जब एआई सिर्फ प्राथमिक स्तर का पाठ पढ़ता है: लिटिललर्नर प्रयोग

क्या होता है जब 88-अरब-टोकन वाला एआई मॉडल विशेष रूप से पाँचवीं कक्षा की पाठ्यपुस्तकों से सीखता है? लिटिललर्नर प्रयोग मशीन लर्निंग के बारे में छुपे हुए सत्यों को उजागर करता है।

DailyForageDailyForage
5 मिनट पठनTechnologyLittleLearner AIFineWeb-Edu
16
जब एआई सिर्फ प्राथमिक स्तर का पाठ पढ़ता है: लिटिललर्नर प्रयोग
मुख्य बातें
  • 1आधुनिक भाषा मॉडल पेटाबाइट असंरचित पाठ (unstructured text) से खुद को पोषित करते हैं, जिससे यह पता लगाना लगभग असंभव हो जाता है कि कोई विशिष्ट क्षमता वास्तव में कहाँ से उत्पन्न हुई।
  • 2बच्चों के साहित्य और बुनियादी गणित की कार्यपत्रिकाओं (worksheets) पर शुरू से किसी मॉडल को प्रशिक्षित करना तब तक अजीब लग सकता है जब तक आप इसकी वास्तुकला को नहीं देखते।
  • 3तकनीकी दिग्गज पैमाने (scale) के पीछे भागना पसंद करते हैं, यह मानते हुए कि अधिक पैरामीटर और गंदे वेब स्क्रैप हमेशा बेहतर प्रदर्शन के बराबर होते हैं।
  • 4इस परियोजना के दायरे को समझने के लिए, इन मैट्रिक्स पर विचार करें:

एक ऐसे आर्टिफिशियल इंटेलिजेंस मॉडल की कल्पना करें जिसने कभी रेडिट, विकिपीडिया, या क्वांटम भौतिकी पर किसी अकादमिक शोध पत्र का सामना नहीं किया है। इसके बजाय, इसका पूरा विश्वदृष्टिकोण FineWeb-Edu फ़िल्टर से आता है जो विशेष रूप से अमेरिकी प्राथमिक स्कूल पाठ्यक्रम के इर्द-गिर्द कॉन्फ़िगर किए गए हैं। शोधकर्ताओं ने LittleLearner का निर्माण किया है, जो एक 88-अरब-टोकन (88-billion-token) का सैंडबॉक्स है जिसे तकनीक में एक जिद्दी सवाल का जवाब देने के लिए डिज़ाइन किया गया है: तब क्या होता है जब कोई मॉडल व्यापक वेब के अराजक शोर पर निर्भर नहीं रह सकता?

एक साथ सब कुछ करने की समस्या

आधुनिक भाषा मॉडल पेटाबाइट असंरचित पाठ (unstructured text) से खुद को पोषित करते हैं, जिससे यह पता लगाना लगभग असंभव हो जाता है कि कोई विशिष्ट क्षमता वास्तव में कहाँ से उत्पन्न हुई। क्या सिस्टम ने वास्तव में तर्क (reasoning) सीखा, या उसने सिर्फ किसी फोरम पोस्ट से एक चतुर संकेत (prompt) को याद कर लिया?

प्रशिक्षण वितरण को प्राथमिक पठन स्तरों के लिए फ़िल्टर किए गए 88 अरब टोकन तक सीमित करके, कंप्यूटर वैज्ञानिकों ने एक प्राचीन प्रयोगशाला वातावरण बनाया। आलोचकों अक्सर यह मान लेते हैं कि सरल इनपुट केवल सरल आउटपुट की ओर ले जाते हैं। फिर भी यह नियंत्रित सेटअप कॉर्पोरेट प्रेस विज्ञप्तियों और जहरीले टिप्पणी अनुभागों (toxic comment sections) को हटा देता है, जिससे हमें यह देखने के लिए मजबूर होना पड़ता है कि बुनियादी भाषाई निर्माण खंड कृत्रिम दिमाग को कैसे आकार देते हैं।

"हम मॉडल को एक साथ सब कुछ सिखाने में अरबों खर्च करते हैं, फिर जब वे अराजकता उत्पन्न करते हैं तो हैरान होने का नाटक करते हैं। क्या होगा यदि एक सरल खुराक एक बेहतर आधार तैयार करे?"

नौ साल के बच्चे की कक्षा के अंदर

बच्चों के साहित्य और बुनियादी गणित की कार्यपत्रिकाओं (worksheets) पर शुरू से किसी मॉडल को प्रशिक्षित करना तब तक अजीब लग सकता है जब तक आप इसकी वास्तुकला को नहीं देखते। होस्ट किया गया 5-गीगाबाइट मॉडल ब्राउज़र सैंडबॉक्स में लाइव संचालित होता है, जिससे इंजीनियरों को वास्तविक समय में इसके उभरते व्यवहारों की जाँच करने की अनुमति मिलती है।

बच्चे संरचित पुनरावृत्ति (structured repetition), स्पष्ट परिभाषाओं और सावधानीपूर्वक तैयार किए गए व्याकरण नियमों के माध्यम से भाषा में महारत हासिल करते हैं। उस अध्यापन शास्त्र (pedagogy) को एक न्यूरल नेटवर्क में अनुवादित करने से पता चलता है कि शब्दावली का आकार सिमेंटिक स्पष्टता और कथा सुसंगतता (narrative coherence) की तुलना में बहुत कम मायने रखता है।

📌 मुख्य बिंदु: प्रशिक्षण डेटा को प्राथमिक पाठ्यक्रम तक सीमित करने से यह उजागर होता है कि क्या उन्नत तर्क के लिए जटिल इंटरनेट डेटा की आवश्यकता होती है या केवल साफ-सुथरे, संरचित बुनियादी सिद्धांतों की।

प्रयोग वास्तव में हमें क्या सिखाता है

तकनीकी दिग्गज पैमाने (scale) के पीछे भागना पसंद करते हैं, यह मानते हुए कि अधिक पैरामीटर और गंदे वेब स्क्रैप हमेशा बेहतर प्रदर्शन के बराबर होते हैं। यह प्रोजेक्ट नियंत्रित वितरण के पुख्ता सबूतों के साथ उस हठधर्मिता के खिलाफ खड़ा है।

यहाँ वह बताया गया है कि LittleLearner फ्रेमवर्क आधुनिक मॉडल विकास के बारे में क्या प्रदर्शित करता है:

  1. फ़िल्टर किए गए कॉर्पोरा बुनियादी भाषा की समझ को कम किए बिना जहरीले कलाकृतियों (toxic artifacts) को समाप्त करते हैं।
  2. प्राथमिक अध्यापन शास्त्र जटिल संबंधीय कार्यों के लिए आश्चर्यजनक रूप से मजबूत सिंटैक्टिक मचान (syntactic scaffolding) प्रदान करता है।
  3. लक्षित सैंडबॉक्स शोधकर्ताओं को यह अलग करने की अनुमति देते हैं कि विशिष्ट कौशल संरचित पाठ से कैसे उभरते हैं।
  4. मिलान नियंत्रण साबित करते हैं कि डेटा गुणवत्ता लगातार कच्चे सूचना आयतन पर विजय प्राप्त करती है।

मुख्य तथ्य

इस परियोजना के दायरे को समझने के लिए, इन मैट्रिक्स पर विचार करें:

  • डेटासेट में 88 अरब टोकन हैं जिन्हें विशेष रूप से FineWeb-Edu से निकाला (distilled) गया है।
  • प्रशिक्षण ब्राउज़र निष्पादन के लिए अनुकूलित एक कस्टम 5B पैरामीटर मॉडल आर्किटेक्चर पर निर्भर करता है।
  • क्यूरेशन पाइपलाइन अमेरिकी प्राथमिक स्कूल पाठ्यक्रम के अनुरूप पाँच-चरण फ़िल्टरिंग प्रक्रिया का उपयोग करती है।
  • मूल्यांकन समान पैमाने के पूरी तरह से अनफ़िल्टर किए गए नियंत्रण मॉडलों के खिलाफ प्रदर्शन की तुलना करते हैं।

निष्कर्ष

हम कृत्रिम बुद्धिमत्ता को चीनी से भरपूर एनर्जी ड्रिंक के डिजिटल समकक्ष को खिलाने के आदी हो चुके हैं, और शोर से ज्ञान के उभरने की उम्मीद करते हैं। शायद मशीन लर्निंग का भविष्य अधिक इंटरनेट अभिलेखागारों को खाने में नहीं, बल्कि प्राथमिक स्कूल की कक्षा के अनुशासित फोकस को फिर से खोजने में निहित है।

FAQ

यह एक नियंत्रित शोध पहल है जिसमें 88-अरब-टोकन कॉर्पस शामिल है जिसे एआई मॉडल ज्ञान कैसे प्राप्त करते हैं, इसका अध्ययन करने के लिए अमेरिकी प्राथमिक स्कूल पाठ्यक्रम के अनुसार कड़ाई से फ़िल्टर किया गया है।

5 मिनट · 891 शब्द

इसे शेयर करें

यह लेख उपयोगी लगा? अपने दोस्तों के साथ शेयर करें।

Rate this article

Discussion

Leave a comment

Loading comments…

आपको यह भी पसंद आएगा

आपके लिए चुनी गई खबरें

Next.js v4 इमेज ऑप्टिमाइजेशन: दिल्ली के डेवलपर्स के लिए AVIF का जाल
Technology

Next.js v4 इमेज ऑप्टिमाइजेशन: दिल्ली के डेवलपर्स के लिए AVIF का जाल

Next.js v4 को अपनाने में जल्दबाजी कर रही स्थानीय दिल्ली इंजीनियरिंग टीमें एक साइलेंट परफॉर्मेंस दीवार से टकरा रही हैं। जानिए क्यों डिफ़ॉल्ट AVIF रेंडरिंग प्रोडक्शन पाइपलाइनों को तोड़ रही है।

DailyForageDailyForage · 5 मिनटपढ़ें

Enjoy this article?

Get fresh stories delivered to your inbox every morning.