LingVo.club
📖+40 XP
🎧+25 XP
+45 XP
बड़े भाषा मॉडल और सरल गुणा में असफलता (स्तर B2) — brown wooden blocks on white surface

बड़े भाषा मॉडल और सरल गुणा में असफलताCEFR B2

29 दिस॰ 2025

स्तर B2 – ऊपरी-मध्य स्तर
6 मिनट
322 शब्द

एक व्यापक अध्ययन में Xiaoyan Bai और Chenhao Tan (University of Chicago) ने MIT, Harvard University, University of Waterloo और Google DeepMind के सहयोगियों के साथ मिलकर यह जांच की कि क्यों अत्याधुनिक बड़े भाषा मॉडल सरल प्राथमिक-स्तर गणनाओं—विशेषकर दो चार-अंकीय संख्याओं का गुणा—में भी असफल रहते हैं। अध्ययन ने मानक फाइन-ट्यूनिंग और Implicit Chain of Thought (ICoT) प्रशिक्षण विधियों की तुलना पर ध्यान केन्द्रित किया, खासकर लंबी-दूरी निर्भरताओं के संदर्भ में जहाँ मॉडल को आंशिक गुणा और चलती राशियाँ बनाए रखना होता है।

परिणाम स्पष्ट थे: मानक फाइन-ट्यूनिंग के तहत दो से 12 परतों वाले मॉडल चार-अंकीय गुणा पर 1% से भी कम सटीकता दिखाते रहे, जबकि ICoT से प्रशिक्षित मॉडल ने 100% सटीकता हासिल की। आंतरिक विश्लेषण से पता चला कि ICoT मॉडल मध्यवर्ती मानों को एन्कोड करते हैं और इनके छिपे हुए राज्यों से चलती राशियाँ डिकोड कर पाते हैं। टीम ने ध्यान के संगठन में परत-विशेष विभाजन देखा: शुरुआती परतें निश्चित स्थानों पर अंक-जुड़ियों के गुणनफल निकालकर संग्रहीत करतीं और बाद की परतें उन मानों को पुनः प्राप्त कर अंतिम उत्तर के प्रत्येक अंक का निर्माण करती थीं।

शोध ने यह भी बताया कि अंक Fourier-जैसे आधारों में प्रस्तुत होते हैं और प्रशिक्षण के दौरान Minkowski योग जैसा एक ज्यामितीय ऑपरेशन स्वाभाविक रूप से उभर आया। व्यवहारिक सुधार के लिये टीम ने एक प्रशिक्षण उद्देश्य जोड़ा जो प्रत्येक चरण पर चलती राशियों को ट्रैक करना सिखाता; इस लक्ष्य ने बिना स्पष्ट चेन-ऑफ-थॉट पर्यवेक्षण के दो-परत वाले मॉडल की सटीकता 99% तक बढ़ा दी। अध्ययन का निष्कर्ष यह है कि केवल डेटा या पैरामीटर बढ़ाने से सीमाएँ नहीं हटतीं; आर्किटेक्चरल मार्गदर्शन और लक्षित प्रशिक्षण उद्देश्य बहु-चरण तर्क सीखने में निर्णायक हो सकते हैं।

"जैसे-जैसे AI महत्वपूर्ण निर्णय-निर्माण में अधिक समाहित होता जा रहा है, इसके सीखने और सोचने के विशिष्ट तरीकों को समझना आवश्यक है," Tan कहते हैं। Source: University of Chicago

कठिन शब्द

  • गणनासंख्याओं या आंकड़ों पर किया गया हिसाब
    गणनाओं
  • फाइन-ट्यूनिंगमौजूदा मॉडल को विशेष काम के लिये बदलना
  • प्रशिक्षणमशीन को नया व्यवहार सिखाने की प्रक्रिया
  • परतमॉडल के भीतर अलग-अलग स्तर या तह
    परतों
  • मध्यवर्तीबीच के स्तर या मध्य में होने वाला
  • चलती राशिगणना के बीच के अस्थायी संख्यात्मक मान
    चलती राशियाँ
  • सटीकताउत्तर या परिणाम की शुद्धता की मात्रा
  • आर्किटेक्चरल मार्गदर्शनडिजाइन या संरचना के आधार पर निर्देश देना

युक्ति: जब आप किसी भी भाषा में कहानी पढ़ें या ऑडियो सुनें, तो लेख में हाइलाइट किए गए शब्दों पर होवर/फ़ोकस/टैप करें और तुरंत छोटी-सी परिभाषा देखें।

चर्चा के प्रश्न

  • अध्ययन में बताया गया है कि आर्किटेक्चरल मार्गदर्शन और लक्षित प्रशिक्षण महत्वपूर्ण हैं। आप कैसे सोचते हैं कि ये उपाय वास्तविक दुनिया के AI सिस्टम की भरोसेमंदता बढ़ा सकते हैं? उदाहरण दें।
  • क्या मॉडल के मध्यवर्ती मानों (चलती राशियों) को समझना और ट्रैक करना रोज़मर्रा के अनुप्रयोगों में उपयोगी होगा? किन स्थितियों में यह जरूरी हो सकता है?
  • डेटा या पैरामीटर बढ़ाने की बजाय लक्षित प्रशिक्षण उद्देश्य चुनने के क्या फायदे और सीमाएँ हो सकती हैं? अपने विचार संक्षेप में बताइए।

संबंधित लेख

सस्ते रंग-सूचक वाइप्स से घर में सीसा जांच संभव (स्तर B2)
26 जन॰ 2026

सस्ते रंग-सूचक वाइप्स से घर में सीसा जांच संभव

नए अध्ययन ने परिवार तुरंत इस्तेमाल कर सकने वाले सस्ते रंग-सूचक वाइप्स की पुष्टि की। शोध में बोस्टन के कुछ घरों और वाहनों से नमूने लेकर वाइप्स के परिणाम प्रयोगशाला परीक्षणों के समान पाए गए।

एडिस अबाबा में सोशल-मीडिया दान और विवाद (स्तर B2)
12 नव॰ 2025

एडिस अबाबा में सोशल-मीडिया दान और विवाद

एडिस अबाबा से शुरू हुए TikTok दान अभियान वायरल हुए और लोगों ने पैसे भेजे। तम्रू नाम के व्यक्ति ने कहा कि वादे पूरे नहीं हुए और कुछ रकम उसके खाते से चली गई। जांच में गुमनामी और प्लेटफॉर्म नियमों के सवाल उठे।

ऐसे धातु ट्यूब जो पानी में नहीं डूबते (स्तर B2)
4 फ़र॰ 2026

ऐसे धातु ट्यूब जो पानी में नहीं डूबते

यूनिवर्सिटी ऑफ रोचेस्टर के शोधकर्ताओं ने ऐसी एल्यूमिनियम ट्यूब बनाई हैं जिनकी अंदरूनी सतह हवा रोकती है और वे पानी में डूबती नहीं। यह डिजाइन जहाज, फ्लोटिंग प्लेटफॉर्म और ऊर्जा उपकरणों पर असर डाल सकता है।

डेटा सेंटर और बिजली की बढ़ती मांग: 2030 के लिए चेतावनी (स्तर B2)
18 मई 2026

डेटा सेंटर और बिजली की बढ़ती मांग: 2030 के लिए चेतावनी

नए अध्ययन में कहा गया है कि डेटा सेंटरों और क्रिप्टोकरेन्सी खनन से बढ़ती बिजली मांग 2030 तक अमेरिका में बिजली की कीमतें और CO2 उत्सर्जन बढ़ा सकती है। मॉडल ने 26 क्षेत्रों में घंटा-दर-घंटा विश्लेषण किया।

MRI और AI से मस्तिष्क के तरल प्रवाह नापे गए (स्तर B2)
31 मई 2026

MRI और AI से मस्तिष्क के तरल प्रवाह नापे गए

शोधकर्ताओं ने MRI और आर्टिफिशल इंटेलिजेंस से मस्तिष्क में धीरे-धीरे बहने वाले तरल प्रवाह मापे। यह प्रवाह glymphatic प्रणाली से जुड़ा है और अल्ज़ाइमर से संबंध रखता है।