खोजें

Grok Bot अब X से जुड़ा, GitHub ने Issues के लिए पाँच नई सुविधाएँ घोषित कीं, एक MacBook पर प्रशिक्षित post-transformer मॉडल 10 मिलियन tokens पढ़ता है

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Grok Bot अब X से जुड़ा, GitHub ने Issues के लिए पाँच नई सुविधाएँ घोषित कीं, एक MacBook पर प्रशिक्षित post-transformer मॉडल 10 मिलियन tokens पढ़ता है

ai-powered-markdown-translator

लेख का fr से hi में अनुवाद gpt-5.6-sol के साथ किया गया।

GitHub पर प्रोजेक्ट देखें ↗

सप्ताहांत 29 और 30 अगस्त के दौरान पाँच क्षेत्रों में केवल बारह घोषणाएँ हुईं—जबकि एक दिन पहले बाईस और 28 तारीख को बयालीस हुई थीं। इसके पीछे दो संयुक्त कारण हैं और किसी को भी छिपाया नहीं जाना चाहिए। 29 तारीख शनिवार और 30 तारीख रविवार थी: लगभग सभी आधिकारिक blogs ने कुछ भी प्रकाशित नहीं किया। इसके अतिरिक्त, संग्रह के दौरान X ठप हो गया और profile feeds उपलब्ध कराने वाला interface प्रत्युत्तर देना बंद कर गया; निगरानी में रखे गए तेईस खाते—image और video generation से जुड़े खाते तथा development tools वाले खाते—अप्राप्य रहे। इसलिए केवल tweet के माध्यम से प्रसारित कोई घोषणा scan से छूट सकती है।

फिर भी, यह दिन दो अलग-अलग पहलुओं वाला रहा। उत्पादों की ओर, xAI ने Grok Bot को X नेटवर्क से जोड़ा और GitHub ने Issues के पाँच सुधारों का विवरण दिया। शोध की ओर, सारी सामग्री Hugging Face blog और व्यक्तिगत योगदानकर्ताओं से आई: एक linear probe जिसे एक vision model से प्रतिद्वंद्वी के model पर ले जाया जा सकता है, केवल एक MacBook पर पूर्व-प्रशिक्षित post-transformer model, एक Leech lattice जो Qwen3-4B को 2.60 GB VRAM में समाहित करता है, और generation के दौरान किसी agent को रोकने की विधि। ये शोध-कार्य हैं, उत्पाद-विमोचन नहीं।


Grok Bot अब X से जुड़ा

29 अगस्त — xAI ने अपने समाचार feed पर अपने autonomous agents उत्पाद Grok Bot का update प्रकाशित किया: अब यह उत्पाद X के साथ अधिक गहराई से एकीकृत है।

इसकी कार्यप्रणाली केवल account connection पर आधारित है। उपयोगकर्ता Grok Bot से अपना X account जोड़ता है और यदि उसके पास developer account नहीं है, तो xAI उसे अपने-आप बना देता है—network तक programmatic access के लिए यह चरण आवश्यक है। Grok Bot के सशुल्क ग्राहकों को आरंभ करने के लिए निःशुल्क X API credits भी मिलते हैं, हालाँकि xAI ने उनकी मात्रा या वैधता अवधि स्पष्ट नहीं की है।

connector सक्रिय हो जाने पर कोई Bot posts खोज सकता है, अपने स्वामी का news feed पढ़ सकता है, उसके mentions देख सकता है और network पर चल रही गतिविधियों का सारांश तैयार कर सकता है। इसे आरंभ करने के लिए केवल Grok Bot खोलकर X connector का उपयोग करना होता है।

xAI ने स्पष्ट रूप से इसे integration का पहला version बताया है और कहा है कि वह X पर Grok Bot के काम को और सरल बनाता रहेगा।

🔗 Grok Bot अब X के साथ काम करता है


GitHub Issues: पाँच नई सुविधाएँ, जिनमें दायरे के प्रति संवेदनशील dependency REST API शामिल है

29 अगस्त — GitHub ने GitHub Issues के पाँच सुधारों का विवरण दिया, जिनकी घोषणा संबंधित changelog entry के बिना सीधे X पर की गई: संदेश स्वयं ही प्राथमिक स्रोत है।

इनमें से चार navigation को अधिक सुविधाजनक बनाते हैं। views को sidebar में pin किया जा सकता है, जिससे हर session में filter दोबारा बनाने की आवश्यकता समाप्त होती है। अब reactions में वहाँ profile avatars दिखाई देते हैं जहाँ पहले केवल संख्या दिखती थी। dashboard density को समायोजित किया जा सकता है, जो बहुत सारी पंक्तियों वाले repositories के लिए उपयोगी है। बंद sub-issues को छिपाया जा सकता है, जिससे कार्य की प्रगति पर नज़र रखने वाली parent issues कम बोझिल होती हैं।

पाँचवाँ बदलाव automation के लिए सबसे संरचनात्मक है: issue dependencies की REST API अब दायरे के प्रति संवेदनशील (scope-aware) हो गई है। issues के बीच dependencies यह बताती हैं कि tasks को किस क्रम में पूरा किया जाना चाहिए; अब दायरे को ध्यान में रखते हुए उनसे query की जा सकती है—यह उन agents और scripts के लिए सीधे उपयोगी है जो repository tracking से कार्ययोजना बनाते हैं। GitHub ने इन पाँच बदलावों की availability व्यवस्था स्पष्ट नहीं की।

घोषित नई सुविधाबदलाव का दायरा
sidebar में views को pin करनाIssues navigation
reactions पर profile avatarsreactions का प्रदर्शन
समायोज्य dashboard densitydashboard
बंद sub-issues को छिपानाparent issues और sub-issues
दायरे के प्रति संवेदनशील dependency REST APIREST API, issues के बीच dependencies

🔗 @github का संदेश


केवल एक MacBook पर पूर्व-प्रशिक्षित post-transformer मॉडल Gala स्थिर गति से 10 मिलियन tokens पढ़ता है

29 अगस्त — छोटे language models के एक परिवार, जिसका कार्यकारी नाम Gala है, को केवल एक MacBook—M3 Max, 40-core GPU और 128 GB unified memory—पर शून्य से शुद्ध MLX में पाँच दिनों तक पूर्व-प्रशिक्षित किया गया।

यह प्रयोग दृष्टिकोण को उलटने से आरंभ होता है। Transformer ऐसे hardware के लिए बनाया गया है जहाँ dense matrix products प्रचुर मात्रा में और high-bandwidth memory दुर्लभ होती है; Mac इसके विपरीत मशीन है। इसलिए चुना गया architecture parameters और state को संचित करता है तथा प्रति token FLOPs को सीमित रखता है।

अंतिम परीक्षण में laptop पर batch size 1 के साथ वास्तविक FineWeb text के 10.5 मिलियन tokens चलाए गए। कुछ भी नहीं बढ़ता: पूरी अवधि में recurrent state 3.07 MB पर स्थिर रहती है और decoding गति नहीं गिरती। अगले 2,000 tokens पर loss भी नहीं बढ़ता। उन्हीं data पर प्रशिक्षित संदर्भ Transformer 32k context से ही 134 tokens/s पर decode करता है और दस लाख tokens पर उसे लगभग 33 GB KV cache की आवश्यकता होती।

प्राप्त contextdecoding गतिअगले 2,000 tokens पर lossrecurrent state
32 768382,3 tokens/s3,6303,07 MB
1 048 576388,1 tokens/s3,5343,07 MB
5 242 880386,2 tokens/s3,5903,07 MB
10 485 760385,8 tokens/s3,2963,07 MB

ingestion लगभग 28,000 tokens/s की दर से linear रहती है, यानी दस मिलियन tokens के लिए करीब छह मिनट। model को उसके execution logs के साथ प्रकाशित किया गया है और लेख में एक section उन कार्यों के लिए आरक्षित है जिन्हें वह नहीं कर सकता।

A post-transformer language model, pretrained from scratch on one MacBook in pure MLX, that reads 10M tokens of context at constant speed. Five days, every number measured, everything released.

🇮🇳 एक post-transformer language model, जिसे केवल एक MacBook पर शुद्ध MLX में शून्य से पूर्व-प्रशिक्षित किया गया है और जो स्थिर गति से 10 मिलियन context tokens पढ़ता है। पाँच दिन, हर आँकड़ा मापा गया, सब कुछ प्रकाशित है।Hugging Face blog पर Arjun Reddy

🔗 Hugging Face पर लेख


CUDA kernel में Leech lattice ने Qwen3-4B को 2.60 GB VRAM में समाहित किया

29 अगस्त — प्रति weight bits की संख्या ही वह साधन है जो किसी model को चला सकने वाली machine की श्रेणी बदलता है: 2 bits पर 70 billion parameters वाला model 140 GB से घटकर लगभग 18 GB रह जाता है और 24 GB card पर चल सकता है। लेकिन गुणवत्ता भी बरकरार रहनी चाहिए, और compression के इस स्तर पर रिपोर्ट की गई सर्वोत्तम गुणवत्ता Qualcomm AI Research के Leech lattice पर 24-element block vector quantization से मिलती है।

बाधा software की थी। सरलता के लिए इस paper के साथ प्रकाशित CUDA kernel lattice की केवल एक layer को decode करता है और प्रतिस्पर्धी विधियों से धीमा रहता है। लेकिन 2 bits पर वास्तव में आवश्यक dictionary layers का union है: 301 equivalence classes और 47-bit index, जो 1.1 × 10¹⁴ points में से किसी एक को निर्दिष्ट करता है। लेखक को इस index के लिए कहीं कोई decoder नहीं मिला।

इसलिए उसने स्वयं इसे लिखा। परियोजना का गणितीय केंद्र—lattice, सटीक nearest-neighbor search, 48-bit bijective indexing और spherical GPTQ—बिना किसी external dependency के Rust में समाहित है और उसके साथ वह अनुपलब्ध fused CUDA decoder भी है।

मापा गया तत्वदर्ज मान
quantized modelQwen3-4B
VRAM footprint2,60 GB
generation throughput87 tokens/s
2 bits पर equivalence classes301
index का आकार47 bits, 1,1 × 10¹⁴ points में से
2 bits पर 70 billion वाला model140 GB से लगभग 18 GB

quantized model greedy decoding में dense model जैसे ही tokens उत्पन्न करता है, केवल बराबरी की स्थिति में निर्णय का मामूली अंतर है। लेखक ने स्वयं दो सीमाएँ बताई हैं: उसका decoder अब भी प्रतिस्पर्धी QTIP kernel से धीमा है, जो 2.40 गुना कम bytes पढ़ता है और 2.27 गुना तेज चलता है; और preprint स्वयं जमा किया गया है तथा peer review नहीं हुआ है। code और data सार्वजनिक हैं।

🔗 Hugging Face पर लेख


एक vision model पर प्रशिक्षित linear probe को प्रतिद्वंद्वी के model पर पढ़ा जा सकता है

30 अगस्त — चार अलग-अलग कंपनियों के चार multimodal models समान images को encode करते हैं। सभी frozen हैं, किसी को fine-tune नहीं किया गया है और उनकी hidden states की width भी समान नहीं है: 5,376, 5,120, 2,560 और 2,048 dimensions। सिद्धांततः एक पर सीखे गए probe को दूसरे पर काम नहीं करना चाहिए। फिर भी वह काम करता है।

protocol अत्यंत सरल है। एक linear probe—केवल एक weight matrix—किसी model की states से image labels का अनुमान लगाना सीखता है, फिर किसी अन्य model की states पर बिना दोबारा प्रशिक्षण के पढ़ा जाता है; दोनों spaces के बीच bridge के रूप में केवल training rows पर ridge regression से अनुमानित mapping लगाई जाती है।

मूल्यांकित क्षेत्रnative AUROCस्थानांतरित AUROCस्थानांतरण लागत
satellite imaging, 17 classes में भूमि उपयोग0,95070,94840,0024
ChestX-ray14 radiographs, 4 में से 3 models0,74400,7511ऋणात्मक

छाती की radiography पर—आधिकारिक test list में ऐसे patients की 25,596 images हैं जिन्हें training के दौरान कभी नहीं देखा गया—स्थानांतरित score native score से अधिक है और छह cross-directions में से चार target model के अपने probe से बेहतर प्रदर्शन करते हैं। मापन की कठोरता बताती है कि परिणाम को गंभीरता से क्यों लिया जाना चाहिए: correction से पहले असंबंधित elements के बीच raw cosine 0.998 तक पहुँचता है, centering चारों providers को 0.005 या उससे कम पर ले आता है, और हर दावे के साथ उसका chance floor प्रकाशित है—satellite test set पर shuffled labels से 0.5014।

🔗 Hugging Face पर लेख


Together AI ने hallucination दर में GLM-5.3 को दो closed models से आगे रखा, लेकिन benchmark का नाम नहीं बताया

30 अगस्त — Together AI ने GLM-5.3 की कम hallucination दर को model का कम आँका गया पहलू बताया और उसकी तुलना दो प्रमुख closed models से की।

तुलना किया गया modelGLM-5.3 के सापेक्ष hallucination दर
GLM-5.3संदर्भ
Claude Fable 52 गुना से अधिक
GPT-5.6 Luna3 गुना से अधिक

इस मापन को उसके वास्तविक स्वरूप में समझना चाहिए। Together AI GLM-5.3 को host करता है और उसकी inference बेचता है: यह स्रोत निष्पक्ष नहीं है। संदेश में न उपयोग किए गए benchmark का उल्लेख है, न absolute values का, न hallucinations गिनने की विधि का—केवल ratios दिए गए हैं। post के साथ एक छोटा video है, लेकिन प्रकाशित text में कोई raw figure नहीं है। इसलिए इसे relative ranking के रूप में देखा जाना चाहिए, स्वतंत्र evaluation के रूप में नहीं।

फिर भी यह दृष्टिकोण उल्लेखनीय है, क्योंकि यह पिछले दिनों बनी तस्वीर को पूरा करता है: 29 तारीख को प्रकाशित DeepSWE comparisons ने coding क्षमता और लागत मापी थी, production में factual reliability नहीं।

an underrated part of glm-5.3 is its low hallucination rate

claude fable 5 is over 2x higher, while gpt-5.6 luna is over 3x higher

🇮🇳 glm-5.3 का एक कम आँका गया पहलू इसकी कम hallucination दर है। claude fable 5 की दर 2 गुना से अधिक है, जबकि gpt-5.6 luna की दर 3 गुना से अधिक है।X पर @togethercompute

🔗 @togethercompute का संदेश


संक्षिप्त समाचार

  • Reflexive Role Routing, generation के दौरान किसी agent को रोकने की विधि — single linear layer वाला probe generation के दौरान दो values पढ़ता है—prompt के target और वर्तमान trajectory के बीच drift तथा output के review में सफल रहने की अनुमानित probability—जिनका उपयोग frozen controller यह तय करने के लिए करता है कि प्रक्रिया रोकी जाए या नहीं। पहले से उत्पन्न context को नष्ट होने से बचाने के लिए प्रक्रिया को semi-Markov decision के रूप में formalize किया गया है। preprint DOI 10.5281/zenodo.22171581 के अंतर्गत जमा किया गया। 🔗 Hugging Face पर लेख
  • frontier model द्वारा बनाया गया एक बार उपयोग होने वाला risk evaluation — एक ही prompt किसी शक्तिशाली model से नया benchmark बनवाता है, जिसकी scoring rubric conversation में private रहती है; मूल्यांकित models test पूरा करते हैं, उनके responses grading के लिए उसी conversation में लौटते हैं और फिर benchmark त्याग दिया जाता है—लेखक इसे contamination का समाधान नहीं मानता, केवल उन्हीं सार्वजनिक questions पर निर्भरता कम करने का तरीका मानता है। इसकी मुख्य रुचि results पर थोपी गई इच्छा (willingness), क्षमता (capability) और सहूलियत (enablement) के बीच distinction में है। 🔗 Hugging Face पर लेख
  • CUDA का default failure mode मौन है — GPU programming के पहले सप्ताह की learning note, जिसे सबसे सरल संभव program—एक हजार numbers वाली दो lists को जोड़ने—के आधार पर लिखा गया है। लेखक को GPU के काम करने के ढंग ने नहीं, बल्कि उसके विफल होने की खामोशी ने प्रभावित किया। कोई घोषणा या model release नहीं। 🔗 Hugging Face पर लेख
  • GitHub ने Dependabot updates के grouping को फिर प्रमुखता दी — Microsoft के project GCToolkit में लगभग हर छह commits में से एक केवल किसी dependency का version बढ़ाता था; dependabot.yml file में तीन बदलावों ने updates को group करके और उनकी cadence धीमी करके शोर कम कर दिया, जबकि security fixes में देरी नहीं हुई। संबंधित लेख 29 जुलाई 2026 का है: केवल उसका sharing 30 अगस्त को हुआ। 🔗 @github का संदेश
  • WebMCP Challenge: 3 सितंबर की समय-सीमा और 31 अगस्त को प्रश्नोत्तर session — OpenAI Developers ने याद दिलाया कि WebMCP hackathon projects को 3 सितंबर तक submit किया जा सकता है और उसी thread में सोमवार, 31 अगस्त को 11 am PT पर Discord पर प्रतियोगिता के partners Chrome, Cloudflare, Shopify, Vercel, Render और Netlify के साथ प्रश्नोत्तर session (office hours) की घोषणा की। hackathon स्वयं 25 अगस्त को प्रस्तुत किया गया था। 🔗 @OpenAIDevs का संदेश
  • Cohere ने बिना किसी संबंधित घोषणा के Waterloo की तीन photos प्रकाशित कीं — आधिकारिक account ने बिना launch, आँकड़े या link के कंपनी की Canadian positioning को आगे बढ़ाया। कोई तथ्यात्मक सामग्री नहीं: समयावधि की पूर्णता के लिए इसका उल्लेख किया गया है। 🔗 @cohere का संदेश

इसका क्या अर्थ है

उपभोक्ता हार्डवेयर फिर से एक डिज़ाइन बाधा बन रहा है, न कि केवल झेलने की सीमा। सप्ताहांत के दो शोधकार्य एक ही आधार से शुरू होते हैं: उपलब्ध मशीन वास्तुकला को निर्धारित करती है, न कि इसका उलटा। Gala को Mac के लिए बनाया गया है—प्रचुर memory, दुर्लभ FLOPs—इसलिए यह प्रति token गणना के बजाय parameters और state संचित करता है; परिणामस्वरूप decoding की गति 32,768 से 10.5 मिलियन context tokens तक धीमी नहीं होती। Leech lattice quantization शृंखला के दूसरे छोर को लक्ष्य बनाता है: 70 अरब parameters वाले model को 140 GB से घटाकर लगभग 18 GB करना, यानी उसे ऐसे card में समाना जो आम लोगों के पास होता है। दोनों में से कोई भी frontier model से प्रतिस्पर्धा करने का दावा नहीं करता, और मुद्दा वह है भी नहीं: दोनों प्रश्न को model के आकार से हटाकर उसे host कर सकने वाली machine की श्रेणी पर ले जाते हैं।

एक model पर प्रशिक्षित probe को दूसरे model पर पढ़ा जा सकता है। आज का सबसे आश्चर्यजनक परिणाम सबसे शांत भी है। यदि चार कंपनियों के चार frozen models images को इतने समान ढंग से encode करते हैं कि एक ही weight matrix को 0.0024 AUROC की लागत पर—बल्कि कभी-कभी ऋणात्मक लागत पर—एक से दूसरे में स्थानांतरित किया जा सके, तो इन representations के ऊपर बनाए गए tools उस provider के बंधक नहीं रह जाते जिस पर उन्हें calibrate किया गया था। शोधपत्र स्वयं यह व्यावहारिक निष्कर्ष निकालता है, लेकिन तुरंत उस सीमा को भी सामने रखता है जो इसे अभी से एक method बनने से रोकती है: transport mappings को प्रत्येक जोड़ी के लिए अलग-अलग fit किया गया है, और ऐसा कोई प्रमाण नहीं है कि उनमें से कोई एक उस model पर भी काम करेगा जिसे इस fitting से अलग रखा गया हो। मापन का अनुशासन कहीं ढीला नहीं पड़ता: हर तुलना से पहले anisotropy को सुधारा गया है और प्रत्येक score के साथ random baseline प्रकाशित किया गया है।

विश्वसनीयता के दावे मापन-पद्धति के बिना आ रहे हैं। Together AI hallucination rate में GLM-5.3 को दो closed models से आगे रखता है, लेकिन किसी benchmark का नाम नहीं देता, कोई absolute value प्रकाशित नहीं करता और अपनी counting method का वर्णन नहीं करता—जबकि वह उसी model की inference सेवा बेच रहा है जिसे उसने पहले स्थान पर रखा है। उसी सप्ताहांत के research posts के साथ इसका अंतर स्पष्ट है: वे अपने results के साथ random baselines प्रकाशित करते और अपने protocols का विस्तार से वर्णन करते हैं। संदर्भ-मानक के बिना report कोई measurement नहीं, बल्कि commercial argument है, और उसे उसी रूप में वर्गीकृत किया जाना चाहिए।

Product के स्तर पर सप्ताहांत में केवल plumbing आई—और agents का असली खेल यहीं तय होता है। xAI कोई model जारी नहीं करता: वह Grok Bot को X से जोड़ता है, user की ओर से developer account बनाता है और शुरुआती बाधा हटाने के लिए API credits वितरित करता है। GitHub किसी चमत्कारिक feature की घोषणा नहीं करता: वह issues की dependencies वाली अपनी REST API को scope-aware बनाता है। दोनों मामलों में model की क्षमता नहीं, बल्कि access rights और query की जा सकने वाली surface बदलती है। social network या ticket tracker पढ़ने वाले agents बनाने वालों के लिए यही सबसे कम दिखाई देने वाला और सबसे निर्णायक काम है।


स्रोत