खोजें

GPT-6 Astra आम जनता के लिए उपलब्ध, Claude ने फ़र्मा के अंतिम प्रमेय को औपचारिक रूप दिया, GitHub ने HydraFusion के साथ कई मॉडलों का संयोजन किया

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
GPT-6 Astra आम जनता के लिए उपलब्ध, Claude ने फ़र्मा के अंतिम प्रमेय को औपचारिक रूप दिया, GitHub ने HydraFusion के साथ कई मॉडलों का संयोजन किया

ai-powered-markdown-translator

लेख का fr से hi में अनुवाद gpt-5.6-sol के साथ किया गया।

GitHub पर प्रोजेक्ट देखें ↗

लॉन्च के चौबीस घंटे बाद GPT-6 Astra सीमित परिनियोजन से बाहर आ गया है: मॉडल अब Pro, Enterprise और Business Premium योजनाओं के लिए सुलभ है, GitHub Copilot में सामान्य उपलब्धता के तहत शामिल हो गया है और दस्तावेज़-आधारित शोध के लिए Perplexity के परीक्षण में अब तक का सर्वोच्च स्कोर हासिल कर चुका है। दूसरी ओर, Anthropic ने कंप्यूटर द्वारा सत्यापित फ़र्मा के अंतिम प्रमेय का पहला प्रमाण प्रकाशित किया है, जिसे Claude ने ग्यारह दिनों में लिखा। GitHub ने HydraFusion उपलब्ध कराया है, जो प्रत्येक कार्य के लिए स्वयं मॉडल और कार्यप्रवाह चुनता है, Google ने Gemini एप्लिकेशन में Lyria 3.5 जारी किया है, और SpaceXAI ने कंपनियों के लिए Grok Bot उपलब्ध कराते हुए ऐसे खरीद एजेंट का विवरण प्रकाशित किया है जिसने अपने ही नियोक्ता के लिए 100,000 डॉलर से अधिक की बचत खोजी।


GPT-6 Astra सीमित परिनियोजन से बाहर आया और Copilot में सामान्य रूप से उपलब्ध हुआ

4 सितंबर — OpenAI ने पेरिस समयानुसार रात 10 बजकर 13 मिनट पर घोषणा की कि GPT-6 Astra अब सीमित परिनियोजन में नहीं है। मॉडल ChatGPT Work और Codex में सभी Pro, Enterprise तथा Business Premium उपयोगकर्ताओं के लिए सुलभ है और अब API में भी बिना किसी प्रतिबंध के उपलब्ध है, जबकि 3 सितंबर की घोषणा में इसकी उपलब्धता अभी क्रमिक परिनियोजन पर निर्भर थी। उसी संदेश में स्पष्ट किया गया कि Plus सदस्यों और Business उपयोगकर्ताओं को कुछ और दिन प्रतीक्षा करनी होगी।

संबंधित माध्यम4 सितंबर को पहुँच
OpenAI APIबिना प्रतिबंध उपलब्ध
ChatGPT Work और Codex, Proउपलब्ध
Enterprise और Business Premiumउपलब्ध
Plus और अन्य Businessकुछ दिनों की देरी

🔗 X पर OpenAI की घोषणा

GitHub Copilot में सामान्य उपलब्धता, पहले दिन से सार्वजनिक दर पर

उसी दिन GPT-6 Astra GitHub Copilot में सामान्य रूप से उपलब्ध हो गया। GitHub ने मॉडल के स्कोर के बजाय उसकी कार्यपद्धति पर ज़ोर दिया है: उसके आंतरिक परीक्षणों में Astra निष्पादन के दौरान योजना बनाता और सत्यापन करता है, निदान को सत्यापन के साथ जोड़ता है और किसी कार्य को पूर्ण घोषित करने से पहले अपने परिणामों की स्वयं पुष्टि करता है। इससे वह पिछले OpenAI मॉडलों की तुलना में कम चरणों के साथ लंबे कार्यों पर बेहतर प्रदर्शन करता है। घोषणा के साथ कोई बेंचमार्क आँकड़ा नहीं दिया गया।

यह मॉडल Visual Studio Code से लेकर JetBrains IDE, Copilot CLI, GitHub Mobile, Xcode और Eclipse सहित दस माध्यमों पर दिखाई देता है, लेकिन केवल Pro+, Max, Business और Enterprise योजनाओं के लिए उपलब्ध है। Copilot Pro को इसमें शामिल नहीं किया गया है। बिलिंग का पहलू ध्यान देने योग्य है: उपयोग के अनुसार भुगतान में Astra पर प्रदाता की सार्वजनिक दर पहले दिन से लागू होती है और कोई प्रचार अवधि नहीं है, जबकि एक दिन पहले आए Gemini 3.8 Flash को 31 दिसंबर 2026 तक प्रारंभिक मूल्य निर्धारण का लाभ मिलता है।

🔗 GitHub बदलाव-सूची

Perplexity ने इसे WANDR पर अपना सर्वोच्च स्कोर दिया

Perplexity ने 3 सितंबर को रात 11 बजकर 10 मिनट पर बड़े पैमाने के दस्तावेज़-आधारित शोध के अपने आंतरिक परीक्षण WANDR पर Astra का परिणाम प्रकाशित किया। मॉडल को प्रति कार्य 11.98 डॉलर की लागत पर 0.682 अंक मिले, जो कंपनी द्वारा जाँचे गए सभी मॉडलों में सर्वोच्च स्कोर है।

मूल्यांकित मॉडलWANDR स्कोरप्रति कार्य लागतमाप प्रकाशित होने की तिथि
GPT-6 Astra0.68211.98 डॉलर3 सितंबर 2026
Claude Fable 5.10.60112.76 डॉलर1 सितंबर 2026

Perplexity ने दो सापेक्ष अंतर भी बताए: Claude Fable 5.1 की तुलना में 6.1 प्रतिशत कम लागत पर 13.5 प्रतिशत अधिक स्कोर और Opus 5 की तुलना में 3.3 प्रतिशत अधिक लागत पर 27.0 प्रतिशत अधिक स्कोर। यहाँ दो सावधानियाँ आवश्यक हैं। WANDR एक स्वामित्व वाला परीक्षण है जिसकी विस्तृत कार्यप्रणाली प्रकाशित नहीं की गई है, और Perplexity उन मॉडलों की ग्राहक भी है जिन्हें वह क्रमबद्ध करती है। Opus 5 के लिए कोई निरपेक्ष मान साझा नहीं किया गया।

🔗 X पर Perplexity का माप

Codex CLI के तीन सुधारों ने एकीकरण पूरा किया

कमांड लाइन के स्तर पर, 3 सितंबर की रात जारी संस्करण 0.153.0 के बाद दो दिनों से भी कम समय में तीन सुधार आए, जो सभी Astra को समर्पित थे। संस्करण 0.153.1 डिफ़ॉल्ट मॉडल बदले बिना और उसे चयनकर्ता में दिखाए बिना API के माध्यम से मॉडल को कॉन्फ़िगर करने की सुविधा देता है। संस्करण 0.153.2 ने एक लेबल सुधारा: Fast स्तर को 1.5 गुना नहीं बल्कि 2 गुना गति देने वाला बताया गया है, जबकि अनुरोधों को संसाधित करने का तरीका नहीं बदला। 4 सितंबर को रात 9 बजकर 1 मिनट पर जारी संस्करण 0.153.3 ने Mantle और Runtime मार्गों के लिए Amazon Bedrock मॉडल चयनकर्ता में Astra जोड़ा और असमकालिक स्पष्टीकरण प्रश्नों के लिए मॉडल को दिए जाने वाले निर्देश को सुधारा।

OpenAI ने दिन का समापन तीन अनुभव-विवरणों से किया: डेवलपर ब्लॉग पर दो लेख, जिनमें से एक Codex में बनाए गए प्रक्रियात्मक अंतरिक्ष-अन्वेषण गेम पर और दूसरा Blender तथा Unreal Engine 5 में खोजे जा सकने वाले घर की रचना पर था, साथ ही Dominik Kundel का एक लेख जिसमें Codex के उपयोग की उनकी पद्धति में आए पाँच बदलाव बताए गए।

🔗 Codex CLI 0.153.3 के रिलीज़ नोट्स · 🔗 Astra के साथ गेम बनाना


Claude ने फ़र्मा के अंतिम प्रमेय का पहला औपचारिक प्रमाण प्रस्तुत किया

4 सितंबर — Anthropic ने कंप्यूटर द्वारा पूरी तरह सत्यापित फ़र्मा के अंतिम प्रमेय का पहला प्रमाण प्रकाशित किया। Claude ने इसे Lean में लिखने के लिए ग्यारह दिन तक, अधिकांशतः स्वायत्त रूप से, काम किया। कंपनी इसे अब तक बनाया गया सबसे बड़ा Lean प्रमाण बताती है।

मापी गई कसौटीदर्ज मान
Claude के कार्य की अवधि11 दिन
लिखी गई Lean पंक्तियाँ13 मिलियन
सिद्ध किए गए मध्यवर्ती प्रमेय29,500
Wiles द्वारा पहला मानवीय प्रमाण1995, 129 पृष्ठ
अनुमान और उसके प्रमाण के बीच अंतराल350 वर्ष से अधिक

प्रमेय कहता है कि दो से अधिक घातांक के लिए कोई भी धनात्मक पूर्णांक त्रिक फ़र्मा के समीकरण को संतुष्ट नहीं करता। Pierre de Fermat ने लगभग 1637 में इसे Diophantus की Arithmetica की अपनी प्रति के हाशिये पर लिख दिया था। पहला सही प्रमाण 1995 में Sir Andrew Wiles ने दिया: 129 पृष्ठ, कई महीनों का मानवीय सत्यापन, और 1993 में प्रस्तुत पहला संस्करण जिसमें दो महीने बाद एक समीक्षक ने गंभीर त्रुटि उजागर की थी।

आरंभिक प्रयास विफल रहे, क्योंकि एजेंटों को शुरुआत में शीघ्र सफलता मिली, लेकिन बाद में वे दिशा खो बैठे। सफलता Prove2Me से मिली, जो औपचारिकीकरण का एक खुला सहयोगी मंच है और Claude Code पर आधारित बहु-एजेंट ढाँचे के साथ जुड़ा है। यह मंच कथनों का एक निर्देशित अचक्रीय ग्राफ बनाए रखता है, जिसकी सहायता से एजेंट अगला प्रमाण चुनते हैं; Lean संकलन को तेज़ करने के लिए कथनों और प्रमाणों को अलग-अलग फ़ाइलों में रखता है; और खोज तथा पुनः उपयोग संभव बनाने के लिए प्रत्येक कथन का स्वाभाविक भाषा में विवरण सुरक्षित रखता है। निर्मित प्रमाण Henri Darmon, Fred Diamond और Richard Taylor द्वारा प्रस्तुत Wiles के सरलीकृत निरूपण का अनुसरण करता है।

This extraordinary autoformalization achievement, which Anthropic researchers say only took 11 days, proves Fermat’s Last Theorem with no assumptions other than the axioms of mathematics.

🇮🇳 स्वतः औपचारिकीकरण की यह असाधारण उपलब्धि, जिसमें Anthropic के शोधकर्ताओं के अनुसार केवल ग्यारह दिन लगे, गणित के अभिगृहीतों के अतिरिक्त किसी अन्य मान्यता के बिना फ़र्मा के अंतिम प्रमेय को सिद्ध करती है। — परिणाम के समीक्षक Kevin Buzzard, Anthropic के शोध पृष्ठ पर उद्धृत

Anthropic इसे खोज के बजाय सत्यापन की चुनौती के रूप में प्रस्तुत करता है, जो रीमान परिकल्पना पर AI द्वारा किए गए हालिया कार्य से अलग है, जहाँ नया गणित विकसित किया गया था। जैसे-जैसे प्रमाणों की मात्रा बढ़ती है, सहकर्मी समीक्षा वर्षों में मापी जाने वाली बाधा बन जाती है।

🔗 GitHub पर पूरा प्रमाण


Project HydraFusion में GitHub ने मॉडल का चुनाव डेवलपर के बजाय उपकरण को सौंपा

4 सितंबर — GitHub ने शोध पूर्वावलोकन के रूप में Project HydraFusion उपलब्ध कराया है, जो अब किसी मॉडल के बजाय एक कार्यप्रवाह निर्धारित करता है। जहाँ Copilot का चयनकर्ता बीस से अधिक मॉडलों में से चुनने को कहता था, वहीं HydraFusion प्रत्येक अनुरोध के लिए स्वयं तय करता है कि कौन-सा मॉडल कार्य संभालेगा और किस निष्पादन योजना के अनुसार। इसे किसी भी मॉडल की तरह चुना जाता है, लेकिन इस एक चयन के पीछे यह कई मॉडलों का संयोजन करता है।

फिलहाल तीन योजनाएँ उपलब्ध हैं। Single मोड कार्य को एक ही मॉडल को सौंपता है। Cascade मोड में एक कुशल मॉडल पहला समाधान लिखता है, फिर गुणवत्ता-द्वार तय करता है कि उसे स्वीकार किया जाए या अधिक सक्षम मॉडल को सौंपा जाए। Critique मोड किसी दूसरे मॉडल परिवार से आए स्वतंत्र, केवल पढ़ने वाले समीक्षक से प्रारूप की समीक्षा कराता है।

मूल्यांकित बेंचमार्कOpus 5 की तुलना में लागत-अंतरOpus 5 की तुलना में गुणवत्ता-अंतर
TerminalBench 2.167 प्रतिशत कम4.9 अंक अधिक
DeepSWE36 प्रतिशत कम1.5 अंक कम
CheckpointBench65 प्रतिशत कम0.1 अंक कम

निष्पादन पाँच अभियांत्रिकी सिद्धांतों से नियंत्रित होता है: प्रत्येक चरण की लागत का समेकित लेखांकन, स्पष्ट समय-सीमा और निरस्तीकरण, अलग संदर्भ में और बिना उपकरणों के समीक्षा, अंतर्निहित सुरक्षा वाला अनुप्रयोग जो कार्यप्रवाह विफल होने पर कोई सुधार लागू नहीं करता, और निष्पादन से पहले मार्ग-निर्धारण का सत्यापन। GitHub ने इंटरफ़ेस के स्तर पर एक समझौता स्वीकार किया है: चरण दिखाए जाते हैं, लेकिन अंतिम परिणाम आने तक मध्यवर्ती प्रारूप रोके रखे जाते हैं। कंपनी मानती है कि पर्याप्त दृश्यता के बिना प्रतीक्षा करना एक वास्तविक असुविधा है।

विकास संबंधी दस्तावेज़ असामान्य रूप से स्पष्ट हैं: GitHub ने TerminalBench 2.1 को परीक्षण-चक्रों का सबसे पूर्ण क्रम माना, बताया कि प्रगति रैखिक नहीं थी और स्वीकार किया कि मूल्यांकन ढाँचे की दो परिचालन विफलताओं के कारण 11 से 25 अगस्त के बीच अमान्य परीक्षण-चक्र बने। इन परीक्षण-चक्रों को रुझान से बाहर कर दिया गया और बाद में सुधार लिया गया। कंपनी दर्ज श्रृंखला के सर्वोत्तम परिचालन बिंदुओं को 25 अगस्त का बताती है। सभी योजनाओं में Copilot CLI के माध्यम से पहुँच मिलती है और कार्यप्रवाह के कुल tokens पर आधारित मानक दर लागू होती है; इसके लिए पहले /update और फिर /experimental on का उपयोग किया जाता है।

🔗 Project HydraFusion


Lyria 3.5 Gemini एप्लिकेशन और API में आया

4 सितंबर — Google ने Lyria 3.5 जारी किया है, जिसे वह अधिक अभिव्यंजक आवाज़ों और अधिक समृद्ध संयोजनों के साथ अब तक का अपना सर्वोत्तम ध्वनि-पुनरुत्पादन वाला संगीत-निर्माण मॉडल बताता है।

Gemini एप्लिकेशन में यह अद्यतन इंटरफ़ेस के तीन बदलावों के साथ आया है। उपयोगकर्ता अपनी संगीत शैली चुन या उसका वर्णन कर सकता है और गायनयुक्त अथवा वाद्य प्रस्तुति में से चयन कर सकता है। पृष्ठभूमि संगीत हो या व्यक्तिगत जन्मदिन गीत, नए उपयोग-के-लिए-तैयार नमूने (templates) आरंभिक बिंदु का काम करते हैं। गीत की अवधि अब छोटे से लंबे प्रारूप के बीच निर्धारित की जा सकती है।

माध्यम का प्रकारLyria 3.5 तक पहुँच
आम जनताGemini वेब और मोबाइल एप्लिकेशन, विश्वभर में
पेशेवर निर्माणGoogle Flow Music
डेवलपरGemini API, Google AI Studio, Google Vids

Google के अनुसार इसका अपेक्षित उपयोग पेशेवर निर्माण के बजाय रोज़मर्रा की आवश्यकताओं के लिए है: किसी वीडियो के लिए संगत संगीत, ब्रांड जिंगल या व्यक्तिगत रिंगटोन। वितरण व्यापक है और किसी सदस्यता प्रतिबंध का उल्लेख नहीं किया गया है। हालाँकि, लेख में ऑडियो गुणवत्ता का कोई आँकड़ा, Lyria के पिछले संस्करण से कोई तुलना या API पहुँच की कोई कीमत नहीं दी गई है।

🔗 Google की घोषणा


SpaceXAI ने कंपनियों में Grok को काम पर लगाया और अपने खरीद एजेंट का सिस्टम प्रॉम्प्ट प्रकाशित किया

3 और 4 सितंबर — SpaceXAI ने कंपनियों के लिए Grok Bot उपलब्ध कराया है। 12 अगस्त को लॉन्च हुआ यह उत्पाद व्यक्तिगत सदस्यों और Cursor टीमों के लिए बनी पेशकश से आगे बढ़कर अब पहुँच, नेटवर्क और ऑडिट नियंत्रणों से युक्त संस्करण बन गया है। प्रत्येक उपयोगकर्ता का कार्य अलग वातावरण में निष्पादित होता है और किसी Bot के पास डिफ़ॉल्ट रूप से कोई पहुँच नहीं होती: वह केवल उन्हीं खातों तक पहुँचता है जिनसे उसे स्पष्ट रूप से जोड़ा जाता है। Grok Enterprise और Cursor Enterprise के ग्राहकों को यह दो सप्ताह तक निःशुल्क मिलता है और वे अपने पूरे संगठन को आमंत्रित कर सकते हैं, जिनमें वे लोग भी शामिल हैं जिनके पास पहले से कोई लाइसेंस नहीं है। SpaceXAI ने Legora, Supermicro और ServiceTitan का उल्लेख किया और दावा किया कि लॉन्च के बाद से हज़ारों संगठनों ने इस उत्पाद को अपनाया है।

घोषणा का सबसे रोचक बिंदु यह है कि इसका सबसे गहन उपयोग अभियांत्रिकी से बाहर हो रहा है: भर्ती में रातभर संभावित उम्मीदवार खोजना और मूल्यांकन सारणियाँ बनाना, बिक्री में ईमेल प्रारूप और प्रस्तुतियाँ अद्यतन करना, तथा विपणन में वेबिनार से प्रश्नोत्तर निकालना।

अगले दिन कंपनी ने अपने ही खरीद कार्यों पर लगाए गए एक Bot का प्रकरण-अध्ययन प्रकाशित किया। Haggle Bot नामक यह एजेंट Slack, Notion, Drive, Gmail, Hex और Ramp से जुड़ा था और इसने 100,000 डॉलर से अधिक की प्रत्यक्ष बचत का दावा किया।

एजेंट की खोजपहचानी गई राशि
कुल प्रत्यक्ष बचत100,000 डॉलर से अधिक
90 दिनों से निष्क्रिय लाइसेंस, पहला उत्पाद43 लाइसेंस, 14,220 डॉलर
अप्रयुक्त संदर्भ, मासिक उत्पादप्रति वर्ष 85,662 डॉलर

इस लेख का संपादकीय महत्व इन आँकड़ों से आगे जाता है: SpaceXAI ने एजेंट के सिस्टम प्रॉम्प्ट का साँचा प्रकाशित किया है, जिसे अपने संगठन के लिए भरने योग्य नमूने के रूप में प्रस्तुत किया गया है और उदाहरण मान कोणीय कोष्ठकों में दिए गए हैं। उसका अनुमतियाँ अनुभाग तीन स्थायी व्यवस्थाओं में अंतर करता है। पहली व्यवस्था में कभी सहमति नहीं माँगी जाती, जिसके उदाहरणों में व्यय डेटा पढ़ना और सहकर्मियों को संदेश भेजना शामिल है। दूसरी व्यवस्था में हर बार संचालक की स्पष्ट स्वीकृति आवश्यक होती है और किसी आपूर्तिकर्ता को कुछ भी भेजना इसका उदाहरण है। तीसरी व्यवस्था हर परिस्थिति में निषिद्ध रहती है; दिए गए उदाहरणों में हस्ताक्षर करना, खरीदना, सदस्यता लेना, खर्च को स्वीकृति देना और कोई भी बाध्यकारी प्रतिबद्धता करना शामिल है। लेख में स्पष्ट किया गया है कि टीम ने एजेंट को आंतरिक शोध और समन्वय स्वयं करने दिया, लेकिन धन खर्च करने, शर्तें स्वीकार करने या किसी आपूर्तिकर्ता को लिखने के लिए स्पष्ट स्वीकृति अनिवार्य रखी।

🔗 कंपनियों के लिए Grok Bot · 🔗 खरीद कार्यों पर लगाया गया Haggle Bot


Grok अब Plaid के माध्यम से अमेरिकी बैंक खातों से जुड़ता है

4 सितंबर — Grok अब अपने उपयोगकर्ताओं के वित्तीय खातों से जुड़ सकता है। यह संपर्क Plaid के माध्यम से होता है, जो संयुक्त राज्य अमेरिका में ऐप्लिकेशनों और बैंकिंग संस्थानों को जोड़ने वाला तकनीकी मध्यस्थ है, और यह सुविधा फिलहाल केवल इसी देश में तुरंत उपलब्ध है।

SpaceXAI द्वारा चुने गए तीन उदाहरण लक्षित दायरे को स्पष्ट करते हैं: यह जानना कि पिछले महीने का पैसा कहाँ खर्च हुआ, अपने निवेशों के प्रदर्शन पर नज़र रखना, और यह जाँचना कि क्या व्यक्ति वास्तव में अपने कार्ट में मौजूद सामान खरीद सकता है। दूसरे शब्दों में, पिछले खर्चों का विश्लेषण, पोर्टफ़ोलियो की निगरानी और खरीदारी का निर्णय लेते समय सहायता। घोषणा संक्षिप्त है और सुरक्षित संपर्क के उल्लेख के अतिरिक्त डेटा के प्रसंस्करण या समर्थित संस्थानों के बारे में कुछ नहीं बताती।

यह 25 जून को Interactive Brokers के साथ शुरू हुई वित्तीय एकीकरणों की शृंखला को आगे बढ़ाता है, लेकिन इसकी प्रकृति अलग है: जहाँ Interactive Brokers सक्रिय निवेशकों पर केंद्रित था, वहीं Plaid सहायक को आम जनता के चालू खातों तक पहुँच प्रदान करता है।

🔗 X पर Grok की घोषणा


Claude Code 2.1.260 और 2.1.261: diff पैनल, skills का ऑडिट और अधिक कठोर permissions

4 सितंबर — Claude Code के दो संस्करण एक ही दिन जारी हुए, और वे एक-दूसरे के पूरक हैं: पहला चल रहे काम की दृश्यता प्रदान करता है, जबकि दूसरा यह दिखाता है कि सत्र किन संसाधनों का उपयोग कर रहा है।

प्रकाशित संस्करणजारी होने का समयप्रमुख योगदान
2.1.2604 सितंबर 01h48/diff पैनल, /cost में cache निदान, permissions संबंधी सुधार
2.1.2614 सितंबर 21h58/skill-doctor, 128 000 वर्णों तक का output, फ़ाइल में sub-agent prompt

2.1.260 पूर्ण-स्क्रीन मोड में बातचीत के बगल में एक diff पैनल खोलता है, जो संपादन के दौरान commit न किए गए बदलाव दिखाता है। यह विशेष रूप से permissions के मूल्यांकन से जुड़ी कई खामियों को ठीक करता है: Edit, Write और Read नियम, जिनके path में कोष्ठक थे, अमान्य मानकर अस्वीकार कर दिए जाते थे या Bash sandbox द्वारा अनदेखे कर दिए जाते थे, जिससे केवल-पठन के लिए निर्धारित फ़ोल्डरों में लिखना संभव रहता था; और ऐसे zsh command, जो REPORTTIME assignment में command substitution छिपाते थे, स्वतः स्वीकृत हो जाते थे।

2.1.261 में /skill-doctor जोड़ा गया है, जो load किए गए लेकिन अप्रयुक्त रहे skills और प्रत्येक की context लागत की सूची देता है। इसका auto mode अब ऐसे link को किसी third-party site पर भेजा गया डेटा मानता है, जो किसी सार्वजनिक diagram generator के URL में सामग्री समाहित करता है।

🔗 संस्करण 2.1.260 के release notes · 🔗 संस्करण 2.1.261 के release notes


ant apply command Managed Agents को versioned files में बदलता है

4 सितंबर — Anthropic ने अपने ant CLI में ant apply जोड़ा है। यह command Managed Agents पर infrastructure teams के परिचित declarative model को लागू करता है: repository की files में वांछित state का वर्णन किया जाता है, और command API resources को इस विवरण के अनुरूप बनाता है।

इसमें पाँच प्रकार के resources शामिल हैं: Managed Agent environments, स्वयं agents, skills, memory stores (memory stores) और deployments। अब तक ये objects API calls या console के माध्यम से बनाए जाते थे और repository में उनका कोई रिकॉर्ड नहीं रहता था। Files में उनका वर्णन करने से वे code review, versioning और continuous integration pipelines के दायरे में आ जाते हैं। व्यावहारिक लाभ reproducibility है: file में वर्णित agent environment को हूबहू फिर से बनाया जा सकता है, अलग-अलग branches के बीच उसकी तुलना की जा सकती है, या बिना manual intervention के pipeline से deploy किया जा सकता है।

🔗 X पर घोषणा


NVIDIA की तिहरी पेशकश: agents की स्थायी memory, Jetson पर reasoning और federated identity

3 और 4 सितंबर — एक ही दिन NVIDIA के technical blog पर stack की तीन अलग-अलग layers से संबंधित तीन प्रकाशन आए।

पहला NemoClaw पर आधारित एक open recipe है: ऐसा chief-of-staff agent जो अपने उपयोगकर्ता के काम की स्थायी memory बनाए रखता है। इसका मूल विचार एक वाक्य में है: उपयोगी agent memory के लिए केवल storage नहीं, बल्कि structure, selective retrieval और governance की आवश्यकता होती है। यह व्यवस्था एक self model (self model) पर आधारित है—संरचित Markdown pages में लिखी ऐसी knowledge layer जिसे मनुष्य पढ़ सकता है—और इसके साथ एक SQLite register है, जो obligations, classifications, corrections और audit events सुरक्षित रखता है। Execution NVIDIA OpenShell के माध्यम से होता है, जो filesystem, processes और network तक पहुँच की policies को sandbox में लागू करता है, जबकि credentials sandbox से बाहर रहते हैं।

मापी गई metricAgentic RAG baselineSelf modelदर्ज अंतर
186 प्रश्नों पर समग्र accuracy82,8 प्रतिशत90,9 प्रतिशत8,1 points अधिक
31 प्रश्नों में कठिन प्रश्न67,7 प्रतिशत87,1 प्रतिशत19,4 points अधिक
बदलते तथ्यों की tracking, 5 पर60,0 प्रतिशत100,0 प्रतिशत40,0 points अधिक
13 प्रश्नों पर corpus fidelity100,0 प्रतिशत92,3 प्रतिशत7,7 points कम

Context can inform an action, but it cannot authorize one.

🇮🇳 संदर्भ किसी कार्रवाई को स्पष्ट कर सकता है, लेकिन उसे अधिकृत नहीं कर सकता।agents की memory पर NVIDIA का लेख

दूसरा प्रकाशन एक deployment guide है, जो embedded AI में आए बदलाव को रेखांकित करता है: speculative decoding के साथ NVFP4 quantization, Jetson AGX Thor और Orin पर BF16 की तुलना में decoding throughput को 6,28 गुना तक बढ़ाता है। सर्वोत्तम configuration model के अनुसार अलग होती है, और NVIDIA किसी एक सार्वभौमिक विजेता को घोषित करने के बजाय इसी बिंदु पर बल देता है: Nemotron 3.5 Lightning, DSpark के साथ प्रति सेकंड 123 से 138 output tokens के बीच अपना सर्वोत्तम परिणाम देता है, जबकि Qwen3.8-27B, DFlash2 के साथ प्रति सेकंड 27,7 से 34,4 tokens देता है। अंतिम चेतावनी methodology से संबंधित है: throughput workload के अनुसार बदलता है, इसलिए लक्षित application का प्रतिनिधित्व करने वाले prompts के साथ configuration को validate करें। तीसरा, अपेक्षाकृत सीमित प्रकाशन, federated Kubernetes platforms और AI platforms के बीच उपयोगकर्ता identity के propagation का वर्णन करता है।

🔗 Jetson पर frontier reasoning · 🔗 federated platforms के बीच identity


Google के command-line tools: Gemini CLI 0.60.0 series में पहुँचा, Antigravity ने enterprises के लिए Flash खोला

3 और 4 सितंबर — Gemini CLI का nightly channel 0.59.0 series से 0.60.0 में पहुँच गया है, और इस release का मुख्य केंद्र security है। सबसे उल्लेखनीय सुधार chrome-devtools-mcp component से hard-coded Google CrUX API key हटाता है। दो अन्य बदलाव isolation को मजबूत करते हैं: macOS Seatbelt sandbox को एक अलग temporary directory मिलती है, और extension loader अधिक सुरक्षित path resolution के साथ boundary validation लागू करता है। चौथा बदलाव MCP servers के OAuth flow में RFC 9207 के अनुरूप issuer identification अनिवार्य करता है, जो authorization-server substitution attacks से सुरक्षा प्रदान करता है।

एक दिन पहले प्रकाशित Antigravity 2.12.2 में केवल एक improvement है और कोई fix नहीं: enterprise users, application default credentials (Application Default Credentials) से authentication करके Gemini 3.8 Flash reasoning models का उपयोग कर सकते हैं। व्यावहारिक लाभ यह है कि model को individual API key के बिना Google Cloud deployments के standard authentication mode से जोड़ा जा सकता है।

🔗 Gemini CLI v0.60.0 nightly · 🔗 Antigravity changelog


विज्ञान की सेवा में AI: एक coupled climate emulator और नर फल-मक्खी का पूर्ण connectome

3 और 4 सितंबर — दो प्रकाशन machine learning को दो परस्पर असंबंधित disciplines में विशाल scientific objects पर लागू करते हैं।

Ai2 ने Hugging Face Hub पर Apache 2.0 license के तहत SamudrACE-E3SMv3 प्रकाशित किया है, जो पूरी तरह coupled atmosphere-ocean climate emulator है। इस कार्य का उद्देश्य अमेरिकी Department of Energy के reference climate model E3SM के व्यवहार को बहुत कम computational cost पर दोहराना है: E3SM को स्वयं चलाने से पहले hypotheses को filter करना और कम लागत पर climate variability का sampling करने वाले बड़े ensembles बनाना। Atmosphere emulator (ACE) और ocean emulator (Samudra) को पहले अलग-अलग pre-train किया जाता है, फिर couple किया जाता है, और उसके बाद 400 वर्षों के ऐसे E3SM data पर evaluate किया जाता है जिन्हें उन्होंने पहले नहीं देखा था; इन पर औसत climate स्थिर रहता है। Ai2 एक स्पष्ट सीमा बताता है: emulator दैनिक precipitation को 99,99वें percentile तक capture करता है, लेकिन उसके आगे कम अनुमान लगाता है।

दूसरी ओर, HHMI Janelia Research Campus, Google Research और उनके सहयोगियों ने एक वयस्क नर फल-मक्खी के मस्तिष्क और central nervous system का पहला पूर्ण map प्रकाशित किया है: 166 000 से अधिक neurons—एक record—जिन्हें AI की सहायता से वर्गीकृत और human experts द्वारा validated 11 691 cell types में बाँटा गया है। यह method पतली slices की imaging और फिर लाखों two-dimensional images को computer द्वारा three-dimensional neuronal shapes में पुनर्गठित करने पर आधारित है। इसका महत्व पहले प्रकाशित मादा map के साथ तुलना में है: अधिकांश neurons दोनों sexes में समान हैं, एक अल्पसंख्या sex-specific है, और dimorphic कही जाने वाली तीसरी category दोनों में मौजूद है लेकिन अलग-अलग neighboring neurons से जुड़ती है। तीन companion studies इस map को vision, taste और social behavior पर लागू करती हैं।

🔗 X पर SamudrACE-E3SMv3 · 🔗 नर फल-मक्खी के मस्तिष्क का map


Meta ने Muse Spark 1.3 का max reasoning tier सार्वजनिक किया

4 सितंबर — Model की घोषणा के दो दिन बाद Meta ने Muse Spark 1.3 का max reasoning tier सार्वजनिक कर दिया है। यह tier Muse Code और Meta Model API में उपलब्ध है।

इसलिए बदलाव model में नहीं, बल्कि उसके सबसे महँगे reasoning level की वास्तविक उपलब्धता में है। Meta के chief AI officer Alexandr Wang बताते हैं कि coding और agentic tasks में सुधार हुआ है, और उन लोगों को भी model फिर से आज़माने की सलाह देते हैं जिन्होंने पहले high और xhigh tiers का परीक्षण किया था। वे यह भी कहते हैं कि launch security testing पूरी होने के बाद हुआ है। इसे सक्रिय करने के लिए Muse Spark 1.3 चुनना और फिर reasoning level को max पर set करना आवश्यक है।

इस उपलब्धता के साथ कोई benchmark figure नहीं दिया गया है: thread में न कोई score है, न comparison, केवल लेखक का qualitative assessment है।

🔗 AI at Meta की घोषणा


Percept-Lens, generated images की detection का मूल्यांकन करने के लिए Sakana AI का protocol

3 सितंबर — Sakana AI ने Percept-Lens प्रस्तुत किया है, जो AI-generated images की detection के लिए out-of-distribution evaluation framework है और ECCV 2026 में स्वीकार किया गया है। शुरुआती निष्कर्ष यह है कि synthetic-image detectors तब विफल हो जाते हैं जब कई factors एक साथ बदलते हैं: generator, style या prompt, और source domain। Percept-Lens 39 public datasets, अर्थात 71 लाख images, पर evaluation को एकीकृत करता है।

Representation study एक सीधा प्रश्न उठाती है: क्या classification head की training अब भी उस separation से आगे कोई लाभ देती है जो modern encoders पहले से करते हैं? लेखक prior-conditioned Gaussian discriminants की एक scale बनाते हैं, अर्थात features के first- और second-order statistics पर आधारित closed-form heads। इस scale का सर्वोत्तम स्तर अक्सर प्रकाशित detection heads की बराबरी करता है और कभी-कभी उनसे आगे निकल जाता है, बशर्ते तुलना समान prior और encoder के साथ की जाए। लेखक prior, encoder और head की triplet के स्तर पर reporting की वकालत करते हैं।

🔗 Sakana AI का लेख · 🔗 arXiv paper


TAOT, network topology को ध्यान में रखने वाला expert-replica placement

4 सितंबर — Baidu की Baige team ने TAOT का विवरण दिया है, जो mixture-of-experts models की training के लिए expert replicas को रखने की method है और उसके open-source framework LoongForge में उपलब्ध है।

समस्या ठोस है। जब MoE training धीमी होती है, तो कारण प्रायः GPU power नहीं, बल्कि समय पर load को rebalance न कर पाना होता है: कुछ experts hotspots बन जाते हैं और अन्य सभी ranks प्रतीक्षा करते हैं। सामान्य उपाय किसी hot expert के weights को अस्थायी रूप से किसी inactive rank पर replicate करना है, लेकिन जैसे ही parallelism domain एक node से आगे बढ़ता है, सभी inactive GPUs समान नहीं रहते: intra-node communication NVLink के माध्यम से होता है, cross-node communication InfiniBand से, और लागत में दस गुना तक अंतर हो सकता है।

मापी गई metricदर्ज value
प्रति iteration समय, पहले और बाद में155,4 ms, फिर 108,8 ms, अर्थात 1,43x
EP4 से EP16 तक acceleration1,79x तक
LPLB की तुलना में communication costEP32 पर 74 प्रतिशत तक कम
online scheduling overheadforward pass समय के 1 प्रतिशत से कम

TAOT को ऐसी पहली method के रूप में प्रस्तुत किया गया है जो peak clipping के लाभ और nodes के बीच weights स्थानांतरित करने की लागत को एक ही objective function में शामिल करती है। जहाँ DeepSeek का LPLB predefined graphs के माध्यम से paths को सीमित करता है, वहीं TAOT एक continuous communication-cost matrix के साथ flexible topological preference का उपयोग करता है: intra-node को प्राथमिकता दी जाती है, जबकि cross-node वैध रहता है लेकिन अधिक महँगा होता है। Row-wise matching से column-wise matching पर जाने से residual imbalance 7 से 10 प्रतिशत से घटकर 1 से 2 प्रतिशत रह जाता है।

🔗 Hugging Face का लेख


Open Yap 1K, commercial use के लिए मुक्त एक हज़ार घंटे की full-duplex conversation

3 सितंबर — The Agentic Data Company ने Open Yap 1K प्रकाशित किया है, जो दो अलग-अलग channels में English conversation का corpus है और full-duplex voice models के लिए बनाया गया है।

corpus का घटकpublic sampleपूर्ण corpus
कुल अवधि8,9 घंटे1 000 घंटे
conversations161 602
लागू licenseCC BY 4.0Open Yap, commercial use के लिए मुक्त
access modeHugging Face Hubअनुरोध पर

लेखक corpus को स्पष्ट रूप से Fisher, Switchboard और CANDOR जैसे मौजूदा speech corpora के विकल्प के रूप में प्रस्तुत करते हैं, और उनका मुख्य तर्क technical है: blog post में telephone bandwidth पर 8 kHz में sampled Fisher English excerpt की तुलना Open Yap 1K excerpt से की गई है, ताकि audio quality का अंतर दिखाया जा सके। Collection method, speaker demographics, quality assurance, consent और privacy का documentation उपलब्ध है।

🔗 Hugging Face का लेख


अधिक अमेरिकी Gemini उपयोगकर्ताओं के लिए Daily Brief मुफ़्त हुआ

4 सितंबर — Google अमेरिका में Gemini ऐप के अधिक उपयोगकर्ताओं के लिए Daily Brief की मुफ़्त पहुँच का विस्तार कर रहा है। यह सुविधा 21 मई को पेश की गई थी।

Daily Brief पृष्ठभूमि में काम करता है और उपयोगकर्ता के Google ऐप्स को आपस में जोड़ता है: ईमेल, कैलेंडर, बातचीत और रुचियों को कार्यों और प्राथमिकताओं की एकल, आसानी से देखी जा सकने वाली सूची में संक्षिप्त किया जाता है, जिसे दिन की शुरुआत के बिंदु के रूप में प्रस्तुत किया जाता है। घोषणा अभी अमेरिका तक सीमित है और न तो संबंधित उपयोगकर्ताओं का प्रतिशत बताती है, न ही अंतरराष्ट्रीय विस्तार की समय-सारणी।

🔗 X पर Gemini की घोषणा


Runway ने दो से नौ सीट वाली टीमों के लिए स्व-सेवा प्लान Team पेश किया

4 सितंबर — Runway ने Team लॉन्च किया है, जो व्यक्तिगत प्लानों और बड़े ग्राहकों के लिए आरक्षित Enterprise पेशकश के बीच की कमी को पूरा करता है। यह बदलाव उत्पाद-सूची की संरचना के लिए अहम है: Standard, Pro और Max अब स्पष्ट रूप से व्यक्तिगत प्लान बन गए हैं, और अब हर नया सदस्य Team के माध्यम से जुड़ेगा, जबकि मौजूदा वर्कस्पेस अपनी पहुँच और कीमत बनाए रखेंगे।

प्लान की विशेषताघोषित मूल्य
प्रति सीट मासिक कीमत69 डॉलर
प्रति सीट वार्षिक कीमत55 डॉलर, यानी 20 प्रतिशत की छूट
अनुमत सीटों की संख्या2 से 9
प्रति सीट मासिक क्रेडिट6 900, साझा पूल में जमा
साझा प्रोजेक्ट और स्टोरेजअधिकतम 100 प्रोजेक्ट, 1 TB

यह प्लान साझा प्रोजेक्टों के इर्द-गिर्द व्यवस्थित है, जिनमें एसेट, रेफ़रेंस, Brand Kits, सेशन और workflows रखे जाते हैं। Runway आउटपुट की एकरूपता के आधार पर इसका समर्थन करता है: जब पूरी टीम समान रेफ़रेंस से सामग्री बनाती है, तो दसवाँ वीडियो पहले वीडियो जैसा दिखता है। इस्तेमाल न हुए क्रेडिट एक महीने के लिए आगे बढ़ जाते हैं, एक टीम अधिकतम 20 एजेंट कौशल साझा करती है, और Agent Connectors Figma, Dropbox तथा Notion को क्रिएटिव एजेंट से जोड़ते हैं।

🔗 Runway की घोषणा


ElevenLabs ने अपनी 1 Million Voices पहल का ब्राज़ील तक विस्तार किया

4 सितंबर — ElevenLabs अपने प्रभाव कार्यक्रम को ब्राज़ील ले गया है और इसे ब्राज़ील की पहली कहानी के माध्यम से प्रस्तुत कर रहा है। Eliane ने बचपन में अपनी आवाज़ खो दी थी और Alberto 46 वर्ष की उम्र में दृष्टिहीन हो गए थे; कंपनी ने Eliane को ऐसी आवाज़ दी जो उनके परिवार की आवाज़ से मिलती-जुलती है, जिससे वह पहली बार उस व्यक्ति से अपनी पहचान वाली आवाज़ में संवाद कर सकीं, जिससे वह प्रेम करती हैं।

इस घोषणा के साथ दो स्थानीय साझेदारियाँ भी हुई हैं। देश में एमियोट्रोफ़िक लैटरल स्क्लेरोसिस से पीड़ित अधिकतम 10 000 लोगों की सेवा करने वाली Associação Brasileira de Esclerose Lateral Amiotrófica इन रोगियों को अपनी आवाज़ क्लोन करने के लिए मुफ़्त पहुँच उपलब्ध कराती है। दूसरी ओर, Sociedade Brasileira de Fonoaudiologia ब्राज़ील के स्पीच थेरेपिस्टों को वॉइस क्लोनिंग का प्रशिक्षण देगी; कंपनी लाभान्वित होने वाले रोगियों की संख्या बढ़ाने के लिए चिकित्सकों की दक्षता पर भरोसा कर रही है। 1 Million Voices पहल एक अरब डॉलर की वस्तु-रूप प्रतिबद्धता है, जो लॉन्च के बाद से दुनिया भर में 11 000 से अधिक लोगों तक पहुँच चुकी है।

🔗 ElevenLabs का लेख


Kimi Code 0.41.0 ने multi-agent मोड जोड़ा और दो दिन पुराना सुरक्षा-उपाय हटाया

4 सितंबर — Moonshot AI ने Kimi Code 0.41.0 जारी किया है। प्रमुख नई सुविधा tower है, जो वेब इंटरफ़ेस में प्रयोगात्मक multi-agent सहयोग मोड है। इसे /tower कमांड या कंपोज़र के प्लस मेनू से चालू किया जाता है और यह आर्ग्युमेंट के रूप में एक बेस ब्रांच स्वीकार करता है। कॉन्टेक्स्ट प्रबंधन में दो बदलाव किए गए हैं: स्वचालित कॉम्पैक्शन से पहले मॉडल को उसके कॉन्टेक्स्ट बजट की सूचना दी जाती है, फिर सटीक विवरण खोजने के लिए उसे सेशन के इवेंट लॉग की ओर भेजा जाता है। टर्न स्तर की फ़ाइल हिस्ट्री अब स्थायी हो गई है।

सबसे उल्लेखनीय बिंदु एक कदम पीछे हटना है। 2 सितंबर को जारी संस्करण 0.40.0 ने स्वचालित अनुमति मोड में shutdown, reboot या rm -rf जैसी विनाशकारी कमांड को ब्लॉक करना शुरू किया था। 0.41.0 इस निर्णय को पलटता है और उसी मोड में खतरनाक कमांड के साथ-साथ उन कमांड को भी ब्लॉक करना बंद कर देता है जिनका स्थिर रूप से विश्लेषण नहीं किया जा सकता। यह सुरक्षा-उपाय केवल दो दिन चला। रिलीज़ नोट्स में कारण स्पष्ट नहीं किया गया है, लेकिन shell कमांड का स्थिर विश्लेषण आसानी से ऐसे ग़लत सकारात्मक परिणाम देता है जो वैध काम को रोक देते हैं।

🔗 Kimi Code 0.41.0 के रिलीज़ नोट्स


Perplexity ने अपने embeddings उपलब्ध कराने वाले घरेलू स्टैक Ivy, Tulip और ROSE का विवरण दिया

4 सितंबर — Perplexity ने एक इंजीनियरिंग लेख प्रकाशित किया है, जो उसके embedding और ranking मॉडलों को उपलब्ध कराने वाली अवसंरचना के भीतर झाँकने देता है। कंपनी pplx-embed सहित अपने मॉडल स्वयं प्रशिक्षित और उपलब्ध कराती है तथा अपने सर्च इंडेक्स को exabyte स्तर का बताती है।

स्टैक घटकप्रयुक्त भाषासेवा में भूमिका
IvyRustHTTP गेटवे, tokenization, विभाजन और बैच वितरण
TulipRust, tokio, tonicgRPC inference सर्वर, scheduling और batching
ROSEPythonमॉडल निष्पादन, CUDA kernels और graphs

मुख्य विचार LLM के inference कोड का पुनः उपयोग है। Perplexity का कहना है कि batch embedding गणना-सीमित prefill चरण जैसा होता है, जबकि किसी छोटी क्वेरी का online embedding मेमोरी-सीमित decode चरण जैसा होता है। इसलिए समान kernels pplx-embed और Qwen3.5 decoding, दोनों के लिए इस्तेमाल किए जाते हैं; embeddings के लिए कोई key-value cache इंस्टैंशिएट नहीं किया जाता और अनियमित ragged इनपुट स्वीकार करने वाले attention variants अनावश्यक padding से बचाते हैं। attention kernels के लिए टीम किसी एक को चुनने के बजाय FlashInfer 2, FlashInfer 3 और FlashAttention 4 को समानांतर बनाए रखती है; चयन हर मामले में heads की संख्या और dimension के अनुसार किया जाता है। मापों की तुलना vLLM v0.22.0 से की गई है, लेकिन उनके संख्यात्मक परिणाम केवल ग्राफ़ों में दिए गए हैं।

🔗 Perplexity का इंजीनियरिंग लेख


Zed और Replit ने X पर घोषणा की, लेकिन कोई लेख या रिलीज़ नोट्स नहीं दिए

4 सितंबर — तीसरे पक्ष के coding tools से जुड़ी दो घोषणाएँ एक ही दिन आईं और दोनों केवल एक X पोस्ट पर आधारित हैं; उनके समर्थन में न कोई ब्लॉग लेख है, न रिलीज़ नोट्स।

Zed ने 2 सितंबर की एक उपयोगकर्ता माँग के उत्तर में बताया कि Windows पर बीटा के लिए पंजीकृत लोगों को अब Delta उपलब्ध है। यह अंतर महत्वपूर्ण है: Delta 12 अगस्त को लॉन्च किया गया एजेंटों वाला multiplayer coding environment है, जिसमें टीम के कई सदस्य किसी साझा प्रोजेक्ट पर एजेंटों के साथ काम कर सकते हैं। दूसरी ओर, Zed editor पहले से macOS, Linux और Windows के लिए वितरित किया जा रहा है। इसलिए घोषणा editor के बारे में नहीं, बल्कि Delta के बारे में है, जिसकी Windows उपलब्धता अगस्त से लंबित थी। इस बीटा का सटीक दायरा और पंजीकरण की शर्तें अज्ञात हैं।

दूसरी ओर, Replit ने « Replit MCP: कहीं से भी अपने एजेंट को निर्देशित करें » शीर्षक वाला एक घंटे और 58 मिनट का लाइव सेशन प्रसारित किया। शीर्षक ऐसे MCP सर्वर की घोषणा करता है जो प्लेटफ़ॉर्म के एजेंट को protocol-compatible clients के सामने उपलब्ध कराता है; इसका लक्षित उपयोग वेब इंटरफ़ेस से गुज़रे बिना किसी editor, terminal या तीसरे पक्ष के assistant से कार्य शुरू करना और उसकी प्रगति पर नज़र रखना है। संदेश में इस शीर्षक के अलावा कोई अन्य पाठ, किसी लेख का लिंक या लॉन्च की स्पष्ट घोषणा नहीं है।

🔗 Windows पर Delta · 🔗 Replit MCP लाइव


संक्षिप्त समाचार

  • एक API endpoint उपयोगकर्ताओं को उजागर किए बिना stars की हिस्ट्री लौटाता है — GitHub का REST API इस वर्ष की शुरुआत में केवल administrators के लिए आरक्षित listing endpoints के स्थान पर, stars देने वाले accounts की पहचान बताए बिना timestamp वाले star counts लौटाता है। 🔗 बदलाव-सूची
  • npm प्रति package कई trusted publishing configurations स्वीकार करता है — सामान्य उपलब्धता में तीन बदलाव: प्रति package कई additive OIDC configurations, antimalware analysis चलने तक approval को रोकना और versions tab में pre-production history दिखाना। 🔗 बदलाव-सूची
  • GitHub Actions ने runners के deprecation का API जोड़ा — REST API किसी runner version के support समाप्त होने की तारीखें देता है, vulnerability-alerts permission Dependabot alerts को केवल पढ़ने के लिए खोलती है और job context की चार properties reusable workflows को उनकी मूल पहचान देती हैं। 🔗 बदलाव-सूची
  • The Story of VS Code वृत्तचित्र 4 सितंबर को जारी हुआ — GitHub ने 1 सितंबर को जारी trailer के बाद, publisher के YouTube channel पर Visual Studio Code के आधिकारिक वृत्तचित्र का प्रसारण साझा किया। 🔗 घोषणा
  • Replit ने एक सप्ताह में बनाए गए application को प्रमुखता दी — Cédric Roberge द्वारा प्लेटफ़ॉर्म पर लगभग एक सप्ताह में बनाया गया Pep AI, Replit के अनुसार प्रति माह लगभग 130 000 डॉलर कमाता है; यह दावा pricing संबंधी सलाह के साथ एक प्रचारात्मक thread में किया गया। 🔗 Replit thread
  • Zed ने एक दृश्य घोषणा प्रकाशित की जिसकी सामग्री सत्यापित नहीं की जा सकी — 4 सितंबर को रात 22:14 बजे प्रकाशित चार शब्दों का संदेश, जिसके साथ केवल एक image थी। scan के दौरान image load नहीं हुई और पोस्ट के साथ कोई लेख या रिलीज़ नोट्स नहीं हैं: यह निर्धारित करने का कोई आधार नहीं है कि इसमें क्या घोषित किया गया है। 🔗 संदेश
  • आर्मेनियाई भाषा के लिए पूर्ण open LLM ecosystem — एक Hugging Face collection में ArmWeb web corpus, सत्यापित वैज्ञानिक dataset ArmSTEM और arm-gemma-e4b model शामिल हैं; संबंधित शोध-पत्र आगामी बताया गया है। 🔗 लेख
  • VLM Run Gateway ने open-weight OCR और vision models को एक API के पीछे एकीकृत किया — gateway एक ही entry point से PaddleOCR-VL-1.6 सहित open-weight optical recognition, vision-language और vision models उपलब्ध कराता है। 🔗 लेख
  • Sakana AI ने 5 अक्टूबर को अपनी engineering team के द्वार खोले — Engineer Open House सोमवार, 5 अक्टूबर 2026 को शाम 18 बजे से 21 बजे तक Toranomon या online आयोजित होगा और पंजीकरण connpass पर होगा। 🔗 घोषणा
  • Google ने अपने Gemini Enterprise developer experience कार्यक्रम के sprints का विवरण दिया — बिना किसी लॉन्च का कार्यविधि लेख: वर्णित sprint enterprise AI governance पर केंद्रित है और Agent Gateway तथा Semantic Governance के लिए अद्यतन documentation एवं मानकीकृत code examples देता है। 🔗 लेख
  • Suno ने अपनी अगली model generation को v6 family नाम दिया — एक उपयोगकर्ता को दिए उत्तर में आधिकारिक account ने इसे अब तक का अपना सर्वश्रेष्ठ काम बताया, लेकिन कोई तारीख या तकनीकी विवरण नहीं दिया; यह नई download limits लागू होने के अगले दिन हुआ। 🔗 उत्तर
  • MiniMax और Together AI ने London में open models की economics पर एक शाम आयोजित की — संयुक्त कार्यक्रम Open by Design: The Economics of AI in Production 16 सितंबर को होगा; निर्धारित अवधि में MiniMax की यही एकमात्र पोस्ट थी। 🔗 घोषणा
  • Mistral 23 और 24 सितंबर को AI Engineer conference को फिर Paris ला रहा है — Station F में वापसी पर engineering vice president Lélio Renard-Lavaud, Black Forest Labs, Cognition और Hugging Face के साथ शामिल होंगे; पिछला संस्करण पूरी तरह भरा हुआ था। 🔗 घोषणा
  • WebMCP Challenge ने submissions बंद किए — 3 सितंबर की outage के कारण बारह घंटे की देरी के बाद submissions बंद हुईं; projects की समीक्षा जारी है और winners की घोषणा जल्द की जाएगी। 🔗 घोषणा

इसका क्या अर्थ है

किसी frontier model को ecosystem कितनी तेज़ी से अपनाता है, यही अब वास्तविक संकेतक बन गया है। GPT-6 Astra की घोषणा 3 सितंबर को हुई; 4 सितंबर तक वह बिना प्रतिबंध API में, दस Copilot surfaces पर सामान्य उपलब्धता में, उत्पादन में उसका उपयोग करने वाले किसी तीसरे पक्ष द्वारा मापा गया और Codex CLI के लगातार तीन patches में एकीकृत हो चुका था। चौबीस घंटे की ऐसी अवधि एक साल पहले मौजूद नहीं थी। यह लॉन्च का प्रश्न हटाकर billing पर ध्यान ले आती है: GitHub Astra पर बिना किसी promotional period के provider की सार्वजनिक दर लागू करता है, जबकि Gemini 3.8 Flash को वर्ष के अंत तक introductory pricing मिलती है। जब सभी models अपनी घोषणा के अगले ही दिन उपलब्ध हो जाते हैं, तो अंतिम उपयोगकर्ता के लिए कीमत फिर एकमात्र दृश्यमान अंतर बन जाती है।

HydraFusion समस्या को दूसरी ओर से हल करता है और tooling के लिए यह दिन की सबसे संरचनात्मक ख़बर है। बीस models में से चुनना ऐसा काम है जिसे बहुत कम developers गंभीरता से करते हैं, और GitHub इसे पूरी तरह समाप्त करने का प्रस्ताव रखता है: उपयोगकर्ता workflow चुनता है और tool हर request के लिए model तय करता है। TerminalBench पर Opus 5 की तुलना में 67 प्रतिशत कम लागत पर गुणवत्ता में 4.9 points की बढ़ोतरी के आँकड़ों का महत्व मुख्यतः उनके संकेत में है: लाभ किसी श्रेष्ठ model से नहीं, orchestration से आता है। यदि यह परिणाम benchmark की परिस्थितियों के बाहर भी कायम रहता है, तो model स्वयं product नहीं रह जाता, बल्कि गुणवत्ता के प्रवेश-द्वार के पीछे एक परस्पर बदलने योग्य component बन जाता है।

enterprise agents engineering से बाहर निकल रहे हैं और governance उनके पीछे चल रहा है। SpaceXAI स्पष्ट रूप से कहता है कि Grok Bot का सबसे गहन उपयोग code से बाहर होता है, और दिन का सबसे स्पष्ट आँकड़ा software seats का audit है: 90 दिनों से बिना गतिविधि वाले 43 paid subscriptions। लेकिन इन घोषणाओं की असली सामग्री permission mechanism है। SpaceXAI द्वारा प्रकाशित system prompt template तीन व्यवस्थाओं में अंतर करता है—हमेशा अनुमत, मामले-दर-मामला अनुमत और कभी अनुमत नहीं—और NVIDIA agent memory पर अपने लेख में यही सिद्धांत रखता है: context किसी कार्रवाई के बारे में जानकारी दे सकता है, उसे अधिकृत नहीं कर सकता। परस्पर असंबंधित दो पक्ष एक ही दिन इस निष्कर्ष पर पहुँचते हैं कि उपयोगी agent को सबसे पहले उन कार्यों से परिभाषित किया जाता है जिन्हें करने से उसे रोका गया है।

command-line tools में सुरक्षा सीधी रेखा में नहीं, बल्कि टेढ़े-मेढ़े ढंग से आगे बढ़ रही है। Gemini CLI hard-coded API key हटाता है और अपने sandbox को मज़बूत करता है, Claude Code उन permission rules को ठीक करता है जिनके कारण केवल पढ़ने योग्य माने गए folders में लिखा जा सकता था, और Kimi Code विनाशकारी commands को रोकने की व्यवस्था जोड़ने के दो दिन बाद ही हटा देता है। अंतिम मामला सबसे शिक्षाप्रद है: shell commands का static analysis इतने false positives उत्पन्न करता है कि काग़ज़ पर सही सुरक्षा-उपाय व्यवहार में असहनीय बन जाता है। इन tools की सुरक्षा किसी protection की घोषणा में नहीं, बल्कि उपयोगकर्ताओं के संपर्क में आने के बाद उसके टिके रहने में तय होती है।

अंत में गणित और विज्ञान का दिन बचता है, जिसका तत्काल मूल्यांकन करना सबसे कठिन है। ग्यारह दिनों में औपचारिक रूप दिया गया Fermat proof कोई नया गणित उत्पन्न नहीं करता: वह तीस साल पुराने परिणाम को सत्यापित करता है। ठीक यही उसे रोचक बनाता है, क्योंकि peer review वह bottleneck है जिसे वर्षों में मापा जाता है, और Kevin Buzzard बताते हैं कि ये artifacts अब इतने मज़बूत हैं कि दूसरे कार्यों के आधार बन सकते हैं। Ai2 का climate emulator और fruit fly का connectome इसी तर्क पर आधारित हैं: दोनों में से कोई खोज नहीं करता, लेकिन दोनों ऐसे काम को व्यावहारिक बनाते हैं जिसकी लागत बड़े पैमाने को असंभव बना देती थी। यह autonomous discovery की तुलना में कम आकर्षक उपयोग है और संभवतः उस वास्तविक बदलाव के अधिक निकट है जो AI वैज्ञानिक अभ्यास में ला रहा है।


स्रोत