ai-powered-markdown-translatorलेख का fr से hi में अनुवाद gpt-5.6-sol के साथ किया गया।
लॉन्च के चौबीस घंटे बाद GPT-6 Astra सीमित परिनियोजन से बाहर आ गया है: मॉडल अब Pro, Enterprise और Business Premium योजनाओं के लिए सुलभ है, GitHub Copilot में सामान्य उपलब्धता के तहत शामिल हो गया है और दस्तावेज़-आधारित शोध के लिए Perplexity के परीक्षण में अब तक का सर्वोच्च स्कोर हासिल कर चुका है। दूसरी ओर, Anthropic ने कंप्यूटर द्वारा सत्यापित फ़र्मा के अंतिम प्रमेय का पहला प्रमाण प्रकाशित किया है, जिसे Claude ने ग्यारह दिनों में लिखा। GitHub ने HydraFusion उपलब्ध कराया है, जो प्रत्येक कार्य के लिए स्वयं मॉडल और कार्यप्रवाह चुनता है, Google ने Gemini एप्लिकेशन में Lyria 3.5 जारी किया है, और SpaceXAI ने कंपनियों के लिए Grok Bot उपलब्ध कराते हुए ऐसे खरीद एजेंट का विवरण प्रकाशित किया है जिसने अपने ही नियोक्ता के लिए 100,000 डॉलर से अधिक की बचत खोजी।
GPT-6 Astra सीमित परिनियोजन से बाहर आया और Copilot में सामान्य रूप से उपलब्ध हुआ
4 सितंबर — OpenAI ने पेरिस समयानुसार रात 10 बजकर 13 मिनट पर घोषणा की कि GPT-6 Astra अब सीमित परिनियोजन में नहीं है। मॉडल ChatGPT Work और Codex में सभी Pro, Enterprise तथा Business Premium उपयोगकर्ताओं के लिए सुलभ है और अब API में भी बिना किसी प्रतिबंध के उपलब्ध है, जबकि 3 सितंबर की घोषणा में इसकी उपलब्धता अभी क्रमिक परिनियोजन पर निर्भर थी। उसी संदेश में स्पष्ट किया गया कि Plus सदस्यों और Business उपयोगकर्ताओं को कुछ और दिन प्रतीक्षा करनी होगी।
| संबंधित माध्यम | 4 सितंबर को पहुँच |
|---|---|
| OpenAI API | बिना प्रतिबंध उपलब्ध |
| ChatGPT Work और Codex, Pro | उपलब्ध |
| Enterprise और Business Premium | उपलब्ध |
| Plus और अन्य Business | कुछ दिनों की देरी |
GitHub Copilot में सामान्य उपलब्धता, पहले दिन से सार्वजनिक दर पर
उसी दिन GPT-6 Astra GitHub Copilot में सामान्य रूप से उपलब्ध हो गया। GitHub ने मॉडल के स्कोर के बजाय उसकी कार्यपद्धति पर ज़ोर दिया है: उसके आंतरिक परीक्षणों में Astra निष्पादन के दौरान योजना बनाता और सत्यापन करता है, निदान को सत्यापन के साथ जोड़ता है और किसी कार्य को पूर्ण घोषित करने से पहले अपने परिणामों की स्वयं पुष्टि करता है। इससे वह पिछले OpenAI मॉडलों की तुलना में कम चरणों के साथ लंबे कार्यों पर बेहतर प्रदर्शन करता है। घोषणा के साथ कोई बेंचमार्क आँकड़ा नहीं दिया गया।
यह मॉडल Visual Studio Code से लेकर JetBrains IDE, Copilot CLI, GitHub Mobile, Xcode और Eclipse सहित दस माध्यमों पर दिखाई देता है, लेकिन केवल Pro+, Max, Business और Enterprise योजनाओं के लिए उपलब्ध है। Copilot Pro को इसमें शामिल नहीं किया गया है। बिलिंग का पहलू ध्यान देने योग्य है: उपयोग के अनुसार भुगतान में Astra पर प्रदाता की सार्वजनिक दर पहले दिन से लागू होती है और कोई प्रचार अवधि नहीं है, जबकि एक दिन पहले आए Gemini 3.8 Flash को 31 दिसंबर 2026 तक प्रारंभिक मूल्य निर्धारण का लाभ मिलता है।
Perplexity ने इसे WANDR पर अपना सर्वोच्च स्कोर दिया
Perplexity ने 3 सितंबर को रात 11 बजकर 10 मिनट पर बड़े पैमाने के दस्तावेज़-आधारित शोध के अपने आंतरिक परीक्षण WANDR पर Astra का परिणाम प्रकाशित किया। मॉडल को प्रति कार्य 11.98 डॉलर की लागत पर 0.682 अंक मिले, जो कंपनी द्वारा जाँचे गए सभी मॉडलों में सर्वोच्च स्कोर है।
| मूल्यांकित मॉडल | WANDR स्कोर | प्रति कार्य लागत | माप प्रकाशित होने की तिथि |
|---|---|---|---|
| GPT-6 Astra | 0.682 | 11.98 डॉलर | 3 सितंबर 2026 |
| Claude Fable 5.1 | 0.601 | 12.76 डॉलर | 1 सितंबर 2026 |
Perplexity ने दो सापेक्ष अंतर भी बताए: Claude Fable 5.1 की तुलना में 6.1 प्रतिशत कम लागत पर 13.5 प्रतिशत अधिक स्कोर और Opus 5 की तुलना में 3.3 प्रतिशत अधिक लागत पर 27.0 प्रतिशत अधिक स्कोर। यहाँ दो सावधानियाँ आवश्यक हैं। WANDR एक स्वामित्व वाला परीक्षण है जिसकी विस्तृत कार्यप्रणाली प्रकाशित नहीं की गई है, और Perplexity उन मॉडलों की ग्राहक भी है जिन्हें वह क्रमबद्ध करती है। Opus 5 के लिए कोई निरपेक्ष मान साझा नहीं किया गया।
Codex CLI के तीन सुधारों ने एकीकरण पूरा किया
कमांड लाइन के स्तर पर, 3 सितंबर की रात जारी संस्करण 0.153.0 के बाद दो दिनों से भी कम समय में तीन सुधार आए, जो सभी Astra को समर्पित थे। संस्करण 0.153.1 डिफ़ॉल्ट मॉडल बदले बिना और उसे चयनकर्ता में दिखाए बिना API के माध्यम से मॉडल को कॉन्फ़िगर करने की सुविधा देता है। संस्करण 0.153.2 ने एक लेबल सुधारा: Fast स्तर को 1.5 गुना नहीं बल्कि 2 गुना गति देने वाला बताया गया है, जबकि अनुरोधों को संसाधित करने का तरीका नहीं बदला। 4 सितंबर को रात 9 बजकर 1 मिनट पर जारी संस्करण 0.153.3 ने Mantle और Runtime मार्गों के लिए Amazon Bedrock मॉडल चयनकर्ता में Astra जोड़ा और असमकालिक स्पष्टीकरण प्रश्नों के लिए मॉडल को दिए जाने वाले निर्देश को सुधारा।
OpenAI ने दिन का समापन तीन अनुभव-विवरणों से किया: डेवलपर ब्लॉग पर दो लेख, जिनमें से एक Codex में बनाए गए प्रक्रियात्मक अंतरिक्ष-अन्वेषण गेम पर और दूसरा Blender तथा Unreal Engine 5 में खोजे जा सकने वाले घर की रचना पर था, साथ ही Dominik Kundel का एक लेख जिसमें Codex के उपयोग की उनकी पद्धति में आए पाँच बदलाव बताए गए।
🔗 Codex CLI 0.153.3 के रिलीज़ नोट्स · 🔗 Astra के साथ गेम बनाना
Claude ने फ़र्मा के अंतिम प्रमेय का पहला औपचारिक प्रमाण प्रस्तुत किया
4 सितंबर — Anthropic ने कंप्यूटर द्वारा पूरी तरह सत्यापित फ़र्मा के अंतिम प्रमेय का पहला प्रमाण प्रकाशित किया। Claude ने इसे Lean में लिखने के लिए ग्यारह दिन तक, अधिकांशतः स्वायत्त रूप से, काम किया। कंपनी इसे अब तक बनाया गया सबसे बड़ा Lean प्रमाण बताती है।
| मापी गई कसौटी | दर्ज मान |
|---|---|
| Claude के कार्य की अवधि | 11 दिन |
| लिखी गई Lean पंक्तियाँ | 13 मिलियन |
| सिद्ध किए गए मध्यवर्ती प्रमेय | 29,500 |
| Wiles द्वारा पहला मानवीय प्रमाण | 1995, 129 पृष्ठ |
| अनुमान और उसके प्रमाण के बीच अंतराल | 350 वर्ष से अधिक |
प्रमेय कहता है कि दो से अधिक घातांक के लिए कोई भी धनात्मक पूर्णांक त्रिक फ़र्मा के समीकरण को संतुष्ट नहीं करता। Pierre de Fermat ने लगभग 1637 में इसे Diophantus की Arithmetica की अपनी प्रति के हाशिये पर लिख दिया था। पहला सही प्रमाण 1995 में Sir Andrew Wiles ने दिया: 129 पृष्ठ, कई महीनों का मानवीय सत्यापन, और 1993 में प्रस्तुत पहला संस्करण जिसमें दो महीने बाद एक समीक्षक ने गंभीर त्रुटि उजागर की थी।
आरंभिक प्रयास विफल रहे, क्योंकि एजेंटों को शुरुआत में शीघ्र सफलता मिली, लेकिन बाद में वे दिशा खो बैठे। सफलता Prove2Me से मिली, जो औपचारिकीकरण का एक खुला सहयोगी मंच है और Claude Code पर आधारित बहु-एजेंट ढाँचे के साथ जुड़ा है। यह मंच कथनों का एक निर्देशित अचक्रीय ग्राफ बनाए रखता है, जिसकी सहायता से एजेंट अगला प्रमाण चुनते हैं; Lean संकलन को तेज़ करने के लिए कथनों और प्रमाणों को अलग-अलग फ़ाइलों में रखता है; और खोज तथा पुनः उपयोग संभव बनाने के लिए प्रत्येक कथन का स्वाभाविक भाषा में विवरण सुरक्षित रखता है। निर्मित प्रमाण Henri Darmon, Fred Diamond और Richard Taylor द्वारा प्रस्तुत Wiles के सरलीकृत निरूपण का अनुसरण करता है।
This extraordinary autoformalization achievement, which Anthropic researchers say only took 11 days, proves Fermat’s Last Theorem with no assumptions other than the axioms of mathematics.
🇮🇳 स्वतः औपचारिकीकरण की यह असाधारण उपलब्धि, जिसमें Anthropic के शोधकर्ताओं के अनुसार केवल ग्यारह दिन लगे, गणित के अभिगृहीतों के अतिरिक्त किसी अन्य मान्यता के बिना फ़र्मा के अंतिम प्रमेय को सिद्ध करती है। — परिणाम के समीक्षक Kevin Buzzard, Anthropic के शोध पृष्ठ पर उद्धृत
Anthropic इसे खोज के बजाय सत्यापन की चुनौती के रूप में प्रस्तुत करता है, जो रीमान परिकल्पना पर AI द्वारा किए गए हालिया कार्य से अलग है, जहाँ नया गणित विकसित किया गया था। जैसे-जैसे प्रमाणों की मात्रा बढ़ती है, सहकर्मी समीक्षा वर्षों में मापी जाने वाली बाधा बन जाती है।
Project HydraFusion में GitHub ने मॉडल का चुनाव डेवलपर के बजाय उपकरण को सौंपा
4 सितंबर — GitHub ने शोध पूर्वावलोकन के रूप में Project HydraFusion उपलब्ध कराया है, जो अब किसी मॉडल के बजाय एक कार्यप्रवाह निर्धारित करता है। जहाँ Copilot का चयनकर्ता बीस से अधिक मॉडलों में से चुनने को कहता था, वहीं HydraFusion प्रत्येक अनुरोध के लिए स्वयं तय करता है कि कौन-सा मॉडल कार्य संभालेगा और किस निष्पादन योजना के अनुसार। इसे किसी भी मॉडल की तरह चुना जाता है, लेकिन इस एक चयन के पीछे यह कई मॉडलों का संयोजन करता है।
फिलहाल तीन योजनाएँ उपलब्ध हैं। Single मोड कार्य को एक ही मॉडल को सौंपता है। Cascade मोड में एक कुशल मॉडल पहला समाधान लिखता है, फिर गुणवत्ता-द्वार तय करता है कि उसे स्वीकार किया जाए या अधिक सक्षम मॉडल को सौंपा जाए। Critique मोड किसी दूसरे मॉडल परिवार से आए स्वतंत्र, केवल पढ़ने वाले समीक्षक से प्रारूप की समीक्षा कराता है।
| मूल्यांकित बेंचमार्क | Opus 5 की तुलना में लागत-अंतर | Opus 5 की तुलना में गुणवत्ता-अंतर |
|---|---|---|
| TerminalBench 2.1 | 67 प्रतिशत कम | 4.9 अंक अधिक |
| DeepSWE | 36 प्रतिशत कम | 1.5 अंक कम |
| CheckpointBench | 65 प्रतिशत कम | 0.1 अंक कम |
निष्पादन पाँच अभियांत्रिकी सिद्धांतों से नियंत्रित होता है: प्रत्येक चरण की लागत का समेकित लेखांकन, स्पष्ट समय-सीमा और निरस्तीकरण, अलग संदर्भ में और बिना उपकरणों के समीक्षा, अंतर्निहित सुरक्षा वाला अनुप्रयोग जो कार्यप्रवाह विफल होने पर कोई सुधार लागू नहीं करता, और निष्पादन से पहले मार्ग-निर्धारण का सत्यापन। GitHub ने इंटरफ़ेस के स्तर पर एक समझौता स्वीकार किया है: चरण दिखाए जाते हैं, लेकिन अंतिम परिणाम आने तक मध्यवर्ती प्रारूप रोके रखे जाते हैं। कंपनी मानती है कि पर्याप्त दृश्यता के बिना प्रतीक्षा करना एक वास्तविक असुविधा है।
विकास संबंधी दस्तावेज़ असामान्य रूप से स्पष्ट हैं: GitHub ने TerminalBench 2.1 को परीक्षण-चक्रों का सबसे पूर्ण क्रम माना, बताया कि प्रगति रैखिक नहीं थी और स्वीकार किया कि मूल्यांकन ढाँचे की दो परिचालन विफलताओं के कारण 11 से 25 अगस्त के बीच अमान्य परीक्षण-चक्र बने। इन परीक्षण-चक्रों को रुझान से बाहर कर दिया गया और बाद में सुधार लिया गया। कंपनी दर्ज श्रृंखला के सर्वोत्तम परिचालन बिंदुओं को 25 अगस्त का बताती है। सभी योजनाओं में Copilot CLI के माध्यम से पहुँच मिलती है और कार्यप्रवाह के कुल tokens पर आधारित मानक दर लागू होती है; इसके लिए पहले /update और फिर /experimental on का उपयोग किया जाता है।
Lyria 3.5 Gemini एप्लिकेशन और API में आया
4 सितंबर — Google ने Lyria 3.5 जारी किया है, जिसे वह अधिक अभिव्यंजक आवाज़ों और अधिक समृद्ध संयोजनों के साथ अब तक का अपना सर्वोत्तम ध्वनि-पुनरुत्पादन वाला संगीत-निर्माण मॉडल बताता है।
Gemini एप्लिकेशन में यह अद्यतन इंटरफ़ेस के तीन बदलावों के साथ आया है। उपयोगकर्ता अपनी संगीत शैली चुन या उसका वर्णन कर सकता है और गायनयुक्त अथवा वाद्य प्रस्तुति में से चयन कर सकता है। पृष्ठभूमि संगीत हो या व्यक्तिगत जन्मदिन गीत, नए उपयोग-के-लिए-तैयार नमूने (templates) आरंभिक बिंदु का काम करते हैं। गीत की अवधि अब छोटे से लंबे प्रारूप के बीच निर्धारित की जा सकती है।
| माध्यम का प्रकार | Lyria 3.5 तक पहुँच |
|---|---|
| आम जनता | Gemini वेब और मोबाइल एप्लिकेशन, विश्वभर में |
| पेशेवर निर्माण | Google Flow Music |
| डेवलपर | Gemini API, Google AI Studio, Google Vids |
Google के अनुसार इसका अपेक्षित उपयोग पेशेवर निर्माण के बजाय रोज़मर्रा की आवश्यकताओं के लिए है: किसी वीडियो के लिए संगत संगीत, ब्रांड जिंगल या व्यक्तिगत रिंगटोन। वितरण व्यापक है और किसी सदस्यता प्रतिबंध का उल्लेख नहीं किया गया है। हालाँकि, लेख में ऑडियो गुणवत्ता का कोई आँकड़ा, Lyria के पिछले संस्करण से कोई तुलना या API पहुँच की कोई कीमत नहीं दी गई है।
SpaceXAI ने कंपनियों में Grok को काम पर लगाया और अपने खरीद एजेंट का सिस्टम प्रॉम्प्ट प्रकाशित किया
3 और 4 सितंबर — SpaceXAI ने कंपनियों के लिए Grok Bot उपलब्ध कराया है। 12 अगस्त को लॉन्च हुआ यह उत्पाद व्यक्तिगत सदस्यों और Cursor टीमों के लिए बनी पेशकश से आगे बढ़कर अब पहुँच, नेटवर्क और ऑडिट नियंत्रणों से युक्त संस्करण बन गया है। प्रत्येक उपयोगकर्ता का कार्य अलग वातावरण में निष्पादित होता है और किसी Bot के पास डिफ़ॉल्ट रूप से कोई पहुँच नहीं होती: वह केवल उन्हीं खातों तक पहुँचता है जिनसे उसे स्पष्ट रूप से जोड़ा जाता है। Grok Enterprise और Cursor Enterprise के ग्राहकों को यह दो सप्ताह तक निःशुल्क मिलता है और वे अपने पूरे संगठन को आमंत्रित कर सकते हैं, जिनमें वे लोग भी शामिल हैं जिनके पास पहले से कोई लाइसेंस नहीं है। SpaceXAI ने Legora, Supermicro और ServiceTitan का उल्लेख किया और दावा किया कि लॉन्च के बाद से हज़ारों संगठनों ने इस उत्पाद को अपनाया है।
घोषणा का सबसे रोचक बिंदु यह है कि इसका सबसे गहन उपयोग अभियांत्रिकी से बाहर हो रहा है: भर्ती में रातभर संभावित उम्मीदवार खोजना और मूल्यांकन सारणियाँ बनाना, बिक्री में ईमेल प्रारूप और प्रस्तुतियाँ अद्यतन करना, तथा विपणन में वेबिनार से प्रश्नोत्तर निकालना।
अगले दिन कंपनी ने अपने ही खरीद कार्यों पर लगाए गए एक Bot का प्रकरण-अध्ययन प्रकाशित किया। Haggle Bot नामक यह एजेंट Slack, Notion, Drive, Gmail, Hex और Ramp से जुड़ा था और इसने 100,000 डॉलर से अधिक की प्रत्यक्ष बचत का दावा किया।
| एजेंट की खोज | पहचानी गई राशि |
|---|---|
| कुल प्रत्यक्ष बचत | 100,000 डॉलर से अधिक |
| 90 दिनों से निष्क्रिय लाइसेंस, पहला उत्पाद | 43 लाइसेंस, 14,220 डॉलर |
| अप्रयुक्त संदर्भ, मासिक उत्पाद | प्रति वर्ष 85,662 डॉलर |
इस लेख का संपादकीय महत्व इन आँकड़ों से आगे जाता है: SpaceXAI ने एजेंट के सिस्टम प्रॉम्प्ट का साँचा प्रकाशित किया है, जिसे अपने संगठन के लिए भरने योग्य नमूने के रूप में प्रस्तुत किया गया है और उदाहरण मान कोणीय कोष्ठकों में दिए गए हैं। उसका अनुमतियाँ अनुभाग तीन स्थायी व्यवस्थाओं में अंतर करता है। पहली व्यवस्था में कभी सहमति नहीं माँगी जाती, जिसके उदाहरणों में व्यय डेटा पढ़ना और सहकर्मियों को संदेश भेजना शामिल है। दूसरी व्यवस्था में हर बार संचालक की स्पष्ट स्वीकृति आवश्यक होती है और किसी आपूर्तिकर्ता को कुछ भी भेजना इसका उदाहरण है। तीसरी व्यवस्था हर परिस्थिति में निषिद्ध रहती है; दिए गए उदाहरणों में हस्ताक्षर करना, खरीदना, सदस्यता लेना, खर्च को स्वीकृति देना और कोई भी बाध्यकारी प्रतिबद्धता करना शामिल है। लेख में स्पष्ट किया गया है कि टीम ने एजेंट को आंतरिक शोध और समन्वय स्वयं करने दिया, लेकिन धन खर्च करने, शर्तें स्वीकार करने या किसी आपूर्तिकर्ता को लिखने के लिए स्पष्ट स्वीकृति अनिवार्य रखी।
🔗 कंपनियों के लिए Grok Bot · 🔗 खरीद कार्यों पर लगाया गया Haggle Bot
Grok अब Plaid के माध्यम से अमेरिकी बैंक खातों से जुड़ता है
4 सितंबर — Grok अब अपने उपयोगकर्ताओं के वित्तीय खातों से जुड़ सकता है। यह संपर्क Plaid के माध्यम से होता है, जो संयुक्त राज्य अमेरिका में ऐप्लिकेशनों और बैंकिंग संस्थानों को जोड़ने वाला तकनीकी मध्यस्थ है, और यह सुविधा फिलहाल केवल इसी देश में तुरंत उपलब्ध है।
SpaceXAI द्वारा चुने गए तीन उदाहरण लक्षित दायरे को स्पष्ट करते हैं: यह जानना कि पिछले महीने का पैसा कहाँ खर्च हुआ, अपने निवेशों के प्रदर्शन पर नज़र रखना, और यह जाँचना कि क्या व्यक्ति वास्तव में अपने कार्ट में मौजूद सामान खरीद सकता है। दूसरे शब्दों में, पिछले खर्चों का विश्लेषण, पोर्टफ़ोलियो की निगरानी और खरीदारी का निर्णय लेते समय सहायता। घोषणा संक्षिप्त है और सुरक्षित संपर्क के उल्लेख के अतिरिक्त डेटा के प्रसंस्करण या समर्थित संस्थानों के बारे में कुछ नहीं बताती।
यह 25 जून को Interactive Brokers के साथ शुरू हुई वित्तीय एकीकरणों की शृंखला को आगे बढ़ाता है, लेकिन इसकी प्रकृति अलग है: जहाँ Interactive Brokers सक्रिय निवेशकों पर केंद्रित था, वहीं Plaid सहायक को आम जनता के चालू खातों तक पहुँच प्रदान करता है।
Claude Code 2.1.260 और 2.1.261: diff पैनल, skills का ऑडिट और अधिक कठोर permissions
4 सितंबर — Claude Code के दो संस्करण एक ही दिन जारी हुए, और वे एक-दूसरे के पूरक हैं: पहला चल रहे काम की दृश्यता प्रदान करता है, जबकि दूसरा यह दिखाता है कि सत्र किन संसाधनों का उपयोग कर रहा है।
| प्रकाशित संस्करण | जारी होने का समय | प्रमुख योगदान |
|---|---|---|
| 2.1.260 | 4 सितंबर 01h48 | /diff पैनल, /cost में cache निदान, permissions संबंधी सुधार |
| 2.1.261 | 4 सितंबर 21h58 | /skill-doctor, 128 000 वर्णों तक का output, फ़ाइल में sub-agent prompt |
2.1.260 पूर्ण-स्क्रीन मोड में बातचीत के बगल में एक diff पैनल खोलता है, जो संपादन के दौरान commit न किए गए बदलाव दिखाता है। यह विशेष रूप से permissions के मूल्यांकन से जुड़ी कई खामियों को ठीक करता है: Edit, Write और Read नियम, जिनके path में कोष्ठक थे, अमान्य मानकर अस्वीकार कर दिए जाते थे या Bash sandbox द्वारा अनदेखे कर दिए जाते थे, जिससे केवल-पठन के लिए निर्धारित फ़ोल्डरों में लिखना संभव रहता था; और ऐसे zsh command, जो REPORTTIME assignment में command substitution छिपाते थे, स्वतः स्वीकृत हो जाते थे।
2.1.261 में /skill-doctor जोड़ा गया है, जो load किए गए लेकिन अप्रयुक्त रहे skills और प्रत्येक की context लागत की सूची देता है। इसका auto mode अब ऐसे link को किसी third-party site पर भेजा गया डेटा मानता है, जो किसी सार्वजनिक diagram generator के URL में सामग्री समाहित करता है।
🔗 संस्करण 2.1.260 के release notes · 🔗 संस्करण 2.1.261 के release notes
ant apply command Managed Agents को versioned files में बदलता है
4 सितंबर — Anthropic ने अपने ant CLI में ant apply जोड़ा है। यह command Managed Agents पर infrastructure teams के परिचित declarative model को लागू करता है: repository की files में वांछित state का वर्णन किया जाता है, और command API resources को इस विवरण के अनुरूप बनाता है।
इसमें पाँच प्रकार के resources शामिल हैं: Managed Agent environments, स्वयं agents, skills, memory stores (memory stores) और deployments। अब तक ये objects API calls या console के माध्यम से बनाए जाते थे और repository में उनका कोई रिकॉर्ड नहीं रहता था। Files में उनका वर्णन करने से वे code review, versioning और continuous integration pipelines के दायरे में आ जाते हैं। व्यावहारिक लाभ reproducibility है: file में वर्णित agent environment को हूबहू फिर से बनाया जा सकता है, अलग-अलग branches के बीच उसकी तुलना की जा सकती है, या बिना manual intervention के pipeline से deploy किया जा सकता है।
NVIDIA की तिहरी पेशकश: agents की स्थायी memory, Jetson पर reasoning और federated identity
3 और 4 सितंबर — एक ही दिन NVIDIA के technical blog पर stack की तीन अलग-अलग layers से संबंधित तीन प्रकाशन आए।
पहला NemoClaw पर आधारित एक open recipe है: ऐसा chief-of-staff agent जो अपने उपयोगकर्ता के काम की स्थायी memory बनाए रखता है। इसका मूल विचार एक वाक्य में है: उपयोगी agent memory के लिए केवल storage नहीं, बल्कि structure, selective retrieval और governance की आवश्यकता होती है। यह व्यवस्था एक self model (self model) पर आधारित है—संरचित Markdown pages में लिखी ऐसी knowledge layer जिसे मनुष्य पढ़ सकता है—और इसके साथ एक SQLite register है, जो obligations, classifications, corrections और audit events सुरक्षित रखता है। Execution NVIDIA OpenShell के माध्यम से होता है, जो filesystem, processes और network तक पहुँच की policies को sandbox में लागू करता है, जबकि credentials sandbox से बाहर रहते हैं।
| मापी गई metric | Agentic RAG baseline | Self model | दर्ज अंतर |
|---|---|---|---|
| 186 प्रश्नों पर समग्र accuracy | 82,8 प्रतिशत | 90,9 प्रतिशत | 8,1 points अधिक |
| 31 प्रश्नों में कठिन प्रश्न | 67,7 प्रतिशत | 87,1 प्रतिशत | 19,4 points अधिक |
| बदलते तथ्यों की tracking, 5 पर | 60,0 प्रतिशत | 100,0 प्रतिशत | 40,0 points अधिक |
| 13 प्रश्नों पर corpus fidelity | 100,0 प्रतिशत | 92,3 प्रतिशत | 7,7 points कम |
Context can inform an action, but it cannot authorize one.
🇮🇳 संदर्भ किसी कार्रवाई को स्पष्ट कर सकता है, लेकिन उसे अधिकृत नहीं कर सकता। — agents की memory पर NVIDIA का लेख
दूसरा प्रकाशन एक deployment guide है, जो embedded AI में आए बदलाव को रेखांकित करता है: speculative decoding के साथ NVFP4 quantization, Jetson AGX Thor और Orin पर BF16 की तुलना में decoding throughput को 6,28 गुना तक बढ़ाता है। सर्वोत्तम configuration model के अनुसार अलग होती है, और NVIDIA किसी एक सार्वभौमिक विजेता को घोषित करने के बजाय इसी बिंदु पर बल देता है: Nemotron 3.5 Lightning, DSpark के साथ प्रति सेकंड 123 से 138 output tokens के बीच अपना सर्वोत्तम परिणाम देता है, जबकि Qwen3.8-27B, DFlash2 के साथ प्रति सेकंड 27,7 से 34,4 tokens देता है। अंतिम चेतावनी methodology से संबंधित है: throughput workload के अनुसार बदलता है, इसलिए लक्षित application का प्रतिनिधित्व करने वाले prompts के साथ configuration को validate करें। तीसरा, अपेक्षाकृत सीमित प्रकाशन, federated Kubernetes platforms और AI platforms के बीच उपयोगकर्ता identity के propagation का वर्णन करता है।
🔗 Jetson पर frontier reasoning · 🔗 federated platforms के बीच identity
Google के command-line tools: Gemini CLI 0.60.0 series में पहुँचा, Antigravity ने enterprises के लिए Flash खोला
3 और 4 सितंबर — Gemini CLI का nightly channel 0.59.0 series से 0.60.0 में पहुँच गया है, और इस release का मुख्य केंद्र security है। सबसे उल्लेखनीय सुधार chrome-devtools-mcp component से hard-coded Google CrUX API key हटाता है। दो अन्य बदलाव isolation को मजबूत करते हैं: macOS Seatbelt sandbox को एक अलग temporary directory मिलती है, और extension loader अधिक सुरक्षित path resolution के साथ boundary validation लागू करता है। चौथा बदलाव MCP servers के OAuth flow में RFC 9207 के अनुरूप issuer identification अनिवार्य करता है, जो authorization-server substitution attacks से सुरक्षा प्रदान करता है।
एक दिन पहले प्रकाशित Antigravity 2.12.2 में केवल एक improvement है और कोई fix नहीं: enterprise users, application default credentials (Application Default Credentials) से authentication करके Gemini 3.8 Flash reasoning models का उपयोग कर सकते हैं। व्यावहारिक लाभ यह है कि model को individual API key के बिना Google Cloud deployments के standard authentication mode से जोड़ा जा सकता है।
🔗 Gemini CLI v0.60.0 nightly · 🔗 Antigravity changelog
विज्ञान की सेवा में AI: एक coupled climate emulator और नर फल-मक्खी का पूर्ण connectome
3 और 4 सितंबर — दो प्रकाशन machine learning को दो परस्पर असंबंधित disciplines में विशाल scientific objects पर लागू करते हैं।
Ai2 ने Hugging Face Hub पर Apache 2.0 license के तहत SamudrACE-E3SMv3 प्रकाशित किया है, जो पूरी तरह coupled atmosphere-ocean climate emulator है। इस कार्य का उद्देश्य अमेरिकी Department of Energy के reference climate model E3SM के व्यवहार को बहुत कम computational cost पर दोहराना है: E3SM को स्वयं चलाने से पहले hypotheses को filter करना और कम लागत पर climate variability का sampling करने वाले बड़े ensembles बनाना। Atmosphere emulator (ACE) और ocean emulator (Samudra) को पहले अलग-अलग pre-train किया जाता है, फिर couple किया जाता है, और उसके बाद 400 वर्षों के ऐसे E3SM data पर evaluate किया जाता है जिन्हें उन्होंने पहले नहीं देखा था; इन पर औसत climate स्थिर रहता है। Ai2 एक स्पष्ट सीमा बताता है: emulator दैनिक precipitation को 99,99वें percentile तक capture करता है, लेकिन उसके आगे कम अनुमान लगाता है।
दूसरी ओर, HHMI Janelia Research Campus, Google Research और उनके सहयोगियों ने एक वयस्क नर फल-मक्खी के मस्तिष्क और central nervous system का पहला पूर्ण map प्रकाशित किया है: 166 000 से अधिक neurons—एक record—जिन्हें AI की सहायता से वर्गीकृत और human experts द्वारा validated 11 691 cell types में बाँटा गया है। यह method पतली slices की imaging और फिर लाखों two-dimensional images को computer द्वारा three-dimensional neuronal shapes में पुनर्गठित करने पर आधारित है। इसका महत्व पहले प्रकाशित मादा map के साथ तुलना में है: अधिकांश neurons दोनों sexes में समान हैं, एक अल्पसंख्या sex-specific है, और dimorphic कही जाने वाली तीसरी category दोनों में मौजूद है लेकिन अलग-अलग neighboring neurons से जुड़ती है। तीन companion studies इस map को vision, taste और social behavior पर लागू करती हैं।
🔗 X पर SamudrACE-E3SMv3 · 🔗 नर फल-मक्खी के मस्तिष्क का map
Meta ने Muse Spark 1.3 का max reasoning tier सार्वजनिक किया
4 सितंबर — Model की घोषणा के दो दिन बाद Meta ने Muse Spark 1.3 का max reasoning tier सार्वजनिक कर दिया है। यह tier Muse Code और Meta Model API में उपलब्ध है।
इसलिए बदलाव model में नहीं, बल्कि उसके सबसे महँगे reasoning level की वास्तविक उपलब्धता में है। Meta के chief AI officer Alexandr Wang बताते हैं कि coding और agentic tasks में सुधार हुआ है, और उन लोगों को भी model फिर से आज़माने की सलाह देते हैं जिन्होंने पहले high और xhigh tiers का परीक्षण किया था। वे यह भी कहते हैं कि launch security testing पूरी होने के बाद हुआ है। इसे सक्रिय करने के लिए Muse Spark 1.3 चुनना और फिर reasoning level को max पर set करना आवश्यक है।
इस उपलब्धता के साथ कोई benchmark figure नहीं दिया गया है: thread में न कोई score है, न comparison, केवल लेखक का qualitative assessment है।
Percept-Lens, generated images की detection का मूल्यांकन करने के लिए Sakana AI का protocol
3 सितंबर — Sakana AI ने Percept-Lens प्रस्तुत किया है, जो AI-generated images की detection के लिए out-of-distribution evaluation framework है और ECCV 2026 में स्वीकार किया गया है। शुरुआती निष्कर्ष यह है कि synthetic-image detectors तब विफल हो जाते हैं जब कई factors एक साथ बदलते हैं: generator, style या prompt, और source domain। Percept-Lens 39 public datasets, अर्थात 71 लाख images, पर evaluation को एकीकृत करता है।
Representation study एक सीधा प्रश्न उठाती है: क्या classification head की training अब भी उस separation से आगे कोई लाभ देती है जो modern encoders पहले से करते हैं? लेखक prior-conditioned Gaussian discriminants की एक scale बनाते हैं, अर्थात features के first- और second-order statistics पर आधारित closed-form heads। इस scale का सर्वोत्तम स्तर अक्सर प्रकाशित detection heads की बराबरी करता है और कभी-कभी उनसे आगे निकल जाता है, बशर्ते तुलना समान prior और encoder के साथ की जाए। लेखक prior, encoder और head की triplet के स्तर पर reporting की वकालत करते हैं।
🔗 Sakana AI का लेख · 🔗 arXiv paper
TAOT, network topology को ध्यान में रखने वाला expert-replica placement
4 सितंबर — Baidu की Baige team ने TAOT का विवरण दिया है, जो mixture-of-experts models की training के लिए expert replicas को रखने की method है और उसके open-source framework LoongForge में उपलब्ध है।
समस्या ठोस है। जब MoE training धीमी होती है, तो कारण प्रायः GPU power नहीं, बल्कि समय पर load को rebalance न कर पाना होता है: कुछ experts hotspots बन जाते हैं और अन्य सभी ranks प्रतीक्षा करते हैं। सामान्य उपाय किसी hot expert के weights को अस्थायी रूप से किसी inactive rank पर replicate करना है, लेकिन जैसे ही parallelism domain एक node से आगे बढ़ता है, सभी inactive GPUs समान नहीं रहते: intra-node communication NVLink के माध्यम से होता है, cross-node communication InfiniBand से, और लागत में दस गुना तक अंतर हो सकता है।
| मापी गई metric | दर्ज value |
|---|---|
| प्रति iteration समय, पहले और बाद में | 155,4 ms, फिर 108,8 ms, अर्थात 1,43x |
| EP4 से EP16 तक acceleration | 1,79x तक |
| LPLB की तुलना में communication cost | EP32 पर 74 प्रतिशत तक कम |
| online scheduling overhead | forward pass समय के 1 प्रतिशत से कम |
TAOT को ऐसी पहली method के रूप में प्रस्तुत किया गया है जो peak clipping के लाभ और nodes के बीच weights स्थानांतरित करने की लागत को एक ही objective function में शामिल करती है। जहाँ DeepSeek का LPLB predefined graphs के माध्यम से paths को सीमित करता है, वहीं TAOT एक continuous communication-cost matrix के साथ flexible topological preference का उपयोग करता है: intra-node को प्राथमिकता दी जाती है, जबकि cross-node वैध रहता है लेकिन अधिक महँगा होता है। Row-wise matching से column-wise matching पर जाने से residual imbalance 7 से 10 प्रतिशत से घटकर 1 से 2 प्रतिशत रह जाता है।
Open Yap 1K, commercial use के लिए मुक्त एक हज़ार घंटे की full-duplex conversation
3 सितंबर — The Agentic Data Company ने Open Yap 1K प्रकाशित किया है, जो दो अलग-अलग channels में English conversation का corpus है और full-duplex voice models के लिए बनाया गया है।
| corpus का घटक | public sample | पूर्ण corpus |
|---|---|---|
| कुल अवधि | 8,9 घंटे | 1 000 घंटे |
| conversations | 16 | 1 602 |
| लागू license | CC BY 4.0 | Open Yap, commercial use के लिए मुक्त |
| access mode | Hugging Face Hub | अनुरोध पर |
लेखक corpus को स्पष्ट रूप से Fisher, Switchboard और CANDOR जैसे मौजूदा speech corpora के विकल्प के रूप में प्रस्तुत करते हैं, और उनका मुख्य तर्क technical है: blog post में telephone bandwidth पर 8 kHz में sampled Fisher English excerpt की तुलना Open Yap 1K excerpt से की गई है, ताकि audio quality का अंतर दिखाया जा सके। Collection method, speaker demographics, quality assurance, consent और privacy का documentation उपलब्ध है।
अधिक अमेरिकी Gemini उपयोगकर्ताओं के लिए Daily Brief मुफ़्त हुआ
4 सितंबर — Google अमेरिका में Gemini ऐप के अधिक उपयोगकर्ताओं के लिए Daily Brief की मुफ़्त पहुँच का विस्तार कर रहा है। यह सुविधा 21 मई को पेश की गई थी।
Daily Brief पृष्ठभूमि में काम करता है और उपयोगकर्ता के Google ऐप्स को आपस में जोड़ता है: ईमेल, कैलेंडर, बातचीत और रुचियों को कार्यों और प्राथमिकताओं की एकल, आसानी से देखी जा सकने वाली सूची में संक्षिप्त किया जाता है, जिसे दिन की शुरुआत के बिंदु के रूप में प्रस्तुत किया जाता है। घोषणा अभी अमेरिका तक सीमित है और न तो संबंधित उपयोगकर्ताओं का प्रतिशत बताती है, न ही अंतरराष्ट्रीय विस्तार की समय-सारणी।
Runway ने दो से नौ सीट वाली टीमों के लिए स्व-सेवा प्लान Team पेश किया
4 सितंबर — Runway ने Team लॉन्च किया है, जो व्यक्तिगत प्लानों और बड़े ग्राहकों के लिए आरक्षित Enterprise पेशकश के बीच की कमी को पूरा करता है। यह बदलाव उत्पाद-सूची की संरचना के लिए अहम है: Standard, Pro और Max अब स्पष्ट रूप से व्यक्तिगत प्लान बन गए हैं, और अब हर नया सदस्य Team के माध्यम से जुड़ेगा, जबकि मौजूदा वर्कस्पेस अपनी पहुँच और कीमत बनाए रखेंगे।
| प्लान की विशेषता | घोषित मूल्य |
|---|---|
| प्रति सीट मासिक कीमत | 69 डॉलर |
| प्रति सीट वार्षिक कीमत | 55 डॉलर, यानी 20 प्रतिशत की छूट |
| अनुमत सीटों की संख्या | 2 से 9 |
| प्रति सीट मासिक क्रेडिट | 6 900, साझा पूल में जमा |
| साझा प्रोजेक्ट और स्टोरेज | अधिकतम 100 प्रोजेक्ट, 1 TB |
यह प्लान साझा प्रोजेक्टों के इर्द-गिर्द व्यवस्थित है, जिनमें एसेट, रेफ़रेंस, Brand Kits, सेशन और workflows रखे जाते हैं। Runway आउटपुट की एकरूपता के आधार पर इसका समर्थन करता है: जब पूरी टीम समान रेफ़रेंस से सामग्री बनाती है, तो दसवाँ वीडियो पहले वीडियो जैसा दिखता है। इस्तेमाल न हुए क्रेडिट एक महीने के लिए आगे बढ़ जाते हैं, एक टीम अधिकतम 20 एजेंट कौशल साझा करती है, और Agent Connectors Figma, Dropbox तथा Notion को क्रिएटिव एजेंट से जोड़ते हैं।
ElevenLabs ने अपनी 1 Million Voices पहल का ब्राज़ील तक विस्तार किया
4 सितंबर — ElevenLabs अपने प्रभाव कार्यक्रम को ब्राज़ील ले गया है और इसे ब्राज़ील की पहली कहानी के माध्यम से प्रस्तुत कर रहा है। Eliane ने बचपन में अपनी आवाज़ खो दी थी और Alberto 46 वर्ष की उम्र में दृष्टिहीन हो गए थे; कंपनी ने Eliane को ऐसी आवाज़ दी जो उनके परिवार की आवाज़ से मिलती-जुलती है, जिससे वह पहली बार उस व्यक्ति से अपनी पहचान वाली आवाज़ में संवाद कर सकीं, जिससे वह प्रेम करती हैं।
इस घोषणा के साथ दो स्थानीय साझेदारियाँ भी हुई हैं। देश में एमियोट्रोफ़िक लैटरल स्क्लेरोसिस से पीड़ित अधिकतम 10 000 लोगों की सेवा करने वाली Associação Brasileira de Esclerose Lateral Amiotrófica इन रोगियों को अपनी आवाज़ क्लोन करने के लिए मुफ़्त पहुँच उपलब्ध कराती है। दूसरी ओर, Sociedade Brasileira de Fonoaudiologia ब्राज़ील के स्पीच थेरेपिस्टों को वॉइस क्लोनिंग का प्रशिक्षण देगी; कंपनी लाभान्वित होने वाले रोगियों की संख्या बढ़ाने के लिए चिकित्सकों की दक्षता पर भरोसा कर रही है। 1 Million Voices पहल एक अरब डॉलर की वस्तु-रूप प्रतिबद्धता है, जो लॉन्च के बाद से दुनिया भर में 11 000 से अधिक लोगों तक पहुँच चुकी है।
Kimi Code 0.41.0 ने multi-agent मोड जोड़ा और दो दिन पुराना सुरक्षा-उपाय हटाया
4 सितंबर — Moonshot AI ने Kimi Code 0.41.0 जारी किया है। प्रमुख नई सुविधा tower है, जो वेब इंटरफ़ेस में प्रयोगात्मक multi-agent सहयोग मोड है। इसे /tower कमांड या कंपोज़र के प्लस मेनू से चालू किया जाता है और यह आर्ग्युमेंट के रूप में एक बेस ब्रांच स्वीकार करता है। कॉन्टेक्स्ट प्रबंधन में दो बदलाव किए गए हैं: स्वचालित कॉम्पैक्शन से पहले मॉडल को उसके कॉन्टेक्स्ट बजट की सूचना दी जाती है, फिर सटीक विवरण खोजने के लिए उसे सेशन के इवेंट लॉग की ओर भेजा जाता है। टर्न स्तर की फ़ाइल हिस्ट्री अब स्थायी हो गई है।
सबसे उल्लेखनीय बिंदु एक कदम पीछे हटना है। 2 सितंबर को जारी संस्करण 0.40.0 ने स्वचालित अनुमति मोड में shutdown, reboot या rm -rf जैसी विनाशकारी कमांड को ब्लॉक करना शुरू किया था। 0.41.0 इस निर्णय को पलटता है और उसी मोड में खतरनाक कमांड के साथ-साथ उन कमांड को भी ब्लॉक करना बंद कर देता है जिनका स्थिर रूप से विश्लेषण नहीं किया जा सकता। यह सुरक्षा-उपाय केवल दो दिन चला। रिलीज़ नोट्स में कारण स्पष्ट नहीं किया गया है, लेकिन shell कमांड का स्थिर विश्लेषण आसानी से ऐसे ग़लत सकारात्मक परिणाम देता है जो वैध काम को रोक देते हैं।
🔗 Kimi Code 0.41.0 के रिलीज़ नोट्स
Perplexity ने अपने embeddings उपलब्ध कराने वाले घरेलू स्टैक Ivy, Tulip और ROSE का विवरण दिया
4 सितंबर — Perplexity ने एक इंजीनियरिंग लेख प्रकाशित किया है, जो उसके embedding और ranking मॉडलों को उपलब्ध कराने वाली अवसंरचना के भीतर झाँकने देता है। कंपनी pplx-embed सहित अपने मॉडल स्वयं प्रशिक्षित और उपलब्ध कराती है तथा अपने सर्च इंडेक्स को exabyte स्तर का बताती है।
| स्टैक घटक | प्रयुक्त भाषा | सेवा में भूमिका |
|---|---|---|
| Ivy | Rust | HTTP गेटवे, tokenization, विभाजन और बैच वितरण |
| Tulip | Rust, tokio, tonic | gRPC inference सर्वर, scheduling और batching |
| ROSE | Python | मॉडल निष्पादन, CUDA kernels और graphs |
मुख्य विचार LLM के inference कोड का पुनः उपयोग है। Perplexity का कहना है कि batch embedding गणना-सीमित prefill चरण जैसा होता है, जबकि किसी छोटी क्वेरी का online embedding मेमोरी-सीमित decode चरण जैसा होता है। इसलिए समान kernels pplx-embed और Qwen3.5 decoding, दोनों के लिए इस्तेमाल किए जाते हैं; embeddings के लिए कोई key-value cache इंस्टैंशिएट नहीं किया जाता और अनियमित ragged इनपुट स्वीकार करने वाले attention variants अनावश्यक padding से बचाते हैं। attention kernels के लिए टीम किसी एक को चुनने के बजाय FlashInfer 2, FlashInfer 3 और FlashAttention 4 को समानांतर बनाए रखती है; चयन हर मामले में heads की संख्या और dimension के अनुसार किया जाता है। मापों की तुलना vLLM v0.22.0 से की गई है, लेकिन उनके संख्यात्मक परिणाम केवल ग्राफ़ों में दिए गए हैं।
🔗 Perplexity का इंजीनियरिंग लेख
Zed और Replit ने X पर घोषणा की, लेकिन कोई लेख या रिलीज़ नोट्स नहीं दिए
4 सितंबर — तीसरे पक्ष के coding tools से जुड़ी दो घोषणाएँ एक ही दिन आईं और दोनों केवल एक X पोस्ट पर आधारित हैं; उनके समर्थन में न कोई ब्लॉग लेख है, न रिलीज़ नोट्स।
Zed ने 2 सितंबर की एक उपयोगकर्ता माँग के उत्तर में बताया कि Windows पर बीटा के लिए पंजीकृत लोगों को अब Delta उपलब्ध है। यह अंतर महत्वपूर्ण है: Delta 12 अगस्त को लॉन्च किया गया एजेंटों वाला multiplayer coding environment है, जिसमें टीम के कई सदस्य किसी साझा प्रोजेक्ट पर एजेंटों के साथ काम कर सकते हैं। दूसरी ओर, Zed editor पहले से macOS, Linux और Windows के लिए वितरित किया जा रहा है। इसलिए घोषणा editor के बारे में नहीं, बल्कि Delta के बारे में है, जिसकी Windows उपलब्धता अगस्त से लंबित थी। इस बीटा का सटीक दायरा और पंजीकरण की शर्तें अज्ञात हैं।
दूसरी ओर, Replit ने « Replit MCP: कहीं से भी अपने एजेंट को निर्देशित करें » शीर्षक वाला एक घंटे और 58 मिनट का लाइव सेशन प्रसारित किया। शीर्षक ऐसे MCP सर्वर की घोषणा करता है जो प्लेटफ़ॉर्म के एजेंट को protocol-compatible clients के सामने उपलब्ध कराता है; इसका लक्षित उपयोग वेब इंटरफ़ेस से गुज़रे बिना किसी editor, terminal या तीसरे पक्ष के assistant से कार्य शुरू करना और उसकी प्रगति पर नज़र रखना है। संदेश में इस शीर्षक के अलावा कोई अन्य पाठ, किसी लेख का लिंक या लॉन्च की स्पष्ट घोषणा नहीं है।
🔗 Windows पर Delta · 🔗 Replit MCP लाइव
संक्षिप्त समाचार
- एक API endpoint उपयोगकर्ताओं को उजागर किए बिना stars की हिस्ट्री लौटाता है — GitHub का REST API इस वर्ष की शुरुआत में केवल administrators के लिए आरक्षित listing endpoints के स्थान पर, stars देने वाले accounts की पहचान बताए बिना timestamp वाले star counts लौटाता है। 🔗 बदलाव-सूची
- npm प्रति package कई trusted publishing configurations स्वीकार करता है — सामान्य उपलब्धता में तीन बदलाव: प्रति package कई additive OIDC configurations, antimalware analysis चलने तक approval को रोकना और versions tab में pre-production history दिखाना। 🔗 बदलाव-सूची
- GitHub Actions ने runners के deprecation का API जोड़ा — REST API किसी runner version के support समाप्त होने की तारीखें देता है,
vulnerability-alertspermission Dependabot alerts को केवल पढ़ने के लिए खोलती है औरjobcontext की चार properties reusable workflows को उनकी मूल पहचान देती हैं। 🔗 बदलाव-सूची - The Story of VS Code वृत्तचित्र 4 सितंबर को जारी हुआ — GitHub ने 1 सितंबर को जारी trailer के बाद, publisher के YouTube channel पर Visual Studio Code के आधिकारिक वृत्तचित्र का प्रसारण साझा किया। 🔗 घोषणा
- Replit ने एक सप्ताह में बनाए गए application को प्रमुखता दी — Cédric Roberge द्वारा प्लेटफ़ॉर्म पर लगभग एक सप्ताह में बनाया गया Pep AI, Replit के अनुसार प्रति माह लगभग 130 000 डॉलर कमाता है; यह दावा pricing संबंधी सलाह के साथ एक प्रचारात्मक thread में किया गया। 🔗 Replit thread
- Zed ने एक दृश्य घोषणा प्रकाशित की जिसकी सामग्री सत्यापित नहीं की जा सकी — 4 सितंबर को रात 22:14 बजे प्रकाशित चार शब्दों का संदेश, जिसके साथ केवल एक image थी। scan के दौरान image load नहीं हुई और पोस्ट के साथ कोई लेख या रिलीज़ नोट्स नहीं हैं: यह निर्धारित करने का कोई आधार नहीं है कि इसमें क्या घोषित किया गया है। 🔗 संदेश
- आर्मेनियाई भाषा के लिए पूर्ण open LLM ecosystem — एक Hugging Face collection में ArmWeb web corpus, सत्यापित वैज्ञानिक dataset ArmSTEM और arm-gemma-e4b model शामिल हैं; संबंधित शोध-पत्र आगामी बताया गया है। 🔗 लेख
- VLM Run Gateway ने open-weight OCR और vision models को एक API के पीछे एकीकृत किया — gateway एक ही entry point से PaddleOCR-VL-1.6 सहित open-weight optical recognition, vision-language और vision models उपलब्ध कराता है। 🔗 लेख
- Sakana AI ने 5 अक्टूबर को अपनी engineering team के द्वार खोले — Engineer Open House सोमवार, 5 अक्टूबर 2026 को शाम 18 बजे से 21 बजे तक Toranomon या online आयोजित होगा और पंजीकरण connpass पर होगा। 🔗 घोषणा
- Google ने अपने Gemini Enterprise developer experience कार्यक्रम के sprints का विवरण दिया — बिना किसी लॉन्च का कार्यविधि लेख: वर्णित sprint enterprise AI governance पर केंद्रित है और Agent Gateway तथा Semantic Governance के लिए अद्यतन documentation एवं मानकीकृत code examples देता है। 🔗 लेख
- Suno ने अपनी अगली model generation को v6 family नाम दिया — एक उपयोगकर्ता को दिए उत्तर में आधिकारिक account ने इसे अब तक का अपना सर्वश्रेष्ठ काम बताया, लेकिन कोई तारीख या तकनीकी विवरण नहीं दिया; यह नई download limits लागू होने के अगले दिन हुआ। 🔗 उत्तर
- MiniMax और Together AI ने London में open models की economics पर एक शाम आयोजित की — संयुक्त कार्यक्रम Open by Design: The Economics of AI in Production 16 सितंबर को होगा; निर्धारित अवधि में MiniMax की यही एकमात्र पोस्ट थी। 🔗 घोषणा
- Mistral 23 और 24 सितंबर को AI Engineer conference को फिर Paris ला रहा है — Station F में वापसी पर engineering vice president Lélio Renard-Lavaud, Black Forest Labs, Cognition और Hugging Face के साथ शामिल होंगे; पिछला संस्करण पूरी तरह भरा हुआ था। 🔗 घोषणा
- WebMCP Challenge ने submissions बंद किए — 3 सितंबर की outage के कारण बारह घंटे की देरी के बाद submissions बंद हुईं; projects की समीक्षा जारी है और winners की घोषणा जल्द की जाएगी। 🔗 घोषणा
इसका क्या अर्थ है
किसी frontier model को ecosystem कितनी तेज़ी से अपनाता है, यही अब वास्तविक संकेतक बन गया है। GPT-6 Astra की घोषणा 3 सितंबर को हुई; 4 सितंबर तक वह बिना प्रतिबंध API में, दस Copilot surfaces पर सामान्य उपलब्धता में, उत्पादन में उसका उपयोग करने वाले किसी तीसरे पक्ष द्वारा मापा गया और Codex CLI के लगातार तीन patches में एकीकृत हो चुका था। चौबीस घंटे की ऐसी अवधि एक साल पहले मौजूद नहीं थी। यह लॉन्च का प्रश्न हटाकर billing पर ध्यान ले आती है: GitHub Astra पर बिना किसी promotional period के provider की सार्वजनिक दर लागू करता है, जबकि Gemini 3.8 Flash को वर्ष के अंत तक introductory pricing मिलती है। जब सभी models अपनी घोषणा के अगले ही दिन उपलब्ध हो जाते हैं, तो अंतिम उपयोगकर्ता के लिए कीमत फिर एकमात्र दृश्यमान अंतर बन जाती है।
HydraFusion समस्या को दूसरी ओर से हल करता है और tooling के लिए यह दिन की सबसे संरचनात्मक ख़बर है। बीस models में से चुनना ऐसा काम है जिसे बहुत कम developers गंभीरता से करते हैं, और GitHub इसे पूरी तरह समाप्त करने का प्रस्ताव रखता है: उपयोगकर्ता workflow चुनता है और tool हर request के लिए model तय करता है। TerminalBench पर Opus 5 की तुलना में 67 प्रतिशत कम लागत पर गुणवत्ता में 4.9 points की बढ़ोतरी के आँकड़ों का महत्व मुख्यतः उनके संकेत में है: लाभ किसी श्रेष्ठ model से नहीं, orchestration से आता है। यदि यह परिणाम benchmark की परिस्थितियों के बाहर भी कायम रहता है, तो model स्वयं product नहीं रह जाता, बल्कि गुणवत्ता के प्रवेश-द्वार के पीछे एक परस्पर बदलने योग्य component बन जाता है।
enterprise agents engineering से बाहर निकल रहे हैं और governance उनके पीछे चल रहा है। SpaceXAI स्पष्ट रूप से कहता है कि Grok Bot का सबसे गहन उपयोग code से बाहर होता है, और दिन का सबसे स्पष्ट आँकड़ा software seats का audit है: 90 दिनों से बिना गतिविधि वाले 43 paid subscriptions। लेकिन इन घोषणाओं की असली सामग्री permission mechanism है। SpaceXAI द्वारा प्रकाशित system prompt template तीन व्यवस्थाओं में अंतर करता है—हमेशा अनुमत, मामले-दर-मामला अनुमत और कभी अनुमत नहीं—और NVIDIA agent memory पर अपने लेख में यही सिद्धांत रखता है: context किसी कार्रवाई के बारे में जानकारी दे सकता है, उसे अधिकृत नहीं कर सकता। परस्पर असंबंधित दो पक्ष एक ही दिन इस निष्कर्ष पर पहुँचते हैं कि उपयोगी agent को सबसे पहले उन कार्यों से परिभाषित किया जाता है जिन्हें करने से उसे रोका गया है।
command-line tools में सुरक्षा सीधी रेखा में नहीं, बल्कि टेढ़े-मेढ़े ढंग से आगे बढ़ रही है। Gemini CLI hard-coded API key हटाता है और अपने sandbox को मज़बूत करता है, Claude Code उन permission rules को ठीक करता है जिनके कारण केवल पढ़ने योग्य माने गए folders में लिखा जा सकता था, और Kimi Code विनाशकारी commands को रोकने की व्यवस्था जोड़ने के दो दिन बाद ही हटा देता है। अंतिम मामला सबसे शिक्षाप्रद है: shell commands का static analysis इतने false positives उत्पन्न करता है कि काग़ज़ पर सही सुरक्षा-उपाय व्यवहार में असहनीय बन जाता है। इन tools की सुरक्षा किसी protection की घोषणा में नहीं, बल्कि उपयोगकर्ताओं के संपर्क में आने के बाद उसके टिके रहने में तय होती है।
अंत में गणित और विज्ञान का दिन बचता है, जिसका तत्काल मूल्यांकन करना सबसे कठिन है। ग्यारह दिनों में औपचारिक रूप दिया गया Fermat proof कोई नया गणित उत्पन्न नहीं करता: वह तीस साल पुराने परिणाम को सत्यापित करता है। ठीक यही उसे रोचक बनाता है, क्योंकि peer review वह bottleneck है जिसे वर्षों में मापा जाता है, और Kevin Buzzard बताते हैं कि ये artifacts अब इतने मज़बूत हैं कि दूसरे कार्यों के आधार बन सकते हैं। Ai2 का climate emulator और fruit fly का connectome इसी तर्क पर आधारित हैं: दोनों में से कोई खोज नहीं करता, लेकिन दोनों ऐसे काम को व्यावहारिक बनाते हैं जिसकी लागत बड़े पैमाने को असंभव बना देती थी। यह autonomous discovery की तुलना में कम आकर्षक उपयोग है और संभवतः उस वास्तविक बदलाव के अधिक निकट है जो AI वैज्ञानिक अभ्यास में ला रहा है।
स्रोत
- GPT-6 Astra, Pro, Enterprise और Business Premium के लिए उपलब्ध
- GitHub Copilot में GPT-6 Astra की सामान्य उपलब्धता
- Perplexity ने WANDR पर GPT-6 Astra का मूल्यांकन किया
- Codex CLI 0.153.3
- Astra के साथ गेम बनाना
- फ़र्मा के अंतिम प्रमेय का औपचारिकीकरण
- GitHub पर फ़र्मा के अंतिम प्रमेय का प्रमाण
- Project HydraFusion
- Gemini ऐप में Lyria 3.5
- Enterprise के लिए Grok Bot
- SpaceXAI का खरीदारी एजेंट Haggle Bot
- Grok, Plaid के माध्यम से वित्तीय खातों से जुड़ता है
- Claude Code 2.1.260
- Claude Code 2.1.261
- ant apply कमांड
- NVIDIA NemoClaw के साथ स्मृति-संचालित एजेंट
- Jetson पर सीमांत तर्क क्षमता का आगमन
- संघबद्ध Kubernetes प्लेटफ़ॉर्मों के बीच उपयोगकर्ता पहचान स्थानांतरित करना
- Gemini CLI v0.60.0 nightly
- Antigravity परिवर्तन-सूची
- Ai2 का SamudrACE-E3SMv3
- नर फल-मक्खी का संपूर्ण कनेक्टोम
- Muse Spark 1.3 max सार्वजनिक रूप से उपलब्ध
- Sakana AI का Percept-Lens
- arXiv पर Percept-Lens शोधपत्र
- LoongForge में TAOT
- Open Yap 1K
- Daily Brief का संयुक्त राज्य अमेरिका में विस्तार
- Runway ने Team योजना शुरू की
- 1 Million Voices का ब्राज़ील में आगमन
- Kimi Code 0.41.0
- Perplexity में GPU पर तेज़ एम्बेडिंग
- Windows पर Delta का बीटा संस्करण उपलब्ध
- Replit MCP लाइव
- स्टार इतिहास के लिए गोपनीयता-सुरक्षित एंडपॉइंट
- npm की विश्वसनीय प्रकाशन सुविधा के लिए एकाधिक कॉन्फ़िगरेशन
- सितंबर की शुरुआत के GitHub Actions अपडेट
- VS Code की कहानी
- Replit पर निर्मित Pep AI
- Zed द्वारा प्रकाशित दृश्य घोषणा
- आर्मेनियाई भाषा के लिए खुला LLM पारिस्थितिकी तंत्र
- VLM Run Gateway
- Sakana AI का इंजीनियर खुला दिवस
- Gemini Enterprise के DevEx कार्यक्रम के स्प्रिंट
- Suno ने v6 परिवार का उल्लेख किया
- लंदन में Open by Design
- AI Engineer की पेरिस में वापसी
- WebMCP Challenge का समापन