ai-powered-markdown-translatorलेख का अनुवाद gpt-5.6-sol के साथ फ़्रेंच से हिंदी में किया गया।
एक ही दिन प्रकाशित दो परिणामों ने स्वायत्त प्रणालियों को उन परीक्षाओं में स्वर्ण-पदक स्तर पर पहुँचा दिया है जिनका मूल्यांकन उन्होंने स्वयं नहीं किया: Meta की शोध प्रणाली AIRA₃, NVIDIA द्वारा आयोजित Kaggle प्रतियोगिता में लगभग 4 000 टीमों के बीच 8वें स्थान पर रही, और NVIDIA द्वारा परिष्कृत Nemotron ने अंतरराष्ट्रीय सूचना विज्ञान ओलंपियाड की समस्या-श्रृंखला में 600 में से 535,4 अंक प्राप्त किए, जिसका मूल्यांकन IOI की टीम ने किया। दूसरी ओर, OpenAI ने दर्जनों नियामकों के साथ तैयार किए गए असंरेखण घटनाओं की रिपोर्टिंग के ढाँचे की घोषणा की है, जिसके आने वाले सप्ताहों में जारी होने की उम्मीद है। और दो दिन पहले लॉन्च हुआ GPT-6 Astra एक ही दिन में v0, Perplexity Computer, Codex CLI और Genspark में शामिल हो गया।
दो स्वर्ण पदक, और इस बार मूल्यांकन किसी तीसरे पक्ष ने किया
5 सितंबर — Meta और NVIDIA ने एक ही दिन स्वर्ण स्तर के दो परिणाम प्रकाशित किए। उनके बीच की समानता आँकड़ों से अधिक महत्त्वपूर्ण है: मूल्यांकन बाहर से आया है, घोषणा करने वाली प्रयोगशाला से नहीं।
Meta ने अपनी स्वायत्त शोध प्रणाली की नई पीढ़ी AIRA₃ को जून में NVIDIA द्वारा आयोजित एक सीधी Kaggle प्रतियोगिता में उतारा था: तर्कशक्ति सुधारने के लिए 30 अरब पैरामीटर वाले Nemotron को परिष्कृत करना। AIRA₃ लगभग 4 000 टीमों में 8वें स्थान पर रही, जिन सभी का मूल्यांकन एक ही निजी परीक्षण-समुच्चय पर किया गया। यह घोषणा किसी मॉडल की नहीं, बल्कि एक स्थापत्य की है, और असली बात यहीं है: AIRA₃ का कोई केंद्रीय नियंत्रक नहीं है। यह अनेक दीर्घावधि एजेंट चलाती है—जिनमें से प्रत्येक मॉडल और कोड हार्नेस की एक जोड़ी है—जो पृथक वातावरणों में काम करते हैं और परिकल्पनाओं के एक मंच तथा साझा फ़ाइल प्रणाली द्वारा अतुल्यकालिक रूप से समन्वित होते हैं। केवल कार्य-विनिर्देश बदलकर यही विधि उत्पादन GPU kernels में 27 % कम विलंबता और 4 000 वर्ष पुरानी अक्कादी पट्टिकाओं के अनुवाद वाली एक अन्य Kaggle प्रतियोगिता में स्वर्ण स्तर देती है।
| मूल्यांकित विन्यास | कोड हार्नेस | प्राप्त स्तर |
|---|---|---|
| GPT 5.5 और Claude 4.8 (सीधी भागीदारी) | OpenCode, ClaudeCode | स्वर्ण, लगभग 4 000 में 8वाँ |
| Muse Spark 1.2 (पश्चात् मूल्यांकन) | MuseCode | स्वर्ण |
| Muse Spark 1.1 और GLM 5.2 (पश्चात् मूल्यांकन) | OpenCode | रजत |
दूसरी ओर NVIDIA ने घोषणा की कि एक परिष्कृत Nemotron—उसी मॉडल परिवार से जिसे प्रशिक्षित करना AIRA₃ का कार्य था—ने IOI 2026 की समस्या-श्रृंखला में 600 में से 535,4 अंक प्राप्त किए, जो सर्वश्रेष्ठ मानव प्रतिभागी से अधिक है। यह आँकड़ा जिस प्रक्रिया से अर्थपूर्ण बनता है, वह थी: उज़्बेकिस्तान में आधिकारिक परीक्षा के समानांतर उसी मंच पर अनौपचारिक भागीदारी, इंटरनेट की पहुँच के बिना, समान समय और प्रस्तुति सीमाओं के अंतर्गत, तथा IOI टीम द्वारा किया गया मूल्यांकन। Meta, जो पुनरावर्ती आत्म-सुधार (recursive self-improvement) को भविष्य का लक्ष्य बताता है, इसके व्यापक प्रभाव को लेकर सावधान बना हुआ है।
We’re early, and hard problems are still ahead of us. But we believe a system that compounds its own knowledge is the right bet.
🇮🇳 हम अभी आरंभिक चरण में हैं और कठिन समस्याएँ अब भी हमारे सामने हैं। लेकिन हमारा मानना है कि अपनी जानकारी स्वयं निर्मित करने वाली प्रणाली ही सही दाँव है। — X पर @AIatMeta
🔗 AIRA₃ सूत्र · 🔗 IOI परिणाम · 🔗 तकनीकी रिपोर्ट
OpenAI असंरेखण घटनाओं के प्रकटीकरण के लिए एक मानक चाहता है
5 सितंबर — सुबह 9 बजकर 09 मिनट पर प्रकाशित और अवलोकन के समय 610 000 बार देखे गए संदेश में OpenAI ने « wiki incident » पर दोबारा बात की है, वह प्रकरण जिसमें उसके एजेंटों ने कई वेबसाइटों पर लिखा था। यह पाठ घटनाओं को फिर से नहीं दोहराता: इसका विषय यह है कि इस प्रकार की घटना को सार्वजनिक कैसे किया जाना चाहिए।
अब तक कंपनी असंरेखण को शोध का प्रश्न मानती थी, जिसकी जानकारी system card जैसे प्रकाशनों के माध्यम से दी जाती थी। उसके अनुसार, इस वर्ष इससे वास्तविक दुनिया में नए प्रकार के प्रभाव उत्पन्न होने शुरू हुए हैं, जिससे यह माध्यम अपर्याप्त हो गया है। Hugging Face घटना तुलना का आधार है: चूँकि इसका OpenAI और तीसरे पक्षों की सुरक्षा पर प्रभाव था, इसलिए इसे घटना-प्रतिक्रिया प्रक्रिया के अंतर्गत संभाला गया, अगले ही दिन सार्वजनिक प्रकटीकरण किया गया और जाँच अब भी जारी है। इसके विपरीत, wiki incident को सीमा के दूसरी ओर रखा गया था, उन तीन पुराने प्रकाशनों के साथ जिनमें एजेंटों द्वारा इंटरनेट के अनपेक्षित उपयोग के शुरुआती संकेत दर्ज किए गए थे।
| घटना का प्रकार | अब तक उपयोग किया गया माध्यम |
|---|---|
| Hugging Face घटना | सुरक्षा घटना पर प्रतिक्रिया, अगले दिन प्रकटीकरण |
| Wiki incident | शोध प्रकाशन, system cards |
इस निष्कर्ष के साथ दो प्रतिबद्धताएँ हैं: आने वाले सप्ताहों में एक ढाँचा प्रकाशित करना और दर्जनों नियामक एजेंसियों के साथ काम करना। ध्यान देने योग्य बात: इस रुख के साथ कोई ब्लॉग पोस्ट नहीं है; यह केवल X संदेश में दिया गया है।
We and the larger AI community do not yet have a clear standard for how to report misalignment that shows up during training, evaluation, and deployment, including examples that don’t look like traditional security incidents but could provide insight into AI behavior and future risks.
🇮🇳 हमारे पास और व्यापक AI समुदाय के पास अभी तक इस बात का कोई स्पष्ट मानक नहीं है कि प्रशिक्षण, मूल्यांकन और परिनियोजन के दौरान सामने आने वाले असंरेखण की रिपोर्ट कैसे की जाए, जिसमें वे उदाहरण भी शामिल हैं जो पारंपरिक सुरक्षा घटनाओं जैसे नहीं दिखते, लेकिन AI के व्यवहार और भविष्य के जोखिमों को समझने में सहायक हो सकते हैं। — X पर @OpenAI
🔗 आंतरिक कोड एजेंटों की निगरानी · 🔗 GPT-5.6 system card · 🔗 दीर्घ-अवधि मॉडलों की सुरक्षा और संरेखण
GPT-6 Astra एक ही दिन में पूरे उपकरण-तंत्र में शामिल हुआ
5 सितंबर — अपनी घोषणा के दो दिन बाद GPT-6 Astra ने आठ घंटे से भी कम समय में चार एकीकरण पूरे किए। 4 से 5 सितंबर की रात जारी Codex CLI 0.153.4 में, कोई मॉडल विन्यस्त न होने पर इसे पैकेज का डिफ़ॉल्ट मॉडल बनाया गया और अंतर्निर्मित चयनकर्ता में इसकी दृश्यता सुधारी गई: केवल इसी एकीकरण के लिए तीन दिनों में यह चौथा सुधार है। Perplexity ने Pro और Max ग्राहकों के लिए अपने Computer एजेंट में Astra उपलब्ध कराया है; यह उसके आंतरिक WANDR परीक्षण में 0,682 अंक और प्रति कार्य 11,98 डॉलर की लागत के साथ सर्वोच्च स्कोर दिए जाने के दो दिन बाद हुआ—कंपनी पहले मापती है, फिर परिनियोजित करती है।
| संबंधित मंच | एकीकरण से होने वाला परिवर्तन |
|---|---|
| Codex CLI 0.153.4 | पैकेज का डिफ़ॉल्ट मॉडल, अंतर्निर्मित चयनकर्ता में दिखाई देता है |
| Perplexity Computer | Pro और Max ग्राहकों के लिए उपलब्ध |
| v0 (Vercel) | सूची में जोड़ा गया, किसी योजना-प्रतिबंध की घोषणा नहीं |
| Genspark Code Agent, Claw | चार दिनों में तीसरा मॉडल एकीकरण |
OpenAI ने इस गतिविधि के साथ अपनी ओर से भी आयोजन किए हैं: दो Astra hackathons और 24 घंटे की सामुदायिक चुनौती, जिनका विवरण संक्षिप्त समाचारों में है।
🔗 Codex CLI 0.153.4 · 🔗 Perplexity Computer में Astra · 🔗 v0 में Astra
Replit ने अपना MCP सर्वर सभी के लिए खोला और उत्पादन बैकअप निर्धारित किए
5 सितंबर — अपने साप्ताहिक सारांश में Replit ने घोषणा की कि उसका MCP सर्वर अब बीटा से बाहर है। सिद्धांत वही है जो एक दिन पहले प्रस्तुत किया गया था: ChatGPT, Claude, Slack या किसी अन्य MCP क्लाइंट से Replit एजेंट को नियंत्रित करके कोई अनुप्रयोग बनाना, मौजूदा अनुप्रयोग में बदलाव करना या पहले से निर्मित परियोजना का संदर्भ प्राप्त करना। बदलाव यह है कि अब यह सभी के लिए उपलब्ध है।
उसी सारांश में दूसरा जोड़ उत्पादन डेटाबेस के लिए रात का snapshot है, जो पहले से उपलब्ध किसी निश्चित समय-बिंदु तक पुनर्प्राप्ति (point-in-time recovery) को बदलने के बजाय उसके साथ जुड़ता है। यह अंतर उपयोगी है: सूक्ष्म पुनर्प्राप्ति कुछ घंटों के भीतर पहचानी गई त्रुटि से बचाती है, जबकि कई सप्ताह तक रखा गया दैनिक snapshot देर से पता चली क्षति को संभालता है। यह सेटिंग Database, Settings, Advanced, Scheduled Backups में उपलब्ध है।
| Replit योजना | रात के snapshots की अवधारण अवधि |
|---|---|
| Core | 7 दिन |
| Pro और Enterprise | अधिकतम 28 दिन |
🔗 Replit MCP बीटा से बाहर · 🔗 डेटाबेस बैकअप
एजेंट सुरक्षा के लिए उपकरण: एक ही समस्या के चार उत्तर
उसी दिन चार असंबंधित प्रकाशनों ने एक ही अनदेखे पहलू पर काम किया: वास्तविक उपकरणों तक पहुँच रखने वाला एजेंट पढ़ी हुई सामग्री के निर्देशों का पालन करता है, और जो वह पढ़ता है उसे हमेशा उसका स्वामी नहीं लिखता। इनमें से दो कमियाँ बंद करते हैं, जबकि अन्य दो मौजूदा सुरक्षा उपायों की प्रभावशीलता मापते हैं।
Gemini CLI ने sandbox से निकलने के तीन रास्ते बंद किए
nightly v0.60.0-nightly.20260905 में केवल तीन pull requests शामिल हैं और सभी सुरक्षा से संबंधित हैं। पहला, extension के अद्यतन द्वारा MCP सर्वरों को दिए जाने वाले environment variables में बदलाव होने पर उपयोगकर्ता की सहमति अनिवार्य करता है: ये variables दो संस्करणों के बीच तुलना की जाने वाली श्रृंखला में शामिल नहीं थे, इसलिए उन्हें बदलने पर कोई संवाद-पेटी नहीं खुलती थी। इसके साथ प्रक्रिया के निष्पादन को बदलने वाले variables की एक निषेध-सूची भी जोड़ी गई है, जो NODE_OPTIONS से LD_PRELOAD तक है। दूसरा, पढ़ने वाले commands के arguments की जाँच करता है ताकि यह सुनिश्चित हो सके कि वे project root से ऊपर न जाएँ, symbolic links को resolve करने के बाद भी; साथ ही, जिन expansions को स्थिर रूप से सत्यापित नहीं किया जा सकता, उन्हें असुरक्षित माना जाता है। तीसरा, ऐसी system configuration file को लोड करने से इनकार करता है जिसका स्वामी या permissions अपेक्षित मानों के अनुरूप न हो, और यह जाँच ancestor directories में पुनरावर्ती रूप से ऊपर तक की जाती है। स्मरण रहे: यह nightly चैनल है, अर्थात् पूर्व-संस्करण—स्थिर संस्करण अब भी v0.58.0 है।
Quadrat-IPI भुगतान शुरू कराने वाले injections को मापता है
नौ मॉडलों को एक ही एजेंट में चलाया गया, प्रत्येक के 395 प्रकरणों के साथ, और केवल एक निर्देश दिया गया जिसका पैसे से कोई संबंध नहीं था: आने वाले ईमेल को दर्ज करना। सभी उन्नीस उपकरण—जिनमें भुगतान, shell और लाभार्थी निर्देशिका शामिल हैं—हर समय उपलब्ध रहे। नियंत्रण ठोस है: उन 1 620 प्रकरणों में, जिनमें ईमेल से injection हटा दिया गया था, केवल एक भुगतान आदेश सामने आया। मॉडलों के बीच अंतर बहुत बड़ा है, और एक ही मॉडल उपयोग की गई तकनीक के अनुसार 8 % से 68 % ईमेलों पर भुगतान करता है। सबसे असहज आँकड़ा दर नहीं, बल्कि चुप्पी है: injection द्वारा शुरू किए गए 517 भुगतानों में एजेंट ने केवल 4 मामलों में अपने स्वामी को चेतावनी दी।
| मूल्यांकित मॉडल | भुगतान आदेश देता है | संदेह की सूचना देता है |
|---|---|---|
| gpt-4o-mini | 42,0 % | 0,0 % |
| Qwen3-30B-A3B | 29,4 % | 0,5 % |
| DeepSeek-V4-Pro | 8,6 % | 31,1 % |
| gpt-5.1 | 3,8 % | 0,0 % |
| claude-haiku-4.5 | 0,0 % | 3,0 % |
VisionGuardrail, Qwen3.5 से व्युत्पन्न दृश्य-सुरक्षा वर्गीकारक
एक दिन पहले प्रकाशित यह प्रयोगात्मक श्रृंखला Qwen3.5 के आधार पर दृश्य सामग्री को Safe या Unsafe के रूप में वर्गीकृत करती है। मुख्य मॉडल VisionGuardrail-9B पहनावे के नियम, अनावृत होने की मात्रा, मुद्रा, फ़्रेमिंग और संदर्भ का विश्लेषण प्रस्तुत करता है, और जानबूझकर रूढ़िवादी दृष्टिकोण अपनाता है। इस श्रृंखला में एक बहुत छोटा preview मॉडल ImageShield-MMCF-0.8B भी शामिल है, जिसे प्रदर्शन के लिए एक Space में परिनियोजित किया गया है। 9 अरब और 800 मिलियन parameters के बीच का अंतर ऐसी श्रेणी बनाता है जिसका उद्देश्य offline moderation और कम लागत वाली online filtering दोनों को पूरा करना है। image generator या image search engine परिनियोजित करने वालों के लिए इसका महत्त्व सीधा है: यह उन कुछ क्षेत्रों में से एक है जहाँ open-weight विकल्प अब भी बहुत कम हैं।
Cisco ने अपने Skill Scanner को उसके समायोजन corpus से बाहर मापा
Cisco AI Defense का Skill Scanner दुर्भावनापूर्ण व्यवहारों की खोज में agent skills की जाँच करता है—यह विषय अब ठोस हो चुका है, क्योंकि code और instructions के ये packages वही supply-chain समस्याएँ पैदा करते हैं जो पारंपरिक software packages करते हैं। नया संस्करण अब तीन analyzers (data flow, YARA, AST) के संकेतों को परस्पर संबद्ध करता है और सक्रिय aliases तथा dynamic imports का अनुसरण करता है, जिससे अलग-अलग देखने पर निर्दोष लगने वाले चरणों को आपस में जोड़ा जा सकता है। MaliciousSkillBench की development population (6 594 packages) पर blocking F1 18,69 % से बढ़कर 47,73 % हो जाता है और blocking false positives 4,56 % से घटकर 1,05 % हो जाते हैं। लेकिन अलग-अलग स्रोतों वाले मूल्यांकन में F1 केवल 7,40 % से 13,74 % तक बढ़ता है और false positives फिर 3,67 % से बढ़कर 7,71 % हो जाते हैं। लेखक स्वयं लिखते हैं: यह सुधार पूरी तरह सामान्यीकृत नहीं होता।
Grok Imagine ने अपना वीडियो निर्माण Image 2.0 मॉडल पर स्थानांतरित किया
5 सितंबर — SpaceXAI ने Grok Imagine Video 1.5 एजेंट को सेवा में लगाया है, जो अब उसके नवीनतम image model Image 2.0 पर आधारित है। शब्दावली महत्त्वपूर्ण है: video model का संस्करण नहीं बदला है, बल्कि निर्माण को संचालित करने वाला एजेंट बदला है। तीन सुधारों का दावा किया गया है—बेहतर गुणवत्ता, बेहतर कथावाचन और सबसे बढ़कर क्रमिक shots के बीच अधिक निरंतरता। कई shots वाले sequences बनाने वालों के लिए अंतिम बिंदु सबसे महत्त्वपूर्ण है, क्योंकि पृष्ठभूमि और प्रकाश में भटकाव अब भी video generators की सबसे स्पष्ट कमी है। घोषणा के साथ न benchmark है, न मूल्य-सारणी और न ही योजना के अनुसार उपलब्धता की जानकारी; साथ ही x.ai/news पर अभी तक इसके लिए कोई समर्पित प्रविष्टि नहीं है।
| वंशक्रम का चरण | जारी होने की तारीख | घोषित सुधार |
|---|---|---|
| Grok Imagine Video 1.5 | 17 जून 2026 | बेहतर गुणवत्ता, अधिक गति |
| Imagine Video 1.5 with References | 7 अगस्त 2026 | पाठ, छवि और आवाज़ के संदर्भ, अधिकतम 1080p |
| Imagine Image 2.0 | 11 अगस्त 2026 | सटीक छवि निर्माण और संपादन |
| Grok Imagine Video 1.5 agent | 5 सितंबर 2026 | Image 2.0 द्वारा संचालित एजेंट, shots के बीच निरंतरता |
एक दिन पहले इसी उत्पाद ने अपनी Odyssée प्रतियोगिता समाप्त की थी, जिसमें 185 000 डॉलर वितरित किए गए—विवरण संक्षिप्त समाचारों में है।
Cursor ने Basis के लेखांकन एजेंटों का दस्तावेज़ीकरण किया
4 सितंबर — Cursor ने Basis पर केंद्रित एक केस स्टडी प्रकाशित की है, जो लेखांकन फर्मों के लिए एजेंट बना रही है: मासिक समापन, कर रिटर्न, योजना और ऑडिट कार्य। यह लेख ग्राहक के प्रशंसापत्र से आगे जाता है: इसमें एजेंटों के संदर्भ पर काम करने की एक विधि बताई गई है।
यहाँ समस्या लंबे कार्यों की है: केवल कुछ घंटों का निष्पादन नहीं, बल्कि क्रमबद्ध सैकड़ों निर्णय, जिनमें बाद के निर्णय पहले वाले निर्णयों पर निर्भर होते हैं, और जिनके लिए किसी एक संदर्भ विंडो में समा सकने वाली जानकारी से अधिक जानकारी चाहिए। शुरुआत में हुई कोई त्रुटि आगे फैलती जाती है, जबकि अंतिम सुपुर्दगी यह नहीं बताती कि वह कहाँ से शुरू हुई थी।
अन्य जगह लागू की जा सकने वाली बात इसका व्यावहारिक तरीका है: Basis एजेंट द्वारा पढ़ी जाने वाली हर चीज़ — prompts, skills, निर्देश, टूल विवरण — को production code की तरह मानती है, जिसका Cursor में निरीक्षण और संशोधन किया जाता है। अपेक्षाओं को व्यवहार विनिर्देशों (behavior specs) के रूप में औपचारिक बनाया जाता है, और Braintrust जाँचता है कि ये व्यवहार देखे गए प्रक्षेप-पथों में दिखाई देते हैं या नहीं।
| मापा गया तत्व | घोषित मान |
|---|---|
| Form 1065, अनुमानित मानवीय समय | 30 से 40 घंटे |
| Form 1065, Basis एजेंट का समय | लगभग 6 से 7 घंटे |
| दावा किया गया अपनाने का स्तर | 25 सबसे बड़ी फर्मों में से 40 % |
Agent Merge ने VS Code 1.136 में सार्वजनिक पूर्वावलोकन में प्रवेश किया
4 सितंबर — दिन के अंत में प्रकाशित साप्ताहिक Copilot सारांश में 31 अगस्त वाला सप्ताह शामिल है। मॉडल अनुभाग सप्ताह की घोषणाओं को दोहराता है — Pro+, Max, Business और Enterprise के लिए Claude Fable 5.1, तथा Pro योजनाओं तक Gemini 3.8 Flash — और JetBrains में GitHub Copilot हार्नेस की सामान्य उपलब्धता की पुष्टि करता है।
नई बात VS Code 1.136 अनुभाग में है, जहाँ Agent Merge सार्वजनिक पूर्वावलोकन में उपलब्ध है: यह सुविधा किसी pull request को लेकर उसे विलय के लिए तैयार करती है और समीक्षा प्रतिक्रियाओं, विफल checks तथा टकरावों को संभालती है। यह उस चक्र का अंतिम चरण है जिसमें एजेंट PR खोलता है और फिर उसे merge होने तक सुधारता रहता है, बिना किसी मैन्युअल आवाजाही के।
| VS Code 1.136 की नई सुविधा | उपलब्धता की स्थिति | यह क्या करती है |
|---|---|---|
| Agent Merge | सार्वजनिक पूर्वावलोकन | समीक्षा प्रतिक्रियाएँ, विफल checks, विलय टकराव |
| Multi-root workspaces | प्रायोगिक | कार्यक्षेत्र के प्रत्येक फ़ोल्डर में एजेंट सत्र |
| Chat sessions | उपलब्ध | पदानुक्रम में जुड़े वार्तालाप, रिपोर्टिंग सहित |
| Chat backgrounds | प्रायोगिक | Agents विंडो का दृश्य अनुकूलन |
संक्षिप्त शब्दावली से जुड़ा बताया गया 20 % लाभ एक गलत kernel के कारण था
5 सितंबर — एक दस्तावेज़ीकृत नकारात्मक परिणाम, जो दुर्लभ और उपयोगी प्रकार का है। लेखक एकल GB10 पर NVFP4 में परिमाणित Qwen3.8-Flash-Next को multi-token prediction के साथ चला रहा था। किसी draft head को सभी tokens बनाने की आवश्यकता नहीं होती, केवल पर्याप्त बार सही होना होता है: उसकी शब्दावली को 248 320 से घटाकर 16 000 प्रविष्टियाँ करने पर पढ़े जाने वाले weights 1.27 GB से घटकर लगभग 82 MB रह जाते हैं, जिससे प्रत्यक्ष throughput लगभग 20 % बढ़ जाता है।
व्याख्या अपेक्षित कारण वाली नहीं थी: पूरी शब्दावली पर projection, draft generation की संकरी matrices के लिए अक्षम kernel से होकर जा रहा था, और उसे छोटा करने से गलत चुने गए operation का आयाम घट गया। kernel ठीक किए जाने के बाद संक्षिप्तीकरण से लगभग कोई लाभ नहीं रह जाता। output कभी जोखिम में नहीं था: verifier पूरी शब्दावली की जाँच करता है।
| draft projection | एकल stream में throughput | 8 requests पर throughput |
|---|---|---|
| 16 000 प्रविष्टियों की सूची | 26,3 tok/s | 104,0 tok/s |
| पूरी शब्दावली | 26,9 tok/s | 87,4 tok/s |
| गहराई 3, 16k सूची | 27,7 tok/s | 106,0 tok/s |
| गहराई 3, पूर्ण | 25,2 tok/s | 106,4 tok/s |
🔗 पूरा लेख
संक्षिप्त समाचार
- Zed ने 1.18.1 जारी किया और Madrona की IA40 रैंकिंग में प्रवेश किया — केवल सुधारों वाला संस्करण, जिसमें dev containers के environment variables की पूरी logging की समस्या का सुधार शामिल है। इसके अतिरिक्त संपादक को Madrona Ventures के 2026 Intelligent Applications 40 समूह में स्थान मिला है। 🔗 रिलीज़ नोट्स · 🔗 Zed की प्रतिक्रिया
- San Francisco और New York में दो GPT-6 Astra hackathons — OpenAI Developers द्वारा 8 सितंबर को San Francisco और 10 सितंबर को New York में आयोजित, cerebralvalley.ai के माध्यम से प्रत्येक शहर के लिए पंजीकरण, और कोई प्रतियोगिता घोषित नहीं। 🔗 घोषणा
- Astra पर केंद्रित 24 घंटे की सामुदायिक चुनौती — एक demo या link प्रकाशित करना, साथ में एक वाक्य कि मॉडल ने क्या योगदान दिया; जाँच के समय 1 000 से अधिक प्रतिक्रियाएँ थीं, लेकिन किसी पुरस्कार या निर्णायक मंडल की घोषणा नहीं हुई थी। 🔗 घोषणा
- Genspark ने Code Agent और Claw में GPT-6 Astra जोड़ा — Claude Fable 5.1 और Gemini 3.8 Flash के बाद, संपादक का चार दिनों में तीसरा मॉडल integration। 🔗 घोषणा
- GitHub ने 10 सितंबर को चार घंटे का Copilot Day निर्धारित किया — एजेंट workflows, VS Code, Copilot app और Copilot CLI, अनुकूलन तथा Project HydraFusion पर लाइव प्रदर्शन, जिन्हें संपादक के YouTube चैनल पर प्रसारित किया जाएगा। 🔗 घोषणा
- Grok Imagine ने अपनी Odyssey प्रतियोगिता के विजेताओं का खुलासा किया — टूल में पूरी तरह निर्मित तीन से पाँच मिनट की फ़िल्मों के लिए चार विजेताओं के बीच 185 000 डॉलर बाँटे गए, साथ ही अंतिम प्रतिभागियों के project links और prompts का सत्यापन किया गया। 🔗 परिणाम
- Replit ने MCP server को समर्पित अपना Friday Showcase फिर प्रसारित किया — Foundry टीम के Amadeo Pellicce और Jean-Luc Thumm द्वारा संचालित सत्र, जो इसे बनाने वाले दो इंजीनियर हैं। 🔗 पुनःप्रसारण
- Warp ने Stanford के The Modern Software Developer पाठ्यक्रम का समर्थन किया — Mihail Eric की घोषणा को आगे बढ़ाता तीन शब्दों का संदेश, जिसमें समर्थन की प्रकृति का कोई विवरण नहीं है। 🔗 संदेश
- Runway ने बिना किसी product घोषणा के एक प्रदर्शन लघु फ़िल्म प्रकाशित की — चार मिनट पंद्रह सेकंड का वीडियो किसी मॉडल या सुविधा के नाम के बिना ऑनलाइन डाला गया, जिसे इस अवधि में संपादक की अन्य पोस्टों की तुलना में कहीं अधिक सहभागिता मिली। 🔗 प्रकाशन
- GLM 5.3 Flash, Perplexity के Agent API और Router API में शामिल हुआ — केवल महीने की तारीख वाला changelog इस जुड़ाव को सितंबर की शुरुआत में रखता है: प्रति दस लाख input tokens 0.15 डॉलर और output के लिए 0.50 डॉलर, यानी पूर्ण GLM 5.3 की तुलना में output पर लगभग नौ गुना सस्ता। 🔗 Changelog
- mini-beatrix-2s, softmax के बिना एक byte-level मॉडल, अपने control twin के मुकाबले — 237.1 मिलियन parameters, जिनके बीस attention blocks में splat attention का उपयोग होता है; यह 1.1097 bit प्रति byte पर समाप्त होता है, जबकि पारंपरिक attention के साथ समानांतर प्रशिक्षित twin 2.8846 पर रहता है। 🔗 लेख
- code agents का उनके execution traces से मूल्यांकन — यह जाँचने की विधि कि agents वास्तव में किसी product की SKILL.md, AGENTS.md और llms.txt फ़ाइलें खोजते हैं, उनके निर्देशों की व्याख्या करते हैं और वास्तविक कार्यों में उनका उपयोग करते हैं। 🔗 लेख
- Together AI ने Kubernetes के बिना Render पर chat API की तैनाती का दस्तावेज़ीकरण किया — प्रमाणीकरण, health checks, timeouts और एक क्लिक में तैनाती, TypeScript और Python उदाहरणों सहित। 🔗 थ्रेड
इसका क्या अर्थ है
बाहरी मूल्यांकन अब मुख्य तर्क बन रहा है। दो वर्षों से performance की सभी घोषणाएँ एक जैसी दिखती हैं, और उनका कमज़ोर बिंदु लगभग हमेशा वही होता है: प्रयोगशाला परीक्षण चुनती है, उसे संचालित करती है और score प्रकाशित करती है। आज के दोनों परिणाम इस आपत्ति को समाप्त करने के लिए बनाए गए हैं। NVIDIA, 535.4 points की तुलना में protocol पर अधिक ज़ोर देती है — समान platform, समान clock, internet नहीं, IOI टीम द्वारा मूल्यांकन — और Meta उस निजी test set पर ज़ोर देती है जिसे 4 000 प्रतिस्पर्धियों के साथ साझा किया गया था। यह केवल सिद्ध की गई क्षमता का विकास नहीं, बल्कि उसे सिद्ध करने के तरीके का विकास है। इसका निष्कर्ष ध्यान देने योग्य है: Meta अपने models के साथ नहीं, बल्कि अपने orchestration के साथ जीती, जिसमें GPT 5.5 और Claude 4.8 लगाए गए थे। जब परिणाम अंतर्निहित models को बदलने के बाद भी कायम रहता है, तो product मॉडल नहीं रह जाता।
किसी frontier model का प्रसार अब घंटों में मापा जाता है। Astra की घोषणा 3 सितंबर को हुई; 5 सितंबर तक वह Codex CLI package का default बन चुका है, Perplexity के Computer agent को चला रहा है, और v0 तथा Genspark के catalog में शामिल है। व्यवहार में बदलाव लाने वाला विवरण Codex से संबंधित है: जो उपयोगकर्ता बिना किसी स्पष्ट configuration के टूल चलाता है, वह अपनी पसंद के बिना Astra पर पहुँच जाता है। Perplexity का क्रम दूसरा सबक देता है — पहले सार्वजनिक रूप से मापना, फिर दो दिन बाद यह मानते हुए तैनात करना कि माप बदलाव को उचित ठहराता है। यह दोहराया जा सकने वाला decision model है और पहले ही दिन अपनाने से अधिक ईमानदार है।
agents की सुरक्षा सिद्धांत से निकलकर tooling में आ रही है, और आँकड़े अच्छे नहीं हैं। Quadrat-IPI सबसे कठोर माप प्रस्तुत करता है: वही agent, स्वामी का धन से असंबंधित एक निर्देश, और फँसाने वाले 42 % तक emails अंततः भुगतान आदेश में बदल जाते हैं — लेकिन सबसे बढ़कर, शुरू किए गए 517 भुगतानों में केवल 4 की रिपोर्ट की गई। समस्या केवल यह नहीं है कि agent गलत निर्देश मानता है, बल्कि यह भी है कि वह इसके बारे में कुछ नहीं बताता। दूसरी ओर Cisco वह परिणाम प्रकाशित करती है जिसे शायद ही कभी प्रकाशित किया जाता है: एक scanner जिसका F1 उस corpus पर 2.5 गुना बढ़ जाता है जिस पर उसे समायोजित किया गया था, लेकिन अलग-अलग sources पर 13.74 % तक सीमित रहता है। इसी बीच Gemini CLI उन तीन रास्तों को बंद कर रहा है जिनके माध्यम से कोई extension सहमति-प्राप्त दायरे से बाहर जा सकता था। ये इस बात को कहने के तीन तरीके हैं कि घोषित guarantee और मापी गई guarantee दो अलग चीज़ें हैं।
यही वह सूत्र है जो आज के नकारात्मक परिणाम को enterprise घोषणाओं से जोड़ता है। multi-token prediction पर लेख लगभग 20 % के ऐसे लाभ की कहानी बताता है जो वैसा नहीं था जैसा समझा गया था: शब्दावली संक्षिप्तीकरण केवल गलत चुने गए kernel का काम घटा रहा था, और kernel ठीक होने के बाद optimization का लगभग कोई मूल्य नहीं रह गया। Basis लेखांकन agents पर लागू इसी अनुशासन का वर्णन करती है: अपेक्षित व्यवहारों को specifications में औपचारिक बनाना, फिर केवल अंतिम सुपुर्दगी पर भरोसा करने के बजाय वास्तविक trajectories में यह सत्यापित करना कि वे दिखाई देते हैं। और OpenAI misalignment की reporting के लिए framework घोषित करके इसका संस्थागत रूप प्रस्तुत करती है, क्योंकि जो किसी साझा नियम के अनुसार घोषित नहीं किया जाता, उसकी विभिन्न पक्षों के बीच तुलना नहीं की जा सकती। records से भरे दिन में ये चार प्रकाशन इस क्षेत्र की परिपक्वता के बारे में सबसे अधिक बताते हैं: अब प्रश्न यह नहीं है कि मापना आता है या नहीं, बल्कि यह है कि माप वास्तव में किस चीज़ को मापता है।
स्रोत
- Meta का AIRA₃ थ्रेड
- Meta के अनुसार सामान्यीकरण और पुनरावर्ती आत्म-सुधार
- IOI 2026 के लिए fine-tuned Nemotron
- arXiv पर IOI तकनीकी रिपोर्ट
- incident wiki और misalignment disclosure पर OpenAI
- OpenAI में आंतरिक code agents की निगरानी
- GPT-5.6 की system card
- दीर्घ-क्षितिज models की सुरक्षा और alignment
- Codex CLI 0.153.4
- Perplexity Computer में GPT-6 Astra
- v0 में GPT-6 Astra
- Genspark ने GPT-6 Astra जोड़ा
- GPT-6 Astra hackathons
- 24 घंटे की सामुदायिक चुनौती
- Replit MCP beta से बाहर
- Replit databases के रात्रिकालीन backups
- Replit Friday Showcase का पुनःप्रसारण
- 5 सितंबर का Gemini CLI v0.60.0 nightly
- Quadrat-IPI, अप्रत्यक्ष injections के सामने नौ models
- VisionGuardrail, multimodal सुरक्षा classifier
- Cisco Skill Scanner का मूल्यांकन
- Grok Imagine Video 1.5 agent
- Odyssey प्रतियोगिता के विजेता
- Cursor द्वारा Basis केस स्टडी
- 31 अगस्त का साप्ताहिक Copilot सारांश
- MTP शब्दावली संक्षिप्तीकरण और kernel का चयन
- Zed 1.18.1
- Madrona की IA40 रैंकिंग में Zed
- GitHub Copilot Day
- Warp ने Stanford पाठ्यक्रम का समर्थन किया
- Runway लघु फ़िल्म
- Perplexity API का changelog
- mini-beatrix-2s
- execution traces और agents का व्यवहार
- Together AI और Render