खोजें

Google ने Gemini 4 Argon की घोषणा की, OpenAI का कहना है कि उसने डिस्टिलेशन अभियान को विफल किया, Cohere ने Embed 5 लॉन्च किया

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Google ने Gemini 4 Argon की घोषणा की, OpenAI का कहना है कि उसने डिस्टिलेशन अभियान को विफल किया, Cohere ने Embed 5 लॉन्च किया

ai-powered-markdown-translator

gemini-3.8-flash-medium के साथ फ्रेंच से हिंदी में अनुवादित लेख।

GitHub पर प्रोजेक्ट देखें ↗

बुधवार, 30 सितंबर को Google ने Gemini 4 Argon की घोषणा की, जो एक फ्रंटियर मॉडल है जिसे सबसे पहले Fairwind Program के विश्वसनीय साइबर रक्षकों के लिए रोल आउट किया जा रहा है, और इसका आउटपुट 10 लाख टोकन तक बढ़ा दिया गया है। OpenAI का कहना है कि उसने अपने मॉडलों के संरक्षित तर्क को निकालने के एक समन्वित अभियान को विफल कर दिया है, जिसका मुख्य हिस्सा वह Moonshot AI से जुड़े व्यक्तियों को जिम्मेदार ठहराता है। Cohere ने अपनी स्वयं की मूल्यांकन पद्धति के साथ Embed 5 लॉन्च किया, Ideogram 4.5 ने बिना किसी आर्टिफ़ैक्ट के क्रमिक रीटचिंग का वादा किया और HeyGen ने MiniMax H3 पर आधारित एक वीडियो मॉडल जारी किया; डेवलपर्स के मोर्चे पर, Claude Code 2.1.286, Zed 1.22.0 और VS Code 1.140 एक ही दिन जारी हुए।


Gemini 4 Argon: Google का नया फ्रंटियर मॉडल, सबसे पहले साइबर रक्षकों के लिए

30 सितंबर — Google ने अपने नए फ्रंटियर मॉडल, Gemini 4 Argon की घोषणा Google DeepMind के सीनियर वाइस प्रेसिडेंट और Google के चीफ़ एआई आर्किटेक्ट (Chief AI Architect) Koray Kavukcuoglu द्वारा हस्ताक्षरित एक ब्लॉग पोस्ट में की। Argon को तीन क्षेत्रों में लंबे और जटिल वर्कफ़्लो (long-horizon workflows) पर गहन तर्क का समर्थन करने के लिए डिज़ाइन किया गया है: वास्तविक दुनिया की परिस्थितियों में सॉफ्टवेयर इंजीनियरिंग, एंटरप्राइज नॉलेज वर्क (कानूनी, वित्त) और साइबर रक्षा।

यह मॉडल अभी जनता के लिए खुला नहीं है। इसे सबसे पहले Fairwind Program के विश्वसनीय साइबर रक्षकों के एक समूह के लिए रोल आउट किया जा रहा है, जिसे 2 सितंबर को Gemini 3.8 Flash Cyber के साथ लॉन्च किया गया था, जो इसे Google की आंतरिक टीमों की तरह ही बिना साइबर सुरक्षा उपायों (cyber guardrails) के प्राप्त कर रहे हैं। डेवलपर्स, उद्यम और आम जनता इसके बाद “जितनी जल्दी संभव हो” इसे प्राप्त करेंगे, जिसकी शुरुआत एपीआई के भुगतान करने वाले ग्राहकों और Google AI Ultra के सब्सक्राइबर्स से होगी, हालांकि किसी तारीख की घोषणा नहीं की गई है। तब तक, Google साइबर और NRBC में हानिकारक अनुरोधों के अस्वीकरण को मजबूत कर रहा है, मॉडल की विचार श्रृंखला और क्रियाओं की निगरानी कर रहा है, और अपने उच्च-जोखिम वाले प्रशिक्षण और मूल्यांकनों को सीलबंद सैंडबॉक्स में अलग रख रहा है; कंपनी का यह भी कहना है कि वह रिलीज से पहले मॉडल एक्सेस की अमेरिकी सरकार की स्वैच्छिक प्रक्रिया में भाग ले रही है।

Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.

🇮🇳 प्रस्तुत है Gemini 4 Argon, हमारा नया फ्रंटियर मॉडल। इसे प्रोग्रामिंग, एंटरप्राइज नॉलेज वर्क और साइबर रक्षा में जटिल वर्कफ़्लो के लिए डिज़ाइन किया गया है, और यह आज से हमारे Fairwind Program के ज़रिए विश्वसनीय टेस्टर्स के एक समूह के लिए रोल आउट हो रहा है। — X पर @GoogleDeepMind

मूल्य निर्धारण पहले ही तय हो चुका है: शुरुआती कीमत के रूप में, इनपुट पर 2 डॉलर प्रति 10 लाख टोकन और आउटपुट पर 10 डॉलर, जो एक दिन पहले लॉन्च किए गए GPT-6.1 Sol की कीमत के बराबर है, इसके बाद एक अज्ञात अवधि के अंत में यह 4 और 20 डॉलर हो जाएगा; कैश्ड इनपुट की लागत सामान्य इनपुट से 95% कम है। आउटपुट सीमा पहले के 64K से बढ़कर 10 लाख टोकन हो गई है, जो Google के अनुसार इस उद्योग में सबसे अधिक है: यह मॉडल किसी कठिन समस्या को हल करने के लिए एक ही ट्रैजेक्टरी में लाखों टोकन उत्पन्न कर सकता है।

प्रति दस लाख टोकन मूल्यशुरुआती दरशुरुआती अवधि के बाद की दर
इनपुट2 डॉलर4 डॉलर
आउटपुट10 डॉलर20 डॉलर

Google DeepMind का पेज उन्नीस पंक्तियों में Argon की तुलना GPT-6 Astra, Claude Fable 5.1 और Claude Opus 5.5 से करता है। Argon इनमें से 13 में शीर्ष स्कोर प्राप्त करता है, CWE-bench v1 (68%) पर GPT-6 Astra के साथ पहला स्थान साझा करता है और 5 में पीछे रह जाता है। एजेंटिक कोड सबसे अधिक प्रतिस्पर्धी क्षेत्र है: DeepSWE v1.1 (77.9%) और Vibe Code Bench पर पहले स्थान पर रहने वाला Argon, FrontierSWE v2 और Terminal-bench 4.0 पर चारों में अंतिम स्थान पर रहा। नॉलेज वर्क में इसकी बढ़त स्पष्ट है, विशेष रूप से Harvey के Legal Agent Benchmark (19.6% बनाम अन्य तीनों के लिए अधिकतम 6.7%) पर, और 256K से 1M टोकन के बीच लॉन्ग कॉन्टेक्स्ट में। प्रत्येक पंक्ति का सर्वश्रेष्ठ स्कोर बोल्ड में है।

मूल्यांकित बेंचमार्क (क्षेत्र)Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
Vals Index (नॉलेज वर्क)68,9 %63,1 %65,8 %67,0 %
AutomationBench (नॉलेज वर्क)51,3 %41,4 %31,4 %42,5 %
Vals Finance Agent v2 (नॉलेज वर्क)65,4 %53,5 %58,9 %58,6 %
Harvey का Legal Agent Benchmark (नॉलेज वर्क)19,6 %5,4 %6,7 %3,8 %
DeepSWE v1.1 (एजेंटिक कोड)77,9 %74,1 %67,4 %74,2 %
FrontierSWE v2 (एजेंटिक कोड)55,0 %65,5 %56,3 %62,3 %
Vibe Code Bench (एजेंटिक कोड)91,9 %89,6 %90,3 %90,3 %
Terminal-bench 4.0 (एजेंटिक कोड)57,4 %58,2 %57,9 %66,4 %
PostTrainBench (ML इंजीनियरिंग)45,3 %44,3 %40,2 %49,3 %
Terminal-Bench Science 0.1 (विज्ञान और गणित)57,6 %68,1 %52,6 %63,3 %
LABBench 2 (विज्ञान और गणित)88,8 %85,4 %68,6 %73,1 %
RiemannBench (विज्ञान और गणित)76,0 %72,0 %65,6 %69,6 %
GraphWalks BFS 128K तक (लॉन्ग कॉन्टेक्स्ट, F1)99,7 %98,7 %91,4 %90,6 %
GraphWalks BFS 256K से 1M (लॉन्ग कॉन्टेक्स्ट, F1)84,2 %71,8 %65,0 %66,8 %
Agent’s Last Exam (कंप्यूटर उपयोग)39,5 %34,2 %—38,2 %
OSWorld-2.0, ऑफ़लाइन सबसेट, आंशिक स्कोर (कंप्यूटर उपयोग)69,2 %72,6 %——
Chartography (मल्टीमॉडल समझ)71,6 %71,0 %46,2 %66,3 %
LVBench (मल्टीमॉडल समझ)91,7 %87,5 %79,7 %83,7 %
CWE-bench v1 (साइबर सुरक्षा)68,0 %68,0 %58,0 %67,0 %

Google में, हज़ारों कर्मचारी पहले से ही इसका उपयोग कर रहे हैं। libgav1 पर, जो Google का ओपन-सोर्स वीडियो डिकोडर है, Argon एजेंट्स ने मौजूदा Rust पोर्ट के 32,000 SIMD कोड की पंक्तियों को सुरक्षित Rust से बदल दिया: परिणामी डिकोडर समान वीडियो आउटपुट के साथ उस पोर्ट की तुलना में 2.7 गुना तेज़ है। अन्य एजेंट्स ने डेटा केंद्रों के लिए मेमोरी ऑप्टिमाइज़ेशन तैयार किए हैं, जिनसे तैनात होने के बाद 300 TiB से अधिक स्थान मुक्त होने की उम्मीद है। साइबर सुरक्षा में, Wiz अपनी Scan for Good पहल में इसका उपयोग कर रहा है: दुनिया भर के अस्पतालों द्वारा उपयोग किए जाने वाले एक हेल्थकेयर सॉफ़्टवेयर में Argon ने संवेदनशील व्यक्तिगत डेटा को उजागर करने वाली एक गंभीर भेद्यता की खोज की, जिसे पिछले फ्रंटियर मॉडल पकड़ नहीं पाए थे।

🔗 Gemini 4 Argon: our next era of frontier intelligence (Google ब्लॉग) 🔗 Google DeepMind का Gemini पेज और बेंचमार्क तालिका


OpenAI का कहना है कि उसने डिस्टिलेशन अभियान को विफल किया और इसके मुख्य हिस्से के लिए Moonshot AI से जुड़े व्यक्तियों को जिम्मेदार ठहराया

30 सितंबर — अपने Security सेक्शन के एक ब्लॉग पोस्ट में, OpenAI ने कहा कि उसने अपने मॉडलों के संरक्षित तर्क (protected reasoning) को निकालने के उद्देश्य से चलाए जा रहे एक समन्वित अभियान का पता लगाकर उसे बेअसर कर दिया है, यानी वह आंतरिक ट्रेस जो कोई मॉडल किसी कार्य को संसाधित करने के लिए उत्पन्न करता है। कंपनी इसे प्रतिकूल डिस्टिलेशन (adversarial distillation) मानती है: किसी अन्य मॉडल को प्रशिक्षित करने, पुनरुत्पादित करने या बेहतर बनाने के लिए किसी मॉडल के आउटपुट या तर्क का व्यवस्थित और अनधिकृत उपयोग।

OpenAI के अनुसार, ऑपरेटरों ने न तो एन्क्रिप्शन तोड़ा, न ही किसी डेटाबेस से छेड़छाड़ की, और न ही उपयोगकर्ताओं की संग्रहीत बातचीत तक सीधे पहुँचे। उन्होंने बातचीत में इस तरह हेरफेर किया कि संरक्षित तर्क एक दृश्य रूप में फिर से सामने आ जाए, उदाहरण के लिए, एक बातचीत से एन्क्रिप्टेड तर्क को कॉपी करके किसी अन्य बातचीत में मॉडल से उसे डिक्रिप्ट और ट्रांसक्राइब करने के लिए कहना। स्वतंत्र शोधकर्ताओं ने जिम्मेदार प्रकटीकरण के माध्यम से समान कमजोरियों की सूचना दी थी, जिनका वर्णन 10 अगस्त को arXiv पर प्रस्तुत शोधपत्र “Stealing Reasoning Traces from Proprietary LLM APIs” में किया गया था; OpenAI ने पुष्टि की कि ये अटैक पाथ वास्तविक थे।

अभियान का चरणOpenAI द्वारा दर्ज की गई तारीख या मात्रा
कम मात्रा में गतिविधि की शुरुआत1 जुलाई
गतिविधि के चरम दिन24 और 25 जुलाई
चरम दिनों में निष्कर्षण पैटर्न का पालन करने वाले अनुरोध16,000, 4,000 से अधिक उपयोगकर्ताओं से
इस पैटर्न से जुड़ा समूह15,000 से अधिक उपयोगकर्ता
समूह का पूर्ण निष्प्रभावीकरण28 जुलाई

जिम्मेदारी तय करने के मामले में, पोस्ट सतर्क रहता है: यह स्थापित नहीं हुआ है कि सभी ऑपरेटर एक ही कर्ता से संबंधित हैं, और चरम दिनों के दौरान 16,000 अनुरोध निष्कर्षण के प्रयास थे, जो आवश्यक रूप से सफल नहीं रहे। हालाँकि, OpenAI इस गतिविधि के मुख्य हिस्से को Kimi के डेवलपर, Moonshot AI से जुड़े व्यक्तियों के लिए जिम्मेदार ठहराता है।

… we attribute a core cluster of the activity to individuals associated with Moonshot AI …

🇮🇳 … हम इस गतिविधि के मुख्य हिस्से का श्रेय Moonshot AI से जुड़े व्यक्तियों को देते हैं … — OpenAI, Security सेक्शन का ब्लॉग पोस्ट

इसके जवाब में, OpenAI ने धोखाधड़ी वाले खातों को प्रतिबंधित या सीमित कर दिया, अपने साइनअप और बुनियादी ढांचे के नियंत्रण को कड़ा कर दिया, संबंधित नेटवर्कों की निगरानी का विस्तार किया और उपयोगकर्ताओं, वर्कस्पेस, संगठनों और मॉडल परिवारों के बीच छिपे हुए तर्क की सुरक्षा को मजबूत किया। इसने उस तरीके को बंद कर दिया जो किसी अन्य उपयोगकर्ता के एन्क्रिप्टेड तर्क को फिर से चलाकर उसकी सामग्री को पुनः प्राप्त करने की अनुमति देता था, और ऐसे नियंत्रण जोड़े जो इसे उजागर करने वाले स्ट्रीमिंग आउटपुट (streaming) का पता लगाते हैं और उसे रोकते हैं। इन निष्कर्षों को Frontier Model Forum और सरकारी चैनलों के माध्यम से साझा किया गया: OpenAI के अनुसार, यह तकनीक केवल उसके मॉडलों तक ही सीमित नहीं है, और कोई भी प्रणाली जो तर्क को पोर्टेबल या फिर से चलाने योग्य बनाती है, वह समान जोखिमों के प्रति संवेदनशील हो सकती है। कंपनी प्रतिकूल डिस्टिलेशन को सुरक्षा और राष्ट्रीय सुरक्षा जोखिम के रूप में प्रस्तुत करती है, क्योंकि निकाले गए तर्क का उपयोग मूल मॉडल के सुरक्षा उपायों के बिना किसी अन्य मॉडल को प्रशिक्षित करने के लिए किया जा सकता है। यह विषय नया नहीं है: फरवरी में, Anthropic ने डिस्टिलेशन अभियानों के लिए DeepSeek, Moonshot AI और MiniMax को जिम्मेदार ठहराया था, और Anthropic 24 सितंबर से तर्क निष्कर्षण सहित कई श्रेणियों में अवरुद्ध अनुरोधों के लिए शुल्क ले रहा है।

🔗 arXiv पर लेख “Stealing Reasoning Traces from Proprietary LLM APIs”


Embeddings: Cohere ने लॉन्च किया Embed 5 और RCP-nDCG@10 मीट्रिक, Perplexity ने जारी किया pplx-embed-v2-context-9b-preview

30 सितंबर — Cohere ने एंटरप्राइज़ सर्च के लिए एम्बेडिंग मॉडल्स की एक फ़ैमिली Embed 5 लॉन्च की है, जो दो टियर्स में उपलब्ध है और दोनों एक ही एम्बेडिंग स्पेस साझा करते हैं: अधिकतम गुणवत्ता और ऑफ़लाइन इंडेक्सिंग के लिए Embed 5 Pro, और इंटरैक्टिव सर्च, हाई-वॉल्यूम RAG और एजेंटिक सर्च के लिए Embed 5 Fast। आउटपुट डायमेंशन समान रखने की शर्त पर, किसी कॉर्पस को Pro के साथ इंडेक्स किया जा सकता है और फिर बिना दोबारा इंडेक्स किए Fast से क्वेरी की जा सकती है: 40 डेवलपमेंट डेटासेट्स पर, Cohere द्वारा अनुशंसित यह दृष्टिकोण पूरी तरह से Pro आधारित सिस्टम की औसतन 98.4% गुणवत्ता बनाए रखता है, जबकि पूरी तरह से Fast आधारित सिस्टम के लिए यह 96.6% है।

दोनों मॉडल 128K टोकन्स तक पढ़ सकते हैं, टेक्स्ट, इमेज या दोनों को एक ही वेक्टर में फ़्यूज़ करके स्वीकार करते हैं, 100 से अधिक भाषाओं को कवर करते हैं और float, int8 या बाइनरी में 256 से 2,048 डायमेंशन के वेक्टर्स उत्पन्न करते हैं। Cohere int8 में 1,024 डायमेंशन की सलाह देता है, यानी 2,048 डायमेंशन पर float32 में 8 KB की तुलना में 1 KB प्रति वेक्टर। Pro की लागत प्रति मिलियन टेक्स्ट टोकन 0.12 डॉलर और Fast की लागत 0.08 डॉलर है (एक तिहाई कम), जिसमें औसतन 2.4 गुना अधिक दस्तावेज़ थ्रूपुट मिलता है; दोनों के लिए इमेज की कीमत प्रति मिलियन टोकन 0.40 डॉलर है। Embed 5 आज से Cohere API, Model Vault, Microsoft Foundry और Amazon SageMaker के साथ-साथ North में भी उपलब्ध है, और इसे vLLM के साथ निजी तौर पर तैनात किया जा सकता है।

बेंचमार्क (मीट्रिक)Embed 5 ProEmbed 5 Fastउद्धृत अन्य मॉडल
ViDoRe V3, 8 डोमेन (RCP-nDCG@10)85.884.5Voyage 4 Large 83.7 ; Gemini Embedding 2 83.2 ; OpenAI text-embedding-3-large 75.5
FinanceBench (RCP-nDCG@10)80.180.0Pro, OpenAI text-embedding-3-large से 21.4 अंक आगे
FinQA (RCP-nDCG@10)90.088.8—
ViDoRe V3 Finance (RCP-nDCG@10)85.083.9—
पार्स किए गए PDF, सुइट का औसत (RCP-nDCG@10)84.883.4Voyage 4 Large 83.6 ; Gemini Embedding 2 80.8 ; Embed 4 78.6
टेक्स्ट और इमेज फ़्यूज़्ड, 5 सेट (nDCG@10)82.381.2Gemini Embedding 2 61.3
पेज इमेज, 5 वित्तीय सेट (nDCG@10)77.073.2Embed 4 71.1 ; Voyage Multimodal 3.5 70.1 ; Gemini Embedding 2 56.7
5 यूरोपीय भाषाएं (nDCG@10 या RCP-nDCG@10)77—Voyage 4 Large 76 ; Gemini Embedding 2 73

इनमें से अधिकांश स्कोर RCP-nDCG@10 में व्यक्त किए गए हैं, जो वह मूल्यांकन पद्धति है जिसे Cohere ने उसी दिन प्रकाशित किया (नीचे देखें): पोस्ट में एक नोट स्पष्ट करता है कि यह उम्मीदवारों के एक निश्चित सेट को पुनः व्यवस्थित (रीऑर्डर) करता है और इसलिए प्रथम-स्तरीय पुनर्प्राप्ति के बजाय रैंकिंग की गुणवत्ता को मापता है। दूसरी बहुभाषी तालिका पूरी तरह पढ़ने लायक है: Cohere इसमें Embed 4 की तुलना में अपनी प्रगति पर प्रकाश डालता है, जो फ़ारसी में 13 अंकों तक है, लेकिन इन दस भाषाओं में, Gemini Embedding 2 नौ भाषाओं में Embed 5 Pro से आगे है, जिसमें चीनी एकमात्र अपवाद है, और Voyage 4 Large पाँच में इससे आगे है। Cohere 8 अक्टूबर को X पर एक सत्र के दौरान Embed 5 प्रस्तुत करेगा।

🔗 Cohere का Embed 5 ब्लॉग पोस्ट · X पर @cohere की घोषणा

RCP-nDCG@10, वह मीट्रिक जिससे Cohere Embed 5 को मापता है

30 सितंबर — Cohere ने खोज मूल्यांकन की अपनी पद्धति RCP-nDCG@10 (Rubric-Calibrated Preferences nDCG@10) भी प्रकाशित की है। शुरुआती बिंदु: MTEB और BEIR का मीट्रिक nDCG, परिणामों की तुलना पहले से एनोटेट किए गए दस्तावेज़ों की सूची से करता है, जो स्वाभाविक रूप से अधूरी होती है, जिससे कभी एनोटेट न किया गया प्रासंगिक दस्तावेज़ कोई स्कोर नहीं दिला पाता; Cohere के अध्ययन में, अप्रासंगिक चिह्नित किए गए 28% दस्तावेज़ों को इंसानों द्वारा उपयोगी माना गया। RCP-nDCG@10 निर्णय को एक कैलिब्रेटेड AI जज को सौंपता है, जो प्रत्येक क्वेरी के लिए पाँच समान हाँ/ना प्रश्नों के उत्तर देता है और समूहों में दस्तावेज़ों की तुलना करता है। 289 मुकाबलों में 46 एनोटेटर्स के साथ ब्लाइंड वैलिडेशन: जब दोनों मीट्रिक्स अलग-अलग विजेताओं का चयन करते हैं, तो 70% मामलों में इंसान RCP-nDCG से सहमत होते हैं। पेपर, कोड और डेटा प्रकाशित कर दिए गए हैं, और MTEB के मुख्य अनुरक्षक ने इसके एकीकरण की घोषणा की है। Cohere का कहना है कि उसने अपनी पाँचवीं पीढ़ी के Embed और Rerank को इसी मीट्रिक के आधार पर अनुकूलित किया है (Rerank की कोई तारीख अभी तय नहीं है), और आगाह किया है कि केवल ऐतिहासिक nDCG के आधार पर ये मॉडल हमेशा सर्वश्रेष्ठ नहीं दिख सकते हैं।

🔗 Cohere का RCP-nDCG@10 ब्लॉग पोस्ट · GitHub पर कोड और डेटा

Perplexity ने pplx-embed-v2-context-9b-preview और context-bench बेंचमार्क जारी किया

30 सितंबर — Perplexity ने Hugging Face पर MIT लाइसेंस के तहत प्रीव्यू के रूप में pplx-embed-v2-context-9b-preview जारी किया, जो एक कॉन्टेक्स्टुअल एम्बेडिंग्स मॉडल है: किसी दस्तावेज़ के प्रत्येक अंश को पूरे दस्तावेज़ को ध्यान में रखकर एनकोड किया जाता है, ताकि “वह” जैसा संदर्भ सही एंटिटी से जुड़ा रहे। प्रति क्वेरी केवल एक “गोल्ड” अंश (gold passage) के बजाय, यह मॉडल एक शिक्षक—Perplexity के कॉन्टेक्स्ट कम्प्रेशन मॉडल—से सीखता है, जो दस्तावेज़ के प्रत्येक टोकन को स्कोर करता है: इस प्रकार यह उत्तर और उसे प्रमाणित करने वाले अंशों दोनों को खोजना सीखता है। ब्लॉग पोस्ट के सह-हस्ताक्षरकर्ता turbopuffer के एक निजी बेंचमार्क context-bench (2,099 क्वेरी, 38,894 दस्तावेज़) पर ब्लाइंड मूल्यांकन में, यह voyage-context-4 से आगे निकल गया; ConTEB पर, यह सभी कार्यों को जीते बिना सर्वश्रेष्ठ औसत प्राप्त करता है। Perplexity ने आगाह किया है कि वज़न और इंटरफ़ेस अभी भी बदल सकते हैं, और वह बिना किसी निश्चित तिथि के अपने API के माध्यम से एक्सेस तैयार कर रहा है।

Perplexity द्वारा प्रकाशित मापpplx-embed-v2-context-9b-previewvoyage-context-4 से अंतर
context-bench पर उत्तर रिकॉल, K = 10 पर45.5 %+14.4 अंक
context-bench पर साक्ष्य रिकॉल, K = 10 पर40.6 %+5.0 अंक
प्रति वेक्टर स्टोरेज (1,024 डायमेंशन, int8)1 KBfloat32 में voyage-context-4 से 8 गुना कम

🔗 Perplexity Research का ब्लॉग पोस्ट · Hugging Face पर मॉडल


Ideogram 4.5: क्रमिक एडिट्स के लिए डिज़ाइन किया गया इमेज एडिटिंग मॉडल

30 सितंबर — Ideogram ने Ideogram 4.5 लॉन्च किया है, जिसे वह “सबसे सटीक संपादन मॉडल” के रूप में प्रस्तुत करता है। शुरुआती अवलोकन: प्रत्येक संपादन के साथ, इमेज मॉडल आर्टिफ़ैक्ट्स, पिक्सेल शिफ्ट और रंग बदलाव जोड़ते हैं, जिससे कई बार एडिट करने के बाद छवि जल्दी ही अनुपयोगी हो जाती है। Ideogram 4.5 को इस संचय को समाप्त करने और मल्टी-टर्न एडिटिंग (multi-turn editing) को संभव बनाने के लिए डिज़ाइन किया गया है।

Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.

🇮🇳 प्रस्तुत है Ideogram 4.5, सबसे सटीक संपादन मॉडल। प्रत्येक संपादन के साथ, अत्याधुनिक मॉडल आर्टिफ़ैक्ट्स, पिक्सेल ड्रिफ्ट और रंग परिवर्तन जोड़ते हैं। Ideogram 4.5 आर्टिफ़ैक्ट संचय को समाप्त करता है, जिससे मल्टी-टर्न संपादन संभव हो पाता है। Ideogram में, API में और लॉन्च पार्टनर्स के पास उपलब्ध। ओपन वेट्स जल्द ही आ रहे हैं। — @ideogram_ai X पर

इस बात के समर्थन में, Ideogram ने GPT Image 2.5 Sunburst, Nano Banana Pro और Nano Banana 2 के साथ समान क्रमिक एडिट्स की आमने-सामने तुलना प्रकाशित की है, जिनके आउटपुट उसके अनुसार कुछ ही एडिट्स में अनुपयोगी हो जाते हैं। तुलना दृश्य आधारित है, बिना किसी संख्यात्मक स्कोर के। उदाहरणों में रंग और प्रकाश (कंपोज़ीशन बदले बिना छाया, प्रतिबिंब और हाइलाइट्स परिवर्तन के अनुसार ढलते हैं), टेक्स्ट संशोधन, उत्पाद फ़ोटोग्राफ़ी, इंटीरियर डिज़ाइन, पुरानी फ़ोटो की चरण-दर-चरण बहाली, स्केच या डेप्थ मैप से इमेज में परिवर्तन, और क्रॉपिंग शामिल हैं।

मॉडल किसी भी रिज़ॉल्यूशन पर संपादन (Zoom editing) की सुविधा भी पेश करता है: एक हाई-डेफ़िनिशन छवि का कोई क्षेत्र—Ideogram के उदाहरण में 24.2 मेगापिक्सल (4,016 × 6,016 पिक्सेल)—छवि को छोटा किए बिना संपादित किया जाता है, और इसके किनारों को संरक्षित रखा जाता है ताकि इसे बिना किसी दृश्य जोड़ के वापस एकीकृत किया जा सके। Ideogram के अनुसार, यद्यपि इसे लक्षित संपादन के लिए डिज़ाइन किया गया है, यह मॉडल सामान्य संपादन में भी बहुत अच्छा प्रदर्शन करता है।

घोषणा का विवरणजो ज्ञात है
उपलब्धता30 सितंबर से Ideogram और API में
लॉन्च पार्टनर्सPika और Luma, जिन्होंने उसी दिन इसकी घोषणा की
ओपन वेट्स”जल्द ही” का वादा, जून में प्रकाशित Ideogram 4.0 की तरह
कीमतप्रकाशित नहीं

🔗 Ideogram 4.5 मॉडल पेज


HeyGen Video: MiniMax H3 पर आधारित एक वीडियो मॉडल, API के ज़रिए उपलब्ध

30 सितंबर — HeyGen ने HeyGen Video लॉन्च किया, जो उन उद्यमों के लिए एक वीडियो जनरेशन मॉडल है जो भारी लागत चुकाए बिना प्रोडक्शन-क्वालिटी वीडियो चाहते हैं। MiniMax H3 पर निर्मित और HeyGen द्वारा पोस्ट-ट्रेन्ड, यह टेक्स्ट या इमेज से वीडियो तैयार करता है, जिसमें उसी कॉल में ऑडियो भी जेनरेट होता है, और इसका उपयोग HeyGen के API के साथ-साथ OpenRouter, Runware और ComfyUI पर किया जा सकता है।

कीमत के मामले में, तीन आंकड़े मौजूद हैं। कैटलॉग पेज के अनुसार, अक्टूबर के अंत तक कीमत 0.01 डॉलर प्रति सेकंड से शुरू होती है, जो मानक दर 0.02 डॉलर पर 50% की छूट है। वहीं इसकी तुलनात्मक तालिका लॉन्च ऑफ़र से पहले ऑडियो के साथ 768p में सूची मूल्य को दर्शाती है: 0.03 डॉलर प्रति सेकंड। इस कीमत पर भी, HeyGen Video तुलना किए गए मॉडल्स में सबसे सस्ता है।

तुलना किया गया मॉडलप्रति सेकंड सूची मूल्य (768p, ऑडियो)HeyGen का आंतरिक Elo (HeyGen Video = 1,000)
HeyGen Video0.03 डॉलर1,000
Seedance 2.00.303 डॉलर955
H3 Max0.08 डॉलर952
H3 Max Turbo0.04 डॉलर920
H3 Max balanced0.08 डॉलर860
Kling 3.0 Pro0.168 डॉलर857
Veo 3.10.40 डॉलर744

गुणवत्ता पर, HeyGen Artificial Analysis Arena की क्वेरीज़ (4,800 वोट) पर किए गए एक आंतरिक मूल्यांकन पर निर्भर करता है, जिसमें उसके मॉडल का Elo 1,000 पर मानकीकृत किया गया है। H3 Max के ख़िलाफ़ ब्लाइंड प्रेफ़रेंस में, 650 वोटों में से 55.8% HeyGen Video के पक्ष में गए, जिसकी सीमा 49 से 62% के बीच है, जो बराबरी की संभावना को बाहर नहीं करती। इमेज-टू-वीडियो में 10-सेकंड की क्लिप के लिए, डिफ़्यूज़न ट्रांसफ़ॉर्मर का इन्फ़्रेंस समय 3.7 सेकंड तक गिर जाता है, जबकि H3 Max Turbo के लिए 4.1 और H3 Max के लिए 8.3 सेकंड है (कैप्शनिंग समय को छोड़कर)।

MiniMax ने इस लॉन्च का स्वागत किया और उसी दिन H3 से व्युत्पन्न एक अन्य मॉडल को प्रदर्शित किया: Creatify का Boreal-H3, जो विज्ञापनों के लिए अनुकूलित एक वीडियो मॉडल है।

🔗 HeyGen Video कैटलॉग · X पर @HeyGen की घोषणा


सामान्य-उद्देश्यीय असिस्टेंट्स और एजेंट्स: Gemini के स्किल्स, Manus Flex और Grok Bot

Gemini ऐप ने स्किल्स लॉन्च किए, जो Gems की जगह लेंगे

30 सितंबर — Google ने Gemini ऐप में स्किल्स लॉन्च किए हैं: ऐसे निर्देश जिन्हें एक बार सेव किया जाता है और उनके नाम से पहले स्लैश टाइप करके कॉल किया जा सकता है। Gemini बातचीत के आधार पर भी इन्हें बना सकता है और प्रॉम्प्ट मेल खाने पर इन्हें अपने आप निष्पादित कर सकता है; कई स्किल्स को एक साथ संयोजित किया जा सकता है, और प्रत्येक में संदर्भ फ़ाइलें (सादा पाठ, PDF, चित्र) शामिल हो सकती हैं। पहले से ही Gemini Spark में उपलब्ध, ये दुनिया भर में Gemini चैट में सभी Google AI सदस्यता स्तरों के लिए और फ़िलहाल 18 वर्ष और उससे अधिक उम्र के उपयोगकर्ताओं के लिए आ रहे हैं; Workspace ग्राहक आने वाले हफ़्तों में जुड़ेंगे। स्किल्स Gems की जगह लेंगे, जो व्यक्तिगत खातों के लिए नवंबर से, Workspace business, enterprise और nonprofit के लिए मार्च 2027 में और शिक्षा के लिए जून 2027 में स्वचालित माइग्रेशन के साथ बंद हो जाएंगे। मिनी-ऐप निर्माण टूल Opal भी नवंबर में बंद हो जाएगा, साथ ही “Gems by Google Labs” भी, जिन्हें माइग्रेट नहीं किया जाएगा।

🔗 Gemini में स्किल्स को अपने सबसे दोहराव वाले कार्य संभालने दें (Google ब्लॉग)

Manus Flex: Manus एजेंट में अपनी खुद की API की का उपयोग

29 सितंबर — Manus ने Manus Flex लॉन्च किया, जो किसी समर्थित इनफ़्रेंस प्रदाता की API की के साथ Manus को चलाने की अनुमति देता है (bring your own API key)। अब तक, Manus स्वयं मॉडल चुनता था और एजेंट हार्नेस तथा इन्फ़्रास्ट्रक्चर प्रदान करता था; Flex के साथ, किसी प्रदाता की की उन्हीं प्रोजेक्ट्स, टूल्स, रनटाइम एनवायरनमेंट्स और एजेंट वर्कफ़्लो को शक्ति प्रदान करती है, जिसमें मुख्य मॉडल और रीज़निंग के प्रयास स्तर का विकल्प उपयोगकर्ता के पास होता है। बिलिंग विभाजित होती है: इनफ़्रेंस का बिल सीधे प्रदाता द्वारा भेजा जाता है, जबकि किसी कार्य द्वारा उपयोग की जाने वाली अन्य सेवाएँ और इन्फ़्रास्ट्रक्चर Manus क्रेडिट्स की खपत जारी रखते हैं। OpenRouter, Fireworks और Modal इनफ़्रेंस पार्टनर प्रोग्राम (Manus Flex Inference Partner Program) के पहले तीन सदस्य हैं। Manus 2.0 के लॉन्च के अगले दिन प्रकाशित इस पोस्ट में न तो किसी प्लान, न मूल्य निर्धारण और न ही मॉडलों की सूची का उल्लेख है।

🔗 Manus Flex का परिचय

Grok Bot कोडिंग का काम Cursor को सौंपता है और पुल रिक्वेस्ट्स प्रबंधित करता है

30 सितंबर — Team Bots के दो दिन बाद, SpaceXAI ने सॉफ़्टवेयर विकास के लिए Grok Bot को और मज़बूत किया। @bot खाते के एक थ्रेड में, प्रकाशक ने घोषणा की कि उसके Bots कोडिंग कार्य Cursor को सौंप सकते हैं, GitHub और Origin प्लगइन्स (जिसका विवरण नहीं दिया गया है) के माध्यम से पुल रिक्वेस्ट्स प्रबंधित कर सकते हैं और जो वे बनाते हैं उसके वीडियो डेमो साझा कर सकते हैं। SpaceXAI अपनी स्वयं की इंजीनियरिंग टीम के बॉट्स को इंस्टॉल करने योग्य टेम्पलेट्स (templates) के रूप में भी प्रकाशित करता है, जिनमें से प्रत्येक अपने स्किल्स, रूटीन और कनेक्टर्स के साथ आता है। थ्रेड में किसी प्लान, कीमत या तारीख का उल्लेख नहीं है, और x.ai पर इसके साथ कोई ब्लॉग पोस्ट नहीं है। Cursor के साथ संबंध नया नहीं है: सितंबर की शुरुआत में Grok और Cursor Enterprise ग्राहकों को दो सप्ताह के लिए Grok Bot for Enterprise निःशुल्क दिया गया था; जो बदल गया है वह यह है कि अब एक Bot स्वयं कोडिंग कार्य डेलिगेट करता है।

🔗 X पर @bot का थ्रेड


रोबोटिक्स और वर्ल्ड मॉडल्स: Runway का Praxis-1, Ai2 का MolmoAct 2 और NVIDIA का Physis-Lang

Runway ने पेश किया Praxis-1, ओपन-वेट्स वाला वर्ल्ड एक्शन मॉडल

30 सितंबर — Runway ने Praxis-1 पेश किया, जो ओपन-वेट्स वाला उसका पहला वर्ल्ड एक्शन मॉडल (world action model) है, जिसे वास्तविक रोबोटों को संचालित करने के लिए डिज़ाइन किया गया है। यह Solaris या GWM Worlds 2 जैसे इसके वर्ल्ड मॉडल्स के समान वीडियो प्री-ट्रेनिंग पर आधारित है, और इसका उद्देश्य रोबोटिक्स डेवलपर्स और शोधकर्ताओं के लिए एक सामान्य पॉलिसी मॉडल बनना है। Runway का दांव: रोबोटिक डिमॉन्स्ट्रेशन दुर्लभ हैं, जबकि वीडियो लगभग असीमित हैं। इसके डिमॉन्स्ट्रेशन में एक ही पॉलिसी बिना किसी पुनः-प्रशिक्षण के स्टूडियो से किचन में काम करने लगती है। अभी कुछ भी डाउनलोड के लिए उपलब्ध नहीं है: Praxis-1 का परीक्षण Noble Machines, Standard Bots और Ultra में चल रहा है, प्रत्येक अपने स्वयं के हार्डवेयर पर, और वज़न (वेट्स) सहित इसकी सार्वजनिक रिलीज़ की घोषणा अगले कुछ महीनों में की गई है।

Runway द्वारा प्रकाशित मेट्रिकघोषित परिणाम
वर्ल्ड मॉडल में सिमुलेशन और वास्तविक परिणामों के बीच सहसंबंध0,95
वेब वीडियो के साथ, फाइन-ट्यूनिंग के बाद अंतिम प्लेसमेंट त्रुटि16,1 cm
टेलीऑपरेटेड रोबोट वीडियो के साथ वही त्रुटि16,0 cm

🔗 Runway Research पर Praxis-1

आयोजक द्वारा फाइन-ट्यूनिंग के बाद, Ai2 का MolmoAct 2 Reality Check में शीर्ष पर

30 सितंबर — Ai2 ने घोषणा की कि उसका पूरी तरह से खुला रोबोटिक्स मॉडल, MolmoAct 2, वास्तविक परिस्थितियों में हेरफेर के एक स्वतंत्र बेंचमार्क Reality Check पर समग्र सफलता दर में पहले स्थान पर रहा है, हालांकि इसमें एक बड़ा अंतर है: मॉडलों को आयोजक Poke & Wiggle द्वारा बेंचमार्क के कार्यों पर फाइन-ट्यून किया गया है। इस कंपनी द्वारा एक दिन पहले लॉन्च किए गए Reality Check में म्यूनिख के Deutsches Museum में स्थापित FR3 Duo स्टेशनों पर वास्तविक रोबोटों पर 14,400 निष्पादन शामिल हैं, जो दस अलग-अलग परिवेशों में किए गए (जैसे स्क्रू छांटना, DC कनेक्टर प्लग करना, स्क्रूड्राइवर से टूलबॉक्स खोलना…)। दो पहलू अभी भी “आगामी” हैं: प्रशिक्षण क्षेत्र से बाहर रखी गई वस्तुएं और स्टेशनों के 100 घंटों के डेटा पर मिड-ट्रेनिंग।

मूल्यांकित मॉडलसमग्र सफलताप्रति परिवेश लगभग 10 डिमॉन्स्ट्रेशन के बाद सफलताप्रति परिवेश लगभग 300 डिमॉन्स्ट्रेशन के बाद सफलता
MolmoAct 228 %4 %44 %
Pi 0.521 %5 %33 %
DiT-Flow19 %2 %29 %
GR00T N1.712 %4 %19 %

🔗 Ai2 का ट्वीट · Reality Check लीडरबोर्ड

Physis-Lang: वर्ल्ड मॉडल्स को भौतिकी समझाने वाले कैप्शन

29 सितंबर — NVIDIA, MIT और ऑक्सफ़ोर्ड विश्वविद्यालय के शोधकर्ताओं ने Physis-Lang प्रकाशित किया, जो वर्ल्ड मॉडल्स को बेहतर बनाने के लिए वीडियो कैप्शन में भौतिकी संबंधी तर्क (फिज़िकल रीज़निंग) जोड़ने वाला एक फ्रेमवर्क है। कैप्शन कारणों, शामिल नियमों और प्रभावों को स्पष्ट करते हैं; एक विशेष क्रिटिक लापता या असमर्थित दावों की पहचान करता है, एक एजेंट कैप्शनिंग निर्देशों को परिष्कृत करता है, और मॉडल की विफलताओं का उपयोग उन वीडियो को खोजने के लिए किया जाता है जो इसकी कमियों को पूरा करेंगे। NVIDIA के अनुसार, केवल प्रॉम्प्ट में इस रीज़निंग को जोड़ने से, बिना किसी पुनः-प्रशिक्षण के, Cosmos 3 का PhyGenBench स्कोर 5.62 अंक बढ़ जाता है। प्रशिक्षण के साथ, Cosmos3-Super और Cosmos3-Nano पर Physis-Lang इमेज-टू-वीडियो में Physics-IQ Verified रैंकिंग के शीर्ष दो स्थानों पर काबिज है (पिछले सर्वश्रेष्ठ स्कोर 42.7 के मुकाबले 48.2 और 43.3)। PhyGenBench और VideoPhy-2 का मूल्यांकन GPT-5.5 द्वारा किया गया है, और Veo 3.1, VideoPhy-2 के पूरे सेट पर थोड़ा आगे बना हुआ है।

वीडियो भौतिकी बेंचमार्कCosmos3-NanoVeo 3.1Cosmos3-Nano पर Physis-Lang
PhyGenBench61,6765,6371,04
Physics-IQ Verified40,2334,9943,41
VideoPhy-2 Hard48,3158,4362,36
VideoPhy-2, पूरा सेट60,4168,8768,02

🔗 Physis-Lang प्रोजेक्ट पेज · X पर @NVIDIAAI की घोषणा


ओपन मॉडल्स: Hunmin-397B-A17B-CUA और JEV-27B-VL

Hunmin-397B-A17B-CUA ने 397 बिलियन पैरामीटर वाले MoE में Qwen-CUA की एजेंट क्षमताओं को जोड़ा

30 सितंबर — Hugging Face कम्युनिटी ब्लॉग पर, hojun Lee ने Hunmin-397B-A17B-CUA का विवरण दिया है, जो mncai संगठन द्वारा Apache-2.0 के तहत जारी किया गया एक कंप्यूटर-उपयोग (computer use) मॉडल है। हालांकि, लेखकों ने खुद एक चेतावनी दी है: मूल्यांकन आंतरिक रूप से किए गए हैं, जिनमें एजेंट बेंचमार्क के लिए केवल एक रन है, और ये प्रकाशित लीडरबोर्ड से तुलनीय नहीं हैं (बेस मॉडल OSWorld पर 48.16 प्राप्त करता है, जबकि OSWorld-Verified पर 62.2 की घोषणा की गई थी)। यह मॉडल Qwen3.5-397B-A17B पर आधारित है, जो 17 बिलियन सक्रिय मापदंडों वाला एक मिक्सचर ऑफ एक्सपर्ट्स (MoE) है, और पूरा प्रोजेक्ट आठ B200 के एक नोड पर पूरा किया गया था। टीम ने अपने बेस और पहले से ही विशेषीकृत Qwen-CUA के बीच वेट्स के अंतर की गणना की, और मॉड्यूल के एक चयन पर केवल एक लो-रैंक संस्करण को ट्रांसप्लांट किया: अकेले इस ट्रांसफर ने OSWorld-316 को 48.84 से बढ़ाकर 68.25 कर दिया, बिना विज़ुअल ग्राउंडिंग में Qwen-CUA की कमियों को अपनाए। इसके बाद फाइन-ट्यूनिंग और फिर GRPO रीइन्फोर्समेंट लर्निंग ने 4.3 अंक और जोड़े।

मूल्यांकन बेंचमार्क (आंतरिक प्रोटोकॉल)बेस Qwen3.5-397BHunmin-CUAQwen-CUA (स्रोत)
OSWorld, 360 कार्य48,1670,4577,12
WindowsAgentArena, 153 कार्य41,7750,8556,68
ScreenSpot-Pro72,7475,6162,20
KMMLU-Pro (कोरियाई)77,9176,1271,41

🔗 Hunmin-CUA ब्लॉग पोस्ट · Hugging Face पर वेट्स

AutoTrust AI ने JEV-27B-VL जारी किया, एक ओपन डिसीजन मॉडल जो छवियों का भी मूल्यांकन करता है

30 सितंबर — AutoTrust AI ने 27 सितंबर को पेश किए गए अपने ओपन डिसीजन मॉडल JEV-27B का विज़न-सक्षम संस्करण JEV-27B-VL Apache-2.0 के तहत जारी किया। इसे छवियां और टेक्स्ट दिखाए जाते हैं, एक प्रश्न पूछा जाता है, और यह लगभग सौ मिलीसेकंड में प्रत्येक विकल्प के लिए कैलिब्रेटेड संभाव्यता के साथ एक ही पास में उत्तर देता है; जब प्रश्न में आवश्यकता होती है, तो यह छवियों को देखकर चरण-दर-चरण तर्क करता है। इसके बावजूद इसके डिसीजन हेड ने प्रशिक्षण के दौरान कोई भी छवि नहीं देखी थी। मुख्य परीक्षण: शॉर्ट-वीडियो ऐप के सार्वजनिक डेटासेट MicroLens पर, यह केवल थंबनेल के आधार पर 200 उपयोगकर्ताओं के लिए 20 उम्मीदवार वीडियो को रैंक करता है, और 59,045 उपयोगकर्ताओं पर प्रशिक्षित सहयोगात्मक फ़िल्टरिंग के साथ AUC में बराबरी करता है, जिसमें टॉप 5 में सही वीडियो की दर बेहतर रही। लेखकों ने याद दिलाया कि यह परिणाम 200 उपयोगकर्ताओं के केवल एक डेटासेट से आया है।

MicroLens पर सिफ़ारिश पद्धतिAUCटॉप 5 में सही वीडियो
JEV-27B-VL, केवल थंबनेल, बिना किसी इंटरैक्शन डेटा के0,72759 %
59,045 उपयोगकर्ताओं पर प्रशिक्षित सहयोगात्मक फ़िल्टरिंग0,72849 %
JEV-27B-VL, केवल शीर्षक0,64946 %
यादृच्छिक क्रम0,48921 %

🔗 JEV-27B-VL ब्लॉग पोस्ट


लीडरबोर्ड: Hugging Face का Open TTS Leaderboard और LILT का AURORA

Hugging Face ने ओपन स्पीच सिंथेसिस रैंकिंग, Open TTS Leaderboard लॉन्च किया

30 सितंबर — Hugging Face ने Open TTS Leaderboard लॉन्च किया, जो ओपन और बहुभाषी मॉडलों पर केंद्रित एक टेक्स्ट-टू-स्पीच (text-to-speech, TTS) लीडरबोर्ड है। Hub पर 8,000 से अधिक TTS मॉडल हैं, लेकिन मानक वोटिंग एरेना इस गति के साथ तालमेल नहीं बिठा पा रहे हैं और ओपन मॉडलों का प्रतिनिधित्व कम करते हैं: ब्लॉग पोस्ट के अनुसार, Artificial Analysis द्वारा रैंक किए गए 92 मॉडलों में से केवल 16 ही ओपन-वेट्स वाले हैं। इसलिए यह लीडरबोर्ड वोटों को वस्तुनिष्ठ मीट्रिक्स से बदल देता है: बोधगम्यता (अनुरोधित टेक्स्ट और Qwen3 ASR द्वारा इसके ट्रांसक्रिप्शन के बीच प्रति शब्द या प्रति वर्ण त्रुटि दर), गति (बैच इंफरेंस और पहले ऑडियो तक का समय, H200 और CPU पर) और क्लोन की गई आवाज़ की निष्ठा (WavLM समानता)। किसी मॉडल का मूल्यांकन करने में हफ़्तों के मतदान के बजाय केवल कुछ घंटे लगते हैं। अंग्रेज़ी में, Kokoro-82M, supertonic-3 और Fish Audio का s2-pro आगे हैं; बहुभाषी में, OmniVoice, s2-pro और Fun-CosyVoice3-0.5B। लेखक आगाह करते हैं कि न तो स्वाभाविकता और न ही अभिव्यक्ति को मापा गया है, और वे अपने मूल्यांकन स्क्रिप्ट “जल्द ही” प्रकाशित करेंगे।

🔗 Open TTS Leaderboard ब्लॉग पोस्ट · Hugging Face पर लीडरबोर्ड

LILT ने एजेंट कार्यों का बहुभाषी लीडरबोर्ड AURORA लॉन्च किया

30 सितंबर — LILT ने AURORA लॉन्च किया, जो गैर-अंग्रेज़ी एजेंट कार्यों पर अत्याधुनिक मॉडलों का मूल्यांकन करने वाला एक लीडरबोर्ड है, जिसे बिना किसी मशीन अनुवाद के मूल भाषा विशेषज्ञों द्वारा पूरी तरह से डिज़ाइन और सत्यापित किया गया है। चार बेंचमार्क इसे शुरू करते हैं: दस भाषाओं में 324 कोडिंग कार्यों वाला एक बहुभाषी Terminal-Bench, ग्राहक सहायता के लिए τ³-bench का एक बहुभाषी संस्करण, लंबे संदर्भ में निर्देशों का पालन करने के लिए MultiChallenge, और एजेंटिक रीज़निंग के लिए GAIA-v2-LILT। Claude Opus 5.5 बहुभाषी Terminal-Bench में शीर्ष पर है और सभी पाँच भाषाओं में τ³-bench में पहले स्थान पर है। GAIA पर, मॉडल मशीन अनुवाद की तुलना में LILT द्वारा ऑडिट किए गए संस्करण पर औसतन 20.7 अंक अधिक प्राप्त करते हैं: LILT के अनुसार, यह अंतर अनुवाद द्वारा उत्पन्न त्रुटि को दर्शाता है। एक ही संवाद अंग्रेज़ी की तुलना में कोरियाई या अरबी में लगभग 1.4 गुना अधिक टोकन की खपत करता है।

मूल्यांकित मॉडल (बहुभाषी Terminal-Bench, अंश)औसत सफलता
Claude Opus 5.5 (effort high)76,4 %
Claude Opus 5 (effort high)73,5 %
Gemini 3.8 Flash67,3 %
GPT-6 Sol64,8 %
Command A+4,3 %

🔗 LILT का AURORA ब्लॉग पोस्ट · AURORA लीडरबोर्ड


सार्वजनिक क्षेत्र और उद्यम: Claude for Government, Anthropic का ख़रीदारी एजेंट और America’s SBDC के साथ OpenAI

Claude for Government सामान्य उपलब्धता में पहुँचा

30 सितंबर — Claude for Government बीटा से बाहर आ गया है: Anthropic ने अमेरिकी संघीय और राज्य एजेंसियों के लिए इसकी सामान्य उपलब्धता की घोषणा की है। जुलाई से सार्वजनिक बीटा में रहा यह प्लेटफ़ॉर्म व्यावसायिक ग्राहकों के समान सुविधाओं के साथ FedRAMP High अधिकृत परिवेश में Claude की कोडिंग और एजेंटिक कार्य क्षमताएं प्रदान करता है; Claude Code CLI और Claude for Microsoft 365 यहां अर्ली एक्सेस में आ रहे हैं। कोई प्रति-सीट लाइसेंसिंग नहीं है: एजेंसियां निर्धारित स्तरों में उपयोग के लिए भुगतान करती हैं, जिसमें एक सख्त सीमा होती है जो प्रतिबद्ध बजट से अधिक होने से रोकती है, और SCIM समूह मैपिंग सीट स्तर के आधार पर दर सीमाएं, डॉलर सीमाएं और अधिकृत मॉडल निर्धारित करती हैं। नियंत्रण के मामले में, Anthropic की ओर से संवेदनशील परिचालनों के लिए दो-व्यक्ति अनुमोदन की आवश्यकता होती है, उपयोग निर्यात में केवल मीट्रिक डेटा होता है, और बातचीत का इतिहास एजेंसी द्वारा प्रबंधित डिवाइस पर ही रहता है। Anthropic ने किसी भी मूल्य निर्धारण को प्रकाशित नहीं किया है।

🔗 Claude for Government अब सामान्य रूप से उपलब्ध है

Anthropic में Managed Agents पर निर्मित एक एजेंट बिक्री संबंधी पूछताछ संभालता है

30 सितंबर — Anthropic ने साझा किया कि कैसे उसकी बिक्री टीम ने बीटा में मौजूद Claude Managed Agents पर बने एक ख़रीदारी एजेंट की मदद से हर महीने आने वाली हज़ारों पूछताछ के प्रबंधन को पूरी तरह बदल दिया। Contact Sales और Pricing पेजों, claude.ai में और ईमेलों में मौजूद यह एजेंट कुछ प्रश्न पूछता है, एक प्लान और सीटों की संख्या की सिफारिश करता है, और फिर ख़रीदारी की ओर ले जाता है, पूरे इतिहास के साथ किसी सेल्स प्रतिनिधि को स्थानांतरित करता है, या केवल उत्तर देता है; ग्राहक शुरू से ही किसी मानव प्रतिनिधि को चुन सकता है। Carl Johnson द्वारा लिखे गए इस ब्लॉग पोस्ट के अनुसार, यह एजेंट प्रति दिन हज़ारों बातचीत करता है; इसके द्वारा अग्रेषित लीड्स पुराने फ़ॉर्म की तुलना में दोगुनी से अधिक बार अवसरों में परिवर्तित होती हैं और लगभग पाँच दिन तेजी से पूरी होती हैं, तथा डील क्लोज़ करने के लिए सेल्स प्रतिनिधि की आवश्यकता वाली बातचीत का हिस्सा लगभग आधा रह गया है। केवल एक इंजीनियर ने कुछ ही हफ़्तों में इसका पहला संस्करण तैयार किया; यह एजेंट अक्सर छोटी टीमों को Enterprise के बजाय Team प्लान की ओर निर्देशित करता है, जिसे Anthropic ने स्वीकार करने का निर्णय लिया है।

🔗 Anthropic की सेल्स टीम ने Claude Managed Agents के साथ इनबाउंड को कैसे नए सिरे से तैयार किया

OpenAI ने America’s SBDC के साथ साझेदारी की और छोटे व्यवसायों पर एक रिपोर्ट प्रकाशित की

30 सितंबर — OpenAI ने America’s SBDC के साथ साझेदारी की है, जो अमेरिकी लघु व्यवसाय विकास केंद्रों का राष्ट्रीय नेटवर्क है और प्रति वर्ष 10 लाख उद्यमियों को सहायता प्रदान करता है। पहले चरण में, 23 सितंबर को पायलट के रूप में शुरू किए गए OpenAI Academy के कम्युनिटी ट्रेनर प्रोग्राम (Community Trainer Program) के माध्यम से, OpenAI लगभग 150 सलाहकारों को प्रशिक्षित करने की योजना बना रहा है, जो SBDC नेटवर्क में तीन घंटे की कार्यशालाएं आयोजित करेंगे, जिसका लक्ष्य व्यक्तिगत रूप से कम से कम 1,000 छोटे व्यवसायों तक पहुँचना है। उसी दिन, “Small Businesses, Bigger Capabilities” रिपोर्ट ने इसके उपयोग के आंकड़े प्रस्तुत किए: 9 से 15 सितंबर के सप्ताह में, 500 से कम कर्मचारियों वाली कंपनियों के लगभग 40 लाख कर्मचारियों ने OpenAI उत्पादों का उपयोग किया, जिनमें से लगभग पाँच में से एक 10 से कम कर्मचारियों वाली कंपनी में था। अगस्त में, एजेंटिक आउटपुट टोकन (विशेष रूप से ChatGPT Work और Codex के) छोटे व्यवसायों के कुल आउटपुट टोकन का दो-तिहाई हिस्सा थे, जबकि अप्रैल में यह एक-तिहाई थे।

🔗 छोटे व्यवसायों पर OpenAI का ब्लॉग पोस्ट


Runway Ads: परफ़ॉर्मेंस विज्ञापन के लिए एक ऑटोनॉमस इंजन

30 सितंबर — Runway ने Runway Ads लॉन्च किया, जो पेड अभियानों (कैंपेन) के क्रिएटिव हिस्से को शुरू से अंत तक संभालता है। इसमें एक विज्ञापन खाता और एक ब्रांड किट कनेक्ट किया जाता है: Runway Agent पर बना यह टूल वीडियो और इमेज क्रिएटिव तैयार करता है, स्वीकृत वैरिएंट्स को Meta, Google और TikTok पर प्रकाशित करता है, उनके परफ़ॉर्मेंस की समीक्षा करता है और जिन चीज़ों पर खर्च आकर्षित हुआ है उनके आधार पर अगला चरण तैयार करता है। यह टीम द्वारा तय किए गए नियमों के अनुसार प्रत्येक क्रिएटिव को स्थानीयकृत करता है, जिसमें ऑन-स्क्रीन टेक्स्ट भी शामिल है, इसे हर फ़ॉर्मेट के लिए रीसाइज़ करता है, इसे एक ऑटोमैटिक ब्रांड चेक से गुज़ारता है और बजट सीमाओं का पालन करता है। मानवीय स्वीकृति डिफ़ॉल्ट रूप से चालू रहती है; ऑटोमैटिक पब्लिशिंग को प्रति अभियान या प्रति वैरिएंट प्रकार चालू किया जा सकता है।

जुलाई से Runway का आंतरिक मीट्रिकब्लॉग पोस्ट में प्रकाशित परिणाम
प्रति सप्ताह विज्ञापन77 से लगभग 900
विज्ञापन खर्च पर रिटर्न (ROAS)दोगुना
कन्वर्ज़नलगभग +34%, स्थिर क्लिक-थ्रू दर
प्रति सब्सक्राइबर लागत−41%

Runway Ads फ़िलहाल चुनिंदा एंटरप्राइज साझेदारों के साथ पायलट चरण में है। घोषणा ट्वीट में आने वाले हफ्तों में व्यापक रोलआउट का वादा किया गया है और दावा किया गया है कि इस टूल ने जुलाई से अब तक 100 मिलियन डॉलर का ARR (वार्षिक आवर्ती राजस्व) जोड़ने में भी मदद की है, यह आंकड़ा ब्लॉग पोस्ट में मौजूद नहीं है।

🔗 Runway Ads ब्लॉग पोस्ट · @runwayml का ट्वीट


300 मिलियन डॉलर के टेंडर ऑफ़र के बाद ElevenLabs का मूल्यांकन 22 बिलियन डॉलर हुआ

30 सितंबर — ElevenLabs ने अपने कर्मचारियों के लिए 300 मिलियन डॉलर का शेयर पुनर्खरीद ऑफ़र (tender offer) पूरा कर लिया है, जिससे इसका मूल्यांकन बढ़कर 22 बिलियन डॉलर हो गया है, जो फरवरी के इसके सीरीज़ D मूल्यांकन का दोगुना है। इस सौदे का नेतृत्व Wellington और T. Rowe Price ने किया; EQT, Goldman Sachs, GIC, OTPP, Sapphire Ventures और BDT & MSD पूंजी में शामिल हुए, साथ ही Andreessen Horowitz, Lightspeed और ICONIQ जैसे मौजूदा निवेशक भी शामिल रहे। एंटरप्राइज ग्राहक कुल राजस्व का 55% हिस्सा हैं: ElevenAgents प्रति सप्ताह 15 मिलियन से अधिक बातचीत संभालता है, जो फरवरी की तुलना में तीन गुना अधिक है, और इस अवधि में इसका वार्षिक आवर्ती राजस्व तीन गुना से अधिक बढ़ गया है। इसके ग्राहकों के एक विश्लेषण के अनुसार, वॉयस एजेंट चैट एजेंटों की तुलना में अनुरोधों को 31% तेज़ी से हल करते हैं। 9 मिलियन डॉलर के मूल्यांकन पर पहले दौर के चार साल बाद, कंपनी में अब 800 से अधिक कर्मचारी हैं।

🔗 ElevenLabs का ब्लॉग पोस्ट


CoreWeave में Vera Rubin NVL72 प्रोडक्शन में, Cognition ने थ्रूपुट में 4.8 गुना तक बढ़ोतरी मापी

30 सितंबर — सैन फ्रांसिस्को में CoreWeave Fully Connected के अवसर पर, NVIDIA ने CoreWeave में Vera Rubin NVL72 के प्रोडक्शन रोलआउट का विवरण साझा किया: यह प्लेटफ़ॉर्म, Spectrum-X Ethernet 102.4T नेटवर्किंग के साथ, CoreWeave Cloud पर उपलब्ध है, जिसने इस महीने की शुरुआत में अपने पहले प्रोडक्शन रैक प्राप्त किए थे। Devin की निर्माता कंपनी Cognition, इस पर प्रोडक्शन वर्कलोड चलाने वाला पहला ग्राहक है: FrontierCode से लिए गए कार्यों पर शुरुआती परीक्षणों के दौरान, इसने GB200 NVL72 की तुलना में SWE-2 के इनफ़्रेंस के लिए कुल टोकन थ्रूपुट में 4.8 गुना तक की वृद्धि मापी। CoreWeave एजेंटों के लिए डिज़ाइन किया गया Vera CPU भी पेश करेगा: प्रति रैक 128 CPU और 11,264 कोर, जो 11,000 से अधिक एक साथ अलग-अलग परिवेशों को चलाने में सक्षम हैं, और इसमें एजेंट सैंडबॉक्स तीन गुना से अधिक तेज़ी से शुरू होते हैं। अंत में, CoreWeave ने CoreWeave Forge लॉन्च किया, जो प्रोडक्शन से ट्रेनिंग की ओर वापस लूप बनाने के लिए Weights & Biases, OpenPipe और marimo को एक साथ लाता है; इसका सर्वरलेस रीइंफ़ोर्समेंट लर्निंग (serverless RL) 40% कम लागत में 1.4 गुना तेज़ बताया गया है।

🔗 CoreWeave और Vera Rubin पर NVIDIA का ब्लॉग पोस्ट


कोडिंग एजेंट और डेवलपर टूल्स: Claude Code 2.1.286, Zed 1.22.0, Gemini CLI, VS Code 1.140, HydraFusion और gcloud के लिए एक MCP सर्वर

Claude Code 2.1.286: VS Code में बुकमार्क, सीमित पुनःप्रयास और कड़ा किया गया बेयर मोड

30 सितंबर — शाम 19:10 UTC पर जारी किए गए Claude Code 2.1.286 में 88 प्रविष्टियाँ शामिल हैं, जिनमें 49 बग फिक्स हैं। अनुमति प्रॉम्प्ट अब अपनी स्थिति बताता है जब कई अनुरोध कतार में होते हैं (“2 of 5”), और VS Code एक्सटेंशन में Claude के उत्तरों को साइड पैनल में सहेजने के लिए बुकमार्क (bookmarks), एक Questions पंक्ति जो Claude द्वारा पूछे गए प्रश्नों और चुने गए उत्तरों को सारांशित करती है, तथा प्रश्न कार्डों में विकल्पों के पूर्वावलोकन जोड़े गए हैं। दो व्यवहारगत बदलाव महत्वपूर्ण हैं: अब एक ही सीमा एक मॉडल कॉल के पुनःप्रयासों को कवर करती है, जो डिफ़ॉल्ट सेटिंग्स के साथ अधिकतम 14 अनुरोध है, और --bare अब केवल कमांड लाइन पर नामित MCP सर्वरों को ही कनेक्ट करता है, जिसमें कोई सिस्टम प्रॉम्प्ट या बैकग्राउंड टास्क शामिल नहीं होते हैं। यदि verify नाम का कोई स्किल मौजूद है, तो Claude को हर कमिट से ठीक पहले इसे चलाने के लिए प्रेरित किया जाता है, सिवाय डॉक्यूमेंटेशन या परीक्षणों के, और प्लगइन्स उन npm स्रोतों को अस्वीकार कर देते हैं जो git रिपॉजिटरी या फ़ोल्डर हैं। अंत में, जब API डिफ़ॉल्ट मॉडल को अस्वीकार करता है, तो Claude Code प्रत्येक टर्न पर विफल होने के बजाय उसी टियर के पिछले मॉडल पर एक बार पुनः प्रयास करता है।

🔗 Claude Code 2.1.286 के रिलीज़ नोट्स

Zed 1.22.0: प्रति सब-एजेंट एक मॉडल

30 सितंबर — Zed ने सब-एजेंटों पर केंद्रित अपना स्थिर वर्ज़न 1.22.0 जारी किया: spawn_agent टूल एक वैकल्पिक पैरामीटर model स्वीकार करता है, जिससे पैरेंट से कॉन्फ़िगर या इनहेरिट किए गए मॉडल के अलावा किसी अन्य मॉडल पर सब-एजेंट चलाया जा सकता है, और प्रत्येक सब-एजेंट का कार्ड उपयोग किए जा रहे मॉडल को प्रदर्शित करता है। सब-एजेंट अपने संदर्भ को स्वचालित रूप से कंपैक्ट भी करते हैं, जो Zed के अनुसार उन्हें लंबे कार्यों को संभालने की अनुमति देता है। मॉडलों के संबंध में, GPT-6.1 Sol एक OpenAI API कुंजी के साथ BYOK के रूप में आता है, Grok 4.7 SuperGrok और xAI में अनुशंसित मॉडल के रूप में स्थिर हो गया है, और OpenCode Zen तथा Go मॉडलों की सूची को रनटाइम पर फ़ेच किया जाता है। यह वर्ज़न टर्मिनल में प्रति पूर्ण कमांड लगभग 2 MB मेमोरी लीक को ठीक करता है और एक शॉर्टकट बदलता है: सक्रिय डॉक को बंद करना सभी प्लेटफ़ॉर्मों पर ctrl-alt-w हो जाता है। कुल मिलाकर, 18 नई सुविधाएँ और 37 बग फिक्स शामिल हैं।

🔗 Zed 1.22.0 के रिलीज़ नोट्स

Gemini CLI: v0.62.0 स्थिर वर्ज़न में, और एक प्रीव्यू वर्ज़न जो बिना पुष्टि के योजनाओं को निष्पादित करता है

29 सितंबर — Gemini CLI ने शाम को (UTC) दो वर्ज़न जारी किए। v0.62.0 रात 21:17 बजे स्थिर हो गया: इसकी 19 प्रविष्टियाँ 16 से 24 सितंबर तक प्रस्तुत प्रीव्यू और नाइटली रिलीज़ को शामिल करती हैं (MCP टूल कॉल के संरचित शीर्षक, OAuth रिफ़्रेश टोकन (refresh token) का संरक्षण, Gemini 3.8 Flash और 3.5 Flash Lite)। नई सुविधा v0.63.0-preview.0 प्रीव्यू में है, जिसे 20:58 बजे जारी किया गया: गैर-इंटरैक्टिव मोड में, एजेंट अब पुष्टि की प्रतीक्षा किए बिना अपनी योजना लिखता है और निष्पादित करता है (PR 29539), जबकि Plan Mode के निर्देश पहले इसे बिना किसी टूल कॉल के केवल एक साधारण अलाइनमेंट संदेश के साथ उत्तर देने के लिए कहते थे। 0 या उससे कम की maxChars सीमा टूल आउटपुट के ट्रंकेशन को भी अक्षम कर देती है (PR 29542)। 30 सितंबर का नाइटली बिल्ड 0.64.0 श्रृंखला शुरू करता है: ACP मोड में, CLI आखिरकार मानक उपयोग की रिपोर्ट करता है, जबकि Zed या OpenHands जैसे क्लाइंट बिलिंग को लगभग 3 गुना अधिक आंक रहे थे (PR 29549 के अनुसार)।

🔗 Gemini CLI v0.63.0-preview.0 · Gemini CLI v0.62.0

VS Code 1.140 ने Copilot हार्नेस को अपनाया

30 सितंबर — Visual Studio Code 1.140 Copilot हार्नेस (Copilot harness) के साथ स्थिर रूप में जारी किया गया: Copilot SDK पर आधारित, यह VS Code एजेंट को GitHub Copilot ऐप और Copilot CLI का व्यवहार और क्षमताएं प्रदान करता है, और एक समर्पित होस्ट प्रोसेस में चलता है जो Agent Host Protocol पर आधारित है, जिससे एक ही सत्र में कई विंडो से शामिल हुआ जा सकता है; नोट्स चेतावनी देते हैं कि यह कुछ उपयोगकर्ताओं के लिए पहले से ही डिफ़ॉल्ट रूप से चुना जा सकता है। प्रायोगिक तौर पर, मल्टी-फ़ोल्डर सत्र प्रत्येक चैट को अपना स्वयं का फ़ोल्डर या वर्कट्री देते हैं, और एजेंट एक सत्र को एक रिमोट होस्ट को सौंप सकता है, जिसे सिस्टम, मेमोरी, CPU की संख्या और मॉडल के आधार पर चुना जाता है। एंटरप्राइज के लिए तीन नियंत्रण आते हैं: चैट में व्यवस्थापक द्वारा आवश्यक न्यूनतम संस्करणों का स्पष्टीकरण, एक प्रबंधित सेटिंग (autoTier) द्वारा निर्धारित Auto मोड का डिफ़ॉल्ट स्तर, और Copilot के OpenTelemetry डेटा में उपयोगकर्ता की पहचान जोड़ना, जो विकल्प डिफ़ॉल्ट रूप से अक्षम है।

🔗 VS Code 1.140 के रिलीज़ नोट्स

HydraFusion, VS Code और GitHub Copilot ऐप में आया

30 सितंबर — GitHub ने HydraFusion को VS Code (वर्ज़न 1.140 या Insiders से) और GitHub Copilot ऐप में विस्तारित किया है, जो अभी भी रिसर्च प्रीव्यू में है; यह मल्टी-मॉडल ऑर्केस्ट्रेशन 4 सितंबर को Copilot CLI में लॉन्च किया गया था। HydraFusion को चयनकर्ता में एक मॉडल की तरह चुना जाता है, लेकिन यह कोई मॉडल नहीं है: यह वर्कफ़्लो के चयन को एक अनुकूलन समस्या के रूप में देखता है और तीन पैटर्नों में से एक को चुनता है। Single मोड में, एक ही मॉडल कार्य को हल करता है; Cascade मोड में, एक कुशल मॉडल ड्राफ़्ट तैयार करता है और गुणवत्ता जांच परिणाम को स्वीकार करती है या इसे अधिक शक्तिशाली मॉडल तक बढ़ाती है; Critique मोड में, किसी अन्य मॉडल परिवार का रीड-ओनली क्रिटिक समीक्षा करता है, और फिर ड्राफ़्टर एक बार संशोधित करता है। जहाँ Auto मोड प्रति अनुरोध एक मॉडल चुनता है, वहीं HydraFusion एक ही टर्न में कई मॉडलों का समन्वय करता है। यह Copilot Pro, Pro+, Business और Enterprise में उपलब्ध है, हालांकि Business और Enterprise में व्यवस्थापक को प्रीव्यू सक्रिय करने की आवश्यकता होती है; GitHub ने कोई नया आंकड़ा प्रकाशित नहीं किया है।

🔗 VS Code और GitHub Copilot ऐप में HydraFusion

Google Cloud ने रिमोट MCP सर्वर का प्रीव्यू खोला जो gcloud और bq को निष्पादित करता है

Google Cloud अपने प्रबंधित रिमोट MCP सर्वरों में पब्लिक प्रीव्यू के रूप में Google Cloud CLI remote MCP server जोड़ रहा है। यह gcloud और bq (BigQuery) कमांड-लाइन टूल्स के सैकड़ों कमांड्स को दो MCP टूल्स, run_gcloud_command और run_bq_command के पीछे समूहित करता है। Google कमांड लाइन के चयन को दो तर्कों से सही ठहराता है: एक कमांड कई चरणों वाले ऑपरेशनों को समाहित करता है जिन्हें API के माध्यम से ऑर्केस्ट्रेट करना पड़ता, और मॉडलों को इन कमांड्स के सार्वजनिक दस्तावेज़ों पर बड़े पैमाने पर प्रशिक्षित किया गया है। रिमोट सर्वर एजेंट के वातावरण में CLI इंस्टॉल करने से बचाता है, जिससे ये ऑपरेशन Gemini Enterprise जैसे वेब-होस्टेड एजेंट प्लेटफ़ॉर्म के लिए सुलभ हो जाते हैं। कमांड एक आइसोलेटेड सैंडबॉक्स में, प्रतिबंधित नेटवर्क वाले प्रॉक्सी के पीछे और बिना किसी एम्बिएंट क्रेडेंशियल्स (ambient credentials) के निष्पादित होते हैं, प्रत्येक कॉलिंग आइडेंटिटी के IAM अधिकारों के साथ, जो Agent Identity या OAuth 2.0 द्वारा प्रमाणित होती है; Model Armor प्रॉम्प्ट्स और उत्तरों को फ़िल्टर कर सकता है, और प्रत्येक कॉल को ऑडिट लॉग में दर्ज किया जा सकता है। सर्वर के लिए अलग से कोई शुल्क नहीं लिया जाता है: केवल बनाई गई रिसोर्सेज और किसी भी डेटा ट्रांसफर के लिए शुल्क लिया जाता है।

🔗 Empower your agents with the Google Cloud CLI remote MCP server (Google Cloud ब्लॉग)


संक्षेप में

  • Codex CLI 0.159.2 — 29 सितंबर को 23:57 UTC पर जारी, इस संस्करण में केवल एक बैकपोर्टेड समाधान शामिल है: Windows पर, कंसोल विंडो अब तब नहीं टिमटिमाती हैं जब Codex अपने सैंडबॉक्स में बैकग्राउंड प्रोसेस या कमांड चलाता है। 🔗 स्रोत
  • Amp में Plaid — GPT-6 Astra का उपयोग करने वाले Amp के मोड में Plaid जोड़ा गया है, जो OpenAI के अल्ट्रा-फास्ट टियर पर आधारित है: टोकन लागत के 6 गुना होने पर 6 गुना तक तेज़ अनुरोध, केवल Amp द्वारा प्रदान किए गए इनफ़रेंस के लिए आरक्षित; सब-एजेंट फ़ास्ट या स्टैंडर्ड गति में बने रहते हैं, और Amp ने कोई कीमत प्रकाशित नहीं की है। 🔗 स्रोत
  • Warp और Factories as Code — Warp अपनी सॉफ़्टवेयर फ़ैक्टरियों के कॉन्फ़िगरेशन को “एजेंटों का Terraform” बताता है: एक रिपॉज़िटरी एजेंटों, ऑटोमेशन, एक्सेस और माप का विवरण देती है। factory.yaml प्रारूप अगस्त के अंत का है; इंटरैक्टिव गाइड में AWS या GCP के लिए फ़ेडरेटेड एक्सेस, वेबहुक और Slack, Linear या Jira एकीकरण का विवरण दिया गया है। 🔗 Warp थ्रेड · 🔗 कॉन्फ़िगरेशन गाइड
  • Crosby में Devin — Cognition के एक केस स्टडी में, न्यूयॉर्क की लॉ फर्म Crosby ने, जिसमें 50 से अधिक वकीलों के लिए लगभग एक दर्जन इंजीनियर हैं, Devin को घटनाओं की पहली प्रतिक्रिया का काम सौंपा है: प्रति दिन 20 से 40 बग और अलर्ट की जांच की जाती है, जिनमें से अधिकांश में लगभग 5 मिनट लगते हैं, और कम से कम 50% Sentry शोर कम होता है। 🔗 स्रोत
  • claude.dev — Anthropic ने आधिकारिक तौर पर claude.dev को Claude के साथ निर्माण करने वाले डेवलपर्स के लिए मुख्य मंच के रूप में पेश किया है: तकनीकी गहन विश्लेषण, Claude Code और API गाइड, Agents, Engineering, Playbooks और Skills अनुभाग, तथा एक सरप्राइज़ टर्मिनल पेज। साइट के पोस्ट 22 सितंबर से ही शेयर किए जा रहे थे। 🔗 स्रोत
  • ChatGPT की संपादन योग्य Sites — 29 सितंबर के रिलीज़ नोट्स के अनुसार, एक प्रकाशित Site को Edit site से संपादित किया जा सकता है और Plus व Pro पर Automations से शेड्यूल किया जा सकता है; Enterprise में, निजी Sites कनेक्टेड ऐप्लिकेशन का लाभ उठा सकती हैं, जिसमें प्रति प्लगइन Allow use in Sites सेटिंग होती है, जो डिफ़ॉल्ट रूप से अक्षम रहती है। 🔗 ChatGPT रिलीज़ नोट्स · 🔗 Enterprise और Edu नोट्स
  • Kimi Work 3.2.15 — 30 सितंबर का संस्करण अंतर्निहित ब्राउज़र में Notion और Feishu दस्तावेज़ों के मानव-AI सह-संपादन की सुविधा देता है, डिफ़ॉल्ट रूप से एजेंट की प्रक्रिया को संक्षिप्त करता है और एक PPT के एक साथ संपादन के दौरान फ़ाइल करप्शन को ठीक करता है। 🔗 स्रोत
  • Cue वित्त का प्रबंधन करता है — Manus 2.0 के साथ लॉन्च किया गया पर्सनल एजेंट ऐप्लिकेशन अब Plaid के ज़रिए सब्सक्रिप्शन और खर्च के रुझानों को ट्रैक करता है और बैंक खातों को ऑटोपायलट पर डालता है; किसी देश, प्लान या शर्तों का उल्लेख नहीं किया गया है। 🔗 स्रोत
  • Genspark में GPT-6.1 Sol — Genspark ने अपने लॉन्च के अगले ही दिन AI Chat, Code Agent और Claw में GPT-6.1 Sol की शुरुआत की, जिसमें OpenAI के उसी तर्क (इसके API मूल्य के पांचवें हिस्से पर Astra के करीब की बुद्धिमत्ता) को दोहराया गया है, जिसमें कोई प्लान या क्रेडिट लागत निर्दिष्ट नहीं है। 🔗 स्रोत
  • Qwen3.8-27B-pi — Thomas Kim ने Pi हार्नेस के लिए Qwen3.8-27B का एक फ़ाइन-ट्यून Apache-2.0 के तहत प्रकाशित किया जो प्रयास स्तरों को व्यवस्थित करता है: Terminal-Bench 2.1 पर, medium स्तर xhigh पर बेस मॉडल के बराबर (89 में से 67 कार्य) प्रदर्शन करता है और इसमें लगभग 41% कम आउटपुट टोकन लगते हैं। 🔗 स्रोत
  • Nebius पर Qwen3.8-27B — Qwen ने Nebius Token Factory पर अपने 27 बिलियन पैरामीटर वाले डेंस मॉडल के आगमन की जानकारी साझा की, जिसकी घोषणा 28 सितंबर को कोड, शोध और एजेंटिक वर्कफ़्लो के लिए की गई थी; कोई कीमत या थ्रूपुट साझा नहीं किया गया। 🔗 स्रोत
  • Bekko System One v0 — Yuichi Tateno ने 17M, 68M और 400M पैरामीटर वाले तीन निर्णय मॉडल प्रकाशित किए, जिनमें से दो सबसे छोटे ब्राउज़र में चलते हैं, और S1MB बेंचमार्क: 400M मॉडल Jev 1.13 के 59.59 के मुकाबले 50.60 स्कोर प्राप्त करता है, लेकिन सामान्यीकरण में 96.27 के मुकाबले 54.48। 🔗 स्रोत
  • ZooWork Instinct Tuned 4B — SRP ने Apache-2.0 के तहत 4 बिलियन पैरामीटर का एक निर्णय मॉडल प्रकाशित किया, जो Qwen3.5-4B पर आधारित है, जो बिना डिकोड किए एक ही पास में विकल्पों को स्कोर करता है: लेखकों ने स्पष्ट किया कि JevBench के सार्वजनिक कार्यों पर 231 में से 198 (85.71%), जिनका उपयोग विकास के दौरान किया गया था। 🔗 स्रोत
  • Transformers v5.18.0 — Hugging Face ने चार आर्किटेक्चर जोड़े हैं: NVIDIA के Nemotron 3 Diarization और NemotronH Omni, NAVER का HyperCLOVAX Vision V2, और GTE; साथ ही छह ब्रेकिंग बदलावों की सूचना दी है। 🔗 स्रोत
  • TaskSmith — Adithya S K, जो Hugging Face में रीइन्फ़ोर्समेंट लर्निंग वातावरणों पर काम करते हैं, ने एक ऑर्केस्ट्रेटर प्रकाशित किया है जो एक पुल रिक्वेस्ट को सत्यापन योग्य RL वातावरण में बदल देता है: TRL, PEFT, Accelerate, Diffusers और Transformers से लिए गए 50 वातावरण, जो Harbor कार्यों के रूप में वितरित किए गए हैं। 🔗 स्रोत
  • TraceML 0.4.1 — ओपन-सोर्स टूल अब ऑप्टिमाइज़र अपडेट के पूरे समूह को मापता है; ResNet-50 और T4 GPU पर, लोडिंग को ट्यून करने के बाद डेटा प्रतीक्षा समय स्टेप के 23% से घटकर 2 ms से भी कम हो जाता है, जिसमें मीडियन ओवरहेड 0.35% रहता है। 🔗 स्रोत
  • लूप वाला ट्रांसफ़ॉर्मर — 54,106 पैरामीटर और 260 सत्यापन योग्य मामलों वाले एक टॉय मॉडल पर, 80 ब्लॉक पास के समान बजट पर, एक लूप औसतन सभी 260 मामलों को सीखता है, दो लूप 125.3 और आठ लूप 37.0: पासों को बढ़ाने से सीखना अधिक किफायती नहीं हुआ। 🔗 स्रोत
  • ना कहना जानने वाला मूल्यांकन — Eric Mey का ट्यूटोरियल, मूवी रिव्यू सेंटीमेंट (SST-2) पर, एक ऐसा मूल्यांकन दिखाता है जो रिज़र्व्ड डेटा पर 7 अंक बेहतर होने के बावजूद एक मॉडल को अस्वीकार कर देता है, क्योंकि एक महत्वपूर्ण व्यवहार ख़राब हो जाता है; उनकी स्क्रिप्ट प्रोसेसर पर एक मिनट से भी कम समय में चलती हैं। 🔗 स्रोत
  • 10,000 सिंथेटिक पॉलिसीधारक — Intelligent Actuaries ने CC-BY-4.0 के तहत जीवन बीमा लैप्स और सरेंडर का एक सिंथेटिक अध्ययन प्रकाशित किया है: दस बाज़ारों में 10,000 काल्पनिक पॉलिसीधारक, यानी SOA-LIMRA सर्वेक्षण प्रारूप में 27,692 पॉलिसी-वर्ष रिकॉर्ड (2023-2025)। 🔗 स्रोत
  • cuObject और SCADA Server SDK — NVIDIA ने CPU मेमोरी से गुज़रे बिना, RDMA के माध्यम से ऑब्जेक्ट स्टोरेज एक्सेस के लिए cuObject लाइब्रेरीज़ को सामान्य उपलब्धता में बदल दिया है, और 40 से अधिक प्रतिभागियों की Storage-Next पहल में IBM द्वारा Storage Scale के साथ प्रोटोटाइप किए गए SCADA Server SDK को लॉन्च किया है। 🔗 स्रोत
  • NeMo Relay और Hermes Agent — Nous Research के Teknium द्वारा सह-लिखित NVIDIA का एक ट्यूटोरियल Hermes एजेंट को ट्रेस करता है: 108 निष्पादनों पर, टूल फ़िक्स Qwen3 Coder 30B को 27 में से 19 से बढ़ाकर 22 सफलताओं तक ले जाते हैं, जिसके लिए 3.8 के बजाय 4.9 मॉडल कॉल की लागत आती है। 🔗 स्रोत
  • OpenClaw Enterprise के लिए OpenShell — NVIDIA ने OpenClaw Enterprise के एजेंटों को नियंत्रित करने के लिए अपना ओपन-सोर्स वातावरण OpenShell पेश किया है, जो परसिस्टेंट एजेंटों के लिए एक ओपन-सोर्स कंट्रोल प्लेन है, जिसकी घोषणा एक दिन पहले OpenClaw फाउंडेशन द्वारा Red Hat, NVIDIA और OpenAI के साथ की गई थी। 🔗 स्रोत
  • GitHub Advanced Security के ट्रायल — GitHub Team के ग्राहक संगठन के Overview पेज, बिलिंग पेज या Risk Assessment से GitHub Code Security और GitHub Secret Protection का ट्रायल स्वयं शुरू कर सकते हैं; अवधि निर्दिष्ट नहीं है। 🔗 स्रोत
  • GHE.com और X25519 — 7 अक्टूबर 2026 से, डेटा रेजिडेंसी वाला GitHub Enterprise Cloud उन TLS क्लाइंट्स को अस्वीकार कर देगा जो की-एग्रीमेंट के लिए केवल X25519 की पेशकश करते हैं; P-256 और P-384 समर्थित बने रहेंगे और SSH प्रभावित नहीं होगा। 🔗 स्रोत
  • Runway में दो केस स्टडी — फ्रांसीसी पेय ब्रांड Bonjour ने Runway के साथ 500 से अधिक विज्ञापन रूपांतर तैयार किए और 50,000 यूरो से अधिक की उत्पादन लागत को पुनः आवंटित किया; World Juggling Federation ने ESPN के लिए एक घंटे के शो की पैकेजिंग का काम सिर्फ़ एक व्यक्ति को सौंपा। 🔗 Bonjour · 🔗 World Juggling Federation
  • Luma में Ad Variants — Luma ने एक ऐसी सुविधा पर प्रकाश डाला है जो एक ही अभियान के भीतर एक तैयार विज्ञापन को कई आकारों और कई बाज़ारों के लिए रूपांतरित करती है, जिसमें कोई मूल्य, प्लान या लॉन्च तिथि और कोई ब्लॉग पोस्ट नहीं है। 🔗 स्रोत
  • Microduck उत्पादन में — Pollen Robotics ने घोषणा की है कि 10,950 Microduck, इसका $399 का छोटा बाईपेडल रोबोट जिसे सिमुलेशन में प्रशिक्षित किया गया है और जिसमें ओपन-सोर्स रीइन्फ़ोर्समेंट लर्निंग स्टैक है, 10 दिसंबर से 10 जनवरी के बीच साप्ताहिक लॉट में उत्पादन लाइन से निकलेंगे। 🔗 स्रोत
  • Cognition में भर्तियां — Devin की निर्माता कंपनी ने Snowflake के पूर्व CRO Chris Degnan का मुख्य राजस्व अधिकारी के रूप में स्वागत किया, जिसके एक दिन पहले Alex Stamos मुख्य सूचना सुरक्षा अधिकारी (CISO) के रूप में शामिल हुए थे। 🔗 Chris Degnan · 🔗 Alex Stamos
  • Claude Founder House — Anthropic SF Tech Week के दौरान सैन फ्रांसिस्को में (6 से 8 अक्टूबर तक, Terra Gallery में) और 14 अक्टूबर को स्टॉकहोम में संस्थापकों के लिए दिनों का आयोजन कर रहा है, जिसमें वार्ताएं, कार्यशालाएं और इसकी Applied AI टीम के साथ स्लॉट शामिल हैं। 🔗 स्रोत
  • AI Engineer Paris — Mistral ने पिछले सप्ताह Station F में आयोजित कार्यक्रम का लेखा-जोखा प्रस्तुत किया: बिना किसी उत्पाद घोषणा के 900 से अधिक प्रतिभागी, 60 वक्ता, 57 वार्ताएं और 22 भागीदार। 🔗 स्रोत
  • NVIDIA डॉक्टरेट फ़ेलोशिप — Graduate Fellowship Program 2027-2028 के लिए आवेदन 30 अक्टूबर 2026 तक खुले हैं, जिसमें प्रति पीएचडी छात्र $60,000 तक दिए जाएंगे; 2002 से अब तक 220 से अधिक फ़ेलोशिप दी जा चुकी हैं। 🔗 स्रोत

इसका क्या अर्थ है

सुरक्षा अब फ्रंटियर मॉडलों का शेड्यूल तय करती है। Gemini 4 Argon, Fairwind Program के तर्क को आगे बढ़ाता है: विश्वसनीय साइबर रक्षकों को यह सबसे पहले मिलता है, बिना साइबर सुरक्षा उपायों के, और बाकी लोगों को सुरक्षा को मजबूत करने का समय देते हुए, बिना किसी तिथि के “यथाशीघ्र” यह मिलेगा। उसी दिन, OpenAI समस्या का दूसरा पहलू दिखाता है: अब केवल मॉडल की ही रक्षा नहीं करनी है, बल्कि उसके रीज़निंग (तर्क) की भी रक्षा करनी है। चाहे यह किसी एक पक्ष का काम हो या नहीं, वह अभियान जिसका मुख्य केंद्र OpenAI द्वारा Moonshot AI से जुड़े व्यक्तियों को बताया गया है, रीज़निंग ट्रेस को तकनीकी सुरक्षा उपायों और प्रयोगशालाओं तथा सरकारों के बीच सूचना साझाकरण के साथ एक रक्षा योग्य संपत्ति बनाता है।

आज के आंकड़ों का एक बड़ा हिस्सा उन मापों से आता है जिन्हें घोषणा करने वालों द्वारा ही डिज़ाइन या संचालित किया गया है। Cohere उसी दिन प्रकाशित अपने मीट्रिक के साथ Embed 5 का मूल्यांकन करता है, और स्वयं चेतावनी देता है कि पुराने पैमाने पर इसके मॉडल कमतर लग सकते हैं; HeyGen आंतरिक Elo पर निर्भर करता है, Hunmin एक घरेलू प्रोटोकॉल पर, जिसमें एजेंट बेंचमार्क के लिए केवल एक रन है, और Reality Check पर, आयोजक ने ही मॉडलों को फ़ाइन-ट्यून किया था। इसके विपरीत, Perplexity अपने मॉडल को turbopuffer के एक निजी बेंचमार्क पर ब्लाइंडली सबमिट करता है, और Open TTS Leaderboard तथा AURORA वोटिंग या ऑटोमैटिक अनुवाद को सत्यापन योग्य कार्यों और मापों से बदलते हैं। दो स्कोरों की तुलना करने से पहले, यह देखना आवश्यक है कि उन्हें किसने तैयार किया है।

इमेज और वीडियो जनरेशन को तेज़ी से उपयोग और लागत के आधार पर आंका जा रहा है। Ideogram 4.5 अधिक सुंदर छवि का वादा नहीं करता है, बल्कि एक ऐसी छवि का वादा करता है जो निरंतर संपादन का समर्थन करती है; HeyGen Video प्रति सेकंड बिकता है, जो इसके ग्रिड के सभी मॉडलों से सस्ता है, और दिखाता है कि MiniMax H3 जैसा एक बेस मॉडल HeyGen से लेकर Creatify तक विशेष रूपांतर दे सकता है। Runway Ads विज्ञापन व्यय तक की पूरी श्रृंखला को पूरा करता है, और ElevenLabs का मूल्यांकन, जो फरवरी से दोगुना हो गया है, संवादी एजेंटों के लिए उद्यम मांग पर आधारित है।

डेवलपर्स के पक्ष में, हार्नेस मॉडल से अलग, अपने आप में एक संपूर्ण उत्पाद बनता जा रहा है। VS Code अपने एजेंट को ऐप और CLI के साथ संरेखित करने के लिए Copilot के हार्नेस को अपनाता है, HydraFusion एक ही टर्न में कई मॉडलों का समन्वय करता है, Zed एजेंट को प्रति सब-एजेंट एक मॉडल चुनने देता है और Manus अपने हार्नेस को तीसरे पक्ष के प्रदाताओं की API कीज़ के लिए खोलता है। Gemini CLI अब गैर-इंटरैक्टिव मोड में बिना किसी मानवीय हस्तक्षेप के अपनी योजनाएं निष्पादित करता है, Claude Code स्क्रिप्टेड उपयोगों के लिए --bare को सख्त करता है, और Google Cloud कॉलर के IAM अधिकारों के साथ एक सैंडबॉक्स में एजेंटों के लिए gcloud और bq को प्रदर्शित करता है। मांग इंफ्रास्ट्रक्चर तक में दिखाई देती है: CoreWeave में उत्पादन में Vera Rubin NVL72 का पहला ग्राहक Devin की निर्माता कंपनी Cognition है।


स्रोत