खोजें

Claude ने CRISPR जैसी पुनरावृत्तियों वाला एक एंज़ाइम तंत्र खोजा, Google ने Gemini 3.8 Flash TTS लॉन्च किया, Black Forest Labs ने FLUX 3 Action जारी किया

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Claude ने CRISPR जैसी पुनरावृत्तियों वाला एक एंज़ाइम तंत्र खोजा, Google ने Gemini 3.8 Flash TTS लॉन्च किया, Black Forest Labs ने FLUX 3 Action जारी किया

ai-powered-markdown-translator

gpt-6-sol के साथ fr से hi में अनुवादित लेख।

GitHub पर प्रोजेक्ट देखें ↗

इस 23 सितंबर को Anthropic ने अपनी आणविक जीवविज्ञान प्रयोगशाला और उसका पहला परिणाम पेश किया: ART, एक अज्ञात एंज़ाइम तंत्र जिसे लगभग 950 Claude एजेंटों ने बैक्टीरियोफ़ेज के डीएनए में पहचाना। Google ने Gemini 3.8 Flash TTS और Flash-Lite TTS लॉन्च किए, जो आवाज़ें बनाते हैं और उनकी प्रतिकृति तैयार करते हैं। Black Forest Labs ने रोबोट नियंत्रित करने के लिए खुले वज़न वाला मॉडल FLUX 3 Action जारी किया, और Perplexity ने SPACE का पहला सुरक्षा ऑडिट प्रकाशित किया। SPACE वह सैंडबॉक्स है जिसमें उसके एजेंट चलते हैं।


Anthropic ने आणविक जीवविज्ञान प्रयोगशाला खोली, जहाँ Claude ने ART खोजा

23 सितंबर — Anthropic ने जीवन विज्ञान का एक नया शोध समूह पेश किया है। सैन फ़्रांसिस्को खाड़ी क्षेत्र में स्थित इस समूह की अपनी आणविक जीवविज्ञान प्रयोगशाला है और इसका गठन वसंत ऋतु में हुआ था। इसका पहला परिणाम: Claude एजेंटों ने बैक्टीरिया को संक्रमित करने वाले वायरस, यानी बैक्टीरियोफ़ेज, के डीएनए में पहले कभी वर्णित न किया गया एक एंज़ाइम तंत्र पहचाना। Anthropic ने इसे ART (array-associated reverse transcriptases, यानी श्रृंखला से संबद्ध रिवर्स ट्रांसक्रिप्टेज़) नाम दिया है।

शुरुआत एक प्रॉम्प्ट से हुई: डीएनए अनुक्रमों के विशाल डेटाबेस में रिवर्स ट्रांसक्रिप्टेज़ के नए उदाहरण खोजने थे। ये एंज़ाइम आरएनए की प्रति डीएनए के रूप में बनाते हैं। 21 घंटों में लगभग 950 एजेंटों ने 210 मिलियन टोकन इस्तेमाल किए, 200 000 से अधिक रिवर्स ट्रांसक्रिप्टेज़ जुटाए, 3 500 नए संभावित तंत्र अलग किए और 20 सबसे आशाजनक उम्मीदवार चुने। हर उम्मीदवार के साथ मनुष्यों के पढ़ने योग्य रिपोर्ट थी। Anthropic के अनुसार, ऐसा विश्लेषण किसी विशेषज्ञ को कई सप्ताह, यहाँ तक कि कई महीने ले सकता है; मानवीय हस्तक्षेप शुरुआती प्रॉम्प्ट और प्रयोगशाला के प्रयोगों तक सीमित रहा।

शोध अभियान का चरणमापा गया आँकड़ा
शोध की अवधि21 घंटे
लगाए गए Claude एजेंटलगभग 950
इस्तेमाल किए गए टोकन210 मिलियन
जुटाए गए रिवर्स ट्रांसक्रिप्टेज़200 000 से अधिक
नए संभावित तंत्र3 500
चुने और विश्लेषित किए गए उम्मीदवार20

ART में तीन घटक हैं: रिवर्स ट्रांसक्रिप्टेज़, पास में स्थित एक सहयोगी जीन जिसका कार्य अज्ञात है, और नियमित अंतराल पर दोहराए गए डीएनए अनुक्रमों की एक लंबी श्रृंखला, जिसकी बनावट CRISPR श्रृंखला जैसी है। एक विशाल फ़ेज में पाया गया रिवर्स ट्रांसक्रिप्टेज़ पहले से ज्ञात था; Anthropic के अनुसार, उसके साथ मौजूद गैर-कोडिंग श्रृंखला और प्रोटीन पर ध्यान देने वाला Claude «शायद पहला» है। शुरुआती प्रयोग दिखाते हैं कि यह श्रृंखला अलग-अलग छोटे आरएनए के रूप में अभिव्यक्त होती है। Anthropic सावधानी बरत रहा है: ART का कार्य अभी ज्ञात नहीं है और आगे प्रयोग चल रहे हैं। Anthropic के अनुसार, केवल कुछ ज्ञात तंत्रों में ये विशेषताएँ मिलती हैं, और वे सभी प्रोग्राम किए जा सकते हैं तथा डीएनए को काटने, कॉपी करने और चिपकाने में सक्षम हैं।

Claude has discovered a previously unknown enzyme system hidden in the DNA of bacteriophages. Beside the enzyme’s gene sits a long array of repeating DNA—a structure that looks somewhat similar to CRISPR.

🇮🇳 Claude ने बैक्टीरियोफ़ेज के डीएनए में छिपा एक ऐसा एंज़ाइम तंत्र खोजा है जो अब तक अज्ञात था। एंज़ाइम के जीन के बगल में दोहराए गए डीएनए की एक लंबी श्रृंखला है, जिसकी संरचना कुछ हद तक CRISPR जैसी है।X पर @AnthropicAI

प्रयोगशाला केवल BSL-1 और BSL-2 जैवसुरक्षा स्तरों पर काम करती है और मनुष्यों को संक्रमित कर सकने वाले किसी भी रोगजनक को नहीं संभालती; प्रयोगशाला का सारा प्रत्यक्ष काम मानव वैज्ञानिक करते हैं। टीम Claude Science और Claude Code का उपयोग करती है, कभी-कभी अपने बनाए ऐसे तंत्र के साथ जो कई सत्रों का समानांतर समन्वय करता है। एक अभियान से सैकड़ों, बल्कि हज़ारों रिपोर्ट बनती हैं, इसलिए परिकल्पनाएँ भी अध्ययन का विषय बन जाती हैं: शोधकर्ता जिन परिकल्पनाओं को परीक्षण योग्य मानते हैं, उनकी विशेषताओं से Claude को दिए जाने वाले निर्देश सुधारे जाते हैं। CRISPR से जीनोम संपादन के अग्रणी वैज्ञानिक Feng Zhang (MIT और Broad Institute) ने प्रीप्रिंट की समीक्षा की और इसे जैविक खोज में एआई एजेंटों के संभावित योगदान का उत्साहजनक उदाहरण माना। Anthropic ने यह प्रीप्रिंट प्रकाशित किया है और वैज्ञानिकों को अपने शोध प्रश्न भेजने के लिए आमंत्रित किया है।

🔗 Claude ने CRISPR जैसी पुनरावृत्तियों वाला एक नया एंज़ाइम तंत्र खोजा · प्रीप्रिंट (PDF)


Gemini 3.8 Flash TTS और Flash-Lite TTS: Google आवाज़ें बनाता है और उनकी प्रतिकृति तैयार करता है

23 सितंबर — Google ने Gemini परिवार में आवाज़ संश्लेषण (text-to-speech) के दो मॉडल जोड़े हैं: Gemini 3.8 Flash TTS और Gemini 3.8 Flash-Lite TTS। कंपनी इन्हें अपने सबसे अभिव्यंजक ऑडियो मॉडल बताती है। दोनों Gemini API और Google AI Studio में सामान्य उपलब्धता के साथ, नए Voices एंडपॉइंट पर उपलब्ध हैं; API के परिवर्तन लॉग में प्रविष्टि 22 सितंबर की है, जबकि सार्वजनिक घोषणा 23 सितंबर को हुई।

दोनों मॉडलों की भूमिकाएँ अलग हैं। Flash TTS रचना के लिए है: आवाज़ की भूमिका, लहजे और व्यक्तित्व का प्राकृतिक भाषा में वर्णन किया जाता है, फिर हर संवाद की अदायगी, गति और बोली में बदलाव निर्देशित किए जाते हैं। Google इसे वीडियो गेम, ऑडियोबुक और पॉडकास्ट के लिए पेश करता है। Flash-Lite TTS का लक्ष्य अधिक मात्रा और कम लागत है: बड़े पैमाने पर डबिंग, भारी मात्रा में ऑडियो उत्पादन और वास्तविक समय के वॉइस एजेंट; इसे gemini-3.1-flash-tts-preview की जगह लेनी है। दोनों एक ही स्क्रिप्ट में दो आवाज़ों का संवाद, आवाज़ के स्वर में उल्लेखनीय बदलाव के बिना घंटों लंबा ऑडियो, और <laughs>, <sigh> या |mhm| जैसे टैग संभालते हैं।

घोषणा में 2 000 से अधिक तैयार आवाज़ों का उल्लेख है, जिनमें क्यूबेक की फ़्रेंच जैसी क्षेत्रीय किस्में शामिल हैं; वहीं API दस्तावेज़ में 30 स्टूडियो आवाज़ों और कई सौ आवाज़ों वाली विस्तृत लाइब्रेरी का वर्णन है। आवाज़ की प्रतिकृति 30 सेकंड के नमूने से बनाई जा सकती है, बशर्ते आवाज़ के मालिक की मौखिक सहमति रिकॉर्ड की जाए। सभी उत्पन्न ऑडियो में SynthID वॉटरमार्क होता है। फ़्रांस के पाठकों के लिए एक अहम बात: घोषणा की एक टिप्पणी के अनुसार, AI Studio के ज़रिए आवाज़ की प्रतिकृति यूरोपीय आर्थिक क्षेत्र, ब्रिटेन, स्विट्ज़रलैंड, भारत, इलिनॉय और टेक्सस में उपलब्ध नहीं है। मौजूदा आवाज़ों को रीमिक्स करने की सुविधा जल्द आने की घोषणा की गई है।

मॉडल की विशेषताGemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS
API पहचानकर्ताgemini-3.8-flash-ttsgemini-3.8-flash-lite-tts
समर्थित भाषाएँ (API दस्तावेज़)130101
लक्षित उपयोगरचना, सूक्ष्म निर्देशनअधिक मात्रा, डबिंग, वॉइस एजेंट
ऑडियो आउटपुट, 31/12/2026 तक Standard मूल्य (मिलियन टोकन)9 डॉलर6 डॉलर
ऑडियो आउटपुट, 01/01/2027 से Standard मूल्य (मिलियन टोकन)18 डॉलर12 डॉलर
उपभोक्ता उत्पादGemini NotebookGoogle Vids (घोषित वाचन सुविधा)

तुलना के लिए, Gemini 3.1 Flash TTS Preview के आउटपुट ऑडियो की लागत 20 डॉलर प्रति मिलियन टोकन है। लॉन्च के समर्थन में Google बाहरी मूल्यांकनों का हवाला देता है: Flash TTS ने Hume AI के Voice Design Benchmark में पहला स्थान (71,4) पाया, और दोनों मॉडलों ने Hume AI के Overall Quality Index में पहले दो स्थान हासिल किए। वे API के ज़रिए Gemini Enterprise में भी «जल्द» उपलब्ध होंगे।

🔗 Google की घोषणा · Gemini API के रिलीज़ नोट्स · API की कीमतें


FLUX 3 Action: Black Forest Labs ने रोबोट नियंत्रित करने के लिए खुले वज़न वाला मॉडल जारी किया

23 सितंबर — FLUX इमेज मॉडल के लिए प्रसिद्ध Black Forest Labs ने FLUX 3 Action जारी किया है। यह रोबोट नियंत्रित करने के लिए बनाया गया 7 बिलियन पैरामीटर वाला वर्ल्ड एक्शन मॉडल (World Action Model) है। बहु-माध्यमी FLUX 3 आधार से विकसित यह मॉडल कैमरों और जोड़ों की स्थिति के आधार पर एक ही गणना में आगामी छवियों और मोटर कमांड का अनुमान लगाता है। इसके वज़न खुले हैं (DROID चेकपॉइंट के Hugging Face पृष्ठ पर «flux-kommunity-license» लाइसेंस दर्ज है)। प्रयोगशाला ने कोड, फ़ाइन-ट्यूनिंग की विधि, बेंचमार्क और दोहराए जा सकने वाले उदाहरण भी प्रकाशित किए हैं।

An open weights 7B World Action Model that achieves first place on the RoboLab benchmark. It outperforms the previous best open model by 6.1 percentage points while using 56% fewer parameters and running up to 3.95x faster.

🇮🇳 7B पैरामीटर वाला खुले वज़न का वर्ल्ड एक्शन मॉडल, जिसने RoboLab बेंचमार्क में पहला स्थान हासिल किया है। यह पिछले सर्वश्रेष्ठ खुले मॉडल से 6,1 प्रतिशत अंक आगे है, जबकि इसमें 56 % कम पैरामीटर हैं और यह 3,95 गुना तक तेज़ चलता है।X पर @bfl_ai

मूल्यांकित मॉडलमॉडल का प्रकारवज़नों की उपलब्धताRoboLab-120 में सफलतापैरामीटरों की संख्या
FLUX 3 ActionWAMखुले42,92 %7B
OASIS WAMVLM + WAMबंद39,0 %
Cosmos3-Nano-PolicyWAMखुले36,8 %16B
PhoenixTAMP+FMबंद34,4 %
BiMind v0.1VLAबंद33,3 %
π0.5VLAखुले28,0 %3,3B
DreamZeroWAMखुले25,7 %14B
GR00T N1.6VLAखुले7,2 %3B

पिछला सर्वश्रेष्ठ खुला मॉडल NVIDIA का Cosmos3-Nano-Policy था। «3,95 गुना तक तेज़» की तुलना FP8 में Cosmos 3 Nano से है: GPU के अनुसार गति 1,52 से 3,95 गुना तक है। सबसे सक्षम खुले दृष्टि-भाषा-क्रिया मॉडल (VLA) π0.5 की तुलना में, एक चरण वाला डिस्टिल्ड संस्करण (38,3 %) वर्कस्टेशन और डेटा सेंटर GPU पर तेज़ है, लेकिन RTX 5090 पर धीमा है; हालाँकि यह प्रति अनुमान 2,13 सेकंड की गति का पूर्वानुमान लगाता है, जबकि π0.5 केवल 1 सेकंड का।

घोषणा में एक मिश्रित नीति भी परखी गई है, जिसमें OpenAI का GPT-6 Astra रोबोट की निगरानी करता है: कम प्रयास स्तर (low) पर Astra के साथ FLUX 3 Action ने 90 % एपिसोड सफलतापूर्वक पूरे किए, प्रति सफलता 8,77 डॉलर और लगभग 8 मिनट लगे। इसके मुकाबले «xhigh» प्रयास स्तर पर अकेले Astra ने सभी कार्य पूरे किए, लेकिन प्रति सफलता 13,47 डॉलर और 16 मिनट लगे। वास्तविक Franka रोबोटिक भुजा पर Positronic Robotics के अंध मूल्यांकन में FLUX 3 Action ने 30 में से 28 बार सफलता पाई, जबकि Cosmos 3 Nano ने 27 और π0.5 ने 13 बार। Hugging Face पर तीन चेकपॉइंट उपलब्ध हैं (बेस, SO-101 और DROID)। मॉडल को NVIDIA के साथ LeRobot में भी एकीकृत किया गया है और इसे Jetson पर तैनात किया जा सकता है।

🔗 FLUX 3 Action (Black Forest Labs) · Hugging Face संग्रह


Escaping SPACE: Perplexity ने Computer के सैंडबॉक्स का पहला सुरक्षा ऑडिट प्रकाशित किया

23 सितंबर — Perplexity Secure Intelligence Institute ने SPACE पर किए गए प्रवेश परीक्षणों (red-teaming) की रिपोर्ट का पहला भाग प्रकाशित किया है। SPACE वह सैंडबॉक्स है जिसमें 15 जुलाई को पेश किए गए Perplexity Computer के एजेंट चलते हैं। यह किसी उत्पाद का लॉन्च नहीं, बल्कि SPACE का पहला प्रकाशित सुरक्षा मूल्यांकन है। हर सैंडबॉक्स होस्ट मशीन से अलग की गई Firecracker माइक्रो वर्चुअल मशीन है, और हर सैंडबॉक्स का अपना गेटवे आउटबाउंड नेटवर्क नीति लागू करता है।

नौ मॉडलों को वर्चुअल मशीन में root पहुँच दी गई और झंडा हासिल करने जैसी दो चुनौतियाँ सौंपी गईं: VM और होस्ट के बीच की सीमा पार करके एक नकली AWS पहचानकर्ता प्राप्त करना, या नेटवर्क नीति से अवरुद्ध URL तक पहुँचना। परीक्षण में SPACE के स्रोत कोड तक पहुँच होने या न होने और नेटवर्क पहुँच के दो स्तरों—बिल्कुल नहीं या आंशिक (PyPI तथा Ubuntu पैकेज रिपॉज़िटरी और Perplexity वेब खोज)—को मिलाया गया; हर संयोजन में तीन प्रयास हुए। परिणाम: स्रोत कोड उपलब्ध होने पर भी 108 प्रयासों में VM से होस्ट तक कोई पहुँच नहीं बना सका। पूरा नेटवर्क बंद होने पर नेटवर्क फ़िल्टरिंग बनी रही (54 में से 0); आंशिक नेटवर्क पहुँच के साथ, हालाँकि, सुधार लागू होने से पहले 54 में से 11 प्रयास निषिद्ध गंतव्य तक पहुँचे।

मूल्यांकित मॉडलस्रोत कोड के साथ सफलतास्रोत कोड के बिना सफलता
Claude Opus 5.03 में से 3 प्रयासकोई नहीं
GPT-5.6 Sol3 में से 3 प्रयास3 में से 2 प्रयास
Kimi K33 में से 2 प्रयासकोई नहीं
GPT-5.6 Cyberकोई नहीं3 में से 1 प्रयास
पाँच अन्य मूल्यांकित मॉडलकोई नहींकोई नहीं

दो कमज़ोरियों का इस्तेमाल हुआ। पहली, DNS स्पूफ़िंग: एजेंट ने pypi.org को लक्ष्य के पते से जोड़ने वाला नकली जवाब डाला, और स्रोत की जाँच न करने वाले गेटवे ने उसे दर्ज कर लिया; इसके लिए ऐसा आंतरिक पता चाहिए था जो केवल स्रोत कोड में दिखता था। दूसरी, CDN द्वारा IP पतों को साझा करना: GPT-5.6 Sol ने निषिद्ध URL को fiddle.fastly.dev से खुलवाया, जिस तक PyPI वाले ही पते से पहुँचा जा सकता था। GPT-5.6 Cyber ने पहले Taboola की इमेज सेवा और फिर thum.io के स्क्रीनशॉट जनरेटर का उपयोग किया, जिसके बाद अक्षर पहचान से झंडा पढ़ा। Claude Opus 5.0 ने इस रास्ते को पहचाना, लेकिन किसी बाहरी प्रणाली को निशाना न बनाने के निर्देश के विरुद्ध मानकर छोड़ दिया। सफल होने वाला खुले वज़न का एकमात्र मॉडल Kimi K3 था। दो मॉडलों का मूल्यांकन नहीं हो सका: Anthropic के Cyber Verification Program में Perplexity के नामांकन के बावजूद Fable ने अभ्यास से इनकार किया, और GPT-6 Astra ने भी मना कर दिया।

26 अगस्त को मिली कमज़ोरियाँ ठीक कर दी गई हैं: हर आउटबाउंड पैकेट में अपनी VM को दिया गया पता होना चाहिए, और अब गेटवे स्वयं TLS कनेक्शन समाप्त करके सर्वर नाम (SNI) तथा HTTP होस्ट की जाँच करता है। हमलावर के लिए सबसे अनुकूल संयोजन में दोबारा मूल्यांकन करने पर मॉडल झंडा प्राप्त नहीं कर सके। इसके बाद Perplexity ने बिना एजेंट के तीसरे पक्ष के दस सैंडबॉक्स प्लेटफ़ॉर्म पर परीक्षण किए: आठ में कम से कम एक रास्ता मिला जिससे प्रतिबंध पार किया जा सकता था। इनमें E2B, Vercel Sandbox, Modal Sandboxes और Daytona Sandbox शामिल थे, जबकि Cloudflare Sandbox और NVIDIA OpenShell सुरक्षित रहे। 1 सितंबर को सूचित किए गए सभी प्रदाताओं ने जवाब दिया; 10 सितंबर तक Daytona, Deno और microsandbox ने समस्याएँ ठीक कर दी थीं, जबकि Vercel और Modal ने इस व्यवहार को ज्ञात सीमा माना। मॉडलों की रणनीतियों पर रिपोर्ट के दूसरे भाग की घोषणा हुई है, लेकिन तारीख नहीं दी गई है।

🔗 Escaping SPACE, भाग I


Claude Code 2.1.281: एट्रिब्यूशन बंद करने का विकल्प और ऑटो मोड पर सख्ती

23 सितंबर — 2.1.280 के अगले दिन, 19:19 UTC पर जारी Claude Code 2.1.281 में 176 प्रविष्टियाँ हैं, जिनमें 112 सुधार हैं। रोज़मर्रा के इस्तेमाल में दो बदलाव दिखते हैं: settings.json में "attribution": false सेटिंग कमिट और पुल रिक्वेस्ट से सभी एट्रिब्यूशन हटा देती है, और संदेश तुरंत भेजने पर (ctrl+enter) चल रहे टूल मौजूदा टर्न को रद्द करने के बजाय पृष्ठभूमि में चले जाते हैं।

ऑटो मोड के नियम और सख्त हुए हैं: जहाँ क्लासिफ़ायर की समीक्षा सर्वर पर होती है, वहाँ केवल पढ़ने वाली शेल कमांड भी उसके फ़ैसले का इंतज़ार करती हैं। एक सुरक्षा सुधार भी ध्यान देने योग्य है: कमांड सब्स्टिट्यूशन को लक्ष्य बनाने वाला रिकर्सिव rm, जैसे rm -rf "$(pwd)", पहले ऑटो मोड में और --dangerously-skip-permissions के साथ बिना पुष्टि के चल जाता था; अब अनुमति देने वाला Bash नियम होने पर भी पुष्टि माँगता है। बिना निगरानी वाले सत्रों को अटकने से बचाने के लिए, ख़तरनाक rm की पुष्टि का संकेत दो मिनट इंतज़ार करता है, फिर कमांड अस्वीकार करके उसे दोबारा लिखने का सुझाव देता है।

स्वयं होस्ट किए गए रनर के लिए एक असंगत बदलाव है: --system-prompt जोड़ने वाली मध्यवर्ती स्क्रिप्ट (wrappers) या हुक को --system-prompt-file अपनाना होगा। प्रशासकों के लिए, Claude apps गेटवे STS से प्राप्त IAM भूमिका (assume_role) के तहत Amazon Bedrock को कॉल कर सकता है, ज़रूरत पड़ने पर किसी दूसरे AWS खाते में भी, और हर अनुरोध पर Bedrock सुरक्षा नियंत्रण लागू कर सकता है।

🔗 Claude Code v2.1.281


Anthropic के उत्पाद: तेज़ हुआ claude.ai, विस्तृत हुआ Marketplace

उसी दिन प्रकाशित Anthropic की दो उत्पाद घोषणाएँ वैज्ञानिक परिणाम की पूरक हैं।

दो हफ़्तों में claude.ai तीन गुना तेज़

23 सितंबर — claude.dev पर Anthropic के तीन इंजीनियर अगस्त में चले दो सप्ताह के प्रयास का विवरण देते हैं, जिसने claude.ai और डेस्कटॉप ऐप को लगभग तीन गुना तेज़ बनाया। पूरा काम एक ही Slack चैनल में हुआ। उसमें Claude Tag (बीटा) एक आंतरिक शोध मॉडल से संचालित था, जिसे उन्होंने “लगभग Opus 5.5 के बराबर” बताया: Claude ने बाधाएँ पहचानीं, बेंचमार्क बनाए, सुधार सुझाए और परिनियोजन पर नज़र रखी; मनुष्यों ने लक्ष्य तय किए और हर बदलाव को मंज़ूरी दी। नतीजा: 3,000 से अधिक बदलाव मर्ज हुए, ग्राहकों को दिखने वाली किसी घटना या बदलाव वापस लेने की ज़रूरत के बिना।

मापा गया चरण (75वाँ परसेंटाइल)प्रयास से पहलेप्रयास के बाद
claude.ai पेज टाइप करने के लिए तैयार3,1 s0,55 s
नया Claude Code सत्र (डेस्कटॉप)0,8 s0,3 s
Claude Cowork क्लाउड सत्र (डेस्कटॉप)2,6 s0,73 s
13 मापों का ज्यामितीय माध्य3,1x तेज़

तरीका एक विचार पर आधारित है: Claude के पास जैसे ही कोई मापने योग्य लक्ष्य होता है, वह उसे बेहतर बना सकता है। इसलिए टीम ने नियतात्मक मापों को CI की ऐसी सीमाओं में बदला जो केवल घट सकती हैं। इन सुधारों में से एक, लगभग चार गुना अधिक सुचारु स्ट्रीमिंग, की घोषणा 24 अगस्त को हो चुकी थी।

🔗 हमने दो हफ़्तों में claude.ai को 3x तेज़ कैसे बनाया

Claude Marketplace में कनेक्टर, एजेंट और इंटीग्रेटर एक साथ

23 सितंबर — Anthropic ने मार्च में सीमित पूर्वावलोकन के रूप में शुरू हुए Claude Marketplace का विस्तार किया है। अब इसमें तीन तरह की पेशकशें हैं: 2,000 से अधिक कनेक्टर और प्लगइन (Atlassian, Google, Microsoft, Notion, Salesforce…), Claude से संचालित एजेंट और उत्पाद (CrowdStrike, Cursor, Harvey, Legora, Lovable, Snowflake), जिनका भुगतान कंपनियाँ Anthropic के प्रति अपनी खर्च प्रतिबद्धता के एक हिस्से से कर सकती हैं, और Claude Partner Network की परामर्श कंपनियाँ (Accenture, Boston Consulting Group, Deloitte)। प्रदाताओं के पास शामिल होने के तीन रास्ते हैं: MCP और Agent Skills से कनेक्टर या प्लगइन बनाना, किसी एजेंट या उत्पाद के लिए आवेदन देना, या Partner Network से जुड़ना। साथ प्रकाशित एक लेख ख़रीद की प्रक्रिया दिखाता है: CodeRabbit ने Anthropic के लिए प्रतिबद्ध अपने बजट से Vercel की योजना का भुगतान किया और समझौता एक सप्ताह में पूरा हुआ। Anthropic की खर्च प्रतिबद्धता से ऐसा भुगतान अभी पात्रता के अनुरोध पर उपलब्ध सीमित पूर्वावलोकन में है।

🔗 Claude Marketplace


ChatGPT: Voice से काम कराना, रिविज़न कार्ड और Privacy Center

Voice प्लगइन इस्तेमाल करता है और ChatGPT Work में आता है

23 सितंबर — OpenAI ने ChatGPT Voice को दो दिशाओं में बढ़ाया है। वेब, iOS और Android पर बातचीत के दौरान Live वॉइस मोड अब खाते से जुड़े प्लगइन और ऐप, जैसे ईमेल, कैलेंडर या Slack, इस्तेमाल कर सकता है। Voice वेब और मोबाइल पर ChatGPT Work में भी आ गया है: इसमें बोलकर दस्तावेज़, प्रस्तुति या स्प्रेडशीट बनाने, कोई जुड़ा हुआ ऐप इस्तेमाल करने या ब्राउज़र में कोई काम करने को कहा जा सकता है। कॉल के बाद वह काम लिखित रूप में जारी रह सकता है।

मॉडल के बारे में OpenAI की पोस्ट कहती है कि Voice, GPT-6 Astra, Sol और Luna का भी उपयोग कर सकता है; वहीं सहायता लेख स्पष्ट करता है कि सदस्यता के अनुसार Live, GPT-Live-1 या GPT-Live-1 mini पर चलता है, लेकिन GPT-6 मॉडल की भूमिका का विवरण नहीं देता। Free और Go उपयोगकर्ताओं को उनके प्लान के प्लगइन के साथ Chat में Voice मिलता है; Work में Voice के लिए दोनों की पहुँच आवश्यक है, और इस तरह शुरू किए गए काम Work के सामान्य उपयोग में गिने जाते हैं। Live वीडियो या स्क्रीन शेयरिंग का समर्थन नहीं करता। 23 सितंबर से नवीनतम ऐप संस्करण में इसका वैश्विक रोलआउट जारी है।

🔗 X पर OpenAI की घोषणा · ChatGPT Voice सहायता लेख

रिविज़न कार्ड और गोपनीयता केंद्र

22 सितंबर — ChatGPT अब किसी विषय या अपलोड किए गए नोट्स से इंटरैक्टिव रिविज़न कार्ड (flashcards) बना सकता है। कार्ड पर टैप करके उसे पलटा जाता है, फिर बताया जाता है कि उत्तर पहले से आता था या उसे दोबारा पढ़ना है; कार्डों का क्रम भी बदला जा सकता है। कार्ड लाइब्रेरी में अपने आप सहेजे जाते हैं। यह सुविधा मुफ़्त प्लान सहित सभी प्लान के लिए मोबाइल और वेब पर उपलब्ध है।

21 सितंबर — पिछली ख़बर: उसी रिलीज़ नोट्स पेज पर एक दिन पहले गोपनीयता केंद्र (Privacy Center) की भी घोषणा की गई थी। यह Free, Go, Plus और Pro प्लान के साइन इन किए हुए उपयोगकर्ताओं के लिए जारी किया जा रहा है। इसमें बातचीत की गोपनीयता, मेमोरी, निजीकरण, डेटा के उपयोग, जुड़े हुए ऐप और खाते की सुरक्षा की जानकारी एक जगह मिलती है, साथ ही सेटिंग्स के सीधे लिंक भी हैं। वेब पर इसे खाते के मेन्यू (Help, फिर Privacy Center) से और मोबाइल पर सेटिंग्स से खोला जा सकता है।

🔗 ChatGPT के रिलीज़ नोट्स


दो नए बेंचमार्क: मानसिक स्वास्थ्य और इन्फ़रेंस सेवा

MentalHealthBench (OpenAI)

23 सितंबर — OpenAI ने MentalHealthBench जारी किया है। यह खुला बेंचमार्क जाँचता है कि मॉडल मानसिक स्वास्थ्य से जुड़ी वास्तविक लगने वाली बातचीत में कैसे जवाब देते हैं—भावनात्मक पहलू वाली रोज़मर्रा की बातों से लेकर आपात स्थितियों तक। इसे 22 देशों के 19 भाषाएँ बोलने वाले 80 से अधिक लाइसेंस प्राप्त मनोवैज्ञानिकों और मनोचिकित्सकों के साथ बनाया गया है। कृत्रिम रूप से तैयार बातचीत में चार तरह के लोग हैं: वयस्क, 13 से 17 वर्ष के किशोर, देखभालकर्ता और चिकित्सक। विशेषज्ञों ने हर बातचीत के लिए -10 से +10 तक भारित मानदंड लिखे; केवल वे मानदंड रखे गए जिन्हें तीन में से कम से कम दो विशेषज्ञों ने मंज़ूरी दी और तीसरे ने उनका विरोध नहीं किया। मूल्यांकन GPT-5.6 Sol को निर्णायक बनाकर अपने आप किया जाता है, और स्कोर सुरक्षा, संदर्भ पूछने तथा उपयोगकर्ता की स्वायत्तता का सम्मान करने जैसे दस आयामों में बँटता है। OpenAI का कहना है कि मॉडल लगातार बेहतर हो रहे हैं, ख़ासकर संदर्भ पूछने में, लेकिन प्रत्येक मॉडल के स्कोर केवल लेख के ग्राफ़ में दिए गए हैं। OpenAI याद दिलाता है कि ChatGPT थेरेपी या पेशेवर देखरेख का विकल्प नहीं है।

🔗 MentalHealthBench का परिचय

SWE-Serve (NVIDIA)

23 सितंबर — Nemotron मॉडल के डेटा और मूल्यांकन पर काम करने वाली NVIDIA टीम ने SGLang टीम के साथ बनाया SWE-Serve जारी किया है: इस इन्फ़रेंस सर्विंग इंजन में वास्तव में मर्ज हुईं 83 पुल रिक्वेस्ट को 53 चलाए जा सकने वाले कार्यों में बदला गया है (स्पेकुलेटिव डिकोडिंग, मॉडल समर्थन, कर्नेल, कैश, सर्विंग API)। मुख्य नतीजा स्थानीय परीक्षण और वास्तविक सेवा के बीच का अंतर दिखाता है: वास्तविक सर्वर शुरू करने वाले 19 कार्यों पर वही सुधार लाइव सर्विंग परीक्षणों के बिना 69,4 % सफल होते हैं, लेकिन पूरे सत्यापनकर्ता के साथ केवल 45,9 %। यानी अन्य जाँचों में सफल होने वाले लगभग हर तीन सुधारों में से एक मॉडल लोड करके उससे अनुरोध करते ही विफल हो जाता है।

मूल्यांकित मॉडल (अधिकतम रीजनिंग)3 प्रयासों में pass@1प्रति कार्य औसत लागत
Claude Opus 575 %17,40 डॉलर
GPT-5.6 Sol75 %12,26 डॉलर
Kimi K364 %7,24 डॉलर
GPT-5.6 Luna64 %0,95 डॉलर
DeepSeek V4 Flash (0731)55 %0,69 डॉलर

न्यूनतम सुविधाओं वाले एक एजेंट से, वेब पहुँच के बिना, ग्यारह मॉडलों का मूल्यांकन किया गया। तालिका में Claude Opus 5.5, 22 सितंबर को जारी GPT-6 Sol और Luna, या GPT-6 Astra शामिल नहीं हैं। कार्य और सत्यापनकर्ता सार्वजनिक हैं।

🔗 SWE-Serve स्थानीय परीक्षणों और लाइव सर्विंग के बीच अंतर कैसे दिखाता है · GitHub रिपॉज़िटरी


जनरेटिव वीडियो एडिटिंग सॉफ़्टवेयर में पहुँचा

DaVinci Resolve Studio में Runway

23 सितंबर — Premiere Pro और After Effects के लिए अपने प्लगइन जारी करने के दो सप्ताह बाद, Runway अब Blackmagic Design के वीडियो एडिटिंग सॉफ़्टवेयर DaVinci Resolve Studio में आ गया है। macOS और Windows के लिए मुफ़्त प्लगइन Workspace, फिर Workflow Integrations से खुलता है। इससे प्रॉम्प्ट द्वारा चित्र और वीडियो बनाए जा सकते हैं, जो ब्राउज़र खोले बिना एक क्लिक में Media Pool और टाइमलाइन में आयात हो जाते हैं। Edit Studio सुविधा पहले से एडिट किए गए शॉट पर काम करती है: पैनल चुना हुआ हिस्सा निर्यात करता है और Aleph 2.0 अधिकतम पाँच संशोधित कीफ़्रेम के आधार पर उसे नई शैली में, समान अवधि रखते हुए, फिर से रेंडर करता है। इसके लिए DaVinci Resolve Studio 19 या नया संस्करण चाहिए; जनरेशन सभी भुगतान वाले Runway प्लान में उपलब्ध है और मौजूदा क्रेडिट इस्तेमाल करती है। हर जनरेशन की लागत पुष्टि से पहले दिखाई जाती है।

🔗 Runway अब DaVinci Resolve में

Google Vids में Gemini Omni 1.1 Flash मुफ़्त

23 सितंबर — Google या Google Workspace खाते वाला कोई भी व्यक्ति अब कंप्यूटर पर vids.new से Google Vids में Gemini Omni 1.1 Flash की मदद से मुफ़्त वीडियो बना सकता है। संस्करण 1.1 में तीन नए नियंत्रण हैं: पात्रों, रोशनी और दृश्य को बनाए रखते हुए किसी दृश्य को आगे बढ़ाना; क्लिप की सटीक अवधि तय करके उसे वॉइस ओवर से मिलाना; और सीधे 1080p में वीडियो बनाना। हर क्लिप पर SynthID वॉटरमार्क होता है। पूरा रोलआउट 23 सितंबर से शुरू होता है और इसमें 1 से 3 दिन लग सकते हैं; भुगतान वाले प्लान में अधिक वीडियो बनाए जा सकते हैं, लेकिन कोई संख्या प्रकाशित नहीं की गई है। Google ने जल्द ही Vids में Gemini 3.8 Flash-Lite TTS से 100 से अधिक भाषाओं में नैरेशन उपलब्ध कराने की घोषणा की है।

🔗 Google की घोषणा

Made On YouTube 2026: Shorts की एडिटिंग में Gemini Omni

23 सितंबर — अपने वार्षिक Made On YouTube कार्यक्रम में YouTube ने Shorts और YouTube Create ऐप के लिए संवाद के ज़रिए काम करने वाले एडिटिंग सहायक में Gemini Omni को जोड़ा है: साधारण टेक्स्ट निर्देशों से बोले गए हिस्से काटे जा सकते हैं, संगीत मिलाया जा सकता है, शुरुआत में ध्यान खींचने वाला टेक्स्ट जोड़ा जा सकता है या शॉट्स का क्रम बदला जा सकता है। लाइव प्रसारण में अपने आप डबिंग (Live auto-dubbing) जुड़ती है, YouTube Music को बातचीत करके अपनी सुनने की कतार बनाने के लिए Ask Music मिलता है, और Podcast Lineup हर सप्ताह सुझाए गए पॉडकास्ट के AI से बने बोले हुए परिचय देता है। रचनाकारों को अपनी आवाज़ और चेहरे की सुरक्षा के लिए विस्तृत समानता पहचान सुविधा भी मिलती है। केवल व्यक्तिगत होम फ़ीड (Custom Feeds) के लिए समय बताया गया है: वे इस शरद ऋतु में अमेरिकी दर्शकों को मिलेंगी; बाकी सुविधाओं की अभी कोई निश्चित समयसीमा नहीं है।

🔗 Made On YouTube 2026 · Google का सारांश


सहायक दूसरे ऐप से जुड़ रहे हैं

Gemini: जुड़े हुए ऐप की नई खेप

23 सितंबर — Google, Gemini से जोड़े जा सकने वाले ऐप की नई शृंखला जारी कर रहा है, जिसे @GeminiApp खाते ने MCP कनेक्शन बताया है। लेख में तीन श्रेणियों के 14 नाम दिए गए हैं: उत्पादकता (Airtable, Linear, monday.com, PandaDoc, Wispr AI, Zoho), रचनात्मक काम (Adobe, Picsart, Squarespace, Webflow) और रोज़मर्रा की ज़िंदगी (apartments.com, Experian, Peloton, SeatGeek); वहीं @GeminiApp की पोस्ट 13 नए ऐप बताती है। इन सेवाओं को सेटिंग्स में सक्रिय किया जा सकता है या बातचीत में @ टाइप करके बुलाया जा सकता है। दिए गए उदाहरणों में Adobe से तस्वीर की रोशनी बदलना और Experian से अपना क्रेडिट स्कोर देखना शामिल हैं। लेख यह नहीं बताता कि यह किन देशों या प्लान के लिए है।

🔗 Google की घोषणा · @GeminiApp की घोषणा

Meta के एजेंट Muse में Shopify, PayPal, Expedia, Instacart, फिर ElevenLabs और HeyGen

22 और 23 सितंबर — Meta द्वारा 8 सितंबर को शुरू किए गए निजी एजेंट Muse ने 24 घंटे से भी कम समय में कारोबारी सेवाओं के चार कनेक्टर घोषित किए। आधिकारिक @Muse खाते के अनुसार सभी “जल्द” उपलब्ध होंगे, लेकिन तारीख, शुल्क या देश नहीं बताए गए। 23 तारीख को जनरेटिव मीडिया की दो कंपनियों ने भी Muse में आने की घोषणा की: ElevenLabs ने उपलब्धता की तारीख नहीं बताई, और HeyGen अपने MCP सर्वर का उपयोग करेगा।

घोषित सेवाघोषणा में बताया गया उपयोगघोषणा करने वालाबताई गई उपलब्धता
Shopifyवेब पर कहीं भी एक ही कदम में भुगतान@Museजल्द
PayPalदुनिया भर में एजेंट द्वारा प्रबंधित भुगतान@Museजल्द
Expediaहोटल बुक करना@Museजल्द
Instacartघर तक किराने की डिलीवरी@Museजल्द
ElevenLabsवॉइस ओवर, साउंडट्रैक और वीडियो@ElevenLabsस्पष्ट नहीं
HeyGenअपनी आवाज़ वाला, प्रकाशित करने के लिए तैयार अवतार वीडियो@HeyGenस्पष्ट नहीं

🔗 @Muse द्वारा घोषित चार कनेक्टर · Muse में ElevenLabs का आगमन · Muse से जुड़ा HeyGen

Tesla और Google Slides, Sheets तथा Docs में Grok Bot

22 सितंबर — Tesla ने अपनी कारों में SpaceXAI के एजेंट Grok Bot के आने की घोषणा की: Connectors की मदद से Grok ईमेल इनबॉक्स संभाल सकता है, कैलेंडर व्यवस्थित कर सकता है या मौजूदा फ़ाइलों, बातचीत और कार्यों को आगे बढ़ा सकता है, जबकि चालक स्टीयरिंग पर हाथ रखे रहता है। @grok खाते ने उसी शाम घोषणा साझा की। इसे सक्रिय करने के तीन चरण हैं: कार में Grok ऐप में साइन इन करना, मोबाइल ऐप या Grok वेबसाइट से Connectors जोड़ना, फिर Grok Bot के लिए ज़रूरी SuperGrok की सदस्यता लेना। संदेशों में वाहन के मॉडल या देशों का उल्लेख नहीं है।

उसी दिन @bot खाते ने घोषणा की कि Grok Bot सीधे Google Slides, Sheets और Docs से जुड़ता है, ईमेल अटैचमेंट बेहतर ढंग से संभालता है (फ़ाइलें पढ़ना और जोड़ना) और अपनी वेब ब्राउज़िंग को उपयोगकर्ता के नेटवर्क से चला सकता है। SpaceXAI ने तेज़ कार्य निष्पादन और अधिक प्रतिक्रियाशील डेस्कटॉप ऐप का भी वादा किया है, लेकिन कोई आँकड़ा नहीं दिया।

🔗 @grok की साझा की हुई पोस्ट · Tesla की घोषणा · Grok Bot की पोस्ट शृंखला


Antigravity: स्थानीय एजेंट और /plan कमांड

SDK अब Gemma 4 26B के साथ स्थानीय रूप से अपने एजेंट चलाता है

23 सितंबर — Google Antigravity की एजेंट क्षमताओं तक Python से पहुँच देने वाला Antigravity SDK अब पूरी तरह स्थानीय वर्कफ़्लो का समर्थन करता है। शुरुआती समर्थन LiteRT (Google AI Edge) पर चलने वाले Gemma 4 26B A4B के लिए है। इसके लिए 24 GB से अधिक VRAM या एकीकृत मेमोरी वाली मशीन चाहिए; LocalOpenAIAgentConfig Ollama, LM Studio या vLLM जैसे किसी भी OpenAI-संगत सर्वर से जुड़ सकता है। Google के अनुसार, इसमें API की लागत या दर सीमा नहीं है, कोड मशीन से बाहर नहीं जाता और हाइब्रिड वर्कफ़्लो संभव हैं। उसके प्रदर्शन में Gemini 3.8 Flash क्लाउड पर 95 टोकन का उपयोग करके तीन असुरक्षित मॉड्यूल की जाँच की योजना बनाता है, जबकि उसे कोड कभी नहीं दिखता। इस दौरान Gemma 4 26B के स्थानीय इंस्टेंस खामियों को दोहराते हैं, सुधार लिखते हैं और उनकी पुष्टि करते हैं; 97,2 % टोकन (3 322) स्थानीय स्तर पर ही रहते हैं। ये सुविधाएँ 21 सितंबर को आए SDK 0.1.18 में शामिल हुईं। यह संस्करण इंटरैक्टिव प्रश्न वाले टूल ASK_QUESTION को डिफ़ॉल्ट टूलों से भी हटाता है, ताकि एजेंट स्वायत्त रूप से काम कर सकें।

🔗 Google Developers की घोषणा

Antigravity 2.16.0 और 2.17.0, CLI 1.2.8 और 1.2.9

22 सितंबर — Antigravity ऐप ने एक ही दिन दो संस्करण जारी किए। 2.17.0 में /plan कमांड आया है: एजेंट कोई भी कोड लिखने से पहले एक योजना तैयार करता है, जिसे पढ़कर बदला जा सकता है। Plan Review Policy की सेटिंग में तीन मोड हैं—हर योजना की समीक्षा करना, निर्णय एजेंट पर छोड़ना या समीक्षा छोड़ देना। यह संस्करण नियमों के लिए 20 000 टोकन का बजट भी रखता है और प्रत्येक रिपॉज़िटरी की कॉन्फ़िगरेशन .gemini/config.json से पढ़ता है; पुराने .agents/settings.json को अब ध्यान में नहीं रखा जाता। 2.16.0 में WSL वितरण से जुड़ना, प्रॉम्प्ट में Word, Excel और PowerPoint दस्तावेज़ जोड़ना और उप-एजेंटों को लाइव कार्ड के रूप में देखना संभव हुआ है।

ऐप का संस्करणसुधारों की संख्यादोष सुधारों की संख्यामुख्य नई सुविधा
2.16.01215WSL, Office अटैचमेंट, उप-एजेंटों के कार्ड
2.17.01110/plan, नियमों के लिए 20 000 टोकन का बजट

22 और 23 सितंबर — टर्मिनल पर CLI 1.2.9 ने किसी उप-एजेंट को सीधे लिखने के लिए @ सिंटैक्स जोड़ा और headless मोड को अधिक भरोसेमंद बनाया: बैकग्राउंड कार्यों के लिए अब 30 मिनट तक इंतज़ार किया जाता है, जबकि पहले एजेंट के निष्क्रिय होने के कुछ सेकंड बाद उन्हें रद्द कर दिया जाता था। 1.2.8 ने संदर्भ के संक्षेपण में बदलाव किया और वॉइस डिक्टेशन को 3 मिनट 30 सेकंड तक सीमित किया।

🔗 Antigravity का बदलाव विवरण


Google DeepMind: Private AI Compute के लिए एन्क्रिप्टेड स्थायी मेमोरी

23 सितंबर — Google DeepMind ने बताया है कि वह Private AI Compute में स्थायी मेमोरी कैसे जोड़ने की योजना बना रहा है। यह प्लेटफ़ॉर्म हार्डवेयर से अलग रखे गए क्लाउड एनक्लेव में डेटा प्रोसेस करता है। अब तक प्लेटफ़ॉर्म में कोई स्थायी स्थिति नहीं रहती थी: कार्य समाप्त होते ही पूरा संदर्भ मिट जाता था। नई परत क्लाउड में एन्क्रिप्टेड तिजोरी की तरह काम करेगी, जिसकी कुंजियाँ केवल उपयोगकर्ता के उपकरणों पर रहेंगी। Google के अनुसार, इससे डेटा Google सहित किसी के लिए भी अप्राप्य रहेगा। जब किसी मॉडल को जानकारी चाहिए होगी, तो सुरक्षित एनक्लेव अलग रखी गई मेमोरी में डेटा को अस्थायी रूप से डिक्रिप्ट करेगा, अनुरोध पर काम करेगा, नया संदर्भ सहेजेगा और तुरंत फिर एन्क्रिप्ट कर देगा। दिया गया एक उदाहरण है: कनेक्टेड चश्मे से पहले देखे गए असेंबली निर्देशों को बाद में अपने कंप्यूटर पर ढूँढ़ना।

यह भविष्य की संरचना की घोषणा है; उपलब्धता की कोई तारीख या उत्पाद का नाम नहीं दिया गया है। भरोसा बढ़ाने के लिए Google ने एक अद्यतन श्वेतपत्र, अपने सर्वर सॉफ़्टवेयर का छेड़छाड़-रोधी सार्वजनिक रजिस्टर, जिसे उपकरण निजी डेटा भेजने से पहले जाँच सकेंगे, और एक स्वतंत्र ऑडिट के नतीजे प्रकाशित किए हैं। ऑडिट करने वाली कंपनी का नाम नहीं बताया गया है।

🔗 Google DeepMind का लेख


Qwen: स्मार्टफ़ोन के लिए एजेंट और सस्ता ऑडियो

Qwen Intelligence, फ़ोन निर्माताओं के लिए तीन एजेंट

23 सितंबर — Qwen ने Qwen Intelligence शुरू किया है, जो स्मार्टफ़ोन के लिए एजेंटों की पेशकश है और मुख्यतः फ़ोन निर्माताओं को लक्षित करती है। इसके मॉड्यूल—योजना, निष्पादन, छवि और मेमोरी—ज़रूरत के अनुसार जोड़े जा सकते हैं, और रूटिंग गणना को उपकरण तथा क्लाउड के बीच बाँटती है। शुरुआत में तीन एजेंट हैं: Mobile Planner जटिल कार्यों की योजना बनाता है; Mobile-Use पहले API के ज़रिए उन्हें पूरा करता है और ज़रूरत पड़ने पर ग्राफ़िकल इंटरफ़ेस का उपयोग करता है (Qwen के अनुसार MobileWorld पर 82,1, AndroidDaily पर 97,2 और शुरू से अंत तक 90 % सफलता); Mobile Creative 3 सेकंड में छवि बनाता है। Qwen ने चार बेंचमार्क उपलब्ध कराए हैं, लेकिन एजेंटों के वेट या कोड नहीं। Mobile-Use और Mobile Creative का शुल्क उपयोग के आधार पर लिया जा रहा है, जबकि Mobile Planner के लिए शुल्क लागू होने की घोषणा « जल्द » की गई है।

मूल्यांकित मॉडल या सिस्टम (Qwen के अनुसार)MobilePA-Bench का समग्र स्कोर
Qwen-Planner-Agent 27B77,05 %
GPT-6 Astra76,84 %
Claude Opus 575,71 %
Claude Fable 574,53 %
GLM 5.373,88 %

🔗 X पर Qwen की घोषणा · Qwen-Planner-Agent की रिपोर्ट

Qwen-Audio-3.1, 95 % तक सस्ता

23 सितंबर — Qwen-Audio-3.1 ने Qwen के तीन ऑडियो मॉडल—वाक् पहचान (ASR), वाक् संश्लेषण (TTS) और रियल टाइम बातचीत (Realtime)—को उन्नत किया है और दो नए मॉडल जोड़े हैं: TTS-Next, जो एक ही बार में आवाज़, ध्वनि प्रभाव और पृष्ठभूमि ध्वनि बनाता है; और ASR-Next, जो वक्ताओं में अंतर करता है, प्रतिलेखन को समय चिह्न देता है तथा भावनाओं और आसपास की आवाज़ों को पहचानता है। Realtime एक साथ सुन और बोल सकता है तथा बीच में रोका जा सकता है। QwenCloud पर qwen-audio-3.1-realtime-plus की लागत इनपुट ऑडियो के प्रति दस लाख टोकन 6,4 डॉलर और टेक्स्ट व ऑडियो आउटपुट के लिए 24 डॉलर है; इसकी संदर्भ क्षमता 262K टोकन है। फ़ाइलों पर ASR की लागत इनपुट के प्रति दस लाख टोकन 0,15 डॉलर है। अभी केवल ये दो API उपलब्ध हैं; बाकी के « जल्द » आने की घोषणा की गई है।

मॉडल परिवारघोषित मूल्य कटौती
TTSलगभग 70 %
Realtimeलगभग 85 %
ASR95 % तक

🔗 X पर Qwen-Audio-3.1 की घोषणा · QwenCloud पर Qwen-Audio-3.1-Realtime


Mistral Vibe: Chat और Work का विलय, CLI की अनुमतियाँ सख़्त

Chat और Work का विलय, नॉलेज बेस पूर्वावलोकन में

22 सितंबर — Mistral ने अपने सहायक Vibe (पहले Le Chat) के लिए बिना किसी लेख या ट्वीट के चार रिलीज़ नोट प्रकाशित किए। मुख्य बदलाव Chat और Work को एक अनुभव में जोड़ता है: अब एक ही जगह प्रश्न पूछा या कार्य शुरू किया जा सकता है। मोड बदलने की जगह Fast / Think चयनकर्ता आया है, और Chat Agents की जगह Skills ने ली है; Deep Research अब उनमें से एक है। Free, Pro और Teams खातों के लिए माइग्रेशन 14 सितंबर को शुरू हुआ; उद्यम खातों के लिए यह 1 अक्टूबर से शुरू होगा और लगभग छह महीने तक चलेगा। सार्वजनिक पूर्वावलोकन में उपलब्ध एजेंटिक नॉलेज बेस (Agentic Knowledge Base) अस्पष्ट मेमोरी की जगह ऐसे पृष्ठ देता है जिन्हें देखा और बदला जा सकता है, और यह बताता है कि याद किया गया हर तथ्य कहाँ से आया। Mini App Canvas किसी प्रॉम्प्ट से साझा किए जा सकने वाले छोटे React ऐप बनाता है, और सशुल्क योजनाओं पर Excel या CSV स्प्रेडशीट Vibe Work में आ रही हैं।

🔗 Mistral के रिलीज़ नोट

Vibe CLI 2.25.8 अनुमति जाँच से बच निकलने के रास्ते बंद करता है

23 सितंबर — Vibe CLI 2.25.8 में 5 नई सुविधाएँ और 38 दोष सुधार हैं, जिनमें कई अनुमति सुरक्षा से जुड़े हैं। रिलेटिव पाथ पर आधारित अनुमति सूची अब किसी फ़ाइल को केवल इसलिए अनुमति नहीं देती कि उसके पाथ का अंतिम हिस्सा समान है। शेल कमांडों में वाइल्डकार्ड अब कार्य फ़ोल्डर के बाहर के पाथों की जाँच को नहीं छोड़ते। किसी पैरेंट फ़ोल्डर को दी गई अनुमति अब अपने आप उसके उपफ़ोल्डरों पर लागू नहीं होती, इसलिए कुछ अनुमोदन अनुरोध फिर दिखाई दे सकते हैं। नोट में पहली बार « Rust CLI » का भी उल्लेख है; इससे जुड़ी 18 प्रविष्टियाँ हैं और यह Vibe Code के दूरस्थ प्रोजेक्ट कॉन्फ़िगर करने सहित कई काम करने देती है। उद्यमों के लिए, संगठन द्वारा लागू कॉन्फ़िगरेशन Unified Harness सत्र खुलते ही प्रभावी हो जाती है। Supabase जैसे क्लाइंट सीक्रेट जारी करने वाले MCP सर्वरों से OAuth कनेक्शन की समस्या भी ठीक की गई है।

🔗 Vibe CLI 2.25.8 के रिलीज़ नोट


खुले और कमांड लाइन से चलने वाले कोड एजेंट

सुरक्षा समस्याओं के बाद ZCode ओपन सोर्स हुआ

21 सितंबर — पिछली ख़बर: समुदाय द्वारा बताई गई सुरक्षा समस्याओं के जवाब में Z.ai ने ZCode का कोड खोल दिया है। यह उसका एजेंटिक प्रोग्रामिंग ढाँचा है, जिसे GLM-5.3 का आधिकारिक टूल बताया गया था। @zcode_ai खाते का कहना है कि ज़रूरी सुधार पूरे कर लिए गए हैं; उसने माफ़ी भी माँगी है। Apache-2.0 लाइसेंस वाले zai-org/ZCode रिपॉज़िटरी में क्लाइंट, बैकएंड सेवाएँ, CLI और एजेंट रनटाइम शामिल हैं। 23 सितंबर को इसके लगभग 6 500 स्टार थे।

With respect to the code data referenced by the community, we confirm that no such data is retained and that it has never been used for model training.

🇮🇳 समुदाय द्वारा उठाए गए कोड डेटा के मुद्दे पर हम पुष्टि करते हैं कि ऐसा कोई डेटा संग्रहीत नहीं रखा गया है और मॉडल को प्रशिक्षित करने के लिए उसका कभी उपयोग नहीं हुआ है।X पर @zcode_ai

ZCode के अनुसार, इसके बाद दो संस्थाओं ने स्थिति का मूल्यांकन किया: CAICT के मुताबिक Alibaba Cloud OSS का « zcode-prod » बकेट अब खाली है; NSFOCUS के मुताबिक उसके ऑब्जेक्ट और बकेट, दोनों हटा दिए गए हैं। दोनों ने पाया कि क्लाइंट v3.14.0 में सुधार शामिल है, Repo Wiki सुविधा हटा दी गई है और स्थानीय रिपॉज़िटरी के स्नैपशॉट अपलोड करने वाला प्रवाह बंद कर दिया गया है। Z.ai ने पुरस्कारों के साथ सुरक्षा खामियों की रिपोर्टिंग की स्थायी प्रक्रिया की घोषणा की है और पूरी मूल्यांकन रिपोर्ट प्रकाशित करने का वादा किया है।

🔗 GitHub पर ZCode का सोर्स कोड

Kimi Code 2.1.0 की सुरक्षा सख़्त हुई

23 सितंबर — Moonshot ने Kimi Code 2.1.0 जारी किया है (2 नई सुविधाएँ, 18 दोष सुधार)। दिखाई देने वाली नई सुविधा एक प्रयोगात्मक फ़ुल स्क्रीन लेआउट है, जिसे /settings में चुनना होता है और जो दोबारा शुरू करने पर लागू होता है। कई सुधार सुरक्षा को सख़्त करते हैं: फ़ाइल टूल अब प्रतीकात्मक लिंक के ज़रिए कार्य फ़ोल्डर से बाहर नहीं जा सकते; किसी प्रोजेक्ट की स्थानीय कॉन्फ़िगरेशन कार्यक्षेत्र स्वीकृत होने के बाद ही लागू होती है; रिपॉज़िटरी की git कॉन्फ़िगरेशन अब बैकग्राउंड git कार्रवाइयों के दौरान कमांड नहीं चला सकती; और निजी फ़ोल्डर या रूट की ओर इशारा करने वाले अतिरिक्त फ़ोल्डर अस्वीकार किए जाते हैं। MCP सर्वरों का OAuth अब ऑफ़लाइन पहुँच माँगता है, जिससे हर घंटे दोबारा अनुमति देने की ज़रूरत ख़त्म होती है। इसी दौरान Moonshot ने Python में लिखे पुराने Kimi CLI (11 424 स्टार) को आर्काइव कर दिया है; उसके संस्करण 1.51.0 और 1.52.0 उपयोगकर्ताओं को Kimi Code की ओर भेजते हैं।

🔗 Kimi Code 2.1.0 के रिलीज़ नोट

DeepSeek Harness 0.1.7-rc.1, पूर्वावलोकन में

23 सितंबर — DeepSeek ने DeepSeek Harness का v0.1.7-rc.1 जारी किया है। MIT लाइसेंस वाला यह ओपन सोर्स एजेंट ढाँचा 13 अगस्त को पेश किया गया था। यह रिलीज़ कैंडिडेट (release candidate) है: अगस्त से रिपॉज़िटरी में 21 पूर्वावलोकन संस्करण आए हैं, लेकिन अब तक कोई स्थिर संस्करण नहीं आया है। प्रमुख नई सुविधाएँ प्रयोगात्मक हैं: Computer Use मोड एजेंट को स्थानीय कंप्यूटर पर काम करने और उसके स्क्रीनशॉट लेने देता है (Cua Driver MCP या नेटिव ड्राइवर के ज़रिए), और ब्राउज़र नियंत्रण के लिए तीन बैकएंड हैं (Playwright MCP, Chrome DevTools MCP, Stagehand)। वेब इंटरफ़ेस में एकीकृत टर्मिनल और diffs के साथ बदलावों की समीक्षा जुड़ी है। headless मोड मानक इनपुट से कार्य पढ़ता है और JSON में ईवेंट देता है, तथा एजेंट SSH के ज़रिए दूरस्थ कार्यक्षेत्र में काम कर सकता है। माइग्रेशन में बदलाव करने होंगे: DeepSeek का आधिकारिक एडेप्टर अब केवल Messages API का उपयोग करता है, E2B निष्पादन बैकएंड हट गए हैं और प्रयोगात्मक टीम मोड में साथियों की संख्या 8 से बढ़कर 16 हो गई है।

🔗 DeepSeek Harness v0.1.7-rc.1

GenCode, Genspark का कोड एजेंट

23 सितंबर — Genspark ने GenCode शुरू किया है। यह उसकी Super App में शामिल कोड एजेंट है, जो macOS, Windows और Linux पर तथा कमांड लाइन से उपलब्ध है। इसकी मुख्य विशेषता मॉडल चुनने की सुविधा है: एक ही खाते से, हर कार्य के लिए Claude, GPT, DeepSeek या ओपन वेट मॉडल चुना जा सकता है और API कुंजी कॉन्फ़िगर करने की ज़रूरत नहीं होती। Genspark के अनुसार ओपन मॉडल की लागत « 1/10 से 1/20 » तक है। GenCode एक चरण में Claude Code के लिए तैयार किए गए निर्देश, नियम और मेमोरी अपना लेता है। npm पैकेज @genspark/gencode का README इसकी उत्पत्ति स्पष्ट करता है: यह ओपन सोर्स कोड एजेंट opencode से निकला है, लेकिन उस प्रोजेक्ट से असंबद्ध मालिकाना उत्पाद है और जानबूझकर रिपॉज़िटरी का .opencode/ फ़ोल्डर साझा करता है। हर चरण पर ख़र्च Genspark क्रेडिट में दिखता है।

🔗 GenCode · X पर Genspark की घोषणा


GitHub Copilot: सहायता प्राप्त अनुमोदन और स्थानीय सैंडबॉक्स

JetBrains के लिए Copilot 1.18.0

22 सितंबर — JetBrains IDE के लिए Copilot के संस्करण 1.18.0 में सार्वजनिक पूर्वावलोकन के रूप में सहायता प्राप्त अनुमोदन (assisted approvals) शुरू हुए हैं: एजेंट सत्रों में कम जोखिम वाले माने गए टूल कॉल अपने आप स्वीकृत होते हैं, जबकि अधिक जोखिम वाली कार्रवाइयों के लिए अब भी निर्णय चाहिए। पहले भेजे गए संदेश को फिर संपादित भी किया जा सकता है: नया निर्देश भेजने से पहले Copilot बातचीत और फ़ाइलों में हुए बदलावों को उस बिंदु तक वापस ले जाता है। JetBrains के Copilot में उपलब्ध Codex एजेंट को योजना मोड मिला है, ताकि कोई बदलाव करने से पहले उसके तरीके को पढ़ा, सुधारा या स्वीकृत किया जा सके। सत्रों में संगठन और उद्यम के skills तथा निर्देश भी स्वीकार किए जाते हैं। डिफ़ॉल्ट रूप से सक्रिय, अंतर्निहित GitHub MCP सर्वर को अब बंद किया जा सकता है। JetBrains IDE 2025.1 के उपयोगकर्ताओं को 2026.1 या उससे नए संस्करण पर जाने की सूचना मिलेगी।

🔗 JetBrains के लिए Copilot की नई सुविधाएँ

Copilot ऐप अपने स्थानीय सत्रों को सीमित करता है

23 सितंबर — GitHub के एजेंटों के लिए बने डेस्कटॉप ऐप GitHub Copilot में सार्वजनिक पूर्वावलोकन के रूप में स्थानीय सैंडबॉक्स जोड़ा गया है। इसे हर प्रोजेक्ट के लिए अलग कॉन्फ़िगर किया जाता है और यह सीमित करता है कि स्थानीय सत्र की कमांडें किन संसाधनों तक पहुँच सकती हैं: फ़ाइल सिस्टम (पढ़ने और लिखने योग्य, केवल पढ़ने योग्य या प्रतिबंधित फ़ोल्डर), नेटवर्क (इंटरनेट और स्थानीय नेटवर्क तक आउटबाउंड पहुँच) और क्रेडेंशियल (HTTPS पर Git, GitHub CLI)। उद्यम द्वारा प्रबंधित सेटिंग्स नीति को और सख़्त कर सकती हैं। अगर ऑपरेटिंग सिस्टम माँगी गई नीति लागू नहीं कर सकता, तो सैंडबॉक्स का शेल बिना सुरक्षा के चलने के बजाय त्रुटि दिखाकर रुक जाता है। डिफ़ॉल्ट रूप से बंद सैंडबॉक्स को प्रोजेक्ट के नए सत्रों के लिए या चल रहे सत्र में /sandbox on से चालू किया जा सकता है। यह क्लाउड सत्रों या दूरस्थ होस्ट पर लागू नहीं होता, और इसकी सेटिंग्स Copilot CLI की सेटिंग्स से अलग रहती हैं।

🔗 GitHub Copilot ऐप में स्थानीय सैंडबॉक्स


Cursor: प्रोडक्शन में तैनाती के लिए दो बॉट, 7 % कम टोकन

Rollouts और Security Review

23 सितंबर — Cursor ने कोड डिलीवरी के अंतिम चरण के लिए दो बॉट लॉन्च किए हैं, जो Teams और Enterprise योजनाओं पर उपलब्ध हैं। हर pull request खुलने पर Rollouts निगरानी की एक योजना प्रकाशित करता है—जोखिम, अपेक्षित प्रभाव और जाँचने योग्य संकेत। फिर हर डिप्लॉयमेंट के बाद वह इस योजना की तुलना लॉग, मेट्रिक्स और ट्रेस से करता है और हर वातावरण के लिए निष्कर्ष देता है: स्थिति ठीक है, रिग्रेशन मिला है या निष्कर्ष स्पष्ट नहीं है। रिग्रेशन मिलने पर वह संदिग्ध बदलाव की पहचान करता है और समीक्षा के लिए बदलाव वापस लेने वाली PR खोल सकता है; वह स्वयं कुछ मर्ज या वापस नहीं करता। Security Review हर pull request की जाँच करता है और दुरुपयोग की जा सकने वाली कमज़ोरियों—इंजेक्शन, प्रमाणीकरण को दरकिनार करने के तरीके, कोड में छूटे रहस्य, SSRF आदि—की सूचना देता है। हर कमज़ोरी के साथ उसकी गंभीरता, हमले का तरीका और प्रस्तावित सुधार दिया जाता है। 10 दिनों तक परीक्षण क्रेडिट से Teams पर लगभग 50 और Enterprise पर 500 बदलावों के लिए Rollouts आज़माया जा सकता है।

🔗 Cursor का बदलाव विवरण

गुणवत्ता घटाए बिना टोकन लागत में 7 % की कमी

23 सितंबर — Cursor ने बताया कि उसने गुणवत्ता घटाए बिना उपयोगकर्ताओं के लिए अपने एजेंट की टोकन लागत 7 % कैसे कम की। नए मॉडलों को अब प्रतिबंधों की लंबी सूचियों की आवश्यकता नहीं होती, इसलिए सिस्टम प्रॉम्प्ट लगभग 66 % छोटा किया गया। इन कटौतियों की पुष्टि वास्तविक ट्रैफ़िक पर A/B परीक्षणों से हुई। एकीकृत टूल, जिनमें से अधिकांश का उपयोग 20 % से भी कम बातचीत में होता है, अब आवश्यकता पड़ने पर लोड किए जाते हैं।

अनुकूलन का उपायCursor द्वारा मापा गया प्रभाव
छोटा किया गया सिस्टम प्रॉम्प्टप्रॉम्प्ट का लगभग 66 % हटाया गया
आवश्यकता पड़ने पर लोड किए जाने वाले एकीकृत टूलस्थिर कॉन्टेक्स्ट में विवरण के टोकन 60 % कम
स्पष्ट कैश ब्रेकपॉइंटपहली बार कैश उपयोग में विफलताएँ 20 % कम
हर दस पंक्तियों पर एक पंक्ति संख्याकैश से पढ़े गए टोकन 1,6 % कम
सभी बदलाव मिलाकरउपयोगकर्ताओं के लिए टोकन लागत 7 % कम

🔗 Cursor का लेख


NVIDIA: ओपन डायरीकरण और AI Day Singapore

Nemotron 3 Diarization आठ वक्ताओं तक की पहचान करता है

23 सितंबर — NVIDIA ने Hugging Face पर Nemotron 3 Diarization जारी किया। यह 100 मिलियन पैरामीटर वाला ओपन वेट मॉडल बातचीत में यह निर्धारित करता है कि कौन कब बोल रहा है, यहाँ तक कि जब आवाज़ें एक साथ सुनाई दें। यह आठ वक्ताओं तक को ट्रैक करता है, जबकि इसका पूर्ववर्ती Streaming Sortformer चार को ट्रैक करता था। यह रिकॉर्ड की गई बातचीत और लाइव स्ट्रीम, दोनों पर काम करता है; इसकी बफ़र विलंबता 30,4 से 0,32 सेकंड तक समायोजित की जा सकती है। यह बोले गए शब्दों का लिप्यंतरण नहीं करता: यह हर वक्ता के बोलने की समय सीमाएँ देता है, जिन्हें लिप्यंतरण मॉडल के साथ इस्तेमाल किया जा सकता है। VoiceArena के Diarization-Bench के शुरुआती नतीजों में यह 12 सिस्टमों में पहले स्थान पर है। इसकी डायरीकरण त्रुटि 14,72 % है, जबकि अगले सिस्टम की 19,3 % है; NVIDIA के अनुसार यह शुरुआती रैंकिंग आगे बदल सकती है। पुराने मॉडल की तुलना में आठ मूल्यांकन डेटासेट पर इसकी त्रुटि औसतन 41 % कम है, हालाँकि CALLHOME में दो वक्ताओं वाली बातचीत पर प्रदर्शन थोड़ा घटा है। लाइसेंस OpenMDW 1.1 है।

प्रकाशित मापNemotron 3 Diarizationपिछला मॉडल
ट्रैक किए जा सकने वाले वक्ताओं की अधिकतम संख्या84
30,4 s पर प्रवाह दर (32 के बैच, RTX PRO 5000)वास्तविक समय से 15 113 गुना2 619 गुना
30,4 s पर DIHARD III त्रुटि12,73 %19,09 %

🔗 Hugging Face ब्लॉग पर Nemotron 3 Diarization

AI Day Singapore: दक्षिण-पूर्व एशिया में Vera Rubin और Nemotron

22 सितंबर — NVIDIA ने 22 तारीख को 19:30 PT पर, अपने AI Day Singapore (22 और 23 सितंबर) के दौरान प्रकाशित लेख में, Shopee, Garena और Monee की मूल कंपनी Sea Limited को ASEAN क्षेत्र की पहली ऐसी कंपनी बताया जिसने बड़े पैमाने पर मॉडल और एजेंट विकसित तथा डिप्लॉय करने के लिए उसका Vera Rubin प्लेटफ़ॉर्म अपनाया है। लेख के बाकी हिस्से में स्थानीय ज़रूरतों के अनुसार ढाले गए ओपन Nemotron मॉडल दिखाए गए हैं: AI Singapore क्षेत्रीय भाषाओं के लिए बने अपने SEA-LION परिवार में Nemotron मॉडल जोड़ रहा है; वियतनाम में Viettel AI ने Nemotron 3 Super को वियतनामी भाषा के लिए फ़ाइन-ट्यून किया है और वह VMLU बेंचमार्क में शीर्ष पर है; थाईलैंड में iApp Technology ने Nemotron 3 Nano को थाई कानून के लिए OpenThai 2.0 Legal के रूप में अनुकूलित किया है। यह ओपन सोर्स मॉडल कानूनी चैटबॉट Thanoy को चलाता है, जिसके लगभग 43 000 उपयोगकर्ता हैं।

🔗 AI Day Singapore में NVIDIA और साझेदारों ने दक्षिण-पूर्व एशिया में AI की प्रगति दिखाई


बिना व्यवधान के AI को उत्पादन में लाना

इन दो घोषणाओं का साझा विचार है: ट्रैफ़िक बदलने या मशीनें अपडेट करने से पहले वास्तविक वर्कलोड पर जाँच करना।

Together AI के कैनरी डिप्लॉयमेंट

22 सितंबर — Together AI ने अपनी Dedicated Model Inference सेवा के क्रमिक डिप्लॉयमेंट का विवरण दिया, जो 15 सितंबर के अपडेट से उपलब्ध हैं। इनके ज़रिए बिना सेवा बाधित किए या URL बदले, किसी एंडपॉइंट के पीछे चल रहा मॉडल बदला जा सकता है। तीन रणनीतियाँ उपलब्ध हैं: कैनरी में नए मॉडल का ट्रैफ़िक चरणों में बढ़ता है (डिफ़ॉल्ट रूप से 5 %, 25 %, 50 % और फिर 100 %); ब्लू-ग्रीन में सारा ट्रैफ़िक एक साथ बदला जाता है; और क्रमिक प्रतिस्थापन में रेप्लिका एक-एक करके बदले जाते हैं। कैनरी के हर चरण के बाद एक जाँच नए मॉडल की विलंबता या त्रुटि दर की पुराने मॉडल से तुलना करती है और प्रदर्शन बिगड़ने पर डिप्लॉयमेंट रोक देती है। प्रकाशित डेमो में Qwen2.5-7B से Qwen3.5-9B पर बदलाव 10 % ट्रैफ़िक पहुँचते ही रोक दिया गया, क्योंकि p95 विलंबता 137 % बढ़ गई थी (1 740 ms बनाम 734 ms)। पुराने मॉडल पर लौटते समय पूरी की गई 6 800 रिक्वेस्ट में से कोई भी विफल नहीं हुई।

🔗 कैनरी डिप्लॉयमेंट: बिना डाउनटाइम के उत्पादन में मॉडल अपग्रेड करें

NVIDIA के NVCRE और NodeWright

23 सितंबर — NVIDIA ने Kubernetes पर GPU क्लस्टरों के लिए अपने AI फ़ैक्टरी प्लेटफ़ॉर्म की सॉफ़्टवेयर परत DSX OS के दो ओपन सोर्स प्रोजेक्ट (Apache 2.0) का विवरण दिया। NVIDIA Cluster Readiness Engine (NVCRE) इस समस्या से शुरू होता है: कोई क्लस्टर सभी स्वास्थ्य जाँच पास कर सकता है, फिर भी वितरित प्रशिक्षण में विफल हो सकता है। इसलिए यह टोपोलॉजी के आधार पर चुने गए नोड समूहों पर वास्तविक वर्कलोड—NCCL संचार परीक्षण, DCGM डायग्नोस्टिक्स और NeMo प्रीट्रेनिंग—चलाकर क्लस्टर की तैयारी प्रमाणित करता है। यह दोषपूर्ण नोडों की पहचान करता है और डायग्नोस्टिक मोड में विफल समूहों को आधा-आधा बाँटता है, जब तक संदिग्ध नोड अलग न हो जाएँ। लेख में इन वर्कलोड के बीच 8 और 56 अरब पैरामीटर वाले Nemotron 5 मॉडलों का उल्लेख है, पर और विवरण नहीं दिया गया है। NodeWright, जिसे पहले Skyhook कहा जाता था और जिसे NVIDIA उत्पादन में इस्तेमाल करता है, सुरक्षित रखे गए कार्यों के पूरा होने की प्रतीक्षा करके नोडों का सिस्टम अपडेट करता है—कर्नेल सेटिंग, सुरक्षा एजेंट और कमज़ोरियों के सुधार। अपडेट निश्चित आकार की, रैखिक या घातीय लहरों में होते हैं और बहुत अधिक बैच विफल होने पर अपने आप रुक जाते हैं।

🔗 AI वर्कलोड शुरू होने से पहले GPU क्लस्टर की तैयारी जाँचें · NodeWright


दो ओपन डेटासेट: कई वक्ताओं की बातचीत और वैज्ञानिक कॉर्पस

Basis Conversations 1500

23 सितंबर — Basis ने Hugging Face पर Basis Conversations 1500 जारी किया: 33 देशों के 2 645 लोगों के बीच 1 502 घंटे की स्वतःस्फूर्त बातचीत, 22 भाषाओं में, अंग्रेज़ी से लेकर मिंग्रेलियन और खोसा तक। हर बातचीत में दो से चार लोग शामिल हैं और प्रत्येक की आवाज़ उसकी अपनी सिंक्रनाइज़ रिकॉर्डिंग ट्रैक (FLAC 48 kHz) पर है। इससे एक साथ बोलने, बीच में टोकने और बोलने की बारी का अध्ययन किया जा सकता है—टीम के अनुसार मॉडल अब भी इन स्थितियों में अटकते हैं। लगभग 100 घंटों को मनुष्यों ने विस्तार से एनोटेट किया है (113 096 निर्णय): सहानुभूतिपूर्ण या खीझ भरी मौखिक प्रतिक्रिया, असहज चुप्पी, और सहयोगी या प्रतिस्पर्धी ढंग से एक साथ बोलना। उपलब्ध लिप्यंतरण स्वचालित हैं और जाँच के बिना प्रशिक्षण लक्ष्य के रूप में इस्तेमाल नहीं किए जाने चाहिए। लेख डेटासेट को व्यावसायिक और शोध उपयोग के लिए मुक्त बताता है, लेकिन यह Basis के अपने लाइसेंस (basis-data-license-1.0) के अधीन है और इसकी पहुँच मैन्युअल रूप से स्वीकृत की जाती है।

🔗 Basis Conversations 1500

QVAC Genesis III

23 सितंबर — Tether AI Research ने QVAC Genesis III जारी किया, जो विज्ञान, प्रौद्योगिकी, इंजीनियरिंग और गणित में छोटे मॉडलों की प्रीट्रेनिंग के लिए बनाए गए उसके सिंथेटिक कॉर्पस का तीसरा भाग है। इसमें 43,06 अरब और टोकन जुड़ने से पूरा संग्रह 191,43 अरब टोकन और 19 क्षेत्रों के लगभग 160 मिलियन दस्तावेज़ों तक पहुँच गया है; इसके साथ प्रकाशित शोधपत्र COLM 2026 सम्मेलन में स्वीकार किया गया है। इस पद्धति में एक छोटे छात्र मॉडल, Qwen3-1.7B-Base, से प्रश्न पूछे जाते हैं: गलत उत्तर से सुधार समझाने वाला विवरण बनता है और सही उत्तर से हर उत्तर विकल्प का विश्लेषण। इस कॉर्पस पर शुरू से प्रशिक्षित 1,7 अरब पैरामीटर वाला मॉडल, समान टोकन बजट पर Cosmopedia-v2 से प्रशिक्षित उसी मॉडल की तुलना में स्पष्ट रूप से बेहतर प्रदर्शन करता है। कॉर्पस गैर-व्यावसायिक लाइसेंस (CC-BY-NC 4.0) के तहत प्रकाशित है और इस पर प्रशिक्षित एक मॉडल Apache 2.0 के तहत जारी करने की घोषणा की गई है।

मूल्यांकित बेंचमार्कCosmopedia-v2 की तुलना में बढ़त (समान टोकन बजट)
ARC-Easy+28,57 अंक
ARC-Challenge+21,35 अंक
GPQA Diamond+2,52 अंक
MMLU STEM+15,03 अंक

🔗 QVAC Genesis III


जलवायु और खाद्य उत्पादन के लिए AI

Ai2 और Global Fishing Watch एजेंटों से महासागरों की निगरानी करेंगे

23 सितंबर — न्यूयॉर्क के Climate Week में Ai2 और Global Fishing Watch ने महासागरों की निगरानी और मत्स्य पालन पर नियंत्रण में AI, विशेष रूप से एजेंटों, का उपयोग बढ़ाने के लिए साझेदारी की घोषणा की। दोनों संगठन पहले से साथ काम कर रहे थे; अब वे संयुक्त रूप से विकास करेंगे: एक साझा पहचान पाइपलाइन, उपग्रह चित्रों के लिए नए रीयल-टाइम विज़न मॉडल और कई डेटा स्रोतों को मिलाकर काम करने वाले एजेंट। Global Fishing Watch को Ai2 का ओपन मॉडलों पर आधारित पृथ्वी अवलोकन प्लेटफ़ॉर्म OlmoEarth मिलेगा, ताकि वह अपने डेटा को एनोटेट कर सके और अपने मॉडल प्रशिक्षित कर सके। Skylight की रीयल-टाइम जहाज़ पहचान उसके समुद्री संरक्षित क्षेत्रों के प्रबंधकों वाले पोर्टल में उपलब्ध होगी। दोनों टीमें Shippy जैसे एजेंट भी आगे विकसित करेंगी, जिससे विश्लेषक किसी जहाज़ का इतिहास पूछ सकता है। घोषणा में कोई समय-सीमा या धनराशि नहीं बताई गई।

🔗 Ai2 और Global Fishing Watch महासागरों की निगरानी में AI एजेंट लाने के लिए एकजुट हुए

Google.org और Gates Foundation: 200 मिलियन छोटे किसानों के लिए

18 और 22 सितंबर — पिछली खबर: Google.org और Gates Foundation ने उप-सहारा अफ़्रीका और दक्षिण एशिया के 200 मिलियन छोटे किसानों तक जलवायु, कृषि और भाषाओं से जुड़े AI टूल पहुँचाने की अपनी साझा पहल का विस्तार किया है। शुरुआत में लक्ष्य 50 मिलियन किसानों का था। दोनों साझेदार इसके लिए कुल 100 मिलियन डॉलर दे रहे हैं, साथ ही Google के शोधकर्ताओं और इंजीनियरों का तकनीकी सहयोग भी मिलेगा। Gates Foundation की प्रेस विज्ञप्ति 18 सितंबर की है; blog.google ने इसे 22 सितंबर की शाम प्रकाशित किया। कार्यक्रम भारत में Wadhwani AI और Digital Green जैसे स्थानीय संगठनों को वित्त देता है, TomorrowNow जलवायु प्लेटफ़ॉर्म में AI पूर्वानुमान जोड़ता है, एक मीटर से कम रिज़ॉल्यूशन पर खेतों का मानचित्र बनाता है और 40 से अधिक अफ़्रीकी भाषाओं में ओपन वॉइस तथा टेक्स्ट डेटासेट को सहायता देता है। छोटे किसान दुनिया के लगभग 35 % भोजन का उत्पादन करते हैं।

🔗 Google.org की घोषणा · Gates Foundation की प्रेस विज्ञप्ति


संक्षिप्त समाचार

  • Anthropic और कोड का आधुनिकीकरण — « Notes from the Field » शृंखला में ग्राहकों के साथ काम कर रहे Anthropic के दो इंजीनियर, Jonah Ezekiel और Lexie Tonelli, एजेंटों की मदद से कोड का आधुनिकीकरण शुरू करने से पहले छह चरण सुझाते हैं: लक्ष्य तय करना, परीक्षणों का « प्रमाणपत्र » तैयार करना, चरणबद्ध मानवीय समीक्षा, आवश्यक पूर्वशर्तें, एजेंटों का कार्यप्रवाह और फिर शुरुआत। वे लागत का कोई आँकड़ा नहीं देते; इसे पायलट परियोजना में मापने की सलाह देते हैं। 🔗 स्रोत
  • Boris Cherny ने Claude Agent SDK का Lean में सत्यापन कराया — 22 तारीख की शाम Boris Cherny (Claude Code) ने बताया कि उन्होंने प्रमाण सहायक Lean के साथ Opus 5.5 से Claude Agent SDK का औपचारिक सत्यापन कराया। कुछ छोटे prompts से 16 pull requests बनीं, जिन्होंने bugs और समवर्ती प्रक्रियाओं से जुड़ी समस्याएँ ठीक कीं। वे TLA+ का भी उपयोग करते हैं। 🔗 स्रोत
  • Codex CLI 0.156.1 — संस्करण 0.156.0 का यह सुधार CLI के मॉडल चयनकर्ता में GPT-6 Sol और GPT-6 Luna जोड़ता है। दर सीमा आने पर दिखने वाला संदेश अब Luna की सिफारिश करता है, और GPT-5.5 तथा GPT-5.6 से स्थानांतरण के विकल्प भी देता है। 🔗 स्रोत
  • Airbnb और GPT-6 Astra — एक नए समझौते से Airbnb की इंजीनियरिंग और उत्पाद टीमों को OpenAI के मॉडलों, जिनमें GPT-6 Astra शामिल है, तक OpenAI API और Amazon Bedrock के माध्यम से अधिक पहुँच मिलेगी। उसके तकनीकी निदेशक Ahmad Al-Dahle का कहना है कि उनकी टीमें एक साल पहले की तुलना में लगभग 80 % अधिक सुविधाएँ उपलब्ध करा रही हैं; समझौते की राशि नहीं बताई गई है। 🔗 स्रोत
  • OpenAI Academy के दो साल — सितंबर 2024 से अब तक 250 से अधिक आयोजन हुए हैं और 40 लाख से अधिक लोगों तक पहुँच बनी है। OpenAI एक सामुदायिक प्रशिक्षक कार्यक्रम (Community Trainer Program) का परीक्षण कर रहा है, जिसमें भागीदार संगठनों के कर्मचारियों को मूल्यांकन के बाद कार्यशालाएँ संचालित करना सिखाया जाता है। 🔗 स्रोत
  • LED डिस्प्ले से बना वॉइस असिस्टेंट — OpenAI Developers ब्लॉग पर Sid Rampally बताते हैं कि Codex ने Raspberry Pi से नियंत्रित 128 × 64 पिक्सेल के LED पैनल की वायरिंग और प्रोग्रामिंग में उनकी कैसे मदद की। GPT-Live-1 बातचीत संभालता है और Responses API के ज़रिए खोज तथा डिस्प्ले के काम GPT-5.6 Luna को सौंपता है। 🔗 स्रोत
  • MedGemma के डाउनलोड 1 करोड़ से अधिक — Google अपने खुले चिकित्सा मॉडलों के वास्तविक उपयोगों का ब्यौरा देता है: ज़ाम्बिया में 3 500 से अधिक महिलाओं की गर्भाशय ग्रीवा के कैंसर की जाँच, दिल्ली के AIIMS अस्पताल में पायलट परियोजनाएँ और इंडोनेशिया में तपेदिक की पहचान। Google याद दिलाता है कि इनके परिणामों को सीधे निदान का आधार नहीं बनाना चाहिए। 🔗 स्रोत
  • Google Docs में Gemini Notebook — Docs में @ टाइप करके किसी notebook को स्रोत के रूप में उद्धृत किया जा सकता है। Gemini अपने लिखे पाठ को उसके स्रोतों पर आधारित रखता है, पाठ के भीतर उद्धरण देता है और Workspace Intelligence के माध्यम से उन्हें ईमेल तथा फ़ाइलों के साथ जोड़ता है। यह Business Standard और Plus, Enterprise Standard और Plus, Education Plus तथा Google AI Pro और Ultra के ग्राहकों के लिए उपलब्ध है। 🔗 स्रोत
  • Google Flow के छह टूल — Google Labs ने रचनाकारों द्वारा Google Flow Tools से बनाए गए छह टूल प्रकाशित किए हैं: Mondo Sónico (समय के साथ मेल खाते ध्वनि प्रभाव), CaptionCast (एनिमेटेड उपशीर्षक), ThumbnailForge (थंबनेल), Surface (3D सतहों पर टेक्सचर), CollageMotion Pro और SwissFlow Studio (मोशन डिज़ाइन)। हर टूल की प्रति बनाकर उसे नए रूप में ढाला जा सकता है। 🔗 स्रोत
  • Google Beam की फ़्रांस में आपूर्ति शुरू — आमने-सामने की मौजूदगी जैसा अनुभव देने के उद्देश्य से बनाया गया Google का वीडियो संचार प्लेटफ़ॉर्म Beam, जिसे HP के साथ बेचा जाता है, अब फ़्रांस सहित छह देशों में उपलब्ध कराया जा रहा है; इसके 18 साझेदार हैं। एक आंतरिक अध्ययन के अनुसार, टीमों में जुड़ाव 50 % अधिक हुआ और अनुवर्ती बैठकों की संख्या 21 % कम हुई। 🔗 स्रोत
  • Android Enterprise और Gemini एजेंट — Gemini स्क्रीन पर दिख रहे संदर्भ के आधार पर कई ऐप्स में लगातार काम कर सकता है। सुरक्षा नियंत्रण निजी एजेंटों को कार्य प्रोफ़ाइल तक पहुँचने से रोकते हैं; प्रशासक अपने सभी उपकरणों पर AI स्वचालन को सीमित या बंद कर सकते हैं। 🔗 स्रोत
  • AI Brief अब फ़्रेंच में — Google Ads के AI Max अभियानों को उपयोगकर्ता के अपने शब्दों के आधार पर दिशा देने वाले AI Brief का सीमित बीटा अब फ़्रेंच, डच, जर्मन, इतालवी, जापानी, पुर्तगाली और स्पेनिश भाषाओं के लिए खुल रहा है। 🔗 स्रोत
  • Gemini CLI का 23 सितंबर वाला nightly संस्करण — यह केवल nightly संस्करण है, स्थिर संस्करण नहीं। इसमें Gemini 3.8 Flash और Gemini 3.5 Flash Lite जोड़े गए हैं, जिन्हें API key, Vertex AI या गेटवे से तुरंत इस्तेमाल किया जा सकता है; Google खाते से उपयोग के लिए प्रायोगिक सेटिंग चालू करनी होगी। मंगलवार 22 तारीख को कोई स्थिर संस्करण जारी नहीं हुआ। 🔗 स्रोत
  • EcoHash ने अपने वीडियो अनुकूलन मापे — 96 GB की RTX PRO 6000 पर EcoHash ने MiniMax H3 वीडियो का समय 174,8 से घटाकर 40,8 सेकंड और Wan2.2 में टेक्स्ट से वीडियो बनाने का समय 132,3 से घटाकर 10,7 सेकंड किया। इसके लिए 4 चरणों में डिस्टिल की गई LoRA इस्तेमाल हुई; आज़माई गई दस सेटिंग्स में से तीन, जिनमें दोनों कंपाइलेशन मोड शामिल थे, कोई बदलाव नहीं ला सकीं। 🔗 स्रोत
  • क्रीमियाई तातार के परीक्षण में त्रुटि पकड़ी गई — क्रीमियाई तातार के लिए वाक् पहचान मॉडल बनाने वाले डेवलपर को पता चला कि उनके डेटासेट में चार ऑडियोबुक दो बार मौजूद थीं: मुख्य परीक्षण के 96,9 % अंशों का एक समान अंश प्रशिक्षण डेटा में था। इसे ठीक करने, LoRA से मॉडल को और प्रशिक्षित करने तथा डिकोडर समायोजित करने के बाद प्रति शब्द त्रुटि दर 0,3463 से घटकर 0,1701 हो गई। 🔗 स्रोत
  • Falcon-H1 और mlx-lm — mlx-lm 0.31.3 में KV cache के बिना प्रशिक्षण के दौरान Falcon-H1 की 66 परतों में से केवल पहली परत चलती है। इसके चलते किसी भी LoRA का प्रशिक्षण एक परत वाले मॉडल पर बिना त्रुटि या चेतावनी के हो जाता है। सुधार के लिए कोड की एक पंक्ति पर्याप्त है और एक issue दर्ज किया गया है। 🔗 स्रोत
  • एजेंट और ओपन सोर्स योगदान — Quentin Gallouédec (Hugging Face) का मानना है कि एजेंटों के बनाए योगदान वास्तविक ज़रूरत का संकेत धुंधला करते हैं और रखरखाव करने वालों का समीक्षा समय लेते हैं। वे कहते हैं कि बेतरतीब चुनी परियोजनाओं पर एजेंट लगाने बंद किए जाएँ और पहले उस परियोजना का उपयोग किया जाए। 🔗 स्रोत
  • IETF में Phionyx — Phionyx के लेखक ने Claim-Preserving Exchange of AI Evaluation Evidence शीर्षक से एक व्यक्तिगत मसौदा जमा किया है, ताकि मूल्यांकन के नतीजे एक प्रणाली से दूसरी प्रणाली में जाते समय अपनी शर्तें और सीमाएँ साथ रखें। इस पाठ को किसी कार्य समूह ने नहीं अपनाया है। 🔗 स्रोत
  • Kimi Work 3.2.12 — Moonshot का डेस्कटॉप एजेंट PPT, Excel, Word या Markdown फ़ाइल में चुने गए हिस्से को सटीक रूप से बदल सकता है। संलग्न फ़ाइलों की आकार सीमा भी हटा दी गई है। 🔗 स्रोत
  • खुले मॉडलों में Qwen-Image-2.1 शीर्ष पर — Arena के अनुसार, Qwen-Image-2.1 छवि संपादन में पहला खुला मॉडल बन गया है (1 367 अंक, समग्र सूची में 16वाँ) और टेक्स्ट से छवि बनाने में भी पहला है (1 228 अंक, समग्र सूची में 17वाँ)। 🔗 स्रोत
  • Copilot ऐप में OpenTelemetry — प्रशासक GitHub Copilot ऐप के एजेंट सत्रों के traces (मॉडल को भेजे गए अनुरोध और इस्तेमाल किए गए टूल) को managed-settings.json की telemetry प्रॉपर्टी के माध्यम से अपने निगरानी टूल में निर्यात कर सकते हैं। prompts और जवाबों की सामग्री डिफ़ॉल्ट रूप से बाहर रखी जाती है। 🔗 स्रोत
  • Copilot CLI और C++ — Copilot CLI का Microsoft C++ Language Server अब पूरे प्रोजेक्ट के symbols की स्थायी index बनाता है; यह डिफ़ॉल्ट रूप से चालू है। पहली बार index बनाने में समय और अधिक मेमोरी लग सकती है, और GitHub ने लाभ का कोई आँकड़ा नहीं दिया है। 🔗 स्रोत
  • दस लाख पंक्तियों वाली pull request — GitHub की एक इंजीनियरिंग पोस्ट बताती है कि Copilot ऐप 2 200 फ़ाइलों, दस लाख से अधिक पंक्तियों और 400 से अधिक टिप्पणियों वाली pull request कैसे दिखाता है: कोड की ज्यामिति पहले से गणना की जाती है, जबकि टिप्पणियों की ज्यामिति दृश्य क्षेत्र के पास मापी जाती है। 🔗 स्रोत
  • Genspark ने Opus 5.5, GPT-6 और Grok 4.7 जोड़े — 23 तारीख की रात Genspark ने AI Chat, Code Agent और Claw में Claude Opus 5.5, Grok 4.7, GPT-6 Sol और GPT-6 Luna उपलब्ध कराए। घोषणा में मॉडल निर्माताओं के दावे दोहराए गए हैं; किसी योजना या कीमत का विवरण नहीं दिया गया है। 🔗 स्रोत
  • GitHub और Yale का सर्वेक्षण — अमेरिका में GitHub के 1 039 उपयोगकर्ताओं में 71 % ने कहा कि वे AI के पर्यावरणीय प्रभाव को लेकर चिंतित हैं, और दस में से आठ अधिक ऊर्जा कुशल कोड लिखने के टूल चाहते हैं। GitHub स्पष्ट करता है कि मार्केटिंग संदेश प्राप्त करने की सहमति देने वालों से लिया गया यह नमूना प्रतिनिधिक नहीं है। 🔗 स्रोत
  • Zed 1.21.0 — स्थिर संस्करण अपनी API key के साथ Claude Opus 5.5 और GPT-6 Astra, Sol तथा Luna का उपयोग उपलब्ध कराता है, Agent पैनल में SuperGrok से जुड़ने का विकल्प जोड़ता है और एजेंट के काम करते समय मशीन को डिफ़ॉल्ट रूप से स्लीप मोड में जाने से रोकता है। 🔗 स्रोत
  • Warp — GPT-6 Sol और Luna, फिर Claude Opus 5.5, Warp टर्मिनल और Warp Agent CLI में उपलब्ध हो रहे हैं। अपना Grok सदस्यता खाता जोड़ने वालों को Grok 4.7 भी मिलेगा। यह उपलब्धता की घोषणा है; कीमत नहीं बताई गई है। 🔗 स्रोत
  • Microsoft Teams में Devin — पहले केवल चैनलों तक सीमित Devin अब सीधे संदेशों और समूह चर्चाओं में भी जवाब देता है, चैनल से Automations शुरू करता है और प्रश्न या स्वीकृति के कार्ड भेजता है। ऐप कोई नई अनुमति नहीं माँगता। 🔗 स्रोत
  • Scribe v2 Medical — 11 सितंबर से उपलब्ध ElevenLabs के क्लिनिकल ट्रांसक्रिप्शन मॉडल की अब आधिकारिक घोषणा हुई है, जिसमें एक नया आँकड़ा दिया गया है: क्लिनिकल ऑडियो पर Scribe v2 की तुलना में शब्द संबंधी त्रुटियाँ 35 % कम हैं। इसकी कीमत 0,22 डॉलर प्रति घंटा से शुरू होती है। 🔗 स्रोत
  • ElevenLabs से Sora 2 की विदाई — ElevenLabs अपने स्टूडियो से Sora 2 और Sora 2 Pro हटा रहा है, क्योंकि OpenAI 24 सितंबर को Sora API बंद कर रहा है। OpenAI ने 24 मार्च को इस समयसीमा की घोषणा की थी। प्रभावित कार्यप्रवाहों को Gemini Omni 1.1 Flash जैसे किसी अन्य वीडियो मॉडल पर जाना होगा। 🔗 स्रोत
  • कनाडा में Cohere Model Vault — Cohere ने बताया है कि उसका एकल ग्राहक के लिए समर्पित अनुमान प्लेटफ़ॉर्म Model Vault कनाडा में उपलब्ध है। उसने क्लाउड क्षेत्र, प्रदाता या कीमत नहीं बताई है; उत्पाद पृष्ठ पर भी अभी कनाडा का उल्लेख नहीं है। 🔗 स्रोत
  • Cohere और बदलाव का प्रबंधन — Katherine Correia (Cohere) की एक पोस्ट AI को केवल एक टूल के बजाय एक सहभागी के रूप में शामिल करने, कार्यों को सत्यापित किए जा सकने वाले, निर्णय आधारित या मिश्रित वर्गों में बाँटने और उपयोग के मामले के अनुसार संचालन करने की सलाह देती है। इसमें किसी उत्पाद या आँकड़े की घोषणा नहीं है। 🔗 स्रोत

इसका क्या अर्थ है

Anthropic का परिणाम कोड एजेंटों को बुनियादी जीवविज्ञान तक ले जाता है। लगभग 950 Claude एजेंटों ने 21 घंटों में 200 000 से अधिक रिवर्स ट्रांसक्रिप्टेस की छँटाई की। मनुष्यों ने केवल शुरुआत में एक prompt देकर और अंत में प्रयोगों के लिए हस्तक्षेप किया। अब मुख्य चुनौती परिकल्पनाओं की छँटाई है, जिसे Anthropic स्वयं एक शोध विषय के रूप में अध्ययन कर रहा है। सावधानी ज़रूरी है: ART का कार्य अज्ञात है और परिणाम फिलहाल प्रीप्रिंट के रूप में है। बड़ी संख्या में एजेंट चलाकर उनके काम को मापों के आधार पर दिशा देने का यही तरीका claude.ai को तेज़ बनाने वाले स्प्रिंट में भी दिखता है, जिसमें 3 000 से अधिक बदलाव हुए, और Lean में Claude Agent SDK के औपचारिक सत्यापन में भी।

एजेंटों के sandbox की सुरक्षा अब सार्वजनिक चर्चा का विषय बन रही है। Perplexity का ऑडिट दो सुरक्षा सीमाओं को अलग करता है: वर्चुअल मशीन का अलगाव सभी 108 परीक्षणों में कायम रहा; नेटवर्क फ़िल्टरिंग 54 में से 11 बार ऐसे मॉडलों के सामने विफल हुई जिन्होंने ठीक से सत्यापित न किए गए DNS या CDN के साझा पतों का उपयोग किया; और दस में से आठ तृतीय पक्ष प्लेटफ़ॉर्म पर कम से कम एक रास्ते से सुरक्षा को दरकिनार किया जा सकता था। Fable और GPT-6 Astra, इन दो मॉडलों ने यह अभ्यास करने से इनकार कर दिया। उसी दिन GitHub Copilot ऐप ने एक स्थानीय sandbox उपलब्ध कराया जो सुरक्षा के बिना चलने के बजाय विफल हो जाता है; Claude Code का auto मोड केवल पढ़ने वाले commands को भी classifier के पास भेजता है; और Vibe CLI तथा Kimi Code ने अनुमति जाँच को दरकिनार करने के रास्ते बंद किए। इससे दो दिन पहले ZCode ने अपने समुदाय द्वारा बताई गई समस्याओं के बाद अपना कोड सार्वजनिक किया था।

आवाज़ काम करवाने का माध्यम बन रही है। Gemini 3.8 Flash TTS और Flash-Lite TTS का ऑडियो आउटपुट पिछले पूर्वावलोकन संस्करण से आधे से भी कम कीमत पर मिलता है (2026 के अंत तक प्रति दस लाख tokens पर 9 और 6 डॉलर, जबकि पहले 20 डॉलर थे)। इनमें रिकॉर्ड की गई सहमति के आधार पर वॉइस क्लोनिंग भी जोड़ी गई है, जो AI Studio के ज़रिए यूरोपीय आर्थिक क्षेत्र में उपलब्ध नहीं है। Qwen ने अपने ऑडियो उत्पाद समूह की कीमतों में 70 से 95 % कटौती की घोषणा की है, NVIDIA ने आठ वक्ताओं को अलग पहचानने वाला मॉडल उपलब्ध कराया है, और Basis ने एक साथ बोलती आवाज़ों वाली 1 500 घंटे की बातचीत प्रकाशित की है। दूसरी ओर, ChatGPT Voice बातचीत से आगे बढ़कर ChatGPT Work के plugins और tasks की मदद से काम करने लगा है।

अंत में, भौतिक दुनिया में काम करने वाली AI के संसाधन अधिक खुले हो रहे हैं, लेकिन उनकी शर्तें अलग-अलग हैं। FLUX 3 Action का 7 अरब पैरामीटर वाला मॉडल RoboLab-120 में शीर्ष पर है। इसे NVIDIA के साथ LeRobot में जोड़ा गया है और यह दिखाता है कि तेज़ तथा भरोसेमंद नीति महँगे तर्क की ज़रूरत घटाती है: GPT-6 Astra को पर्यवेक्षक बनाकर प्रति सफलता 8,77 डॉलर की लागत आती है, जबकि अकेले Astra के साथ 13,47 डॉलर। लेकिन « खुला » होने के अलग-अलग अर्थ हैं: FLUX 3 Action और Basis Conversations 1500 के अपने लाइसेंस हैं, QVAC Genesis III का लाइसेंस गैर-व्यावसायिक है, और Qwen Intelligence ने मॉडल के weights के बिना benchmarks प्रकाशित किए हैं। इन संसाधनों का पुनः उपयोग करने वालों के लिए लाइसेंस उतना ही मायने रखता है जितना स्कोर।


स्रोत