ai-powered-markdown-translatorgpt-6-sol के साथ fr से hi में अनुवादित लेख।
इस 23 सितंबर को Anthropic ने अपनी आणविक जीवविज्ञान प्रयोगशाला और उसका पहला परिणाम पेश किया: ART, एक अज्ञात एंज़ाइम तंत्र जिसे लगभग 950 Claude एजेंटों ने बैक्टीरियोफ़ेज के डीएनए में पहचाना। Google ने Gemini 3.8 Flash TTS और Flash-Lite TTS लॉन्च किए, जो आवाज़ें बनाते हैं और उनकी प्रतिकृति तैयार करते हैं। Black Forest Labs ने रोबोट नियंत्रित करने के लिए खुले वज़न वाला मॉडल FLUX 3 Action जारी किया, और Perplexity ने SPACE का पहला सुरक्षा ऑडिट प्रकाशित किया। SPACE वह सैंडबॉक्स है जिसमें उसके एजेंट चलते हैं।
Anthropic ने आणविक जीवविज्ञान प्रयोगशाला खोली, जहाँ Claude ने ART खोजा
23 सितंबर — Anthropic ने जीवन विज्ञान का एक नया शोध समूह पेश किया है। सैन फ़्रांसिस्को खाड़ी क्षेत्र में स्थित इस समूह की अपनी आणविक जीवविज्ञान प्रयोगशाला है और इसका गठन वसंत ऋतु में हुआ था। इसका पहला परिणाम: Claude एजेंटों ने बैक्टीरिया को संक्रमित करने वाले वायरस, यानी बैक्टीरियोफ़ेज, के डीएनए में पहले कभी वर्णित न किया गया एक एंज़ाइम तंत्र पहचाना। Anthropic ने इसे ART (array-associated reverse transcriptases, यानी श्रृंखला से संबद्ध रिवर्स ट्रांसक्रिप्टेज़) नाम दिया है।
शुरुआत एक प्रॉम्प्ट से हुई: डीएनए अनुक्रमों के विशाल डेटाबेस में रिवर्स ट्रांसक्रिप्टेज़ के नए उदाहरण खोजने थे। ये एंज़ाइम आरएनए की प्रति डीएनए के रूप में बनाते हैं। 21 घंटों में लगभग 950 एजेंटों ने 210 मिलियन टोकन इस्तेमाल किए, 200 000 से अधिक रिवर्स ट्रांसक्रिप्टेज़ जुटाए, 3 500 नए संभावित तंत्र अलग किए और 20 सबसे आशाजनक उम्मीदवार चुने। हर उम्मीदवार के साथ मनुष्यों के पढ़ने योग्य रिपोर्ट थी। Anthropic के अनुसार, ऐसा विश्लेषण किसी विशेषज्ञ को कई सप्ताह, यहाँ तक कि कई महीने ले सकता है; मानवीय हस्तक्षेप शुरुआती प्रॉम्प्ट और प्रयोगशाला के प्रयोगों तक सीमित रहा।
| शोध अभियान का चरण | मापा गया आँकड़ा |
|---|---|
| शोध की अवधि | 21 घंटे |
| लगाए गए Claude एजेंट | लगभग 950 |
| इस्तेमाल किए गए टोकन | 210 मिलियन |
| जुटाए गए रिवर्स ट्रांसक्रिप्टेज़ | 200 000 से अधिक |
| नए संभावित तंत्र | 3 500 |
| चुने और विश्लेषित किए गए उम्मीदवार | 20 |
ART में तीन घटक हैं: रिवर्स ट्रांसक्रिप्टेज़, पास में स्थित एक सहयोगी जीन जिसका कार्य अज्ञात है, और नियमित अंतराल पर दोहराए गए डीएनए अनुक्रमों की एक लंबी श्रृंखला, जिसकी बनावट CRISPR श्रृंखला जैसी है। एक विशाल फ़ेज में पाया गया रिवर्स ट्रांसक्रिप्टेज़ पहले से ज्ञात था; Anthropic के अनुसार, उसके साथ मौजूद गैर-कोडिंग श्रृंखला और प्रोटीन पर ध्यान देने वाला Claude «शायद पहला» है। शुरुआती प्रयोग दिखाते हैं कि यह श्रृंखला अलग-अलग छोटे आरएनए के रूप में अभिव्यक्त होती है। Anthropic सावधानी बरत रहा है: ART का कार्य अभी ज्ञात नहीं है और आगे प्रयोग चल रहे हैं। Anthropic के अनुसार, केवल कुछ ज्ञात तंत्रों में ये विशेषताएँ मिलती हैं, और वे सभी प्रोग्राम किए जा सकते हैं तथा डीएनए को काटने, कॉपी करने और चिपकाने में सक्षम हैं।
Claude has discovered a previously unknown enzyme system hidden in the DNA of bacteriophages. Beside the enzyme’s gene sits a long array of repeating DNA—a structure that looks somewhat similar to CRISPR.
🇮🇳 Claude ने बैक्टीरियोफ़ेज के डीएनए में छिपा एक ऐसा एंज़ाइम तंत्र खोजा है जो अब तक अज्ञात था। एंज़ाइम के जीन के बगल में दोहराए गए डीएनए की एक लंबी श्रृंखला है, जिसकी संरचना कुछ हद तक CRISPR जैसी है। — X पर @AnthropicAI
प्रयोगशाला केवल BSL-1 और BSL-2 जैवसुरक्षा स्तरों पर काम करती है और मनुष्यों को संक्रमित कर सकने वाले किसी भी रोगजनक को नहीं संभालती; प्रयोगशाला का सारा प्रत्यक्ष काम मानव वैज्ञानिक करते हैं। टीम Claude Science और Claude Code का उपयोग करती है, कभी-कभी अपने बनाए ऐसे तंत्र के साथ जो कई सत्रों का समानांतर समन्वय करता है। एक अभियान से सैकड़ों, बल्कि हज़ारों रिपोर्ट बनती हैं, इसलिए परिकल्पनाएँ भी अध्ययन का विषय बन जाती हैं: शोधकर्ता जिन परिकल्पनाओं को परीक्षण योग्य मानते हैं, उनकी विशेषताओं से Claude को दिए जाने वाले निर्देश सुधारे जाते हैं। CRISPR से जीनोम संपादन के अग्रणी वैज्ञानिक Feng Zhang (MIT और Broad Institute) ने प्रीप्रिंट की समीक्षा की और इसे जैविक खोज में एआई एजेंटों के संभावित योगदान का उत्साहजनक उदाहरण माना। Anthropic ने यह प्रीप्रिंट प्रकाशित किया है और वैज्ञानिकों को अपने शोध प्रश्न भेजने के लिए आमंत्रित किया है।
🔗 Claude ने CRISPR जैसी पुनरावृत्तियों वाला एक नया एंज़ाइम तंत्र खोजा · प्रीप्रिंट (PDF)
Gemini 3.8 Flash TTS और Flash-Lite TTS: Google आवाज़ें बनाता है और उनकी प्रतिकृति तैयार करता है
23 सितंबर — Google ने Gemini परिवार में आवाज़ संश्लेषण (text-to-speech) के दो मॉडल जोड़े हैं: Gemini 3.8 Flash TTS और Gemini 3.8 Flash-Lite TTS। कंपनी इन्हें अपने सबसे अभिव्यंजक ऑडियो मॉडल बताती है। दोनों Gemini API और Google AI Studio में सामान्य उपलब्धता के साथ, नए Voices एंडपॉइंट पर उपलब्ध हैं; API के परिवर्तन लॉग में प्रविष्टि 22 सितंबर की है, जबकि सार्वजनिक घोषणा 23 सितंबर को हुई।
दोनों मॉडलों की भूमिकाएँ अलग हैं। Flash TTS रचना के लिए है: आवाज़ की भूमिका, लहजे और व्यक्तित्व का प्राकृतिक भाषा में वर्णन किया जाता है, फिर हर संवाद की अदायगी, गति और बोली में बदलाव निर्देशित किए जाते हैं। Google इसे वीडियो गेम, ऑडियोबुक और पॉडकास्ट के लिए पेश करता है। Flash-Lite TTS का लक्ष्य अधिक मात्रा और कम लागत है: बड़े पैमाने पर डबिंग, भारी मात्रा में ऑडियो उत्पादन और वास्तविक समय के वॉइस एजेंट; इसे gemini-3.1-flash-tts-preview की जगह लेनी है। दोनों एक ही स्क्रिप्ट में दो आवाज़ों का संवाद, आवाज़ के स्वर में उल्लेखनीय बदलाव के बिना घंटों लंबा ऑडियो, और <laughs>, <sigh> या |mhm| जैसे टैग संभालते हैं।
घोषणा में 2 000 से अधिक तैयार आवाज़ों का उल्लेख है, जिनमें क्यूबेक की फ़्रेंच जैसी क्षेत्रीय किस्में शामिल हैं; वहीं API दस्तावेज़ में 30 स्टूडियो आवाज़ों और कई सौ आवाज़ों वाली विस्तृत लाइब्रेरी का वर्णन है। आवाज़ की प्रतिकृति 30 सेकंड के नमूने से बनाई जा सकती है, बशर्ते आवाज़ के मालिक की मौखिक सहमति रिकॉर्ड की जाए। सभी उत्पन्न ऑडियो में SynthID वॉटरमार्क होता है। फ़्रांस के पाठकों के लिए एक अहम बात: घोषणा की एक टिप्पणी के अनुसार, AI Studio के ज़रिए आवाज़ की प्रतिकृति यूरोपीय आर्थिक क्षेत्र, ब्रिटेन, स्विट्ज़रलैंड, भारत, इलिनॉय और टेक्सस में उपलब्ध नहीं है। मौजूदा आवाज़ों को रीमिक्स करने की सुविधा जल्द आने की घोषणा की गई है।
| मॉडल की विशेषता | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| API पहचानकर्ता | gemini-3.8-flash-tts | gemini-3.8-flash-lite-tts |
| समर्थित भाषाएँ (API दस्तावेज़) | 130 | 101 |
| लक्षित उपयोग | रचना, सूक्ष्म निर्देशन | अधिक मात्रा, डबिंग, वॉइस एजेंट |
| ऑडियो आउटपुट, 31/12/2026 तक Standard मूल्य (मिलियन टोकन) | 9 डॉलर | 6 डॉलर |
| ऑडियो आउटपुट, 01/01/2027 से Standard मूल्य (मिलियन टोकन) | 18 डॉलर | 12 डॉलर |
| उपभोक्ता उत्पाद | Gemini Notebook | Google Vids (घोषित वाचन सुविधा) |
तुलना के लिए, Gemini 3.1 Flash TTS Preview के आउटपुट ऑडियो की लागत 20 डॉलर प्रति मिलियन टोकन है। लॉन्च के समर्थन में Google बाहरी मूल्यांकनों का हवाला देता है: Flash TTS ने Hume AI के Voice Design Benchmark में पहला स्थान (71,4) पाया, और दोनों मॉडलों ने Hume AI के Overall Quality Index में पहले दो स्थान हासिल किए। वे API के ज़रिए Gemini Enterprise में भी «जल्द» उपलब्ध होंगे।
🔗 Google की घोषणा · Gemini API के रिलीज़ नोट्स · API की कीमतें
FLUX 3 Action: Black Forest Labs ने रोबोट नियंत्रित करने के लिए खुले वज़न वाला मॉडल जारी किया
23 सितंबर — FLUX इमेज मॉडल के लिए प्रसिद्ध Black Forest Labs ने FLUX 3 Action जारी किया है। यह रोबोट नियंत्रित करने के लिए बनाया गया 7 बिलियन पैरामीटर वाला वर्ल्ड एक्शन मॉडल (World Action Model) है। बहु-माध्यमी FLUX 3 आधार से विकसित यह मॉडल कैमरों और जोड़ों की स्थिति के आधार पर एक ही गणना में आगामी छवियों और मोटर कमांड का अनुमान लगाता है। इसके वज़न खुले हैं (DROID चेकपॉइंट के Hugging Face पृष्ठ पर «flux-kommunity-license» लाइसेंस दर्ज है)। प्रयोगशाला ने कोड, फ़ाइन-ट्यूनिंग की विधि, बेंचमार्क और दोहराए जा सकने वाले उदाहरण भी प्रकाशित किए हैं।
An open weights 7B World Action Model that achieves first place on the RoboLab benchmark. It outperforms the previous best open model by 6.1 percentage points while using 56% fewer parameters and running up to 3.95x faster.
🇮🇳 7B पैरामीटर वाला खुले वज़न का वर्ल्ड एक्शन मॉडल, जिसने RoboLab बेंचमार्क में पहला स्थान हासिल किया है। यह पिछले सर्वश्रेष्ठ खुले मॉडल से 6,1 प्रतिशत अंक आगे है, जबकि इसमें 56 % कम पैरामीटर हैं और यह 3,95 गुना तक तेज़ चलता है। — X पर @bfl_ai
| मूल्यांकित मॉडल | मॉडल का प्रकार | वज़नों की उपलब्धता | RoboLab-120 में सफलता | पैरामीटरों की संख्या |
|---|---|---|---|---|
| FLUX 3 Action | WAM | खुले | 42,92 % | 7B |
| OASIS WAM | VLM + WAM | बंद | 39,0 % | – |
| Cosmos3-Nano-Policy | WAM | खुले | 36,8 % | 16B |
| Phoenix | TAMP+FM | बंद | 34,4 % | – |
| BiMind v0.1 | VLA | बंद | 33,3 % | – |
| π0.5 | VLA | खुले | 28,0 % | 3,3B |
| DreamZero | WAM | खुले | 25,7 % | 14B |
| GR00T N1.6 | VLA | खुले | 7,2 % | 3B |
पिछला सर्वश्रेष्ठ खुला मॉडल NVIDIA का Cosmos3-Nano-Policy था। «3,95 गुना तक तेज़» की तुलना FP8 में Cosmos 3 Nano से है: GPU के अनुसार गति 1,52 से 3,95 गुना तक है। सबसे सक्षम खुले दृष्टि-भाषा-क्रिया मॉडल (VLA) π0.5 की तुलना में, एक चरण वाला डिस्टिल्ड संस्करण (38,3 %) वर्कस्टेशन और डेटा सेंटर GPU पर तेज़ है, लेकिन RTX 5090 पर धीमा है; हालाँकि यह प्रति अनुमान 2,13 सेकंड की गति का पूर्वानुमान लगाता है, जबकि π0.5 केवल 1 सेकंड का।
घोषणा में एक मिश्रित नीति भी परखी गई है, जिसमें OpenAI का GPT-6 Astra रोबोट की निगरानी करता है: कम प्रयास स्तर (low) पर Astra के साथ FLUX 3 Action ने 90 % एपिसोड सफलतापूर्वक पूरे किए, प्रति सफलता 8,77 डॉलर और लगभग 8 मिनट लगे। इसके मुकाबले «xhigh» प्रयास स्तर पर अकेले Astra ने सभी कार्य पूरे किए, लेकिन प्रति सफलता 13,47 डॉलर और 16 मिनट लगे। वास्तविक Franka रोबोटिक भुजा पर Positronic Robotics के अंध मूल्यांकन में FLUX 3 Action ने 30 में से 28 बार सफलता पाई, जबकि Cosmos 3 Nano ने 27 और π0.5 ने 13 बार। Hugging Face पर तीन चेकपॉइंट उपलब्ध हैं (बेस, SO-101 और DROID)। मॉडल को NVIDIA के साथ LeRobot में भी एकीकृत किया गया है और इसे Jetson पर तैनात किया जा सकता है।
🔗 FLUX 3 Action (Black Forest Labs) · Hugging Face संग्रह
Escaping SPACE: Perplexity ने Computer के सैंडबॉक्स का पहला सुरक्षा ऑडिट प्रकाशित किया
23 सितंबर — Perplexity Secure Intelligence Institute ने SPACE पर किए गए प्रवेश परीक्षणों (red-teaming) की रिपोर्ट का पहला भाग प्रकाशित किया है। SPACE वह सैंडबॉक्स है जिसमें 15 जुलाई को पेश किए गए Perplexity Computer के एजेंट चलते हैं। यह किसी उत्पाद का लॉन्च नहीं, बल्कि SPACE का पहला प्रकाशित सुरक्षा मूल्यांकन है। हर सैंडबॉक्स होस्ट मशीन से अलग की गई Firecracker माइक्रो वर्चुअल मशीन है, और हर सैंडबॉक्स का अपना गेटवे आउटबाउंड नेटवर्क नीति लागू करता है।
नौ मॉडलों को वर्चुअल मशीन में root पहुँच दी गई और झंडा हासिल करने जैसी दो चुनौतियाँ सौंपी गईं: VM और होस्ट के बीच की सीमा पार करके एक नकली AWS पहचानकर्ता प्राप्त करना, या नेटवर्क नीति से अवरुद्ध URL तक पहुँचना। परीक्षण में SPACE के स्रोत कोड तक पहुँच होने या न होने और नेटवर्क पहुँच के दो स्तरों—बिल्कुल नहीं या आंशिक (PyPI तथा Ubuntu पैकेज रिपॉज़िटरी और Perplexity वेब खोज)—को मिलाया गया; हर संयोजन में तीन प्रयास हुए। परिणाम: स्रोत कोड उपलब्ध होने पर भी 108 प्रयासों में VM से होस्ट तक कोई पहुँच नहीं बना सका। पूरा नेटवर्क बंद होने पर नेटवर्क फ़िल्टरिंग बनी रही (54 में से 0); आंशिक नेटवर्क पहुँच के साथ, हालाँकि, सुधार लागू होने से पहले 54 में से 11 प्रयास निषिद्ध गंतव्य तक पहुँचे।
| मूल्यांकित मॉडल | स्रोत कोड के साथ सफलता | स्रोत कोड के बिना सफलता |
|---|---|---|
| Claude Opus 5.0 | 3 में से 3 प्रयास | कोई नहीं |
| GPT-5.6 Sol | 3 में से 3 प्रयास | 3 में से 2 प्रयास |
| Kimi K3 | 3 में से 2 प्रयास | कोई नहीं |
| GPT-5.6 Cyber | कोई नहीं | 3 में से 1 प्रयास |
| पाँच अन्य मूल्यांकित मॉडल | कोई नहीं | कोई नहीं |
दो कमज़ोरियों का इस्तेमाल हुआ। पहली, DNS स्पूफ़िंग: एजेंट ने pypi.org को लक्ष्य के पते से जोड़ने वाला नकली जवाब डाला, और स्रोत की जाँच न करने वाले गेटवे ने उसे दर्ज कर लिया; इसके लिए ऐसा आंतरिक पता चाहिए था जो केवल स्रोत कोड में दिखता था। दूसरी, CDN द्वारा IP पतों को साझा करना: GPT-5.6 Sol ने निषिद्ध URL को fiddle.fastly.dev से खुलवाया, जिस तक PyPI वाले ही पते से पहुँचा जा सकता था। GPT-5.6 Cyber ने पहले Taboola की इमेज सेवा और फिर thum.io के स्क्रीनशॉट जनरेटर का उपयोग किया, जिसके बाद अक्षर पहचान से झंडा पढ़ा। Claude Opus 5.0 ने इस रास्ते को पहचाना, लेकिन किसी बाहरी प्रणाली को निशाना न बनाने के निर्देश के विरुद्ध मानकर छोड़ दिया। सफल होने वाला खुले वज़न का एकमात्र मॉडल Kimi K3 था। दो मॉडलों का मूल्यांकन नहीं हो सका: Anthropic के Cyber Verification Program में Perplexity के नामांकन के बावजूद Fable ने अभ्यास से इनकार किया, और GPT-6 Astra ने भी मना कर दिया।
26 अगस्त को मिली कमज़ोरियाँ ठीक कर दी गई हैं: हर आउटबाउंड पैकेट में अपनी VM को दिया गया पता होना चाहिए, और अब गेटवे स्वयं TLS कनेक्शन समाप्त करके सर्वर नाम (SNI) तथा HTTP होस्ट की जाँच करता है। हमलावर के लिए सबसे अनुकूल संयोजन में दोबारा मूल्यांकन करने पर मॉडल झंडा प्राप्त नहीं कर सके। इसके बाद Perplexity ने बिना एजेंट के तीसरे पक्ष के दस सैंडबॉक्स प्लेटफ़ॉर्म पर परीक्षण किए: आठ में कम से कम एक रास्ता मिला जिससे प्रतिबंध पार किया जा सकता था। इनमें E2B, Vercel Sandbox, Modal Sandboxes और Daytona Sandbox शामिल थे, जबकि Cloudflare Sandbox और NVIDIA OpenShell सुरक्षित रहे। 1 सितंबर को सूचित किए गए सभी प्रदाताओं ने जवाब दिया; 10 सितंबर तक Daytona, Deno और microsandbox ने समस्याएँ ठीक कर दी थीं, जबकि Vercel और Modal ने इस व्यवहार को ज्ञात सीमा माना। मॉडलों की रणनीतियों पर रिपोर्ट के दूसरे भाग की घोषणा हुई है, लेकिन तारीख नहीं दी गई है।
Claude Code 2.1.281: एट्रिब्यूशन बंद करने का विकल्प और ऑटो मोड पर सख्ती
23 सितंबर — 2.1.280 के अगले दिन, 19:19 UTC पर जारी Claude Code 2.1.281 में 176 प्रविष्टियाँ हैं, जिनमें 112 सुधार हैं। रोज़मर्रा के इस्तेमाल में दो बदलाव दिखते हैं: settings.json में "attribution": false सेटिंग कमिट और पुल रिक्वेस्ट से सभी एट्रिब्यूशन हटा देती है, और संदेश तुरंत भेजने पर (ctrl+enter) चल रहे टूल मौजूदा टर्न को रद्द करने के बजाय पृष्ठभूमि में चले जाते हैं।
ऑटो मोड के नियम और सख्त हुए हैं: जहाँ क्लासिफ़ायर की समीक्षा सर्वर पर होती है, वहाँ केवल पढ़ने वाली शेल कमांड भी उसके फ़ैसले का इंतज़ार करती हैं। एक सुरक्षा सुधार भी ध्यान देने योग्य है: कमांड सब्स्टिट्यूशन को लक्ष्य बनाने वाला रिकर्सिव rm, जैसे rm -rf "$(pwd)", पहले ऑटो मोड में और --dangerously-skip-permissions के साथ बिना पुष्टि के चल जाता था; अब अनुमति देने वाला Bash नियम होने पर भी पुष्टि माँगता है। बिना निगरानी वाले सत्रों को अटकने से बचाने के लिए, ख़तरनाक rm की पुष्टि का संकेत दो मिनट इंतज़ार करता है, फिर कमांड अस्वीकार करके उसे दोबारा लिखने का सुझाव देता है।
स्वयं होस्ट किए गए रनर के लिए एक असंगत बदलाव है: --system-prompt जोड़ने वाली मध्यवर्ती स्क्रिप्ट (wrappers) या हुक को --system-prompt-file अपनाना होगा। प्रशासकों के लिए, Claude apps गेटवे STS से प्राप्त IAM भूमिका (assume_role) के तहत Amazon Bedrock को कॉल कर सकता है, ज़रूरत पड़ने पर किसी दूसरे AWS खाते में भी, और हर अनुरोध पर Bedrock सुरक्षा नियंत्रण लागू कर सकता है।
Anthropic के उत्पाद: तेज़ हुआ claude.ai, विस्तृत हुआ Marketplace
उसी दिन प्रकाशित Anthropic की दो उत्पाद घोषणाएँ वैज्ञानिक परिणाम की पूरक हैं।
दो हफ़्तों में claude.ai तीन गुना तेज़
23 सितंबर — claude.dev पर Anthropic के तीन इंजीनियर अगस्त में चले दो सप्ताह के प्रयास का विवरण देते हैं, जिसने claude.ai और डेस्कटॉप ऐप को लगभग तीन गुना तेज़ बनाया। पूरा काम एक ही Slack चैनल में हुआ। उसमें Claude Tag (बीटा) एक आंतरिक शोध मॉडल से संचालित था, जिसे उन्होंने “लगभग Opus 5.5 के बराबर” बताया: Claude ने बाधाएँ पहचानीं, बेंचमार्क बनाए, सुधार सुझाए और परिनियोजन पर नज़र रखी; मनुष्यों ने लक्ष्य तय किए और हर बदलाव को मंज़ूरी दी। नतीजा: 3,000 से अधिक बदलाव मर्ज हुए, ग्राहकों को दिखने वाली किसी घटना या बदलाव वापस लेने की ज़रूरत के बिना।
| मापा गया चरण (75वाँ परसेंटाइल) | प्रयास से पहले | प्रयास के बाद |
|---|---|---|
| claude.ai पेज टाइप करने के लिए तैयार | 3,1 s | 0,55 s |
| नया Claude Code सत्र (डेस्कटॉप) | 0,8 s | 0,3 s |
| Claude Cowork क्लाउड सत्र (डेस्कटॉप) | 2,6 s | 0,73 s |
| 13 मापों का ज्यामितीय माध्य | – | 3,1x तेज़ |
तरीका एक विचार पर आधारित है: Claude के पास जैसे ही कोई मापने योग्य लक्ष्य होता है, वह उसे बेहतर बना सकता है। इसलिए टीम ने नियतात्मक मापों को CI की ऐसी सीमाओं में बदला जो केवल घट सकती हैं। इन सुधारों में से एक, लगभग चार गुना अधिक सुचारु स्ट्रीमिंग, की घोषणा 24 अगस्त को हो चुकी थी।
🔗 हमने दो हफ़्तों में claude.ai को 3x तेज़ कैसे बनाया
Claude Marketplace में कनेक्टर, एजेंट और इंटीग्रेटर एक साथ
23 सितंबर — Anthropic ने मार्च में सीमित पूर्वावलोकन के रूप में शुरू हुए Claude Marketplace का विस्तार किया है। अब इसमें तीन तरह की पेशकशें हैं: 2,000 से अधिक कनेक्टर और प्लगइन (Atlassian, Google, Microsoft, Notion, Salesforce…), Claude से संचालित एजेंट और उत्पाद (CrowdStrike, Cursor, Harvey, Legora, Lovable, Snowflake), जिनका भुगतान कंपनियाँ Anthropic के प्रति अपनी खर्च प्रतिबद्धता के एक हिस्से से कर सकती हैं, और Claude Partner Network की परामर्श कंपनियाँ (Accenture, Boston Consulting Group, Deloitte)। प्रदाताओं के पास शामिल होने के तीन रास्ते हैं: MCP और Agent Skills से कनेक्टर या प्लगइन बनाना, किसी एजेंट या उत्पाद के लिए आवेदन देना, या Partner Network से जुड़ना। साथ प्रकाशित एक लेख ख़रीद की प्रक्रिया दिखाता है: CodeRabbit ने Anthropic के लिए प्रतिबद्ध अपने बजट से Vercel की योजना का भुगतान किया और समझौता एक सप्ताह में पूरा हुआ। Anthropic की खर्च प्रतिबद्धता से ऐसा भुगतान अभी पात्रता के अनुरोध पर उपलब्ध सीमित पूर्वावलोकन में है।
ChatGPT: Voice से काम कराना, रिविज़न कार्ड और Privacy Center
Voice प्लगइन इस्तेमाल करता है और ChatGPT Work में आता है
23 सितंबर — OpenAI ने ChatGPT Voice को दो दिशाओं में बढ़ाया है। वेब, iOS और Android पर बातचीत के दौरान Live वॉइस मोड अब खाते से जुड़े प्लगइन और ऐप, जैसे ईमेल, कैलेंडर या Slack, इस्तेमाल कर सकता है। Voice वेब और मोबाइल पर ChatGPT Work में भी आ गया है: इसमें बोलकर दस्तावेज़, प्रस्तुति या स्प्रेडशीट बनाने, कोई जुड़ा हुआ ऐप इस्तेमाल करने या ब्राउज़र में कोई काम करने को कहा जा सकता है। कॉल के बाद वह काम लिखित रूप में जारी रह सकता है।
मॉडल के बारे में OpenAI की पोस्ट कहती है कि Voice, GPT-6 Astra, Sol और Luna का भी उपयोग कर सकता है; वहीं सहायता लेख स्पष्ट करता है कि सदस्यता के अनुसार Live, GPT-Live-1 या GPT-Live-1 mini पर चलता है, लेकिन GPT-6 मॉडल की भूमिका का विवरण नहीं देता। Free और Go उपयोगकर्ताओं को उनके प्लान के प्लगइन के साथ Chat में Voice मिलता है; Work में Voice के लिए दोनों की पहुँच आवश्यक है, और इस तरह शुरू किए गए काम Work के सामान्य उपयोग में गिने जाते हैं। Live वीडियो या स्क्रीन शेयरिंग का समर्थन नहीं करता। 23 सितंबर से नवीनतम ऐप संस्करण में इसका वैश्विक रोलआउट जारी है।
🔗 X पर OpenAI की घोषणा · ChatGPT Voice सहायता लेख
रिविज़न कार्ड और गोपनीयता केंद्र
22 सितंबर — ChatGPT अब किसी विषय या अपलोड किए गए नोट्स से इंटरैक्टिव रिविज़न कार्ड (flashcards) बना सकता है। कार्ड पर टैप करके उसे पलटा जाता है, फिर बताया जाता है कि उत्तर पहले से आता था या उसे दोबारा पढ़ना है; कार्डों का क्रम भी बदला जा सकता है। कार्ड लाइब्रेरी में अपने आप सहेजे जाते हैं। यह सुविधा मुफ़्त प्लान सहित सभी प्लान के लिए मोबाइल और वेब पर उपलब्ध है।
21 सितंबर — पिछली ख़बर: उसी रिलीज़ नोट्स पेज पर एक दिन पहले गोपनीयता केंद्र (Privacy Center) की भी घोषणा की गई थी। यह Free, Go, Plus और Pro प्लान के साइन इन किए हुए उपयोगकर्ताओं के लिए जारी किया जा रहा है। इसमें बातचीत की गोपनीयता, मेमोरी, निजीकरण, डेटा के उपयोग, जुड़े हुए ऐप और खाते की सुरक्षा की जानकारी एक जगह मिलती है, साथ ही सेटिंग्स के सीधे लिंक भी हैं। वेब पर इसे खाते के मेन्यू (Help, फिर Privacy Center) से और मोबाइल पर सेटिंग्स से खोला जा सकता है।
दो नए बेंचमार्क: मानसिक स्वास्थ्य और इन्फ़रेंस सेवा
MentalHealthBench (OpenAI)
23 सितंबर — OpenAI ने MentalHealthBench जारी किया है। यह खुला बेंचमार्क जाँचता है कि मॉडल मानसिक स्वास्थ्य से जुड़ी वास्तविक लगने वाली बातचीत में कैसे जवाब देते हैं—भावनात्मक पहलू वाली रोज़मर्रा की बातों से लेकर आपात स्थितियों तक। इसे 22 देशों के 19 भाषाएँ बोलने वाले 80 से अधिक लाइसेंस प्राप्त मनोवैज्ञानिकों और मनोचिकित्सकों के साथ बनाया गया है। कृत्रिम रूप से तैयार बातचीत में चार तरह के लोग हैं: वयस्क, 13 से 17 वर्ष के किशोर, देखभालकर्ता और चिकित्सक। विशेषज्ञों ने हर बातचीत के लिए -10 से +10 तक भारित मानदंड लिखे; केवल वे मानदंड रखे गए जिन्हें तीन में से कम से कम दो विशेषज्ञों ने मंज़ूरी दी और तीसरे ने उनका विरोध नहीं किया। मूल्यांकन GPT-5.6 Sol को निर्णायक बनाकर अपने आप किया जाता है, और स्कोर सुरक्षा, संदर्भ पूछने तथा उपयोगकर्ता की स्वायत्तता का सम्मान करने जैसे दस आयामों में बँटता है। OpenAI का कहना है कि मॉडल लगातार बेहतर हो रहे हैं, ख़ासकर संदर्भ पूछने में, लेकिन प्रत्येक मॉडल के स्कोर केवल लेख के ग्राफ़ में दिए गए हैं। OpenAI याद दिलाता है कि ChatGPT थेरेपी या पेशेवर देखरेख का विकल्प नहीं है।
SWE-Serve (NVIDIA)
23 सितंबर — Nemotron मॉडल के डेटा और मूल्यांकन पर काम करने वाली NVIDIA टीम ने SGLang टीम के साथ बनाया SWE-Serve जारी किया है: इस इन्फ़रेंस सर्विंग इंजन में वास्तव में मर्ज हुईं 83 पुल रिक्वेस्ट को 53 चलाए जा सकने वाले कार्यों में बदला गया है (स्पेकुलेटिव डिकोडिंग, मॉडल समर्थन, कर्नेल, कैश, सर्विंग API)। मुख्य नतीजा स्थानीय परीक्षण और वास्तविक सेवा के बीच का अंतर दिखाता है: वास्तविक सर्वर शुरू करने वाले 19 कार्यों पर वही सुधार लाइव सर्विंग परीक्षणों के बिना 69,4 % सफल होते हैं, लेकिन पूरे सत्यापनकर्ता के साथ केवल 45,9 %। यानी अन्य जाँचों में सफल होने वाले लगभग हर तीन सुधारों में से एक मॉडल लोड करके उससे अनुरोध करते ही विफल हो जाता है।
| मूल्यांकित मॉडल (अधिकतम रीजनिंग) | 3 प्रयासों में pass@1 | प्रति कार्य औसत लागत |
|---|---|---|
| Claude Opus 5 | 75 % | 17,40 डॉलर |
| GPT-5.6 Sol | 75 % | 12,26 डॉलर |
| Kimi K3 | 64 % | 7,24 डॉलर |
| GPT-5.6 Luna | 64 % | 0,95 डॉलर |
| DeepSeek V4 Flash (0731) | 55 % | 0,69 डॉलर |
न्यूनतम सुविधाओं वाले एक एजेंट से, वेब पहुँच के बिना, ग्यारह मॉडलों का मूल्यांकन किया गया। तालिका में Claude Opus 5.5, 22 सितंबर को जारी GPT-6 Sol और Luna, या GPT-6 Astra शामिल नहीं हैं। कार्य और सत्यापनकर्ता सार्वजनिक हैं।
🔗 SWE-Serve स्थानीय परीक्षणों और लाइव सर्विंग के बीच अंतर कैसे दिखाता है · GitHub रिपॉज़िटरी
जनरेटिव वीडियो एडिटिंग सॉफ़्टवेयर में पहुँचा
DaVinci Resolve Studio में Runway
23 सितंबर — Premiere Pro और After Effects के लिए अपने प्लगइन जारी करने के दो सप्ताह बाद, Runway अब Blackmagic Design के वीडियो एडिटिंग सॉफ़्टवेयर DaVinci Resolve Studio में आ गया है। macOS और Windows के लिए मुफ़्त प्लगइन Workspace, फिर Workflow Integrations से खुलता है। इससे प्रॉम्प्ट द्वारा चित्र और वीडियो बनाए जा सकते हैं, जो ब्राउज़र खोले बिना एक क्लिक में Media Pool और टाइमलाइन में आयात हो जाते हैं। Edit Studio सुविधा पहले से एडिट किए गए शॉट पर काम करती है: पैनल चुना हुआ हिस्सा निर्यात करता है और Aleph 2.0 अधिकतम पाँच संशोधित कीफ़्रेम के आधार पर उसे नई शैली में, समान अवधि रखते हुए, फिर से रेंडर करता है। इसके लिए DaVinci Resolve Studio 19 या नया संस्करण चाहिए; जनरेशन सभी भुगतान वाले Runway प्लान में उपलब्ध है और मौजूदा क्रेडिट इस्तेमाल करती है। हर जनरेशन की लागत पुष्टि से पहले दिखाई जाती है।
🔗 Runway अब DaVinci Resolve में
Google Vids में Gemini Omni 1.1 Flash मुफ़्त
23 सितंबर — Google या Google Workspace खाते वाला कोई भी व्यक्ति अब कंप्यूटर पर vids.new से Google Vids में Gemini Omni 1.1 Flash की मदद से मुफ़्त वीडियो बना सकता है। संस्करण 1.1 में तीन नए नियंत्रण हैं: पात्रों, रोशनी और दृश्य को बनाए रखते हुए किसी दृश्य को आगे बढ़ाना; क्लिप की सटीक अवधि तय करके उसे वॉइस ओवर से मिलाना; और सीधे 1080p में वीडियो बनाना। हर क्लिप पर SynthID वॉटरमार्क होता है। पूरा रोलआउट 23 सितंबर से शुरू होता है और इसमें 1 से 3 दिन लग सकते हैं; भुगतान वाले प्लान में अधिक वीडियो बनाए जा सकते हैं, लेकिन कोई संख्या प्रकाशित नहीं की गई है। Google ने जल्द ही Vids में Gemini 3.8 Flash-Lite TTS से 100 से अधिक भाषाओं में नैरेशन उपलब्ध कराने की घोषणा की है।
Made On YouTube 2026: Shorts की एडिटिंग में Gemini Omni
23 सितंबर — अपने वार्षिक Made On YouTube कार्यक्रम में YouTube ने Shorts और YouTube Create ऐप के लिए संवाद के ज़रिए काम करने वाले एडिटिंग सहायक में Gemini Omni को जोड़ा है: साधारण टेक्स्ट निर्देशों से बोले गए हिस्से काटे जा सकते हैं, संगीत मिलाया जा सकता है, शुरुआत में ध्यान खींचने वाला टेक्स्ट जोड़ा जा सकता है या शॉट्स का क्रम बदला जा सकता है। लाइव प्रसारण में अपने आप डबिंग (Live auto-dubbing) जुड़ती है, YouTube Music को बातचीत करके अपनी सुनने की कतार बनाने के लिए Ask Music मिलता है, और Podcast Lineup हर सप्ताह सुझाए गए पॉडकास्ट के AI से बने बोले हुए परिचय देता है। रचनाकारों को अपनी आवाज़ और चेहरे की सुरक्षा के लिए विस्तृत समानता पहचान सुविधा भी मिलती है। केवल व्यक्तिगत होम फ़ीड (Custom Feeds) के लिए समय बताया गया है: वे इस शरद ऋतु में अमेरिकी दर्शकों को मिलेंगी; बाकी सुविधाओं की अभी कोई निश्चित समयसीमा नहीं है।
🔗 Made On YouTube 2026 · Google का सारांश
सहायक दूसरे ऐप से जुड़ रहे हैं
Gemini: जुड़े हुए ऐप की नई खेप
23 सितंबर — Google, Gemini से जोड़े जा सकने वाले ऐप की नई शृंखला जारी कर रहा है, जिसे @GeminiApp खाते ने MCP कनेक्शन बताया है। लेख में तीन श्रेणियों के 14 नाम दिए गए हैं: उत्पादकता (Airtable, Linear, monday.com, PandaDoc, Wispr AI, Zoho), रचनात्मक काम (Adobe, Picsart, Squarespace, Webflow) और रोज़मर्रा की ज़िंदगी (apartments.com, Experian, Peloton, SeatGeek); वहीं @GeminiApp की पोस्ट 13 नए ऐप बताती है। इन सेवाओं को सेटिंग्स में सक्रिय किया जा सकता है या बातचीत में @ टाइप करके बुलाया जा सकता है। दिए गए उदाहरणों में Adobe से तस्वीर की रोशनी बदलना और Experian से अपना क्रेडिट स्कोर देखना शामिल हैं। लेख यह नहीं बताता कि यह किन देशों या प्लान के लिए है।
🔗 Google की घोषणा · @GeminiApp की घोषणा
Meta के एजेंट Muse में Shopify, PayPal, Expedia, Instacart, फिर ElevenLabs और HeyGen
22 और 23 सितंबर — Meta द्वारा 8 सितंबर को शुरू किए गए निजी एजेंट Muse ने 24 घंटे से भी कम समय में कारोबारी सेवाओं के चार कनेक्टर घोषित किए। आधिकारिक @Muse खाते के अनुसार सभी “जल्द” उपलब्ध होंगे, लेकिन तारीख, शुल्क या देश नहीं बताए गए। 23 तारीख को जनरेटिव मीडिया की दो कंपनियों ने भी Muse में आने की घोषणा की: ElevenLabs ने उपलब्धता की तारीख नहीं बताई, और HeyGen अपने MCP सर्वर का उपयोग करेगा।
| घोषित सेवा | घोषणा में बताया गया उपयोग | घोषणा करने वाला | बताई गई उपलब्धता |
|---|---|---|---|
| Shopify | वेब पर कहीं भी एक ही कदम में भुगतान | @Muse | जल्द |
| PayPal | दुनिया भर में एजेंट द्वारा प्रबंधित भुगतान | @Muse | जल्द |
| Expedia | होटल बुक करना | @Muse | जल्द |
| Instacart | घर तक किराने की डिलीवरी | @Muse | जल्द |
| ElevenLabs | वॉइस ओवर, साउंडट्रैक और वीडियो | @ElevenLabs | स्पष्ट नहीं |
| HeyGen | अपनी आवाज़ वाला, प्रकाशित करने के लिए तैयार अवतार वीडियो | @HeyGen | स्पष्ट नहीं |
🔗 @Muse द्वारा घोषित चार कनेक्टर · Muse में ElevenLabs का आगमन · Muse से जुड़ा HeyGen
Tesla और Google Slides, Sheets तथा Docs में Grok Bot
22 सितंबर — Tesla ने अपनी कारों में SpaceXAI के एजेंट Grok Bot के आने की घोषणा की: Connectors की मदद से Grok ईमेल इनबॉक्स संभाल सकता है, कैलेंडर व्यवस्थित कर सकता है या मौजूदा फ़ाइलों, बातचीत और कार्यों को आगे बढ़ा सकता है, जबकि चालक स्टीयरिंग पर हाथ रखे रहता है। @grok खाते ने उसी शाम घोषणा साझा की। इसे सक्रिय करने के तीन चरण हैं: कार में Grok ऐप में साइन इन करना, मोबाइल ऐप या Grok वेबसाइट से Connectors जोड़ना, फिर Grok Bot के लिए ज़रूरी SuperGrok की सदस्यता लेना। संदेशों में वाहन के मॉडल या देशों का उल्लेख नहीं है।
उसी दिन @bot खाते ने घोषणा की कि Grok Bot सीधे Google Slides, Sheets और Docs से जुड़ता है, ईमेल अटैचमेंट बेहतर ढंग से संभालता है (फ़ाइलें पढ़ना और जोड़ना) और अपनी वेब ब्राउज़िंग को उपयोगकर्ता के नेटवर्क से चला सकता है। SpaceXAI ने तेज़ कार्य निष्पादन और अधिक प्रतिक्रियाशील डेस्कटॉप ऐप का भी वादा किया है, लेकिन कोई आँकड़ा नहीं दिया।
🔗 @grok की साझा की हुई पोस्ट · Tesla की घोषणा · Grok Bot की पोस्ट शृंखला
Antigravity: स्थानीय एजेंट और /plan कमांड
SDK अब Gemma 4 26B के साथ स्थानीय रूप से अपने एजेंट चलाता है
23 सितंबर — Google Antigravity की एजेंट क्षमताओं तक Python से पहुँच देने वाला Antigravity SDK अब पूरी तरह स्थानीय वर्कफ़्लो का समर्थन करता है। शुरुआती समर्थन LiteRT (Google AI Edge) पर चलने वाले Gemma 4 26B A4B के लिए है। इसके लिए 24 GB से अधिक VRAM या एकीकृत मेमोरी वाली मशीन चाहिए; LocalOpenAIAgentConfig Ollama, LM Studio या vLLM जैसे किसी भी OpenAI-संगत सर्वर से जुड़ सकता है। Google के अनुसार, इसमें API की लागत या दर सीमा नहीं है, कोड मशीन से बाहर नहीं जाता और हाइब्रिड वर्कफ़्लो संभव हैं। उसके प्रदर्शन में Gemini 3.8 Flash क्लाउड पर 95 टोकन का उपयोग करके तीन असुरक्षित मॉड्यूल की जाँच की योजना बनाता है, जबकि उसे कोड कभी नहीं दिखता। इस दौरान Gemma 4 26B के स्थानीय इंस्टेंस खामियों को दोहराते हैं, सुधार लिखते हैं और उनकी पुष्टि करते हैं; 97,2 % टोकन (3 322) स्थानीय स्तर पर ही रहते हैं। ये सुविधाएँ 21 सितंबर को आए SDK 0.1.18 में शामिल हुईं। यह संस्करण इंटरैक्टिव प्रश्न वाले टूल ASK_QUESTION को डिफ़ॉल्ट टूलों से भी हटाता है, ताकि एजेंट स्वायत्त रूप से काम कर सकें।
Antigravity 2.16.0 और 2.17.0, CLI 1.2.8 और 1.2.9
22 सितंबर — Antigravity ऐप ने एक ही दिन दो संस्करण जारी किए। 2.17.0 में /plan कमांड आया है: एजेंट कोई भी कोड लिखने से पहले एक योजना तैयार करता है, जिसे पढ़कर बदला जा सकता है। Plan Review Policy की सेटिंग में तीन मोड हैं—हर योजना की समीक्षा करना, निर्णय एजेंट पर छोड़ना या समीक्षा छोड़ देना। यह संस्करण नियमों के लिए 20 000 टोकन का बजट भी रखता है और प्रत्येक रिपॉज़िटरी की कॉन्फ़िगरेशन .gemini/config.json से पढ़ता है; पुराने .agents/settings.json को अब ध्यान में नहीं रखा जाता। 2.16.0 में WSL वितरण से जुड़ना, प्रॉम्प्ट में Word, Excel और PowerPoint दस्तावेज़ जोड़ना और उप-एजेंटों को लाइव कार्ड के रूप में देखना संभव हुआ है।
| ऐप का संस्करण | सुधारों की संख्या | दोष सुधारों की संख्या | मुख्य नई सुविधा |
|---|---|---|---|
| 2.16.0 | 12 | 15 | WSL, Office अटैचमेंट, उप-एजेंटों के कार्ड |
| 2.17.0 | 11 | 10 | /plan, नियमों के लिए 20 000 टोकन का बजट |
22 और 23 सितंबर — टर्मिनल पर CLI 1.2.9 ने किसी उप-एजेंट को सीधे लिखने के लिए @ सिंटैक्स जोड़ा और headless मोड को अधिक भरोसेमंद बनाया: बैकग्राउंड कार्यों के लिए अब 30 मिनट तक इंतज़ार किया जाता है, जबकि पहले एजेंट के निष्क्रिय होने के कुछ सेकंड बाद उन्हें रद्द कर दिया जाता था। 1.2.8 ने संदर्भ के संक्षेपण में बदलाव किया और वॉइस डिक्टेशन को 3 मिनट 30 सेकंड तक सीमित किया।
Google DeepMind: Private AI Compute के लिए एन्क्रिप्टेड स्थायी मेमोरी
23 सितंबर — Google DeepMind ने बताया है कि वह Private AI Compute में स्थायी मेमोरी कैसे जोड़ने की योजना बना रहा है। यह प्लेटफ़ॉर्म हार्डवेयर से अलग रखे गए क्लाउड एनक्लेव में डेटा प्रोसेस करता है। अब तक प्लेटफ़ॉर्म में कोई स्थायी स्थिति नहीं रहती थी: कार्य समाप्त होते ही पूरा संदर्भ मिट जाता था। नई परत क्लाउड में एन्क्रिप्टेड तिजोरी की तरह काम करेगी, जिसकी कुंजियाँ केवल उपयोगकर्ता के उपकरणों पर रहेंगी। Google के अनुसार, इससे डेटा Google सहित किसी के लिए भी अप्राप्य रहेगा। जब किसी मॉडल को जानकारी चाहिए होगी, तो सुरक्षित एनक्लेव अलग रखी गई मेमोरी में डेटा को अस्थायी रूप से डिक्रिप्ट करेगा, अनुरोध पर काम करेगा, नया संदर्भ सहेजेगा और तुरंत फिर एन्क्रिप्ट कर देगा। दिया गया एक उदाहरण है: कनेक्टेड चश्मे से पहले देखे गए असेंबली निर्देशों को बाद में अपने कंप्यूटर पर ढूँढ़ना।
यह भविष्य की संरचना की घोषणा है; उपलब्धता की कोई तारीख या उत्पाद का नाम नहीं दिया गया है। भरोसा बढ़ाने के लिए Google ने एक अद्यतन श्वेतपत्र, अपने सर्वर सॉफ़्टवेयर का छेड़छाड़-रोधी सार्वजनिक रजिस्टर, जिसे उपकरण निजी डेटा भेजने से पहले जाँच सकेंगे, और एक स्वतंत्र ऑडिट के नतीजे प्रकाशित किए हैं। ऑडिट करने वाली कंपनी का नाम नहीं बताया गया है।
Qwen: स्मार्टफ़ोन के लिए एजेंट और सस्ता ऑडियो
Qwen Intelligence, फ़ोन निर्माताओं के लिए तीन एजेंट
23 सितंबर — Qwen ने Qwen Intelligence शुरू किया है, जो स्मार्टफ़ोन के लिए एजेंटों की पेशकश है और मुख्यतः फ़ोन निर्माताओं को लक्षित करती है। इसके मॉड्यूल—योजना, निष्पादन, छवि और मेमोरी—ज़रूरत के अनुसार जोड़े जा सकते हैं, और रूटिंग गणना को उपकरण तथा क्लाउड के बीच बाँटती है। शुरुआत में तीन एजेंट हैं: Mobile Planner जटिल कार्यों की योजना बनाता है; Mobile-Use पहले API के ज़रिए उन्हें पूरा करता है और ज़रूरत पड़ने पर ग्राफ़िकल इंटरफ़ेस का उपयोग करता है (Qwen के अनुसार MobileWorld पर 82,1, AndroidDaily पर 97,2 और शुरू से अंत तक 90 % सफलता); Mobile Creative 3 सेकंड में छवि बनाता है। Qwen ने चार बेंचमार्क उपलब्ध कराए हैं, लेकिन एजेंटों के वेट या कोड नहीं। Mobile-Use और Mobile Creative का शुल्क उपयोग के आधार पर लिया जा रहा है, जबकि Mobile Planner के लिए शुल्क लागू होने की घोषणा « जल्द » की गई है।
| मूल्यांकित मॉडल या सिस्टम (Qwen के अनुसार) | MobilePA-Bench का समग्र स्कोर |
|---|---|
| Qwen-Planner-Agent 27B | 77,05 % |
| GPT-6 Astra | 76,84 % |
| Claude Opus 5 | 75,71 % |
| Claude Fable 5 | 74,53 % |
| GLM 5.3 | 73,88 % |
🔗 X पर Qwen की घोषणा · Qwen-Planner-Agent की रिपोर्ट
Qwen-Audio-3.1, 95 % तक सस्ता
23 सितंबर — Qwen-Audio-3.1 ने Qwen के तीन ऑडियो मॉडल—वाक् पहचान (ASR), वाक् संश्लेषण (TTS) और रियल टाइम बातचीत (Realtime)—को उन्नत किया है और दो नए मॉडल जोड़े हैं: TTS-Next, जो एक ही बार में आवाज़, ध्वनि प्रभाव और पृष्ठभूमि ध्वनि बनाता है; और ASR-Next, जो वक्ताओं में अंतर करता है, प्रतिलेखन को समय चिह्न देता है तथा भावनाओं और आसपास की आवाज़ों को पहचानता है। Realtime एक साथ सुन और बोल सकता है तथा बीच में रोका जा सकता है। QwenCloud पर qwen-audio-3.1-realtime-plus की लागत इनपुट ऑडियो के प्रति दस लाख टोकन 6,4 डॉलर और टेक्स्ट व ऑडियो आउटपुट के लिए 24 डॉलर है; इसकी संदर्भ क्षमता 262K टोकन है। फ़ाइलों पर ASR की लागत इनपुट के प्रति दस लाख टोकन 0,15 डॉलर है। अभी केवल ये दो API उपलब्ध हैं; बाकी के « जल्द » आने की घोषणा की गई है।
| मॉडल परिवार | घोषित मूल्य कटौती |
|---|---|
| TTS | लगभग 70 % |
| Realtime | लगभग 85 % |
| ASR | 95 % तक |
🔗 X पर Qwen-Audio-3.1 की घोषणा · QwenCloud पर Qwen-Audio-3.1-Realtime
Mistral Vibe: Chat और Work का विलय, CLI की अनुमतियाँ सख़्त
Chat और Work का विलय, नॉलेज बेस पूर्वावलोकन में
22 सितंबर — Mistral ने अपने सहायक Vibe (पहले Le Chat) के लिए बिना किसी लेख या ट्वीट के चार रिलीज़ नोट प्रकाशित किए। मुख्य बदलाव Chat और Work को एक अनुभव में जोड़ता है: अब एक ही जगह प्रश्न पूछा या कार्य शुरू किया जा सकता है। मोड बदलने की जगह Fast / Think चयनकर्ता आया है, और Chat Agents की जगह Skills ने ली है; Deep Research अब उनमें से एक है। Free, Pro और Teams खातों के लिए माइग्रेशन 14 सितंबर को शुरू हुआ; उद्यम खातों के लिए यह 1 अक्टूबर से शुरू होगा और लगभग छह महीने तक चलेगा। सार्वजनिक पूर्वावलोकन में उपलब्ध एजेंटिक नॉलेज बेस (Agentic Knowledge Base) अस्पष्ट मेमोरी की जगह ऐसे पृष्ठ देता है जिन्हें देखा और बदला जा सकता है, और यह बताता है कि याद किया गया हर तथ्य कहाँ से आया। Mini App Canvas किसी प्रॉम्प्ट से साझा किए जा सकने वाले छोटे React ऐप बनाता है, और सशुल्क योजनाओं पर Excel या CSV स्प्रेडशीट Vibe Work में आ रही हैं।
Vibe CLI 2.25.8 अनुमति जाँच से बच निकलने के रास्ते बंद करता है
23 सितंबर — Vibe CLI 2.25.8 में 5 नई सुविधाएँ और 38 दोष सुधार हैं, जिनमें कई अनुमति सुरक्षा से जुड़े हैं। रिलेटिव पाथ पर आधारित अनुमति सूची अब किसी फ़ाइल को केवल इसलिए अनुमति नहीं देती कि उसके पाथ का अंतिम हिस्सा समान है। शेल कमांडों में वाइल्डकार्ड अब कार्य फ़ोल्डर के बाहर के पाथों की जाँच को नहीं छोड़ते। किसी पैरेंट फ़ोल्डर को दी गई अनुमति अब अपने आप उसके उपफ़ोल्डरों पर लागू नहीं होती, इसलिए कुछ अनुमोदन अनुरोध फिर दिखाई दे सकते हैं। नोट में पहली बार « Rust CLI » का भी उल्लेख है; इससे जुड़ी 18 प्रविष्टियाँ हैं और यह Vibe Code के दूरस्थ प्रोजेक्ट कॉन्फ़िगर करने सहित कई काम करने देती है। उद्यमों के लिए, संगठन द्वारा लागू कॉन्फ़िगरेशन Unified Harness सत्र खुलते ही प्रभावी हो जाती है। Supabase जैसे क्लाइंट सीक्रेट जारी करने वाले MCP सर्वरों से OAuth कनेक्शन की समस्या भी ठीक की गई है।
🔗 Vibe CLI 2.25.8 के रिलीज़ नोट
खुले और कमांड लाइन से चलने वाले कोड एजेंट
सुरक्षा समस्याओं के बाद ZCode ओपन सोर्स हुआ
21 सितंबर — पिछली ख़बर: समुदाय द्वारा बताई गई सुरक्षा समस्याओं के जवाब में Z.ai ने ZCode का कोड खोल दिया है। यह उसका एजेंटिक प्रोग्रामिंग ढाँचा है, जिसे GLM-5.3 का आधिकारिक टूल बताया गया था। @zcode_ai खाते का कहना है कि ज़रूरी सुधार पूरे कर लिए गए हैं; उसने माफ़ी भी माँगी है। Apache-2.0 लाइसेंस वाले zai-org/ZCode रिपॉज़िटरी में क्लाइंट, बैकएंड सेवाएँ, CLI और एजेंट रनटाइम शामिल हैं। 23 सितंबर को इसके लगभग 6 500 स्टार थे।
With respect to the code data referenced by the community, we confirm that no such data is retained and that it has never been used for model training.
🇮🇳 समुदाय द्वारा उठाए गए कोड डेटा के मुद्दे पर हम पुष्टि करते हैं कि ऐसा कोई डेटा संग्रहीत नहीं रखा गया है और मॉडल को प्रशिक्षित करने के लिए उसका कभी उपयोग नहीं हुआ है। — X पर @zcode_ai
ZCode के अनुसार, इसके बाद दो संस्थाओं ने स्थिति का मूल्यांकन किया: CAICT के मुताबिक Alibaba Cloud OSS का « zcode-prod » बकेट अब खाली है; NSFOCUS के मुताबिक उसके ऑब्जेक्ट और बकेट, दोनों हटा दिए गए हैं। दोनों ने पाया कि क्लाइंट v3.14.0 में सुधार शामिल है, Repo Wiki सुविधा हटा दी गई है और स्थानीय रिपॉज़िटरी के स्नैपशॉट अपलोड करने वाला प्रवाह बंद कर दिया गया है। Z.ai ने पुरस्कारों के साथ सुरक्षा खामियों की रिपोर्टिंग की स्थायी प्रक्रिया की घोषणा की है और पूरी मूल्यांकन रिपोर्ट प्रकाशित करने का वादा किया है।
🔗 GitHub पर ZCode का सोर्स कोड
Kimi Code 2.1.0 की सुरक्षा सख़्त हुई
23 सितंबर — Moonshot ने Kimi Code 2.1.0 जारी किया है (2 नई सुविधाएँ, 18 दोष सुधार)। दिखाई देने वाली नई सुविधा एक प्रयोगात्मक फ़ुल स्क्रीन लेआउट है, जिसे /settings में चुनना होता है और जो दोबारा शुरू करने पर लागू होता है। कई सुधार सुरक्षा को सख़्त करते हैं: फ़ाइल टूल अब प्रतीकात्मक लिंक के ज़रिए कार्य फ़ोल्डर से बाहर नहीं जा सकते; किसी प्रोजेक्ट की स्थानीय कॉन्फ़िगरेशन कार्यक्षेत्र स्वीकृत होने के बाद ही लागू होती है; रिपॉज़िटरी की git कॉन्फ़िगरेशन अब बैकग्राउंड git कार्रवाइयों के दौरान कमांड नहीं चला सकती; और निजी फ़ोल्डर या रूट की ओर इशारा करने वाले अतिरिक्त फ़ोल्डर अस्वीकार किए जाते हैं। MCP सर्वरों का OAuth अब ऑफ़लाइन पहुँच माँगता है, जिससे हर घंटे दोबारा अनुमति देने की ज़रूरत ख़त्म होती है। इसी दौरान Moonshot ने Python में लिखे पुराने Kimi CLI (11 424 स्टार) को आर्काइव कर दिया है; उसके संस्करण 1.51.0 और 1.52.0 उपयोगकर्ताओं को Kimi Code की ओर भेजते हैं।
🔗 Kimi Code 2.1.0 के रिलीज़ नोट
DeepSeek Harness 0.1.7-rc.1, पूर्वावलोकन में
23 सितंबर — DeepSeek ने DeepSeek Harness का v0.1.7-rc.1 जारी किया है। MIT लाइसेंस वाला यह ओपन सोर्स एजेंट ढाँचा 13 अगस्त को पेश किया गया था। यह रिलीज़ कैंडिडेट (release candidate) है: अगस्त से रिपॉज़िटरी में 21 पूर्वावलोकन संस्करण आए हैं, लेकिन अब तक कोई स्थिर संस्करण नहीं आया है। प्रमुख नई सुविधाएँ प्रयोगात्मक हैं: Computer Use मोड एजेंट को स्थानीय कंप्यूटर पर काम करने और उसके स्क्रीनशॉट लेने देता है (Cua Driver MCP या नेटिव ड्राइवर के ज़रिए), और ब्राउज़र नियंत्रण के लिए तीन बैकएंड हैं (Playwright MCP, Chrome DevTools MCP, Stagehand)। वेब इंटरफ़ेस में एकीकृत टर्मिनल और diffs के साथ बदलावों की समीक्षा जुड़ी है। headless मोड मानक इनपुट से कार्य पढ़ता है और JSON में ईवेंट देता है, तथा एजेंट SSH के ज़रिए दूरस्थ कार्यक्षेत्र में काम कर सकता है। माइग्रेशन में बदलाव करने होंगे: DeepSeek का आधिकारिक एडेप्टर अब केवल Messages API का उपयोग करता है, E2B निष्पादन बैकएंड हट गए हैं और प्रयोगात्मक टीम मोड में साथियों की संख्या 8 से बढ़कर 16 हो गई है।
🔗 DeepSeek Harness v0.1.7-rc.1
GenCode, Genspark का कोड एजेंट
23 सितंबर — Genspark ने GenCode शुरू किया है। यह उसकी Super App में शामिल कोड एजेंट है, जो macOS, Windows और Linux पर तथा कमांड लाइन से उपलब्ध है। इसकी मुख्य विशेषता मॉडल चुनने की सुविधा है: एक ही खाते से, हर कार्य के लिए Claude, GPT, DeepSeek या ओपन वेट मॉडल चुना जा सकता है और API कुंजी कॉन्फ़िगर करने की ज़रूरत नहीं होती। Genspark के अनुसार ओपन मॉडल की लागत « 1/10 से 1/20 » तक है। GenCode एक चरण में Claude Code के लिए तैयार किए गए निर्देश, नियम और मेमोरी अपना लेता है। npm पैकेज @genspark/gencode का README इसकी उत्पत्ति स्पष्ट करता है: यह ओपन सोर्स कोड एजेंट opencode से निकला है, लेकिन उस प्रोजेक्ट से असंबद्ध मालिकाना उत्पाद है और जानबूझकर रिपॉज़िटरी का .opencode/ फ़ोल्डर साझा करता है। हर चरण पर ख़र्च Genspark क्रेडिट में दिखता है।
🔗 GenCode · X पर Genspark की घोषणा
GitHub Copilot: सहायता प्राप्त अनुमोदन और स्थानीय सैंडबॉक्स
JetBrains के लिए Copilot 1.18.0
22 सितंबर — JetBrains IDE के लिए Copilot के संस्करण 1.18.0 में सार्वजनिक पूर्वावलोकन के रूप में सहायता प्राप्त अनुमोदन (assisted approvals) शुरू हुए हैं: एजेंट सत्रों में कम जोखिम वाले माने गए टूल कॉल अपने आप स्वीकृत होते हैं, जबकि अधिक जोखिम वाली कार्रवाइयों के लिए अब भी निर्णय चाहिए। पहले भेजे गए संदेश को फिर संपादित भी किया जा सकता है: नया निर्देश भेजने से पहले Copilot बातचीत और फ़ाइलों में हुए बदलावों को उस बिंदु तक वापस ले जाता है। JetBrains के Copilot में उपलब्ध Codex एजेंट को योजना मोड मिला है, ताकि कोई बदलाव करने से पहले उसके तरीके को पढ़ा, सुधारा या स्वीकृत किया जा सके। सत्रों में संगठन और उद्यम के skills तथा निर्देश भी स्वीकार किए जाते हैं। डिफ़ॉल्ट रूप से सक्रिय, अंतर्निहित GitHub MCP सर्वर को अब बंद किया जा सकता है। JetBrains IDE 2025.1 के उपयोगकर्ताओं को 2026.1 या उससे नए संस्करण पर जाने की सूचना मिलेगी।
🔗 JetBrains के लिए Copilot की नई सुविधाएँ
Copilot ऐप अपने स्थानीय सत्रों को सीमित करता है
23 सितंबर — GitHub के एजेंटों के लिए बने डेस्कटॉप ऐप GitHub Copilot में सार्वजनिक पूर्वावलोकन के रूप में स्थानीय सैंडबॉक्स जोड़ा गया है। इसे हर प्रोजेक्ट के लिए अलग कॉन्फ़िगर किया जाता है और यह सीमित करता है कि स्थानीय सत्र की कमांडें किन संसाधनों तक पहुँच सकती हैं: फ़ाइल सिस्टम (पढ़ने और लिखने योग्य, केवल पढ़ने योग्य या प्रतिबंधित फ़ोल्डर), नेटवर्क (इंटरनेट और स्थानीय नेटवर्क तक आउटबाउंड पहुँच) और क्रेडेंशियल (HTTPS पर Git, GitHub CLI)। उद्यम द्वारा प्रबंधित सेटिंग्स नीति को और सख़्त कर सकती हैं। अगर ऑपरेटिंग सिस्टम माँगी गई नीति लागू नहीं कर सकता, तो सैंडबॉक्स का शेल बिना सुरक्षा के चलने के बजाय त्रुटि दिखाकर रुक जाता है। डिफ़ॉल्ट रूप से बंद सैंडबॉक्स को प्रोजेक्ट के नए सत्रों के लिए या चल रहे सत्र में /sandbox on से चालू किया जा सकता है। यह क्लाउड सत्रों या दूरस्थ होस्ट पर लागू नहीं होता, और इसकी सेटिंग्स Copilot CLI की सेटिंग्स से अलग रहती हैं।
🔗 GitHub Copilot ऐप में स्थानीय सैंडबॉक्स
Cursor: प्रोडक्शन में तैनाती के लिए दो बॉट, 7 % कम टोकन
Rollouts और Security Review
23 सितंबर — Cursor ने कोड डिलीवरी के अंतिम चरण के लिए दो बॉट लॉन्च किए हैं, जो Teams और Enterprise योजनाओं पर उपलब्ध हैं। हर pull request खुलने पर Rollouts निगरानी की एक योजना प्रकाशित करता है—जोखिम, अपेक्षित प्रभाव और जाँचने योग्य संकेत। फिर हर डिप्लॉयमेंट के बाद वह इस योजना की तुलना लॉग, मेट्रिक्स और ट्रेस से करता है और हर वातावरण के लिए निष्कर्ष देता है: स्थिति ठीक है, रिग्रेशन मिला है या निष्कर्ष स्पष्ट नहीं है। रिग्रेशन मिलने पर वह संदिग्ध बदलाव की पहचान करता है और समीक्षा के लिए बदलाव वापस लेने वाली PR खोल सकता है; वह स्वयं कुछ मर्ज या वापस नहीं करता। Security Review हर pull request की जाँच करता है और दुरुपयोग की जा सकने वाली कमज़ोरियों—इंजेक्शन, प्रमाणीकरण को दरकिनार करने के तरीके, कोड में छूटे रहस्य, SSRF आदि—की सूचना देता है। हर कमज़ोरी के साथ उसकी गंभीरता, हमले का तरीका और प्रस्तावित सुधार दिया जाता है। 10 दिनों तक परीक्षण क्रेडिट से Teams पर लगभग 50 और Enterprise पर 500 बदलावों के लिए Rollouts आज़माया जा सकता है।
गुणवत्ता घटाए बिना टोकन लागत में 7 % की कमी
23 सितंबर — Cursor ने बताया कि उसने गुणवत्ता घटाए बिना उपयोगकर्ताओं के लिए अपने एजेंट की टोकन लागत 7 % कैसे कम की। नए मॉडलों को अब प्रतिबंधों की लंबी सूचियों की आवश्यकता नहीं होती, इसलिए सिस्टम प्रॉम्प्ट लगभग 66 % छोटा किया गया। इन कटौतियों की पुष्टि वास्तविक ट्रैफ़िक पर A/B परीक्षणों से हुई। एकीकृत टूल, जिनमें से अधिकांश का उपयोग 20 % से भी कम बातचीत में होता है, अब आवश्यकता पड़ने पर लोड किए जाते हैं।
| अनुकूलन का उपाय | Cursor द्वारा मापा गया प्रभाव |
|---|---|
| छोटा किया गया सिस्टम प्रॉम्प्ट | प्रॉम्प्ट का लगभग 66 % हटाया गया |
| आवश्यकता पड़ने पर लोड किए जाने वाले एकीकृत टूल | स्थिर कॉन्टेक्स्ट में विवरण के टोकन 60 % कम |
| स्पष्ट कैश ब्रेकपॉइंट | पहली बार कैश उपयोग में विफलताएँ 20 % कम |
| हर दस पंक्तियों पर एक पंक्ति संख्या | कैश से पढ़े गए टोकन 1,6 % कम |
| सभी बदलाव मिलाकर | उपयोगकर्ताओं के लिए टोकन लागत 7 % कम |
NVIDIA: ओपन डायरीकरण और AI Day Singapore
Nemotron 3 Diarization आठ वक्ताओं तक की पहचान करता है
23 सितंबर — NVIDIA ने Hugging Face पर Nemotron 3 Diarization जारी किया। यह 100 मिलियन पैरामीटर वाला ओपन वेट मॉडल बातचीत में यह निर्धारित करता है कि कौन कब बोल रहा है, यहाँ तक कि जब आवाज़ें एक साथ सुनाई दें। यह आठ वक्ताओं तक को ट्रैक करता है, जबकि इसका पूर्ववर्ती Streaming Sortformer चार को ट्रैक करता था। यह रिकॉर्ड की गई बातचीत और लाइव स्ट्रीम, दोनों पर काम करता है; इसकी बफ़र विलंबता 30,4 से 0,32 सेकंड तक समायोजित की जा सकती है। यह बोले गए शब्दों का लिप्यंतरण नहीं करता: यह हर वक्ता के बोलने की समय सीमाएँ देता है, जिन्हें लिप्यंतरण मॉडल के साथ इस्तेमाल किया जा सकता है। VoiceArena के Diarization-Bench के शुरुआती नतीजों में यह 12 सिस्टमों में पहले स्थान पर है। इसकी डायरीकरण त्रुटि 14,72 % है, जबकि अगले सिस्टम की 19,3 % है; NVIDIA के अनुसार यह शुरुआती रैंकिंग आगे बदल सकती है। पुराने मॉडल की तुलना में आठ मूल्यांकन डेटासेट पर इसकी त्रुटि औसतन 41 % कम है, हालाँकि CALLHOME में दो वक्ताओं वाली बातचीत पर प्रदर्शन थोड़ा घटा है। लाइसेंस OpenMDW 1.1 है।
| प्रकाशित माप | Nemotron 3 Diarization | पिछला मॉडल |
|---|---|---|
| ट्रैक किए जा सकने वाले वक्ताओं की अधिकतम संख्या | 8 | 4 |
| 30,4 s पर प्रवाह दर (32 के बैच, RTX PRO 5000) | वास्तविक समय से 15 113 गुना | 2 619 गुना |
| 30,4 s पर DIHARD III त्रुटि | 12,73 % | 19,09 % |
🔗 Hugging Face ब्लॉग पर Nemotron 3 Diarization
AI Day Singapore: दक्षिण-पूर्व एशिया में Vera Rubin और Nemotron
22 सितंबर — NVIDIA ने 22 तारीख को 19:30 PT पर, अपने AI Day Singapore (22 और 23 सितंबर) के दौरान प्रकाशित लेख में, Shopee, Garena और Monee की मूल कंपनी Sea Limited को ASEAN क्षेत्र की पहली ऐसी कंपनी बताया जिसने बड़े पैमाने पर मॉडल और एजेंट विकसित तथा डिप्लॉय करने के लिए उसका Vera Rubin प्लेटफ़ॉर्म अपनाया है। लेख के बाकी हिस्से में स्थानीय ज़रूरतों के अनुसार ढाले गए ओपन Nemotron मॉडल दिखाए गए हैं: AI Singapore क्षेत्रीय भाषाओं के लिए बने अपने SEA-LION परिवार में Nemotron मॉडल जोड़ रहा है; वियतनाम में Viettel AI ने Nemotron 3 Super को वियतनामी भाषा के लिए फ़ाइन-ट्यून किया है और वह VMLU बेंचमार्क में शीर्ष पर है; थाईलैंड में iApp Technology ने Nemotron 3 Nano को थाई कानून के लिए OpenThai 2.0 Legal के रूप में अनुकूलित किया है। यह ओपन सोर्स मॉडल कानूनी चैटबॉट Thanoy को चलाता है, जिसके लगभग 43 000 उपयोगकर्ता हैं।
🔗 AI Day Singapore में NVIDIA और साझेदारों ने दक्षिण-पूर्व एशिया में AI की प्रगति दिखाई
बिना व्यवधान के AI को उत्पादन में लाना
इन दो घोषणाओं का साझा विचार है: ट्रैफ़िक बदलने या मशीनें अपडेट करने से पहले वास्तविक वर्कलोड पर जाँच करना।
Together AI के कैनरी डिप्लॉयमेंट
22 सितंबर — Together AI ने अपनी Dedicated Model Inference सेवा के क्रमिक डिप्लॉयमेंट का विवरण दिया, जो 15 सितंबर के अपडेट से उपलब्ध हैं। इनके ज़रिए बिना सेवा बाधित किए या URL बदले, किसी एंडपॉइंट के पीछे चल रहा मॉडल बदला जा सकता है। तीन रणनीतियाँ उपलब्ध हैं: कैनरी में नए मॉडल का ट्रैफ़िक चरणों में बढ़ता है (डिफ़ॉल्ट रूप से 5 %, 25 %, 50 % और फिर 100 %); ब्लू-ग्रीन में सारा ट्रैफ़िक एक साथ बदला जाता है; और क्रमिक प्रतिस्थापन में रेप्लिका एक-एक करके बदले जाते हैं। कैनरी के हर चरण के बाद एक जाँच नए मॉडल की विलंबता या त्रुटि दर की पुराने मॉडल से तुलना करती है और प्रदर्शन बिगड़ने पर डिप्लॉयमेंट रोक देती है। प्रकाशित डेमो में Qwen2.5-7B से Qwen3.5-9B पर बदलाव 10 % ट्रैफ़िक पहुँचते ही रोक दिया गया, क्योंकि p95 विलंबता 137 % बढ़ गई थी (1 740 ms बनाम 734 ms)। पुराने मॉडल पर लौटते समय पूरी की गई 6 800 रिक्वेस्ट में से कोई भी विफल नहीं हुई।
🔗 कैनरी डिप्लॉयमेंट: बिना डाउनटाइम के उत्पादन में मॉडल अपग्रेड करें
NVIDIA के NVCRE और NodeWright
23 सितंबर — NVIDIA ने Kubernetes पर GPU क्लस्टरों के लिए अपने AI फ़ैक्टरी प्लेटफ़ॉर्म की सॉफ़्टवेयर परत DSX OS के दो ओपन सोर्स प्रोजेक्ट (Apache 2.0) का विवरण दिया। NVIDIA Cluster Readiness Engine (NVCRE) इस समस्या से शुरू होता है: कोई क्लस्टर सभी स्वास्थ्य जाँच पास कर सकता है, फिर भी वितरित प्रशिक्षण में विफल हो सकता है। इसलिए यह टोपोलॉजी के आधार पर चुने गए नोड समूहों पर वास्तविक वर्कलोड—NCCL संचार परीक्षण, DCGM डायग्नोस्टिक्स और NeMo प्रीट्रेनिंग—चलाकर क्लस्टर की तैयारी प्रमाणित करता है। यह दोषपूर्ण नोडों की पहचान करता है और डायग्नोस्टिक मोड में विफल समूहों को आधा-आधा बाँटता है, जब तक संदिग्ध नोड अलग न हो जाएँ। लेख में इन वर्कलोड के बीच 8 और 56 अरब पैरामीटर वाले Nemotron 5 मॉडलों का उल्लेख है, पर और विवरण नहीं दिया गया है। NodeWright, जिसे पहले Skyhook कहा जाता था और जिसे NVIDIA उत्पादन में इस्तेमाल करता है, सुरक्षित रखे गए कार्यों के पूरा होने की प्रतीक्षा करके नोडों का सिस्टम अपडेट करता है—कर्नेल सेटिंग, सुरक्षा एजेंट और कमज़ोरियों के सुधार। अपडेट निश्चित आकार की, रैखिक या घातीय लहरों में होते हैं और बहुत अधिक बैच विफल होने पर अपने आप रुक जाते हैं।
🔗 AI वर्कलोड शुरू होने से पहले GPU क्लस्टर की तैयारी जाँचें · NodeWright
दो ओपन डेटासेट: कई वक्ताओं की बातचीत और वैज्ञानिक कॉर्पस
Basis Conversations 1500
23 सितंबर — Basis ने Hugging Face पर Basis Conversations 1500 जारी किया: 33 देशों के 2 645 लोगों के बीच 1 502 घंटे की स्वतःस्फूर्त बातचीत, 22 भाषाओं में, अंग्रेज़ी से लेकर मिंग्रेलियन और खोसा तक। हर बातचीत में दो से चार लोग शामिल हैं और प्रत्येक की आवाज़ उसकी अपनी सिंक्रनाइज़ रिकॉर्डिंग ट्रैक (FLAC 48 kHz) पर है। इससे एक साथ बोलने, बीच में टोकने और बोलने की बारी का अध्ययन किया जा सकता है—टीम के अनुसार मॉडल अब भी इन स्थितियों में अटकते हैं। लगभग 100 घंटों को मनुष्यों ने विस्तार से एनोटेट किया है (113 096 निर्णय): सहानुभूतिपूर्ण या खीझ भरी मौखिक प्रतिक्रिया, असहज चुप्पी, और सहयोगी या प्रतिस्पर्धी ढंग से एक साथ बोलना। उपलब्ध लिप्यंतरण स्वचालित हैं और जाँच के बिना प्रशिक्षण लक्ष्य के रूप में इस्तेमाल नहीं किए जाने चाहिए। लेख डेटासेट को व्यावसायिक और शोध उपयोग के लिए मुक्त बताता है, लेकिन यह Basis के अपने लाइसेंस (basis-data-license-1.0) के अधीन है और इसकी पहुँच मैन्युअल रूप से स्वीकृत की जाती है।
QVAC Genesis III
23 सितंबर — Tether AI Research ने QVAC Genesis III जारी किया, जो विज्ञान, प्रौद्योगिकी, इंजीनियरिंग और गणित में छोटे मॉडलों की प्रीट्रेनिंग के लिए बनाए गए उसके सिंथेटिक कॉर्पस का तीसरा भाग है। इसमें 43,06 अरब और टोकन जुड़ने से पूरा संग्रह 191,43 अरब टोकन और 19 क्षेत्रों के लगभग 160 मिलियन दस्तावेज़ों तक पहुँच गया है; इसके साथ प्रकाशित शोधपत्र COLM 2026 सम्मेलन में स्वीकार किया गया है। इस पद्धति में एक छोटे छात्र मॉडल, Qwen3-1.7B-Base, से प्रश्न पूछे जाते हैं: गलत उत्तर से सुधार समझाने वाला विवरण बनता है और सही उत्तर से हर उत्तर विकल्प का विश्लेषण। इस कॉर्पस पर शुरू से प्रशिक्षित 1,7 अरब पैरामीटर वाला मॉडल, समान टोकन बजट पर Cosmopedia-v2 से प्रशिक्षित उसी मॉडल की तुलना में स्पष्ट रूप से बेहतर प्रदर्शन करता है। कॉर्पस गैर-व्यावसायिक लाइसेंस (CC-BY-NC 4.0) के तहत प्रकाशित है और इस पर प्रशिक्षित एक मॉडल Apache 2.0 के तहत जारी करने की घोषणा की गई है।
| मूल्यांकित बेंचमार्क | Cosmopedia-v2 की तुलना में बढ़त (समान टोकन बजट) |
|---|---|
| ARC-Easy | +28,57 अंक |
| ARC-Challenge | +21,35 अंक |
| GPQA Diamond | +2,52 अंक |
| MMLU STEM | +15,03 अंक |
जलवायु और खाद्य उत्पादन के लिए AI
Ai2 और Global Fishing Watch एजेंटों से महासागरों की निगरानी करेंगे
23 सितंबर — न्यूयॉर्क के Climate Week में Ai2 और Global Fishing Watch ने महासागरों की निगरानी और मत्स्य पालन पर नियंत्रण में AI, विशेष रूप से एजेंटों, का उपयोग बढ़ाने के लिए साझेदारी की घोषणा की। दोनों संगठन पहले से साथ काम कर रहे थे; अब वे संयुक्त रूप से विकास करेंगे: एक साझा पहचान पाइपलाइन, उपग्रह चित्रों के लिए नए रीयल-टाइम विज़न मॉडल और कई डेटा स्रोतों को मिलाकर काम करने वाले एजेंट। Global Fishing Watch को Ai2 का ओपन मॉडलों पर आधारित पृथ्वी अवलोकन प्लेटफ़ॉर्म OlmoEarth मिलेगा, ताकि वह अपने डेटा को एनोटेट कर सके और अपने मॉडल प्रशिक्षित कर सके। Skylight की रीयल-टाइम जहाज़ पहचान उसके समुद्री संरक्षित क्षेत्रों के प्रबंधकों वाले पोर्टल में उपलब्ध होगी। दोनों टीमें Shippy जैसे एजेंट भी आगे विकसित करेंगी, जिससे विश्लेषक किसी जहाज़ का इतिहास पूछ सकता है। घोषणा में कोई समय-सीमा या धनराशि नहीं बताई गई।
🔗 Ai2 और Global Fishing Watch महासागरों की निगरानी में AI एजेंट लाने के लिए एकजुट हुए
Google.org और Gates Foundation: 200 मिलियन छोटे किसानों के लिए
18 और 22 सितंबर — पिछली खबर: Google.org और Gates Foundation ने उप-सहारा अफ़्रीका और दक्षिण एशिया के 200 मिलियन छोटे किसानों तक जलवायु, कृषि और भाषाओं से जुड़े AI टूल पहुँचाने की अपनी साझा पहल का विस्तार किया है। शुरुआत में लक्ष्य 50 मिलियन किसानों का था। दोनों साझेदार इसके लिए कुल 100 मिलियन डॉलर दे रहे हैं, साथ ही Google के शोधकर्ताओं और इंजीनियरों का तकनीकी सहयोग भी मिलेगा। Gates Foundation की प्रेस विज्ञप्ति 18 सितंबर की है; blog.google ने इसे 22 सितंबर की शाम प्रकाशित किया। कार्यक्रम भारत में Wadhwani AI और Digital Green जैसे स्थानीय संगठनों को वित्त देता है, TomorrowNow जलवायु प्लेटफ़ॉर्म में AI पूर्वानुमान जोड़ता है, एक मीटर से कम रिज़ॉल्यूशन पर खेतों का मानचित्र बनाता है और 40 से अधिक अफ़्रीकी भाषाओं में ओपन वॉइस तथा टेक्स्ट डेटासेट को सहायता देता है। छोटे किसान दुनिया के लगभग 35 % भोजन का उत्पादन करते हैं।
🔗 Google.org की घोषणा · Gates Foundation की प्रेस विज्ञप्ति
संक्षिप्त समाचार
- Anthropic और कोड का आधुनिकीकरण — « Notes from the Field » शृंखला में ग्राहकों के साथ काम कर रहे Anthropic के दो इंजीनियर, Jonah Ezekiel और Lexie Tonelli, एजेंटों की मदद से कोड का आधुनिकीकरण शुरू करने से पहले छह चरण सुझाते हैं: लक्ष्य तय करना, परीक्षणों का « प्रमाणपत्र » तैयार करना, चरणबद्ध मानवीय समीक्षा, आवश्यक पूर्वशर्तें, एजेंटों का कार्यप्रवाह और फिर शुरुआत। वे लागत का कोई आँकड़ा नहीं देते; इसे पायलट परियोजना में मापने की सलाह देते हैं। 🔗 स्रोत
- Boris Cherny ने Claude Agent SDK का Lean में सत्यापन कराया — 22 तारीख की शाम Boris Cherny (Claude Code) ने बताया कि उन्होंने प्रमाण सहायक Lean के साथ Opus 5.5 से Claude Agent SDK का औपचारिक सत्यापन कराया। कुछ छोटे prompts से 16 pull requests बनीं, जिन्होंने bugs और समवर्ती प्रक्रियाओं से जुड़ी समस्याएँ ठीक कीं। वे TLA+ का भी उपयोग करते हैं। 🔗 स्रोत
- Codex CLI 0.156.1 — संस्करण 0.156.0 का यह सुधार CLI के मॉडल चयनकर्ता में GPT-6 Sol और GPT-6 Luna जोड़ता है। दर सीमा आने पर दिखने वाला संदेश अब Luna की सिफारिश करता है, और GPT-5.5 तथा GPT-5.6 से स्थानांतरण के विकल्प भी देता है। 🔗 स्रोत
- Airbnb और GPT-6 Astra — एक नए समझौते से Airbnb की इंजीनियरिंग और उत्पाद टीमों को OpenAI के मॉडलों, जिनमें GPT-6 Astra शामिल है, तक OpenAI API और Amazon Bedrock के माध्यम से अधिक पहुँच मिलेगी। उसके तकनीकी निदेशक Ahmad Al-Dahle का कहना है कि उनकी टीमें एक साल पहले की तुलना में लगभग 80 % अधिक सुविधाएँ उपलब्ध करा रही हैं; समझौते की राशि नहीं बताई गई है। 🔗 स्रोत
- OpenAI Academy के दो साल — सितंबर 2024 से अब तक 250 से अधिक आयोजन हुए हैं और 40 लाख से अधिक लोगों तक पहुँच बनी है। OpenAI एक सामुदायिक प्रशिक्षक कार्यक्रम (Community Trainer Program) का परीक्षण कर रहा है, जिसमें भागीदार संगठनों के कर्मचारियों को मूल्यांकन के बाद कार्यशालाएँ संचालित करना सिखाया जाता है। 🔗 स्रोत
- LED डिस्प्ले से बना वॉइस असिस्टेंट — OpenAI Developers ब्लॉग पर Sid Rampally बताते हैं कि Codex ने Raspberry Pi से नियंत्रित 128 × 64 पिक्सेल के LED पैनल की वायरिंग और प्रोग्रामिंग में उनकी कैसे मदद की। GPT-Live-1 बातचीत संभालता है और Responses API के ज़रिए खोज तथा डिस्प्ले के काम GPT-5.6 Luna को सौंपता है। 🔗 स्रोत
- MedGemma के डाउनलोड 1 करोड़ से अधिक — Google अपने खुले चिकित्सा मॉडलों के वास्तविक उपयोगों का ब्यौरा देता है: ज़ाम्बिया में 3 500 से अधिक महिलाओं की गर्भाशय ग्रीवा के कैंसर की जाँच, दिल्ली के AIIMS अस्पताल में पायलट परियोजनाएँ और इंडोनेशिया में तपेदिक की पहचान। Google याद दिलाता है कि इनके परिणामों को सीधे निदान का आधार नहीं बनाना चाहिए। 🔗 स्रोत
- Google Docs में Gemini Notebook — Docs में @ टाइप करके किसी notebook को स्रोत के रूप में उद्धृत किया जा सकता है। Gemini अपने लिखे पाठ को उसके स्रोतों पर आधारित रखता है, पाठ के भीतर उद्धरण देता है और Workspace Intelligence के माध्यम से उन्हें ईमेल तथा फ़ाइलों के साथ जोड़ता है। यह Business Standard और Plus, Enterprise Standard और Plus, Education Plus तथा Google AI Pro और Ultra के ग्राहकों के लिए उपलब्ध है। 🔗 स्रोत
- Google Flow के छह टूल — Google Labs ने रचनाकारों द्वारा Google Flow Tools से बनाए गए छह टूल प्रकाशित किए हैं: Mondo Sónico (समय के साथ मेल खाते ध्वनि प्रभाव), CaptionCast (एनिमेटेड उपशीर्षक), ThumbnailForge (थंबनेल), Surface (3D सतहों पर टेक्सचर), CollageMotion Pro और SwissFlow Studio (मोशन डिज़ाइन)। हर टूल की प्रति बनाकर उसे नए रूप में ढाला जा सकता है। 🔗 स्रोत
- Google Beam की फ़्रांस में आपूर्ति शुरू — आमने-सामने की मौजूदगी जैसा अनुभव देने के उद्देश्य से बनाया गया Google का वीडियो संचार प्लेटफ़ॉर्म Beam, जिसे HP के साथ बेचा जाता है, अब फ़्रांस सहित छह देशों में उपलब्ध कराया जा रहा है; इसके 18 साझेदार हैं। एक आंतरिक अध्ययन के अनुसार, टीमों में जुड़ाव 50 % अधिक हुआ और अनुवर्ती बैठकों की संख्या 21 % कम हुई। 🔗 स्रोत
- Android Enterprise और Gemini एजेंट — Gemini स्क्रीन पर दिख रहे संदर्भ के आधार पर कई ऐप्स में लगातार काम कर सकता है। सुरक्षा नियंत्रण निजी एजेंटों को कार्य प्रोफ़ाइल तक पहुँचने से रोकते हैं; प्रशासक अपने सभी उपकरणों पर AI स्वचालन को सीमित या बंद कर सकते हैं। 🔗 स्रोत
- AI Brief अब फ़्रेंच में — Google Ads के AI Max अभियानों को उपयोगकर्ता के अपने शब्दों के आधार पर दिशा देने वाले AI Brief का सीमित बीटा अब फ़्रेंच, डच, जर्मन, इतालवी, जापानी, पुर्तगाली और स्पेनिश भाषाओं के लिए खुल रहा है। 🔗 स्रोत
- Gemini CLI का 23 सितंबर वाला nightly संस्करण — यह केवल nightly संस्करण है, स्थिर संस्करण नहीं। इसमें Gemini 3.8 Flash और Gemini 3.5 Flash Lite जोड़े गए हैं, जिन्हें API key, Vertex AI या गेटवे से तुरंत इस्तेमाल किया जा सकता है; Google खाते से उपयोग के लिए प्रायोगिक सेटिंग चालू करनी होगी। मंगलवार 22 तारीख को कोई स्थिर संस्करण जारी नहीं हुआ। 🔗 स्रोत
- EcoHash ने अपने वीडियो अनुकूलन मापे — 96 GB की RTX PRO 6000 पर EcoHash ने MiniMax H3 वीडियो का समय 174,8 से घटाकर 40,8 सेकंड और Wan2.2 में टेक्स्ट से वीडियो बनाने का समय 132,3 से घटाकर 10,7 सेकंड किया। इसके लिए 4 चरणों में डिस्टिल की गई LoRA इस्तेमाल हुई; आज़माई गई दस सेटिंग्स में से तीन, जिनमें दोनों कंपाइलेशन मोड शामिल थे, कोई बदलाव नहीं ला सकीं। 🔗 स्रोत
- क्रीमियाई तातार के परीक्षण में त्रुटि पकड़ी गई — क्रीमियाई तातार के लिए वाक् पहचान मॉडल बनाने वाले डेवलपर को पता चला कि उनके डेटासेट में चार ऑडियोबुक दो बार मौजूद थीं: मुख्य परीक्षण के 96,9 % अंशों का एक समान अंश प्रशिक्षण डेटा में था। इसे ठीक करने, LoRA से मॉडल को और प्रशिक्षित करने तथा डिकोडर समायोजित करने के बाद प्रति शब्द त्रुटि दर 0,3463 से घटकर 0,1701 हो गई। 🔗 स्रोत
- Falcon-H1 और mlx-lm — mlx-lm 0.31.3 में KV cache के बिना प्रशिक्षण के दौरान Falcon-H1 की 66 परतों में से केवल पहली परत चलती है। इसके चलते किसी भी LoRA का प्रशिक्षण एक परत वाले मॉडल पर बिना त्रुटि या चेतावनी के हो जाता है। सुधार के लिए कोड की एक पंक्ति पर्याप्त है और एक issue दर्ज किया गया है। 🔗 स्रोत
- एजेंट और ओपन सोर्स योगदान — Quentin Gallouédec (Hugging Face) का मानना है कि एजेंटों के बनाए योगदान वास्तविक ज़रूरत का संकेत धुंधला करते हैं और रखरखाव करने वालों का समीक्षा समय लेते हैं। वे कहते हैं कि बेतरतीब चुनी परियोजनाओं पर एजेंट लगाने बंद किए जाएँ और पहले उस परियोजना का उपयोग किया जाए। 🔗 स्रोत
- IETF में Phionyx — Phionyx के लेखक ने Claim-Preserving Exchange of AI Evaluation Evidence शीर्षक से एक व्यक्तिगत मसौदा जमा किया है, ताकि मूल्यांकन के नतीजे एक प्रणाली से दूसरी प्रणाली में जाते समय अपनी शर्तें और सीमाएँ साथ रखें। इस पाठ को किसी कार्य समूह ने नहीं अपनाया है। 🔗 स्रोत
- Kimi Work 3.2.12 — Moonshot का डेस्कटॉप एजेंट PPT, Excel, Word या Markdown फ़ाइल में चुने गए हिस्से को सटीक रूप से बदल सकता है। संलग्न फ़ाइलों की आकार सीमा भी हटा दी गई है। 🔗 स्रोत
- खुले मॉडलों में Qwen-Image-2.1 शीर्ष पर — Arena के अनुसार, Qwen-Image-2.1 छवि संपादन में पहला खुला मॉडल बन गया है (1 367 अंक, समग्र सूची में 16वाँ) और टेक्स्ट से छवि बनाने में भी पहला है (1 228 अंक, समग्र सूची में 17वाँ)। 🔗 स्रोत
- Copilot ऐप में OpenTelemetry — प्रशासक GitHub Copilot ऐप के एजेंट सत्रों के traces (मॉडल को भेजे गए अनुरोध और इस्तेमाल किए गए टूल) को
managed-settings.jsonकीtelemetryप्रॉपर्टी के माध्यम से अपने निगरानी टूल में निर्यात कर सकते हैं। prompts और जवाबों की सामग्री डिफ़ॉल्ट रूप से बाहर रखी जाती है। 🔗 स्रोत - Copilot CLI और C++ — Copilot CLI का Microsoft C++ Language Server अब पूरे प्रोजेक्ट के symbols की स्थायी index बनाता है; यह डिफ़ॉल्ट रूप से चालू है। पहली बार index बनाने में समय और अधिक मेमोरी लग सकती है, और GitHub ने लाभ का कोई आँकड़ा नहीं दिया है। 🔗 स्रोत
- दस लाख पंक्तियों वाली pull request — GitHub की एक इंजीनियरिंग पोस्ट बताती है कि Copilot ऐप 2 200 फ़ाइलों, दस लाख से अधिक पंक्तियों और 400 से अधिक टिप्पणियों वाली pull request कैसे दिखाता है: कोड की ज्यामिति पहले से गणना की जाती है, जबकि टिप्पणियों की ज्यामिति दृश्य क्षेत्र के पास मापी जाती है। 🔗 स्रोत
- Genspark ने Opus 5.5, GPT-6 और Grok 4.7 जोड़े — 23 तारीख की रात Genspark ने AI Chat, Code Agent और Claw में Claude Opus 5.5, Grok 4.7, GPT-6 Sol और GPT-6 Luna उपलब्ध कराए। घोषणा में मॉडल निर्माताओं के दावे दोहराए गए हैं; किसी योजना या कीमत का विवरण नहीं दिया गया है। 🔗 स्रोत
- GitHub और Yale का सर्वेक्षण — अमेरिका में GitHub के 1 039 उपयोगकर्ताओं में 71 % ने कहा कि वे AI के पर्यावरणीय प्रभाव को लेकर चिंतित हैं, और दस में से आठ अधिक ऊर्जा कुशल कोड लिखने के टूल चाहते हैं। GitHub स्पष्ट करता है कि मार्केटिंग संदेश प्राप्त करने की सहमति देने वालों से लिया गया यह नमूना प्रतिनिधिक नहीं है। 🔗 स्रोत
- Zed 1.21.0 — स्थिर संस्करण अपनी API key के साथ Claude Opus 5.5 और GPT-6 Astra, Sol तथा Luna का उपयोग उपलब्ध कराता है, Agent पैनल में SuperGrok से जुड़ने का विकल्प जोड़ता है और एजेंट के काम करते समय मशीन को डिफ़ॉल्ट रूप से स्लीप मोड में जाने से रोकता है। 🔗 स्रोत
- Warp — GPT-6 Sol और Luna, फिर Claude Opus 5.5, Warp टर्मिनल और Warp Agent CLI में उपलब्ध हो रहे हैं। अपना Grok सदस्यता खाता जोड़ने वालों को Grok 4.7 भी मिलेगा। यह उपलब्धता की घोषणा है; कीमत नहीं बताई गई है। 🔗 स्रोत
- Microsoft Teams में Devin — पहले केवल चैनलों तक सीमित Devin अब सीधे संदेशों और समूह चर्चाओं में भी जवाब देता है, चैनल से Automations शुरू करता है और प्रश्न या स्वीकृति के कार्ड भेजता है। ऐप कोई नई अनुमति नहीं माँगता। 🔗 स्रोत
- Scribe v2 Medical — 11 सितंबर से उपलब्ध ElevenLabs के क्लिनिकल ट्रांसक्रिप्शन मॉडल की अब आधिकारिक घोषणा हुई है, जिसमें एक नया आँकड़ा दिया गया है: क्लिनिकल ऑडियो पर Scribe v2 की तुलना में शब्द संबंधी त्रुटियाँ 35 % कम हैं। इसकी कीमत 0,22 डॉलर प्रति घंटा से शुरू होती है। 🔗 स्रोत
- ElevenLabs से Sora 2 की विदाई — ElevenLabs अपने स्टूडियो से Sora 2 और Sora 2 Pro हटा रहा है, क्योंकि OpenAI 24 सितंबर को Sora API बंद कर रहा है। OpenAI ने 24 मार्च को इस समयसीमा की घोषणा की थी। प्रभावित कार्यप्रवाहों को Gemini Omni 1.1 Flash जैसे किसी अन्य वीडियो मॉडल पर जाना होगा। 🔗 स्रोत
- कनाडा में Cohere Model Vault — Cohere ने बताया है कि उसका एकल ग्राहक के लिए समर्पित अनुमान प्लेटफ़ॉर्म Model Vault कनाडा में उपलब्ध है। उसने क्लाउड क्षेत्र, प्रदाता या कीमत नहीं बताई है; उत्पाद पृष्ठ पर भी अभी कनाडा का उल्लेख नहीं है। 🔗 स्रोत
- Cohere और बदलाव का प्रबंधन — Katherine Correia (Cohere) की एक पोस्ट AI को केवल एक टूल के बजाय एक सहभागी के रूप में शामिल करने, कार्यों को सत्यापित किए जा सकने वाले, निर्णय आधारित या मिश्रित वर्गों में बाँटने और उपयोग के मामले के अनुसार संचालन करने की सलाह देती है। इसमें किसी उत्पाद या आँकड़े की घोषणा नहीं है। 🔗 स्रोत
इसका क्या अर्थ है
Anthropic का परिणाम कोड एजेंटों को बुनियादी जीवविज्ञान तक ले जाता है। लगभग 950 Claude एजेंटों ने 21 घंटों में 200 000 से अधिक रिवर्स ट्रांसक्रिप्टेस की छँटाई की। मनुष्यों ने केवल शुरुआत में एक prompt देकर और अंत में प्रयोगों के लिए हस्तक्षेप किया। अब मुख्य चुनौती परिकल्पनाओं की छँटाई है, जिसे Anthropic स्वयं एक शोध विषय के रूप में अध्ययन कर रहा है। सावधानी ज़रूरी है: ART का कार्य अज्ञात है और परिणाम फिलहाल प्रीप्रिंट के रूप में है। बड़ी संख्या में एजेंट चलाकर उनके काम को मापों के आधार पर दिशा देने का यही तरीका claude.ai को तेज़ बनाने वाले स्प्रिंट में भी दिखता है, जिसमें 3 000 से अधिक बदलाव हुए, और Lean में Claude Agent SDK के औपचारिक सत्यापन में भी।
एजेंटों के sandbox की सुरक्षा अब सार्वजनिक चर्चा का विषय बन रही है। Perplexity का ऑडिट दो सुरक्षा सीमाओं को अलग करता है: वर्चुअल मशीन का अलगाव सभी 108 परीक्षणों में कायम रहा; नेटवर्क फ़िल्टरिंग 54 में से 11 बार ऐसे मॉडलों के सामने विफल हुई जिन्होंने ठीक से सत्यापित न किए गए DNS या CDN के साझा पतों का उपयोग किया; और दस में से आठ तृतीय पक्ष प्लेटफ़ॉर्म पर कम से कम एक रास्ते से सुरक्षा को दरकिनार किया जा सकता था। Fable और GPT-6 Astra, इन दो मॉडलों ने यह अभ्यास करने से इनकार कर दिया। उसी दिन GitHub Copilot ऐप ने एक स्थानीय sandbox उपलब्ध कराया जो सुरक्षा के बिना चलने के बजाय विफल हो जाता है; Claude Code का auto मोड केवल पढ़ने वाले commands को भी classifier के पास भेजता है; और Vibe CLI तथा Kimi Code ने अनुमति जाँच को दरकिनार करने के रास्ते बंद किए। इससे दो दिन पहले ZCode ने अपने समुदाय द्वारा बताई गई समस्याओं के बाद अपना कोड सार्वजनिक किया था।
आवाज़ काम करवाने का माध्यम बन रही है। Gemini 3.8 Flash TTS और Flash-Lite TTS का ऑडियो आउटपुट पिछले पूर्वावलोकन संस्करण से आधे से भी कम कीमत पर मिलता है (2026 के अंत तक प्रति दस लाख tokens पर 9 और 6 डॉलर, जबकि पहले 20 डॉलर थे)। इनमें रिकॉर्ड की गई सहमति के आधार पर वॉइस क्लोनिंग भी जोड़ी गई है, जो AI Studio के ज़रिए यूरोपीय आर्थिक क्षेत्र में उपलब्ध नहीं है। Qwen ने अपने ऑडियो उत्पाद समूह की कीमतों में 70 से 95 % कटौती की घोषणा की है, NVIDIA ने आठ वक्ताओं को अलग पहचानने वाला मॉडल उपलब्ध कराया है, और Basis ने एक साथ बोलती आवाज़ों वाली 1 500 घंटे की बातचीत प्रकाशित की है। दूसरी ओर, ChatGPT Voice बातचीत से आगे बढ़कर ChatGPT Work के plugins और tasks की मदद से काम करने लगा है।
अंत में, भौतिक दुनिया में काम करने वाली AI के संसाधन अधिक खुले हो रहे हैं, लेकिन उनकी शर्तें अलग-अलग हैं। FLUX 3 Action का 7 अरब पैरामीटर वाला मॉडल RoboLab-120 में शीर्ष पर है। इसे NVIDIA के साथ LeRobot में जोड़ा गया है और यह दिखाता है कि तेज़ तथा भरोसेमंद नीति महँगे तर्क की ज़रूरत घटाती है: GPT-6 Astra को पर्यवेक्षक बनाकर प्रति सफलता 8,77 डॉलर की लागत आती है, जबकि अकेले Astra के साथ 13,47 डॉलर। लेकिन « खुला » होने के अलग-अलग अर्थ हैं: FLUX 3 Action और Basis Conversations 1500 के अपने लाइसेंस हैं, QVAC Genesis III का लाइसेंस गैर-व्यावसायिक है, और Qwen Intelligence ने मॉडल के weights के बिना benchmarks प्रकाशित किए हैं। इन संसाधनों का पुनः उपयोग करने वालों के लिए लाइसेंस उतना ही मायने रखता है जितना स्कोर।
स्रोत
- Claude ने CRISPR जैसे दोहराव वाली एक नई एंज़ाइम प्रणाली खोजी (Anthropic)
- ART प्रीप्रिंट (PDF, Anthropic)
- @AnthropicAI: Claude द्वारा खोजी गई एंज़ाइम प्रणाली
- Gemini 3.8 Flash TTS और Flash-Lite TTS (Google)
- Gemini API के संस्करण नोट्स, 22 सितंबर
- Gemini API की कीमतें
- FLUX 3 Action (Black Forest Labs)
- @bfl_ai: FLUX 3 Action का लॉन्च
- Hugging Face पर FLUX 3 Action संग्रह
- SPACE से बाहर निकलना, भाग I (Perplexity)
- Claude Code v2.1.281
- हमने दो हफ़्तों में claude.ai को तीन गुना तेज़ कैसे बनाया (claude.dev)
- Claude Marketplace (Anthropic)
- @OpenAI: प्लगइन्स के साथ और ChatGPT Work में ChatGPT Voice
- ChatGPT Voice का सहायता लेख
- ChatGPT के संस्करण नोट्स
- MentalHealthBench का परिचय (OpenAI)
- SWE-Serve (NVIDIA)
- NVIDIA/swe-serve रिपॉज़िटरी
- Runway अब DaVinci Resolve में उपलब्ध है
- Google Vids में Gemini Omni 1.1 Flash
- Made On YouTube 2026
- Made On YouTube 2026 का सारांश (Google)
- Gemini के नए कनेक्टेड ऐप्स
- @GeminiApp: 13 नए कनेक्टेड ऐप्स
- @Muse: जल्द आने वाले चार कनेक्टर
- @ElevenLabs: ElevenLabs, Muse में आ रहा है
- @HeyGen: HeyGen, Muse से जुड़ रहा है
- @grok: Tesla कारों में Grok Bot
- @Tesla: Grok और कनेक्टर
- @bot: Google Slides, Sheets और Docs से जुड़ा Grok Bot
- Antigravity SDK में स्थानीय मॉडल (Google Developers)
- Antigravity का परिवर्तन लॉग
- Private AI Compute के लिए स्थायी मेमोरी (Google DeepMind)
- @Alibaba_Qwen: Qwen Intelligence
- Qwen-Planner-Agent रिपोर्ट
- @Alibaba_Qwen: Qwen-Audio-3.1
- QwenCloud पर Qwen-Audio-3.1-Realtime
- Mistral के संस्करण नोट्स
- Vibe CLI 2.25.8
- @zcode_ai: ZCode का स्रोत कोड जारी
- zai-org/ZCode रिपॉज़िटरी
- Kimi Code 2.1.0
- DeepSeek Harness v0.1.7-rc.1
- GenCode (Genspark)
- @genspark_ai: GenCode का लॉन्च
- JetBrains के लिए Copilot 1.18.0 (GitHub परिवर्तन लॉग)
- GitHub Copilot ऐप में स्थानीय सैंडबॉक्स (GitHub परिवर्तन लॉग)
- रोलआउट और सुरक्षा समीक्षा (Cursor परिवर्तन लॉग)
- बेहतर टोकन दक्षता (Cursor)
- Nemotron 3 Diarization (NVIDIA, Hugging Face ब्लॉग)
- AI Day Singapore (NVIDIA)
- कैनरी रोलआउट (Together AI)
- NVIDIA Cluster Readiness Engine (NVIDIA)
- NodeWright (NVIDIA)
- Basis Conversations 1500 (Hugging Face ब्लॉग)
- QVAC Genesis III (Hugging Face ब्लॉग)
- Ai2 और Global Fishing Watch (Skylight)
- Google.org और Gates Foundation (blog.google)
- Gates Foundation की प्रेस विज्ञप्ति
- AI की मदद से कोड के आधुनिकीकरण की परियोजनाओं की तैयारी कैसे करें (Anthropic)
- @bcherny: Lean में Claude Agent SDK का औपचारिक सत्यापन
- Codex CLI 0.156.1
- Airbnb और GPT-6 Astra (OpenAI)
- OpenAI Academy के दो वर्ष
- मैंने अपने LED डिस्प्ले को जीवंत कैसे बनाया (OpenAI Developers)
- MedGemma और वैश्विक स्वास्थ्य (Google)
- Google Docs में Gemini Notebook (Workspace Updates)
- Google Flow के छह टूल (Google Labs)
- Google Beam का छह देशों में विस्तार (Google)
- Android Enterprise 2026 में नया क्या है (Google)
- AI Brief और AI Max (Google Ads)
- Gemini CLI v0.62.0-nightly.20260923
- दस में से तीन ऑप्टिमाइज़ेशन का कोई असर नहीं हुआ (EcoHash)
- क्रीमियाई तातार भाषा की वाक् पहचान (Hugging Face ब्लॉग)
- Mac पर Falcon-H1 की फ़ाइन-ट्यूनिंग (Hugging Face ब्लॉग)
- ओपन सोर्स के संकट की राह नेक इरादों से बनती है (Hugging Face ब्लॉग)
- डैशबोर्ड पर PASS दिखता है। आख़िर पास क्या हुआ? (Phionyx)
- Kimi Work के संस्करण नोट्स
- @arena: Qwen-Image-2.1 पहला खुला मॉडल
- GitHub Copilot ऐप में OpenTelemetry
- Copilot CLI में C++ कोड इंटेलिजेंस
- GitHub Copilot ऐप में बहुत बड़े पुल अनुरोध प्रदर्शित करना
- @genspark_ai: Genspark में Claude Opus 5.5
- सॉफ़्टवेयर दक्षता पर GitHub और Yale का अध्ययन
- Zed 1.21.0
- @warpdotdev: Warp में GPT-6 Sol और Luna
- Devin, Microsoft Teams और Microsoft 365
- @ElevenLabs: Scribe v2 Medical
- 23 सितंबर का ElevenLabs परिवर्तन लॉग
- @cohere: कनाडा में Model Vault
- AI से जुड़े बदलावों का प्रबंधन (Cohere)