खोजें

Wan 3.0 एक ही पास में 30 सेकंड उत्पन्न करता है, NVIDIA प्रति वाट कार्य में 30x तक की चोटियाँ मापता है, Mistral HUMAIN के साथ हस्ताक्षर करता है

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Wan 3.0 एक ही पास में 30 सेकंड उत्पन्न करता है, NVIDIA प्रति वाट कार्य में 30x तक की चोटियाँ मापता है, Mistral HUMAIN के साथ हस्ताक्षर करता है

ai-powered-markdown-translator

फ्र से hi में अनुवादित लेख gpt-5.4-mini के साथ।

GitHub पर प्रोजेक्ट देखें ↗

24 अगस्त हार्डवेयर जितना ही मॉडलों का भी दिन है। NVIDIA Hot Chips की इसी लहर में बुनियादी ढाँचे की तीन घोषणाएँ जारी करता है — Vera Rubin NVL72 के लिए सिलिकॉन पर पहले माप, Groq 3 LPX का उत्पादन में प्रवेश, NVLink Fusion के माध्यम से तीसरे पक्ष की चिप्स के लिए प्लेटफ़ॉर्म का खुलना। Alibaba Wan 3.0 लॉन्च करता है, जो एक ही पास में 30 सेकंड की मूल वीडियो बनाता है। और दो अमेरिकी-तर्रार प्रयोगशालाएँ उसी दिन राष्ट्रीय संस्थानों के साथ सामने आती हैं : सऊदी अरब में HUMAIN के साथ Mistral, जापान के रक्षा मंत्रालय के साथ Sakana AI। इनके साथ Anthropic के MCP कनेक्टरों के लिए एंटरप्राइज़ अनुमति की सामान्य उपलब्धता, Kiro में GPT-5.6 का आगमन और वॉयस एजेंटों पर घोषणाओं की एक श्रृंखला भी जुड़ती है।


Wan 3.0 एक ही पास में 30 सेकंड की मूल वीडियो उत्पन्न करता है

24 अगस्त — Alibaba अपने वीडियो मॉडल की नई पीढ़ी Wan 3.0 लॉन्च करता है। सबसे स्पष्ट बदलाव अवधि में है : यह मॉडल एक ही पास में 30 सेकंड की मूल सामग्री उत्पन्न करता है, लगातार शॉटों की असेंबली (stitching) के बिना। अब तक, दस सेकंड से आगे जाने के लिए कई खंड बनाकर उन्हें जोड़ना पड़ता था, और इससे रोशनी, बनावट तथा चेहरों में सामंजस्य भटकने लगता था।

दूसरा आयाम मल्टीमोडल इनपुट का है। Wan 3.0 20 तक संदर्भ assets स्वीकार करता है और चित्रों, ऑडियो और वीडियो के अलावा दस्तावेज़ों और वेब पेजों का भी विश्लेषण करता है — जिसे आधिकारिक पृष्ठ omnimodal creation (Omni-Creation) कहता है। व्यवहार में, इसमें एक पाठ्य विवरण की बजाय एक ब्रांड फ़ोल्डर दिया जाता है।

यह मॉडल साथ ही समकालिक मूल ऑडियो भी उत्पन्न करता है : आवाज़, प्रभाव और माहौल चित्रों के साथ ही बनाए जाते हैं, बाद में जोड़े नहीं जाते। स्थिर छवि की ओर देखें तो Wan 3.0 9 छवियों तक को एक एकल composition में मिलाता है और स्थिर शैली व विषय के साथ 12 क्रमिक छवियाँ उत्पन्न करता है, जिसका उद्देश्य स्पष्ट रूप से storyboard और विज्ञापन रूपांतर है।

दो कम नाटकीय लेकिन पेशेवर उपयोग में महत्वपूर्ण क्षमताएँ हैं : 12 भाषाओं में लंबे पाठ का rendering, जो graphics, formulas और infographics को कवर करता है जहाँ वीडियो मॉडल सामान्यतः विफल होते हैं, और सटीक colorimetry control, जो किसी ब्रांड गाइडलाइन के अनुरूपता की शर्त है।

दिन भर में ecosystem ने भी साथ दिया : Wan 3.0 fal, Leonardo.Ai, Scenario, RunningHub, Venice, TapNow, DeeVid, Pixmax और Pika API Club के माध्यम से day zero पर उपलब्ध था।

घोषित क्षमताWan 3.0 के लिए मूल्य
मूल अवधि30 s एक पास में, बिना असेंबली
संदर्भ assets20 तक, दस्तावेज़ों और वेब पेजों के विश्लेषण के साथ
ऑडियोसमकालिक, चित्रों के साथ मूल रूप से उत्पन्न
पाठ rendering12 भाषाओं में लंबा पाठ (ग्राफिक्स, सूत्र, infographics)
छवि fusion9 छवियों तक एक composition में
छवि शृंखलाएँ12 तक क्रमिक संगत छवियाँ

🔗 Wan 3.0 — आधिकारिक पृष्ठ


NVIDIA Vera Rubin NVL72 पर प्रति वाट 30x तक अधिक कार्य मापता है

24 अगस्त — Hot Chips सम्मेलन के अवसर पर, NVIDIA Vera Rubin NVL72 के लिए सिलिकॉन पर अपनी पहली performance measurements प्रकाशित करता है। सामने रखा गया आँकड़ा सीधे data center अर्थशास्त्र को लक्षित करता है : DeepSeek V4 Pro मॉडल पर GB300 NVL72 पीढ़ी की तुलना में megawatt प्रति 30x तक अधिक throughput, और प्रति मिलियन tokens लागत 35x तक कम।

पद्धतिगत बिंदु परिणाम जितना ही महत्वपूर्ण है। NVIDIA पारंपरिक inference measurements को अलग रखता है, जिन्हें 1,000 से 8,000 tokens की sequences पर calibrated किया जाता है : agentic session में context जमा होता रहता है और input में कई सौ हज़ार tokens तक पहुँच जाता है। इसलिए माप SemiAnalysis AgentX के साथ किए गए — दर्ज की गई वास्तविक agentic coding sessions की एक workload, जिसमें tool calls और sub-agents संरक्षित रखे गए। दो सावधानियाँ : आँकड़े SemiAnalysis की समीक्षा की प्रतीक्षा में हैं और अभी Vera CPU के योगदान को शामिल नहीं करते।

इसका औचित्य एक OpenRouter आँकड़े में निहित है : एक agentic workload एक साधारण chat request की तुलना में 15x अधिक tokens खपत करता है। ऊर्जा-सीमित AI factory के लिए, मुद्दा बिना किसी घुमा-फिरा के कहा गया है — megawatt प्रति throughput राजस्व निर्धारित करता है, प्रति मिलियन tokens लागत मार्जिन निर्धारित करती है। DSX MaxLPS तकनीक megawatt बजट समान रहने पर 40% तक अतिरिक्त GPU provisioning की भी अनुमति देती है।

लाभ inference optimizations की एक परतदार श्रृंखला से आते हैं : disaggregated service जो context processing और response generation को अलग करता है, paliers द्वारा offload के साथ वितरित KV cache, MegaMoE जैसे fused CUDA kernels, और NVFP4 quantization जो weights को 4 bits में संपीड़ित करती है। पूर्ण platform में सात chips शामिल हैं, Rubin GPU सहित।

मापी गई तुलनाघोषित लाभ
Vera Rubin NVL72 बनाम GB300 NVL72 (megawatt प्रति throughput)30x तक
Vera Rubin NVL72 बनाम GB300 NVL72 (प्रति मिलियन tokens लागत)35x तक कम
GB300 NVL72 बनाम Hopper (megawatt प्रति throughput)15x तक
DSX MaxLPSसमान megawatt बजट पर +40% GPU

🔗 Vera Rubin NVL72 और agentic workloads


Groq 3 LPX पूर्ण उत्पादन में प्रवेश करता है, Nebius और SpaceXAI Vera Rubin अपनाते हैं

24 अगस्त — उसी Hot Chips लहर का दूसरा हिस्सा : NVIDIA Groq 3 LPX rack-scale प्रणाली Vera Rubin NVL72 के विस्तार में पूर्ण उत्पादन में जाती है।

संदर्भ आँकड़ा Gemma 4 31B पर एक Artificial Analysis benchmark से आता है : 100,000 tokens की लंबी context के साथ प्रति सेकंड 3,400 output tokens, यानी निकटतम वैकल्पिक platform से 4x। लक्षित समस्या का एक सटीक नाम है — decoding latency : एक agent अपनी प्रतिक्रिया token दर token उत्पन्न करता है, और सबसे छोटा भी unit delay काम की श्रृंखलाओं में गुणा होता जाता है।

भूमिकाओं का विभाजन स्पष्ट है : Rubin GPU बड़े पैमाने पर context संभालते हैं, LPX latency-संवेदनशील decoding को तेज़ करता है। एक rack में 256 LP30 accelerators हो सकते हैं, जो सीधे chip-to-chip links से जुड़े होते हैं।

तीन adopters का उल्लेख है। Nebius अपने Token Factory में Groq 3 LPX को एकीकृत करने वाला पहला AI cloud है; CoreWeave अपने Vera Rubin racks को interconnect करने के लिए Spectrum-X Multiplane को production में तैनात करता है; और SpaceXAI agentic AI के पीछे orchestration, tool calling और code execution के लिए NVIDIA Vera CPUs अपनाता है, Vera Rubin के इर्द-गिर्द अपनी architecture बनाने के इरादे के साथ, terrestrial data centers से लेकर कक्षा में उपग्रहों तक।

Network के लिहाज़ से, मौजूदा सबसे बड़े clusters से आगे निकलने के लिए अब तक एक तीसरे स्तर की आवश्यकता होती थी, जो cabling, optics, energy और latency में महँगा था। Spectrum-X Multiplane इसके बजाय हर server के connection को कई स्वतंत्र paths, या planes, में बाँटता है, जिनमें से प्रत्येक अपना दो-स्तरीय network संचालित करता है।

मापा गया तत्वघोषित मूल्य
Gemma 4 31B पर Groq 3 LPX, 100k contextoutput में 3,400 tokens/s, निकटतम platform से 4x
Groq 3 LPX rack256 LP30 accelerators तक, chip-to-chip links
Spectrum-X Multiplaneदो स्तरों पर 512,000 GPU तक
आठ में से एक plane की हानिलगभग 90% bandwidth संरक्षित
Hardware recoverysoftware balancing से 11x तेज़, 1.6x उत्पादन

🔗 Groq 3 LPX, Spectrum-X और NVLink Fusion


24 अगस्त — दिन का तीसरा NVIDIA लेख : NVLink Fusion कस्टम chips (XPU) को 72 accelerators के NVLink scale-up domain में लाता है। NVLink की छठी पीढ़ी standard Ethernet आधारित समाधानों की तुलना में 3x कम end-to-end latency दिखाती है, और packet throughput 10x अधिक है; roadmap 1,152 accelerators तक के domains और co-packaged optics की घोषणा करती है। NVLink-C2C XPU को Vera CPUs या अन्य CPUs से PCIe interface की तुलना में 6x तक अधिक energy efficiency के साथ जोड़ता है।

तर्क decoupling का है : एक AI factory — ऊर्जा, भवन, cooling, racks, network — की योजना accelerators के mix के final होने से बहुत पहले शुरू हो जाती है, और केवल एक chip पर बंद data center एक planning risk बन जाता है। adopters MGX rack architecture और इसकी supply chain को पुनः उपयोग करते हैं। उल्लेखित साझेदार : Intel, MediaTek, GUC, QCT और Annapurna Labs।

🔗 NVLink Fusion और XPU


Mistral और HUMAIN सऊदी अरब में संप्रभु AI के लिए हस्ताक्षर करते हैं

24 अगस्त — Mistral सऊदी AI कंपनी HUMAIN के साथ एक रणनीतिक सहयोग की घोषणा करता है : computing infrastructure, उन्नत model development और kingdom तथा region में solutions की तैनाती। Mistral के अनुसार, यह प्रतिबद्धता कई सौ मिलियन यूरो की है।

प्रारंभिक दिशाएँ cybersecurity और voice हैं, जिनमें Arabic language में performant frontier models शामिल हैं। Mistral अपने स्थानीय compute needs के लिए HUMAIN के datacenters के उपयोग की खोज करेगा, और दोनों साझेदार मिलकर kingdom के regulated industries को लक्षित करेंगे। यह घोषणा इस गर्मी शुरू हुई एक श्रृंखला को आगे बढ़ाती है — Microsoft के साथ विस्तारित साझेदारी, फिर अगस्त की शुरुआत में European Compute Units — और communiqué स्पष्ट करता है कि ये prospective statements हैं, जो आगे के commercial agreements पर निर्भर हैं।

Control is becoming the defining topic in enterprise AI adoption. Across the world, and especially in regulated industries, organizations want the benefits of AI without giving up control over their sensitive data and systems.

🇮🇳 एंटरप्राइज़ में AI अपनाने का निर्णायक विषय नियंत्रण बन गया है। दुनिया भर में, और विशेष रूप से विनियमित उद्योगों में, संगठन अपने डेटा और संवेदनशील प्रणालियों पर नियंत्रण छोड़े बिना AI के लाभ चाहते हैं।@MistralAI sur X

🔗 @MistralAI की घोषणा · Mistral पोस्ट


Sakana AI जापानी रक्षा मंत्रालय के साथ अनुबंध हासिल करता है

24 अगस्त — Sakana AI 29 जुलाई को जापानी रक्षा मंत्रालय (防衛省) के साथ हस्ताक्षरित एक अनुबंध को सार्वजनिक करता है, जो एकीकृत विश्लेषण कार्यों के लिए आवश्यक AI functions के अध्ययन और demonstration से संबंधित है। परियोजना Directorate of Intelligence के विश्लेषण अधिकारियों को लक्षित करती है, तीन axes पर : collection, analysis capabilities और document management। उपयोग में लाई गई ईंट प्रयोगशाला की AI agents technology है।

यह उसका पहला defense contract नहीं है : मार्च 2026 में, टोक्यो स्थित यह प्रयोगशाला command and control systems की basic technologies पर पहले ही चुनी जा चुकी थी। एक ऐसी कंपनी के लिए जिसकी सार्वजनिक पहचान उसके खुले models पर आधारित है, यह trajectory ध्यान देने योग्य है — blog में अब रक्षा और खुफिया के लिए एक समर्पित section है, और Sakana AI इस टीम के लिए भर्ती कर रहा है।

「Sakana AI株式会社は、令和8年7月29日、防衛省と「総合分析業務に必要なAI機能の調査・実証」に関する契約を締結いたしました。」

🇮🇳 Sakana AI ने 29 जुलाई 2026 को रक्षा मंत्रालय के साथ एक अनुबंध संपन्न किया, जो एकीकृत विश्लेषण कार्यों के लिए आवश्यक AI कार्यों के अध्ययन और प्रदर्शन से संबंधित है। — Sakana AI, आधिकारिक पोस्ट

🔗 Sakana AI — रक्षा के लिए एकीकृत विश्लेषण


Anthropic MCP कनेक्टरों के लिए एंटरप्राइज़ अनुमति को सामान्य उपलब्धता में खोलता है

24 अगस्त — MCP connectors के लिए enterprise-managed auth Claude Team और Claude Enterprise पर जून की open beta के बाद सामान्य उपलब्धता में चला जाता है। हल हुई समस्या ठोस है : अब तक, MCP connector जोड़ने के लिए दो चरण आवश्यक थे — administrator इसे organization के लिए सक्रिय करता था, फिर हर user हर tool के लिए OAuth flow से गुजरता था। अब administrator enterprise के identity provider के माध्यम से केवल एक बार अनुमति देता है, और users को उनके tools पहले से connected मिलते हैं।

एक बिंदु security teams के लिए दिलचस्प है : administrator यह मांग सकता है कि connector हमेशा identity provider के माध्यम से ही जाए, जिससे किसी personal account को किसी professional tool से जोड़ने से रोका जा सके। लॉन्च पर दस MCP providers समर्थित हैं — Asana, Atlassian, Canva, Datadog, Figma, Granola, Linear, Notion, Slack और Supabase — और फिलहाल केवल Okta IdP के रूप में उपलब्ध है। यह mechanism proprietary नहीं है : यह Model Context Protocol के Enterprise-Managed Authorization extension का पहला implementation है।

🔗 @ClaudeDevs की घोषणा · Anthropic पोस्ट


Boris Cherny साइबरसुरक्षा में अस्वीकृतियों को एक दोष मानते हैं

24 अगस्त — क्षमता के तीन स्तरों पर अपनी टिप्पणियों के अगले ही दिन, Claude Code के प्रमुख सुरक्षा डेवलपर्स के बीच दो बार-बार उठने वाले प्रश्नों का उत्तर देते हैं। पहला एक पसंदीदा आंतरिक मॉडल पर संदेह है : टीम ठीक वही Fable उपयोग करती है जो अंतिम उपयोगकर्ता करते हैं।

दूसरा अधिक सीधा है : cyber security विषयों से ट्रिगर होने वाली अस्वीकृतियों को एक दोष माना जाता है, ऐसे शब्दों में जो उसे कमज़ोर नहीं बनाते, और टीम उन्हें घटाने पर काम कर रही है। यह रक्षात्मक सुरक्षा या CTF के practitioners के लिए उपयोगी जानकारी है, जिन्हें वैध अनुरोधों पर नियमित रूप से अस्वीकृतियों का सामना करना पड़ता है। कोई समय-सीमा नहीं दी गई है, लेकिन संदेश अगस्त के Fable 5 biology guardrails अपडेट को आगे बढ़ाता है, जिसका उद्देश्य भी false positives को कम करना था।

We use the same exact Fable. Cyber security refusals suck, and we are working on reducing them. More to come.

🇮🇳 हम ठीक वही Fable उपयोग करते हैं। साइबरसुरक्षा में अस्वीकृतियाँ परेशान करने वाली हैं, और हम उन्हें कम करने पर काम कर रहे हैं। आगे और भी बातें आएँगी।@bcherny sur X


Anthropic अपने स्वयं के ऐप्स को स्वचालित रूप से मेंटेन करना शुरू करता है

23 अगस्त — कोडिंग से उनका क्या मतलब है, इसे स्पष्ट करने के लिए प्रेरित होकर, Boris Cherny एक सरल भेद बताते हैं: coding कोड लिखने की क्रिया है, engineering उसके ऊपर बाकी सब कुछ है। वे स्वीकार करते हैं कि सामरिक काम और रणनीतिक काम के बीच का विभाजन भी एक वैध दृष्टिकोण है।

उनके संदेश का अंतिम हिस्सा नई जानकारी देता है। वे कहते हैं कि वे रणनीतिक काम के कुछ हिस्सों को स्वचालित होते देख रहे हैं, और एक ठोस उदाहरण देते हैं: Anthropic अपने ऐप्स को स्वतः मेंटेन करना शुरू कर रहा है, और तेजी से बढ़ते ग्राहकों की एक संख्या भी ऐसा ही कर रही होगी। सूक्ष्मता महत्वपूर्ण है — अब बात मांग पर कोड जनरेट करने की नहीं, बल्कि एजेंटों को प्रोडक्शन में चल रहे ऐप्लिकेशनों की नियमित मेंटेनेंस संभालने देने की है: dependency updates, corrections, API परिवर्तनों के अनुरूप अनुकूलन। प्रयुक्त क्रिया एक जारी तैनाती का वर्णन करती है, न कि किसी स्थापित तथ्य का, और कोई संख्या, कोई नामित ऐप या कोई सटीक दायरा नहीं दिया गया है।

🔗 coding और engineering पर @bcherny का थ्रेड


Claude Code के साथ साप्ताहिक स्वचालित व्यावसायिक digest

24 अगस्त — Anthropic Claude Code के एक आंतरिक उपयोग पर एक पोस्ट प्रकाशित करता है, जो सॉफ़्टवेयर विकास के बाहर है: एक फ़ील्ड मार्केटर बताती हैं कि कैसे उन्होंने सोमवार सुबह की पंद्रह मिनट की stand-up को एक व्यक्तिगत साप्ताहिक digest से बदल दिया, जो हर सेल्सपर्सन को Slack संदेश के रूप में दिया जाता है।

इसकी संरचना बहुत कम चीज़ों पर टिकी है: Claude, MCP के माध्यम से BigQuery से जुड़ा है, और data warehouse marketing data के लिए source of truth का काम करता है। तरीका तकनीक से अधिक शिक्षाप्रद है: pilot एक ही स्वयंसेवी टीम के साथ शुरू हुआ, और प्राप्तकर्ताओं द्वारा दी गई हर correction को prompt के एक स्पष्ट नियम में बदला गया: पहले सप्ताह के अंत तक, उसमें content के नौ नियम थे, जिनमें से प्रत्येक एक विशिष्ट feedback से ट्रेस किया जा सकता था। चूँकि हर संदेश प्राप्तकर्ता की खातों की सूची के आधार पर तैयार होता है, दो संदेश कभी एक जैसे नहीं होते; बाद में BDR (business development representatives) ने अपना अलग संस्करण माँगा।

🔗 Claude Code के साथ एक व्यक्तिगत साप्ताहिक digest


GPT-5.6 AWS के विकास एजेंट Kiro में आ रहा है

24 अगस्त — पूरी GPT-5.6 family — Sol, Terra और Luna — AWS के software development agent Kiro में उपलब्ध है। जो बात प्रमुखता से सामने रखी गई है, वह raw power नहीं बल्कि price/performance ratio है: Terminal-Bench 2.1 पर, जो OpenAI और AWS द्वारा संयुक्त रूप से किया गया एक test है, GPT-5.6 Terra सफल tasks को लगभग 82% कम लागत में पूरा करता है।

दी गई व्याख्या Kiro की पद्धति, यानी spec-driven development, पर आधारित है: यह tool एक उच्च-स्तरीय intention को requirements, technical design और executable tasks में बदलता है, जिससे model शुरू से ही एक precise context में anchored रहता है और गलत रास्ते सीमित होते हैं। OpenAI लक्षित उपयोगों का विवरण देता है: structured implementation plans, multi-step code tasks, repository context, changes लागू करने से पहले checkpoints। code agents के ecosystem पर नज़र रखने वालों के लिए, यह घोषणा मुख्यतः यह पुष्टि करती है कि GPT-5.6 lineup OpenAI surfaces के बाहर भी फैल रही है।

🔗 Kiro में GPT-5.6


Codex को Chrome DevTools Protocol तक पहुँच के साथ developer mode मिलता है

24 अगस्त — ChatGPT और Codex changelog को browser-चालित agent पर केंद्रित नई विशेषताओं की एक शृंखला मिलती है। मुख्य विशेषता Browser use के लिए developer mode है, Chrome में भी और Codex के integrated browser में भी: यह Chrome DevTools Protocol तक नियंत्रित पहुँच देता है, वही interface जिसका उपयोग Chrome के development tools करते हैं। इससे agent प्रदर्शन को profile कर सकता है और network traffic, console output तथा page state को debug कर सकता है, बजाय इसके कि वह केवल स्क्रीन पर जो पढ़ता है, उसी तक सीमित रहे।

वही protocol गति के लिए भी काम आता है: Browser use अब DOM snapshots की बदौलत, जो browser के साथ होने वाले back-and-forth को कम करते हैं, दो गुना तक तेज़ हो जाता है। अनुसूचित automatisations अब चुने गए approval mode का पालन करती हैं, जिससे बिना निगरानी वाले executions के लिए एक परेशान करने वाला अंतर ठीक हो जाता है।

changelog की नई विशेषताघोषित दायरा
Browser use के लिए developer modeChrome और Codex का integrated browser, नियंत्रित CDP access
तेज़ किया गया Browser use2x तक तेज़ (CDP optimizations और DOM snapshots)
कमांड /initapplication को compose करना, Codex CLI जैसा ही व्यवहार
Computer UseEEA, UK और Switzerland के बाहर की enterprises
Windows पर Computer Use controlsप्रति application configurable

🔗 ChatGPT और Codex changelog


Gemma 4 Good Challenge के विजेता

24 अगस्त — Google अपने Gemma 4 Good Challenge के परिणाम प्रकाशित करता है, यह एक Kaggle competition थी जिसमें developers को उसके खुले models के साथ वास्तविक समस्याओं को हल करने के लिए आमंत्रित किया गया था: छह सप्ताह में 1,600 से अधिक projects जमा किए गए। कठिनाई models की गुणवत्ता से कम और constrained environment में उनके deployment से अधिक थी, क्योंकि प्रतिभागियों ने सामान्य hardware पर चलाने के लिए LiteRT, Cactus, Ollama, llama.cpp और Unsloth का उपयोग किया।

पुरस्कृत projects की साझा थीम offline operation और by-design privacy है। GEM-4 पहले स्थान पर आता है, एक वृद्ध और दिव्यांग लोगों के लिए robotic assistant के साथ: एक Gemma 4 31B training video sequences को annotate करता है, एक fine-tuned E2B controller observations और instructions को movements में बदलता है। विशेष पुरस्कारों में, Gem-Care Gemma 4 E2B को non-normative speech को पुनर्निर्मित करने के लिए fine-tune करता है और word error rate को 32.7% से 19.0% तक गिरा देता है; PreVillage 7.5 tokens प्रति सेकंड की गति से Raspberry Pi 5 पर romanized Nepali में conversational routing प्रदान करता है।

🔗 Gemma 4 Good Challenge के पुरस्कृत projects


ADK native रूप से vocal agents का मूल्यांकन करता है

24 अगस्त — Google का Agent Development Kit अब live और vocal agents के मूल्यांकन का समर्थन करता है, उसी loop में जैसे text agents के लिए होता है। सिद्धांत यह है: एक user simulator अपने turns of speech बोलता है, जो Gemini TTS द्वारा synthesized होकर agent को streamed किए जाते हैं, और agent के बोले गए उत्तरों को स्वतः अंक दिए जाते हैं। live mode केवल एक live_model_config block की उपस्थिति से सक्रिय होता है; इसके बिना, वही test cases text mode में चलते हैं।

Test cases दो शैलियों में आते हैं: scenario, जहाँ एक persona किसी plan के अनुसार अपने turns को improvise करता है, और fixed conversation, जो शब्दशः scripted होती है। Scoring natural language rubrics द्वारा संचालित LLM judges के माध्यम से होती है, जो एक बार लिखे जाते हैं और फिर पूरी suite पर लागू किए जाते हैं। execution adk eval या AgentEvaluator के माध्यम से होता है, जिससे vocal evaluations को CI/CD pipeline में डाला जा सकता है। ADK Web standard mode और live mode के बीच एक toggle जोड़ता है, audio stream से transcription को पुनर्निर्मित करता है और हर turn के साथ एक playable audio clip संलग्न करता है।

🔗 ADK में vocal agents का मूल्यांकन करें


Grok Voice Think Fast 2.0 Speech-to-Speech index में आगे है

24 अगस्त — xAI घोषणा करता है कि Grok Voice Think Fast 2.0 Artificial Analysis के Speech-to-Speech index में पहले स्थान पर पहुँच गया है, जो तैयार की गई voice की गुणवत्ता से कम, और इस क्षमता को अधिक मापता है कि एक vocal agent जो कुछ सुनता है, उस पर तर्क कर सके, एक वास्तविक customer problem हल कर सके और tools को कॉल करके किसी task को अंत तक पूरा कर सके।

यह model आज की नई चीज़ नहीं है: इसका presentation post 29 जुलाई का है। xAI यहाँ जो संप्रेषित कर रहा है, वह ranking और production figures हैं। उसी समूह की subsidiary Starlink में, Grok Voice रोज़ाना 15,000 से अधिक inbound support और sales calls संभालता है और voice और chat मिलाकर प्रति सप्ताह 3,000 से अधिक orders पूरा करता है। Think Fast family अपना reasoning speech synthesis के समानांतर चलाती है, जिससे intelligence के लिए latency का भुगतान नहीं करना पड़ता।

BenchmarkThink Fast 2.0GPT-Realtime-2.1 (High)Gemini 3.1 Flash (High)
AA Speech-to-Speech Quality Index82.9 %79.1 %69.5 %
τ-voice Bench (agent performance)56.5 %45.7 %37.7 %
पहले sound तक का समय0.70 s2.98 s

🔗 @SpaceXAI की घोषणा · x.ai पोस्ट


ElevenLabs अपनी पूरी API को terminal में ला रहा है

24 अगस्त — ElevenLabs अपने CLI का version 1 प्रकाशित करता है, जो पूरी API को terminal में उपलब्ध कराता है। घोषणा दो समान भागों में दो दर्शकों को लक्षित करती है: developers और code agents।

यह दोहरी लक्ष्य-रेखा तकनीकी विकल्पों में दिखाई देती है। commands को discoverable बनाने के लिए दस्तावेज़ित किया गया है, agent skills सीधे tool में एकीकृत हैं, और output structured JSON में उपलब्ध है — ये तीनों शर्तें किसी agent को free text की व्याख्या करने के बजाय tool को विश्वसनीय रूप से संचालित करने देती हैं। dry run mode इस सेट को पूरा करता है: यह किसी operation को चलाने से पहले उसका preview लेने देता है, जो तब उपयोगी सुरक्षा-बंध है जब कोई autonomous agent call शुरू कर रहा हो। यह output 17 अगस्त को प्रकाशक द्वारा लॉन्च किए गए official MCP server की निरंतरता में आता है।

🔗 ElevenLabs CLI v1


MiniMax GMI Cloud पर 14 दिनों की असीमित पहुँच खोलता है

24 अगस्त24 अगस्त से 6 सितंबर तक, MiniMax GMI Cloud पर अपने models की असीमित पहुँच खोलता है: भाषा पक्ष में M3 और M2.7, audio पक्ष में Speech 2.8 और Music 3.0।

ध्यान देने योग्य बात व्यावसायिक अभियान से आगे जाती है। 21 अगस्त को, MiniMax ने केवल एक रहस्यमय घोषणा की थी, जिससे M3 model के आने का संकेत मिलता था, लेकिन specifications या तारीख के बिना। तीन दिन बाद, M3 एक दिनांकित offer में नाम सहित उपलब्ध है, साथ में दो audio models भी हैं, जिनके version numbers पहले के provider communications में नहीं आए थे। घोषणा के साथ कोई benchmark या technical specification नहीं है: यह उपलब्धता है, product sheet नहीं।

🔗 GMI Cloud पर 14 दिनों की असीमित पहुँच


संक्षेप समाचार

  • Nemotron 3.5 Lightning PinchBench के शीर्ष 4 में प्रवेश करता है — NVIDIA का model OpenClaw standardised agent tests पर 86.4% औसत सफलता के साथ खुले weights वाले models में शीर्ष 4 में आता है; Nemotron 3 Ultra पहले स्थान पर बना रहता है। 🔗 @NVIDIAAI का ट्वीट
  • Wan 3.0 अब Pika API Club के माध्यम से उपलब्ध है — 5 अगस्त को लॉन्च किया गया यह aggregator एक ही API के माध्यम से एक सौ से अधिक models तक पहुँच देता है। day-zero जोड़ 17 अगस्त को Seedance 2.5 के साथ देखी गई तर्क-धारा को आगे बढ़ाता है। 🔗 @pika_labs का ट्वीट
  • Runway Ruby को अपने platform के सभी models तक विस्तारित करता है — Seedance 2.5, Gen-4.5 या MiniMax H3 के outputs अब अलग calibration chain के बिना EXR 16-bit या ProRes और HEVC 10 और 12-bit में बदल जाते हैं। 🔗 @runwayml का ट्वीट
  • Runway San Francisco में एक in-person hackathon खोलता है30 सितंबर को, agents और applications के निर्माण पर केंद्रित; आवेदन hackathon.runway.com के माध्यम से होते हैं। 🔗 @runwayml का ट्वीट
  • Boris Cherny के अनुसार, prompt injection हल करने योग्य साबित हुई है — वे bug-free code generation पर आगे बढ़ते हैं और पूर्व मिसाल का उल्लेख करते हैं: alignment training और mechanistic interpretability का संयोजन कई वर्षों के बाद अंततः इस समस्या पर काबू पाने में सफल रहा। 🔗 @bcherny का थ्रेड
  • 25 अगस्त को GitHub webinar, app Copilot के इर्द-गिर्द — Pierce Boggan और James Clancey के साथ 18:00 से 19:00 CEST तक live demonstration; registration page Agent Merge का विवरण देती है, जो rebase, reviews और merge तक checks को संभालता है। 🔗 @github का ट्वीट
  • GitHub अपने podcast के season 2 को प्रमुखता देता है — पिछले season के hosts और उनके पसंदीदा episodes का परिचय वीडियो, बिना किसी product announcement के। 🔗 @github का ट्वीट
  • Nous Research portal में Grok 4.6 आधी कीमत पर — एक सप्ताह के लिए 50% की छूट, open source agent Hermes के साथ या मौजूदा SuperGrok या X Premium+ subscription के माध्यम से उपयोग योग्य। 🔗 @SpaceXAI का ट्वीट
  • Codex Live Build voice-driven steering को प्रमुखता देता है — creator Alex Finn के साथ X पर live session, जो computer और mobile पर Codex में keyboard-free काम पर केंद्रित है। demonstration, feature announcement नहीं। 🔗 @OpenAIDevs का ट्वीट
  • HeyGen real-estate videos के लिए prompt guide प्रकाशित करता है — cinematic quality avatar videos के लिए prompts लिखना, अपनी real estate series की निरंतरता में। 🔗 @HeyGen का ट्वीट
  • Maps, Search और Gemini के साथ अमेरिकी राष्ट्रीय उद्यानों के 110 वर्ष — Google अपने search trends (शुरुआती hiking के लिए queries एक महीने में 165% बढ़ती हैं) और यात्रा तैयारी में AI Mode, Ask Maps और Gemini Live के उपयोग को जोड़ता है। कोई नई feature नहीं। 🔗 blog.google पोस्ट

इसका क्या मतलब है

सॉफ़्टवेयर उपयोगों पर केंद्रित कई दिनों के बाद, हार्डवेयर फिर से केंद्र में आ गया है — और जो वह मापता है, वह बदल गया है। NVIDIA 1,000 से 8,000 tokens की शृंखलाओं पर कैलिब्रेट किए गए inference मापों को स्पष्ट रूप से किनारे रखकर, उनके बजाय दर्ज की गई वास्तविक agentic coding sessions को प्राथमिकता देता है, जिनमें बढ़ता context, tool calls और sub-agents शामिल हैं। माप की इकाई भी उसी तरह बदल रही है: अब यह raw throughput नहीं, बल्कि प्रति megawatt काम है, और प्रति million tokens लागत है। बाधा अब उपलब्ध silicon नहीं है, बल्कि वह ऊर्जा है जो उसे दी जा सकती है। GPU/LPU का विभाजन भी यही बात एक अलग कोण से कहता है: एक तरफ context processing, दूसरी तरफ latency-sensitive decoding, क्योंकि agentic inference अब एक समान भार नहीं रह गया है।

दिन का दूसरा संकेत platform का खुलना है। NVLink Fusion दूसरों द्वारा डिज़ाइन किए गए chips को जोड़ता है, SpaceXAI Vera CPUs लेता है, और Intel, MediaTek तथा Annapurna Labs partner सूची में शामिल हैं। व्यावसायिक तर्क समय-सारिणी का है: AI factory की योजना — ऊर्जा, भवन, cooling, network — accelerator mix तय होने से बहुत पहले बनाई जाती है, और केवल accelerator के बजाय rack, network और tooling बेचना खुद को अपरिहार्य बना देना है, यहाँ तक कि उन लोगों के लिए भी जो अपना silicon खुद बनाते हैं।

और भी अप्रत्याशित, sovereignty एक ही दिन दो घोषणाओं में उभर कर आई। Mistral HUMAIN के साथ arabic-speaking models और Saudi datacenters के उपयोग पर collaboration की घोषणा करता है; Sakana AI जापानी Ministry of Defense के साथ intelligence analysis के लिए समझौता करता है। दो गैर-अमेरिकी labs, दो national institutions, एक ही logic: जिसे Mistral control कहता है और जिसे जापानी सरकार information power कहती है, वह चुनी गई jurisdiction के भीतर training और inference चलाने की क्षमता को दर्शाता है। Sakana के लिए, जिसकी सार्वजनिक पहचान open work पर आधारित है, defense को समर्पित अनुभाग और उससे जुड़े hiring संकेत देते हैं कि यह एक isolated contract नहीं, बल्कि एक स्थायी activity line है।

एक सूक्ष्म लेकिन सुसंगत धागा बचता है: tooling इस तरह संरचित हो रहा है कि उसे केवल मनुष्य नहीं, agent भी चला सके। ElevenLabs एक CLI जारी करता है, जिसके selling points — discoverable commands, structured JSON, dry run mode — सीधे code agents को लक्ष्य करते हैं। Codex को Chrome DevTools Protocol तक पहुँच मिलती है, यानी किसी पेज के render की बजाय उसकी वास्तविक state पढ़ने की क्षमता। ADK native vocal evaluation जोड़ता है, ताकि बोलने वाले agents को अंदाज़े के सहारे न छोड़ना पड़े। और Grok Voice production volumes प्रकाशित करता है — Starlink पर प्रति दिन 15,000 calls — बजाय केवल एक ranking score पर टिके रहने के। हर बार वही मोड़: prototype से बाहर निकलने के लिए machinable interfaces और reproducible measurements चाहिए।


स्रोत