ai-powered-markdown-translatorgpt-5.4-mini के साथ फ्र से hi में अनुवादित लेख।
चौबीस घंटों में इक्यावन घोषणाएँ, नौ क्षेत्रों में फैली हुईं: 25 अगस्त का दिन सप्ताह का सबसे व्यस्त दिन है। इससे चार प्रमुख घटनाएँ उभरती हैं। OpenAI अपने इन-हाउस inference चिप Jalapeño के पहले मापे गए नतीजे प्रकाशित करता है, और इसके तुरंत बाद Chrome, Cloudflare, Shopify, Vercel, Render और Netlify के साथ WebMCP पर दस दिन का हैकाथॉन शुरू करता है। Perplexity अपने Computer agent का पूरा हिस्सा उपयोगकर्ता की मशीन पर ले आता है। IBM Granite 4.2, अपने reasoning मॉडल परिवार की पहली श्रृंखला, लॉन्च करता है। और Anthropic Claude की memory को chat और Cowork के बीच एकीकृत करता है, उसे फ़ाइल-दर-फ़ाइल पढ़ने और संशोधित करने योग्य बनाकर। बाकी — National Hurricane Center में WeatherNext Cyclones का उपयोग, Stability AI की Series B, और टूल्स के लगभग बीस अपडेट — नीचे दिए गए हैं।
WebMCP : एक मानक, उसका उत्पाद समर्थन, उसका आंतरिक उपयोग और उसे शुरू करने के लिए एक प्रतियोगिता
25 अगस्त — OpenAI WebMCP Challenge शुरू करता है, जो एक अभी भी प्रयोगात्मक खुले मानक को समर्पित दस-दिवसीय हैकाथॉन है, और यह बदल देता है कि agents वेब के साथ कैसे इंटरैक्ट करते हैं। लक्षित समस्या बहुत व्यावहारिक है: आज, किसी साइट पर कोई कार्य पूरा करने वाले agent को ऐसा interface नेविगेट करना पड़ता है जो आँखों और mouse के लिए बनाया गया है। WebMCP तर्क को उलट देता है; साइट स्वयं संरचित tools expose करती है जिन्हें agent सीधे call करता है।
प्रतियोगिता घोषणा का सबसे उल्लेखनीय पहलू नहीं है। सबसे महत्वपूर्ण है वह alignment जिसे यह उजागर करती है: Chrome (Google), Cloudflare, Shopify, Vercel, Render और Netlify सभी OpenAI के साथ उसी standard पर जुड़ते हैं। jury में भी इसकी छाप दिखती है, जिसमें Sarah Drasner (Distinguished Engineer, Chrome), Andrew Galloni (VP Research & Innovation, Cloudflare), Jude Gao (Next.js Core team, Vercel), Ilya Grigorik (Distinguished Engineer, Shopify), Sean Roberts (VP of Applied AI, Netlify), Justin Rushing (Browser Agent Lead, OpenAI) और Alex Nahas, MCP-B के निर्माता, शामिल हैं।
The WebMCP Challenge is here. We’ve teamed up with @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render, and @Netlify for a 10-day hackathon. Up for grabs: $35,000 in cash prizes, Codex Micros, ChatGPT Pro subscriptions, and more prizes from our supporters.
🇮🇳 WebMCP Challenge शुरू हो गया है। हमने @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render और @Netlify के साथ मिलकर दस-दिवसीय हैकाथॉन आयोजित करने के लिए साझेदारी की है। दांव पर हैं: नकद पुरस्कार के रूप में 35,000 डॉलर, Codex Micro, ChatGPT Pro subscriptions, और हमारे partners द्वारा दिए गए अन्य पुरस्कार। — X पर @OpenAIDevs
समय-सारिणी कड़ी है और मूल्यांकन मानदंड स्पष्ट हैं: उपयोगिता, मौलिकता, निष्पादन, WebMCP का विचारपूर्ण उपयोग, और human-agent अनुभव की गुणवत्ता। Registration और submission Devpost के माध्यम से होते हैं। OpenAI agent-native demo apps भी प्रकाशित करता है ताकि projects की शुरुआत हो सके — agent द्वारा संचालित 3D modeling, collaborative writing जहाँ agent अपनी ही पहचान से टिप्पणी करता है, custom crossword generator, Wandernote जो travel notes को itinerary में बदलता है, और browser में DuckDB-Wasm के ज़रिए data exploration। किसी मौजूदा application से शुरुआत करना और उसमें WebMCP जोड़ना स्वीकार्य है।
| प्रतियोगिता का तत्व | घोषित विवरण |
|---|---|
| घोषित अवधि | 10 दिन |
| submissions खुलने की तिथि | 25 अगस्त 2026, 12 h PT |
| जमा करने की अंतिम तिथि | 3 सितंबर 2026, 13 h PT |
| विजेताओं की घोषणा | 23 सितंबर 2026 (संकेतात्मक तिथि) |
| कुल पुरस्कार राशि | 35,000 डॉलर |
| प्रत्येक विजेता के लिए पुरस्कार (top 10) | 3,000 डॉलर, एक वर्ष का ChatGPT Pro, एक Codex Micro keyboard, goodies |
| जमा करने का प्लेटफ़ॉर्म | Devpost |
उसे रोज़मर्रा में उपयोगी बनाने वाला product layer उसी दिन आता है: ChatGPT desktop app और ChatGPT Sites का integrated browser अब WebMCP को consume कर सकता है। जब ChatGPT या Codex किसी compatible site पर जाता है, तो agent page द्वारा expose किए गए tools को पहचानता है और interface में भटकने के बजाय उन्हें स्वतः उपयोग करता है — इसके लिए desktop app के latest version में update आवश्यक है। loop का दूसरा आधा production side पर है: Codex से WebMCP-compatible application बनवाना और फिर उसे सीधे Sites पर deploy करना संभव हो जाता है। ध्यान देने योग्य है support की asymmetry Chrome के साथ, जहाँ WebMCP अभी भी experimental flag या origin trial के पीछे है, जबकि ChatGPT का browser इसे natively संभालता है।
तीसरा पहलू, और सबसे शिक्षाप्रद, यह है कि OpenAI अपने आंतरिक उपयोग का दस्तावेज़ीकरण करता है। कंपनी का एक engineer बताता है कि उसने हर task के लिए अलग automation लिखना छोड़कर Runme बनाने का निर्णय लिया, जो open source notebooks के लिए एक web application है और Codex के साथ सहयोग के लिए डिज़ाइन किया गया है। उसमें वह एक संक्षिप्त objective और स्पष्ट निर्देश लिखता है — पिछली execution देखना, विस्तृत योजना लिखना, शुरुआत करने से पहले validation की प्रतीक्षा करना, निष्पादित commands और उनकी व्याख्या का दस्तावेज़ीकरण करना — और Codex काम के दौरान notebook को पढ़ता और अपडेट करता रहता है। दो architecture विकल्प विशेष ध्यान देते हैं। पहला, persistence: notebooks Google Drive में save होते हैं, और Runme साथ में एक companion Markdown index *.index.md बनाता है जिसे Drive index कर सकता है, जिससे agent किसी पिछली execution को operational context के रूप में खोज सके। दूसरा, capabilities का exposure: Runme एक statically served client application है, और केवल एक classic MCP access point expose करने के लिए server जोड़ना infrastructure बढ़ाता और notebook data processing को कहीं और ले जाता। WebMCP application को अपने tools सीधे browser से register करने देता है।
🔗 WebMCP Challenge · ChatGPT desktop और Sites में समर्थन · OpenAI में Codex, Runme और WebMCP
Jalapeño : OpenAI अपने inference चिप के पहले आंकड़े प्रकाशित करता है और अपनी compute रणनीति को मानता है
25 अगस्त — OpenAI Jalapeño के पहले मापे गए परिणाम प्रकाशित करता है, जो पहली inference chip है जिसे उसने स्वयं डिज़ाइन किया है। घोषणा की दिलचस्पी केवल raw gains में नहीं है, बल्कि उस समझौते की प्रकृति में है जिसे वह ख़त्म करने का दावा करती है: मौजूदा inference systems आम तौर पर throughput और latency के बीच संतुलन बनाते हैं, जबकि Jalapeño दोनों को एक ही architecture में दावा करती है।
माप InferenceX पर आधारित हैं, जो SemiAnalysis का एक सार्वजनिक benchmark है और किसी request की पूरी processing का अनुकरण करता है। तीन open models का परीक्षण किया गया — GPT-OSS 120B, DeepSeek R1 670B और Kimi K2.5 1T — commercial systems के सामने। per chip के बजाय per watt सामान्यीकरण चुनना स्पष्ट और सुविधाजनक है: Jalapeño उन systems की तुलना में आधी बिजली खर्च करती है जिनसे उसकी तुलना की गई। Jalapeño को 700 W पर घोषित किया गया है, और tested loads पर sustained consumption 550 W या उससे कम रही, जबकि GB200 के लिए 1,200 W और GB300 के लिए 1,400 W है।
| मूल्यांकित मॉडल (तुलना किया गया सिस्टम) | प्रति kW चरम throughput | end-to-end latency | न्यूनतम TBT |
|---|---|---|---|
| GPT-OSS 120B (GB200, 1,200 W) | ≈1,9x (85 448 vs 44 960) | ≈1,7x (1,03 s vs 1,80 s) | ≈2,7x (0,69 vs 1,87 ms) |
| DeepSeek R1 670B (GB300, 1,400 W) | ≈1,7x (19 641 vs 11 781) | ≈3,6x (1,65 s vs 5,99 s) | ≈4,1x (1,43 vs 5,90 ms) |
| Kimi K2.5 1T (GB300, 1,400 W) | ≈1,5x (18 195 vs 11 862) | ≈3,4x (1,56 s vs 5,31 s) | ≈3,8x (1,44 vs 5,48 ms) |
तीनों मॉडलों के समग्र रूप से, OpenAI peak throughput पर watt प्रति 1.5 से 1.9 गुना अधिक AI work और comparison systems की तुलना में 1.7 से 3.6 गुना कम end-to-end latency की घोषणा करता है, तथा अत्यधिक interactive loads पर 2.1 से 4.1 गुना अधिक performance तक पहुँचता है। तकनीकी रूप से, ये gains chip, memory, network, software और rack-scale system के co-design से आते हैं। inference दो phases से गुजरती है जिनकी bottlenecks अलग-अलग होती हैं: prefill, जो prompt को process करती है और computation को saturate करती है, और decode, जो tokens को एक-एक करके बनाती है और मुख्यतः memory bandwidth पर निर्भर करती है। Jalapeño data movement को न्यूनतम करने की कोशिश करती है; model state — KV cache सहित — को स्पष्ट रूप से रखा और local रखा जा सकता है, जबकि system phase के अनुसार computation, memory और network के सही संयोजन को सक्रिय करता है।
एक developer के लिए सबसे दिलचस्प हिस्सा chip के स्वयं के design में AI की भूमिका है। OpenAI बताता है कि वह प्रारंभिक design से tapeout तक नौ महीनों में पहुँचा, design, measurement और verification के cycles को छोटा करके। chip को AI के लिए भी और मनुष्यों के लिए भी एक पूर्वानुमेय programming target के रूप में बनाया गया: local tensors, explicit communication, predictable synchronization के माध्यम से वर्णित work। Codex और GPT-Astra के साथ, टीम ने production plan में अनुपस्थित तीन open-weight models को दो महीनों में port किया, और GPT-OSS के चुने हुए attention blocks और mixture-of-experts blocks पर, AI-generated kernels मानव experts द्वारा लिखी implementations की तुलना में 1.5 से 1.8 गुना तेज़ चलते हैं। सूक्ष्मता बनाए रखना ज़रूरी है: ये आंकड़े चुने हुए blocks पर लागू होते हैं, पूरे model पर नहीं। समय-सारिणी अभी भी सावधानीपूर्ण है — production qualification जारी है, software को परिपक्व होना है, OpenAI infrastructure में deployment वर्ष के अंत के लिए घोषित है, Gen 2 उन्नत विकास में है और Gen 3 आकार ले रहा है।
उसी दिन, Sarah Friar वह लेख प्रकाशित करती हैं जो इन सबके पीछे की आर्थिक तर्कशक्ति देता है। उसमें वह व्यापक compute portfolio का दावा करती हैं — आधार पर Microsoft और NVIDIA, तथा AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy और SoftBank द्वारा पूरक — एक ऐसा तर्क जो वाणिज्यिक होने के साथ-साथ तकनीकी भी है: आपूर्तिकर्ताओं के बीच विश्वसनीय विकल्प बनाए रखने से प्रत्येक workload को performance-price के सर्वोत्तम अनुपात की ओर निर्देशित करना और मूल्य अनुशासन बनाए रखना संभव होता है। एक ठोस आंकड़ा इस बात के साथ आता है: Artificial Analysis Coding Agent Index पर, अधिकतम reasoning में GPT-5.6 Sol एक नया रिकॉर्ड हासिल करता है, जबकि दूसरे अग्रणी model की तुलना में 54% कम output tokens का उपयोग करता है। पाठ अंततः Jevons paradox को स्वीकार करता है — intelligence को सस्ता बनाना उसकी खपत कम नहीं करता, बल्कि उसके लाभदायक उपयोगों का दायरा बढ़ाता है। Infrastructure पक्ष में, Georgia में Project Camellia को पानी के लिए बंद-लूप circuit और सार्वजनिक स्वतंत्र annual audit के अधीन प्रतिबद्धताओं के साथ प्रस्तुत किया गया है। OpenAI स्पष्ट करती है कि वह training और inference दोनों के लिए NVIDIA और अपने अन्य partners के accelerators को बड़े पैमाने पर deploy करना जारी रखेगी।
🔗 Jalapeño — पहले परिणाम · Abundant intelligence के पीछे का पूरा stack
Perplexity पोर्टेबल कंप्यूटर : सब कुछ मशीन पर चलता है, बेंचमार्क्स सहित
25 अगस्त — Perplexity Portable Computer लॉन्च कर रहा है, जो उसके Computer एजेंट का एक संस्करण है और पूरी तरह उपयोगकर्ता की मशीन पर चलता है। यह बदलाव रूप-सज्जा से अधिक वास्तुकला से जुड़ा है : यह केवल मॉडल ही नहीं है जो लोकल पर चलता है, बल्कि पूरी ऑर्केस्ट्रेशन श्रृंखला — ऑर्केस्ट्रेटर, प्लानर, टूल राउटर, शेड्यूलर, स्थायी टास्क क्यू और लोकल सर्च इंडेक्स।
आज हम @NVIDIA DGX Spark पर Portable Computer लॉन्च कर रहे हैं।
Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency.
🇮🇳 आज हम @NVIDIA DGX Spark पर Portable Computer लॉन्च कर रहे हैं। Portable Computer, Perplexity Computer का एक पूरी तरह स्थानीय संस्करण है, जहाँ पूरा रनटाइम वातावरण — ऑर्केस्ट्रेटर LLM, सब-एजेंट्स का LLM, एजेंट हार्नेस — आपके स्थानीय हार्डवेयर पर चलता है। क्लाउड पर कोई निर्भरता नहीं। — @perplexity_ai on X
यह घोषणा NVIDIA के साथ संयुक्त रूप से की गई है और शुरुआत में DGX Spark को लक्षित करती है — Grace Blackwell GB10 प्लेटफ़ॉर्म, Arm 20-कोर CPU, NVIDIA GPU, 128 GB unified memory — और बाद में RTX GPU वाले PCs तक विस्तार की घोषणा की गई है। दो मॉडल विकल्प दिए गए हैं, Qwen 3.8 27B या PPLX 27B, जो Perplexity द्वारा Qwen मॉडल का post-trained संस्करण है, और NVIDIA Nemotron 3.5 Lightning, एक खुला 30B मॉडल, भी selector में जोड़ा जाएगा। जो काम स्थानीय रूप से किया जाता है, वह कोई credit consume नहीं करता। cloud की ओर escalation अभी भी संभव है — up-to-date जानकारी, browser, connected apps, या 15 frontier models में से कोई एक — लेकिन इसके लिए उपयोगकर्ता की स्पष्ट अनुमति आवश्यक है। Google Drive, Gmail, Slack और GitHub connectors डिवाइस से ही काम करते हैं, dictation NVIDIA Nemotron 3.5 ASR Model के जरिए स्थानीय रूप से चलता है, बिना audio को मशीन से बाहर भेजे, और code execution isolated sandbox में होता है। Portable Computer Pro और Max subscribers के लिए उपलब्ध है जिनके पास DGX Spark है, पहले Linux पर, फिर Windows पर, और app से एक-click installation के साथ।
उसी दिन, engineering टीम उन आंकड़ों को प्रकाशित करती है जो इस लॉन्च का दस्तावेज़ीकरण करते हैं। थीसिस यह है कि model और harness को साथ-साथ डिज़ाइन किया जाना चाहिए : generic harness मानते हैं कि frontier model लंबे context को संभाल सकता है और विस्तृत horizon पर योजना बना सकता है, जो स्थानीय मॉडल अक्सर ठीक से नहीं कर पाते।
| मापा गया बेंचमार्क | Computer (Qwen 3.8 27B) | Pi | Hermes | Computer + PPLX 27B |
|---|---|---|---|---|
| Local Knowledge Work Bench (53 कार्य) | 82,6 % | 77,6 % | 74,0 % | 85,4 % |
| BrowseComp (1 266 कार्य) | 66,7 % | 50,2 % | 43,9 % | — |
| ParseBench-100 (बहु-माध्यम दस्तावेज़) | 65,1 % | 13,9 % | 34,6 % | — |
BrowseComp पर, Computer साथ ही 61 % कम समय और Hermes की तुलना में 16 % कम tokens खपत करता है, और Pi की तुलना में 51 % कम समय और 70 % कम tokens। डिज़ाइन के चार विकल्प इस अंतर को समझाते हैं : एक minimal system prompt, trajectory के दौरान load और unload होने वाली modularized skills, बहुत उपयोग किए जाने वाले connectors (Gmail, GitHub, Outlook, Google Calendar) को compact command-line tools में बदलना, बजाय MCP servers के रूप में expose करने के जिनकी definitions context खा जाती हैं, और हमेशा सक्रिय, non-configurable sandbox — यदि वह अनुपलब्ध हो, तो harness किसी भी tool call से पहले ही disable हो जाता है, बजाय non-isolated execution पर जाने के। Perplexity एक उपयोगी व्यावहारिक निष्कर्ष भी नोट करता है : Qwen 3.8 27B 260K tokens की window घोषित करता है, लेकिन empirically 100K के बाद लड़खड़ाने लगता है।
| Terminal Bench 2.1 (89 कार्य) | स्कोर | प्रति निष्पादन API लागत |
|---|---|---|
| Qwen 3.8 27B, 100 % स्थानीय | 59,6 % | लगभग 0 |
| Qwen 3.8 27B + Claude Opus 5 सलाहकार | 73,0 % | 0,415 USD |
| केवल Claude Opus 5 | 82,4 % | 0,65 USD |
advisor model की ओर escalation का तंत्र रिपोर्ट का सबसे दिलचस्प हिस्सा है : यह frontier के अंतर का लगभग तीन-पाँचवाँ हिस्सा उसकी लागत के लगभग दो-तिहाई के लिए वापस पा लेता है, और निर्णय उपयोगकर्ता के हाथ में रहता है। हर call से पहले, harness उपयुक्त context चुनता है, personal data classifier लागू करता है, और उपयोगकर्ता को दिखाता है कि क्या डिवाइस से बाहर जाएगा ; advisor model केवल text लौटाता है और फ़ाइलों या tools तक कोई direct access नहीं रखता। अंत में PPLX 27B का post-training, rejection fine-tuning के बाद Docker containers में चलाए गए synthetic environments पर reinforcement learning को जोड़ता है, बिना किसी वास्तविक उपयोगकर्ता data के। एक technical report और evaluation benchmark का open source में खुलना घोषित किया गया है।
🔗 स्थानीय harness के बेंचमार्क · Portable Computer — Perplexity पोस्ट
Claude : chat और Cowork के बीच एक ही memory, फ़ाइल-दर-फ़ाइल पढ़ने योग्य
25 अगस्त — Anthropic उन दो memory के बीच की सीमा हटा रहा है जो अब तक साथ-साथ मौजूद थीं। Claude आपके chat conversations से जो याद रखता है, वही अब Claude Cowork में भी उसके पास है, और इसका उलटा भी सच है। व्यवहार में, जब Cowork cloud में कोई task चलाता है, तो वह महीनों भर के संचित context के साथ शुरू होता है : तिमाही की प्राथमिकताएँ, projects की प्रगति की स्थिति, किसी interlocutor की लेखन-शैली की पसंद। Anthropic जानबूझकर ज़मीन से जुड़े उदाहरण देता है — अपने manager के लिए प्रगति-अपडेट माँगना, बिना यह बताए कि वह कौन है या वह व्यक्ति जानकारी कैसे प्राप्त करना पसंद करता है।
दूसरा बदलाव अधिक सूक्ष्म है लेकिन रोज़मर्रा के व्यवहार को बदलता है : memory बातचीत के दौरान ही अपडेट होती है, बाद में बने सारांश के माध्यम से नहीं। यह बताना कि कोई deadline सितंबर तक टाल दी गई है, अगली बातचीत में इसे ध्यान में रखने के लिए पर्याप्त है। “इसे याद रखो” वाक्यांश किसी विशिष्ट तत्व को जबरन सहेजने के लिए उपलब्ध रहता है, और memory को कभी भी pause या reset किया जा सकता है।
पारदर्शिता के मामले में, Anthropic ने black box की बजाय एक पढ़ने योग्य representation चुनी है : Claude जो कुछ भी याद रखता है, वह विषय के अनुसार वर्गीकृत छोटी फ़ाइलों के रूप में Settings फिर Memory में दिखाई देता है। हर फ़ाइल पढ़ी, सुधारी या हटाई जा सकती है। व्यावहारिक लाभ तुरंत मिलता है — अपनी कंपनी का पुराना नाम एक ही फ़ाइल में सुधार देना काफी है, और आगे की सभी conversations सही नाम का उपयोग करेंगी।
संवेदनशील विषयों का treatment product choices के लिहाज़ से सबसे दिलचस्प बिंदु है। डिफ़ॉल्ट रूप से, Claude स्वास्थ्य, मूल, ethnicity, धार्मिक विश्वास, राजनीतिक विचार या gender identity से संबंधित बातों को याद नहीं रखता। फिर भी Anthropic मानता है कि यह सीमा व्यक्तिगत है और इन विषयों को शामिल करने के लिए एक वैकल्पिक setting प्रदान करता है — ताकि recipes सुझाते समय Claude gluten intolerance याद रख सके। यह setting retroactive नहीं है और किसी भी समय बंद की जा सकती है। एक श्रेणी किसी भी setting पर हमेशा excluded रहती है : पहचान संख्या, आपराधिक इतिहास, प्रवासन स्थिति, और व्यापक रूप से वह सब जो Acceptable Use Policy का उल्लंघन करता है। Claude स्पष्ट रूप से बताता है जब वह इस प्रकार की जानकारी सहेज नहीं सकता, एक डिज़ाइन विकल्प जो मौन filtering के बजाय दृश्यमान अस्वीकृति को प्राथमिकता देता है।
| Memory का पहलू | वर्णित व्यवहार |
|---|---|
| दायरा | chat और Claude Cowork के बीच साझा एकीकृत memory |
| अपडेट का समय | बातचीत के दौरान, पहले की तरह अंत के बाद सारांश के बजाय |
| भंडारण स्वरूप | विषय अनुसार वर्गीकृत छोटी फ़ाइलें, एक-एक करके पढ़ने और संशोधित करने योग्य |
| संवेदनशील विषय | डिफ़ॉल्ट रूप से संग्रहीत नहीं, setting से सक्रिय किए जा सकते हैं, बिना retroactive प्रभाव के |
| स्थायी अपवाद | पहचान संख्या, आपराधिक इतिहास, प्रवासन स्थिति |
| Free, Pro और Max प्लान | web, desktop और mobile पर memory डिफ़ॉल्ट रूप से सक्रिय |
| Team और Enterprise प्लान | administrator द्वारा खुली, activation तक प्रति उपयोगकर्ता निष्क्रिय |
🔗 Claude की memory हर जगह काम करती है · @claudeai की घोषणा
IBM ने Granite 4.2, अपने पहले reasoning परिवार, और 470M के दो ASR मॉडल खोले
25 अगस्त — IBM Granite 4.2 प्रकाशित करता है, जिसे उसके पहले dense, decoder-only language model परिवार के रूप में प्रस्तुत किया गया है, जो स्पष्ट रूप से reasoning के लिए डिज़ाइन किए गए हैं। जहाँ पिछली पीढ़ियाँ दक्षता और पारंपरिक enterprise tasks पर केंद्रित थीं, यह संस्करण reasoning को केंद्र में रखता है और इसे modular बनाता है : हर मॉडल तीन modes expose करता है — thinking, non-thinking और low-effort — जिन्हें application उस latency और token budget के अनुसार चुनती है जो वह चुकाने को तैयार है। तीनों sizes (3B, 8B, 30B) एक ही architecture और एक ही pipeline साझा करते हैं, जिससे integration की दृष्टि से एक से दूसरे पर जाना बिना दर्द के होता है।
Architecture पारंपरिक है : 8 KV heads के लिए 40 heads वाली GQA attention, 131 072 token context बनाए रखने के लिए 10 million θ के साथ RoPE, SwiGLU MLP, RMSNorm normalization, CoreWeave द्वारा होस्ट किए गए NVIDIA GB200 NVL72 cluster पर bfloat16 training। pre-training लगभग 15 000 billion tokens से शून्य से शुरू होता है, जो पाँच phases में विभाजित हैं। Granite 4.2 को वास्तव में अलग बनाता है उसका post-training है : specialized steps की श्रृंखला में reinforcement pipeline, एक single pass के बजाय, asynchronous GRPO के साथ truncated importance sampling में, ताकि loop के generation और training halves कभी एक-दूसरे को block न करें। curriculum तीन verified-reward RLVR passes, instruction-following और code पर targeted amplifiers, 128K context में software engineering के दो चरण, एक terminal चरण, एक research चरण, फिर RLHF alignment को जोड़ता है। agentic reinforcement block केवल 8B और 30B models पर लागू होता है, जो 3B और उसके बड़े भाइयों के बीच agentic coding performance का अंतर समझाता है।
| IBM द्वारा प्रकाशित बेंचमार्क | 3B Dense | 8B Dense | 30B Dense |
|---|---|---|---|
| SWE-Bench Verified | — | 47,67 | 57,00 |
| SWE-Bench Multilingual | — | 30,78 | 41,89 |
| Terminal-Bench 2.1 | — | 20,56 | 29,24 |
| τ³-bench | 45,78 | 58,06 | 62,00 |
| AIME25 | 78,33 | 86,67 | 89,17 |
| GPQA | 54,80 | 64,14 | 66,41 |
| LiveCodeBench v6 | 69,71 | 73,24 | 75,77 |
| MMLU-Pro | 67,84 | 74,04 | 77,60 |
| RULER 128K | 55,30 | 71,41 | 81,38 |
प्रकाशन केवल bfloat16 weights तक सीमित नहीं है : रिलीज़ के साथ vLLM के लिए चार quantized variants भी दिए गए हैं — बिना calibration के dynamic per-channel FP8, और 2 000 SFT samples पर calibrated GPTQ के माध्यम से NVFP4 तथा MXFP4 — साथ ही llama.cpp के लिए Q2_K से Q8_0 तक चौदह GGUF formats। बारह भाषाएँ समर्थित हैं, जिनमें फ़्रेंच भी शामिल है, और तीन agentic coding harnesses पहले ही दिन प्रलेखित हैं : OpenCode, Pi और OpenHands। data quality पर, IBM एक श्रृंखला का विवरण देता है जहाँ GPT-OSS-120B और Gemma 4 SFT samples को अंक देने के लिए judges के रूप में काम करते हैं, उसके बाद SHA-256 hash द्वारा स्थानीय और वैश्विक deduplication होता है।
उसी दिन, IBM Granite Speech 5.0 Turbo CTC प्रकाशित करता है, अंग्रेज़ी speech recognition के दो 470 million-parameter models जो केवल अपने training data और license में भिन्न हैं — standard variant के लिए Apache 2.0, और अतिरिक्त data पर प्रशिक्षित variant के लिए CC-BY-NC-SA-4.0। architecture परिवर्तन उल्लेखनीय है : पहले के Granite Speech एक acoustic encoder, एक projector और एक LLM को जोड़ते थे, जबकि ये केवल encoder हैं। stack 16 Conformer blocks को जोड़ता है, आठवें block के आउटपुट पर self-conditioning लागू करता है, quadratic scaling से बचने के लिए dot-product attention को chunkwise attention से बदलता है, और सीधे CTC loss को optimize करता है। वास्तविक नवीनता token rate है : subsampling operations log-Mel spectrogram से output stream को 100 frames per second से घटाकर 12,5 per second कर देते हैं, जो नाम के “Turbo” को समझाता है। परिणाम OpenASR Leaderboard और दूर-क्षेत्र के लिए FFASR Leaderboard पर report किए गए हैं, अलग-अलग scores के बजाय गति/सटीकता के Pareto graphs के साथ, और Chrome तथा Edge तक सीमित browser में WebGPU के माध्यम से चलाया गया continuous recognition demonstration भी शामिल है।
🔗 Granite 4.2 — तकनीकी मार्ग · Granite Speech 5.0 Turbo CTC
WeatherNext Cyclones, नेशनल हरिकेन सेंटर द्वारा वास्तविक समय में उपयोग किया जाने वाला प्रमुख IA मॉडल
25 अगस्त — Google AI WeatherNext Cyclones का विवरण देता है, जो Google DeepMind और Google Research से निकला एक उष्णकटिबंधीय चक्रवात पूर्वानुमान मॉडल है। यह घोषणा कच्चे प्रदर्शन से कम, और इस बात से अधिक महत्वपूर्ण है कि यह मौसम IA के प्रयोगशाला से संचालनात्मक स्तर तक पहुँचने की कहानी क्या कहती है।
जिस समस्या पर काम किया गया है, वह संरचनात्मक है। अब तक, किसी चक्रवात को ट्रैक करने के लिए एक समझौता करना पड़ता था: सुपरकंप्यूटरों पर चलने वाले भौतिक मॉडल ग्रह भर में फैली बड़ी वायुमंडलीय संरचनाओं को अच्छी तरह पकड़ लेते हैं, लेकिन तूफ़ान की ताकत तय करने वाली स्थानीय और तीव्र भौतिकी को समझने के लिए पूरी तरह अलग क्षेत्रीय मॉडलों पर जाना पड़ता था। WeatherNext Cyclones इस आवागमन को हटाकर एक ही मॉडल में मार्ग, तीव्रता और आकार की भविष्यवाणी करता है।
बताया गया लाभ पिछले प्रणालियों की तुलना में पूरे एक दिन की अतिरिक्त अग्रिम चेतावनी का है। Google इसे एक स्पष्ट तरीके से प्रस्तुत करता है: तीन दिन के पूर्वानुमान अब पुराने दो दिन के पूर्वानुमानों जैसी सटीकता तक पहुँचते हैं, एक ऐसी प्रगति जिसके लिए ऐतिहासिक रूप से पद्धतिगत सुधारों के एक दशक की जरूरत पड़ती थी। दूसरा योगदान संभाव्यात्मक है: मॉडल इतना तेज़ है कि प्रति तूफ़ान 1,000 तक सिमुलेशन पैदा कर सकता है, जिससे एकमात्र “सबसे संभावित” मार्ग की जगह परिदृश्यों की एक श्रृंखला मिलती है। इससे तीव्र सुदृढ़ीकरण अधिक स्पष्ट होता है, जिसे 24 घंटे में अधिकतम निरंतर हवाओं में कम-से-कम 30 नॉट्स की वृद्धि के रूप में परिभाषित किया गया है। इस साल, WeatherLab के माध्यम से पूर्वानुमानकर्ताओं को प्रति तूफ़ान 1,000 संभाव्य पूर्वानुमान दिए जा रहे हैं।
सबसे महत्वपूर्ण पहलू वास्तविक तैनाती ही है। 2025 के हरिकेन मौसम के दौरान, WeatherNext Cyclones को अमेरिकी National Hurricane Center — यह पहली बार है कि इस संस्था ने वास्तविक समय संचालन में IA मॉडल का उपयोग किया — के भीतर परखा गया। मौसमविदों ने इसका उपयोग जमैका में हरिकेन Melissa के श्रेणी 5 पर लैंडफॉल के पूर्वानुमान के लिए किया, जिससे स्थानीय अधिकारियों को तैयारी के लिए अतिरिक्त समय मिला। Nature में एक लेख प्रकाशित हुआ है, और Google GitHub पर मॉडल के कोड और वज़न को open source में जारी करने की घोषणा करता है।
| मॉडल का पहलू | WeatherNext Cyclones का योगदान |
|---|---|
| पूर्वानुमानित मात्राएँ | एक ही पास में मार्ग, तीव्रता और आकार |
| अग्रिम चेतावनी लाभ | एक दिन; 3-दिन का पूर्वानुमान = पुराने 2-दिन वाले जितनी सटीकता |
| प्रति तूफ़ान सिमुलेशन | 1,000 तक |
| संचालनात्मक तैनाती | U.S. National Hurricane Center, 2025 हरिकेन मौसम |
| दस्तावेज़ित उपयोग-केस | जमैका में हरिकेन Melissa का श्रेणी 5 पर लैंडफॉल |
| तीव्रता की सीमा | 24 घंटे में 30 नॉट्स से अधिक निरंतर अधिकतम हवाएँ |
| उपलब्धता के तरीके | WeatherLab; code और weights GitHub पर open source में |
🔗 @GoogleAI घोषणा · Google DeepMind पोस्ट
Stability AI ने EA, Sony Music, Universal और Warner के साथ 76 मिलियन डॉलर की Series B पूरी की
25 अगस्त — Stability AI अपनी Series B के समापन की घोषणा करता है: 76 मिलियन डॉलर की नई पूंजी, जो जून 2024 में Prem Akkaraju द्वारा कंपनी का नियंत्रण संभालने के बाद से कुल वित्तपोषण को 232 मिलियन डॉलर तक ले जाती है, जिसमें दो equity rounds और convertibles शामिल हैं। राशि उद्योग के पैमाने पर मामूली बनी हुई है, लेकिन राउंड की संरचना ही असली विषय है।
मनोरंजन जगत के चार दिग्गज पूंजी में शामिल होते हैं: वीडियो गेम के लिए Electronic Arts, और संगीत के लिए Sony Music Group, Universal Music Group तथा Warner Music Group। रिकॉर्ड उद्योग की तीनों majors अब एक ही लैब की शेयरधारक हैं। इनके साथ AMD Ventures और Pacific Alliance Ventures भी जुड़ते हैं। ये निवेशक अचानक नहीं आए हैं: EA, Universal और Warner पहले से ही 2025 की शरद ऋतु से Stability AI के रणनीतिक साझेदार थे। इसलिए यह राउंड मौजूदा व्यावसायिक समझौतों को इक्विटी भागीदारी में बदल देता है।
दूसरा संकेत निवेशकों की निष्ठा से जुड़ा है। Coatue, Greycroft, Kadmos Capital, Sean Parker और Eric Schmidt नए नेतृत्व के तहत लगातार दूसरे राउंड में फिर से निवेश कर रहे हैं — जो Stability AI द्वारा 2023 और 2024 में झेले गए उथल-पुथल भरे दौर के बाद, पुष्टि के बराबर है। Coatue के सह-संस्थापक Thomas Laffont बोर्ड ऑफ़ डायरेक्टर्स में शामिल होते हैं, जहाँ पहले से James Cameron, Sean Parker, Dana Settle और Prem Akkaraju मौजूद हैं।
This unmatched group of investors is an affirmation of our vision where generative AI empowers every producer, musician, and storyteller. Stability is unique in the AI field because we are creative people making tools for creatives.
🇮🇳 निवेशकों का यह बेजोड़ समूह हमारे दृष्टिकोण की पुष्टि करता है — एक ऐसी जनरेटिव IA जो हर निर्माता, संगीतकार और कहानीकार को सशक्त बनाती है। IA के क्षेत्र में Stability अनोखी है क्योंकि हम स्वयं रचनात्मक लोग हैं, जो रचनात्मक लोगों के लिए उपकरण बनाते हैं। — Prem Akkaraju, Stability AI के CEO, 25 अगस्त की प्रेस विज्ञप्ति
स्वीकार की गई रणनीति एक niche लैब की है: कोई सामान्य-उद्देश्य मॉडल नहीं, बल्कि रचनात्मक पेशेवरों के लिए उपकरण, जो अधिकार-धारकों के साथ, उनके खिलाफ नहीं, बनाए गए हैं। यही Stable Audio 3.0 की दिशा है — खुले weights वाले मॉडलों की वह परिवार जिसे पूरी तरह licensed डेटा पर प्रशिक्षित किया गया है, और जिसे 18 अगस्त को audio workstations के लिए एक plugin से विस्तारित किया गया। यह धन उत्पाद-शृंखला, अनुप्रयुक्त शोध और पेशेवर सेवाओं वाले हिस्से को वित्तपोषित करेगा।
ChatGPT का एंटरप्राइज़ पक्ष: Admin plugin, multi-browser extension और 100 डॉलर की Premium seat
25 अगस्त — OpenAI की तीन घोषणाएँ एक ही दर्शक-समूह की ओर इशारा करती हैं: वे संगठन जो ChatGPT और Codex को बड़े पैमाने पर तैनात करते हैं।
सबसे महत्वपूर्ण है ChatGPT Work और Codex के लिए Admin plugin, जो उस सबको एक बातचीत में समेटता है जिसके लिए अब तक analytics dashboards, settings screens और reports के बीच घूमना पड़ता था। इसका दायरा रोज़मर्रा के कार्यों को कवर करता है: adoption और credits की खपत को समझना, अपनी सीमाओं के करीब पहुँच रहे सदस्यों या समूहों को पहचानना, आगमन और प्रस्थान को प्रबंधित करना, प्रभावी permissions की जाँच करना और access समस्या का निदान करना, usage limits को समायोजित करना और खर्च संबंधी अनुरोधों को वास्तविक खपत से मिलाकर तय करना। सबसे दिलचस्प हिस्सा बिना code लिखे automation है: लंबित usage requests को Slack या Microsoft Teams की ओर approval के लिए भेजा जा सकता है, उसी tool में जिसे approvers पहले से उपयोग कर रहे हैं; और किसी feature तक पहुँच के अनुरोधों को तब स्वतः मंज़ूरी दी जा सकती है जब वे पूर्वनिर्धारित मानदंडों को पूरा करते हों, जबकि अपवाद किसी मानव के पास भेज दिए जाते हैं। सुरक्षा की दृष्टि से महत्वपूर्ण बात: plugin उपयोगकर्ता की मौजूदा role और permissions के भीतर काम करता है और कोई अतिरिक्त access नहीं बढ़ाता; हर निर्देश को पढ़ने या लिखने की समर्थित action में map किया जाता है, और परिणाम structured होता है। OpenAI अपने ही उपयोग का उल्लेख करता है — Slack में एक ChatGPT Work agent आंतरिक IT requests को संभालता है, और deployed workflows लगभग 45% ticket volume को सुलझा देते हैं, backlog समाप्त कर देते हैं, जबकि support volume लगभग दोगुना हो चुका था।
दूसरी घोषणा, ChatGPT browser extension Chrome के दायरे से बाहर निकलती है और Microsoft Edge, Brave, Opera तथा Vivaldi को support करती है। यह बदलाव उन लोगों के लिए मायने रखता है जो privacy के कारण या enterprise बाध्यता के कारण किसी वैकल्पिक browser में काम करते हैं। दो उपयोगों पर जोर दिया गया है: ChatGPT Desktop में @ tab के माध्यम से खुले tabs का context किसी task में लाना, ताकि Codex पहले से प्रदर्शित documentation या ticket से काम करे; और agent को browser चलाने देना ताकि वह वास्तविक web tasks निष्पादित कर सके, जिनमें subscription रद्द करना दिए गए उदाहरणों में शामिल है।
तीसरी घोषणा, अधिक संक्षिप्त: 100 डॉलर की Premium seat ChatGPT Business ऑफ़र में जुड़ती है, छोटे व्यवसायों और startups को लक्षित करते हुए, और इसे team size के अनुसार flexible तथा scalable योजना के रूप में प्रस्तुत किया गया है। घोषणा X पर की गई थी, बिना किसी विस्तृत blog post के, और seat की सटीक संरचना संदेश में निर्दिष्ट नहीं है।
🔗 Admin plugin · Multi-browser extension · ChatGPT Business Premium seat
NVIDIA: RTX Spark के लिए Gamescom, और SANA ने MiniMax H3 की latency को 27 गुना घटाया
25 अगस्त — NVIDIA इस सप्ताह Cologne में चल रही Gamescom का लाभ उठाकर अपने इस पतझड़ में आने वाले RTX Spark Windows PC platform के catalog को विस्तारित कर रही है। Electronic Arts, Embark Studios और Ubisoft, KRAFTON, NetEase, Riot Games और XBOX के साथ जुड़ते हैं, जिन्होंने मई के COMPUTEX से ही प्रतिबद्धता जताई थी। नामित titles विभिन्न तकनीकी आवश्यकताओं को कवर करते हैं: EA की ओर से EA SPORTS F1 25 और Apex Legends, Ubisoft में Anno 117: Pax Romana, और Embark Studios में ARC Raiders तथा THE FINALS।
सबसे ठोस मुद्दा anti-cheat से जुड़ा है। कोई गेम चलाना पर्याप्त नहीं है: बड़े online titles anti-cheat प्रणालियों पर निर्भर करते हैं, जिन्हें हर platform पर port करना पड़ता है, वरना गेम multiplayer में खेलने योग्य नहीं रहता। NVIDIA घोषणा करती है कि वह EA के साथ मिलकर EA Javelin Anticheat को RTX Spark पर natively लाने पर काम कर रही है — यही वह infrastructure-detail है जो किसी नए PC platform की वास्तविक स्वीकृति तय करती है। rendering की ओर, DLSS 4.5 Ray Reconstruction तुरंत उपलब्ध है, जिसमें दूसरी पीढ़ी का transformer model क्लासिक denoisers की जगह एक supercomputer-प्रशिक्षित network लाता है। path tracing CONTROL Resonant और 007 First Light में आ रहा है, Gears of War: E-Day RTX Mega Geometry को एकीकृत करता है, और NVIDIA ACE technologies Aniimo में 2027 की शुरुआत के लिए घोषित हैं।
उसी अभिनेता का दूसरा पहलू, 24 अगस्त को, अधिक तकनीकी है। MiniMax, NVIDIA की SANA टीम द्वारा अपने H3 video model पर लागू Sol Engine से प्राप्त परिणामों को साझा करता है: एकल GB200 पर उत्पन्न 768p में 10 सेकंड की वीडियो 414 सेकंड से घटकर 14.93 सेकंड रह जाती है, यानी 27.7 गुना की गति-वृद्धि। यह विधि kernel optimization पर नहीं, बल्कि generation को दो passes में बाँटने पर आधारित है — H3 द्वारा 4 steps में कम-रिज़ॉल्यूशन draft, फिर Sol-Attn के साथ 3 steps में LTX को सौंपा गया target-resolution refinement pass। कुल सात steps। दूसरा leverage, महँगे VAE decodings को TAEH3 और TAEHV से बदला जाता है, जो हल्के decoders हैं, जबकि refinement pass के लिए latents को स्थिर रखा जाता है।
| MiniMax H3 पर मापन | मापी गई मान |
|---|---|
| मापी गई लोड | 768p में 10 s वीडियो, एकल GB200 |
| पहले की latency | 414 s |
| बाद की latency | 14.93 s |
| गति-गुणक | 27.7x |
| generation steps | 4 (कम-रिज़ॉल्यूशन H3 draft) + 3 (LTX) |
| प्रतिस्थापित decoders | VAE decodes के स्थान पर TAEH3 और TAEHV |
| प्रक्षेपित throughput प्रति node | 378,000 वीडियो प्रति माह, 97% से अधिक GPU margin |
प्रक्षेपित throughput MiniMax का अनुमान है, production मापन नहीं, और इसे वैसा ही पढ़ा जाना चाहिए। लेकिन दिशा स्पष्ट है: 10 सेकंड की वीडियो के लिए 15 सेकंड पर, उच्च-निष्ठा video generation असिंक्रोनस batch rendering से निकलकर लगभग interactive infrastructure की ओर बढ़ रही है।
🔗 Gamescom में NVIDIA · H3 पर SANA और Sol Engine
चीनी open models शोध का संदर्भ बन रहे हैं, और Qwen3.8-27B Code Arena के शीर्ष 10 में प्रवेश करता है
25 अगस्त — Qwen उसी सुबह दो परिणाम साझा करता है, और दूसरा पहले का अर्थ स्पष्ट कर देता है।
पहला एक ranking है। Qwen3.8-27B, Code Arena: WebDev ranking में प्रवेश करता है, जो web interface generation पर models का मूल्यांकन करती है, और 1595 points के साथ समग्र रूप से 9वें स्थान पर है। यह अपनी आकार-श्रेणी का top 10 में एकमात्र model है, और Qwen3.8-Max, जो कहीं बड़ा है, से केवल छह स्थान पीछे है। Arena बताता है कि यह ranking की Pareto frontier को फिर से आकार दे रहा है, और एक स्पष्ट संदर्भ देता है: Gemma 4-31B, जो आकार में तुलनीय है लेकिन अप्रैल में जारी हुआ था, 80वें स्थान पर है।
| मूल्यांकित मॉडल | Code Arena: WebDev रैंक | प्राप्त अंक | रैंकिंग टिप्पणी |
|---|---|---|---|
| GLM-5.3 (Max) | समग्र रूप से 8वाँ | 1597 | 20 अगस्त का आँकड़ा, open models में 2रा |
| Qwen3.8-27B | समग्र रूप से 9वाँ | 1595 | top 10 में अपनी आकार-श्रेणी का एकमात्र model |
| Qwen3.8-Max | 27B से छह रैंक आगे | n.c. | उसी family का कहीं बड़ा model |
| Gemma 4-31B | समग्र रूप से 80वाँ | n.c. | अप्रैल 2026 में जारी |
दूसरा परिणाम उपयोग का माप है। Ai2 में Olmo project का सह-नेतृत्व कर चुके Nathan Lambert ने Codex से ChatGPT की रिलीज़ के बाद से प्रकाशित 500,000 arXiv IA और machine learning articles की छंटनी करवाई, ताकि शोध में वास्तव में उपयोग किए जा रहे open models की पहचान की जा सके। उलटफेर दो आँकड़ों में निहित है: 2024 में, लगभग 30% articles में एक अमेरिकी open model का उल्लेख था, जबकि 10% में चीनी model का; आज, लगभग 40% एक चीनी open LLM का उल्लेख करते हैं और केवल 25 से 30% एक अमेरिकी का।
| मॉडल परिवार | LLM का उल्लेख करने वाले लेखों का हिस्सा |
|---|---|
| OpenAI (closed models) | लगभग 37 % |
| Qwen | लगभग 33 % |
| Gemini, Claude | 10 से 15 % |
| Gemma, Mistral | 5 से 10 % |
| Olmo | लगभग 1 % |
विवरण में, Qwen का उल्लेख उन लेखों के एक-तिहाई में है जो किसी भी LLM का हवाला देते हैं। Llama ने लगभग अप्रैल 2025 में 30% पर अपना शिखर छुआ, ठीक उसी समय जब Llama 4 जारी हुआ था, और तब से घट रहा है। Lambert स्वयं एक महत्वपूर्ण सीमा बताते हैं: publications मॉडल releases से पीछे चलती हैं, क्योंकि शोध में समय लगता है — ये आँकड़े मौजूदा कार्य की स्थिति बताते हैं, न कि तत्काल प्राथमिकताओं को। एक व्यापक प्रवृत्ति समानांतर में पढ़ी जा सकती है, जो open बनाम closed के द्वंद्व से अलग है: IA articles में LLM का उल्लेख करने का अनुपात जनवरी 2023 में 10.43% से बढ़कर 2026 में 50% से अधिक हो गया है।
🔗 Code Arena पर Qwen3.8-27B · arXiv विश्लेषण पर Qwen का पुनर्प्रसारण · @natolambert विश्लेषण
Claude Code 2.1.245 में चला गया है, और वेब पर Claude का रेंडरिंग 4 गुना अधिक स्मूद हो गया है
Claude Code के दो संस्करण इस विंडो में जारी हुए हैं, और उनकी सामग्री स्पष्ट रूप से संगठनात्मक डिप्लॉयमेंट्स को लक्षित करती है। CHANGELOG में तारीखें नहीं हैं, लेकिन Git इतिहास उन्हें जगह देता है: 2.1.243 24 अगस्त के 23:40 UTC वाले कमिट पर दिखाई देता है, और 2.1.245 25 अगस्त के 05:13 UTC वाले कमिट पर।
| जोड़ी गई सेटिंग | संबंधित संस्करण | व्यावहारिक लाभ |
|---|---|---|
modelPricing | 2.1.243 | /cost में संविदात्मक दरें, स्टेटस बार और टेलीमेट्री |
modelPicker | 2.1.243 | /model के लिए क्रमबद्ध और लेबलयुक्त मॉडल सूची |
promptCacheTtl / subagentPromptCacheTtl | 2.1.243 | बातचीत पर एक घंटे का prompt cache, subagents पर 5 मिनट |
/usage में Ventilation Loops | 2.1.243 | भटकने वाले /loop कार्यों को पहचानना |
| Console के माध्यम से बिना key के कनेक्शन | 2.1.243 | वे संगठन जो API keys पर रोक लगाते हैं |
| glibc 2.44 सुधार | 2.1.245 | Arch Linux, CachyOS और Fedora Rawhide पर startup crash |
सबसे निर्णायक सेटिंग modelPricing है: अब तक दिखाए गए costs public rate पर आधारित थे; अब कोई organization अपने contract rates प्रति मॉडल और अपने discount coefficient को इसमें inject कर सकती है, जिससे आंकड़े सीधे internal re-invoicing के लिए उपयोगी बन जाते हैं। promptCacheTtl और subagentPromptCacheTtl का जोड़ा API key उपयोगकर्ताओं के लिए एक ठोस आर्थिक समझौता संभालता है: मुख्य बातचीत पर एक घंटे का cache रखना, जहाँ context स्थिर रहता है, जबकि subagents को केवल पाँच मिनट देना, क्योंकि उनके contexts अधिक volatile होते हैं। सुधारों की तरफ, non-interactive mode में remote MCP servers अब disconnect के बाद अटके नहीं रहते, /resume अब केवल सबसे हाल की पचास sessions तक सीमित नहीं है, और दस मिनट से अधिक मौन रहने वाली sessions अब लगभग तीन मिनट बाद expire हो जाती हैं, फिर retry और एक स्पष्ट error दिया जाता है।
24 अगस्त को Anthropic ने यह भी बताया कि उसने Claude web और desktop पर generation के दौरान responses दिखाने वाले engine को फिर से लिखा है। UI rendering में सिद्धांत सीधा है: हर नए fragment पर पूरी response को redraw करने के बजाय केवल उसी हिस्से को छूना जो अभी बदल रहा है। लंबी response पर फर्क संरचनात्मक होता है — render cost पहले से दिखाए गए text की लंबाई के साथ बढ़ना बंद कर देता है। घोषित gains संगत हैं: लगभग 4 गुना अधिक fluidity, कमज़ोर laptop पर 9 गुना कम blocking, सबसे खराब interface freeze 4.5 गुना छोटा, और 120 Hz MacBook पर शुरुआत से अंत तक 120 frames per second टिके रहना। दिलचस्प बात लक्षित audience है: सबसे ज़्यादा लाभ modest configurations को मिलता है।
🔗 Claude Code CHANGELOG · 4x अधिक स्मूद रेंडरिंग, @ClaudeDevs
कोड एजेंट्स औद्योगिक रूप ले रहे हैं: Warp ने अपने factories का format प्रकाशित किया, Rohlik अपना 90% code agents से लिखवा रहा है
24 अगस्त के दिन के अंत में — Warp अपने cloud agent प्लेटफ़ॉर्म Warp Factories की आंतरिक mechanics दिखाता है, जिसकी घोषणा 18 अगस्त को की गई थी: चुना गया configuration format, और early access का खुलना। शुरुआती बिंदु स्पष्ट है — गुणवत्ता और लागत के कारण Warp अपने ही agents को local machines से हटाकर बाहर ले जा रहा है, और उसे versioned code की तरह environments, harnesses और security permissions का वर्णन करना था।
| कॉन्फ़िगरेशन तत्व | चुनी गई वैल्यू |
|---|---|
| परिभाषा फ़ाइल | factory.yaml, schemaVersion: v1alpha1 |
| मुख्य keys | name, repositories (owner / name), agentDefaults.model |
| किसी agent की परिभाषा | agents/<nom>/agent.md के साथ agentType (FOREMAN, REVIEW…) और model |
| ट्रिगर्स | automations/<nom>/automation.md : agent, triggers (provider, event) |
| उपलब्ध interfaces | CLI (warp agent run-cloud), REST API, TypeScript SDK, MCP server |
| early access | योग्य ग्राहकों के लिए 10,000 USD तक का मुफ्त उपयोग |
विभाजन दिलचस्प है: agents को एक ही YAML में नहीं बल्कि समर्पित Markdown फ़ाइलों में वर्णित किया गया है, इसलिए किसी agent की परिभाषा एक पढ़ने योग्य और diff करने योग्य document बन जाती है। Warp इस recipe को अपने ऊपर लागू करता है — उसका internal factory, “wilson” नाम से, warp-server या warp-terraform जैसे repositories को कवर करता है, अपने secrets और MCP servers घोषित करता है, और अपने agents को role के अनुसार (code-review, foreman, implementation, spec, triage) 34 lines में व्यवस्थित करता है। access request page पर दिए गए आँकड़े बाहरी रूप से सत्यापित न किए जा सकने वाले commercial claims हैं: प्रति दिन 200,000 agent runs, 30% से अधिक pull requests बिना संशोधन के merged, प्रति pull request 20% कम cost।
25 अगस्त को Cognition ने अपनी ओर से पिछली रिपोर्ट की तुलना में कहीं अधिक दस्तावेज़ीकृत case study प्रकाशित की। Rohlik Group एक ऑनलाइन grocery distributor है, जो चेक गणराज्य में जन्मा, पाँच देशों में मौजूद, लाभदायक, और पिछले साल 1.3 बिलियन डॉलर से अधिक के revenue वाला है; यह 17,000 उत्पादों की एक पूरी weekly basket एक घंटे से कम समय में या पंद्रह मिनट की time slot पर deliver करता है। लेख को संरचित करने वाला आँकड़ा: आज लगभग 90% code agents द्वारा generated है, और engineering organization खुद को “agent-mostly” कहती है।
यह परिणाम केवल एक tool जोड़ देने से नहीं मिला। Rohlik कहता है कि उसने एक साल पहले शुरुआत की, Devin के साथ एक पहली experience से, जिसे buggy माना गया। खेल बदलने वाली चीज़ client side पर रखी गई foundations थीं: पचास से अधिक internal और external MCP integrations, इस सिद्धांत के साथ कि कोई भी नया tool पहले दिन से agents के लिए उपलब्ध होना चाहिए; Snowflake data warehouse के ऊपर एक semantic layer; और एक knowledge base जो agents को वह context देती है जो किसी नए colleague को दिया जाता। काम वहीं से Devin तक पहुँचता है जहाँ वह जन्म लेता है — किसी bug पर Slack conversation या Linear specification document से लेकर pull request तक। दावे किए गए परिणाम — नवंबर के बाद engineering throughput दोगुना, AutoStore robotics integration आठ महीनों में deliver, जबकि उद्योग में दो से तीन साल लगते हैं, prototyping एक महीने से घटकर एक दिन — फिर भी supplier द्वारा प्रकाशित client page के ही हैं। सबसे बोलने वाला प्रभाव कहीं और है: सर्वश्रेष्ठ engineers अब अपना 80% समय code review करने में लगाते हैं, और Rohlik में Devin के उपयोग का लगभग 30% business users द्वारा data analysis है।
🔗 factory.yaml format, @warpdotdev · Rohlik case study, @cognition · Devin client page
GitHub: agentic workflows पर चार अभ्यास और Customize टैब सामान्य उपलब्धता में
25 अगस्त — GitHub अपने learning platform GitHub Skills पर चार नए अभ्यास ऑनलाइन करता है। रुख स्पष्ट है: वर्ष की agentic नई चीज़ों का दस्तावेज़ीकरण करने के बजाय, GitHub उन्हें एक demo repository में अभ्यास करने देता है, pull requests के माध्यम से चरण-दर-चरण दिए गए निर्देशों के साथ।
| प्रकाशित अभ्यास | अभ्यास का विषय |
|---|---|
| Agent Orchestration Build Your AI Dream Team | Copilot CLI में custom agents: plan, design, build, validate, hand off |
| Agentic Workflows that Read the Room | gh aw extension, Markdown में agentic workflow, pull requests के जरिए प्रस्तुत बदलाव |
| Idea to Merge with the Copilot App | एक session से merged pull request तक, पूरी तरह GitHub Copilot app के भीतर |
| Ship with Quality | स्वचालित quality signals, test coverage, pull requests पर enforced checks |
इन चारों में सबसे उल्लेखनीय पहला है: यह पहली बार है जब GitHub ने अपनी CLI में multi-agent orchestration पर एक guided path दिया है, जो अब तक केवल prose में दस्तावेज़ीकृत था। दूसरा gh aw extension पेश करता है, और सुरक्षा के लिए एक महत्वपूर्ण बिंदु है — workflow द्वारा प्रस्तावित बदलाव सीधे लागू होने के बजाय pull requests के माध्यम से जाते हैं, जिससे human review का एक बिंदु बना रहता है।
उसी दिन, GitHub Copilot app को सामान्य उपलब्धता में Customize टैब मिलता है। इसका काम पिछले महीनों में अलग-अलग पेश किए गए चार extension mechanisms को एक ही surface पर लाना है: MCP servers, plugins, skills और canvases। एक Featured view प्रत्येक category से चुनी गई editorial selection प्रस्तुत करती है, उस user के लिए जो जानता है कि उसे क्या करना है लेकिन यह नहीं जानता कि कौन-सा extension type उसकी ज़रूरत पूरी करेगा; और MCP servers को अपनी अलग navigation मिलती है, जिसमें popularity के आधार पर विकल्पों को सामने रखा जाता है और category-wise path दिया जाता है। changelog canvases की उपयोगिता को एक ठोस उदाहरण से दिखाता है: issues को sort करने, backlog को प्राथमिकता देने, follow-ups assign करने, और फिर Copilot को एक task सौंपने के लिए एक Azure DevOps canvas, ताकि वह जाँच करे, implement करे या review तैयार करे।
🔗 चार GitHub Skills अभ्यास · सामान्य उपलब्धता में Customize टैब
डेवलपर्स के लिए Google का टूलिंग: Gemini CLI 0.57.0 और Antigravity 2.10.0
25 अगस्त — Google Gemini CLI 0.57.0 का स्थिर संस्करण जारी करता है, और उसके पंद्रह मिनट पहले 0.58.0 preview आती है। इस संस्करण की सामग्री नई सुविधाओं के बारे में कम और इस बारे में अधिक बताती है कि Google अपने tool का रखरखाव कैसे करता है: changelog की 24 प्रविष्टियों में से 13 [SSR Agent] Issue Fix से शुरू होती हैं और अक्सर पुरानी issues, 19239 से 28518 तक, के नंबरों की ओर इशारा करती हैं। ये सुधार backlog में जमा irritants को संबोधित करते हैं — terminal interface का अनिश्चितकालीन hang, जिसमें अब timeouts जोड़े गए हैं; personal accounts के लिए भ्रामक administration error message; autocomplete suggestions के बाद space की कमी; बाहरी editor से output देने पर terminal rendering का refresh न होना। दूसरे शब्दों में, Google अपनी technical debt पर भी एक agent चलाता है, और नतीजा सीधे स्थिर संस्करण में पहुँचता है।
| जारी संस्करण | दिनांक और समय (UTC) | रिलीज़ चैनल | मुख्य बिंदु |
|---|---|---|---|
| v0.57.0 | 25 अगस्त, 18:37:14 | Stable | 13 [SSR Agent] सुधार, evals validation, contextual retries |
| v0.58.0-preview.0 | 25 अगस्त, 18:22:01 | Preview | macOS Seatbelt profile में Docker isolation, safety checks |
फ़ीचर्स की तरफ, प्रयास evaluation पर है, जिसमें evals validation कमांड और failure summaries को शामिल करने वाला tool-call formatter है। विश्वसनीयता भी बढ़ती है: capacity errors silent retries को trigger करते हैं जो context को ध्यान में रखते हैं, और multi-turn request का cancellation partial state के बजाय पूर्ण rollback कराता है। version notes खोजने वालों के लिए ध्यान दें: repository की docs/changelogs/index.md फ़ाइल को 6 अगस्त की v0.54.0 के बाद अपडेट नहीं किया गया है।
2.9.1 और उसके Remote Control के चार दिन बाद, Google Antigravity 24 अगस्त को 2.10.0 पर चला जाता है और दो कमियों को पूरा करता है जिनके कारण tool से बाहर निकलना पड़ता था: एक integrated terminal और Git का native version control, दोनों सीधे sidebar में रखे गए हैं। यह regrouping उत्पाद की trajectory के अनुरूप है — Antigravity खुद को एक ऐसे environment के रूप में स्थापित करता है जहाँ code को line by line edit करने के बजाय agents को संचालित किया जाता है; लेकिन इसके लिए कम से कम एक command चलानी और window बदले बिना diff inspect करना संभव होना चाहिए। संस्करण का बाकी हिस्सा यह बढ़ाता है कि किसी agent को क्या सौंपा जा सकता है और उसके काम से क्या देखा जा सकता है: audio files accepted attachments में जुड़ते हैं, images पर interactive comment एक visual को annotate करने देता है ताकि agent को दिशा दी जा सके, और MCP tools के enriched execution previews यह पढ़ने योग्य बनाते हैं कि किसी tools server ने वास्तव में क्या किया। Google इस संस्करण को 13 सुधारों और 8 सुधारात्मक कार्रवाइयों के रूप में गिनता है, progressive rollout के साथ।
🔗 Gemini CLI v0.57.0 · Antigravity changelog
Anthropic कल्याण पर स्वतंत्र मूल्यांकन के लिए 5 मिलियन डॉलर का वित्तपोषण करता है
25 अगस्त — Anthropic 5 मिलियन डॉलर का एक bursary program शुरू करता है, जिसका उद्देश्य अपने उपयोगकर्ताओं के कल्याण पर AI के प्रभाव पर स्वतंत्र शोध को वित्तपोषित करना है। विजेताओं को प्रत्यक्ष funding, models तक access और technical support मिलता है, लेकिन वे पूरी स्वतंत्रता से काम करते हैं: उनके assessments open source में प्रकाशित किए जाते हैं और पूरे उद्योग द्वारा पुन: उपयोग योग्य होते हैं। आवेदन 21 सितंबर तक खुले हैं, और पूरी proposal जमा करने के लिए चुने गए candidates को 5 अक्टूबर से पहले सूचना दी जाएगी।
तकनीकी तर्क बताता है कि यह क्षेत्र सामान्य evaluation विधियों के प्रति क्यों प्रतिरोधी है। किसी model के अधिकांश व्यवहारों के लिए, बस एक अलग response देखना पर्याप्त होता है यह तय करने के लिए कि वह सटीक और उपयुक्त है या नहीं। कल्याण के लिए context चाहिए: संकट में पड़ा user अपनी आत्म-हानि से जुड़ी सोच को शुरू में ज़रूरी नहीं बताता, और संतुलित diet पर दिए गए उचित advice, यदि व्यक्ति ने eating disorder का इतिहास दिखाया हो, तो संभावित रूप से खतरनाक हो सकते हैं। Safeguards team समानांतर में पाँच rigour criteria प्रकाशित करती है: यह स्पष्ट करना कि क्या मापा जा रहा है, design में clinicians और domain specialists को शामिल करना, दोनों तरह की सावधानियों और हानियों का परीक्षण करना — यानी excessive compliance के जोखिम और excessive refusal के जोखिम, दोनों का मूल्यांकन —, multi-turn scenarios के जरिए वास्तविक उपयोग को प्रतिबिंबित करना, और automatic correctors को वास्तविक experts के खिलाफ मान्य करना। यह तीसरा criterion, over-conformity और over-refusal के बीच symmetry, वही है जो इस approach को guardrails के साधारण सख्तीकरण से अलग करता है।
Quantization-Aware Healing : एक 4-बिट मॉडल जो अपनी पूर्ण-परिशुद्धता वाली मूल प्रति से आगे निकल जाता है
25 अगस्त — एक बड़े मॉडल को तैनाती योग्य बनाने के लिए मानक पाइपलाइन तीन चरणों में चलती है: आर्किटेक्चर को संपीड़ित करना, परिणाम को क्वांटाइज़ करना, और फिर गुणवत्ता में आई गिरावट की मरम्मत करना। इस अंतिम चरण के लिए प्रमुख नुस्खा QAT (quantization-aware training) है, जो नकली क्वांटाइज़ेशन ऑपरेशनों को जोड़कर फिर से प्रशिक्षण देता है; एक वैकल्पिक तरीका QAD है, जो संपीड़ित मॉडल से पूर्ण परिशुद्धता में डिस्टिल करता है। दोनों ही मामलों में, छात्र अधिकतम अपने संपीड़ित शिक्षक की बराबरी ही कर सकता है, और इस तरह संपीड़न द्वारा तय की गई ऊपरी सीमा को ही विरासत में लेता है।
Multiverse Computing एक पंक्ति के बदलाव का प्रस्ताव करता है: सीधे मूल मॉडल, यानी संपीड़न से पहले वाले मॉडल, से डिस्टिल करना। तब क्वांटाइज़ेशन हानि-युक्त पोस्ट-प्रोसेसिंग बनना बंद कर देती है और अपने आप में एक प्रशिक्षण चरण बन जाती है। परिणाम सहज ज्ञान के विपरीत है — GPT-OSS 120B पर लागू करने पर, जिसे 60B तक संपीड़ित किया गया और फिर MXFP4 में क्वांटाइज़ किया गया, यह विधि एक 4-बिट मॉडल बनाती है जो नौ में से सात बेंचमार्क पर अपनी ही bfloat16 स्रोत प्रति के बराबर या उससे बेहतर प्रदर्शन करता है, और जहाँ संपीड़न सबसे अधिक नुकसान करता है वहाँ सबसे बड़े लाभ देती है: लंबे संदर्भ वाले तर्क में AA-LCR पर +7.4 अंक और AIME 2025 पर +5.6। केवल दो गिरावटें, MMLU-Pro और SciCode पर, डेढ़ अंक से कम रहती हैं।
एक समान पाइपलाइन वाले QAT के साथ सीधी तुलना शायद व्यवहार में सबसे उपयोगी परिणाम है। MXFP4 में क्वांटाइज़ किए गए GPT-OSS 9B पर, दोनों विधियाँ लगभग समान शिखर तक पहुँचती हैं, 54.9 बनाम 54.6, लेकिन कीमत एक जैसी नहीं है: QAH यह लगभग सौ चरणों में हासिल कर लेता है और वहीं बना रहता है, जबकि QAT को वहाँ पहुँचने में लगभग 700 चरण लगते हैं और उसके बाद वह गिरावट दिखाता है। इसका ठोस परिणाम एक अलग प्रकार का परिनियोजन जोखिम है — QAT चेकपॉइंट के लिए अर्ली स्टॉपिंग की सावधानीपूर्वक निगरानी चाहिए, जबकि QAH चेकपॉइंट के लिए बहुत कम।
Gradio में gr.Workflow जोड़ा गया, ग्राफ-आधारित AI पाइपलाइन बिल्डर
25 अगस्त — Hugging Face एक गाइड प्रकाशित करता है जो gr.Workflow प्रस्तुत करता है, जो अब Gradio में समाहित एक प्रिमिटिव है। शुरुआती निष्कर्ष सरल है: अधिकांश दिलचस्प AI एप्लिकेशन एक मॉडल कॉल नहीं होते, बल्कि एक श्रृंखला होते हैं — आप एक छवि बनाते हैं, उसका बैकग्राउंड हटाते हैं, उससे वॉइस-ओवर निकालते हैं, और किसी LLM से शीर्षक माँगते हैं। अब तक, इस श्रृंखला को जोड़ने और उसे साफ़-सुथरे ढंग से प्रदर्शित करने के लिए लॉजिक और इंटरफ़ेस, दोनों लिखने पड़ते थे। gr.Workflow इन दोनों को मिला देता है: आप चरणों को टाइप्ड नोड्स के ग्राफ के रूप में वर्णित करते हैं, और वही ग्राफ इंटरफ़ेस बन जाता है।
डेवलपर्स के लिए इसका लाभ केवल दृश्य डेमो से आगे जाता है। ग्राफ का हर आउटपुट स्वतः अपना REST endpoint प्राप्त करता है: उदाहरण में दिया गया मीडिया स्टूडियो, जो FLUX जनरेशन, बैकग्राउंड रिमूवल, स्पीच सिंथेसिस और एक LLM को क्रम से जोड़ता है, तीन अलग-अलग रूट (/sticker, /voiceover, /episode_title) उजागर करता है जिन्हें इंटरफ़ेस के बिना कोड से बुलाया जा सकता है। नोड्स चार दुनियाओं से बात कर सकते हैं — Hugging Face के Inference Providers के माध्यम से होस्ट किए गए मॉडल, अन्य सार्वजनिक Gradio Spaces जिन्हें बिल्डिंग ब्लॉक्स की तरह पुन: उपयोग किया गया है, Hub डेटासेट की एक पंक्ति, और मनमाना Python। आखिरी बिंदु सबसे अधिक दरवाज़े खोलता है: @spaces.GPU से सजाया गया एक ऑपरेटर नोड अपने निष्पादन के लिए ZeroGPU GPU आरक्षित करता है, जिससे अपने स्वयं के वेट्स चलाना संभव हो जाता है। गाइड के साथ Spaces में वास्तव में तैनात पाँच एप्लिकेशन भी हैं, जिनमें एक डेटासेट प्रोफ़ाइलर और Lightricks/LTX-Video के साथ एक स्थिर छवि को एनिमेट करने वाला डेमो शामिल है।
ElevenLabs ने Composer लॉन्च किया, एक ऐसा गीत-संपादक जो सेक्शन-दर-सेक्शन काम करता है
25 अगस्त — ElevenLabs Composer की घोषणा करता है, जो सेक्शन-दर-सेक्शन काम करने वाला एक गीत-संपादक है। यह सिद्धांत संगीत मॉडलों की प्रमुख जनरेशन शैली को तोड़ता है: पूरे गीत को एक ही पास में बनाने और जब कोई हिस्सा जँच न पाए तो सब कुछ फिर से चलाने के बजाय, Composer आपको किसी एक पद्य, कोरस या ब्रिज को अलग से फिर से करने देता है। चार शुरुआती विकल्प दिए गए हैं — आपके अपने बोल, आपके द्वारा लाई गई कोई मौजूदा ट्रैक, एक खाली पृष्ठ, या एक साधारण प्रॉम्प्ट — और फिर गीत क्रमिक संपादनों के माध्यम से बनता है।
यह ElevenLabs का संगीत की ओर दूसरा कदम है, Eleven Music के बाद, और यह कंपनी के लिए एक व्यस्त सप्ताह में आता है, क्योंकि CLI v1 एक दिन पहले ही जारी हुआ था। यह स्थिति ऑडियो क्षेत्र के बाकी हिस्सों के अनुरूप है: Suno ने 13 अगस्त को Studio 2.0 लॉन्च किया, Pika ने 18 अगस्त को अपनी Pika Music श्रृंखला जारी की, और Stability AI ने उसी दिन अपने ऑडियो वर्कस्टेशन प्लगइन की डिलीवरी की। गीत की संरचना पर सूक्ष्म नियंत्रण, बजाय केवल जनरेशन की कच्ची गुणवत्ता के, अब प्रतिस्पर्धा का मैदान बन गया है। एक सावधानी, हालांकि: घोषणा के साथ कोई ब्लॉग पोस्ट नहीं है, और Composer तक पहुँच देने वाली योजनाओं, निर्यात प्रारूपों, या API एक्सेस के बारे में कुछ भी उपलब्ध नहीं है।
LiveAvatar ने सभी concurrency सीमाएँ हटा दीं और कीमत 0.01 USD प्रति मिनट तक घटा दी
25 अगस्त — HeyGen अपने रीयल-टाइम अवतार उत्पाद LiveAvatar पर concurrency सीमाओं को हटाने की घोषणा करता है। शब्दावली बदलाव की प्रकृति पर ज़ोर देती है: सीमाएँ बढ़ाई नहीं जा रही हैं, वे पूरी तरह समाप्त हो रही हैं। एक सत्र हो या दस हज़ार, सभी एक ही API पर चलते हैं, बिना किसी पूर्व quota वार्ता के। घोषणा के साथ दो पैरामीटर दिए गए हैं — आउटपुट अभी भी 1080p full-body रहता है, और पैमाने पर कीमत 0.01 USD प्रति मिनट तक गिरती है।
यह मूल्य स्तर संभावित उपयोगों की प्रकृति बदल देता है: एक cent प्रति मिनट पर, रीयल-टाइम अवतार बड़े पैमाने के ग्राहक समर्थन, प्रशिक्षण, या इंटरैक्टिव कियोस्क के लिए व्यावहारिक हो जाता है, ऐसे मामले जहाँ इकाई लागत अब तक व्यवहार्यता तय करती थी। concurrency सीमा को हटाना तकनीकी रूप से सबसे दिलचस्प बिंदु है। रीयल-टाइम अवतार प्लेटफ़ॉर्म आम तौर पर एक साथ चलने वाले सत्रों की संख्या पर सीमा लगाते हैं क्योंकि हर सत्र लगातार GPU उपयोग करता है; इस सीमा को हटाने का अर्थ है या तो पर्याप्त क्षमता मार्जिन, या मॉडल पर दक्षता में सुधार। HeyGen अपने तरीके को समझाने वाला एक लेख प्रकाशित करता है, जिसके तकनीकी विवरण स्कैन के समय उपलब्ध नहीं थे।
🔗 LiveAvatar पर असीमित concurrency
Grok 4.6 OpenCode Go में आ गया है
25 अगस्त — Grok 4.6, OpenCode Go में शामिल हो गया है, जो ओपन-सोर्स कोड एजेंट OpenCode की सदस्यता-आधारित पेशकश है। घोषणा दिन के अंत में OpenCode की ओर से आती है, और @grok अकाउंट आधे घंटे बाद इसे पुनः साझा करता है। डेवलपर्स के लिए ठोस बात quota है: Go योजना उपयोगकर्ताओं के लिए हर 5 घंटे की विंडो में 169 अनुरोध। यह एक sliding cap है, मासिक गणना नहीं, जो सहायक कोडिंग सत्रों के विशिष्ट burst उपयोग के लिए उपयुक्त है।
यह एकीकरण Grok 4.6 के तृतीय-पक्ष टूल्स की ओर खुलने की श्रृंखला का हिस्सा है: मॉडल 14 अगस्त को GitHub Copilot में आया, 19 अगस्त को Amazon Bedrock पर, और फिर 21 अगस्त को Google की Gemini Enterprise Agent Platform पर। xAI ने पहले ही मई 2026 में OpenCode को अपने SuperGrok और X Premium सदस्यता से जोड़ दिया था — इसलिए आज का योगदान OpenCode तक पहुँच अपने आप में नहीं, बल्कि Go योजना में मॉडल 4.6 की उपस्थिति है, जिसमें शामिल quota है, न कि अपना xAI subscription लाने की आवश्यकता।
🔗 @grok पुनर्प्रेषण · @opencode घोषणा
Cohere ने 2026 में संप्रभु AI अपनाने पर IDC अध्ययन प्रकाशित किया
25 अगस्त — Cohere नियामित क्षेत्रों में संप्रभु AI के अपनाने पर IDC द्वारा कमीशन किए गए एक InfoBrief के परिणाम प्रकाशित करता है। अध्ययन ने अप्रैल और मई 2026 के बीच कनाडा, संयुक्त राज्य, यूनाइटेड किंगडम और जर्मनी में एक अरब डॉलर से अधिक राजस्व वाली कंपनियों के 500 से अधिक वरिष्ठ निर्णयकर्ताओं से प्रश्न किए।
सबसे उल्लेखनीय परिणाम अपनाने से कम और वैचारिक भ्रम से अधिक जुड़ा है। तीन में से एक कार्यकारी संप्रभु AI को अपने शब्दों में वर्णित करने में कठिनाई महसूस करता है, और केवल 13% ही अपने को इस विषय से बहुत अधिक परिचित बताते हैं। जो लोग इसकी परिभाषा दे पाते हैं, उनमें 52% इसे स्थानीय या राष्ट्रीय नियंत्रण के रूप में और 35% इसे डिजिटल स्वतंत्रता के रूप में प्रस्तुत करते हैं। यह अंतर संगठनात्मक ढाँचे में भी दिखता है: IT प्रमुखों में जागरूकता व्यावसायिक प्रमुखों की तुलना में दोगुनी है।
| पूछे गए क्षेत्र | डेटा लीक और अनुपालन मुख्य चिंता के रूप में | प्रतिस्पर्धात्मक लाभ प्रेरक के रूप में |
|---|---|---|
| वित्तीय सेवाएँ | 82 % | 21 % |
| उद्योग | 77 % | 32 % |
| दूरसंचार | 75 % | 37 % |
| स्वास्थ्य | 74 % | 28 % |
| ऊर्जा | 70 % | 21 % |
प्रेरणाओं के मामले में सहमति स्पष्ट और व्यापक है: डेटा लीक, गोपनीयता, और अनुपालन सभी पूछे गए क्षेत्रों में सबसे ऊपर आते हैं। प्रतिस्पर्धात्मक लाभ एक द्वितीयक लेकिन बढ़ता हुआ प्रेरक है, जिसे कनाडा (35 %) और संयुक्त राज्य (28 %) में जर्मनी (23 %) या यूनाइटेड किंगडम (18 %) की तुलना में अधिक महत्व दिया गया है। यह अध्ययन स्वाभाविक रूप से Cohere की स्थिति का समर्थन करता है, जिसकी North agentic platform ग्राहक द्वारा चुनी गई अवसंरचना और अधिकार-क्षेत्र में चलती है; फिर भी, आँकड़े एक पहचाने गए स्रोत को सौंपे गए हैं। IDC यह भी अनुमान लगाता है कि 2028 तक बहुराष्ट्रीय कंपनियों के CIOs अपने मॉड्यूलर sovereign cloud environments और data localization में निवेश 65% बढ़ाएँगे।
🔗 संप्रभु AI अपनाने की स्थिति 2026
संक्षेप
- Bain & Company Claude Partner Network में शामिल हुआ — यह परामर्श फर्म Global Premier partner बन गई है, और इसे अपने 19,000 कर्मचारियों में Claude की तैनाती का समर्थन मिला है; पायलट चरण में ही 7,000 से अधिक सक्रिय उपयोगकर्ता, और भाग लेने वालों में से दो-तिहाई से अधिक ने Claude for Excel अपना लिया। 🔗 Anthropic पोस्ट
- Amp बताता है कि orbs क्या हैं — नाम को लेकर भ्रम के जवाब में Thorsten Ball का नोट: एक orb एक दूरस्थ agent है, जिसे web, फोन या CLI से नियंत्रित किया जा सकता है। लागत पर दो उपयोगी स्पष्टीकरण: unlimited sleep के लिए शुल्क नहीं लगता और एक साथ चलने वाले orbs की संख्या पर कोई सीमा नहीं है। 🔗 Amp नोट
- Together AI ने Qwen3.8 27B को fine-tuning और dedicated inference के लिए खोला — मॉडल अब अपनी खुद की डेटा पर fine-tuning और आरक्षित हार्डवेयर पर Dedicated Model Inference, दोनों के लिए उपलब्ध है। 🔗 @togethercompute ट्वीट
- FINAL-Bench ने एजेंटों के लिए वित्तीय पूर्वानुमान प्रतियोगिता FINCHAL शुरू की — 2,000 डॉलर की पुरस्कार राशि के साथ, यह पूर्वानुमानों के बजाय positions माँगती है और कौशल को भाग्य से अलग करने के लिए luck ceiling प्रकाशित करती है। 🔗 FINAL-Bench पोस्ट
- Au-Zone ने EdgeFirst Model Zoo प्रकाशित किया — एम्बेडेड वास्तविक सिलिकॉन पर मापी गई डिटेक्शन और सेगमेंटेशन में चार YOLO परिवार, जहाँ प्रकाशित हर संख्या उस validation session से जुड़ती है जिसने उसे उत्पन्न किया, निर्माताओं द्वारा घोषित TOPS की अपारदर्शिता के विपरीत। 🔗 EdgeFirst पोस्ट
- macOS के लिए Gemini की बुद्धिमान डिक्टेशन — डेस्कटॉप की किसी भी विंडो में डिक्टेशन, hesitation का स्वचालित हटाना, और वाक्य के बीच में किए गए सुधारों को समझना; यह आवाज़ फाइलों का सारांश देने और किसी पाठ को फिर से लिखने में भी काम आती है। 🔗 blog.google गाइड
- push rules अब path exceptions स्वीकार करती हैं — सार्वजनिक पूर्वावलोकन में, Restrict file paths और Restrict file size नियम विशिष्ट paths को छूट दे सकते हैं, उदाहरण के लिए हर जगह JAR ब्लॉक करना सिवाय
**/gradle/wrapper/*.jarके। 🔗 GitHub changelog - सुरक्षा advisory से उपयोगकर्ता को ब्लॉक करना — यह क्रिया सार्वजनिक repositories में विवरण या टिप्पणी के तीन-बिंदु मेनू के माध्यम से की जाती है, सेटिंग्स में वापस जाए बिना; advisory जस का तस रहता है। 🔗 GitHub changelog
- Manus डेटा पुनर्स्थापन पर भारी मांग की सूचना देता है — जो पुनर्स्थापन सफल नहीं होते, उन्हें दिन में बाद में फिर से चलाना चाहिए; स्पष्ट निर्देश है कि backup packages को अखंड और अपरिवर्तित रखा जाए। 🔗 @ManusAI ट्वीट
- Kling ने अपने MCP सर्वर पर तीन गाइड प्रकाशित किए — एक सत्यापित creative configuration को फिर से चलाने और बैच में variants बनाने के लिए Kling को एक MCP-संगत assistant से जोड़ना; तीन में से दो ट्यूटोरियल client के रूप में Claude Code का उल्लेख करते हैं। 🔗 Kling ब्लॉग
- Wan 3.0 Runway और Replicate पर आ गया है — Runway ने इसे 24 अगस्त को image, video और audio में multiple reference inputs के साथ जोड़ा; Replicate ने 25 तारीख को इसका अनुसरण किया और एक ही टेक में synchronized audio के साथ 30 native seconds को उजागर किया। 🔗 @runwayml ट्वीट
- Runway ने अपने AI Summit के लिए नए वक्ताओं की घोषणा की — सैन फ्रांसिस्को में सितंबर के कार्यक्रम के लिए कार्यक्रम का विस्तार robotics, autonomous vehicles, marketing और infrastructure तक किया गया। 🔗 @runwayml ट्वीट
- MiniMax ने H3 integrations का index प्रकाशित किया — Awesome MiniMax H3 Integrations खुले video model के इर्द-गिर्द बन रही चीज़ों को सूचीबद्ध करता है, जिनमें 24 GB VRAM पर चलने वाली configurations शामिल हैं। 🔗 @MiniMax_AI ट्वीट
- Luma ने Dream Lab Weekly लॉन्च किया — Luma के रचनात्मक पेशेवरों और उत्पाद पर उनके साप्ताहिक कार्य को समर्पित वीडियो श्रृंखला का पहला एपिसोड। 🔗 @LumaLabsAI ट्वीट
- NVIDIA ने खुले model routing पर Nemotron Labs session प्रसारित किया — Get Started with Open Model Routing नामक 55 मिनट की लाइवस्ट्रीम, Nemotron 3.5 Lightning और NeMo Switchyard पर किए गए काम का विस्तार। 🔗 @NVIDIAAI ट्वीट
- Grok Imagine Odyssey प्रतियोगिता के लिए एक सप्ताह बाकी — Odyssey से ली गई एक scene रचना करनी है जो टूल की video और voice क्षमताओं को उजागर करे; पुरस्कार 100,000, 50,000 और 25,000 डॉलर के हैं। 🔗 @grok ट्वीट
- Plus और Pro सदस्यों के लिए limit reset bank — reset window का इंतज़ार करने के बजाय, उपयोगकर्ता reserve में रखी गई एक reset का उपयोग करता है; लॉन्च पर एक मुफ्त और अन्य रेफ़रल के माध्यम से, Business की ओर shared workspace credits के साथ। 🔗 ChatGPT और Codex changelog
इसका क्या मतलब है
सिलिकॉन फिर से मॉडल-लैब का विषय बन रहा है। OpenAI उसी दिन अपनी इन्फ़ेरेंस चिप के पहले मापे गए आँकड़े और अपनी compute रणनीति को सामने रखने वाला लेख प्रकाशित करता है। यह कैलेंडर की संयोगवश घटना नहीं है: जो मॉडल प्रदाता अपना सिलिकॉन डिज़ाइन करता है, उसे किसी तीसरे पक्ष के सार्वजनिक benchmark पर मापता है, और दस साझेदारों के पोर्टफोलियो को सार्वजनिक रूप से स्वीकार करता है, वह प्रतिस्पर्धा की प्रकृति बदल देता है। सवाल अब यह नहीं रह जाता कि “कौन सा मॉडल सबसे अच्छा है”, बल्कि यह बन जाता है कि “किसी सफल कार्य की लागत कितनी है”, और जवाब rack जितना weight में भी छिपा होता है। शायद सबसे महत्वपूर्ण बात कहीं और है: AI का इस्तेमाल चिप को डिज़ाइन करने और उसके kernels लिखने में हुआ, नौ महीनों में fabrication तक पहुँचाया गया, और जेनरेट की गई implementations चुने गए blocks पर मानव विशेषज्ञों से बेहतर निकलीं। चक्र पूरा हो जाता है — मॉडल उस hardware को डिज़ाइन करते हैं जो उन्हें चलाएगा।
AI फिर से डिवाइस पर लौट रही है, और आँकड़े उसका पीछा करने लगे हैं। उसी दिन तीन संकेत एक ही दिशा में इशारा करते हैं। Perplexity अपना पूरा agent local पर DGX Spark पर चलाता है, credits खर्च किए बिना, और cloud escalation उपयोगकर्ता का निर्णय बनी रहती है। Multiverse Computing एक ऐसी विधि प्रकाशित करता है जिसमें 4-bit model अपने full-precision source के बराबर या उससे बेहतर प्रदर्शन करता है, जिससे aggressive quantization के खिलाफ सामान्य तर्क कमजोर पड़ जाता है। Au-Zone embedded silicon vision के माप प्रकाशित करता है और घोषित TOPS पर आरोप लगाता है कि वे यह नहीं बताते कि कोई विशिष्ट model वास्तव में क्या करेगा। इन तीनों में से कोई भी काम frontier के बराबर होने का दावा नहीं करता: Perplexity का ईमानदार आँकड़ा local पर 59.6% है, जबकि Terminal Bench 2.1 पर केवल Claude Opus 5 के लिए 82.4% है। लेकिन model सलाहकार की ओर escalation दो-तिहाई लागत पर अंतर का तीन-पाँचवाँ हिस्सा वापस ला देती है, और यही समझौता, parity से अधिक, local execution को उचित बनाता है।
Open weights अब संदर्भ स्थिति के रूप में स्थापित हो रहे हैं। Qwen द्वारा प्रसारित 500,000 arXiv लेखों का विश्लेषण एक पहले से दिख रहे उलटफेर को दर्ज करता है: खुले चीनी models 10% से बढ़कर लगभग 40% mentions तक पहुँच गए हैं, जबकि खुले अमेरिकी models 25% और 30% के बीच स्थिर हैं। Qwen3.8-27B का Code Arena के top 10 में प्रवेश, अपने आकार के एकमात्र model के रूप में; GLM-5.3 का DeepSWE पर multi-run परीक्षणों में GPT-5.6 Sol और Claude Fable 5 से आगे निकलना, वह भी 2.1 से 5.4 गुना कम लागत पर; IBM का Granite 4.2 को चार quantized variants और पहले ही दिन fourteen GGUF formats के साथ खोलना — वही तर्क बार-बार दोहराया जाता है। weights खोलना अब पिछड़ने का प्रयास नहीं, बल्कि दूसरों के लिए default infrastructure बनने का तरीका है, इस nuance के साथ कि Nathan Lambert स्वयं यह रेखांकित करते हैं: publications releases से पीछे हैं, और ये curves मौजूदा काम को दिखाती हैं, उस समय की preferences को नहीं।
और web अब आँखों के बजाय agents द्वारा पढ़े जाने के लिए तैयार हो रहा है। WebMCP Challenge 35,000 डॉलर की prize वाला प्रतियोगिता है, जो कम है; लेकिन यह जो उजागर करता है, वह अधिक मूल्यवान है। Chrome, Cloudflare, Shopify, Vercel, Render और Netlify OpenAI के साथ उस standard पर align हो रहे हैं जो sites से structured tools expose करने की मांग करता है, बजाय इसके कि agents किसी interface का अनुमान लगाएँ। उसी दिन, ChatGPT desktop WebMCP को natively consume कर सकता है, Codex एक compatible application बना और deploy कर सकता है, और OpenAI एक notebooks tool में protocol के अपने internal उपयोग का दस्तावेज़ीकरण करता है। यह convergence उस दिशा से मेल खाती है जो Rohlik अपने पक्ष में बताता है, जहाँ पचास से अधिक MCP integrations हैं और यह सिद्धांत है कि हर नया tool पहले ही दिन agents के लिए accessible होना चाहिए। agents के लिए interface layer अब research का विषय नहीं, बल्कि engineering की आवश्यकता बन जाती है।
स्रोत
- OpenAI — WebMCP Challenge
- OpenAI — X पर WebMCP Challenge की घोषणा
- OpenAI — ChatGPT desktop और Sites में WebMCP
- OpenAI — Codex, Runme और WebMCP के साथ दोहराए जाने वाले काम को स्वचालित करना
- OpenAI — Jalapeño, प्रारंभिक परिणाम
- OpenAI — प्रचुर बुद्धिमत्ता के पीछे पूरा स्टैक
- OpenAI — ChatGPT Work और Codex के लिए Admin plugin
- OpenAI — browser extension को Edge, Brave, Opera और Vivaldi तक विस्तारित करना
- OpenAI — ChatGPT Business का Premium seat
- ChatGPT और Codex — changelog
- Perplexity — Portable Computer का लॉन्च
- Perplexity — Portable Computer लेख
- Perplexity — local harness benchmarks
- Anthropic — Claude की memory हर जगह काम करती है
- Anthropic — X पर memory की घोषणा
- Anthropic — Claude Code CHANGELOG
- Anthropic — 4x अधिक smooth streaming rendering
- Anthropic — welfare research grants
- Anthropic — Bain & Company Claude Partner Network में शामिल होता है
- IBM — Granite 4.2
- IBM — Granite Speech 5.0 Turbo CTC
- Multiverse Computing — Quantization-Aware Healing
- Hugging Face — gr.Workflow guide
- FINAL-Bench — FINCHAL प्रतियोगिता
- Au-Zone — EdgeFirst Model Zoo
- Together AI — fine-tuning और dedicated inference में Qwen3.8 27B
- Google AI — WeatherNext Cyclones
- Google DeepMind — WeatherNext Cyclones
- Google — Gemini CLI v0.57.0
- Google — Antigravity changelog
- Google — macOS के लिए Gemini की smart dictation
- Stability AI — 76 मिलियन डॉलर की Series B
- Stability AI — X पर घोषणा
- NVIDIA — Gamescom और RTX Spark
- MiniMax — H3 पर SANA और Sol Engine
- MiniMax — H3 integrations index
- NVIDIA — खुले model routing पर Nemotron Labs session
- Qwen — Code Arena WebDev पर Qwen3.8-27B
- Qwen — arXiv विश्लेषण का प्रसारण
- Nathan Lambert — छांटे गए 500,000 arXiv लेख
- Warp — factory.yaml format और early access
- Cognition — Rohlik Group case study
- Devin — Rohlik Group client page
- Amp — orbs explained
- GitHub — चार नए GitHub Skills अभ्यास
- GitHub — Customize टैब सामान्य उपलब्धता में
- GitHub — push rules में path exceptions
- GitHub — security advisory से blocking
- Manus — data restoration पर अपडेट
- ElevenLabs — Composer
- HeyGen — LiveAvatar पर unlimited competition
- Kling — MCP server पर guides
- Runway — प्लेटफ़ॉर्म पर Wan 3.0 उपलब्ध
- Runway — AI Summit के नए speakers
- Luma — Dream Lab Weekly
- xAI — OpenCode Go में Grok 4.6
- OpenCode — Go plan में Grok 4.6
- xAI — Odyssey पर Grok Imagine contest
- Cohere — State of Sovereign AI Adoption 2026