ai-powered-markdown-translatorgpt-5.4-mini के साथ fr से hi में अनूदित लेख।
एजेंटिक इन्फ्रास्ट्रक्चर के बिल्डिंग ब्लॉक्स के लिए बड़ा दिन: Anthropic ने Claude Platform पर computer use, browser tool, Skills API और Files API को बीटा से निकालकर उपलब्ध कराया है, जबकि GitHub Copilot Slack और Microsoft Teams में स्थापित हो रहा है। मॉडल्स की तरफ, DeepSeek अपना पहला मल्टीमोडल मॉडल प्रकाशित कर रहा है और Pika Labs एक ऐसा वॉयस सिंथेसाइज़र लॉन्च कर रहा है जो कीमत/गुणवत्ता का अभूतपूर्व अनुपात होने का दावा करता है। इन दोनों के बीच, एक विशाल egocentric डेटासेट, स्पीच रिकग्निशन में benchmark bias पर एक अध्ययन, और Google DeepMind, GitHub, Z.ai, Qwen, Harvey तथा वीडियो/ऑडियो जनरेशन टूल्स के कई उल्लेखनीय अपडेट हैं।
Claude Platform : computer use, browser tool, Skills API और Files API सामान्य उपलब्धता में
20 अगस्त — Anthropic ने Claude Platform पर एजेंट बनाने के लिए चार बिल्डिंग ब्लॉक्स को सामान्य उपलब्धता में ले जाने की घोषणा की है: computer use, browser tool, Skills API और Files API। घोषित लक्ष्य है कि जिन ऐप्स में API नहीं है, उनमें एक कार्य को ऑटोमेट करने के लिए आवश्यक आने-जाने की संख्या कम की जाए, और वर्ज़न किए गए skills तथा पुन: उपयोग योग्य files पर आधारित Claude Managed Agents बनाए जा सकें।
नया computer_toolset_20260801 Claude को एक टर्न में कई क्रियाएँ क्रम से करने देता है (क्लिक, टाइपिंग, कीबोर्ड कुंजी, स्क्रीनशॉट) — हर अलग क्रिया के लिए एक बार आने-जाने के बजाय। Anthropic के अनुसार शुरुआती एक्सेस ग्राहकों ने प्रति कार्य 20 से 40 % कम आने-जाने देखे हैं। browser tool भी browser_toolset_20260801 के साथ विकसित होता है: पिक्सेल्स को लक्ष्य बनाने के बजाय — जो लेआउट में ज़रा-से बदलाव पर भी नाज़ुक होता है — Claude अब पेज की संरचना प्राप्त करता है और तत्वों के संदर्भों पर कार्य कर सकता है।
API की तरफ, Skills API एक टीम की प्रक्रिया को एक बार अपलोड करने, उसे वर्ज़न करने और उसे किसी सटीक version_id या latest से पिन करने की सुविधा देती है। Files API में expires_in_seconds पैरामीटर जुड़ता है, 5 गुना अधिक rate limit (500 अनुरोध प्रति मिनट) और प्रति संगठन 1 TB कोटा मिलता है। Anthropic ने Managed Agents के लिए एक AG-UI adapter भी जारी किया है, जो हर चर्चा-थ्रेड को एक managed session से मैप करता है और text, tool calls तथा reasoning को interface तक प्रसारित करता है।
| बिल्डिंग ब्लॉक | आज की नई बात |
|---|---|
| Computer use | computer_toolset_20260801, प्रति कार्य -40% तक कम आने-जाने |
| Browser tool | browser_toolset_20260801, पेज तत्व संदर्भ द्वारा लक्ष्य निर्धारण |
| Skills API | वर्ज़निंग, version_id या latest से पिन करना |
| Files API | 500 अनुरोध/मिनट (x5), प्रति संगठन 1 TB कोटा |
GitHub Copilot Slack और Microsoft Teams में आया
21 अगस्त — GitHub Copilot अब पब्लिक प्रीव्यू में Slack और Microsoft Teams पर उपलब्ध है। दोनों मामलों में सिद्धांत समान है: किसी direct message, channel या thread में @GitHub का उल्लेख करने से एक cloud agent session खुलता है, जो कोड और GitHub गतिविधि पर सवालों के जवाब दे सकता है, bug reports को छाँट सकता है, failures की जाँच कर सकता है, सुरक्षित cloud sandbox में बदलाव लागू कर सकता है, और फिर मूल बातचीत के लिंक के साथ pull requests खोल सकता है।
Slack पर यह integration Slack Code पर आधारित है, Slack की नई agentic पेशकश जिसे उसी सप्ताहांत लॉन्च किया गया था: GitHub Copilot समर्पित code channels खोल सकता है जहाँ टीम diffs देखती है और rendering previews की जाँच करती है, बिना मूल बातचीत को प्रदूषित किए। Teams पर, एक चर्चा सामूहिक agent session में बदल जाती है जिसे हर कोई देख और दिशा दे सकता है; टीम कुछ और करती रहती है जबकि काम cloud sandbox में asynchronously चलता रहता है।
उपलब्धता केवल Copilot Business या Enterprise योजना वाली संगठनों के लिए आरक्षित है। प्रशासक Copilot cloud agent policy सक्रिय करता है और Slack या Teams ऐप इंस्टॉल करता है; repository प्रशासक agent द्वारा उत्पन्न pull requests को merge करने से पहले approval की मांग कर सकते हैं। उपयोग AI credits खपत करता है, और cloud sandbox अलग से configurable budgets के साथ बिल किया जाता है।
🔗 Slack में GitHub Copilot · 🔗 Teams में GitHub Copilot
DeepSeek-V4-Flash-Vision-Exp : API पर DeepSeek का पहला मल्टीमोडल मॉडल
21 अगस्त — DeepSeek DeepSeek-V4-Flash-Vision-Exp को ऑनलाइन उपलब्ध कराता है, एक प्रयोगात्मक मल्टीमोडल मॉडल जो deepseek-v4-flash-vision-exp पहचानकर्ता के तहत उपलब्ध है। विशुद्ध पाठ्य क्षमताओं — agents, reasoning, world knowledge — में यह मॉडल DeepSeek-V4-Flash के बराबर है। नई बात कहीं और है: मल्टीमोडल agents के benchmarks पर DeepSeek, V4-Flash की तुलना में स्पष्ट छलांग की घोषणा करता है, और प्रदर्शन Opus-4.8 के करीब पहुँचता है।
API पक्ष में multimodal support पूर्ण है: मिश्रित input text + image (base64, external URL, या उसी दिन लॉन्च की गई नई free Files API के माध्यम से), और मौजूदा तीन formats (Chat Completions, Messages, Responses) के साथ संगत। मूल्य निर्धारण V4-Flash ग्रिड का अनुसरण करता है, जिसमें image tokenization प्रति image अधिकतम 384 tokens तक सीमित है। Files API आपको एक image केवल एक बार upload करने और उसे file_id द्वारा reference करने देती है, जो दोहराए जाने वाले agentic उपयोगों के लिए bandwidth बचाती है। DeepSeek Harness 0.1.1, 13 अगस्त को लॉन्च किया गया open-source agent harness, नए मॉडल को native रूप से support करने के लिए उसी दिन अपडेट किया गया।
| तत्व | विवरण |
|---|---|
| मॉडल | deepseek-v4-flash-vision-exp |
| पाठ क्षमताएँ | DeepSeek-V4-Flash के साथ समानता |
| मल्टीमोडल क्षमताएँ | मल्टीमोडल agents के benchmarks पर Opus-4.8 के करीब |
| image pricing | 384 tokens/image तक, V4-Flash मूल्य |
| समर्थित APIs | Chat Completions, Messages, Responses |
| Harness | DeepSeek Harness 0.1.1 (native support) |
DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.
🇮🇳 DeepSeek-V4-Flash-Vision-Exp अब DeepSeek API प्लेटफ़ॉर्म पर उपलब्ध है! यह प्रयोगात्मक मल्टीमोडल मॉडल पाठ्य क्षमताओं पर DeepSeek-V4-Flash के बराबर है — जिसमें agents, reasoning और world knowledge शामिल हैं। मल्टीमोडल agents के benchmarks पर, V4-Flash-Vision-Exp, V4-Flash की तुलना में एक बड़ी छलांग लगाता है, और multimodal agent performance को Opus-4.8 के स्तर के करीब ले आता है। — @deepseek_ai on X
Pika Speech : 3B वॉयस सिंथेसिस, 1.2 सेकंड प्रति मिनट, ElevenLabs v3 से 9x तक सस्ता
21 अगस्त — Pika Labs अपनी Pika Audio लाइन को Pika Speech के साथ विस्तारित कर रहा है, जो 3 अरब parameters वाला वॉयस सिंथेसिस मॉडल है। मुख्य तर्क गति है: 0.02 का real-time factor (RTF), यानी 48 kHz studio-quality speech का एक मिनट स्थानीय लंबे-रूप परीक्षणों में लगभग 1.2 सेकंड में उत्पन्न होता है, और अनुरोध पाँच मिनट तक की निरंतर speech तक संभव हैं।
रीथम नियंत्रण में, Pika Speech नया करता है: अधिकांश TTS systems में मानक तरीके की तरह बाद में audio को फैलाने या संकुचित करने के बजाय — मॉडल सीधे गति और अवधि को एक « end-of-speech latent » (EOS latent) के माध्यम से नियंत्रित करता है, जो target final image पर रखा गया एक anchor है। इस anchor को पहले खिसकाने से गति संकुचित होती है; इसे बाद में खिसकाने से text को सांस लेने की जगह मिलती है। architecture के स्तर पर, टीम flow matching और distribution matching distillation, FlashAttention-3, तथा एक “token packing” को जोड़ती है, जिससे पाँच phrase segments की लागत लगभग एक segment की दोगुनी होती है, पाँच गुना नहीं।
लागत के मामले में, Pika का दावा है कि यह ElevenLabs v3 की तुलना में 9x तक, Cartesia और ElevenLabs Turbo की तुलना में 4.5x, और Fish Audio की तुलना में 2x तक लाभ दे सकता है — हालांकि इन ratios से आगे सटीक methodology का विवरण नहीं दिया गया है। मॉडल Pika API Club के माध्यम से उपलब्ध है।
Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02. […] Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes it up to 9× more cost-efficient than ElevenLabs v3, 4.5× than Cartesia and ElevenLabs Turbo, and 2× than Fish Audio.
🇮🇳 आइए Pika Speech की बात करें, 3 अरब parameters वाला एक वॉयस सिंथेसिस मॉडल, जिसमें 0.02 का real-time factor है। […] Pika Speech स्टूडियो-क्वालिटी 48 kHz speech का एक मिनट लगभग 1.2 सेकंड में उत्पन्न करता है — और पाँच मिनट तक के अनुरोधों का समर्थन करता है। यह दक्षता इसे ElevenLabs v3 की तुलना में 9 गुना, Cartesia और ElevenLabs Turbo की तुलना में 4.5 गुना, और Fish Audio की तुलना में 2 गुना तक अधिक किफायती बनाती है। — @pika_labs on X
EgoSuite-Open100K : सबसे बड़ा खुला मानव egocentric डेटासेट
21 अगस्त — Lightwheel AI, Hugging Face के साथ साझेदारी में, EgoSuite-Open100K को open-source करता है, जिसे अब तक सार्वजनिक रूप से जारी किया गया सबसे बड़ा, पूरी तरह annotated मानव egocentric डेटासेट बताया गया है। लक्ष्य 100,000 घंटे के first-person human data का है; पहले 10,000 घंटे पहले ही उपलब्ध हैं, और बाकी चरणों में प्रकाशित होंगे।
यह डेटासेट 15,000 से अधिक tasks को कवर करता है, जो 15,000 से अधिक वास्तविक scenes — रसोई, बेडरूम, warehouses, assembly lines — में फैले हैं, और 7 environment categories तथा 128 scene types में व्यवस्थित हैं। हर sequence में हाथ की pose, शरीर की pose और sub-tasks के स्तर पर semantics की annotation है, और corpus के एक हिस्से में wrist-mounted camera coverage भी है। License के लिहाज़ से एक उल्लेखनीय बात: कई research datasets के विपरीत, EgoSuite-Open100K commercial training के लिए लाइसेंस प्राप्त है, केवल academic उपयोग के लिए नहीं।
डेवलपर्स इसे “Physical AI” (रोबोटिक्स और embodied AI) के लिए एक व्यापक data infrastructure की पहली सार्वजनिक कड़ी के रूप में प्रस्तुत करते हैं — यह विचार कि physical models का scale-up अब massive, shared human data तक पहुँच पर निर्भर है।
🔗 Lightwheel AI घोषणा · 🔗 Hugging Face रिले
Claude Security अब Claude Mythos 5 पर चलता है
21 अगस्त — Anthropic अपने vulnerability scanning tool Claude Security को Claude Mythos 5 पर चला रहा है, जो सभी Claude Enterprise ग्राहकों के लिए public beta में है। तर्क: सुरक्षा के लिए Anthropic के सबसे सक्षम मॉडल का लाभ उसके codebase पर लेना, बिना मॉडल तक अलग पहुँच के — scans मौजूदा plan पर standard token usage के रूप में बिल किए जाते हैं।
व्यवहार में, टूल GitHub repository पर जाता है और Mythos 5 डेटा के फ़ाइलों के बीच प्रवाह को ट्रेस करके तथा components के बीच interactions पर reasoning करके code का विश्लेषण करता है। हर result CWE category, confidence level, severity assessment और एक सुझाए गए fix के साथ लौटता है, जो सीधे web पर Claude Code में खुलता है। Anthropic इस अवसर पर Defender Advantage Fund भी लॉन्च करता है, जिसमें open source सुरक्षा के लिए 35 million dollars के credits हैं, और आने वाले हफ्तों में अपने Cyber Verification Program का विस्तार करने की योजना है।
GPT-5.6 Sol मूल्य-निर्धारण : OpenAI API कीमतें घटाता है, GitHub Copilot साथ देता है
21 अगस्त — OpenAI अगले तीन महीनों के लिए GPT-5.6 Sol की API कीमतें और credits 20 % से अधिक घटा रहा है। यह कदम API पक्ष में पहले ही सक्रिय है और दिन भर Codex तथा ChatGPT Work में लागू हो रहा है। टास्क-आधारित (token-based) योजनाओं पर Codex उपयोगकर्ताओं के लिए, खरीदे गए credits अब अधिक दूर तक चलते हैं; Pro, Plus और Business subscriptions में शामिल उपयोग, हालांकि, अपरिवर्तित रहता है — इसलिए कीमत में कटौती मुख्य रूप से API developers और token-आधारित बिलिंग वाले उपयोगकर्ताओं को लाभ देती है।
GitHub Copilot में GPT-5.6 Sol -50%
साथ ही, GitHub एक अलग प्रमोशन जारी करता है: GitHub Copilot में GPT-5.6 Sol पर -50 % छूट, जो 3 सितंबर तक ऐप, CLI और IDE में उपयोग की जा सकती है। यह Copilot पक्ष की एक सीमित-समय की छूट है, जिसे ऊपर वर्णित OpenAI की स्थायी मूल्य कटौती के साथ भ्रमित नहीं करना चाहिए — दो अलग कंपनियाँ, उसी मॉडल पर दो अलग तंत्र।
🔗 OpenAI मूल्य कटौती · 🔗 GitHub Copilot प्रमोशन
GLM-5.3 (Max) Code Arena: WebDev में ऊपर चढ़ता है
20 अगस्त — LMArena बताता है कि Z.ai का GLM-5.3 (Max) ने Code Arena: WebDev रैंकिंग के Pareto frontier (गुणवत्ता/लागत अनुपात) को आगे बढ़ाया है, जो web development tasks पर मॉडल मूल्यांकन के लिए समर्पित है। 1597 अंकों के साथ, मॉडल open-weight models (एक बार प्रकाशित होने पर) में 2वें स्थान पर और सभी श्रेणियों में कुल 8वें स्थान पर होगा।
| मॉडल | कीमत ($/M tokens) | Code Arena: WebDev अंक |
|---|---|---|
| GLM-5.3 (Max) | $3,65 | 1597 |
| Qwen3.8 (Max) | $5,00 | — |
| Gemini-3.7-flash-high | $2,86 | कम बेहतर स्कोर |
| DeepSeek-v4-flash-high | $1,10 | कम बेहतर स्कोर |
प्रति million tokens $3.65 पर, GLM-5.3 (Max) कीमत के लिहाज़ से Qwen3.8 (Max) के समान दायरे में रहता है, जबकि इस रैंकिंग में Gemini-3.7-flash-high और DeepSeek-v4-flash-high से बेहतर प्रदर्शन करता है — agentic web development पर Z.ai की प्रतिस्पर्धात्मकता का एक और संकेत, Terminal-Bench और general Agent Arena के पहले से ज्ञात परिणामों के पूरक के रूप में।
Harvey ने Tenet लॉन्च किया, Kimi K3 पर आधारित एक कानूनी मॉडल
20 अगस्त — Harvey Tenet पेश करता है, जो कानून के लिए उसका पहला post-trained model है, और यह एक Kimi K3 (Moonshot AI) base से शुरू होता है, जिसे Fireworks AI के साथ public legal data, synthetic data और लंबे समय के कानूनी काम का अनुकरण करने वाले human expert data के corpus पर post-train किया गया है।
Harvey का कहना है कि यह post-training Tenet की end-to-end success rate को LAB benchmark पर 82 % और LAB Contracts पर 22 % बढ़ा देता है, base Kimi K3 की तुलना में — और LAB Contracts पर state of the art तथा पूरे LAB पर दूसरा स्थान प्राप्त होता है। Tenet की संचालन लागत बाजार के सबसे सक्षम foundation models की लागत के एक चौथाई से भी कम होने का अनुमान है। इसके अतिरिक्त, Harvey ने तीन specialist sub-agents प्रशिक्षित किए हैं: M&A diligence, table review, और firm knowledge।
Georgia Tech ने Olmo 3 के सामाजिक तर्क के स्रोतों का पता लगाया
21 अगस्त — Georgia Tech की एक टीम ने इस तथ्य का लाभ उठाया कि Ai2 का Olmo 3 स्टैक पूरी तरह खुला है — वज़न, Dolma 3 का प्री-ट्रेनिंग कॉर्पस (1,26 अरब दस्तावेज़), इंफ्रास्ट्रक्चर — ताकि मॉडल की क्षमताओं को सांख्यिकीय रूप से उन पाठों से जोड़ा जा सके जिन्होंने उन्हें उत्पन्न किया, जो एक बंद मॉडल पर असंभव प्रयोग होता।
यह विधि influence functions पर आधारित है, जिन्हें Dolma 3 में सैंपल किए गए लगभग 5,68 लाख दस्तावेज़ों पर लागू किया गया। मुख्य परिणाम: संवाद-समृद्ध और अंतर-व्यक्तिगत लेखन वाले पाठ तथ्यात्मक ज्ञान की तुलना में सामाजिक तर्क में प्रदर्शन पर अधिक प्रभाव डालते हैं — और सबसे प्रभावशाली साहित्यिक दस्तावेज़ों को हटाने पर SocialIQA benchmark पर प्रदर्शन में उल्लेखनीय गिरावट आई, जिससे कारणता की पुष्टि हुई।
🔗 Ai2 लेख
खुली स्रोत ASR मॉडलों में « benchmark optimization » पूर्वाग्रह का पता चला
21 अगस्त — Hume AI की एक टीम Hugging Face ब्लॉग पर वाक् पहचान में एक पद्धतिगत पूर्वाग्रह पर अध्ययन प्रकाशित करती है: कुछ मॉडल सार्वजनिक benchmarks की संदर्भ प्रतिलिपियों को faithfully transcribe करने के बजाय उन्हें पुन: प्रस्तुत करने के लिए अनुकूलित लगते हैं।
परीक्षित 11 open source ASR मॉडल में से, विश्लेषित लगभग 40% VoxPopuli अंशों में उनकी references में त्रुटियाँ थीं, और 11 में से 6 मॉडल सही ढंग से ऑडियो ट्रांसक्राइब करने के बजाय उन त्रुटियों को ही दोहरा रहे थे। LibriSpeech पर, masked numbers की recovery दर 30 से 40% तक पहुँची, जो संकेत है कि कुछ मॉडल सुनने के बजाय पाठ को « भर » देते हैं। निष्कर्ष में secret evaluation sets के उपयोग और training तथा test data के बीच अधिक कठोर विभाजन की सिफारिश की गई है।
SenseNova-U1.5-8B-MoT : VAE या DiT के बिना खुला image model
21 अगस्त — SenseNova एक image generation model को open weights के रूप में जारी करता है, जिसके घोषित प्रदर्शन Nano Banana 2 के बराबर बताए जाते हैं। तकनीकी आकर्षण इसकी architecture में है: न VAE, न अलग text encoder, न DiT — मॉडल एक « mixture of transformers » पर आधारित है, जहाँ text और image tokens अलग-अलग weights का उपयोग करते हैं और परस्पर एक-दूसरे की अपेक्षा करते हैं, तथा denoising compressed latent space के बजाय सीधे pixel space में होता है।
यह दृष्टिकोण text-image diffusion models के मानक stack से अलग है, और इसका weight openness समुदाय को घोषित performance comparisons की स्वतंत्र रूप से जाँच करने देगी।
Diffusers 0.40.0 : Modular Diffusers प्रयोगात्मक स्थिति से बाहर
21 अगस्त — Hugging Face Diffusers 0.40.0 जारी करता है। सबसे संरचनात्मक बदलाव Modular Diffusers का प्रयोगात्मक स्थिति से बाहर निकलना है, जो library की modular pipeline प्रणाली है। यह संस्करण कई हालिया खुले मॉडलों (LTX2.5, MiniMax H3, MiniMax Music 3, Wan Animate 2) का एकीकरण जोड़ता है, कुछ मॉडलों के लिए tensor parallelism समर्थन, और quantification के दो नए backends (SDNQ, Nunchaku-Lite) जोड़ता है।
Google DeepMind Fenris Creations के साथ खेलों में AI का अन्वेषण करता है
21 अगस्त — Google DeepMind स्टूडियो Fenris Creations के साथ एक शोध साझेदारी की घोषणा करता है, जो AI के लिए प्रयोगात्मक क्षेत्र के रूप में वीडियो गेम्स का उपयोग करने वाले 15 वर्षों के कार्यों की निरंतरता है — Atari mastery से लेकर StarCraft II पर Grandmaster स्तर तक। SIMA के बाद, जिसने एजेंटों को 3D संसारों को समझना सिखाया, DeepMind एक स्थायी universe के भीतर वास्तविक मानव गतिशीलताओं में नेविगेशन का अन्वेषण करना चाहता है।
यह साझेदारी चार खुले चुनौतियों को लक्षित करती है: निरंतर सीखना (पहले सीखी चीज़ों को भूले बिना नई क्षमताएँ अर्जित करना), मौजूदा context windows से बहुत आगे तक जाने वाली deep memory systems, लंबी क्षितिज वाली योजना (सप्ताह, महीने, वर्ष), और multi-agent dynamics (सहयोग, बातचीत, अर्थव्यवस्था, उभरते व्यवहार)। दीर्घकालिक उद्देश्य दोहरा है: डेवलपर्स के साथ नई गेमिंग experiences बनाना, और इन प्रगतियों को वास्तविक दुनिया की समस्याओं तथा वैज्ञानिक खोज के लिए पुन: उपयोग करना।
Runway Ruby : SDR वीडियो को 16-bit HDR में रूपांतरित करना
21 अगस्त — Runway Ruby लॉन्च करता है, एक मॉडल जो SDR (standard dynamic range) वीडियो को 16-bit HDR में रूपांतरित करता है, EXR sequences या ProRes/HEVC 10-12 bit output के रूप में, BT.2020 color space में PQ या HLG समर्थन के साथ — वे मानक जो पेशेवर post-production और HDR broadcast में उपयोग होते हैं।
Ruby उपयोगकर्ता द्वारा uploaded वीडियो और Runway द्वारा generated output, दोनों पर समान रूप से काम करता है, 30 सेकंड की सीमा के साथ। यह सुविधा Max और Enterprise योजनाओं के लिए अभी उपलब्ध है।
NVIDIA AVO ने ARC-AGI-3 benchmark पर 100 % का दावा किया
21 अगस्त — NVIDIA AVO प्रस्तुत करता है, एक generalist code agent, 100 % score के साथ ARC-AGI-3 पर, जो एक interactive reasoning benchmark है। NVIDIA के अनुसार, AVO ने benchmark के 25 public environments में फैले 183 levels को पूरा किया, बिना स्पष्ट निर्देशों, बताए गए नियमों या पहले से formulat किए गए उद्देश्यों के।
AVO inspection, planning, implementation और evaluation के एक निरंतर loop के माध्यम से काम करता है, memory, tools और execution feedback का उपयोग करके उस पर निर्माण करता है जो वह समय के साथ सीखता है — एक ऐसा दृष्टिकोण जिसका उद्देश्य long tasks पर progress बनाए रखना है, बजाय हर नए context window पर शून्य से शुरू करने के।
HeyGen Look Packs : चेहरा बनाए रखते हुए पहनावा और सेट बदलना
21 अगस्त — HeyGen Look Packs लॉन्च करता है, एक सुविधा जो avatar वीडियो के पहनावे और सेट को बदलती है, जबकि व्यक्ति के चेहरे को faithfully बनाए रखती है — तर्क यह है कि अधिकांश generative models रूप-रंग बदलते समय चेहरे की विशेषताएँ भी बदल देते हैं।
उद्देश्य विभिन्न पेशेवर संदर्भों में व्यक्तिगत ब्रांड की निरंतरता है: real estate, legal, fitness, education, well-being। एक B2B content creator इस प्रकार हर sector के लिए उपयुक्त पहनावे और सेट में वीडियो बना सकता है, जबकि एक वीडियो से दूसरे में पहचाना जा सकता है। यह घोषणा हाल के दिनों में HeyGen की तीव्र cadence के अनुरूप है (20 अगस्त को Retouch, 18-19 अगस्त को Brand Kits और 4K upscale)।
Amp अपने token consumption को समझाने के लिए Explain Usage लॉन्च करता है
21 अगस्त — Amp Explain Usage जोड़ता है, एक सुविधा जो integrated assistant Puck से सीधे अपनी token, credit और orb size की consumption का विश्लेषण कराने देती है। उपयोगकर्ता प्राकृतिक भाषा में प्रश्न पूछता है — « आज किन threads ने सबसे अधिक tokens खर्च किए ? » — और Puck उत्तर देने के लिए व्यक्तिगत usage डेटा और प्रति-thread metrics पढ़ता है।
दो entry points हैं: प्रश्न सीधे Puck से पूछना, या usage pages पर समर्पित button पर क्लिक करना। जो उपयोगकर्ता raw data पसंद करते हैं, उनके लिए Amp यह जानकारी CLI (amp usage --details, amp threads usage <thread-id> --details) के माध्यम से भी उपलब्ध कराता है।
v0 (Vercel) 100+ सेवाओं से जुड़ने के लिए Vercel Connect जोड़ता है
21 अगस्त — v0 में बनाई गई apps और agents अब Vercel Connect के माध्यम से सीधे Slack, GitHub, Salesforce और 100 से अधिक अन्य third-party सेवाओं से जुड़ सकती हैं, बिना developer को स्वयं authentication flow प्रबंधित किए।
यह तंत्र reusable team connectors और short-lived tokens पर आधारित है: एक बार टीम पक्ष पर connector कॉन्फ़िगर हो जाने पर, हर नई बनाई गई app या agent इसे पुन: उपयोग कर सकती है, बजाय हर बार पूर्ण authentication फिर से माँगने के। यह v0 को एक ऐसी platform के रूप में स्थापित करता है जो किसी कंपनी के software stack में integrated agents बना सकती है, न कि केवल isolated interfaces।
Codex और ChatGPT Work में साझा threads
20 अगस्त — Codex और ChatGPT Work « shared threads » पेश करते हैं: एक read-only link जो session की पूरी reasoning को उजागर करता है — प्रक्रिया, निर्णय, संदर्भ — न कि केवल अंतिम परिणाम। लक्ष्य यह है कि code review, गहन technical exploration, या co-workers के बीच project handoff के दौरान बिखरे हुए screenshots से pull request का संदर्भ फिर से न बनाना पड़े।
यह एक ऐसी सुविधा है जो हाल की ChatGPT Sites घोषणाओं (बहु-व्यक्ति संपादन, URL personalization) की निरंतरता में आती है और Codex/ChatGPT Work के टीम-work tool के रूप में positioning को मजबूत करती है।
GPT-Image-2 के लिए preview में पारदर्शी पृष्ठभूमियाँ
20 अगस्त — GPT-Image-2 API अब preview में पारदर्शी पृष्ठभूमि वाली छवियाँ उत्पन्न करने देती है। व्यावहारिक लाभ reusable assets बनाना है — product visuals, graphic design elements, website mockups, marketing campaigns — जिन्हें बाद में किसी भी background पर मैन्युअल cutout retouching के बिना रखा जा सकता है।
संक्षिप्त समाचार
- Zed — Antigravity, Zed की ACP Registry से एक क्लिक में स्थापित हो जाता है। 🔗 Tweet
- trackio 0.36 — Hugging Face एक अपडेट प्रकाशित करता है जो loggable data के नए प्रकार के समर्थन को जोड़ता है, बिना अन्य विवरण के। 🔗 Tweet
- Google DeepMind के अनुसार « full-stack » AI — Paige Bailey Google के end-to-end approach को पाँच परतों में विभाजित करती हैं: infrastructure, security, research, models/tools, products. 🔗 Google लेख
- GitHub — blocked users का बेहतर प्रबंधन: नाम से खोज, छँटाई, और लंबी सूचियों का pagination। 🔗 Changelog
- GitHub — repository sidebar में views, projects और milestones को pin करना अब general availability में है, कई संबंधित सुधारों के साथ (reaction avatars, dashboard density)। 🔗 Changelog
- Manus 28 अगस्त तक (SGT) Manus 1.6 Lite और Manus 1.6 तक मुफ्त पहुँच बढ़ाता है, दैनिक quota की सीमा के भीतर। 🔗 Tweet
- Manus सूचित उपयोगकर्ताओं को याद दिलाता है कि वे 23 अगस्त 7:59 बजे (SGT) से पहले अपना डेटा सहेज लें, enterprise-independent होने से पहले। 🔗 Tweet
- Genspark 30 सितंबर तक एक promotion लॉन्च करता है: Design + GenTeam पर -90%, GenMail मुफ्त, Slides Ultra Mode पर -50%। 🔗 Tweet
- NVIDIA एक agentic stack के security deep dive में agent harness (वह क्या करने की कोशिश करता है) और infrastructure (वह वास्तव में क्या कर सकता है) के बीच विभाजन का विवरण देती है। 🔗 Tweet
- NVIDIA DGX Spark पर Seattle Spark Hack Series का सारांश प्रकाशित करती है: आपदा प्रतिक्रिया, स्वास्थ्य, और Nemotron तथा NemoClaw के साथ offline survival में विजेता परियोजनाएँ। 🔗 Tweet
- NVIDIA Cosmos 3 — एक Cosmos Labs वीडियो partners Aigen और Linker Vision में Cosmos 3 के post-training को दिखाता है। 🔗 Tweet
- Luma Labs 14 सितंबर को GMI Cloud के साथ आयोजित Summer Signal में creative agents पर बोलेंगे। 🔗 Tweet
- Synthesia — इसके CEO को Forbes Tech के एक लेख में उद्धृत किया गया है, जो AI adoption को उपयोग के बजाय परिणामों से मापने पर है। 🔗 Tweet
- Qwen3.8-27B अपनी सामुदायिक गति जारी रखता है: SGLang cookbook में नए NVFP4 + DFlash2 inference recipes, Unsloth द्वारा प्रकाशित हल्के संस्करण, चार दिनों में Cline code agent leaderboard पर 1ᵉ स्थान, और एक NVIDIA DGX Station जो BF16 service में समेकित peak पर 2713 tokens/second से अधिक रिपोर्ट करता है। 🔗 SGLang · 🔗 Unsloth · 🔗 Cline · 🔗 DGX Station
- Qwen3.8-Max अब interface generation के लिए Kilo Code code tool में उपयोग किया जा सकता है। 🔗 Tweet
- Kimi Work वित्तीय विश्लेषकों के लिए दूसरा tutorial प्रकाशित करता है: investor dashboard, financial model updates, batch report generation। 🔗 Tweet
- GLM-5.3 अपनी प्रगति जारी रखता है: आधिकारिक DeepSWE leaderboard पर 69 का score, WorkBuddy platform पर उपलब्धता, और Z.ai द्वारा Build Week का 23 अगस्त 18h (PT) तक विस्तार, पहले 50,000 नए ZCode sign-ups के लिए 100 million free tokens के साथ। 🔗 DeepSWE · 🔗 WorkBuddy · 🔗 Build Week
- GPT-5.6 Sol — तीन third-party platforms (Router, Cloudflare AI Gateway, OpenCode Zen) प्रत्येक सितंबर मध्य तक -50% प्रदान करती हैं, Devin, OpenRouter और v0 पर पहले से कवर की गई छूटों के अतिरिक्त। 🔗 Cloudflare AI Gateway
इसका क्या अर्थ है
आज की Anthropic-GitHub घोषणा एक गहरी प्रवृत्ति को रेखांकित करती है: agentic infrastructure प्रयोगात्मक चरण से बाहर निकल रही है। Claude Platform पर computer use और browser tool की GA, Slack और Teams में Copilot के आगमन के साथ मिलकर, संकेत देती है कि बड़े प्रदाता अब केवल models बेचने तक सीमित नहीं हैं — वे ऐसे agents बेच रहे हैं जो उन tools में कार्य कर सकते हैं जिन्हें टीमें पहले से रोज़मर्रा में उपयोग करती हैं, बिना हर बार समर्पित API integration के। यह क्षमता जितना ही वितरण का भी बदलाव है: अब agent वहीं जाएगा जहाँ काम होता है, बजाय इसके कि काम को उसके पास आना पड़े।
मॉडल के क्षेत्र में, DeepSeek-V4-Flash-Vision-Exp पुष्टि करता है कि multimodality एक अपेक्षित standard बन रहा है, न कि differentiator — यहाँ तक कि economic efficiency पर केंद्रित खिलाड़ी (V4-Flash) भी अब इसे native रूप से शामिल कर रहे हैं, ऐसे प्रदर्शन के साथ जो सर्वोत्तम closed models के करीब पहुँचते हैं। code के agentic benchmarks (Code Arena: WebDev पर GLM-5.3, Cline पर Qwen3.8-27B) में प्रतिस्पर्धा विकास tools पक्ष में वही गतिशीलता दर्शाती है: खुले और बंद models के बीच कीमतों का अंतर संकुचित हो रहा है, जिससे OpenAI को GPT-5.6 Sol पर 20% से अधिक API कीमतें कम करनी पड़ रही हैं।
पूर्ण openness की ओर गति — केवल weights नहीं, बल्कि डेटा और training infrastructure भी — वैज्ञानिक फल देना जारी रखती है: Olmo 3 पर Georgia Tech का अध्ययन एक बंद model पर बिल्कुल संभव नहीं होता, ठीक वैसे ही जैसे ASR benchmark bias पर Hume AI का अध्ययन याद दिलाता है कि leaderboard score वास्तविक transcription quality की गारंटी नहीं देता। ये दो उपयोगी अनुस्मारक हैं, ऐसे समय में जब उद्योग record scores की घोषणाएँ बढ़ा रहा है।
अंततः, वाणिज्यिक लाइसेंस वाले विशाल data sets का बढ़ना — आज EgoSuite-Open100K, पिछले कुछ हफ्तों में कई समान घोषणाओं के बाद — पुष्टि करता है कि वास्तविक मानव डेटा तक पहुँच, केवल synthetic नहीं, robotics और embodied AI के लिए एक रणनीतिक मुद्दा बन रही है, उसी तरह जैसे बड़े language models के लिए compute रहा है।
स्रोत
- Claude Platform — GA computer use, browser tool, Skills API, Files API
- Slack में GitHub Copilot
- Teams में GitHub Copilot
- DeepSeek-V4-Flash-Vision-Exp
- Pika Speech
- Pika Speech की आर्किटेक्चर का विवरण
- EgoSuite-Open100K
- EgoSuite का Hugging Face रिले
- Mythos 5 पर Claude Security
- GPT-5.6 Sol की कीमत में कटौती (API)
- GitHub Copilot में GPT-5.6 Sol -50%
- Code Arena: WebDev पर GLM-5.3 (Max)
- Harvey Tenet
- Georgia Tech सामाजिक तर्क के लिए Olmo 3 की उत्पत्ति का पता लगाता है
- ASR में benchmark optimization का bias
- SenseNova-U1.5-8B-MoT
- Diffusers 0.40.0
- Google DeepMind × Fenris Creations
- Runway Ruby
- ARC-AGI-3 पर NVIDIA AVO
- HeyGen Look Packs
- Amp उपयोग की व्याख्या
- v0 Vercel Connect
- Codex / ChatGPT Work की साझा Threads
- GPT-Image-2 के पारदर्शी पृष्ठभूमियाँ
- Zed × Antigravity
- trackio 0.36
- Google DeepMind के अनुसार full-stack AI
- GitHub — अवरुद्ध उपयोगकर्ताओं का प्रबंधन
- GitHub — sidebar पिनिंग
- Manus — विस्तारित निःशुल्क पहुँच
- Manus — सहेजने की याद दिलाना
- Genspark — प्रमोशन
- NVIDIA — agentic stack की सुरक्षा
- NVIDIA — DGX Spark Seattle hackathon
- NVIDIA Cosmos 3 — post-training
- DGX Station — Qwen3.8-27B
- Luma Labs — Summer Signal
- Forbes में Synthesia
- Qwen3.8-27B — SGLang cookbook
- Qwen3.8-27B — Unsloth
- Qwen3.8-27B — Cline में 1ᵉ स्थान
- Qwen3.8-Max — Kilo Code
- Kimi Work — वित्तीय विश्लेषकों के लिए ट्यूटोरियल
- GLM-5.3 — DeepSWE स्कोर
- GLM-5.3 — WorkBuddy
- GLM-5.3 — Build Week Z.ai
- GPT-5.6 Sol — तृतीय-पक्ष छूट