खोजें

Claude Platform सामान्य उपलब्धता में, GitHub Copilot Slack में आया, DeepSeek ने मल्टीमोडल मॉडल लॉन्च किया

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Claude Platform सामान्य उपलब्धता में, GitHub Copilot Slack में आया, DeepSeek ने मल्टीमोडल मॉडल लॉन्च किया

ai-powered-markdown-translator

gpt-5.4-mini के साथ fr से hi में अनूदित लेख।

GitHub पर प्रोजेक्ट देखें ↗

एजेंटिक इन्फ्रास्ट्रक्चर के बिल्डिंग ब्लॉक्स के लिए बड़ा दिन: Anthropic ने Claude Platform पर computer use, browser tool, Skills API और Files API को बीटा से निकालकर उपलब्ध कराया है, जबकि GitHub Copilot Slack और Microsoft Teams में स्थापित हो रहा है। मॉडल्स की तरफ, DeepSeek अपना पहला मल्टीमोडल मॉडल प्रकाशित कर रहा है और Pika Labs एक ऐसा वॉयस सिंथेसाइज़र लॉन्च कर रहा है जो कीमत/गुणवत्ता का अभूतपूर्व अनुपात होने का दावा करता है। इन दोनों के बीच, एक विशाल egocentric डेटासेट, स्पीच रिकग्निशन में benchmark bias पर एक अध्ययन, और Google DeepMind, GitHub, Z.ai, Qwen, Harvey तथा वीडियो/ऑडियो जनरेशन टूल्स के कई उल्लेखनीय अपडेट हैं।


Claude Platform : computer use, browser tool, Skills API और Files API सामान्य उपलब्धता में

20 अगस्त — Anthropic ने Claude Platform पर एजेंट बनाने के लिए चार बिल्डिंग ब्लॉक्स को सामान्य उपलब्धता में ले जाने की घोषणा की है: computer use, browser tool, Skills API और Files API। घोषित लक्ष्य है कि जिन ऐप्स में API नहीं है, उनमें एक कार्य को ऑटोमेट करने के लिए आवश्यक आने-जाने की संख्या कम की जाए, और वर्ज़न किए गए skills तथा पुन: उपयोग योग्य files पर आधारित Claude Managed Agents बनाए जा सकें।

नया computer_toolset_20260801 Claude को एक टर्न में कई क्रियाएँ क्रम से करने देता है (क्लिक, टाइपिंग, कीबोर्ड कुंजी, स्क्रीनशॉट) — हर अलग क्रिया के लिए एक बार आने-जाने के बजाय। Anthropic के अनुसार शुरुआती एक्सेस ग्राहकों ने प्रति कार्य 20 से 40 % कम आने-जाने देखे हैं। browser tool भी browser_toolset_20260801 के साथ विकसित होता है: पिक्सेल्स को लक्ष्य बनाने के बजाय — जो लेआउट में ज़रा-से बदलाव पर भी नाज़ुक होता है — Claude अब पेज की संरचना प्राप्त करता है और तत्वों के संदर्भों पर कार्य कर सकता है।

API की तरफ, Skills API एक टीम की प्रक्रिया को एक बार अपलोड करने, उसे वर्ज़न करने और उसे किसी सटीक version_id या latest से पिन करने की सुविधा देती है। Files API में expires_in_seconds पैरामीटर जुड़ता है, 5 गुना अधिक rate limit (500 अनुरोध प्रति मिनट) और प्रति संगठन 1 TB कोटा मिलता है। Anthropic ने Managed Agents के लिए एक AG-UI adapter भी जारी किया है, जो हर चर्चा-थ्रेड को एक managed session से मैप करता है और text, tool calls तथा reasoning को interface तक प्रसारित करता है।

बिल्डिंग ब्लॉकआज की नई बात
Computer usecomputer_toolset_20260801, प्रति कार्य -40% तक कम आने-जाने
Browser toolbrowser_toolset_20260801, पेज तत्व संदर्भ द्वारा लक्ष्य निर्धारण
Skills APIवर्ज़निंग, version_id या latest से पिन करना
Files API500 अनुरोध/मिनट (x5), प्रति संगठन 1 TB कोटा

🔗 Claude Platform घोषणा


GitHub Copilot Slack और Microsoft Teams में आया

21 अगस्त — GitHub Copilot अब पब्लिक प्रीव्यू में Slack और Microsoft Teams पर उपलब्ध है। दोनों मामलों में सिद्धांत समान है: किसी direct message, channel या thread में @GitHub का उल्लेख करने से एक cloud agent session खुलता है, जो कोड और GitHub गतिविधि पर सवालों के जवाब दे सकता है, bug reports को छाँट सकता है, failures की जाँच कर सकता है, सुरक्षित cloud sandbox में बदलाव लागू कर सकता है, और फिर मूल बातचीत के लिंक के साथ pull requests खोल सकता है।

Slack पर यह integration Slack Code पर आधारित है, Slack की नई agentic पेशकश जिसे उसी सप्ताहांत लॉन्च किया गया था: GitHub Copilot समर्पित code channels खोल सकता है जहाँ टीम diffs देखती है और rendering previews की जाँच करती है, बिना मूल बातचीत को प्रदूषित किए। Teams पर, एक चर्चा सामूहिक agent session में बदल जाती है जिसे हर कोई देख और दिशा दे सकता है; टीम कुछ और करती रहती है जबकि काम cloud sandbox में asynchronously चलता रहता है।

उपलब्धता केवल Copilot Business या Enterprise योजना वाली संगठनों के लिए आरक्षित है। प्रशासक Copilot cloud agent policy सक्रिय करता है और Slack या Teams ऐप इंस्टॉल करता है; repository प्रशासक agent द्वारा उत्पन्न pull requests को merge करने से पहले approval की मांग कर सकते हैं। उपयोग AI credits खपत करता है, और cloud sandbox अलग से configurable budgets के साथ बिल किया जाता है।

🔗 Slack में GitHub Copilot · 🔗 Teams में GitHub Copilot


DeepSeek-V4-Flash-Vision-Exp : API पर DeepSeek का पहला मल्टीमोडल मॉडल

21 अगस्त — DeepSeek DeepSeek-V4-Flash-Vision-Exp को ऑनलाइन उपलब्ध कराता है, एक प्रयोगात्मक मल्टीमोडल मॉडल जो deepseek-v4-flash-vision-exp पहचानकर्ता के तहत उपलब्ध है। विशुद्ध पाठ्य क्षमताओं — agents, reasoning, world knowledge — में यह मॉडल DeepSeek-V4-Flash के बराबर है। नई बात कहीं और है: मल्टीमोडल agents के benchmarks पर DeepSeek, V4-Flash की तुलना में स्पष्ट छलांग की घोषणा करता है, और प्रदर्शन Opus-4.8 के करीब पहुँचता है।

API पक्ष में multimodal support पूर्ण है: मिश्रित input text + image (base64, external URL, या उसी दिन लॉन्च की गई नई free Files API के माध्यम से), और मौजूदा तीन formats (Chat Completions, Messages, Responses) के साथ संगत। मूल्य निर्धारण V4-Flash ग्रिड का अनुसरण करता है, जिसमें image tokenization प्रति image अधिकतम 384 tokens तक सीमित है। Files API आपको एक image केवल एक बार upload करने और उसे file_id द्वारा reference करने देती है, जो दोहराए जाने वाले agentic उपयोगों के लिए bandwidth बचाती है। DeepSeek Harness 0.1.1, 13 अगस्त को लॉन्च किया गया open-source agent harness, नए मॉडल को native रूप से support करने के लिए उसी दिन अपडेट किया गया।

तत्वविवरण
मॉडलdeepseek-v4-flash-vision-exp
पाठ क्षमताएँDeepSeek-V4-Flash के साथ समानता
मल्टीमोडल क्षमताएँमल्टीमोडल agents के benchmarks पर Opus-4.8 के करीब
image pricing384 tokens/image तक, V4-Flash मूल्य
समर्थित APIsChat Completions, Messages, Responses
HarnessDeepSeek Harness 0.1.1 (native support)

DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.

🇮🇳 DeepSeek-V4-Flash-Vision-Exp अब DeepSeek API प्लेटफ़ॉर्म पर उपलब्ध है! यह प्रयोगात्मक मल्टीमोडल मॉडल पाठ्य क्षमताओं पर DeepSeek-V4-Flash के बराबर है — जिसमें agents, reasoning और world knowledge शामिल हैं। मल्टीमोडल agents के benchmarks पर, V4-Flash-Vision-Exp, V4-Flash की तुलना में एक बड़ी छलांग लगाता है, और multimodal agent performance को Opus-4.8 के स्तर के करीब ले आता है।@deepseek_ai on X


Pika Speech : 3B वॉयस सिंथेसिस, 1.2 सेकंड प्रति मिनट, ElevenLabs v3 से 9x तक सस्ता

21 अगस्त — Pika Labs अपनी Pika Audio लाइन को Pika Speech के साथ विस्तारित कर रहा है, जो 3 अरब parameters वाला वॉयस सिंथेसिस मॉडल है। मुख्य तर्क गति है: 0.02 का real-time factor (RTF), यानी 48 kHz studio-quality speech का एक मिनट स्थानीय लंबे-रूप परीक्षणों में लगभग 1.2 सेकंड में उत्पन्न होता है, और अनुरोध पाँच मिनट तक की निरंतर speech तक संभव हैं।

रीथम नियंत्रण में, Pika Speech नया करता है: अधिकांश TTS systems में मानक तरीके की तरह बाद में audio को फैलाने या संकुचित करने के बजाय — मॉडल सीधे गति और अवधि को एक « end-of-speech latent » (EOS latent) के माध्यम से नियंत्रित करता है, जो target final image पर रखा गया एक anchor है। इस anchor को पहले खिसकाने से गति संकुचित होती है; इसे बाद में खिसकाने से text को सांस लेने की जगह मिलती है। architecture के स्तर पर, टीम flow matching और distribution matching distillation, FlashAttention-3, तथा एक “token packing” को जोड़ती है, जिससे पाँच phrase segments की लागत लगभग एक segment की दोगुनी होती है, पाँच गुना नहीं।

लागत के मामले में, Pika का दावा है कि यह ElevenLabs v3 की तुलना में 9x तक, Cartesia और ElevenLabs Turbo की तुलना में 4.5x, और Fish Audio की तुलना में 2x तक लाभ दे सकता है — हालांकि इन ratios से आगे सटीक methodology का विवरण नहीं दिया गया है। मॉडल Pika API Club के माध्यम से उपलब्ध है।

Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02. […] Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes it up to 9× more cost-efficient than ElevenLabs v3, 4.5× than Cartesia and ElevenLabs Turbo, and 2× than Fish Audio.

🇮🇳 आइए Pika Speech की बात करें, 3 अरब parameters वाला एक वॉयस सिंथेसिस मॉडल, जिसमें 0.02 का real-time factor है। […] Pika Speech स्टूडियो-क्वालिटी 48 kHz speech का एक मिनट लगभग 1.2 सेकंड में उत्पन्न करता है — और पाँच मिनट तक के अनुरोधों का समर्थन करता है। यह दक्षता इसे ElevenLabs v3 की तुलना में 9 गुना, Cartesia और ElevenLabs Turbo की तुलना में 4.5 गुना, और Fish Audio की तुलना में 2 गुना तक अधिक किफायती बनाती है।@pika_labs on X

🔗 आर्किटेक्चर विवरण


EgoSuite-Open100K : सबसे बड़ा खुला मानव egocentric डेटासेट

21 अगस्त — Lightwheel AI, Hugging Face के साथ साझेदारी में, EgoSuite-Open100K को open-source करता है, जिसे अब तक सार्वजनिक रूप से जारी किया गया सबसे बड़ा, पूरी तरह annotated मानव egocentric डेटासेट बताया गया है। लक्ष्य 100,000 घंटे के first-person human data का है; पहले 10,000 घंटे पहले ही उपलब्ध हैं, और बाकी चरणों में प्रकाशित होंगे।

यह डेटासेट 15,000 से अधिक tasks को कवर करता है, जो 15,000 से अधिक वास्तविक scenes — रसोई, बेडरूम, warehouses, assembly lines — में फैले हैं, और 7 environment categories तथा 128 scene types में व्यवस्थित हैं। हर sequence में हाथ की pose, शरीर की pose और sub-tasks के स्तर पर semantics की annotation है, और corpus के एक हिस्से में wrist-mounted camera coverage भी है। License के लिहाज़ से एक उल्लेखनीय बात: कई research datasets के विपरीत, EgoSuite-Open100K commercial training के लिए लाइसेंस प्राप्त है, केवल academic उपयोग के लिए नहीं।

डेवलपर्स इसे “Physical AI” (रोबोटिक्स और embodied AI) के लिए एक व्यापक data infrastructure की पहली सार्वजनिक कड़ी के रूप में प्रस्तुत करते हैं — यह विचार कि physical models का scale-up अब massive, shared human data तक पहुँच पर निर्भर है।

🔗 Lightwheel AI घोषणा · 🔗 Hugging Face रिले


Claude Security अब Claude Mythos 5 पर चलता है

21 अगस्त — Anthropic अपने vulnerability scanning tool Claude Security को Claude Mythos 5 पर चला रहा है, जो सभी Claude Enterprise ग्राहकों के लिए public beta में है। तर्क: सुरक्षा के लिए Anthropic के सबसे सक्षम मॉडल का लाभ उसके codebase पर लेना, बिना मॉडल तक अलग पहुँच के — scans मौजूदा plan पर standard token usage के रूप में बिल किए जाते हैं।

व्यवहार में, टूल GitHub repository पर जाता है और Mythos 5 डेटा के फ़ाइलों के बीच प्रवाह को ट्रेस करके तथा components के बीच interactions पर reasoning करके code का विश्लेषण करता है। हर result CWE category, confidence level, severity assessment और एक सुझाए गए fix के साथ लौटता है, जो सीधे web पर Claude Code में खुलता है। Anthropic इस अवसर पर Defender Advantage Fund भी लॉन्च करता है, जिसमें open source सुरक्षा के लिए 35 million dollars के credits हैं, और आने वाले हफ्तों में अपने Cyber Verification Program का विस्तार करने की योजना है।

🔗 Claude Security घोषणा


GPT-5.6 Sol मूल्य-निर्धारण : OpenAI API कीमतें घटाता है, GitHub Copilot साथ देता है

21 अगस्त — OpenAI अगले तीन महीनों के लिए GPT-5.6 Sol की API कीमतें और credits 20 % से अधिक घटा रहा है। यह कदम API पक्ष में पहले ही सक्रिय है और दिन भर Codex तथा ChatGPT Work में लागू हो रहा है। टास्क-आधारित (token-based) योजनाओं पर Codex उपयोगकर्ताओं के लिए, खरीदे गए credits अब अधिक दूर तक चलते हैं; Pro, Plus और Business subscriptions में शामिल उपयोग, हालांकि, अपरिवर्तित रहता है — इसलिए कीमत में कटौती मुख्य रूप से API developers और token-आधारित बिलिंग वाले उपयोगकर्ताओं को लाभ देती है।

GitHub Copilot में GPT-5.6 Sol -50%

साथ ही, GitHub एक अलग प्रमोशन जारी करता है: GitHub Copilot में GPT-5.6 Sol पर -50 % छूट, जो 3 सितंबर तक ऐप, CLI और IDE में उपयोग की जा सकती है। यह Copilot पक्ष की एक सीमित-समय की छूट है, जिसे ऊपर वर्णित OpenAI की स्थायी मूल्य कटौती के साथ भ्रमित नहीं करना चाहिए — दो अलग कंपनियाँ, उसी मॉडल पर दो अलग तंत्र।

🔗 OpenAI मूल्य कटौती · 🔗 GitHub Copilot प्रमोशन


GLM-5.3 (Max) Code Arena: WebDev में ऊपर चढ़ता है

20 अगस्त — LMArena बताता है कि Z.ai का GLM-5.3 (Max) ने Code Arena: WebDev रैंकिंग के Pareto frontier (गुणवत्ता/लागत अनुपात) को आगे बढ़ाया है, जो web development tasks पर मॉडल मूल्यांकन के लिए समर्पित है। 1597 अंकों के साथ, मॉडल open-weight models (एक बार प्रकाशित होने पर) में 2वें स्थान पर और सभी श्रेणियों में कुल 8वें स्थान पर होगा।

मॉडलकीमत ($/M tokens)Code Arena: WebDev अंक
GLM-5.3 (Max)$3,651597
Qwen3.8 (Max)$5,00
Gemini-3.7-flash-high$2,86कम बेहतर स्कोर
DeepSeek-v4-flash-high$1,10कम बेहतर स्कोर

प्रति million tokens $3.65 पर, GLM-5.3 (Max) कीमत के लिहाज़ से Qwen3.8 (Max) के समान दायरे में रहता है, जबकि इस रैंकिंग में Gemini-3.7-flash-high और DeepSeek-v4-flash-high से बेहतर प्रदर्शन करता है — agentic web development पर Z.ai की प्रतिस्पर्धात्मकता का एक और संकेत, Terminal-Bench और general Agent Arena के पहले से ज्ञात परिणामों के पूरक के रूप में।

🔗 LMArena घोषणा


Harvey ने Tenet लॉन्च किया, Kimi K3 पर आधारित एक कानूनी मॉडल

20 अगस्त — Harvey Tenet पेश करता है, जो कानून के लिए उसका पहला post-trained model है, और यह एक Kimi K3 (Moonshot AI) base से शुरू होता है, जिसे Fireworks AI के साथ public legal data, synthetic data और लंबे समय के कानूनी काम का अनुकरण करने वाले human expert data के corpus पर post-train किया गया है।

Harvey का कहना है कि यह post-training Tenet की end-to-end success rate को LAB benchmark पर 82 % और LAB Contracts पर 22 % बढ़ा देता है, base Kimi K3 की तुलना में — और LAB Contracts पर state of the art तथा पूरे LAB पर दूसरा स्थान प्राप्त होता है। Tenet की संचालन लागत बाजार के सबसे सक्षम foundation models की लागत के एक चौथाई से भी कम होने का अनुमान है। इसके अतिरिक्त, Harvey ने तीन specialist sub-agents प्रशिक्षित किए हैं: M&A diligence, table review, और firm knowledge।

🔗 Harvey घोषणा


Georgia Tech ने Olmo 3 के सामाजिक तर्क के स्रोतों का पता लगाया

21 अगस्त — Georgia Tech की एक टीम ने इस तथ्य का लाभ उठाया कि Ai2 का Olmo 3 स्टैक पूरी तरह खुला है — वज़न, Dolma 3 का प्री-ट्रेनिंग कॉर्पस (1,26 अरब दस्तावेज़), इंफ्रास्ट्रक्चर — ताकि मॉडल की क्षमताओं को सांख्यिकीय रूप से उन पाठों से जोड़ा जा सके जिन्होंने उन्हें उत्पन्न किया, जो एक बंद मॉडल पर असंभव प्रयोग होता।

यह विधि influence functions पर आधारित है, जिन्हें Dolma 3 में सैंपल किए गए लगभग 5,68 लाख दस्तावेज़ों पर लागू किया गया। मुख्य परिणाम: संवाद-समृद्ध और अंतर-व्यक्तिगत लेखन वाले पाठ तथ्यात्मक ज्ञान की तुलना में सामाजिक तर्क में प्रदर्शन पर अधिक प्रभाव डालते हैं — और सबसे प्रभावशाली साहित्यिक दस्तावेज़ों को हटाने पर SocialIQA benchmark पर प्रदर्शन में उल्लेखनीय गिरावट आई, जिससे कारणता की पुष्टि हुई।

🔗 Ai2 लेख


खुली स्रोत ASR मॉडलों में « benchmark optimization » पूर्वाग्रह का पता चला

21 अगस्त — Hume AI की एक टीम Hugging Face ब्लॉग पर वाक् पहचान में एक पद्धतिगत पूर्वाग्रह पर अध्ययन प्रकाशित करती है: कुछ मॉडल सार्वजनिक benchmarks की संदर्भ प्रतिलिपियों को faithfully transcribe करने के बजाय उन्हें पुन: प्रस्तुत करने के लिए अनुकूलित लगते हैं।

परीक्षित 11 open source ASR मॉडल में से, विश्लेषित लगभग 40% VoxPopuli अंशों में उनकी references में त्रुटियाँ थीं, और 11 में से 6 मॉडल सही ढंग से ऑडियो ट्रांसक्राइब करने के बजाय उन त्रुटियों को ही दोहरा रहे थे। LibriSpeech पर, masked numbers की recovery दर 30 से 40% तक पहुँची, जो संकेत है कि कुछ मॉडल सुनने के बजाय पाठ को « भर » देते हैं। निष्कर्ष में secret evaluation sets के उपयोग और training तथा test data के बीच अधिक कठोर विभाजन की सिफारिश की गई है।

🔗 Hugging Face अध्ययन


SenseNova-U1.5-8B-MoT : VAE या DiT के बिना खुला image model

21 अगस्त — SenseNova एक image generation model को open weights के रूप में जारी करता है, जिसके घोषित प्रदर्शन Nano Banana 2 के बराबर बताए जाते हैं। तकनीकी आकर्षण इसकी architecture में है: न VAE, न अलग text encoder, न DiT — मॉडल एक « mixture of transformers » पर आधारित है, जहाँ text और image tokens अलग-अलग weights का उपयोग करते हैं और परस्पर एक-दूसरे की अपेक्षा करते हैं, तथा denoising compressed latent space के बजाय सीधे pixel space में होता है।

यह दृष्टिकोण text-image diffusion models के मानक stack से अलग है, और इसका weight openness समुदाय को घोषित performance comparisons की स्वतंत्र रूप से जाँच करने देगी।

🔗 SenseNova घोषणा


Diffusers 0.40.0 : Modular Diffusers प्रयोगात्मक स्थिति से बाहर

21 अगस्त — Hugging Face Diffusers 0.40.0 जारी करता है। सबसे संरचनात्मक बदलाव Modular Diffusers का प्रयोगात्मक स्थिति से बाहर निकलना है, जो library की modular pipeline प्रणाली है। यह संस्करण कई हालिया खुले मॉडलों (LTX2.5, MiniMax H3, MiniMax Music 3, Wan Animate 2) का एकीकरण जोड़ता है, कुछ मॉडलों के लिए tensor parallelism समर्थन, और quantification के दो नए backends (SDNQ, Nunchaku-Lite) जोड़ता है।

🔗 Diffusers 0.40.0 घोषणा


Google DeepMind Fenris Creations के साथ खेलों में AI का अन्वेषण करता है

21 अगस्त — Google DeepMind स्टूडियो Fenris Creations के साथ एक शोध साझेदारी की घोषणा करता है, जो AI के लिए प्रयोगात्मक क्षेत्र के रूप में वीडियो गेम्स का उपयोग करने वाले 15 वर्षों के कार्यों की निरंतरता है — Atari mastery से लेकर StarCraft II पर Grandmaster स्तर तक। SIMA के बाद, जिसने एजेंटों को 3D संसारों को समझना सिखाया, DeepMind एक स्थायी universe के भीतर वास्तविक मानव गतिशीलताओं में नेविगेशन का अन्वेषण करना चाहता है।

यह साझेदारी चार खुले चुनौतियों को लक्षित करती है: निरंतर सीखना (पहले सीखी चीज़ों को भूले बिना नई क्षमताएँ अर्जित करना), मौजूदा context windows से बहुत आगे तक जाने वाली deep memory systems, लंबी क्षितिज वाली योजना (सप्ताह, महीने, वर्ष), और multi-agent dynamics (सहयोग, बातचीत, अर्थव्यवस्था, उभरते व्यवहार)। दीर्घकालिक उद्देश्य दोहरा है: डेवलपर्स के साथ नई गेमिंग experiences बनाना, और इन प्रगतियों को वास्तविक दुनिया की समस्याओं तथा वैज्ञानिक खोज के लिए पुन: उपयोग करना।

🔗 Google DeepMind घोषणा


Runway Ruby : SDR वीडियो को 16-bit HDR में रूपांतरित करना

21 अगस्त — Runway Ruby लॉन्च करता है, एक मॉडल जो SDR (standard dynamic range) वीडियो को 16-bit HDR में रूपांतरित करता है, EXR sequences या ProRes/HEVC 10-12 bit output के रूप में, BT.2020 color space में PQ या HLG समर्थन के साथ — वे मानक जो पेशेवर post-production और HDR broadcast में उपयोग होते हैं।

Ruby उपयोगकर्ता द्वारा uploaded वीडियो और Runway द्वारा generated output, दोनों पर समान रूप से काम करता है, 30 सेकंड की सीमा के साथ। यह सुविधा Max और Enterprise योजनाओं के लिए अभी उपलब्ध है।

🔗 Runway Ruby घोषणा


NVIDIA AVO ने ARC-AGI-3 benchmark पर 100 % का दावा किया

21 अगस्त — NVIDIA AVO प्रस्तुत करता है, एक generalist code agent, 100 % score के साथ ARC-AGI-3 पर, जो एक interactive reasoning benchmark है। NVIDIA के अनुसार, AVO ने benchmark के 25 public environments में फैले 183 levels को पूरा किया, बिना स्पष्ट निर्देशों, बताए गए नियमों या पहले से formulat किए गए उद्देश्यों के।

AVO inspection, planning, implementation और evaluation के एक निरंतर loop के माध्यम से काम करता है, memory, tools और execution feedback का उपयोग करके उस पर निर्माण करता है जो वह समय के साथ सीखता है — एक ऐसा दृष्टिकोण जिसका उद्देश्य long tasks पर progress बनाए रखना है, बजाय हर नए context window पर शून्य से शुरू करने के।

🔗 ARC-AGI-3 परिणाम


HeyGen Look Packs : चेहरा बनाए रखते हुए पहनावा और सेट बदलना

21 अगस्त — HeyGen Look Packs लॉन्च करता है, एक सुविधा जो avatar वीडियो के पहनावे और सेट को बदलती है, जबकि व्यक्ति के चेहरे को faithfully बनाए रखती है — तर्क यह है कि अधिकांश generative models रूप-रंग बदलते समय चेहरे की विशेषताएँ भी बदल देते हैं।

उद्देश्य विभिन्न पेशेवर संदर्भों में व्यक्तिगत ब्रांड की निरंतरता है: real estate, legal, fitness, education, well-being। एक B2B content creator इस प्रकार हर sector के लिए उपयुक्त पहनावे और सेट में वीडियो बना सकता है, जबकि एक वीडियो से दूसरे में पहचाना जा सकता है। यह घोषणा हाल के दिनों में HeyGen की तीव्र cadence के अनुरूप है (20 अगस्त को Retouch, 18-19 अगस्त को Brand Kits और 4K upscale)।

🔗 Look Packs घोषणा


Amp अपने token consumption को समझाने के लिए Explain Usage लॉन्च करता है

21 अगस्त — Amp Explain Usage जोड़ता है, एक सुविधा जो integrated assistant Puck से सीधे अपनी token, credit और orb size की consumption का विश्लेषण कराने देती है। उपयोगकर्ता प्राकृतिक भाषा में प्रश्न पूछता है — « आज किन threads ने सबसे अधिक tokens खर्च किए ? » — और Puck उत्तर देने के लिए व्यक्तिगत usage डेटा और प्रति-thread metrics पढ़ता है।

दो entry points हैं: प्रश्न सीधे Puck से पूछना, या usage pages पर समर्पित button पर क्लिक करना। जो उपयोगकर्ता raw data पसंद करते हैं, उनके लिए Amp यह जानकारी CLI (amp usage --details, amp threads usage <thread-id> --details) के माध्यम से भी उपलब्ध कराता है।

🔗 Explain Usage


v0 (Vercel) 100+ सेवाओं से जुड़ने के लिए Vercel Connect जोड़ता है

21 अगस्तv0 में बनाई गई apps और agents अब Vercel Connect के माध्यम से सीधे Slack, GitHub, Salesforce और 100 से अधिक अन्य third-party सेवाओं से जुड़ सकती हैं, बिना developer को स्वयं authentication flow प्रबंधित किए।

यह तंत्र reusable team connectors और short-lived tokens पर आधारित है: एक बार टीम पक्ष पर connector कॉन्फ़िगर हो जाने पर, हर नई बनाई गई app या agent इसे पुन: उपयोग कर सकती है, बजाय हर बार पूर्ण authentication फिर से माँगने के। यह v0 को एक ऐसी platform के रूप में स्थापित करता है जो किसी कंपनी के software stack में integrated agents बना सकती है, न कि केवल isolated interfaces।

🔗 Vercel Connect


Codex और ChatGPT Work में साझा threads

20 अगस्त — Codex और ChatGPT Work « shared threads » पेश करते हैं: एक read-only link जो session की पूरी reasoning को उजागर करता है — प्रक्रिया, निर्णय, संदर्भ — न कि केवल अंतिम परिणाम। लक्ष्य यह है कि code review, गहन technical exploration, या co-workers के बीच project handoff के दौरान बिखरे हुए screenshots से pull request का संदर्भ फिर से न बनाना पड़े।

यह एक ऐसी सुविधा है जो हाल की ChatGPT Sites घोषणाओं (बहु-व्यक्ति संपादन, URL personalization) की निरंतरता में आती है और Codex/ChatGPT Work के टीम-work tool के रूप में positioning को मजबूत करती है।

🔗 साझा threads


GPT-Image-2 के लिए preview में पारदर्शी पृष्ठभूमियाँ

20 अगस्तGPT-Image-2 API अब preview में पारदर्शी पृष्ठभूमि वाली छवियाँ उत्पन्न करने देती है। व्यावहारिक लाभ reusable assets बनाना है — product visuals, graphic design elements, website mockups, marketing campaigns — जिन्हें बाद में किसी भी background पर मैन्युअल cutout retouching के बिना रखा जा सकता है।

🔗 पारदर्शी पृष्ठभूमियाँ


संक्षिप्त समाचार

  • Zed — Antigravity, Zed की ACP Registry से एक क्लिक में स्थापित हो जाता है। 🔗 Tweet
  • trackio 0.36 — Hugging Face एक अपडेट प्रकाशित करता है जो loggable data के नए प्रकार के समर्थन को जोड़ता है, बिना अन्य विवरण के। 🔗 Tweet
  • Google DeepMind के अनुसार « full-stack » AI — Paige Bailey Google के end-to-end approach को पाँच परतों में विभाजित करती हैं: infrastructure, security, research, models/tools, products. 🔗 Google लेख
  • GitHub — blocked users का बेहतर प्रबंधन: नाम से खोज, छँटाई, और लंबी सूचियों का pagination। 🔗 Changelog
  • GitHub — repository sidebar में views, projects और milestones को pin करना अब general availability में है, कई संबंधित सुधारों के साथ (reaction avatars, dashboard density)। 🔗 Changelog
  • Manus 28 अगस्त तक (SGT) Manus 1.6 Lite और Manus 1.6 तक मुफ्त पहुँच बढ़ाता है, दैनिक quota की सीमा के भीतर। 🔗 Tweet
  • Manus सूचित उपयोगकर्ताओं को याद दिलाता है कि वे 23 अगस्त 7:59 बजे (SGT) से पहले अपना डेटा सहेज लें, enterprise-independent होने से पहले। 🔗 Tweet
  • Genspark 30 सितंबर तक एक promotion लॉन्च करता है: Design + GenTeam पर -90%, GenMail मुफ्त, Slides Ultra Mode पर -50%। 🔗 Tweet
  • NVIDIA एक agentic stack के security deep dive में agent harness (वह क्या करने की कोशिश करता है) और infrastructure (वह वास्तव में क्या कर सकता है) के बीच विभाजन का विवरण देती है। 🔗 Tweet
  • NVIDIA DGX Spark पर Seattle Spark Hack Series का सारांश प्रकाशित करती है: आपदा प्रतिक्रिया, स्वास्थ्य, और Nemotron तथा NemoClaw के साथ offline survival में विजेता परियोजनाएँ। 🔗 Tweet
  • NVIDIA Cosmos 3 — एक Cosmos Labs वीडियो partners Aigen और Linker Vision में Cosmos 3 के post-training को दिखाता है। 🔗 Tweet
  • Luma Labs 14 सितंबर को GMI Cloud के साथ आयोजित Summer Signal में creative agents पर बोलेंगे। 🔗 Tweet
  • Synthesia — इसके CEO को Forbes Tech के एक लेख में उद्धृत किया गया है, जो AI adoption को उपयोग के बजाय परिणामों से मापने पर है। 🔗 Tweet
  • Qwen3.8-27B अपनी सामुदायिक गति जारी रखता है: SGLang cookbook में नए NVFP4 + DFlash2 inference recipes, Unsloth द्वारा प्रकाशित हल्के संस्करण, चार दिनों में Cline code agent leaderboard पर 1ᵉ स्थान, और एक NVIDIA DGX Station जो BF16 service में समेकित peak पर 2713 tokens/second से अधिक रिपोर्ट करता है। 🔗 SGLang · 🔗 Unsloth · 🔗 Cline · 🔗 DGX Station
  • Qwen3.8-Max अब interface generation के लिए Kilo Code code tool में उपयोग किया जा सकता है। 🔗 Tweet
  • Kimi Work वित्तीय विश्लेषकों के लिए दूसरा tutorial प्रकाशित करता है: investor dashboard, financial model updates, batch report generation। 🔗 Tweet
  • GLM-5.3 अपनी प्रगति जारी रखता है: आधिकारिक DeepSWE leaderboard पर 69 का score, WorkBuddy platform पर उपलब्धता, और Z.ai द्वारा Build Week का 23 अगस्त 18h (PT) तक विस्तार, पहले 50,000 नए ZCode sign-ups के लिए 100 million free tokens के साथ। 🔗 DeepSWE · 🔗 WorkBuddy · 🔗 Build Week
  • GPT-5.6 Sol — तीन third-party platforms (Router, Cloudflare AI Gateway, OpenCode Zen) प्रत्येक सितंबर मध्य तक -50% प्रदान करती हैं, Devin, OpenRouter और v0 पर पहले से कवर की गई छूटों के अतिरिक्त। 🔗 Cloudflare AI Gateway

इसका क्या अर्थ है

आज की Anthropic-GitHub घोषणा एक गहरी प्रवृत्ति को रेखांकित करती है: agentic infrastructure प्रयोगात्मक चरण से बाहर निकल रही है। Claude Platform पर computer use और browser tool की GA, Slack और Teams में Copilot के आगमन के साथ मिलकर, संकेत देती है कि बड़े प्रदाता अब केवल models बेचने तक सीमित नहीं हैं — वे ऐसे agents बेच रहे हैं जो उन tools में कार्य कर सकते हैं जिन्हें टीमें पहले से रोज़मर्रा में उपयोग करती हैं, बिना हर बार समर्पित API integration के। यह क्षमता जितना ही वितरण का भी बदलाव है: अब agent वहीं जाएगा जहाँ काम होता है, बजाय इसके कि काम को उसके पास आना पड़े।

मॉडल के क्षेत्र में, DeepSeek-V4-Flash-Vision-Exp पुष्टि करता है कि multimodality एक अपेक्षित standard बन रहा है, न कि differentiator — यहाँ तक कि economic efficiency पर केंद्रित खिलाड़ी (V4-Flash) भी अब इसे native रूप से शामिल कर रहे हैं, ऐसे प्रदर्शन के साथ जो सर्वोत्तम closed models के करीब पहुँचते हैं। code के agentic benchmarks (Code Arena: WebDev पर GLM-5.3, Cline पर Qwen3.8-27B) में प्रतिस्पर्धा विकास tools पक्ष में वही गतिशीलता दर्शाती है: खुले और बंद models के बीच कीमतों का अंतर संकुचित हो रहा है, जिससे OpenAI को GPT-5.6 Sol पर 20% से अधिक API कीमतें कम करनी पड़ रही हैं।

पूर्ण openness की ओर गति — केवल weights नहीं, बल्कि डेटा और training infrastructure भी — वैज्ञानिक फल देना जारी रखती है: Olmo 3 पर Georgia Tech का अध्ययन एक बंद model पर बिल्कुल संभव नहीं होता, ठीक वैसे ही जैसे ASR benchmark bias पर Hume AI का अध्ययन याद दिलाता है कि leaderboard score वास्तविक transcription quality की गारंटी नहीं देता। ये दो उपयोगी अनुस्मारक हैं, ऐसे समय में जब उद्योग record scores की घोषणाएँ बढ़ा रहा है।

अंततः, वाणिज्यिक लाइसेंस वाले विशाल data sets का बढ़ना — आज EgoSuite-Open100K, पिछले कुछ हफ्तों में कई समान घोषणाओं के बाद — पुष्टि करता है कि वास्तविक मानव डेटा तक पहुँच, केवल synthetic नहीं, robotics और embodied AI के लिए एक रणनीतिक मुद्दा बन रही है, उसी तरह जैसे बड़े language models के लिए compute रहा है।


स्रोत