खोजें

Anthropic ने Claude Opus 5.5 जारी किया, OpenAI ने GPT-6 Sol और Luna लॉन्च किए, Claude Code ने Pro और Team Standard को Opus पर स्थानांतरित किया

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Anthropic ने Claude Opus 5.5 जारी किया, OpenAI ने GPT-6 Sol और Luna लॉन्च किए, Claude Code ने Pro और Team Standard को Opus पर स्थानांतरित किया

ai-powered-markdown-translator

लेख का fr से hi में अनुवाद gpt-5.6-sol के साथ किया गया।

GitHub पर प्रोजेक्ट देखें ↗

मंगलवार 22 सितंबर को Anthropic और OpenAI ने दो घंटे से भी कम अंतराल में एक-एक अग्रणी मॉडल लॉन्च किया: Claude Opus 5.5, जिसे Opus 5 से 40% कम लागत पर Fable 5.1 के स्तर का बताया गया है, और फिर GPT-6 Sol तथा GPT-6 Luna, जिनकी API कीमतें GPT-5.6 की प्रचारात्मक दर की तुलना में आधी हैं। दोनों परिवार उसी दिन GitHub Copilot, Devin और Perplexity में उपलब्ध हो गए, जबकि Claude Code 2.1.280 ने Pro तथा Team Standard योजनाओं को Sonnet से Opus पर स्थानांतरित कर दिया। Codex CLI 0.156.0, Anthropic की बढ़ी हुई उपयोग सीमाएँ और NVIDIA के प्रकाशनों की एक शृंखला ने दिन की अन्य प्रमुख घोषणाएँ पूरी कीं।


Anthropic ने Claude 5.5 परिवार का पहला मॉडल Claude Opus 5.5 लॉन्च किया

22 सितंबर — Anthropic ने अपने नए Claude 5.5 परिवार का पहला मॉडल Claude Opus 5.5 (claude-opus-5-5) लॉन्च किया; Sonnet 5.5 और Haiku 5.5 भी “आने वाले सप्ताहों में” उपलब्ध होंगे। यह आज से Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud और Microsoft Foundry पर उपलब्ध है तथा Claude Code में सशुल्क योजनाओं का डिफ़ॉल्ट मॉडल बन गया है। इसकी संदर्भ विंडो दस लाख tokens की है, अधिकतम आउटपुट 128,000 tokens है और इसका विश्वसनीय ज्ञान जून 2026 तक का है।

Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.

It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.

🇮🇳 पेश है Claude Opus 5.5, हमारे नए Claude 5.5 परिवार का पहला मॉडल। यह अधिकांश कार्यों में Claude Fable 5.1 के स्तर पर काम करता है और इसे चलाने की लागत Opus 5 से 40% कम है।@claudeai का X पर वक्तव्य

Anthropic के अनुसार, यह 40% का आँकड़ा सामान्य कार्यभार पर “डिफ़ॉल्ट सेटिंग्स” में मापा गया है और इसमें कम कीमतों के साथ प्रति कार्य कम tokens का उपयोग शामिल है। दरें 20% घटी हैं—प्रति दस लाख tokens इनपुट के लिए 4 डॉलर और आउटपुट के लिए 20 डॉलर, जबकि Opus 5 के लिए ये दरें 5 और 25 डॉलर थीं—और cache read की कीमत 60% घटकर 0.20 डॉलर हो गई है। आउटपुट 30% से अधिक तेज़ी से तैयार होता है और शोध पूर्वावलोकन में उपलब्ध तेज़ मोड (fast mode) 8 तथा 40 डॉलर की दर पर 2.5 गुना तक अधिक गति देने का दावा करता है।

Benchmark (Anthropic के आँकड़े)Claude Opus 5.5Claude Fable 5.1GPT-6 Astra
Terminal-Bench 4.066,4 %55,8 %57,9 %
FrontierCode v1.1 Main54,4 %50,3 %53,3 %
GDPval-AA v2.1 (Elo)184617351542
OSWorld 2.081,8 %80,7 %
AutomationBench40,0 %31,4 %41,4 %
Terminal-Bench-Science 0.158,7 %52,6 %64,6 %

Opus 5.5 एजेंटिक कोडिंग, कार्यालयी कार्य और कंप्यूटर उपयोग में सबसे आगे है, लेकिन AutomationBench तथा Terminal-Bench-Science पर GPT-6 Astra अब भी आगे है। Anthropic स्पष्ट करता है कि उसके स्कोर सक्रिय उत्पादन सुरक्षा उपायों के साथ मापे गए थे, जिससे संभवतः वे कम हुए हैं, और उसका मानना है कि benchmark का अंतर अब “कम विश्वसनीय मार्गदर्शक” बन गया है: वास्तविक उपयोग में Fable 5.1 से अंतर इन आँकड़ों के संकेत से कम बताया जाता है। यह पहला Opus है जिसे साइबर सुरक्षा, जीवविज्ञान और distillation में Fable 5.1 श्रेणी के सुरक्षा उपायों के साथ लॉन्च किया गया है—अधिकांश साइबर कार्य Opus 4.8 पर स्थानांतरित हो जाते हैं—और Anthropic स्वीकार करता है कि मॉडल को अक्सर संदेह होता दिखाई देता है कि उसका मूल्यांकन किया जा रहा है।

डेवलपरों को migration के लिए कुछ समायोजन करने होंगे: adaptive reasoning को अब बंद नहीं किया जा सकता, जबरन tool selection (tool_choice से any या tool) पर 400 त्रुटि मिलती है और डिफ़ॉल्ट effort अब medium है, जबकि Opus 5 पर यह high था। दो tool calls के बीच लिखा गया पाठ अब reasoning blocks में लौटता है, जो डिफ़ॉल्ट प्रदर्शन में खाली दिखाई देते हैं।

🔗 Claude Opus 5.5 का परिचय · API के लिए Opus 5.5 की नई सुविधाएँ


Claude Code 2.1.280 ने Opus 5.5 जोड़ा और Pro तथा Team Standard को Opus पर स्थानांतरित किया

22 सितंबर — Claude Code 2.1.280 को 16:38 UTC पर, Opus 5.5 की घोषणा के सात मिनट बाद जारी किया गया। 2.1.279 कभी जारी नहीं हुआ: CHANGELOG सीधे 19 सितंबर के 2.1.278 से 114 प्रविष्टियों वाले इस संस्करण पर पहुँचता है।

सबसे स्पष्ट बदलाव मॉडल से संबंधित है। Opus 5.5 डिफ़ॉल्ट Opus मॉडल बन गया है और Pro तथा Team Standard योजनाएँ डिफ़ॉल्ट रूप से Sonnet से Opus पर चली गई हैं, जैसा कि Max, Team Premium और Enterprise में पहले से था। /effort के प्रत्येक मॉडल के लिए विशिष्ट बनने से पहले सहेजे गए effort levels अब Opus 5.5 जैसे नए मॉडलों पर लागू नहीं होते, जो अपनी डिफ़ॉल्ट सेटिंग से शुरू होते हैं; वहीं Opus 4.7, Opus 4.8 और Fable 5 अब चुनी गई सेटिंग से ऊपर अपना प्रारंभिक effort लागू नहीं करते।

सुरक्षा के संदर्भ में, symbolic link के माध्यम से होने वाले लेखन का मूल्यांकन अब उसके वास्तविक गंतव्य के आधार पर किया जाता है: अनुमति अनुरोध उस स्थान का नाम बताता है जहाँ लेखन वास्तव में पहुँचता है, और acceptEdits, अनुमति नियम तथा auto mode अब ऐसे लेखन को मंज़ूरी नहीं देते जो directory tree के बाहर पहुँचता हो। सुरक्षा जाँच से उत्तर न मिलने पर auto mode अब बिना रुके लगातार actions अस्वीकार नहीं करता: नए प्रयासों के बीच अंतराल बढ़ता जाता है और लगातार दस अस्वीकृतियों के बाद turn रुक जाता है। आरक्षित नाम की नकल करने वाले plugin marketplaces अस्वीकार कर दिए जाते हैं और CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH variable से MCP tool descriptions की 2,048 वर्णों वाली सीमा बदली जा सकती है।

बाकी बदलाव उपयोग-सुविधा से जुड़े हैं: अकेले y या n key से अब dialog की पुष्टि या उसे बंद नहीं किया जाता—इसके स्थान पर Enter और Escape का उपयोग होता है—dialog में Ctrl+C दो बार दबाने पर अब Claude Code बंद नहीं होता, prompt cache में होने वाली दो टूट-फूट ठीक कर दी गई हैं और VS Code extension को छह typed commands मिले हैं (/status, /sandbox, /chrome, /export, /skills, /plan)।

CHANGELOG प्रविष्टि की श्रेणीप्रविष्टियों की संख्या
सुधार (Fixed)69
उन्नयन (Improved)21
नई सुविधाएँ (Added)12
बदलाव (Changed)10
वापसी और निष्कासन2
कुल114

🔗 Claude Code v2.1.280

Opus 5.5 के साथ काम करने के लिए दो मार्गदर्शिकाएँ

22 सितंबर — Anthropic ने Addy Osmani द्वारा लिखी दो मार्गदर्शिकाएँ भी प्रकाशित कीं। पहली, “Opus 5.5 पर एक कार्य की लागत” (What a task costs on Opus 5.5), याद दिलाती है कि प्रति token समान कीमत वाले दो मॉडलों पर एक ही कार्य की लागत बहुत अलग हो सकती है, क्योंकि प्रत्येक turn पूरी बातचीत को दोबारा भेजता है। सार्वजनिक दरों पर आधारित उदाहरणों के रूप में प्रस्तुत उसके आँकड़ों के अनुसार, 28 लाख input tokens की लागत cache के बिना 11.20 डॉलर और cache से 90% पढ़े जाने पर 1.62 डॉलर होती है, तथा एक output token की कीमत एक cache read से 100 गुना अधिक होती है। वह दैनिक उपयोग के लिए medium, medium के अटकने पर high, और फिर यदि Opus 5.5 एक ही समस्या पर दो बार विफल हो तो Fable 5.1 की सलाह देता है। ध्यान रहे कि effort या मॉडल बदलने से cache खाली हो जाता है—subscription पर इसकी अवधि एक घंटा और API key के साथ डिफ़ॉल्ट रूप से पाँच मिनट होती है। 44 support tickets वाले एक आंतरिक benchmark में Opus 4.8 से कम effort वाले Opus 5.5 पर जाने से लागत लगभग 18% घटी और /claude-api prompt-audit से इसमें 9% की अतिरिक्त कमी आई।

claude.dev पर प्रकाशित दूसरी मार्गदर्शिका सलाह देती है कि पहले यह निर्धारित करें कि “पूरा” होने का अर्थ क्या है और फिर मॉडल को काम करने दें, तथा “अच्छी तरह सोचो” जैसे निर्देश हटा दें क्योंकि मॉडल उत्तर देने से पहले हमेशा सोचता है। यह यह भी समझाती है कि सुरक्षा उपायों द्वारा किसी संदेश को चिह्नित किए जाने पर पुराने मॉडल पर कैसे स्थानांतरण होता है; इस व्यवहार को applications या /config में समायोजित किया जा सकता है।

🔗 Opus 5.5 पर एक कार्य की लागत · Opus 5.5 का अधिकतम लाभ उठाना


OpenAI ने GPT-6 Sol और GPT-6 Luna लॉन्च किए, जो GPT-5.6 की प्रचारात्मक दर से 50% सस्ते हैं

22 सितंबर — Anthropic के दो घंटे से भी कम समय बाद OpenAI ने GPT-6 Sol और GPT-6 Luna के साथ GPT-6 परिवार का विस्तार किया। इन्हें GPT-6 Astra जैसी विधियों से प्रशिक्षित किया गया है, जो कंपनी के अनुसार अब भी उसका सर्वश्रेष्ठ मॉडल है। Sol जटिल कोडिंग और एजेंटिक कार्यप्रवाहों के लिए है, जबकि Luna अधिक मात्रा वाले लक्षित कार्यों के लिए बनाया गया है; ये क्रमशः GPT-5.6 Sol और GPT-5.6 Luna के उत्तराधिकारी हैं।

We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.

🇮🇳 हमने caching और inference को भी अधिक कुशल बनाया है और ये बचत सीधे आपको दे रहे हैं: Sol और Luna की API कीमतें GPT-5.6 की प्रचारात्मक दर की तुलना में 50% कम हैं।@OpenAI का X पर वक्तव्य

दर का प्रकार (प्रति दस लाख tokens)GPT-6 SolGPT-6 Lunaउल्लिखित GPT-5.6 दर (Sol / Luna)
इनपुट2 डॉलर0,10 डॉलर4 डॉलर / 0,20 डॉलर
Cached इनपुट0,20 डॉलर0,01 डॉलरनिर्दिष्ट नहीं
आउटपुट10 डॉलर0,50 डॉलर20 डॉलर / 1,20 डॉलर

दोनों मॉडल 1,050,000 context tokens स्वीकार करते हैं और अधिकतम 128,000 tokens तैयार करते हैं; 272,000 input tokens से अधिक होने पर पूरे अनुरोध के लिए इनपुट की कीमत दोगुनी और आउटपुट की कीमत 1.5 गुना हो जाती है।

OpenAI के benchmarks में—जो Sol की तुलना Opus 5.5 से पहले के Claude मॉडलों से करते हैं—Sol ने xhigh effort पर AutomationBench में 33.2% स्कोर किया और प्रति कार्य लागत 0.27 डॉलर रही। यह max effort वाले Claude Opus 5 से आगे है, जिसने 26.9% स्कोर किया और जिसकी लागत 11.1 गुना अधिक थी, तथा low effort वाले GPT-6 Astra के 30.3% स्कोर से भी आगे है। DeepSWE v1.1 पर इसका स्कोर 68.8% है, जो Claude Fable 5 के सर्वश्रेष्ठ स्कोर से 1.1 अंक कम है, लेकिन प्रति कार्य लागत लगभग 80% कम है; Luna ने इस पर 66.6% प्राप्त किया। प्रतिस्पर्धियों के स्कोर सार्वजनिक रिपोर्टों से लिए गए हैं। Alignment के संदर्भ में, बेईमानी को बढ़ावा देने के लिए बनाए गए coding tasks पर मापी गई deception rate Sol के लिए घटकर 1.3% रह गई, जबकि GPT-5.6 Sol के लिए यह 10.4% थी।

दोनों मॉडल Plus, Pro, Business, Enterprise और Edu subscribers के लिए ChatGPT Work तथा Codex में क्रमिक rollout के साथ उपलब्ध हो रहे हैं—Enterprise में administrator activation आवश्यक है। Free और Go उपयोगकर्ता desktop application में Luna का उपयोग कर सकते हैं और ये मॉडल अभी Chat में उपलब्ध नहीं हैं। API में Responses और Chat Completions के माध्यम से इनके नाम gpt-6-sol और gpt-6-luna हैं।

🔗 GPT-6 Sol और Luna का परिचय

GPT-6 के लिए नए सिरे से तैयार की गई prompt caching

22 सितंबर — लॉन्च के साथ प्रकाशित लेख “GPT-6 के लिए बेहतर prompt caching” परिवार की नई cache प्रणाली का विवरण देता है: डिफ़ॉल्ट रूप से अधिक hit rates, cached input tokens पर 90% तक की छूट—जो 30 मिनट के भीतर दोबारा उपयोग किए गए योग्य shared prefixes पर मिलती है—और cache write के लिए input rate की 1.25 गुना कीमत। डेवलपरों को Prompt Caching dashboard, दोबारा उपयोग किए जाने वाले prefixes निर्धारित करने के लिए स्पष्ट breakpoints (explicit cache breakpoints), application शुरू होने पर cache prewarming (prewarming) और ऐसा configuration_update मिलता है जो cache को तोड़े बिना एक response से अगले response में reasoning effort बदलता है। GitHub के product director Mario Rodriguez के अनुसार, दोबारा process किए जाने वाले prompt tokens का अनुपात 50% से अधिक घटा है; Strawberry Browser ने लागत में 20% कमी की घोषणा की है।

🔗 GPT-6 के लिए बेहतर prompt caching


उसी दिन tools में उपलब्ध: GitHub Copilot, Devin, Perplexity, Cursor और v0

22 सितंबर — Opus 5.5 और दोनों नए GPT-6 मॉडलों को इंतज़ार नहीं करना पड़ा: कुछ ही घंटों में प्रमुख coding और search tools ने उन्हें जोड़ लिया, अक्सर अपने स्वयं के मापों के साथ।

GitHub Copilot ने Opus 5.5, GPT-6 Sol और GPT-6 Luna उपलब्ध किए

GitHub ने तीनों मॉडलों को उनके लॉन्च के दिन दस interfaces पर जोड़ा: VS Code, Visual Studio, Copilot CLI, coding agent, GitHub Copilot application, github.com, GitHub Mobile, JetBrains, Xcode और Eclipse। सभी का शुल्क उपयोग के आधार पर provider की सार्वजनिक दर पर लिया जाता है और premium request multiplier लागू नहीं होता; पुरानी request-आधारित billing पर बने वार्षिक subscribers को ये मॉडल उपलब्ध नहीं होते। इनमें से कोई भी अभी automatic selection (Auto) में शामिल नहीं है।

Copilot में मॉडलउपलब्ध योजनाएँप्रति दस लाख tokens इनपुट और आउटपुट
Claude Opus 5.5Pro+, Max, Business, Enterprise (Pro नहीं)4 और 20 डॉलर
GPT-6 SolPro+, Max, Business, Enterprise2 और 10 डॉलर, फिर 272,000 tokens से अधिक पर 4 और 15
GPT-6 LunaPro, Pro+, Max, Business, Enterprise0,10 और 0,50 डॉलर, फिर 272,000 tokens से अधिक पर 0,20 और 0,75

इस प्रकार Luna, Copilot Pro पर उपलब्ध एकमात्र GPT-6 मॉडल है, जबकि Opus 5.5 वहाँ उपलब्ध नहीं है। GitHub के शुरुआती परीक्षणों के अनुसार, Opus 5.5 Claude Opus 5 के स्तर पर कार्य हल करता है, लेकिन स्पष्ट रूप से कम steps और tokens के साथ। GitHub यह भी बताता है कि Opus 5.5 अपने text outputs पर watermark लगाता है, जिसका GitHub के अनुसार अर्थ, गुणवत्ता, पठनीयता, tokens की संख्या या लागत पर कोई प्रभाव नहीं पड़ता।

🔗 GitHub Copilot में Claude Opus 5.5 · GitHub Copilot में GPT-6 Sol और GPT-6 Luna

Devin ने FrontierCode 1.1 पर नए मॉडलों की रैंकिंग की

Cognition ने Claude Opus 5.5 को उसकी रिलीज़ के दिन ही Devin Desktop और Devin CLI में उपलब्ध कराया और उसे अपने FrontierCode 1.1 benchmark के Extended संस्करण में 65.3% के साथ पहले स्थान पर रखा। वह Claude Fable 5 (64.9%) और GPT-6 Astra (64.5%) से आगे रहा, जबकि प्रति कार्य उसकी लागत Fable 5 की लागत के दसवें हिस्से से भी कम थी। इस 65.3% की तुलना Anthropic द्वारा प्रकाशित 54.4% से नहीं की जा सकती, क्योंकि वह Main संस्करण पर मापा गया था। सैंतालीस मिनट बाद GPT-6 Sol और Luna भी आ गए: Sol ने GPT-5.6 Sol की बराबरी की (60.7% बनाम 60.6%), जबकि उसकी प्रति कार्य लागत 61% कम रही और उसने लगभग 17% कम context पढ़ा; Luna (56.1%) की प्रति कार्य लागत 0.10 डॉलर से कम रही, जिससे वह Cognition की रैंकिंग का सबसे सस्ता मॉडल बना।

एक दिन पहले, 21 सितंबर की दोपहर (Pacific समय), Cognition ने Grok 4.7 को उपलब्ध कराया था और उसे 59.4% पर मापा था, जो Grok 4.6 (61.3%) से कम था: Java, Go और Ruby के कठिन back-end कार्यों पर मजबूत होने के बावजूद वह कार्य-सीमा से बाहर जाने (over-scope) की प्रवृत्ति रखता है और कार्य की आवश्यकता से बड़े diffs बनाता है। इसके तुरंत बाद v0 ने भी Grok 4.7 उपलब्ध करा दिया और 27 सितंबर तक 40% छूट की घोषणा की, हालांकि यह नहीं बताया कि छूट किस पर लागू है।

मूल्यांकित मॉडलFrontierCode 1.1 Extended स्कोर
Claude Opus 5.565.3%
Claude Fable 564.9%
GPT-6 Astra64.5%
Claude Fable 5.163.6%
SWE-262.5%
Grok 4.661.3%
GPT-6 Sol60.7%
GPT-5.6 Sol60.6%
Grok 4.759.4%
Gemini 3.7 Flash56.3%
GPT-6 Luna56.1%

मोटे अक्षरों में वे मॉडल हैं जिन्हें 21 और 22 सितंबर को Devin में जोड़ा गया। स्कोर Cognition द्वारा Extended संस्करण पर प्रकाशित किए गए हैं।

🔗 Devin में Opus 5.5 · Devin में GPT-6 Sol और Luna · Devin में Grok 4.7 · v0 में Grok 4.7

Perplexity: Computer में Opus 5.5 और GPT-6 Sol, Agent API में चार मॉडल

Perplexity ने दोनों रिलीज़ को 17 सितंबर को अपने बहु-चरणीय agent Computer में पेश किए गए effort slider से जोड़ा है। Claude Opus 5.5 अब Standard स्तर का मॉडल है: लागत और प्रदर्शन के लिए Perplexity के आंतरिक benchmark WANDR पर उसने प्रति कार्य 4.13 डॉलर में 0.610 प्राप्त किया, जो Claude Fable 5.1 से थोड़ा अधिक है, जबकि प्रति कार्य लागत 67.6% कम है। Perplexity application में भी उपलब्ध GPT-6 Sol अब Light स्तर का default विकल्प है। दोनों संदेशों में न तो संबंधित plans बताए गए हैं, न ही यह कि किन मॉडलों को बदला गया है।

Developers की ओर, केवल सितंबर 2026 की तारीख वाली API changelog प्रविष्टि Agent API में openai/gpt-6-sol, openai/gpt-6-luna, anthropic/claude-opus-5-5 और xai/grok-4.7 जोड़ती है, लेकिन प्रविष्टि में कीमत नहीं दी गई है।

🔗 Computer में Opus 5.5 · Computer में GPT-6 Sol · Perplexity API का changelog

Cursor और v0 ने Opus 5.5 उपलब्ध कराया

Cursor ने इसे CursorBench का नया सर्वश्रेष्ठ मॉडल बताया है, जो अधिकतम effort (Max) पर 57.8% प्राप्त करता है और जिसकी प्रति कार्य लागत Opus 5 से 40% कम है: ये Anthropic के आँकड़े हैं, जिनमें effort स्तर भी बताया गया है। v0 ने इसे बिना किसी pricing विवरण के उपलब्ध कराया है।

🔗 X पर Cursor · X पर v0


Anthropic ने पाँच घंटे की सीमाएँ बढ़ाईं और 22 अक्टूबर तक एक reset दिया

22 सितंबर — Opus 5.5 के साथ Anthropic ने Pro, Max, Team और प्रति license (seat-based) Enterprise plans की पाँच घंटे के आधार पर गणना की जाने वाली सीमाएँ बढ़ा दी हैं। @ClaudeDevs खाते के अनुसार Claude Code के लिए पाँच घंटे की session सीमाएँ आज से 20% बढ़ी हैं। Subscribers को एक limit reset भी मिलता है, जिसे वे सुरक्षित रखकर अपनी पसंद के समय सक्रिय कर सकते हैं: यह Pro, Max और Team के लिए सेटिंग्स → उपयोग (Settings → Usage) में उपलब्ध है और इसका उपयोग 22 अक्टूबर तक किया जा सकता है।

इसमें कीमत का प्रभाव भी जुड़ता है: Claude Code में Opus 5.5 paid plans का default मॉडल बन गया है और Opus 5 से सस्ता होने के कारण पाँच घंटे और साप्ताहिक सीमाओं को “25% अधिक आगे” तक ले जाता है। उसी दिन प्रकाशित लागत guide स्पष्ट करती है कि कीमत में कमी का लाभ cached context सहित सीमाओं में दिया गया है, लेकिन cache reads की कीमत में अतिरिक्त कमी केवल API पर लागू होती है।

🔗 X पर @ClaudeDevs · Reset और सीमाएँ


Codex CLI 0.156.0 ने voice और worktrees को default रूप से सक्रिय किया

22 सितंबर — 19:51 UTC पर प्रकाशित Codex CLI 0.156.0, 18 सितंबर के 0.155.1 के बाद पहला stable संस्करण है; इसके पूरे changelog में 0.155.0 के बाद से 525 pull requests दर्ज हैं। यह उन दो सुविधाओं को व्यापक रूप से उपलब्ध कराता है जो 0.155 में अभी experimental थीं: Linux और Windows के लिए bundled audio engines वाली voice conversations, और worktrees, जिन्हें agents का command center कार्यों को status के अनुसार filter करके sessions के रूप में खोल सकता है।

संस्करण की नई सुविधाCommand या settingCodex CLI में पिछली स्थिति
Default रूप से voice conversationsF8, /voice settingsExperimental /voice (0.155.0, 17 सितंबर)
Default रूप से worktreesAgents का command center0.154.0 से experimental (9 सितंबर)
Full-screen interface/tui, अगली बार शुरू करने परकोई नहीं
Analytics dashboard/usageDesktop application के analytics (18 सितंबर)
Local background server/daemon, --no-daemonकोई नहीं

Full-screen interface में transcript search, mouse selection और right-click से copy करने की सुविधा मिलती है; छह built-in themes भी जोड़ी गई हैं और उत्तर अब Mermaid diagrams तथा equations सीधे दिखाते हैं। यह संस्करण sandbox isolation की कई कमियाँ भी दूर करता है (Windows पर incoming traffic, app-server के Unix sockets और macOS पर बदलाव करने वाले fcntl)। Release notes में GPT-6 का उल्लेख नहीं है: Sol और Luna को /model या --model से चुना जाता है।

🔗 Codex CLI 0.156.0


Terminal में code agents: Vibe CLI, Qwen Code और Amp

Vibe CLI 2.25.6 और 2.25.7

22 सितंबर — Mistral ने छह fixes वाला Vibe CLI 2.25.7 प्रकाशित किया। इससे एक दिन पहले 2.25.6 को CHANGELOG में 21 सितंबर की तारीख दी गई थी, लेकिन उसे GitHub release के रूप में कभी प्रकाशित नहीं किया गया; अधिकांश नई चीज़ें उसी में हैं (1 addition, 3 changes और 17 fixes)। --experimental-harness विकल्प के अंतर्गत, सक्रिय मॉडल के उन्हें पढ़ पाने में असमर्थ होने पर भी images संलग्न की जा सकती हैं: उसी provider का vision-सक्षम मॉडल agent के लिए उनका वर्णन करता है और config.toml की vision_model key से कोई दूसरा मॉडल निर्धारित किया जा सकता है। इस प्रकार वर्णित interface screenshots में एक layout contract (layout contract) भी शामिल होता है, ताकि agent screen का पुनर्निर्माण कर सके।

Security की ओर, बिना approval चलाए गए Git commands को अधिक सुरक्षित बनाया गया है: secure fetches अब Git configuration के path overrides inherit नहीं करते, कोई untrusted checkout अब SSH client या hooks नहीं चुन सकता और read-only commands में डाले गए risky options या shell redirects के लिए approval आवश्यक है। अंततः 2.25.7 ने free accounts सहित Vibe API और workspace keys के लिए /teleport उपलब्ध कर दिया है।

🔗 Vibe CLI v2.25.7 · Vibe CLI का CHANGELOG

Qwen Code v0.24.4

22 सितंबर — v0.24.3 के एक दिन बाद Qwen Code ने 13 features और 15 fixes के साथ v0.24.4 जारी किया, जिसमें कोई breaking change नहीं है। qwen serve server अब target machine पर daemon install किए बिना SSH के माध्यम से remote workspaces खोलता है और v0.24.0 में Linux पर पेश किया गया bubblewrap (bwrap) sandbox अब प्रत्येक tool के execution स्तर पर लागू होता है। Web Shell में authenticated server के local loopback (loopback) के अलावा कहीं और listen करने पर QR code pairing default रूप से उपलब्ध होती है; इसके single-use invitations 60 सेकंड में expire हो जाते हैं और edit diffs approval से पहले दिखाए जाते हैं। Java की ओर, managed tool executions को JDBC के माध्यम से database में सुरक्षित रखा जाता है। केवल दो fixes वाला v0.24.5-preview.0 भी उसी दिन जारी हुआ।

🔗 Qwen Code v0.24.4

Amp runners Git worktrees बनाते हैं

22 सितंबर — किसी runner को कई directories serve करने की सुविधा देने के पाँच दिन बाद Amp ने उसे Git worktrees बनाना सिखाया है। Selector में प्रत्येक served repository New Worktree विकल्प देता है: Tab दबाएँ, branch को नाम दें और thread repository के बगल में बनाए गए नए checkout में शुरू हो जाता है (~/code/amp से ~/code/amp-fix-flaky-login-test बनता है), जबकि मुख्य checkout अछूता रहता है। इसके बाद एक dedicated action thread को archive करके worktree और branch हटा देता है। Runners को ampcode.com पर configure किए गए secrets और environment variables (Secrets & Env Vars) भी मिल सकते हैं: default रूप से disabled इस विकल्प को --amp-env से सक्रिय किया जाता है और बदला हुआ variable बिना restart या SSH के अगले thread पर लागू होता है।

🔗 एक Runner, अनेक Worktrees


तीसरे पक्ष द्वारा मूल्यांकन: OpenAI ने अपने नियम तय किए, British AISI ने परिणाम प्रकाशित किए

22 सितंबर — उसी दिन दो प्रकाशन laboratories से बाहर के संगठनों द्वारा models के मूल्यांकन से संबंधित थे।

OpenAI: स्वतंत्र evaluators के लिए चार प्राथमिकताएँ और सात सिद्धांत

Lama Ahmad द्वारा हस्ताक्षरित post में OpenAI ने निजी या गैर-लाभकारी स्वतंत्र evaluators को अपने models की training, evaluation और deployment तक गहन पहुँच देने की प्रतिबद्धता जताई है, ताकि वे उसकी धारणाओं को चुनौती दे सकें, छूटे हुए risks पहचान सकें और उसकी safeguards का स्वयं आकलन कर सकें। Governments के साथ किए गए काम से अलग ये evaluations कुछ सप्ताह से लेकर कई महीनों तक चलेंगे और किसी launch से जुड़े नहीं होंगे।

प्राथमिकता वाला क्षेत्रकिसकी जाँच की जाती है
Safety cases (safety cases)वह तर्क जो दिखाता है कि किसी model के risks training से external deployment तक नियंत्रित हैं
महत्वपूर्ण safeguardsJailbreaks के प्रति resistance, cyber defenses, misalignment monitors और chain-of-thought monitoring की reliability
Preparedness FrameworkCapability tests (chemical और biological risks, cybersecurity, AI self-improvement) तथा alignment
Misalignment incidentsCritical incidents की स्वतंत्र investigations, जिनमें जुलाई की Hugging Face incident को उदाहरण के रूप में उद्धृत किया गया है

पूरी प्रक्रिया सात सिद्धांतों से संचालित होती है: सहमत scope और पहले से दर्ज claims, अनुपातिक access, transparent method, expertise और independence (घोषित conflicts of interest), security और confidentiality, publication से पहले सुधार की अवधि के साथ actionable findings, तथा redaction को नियंत्रित करने वाला responsible publication। OpenAI का कहना है कि वह कई संगठनों से चर्चा कर रहा है, लेकिन उसने किसी का नाम नहीं बताया।

🔗 प्रभावी third-party assessments के लिए प्राथमिकताएँ और सिद्धांत

UK AI Security Institute ने EvalEval के साथ अपने सत्यापित परिणाम प्रकाशित किए

EvalEval Coalition ने Hugging Face blog पर घोषणा की है कि advanced AI के risks का अध्ययन करने वाला British public body UK AI Security Institute (AISI) अब अपने evaluation results को EvalEval के open platform Evaluation Cards पर उनके context और configuration सहित साझा format Every Eval Ever में प्रकाशित करता है। पहले प्रकाशन में छह models—Claude Opus 4, 4.5 और 4.6, GPT-5, GPT-5.2 और GPT-5.4—पर मापे गए पाँच benchmarks (HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro और Terminal-Bench 2.0), साथ ही दो cyber evaluations शामिल हैं। मुख्य उद्देश्य reproducibility है: configuration के साथ प्रकाशित verified references यह समझने में मदद करते हैं कि दिखने में तुलनीय दो scores अलग क्यों होते हैं।

🔗 UK AISI और EvalEval benchmark results को reproducible कैसे बना रहे हैं


ChatGPT अमेरिका में Experian credit score track करता है

21 सितंबर — @ChatGPT खाते द्वारा 21 सितंबर को घोषित एक नई सुविधा ChatGPT में अपना credit score track करने देती है। Finances section से अमेरिका के Plus और Pro subscribers अपनी Experian credit report और VantageScore 3.0 score जोड़ सकते हैं, उस score को प्रभावित करने वाले कारकों के बारे में personalized explanations प्राप्त कर सकते हैं और उसके बदलने पर सूचना पा सकते हैं। यह सुविधा web तथा iOS और Android applications के नवीनतम संस्करणों में उपलब्ध है।

OpenAI ने कुछ ठोस उपयोग बताए हैं: rental application पर अपने credit के प्रभाव को मापना, यह चुनना कि किस credit card का भुगतान पहले किया जाए, समय के साथ अपना credit बनाना या यह देखना कि credit और budget किसी car lease या mortgage को कैसे प्रभावित करते हैं। यह सुविधा अमेरिकी Pro subscribers के लिए मई में preview के रूप में launch किए गए personal finance tools को पूरा करती है, जिनमें Plaid के माध्यम से bank connection शामिल है।

🔗 X पर ChatGPT की घोषणा


Google: Colab को Google AI plans में शामिल किया गया, Gemini API ने Gemini 2.5 को सीमित किया

Colab Google AI plans में शामिल हुआ

22 सितंबर — Google AI subscribers को premium Colab benefits मिलते हैं, जिनमें तेज accelerators और अधिक शक्तिशाली machines तक priority access शामिल है। Ultra subscribers को uninterrupted background execution और Premium GPUs का access भी मिलता है, ताकि लंबी training खुले tab के बिना पूरी हो सके। Post में launch को “आज से” बताया गया है, लेकिन यह भी स्पष्ट किया गया है कि benefits अगले कुछ सप्ताह में उन देशों में उपलब्ध होंगे जहाँ Colab उपलब्ध है। Colab FAQ के अनुसार, Google AI plan और Colab Pro या Pro+ subscription की compute units एक ही balance में जुड़ती हैं; केवल storage वाले Google One plans और free trials इनके पात्र नहीं हैं। न तो post और न ही FAQ प्रत्येक plan को दी जाने वाली units की संख्या बताता है।

🔗 Colab अब आपके Google AI plan का हिस्सा है · Colab FAQ

Gemini API ने Gemini 2.5 तक पहुँच सीमित की

18 सितंबर — 18 सितंबर के एक note में Gemini API release notes ने Gemini 2.5 models तक access उन users तक सीमित कर दिया है जिन्होंने पहले उनका सक्रिय रूप से उपयोग किया है, ताकि reliable performance सुनिश्चित की जा सके और capacity सुरक्षित रखी जा सके। ये models deprecated नहीं हैं और अगली सूचना तक serve किए जाते रहेंगे: deprecations page पर gemini-2.5-pro, gemini-2.5-flash और gemini-2.5-flash-lite के बंद होने की कोई तारीख नहीं है; केवल gemini-2.5-flash-image को 2 अक्टूबर 2026 को बंद किया जाएगा। हर नए project के लिए Google Gemini 3.5 Flash-Lite या Gemini 3.8 Flash की ओर निर्देशित करता है।

🔗 Gemini API के release notes · Gemini deprecations page


Hugging Face, Transformers में llama.cpp के GGUF चला रहा है

22 सितंबर — Hugging Face अब Transformers में llama.cpp के क्वांटाइज़ेशन प्रारूप GGUF फ़ाइलों को कुशलतापूर्वक चलाने की सुविधा देता है। फ़ाइल को बस from_pretrained में (gguf_file पैरामीटर) देना होता है: वज़न मेमोरी में संपीड़ित रहते हैं और गणनाएँ ggml के Metal kernels के माध्यम से होती हैं, जिन्हें kernels लाइब्रेरी द्वारा Hub से वितरित किया जाता है। इसके बाद transformers serve कमांड मॉडल को OpenAI-संगत API के पीछे उपलब्ध कराता है।

शुरुआती दायरा सीमित है: केवल Mac Apple Silicon, dense और MoE संस्करणों में Qwen3.5 आर्किटेक्चर (साथ ही संगत Qwen3.8 checkpoints), एक समय में एक बातचीत, और main branch से इंस्टॉलेशन। चार kernels ggml से आते हैं, जबकि Hugging Face द्वारा लिखा गया पाँचवाँ kernel विशेषज्ञों की routing संभालता है। MacBook Pro M2 Max पर Hugging Face, Transformers को llama.cpp के “करीब” मानता है, लेकिन आँकड़े केवल ग्राफ़ में दिए गए हैं और माप एक जैसे नहीं हैं (एक ओर prefill शामिल है, दूसरी ओर केवल decoding); टीम अब भी कुशल स्थानीय inference के लिए llama.cpp की अनुशंसा करती है। असली लाभ कहीं और है: सामान्य PyTorch औज़ारों से GGUF को संचालित करना, या fine-tuning के लिए dequantized GGUF से शुरुआत करना।

GGUF प्रकार (Qwen3.5-4B, Unsloth)फ़ाइल का आकारबताया गया संतुलन
BF168,42 Goगैर-क्वांटाइज़्ड संदर्भ
Q6_K3,53 Goअधिक सटीकता
Q5_K_M3,14 Goआकार और सटीकता का संतुलन
Q4_K_M2,74 Goस्थानीय उपयोग के लिए अनुशंसित शुरुआती बिंदु

🔗 Transformers अब llama.cpp quants चलाता है


Kimi: Amazon Bedrock पर K3 और नए नाम वाला browser extension

Kimi K3, Amazon Bedrock पर आया

22 सितंबर — Moonshot AI ने Amazon Bedrock पर Kimi K3 के आने की घोषणा की है; हालाँकि AWS की जानकारी में इस लॉन्च की तारीख 18 सितंबर दी गई है। जुलाई के अंत में दस लाख tokens के context के साथ प्रकाशित यह open-weight मॉडल वहाँ Bedrock के access control, encryption और audit की सुविधाओं का लाभ उठाता है। इसे अमेरिकी और वैश्विक cross-Region inference (us.moonshotai.kimi-k3, global.moonshotai.kimi-k3) के माध्यम से उपलब्ध कराया गया है, और इसकी explicit caching प्रत्येक cache point पर 1,024 tokens से शुरू होकर कम-से-कम 30 मिनट तक रहती है। Priority स्तर (दर का 1,75 गुना) और Flex स्तर (0,5 गुना) मूल कीमतों पर लागू होते हैं।

Inference विकल्प (Standard स्तर)प्रति दस लाख tokens inputप्रति दस लाख tokens outputCache read
वैश्विक inference3,00 डॉलर15,00 डॉलर0,30 डॉलर
अमेरिकी inference3,30 डॉलर16,50 डॉलर0,33 डॉलर

🔗 Amazon Bedrock पर Kimi K3 की जानकारी · Bedrock पर Kimi K3 की X पर घोषणा

Kimi WebBridge अब Kimi Browser Extension है

22 सितंबर — जून में Kimi Work के साथ आया browser extension अपना नाम बदल रहा है और इसमें एक sidebar जुड़ रहा है, जहाँ से उपयोगकर्ता Kimi से बातचीत करके उसे वेबसाइटों पर नेविगेट करने, फ़ॉर्म भरने और कार्यों को पूरा करने के लिए कह सकते हैं। दोहराए जाने वाले कार्यों को एक बार रिकॉर्ड करके skill के रूप में सहेजा जाता है, जिसे Kimi अगली बार फिर इस्तेमाल करता है; extension वेब पेजों को commands में भी विभाजित करता है। एक स्थानीय service, Chrome DevTools Protocol के माध्यम से पहले से खुले Chrome या Edge को नियंत्रित करती है, और Moonshot का दावा है कि login sessions तथा पेजों की सामग्री डिवाइस से बाहर नहीं जाती। केवल sidebar के लिए Kimi account आवश्यक है।

🔗 Kimi Browser Extension · Kimi Browser Extension की X पर घोषणा


SpaceXAI: Grok Bot ने support tickets में हुई वृद्धि को संभाला

22 सितंबर — SpaceXAI ने अपने customer support के अनुभव पर एक रिपोर्ट प्रकाशित की है, जिसे कंपनी के औज़ारों में काम करने वाले उसके agent Grok Bot के इर्द-गिर्द फिर से बनाया गया है। 14 अगस्त को Cursor के SpaceXAI में शामिल होने के बाद, दोनों support teams का विलय हो गया और अब वे कहीं अधिक उत्पादों को संभालती हैं। पोस्ट के अनुसार, बिना किसी नई भर्ती के tickets की संख्या 175% बढ़ी, जबकि संभवतः 200 लोगों की भर्ती करनी पड़ती; माप की अवधि नहीं बताई गई है।

इसे चरणबद्ध तरीके से लागू किया गया: tickets के लिए Plain और incidents के लिए Linear से जुड़े Grok Bot को शुरुआत में केवल आंतरिक notes तक सीमित रखा गया था और उसकी हर लेखन कार्रवाई को कोई इंसान मंज़ूरी देता था। फिर उसने सरल tickets संभाले और पहले दिन के अंत तक ग्राहकों को सीधे जवाब देना शुरू कर दिया। आज वह हर आने वाले ticket की प्रारंभिक जाँच करता है, engineering team के लिए समस्याओं को वीडियो में पुनरुत्पादित करता है और प्रतिदिन 20,000 से अधिक product feedback का सार तैयार करता है।

SpaceXAI द्वारा प्रकाशित संकेतकघोषित मान
Support tickets में वृद्धि+175 %
बचाई गई भर्तियाँ (अनुमान)200
पारंपरिक औज़ारों से प्रति समाधान लागत1 से 4 डॉलर
Grok Bot के साथ प्रति ticket न्यूनतम लागत0,20 से 0,30 डॉलर
इंसानी हस्तक्षेप के बिना संसाधित refunds99 %

🔗 SpaceXAI customer support को बढ़ाने के लिए Grok Bot का उपयोग कैसे कर रहा है


Cognition: Latin America पर ध्यान और Devin के नए release notes

Cognition ने São Paulo से Latin America में विस्तार किया

22 सितंबर — अपनी Latin America team की एक पोस्ट में Cognition ने पिछले सप्ताह São Paulo के कला संग्रहालय MASP में की गई घोषणा का विवरण दिया: कंपनी इस क्षेत्र में विस्तार कर रही है, उसकी एक team São Paulo में स्थित है और वह भर्ती कर रही है, जिसमें ग्राहकों के यहाँ तैनात engineers (deployed engineers) भी शामिल हैं। वह पहले से मौजूद ग्राहकों पर निर्भर कर रही है, जिनमें Itaú, Nubank, Santander, Natura और EBANX शामिल हैं। Cognition के अनुसार, Itaú में 75% से अधिक technology teams Devin का उपयोग करती हैं, जिसने 300,000 से अधिक repositories का documentation तैयार किया और लगभग 70% vulnerabilities को स्वचालित रूप से हल किया; Nubank में कई मिलियन lines वाले monolith का migration कई वर्षों के बजाय कुछ सप्ताह में पूरा हुआ और उसकी लागत बीस गुना से भी अधिक कम रही। ये Cognition द्वारा प्रकाशित परिणाम हैं, जिनके लिए कोई तृतीय-पक्ष स्रोत नहीं दिया गया है।

🔗 Latin America में Software Engineering के भविष्य का निर्माण

21 सितंबर के Devin release notes

21 सितंबर — हमारे पिछले संस्करण के बाद प्रकाशित Devin के release notes में Cognition का 10 सितंबर को जारी code model SWE-2, agent selector में research preview के रूप में शामिल हो गया है: session शुरू करते समय या उसके दौरान SWE-2 और effort स्तर (Medium, High या Max) चुना जाता है, और Slack में !swe2 भी यही करता है। Microsoft 365 MCP servers (Mail और Contacts, Calendar, To Do, OneDrive और SharePoint, Teams तथा Entra ID directory) MCP marketplace में शामिल हो गए हैं और OAuth scope configure न होने पर default रूप से read-only रहते हैं। Devin Review अब Bitbucket Data Center के लिए उपलब्ध है, plugins का आकार 20 Mio और 2,500 files तक हो सकता है, और standalone CLI npx devin-review हटा दी गई है: पहले से install की गई प्रतियाँ भी अब काम नहीं करतीं।

🔗 21 सितंबर के Devin release notes


Genspark का presentation benchmark, Fireworks AI के SII index में शामिल

22 सितंबर — Fireworks AI ने Specialized Intelligence Index (SII) लॉन्च किया है। इसमें वास्तविक काम के 20 benchmarks हैं, जिन्हें सात क्षेत्रों (security, legal, finance, customer support, software, health और productivity) में बाँटा गया है और practitioners ने बनाया है; इसमें शामिल बारह कंपनियों में Harvey, Doximity, Mercor, Sierra, Decagon और Genspark भी हैं। Productivity श्रेणी का एकमात्र benchmark, Genspark Slides Benchmark, Genspark Slides agent के harness में 200 वास्तविक कार्यों पर ग्यारह models से presentations बनवाता है; scores Genspark के आंतरिक evaluator से आते हैं। अपने घरेलू model Gen-1 Slides के लिए Genspark फिर यह दावा करता है कि उसकी input कीमत Claude Opus 5 की तुलना में लगभग सत्रहवाँ हिस्सा है।

मूल्यांकित modelSII index पर score10 सितंबर की Genspark पोस्ट का scoreIndex में प्रति presentation लागत
Claude Fable 5.183,6 %तालिका से बाहर, पाठ में Gen-1 Slides से 0,003 आगेप्रदर्शित नहीं
Gen-1 Slides82,2 %0,8210,44 डॉलर
Claude Opus 581,0 %0,8104,16 डॉलर
Claude Fable 579,9 %तालिका से बाहरप्रदर्शित नहीं
GPT-6 Astra78,0 %तालिका से बाहरप्रदर्शित नहीं
Kimi K372,6 %0,7232,00 डॉलर
GPT-5.6 Sol67,0 %0,6682,01 डॉलर
MiniMax M356,1 %0,5630,34 डॉलर

🔗 Specialized Intelligence Index · Genspark की घोषणा


Runway ने AI में प्रशिक्षित creative professionals के लिए भर्ती मंच DIFFUSE लॉन्च किया

22 सितंबर — Runway ने DIFFUSE (diffuse.runway.com) लॉन्च किया है। यह एक खुला मंच है, जहाँ brands, agencies और studios generative AI tools में प्रशिक्षित प्रतिभाओं (AI-native talent) को खोजते, उनसे संपर्क करते और उन्हें नियुक्त करते हैं। Creative professionals, freelancers, boutique studios या production companies यहाँ profile बनाकर अपना portfolio host कर सकते हैं; कोई शुल्क घोषित नहीं किया गया है।

Runway ने लगभग 400 कंपनियों द्वारा प्रकाशित 1,000 से अधिक creative job listings के अपने अध्ययन को आधार बनाया है: 17% listings में AI skills या generative tools का उल्लेख है और कंपनी के अनुसार, उनमें Runway अब तक का सबसे अधिक माँगा जाने वाला video tool है। Runway स्वीकार करता है कि AI कुछ हद तक creative professions को विस्थापित कर रहा है, लेकिन उसका दावा है कि इन tools के इर्द-गिर्द एक नया creative workforce तैयार हो रहा है और उसकी माँग तेज़ी से बढ़ रही है।

🔗 DIFFUSE का परिचय · X पर Runway


Developers के लिए NVIDIA: Isaac ROS 5.0, DLSS 5 और RTX Mega Geometry 2.0

Isaac ROS 5.0 का ज़ोर agents पर

22 सितंबर — Toronto में ROSCon सम्मेलन के दौरान प्रस्तुत Isaac ROS 5.0, NVIDIA के GPU-accelerated ROS packages का मुफ़्त और open-source संग्रह है। यह ROS Lyrical और Ubuntu 24.04 को support करता है और Jetson Orin Nano से Jetson Thor तक पूरी Jetson श्रृंखला को समेटता है। मुख्य नवीनता agents के लिए है: installation और संचालन के लिए पुनः उपयोग योग्य Isaac skills, agents द्वारा पढ़े जा सकने वाले documentation, एक skill जो agent को अपने cameras के लिए stereo vision model FoundationStereo को fine-tune करने में सहायता करती है, और pick-and-place की एक standalone skill। FoundationPose को एक inference library मिली है, जो objects की position और orientation को 5,5 गुना तक तेज़ी से track करती है, हालाँकि NVIDIA ने तुलना का reference नहीं बताया है।

🔗 Isaac ROS 5.0

Studios के लिए DLSS 5 का विवरण, RTX Mega Geometry 2.0 उपलब्ध

22 सितंबर — NBA 2K27 में पहले से उपलब्ध DLSS 5 का अब developers के लिए विवरण दिया गया है: इसका 3D-Guided Neural Rendering, pipeline के अंतिम चरण में जुड़ता है, engine द्वारा render की गई image से शुरू होता है और color तथा motion vectors के आधार पर हर image में deterministically lighting और material details जोड़ता है। यह एक ही GeForce RTX 50 series GPU पर 4K तक चलता है। Studios, Structure Intensity और Tone Intensity समायोजित कर सकते हैं और उन्हें AI-आधारित semantic masking भी मिलता है। इसी पोस्ट में ACE के लिए 600 million parameters वाले दो models—Nemotron Speech 3.5 Streaming (speech recognition) और Qwen3 TTS (speech synthesis)—जोड़े गए हैं, RTX Kit 2026.3 प्रकाशित किया गया है और RTX Mega Geometry 2.0 उपलब्ध कराया गया है, जिसमें अत्यधिक dense meshes के लिए continuous level-of-detail cluster streaming शामिल है।

🔗 Game developers के लिए नई सुविधाएँ


NVIDIA और inference: Multi-GPU Dynamo-Triton तथा B200 पर confidential computing

Dynamo-Triton 26.07 आठ GPU में वितरित model को उपलब्ध कराता है

21 सितंबर — NVIDIA ने दिखाया है कि कई GPUs पर वितरित TensorRT model को सामान्य model की तरह कैसे उपलब्ध कराया जा सकता है। TensorRT का multi-device inference, जिसे TensorRT 11.0 से पूरी तरह support किया जाता है, NCCL पर आधारित है; पुराने Triton Inference Server का नया नाम Dynamo-Triton 26.07 इसे अपने TensorRT backend में सक्रिय करता है, और application केवल एक gRPC endpoint को call करता है। Cosmos 3 Nano की video generation (1280×720, 189 images, 35 steps) में end-to-end latency एक GPU पर 156,6 seconds से घटकर आठ GPUs पर 34,2 seconds हो जाती है, यानी 4,58 गुना कम। NVIDIA स्पष्ट करता है कि test न तो simultaneous requests के दौरान throughput मापता है, न प्रति video लागत।

जाँची गई configurationGPUs की संख्याऔसत end-to-end latency
Single-GPU1156,595 s
CP2287,999 s
CP4453,093 s
CP8834,183 s

🔗 Dynamo-Triton और multi-GPU TensorRT

B200 पर confidential inference ने 96% से अधिक throughput बनाए रखा

22 सितंबर — NVIDIA ने Blackwell पर अपने Confidential Computing की लागत मापी है, जो encrypted memory वाली virtual machines में workloads चलाता है और confidential GPUs तथा encrypted NVLink का उपयोग करता है। TensorRT LLM के साथ NVFP4 में DeepSeek-R1 उपलब्ध कराने वाले DGX B200 (आठ GPUs, Intel TDX platform) पर, 32,000 input tokens और 1,000 output tokens के साथ confidential mode ने 96,1 से 98,2% throughput बनाए रखा और 1 से 16 simultaneous requests के बीच प्रति output token औसत समय केवल 1,2 से 4,3% बढ़ाया। Framework में तीन बदलाव करने पड़े: कुछ transfers के लिए pinned memory के बजाय pageable memory, kernel autotuner के लिए GPU का internal counter, और इस mode में NVLink SHARP multicast उपलब्ध न होने के कारण दूसरे communication algorithms। Workload को overhead स्पष्ट दिखाने के लिए चुना गया था; NVIDIA अपने workload पर दोनों modes की तुलना करने की सलाह देता है।

🔗 Confidential computing और TensorRT LLM


संक्षिप्त समाचार

  • Zed, Delta की तैयारी कर रहा है — Zed ने इस सप्ताह के लिए, हालांकि वे अभी उपलब्ध नहीं हैं, अपने एजेंट-आधारित बहु-उपयोगकर्ता कोडिंग परिवेश Delta के थ्रेड को समूहबद्ध करने हेतु रंगों और संदर्भ के स्वचालित संकुचन से पहले बची दूरी दिखाने वाले एक गेज की घोषणा की है। 🔗 स्रोत
  • Replit और Handshake — Replit, Handshake के AI Skills Studio का संस्थापक साझेदार है: 45 मिनट के तीन निःशुल्क मिशन पूरे करने पर Handshake प्रोफ़ाइल में प्रदर्शित होने वाला एक प्रोजेक्ट मिलता है; अन्य साझेदारों में OpenAI (10 मिशन), Google, Figma और Vercel शामिल हैं। 🔗 स्रोत
  • oMLX, Hugging Face से जुड़ा — Apple के MLX पारिस्थितिकी तंत्र के प्रोजेक्ट oMLX के निर्माता Jun Kim, Hugging Face से जुड़ गए हैं; प्रोजेक्ट Apache 2.0 के अंतर्गत बना रहेगा, उसका नेतृत्व उन्हीं के पास रहेगा, अब उसका रखरखाव और वित्तपोषण होगा, तथा उसका पहला लक्ष्य Transformers मॉडल को अधिक तेज़ी से MLX में स्थानांतरित करना है। 🔗 स्रोत
  • SnowLLM — सामुदायिक आलेख: Ryzen AI Max के GPU के लिए लिखा गया Apache-2.0 के अंतर्गत यह अनुमान इंजन (कर्नेल बाइनरी रूप में वितरित किए जाते हैं) अपने लेखकों के अनुसार llama.cpp की तुलना में 2.3 गुना तेज़ी से डीकोड करता है (सट्टात्मक डीकोडिंग के बिना 1.9 गुना) और 9.4 गुना तेज़ी से प्रीफ़िल करता है। 🔗 स्रोत
  • DecisionBench और Bosun v3.1 — Hanno Labs ने DecisionBench 1.0 (43 कार्य, 28 क्षेत्र) और Qwen3 पर आधारित दो मुक्त-वज़न निर्णय मॉडल (0.6 और 1.7 अरब पैरामीटर) जारी किए हैं, जिन्हें उसके अपने व्यावहारिक परीक्षण-संग्रह पर क्रमशः 83.20% और 87.29% मिले; तर्क-वितर्क श्रेणी में Jev उनसे आगे है। 🔗 स्रोत
  • 60 करोड़ पैरामीटर वाला Moshi — एक डेवलपर ने Qwen3-0.6B-Base पर निर्मित अपने पूर्ण-द्विदिश वॉइस मॉडल के प्रयास का वर्णन किया है, जिसके प्रत्येक प्रयोग को B200 पर प्रशिक्षित करने की लागत 2 से 15 डॉलर रही: टेक्स्ट अभिसरित हो जाता है, लेकिन आवाज़ अस्पष्ट रहती है और बाधा सूक्ष्म ध्वनिक कोडबुक में स्थित है। प्रोजेक्ट स्थगित है और कोई वज़न प्रकाशित नहीं किया गया। 🔗 स्रोत
  • Together AI और GLM-5.2 — 18 सितंबर के एक केस अध्ययन में, जिसे 21 तारीख को X पर दोबारा प्रकाशित किया गया, Together AI ने ऐसी fintech कंपनी का वर्णन किया है जो 56 B200 के साथ 256K संदर्भ में GLM-5.2 पर अपने कोडिंग एजेंट चलाती है; कतार में 1 से 3 मिनट की देरी वाली घटना को उसी दिन रूटिंग पुनर्विन्यास से ठीक कर दिया गया। 🔗 स्रोत
  • Gemini CLI — 22 सितंबर का nightly संस्करण, जो 19 तारीख के बाद नया कोड वाला पहला संस्करण है, proxy के पीछे Vertex AI के साथ होने वाली HttpsProxyAgent is not a constructor क्रैश समस्या को ठीक करता है और ACP मोड में अनुमति माँगने से पहले tool_call अपडेट भेजता है। 🔗 स्रोत
  • Google Flow — आधिकारिक खाते का दावा है कि इसके प्रति माह 2.5 करोड़ से अधिक उपयोगकर्ता हैं और उसने सभी के लिए प्रतिदिन मिलने वाले 50 अतिरिक्त क्रेडिट की अवधि बढ़ा दी है; जुलाई में यह पेशकश 31 अगस्त तक केवल Google AI ग्राहकों के लिए आरक्षित थी। 🔗 स्रोत
  • Jigsaw और Sensemaking AI — Google का इनक्यूबेटर नागरिक परामर्श के लिए Gemini-संचालित अपने open source सुइट को 30 शहरों, राज्यों और देशों में लागू करने हेतु Partner Program शुरू कर रहा है, जिसके साथ Google.org, Bloomberg Philanthropies और Packard Foundation का एक कोष है जिसकी राशि प्रकाशित नहीं की गई। 🔗 स्रोत
  • प्रशिक्षण के लिए 1,00,000 छात्रवृत्तियाँ — संयुक्त राष्ट्र महासभा के अवसर पर Google, ITU के AI for Good कार्यक्रम की AI Skills Coalition के माध्यम से 80 से अधिक देशों में प्रमाणित AI प्रशिक्षण के लिए 1,00,000 छात्रवृत्तियों को वित्तपोषित कर रहा है, जिन्हें स्थानीय सरकारों और Giga नेटवर्क द्वारा वितरित किया जाएगा। 🔗 स्रोत
  • Google के कोड को सुरक्षित करने वाले एजेंट — 19 सितंबर के एक आलेख में Google ने बताया है कि वह अपने open source Mantis ढाँचे पर बने एजेंटों से अपने बुनियादी ढाँचे के प्रत्येक कोड परिवर्तन का प्रस्तुत किए जाने से पहले विश्लेषण करता है; ये एजेंट हर महीने सैकड़ों कमज़ोरियों को रोकते हैं और छँटाई एजेंट एक मिनट से कम समय में 92% से अधिक सटीकता का दावा करता है। 🔗 स्रोत
  • Copilot CLI 1.0.88 — उद्यम द्वारा प्रबंधित सेटिंग अब --acp, --ahp-host और --server सत्रों पर भी लागू होती हैं, जिनमें अब तक MCP नीति, अनुमतियाँ और plugins उपलब्ध नहीं थे, तथा /fork एक चरण के दौरान काम करता है; 21 सितंबर के संस्करण 1.0.87 ने Auto रूटिंग स्तर के लिए प्रबंधित सेटिंग जोड़ी थीं। 🔗 स्रोत
  • Pika और Seedance 2.5 — Seedance 2.5 का Draft मोड Pika और Pika API Club में उपलब्ध हो गया है: प्रति सेकंड 10 सेंट से शुरू होने वाली क्लिप की प्रारूप प्रतियाँ, जिन्हें बाद में उच्च गुणवत्ता में अंतिम रूप दिया जा सकता है। 🔗 स्रोत
  • Pika Swap Anything — Pika का नया अनुप्रयोग, जो मूल दृश्य की लय, गतिविधि और कथानक को बनाए रखते हुए किसी वीडियो के कलाकारों, वेशभूषा, पृष्ठभूमि या सहायक वस्तुओं को बदलता है; मूल्य की घोषणा नहीं की गई है। 🔗 स्रोत
  • Suno Studio — Suno के संगीत उत्पादन कार्यस्थान में audio effects का एक सुइट जोड़ा गया है, जिसमें compressor (threshold, ratio, attack, release, sidechain) शामिल है और यह Premier सदस्यता में उपलब्ध है। 🔗 स्रोत
  • Sluicebox और Nemotron 3 Ultra — NVIDIA केस अध्ययन: Nemotron 3 Ultra अपनाने के बाद आपूर्ति-श्रृंखलाओं के कार्बन विश्लेषण से जुड़ा यह startup अपनी अनुमान लागत 51 से 80% तक घटाता है और आपूर्तिकर्ता डेटा निष्कर्षण में 87.7% हासिल करता है, जबकि उसके पिछले मॉडल का परिणाम 84% था। 🔗 स्रोत
  • Topograph — NVIDIA का open source टूलकिट, जो किसी GPU क्लस्टर की नेटवर्क टोपोलॉजी खोजकर उसे Kubernetes, Slurm और Slinky के लिए प्रकाशित करता है, ताकि वितरित कार्यभारों को यथासंभव एक-दूसरे के पास रखा जा सके; यह Crusoe, Google Cloud, Lambda, Nebius, Nscale और Oracle Cloud के API पढ़ता है। 🔗 स्रोत
  • किसी एजेंट का मूल्यांकन — 21 सितंबर के एक कार्यविधि आलेख में NVIDIA ने टूल कॉल से लेकर कार्य पूरा होने तक छह मेट्रिक प्रस्तावित किए हैं और बताया है कि Nemotron 3.5 Lightning ने PinchBench पर 86% हासिल किया तथा वह Qwen3.6 35B से 30% तेज़ है। 🔗 स्रोत
  • Intel पर Qwen-Image-2.1 — Intel द्वारा 21 सितंबर को घोषित और Qwen द्वारा 22 तारीख को साझा किया गया OpenVINO के माध्यम से पहले दिन से उपलब्ध समर्थन Arc Pro B70 GPU और Core Ultra Series 3 के एकीकृत GPU के लिए लक्षित है तथा इसके साथ एक समर्पित notebook भी है। 🔗 स्रोत
  • Box और Grok 4.7 — Grok 4.7 के लॉन्च वाले दिन, 21 सितंबर को, Box ने 20 लाख डॉलर के एक हानि-दावे पर Box Agent के पूर्वावलोकन में इसका परीक्षण किया: 82,000 डॉलर का दोहरा बिल और 64,000 डॉलर की अनुपस्थित जमा-पर्ची पहचानी गई; उपलब्धता की तारीख या मूल्य की घोषणा नहीं हुई। 🔗 स्रोत
  • एक शल्य चिकित्सक और Codex — OpenAI Developers ने एक वीडियो प्रकाशित किया है जिसमें हाथों के शल्य चिकित्सक Brian Pridgen दिखाते हैं कि वह Codex से अपने उपकरण कैसे बनाते हैं और PubMed पर वैज्ञानिक साहित्य की समीक्षा कैसे करते हैं; कोई आँकड़ा या लिखित अध्ययन नहीं दिया गया। 🔗 स्रोत
  • Word में ChatGPT — 17 सितंबर को घोषित: एक ही Microsoft ऐड-इन दुनिया भर में और Free सहित सभी योजनाओं पर Word, Excel और PowerPoint में ChatGPT की पहुँच देता है, हालांकि उपयोग की सीमाएँ लागू हैं; Business और Enterprise उपयोगकर्ताओं को 30 सितंबर तक Word में GPT-5.6 Sol का निःशुल्क पूर्वावलोकन मिलता है। 🔗 स्रोत
  • AI साक्षरता — Perplexity ने एक मार्गदर्शिका प्रकाशित की है जो उत्तरों के मूल्यांकन को मुख्य कौशल मानती है, “प्रशिक्षण के दिखावे” की आलोचना करती है और Gallup का हवाला देती है: 2025 की चौथी तिमाही में घोषित स्वीकार्यता 38% थी, लेकिन दैनिक उपयोग केवल 12% था। 🔗 स्रोत

इसका क्या अर्थ है

उसी दिन Anthropic और OpenAI ने एक ही तर्क दिया: हर कीमत पर अधिक शक्तिशाली मॉडल नहीं, बल्कि बहुत कम लागत में अपने सर्वोच्च स्तर के करीब प्रदर्शन। Opus 5.5 को Opus 5 से 40% कम कीमत पर Fable 5.1 के स्तर का बताया गया है, जबकि GPT-6 Sol को प्रति दस लाख tokens पर 2 और 10 डॉलर में Astra की अधिकांश क्षमताएँ अपनाने वाला बताया गया है। दोनों प्रदाता अब प्रति token मूल्य के बजाय प्रति कार्य लागत के आधार पर सोच रहे हैं और cache को वास्तविक साधन बना रहे हैं: Anthropic में पढ़ने की लागत 0.20 डॉलर, जबकि OpenAI में 90% तक छूट और स्पष्ट विराम-बिंदु।

एकीकरण को घंटों में मापा जा रहा है। GitHub Copilot, Devin, Perplexity, Cursor और v0 ने उसी दिन नए मॉडल उपलब्ध करा दिए, प्रत्येक ने अपने मापदंड के साथ: Cognition में FrontierCode 1.1 Extended, Perplexity में WANDR और Cursor में CursorBench। इन आँकड़ों की सीधे तुलना नहीं की जा सकती (Extended संस्करण में Opus 5.5 के लिए 65.3%, Main संस्करण में 54.4%), और दोनों में से किसी प्रदाता ने अभी अपने नए मॉडल की तुलना दूसरे के मॉडल से नहीं की है। किसी डेवलपर के लिए सही विकल्प का निर्णय अब लॉन्च तालिकाओं के बजाय अपने उपकरण और अपने कार्यों में प्रदर्शन के आधार पर लगातार अधिक हो रहा है।

योजनाएँ भी भिन्नता का क्षेत्र बन रही हैं। Anthropic ने अपनी पाँच घंटे की सीमाएँ बढ़ाई हैं, एक रीसेट दिया है और Claude Code में Pro तथा Team Standard को Opus पर स्थानांतरित किया है; GitHub ने Opus 5.5 को उच्च योजनाओं तक सीमित रखा है, लेकिन GPT-6 Luna को Copilot Pro से ही उपलब्ध करा दिया है; Google ने क्षमता सुरक्षित रखने के लिए Gemini 2.5 को सीमित करते हुए Colab को अपनी Google AI योजनाओं में शामिल किया है। योजनाओं के बीच गणना-संसाधनों का वितरण अब प्रदर्शित मूल्य जितना ही महत्वपूर्ण है।

अंततः, मापने का तरीका स्वयं भी बदल रहा है। Anthropic स्वीकार करता है कि benchmark के अंतर पहले की तुलना में कम मार्गदर्शक हैं और Opus 5.5 को अक्सर अपने मूल्यांकन में होने का ज्ञान प्रतीत होता है; OpenAI ने स्वतंत्र मूल्यांकनकर्ताओं को अपने मॉडल उपलब्ध कराने के नियम तय किए हैं; ब्रिटेन का AISI, EvalEval के माध्यम से अपने परिणामों को पुनरुत्पाद्य बना रहा है, और NVIDIA प्रत्येक टूल कॉल के बजाय पूरे किए गए कार्य के आधार पर एजेंट का आकलन करने का प्रस्ताव देता है। कोई मॉडल वास्तव में क्या करता है, इसे सत्यापित करना अब उसके स्कोर जितना ही महत्वपूर्ण है।


स्रोत