ai-powered-markdown-translatorलेख का fr से hi में अनुवाद gpt-5.6-sol के साथ किया गया।
मंगलवार 22 सितंबर को Anthropic और OpenAI ने दो घंटे से भी कम अंतराल में एक-एक अग्रणी मॉडल लॉन्च किया: Claude Opus 5.5, जिसे Opus 5 से 40% कम लागत पर Fable 5.1 के स्तर का बताया गया है, और फिर GPT-6 Sol तथा GPT-6 Luna, जिनकी API कीमतें GPT-5.6 की प्रचारात्मक दर की तुलना में आधी हैं। दोनों परिवार उसी दिन GitHub Copilot, Devin और Perplexity में उपलब्ध हो गए, जबकि Claude Code 2.1.280 ने Pro तथा Team Standard योजनाओं को Sonnet से Opus पर स्थानांतरित कर दिया। Codex CLI 0.156.0, Anthropic की बढ़ी हुई उपयोग सीमाएँ और NVIDIA के प्रकाशनों की एक शृंखला ने दिन की अन्य प्रमुख घोषणाएँ पूरी कीं।
Anthropic ने Claude 5.5 परिवार का पहला मॉडल Claude Opus 5.5 लॉन्च किया
22 सितंबर — Anthropic ने अपने नए Claude 5.5 परिवार का पहला मॉडल Claude Opus 5.5 (claude-opus-5-5) लॉन्च किया; Sonnet 5.5 और Haiku 5.5 भी “आने वाले सप्ताहों में” उपलब्ध होंगे। यह आज से Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud और Microsoft Foundry पर उपलब्ध है तथा Claude Code में सशुल्क योजनाओं का डिफ़ॉल्ट मॉडल बन गया है। इसकी संदर्भ विंडो दस लाख tokens की है, अधिकतम आउटपुट 128,000 tokens है और इसका विश्वसनीय ज्ञान जून 2026 तक का है।
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.
It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
🇮🇳 पेश है Claude Opus 5.5, हमारे नए Claude 5.5 परिवार का पहला मॉडल। यह अधिकांश कार्यों में Claude Fable 5.1 के स्तर पर काम करता है और इसे चलाने की लागत Opus 5 से 40% कम है। — @claudeai का X पर वक्तव्य
Anthropic के अनुसार, यह 40% का आँकड़ा सामान्य कार्यभार पर “डिफ़ॉल्ट सेटिंग्स” में मापा गया है और इसमें कम कीमतों के साथ प्रति कार्य कम tokens का उपयोग शामिल है। दरें 20% घटी हैं—प्रति दस लाख tokens इनपुट के लिए 4 डॉलर और आउटपुट के लिए 20 डॉलर, जबकि Opus 5 के लिए ये दरें 5 और 25 डॉलर थीं—और cache read की कीमत 60% घटकर 0.20 डॉलर हो गई है। आउटपुट 30% से अधिक तेज़ी से तैयार होता है और शोध पूर्वावलोकन में उपलब्ध तेज़ मोड (fast mode) 8 तथा 40 डॉलर की दर पर 2.5 गुना तक अधिक गति देने का दावा करता है।
| Benchmark (Anthropic के आँकड़े) | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench 4.0 | 66,4 % | 55,8 % | 57,9 % |
| FrontierCode v1.1 Main | 54,4 % | 50,3 % | 53,3 % |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1542 |
| OSWorld 2.0 | 81,8 % | 80,7 % | — |
| AutomationBench | 40,0 % | 31,4 % | 41,4 % |
| Terminal-Bench-Science 0.1 | 58,7 % | 52,6 % | 64,6 % |
Opus 5.5 एजेंटिक कोडिंग, कार्यालयी कार्य और कंप्यूटर उपयोग में सबसे आगे है, लेकिन AutomationBench तथा Terminal-Bench-Science पर GPT-6 Astra अब भी आगे है। Anthropic स्पष्ट करता है कि उसके स्कोर सक्रिय उत्पादन सुरक्षा उपायों के साथ मापे गए थे, जिससे संभवतः वे कम हुए हैं, और उसका मानना है कि benchmark का अंतर अब “कम विश्वसनीय मार्गदर्शक” बन गया है: वास्तविक उपयोग में Fable 5.1 से अंतर इन आँकड़ों के संकेत से कम बताया जाता है। यह पहला Opus है जिसे साइबर सुरक्षा, जीवविज्ञान और distillation में Fable 5.1 श्रेणी के सुरक्षा उपायों के साथ लॉन्च किया गया है—अधिकांश साइबर कार्य Opus 4.8 पर स्थानांतरित हो जाते हैं—और Anthropic स्वीकार करता है कि मॉडल को अक्सर संदेह होता दिखाई देता है कि उसका मूल्यांकन किया जा रहा है।
डेवलपरों को migration के लिए कुछ समायोजन करने होंगे: adaptive reasoning को अब बंद नहीं किया जा सकता, जबरन tool selection (tool_choice से any या tool) पर 400 त्रुटि मिलती है और डिफ़ॉल्ट effort अब medium है, जबकि Opus 5 पर यह high था। दो tool calls के बीच लिखा गया पाठ अब reasoning blocks में लौटता है, जो डिफ़ॉल्ट प्रदर्शन में खाली दिखाई देते हैं।
🔗 Claude Opus 5.5 का परिचय · API के लिए Opus 5.5 की नई सुविधाएँ
Claude Code 2.1.280 ने Opus 5.5 जोड़ा और Pro तथा Team Standard को Opus पर स्थानांतरित किया
22 सितंबर — Claude Code 2.1.280 को 16:38 UTC पर, Opus 5.5 की घोषणा के सात मिनट बाद जारी किया गया। 2.1.279 कभी जारी नहीं हुआ: CHANGELOG सीधे 19 सितंबर के 2.1.278 से 114 प्रविष्टियों वाले इस संस्करण पर पहुँचता है।
सबसे स्पष्ट बदलाव मॉडल से संबंधित है। Opus 5.5 डिफ़ॉल्ट Opus मॉडल बन गया है और Pro तथा Team Standard योजनाएँ डिफ़ॉल्ट रूप से Sonnet से Opus पर चली गई हैं, जैसा कि Max, Team Premium और Enterprise में पहले से था। /effort के प्रत्येक मॉडल के लिए विशिष्ट बनने से पहले सहेजे गए effort levels अब Opus 5.5 जैसे नए मॉडलों पर लागू नहीं होते, जो अपनी डिफ़ॉल्ट सेटिंग से शुरू होते हैं; वहीं Opus 4.7, Opus 4.8 और Fable 5 अब चुनी गई सेटिंग से ऊपर अपना प्रारंभिक effort लागू नहीं करते।
सुरक्षा के संदर्भ में, symbolic link के माध्यम से होने वाले लेखन का मूल्यांकन अब उसके वास्तविक गंतव्य के आधार पर किया जाता है: अनुमति अनुरोध उस स्थान का नाम बताता है जहाँ लेखन वास्तव में पहुँचता है, और acceptEdits, अनुमति नियम तथा auto mode अब ऐसे लेखन को मंज़ूरी नहीं देते जो directory tree के बाहर पहुँचता हो। सुरक्षा जाँच से उत्तर न मिलने पर auto mode अब बिना रुके लगातार actions अस्वीकार नहीं करता: नए प्रयासों के बीच अंतराल बढ़ता जाता है और लगातार दस अस्वीकृतियों के बाद turn रुक जाता है। आरक्षित नाम की नकल करने वाले plugin marketplaces अस्वीकार कर दिए जाते हैं और CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH variable से MCP tool descriptions की 2,048 वर्णों वाली सीमा बदली जा सकती है।
बाकी बदलाव उपयोग-सुविधा से जुड़े हैं: अकेले y या n key से अब dialog की पुष्टि या उसे बंद नहीं किया जाता—इसके स्थान पर Enter और Escape का उपयोग होता है—dialog में Ctrl+C दो बार दबाने पर अब Claude Code बंद नहीं होता, prompt cache में होने वाली दो टूट-फूट ठीक कर दी गई हैं और VS Code extension को छह typed commands मिले हैं (/status, /sandbox, /chrome, /export, /skills, /plan)।
| CHANGELOG प्रविष्टि की श्रेणी | प्रविष्टियों की संख्या |
|---|---|
| सुधार (Fixed) | 69 |
| उन्नयन (Improved) | 21 |
| नई सुविधाएँ (Added) | 12 |
| बदलाव (Changed) | 10 |
| वापसी और निष्कासन | 2 |
| कुल | 114 |
Opus 5.5 के साथ काम करने के लिए दो मार्गदर्शिकाएँ
22 सितंबर — Anthropic ने Addy Osmani द्वारा लिखी दो मार्गदर्शिकाएँ भी प्रकाशित कीं। पहली, “Opus 5.5 पर एक कार्य की लागत” (What a task costs on Opus 5.5), याद दिलाती है कि प्रति token समान कीमत वाले दो मॉडलों पर एक ही कार्य की लागत बहुत अलग हो सकती है, क्योंकि प्रत्येक turn पूरी बातचीत को दोबारा भेजता है। सार्वजनिक दरों पर आधारित उदाहरणों के रूप में प्रस्तुत उसके आँकड़ों के अनुसार, 28 लाख input tokens की लागत cache के बिना 11.20 डॉलर और cache से 90% पढ़े जाने पर 1.62 डॉलर होती है, तथा एक output token की कीमत एक cache read से 100 गुना अधिक होती है। वह दैनिक उपयोग के लिए medium, medium के अटकने पर high, और फिर यदि Opus 5.5 एक ही समस्या पर दो बार विफल हो तो Fable 5.1 की सलाह देता है। ध्यान रहे कि effort या मॉडल बदलने से cache खाली हो जाता है—subscription पर इसकी अवधि एक घंटा और API key के साथ डिफ़ॉल्ट रूप से पाँच मिनट होती है। 44 support tickets वाले एक आंतरिक benchmark में Opus 4.8 से कम effort वाले Opus 5.5 पर जाने से लागत लगभग 18% घटी और /claude-api prompt-audit से इसमें 9% की अतिरिक्त कमी आई।
claude.dev पर प्रकाशित दूसरी मार्गदर्शिका सलाह देती है कि पहले यह निर्धारित करें कि “पूरा” होने का अर्थ क्या है और फिर मॉडल को काम करने दें, तथा “अच्छी तरह सोचो” जैसे निर्देश हटा दें क्योंकि मॉडल उत्तर देने से पहले हमेशा सोचता है। यह यह भी समझाती है कि सुरक्षा उपायों द्वारा किसी संदेश को चिह्नित किए जाने पर पुराने मॉडल पर कैसे स्थानांतरण होता है; इस व्यवहार को applications या /config में समायोजित किया जा सकता है।
🔗 Opus 5.5 पर एक कार्य की लागत · Opus 5.5 का अधिकतम लाभ उठाना
OpenAI ने GPT-6 Sol और GPT-6 Luna लॉन्च किए, जो GPT-5.6 की प्रचारात्मक दर से 50% सस्ते हैं
22 सितंबर — Anthropic के दो घंटे से भी कम समय बाद OpenAI ने GPT-6 Sol और GPT-6 Luna के साथ GPT-6 परिवार का विस्तार किया। इन्हें GPT-6 Astra जैसी विधियों से प्रशिक्षित किया गया है, जो कंपनी के अनुसार अब भी उसका सर्वश्रेष्ठ मॉडल है। Sol जटिल कोडिंग और एजेंटिक कार्यप्रवाहों के लिए है, जबकि Luna अधिक मात्रा वाले लक्षित कार्यों के लिए बनाया गया है; ये क्रमशः GPT-5.6 Sol और GPT-5.6 Luna के उत्तराधिकारी हैं।
We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.
🇮🇳 हमने caching और inference को भी अधिक कुशल बनाया है और ये बचत सीधे आपको दे रहे हैं: Sol और Luna की API कीमतें GPT-5.6 की प्रचारात्मक दर की तुलना में 50% कम हैं। — @OpenAI का X पर वक्तव्य
| दर का प्रकार (प्रति दस लाख tokens) | GPT-6 Sol | GPT-6 Luna | उल्लिखित GPT-5.6 दर (Sol / Luna) |
|---|---|---|---|
| इनपुट | 2 डॉलर | 0,10 डॉलर | 4 डॉलर / 0,20 डॉलर |
| Cached इनपुट | 0,20 डॉलर | 0,01 डॉलर | निर्दिष्ट नहीं |
| आउटपुट | 10 डॉलर | 0,50 डॉलर | 20 डॉलर / 1,20 डॉलर |
दोनों मॉडल 1,050,000 context tokens स्वीकार करते हैं और अधिकतम 128,000 tokens तैयार करते हैं; 272,000 input tokens से अधिक होने पर पूरे अनुरोध के लिए इनपुट की कीमत दोगुनी और आउटपुट की कीमत 1.5 गुना हो जाती है।
OpenAI के benchmarks में—जो Sol की तुलना Opus 5.5 से पहले के Claude मॉडलों से करते हैं—Sol ने xhigh effort पर AutomationBench में 33.2% स्कोर किया और प्रति कार्य लागत 0.27 डॉलर रही। यह max effort वाले Claude Opus 5 से आगे है, जिसने 26.9% स्कोर किया और जिसकी लागत 11.1 गुना अधिक थी, तथा low effort वाले GPT-6 Astra के 30.3% स्कोर से भी आगे है। DeepSWE v1.1 पर इसका स्कोर 68.8% है, जो Claude Fable 5 के सर्वश्रेष्ठ स्कोर से 1.1 अंक कम है, लेकिन प्रति कार्य लागत लगभग 80% कम है; Luna ने इस पर 66.6% प्राप्त किया। प्रतिस्पर्धियों के स्कोर सार्वजनिक रिपोर्टों से लिए गए हैं। Alignment के संदर्भ में, बेईमानी को बढ़ावा देने के लिए बनाए गए coding tasks पर मापी गई deception rate Sol के लिए घटकर 1.3% रह गई, जबकि GPT-5.6 Sol के लिए यह 10.4% थी।
दोनों मॉडल Plus, Pro, Business, Enterprise और Edu subscribers के लिए ChatGPT Work तथा Codex में क्रमिक rollout के साथ उपलब्ध हो रहे हैं—Enterprise में administrator activation आवश्यक है। Free और Go उपयोगकर्ता desktop application में Luna का उपयोग कर सकते हैं और ये मॉडल अभी Chat में उपलब्ध नहीं हैं। API में Responses और Chat Completions के माध्यम से इनके नाम gpt-6-sol और gpt-6-luna हैं।
GPT-6 के लिए नए सिरे से तैयार की गई prompt caching
22 सितंबर — लॉन्च के साथ प्रकाशित लेख “GPT-6 के लिए बेहतर prompt caching” परिवार की नई cache प्रणाली का विवरण देता है: डिफ़ॉल्ट रूप से अधिक hit rates, cached input tokens पर 90% तक की छूट—जो 30 मिनट के भीतर दोबारा उपयोग किए गए योग्य shared prefixes पर मिलती है—और cache write के लिए input rate की 1.25 गुना कीमत। डेवलपरों को Prompt Caching dashboard, दोबारा उपयोग किए जाने वाले prefixes निर्धारित करने के लिए स्पष्ट breakpoints (explicit cache breakpoints), application शुरू होने पर cache prewarming (prewarming) और ऐसा configuration_update मिलता है जो cache को तोड़े बिना एक response से अगले response में reasoning effort बदलता है। GitHub के product director Mario Rodriguez के अनुसार, दोबारा process किए जाने वाले prompt tokens का अनुपात 50% से अधिक घटा है; Strawberry Browser ने लागत में 20% कमी की घोषणा की है।
🔗 GPT-6 के लिए बेहतर prompt caching
उसी दिन tools में उपलब्ध: GitHub Copilot, Devin, Perplexity, Cursor और v0
22 सितंबर — Opus 5.5 और दोनों नए GPT-6 मॉडलों को इंतज़ार नहीं करना पड़ा: कुछ ही घंटों में प्रमुख coding और search tools ने उन्हें जोड़ लिया, अक्सर अपने स्वयं के मापों के साथ।
GitHub Copilot ने Opus 5.5, GPT-6 Sol और GPT-6 Luna उपलब्ध किए
GitHub ने तीनों मॉडलों को उनके लॉन्च के दिन दस interfaces पर जोड़ा: VS Code, Visual Studio, Copilot CLI, coding agent, GitHub Copilot application, github.com, GitHub Mobile, JetBrains, Xcode और Eclipse। सभी का शुल्क उपयोग के आधार पर provider की सार्वजनिक दर पर लिया जाता है और premium request multiplier लागू नहीं होता; पुरानी request-आधारित billing पर बने वार्षिक subscribers को ये मॉडल उपलब्ध नहीं होते। इनमें से कोई भी अभी automatic selection (Auto) में शामिल नहीं है।
| Copilot में मॉडल | उपलब्ध योजनाएँ | प्रति दस लाख tokens इनपुट और आउटपुट |
|---|---|---|
| Claude Opus 5.5 | Pro+, Max, Business, Enterprise (Pro नहीं) | 4 और 20 डॉलर |
| GPT-6 Sol | Pro+, Max, Business, Enterprise | 2 और 10 डॉलर, फिर 272,000 tokens से अधिक पर 4 और 15 |
| GPT-6 Luna | Pro, Pro+, Max, Business, Enterprise | 0,10 और 0,50 डॉलर, फिर 272,000 tokens से अधिक पर 0,20 और 0,75 |
इस प्रकार Luna, Copilot Pro पर उपलब्ध एकमात्र GPT-6 मॉडल है, जबकि Opus 5.5 वहाँ उपलब्ध नहीं है। GitHub के शुरुआती परीक्षणों के अनुसार, Opus 5.5 Claude Opus 5 के स्तर पर कार्य हल करता है, लेकिन स्पष्ट रूप से कम steps और tokens के साथ। GitHub यह भी बताता है कि Opus 5.5 अपने text outputs पर watermark लगाता है, जिसका GitHub के अनुसार अर्थ, गुणवत्ता, पठनीयता, tokens की संख्या या लागत पर कोई प्रभाव नहीं पड़ता।
🔗 GitHub Copilot में Claude Opus 5.5 · GitHub Copilot में GPT-6 Sol और GPT-6 Luna
Devin ने FrontierCode 1.1 पर नए मॉडलों की रैंकिंग की
Cognition ने Claude Opus 5.5 को उसकी रिलीज़ के दिन ही Devin Desktop और Devin CLI में उपलब्ध कराया और उसे अपने FrontierCode 1.1 benchmark के Extended संस्करण में 65.3% के साथ पहले स्थान पर रखा। वह Claude Fable 5 (64.9%) और GPT-6 Astra (64.5%) से आगे रहा, जबकि प्रति कार्य उसकी लागत Fable 5 की लागत के दसवें हिस्से से भी कम थी। इस 65.3% की तुलना Anthropic द्वारा प्रकाशित 54.4% से नहीं की जा सकती, क्योंकि वह Main संस्करण पर मापा गया था। सैंतालीस मिनट बाद GPT-6 Sol और Luna भी आ गए: Sol ने GPT-5.6 Sol की बराबरी की (60.7% बनाम 60.6%), जबकि उसकी प्रति कार्य लागत 61% कम रही और उसने लगभग 17% कम context पढ़ा; Luna (56.1%) की प्रति कार्य लागत 0.10 डॉलर से कम रही, जिससे वह Cognition की रैंकिंग का सबसे सस्ता मॉडल बना।
एक दिन पहले, 21 सितंबर की दोपहर (Pacific समय), Cognition ने Grok 4.7 को उपलब्ध कराया था और उसे 59.4% पर मापा था, जो Grok 4.6 (61.3%) से कम था: Java, Go और Ruby के कठिन back-end कार्यों पर मजबूत होने के बावजूद वह कार्य-सीमा से बाहर जाने (over-scope) की प्रवृत्ति रखता है और कार्य की आवश्यकता से बड़े diffs बनाता है। इसके तुरंत बाद v0 ने भी Grok 4.7 उपलब्ध करा दिया और 27 सितंबर तक 40% छूट की घोषणा की, हालांकि यह नहीं बताया कि छूट किस पर लागू है।
| मूल्यांकित मॉडल | FrontierCode 1.1 Extended स्कोर |
|---|---|
| Claude Opus 5.5 | 65.3% |
| Claude Fable 5 | 64.9% |
| GPT-6 Astra | 64.5% |
| Claude Fable 5.1 | 63.6% |
| SWE-2 | 62.5% |
| Grok 4.6 | 61.3% |
| GPT-6 Sol | 60.7% |
| GPT-5.6 Sol | 60.6% |
| Grok 4.7 | 59.4% |
| Gemini 3.7 Flash | 56.3% |
| GPT-6 Luna | 56.1% |
मोटे अक्षरों में वे मॉडल हैं जिन्हें 21 और 22 सितंबर को Devin में जोड़ा गया। स्कोर Cognition द्वारा Extended संस्करण पर प्रकाशित किए गए हैं।
🔗 Devin में Opus 5.5 · Devin में GPT-6 Sol और Luna · Devin में Grok 4.7 · v0 में Grok 4.7
Perplexity: Computer में Opus 5.5 और GPT-6 Sol, Agent API में चार मॉडल
Perplexity ने दोनों रिलीज़ को 17 सितंबर को अपने बहु-चरणीय agent Computer में पेश किए गए effort slider से जोड़ा है। Claude Opus 5.5 अब Standard स्तर का मॉडल है: लागत और प्रदर्शन के लिए Perplexity के आंतरिक benchmark WANDR पर उसने प्रति कार्य 4.13 डॉलर में 0.610 प्राप्त किया, जो Claude Fable 5.1 से थोड़ा अधिक है, जबकि प्रति कार्य लागत 67.6% कम है। Perplexity application में भी उपलब्ध GPT-6 Sol अब Light स्तर का default विकल्प है। दोनों संदेशों में न तो संबंधित plans बताए गए हैं, न ही यह कि किन मॉडलों को बदला गया है।
Developers की ओर, केवल सितंबर 2026 की तारीख वाली API changelog प्रविष्टि Agent API में openai/gpt-6-sol, openai/gpt-6-luna, anthropic/claude-opus-5-5 और xai/grok-4.7 जोड़ती है, लेकिन प्रविष्टि में कीमत नहीं दी गई है।
🔗 Computer में Opus 5.5 · Computer में GPT-6 Sol · Perplexity API का changelog
Cursor और v0 ने Opus 5.5 उपलब्ध कराया
Cursor ने इसे CursorBench का नया सर्वश्रेष्ठ मॉडल बताया है, जो अधिकतम effort (Max) पर 57.8% प्राप्त करता है और जिसकी प्रति कार्य लागत Opus 5 से 40% कम है: ये Anthropic के आँकड़े हैं, जिनमें effort स्तर भी बताया गया है। v0 ने इसे बिना किसी pricing विवरण के उपलब्ध कराया है।
🔗 X पर Cursor · X पर v0
Anthropic ने पाँच घंटे की सीमाएँ बढ़ाईं और 22 अक्टूबर तक एक reset दिया
22 सितंबर — Opus 5.5 के साथ Anthropic ने Pro, Max, Team और प्रति license (seat-based) Enterprise plans की पाँच घंटे के आधार पर गणना की जाने वाली सीमाएँ बढ़ा दी हैं। @ClaudeDevs खाते के अनुसार Claude Code के लिए पाँच घंटे की session सीमाएँ आज से 20% बढ़ी हैं। Subscribers को एक limit reset भी मिलता है, जिसे वे सुरक्षित रखकर अपनी पसंद के समय सक्रिय कर सकते हैं: यह Pro, Max और Team के लिए सेटिंग्स → उपयोग (Settings → Usage) में उपलब्ध है और इसका उपयोग 22 अक्टूबर तक किया जा सकता है।
इसमें कीमत का प्रभाव भी जुड़ता है: Claude Code में Opus 5.5 paid plans का default मॉडल बन गया है और Opus 5 से सस्ता होने के कारण पाँच घंटे और साप्ताहिक सीमाओं को “25% अधिक आगे” तक ले जाता है। उसी दिन प्रकाशित लागत guide स्पष्ट करती है कि कीमत में कमी का लाभ cached context सहित सीमाओं में दिया गया है, लेकिन cache reads की कीमत में अतिरिक्त कमी केवल API पर लागू होती है।
🔗 X पर @ClaudeDevs · Reset और सीमाएँ
Codex CLI 0.156.0 ने voice और worktrees को default रूप से सक्रिय किया
22 सितंबर — 19:51 UTC पर प्रकाशित Codex CLI 0.156.0, 18 सितंबर के 0.155.1 के बाद पहला stable संस्करण है; इसके पूरे changelog में 0.155.0 के बाद से 525 pull requests दर्ज हैं। यह उन दो सुविधाओं को व्यापक रूप से उपलब्ध कराता है जो 0.155 में अभी experimental थीं: Linux और Windows के लिए bundled audio engines वाली voice conversations, और worktrees, जिन्हें agents का command center कार्यों को status के अनुसार filter करके sessions के रूप में खोल सकता है।
| संस्करण की नई सुविधा | Command या setting | Codex CLI में पिछली स्थिति |
|---|---|---|
| Default रूप से voice conversations | F8, /voice settings | Experimental /voice (0.155.0, 17 सितंबर) |
| Default रूप से worktrees | Agents का command center | 0.154.0 से experimental (9 सितंबर) |
| Full-screen interface | /tui, अगली बार शुरू करने पर | कोई नहीं |
| Analytics dashboard | /usage | Desktop application के analytics (18 सितंबर) |
| Local background server | /daemon, --no-daemon | कोई नहीं |
Full-screen interface में transcript search, mouse selection और right-click से copy करने की सुविधा मिलती है; छह built-in themes भी जोड़ी गई हैं और उत्तर अब Mermaid diagrams तथा equations सीधे दिखाते हैं। यह संस्करण sandbox isolation की कई कमियाँ भी दूर करता है (Windows पर incoming traffic, app-server के Unix sockets और macOS पर बदलाव करने वाले fcntl)। Release notes में GPT-6 का उल्लेख नहीं है: Sol और Luna को /model या --model से चुना जाता है।
Terminal में code agents: Vibe CLI, Qwen Code और Amp
Vibe CLI 2.25.6 और 2.25.7
22 सितंबर — Mistral ने छह fixes वाला Vibe CLI 2.25.7 प्रकाशित किया। इससे एक दिन पहले 2.25.6 को CHANGELOG में 21 सितंबर की तारीख दी गई थी, लेकिन उसे GitHub release के रूप में कभी प्रकाशित नहीं किया गया; अधिकांश नई चीज़ें उसी में हैं (1 addition, 3 changes और 17 fixes)। --experimental-harness विकल्प के अंतर्गत, सक्रिय मॉडल के उन्हें पढ़ पाने में असमर्थ होने पर भी images संलग्न की जा सकती हैं: उसी provider का vision-सक्षम मॉडल agent के लिए उनका वर्णन करता है और config.toml की vision_model key से कोई दूसरा मॉडल निर्धारित किया जा सकता है। इस प्रकार वर्णित interface screenshots में एक layout contract (layout contract) भी शामिल होता है, ताकि agent screen का पुनर्निर्माण कर सके।
Security की ओर, बिना approval चलाए गए Git commands को अधिक सुरक्षित बनाया गया है: secure fetches अब Git configuration के path overrides inherit नहीं करते, कोई untrusted checkout अब SSH client या hooks नहीं चुन सकता और read-only commands में डाले गए risky options या shell redirects के लिए approval आवश्यक है। अंततः 2.25.7 ने free accounts सहित Vibe API और workspace keys के लिए /teleport उपलब्ध कर दिया है।
🔗 Vibe CLI v2.25.7 · Vibe CLI का CHANGELOG
Qwen Code v0.24.4
22 सितंबर — v0.24.3 के एक दिन बाद Qwen Code ने 13 features और 15 fixes के साथ v0.24.4 जारी किया, जिसमें कोई breaking change नहीं है। qwen serve server अब target machine पर daemon install किए बिना SSH के माध्यम से remote workspaces खोलता है और v0.24.0 में Linux पर पेश किया गया bubblewrap (bwrap) sandbox अब प्रत्येक tool के execution स्तर पर लागू होता है। Web Shell में authenticated server के local loopback (loopback) के अलावा कहीं और listen करने पर QR code pairing default रूप से उपलब्ध होती है; इसके single-use invitations 60 सेकंड में expire हो जाते हैं और edit diffs approval से पहले दिखाए जाते हैं। Java की ओर, managed tool executions को JDBC के माध्यम से database में सुरक्षित रखा जाता है। केवल दो fixes वाला v0.24.5-preview.0 भी उसी दिन जारी हुआ।
Amp runners Git worktrees बनाते हैं
22 सितंबर — किसी runner को कई directories serve करने की सुविधा देने के पाँच दिन बाद Amp ने उसे Git worktrees बनाना सिखाया है। Selector में प्रत्येक served repository New Worktree विकल्प देता है: Tab दबाएँ, branch को नाम दें और thread repository के बगल में बनाए गए नए checkout में शुरू हो जाता है (~/code/amp से ~/code/amp-fix-flaky-login-test बनता है), जबकि मुख्य checkout अछूता रहता है। इसके बाद एक dedicated action thread को archive करके worktree और branch हटा देता है। Runners को ampcode.com पर configure किए गए secrets और environment variables (Secrets & Env Vars) भी मिल सकते हैं: default रूप से disabled इस विकल्प को --amp-env से सक्रिय किया जाता है और बदला हुआ variable बिना restart या SSH के अगले thread पर लागू होता है।
तीसरे पक्ष द्वारा मूल्यांकन: OpenAI ने अपने नियम तय किए, British AISI ने परिणाम प्रकाशित किए
22 सितंबर — उसी दिन दो प्रकाशन laboratories से बाहर के संगठनों द्वारा models के मूल्यांकन से संबंधित थे।
OpenAI: स्वतंत्र evaluators के लिए चार प्राथमिकताएँ और सात सिद्धांत
Lama Ahmad द्वारा हस्ताक्षरित post में OpenAI ने निजी या गैर-लाभकारी स्वतंत्र evaluators को अपने models की training, evaluation और deployment तक गहन पहुँच देने की प्रतिबद्धता जताई है, ताकि वे उसकी धारणाओं को चुनौती दे सकें, छूटे हुए risks पहचान सकें और उसकी safeguards का स्वयं आकलन कर सकें। Governments के साथ किए गए काम से अलग ये evaluations कुछ सप्ताह से लेकर कई महीनों तक चलेंगे और किसी launch से जुड़े नहीं होंगे।
| प्राथमिकता वाला क्षेत्र | किसकी जाँच की जाती है |
|---|---|
| Safety cases (safety cases) | वह तर्क जो दिखाता है कि किसी model के risks training से external deployment तक नियंत्रित हैं |
| महत्वपूर्ण safeguards | Jailbreaks के प्रति resistance, cyber defenses, misalignment monitors और chain-of-thought monitoring की reliability |
| Preparedness Framework | Capability tests (chemical और biological risks, cybersecurity, AI self-improvement) तथा alignment |
| Misalignment incidents | Critical incidents की स्वतंत्र investigations, जिनमें जुलाई की Hugging Face incident को उदाहरण के रूप में उद्धृत किया गया है |
पूरी प्रक्रिया सात सिद्धांतों से संचालित होती है: सहमत scope और पहले से दर्ज claims, अनुपातिक access, transparent method, expertise और independence (घोषित conflicts of interest), security और confidentiality, publication से पहले सुधार की अवधि के साथ actionable findings, तथा redaction को नियंत्रित करने वाला responsible publication। OpenAI का कहना है कि वह कई संगठनों से चर्चा कर रहा है, लेकिन उसने किसी का नाम नहीं बताया।
🔗 प्रभावी third-party assessments के लिए प्राथमिकताएँ और सिद्धांत
UK AI Security Institute ने EvalEval के साथ अपने सत्यापित परिणाम प्रकाशित किए
EvalEval Coalition ने Hugging Face blog पर घोषणा की है कि advanced AI के risks का अध्ययन करने वाला British public body UK AI Security Institute (AISI) अब अपने evaluation results को EvalEval के open platform Evaluation Cards पर उनके context और configuration सहित साझा format Every Eval Ever में प्रकाशित करता है। पहले प्रकाशन में छह models—Claude Opus 4, 4.5 और 4.6, GPT-5, GPT-5.2 और GPT-5.4—पर मापे गए पाँच benchmarks (HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro और Terminal-Bench 2.0), साथ ही दो cyber evaluations शामिल हैं। मुख्य उद्देश्य reproducibility है: configuration के साथ प्रकाशित verified references यह समझने में मदद करते हैं कि दिखने में तुलनीय दो scores अलग क्यों होते हैं।
🔗 UK AISI और EvalEval benchmark results को reproducible कैसे बना रहे हैं
ChatGPT अमेरिका में Experian credit score track करता है
21 सितंबर — @ChatGPT खाते द्वारा 21 सितंबर को घोषित एक नई सुविधा ChatGPT में अपना credit score track करने देती है। Finances section से अमेरिका के Plus और Pro subscribers अपनी Experian credit report और VantageScore 3.0 score जोड़ सकते हैं, उस score को प्रभावित करने वाले कारकों के बारे में personalized explanations प्राप्त कर सकते हैं और उसके बदलने पर सूचना पा सकते हैं। यह सुविधा web तथा iOS और Android applications के नवीनतम संस्करणों में उपलब्ध है।
OpenAI ने कुछ ठोस उपयोग बताए हैं: rental application पर अपने credit के प्रभाव को मापना, यह चुनना कि किस credit card का भुगतान पहले किया जाए, समय के साथ अपना credit बनाना या यह देखना कि credit और budget किसी car lease या mortgage को कैसे प्रभावित करते हैं। यह सुविधा अमेरिकी Pro subscribers के लिए मई में preview के रूप में launch किए गए personal finance tools को पूरा करती है, जिनमें Plaid के माध्यम से bank connection शामिल है।
Google: Colab को Google AI plans में शामिल किया गया, Gemini API ने Gemini 2.5 को सीमित किया
Colab Google AI plans में शामिल हुआ
22 सितंबर — Google AI subscribers को premium Colab benefits मिलते हैं, जिनमें तेज accelerators और अधिक शक्तिशाली machines तक priority access शामिल है। Ultra subscribers को uninterrupted background execution और Premium GPUs का access भी मिलता है, ताकि लंबी training खुले tab के बिना पूरी हो सके। Post में launch को “आज से” बताया गया है, लेकिन यह भी स्पष्ट किया गया है कि benefits अगले कुछ सप्ताह में उन देशों में उपलब्ध होंगे जहाँ Colab उपलब्ध है। Colab FAQ के अनुसार, Google AI plan और Colab Pro या Pro+ subscription की compute units एक ही balance में जुड़ती हैं; केवल storage वाले Google One plans और free trials इनके पात्र नहीं हैं। न तो post और न ही FAQ प्रत्येक plan को दी जाने वाली units की संख्या बताता है।
🔗 Colab अब आपके Google AI plan का हिस्सा है · Colab FAQ
Gemini API ने Gemini 2.5 तक पहुँच सीमित की
18 सितंबर — 18 सितंबर के एक note में Gemini API release notes ने Gemini 2.5 models तक access उन users तक सीमित कर दिया है जिन्होंने पहले उनका सक्रिय रूप से उपयोग किया है, ताकि reliable performance सुनिश्चित की जा सके और capacity सुरक्षित रखी जा सके। ये models deprecated नहीं हैं और अगली सूचना तक serve किए जाते रहेंगे: deprecations page पर gemini-2.5-pro, gemini-2.5-flash और gemini-2.5-flash-lite के बंद होने की कोई तारीख नहीं है; केवल gemini-2.5-flash-image को 2 अक्टूबर 2026 को बंद किया जाएगा। हर नए project के लिए Google Gemini 3.5 Flash-Lite या Gemini 3.8 Flash की ओर निर्देशित करता है।
🔗 Gemini API के release notes · Gemini deprecations page
Hugging Face, Transformers में llama.cpp के GGUF चला रहा है
22 सितंबर — Hugging Face अब Transformers में llama.cpp के क्वांटाइज़ेशन प्रारूप GGUF फ़ाइलों को कुशलतापूर्वक चलाने की सुविधा देता है। फ़ाइल को बस from_pretrained में (gguf_file पैरामीटर) देना होता है: वज़न मेमोरी में संपीड़ित रहते हैं और गणनाएँ ggml के Metal kernels के माध्यम से होती हैं, जिन्हें kernels लाइब्रेरी द्वारा Hub से वितरित किया जाता है। इसके बाद transformers serve कमांड मॉडल को OpenAI-संगत API के पीछे उपलब्ध कराता है।
शुरुआती दायरा सीमित है: केवल Mac Apple Silicon, dense और MoE संस्करणों में Qwen3.5 आर्किटेक्चर (साथ ही संगत Qwen3.8 checkpoints), एक समय में एक बातचीत, और main branch से इंस्टॉलेशन। चार kernels ggml से आते हैं, जबकि Hugging Face द्वारा लिखा गया पाँचवाँ kernel विशेषज्ञों की routing संभालता है। MacBook Pro M2 Max पर Hugging Face, Transformers को llama.cpp के “करीब” मानता है, लेकिन आँकड़े केवल ग्राफ़ में दिए गए हैं और माप एक जैसे नहीं हैं (एक ओर prefill शामिल है, दूसरी ओर केवल decoding); टीम अब भी कुशल स्थानीय inference के लिए llama.cpp की अनुशंसा करती है। असली लाभ कहीं और है: सामान्य PyTorch औज़ारों से GGUF को संचालित करना, या fine-tuning के लिए dequantized GGUF से शुरुआत करना।
| GGUF प्रकार (Qwen3.5-4B, Unsloth) | फ़ाइल का आकार | बताया गया संतुलन |
|---|---|---|
| BF16 | 8,42 Go | गैर-क्वांटाइज़्ड संदर्भ |
| Q6_K | 3,53 Go | अधिक सटीकता |
| Q5_K_M | 3,14 Go | आकार और सटीकता का संतुलन |
| Q4_K_M | 2,74 Go | स्थानीय उपयोग के लिए अनुशंसित शुरुआती बिंदु |
🔗 Transformers अब llama.cpp quants चलाता है
Kimi: Amazon Bedrock पर K3 और नए नाम वाला browser extension
Kimi K3, Amazon Bedrock पर आया
22 सितंबर — Moonshot AI ने Amazon Bedrock पर Kimi K3 के आने की घोषणा की है; हालाँकि AWS की जानकारी में इस लॉन्च की तारीख 18 सितंबर दी गई है। जुलाई के अंत में दस लाख tokens के context के साथ प्रकाशित यह open-weight मॉडल वहाँ Bedrock के access control, encryption और audit की सुविधाओं का लाभ उठाता है। इसे अमेरिकी और वैश्विक cross-Region inference (us.moonshotai.kimi-k3, global.moonshotai.kimi-k3) के माध्यम से उपलब्ध कराया गया है, और इसकी explicit caching प्रत्येक cache point पर 1,024 tokens से शुरू होकर कम-से-कम 30 मिनट तक रहती है। Priority स्तर (दर का 1,75 गुना) और Flex स्तर (0,5 गुना) मूल कीमतों पर लागू होते हैं।
| Inference विकल्प (Standard स्तर) | प्रति दस लाख tokens input | प्रति दस लाख tokens output | Cache read |
|---|---|---|---|
| वैश्विक inference | 3,00 डॉलर | 15,00 डॉलर | 0,30 डॉलर |
| अमेरिकी inference | 3,30 डॉलर | 16,50 डॉलर | 0,33 डॉलर |
🔗 Amazon Bedrock पर Kimi K3 की जानकारी · Bedrock पर Kimi K3 की X पर घोषणा
Kimi WebBridge अब Kimi Browser Extension है
22 सितंबर — जून में Kimi Work के साथ आया browser extension अपना नाम बदल रहा है और इसमें एक sidebar जुड़ रहा है, जहाँ से उपयोगकर्ता Kimi से बातचीत करके उसे वेबसाइटों पर नेविगेट करने, फ़ॉर्म भरने और कार्यों को पूरा करने के लिए कह सकते हैं। दोहराए जाने वाले कार्यों को एक बार रिकॉर्ड करके skill के रूप में सहेजा जाता है, जिसे Kimi अगली बार फिर इस्तेमाल करता है; extension वेब पेजों को commands में भी विभाजित करता है। एक स्थानीय service, Chrome DevTools Protocol के माध्यम से पहले से खुले Chrome या Edge को नियंत्रित करती है, और Moonshot का दावा है कि login sessions तथा पेजों की सामग्री डिवाइस से बाहर नहीं जाती। केवल sidebar के लिए Kimi account आवश्यक है।
🔗 Kimi Browser Extension · Kimi Browser Extension की X पर घोषणा
SpaceXAI: Grok Bot ने support tickets में हुई वृद्धि को संभाला
22 सितंबर — SpaceXAI ने अपने customer support के अनुभव पर एक रिपोर्ट प्रकाशित की है, जिसे कंपनी के औज़ारों में काम करने वाले उसके agent Grok Bot के इर्द-गिर्द फिर से बनाया गया है। 14 अगस्त को Cursor के SpaceXAI में शामिल होने के बाद, दोनों support teams का विलय हो गया और अब वे कहीं अधिक उत्पादों को संभालती हैं। पोस्ट के अनुसार, बिना किसी नई भर्ती के tickets की संख्या 175% बढ़ी, जबकि संभवतः 200 लोगों की भर्ती करनी पड़ती; माप की अवधि नहीं बताई गई है।
इसे चरणबद्ध तरीके से लागू किया गया: tickets के लिए Plain और incidents के लिए Linear से जुड़े Grok Bot को शुरुआत में केवल आंतरिक notes तक सीमित रखा गया था और उसकी हर लेखन कार्रवाई को कोई इंसान मंज़ूरी देता था। फिर उसने सरल tickets संभाले और पहले दिन के अंत तक ग्राहकों को सीधे जवाब देना शुरू कर दिया। आज वह हर आने वाले ticket की प्रारंभिक जाँच करता है, engineering team के लिए समस्याओं को वीडियो में पुनरुत्पादित करता है और प्रतिदिन 20,000 से अधिक product feedback का सार तैयार करता है।
| SpaceXAI द्वारा प्रकाशित संकेतक | घोषित मान |
|---|---|
| Support tickets में वृद्धि | +175 % |
| बचाई गई भर्तियाँ (अनुमान) | 200 |
| पारंपरिक औज़ारों से प्रति समाधान लागत | 1 से 4 डॉलर |
| Grok Bot के साथ प्रति ticket न्यूनतम लागत | 0,20 से 0,30 डॉलर |
| इंसानी हस्तक्षेप के बिना संसाधित refunds | 99 % |
🔗 SpaceXAI customer support को बढ़ाने के लिए Grok Bot का उपयोग कैसे कर रहा है
Cognition: Latin America पर ध्यान और Devin के नए release notes
Cognition ने São Paulo से Latin America में विस्तार किया
22 सितंबर — अपनी Latin America team की एक पोस्ट में Cognition ने पिछले सप्ताह São Paulo के कला संग्रहालय MASP में की गई घोषणा का विवरण दिया: कंपनी इस क्षेत्र में विस्तार कर रही है, उसकी एक team São Paulo में स्थित है और वह भर्ती कर रही है, जिसमें ग्राहकों के यहाँ तैनात engineers (deployed engineers) भी शामिल हैं। वह पहले से मौजूद ग्राहकों पर निर्भर कर रही है, जिनमें Itaú, Nubank, Santander, Natura और EBANX शामिल हैं। Cognition के अनुसार, Itaú में 75% से अधिक technology teams Devin का उपयोग करती हैं, जिसने 300,000 से अधिक repositories का documentation तैयार किया और लगभग 70% vulnerabilities को स्वचालित रूप से हल किया; Nubank में कई मिलियन lines वाले monolith का migration कई वर्षों के बजाय कुछ सप्ताह में पूरा हुआ और उसकी लागत बीस गुना से भी अधिक कम रही। ये Cognition द्वारा प्रकाशित परिणाम हैं, जिनके लिए कोई तृतीय-पक्ष स्रोत नहीं दिया गया है।
🔗 Latin America में Software Engineering के भविष्य का निर्माण
21 सितंबर के Devin release notes
21 सितंबर — हमारे पिछले संस्करण के बाद प्रकाशित Devin के release notes में Cognition का 10 सितंबर को जारी code model SWE-2, agent selector में research preview के रूप में शामिल हो गया है: session शुरू करते समय या उसके दौरान SWE-2 और effort स्तर (Medium, High या Max) चुना जाता है, और Slack में !swe2 भी यही करता है। Microsoft 365 MCP servers (Mail और Contacts, Calendar, To Do, OneDrive और SharePoint, Teams तथा Entra ID directory) MCP marketplace में शामिल हो गए हैं और OAuth scope configure न होने पर default रूप से read-only रहते हैं। Devin Review अब Bitbucket Data Center के लिए उपलब्ध है, plugins का आकार 20 Mio और 2,500 files तक हो सकता है, और standalone CLI npx devin-review हटा दी गई है: पहले से install की गई प्रतियाँ भी अब काम नहीं करतीं।
🔗 21 सितंबर के Devin release notes
Genspark का presentation benchmark, Fireworks AI के SII index में शामिल
22 सितंबर — Fireworks AI ने Specialized Intelligence Index (SII) लॉन्च किया है। इसमें वास्तविक काम के 20 benchmarks हैं, जिन्हें सात क्षेत्रों (security, legal, finance, customer support, software, health और productivity) में बाँटा गया है और practitioners ने बनाया है; इसमें शामिल बारह कंपनियों में Harvey, Doximity, Mercor, Sierra, Decagon और Genspark भी हैं। Productivity श्रेणी का एकमात्र benchmark, Genspark Slides Benchmark, Genspark Slides agent के harness में 200 वास्तविक कार्यों पर ग्यारह models से presentations बनवाता है; scores Genspark के आंतरिक evaluator से आते हैं। अपने घरेलू model Gen-1 Slides के लिए Genspark फिर यह दावा करता है कि उसकी input कीमत Claude Opus 5 की तुलना में लगभग सत्रहवाँ हिस्सा है।
| मूल्यांकित model | SII index पर score | 10 सितंबर की Genspark पोस्ट का score | Index में प्रति presentation लागत |
|---|---|---|---|
| Claude Fable 5.1 | 83,6 % | तालिका से बाहर, पाठ में Gen-1 Slides से 0,003 आगे | प्रदर्शित नहीं |
| Gen-1 Slides | 82,2 % | 0,821 | 0,44 डॉलर |
| Claude Opus 5 | 81,0 % | 0,810 | 4,16 डॉलर |
| Claude Fable 5 | 79,9 % | तालिका से बाहर | प्रदर्शित नहीं |
| GPT-6 Astra | 78,0 % | तालिका से बाहर | प्रदर्शित नहीं |
| Kimi K3 | 72,6 % | 0,723 | 2,00 डॉलर |
| GPT-5.6 Sol | 67,0 % | 0,668 | 2,01 डॉलर |
| MiniMax M3 | 56,1 % | 0,563 | 0,34 डॉलर |
🔗 Specialized Intelligence Index · Genspark की घोषणा
Runway ने AI में प्रशिक्षित creative professionals के लिए भर्ती मंच DIFFUSE लॉन्च किया
22 सितंबर — Runway ने DIFFUSE (diffuse.runway.com) लॉन्च किया है। यह एक खुला मंच है, जहाँ brands, agencies और studios generative AI tools में प्रशिक्षित प्रतिभाओं (AI-native talent) को खोजते, उनसे संपर्क करते और उन्हें नियुक्त करते हैं। Creative professionals, freelancers, boutique studios या production companies यहाँ profile बनाकर अपना portfolio host कर सकते हैं; कोई शुल्क घोषित नहीं किया गया है।
Runway ने लगभग 400 कंपनियों द्वारा प्रकाशित 1,000 से अधिक creative job listings के अपने अध्ययन को आधार बनाया है: 17% listings में AI skills या generative tools का उल्लेख है और कंपनी के अनुसार, उनमें Runway अब तक का सबसे अधिक माँगा जाने वाला video tool है। Runway स्वीकार करता है कि AI कुछ हद तक creative professions को विस्थापित कर रहा है, लेकिन उसका दावा है कि इन tools के इर्द-गिर्द एक नया creative workforce तैयार हो रहा है और उसकी माँग तेज़ी से बढ़ रही है।
🔗 DIFFUSE का परिचय · X पर Runway
Developers के लिए NVIDIA: Isaac ROS 5.0, DLSS 5 और RTX Mega Geometry 2.0
Isaac ROS 5.0 का ज़ोर agents पर
22 सितंबर — Toronto में ROSCon सम्मेलन के दौरान प्रस्तुत Isaac ROS 5.0, NVIDIA के GPU-accelerated ROS packages का मुफ़्त और open-source संग्रह है। यह ROS Lyrical और Ubuntu 24.04 को support करता है और Jetson Orin Nano से Jetson Thor तक पूरी Jetson श्रृंखला को समेटता है। मुख्य नवीनता agents के लिए है: installation और संचालन के लिए पुनः उपयोग योग्य Isaac skills, agents द्वारा पढ़े जा सकने वाले documentation, एक skill जो agent को अपने cameras के लिए stereo vision model FoundationStereo को fine-tune करने में सहायता करती है, और pick-and-place की एक standalone skill। FoundationPose को एक inference library मिली है, जो objects की position और orientation को 5,5 गुना तक तेज़ी से track करती है, हालाँकि NVIDIA ने तुलना का reference नहीं बताया है।
Studios के लिए DLSS 5 का विवरण, RTX Mega Geometry 2.0 उपलब्ध
22 सितंबर — NBA 2K27 में पहले से उपलब्ध DLSS 5 का अब developers के लिए विवरण दिया गया है: इसका 3D-Guided Neural Rendering, pipeline के अंतिम चरण में जुड़ता है, engine द्वारा render की गई image से शुरू होता है और color तथा motion vectors के आधार पर हर image में deterministically lighting और material details जोड़ता है। यह एक ही GeForce RTX 50 series GPU पर 4K तक चलता है। Studios, Structure Intensity और Tone Intensity समायोजित कर सकते हैं और उन्हें AI-आधारित semantic masking भी मिलता है। इसी पोस्ट में ACE के लिए 600 million parameters वाले दो models—Nemotron Speech 3.5 Streaming (speech recognition) और Qwen3 TTS (speech synthesis)—जोड़े गए हैं, RTX Kit 2026.3 प्रकाशित किया गया है और RTX Mega Geometry 2.0 उपलब्ध कराया गया है, जिसमें अत्यधिक dense meshes के लिए continuous level-of-detail cluster streaming शामिल है।
🔗 Game developers के लिए नई सुविधाएँ
NVIDIA और inference: Multi-GPU Dynamo-Triton तथा B200 पर confidential computing
Dynamo-Triton 26.07 आठ GPU में वितरित model को उपलब्ध कराता है
21 सितंबर — NVIDIA ने दिखाया है कि कई GPUs पर वितरित TensorRT model को सामान्य model की तरह कैसे उपलब्ध कराया जा सकता है। TensorRT का multi-device inference, जिसे TensorRT 11.0 से पूरी तरह support किया जाता है, NCCL पर आधारित है; पुराने Triton Inference Server का नया नाम Dynamo-Triton 26.07 इसे अपने TensorRT backend में सक्रिय करता है, और application केवल एक gRPC endpoint को call करता है। Cosmos 3 Nano की video generation (1280×720, 189 images, 35 steps) में end-to-end latency एक GPU पर 156,6 seconds से घटकर आठ GPUs पर 34,2 seconds हो जाती है, यानी 4,58 गुना कम। NVIDIA स्पष्ट करता है कि test न तो simultaneous requests के दौरान throughput मापता है, न प्रति video लागत।
| जाँची गई configuration | GPUs की संख्या | औसत end-to-end latency |
|---|---|---|
| Single-GPU | 1 | 156,595 s |
| CP2 | 2 | 87,999 s |
| CP4 | 4 | 53,093 s |
| CP8 | 8 | 34,183 s |
🔗 Dynamo-Triton और multi-GPU TensorRT
B200 पर confidential inference ने 96% से अधिक throughput बनाए रखा
22 सितंबर — NVIDIA ने Blackwell पर अपने Confidential Computing की लागत मापी है, जो encrypted memory वाली virtual machines में workloads चलाता है और confidential GPUs तथा encrypted NVLink का उपयोग करता है। TensorRT LLM के साथ NVFP4 में DeepSeek-R1 उपलब्ध कराने वाले DGX B200 (आठ GPUs, Intel TDX platform) पर, 32,000 input tokens और 1,000 output tokens के साथ confidential mode ने 96,1 से 98,2% throughput बनाए रखा और 1 से 16 simultaneous requests के बीच प्रति output token औसत समय केवल 1,2 से 4,3% बढ़ाया। Framework में तीन बदलाव करने पड़े: कुछ transfers के लिए pinned memory के बजाय pageable memory, kernel autotuner के लिए GPU का internal counter, और इस mode में NVLink SHARP multicast उपलब्ध न होने के कारण दूसरे communication algorithms। Workload को overhead स्पष्ट दिखाने के लिए चुना गया था; NVIDIA अपने workload पर दोनों modes की तुलना करने की सलाह देता है।
🔗 Confidential computing और TensorRT LLM
संक्षिप्त समाचार
- Zed, Delta की तैयारी कर रहा है — Zed ने इस सप्ताह के लिए, हालांकि वे अभी उपलब्ध नहीं हैं, अपने एजेंट-आधारित बहु-उपयोगकर्ता कोडिंग परिवेश Delta के थ्रेड को समूहबद्ध करने हेतु रंगों और संदर्भ के स्वचालित संकुचन से पहले बची दूरी दिखाने वाले एक गेज की घोषणा की है। 🔗 स्रोत
- Replit और Handshake — Replit, Handshake के AI Skills Studio का संस्थापक साझेदार है: 45 मिनट के तीन निःशुल्क मिशन पूरे करने पर Handshake प्रोफ़ाइल में प्रदर्शित होने वाला एक प्रोजेक्ट मिलता है; अन्य साझेदारों में OpenAI (10 मिशन), Google, Figma और Vercel शामिल हैं। 🔗 स्रोत
- oMLX, Hugging Face से जुड़ा — Apple के MLX पारिस्थितिकी तंत्र के प्रोजेक्ट oMLX के निर्माता Jun Kim, Hugging Face से जुड़ गए हैं; प्रोजेक्ट Apache 2.0 के अंतर्गत बना रहेगा, उसका नेतृत्व उन्हीं के पास रहेगा, अब उसका रखरखाव और वित्तपोषण होगा, तथा उसका पहला लक्ष्य Transformers मॉडल को अधिक तेज़ी से MLX में स्थानांतरित करना है। 🔗 स्रोत
- SnowLLM — सामुदायिक आलेख: Ryzen AI Max के GPU के लिए लिखा गया Apache-2.0 के अंतर्गत यह अनुमान इंजन (कर्नेल बाइनरी रूप में वितरित किए जाते हैं) अपने लेखकों के अनुसार llama.cpp की तुलना में 2.3 गुना तेज़ी से डीकोड करता है (सट्टात्मक डीकोडिंग के बिना 1.9 गुना) और 9.4 गुना तेज़ी से प्रीफ़िल करता है। 🔗 स्रोत
- DecisionBench और Bosun v3.1 — Hanno Labs ने DecisionBench 1.0 (43 कार्य, 28 क्षेत्र) और Qwen3 पर आधारित दो मुक्त-वज़न निर्णय मॉडल (0.6 और 1.7 अरब पैरामीटर) जारी किए हैं, जिन्हें उसके अपने व्यावहारिक परीक्षण-संग्रह पर क्रमशः 83.20% और 87.29% मिले; तर्क-वितर्क श्रेणी में Jev उनसे आगे है। 🔗 स्रोत
- 60 करोड़ पैरामीटर वाला Moshi — एक डेवलपर ने Qwen3-0.6B-Base पर निर्मित अपने पूर्ण-द्विदिश वॉइस मॉडल के प्रयास का वर्णन किया है, जिसके प्रत्येक प्रयोग को B200 पर प्रशिक्षित करने की लागत 2 से 15 डॉलर रही: टेक्स्ट अभिसरित हो जाता है, लेकिन आवाज़ अस्पष्ट रहती है और बाधा सूक्ष्म ध्वनिक कोडबुक में स्थित है। प्रोजेक्ट स्थगित है और कोई वज़न प्रकाशित नहीं किया गया। 🔗 स्रोत
- Together AI और GLM-5.2 — 18 सितंबर के एक केस अध्ययन में, जिसे 21 तारीख को X पर दोबारा प्रकाशित किया गया, Together AI ने ऐसी fintech कंपनी का वर्णन किया है जो 56 B200 के साथ 256K संदर्भ में GLM-5.2 पर अपने कोडिंग एजेंट चलाती है; कतार में 1 से 3 मिनट की देरी वाली घटना को उसी दिन रूटिंग पुनर्विन्यास से ठीक कर दिया गया। 🔗 स्रोत
- Gemini CLI — 22 सितंबर का nightly संस्करण, जो 19 तारीख के बाद नया कोड वाला पहला संस्करण है, proxy के पीछे Vertex AI के साथ होने वाली
HttpsProxyAgent is not a constructorक्रैश समस्या को ठीक करता है और ACP मोड में अनुमति माँगने से पहलेtool_callअपडेट भेजता है। 🔗 स्रोत - Google Flow — आधिकारिक खाते का दावा है कि इसके प्रति माह 2.5 करोड़ से अधिक उपयोगकर्ता हैं और उसने सभी के लिए प्रतिदिन मिलने वाले 50 अतिरिक्त क्रेडिट की अवधि बढ़ा दी है; जुलाई में यह पेशकश 31 अगस्त तक केवल Google AI ग्राहकों के लिए आरक्षित थी। 🔗 स्रोत
- Jigsaw और Sensemaking AI — Google का इनक्यूबेटर नागरिक परामर्श के लिए Gemini-संचालित अपने open source सुइट को 30 शहरों, राज्यों और देशों में लागू करने हेतु Partner Program शुरू कर रहा है, जिसके साथ Google.org, Bloomberg Philanthropies और Packard Foundation का एक कोष है जिसकी राशि प्रकाशित नहीं की गई। 🔗 स्रोत
- प्रशिक्षण के लिए 1,00,000 छात्रवृत्तियाँ — संयुक्त राष्ट्र महासभा के अवसर पर Google, ITU के AI for Good कार्यक्रम की AI Skills Coalition के माध्यम से 80 से अधिक देशों में प्रमाणित AI प्रशिक्षण के लिए 1,00,000 छात्रवृत्तियों को वित्तपोषित कर रहा है, जिन्हें स्थानीय सरकारों और Giga नेटवर्क द्वारा वितरित किया जाएगा। 🔗 स्रोत
- Google के कोड को सुरक्षित करने वाले एजेंट — 19 सितंबर के एक आलेख में Google ने बताया है कि वह अपने open source Mantis ढाँचे पर बने एजेंटों से अपने बुनियादी ढाँचे के प्रत्येक कोड परिवर्तन का प्रस्तुत किए जाने से पहले विश्लेषण करता है; ये एजेंट हर महीने सैकड़ों कमज़ोरियों को रोकते हैं और छँटाई एजेंट एक मिनट से कम समय में 92% से अधिक सटीकता का दावा करता है। 🔗 स्रोत
- Copilot CLI 1.0.88 — उद्यम द्वारा प्रबंधित सेटिंग अब
--acp,--ahp-hostऔर--serverसत्रों पर भी लागू होती हैं, जिनमें अब तक MCP नीति, अनुमतियाँ और plugins उपलब्ध नहीं थे, तथा/forkएक चरण के दौरान काम करता है; 21 सितंबर के संस्करण 1.0.87 ने Auto रूटिंग स्तर के लिए प्रबंधित सेटिंग जोड़ी थीं। 🔗 स्रोत - Pika और Seedance 2.5 — Seedance 2.5 का Draft मोड Pika और Pika API Club में उपलब्ध हो गया है: प्रति सेकंड 10 सेंट से शुरू होने वाली क्लिप की प्रारूप प्रतियाँ, जिन्हें बाद में उच्च गुणवत्ता में अंतिम रूप दिया जा सकता है। 🔗 स्रोत
- Pika Swap Anything — Pika का नया अनुप्रयोग, जो मूल दृश्य की लय, गतिविधि और कथानक को बनाए रखते हुए किसी वीडियो के कलाकारों, वेशभूषा, पृष्ठभूमि या सहायक वस्तुओं को बदलता है; मूल्य की घोषणा नहीं की गई है। 🔗 स्रोत
- Suno Studio — Suno के संगीत उत्पादन कार्यस्थान में audio effects का एक सुइट जोड़ा गया है, जिसमें compressor (threshold, ratio, attack, release, sidechain) शामिल है और यह Premier सदस्यता में उपलब्ध है। 🔗 स्रोत
- Sluicebox और Nemotron 3 Ultra — NVIDIA केस अध्ययन: Nemotron 3 Ultra अपनाने के बाद आपूर्ति-श्रृंखलाओं के कार्बन विश्लेषण से जुड़ा यह startup अपनी अनुमान लागत 51 से 80% तक घटाता है और आपूर्तिकर्ता डेटा निष्कर्षण में 87.7% हासिल करता है, जबकि उसके पिछले मॉडल का परिणाम 84% था। 🔗 स्रोत
- Topograph — NVIDIA का open source टूलकिट, जो किसी GPU क्लस्टर की नेटवर्क टोपोलॉजी खोजकर उसे Kubernetes, Slurm और Slinky के लिए प्रकाशित करता है, ताकि वितरित कार्यभारों को यथासंभव एक-दूसरे के पास रखा जा सके; यह Crusoe, Google Cloud, Lambda, Nebius, Nscale और Oracle Cloud के API पढ़ता है। 🔗 स्रोत
- किसी एजेंट का मूल्यांकन — 21 सितंबर के एक कार्यविधि आलेख में NVIDIA ने टूल कॉल से लेकर कार्य पूरा होने तक छह मेट्रिक प्रस्तावित किए हैं और बताया है कि Nemotron 3.5 Lightning ने PinchBench पर 86% हासिल किया तथा वह Qwen3.6 35B से 30% तेज़ है। 🔗 स्रोत
- Intel पर Qwen-Image-2.1 — Intel द्वारा 21 सितंबर को घोषित और Qwen द्वारा 22 तारीख को साझा किया गया OpenVINO के माध्यम से पहले दिन से उपलब्ध समर्थन Arc Pro B70 GPU और Core Ultra Series 3 के एकीकृत GPU के लिए लक्षित है तथा इसके साथ एक समर्पित notebook भी है। 🔗 स्रोत
- Box और Grok 4.7 — Grok 4.7 के लॉन्च वाले दिन, 21 सितंबर को, Box ने 20 लाख डॉलर के एक हानि-दावे पर Box Agent के पूर्वावलोकन में इसका परीक्षण किया: 82,000 डॉलर का दोहरा बिल और 64,000 डॉलर की अनुपस्थित जमा-पर्ची पहचानी गई; उपलब्धता की तारीख या मूल्य की घोषणा नहीं हुई। 🔗 स्रोत
- एक शल्य चिकित्सक और Codex — OpenAI Developers ने एक वीडियो प्रकाशित किया है जिसमें हाथों के शल्य चिकित्सक Brian Pridgen दिखाते हैं कि वह Codex से अपने उपकरण कैसे बनाते हैं और PubMed पर वैज्ञानिक साहित्य की समीक्षा कैसे करते हैं; कोई आँकड़ा या लिखित अध्ययन नहीं दिया गया। 🔗 स्रोत
- Word में ChatGPT — 17 सितंबर को घोषित: एक ही Microsoft ऐड-इन दुनिया भर में और Free सहित सभी योजनाओं पर Word, Excel और PowerPoint में ChatGPT की पहुँच देता है, हालांकि उपयोग की सीमाएँ लागू हैं; Business और Enterprise उपयोगकर्ताओं को 30 सितंबर तक Word में GPT-5.6 Sol का निःशुल्क पूर्वावलोकन मिलता है। 🔗 स्रोत
- AI साक्षरता — Perplexity ने एक मार्गदर्शिका प्रकाशित की है जो उत्तरों के मूल्यांकन को मुख्य कौशल मानती है, “प्रशिक्षण के दिखावे” की आलोचना करती है और Gallup का हवाला देती है: 2025 की चौथी तिमाही में घोषित स्वीकार्यता 38% थी, लेकिन दैनिक उपयोग केवल 12% था। 🔗 स्रोत
इसका क्या अर्थ है
उसी दिन Anthropic और OpenAI ने एक ही तर्क दिया: हर कीमत पर अधिक शक्तिशाली मॉडल नहीं, बल्कि बहुत कम लागत में अपने सर्वोच्च स्तर के करीब प्रदर्शन। Opus 5.5 को Opus 5 से 40% कम कीमत पर Fable 5.1 के स्तर का बताया गया है, जबकि GPT-6 Sol को प्रति दस लाख tokens पर 2 और 10 डॉलर में Astra की अधिकांश क्षमताएँ अपनाने वाला बताया गया है। दोनों प्रदाता अब प्रति token मूल्य के बजाय प्रति कार्य लागत के आधार पर सोच रहे हैं और cache को वास्तविक साधन बना रहे हैं: Anthropic में पढ़ने की लागत 0.20 डॉलर, जबकि OpenAI में 90% तक छूट और स्पष्ट विराम-बिंदु।
एकीकरण को घंटों में मापा जा रहा है। GitHub Copilot, Devin, Perplexity, Cursor और v0 ने उसी दिन नए मॉडल उपलब्ध करा दिए, प्रत्येक ने अपने मापदंड के साथ: Cognition में FrontierCode 1.1 Extended, Perplexity में WANDR और Cursor में CursorBench। इन आँकड़ों की सीधे तुलना नहीं की जा सकती (Extended संस्करण में Opus 5.5 के लिए 65.3%, Main संस्करण में 54.4%), और दोनों में से किसी प्रदाता ने अभी अपने नए मॉडल की तुलना दूसरे के मॉडल से नहीं की है। किसी डेवलपर के लिए सही विकल्प का निर्णय अब लॉन्च तालिकाओं के बजाय अपने उपकरण और अपने कार्यों में प्रदर्शन के आधार पर लगातार अधिक हो रहा है।
योजनाएँ भी भिन्नता का क्षेत्र बन रही हैं। Anthropic ने अपनी पाँच घंटे की सीमाएँ बढ़ाई हैं, एक रीसेट दिया है और Claude Code में Pro तथा Team Standard को Opus पर स्थानांतरित किया है; GitHub ने Opus 5.5 को उच्च योजनाओं तक सीमित रखा है, लेकिन GPT-6 Luna को Copilot Pro से ही उपलब्ध करा दिया है; Google ने क्षमता सुरक्षित रखने के लिए Gemini 2.5 को सीमित करते हुए Colab को अपनी Google AI योजनाओं में शामिल किया है। योजनाओं के बीच गणना-संसाधनों का वितरण अब प्रदर्शित मूल्य जितना ही महत्वपूर्ण है।
अंततः, मापने का तरीका स्वयं भी बदल रहा है। Anthropic स्वीकार करता है कि benchmark के अंतर पहले की तुलना में कम मार्गदर्शक हैं और Opus 5.5 को अक्सर अपने मूल्यांकन में होने का ज्ञान प्रतीत होता है; OpenAI ने स्वतंत्र मूल्यांकनकर्ताओं को अपने मॉडल उपलब्ध कराने के नियम तय किए हैं; ब्रिटेन का AISI, EvalEval के माध्यम से अपने परिणामों को पुनरुत्पाद्य बना रहा है, और NVIDIA प्रत्येक टूल कॉल के बजाय पूरे किए गए कार्य के आधार पर एजेंट का आकलन करने का प्रस्ताव देता है। कोई मॉडल वास्तव में क्या करता है, इसे सत्यापित करना अब उसके स्कोर जितना ही महत्वपूर्ण है।
स्रोत
- Claude Opus 5.5 का परिचय (Anthropic)
- @claudeai: Claude Opus 5.5 का लॉन्च
- API के लिए Claude Opus 5.5 की नई सुविधाएँ
- Claude Code v2.1.280
- Opus 5.5 पर किसी कार्य की लागत
- Opus 5.5 का अधिकतम लाभ उठाना
- GPT-6 Sol और Luna का परिचय (OpenAI)
- @OpenAI: GPT-6 Sol और Luna का लॉन्च
- GPT-6 के लिए बेहतर prompt caching
- GitHub Copilot में Claude Opus 5.5
- GitHub Copilot में GPT-6 Sol और GPT-6 Luna
- Devin में Claude Opus 5.5
- Devin में GPT-6 Sol और Luna
- Devin में Grok 4.7
- @v0: v0 में Grok 4.7
- @perplexity_ai: Computer में Opus 5.5
- @perplexity_ai: Computer में GPT-6 Sol
- Perplexity API का परिवर्तन-विवरण
- @cursor_ai: Cursor में Opus 5.5
- @v0: v0 में Opus 5.5
- @ClaudeDevs: Claude Code की सीमाएँ
- @ClaudeDevs: सीमाओं का रीसेट
- Codex CLI 0.156.0
- Vibe CLI v2.25.7
- Vibe CLI का CHANGELOG
- Qwen Code v0.24.4
- एक Runner, अनेक Worktrees (Amp)
- प्रभावी तृतीय-पक्ष आकलनों की प्राथमिकताएँ और सिद्धांत (OpenAI)
- UK AISI और EvalEval, Benchmark परिणामों को पुनरुत्पाद्य कैसे बना रहे हैं
- @ChatGPT: Experian क्रेडिट स्कोर
- Colab अब आपकी Google AI योजना का हिस्सा है
- Colab के अक्सर पूछे जाने वाले प्रश्न
- Gemini API के रिलीज़ नोट्स
- Gemini के अप्रचलन की सूची वाला पृष्ठ
- Transformers अब llama.cpp quants चलाता है
- Amazon Bedrock पर Kimi K3 का विवरण
- @Kimi_Moonshot: Bedrock पर Kimi K3
- Kimi Browser Extension
- @Kimi_Moonshot: Kimi Browser Extension
- ग्राहक सहायता का विस्तार करने के लिए SpaceXAI, Grok Bot का उपयोग कैसे कर रहा है
- लैटिन अमेरिका में Software Engineering के भविष्य का निर्माण (Cognition)
- 21 सितंबर के Devin रिलीज़ नोट्स
- Specialized Intelligence Index (Fireworks AI)
- @genspark_ai: SII में Genspark Slides Benchmark
- DIFFUSE का परिचय (Runway)
- @runwayml: DIFFUSE का लॉन्च
- Isaac ROS 5.0 (NVIDIA)
- गेम डेवलपरों के लिए नई सुविधाएँ (NVIDIA)
- Dynamo-Triton और बहु-GPU TensorRT (NVIDIA)
- गोपनीय गणना और TensorRT LLM (NVIDIA)
- @zeddotdev: Delta की नई सुविधाएँ
- @Replit: Handshake का AI Skills Studio
- Jun Kim, Hugging Face से जुड़े (oMLX)
- SnowLLM
- DecisionBench और Bosun v3.1 (Hanno Labs)
- पूर्ण-द्विदिश वाणी को छोटा करना
- Together AI केस अध्ययन (समर्पित मॉडल अनुमान)
- Gemini CLI v0.62.0-nightly.20260922
- @FlowbyGoogle: 2.5 करोड़ उपयोगकर्ता
- Sensemaking AI और Jigsaw Partner Program (Google)
- वैश्विक प्रतिभा और AI साक्षरता में निवेश (Google)
- बुनियादी ढाँचा कोड को सुरक्षित करने के लिए agentic AI का उपयोग (Google Cloud)
- Copilot CLI v1.0.88
- @pika_labs: Seedance 2.5 का Draft मोड
- @pika_labs: Swap Anything
- Compression के बारे में (Suno)
- Sluicebox केस अध्ययन (NVIDIA)
- Topograph (NVIDIA)
- AI एजेंटों का मूल्यांकन कैसे करें (NVIDIA)
- Intel हार्डवेयर पर Qwen-Image-2.1 (OpenVINO)
- @Box: Box Agent में Grok 4.7
- @OpenAIDevs: एक शल्य चिकित्सक और Codex
- @ChatGPT: Word में ChatGPT
- AI साक्षरता (Perplexity)