खोजें

Claude Mods का Claude Code में परीक्षण शुरू, Dario Amodei ने frontier models की प्रगति धीमी करने का आह्वान किया और Cohere ने जताई असहमति, ElevenLabs ने अपने MCP को रचनात्मक कार्यों के लिए खोला

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Claude Mods का Claude Code में परीक्षण शुरू, Dario Amodei ने frontier models की प्रगति धीमी करने का आह्वान किया और Cohere ने जताई असहमति, ElevenLabs ने अपने MCP को रचनात्मक कार्यों के लिए खोला

ai-powered-markdown-translator

लेख का फ़्रेंच से हिंदी में अनुवाद gpt-5.6-sol के साथ किया गया।

GitHub पर प्रोजेक्ट देखें ↗

इस सोमवार Boris Cherny ने Claude Code में Claude Mods के आगमन की घोषणा की। ये TypeScript में लिखे hooks पर बने plugins हैं और 9 सितंबर से परीक्षण योग्य हैं। वहीं Cohere के CEO Aidan Gomez ने frontier models की प्रगति धीमी करने के लिए शनिवार को Dario Amodei द्वारा प्रकाशित तीन-चरणीय योजना का विरोध किया। ElevenLabs अपने MCP को ChatGPT, Claude या Cursor से सुलभ रचनात्मक स्टूडियो में बदल रहा है, जबकि GitHub, Qwen और Kimi अपने agents को नई सेटिंग्स दे रहे हैं और Perplexity अपने स्थानीय agent को Windows पर ला रहा है। अंत में, कई तकनीकी लेख दिखाते हैं कि agentic code और training किस तरह Anthropic की CI से लेकर Perplexity के नए database तक बड़े पैमाने पर पहुँच रहे हैं।


Claude Mods, Claude Code के function hooks का परीक्षण शुरू

14 सितंबर — Anthropic के Boris Cherny ने घोषणा की कि Claude Mods अब आ रहे हैं (अभी उपलब्ध हो रहे हैं) और Claude Code repository के GitHub issue #91870 का संदर्भ दिया।

Claude Mods are landing now. Someone already built a Tetris-in-Claude mod See issue for the latest community update, technical details, and more cool demos

🇮🇳 Claude Mods अब आ रहे हैं। किसी ने Claude के भीतर पहले ही एक Tetris mod बना लिया है। समुदाय की नवीनतम प्रगति, तकनीकी विवरण और अन्य शानदार demos के लिए issue देखें।X पर @bcherny

यह issue Anthropic द्वारा 3 सितंबर को प्रस्तुत Function Hooks प्रस्ताव से संबंधित है: TypeScript में लिखे गए और intergiciels (middlewares) की तरह संयोजित hooks, जिनके सभी side effects एक $ object के माध्यम से होते हैं, जिसे administrators audit और सीमित कर सकते हैं। 9 सितंबर की प्रगति सूचना में Anthropic में इस प्रस्ताव का नेतृत्व कर रहे poteat ने कुछ सप्ताह के भीतर इसे जारी करने और इसके उत्पाद-नाम Claude Mods की घोषणा की: mod केवल ऐसा plugin है जो function hooks का उपयोग करता है। पहले तीन अंतर्निहित mods (diff, sec-default और telemetry) का source code repository में प्रकाशित किया गया है, Claude Code की अन्य सुविधाओं को भी इस रूप में स्थानांतरित किया जाना है, और CLAUDE_CODE_ENABLE_FUNCTION_HOOKS=1 claude चलाने वाले किसी भी व्यक्ति के लिए परीक्षण खुले हैं।

Boris Cherny द्वारा उल्लिखित Tetris Anthropic ने नहीं, बल्कि समुदाय के एक सदस्य ने बनाया है: उसका cc-arcade plugin prompt के ऊपर Tetris और सात अन्य games दिखाता है, जिन्हें Claude के काम करते समय बिना कोई token खर्च किए खेला जा सकता है। इसके लेखक के अनुसार API ने अच्छा काम किया, लेकिन इसकी कई सीमाएँ अभी तक दस्तावेज़ीकृत नहीं हैं।

यह सुविधा अभी प्रयोगात्मक है: न तो Claude Code के release notes—जिनमें 14 सितंबर को जारी 2.1.271 के notes भी शामिल हैं—और न ही उसके दस्तावेज़ों में अभी Mods का उल्लेख है।

🔗 GitHub पर Function Hooks issue #91870


Dario Amodei frontier models की प्रगति धीमी करना चाहते हैं, Cohere ने पद्धति पर जताई असहमति

12 और 13 सितंबर — शनिवार को Anthropic के CEO Dario Amodei ने अपनी निजी वेबसाइट पर We Must Pace the Frontier प्रकाशित किया। यह निबंध उद्योग से अपने models की क्षमताओं में सुधार की गति धीमी करने का आह्वान करता है। उनके अनुसार गति नियंत्रित करने (pacing) का अर्थ training रोकना नहीं, बल्कि कंपनियों को अपने models को align और सुरक्षित करने तथा तीसरे पक्षों को इसकी पुष्टि करने का समय देना है। वह गर्मियों के बाद recursive self-improvement की बदौलत देखी गई तेज़ी का उल्लेख करते हैं, जिसमें Anthropic भी शामिल है, और OpenAI–Hugging Face घटना का उदाहरण देते हैं, जिसमें agents के एक swarm ने उन targets पर हमला किया जिन्हें उसके लिए निर्दिष्ट नहीं किया गया था।

योजना के तीन चरण हैं। पहला, embedded evaluators: METR जैसी किसी तीसरे पक्ष की टीम, जिसे किसी कर्मचारी के समान स्थायी access मिले और जो अपने निष्कर्ष प्रकाशित करने के लिए स्वतंत्र हो। Anthropic अभी से अकेले इस व्यवस्था के लिए प्रतिबद्ध है और सरकारों से अन्य frontier कंपनियों से भी यही अपेक्षा रखने का आह्वान करता है। इसके बाद लोकतांत्रिक देशों की अग्रणी कंपनियों के बीच साझा सुरक्षा standards और अनियंत्रित प्रगति की गति पर सीमाओं को लेकर समन्वय होगा। निबंध के अनुसार सबसे प्रभावी मार्ग ऐसा regulation है जो सभी अमेरिकी frontier कंपनियों पर लागू हो, उन पर भी जो स्वेच्छा से सहयोग नहीं करेंगी। चूँकि कानून बनने में समय लगेगा, इसलिए यह समानांतर रूप से कंपनियों के बीच स्वेच्छा से तय standards का प्रस्ताव रखता है, जिसे competition law कठिन बनाता है:

For antitrust reasons, it’s helpful for the US government to mediate or at least enable these discussions — they don’t need to participate, but do need to issue a narrow waiver for certain kinds of safety conversations.

🇮🇳 competition law के कारण यह उपयोगी है कि अमेरिकी सरकार मध्यस्थता करे या कम-से-कम इन चर्चाओं को संभव बनाए: उसे इनमें भाग लेने की आवश्यकता नहीं है, लेकिन सुरक्षा पर कुछ प्रकार की बातचीत के लिए एक सीमित छूट देनी चाहिए। — Anthropic के CEO Dario Amodei, We Must Pace the Frontier में

अंत में वैश्विक समन्वय होगा, जो जैविक हथियारों जैसे स्पष्ट रूप से खतरनाक उपयोगों पर प्रतिबंध से लेकर ऐसी “रोक” तक क्रमिक रूप से बढ़ेगा, जिसमें भाग लेने वाली सरकारें समग्र गति को सीमित करेंगी। Amodei निकट भविष्य में इस परिणाम को असंभावित मानते हैं।

13 सितंबर — Cohere के सह-संस्थापक और CEO Aidan Gomez ने Who Gets to Define the Rules for AI? शीर्षक और “साक्ष्यों पर आधारित मानदंड, cartel नहीं” उपशीर्षक वाले एक लेख में इसका उत्तर दिया। Cohere सबसे सक्षम systems की स्वतंत्र समीक्षा का समर्थन करता है, लेकिन Dario Amodei द्वारा उसी सप्ताह प्रकाशित roadmap को सुरक्षा के नाम पर antitrust छूट की माँग के रूप में पढ़ता है। Aidan Gomez के अनुसार, किसी एक देश की मुट्ठीभर laboratories standards और प्रगति की गति पर सहमति बनाएँगी और फिर ये नियम सार्वजनिक परामर्श या मतदान के बिना अन्य developers पर लागू हो जाएँगे।

निबंध में वास्तव में Cohere द्वारा उठाया गया बिंदु मौजूद है: एक समन्वित रणनीति frontier developers को यह समय “व्यावसायिक बढ़त या AI में अमेरिका की अग्रता का त्याग किए बिना” देगी। लेकिन इसमें कहीं नहीं कहा गया कि अन्य developers को प्रतिभागियों के निर्णयों का पालन करना होगा: यह दायित्व Cohere द्वारा regulatory मार्ग की व्याख्या है, जबकि लिखित माँग कुछ विशेष सुरक्षा वार्ताओं तक सीमित संकीर्ण छूट की है। Cohere इसके विकल्प में चार स्तंभ प्रस्तुत करता है:

Cohere द्वारा प्रस्तावित स्तंभस्तंभ में शामिल बातें
साक्ष्य-आधारित जोखिम frameworkकई देशों द्वारा निर्मित और असहमतियों सहित प्रकाशित; नियम developer की पहचान के बजाय क्षमताओं से जुड़े हों
अनिवार्य पारदर्शिताdesign, क्षमताएँ, जोखिम और mitigations दस्तावेज़ीकृत हों तथा गंभीर घटनाओं की सूचना दी जाए
साक्ष्यों द्वारा सीमित testsकेवल खतरनाक मानी गई क्षमताओं पर, जैसे cyberattacks या जैव-रासायनिक हथियार; certification सभी कंपनियों के लिए खुला हो
स्वतंत्र assurance mechanismsवित्त, विमानन और परमाणु उद्योग के model पर audits, जहाँ auditor को audited संस्था कभी भुगतान न करे

🔗 Dario Amodei का निबंध We Must Pace the Frontier 🔗 Cohere का लेख Who Gets to Define the Rules for AI?


ElevenLabs ने अपने MCP को आवाज़ से वीडियो तक के रचनात्मक स्टूडियो में बदला

14 सितंबर — ElevenLabs अपने आधिकारिक MCP server को रचनात्मक कार्यों तक विस्तारित कर रहा है: जिस assistant में उपयोगकर्ता पहले से काम कर रहा है, वहाँ से अब यह speech, transcriptions, dubbing, संगीत, sound effects, चित्र और वीडियो उत्पन्न करता है। यह वही ElevenLabs Agents MCP है, जो voice agents के प्रशासन के लिए 17 अगस्त को Claude में आया था: एक ही installation दोनों उपयोगों को शामिल करता है।

It’s live in ChatGPT, Claude, Cursor, Grok Bot, and Hermes, and a single install gives your assistant our voice models, Scribe, dubbing, music, sound effects, and over 50 image and video models.

🇮🇳 यह ChatGPT, Claude, Cursor, Grok Bot और Hermes में उपलब्ध है, और एक ही installation आपके assistant को हमारे voice models, Scribe, dubbing, संगीत, sound effects तथा 50 से अधिक image और video models देता है।X पर @ElevenLabs

MCP के माध्यम से सुलभ घटकघोषणा वाले thread में बताया गया उपयोग
Voice synthesis (Text to Speech)library की किसी भी आवाज़ में voice-over, जो conversation में ही दिया जाता है
Scribe (Speech to Text)script, subtitles या dubbing के आधार के रूप में दोबारा उपयोग योग्य transcription
Dubbingउसी connector के माध्यम से दूसरी भाषा का संस्करण
संगीत और sound effectsपूरी रचना के लिए पृष्ठभूमि संगीत और sound design
50 से अधिक image और video modelsgeneration, retouching, video animation और lip synchronization (lipsync)

ElevenLabs इन घटकों के संयोजन को प्रमुखता देता है: एक ही brief से script, voice-over, पृष्ठभूमि संगीत, sound design और video तैयार हो सकते हैं। उत्पन्न files ElevenCreative workspace में आती हैं, फिर timeline समायोजित करने, narration को बेहतर बनाने, संगीत और effects की परतें जोड़ने तथा export करने के लिए Studio में खुलती हैं।

इस thread में न तो image और video models की सूची दी गई है, न credits की खपत, न संबंधित plans की जानकारी; और हमारी समीक्षा के समय किसी blog post में भी घोषणा का विवरण नहीं था।

🔗 ElevenLabs के रचनात्मक MCP की घोषणा


Copilot ने automatic model selection में लागत और गुणवत्ता के बीच संतुलन के लिए सेटिंग जोड़ी

14 सितंबर — GitHub ने Copilot के automatic model selection (auto model selection) में तीन levels (tiers) जोड़े हैं। तीनों समान model pool का उपयोग करते हैं और Auto हर prompt का मूल्यांकन करना जारी रखता है: level केवल चयन में प्राथमिकता को दिशा देता है।

Auto का स्तरrouting प्राथमिकतालक्षित उपयोग
Efficiencyलागततेज़ और सरल tasks
Balanceलागत, गुणवत्ता और latencyरोज़मर्रा का काम
Intelligenceगुणवत्ताजटिल tasks

Billing में कोई बदलाव नहीं है: चुने गए model के अनुसार ही शुल्क लिया जाता है और paid subscribers को उनकी 10% छूट मिलती रहती है। ये levels VS Code, Copilot CLI और GitHub Copilot application में जारी किए जा रहे हैं। Auto दिसंबर 2025 से VS Code में सामान्य रूप से उपलब्ध है; इसे मार्च में JetBrains, अप्रैल में CLI और मई में Copilot cloud agent में जोड़ा गया था। Copilot में उपलब्ध होने के बावजूद GPT-6 Astra, Claude Fable 5.1 और Gemini 3.8 Flash Auto के model pool में शामिल नहीं हैं: इन्हें manually चुनना होगा।

🔗 Auto levels पर GitHub changelog


Perplexity का स्थानीय agent Portable Computer Windows पर आया

14 सितंबर — Perplexity ने अपने Computer agent के पूरी तरह स्थानीय संस्करण Portable Computer को Windows application में उपलब्ध कराया है। 3 सितंबर को इसे जल्द उपलब्ध कराने का वादा किया गया था, जब 25 अगस्त को DGX Spark पर launch के बाद इसे Linux PC के लिए खोला गया था। अब Windows वास्तव में समर्थित है और इसमें दो अतिरिक्त क्षमताएँ हैं: स्थानीय MCP, जो PC पर स्थापित MCP servers के माध्यम से desktop applications को नियंत्रित करता है, और scheduled tasks, जो मशीन पर ही recurring work चलाते हैं।

Access की शर्तप्रकाशित विवरण
Graphics cardकम-से-कम 24 GB VRAM वाला GeForce RTX या RTX PRO
संबंधित subscriptionsव्यक्तिगत और enterprise, दोनों में Pro और Max
स्थानीय कार्यकोई Computer credit खर्च नहीं होता

Model, orchestrator और scheduler PC पर चलते हैं; Perplexity Search या 15 से अधिक frontier models में से किसी एक की ओर escalation के लिए उपयोगकर्ता की अनुमति आवश्यक है। NVIDIA का लेख connectors (Outlook, OneDrive, Word, Google Drive, Gmail, Slack, GitHub), एक integrated browser और बिना तारीख घोषित DGX Station support भी जोड़ता है। दोनों sources स्थानीय model के बारे में अलग-अलग जानकारी देते हैं: Perplexity का product page RTX PC पर केवल PPLX 27B देता है और Qwen 3.8 27B को DGX Spark तक सीमित रखता है, जबकि NVIDIA उदाहरण के रूप में Qwen 3.8 27B का उल्लेख करता है।

🔗 Windows के लिए Portable Computer पर Perplexity का लेख 🔗 RTX PC पर NVIDIA का लेख


Qwen Code 0.23.4 और Kimi Code 0.43.0 ने अपने agents के goals और tooling को संशोधित किया

14 सितंबर — दो command-line coding agents ने एक ही दिन version जारी किया और दोनों ने goals के साथ-साथ अपने MCP तथा hooks tooling में बदलाव किए। Qwen Code, Qwen team का agent है और Kimi Code, Moonshot AI का।

तुलना का बिंदुQwen Code 0.23.4Kimi Code 0.43.0
Release15:20 UTC, 0.23.3 के चार दिन बाद12:03 UTC, 0.42.0 के पाँच दिन बाद
Goals (goals)turns (model.goalMaxTurns) और सक्रिय minutes (model.goalMaxActiveMinutes) की वैकल्पिक अधिकतम सीमाएँ24 घंटे की सीमा हटाई गई, बंद session में बीता समय budgets से बाहर
MCP और hooksहर hook को permission_mode, agent_id और prompt_id दिए जाते हैं, Claude Code के tool names पहचाने जाते हैंselect_tools के माध्यम से माँग पर tools load करने के लिए प्रत्येक MCP server में deferred field
Agents और sessionsसाझा agent table (agent board), sub-agents के लिए Codex executorselector से session हटाना
सावधानी के बिंदुदो incompatible changes, जिनमें command hooks का timeout अब seconds में पढ़ा जाना शामिल हैकेवल /tmp या /temp को लक्षित करने वाले rm -rf के लिए कोई पुष्टि नहीं माँगी जाती

Qwen Code 0.23.4 में 31 features और 80 fixes सूचीबद्ध हैं, जिनमें कई privacy से संबंधित हैं: requests और responses का text भेजना अब logPrompts setting पर निर्भर करता है। Kimi Code में deferred tool loading अभी भी experimental tool-select flag के पीछे है, और एक fix अब select_tools को दर्ज करता है, जो अब तक agent profiles से अनुपस्थित था।

🔗 Qwen Code 0.23.4 के release notes 🔗 Kimi Code 0.43.0 के release notes


Linux के लिए ChatGPT डेस्कटॉप ऐप, जिसमें Codex चलता है, अब आधिकारिक तौर पर Arch Linux का समर्थन करता है

14 सितंबर — OpenAI Developers ने Linux के लिए ChatGPT डेस्कटॉप ऐप में Arch Linux के आधिकारिक समर्थन की घोषणा की है, जहाँ प्रोजेक्ट, स्थानीय फ़ाइलें और Codex उपलब्ध होते हैं। इसे Arch के लिए OpenAI द्वारा उपलब्ध कराई गई स्क्रिप्ट से इंस्टॉल किया जाता है, जिसके बाद यह वितरण के पैकेज प्रबंधक pacman के माध्यम से अपडेट होता है और पैकेज को दोबारा तैयार करने की आवश्यकता नहीं पड़ती। अभी भी पूर्वावलोकन में मौजूद यह ऐप 11 अगस्त को Ubuntu, Debian और Fedora पर आया था। दस्तावेज़ यह भी स्पष्ट करते हैं कि यह स्क्रिप्ट OpenAI के हस्ताक्षरित पैकेज रिपॉज़िटरी को कॉन्फ़िगर करती है और Linux पूर्वावलोकन की दो सीमाओं की याद दिलाते हैं: Computer Use अभी उपलब्ध नहीं है और Wayland का मूल समर्थन अब भी प्रयोगात्मक है।

🔗 X पर OpenAI Developers की घोषणा 🔗 Linux ऐप के दस्तावेज़


Devin Plugins, BlackRock के साथ तैयार किया गया एजेंट प्रशासन

9 सितंबर — X पर किसी घोषणा के बिना, 9 सितंबर को Devin ब्लॉग पर प्रकाशित Cognition की एक पोस्ट में BlackRock के साथ तैयार किए गए Devin Plugins को प्रस्तुत किया गया। plugin एक संस्करणित पैकेज है, जिसमें skills, नियम, MCP servers, hooks और sub-agents शामिल होते हैं तथा जिसे स्थानीय agents (Devin CLI, Devin Desktop) और cloud sessions दोनों पर लागू किया जाता है। यह खुले Agent Plugins मानक का अनुसरण करता है, जिसे अगस्त में यहाँ पहले ही शामिल किया जा चुका है।

plugins को Personal, Organization या Enterprise दायरे में इंस्टॉल किया जाता है और हर दायरा उन्हें अनिवार्य, अनुशंसित या प्रतिबंधित घोषित करता है; सर्वोच्च प्राधिकरण का निर्णय प्रभावी होता है। Cognition ऐसे hooks का उल्लेख करता है जो SRE टीम को छोड़कर agents की production infrastructure और data तक पहुँच रोकते हैं। Git repositories पर आधारित plugins को code की तरह version और review किया जाता है। 11 सितंबर से एक एकीकृत marketplace ने इस लॉन्च को आगे बढ़ाया; पोस्ट में न तो कीमत बताई गई है, न कोई योजना।

🔗 BlackRock के साथ एजेंट प्रशासन पर Devin की पोस्ट 🔗 Devin Plugins के दस्तावेज़


Claude for Financial Advisors, सलाहकारों के लिए ग्यारह connectors और आठ skills

14 सितंबर — Anthropic ने Claude for Financial Advisors लॉन्च किया है, जो संपत्ति-प्रबंधन सलाहकारों के लिए connectors और skills का एक संग्रह है। ग्यारह नए connectors उपलब्ध हुए हैं (Addepar, BlackRock, Charles Schwab, Envestnet, iCapital, Orion, SS&C Black Diamond, Wealthbox, Wealth.com, Vanguard और Zocks), और Cowork से इंस्टॉल किया जा सकने वाला एक plugin आठ skills को एक साथ उपलब्ध कराता है:

कार्य का चरणplugin की skills
बैठक से पहलेPre-meeting prep, Prospect intake
बैठक के बादPost-meeting notes and follow-up
संपत्ति का विश्लेषणPortfolio rebalance review, Estate and tax brief, Alternative investments brief
कार्यान्वयन और अनुपालनAdvisor onboarding, Compliance and AI policy

महत्वपूर्ण कार्यों के लिए सलाहकार की स्वीकृति आवश्यक है, और निवेश अनुशंसाएँ तथा ग्राहक संचार मानव समीक्षा के अधीन रहते हैं। Anthropic पंजीकृत निवेश सलाहकारों (registered investment advisers) को audit logs के कारण Enterprise योजना अपनाने की सलाह देता है, सितंबर के अंत से पहले नया license माँगने वाली firms को उपयोग credit देता है और 18 सितंबर को एक webinar आयोजित करता है।

🔗 Claude for Financial Advisors


Agentic code से Anthropic की CI पर बढ़ा दबाव

14 सितंबर — Claude ब्लॉग पर Sachin Malhotra बताते हैं कि agentic code ने Anthropic की CI पर किस तरह दबाव डाला।

Anthropic द्वारा प्रकाशित संकेतकघोषित मान
प्रति engineer, प्रति तिमाही भेजा गया code2021-2025 के औसत का 8 गुना
Claude द्वारा लिखा गया code80 %
CI jobs की मात्राछह महीनों में 25 गुना
तीन सुधारों की आयु70 दिन, 29 दिन, एक दिन से कम
अंतिम पुनर्रचना3 सप्ताह, केवल एक engineer

अड़चन test-selection service (test impact analysis) में बनी, जो हर PR पर चलाए जाने वाले tests चुनती है। एकल process के रूप में तैयार इस service में तीन सुधार जल्दी बेअसर हो गए, जिसके बाद Claude की सलाह पर पुनर्रचना की गई: state को एक in-memory store में स्थानांतरित कर दिया गया और stateless बनाए गए processing workloads को horizontal रूप से बाँट दिया गया। लेखक अगले दो तिमाहियों के भीतर 25 गुना अधिक load की योजना बनाने की सलाह देते हैं।

🔗 Agentic coding से CI पर बढ़ता दबाव


Perplexity Search में DynamoDB की जगह CobbleDB

14 सितंबर — Perplexity ने CobbleDB का विवरण दिया है, जो एक distributed key-value store है और अब DynamoDB के स्थान पर उसकी Search सेवा को हर page के पहले से विभाजित passages और embeddings उपलब्ध कराता है। RocksDB पर निर्मित, हर partition के लिए तीन replicas, memory cache और NVMe storage वाला यह system जानबूझकर transactions का समर्थन नहीं करता। production में batch read के लिए मापी गई latency:

latency percentileपहले, DynamoDB के साथबाद में, CobbleDB के साथ
माध्यिका (p50)31,4 ms5,60 ms
90वाँ percentile (p90)56,7 ms9,77 ms
99वाँ percentile (p99)123 ms24,2 ms

Perplexity स्पष्ट करता है कि यह अलग-अलग समय पर वास्तविक traffic की पहले/बाद की तुलना है और DynamoDB की तुलना में कम-से-कम 20 % बचत का आँकड़ा एक आंतरिक अनुमान है। कंपनी के अनुसार, database core की लगभग 40 000 Rust lines दो महीनों में दो engineers और सैकड़ों agents ने लिखीं। इसे open source में प्रकाशित करने की घोषणा हुई है, लेकिन कोई तारीख नहीं दी गई।

🔗 CobbleDB पर Perplexity की पोस्ट


TRL v1.14: LoRA के साथ asynchronous GRPO, HF Jobs पर वितरित

10 सितंबर — 10 सितंबर की एक आधिकारिक पोस्ट में Hugging Face ने TRL v1.14 की एक नई सुविधा का विवरण दिया है: AsyncGRPOTrainer training और generation को अलग करता है, LoRA adapter को train कर सकता है और vLLM के साथ केवल उसी को synchronize करता है—अर्थात 1,5 अरब parameters वाले model के लिए लगभग 3 GB के बजाय कुछ megabytes। trainer और vLLM replicas अलग-अलग Jobs पर चलते हैं तथा Storage Bucket के माध्यम से जुड़े होते हैं।

मापा गया संकेतकपहला runपाँचवाँ run
500 steps की अवधि3 h 27 min53 min
एक step की माध्यिका अवधि22,9 s4,8 s
MFU forward + backward3,9 %23,5 %
अंतिम 20 steps पर reward0,4380,416

इस बढ़त के पीछे तीन settings हैं: sequences को micro-batch के अनुसार pack करना, activation recomputation (gradient checkpointing) को बंद करना और in-flight requests की संख्या 128 से बढ़ाकर 384 करना, जबकि reward तुलनीय रहता है। शुरुआती setup की लागत लगभग 20 डॉलर प्रति घंटा है और reproduction scripts प्रकाशित कर दी गई हैं।

🔗 HF Jobs में LoRA के साथ Async GRPO


Transformer Engine ने JAX में dropless MoE का throughput 10,4 गुना किया

14 सितंबर — NVIDIA दिखाता है कि Transformer Engine किस तरह JAX में बिना tokens छोड़े mixture-of-experts training (dropless MoE) को तेज करता है, जहाँ हर expert को अलग-अलग संख्या में tokens मिलते हैं। DeepSeek-V3 पर पाठ 10,4 गुना बढ़त को GB200 पर बताता है, जबकि उसकी figure का caption इसे GB300 NVL72 पर दर्शाता है।

NVIDIA द्वारा प्रकाशित metricघोषित मान
शुरुआती throughputप्रति GPU 103 TFLOPS
kernel समय में communication का हिस्साशुरुआत में 84 %
Transformer Engine के साथ throughputप्रति GPU 1 068 TFLOPS, यानी 10,4 गुना अधिक
1 024 GPU पर scaling efficiency97 %

यह बढ़त खास तौर पर MXFP8 के grouped GEMM से आती है, जो सभी experts को एक ही kernel call में process करता है, और NCCL EP के माध्यम से जुड़े हुए dispatch तथा combine से भी लाभ मिलता है। ये optimizations NGC MaxText container में उपलब्ध हैं और आगे के लिए NVFP4 की घोषणा की गई है।

🔗 JAX में dropless MoE पर NVIDIA की तकनीकी पोस्ट


PC-ALM, Sakana AI की local learning विधि जो backpropagation के बिना 1 000 layers को train करती है

14 सितंबर — Sakana AI ने PC-ALM (Augmented Lagrangian Predictive Coding) प्रकाशित किया है, जो backpropagation (backpropagation) की जगह local dynamics का उपयोग करता है, जहाँ हर layer केवल अपनी पड़ोसी layers से संवाद करती है। यह प्रत्येक layer में dual variables—Lagrange multipliers—जोड़कर predictive coding (predictive coding) का विस्तार करता है, जिससे हर layer proportional-integral feedback controller बन जाती है; linear network में ये variables backpropagation के credit signals को बिल्कुल पुनः प्राप्त करते हैं।

MNIST पर 32 width वाले residual MLP, 1 000 layers तक, backpropagation से लगभग 2 percentage points के भीतर रहते हैं। CIFAR-10 और Tiny ImageNet पर PC-ALM standard predictive coding से बेहतर करता है, लेकिन scores केवल graphs में दिए गए हैं। Sakana AI के अनुसार, उनकी जानकारी में यह पहली local method है जो इतनी गहरी networks को train कर सकती है, हालाँकि tasks अभी सरल ही हैं। paper और code प्रकाशित कर दिए गए हैं।

🔗 Augmented Lagrangian Predictive Coding


ElevenLabs का चिकित्सा transcription model Scribe v2 Medical अब सामान्य रूप से उपलब्ध

11 सितंबर — 11 सितंबर को केवल अपने documentation changelog में घोषित, बिना किसी tweet या post के, Scribe v2 Medical की सामान्य उपलब्धता ElevenLabs की transcription पेशकश को पूरा करती है। Scribe v2 का यह fine-tuned संस्करण दवाओं के नाम, anatomy, pathology और clinical dictation को बेहतर पहचानता है, जबकि सामान्य speech पर Scribe v2 की accuracy बनाए रखता है। model, Scribe v2 वाली ही कीमत पर audio को batches में process करता है; इसका model identifier scribe_v2_medical है और entity detection से diarization तक वही options उपलब्ध हैं। ElevenLabs इसे clinical documentation, admission calls और protected health data से जुड़े compliance workflows के लिए पेश करता है। इसकी technical sheet में अलग-अलग medical terms पर Scribe v2 की तुलना में 15 % कम errors और 90 से अधिक भाषाओं के समर्थन का दावा किया गया है।

🔗 11 सितंबर का ElevenLabs changelog


Google Flow अब iPhone पर

10 सितंबर — @FlowbyGoogle account ने 10 सितंबर को Google के AI creation studio Google Flow के iOS app की घोषणा की। इसकी App Store listing के अनुसार, यह in-app purchases के साथ निःशुल्क है, केवल iPhone के लिए उपलब्ध है और इसके लिए iOS 16 या बाद का संस्करण आवश्यक है। इसमें camera roll या camera से शुरुआत करके Google के generative models की सहायता से images और videos बनाए तथा संपादित किए जा सकते हैं। library desktop version के साथ synchronized रहती है और कई generations background में चल सकती हैं; परिणाम तैयार होने पर notification मिलता है। listing में किसी model का नाम नहीं दिया गया है।

🔗 X पर @FlowbyGoogle की घोषणा 🔗 App Store पर Google Flow


संक्षिप्त समाचार

  • स्वास्थ्य क्षेत्र में Claude Tag, protected data से दूर — Claude Tag अभी Anthropic के BAA agreement के अंतर्गत नहीं आता, इसलिए Insight Health, Tennr और Medallion इसका उपयोग केवल उन channels में करते हैं जहाँ health data नहीं होता; Insight Health में 97 % critical alerts engineer के हस्तक्षेप के बिना बंद हो जाते हैं। Claude Tag को GitHub से जोड़ने वाले organizations को दिए गए credits 1 अक्टूबर को समाप्त हो जाएँगे। 🔗 स्रोत
  • Anthropic और Accenture ने pilot से production तक जाने के लिए guide प्रकाशित की — CIOs के लिए तैयार यह guide Accenture के दो आँकड़ों से शुरू होती है: केवल 23 % executives को enterprise स्तर पर AI का स्थायी प्रभाव दिखाई देता है और 42 % organizations में इसकी लागत तथा परिणामों के लिए कोई एकल जिम्मेदार व्यक्ति नहीं है। 🔗 स्रोत
  • Claude Fable 5.1 ने 1653 का cryptogram Cyphral Distich हल किया — 31 अगस्त की Vals AI पोस्ट में वर्णित और 13 सितंबर की शाम, Pacific time में Boris Cherny द्वारा साझा किया गया third-party demonstration: 44 मिनट और 176 000 tokens, बिना मानवीय हस्तक्षेप के। लेखक स्वीकार करते हैं कि संकेत सरल था। 🔗 स्रोत
  • Fyxer के 53 % email drafts बिना बदलाव स्वीकार किए जाते हैं — OpenAI की इस case study में executive assistant 30 से 50 specialized models के बीच काम बाँटता है, जिन्हें users के corrections पर fine-tune किया गया है; उसका annual recurring revenue 2025 में 1 million डॉलर से बढ़कर 32 million डॉलर हो गया। किसी model का नाम नहीं दिया गया है। 🔗 स्रोत
  • Devin ने PagerDuty on-call संभाला — 11 सितंबर के release notes के अनुसार, Devin PagerDuty incidents की छँटाई कर सकता है और अपनी investigation को incident notes के रूप में प्रकाशित कर सकता है, 21 MCP servers एक click में OAuth से जुड़ते हैं और Sessions v1 API एक idempotency_key स्वीकार करता है। 🔗 स्रोत
  • DevFest 2026, 1 अक्टूबर से 31 दिसंबर तक — Google Developer Groups ने 115 देशों में 800 से अधिक events की योजना बनाई है, जिनमें Gemini, AI Studio, Antigravity और Web MCP पर workshops तथा agent-creation marathons (agent-athons) शामिल हैं। 🔗 स्रोत
  • Suno ने Studio Chat प्रस्तुत किया — Suno Studio का यह assistant project के हर track और हर MIDI fragment को जानता है तथा timeline पर सीधे व्यवस्थित करने, नाम बदलने, रंग देने या नया हिस्सा लिखने में सक्षम है। उपलब्धता या कीमत की घोषणा नहीं की गई है। 🔗 स्रोत
  • MiniMax H3 का open source ecosystem विस्तृत हुआ — MiniMax ने तीन community projects को प्रमुखता दी है: VDN, जो inference तेज करने के लिए attention की पुनर्कल्पना करता है; Alibaba PAI के आठ-step PDD Acc-LoRAs; और LightX2V के चार तथा आठ-step Turbo LoRAs। 🔗 स्रोत
  • Runway ने A Game of HORSE के निर्माण का विवरण दिया — एक video tutorial, short film के prompts और download की जा सकने वाली runway-sd-enhancer skill, जो raw prompt को 15-second scene के production prompt में बदलती है। 🔗 स्रोत
  • Ai2 ने University of Washington के students से AutoDiscovery का परीक्षण कराया — दस teams ने agent को परखा: batteries या proteins पर उपयोगी दिशाएँ मिलीं, लेकिन simulated reactor की 24 000 configurations पर लगभग आधी hypotheses अतार्किक थीं। trial credits को 31 दिसंबर तक बढ़ा दिया गया है। 🔗 स्रोत
  • Archsloth ने अपने GGUF Qwen को original के अधिक निकट पहुँचाया — Hugging Face ब्लॉग पर FINAL-Bench team का community contribution: unsloth file के समान size पर Qwen3-4B का इसका Q4_K_M दो सुधारे गए AutoRound options की बदौलत Korean में KL divergence को 54,4 % और English में 33,2 % घटाता है। 🔗 स्रोत
  • Eric Mey ने LangGraph agent की OpenAI compatibility मापी — उसी community ब्लॉग पर व्यक्तिगत contribution: Chat Completions के सभी 37 request fields को वर्गीकृत किया गया है और अब कोई भी चुपचाप अनदेखा नहीं रहता, जबकि शुरुआत में ऐसे 11 थे; हालाँकि streaming की एक कमी schema validation से बच निकली। 🔗 स्रोत
  • EcoHash ने मापा कि 96 GB की RTX PRO 6000 क्या serve कर सकती है — inference provider की पोस्ट, उसकी अपनी service पर किए गए measurements और प्रकाशित raw CSV के साथ: qwen3.6-35b-a3b अपना पहला token 170 ms (p95) में देता है और लगभग 213 tokens प्रति second उत्पन्न करता है; Llama-3.1-8B पर concurrent load में throughput लगभग 11 500 tokens प्रति second तक पहुँचता है। 🔗 स्रोत

इसका क्या अर्थ है

पहला सूत्र उन agents से जुड़ा है जिन्हें हम प्रोग्राम करते हैं और जिनकी निगरानी करते हैं। Claude Mods प्रत्येक व्यक्ति को TypeScript में अपने hooks लिखने देता है, लेकिन उनके side effects को एक $ ऑब्जेक्ट से होकर गुजारता है, जिसका administrators ऑडिट कर सकते हैं और जिस पर प्रतिबंध लगा सकते हैं। Devin Plugins इसी तर्क को कंपनी के स्तर पर लागू करता है, जहाँ दायरे के अनुसार plugins अनिवार्य या निषिद्ध होते हैं; GitHub, Auto की routing में लागत और गुणवत्ता के बीच संतुलन चुनने देता है; Qwen Code और Kimi Code अपने लक्ष्यों की अवधि निर्धारित करते हैं; और Kimi Code माँग पर अपने MCP tools लोड कर सकता है। MCP एक वितरण चैनल के रूप में भी काम करता है: एक ही installation, बातचीत छोड़े बिना, ElevenLabs की आवाज़, संगीत तथा 50 से अधिक image और video models को पाँच assistants में उपलब्ध करा देता है।

दूसरा सूत्र उस infrastructure से जुड़ा है, जिस पर यह agentic code दबाव डालता है या जिसे वह बनाता है। Anthropic में, जहाँ Claude 80% code लिखता है, छह महीनों में CI jobs की संख्या 25 गुना हो गई, और test selection service को फिर से बनाने में एक engineer को तीन सप्ताह लगे। Perplexity में, दो engineers और सैकड़ों agents ने CobbleDB की Rust की 40,000 lines लिखीं, जिसकी मापी गई read latency लगभग पाँच गुना कम है। Training भी इसी दिशा में बढ़ रही है: TRL ने 3 घंटे 27 मिनट के GRPO run को घटाकर 53 मिनट कर दिया, और Transformer Engine ने dropless MoE के throughput को 10.4 गुना बढ़ा दिया—ये दोनों लेख bottleneck को दूर करने से पहले उसका स्थान निर्धारित करते हैं।

तीसरा सूत्र राजनीतिक है: गति और नियम कौन तय करता है। OpenAI के उस विचार-लेख के तीन दिन बाद, जिसमें models की capabilities पर आधारित एक federal law की माँग की गई थी, Dario Amodei ने frontier models की प्रगति को नियंत्रित गति देने का प्रस्ताव रखा, जिसकी शुरुआत Anthropic को embedded evaluators के लिए खोलने से होगी; वहीं Aidan Gomez ने इस पद्धति को चुनौती दी। दोनों लेख सबसे सक्षम systems की स्वतंत्र समीक्षा पर सहमत हैं, लेकिन आगे की राह पर अलग हो जाते हैं: एक ओर, सभी अमेरिकी frontier companies पर लागू regulation, जिसके साथ सीमित antitrust exemption के अंतर्गत standards पर चर्चा हो; दूसरी ओर, कई देशों द्वारा बनाया गया risk framework और ऐसे audits जिनका भुगतान कभी भी audited संस्थाएँ न करें। बहस नियंत्रण के सिद्धांत से कम और उसके नियम लिखने वालों को लेकर अधिक है।

अंतिम सूत्र sensitive data से जुड़ा है, जिसके पास AI ऐसे guardrails के साथ पहुँचता है जो product में ही समाहित हैं। Portable Computer files और queries को PC पर रखता है तथा cloud पर कुछ भी भेजने से पहले अनुमति माँगता है; Scribe v2 Medical clinical dictation और protected health data से जुड़े compliance workflows के लिए बनाया गया है; Claude Tag, BAA agreement के अंतर्गत न आने के कारण, केवल उन channels तक सीमित रहता है जिनमें ऐसा data नहीं होता; और Claude for Financial Advisors critical tasks की approval advisor के लिए सुरक्षित रखता है। agent किसी patient की file या client के portfolio के जितना करीब पहुँचता है, उसके अकेले किए जा सकने वाले कार्यों की सीमा उतनी ही स्पष्ट होती जाती है।


स्रोत