खोजें

Google Cloud ने काम के लिए अपना Gemini एजेंट पेश किया, HeyGen Voice और Claude Managed Agents के गतिशील वर्कफ़्लो

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Google Cloud ने काम के लिए अपना Gemini एजेंट पेश किया, HeyGen Voice और Claude Managed Agents के गतिशील वर्कफ़्लो

ai-powered-markdown-translator

gpt-6.1-sol का उपयोग करके फ़्रेंच से हिंदी में अनुवादित लेख।

GitHub पर प्रोजेक्ट देखें ↗

Google Cloud ने 8 अक्टूबर को Gemini at Work 2026 में Gemini एजेंट पेश किया: उद्यमों के सभी कामों के लिए एक ही एजेंट, जो क्लाउड में लगातार चलता है और Gemini तथा Claude, दोनों के मॉडलों का संचालन करता है। दूसरी ओर, HeyGen ने अपना पहला आंतरिक रूप से विकसित वॉइस मॉडल HeyGen Voice जारी किया, जो Artificial Analysis की Controlled Voice रैंकिंग में शीर्ष पर पहुँच गया है, जबकि Anthropic ने Claude Managed Agents में ऐसे वर्कफ़्लो उपलब्ध कराए हैं जो प्रति रन 1 000 तक एजेंट शुरू कर सकते हैं। कोडिंग के क्षेत्र में, Codex उपयोगकर्ता के अगले संदेश का अनुमान लगाना सीख रहा है और Windows पर Microsoft Execution Containers पर आधारित एक नया सैंडबॉक्स अपना रहा है।


Google Cloud ने Gemini एजेंट पेश किया, सभी कामों के लिए एक ही एजेंट

8 अक्टूबर — Gemini at Work 2026 में Google Cloud ने Gemini एजेंट पेश किया, जिसे वह काम के लिए एक एकल और सार्वभौमिक एजेंट बताता है। एक ही इनपुट क्षेत्र और एक ही API से यह सवालों के जवाब देता है, बौद्धिक कार्य संभालता है, चित्र और मीडिया बनाता है, तथा कोड लिखता और चलाता है। Google Cloud के मुख्य कार्यकारी अधिकारी थॉमस कुरियन का विचार है: उसे निर्देशों की एक श्रृंखला देने के बजाय एक लक्ष्य सौंपा जाए।

यह एजेंट एक ही स्मृति के साथ क्लाउड में लगातार चलता है और हर जगह उपलब्ध है: वेब, iOS, Android, Windows, Mac, कमांड लाइन, Google Workspace, Microsoft 365 और Slack में, या तीसरे पक्ष के अनुप्रयोगों में बिना इंटरफ़ेस (headless) के। कई घंटों या कई दिनों का कार्य कंप्यूटर बंद होने पर भी जारी रहता है। लंबे कामों के लिए यह अस्थायी उप-एजेंट बनाता है, जिनमें से हर एक की अपनी पहचान होती है, और यह स्थायी भूमिका वाला सहकर्मी एजेंट (coworker agent) भी बन सकता है, जिसका अपना @agents.company.com पता और भंडारण होता है। मॉडल का चयन एक अलग विकल्प बन जाता है: Google के अनुसार, एजेंट पहले से ही Gemini और Anthropic के Claude मॉडलों का संचालन करता है, और आगे अन्य निजी और खुले मॉडल भी जुड़ेंगे। वित्त और कानूनी क्षेत्रों के लिए विशेष संस्करण पूर्वावलोकन में आ रहे हैं; वित्त संस्करण में 50 से अधिक मूल कौशल हैं, जिनका उपयोग CME Group और Deutsche Bank पहले से कर रहे हैं।

घोषित नियंत्रण घटकGoogle द्वारा बताई गई भूमिका
हर एजेंट की पहचानक्रिप्टोग्राफ़ी से प्रमाणित पहचान, भूमिका के अनुसार अनुमतियाँ, उसके नाम पर ऑडिट लॉग
Agent Sandboxअलग-थलग निष्पादन, अपनी नेटवर्क सीमा के साथ
Agent Gatewayएआई के लिए नेटवर्क फ़ायरवॉल, जिससे एजेंट का पूरा ट्रैफ़िक गुजरता है
वास्तविक समय में खर्च की सीमाएँCloud Billing में परियोजना का एजेंट रुक जाता है, एक क्लिक से फिर शुरू किया जा सकता है

Google Cloud अपने आँकड़े भी प्रस्तुत करता है: करीब 500 ग्राहकों में से हर एक ने एक वर्ष में 1 000 अरब से अधिक टोकन संसाधित किए हैं, और Fortune 100 की करीब 90 % कंपनियाँ Gemini Enterprise का उपयोग करती हैं। हालाँकि, ब्लॉग पोस्ट में एजेंट की उपलब्धता की तारीख या उसकी कीमत नहीं दी गई है; Google Cloud केवल उन बड़े ग्राहकों का उल्लेख करता है जिन्होंने इसे पहले से आज़माया है, जैसे मॉडल के गतिशील चयन के लिए खेल ब्रांड On।

🔗 Gemini at Work 2026 (Google Cloud का ब्लॉग)

Gemini Enterprise ने Antigravity उपकरणों के लिए Claude Opus 5.5 और Claude Sonnet 5.5 उपलब्ध कराए

8 अक्टूबर — उसी दिन, Gemini Enterprise के संस्करण नोट्स के अनुसार व्यवस्थापक Antigravity 2.0, Antigravity CLI और IDE के लिए Antigravity एक्सटेंशन में Claude Opus 5.5 और Claude Sonnet 5.5 सक्रिय कर सकते हैं। व्यवस्थापक अलग Anthropic खाते के बिना, सीधे Google Cloud कंसोल में उनकी उपयोग की शर्तें स्वीकार करता है।

सक्रियण संबंधी सेटिंगGoogle द्वारा दिया गया मान
डिफ़ॉल्ट स्थितितीसरे पक्ष के मॉडल निष्क्रिय, व्यवस्थापकों द्वारा सक्रियण
बिलिंग का तरीकाउपयोग के अनुसार, परियोजना की खर्च सीमा के भीतर
अनुमान के स्थानglobal, us और eu
विचार के स्तरLow, Medium (डिफ़ॉल्ट), High या Max

डेवलपर अपना Gemini Enterprise लाइसेंस बनाए रखता है और मॉडल चयनकर्ता में Claude चुनता है। तीसरे पक्ष का मॉडल उपलब्ध कराने से पहले सीमा से अधिक उपयोग (overages) सक्रिय करना आवश्यक है, और उसकी लागत सभी मॉडलों की साझा खर्च सीमा में शामिल होती है। यही पृष्ठ सिंगापुर में Gemini 3.8 Flash की सामान्य उपलब्धता की भी घोषणा करता है।

🔗 Gemini Enterprise के संस्करण नोट्स


आवाज़: Controlled Voice रैंकिंग में HeyGen Voice शीर्ष पर, Mistral ने अरबी के लिए दो मॉडल जारी किए

9 अक्टूबर — HeyGen ने HeyGen Voice पेश किया, जिसे जोशुआ शू कंपनी का पहला आंतरिक रूप से विकसित वॉइस मॉडल बताते हैं; कंपनी अब तक अपने अवतारों के लिए जानी जाती थी। मॉडल HeyGen में और API के माध्यम से उपलब्ध है, जिसकी कीमत प्रति दस लाख अक्षरों पर 30 डॉलर है; 31 अक्टूबर तक API उपयोगकर्ता 15 डॉलर चुकाते हैं और छूट अपने आप लागू होती है।

इस दावे का आधार Artificial Analysis के परिणाम हैं, जिन्हें उसने HeyGen से डेढ़ मिनट पहले प्रकाशित किया था। उसकी Controlled Voice रैंकिंग में, जहाँ सभी मॉडल अमेरिकी और ब्रिटिश अंग्रेज़ी में उन्हीं 8 क्लोन की गई आवाज़ों के साथ बोलते हैं, HeyGen Voice ने 1 468 प्रस्तुतियों में 1 201 के Elo के साथ पहला स्थान हासिल किया है। इसमें वह सहायक और ग्राहक सेवा श्रेणियों में, तथा ब्रिटिश अंग्रेज़ी में भी पहले स्थान पर है।

HeyGen Voice takes the #1 spot on the Artificial Analysis Controlled Voice TTS Arena Leaderboard, ahead of Alibaba’s Qwen-Audio-3.1-TTS-Plus and ElevenLabs’ Eleven v4 Turbo

🇮🇳 HeyGen Voice ने Artificial Analysis की Controlled Voice TTS Arena रैंकिंग में Alibaba के Qwen-Audio-3.1-TTS-Plus और ElevenLabs के Eleven v4 Turbo को पीछे छोड़कर पहला स्थान हासिल किया है। — X पर @ArtificialAnlys

मूल्यांकित मॉडलControlled Voice Elo (9 अक्टूबर)प्रति दस लाख अक्षरों पर API की कीमत
HeyGen Voice1 20130 डॉलर (31 अक्टूबर तक 15)
Qwen-Audio-3.1-TTS-Plus1 18219,3 डॉलर
Eleven v4 Turbo1 16640 डॉलर
Eleven v41 16280 डॉलर

इस पहले स्थान का दायरा स्पष्ट है: यह आवाज़ की क्लोनिंग से संबंधित है। Provider Voice रैंकिंग में, जहाँ हर प्रदाता अपनी आवाज़ों का उपयोग करता है, 9 अक्टूबर की शाम तक Eleven v4 Turbo और Eleven v4 शीर्ष पर बने हुए थे, और HeyGen Voice पहले आठ में शामिल नहीं था। उच्चारण की विश्वसनीयता में HeyGen Voice को 83,1 % मिला, यानी 29 में से 10वाँ स्थान।

API में क्लोनिंग तुरंत होती है: एक ही रिकॉर्डिंग, जिसके केवल पहले तीन मिनट इस्तेमाल होते हैं, बिना प्रशिक्षण के कुछ सेकंड में उपयोग के लिए तैयार आवाज़ देती है। आवाज़ का संश्लेषण एक साथ पूरी फ़ाइल के रूप में (44,1 kHz पर WAV फ़ाइल) या स्ट्रीम में होता है, और Artificial Analysis ने API की डिफ़ॉल्ट सेटिंग का ही मूल्यांकन किया है।

🔗 HeyGen की घोषणा

Voxtral Mini 4B Realtime Arabic और LIDstral Arabic: अरबी के लिए Mistral के दो मॉडल

8 अक्टूबर — Mistral ने बिना घोषणा किए Hugging Face पर अरबी के लिए समर्पित दो खुले मॉडल Apache 2.0 लाइसेंस के अंतर्गत उपलब्ध कराए हैं। Voxtral Mini 4B Realtime Arabic अरबी बोलियों और आधुनिक मानक अरबी का स्ट्रीम में लिप्यंतरण करता है, तब भी जब वक्ता बातचीत के बीच भाषा बदलते हैं (code-switching)। Voxtral Mini 4B Realtime से फ़ाइन-ट्यून किए गए इस मॉडल में लगभग 4,4 अरब पैरामीटर हैं। इसके विवरण के अनुसार, इसे मोरक्को के डिजिटल परिवर्तन और प्रशासनिक सुधार मंत्रालय के साथ मिलकर विकसित किया गया है। यह जनवरी 2026 में Mistral और मोरक्को के बीच हुई साझेदारी का हिस्सा है, जिसके अंतर्गत दो नए बेंचमार्क, ISMA और Darija in the Wild, भी तैयार किए गए हैं।

प्रकाशित मॉडलमॉडल का कार्यविवरण के अनुसार परिणाम
Voxtral Mini 4B Realtime Arabicअरबी का स्ट्रीम में लिप्यंतरण480 ms पर 7 बेंचमार्क में औसत अक्षर त्रुटि दर 8,82 %, जबकि Voxtral Transcribe Arabic के लिए 7,91 %
LIDstral Arabicप्रोसेसर पर भाषा और बोली की पहचान, 51 वर्गमोरक्को की दरिजा पर F1 88,67 %, जबकि GlotLID v3 के लिए 71,28 %

🔗 Hugging Face पर Voxtral Mini 4B Realtime Arabic · Hugging Face पर LIDstral Arabic


Claude Managed Agents: प्रति रन 1 000 तक एजेंट वाले गतिशील वर्कफ़्लो

9 अक्टूबर — Anthropic ने Claude Managed Agents के गतिशील वर्कफ़्लो (dynamic workflows) सार्वजनिक बीटा में उपलब्ध कराए हैं, जो बहु-एजेंट संचालन का एक नया प्रकार है। सत्र का नेतृत्व करने वाला एजेंट स्वयं एक प्रोग्राम लिखता है, जिसे सर्वर पृष्ठभूमि में चलाता है: वह चरणों में अनेक एजेंट शुरू करता है और फिर उनके परिणामों को जोड़ता है। multiagent_20261001 प्रकार सक्रिय होने के बाद, रन शुरू करने का निर्णय एजेंट स्वयं लेता है।

एक रन में 1 000 तक एजेंट शुरू होते हैं, जिनमें से 64 एक साथ चल सकते हैं। यह डिफ़ॉल्ट रूप से 24 घंटे सक्रिय रहता है, और एक सत्र ऐसे 10 रन खुले रख सकता है। इसके टोकन की बिलिंग सत्र के टोकन की तरह होती है और वे उसके बजट में गिने जाते हैं; Anthropic चेतावनी देता है कि उनकी संख्या बड़ी हो सकती है, और 116 000 पंक्तियों वाले कोडबेस में जानबूझकर डाले गए 70 बग पर किए गए एक आंतरिक परीक्षण का उल्लेख करता है।

Anthropic के परीक्षण की व्यवस्था3 प्रयासों में मिले बग
अकेला एजेंट14, 15 और 27
गतिशील वर्कफ़्लोहर प्रयास में 66

🔗 @ClaudeDevs की घोषणा · वर्कफ़्लो रन का दस्तावेज़ीकरण


कोडिंग एजेंट: Codex के लिए संदेशों के अनुमान और MXC सैंडबॉक्स, Claude Code 2.1.296, Vibe CLI 2.26.1

Codex को एक ही दिन दो नई सुविधाएँ मिली हैं, जबकि Anthropic और Mistral ने अपने कमांड लाइन एजेंटों के नए संस्करण जारी किए हैं।

Codex उपयोगकर्ता के अगले संदेश का अनुमान लगाता है, Pro ग्राहकों के लिए बीटा में

9 अक्टूबर — OpenAI ने Codex के डेस्कटॉप अनुप्रयोग में संदेश संपादक के अनुमान (composer predictions) बीटा में उपलब्ध कराए हैं। जब Codex उत्तर देना समाप्त कर देता है, तो इनपुट क्षेत्र में अगले संदेश का सुझाव दिखाई दे सकता है। यह मौजूदा बातचीत से तैयार होता है और इसके लिए स्मृतियों या जुड़े हुए अनुप्रयोगों में खोज नहीं की जाती। Tab कुंजी इसे इनपुट क्षेत्र में डाल देती है; पाठ बदला जा सकता है और कभी अपने आप नहीं भेजा जाता। सुझाव पूरे संदेश का होता है, शब्द-दर-शब्द पूर्ति का नहीं।

बीटा की शर्तOpenAI द्वारा दिया गया मान
योजना और आयुव्यक्तिगत ChatGPT Pro, 18 वर्ष और उससे अधिक
बातचीत और मॉडलस्थानीय और SSH बातचीत, GPT-6 Astra या GPT-6.1 Sol के साथ
डिफ़ॉल्ट सेटिंगसक्रिय, General > Composer > Show predictions में निष्क्रिय किया जा सकता है
बीटा के दौरान लागतCodex की उपयोग सीमाओं से बाहर, कोई क्रेडिट खर्च नहीं होता

भेजे गए संदेश, जिनमें स्वीकार किए गए अनुमान भी शामिल हैं, सामान्य रूप से गिने जाते हैं। यह सुविधा Chat में उपलब्ध नहीं है।

🔗 @OpenAIDevs की घोषणा · OpenAI का सहायता लेख

Windows पर Codex: Microsoft Execution Containers पर आधारित सैंडबॉक्स

9 अक्टूबर — OpenAI ने Windows पर Codex में Microsoft Execution Containers (MXC) पर आधारित सैंडबॉक्स मोड जोड़ा है, जिन्हें Microsoft ने 7 अक्टूबर को सामान्य उपलब्धता में जारी किया था। इसके लिए संगत Windows 11 उपकरण (24H2 build 26100.9278 या 25H2 build 26200.9278) आवश्यक है, और यह तेज़ सेटअप, अधिक सख्त नेटवर्क नियंत्रण तथा फ़ाइल पहुँच पर अधिक सूक्ष्म नियंत्रण का वादा करता है।

दस्तावेज़ीकरण के अनुसार, MXC अब अनुशंसित कार्यान्वयन है: यह प्रक्रियाओं को मूल रूप से अलग-थलग रखता है, बिना व्यवस्थापक द्वारा स्वीकृत कॉन्फ़िगरेशन, अतिरिक्त Windows खातों या स्थानीय फ़ायरवॉल नियमों के। elevated और unelevated मोड अब पुराने वैकल्पिक उपाय बन गए हैं। व्यक्तिगत खातों के लिए डेस्कटॉप अनुप्रयोग स्वयं MXC चुनता है; CLI या उद्यम में इसे config.toml में prefer_mxc = true से सक्रिय किया जाता है, और व्यवस्थापक allow_mxc = false से इसे रोक सकता है। दो सीमाएँ दस्तावेज़ में बताई गई हैं: प्रबंधित नेटवर्क के लिए allow_local_binding = true आवश्यक है, और बची हुई चाइल्ड प्रक्रियाएँ अग्रभूमि में चल रही कमांड समाप्त होने पर बंद हो जाती हैं।

🔗 @OpenAIDevs की घोषणा · Windows सैंडबॉक्स का दस्तावेज़ीकरण

Claude Code 2.1.296: उप-एजेंटों के लिए अलग संदर्भ संक्षेपण और वर्कफ़्लो एजेंटों के लिए एक ही मॉडल

9 अक्टूबर — Claude Code 2.1.296 में 79 प्रविष्टियाँ हैं, जिनमें 56 सुधार शामिल हैं, और इसके साथ कोई ट्वीट नहीं किया गया। यह मुख्य रूप से उप-एजेंटों पर अधिक नियंत्रण देता है।

संस्करण की नई सुविधाइससे क्या बदलता है
autoCompactWindow (उप-एजेंट, --agents)उप-एजेंट मुख्य बातचीत से पहले अपना संदर्भ संक्षिप्त करता है
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODELएक वर्कफ़्लो के सभी एजेंट एक ही मॉडल पर चलते हैं, अन्य उप-एजेंट अपने मॉडल बनाए रखते हैं
Read का allow_large विकल्पसंदर्भ अनुमति दे तो बड़ी पाठ फ़ाइल को एक ही कॉल में पढ़ना
CLAUDE_CODE_OVERLOADED_RETRY_MAX_DELAY_MS529 त्रुटि के बाद दो पुनः प्रयासों के बीच अधिक लंबा अधिकतम विलंब
MCP उपकरणों के विवरण शुरुआत में ही भेजे जाते हैंडिफ़ॉल्ट सीमा 2 048 से बढ़ाकर 4 096 अक्षर की गई

/cost और स्थिति पंक्ति अब Sonnet 5.5 के कैश से पढ़े गए टोकन की गणना प्रति दस लाख टोकन पर 0,10 डॉलर की दर से करते हैं। सुरक्षा के क्षेत्र में, यह संस्करण उन प्रबंधित PreToolUse हुक को ठीक करता है जो कॉल अस्वीकार करते थे लेकिन उस चरण को समाप्त नहीं करते थे; उन Bash जाँचों को ठीक करता है जो BASH_ARGV0 का उपयोग करने वाली कुछ कमांड को अपने आप स्वीकृत कर देती थीं; उन क्लाउड सत्रों को ठीक करता है जो Claude in Chrome की कार्रवाइयों पर स्वचालित मोड की जाँच छोड़ देते थे; और उन Edit तथा NotebookEdit बदलावों को ठीक करता है जो गैर-UTF-8 फ़ाइलों के सभी गैर-ASCII अक्षरों को बदल देते थे—ऐसे बदलाव अब अस्वीकार किए जाते हैं।

🔗 GitHub पर Claude Code 2.1.296

Vibe CLI 2.26.1 : स्थानीय Devstral मॉडल हटाया गया, अधिक सुविधाओं वाला गैर-इंटरैक्टिव मोड

9 अक्टूबर — 2.26.0 के तीन दिन बाद और बिना किसी ट्वीट के, Mistral ने Vibe CLI 2.26.1 जारी किया है। संस्करण संख्या इसे एक पैच रिलीज़ बताती है, लेकिन इसमें 85 प्रविष्टियाँ हैं (23 नई सुविधाएँ, 24 बदलाव, 36 सुधार, 2 हटाए गए हिस्से), जिनमें से 37 नए Rust इंटरफ़ेस से जुड़ी हैं। इसमें पैकेज के साथ शामिल स्थानीय Devstral मॉडल हटा दिया गया है : जो कॉन्फ़िगरेशन अब भी उस मॉडल को तय रखता है, वह चेतावनी के साथ डिफ़ॉल्ट होस्ट किए गए मॉडल पर लौट जाता है। इस मॉडल में अब तर्क-विचार के केवल दो स्तर, off और high, उपलब्ध हैं और इसकी घोषित संदर्भ विंडो 256k है, जिसके अनुसार स्वचालित संदर्भ-संक्षेपण होता है।

गैर-इंटरैक्टिव मोड vibe -p में समय सीमा, फ़ाइल या मानक इनपुट से प्रॉम्प्ट पढ़ने की सुविधा, हर बार प्रोग्राम से बाहर निकलने पर लिखी जाने वाली export.json रिपोर्ट और अलग-अलग निकास कोड जोड़े गए हैं : उपयोग या कॉन्फ़िगरेशन की त्रुटि के लिए 1, बुनियादी ढाँचे की विफलता के लिए 2, किसी सीमा तक पहुँचने या मॉडल के इनकार के लिए 3। Rust CLI में /proxy-setup, हर संवाद-चरण का सारांश आवाज़ में पढ़ने वाला एक वाचक, /plugins और /whoami जोड़े गए हैं। नई सेटिंग एजेंट को पृष्ठभूमि प्रक्रियाएँ या उप-एजेंट चलाने से रोकती हैं, और Document Library कनेक्टर डिफ़ॉल्ट रूप से अक्षम रहता है।

🔗 Vibe CLI 2.26.1 के रिलीज़ नोट्स


जनरेटिव चित्र, वीडियो और गेम : Qwen-Image-2.1-Turbo, Midjourney का Thinking मोड, Synthesia का Syren, Google का Playground

एक अधिक तेज़ और सस्ता चित्र मॉडल, अपने परिणाम की समीक्षा करने वाला जनरेटर, वीडियो संपादित करने वाला एजेंट और बिना कोड का गेमिंग प्लेटफ़ॉर्म।

Qwen-Image-2.1-Turbo : शोर हटाने के 8 चरण और प्रति चित्र 0,016 डॉलर

9 अक्टूबर — Qwen ने Qwen-Image-2.1-Turbo जारी किया है, जो Qwen-Image-2.1 का एक त्वरित चेकपॉइंट (accelerated checkpoint) है। यह 7 अरब पैरामीटर वाले उसी आर्किटेक्चर पर शोर हटाने के 8 चरणों में चित्र बनाता और संपादित करता है। Qwen के अनुसार, यह अब भी 2K चित्र बनाता है और प्राकृतिक भाषा में संपादन निर्देश स्वीकार करता है, लेकिन इस संस्करण की गुणवत्ता या गति के कोई विशिष्ट आँकड़े प्रकाशित नहीं किए गए हैं। मॉडल के वेट Hugging Face और ModelScope पर Qwen के शोध लाइसेंस (Qwen Research License) के तहत उपलब्ध हैं। चेकपॉइंट में 8 चरणों का सैंपलिंग शेड्यूल शामिल है और यह डिफ़ॉल्ट रूप से 1 के CFG के साथ चलता है।

उसी दिन Qwen ने आधिकारिक तौर पर Qwen-Image-2.1 Pro और Turbo के API उपलब्ध कराए ; QwenCloud, Turbo के लिए प्रति मिनट 120 अनुरोधों की अनुमति देता है।

API के ज़रिए उपलब्ध मॉडल (Model Studio)प्रति चित्र कीमतमुफ़्त चित्र
qwen-image-2.1-turbo0,016 डॉलर10
qwen-image-2.1-pro0,04 डॉलर10
qwen-image-2.0-pro0,075 डॉलर100

🔗 Qwen की घोषणा · Hugging Face पर मॉडल का विवरण

Midjourney ने Thinking मोड का परीक्षण शुरू किया और अपनी अल्फ़ा साइट पर साझा फ़ोल्डर उपलब्ध कराए

8 अक्टूबर — शाम को प्रकाशित Midjourney के अल्फ़ा चेंजलॉग में दो सुविधाओं के शुरुआती संस्करण प्रस्तुत किए गए हैं, जो फ़िलहाल केवल alpha.midjourney.com साइट पर उपलब्ध हैं। पहली सुविधा एक परीक्षण है : V8.2 से बनाए या संपादित किए गए चित्र पर Rerun (Thinking) बटन मॉडल से परिणाम देखने, प्रॉम्प्ट से उसके विचलन पहचानने (वस्तुएँ, लेआउट, शरीररचना, पाठ) और चित्र दोबारा बनाने को कहता है। Midjourney का कहना है कि प्रॉम्प्ट का पालन करने, टाइपोग्राफ़ी और सुसंगति में बेहतर परिणाम मिले हैं, और वह इसे एक सामान्य मोड बनाने पर विचार कर रहा है।

दूसरी सुविधा फ़ोल्डर साझा करना है : सहयोगियों को आमंत्रित किया जा सकता है, जो सीधे फ़ोल्डर में चित्र बनाते हैं, या दर्शकों को बुलाया जा सकता है। लिंक के ज़रिए फ़ोल्डर साझा करना या उसे Midjourney के सभी सदस्यों के लिए खोलना भी संभव है। Midjourney स्पष्ट करता है कि साझा करने से चित्रों की दृश्यता नहीं बदलती : stealth मोड के बिना वे अब भी Explore और प्रोफ़ाइल पर दिखाई दे सकते हैं।

🔗 Midjourney का अल्फ़ा चेंजलॉग · Thinking मोड का परीक्षण (Midjourney)

Syren : Synthesia ने बीटा में वीडियो बनाने का काम एक एजेंट को सौंपा

9 अक्टूबर — Synthesia ने मुफ़्त खातों सहित अपने सभी ग्राहकों के लिए Syren का बीटा लॉन्च किया है। उपयोगकर्ता मनचाहे वीडियो का विवरण देता है या दस्तावेज़, चित्र, वीडियो, PowerPoint प्रस्तुतियाँ या YouTube लिंक उपलब्ध कराता है, और Syren ग्राफ़िक ऐनिमेशन (motion graphics), अवतार, पार्श्व आवाज़, संगीत और पूरक दृश्य (b-roll) के साथ एक तैयार वीडियो देता है, जिसे फिर बातचीत के ज़रिए संशोधित किया जा सकता है। Synthesia के तकनीकी निदेशक पीटर हिल के अनुसार, एजेंट पूरे वीडियो को कोड के रूप में लिखता है, जिसे कंपनी का अपना रेंडरिंग इंजन लाइव चलाता है। यह इंजन जून से Synthesia के ऐनिमेशन के लिए इस्तेमाल हो रहा है।

वीडियो 3 मिनट तक लंबे हो सकते हैं, क्षैतिज या ऊर्ध्वाधर प्रारूप में, और ब्राउज़र में रेंडर होते हैं। बिलिंग क्रेडिट के आधार पर होती है, विस्तृत दरें नहीं दी गई हैं, और Enterprise प्रशासक इस टूल को अक्षम कर सकते हैं। लेख में मौजूदा वीडियो से ब्रांड की पहचान अपने आप सीखने की सुविधा जल्द आने की घोषणा की गई है। Syren, HeyGen के HyperFrames Studio के चार दिन बाद और Anthropic के Claude Motion के अगले दिन आया है। ये दोनों भी ऐसे टूल हैं जिनमें एजेंट वीडियो बनाता है।

🔗 Syren का परिचय (Synthesia)

Playground : Google ने बिना कोड लिखे गेम बनाने का प्लेटफ़ॉर्म उपलब्ध कराया

7 अक्टूबर — Google ने Playground लॉन्च किया है, जो एक प्रयोगात्मक गेमिंग प्लेटफ़ॉर्म है। इसमें बिना कोड लिखे, कुछ प्रॉम्प्ट में विवरण देकर गेम बनाए, खेले और साझा किए जा सकते हैं। संवादात्मक इंटरफ़ेस में शुरुआत खाली पृष्ठ से, रीमिक्स किए जा सकने वाले उदाहरण से या निर्देशित सहायता के साथ की जाती है, फिर अनुरोध के अनुसार भौतिकी, नियम, पात्र या परिवेश बदले जाते हैं।

गेम फ़ोन और कंप्यूटर दोनों पर ब्राउज़र में चलते हैं। इन्हें निजी रखा जा सकता है, लिंक के ज़रिए साझा किया जा सकता है या Explore गैलरी में जोड़ा जा सकता है। कुछ श्रेणियों में रैंकिंग और मल्टीप्लेयर की सुविधा है ; हर प्रकाशित गेम की सुरक्षा जाँच होती है। Playground अमेरिका में 18 वर्ष और उससे अधिक उम्र के लोगों के लिए उपलब्ध है, और गेम बनाने की अनुमति Google AI की सदस्यता पर निर्भर करती है। अधिक महत्वाकांक्षी 3D गेम के लिए Unity Spark के साथ एकीकरण जल्द बंद बीटा में आने की घोषणा की गई है। Google ने यह स्पष्ट नहीं किया है कि प्लेटफ़ॉर्म किस मॉडल पर चलता है।

🔗 Playground का परिचय (Google ब्लॉग)


स्वास्थ्य : AMIE का नैदानिक अध्ययन The Lancet में प्रकाशित

8 अक्टूबर — Google और Beth Israel Deaconess Medical Center (BIDMC) ने The Lancet में AMIE (Articulate Medical Intelligence Explorer) का एक भावी व्यवहार्यता अध्ययन प्रकाशित किया है। AMIE, Google की निदान करने वाली संवादात्मक IA है ; Google के अनुसार, Lancet की मुख्य पत्रिका में यह उसका पहला प्रकाशन है। मरीज़ों ने तत्काल चिकित्सा परामर्श से अधिकतम पाँच दिन पहले AMIE से बातचीत की, और चिकित्सक को बाद में बातचीत का प्रतिलेख और सारांश मिला।

अध्ययन का मापप्रकाशित परिणाम
अध्ययन में शामिल मरीज़ (अप्रैल से नवंबर 2025), फिर अनुवर्ती निरीक्षण वाले114, फिर 98
सुरक्षा के कारण रोके गए मामले0
दर्ज किए गए हैलुसिनेशन1
चिकित्सक के अनुसार, परामर्श की तैयारी में AMIE उपयोगी44 में से 33 मामले (75 %)
अंतिम निदान से मेल खाने वाले निदान (Google)90 %

एक ही केंद्र पर किए गए इस अध्ययन में नियंत्रण समूह नहीं था और इसका वित्तपोषण Alphabet ने किया। यह न तो मंज़ूरी है, न ही तैनाती : लेखकों ने बड़े परीक्षणों की माँग की है।

🔗 Google का लेख · The Lancet में प्रकाशित लेख


OpenAI में शोध : कंपनी से अलग किए गए तीन शोधकर्ताओं के पत्र का जवाब

9 अक्टूबर — अपने शोध प्रमुखों की ओर से @OpenAINewsroom पर प्रकाशित एक नोट में OpenAI ने तीन शोधकर्ताओं के पत्र का जवाब दिया है, जिनसे वह कहती है कि पिछले सप्ताह अलग हुई थी। OpenAI के अनुसार, आंतरिक जाँच में निष्कर्ष निकला कि उन्होंने संवेदनशील जानकारी के प्रबंधन से जुड़े स्पष्ट नियमों का उल्लंघन किया था और विश्वास में आई दरार उनके पत्र में बताए गए दायरे से आगे थी ; OpenAI अपने फैसले पर कायम है। उसका कहना है कि ये फैसले न तो सुरक्षा संबंधी चिंताएँ उठाने के कारण हुए, न ही अपनी बात सार्वजनिक रूप से रखने के कारण, और वह चिंताएँ व्यक्त करने के लिए किसी कर्मचारी को नौकरी से नहीं निकालती।

नोट में यह घोषणा भी की गई है :

We are actively finalizing contracts with third-party safety assessors and will announce details in the coming weeks.

🇮🇳 हम तीसरे पक्ष के सुरक्षा मूल्यांकनकर्ताओं के साथ अनुबंधों को अंतिम रूप देने पर सक्रिय रूप से काम कर रहे हैं और आने वाले हफ़्तों में इनके विवरण की घोषणा करेंगे। — X पर @OpenAINewsroom

OpenAI का कहना है कि वह पत्र की एक बात से सहमत है : फ्रंटियर मॉडलों की निगरानी करने की क्षमता (monitorability) बनाए रखने के लिए पूरे उद्योग की प्रतिबद्धता चाहिए, जिसमें OpenAI भी शामिल है। यह लेख OpenAI का पक्ष प्रस्तुत करता है ; शोधकर्ताओं का पत्र नहीं पढ़ा गया है।


खुले मॉडल बनाना : ML Intern से लगभग 103 डॉलर में छह मॉडल, Ai2 का GPU शेड्यूलर

मॉडल बनाने के दो अनुभव : एक एजेंट के स्तर पर, दूसरा कंप्यूटिंग क्लस्टरों के स्तर पर।

ML Intern : लगभग 103 डॉलर की गणना लागत में छह खुले मॉडल

8 अक्टूबर — यहाँ 1 और 8 अक्टूबर को अलग-अलग पहलुओं से प्रस्तुत किए जा चुके HuggingChat के ML Intern मोड का पहला आँकड़ों सहित लेखाजोखा Hugging Face के ब्लॉग पर आया है : छह परियोजनाएँ शुरू से अंत तक पूरी की गईं, कुल लगभग 103 डॉलर की गणना लागत में। हर परियोजना एक संदेश से शुरू होती है और मूल्यांकन सहित Hub पर एक सार्वजनिक मॉडल के साथ समाप्त होती है। एजेंट योजना बनाता है, किसी भी सशुल्क गणना कार्य से पहले अनुमति माँगता है, छोटा परीक्षण चलाता है, फिर Hugging Face के हार्डवेयर पर प्रशिक्षण, मूल्यांकन और प्रकाशन करता है।

ML Intern द्वारा बनाया गया मॉडलप्रकाशित परिणामगणना लागत
Pocket Rewriter (0.8B)99,7 % वैध आउटपुट, Qwen-Image 2.1 के 9B पुनर्लेखन मॉडल के लगभग एक चौथाई टोकनलगभग 16 डॉलर
Citrus Doctor (Qwen3.5-2B)खट्टे फलों के रोगों के सही निदान 14,9 % से 52,8 % तकलगभग 1,90 डॉलर
Qwen-Image 2.1 के लिए दो LoRAदेखने के कोण में बदलाव, आड़ी-तिरछी रेखाओं की जगह माँगी गई वस्तुलगभग 16 और 24,30 डॉलर
Huggy LoRA (FLUX.2 klein)पात्र का LoRAलगभग 7,60 डॉलर
Agate 4 चरणएक छोटे चित्र मॉडल का डिस्टिलेशन, 50 चरणों (गाइडेंस के साथ 100 पास) से 4 तकलगभग 37 डॉलर

🔗 Hugging Face का लेख

Ai2 का GPU शेड्यूलर : मध्यिका प्रतीक्षा समय 5 मिनट से घटकर 24 सेकंड

9 अक्टूबर — जेरेमी ट्राइबा के लिखे एक लेख में Ai2 ने अपने GPU क्लस्टरों के नए शेड्यूलर का विवरण दिया है। 88 से 1 024 GPU वाले क्लस्टरों में हज़ारों NVIDIA H100, B200 और B300 GPU लगभग 150 शोधकर्ताओं के बीच साझा किए जाते हैं, जबकि माँग उपलब्ध क्षमता से दो से तीन गुना अधिक है। प्राथमिकताओं पर आधारित पुराना तंत्र GPU को खाली कार्यों के « कब्ज़े » में छोड़ देता था, और सभी कार्यभार अंततः अधिकतम प्राथमिकता पर पहुँच जाते थे।

नया तंत्र शोध के संगठनात्मक पदक्रम में बाँटे गए GPU समय के बजट, पिछले सात दिनों की बदलती अवधि के आधार पर तय पदानुक्रमित न्यायसंगत बँटवारे (fair-share) और एक « शेड्यूलिंग अनुबंध » पर आधारित है : हर कार्यभार अधिकतम 8 घंटे की सुरक्षित अवधि घोषित करता है, जिसके बाद उसे रोककर फिर कतार में डाला जा सकता है। अनावंटित समय मुफ़्त रहता है, लेकिन उसे किसी भी समय रोका जा सकता है।

Ai2 द्वारा मापा गया संकेतकपुराना शेड्यूलरनया शेड्यूलर
मध्यिका प्रतीक्षा समय, सबसे बड़ा H100 क्लस्टर5 मिनट24 सेकंड
डिबगिंग कार्यभारों का p90 प्रतीक्षा समय2 घंटे30 सेकंड
30 दिनों में उपलब्ध कराए गए देय GPU घंटे—98 %

मानवीय हस्तक्षेप की ज़रूरत वाली मरम्मतों में 74 % की कमी आई है। Ai2 कुछ सीमाएँ स्वीकार करता है, जैसे इंटरैक्टिव सत्र जिन्हें 8 घंटे बाद रोका जा सकता है, जबकि पहले वे एक हफ़्ते तक चल सकते थे, और उसने कोई कोड प्रकाशित नहीं किया है।

🔗 Ai2 का लेख


निर्णय मॉडल : Decision Bench पर pplx-decider-v1.1-27b सबसे आगे, नौ अन्य मॉडलों के साथ सांख्यिकीय बराबरी पर

9 अक्टूबर — 6 और 8 अक्टूबर को प्रस्तुत किए जा चुके Perplexity के निर्णय मॉडल को एक बाहरी मूल्यांकन का परिणाम मिला है। Atlan Frontier Labs के ओपन सोर्स बेंचमार्क Decision Bench (सीमित विकल्पों वाले 1 071 प्रश्न, 36 डेटासेट, रैंक किए गए 15 मॉडल) पर pplx-decider-v1.1-27b ने सर्वोच्च मूल स्कोर, 94,5 %, हासिल किया है, और इसकी लागत सबसे कम है, प्रति 1 000 निर्णय 0,017 डॉलर। हालाँकि, साइट उन मॉडलों को एक ही रैंक देती है जिनके 95 % विश्वास अंतराल आपस में ओवरलैप करते हैं : दस मॉडल पहला स्थान साझा करते हैं।

Decision Bench पर मूल्यांकित मॉडलमापी गई सटीकता1 000 पंक्तियों की लागत
pplx-decider-v1.1-27b94,5 %0,017 डॉलर
DeepSeek V4.1 Flash94,2 %0,683 डॉलर
Gemini 3.5 Flash94,2 %3,32 डॉलर
Jev 1.1393,8 %0,044 डॉलर

Perplexity ने एक नेविगेशन एजेंट की व्यावहारिक मार्गदर्शिका (cookbook) भी प्रकाशित की है, जिसमें क्लिक करने का निर्णय हमेशा कोड लेता है, मॉडल कभी नहीं, और API में v1.1 ने v1 की जगह ले ली है।

🔗 @perplexitydevs की पोस्ट-शृंखला · Decision Bench की रैंकिंग


Grok Bot को अपना ईमेल पता मिला

9 अक्टूबर — SpaceXAI के एजेंट Grok Bot के पास अब अपना ईमेल पता है। Bot इसका इस्तेमाल सेवाओं में पंजीकरण करने, उपयोगकर्ता की ओर से कंपनियों से संपर्क करने या किसी के साथ मिलने का समय तय करने के लिए कर सकता है। यह सुविधा उसी दिन जारी की गई है : Bot से एक पता माँगना या X पर @bot का उल्लेख करना पर्याप्त है, और टीम में पहले किसी प्रशासक को इसे सक्रिय करना होगा।

घोषणा @bot खाते की एक पोस्ट-शृंखला तक सीमित है, जिसे @grok ने साझा किया है, और x.ai पर कोई लेख नहीं है। इसमें पतों का प्रारूप, उनका डोमेन या शामिल सदस्यता योजनाएँ स्पष्ट नहीं की गई हैं। सितंबर के अंत में Team Bots को अपना Slack पहचानकर्ता मिलने के बाद, एजेंट को अब बाहर काम करने के लिए अपनी पहचान मिलती है।

🔗 Grok Bot की घोषणा


ElevenLabs ने सिंगापुर में अपना दक्षिण-पूर्व एशिया का केंद्र खोला

8 अक्टूबर — ElevenLabs ने सिंगापुर में अपनी मौजूदगी की आधिकारिक घोषणा की है, जहाँ कंपनी दक्षिण-पूर्व एशिया और व्यापक तौर पर एशिया-प्रशांत क्षेत्र के केंद्र के रूप में काम करने के लिए कार्यालय खोल रही है। लेख में पहले से उपलब्ध बुनियादी ढाँचे पर ज़ोर दिया गया है : जुलाई से कंपनियाँ सिंगापुर में अपना डेटा होस्ट कर सकती हैं, डेटा न सहेजने के विकल्पों और क्षेत्र में कम विलंबता के साथ।

ElevenLabs मुख्य रूप से अपने क्षेत्रीय ग्राहकों का उल्लेख करता है : Funding Societies, जो पाँच बाज़ारों में संवादात्मक IA के ज़रिए संभावित ग्राहकों की पात्रता जाँचता है, मलेशिया का Boost Bank, फ़िलीपींस का Salmon Group, इंडोनेशिया का MNC Group, या Rezonate, एक स्वास्थ्य प्लेटफ़ॉर्म जिसका इस्तेमाल सिंगापुर के 60 % सार्वजनिक अस्पताल करते हैं। कर्मचारियों की संख्या नहीं बताई गई है। यह कार्यालय सितंबर के अंत में ब्रसेल्स और अक्टूबर की शुरुआत में एम्स्टर्डम में खोले गए कार्यालयों के बाद खुला है।

🔗 ElevenLabs का लेख


संक्षिप्त समाचार

  • Claude Code में Projects — Anthropic ने प्रतीक्षा सूची में शामिल सभी Pro और Max ग्राहकों को प्रवेश दे दिया है। Projects अभी बीटा में है: सूची खुली है, क्षमता के अनुसार और लोगों को प्रवेश मिलेगा, और दस्तावेज़ों के अनुसार यह सुविधा अभी Team और Enterprise पर उपलब्ध नहीं है। 🔗 स्रोत
  • एजेंट स्वचालन की मार्गदर्शिका — claude.dev की एक मार्गदर्शिका Claude Managed Agents पर बने एक संदर्भ कार्यान्वयन का वर्णन करती है, जो निर्धारित समय पर Slack चैनल और GitHub की पुल रिक्वेस्ट पढ़ता है और फिर Slack में सारांश प्रकाशित करता है। इसमें उसके छह घटकों और सामान्य विफलताओं से बचने के उपायों का विवरण है, जैसे किसी अपठनीय स्रोत को कम गतिविधि वाले दिन का संकेत न मानना या खर्च की सीमा सामान्य निष्पादन की लागत से 3 से 5 गुना तय करना। 🔗 स्रोत
  • Block और Claude Fable — Anthropic द्वारा प्रकाशित एक साक्षात्कार में Block बताता है कि Claude Fable उसके बड़े कोड माइग्रेशन की योजना बनाता है और दर्जनों Opus या Sonnet मॉडल का संचालन करता है, यहाँ तक कि एक ही माइग्रेशन में एक हज़ार तक पुल रिक्वेस्ट मर्ज करता है; मर्ज और उत्पादन में तैनाती का अधिकार मनुष्यों के पास रहता है, और तैनाती के लिए दोहरी मंज़ूरी आवश्यक होती है। 🔗 स्रोत
  • Claude Enterprise की Compliance API — इसके संवाद संबंधी समापन बिंदु (एंडपॉइंट्स) अब बीटा में मौजूदा कुंजी के साथ एकीकृत Claude अनुभव के संवाद भी लौटाते हैं: क्लाउड सत्र में आगे जारी किया गया संवाद एक ही संवाद के रूप में लौटता है, जिसमें Claude का काम tool_use और tool_result ब्लॉक में होता है। 🔗 स्रोत
  • Codex CLI 0.162.1 — 0.162.0 का यह सुधार कई पंक्तियों वाले असिंक्रोनस प्रश्नों पर TUI के क्रैश होने और पहले से चल रहे पृष्ठभूमि सर्वर की सुविधा सेटिंग CLI से अलग होने पर शुरू होने में आने वाली विफलताओं को दूर करता है। 🔗 स्रोत
  • ChatGPT Enterprise और Edu में भूमिका के अनुसार प्लगइन — भूमिका आधारित पहुँच नियंत्रण (RBAC) सक्रिय होने पर मालिक और प्रशासक हर भूमिका के लिए प्लगइन की पहुँच तय करते हैं: कार्यक्षेत्र के लिए Available, Install या Disabled, और किसी कस्टम भूमिका को वही सेटिंग विरासत में देने के लिए Default। 🔗 स्रोत
  • Sophos और OpenAI Daybreak — साइबर सुरक्षा कंपनी के अनुसार, Daybreak से बनाए गए उसके एजेंट जिन मामलों को संभालते हैं, उनमें औसत प्रतिक्रिया समय लगभग 38 मिनट से घटाकर लगभग 89 सेकंड कर देते हैं, और उसके 52 % MDR मामले शुरू से अंत तक एआई द्वारा सुलझाए जाते हैं; विनाशकारी कार्रवाइयाँ मानव निगरानी में रहती हैं। 🔗 स्रोत
  • Asana और StackAI का ब्राउज़िंग एजेंट — Asana के अनुसार, Codex में GPT-6 Astra ने लगभग एक सप्ताह में इस एजेंट को अनुकूलित किया: GPT-6.1 Sol पर एक परीक्षण निष्पादन की लागत 0,47 डॉलर है और इसमें लगभग चार मिनट लगते हैं, यानी मूल उत्पादन कॉन्फ़िगरेशन की तुलना में यह 76 गुना सस्ता और 5 गुना तेज़ है। 🔗 स्रोत
  • LegalOn और Codex — LegalOn Technologies का कहना है कि उसने असीमित तेज़ मोड वाले GPT-5.5 से हटकर काम को GPT-6 Luna, GPT-6.1 Sol और GPT-6 Astra में बाँटने, माँग पर तेज़ मोड इस्तेमाल करने और हर विभाग व व्यक्ति के लिए सीमा तय करने से Codex की अपनी अनुमानित दैनिक लागत लगभग 65 % घटाई है। 🔗 स्रोत
  • Gemini CLI v0.64.0-preview.1 — यह पूर्वावलोकन हानिरहित शेल कमांड पर Untrusted Command Flags Detected चेतावनी के ग़लत संकेतों को रोकता है: केवल पढ़ने वाले विकल्पों को छूट मिलती है, शेल वेरिएबल सुरक्षित रहते हैं, और जब हर उपकमांड के लिए ALLOW नियम हो तो लूप की अनुमति होती है। 9 अक्टूबर को कोई रात्रिकालीन संस्करण जारी नहीं हुआ, और स्थिर संस्करण अभी v0.63.0 है। 🔗 स्रोत
  • Antigravity 2.22.0 — प्लगइन पार्श्व पैनल में अपना इंटरफ़ेस दिखा सकते हैं (UI Extensions), संवादों को खींचकर पार्श्व पट्टी के एक अनुभाग से दूसरे में रखा जा सकता है, और समयचिह्नों में महीने का नाम दिखता है। 🔗 स्रोत
  • Gemini 3.7 Flash को अप्रचलित घोषित किया गया — Gemini API में gemini-3.7-flash के कॉल gemini-3.8-flash पर भेजे जाते हैं, और पुराने एजेंट deep-research-pro-preview-12-2025 को 23 अक्टूबर को बंद कर दिया जाएगा; उसके स्थान पर deep-research-preview-04-2026 या deep-research-max-preview-04-2026 का उपयोग होगा। 🔗 स्रोत
  • Google Flow Music के लिए VST3 और AU प्लगइन — 6 अक्टूबर की छूटी हुई ख़बर: प्राकृतिक भाषा से बनाए गए वाद्ययंत्र और प्रभाव, जिन्हें Spaces कहा जाता है, डिजिटल ऑडियो कार्यस्थानों (डिजिटल ऑडियो वर्कस्टेशन) के लिए प्लगइन के रूप में निर्यात किए जा सकते हैं, जैसे निर्माता ख्रिस रिडिक-टाइन्स का No Chaser प्लगइन। 🔗 स्रोत
  • Google Earth AI और सार्वजनिक स्वास्थ्य — 6 अक्टूबर की छूटी हुई ख़बर: कांगो लोकतांत्रिक गणराज्य में इबोला की महामारी के दौरान भूस्थानिक तर्क एजेंट के एक प्रोटोटाइप ने विश्व स्वास्थ्य संगठन के अफ़्रीका कार्यालय को कुछ ही मिनटों में 48 प्रभावित होने की आशंका वाले इलाक़े और जोखिम में पड़े 45 500 से अधिक लोगों की पहचान करने में मदद की; PDFM मॉडल हैज़े के जोखिम वाले क्षेत्रों को भी 8 सप्ताह पहले तक पहचान सकता है। 🔗 स्रोत
  • Copilot code review की बिलिंग — यदि AI Credits का सशुल्क उपयोग सक्रिय है, तो संगठन के मालिक लाइसेंसधारी सदस्यों द्वारा माँगी गई समीक्षाओं का खर्च उनके कोटे से काटने के बजाय रिपॉज़िटरी के मालिक संगठन पर डाल सकते हैं, और समीक्षा शुरू करने का अधिकार केवल संगठन या उद्यम द्वारा दिए गए लाइसेंसों तक सीमित कर सकते हैं। 🔗 स्रोत
  • Copilot CLI 1.0.95 — अब स्थिर संस्करण के रूप में उपलब्ध यह CLI macOS पर Microsoft Entra के मूल ब्रोकर के ज़रिए प्रमाणीकरण करती है, और आवश्यकता पड़ने पर ब्राउज़र का उपयोग करती है; पूर्वावलोकन 1.0.96-0 समयरेखा में बताता है कि हर अनुमति का फ़ैसला किसने किया: उपयोगकर्ता, Assisted Permissions, कोई नीति या बिना निगरानी वाला वैकल्पिक व्यवहार। 🔗 स्रोत
  • GitHub MCP Server 2.0 — 6 अक्टूबर की छूटी हुई ख़बर: GitHub का आधिकारिक MCP सर्वर Code Mode या Programmatic Tool Calling में काम करने वाले एजेंटों के लिए प्रकार निर्धारित आउटपुट लौटाता है, जिनका वर्णन आउटपुट स्कीमा (आउटपुट स्कीमा) में होता है; इनकी उपलब्धता केवल MCP 2026-07-28 या बाद के विनिर्देश का उपयोग करने वाले क्लाइंट को बताई जाती है। 🔗 स्रोत
  • Genspark में Claude Haiku 5.5 — Genspark ने AI Chat, Code Agent और Claw में यह मॉडल उपलब्ध कराया है और Anthropic का यह दावा दोहराया है कि इसे चलाने की लागत Haiku 4.5 से लगभग 75 % कम है; इसके लिए कोई अलग योजना या दर नहीं है। 🔗 स्रोत
  • v0 के लिए Meta VR टेम्पलेट — Meta ने Vercel के साथ Immersive Web SDK पर आधारित एक v0 टेम्पलेट प्रकाशित किया है: आप किसी अनुभव का वर्णन करते हैं, v0 उसका कोड बनाता है और पूर्वावलोकन दिखाता है, और एक क्लिक से उसे Vercel पर तैनात करके Quest के ब्राउज़र में खोला जा सकता है; वसंत 2027 में आने वाले Meta VR Glasses के दृष्टि और हाथ संबंधी इनपुट का समर्थन पहले से मौजूद है। 🔗 स्रोत
  • v0 for teams — v0 ने वीडियो में साथियों का काम देखने, उनके संवादों में शामिल होने और मिलकर निर्माण करने का यह तरीका प्रस्तुत किया है; ट्वीट में सितंबर से चरणबद्ध ढंग से आई सुविधाओं को प्रमुखता दी गई है, किसी नई दर की घोषणा नहीं हुई है। 🔗 स्रोत
  • DeepSeek Harness 0.2.1-alpha.2 — यह 26वाँ पूर्वावलोकन है और अभी भी कोई स्थिर संस्करण नहीं है: प्लगइन सूची माँग पर Claude Code और Codex पैकेज स्थापित करती है, दो प्रयोगात्मक प्लगइन आए हैं (Git Worktrees, तर्क का अनुवाद), और वैश्विक निर्देश साझा AGENTS.md से लिए जा सकते हैं। 🔗 स्रोत
  • OGX 1.5.0 — पूर्व Llama Stack, जिसका अप्रैल में नाम बदला गया और जिसे meta-llama संगठन से बाहर ले जाया गया, अब DeepSeek और Fireworks AI के लिए /v1/messages API का मूल पासथ्रू, Text-Embeddings-Inference प्रदाता, Exa और Serply वेब खोज तथा MCP 2.x क्लाइंट जोड़ता है; इसमें चार ऐसे बदलाव हैं जो पिछली संगतता तोड़ते हैं। 🔗 स्रोत
  • GenIA — Meta ने बिना घोषणा के, गैर-वाणिज्यिक CC BY-NC 4.0 लाइसेंस के तहत, Tübingen AI Center के साथ किए गए इस काम का कोड ऑनलाइन प्रकाशित किया है: यह एक छवि, कुछ दृश्यों या वीडियो से 3D वस्तुओं का पुनर्निर्माण करता है और इन्फ़रेंस के समय SAM 3D Objects के स्थिर पूर्वज्ञान को अनुरूप बनाता है, बिना दोबारा प्रशिक्षण के। 🔗 स्रोत
  • Hub पर decision-model लेबल — Hugging Face ने निर्णय मॉडलों को अपना अलग लेबल दिया है, साथ ही Models पृष्ठ पर एक आइकन और फ़िल्टर भी; निर्णय संबंधी GGUF को उनके llama.cpp मेटाडेटा के आधार पर अपने आप लेबल किया जाता है। 🔗 स्रोत
  • Darwin-27B-ZTC-v2 — VIDRAFT ने घोषणा की है कि Apache-2.0 के तहत उपलब्ध उसके मूल्यांकनकर्ता का नया संस्करण System One Mosaic Benchmark (137 परीक्षण समूह) में 89,58 के Borda स्कोर के साथ शीर्ष पर पहुँच गया है, जबकि OpenJev-27B का स्कोर 87,50 और Jev 1.13 का 85,05 है; यह रैंकिंग उसके लेखकों द्वारा घोषित की गई है, जो इसे सार्वजनिक तालिका की एक समय विशेष की झलक बताते हैं। 🔗 स्रोत
  • निर्णय मॉडलों का विश्वास स्तर — स्टीफ़न सोल्का एक सामुदायिक लेख में दिखाते हैं कि OpenRouter के ज़रिए पूछे जाने पर GPT-6 Luna Decisions, SHA-256 की 600 जाँचों में « मेल नहीं खाता » उत्तर देता है, जिससे उसकी सटीकता 50 % और औसत विश्वास स्तर 99,8 % रहता है; कारणात्मक तर्क में 99 % की सीमा चुनने पर 49 उत्तरों में से 47 सही मिलते हैं, लेकिन इसमें केवल 8,2 % मामले आते हैं। 🔗 स्रोत
  • सुदृढीकरण अधिगम परिवेशों में openai-math — FineEnvs ने openai/math प्रकाशन के Lean में औपचारिक रूप दिए गए 405 परिणामों में से 369 को Harbor परिवेशों में रूपांतरित किया है: एजेंट को Lean 4 के सैंडबॉक्स में एक प्रमेय सिद्ध करना होता है, और Comparator केवल उसी सटीक कथन के पूर्ण प्रमाण पर पुरस्कार देता है; यह प्रयोगात्मक संग्रह Apache-2.0 के तहत उपलब्ध है। 🔗 स्रोत
  • JOSIE-2 — गोकदेनिज़ ग्युलमेज़ ने 2B, 4B और 9B वाले इस मॉडल परिवार की तकनीकी रिपोर्ट प्रकाशित की है, जिसे Qwen3.5 से आगे दो Mac M4 पर लगभग 3 000 चुने हुए उदाहरणों के साथ प्रशिक्षण दिया गया है: तर्क मोड में JOSIE-2-4B, ARC-Challenge पर 95,5 (+12,1) और TruthfulQA पर 69,2 (+20,3) तक पहुँचता है; मूल्यांकन केवल दो परीक्षण समूहों पर किया गया है। 🔗 स्रोत
  • Gradio 6.30 — gr.Workflow में अनुप्रयोग दृश्य जुड़ा है, और Run this node कमांड पूरे उपग्राफ़ को दोबारा चलाने के बजाय पहले के नोडों के अभी भी अद्यतन परिणामों का पुनः उपयोग करती है; gr.ImageEditor लोड की गई छवियों के अल्फ़ा चैनल को सुरक्षित रखता है। 🔗 स्रोत
  • tokenizers 0.23.3 — केवल Python पैकेज का यह सुधार huggingface_hub v2 को स्वीकार करता है, जिससे रिलीज़ विवरण के अनुसार Transformers की स्थापना में आई बाधा दूर होती है, और ट्रंकेशन से संबंधित 0.23.1 के संगतता तोड़ने वाले बदलाव को वापस लेता है। 🔗 स्रोत
  • एआई द्वारा वैज्ञानिक समीक्षा — Sakana AI ने TMLR में स्वीकृत एक शोधपत्र प्रस्तुत किया है: एक परीक्षण समूह लेखों में विरोधाभासी दावे जोड़कर जाँचता है कि एआई समीक्षक उन्हें पहचानते हैं या नहीं, और Sakana AI की घोषणा के अनुसार उसका Multi-Layered Review तंत्र अन्य परीक्षण किए गए तंत्रों की तुलना में अधिक विरोधाभास पहचानता है; घोषणा में कोई आँकड़ा नहीं दिया गया है। 🔗 स्रोत
  • Suno Studio — क्लिप पहले बीट के साथ बेहतर तालमेल बैठाते हैं और प्रोजेक्ट की गति के अनुसार खिंचते हैं, फ़ेड अब घातांकीय या लघुगणकीय हो सकते हैं, और सिंथेसाइज़र, कीबोर्ड तथा प्लगइन दृश्य अलग करके दूसरे स्क्रीन तक ले जाए जा सकते हैं; Studio, Premier सदस्यता में शामिल है। 🔗 स्रोत
  • World Models’ Last Exam in Physics — वीडियो मॉडलों के लिए Einsia की इस भौतिकी परीक्षा (40 कार्य, 9 श्रेणियाँ, आठ मॉडल) में Seedance 2.5, 100 में से 57,76 अंकों के साथ पहले स्थान पर है, उसके बाद MiniMax H3 (54,89), जिसे MiniMax सबसे अच्छा खुला मॉडल बताता है, और NVIDIA का Cosmos 3 Super (42,46) हैं; यह तीसरे पक्ष का बेंचमार्क है। 🔗 स्रोत
  • एजेंटों द्वारा बनाए गए Omniverse सिमुलेशन — NVIDIA का ब्लॉग कंपनी की उन टीमों को दिखाता है जो GPT-6 Astra से, और एक मामले में Claude Fable 5 से, ovphysx, ovstage, ovrtx और ovui लाइब्रेरी का उपयोग करके सिमुलेशन बनवाती हैं। इनमें लगभग तीन दिनों में बनाए गए या सुधारे गए डिजिटल जुड़वाँ भी शामिल हैं; कोई नया उत्पाद नहीं आया है। 🔗 स्रोत
  • Shopify दुकान का प्रबंधन — दुकान जुड़ जाने के बाद Grok Bot ऑर्डर जाँच सकता है, स्टॉक पर नज़र रख सकता है और उत्पाद विवरण अद्यतन रख सकता है; किसी योजना या सीमा का उल्लेख नहीं है। 🔗 स्रोत
  • X पर खोज — 7 अक्टूबर की छूटी हुई ख़बर: Grok Bot सभी उपयोगकर्ताओं के लिए X पर खोज, पढ़ने और निगरानी का काम कर सकता है, बिना X कनेक्टर कॉन्फ़िगर किए; उदाहरण के लिए किसी उत्पाद पर प्रतिक्रियाएँ देखने या अपने क्षेत्र का साप्ताहिक सारांश पाने के लिए। अगस्त के अंत में अभी भी अपना खाता जोड़ना आवश्यक था। 🔗 स्रोत
  • Grokipedia v0.3 — इसके आधिकारिक खाते के अनुसार, Grok द्वारा लिखे गए इस विश्वकोश ने एक सप्ताह में पाठकों द्वारा माँगे गए 4 400 से अधिक लेख प्रकाशित किए हैं और प्रतिदिन 2 200 से अधिक बदलाव किए हैं, जिसमें हर नए लेख के लिए औसतन 78 स्रोत हैं; अब एक पृष्ठ इसके बदलावों को तत्काल दिखाता है। 🔗 स्रोत
  • mistral CLI 0.8.0 — mistral apps deploy अब वर्कफ़्लो वर्कर और सभी मॉड्यूल को एक साथ तैनात करता है, जिसमें केवल एक API कुंजी के साथ निरंतर एकीकरण में तैनाती भी शामिल है, और mistral apps dev Docker में स्थानीय Postgres डेटाबेस शुरू करता है; इसके साथ ही वर्तमान डायरेक्टरी का .env अब नहीं पढ़ा जाता। 🔗 स्रोत
  • Mistral का Python SDK 3.2.0 — चैट और एजेंट कॉल अब उत्तर और प्रॉम्प्ट दोनों के लिए लघुगणकीय प्रायिकताएँ (लॉगप्रॉब्स), साथ ही top_k, दोहराव पर दंड और टोकन की न्यूनतम संख्या स्वीकार करते हैं; यह अपने आप तैयार किया गया संस्करण है, जिसकी कोई घोषणा नहीं हुई है। 🔗 स्रोत
  • Qwen Code v0.25.1-preview.1 — तीन दिनों में v0.25.1 का दूसरा पूर्वावलोकन, जिसमें 16 नई सुविधाएँ और 27 नए सुधार हैं। इनमें सत्र पर केंद्रित बहु-एजेंट सहयोग और PreToolUse हुक शामिल हैं, जो पूर्ण पुनः सत्यापन के साथ किसी टूल के इनपुट को बदलते हैं; स्थिर संस्करण अभी जारी नहीं हुआ है। 🔗 स्रोत
  • Perplexity की Agent API में Claude Haiku 5.5 — 7 अक्टूबर की छूटी हुई ख़बर: Agent API, anthropic/claude-haiku-5-5 को Anthropic की दर पर स्वीकार करती है, जिसमें 100 000 इनपुट टोकन तक प्रति दस लाख इनपुट टोकन की लागत 0,10 डॉलर और आउटपुट की 0,50 डॉलर है; उससे अधिक पर दरें क्रमशः 0,50 और 2,50 हैं। 🔗 स्रोत
  • साझा या समर्पित इन्फ़रेंस — Embed और Rerank के लिए Cohere की एक मार्गदर्शिका बताती है कि अनुरोधों की संख्या से अधिक उनका स्वरूप मायने रखता है, और एक NVIDIA A10 GPU वाले समर्पित इंस्टेंस की तुलना में लागत बराबर पड़ने की उदाहरणात्मक सीमाएँ गणना करती है: लंबे दस्तावेज़ों के लिए लगभग 4 अनुरोध प्रति मिनट, कैटलॉग के लिए 20 और पुनः रैंकिंग (रीरैंकिंग) के लिए 29। 🔗 स्रोत
  • एजेंट या MCP — Perplexity ने एक मार्गदर्शिका प्रकाशित की है जो निर्णय लेने वाले एजेंट और उसे टूल से जोड़ने वाले MCP का अंतर बताती है। इसमें विकल्प चुनने की तालिका, ऑनलाइन दुकान का उदाहरण और चार जोखिमों के साथ उनके सुरक्षा उपाय हैं; मार्गदर्शिका के अनुसार Claude, ChatGPT या Cursor, Perplexity के MCP सर्वर के ज़रिए Computer को कोई कार्य सौंप सकते हैं। 🔗 स्रोत

इसका क्या अर्थ है

अब एक एजेंट कई अन्य एजेंटों का संचालन करता है, और हर एजेंट को अपनी पहचान मिलती है। Gemini एजेंट ऐसे उप-एजेंट शुरू करता है जिनमें से प्रत्येक की अपनी पहचान होती है, और वह अपने पते वाला सहकर्मी एजेंट भी बन सकता है; Claude Managed Agents किसी एजेंट को ऐसा प्रोग्राम लिखने देता है जो 1 000 तक एजेंट शुरू कर सके; Grok Bot को बाहरी दुनिया में कार्रवाई करने के लिए ईमेल पता मिलता है, और Block एक ही माइग्रेशन में दर्जनों मॉडलों का नेतृत्व Claude Fable को सौंपता है। अब उभरता सवाल यह नहीं है कि एजेंट काम कर सकता है या नहीं, बल्कि यह है कि उसे नियंत्रण में कैसे रखा जाए। Google इसका जवाब Agent Gateway, Agent Sandbox, प्रत्येक एजेंट के नाम से ऑडिट लॉग और वास्तविक समय में खर्च की सीमाओं के ज़रिए देता है; Anthropic सत्र के लिए ऐसा बजट देता है जिसकी सीमा तक पहुँचने पर सभी निष्पादन निलंबित हो जाते हैं; OpenAI ऐसा Windows सैंडबॉक्स देता है जिसमें नेटवर्क और फ़ाइलों पर अधिक सख्त पाबंदियाँ हैं।

प्लेटफ़ॉर्म भी अब कई मॉडलों का इस्तेमाल अपना रहे हैं। Gemini विकसित करने वाला Google अपने ही एजेंट से Claude मॉडलों का संचालन करवाता है, मॉडल के चुनाव को एजेंट के चुनाव से स्पष्ट रूप से अलग रखता है, और Antigravity में Claude Opus 5.5 तथा Sonnet 5.5 उपलब्ध कराता है, जिनका शुल्क उसके अपने मॉडलों वाली खर्च सीमा में ही गिना जाता है। Genspark और Perplexity का Agent API, Claude Haiku 5.5 के लॉन्च होने के कुछ ही दिनों के भीतर उसे जोड़ते हैं, LegalOn अपने कोड संबंधी काम को कार्यों की प्रकृति के अनुसार OpenAI के तीन मॉडलों में बाँटता है, और Block मॉडल चुनने की स्वचालित प्रणाली बना रहा है।

प्रति इकाई लागत लगातार घट रही है, और हर घोषणा इसे आँकड़ों में बताती है: Qwen-Image-2.1-Turbo के लिए प्रति चित्र 0,016 डॉलर, जो Pro संस्करण से 2,5 गुना कम है; HeyGen Voice के लिए 31 अक्टूबर तक प्रति दस लाख वर्ण 15 डॉलर, फिर 30 डॉलर, जो Eleven v4 Turbo से कम है; pplx-decider-v1.1-27b के लिए प्रति 1 000 निर्णय 0,017 डॉलर; ML Intern के साथ लगभग 103 डॉलर की कंप्यूटिंग लागत में Hub पर प्रकाशित छह मॉडल। हालाँकि, शीर्ष स्थानों को ध्यान से समझना ज़रूरी है: HeyGen Voice केवल नियंत्रित आवाज़ों वाली रैंकिंग में पहले स्थान पर है, और pplx-decider अपना स्थान नौ अन्य मॉडलों के साथ साझा करता है, जिनके विश्वास अंतराल आपस में अतिव्यापित होते हैं।

स्वास्थ्य के क्षेत्र में सावधानी अब भी ज़रूरी है। The Lancet में प्रकाशित AMIE का अध्ययन व्यवहार्यता का अध्ययन है, जो एक ही केंद्र पर, नियंत्रण समूह के बिना किया गया और जिसे Alphabet ने वित्तपोषित किया: 98 मरीज़, सुरक्षा के कारण एक भी बातचीत नहीं रोकी गई, काल्पनिक जानकारी देने की एक घटना दर्ज हुई। यह व्यापक परीक्षणों की दिशा में एक कदम है, जिनकी माँग स्वयं लेखक भी करते हैं; यह न तो स्वीकृति है और न ही मरीज़ों के लिए तैनाती।


स्रोत