ai-powered-markdown-translatorgpt-6.1-sol का उपयोग करके फ़्रेंच से हिंदी में अनुवादित लेख।
Google Cloud ने 8 अक्टूबर को Gemini at Work 2026 में Gemini एजेंट पेश किया: उद्यमों के सभी कामों के लिए एक ही एजेंट, जो क्लाउड में लगातार चलता है और Gemini तथा Claude, दोनों के मॉडलों का संचालन करता है। दूसरी ओर, HeyGen ने अपना पहला आंतरिक रूप से विकसित वॉइस मॉडल HeyGen Voice जारी किया, जो Artificial Analysis की Controlled Voice रैंकिंग में शीर्ष पर पहुँच गया है, जबकि Anthropic ने Claude Managed Agents में ऐसे वर्कफ़्लो उपलब्ध कराए हैं जो प्रति रन 1 000 तक एजेंट शुरू कर सकते हैं। कोडिंग के क्षेत्र में, Codex उपयोगकर्ता के अगले संदेश का अनुमान लगाना सीख रहा है और Windows पर Microsoft Execution Containers पर आधारित एक नया सैंडबॉक्स अपना रहा है।
Google Cloud ने Gemini एजेंट पेश किया, सभी कामों के लिए एक ही एजेंट
8 अक्टूबर — Gemini at Work 2026 में Google Cloud ने Gemini एजेंट पेश किया, जिसे वह काम के लिए एक एकल और सार्वभौमिक एजेंट बताता है। एक ही इनपुट क्षेत्र और एक ही API से यह सवालों के जवाब देता है, बौद्धिक कार्य संभालता है, चित्र और मीडिया बनाता है, तथा कोड लिखता और चलाता है। Google Cloud के मुख्य कार्यकारी अधिकारी थॉमस कुरियन का विचार है: उसे निर्देशों की एक श्रृंखला देने के बजाय एक लक्ष्य सौंपा जाए।
यह एजेंट एक ही स्मृति के साथ क्लाउड में लगातार चलता है और हर जगह उपलब्ध है: वेब, iOS, Android, Windows, Mac, कमांड लाइन, Google Workspace, Microsoft 365 और Slack में, या तीसरे पक्ष के अनुप्रयोगों में बिना इंटरफ़ेस (headless) के। कई घंटों या कई दिनों का कार्य कंप्यूटर बंद होने पर भी जारी रहता है। लंबे कामों के लिए यह अस्थायी उप-एजेंट बनाता है, जिनमें से हर एक की अपनी पहचान होती है, और यह स्थायी भूमिका वाला सहकर्मी एजेंट (coworker agent) भी बन सकता है, जिसका अपना @agents.company.com पता और भंडारण होता है। मॉडल का चयन एक अलग विकल्प बन जाता है: Google के अनुसार, एजेंट पहले से ही Gemini और Anthropic के Claude मॉडलों का संचालन करता है, और आगे अन्य निजी और खुले मॉडल भी जुड़ेंगे। वित्त और कानूनी क्षेत्रों के लिए विशेष संस्करण पूर्वावलोकन में आ रहे हैं; वित्त संस्करण में 50 से अधिक मूल कौशल हैं, जिनका उपयोग CME Group और Deutsche Bank पहले से कर रहे हैं।
| घोषित नियंत्रण घटक | Google द्वारा बताई गई भूमिका |
|---|---|
| हर एजेंट की पहचान | क्रिप्टोग्राफ़ी से प्रमाणित पहचान, भूमिका के अनुसार अनुमतियाँ, उसके नाम पर ऑडिट लॉग |
| Agent Sandbox | अलग-थलग निष्पादन, अपनी नेटवर्क सीमा के साथ |
| Agent Gateway | एआई के लिए नेटवर्क फ़ायरवॉल, जिससे एजेंट का पूरा ट्रैफ़िक गुजरता है |
| वास्तविक समय में खर्च की सीमाएँ | Cloud Billing में परियोजना का एजेंट रुक जाता है, एक क्लिक से फिर शुरू किया जा सकता है |
Google Cloud अपने आँकड़े भी प्रस्तुत करता है: करीब 500 ग्राहकों में से हर एक ने एक वर्ष में 1 000 अरब से अधिक टोकन संसाधित किए हैं, और Fortune 100 की करीब 90 % कंपनियाँ Gemini Enterprise का उपयोग करती हैं। हालाँकि, ब्लॉग पोस्ट में एजेंट की उपलब्धता की तारीख या उसकी कीमत नहीं दी गई है; Google Cloud केवल उन बड़े ग्राहकों का उल्लेख करता है जिन्होंने इसे पहले से आज़माया है, जैसे मॉडल के गतिशील चयन के लिए खेल ब्रांड On।
🔗 Gemini at Work 2026 (Google Cloud का ब्लॉग)
Gemini Enterprise ने Antigravity उपकरणों के लिए Claude Opus 5.5 और Claude Sonnet 5.5 उपलब्ध कराए
8 अक्टूबर — उसी दिन, Gemini Enterprise के संस्करण नोट्स के अनुसार व्यवस्थापक Antigravity 2.0, Antigravity CLI और IDE के लिए Antigravity एक्सटेंशन में Claude Opus 5.5 और Claude Sonnet 5.5 सक्रिय कर सकते हैं। व्यवस्थापक अलग Anthropic खाते के बिना, सीधे Google Cloud कंसोल में उनकी उपयोग की शर्तें स्वीकार करता है।
| सक्रियण संबंधी सेटिंग | Google द्वारा दिया गया मान |
|---|---|
| डिफ़ॉल्ट स्थिति | तीसरे पक्ष के मॉडल निष्क्रिय, व्यवस्थापकों द्वारा सक्रियण |
| बिलिंग का तरीका | उपयोग के अनुसार, परियोजना की खर्च सीमा के भीतर |
| अनुमान के स्थान | global, us और eu |
| विचार के स्तर | Low, Medium (डिफ़ॉल्ट), High या Max |
डेवलपर अपना Gemini Enterprise लाइसेंस बनाए रखता है और मॉडल चयनकर्ता में Claude चुनता है। तीसरे पक्ष का मॉडल उपलब्ध कराने से पहले सीमा से अधिक उपयोग (overages) सक्रिय करना आवश्यक है, और उसकी लागत सभी मॉडलों की साझा खर्च सीमा में शामिल होती है। यही पृष्ठ सिंगापुर में Gemini 3.8 Flash की सामान्य उपलब्धता की भी घोषणा करता है।
🔗 Gemini Enterprise के संस्करण नोट्स
आवाज़: Controlled Voice रैंकिंग में HeyGen Voice शीर्ष पर, Mistral ने अरबी के लिए दो मॉडल जारी किए
9 अक्टूबर — HeyGen ने HeyGen Voice पेश किया, जिसे जोशुआ शू कंपनी का पहला आंतरिक रूप से विकसित वॉइस मॉडल बताते हैं; कंपनी अब तक अपने अवतारों के लिए जानी जाती थी। मॉडल HeyGen में और API के माध्यम से उपलब्ध है, जिसकी कीमत प्रति दस लाख अक्षरों पर 30 डॉलर है; 31 अक्टूबर तक API उपयोगकर्ता 15 डॉलर चुकाते हैं और छूट अपने आप लागू होती है।
इस दावे का आधार Artificial Analysis के परिणाम हैं, जिन्हें उसने HeyGen से डेढ़ मिनट पहले प्रकाशित किया था। उसकी Controlled Voice रैंकिंग में, जहाँ सभी मॉडल अमेरिकी और ब्रिटिश अंग्रेज़ी में उन्हीं 8 क्लोन की गई आवाज़ों के साथ बोलते हैं, HeyGen Voice ने 1 468 प्रस्तुतियों में 1 201 के Elo के साथ पहला स्थान हासिल किया है। इसमें वह सहायक और ग्राहक सेवा श्रेणियों में, तथा ब्रिटिश अंग्रेज़ी में भी पहले स्थान पर है।
HeyGen Voice takes the #1 spot on the Artificial Analysis Controlled Voice TTS Arena Leaderboard, ahead of Alibaba’s Qwen-Audio-3.1-TTS-Plus and ElevenLabs’ Eleven v4 Turbo
🇮🇳 HeyGen Voice ने Artificial Analysis की Controlled Voice TTS Arena रैंकिंग में Alibaba के Qwen-Audio-3.1-TTS-Plus और ElevenLabs के Eleven v4 Turbo को पीछे छोड़कर पहला स्थान हासिल किया है। — X पर @ArtificialAnlys
| मूल्यांकित मॉडल | Controlled Voice Elo (9 अक्टूबर) | प्रति दस लाख अक्षरों पर API की कीमत |
|---|---|---|
| HeyGen Voice | 1 201 | 30 डॉलर (31 अक्टूबर तक 15) |
| Qwen-Audio-3.1-TTS-Plus | 1 182 | 19,3 डॉलर |
| Eleven v4 Turbo | 1 166 | 40 डॉलर |
| Eleven v4 | 1 162 | 80 डॉलर |
इस पहले स्थान का दायरा स्पष्ट है: यह आवाज़ की क्लोनिंग से संबंधित है। Provider Voice रैंकिंग में, जहाँ हर प्रदाता अपनी आवाज़ों का उपयोग करता है, 9 अक्टूबर की शाम तक Eleven v4 Turbo और Eleven v4 शीर्ष पर बने हुए थे, और HeyGen Voice पहले आठ में शामिल नहीं था। उच्चारण की विश्वसनीयता में HeyGen Voice को 83,1 % मिला, यानी 29 में से 10वाँ स्थान।
API में क्लोनिंग तुरंत होती है: एक ही रिकॉर्डिंग, जिसके केवल पहले तीन मिनट इस्तेमाल होते हैं, बिना प्रशिक्षण के कुछ सेकंड में उपयोग के लिए तैयार आवाज़ देती है। आवाज़ का संश्लेषण एक साथ पूरी फ़ाइल के रूप में (44,1 kHz पर WAV फ़ाइल) या स्ट्रीम में होता है, और Artificial Analysis ने API की डिफ़ॉल्ट सेटिंग का ही मूल्यांकन किया है।
Voxtral Mini 4B Realtime Arabic और LIDstral Arabic: अरबी के लिए Mistral के दो मॉडल
8 अक्टूबर — Mistral ने बिना घोषणा किए Hugging Face पर अरबी के लिए समर्पित दो खुले मॉडल Apache 2.0 लाइसेंस के अंतर्गत उपलब्ध कराए हैं। Voxtral Mini 4B Realtime Arabic अरबी बोलियों और आधुनिक मानक अरबी का स्ट्रीम में लिप्यंतरण करता है, तब भी जब वक्ता बातचीत के बीच भाषा बदलते हैं (code-switching)। Voxtral Mini 4B Realtime से फ़ाइन-ट्यून किए गए इस मॉडल में लगभग 4,4 अरब पैरामीटर हैं। इसके विवरण के अनुसार, इसे मोरक्को के डिजिटल परिवर्तन और प्रशासनिक सुधार मंत्रालय के साथ मिलकर विकसित किया गया है। यह जनवरी 2026 में Mistral और मोरक्को के बीच हुई साझेदारी का हिस्सा है, जिसके अंतर्गत दो नए बेंचमार्क, ISMA और Darija in the Wild, भी तैयार किए गए हैं।
| प्रकाशित मॉडल | मॉडल का कार्य | विवरण के अनुसार परिणाम |
|---|---|---|
| Voxtral Mini 4B Realtime Arabic | अरबी का स्ट्रीम में लिप्यंतरण | 480 ms पर 7 बेंचमार्क में औसत अक्षर त्रुटि दर 8,82 %, जबकि Voxtral Transcribe Arabic के लिए 7,91 % |
| LIDstral Arabic | प्रोसेसर पर भाषा और बोली की पहचान, 51 वर्ग | मोरक्को की दरिजा पर F1 88,67 %, जबकि GlotLID v3 के लिए 71,28 % |
🔗 Hugging Face पर Voxtral Mini 4B Realtime Arabic · Hugging Face पर LIDstral Arabic
Claude Managed Agents: प्रति रन 1 000 तक एजेंट वाले गतिशील वर्कफ़्लो
9 अक्टूबर — Anthropic ने Claude Managed Agents के गतिशील वर्कफ़्लो (dynamic workflows) सार्वजनिक बीटा में उपलब्ध कराए हैं, जो बहु-एजेंट संचालन का एक नया प्रकार है। सत्र का नेतृत्व करने वाला एजेंट स्वयं एक प्रोग्राम लिखता है, जिसे सर्वर पृष्ठभूमि में चलाता है: वह चरणों में अनेक एजेंट शुरू करता है और फिर उनके परिणामों को जोड़ता है। multiagent_20261001 प्रकार सक्रिय होने के बाद, रन शुरू करने का निर्णय एजेंट स्वयं लेता है।
एक रन में 1 000 तक एजेंट शुरू होते हैं, जिनमें से 64 एक साथ चल सकते हैं। यह डिफ़ॉल्ट रूप से 24 घंटे सक्रिय रहता है, और एक सत्र ऐसे 10 रन खुले रख सकता है। इसके टोकन की बिलिंग सत्र के टोकन की तरह होती है और वे उसके बजट में गिने जाते हैं; Anthropic चेतावनी देता है कि उनकी संख्या बड़ी हो सकती है, और 116 000 पंक्तियों वाले कोडबेस में जानबूझकर डाले गए 70 बग पर किए गए एक आंतरिक परीक्षण का उल्लेख करता है।
| Anthropic के परीक्षण की व्यवस्था | 3 प्रयासों में मिले बग |
|---|---|
| अकेला एजेंट | 14, 15 और 27 |
| गतिशील वर्कफ़्लो | हर प्रयास में 66 |
🔗 @ClaudeDevs की घोषणा · वर्कफ़्लो रन का दस्तावेज़ीकरण
कोडिंग एजेंट: Codex के लिए संदेशों के अनुमान और MXC सैंडबॉक्स, Claude Code 2.1.296, Vibe CLI 2.26.1
Codex को एक ही दिन दो नई सुविधाएँ मिली हैं, जबकि Anthropic और Mistral ने अपने कमांड लाइन एजेंटों के नए संस्करण जारी किए हैं।
Codex उपयोगकर्ता के अगले संदेश का अनुमान लगाता है, Pro ग्राहकों के लिए बीटा में
9 अक्टूबर — OpenAI ने Codex के डेस्कटॉप अनुप्रयोग में संदेश संपादक के अनुमान (composer predictions) बीटा में उपलब्ध कराए हैं। जब Codex उत्तर देना समाप्त कर देता है, तो इनपुट क्षेत्र में अगले संदेश का सुझाव दिखाई दे सकता है। यह मौजूदा बातचीत से तैयार होता है और इसके लिए स्मृतियों या जुड़े हुए अनुप्रयोगों में खोज नहीं की जाती। Tab कुंजी इसे इनपुट क्षेत्र में डाल देती है; पाठ बदला जा सकता है और कभी अपने आप नहीं भेजा जाता। सुझाव पूरे संदेश का होता है, शब्द-दर-शब्द पूर्ति का नहीं।
| बीटा की शर्त | OpenAI द्वारा दिया गया मान |
|---|---|
| योजना और आयु | व्यक्तिगत ChatGPT Pro, 18 वर्ष और उससे अधिक |
| बातचीत और मॉडल | स्थानीय और SSH बातचीत, GPT-6 Astra या GPT-6.1 Sol के साथ |
| डिफ़ॉल्ट सेटिंग | सक्रिय, General > Composer > Show predictions में निष्क्रिय किया जा सकता है |
| बीटा के दौरान लागत | Codex की उपयोग सीमाओं से बाहर, कोई क्रेडिट खर्च नहीं होता |
भेजे गए संदेश, जिनमें स्वीकार किए गए अनुमान भी शामिल हैं, सामान्य रूप से गिने जाते हैं। यह सुविधा Chat में उपलब्ध नहीं है।
🔗 @OpenAIDevs की घोषणा · OpenAI का सहायता लेख
Windows पर Codex: Microsoft Execution Containers पर आधारित सैंडबॉक्स
9 अक्टूबर — OpenAI ने Windows पर Codex में Microsoft Execution Containers (MXC) पर आधारित सैंडबॉक्स मोड जोड़ा है, जिन्हें Microsoft ने 7 अक्टूबर को सामान्य उपलब्धता में जारी किया था। इसके लिए संगत Windows 11 उपकरण (24H2 build 26100.9278 या 25H2 build 26200.9278) आवश्यक है, और यह तेज़ सेटअप, अधिक सख्त नेटवर्क नियंत्रण तथा फ़ाइल पहुँच पर अधिक सूक्ष्म नियंत्रण का वादा करता है।
दस्तावेज़ीकरण के अनुसार, MXC अब अनुशंसित कार्यान्वयन है: यह प्रक्रियाओं को मूल रूप से अलग-थलग रखता है, बिना व्यवस्थापक द्वारा स्वीकृत कॉन्फ़िगरेशन, अतिरिक्त Windows खातों या स्थानीय फ़ायरवॉल नियमों के। elevated और unelevated मोड अब पुराने वैकल्पिक उपाय बन गए हैं। व्यक्तिगत खातों के लिए डेस्कटॉप अनुप्रयोग स्वयं MXC चुनता है; CLI या उद्यम में इसे config.toml में prefer_mxc = true से सक्रिय किया जाता है, और व्यवस्थापक allow_mxc = false से इसे रोक सकता है। दो सीमाएँ दस्तावेज़ में बताई गई हैं: प्रबंधित नेटवर्क के लिए allow_local_binding = true आवश्यक है, और बची हुई चाइल्ड प्रक्रियाएँ अग्रभूमि में चल रही कमांड समाप्त होने पर बंद हो जाती हैं।
🔗 @OpenAIDevs की घोषणा · Windows सैंडबॉक्स का दस्तावेज़ीकरण
Claude Code 2.1.296: उप-एजेंटों के लिए अलग संदर्भ संक्षेपण और वर्कफ़्लो एजेंटों के लिए एक ही मॉडल
9 अक्टूबर — Claude Code 2.1.296 में 79 प्रविष्टियाँ हैं, जिनमें 56 सुधार शामिल हैं, और इसके साथ कोई ट्वीट नहीं किया गया। यह मुख्य रूप से उप-एजेंटों पर अधिक नियंत्रण देता है।
| संस्करण की नई सुविधा | इससे क्या बदलता है |
|---|---|
autoCompactWindow (उप-एजेंट, --agents) | उप-एजेंट मुख्य बातचीत से पहले अपना संदर्भ संक्षिप्त करता है |
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODEL | एक वर्कफ़्लो के सभी एजेंट एक ही मॉडल पर चलते हैं, अन्य उप-एजेंट अपने मॉडल बनाए रखते हैं |
Read का allow_large विकल्प | संदर्भ अनुमति दे तो बड़ी पाठ फ़ाइल को एक ही कॉल में पढ़ना |
CLAUDE_CODE_OVERLOADED_RETRY_MAX_DELAY_MS | 529 त्रुटि के बाद दो पुनः प्रयासों के बीच अधिक लंबा अधिकतम विलंब |
| MCP उपकरणों के विवरण शुरुआत में ही भेजे जाते हैं | डिफ़ॉल्ट सीमा 2 048 से बढ़ाकर 4 096 अक्षर की गई |
/cost और स्थिति पंक्ति अब Sonnet 5.5 के कैश से पढ़े गए टोकन की गणना प्रति दस लाख टोकन पर 0,10 डॉलर की दर से करते हैं। सुरक्षा के क्षेत्र में, यह संस्करण उन प्रबंधित PreToolUse हुक को ठीक करता है जो कॉल अस्वीकार करते थे लेकिन उस चरण को समाप्त नहीं करते थे; उन Bash जाँचों को ठीक करता है जो BASH_ARGV0 का उपयोग करने वाली कुछ कमांड को अपने आप स्वीकृत कर देती थीं; उन क्लाउड सत्रों को ठीक करता है जो Claude in Chrome की कार्रवाइयों पर स्वचालित मोड की जाँच छोड़ देते थे; और उन Edit तथा NotebookEdit बदलावों को ठीक करता है जो गैर-UTF-8 फ़ाइलों के सभी गैर-ASCII अक्षरों को बदल देते थे—ऐसे बदलाव अब अस्वीकार किए जाते हैं।
🔗 GitHub पर Claude Code 2.1.296
Vibe CLI 2.26.1 : स्थानीय Devstral मॉडल हटाया गया, अधिक सुविधाओं वाला गैर-इंटरैक्टिव मोड
9 अक्टूबर — 2.26.0 के तीन दिन बाद और बिना किसी ट्वीट के, Mistral ने Vibe CLI 2.26.1 जारी किया है। संस्करण संख्या इसे एक पैच रिलीज़ बताती है, लेकिन इसमें 85 प्रविष्टियाँ हैं (23 नई सुविधाएँ, 24 बदलाव, 36 सुधार, 2 हटाए गए हिस्से), जिनमें से 37 नए Rust इंटरफ़ेस से जुड़ी हैं। इसमें पैकेज के साथ शामिल स्थानीय Devstral मॉडल हटा दिया गया है : जो कॉन्फ़िगरेशन अब भी उस मॉडल को तय रखता है, वह चेतावनी के साथ डिफ़ॉल्ट होस्ट किए गए मॉडल पर लौट जाता है। इस मॉडल में अब तर्क-विचार के केवल दो स्तर, off और high, उपलब्ध हैं और इसकी घोषित संदर्भ विंडो 256k है, जिसके अनुसार स्वचालित संदर्भ-संक्षेपण होता है।
गैर-इंटरैक्टिव मोड vibe -p में समय सीमा, फ़ाइल या मानक इनपुट से प्रॉम्प्ट पढ़ने की सुविधा, हर बार प्रोग्राम से बाहर निकलने पर लिखी जाने वाली export.json रिपोर्ट और अलग-अलग निकास कोड जोड़े गए हैं : उपयोग या कॉन्फ़िगरेशन की त्रुटि के लिए 1, बुनियादी ढाँचे की विफलता के लिए 2, किसी सीमा तक पहुँचने या मॉडल के इनकार के लिए 3। Rust CLI में /proxy-setup, हर संवाद-चरण का सारांश आवाज़ में पढ़ने वाला एक वाचक, /plugins और /whoami जोड़े गए हैं। नई सेटिंग एजेंट को पृष्ठभूमि प्रक्रियाएँ या उप-एजेंट चलाने से रोकती हैं, और Document Library कनेक्टर डिफ़ॉल्ट रूप से अक्षम रहता है।
🔗 Vibe CLI 2.26.1 के रिलीज़ नोट्स
जनरेटिव चित्र, वीडियो और गेम : Qwen-Image-2.1-Turbo, Midjourney का Thinking मोड, Synthesia का Syren, Google का Playground
एक अधिक तेज़ और सस्ता चित्र मॉडल, अपने परिणाम की समीक्षा करने वाला जनरेटर, वीडियो संपादित करने वाला एजेंट और बिना कोड का गेमिंग प्लेटफ़ॉर्म।
Qwen-Image-2.1-Turbo : शोर हटाने के 8 चरण और प्रति चित्र 0,016 डॉलर
9 अक्टूबर — Qwen ने Qwen-Image-2.1-Turbo जारी किया है, जो Qwen-Image-2.1 का एक त्वरित चेकपॉइंट (accelerated checkpoint) है। यह 7 अरब पैरामीटर वाले उसी आर्किटेक्चर पर शोर हटाने के 8 चरणों में चित्र बनाता और संपादित करता है। Qwen के अनुसार, यह अब भी 2K चित्र बनाता है और प्राकृतिक भाषा में संपादन निर्देश स्वीकार करता है, लेकिन इस संस्करण की गुणवत्ता या गति के कोई विशिष्ट आँकड़े प्रकाशित नहीं किए गए हैं। मॉडल के वेट Hugging Face और ModelScope पर Qwen के शोध लाइसेंस (Qwen Research License) के तहत उपलब्ध हैं। चेकपॉइंट में 8 चरणों का सैंपलिंग शेड्यूल शामिल है और यह डिफ़ॉल्ट रूप से 1 के CFG के साथ चलता है।
उसी दिन Qwen ने आधिकारिक तौर पर Qwen-Image-2.1 Pro और Turbo के API उपलब्ध कराए ; QwenCloud, Turbo के लिए प्रति मिनट 120 अनुरोधों की अनुमति देता है।
| API के ज़रिए उपलब्ध मॉडल (Model Studio) | प्रति चित्र कीमत | मुफ़्त चित्र |
|---|---|---|
| qwen-image-2.1-turbo | 0,016 डॉलर | 10 |
| qwen-image-2.1-pro | 0,04 डॉलर | 10 |
| qwen-image-2.0-pro | 0,075 डॉलर | 100 |
🔗 Qwen की घोषणा · Hugging Face पर मॉडल का विवरण
Midjourney ने Thinking मोड का परीक्षण शुरू किया और अपनी अल्फ़ा साइट पर साझा फ़ोल्डर उपलब्ध कराए
8 अक्टूबर — शाम को प्रकाशित Midjourney के अल्फ़ा चेंजलॉग में दो सुविधाओं के शुरुआती संस्करण प्रस्तुत किए गए हैं, जो फ़िलहाल केवल alpha.midjourney.com साइट पर उपलब्ध हैं। पहली सुविधा एक परीक्षण है : V8.2 से बनाए या संपादित किए गए चित्र पर Rerun (Thinking) बटन मॉडल से परिणाम देखने, प्रॉम्प्ट से उसके विचलन पहचानने (वस्तुएँ, लेआउट, शरीररचना, पाठ) और चित्र दोबारा बनाने को कहता है। Midjourney का कहना है कि प्रॉम्प्ट का पालन करने, टाइपोग्राफ़ी और सुसंगति में बेहतर परिणाम मिले हैं, और वह इसे एक सामान्य मोड बनाने पर विचार कर रहा है।
दूसरी सुविधा फ़ोल्डर साझा करना है : सहयोगियों को आमंत्रित किया जा सकता है, जो सीधे फ़ोल्डर में चित्र बनाते हैं, या दर्शकों को बुलाया जा सकता है। लिंक के ज़रिए फ़ोल्डर साझा करना या उसे Midjourney के सभी सदस्यों के लिए खोलना भी संभव है। Midjourney स्पष्ट करता है कि साझा करने से चित्रों की दृश्यता नहीं बदलती : stealth मोड के बिना वे अब भी Explore और प्रोफ़ाइल पर दिखाई दे सकते हैं।
🔗 Midjourney का अल्फ़ा चेंजलॉग · Thinking मोड का परीक्षण (Midjourney)
Syren : Synthesia ने बीटा में वीडियो बनाने का काम एक एजेंट को सौंपा
9 अक्टूबर — Synthesia ने मुफ़्त खातों सहित अपने सभी ग्राहकों के लिए Syren का बीटा लॉन्च किया है। उपयोगकर्ता मनचाहे वीडियो का विवरण देता है या दस्तावेज़, चित्र, वीडियो, PowerPoint प्रस्तुतियाँ या YouTube लिंक उपलब्ध कराता है, और Syren ग्राफ़िक ऐनिमेशन (motion graphics), अवतार, पार्श्व आवाज़, संगीत और पूरक दृश्य (b-roll) के साथ एक तैयार वीडियो देता है, जिसे फिर बातचीत के ज़रिए संशोधित किया जा सकता है। Synthesia के तकनीकी निदेशक पीटर हिल के अनुसार, एजेंट पूरे वीडियो को कोड के रूप में लिखता है, जिसे कंपनी का अपना रेंडरिंग इंजन लाइव चलाता है। यह इंजन जून से Synthesia के ऐनिमेशन के लिए इस्तेमाल हो रहा है।
वीडियो 3 मिनट तक लंबे हो सकते हैं, क्षैतिज या ऊर्ध्वाधर प्रारूप में, और ब्राउज़र में रेंडर होते हैं। बिलिंग क्रेडिट के आधार पर होती है, विस्तृत दरें नहीं दी गई हैं, और Enterprise प्रशासक इस टूल को अक्षम कर सकते हैं। लेख में मौजूदा वीडियो से ब्रांड की पहचान अपने आप सीखने की सुविधा जल्द आने की घोषणा की गई है। Syren, HeyGen के HyperFrames Studio के चार दिन बाद और Anthropic के Claude Motion के अगले दिन आया है। ये दोनों भी ऐसे टूल हैं जिनमें एजेंट वीडियो बनाता है।
Playground : Google ने बिना कोड लिखे गेम बनाने का प्लेटफ़ॉर्म उपलब्ध कराया
7 अक्टूबर — Google ने Playground लॉन्च किया है, जो एक प्रयोगात्मक गेमिंग प्लेटफ़ॉर्म है। इसमें बिना कोड लिखे, कुछ प्रॉम्प्ट में विवरण देकर गेम बनाए, खेले और साझा किए जा सकते हैं। संवादात्मक इंटरफ़ेस में शुरुआत खाली पृष्ठ से, रीमिक्स किए जा सकने वाले उदाहरण से या निर्देशित सहायता के साथ की जाती है, फिर अनुरोध के अनुसार भौतिकी, नियम, पात्र या परिवेश बदले जाते हैं।
गेम फ़ोन और कंप्यूटर दोनों पर ब्राउज़र में चलते हैं। इन्हें निजी रखा जा सकता है, लिंक के ज़रिए साझा किया जा सकता है या Explore गैलरी में जोड़ा जा सकता है। कुछ श्रेणियों में रैंकिंग और मल्टीप्लेयर की सुविधा है ; हर प्रकाशित गेम की सुरक्षा जाँच होती है। Playground अमेरिका में 18 वर्ष और उससे अधिक उम्र के लोगों के लिए उपलब्ध है, और गेम बनाने की अनुमति Google AI की सदस्यता पर निर्भर करती है। अधिक महत्वाकांक्षी 3D गेम के लिए Unity Spark के साथ एकीकरण जल्द बंद बीटा में आने की घोषणा की गई है। Google ने यह स्पष्ट नहीं किया है कि प्लेटफ़ॉर्म किस मॉडल पर चलता है।
🔗 Playground का परिचय (Google ब्लॉग)
स्वास्थ्य : AMIE का नैदानिक अध्ययन The Lancet में प्रकाशित
8 अक्टूबर — Google और Beth Israel Deaconess Medical Center (BIDMC) ने The Lancet में AMIE (Articulate Medical Intelligence Explorer) का एक भावी व्यवहार्यता अध्ययन प्रकाशित किया है। AMIE, Google की निदान करने वाली संवादात्मक IA है ; Google के अनुसार, Lancet की मुख्य पत्रिका में यह उसका पहला प्रकाशन है। मरीज़ों ने तत्काल चिकित्सा परामर्श से अधिकतम पाँच दिन पहले AMIE से बातचीत की, और चिकित्सक को बाद में बातचीत का प्रतिलेख और सारांश मिला।
| अध्ययन का माप | प्रकाशित परिणाम |
|---|---|
| अध्ययन में शामिल मरीज़ (अप्रैल से नवंबर 2025), फिर अनुवर्ती निरीक्षण वाले | 114, फिर 98 |
| सुरक्षा के कारण रोके गए मामले | 0 |
| दर्ज किए गए हैलुसिनेशन | 1 |
| चिकित्सक के अनुसार, परामर्श की तैयारी में AMIE उपयोगी | 44 में से 33 मामले (75 %) |
| अंतिम निदान से मेल खाने वाले निदान (Google) | 90 % |
एक ही केंद्र पर किए गए इस अध्ययन में नियंत्रण समूह नहीं था और इसका वित्तपोषण Alphabet ने किया। यह न तो मंज़ूरी है, न ही तैनाती : लेखकों ने बड़े परीक्षणों की माँग की है।
🔗 Google का लेख · The Lancet में प्रकाशित लेख
OpenAI में शोध : कंपनी से अलग किए गए तीन शोधकर्ताओं के पत्र का जवाब
9 अक्टूबर — अपने शोध प्रमुखों की ओर से @OpenAINewsroom पर प्रकाशित एक नोट में OpenAI ने तीन शोधकर्ताओं के पत्र का जवाब दिया है, जिनसे वह कहती है कि पिछले सप्ताह अलग हुई थी। OpenAI के अनुसार, आंतरिक जाँच में निष्कर्ष निकला कि उन्होंने संवेदनशील जानकारी के प्रबंधन से जुड़े स्पष्ट नियमों का उल्लंघन किया था और विश्वास में आई दरार उनके पत्र में बताए गए दायरे से आगे थी ; OpenAI अपने फैसले पर कायम है। उसका कहना है कि ये फैसले न तो सुरक्षा संबंधी चिंताएँ उठाने के कारण हुए, न ही अपनी बात सार्वजनिक रूप से रखने के कारण, और वह चिंताएँ व्यक्त करने के लिए किसी कर्मचारी को नौकरी से नहीं निकालती।
नोट में यह घोषणा भी की गई है :
We are actively finalizing contracts with third-party safety assessors and will announce details in the coming weeks.
🇮🇳 हम तीसरे पक्ष के सुरक्षा मूल्यांकनकर्ताओं के साथ अनुबंधों को अंतिम रूप देने पर सक्रिय रूप से काम कर रहे हैं और आने वाले हफ़्तों में इनके विवरण की घोषणा करेंगे। — X पर @OpenAINewsroom
OpenAI का कहना है कि वह पत्र की एक बात से सहमत है : फ्रंटियर मॉडलों की निगरानी करने की क्षमता (monitorability) बनाए रखने के लिए पूरे उद्योग की प्रतिबद्धता चाहिए, जिसमें OpenAI भी शामिल है। यह लेख OpenAI का पक्ष प्रस्तुत करता है ; शोधकर्ताओं का पत्र नहीं पढ़ा गया है।
खुले मॉडल बनाना : ML Intern से लगभग 103 डॉलर में छह मॉडल, Ai2 का GPU शेड्यूलर
मॉडल बनाने के दो अनुभव : एक एजेंट के स्तर पर, दूसरा कंप्यूटिंग क्लस्टरों के स्तर पर।
ML Intern : लगभग 103 डॉलर की गणना लागत में छह खुले मॉडल
8 अक्टूबर — यहाँ 1 और 8 अक्टूबर को अलग-अलग पहलुओं से प्रस्तुत किए जा चुके HuggingChat के ML Intern मोड का पहला आँकड़ों सहित लेखाजोखा Hugging Face के ब्लॉग पर आया है : छह परियोजनाएँ शुरू से अंत तक पूरी की गईं, कुल लगभग 103 डॉलर की गणना लागत में। हर परियोजना एक संदेश से शुरू होती है और मूल्यांकन सहित Hub पर एक सार्वजनिक मॉडल के साथ समाप्त होती है। एजेंट योजना बनाता है, किसी भी सशुल्क गणना कार्य से पहले अनुमति माँगता है, छोटा परीक्षण चलाता है, फिर Hugging Face के हार्डवेयर पर प्रशिक्षण, मूल्यांकन और प्रकाशन करता है।
| ML Intern द्वारा बनाया गया मॉडल | प्रकाशित परिणाम | गणना लागत |
|---|---|---|
| Pocket Rewriter (0.8B) | 99,7 % वैध आउटपुट, Qwen-Image 2.1 के 9B पुनर्लेखन मॉडल के लगभग एक चौथाई टोकन | लगभग 16 डॉलर |
| Citrus Doctor (Qwen3.5-2B) | खट्टे फलों के रोगों के सही निदान 14,9 % से 52,8 % तक | लगभग 1,90 डॉलर |
| Qwen-Image 2.1 के लिए दो LoRA | देखने के कोण में बदलाव, आड़ी-तिरछी रेखाओं की जगह माँगी गई वस्तु | लगभग 16 और 24,30 डॉलर |
| Huggy LoRA (FLUX.2 klein) | पात्र का LoRA | लगभग 7,60 डॉलर |
| Agate 4 चरण | एक छोटे चित्र मॉडल का डिस्टिलेशन, 50 चरणों (गाइडेंस के साथ 100 पास) से 4 तक | लगभग 37 डॉलर |
Ai2 का GPU शेड्यूलर : मध्यिका प्रतीक्षा समय 5 मिनट से घटकर 24 सेकंड
9 अक्टूबर — जेरेमी ट्राइबा के लिखे एक लेख में Ai2 ने अपने GPU क्लस्टरों के नए शेड्यूलर का विवरण दिया है। 88 से 1 024 GPU वाले क्लस्टरों में हज़ारों NVIDIA H100, B200 और B300 GPU लगभग 150 शोधकर्ताओं के बीच साझा किए जाते हैं, जबकि माँग उपलब्ध क्षमता से दो से तीन गुना अधिक है। प्राथमिकताओं पर आधारित पुराना तंत्र GPU को खाली कार्यों के « कब्ज़े » में छोड़ देता था, और सभी कार्यभार अंततः अधिकतम प्राथमिकता पर पहुँच जाते थे।
नया तंत्र शोध के संगठनात्मक पदक्रम में बाँटे गए GPU समय के बजट, पिछले सात दिनों की बदलती अवधि के आधार पर तय पदानुक्रमित न्यायसंगत बँटवारे (fair-share) और एक « शेड्यूलिंग अनुबंध » पर आधारित है : हर कार्यभार अधिकतम 8 घंटे की सुरक्षित अवधि घोषित करता है, जिसके बाद उसे रोककर फिर कतार में डाला जा सकता है। अनावंटित समय मुफ़्त रहता है, लेकिन उसे किसी भी समय रोका जा सकता है।
| Ai2 द्वारा मापा गया संकेतक | पुराना शेड्यूलर | नया शेड्यूलर |
|---|---|---|
| मध्यिका प्रतीक्षा समय, सबसे बड़ा H100 क्लस्टर | 5 मिनट | 24 सेकंड |
| डिबगिंग कार्यभारों का p90 प्रतीक्षा समय | 2 घंटे | 30 सेकंड |
| 30 दिनों में उपलब्ध कराए गए देय GPU घंटे | — | 98 % |
मानवीय हस्तक्षेप की ज़रूरत वाली मरम्मतों में 74 % की कमी आई है। Ai2 कुछ सीमाएँ स्वीकार करता है, जैसे इंटरैक्टिव सत्र जिन्हें 8 घंटे बाद रोका जा सकता है, जबकि पहले वे एक हफ़्ते तक चल सकते थे, और उसने कोई कोड प्रकाशित नहीं किया है।
निर्णय मॉडल : Decision Bench पर pplx-decider-v1.1-27b सबसे आगे, नौ अन्य मॉडलों के साथ सांख्यिकीय बराबरी पर
9 अक्टूबर — 6 और 8 अक्टूबर को प्रस्तुत किए जा चुके Perplexity के निर्णय मॉडल को एक बाहरी मूल्यांकन का परिणाम मिला है। Atlan Frontier Labs के ओपन सोर्स बेंचमार्क Decision Bench (सीमित विकल्पों वाले 1 071 प्रश्न, 36 डेटासेट, रैंक किए गए 15 मॉडल) पर pplx-decider-v1.1-27b ने सर्वोच्च मूल स्कोर, 94,5 %, हासिल किया है, और इसकी लागत सबसे कम है, प्रति 1 000 निर्णय 0,017 डॉलर। हालाँकि, साइट उन मॉडलों को एक ही रैंक देती है जिनके 95 % विश्वास अंतराल आपस में ओवरलैप करते हैं : दस मॉडल पहला स्थान साझा करते हैं।
| Decision Bench पर मूल्यांकित मॉडल | मापी गई सटीकता | 1 000 पंक्तियों की लागत |
|---|---|---|
| pplx-decider-v1.1-27b | 94,5 % | 0,017 डॉलर |
| DeepSeek V4.1 Flash | 94,2 % | 0,683 डॉलर |
| Gemini 3.5 Flash | 94,2 % | 3,32 डॉलर |
| Jev 1.13 | 93,8 % | 0,044 डॉलर |
Perplexity ने एक नेविगेशन एजेंट की व्यावहारिक मार्गदर्शिका (cookbook) भी प्रकाशित की है, जिसमें क्लिक करने का निर्णय हमेशा कोड लेता है, मॉडल कभी नहीं, और API में v1.1 ने v1 की जगह ले ली है।
🔗 @perplexitydevs की पोस्ट-शृंखला · Decision Bench की रैंकिंग
Grok Bot को अपना ईमेल पता मिला
9 अक्टूबर — SpaceXAI के एजेंट Grok Bot के पास अब अपना ईमेल पता है। Bot इसका इस्तेमाल सेवाओं में पंजीकरण करने, उपयोगकर्ता की ओर से कंपनियों से संपर्क करने या किसी के साथ मिलने का समय तय करने के लिए कर सकता है। यह सुविधा उसी दिन जारी की गई है : Bot से एक पता माँगना या X पर @bot का उल्लेख करना पर्याप्त है, और टीम में पहले किसी प्रशासक को इसे सक्रिय करना होगा।
घोषणा @bot खाते की एक पोस्ट-शृंखला तक सीमित है, जिसे @grok ने साझा किया है, और x.ai पर कोई लेख नहीं है। इसमें पतों का प्रारूप, उनका डोमेन या शामिल सदस्यता योजनाएँ स्पष्ट नहीं की गई हैं। सितंबर के अंत में Team Bots को अपना Slack पहचानकर्ता मिलने के बाद, एजेंट को अब बाहर काम करने के लिए अपनी पहचान मिलती है।
ElevenLabs ने सिंगापुर में अपना दक्षिण-पूर्व एशिया का केंद्र खोला
8 अक्टूबर — ElevenLabs ने सिंगापुर में अपनी मौजूदगी की आधिकारिक घोषणा की है, जहाँ कंपनी दक्षिण-पूर्व एशिया और व्यापक तौर पर एशिया-प्रशांत क्षेत्र के केंद्र के रूप में काम करने के लिए कार्यालय खोल रही है। लेख में पहले से उपलब्ध बुनियादी ढाँचे पर ज़ोर दिया गया है : जुलाई से कंपनियाँ सिंगापुर में अपना डेटा होस्ट कर सकती हैं, डेटा न सहेजने के विकल्पों और क्षेत्र में कम विलंबता के साथ।
ElevenLabs मुख्य रूप से अपने क्षेत्रीय ग्राहकों का उल्लेख करता है : Funding Societies, जो पाँच बाज़ारों में संवादात्मक IA के ज़रिए संभावित ग्राहकों की पात्रता जाँचता है, मलेशिया का Boost Bank, फ़िलीपींस का Salmon Group, इंडोनेशिया का MNC Group, या Rezonate, एक स्वास्थ्य प्लेटफ़ॉर्म जिसका इस्तेमाल सिंगापुर के 60 % सार्वजनिक अस्पताल करते हैं। कर्मचारियों की संख्या नहीं बताई गई है। यह कार्यालय सितंबर के अंत में ब्रसेल्स और अक्टूबर की शुरुआत में एम्स्टर्डम में खोले गए कार्यालयों के बाद खुला है।
संक्षिप्त समाचार
- Claude Code में Projects — Anthropic ने प्रतीक्षा सूची में शामिल सभी Pro और Max ग्राहकों को प्रवेश दे दिया है। Projects अभी बीटा में है: सूची खुली है, क्षमता के अनुसार और लोगों को प्रवेश मिलेगा, और दस्तावेज़ों के अनुसार यह सुविधा अभी Team और Enterprise पर उपलब्ध नहीं है। 🔗 स्रोत
- एजेंट स्वचालन की मार्गदर्शिका — claude.dev की एक मार्गदर्शिका Claude Managed Agents पर बने एक संदर्भ कार्यान्वयन का वर्णन करती है, जो निर्धारित समय पर Slack चैनल और GitHub की पुल रिक्वेस्ट पढ़ता है और फिर Slack में सारांश प्रकाशित करता है। इसमें उसके छह घटकों और सामान्य विफलताओं से बचने के उपायों का विवरण है, जैसे किसी अपठनीय स्रोत को कम गतिविधि वाले दिन का संकेत न मानना या खर्च की सीमा सामान्य निष्पादन की लागत से 3 से 5 गुना तय करना। 🔗 स्रोत
- Block और Claude Fable — Anthropic द्वारा प्रकाशित एक साक्षात्कार में Block बताता है कि Claude Fable उसके बड़े कोड माइग्रेशन की योजना बनाता है और दर्जनों Opus या Sonnet मॉडल का संचालन करता है, यहाँ तक कि एक ही माइग्रेशन में एक हज़ार तक पुल रिक्वेस्ट मर्ज करता है; मर्ज और उत्पादन में तैनाती का अधिकार मनुष्यों के पास रहता है, और तैनाती के लिए दोहरी मंज़ूरी आवश्यक होती है। 🔗 स्रोत
- Claude Enterprise की Compliance API — इसके संवाद संबंधी समापन बिंदु (एंडपॉइंट्स) अब बीटा में मौजूदा कुंजी के साथ एकीकृत Claude अनुभव के संवाद भी लौटाते हैं: क्लाउड सत्र में आगे जारी किया गया संवाद एक ही संवाद के रूप में लौटता है, जिसमें Claude का काम
tool_useऔरtool_resultब्लॉक में होता है। 🔗 स्रोत - Codex CLI 0.162.1 — 0.162.0 का यह सुधार कई पंक्तियों वाले असिंक्रोनस प्रश्नों पर TUI के क्रैश होने और पहले से चल रहे पृष्ठभूमि सर्वर की सुविधा सेटिंग CLI से अलग होने पर शुरू होने में आने वाली विफलताओं को दूर करता है। 🔗 स्रोत
- ChatGPT Enterprise और Edu में भूमिका के अनुसार प्लगइन — भूमिका आधारित पहुँच नियंत्रण (RBAC) सक्रिय होने पर मालिक और प्रशासक हर भूमिका के लिए प्लगइन की पहुँच तय करते हैं: कार्यक्षेत्र के लिए Available, Install या Disabled, और किसी कस्टम भूमिका को वही सेटिंग विरासत में देने के लिए Default। 🔗 स्रोत
- Sophos और OpenAI Daybreak — साइबर सुरक्षा कंपनी के अनुसार, Daybreak से बनाए गए उसके एजेंट जिन मामलों को संभालते हैं, उनमें औसत प्रतिक्रिया समय लगभग 38 मिनट से घटाकर लगभग 89 सेकंड कर देते हैं, और उसके 52 % MDR मामले शुरू से अंत तक एआई द्वारा सुलझाए जाते हैं; विनाशकारी कार्रवाइयाँ मानव निगरानी में रहती हैं। 🔗 स्रोत
- Asana और StackAI का ब्राउज़िंग एजेंट — Asana के अनुसार, Codex में GPT-6 Astra ने लगभग एक सप्ताह में इस एजेंट को अनुकूलित किया: GPT-6.1 Sol पर एक परीक्षण निष्पादन की लागत 0,47 डॉलर है और इसमें लगभग चार मिनट लगते हैं, यानी मूल उत्पादन कॉन्फ़िगरेशन की तुलना में यह 76 गुना सस्ता और 5 गुना तेज़ है। 🔗 स्रोत
- LegalOn और Codex — LegalOn Technologies का कहना है कि उसने असीमित तेज़ मोड वाले GPT-5.5 से हटकर काम को GPT-6 Luna, GPT-6.1 Sol और GPT-6 Astra में बाँटने, माँग पर तेज़ मोड इस्तेमाल करने और हर विभाग व व्यक्ति के लिए सीमा तय करने से Codex की अपनी अनुमानित दैनिक लागत लगभग 65 % घटाई है। 🔗 स्रोत
- Gemini CLI v0.64.0-preview.1 — यह पूर्वावलोकन हानिरहित शेल कमांड पर Untrusted Command Flags Detected चेतावनी के ग़लत संकेतों को रोकता है: केवल पढ़ने वाले विकल्पों को छूट मिलती है, शेल वेरिएबल सुरक्षित रहते हैं, और जब हर उपकमांड के लिए ALLOW नियम हो तो लूप की अनुमति होती है। 9 अक्टूबर को कोई रात्रिकालीन संस्करण जारी नहीं हुआ, और स्थिर संस्करण अभी v0.63.0 है। 🔗 स्रोत
- Antigravity 2.22.0 — प्लगइन पार्श्व पैनल में अपना इंटरफ़ेस दिखा सकते हैं (UI Extensions), संवादों को खींचकर पार्श्व पट्टी के एक अनुभाग से दूसरे में रखा जा सकता है, और समयचिह्नों में महीने का नाम दिखता है। 🔗 स्रोत
- Gemini 3.7 Flash को अप्रचलित घोषित किया गया — Gemini API में
gemini-3.7-flashके कॉलgemini-3.8-flashपर भेजे जाते हैं, और पुराने एजेंटdeep-research-pro-preview-12-2025को 23 अक्टूबर को बंद कर दिया जाएगा; उसके स्थान परdeep-research-preview-04-2026याdeep-research-max-preview-04-2026का उपयोग होगा। 🔗 स्रोत - Google Flow Music के लिए VST3 और AU प्लगइन — 6 अक्टूबर की छूटी हुई ख़बर: प्राकृतिक भाषा से बनाए गए वाद्ययंत्र और प्रभाव, जिन्हें Spaces कहा जाता है, डिजिटल ऑडियो कार्यस्थानों (डिजिटल ऑडियो वर्कस्टेशन) के लिए प्लगइन के रूप में निर्यात किए जा सकते हैं, जैसे निर्माता ख्रिस रिडिक-टाइन्स का No Chaser प्लगइन। 🔗 स्रोत
- Google Earth AI और सार्वजनिक स्वास्थ्य — 6 अक्टूबर की छूटी हुई ख़बर: कांगो लोकतांत्रिक गणराज्य में इबोला की महामारी के दौरान भूस्थानिक तर्क एजेंट के एक प्रोटोटाइप ने विश्व स्वास्थ्य संगठन के अफ़्रीका कार्यालय को कुछ ही मिनटों में 48 प्रभावित होने की आशंका वाले इलाक़े और जोखिम में पड़े 45 500 से अधिक लोगों की पहचान करने में मदद की; PDFM मॉडल हैज़े के जोखिम वाले क्षेत्रों को भी 8 सप्ताह पहले तक पहचान सकता है। 🔗 स्रोत
- Copilot code review की बिलिंग — यदि AI Credits का सशुल्क उपयोग सक्रिय है, तो संगठन के मालिक लाइसेंसधारी सदस्यों द्वारा माँगी गई समीक्षाओं का खर्च उनके कोटे से काटने के बजाय रिपॉज़िटरी के मालिक संगठन पर डाल सकते हैं, और समीक्षा शुरू करने का अधिकार केवल संगठन या उद्यम द्वारा दिए गए लाइसेंसों तक सीमित कर सकते हैं। 🔗 स्रोत
- Copilot CLI 1.0.95 — अब स्थिर संस्करण के रूप में उपलब्ध यह CLI macOS पर Microsoft Entra के मूल ब्रोकर के ज़रिए प्रमाणीकरण करती है, और आवश्यकता पड़ने पर ब्राउज़र का उपयोग करती है; पूर्वावलोकन 1.0.96-0 समयरेखा में बताता है कि हर अनुमति का फ़ैसला किसने किया: उपयोगकर्ता, Assisted Permissions, कोई नीति या बिना निगरानी वाला वैकल्पिक व्यवहार। 🔗 स्रोत
- GitHub MCP Server 2.0 — 6 अक्टूबर की छूटी हुई ख़बर: GitHub का आधिकारिक MCP सर्वर Code Mode या Programmatic Tool Calling में काम करने वाले एजेंटों के लिए प्रकार निर्धारित आउटपुट लौटाता है, जिनका वर्णन आउटपुट स्कीमा (आउटपुट स्कीमा) में होता है; इनकी उपलब्धता केवल MCP 2026-07-28 या बाद के विनिर्देश का उपयोग करने वाले क्लाइंट को बताई जाती है। 🔗 स्रोत
- Genspark में Claude Haiku 5.5 — Genspark ने AI Chat, Code Agent और Claw में यह मॉडल उपलब्ध कराया है और Anthropic का यह दावा दोहराया है कि इसे चलाने की लागत Haiku 4.5 से लगभग 75 % कम है; इसके लिए कोई अलग योजना या दर नहीं है। 🔗 स्रोत
- v0 के लिए Meta VR टेम्पलेट — Meta ने Vercel के साथ Immersive Web SDK पर आधारित एक v0 टेम्पलेट प्रकाशित किया है: आप किसी अनुभव का वर्णन करते हैं, v0 उसका कोड बनाता है और पूर्वावलोकन दिखाता है, और एक क्लिक से उसे Vercel पर तैनात करके Quest के ब्राउज़र में खोला जा सकता है; वसंत 2027 में आने वाले Meta VR Glasses के दृष्टि और हाथ संबंधी इनपुट का समर्थन पहले से मौजूद है। 🔗 स्रोत
- v0 for teams — v0 ने वीडियो में साथियों का काम देखने, उनके संवादों में शामिल होने और मिलकर निर्माण करने का यह तरीका प्रस्तुत किया है; ट्वीट में सितंबर से चरणबद्ध ढंग से आई सुविधाओं को प्रमुखता दी गई है, किसी नई दर की घोषणा नहीं हुई है। 🔗 स्रोत
- DeepSeek Harness 0.2.1-alpha.2 — यह 26वाँ पूर्वावलोकन है और अभी भी कोई स्थिर संस्करण नहीं है: प्लगइन सूची माँग पर Claude Code और Codex पैकेज स्थापित करती है, दो प्रयोगात्मक प्लगइन आए हैं (Git Worktrees, तर्क का अनुवाद), और वैश्विक निर्देश साझा AGENTS.md से लिए जा सकते हैं। 🔗 स्रोत
- OGX 1.5.0 — पूर्व Llama Stack, जिसका अप्रैल में नाम बदला गया और जिसे meta-llama संगठन से बाहर ले जाया गया, अब DeepSeek और Fireworks AI के लिए /v1/messages API का मूल पासथ्रू, Text-Embeddings-Inference प्रदाता, Exa और Serply वेब खोज तथा MCP 2.x क्लाइंट जोड़ता है; इसमें चार ऐसे बदलाव हैं जो पिछली संगतता तोड़ते हैं। 🔗 स्रोत
- GenIA — Meta ने बिना घोषणा के, गैर-वाणिज्यिक CC BY-NC 4.0 लाइसेंस के तहत, Tübingen AI Center के साथ किए गए इस काम का कोड ऑनलाइन प्रकाशित किया है: यह एक छवि, कुछ दृश्यों या वीडियो से 3D वस्तुओं का पुनर्निर्माण करता है और इन्फ़रेंस के समय SAM 3D Objects के स्थिर पूर्वज्ञान को अनुरूप बनाता है, बिना दोबारा प्रशिक्षण के। 🔗 स्रोत
- Hub पर decision-model लेबल — Hugging Face ने निर्णय मॉडलों को अपना अलग लेबल दिया है, साथ ही Models पृष्ठ पर एक आइकन और फ़िल्टर भी; निर्णय संबंधी GGUF को उनके llama.cpp मेटाडेटा के आधार पर अपने आप लेबल किया जाता है। 🔗 स्रोत
- Darwin-27B-ZTC-v2 — VIDRAFT ने घोषणा की है कि Apache-2.0 के तहत उपलब्ध उसके मूल्यांकनकर्ता का नया संस्करण System One Mosaic Benchmark (137 परीक्षण समूह) में 89,58 के Borda स्कोर के साथ शीर्ष पर पहुँच गया है, जबकि OpenJev-27B का स्कोर 87,50 और Jev 1.13 का 85,05 है; यह रैंकिंग उसके लेखकों द्वारा घोषित की गई है, जो इसे सार्वजनिक तालिका की एक समय विशेष की झलक बताते हैं। 🔗 स्रोत
- निर्णय मॉडलों का विश्वास स्तर — स्टीफ़न सोल्का एक सामुदायिक लेख में दिखाते हैं कि OpenRouter के ज़रिए पूछे जाने पर GPT-6 Luna Decisions, SHA-256 की 600 जाँचों में « मेल नहीं खाता » उत्तर देता है, जिससे उसकी सटीकता 50 % और औसत विश्वास स्तर 99,8 % रहता है; कारणात्मक तर्क में 99 % की सीमा चुनने पर 49 उत्तरों में से 47 सही मिलते हैं, लेकिन इसमें केवल 8,2 % मामले आते हैं। 🔗 स्रोत
- सुदृढीकरण अधिगम परिवेशों में openai-math — FineEnvs ने openai/math प्रकाशन के Lean में औपचारिक रूप दिए गए 405 परिणामों में से 369 को Harbor परिवेशों में रूपांतरित किया है: एजेंट को Lean 4 के सैंडबॉक्स में एक प्रमेय सिद्ध करना होता है, और Comparator केवल उसी सटीक कथन के पूर्ण प्रमाण पर पुरस्कार देता है; यह प्रयोगात्मक संग्रह Apache-2.0 के तहत उपलब्ध है। 🔗 स्रोत
- JOSIE-2 — गोकदेनिज़ ग्युलमेज़ ने 2B, 4B और 9B वाले इस मॉडल परिवार की तकनीकी रिपोर्ट प्रकाशित की है, जिसे Qwen3.5 से आगे दो Mac M4 पर लगभग 3 000 चुने हुए उदाहरणों के साथ प्रशिक्षण दिया गया है: तर्क मोड में JOSIE-2-4B, ARC-Challenge पर 95,5 (+12,1) और TruthfulQA पर 69,2 (+20,3) तक पहुँचता है; मूल्यांकन केवल दो परीक्षण समूहों पर किया गया है। 🔗 स्रोत
- Gradio 6.30 —
gr.Workflowमें अनुप्रयोग दृश्य जुड़ा है, और Run this node कमांड पूरे उपग्राफ़ को दोबारा चलाने के बजाय पहले के नोडों के अभी भी अद्यतन परिणामों का पुनः उपयोग करती है;gr.ImageEditorलोड की गई छवियों के अल्फ़ा चैनल को सुरक्षित रखता है। 🔗 स्रोत - tokenizers 0.23.3 — केवल Python पैकेज का यह सुधार
huggingface_hubv2 को स्वीकार करता है, जिससे रिलीज़ विवरण के अनुसार Transformers की स्थापना में आई बाधा दूर होती है, और ट्रंकेशन से संबंधित 0.23.1 के संगतता तोड़ने वाले बदलाव को वापस लेता है। 🔗 स्रोत - एआई द्वारा वैज्ञानिक समीक्षा — Sakana AI ने TMLR में स्वीकृत एक शोधपत्र प्रस्तुत किया है: एक परीक्षण समूह लेखों में विरोधाभासी दावे जोड़कर जाँचता है कि एआई समीक्षक उन्हें पहचानते हैं या नहीं, और Sakana AI की घोषणा के अनुसार उसका Multi-Layered Review तंत्र अन्य परीक्षण किए गए तंत्रों की तुलना में अधिक विरोधाभास पहचानता है; घोषणा में कोई आँकड़ा नहीं दिया गया है। 🔗 स्रोत
- Suno Studio — क्लिप पहले बीट के साथ बेहतर तालमेल बैठाते हैं और प्रोजेक्ट की गति के अनुसार खिंचते हैं, फ़ेड अब घातांकीय या लघुगणकीय हो सकते हैं, और सिंथेसाइज़र, कीबोर्ड तथा प्लगइन दृश्य अलग करके दूसरे स्क्रीन तक ले जाए जा सकते हैं; Studio, Premier सदस्यता में शामिल है। 🔗 स्रोत
- World Models’ Last Exam in Physics — वीडियो मॉडलों के लिए Einsia की इस भौतिकी परीक्षा (40 कार्य, 9 श्रेणियाँ, आठ मॉडल) में Seedance 2.5, 100 में से 57,76 अंकों के साथ पहले स्थान पर है, उसके बाद MiniMax H3 (54,89), जिसे MiniMax सबसे अच्छा खुला मॉडल बताता है, और NVIDIA का Cosmos 3 Super (42,46) हैं; यह तीसरे पक्ष का बेंचमार्क है। 🔗 स्रोत
- एजेंटों द्वारा बनाए गए Omniverse सिमुलेशन — NVIDIA का ब्लॉग कंपनी की उन टीमों को दिखाता है जो GPT-6 Astra से, और एक मामले में Claude Fable 5 से, ovphysx, ovstage, ovrtx और ovui लाइब्रेरी का उपयोग करके सिमुलेशन बनवाती हैं। इनमें लगभग तीन दिनों में बनाए गए या सुधारे गए डिजिटल जुड़वाँ भी शामिल हैं; कोई नया उत्पाद नहीं आया है। 🔗 स्रोत
- Shopify दुकान का प्रबंधन — दुकान जुड़ जाने के बाद Grok Bot ऑर्डर जाँच सकता है, स्टॉक पर नज़र रख सकता है और उत्पाद विवरण अद्यतन रख सकता है; किसी योजना या सीमा का उल्लेख नहीं है। 🔗 स्रोत
- X पर खोज — 7 अक्टूबर की छूटी हुई ख़बर: Grok Bot सभी उपयोगकर्ताओं के लिए X पर खोज, पढ़ने और निगरानी का काम कर सकता है, बिना X कनेक्टर कॉन्फ़िगर किए; उदाहरण के लिए किसी उत्पाद पर प्रतिक्रियाएँ देखने या अपने क्षेत्र का साप्ताहिक सारांश पाने के लिए। अगस्त के अंत में अभी भी अपना खाता जोड़ना आवश्यक था। 🔗 स्रोत
- Grokipedia v0.3 — इसके आधिकारिक खाते के अनुसार, Grok द्वारा लिखे गए इस विश्वकोश ने एक सप्ताह में पाठकों द्वारा माँगे गए 4 400 से अधिक लेख प्रकाशित किए हैं और प्रतिदिन 2 200 से अधिक बदलाव किए हैं, जिसमें हर नए लेख के लिए औसतन 78 स्रोत हैं; अब एक पृष्ठ इसके बदलावों को तत्काल दिखाता है। 🔗 स्रोत
- mistral CLI 0.8.0 —
mistral apps deployअब वर्कफ़्लो वर्कर और सभी मॉड्यूल को एक साथ तैनात करता है, जिसमें केवल एक API कुंजी के साथ निरंतर एकीकरण में तैनाती भी शामिल है, औरmistral apps devDocker में स्थानीय Postgres डेटाबेस शुरू करता है; इसके साथ ही वर्तमान डायरेक्टरी का.envअब नहीं पढ़ा जाता। 🔗 स्रोत - Mistral का Python SDK 3.2.0 — चैट और एजेंट कॉल अब उत्तर और प्रॉम्प्ट दोनों के लिए लघुगणकीय प्रायिकताएँ (लॉगप्रॉब्स), साथ ही
top_k, दोहराव पर दंड और टोकन की न्यूनतम संख्या स्वीकार करते हैं; यह अपने आप तैयार किया गया संस्करण है, जिसकी कोई घोषणा नहीं हुई है। 🔗 स्रोत - Qwen Code v0.25.1-preview.1 — तीन दिनों में v0.25.1 का दूसरा पूर्वावलोकन, जिसमें 16 नई सुविधाएँ और 27 नए सुधार हैं। इनमें सत्र पर केंद्रित बहु-एजेंट सहयोग और PreToolUse हुक शामिल हैं, जो पूर्ण पुनः सत्यापन के साथ किसी टूल के इनपुट को बदलते हैं; स्थिर संस्करण अभी जारी नहीं हुआ है। 🔗 स्रोत
- Perplexity की Agent API में Claude Haiku 5.5 — 7 अक्टूबर की छूटी हुई ख़बर: Agent API,
anthropic/claude-haiku-5-5को Anthropic की दर पर स्वीकार करती है, जिसमें 100 000 इनपुट टोकन तक प्रति दस लाख इनपुट टोकन की लागत 0,10 डॉलर और आउटपुट की 0,50 डॉलर है; उससे अधिक पर दरें क्रमशः 0,50 और 2,50 हैं। 🔗 स्रोत - साझा या समर्पित इन्फ़रेंस — Embed और Rerank के लिए Cohere की एक मार्गदर्शिका बताती है कि अनुरोधों की संख्या से अधिक उनका स्वरूप मायने रखता है, और एक NVIDIA A10 GPU वाले समर्पित इंस्टेंस की तुलना में लागत बराबर पड़ने की उदाहरणात्मक सीमाएँ गणना करती है: लंबे दस्तावेज़ों के लिए लगभग 4 अनुरोध प्रति मिनट, कैटलॉग के लिए 20 और पुनः रैंकिंग (रीरैंकिंग) के लिए 29। 🔗 स्रोत
- एजेंट या MCP — Perplexity ने एक मार्गदर्शिका प्रकाशित की है जो निर्णय लेने वाले एजेंट और उसे टूल से जोड़ने वाले MCP का अंतर बताती है। इसमें विकल्प चुनने की तालिका, ऑनलाइन दुकान का उदाहरण और चार जोखिमों के साथ उनके सुरक्षा उपाय हैं; मार्गदर्शिका के अनुसार Claude, ChatGPT या Cursor, Perplexity के MCP सर्वर के ज़रिए Computer को कोई कार्य सौंप सकते हैं। 🔗 स्रोत
इसका क्या अर्थ है
अब एक एजेंट कई अन्य एजेंटों का संचालन करता है, और हर एजेंट को अपनी पहचान मिलती है। Gemini एजेंट ऐसे उप-एजेंट शुरू करता है जिनमें से प्रत्येक की अपनी पहचान होती है, और वह अपने पते वाला सहकर्मी एजेंट भी बन सकता है; Claude Managed Agents किसी एजेंट को ऐसा प्रोग्राम लिखने देता है जो 1 000 तक एजेंट शुरू कर सके; Grok Bot को बाहरी दुनिया में कार्रवाई करने के लिए ईमेल पता मिलता है, और Block एक ही माइग्रेशन में दर्जनों मॉडलों का नेतृत्व Claude Fable को सौंपता है। अब उभरता सवाल यह नहीं है कि एजेंट काम कर सकता है या नहीं, बल्कि यह है कि उसे नियंत्रण में कैसे रखा जाए। Google इसका जवाब Agent Gateway, Agent Sandbox, प्रत्येक एजेंट के नाम से ऑडिट लॉग और वास्तविक समय में खर्च की सीमाओं के ज़रिए देता है; Anthropic सत्र के लिए ऐसा बजट देता है जिसकी सीमा तक पहुँचने पर सभी निष्पादन निलंबित हो जाते हैं; OpenAI ऐसा Windows सैंडबॉक्स देता है जिसमें नेटवर्क और फ़ाइलों पर अधिक सख्त पाबंदियाँ हैं।
प्लेटफ़ॉर्म भी अब कई मॉडलों का इस्तेमाल अपना रहे हैं। Gemini विकसित करने वाला Google अपने ही एजेंट से Claude मॉडलों का संचालन करवाता है, मॉडल के चुनाव को एजेंट के चुनाव से स्पष्ट रूप से अलग रखता है, और Antigravity में Claude Opus 5.5 तथा Sonnet 5.5 उपलब्ध कराता है, जिनका शुल्क उसके अपने मॉडलों वाली खर्च सीमा में ही गिना जाता है। Genspark और Perplexity का Agent API, Claude Haiku 5.5 के लॉन्च होने के कुछ ही दिनों के भीतर उसे जोड़ते हैं, LegalOn अपने कोड संबंधी काम को कार्यों की प्रकृति के अनुसार OpenAI के तीन मॉडलों में बाँटता है, और Block मॉडल चुनने की स्वचालित प्रणाली बना रहा है।
प्रति इकाई लागत लगातार घट रही है, और हर घोषणा इसे आँकड़ों में बताती है: Qwen-Image-2.1-Turbo के लिए प्रति चित्र 0,016 डॉलर, जो Pro संस्करण से 2,5 गुना कम है; HeyGen Voice के लिए 31 अक्टूबर तक प्रति दस लाख वर्ण 15 डॉलर, फिर 30 डॉलर, जो Eleven v4 Turbo से कम है; pplx-decider-v1.1-27b के लिए प्रति 1 000 निर्णय 0,017 डॉलर; ML Intern के साथ लगभग 103 डॉलर की कंप्यूटिंग लागत में Hub पर प्रकाशित छह मॉडल। हालाँकि, शीर्ष स्थानों को ध्यान से समझना ज़रूरी है: HeyGen Voice केवल नियंत्रित आवाज़ों वाली रैंकिंग में पहले स्थान पर है, और pplx-decider अपना स्थान नौ अन्य मॉडलों के साथ साझा करता है, जिनके विश्वास अंतराल आपस में अतिव्यापित होते हैं।
स्वास्थ्य के क्षेत्र में सावधानी अब भी ज़रूरी है। The Lancet में प्रकाशित AMIE का अध्ययन व्यवहार्यता का अध्ययन है, जो एक ही केंद्र पर, नियंत्रण समूह के बिना किया गया और जिसे Alphabet ने वित्तपोषित किया: 98 मरीज़, सुरक्षा के कारण एक भी बातचीत नहीं रोकी गई, काल्पनिक जानकारी देने की एक घटना दर्ज हुई। यह व्यापक परीक्षणों की दिशा में एक कदम है, जिनकी माँग स्वयं लेखक भी करते हैं; यह न तो स्वीकृति है और न ही मरीज़ों के लिए तैनाती।
स्रोत
- Gemini at Work 2026 (Google Cloud ब्लॉग)
- Gemini Enterprise के रिलीज़ नोट्स
- HeyGen Voice की घोषणा (@HeyGen)
- Artificial Analysis के परिणाम (@ArtificialAnlys)
- Voxtral Mini 4B Realtime Arabic (Hugging Face)
- LIDstral Arabic (Hugging Face)
- Claude Managed Agents के गतिशील वर्कफ़्लो (@ClaudeDevs)
- वर्कफ़्लो निष्पादन का दस्तावेज़ीकरण (Claude Platform)
- Codex में कंपोज़र के पूर्वानुमान (@OpenAIDevs)
- कंपोज़र के पूर्वानुमानों पर सहायता लेख (OpenAI)
- Windows पर Codex के लिए MXC सैंडबॉक्स (@OpenAIDevs)
- Windows सैंडबॉक्स का दस्तावेज़ीकरण (ChatGPT Learn)
- Claude Code 2.1.296 (GitHub)
- Vibe CLI 2.26.1 (GitHub)
- Qwen-Image-2.1-Turbo (@Alibaba_Qwen)
- Qwen-Image-2.1-Turbo (Hugging Face)
- Midjourney का अल्फ़ा परिवर्तन विवरण
- Thinking मोड का परीक्षण (Midjourney)
- Syren (Synthesia)
- Playground (Google ब्लॉग)
- AMIE का नैदानिक अध्ययन (Google ब्लॉग)
- The Lancet में AMIE का अध्ययन
- OpenAI के शोध प्रमुखों का वक्तव्य (@OpenAINewsroom)
- ML Intern के साथ छह मॉडल (Hugging Face ब्लॉग)
- Ai2 का GPU शेड्यूलर (Ai2 ब्लॉग)
- Decision Bench पर pplx-decider-v1.1-27b (@perplexitydevs)
- Decision Bench रैंकिंग
- Grok Bot का ईमेल पता (@bot)
- सिंगापुर में ElevenLabs (ElevenLabs ब्लॉग)
- Claude Code में Projects (@ClaudeDevs)
- प्रभावी एजेंट स्वचालन बनाना (claude.dev)
- Block और Claude Fable (claude.com)
- Claude Platform के रिलीज़ नोट्स
- Codex CLI 0.162.1 (GitHub)
- ChatGPT Enterprise और Edu के रिलीज़ नोट्स
- Sophos और OpenAI Daybreak (OpenAI)
- Asana और StackAI का ब्राउज़िंग एजेंट (OpenAI)
- LegalOn और Codex (OpenAI)
- Gemini CLI v0.64.0-preview.1 (GitHub)
- Antigravity का परिवर्तन विवरण
- Gemini API के रिलीज़ नोट्स
- Google Flow Music के प्लगइन (Google ब्लॉग)
- Google Earth AI और सार्वजनिक स्वास्थ्य (Google ब्लॉग)
- Copilot code review की बिलिंग (GitHub परिवर्तन विवरण)
- Copilot CLI 1.0.95 (GitHub)
- GitHub MCP Server 2.0.0 (GitHub)
- Genspark में Claude Haiku 5.5 (@genspark_ai)
- v0 के लिए Meta VR मॉडल (Meta)
- टीमों के लिए v0 (@v0)
- DeepSeek Harness 0.2.1-alpha.2 (GitHub)
- OGX 1.5.0 (GitHub)
- GenIA (GitHub)
- Hub पर निर्णय मॉडल (Hugging Face परिवर्तन विवरण)
- Darwin-27B-ZTC-v2 और System One Mosaic Benchmark (Hugging Face ब्लॉग)
- निर्णय मॉडलों का विश्वास स्तर (Hugging Face ब्लॉग)
- FineEnvs/openai-math (Hugging Face)
- JOSIE-2 की तकनीकी रिपोर्ट (Hugging Face ब्लॉग)
- Gradio 6.30.0 (GitHub)
- tokenizers 0.23.3 (GitHub)
- एआई द्वारा वैज्ञानिक समीक्षा (@SakanaAILabs)
- Suno Studio का अपडेट (@suno)
- भौतिकी में विश्व मॉडलों की अंतिम परीक्षा (Einsia)
- एजेंटों द्वारा बनाए गए Omniverse सिमुलेशन (NVIDIA ब्लॉग)
- Grok Bot और Shopify (@bot)
- Grok Bot और X पर खोज (@bot)
- Grokipedia v0.3 का आकलन (@Grokipedia)
- mistral CLI 0.8.0 (GitHub)
- Mistral का Python SDK 3.2.0 (GitHub)
- Qwen Code v0.25.1-preview.1 (GitHub)
- Agent API के मॉडल (Perplexity)
- Embed और Rerank के लिए साझा या समर्पित इन्फ़रेंस (Cohere ब्लॉग)
- एजेंट या MCP (Perplexity ब्लॉग)