खोजें

OpenAI यूरोपीय संघ में ChatGPT और Codex के पाठ पर वॉटरमार्क लगाएगा, Devin सत्रों के बीच अपनी स्मृति बनाए रखेगा, GitHub ने ReviewBench जारी किया

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
OpenAI यूरोपीय संघ में ChatGPT और Codex के पाठ पर वॉटरमार्क लगाएगा, Devin सत्रों के बीच अपनी स्मृति बनाए रखेगा, GitHub ने ReviewBench जारी किया

ai-powered-markdown-translator

gpt-6.1-sol का उपयोग करके फ़्रेंच से हिंदी में अनुवादित लेख।

GitHub पर प्रोजेक्ट देखें ↗

OpenAI अगले कुछ हफ़्तों में यूरोपीय संघ के अपने उपयोगकर्ताओं के लिए ChatGPT और Codex के पाठ में एक अदृश्य वॉटरमार्क जोड़ेगा। यह AI Act के जवाब में किया जा रहा है, जो उत्पन्न पाठ को मशीन द्वारा पहचाने जाने योग्य बनाने की माँग करता है। साथ ही, आज से दुनिया भर में इसके API ग्राहकों को यह वॉटरमार्क एक विकल्प के रूप में उपलब्ध होगा। एजेंटों में स्मृति अपनी जगह बना रही है: Cognition ने Devin को सत्रों के बीच बनी रहने वाली स्मृति दी है और उसके प्रारूप को एक खुले मानक के रूप में प्रकाशित किया है, जबकि Cohere ने North 2 जारी किया है, जिसकी स्मृति एक सत्र से दूसरे सत्र तक संदर्भ बनाए रखती है; GitHub ने भी एआई द्वारा कोड समीक्षा के लिए एक खुला बेंचमार्क, ReviewBench, प्रकाशित किया है। खुले मॉडलों में Reflection AI ने 501 अरब पैरामीटर वाला Beam प्रस्तुत किया है, जिसके वेट्स अक्टूबर में आगे जारी करने का वादा किया गया है।


OpenAI का अदृश्य वॉटरमार्क: यूरोपीय संघ में ChatGPT और Codex के पाठ पर चिह्न, API में दुनिया भर के लिए विकल्प

5 अक्टूबर — OpenAI ने पाठ की उत्पत्ति से जुड़े यूरोपीय नियमों पर अपना जवाब प्रकाशित किया है। AI Act जनरेटिव एआई प्रदाताओं से माँग करता है कि वे अपने उत्पन्न पाठ को मशीन द्वारा पढ़े और पहचाने जाने योग्य बनाएँ; OpenAI चरणों में इसका जवाब दे रहा है और शुरुआत में ही चेतावनी देता है कि मौजूदा पाठ वॉटरमार्क तकनीकों की महत्त्वपूर्ण सीमाएँ हैं (महत्त्वपूर्ण सीमाएँ)।

प्रभावित उपयोगकर्ताक्या बदल रहा हैघोषित समयसीमा
यूरोपीय संघ में ChatGPT और Codex के उपयोगकर्ता, सभी योजनाएँपात्र पाठ में अदृश्य वॉटरमार्क जोड़ा जाएगाअगले कुछ हफ़्तों में
दुनिया भर के API ग्राहकचुनिंदा, अनाम मॉडलों पर वैकल्पिक वॉटरमार्क (ऑप्ट-इन), डिफ़ॉल्ट रूप से बंद5 अक्टूबर से
स्वीकृत शोधकर्ता और विशेषज्ञ संगठनआवेदन के आधार पर, प्रत्येक मामले के अनुसार डिटेक्टर तक पहुँचआवेदन 5 अक्टूबर से खुले

OpenAI इसे दुनिया भर में डिफ़ॉल्ट सेटिंग नहीं बना रहा है और क्लाउड साझेदारों के साथ काम कर रहा है, ताकि अगले कुछ हफ़्तों में उनके द्वारा उपलब्ध कराए जाने वाले OpenAI मॉडलों पर भी यही वॉटरमार्क दिया जा सके। यह तकनीक, textGrain, मॉडल के शब्द चयन में एक अदृश्य सांख्यिकीय संकेत जोड़ती है, जिसमें कोई दिखाई देने वाला चिह्न या विशेष वर्ण नहीं होता; OpenAI के अनुसार, इसका प्रदर्शन जाँचे गए अन्य तरीकों के बराबर या उनसे बेहतर है, जिनमें पाठ के लिए SynthID भी शामिल है। एक तकनीकी रिपोर्ट प्रकाशित की गई है और OpenAI इसका कोड खोलने की योजना बना रहा है। दूसरी ओर, डिटेक्टर शुरुआत में सार्वजनिक नहीं है, क्योंकि वॉटरमार्क छूट जाने और गलत सकारात्मक परिणाम मिलने का जोखिम है: इसकी पहुँच यूरोपीय आयोग की आचार संहिता (आचार संहिता) के अनुसार दी जाती है।

प्रकाशित आँकड़े मुख्यतः पहचान की सीमाएँ दिखाते हैं:

मापन की स्थितिप्रकाशित पहचान दर
200 tokens के अंश, मनोविज्ञान जैसी सामग्री, गलत सकारात्मक परिणामों का लक्षित स्तर 1 %लगभग 80 %
400 tokens के अंश, मनोविज्ञान जैसी सामग्री, गलत सकारात्मक परिणामों का लक्षित स्तर 1 %लगभग 95 %
गणित जैसी सामग्री, वही 1 % की सीमाकाफ़ी कम (मान केवल एक ग्राफ़ में दिया गया है)
अंग्रेज़ी में 400 tokens के अंश (ELI5 डेटासेट), बिना बदलाव केलगभग 92 %
वही अंश, 10 % शब्द पर्यायवाची शब्दों से बदले गए66 %
वही अंश, 25 % शब्द बदले गए17 %

Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.

🇮🇳 वॉटरमार्क की सीमाएँ हैं। अक्सर उनका पता नहीं लगाया जा सकता, ख़ासकर छोटे अंशों में। किसी पाठ को दोबारा लिखने या उसका अनुवाद करने से वॉटरमार्क पूरी तरह हट सकता है। — X पर @OpenAI

गुणवत्ता के मामले में OpenAI को GPT-6 Astra के आठ बेंचमार्क में वॉटरमार्क के बिना और उसके साथ कोई महत्त्वपूर्ण अंतर नहीं मिला है (GPQA Diamond पर 94,44 % बनाम 93,94 %, Terminal-Bench 4.0 पर 53,90 % बनाम 56,06 %)। लेख यह भी स्पष्ट करता है कि वॉटरमार्क क्या नहीं बताता: मानव कार्य का हिस्सा, पाठ का स्वामित्व या उसकी ज़िम्मेदारी, उपयोगकर्ता की पहचान और पाठ की सटीकता; इनमें से कुछ भी नहीं। साथ ही, वॉटरमार्क का न होना यह साबित नहीं करता कि पाठ किसी मानव ने लिखा है। चित्रों और ऑडियो के लिए कुछ नहीं बदलता: openai.com/verify और Content Provenance API संगठनों के लिए उपलब्ध रहते हैं, और 19 मई से उत्पन्न चित्रों के C2PA मेटाडेटा के साथ SynthID भी जोड़ा जाता है।

🔗 यूरोपीय संघ में पाठ की उत्पत्ति पर OpenAI का लेख


5 अक्टूबर — Cognition ने Devin में दो संबंधित सुविधाएँ पेश की हैं: Memory, एक ऐसी स्मृति जो एक सत्र से दूसरे सत्र तक बनी रहती है, और Dreaming, एक दैनिक « स्वप्न » जो उसे पुनर्व्यवस्थित करता है। Memory वह सब सँभालकर रखती है जो एजेंट प्रत्येक उपयोगकर्ता के साथ काम करते हुए सीखता है: प्राथमिकताएँ, सुधार, किसी परियोजना या कार्यप्रवाह से मिले सबक। ये सत्रों के सारांश नहीं, बल्कि छोटे नोट हैं। हर नोट उस सत्र से जुड़ा होता है जिसमें वह सबक सीखा गया था, और यह स्मृति व्यक्तिगत रहती है: यह पूरे संगठन के लिए साझा निर्देश नहीं बनती।

ये नोट Memory Drive में रहते हैं, जो Markdown फ़ाइलों का एक स्थायी Git रिपॉज़िटरी है, जिसमें फ़ाइलें रिपॉज़िटरी, परियोजना या विषय के अनुसार व्यवस्थित होती हैं। जानबूझकर छोटी रखी गई एक MEMORY.md फ़ाइल सामान्य प्राथमिकताओं और बाकी सामग्री की अनुक्रमणिका को एक साथ रखती है: Devin को यह प्रत्येक सत्र की शुरुआत में मिलती है, फिर वह कोड में खोज करने वाले अपने उपकरणों से उपयोगी नोट ढूँढ़ता है, बिना पूरे संग्रह को अपने प्रॉम्प्ट में लोड किए। प्रत्येक सत्र अपनी अलग Git प्रति पर काम करता है: Devin दूसरे सत्रों के अपडेट मर्ज करता है, रिवीज़न की जाँच पुराने संस्करण पर आधारित लिखने के प्रयासों को अस्वीकार करती है, और टकरावों को चुपचाप अधिलेखित करने के बजाय उनकी सूचना दी जाती है।

Dreaming पृष्ठभूमि में चलने वाला दैनिक सत्र है (Cognition के पोस्ट क्रम के अनुसार, रात में): Devin अपनी स्मृति के संदर्भ में पिछली बातचीत दोबारा पढ़ता है, मिलते-जुलते नोटों को मर्ज करता है, अस्थायी विवरण हटाता है, ऐसे सबक ढूँढ़ता है जिन्हें पहले दर्ज नहीं किया गया था और उन स्मृतियों को मिटाता है जिनका किसी सत्र ने उपयोग नहीं किया। पहुँच devin.ai पर Customize → Memory मेन्यू से मिलती है; लेख में Devin Desktop या Devin CLI का कोई उल्लेख नहीं है और किसी कीमत की घोषणा नहीं की गई है।

Cognition ने इस प्रारूप को Agent Memory Repo नाम के एक खुले मानक के रूप में MIT लाइसेंस के तहत भी प्रकाशित किया है। योगदान के लिए खुला यह विनिर्देश हर सत्र के चक्र का वर्णन करता है (स्मृति क्लोन करना, खोज करना, किसी मानव की भागीदारी के बिना अपडेट करना, प्रत्येक बदलाव के बाद पुश करना) और एक ही सत्र में कई स्मृतियों को साथ इस्तेमाल करने का तरीका बताता है, जिनमें से प्रत्येक अपने अधिकारों और इतिहास के साथ अपने अलग रिपॉज़िटरी में रहती है। बताए गए उपयोगों में टीम की स्मृति और एजेंटों के झुंड (एजेंटों के झुंड) शामिल हैं:

In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)

🇮🇳 शुरुआती प्रयोगों के दौरान हमने Devin के एक झुंड को बड़े पैमाने पर समन्वय करने के लिए स्मृति का इस्तेमाल करते देखा, जबकि हमने उनसे ऐसा करने को कहा भी नहीं था (वादा रहा, उन्होंने किसी को हैक नहीं किया)। — X पर @cognition

किसी एजेंट की स्मृति को पुनर्व्यवस्थित करने वाला « स्वप्न » Anthropic (मई में Claude Managed Agents) और OpenAI (जून में ChatGPT की स्मृति) में पहले से मौजूद था; यहाँ बदलाव यह है कि स्मृति Git से संस्करण नियंत्रित फ़ाइलों में रखी जाती है और उसे ऐसे विनिर्देश के रूप में प्रकाशित किया गया है जिसे दूसरे एजेंट अपना सकते हैं।

🔗 स्मृति और स्वप्न, Cognition का लेख 🔗 Agent Memory Repo का विनिर्देश

Cursor: निष्पादन के दौरान अपने SDK के एजेंटों को दिशा देना

5 अक्टूबर — Cursor ने अपने SDK में नई सुविधाएँ जोड़ी हैं, जिससे TypeScript या Python कोड से उसके एजेंट चलाए जा सकते हैं। run.steer() विधि किसी एजेंट के चल रहे टर्न में एक संदेश जोड़ती है; यदि उस समय कोई उप-एजेंट काम कर रहा हो, तो वह पृष्ठभूमि में चला जाता है और काम जारी रखता है। पृष्ठभूमि के उप-एजेंट अपने परिणाम भी भेजते हैं: उनका परिणाम उसी निष्पादन के एक अतिरिक्त टर्न के रूप में मूल एजेंट तक लौटता है, बजाय इसके कि मूल एजेंट का टर्न समाप्त होने पर खो जाए।

SDK की नई सुविधाबदलावों की सूची में बताया गया दायरा
run.steer(), निष्पादन के दौरान नियंत्रणTypeScript में स्थानीय एजेंट; क्लाउड एजेंट पर संदेश सामान्य अनुवर्ती अनुरोध के रूप में भेजा जाता है
पृष्ठभूमि के उप-एजेंटों के परिणामों की वापसीस्थानीय एजेंट, TypeScript और Python में
कस्टम उपकरणों के MCP एनोटेशन (readOnlyHint, destructiveHint…)TypeScript; केवल संकेत, जिनका पालन SDK लागू नहीं करता
बदला जा सकने वाला सिस्टम प्रॉम्प्ट, नियम और स्किल्स हमेशा लोड रहते हैंTypeScript में स्थानीय एजेंट; पहुँच प्रत्येक खाते के लिए अलग से सक्रिय की जाती है

इन बदलावों के साथ किसी कीमत की घोषणा नहीं की गई है।

🔗 X पर Cursor के पोस्ट का क्रम 🔗 Cursor SDK के बदलावों की सूची

Qwen Code v0.25.0: कार्यक्षेत्र के एजेंट, ईमेल चैनल और Mem0 स्मृति

5 अक्टूबर — Qwen ने अपने कमांड लाइन प्रोग्रामिंग एजेंट Qwen Code का v0.25.0 प्रकाशित किया है। यह 29 सितंबर के v0.24.7 के बाद पहला स्थिर संस्करण है: 42 सुविधाएँ, जिनमें 23 Managed Agent के लिए हैं, 79 सुधार और मौजूदा कार्यप्रणाली को बाधित करने वाला कोई ज्ञात बदलाव नहीं। तीन नई सुविधाएँ विशेष रूप से उल्लेखनीय हैं, और तीनों को स्पष्ट रूप से सक्रिय करना पड़ता है। कार्यक्षेत्र के एजेंट अब स्थानीय रूप से सहयोग करते हैं: डेमन उनके टर्न शुरू करता है और फिर से चलाता है, जबकि Web Shell से एजेंटों और कार्यों को प्रबंधित किया जा सकता है तथा बातचीत में @agent के ज़रिए किसी एजेंट को बुलाया जा सकता है। ये स्थायी एजेंट A2A 1.0 प्रोटोकॉल से भी जुड़ते हैं, ऐसे साझाकरणों के माध्यम से जिनकी समय सीमा समाप्त होती है और जिन्हें रद्द किया जा सकता है। अंत में, Mem0 स्मृति सीधे CLI से जुड़ती है: बस एक एंडपॉइंट और एक कुंजी बतानी होती है, और Qwen Code संबंधित MCP सर्वर को स्वयं पंजीकृत कर देता है। एक ईमेल चैनल एजेंट को IMAP और SMTP के साथ अपना मेलबॉक्स भी देता है, और Code Mode उन Bash कॉल को समानांतर चलाता है जिन्हें मॉडल एक समूह में रखता है। TypeScript SDK v0.1.18 और Desktop एप्लिकेशन v0.25.0 भी उसी सुबह जारी हुए, Qwen के किसी ट्वीट के बिना।

🔗 Qwen Code v0.25.0 के संस्करण विवरण

5 अक्टूबर — Together AI ने Together Link का बीटा जारी किया है, जो पहले से इंस्टॉल कोड एजेंटों को प्लेटफ़ॉर्म पर होस्ट किए गए खुले मॉडलों पर चलाता है। इंस्टॉलेशन की एक कमांड (macOS या Linux) खाते की कुंजी के साथ Claude Code, Claude Desktop, Codex, OpenCode और Pi को इसके API से जोड़ती है; दस्तावेज़ों में ChatGPT Desktop भी शामिल है और चेतावनी दी गई है कि कमांड, रूटिंग और मॉडलों की सूची अभी बदल सकती है। Auto मोड के अलावा चार मॉडल उपलब्ध हैं, और सभी में 1M tokens का संदर्भ है:

उपलब्ध मॉडलClaude Code के /model मेन्यू में समकक्ष
Kimi K3Opus
GLM 5.3Fable
GLM 5.3 FlashSonnet
DeepSeek V4.1 FlashHaiku

डिफ़ॉल्ट रूप से चुना गया Auto मोड कठिन कार्य Opus 5.5 को सौंप सकता है, जब उपयोगकर्ता Anthropic की कुंजी देता है। हालाँकि, लेख और दस्तावेज़ इस रूटिंग का एक जैसा वर्णन नहीं करते: लेख के अनुसार, प्रॉम्प्ट कैश सुरक्षित रखने के लिए प्रत्येक सत्र में केवल एक बार चयन किया जाता है; दस्तावेज़ों के अनुसार, यह अनुरोध दर अनुरोध चयन है जो केवल Claude Code और Claude Desktop के लिए उपलब्ध है। Together AI ने 50 % से अधिक खर्च घटने की घोषणा की है, लेकिन उसकी पद्धति प्रकाशित नहीं की है। प्रत्येक सत्र के बाद वह उसकी लागत के साथ यह भी दिखाता है कि वही सत्र Opus 5.5 पर कितना महँगा पड़ता।

🔗 Together AI का लेख 🔗 Together Link के दस्तावेज़

स्वयं होस्ट किया गया IBM Bob, NVIDIA के Nemotron 3 Ultra पर आधारित है

5 अक्टूबर — IBM ने बताया है कि उसके एजेंट आधारित विकास सहायक Bob का स्वयं होस्ट किया गया (स्वयं होस्ट किया गया) संस्करण, Poolside Laguna S 2.1 के साथ NVIDIA के Nemotron 3 Ultra पर क्यों आधारित है। यह विकल्प, जो पिछले सप्ताह सामान्य उपलब्धता में आया था, सहायक को ग्राहक के बुनियादी ढाँचे पर चलाता है, यहाँ तक कि नेटवर्क से अलग (नेटवर्क से पूरी तरह अलग) परिवेशों में भी। टीम ने मॉडलों को चार मानदंडों पर परखा (हार्डवेयर की आवश्यकता, कोड की सटीकता, विलंब, वेट्स का खुलापन), Bob के एजेंट हार्नेस के साथ उनका परीक्षण किया और Anthropic, OpenAI तथा Google के बंद मॉडलों को तुलना के आधार के रूप में इस्तेमाल किया। शुरुआत में ज़रूरत से ज़्यादा विस्तार से जवाब देने वाले Nemotron को NVIDIA के साथ मिलकर समायोजित किया गया: प्रॉम्प्ट, सैंपलिंग पैरामीटर, तर्क की सेटिंग और हार्नेस में सुधार। IBM के आंतरिक परीक्षणों के अनुसार, Blackwell GPU पर Nemotron 3 Ultra का विलंब नेटवर्क के ज़रिए बुलाए जाने वाले अग्रणी SaaS मॉडलों की तुलना में लगभग 4 गुना तक कम है, और यह उपकरणों के स्कीमा का कड़ाई से पालन करता है; Laguna S 2.1 को प्रदर्शन और संसाधन आवश्यकता के अनुपात के लिए चुना गया है। लेख में सटीकता का कोई स्कोर प्रकाशित नहीं किया गया है।

🔗 स्वयं होस्ट किए गए Bob पर IBM का लेख


ReviewBench : GitHub ने एआई से कोड समीक्षा के लिए खुला बेंचमार्क पेश किया

5 अक्टूबर — GitHub ने शोध पूर्वावलोकन (रिसर्च प्रीव्यू) के रूप में ReviewBench पेश किया है, जो एआई कोड समीक्षा एजेंटों के लिए एक खुला बेंचमार्क है। इसकी समर्पित वेबसाइट पर पूरा डेटासेट, रैंकिंग, कार्यप्रणाली, प्रॉम्प्ट और मूल्यांकनकर्ता का कॉन्फ़िगरेशन, साथ ही स्वयं परीक्षण चलाने की सुविधा उपलब्ध है। लेख मिशेल झोउ और अलेहांद्रो कार्डेरेरा दे दिएगो ने लिखा है, और इसके आभार अनुभाग में GitHub और Microsoft को इस परियोजना से जोड़ा गया है।

इस संग्रह में 19 भाषाओं के 187 सार्वजनिक ओपन सोर्स रिपॉज़िटरी से ली गई 219 पुल रिक्वेस्ट शामिल हैं। भाषाओं और रिपॉज़िटरी के आकार का इसका वितरण GitHub के वितरण को दोहराता है, जिसे 103,9 मिलियन पुल रिक्वेस्ट के आधार पर निर्धारित किया गया है; इसमें जानबूझकर मध्यम और बड़े बदलावों को अधिक भार दिया गया है। आधार-सत्य (गोल्डन सेट) में मानव समीक्षकों, बाद के कमिट से निकाली गई समस्याओं, नियतात्मक विश्लेषण उपकरणों और कई अग्रणी LLM के निष्कर्षों को मिलाया गया है; निष्कर्षों की पुष्टि एक मूल्यांकनकर्ता LLM करता है, जो लेख के अनुसार Claude Sonnet 5 है। डेटासेट बनाने में शामिल नहीं रहे वरिष्ठ इंजीनियरों ने हर निष्कर्ष को दोबारा लेबल किया: 96,6 % मामलों में उनका निर्णय ReviewBench से मेल खाता है। केवल आधार-सत्य पर मापा गया « आधार-सत्य आधारित » (ग्राउंडेड) रिकॉल मुख्य तुलना का आधार है।

GitHub की शुरुआती रैंकिंग के अनुसार, Copilot code review पहले स्थान पर है:

मूल्यांकित एजेंट (कॉन्फ़िगरेशन)आधार-सत्य आधारित F1आधार-सत्य आधारित सटीकताआधार-सत्य आधारित रिकॉलपरीक्षण की तारीख
Copilot Code Review (Balanced)40,1 %87,8 %26,0 %1 अक्टूबर 2026
Devin AI37,0 %84,0 %23,8 %28 सितंबर 2026
Qodo35,1 %85,3 %22,1 %28 सितंबर 2026
Codex (GPT-5.6 Sol · Ultra)32,3 %87,0 %19,9 %19 जुलाई 2026
Cubic27,3 %85,5 %16,3 %29 जून 2026
Greptile27,2 %86,1 %16,2 %16 जून 2026
Cursor17,3 %87,7 %9,6 %27 सितंबर 2026

वेबसाइट स्पष्ट करती है कि ये शुरुआती प्रविष्टियाँ ReviewBench टीम ने दी गई तारीख पर प्रत्येक विक्रेता के सार्वजनिक उत्पाद को चलाकर तैयार की थीं, और विक्रेताओं ने इन्हें न तो चलाया था और न ही सत्यापित किया था। अब कोई भी अपना एजेंट प्रस्तुत कर सकता है: उम्मीदवार कंटेनर इमेज और मॉडल की कुंजी देता है, GitHub मूल्यांकनकर्ता उपलब्ध कराता है, पहले 25 पुल रिक्वेस्ट पर परीक्षण होता है और फिर तीन चरणों में पूरा परीक्षण चलाया जाता है; स्कोर किसी मेंटेनर की पुष्टि के बाद ही प्रकाशित होता है, और तभी जब वह एजेंट के पिछले स्कोर से बेहतर हो या उसकी पहली प्रविष्टि हो।

GitHub इसका उपयोग Copilot code review को बेहतर बनाने के लिए भी करता है। A/B परीक्षण में Lite स्तर की एक बहु-मॉडल समीक्षा, जो कई स्वतंत्र परीक्षणों को जोड़ती है, ने रिकॉल में 13,6 % की बढ़ोतरी की और प्रति समीक्षा लागत 8,0 % घटाई; यह ऑफ़लाइन परीक्षणों में अनुमानित दिशा के अनुरूप था। टिप्पणियों की संख्या को लेकर लेख में विरोधाभास है: पाठ के अनुसार +61 %, जबकि उसके ग्राफ़ के अनुसार +25,0 %।

🔗 ReviewBench पर GitHub का लेख 🔗 ReviewBench की वेबसाइट और रैंकिंग


Cohere ने North 2 पेश किया और PwC के साथ वैश्विक गठबंधन किया

5 अक्टूबर — Cohere ने North 2 पेश किया है, जो उद्यमों के लिए उसके एआई एजेंट प्लेटफ़ॉर्म North का नया संस्करण है। इसे 9 सितंबर को « जल्द उपलब्ध » बताया गया था और फिर अक्टूबर में जारी करने का वादा किया गया था। लॉन्च संबंधी पोस्टों की शृंखला में 15 से अधिक नई सुविधाओं (15+ नई सुविधाएँ) का दावा किया गया है, लेकिन लेख में यह संख्या नहीं दोहराई गई है। इस संस्करण के केंद्र में नया एजेंट हार्नेस (एजेंट संचालन ढाँचा) है, जिसे कई चरणों वाले स्वचालन और एजेंटों के लिए फिर से बनाया गया है। प्लेटफ़ॉर्म किसी विशेष मॉडल तक सीमित नहीं है: इसमें Cohere के मॉडल या ग्राहक के मॉडल इस्तेमाल किए जा सकते हैं।

कार्यात्मक क्षेत्रCohere द्वारा बताई गई नई सुविधाएँ
एजेंटदोबारा इस्तेमाल किए जा सकने वाले एजेंट और स्वचालन, जिन्हें प्रॉम्प्ट से बनाया जा सकता है और संगठन में साझा किया जा सकता है; कई एजेंटों का समन्वय; ऐसी मेमोरी जो एक सत्र से अगले सत्र तक संदर्भ बनाए रखती है
उत्पादकताकौशल (Skills), लाइब्रेरी (Libraries) और ऐसे ऐप्लिकेशन जो प्रस्तुतियाँ, डैशबोर्ड और दस्तावेज़ बनाते हैं; जुलाई के अंत में पेश किए गए Automations, जिनमें तैयार टेम्पलेट और दृश्य संपादक उपलब्ध हैं
कनेक्टरSlack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion और GitHub; वित्तीय डेटा प्रदाता (PitchBook, FactSet और अन्य) अभी केवल नियोजित हैं
परिनियोजन और सुरक्षास्वयं होस्ट किया हुआ, VPC, हाइब्रिड, परिसर में या पूरी तरह डिस्कनेक्टेड; SOC 2 Type 2, ISO 27001 और ISO 42001; स्वायत्तता संबंधी नीतियाँ, जिनमें महत्वपूर्ण निर्णयों की मानव पुष्टि शामिल है
शासनNorth Admin कंसोल, प्रति उपयोगकर्ता या समूह अनुरोधों और टोकन की खपत के स्तर, अधिकतम सीमा तक पहुँचने से पहले चेतावनियाँ

Cohere ने दो ग्राहकों का उल्लेख किया है, दक्षिण कोरिया में LG CNS और कनाडा में Bell Cyber। कंपनी NVIDIA Blackwell और Hopper GPU पर अपने मॉडलों के बेहतर थ्रूपुट को भी रेखांकित करती है, लेकिन कोई आँकड़ा नहीं देती; इसके साथ NVIDIA में जनरेटिव एआई की प्रमुख कारी ब्रिस्की का कथन दिया गया है। कोई कीमत या परिनियोजन की समय-सारणी नहीं बताई गई है: लेख बिक्री टीमों के साथ प्रदर्शन बुक करने की ओर निर्देशित करता है।

🔗 North 2 के लॉन्च का लेख 🔗 X पर North 2 के लॉन्च संबंधी पोस्टों की शृंखला

PwC के साथ वैश्विक गठबंधन, जिसकी शुरुआत कनाडा से होगी

5 अक्टूबर — उसी दिन PwC और Cohere ने एक वैश्विक गठबंधन (विश्वव्यापी साझेदारी) की घोषणा की, जिसकी शुरुआत कनाडा से होगी। यह घोषणा टोरंटो से जारी PwC Canada की प्रेस विज्ञप्ति में की गई, जिसे Cohere के एक छोटे लेख ने साझा किया। भूमिकाओं का विभाजन स्पष्ट है: Cohere अपना North प्लेटफ़ॉर्म, उद्यमों के लिए मॉडल और सूचना खोज उपकरण देता है; PwC क्षेत्रीय, नियामकीय, जोखिम प्रबंधन और रूपांतरण संबंधी विशेषज्ञता लाता है, जो उपयोग के मामलों के चयन से लेकर एआई को उद्यम के डेटा और प्रणालियों के साथ जोड़ने तक फैली है। बताए गए उपयोगों में उद्यम के भीतर खोज, ज्ञान तक पहुँच, गहन शोध, निर्णय लेने में सहायता और कार्यों का स्वचालन शामिल हैं। ये निजी क्लाउड, परिसर में या डिस्कनेक्टेड परिवेश में उपलब्ध होंगे, और प्राथमिक लक्ष्य नियमन के अधीन क्षेत्र हैं। प्रेस विज्ञप्ति में PwC Canada के डोमिनिक मरीनो और एनी वेये तथा Cohere के एडन गोमेज़ के कथन हैं; इसमें किसी रकम, ग्राहक या कनाडा से आगे की समय-सारणी का उल्लेख नहीं है। Cohere ने इससे पहले 16 सितंबर को OpenText के साथ गठबंधन किया था।

🔗 PwC के साथ गठबंधन पर Cohere का लेख 🔗 PwC Canada की प्रेस विज्ञप्ति


खुले मॉडल : Beam, MetaEncoder-30B और पौधों की जीनोमिक्स में Gemma 4

आज तीन खुले मॉडल चर्चा में हैं, और तीनों अलग-अलग चरणों में हैं: एक को जारी करने का वादा किया गया है, दूसरा बिना घोषणा के ऑनलाइन उपलब्ध हुआ है, और तीसरे को प्रकाशित होने के एक महीने बाद प्रमुखता दी गई है।

Beam : Reflection AI का 501 अरब पैरामीटर वाला खुला मॉडल

5 अक्टूबर — Reflection AI ने Beam प्रस्तुत किया है, जो खुले वज़न वाला उसका पहला मॉडल है: यह 501 अरब पैरामीटर वाला स्पार्स MoE है, जिनमें 23 अरब सक्रिय हैं। इसे कोड, तर्क और एजेंट संबंधी कार्यों के लिए बनाया गया है तथा शून्य से शुरू करके शुरू से अंत तक प्रशिक्षित किया गया है। पूर्व-प्रशिक्षण में 23 800 अरब टोकन इस्तेमाल हुए; रीइन्फोर्समेंट लर्निंग के चरण में चार सप्ताह तक 10 500 NVIDIA GB300 GPU इस्तेमाल हुए और 100 मिलियन से अधिक प्रक्षेपपथ (रोलआउट) तैयार किए गए।

Reflection AI की तालिकाओं के अनुसार:

मूल्यांकित बेंचमार्कBeamNemotron 3 UltraGLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
SWE-bench Verified80,970,7————
SWE Bench Pro v165,546,4——67,7—
Terminal Bench v2.180,156,488,288,386,690,6
DeepSWE v1.144,4—61,068,051,074,2

डैश का अर्थ है कि लेख में स्कोर नहीं बताया गया है। Reflection AI का दावा है कि उसे GLM-5.2 के तुलनीय तर्क संबंधी स्कोर मिले हैं, जबकि इन्फ़रेंस के लिए 3 से 4 गुना कम गणना की आवश्यकता पड़ती है। कंपनी स्वीकार करती है कि मूल क्षमता में Kimi K3 अभी भी आगे है। अभी कुछ भी डाउनलोड करने के लिए उपलब्ध नहीं है: Beam का अंतिम मूल्यांकन और प्रतिकूल परीक्षण (रेड-टीमिंग) चल रहे हैं, शुरुआती पहुँच के लिए पंजीकरण करना पड़ता है, और वज़न, तकनीकी रिपोर्ट, मॉडल कार्ड तथा डेवलपर उपकरण अक्टूबर में बाद में जारी करने का वादा किया गया है।

🔗 Beam पर Reflection AI का लेख

MetaEncoder-30B, निर्णय एनकोडर जिसे Meta ने बिना घोषणा के ऑनलाइन उपलब्ध कराया

5 अक्टूबर — Meta ने Hugging Face पर अपने facebook संगठन के अंतर्गत MetaEncoder-30B ऑनलाइन उपलब्ध कराया है, लेकिन इसकी कोई घोषणा नहीं मिली: रिपॉज़िटरी 30 सितंबर को बनाई गई और 5 अक्टूबर को संशोधित हुई; हमारे निरीक्षण के समय इसमें केवल दो डाउनलोड दर्ज थे। मॉडल कार्ड इसे « System One » मल्टीमॉडल एनकोडर बताता है, जो Jev के निर्णय मॉडलों का प्रारूप है: इसे प्राकृतिक भाषा में एक कार्य (प्रश्न, निर्देश, स्थिति का विवरण, मानदंड) और विकल्पों की सूची दी जाती है। विकल्प पाठ में होते हैं, जिनके समर्थन में चित्र और वीडियो दिए जा सकते हैं, और यह हर विकल्प को स्कोर देता है। कार्य और विकल्प अलग-अलग एनकोड किए जाते हैं, इसलिए तुलना एक अदिश गुणनफल तक सीमित हो जाती है, और निकटतम पड़ोसियों का इंडेक्स मॉडल को दोबारा चलाए बिना लाखों विकल्पों को शामिल कर सकता है। MetaEncoder, Muse Glimmer 30B की कॉन्ट्रास्टिव फ़ाइन-ट्यूनिंग है। Muse Glimmer 30B खुले वज़न वाला एजेंट संबंधी मॉडल है, जिसे Meta ने अगस्त में जारी किया था; MetaEncoder को उसी से Apache 2.0 लाइसेंस मिला है। डाउनलोड करने के लिए शर्तें स्वीकार करनी होती हैं, और vLLM इसे पाठ और चित्र के लिए सर्व करता है।

मूल्यांकन बेंचमार्कमॉडल कार्ड के अनुसार स्कोरइस्तेमाल किया गया मेट्रिक
JEVBench (मूल / आसान / कठिन)0,9444 / 1,0000 / 0,7387शुद्धता
ImaJEV-Bench0,8958शुद्धता
NanoBEIR0,6632NDCG_linear@10
MMEB-V3 (चित्र / वीडियो / दृश्य दस्तावेज़)0,7897 / 0,6046 / 0,8138Hit@1 / Hit@1 / NDCG@5

🔗 Hugging Face पर MetaEncoder-30B का मॉडल कार्ड

Living Models ने पौधों के डीएनए को समझने के लिए Gemma 4 और BOTANIC-1 को जोड़ा

5 अक्टूबर — Google ने @GoogleAI के एक X Article और अपनी Gemmaverse प्रदर्शनी में पेरिस स्थित एआई जीवविज्ञान प्रयोगशाला Living Models के काम को प्रमुखता दी है। इसमें Gemma 4 E4B विश्लेषण का समन्वय करता है (टर्मिनल में प्रसंस्करण पाइपलाइन, डेटा फ़िल्टर करना, उपकरणों को कॉल करना), और Ollama के माध्यम से एक NVIDIA L4 GPU पर स्थानीय रूप से चलता है। वहीं BOTANIC-1, जो 320 पादप प्रजातियों पर पूर्व-प्रशिक्षित जीनोमिक्स का फ़ाउंडेशन मॉडल है, उत्परिवर्तनों के प्रभाव का मूल्यांकन करता है; मालिकाना जीनोम परिसर में ही रहते हैं। यह केस स्टडी INRAE में अदनान बुआलेम द्वारा की गई खोज पर आधारित है: खरबूजे के CmEIN3 जीन में केवल एक अक्षर बदलने से फूल मादा से उभयलिंगी हो जाता है। X Article के अनुसार, 2 494 संभावित बिंदु उत्परिवर्तनों में से सत्यापित उत्परिवर्तन चार मिनट से कम समय में अकेले पहले स्थान पर आया।

परीक्षण किया गया कॉन्फ़िगरेशन (20 बार चलाया गया)Recall@1
मार्गदर्शन के बिना0,00
विशेषज्ञ मार्गदर्शन0,15
BOTANIC-1 के स्कोर के साथ0,90

Botanic1 मॉडल (0,3 से 2 अरब पैरामीटर वाले) और bioRxiv प्रीप्रिंट सितंबर की शुरुआत के हैं: नई बात Google द्वारा इन्हें प्रमुखता देना और परिणामों का विस्तृत विवरण है।

🔗 Google AI का X Article 🔗 Google DeepMind का Gemmaverse पृष्ठ


ChatGPT में विज्ञापन : एक दृश्य प्रारूप का परीक्षण और मापन का विस्तार

5 अक्टूबर — OpenAI, ChatGPT के लिए एक दृश्य विज्ञापन प्रारूप तैयार कर रहा है: चित्र किसी उत्पाद से जुड़ी प्रेरणा, उसके इस्तेमाल या उससे संभव होने वाले अनुभव को दिखाएँगे। पहला परीक्षण चित्र बनाने के दौरान होगा। विज्ञापनों पर स्पष्ट लेबल होगा और वे बनाए जा रहे चित्र से अलग होंगे; परीक्षण इस महीने के अंत में अमेरिका में विज्ञापनदाताओं के शुरुआती समूह के साथ शुरू होगा। OpenAI ने दोहराया है कि विज्ञापन ChatGPT के उत्तरों को प्रभावित नहीं करते। कंपनी के अनुसार ChatGPT हर सप्ताह 1,2 अरब लोगों तक पहुँचता है।

अधिकांश घोषणाएँ मापन से जुड़ी हैं: Hightouch, Tealium और LiveRamp के माध्यम से कन्वर्ज़न भेजना, एट्रिब्यूशन के दस साझेदारों के नाम बताना (जिनमें AppsFlyer, Adjust और Triple Whale शामिल हैं), Haus, Measured और WorkMagic के साथ भौगोलिक स्तर पर अतिरिक्त प्रभाव मापने के प्रयोग, रिपोर्टों में विज्ञापन दिखने के बाद कन्वर्ज़न की एक दिन की अवधि और संकेतों की गुणवत्ता का सूचक (Event Quality Score)। ब्रांड सुरक्षा के मामले में पात्र विज्ञापनदाता कुछ वाक्यांशों को बाहर रख सकते हैं (Negative Phrases), और DoubleVerify तथा Integral Ad Science के साथ मूल्यांकन के पायलट परीक्षण तैयार किए जा रहे हैं। पिक्सेल और Conversions API, दोनों 5 मई से उपलब्ध हैं।

OpenAI द्वारा प्रकाशित परिणामप्रकाशित मानमापन करने वाला
भुगतान वाले सर्च विज्ञापनों के अपने बेंचमार्क की तुलना में WeightWatchers की प्रति अधिग्रहण लागत−15,3 %DV Rockerbox
नए ग्राहकों द्वारा की गई Dose ब्रांड की अतिरिक्त खरीदें67 %WorkMagic
ChatGPT Ads से आए Portland Leather के ऐसे आगंतुक जो ब्रांड के लिए नए थे93 %Triple Whale

🔗 नए विज्ञापन प्रारूप पर OpenAI का लेख 🔗 मापन पर Ads ब्लॉग का लेख


5 अक्टूबर का Perplexity बदलाव विवरण: Computer के लिए ब्राउज़र एक्सटेंशन, Wiley और Stripe Projects

5 अक्टूबर — Perplexity ने उत्पाद में बदलावों का 18 विषयों वाला विवरण प्रकाशित किया है; हमारी जानकारी दर्ज करने के समय तक इसे X पर साझा नहीं किया गया था। आठ विषयों में पहले से शामिल घोषणाएँ दोहराई गई हैं (Automations, Claude Opus 5.5, वीडियो निर्माण, Skills American Express, AMD पर Portable Computer, Fast Search, Agent API के Profiles, Claude Fable 5.1), नौवाँ विषय 1 अक्टूबर के ग्राफ़ में इंटरैक्टिव 3D व्याख्याएँ जोड़ता है, और नौ बदलाव पहली बार सामने आए हैं:

पहली बार सामने आया बदलावप्लेटफ़ॉर्म या संस्करणसंबंधित उपयोगकर्ता
Chrome, Edge या Brave के लिए एक्सटेंशन, जो Computer को ब्राउज़र इस्तेमाल करने देता है (Comet डिफ़ॉल्ट बना रहता है)Mac के लिए Perplexity 26.38.0 और बाद के संस्करणनिर्दिष्ट नहीं
अलग टैब और विंडो में Computer के कार्यMac के लिए Perplexity 26.37.1 और बाद के संस्करणनिर्दिष्ट नहीं
मोबाइल पर प्रयास मोड (Light, Standard, High, Ultra)iOS 26.38.0 और Android 2.100.0, और बाद के संस्करणPro, Max, Enterprise Pro, Enterprise Max
अलग Wiley सदस्यता के बिना Wiley की पत्रिकाएँ और पुस्तकेंPerplexity और Computerसभी प्लान, प्रीमियम कोटा अलग-अलग
GPT-6.1 Sol, जो Computer के Light प्रयास मोड को भी GPT-6 Sol की जगह संचालित करता हैPerplexity और Computerपात्र सशुल्क सदस्य
Computer का पहला कार्य शुरू करने के लिए मार्गदर्शित बातचीतवेबनए मुफ़्त खाते
इनपुट क्षेत्र से कोई ऐप जोड़ना (कोई ऐप जोड़ें)वेब पर Computerनिर्दिष्ट नहीं
निवेश संबंधी डेटा रूम (सौदों के डेटा रूम) के लिए DocSend कनेक्टरComputerपात्र DocSend खाता
Stripe Projects: Stripe CLI से बनाई गई Perplexity API कुंजीStripe CLIPerplexity API के डेवलपर

Stripe Projects के साथ, एक कमांड प्रोजेक्ट बनाती है या उसे जोड़ती है, कुंजी तैयार करती है और उसे .env फ़ाइल में लिखती है; Perplexity इस सेटअप का काम Claude Code, Cursor या Codex को सौंपने का सुझाव देता है।

🔗 5 अक्टूबर का Perplexity बदलाव विवरण


जनरेटिव निर्माण: Suno Albums और HeyGen का HyperFrames Studio

Suno ने एल्बम जोड़े

5 अक्टूबर — Suno ने एल्बम जोड़े हैं, जो अब तक उसके प्लेटफ़ॉर्म पर उपलब्ध नहीं थे। घोषणा के साथ प्रकाशित लेख के अनुसार, यह सुविधा उसके बेहतरीन गानों को पूर्ण प्रोजेक्ट (पूर्ण लंबाई वाले प्रोजेक्ट) में बदलती है, और एल्बम की तरह इस्तेमाल की जाने वाली प्लेलिस्ट (गीतों की सूची) को अब Album में बदला जा सकता है। Suno ने पहले पाँच एल्बम के कलाकारों का परिचय दिया है: naenia (Oakwood///diskrot), Old Soul (Isaiah Wallace), phenomenal (KakerMix///diskrot), Lost In a Dream (Dream Relic) और VOID (ECHLO)। कंपनी ने संबंधित प्लान, हर एल्बम में गानों की संख्या या सुविधा चालू होने की सटीक तारीख नहीं बताई है। जून में ही Suno अपने समुदाय से प्लेलिस्ट, एल्बम और रेडियो के बीच उनके सुनने के अनुभव के बारे में पूछ रहा था।

🔗 X पर Suno की घोषणा 🔗 5 एल्बम जिन्हें आप अनदेखा नहीं कर सकते, Suno का ब्लॉग

HyperFrames Studio, एजेंटों के लिए बनाया गया HeyGen का वीडियो संपादक

5 अक्टूबर — HyperFrames, HeyGen का ओपन सोर्स फ़्रेमवर्क जो HTML कोड को वीडियो में बदलता है, अब डेस्कटॉप ऐप बन गया है। HyperFrames Studio खुद को शुरू से एजेंटों के लिए बनाए गए वीडियो संपादक के रूप में प्रस्तुत करता है: आप मनचाहे वीडियो का वर्णन करते हैं, एजेंट (Claude Code, Codex या अपना बनाया एजेंट) पहला संपादन तैयार करता है, फिर इंसान और एजेंट एक ही समयरेखा (टाइमलाइन) पर काम करते हैं। निर्देशन प्रॉम्प्ट के बजाय इशारों से होता है: चित्र के किसी तत्व के चारों ओर घेरा बनाना, किसी शब्द पर टिप्पणी पिन करना या खुद कट लगाना। ऐप 4K में निर्यात करता है और प्रेरणा के सैकड़ों उदाहरण तथा टेम्पलेट उपलब्ध होने का दावा करता है; X पर HyperFrames के खाते के अनुसार यह मुफ़्त है, और डाउनलोड के लिए केवल macOS संस्करण उपलब्ध है। यह जुलाई के Studio Preview को आगे बढ़ाता है, जिसमें कोड से बनाए गए वीडियो का दृश्य रूप से संपादन पहले ही संभव था।

🔗 HyperFrames Studio की घोषणा 🔗 HeyGen द्वारा साझा की गई घोषणा


संक्षिप्त समाचार

  • Warp Factories सामान्य उपलब्धता की ओर — अपने शरद ऋतु के सेमिनार पर 3 अक्टूबर के लेख में Warp बताता है कि उसका एजेंट इंफ़्रास्ट्रक्चर Warp Factories शुरुआती पहुँच से सामान्य उपलब्धता की ओर बढ़ रहा है; तारीख या कीमत नहीं बताई गई है। टीम का कहना है कि इसके इस्तेमाल से उसने पिछले महीने में प्रति PR अपनी लागत 70 % घटाई है। 🔗 स्रोत
  • 2 अक्टूबर के Devin संस्करण नोट्स — Microsoft Teams की पहुँच संबंधी सेटिंग अब लागू होती हैं, एक क्लिक में एक ही गंभीरता स्तर के सभी सुरक्षा निष्कर्ष चुने जा सकते हैं (API v3 सहित), और सुझाए गए प्लगइन इंस्टॉल करने से पहले अपनी स्किल, MCP, हुक और नियम दिखाते हैं; बड़े Perforce रिपॉज़िटरी में परिवेश तैयार करने की प्रक्रिया को अब 3 घंटे मिलते हैं, जबकि पहले वह 10 मिनट बाद विफल हो जाती थी। 🔗 स्रोत
  • Replit में TikTok Ads MCP — Replit ने 450 से अधिक इंटीग्रेशन की अपनी सूची में TikTok Ads जोड़ा है: खाता जोड़ने के बाद उसका Agent कार्यक्षेत्र से ही TikTok विज्ञापन बना और संभाल सकता है, दर्शकों तक पहुँच सकता है और प्रदर्शन माप सकता है; कनेक्शन के लिए कोई क्रेडिट खर्च नहीं होता। 🔗 स्रोत
  • Replit पर Cockle Finance — Replit ने Cockle Finance पर एक वीडियो पिन किया है, जिसका उपकरण डैन और उनके पिता स्टीव ने आने वाले ग्राहकों पर नज़र रखने के लिए Replit पर बनाया था; Replit के अनुसार, डैन ने तीन महीनों में अपने व्यवसाय को 15 % बढ़ाया, हालाँकि माप का आधार नहीं बताया गया है। 🔗 स्रोत
  • Copilot CLI 1.0.92 का स्थिर संस्करण — इस संस्करण में 1.0.92-0 से -5 तक के पूर्वावलोकन संस्करणों के बदलाव शामिल हैं; केवल नया बदलाव यह है कि Microsoft Entra से जुड़ने के बाद उपयोगकर्ता इस्तेमाल करने वाला खाता चुनता है, /logout इन OAuth सत्रों को बंद करता है और Entra से सुरक्षित MCP सर्वर अपने प्रमाणीकरण विवरण अपने आप नवीनीकृत करते हैं। 🔗 स्रोत
  • Codex CLI 0.160.1 — 0.160.0 के इस सुधार में पिछले संस्करण में लाया गया केवल एक बदलाव है: जिन दूरस्थ MCP stdio सर्वरों का दूरस्थ परिवेश स्पष्ट रूप से कॉन्फ़िगर किया गया है, उन्हें शुरू करते समय Windows के SYSTEMROOT, TEMP और TMP वेरिएबल बनाए रखे जाते हैं; यह नवीनतम स्थिर संस्करण है, क्योंकि 0.161.0 का कोई स्थिर संस्करण जारी नहीं हुआ है। 🔗 स्रोत
  • 5 अक्टूबर का Gemini CLI नाइटली संस्करण — इसमें कोई बदलाव नहीं है: यह 3 अक्टूबर वाले संस्करण के समान कमिट पर बना है और केवल संस्करण संख्याओं में अलग है; स्थिर (v0.62.0) और पूर्वावलोकन (v0.63.0-preview.0) चैनल अपरिवर्तित हैं। 🔗 स्रोत
  • SpaceXAI का TypeScript SDK 0.2.1 — 2 अक्टूबर को प्रकाशित यह संस्करण toJson(schema) जोड़ता है, जो Standard Schema वैलिडेटर (Zod, Valibot या ArkType) से संरचित आउटपुट की वैधता जाँचता है, और retryBeforeOutput विकल्प जोड़ता है, जो किसी भी आउटपुट से पहले विफल हुए निरंतर प्रवाह वाले (स्ट्रीमिंग) अनुरोध को दोबारा चलाता है; Retry-After हेडर के बिना मिले 429 के लिए अब प्रतीक्षा 250 मिलीसेकंड के बजाय एक सेकंड से शुरू होकर 30 सेकंड तक जाती है। 🔗 स्रोत
  • Claude Agent SDK पर Cresta Conductor — Claude के साथ उत्पाद बनाने वाले स्टार्टअप पर Anthropic की शृंखला में Cresta ने Conductor प्रस्तुत किया है, जो Claude Agent SDK पर बना प्राकृतिक भाषा में ग्राहक संबंध एजेंट बनाने का उपकरण है; Cresta के अनुसार, शुरुआती उपयोगों में इसने प्रारंभिक तैनाती का समय लगभग आधा कर दिया है, लेकिन उपलब्धता की तारीख या कीमत नहीं बताई गई है। 🔗 स्रोत
  • npm: विश्वसनीय प्रकाशन कॉन्फ़िगरेशन की समाप्ति — 2 अक्टूबर से, विश्वसनीय प्रकाशन (भरोसेमंद प्रकाशन) का ऐसा कॉन्फ़िगरेशन जिसका किसी प्रकाशन में इस्तेमाल नहीं हुआ है, बनने के 48 घंटे बाद समाप्त हो जाता है; npm अब GitHub Actions के issue_comment इवेंट से मिले टोकन भी अस्वीकार करता है, जैसा pull_request_target के लिए होता है। 🔗 स्रोत
  • npm: लंबित प्रकाशन से पैकेज बनाए जा सकते हैं — 2 अक्टूबर से, npm stage publish स्थानीय सत्र या बारीक अनुमति नियंत्रण वाले टोकन से ऐसा पैकेज बना सकता है जो अभी मौजूद नहीं है, यहाँ तक कि केवल लंबित रखने (केवल लंबित रखने तक सीमित) की अनुमति वाले टोकन से भी; पहला संस्करण इंस्टॉल करने योग्य होने से पहले किसी रखरखावकर्ता द्वारा उसे जारी किए जाने का इंतज़ार करता है। 🔗 स्रोत
  • Fast Search पर Perplexity का Agent API — Agent API के low, medium और high प्रीसेट अब web_search उपकरण के लिए Fast Search इस्तेमाल करते हैं; प्रति 1 000 आह्वान लागत 2,50 से घटकर 1 डॉलर हो गई है और यह लगभग 800 ms तेज़ है; xhigh प्रीसेट में सामान्य खोज बनी रहती है। 🔗 स्रोत
  • Perplexity की RAG मार्गदर्शिका — Perplexity ने पुनर्प्राप्ति से संवर्धित सामग्री निर्माण (पुनर्प्राप्ति से संवर्धित जनरेशन, RAG) के नौ उदाहरणों और सात आर्किटेक्चर की मार्गदर्शिका प्रकाशित की है; Zendesk या GitHub Copilot जैसे तीसरे पक्ष के उदाहरणों के साथ उसने अपने वेब इंडेक्स और Instant Buy सुविधा के लिए खुद का भी उल्लेख किया है; उत्पाद में कोई नया बदलाव नहीं है। 🔗 स्रोत
  • Cohere के कर्मचारियों की संख्या — Cohere के अनुसार, कंपनी में 2026 की शुरुआत में लगभग 400 कर्मचारी थे और आज 800 से अधिक हैं; यह संख्या भर्ती संबंधी संदेश में दी गई है। 🔗 स्रोत
  • Meta में IsoVGRBench और Logbook — बिना घोषणा के, facebookresearch ने IsoVGRBench का कोड प्रकाशित किया है, जो केवल एक पहलू में अलग 16 000 जोड़ों पर वीडियो रिवॉर्ड मॉडल का मूल्यांकन करता है (उसी क्लिप के फ़्रेमों को मिला देने वाले संस्करण से तुलना करने पर ये मॉडल लगभग यादृच्छिक उत्तर देते हैं), और Logbook का कोड भी प्रकाशित किया है, जो बहुत लंबी ऑडियो रिकॉर्डिंग की घटनाओं पर केंद्रित है। 🔗 स्रोत
  • FiftyOne अब LeRobot v3 डेटासेट पढ़ता है — हरप्रीत सहोता के सामुदायिक लेख के अनुसार, ओपन सोर्स टूलकिट FiftyOne अब बिना कन्वर्टर या वीडियो की प्रतिलिपि बनाए LeRobot v3 प्रारूप को सीधे पढ़ता है; प्रदर्शन में LeRobot के सामुदायिक डेटासेट के 50 प्रकार के रोबोटों से लिए गए 497 एपिसोड इस्तेमाल किए गए हैं। 🔗 स्रोत
  • Ai2 का FetchMan-data — 1 अक्टूबर को बिना घोषणा के प्रकाशित इस डेटासेट में ह्यूमनॉइड Unitree G1 द्वारा वस्तुएँ पकड़ने के 352 696 सिमुलेटेड एपिसोड (52 मिलियन फ़्रेम, 902 निर्देश) शामिल हैं, जो MolmoSpaces में बनाए गए हैं; यह LeRobot v3 प्रारूप में और ODC-BY लाइसेंस के अंतर्गत उपलब्ध है। 🔗 स्रोत
  • Hugging Face प्रोफ़ाइल पर P(doom) — Hub के उपयोगकर्ता अपनी प्रोफ़ाइल पर अपना P(doom) दिखा सकते हैं, यानी एआई के कारण अस्तित्वगत तबाही होने की संभावना का अपना अनुमान; जवाब एक सर्वेक्षण में शामिल होते हैं, जिसके केवल एकत्रित और पहचानरहित परिणाम दो सप्ताह में प्रकाशित किए जाएँगे। 🔗 स्रोत
  • hf-image एक्सटेंशन — Hugging Face ने बिना घोषणा के अपने CLI का एक एक्सटेंशन उपलब्ध कराया है, जो उसके cr.hf.co रजिस्ट्री पर कंटेनर इमेज बनाता है, पुश करता है, पुल करता है और चलाता है; Xet असंपीड़ित परतों की दोहराई गई सामग्री को एक ही प्रति में रखता है, इसलिए README के अनुसार 2 Go की परत में 100 Mo का बदलाव होने पर केवल लगभग 100 Mo ही भेजे जाते हैं। 🔗 स्रोत
  • मिलोश कोटलार के तीन प्रयोग — तीन सामुदायिक लेखों में मिलोश कोटलार ने अगले टोकन पर 97,85 % सहमति के साथ एक छोटे ट्रांसफ़ॉर्मर के KV कैश को 2,71 गुना अधिक कॉम्पैक्ट बनाया है, और MoE रूटिंग में बिना विशेषज्ञ वाले टोकनों का हिस्सा 13,84 % से घटाकर 8,09 % किया है, जबकि गति में कोई बढ़ोतरी नहीं हुई। 🔗 स्रोत
  • स्टीफ़न यू द्वारा एक निर्णायक LLM का ऑडिट — स्टीफ़न यू ने 38 400 नमूनों पर GLM-5.3 निर्णायक का ऑडिट किया, जो उनके 12B पुनर्लेखन मॉडल के GRPO रिवॉर्ड में तथ्यनिष्ठता को अंक देता है: किसी तथ्य के बदलने का पता लगाने में भरोसेमंद, लेकिन उसकी गंभीरता के आकलन में अस्थिर; गलत आउटपुट गिनने पर 39 % की गिरावट सामने आती है, जो पहली गिनती में छिपी हुई थी। 🔗 स्रोत
  • टोक्यो में Sakana AI की संगोष्ठी — Sakana AI ने 26 अक्टूबर को टोक्यो के हितोत्सुबाशी हॉल में होने वाली मुफ़्त संगोष्ठी के लिए पंजीकरण खोल दिए हैं; यह अंग्रेज़ी में होगी और इसमें युर्गेन श्मिडहुबर का व्याख्यान तथा Sakana AI के मुख्य कार्यकारी अधिकारी डेविड हा के साथ बातचीत शामिल होगी। 🔗 स्रोत
  • NVIDIA Inception के स्टार्टअप और स्तन कैंसर — NVIDIA ने अपने Inception कार्यक्रम के चार स्टार्टअप प्रस्तुत किए हैं, जो देखभाल की प्रक्रिया में एआई लागू करते हैं; इनमें iSono Health और उसका FDA की अनुमति प्राप्त 3D अल्ट्रासाउंड उपकरण ATUSA (हाथ से जाँच में लगने वाले अधिकतम 45 मिनट के मुकाबले लगभग दो मिनट प्रति स्तन), Whiterabbit.ai, Ataraxis AI और SimBioSys शामिल हैं; इनमें से कुछ तकनीकों को FDA की मंज़ूरी नहीं मिली है। 🔗 स्रोत

इसका क्या अर्थ है

पाठ के स्रोत की पहचान अब एक नियामकीय अनिवार्यता बन रही है। अब तक, जनरेट की गई सामग्री के स्रोत का पता लगाने का काम मुख्यतः चित्र और ऑडियो पर केंद्रित था, जिसमें वॉटरमार्क और सत्यापित किए जा सकने वाले मेटाडेटा इस्तेमाल होते थे; AI Act इस आवश्यकता को पाठ तक बढ़ाता है, और OpenAI इसका जवाब चरणों में दे रहा है: यूरोपीय संघ में ChatGPT और Codex के पाठ पर स्वतः लागू वॉटरमार्क, API में केवल एक विकल्प, और स्वीकृत संगठनों के लिए आरक्षित डिटेक्टर। प्रकाशित आँकड़े इस सावधानी की वजह बताते हैं: मनोविज्ञान संबंधी सामग्री के 400 टोकन वाले अंशों में लगभग 95 % का पता लगाया जाता है, गलत सकारात्मक परिणामों का लक्ष्य 1 % है, लेकिन अंग्रेज़ी के 400 टोकन वाले अंशों में 10 % शब्दों को पर्यायवाची से बदलने पर पहचान की दर लगभग 92 % से घटकर 66 % हो जाती है, और पुनर्लेखन या अनुवाद वॉटरमार्क मिटा सकता है। वॉटरमार्क स्रोत का संकेत देता है, प्रमाण नहीं, और उसका न होना लेखक के बारे में कुछ नहीं बताता।

एजेंटों की स्मृति स्थापित हो रही है और उसका मानकीकरण शुरू हो रहा है। Devin अपनी सीख Markdown फ़ाइलों के Git रिपॉज़िटरी में रखता है, जिसे Dreaming रोज़ पुनर्व्यवस्थित करता है, और Cognition ने इसका प्रारूप MIT लाइसेंस के अंतर्गत प्रकाशित किया है ताकि दूसरे एजेंट इसे अपना सकें; North 2 एक सत्र से अगले सत्र तक संदर्भ बनाए रखता है; Qwen Code अपने CLI से Mem0 को सीधे जोड़ता है। तरीके अलग हैं—इंसानों द्वारा पढ़ी जा सकने वाली संस्करणयुक्त फ़ाइलें, बाहरी स्मृति सेवा और प्लेटफ़ॉर्म में एकीकृत सुविधा—लेकिन वे एक ही ज़रूरत पूरी करते हैं: एजेंट को हर सत्र में शून्य से शुरुआत न करनी पड़े। Cognition के विकल्प का एक व्यावहारिक लाभ है: हर नोट उस सत्र से जुड़ा होता है जिसमें वह सीख मिली थी, इंटरफ़ेस में पढ़ा जा सकता है और अपना Git इतिहास बनाए रखता है, जिससे एजेंट ने जो याद रखा है उसे पढ़ना और सुधारना संभव होता है।

ओपन मॉडल कई रास्तों से कोडिंग टूलों में आ रहे हैं। Together Link उन्हें मौजूदा एजेंटों से जोड़ता है, जिनमें Claude Code और Codex भी शामिल हैं, और खर्च आधे से भी अधिक घटाने का दावा करता है; IBM उन कंपनियों के लिए Bob का अपने सर्वर पर होस्ट किया गया संस्करण Nemotron 3 Ultra पर चलाता है, जो अपना विकास अपने ही इंफ़्रास्ट्रक्चर पर रखती हैं, यहाँ तक कि नेटवर्क से कटे परिवेशों में भी; Reflection AI ने Beam को कोड और एजेंट संबंधी कार्यों के लिए तैयार ओपन मॉडल के रूप में प्रस्तुत किया है, जिसका SWE-bench Verified स्कोर उसके अपने तालिकाओं के अनुसार 80,9 है। साझा तर्क सीधे स्कोर पर कम टिका है, जहाँ Reflection AI मानता है कि Kimi K3 अभी भी आगे है, और लागत, विलंब तथा डेटा पर नियंत्रण पर अधिक।

आज के बहुत से आँकड़े उन्हें प्रकाशित करने वालों से ही आए हैं। GitHub ने ReviewBench बनाया और शुरुआती रैंकिंग तैयार की, जिसमें Copilot code review पहले स्थान पर है, जबकि दूसरे प्रदाताओं ने न इसे चलाया है और न सत्यापित किया है; Nemotron 3 Ultra का विलंब संबंधी आँकड़ा IBM के आंतरिक परीक्षणों से आया है; Together Link की बचत और ChatGPT के विज्ञापन परिणाम वही हैं जो Together AI और OpenAI ने बताए हैं। हालाँकि, GitHub अपना डेटासेट, निर्णायक और कार्यप्रणाली प्रकाशित करता है तथा नतीजे जमा करने की सुविधा खोलता है: हर प्रदाता अपने एजेंट के साथ मापन दोहरा सकता है। इसी से पता चलेगा कि शुरुआती रैंकिंग आगे भी सही ठहरती है या नहीं।


स्रोत