ai-powered-markdown-translatorgpt-6.1-sol का उपयोग करके फ़्रेंच से हिंदी में अनुवादित लेख।
GPT-6 और Intelligent UI अब ChatGPT के सभी उपयोगकर्ताओं तक पहुँच रहे हैं: सशुल्क प्लान के लिए GPT-6 Sol 7 अक्टूबर से, और Free तथा Go के लिए GPT-6 Luna 8 अक्टूबर से। Anthropic अपने 5.5 परिवार को Claude Haiku 5.5 के साथ पूरा कर रहा है, जिसकी कीमत प्रति दस लाख इनपुट टोकन के लिए 0,10 डॉलर से शुरू होती है। वहीं, Microsoft के Windows कार्यक्रम में RTX Spark PC के अग्रिम ऑर्डर शुरू किए गए और घोषणा हुई कि GitHub Copilot जल्द ही अपने कार्य किसी स्थानीय मॉडल को सौंप सकेगा। OpenAI ने एक आंतरिक मॉडल द्वारा तैयार किए गए गणितीय परिणामों की 722 पांडुलिपियाँ भी प्रकाशित की हैं।
ChatGPT में सभी के लिए GPT-6 और Intelligent UI, ऑडियो फ़ाइलें पढ़ने की सुविधा और College Planner की तैयारी
7 अक्टूबर — OpenAI सभी ChatGPT उपयोगकर्ताओं तक GPT-6 का विस्तार कर रहा है। यह कोई नया बेस मॉडल नहीं है: GPT-6 Sol और GPT-6 Luna सितंबर से ही सशुल्क ग्राहकों के लिए उपलब्ध थे (यहाँ 22 सितंबर को इनका उल्लेख किया गया था)। इस बार, रोज़मर्रा की बातचीत के लिए अनुकूलित इन दोनों मॉडलों के अक्टूबर संस्करण Chat टैब में आ रहे हैं: Plus, Pro, Business और Enterprise के लिए GPT-6 Sol 7 अक्टूबर से, और Free तथा Go के लिए GPT-6 Luna 8 अक्टूबर से। ये ChatGPT में GPT-5.6 Sol और GPT-5.6 Luna की जगह लेते हैं, जबकि Codex और ChatGPT Work सितंबर के संस्करणों पर बने रहते हैं। OpenAI के अनुसार, इस तरह वह हर सप्ताह ChatGPT इस्तेमाल करने वाले 1,2 अरब से अधिक लोगों तक पहुँच रहा है।
सबसे स्पष्ट नई सुविधा का नाम Intelligent UI है। GPT-6 अपने उत्तरों में पाठ, दृश्य सामग्री और इंटरैक्टिव तत्वों (ग्राफ़, बटन, फ़ॉर्म, इंटरैक्टिव आरेख, मानचित्र) को शामिल करता है और माँगने पर कोई छोटा उपकरण बना सकता है, जैसे बचत का कैलकुलेटर, बिल बाँटने का उपकरण या कोई खेल; जब साधारण पाठ पर्याप्त होता है, तो ChatGPT उसी तक सीमित रहता है। इसके लिए OpenAI मूल घटकों की एक लाइब्रेरी और ऐसे कम्पाइलर का इस्तेमाल करता है जो उत्तर बनते समय ही इंटरफ़ेस दिखाता है। Intelligent UI, Instant से Extra High तक के प्रयास स्तरों पर बिना किसी अलग कोटे के काम करता है, लेकिन Pro प्रयास स्तर पर उपलब्ध नहीं है, जिसे GPT-6 Pro (GPT-6 Astra द्वारा संचालित) संभालता है। यह macOS और Windows के पुराने डेस्कटॉप अनुप्रयोगों में भी उपलब्ध नहीं है।
दूसरा बदलाव: ChatGPT सोचते समय या उपकरणों का इस्तेमाल करते समय ही उत्तर देना शुरू कर सकता है और फिर किसी नए प्रॉम्प्ट के बिना अपना उत्तर पूरा कर सकता है। OpenAI के आंतरिक मूल्यांकनों के अनुसार, वेब खोज की आवश्यकता वाले प्रश्नों पर GPT-6 Instant औसतन GPT-5.6 Instant से 44 % पहले उत्तर देना शुरू करता है। वहीं, GPT-6 Extra High उतने ही समय में उत्तर शुरू करता है जितना GPT-5.6 Medium, और उसका समग्र स्कोर GPT-5.6 Extra High से बेहतर है।
| प्लान या प्रयास स्तर की सेटिंग | ChatGPT में इस्तेमाल होने वाला मॉडल | समय-सारणी और विवरण |
|---|---|---|
| Plus, Pro, Business और Enterprise | GPT-6 Sol (Instant, Medium, High, Extra High) | 7 अक्टूबर से विश्वव्यापी उपलब्धता |
| Free और Go | GPT-6 Luna | 8 अक्टूबर से |
| Pro प्रयास स्तर (100 और 200 डॉलर वाले Pro प्लान, Business, Enterprise) | GPT-6 Pro, GPT-6 Astra द्वारा संचालित | Intelligent UI के बिना |
| ChatGPT Work और Codex | GPT-6 Sol और GPT-6 Luna के सितंबर संस्करण | कोई बदलाव नहीं |
सुरक्षा के संदर्भ में, उसी दिन प्रकाशित सिस्टम कार्ड इन संस्करणों को Preparedness Framework के तहत साइबर सुरक्षा तथा जीवविज्ञान और रसायन विज्ञान में « High » क्षमता स्तर पर रखता है, जबकि स्व-सुधार में वे इस सीमा तक नहीं पहुँचते। इनमें GPT-5.6 के सुरक्षा उपाय बने हुए हैं और सुरक्षा सीमाओं को दरकिनार करने की कोशिशों (जेलब्रेक) के प्रति बेहतर प्रतिरोध है, जिसमें कई संवाद चरणों में की जाने वाली कोशिशें भी शामिल हैं। API में, स्नैपशॉट chat-latest अब ChatGPT के इस नए मॉडल की ओर संकेत करता है, और OpenAI प्रोडक्शन के लिए GPT-6 परिवार की सिफ़ारिश करता है।
GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.
🇮🇳 GPT-6 और Intelligent UI अब ChatGPT में सभी के लिए उपलब्ध किए जा रहे हैं। ChatGPT में Intelligent UI तेज़ और इंटरैक्टिव उत्तर देता है, जो रोज़मर्रा के सवालों को अधिक दृश्यात्मक बनाते हैं, जटिल विषयों को समझना आसान करते हैं और आपके कार्य के अनुरूप इंटरैक्टिव उपकरण तुरंत उपलब्ध कराते हैं। — X पर @OpenAI
🔗 सभी के लिए GPT-6 और Intelligent UI · सिस्टम कार्ड, अक्टूबर का अद्यतन · ChatGPT में GPT-6 और अन्य मॉडल
ChatGPT में ऑडियो फ़ाइलें
6 अक्टूबर — ChatGPT अब संलग्नक के रूप में ऑडियो फ़ाइलें स्वीकार करता है। किसी बातचीत में रिकॉर्डिंग जोड़कर उसका प्रतिलेख, सारांश या उसकी सामग्री से जुड़े उत्तर प्राप्त किए जा सकते हैं। इससे किसी बैठक, साक्षात्कार या कक्षा को व्यवस्थित नोट्स में, यहाँ तक कि बाद में भेजे जाने वाले ईमेल के मसौदे में भी बदला जा सकता है। यह सुविधा सशुल्क सदस्यताओं और कार्यक्षेत्रों के लिए आरक्षित है, जिसमें Enterprise भी शामिल है: Free प्लान को « फ़िलहाल » इसका उपयोग नहीं मिलता। स्वीकार्य प्रारूप WAV, MP3, OGG, FLAC, AAC, M4A और PCM हैं, साथ ही WebM और MP4 भी, यदि उनमें केवल ऑडियो हो; प्रत्येक फ़ाइल का आकार अधिकतम 512 Mo हो सकता है। OpenAI चेतावनी देता है कि प्रतिलेखों में त्रुटियाँ हो सकती हैं, वक्ताओं की पहचान अभी भी कम भरोसेमंद है और प्रदर्शन भाषा के अनुसार बदलता है।
🔗 ChatGPT के रिलीज़ नोट्स · ChatGPT में फ़ाइलें और ऑडियो अपलोड करना
ChatGPT for Teens: इस्तेमाल के शुरुआती आँकड़े और आने वाला College Planner
7 अक्टूबर — OpenAI ने ChatGPT for Teens की प्रगति पर पहली जानकारी दी है। यह अनुभव उन खातों पर डिफ़ॉल्ट रूप से लागू होता है जिनके उपयोगकर्ताओं की उम्र 18 वर्ष से कम पहचानी गई है। कंपनी के अनुसार, एक सप्ताह में लगभग 1,2 मिलियन किशोरों ने Learning Visualizations और 180 000 से अधिक ने Study Mode का इस्तेमाल किया। वे इसमें प्रतिदिन औसतन 15 मिनट से कम समय बिताते हैं, और 2 % से कम लगातार तीन घंटे से अधिक इस्तेमाल करते हैं। घोषित नई सुविधा College Planner « जल्द ही » आएगी, शुरुआत में अमेरिका के 10वीं से 12वीं कक्षा के उन विद्यार्थियों के लिए जो चार वर्षीय विश्वविद्यालय में प्रवेश चाहते हैं: एक ही योजना में आवेदन की आवश्यकताएँ, अंतिम तिथियाँ, कार्य और छात्रवृत्तियों सहित वित्तीय सहायता की प्रक्रियाएँ शामिल होंगी। OpenAI, College Advising Corps और तीन वर्षों के लिए Boston Children’s Hospital के Digital Wellness Lab को भी समर्थन दे रहा है, लेकिन उसने किसी राशि की जानकारी नहीं दी है।
🔗 किशोरों को सीखने, योजना बनाने और AI का भविष्य गढ़ने में मदद करना
Anthropic के अनुसार, Claude Haiku 5.5, Haiku 4.5 से लगभग 75 % सस्ता
7 अक्टूबर — Opus 5.5 के पंद्रह दिन और Sonnet 5.5 के नौ दिन बाद, Anthropic ने Claude Haiku 5.5 (claude-haiku-5-5) के साथ Claude 5.5 परिवार को पूरा किया है। यह मॉडल बड़ी मात्रा में किए जाने वाले और लागत के प्रति संवेदनशील कार्यों (सारांश, संदर्भ संपीड़न, डेटाबेस क्वेरी, वर्गीकरण), कोड संबंधी कार्यों में Opus 5.5 और Sonnet 5.5 के उप-एजेंट की भूमिका, और उन उपयोगों के लिए बनाया गया है जहाँ गति मायने रखती है, जैसे तत्काल ग्राहक सहायता या ब्राउज़र संचालन। मानक गति पर यह Anthropic का सबसे तेज़ मॉडल है, हालाँकि Fast Mode में Opus मॉडल अभी भी अधिक तेज़ हैं। प्रयास स्तर की सेटिंग वाला यह पहला Haiku भी है (डिफ़ॉल्ट रूप से medium), जिसमें 1 मिलियन टोकन का संदर्भ और अधिकतम 128 000 आउटपुट टोकन उपलब्ध हैं।
कीमत के दो स्तर हैं। 100 000 प्रॉम्प्ट टोकन तक, Haiku 5.5 की कीमत प्रति दस लाख टोकन के लिए इनपुट पर 0,10 डॉलर और आउटपुट पर 0,50 डॉलर है, यानी Haiku 4.5 से 90 % कम। इससे ऊपर कीमत क्रमशः 0,50 और 2,50 डॉलर हो जाती है, यानी 50 % कम। प्रमुखता से बताई गई « लगभग 75 % » की बचत Anthropic द्वारा निकाला गया औसत है: Haiku 4.5 को भेजे गए 90 % अनुरोध इस सीमा से नीचे थे, और नया टोकन विभाजन (टोकनाइज़र) उसी पाठ के लिए लगभग 30 % अधिक टोकन गिनता है।
| कीमत का प्रकार (प्रति दस लाख टोकन) | Haiku 5.5 में 100 000 प्रॉम्प्ट टोकन तक | Haiku 5.5 में 100 000 टोकन से अधिक | Haiku 4.5 |
|---|---|---|---|
| इनपुट टोकन | 0,10 डॉलर | 0,50 डॉलर | 1 डॉलर |
| आउटपुट टोकन | 0,50 डॉलर | 2,50 डॉलर | 5 डॉलर |
| कैश पढ़ना | 0,01 डॉलर | 0,05 डॉलर | 0,10 डॉलर |
| कैश लिखना | 0,125 डॉलर | 0,625 डॉलर | 1,25 डॉलर |
Anthropic द्वारा प्रकाशित बेंचमार्क में Haiku 4.5 के साथ अंतर बड़ा है, और जहाँ दोनों शामिल हैं, वहाँ हर बेंचमार्क में Haiku 5.5, OpenAI के GPT-6 Luna से आगे है। हालाँकि, यह Sonnet 5.5 से पीछे रहता है, जिसकी Anthropic अब भी Opus 5.5 के साथ जटिल एजेंट आधारित कोडिंग के लिए सिफ़ारिश करता है।
| मूल्यांकित बेंचमार्क (Anthropic के आँकड़े) | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 (एजेंट आधारित कोडिंग) | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| OSWorld 2.1, ऑफ़लाइन उपसमूह | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity’s Last Exam, उपकरणों के बिना | 45,9 % | 10,2 % | — | 56,9 % |
| FrontierCode 1.1, Main | 46,4 % | — | 42,4 % | 52,1 % (प्रयास स्तर Xhigh) |
| Chartography, उपकरणों के बिना | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
छह ग्राहकों ने अपने शुरुआती परीक्षणों के अनुभव साझा किए: HubSpot ने अपने CRM परीक्षण समूह पर 92,8 % बताया, जो उसका अब तक का सर्वश्रेष्ठ स्कोर है; AlphaSense ने 400 अनुरोधों पर Haiku 4.5 के 0,76 के मुकाबले 0,84 बताया; और Box ने लगभग आधी लेटेंसी पर 11 अंक अधिक बताए। Haiku 4.5 से माइग्रेशन में काम करना पड़ता है: मार्गदर्शिका में ग्यारह बदलाव सूचीबद्ध हैं, जिनमें budget_tokens, temperature, top_p और top_k पैरामीटर तथा प्रीफ़िलिंग का समाप्त होना शामिल है। Claude Code का /claude-api migrate कमांड इस प्रक्रिया के एक हिस्से को स्वचालित करता है। सुरक्षा के संदर्भ में, Anthropic साइबर सुरक्षा उपायों को Haiku 4.5 की तुलना में अधिक प्रतिबंधात्मक, लेकिन अपने अन्य हालिया मॉडलों से थोड़ा कम प्रतिबंधात्मक बताता है: Sonnet 5.5 की तुलना में अधिक रक्षात्मक कार्यों की अनुमति है, जबकि प्रवेश परीक्षण अब भी अवरुद्ध हैं।
लॉन्च के साथ कीमत में कटौती भी हुई है: Sonnet 5.5 में कैश पढ़ने की कीमत 7 अक्टूबर से प्रति दस लाख टोकन के लिए 0,20 से घटकर 0,10 डॉलर हो जाती है। Anthropic के अनुसार, इससे अधिकांश एजेंट आधारित कार्यों में यह मॉडल लगभग 20 % सस्ता हो जाता है। Haiku 5.5 अब Claude API, Amazon Web Services, Google Cloud और Microsoft Azure के साथ-साथ Claude Code में भी उपलब्ध है।
Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.
🇮🇳 पेश है Claude Haiku 5.5: अब तक हमारे द्वारा जारी किया गया सबसे सस्ता, सबसे तेज़ और सबसे सक्षम छोटा मॉडल। औसतन, इसे चलाने की लागत Claude Haiku 4.5 से लगभग 75 % कम है। — X पर @claudeai
🔗 Claude Haiku 5.5 की घोषणा · Haiku 5.5 पर माइग्रेशन की मार्गदर्शिका
Cursor में Haiku 5.5: CursorBench पर 48,4 %
7 अक्टूबर — Cursor ने लॉन्च के दिन ही Claude Haiku 5.5 उपलब्ध कर दिया है, जिसे उसकी मॉडल सेटिंग में सक्रिय किया जा सकता है। Cursor के अनुसार, छोटे अनुरोधों पर यह Claude Haiku 4.5 से 10 गुना सस्ता है। Cursor की वेबसाइट पर प्रकाशित रैंकिंग CursorBench में, Max प्रयास स्तर वाला Haiku 5.5 प्रति कार्य 1,12 डॉलर की लागत और 48,4 % सफलता दर के साथ 10वें स्थान पर है। यह High प्रयास स्तर वाले Sonnet 5.5 से ठीक आगे है, जिसकी नई कीमत को ध्यान में रखने के लिए Cursor ने 7 अक्टूबर को लागत की दोबारा गणना की, और Max प्रयास स्तर वाले Opus 5 से भी आगे है। हालाँकि, यह अधिक काम करता है: प्रति कार्य औसतन 325 934 टोकन और 163 चरण, जबकि High प्रयास स्तर वाले Sonnet 5.5 में 37 391 टोकन और 41 चरण हैं।
| Cursor द्वारा परीक्षण किया गया विन्यास | रैंकिंग में स्थान | CursorBench स्कोर | प्रति कार्य लागत |
|---|---|---|---|
| Opus 5.5, प्रयास स्तर Max | 1 | 57,8 % | 13,43 डॉलर |
| Haiku 5.5, प्रयास स्तर Max | 10 | 48,4 % | 1,12 डॉलर |
| Sonnet 5.5, प्रयास स्तर High | 11 | 47,8 % | 1,20 डॉलर |
| Opus 5, प्रयास स्तर Max | 13 | 46,6 % | 11,95 डॉलर |
| Haiku 5.5, प्रयास स्तर Low | 54 | 30,9 % | 0,08 डॉलर |
🔗 X पर Cursor की घोषणा · CursorBench रैंकिंग
Max और Team योजनाओं के लिए 100 से 500 डॉलर का मासिक API क्रेडिट
7 अक्टूबर — Haiku 5.5 वाले उसी ब्लॉग लेख में घोषित मासिक क्रेडिट Max और Team के ग्राहकों को मिलने वाला है, जिसे Claude Platform पर इस्तेमाल किया जा सकेगा और जिसे कुछ दिनों में चरणबद्ध तरीके से उपलब्ध कराया जाएगा। इससे API के ज़रिए अपने उपकरण, ऐप और एजेंट बनाए जा सकते हैं; @ClaudeDevs के अनुसार, यह Haiku 5.5 सहित सभी मॉडलों के साथ काम करता है, चाहे अपने कोड में इस्तेमाल हो या तीसरे पक्ष के उपकरणों में।
| संबंधित योजना | मासिक API क्रेडिट |
|---|---|
| Max 5x | 100 डॉलर |
| Max 20x | 200 डॉलर |
| Team, Standard सीट | प्रति सीट 20 डॉलर |
| Team, Premium सीट | प्रति सीट 100 डॉलर |
| Team की एक टीम की सीमा | 500 डॉलर, साझा रूप से |
| Free, Pro और Enterprise | पात्र नहीं |
Team में सीटों के क्रेडिट एक साझा भंडार में जुड़ते हैं: उदाहरण के लिए, तीन Standard सीटों और दो Premium सीटों से हर महीने 260 डॉलर मिलते हैं। क्रेडिट Claude API के सभी मॉडलों, जिनमें Message Batches API भी शामिल है, के साथ-साथ Console के Playground, Claude Managed Agents और Claude Agent SDK के उपयोग को भी कवर करता है। यह Claude Code के इंटरैक्टिव उपयोग (टर्मिनल, IDE, डेस्कटॉप ऐप या वेब), योजना की सीमाओं से परे अतिरिक्त उपयोग, या Amazon Bedrock, Google Cloud Vertex AI और Microsoft Foundry के ज़रिए उपलब्ध Claude मॉडलों को कवर नहीं करता, और Claude, Claude Code या Cowork की उपयोग सीमाओं को नहीं बदलता।
इसे पाने के लिए किसी पात्र योजना की सदस्यता कम से कम सात दिनों से सक्रिय होनी चाहिए, फिर भुगतान का कोई माध्यम जोड़े बिना claude.ai की बिलिंग सेटिंग से Claude Console के किसी संगठन को जोड़ना होगा। केवल एक संगठन जोड़ा जा सकता है, और उसे केवल सहायता टीम ही बदल सकती है। क्रेडिट हर बिलिंग चक्र में दोबारा मिलता है, अगले चक्र में आगे नहीं ले जाया जा सकता और खरीदे गए क्रेडिट से पहले इस्तेमाल होता है; इसके खत्म होने पर अगले क्रेडिट तक API कॉल रुक जाती हैं, जब तक कि संगठन ने क्रेडिट न खरीदे हों या स्वचालित रिचार्ज चालू न किया हो, और Claude सदस्यता पर कोई शुल्क नहीं लगाया जाता। मई में Anthropic ने 15 जून से प्रोग्राम के ज़रिए उपयोग के लिए मासिक क्रेडिट की घोषणा की थी; सहायता पृष्ठ स्पष्ट करता है कि नया क्रेडिट उन «Agent SDK क्रेडिट» से अलग है, जिन्हें वह अनुपलब्ध बताता है।
🔗 सहायता पृष्ठ: Max और Team योजनाओं के मासिक API क्रेडिट · @ClaudeDevs की घोषणा
Windows पर स्थानीय AI: NVIDIA ने RTX Spark PC की अग्रिम बुकिंग खोली और DGX Station for Windows की शुरुआती झलक पेश की
7 अक्टूबर — NVIDIA और Microsoft ने सैन फ़्रांसिस्को में आयोजित Windows AI and Surface कार्यक्रम, जिसमें जेनसन हुआंग और सत्या नडेला के बीच बातचीत हुई, के अवसर पर RTX Spark को व्यावसायिक रूप से लॉन्च किया। यह Windows PC के लिए वह चिप है जिसकी घोषणा 2 जून को Build में हुई थी। लैपटॉप की अग्रिम बुकिंग 7 अक्टूबर से खुल गई है और वे 16 अक्टूबर को उपलब्ध होंगे; मिनी-PC नवंबर में आएँगे। Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI और Gigabyte मशीनें तैयार कर रहे हैं, और Microsoft ने इस चिप पर आधारित Surface Laptop Ultra पेश किया है। NVIDIA के ब्लॉग लेख में कोई कीमत नहीं बताई गई है।
RTX Spark में Blackwell RTX GPU और Grace CPU को 600 Go/s की गति वाले कनेक्शन से जोड़ा गया है। यह FP4 में एक पेटाफ्लॉप की AI गणना क्षमता और 128 Go तक की एकीकृत मेमोरी देता है। NVIDIA बड़े मॉडलों को स्थानीय रूप से चलाने पर ज़ोर देता है, जिसमें डेटा क्लाउड पर नहीं भेजा जाता और उपयोग का कोई मीटर नहीं होता, जबकि CUDA सॉफ़्टवेयर स्टैक वही रहता है जो उसके सर्वरों पर है। चिप का लक्ष्य रचनाकार भी हैं (NVFP4, AV1 और हार्डवेयर आधारित 4:2:2 एन्कोडिंग), साथ ही गेम खेलने वाले भी, जिन्हें DLSS 5 की मदद से 1440p पर 100 फ़्रेम प्रति सेकंड से अधिक की गति मिलती है।
व्यावसायिक उपयोग के लिए NVIDIA ने DGX Station for Windows की शुरुआती झलक पेश की, जिसकी घोषणा भी जून में Build में हुई थी। कंपनी इसे Windows इकोसिस्टम का पहला डेस्कटॉप AI सुपरकंप्यूटर बताती है: इससे Windows छोड़े बिना लगभग एक लाख करोड़ पैरामीटर वाले मॉडल स्थानीय रूप से चलाए जा सकेंगे, और Linux उपकरण WSL के ज़रिए उपलब्ध रहेंगे। कोई तारीख या कीमत नहीं दी गई है, केवल सूचना पाने के लिए पंजीकरण किया जा सकता है। दूसरी ओर, Microsoft ने Microsoft Execution Containers (MXC) को सामान्य रूप से उपलब्ध कर दिया है। यह वह बुनियादी ढाँचा है जो Windows के नियंत्रण में एजेंटों को पृष्ठभूमि में चलाता है।
| तुलना का पहलू | RTX Spark | DGX Station for Windows |
|---|---|---|
| चिप | Blackwell RTX GPU (6 144 कोर तक) और Grace CPU (20 कोर तक) | GB300 Grace Blackwell Ultra Desktop सुपरचिप |
| मेमोरी | 128 Go तक, एकीकृत | 748 Go, सुसंगत |
| FP4 में AI गणना | 1 पेटाफ्लॉप | 20 पेटाफ्लॉप तक |
| घोषित उपलब्धता | लैपटॉप की अग्रिम बुकिंग खुली, 16 अक्टूबर को उपलब्ध; मिनी-PC नवंबर में | शुरुआती झलक, तारीख या कीमत के बिना |
🔗 Windows कार्यक्रम पर NVIDIA का ब्लॉग लेख
Windows पर स्थानीय विकास: Copilot MAI Code 1.1 Flash की ओर रूट करेगा, इसका सैंडबॉक्स सामान्य रूप से उपलब्ध हुआ, Replit डेस्कटॉप ऐप तैयार कर रहा है
7 अक्टूबर — GitHub Copilot जल्द ही डेवलपर की मशीन पर चलने वाले मॉडल और क्लाउड के मॉडल के बीच अपने आप चयन कर सकेगा। Microsoft Command Line ब्लॉग पर प्रकाशित Microsoft और GitHub के लेख के अनुसार, यह रूटिंग «महीने के अंत तक» आएगी: यह अभी उपलब्ध नहीं है। GitHub इसे Project HydraFusion का अगला चरण बताता है। उसका यह ऑर्केस्ट्रेटर पहले से कई मॉडलों के बीच कार्य बाँटता है, और कंपनी AI क्रेडिट की बचत पर ज़ोर देती है, लेकिन उसकी मात्रा नहीं बताती।
Copilot CLI, GitHub Copilot ऐप और VS Code में दो तरह के उपयोग की योजना है। Auto मोड हर चरण में कार्य के संदर्भ और कैश की स्थिति के आधार पर स्थानीय और क्लाउड इन्फ़रेंस के बीच चयन करेगा; डेवलपर स्वयं भी कोई स्थानीय मॉडल चुन सकेगा—Windows ML प्रदाता के ज़रिए MAI Code 1.1 Flash या OpenAI API के अनुकूल किसी स्थानीय एक्सेस पॉइंट (endpoint) से उपलब्ध कोई भी मॉडल। लेख याद दिलाता है कि स्थानीय इन्फ़रेंस से सत्र ऑफ़लाइन नहीं हो जाता।
प्रदर्शन RTX Spark से लैस Surface Laptop Ultra पर चल रहा है। Microsoft AI इसमें MAI Code 1.1 Flash का स्थानीय संस्करण चला रहा है, जो कोड में विशेषज्ञता वाला विशेषज्ञों का मिश्रण (mixture-of-experts) मॉडल है। इसके 137 अरब पैरामीटर में से 6,8 अरब सक्रिय हैं। प्रति वज़न लगभग 3,3 बिट पर क्वांटाइज़ किए जाने के बाद इसका आकार 53 Go है, जो क्लाउड संस्करण से 80 % कम है, और 256 000 टोकन के संदर्भ पर मेमोरी का अधिकतम उपयोग 75,5 Go है।
| मूल्यांकित बेंचमार्क (5 अक्टूबर के Microsoft परीक्षण) | MAI Code 1.1 Flash | डिवाइस पर चलने वाला क्वांटाइज़्ड संस्करण | GPT OSS 120B (Unsloth का GGUF संस्करण) |
|---|---|---|---|
| SWE-Bench Verified (500 कार्य) | 72,6 % | 70,80 % | 32,0 % |
| Terminal-Bench 2.1 (89 कार्य) | 62,9 % | 66,29 % | 23,6 % |
Microsoft स्पष्ट करता है कि ये परीक्षण Windows ARM64 के लिए llama.cpp निष्पादन परिवेश में चले थे और परिणाम डिवाइस तथा कॉन्फ़िगरेशन के अनुसार बदलते हैं। इसकी एक शुरुआती सुविधा टर्मिनल में पहले से उपलब्ध है: Copilot CLI के पूर्वावलोकन संस्करण 1.0.94-0 से /model कमांड किसी स्थानीय Ollama इंस्टेंस के मॉडल खोजती है। पुष्टि के बिना कुछ भी नहीं जोड़ा जाता, Ollama और मॉडल पहले से इंस्टॉल होने चाहिए, और केवल वे मॉडल पेश किए जाते हैं जो उपकरणों को कॉल करने और निरंतर आउटपुट (streaming) का समर्थन करते हैं।
🔗 Windows और GitHub Copilot में स्थानीय मॉडल और सैंडबॉक्स में चलने वाले उपकरण लाना · GitHub Copilot CLI में स्थानीय मॉडल खोजें
Copilot का स्थानीय सैंडबॉक्स सामान्य रूप से उपलब्ध
7 अक्टूबर — GitHub Copilot का स्थानीय सैंडबॉक्स 2 जून को खुले सार्वजनिक पूर्वावलोकन चरण से बाहर आ गया है: यह अब Copilot CLI, GitHub Copilot ऐप और Agent Host के ज़रिए चलने वाले VS Code सत्रों में बिना अतिरिक्त लागत के सामान्य रूप से उपलब्ध है। Copilot द्वारा चलाए गए उपकरण और कमांड तब फ़ाइलों, नेटवर्क, Git और GitHub CLI के प्रमाणीकरण क्रेडेंशियल तथा सिस्टम की अन्य क्षमताओं तक सीमित पहुँच के साथ चलते हैं। ये सीमाएँ डेवलपर या उसके संगठन की निर्धारित नीतियों पर आधारित होती हैं; कोई कंपनी ऐसी सेटिंग अनिवार्य कर सकती है जिन्हें डेवलपर ढीला नहीं कर सकते, चाहे कोई भी मॉडल इस्तेमाल हो। इसका इंजन, Microsoft eXecution Container (MXC), Windows टीम की ओपन सोर्स लाइब्रेरी है जो Windows पर ProcessContainer, macOS पर Seatbelt और Linux पर bubblewrap का इस्तेमाल करती है, बिना किसी वर्चुअल मशीन के। इसकी सीमाएँ स्पष्ट रूप से लिखी गई हैं: अंतर्निहित फ़ाइल उपकरणों का नियंत्रण सिस्टम के बजाय स्वयं Copilot करता है, और दूरस्थ MCP सर्वर स्थानीय सैंडबॉक्स से बाहर रहते हैं।
🔗 GitHub Copilot के लिए स्थानीय सैंडबॉक्स अब सामान्य रूप से उपलब्ध
Replit Windows पर स्थानीय रूप से ऐप बनाता है
7 अक्टूबर — Replit ने Microsoft के साथ मिलकर एक डेस्कटॉप ऐप के पूर्वावलोकन की घोषणा की है, जो Windows पर सीधे उपयोगकर्ता के कंप्यूटर में ऐप बनाता और चलाता है। Replit पहले से एक डेस्कटॉप ऐप देता था: नई बात यह स्थानीय निर्माण है, जिसमें हर बिल्ड अपने अलग सैंडबॉक्स में चलता है। यह Microsoft Execution Containers और NVIDIA के ओपन सोर्स निष्पादन परिवेश OpenShell पर आधारित है। शुरुआती पहुँच के लिए प्रतीक्षा सूची है, लेकिन कोई तारीख या शुल्क नहीं बताया गया है, और macOS के लिए किसी संस्करण का उल्लेख नहीं है। Replit ने 7 अक्टूबर के Windows कार्यक्रम के दौरान मंच पर यह पूर्वावलोकन पेश किया।
🔗 X पर Replit की घोषणा · पूर्वावलोकन की प्रतीक्षा सूची
OpenAI ने एक आंतरिक मॉडल द्वारा तैयार गणितीय परिणामों की 722 पांडुलिपियाँ प्रकाशित कीं
6 अक्टूबर — OpenAI ने एक अत्याधुनिक आंतरिक मॉडल द्वारा तैयार गणितीय परिणामों का एक बड़ा संग्रह एक साथ प्रकाशित किया है। यह मॉडल सार्वजनिक रूप से उपलब्ध नहीं है। 6 अक्टूबर की शाम घोषित GitHub रिपॉज़िटरी openai/math में 722 पांडुलिपियाँ हैं, जिन्हें विषय के अनुसार वर्गीकृत 372 परिणाम-समूहों में रखा गया है: किसी मुख्य परिणाम के साथ पूरक तर्क, उससे निकलने वाले निष्कर्ष या वैकल्पिक प्रमाण भी हो सकते हैं।
अधिकांश परिणाम एक ही प्रक्रिया से आए हैं: मॉडल को लगभग 4 000 समस्याएँ दी गईं, और प्रति परिणाम औसतन ChatGPT Pro की तीन घंटे की विचार प्रक्रिया के बराबर गणना हुई। OpenAI बताता है कि अपने मौजूदा गणितीय मूल्यांकनों की सीमा तक पहुँचने के बाद उसने मूल्यांकन का दायरा बढ़ाकर अनसुलझी शोध समस्याओं को शामिल किया। दो शोध कार्य इस प्रक्रिया के अपवाद हैं: रीमान ज़ीटा फलन का एक शून्य-मुक्त क्षेत्र, जिसके लेखन को स्पष्टता के लिए एक व्यक्ति ने संपादित किया, और हॉज अनुमान के एक विशेष मामले, अर्थात CM एबेलीय विविधताओं वाले मामले, का प्रमाण।
| OpenAI द्वारा प्रकाशित संकेतक | घोषित मान |
|---|---|
| प्रकाशित पांडुलिपियाँ | 722 |
| परिणाम-समूह | 372 |
| मॉडल को दी गई समस्याएँ | लगभग 4 000 |
| प्रति परिणाम औसत गणना | ChatGPT Pro की लगभग तीन घंटे की विचार प्रक्रिया |
| प्रकाशित तर्क प्रक्रिया के सार | 10 |
सभी परिणामों का सत्यापन एक ही तरह से नहीं किया गया है। कई प्रमाण Lean में औपचारिक रूप से लिखे गए हैं, जो कंप्यूटर से प्रमाण की जाँच करने की सुविधा देने वाली भाषा है, लेकिन सभी प्रमाण ऐसे नहीं हैं: OpenAI चेतावनी देता है कि «कुछ गैर-औपचारिक परिणामों में त्रुटियाँ हो सकती हैं», उन्हें जल्दी सुधारने का वादा करता है और आगे नए औपचारिक प्रमाण जोड़ता रहेगा। मॉडल की तर्क प्रक्रिया के दस सार π के अपरिमेयता घातांक, माहलर के अनुमानों, अभिलक्षण दो में काप्लान्स्की के प्रत्यक्ष परिमितता अनुमान या मुक्त समूह फ़ैक्टरों की समाकृतिकता जैसे विषयों पर हैं।
प्रकाशन की तैयारी Institute for Advanced Study के गणित और AI पर स्वतंत्र सलाहकार समूह के साथ की गई: समीक्षा और उद्धरण के नियम, नए संस्करणों के रूप में प्रकाशित सुधार और सुरक्षित रखा गया इतिहास। OpenAI ने इन परिणामों को समर्पित कार्यशालाओं, सम्मेलनों और कार्यक्रमों के लिए वित्तपोषण की भी घोषणा की है, और कहता है कि वह वैज्ञानिकों को इन्हें तैयार करने वाले मॉडल तक «जिम्मेदार» पहुँच देने पर काम कर रहा है, लेकिन कोई समय-सीमा नहीं बताता।
We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.
🇮🇳 हम एक अत्याधुनिक आंतरिक मॉडल द्वारा तैयार किए गए नए गणितीय परिणामों का व्यापक संग्रह प्रकाशित कर रहे हैं। हमने Institute for Advanced Study के गणित और कृत्रिम बुद्धिमत्ता पर स्वतंत्र सलाहकार समूह से परामर्श किया है और इन परिणामों को प्रकाशित करने का तरीका तय करने के लिए उसकी सलाह और सार्वजनिक अनुशंसाओं का सहारा लिया है। — X पर @OpenAI
🔗 गणित में AI की प्रगति साझा करना · GitHub पर openai/math रिपॉज़िटरी
Perplexity ने pplx-embed-v2-late जारी किया, पाठ और चित्रों के लिए मल्टी-वेक्टर एम्बेडिंग
7 अक्टूबर — Perplexity Research ने pplx-embed-v2-late जारी किया है। इसमें 0.6B और 9B पैरामीटर वाले दो विलंबित इंटरैक्शन (लेट इंटरैक्शन) एम्बेडिंग मॉडल हैं, जो MIT लाइसेंस के तहत Hugging Face पर उपलब्ध हैं। जहाँ डेंस एम्बेडिंग हर दस्तावेज़ को एक ही वेक्टर में समेट देती है, वहीं ColBERT प्रकार के ये मॉडल हर टोकन के लिए 128 आयामों का एक वेक्टर रखते हैं और MaxSim से हर क्वेरी-दस्तावेज़ जोड़ी को स्कोर देते हैं: क्वेरी के हर टोकन का मिलान दस्तावेज़ के सबसे निकटवर्ती टोकन से किया जाता है। ये OCR का उपयोग किए बिना पाठ, चित्रों और रेंडर किए गए पृष्ठों (PDF, स्लाइड, स्कैन) में खोज करते हैं, जिससे तालिकाएँ, आकृतियाँ और पृष्ठ का विन्यास सुरक्षित रहते हैं।
दोनों आकारों के मॉडल एक ही एम्बेडिंग स्पेस साझा करते हैं, क्योंकि उन्हें 27B के आधार मॉडल से बने 18B के एक आंतरिक शिक्षक मॉडल से टोकन-दर-टोकन डिस्टिल किया गया है। इसलिए 9B से इंडेक्स किए गए कॉर्पस में 0.6B से एनकोड की गई क्वेरी के ज़रिए खोज की जा सकती है: चित्रों वाले ViDoRe v3 पर यह विन्यास 63,5 % तक पहुँचता है, जबकि दोनों तरफ़ 0.6B इस्तेमाल करने पर स्कोर 62,3 % है, और क्वेरी की लागत नहीं बढ़ती। Qwen3.5-0.8B की प्रूनिंग करके बनाया गया 0.6B इस तरह एक हल्के क्वेरी एनकोडर का काम करता है, यहाँ तक कि डिवाइस पर भी।
| मूल्यांकित बेंचमार्क (Perplexity के माप) | 9B का स्कोर | 0.6B का स्कोर | तुलना का आधार |
|---|---|---|---|
| 72 विशिष्ट कार्य (nDCG@10) | 81,3 % | 78,0 % | 9B अगले मॉडल से 1,6 अंक आगे है |
| Q2D-Web, वेब खोज (Recall@1000) | 74,8 % | 73,6 % | nemotron-embed-8b : 69,3 % |
| चित्रों वाला ViDoRe v3 (nDCG@10) | 65,2 % | 62,3 % | केवल EVIE, 9B से आगे है |
| BrowseComp+ (GPT-OSS-120B एजेंट) | 64,0 % | — | अगला सर्वश्रेष्ठ ColBERT : 4,9 अंक कम |
| MADQA (Gemini 3.5 Flash एजेंट) | 92,4 % | 90,1 % | Mixedbread Agentic Search : 93,4 % |
9B हर जगह नहीं जीतता, और Perplexity ने यह बात लिखी है: Tencent का EVIE चित्रों वाले ViDoRe v3 पर उससे आगे है, gemini-embedding-2, MIRACL-Vision और आंतरिक बेंचमार्क PPLX-Q2I पर उससे आगे है, और Mixedbread Agentic Search को MADQA पर बेहतर स्कोर मिलता है। Perplexity के अनुसार यह अंतर उसके विश्वास अंतराल के भीतर है। कंपनी यह भी स्वीकार करती है कि दस्तावेज़ों की लंबाई के साथ स्टोरेज और स्कोरिंग की लागत बढ़ती है। एक तकनीकी रिपोर्ट « इस वर्ष बाद में » जारी करने की घोषणा की गई है, और Perplexity अपनी API प्लेटफ़ॉर्म पर लेट इंटरैक्शन, डेंस और कॉन्टेक्स्चुअल एम्बेडिंग को धीरे-धीरे उपलब्ध कराने की योजना बना रही है, लेकिन कोई तारीख़ नहीं दी गई है।
🔗 Perplexity Research की ब्लॉग पोस्ट · Hugging Face पर pplx-embed-v2-late-9b
कोड एजेंट: Claude Code 2.1.293, Codex CLI 0.161.0, iOS पर Cursor, Antigravity 2.21.0 और Warp Factories
कोड एजेंटों के पाँच टूल में बदलाव हुए हैं: Claude Code ने Haiku 5.5 अपनाया है, Codex CLI टर्मिनल से MCP सर्वरों से जुड़ता है, Cursor को iPhone से नियंत्रित किया जा सकता है, Antigravity अपने एजेंट की कार्रवाइयों को एक साथ समूहित करता है और Warp अब Microsoft के टूल से जुड़ता है।
Claude Code 2.1.293 में Haiku 5.5 अब डिफ़ॉल्ट मॉडल है
7 अक्टूबर — Haiku 5.5 की घोषणा के कुछ मिनट बाद जारी Claude Code का संस्करण 2.1.293, Anthropic API पर उसे डिफ़ॉल्ट Haiku मॉडल बनाता है। कस्टम सब-एजेंटों की पहचान के लिए इसमें subagentStatusLine के पेलोड में agentType फ़ील्ड जोड़ा गया है, और isDeferred विकल्प भी जोड़ा गया है, जो मॉड द्वारा घोषित टूल का स्कीमा शुरुआत में ही उपलब्ध कराता है। मुख्य बदलाव 56 प्रविष्टियों में शामिल 38 सुधार हैं: कॉम्पैक्शन के बाद Claude कभी-कभी उससे पहले की अपनी अंतिम कार्रवाइयों को उसके बाद का मान लेता था, और फिर पूरा हो चुका काम हटा देता था या दोबारा करता था; किसी पाथ तक सीमित नियम और नेस्टेड CLAUDE.md अब तब भी लोड होते हैं जब Claude, Bash में cat या grep से कोई फ़ाइल पढ़ता है; MCP HTTP कनेक्शन में मेमोरी लीक भी दूर किया गया है। हाल के दो बदलाव वापस लिए गए हैं (2.1.281 में ऑटो मोड का अस्वीकृति संदेश और 2.1.290 में क्लाउड सत्रों का एक सुधार), और Claude Tag में चैनल नियमों की सीमा 20 से बढ़कर 50 हो गई है।
🔗 GitHub पर Claude Code 2.1.293
Codex CLI 0.161.0 में Daybreak अब एक विकल्प से सक्रिय होता है
7 अक्टूबर — Codex CLI 0.161.0, 5 अक्टूबर को आए 0.160.1 के बाद पहला स्थिर संस्करण है। /mcp login <name> कमांड से मौजूदा टर्मिनल सत्र छोड़े बिना किसी MCP सर्वर से जुड़ा जा सकता है, और आवाज़ वाली बातचीत में अब माइक्रोफ़ोन, स्पीकर और इनपुट चैनल चुनने की सुविधा है। OpenAI की साइबर उत्पाद शृंखला Daybreak अब एक विकल्प से सक्रिय होती है: जब तक उपयोगकर्ता इसे --enable cli_daybreak (या features.cli_daybreak=true) से सक्रिय नहीं करता, /daybreak टॉगल और स्टेटस लाइन में Daybreak की स्थिति छिपे रहते हैं, और इसके बिना स्वचालित Cyber रूटिंग भी शामिल नहीं होती। केवल एक टर्न के लिए codex exec --cyber-access-program से Cyber ऐक्सेस प्रोग्राम चुना जा सकता है। Amazon Bedrock में संगत मॉडलों के लिए मल्टी-एजेंट V2 और Ultra रीजनिंग एफ़र्ट उपलब्ध हो रहे हैं, और Bedrock Mantle अब AWS GovCloud क्षेत्रों को स्वीकार करता है। सुधार अनुमतियों, बातचीत को फिर से जारी करने और दूषित SQLite डेटाबेस की पहचान से जुड़े हैं।
Cursor से iOS पर कंप्यूटर के एजेंटों को नियंत्रित किया जा सकता है
6 अक्टूबर — Cursor का iOS ऐप अब कंप्यूटर पर स्थानीय रूप से चल रहे एजेंट दिखाता है: हर एजेंट क्या कर रहा है, यह देखा जा सकता है और उसे जवाब दिया जा सकता है। घोषणा वाले ट्वीट में नए कार्य शुरू करने का भी उल्लेख है। एजेंट कंप्यूटर पर ही रहते हैं, ऐप उनसे जुड़ता है: इसलिए कंप्यूटर चालू और ऑनलाइन रहना चाहिए, और Keep this computer awake सेटिंग उसे स्लीप मोड में जाने से रोकती है, बशर्ते कंप्यूटर बिजली से जुड़ा हो और स्क्रीन खुली हो। यह सुविधा डिफ़ॉल्ट रूप से सक्रिय है, लेकिन Enterprise संगठनों में इसे प्रशासक को सक्रिय करना होगा; पेयरिंग की पुष्टि डेस्कटॉप ऐप में होती है, और क्लाउड एजेंटों की ज़रूरत नहीं है। जून के अंत में जारी iOS ऐप में क्लाउड एजेंटों पर ज़ोर था: अब स्थानीय एजेंट भी फ़ोन से उपलब्ध हो गए हैं।
Antigravity 2.21.0 अपने एजेंट की कार्रवाइयों को एक साथ समूहित करता है
6 अक्टूबर — Google का Antigravity ऐप संस्करण 2.21.0 पर पहुँच गया है, जिसमें 9 सुधार और 14 त्रुटि सुधार शामिल हैं। उन्नत खोज से ⌘+K (Windows पर Ctrl+K) के ज़रिए किसी बातचीत को उसकी सामग्री के आधार पर ढूँढ़ा जा सकता है। निर्धारित कार्यों (Scheduled Tasks) का टैब अब Automations बन गया है: इसमें Run Now से किसी ऑटोमेशन को तुरंत चलाया जा सकता है, या Create with Prompt से एजेंट को नया ऑटोमेशन बनाने में मार्गदर्शन देने के लिए कहा जा सकता है। दो जवाबों के बीच एजेंट द्वारा किए गए फ़ाइल बदलाव, टर्मिनल कमांड और पढ़ने की कार्रवाइयाँ अब एक ही समेटी जा सकने वाली पंक्ति में समूहित होती हैं, जिसके साथ एक छोटा सारांश होता है। त्रुटि सुधारों में यह समस्या भी शामिल है कि एजेंट के अधूरी MP4 या MOV वीडियो पढ़ने से आगे की पूरी बातचीत विफल हो सकती थी, और Windows के Notepad या PowerShell से सहेजी गई सेटिंग फ़ाइल काम करना बंद कर देती थी। बदलावों का विवरण बताता है कि किसी संस्करण को सभी उपयोगकर्ताओं तक पहुँचने में कुछ दिन लग सकते हैं।
🔗 Antigravity के बदलावों का विवरण
Warp Factories अब Microsoft Teams और Azure DevOps से जुड़ता है
7 अक्टूबर — Warp ने अपनी सॉफ़्टवेयर फ़ैक्टरी (सॉफ़्टवेयर फ़ैक्टरी) प्लेटफ़ॉर्म Warp Factories को Microsoft Teams और Azure DevOps Services से जोड़ दिया है। Teams में किसी कॉन्फ़िगर किए गए चैनल या थ्रेड में Warp ऐप का उल्लेख करने पर बातचीत के संदर्भ सहित कार्य फ़ैक्टरी को सौंप दिया जाता है; वह उसी थ्रेड में अपनी प्रगति बताती है और समीक्षा के लिए अपनी पुल रिक्वेस्ट भी वहीं भेजती है। Azure DevOps में किसी कार्य आइटम (वर्क आइटम) या पुल रिक्वेस्ट से फ़ैक्टरी का उल्लेख किया जा सकता है, या उनसे जुड़ी घटनाओं पर रन शुरू किए जा सकते हैं; Git कार्रवाइयों के लिए हर फ़ैक्टरी को अपनी अलग पहचान मिलती है, और उसका ऐक्सेस चुनी गई रिपॉज़िटरी तक सीमित होता है। दोनों इंटीग्रेशन Warp Factories के सभी ग्राहकों के लिए उपलब्ध हैं। Warp इस दोहरे मूल समर्थन को उद्योग में पहली बार उपलब्ध होने वाला बताता है; Devin पहले से ही Teams और Azure DevOps Server से जुड़ता था।
API और प्लेटफ़ॉर्म: Claude SDK के computer use और browser use टूलसेट, Microsoft Foundry पर Grok 4.7
होस्ट किए गए मॉडलों पर निर्माण करने वाले डेवलपरों के लिए दो घोषणाएँ: Anthropic ने कंप्यूटर या ब्राउज़र का संचालन आसान बनाया है, और Grok 4.7 अब Microsoft पर सामान्य रूप से उपलब्ध है।
Claude SDK के computer use और browser use टूलसेट
7 अक्टूबर — Claude के Python और TypeScript SDK में computer use और browser use टूल समूह (टूलसेट) बीटा के रूप में शामिल किए गए हैं। अब तक API बताती थी कि Claude कहाँ क्लिक करना या क्या टाइप करना चाहता है, और हर कार्रवाई को कमांड में बदलने के लिए अपना लूप लिखना पड़ता था। अब SDK इस लूप को संभालता है: डेवलपर BetaAbstractBrowserToolset20260801 या BetaAbstractComputerToolset20260801 की सबक्लास बनाता है, हर कार्रवाई के लिए एक मेथड लिखता है, और SDK कॉल को रूट करता है, दी गई URL और फ़ाइल नीतियाँ लागू करता है, अनुमोदन माँगता है और मॉडल को वापस भेजे जाने वाले परिणाम तैयार करता है। Anthropic इस्तेमाल के लिए तैयार ब्राउज़र या ड्राइवर उपलब्ध नहीं कराता: अपना ऑटोमेशन या Browser Use, Browserbase, E2B या Daytona का ड्राइवर जोड़ा जाता है, और claude-quickstarts रिपॉज़िटरी में Chrome DevTools Protocol का एक न्यूनतम उदाहरण प्रकाशित किया गया है। JavaScript का निष्पादन और फ़ाइल भेजना डिफ़ॉल्ट रूप से बंद है, और URL नीति के बिना किसी पते की जाँच नहीं होती।
🔗 X पर @ClaudeDevs का थ्रेड · SDK टूलसेट का दस्तावेज़ीकरण
Microsoft Foundry पर Grok 4.7 सामान्य रूप से उपलब्ध
7 अक्टूबर — 21 सितंबर को जारी SpaceXAI का मॉडल Grok 4.7 अब Microsoft Foundry पर उपलब्ध है, जैसा कि @SpaceXAI ने रात में घोषणा की। Microsoft के दस्तावेज़ीकरण में इसे Azure द्वारा सीधे बेचे जाने वाले मॉडलों में सामान्य रूप से उपलब्ध बताया गया है: इनपुट में पाठ और चित्र, 500 000 टोकन का संदर्भ (इनपुट और आउटपुट मिलाकर), टूल कॉलिंग, Chat Completions या Responses API से ऐक्सेस, और low से xhigh तक रीजनिंग एफ़र्ट, जिसमें high डिफ़ॉल्ट है। Microsoft ने Grok 4.7 से शुरू करके Grok मॉडलों को कम से कम छह महीने तक सामान्य रूप से उपलब्ध रखने की प्रतिबद्धता जताई है; Grok 4.6 वहाँ अब भी प्रीव्यू में है। 7 अक्टूबर की शाम तक Azure के मूल्य निर्धारण पृष्ठ पर Grok 4.7 सूचीबद्ध नहीं था। Amazon Bedrock (28 सितंबर) और Google Cloud के प्रीव्यू (1 अक्टूबर) के बाद, इस तरह Grok 4.7 अब तीनों प्रमुख क्लाउड प्रदाताओं पर उपलब्ध है।
🔗 Microsoft Foundry में Grok मॉडलों को डिप्लॉय और इस्तेमाल करें
खुले मॉडल: Liquid AI का Open d1, Bwen 8B और Blama 8B के साथ Nature में Ai2 का Bolmo
खुले वज़न वाली दो पेशकशें, एक नेटवर्क के किनारे तेज़ी से निर्णय लेने के लिए और दूसरी पाठ को बाइट-दर-बाइट पढ़ने के लिए।
Open d1, Liquid AI के खुले निर्णय मॉडल
7 अक्टूबर — Liquid AI ने Open d1 के साथ अपने निर्णय मॉडलों का परिवार खोल दिया है: खुले वज़न वाले दो मॉडल, d1-3B (पाठ और चित्र) और d1-omni-600M (चित्र या ऑडियो के साथ पाठ), जिनमें दूसरा शुरुआती शोध संस्करण है। ये पाठ उत्पन्न नहीं करते: एक ही पास में हर अनुमत जवाब को एक प्रायिकता देते हैं। Liquid AI के अनुसार, d1-3B को Decision Index 0.2.1 पर 48,57 का स्कोर मिलता है, जो 10 अरब से कम पैरामीटर वाले मॉडलों में सबसे अच्छा है और Decider 35B-A3B (47,11) से आगे है। सात सार्वजनिक डेटासेट पर इसका औसत 82,9 है। NVIDIA के साथ मापी गई एक प्रश्न की लेटेंसी RTX 4090 पर 8 ms से Jetson Orin Nano पर 50 ms तक है, जिससे नेटवर्क के किनारे (एज) पर उपयोग को लक्ष्य बनाया जा सकता है। विज़न या ऑडियो का कोई बेंचमार्क प्रकाशित नहीं किया गया है। वज़न Hugging Face पर Liquid AI के अपने लाइसेंस (lfm1.0) के तहत उपलब्ध हैं, साथ में GGUF संस्करण भी हैं; 29 सितंबर का d1 केवल API के ज़रिए उपलब्ध था।
🔗 Hugging Face पर Liquid AI की ब्लॉग पोस्ट
Bwen 8B और Blama 8B के साथ Nature में Ai2 का Bolmo
7 अक्टूबर — Ai2 ने Nature में, 7 अक्टूबर को ऑनलाइन प्रकाशित लेख में, Bolmo के पीछे की विधि प्रस्तुत की है। Bolmo उसके पूरी तरह खुले मॉडलों का परिवार है, जो उपशब्दों के बजाय सीधे बाइट पढ़ते हैं। बाइट पढ़ने से निश्चित शब्दावली की सीमाओं (वर्तनी, असामान्य स्ट्रिंग, कुछ लेखन प्रणालियाँ) से बचा जा सकता है, लेकिन अब तक इसके लिए शून्य से पूरा प्रशिक्षण करना पड़ता था। इसके विपरीत, बाइट में रूपांतरण (बाइटिफ़ाइंग) पहले से अच्छा प्रदर्शन करने वाले उपशब्द मॉडल से शुरू होता है और थोड़े अतिरिक्त प्रशिक्षण से उसे बदलता है। Olmo से बने Bolmo 1B और 7B दिसंबर के हैं; Ai2 ने Bwen 8B (Qwen 3 8B से बना, Apache-2.0 लाइसेंस) और Blama 8B (Llama 3 8B से बना, llama3 लाइसेंस) भी प्रस्तुत किए हैं, जिनकी रिपॉज़िटरी 26 अगस्त से मौजूद हैं। साथ में « Stage 1 » चेकपॉइंट भी हैं, जिनमें केवल नई बाइट परत को प्रशिक्षित किया गया है। Ai2 के अनुसार, दोनों मॉडलों का प्रदर्शन उनके मूल मॉडलों के करीब है और Bwen 8B, Bolmo 7B से आगे है, लेकिन कोई आँकड़ा प्रकाशित नहीं किया गया है।
चित्रों, वीडियो और आवाज़ की जाँच के लिए SynthID Detector अब सभी के लिए उपलब्ध
7 अक्टूबर — Google ने SynthID Detector को सभी के लिए खोल दिया है। यह टूल AI से बनी सामग्री में अदृश्य SynthID वॉटरमार्क पहचानता है। पिछले वर्ष मीडिया पेशेवरों के लिए शुरुआती संस्करण के रूप में प्रस्तुत यह टूल अब synthid.com पर पूरी दुनिया में अंग्रेज़ी में उपलब्ध है। इसमें कोई चित्र, वीडियो या ऑडियो फ़ाइल अपलोड की जाती है। जाँच में Google और उसके साझेदारों OpenAI, NVIDIA और Kakao की सामग्री शामिल है, और जल्द ही Apple की भी होगी। पोर्टल बताता है कि यह हर तरह की AI सामग्री पहचानने वाला सामान्य डिटेक्टर नहीं है: SynthID के बिना किसी मॉडल से बनी सामग्री, या बहुत अधिक बदली गई सामग्री का परिणाम « नहीं मिला » आ सकता है। Google के अनुसार, 2023 से अब तक 180 अरब से अधिक चित्रों और वीडियो तथा 240 000 वर्षों के ऑडियो पर वॉटरमार्क लगाए जा चुके हैं, जबकि जुलाई में घोषित आँकड़े 100 अरब और 60 000 वर्ष थे। Search, Gemini ऐप और Chrome में प्रतिदिन दस लाख से अधिक जाँचें होती हैं।
🔗 Google ने AI सामग्री के लिए SynthID Detector का विस्तार किया
सुरक्षा: लीक हुए सीक्रेट के लिए GitHub का क्लासिफ़ायर
7 अक्टूबर — GitHub ने लीक हुए सीक्रेट के लिए एक फ़ाइन-ट्यून किया गया ModernBERT क्लासिफ़ायर शुरू किया है, जिसे Microsoft Applied Sciences के साथ बनाया गया है: यह किसी मान के आसपास का कोड पढ़कर संभावित क्रेडेंशियल पहचानता है, जिनमें बिना किसी पहचानने योग्य प्रारूप वाले पासवर्ड भी शामिल हैं। यह उम्मीदवारों के एक बैच का मूल्यांकन 2 ms से कम समय में करता है और GitHub के अनुसार, पुश के दौरान रोके जाने वाले सीक्रेट की संख्या को « दोगुने से भी अधिक » कर सकता है। अब से AI द्वारा पहचाने गए पासवर्ड के अलर्ट इसी मॉडल का उपयोग करेंगे, बिना अतिरिक्त लागत के। निजी प्रीव्यू में मौजूद AI आधारित पुश सुरक्षा पात्र संगठनों के लिए « इस महीने बाद में » उपलब्ध होनी है, और Copilot की /security-review कमांड की जाँचें « जल्द » निजी प्रीव्यू में आएँगी; दोनों के लिए AI क्रेडिट लगेंगे। GitHub में सुरक्षा उत्पाद प्रबंधक Erin Havens के लेख में याद दिलाया गया है कि हर तीन पुल रिक्वेस्ट में से एक में AI एजेंट शामिल होता है, और पुश सुरक्षा पहचाने गए नए सीक्रेट में से केवल लगभग 30 % को रोकती है।
🔗 सॉफ़्टवेयर के विस्तार के साथ सीक्रेट की सुरक्षा भी बढ़नी चाहिए
आधारभूत संरचना : GitHub एजेंटों की गतिविधि के लिए Git का पुनर्निर्माण कर रहा है
6 अक्टूबर — GitHub एजेंट आधारित विकास की गति के साथ तालमेल रखने के लिए अपने Git ढाँचे का पुनर्निर्माण कर रहा है। ब्रायन सेलेन्ज़ा के इंजीनियरिंग लेख के अनुसार, सितंबर 2025 से अगस्त 2026 के बीच Git की कुल गतिविधि 218,2 से बढ़कर 473,3 अरब घटनाएँ प्रति माह हो गई; डेवलपरों और एजेंटों ने सितंबर 2026 में 7,38 अरब कमिट किए, जो एक साल पहले की तुलना में पाँच गुना से अधिक हैं, और पुश की संख्या 4,9 गुना हो गई। मौजूदा आर्किटेक्चर, Spokes, हर रिपॉज़िटरी की प्रतियाँ कई सर्वरों पर रखता है और हर अपडेट को बहुमत के मतदान से मान्य करता है: इसलिए पढ़ने के लिए और प्रतियाँ जोड़ने से लिखने की गति धीमी हो जाती है। नया आर्किटेक्चर भंडारण और गणना को अलग करता है, जिसमें मुख्य डेटा Azure Blob Storage में रहता है और हल्की प्रक्रियाएँ (workers) कैश से पढ़ने के अनुरोध पूरे करती हैं। अपने आंतरिक बेंचमार्क में GitHub ने लिखने का थ्रूपुट 35 गुना तक अधिक मापा है, लेकिन नई प्रणाली पर जाने की कोई तारीख नहीं दी है।
🔗 एजेंटों के पैमाने पर विकास के लिए Git का आधारभूत ढाँचा बनाना
वॉइस एआई : ElevenLabs ने एक भारतीय राज्य के साथ समझौता ज्ञापन पर हस्ताक्षर किए
7 अक्टूबर — बेंगलुरु में अपने सम्मेलन के दौरान ElevenLabs ने वॉइस एआई की एक प्रायोगिक परियोजना के लिए किसी भारतीय राज्य की सरकार के साथ अपने पहले समझौता ज्ञापन (MOU) पर हस्ताक्षर किए। कंपनी राज्य का नाम नहीं बताती और न समयसीमा, न दायरा, न राशि देती है: घोषणा केवल एक ट्वीट में की गई है, कोई ब्लॉग लेख नहीं है। इसके साथ दिया गया आँकड़ा इस पहल का महत्व स्पष्ट करता है: पिछले साल ElevenAgents ने भारत में 100 मिलियन से अधिक बातचीत कीं, जिनमें से 70 % से अधिक हिंदी, कन्नड़, तमिल और तेलुगु में थीं। सम्मेलन में 500 से अधिक कारोबारी प्रमुख, डेवलपर और साझेदार शामिल हुए।
अनुसंधान : PivotOPD, एजेंट की निर्णायक त्रुटि सुधारने की NVIDIA की विधि
7 अक्टूबर — NVIDIA के शोधकर्ता PivotOPD प्रस्तुत करते हैं, जो कार्रवाई के कई चरणों से गुजरने वाले एजेंटों के प्रशिक्षण की एक विधि है। उनका निष्कर्ष: ALFWorld पर तीन Qwen3 मॉडलों की 59 % विफलताओं में एक « निर्णायक त्रुटि » होती है, जो शुरुआती चरण में होती है और जिसके बाद एजेंट गलत दिशा में आगे बढ़ता रहता है। PivotOPD ऑन-पॉलिसी डिस्टिलेशन (on-policy distillation) का विस्तार करता है: हर निर्णायक त्रुटि पर एक शिक्षक मॉडल सही कार्रवाई बताता है, फिर अगले चरणों के लिए सुधारात्मक कार्रवाई सुझाता है, जिससे विद्यार्थी मॉडल त्रुटि से बचना और उससे उबरना सीखता है। 13 मानक विधियों की तुलना में यह 1.7B और 8B के Qwen3 विद्यार्थी मॉडलों के साथ ALFWorld, WebShop और Search-based QA पर सबसे अच्छा औसत प्राप्त करता है, और दोबारा चलाकर जाँची गई 72 निर्णायक त्रुटियों में से 72,7 % से उबरता है, जबकि मानक डिस्टिलेशन के लिए यह आँकड़ा 20,3 % है। यह लाभ कोड में भी मिलता है: Nemotron-3.5 का एक विद्यार्थी मॉडल SWE-Bench Verified पर 62,8 % से बढ़कर 66,0 % तक पहुँचता है। शोधपत्र arXiv पर उपलब्ध है; कोड जल्द जारी करने की घोषणा की गई है।
अनुकूलन : mPDLP, cuOpt में विशाल रैखिक प्रोग्रामों को कई GPU पर बाँटता है
7 अक्टूबर — NVIDIA अपनी मुक्त स्रोत अनुकूलन लाइब्रेरी cuOpt में mPDLP जोड़ रहा है, जो बड़े नियोजन कार्यों (आपूर्ति शृंखलाओं, बिजली नेटवर्क) के लिए NVLink से जुड़े कई GPU पर वितरित रैखिक प्रोग्रामिंग सॉल्वर है। परस्पर निर्भर चरों और बाधाओं को एक ही GPU पर रखने से यह डेटा के आदान-प्रदान को सीमित करता है और प्रति GPU चरम मेमोरी उपयोग को 6 गुना तक घटाता है। DGX B200 के एक नोड पर PDLP गणना में गति वृद्धि 11,4 गुना और पूरी प्रक्रिया में 4,2 गुना तक पहुँचती है; D-PDLP की तुलना में mPDLP अधिकांश बड़ी समस्याओं पर 1,2 से 2,5 गुना तेज है, लेकिन तीन सबसे बड़े मामलों और छोटी समस्याओं पर धीमा है। Kinaxis आठ H100 पर 135 मिलियन से अधिक चरों वाली आपूर्ति शृंखला को 3,3 गुना अधिक तेजी से हल करता है, और PSR आठ B200 पर 185 मिलियन चरों वाले ऊर्जा मॉडल को 5 गुना से अधिक तेजी से हल करता है।
रोबोटिक्स : रोबोट GB300 की परीक्षण ट्रे असेंबल करते हैं
7 अक्टूबर — NVIDIA की Seattle Robotics Lab बताती है कि वह रोबोटों को GB300 की परीक्षण ट्रे असेंबल करना कैसे सिखाती है, जो भेजे जाने से पहले मॉड्यूल की जाँच करती हैं। इन प्रणालियों को बनाने वाली Foxconn के साथ दो क्रियाएँ चुनी गईं: एक बसबार को रखकर 16 बिंदुओं पर पेंच कसना, और लचीली केबलों पर लगे चार कनेक्टरों को जोड़ना। Foxconn के साथ तय की गई आवश्यकता है कि बिना टक्कर के 99,5 % सफलता मिले और काम पूरा करने में किसी कुशल ऑपरेटर के समय के अधिकतम दोगुना समय लगे। रोबोट इस लक्ष्य के करीब पहुँचते हैं, लेकिन इसे हासिल नहीं कर पाते: बसबार के लिए 160 सेकंड में 95 % से अधिक सफलता, जबकि लक्ष्य 124 सेकंड है, और कनेक्टरों के लिए प्रति केबल 40 सेकंड में 90 से 95 % सफलता। टीम एक पारंपरिक बोध और नियंत्रण प्रणाली, स्थिति तथा अभिविन्यास का आकलन करने वाले DOPER और Isaac Lab में पुनर्बलन अधिगम को जोड़ती है, जिसे वास्तविक रोबोट पर सुधारा जाता है। NVIDIA ने DOPER और अपने ऑर्केस्ट्रेटर TALOS को जारी करने का वादा किया है, लेकिन कोई तारीख नहीं दी है।
🔗 GB300 ट्रे पर NVIDIA के तकनीकी ब्लॉग का लेख
संक्षिप्त समाचार
- ChatGPT 1.2026.272 का iOS ऐप — यह सीधे जवाबों में वेब पृष्ठों के पूर्वावलोकन दिखाता है, Codex कार्यों के लिंक ऐप में खोलता है और Codex Mobile में स्वीकृति चयनक को नया रूप देता है तथा लंबे संवादों में सामग्री के प्रवाह को तेज करता है। 🔗 स्रोत
- Radisson Hotel Group — OpenAI के एक केस अध्ययन के अनुसार, Accenture Song के साथ छह सप्ताह में बनाया गया इसका ChatGPT प्लगइन जुलाई-अगस्त 2026 में इसकी ऑर्गेनिक खोज की तुलना में लगभग 1,5 गुना बेहतर रूपांतरण करता है, और ChatGPT में इसके विज्ञापन अभियान के भुगतान तथा आरक्षण संबंधी 54 % घटनाओं का श्रेय केवल विज्ञापन देखे जाने को दिया गया है। 🔗 स्रोत
- Jump Trading — यह मात्रात्मक ट्रेडिंग कंपनी GPT-6 Astra एजेंटों को ऐसे विश्लेषण सौंपती है जो अनेक डेटा स्रोतों को मिलाकर कई दिनों तक चल सकते हैं, और प्रक्रिया के अंत में मानव समीक्षा होती है; OpenAI का केस अध्ययन लाभ का कोई आँकड़ा प्रकाशित नहीं करता। 🔗 स्रोत
- ChatGPT प्लगइन एक्सटेंशन — अपने वीडियो ट्यूटोरियल के थ्रेड में OpenAI Developers इन्हें इस्तेमाल करने वाली कंपनियों में tldraw और MagicPath के अलावा Adobe, Canva, Figma, Shopify, Instacart और Atlassian का नाम लेता है; 29 सितंबर को प्रस्तुत किए गए ये एक्सटेंशन साइडबार से प्लगइन शुरू करते हैं, @ उल्लेख सँभालते हैं और फ़ाइल व्यूअर जोड़ते हैं। 🔗 स्रोत
- Every और Claude Managed Agents — Every की टीम ने Claude Managed Agents पर कंपनी के लिए एक एजेंट बनाया, जिसे हर कोई Slack में प्रत्येक नए मॉडल के साथ अपने कौशल साझा करने के लिए इस्तेमाल करता है, फिर उसे अपने सदस्यों के लिए भी उपलब्ध कराया; Anthropic एक वीडियो साक्षात्कार साझा करता है, जिसमें कोई आँकड़ा नहीं है। 🔗 स्रोत
- Zed 1.23 और पूर्वावलोकन 1.24.1 — संस्करण 1.23 अपने JSONL और NDJSON फ़ाइल पूर्वावलोकन के साथ स्थिर संस्करण बन गया है, और पूर्वावलोकन 1.24.1 टर्मिनल टैब को खींचकर Agent Panel में लाने देता है, टूल, चित्र और चिंतन के साथ कस्टम Amazon Bedrock मॉडल स्वीकार करता है, Git टैग बनाता है और Linux बाइनरी का आकार लगभग 23 % घटाता है। 🔗 स्रोत
- Amp का मेटा-एजेंट Puck — यह अब कई अलग-अलग संवाद स्वीकार करता है: + बटन एक नया संवाद खोलता है, उसके नाम पर क्लिक करके एक से दूसरे संवाद में जाया जा सकता है, और तीन दिनों से निष्क्रिय संवाद अलग रख दिए जाते हैं। 🔗 स्रोत
- Copilot CLI 1.0.93 — स्थिर संस्करण में पहुँच चुकी यह CLI सत्र दोबारा शुरू किए बिना दो चरणों के बीच MCP सर्वरों के कॉन्फ़िगरेशन में हुए बदलाव लागू करती है, और /sandbox तथा —sandbox के माध्यम से कमांड सैंडबॉक्स सभी के लिए उपलब्ध कराती है; Copilot SDK 1.0.17 भी स्थिर संस्करण बन गया है। 🔗 स्रोत
- Copilot के उपयोग संबंधी मेट्रिक्स — जब से कई IDE अपने सत्र Copilot SDK से गुजारने लगे हैं, ये एजेंटों की गतिविधि कम गिन रहे थे; सुधार के लिए अपडेट आवश्यक है (VS Code 1.139.0 अभी से, Visual Studio 18.12 अक्टूबर में, JetBrains अक्टूबर के अंत में, Eclipse और Xcode नवंबर तक), और खोया हुआ डेटा वापस नहीं मिलेगा। 🔗 स्रोत
- Gemini CLI v0.65.0-nightly.20261007 — यह रात्रिकालीन संस्करण पाँच सुधारों के साथ 0.65.0 शृंखला की शुरुआत करता है, जिनमें दो डेटा हानि रोकने के लिए हैं: अविश्वसनीय फ़ोल्डर में परियोजना की सेटिंग केवल पढ़ने योग्य हो जाती हैं, जहाँ
gemini mcp addसे.gemini/settings.jsonखाली हो सकता था, और फिर शुरू किए गए सत्र से तुरंत बाहर निकलने पर अब उसका इतिहास नहीं हटता। 🔗 स्रोत - Transformers.js 4.3.1 — EmbeddingGemma 2 जारी होने के अगले दिन, यह लाइब्रेरी उसकी मल्टीमोडल एम्बेडिंग (740 मिलियन पैरामीटर, 768 आयाम) की गणना सीधे ब्राउज़र में WebGPU या WASM से, अथवा Node.js में करती है। 🔗 स्रोत
- RL Environment Explorer — Hugging Face के आदित्य एस के, FineEnvs का यह Space प्रस्तुत करते हैं, जिससे Hub के पुनर्बलन अधिगम परिवेशों (OpenEnv, Harbor, MiMo, Verifiers, NeMo Gym) को खोजा, देखा और चलाया जा सकता है: इसमें 12 मिलियन से अधिक कार्य प्रविष्टियाँ हैं, जो मुख्यतः कुछ बड़े OpenEnv परिवेशों से आई हैं। 🔗 स्रोत
- Seb-9B — स्तास वेरेतेन्निकोव Apache-2.0 लाइसेंस के तहत यह स्थानीय निर्णय मॉडल जारी करते हैं (पाठ, JSON या चित्र, अधिकतम 20 विकल्प), जो 17 सार्वजनिक परीक्षण समूहों पर 0,792 का औसत प्राप्त करता है, जबकि Jev 1.13 का औसत 0,786 है; सभी माप लेखक ने किए हैं और उन्होंने स्पष्ट किया है कि प्रशिक्षण डेटा में एक बेंचमार्क का प्रशिक्षण वाला भाग शामिल था, लेकिन उसके परीक्षण उदाहरण नहीं थे। 🔗 स्रोत
- 2026 के ओलंपियाड में Nemotron — NVIDIA उस साझा प्रक्रिया (पर्यवेक्षित फ़ाइन-ट्यूनिंग, पुनर्बलन अधिगम, और उत्पन्न करने, जाँचने तथा सुधारने वाला चक्र) का विवरण देता है, जिससे IOI 2026 में गैर-आधिकारिक भागीदारी के तहत 600 में से 535,4 और IMO 2026 में 42 में से 30 अंक मिले, जबकि स्वर्ण पदक की सीमा 29 थी, और 200 समस्याओं वाला Nemotron-IMO-Bench जारी करता है। 🔗 स्रोत
- Instadocs: AI Gone Wild — Netflix 12 अक्टूबर को इस वृत्तचित्र के प्रदर्शन की घोषणा करता है, जो जुलाई में Hugging Face पर हुए साइबर हमले की घटनाओं को दोबारा प्रस्तुत करता है; Netflix के अनुसार यह हमला OpenAI के शोधकर्ताओं द्वारा बनाए गए स्वायत्त एजेंटों ने किया था। 🔗 स्रोत
- ChatGPT की ऐप निर्देशिका में Runway — प्लगइन इंस्टॉल होने और Runway खाता जुड़ने के बाद, संवाद में @Runway का उल्लेख उसे चित्र या वीडियो बनाने का काम सौंप देता है; Runway ने शुल्क या क्रेडिट में लागत स्पष्ट नहीं की है। 🔗 स्रोत
- Luma का Face Swap — यह सुविधा किसी मौजूदा शॉट में एक पात्र का चेहरा बदल देती है, ताकि सब कुछ दोबारा शुरू किए बिना बदलाव आज़माए जा सकें; घोषणा केवल दो ट्वीट में की गई है, जिसमें कोई उत्पाद पृष्ठ, कीमत या मॉडल का विवरण नहीं है। 🔗 स्रोत
- DSX Air — NVIDIA दिखाता है कि एआई फैक्टरी के बदलावों को इस डिजिटल ट्विन पर कैसे परखा जाए: एजेंट बदलाव लागू करते हैं, कॉन्फ़िगरेशन, सुरक्षा और अलगाव की जाँच करते हैं, फिर रिपोर्ट देते हैं, जबकि उत्पादन में लागू करना मानव स्वीकृति पर निर्भर रहता है; यह कार्यविधि समझाने वाला लेख है, जिसमें कोई आँकड़ा नहीं है। 🔗 स्रोत
- cuPhoton — NVIDIA का एक ट्यूटोरियल इस मुक्त स्रोत टूलकिट को GPU पर खगोलीय चित्रों के विश्लेषण के लिए इस्तेमाल करता है, FITS फ़ाइलें पढ़ने से लेकर संभावित पिंडों की समीक्षा तक; घोषित गति वृद्धि, जो 14 900 गुना तक है, कुछ विशिष्ट क्रियाओं के लिए है, पूरी प्रक्रिया के लिए नहीं। 🔗 स्रोत
- Cosmos और SynthID — build.nvidia.com पर NVIDIA Cosmos मॉडलों से बनी सामग्री में SynthID का जलचिह्न होता है और अब Google द्वारा सार्वजनिक किए गए डिटेक्टर से कोई भी इसकी जाँच कर सकता है। 🔗 स्रोत
- SpaceXAI का TypeScript SDK 0.2.3 — इसमें सेवा स्तर
fastजोड़ा गया है, जिसेpriorityके साथ परस्पर बदलकर इस्तेमाल किया जा सकता है, और पहचानकर्ताgrok-imagine-video-1.5-liteभी जोड़ा गया है, जो रिलीज़ नोट्स में उल्लेखित नहीं किए गए एक हल्के वीडियो मॉडल का है: मॉडल पृष्ठ के डेटा के अनुसार, यह इनपुट में ऑडियो स्वीकार नहीं करता और 480p पर प्रति सेकंड इसकी लागतgrok-imagine-video-1.5की तुलना में चार गुना कम है। 🔗 स्रोत - RAG बनाम LLM मार्गदर्शिका — Perplexity एक शैक्षणिक मार्गदर्शिका प्रकाशित करता है, जो RAG और LLM को पूरक बताती है, RAG के तीन प्रकारों (सरल, मॉड्यूलर, उन्नत) में अंतर करती है और स्पष्ट करती है कि कब केवल LLM पर्याप्त है; इसमें कोई नई सुविधा या आँकड़ा नहीं है। 🔗 स्रोत
इसका क्या अर्थ है
छोटे मॉडल बड़े पैमाने पर इस्तेमाल होने वाला उत्पाद बनते जा रहे हैं। 8 अक्टूबर से ChatGPT के मुफ़्त उपयोगकर्ताओं को GPT-6 Luna जवाब देता है, और Anthropic ने 100 000 से कम प्रॉम्प्ट टोकन के लिए Haiku 5.5 की कीमत प्रति मिलियन इनपुट टोकन 0,10 डॉलर रखी है, साथ ही Sonnet 5.5 के कैश से पढ़ने की कीमत आधी कर दी है। ये मॉडल अधिकांश काम का बोझ उठाते हैं: रोज़मर्रा की बातचीत, उप-एजेंट, सारांश और संदर्भ संपीड़न। हालाँकि, Cursor की रैंकिंग याद दिलाती है कि प्रति टोकन कीमत सब कुछ नहीं बताती: Max प्रयास स्तर पर Haiku 5.5, High प्रयास स्तर वाले Sonnet 5.5 की तुलना में प्रति कार्य लगभग नौ गुना अधिक टोकन इस्तेमाल करता है, जबकि प्रति कार्य लागत बस थोड़ी कम रहती है (1,12 डॉलर बनाम 1,20)। दूसरी ओर, Max और Team योजनाओं का मासिक API क्रेडिट सदस्यों को इन मॉडलों को अपने कोड में आज़माने के लिए प्रेरित करता है।
एआई अब कार्यस्थल के कंप्यूटर तक भी पहुँच रही है। RTX Spark लैपटॉप 16 अक्टूबर को आ रहे हैं, DGX Station for Windows एक डेस्क पर 20 पेटाफ्लॉप्स तक का वादा करता है, और महीने के अंत तक Copilot खुद कुछ काम स्थानीय रूप से MAI Code 1.1 Flash को सौंपने वाला है। Replit अब उपयोगकर्ता की मशीन पर एप्लिकेशन बनाता है। व्यक्तिगत कंप्यूटर पर कोड चलाने वाले एजेंट सुरक्षा संबंधी प्रश्न खड़ा करते हैं, और हर जगह एक ही आधारभूत घटक सामने आता है: Windows पर सामान्य रूप से उपलब्ध Microsoft Execution Containers (MXC), Copilot के कमांड और Replit के बिल्ड दोनों को अलग-थलग रखता है। अपनी ओर से GitHub उजागर हुई गोपनीय जानकारी की पहचान के लिए एक विशेष वर्गीकारक तैनात कर रहा है और अपने Git ढाँचे का पुनर्निर्माण कर रहा है, क्योंकि तीन में से एक पुल रिक्वेस्ट में पहले से ही एक एजेंट शामिल होता है और एक साल में कमिट की संख्या पाँच गुना से अधिक हो गई है।
जवाब भी एक इंटरफ़ेस बन रहा है। Intelligent UI के साथ ChatGPT ग्राफ़, फ़ॉर्म या माँग पर बनाए गए किसी छोटे टूल के माध्यम से जवाब देता है, और सोच पूरी होने से पहले ही जवाब देना शुरू कर देता है। डेवलपरों के लिए Claude के SDK, computer use और browser use के चक्र को सँभालते हैं, और Cursor कंप्यूटर पर काम कर रहे एजेंटों पर iPhone से नज़र रखने और उन्हें जवाब देने की सुविधा देता है। इन तीनों मामलों में पाठ आदान-प्रदान का केवल एक हिस्सा रह जाता है: एआई दिखाती है, क्लिक करती है और काम का विवरण देती है, जबकि उपयोगकर्ता निगरानी करता है।
आखिर में, आज के कई आँकड़े उन्हीं लोगों ने मापे हैं जिन्होंने उन्हें प्रकाशित किया है: Haiku 5.5 के बेंचमार्क Anthropic ने, MAI Code 1.1 Flash के बेंचमार्क Microsoft ने, Q2D-Web के बेंचमार्क उसे बनाने वाले Perplexity ने, Open d1 के स्कोर Liquid AI ने, और लिखने के थ्रूपुट में 35 गुना वृद्धि GitHub के आंतरिक परीक्षणों ने मापी है। OpenAI खुद चेतावनी देता है कि उसकी 722 पांडुलिपियों के उन परिणामों में त्रुटियाँ हो सकती हैं जिन्हें औपचारिक रूप नहीं दिया गया है, और GPT-6 की गति में उसके सुधार भी आंतरिक मूल्यांकनों से आते हैं। ये माप उत्पादों की आपस में तुलना करने के लिए उपयोगी बने रहते हैं; CursorBench की रैंकिंग जैसे बाहरी मूल्यांकन, जहाँ एक टूल निर्माता दूसरे के मॉडल को मापता है, इनका मिलान करके जाँचने में मदद करेंगे।
स्रोत
- GPT-6 और सभी के लिए बुद्धिमान UI (OpenAI)
- सभी के लिए GPT-6 की घोषणा (@OpenAI)
- GPT-6 Sol और GPT-6 Luna का सिस्टम कार्ड, अक्टूबर का अपडेट
- ChatGPT में GPT-6 और अन्य मॉडल
- ChatGPT के रिलीज़ नोट्स
- ChatGPT में फ़ाइलें और ऑडियो अपलोड करना
- किशोरों को सीखने, योजना बनाने और एआई का भविष्य गढ़ने में मदद करना (OpenAI)
- Claude Haiku 5.5 की घोषणा (Anthropic)
- Claude Haiku 5.5 का लॉन्च (@claudeai)
- Haiku 5.5 पर माइग्रेशन की मार्गदर्शिका
- Cursor में Haiku 5.5 (@cursor_ai)
- CursorBench की रैंकिंग
- Max और Team योजनाओं के मासिक API क्रेडिट (Claude सहायता)
- API क्रेडिट की घोषणा (@ClaudeDevs)
- RTX Spark और Windows के लिए DGX Station (NVIDIA ब्लॉग)
- Windows और GitHub Copilot में स्थानीय मॉडल और सैंडबॉक्स में सीमित टूल लाना (Microsoft Command Line)
- GitHub Copilot CLI में स्थानीय मॉडल खोजें
- GitHub Copilot के लिए स्थानीय सैंडबॉक्सिंग अब सामान्य रूप से उपलब्ध है
- Replit के डेस्कटॉप ऐप का पूर्वावलोकन (@Replit)
- Replit के डेस्कटॉप ऐप की प्रतीक्षा सूची
- गणित में एआई की प्रगति साझा करना (OpenAI)
- openai/math रिपॉज़िटरी
- गणितीय परिणामों की घोषणा (@OpenAI)
- एकल वेक्टर से आगे बहुमाध्यमीय एम्बेडिंग (Perplexity Research)
- Hugging Face पर pplx-embed-v2-late-9b
- Claude Code 2.1.293
- Codex CLI 0.161.0
- स्थानीय एजेंटों का दूरस्थ नियंत्रण (Cursor की परिवर्तन सूची)
- Antigravity की परिवर्तन सूची
- Warp Factories, Microsoft Teams और Azure DevOps (Warp ब्लॉग)
- SDK में computer use और browser use के टूलसेट (@ClaudeDevs)
- Claude SDK के टूलसेट का दस्तावेज़ीकरण
- Microsoft Foundry में Grok मॉडल तैनात करें और उपयोग करें
- Open d1 (Hugging Face पर Liquid AI)
- Nature में Bolmo (Ai2)
- Google एआई सामग्री के लिए SynthID Detector का विस्तार कर रहा है
- गोपनीय जानकारी की सुरक्षा को सॉफ़्टवेयर के साथ बढ़ना चाहिए (GitHub)
- एजेंटों के पैमाने पर विकास के लिए Git अवसंरचना बनाना (GitHub)
- भारत के एक राज्य के साथ समझौता ज्ञापन (@ElevenLabs)
- PivotOPD (NVIDIA Research)
- cuOpt में mPDLP (NVIDIA का तकनीकी ब्लॉग)
- मशीनें बनाने वाली मशीनें (NVIDIA का तकनीकी ब्लॉग)
- ChatGPT और Codex की परिवर्तन सूची, iOS के लिए ChatGPT 1.2026.272
- Radisson Hotel Group होटल खोजने की सुविधा ChatGPT में ला रहा है (OpenAI)
- Jump Trading, ChatGPT की मदद से मात्रात्मक शोध का विस्तार कैसे कर रहा है (OpenAI)
- ChatGPT प्लगइन के एक्सटेंशन (@OpenAIDevs)
- Every और Claude Managed Agents (@claudeai)
- Zed v1.24.1-pre
- बहुत सारे, बहुत सारे Pucks (Amp)
- Copilot CLI 1.0.93
- Copilot के उपयोग मेट्रिक्स में एजेंट गतिविधि बहाल करने के लिए अपना IDE अपडेट करें
- Gemini CLI v0.65.0-nightly.20261007
- Transformers.js 4.3.1
- RL Environment Explorer (@adithya_s_k)
- Seb-9B का आमने-सामने का मुकाबला (Hugging Face ब्लॉग)
- IOI और IMO 2026 में Nemotron (Hugging Face ब्लॉग)
- Instadocs: बेलगाम एआई (@netflix)
- ChatGPT में Runway (@runwayml)
- चेहरे की अदला-बदली (@LumaLabsAI)
- डिजिटल ट्विन और एआई एजेंटों की मदद से एआई फ़ैक्ट्री में बदलावों को सत्यापित करें (NVIDIA का तकनीकी ब्लॉग)
- NVIDIA cuPhoton से वैज्ञानिक छवियों का अधिक तेज़ विश्लेषण
- Cosmos और SynthID (@NVIDIAAI)
- SpaceXAI का TypeScript SDK 0.2.3
- RAG बनाम LLM (Perplexity)