खोजें

Mistral Large 4 प्रीव्यू में, Claude अब Google Docs, Sheets और Slides में, Anthropic ने अपने साइबर कार्यक्रम का विस्तार किया

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Mistral Large 4 प्रीव्यू में, Claude अब Google Docs, Sheets और Slides में, Anthropic ने अपने साइबर कार्यक्रम का विस्तार किया

ai-powered-markdown-translator

gpt-6.1-sol की मदद से फ़्रेंच से हिंदी में अनुवादित लेख।

GitHub पर प्रोजेक्ट देखें ↗

Mistral ने 1 000 अरब पैरामीटर वाले मल्टीमोडल मॉडल Mistral Large 4 का प्रीव्यू उपलब्ध कराया है, जिसका API आज से सभी के लिए सुलभ है और जिसके वेट अक्टूबर के अंत तक जारी करने का वादा किया गया है। Anthropic, Claude को Google Docs, Sheets और Slides में ला रहा है और अपने साइबर सत्यापन कार्यक्रम को पहुँच के तीन स्तरों में पुनर्गठित कर रहा है, जबकि Google DeepMind ने EmbeddingGemma 2 जारी किया है, जो एक खुला मल्टीमोडल एम्बेडिंग मॉडल है और फ़ोन पर भी चल सकता है। निर्णय मॉडल के लिए भी आज का दिन खास है: OpenAI ने अपना Decisions API सार्वजनिक बीटा में उपलब्ध कराया है, Perplexity ने इसकी कीमत आधी कर दी है और समुदाय की एक रैंकिंग उनकी तुलना करती है।


Mistral Large 4: प्रीव्यू में 1 000 अरब पैरामीटर, अक्टूबर के अंत तक वेट जारी करने का वादा

6 अक्टूबर — Mistral AI ने Mistral Large 4 का सार्वजनिक प्रीव्यू लॉन्च किया है, जिसका उपनाम ML4 और, « पूरी तरह आधिकारिक तौर पर », Chonk है। यह कंपनी का अब तक का सबसे बड़ा मॉडल है: मूल रूप से मल्टीमोडल विशेषज्ञों का मिश्रण (Mixture-of-Experts), जिसमें 1 000 अरब पैरामीटर (1T) हैं। घोषणा लेख के अनुसार इनमें से 49 अरब सक्रिय हैं, और मॉडल दस लाख टोकन के संदर्भ में निर्देशों, तर्क और एजेंट क्षमताओं को एक साथ लाता है। दस्तावेज़ में दी गई विवरणिका अलग आँकड़े देती है, लेकिन अंतर की वजह नहीं बताती: 1 050 अरब पैरामीटर, जिनमें से 52 अरब सक्रिय हैं, साथ में 1,6 अरब पैरामीटर वाला विज़न एनकोडर।

API आज से Mistral Studio पर सभी के लिए उपलब्ध है, लेकिन वेट अभी जारी नहीं किए गए हैं: Mistral ने उन्हें अक्टूबर के अंत तक जारी करने का वादा किया है, साथ में आर्किटेक्चर और प्रशिक्षण के बाद की प्रक्रिया का विवरण भी दिया जाएगा। इस बीच, साइबरसुरक्षा अधिकारी, सत्यापित साझेदार और सरकारी प्राधिकरण वास्तविक परिस्थितियों में मॉडल को परख रहे हैं और उन्हें कम मॉडरेशन के साथ इसकी पहुँच मिल रही है। ML4 को Mistral के यूरोपीय डेटा सेंटरों में 3 800 NVIDIA Grace Blackwell GPU पर शुरू से प्रशिक्षित किया गया है; इन्हीं डेटा सेंटरों से प्रीव्यू भी उपलब्ध कराया जा रहा है। कंपनी यूरोप में ऐसी तैनाती की योजना बना रही है जिसका पूरा संचालन वह यूरोपीय कानून के तहत स्वयं करेगी, और इस मॉडल को 3 अरब यूरो के अपने सीरीज़ D वित्तपोषण से समर्थित विकास योजना का पहला पड़ाव बता रही है।

साइबरसुरक्षा इसका मुख्य आकर्षण है। Mistral के अनुसार, ML4, Artificial Analysis Cyber Index के शीर्ष पाँच मॉडल में शामिल है और उसके एक परीक्षण में 82 % प्राप्त करता है। इस परीक्षण में किसी ओपन सोर्स सॉफ़्टवेयर की वास्तविक सुरक्षा खामी को पहले दोहराना और फिर ठीक करना होता है; यह सभी मॉडल में सबसे ऊँचा स्कोर है। कंपनी का दावा है कि Claude Opus 5.5 और GPT-6 Astra इसी परीक्षण में लगभग शून्य स्कोर प्राप्त करते हैं, क्योंकि वे यह कार्य करने से इनकार कर देते हैं।

मूल्यांकित बेंचमार्कMistral द्वारा घोषित स्कोरMistral द्वारा दी गई तुलना
DeepSWE v1.161,7 %—
Coding Agent Index (संयुक्त)49,8 %DeepSeek V4 Pro 0813 और Qwen3.8 Max से आगे
Surge AI का मानवों द्वारा ब्लाइंड मूल्यांकन (कोड, 5 में से)3,74, 5 में से दूसराClaude Opus 5 (4,22) से पीछे
Cybench (40 चुनौतियाँ)93 %—
AA Cyber Index, सुरक्षा खामी को दोहराना और फिर ठीक करना82 %सभी मॉडल में सबसे ऊँचा स्कोर
AutomationBench (657 व्यावसायिक प्रक्रियाएँ)59,9 %Kimi K3, MiMo-V2.6-Pro और DeepSeek V4 Pro से आगे

लेख और विवरणिका में कीमत भी अलग है: लेख का कार्ड प्रति दस लाख इनपुट टोकन के लिए 1,36 डॉलर और आउटपुट के लिए 4,18 डॉलर दिखाता है, जबकि विवरणिका इन दरों को काटकर उनके बगल में आधी कीमत दिखाती है, लेकिन उसकी अवधि या वजह नहीं बताती।

ML4 की विशेषताघोषणा लेख के अनुसारदस्तावेज़ की विवरणिका के अनुसार
कुल पैरामीटर1 000 अरब1 050 अरब
सक्रिय पैरामीटर49 अरब52 अरब
इनपुट, प्रति दस लाख टोकन1,36 डॉलर0,68 डॉलर (1,36 काटा गया है)
आउटपुट, प्रति दस लाख टोकन4,18 डॉलर2,09 डॉलर (4,18 काटा गया है)

ये सभी स्कोर Mistral के दिए हुए हैं। कंपनी बताती है कि प्रीव्यू का रीइन्फोर्समेंट लर्निंग जारी है और सुधार ठहरने का कोई संकेत नहीं है; उसे आने वाले हफ़्तों में तेज़ प्रगति की उम्मीद है।

🔗 Mistral Large 4 पर Mistral का लेख 🔗 दस्तावेज़ में Mistral Large 4 की विवरणिका


Claude for Google Workspace: Claude अब Docs, Sheets और Slides में

6 अक्टूबर — Anthropic ने Claude for Google Workspace लॉन्च किया है। यह एक अतिरिक्त मॉड्यूल (add-on) है, जो Google Docs, Sheets और Slides के साइड पैनल में Claude खोलता है और सभी सशुल्क योजनाओं पर सार्वजनिक बीटा में उपलब्ध है। Claude खुली हुई फ़ाइल पढ़ता है, वर्तमान चयन (पाठ, सेल या स्लाइड) देखता है और उसी फ़ाइल में बदलाव करता है।

Google ऐपउसमें Claude क्या करता है
Docsफ़ाइल में सीधे सुधार और शैली में बदलाव; बड़े पुनर्लेखन के लिए सुझाव कार्ड, जिन्हें लागू किया जा सकता है या अनदेखा किया जा सकता है
Sheetsफ़ॉर्मूले, पिवट टेबल, अंतर्निहित चार्ट, नए टैब, डेटा जोड़ने या साफ़ करने के लिए किसी सेल रेंज को Python से संसाधित करना
Slidesप्रस्तुति के लेआउट और थीम के आधार पर स्लाइड बनाना, एक-दूसरे पर चढ़ने वाले या सीमा से बाहर निकलने वाले तत्वों की जाँच

उपयोगकर्ता स्वायत्तता का स्तर चुनता है: डिफ़ॉल्ट रूप से सक्रिय « बदलाव करने से पहले पूछें » (Ask before edits) मोड में हर बदलाव के लिए अनुमोदन कार्ड दिखाया जाता है; « सभी बदलाव स्वीकार करें » (Accept all edits) मोड में Claude बिना रुके काम करता रहता है। Claude खाते से जुड़ने पर पैनल में वही मॉडल, कनेक्टर और कौशल (skills) उपलब्ध होते हैं। Enterprise योजनाओं में Compliance API, ग्राहक द्वारा प्रबंधित एन्क्रिप्शन कुंजियाँ (CMEK) और OpenTelemetry ऑडिट निर्यात भी इस मॉड्यूल पर लागू होते हैं।

Claude now works inside Google Docs, Sheets, and Slides, and those files also open inside Claude. In Google Workspace, Claude sits in a sidebar next to your file, reads what you have open, and edits it in place. You can approve each edit before it lands.

🇮🇳 Claude अब Google Docs, Sheets और Slides में काम करता है, और ये फ़ाइलें Claude में भी खुलती हैं। Google Workspace में Claude आपकी फ़ाइल के बगल में एक साइड पैनल में दिखाई देता है, आपने जो खोला है उसे पढ़ता है और उसी फ़ाइल में बदलाव करता है। आप हर बदलाव लागू होने से पहले उसे मंज़ूरी दे सकते हैं। — X पर @claudeai

इसके उलटी दिशा वाला काम भी साथ ही उपलब्ध हो रहा है: Google Docs, Sheets और Slides के नए कनेक्टर, जो स्वयं भी बीटा में हैं, Claude से Google फ़ाइलें बनाने और उनमें बदलाव करने की सुविधा देते हैं। इसके लिए कोई लिंक पेस्ट किया जा सकता है या नया दस्तावेज़ माँगा जा सकता है। समर्थित कॉन्फ़िगरेशन में फ़ाइल बातचीत के बगल में एक पैनल में खुलती है, और Claude की पहुँच Google की साझाकरण अनुमतियों के अनुसार रहती है। मॉड्यूल को Google Workspace Marketplace से इंस्टॉल किया जाता है (Extensions > Claude > Open Claude), और प्रशासक इसे Google Admin कंसोल से तैनात कर सकते हैं; Team और Enterprise पर किसी मालिक को पहले कनेक्टर सक्रिय करने होते हैं। इस तरह Google Workspace भी Microsoft 365 के साथ जुड़ गया है, जहाँ Excel, PowerPoint और Word के लिए Claude 7 मई से सामान्य रूप से उपलब्ध है।

🔗 Claude for Google Workspace पर Anthropic का लेख


Cyber Verification Program: Anthropic ने Opus 5.5, Sonnet 5.5 और Mythos 5.1 के लिए पहुँच के तीन स्तर उपलब्ध कराए

6 अक्टूबर — Anthropic अपने साइबर सत्यापन कार्यक्रम (Cyber Verification Program, CVP) को पुनर्गठित कर रहा है। यह कार्यक्रम सत्यापित सुरक्षा पेशेवरों को ऐसी क्षमताओं तक पहुँच देता है जिन्हें उसके आम उपयोगकर्ताओं वाले मॉडल रोकते हैं। पिछले छह महीनों से दो व्यवस्थाएँ साथ-साथ चल रही थीं: Project Glasswing, जो सबसे महत्वपूर्ण सॉफ़्टवेयर की ज़िम्मेदारी संभालने वाले संगठनों को Claude Mythos की पहुँच देता था, और एक स्तर वाला CVP, जो Opus और Sonnet मॉडल के सुरक्षा नियंत्रणों में ढील देता था। अब दोनों को तीन स्तरों में मिला दिया गया है; हर स्तर Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 और आने वाले मॉडल तक पहुँच देता है। सामान्य रूप से उपलब्ध मॉडल (Opus 5.5, Fable 5.1, Sonnet 5.5) में सावधानीपूर्ण सुरक्षा नियंत्रण बने रहते हैं, जो अधिकांश साइबर कार्यों को रोकते हैं।

पहुँच का स्तरशामिल उपयोगलक्षित उपयोगकर्ता और समय
Defense Accessसुरक्षा संचालन केंद्र, घटना पर प्रतिक्रिया, दुर्भावनापूर्ण सॉफ़्टवेयर की रिवर्स इंजीनियरिंग, सुरक्षा कमजोरियों का विश्लेषणसुरक्षा टीमें, किसी भी आकार का महत्वपूर्ण बुनियादी ढाँचा, ओपन सोर्स अनुरक्षक, शोधकर्ता; कुछ दिन
Red Team Accessरक्षात्मक उपयोग, साथ में अधिकृत प्रवेश परीक्षण और नकली हमले के अभ्यास (red teaming)केवल संगठन, उन प्रणालियों पर जिनका परीक्षण करने की उन्हें अनुमति है; कुछ हफ़्ते
Specialized Accessसुरक्षा संबंधी प्रणालियों का परीक्षण: विमानन, बिजली ग्रिड, दूरसंचार, अंतरबैंक धन हस्तांतरण, प्रशासनिक नेटवर्कअमेरिकी सरकार के साथ एक-एक करके समीक्षा किए गए कुछ संगठन; Glasswing के सदस्य इस स्तर पर स्थानांतरित किए गए

Red Team Access में ऐसी कार्रवाइयाँ वास्तविक समय में रोकी जाती हैं जो शारीरिक नुकसान या बड़े पैमाने पर व्यवधान पैदा कर सकती हैं, जैसे रैनसमवेयर तैनात करना। अपनी सेटिंग की जाँच के लिए Anthropic ने Opus 5.5 को हर स्तर के सुरक्षा नियंत्रणों के साथ CyScenarioBench से परखा। यह कई चरणों वाले साइबर अभियानों का मूल्यांकन है (10 चुनौतियाँ, प्रत्येक के 5 प्रयास)।

Anthropic द्वारा परीक्षण किया गया कॉन्फ़िगरेशन (Opus 5.5)CyScenarioBench पर परिणाम (50 प्रयास)
CVP के बिनासभी कार्य पहले ही प्रॉम्प्ट पर रोक दिए गए
Defense Access46 प्रयास किसी चरण पर रोके गए, 4 सफल हुए
Red Team Accessकोई रोक नहीं, 34 कार्य सफल, सुरक्षा नियंत्रणों के बिना मॉडल के 67,6 % के बराबर

लेख Glasswing का शुरुआती आकलन भी प्रस्तुत करता है, जिसमें Anthropic के अनुसार आँकड़े आंशिक हैं: अप्रैल से जुलाई के बीच साझेदारों ने कम से कम 129 000 सत्यापित सुरक्षा कमजोरियाँ खोजीं, और Anthropic के ओपन सोर्स विश्लेषणों ने 5 500 अतिरिक्त कमजोरियाँ खोजीं; इनमें से 33 000 से अधिक को गंभीर या उच्च गंभीरता वाला वर्गीकृत किया गया। ये आँकड़े साझेदारों की 33 रिपोर्टों पर आधारित हैं, और Anthropic वास्तविक प्रभाव को « कम से कम पाँच गुना अधिक » मानता है। उसी दिन प्रकाशित अनुभव विवरण में Comcast ने बताया कि 258 प्रणालियों और लगभग 170 मिलियन पंक्तियों के कोड का मूल्यांकन करते समय उसने Claude Mythos Preview की मदद से प्रमाणीकरण की एक गंभीर खामी खोजी, और Booz Allen के एक विश्लेषक ने बारह दिनों में 138 रिपॉज़िटरी की समीक्षा की।

व्यावहारिक रूप से, दुरुपयोग की निगरानी के लिए कार्यक्रम में डेटा को सुरक्षित रखकर संग्रहित करना आवश्यक है। Enterprise Frontier Safeguards (EFS) आने तक यह व्यवस्था रहेगी; EFS इस शरद ऋतु में आगे चलकर इस डेटा को ग्राहक के नियंत्रण वाले क्लाउड में रखने की सुविधा देगा। जो संगठन पहले से Fable 5.1 या Mythos 5.1 का इस्तेमाल बिना डेटा संग्रहण के कर रहे हैं, वे CVP के साथ भी ऐसा कर सकते हैं। कार्यक्रम Claude Platform, Vertex AI और Microsoft Foundry पर उपलब्ध है, और Amazon Bedrock पर केवल EFS के पात्र ग्राहकों के लिए उपलब्ध है। व्यक्तिगत आवेदन केवल Defense Access के लिए, किसी सशुल्क योजना पर किया जा सकता है, और इस स्तर पर 15 दिसंबर तक फ़िशिंग-प्रतिरोधी बहु-कारक प्रमाणीकरण अपनाना तथा API कुंजियों का इस्तेमाल छोड़ना होगा। 14 अक्टूबर को सुबह 9 बजे PT पर एक वेबिनार निर्धारित है।

🔗 Cyber Verification Program पर Anthropic का लेख 🔗 Cyber Verification Program का सहायता पृष्ठ 🔗 Claude Mythos के साथ Comcast और Booz Allen


EmbeddingGemma 2 : Google का खुला एम्बेडिंग मॉडल अब मल्टीमोडल हुआ

6 अक्टूबर — Google DeepMind ने EmbeddingGemma 2 जारी किया है, जो उपकरण पर चलने के लिए बनाए गए उसके खुले एम्बेडिंग मॉडल की दूसरी पीढ़ी है। Google के अनुसार, पहले EmbeddingGemma को 20 मिलियन से अधिक बार डाउनलोड किया गया था और वह केवल टेक्स्ट संभालता था; नया मॉडल टेक्स्ट (कोड सहित), चित्र, वीडियो और ऑडियो को, अलग-अलग या एक साथ, 768 आयामों वाले एक ही स्पेस में निरूपित करता है। Gemma 4 की आर्किटेक्चर पर बना यह मॉडल Apache 2.0 लाइसेंस के तहत जारी हुआ है।

Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space.

🇮🇳 पेश है EmbeddingGemma 2, उपकरण पर एम्बेडिंग्स बनाने के लिए हमारा पहला खुला मॉडल, जो मूल रूप से मल्टीमोडल है। यह टेक्स्ट से आगे बढ़कर कोड, चित्र, ऑडियो और वीडियो को एक साझा स्पेस में एकीकृत करता है। — X पर @GoogleDeepMind

मॉडल में 740 मिलियन पैरामीटर हैं, लेकिन इसकी संरचना मॉड्यूलर है: 270M का मुख्य टेक्स्ट घटक, जिसके साथ जरूरत के अनुसार एक विज़न एन्कोडर (170M) और एक ऑडियो एन्कोडर (300M) जोड़े जाते हैं। इसलिए केवल टेक्स्ट इस्तेमाल करने वाला अनुप्रयोग सिर्फ 270M पैरामीटर लोड करता है। क्वांटाइज़ेशन के साथ, Google ने Pixel 11 Pro पर टेक्स्ट के वज़नों के लिए लगभग 191 Mo और पूरे मल्टीमोडल मॉडल के लिए 567 Mo सक्रिय RAM मापी है।

EmbeddingGemma 2 की विशेषताGoogle द्वारा घोषित मान
कुल पैरामीटर740M (टेक्स्ट 270M, विज़न 170M, ऑडियो 300M)
वेक्टर के आयाम768, जिन्हें घटाकर 512, 256 या 128 किया जा सकता है
संदर्भ विंडो8K tokens, पहले संस्करण की तुलना में चार गुना
Pixel 11 Pro पर सक्रिय RAM (क्वांटाइज़्ड)केवल टेक्स्ट में लगभग 191 Mo, मल्टीमोडल में 567 Mo
MTEB Code78,68, जबकि पहले संस्करण में 68,76
MTEB बहुभाषी v261,36, जबकि पहले संस्करण में 61,15

«एक-दूसरे के भीतर समाई रूसी गुड़ियों» की तरह निरूपण सीखने की पद्धति (Matryoshka Representation Learning) वेक्टर छोटे करने की सुविधा देती है, जिससे भंडारण की जरूरत छह गुना तक घट सकती है; मॉडल के विवरण के अनुसार, 256 आयामों तक गुणवत्ता पर मामूली असर पड़ता है, जबकि 128 आयाम मुख्यतः केवल टेक्स्ट वाले उपयोगों के लिए उपयुक्त हैं। सबसे स्पष्ट सुधार कोड में है, जहाँ Google के अनुसार MTEB Code पर लगभग दस अंक बढ़े हैं, जबकि बहुभाषी टेक्स्ट का प्रदर्शन पिछले स्तर पर बना हुआ है।

इसके लक्षित उपयोग पूरी तरह स्थानीय खोज और पुनर्प्राप्ति से संवर्धित उत्तर निर्माण (RAG) हैं, जैसे किसी आवाज़ में दर्ज नोट से वीडियो का कोई अंश खोजना। चूँकि यह मॉडल Gemma 4 के टेक्स्ट टोकनाइज़र (tokenizer) और ऑडियो एन्कोडर को साझा करता है, इसलिए दोनों कम मेमोरी इस्तेमाल करते हुए साथ चल सकते हैं। वज़न Hugging Face और Kaggle पर उपलब्ध हैं; Gemini Enterprise Agent Platform के Model Garden में इसकी उपलब्धता «जल्द» आने की घोषणा की गई है, लेकिन कोई तारीख नहीं दी गई है। जारी होते ही मॉडल को Transformers (संस्करण 5.19.0), sentence-transformers, MLX, vLLM, llama.cpp, Ollama और LM Studio का समर्थन मिल गया है, और ब्राउज़र में transformers.js के जरिए भी इसे चलाया जा सकता है।

🔗 Google के ब्लॉग पर घोषणा 🔗 EmbeddingGemma 2 का मॉडल विवरण 🔗 Hugging Face पर वज़न


निर्णय मॉडल : OpenAI ने अपना Decisions API खोला, Perplexity ने Decider v1.1 जारी किया और कीमत आधी की, Decision Index 0.3 ने उनकी रैंकिंग की

निर्णय मॉडल, जो खुला उत्तर लिखने के बजाय कोई विकल्प चुनते हैं या किसी इनपुट को अंक देते हैं, आज चर्चा में रहे: दो प्रदाताओं ने अपनी पेशकश और कीमतों में बदलाव किया, और इस श्रेणी की सामुदायिक रैंकिंग की पद्धति भी बदली।

OpenAI का Decisions API सार्वजनिक बीटा में

6 अक्टूबर — DevDay पर सीमित पहुँच के साथ उपलब्ध होने के एक सप्ताह बाद, OpenAI का Decisions API सार्वजनिक बीटा में आ गया है, और इसकी सामान्य उपलब्धता «आने वाले सप्ताहों में» अपेक्षित है। यह एक समर्पित एंडपॉइंट (POST /v1/decisions) के जरिए टेक्स्ट, चित्र या दोनों पर निश्चित विकल्पों वाले प्रश्नों के उत्तर देता है; इसमें GPT-6 Luna ही एकमात्र उपलब्ध मॉडल है। OpenAI के अनुसार, इसके निर्धारित प्रकार वाले उत्तर Responses API की तुलना में लगभग 10 गुना तेजी से आते हैं। आज की नई जानकारी इसकी कीमत है: इनपुट के प्रति मिलियन टोकन पर 0,10 डॉलर, आउटपुट और कैश का कोई शुल्क नहीं, जबकि क्षेत्रीय प्रोसेसिंग और लंबे संदर्भ के अतिरिक्त शुल्क अलग से लगते हैं।

प्रश्न का प्रकारलक्षित उपयोगलौटाया गया परिणाम
विधेय (predicate)किसी शर्त की जाँच करना, जैसे तस्वीर में कोई क्षतिग्रस्त उत्पादशर्त के सही होने की 0 से 1 के बीच प्रायिकता
चयन (choice)दी गई सूची में से एक विकल्प चुननाविकल्प, प्रत्येक विकल्प की प्रायिकता और विश्वास का सूचकांक
स्कोर (score)क्रमबद्ध स्तरों पर अंक देना, जैसे किसी घटना की गंभीरताप्रायिकताओं के आधार पर भारित स्तरों का औसत

एक ही अनुरोध में एक ही इनपुट पर कई प्रश्न पूछे जा सकते हैं, और चित्रों को base64 में भेजना होता है; होस्ट किए गए URL या फ़ाइल पहचानकर्ता का इस्तेमाल नहीं किया जा सकता। यह API पात्र ग्राहकों के लिए डेटा न रखने की सुविधा (Zero Data Retention) और HIPAA के तहत उपयोगों का समर्थन करता है, तथा डेटा संयुक्त राज्य अमेरिका और यूरोप में रखा जा सकता है।

🔗 Decisions API की मार्गदर्शिका 🔗 OpenAI API का बदलाव विवरण

Perplexity का pplx-decider-v1.1-27b और आधी हुई कीमत

6 अक्टूबर — अपना Decisions API लॉन्च करने के पाँच दिन बाद, Perplexity ने इसे चलाने वाले मॉडल को अपडेट किया है। इसकी जानकारी उसके डेवलपर खाते @perplexitydevs की एक पोस्ट शृंखला में दी गई है। Hugging Face पर Apache 2.0 लाइसेंस के तहत खुले वज़नों के साथ जारी pplx-decider-v1.1-27b, v1 के Qwen3.8-27B आधार को बनाए रखता है, 250k टोकन के संदर्भ में टेक्स्ट और चित्र पढ़ता है तथा अपनी पूर्ण अटेंशन वाली परतों का कॉज़ल मास्क (causal mask) हटाता है। अब इसी मॉडल को उपलब्ध कराने वाले Decisions API की कीमत इनपुट के प्रति मिलियन टोकन पर 0,02 डॉलर है, जो v1 के 0,04 डॉलर की आधी है, और आउटपुट अब भी मुफ्त है।

Decision Index की श्रेणी (Hugging Face का विवरण)Jev का स्कोरv1 का स्कोरv1.1 का स्कोर
ज्ञान (ज्ञान)51,440,948,18
भाषा (भाषा)62,063,569,45
सूचना पुनर्प्राप्ति (पुनर्प्राप्ति)55,454,961,26
उपकरण (उपकरण)75,179,378,88
कला (कला)37,739,444,66
भारित समग्र स्कोर57,956,461,56

मॉडल के विवरण के अनुसार, समग्र स्कोर 56,4 से बढ़कर 61,56 हो गया है, जो TypeSafe AI के निर्णय मॉडल Jev के 57,9 से अधिक है। हालाँकि, ज्ञान की श्रेणी में Jev अब भी आगे है। Perplexity का यह भी दावा है कि उसे नए Decision Index 0.3 में सर्वोच्च स्कोर मिला है। इसे स्वयं होस्ट करने के लिए ऐसा GPU चाहिए जिसमें लगभग 49 Gio वज़न समा सकें, और साथ दिया गया इम्प्लीमेंटेशन भी जरूरी है, क्योंकि सामान्य कॉज़ल इन्फ़रेंस मापे गए व्यवहार को दोहराता नहीं है।

🔗 X पर @perplexitydevs की पोस्ट शृंखला 🔗 Hugging Face पर pplx-decider-v1.1-27b

Decision Index 0.3

6 अक्टूबर — Hugging Face के इंजीनियर apolinario ने Decision Index का संस्करण 0.3 जारी किया है। यह Jev के Decision Model को दोहराने वाले खुले निर्णय मॉडलों की सामुदायिक रैंकिंग है। इसमें अब 112 मॉडल हैं, जिनमें 111 खुले पुनरुत्पादन शामिल हैं, और ये NVIDIA RTX PRO 6000 पर चलते हैं। पद्धति बदल गई है: पूर्ण स्कोर (पूर्ण स्कोर) में 37 सार्वजनिक बेंचमार्क, उन्हीं क्षमताओं को मापने वाले निजी परीक्षण और नए क्षेत्रों से लिए गए निजी कार्य शामिल हैं, ताकि रैंक क्षमताओं को दर्शाए और केवल परिचित बेंचमार्क पर सफलता को नहीं। विज़न का एक टैब भी जोड़ा गया है।

प्रदर्शित रैंकरैंकिंग में शामिल मॉडलपूर्ण स्कोर
1Perplexity Decider v1.1 (27B)62,8
2Fastino GLiDE बिना विचार प्रक्रिया के (28B)60,2
संदर्भJev60,1
3Torchcast Decision 27B59,9
4deck31b (Gemma 4 31B)59,0

Decider v1.1 के दोनों स्कोर अलग हैं: 61,56 वह स्कोर है जो Perplexity के विवरण में प्रकाशित है, और 62,8 वह है जिसे यह रैंकिंग अपनी नई पद्धति से गणना करती है। निजी परीक्षण, अपनी प्रकृति के कारण, प्रकाशित नहीं किए जाते।

🔗 X पर apolinario की घोषणा 🔗 Decision Index 0.3


कंप्यूटर का नियंत्रण : OpenAI ने Ironclad के अनुबंधों पर GPT-6 Astra को प्रशिक्षित किया

6 अक्टूबर — OpenAI ने व्यावसायिक सॉफ़्टवेयर में अपने एजेंटों को अधिक प्रभावी बनाने के लिए सॉफ़्टवेयर प्रदाताओं के साथ शोध सहयोग शुरू किए हैं। यह कंप्यूटर के इस्तेमाल (computer use) से जुड़ा काम है, जिसकी शुरुआत AI की सहायता से अनुबंधों के प्रबंधन में विशेषज्ञ Ironclad के साथ हुई है। टीमों ने कानूनी, बिक्री और खरीद संबंधी 11 कार्य निर्धारित किए हैं। OpenAI के अनुसार, प्रत्येक कार्य में अनुभवी उपयोगकर्ता को 30 से 40 मिनट लगते हैं, और उनका मूल्यांकन 8 से 50 मानदंडों पर किया गया। Ironclad ने अपने सॉफ़्टवेयर के होस्ट किए गए वातावरण उपलब्ध कराए, जहाँ मॉडलों को SEC के EDGAR डेटाबेस के सार्वजनिक अनुबंधों से निकाले गए कृत्रिम कार्यों पर पुनर्बलन अधिगम के जरिए प्रशिक्षित किया गया।

11 कार्यों पर OpenAI का मापनGPT-5.6 Sol (तर्क क्षमता High)GPT-6 Astra (तर्क क्षमता Max)
औसत स्कोर41,6 %55,0 % (+32 %)
प्रति प्रयास अनुमानित औसत समय (सिम्युलेटेड)37,0 मिनट19,2 मिनट (-48 %)

GPT-6 Astra इन कार्यों पर प्रशिक्षित OpenAI का पहला अग्रणी मॉडल है, और इसके विकास के दौरान इस्तेमाल किया गया एक आंतरिक मॉडल 63,7 % तक पहुँचता है। ये आँकड़े OpenAI के हैं, और समय का आकलन प्रोसेसिंग की अनुमानित गति के आधार पर सिम्युलेट किया गया है; इसे ग्राहकों के यहाँ मापा नहीं गया है। OpenAI ने अन्य प्रदाताओं को ऐसे कार्य सुझाने के लिए आमंत्रित किया है जिन्हें मौजूदा एजेंट अभी भरोसेमंद ढंग से पूरा नहीं कर पाते।

🔗 Ironclad के साथ सहयोग पर OpenAI की ब्लॉग पोस्ट


API और प्लेटफ़ॉर्म : OpenAI API के स्तर और BAA, Perplexity के Agent API में दस्तावेज़ और चित्र, Bedrock पर GLM-5.3

इन्फ़रेंस खरीदने वाले डेवलपरों के लिए चार बदलाव हुए हैं: OpenAI के API तक पहुँच की शर्तें, Perplexity के Agent API के उपकरण और AWS की सूची में एक नया खुला मॉडल।

OpenAI API के उपयोग स्तर पाँच से घटकर तीन हुए

6 अक्टूबर — OpenAI ने अपने API की सबसे ऊँची दर सीमाओं (rate limits) तक पहुँच आसान की है: पाँच सशुल्क उपयोग स्तर अब तीन हो गए हैं, Build, Launch और Grow। सबसे ऊँचा स्तर Grow, API के लिए कुल 500 डॉलर का भुगतान करने पर मिलता है, जबकि पुराने सर्वोच्च स्तर के लिए 1 000 डॉलर चाहिए थे। पहले से किसी सशुल्क स्तर पर मौजूद संगठन बिना कुछ किए अपने आप नए स्तरों पर चले जाते हैं, और फिर उनकी कुल क्रेडिट खरीद निर्धारित सीमाओं तक पहुँचने पर उनका स्तर बढ़ता है; मुफ्त स्तर की सीमा अब भी प्रति माह 100 डॉलर है।

उपयोग स्तरकुल खरीद की न्यूनतम सीमामासिक उपयोग की अधिकतम सीमाAstra, Sol और Terra (प्रति मिनट अनुरोध और टोकन)Luna (प्रति मिनट अनुरोध और टोकन)
Build5 डॉलर500 डॉलर5 000 और 1 000 0005 000 और 2 000 000
Launch100 डॉलर5 000 डॉलर10 000 और 4 000 00010 000 और 10 000 000
Grow500 डॉलर200 000 डॉलर15 000 और 40 000 00030 000 और 180 000 000

🔗 X पर @OpenAIDevs की पोस्ट शृंखला 🔗 दर सीमाओं का दस्तावेज़

OpenAI API पर स्वयं BAA स्वीकार करने और HIPAA अनुपालन की सुविधा

5 अक्टूबर — OpenAI के API से संरक्षित स्वास्थ्य डेटा की प्रोसेसिंग करने वाले संगठन अब अमेरिकी HIPAA कानून के तहत आवश्यक व्यावसायिक सहयोगी समझौते (Business Associate Agreement, BAA) पर स्वयं हस्ताक्षर कर सकते हैं। Settings > Organization > General में कोई प्रशासक मानक BAA स्वीकार करके HIPAA अनुपालन सहायता सक्रिय कर सकता है, जिसके लिए एंटरप्राइज़ अनुबंध जरूरी नहीं है। यह सुविधा केवल उन पात्र संगठनों के लिए है जिनका API इस्तेमाल करने का स्थापित इतिहास है, और इन सेटिंग्स से सक्रियण वापस नहीं लिया जा सकता। अनुकूलित शर्तों के लिए अब भी ईमेल से अनुरोध करना होता है, जिसका उत्तर एक से दो कार्यदिवसों में मिलता है। OpenAI ने याद दिलाया है कि केवल BAA पर हस्ताक्षर करने से कोई अनुप्रयोग अनुपालक नहीं बन जाता, और ChatGPT Business के लिए कोई BAA उपलब्ध नहीं है।

🔗 API के BAA पर OpenAI का सहायता लेख

Perplexity का Agent API दस्तावेज़ पढ़ता है और चित्र खोजता है

5 अक्टूबर — Perplexity API के बदलाव विवरण में देर शाम तीन प्रविष्टियाँ जोड़ी गईं। Agent API अब इनपुट में PDF, DOC, DOCX, TXT और RTF दस्तावेज़ स्वीकार करता है, जिन्हें अनुरोध में शामिल किया जा सकता है या सार्वजनिक HTTPS URL से निर्दिष्ट किया जा सकता है; समर्थन चुने गए मॉडल और प्रदाता पर निर्भर करता है। एक नया उपकरण, image_search, वेब पर चित्र खोजता है और चित्र के पते तथा उसके मूल पृष्ठ के पते के साथ संरचित परिणाम लौटाता है: प्रति कॉल 1 से 30 चित्र, डिफ़ॉल्ट रूप से 5, डोमेन और फ़ॉर्मैट के फ़िल्टर तथा डिफ़ॉल्ट रूप से सक्रिय सुरक्षित खोज। इसकी कीमत प्रति 1 000 सफल कॉल 2,50 डॉलर है, और असफल कॉल का शुल्क नहीं लिया जाता। तीसरी प्रविष्टि लागत की गणना ठीक करती है: उत्तरों में अब सैंडबॉक्स में किए गए निष्कर्षणों की लागत का विवरण मिलता है, और GPT-6 Luna की दर अपरिवर्तित है।

🔗 Perplexity API का बदलाव विवरण 🔗 image_search उपकरण का दस्तावेज़

Amazon Bedrock पर Z.ai का GLM-5.3

6 अक्टूबर — Z.ai ने खुले वज़नों वाले अपने प्रमुख मॉडल GLM-5.3 के Amazon Bedrock पर आने की घोषणा की है; AWS के विवरण में लॉन्च की तारीख 5 अक्टूबर दी गई है। यह 744 अरब पैरामीटर वाला मिश्रित विशेषज्ञों का मॉडल है, जिनमें प्रति टोकन लगभग 40 अरब सक्रिय होते हैं। इसकी संदर्भ क्षमता एक मिलियन टोकन है और आउटपुट 128 000 टोकन तक हो सकता है। पहुँच केवल पात्र ग्राहकों के लिए है, जिन्हें अपनी AWS खाता टीम से संपर्क करना होता है। मॉडल केवल विभिन्न क्षेत्रों के बीच इन्फ़रेंस के जरिए उपलब्ध है (US या global प्रोफ़ाइल), जिसमें 1 024 टोकन से प्रॉम्प्ट कैशिंग तथा Standard, Priority, Flex और Reserved सेवा स्तर उपलब्ध हैं। विवरण में कीमत नहीं दी गई है और Bedrock के मूल्य निर्धारण पृष्ठ की ओर भेजा गया है। GLM-5.3 से पहले Kimi K3 (22 सितंबर) और Grok 4.7 (28 सितंबर) पिछले दो सप्ताहों में Bedrock पर आए थे।

🔗 Amazon Bedrock पर GLM 5.3 का विवरण 🔗 X पर Z.ai की घोषणा


कोड एजेंट : Claude Code 2.1.290 से 2.1.292, क्लाउड सत्र, Vibe CLI 2.26.0, Antigravity और Replit

कोड एजेंटों को टर्मिनल से एडिटर तक पाँच अपडेट मिले हैं: बीस घंटे से भी कम समय में Claude Code के तीन संस्करण, क्लाउड सत्रों की एक मार्गदर्शिका, Vibe CLI जिसका Rust में बना नया इंटरफ़ेस और समृद्ध हुआ है, VS Code के लिए Antigravity एक्सटेंशन और उपयोगकर्ता के सभी प्रोजेक्ट देख सकने वाला Replit।

Claude Code 2.1.290 से 2.1.292

5 और 6 अक्टूबर — 5 अक्टूबर को 23 बजकर 33 मिनट UTC पर जारी Claude Code 2.1.290 एक बड़ा संस्करण है: 190 प्रविष्टियाँ, जिनमें 131 सुधार हैं। claude attach और claude logs किसी सत्र के पहचानकर्ता की जगह उसके नाम का कुछ हिस्सा स्वीकार करते हैं, और /claude-api managed-agents-onboard किसी वेब पृष्ठ पर वर्णित Managed Agents मॉडल को ant apply फ़ाइलों में बदलता है। इंटरैक्टिव सत्र में वेब खोज का बजट अब 200 कॉल के बाद समाप्त नहीं होता: वह हर घंटे 100 कॉल की दर से फिर भरता है। मध्यम प्रयास स्तर (medium) पर /code-review अब Opus 5.5 और Sonnet 5.5 में CLAUDE.md की परिपाटियों से विचलन की भी सूचना देता है। Slack में Claude Tag को तेज़ मोड (!fast) मिलता है, Claude in Chrome में browser_batch कॉल के लिए 60 के बजाय 90 सेकंड मिलते हैं, और WebFetch अब 100 000 अक्षरों से आगे के पाठ को चुपचाप नहीं काटता। pyright और ps के अधिक रूपों के लिए अनुमति माँगी जाती है, और अनुमति संबंधी कई खामियाँ सुधारी गई हैं: shell द्वारा विस्तारित rg और git grep के वाइल्डकार्ड, कार्य फ़ोल्डरों से बाहर लिंक किए गए CLAUDE.md, और उपयोगकर्ता mod के ज़रिए संगठन के mod को दरकिनार करना। चार घंटे बाद 2.1.291 दो रिग्रेशन सुधारता है: एक 2.1.290 के साथ आया था, जिसमें क्लाउड सत्रों में अनुमति संबंधी संकेतों के जवाब खो जाते थे; दूसरा 2.1.288 के साथ आया था, जिसमें बाहर निकलते समय सत्र के आख़िरी संदेश खो जाते थे।

6 अक्टूबर को 18 बजकर 59 मिनट UTC पर जारी 2.1.292 (92 प्रविष्टियाँ, जिनमें 64 सुधार हैं) Agent टूल में effort पैरामीटर जोड़ता है, जिससे माँगे गए प्रयास स्तर पर उप-एजेंट शुरू किया जा सकता है। इसमें claude plugin install --marketplace भी जुड़ता है, जो आवश्यकता पड़ने पर मार्केटप्लेस (marketplace) जोड़ता है और फिर प्लगइन स्थापित करता है। स्थानीय MCP सर्वर (stdio) अब डिफ़ॉल्ट रूप से 2026-07-28 प्रोटोकॉल पर सहमति बनाते हैं (वापस जाने के लिए MCP_PROTOCOL_NEGOTIATION=legacy), CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS त्रुटि 529 पर दोबारा प्रयास करने की अवधि बढ़ाता है, और mods को prompt ऑटोकम्प्लीशन का इवेंट तथा prompt कैश मिलता है। सुरक्षा के मामले में, PreToolUse hook की स्वीकृतियाँ और auto मोड अब नेटवर्क पाथ (UNC) पढ़ने के लिए अनुमति माँगने वाले संकेत को दरकिनार नहीं करते, और hook द्वारा लिखे गए <system-reminder> टैग Claude तक पहुँचने से पहले एस्केप किए जाते हैं। Artifact टूल अब अंततः 50 के बजाय 200 आर्टिफ़ैक्ट सूचीबद्ध करता है, और Code Review अपने आँकड़े रिपॉज़िटरी के हिसाब से दिखाता है। न तो 2.1.290 और न ही 2.1.292 की घोषणा X पर की गई है।

Claude Code संस्करणप्रकाशन की तारीख़ (UTC)प्रविष्टियों की संख्यामुख्य नई सुविधा
2.1.2905 अक्टूबर, 23 बजकर 33 मिनट190, जिनमें 131 सुधारनाम से पहचाने जाने वाले सत्र, managed-agents-onboard, फिर भरने वाला WebSearch बजट
2.1.2916 अक्टूबर, 3 बजकर 55 मिनट2 सुधारदो रिग्रेशन सुधारे गए
2.1.2926 अक्टूबर, 18 बजकर 59 मिनट92, जिनमें 64 सुधारउप-एजेंटों का प्रयास स्तर, एक कमांड में प्लगइन और मार्केटप्लेस, MCP 2026-07-28

🔗 Claude Code 2.1.290 🔗 Claude Code 2.1.291 🔗 Claude Code 2.1.292

Claude Code के क्लाउड सत्रों की मार्गदर्शिका

6 अक्टूबर — Claude Code के क्लाउड सत्रों का पूर्वावलोकन जारी होने के दो सप्ताह बाद Anthropic ने claude.dev पर Addy Osmani की लिखी व्यावहारिक मार्गदर्शिका प्रकाशित की है। हर कार्य लगभग 4 vCPU, 16 Go RAM और 30 Go डिस्क वाली नई वर्चुअल मशीन पर चलता है, जिसमें रिपॉज़िटरी को एक नई ब्रांच पर क्लोन किया जाता है; Pro, Max, Team और Enterprise प्लान पर कंप्यूटिंग का कोई अतिरिक्त शुल्क नहीं लगता। मार्गदर्शिका सात उपयोग बताती है: लंबित कार्यों की सूची (backlog) को समानांतर रूप से पूरा करना, बार-बार चलाकर किसी सुधार की पुष्टि कराना, स्थानीय रूप से योजना बनाकर फिर claude --teleport के साथ सत्र जारी रखना, फ़ोन से प्रगति देखना, CI की विफलताओं और समीक्षा की टिप्पणियों को Auto-fix के हवाले करना, नियमित प्रक्रियाएँ शुरू करना और इस्तेमाल के बाद हटाई जाने वाली VM में कम सुरक्षित कोड चलाना। इसके प्रदर्शन में तीनों सत्र पहली शुरुआत के 87 सेकंड बाद पूरे हो गए, और एक परियोजना प्रतिदिन 200 तक नए थ्रेड (threads) शुरू कर सकती है। मार्गदर्शिका GitHub से जुड़ने की प्रक्रिया भी विस्तार से बताती है: GitHub से साइन इन करना और Claude GitHub ऐप स्थापित करना दो अलग अनुमतियाँ हैं, और केवल दूसरी अनुमति निजी रिपॉज़िटरी तक पहुँच देती है। 100 डॉलर (Pro) या 250 डॉलर (Max) का बोनस क्रेडिट 7 अक्टूबर को 23 बजकर 59 मिनट PT से पहले प्राप्त करना होगा, और यह 4 नवंबर को समाप्त हो जाता है।

🔗 claude.dev पर क्लाउड सत्रों की व्यावहारिक मार्गदर्शिका 🔗 बोनस क्रेडिट के बारे में @ClaudeDevs का अनुस्मारक

Vibe CLI 2.26.0

6 अक्टूबर — Mistral ने अपने कमांड लाइन कोड एजेंट Vibe CLI का संस्करण 2.26.0 जारी किया है, 2.25.8 के तेरह दिन बाद और X पर किसी घोषणा के बिना। 33 परिवर्धन, 23 बदलाव और 91 सुधारों के साथ यह बड़ा अपडेट है: इसकी 147 प्रविष्टियों में से 72 Rust में लिखे नए इंटरफ़ेस से जुड़ी हैं: पहली बार शुरू करने पर मदद करने वाला सहायक, वॉइस मोड (/voice), /loop के साथ प्राकृतिक भाषा में बताए गए बार-बार दोहराए जाने वाले prompt, /teleport के साथ सत्र को Vibe Code Web पर भेजना, और vibe update कमांड। Vibe अब हमेशा अपने नए निष्पादन इंजन Unified Harness पर चलता है, और उसके उपलब्ध न होने पर पुराने इंजन पर चुपचाप लौटने के बजाय स्पष्ट त्रुटि के साथ रुक जाता है। प्लगइन अपना MCP सर्वर साथ ला सकते हैं, ~/.vibe/.env में रखी फ़ॉलबैक API कुंजी अब केवल उसका मालिक पढ़ सकता है, और Rust CLI अब उपयोग संबंधी टेलीमेट्री (शुरू होने में लगा समय, इस्तेमाल की गई कमांड, पहचाना गया टर्मिनल) Mistral को भेजता है।

🔗 Mistral Vibe v2.26.0 के रिलीज़ नोट्स

VS Code के लिए Antigravity एक्सटेंशन 1.7.0

5 अक्टूबर — Google ने Visual Studio Code के लिए Antigravity एक्सटेंशन का संस्करण 1.7.0 जारी किया है, जो VS Code 1.90 से शुरू करके Microsoft के संपादक में Google Antigravity के एजेंट लाता है (साइड पैनल में बातचीत, इनलाइन diff समीक्षा, इंटरैक्टिव योजनाएँ)। इसके बदलाव विवरण के अनुसार सितंबर की शुरुआत से इसे लगभग हर सप्ताह अपडेट किया जा रहा है, और यहाँ इसके बारे में पहले कभी नहीं लिखा गया था। यह 1.7.0 (6 सुधारात्मक संवर्द्धन, 9 त्रुटि सुधार) कोड समीक्षा को बेहतर बनाता है: Accept और Reject के निर्णय कीबोर्ड से पूर्ववत किए और फिर बहाल किए जा सकते हैं, अगल-बगल दिखाने वाले diff संपादक में Accept All और Reject All बटन जुड़ते हैं, और VS Code का स्वचालित सहेजना (Auto Save) अब चल रही समीक्षा को ओवरराइट या बंद नहीं कर सकता। Windows में, विंडो अग्रभूमि में न होने पर कार्य पूरा होने की सूचना सिस्टम की सूचनाओं से मिलती है, और Google Cloud Workstations तथा Cloud Shell को इंटरैक्टिव प्रमाणीकरण मिलता है। उसी दिन Visual Studio का एक्सटेंशन 1.0.261005.0 पर पहुँचता है और भेजे गए फ़ीडबैक के साथ निदान के लॉग जोड़ता है।

🔗 Google Antigravity का बदलाव विवरण

Replit और सभी परियोजनाओं का संदर्भ

6 अक्टूबर — Replit ने घोषणा की है कि अब उसके पास उपयोगकर्ता की सभी परियोजनाओं का संदर्भ उपलब्ध है। नई बातचीत से उसे किसी मौजूदा परियोजना को ढूँढ़ने, उसमें नई सुविधा जोड़ने या एक परियोजना को दूसरी के लिए संदर्भ बनाने को कहा जा सकता है; इसके बाद Replit संबंधित फ़ाइलें पढ़ता है और पृष्ठभूमि कार्यों (background tasks) में बदलाव शुरू करता है, साथ में बदलावों की समीक्षा के लिए लिंक देता है। चुना गया उदाहरण केवल कोड तक सीमित नहीं है: एक कॉफ़ी ब्रांड की दो दूसरी परियोजनाओं पर « Partner Marketing Hub » की रंग योजना लागू करना। घोषणा एक वीडियो के साथ किए गए ट्वीट तक सीमित है; कोई लेख, दस्तावेज़ या कीमत नहीं दी गई है।

🔗 X पर Replit की घोषणा


GitHub की स्टैक की गई pull requests अब सामान्य रूप से उपलब्ध हैं

6 अक्टूबर — GitHub ने github.com के सभी प्लान के लिए स्टैक की गई pull requests (stacked pull requests) उपलब्ध कर दी हैं, जो 30 जुलाई से सार्वजनिक पूर्वावलोकन में थीं: बड़े बदलाव को छोटी pull requests में बाँटा जाता है, जिनकी अलग-अलग समीक्षा होती है और फिर उन्हें एक साथ मर्ज किया जाता है। GitHub Enterprise Server को ये आगामी संस्करण में मिलेंगी। GitHub के अनुसार, स्टैक इस्तेमाल करने वाली रिपॉज़िटरी तुलनीय रिपॉज़िटरी से 9 % अधिक कोड मर्ज करती हैं, और शीर्ष 1 % रिपॉज़िटरी में से दो-तिहाई से अधिक इन्हें इस्तेमाल करती हैं, जबकि मर्ज होने तक के समय में 5 % सुधार हुआ है।

अंतिम संस्करण मर्ज करने की अड़चनें कम करता है। मुख्य ब्रांच आगे बढ़ने पर « Rebase stack » अपरिवर्तित कोड की स्वीकृतियाँ बनाए रखता है और हस्ताक्षरित प्रतिस्थापन commits बनाता है; स्टैक मर्ज कतार (merge queue) से एक समूह के रूप में गुज़रता है, और जिस स्टैक की आधार ब्रांच हटा दी जाती है, उसे बंद करने के बजाय नया लक्ष्य दिया जाता है। पूरे स्टैक का स्वचालित मर्ज « आने वाले कुछ सप्ताहों में » आएगा। कमांड लाइन के उपयोगों और एजेंटों के लिए GitHub CLI का gh stack एक्सटेंशन Git worktrees का समर्थन करता है।

🔗 स्टैक की गई pull requests पर GitHub का बदलाव विवरण


बहुभाषी मॉडल: Cohere का Tiny Aya L2-Thinker और TII का Falcon-OCR-Arabic

दो छोटे मॉडल उन भाषाओं पर केंद्रित हैं जिन्हें बड़े मॉडल कम अच्छी तरह सँभालते हैं: एक उपयोगकर्ता की भाषा में तर्क करता है, दूसरा अरबी दस्तावेज़ पढ़ता है।

Cohere का Tiny Aya L2-Thinker

6 अक्टूबर — Cohere उस भाषा की समस्या पर काम कर रहा है जिसमें मॉडल तर्क करते हैं: स्पेनिश, अरबी या स्वाहिली में पूछे जाने पर अधिकांश मॉडल जवाब देने से पहले अंग्रेज़ी में सोचते हैं। उसका शोध मॉडल Tiny Aya L2-Thinker (3,35 अरब पैरामीटर) 60 भाषाओं में 93 % से अधिक बार prompt की भाषा में तर्क करता है। इसका तरीका डेटा के मिश्रण में है: gpt-oss-120b द्वारा बनाए गए अंग्रेज़ी में तर्क के लगभग 1,7 मिलियन उदाहरण उसे केवल 12,8 % बार उपयोगकर्ता की भाषा में तर्क करवाते हैं; 44 भाषाओं में प्रति भाषा लगभग 5 000 अनूदित उदाहरण इस दर को 86,1 % तक ले जाते हैं, और तर्क के बिना वाला बहुभाषी डेटा इस व्यवहार को दूसरी भाषाओं तक बढ़ाता है। अंग्रेज़ी में तर्क करने वाले उसके समकक्ष की तुलना में छह benchmarks में से पाँच पर सटीकता अधिकतम दो से तीन अंक घटती है; केवल प्रतियोगी गणित वाले PolyMath में गिरावट अधिक स्पष्ट है, क्योंकि reinforcement learning का चरण नहीं है। मॉडल औसतन 5 000 से कम विचार संबंधी tokens खर्च करता है। मॉडल और डेटा Hugging Face पर गैर-व्यावसायिक CC-BY-NC 4.0 लाइसेंस के तहत प्रकाशित हैं; लेख 9 सितंबर के arXiv शोधपत्र को प्रस्तुत करता है।

🔗 Tiny Aya L2-Thinker पर Cohere का शोध लेख

TII का Falcon-OCR-Arabic

6 अक्टूबर — Falcon मॉडल विकसित करने वाला संयुक्त अरब अमीरात का संस्थान TII, Hugging Face के ब्लॉग पर Falcon-OCR-Arabic प्रस्तुत करता है, जो उसके टेक्स्ट पहचान मॉडल Falcon OCR का अरबी संस्करण है। इसमें वही 270 मिलियन पैरामीटर और early fusion आर्किटेक्चर बने रहते हैं, और इसे वास्तविक तथा कृत्रिम अरबी दस्तावेज़ों पर supervised fine-tuning, फिर reinforcement learning के ज़रिए अनुकूलित किया गया है। स्वयं TII द्वारा बनाए गए मूल्यांकन सेट (11 974 वास्तविक दस्तावेज़, 15 श्रेणियाँ) पर यह तुलना किए गए 17 मॉडलों में दूसरे स्थान पर है, और आधिकारिक दस्तावेज़ों, प्रशासनिक फ़ॉर्म, रसीदों तथा चालानों पर पहले स्थान पर है।

TII द्वारा मूल्यांकित मॉडलटेक्स्ट की सटीकताTable TEDS स्कोर
Gemini 3.5 Flash84,34 %51,30 %
Falcon-OCR-Arabic (270M)81,87 %59,95 %
Claude Opus 5.579,22 %43,98 %
GPT Astra75,02 %51,23 %
Chandra OCR 2 (सर्वश्रेष्ठ समर्पित OCR)61,67 %32,63 %

लेख केवल आज़माने की जगह (playground) देता है: हमारी जाँच के समय Hub पर Falcon-OCR-Arabic के कोई weights दिखाई नहीं दिए, और किसी लाइसेंस का उल्लेख नहीं है।

🔗 Falcon-OCR-Arabic पर TII का लेख


Hugging Face की लाइब्रेरी: Diffusers 0.41.0 में Qwen-Image 2.1 जुड़ता है, Transformers v5.19.0 में EmbeddingGemma 2 आता है

Hugging Face की दोनों प्रमुख मॉडल लाइब्रेरी एक ही दिन नया संस्करण जारी करती हैं।

Diffusers 0.41.0 और Qwen-Image 2.1

6 अक्टूबर — diffusion मॉडलों के लिए Hugging Face की लाइब्रेरी Diffusers 0.41.0 में Qwen-Image 2.1 जुड़ता है, Alibaba का वह मॉडल जो चित्र बनाने और संपादित करने को एक साथ लाता है: अब इसे सीधे चित्र बनाने, संपादित करने, पारदर्शी पृष्ठभूमि वाले चित्र बनाने (मूल RGBA आउटपुट) और LoRA प्रशिक्षित करने के लिए इस्तेमाल किया जा सकता है, जिसमें 7 अरब पैरामीटर वाला दृश्य निर्माण घटक है। टीम अपनी रिलीज़ की गति भी बदल रही है: Transformers की तरह अब Diffusers अपने minor संस्करण नए मॉडलों के आने के साथ जारी करेगा, जबकि patch संस्करण केवल त्रुटियाँ सुधारने के लिए होंगे। tensor parallelism के साथ लोड करने पर प्रत्येक GPU केवल अपने हिस्से के weights पढ़ सकता है, और संस्करण में LTX-2.5 DFR pipelines तथा Cosmos 3 के लिए अनुकूलन जुड़ते हैं। इसके बदले, Optimum के पक्ष में ONNX समर्थन को अप्रचलित घोषित किया गया है।

🔗 Diffusers 0.41.0 के रिलीज़ नोट्स

Transformers v5.19.0

6 अक्टूबर — v5.18.0 के छह दिन बाद Transformers v5.19.0 में ऊपर प्रस्तुत EmbeddingGemma 2 आता है, जिसके वेक्टर छोटे किए जा सकते हैं और जिसके vision तथा audio encoders लोड करते समय बंद किए जा सकते हैं। वितरित प्रशिक्षण में expert parallelism को tokens का वितरण (token dispatch) मिलता है, जो Qwen3 MoE और Mellum के लिए डिफ़ॉल्ट रूप से सक्रिय है: उसका आकार अब tensor parallelism के आकार के बराबर होना आवश्यक नहीं है, और Trainer इस मोड के साथ काम करता है। कैश का विन्यास अब हर परत के लिए अलग किया जा सकता है, जो विषम मॉडल के लिए उपयोगी है, और लगातार बैच में प्रसंस्करण (continuous batching) XPU का समर्थन करता है। संस्करण में पिछली संगतता तोड़ने वाले छह बदलाव हैं, जिनमें सभी MoE के लिए router logits लौटाना और paged| उपसर्ग को धीरे-धीरे हटाना शामिल है।

🔗 Transformers v5.19.0 के रिलीज़ नोट्स


वॉइस एजेंट: ElevenLabs ने ElevenAgents Architect को Alpha में लॉन्च किया

6 अक्टूबर — ElevenLabs अपने संवादात्मक एजेंटों के प्लेटफ़ॉर्म ElevenAgents में Architect नाम का एक विशेषज्ञ जोड़ता है, जिससे बोलकर या लिखकर टीमें अपने वॉइस या टेक्स्ट एजेंट बना और सुधार सकती हैं। वह ElevenAgents की सभी सेटिंग (ज्ञान आधार, prompt, कार्यप्रवाह, आवाज़ें, सुरक्षा सीमाएँ, टूल, सिमुलेशन) और उनके आपसी प्रभावों को जानता है। उसे कोई प्रश्न, विफल परीक्षण, किसी इंसान को सौंपे जाने वाले संवादों में बढ़ोतरी या ElevenAgents Spotlight का कोई निष्कर्ष दिया जा सकता है: वह प्रतिलेखों का विश्लेषण करता है, मूल कारण तक पहुँचता है, बदलाव सुझाता है और उसकी पुष्टि करने वाले सिमुलेशन लिखता है। वह साधारण विवरण से एजेंट भी बनाता है। हर बदलाव संस्करणयुक्त और वापस पलटे जा सकने वाले मसौदे के रूप में आता है, और स्वीकृति के बिना कुछ भी प्रोडक्शन में नहीं जाता। Architect उत्पाद के भीतर से उपलब्ध है, और Claude, Claude Code, ChatGPT, Cursor तथा Grok Bot से भी इस्तेमाल किया जा सकता है। यह अभी से Alpha में उपलब्ध है; कोई कीमत या नतीजों के आँकड़े नहीं दिए गए हैं।

🔗 ElevenAgents Architect पर ElevenLabs का लेख


जनरेटिव वीडियो: Black Forest Labs के अनुसार Physics-IQ Verified में FLUX 3 शीर्ष पर

6 अक्टूबर — Black Forest Labs ने Physics-IQ में पहला स्थान हासिल करने का दावा किया है। Google DeepMind का यह बेंचमार्क वीडियो मॉडलों की भौतिक दुनिया की समझ को मापता है: मॉडल को वास्तविक प्रयोग की रिकॉर्डिंग का शुरुआती हिस्सा दिखाया जाता है और उसे आगे होने वाली घटनाओं का पूर्वानुमान लगाना होता है (तरल पदार्थ, प्रकाशिकी, ठोस पदार्थों की यांत्रिकी)। संदर्भ रैंकिंग, Physics-IQ Verified, का रखरखाव Anates Labs करता है। वीडियो से वीडियो श्रेणी में FLUX 3 [large], NVIDIA के Cosmos3 से काफी आगे है, हालाँकि प्रति वीडियो उसकी लागत अधिक है।

मॉडल और विधि (वीडियो से वीडियो)Physics-IQ Verified स्कोरप्रति मानकीकृत वीडियो लागत
FLUX 3 [large], 8 जनरेशन में सर्वश्रेष्ठ64,35 %16,43 डॉलर
FLUX 3 [large]61,11 %2,08 डॉलर
Cosmos3 Super (NVIDIA)50,80 %0,82 डॉलर
Cosmos3 Nano (NVIDIA)43,00 %0,82 डॉलर

छवि से वीडियो श्रेणी में भी FLUX 3 [large], Physis-Lang से आगे निकल गया है। NVIDIA ने 29 सितंबर को इस विधि को शीर्ष पर बताया था। FLUX 3 [large] एक मालिकाना मॉडल है और पोस्ट शृंखला में इस संस्करण की उपलब्धता की तारीख या कीमत नहीं दी गई है।

🔗 X पर @bfl_ai की पोस्ट शृंखला 🔗 Physics-IQ Verified की रैंकिंग


सार्वजनिक मूल्यांकन: GeoGuess Bench और RSI Arena

जनता के लिए खुले दो मूल्यांकन सामान्य बेंचमार्कों से अलग हैं: एक में मॉडल GeoGuessr खेलते हैं, जबकि दूसरे में जनता एजेंटों द्वारा प्रशिक्षित मॉडलों पर मतदान करती है।

GeoGuess Bench

6 अक्टूबर — Together AI में डेवलपर अनुभव के प्रभारी हसन ने GeoGuess Bench प्रकाशित किया है। यह उनका निजी बेंचमार्क है, जिसमें मॉडल GeoGuessr खेलते हैं: हर मॉडल को सड़कों की वही 210 तस्वीरें दिखाई जाती हैं और वह नक्शे पर एक पिन लगाता है, जिसे खेल के फ़ॉर्मूले के अनुसार अंक मिलते हैं। पाँच दौर के एक खेल में अधिकतम 25 000 अंक मिल सकते हैं। Claude Opus 5.5 पहले स्थान पर है और Claude Fable 5.1 उससे थोड़ा पीछे है; चौंकाने वाला प्रदर्शन Meta के खुले वज़नों वाले मॉडल Muse Glimmer 30B का है, जो तीसरे स्थान पर है और प्रति खेल लगभग 45 गुना कम लागत पर GPT-6 Astra से आगे है।

GeoGuess Bench में स्थानमूल्यांकित मॉडल25 000 में से स्कोरप्रति खेल लागत
1Claude Opus 5.523 4120,064 डॉलर
2Claude Fable 5.123 3070,115 डॉलर
3Muse Glimmer 30B (खुला)22 4070,0049 डॉलर
4GPT-6 Astra21 5620,223 डॉलर
5GPT-6.1 Sol21 1940,042 डॉलर
6GLM-5.3 Flash (खुला)21 1830,0087 डॉलर

इस तरह GLM-5.3 Flash लगभग पाँच गुना कम लागत पर GPT-6.1 Sol के बराबर प्रदर्शन करता है। यह खुले मॉडलों के इन्फ़रेंस प्रदाता Together AI के एक कर्मचारी की निजी परियोजना है, कंपनी का मूल्यांकन नहीं; इसमें कोई Gemini मॉडल शामिल नहीं है और कोड GitHub पर प्रकाशित है।

🔗 X पर हसन की घोषणा 🔗 GeoGuess Bench

RSI Arena

6 अक्टूबर — ज़िचेन चेन ने RSI Arena (पुनरावर्ती स्व-सुधार, पुनरावर्ती आत्म-सुधार का संक्षिप्त रूप) के एक नए दौर की घोषणा की है, इस बार Hugging Face के साथ। एआई एजेंटों को GPU और एक ही लक्ष्य दिया गया था: बेहतर मॉडल प्रशिक्षित करना। उन्होंने स्वयं डेटा चुना, कोड लिखा और प्रयोग किए। प्रशिक्षण का पहला दौर पूरा होने के बाद जनता इस प्रक्रिया में शामिल होती है: मॉडल आमने-सामने मुकाबला करते हैं, लोग मतदान करते हैं और एजेंट इस प्रतिक्रिया के आधार पर नए प्रयोग करते हैं। Hugging Face के Inference Endpoints हर मॉडल को सीधे उपलब्ध कराते हैं और साइट पर दस एजेंट सूचीबद्ध हैं, जिनमें GPT-6 Astra, Grok 4.7, DeepSeek V4.1 Flash, GLM-5.3 और Muse Spark 1.3 शामिल हैं; इसके डैशबोर्ड पर API खर्च 300 में से 286,60 डॉलर और GPU समय 1 000 में से 755,17 घंटे दिखाया गया था। टीम ने एजेंटों द्वारा प्रशिक्षित हर मॉडल को Hub पर प्रकाशित करने और प्रयोग समाप्त होने पर सभी आर्टिफ़ैक्ट जारी करने का वादा किया है: डेटा, कोड और हर एजेंट की पूरी शोध प्रक्रिया।

🔗 X पर ज़िचेन चेन की घोषणा 🔗 RSI Arena


GPU अवसंरचना: NVIDIA ने AICR v1.0 जारी किया

6 अक्टूबर — NVIDIA ने AI Cluster Runtime (AICR) का संस्करण 1.0 जारी किया है। यह एक खुली परियोजना है, जिसका उद्देश्य Kubernetes GPU क्लस्टरों को अनुमान और प्रयोग के सहारे कॉन्फ़िगर करने की आवश्यकता समाप्त करना है। एक त्वरित कंप्यूटिंग क्लस्टर दर्जनों ऐसे घटकों पर निर्भर करता है जिनके संस्करण स्वतंत्र होते हैं (कर्नेल, ड्राइवर, कंटेनर रनटाइम, नेटवर्क, स्टोरेज, ऑपरेटर, लाइब्रेरी), और एक जगह काम करने वाला संयोजन दूसरी जगह बिना किसी चेतावनी के विफल हो सकता है। AICR इसके लिए निश्चित संस्करणों वाली सत्यापित कॉन्फ़िगरेशन विधियाँ उपलब्ध कराता है, जिन्हें Helm, Argo CD, Flux या Helmfile के लिए तैयार किया जाता है और जिनके साथ परीक्षण किए गए हार्डवेयर पर सत्यापन के हस्ताक्षरित प्रमाण दिए जाते हैं। v1.0 संगतता का एक अनुबंध तय करता है: CLI, REST API, Go SDK, परिनियोजन पैकेजों की संरचना और आर्टिफ़ैक्ट स्कीमा स्थिर इंटरफ़ेस बन जाते हैं, और संगतता तोड़ने वाले किसी भी बदलाव के लिए नया प्रमुख संस्करण जारी करना होगा। NVIDIA ने 100 से अधिक योगदानकर्ताओं का दावा किया है, जिनमें लगभग आधे कंपनी के बाहर के हैं, और Pulumi Labs तथा Mirantis के बहु-क्लस्टर प्रबंधक k0rdent में एकीकरण का उल्लेख किया है।

🔗 NVIDIA के तकनीकी ब्लॉग की पोस्ट


Claude Startups: उत्पादों और क्रेडिट में 7 000 डॉलर तक, और 45 000 डॉलर की Startup Stack

6 अक्टूबर — Anthropic, Claude पर उत्पाद बनाने वाले संस्थापकों के लिए अपने Claude Startups कार्यक्रम का दायरा बढ़ा रहा है। अब इसमें वे स्टार्टअप शामिल हो सकते हैं जिनकी स्थापना पाँच साल से कम समय पहले हुई हो या जिन्हें पिछले दो वर्षों में वित्तपोषण मिला हो।

कार्यक्रम का लाभAnthropic द्वारा घोषित मूल्य
एक साल का Claude Team, अधिकतम पाँच Premium सीटें6 000 डॉलर (100 डॉलर प्रति माह की पाँच सीटें)
एकमुश्त API क्रेडिट, स्वीकृति मिलते ही उपलब्ध1 000 डॉलर
Claude उत्पादों और क्रेडिट का कुल मूल्य7 000 डॉलर तक
Claude Startup Stack (साझेदारों के प्रस्ताव)45 000 डॉलर तक

Claude Team का एक साल उन कंपनियों के लिए है जो पहली बार Team का उपयोग करेंगी, और इसका वास्तविक मूल्य सीटों की संख्या और प्रकार पर निर्भर करता है। आज पेश की गई Claude Startup Stack में Claude के साथ उत्पाद बनाने वाली कंपनियों की छूट और क्रेडिट शामिल हैं, जिनमें Linear, Lovable, ElevenLabs, Granola और Hex हैं; इसकी अधिकतम राशि सितंबर 2026 की सूचीबद्ध कीमतों पर सभी प्रस्तावों के कुल मूल्य के बराबर है और सभी प्रस्तावों का लाभ एक साथ नहीं लिया जा सकता। कार्यक्रम में Anthropic की Applied AI टीम के साथ बातचीत के समय, Claude Marketplace पर परिचय पृष्ठ प्रकाशित करने में सहायता और आयोजनों में भाग लेने की सुविधा भी जोड़ी गई है।

🔗 Claude Startups पर Anthropic की ब्लॉग पोस्ट 🔗 Claude Startup Stack पर @claudeai की पोस्ट शृंखला


संक्षिप्त समाचार

  • Claude Projects और स्थानीय फ़ोल्डर — Anthropic के डैन फ़ाइन ने घोषणा की है कि Claude Projects के क्लाउड सत्र कंप्यूटर के किसी स्वीकृत फ़ोल्डर से जुड़ सकते हैं और केवल तभी उसे खोलते हैं जब किसी कार्य के लिए उसकी आवश्यकता हो; यह सुविधा 5 अक्टूबर से धीरे-धीरे जारी की जा रही है और बोरिस चेर्नी के अनुसार टीम इसे लगभग पूरा कर चुकी है (लगभग पहुँच गए)। 🔗 स्रोत · 🔗 बोरिस चेर्नी
  • Slack के समूह संदेशों में Claude — अब Claude को Slack के समूह संदेशों (समूह के सीधे संदेश) में किसी भी अन्य प्रतिभागी की तरह जोड़ा जा सकता है; वह एक थ्रेड में उत्तर देता है, आगे भी उस पर नज़र रखता है और उसे बुलाने वाले व्यक्ति के निजी कनेक्टरों का उपयोग कर सकता है। योजनाओं या समयसारणी का विवरण नहीं दिया गया है। 🔗 स्रोत
  • बोरिस चेर्नी और प्रॉम्प्ट देने का उनका तरीका — बोरिस चेर्नी, Opus 5.5 से Home Depot पर केंद्रित Acquired पॉडकास्ट के एक एपिसोड के लिए इंटरैक्टिव सहायक वेबसाइट बनवाते हैं, जिसमें जलरंग चित्र भी शामिल हैं; उनके अनुसार प्रॉम्प्ट देने का कोई गुप्त तरीका नहीं है: मॉडल को बताइए कि आपको क्या चाहिए, उस पर कितना प्रयास करना है और परिणाम की जाँच कैसे करनी है। 🔗 सहायक वेबसाइट · 🔗 प्रॉम्प्ट देने का उनका तरीका
  • Atlassian और OpenAI — एक नए समझौते के तहत GPT-6 परिवार के अग्रणी मॉडल, जिनमें GPT-6 Astra शामिल है, Atlassian प्लेटफ़ॉर्म और Rovo के एजेंटों को संचालित करेंगे; Atlassian के 3 000 से अधिक डेवलपर पहले ही Codex का उपयोग कर रहे हैं और Jira के साथ अधिक गहरे एकीकरण पर विचार हो रहा है। समझौते की राशि नहीं बताई गई है। 🔗 स्रोत
  • iOS के लिए ChatGPT में Codex विजेट — 2 अक्टूबर का iOS के लिए ChatGPT संस्करण 1.2026.267 चुने गए कंप्यूटरों के हाल के Codex कार्यों के लिए होम स्क्रीन विजेट जोड़ता है। शेष उपयोग और उसके रीसेट के लिए भी विजेट जोड़े गए हैं, जो लॉक स्क्रीन पर भी उपलब्ध हैं, साथ ही कीबोर्ड को खुला रखने की एक सेटिंग भी है। 🔗 स्रोत
  • Gemini CLI v0.63.0 और v0.64.0-preview.0 — स्थिर संस्करण v0.63.0 में 29 सितंबर के पूर्वावलोकन संस्करण की वही 15 प्रविष्टियाँ हैं और पूर्वावलोकन संस्करण v0.64.0-preview.0 में 30 सितंबर से 3 अक्टूबर तक के रात्रिकालीन संस्करणों की 16 प्रविष्टियाँ एकत्र की गई हैं: कोई नई सामग्री नहीं है और 6 अक्टूबर का रात्रिकालीन संस्करण खाली है। 🔗 स्रोत
  • Mistral का Python SDK 3.1.0 — API से स्वचालित रूप से तैयार किया गया यह संस्करण निगरानी मॉड्यूल के अंतर्गत बीटा में मूल्यांकन के चौदह ऑपरेशन जोड़ता है; Runs विधियाँ अब Workflows.runs के अंतर्गत चली जाती हैं, जिससे केवल मामूली संस्करण बदलाव के बावजूद मौजूदा कोड टूट सकता है। 🔗 स्रोत
  • Qwen Code v0.25.1-preview.0 — v0.25.0 के अगले दिन आया यह पूर्वावलोकन संस्करण 13 सुविधाएँ और 27 सुधार लाता है। इनमें प्रयोगात्मक Kubernetes रनटाइम, Managed Agent के लिए Shell कमांड और पृष्ठभूमि में निगरानी तथा ऐसे MCP नियम शामिल हैं जो अब समान नाम वाले सर्वर को अनुमति नहीं देते। 🔗 स्रोत
  • SpaceXAI का TypeScript SDK 0.2.2 — 5 अक्टूबर को बिना घोषणा के जारी हुए इस संस्करण में केवल एक बदलाव है: retryBeforeOutput विकल्प अब ऐसे create() कॉल पर भी लागू होता है जो निरंतर प्रवाह (स्ट्रीमिंग) का उपयोग नहीं करता और JSON की अपेक्षा करता है। 🔗 स्रोत
  • Falcon-Emirati-7B, अमीराती बोली — TII ने Falcon-H1-Arabic 7B को अमीराती अरबी में विशेषज्ञ बनाया है: 1 173 प्रश्नों वाले बेंचमार्क Alyah पर 84,83 % और बोली के प्रति निष्ठा का स्कोर 0,52 है, जबकि निर्णायक Gemini 3.7 Flash के अनुसार ALLaM, Gemma 3 27B, Jais-2 और Fanar-2 का सर्वोत्तम स्कोर 0,05 है; मॉडल केवल TII के चैट प्लेटफ़ॉर्म पर उपलब्ध है। 🔗 स्रोत
  • Datasets 5.1.0 — 5 अक्टूबर को जारी हुई यह डेटासेट लाइब्रेरी अब Harbor के पुनर्बलन शिक्षण परिवेश, कॉलम आधारित Vortex प्रारूप और पाँच जैविक प्रारूपों (FASTA, FASTQ, GenBank, PDB, mmCIF) को पढ़ती है। यह उस भेद्यता को भी ठीक करती है जिससे कोई आर्काइव पास की डायरेक्टरी में लिख सकता था। 🔗 स्रोत
  • TRL v1.14.2 — यह सुधार बिना किसी चेतावनी के गलत हो रहे प्रशिक्षण को ठीक करता है: vLLM के बिना GRPO, RLOO और Distillation, Gemma या Phi-3.5 जैसे मॉडलों के लिए संवाद की बारी समाप्त होने पर नहीं रुकते थे और अधिकतम लंबाई तक आने वाला पूरा पाठ सीखते रहते थे; तीन क्रैश भी ठीक किए गए हैं। 🔗 स्रोत
  • चुनावी अभियान के ईमेल के विरुद्ध Jev — एक सामुदायिक ब्लॉग पोस्ट में स्टीफ़न सोल्का अपने राजनीतिक ईमेल पहले Jev से छाँटते हैं (100 वास्तविक ईमेल में 99 सही उत्तर और एक गलत सकारात्मक परिणाम), फिर 22,6 मिलियन पैरामीटर वाले SetFit वर्गीकारक से, जो प्रोसेसर पर चलता है: प्रारंभिक मूल्यांकन में 98 %, लेकिन कठिन मामलों में 23 में से 18। 🔗 स्रोत
  • 16 अक्टूबर को Open Together — vLLM और Hugging Face, Open Together का आयोजन कर रहे हैं। ओपन सोर्स डेवलपरों का यह सम्मेलन शुक्रवार, 16 अक्टूबर को San Francisco में Open Source AI Week की शुरुआत करेगा; जेफ़ बाउडियर के अनुसार प्रतीक्षा सूची में 150 लोग हैं और क्षमता दोगुनी कर दी गई है। 🔗 स्रोत · 🔗 जेफ़ बाउडियर
  • Copilot CLI 1.0.93-2 — यह पूर्वावलोकन संस्करण उद्यमों के लिए permissions.limitTo सेटिंग जोड़ता है, जो नेटवर्क अनुरोधों को प्रबंधित डोमेन तक सीमित करती है। चयन सूची में GPT-6.1 Sol, GPT-6 Astra और Luna तथा Claude 5.5 मॉडलों को प्रमुखता दी गई है और अब उपयोगकर्ता की सेटिंग केवल ~/.copilot/settings.json से पढ़ी जाती हैं। 🔗 स्रोत
  • सुरक्षा अवलोकन में AI Scan — GitHub के सुरक्षा अवलोकन (सुरक्षा का समग्र दृश्य) में संगठन और उद्यम के प्रशासक अब देख सकते हैं कि किन रिपॉज़िटरी में पुल रिक्वेस्ट की एआई जाँच (पुल रिक्वेस्ट के लिए AI Scan) सक्रिय है। इसके लिए दो फ़िल्टर और CSV निर्यात में एक कॉलम उपलब्ध हैं। 🔗 स्रोत
  • गोपनीय कुंजियों का पता लगाना: Lovable, Pydantic और Supabase — GitHub की गोपनीय कुंजियों की जाँच (गोपनीय कुंजियों की स्कैनिंग) पाँच नए प्रकार की गोपनीय कुंजियों को पहचानती है, जिनमें Lovable की API कुंजी, Logfire टोकन और Pydantic AI Gateway की कुंजी तथा Supabase के दो टोकन शामिल हैं; Lovable Labs भी इसके साझेदारी कार्यक्रम में शामिल हो गया है। 🔗 स्रोत
  • Devin के 5 अक्टूबर के संस्करण विवरण — मुख्य रूप से छोटे सुधार: सत्र के कार्यक्षेत्र में Terminal टैब (Files या Terminal खोलने से Devin सक्रिय हो जाता है), ट्रिगर कार्रवाइयों के माध्यम से समायोजित किए जा सकने वाले Devin Review के प्रयास स्तर और ऐसे कोड विश्लेषण (कोड स्कैन) जिन्हें पहचानकर्ता के आधार पर API v3 या Devin के MCP से प्राप्त किया जा सकता है। 🔗 स्रोत
  • Delta और उसके अपने वर्कट्री — Delta के ब्लॉग पर कॉनराड इरविन बताते हैं कि यह टूल Git वर्कट्री की जगह क्यों लेता है: हर थ्रेड का अपना वर्कट्री होता है, जो DeltaDB में दर्ज रहता है और लोगों, एजेंटों तथा मशीनों के बीच प्रतिलिपित होता है। कई एजेंट एक ही ब्रांच पर काम करते हैं और संस्करण नियंत्रण में रखा गया .agents/prepare स्क्रिप्ट हर चेकआउट को तैयार करता है; पोस्ट के साथ कोई नया संस्करण जारी नहीं हुआ है। 🔗 स्रोत
  • v0: निजी खाते अब टीम कार्यक्षेत्र — v0 के निजी खाते टीम कार्यक्षेत्रों में बदल रहे हैं और बातचीत, परियोजनाएँ तथा सेटिंग अपने आप स्थानांतरित हो रही हैं; हालाँकि दस्तावेज़ों के अनुसार टीम टेम्प्लेट जैसी कुछ सुविधाएँ केवल Plus, Business और Enterprise योजनाओं के लिए उपलब्ध हैं। 🔗 स्रोत
  • v0 और iOS पर ChatGPT सदस्यता — v0 द्वारा 29 सितंबर से स्वीकार की जा रही ChatGPT सदस्यता का उपयोग अब उसके iOS ऐप में भी किया जा सकता है। कीमत या कोई अतिरिक्त विवरण नहीं दिया गया है। 🔗 स्रोत
  • Eleven v4 और Eleven v4 Turbo शीर्ष पर — ElevenLabs ने घोषणा की है कि 28 सितंबर को लॉन्च किए गए उसके दोनों वाक् संश्लेषण मॉडल Artificial Analysis की वाक् संश्लेषण (पाठ से वाणी) रैंकिंग में पहले दो स्थानों पर हैं; v4 लॉन्च के समय ही पहले स्थान पर था। 🔗 स्रोत
  • HeyGen Video अब 2K में — लॉन्च के एक सप्ताह बाद HeyGen Video अब 2K रिज़ॉल्यूशन में उपलब्ध है; HeyGen के अनुसार उपयोग के आधार पर यह OpenRouter की वीडियो रैंकिंग में पहले स्थान पर है। 2K के लिए अलग कीमत नहीं दी गई है और उत्पाद सूची वाले पृष्ठ पर अभी भी अक्टूबर के अंत तक 0,01 डॉलर प्रति सेकंड की कीमत दिखाई गई है। 🔗 स्रोत
  • Pika पर Nano Banana 2.1 — Pika अपने प्लेटफ़ॉर्म और Pika API Club में Google के Nano Banana मॉडल का नया संस्करण Nano Banana 2.1 जोड़ रहा है। Pika के अनुसार इसकी दृश्य गुणवत्ता और गति बेहतर हैं; कोई कीमत या क्रेडिट लागत नहीं बताई गई है। 🔗 स्रोत
  • DOCA GPUNetIO — NVIDIA, DOCA GPUNetIO को NCCL, NVSHMEM और NIXL/UCX के लिए GPU संचालित नेटवर्क (GDA-KI) का साझा कार्यान्वयन बना रहा है। इसका पूर्ण संस्करण DOCA SDK में और RDMA Verbs पर केंद्रित हल्का संस्करण ओपन सोर्स परियोजना के रूप में उपलब्ध है। 🔗 स्रोत
  • CUDA के Green contexts — NVIDIA की एक तकनीकी ब्लॉग पोस्ट दिखाती है कि किसी महत्वपूर्ण कार्य के लिए SM कैसे आरक्षित किए जा सकते हैं: 148 SM वाले Blackwell GPU पर 8 SM के लिए आरक्षित कर्नेल 0,007 ms में प्रतिक्रिया देता है, जबकि प्राथमिकता वाले प्रवाह (स्ट्रीम) में 0,140 ms और बिना प्राथमिकता के 3,727 ms लगते हैं। 🔗 स्रोत
  • दूरसंचार ऑपरेटरों में खुले मॉडल — अपने रुख को स्पष्ट करने वाले एक लेख में, NVIDIA अपने 2026 के दूरसंचार सर्वेक्षण का हवाला देता है, जिसमें 89 % उत्तरदाता ओपन सोर्स को महत्वपूर्ण मानते हैं, और SoftBank, AT&T तथा Indosat के वक्तव्यों का उल्लेख करता है; कोई नया उत्पाद नहीं। 🔗 स्रोत
  • सहयोग के उपकरणों पर Perplexity की मार्गदर्शिका — Perplexity एआई से लैस दस सहयोग उपकरणों (Slack, Loom, Confluence, Airtable, Notion, ClickUp, Asana, Monday.com, Trello, Miro), उनकी एआई सुविधाओं और उन्हें शामिल करने वाली सदस्यता योजनाओं की तुलना करता है; उत्पादों में कोई नई सुविधा नहीं। 🔗 स्रोत

इसका क्या अर्थ है

निर्णय लेने वाले मॉडल एक स्वतंत्र श्रेणी बनते जा रहे हैं, जिसमें कीमतों की होड़ और रैंकिंग भी है। एक ही दिन में, OpenAI अपनी Decisions API की कीमत प्रति दस लाख इनपुट टोकन 0,10 डॉलर तय करता है, और Perplexity अपनी कीमत घटाकर 0,02 डॉलर कर देता है, जो पाँच दिन पहले की तुलना में आधी है; दोनों में से कोई भी आउटपुट का शुल्क नहीं लेता। ये मॉडल पाठ नहीं लिखते, बल्कि चुनते हैं या अंक देते हैं: इन्हें पढ़ने के लिए भुगतान किया जाता है और इनसे तेज़ी की अपेक्षा की जाती है। OpenAI अपनी Responses API की तुलना में लगभग दस गुना तेज़ उत्तरों का वादा करता है। Decision Index 0.3 सामुदायिक निर्णायक की भूमिका निभाता है, और उसका नया निजी आधा हिस्सा परिचित बेंचमार्क पर सफलता के बजाय क्षमताओं को मापने के लिए बनाया गया है। उसके नतीजे पहले से ही मॉडल निर्माताओं के संचार को प्रभावित कर रहे हैं: Perplexity अपनी घोषणा में उनका हवाला देता है, हालांकि उसके मॉडल के विवरण में रैंकिंग से अलग स्कोर दिया गया है।

एआई कार्यालय के उपकरणों में अपनी जगह बना रहा है, न कि इसके उलट। Excel, PowerPoint और Word के बाद Claude, Google Docs, Sheets और Slides में आ रहा है, Slack के समूह संदेशों में शामिल हो रहा है, और GPT-6 मॉडल Atlassian के Rovo एजेंटों को संचालित करेंगे। इन एकीकरणों में सवाल अब केवल मॉडल की गुणवत्ता का नहीं, बल्कि नियंत्रण का भी है: हर बदलाव के लिए स्वीकृति लेने वाला मोड, Google की साझाकरण अनुमतियों का पालन करने वाले कनेक्टर, और मॉड्यूल पर लागू Enterprise नियंत्रण। यही सोच आज के एजेंट उपकरणों में भी दिखाई देती है, Antigravity में वापस लिए जा सकने वाले समीक्षा निर्णयों से लेकर ElevenAgents Architect में संस्करणों के साथ सहेजे गए मसौदों तक।

साइबर सुरक्षा में, सत्यापन के आधार पर पहुँच के स्तर तय होते हैं। Anthropic का CVP मॉडल को नहीं, बल्कि उसके सुरक्षा उपायों को बदलता है: CyScenarioBench पर, बिना सत्यापन के पहले ही प्रॉम्प्ट पर कार्यों को रोक देने वाला वही Opus 5.5, Red Team Access में 50 में से 34 कार्य सफलतापूर्वक पूरा करता है। Mistral एक दूसरा तर्क पेश करता है, ऐसे मॉडल का जो इनकार नहीं करता: वह एक साइबर परीक्षण में 82 % का दावा करता है, जिसे उसके अनुसार Claude Opus 5.5 और GPT-6 Astra देने से इनकार करते हैं। दोनों तरीकों में एक बात समान है: साइबर क्षमताओं तक सबसे व्यापक पहुँच पहले सत्यापित पेशेवरों को मिलती है, चाहे वे मॉडल के वेट प्रकाशित होने से पहले Mistral के साझेदार हों या Anthropic के कार्यक्रम के सदस्य।

मॉडल आकार के दोनों छोरों पर भी विस्तार कर रहे हैं। बड़े छोर पर Mistral Large 4 है, जिसके 1 000 अरब पैरामीटर हैं और जिसके वेट अक्टूबर के अंत तक जारी करने का वादा किया गया है; छोटे छोर पर EmbeddingGemma 2 है, जो फ़ोन पर लगभग 567 Mo RAM में समा जाता है, 3,35 अरब पैरामीटर वाला Tiny Aya L2-Thinker है, या 270 मिलियन पैरामीटर वाला Falcon-OCR-Arabic है, जो फ़िलहाल केवल प्रदर्शन के रूप में उपलब्ध है। हालांकि, आज के कई आँकड़े स्वयं निर्माताओं ने मापे हैं: Mistral के स्कोर, Black Forest Labs द्वारा दावा किया गया पहला स्थान, TII का अपना बेंचमार्क, Perplexity का मॉडल विवरण, OpenAI द्वारा अंक दिए गए Ironclad के कार्य या GitHub द्वारा घोषित मर्ज संबंधी सुधार। घोषणा के दिन अक्सर यही एकमात्र उपलब्ध माप होता है; स्वतंत्र मूल्यांकनों से इसकी पुष्टि करना उपयोगी होगा, और Mistral Large 4 के वेट प्रकाशित होने के बाद ठीक यही संभव हो सकेगा।


स्रोत