ai-powered-markdown-translatorgpt-6.1-sol का उपयोग करके फ़्रेंच से हिंदी में अनुवादित लेख।
शुक्रवार, 2 अक्टूबर को Meta ने गणित के छह शोधपत्र प्रकाशित किए, जिन्हें शोधकर्ताओं ने उसके Muse Spark मॉडल के साथ तैयार किया है; Meta के अनुसार, इनमें से पाँच अब तक अनसुलझे शोध प्रश्नों के उत्तर देते हैं। Anthropic ने Claude Frontier Academy के माध्यम से तैनाती के लिए 10 000 इंजीनियरों को प्रशिक्षित करने हेतु 100 मिलियन डॉलर देने की प्रतिबद्धता जताई और Claude Code 2.1.288 जारी किया, जबकि NVIDIA ने 4 999 डॉलर से शुरू होने वाले 64 Go के DGX Spark की घोषणा की। पिछले दिन की शाम की दो घोषणाएँ भी दिन की खबरों में शामिल हैं: Perplexity की Decisions API, जो सार्वजनिक रूप से उपलब्ध वज़नों वाले मॉडल के माध्यम से संभावनाओं में जवाब देती है, और Google का उपग्रह, जो उसकी पहली TPU को कक्षा में ले जा रहा है।
Meta ने Muse Spark के साथ लिखे गए गणित के छह शोधपत्र प्रकाशित किए, Ai2 ने AstaBrief सार्वजनिक किया, Google की एआई ने फ्लू का पूर्वानुमान लगाया
2 अक्टूबर — Meta ने अपने शोध ब्लॉग पर गणित के छह शोधपत्र प्रकाशित किए, जिन्हें शोधकर्ताओं ने उसके अपने मॉडल Muse Spark के साथ तैयार किया है। Meta के अनुसार, इनमें से पाँच अब तक अनसुलझे शोध प्रश्नों का उत्तर देते हैं, हालाँकि ब्लॉग लेख यह नहीं बताता कि कौन-सा शोधपत्र अपवाद है। गणितज्ञों ने पिछले कुछ महीनों में Muse Spark 1.1 और 1.2 के साथ Thinking मोड में, सीधे meta.ai के चैट इंटरफ़ेस में काम किया, और शोध के लिए कोई विशेष रूप से तैयार ढाँचा (custom research scaffold) इस्तेमाल नहीं किया।
Following gold-medal-level performance from our AI models across five competitions in mathematics, physics, and chemistry, we asked a harder question: can AI contribute when a problem is genuinely open and without an existing solution path?
🇮🇳 गणित, भौतिकी और रसायन विज्ञान की पाँच प्रतियोगिताओं में हमारे एआई मॉडलों के स्वर्ण पदक स्तर के प्रदर्शन के बाद, हमने एक अधिक कठिन सवाल पूछा: क्या एआई तब योगदान दे सकती है, जब कोई समस्या वास्तव में अनसुलझी हो और उसके समाधान तक पहुँचने का कोई रास्ता मौजूद न हो? — X पर @AIatMeta
बताई गई कार्यप्रक्रिया सख्त है: गणितज्ञों की एक टीम शोध का मार्गदर्शन करती है, दूसरा समूह काम की समीक्षा करता है, और प्रत्येक शोधपत्र बताता है कि कौन-से अंश मुख्यतः शोधकर्ताओं ने लिखे हैं और कौन-से एआई ने। अलग-अलग शोधपत्रों में मॉडल का योगदान बहुत भिन्न है, सहायक गणनाओं से लेकर पूरे खंड लिखने तक:
| गणित का क्षेत्र | Meta द्वारा घोषित परिणाम | Meta के अनुसार Muse Spark का योगदान |
|---|---|---|
| प्रायिकता | उच्च आयामों में यादृच्छिक गाउसी बिंदुओं से होकर गुजरने वाले दीर्घवृत्ताभ को फिट करने की सख्त सीमा | प्रमाण की रणनीतियाँ |
| अवकल समीकरण | क्रांतिक द्रव्यमान वाले द्विहर्मोनिक अरैखिक Schrödinger समीकरण के ऋणात्मक ऊर्जा वाले त्रिज्यीय हलों का परिमित समय में अनंत हो जाना, 2015 से अनसुलझा प्रश्न | गणनाएँ, तर्कों का परीक्षण, प्रमाण का संशोधन |
| समूह सिद्धांत | अर्ध-अबेलियन समूह आवश्यक रूप से मोनोमियल नहीं होता: M. Kida की परिकल्पना (2024) का 384 क्रम वाला प्रतिउदाहरण | GAP में लिखा गया खोज प्रोग्राम, जिसने प्रतिउदाहरण ढूँढ़ा |
| अनुकूलन | सटीक नियम जो बताता है कि चक्रों पर आधारित शिथिलीकरण कब मूल समस्या को समाहित करता है | प्रायिकता के आधार पर पुनर्सूत्रीकरण, प्रतिउदाहरण, प्रमाण की रणनीति |
| अंकगणितीय भौतिकी | p-adic स्ट्रिंग सिद्धांत का दो-बिंदु फलन एक ऊँचाई फलन के बराबर है, और यह Tate वक्र से कहीं अधिक व्यापक वक्रों के वर्ग पर लागू होता है | संभावित प्रमाण, तीन तकनीकी खंडों का लेखन |
| असाहचर्य बीजगणित | हल करने योग्य विकास बीजगणितों से संबंधित एक परिकल्पना का 3 आयाम वाला प्रतिउदाहरण | प्रतिउदाहरण और वैकल्पिक अभिलक्षण |
Meta स्वीकार करता है कि इनमें से तीन समस्याएँ अन्य जगहों पर भी हल की गई हैं: गाउसी सीमा पर अगस्त में प्रकाशित तीन शोध कार्य, एआई एजेंट Nilradical द्वारा 16 सितंबर को बताया गया Kida की परिकल्पना का एक प्रतिउदाहरण, और Hu तथा Wen द्वारा विकास बीजगणितों के प्रतिउदाहरण। Meta के अनुसार, उसके अपने परिणाम स्वतंत्र रूप से, अन्य तरीकों से प्राप्त किए गए। यह घोषणा OpenAI की उस घोषणा के बाद आई है, जिसमें उसने 21 सितंबर को कहा था कि एक आंतरिक मॉडल ने 100 से अधिक अनसुलझी समस्याएँ हल कर ली हैं; Meta आम जनता के लिए उपलब्ध मॉडल को बिना बदलाव के इस्तेमाल करने और एआई के योगदान के बारे में पारदर्शिता पर ज़ोर देता है, जबकि सभी प्रमाणों की जाँच, सुधार और पुनर्लेखन गणितज्ञों ने किया है।
🔗 शोध की अनसुलझी समस्याओं को मिलकर हल करना (Meta AI Research)
AstaBrief 8B: Ai2 ने संदर्भों सहित वैज्ञानिक रिपोर्ट लिखने वाला मॉडल सार्वजनिक किया
2 अक्टूबर — Ai2 ने AstaBrief 8B सार्वजनिक किया है, जो एक शोध प्रश्न और शोध साहित्य के अंशों को संदर्भों सहित वैज्ञानिक रिपोर्ट में बदलता है। अब यह विज्ञान के लिए Ai2 के एजेंट आधारित मंच Asta के « रिपोर्ट तैयार करें » फ़ंक्शन के Fast मोड को संचालित करता है, जबकि उसके साथ मौजूद Thinking मोड Claude से संचालित होता है। इसे तैयार करने का तरीका सरल है: Qwen3-8B पर ScholarQA पाइपलाइन से तैयार किए गए 47 000 उदाहरणों के साथ पर्यवेक्षित सूक्ष्म प्रशिक्षण (SFT), फिर लगभग 6 000 युग्मों पर प्राथमिकताओं का प्रत्यक्ष अनुकूलन (DPO), और इसमें पुनर्बलन अधिगम का इस्तेमाल नहीं किया गया। मॉडल विवरण के अनुसार Apache-2.0 लाइसेंस के तहत वज़न और प्रशिक्षण डेटा प्रकाशित किए गए हैं: कोई प्रयोगशाला इसे अपने हार्डवेयर पर चला सकती है।
मॉडल एक ही पास में अपनी रिपोर्ट लिखता है। Asta की पूरी पाइपलाइन में Fast मोड में एक रिपोर्ट तैयार होने में औसतन 51,1 सेकंड लगते हैं, जबकि Thinking मोड में 178,5 सेकंड, यानी यह लगभग 3,5 गुना तेज़ है। एक छोटे मानव मूल्यांकन अध्ययन में (14 प्रश्न, 3 शोधकर्ता), समग्र पसंद के मामले में DR Tulu आगे रहा, लेकिन तीन में से दो शोधकर्ताओं ने संदर्भों की सटीकता के लिए AstaBrief को पसंद किया। Ai2 स्पष्ट करता है कि अधिकांश प्रशिक्षण और मूल्यांकन 2025 में किए गए थे और मौजूदा मॉडलों के मुकाबले उन्हें दोबारा नहीं किया गया है।
🔗 AstaBrief का स्रोत सार्वजनिक करना (Ai2)
फ्लू: Google की एआई के साथ तैयार मॉडल CDC के FluSight मूल्यांकन में 39 मॉडलों में पहले स्थान पर
30 सितंबर — Google ने घोषणा की कि उसकी एआई के साथ तैयार फ्लू पूर्वानुमान मॉडल FluSight में 2025-2026 के मौसम का सर्वश्रेष्ठ मॉडल रहा। FluSight अमेरिका के रोग नियंत्रण और रोकथाम केंद्रों (CDC) की व्यवस्था है, जो अक्टूबर से मई तक हर सप्ताह अस्पताल में भर्ती होने वाले मरीजों के पूर्वानुमानों को एकत्र करती है। CDC की मौसम के अंत की रिपोर्ट इसकी पुष्टि करती है: 34 टीमों द्वारा प्रस्तुत 53 मॉडलों में से चुने गए 39 मॉडलों के बीच, व्यक्तिगत मॉडलों में Google_SAI-FluEns पहले स्थान पर है, जिसका सापेक्ष WIS 0,56 है (यह त्रुटि का स्कोर है: जितना कम, पूर्वानुमान उतना बेहतर), और उसके बाद 0,58 स्कोर वाले तीन मॉडल हैं, जिनमें OHT_JHU-nbxd भी शामिल है। FluSight का संयुक्त मॉडल, जिसे CDC सार्वजनिक जानकारी देने के लिए इस्तेमाल करता है, 7वें स्थान पर है।
ये पूर्वानुमान Empirical Research Assistance (ERA) के साथ विकसित किए गए हैं। यह Google का एक एआई उपकरण है, जो विभिन्न वैज्ञानिक क्षेत्रों के लिए अनुकूलन एल्गोरिदम तैयार करता है और विश्वसनीय परीक्षकों के लिए उपलब्ध है। संबंधित शोधपत्र एक स्वायत्त प्रणाली का वर्णन करता है, जो LLM द्वारा निर्देशित वृक्ष खोज के माध्यम से अपना पूर्वानुमान कोड लिखती, उसका मूल्यांकन करती और उसे बेहतर बनाती है; इसने COVID-19 और रेस्पिरेटरी सिंसिशियल वायरस (VRS) के लिए भी मॉडल तैयार किए हैं।
🔗 Google Research का ब्लॉग लेख · CDC की FluSight 2025-2026 रिपोर्ट
Perplexity ने Decisions API शुरू की और pplx-decider-v1-27b सार्वजनिक किया, llama.cpp निर्णय मॉडल उपलब्ध कराता है
1 अक्टूबर — Perplexity ने एक नई API, Decisions API, शुरू की है और उसे संचालित करने वाला मॉडल pplx-decider-v1-27b Apache 2.0 लाइसेंस के तहत प्रकाशित किया है। कंपनी के डेवलपर खाते @perplexitydevs ने शाम को इसकी घोषणा की। उत्तर लिखने के बजाय, यह निर्णय मॉडल (decision model) उत्तरों के एक निश्चित समूह पर प्रायिकता वितरण लौटाता है: यह पाठ, JSON या चित्र पढ़ता है, लेकिन उत्तर नहीं लिखता, कोड तैयार नहीं करता और अपने तर्क की व्याख्या नहीं करता।
तीन प्रकार के प्रश्नों की व्यवस्था है: noul हाँ की प्रायिकता लौटाता है, choice 1 से 255 विकल्पों में से चयन करता है और प्रत्येक की प्रायिकता के साथ एक विश्वास सूचकांक देता है, जबकि score सामग्री को अधिकतम 10 स्तरों वाले पैमाने पर रखता है। एक अनुरोध में एक ही सामग्री पर अधिकतम 128 प्रश्न पूछे जा सकते हैं और प्रश्नों सहित इनपुट 262 144 टोकन से कम होना चाहिए। शुल्क प्रति मिलियन इनपुट टोकन 0,04 डॉलर है, आउटपुट मुफ़्त है और प्रत्येक अनुरोध पर कोई अलग शुल्क नहीं लगता; हर संगठन अपनी योजना की परवाह किए बिना प्रति सेकंड 10 अनुरोध भेज सकता है। Perplexity का लक्ष्य वर्गीकरण, रूटिंग और मानदंडों के आधार पर अंक देना है: इसका संदर्भ उदाहरण (cookbook) सहायता टिकटों को छाँटता है, जहाँ Decisions API पहला निर्णय लेती है और Agent API उन मामलों को संभालती है जिन्हें आगे बढ़ाना पड़ता है।
मॉडल Qwen3.8-27B के सूक्ष्म प्रशिक्षण से तैयार किया गया है; Hugging Face पर उपलब्ध इसके वज़नों के लिए ऐसा CUDA GPU चाहिए जिसमें लगभग 49 Gio के साथ कामकाजी मेमोरी भी समा सके। इसका मॉडल विवरण ग्यारह बेंचमार्क पर इसकी तुलना एक अन्य निर्णय मॉडल Jev और इसके मूल मॉडल से करता है; pplx-decider-v1-27b के परिणाम Perplexity की API के माध्यम से मापे गए हैं:
| बेंचमार्क (सटीकता) | Jev का स्कोर | Qwen3.8-27B का स्कोर (मूल मॉडल) | pplx-decider-v1-27b का स्कोर |
|---|---|---|---|
| WinoGrande | 90,70 % | 73,10 % | 83,30 % |
| FinancialPhraseBank | 76,98 % | 75,68 % | 84,18 % |
| RAGTruth | 77,27 % | 61,53 % | 88,80 % |
| JudgeBench | 78,57 % | 68,86 % | 78,29 % |
| BBH | 94,27 % | 72,80 % | 82,80 % |
| JevBench public hard | 73,27 % | 72,28 % | 70,30 % |
| TabFact | 89,80 % | 78,60 % | 90,60 % |
| ContractNLI | 77,45 % | 80,78 % | 80,78 % |
| Circa | 84,60 % | 87,00 % | 89,20 % |
| Belebele | 95,00 % | 93,20 % | 94,00 % |
| TruthfulQA binary | 92,00 % | 82,80 % | 85,40 % |
| कुल (मॉडल विवरण के अनुसार) | 84,51 % | 74,76 % | 85,71 % |
घोषणा में प्रमुखता से दिखाई गई कुल परिणाम की पंक्ति में pplx-decider-v1-27b, Jev से आगे है, 85,71 % बनाम 84,51 %, लेकिन मॉडल विवरण यह नहीं बताता कि इस पंक्ति का हिसाब कैसे किया गया है। प्रकाशित तालिका के अनुसार, ग्यारह में से छह बेंचमार्क पर Jev आगे बना हुआ है, जिनमें BBH और WinoGrande शामिल हैं, और JevBench public hard पर Perplexity का मॉडल अपने मूल मॉडल से भी पीछे रह जाता है।
🔗 @perplexitydevs की घोषणा · Decisions API का दस्तावेज़ीकरण · Hugging Face पर pplx-decider-v1-27b
llama.cpp, Jev के साथ संगत /v1/systemone API के माध्यम से निर्णय मॉडल उपलब्ध कराता है
2 अक्टूबर — llama.cpp का सर्वर अब एक नए एंडपॉइंट, /v1/systemone, के माध्यम से निर्णय मॉडल उपलब्ध करा सकता है। यह PR संख्या 29818 के साथ आया, जिसे 2 अक्टूबर को मर्ज किया गया। Xuan-Son Nguyen और Victor Mustar द्वारा लिखे गए ggml-org के ब्लॉग लेख में इसका तरीका बताया गया है: एक स्थिति (पाठ, JSON, स्क्रीनशॉट) और निर्धारित प्रकार के प्रश्न, choice, score (2 से 10 स्तर) या noul (हाँ या नहीं), भेजे जाते हैं, और मॉडल एक ही पास में प्रत्येक विकल्प की प्रायिकता लौटाता है। API, TypeSafe के मॉडल Jev द्वारा पेश किए गए System One प्रारूप को अपनाती है: मौजूदा क्लाइंट को केवल अपना आधार URL बदलना होता है। एक राउटर मोड उसी सर्वर पर माँग के अनुसार कई मॉडल लोड करता है।
| समर्थित निर्णय मॉडल | मॉडल का आकार | मूल मॉडल | प्रति प्रश्न माध्यिका समय |
|---|---|---|---|
| Julia-1 (50 से अधिक भाषाएँ) | 144M | mmBERT-small | 3 ms |
| Laya | 421M | ModernBERT-large | 5 ms |
| Kev-4B | 4B | Qwen3.5-4B-Base | 12 ms |
| lev | 4B | Qwen3.5-4B | 36 ms |
| OpenJev (चित्र भी पढ़ता है) | 27B | Qwen3.8-27B | 43 ms |
ये समय NVIDIA RTX PRO 6000 पर मापे गए हैं। अगला घोषित मॉडल Clef है, जिसे Cloudflare ने 1 अक्टूबर को Jev की API के साथ संगत API के साथ पेश किया; ggml-org ने 2 अक्टूबर को Hugging Face पर Clef और Clef-flash के GGUF रिपॉज़िटरी बनाए।
🔗 llama.cpp में नया: निर्णय मॉडल
Anthropic ने Claude Frontier Academy शुरू की और 10 000 इंजीनियरों को प्रशिक्षण देने के लिए 100 मिलियन डॉलर की प्रतिबद्धता जताई
2 अक्टूबर — Anthropic ने Claude Frontier Academy शुरू की है, जो 100 मिलियन डॉलर की प्रतिबद्धता पर आधारित एक प्रशिक्षण कार्यक्रम है। इसका लक्ष्य 2027 के अंत तक 10 000 अग्रणी तैनाती इंजीनियरों (Frontier Deployed Engineers, FDE) को प्रशिक्षण देना है। शुरुआती समूहों में Accenture, Bain, Capgemini, Commonwealth Bank of Australia, Deloitte, McKinsey, Morgan Stanley और Novo Nordisk के इंजीनियर शामिल हैं।
पहला कार्यक्रम, Frontier Deployed Engineer Residency, चिकित्सकीय प्रशिक्षण के मॉडल पर आधारित है। कार्यक्रम के पृष्ठ के अनुसार, इसकी शुरुआत चार दिनों के गहन मॉड्यूल से होती है: तीन दिन प्रत्यक्ष रूप से एक काल्पनिक कंपनी के लिए Claude प्रणाली बनाने में बिताए जाते हैं, और फिर एक परीक्षा होती है, जिसमें प्राप्त अंकों के आधार पर Claude Resident Engineer बैज मिलता है। इसके बाद बारह सप्ताह की रेज़िडेंसी होती है, जिसमें प्रतिभागी अपने संगठन में Claude की तैनाती का नेतृत्व करते हैं, और फिर Claude Frontier Deployed Engineer बैज के लिए अंतिम मूल्यांकन होता है; पहले बैज 2027 की शुरुआत में मिलने की उम्मीद है।
प्रवेश अभी सीमित है: भागीदारी नामांकन के आधार पर होती है, शुरुआती पहुँच चुनिंदा ग्राहकों और साझेदारों के लिए आरक्षित है, और प्रशिक्षण समूह सैन फ़्रांसिस्को, न्यूयॉर्क और लंदन में होंगे। यह Academy, Claude Partner Network (46 000 कंपनियाँ, 175 000 से अधिक प्रमाणन) का विस्तार है, जिसे मार्च में 100 मिलियन डॉलर के साथ शुरू किया गया था; लेख यह नहीं बताता कि नई राशि उसके अतिरिक्त है या नहीं।
🔗 Anthropic की घोषणा · कार्यक्रम का पृष्ठ
एजेंट: Claude Code 2.1.288, Cursor में GLM 5.3, Replit, DeepSeek Harness और SWE-sweep बेंचमार्क
Claude Code 2.1.288 ने इंटरैक्टिव सत्रों में पृष्ठभूमि कमांड की समय सीमा हटाई
2 अक्टूबर — Claude Code 2.1.288 में 89 प्रविष्टियाँ हैं, जिनमें 64 सुधार शामिल हैं। सबसे स्पष्ट बदलाव पृष्ठभूमि में चलने वाली कमांड से जुड़ा है: 2.1.285 में लागू की गई समय सीमा (डिफ़ॉल्ट रूप से 30 मिनट, अधिकतम 2 घंटे) अब केवल बिना निगरानी वाले सत्रों (-p, Agent SDK, CI, क्लाउड) पर लागू होती है। टर्मिनल, डेस्कटॉप ऐप और VS Code में पृष्ठभूमि की कमांड फिर से बिना समय सीमा के चल सकती है।
Ctrl+C से गलती से मिटाए गए प्रॉम्प्ट को ऊपर वाले तीर से वापस पाया जा सकता है, /code-review अब --max-findings स्वीकार करता है ताकि कम या अधिक समस्याएँ दिखाई जा सकें, claude project purge अब claude purge बन गया है, और पिछले दिन शुरू किए गए मॉड को $.ui.selection() मिला है, जो पूर्ण स्क्रीन में चुना गया अंतिम पाठ लौटाता है। जब उत्तर के बीच में API की समय सीमा समाप्त हो जाती है, तो गैर-इंटरैक्टिव सत्र और उप-एजेंट विफल होने के बजाय आंशिक उत्तर से फिर शुरू होते हैं। सुरक्षा के मामले में, bash -c स्क्रिप्ट में छिपाया गया ख़तरनाक rm अब bypassPermissions मोड में पुष्टि के बिना नहीं चलता, और जिस PreToolUse या PermissionRequest हुक का मिलान विफल होता है, वह अब अनदेखा होने के बजाय कॉल को रोकता है। अंत में, क्लाइंट पर auto मोड का वर्गीकारक अब Sonnet 5.5 या Opus 5.5 निर्दिष्ट करने वाले ANTHROPIC_DEFAULT_SONNET_MODEL वेरिएबल को अनदेखा करता है और उसकी जगह Claude Sonnet 5 इस्तेमाल करता है।
रिलीज़ के छह मिनट बाद, @ClaudeDevs ने You should know को प्रमुखता से प्रस्तुत किया। यह एक अंतर्निहित मॉड है, जो प्रॉम्प्ट के ऊपर ऐसी जानकारी दिखाने के लिए एक सहायक एजेंट चलाता है जिसे छूटना नहीं चाहिए। यह पहले से ही 1 अक्टूबर को प्रस्तुत किए गए छह अंतर्निहित मॉड में शामिल था और डिफ़ॉल्ट रूप से निष्क्रिय है।
We’re adding a new plugin to Claude Code: You should Know. It scans Claude’s output for important information you might miss to help keep you in the loop. Enable it with: /plugin enable cc-plugin-you-should-know@builtin
🇮🇳 हम Claude Code में एक नया प्लगइन जोड़ रहे हैं: You should Know। यह Claude के आउटपुट में ऐसी महत्वपूर्ण जानकारी खोजता है जो आपसे छूट सकती है, ताकि आप अवगत रहें। इसे सक्रिय करें: /plugin enable cc-plugin-you-should-know@builtin — X पर @ClaudeDevs
🔗 Claude Code 2.1.288 के रिलीज़ नोट्स
GLM 5.3 और GLM 5.3 Flash अब Cursor में उपलब्ध हैं
1 अक्टूबर — Cursor ने Z.ai के खुले मॉडल GLM 5.3 और GLM 5.3 Flash को अपने मॉडल चयनकर्ता में जोड़ा है, और अपने बेंचमार्क पर खुले मॉडलों में GLM 5.3 Max के पहले स्थान पर होने का दावा किया है।
GLM 5.3 and GLM 5.3 Flash are now available in Cursor! GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0.
🇮🇳 GLM 5.3 और GLM 5.3 Flash अब Cursor में उपलब्ध हैं! GLM 5.3 Max, CursorBench 4.0 पर सबसे अधिक अंक पाने वाला खुले वज़न वाला मॉडल है। — X पर @cursor_ai
संलग्न ग्राफ़ मॉडलों को उनके CursorBench 4.0 स्कोर और प्रति कार्य औसत लागत के अनुसार दिखाता है, लेकिन केवल एक बिंदु पर लेबल है: GLM 5.3 का बिंदु, जिस पर « (max) » लिखा है और जिसका स्कोर 42,6 % तथा प्रति कार्य लागत 5,05 डॉलर है। इस ग्राफ़ के अनुसार, GLM 5.3 अभी भी Claude Opus 5.5, Claude Sonnet 5.5, Fable 5.1 और Grok 4.7 से नीचे है, इसमें कोई अन्य खुला मॉडल नहीं दिखाया गया है और GLM 5.3 Flash भी शामिल नहीं है। Cursor ने अपनी रैंकिंग के समर्थन में न कोई मूल्य सूची, न लेख, और न ही मूल्यांकन की विधि प्रकाशित की है।
Replit ने Agent में GPT-6.1 Sol और Claude Sonnet 5.5, तथा अपने AI Integrations में Jev उपलब्ध कराया
2 अक्टूबर — Replit के बदलाव विवरण में Replit Agent के लिए दो हालिया मॉडल विकल्प जोड़े गए हैं: Power मोड में Claude Sonnet 5.5 और Max मोड में GPT-6.1 Sol। इसी प्रविष्टि में Jev, वह निर्णय मॉडल जिसका पहले pplx-decider-v1-27b के मुकाबले उल्लेख किया गया था, Replit AI Integrations में उपलब्ध कराया गया है: कोई ऐप API कुंजी का प्रबंधन किए बिना तेज़ और संरचित निर्णयों के माध्यम से सामग्री का वर्गीकरण, अनुरोधों की रूटिंग या संभावित ग्राहकों का मूल्यांकन कर सकता है। दस्तावेज़ बताते हैं कि Jev को OpenRouter के माध्यम से jev-latest पहचानकर्ता के अंतर्गत उपलब्ध कराया जाता है। सेटिंग अब पूरे पृष्ठ में खुलती हैं, और Enterprise खाते पूरी कंपनी के लिए नियम तय कर सकते हैं, जिनमें प्रत्येक टीम (Workspace) के लिए अपवाद रखे जा सकते हैं। प्रविष्टि में कोई कीमत नहीं दी गई है।
🔗 2 अक्टूबर का Replit बदलाव विवरण
DeepSeek Harness अब macOS और Windows पर इंस्टॉल किया जा सकता है
30 सितंबर — @DeepSeekHarness खाते ने DeepSeek के ओपन सोर्स एजेंट हार्नेस, DeepSeek Harness, के macOS और Windows के लिए डेस्कटॉप संस्करण की घोषणा की। 2 अक्टूबर को मुख्य खाते @deepseek_ai ने घोषणा साझा की और स्पष्ट किया कि Linux उपयोगकर्ता npm पैकेज @deepseek-ai/dsh का इस्तेमाल करें। इंस्टॉलर DeepSeek की वेबसाइट से डाउनलोड किए जा सकते हैं: ARM चिप वाले macOS के लिए और Windows x64 के लिए।
PREVIEW के रूप में चिह्नित आधिकारिक पृष्ठ Harness को पूरी दुनिया में उपलब्ध सार्वजनिक पूर्वावलोकन संस्करण और ओपन सोर्स के रूप में प्रस्तुत करता है। यह Cordis फ़्रेमवर्क की «हर चीज़ एक प्लगइन है» (हर चीज़ एक प्लगइन है) संरचना पर आधारित है और कार्यालय के काम (फ़ाइलें, डेटा, दस्तावेज़, प्रस्तुतियाँ), कोड, स्रोत उद्धरणों सहित शोध और पृष्ठभूमि कार्यों को संभालता है। इसमें Creator मोड भी है, जो बातचीत के माध्यम से नए प्लगइन लिखवाता है। नवीनता वितरण में है: 29 सितंबर के पूर्वावलोकन संस्करण में dsh कमांड पहले से ही डेस्कटॉप ऐप में शामिल थी, और GitHub पर अभी तक कोई स्थिर संस्करण प्रकाशित नहीं हुआ है।
🔗 @deepseek_ai की घोषणा · DeepSeek Harness का पृष्ठ
SWE-sweep: ऐसा बेंचमार्क जहाँ एजेंटों को सुधारने योग्य बग स्वयं खोजने होते हैं
1 अक्टूबर — Meta Superintelligence Labs के शोधकर्ताओं ने Harvard, वॉशिंगटन विश्वविद्यालय और Stanford के साथ मिलकर SWE-sweep उपलब्ध कराया है। यह बेंचमार्क कोडिंग एजेंटों से वास्तविक रिपॉज़िटरी में बग स्वयं खोजने और अधिकतम संभव बग ठीक करने को कहता है, बिना उनकी प्रकृति या स्थान के बारे में कोई संकेत दिए। डेटासेट में 100 रिपॉज़िटरी और 4 068 बग शामिल हैं; MIT लाइसेंस के अंतर्गत उपलब्ध कोड Harbor फ़्रेमवर्क पर आधारित है, और ओफिर प्रेस तथा जॉन यांग इसके लेखकों में शामिल हैं। 1 अक्टूबर को बनाई गई रिपॉज़िटरी के साथ अभी तक कोई घोषणा नहीं की गई है।
24 सितंबर को अपडेट की गई और mini-SWE-agent से मापी गई रैंकिंग इस काम की कठिनाई दिखाती है:
| रैंकिंग में स्थान | मूल्यांकित मॉडल | ठीक किए गए बग | कुल लागत |
|---|---|---|---|
| 1 | Sol 5.6 (xhigh), OpenAI | 4,7 % | 7 230 dollars |
| 2 | Luna 5.6 (xhigh), OpenAI | 2,5 % | 224 dollars |
| 3 | Terra 5.6 (xhigh), OpenAI | 1,5 % | 357 dollars |
| 4 | Luna 5.6 (high), OpenAI | 1,4 % | 28 dollars |
| 5 | Opus 5 (xhigh), Anthropic | 1,3 % | 5 363 dollars |
कंप्यूटिंग और हार्डवेयर: पहली TPU कक्षा में, DGX Spark 64 Go, Ascend 950 पर DeepGEMM और DeepEP
Project Suncatcher: Google का प्रोटोटाइप उपग्रह उसकी पहली TPU को कक्षा में ले गया
1 अक्टूबर — कक्षा में अपने पहले परीक्षण की घोषणा करने के एक सप्ताह बाद, Google ने Project Suncatcher का प्रोटोटाइप उपग्रह लॉन्च किया है। यह एक दीर्घकालिक शोध परियोजना (महत्त्वाकांक्षी दीर्घकालिक परियोजना) है, जो यह पता लगाने की कोशिश करती है कि क्या अंतरिक्ष कभी बड़े पैमाने के मशीन लर्निंग बुनियादी ढाँचे की मेज़बानी कर सकता है। Planet के साथ मिलकर बनाया गया उपग्रह SpaceX की साझा प्रक्षेपण मिशन Transporter-18 से कक्षा में पहुँचा; Google के ट्रैविस बील्स के अनुसार, टीम ने संपर्क स्थापित कर लिया है और उपग्रह अपेक्षा के अनुसार काम कर रहा है।
अगले कुछ सप्ताहों में Google मापेगा कि उसकी TPU अंतरिक्ष उड़ान के दबावों और विकिरण तथा तापमान की चरम स्थितियों को कैसे सहती हैं; पृथ्वी पर Trillium TPU पहले ही पाँच वर्ष के मिशन से मिलने वाली मात्रा से अधिक विकिरण सह चुकी थीं। शोध का विस्तार से वर्णन करने वाला सहकर्मी-समीक्षित लेख Joule पत्रिका में प्रकाशित हो रहा है। 2 अक्टूबर को प्रक्षेपण की खबर साझा करते हुए @GoogleAI ने परियोजना का तर्क दोहराया: पृथ्वी की निचली कक्षा में सूर्य का प्रकाश लगभग निरंतर मिलता है और उपग्रह पृथ्वी की तुलना में 8 गुना तक अधिक सौर ऊर्जा पैदा कर सकते हैं। घोषित अगला चरण: लेज़र लिंक का परीक्षण करने के लिए 2027 में दो उपग्रह।
🔗 Project Suncatcher का प्रोटोटाइप कक्षा में है · Joule में प्रकाशित लेख · @GoogleAI द्वारा साझा की गई खबर
DGX Spark 64 Go: NVIDIA ने 23 अक्टूबर से बिक्री के लिए एक नया कॉन्फ़िगरेशन जोड़ा
2 अक्टूबर — NVIDIA ने अपने DGX Spark में 128 Go मॉडल के साथ 64 Go एकीकृत मेमोरी वाला कॉन्फ़िगरेशन जोड़ा है। यह केवल छह साझेदार निर्माताओं, Acer, ASUS, Dell, Gigabyte, HP और MSI, के माध्यम से शुक्रवार 23 अक्टूबर से 4 999 डॉलर की शुरुआती कीमत पर बेचा जाएगा; लेख में 128 Go मॉडल की मौजूदा कीमत नहीं दी गई है। मूल आधार वही है: GB10 Grace Blackwell चिप, DGX OS और NVIDIA AI सॉफ़्टवेयर स्टैक, ताकि मशीन पर 100 अरब पैरामीटर तक के मॉडल चलाए जा सकें।
मुख्य आकर्षण क्लस्टर बनाना है: ConnectX-7 नेटवर्क कार्ड पर QSFP केबल से जुड़ी दो इकाइयाँ अपनी मेमोरी साझा करती हैं।
| तकनीकी विशेषता | एक DGX Spark 64 Go | क्लस्टर में दो DGX Spark 64 Go |
|---|---|---|
| एकीकृत मेमोरी | 64 Go | साझा 128 Go |
| घोषित मॉडल आकार | 100 अरब पैरामीटर तक | 200 अरब पैरामीटर तक |
| Qwen 3.8 27B पर प्रदर्शन (NVIDIA परीक्षण) | आधार मान | 1,7 गुना तक |
NVIDIA Sync ऐप Cluster Assistant के माध्यम से यह काम संभालता है, जो इकाइयों का पता लगाता है और नेटवर्क सेट करता है। महीने के अंत के लिए घोषित NVIDIA Sync Model Launcher, Qwen3.8 27B को एक मशीन या क्लस्टर पर डाउनलोड करके चलाएगा और उसके इस्तेमाल के लिए OpenCode कॉन्फ़िगर करेगा।
🔗 DGX Spark 64 Go पर NVIDIA का लेख
DeepSeek ने DeepGEMM और DeepEP को Huawei के Ascend 950 NPU पर पोर्ट किया
29 और 30 सितंबर — DeepSeek ने बिना घोषणा किए GitHub पर अपनी कंप्यूटिंग लाइब्रेरी के Huawei के Ascend NPU के लिए दो पोर्ट प्रकाशित किए हैं। DeepGEMM-Ascend, जिसके README में पहली रिलीज़ की तारीख 30 सितंबर दी गई है, DeepGEMM के API को हूबहू अपनाता है: Ascend 950 श्रृंखला के लिए MIT लाइसेंस के अंतर्गत BF16, FP8 और FP4 में मैट्रिक्स गुणन, MQA लॉजिट्स और MegaMoE। DeepEP-Ascend, MoE मॉडलों के विशेषज्ञ समानांतरवाद (expert parallelism) की संचार लाइब्रेरी को पोर्ट करता है, जिसमें वितरण (dispatch) और पुनर्संयोजन (combine) के all-to-all ऑपरेशन शामिल हैं।
Ascend 950DT पर DeepEP-Ascend ने 8 रैंक के साथ 373 से 375 Go/s और 128 रैंक के साथ 313 से 320 Go/s की वितरण गति मापी है; 32 रैंक तक यह बैंडविड्थ की भौतिक सीमा के लगभग 90 से 95 % तक पहुँचता है। ये आँकड़े DeepSeek को दिए गए अवधारणा प्रमाण वाले हार्डवेयर किट (HDK) और मैन्युअल कॉन्फ़िगरेशन से प्राप्त किए गए हैं, जिन्हें सार्वजनिक रूप से वितरित नहीं किया गया है; README वाणिज्यिक संस्करण की ओर निर्देशित करता है, जिसकी उपलब्धता Huawei लगभग 15 अक्टूबर के लिए तय कर रहा है।
🔗 GitHub पर DeepGEMM-Ascend · GitHub पर DeepEP-Ascend
आवाज़ और ऑडियो: Suno Speech बीटा में, ElevenLabs को FedRAMP 20x Class A प्रमाणन
Suno Speech एक ही ट्रैक में बोलती आवाज़ और पृष्ठभूमि संगीत बनाता है
1 अक्टूबर — Suno ने Speech को बीटा में उपलब्ध कराया है। यह सुविधा सीधे Suno में मौलिक पृष्ठभूमि संगीत के साथ बोली गई आवाज़ वाला ऑडियो बनाती है: कोई विचार, कविता या पाठ दर्ज किया जाता है, फिर इच्छित आवाज़ और संगीत शैली का वर्णन किया जाता है। Suno, Speech को पहला ऐसा ऑडियो मॉडल बताता है जो आवाज़ और संगीत को एक साथ, एक ही सुसंगत ट्रैक में बनाता है। एक छोटे उपयोगकर्ता समूह के साथ एक महीने तक परीक्षण के बाद, ऐप अपडेट करने पर यह सुविधा अब सभी के लिए उपलब्ध है।
उत्पाद निदेशक जैक ब्रॉडी द्वारा लिखे गए लेख में मुख्य रूप से व्यक्तिगत उपयोग बताए गए हैं: दोस्तों के संदेशों को नाटकीय पाठ में बदलना, वॉइस नोट्स को संगीत देना, ध्यान या सोते समय सुनाई जाने वाली कहानियाँ। Suno चेतावनी देता है कि बीटा अभी अपूर्ण है: ब्रिटिश लहजा ऑस्ट्रेलियाई लहजे में बदल सकता है और नाटकीय विराम बहुत ज़्यादा लंबे हो सकते हैं। कीमत, सदस्यता योजना या समर्थित भाषाओं का कोई विवरण नहीं दिया गया है।
ElevenAgents और वॉइस API के लिए ElevenLabs को FedRAMP 20x Class A प्रमाणन मिला
1 अक्टूबर — ElevenLabs को FedRAMP 20x Class A प्रमाणन मिला है। इस ढाँचे के माध्यम से अमेरिकी संघीय एजेंसियाँ तय करती हैं कि किसी क्लाउड उत्पाद को सरकारी डेटा के साथ सुरक्षित रूप से इस्तेमाल किया जा सकता है या नहीं। यह ElevenAgents तथा Text to Speech और Speech to Text API को शामिल करता है, बशर्ते वे Zero Retention Mode में चलें और डेटा संयुक्त राज्य अमेरिका में रखा जाए। इससे ElevenLabs for Government की पेशकश का विस्तार होता है और कंपनी अब FedRAMP Marketplace में सूचीबद्ध है। ElevenLabs द्वारा उद्धृत FedRAMP के अनुसार, Class A स्तर एजेंसियों के अधिकांश गैर-संवेदनशील उपयोगों के लिए पर्याप्त है; ElevenLabs ने लाभों के लिए आवेदन, परमिट, कर और सुनवाई के प्रतिलेखन का उल्लेख किया है।
ElevenLabs ने अपनी घोषणा के समर्थन में सार्वजनिक क्षेत्र की मौजूदा तैनातियों का हवाला दिया है:
| उद्धृत सार्वजनिक क्षेत्र की तैनाती | ElevenLabs द्वारा घोषित आँकड़ा |
|---|---|
| राष्ट्रीय रोजगार हेल्पलाइन (यूक्रेन) | 25 % वार्तालाप एजेंटों द्वारा संभाले गए |
| लाभ और रोजगार हेल्पलाइन (चेकिया) | प्रतिदिन लगभग 5 000 कॉल में से 85 % का समाधान |
| मिडलैंड शहर | प्रति माह 7 000 कम छूटे हुए कॉल (अनुमान) |
ChatGPT अमेरिका में Free और Go उपयोगकर्ताओं के लिए Finances उपलब्ध कराता है
2 अक्टूबर — व्यक्तिगत वित्त के लिए ChatGPT का समर्पित क्षेत्र Finances अब अमेरिका में Free और Go योजनाओं तक विस्तारित हो रहा है, और वेब, iOS तथा Android पर उपलब्ध है। यह सुविधा पहले से Plus और Pro ग्राहकों के लिए मौजूद थी: मई में केवल Pro ग्राहकों के लिए पूर्वावलोकन के रूप में शुरू होने के बाद, इसमें 21 सितंबर को Plus और Pro ग्राहकों के लिए Experian क्रेडिट स्कोर की निगरानी जोड़ी गई थी। अब यह Free, Go, Plus और Pro योजनाओं में उपलब्ध है, लेकिन अभी भी केवल अमेरिका में।
इसका तरीका वही है: बैंक और निवेश खातों को Plaid के ज़रिए, और क्रेडिट रिपोर्ट को Experian के ज़रिए जोड़ा जाता है; इन दोनों कनेक्शन का इस्तेमाल साथ या अलग-अलग किया जा सकता है। Finances पृष्ठ पर खर्च, बिल, सदस्यताएँ, शुद्ध संपत्ति, निवेश और क्रेडिट स्कोर एक जगह दिखते हैं। बातचीत के दौरान ChatGPT खर्चों को श्रेणियों में बाँटता है, सदस्यताओं की पहचान करता है, महीने की तुलना हालिया रुझानों से करता है और करों के लिए जानकारी व्यवस्थित करके जाँचने योग्य विकल्प सुझाता है, जैसे कर कटौतियाँ।
🔗 ChatGPT के संस्करण विवरण · ChatGPT में Finances
SpaceXAI ने अपना आधिकारिक TypeScript SDK प्रायोगिक संस्करण में जारी किया
2 अक्टूबर — SpaceXAI ने बिना घोषणा किए अपने आधिकारिक TypeScript SDK का पहला सार्वजनिक संस्करण जारी किया। संस्करण 0.1.0, 16 बजकर 57 मिनट UTC पर आया, जिसके बाद 18 बजकर 25 मिनट UTC पर संस्करण 0.2.0 जारी हुआ, जो क्लाइंट क्लास xAI का नाम बदलकर SpaceXAI करता है: यह संगतता तोड़ने वाला बदलाव है, जो कोड को कंपनी के नए नाम के अनुरूप बनाता है। SDK में पहले से Responses API (स्ट्रीमिंग, संपीड़न और कई चरणों वाली बातचीत), प्लेटफ़ॉर्म के अंतर्निहित उपकरण (वेब खोज और X खोज, कोड चलाना, दूरस्थ MCP सर्वर), चित्रों और वीडियो का निर्माण तथा संपादन, और Files, Batch तथा Voice API शामिल हैं।
| SDK का घटक | दर्ज विवरण |
|---|---|
| npm पैकेज | @xai-official/sdk |
| लाइसेंस | Apache-2.0 |
| आवश्यकताएँ | Node.js 22.13 या उससे नया, ESM प्रोजेक्ट, कोई रनटाइम निर्भरता नहीं |
| स्थिति | प्रायोगिक, 1.0 से पहले इंटरफ़ेस स्थिर नहीं हैं |
डिफ़ॉल्ट रूप से SDK किसी ब्राउज़र या Worker में चलने से इनकार करता है, ताकि क्लाइंट की ओर गुप्त कुंजी उजागर न हो। इस तरह TypeScript डेवलपरों को आधिकारिक Python SDK के समकक्ष एक विकल्प मिल गया है, जिसका संस्करण 1.20.0, 24 सितंबर को जारी हुआ था।
🔗 SpaceXAI के TypeScript SDK का बदलाव विवरण · npm पर @xai-official/sdk पैकेज
संक्षिप्त समाचार
- v0 में GPT-6.1 Sol — 29 सितंबर को, मॉडल जारी होने के दिन, Vercel के ऐप बनाने वाले उपकरण v0 ने GPT-6.1 Sol उपलब्ध कराया, ChatGPT सदस्यता से जुड़ने की सुविधा स्वीकार करने के कुछ ही घंटे बाद; घोषणा में न कीमत दी गई है, न v0 से संबंधित कोई मापन। 🔗 स्रोत
- Grok Build में एजेंटों का नया डैशबोर्ड — 1 अक्टूबर को घोषित यह डैशबोर्ड
/dashboardके साथ सभी एजेंटों को एक ही स्क्रीन पर दिखाता है, कार्यों को समानांतर चलाता है और Ctrl+W से किसी एजेंट को उसके अपने git worktree में रखता है; Grok Build को पहला डैशबोर्ड 15 जून को मिला था। 🔗 स्रोत - Gemini CLI का नाइटली संस्करण — 2 अक्टूबर के v0.64.0-nightly में केवल आठ सुधार हैं: Ctrl+C फिर से किसी चल रही कार्रवाई को रद्द करता है, और
~/.gemini/state.jsonस्थिति एक अविभाज्य कार्रवाई के रूप में लिखी जाती है, जिसमें डेटा दूषित होने पर.bakबैकअप बहाल किया जाता है; स्थिर और पूर्वावलोकन संस्करणों में कोई बदलाव नहीं हुआ है। 🔗 स्रोत - GitHub Copilot से हटाए गए मॉडल — 3 सितंबर की घोषणा के अनुसार, Gemini 3.5 Flash, Gemini 3.6 Flash, Kimi K2.7 Code और Claude Opus 4.7 सभी Copilot अनुभवों से हट रहे हैं; GitHub, Gemini 3.8 Flash, Kimi K3 और अब Claude Opus 5 के बजाय Claude Opus 5.5 सुझाता है। 🔗 स्रोत
- SKILL.md की जाँच — एक सामुदायिक लेख में गोल्डा मैनुएल ने यह जाँचने का तरीका सुझाया है कि कोई कौशल कोड लिखने वाले एजेंटों को मिलता है, लोड होता है और उपयोगी है या नहीं, लेकिन कोई मापन प्रकाशित नहीं किया है: Claude Code या Codex द्वारा अपेक्षित स्थान, अनुरोध के तीन स्तरों पर सक्रियण, और आठ मापदंडों पर कौशल के साथ तथा उसके बिना तुलना। 🔗 स्रोत
- Manus ने Video Editor और Game Dev का विवरण दिया — 1 अक्टूबर के दो लेख Manus 2.0 को और विस्तार से बताते हैं: Manus Studio में Video Editor किसी वीडियो के हर तत्व को उसकी अपनी ट्रैक पर रखता है (125 क्लिप को 195 कट के साथ 10 मिनट 50 सेकंड की फ़िल्म में संपादित किया गया), और Game Dev किसी गेम को चलते हुए समायोजित करता है; न कीमत बताई गई है, न तारीख। 🔗 Video Editor · 🔗 Game Dev
- ServiceNow का AutoSynthData — ServiceNow की CoreAI टीम किसी मॉडल की विफलताओं से सत्यापित प्रशिक्षण कार्य तैयार करती है: EnterpriseOps Gym पर Gemma-4-26B-A4B-it, Hybrid क्षेत्र में Pass@1 पर 7,2 अंक बढ़ाता है और ITSM में 18,77 % से 27,18 % तक पहुँचता है; न कोड प्रकाशित हुआ है, न डेटा। 🔗 स्रोत
- POCKET-Darwin-180B — VIDRAFT ने Darwin-180B-RSI का 111 जीबी वाला 4-बिट GGUF संस्करण प्रकाशित किया है (360 जीबी के मुकाबले), जो 180 अरब पैरामीटर वाला MoE है: लेखकों के अनुसार, केवल प्रोसेसर पर 18,4 से 21 टोकन प्रति सेकंड, 8 जीबी वाली RTX 5060 के लैपटॉप पर 4,17, और MMLU-Pro पर मूल मॉडल के समान 87,65 %। 🔗 स्रोत
- GPT-6 मॉडलों की मार्गदर्शिका — OpenAI ने स्टार्टअप के लिए एक मार्गदर्शिका प्रकाशित की है: सबसे कठिन तर्क कार्यों के लिए GPT-6 Astra, जटिल कोड, शोध और कंप्यूटर के इस्तेमाल के लिए GPT-6.1 Sol, तथा बड़े पैमाने पर लक्षित कार्यों के लिए GPT-6 Luna; मॉडल के अनुसार कैश किए गए टोकन की लागत 95 % तक कम होती है। 🔗 स्रोत
- ChatGPT, iOS पर कैमरे से कई पृष्ठों को एक ही PDF में स्कैन करता है — 1 अक्टूबर से चरणबद्ध रूप से उपलब्ध कराया जा रहा है।
- Chatham Financial और Codex — पूँजी बाज़ारों की इस परामर्श कंपनी ने Codex के साथ लेन-देन सत्यापित करने वाला ऐप बनाया है: शुरुआती मापनों के अनुसार, जाँच में लगने वाला समय लगभग 30 मिनट से घटकर 4 मिनट से कम हो गया है; इसका Onyx प्लेटफ़ॉर्म GPT-5.6 Sol और Terra, GPT-5.4 तथा GPT-4.1 को जोड़ता है। 🔗 स्रोत
- The Den और ChatGPT Work — OpenAI के 1 अक्टूबर के एक अध्ययन के अनुसार, डेनवर में माता-पिता के लिए बने इस क्लब की नेतृत्व टीम Gmail, Slack और Google Drive से जुड़े ChatGPT Work की मदद से प्रति सप्ताह 10 से 15 घंटे बचाती है; अनुदान का आवेदन 3 दिन के बजाय 2 घंटे में तैयार हो जाता है। 🔗 स्रोत
- Blackwell पर GPT-6 Astra Ultrafast — NVIDIA ने 1 अक्टूबर को स्पष्ट किया कि OpenAI द्वारा 29 सितंबर को शुरू किया गया GPT-6 Astra का Ultrafast स्तर उसके Blackwell GPU पर चलता है, जो Astra Standard मोड से 8 गुना तक तेज़ है, और OpenAI अपने मॉडलों की मदद से अपने अनुमान सॉफ़्टवेयर को अनुकूलित करता है; कोई नया आँकड़ा नहीं दिया गया। 🔗 स्रोत
- CoreWeave में RL Rollouts — 30 सितंबर को CoreWeave Forge के साथ प्रस्तुत और 2 अक्टूबर को NVIDIA द्वारा साझा की गई यह सेवा NVIDIA Dynamo पर बनी है और रीइन्फोर्समेंट पोस्ट-ट्रेनिंग के दौरान नए चेकपॉइंट बिना रोके लोड करती है; Nemotron 3.5 Lightning पर मॉडल दोबारा लोड करने की विलंबता में 15 गुना सुधार हुआ है। 🔗 स्रोत
- ElevenReader में Eleven v4 — ElevenLabs का सबसे अभिव्यंजक वॉइस मॉडल, जो 28 सितंबर को जारी हुआ था, अब उसके पढ़ने वाले ऐप में आ रहा है: iOS, Android और वेब पर 90 से अधिक भाषाओं में चुनी हुई आवाज़ में लेख, ई-पुस्तकें और PDF। 🔗 स्रोत
- Midjourney के अल्फ़ा संस्करण का बदलाव विवरण — 1 अक्टूबर के इस विवरण में मुख्य रूप से सुधार हैं, जिनमें हर फ़ोल्डर के लिए प्रॉम्प्ट पैरामीटर याद रखना और शैली संदर्भों को एक बैज में समेटना शामिल है; अगले सप्ताह के लिए नए सहयोगी उपकरणों की घोषणा की गई है। 🔗 स्रोत
- Ramp Router में आधी कीमत पर Grok 4.7 — 6 अक्टूबर तक LLM गेटवे Ramp Router, Grok 4.7 पर 50 % छूट दे रहा है; इस पेशकश को SpaceXAI ने साझा किया है; SpaceXAI की API पर इस मॉडल के प्रति दस लाख टोकन के लिए इनपुट की कीमत 2 डॉलर और आउटपुट की कीमत 6 डॉलर है। 🔗 स्रोत
- सुरक्षा परामर्शों पर गोपनीय टिप्पणियाँ — GitHub किसी रिपॉज़िटरी के सुरक्षा परामर्श पर ऐसी टिप्पणी करने देता है जिसे रिपोर्ट करने वाला व्यक्ति नहीं देख सकता: केवल लिखने की अनुमति वाले लोग इन टिप्पणियों को पढ़ सकते हैं, और इन्हें देखे जाने का रिकॉर्ड रखा जाता है; टिप्पणियों की एक REST API सार्वजनिक पूर्वावलोकन में आ रही है। 🔗 स्रोत · 🔗 REST API
- GitHub Advisory Database की GraphQL API — SecurityAdvisory ऑब्जेक्ट में पाँच नए फ़ील्ड जुड़ते हैं, जिनमें CVE पहचानकर्ता और NVD द्वारा प्रकाशन की तारीख शामिल हैं, और securityAdvisories क्वेरी में गंभीरता तथा वापस लिए जाने की स्थिति के आधार पर दो फ़िल्टर जुड़ते हैं: अब REST API का दोबारा इस्तेमाल करने की ज़रूरत नहीं है। 🔗 स्रोत
- GitHub Actions में macOS 14 इमेज का अंत — 1 अक्टूबर की घोषणा के अनुसार, इसे 2 नवंबर को हटाया जाएगा, जिससे पहले अक्टूबर में 14 बजे से मध्यरात्रि UTC तक आठ निर्धारित व्यवधान होंगे; वर्कफ़्लो को macos-15 या macos-latest पर जाना होगा, जो macos-26 की ओर संकेत करता है। 🔗 स्रोत
- उद्यमों में एआई की परिपक्वता — Perplexity ने एक मार्गदर्शिका प्रकाशित की है, जो परिपक्वता के चार चरण बताती है, Gartner, Deloitte और Google Cloud के ढाँचों का सार देती है और स्व-मूल्यांकन की एक तालिका प्रस्तुत करती है; इसमें उद्धृत McKinsey के 2026 के सर्वेक्षण के अनुसार, 80 % उत्तरदाताओं को व्यक्तिगत उत्पादकता में लाभ दिखता है, लेकिन केवल 37 % को EBIT में योगदान दिखता है। 🔗 स्रोत
इसका क्या अर्थ है
विज्ञान में इस्तेमाल होने वाली एआई का मूल्यांकन लगातार ऐसे मानदंडों पर हो रहा है, जो उसकी घोषणा करने वालों से स्वतंत्र हैं। Meta केवल नतीजे गिनाने तक सीमित नहीं है: हर शोधपत्र बताता है कि एआई ने कौन से अंश लिखे हैं, गणितज्ञों का दूसरा समूह उन्हें दोबारा पढ़ता है, और लेख स्वीकार करता है कि तीन समस्याएँ अन्य जगहों पर भी हल की गई हैं। Google की एआई के साथ तैयार किए गए फ़्लू पूर्वानुमान मॉडल की उपयोगिता का आधार CDC का वह मूल्यांकन है, जो पूरे एक मौसम में 38 अन्य मॉडलों के मुकाबले किया गया। Ai2 ने AstaBrief के वेट और डेटा प्रकाशित किए हैं, लेकिन चेतावनी दी है कि उसकी तुलनाएँ 2025 की हैं: खुले मॉडल की जाँच की जा सकती है, जबकि मूल्यांकन पुराना पड़ता जाता है।
निर्णय मॉडल कुछ ही दिनों में अपने आप में एक पूरी श्रेणी बनते जा रहे हैं। Jev, Liquid AI के d1 और Cloudflare के Clef के बाद, Perplexity इनपुट टोकन के आधार पर शुल्क लेने वाली API और अपने मॉडल के वेट, दोनों उपलब्ध कराता है; llama.cpp इन्हीं मॉडलों को उसी System One प्रारूप में स्थानीय रूप से चलाता है, और Replit ने Jev को API कुंजी के बिना इस्तेमाल होने वाले अपने एकीकरणों में शामिल किया है। किसी डेवलपर के लिए इसका लाभ ठोस है: हर विकल्प की संभावना एक ही बार मॉडल चलाने पर मिल जाती है, उस लिखित उत्तर के बजाय जिसका बाद में विश्लेषण करना पड़ता है। तुलनाओं में सावधानी चाहिए: विवरण पत्र की समग्र नतीजों वाली पंक्ति में pplx-decider-v1-27b, Jev से आगे है, लेकिन प्रकाशित विवरण ग्यारह में से छह बेंचमार्क पर Jev को बढ़त देता है।
कोड लिखने वाले एजेंटों की प्रगति उनकी वास्तविक स्वायत्तता से तेज़ है। SWE-sweep पर किसी रिपॉज़िटरी के सामने अकेला छोड़ दिए जाने पर सबसे अच्छा मॉडल भी 7 000 डॉलर से अधिक की लागत पर केवल 4,7 % बग खोजकर ठीक कर पाता है। Claude Code 2.1.288 की 89 प्रविष्टियों में अधिकांश सुधारों से जुड़ी हैं, जिनमें API के टाइमआउट के बाद काम फिर शुरू करना और अनुमति के कई नियमों को सख़्त करना शामिल है, और यह मुख्य एजेंट के काम की निगरानी करने वाले एक मॉड को प्रमुखता देता है। Anthropic दूसरी बाधा, मानव कौशल, पर काम कर रहा है और ऐसे इंजीनियरों को प्रशिक्षित करने के लिए 100 मिलियन डॉलर दे रहा है जो किसी तैनाती को उत्पादन परिवेश तक पहुँचा सकें। खुले मॉडल भी उपकरणों में अपनी जगह बना रहे हैं, जैसे Cursor में GLM 5.3 और डेस्कटॉप पर DeepSeek Harness।
अंत में, गणना के हार्डवेयर में तीन दिशाओं में विविधता आ रही है। Google कक्षा में ऐसे TPU का परीक्षण कर रहा है, जो एक दिन पृथ्वी की तुलना में 8 गुना तक अधिक सौर ऊर्जा का लाभ उठा सकते हैं, NVIDIA अपने DGX Spark में 64 जीबी का एक कॉन्फ़िगरेशन जोड़ रहा है, जिसकी दो इकाइयों को जोड़कर 200 अरब पैरामीटर तक पहुँचा जा सके, और DeepSeek अपनी निम्न-स्तरीय लाइब्रेरी को उसी API के साथ Huawei की Ascend चिप पर इस्तेमाल करने योग्य बना रहा है। हर एक अपने तरीके से उन जगहों और उपकरणों का दायरा बढ़ाता है, जहाँ और जिन पर मॉडल चल सकते हैं।
स्रोत
- शोध की अनसुलझी समस्याओं को मिलकर हल करना (Meta AI Research)
- छह शोधपत्रों पर @AIatMeta की पोस्ट शृंखला
- AstaBrief को ओपन सोर्स बनाना (Ai2)
- फ़्लू के पूर्वानुमानों पर Google Research का लेख
- CDC की FluSight 2025-2026 रिपोर्ट
- @perplexitydevs द्वारा Decisions API की घोषणा
- Decisions API का दस्तावेज़ीकरण
- Hugging Face पर pplx-decider-v1-27b
- llama.cpp में नया: निर्णय मॉडल (ggml-org)
- Claude Frontier Academy (Anthropic)
- Claude Frontier Academy कार्यक्रम का पृष्ठ
- Claude Code 2.1.288 के संस्करण विवरण
- @ClaudeDevs ने “आपको यह जानना चाहिए” को प्रमुखता दी
- Cursor में GLM 5.3, @cursor_ai की घोषणा
- Replit का 2 अक्टूबर का बदलाव विवरण
- @deepseek_ai द्वारा DeepSeek Harness की जानकारी साझा करना
- DeepSeek Harness का पृष्ठ
- SWE-sweep
- Project Suncatcher का प्रोटोटाइप कक्षा में है (Google)
- Joule में Project Suncatcher का लेख
- @GoogleAI द्वारा प्रक्षेपण की जानकारी साझा करना
- DGX Spark 64 जीबी (NVIDIA का ब्लॉग)
- GitHub पर DeepGEMM-Ascend
- GitHub पर DeepEP-Ascend
- Speech का परिचय (Suno)
- ElevenLabs को FedRAMP 20x Class A प्रमाणन मिला
- ChatGPT के संस्करण विवरण
- ChatGPT में Finances (OpenAI सहायता केंद्र)
- SpaceXAI के TypeScript SDK का बदलाव विवरण
- npm पर @xai-official/sdk पैकेज
- v0 में GPT-6.1 Sol (@v0)
- Grok Build का एजेंट डैशबोर्ड (@grok)
- Gemini CLI का 2 अक्टूबर का नाइटली v0.64.0 संस्करण
- GitHub Copilot के अप्रचलित मॉडल
- क्या आपका SKILL.md कोड लिखने वाले एजेंटों की मदद करता है?
- Manus का Video Editor
- Manus का Game Dev
- AutoSynthData (ServiceNow)
- POCKET-Darwin-180B (VIDRAFT)
- GPT-6 परिवार के मॉडलों की एक मार्गदर्शिका (OpenAI)
- Chatham Financial और OpenAI
- The Den और ChatGPT Work
- Blackwell पर GPT-6 Astra Ultrafast (NVIDIA का ब्लॉग)
- CoreWeave Forge का परिचय
- ElevenReader में Eleven v4 (@ElevenLabs)
- Midjourney के अल्फ़ा संस्करण का 1 अक्टूबर का बदलाव विवरण
- Ramp Router में Grok 4.7 (@SpaceXAI)
- सुरक्षा परामर्शों पर गोपनीय टिप्पणियाँ (GitHub)
- सुरक्षा परामर्शों की टिप्पणियों की REST API (GitHub)
- GraphQL API के SecurityAdvisory के नए फ़ील्ड (GitHub)
- GitHub Actions से macOS 14 इमेज हटाना
- एआई की परिपक्वता पर Perplexity की मार्गदर्शिका