खोजें

Meta ने अपना Muse एजेंट लॉन्च किया, Mistral ने Series D में 3 अरब यूरो जुटाए, OpenAI एजेंटों ने Navier-Stokes पर एक प्रमाण प्रकाशित किया

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Meta ने अपना Muse एजेंट लॉन्च किया, Mistral ने Series D में 3 अरब यूरो जुटाए, OpenAI एजेंटों ने Navier-Stokes पर एक प्रमाण प्रकाशित किया

ai-powered-markdown-translator

लेख का fr से hi में अनुवाद gpt-5.6-sol के साथ किया गया।

GitHub पर प्रोजेक्ट देखें ↗

Meta ने Muse लॉन्च किया है, एक निजी एजेंट जो प्रत्येक उपयोगकर्ता को cloud में उसकी अपनी Linux मशीन देता है, और उसी दिन उसने इससे जुड़ी सुरक्षा संरचना भी प्रकाशित की, जिसमें सभी के लिए खुला 300,000 डॉलर तक का भेद्यता पुरस्कार कार्यक्रम (bug bounty) शामिल है। Mistral ने 3 अरब यूरो की Series D की घोषणा की, जो किसी यूरोपीय तकनीकी कंपनी द्वारा अब तक पूरा किया गया सबसे बड़ा इक्विटी वित्तपोषण दौर है। दूसरी ओर, OpenAI ने Navier-Stokes समीकरणों के लिए सीमित समय में singularity का प्रमाण प्रकाशित किया, जिसे एजेंटों की एक प्रणाली ने तैयार किया है, और Google DeepMind ने मानव DNA में संभावित 9 अरब उत्परिवर्तनों के प्रभाव की पूर्व-गणना की है।


Meta ने अपना निजी एजेंट Muse लॉन्च किया और उसकी सुरक्षा संरचना प्रकाशित की

8 सितंबर — Meta ने Muse लॉन्च किया है, जो iOS और Android अनुप्रयोगों, web interface और WhatsApp में उपलब्ध एक निजी एजेंट है तथा Muse Spark 1.3 द्वारा संचालित है। मॉडल नया नहीं है: यह 2 सितंबर को Muse Code और Meta Model API में आया था, और इसका अधिकतम reasoning स्तर 4 सितंबर को सार्वजनिक किया गया था। नया वह आम उपभोक्ताओं के लिए बनाया गया उत्पाद है जो इसके इर्द-गिर्द निर्मित है।

इस संरचना का आधार एक ऐसा विचार है जिसे कहना सरल, लेकिन लागू करना कठिन है: प्रत्येक उपयोगकर्ता को cloud में उसका अपना computer मिलता है। Muse Secure VM एक स्थायी और पृथक Linux मशीन है, जिसमें file system, terminal और पूर्ण browser के साथ इतना storage, processor और memory है कि code compile किया जा सके, मनचाही skills विकसित की जा सकें और कई sub-agents समानांतर चलाए जा सकें। यही मशीन, न कि Meta का कोई केंद्रीकृत infrastructure, जुड़े हुए services के data और credentials के लिए संदर्भ प्रणाली का काम करती है। जब किसी कार्य के लिए कोई tool उपलब्ध नहीं होता, तो एजेंट उसे स्वयं लिखता है, और text blocks के बजाय ऐसे objects तैयार करता है जिन्हें उपयोगकर्ता संशोधित कर सकता है: यात्रा-योजनाएँ, PDF, web pages और dashboards, जिन्हें Meta Artifacts कहता है।

दूसरा घोषित बड़ा बदलाव यह है कि application बंद होने पर भी एजेंट background में, निर्धारित कार्यक्रम के अनुसार और घटनाओं की प्रतिक्रिया में काम करता है, फिर स्वयं तय करता है कि परिणाम notification भेजने योग्य है या नहीं। memory स्थायी है तथा उपयोगकर्ता उसे पढ़ और संशोधित कर सकता है, जबकि Objectives नामक tab एजेंट द्वारा देखी जा रही सभी चीज़ों का समग्र दृश्य देता है। जो बात Meta नहीं बताता, वह यह है कि कोई मूल्य प्रकाशित नहीं किया गया है और लॉन्च के साथ उपलब्धता वाले देशों की कोई सूची भी नहीं दी गई है।

उत्पाद की घोषणा के बीस मिनट बाद, Meta ने इस व्यवस्था की सुरक्षा पर Meta Superintelligence Labs के software engineer और vice president Tarek Sheasha द्वारा हस्ताक्षरित एक engineering दस्तावेज़ प्रकाशित किया। मार्गदर्शक सिद्धांत शुरुआत में ही स्पष्ट कर दिया गया है: प्रणाली को इस धारणा के साथ बनाया गया है कि एजेंट पर हमला होगा। code में Hatch कहलाने वाला agentic harness एक systemd-nspawn container में चलता है, जिसका root host के एक गैर-विशेषाधिकार प्राप्त उपयोगकर्ता से mapped है, system calls filtered हैं और kernel capabilities हटा दी गई हैं। चार services को जानबूझकर इस container से बाहर रखा गया है, ताकि एजेंट को compromise करने वाला हमलावर उन्हें निष्क्रिय न कर सके: सुरक्षा classifiers, अलग privileges वाले workers, credentials storage daemon और Sentinel।

Sentinel इसका केंद्रीय घटक है: connector action या network egress को अधिकृत करने में सक्षम एकमात्र प्राधिकरण होने के नाते, यह layers 4 और 7 पर प्रत्येक request का मूल्यांकन करता है और वास्तव में resolve हुए address की जाँच करता है। सबसे महत्वपूर्ण बात यह है कि एजेंट केवल substitution tokens का उपयोग करता है, जिन्हें network boundary पर वास्तविक credentials से बदल दिया जाता है। prompt injection के माध्यम से एजेंट से कोई secret उगलवाना निरर्थक हो जाता है, क्योंकि वह secret उसके पास कभी था ही नहीं। इसके साथ kernel स्तर पर flow tracking भी जुड़ी है, जिसे tainted egress कहा गया है: उपयोगकर्ता का data पढ़ने वाली प्रत्येक process को चिह्नित कर दिया जाता है और वह अपना automatic authorization खो देती है। implementation में cgroups से जुड़े eBPF programs और Meta द्वारा जोड़े गए Linux Security Module hooks का संयोजन किया गया है।

संरचना का घटकचुना गया विकल्प
agentic harness का containersystemd-nspawn, root को गैर-विशेषाधिकार प्राप्त उपयोगकर्ता से mapped किया गया
authorization प्राधिकरणSentinel, container के बाहर, layers 4 और 7
एजेंट को दिखाई देने वाले credentialsकेवल substitution tokens
email connectorone-time codes और reset links की filtering
browser sub-agentaccessibility tree, raw DOM नहीं, page में JavaScript नहीं
भुगतानलॉन्च के समय Stripe Link, बाद में Shop Pay, single-use card
bug bounty, प्रति वैध report अधिकतम300,000 डॉलर
bug bounty, prompt injection130,000 डॉलर तक

दस्तावेज़ के साथ दो घोषणाएँ की गई हैं। भेद्यता पुरस्कार कार्यक्रम लॉन्च के समय से ही सभी के लिए खुला है, जिसमें प्रमाणित प्रभाव के आधार पर प्रति वैध report 300,000 डॉलर तक और किसी उपयोगकर्ता को प्रभावित करने वाले सफल prompt injection के लिए 130,000 डॉलर तक दिए जाएँगे। वहीं, वर्ष के अंत तक आने वाली Muse Confidential VM का उद्देश्य cryptographic और सत्यापन योग्य तरीके से Meta को किसी virtual machine के data तक पहुँचने से रोकना है; इसकी design और source code पहले ही बाहरी auditors को सौंपे जा चुके हैं। लेख का निष्कर्ष किसी कंपनी के प्रकाशन के लिए असामान्य रूप से स्पष्ट है: prompt injection उद्योग में अब भी एक अनसुलझी समस्या है, और Muse गलतियाँ करेगा।

🔗 Muse का लॉन्च · 🔗 एजेंटों की सुरक्षा और संरक्षा, Meta


Mistral ने 3 अरब यूरो जुटाए, यूरोपीय तकनीकी क्षेत्र का सबसे बड़ा इक्विटी वित्तपोषण दौर

8 सितंबर — Mistral ने 3 अरब यूरो की Series D की घोषणा की है, जिसमें post-money valuation 21 अरब यूरो से अधिक है। कंपनी अपनी स्थापना के केवल तीन वर्ष बाद हुए इस दौर को किसी यूरोपीय तकनीकी कंपनी द्वारा अब तक पूरा किया गया सबसे बड़ा इक्विटी वित्तपोषण बताती है।

Samsung Electronics इस सौदे का नेतृत्व कर रहा है। EQT द्वारा प्रबंधित Scaleup Europe Fund और पहले से शेयरधारक PSG Equity इसके सह-नेता हैं। तीन नए निवेशक इसमें शामिल हुए हैं: Advent, BlackRock द्वारा प्रबंधित funds और accounts, तथा Grand Duchy of Luxembourg। मौजूदा निवेशकों की सूची लंबी है और तीन महाद्वीपों तक फैली है, जिसमें a16z से Salesforce Ventures तक और ASML, BNP Paribas CIB, Bpifrance, DST Global, General Catalyst, Index Ventures, Korelya Capital, Lightspeed तथा NVIDIA शामिल हैं।

ध्यान देने योग्य विवरण लगातार हुए दोनों दौरों के प्रमुख निवेशकों की प्रकृति है। Series C का नेतृत्व ASML ने किया था और Series D का नेतृत्व Samsung Electronics कर रहा है: दोनों advanced manufacturing की औद्योगिक कंपनियाँ हैं, न कि सामान्य तकनीकी funds। Mistral इसे जटिल औद्योगिक परिवेशों में अत्याधुनिक models तैनात करने की अपनी क्षमता पर भरोसे का संकेत मानता है, जहाँ data और infrastructure पर नियंत्रण ही अपनाए जाने की शर्त तय करता है।

संकेतकमान
जुटाई गई राशि3 अरब यूरो
post-money valuation21 अरब यूरो से अधिक
कंपनी की आयु3 वर्ष
प्रमुख निवेशकSamsung Electronics
सह-प्रमुख निवेशकEQT द्वारा प्रबंधित Scaleup Europe Fund, PSG Equity
संचालन वाले देश20
बड़े corporate ग्राहक125 से अधिक, जिनमें Airbus, ASML और HSBC शामिल हैं

धन के उपयोग में कंपनी सबसे पहले frontier research, फिर training के लिए computing capacity बढ़ाने, infrastructure के विस्तार और अंतरराष्ट्रीय व्यावसायिक तेजी का उल्लेख करती है। इसका तर्क गर्मियों से अपनाए गए रुख को दोहराता है: संगठनों के सामने अब यह प्रश्न नहीं होगा कि सबसे शक्तिशाली model कौन बनाता है, बल्कि यह होगा कि अपने infrastructure का नियंत्रण छोड़े बिना AI का उपयोग कैसे किया जाए। Mistral स्वयं को इस क्षेत्र की एकमात्र ऐसी कंपनी बताता है जो आवश्यक पूरी stack को जोड़ती है—open-weight models से लेकर products और computing capacity तक।

Today marks a major step for Mistral: we’re announcing a €3B Series D, the largest equity round ever raised by a European tech company, just three years after launch.

🇮🇳 आज Mistral के लिए एक महत्वपूर्ण उपलब्धि का दिन है: हम 3 अरब यूरो की Series D की घोषणा कर रहे हैं, जो हमारे लॉन्च के केवल तीन वर्ष बाद किसी यूरोपीय तकनीकी कंपनी द्वारा अब तक पूरा किया गया सबसे बड़ा इक्विटी वित्तपोषण दौर है।X पर @MistralAI

🔗 Mistral की घोषणा


OpenAI के वैज्ञानिक एजेंट: Navier-Stokes पर एक प्रमाण, MIT में calibrate किए गए qubits

8 सितंबर — OpenAI ने त्रि-आयामी Navier-Stokes समीकरणों के लिए सीमित समय में singularity बनने का प्रमाण प्रकाशित किया है, जिसके साथ Lean proof assistant में उसका formalization भी दिया गया है। घोषित परिणाम यह है कि शुरू में smooth और स्थिर कोई त्रि-आयामी fluid, जब किसी smooth बाहरी force के अधीन हो, तो सीमित समय में उसकी velocity असीमित रूप से बढ़ सकती है, जबकि viscosity गति को smooth करने की ओर प्रवृत्त रहती है और system की energy सीमित बनी रहती है। Clay Mathematics Institute के आधिकारिक formulation में यह “C” और “D” statements के अनुरूप है, जो regularity का प्रमाण नहीं बल्कि उसका खंडन प्रस्तुत करते हैं।

OpenAI क्या दावा करता है और क्या दावा नहीं करता, इसे सटीक रूप से स्पष्ट करना आवश्यक है। यह प्रमाण सार्वजनिक नाम से रहित एक internal model से जुड़े समन्वित agents की प्रणाली ने तैयार किया है। कंपनी इसे GPT-6 Astra से उल्लेखनीय रूप से अधिक सक्षम बताती है और इसका training 28 अगस्त से जारी है। वर्णित एकमात्र verification Lean में formalization है, जिसे GPT-6 Astra को सौंपा गया और समाधान मिलने के 17 घंटे बाद पूरा किया गया। घोषणा में न तो किसी peer review का उल्लेख है, न ही Clay Mathematics Institute द्वारा validation का। OpenAI का कहना है कि वह millennium prize का दावा करने का इरादा नहीं रखता और अपने परिणाम को अंतिम उपलब्धि के बजाय एक तत्कालीन झलक के रूप में प्रस्तुत करता है।

इसकी विधि कम से कम परिणाम जितनी ही उल्लेखनीय है। यह प्रयास 1 सितंबर को शुरू हुआ, जब अफवाहें फैली थीं कि millennium की दो समस्याएँ अभी-अभी हल कर ली गई हैं। अलग-अलग agent groups को statement के अलग variants दिए गए: “A” और “B” versions को प्रमाण की दिशा में तथा “C” और “D” versions को खंडन की दिशा में लगाया गया। एक सहायक समस्या, बिना बाहरी force वाले Euler समीकरणों की regularity, पर लगभग 100 agents ने करीब पचास घंटे में एक खंडन तैयार किया; इस परिणाम को Navier-Stokes पर काम कर रहे agents के prompts में फिर से शामिल किया गया।

metricमान
concurrent agents, Navier-Stokes groupलगभग 10,000
समाधान मिलने तक का समयलगभग 88 घंटे
Lean में formalization और verificationGPT-6 Astra के माध्यम से 17 अतिरिक्त घंटे
आदान-प्रदान किए गए messages, Navier-Stokes2.7 मिलियन
output tokens, Navier-Stokesलगभग 130 अरब
आदान-प्रदान किए गए messages, सभी आजमाई गई समस्याएँ4.9 मिलियन
output tokens, सभी आजमाई गई समस्याएँलगभग 300 अरब
बिना बाहरी force वाले Euler की regularity का खंडनलगभग 100 agents, करीब 50 घंटे

समानांतर हुए एक अन्य शोध से तस्वीर जटिल हो जाती है। Anthropic के कर्मचारी Levent Alpöge और NYU में गणित के professor Tristan Buckmaster के पास बाहरी force वाले Euler समीकरणों पर एक परिणाम था। OpenAI ने अपना project पूरा और verify करने के बाद 6 सितंबर को संयुक्त प्रकाशन का प्रस्ताव देने और उनकी प्राथमिकता स्वीकार करने के लिए उनसे संपर्क किया, लेकिन बाद में पता चला कि उनका परिणाम OpenAI के statement से अलग statement पर आधारित था।

This model represents a step-function improvement on many benchmarks, and its training is ongoing. Our internal model group arrived at the Navier–Stokes solution in 88 hours, using around 10,000 coordinating AI agents. Throughout the effort, we maintained the strict safeguards—including monitoring and isolation—that we apply to all our frontier evaluations.

🇮🇳 यह model कई benchmarks पर चरणबद्ध रूप से बड़ा सुधार दर्शाता है, और इसका training जारी है। हमारा internal model group लगभग 10,000 समन्वित AI agents के साथ 88 घंटों में Navier-Stokes के समाधान तक पहुँचा। पूरे प्रयास के दौरान हमने monitoring और isolation सहित वे कड़े safeguards बनाए रखे जिन्हें हम frontier models के अपने सभी evaluations पर लागू करते हैं।X पर @OpenAI

उसी दिन OpenAI ने कहीं अधिक सीमित और कहीं अधिक सत्यापन योग्य case study प्रकाशित की। MIT के Engineering Quantum Systems group की PhD छात्रा Beatriz Yankelevich ने GPT-5.6 Sol द्वारा संचालित Codex को उसके experiments समन्वित करने वाले software से जोड़कर छह uncalibrated superconducting qubits वाली chip को calibrate किया। agents को प्रत्येक measurement type के लिए अलग skills दी गईं, जिनमें measurement करने और उसका मूल्यांकन करने का तरीका बताया गया था। स्पष्ट signals पर Codex ने बहुत कम हस्तक्षेप के साथ पूरी sequence पूरी की: transition frequencies की पहचान, control और readout pulses का calibration तथा quantum information के संरक्षण की अवधि का measurement। कमजोर या noisy signals पर उपयोगी parameters खोजने में इसे अधिक समय लगता है और कभी-कभी यह किसी अनुभवी researcher की निगाह की माँग करता है, जो model से तेज रहता है। इसलिए लाभ गति नहीं, बल्कि निरंतर supervision की आवश्यकता समाप्त होना है: ऐसी एक standard chip के characterization में किसी researcher के कई दिन लगते हैं, और group अब routine measurements agents को सौंपता है।

🔗 Navier-Stokes समाधान, OpenAI · 🔗 Codex और quantum experiments, OpenAI


ChatGPT Images 2.5, Sketch और API में दो इमेज मॉडल के साथ

8 सितंबर — OpenAI ने अपने उत्पादों और API में ChatGPT Images 2.5 लॉन्च किया। शुरुआत में दिया गया उपयोग का आँकड़ा इसके महत्व को दर्शाता है: ChatGPT Images और API के GPT-Image मॉडल पर हर सप्ताह 3 अरब से अधिक इमेज बनाई जाती हैं। सबसे ठोस सुधार विलंबता में है, जो Images 2.0 की तुलना में 50 प्रतिशत तक कम हुई है; अन्य सुधार संदर्भ फ़ोटो के प्रति निष्ठा और लंबी बातचीत के दौरान निरंतरता से जुड़े हैं, जिसमें पहले किए गए बदलाव बेहतर ढंग से संरक्षित रहते हैं।

ChatGPT में तीन सुविधाएँ आ रही हैं। Sketch से « @Sketch » टाइप करके सीधे बातचीत में चित्र बनाया जा सकता है, जो दृश्य मार्गदर्शक का काम करता है। templates में पोस्टर या merchandising जैसे सामान्य प्रारूप शामिल हैं। किसी विशेष हिस्से में बदलाव करने के लिए इमेज पर टिप्पणियाँ जोड़ी जा सकती हैं। अब इमेज साझा करते समय उसे बनाने वाला prompt भी शामिल किया जा सकता है। यह सुविधा desktop, mobile और web पर सभी स्तरों के ChatGPT उपयोगकर्ताओं, ChatGPT Work और Codex के लिए उपलब्ध कराई जा रही है।

API में मॉडलघोषित उपयोग-स्थितिविलंबता
GPT-Image-2.5 Flareडिफ़ॉल्ट विकल्प, सामाजिक सामग्री, बड़े पैमाने पर निर्माणImages 2.0 से 50 प्रतिशत तक कम
GPT-Image-2.5 Sunburstसटीकता, प्रसारण के लिए तैयार अभियाननिर्माण में अधिक समय

दोनों मॉडल गुणवत्ता की नई सेटिंग्स xhigh और max का समर्थन करते हैं और GPT Image 2 की token कीमतें अपनाते हैं: Standard स्तर पर प्रति दस लाख image input tokens के लिए 8.00 डॉलर, image output के लिए 30.00 डॉलर और text input के लिए 5.00 डॉलर। C2PA metadata और अदृश्य watermark बरकरार रखे गए हैं तथा रिलीज़ के साथ एक system card भी दी गई है।

🔗 ChatGPT Images 2.5, OpenAI

Manus ने उसी दिन मॉडल को एकीकृत किया

घोषणा वाली शाम Manus ने GPT-Image-2.5 को अपने प्लेटफ़ॉर्म में जोड़ा और डेढ़ घंटे पहले प्रकाशित OpenAI के संदेश का उल्लेख किया। 1 सितंबर को फिर से स्वतंत्र हुई इस agent प्रयोगशाला ने अपने स्वयं के मूल्यांकन से निकला आँकड़ा प्रस्तुत किया है, न कि OpenAI के मूल्यांकन से: उसके अनुसार Flare नाम वाला मॉडल GPT-Image-2 की तुलना में दो से चार गुना तेज़ गति से उच्च-गुणवत्ता वाली इमेज बनाता है। बातचीत के दौरान लगातार दृश्य सामग्री बनाने वाले agent के लिए यह कारक गुणवत्ता में मामूली सुधार से अधिक महत्वपूर्ण है, क्योंकि इसी से तय होता है कि निर्माण कार्यप्रवाह में बना रहेगा या प्रतीक्षा करनी पड़ेगी। Manus ने पारदर्शी background के बेहतर निर्माण को भी प्रमुखता दी है, जिससे पूर्ण automation को बाधित करने वाला हाथ से विषय काटकर अलग करने का चरण समाप्त हो जाता है।

🔗 Manus एकीकरण


AlphaGenome Atlas, मानव DNA के 9 अरब mutations का पूर्वानुमान मानचित्र

8 सितंबर — Google DeepMind ने AlphaGenome Atlas लॉन्च किया, जो मानव DNA में एक अक्षर के हर संभव mutation के आणविक प्रभाव का पूर्वानुमान लगाने वाला database है। मानव genome में लगभग 3 अरब base pairs हैं, जिनमें केवल 2 प्रतिशत protein को code करते हैं; शेष 98 प्रतिशत अब भी काफी हद तक अन्वेषित हैं, जबकि वहाँ केवल एक अक्षर का बदलाव भी किसी आवश्यक जैविक regulator को निष्क्रिय कर सकता है।

इस पद्धति का आधार गणनात्मक भार को उलटना है। हर प्रयोगशाला को model से एक-एक variant के बारे में पूछने देने के बजाय Google DeepMind ने सभी 9 अरब संभावित substitutions के लिए AlphaGenome model के पूर्वानुमान पहले ही गणना कर लिए हैं। इसका परिणाम 1 petabyte का dataset है, जिसे AlphaFold Database के आकार से तीस गुना अधिक बताया गया है। इस मात्रा को उपयोगी बनाने के लिए Atlas ने AVI score (AlphaGenome Variant Impact) प्रस्तुत किया है। यह एकल संख्या coding और non-coding क्षेत्रों के पूर्वानुमानों को समेकित करके बताती है कि कोई variant किन जैविक प्रक्रियाओं को बाधित करता है और प्रत्येक विशेषता के अनुसार उसका योगदान भी दर्शाती है। इसके साथ 2,500 से अधिक बार दोहराए जाने वाले sequence motifs की सूची भी है—वे regulatory units जिन्हें Google genome के « शब्द » कहता है।

मापदंडमान
पहले से गणना किए गए variants9 अरब, एक अक्षर के सभी बदलाव
dataset का आकार1 petabyte, AlphaFold Database से 30 गुना से अधिक
सूचीबद्ध sequence motifs2,500 से अधिक
विश्लेषित UK Biobank प्रतिभागी54,000 से अधिक
अतिरिक्त non-coding associations22 प्रतिशत अधिक
BMI से जुड़े पहचाने गए genetic regions19

दस्तावेज़ित किए गए दो उपयोग इस लाभ का पैमाना दिखाते हैं। Broad Institute में Laura Covill और उनकी टीम ने निदान से वंचित दुर्लभ रोगों के संभावित variants को प्राथमिकता देने के लिए AVI score का उपयोग किया। उपकरण ने DNM1 gene के एक variant को प्रमुखता दी और पूर्वानुमान लगाया कि वह एक गलत splicing site बनाता है, जिससे मामले को हल करने वाला निर्णायक प्रमाण मिला। University of Exeter में Gareth Hawkes ने Atlas को UK Biobank के 54,000 से अधिक प्रतिभागियों के data पर लागू किया और 22 प्रतिशत अधिक non-coding genetic associations प्राप्त किए। इसके बाद सबसे अधिक प्रभाव डालने वाले 1 प्रतिशत variants तक सीमित रहकर उन्होंने body mass index से जुड़े 19 genetic regions पहचाने।

पहुँच इसका दूसरा उल्लेखनीय पहलू है। Atlas बिना code लिखे उपयोग किए जा सकने वाले web portal के माध्यम से उपलब्ध है, जो programming न करने वाले चिकित्सकों और जीवविज्ञानियों के लिए बनाया गया है। यह AlphaGenome API, Model Garden के माध्यम से Cloud पर और GitHub पर प्रकाशित research data के रूप में भी उपलब्ध है। Google के agent ecosystem पर नज़र रखने वाले developers के लिए एक खास बात यह है कि Atlas को Google Antigravity में एक skill के रूप में भी वितरित किया गया है, इसलिए coding agent इसका सीधे उपयोग कर सकता है।

🔗 AlphaGenome Atlas, Google DeepMind


NVIDIA ने CUDA Rust लॉन्च किया और Cosmos ने ECCV का AI City Challenge जीता

8 सितंबर — NVIDIA ने CUDA Rust जारी किया, जो एक स्पष्ट होती कमी का उसका उत्तर है: AI की systems layer तेजी से Rust में लिखी जा रही है, लेकिन GPU kernel इसका अपवाद बना हुआ था। Rust से kernel पहले भी चलाया जा सकता था, लेकिन उसे कहीं और लिखना पड़ता था। CUDA Rust, Rust kernels को मूल रूप से PTX में compile करके इस अंतर को समाप्त करता है। इसके लिए दो अलग मार्ग हैं, जो CUDA द्वारा C++ और Python में पहले से उपलब्ध दो programming models के अनुरूप हैं।

घटकcuda-oxide, SIMT मार्गcutile-rs, Tile मार्ग
परिपक्वताशुरुआती alphacrates.io पर प्रकाशित
आवश्यक Rust toolchainनिश्चित nightly (nightly-2026-04-03)stable 1.89 या अधिक
CUDA version12.x या अधिक13.3
आवश्यक LLVMहाँ, साथ में clang और libclangनहीं
compilationbuild के समय PTX मेंCUDA Tile IR के माध्यम से JIT
उल्लिखित बाहरी उपयोगकोई नहींHugging Face का Grout, mistral.rs

NVIDIA की सिफारिश स्पष्ट है: Tile से शुरुआत करें, क्योंकि तब source code में किसी architecture-विशिष्ट विकल्प को दर्ज नहीं करना पड़ता, और threads तथा memory पर सूक्ष्म नियंत्रण आवश्यक होने पर SIMT पर जाएँ। फिलहाल इस चुनाव की एक कीमत है, क्योंकि SIMT में तेज़ kernels की नींव shared memory के लिए अभी भी unsafe आवश्यक है। मूल तर्क compile-time memory safety है: दोनों मार्ग उस पारंपरिक aliasing को अस्वीकार करते हैं जिसमें एक buffer input और output दोनों के रूप में काम करता है—SIMT की ओर error[E0502] और Tile की ओर error[E0382] के साथ। परिपक्वता के मामले में NVIDIA बढ़ा-चढ़ाकर दावा नहीं करता: दोनों में से कोई भी project production के लिए तैयार नहीं है, और घोषित प्रतिबद्धता 2027 तथा उसके आगे तक की है, जिसमें rust-cuda के maintainers के साथ संयुक्त कार्य शामिल है।

उसी दिन NVIDIA ने ECCV 2026 के AI City Challenge के परिणाम जारी किए। यातायात दृश्यों के generative video forecasting को समर्पित track 5 में शीर्ष पाँच में से चार solutions Cosmos world foundation models के versions का उपयोग करते हैं। Qyn टीम ने CosmosAlign के साथ सार्वजनिक ranking जीती। यह 16 अरब parameters वाले स्थिर Cosmos3-Nano model को दो-चरणीय LoRA विधि से अनुकूलित करता है, चार पूर्वानुमान बनाता है, medoid चुनता है और देखे गए इतिहास के स्थिर क्षेत्रों को फिर शामिल करता है: SSUPER टीम के 76.04 के मुकाबले 76.39, यानी 0.35 अंक की बढ़त। NVIDIA यह स्पष्ट करता है कि यह अनुकूलन और inference की विधि है, कोई नई architecture नहीं। Cosmos निर्णायक की भूमिका में भी दिखाई देता है: track 3 की दोनों out-of-domain rankings में UWIPL_ETRI टीम ने UniTraffic के साथ जीत हासिल की, जो विवादित दावों की जाँच एक स्वतंत्र Cosmos-Reason1 verifier से कराता है।

🔗 CUDA Rust, NVIDIA · 🔗 AI City Challenge के परिणाम


Cognition ने 2 अरब डॉलर से अधिक जुटाए और 48 अरब डॉलर के मूल्यांकन तक पहुँचा

8 सितंबर — development agent Devin की निर्माता Cognition ने 48 अरब डॉलर के मूल्यांकन पर 2 अरब डॉलर से अधिक की funding जुटाने की घोषणा की। इस round का नेतृत्व दो नए निवेशकों Andreessen Horowitz और Accel ने किया, जिनके साथ मौजूदा निवेशक Founders Fund, General Catalyst और Avenir भी शामिल रहे। लगभग तीस अन्य प्रतिभागियों में NVIDIA, Benchmark, Bessemer, Kleiner Perkins, Greylock, Lightspeed, T. Rowe Price और Bain Capital Ventures शामिल हैं।

संकेतकमई 2026सितंबर 2026
जुटाई गई राशि, round का कुल1 अरब डॉलर से अधिक2 अरब डॉलर से अधिक
मूल्यांकन26 अरब डॉलर48 अरब डॉलर
वार्षिकीकृत राजस्व492 मिलियन डॉलरलगभग 900 मिलियन डॉलर
प्रमुख निवेशकLux Capital, General Catalyst, 8VCAndreessen Horowitz, Accel

इस प्रकार चार महीनों में मूल्यांकन लगभग दोगुना और एक वर्ष में करीब पाँच गुना हो गया है, जबकि वार्षिकीकृत राजस्व भी इसी गति से बढ़ा है। Cognition ने इस वृद्धि को आगे बढ़ाने वाले उपयोगों का विवरण दिया है: Devin, NVIDIA में chip design, GE Aerospace में aviation, Citi में financial services, Mercedes-Benz में automotive और Modal में AI infrastructure पर काम करता है। NVIDIA का इस round में ग्राहक और निवेशक दोनों होना दिखाता है कि ये कंपनियाँ आंतरिक रूप से उपयोग किए जाने वाले उपकरणों तक अपनी पहुँच किस तरह सुरक्षित करती हैं। तीन हालिया क्षमताएँ Devin को कार्य निष्पादन से autonomous action की ओर ले जाती हैं: घटना की शुरुआती जाँच के लिए Auto-Triage, vulnerabilities को छाँटने के लिए Security Swarm और Slack, GitHub या Linear की घटनाओं से सक्रिय होने वाला Automations। एक वर्ष में छह कार्यालय खोले गए हैं, जिनमें पाँच संयुक्त राज्य अमेरिका से बाहर हैं; ये San Francisco, New York और Austin के केंद्रों के अतिरिक्त हैं।

In the next chapter of software engineering, agents will become proactive by default, software will improve itself, and compute will automatically get allocated toward the highest impact use cases. We’re still at the dawn of the self-driving software era.

🇮🇳 software engineering के अगले अध्याय में agents डिफ़ॉल्ट रूप से सक्रिय होंगे, software स्वयं को बेहतर बनाएगा और computing power अपने-आप सबसे अधिक प्रभाव वाले उपयोगों के लिए आवंटित होगी। हम अभी autonomous software के युग की शुरुआत में ही हैं।X पर @cognition

🔗 Series E, Cognition


Suno ने Believe और TuneCore के साथ समझौता किया, जिन्होंने कल तक उसका संगीत वितरित करने से इनकार किया था

8 सितंबर — Suno ने artist development कंपनी Believe और उसके self-distribution platform TuneCore के साथ वैश्विक रणनीतिक साझेदारी की घोषणा की। समझौता दो अलग विषयों से जुड़ा है। पहला, Believe उन नए music models के design में भाग लेगा जिन्हें Suno industry के साथ मिलकर विकसित कर रहा है। दूसरा, और उपयोगकर्ताओं के लिए यही ठोस बिंदु है, इस नए partner model से बनाए गए गाने Believe और TuneCore के माध्यम से Spotify, Apple Music, Amazon Music और YouTube पर वितरण के योग्य होंगे।

इस घोषणा का संदर्भ इसका महत्व स्पष्ट करता है। Suno साफ़ तौर पर याद दिलाता है कि इस वर्ष की शुरुआत में Believe और TuneCore ने घोषणा की थी कि वे उन models से बना संगीत वितरित नहीं करेंगे जो उनके मानदंडों को पूरा नहीं करते, जिनमें उस समय के Suno models भी शामिल थे। इस बदलाव को ऐसी चर्चाओं का परिणाम बताया गया है जिनमें साझा मूल्य सामने आए: artists को वास्तविक विकल्प देना और वितरण तथा आय के रास्ते खोलना।

यह समझौता घटनाओं के एक सुसंगत क्रम का हिस्सा है। यह स्वतंत्र और उभरते artists के लिए Suno के कार्यक्रम Spark को आगे बढ़ाता है तथा Warner Music Group और BMG के साथ मौजूदा समझौतों में independent labels और self-produced artists को जोड़ता है। Suno इसे अपने हालिया safeguards से भी स्पष्ट रूप से जोड़ता है: platform के बाहर उसके गानों की पहचान के लिए audio watermark और acoustic fingerprint, तथा streaming services पर बड़े पैमाने पर प्रसार रोकने के लिए 3 सितंबर से लागू download limits। ये सुरक्षाएँ Believe और TuneCore द्वारा वितरित संगीत पर भी लागू होंगी। घोषणा एक समय-सारिणी के साथ समाप्त होती है: Suno बहुत जल्द अपने नए models लॉन्च करेगा, जिनकी family को 4 सितंबर को v6 नाम दिया गया था।

🔗 Believe साझेदारी, Suno


Cohere ने megakernel पर आधारित serving इंजन जारी किया, जो vLLM से 1.58x तेज़ है

8 सितंबर — Cohere ने पूरी तरह decoding megakernel पर निर्मित inference serving इंजन Apache 2.0 लाइसेंस के अंतर्गत जारी किया। कंपनी इसे पहली उपलब्धि बताती है: यह प्रयोगशाला में गति का प्रदर्शन नहीं, बल्कि OpenAI-संगत endpoint के पीछे वास्तविक अनुरोध संभालने में सक्षम पूरा server है, जिसमें continuous batching, paged attention, prefix cache और tool calling शामिल हैं। इससे serve किया जाने वाला model North Mini Code है, जो 30 अरब parameters वाला mixture of experts है और जिसके प्रति token केवल 3.3 अरब parameters सक्रिय होते हैं।

जिस समस्या को हल किया गया है, उसे एक वाक्य में कहा जा सकता है: decoding के दौरान GPU गणना करने के बजाय प्रतीक्षा में बहुत समय बिताता है। पारंपरिक stack प्रत्येक operation के लिए एक kernel शुरू करता है, और हर kernel boundary पूरी compute grid पर एक barrier लगाती है। लेकिन autoregressive decoding memory bandwidth से सीमित होती है: हर चरण में North Mini Code, HBM memory से 6.6 GB weights और 8K context पर लगभग 0.5 GB key-value cache स्थानांतरित करता है, जिससे H100 की 3.35 TB/s गति पर सैद्धांतिक सीमा लगभग 470 tokens प्रति सेकंड बनती है। Megakernel एक ऐसा persistent kernel शुरू करके इन boundaries को हटा देता है, जो पूरे decoding चरण के दौरान resident रहता है और जिसकी dependencies global memory में counters तक सीमित रहती हैं।

मापMegakernelvLLM v0.24बढ़त
Decoding, batch size 1, context 8K (tok/s)2921851.58x
AIME 2025, आरंभ से अंत तक (tok/s)9356611.41x
SciCode, आरंभ से अंत तक (tok/s)7115601.37x
MMLU-Pro, computer science subset (tok/s)9487131.33x
LiveCodeBench v6, आरंभ से अंत तक (tok/s)8036251.28x
GPQA, आरंभ से अंत तक (tok/s)7876311.25x

Batch size 1 पर 292 tokens प्रति सेकंड सैद्धांतिक सीमा का 62 प्रतिशत है, जबकि vLLM के लिए यह 39 प्रतिशत है। गुणवत्ता अपरिवर्तित रहती है: SciCode पर 38.9 प्रतिशत के मुकाबले 38.2 प्रतिशत और LiveCodeBench v6 पर दोनों ओर 70.3 प्रतिशत, जो सात executions का औसत है। एक विवरण ध्यान देने योग्य है: बढ़त experts के distribution पर निर्भर करती है—model की वास्तविक routing में 1.32x, जबकि simulated uniform routing में 1.14x—जिससे uniform measurements प्रतिकूल स्थिति बन जाती हैं। अंत में Cohere एक सहज-बोध के विपरीत बात पर ज़ोर देता है: megakernel लिखना उसकी प्रतिष्ठा से कहीं सरल होगा, क्योंकि एक ही CUDA file में सोलह operation codes पूरे decoding चरण को समेटते हैं। सीमाएँ स्वीकार की गई हैं और implementation limitations बताई गई हैं: केवल decoding, जबकि prefill अभी भी सामान्य PyTorch kernels पर चलता है; केवल H100 और BF16; तथा 1 से 8 तक batch sizes।

🔗 Megakernels, Cohere


Anthropic ने बताया कि performance खोए बिना Claude Platform का खर्च कैसे घटाएँ

8 सितंबर — Anthropic ने एक engineering guide प्रकाशित की है, जो इस आम धारणा के विपरीत है कि किसी agent का खर्च घटाने का अर्थ खराब नतीजे स्वीकार करना है। इसमें तीन उपाय बताए गए हैं: prompt cache की सफलता दर को अधिकतम करना, frontier model पर जाते समय prompt anti-patterns हटाना और कार्य के अनुसार effort को calibrate करना। यह विधि Claude Code में चलाए जा सकने वाले commands के रूप में दी गई है, जिसमें /claude-api prompt-audit और /claude-api hillclimb, /claude-api cost-optimize के साथ जुड़ते हैं।

Benchmark, Sonnet 5 आधारलागत में कमीमापा गया विवरण
LegalBenchलगभग 58 प्रतिशतreasoning tokens 102 779 से घटकर 8 284
tau2-bench retailलगभग 73 प्रतिशतस्पष्ट breakpoints वाला prompt cache
OfficeQA Proलगभग 52 प्रतिशत136.20 से घटकर 64.87 dollars
SWE-bench Verifiedलगभग 55 प्रतिशतmedian steps 29 से 17, prompt tokens आधे से भी कम

सबसे उपयोगी आँकड़ा इस तालिका में नहीं है। CursorBench 3.2 पर low effort वाला Claude Fable 5.1, लागत के एक-तिहाई में high effort वाले Fable 5 के बराबर है। इसका कुछ हिस्सा cache read pricing से आता है, जिसकी दर पहले के 1.00 dollar के मुकाबले अब प्रति दस लाख tokens पर 0.25 dollar है। इसके विपरीत, बिना tools वाले Humanity’s Last Exam पर effort का अंतिम स्तर 46 प्रतिशत अधिक लागत में लगभग आधा point दिलाता है—ऐसी बढ़त जो benchmark के noise में खो जाती है।

🔗 Claude Platform पर लागत घटाना


Claude Code 2.1.265: plugin folders, 1 GB सीमा और prompt cache की मरम्मत

8 सितंबर — Claude Code को 2.1.265 पर अद्यतन किया गया है, जिसके changelog में पचास entries हैं और इनमें चौंतीस fixes शामिल हैं। यह उस 2.1.263 release के दो दिन बाद आया है, जिसमें केवल एक entry थी। अब --plugin-dir option plugins का पूरा folder स्वीकार करता है; manifest वाला प्रत्येक subfolder load होता है और execution के दौरान किए गए additions तथा deletions का पता लगाया जाता है। Disk पर लिखे गए tool results पर 1 GB की सीमा लागू होती है और preview बताता है कि file truncate की गई है।

सबसे विस्तृत हिस्सा prompt cache से जुड़ा है और उसी दिन प्रकाशित guide की प्रतिध्वनि करता है। दो अलग fixes उन स्थितियों को सुधारते हैं जहाँ Claude Code स्वयं cache reuse को तोड़ता था: foreground में शुरू किए गए sub-agent को resume करने पर उसकी tool list और system prompt prefix बदल जाते थे, जबकि resumed agent teammates और sub-agents, SubagentStart hooks के context तथा preloaded skills को prefix से बाहर खिसका देते थे। दो fixes security से जुड़े हैं: backslash वाला plugin path macOS और Linux पर symbolic links की confinement verification को bypass करता था, और Windows पर read तथा write tools, AppContainer या restricted-token sandbox में मौजूद हर file को अस्वीकार करते थे। अब किसी third party द्वारा लिखे गए artifact को पढ़ना untrusted content के रूप में माना जाता है।

🔗 2.1.265 release notes


Amp ने message queue की जगह live steering अपनाई

8 सितंबर — Amp ने काम के दौरान भेजे गए messages के प्रति अपने agent का default व्यवहार बदल दिया है। अब तक agent के चलते समय लिखा गया message queue में डाल दिया जाता था और turn पूरा होने के बाद ही process होता था; अब उसे पहले उपलब्ध अवसर पर पहुँचा दिया जाता है। Editor इसके दो लाभ बताता है: agent feedback को पहले ध्यान में रखता है और वे verification steps शुरू नहीं करता जिन्हें नया निर्देश अनावश्यक बना देता है। इससे उस सामान्य स्थिति में समय और tokens बचते हैं, जब उपयोगकर्ता agent को गलत दिशा में जाते देखता है।

यह बदलाव side effects से मुक्त नहीं है और Amp ने उनका विवरण दिया है। यदि steering बहुत अचानक लगे, तो editor सलाह देता है कि requests को “Now, …” के बजाय “When done, then…” के रूप में लिखा जाए, ताकि स्पष्ट हो कि निर्देश मौजूदा task के बाद लागू होगा। Ship, Review और अन्य integrated actions पुराने व्यवहार को बनाए रखते हैं और queue में ही रहते हैं, क्योंकि सामान्यतः काम पूरा होने के बाद ही delivery या review शुरू करना वांछित होता है। Manual queuing app और CLI दोनों में उपलब्ध है।

🔗 Queue न करें, steer करें, Amp


Muse Spark 1.3, CursorBench के सर्वोत्तम score-to-cost अनुपात के साथ Cursor में आया

8 सितंबर — Cursor ने Meta Superintelligence Labs के agentic model Muse Spark 1.3 को उसकी प्रस्तुति के छह दिन बाद जोड़ा है। प्रकाशित आँकड़े raw performance नहीं, बल्कि लागत की कहानी बताते हैं। वास्तविक multi-file tasks से बने in-house benchmark CursorBench 3.2 पर Max tier को 1.31 dollar प्रति task में 67.9 प्रतिशत मिलता है और वह बारहवें स्थान पर है।

Model और tierCursorBench 3.2 scoreप्रति task लागत, dollars मेंप्रति task tokensस्थान
Fable 5.1 Max73.4 प्रतिशत9.6472 0601
Grok 4.6 Extra High70.8 प्रतिशत2.8141 1363
Opus 5 Max70.0 प्रतिशत8.2361 8385
Gemini 3.8 Flash High69.2 प्रतिशत2.3881 5249
Muse Spark 1.3 Max67.9 प्रतिशत1.3133 03412
GPT-5.6 Sol Max67.2 प्रतिशत5.6928 32013
Muse Spark 1.3 Low55.0 प्रतिशत0.4512 18149

इस प्रकार Meta का model score में Claude Fable 5.1 Max से बहुत पीछे है, लेकिन Claude Fable 5.1 Max की प्रति task लागत सात गुना से अधिक है। सबसे अहम बात यह है कि यह अपने Max tier में GPT-5.6 Sol से आगे रहते हुए चार गुना से भी कम खर्च करता है। Cursor अपनी उस पद्धति पर कायम है जिसमें केवल उपलब्धता घोषित करने के बजाय जोड़े गए हर model का score और प्रति task लागत व्यवस्थित रूप से प्रकाशित की जाती है।

🔗 Cursor में Muse Spark 1.3


Grok Bot अब chat से forms और credentials भरता है, Grok Imagine को keyframes का नियंत्रण मिला

8 सितंबर — SpaceXAI अब उपयोगकर्ताओं को conversation छोड़े बिना अपने Grok Bot के लिए forms और login pages भरने देता है और किसी भी password manager के समर्थन का दावा करता है। यह feature persistent agents से जुड़ी एक friction को संबोधित करता है: जैसे ही agent को login screen पार करनी हो या व्यक्तिगत जानकारी वाला form submit करना हो, उसे या तो stored credentials चाहिए या उपयोगकर्ता का हस्तक्षेप। इस चरण को अलग browser session के बजाय conversation thread में लाना usability के साथ-साथ security का भी निर्णय है।

दो घंटे बाद Grok Imagine को video scene की शुरुआती और अंतिम images का नियंत्रण तथा seamless loops बनाने की क्षमता मिली, साथ ही बेहतर instruction following और अधिक video quality का दावा किया गया। Keyframe control लगातार shots बनाने वालों के लिए tool का स्वरूप बदल देता है: एक shot की अंतिम image तय करके उसे अगले shot की पहली image के रूप में दोबारा इस्तेमाल किया जा सकता है, जिससे ऐसी sequences जोड़ी जा सकती हैं जिनकी continuity अब generation के संयोग पर निर्भर नहीं रहती। यह घोषणा Image 2.0 model से संचालित Grok Imagine Video 1.5 agent को सेवा में लाए जाने के तीन दिन बाद हुई।

🔗 Grok Bot में forms भरना · 🔗 Grok Imagine में keyframes


Hugging Face blog पर तीन research posts

8 सितंबर — Hugging Face community की उसी दिन प्रकाशित तीन posts पढ़ने योग्य हैं, जो मौसम, model security और जीव-जगत से प्रेरित models पर केंद्रित हैं।

GPU के बिना open weather model चलाना

Hugging Face और Earthmover ने एक ऐसी समस्या पर संयुक्त post प्रकाशित की है जिस पर बहुत कम चर्चा होती है: machine-learning weather models laptop पर चलने जितने हल्के हैं, फिर भी लगभग कोई उन्हें नहीं चलाता। तीन बाधाएँ पहचानी गई हैं: compute—AIFS सहित कई models flash attention पर निर्भर हैं, जो कुछ graphics card architectures तक सीमित है—storage और सबसे बढ़कर bandwidth, क्योंकि हर forecast के लिए लगभग 1 GB initial conditions चाहिए। इसका समाधान तीन public artifacts में है: demo space, storage bucket और reproducible tutorial, जो Microsoft के model Aurora को 0.25-degree pretrained version में चलाता है, जहाँ initial ERA5 conditions Earthmover data marketplace द्वारा उपलब्ध कराई जाती हैं। किसी GPU की आवश्यकता नहीं है: CPU पर प्रति compute step दो से तीन मिनट, graphics card पर कुछ सेकंड, और चौबीस घंटे के forecast के लिए छह घंटे के चार steps, जिसकी बाद में ERA5 से तुलना की जाती है।

🔗 Earthmover के साथ open weather models

अधिक सुरक्षित माना गया model, तीन-चौथाई निरापद प्रश्नों को अस्वीकार करता है

Multiverse Computing ने ऐसा परिणाम प्रकाशित किया है जिसकी चर्चा alignment research से कहीं आगे होनी चाहिए। राजनीतिक manipulation requests अस्वीकार करने के लिए Qwen3-8B को train करने पर team को ऐसे आँकड़े मिलते हैं जो स्पष्ट जीत जैसे लगते हैं: HarmBench, StrongREJECT और WildJailbreak पर औसत harmful response rate 26.26 से गिरकर 0.14 प्रतिशत हो जाती है। उसी checkpoint पर XSTest में over-refusal 2.00 से बढ़कर 74.00 प्रतिशत हो जाता है। दूसरे शब्दों में, कागज़ पर सबसे सुरक्षित configuration वास्तव में refusal machine है, और सामान्य measurements में इसे देखने का कोई तरीका नहीं है। दो corrections प्रभावी सिद्ध होते हैं: external compliance responses को target model के verified responses से बदलने पर XSTest over-refusal 15.20 से घटकर 5.20 प्रतिशत हो जाता है, और benign boundary pairs जोड़ने पर satisfy किए जाने वाले पक्ष का over-refusal 32.94 से गिरकर 4.16 प्रतिशत रह जाता है, जबकि harmful पक्ष के refusal में केवल चार points की कमी आती है।

🔗 किसके लिए सुरक्षा, Multiverse Computing

Fly connectome अपने shuffled wiring को नहीं पछाड़ता

Oruk ने ऐसी methodological सीख प्रकाशित की है जो connectome-inspired models से कहीं आगे लागू होती है। Team ने fly के public MaleCNS reconstruction से 499 अत्यधिक connected neurons को reservoir की तरह काम करने वाले recurrent network में copy किया, जिसके ऊपर केवल एक trained ridge readout लगाया गया। Fly wiring को test पर 16.84 प्रतिशत औसत accuracy मिली, जबकि shuffled wiring को 16.88 प्रतिशत: अंतर ऋण 0.04 point है और confidence interval शून्य को पार करता है। दूसरा experiment इसके विपरीत प्रमाण लग सकता था, क्योंकि सबसे बड़े readout weight norms वाले 50 neurons हटाने से accuracy 16.91 से गिरकर 10.83 प्रतिशत हो जाती है। Authors बताते हैं कि इसमें विरोधाभास क्यों नहीं है: dramatic ablation कभी यह सिद्ध नहीं करता कि biological topology आवश्यक थी। यह भी उल्लेखनीय है कि post स्वयं बताती है कि इसे एक AI agent ने non-peer-reviewed paper से तैयार किया था और पूरा evaluation dataset अब भी private है।

🔗 Connectome और shuffled wiring, Oruk


Runway ने Paris स्थित Kinetix laboratory की team को नियुक्त किया

8 सितंबर — Runway ने घोषणा की है कि Paris स्थित AI research laboratory Kinetix की team उससे जुड़ रही है। Laboratory 3D human motion और physics-grounded video generation पर काम कर रही थी—दो ऐसे विषय जिन्हें Runway robotics में लागू world models पर अपने research से सीधे जोड़ता है। Team कंपनी के Paris hub में शामिल होगी, जहाँ research और engineering के लिए अन्य भर्तियाँ भी चल रही हैं।

तकनीकी तर्क announcement के एक वाक्य में समाया है: वास्तव में उपयोगी robot को नए environments, tasks और situations को समझना तथा संभालना चाहिए, और Runway के अनुसार large-scale video pre-training इन generalization समस्याओं को हल करने का सबसे प्रभावी मार्ग प्रदान करती है। यह 31 अगस्त को प्रस्तुत Solaris और 3 सितंबर को प्रस्तुत GWM Worlds 2 की सीधी निरंतरता है: models को दुनिया simulate करना सिखाने के बाद Runway अब उन्हें उसमें कार्य करना सिखाना चाहता है। Kinetix के CEO Yassine Tahi के अनुसार laboratory का foundational bet छह वर्ष पहले लगाया गया था। लेनदेन की किसी राशि या संरचना की जानकारी नहीं दी गई है।

🔗 Kinetix, Runway से जुड़ा


Sarah Friar ने OpenAI के पैमाने और उसके मॉडलों के लागत-प्रभाव को आँकड़ों में बताया

8 सितंबर — Sarah Friar ने एक विचार-लेख प्रकाशित किया है कि OpenAI अपनी शोध प्रगति को आर्थिक गतिविधि में कैसे बदलता है। इस लेख की दिलचस्पी उसके तर्क से अधिक तीन नए आँकड़ों में है।

संकेतकमान
साप्ताहिक सक्रिय उपयोगकर्ताएक अरब से अधिक
ग्राहक कंपनियाँ2.5 मिलियन
छह महीने बाद प्रतिदिन संदेश, व्यक्तिगत योजनाएँपहले महीने की तुलना में लगभग 50 प्रतिशत अधिक
छह महीने बाद आज़माए गए अलग-अलग कार्यलगभग दोगुने
अनुकूलन के बाद शुरू से अंत तक की सेवा लागत20 प्रतिशत कम
token निर्माण दक्षता15 प्रतिशत से अधिक

तीसरा आँकड़ा एक दिलचस्प चक्र पूरा करता है। GPT-5.6 Sol का उपयोग OpenAI के उत्पादन सेवा सॉफ़्टवेयर को बेहतर बनाने के लिए किया गया, जिससे सेवा लागत में 20 प्रतिशत की कमी आई और token निर्माण की दक्षता में 15 प्रतिशत से अधिक की अतिरिक्त बढ़ोतरी हुई। दूसरे शब्दों में, मॉडल उस परोसने वाली परत को अनुकूलित करके अपने ही बुनियादी ढाँचे के एक हिस्से का खर्च वहन करता है। व्यक्तिगत उपयोग का रुझान एक ऐसे प्रश्न का भी उत्तर देता है जिसे अक्सर पूछा जाता है लेकिन शायद ही कभी दस्तावेज़ित किया जाता है: उपयोगकर्ता प्रतिधारण।

🔗 काम अब पहुँच के भीतर, OpenAI


OpenAI ने किशोरों पर स्वतंत्र शोध के लिए 5 मिलियन डॉलर की प्रतिबद्धता जताई

8 सितंबर — OpenAI ने 13-17 वर्ष के किशोरों पर जनरेटिव AI के प्रभावों से जुड़े स्वतंत्र शोध के लिए 5 मिलियन डॉलर का अनुदान कार्यक्रम शुरू किया है, जिसमें सामाजिक और भावनात्मक विकास पर स्पष्ट रूप से ज़ोर दिया गया है। प्रत्येक परियोजना के लिए व्यक्तिगत अनुदान 1 मिलियन डॉलर तक होगा। आवेदन 6 अक्टूबर 2026 को बंद होंगे, चयनित परियोजनाओं को अधिकतम 13 नवंबर 2026 तक सूचित किया जाएगा, 2027 की पहली तिमाही में प्रगति की समीक्षा अपेक्षित है और प्रत्येक अनुदान में सामान्य प्रशासनिक खर्च की सीमा 10 प्रतिशत रखी गई है।

दो विवरण ध्यान देने योग्य हैं। पहला घोषित स्वतंत्रता से संबंधित है: मूल्यांकन मानदंडों में यह क्षमता शामिल है कि परियोजना विश्वसनीय परिणाम दे सके, चाहे वे AI उत्पाद प्रदाताओं के अनुकूल हों या नहीं; प्रकाशन को प्रोत्साहित किया गया है, लेकिन वह वित्तपोषण की शर्त नहीं है। दूसरा प्रशासनिक है, लेकिन महत्त्वपूर्ण है, क्योंकि अनुदानों का वित्तपोषण और प्रबंधन व्यावसायिक इकाई OpenAI Group PBC करती है, OpenAI Foundation नहीं। समय-सारिणी भी तटस्थ नहीं है: OpenAI ने 31 अगस्त को AI से नाबालिगों की सुरक्षा संबंधी कैलिफ़ोर्निया विधेयक का समर्थन किया था और लेख में कहा गया है कि इसका उद्देश्य नियामकों के निर्णयों के लिए जानकारी उपलब्ध कराना है।

🔗 किशोर शोध अनुदान


संक्षिप्त समाचार

  • Boris Cherny ने prompt injection के जोखिम पर अन्य प्रयोगशालाओं का सार्वजनिक रूप से आकलन किया — Claude Code के निर्माता ने OpenAI के नए मॉडल को prompt injection के मामले में Gemini Flash और Opus 4.8 के स्तर पर रखा और कहा कि जब तक प्रयोगशालाएँ सुरक्षा को अधिक गंभीरता से नहीं लेंगी, वह सार्वजनिक रूप से उनके नाम लेते रहेंगे। लगभग बीस मिनट बाद अपने ही थ्रेड के उत्तर में उन्होंने अपने स्वर को थोड़ा नरम किया। 🔗 पोस्ट
  • Anthropic ने Claude Managed Agents पर निर्माण करने वाले संस्थापकों का वीडियो प्रकाशित किया — Wispr Flow, Actively और Pendo के संस्थापकों के साथ outcomes, sandbox और memory के उपयोग से विस्तार करने पर साक्षात्कार। 🔗 पोस्ट
  • RelayShield repository के code के बजाय निर्देश फ़ाइलों को scan करता है — यह सशुल्क सेवा AGENTS.md, CLAUDE.md, .cursorrules और mcp.json को पढ़कर प्राकृतिक भाषा में लिखे ऐसे दुर्भावनापूर्ण निर्देश खोजती है जिन्हें static analysis नहीं देख पाता। लेख में उद्धृत दुर्भावनापूर्ण repository की संख्या उसके अपने स्रोत से मेल नहीं खाती। 🔗 लेख
  • Ai2 ने ECCV 2026 में अपनी उपस्थिति की घोषणा की — सम्मेलन में विभिन्न लेख और प्रस्तुतियाँ होंगी, लेकिन कोई शीर्षक या कार्यक्रम साझा नहीं किया गया है। 🔗 पोस्ट
  • Prismberry ने उद्यम एजेंटों की tool layer पर एक निबंध प्रकाशित किया — यह वैचारिक लेख सूचना, विश्लेषण और कार्रवाई के tools के बीच अंतर बताता है; इसमें कोई घोषणा या माप नहीं है और यह प्रकाशक के Agent IQ उत्पाद का प्रचार करता है। 🔗 लेख
  • Hugging Face ब्लॉग पर प्रकाशित hardware maintenance विवरणिका — 650 W की power supply के fan में bearing के घिसाव का निदान, जिसमें कृत्रिम बुद्धिमत्ता से संबंधित कोई सामग्री नहीं है। 🔗 लेख
  • Missouri ने 1.1 मिलियन विद्यार्थियों के लिए Gemini for Education उपलब्ध कराया — राज्यव्यापी साझेदारी के अंतर्गत लगभग 100,000 शिक्षकों और 1.1 मिलियन से अधिक विद्यार्थियों को Gemini for Education, Gemini Notebook और Google certifications की निःशुल्क पहुँच मिलेगी; उनके data को training से बाहर रखा जाएगा और इसे अपनाने का निर्णय प्रत्येक संस्थान पर छोड़ा गया है। 🔗 घोषणा
  • Dependabot निजी GitHub registries को व्यक्तिगत token के बिना पढ़ता है — Dependabot का GITHUB_TOKEN अनुमति packages: read माँग सकता है और निजी GitHub Packages registries से सामग्री प्राप्त कर सकता है। जून में जारी होकर वापस ली गई यह सुविधा अब लौट आई है, जिसमें स्वचालित credentials केवल fallback की भूमिका में सीमित हैं। 🔗 बदलाव-विवरण
  • GitHub का support portal help.github.com पर स्थानांतरित हुआ — support, documentation, learning, community और account resources अब एक ही स्थान पर उपलब्ध हैं, जहाँ बिना sign-in के Copilot-संचालित search भी मिलता है। 🔗 बदलाव-विवरण
  • Genspark ने SF Tech Week के दौरान GenTeam की शुरुआती पहुँच के साथ Spark House खोला — यह सामुदायिक पहल प्रतिभागियों को GenTeam की शुरुआती पहुँच और संस्थापकों व निवेशकों के बीच निजी बातचीत का अवसर देती है। 🔗 पोस्ट
  • Ethan Tandowsky ElevenLabs के मुख्य वित्तीय अधिकारी बने — 2 सितंबर को Ashley Kramer को मुख्य राजस्व अधिकारी नियुक्त किए जाने के बाद छह दिनों में ElevenLabs की यह दूसरी वरिष्ठ नियुक्ति है। 🔗 पोस्ट
  • MiniMax ने Tokyo में जापानी मनोरंजन जगत की आवाज़ों और जनरेटिव AI के चार प्रतिभागियों को एकत्र किया — 11 सितंबर को Shibuya में होने वाले कार्यक्रम में निर्माता Yasushi Akimoto, KADOKAWA, KAGAMIAI, Higgsfield, Krea, Runway और HeyGen शामिल होंगे; कोई लॉन्च या आँकड़ा नहीं है। 🔗 पोस्ट
  • एक ही दिन में Nemotron Labs के दो प्रसारण, OpenShell और Domyn पर — OpenShell द्वारा autonomous agents को सुरक्षित करने पर 49 मिनट 44 सेकंड और Domyn द्वारा Nemotron के उपयोग पर 54 मिनट 20 सेकंड, बिना वर्णनात्मक पाठ या transcript के। 🔗 पोस्ट
  • HeyGen ने किसी tool या model का नाम लिए बिना एक ही चेहरे के दो avatars की तुलना की — यह विपणन तुलना है जिसमें किसी प्रतिस्पर्धी tool का नाम, model या माप नहीं दिया गया। 🔗 पोस्ट
  • OpenAI ने अपने पत्रकारिता कार्यक्रम का विस्तार पत्रकारिता विद्यालयों तक किया — 2026-2027 के लिए CUNY के Newmark J-School और Northwestern के Medill School के master विद्यार्थियों एवं शिक्षकों को 400 से अधिक ChatGPT Edu subscriptions। 🔗 घोषणा
  • Perplexity ने AI integration के निवेश प्रतिफल पर मार्गदर्शिका प्रकाशित की — यह बिना किसी उत्पाद घोषणा वाला शैक्षणिक लेख है, जिसके सभी आँकड़े तृतीय पक्षों या ग्राहकों के अनुभवों से लिए गए हैं। 🔗 लेख

इसका क्या अर्थ है

व्यक्तिगत agent बुनियादी ढाँचे का उत्पाद बन रहा है और उसकी सुरक्षा अपने आप में एक उत्पाद बन रही है। Meta केवल Muse उपलब्ध कराने तक सीमित नहीं है: उसी दिन उसने अब तक का सबसे विस्तृत विवरण प्रकाशित किया कि shell, browser और mailbox की पहुँच वाले agent को कैसे नियंत्रित रखा जाए। सबसे शिक्षाप्रद विकल्प substitution tokens का है, जो credentials की चोरी के संदर्भ में prompt injection को निरर्थक बना देता है—इसलिए नहीं कि model बेहतर प्रतिरोध करता है, बल्कि इसलिए कि उसके पास कभी secret होता ही नहीं। tainted egress भी इसी तर्क पर आधारित है: model पर भरोसा नहीं किया जाता, kernel में instrumentation किया जाता है। 300,000 डॉलर का bug bounty और निष्कर्ष की साफ़गोई—जिसमें स्वीकार किया गया है कि Muse गलतियाँ करेगा—वही बात कहते हैं जो Boris Cherny इस जोखिम पर अन्य प्रयोगशालाओं का सार्वजनिक आकलन करते समय कहते हैं। agents की सुरक्षा अब केवल टिक लगाने वाला ख़ाना नहीं है, बल्कि engineering की ऐसी सतह है जिसे प्रकाशित किया जाता है और जिसे तोड़ने के लिए भुगतान किया जाता है।

यह दिन AI के अर्थशास्त्र का भी एक पाठ है और अब गणना की इकाई score नहीं, बल्कि प्रति कार्य लागत है। Mistral ने 21 अरब यूरो से अधिक के मूल्यांकन पर 3 अरब यूरो जुटाए, जबकि Cognition ने 48 अरब के मूल्यांकन पर 2 अरब से अधिक जुटाए; दोनों मामलों में केवल technology funds के बजाय औद्योगिक कंपनियाँ और ग्राहक भी मेज़ पर हैं। उसी समय Cursor ने एक तालिका प्रकाशित की जिसमें Muse Spark 1.3 प्रति कार्य 1.31 डॉलर में 67.9 प्रतिशत प्राप्त करता है, जबकि पहले स्थान वाला model केवल छह अंक अधिक पाने के लिए 9.64 डॉलर खर्च करता है। Anthropic ने प्रदर्शन खोए बिना लागत में 52 से 73 प्रतिशत की कमी दर्ज की और दिखाया कि कम effort पर चलाया गया अधिक शक्तिशाली model अक्सर पूरी क्षमता तक धकेले गए कमज़ोर model को पछाड़ देता है। Sarah Friar ने श्रृंखला के दूसरे छोर को आँकड़ों में बताया: GPT-5.6 Sol से उसे परोसने वाली layer को optimize कराकर सेवा लागत में 20 प्रतिशत की कमी। ये चार अलग-अलग ढंग से बताते हैं कि समझौते का केंद्र क्षमता से हटकर उस क्षमता की कीमत पर आ गया है।

वैज्ञानिक क्षेत्र में प्रश्न अब यह नहीं है कि agents परिणाम देते हैं या नहीं, बल्कि यह है कि उनका सत्यापन कैसे किया जाए। OpenAI ने Navier-Stokes के लिए singularity का एक प्रमाण घोषित किया, जिसे लगभग 10,000 agents ने 88 घंटों में तैयार किया और Lean में formalize किया; लेकिन किसी peer review या संस्थागत validation का उल्लेख नहीं है और इसमें ऐसा internal model उपयोग हुआ है जिससे बाहर का कोई व्यक्ति प्रश्न नहीं कर सकता। कंपनी की सावधानी—millennium prize का दावा न करना और इसे snapshot कहना—अपने आप में एक जानकारी है। उस दिन के दो अन्य शोध इस विरोधाभास का पैमाना बताते हैं: MIT में Codex अच्छी तरह परिभाषित protocols निभाता है लेकिन अस्पष्ट signals पर अटकता है, और एक अनुभवी researcher अब भी अधिक तेज़ है; Google DeepMind में AlphaGenome Atlas कुछ सिद्ध करने का दावा नहीं करता, बल्कि 9 अरब predictions की पूर्व-गणना करके प्रयास को experimental validation की ओर स्थानांतरित करता है। Oruk का लेख यह दिखाकर तर्क पूरा करता है कि शानदार ablation बिना matched comparison के कुछ सिद्ध नहीं करता, और Multiverse Computing का लेख याद दिलाता है कि सुरक्षा का कोई आँकड़ा तब तक अर्थहीन है जब तक benign पक्ष को भी उतनी ही कठोरता से नहीं मापा जाता।

अंत में निचली layer बचती है, जहाँ लाभ अब weights से नहीं आते। Cohere ने एक पूर्ण serving engine उपलब्ध कराया है, जिसमें एकमात्र परिवर्तन kernel boundaries को हटाना है; यह समान गुणवत्ता पर vLLM के मुकाबले 1.58x throughput देता है और स्पष्ट करता है कि megakernel लिखने की कठिनाई को बढ़ा-चढ़ाकर आँका गया है। NVIDIA ने Rust में GPU kernels लिखने के दो रास्ते खोले हैं, जिनमें से एक का उपयोग पहले से ही उसके बाहर Hugging Face के Grout inference engine और mistral.rs में हो रहा है, और वह स्वीकार करता है कि अभी कुछ भी production के लिए तैयार नहीं है। AI City Challenge में पाँच सर्वोत्तम video solutions में से चार LoRA से अनुकूलित Cosmos models पर आधारित हैं; विजेता टीम ने ज़ोर दिया कि यह adaptation recipe है, कोई नई architecture नहीं। Earthmover का मौसम tutorial दूसरे छोर से यही कहानी बताता है: Aurora model processor पर चल जाता है; रुकावट computation नहीं, बल्कि download की जाने वाली एक gigabyte initial conditions थीं। हर मामले में मूल्य model के आसपास की engineering में है और उसे प्रकाशित किया जा रहा है।


स्रोत