खोजें

Claude ने अब तक की अनदेखी क्रिप्टोग्राफ़िक कमजोरियों का पता लगाया, Gemini Robotics ER 2 ने कई रोबोटों को सहयोगी बनाया, GPT-5.6 ने अपनी कीमतें घटाईं

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Claude ने अब तक की अनदेखी क्रिप्टोग्राफ़िक कमजोरियों का पता लगाया, Gemini Robotics ER 2 ने कई रोबोटों को सहयोगी बनाया, GPT-5.6 ने अपनी कीमतें घटाईं

ai-powered-markdown-translator

fr से hi में अनूदित लेख gpt-5.4-mini के साथ।

GitHub पर प्रोजेक्ट देखें ↗

30 जुलाई 2026 पर दो शोध-उपलब्धियाँ हावी रहती हैं: Anthropic का आंतरिक शोध मॉडल Claude Mythos, NIST के एक पोस्ट-क्वांटम उम्मीदवार और AES के एक कमज़ोर संस्करण में अब तक की अनदेखी क्रिप्टोग्राफ़िक कमजोरियाँ खोजता है, जबकि Google DeepMind Gemini Robotics ER 2 लॉन्च करता है, जो एक ही कार्य पर कई रोबोटों को साथ काम कराने में सक्षम है। इन दो विषयों के इर्द-गिर्द OpenAI द्वारा GPT-5.6 की कीमतों में कटौती, GitHub और Devin में stacked pull requests को एक साथ अपनाना, खुले मॉडलों के कई रिलीज़ (Thinking Machines, Sakana AI, LightOn), और एजेंट्स की तरफ़ अपडेट्स की एक लहर (Perplexity, Genspark, Gemini) घूमती है।


Claude Mythos ने अब तक की अनदेखी क्रिप्टोग्राफ़िक कमजोरियाँ खोजीं (HAWK, AES)

30 जुलाई — Anthropic अपनी Frontier Red Team की एक रिसर्च प्रकाशित करता है, जिसमें दिखाया गया है कि Claude Mythos Preview, उसका सबसे उन्नत और गैर-व्यावसायिक आंतरिक शोध मॉडल, ने दो प्रमुख क्रिप्टोग्राफ़िक एल्गोरिद्मों में अब तक की अनदेखी गणितीय कमजोरियाँ खोजीं — केवल कार्यान्वयन की उन बग्स से आगे, जिन्हें Claude पहले ही OpenSSL जैसी लाइब्रेरीज़ में पहचान सकता था। यह घोषणा 28 जुलाई को X पर प्रकाशित की गई, और बाद में एक विस्तृत ब्लॉग लेख में समझाई गई।

पहला परिणाम: HAWK पर एक बेहतर हमला, जो डिजिटल हस्ताक्षरों के लिए NIST के तीसरे दौर का उम्मीदवार है (NIST अमेरिकी मानकीकरण संस्था है) और पोस्ट-क्वांटम है। 60 घंटे के काम और लगभग 100,000 डॉलर के API खर्च में, मॉडल ने एक ऐसा हमला खोजा जिसने HAWK-256 की प्रभावी कुंजी-लंबाई को आधा कर दिया — पूर्ण हमले की अनुमानित लागत 2^64 से घटकर 2^38 ऑपरेशनों पर आ गई। दूसरा परिणाम: AES-128 के 10 में से 7 राउंड तक कम किए गए संस्करण पर, Möbius Bridge (मॉबियस ब्रिज) नामक नई तकनीक ने ज्ञात सर्वोत्तम हमलों की तुलना में गति 200 से 800 गुना बढ़ा दी, लगभग समान लागत पर — मॉडल ने पहले इस कार्य को असंभव माना, फिर शोधकर्ताओं के आग्रह पर लगातार प्रयास किया, और बाद में उन्होंने परिणाम को सत्यापित करने में कई सौ घंटे लगाए।

Anthropic स्पष्ट करता है कि किसी भी उत्पादन प्रणाली पर इसका असर नहीं है: HAWK अभी भी केवल एक गैर-तैनात उम्मीदवार है, और AES पर हमला केवल एन्क्रिप्शन के एक कमज़ोर संस्करण पर लागू होता है — 10 राउंड वाला पूर्ण AES टूटा नहीं है। प्रारंभिक परिणाम LEA (13 राउंड पर एक घंटे से कम में कुंजी पुनः प्राप्त), Serpent-128 (6 राउंड पर पूर्ण हमला) और Salsa20, Poseidon तथा SHA-1 पर कुछ अधिक सीमित लाभों को भी छूते हैं।

इन शोधों को आगे बढ़ाने के लिए, Anthropic ETH Zurich, Tel Aviv University और TU Berlin के साथ मिलकर CryptanalysisBench बना रहा है, जो मॉडलों की क्रिप्टएनालिसिस क्षमताओं को मापने के लिए एक बेंचमार्क होगा।

क्रिप्टोग्राफ़िक लक्ष्यप्राप्त परिणाम
HAWK-256 (पोस्ट-क्वांटम हस्ताक्षर)प्रभावी कुंजी-लंबाई आधी (2^64 → 2^38), 60 घंटे में मिली
10 में से 7 राउंड तक कम किया गया AES-128Möbius Bridge तकनीक के माध्यम से 200 से 800 गुना तेज हमला
24 में से 13 राउंड तक कम किया गया LEAडेस्कटॉप कंप्यूटर पर एक घंटे से कम में कुंजी पुनः प्राप्त
32 में से 6 राउंड तक कम किया गया Serpent-128कुंजी पुनः प्राप्त करने का नया पूर्ण हमला
Salsa20, Poseidon, SHA-1ज्ञात सर्वोत्तम हमलों की तुलना में 10 गुना से कम लाभ

🔗 पूर्ण शोध — Anthropic


Google DeepMind ने Gemini Robotics ER 2 लॉन्च किया

30 जुलाई — Google DeepMind Gemini Robotics ER 2 (Embodied Reasoning, निहित तर्क) लॉन्च करता है, जो रोबोटों को एक उच्च-स्तरीय मस्तिष्क देने के लिए उसका सबसे सक्षम मॉडल है। यह भौतिक दुनिया को समझता है, मनुष्यों से बातचीत करता है, बहु-चरणीय कार्यों की योजना बनाता है, और फिर क्रियान्वयन को निम्न-स्तरीय vision-language-action मॉडल को सौंप देता है; यह Google Search या डेवलपर द्वारा परिभाषित फ़ंक्शनों जैसे टूल्स को मूल रूप से भी कॉल कर सकता है।

पिछले संस्करण (ER 1.6) की तुलना में, मुख्य प्रगति सतत वीडियो समझ पर है: एक लाइव वीडियो स्ट्रीम देखकर, कोई रोबोट अपनी प्रगति पर नज़र रख सकता है, गलती होने पर स्वयं को अनुकूलित कर सकता है, और ठीक-ठीक जान सकता है कि अगला चरण कब शुरू करना है। Google बहु-रोबोट सहयोग भी पेश करता है: अलग-अलग मशीनें (उदाहरण के लिए, एक पहियों वाला रोबोट और एक humanoid) साझा अर्थगत समझ के माध्यम से संवाद करती हैं ताकि जटिल कार्यों को आपस में बाँट सकें — यह Apptronik के Apollo 2 और Franka F3 Duo रोबोटों के साथ दिखाया गया, जो एक गैरेज को मिलकर व्यवस्थित करते हैं।

प्रदर्शन के लिहाज़ से, मॉडल कार्य-प्रगति वर्गीकरण में 57.4% सटीकता और सही समय पर कार्य करने की पहचान में 91.3% सटीकता (औसत अंतर 0.96 सेकंड) तक पहुँचता है, और तुलनीय सटीकता वाले बड़े मॉडलों की तुलना में 4 गुना तेज़ निष्पादन गति देता है। सुरक्षा के मोर्चे पर, Google कहता है कि यह अब तक का उसका सबसे सुरक्षित मॉडल है: यह तब एक humanoid रोबोट को सही ढंग से रोक देता है जब कोई व्यक्ति पास आता है, और केवल क्षेत्र खाली होने पर ही काम फिर शुरू करता है।

मॉडल आज से डेवलपर्स के लिए Gemini API और Google AI Studio के माध्यम से उपलब्ध है, जबकि Gemini Enterprise Agent प्लेटफ़ॉर्म पर सीमित प्रारंभिक पहुँच दी गई है। Boston Dynamics के Spot रोबोट के साथ एक डेमो, जिसमें वह वॉइस कमांड पर स्नैक लेने जाता है, GitHub पर कोड सहित दस्तावेज़ित भी है।

प्रदर्शन संकेतकमापा गया परिणाम
कार्य-प्रगति वर्गीकरण57.4% सटीकता
सही समय पर कार्य करने की पहचान91.3% सटीकता, औसत अंतर 0.96 सेकंड
बड़े मॉडलों की तुलना में निष्पादन गति4 गुना तेज़

🔗 आधिकारिक घोषणा — Google DeepMind


Cursor : cloud agents merged pull requests का 56% पूरा करते हैं

30 जुलाई — Cursor अपने cloud agents के अपनाने पर एक महत्वपूर्ण आंतरिक आँकड़ा साझा करता है: दिसंबर में, 10 में से केवल 1 merged pull request किसी cloud agent से आई थी; आज यह आँकड़ा 56% तक पहुँच गया है। कंपनी इस प्रगति का श्रेय agents को अपनी खुद की cloud machine देने को देती है, साथ ही उनके execution environment को स्वयं ठीक और बेहतर करने की क्षमता देने को — जिससे वे लंबे end-to-end engineering कार्यों को पूरा कर पाते हैं।

In December, 1 in 10 of our merged PRs came from cloud agents. Today, it’s 56%, as we use cloud agents to complete longer engineering tasks from start to finish. We got here by giving agents their own cloud computers and letting them fix and improve their environments.

🇮🇳 दिसंबर में, 10 में से 1 merged PR cloud agents से आती थी। आज, यह 56% है, क्योंकि cloud agents का उपयोग लंबी end-to-end engineering tasks को सफलतापूर्वक पूरा करने के लिए किया जा रहा है। हम यहाँ तक इसलिए पहुँचे क्योंकि हमने agents को अपना खुद का cloud computer दिया और उन्हें अपने environments को ठीक करने तथा बेहतर बनाने दिया।@cursor_ai on X


stacked pull requests GitHub में preview में आ गए, Devin ने उसी दिन उन्हें अपना लिया

30 जुलाई — दो अलग-अलग घोषणाएँ, एक ही दिन, एक ही workflow के इर्द-गिर्द: एक बड़े बदलाव को छोटी, अलग-अलग समीक्षा योग्य pull requests की एक श्रृंखला में बाँटना।

GitHub ने stacked pull requests को व्यापक रूप से उपलब्ध कराया

GitHub stacked pull requests को सभी repositories पर public preview में ले आता है। एक विशाल pull request या कई branches को हाथ से rebase करने के बजाय, बदलाव को क्रमबद्ध layers में बाँटा जाता है, जिनमें से हर एक को एक “stack map” के माध्यम से समीक्षा किया जा सकता है, जो समीक्षा की जा रही layer को पूरे ढाँचे में उसकी जगह दिखाता है, और फिर एक ही operation में merge किया जा सकता है। सबसे ऊपरी layer को merge करने पर अपने-आप उसके नीचे की सभी चीज़ें भी नीचे आ जाती हैं; किसी मध्य layer को merge करने पर खुली हुई layers अपने-आप rebase और retarget हो जाती हैं, बिना मौजूदा branch protections खोए। यह सुविधा github.com, CLI (gh-stack extension), mobile app, और सीधे GitHub Copilot जैसे coding agent से समर्पित skill gh-stack के माध्यम से उपलब्ध है।

🔗 Stacked pull requests — GitHub

Devin (Cognition) ने इन्हें मूल रूप से अपनाया

उसी दिन, Cognition का software engineering agent Devin GitHub के stacked PRs के लिए native support की घोषणा करता है: बड़े बदलावों को छोटे diffs में बाँटना, पूरी stack में review comments को संभालना और ठीक करना, और जब कोई layer बदलती है तो downstream बदलावों को automatically rebase करना। प्लेटफ़ॉर्म और agent दोनों तरफ़ एक साथ अपनाव दिखाता है कि यह नया review model सीधे autonomous agents द्वारा संचालित workflows में स्थापित हो रहा है, न कि केवल मानव डेवलपर्स के लिए।

🔗 Devin — Cognition घोषणा


Amp Labs ने Westpac बैंक के साथ साझेदारी की

29 जुलाई — Amp Labs, Amp (Sourcegraph का स्वतंत्र spin-off) की services/consulting division, Westpac के साथ साझेदारी की घोषणा करता है, जो ऑस्ट्रेलिया के सबसे पुराने बैंकों में से एक है — दो शताब्दियों से भी पुरानी कंपनी। उद्देश्य: बैंक अपने technology को कैसे बनाता और पहुँचाता है, इस प्रक्रिया को बदलना, विशेष रूप से लाखों लोगों द्वारा उपयोग किए जाने वाले data systems के migration और modernization में। एक dedicated टीम Sydney में Westpac के engineers के साथ onsite काम करेगी। लेख परियोजना की founding team को प्रस्तुत करता है — जो Block, Ethereum Foundation, Google और Canva से आई है — और Sydney में स्थानीय hiring शुरू करता है। यह साझेदारी coding agents के इर्द-गिर्द service offerings के बढ़ते प्रभाव को दिखाती है, केवल software subscription से आगे: Amp Labs अब अपनी agent पर आधारित onsite human presence भी बेचता है।

🔗 घोषणा — Amp Labs x Westpac


GPT-5.6 API कीमतों में कटौती, Sol के लिए Fast mode

30 जुलाई — पिछले दिन प्राप्त efficiency gains (GPT-5.6 Sol ने अपने production kernels को स्वयं optimize किया, जैसा पहले बताया गया था) के आधार पर, OpenAI GPT-5.6 Luna, अपने सबसे तेज़ और सबसे सस्ते model, की API कीमतें 80% घटाता है, और GPT-5.6 Terra, अपने सामान्य उपयोग के संतुलित model, की कीमतें 20% घटाता है। ये कटौतियाँ Codex और ChatGPT Work subscriptions की credit consumption में भी दिखाई देती हैं, जबकि quotas और subscription prices में कोई बदलाव नहीं होता।

OpenAI API में एक Fast mode भी पेश करता है, जो Priority Processing offer की जगह लेता है: GPT-5.6 Sol के लिए, यह standard processing की तुलना में 2.5 गुना तक की speed देता है, दोगुनी कीमत पर, बिना intelligence बदले। “priority” tag वाली मौजूदा requests अपने-आप इस नए mode में चली जाती हैं। कई enterprise customers का testimonial के रूप में उल्लेख है, जिनमें Replit, Notion, Ramp, Blitzy, Cognition और Dust शामिल हैं।

मॉडल और mode30 जुलाई से मूल्य निर्धारण
GPT-5.6 Terra (इनपुट / आउटपुट)2 डॉलर और 12 डॉलर प्रति मिलियन tokens
GPT-5.6 Luna (इनपुट / आउटपुट)0.20 डॉलर और 1.20 डॉलर प्रति मिलियन tokens
GPT-5.6 Sol, Fast mode2.5 गुना तक तेज़, दोगुनी कीमत पर

GPT‑5.6 Luna is the closest we’ve come to intelligence too cheap to meter. I’ve never seen a model this affordable be this powerful — it’s unlocking use cases for Replit we didn’t expect to build for a long time.

🇮🇳 GPT-5.6 Luna उस चीज़ के सबसे करीब है जिसे मापने के लिए बहुत सस्ती intelligence कहा जा सकता है। मैंने कभी इतना सस्ता model इतना शक्तिशाली नहीं देखा — यह Replit के लिए ऐसे उपयोग-मामले खोल देता है जिन्हें हम नहीं सोचते थे कि हम बहुत समय तक बना पाएँगे।Michele Catasta, President और Head of AI, Replit — OpenAI द्वारा उद्धृत


दो API सेटिंग्स GPT-5.6 Sol के ARC-AGI-3 पर स्कोर को तिगुना कर देती हैं

29 जुलाई — OpenAI GPT-5.6 Sol (7.8%) और GPT-5.5 (0.4%) के शुरू में कम स्कोर पर एक विश्लेषण प्रकाशित करता है, जो ARC-AGI-3 2D puzzle benchmark पर था, जबकि Sol ने अन्यथा खुले गणितीय समस्याएँ हल की थीं और जटिल video games को हराया था। जाँच से पता चलता है कि benchmark का official harness हर action के बाद मॉडल के private reasoning को हटाता है और उसकी history को sliding window से काट देता है, जिससे वह अपनी पिछली सोच और actions को याद नहीं रख पाता।

OpenAI Responses API (जिसका उपयोग ChatGPT और Codex में production में किया जाता है) के साथ harness को पुनर्निर्मित करके, reasoning retention और truncation के बजाय compaction को सक्रिय करके, सार्वजनिक set पर GPT-5.6 Sol का स्कोर 13.3% से 38.3% तक पहुँच जाता है, और output tokens 6 गुना कम हो जाते हैं — जबकि अनुमानित human reference 48% है। OpenAI इससे एक सामान्य सलाह निकालता है: वास्तविक उपयोग के अधिक प्रतिनिधि मूल्यांकन पाने के लिए पुरानी Chat Completions API के बजाय Responses API का उपयोग करें।

परीक्षण की गई configurationप्राप्त स्कोर (ARC-AGI-3)
benchmark का official harness13.3%
reasoning retained और compaction38.3% (output tokens 6 गुना कम)
अनुमानित human reference48%

🔗 पूर्ण विश्लेषण — OpenAI


Visual Studio में GitHub Copilot : जुलाई का सारांश

30 जुलाई — GitHub Visual Studio 2026 में GitHub Copilot पर अपना मासिक अपडेट प्रकाशित करता है, जिसमें चार नई चीज़ें हैं। एक नया Agent (Preview) Copilot Chat selector में दिखाई देता है, जो उसी Copilot SDK पर बना है जो GitHub Copilot CLI को शक्ति देता है — इससे छोटे उत्तरों और कम back-and-forth के साथ सफल कार्यों का वादा किया जाता है। अंतर्निहित .NET और Azure skills, जिन्हें संबंधित internal teams ने लिखा है, तब tools selector की “Built-in” श्रेणी में अपने-आप दिखाई देती हैं जब संबंधित workloads इंस्टॉल किए जाते हैं (डिफ़ॉल्ट रूप से निष्क्रिय)। Review Selection फ़ंक्शन आपको code चुनने, right click करने, और फिर actionable inline comments प्राप्त करने देता है। अंत में, organization-level custom instructions संगठन के owners को साझा preferences परिभाषित करने देती हैं जो सभी repositories पर अपने-आप लागू हो जाती हैं — Business और Enterprise plans तक सीमित, जबकि अन्य तीन नई चीज़ें सभी plans पर उपलब्ध हैं।

🔗 जुलाई सारांश — Visual Studio में GitHub Copilot


Genspark प्रस्तुत करता है SecondBrain, AI Workspace 6.0 के लिए स्थायी मेमोरी

29 जुलाई — Genspark अपनी COO Wen Sang के एक मीडिया इंटरव्यू के ज़रिए SecondBrain नामक फीचर को AI Workspace 6.0 (जो पहले ही 20 जुलाई को लॉन्च हो चुका है) के भीतर सामने रखता है। चुना गया कोण है AI एजेंटों की « मेमोरी समस्या », जो एक सत्र से दूसरे सत्र तक किसी प्रोजेक्ट का संदर्भ भूल जाते हैं। उपयोगकर्ता की स्पष्ट अनुमति के साथ, SecondBrain ईमेल, कैलेंडर, बातचीत का इतिहास, बैठक के नोट्स और बाहरी टूल्स (Gmail, Slack, Notion, HubSpot, Microsoft 365…) से जुड़ता है ताकि एक व्यक्तिगत संदर्भ-परत बनाई जा सके, जिसका उपयोग Genspark के Super Agent द्वारा किया जा सके। कई ठोस उपयोग दर्ज किए गए हैं: स्वचालित साप्ताहिक सारांश, प्रतिभागियों के संदर्भ के साथ बैठक-पूर्व ब्रीफ, या सभी जुड़े स्रोतों में पार-खोज। Genspark इस सॉफ़्टवेयर को SecondBrain Note उत्पाद से अलग बताता है, जो अलग से बेचा जाने वाला एक भौतिक रिकॉर्डिंग बॉक्स है, और जो अन्य विकल्पों के बीच केवल एक वैकल्पिक इनपुट चैनल है।

🔗 SecondBrain — Genspark की घोषणा


Perplexity ने Projects लॉन्च किए, Computer में Spaces का विकास

30 जुलाई — Perplexity अपने एजेंट ऑर्केस्ट्रेशन वातावरण Computer में Spaces को Projects से बदल देता है: दीर्घकालिक कार्य के लिए स्थायी वर्कस्पेस, जिनमें साझा और श्रेणीबद्ध फ़ाइल सिस्टम होता है, जिस पर क्रमिक कार्य बिना शून्य से शुरू किए आधारित हो सकते हैं। Projects Brain से जुड़ते हैं, जो Computer की स्व-उन्नत होने वाली मेमोरी प्रणाली है, और जो कार्यों के बीच Project की फ़ाइलों और सत्रों को फिर से पढ़ती है ताकि हर नया कार्य संचित संदर्भ के साथ शुरू हो। सहयोगात्मक पहलू पर ज़ोर दिया गया है: किसी टीम के कई सदस्य एक ही Project पर काम कर सकते हैं, जबकि अपनी व्यक्तिगत मेमोरी और कनेक्टर्स अपने-अपने खाते से अलग रख सकते हैं। Perplexity 400 से अधिक टूल्स (Google Drive, Notion, Linear, Snowflake, GitHub) से संभावित कनेक्शन का दावा करता है, साथ ही Slack और Microsoft Teams एकीकरण भी। मौजूदा Spaces अपने-आप माइग्रेट हो जाते हैं; यह आज से सभी Computer उपयोगकर्ताओं के लिए उपलब्ध है।

🔗 Spaces बनता है Projects — Perplexity


Gemini Spark Chrome में एकीकृत होता है और 160+ देशों तक फैलता है

30 जुलाई — Google अपने वेब-कार्य स्वचालन सहायक Gemini Spark का विस्तार सीधे Chrome एकीकरण के साथ करता है, जिसे Chrome auto browse कहा गया है। उपयोगकर्ता की अनुमति से, Spark अब ब्राउज़र के जुड़े हुए खातों और सहेजे गए पासवर्डों का उपयोग करके समय लेने वाले काम कर सकता है — सेव किए गए अपार्टमेंट विज़िट शेड्यूल करना, या उड़ानों की खोज करना और बुकिंग शुरू करना। Google स्पष्ट करता है कि ये कार्रवाइयाँ prompt injection के प्रयासों से सुरक्षित हैं, और भुगतान जैसे संवेदनशील चरण हमेशा सत्यापन के लिए उपयोगकर्ता को लौटा दिए जाते हैं। यह फ़ीचर संयुक्त राज्य अमेरिका में शुरू होता है, और अन्य क्षेत्रों में विस्तार की योजना है। समानांतर रूप से, Spark की पहुँच आज से 160 से अधिक अतिरिक्त देशों में Google AI Pro ग्राहकों तक बढ़ती है — 23 जुलाई के उस विस्तार से कहीं अधिक व्यापक, जो केवल संयुक्त राज्य अमेरिका तक सीमित था।

🔗 Gemini Spark अपडेट — Google


Nano Banana Google Earth में उतरा

30 जुलाई — Google Earth अब अपने वेब इंटरफ़ेस में सीधे Nano Banana 2, Google के इमेज-जनरेशन मॉडल, को एकीकृत करता है। बस किसी स्थान पर ज़ूम करना, « create image » पर क्लिक करना और यह वर्णन करना पर्याप्त है कि आप क्या देखना चाहते हैं: मॉडल उस स्थान की वास्तविक इमेजरी (सैटेलाइट, एरियल और 3D दृश्य) में जमी हुई छवि उत्पन्न करता है, न कि कोई सामान्य दृश्य। लेख पाँच ठोस उपयोगों का विवरण देता है: किसी ऐतिहासिक स्थल का पुनर्निर्माण (78 ईस्वी में जैसे दिखते थे वैसे पोम्पेई के खंडहर), किसी स्थान पर शिक्षणात्मक इन्फोग्राफ़िक्स बनाना, रियल एस्टेट या शहरी-योजना परियोजनाओं के प्लान तैयार करना, निर्माण कार्य से पहले किसी परियोजना का दृश्यांकन, या बस किसी स्थान की कल्पनाशील पुनर्रचना। यह सुविधा आज से, वैश्विक रूप से, वेब पर सभी Google Earth उपयोगकर्ताओं के लिए उपलब्ध है, बिना किसी भौगोलिक प्रतिबंध या विशेष सब्सक्रिप्शन स्तर के।

🔗 Google Earth में Nano Banana — Google


ElevenLabs ने ElevenCreative Audiobooks में Character Casting लॉन्च किया

30 जुलाई — ElevenLabs अपनी AI-आधारित ऑडियोबुक प्रोडक्शन सूट ElevenCreative Audiobooks के भीतर Character Casting लॉन्च करता है। यह सुविधा पूरा पांडुलिपि आयात करने देती है, फिर वास्तविक पाठ के संवादों पर सीधे अलग-अलग आवाज़ों का पूर्वावलोकन करने देती है, ताकि हर पात्र को एक अलग आवाज़ दी जा सके। उद्देश्य वॉइस कास्टिंग को सरल बनाना है, जो अब तक AI-जनित ऑडियोबुक उत्पादन में एक मैनुअल और समय-खपत चरण था — स्टूडियो अब सामान्य डेमो टेक्स्ट के बजाय पुस्तक में वास्तव में बोली गई पंक्तियों पर आवाज़ को मिलाता है।

🔗 Character Casting — ElevenLabs


Inkling-Small : Thinking Machines प्रकाशित करता है, NVIDIA उसी दिन आगे आता है

30 जुलाई — Thinking Machines (Mira Murati की प्रयोगशाला) Inkling-Small लॉन्च करता है, जो Inkling का एक संपीडित संस्करण है: कुल 276 अरब पैरामीटर, 12 अरब सक्रिय, NVFP4 क्वांटिफ़िकेशन, और Inkling — जो चार गुना बड़ा है — के बराबर प्रदर्शन, तथा Hugging Face के अनुसार कोड में बेहतर परिणाम। पूर्ण वज़न खुले प्रवेश में प्रकाशित किए जाते हैं, और Tinker तथा Tinker Playground (पाठ, छवि, ऑडियो) में परीक्षण के साथ fine-tuning संभव है। Hugging Face उसी दिन एक समर्पित ब्लॉग के साथ लॉन्च को बढ़ाता है, जिसमें benchmarks और प्रदर्शन, तथा Hub पर मॉडल संग्रह शामिल है।

NVIDIA उसी दिन रिलीज़ को और समृद्ध करता है, Inkling-Small की NVIDIA NeMo के साथ DGX Station पर fine-tuning के लिए संगतता की घोषणा करके, साथ ही NVFP4 फ़ॉर्मेट के लिए एक समर्पित checkpoint सीधे Hugging Face पर प्रकाशित करके। लॉन्च के समय उपलब्ध यह day-0 हार्डवेयर समर्थन उस गति को दर्शाता है जिससे पारिस्थितिकी तंत्र अब एक तृतीय-पक्ष खुले मॉडल के इर्द-गिर्द समन्वित होता है: प्रयोगशाला वज़न प्रकाशित करती है, Hugging Face प्रदर्शन का दस्तावेज़ीकरण करता है, और NVIDIA अपने fine-tuning इंफ़्रास्ट्रक्चर की संगतता की गारंटी देता है — वह भी एक ही दिन में।

तकनीकी विशेषतामापी गई मान
कुल / सक्रिय पैरामीटर276 अरब / 12 अरब
क्वांटिफ़िकेशनNVFP4
day-0 हार्डवेयर संगतताDGX Station पर NVIDIA NeMo

🔗 लॉन्च — Thinking Machines on X

🔗 NeMo/DGX समर्थन — NVIDIA on X


Sakana AI और NYU ने Dream-Cubed प्रकाशित किया, Minecraft के लिए डेटा सेट और मॉडल

29 जुलाई — Sakana AI, न्यूयॉर्क विश्वविद्यालय (NYU) के साथ मिलकर, Dream-Cubed : Controllable Generative Modeling in Minecraft by Training on Billions of Cubes प्रकाशित करता है। योगदान दोहरा है: Minecraft दुनियाओं का एक विशाल डेटा सेट (प्रक्रियात्मक भूभागों और मनुष्यों द्वारा उनकी सहमति से निर्मित मानचित्रों से आए दसियों अरबों « cubes »), और इन cubes पर tokenization इकाई के रूप में प्रशिक्षित transformers का एक परिवार, भाषा मॉडलिंग में शब्दों की तरह। मॉडल उपयोगकर्ता-निर्देशित, मनमाने आकार की दुनियाओं पर, cube-स्तरीय रिज़ॉल्यूशन के साथ, inpainting, बड़े पैमाने पर outpainting और स्थितिजन्य जनरेशन सहित, इंटरैक्टिव 3D वातावरणों को वास्तविक समय में उत्पन्न और संपादित करने देते हैं। डेटा सेट, प्रशिक्षण कोड और लेख खुले प्रवेश में प्रकाशित किए जाते हैं।

🔗 घोषणा — Sakana AI on X


Together AI और Y Combinator YC स्टार्टअप्स के लिए समर्पित GPU क्लस्टर लॉन्च करते हैं

30 जुलाई — Together AI और Y Combinator, YC स्टार्टअप पोर्टफोलियो के लिए समर्पित पहला GPU क्लस्टर देने वाली साझेदारी की घोषणा करते हैं। उद्देश्य है युवा AI स्टार्टअप्स की प्रमुख बाधा — कंप्यूट तक पहुँच — को हटाना, बिना उन्हें कई वर्षों के compute अनुबंधों को सुरक्षित करने के लिए मजबूर किए, जो अक्सर उनकी कुल नकदी से भी अधिक होते हैं। YC पोर्टफोलियो की स्टार्टअप्स अस्थायी inference और प्रशिक्षण आवश्यकताओं के लिए Together AI के self-service पोर्टल के माध्यम से अपने GPU बुक, प्रोविज़न और प्रबंधित कर सकती हैं, बिना दीर्घकालिक प्रतिबद्धता के, जबकि आमतौर पर दीर्घकालिक अनुबंधों के लिए आरक्षित दरों का लाभ उठाती हैं। उसी दिन, Together AI एक पहला ठोस उपयोग सामने लाता है: Osmosis_AI स्टार्टअप, जो यह खोजता है कि क्या reinforcement learning के माध्यम से एक open source मॉडल foundation model के स्तर तक पहुँच सकता है, इस क्लस्टर पर प्रशिक्षित किया गया।

🔗 समर्पित YC GPU क्लस्टर — Together AI


LightOn ने Hugging Face ब्लॉग पर mDenseOn & mLateOn प्रकाशित किया

30 जुलाई — फ्रांसीसी प्रयोगशाला LightOn AI Hugging Face ब्लॉग पर mDenseOn & mLateOn संग्रह प्रकाशित करती है: एकल-वेक्टर और बहु-वेक्टर सूचना-खोज (retrieval) मॉडल, साथ ही संबद्ध डेटा सेट, जो बहुभाषी खोज, लंबे संदर्भ और कोड खोज में विशेषज्ञ हैं — कुल 18 तत्व, खुले वज़नों के रूप में प्रकाशित। यह प्रकाशन उसी पैटर्न का अनुसरण करता है जैसा LiquidAI (LFM2.5-Encoders) की 28 जुलाई की रिलीज़ ने किया था: एक तृतीय-पक्ष प्रयोगशाला Hugging Face ब्लॉग को आधिकारिक लॉन्च चैनल के रूप में उपयोग करती है, जिसमें मॉडल कार्ड और संग्रह सीधे Hub पर होस्ट किए जाते हैं।

🔗 mDenseOn & mLateOn — Hugging Face ब्लॉग


संक्षिप्त समाचार

  • Cognition FrontierCode 1.1 अपडेट करता है — GPT-5.6 Terra और Luna की नई मूल्य छूटों के साथ (ऊपर देखें), यह श्रृंखला अब लागत/प्रदर्शन Pareto वक्र पर स्थित है। 🔗 स्रोत
  • Hugging Face Trackio Logbooks लॉन्च करता है — Trackio का 0.34.0 संस्करण किसी AI प्रयोग के कोड, एजेंट ट्रेस और कलाकृतियों को पुनरुत्पादनीय स्थैतिक HTML bundle के रूप में स्वतः कैप्चर करता है। 🔗 स्रोत
  • Antigravity CLI संस्करण 1.1.8 पर जाता है — print मोड के लिए संरचित आउटपुट फ़ॉर्मेट (json, stream-json), कस्टम JSON schema के माध्यम से validation, और संयोजित commands के लिए बेहतर अनुमतियाँ। 🔗 स्रोत
  • GitHub Models आधिकारिक रूप से हटाया गया — playground, मॉडल कैटलॉग, inference API और BYOK अब किसी भी ग्राहक के लिए उपलब्ध नहीं हैं; GitHub उपयोगकर्ताओं को Microsoft Foundry या GitHub Copilot की ओर पुनर्निर्देशित करता है। 🔗 स्रोत
  • GitHub ने remote control को प्रबंधित उपकरणों तक सीमित किया — remote control Copilot sessions के लिए नया enterprise सेटिंग remoteControl (requireSSO / disabled / enabled), जिसे private repository, MDM या configuration file के माध्यम से तैनात किया जा सकता है। 🔗 स्रोत
  • Kimi K3 (Max) Fullstack Code Arena रैंकिंग में शीर्ष पर आता है — GPT-5.6 Sol (xHigh) और Claude Fable 5 से आगे, यह एक और संकेत है कि खुले मॉडल पूर्ण विकास कार्यों पर बंद मॉडलों के करीब पहुँच रहे हैं (ऊपर Inkling-Small देखें)। 🔗 स्रोत

इसका क्या अर्थ है

मूलभूत शोध प्रयोगशाला से बाहर आ रहा है। Claude Mythos NIST के एक post-quantum उम्मीदवार और AES के एक कमजोर संस्करण में नई खामियाँ खोजता है — यह एक शोध-प्रगतिशील उपलब्धि है, न कि उत्पादन में शोषण योग्य दोष, लेकिन यह दिखाती है कि एक आंतरिक शोध मॉडल उस क्षेत्र में कितनी तेज़ी से आगे बढ़ सकता है जिसे मनुष्य दशकों से अध्ययन कर रहे हैं। उसी दिन, Gemini Robotics ER 2 embodied robotics को एक अकेले आदेश मानने वाले रोबोट से कई मशीनों तक ले जाता है जो साझा कार्य के लिए आपस में समन्वय करती हैं। Google Earth भी छवि-जनन को वास्तविक दुनिया में लंगर डालता है: Nano Banana अब कोई सामान्य दृश्य नहीं बनाता, बल्कि किसी विशिष्ट स्थान की सैटेलाइट इमेजरी से एक पुनर्निर्माण या प्रक्षेपण बनाता है — जबकि Gemini Spark, Chrome के माध्यम से, पाठ से उपयोगकर्ता के वास्तविक वेब पर ठोस कार्रवाई तक जाता है। 30 जुलाई को, AI को पूरी तरह संवादात्मक क्षेत्र से बाहर निकालने के चार अलग-अलग तरीके।

इन्फ़रेंस की अर्थव्यवस्था लगातार डेवलपर्स के पक्ष में पलट रही है। OpenAI GPT-5.6 Luna की API कीमतों को 80% और Terra की 20% घटाता है, साथ ही Fast मोड पेश करता है जो दोगुना महंगा लेकिन 2.5 गुना तेज़ है — उपयोग के वास्तविक स्वरूप के साथ मूल्य को मिलाने के दो विपरीत तरीके। उसी दिन, OpenAI का एक विश्लेषण दिखाता है कि API की बस एक कॉन्फ़िगरेशन-परिवर्तन (reasoning बरकरार, compaction) GPT-5.6 Sol के ARC-AGI-3 पर स्कोर को तीन गुना कर देता है, जबकि आउटपुट टोकन की खपत को छह गुना घटा देता है — किसी मॉडल का प्रदर्शन उतना ही उसके harness पर निर्भर करता है जितना स्वयं मॉडल पर। Cognition अपने स्वयं के benchmark FrontierCode को अपडेट करके इसका तात्कालिक परिणाम निकालता है: नई छूटों के साथ GPT-5.6 लागत/प्रदर्शन Pareto वक्र पर आ जाता है।

खुले मॉडल बंद मॉडलों की बराबरी करते जा रहे हैं। Thinking Machines Inkling-Small को day-0 उपलब्ध NVIDIA हार्डवेयर समर्थन के साथ प्रकाशित करता है; Sakana AI और NYU Minecraft के लिए एक डेटा सेट और जनरेटिव मॉडल खोलते हैं; LightOn बहुभाषी सूचना-खोज मॉडल का अपना संग्रह प्रकाशित करता है — तीन अलग-अलग प्रयोगशालाएँ, जो उसी दिन अपने काम को लॉन्च और दस्तावेज़ित करने के लिए एक ही चैनल, Hugging Face ब्लॉग, को चुनती हैं। Kimi K3 (Max), जो पहले ही Agent Arena रैंकिंग में शीर्ष पर था, Fullstack Code Arena रैंकिंग में भी पहली जगह लेता है, GPT-5.6 Sol और Claude Fable 5 से आगे। और Together AI, Y Combinator के साथ, इस पारिस्थितिकी तंत्र की अंतिम वास्तविक बाधा — कंप्यूट तक पहुँच — पर हाथ डालता है, YC पोर्टफोलियो की AI स्टार्टअप्स के लिए एक समर्पित GPU क्लस्टर देकर, बिना उन्हें बहुवर्षीय प्रतिबद्धताओं के लिए बाध्य किए।

कोड एजेंटों का औद्योगिकीकरण तेज़ हो रहा है। Cursor में, क्लाउड एजेंटों से आने वाली मर्ज्ड pull requests का हिस्सा दिसंबर में 10% से बढ़कर आज 56% हो गया है। GitHub सार्वजनिक प्रीव्यू में stacked pull requests को सामान्य बनाता है, और Devin (Cognition) उन्हें उसी दिन मूल रूप से समर्थन देता है — एक ही review workflow, जिसे एक साथ प्लेटफ़ॉर्म और एजेंट दोनों पक्षों ने अपनाया है। Amp Labs, अपनी ओर से, अब अपनी एजेंट के अलावा मैदान पर मानवीय उपस्थिति भी बेचता है (Westpac के लिए Sydney में ऑन-साइट टीम), जबकि GitHub Visual Studio में Copilot को अपने SDK-आधारित नए एजेंट से समृद्ध करता है। Genspark और Perplexity एक संबद्ध समस्या, यानी मेमोरी, पर आगे बढ़ते हैं: SecondBrain और Projects दोनों अपने एजेंटों को सत्रों के बीच स्थायी संदर्भ देते हैं, जो हर बार शून्य से शुरू किए बिना लंबे कार्यों को पूरा करने की शर्त है।


स्रोत