खोजें

Amp ने मासिक सब्सक्रिप्शन लॉन्च किए, Claude Code ने उछाल-रोधी सुरक्षा-सीमाएँ जोड़ीं, Perplexity ने Computer में Projects लॉन्च किए

Amp ने मासिक सब्सक्रिप्शन लॉन्च किए, Claude Code ने उछाल-रोधी सुरक्षा-सीमाएँ जोड़ीं, Perplexity ने Computer में Projects लॉन्च किए

ai-powered-markdown-translator

जीपीटी-5.4-मिनी के साथ फ्र से हिंदी में अनुवादित लेख।

GitHub पर प्रोजेक्ट देखें ↗

17 जुलाई एजेंटिक कोडिंग टूल्स में आर्थिक मॉडल के बदलाव का दिन है: Amp अपने पहले मासिक सब्सक्रिप्शन लॉन्च करता है, जिससे उसका पूरी तरह उपयोग-आधारित भुगतान समाप्त हो जाता है। Claude Code WebSearch और सब-एजेंट्स के लिए उछाल-रोधी सुरक्षा-सीमाओं के साथ एक नया संस्करण जारी करता है, जबकि Perplexity, Gemini और Grok उद्यम में अपने स्वायत्त-एजेंट प्लेटफ़ॉर्म को मजबूत करते हैं। HeyGen, ElevenLabs और Runway में मीडिया जनरेशन बहुत सक्रिय बनी हुई है, और ओपन रिसर्च दो ऐसे कार्य प्रकाशित करती है जो मौजूदा मॉडलों की सीमाओं पर सवाल उठाते हैं।


Amp अपने पहले मासिक सब्सक्रिप्शन लॉन्च करता है: Megawatt और Gigawatt

17 जुलाई — Amp (Sourcegraph / Amp Frontier Corporation) अपने पहले मासिक सब्सक्रिप्शन बीटा में लॉन्च करता है, जो एक ऐसे उत्पाद के लिए रणनीतिक बदलाव है जो अब तक विशेष रूप से उपयोग-आधारित भुगतान (कच्ची API दरें) पर चलता था — एक ऐसा मॉडल जो इसे सब्सक्रिप्शन वाले प्रतिस्पर्धियों की तुलना में अधिक महंगा बनाता था। अपने घोषणा-पत्र में Amp स्वयं को अब तक “the Apple or Porsche of agentic coding tools” के रूप में वर्णित करता है।

मूल्य योजनामासिक मूल्यशामिल orb घंटेशामिल एजेंट उपयोगउपलब्ध मोड
Megawatt$20750 h (छोटे orbs)$20low, medium
Gigawatt$2001 000 h (बड़े orbs)$200low, medium, high, ultra

Megawatt में अपना ChatGPT सब्सक्रिप्शन लिंक करके GPT-5.6 तक पहुँचने की सुविधा भी शामिल है, या अपना X Premium+/SuperGrok सब्सक्रिप्शन। एक लॉन्च ऑफ़र पहले महीने के लिए शामिल उपयोग (orbs और agents) को दोगुना कर देता है, उन सभी सब्सक्रिप्शनों के लिए जो रविवार 19 जुलाई से पहले लिए गए हों। जो लोग सब्सक्राइब नहीं करना चाहते, उनके लिए उपयोग-आधारित भुगतान जारी रहता है; शामिल सीमाओं से ऊपर, ChatGPT सब्सक्रिप्शन लिंक करना या भुगतान किए गए क्रेडिट जोड़ना आवश्यक है।

Amp इस बदलाव को अच्छी गुणवत्ता वाले tokens की लागत में सामान्य गिरावट (उदाहरण के तौर पर नए “low” मोड में GLM-5.2) और एजेंटिक काम के स्थानीय workstation के बजाय दूरस्थ मशीनों (“orbs”) की ओर स्थानांतरित होने से उचित ठहराता है — कंपनी का कहना है कि वह चाहती है कि उपयोगकर्ता “tuent leur environnement de développement local singleton”.

“Introducing Amp Subscriptions. $20 or $200 gets you on the agentic frontier with us.”

🇮🇳 Amp सब्सक्रिप्शन का परिचय। 20 या 200 डॉलर आपको हमारे साथ एजेंटिक फ्रंटियर तक पहुँच देते हैं।X पर @sqs

🔗 Amp सब्सक्रिप्शन, आखिरकार


Claude Code और Amp : नई एजेंटिक क्षमताएँ

Claude Code CLI v2.1.212 : उछाल-रोधी सुरक्षा-सीमाएँ

16 जुलाई — Anthropic Claude Code का संस्करण 2.1.212 जारी करता है (पेरिस समय 21:20 पर npm पर प्रकाशित)। सबसे दिखाई देने वाला बदलाव /fork से संबंधित है: कमांड अब बातचीत को बैकग्राउंड में एक नई session में कॉपी करती है (claude agents में दिखाई देती है), जबकि session में शुरू किया गया पुराना sub-agent /subtask नाम से दिखता है। दो उछाल-रोधी सुरक्षा-सीमाएँ दिखाई देती हैं: WebSearch टूल कॉल्स पर प्रति-session सीमा (डिफ़ॉल्ट 200, CLAUDE_CODE_MAX_WEB_SEARCHES_PER_SESSION के माध्यम से समायोज्य) और लॉन्च किए जा सकने वाले sub-agents की संख्या पर एक अधिकतम सीमा (डिफ़ॉल्ट 200, CLAUDE_CODE_MAX_SUBAGENTS_PER_SESSION)। दो मिनट से अधिक चलने वाले MCP टूल कॉल्स अब स्वतः बैकग्राउंड में चले जाते हैं।

दो सुधार सुरक्षा से जुड़े हैं: plan mode अब permission prompt के बिना फ़ाइलें संशोधित करने वाली Bash कमांड्स (touch, rm) निष्पादित नहीं कर सकता, और .claude/worktrees में commit किए गए symlink का अनुसरण करने वाला worktree अब repository के बाहर फ़ाइलें नहीं लिख सकता।

🔗 CHANGELOG Claude Code

Amp : एजेंट अब अन्य एजेंट भी spawn कर सकते हैं

17 जुलाई — Amp “From Agent to Agent” लॉन्च करता है: Amp एजेंट अब अन्य एजेंटों को जन्म दे सकते हैं (spawn) — orbs (दूरस्थ मशीनों) में, स्थानीय मशीन पर, या किसी अन्य मशीन पर — और उनके बीच संदेशों और फ़ाइलों का आदान-प्रदान कर सकते हैं।

Amp द्वारा उद्धृत उपयोग-मामले: उपयोगकर्ता अपने मुख्य काम को जारी रखते हुए एक orb में एजेंट लॉन्च करके किसी द्वितीयक बग को संभालना, कई threads को समानांतर चलाना (उदाहरण के लिए “low” मोड में चार threads ताकि चार अलग-अलग स्क्रीन आकारों पर एक flow का परीक्षण किया जा सके), छोड़े गए पुराने thread से उपयोगी फ़ाइलें वापस पाना, किसी कार्य को दूसरी मशीन पर भेज देना, या किसी API बदलाव का दस्तावेज़ीकरण करने के लिए एक एजेंट भेजकर cross-project काम का समन्वय करना। यह सुविधा “Agents in Orbs” (30 जून) और “Custom Agents” (19 जून) का विस्तार करती है, लेकिन threads और machines के पार एजेंट-से-एजेंट संचार पहली बार पेश करती है। सह-संस्थापक Thorsten Ball ने आधिकारिक लॉन्च से कुछ घंटे पहले X पर इस सुविधा का teaser दिया था।

🔗 From Agent to Agent


स्वायत्त एजेंट : उद्यम में स्वचालन और उत्पादकता

Ascendea में Manus (James) : 90× उत्पादकता केस स्टडी

17 जुलाई — Manus एक केस स्टडी प्रकाशित करता है जिसमें Ascendea को सामने रखा गया है, जो वारविक विश्वविद्यालय के Science Park में स्थित एक ब्रिटिश एजेंसी है, जो छोटे व्यवसायों के लिए CRM, agents और automations विकसित करती है। इसके CTO Rob Arnold ने अपने Manus instance का नाम “James” रखा है और उसे कंपनी का AI chief of staff बना दिया है, जो तीन-स्तरीय architecture के शीर्ष पर है: जटिल कार्यों के लिए Manus, रोज़मर्रा के मानव इंटरफ़ेस के लिए Slack conversational agents (Victor, Victoria, Ava), और एक समर्पित server पर निर्धारित दोहरावदार कार्यों को चलाने वाले छह स्थानीय agents।

मुख्य उपयोग-मामला: 303 standard operating procedures (SOP) एक ही दिन में उत्पन्न किए गए, जो मैनुअल तरीके से दो लोगों के लिए लगभग 14 सप्ताह का काम माना गया। Ascendea आज केवल 10 मानव कर्मचारियों के साथ काम करता है, 112 सक्रिय ग्राहकों की सेवा करता है और Manus के माध्यम से समन्वित 28 से 33 IA workflow production में चलाता है।

🔗 Ascendea केस स्टडी

Perplexity Computer में Spaces का विकास Projects लॉन्च करता है

17 जुलाई — Perplexity Projects की घोषणा करता है, जो Perplexity Computer, उसके agentic environment, में Spaces का अगला संस्करण है। Projects फ़ाइलों, applications और conversation threads को एक ही persistent session में एकत्र करता है: हर नया task पिछली sessions के पूरे context के साथ शुरू होता है।

यह सुविधा enterprise teams को लक्षित करती है: यह Drive, Notion, Linear, Salesforce, Snowflake या Slack/Microsoft Teams जैसे tools को जोड़ती है (400 से अधिक connectors घोषित), जबकि प्रत्येक उपयोगकर्ता के data, memory और access को अलग रखती है। Projects Brain, Computer की self-learning memory system, पर आधारित है, Skills के साथ एकीकृत होता है, और connected sources तथा response traceability की सूची वाला एक “trust panel” प्रदान करता है। मौजूदा Spaces अपने-आप migrate हो जाते हैं, और यह आज से सभी Computer users के लिए उपलब्ध है। उल्लेखनीय बात: आधिकारिक page पर publication date 22 जुलाई दिखाई गई है, जबकि यह पहले से ही 17 जुलाई से online और publicly accessible है।

🔗 Perplexity Projects घोषणा

Grok में Automations

16 जुलाई — xAI Grok में Automations लॉन्च करता है: किसी task का वर्णन एक बार करें, फिर उसे स्वतः चलने दें — एक schedule पर (एक बार, दैनिक, कार्यदिवसों में, साप्ताहिक, मासिक या वार्षिक) या किसी निर्धारित फ़िल्टर से मेल खाने वाले email के आने पर ट्रिगर होकर। हर execution Grok के साथ एक पूरी conversation खोलती है, जिसे runs के इतिहास में देखा जा सकता है, और email, application notification, दोनों, या कुछ भी नहीं द्वारा सूचित किया जा सकता है।

Automations grok.com और Grok mobile app (iOS, Android) में उपलब्ध हैं। Scheduled automations सभी उपयोगकर्ताओं के लिए उपलब्ध हैं, जबकि email-trigger वाले SuperGrok subscribers के लिए आरक्षित हैं।

🔗 Automations in Grok


Google / Gemini : उद्यम एजेंट प्लेटफ़ॉर्म

Conductor एक portable plugin बन गया, Antigravity CLI और Claude के साथ संगत

16 जुलाई — Conductor, Gemini CLI के लिए पिछले साल लॉन्च किया गया spec-driven development extension, अब Conductor Plugin बन गया है, एक ऐसा format जो skills, rules, MCP servers और hooks को एक ही package में समेटता है। अब तक केवल Gemini CLI से जुड़ा Conductor अब Antigravity CLI और Claude में भी उपयोग किया जा सकता है।

एजेंट अब context, specifications (spec.md) और plan (plan.md) उत्पन्न करने और विकसित करने के लिए स्वाभाविक रूप से संवाद करता है, जिन्हें persistent Markdown artifacts और versioned रूप में संग्रहीत रखा जाता है। Google पुराने commands के साथ backward compatibility और TerminalBench के सबसे जटिल task subset पर बेहतर success rate की बात करता है। Antigravity CLI के लिए installation agy plugins install https://github.com/gemini-cli-extensions/conductor के माध्यम से की जाती है।

🔗 आधिकारिक घोषणा

Gemini Enterprise Agent Platform ने Parallel Web Systems के साथ साझेदारी की

16 जुलाई — Google Cloud Parallel Web Systems (Twitter के पूर्व CEO Parag Agrawal द्वारा स्थापित) के साथ एक साझेदारी की घोषणा करता है, ताकि अपनी search infrastructure को Gemini Enterprise Agent Platform पर नए web grounding provider के रूप में मूल रूप से एकीकृत किया जा सके। उद्देश्य: agents को हालिया और सत्यापन योग्य web results, सटीक citations के साथ, पर भरोसा करने देना, जैसे स्वचालित KYC checks या product catalog enrichment जैसे कार्यों के लिए।

यह सुविधा Gemini API के माध्यम से उपलब्ध है, Agent Studio में चयन योग्य है, और Google Cloud Marketplace के माध्यम से उपयोग-आधारित बिलिंग के साथ आती है, संवेदनशील workloads के लिए zero data retention विकल्प सहित। पारंपरिक web search के विपरीत, यह एकीकरण आंतरिक databases को समृद्ध करने के लिए data के extraction और स्थायी caching की अनुमति देता है, साथ ही अन्य LLMs द्वारा परिणामों के post-processing की भी। Parag Agrawal के अनुसार, AI agents जल्द ही web का उपयोग इंसानों की तुलना में कहीं अधिक करेंगे, जिसके लिए उनके कार्यप्रणाली के अनुरूप डिज़ाइन की गई search infrastructure की आवश्यकता होगी।

🔗 आधिकारिक घोषणा


मीडिया जनरेशन

HeyGen — Batch APIs उत्पादन में

17 जुलाई — HeyGen अपनी Batch APIs online करता है, जिससे एक ही request में 100 तक videos, translations, lipsyncs या uploads भेजे जा सकते हैं, और lot संसाधित होने के बाद सूचना के लिए केवल एक webhook होता है। यह सुविधा बड़े पैमाने पर production उपयोग-मामलों — agencies, marketing teams — को लक्षित करती है, जिन्हें पहले समान content volume के लिए सैकड़ों individual API calls संभालनी पड़ती थीं।

🔗 X पर घोषणा — साथ ही तकनीकी दस्तावेज़ीकरण भी देखें

HeyGen — HyperFrames को एक एकीकृत मीडिया लाइब्रेरी मिली

17 जुलाई — HeyGen HyperFrames में एक एकीकृत media library जोड़ता है, जो code द्वारा video निर्माण का उसका tool है (write HTML, render video)। इसमें 10,000 से अधिक audio tracks, 75,000 images, sound effects और logos शामिल हैं, जो HeyGen account के साथ मुफ़्त उपलब्ध हैं, साथ ही in-house generative models तक पहुँच भी। उपयोग किए गए assets स्थानीय रूप से सहेजे जाते हैं, जिससे हर नए project पर फिर से खोज करने की ज़रूरत नहीं पड़ती।

🔗 X पर घोषणा

ElevenLabs — Sir Michael Caine की AI आवाज़ में सुनाई गई The Odyssey

17 जुलाई — ElevenLabs Homer की The Odyssey का पूरा पाठ Sir Michael Caine की पूर्ण-लाइसेंस प्राप्त AI आवाज़ में प्रस्तुत करता है, जो ElevenReader application पर मुफ़्त उपलब्ध है। यह एक और पूरी तरह अधिकृत celebrity voice partnership का उदाहरण है, जो ElevenLabs की उस रणनीति की निरंतरता में है जिसमें वह सामान्य synthesis के बजाय आधिकारिक रूप से licensed AI voices के माध्यम से premium audio content प्रदान करता है।

🔗 X पर घोषणा

Runway Agent 2.0 स्वतंत्र Physion-Arc 1.0 benchmark में #1 रैंक पर

16-17 जुलाई — Runway स्वतंत्र benchmark Physion-Arc 1.0 के परिणामों को सामने रखता है, जिसे 16 जुलाई को तीसरे पक्ष के evaluator Physion Labs द्वारा प्रकाशित किया गया था, जिसने 16 metrics पर आंके गए 30 cinematic prompts के लिए छह AI video agents को परखा। Runway Agent (version 2.0, जून के अंत में लॉन्च) मूल्यांकित तीन स्तंभों में शीर्ष पर आता है: narrative consistency, cinematic language और production quality।

Runway ने Agent के पीछे की philosophy को विस्तार से बताने वाला एक तकनीकी लेख भी प्रकाशित किया: chat के बजाय visual-केंद्रित interface, एक ऐसा system जो प्रत्येक underlying model की ताकतों और कमजोरियों के ज्ञान को encode करता है, और capabilities को workflow में जोड़ने वाली “skills” की एक layer। अगले विचारों में शामिल हैं: sessions के बीच context memory, batch creation और Agent में सीधे task scheduling।

🔗 X पर घोषणा


शोध एवं खुले मॉडल

Sakana AI — “Diffusing Blame” शोध: RL पर लागू Dale सिद्धांत

17 जुलाई — Sakana AI “Diffusing Blame” प्रकाशित करता है, एक शोध जो यह खोजता है कि क्या एक neural network Dale के सिद्धांत का कड़ाई से पालन करते हुए प्रतिस्पर्धात्मक तरीके से सीख सकता है — वह जैविक constraint जिसके अनुसार एक neuron अपने पड़ोसियों के प्रति केवल excitatory या inhibitory हो सकता है, दोनों नहीं। यह लेख #ALIFE2026 सम्मेलन में स्वीकार किया गया है और arXiv पर उपलब्ध है।

उसी thread के दूसरे post में, टीम ED-PPO प्रस्तुत करती है, जो reinforcement learning algorithm PPO (Proximal Policy Optimization) का एक संस्करण है, जिसमें इस जैविक constraint का सम्मान करने वाला error diffusion mechanism शामिल है, जिसे एक control task पर प्रदर्शित किया गया है। यह काम जैव-प्रेरित architectures पर Sakana AI की शोध-रेखा का हिस्सा है, जो उसके अधिक व्यावसायिक product announcements से अलग है।

🔗 X पर घोषणा

PerceptionBench : कोई भी मॉडल 60% सटीकता से ऊपर नहीं जाता (Kimi / Moonshot AI)

16 जुलाई — Kimi team PerceptionBench प्रकाशित करती है, एक benchmark जो बड़े multimodal models की दृश्य perception को दस atomic क्षमताओं में अलग करता है: दृश्य संबंध, गिनती, attribute, depth और 3D, localization, comparison, fine recognition, contextual integration, OCR और hallucination। ये श्रेणियाँ 40 से अधिक मौजूदा benchmarks पर frontier models की वास्तविक विफलताओं के विश्लेषण से निकाली गई हैं। dataset में 3,000 सत्यापित प्रश्न शामिल हैं, जिनमें से प्रत्येक का उत्तर केवल observation से दिया जा सकता है, बिना reasoning या बाहरी knowledge की आवश्यकता के।

“No model we evaluate clears 60% accuracy, and models with nearly identical overall scores can exhibit very different perceptual strengths and weaknesses.”

🇮🇳 मूल्यांकन किए गए किसी भी मॉडल की सटीकता 60% से अधिक नहीं है, और लगभग समान समग्र स्कोर वाले मॉडल perceptive ताकतों और कमजोरियों के मामले में बहुत भिन्न हो सकते हैं। — Kimi Team, PerceptionBench

यह benchmark उसी दिन प्रकाशित Kimi K3 की technical sheet में भी multimodal evaluation tool के रूप में उद्धृत किया गया है।


संक्षिप्त समाचार

  • Built with Claude: Life Sciences हैकाथॉन का समापन — Gladstone Institutes और Cerebral Valley के साथ सह-आयोजित, इसने Trialign (क्लिनिकल परीक्षण मिलान), NCypher (बाल कैंसर DNA विश्लेषण), Extremolith (प्रतिरोधी प्रोटीन डिज़ाइन) और Lazarus (छोड़े गए शोध कोड के पुनर्निर्माण के लिए एजेंट) को सम्मानित किया। 🔗 source
  • Boris Cherny — उद्यम में AI अपनाना — Claude Code के निर्माता ने उन चार चरणों का वर्णन किया है जिन्हें वे टीमों में AI अपनाने के दौरान देखते हैं; यह उत्पाद घोषणा से अधिक संपादकीय सामग्री है। 🔗 source
  • Hugging Face — NVIDIA का NeMo AutoModel अब Diffusers को सपोर्ट करता है — NVIDIA की open source fine-tuning लाइब्रेरी, जो पहले से Transformers को कवर करती थी, अब Hugging Face की image generation लाइब्रेरी Diffusers को भी सपोर्ट करती है। 🔗 source
  • Antigravity 2.3.1 — एक malformed configuration bug को ठीक करने वाला पैच, जो Google के agentic IDE को शुरू होने से रोक रहा था; कोई नई सुविधा नहीं। 🔗 source
  • GitHub Mobile: PR टिप्पणियों पर Fix with Copilot बटन — यह बटन, जो वेब पर पहले से मौजूद था, अब मुख्य pull request view और हर review comment से, iOS और Android पर उपलब्ध है। 🔗 source
  • NVIDIA Nemotron 3 Embed 8B — LMEB पर भी नंबर 1 — RTEB पर पहले स्थान के बाद, embeddings मॉडल ने LMEB leaderboard पर भी बढ़त हासिल कर ली है, जो लंबी बातचीत की memory का मूल्यांकन करता है; संबंधित 1B मॉडल दूसरे स्थान पर आता है। 🔗 source
  • HeyGen HyperFrames — दिन 12/30: गतिशील कैप्शन — एनिमेटेड, शब्द-स्तर पर सिंक किए गए कैप्शन, जिन्हें HyperFrames catalog में उपयोग-तैयार components के रूप में दिया गया है। 🔗 source
  • Kling AI — Seoul में NextGen Awards समारोह का सार — उस समारोह की पुनरावलोकन जिसमें Kling AI का visual storytelling के लिए उपयोग करने वाले creators को सम्मानित किया गया, जिनमें Jo Ryeongmi भी शामिल हैं, उनके short film The Well के लिए। 🔗 source
  • Runway — R/GA केस स्टडी: AI avatar « Forever Founder » — R/GA agency ने Runway Characters API के साथ अपने founder का real-time AI avatar बनाया, अपने 50वें जन्मदिन के लिए; इसने 20 conversations में 145 प्रश्नों के उत्तर बिना किसी तकनीकी घटना के दिए। 🔗 source
  • ZCode: ब्राउज़र और कंप्यूटर उपयोग तैयारी में — Z.ai अपने ZCode development environment के लिए browser use और computer use की भविष्य की क्षमता का teaser दे रहा है, बिना विवरण या तारीख के। 🔗 source
  • AI युग के लिए एक scorecard (OpenAI) — कंपनी में AI के निवेश पर प्रतिफल को मापने पर CFO Sarah Friar की पोस्ट (« Useful Intelligence per Dollar »), ChatGPT Work द्वारा चित्रित, बिना किसी नए उत्पाद की घोषणा के। 🔗 source

इसका क्या मतलब है

Amp का subscription की ओर रुख, Claude Code के नए guardrails (WebSearch सीमाएँ और sub-agents) और अन्य agents को जन्म देने की Amp agents की क्षमता के साथ मिलकर, agentic coding tools के लिए एक ही दिशा दिखाता है: usage-based भुगतान के साथ असीमित वृद्धि के चरण के बाद, उद्योग अब आर्थिक संरचना और governance के चरण में प्रवेश कर रहा है। एक predictable subscription वसूलना और साथ ही यह सीमित करना कि एक session कितने sub-agents उत्पन्न कर सकता है, एक ही समस्या को दो सिरों से हल करता है: प्रकाशक और उपयोगकर्ता दोनों के लिए ऐसी computing को टिकाऊ बनाना, जिसमें agents अब दूसरे agents को श्रृंखला में शुरू कर सकते हैं।

Perplexity Projects, Gemini Enterprise-Parallel Web Systems का संयोजन, और Grok के Automations उद्यम के लिए एक ही पैटर्न की ओर संकेत करते हैं: persistent context, मौजूदा business tools के लिए connectors, और planning या trigger पर autonomous execution। Ascendea केस स्टडी, जहाँ दस human employees Manus के माध्यम से production में 28 से 33 AI workflows चलाते हैं, दिखाती है कि यह तर्क एक छोटी संरचना में कहाँ तक जा सकता है — एक चरम मामला जो बहुत बड़ी organizations को भी पूछना पड़ेगा।

मीडिया generation की तरफ, HeyGen अपनी production infrastructure (Batch APIs, HyperFrames में integrated media library) को विस्तारित कर रहा है, जबकि ElevenLabs पूरी तरह licensed celebrity voice partnerships पर दांव लगा रहा है और Runway अपने design choices को एक independent third-party benchmark से मान्य करवा रहा है। इस तरह क्षेत्र demonstration logic से production infrastructure logic की ओर बढ़ रहा है, जहाँ scale, license और external evaluation अपने-आप में बिक्री तर्क बन जाते हैं।

अंत में, open research याद दिलाता है कि बुनियादें अभी भी सुधार योग्य हैं: Sakana AI का « Diffusing Blame » न्यूरल नेटवर्क्स को प्रशिक्षित करने के लिए एक नई जैविक बाधा का अन्वेषण करता है, जबकि Kimi का PerceptionBench दिखाता है कि कोई भी मौजूदा multimodal model बुनियादी दृश्य धारणा कार्यों पर 60% accuracy से आगे नहीं जाता। यह प्रतिपक्ष, दिन की product announcements के पीछे, याद दिलाता है कि मॉडलों की perceptual और architectural क्षमताएँ अभी भी ऐसे blind spots रखती हैं जिन्हें फीचर-रेस अपने-आप नहीं भरती।


स्रोत