खोजें

Claude Code डिफ़ॉल्ट रूप से Auto Mode में जाता है, OpenAI में Astra को साइबरसुरक्षा के लिए गंभीर श्रेणी में रखा गया, NVIDIA ने Cosmos 3 का अनावरण किया

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Claude Code डिफ़ॉल्ट रूप से Auto Mode में जाता है, OpenAI में Astra को साइबरसुरक्षा के लिए गंभीर श्रेणी में रखा गया, NVIDIA ने Cosmos 3 का अनावरण किया

ai-powered-markdown-translator

फ्र से hi में अनुवादित लेख gpt-5.4-mini के साथ।

GitHub पर प्रोजेक्ट देखें ↗

7 अगस्त 2026 को, Claude Code Pro, Max और Team योजनाओं के लिए 14 अगस्त से Auto Mode को डिफ़ॉल्ट अनुमति मोड में बदल देता है, जो 1,053 भुगतान करने वाले परीक्षकों पर किए गए एक आंतरिक अध्ययन पर आधारित है, जिसमें 89% खतरनाक आदेशों को रोका गया बनाम मैनुअल समीक्षा में 14%। उसी दिन, OpenAI पहली बार अपने आने वाले मॉडलों में से एक, Astra, को अपने Preparedness Framework के तहत साइबरसुरक्षा के लिए गंभीर स्तर पर वर्गीकृत करता है, और NVIDIA Cosmos 3 का अनावरण करता है, जो रोबोटिक्स और स्वायत्त वाहनों के लिए खुले मॉडलों की एक नई परिवार है, जिसे पहले ही Doosan, LG, Samsung और Li Auto अपना चुके हैं। तस्वीर को पूरा करते हैं: Claude Code की सत्रों के बीच संदेश प्रणाली, Claude Fable 5 के जैविक सुरक्षा-गॉर्ड्स में ढील, Runway और Luma पर Seedance 2.5 की सामान्य उपलब्धता, और GitHub Copilot, Gemini तथा एजेंटिक कोड टूल्स की तरफ से लगभग पंद्रह अन्य घोषणाएँ।


Claude Code : Auto Mode 14 अगस्त को डिफ़ॉल्ट अनुमति मोड बन जाता है

7 अगस्त — Anthropic घोषणा करता है कि 14 अगस्त से Auto Mode Claude Code में Pro, Max और Team योजनाओं के उपयोगकर्ताओं के लिए डिफ़ॉल्ट अनुमति मोड बन जाएगा। हर shell कमांड या संवेदनशील कार्रवाई से पहले पुष्टि माँगने के बजाय, Auto Mode एक अलग classifier पर निर्भर करता है जो हर tool call का विश्लेषण करता है और खतरनाक मानी गई commands को उपयोगकर्ता को हर चरण पर रोके बिना स्वतः ब्लॉक कर देता है।

Anthropic इस बदलाव को 1,053 भुगतान करने वाले परीक्षकों पर किए गए एक आंतरिक अध्ययन के आधार पर उचित ठहराता है, जिन्हें एक स्पष्ट रूप से खतरनाक command के लिए permission prompt दिखाया गया था (केवल text, वास्तव में कुछ भी execute नहीं किया गया)। मानव परीक्षकों ने खतरे को केवल 13.6% मामलों में पहचाना, और थकान के प्रभाव से लगातार 50 prompts के बाद यह दर लगभग 5% तक गिर गई। Auto Mode ने, इसके विपरीत, उन्हीं commands को 89% मामलों में रोका, और सत्र की अवधि चाहे जो भी हो, यह दर स्थिर रही।

मापा गया संकेतकमैनुअल स्वीकृतिAuto Mode
प्रारंभिक पहचान13.6%89%
50 prompts के बाद पहचान~5%89% (स्थिर)

एक और ठोस बदलाव: classifier का token surcharge अब Pro, Max और Team योजनाओं की usage limits में नहीं गिना जाएगा, और Auto Mode के हर जगह व्यापक रूप से लागू हो जाने के बाद Enterprise योजनाओं और API तक विस्तार की योजना है। एक in-app notification उपयोगकर्ताओं को इस परिवर्तन के बारे में सूचित करेगी, और administrators defaultMode को pin कर सकते हैं या managed settings के माध्यम से Auto Mode को disable कर सकते हैं।

The team and I use Auto mode exclusively, and have been for many months. I couldn’t imagine going back to permission prompts! Really excited to get this out to everyone.

🇮🇳 टीम के साथ, हम कई महीनों से केवल Auto Mode का उपयोग कर रहे हैं। मैं permission prompts पर वापस जाने की कल्पना भी नहीं कर सकता! इसे सभी के लिए जारी करके वास्तव में बहुत खुशी हुई।@bcherny on X

🔗 @ClaudeDevs की घोषणा


OpenAI Astra को साइबरसुरक्षा के लिए गंभीर स्तर पर वर्गीकृत करता है

7 अगस्त — OpenAI घोषणा करता है कि उसका भविष्य का मॉडल Astra साइबरसुरक्षा के लिए गंभीर (Critical) स्तर पर वर्गीकृत होने वाला पहला मॉडल है, अपने Preparedness Framework के तहत, जिसे पहली बार दिसंबर 2023 में प्रकाशित किया गया था। पिछले मॉडल, जिनमें GPT-5.6 Sol भी शामिल है, इस अक्ष पर केवल उच्च (High) स्तर पर मूल्यांकित किए गए थे।

ढाँचे के अनुसार, कोई मॉडल साइबरसुरक्षा में गंभीर सीमा तक तब पहुँचता है जब वह कई कड़े सुरक्षित critical systems पर मानव हस्तक्षेप के बिना functional zero-day exploits की पहचान और विकास कर सकता है, या एक साधारण उच्च-स्तरीय लक्ष्य से पूरी तरह end-to-end एक नई cyberattack strategy तैयार कर सकता है। हाल के दिनों में Astra पर किए गए internal evaluations, बाहरी expert reviews के साथ मिलकर, OpenAI को इस निष्कर्ष पर ले आए हैं कि वह इस स्तर की क्षमता को खारिज नहीं कर सकता — इसलिए यह transparency note, पूर्ण testing campaign समाप्त होने से पहले ही प्रकाशित किया गया। कंपनी स्पष्ट करती है कि Astra हाल के Hugging Face security incident में शामिल नहीं था।

इसके परिणामस्वरूप, OpenAI अपने internal controls कड़े कर रहा है: अलग-थलग test environments, नेटवर्क और tool access पर प्रतिबंध, model weights का मजबूत encryption, बढ़ी हुई monitoring और sandbox execution। Astra से जुड़ी वे internal activities जो अभी इन आवश्यकताओं का पालन नहीं करतीं, उन्हें रोक दिया गया है, और monitors अब model की reasoning chain को उसकी सभी agentic applications पर विश्लेषित करते हैं ताकि उच्च जोखिम वाले व्यवहार की स्थिति में security response शुरू की जा सके।

After evaluating one of our upcoming models, Astra, we’re treating it as our first “critical” model for cybersecurity under our Preparedness Framework. This is a scenario we’ve planned for, and we’re putting additional controls in place to ensure Astra’s further development happens safely and securely.

🇮🇳 हमारे भविष्य के मॉडलों में से एक, Astra, का मूल्यांकन करने के बाद, हम इसे अपने Preparedness Framework के तहत साइबरसुरक्षा के मामले में अपने पहले “गंभीर” मॉडल के रूप में मान रहे हैं। यह एक ऐसा परिदृश्य था जिसकी हमने आशंका की थी, और हम Astra के विकास के अगले चरण को सुरक्षित और संरक्षित तरीके से आगे बढ़ाने के लिए अतिरिक्त नियंत्रण लागू कर रहे हैं।@OpenAI on X

🔗 OpenAI पारदर्शिता नोट


NVIDIA भौतिक AI के लिए खुले मॉडलों की एक परिवार Cosmos 3 का अनावरण करता है

6 अगस्त — NVIDIA ने Cosmos 3 का अनावरण किया, जो भौतिक AI — robotics, autonomous vehicles, embedded vision — को समर्पित खुले मॉडलों की एक नई परिवार है, जिसे Into the Omniverse श्रृंखला के हिस्से के रूप में प्रकाशित किया गया है। तीन आकार प्रस्तुत किए गए हैं: उच्च-निष्ठा modeling के लिए Cosmos 3 Super, efficient reasoning के लिए Cosmos 3 Nano, और embedded deployment के लिए Cosmos 3 Edge।

Cosmos 3 संस्करणपैरामीटरलक्षित उपयोग
Cosmos 3 Super64 billionउच्च-निष्ठा modeling
Cosmos 3 Nano16 billionefficient reasoning
Cosmos 3 Edge4 billionembedded deployment

यह परिवार कई बेंचमार्क पर पहले स्थान का दावा करता है: Artificial Analysis (text-to-image और image-to-video, खुले weights के साथ), PAI-Bench (world generation) और RoboLab (robotic policies)। कई उद्योगों ने पहले ही इसके adoption की घोषणा कर दी है — robotique पक्ष में Doosan Robotics, LG Electronics, Samsung Electronics और Skild AI, autonomous vehicles पक्ष में Li Auto, Xiaomi और Afari — और NVIDIA Cosmos Coalition ने अपनी गतिविधियाँ जापान तक बढ़ा दी हैं। मॉडल Hugging Face और GitHub पर OpenMDW 1.1 खुली license के तहत उपलब्ध हैं।

🔗 NVIDIA — भौतिक AI के लिए खुले विश्व मॉडल


Claude Code और Claude Fable 5 : Anthropic की ओर से दो नई घोषणाएँ

Claude Code sessions अब एक-दूसरे से बात कर सकती हैं

7 अगस्त — Claude Code inter-session messaging प्रस्तुत करता है: किसी कार्य का context दूसरी session में फिर से समझाने के बजाय, अब Claude को स्वयं जानकारी transmit करने के लिए कहना संभव है। भेजा गया संदेश एक सारांश है — पूरा इतिहास या मूल session की files नहीं — जिसे प्राप्त करने वाली session कार्य के दौरान ही उठा लेती है, बिना शून्य से शुरू किए। यह सुविधा दोनों दिशाओं में काम करती है: एक session दूसरी से पूछ सकती है और उत्तर अपनी conversation में प्राप्त कर सकती है, या Claude स्वयं यह संदेश शुरू कर सकता है जब कोई modification parallel task को प्रभावित करे — एक ही refactor पर दो agents को समन्वित करने के लिए उपयोगी। अभी macOS और Linux पर उपलब्ध।

🔗 @ClaudeDevs की घोषणा

Claude Fable 5 ने अपने biology safeguards को ढीला किया, -85% false positives

7 अगस्त — Anthropic ने false positives कम करने के लिए Claude Fable 5 के biological safeguards को अपडेट किया है। internal tests के अनुसार, यह अपडेट biological विषयों पर गलत तरीके से triggered fallback मामलों को लगभग 85% तक घटा देता है, सभी product surfaces पर — Fable अब स्वास्थ्य और शिक्षा से जुड़े सामान्य प्रश्नों की एक व्यापक श्रृंखला को अनावश्यक ब्लॉकिंग के बिना संभाल सकता है। safeguard dual-use उपयोगों — virology, toxicology, molecular design — के लिए सक्रिय रहता है, जो Opus 5 की ओर बहे चलते हैं: इसलिए Fable 5 का उपयोग पेशेवर biology research या दवा विकास के लिए नहीं किया जा सकता। Anthropic कहता है कि वह समर्पित trusted access paths के माध्यम से इस अंतर को पाटने पर काम कर रहा है।

🔗 @claudeai की घोषणा


Code टूल्स : Amp pricing, Replit SSO और Codex security review

Amp ने अपनी orbs की pricing और size को पुनर्गठित किया

7 अगस्त — Amp एक नया orb size a1.medium (4 CPU, 8 Go RAM) जोड़ता है, जो पुराने a0.medium से 50% सस्ता है और अधिकांश projects के लिए बेहतर उपयुक्त है। inactivity के बाद automatic pause delay 15 से घटकर 5 minutes हो जाता है, जिससे background में भूल गए orbs का bill कम होता है। अब amp -ox command और उसके flag --orb-size के माध्यम से discussion thread द्वारा orb size चुनना भी संभव है।

Orb sizeCPUMemoryप्रति घंटा कीमत
a1.tiny12 Go0.08 $
a1.medium48 Go0.33 $
a1.xxlarge1632 Go1.32 $

🔗 Amp — उत्पादन के orbs का आकार तय करें

Replit ने Okta और Entra ID SSO जोड़ा, अक्टूबर तक मुफ़्त

6 अगस्त — Replit अपनी generated applications में, Clerk के साथ साझेदारी में, enterprise single sign-on (SSO) जोड़ता है। Pro plan के ग्राहक अपने agent से Okta या Entra ID (OIDC या SAML) को सीधे अपने application में configure करवाने के लिए कह सकते हैं, identity provider की manual configuration के बिना। यह विकल्प 1 अक्टूबर 2026 तक बिना अतिरिक्त लागत के उपलब्ध है। multi-factor, session duration और verification frequency भी agent के माध्यम से, एक समर्पित authentication command center में configure की जा सकती है।

🔗 @Replit की घोषणा

Codex Security Review : pull request सुरक्षा विश्लेषण के लिए research preview

6 अगस्त — OpenAI Codex Security Review को research preview के रूप में लॉन्च करता है, जो ChatGPT Enterprise, Business, Edu और Pro workspaces के लिए उपलब्ध है (Plus पर उपलब्ध नहीं)। परिचय अवधि के दौरान, समीक्षा ChatGPT credits का उपभोग नहीं करती, usage limits के अधीन। यह tool सुरक्षा प्रश्नों पर मौजूदा Code Review से आगे जाता है: यह pull request diff, repository context और एक threat model का विश्लेषण करता है, जो यदि कोई file प्रदान नहीं की गई हो तो स्वतः regenerate हो जाता है। डिफ़ॉल्ट रूप से, automatic reviews High और Critical severity के findings सामने लाती हैं, जबकि manual reviews Medium severity जोड़ती हैं — ये thresholds file path के अनुसार समायोज्य हैं। एक manual review किसी भी समय @codex security review comment के माध्यम से शुरू की जा सकती है।

🔗 @OpenAIDevs की घोषणा


शोध और benchmarks : AI tutors और code duel के लिए मूल्यांकन ढाँचा

Ai2 ने TutorMoments लॉन्च किया, AI tutors के लिए एक मूल्यांकन ढाँचा

7 अगस्त — Ai2 TutorMoments प्रकाशित करता है, एक खुला मूल्यांकन ढाँचा जो मापता है कि क्या मॉडल शिक्षण के एक केंद्रीय संतुलन को संभालना जानते हैं: छात्र को सीधे सहायता देना, या उसे स्वयं सोचने देना। कार्यप्रणाली 462 वास्तविक one-on-one math tutoring sessions (कक्षा 1 से 5) के de-identified transcripts पर आधारित है, जहाँ शिक्षकों ने 1,500 से अधिक महत्वपूर्ण निर्णय क्षणों को annotate किया। पहला निष्कर्ष: prompt बहुत मायने रखता है — एक neutral instruction के साथ, सभी मॉडल जरूरत से ज्यादा मदद करने की प्रवृत्ति रखते हैं, लेकिन prompt में इस trade-off को स्पष्ट करने से scores में स्पष्ट सुधार आता है, और मॉडल-दर-मॉडल काफी भिन्नता दिखती है।

मीट्रिक (स्पष्ट prompt)स्कोर
उपयुक्त scaffolding0.458
बढ़ी हुई rigor0.182
over-scaffolding से बचाव0.496

Ai2 transcripts, pipeline code और raw results को खुले access में प्रकाशित करता है।

🔗 Ai2 — TutorMoments

Together AI ने वास्तविक code पर DeepSeek-V4 Flash-0731 और GPT-5.6 Luna की तुलना की

6 अगस्त — Together AI ने 113 वास्तविक software engineering tasks पर 900 DeepSWE executions चलाईं। GPT-5.6 Luna 67.2% pass@1 के साथ raw accuracy में आगे रहता है, जबकि DeepSeek-V4 Flash-0731 53.3% पर है, 14 अंकों का यह अंतर pass@4 में भी बना रहता है (90.3% बनाम 80.5%)। वास्तविक अंतर cost में है: प्रति execution 0.10 $ पर, DeepSeek 100 $ में 532 tasks हल करता है, जबकि Luna के लिए 0.61 $ प्रति execution पर 110 — यानी प्रति डॉलर लगभग 4.8 गुना अधिक समाधान। एक cascade strategy (पहले DeepSeek, विफल होने पर Luna की ओर escalation) प्रति task 0.385 $ की लागत पर 78.9% tasks हल करती है, जो Luna-only की तुलना में बेहतर दर है और task cost में 37% की कमी लाती है।

🔗 Together AI — DeepSeek बनाम GPT-5.6 Luna तुलना


Gemini : रचनात्मकता और यात्रा

Gemini Omni : पाँच रचनाकार अपने रचनात्मक उपयोग साझा करते हैं

7 अगस्त — Google पाँच रचनाकारों को उजागर करता है जो Gemini Omni — Gemini ऐप, Google Flow, AI Studio और API के माध्यम से उपलब्ध — का उपयोग video editing और केवल कमांड से विचारों के visualisation के लिए करते हैं। Leon Lin एक ही शहरी दृश्य को angle और environment बदलकर 20 अलग-अलग perspectives में कैप्चर करता है; Carlos Santana voice command (दिन/रात, बादल वाला आकाश, बर्फीली जमीन) के माध्यम से एक बाहरी दृश्य को बदलता है; Pan sketches से रोज़मर्रा की वस्तुओं को animate करता है; Jerrod Lew Google Flow में एक ही video पर कई visual styles (वास्तविक शूट, anime, claymation) लागू करता है; Hyperagent landscape design proposals और animated dashboards उत्पन्न करता है। लेख Gemini Omni के केंद्रीय वादे को दर्शाता है: तकनीकी कौशल के बिना, natural language से video editing को सरल बनाना।

🔗 Google — Gemini Omni Builders

Gemini विस्तृत यात्रा itineraries कैसे बनाता है

6 अगस्त — Google चार चरणों में Gemini की यात्रा योजना बनाने की कार्यप्रणाली का विवरण देता है, जो अभी Gemini ऐप में उपलब्ध है। पहले, Google Maps, Flights, Hotels और YouTube के माध्यम से real-time डेटा संग्रह, activities के लिए Viator integration के साथ। फिर, Personal Intelligence सुविधा Gmail, Photos, Search और YouTube में उपयोगकर्ता द्वारा पहले से संग्रहीत डेटा के आधार पर recommendations को व्यक्तिगत बनाती है — उदाहरण के लिए, सहेजी गई food photos से सुझाए गए restaurants। इसके बाद Gemini travel times को ध्यान में रखते हुए एक सुसंगत itinerary बनाता है, और Gemini Spark booking emails की एक श्रृंखला को master itinerary document में बदल सकता है। अंत में, assistant reservation forms भरता है, rental cars की तुलना करता है और packing lists तैयार करता है — लेख में Kyoto की एक यात्रा उदाहरण के रूप में दी गई है।

🔗 Google — Gemini यात्रा कैसे योजना बनाता है


GitHub Copilot : review governance और agent metrics

Code Quality अब स्वतः Copilot समीक्षा लागू नहीं करता

7 अगस्त20 जुलाई 2026 को Code Quality के सक्रिय होने के बाद, GitHub हर pull request पर Copilot समीक्षा की मांग करने वाला एक ruleset अपने-आप बनाता था। अब GitHub इनमें से तीन ट्रिगर बंद कर रहा है: PR खुलने पर समीक्षा, नए pushes पर समीक्षा, और draft की समीक्षा। मौजूदा repositories पर, पहले से बनाए गए rulesets को इन तीनों विकल्पों को निष्क्रिय करके संशोधित किया गया है — ruleset बना रहता है लेकिन अब स्वतः कार्रवाई नहीं करता; नई repositories पर, Code Quality सक्रिय करने से अब यह मांग नहीं बनती। जो टीमें स्वचालित समीक्षाएँ बनाए रखना चाहती हैं, उन्हें repository या organization स्तर पर ruleset मैन्युअल रूप से बनानी या संशोधित करनी होगी। GitHub इस बदलाव को एक दोहराई जाने वाली मांग के आधार पर सही ठहराता है: reviewer जोड़ना एक विकल्प बना रहना चाहिए, कोई थोपे गया डिफ़ॉल्ट नहीं।

🔗 GitHub Changelog

Copilot usage metrics API तीसरे पक्ष के AI agents के अनुसार गतिविधि का विवरण देती है

7 अगस्त — Copilot usage metrics API एक नया totals_by_3rd_party_agent table उपलब्ध कराती है, जो GitHub workflows में चल रहे प्रत्येक partner agent (Claude, Codex…) के लिए यह विवरण देती है: एक स्थिर पहचानकर्ता (agent_name, agent_id), उपयोगकर्ताओं द्वारा शुरू किए गए tasks की संख्या, और aggregated reports में sessions की संख्या। यह डेटा enterprise owners, billing managers, organization owners, और “Copilot metrics देखने” भूमिका वाले व्यक्तियों के लिए है। घोषित उद्देश्य प्रत्येक app agent को अलग-अलग ट्रैक करना और उनके adoption की तुलना करना है, ताकि deployment संबंधी निर्णय वास्तविक उपयोग के आधार पर लिए जा सकें, न कि अनुमानों पर।

🔗 GitHub Changelog


मीडिया जनरेशन : वीडियो और आवाज़

Seedance 2.5 Runway और Luma पर व्यापक रूप से उपलब्ध हो गया

7 अगस्त — अगस्त की शुरुआत में early access के बाद, Seedance 2.5 अब Runway पर general availability में है: multi-character universes बनाने के लिए generation प्रति 50 references तक, ध्वनि और संवाद सहित 30-second clips, फिर editing/extension। उसी दिन, Luma ने अपनी platform पर Seedance 2.5 के आने की घोषणा की, उन्हीं क्षमताओं के साथ, जिन्हें Luma Agents के माध्यम से scenes, camera angles और pacing के control के लिए संचालित किया जा सकता है। साथ ही, Pika ने अपने Club API के माध्यम से पुष्टि की कि Seedance 2.5 वहाँ अन्य API aggregators की तुलना में 88% कम कीमत पर उपलब्ध है, और इसे स्थायी दर के रूप में प्रस्तुत किया गया है।

🔗 @runwayml की घोषणा

ElevenLabs ने ElevenAgents का ElevenReader Voice Chat पर प्रभाव बताया

7 अगस्त — ElevenLabs ने ElevenAgents के deployment डेटा साझा किए, जिन्हें उसके सभी products में व्यापक रूप से लागू किया गया है। प्रमुख उदाहरण: ElevenReader Voice Chat, जो audiobook के पाठकों को narrartor की उसी voice में बीच में प्रश्न पूछने की अनुमति देता है, बिना book के आगे के हिस्सों को उजागर किए।

मापी गई मीट्रिकदेखी गई मान
औसत सुनने के समय में वृद्धि+24%
पुस्तक completion rate (5+ sessions)78%

सबसे आम अनुरोध plot summary के लिए है, उसके बाद characters, themes और citations पर प्रश्न आते हैं।

🔗 @ElevenLabs की घोषणा

Suno ने अपने iOS और Android mobile app पर Voices लॉन्च किया

7 अगस्त — Voices feature, जो अपनी आवाज़ रिकॉर्ड करके उसे generated tracks में शामिल करने की अनुमति देता है, अब Suno मोबाइल app (iOS और Android) पर creation screen के “+ Voice” button के माध्यम से उपलब्ध है। रिकॉर्डिंग कम से कम एक मिनट की होनी चाहिए। Pro और Premier subscriptions को unlimited access मिलता है, जबकि free plan में सीमित संस्करण उपलब्ध है।

🔗 @suno की घोषणा


संक्षिप्त समाचार

  • Devin (Cognition) startups के लिए 65,000 डॉलर के credits का कार्यक्रम शुरू करता है — Cognition एक startup program शुरू कर रहा है जो Devin credits में 65,000 डॉलर तक देता है, जनरेटिव AI के प्रमुख खिलाड़ियों के समान programs की परंपरा में। 🔗 स्रोत
  • v0 (Vercel) Usage & Activity dashboard लॉन्च करता है — credits का दिन-वार tracking, सदस्य या project के अनुसार activity, और message के अनुसार विवरण (date, model, cost), जो Settings → Usage & Activity से उपलब्ध है। 🔗 स्रोत
  • Warp Agent CLI — उन्नत customization — पूरी configuration अब एक settings.toml file में रहती है जिसे agent संपादित कर सकता है, साथ में themes, animations, customizable status bar और multi-agent orchestration। 🔗 स्रोत
  • Replit ने सबसे बड़े AI वीडियो कोर्स के लिए Guinness world record हासिल किया — 14,075 लोगों ने एक ही live session में मिलकर निर्माण किया, एक Guinness-मान्यता प्राप्त record। 🔗 स्रोत
  • SK Telecom ने Apache 2.0 में 688 अरब parameters वाला MoE, A.X K2, प्रकाशित किया — Korean mixture-of-experts model, 256K tokens का context, commercial use के लिए open license। 🔗 स्रोत
  • Hugging Face ने public domain की 1 million images का dataset होस्ट किया — 1,080,814 images, मुख्यतः 19वीं सदी की पुस्तकों से, Hub पर प्रकाशित। 🔗 स्रोत
  • Together AI ने कई benchmarks पर Kimi K3 के लिए सर्वोत्तम throughput का दावा किया — Moonshot AI ने परीक्षण किए गए 4 में से 3 benchmarks पर Together AI को पहले या संयुक्त पहले स्थान पर रखा: OCRBench, MMMU Pro Vision और DeepSWE। 🔗 स्रोत
  • Behind-the-scenes : Apollo 2 (Apptronik) on Gemini Robotics 2 — Google DeepMind Gemini Robotics 2 पर चलने वाले humanoid robot Apollo 2 के आसपास प्रचारात्मक सामग्री की एक श्रृंखला प्रकाशित करता है। 🔗 स्रोत
  • preview में issues और multi-select fields के बीच “Relates to” संबंध GA में — public preview में नया neutral issue संबंध, और issues तथा projects के लिए multi-select fields का general availability में जाना। 🔗 स्रोत
  • Secret scanning एक partner और नए push protection detectors जोड़ता है — Lovable Labs कार्यक्रम में शामिल होता है; नए detectors में mistral_ai_api_key शामिल है, और Cohere, GoCardless तथा Square alerts पर समृद्ध metadata। 🔗 स्रोत
  • enterprise managed settings में MCP allowlists — कंपनियाँ Copilot app, CLI और VS Code के लिए अनुमत या अवरुद्ध MCP servers को managed-settings.json के माध्यम से केंद्रीकृत कर सकती हैं। 🔗 स्रोत
  • MiniMax H3 Genspark AI Video Agent में उपलब्ध — अगस्त की शुरुआत में खुले weights के रूप में जारी video model अब Genspark के video generation tool में सीधे उपलब्ध है। 🔗 स्रोत
  • MiniMax H3 Luma Agents में उपलब्ध — stereo sound के साथ native रूप से 15-second तक 2K video generation, text, image, video और reference audio द्वारा संचालित। 🔗 स्रोत
  • MiniMax H3 समुदाय ने distillation LoRA (20 → 4-8 steps) तैयार की — weights खुलने के चार दिन बाद, एक सामुदायिक LoRA sampling steps की संख्या 20 से 4-8 तक घटा देती है। 🔗 स्रोत
  • Genspark, World Economic Forum की Unicorn Innovator Community में शामिल होता है — Davos में business और government leaders के साथ उपस्थित होने की योजना सहित भागीदारी की घोषणा। 🔗 स्रोत
  • GitHub organization स्तर पर खुली pull requests को सीमित करने देता है — organization स्तर पर, write access के बिना contributors द्वारा खोली जाने वाली PRs की संख्या पर सीमा लगाने का नया विकल्प। 🔗 स्रोत
  • Genspark दो AI agents (ChatGPT बनाम Claude) को lemonade stands पर आमने-सामने लाता है — marketing demonstration जहाँ प्रत्येक agent 100 डॉलर एक दिन में कमाने की कोशिश के लिए एक वास्तविक stand संभालता है। 🔗 स्रोत
  • HSP GRUPPE अपने tax consulting firm network में ChatGPT Enterprise तैनात करता है — जर्मन tax consulting, audit और law network, 81 संगठनात्मक समूहों में ChatGPT Enterprise अपना रहा है। 🔗 स्रोत

इसका क्या मतलब है

डिफ़ॉल्ट सुरक्षा एक साथ प्रमुख labs में स्थापित हो रही है, लेकिन अलग-अलग रूपों में। Anthropic Auto Mode को एक ऐसे आँकड़े के आधार पर डिफ़ॉल्ट में बदल रहा है जिसे चुनौती देना कठिन है — मानव समीक्षा की थकान में 14% की तुलना में 89% खतरनाक commands ब्लॉक — इस भरोसे के साथ कि सुरक्षा-निर्णय का स्वचालन अब बार-बार होने वाली मानवीय ध्यान-क्षमता से अधिक विश्वसनीय है। OpenAI एक अलग क्षेत्र में उल्टी दिशा ले रहा है: नियंत्रण कम करने के बजाय, वह एक और नियंत्रण जोड़ रहा है, Astra को testing campaign समाप्त होने से पहले ही critical स्तर पर वर्गीकृत करके। उसी सप्ताह लॉन्च हुआ Codex Security Review, merge के बाद की समीक्षा के बजाय सुरक्षा विश्लेषण को merge से पहले ले जाकर इस तर्क को product पक्ष में आगे बढ़ाता है। ये तीनों घोषणाएँ एक ही कहानी कहती हैं: agentic security अब मैन्युअल रूप से चुनी जाने वाली option नहीं रह गई है, बल्कि एक default layer बन रही है — चाहे वह बढ़ी हुई autonomy के रूप में हो या मजबूत guardrails के रूप में।

open models का ecosystem अब केवल benchmark score के बजाय लागत और औद्योगिक adoption के आधार पर अधिक से अधिक आंका जा रहा है। NVIDIA Cosmos 3 को केवल एक और model के रूप में नहीं, बल्कि एक ऐसी infrastructure के रूप में प्रस्तुत करता है जिसे व्यापक प्रसार से पहले ही Doosan, LG, Samsung और Li Auto ने अपनाया है। Together AI code पक्ष में वही संतुलन दस्तावेज़ित करता है: GPT-5.6 Luna, DeepSeek-V4 Flash पर pass@1 में 14 points जीतता है, लेकिन DeepSeek dollar प्रति 4.8 गुना अधिक solutions देता है, यहाँ तक कि cascade strategy दोनों models को अलग-अलग लेने से बेहतर प्रदर्शन करती है। SK Telecom इस पहले से घने परिदृश्य में permissive license में 688 अरब parameters वाला एक Korean MoE जोड़ता है। साझा संकेत: प्रतिस्पर्धा अब केवल क्षमता की सीमा पर नहीं, बल्कि उस क्षमता और उसके वास्तविक उपयोग-लागत के अनुपात पर है।

agentic development tools अब पारंपरिक enterprise infrastructure — सूक्ष्म billing, identity, governance — से लैस हो रहे हैं, जो केवल prototype से आगे परिपक्वता का संकेत है। Amp अब अपने cloud environments को size और thread के अनुसार वैसे ही विभाजित करता है जैसे कोई भी infrastructure provider, Replit adoption तेज़ करने के लिए सीमित समय के लिए free enterprise SSO जोड़ता है, और Claude Code अपने sessions को पूरा context दोबारा टाइप करने के लिए मजबूर करने के बजाय एक summary पास करने देता है। GitHub की तरफ़, movement लगभग उल्टा है लेकिन दिशा वही है: Code Quality Copilot reviewer जोड़ने की automation हटा देता है, जिससे चयन स्पष्ट हो जाता है, जबकि usage metrics API अंततः दिखाती है कि enterprise workflows में वास्तव में काम Claude कर रहा है या Codex। मिलकर, ये घोषणाएँ बातचीत को “कौन-सा agent सबसे बुद्धिमान है” से “agents के एक बेड़े को कैसे govern किया जाए” की ओर ले जाती हैं।

मीडिया generation एक ही actor तक सीमित रहने के बजाय platforms के माध्यम से फैलती रहती है। Seedance 2.5 एक साथ Runway और Luma पर general availability में आता है, MiniMax H3 कुछ ही दिनों में Genspark और Luma Agents में फैल जाता है और पहले से ही एक community distillation LoRA प्राप्त कर लेता है, और ElevenLabs तथा Suno लक्षित उपयोगों को परिष्कृत करते हैं — audiobook सुनते समय contextual questions, mobile से सीधे voice recording। MiniMax H3 जैसे model का कुछ ही दिनों में कई products के बीच तेज़ी से प्रवाह दिखाता है कि open weights मूल editor से परे creative diffusion को कितना तेज़ बनाते हैं।


स्रोत