ai-powered-markdown-translatorgpt-5.4-mini के साथ fr से hi में अनुवादित लेख।
23 अगस्त को दिन नई क्षमताओं से कम और वास्तविक उपयोग से ज़्यादा जुड़ा है। Claude Code के निर्माता Boris Cherny बताते हैं कि वह नवंबर 2025 से हाथ से कोड नहीं लिख रहे हैं और Claude को क्षमता के तीन स्तरों में रखते हैं; इसी के साथ वे Opus की verbosity को Anthropic के लिए सुधार की प्राथमिकता मानते हैं। Google में, 13 अगस्त को जारी Gemini 3.7 Flash, Gemini परिवार का सबसे तेजी से अपनाया गया मॉडल बनता है और Google Search में प्रवेश करता है, जबकि खुला परिवार Gemma एक अरब डाउनलोड का आंकड़ा पार कर जाता है। Amp अपने orbs पर होस्ट की गई applications के लिए पढ़ने योग्य domain names देता है, और औषधि गुणों की भविष्यवाणी के एक खुले benchmark में हर score के साथ उसका noise floor भी प्रकाशित किया जाता है।
Boris Cherny Claude को तीन स्तरों में रखते हैं और नवंबर 2025 से हाथ से कोड नहीं लिख रहे हैं
23 अगस्त — Claude Code के निर्माता model progression को तीन स्तरों में बाँटते हैं: उनसे बेहतर कोड करना; code के इर्द-गिर्द engineering का काम, यानी debugging से लेकर system design तक, उनसे बेहतर करना; फिर computer पर किए जा सकने वाले ज़्यादातर कामों में ज़्यादातर लोगों से आगे निकलना। वे Claude को पहले स्तर और दूसरे के एक हिस्से पर रखते हैं, और Opus 4.8 को पहला model बताते हैं जो उन्हें खुद से बेहतर लगा। वे एक nuance भी जोड़ते हैं: TypeScript के designer Anders Hejlsberg के लिए पहला स्तर शायद अभी पार नहीं हुआ है।
Back in Nov 2025 I fully stopped writing code by hand, though I continue to code (using agents) every day. […] But engineering is more than coding.
🇮🇳 नवंबर 2025 में, मैंने हाथ से कोड लिखना पूरी तरह बंद कर दिया, लेकिन मैं हर दिन (agents के साथ) कोड करना जारी रखे हुए हूँ। […] लेकिन engineering, coding से ज़्यादा है। — @bcherny on X
Anthropic Opus की verbosity को प्राथमिकता के रूप में स्वीकार करता है और एक अस्थायी समाधान देता है
23 अगस्त — Opus की खामियों के बारे में पूछे जाने पर Boris Cherny एक सीधी सार्वजनिक स्वीकृति देते हैं: verbosity एक पहचानी गई समस्या है, और टीम के लिए प्राथमिकता है। तब तक, claude /config outputStyle=concise कमांड 20 अगस्त को घोषित Concise style को सक्रिय करता है। यही असली जानकारी है: Concise सुविधा के लिए कोई विकल्प नहीं, बल्कि उस व्यवहार के लिए अस्थायी जवाब है जिसे टीम ऊपर से ठीक करना चाहती है।
इसी बातचीत में एक उपयोग-संबंधी सलाह भी है, जो एक दिन पहले, 22 अगस्त को दी गई थी: Opus iterative optimization के लिए कम इस्तेमाल किया जा रहा है — CPU और memory consumption, CI time, latency, frame rate — एक दोहराए जाने योग्य पैटर्न के अनुसार, X पर profileer और dataset के साथ Y तक iterating करना।
We know Opus is not perfect, and it is a big priority for the team to fix it.
🇮🇳 हम जानते हैं कि Opus परफेक्ट नहीं है, और उसे ठीक करना टीम के लिए एक बड़ी प्राथमिकता है। — @bcherny on X
🔗 Opus और iterative optimization
Gemini 3.7 Flash रिकॉर्ड adoption के बाद Google Search में प्रवेश करता है
22 अगस्त — Sundar Pichai किसी नए model की घोषणा नहीं करते: Gemini 3.7 Flash 13 अगस्त को जारी हुआ था। वे adoption की घोषणा करते हैं, Gemini family में सबसे तेज़, और एक deployment की: model अब Google Search में चल रहा है, Gemini app के अलावा। लॉन्च के समय यह केवल Pro और Ultra subscribers के लिए Spark, Gemini Enterprise Agent Platform और API के ज़रिए उपलब्ध था — Search में इसका प्रवेश exposure के पैमाने को बदल देता है।
| मूल्यांकित benchmark | प्राप्त score | प्रति task लागत (USD) |
|---|---|---|
| ARC-AGI-1 | 95,5 % | 0,12 |
| ARC-AGI-2 | 84,6 % | 0,25 |
Gemini 3.7 Flash smashed previous Gemini growth records in its first week, making it our fastest growing model yet.
🇮🇳 Gemini 3.7 Flash ने अपनी पहली ही सप्ताह में Gemini की पिछली विकास दर के सभी रिकॉर्ड तोड़ दिए, जिससे यह अब तक का हमारा सबसे तेज़ी से बढ़ने वाला मॉडल बन गया। — @sundarpichai on X
🔗 ARC Prize द्वारा 20 अगस्त को प्रकाशित ARC-AGI score
Gemma एक अरब downloads पार करता है और Google Awesome Gemma repository प्रकाशित करता है
20 अगस्त — Google DeepMind के Clement Farabet और Olivier Lacombe घोषणा करते हैं कि open models के Gemma family ने दो वर्षों में समुदाय द्वारा प्रकाशित 100,000 से अधिक variants के साथ कुल एक अरब downloads पार कर लिए हैं। उद्धृत deployments पैमाने का अंदाज़ा देते हैं: NASA, Satlyt और Starcloud उपग्रहों पर onboard image analysis के लिए Gemma चलाते हैं; भारत में, National Health Authority ने चिकित्सा रिपोर्टों को standardize करने के लिए Aarogya Setu 2.0 में Gemma 4 को एकीकृत किया है। Research पक्ष में, Yale और Google द्वारा Gemma पर निर्मित C2S-Scale ने एक anticancer therapeutic pathway पहचानी, जिसे बाद में जीवित कोशिकाओं पर सत्यापित किया गया। Google इस milestone के साथ developers के लिए एक deliverable भी देता है: GitHub repository Awesome Gemma, जो इस ecosystem की projects और tutorials की आधिकारिक निर्देशिका है।
| मापा गया संकेतक | घोषित मान |
|---|---|
| Gemma के कुल downloads | 1 अरब से अधिक |
| समुदाय द्वारा प्रकाशित variants | 100,000 से अधिक |
| Gemma Challenge में जमा किए गए projects | 1,600 से अधिक |
Amp अपने orbs के portals को पढ़ने योग्य domain names देता है
23 अगस्त — orb वह remote और disposable machine है जिस पर Amp एक agent चलाता है; portal HTTP entry point है, जो उस orb में बन रहे application को browser में खोलने देता है। हर portal को एक अपठनीय auto-generated पता मिलता था, जैसे t-01a0095e-9568-whatever-p1234.onamp.dev — एक नज़र के लिए उपयोगी, लेकिन टीम को भेजे गए link के लिए बहुत कम। अब उनकी जगह तीन विकल्प आते हैं: एक custom prefix, एक personal domain, या एक workspace domain। Amp उदाहरण के रूप में park.mixfox.org देता है, एक सामान्य पता जो orb पर hosted application की सेवा करता है। Configuration Portal tab से की जाती है या agent से इसे करने को कहा जा सकता है। दिखाई गई प्रेरणा functionality जितनी ही महत्वपूर्ण है: portals अब कम और कम एक अस्थायी preview और अधिक से अधिक टिकाऊ applications बनते जा रहे हैं। एक सीमा बनी रहती है, जिसे Quinn Slack ने पुष्टि की: sharing workspace की सीमाओं के पार नहीं जाता।
LEADBOARD दवाओं की भविष्यवाणी वाले benchmarks का noise floor प्रकाशित करता है
22 अगस्त — FINAL-Bench collective ने Hugging Face पर drug property prediction का एक open benchmark प्रकाशित किया है: 21 tables, 7 disciplines, 212 670 training compounds और 18 382 test compounds। यह लेख launch से कम और methodological demonstration ज़्यादा है। hERG table पर, temporal split की जगह random split लेने से AUROC 0,606 से 0,818 तक पहुँच जाता है, जबकि molecules, fingerprints, algorithm और hyperparameters वही रहते हैं: random draw एक ही chemical series को test set के दोनों ओर बाँट देता है। दूसरा निष्कर्ष labels की quality पर है: hERG का noise floor 0,421 पर स्थापित होता है, और 19 regression tables में से 7 पर सिर्फ average predict करना best absolute error देता है।
| hERG data split | प्राप्त AUROC | मॉडल का MAE | constant का MAE |
|---|---|---|---|
| Temporal, 2022 में कटौती | 0,606 | 0,599 | 0,589 |
| Random, 5 seeds का औसत | 0,818 | 0,457 | 0,671 |
🔗 Hugging Face पर FINAL-Bench article
संक्षिप्त खबरें
- फोन से session start होने में इतना समय क्यों लगा — कल कवर की गई घोषणा के अगले दिन, Boris Cherny 22 अगस्त को समझाते हैं कि default security ने समय-सीमा तय की: device trust और verification, prompt injection से सुरक्षा। आगे और अपडेट आएँगे। 🔗 @bcherny thread
- GitHub Dependabot cooldown को फिर से आगे लाता है — सुरक्षा-रहित version upgrades तीन दिन इंतज़ार करती हैं, ताकि scanners किसी poisoned version को पकड़ सकें; security fixes तुरंत लागू होते हैं। देरी
cooldownसे समायोजित की जा सकती है। 23 जुलाई की post को 23 अगस्त को फिर से आगे लाया गया। 🔗 @github tweet - Stable Audio 3.0 Montréal Music Technology Hackathon में — 22 और 23 अगस्त को Music Hackspace और MUTEK के साथ 48 घंटे का hackathon, music producers के लिए tools के इर्द-गिर्द। Stability AI यहाँ खुले weights का बचाव करती है: पारदर्शिता, कलात्मक नियंत्रण, और technology के उपयोग पर आवाज़ का अधिकार। 🔗 समापन वीडियो
- GPT-5.6 Sol द्वारा डिज़ाइन किए गए processor पर DOOM चलता है — model ने Turing Complete गेम में Codex-R32 नाम का एक RV32IM processor जोड़ा, जिस पर PureDOOM port native machine code में compiled होकर चलता है। यह demonstration 23 अगस्त को @OpenAIDevs द्वारा साझा की गई। 🔗 @Angaisb_ thread
इसका क्या अर्थ है
इस सप्ताहांत कोई model जारी नहीं हुआ, और यही बात दिन को पढ़ने योग्य बनाती है। जो चीज़ बदल रही है, वह मौजूदा models की deployment, उनका उपयोग करने वाले लोगों की संख्या, और उपयोग में बाधा डालने वाली चीज़ों का सुधार है। कंपनियाँ adoption पर काम कर रही हैं, announcement पर नहीं।
Development tooling के संदर्भ में, Boris Cherny की गवाही सबसे ज़्यादा उस सीमा के लिए मायने रखती है जिसे वे उसी वाक्य में रखते हैं: coding उन्हें कई practitioners के लिए सुलझा हुआ लगता है, engineering नहीं, और वे एक expert का हवाला देने का ध्यान रखते हैं जिसके लिए पहला स्तर भी अभी हासिल नहीं हुआ है। Opus की verbosity पर स्वीकारोक्ति भी इसी दिशा में जाती है: एक model का default behavior अपने-आप में product issue बन जाता है। outputStyle=concise जैसा configuration workaround भार को user पर डाल देता है, जिसे Anthropic इसे एक अस्थायी सुधार कहकर साफ़ तौर पर स्वीकार करता है।
Scale पर deployment इस सप्ताहांत तीन अलग रूपों में दिखता है। Gemini 3.7 Flash subscribers और developers के दायरे से निकलकर Search में प्रवेश करता है, जिसे ARC-AGI-2 पर 84,6 % score के लिए प्रति task 0,25 USD की लागत आर्थिक रूप से संभव बनाती है। दूसरी ओर, Gemma अपनी adoption को downloads और community variants में मापता है, जबकि orbit और public health में इसके deployments किसी भी demonstration use case जैसे नहीं लगते। Amp अंत में उस उपयोग का नतीजा निकालता है जिसकी उसने अपेक्षा नहीं की थी: जब disposable previews टिकाऊ applications बन जाते हैं, तो उन्हें एक स्थिर पता देना पड़ता है।
माप का सवाल अभी भी बाकी है, और LEADBOARD बिलकुल सही समय पर आता है। model की एक भी line बदले बिना हासिल हुआ 0,21 AUROC point का अंतर, और 19 में से 7 regression tables पर models को मात देने वाली constant prediction: अपना split, noise floor और trivial references बताए बिना प्रकाशित score व्याख्येय नहीं होता। यही कारण है कि उसी सप्ताहांत Google द्वारा आगे रखे गए ARC-AGI आँकड़ों को महत्व मिलता है — third-party measurements, verified mode में, न कि घर के बनाए नतीजे।
स्रोत
- Boris Cherny — क्षमता के तीन स्तर
- Boris Cherny — Opus की verbosity और Concise style
- Boris Cherny — Opus और iterative optimization
- Boris Cherny — remote session startup सुरक्षा
- Sundar Pichai — Search में Gemini 3.7 Flash
- Logan Kilpatrick — Gemini 3.7 Flash की वृद्धि
- ARC Prize — Gemini 3.7 Flash के ARC-AGI परिणाम
- Google DeepMind — Gemma एक अरब downloads से आगे
- Amp — orbs के portals के लिए domain names
- Quinn Slack — sharing workspace तक सीमित रहता है
- FINAL-Bench — Hugging Face पर LEADBOARD
- LEADBOARD — Hugging Face Space
- GitHub — Dependabot cooldown
- GitHub Blog — a cooldown के पक्ष में तर्क
- Stability AI — Montréal hackathon
- Codex-R32 processor पर DOOM