Căutare

Boris Cherny nu mai codează manual din noiembrie 2025, Gemini 3.7 Flash ajunge în Google Search, Gemma depășește un miliard de descărcări

Articol generat de inteligență artificială
Boris Cherny nu mai codează manual din noiembrie 2025, Gemini 3.7 Flash ajunge în Google Search, Gemma depășește un miliard de descărcări

ai-powered-markdown-translator

Articol tradus din fr în ro cu gpt-5.4-mini.

Vezi proiectul pe GitHub ↗

Pe 23 august, ziua vorbește mai puțin despre noi capabilități și mai mult despre utilizarea reală. Boris Cherny, creatorul Claude Code, explică faptul că nu mai scrie cod manual din noiembrie 2025 și îl situează pe Claude pe trei trepte de capacitate; el recunoaște totodată verbositatea lui Opus ca prioritate de corectare pentru Anthropic. La Google, Gemini 3.7 Flash, lansat pe 13 august, devine modelul Gemini adoptat cel mai rapid și intră în Google Search, în timp ce familia deschisă Gemma trece de un miliard de descărcări. Amp dă nume de domeniu lizibile aplicațiilor găzduite pe orb-urile sale, iar un benchmark deschis de predicție a proprietăților medicamentelor publică pragul de zgomot alături de fiecare scor.


Boris Cherny îl situează pe Claude pe trei trepte și nu mai codează manual din noiembrie 2025

23 august — Creatorul Claude Code descompune progresul modelelor în trei trepte: să codeze mai bine decât el; să facă mai bine decât el munca de inginerie din jurul codului, de la depanare la proiectare de sistem; apoi să-i depășească pe majoritatea oamenilor la majoritatea sarcinilor care pot fi făcute pe un computer. El îl situează pe Claude la prima treaptă și la o parte din a doua, și desemnează Opus 4.8 drept primul model care i s-a părut mai bun decât el. Nuanța pe care o adaugă: pentru Anders Hejlsberg, creatorul TypeScript, prima treaptă s-ar putea să nu fie încă atinsă.

Back in Nov 2025 I fully stopped writing code by hand, though I continue to code (using agents) every day. […] But engineering is more than coding.

🇷🇴 În noiembrie 2025, am încetat complet să mai scriu cod manual, continuând totuși să codez (cu agenți) în fiecare zi. […] Dar ingineria înseamnă mai mult decât codare.@bcherny pe X


Anthropic recunoaște verbositatea lui Opus ca prioritate și livrează un paliativ

23 august — Întrebat despre defectele lui Opus, Boris Cherny răspunde cu o recunoaștere publică directă: verbositatea este o problemă identificată, prioritară pentru echipă. Până atunci, comanda claude /config outputStyle=concise activează stilul Concise anunțat pe 20 august. Aceasta este adevărata informație: Concise nu este o opțiune de confort, ci răspunsul provizoriu la un comportament pe care echipa încearcă să-l corecteze din timp.

Același schimb conține un sfat de utilizare formulat cu o zi înainte, pe 22 august: Opus ar fi subutilizat pentru optimizarea iterativă — consum CPU și memorie, timp de CI, latență, frecvență a cadrelor — după un model reproductibil, iterând pe X cu un profiler și un set de date până la atingerea lui Y.

We know Opus is not perfect, and it is a big priority for the team to fix it.

🇷🇴 Știm că Opus nu este perfect, iar corectarea lui este o prioritate majoră pentru echipă.@bcherny pe X

🔗 Opus și optimizarea iterativă


Gemini 3.7 Flash intră în Google Search după o adopție record

22 august — Sundar Pichai nu anunță un model: Gemini 3.7 Flash a fost lansat pe 13 august. El anunță o adopție, cea mai rapidă din familia Gemini, și o implementare: modelul rulează acum în Google Search, pe lângă aplicația Gemini. La lansare, era accesibil doar abonaților Pro și Ultra prin Spark, pe Gemini Enterprise Agent Platform și prin API — trecerea lui în Search schimbă scala expunerii.

Benchmark evaluatScor obținutCost per sarcină (USD)
ARC-AGI-195,5 %0,12
ARC-AGI-284,6 %0,25

Gemini 3.7 Flash smashed previous Gemini growth records in its first week, making it our fastest growing model yet.

🇷🇴 Gemini 3.7 Flash a spulberat recordurile anterioare de creștere ale Gemini chiar din prima sa săptămână, ceea ce îl face modelul nostru cu cea mai rapidă creștere de până acum.@sundarpichai pe X

🔗 Scorurile ARC-AGI publicate pe 20 august de ARC Prize


Gemma depășește un miliard de descărcări și Google publică depozitul Awesome Gemma

20 august — Clement Farabet și Olivier Lacombe, de la Google DeepMind, anunță că familia de modele deschise Gemma a depășit un miliard de descărcări cumulate, cu peste 100 000 de variante publicate de comunitate în doi ani. Implementările menționate arată amploarea: NASA, Satlyt și Starcloud rulează Gemma la bordul sateliților pentru analiza imaginilor la bord; în India, National Health Authority a integrat Gemma 4 în Aarogya Setu 2.0 pentru a standardiza rapoarte medicale. Pe partea de cercetare, C2S-Scale, construit pe Gemma de Yale și Google, a identificat o cale terapeutică anticanceroasă verificată ulterior pe celule vii. Google însoțește reperul cu un livrabil pentru dezvoltatori: depozitul GitHub Awesome Gemma, director oficial al proiectelor și tutorialelor din acest ecosistem.

Indicator măsuratValoare anunțată
Descărcări cumulate ale Gemmapeste 1 miliard
Variante publicate de comunitatepeste 100 000
Proiecte înscrise la Gemma Challengepeste 1 600

🔗 Articol Google DeepMind


Amp dă nume de domeniu lizibile portalelor sale de pe orb-uri

23 august — Un orb este mașina distantă și de unică folosință pe care Amp rulează un agent; un portal este poarta de intrare HTTP care permite deschiderea în browser a aplicației aflate în construcție în acel orb. Fiecare portal primea o adresă auto-generată ilizibilă, de tipul t-01a0095e-9568-whatever-p1234.onamp.dev — utilă pentru o privire rapidă, mult mai puțin pentru un link transmis unei echipe. Trei opțiuni le înlocuiesc: un prefix personalizat, un domeniu personal sau un domeniu de spațiu de lucru (workspace). Amp dă exemplul lui park.mixfox.org, adresă obișnuită care deservește o aplicație găzduită pe un orb. Configurarea se face din fila Portal sau cerând-o agentului. Motivația afișată contează la fel de mult ca funcționalitatea: portalurile servesc tot mai puțin drept previzualizare efemeră și tot mai mult drept aplicații durabile. Rămâne o limită, confirmată de Quinn Slack: partajarea nu trece dincolo de granițele spațiului de lucru.

🔗 Anunț Amp


LEADBOARD publică pragul de zgomot al benchmarkurilor sale de predicție a medicamentelor

22 august — Colectivul FINAL-Bench a pus online pe Hugging Face un benchmark deschis de predicție a proprietăților medicamentelor: 21 de tabele, 7 discipline, 212 670 de compuși de antrenare și 18 382 de testare. Articolul este mai puțin o lansare decât o demonstrație metodologică. Pe tabelul hERG, înlocuirea unei împărțiri temporale cu una aleatorie duce AUROC de la 0,606 la 0,818, cu molecule, amprente, algoritm și hiperparametri identici: eșantionarea aleatorie repartizează aceeași serie chimică de o parte și de alta a setului de test. Al doilea constat, privind calitatea etichetelor: pragul de zgomot al hERG se situează la 0,421, iar pe cele 19 tabele de regresie, simpla predicție a mediei obține cea mai bună eroare absolută pe șapte dintre ele.

Împărțirea datelor hERGAUROC obținutăMAE-ul modeluluiMAE-ul constantei
Temporală, tăiere în 20220,6060,5990,589
Aleatorie, media a 5 semințe0,8180,4570,671

🔗 Articol FINAL-Bench pe Hugging Face


Pe scurt

  • De ce pornirea sesiunii de pe telefon a durat atât de mult — A doua zi după anunțul acoperit ieri, Boris Cherny explică pe 22 august că securitatea implicită a fixat calendarul: încredere și verificarea dispozitivului, protecție împotriva injectării de prompt. Vor urma și alte actualizări. 🔗 Fir @bcherny
  • GitHub readuce în prim-plan cooldown-ul Dependabot — Actualizările de versiune fără miză de securitate așteaptă trei zile, timp în care scanerele pot detecta o versiune otrăvită; corecțiile de securitate rămân imediate. Întârziere reglabilă prin cooldown. Articol din 23 iulie readus în prim-plan pe 23 august. 🔗 Tweet @github
  • Stable Audio 3.0 la Music Technology Hackathon de Montréal — Hackathon de 48 de ore pe 22 și 23 august cu Music Hackspace și MUTEK, în jurul unor instrumente pentru producătorii de muzică. Stability AI își apără acolo greutățile deschise: transparență, control artistic, dreptul la cuvânt asupra folosirii tehnologiei. 🔗 Video de închidere
  • DOOM rulează pe un procesor conceput de GPT-5.6 Sol — Modelul a asamblat în jocul Turing Complete un procesor RV32IM numit Codex-R32, pe care rulează portarea PureDOOM compilată în cod mașină nativ. Demonstrație reluată pe 23 august de @OpenAIDevs. 🔗 Fir @Angaisb_

Ce înseamnă asta

Niciun model nu a fost lansat în acest weekend, iar asta face ziua ușor de citit. Ceea ce se mișcă este implementarea modelelor existente, numărul de mâini care le folosesc și corectarea a ceea ce încurcă în utilizare. Actorii lucrează la adopție, nu la anunț.

Pe instrumentele de dezvoltare, mărturia lui Boris Cherny contează mai ales prin limita pe care o fixează în aceeași frază: codarea i se pare rezolvată pentru o parte dintre practicieni, ingineria nu, și are grijă să citeze un expert pentru care prima treaptă nici măcar nu este atinsă. Acordul privind verbositatea lui Opus merge în aceeași direcție: comportamentul implicit al unui model devine un subiect de produs în sine. Un paliativ de configurare precum outputStyle=concise mută povara asupra utilizatorului, lucru pe care Anthropic îl asumă explicit numindu-l corectiv provizoriu.

Implementarea la scară ia trei forme distincte în acest weekend. Gemini 3.7 Flash părăsește perimetrul abonaților și al dezvoltatorilor pentru a intra în Search, ceea ce devine economic sustenabil printr-un cost de 0,25 USD per sarcină pe ARC-AGI-2 pentru un scor de 84,6 %. Gemma, la rândul ei, își măsoară adopția în descărcări și variante comunitare, cu implementări în orbită și în sănătate publică ce nu seamănă cu niciun caz de utilizare demonstrativ. Amp, în sfârșit, trage consecința unei utilizări pe care nu o prevăzuse: când previzualizările de unică folosință devin aplicații durabile, trebuie să li se dea o adresă stabilă.

Rămâne întrebarea măsurării, iar LEADBOARD apare exact la timp. O diferență de 0,21 puncte AUROC obținută fără a schimba o linie de model, o predicție constantă care bate modelele pe șapte tabele de regresie din nouăsprezece: un scor publicat fără împărțirea sa, pragul său de zgomot și referințele sale triviale nu este interpretabil. Exact asta dă greutate cifrelor ARC-AGI puse în evidență de Google în același weekend — măsurători terțe, în mod verificat, și nu rezultate interne.


Surse