ai-powered-markdown-translatorArtikel översatt från fr till sv med gpt-5.4-mini.
Den 23 augusti handlar dagen mindre om nya förmågor än om faktiskt användande. Boris Cherny, skaparen av Claude Code, förklarar att han inte längre skriver kod för hand sedan november 2025 och placerar Claude på tre kapacitetsnivåer; i samma veva medger han att Opus-verbositet är en prioriterad bugg att åtgärda för Anthropic. Hos Google blir Gemini 3.7 Flash, som släpptes den 13 augusti, den snabbast antagna Gemini-modellen och går in i Google Search, medan den öppna familjen Gemma passerar en miljard nedladdningar. Amp ger läsbara domännamn åt applikationer som hostas på sina orbs, och ett öppet benchmark för prediktion av läkemedelsegenskaper publicerar sin brusgolvssiffra bredvid varje resultat.
Boris Cherny placerar Claude på tre nivåer och kodar inte längre för hand sedan november 2025
23 augusti — Skaparen av Claude Code bryter ned modellernas utveckling i tre nivåer: att koda bättre än han gör; att göra det ingenjörsarbete runt koden bättre än han gör, från felsökning till systemdesign; och därefter att överträffa de flesta människor i de flesta uppgifter som kan utföras på en dator. Han placerar Claude på den första nivån och en del av den andra, och utser Opus 4.8 till den första modell som han upplevt som bättre än han själv. En nyans han tillför: för Anders Hejlsberg, skaparen av TypeScript, är det inte säkert att den första nivån ens är passerad.
Back in Nov 2025 I fully stopped writing code by hand, though I continue to code (using agents) every day. […] But engineering is more than coding.
🇸🇪 I november 2025 slutade jag helt att skriva kod för hand, samtidigt som jag fortsatte att koda (med agenter) varje dag. […] Men ingenjörskonst är mer än kodande. — @bcherny på X
Anthropic medger Opus-verbositet som en prioritet och levererar en tillfällig lösning
23 augusti — När Boris Cherny pressas om Opus brister svarar han med ett direkt offentligt erkännande: verbositet är ett identifierat problem som är prioriterat för teamet. Under tiden aktiverar kommandot claude /config outputStyle=concise det Concise-läge som annonserades den 20 augusti. Det är den verkliga nyheten: Concise är inte ett bekvämlighetsalternativ, utan det provisoriska svaret på ett beteende som teamet vill rätta till längre fram i kedjan.
Samma utbyte innehåller ett användningstips som formulerades dagen innan, den 22 augusti: Opus skulle vara underutnyttjad för iterativ optimering — CPU- och minnesanvändning, CI-tid, latens, bildfrekvens — enligt ett reproducerbart mönster, iterera på X med en profiler och en datamängd tills Y nås.
We know Opus is not perfect, and it is a big priority for the team to fix it.
🇸🇪 Vi vet att Opus inte är perfekt, och att åtgärda det är en hög prioritet för teamet. — @bcherny på X
🔗 Opus och iterativ optimering
Gemini 3.7 Flash går in i Google Search efter en rekordartad adoption
22 augusti — Sundar Pichai tillkännager inte en modell: Gemini 3.7 Flash släpptes den 13 augusti. Han tillkännager en adoption, den snabbaste i Gemini-familjen, och en utrullning: modellen körs nu i Google Search, utöver Gemini-appen. Vid lanseringen var den bara tillgänglig för Pro- och Ultra-prenumeranter via Spark, Gemini Enterprise Agent Platform och API:t — dess inträde i Search ändrar exponeringsskalan.
| Utvärderat benchmark | Uppnått resultat | Kostnad per uppgift (USD) |
|---|---|---|
| ARC-AGI-1 | 95,5 % | 0,12 |
| ARC-AGI-2 | 84,6 % | 0,25 |
Gemini 3.7 Flash smashed previous Gemini growth records in its first week, making it our fastest growing model yet.
🇸🇪 Gemini 3.7 Flash krossade Gemini-familjens tidigare tillväxtrekord redan under sin första vecka, vilket gör den till vår snabbast växande modell hittills. — @sundarpichai på X
🔗 ARC-AGI-poäng publicerade den 20 augusti av ARC Prize
Gemma passerar en miljard nedladdningar och Google publicerar repot Awesome Gemma
20 augusti — Clement Farabet och Olivier Lacombe från Google DeepMind meddelar att familjen av öppna modeller Gemma har passerat en miljard kumulativa nedladdningar, med mer än 100 000 varianter publicerade av communityn på två år. De citerade utrullningarna visar omfattningen: NASA, Satlyt och Starcloud kör Gemma ombord på satelliter för inbyggd bildanalys; i Indien har National Health Authority integrerat Gemma 4 i Aarogya Setu 2.0 för att standardisera medicinska rapporter. På forskningssidan har C2S-Scale, byggd på Gemma av Yale och Google, identifierat en cancerterapeutisk väg som senare verifierades på levande celler. Google följer milstolpen med en leverans för utvecklare: GitHub-repot Awesome Gemma, den officiella katalogen över projekt och handledningar i detta ekosystem.
| Mätt indikator | Annonserat värde |
|---|---|
| Kumulativa nedladdningar av Gemma | mer än 1 miljard |
| Varianter publicerade av communityn | mer än 100 000 |
| Projekt inskickade till Gemma Challenge | mer än 1 600 |
Amp ger läsbara domännamn åt portalerna på sina orbs
23 augusti — En orb är den avlägsna och förbrukningsbara maskin där Amp kör en agent; en portal är HTTP-ingången som gör det möjligt att öppna i en webbläsare den applikation som håller på att byggas i den orb:en. Varje portal fick tidigare en oläslig, auto-genererad adress av typen t-01a0095e-9568-whatever-p1234.onamp.dev — användbar för en snabb titt, betydligt mindre för en länk som skickas till ett team. Tre alternativ ersätter dem: ett anpassat prefix, en personlig domän eller en arbetsyte-domän (workspace). Amp ger exemplet park.mixfox.org, en vanlig adress som betjänar en applikation som hostas på en orb. Konfigurationen görs via fliken Portal eller genom att be agenten om det. Den uttryckta motivationen är nästan lika viktig som funktionen: portalerna används allt mindre som tillfälliga förhandsvisningar och allt mer som beständiga applikationer. En begränsning kvarstår, bekräftad av Quinn Slack: delning sträcker sig inte över arbetsytans gränser.
LEADBOARD publicerar brusgolvet för sina benchmarks för läkemedelsprediktion
22 augusti — Kollektivet FINAL-Bench har lagt ut ett öppet benchmark för prediktion av läkemedelsegenskaper på Hugging Face: 21 tabeller, 7 discipliner, 212 670 träningsföreningar och 18 382 testföreningar. Artikeln är mindre en lansering än en metoddemonstration. På hERG-tabellen får man, genom att byta ett tidsbaserat split mot ett slumpmässigt split, AUROC att gå från 0,606 till 0,818, med identiska molekyler, fingerprints, algoritm och hyperparametrar: slumpdragningen fördelar en och samma kemiska serie på båda sidor om testmängden. Den andra slutsatsen gäller etikettkvalitet: hERG:s brusgolv ligger på 0,421, och på de 19 regressions-tabellerna får man genom att helt enkelt förutsäga medelvärdet den bästa absoluta felet på sju av dem.
| hERG-datasplit | Uppnådd AUROC | Modellens MAE | Konstansens MAE |
|---|---|---|---|
| Tidsbaserad, brytpunkt 2022 | 0,606 | 0,599 | 0,589 |
| Slumpmässig, medel av 5 seeds | 0,818 | 0,457 | 0,671 |
🔗 FINAL-Bench-artikel på Hugging Face
Kortnytt
- Varför inloggning från telefonen tog så lång tid — Dagen efter gårdagens täckta tillkännagivande förklarar Boris Cherny den 22 augusti att standardsäkerheten satte schemat: förtroende och enhetsverifiering, skydd mot prompt injection. Fler uppdateringar kommer senare. 🔗 @bcherny-tråd
- GitHub lyfter fram Dependabot-cooldown igen — Versionsuppgraderingar utan säkerhetsfråga väntar i tre dagar, så att skannrarna hinner upptäcka en förgiftad version; säkerhetsfixar förblir omedelbara. Fördröjningen kan justeras via
cooldown. Inlägg från 23 juli lyftes fram igen den 23 augusti. 🔗 @github-tweet - Stable Audio 3.0 på Music Technology Hackathon i Montréal — 48-timmars hackathon den 22 och 23 augusti med Music Hackspace och MUTEK, kring verktyg för musikproducenter. Stability AI försvarar där de öppna vikterna: transparens, konstnärlig kontroll, och inflytande över hur tekniken används. 🔗 Avslutningsvideo
- DOOM körs på en processor designad av GPT-5.6 Sol — Modellen byggde i spelet Turing Complete en RV32IM-processor med namnet Codex-R32, på vilken portningen PureDOOM körs kompilerad till native machine code. Demonstrationen lyftes den 23 augusti av @OpenAIDevs. 🔗 @Angaisb_-tråd
Vad det här betyder
Ingen modell släpptes den här helgen, och det är just det som gör dagen lätt att läsa. Det som rör sig är utrullningen av befintliga modeller, antalet händer som använder dem, och rättandet av sådant som stör i praktiken. Aktörerna arbetar med adoption, inte med att annonsera.
För utvecklingsverktygen är Boris Chernys vittnesmål mest värt för gränsen han sätter i samma mening: kodandet verkar löst för vissa praktiker, ingenjörsarbetet inte, och han passar på att citera en expert för vilken den första nivån inte ens är nådd. Erkännandet om Opus-verbositet går i samma riktning: en modells standardbeteende blir ett eget produktämne. En konfigurationslösning som outputStyle=concise flyttar bördan till användaren, vilket Anthropic uttryckligen accepterar genom att kalla det en tillfällig fix.
Utrullning i skala tar tre tydliga former den här helgen. Gemini 3.7 Flash lämnar abonnenternas och utvecklarnas sfär för att gå in i Search, något som ekonomiskt görs hållbart av en kostnad på 0,25 USD per uppgift på ARC-AGI-2 för ett resultat på 84,6 %. Gemma mäter sin adoption i nedladdningar och community-varianter, med utrullningar i omloppsbana och i folkhälsan som inte liknar något demonstrationsanvändningsfall. Amp drar till sist konsekvensen av ett användningsmönster som man inte hade förutsett: när tillfälliga förhandsvisningar blir beständiga applikationer måste de få en stabil adress.
Återstår mätfrågan, och LEADBOARD kommer vid perfekt tidpunkt. En skillnad på 0,21 AUROC-poäng utan att ändra en enda rad i modellen, en konstant förutsägelse som slår modellerna på sju av nitton regressions-tabeller: ett publicerat resultat utan dess split, dess brusgolv och dess triviala referenser är inte tolkningsbart. Det är precis det som ger tyngd åt de ARC-AGI-siffror som Google lyfte fram samma helg — tredjepartsmätningar, i verifierat läge, och inte hemmagjorda resultat.
Källor
- Boris Cherny — tre kapacitetsnivåer
- Boris Cherny — Opus-verbositet och Concise-läge
- Boris Cherny — Opus och iterativ optimering
- Boris Cherny — säkerhet för fjärrstart av sessioner
- Sundar Pichai — Gemini 3.7 Flash i Search
- Logan Kilpatrick — Gemini 3.7 Flashs tillväxt
- ARC Prize — ARC-AGI-resultat för Gemini 3.7 Flash
- Google DeepMind — Gemma passerar en miljard nedladdningar
- Amp — domännamn för orb-portaler
- Quinn Slack — delning förblir begränsad till workspace
- FINAL-Bench — LEADBOARD på Hugging Face
- LEADBOARD — Hugging Face Space
- GitHub — Dependabot-cooldown
- GitHub Blog — anledningen till en cooldown
- Stability AI — hackathon i Montréal
- DOOM på Codex-R32-processorn