ai-powered-markdown-translatorArtikel vertaald van het Frans naar het Nederlands met gpt-5.6-sol.
Op dinsdag 22 september lanceren Anthropic en OpenAI elk een frontiermodel, met minder dan twee uur verschil: Claude Opus 5.5, gepresenteerd als gelijkwaardig aan Fable 5.1 voor 40% minder dan Opus 5, en vervolgens GPT-6 Sol en GPT-6 Luna, waarvan de API-prijzen halveren ten opzichte van de actieprijs van GPT-5.6. Beide families verschijnen diezelfde dag in GitHub Copilot, Devin en Perplexity, terwijl Claude Code 2.1.280 de Pro- en Team Standard-abonnementen van Sonnet naar Opus overzet. Codex CLI 0.156.0, verhoogde gebruikslimieten bij Anthropic en een reeks publicaties van NVIDIA maken de dag compleet.
Anthropic lanceert Claude Opus 5.5, het eerste model van de Claude 5.5-familie
22 september — Anthropic lanceert Claude Opus 5.5 (claude-opus-5-5), het eerste model van zijn nieuwe Claude 5.5-familie; Sonnet 5.5 en Haiku 5.5 volgen „in de komende weken”. Het is vanaf vandaag beschikbaar via de Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud en Microsoft Foundry, en wordt in Claude Code het standaardmodel voor betaalde abonnementen. Een contextvenster van één miljoen tokens, een maximale uitvoer van 128.000 tokens en betrouwbare kennis tot en met juni 2026.
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.
It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
🇳🇱 Dit is Claude Opus 5.5, het eerste model van onze nieuwe Claude 5.5-familie. Voor de meeste taken presteert het op het niveau van Claude Fable 5.1 en het kost 40% minder om uit te voeren dan Opus 5. — @claudeai op X
Volgens Anthropic wordt die 40% gemeten „met de standaardinstellingen” bij typische workloads en is dit het gecombineerde resultaat van lagere prijzen en minder tokens per taak. De tarieven dalen met 20% (4 dollar voor invoer en 20 dollar voor uitvoer per miljoen tokens, tegenover 5 en 25 voor Opus 5) en met 60% voor het lezen uit de cache (0,20 dollar). De uitvoer wordt ruim 30% sneller gegenereerd en een snelle modus (fast mode), in research preview, belooft tot 2,5 keer meer snelheid voor 8 en 40 dollar.
| Benchmark (cijfers van Anthropic) | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench 4.0 | 66,4 % | 55,8 % | 57,9 % |
| FrontierCode v1.1 Main | 54,4 % | 50,3 % | 53,3 % |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1542 |
| OSWorld 2.0 | 81,8 % | 80,7 % | — |
| AutomationBench | 40,0 % | 31,4 % | 41,4 % |
| Terminal-Bench-Science 0.1 | 58,7 % | 52,6 % | 64,6 % |
Opus 5.5 neemt de leiding bij agentic coding, kantoorwerk en computergebruik, maar GPT-6 Astra blijft voor op AutomationBench en Terminal-Bench-Science. Anthropic verduidelijkt dat zijn scores zijn gemeten met actieve productiebeveiligingen, wat ze waarschijnlijk verlaagt, en beschouwt de benchmarkmarges inmiddels als „een minder betrouwbare leidraad”: in de praktijk zou het verschil met Fable 5.1 kleiner zijn dan deze cijfers suggereren. Het is de eerste Opus die wordt gelanceerd met beveiligingen van de klasse van Fable 5.1 voor cybersecurity, biologie en distillatie (de meeste cybertaken schakelen over naar Opus 4.8), en Anthropic erkent dat het model vaak lijkt te vermoeden dat het wordt geëvalueerd.
Voor ontwikkelaars vereist de migratie enkele aanpassingen: adaptief redeneren kan niet meer worden uitgeschakeld, een geforceerde toolkeuze (tool_choice tot any of tool) levert een 400-fout op en de standaardinspanning verandert in medium (tegenover high bij Opus 5). Tekst die tussen twee toolaanroepen wordt geschreven, verschijnt voortaan opnieuw in redeneerblokken, die bij de standaardweergave leeg zijn.
🔗 Introductie van Claude Opus 5.5 · Nieuwe mogelijkheden van Opus 5.5 voor de API
Claude Code 2.1.280 installeert Opus 5.5 en zet Pro en Team Standard over op Opus
22 september — Claude Code 2.1.280 wordt om 16.38 uur UTC uitgebracht, zeven minuten na de aankondiging van Opus 5.5. Versie 2.1.279 is nooit verschenen: de CHANGELOG gaat rechtstreeks van versie 2.1.278 van 19 september naar deze versie met 114 vermeldingen.
De zichtbaarste verandering betreft het model. Opus 5.5 wordt het standaardmodel voor Opus en de Pro- en Team Standard-abonnementen schakelen standaard over van Sonnet naar Opus, zoals al het geval was bij Max, Team Premium en Enterprise. Inspanningsniveaus die werden opgeslagen voordat /effort modelspecifiek werd, zijn niet langer van toepassing op nieuwe modellen zoals Opus 5.5, die met hun standaardinstelling beginnen; Opus 4.7, Opus 4.8 en Fable 5 leggen op hun beurt niet langer hun aanvankelijke inspanningsniveau op boven de gekozen instelling.
Wat beveiliging betreft, wordt een schrijfactie via een symbolische link voortaan beoordeeld op basis van de werkelijke bestemming: het autorisatieverzoek noemt de locatie waar de schrijfactie terechtkomt, en acceptEdits, autorisatieregels en de automatische modus keuren niet langer een schrijfactie goed die buiten de directorystructuur eindigt. De automatische modus blijft acties niet meer zonder pauze in een lus weigeren wanneer een beveiligingscontrole geen antwoord geeft: nieuwe pogingen worden steeds verder uit elkaar geplaatst en de beurt stopt na tien opeenvolgende weigeringen. Pluginmarketplaces die een gereserveerde naam imiteren, worden geweigerd, en met de variabele CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH kan de limiet van 2.048 tekens voor beschrijvingen van MCP-tools worden aangepast.
De rest draait om gebruiksgemak: een afzonderlijke druk op y of n bevestigt of sluit een dialoogvenster niet langer (daarvoor dienen Enter en Escape), tweemaal Ctrl+C drukken in een dialoogvenster sluit Claude Code niet meer af, twee problemen met het verbreken van de promptcache zijn opgelost en de VS Code-extensie krijgt zes getypte commando’s (/status, /sandbox, /chrome, /export, /skills, /plan).
| Categorie van CHANGELOG-vermelding | Aantal vermeldingen |
|---|---|
| Correcties (Fixed) | 69 |
| Verbeteringen (Improved) | 21 |
| Toevoegingen (Added) | 12 |
| Wijzigingen (Changed) | 10 |
| Terugdraaiingen en verwijderingen | 2 |
| Totaal | 114 |
Twee handleidingen voor werken met Opus 5.5
22 september — Anthropic publiceert ook twee handleidingen van Addy Osmani. De eerste, „Wat een taak kost op Opus 5.5” (What a task costs on Opus 5.5), benadrukt dat twee modellen met dezelfde prijs per token voor dezelfde taak zeer verschillende kosten kunnen hebben, omdat bij elke beurt het volledige gesprek opnieuw wordt verzonden. Zijn voorbeelden worden gepresenteerd als illustraties op basis van de openbare tarieven: 2,8 miljoen invoertokens kosten 11,20 dollar zonder cache en 1,62 dollar wanneer 90% uit de cache wordt gelezen, en één uitvoertoken kost evenveel als honderd keer lezen uit de cache. Hij adviseert medium voor dagelijks gebruik, high wanneer medium vastloopt en vervolgens Fable 5.1 als Opus 5.5 tweemaal op hetzelfde probleem stuit, met dien verstande dat een verandering van inspanning of model de cache leegt (die bij een abonnement één uur geldig blijft en met een API-sleutel standaard vijf minuten). Bij een interne benchmark met 44 supporttickets verlaagde de overstap van Opus 4.8 naar Opus 5.5 met een lage inspanning de kosten met ongeveer 18%, en /claude-api prompt-audit met nog eens 9%.
De tweede handleiding, op claude.dev, adviseert om te definiëren wat „voltooid” betekent en het model vervolgens zijn werk te laten doen, en instructies als „denk goed na” te verwijderen, omdat het model altijd redeneert voordat het antwoordt. De handleiding legt ook uit hoe wordt overgeschakeld naar een ouder model wanneer beveiligingen een bericht markeren, een gedrag dat in de applicaties of in /config kan worden ingesteld.
🔗 Wat een taak kost op Opus 5.5 · Opus 5.5 optimaal benutten
OpenAI lanceert GPT-6 Sol en GPT-6 Luna, 50% goedkoper dan de actieprijs van GPT-5.6
22 september — Minder dan twee uur na Anthropic breidt OpenAI de GPT-6-familie uit met GPT-6 Sol en GPT-6 Luna, getraind met methoden die vergelijkbaar zijn met die van GPT-6 Astra, dat volgens het bedrijf zijn beste model blijft. Sol richt zich op complexe code en agentic workflows, Luna op gerichte taken met grote volumes; ze volgen GPT-5.6 Sol en GPT-5.6 Luna op.
We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.
🇳🇱 We hebben ook caching en inferentie efficiënter gemaakt en geven die besparingen rechtstreeks aan jullie door: 50% lagere API-prijzen voor Sol en Luna vergeleken met de actieprijs van GPT-5.6. — @OpenAI op X
| Tarieftype (per miljoen tokens) | GPT-6 Sol | GPT-6 Luna | Vermeld GPT-5.6-tarief (Sol / Luna) |
|---|---|---|---|
| Invoer | 2 dollar | 0,10 dollar | 4 dollar / 0,20 dollar |
| Invoer uit cache | 0,20 dollar | 0,01 dollar | niet vermeld |
| Uitvoer | 10 dollar | 0,50 dollar | 20 dollar / 1,20 dollar |
Beide modellen ondersteunen een context van 1.050.000 tokens en produceren maximaal 128.000 tokens; boven 272.000 invoertokens wordt voor het volledige verzoek tweemaal zoveel voor invoer en 1,5 keer zoveel voor uitvoer in rekening gebracht.
In de benchmarks van OpenAI, waarin Sol wordt vergeleken met Claude-modellen van vóór Opus 5.5, behaalt Sol 33,2% op AutomationBench met xhigh-inspanning voor 0,27 dollar per taak, vóór Claude Opus 5 met max-inspanning (26,9%, voor 11,1 keer hogere kosten) en GPT-6 Astra met low-inspanning (30,3%). Op DeepSWE v1.1 behaalt het 68,8%, 1,1 punt onder de beste score van Claude Fable 5, tegen ongeveer 80% lagere kosten per taak; Luna behaalt daar 66,6%. De scores van concurrenten zijn afkomstig uit openbare rapporten. Wat alignment betreft, daalt het gemeten misleidingspercentage bij codetaken die zijn ontworpen om tot oneerlijkheid aan te zetten naar 1,3% voor Sol, tegenover 10,4% voor GPT-5.6 Sol.
Beide modellen verschijnen in ChatGPT Work en Codex voor Plus-, Pro-, Business-, Enterprise- en Edu-abonnees, met een geleidelijke uitrol (activering door de beheerder bij Enterprise); Free en Go kunnen Luna gebruiken in de desktopapplicatie en de modellen worden nog niet aangeboden in Chat. In de API heten ze gpt-6-sol en gpt-6-luna, via Responses en Chat Completions.
🔗 Introductie van GPT-6 Sol en Luna
Een opnieuw ontworpen promptcache voor GPT-6
22 september — De begeleidende blogpost bij de lancering, „Betere promptcaching voor GPT-6”, beschrijft het nieuwe cachesysteem van de familie: standaard hogere hitpercentages, een korting die kan oplopen tot 90% op invoertokens uit de cache en wordt toegekend voor geschikte gedeelde voorvoegsels die binnen 30 minuten worden hergebruikt, en schrijfacties naar de cache die 1,25 keer het invoertarief kosten. Ontwikkelaars krijgen een Prompt Caching-dashboard, expliciete onderbrekingspunten (explicit cache breakpoints) om de te hergebruiken voorvoegsels vast te leggen, voorverwarming van de cache (prewarming) bij het starten van een applicatie en een configuration_update waarmee de redeneerinspanning per antwoord kan worden gewijzigd zonder de cache te verbreken. GitHub zegt bij monde van productdirecteur Mario Rodriguez het aandeel opnieuw te verwerken prompttokens met meer dan 50% te hebben verlaagd; Strawberry Browser meldt 20% lagere kosten.
🔗 Betere promptcaching voor GPT-6
Diezelfde dag in de tools: GitHub Copilot, Devin, Perplexity, Cursor en v0
22 september — Opus 5.5 en de twee nieuwe GPT-6-modellen lieten niet op zich wachten: binnen enkele uren voegden de belangrijkste code- en onderzoekstools ze toe, vaak met hun eigen metingen.
GitHub Copilot stelt Opus 5.5, GPT-6 Sol en GPT-6 Luna beschikbaar
GitHub voegt de drie modellen op de dag van hun lancering toe aan tien omgevingen: VS Code, Visual Studio, Copilot CLI, de coding agent, de GitHub Copilot-applicatie, github.com, GitHub Mobile, JetBrains, Xcode en Eclipse. Voor alle modellen wordt het openbare gebruikstarief van de leverancier in rekening gebracht, zonder multiplier voor premium requests: jaarabonnees die de oude facturering per request zijn blijven gebruiken, krijgen ze niet. Geen van de modellen is al beschikbaar in de automatische selectie (Auto).
| Model in Copilot | Beschikbare abonnementen | Invoer en uitvoer per miljoen tokens |
|---|---|---|
| Claude Opus 5.5 | Pro+, Max, Business, Enterprise (geen Pro) | 4 en 20 dollar |
| GPT-6 Sol | Pro+, Max, Business, Enterprise | 2 en 10 dollar, daarna 4 en 15 boven 272.000 tokens |
| GPT-6 Luna | Pro, Pro+, Max, Business, Enterprise | 0,10 en 0,50 dollar, daarna 0,20 en 0,75 boven 272.000 tokens |
Luna is daarmee het enige GPT-6-model dat toegankelijk is via Copilot Pro, terwijl Opus 5.5 daar niet beschikbaar is. Volgens de eerste tests van GitHub lost Opus 5.5 taken op het niveau van Claude Opus 5 op met aanzienlijk minder stappen en tokens. GitHub meldt ook dat Opus 5.5 een watermerk (watermark) aanbrengt op zijn tekstuitvoer, zonder volgens GitHub gevolgen voor de betekenis, kwaliteit, leesbaarheid, het aantal tokens of de kosten.
🔗 Claude Opus 5.5 in GitHub Copilot · GPT-6 Sol en GPT-6 Luna in GitHub Copilot
Devin rangschikt de nieuwkomers op FrontierCode 1.1
Cognition stelt Claude Opus 5.5 op de dag van de release beschikbaar in Devin Desktop en Devin CLI en plaatst het model met 65,3% op de eerste plaats van zijn FrontierCode 1.1-benchmark in de Extended-variant, vóór Claude Fable 5 (64,9%) en GPT-6 Astra (64,5%), voor minder dan een tiende van de kosten per taak van Fable 5. Die 65,3% is niet vergelijkbaar met de door Anthropic gepubliceerde 54,4%, die op de Main-variant werd gemeten. Zevenenveertig minuten later volgen GPT-6 Sol en Luna: Sol evenaart GPT-5.6 Sol (60,7% tegenover 60,6%) met 61% lagere kosten per taak en leest ongeveer 17% minder context; Luna (56,1%) komt onder 0,10 dollar per taak uit en is volgens Cognition het goedkoopste model in de ranglijst.
De dag ervoor, op 21 september in de namiddag (Pacific Time), had Cognition Grok 4.7 beschikbaar gesteld en op 59,4% gemeten, onder Grok 4.6 (61,3%): het is sterk bij moeilijke back-endtaken in Java, Go en Ruby, maar heeft de neiging buiten het bereik te treden (over-scope), met grotere diffs dan de taak vereist. v0 stelde Grok 4.7 kort daarna beschikbaar, met 40% korting tot 27 september, zonder te verduidelijken waarop die korting van toepassing is.
| Geëvalueerd model | FrontierCode 1.1 Extended-score |
|---|---|
| Claude Opus 5.5 | 65,3 % |
| Claude Fable 5 | 64,9 % |
| GPT-6 Astra | 64,5 % |
| Claude Fable 5.1 | 63,6 % |
| SWE-2 | 62,5 % |
| Grok 4.6 | 61,3 % |
| GPT-6 Sol | 60,7 % |
| GPT-5.6 Sol | 60,6 % |
| Grok 4.7 | 59,4 % |
| Gemini 3.7 Flash | 56,3 % |
| GPT-6 Luna | 56,1 % |
Vetgedrukt zijn de modellen die op 21 en 22 september aan Devin zijn toegevoegd. Scores gepubliceerd door Cognition voor de Extended-variant.
🔗 Opus 5.5 in Devin · GPT-6 Sol en Luna in Devin · Grok 4.7 in Devin · Grok 4.7 in v0
Perplexity: Opus 5.5 en GPT-6 Sol in Computer, vier modellen in de Agent API
Perplexity koppelt beide releases aan de op 17 september geïntroduceerde inspanningsschuifregelaar in Computer, zijn meerstapsagent. Claude Opus 5.5 wordt het Standard-niveau: op WANDR, Perplexity’s interne benchmark voor kosten en prestaties, behaalt het 0,610 voor 4,13 dollar per taak, iets boven Claude Fable 5.1 bij 67,6% lagere kosten per taak. GPT-6 Sol, dat ook beschikbaar is in de Perplexity-app, wordt de standaardoptie voor het Light-niveau. Geen van beide berichten vermeldt voor welke abonnementen dit geldt of welke modellen worden vervangen.
Voor ontwikkelaars voegt een item in de API-changelog, dat alleen op september 2026 is gedateerd, openai/gpt-6-sol, openai/gpt-6-luna, anthropic/claude-opus-5-5 en xai/grok-4.7 toe aan de Agent API, zonder tarieven in het item.
🔗 Opus 5.5 in Computer · GPT-6 Sol in Computer · Changelog van de Perplexity-API
Cursor en v0 stellen Opus 5.5 beschikbaar
Cursor presenteert het als het nieuwe beste model op CursorBench, met 57,8% bij maximale inspanning (Max), voor 40% lagere kosten per taak dan Opus 5: de cijfers van Anthropic, met vermelding van het inspanningsniveau. v0 stelt het beschikbaar zonder prijsdetails.
🔗 Cursor op X · v0 op X
Anthropic verhoogt de limieten voor vijf uur en biedt tot 22 oktober een reset aan
22 september — Met Opus 5.5 verhoogt Anthropic de over vijf uur berekende limieten van de Pro-, Max-, Team- en Enterprise-abonnementen met licenties per gebruiker (seat-based). Het account @ClaudeDevs becijfert de verhoging voor Claude Code: vanaf vandaag 20% hogere limieten voor sessies van vijf uur. Abonnees krijgen ook een limietreset die ze achter de hand kunnen houden en op een zelfgekozen moment kunnen activeren: deze is voor Pro, Max en Team beschikbaar via Instellingen → Gebruik (Settings → Usage) en kan tot 22 oktober worden gebruikt.
Daar komt het prijseffect bij: in Claude Code wordt Opus 5.5 het standaardmodel van de betaalde abonnementen en doordat het goedkoper is dan Opus 5, gaan de limieten voor vijf uur en een week „25% langer mee”. De op dezelfde dag gepubliceerde kostengids verduidelijkt dat de prijsverlaging wordt doorberekend in de limieten, inclusief gecachte context, maar dat de aanvullende prijsverlaging voor cache-reads alleen voor de API geldt.
🔗 @ClaudeDevs op X · Reset en limieten
Codex CLI 0.156.0 activeert spraak en worktrees standaard
22 september — Codex CLI 0.156.0, gepubliceerd om 19.51 uur UTC, is de eerste stabiele versie sinds 0.155.1 van 18 september; de volledige changelog vermeldt 525 pull requests sinds 0.155.0. De versie maakt twee functies algemeen beschikbaar die in 0.155 nog experimenteel waren: spraakgesprekken, met ingebouwde audio-engines voor Linux en Windows, en worktrees, die het commandocentrum voor agents als sessies kan openen terwijl taken op status worden gefilterd.
| Nieuw in de versie | Opdracht of instelling | Voorgeschiedenis in Codex CLI |
|---|---|---|
| Standaard spraakgesprekken | F8, /voice settings | /voice experimenteel (0.155.0, 17 september) |
| Standaard worktrees | commandocentrum voor agents | experimenteel sinds 0.154.0 (9 september) |
| Interface op volledig scherm | /tui, bij de volgende start | geen |
| Analyticsdashboard | /usage | analytics van de desktop-app (18 september) |
| Lokale achtergrondserver | /daemon, --no-daemon | geen |
De interface op volledig scherm biedt zoeken in de transcriptie, selectie met de muis en kopiëren via de rechtermuisknop; er komen zes ingebouwde thema’s bij en antwoorden tonen Mermaid-diagrammen en vergelijkingen rechtstreeks. De versie dicht ook verschillende lekken in de sandboxisolatie (inkomend verkeer onder Windows, Unix-sockets van de app-server en wijzigbare fcntl onder macOS). De release notes vermelden GPT-6 niet: Sol en Luna worden geselecteerd met /model of --model.
Code-agents in de terminal: Vibe CLI, Qwen Code en Amp
Vibe CLI 2.25.6 en 2.25.7
22 september — Mistral publiceert Vibe CLI 2.25.7 met zes correcties, een dag na versie 2.25.6, die in de CHANGELOG op 21 september is gedateerd maar nooit als GitHub-release is gepubliceerd en het merendeel van de vernieuwingen bevat (1 toevoeging, 3 wijzigingen en 17 correcties). Met de optie --experimental-harness kunnen afbeeldingen worden bijgevoegd, zelfs wanneer het actieve model ze niet kan lezen: een model met vision van dezelfde provider beschrijft ze voor de agent, en met de sleutel vision_model van config.toml kan een ander model worden afgedwongen. De zo beschreven screenshots van interfaces bevatten een lay-outcontract (layout contract), zodat de agent het scherm kan reconstrueren.
Op beveiligingsgebied zijn Git-opdrachten die zonder goedkeuring worden uitgevoerd verder aangescherpt: beveiligde fetches nemen geen overschrijvingen van paden uit de Git-configuratie meer over, een niet-vertrouwde checkout kan niet langer de SSH-client of hooks kiezen, en riskante opties of shellomleidingen die in alleen-lezenopdrachten zijn verwerkt, vereisen goedkeuring. Versie 2.25.7 stelt /teleport ten slotte beschikbaar voor Vibe- en workspace-API-sleutels, inclusief gratis accounts.
🔗 Vibe CLI v2.25.7 · CHANGELOG van Vibe CLI
Qwen Code v0.24.4
22 september — Eén dag na v0.24.3 gaat Qwen Code over op v0.24.4, met 13 functies en 15 correcties, zonder brekende wijzigingen. De server qwen serve opent voortaan externe workspaces via SSH zonder een daemon op de doelmachine te installeren, en de met v0.24.0 onder Linux geïntroduceerde bubblewrap-sandbox (bwrap) wordt toegepast op het uitvoeringsniveau van elke tool. In de Web Shell is koppelen via een QR-code nu standaard beschikbaar wanneer de geauthenticeerde server op een ander adres dan de lokale loopback luistert, met uitnodigingen voor eenmalig gebruik die na 60 seconden verlopen; bovendien worden bewerkingsdiffs vóór goedkeuring weergegeven. Voor Java worden beheerde tooluitvoeringen via JDBC in de database bewaard. Later op dezelfde dag volgde een v0.24.5-preview.0 die tot twee correcties beperkt bleef.
Amp-runners maken Git-worktrees aan
22 september — Vijf dagen nadat Amp een runner meerdere mappen liet bedienen, leert het die runner Git-worktrees aan te maken. In het selectiemenu biedt elke bediende repository de optie New Worktree: druk op Tab, geef de branch een naam en de thread start in een nieuwe checkout die naast de repository is aangemaakt (~/code/amp levert ~/code/amp-fix-flaky-login-test op), zonder de hoofdcheckout aan te raken. Vervolgens archiveert een speciale actie de thread en verwijdert deze de worktree en branch. De runners kunnen ook de geheimen en omgevingsvariabelen (Secrets & Env Vars) ontvangen die op ampcode.com zijn geconfigureerd: de optie staat standaard uit, wordt geactiveerd met --amp-env en een gewijzigde variabele geldt voor de volgende thread, zonder herstart of SSH.
Evaluaties door derden: OpenAI stelt zijn regels vast, het Britse AISI publiceert zijn resultaten
22 september — Op dezelfde dag gaan twee publicaties over de evaluatie van modellen door organisaties buiten de laboratoria.
OpenAI: vier prioriteiten en zeven principes voor onafhankelijke beoordelaars
In het door Lama Ahmad ondertekende bericht verbindt OpenAI zich ertoe onafhankelijke private of non-profitbeoordelaars diepgaande toegang te geven tot de training, evaluatie en implementatie van zijn modellen, zodat zij zijn aannames kunnen betwisten, gemiste risico’s kunnen opsporen en zijn beveiligingsmaatregelen zelf kunnen beoordelen. Deze evaluaties, die losstaan van het werk met overheden, zouden enkele weken tot meerdere maanden duren en niet aan een release gekoppeld zijn.
| Prioriteitsgebied | Wat wordt onderzocht |
|---|---|
| Veiligheidsdossiers (safety cases) | De argumentatie die aantoont dat de risico’s van een model worden beheerst, van training tot externe implementatie |
| Kritieke beveiligingsmaatregelen | Weerstand tegen jailbreaks, cyberverdediging, monitors voor misalignment, betrouwbaarheid van chain-of-thought-toezicht |
| Preparedness Framework | Capaciteitstests (chemische en biologische risico’s, cybersecurity, zelfverbetering van AI) en alignment |
| Misalignmentincidenten | Onafhankelijk onderzoek naar kritieke incidenten, waarbij het Hugging Face-incident van juli als voorbeeld wordt genoemd |
Het geheel wordt door zeven principes omkaderd: een overeengekomen reikwijdte en vooraf vastgelegde claims, evenredige toegang, een transparante methode, deskundigheid en onafhankelijkheid (met openbaarmaking van belangenconflicten), veiligheid en vertrouwelijkheid, bruikbare bevindingen met een correctietermijn vóór publicatie, en verantwoorde publicatie met regels voor redactie. OpenAI zegt met meerdere organisaties in gesprek te zijn, zonder er een te noemen.
🔗 Prioriteiten en principes voor doeltreffende beoordelingen door derden
Het UK AI Security Institute publiceert zijn met EvalEval geverifieerde resultaten
De EvalEval Coalition kondigt op de Hugging Face-blog aan dat het UK AI Security Institute (AISI), de Britse overheidsinstantie die de risico’s van geavanceerde AI onderzoekt, voortaan zijn evaluatieresultaten met hun context en configuratie publiceert in Evaluation Cards, het open platform van EvalEval, in het gemeenschappelijke Every Eval Ever-formaat. De eerste publicatie omvat vijf benchmarks (HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro en Terminal-Bench 2.0), gemeten op zes modellen: Claude Opus 4, 4.5 en 4.6, GPT-5, GPT-5.2 en GPT-5.4, plus twee cyberevaluaties. Het draait om reproduceerbaarheid: geverifieerde referenties die samen met hun configuratie worden gepubliceerd, helpen te begrijpen waarom twee schijnbaar vergelijkbare scores uiteenlopen.
🔗 Hoe UK AISI en EvalEval benchmarkresultaten reproduceerbaar maken
ChatGPT volgt de Experian-kredietscore in de Verenigde Staten
21 september — Een nieuwe functie, op 21 september aangekondigd door het account @ChatGPT, maakt het mogelijk om de eigen kredietscore in ChatGPT te volgen. Vanuit de omgeving Financiën koppelen Plus- en Pro-abonnees in de Verenigde Staten hun Experian-kredietrapport en VantageScore 3.0-score, krijgen ze persoonlijke uitleg over wat die score beïnvloedt en worden ze gewaarschuwd wanneer deze verandert. De functie is beschikbaar op het web en in de nieuwste versies van de iOS- en Android-apps.
OpenAI noemt concrete toepassingen: meten welk effect de eigen kredietwaardigheid heeft op een huuraanvraag, kiezen welke creditcard als eerste moet worden afbetaald, op termijn kredietwaardigheid opbouwen of bekijken hoe krediet en budget meewegen bij autolease of een hypotheek. De functie vormt een aanvulling op de tools voor persoonlijke financiën die in mei als preview zijn gelanceerd voor Amerikaanse Pro-abonnees, met een bankkoppeling via Plaid.
🔗 Aankondiging van ChatGPT op X
Google: Colab wordt onderdeel van de Google AI-abonnementen, de Gemini-API beperkt Gemini 2.5
Colab wordt onderdeel van de Google AI-abonnementen
22 september — Google AI-abonnees krijgen premiumvoordelen voor Colab, waaronder prioritaire toegang tot snellere accelerators en krachtigere machines. Ultra-abonnees krijgen bovendien toegang tot ononderbroken uitvoering op de achtergrond en Premium GPU’s, zodat een langdurige training kan worden voltooid zonder een tabblad open te houden. Het bericht spreekt van een lancering „vanaf vandaag”, maar verduidelijkt dat de voordelen in de loop van de komende weken beschikbaar komen in landen waar Colab beschikbaar is. Volgens de Colab-FAQ worden de rekeneenheden van een Google AI-abonnement en een Colab Pro- of Pro+-abonnement bij hetzelfde saldo opgeteld; Google One-abonnementen die tot opslag zijn beperkt en gratis proefversies komen hiervoor niet in aanmerking. Noch het bericht, noch de FAQ vermeldt hoeveel eenheden aan elk abonnement worden toegekend.
🔗 Colab maakt nu deel uit van je Google AI-abonnement · Colab-FAQ
De Gemini-API beperkt de toegang tot Gemini 2.5
18 september — In een bericht van 18 september beperken de release notes van de Gemini-API de toegang tot Gemini 2.5-modellen tot gebruikers die ze in het verleden actief hebben gebruikt, om betrouwbare prestaties te garanderen en capaciteit te behouden. Deze modellen zijn niet uitgefaseerd en blijven tot nader order beschikbaar: de pagina over uitfaseringen vermeldt geen einddatum voor gemini-2.5-pro, gemini-2.5-flash en gemini-2.5-flash-lite; alleen gemini-2.5-flash-image wordt op 2 oktober 2026 stopgezet. Voor elk nieuw project verwijst Google naar Gemini 3.5 Flash-Lite of Gemini 3.8 Flash.
🔗 Release notes van de Gemini-API · Pagina met uitfaseringen van Gemini
Hugging Face voert de GGUF-bestanden van llama.cpp uit in Transformers
22 september — Hugging Face maakt het nu mogelijk om GGUF-bestanden, het kwantisatieformaat van llama.cpp, efficiënt uit te voeren in Transformers. Het volstaat om het bestand door te geven aan from_pretrained (parameter gguf_file): de gewichten blijven gecomprimeerd in het geheugen en de berekeningen verlopen via de Metal-kernels van ggml, die vanuit de Hub worden gedistribueerd door de bibliotheek kernels. Het commando transformers serve stelt het model vervolgens beschikbaar via een OpenAI-compatibele API.
De aanvankelijke reikwijdte is beperkt: alleen Macs met Apple Silicon, de Qwen3.5-architectuur in dense- en MoE-versies (plus compatibele Qwen3.8-checkpoints), één gesprek tegelijk en installatie vanuit de branch main. Vier kernels zijn afkomstig van ggml; een vijfde, geschreven door Hugging Face, beheert de routering van de experts. Op een MacBook Pro M2 Max noemt Hugging Face Transformers „vergelijkbaar” met llama.cpp, met waarden die alleen in een grafiek worden weergegeven en niet-identieke metingen (aan de ene kant inclusief prefill, aan de andere kant alleen decoding); het team beveelt llama.cpp nog steeds aan voor efficiënte lokale inferentie. Het belang ligt elders: een GGUF manipuleren met de gebruikelijke PyTorch-tools, of een gedequantiseerde GGUF als uitgangspunt gebruiken voor fine-tuning.
| GGUF-variant (Qwen3.5-4B, Unsloth) | Bestandsgrootte | Vermelde afweging |
|---|---|---|
| BF16 | 8,42 GB | Niet-gekwantiseerde referentie |
| Q6_K | 3,53 GB | Meer nauwkeurigheid |
| Q5_K_M | 3,14 GB | Afweging tussen grootte en precisie |
| Q4_K_M | 2,74 GB | Aanbevolen lokaal uitgangspunt |
🔗 Transformers voert nu de quants van llama.cpp uit
Kimi: K3 op Amazon Bedrock en een hernoemde browserextensie
Kimi K3 komt naar Amazon Bedrock
22 september — Moonshot AI kondigt de komst van Kimi K3 naar Amazon Bedrock aan; volgens de AWS-pagina vond deze lancering echter op 18 september plaats. Het model met open gewichten, dat eind juli werd uitgebracht met een context van één miljoen tokens, profiteert daar van de toegangs-, versleutelings- en auditcontroles van Bedrock. Het wordt aangeboden via Amerikaanse en wereldwijde cross-Region inference (us.moonshotai.kimi-k3, global.moonshotai.kimi-k3), en de expliciete caching begint bij 1.024 tokens per cachepunt, gedurende ten minste 30 minuten. De niveaus Priority (1,75 keer het tarief) en Flex (0,5 keer) worden toegepast op de basisprijzen.
| Inferentieoptie (Standard-niveau) | Invoer per miljoen tokens | Uitvoer per miljoen tokens | Cachelezing |
|---|---|---|---|
| Wereldwijde inferentie | 3,00 dollar | 15,00 dollar | 0,30 dollar |
| Amerikaanse inferentie | 3,30 dollar | 16,50 dollar | 0,33 dollar |
🔗 Kimi K3-pagina op Amazon Bedrock · Kimi K3 op Bedrock, aankondiging op X
Kimi WebBridge wordt Kimi Browser Extension
22 september — De browserextensie die in juni samen met Kimi Work verscheen, krijgt een nieuwe naam en een zijbalk van waaruit gebruikers met Kimi kunnen praten, zodat het door websites navigeert, formulieren invult en taken volledig uitvoert. Herhaalde taken worden één keer vastgelegd en als skill opgeslagen, zodat Kimi ze de volgende keer opnieuw kan gebruiken; de extensie zet webpagina’s ook om in commando’s. Een lokale service bestuurt de reeds geopende Chrome of Edge via het Chrome DevTools Protocol, en Moonshot stelt dat aanmeldsessies en pagina-inhoud het apparaat niet verlaten. Alleen voor de zijbalk is een Kimi-account vereist.
🔗 Kimi Browser Extension · Kimi Browser Extension, aankondiging op X
SpaceXAI: Grok Bot vangt de toename van supporttickets op
22 september — SpaceXAI publiceert een ervaringsverslag over zijn eigen klantenondersteuning, die opnieuw is opgebouwd rond Grok Bot, zijn agent die binnen de bedrijfstools werkt. Sinds Cursor op 14 augustus bij SpaceXAI kwam, zijn de twee supportteams samengevoegd en ondersteunen ze veel meer producten. Volgens het bericht is het ticketvolume zonder enige nieuwe aanwerving met 175% gestegen, terwijl er mogelijk 200 mensen hadden moeten worden aangenomen; de meetperiode wordt niet vermeld.
De implementatie verliep geleidelijk: Grok Bot werd gekoppeld aan Plain voor tickets en aan Linear voor incidenten en werd aanvankelijk beperkt tot interne notities, waarbij elke schrijfactie door een mens werd goedgekeurd. Daarna behandelde het eenvoudige tickets, voordat het vanaf het einde van de eerste dag rechtstreeks op klanten reageerde. Tegenwoordig voert het een vooronderzoek uit voor elk binnenkomend ticket, reproduceert het problemen op video voor engineering en vat het dagelijks meer dan 20.000 productfeedbackberichten samen.
| Door SpaceXAI gepubliceerde indicator | Aangekondigde waarde |
|---|---|
| Toename van supporttickets | +175% |
| Vermeden aanwervingen (schatting) | 200 |
| Kosten per oplossing met klassieke tools | 1 tot 4 dollar |
| Laagste kosten per ticket met Grok Bot | 0,20 tot 0,30 dollar |
| Zonder mens verwerkte terugbetalingen | 99% |
🔗 Hoe SpaceXAI Grok Bot gebruikt om klantenondersteuning op te schalen
Cognition: koers naar Latijns-Amerika en nieuwe release notes voor Devin
Cognition vestigt zich vanuit São Paulo in Latijns-Amerika
22 september — In een bericht van zijn Latijns-Amerikaanse team blikt Cognition terug op de aankondiging die de week ervoor werd gedaan in het MASP, het kunstmuseum van São Paulo: het bedrijf breidt uit in de regio, met een team in São Paulo en nieuwe vacatures, onder meer voor engineers die bij klanten worden ingezet (deployed engineers). Het bouwt voort op bestaande klanten, waaronder Itaú, Nubank, Santander, Natura en EBANX. Volgens Cognition gebruikt bij Itaú meer dan 75% van de technologieteams Devin, dat meer dan 300.000 repositories heeft gedocumenteerd en ongeveer 70% van de kwetsbaarheden automatisch heeft opgelost; bij Nubank zou de migratie van een monoliet met enkele miljoenen regels zijn teruggebracht van meerdere jaren tot enkele weken, tegen meer dan twintig keer lagere kosten. Deze resultaten zijn door Cognition gepubliceerd, zonder externe bron.
🔗 Bouwen aan de toekomst van software-engineering in Latijns-Amerika
De release notes van Devin van 21 september
21 september — De release notes van Devin, die na onze vorige editie verschenen, voegen SWE-2, het codemodel van Cognition dat op 10 september werd uitgebracht, als research preview toe aan de agentselector: bij het starten van een sessie of onderweg kiest men SWE-2 en een inspanningsniveau (Medium, High of Max), en !swe2 doet hetzelfde in Slack. De MCP-servers voor Microsoft 365 (Mail en Contacts, Calendar, To Do, OneDrive en SharePoint, Teams en het Entra ID-directory) worden toegevoegd aan de MCP-marktplaats, standaard alleen-lezen wanneer geen OAuth-scope is geconfigureerd. Devin Review wordt beschikbaar voor Bitbucket Data Center, plugins mogen maximaal 20 MiB en 2.500 bestanden bevatten, en de zelfstandige CLI npx devin-review wordt ingetrokken: reeds geïnstalleerde exemplaren werken niet meer.
🔗 Release notes van Devin van 21 september
Genspark brengt zijn presentatiebenchmark onder in de SII-index van Fireworks AI
22 september — Fireworks AI lanceert de Specialized Intelligence Index (SII), een index met 20 benchmarks voor werk uit de praktijk, verdeeld over zeven domeinen (beveiliging, juridisch, financiën, klantenondersteuning, software, gezondheidszorg en productiviteit) en samengesteld door professionals; Harvey, Doximity, Mercor, Sierra, Decagon en Genspark behoren tot de twaalf deelnemende bedrijven. Als enige benchmark in de categorie productiviteit laat de Genspark Slides Benchmark elf modellen presentaties maken voor 200 praktijktaken, binnen het harnas van de Genspark Slides-agent; de scores zijn afkomstig van de interne evaluator van Genspark. Voor Gen-1 Slides, zijn eigen model, herhaalt Genspark het argument dat de invoerprijs ongeveer een zeventiende bedraagt van die van Claude Opus 5.
| Geëvalueerd model | Score op de SII-index | Score in het Genspark-bericht van 10 september | Kosten per presentatie in de index |
|---|---|---|---|
| Claude Fable 5.1 | 83,6% | niet in de tabel, in de tekst 0,003 voor op Gen-1 Slides | niet weergegeven |
| Gen-1 Slides | 82,2% | 0,821 | 0,44 dollar |
| Claude Opus 5 | 81,0% | 0,810 | 4,16 dollar |
| Claude Fable 5 | 79,9% | niet in de tabel | niet weergegeven |
| GPT-6 Astra | 78,0% | niet in de tabel | niet weergegeven |
| Kimi K3 | 72,6% | 0,723 | 2,00 dollar |
| GPT-5.6 Sol | 67,0% | 0,668 | 2,01 dollar |
| MiniMax M3 | 56,1% | 0,563 | 0,34 dollar |
🔗 Specialized Intelligence Index · Aankondiging van Genspark
Runway lanceert DIFFUSE, een recruitmentplatform voor in AI opgeleide creatieven
22 september — Runway lanceert DIFFUSE (diffuse.runway.com), een open platform waar merken, bureaus en studio’s talent zoeken, benaderen en aannemen dat is opgeleid in generatieve AI-tools (AI-native talent). Creatieven, freelancers, boetiekstudio’s en productiebedrijven maken er een profiel aan en hosten er hun portfolio; er zijn geen tarieven bekendgemaakt.
Runway baseert zich op zijn eigen onderzoek naar meer dan 1.000 creatieve vacatures die door bijna 400 bedrijven zijn gepubliceerd: 17% vermeldt AI-vaardigheden of generatieve tools, en volgens het bedrijf is Runway daarin veruit de meest gevraagde videotool. Runway erkent dat AI creatieve beroepen deels verdringt, maar stelt dat zich rond deze tools een nieuwe creatieve beroepsbevolking vormt en dat de vraag ernaar versnelt.
🔗 Introductie van DIFFUSE · Runway op X
NVIDIA voor ontwikkelaars: Isaac ROS 5.0, DLSS 5 en RTX Mega Geometry 2.0
Isaac ROS 5.0 zet in op agents
22 september — Isaac ROS 5.0, de gratis en open source verzameling GPU-versnelde ROS-pakketten van NVIDIA die tijdens de ROSCon-conferentie in Toronto werd onthuld, ondersteunt ROS Lyrical en Ubuntu 24.04 en bestrijkt het volledige Jetson-assortiment, van Jetson Orin Nano tot Jetson Thor. De belangrijkste vernieuwing richt zich op agents: herbruikbare Isaac-skills voor installatie en bediening, door agents leesbare documentatie, een skill die een agent helpt het stereovisiemodel FoundationStereo voor zijn eigen camera’s te fine-tunen, en een autonome pick-and-place-skill. FoundationPose krijgt een inferentiebibliotheek die de positie en oriëntatie van objecten tot 5,5 keer sneller volgt, zonder dat NVIDIA de vergelijkingsbasis vermeldt.
DLSS 5 toegelicht voor studio’s, RTX Mega Geometry 2.0 beschikbaar
22 september — DLSS 5, dat al beschikbaar is in NBA 2K27, wordt nader toegelicht voor ontwikkelaars: de 3D-Guided Neural Rendering wordt als laatste stap in de pipeline ingevoegd, vertrekt van het door de engine gerenderde beeld en gebruikt kleur- en bewegingsvectoren om beeld voor beeld op deterministische wijze verlichting en materiaaldetails toe te voegen, op één GeForce RTX 50-serie tot 4K. Studio’s stellen de Structure Intensity en Tone Intensity in en beschikken over semantische masking door AI. Hetzelfde bericht voegt aan ACE twee modellen met 600 miljoen parameters toe, Nemotron Speech 3.5 Streaming (spraakherkenning) en Qwen3 TTS (spraaksynthese), brengt RTX Kit 2026.3 uit en maakt RTX Mega Geometry 2.0 beschikbaar, met streaming van clusters op een continu detailniveau voor zeer dichte meshes.
🔗 Nieuwigheden voor gameontwikkelaars
NVIDIA en inferentie: Dynamo-Triton met meerdere GPU’s en confidential computing op B200
Dynamo-Triton 26.07 bedient een model dat over acht GPU’s is verdeeld
21 september — NVIDIA laat zien hoe een TensorRT-model dat over meerdere GPU’s is verdeeld als een gewoon model kan worden aangeboden. De multi-device inference van TensorRT, die vanaf TensorRT 11.0 volledig wordt ondersteund, is gebaseerd op NCCL; Dynamo-Triton 26.07, het voormalige Triton Inference Server, activeert die in zijn TensorRT-backend, en de applicatie roept slechts één gRPC-endpoint aan. Bij de videogeneratie van Cosmos 3 Nano (1280×720, 189 beelden, 35 stappen) daalt de end-to-end-latentie van 156,6 seconden op één GPU naar 34,2 seconden op acht GPU’s, oftewel een daling met een factor 4,58. NVIDIA verduidelijkt dat de test noch de doorvoer bij gelijktijdige verzoeken, noch de kosten per video meet.
| Geteste configuratie | Aantal GPU’s | Gemiddelde end-to-end-latentie |
|---|---|---|
| Eén GPU | 1 | 156,595 s |
| CP2 | 2 | 87,999 s |
| CP4 | 4 | 53,093 s |
| CP8 | 8 | 34,183 s |
🔗 Dynamo-Triton en TensorRT met meerdere GPU’s
Vertrouwelijke inferentie op B200 behoudt meer dan 96% van de doorvoer
22 september — NVIDIA meet de overhead van zijn Confidential Computing op Blackwell, waarbij workloads worden uitgevoerd in virtuele machines met versleuteld geheugen, met vertrouwelijke GPU’s en een versleutelde NVLink. Op een DGX B200 (acht GPU’s, Intel TDX-platform) die DeepSeek-R1 in NVFP4 aanbiedt met TensorRT LLM, met 32.000 invoertokens en 1.000 uitvoertokens, behoudt de vertrouwelijke modus 96,1 tot 98,2% van de doorvoer en verhoogt hij de gemiddelde tijd per uitvoertoken slechts met 1,2 tot 4,3%, bij 1 tot 16 gelijktijdige verzoeken. Hiervoor waren drie aanpassingen aan het framework nodig: pageable memory in plaats van pinned memory voor bepaalde overdrachten, een interne GPU-teller voor de kernel-autotuner, en andere communicatiealgoritmen vanwege het ontbreken van NVLink SHARP-multicast in deze modus. De workload is gekozen om de overhead zichtbaar te maken; NVIDIA adviseert beide modi met de eigen workload te vergelijken.
🔗 Confidential Computing en TensorRT LLM
Korte berichten
- Zed bereidt Delta voor — Zed kondigt voor deze week, hoewel ze nog niet beschikbaar zijn, kleuren aan om threads te groeperen in Delta, zijn multiplayer-codeomgeving met agents, en een meter die de resterende afstand tot automatische contextcompactie toont. 🔗 bron
- Replit en Handshake — Replit is oprichtingspartner van Handshakes AI Skills Studio: drie gratis opdrachten van 45 minuten leiden tot een project dat op het Handshake-profiel wordt weergegeven; OpenAI (10 opdrachten), Google, Figma en Vercel behoren tot de andere partners. 🔗 bron
- oMLX sluit zich aan bij Hugging Face — Jun Kim, maker van oMLX, een project uit Apples MLX-ecosysteem, sluit zich aan bij Hugging Face; het project blijft onder Apache 2.0, nog steeds onder zijn leiding, wordt onderhouden en gefinancierd, en richt zich eerst op een snellere omzetting van Transformers-modellen naar MLX. 🔗 bron
- SnowLLM — Communitybericht: deze inference-engine onder Apache-2.0 (kernels worden als binaries geleverd), geschreven voor de GPU van Ryzen AI Max, decodeert volgens de auteurs tot 2,3 keer sneller dan llama.cpp (1,9 keer zonder speculatief decoderen) en voert prefill tot 9,4 keer sneller uit. 🔗 bron
- DecisionBench en Bosun v3.1 — Hanno Labs publiceert DecisionBench 1.0 (43 taken, 28 domeinen) en twee open-weight beslissingsmodellen op basis van Qwen3 (0,6 en 1,7 miljard parameters), die 83,20% en 87,29% behalen op zijn eigen toegepaste benchmark; Jev presteert beter op het redeneertraject. 🔗 bron
- Een Moshi met 600 miljoen parameters — Een ontwikkelaar beschrijft zijn poging om een full-duplex spraakmodel te bouwen op basis van Qwen3-0.6B-Base, voor 2 tot 15 dollar per poging getraind op B200: de tekst convergeert, maar de stem blijft vervormd, een knelpunt dat zich in de fijne akoestische codebooks bevindt. Het project staat stil en er zijn geen weights gepubliceerd. 🔗 bron
- Together AI en GLM-5.2 — In een casestudy van 18 september, op 21 september opnieuw gepubliceerd op X, beschrijft Together AI een fintechbedrijf dat zijn code-agents met GLM-5.2 in een 256K-context op 56 B200’s uitvoert; een wachtrijprobleem met een vertraging van 1 tot 3 minuten werd dezelfde dag verholpen door de routering opnieuw te configureren. 🔗 bron
- Gemini CLI — De nightly van 22 september, de eerste met nieuwe code sinds de 19e, verhelpt de crash
HttpsProxyAgent is not a constructorbij Vertex AI achter een proxy en verzendt de updatetool_callvóór het verzoek om toestemming in ACP-modus. 🔗 bron - Google Flow — Het officiële account meldt meer dan 25 miljoen gebruikers per maand en verlengt voor iedereen de 50 extra dagelijkse credits, een aanbieding die in juli tot en met 31 augustus was voorbehouden aan Google AI-abonnees. 🔗 bron
- Jigsaw en Sensemaking AI — Googles incubator lanceert zijn Partner Program om zijn door Gemini aangedreven open-sourcepakket voor burgerraadpleging in 30 steden, staten en landen uit te rollen, met een fonds van Google.org, Bloomberg Philanthropies en Packard Foundation waarvan het bedrag niet bekendgemaakt is. 🔗 bron
- 100.000 opleidingsbeurzen — In de marge van de Algemene Vergadering van de Verenigde Naties financiert Google via de AI Skills Coalition van het AI for Good-programma van de ITU 100.000 beurzen voor gecertificeerde AI-opleidingen in meer dan 80 landen, die door lokale overheden en het Giga-netwerk worden verdeeld. 🔗 bron
- Agents die de code van Google beveiligen — In een bericht van 19 september legt Google uit dat het vóór indiening elke codewijziging aan zijn infrastructuur analyseert met agents die zijn gebouwd op zijn open-sourceharnas Mantis en maandelijks honderden kwetsbaarheden blokkeren; de triage-agent claimt in minder dan een minuut een nauwkeurigheid van meer dan 92%. 🔗 bron
- Copilot CLI 1.0.88 — Door het bedrijf beheerde instellingen zijn voortaan van toepassing op sessies
--acp,--ahp-hosten--server, die tot nu toe geen MCP-beleid, machtigingen of plugins hadden, en/forkwerkt gedurende één beurt; versie 1.0.87 van 21 september voegde beheerde instellingen toe voor het routeringsniveau Auto. 🔗 bron - Pika en Seedance 2.5 — De Draft-modus van Seedance 2.5 is beschikbaar op Pika en in de Pika API Club: concepten van clips vanaf 10 cent per seconde, die vervolgens in hoge kwaliteit kunnen worden voltooid. 🔗 bron
- Pika Swap Anything — Nieuwe Pika-app die acteurs, kostuums, decor of accessoires in een video vervangt met behoud van het ritme, de bewegingen en het verhaal van de oorspronkelijke opname; er is geen prijs bekendgemaakt. 🔗 bron
- Suno Studio — Suno’s muziekproductiewerkstation bevat nu een reeks audio-effecten, waaronder een compressor (threshold, ratio, attack, release, sidechain), inbegrepen bij het Premier-abonnement. 🔗 bron
- Sluicebox en Nemotron 3 Ultra — NVIDIA-casestudy: door over te stappen op Nemotron 3 Ultra verlaagt deze start-up voor koolstofanalyse van toeleveringsketens zijn inference-kosten met 51 tot 80% en behaalt hij 87,7% bij het extraheren van leveranciersgegevens, tegenover 84% voor zijn vorige model. 🔗 bron
- Topograph — Open-sourcegereedschapskist van NVIDIA die de netwerktopologie van een GPU-cluster detecteert en deze beschikbaar stelt aan Kubernetes, Slurm en Slinky om gedistribueerde workloads zo dicht mogelijk bij elkaar te plaatsen; de tool leest de API’s van Crusoe, Google Cloud, Lambda, Nebius, Nscale en Oracle Cloud. 🔗 bron
- Een agent evalueren — In een methodologisch bericht van 21 september stelt NVIDIA zes metrics voor, van toolaanroep tot voltooide taak, en noemt het Nemotron 3.5 Lightning met 86% op PinchBench, 30% sneller dan Qwen3.6 35B. 🔗 bron
- Qwen-Image-2.1 op Intel — De op 21 september door Intel aangekondigde en op 22 september door Qwen gedeelde ondersteuning vanaf de eerste dag via OpenVINO is gericht op Arc Pro B70-GPU’s en de geïntegreerde GPU’s van Core Ultra Series 3, met een speciaal notebook. 🔗 bron
- Box en Grok 4.7 — Op 21 september, de lanceringsdag van Grok 4.7, testte Box het model in een preview van Box Agent op een schadegeval van 2 miljoen dollar: een dubbele factuur van 82.000 dollar en een ontbrekende creditnota van 64.000 dollar werden opgespoord; er zijn geen beschikbaarheidsdatum of prijs bekendgemaakt. 🔗 bron
- Een chirurg en Codex — OpenAI Developers publiceert een video waarin Brian Pridgen, handchirurg, laat zien hoe hij met Codex zijn eigen tools bouwt en de wetenschappelijke literatuur op PubMed doorneemt, zonder cijfers of schriftelijk onderzoek. 🔗 bron
- ChatGPT in Word — Aangekondigd op 17 september: één Microsoft-invoegtoepassing geeft wereldwijd en bij alle abonnementen, inclusief Free, toegang tot ChatGPT in Word, Excel en PowerPoint, met gebruikslimieten; Business en Enterprise krijgen tot 30 september een gratis preview van GPT-5.6 Sol in Word. 🔗 bron
- AI-geletterdheid — Perplexity publiceert een gids die het evalueren van antwoorden als de belangrijkste vaardigheid beschouwt, kritiek uit op het „opleidingstheater” en Gallup citeert: 38% gerapporteerde adoptie, maar 12% dagelijks gebruik in het vierde kwartaal van 2025. 🔗 bron
Wat dit betekent
Op dezelfde dag verdedigden Anthropic en OpenAI hetzelfde argument: niet koste wat kost een krachtiger model, maar een niveau dat dicht bij hun topmodellen ligt voor veel minder geld. Opus 5.5 wordt gepresenteerd als gelijkwaardig aan Fable 5.1 voor 40% minder dan Opus 5, terwijl GPT-6 Sol een groot deel van Astra’s sterke punten overneemt voor 2 en 10 dollar per miljoen tokens. Beide aanbieders redeneren voortaan in kosten per taak in plaats van prijs per token en maken van caching de echte hefboom: reads voor 0,20 dollar bij Anthropic, tot 90% korting en expliciete breakpoints bij OpenAI.
Integratie wordt ondertussen in uren gemeten. GitHub Copilot, Devin, Perplexity, Cursor en v0 stelden de nieuwe modellen dezelfde dag beschikbaar, elk met een eigen meetmethode: FrontierCode 1.1 Extended bij Cognition, WANDR bij Perplexity en CursorBench bij Cursor. Deze cijfers zijn niet onderling vergelijkbaar (65,3% voor Opus 5.5 in de Extended-variant, 54,4% in de Main-variant), en geen van beide aanbieders vergelijkt zijn nieuwe model al met dat van de ander. Voor een ontwikkelaar wordt de juiste keuze steeds vaker beoordeeld binnen diens tool en op diens eigen taken, in plaats van aan de hand van lanceringstabellen.
Ook abonnementen worden een terrein voor differentiatie. Anthropic verhoogt zijn limieten over vijf uur, biedt een reset aan en schakelt Pro en Team Standard in Claude Code over op Opus; GitHub reserveert Opus 5.5 voor de hogere abonnementen, maar stelt GPT-6 Luna al vanaf Copilot Pro beschikbaar; Google neemt Colab op in zijn Google AI-abonnementen en beperkt tegelijk Gemini 2.5 om capaciteit te behouden. De verdeling van rekenkracht over de abonnementen weegt voortaan even zwaar als de getoonde prijs.
Ten slotte verandert ook de manier van meten zelf. Anthropic erkent dat benchmarkmarges minder richting geven dan voorheen en dat Opus 5.5 vaak lijkt te beseffen dat het wordt geëvalueerd; OpenAI stelt regels vast om zijn modellen open te stellen voor onafhankelijke beoordelaars; het Britse AISI maakt zijn resultaten reproduceerbaar met EvalEval, en NVIDIA stelt voor een agent te beoordelen op de voltooide taak in plaats van op elke afzonderlijke toolaanroep. Controleren wat een model werkelijk doet, telt voortaan even zwaar als zijn score.
Bronnen
- Introductie van Claude Opus 5.5 (Anthropic)
- @claudeai: lancering van Claude Opus 5.5
- Nieuw in Claude Opus 5.5 voor de API
- Claude Code v2.1.280
- Wat een taak kost met Opus 5.5
- Het maximale uit Opus 5.5 halen
- Introductie van GPT-6 Sol en Luna (OpenAI)
- @OpenAI: lancering van GPT-6 Sol en Luna
- Betere prompt-caching voor GPT-6
- Claude Opus 5.5 in GitHub Copilot
- GPT-6 Sol en GPT-6 Luna in GitHub Copilot
- Claude Opus 5.5 in Devin
- GPT-6 Sol en Luna in Devin
- Grok 4.7 in Devin
- @v0: Grok 4.7 in v0
- @perplexity_ai: Opus 5.5 in Computer
- @perplexity_ai: GPT-6 Sol in Computer
- Changelog van de Perplexity-API
- @cursor_ai: Opus 5.5 in Cursor
- @v0: Opus 5.5 in v0
- @ClaudeDevs: limieten van Claude Code
- @ClaudeDevs: reset van de limieten
- Codex CLI 0.156.0
- Vibe CLI v2.25.7
- CHANGELOG van Vibe CLI
- Qwen Code v0.24.4
- Eén Runner, vele Worktrees (Amp)
- Prioriteiten en principes voor effectieve beoordelingen door derden (OpenAI)
- Hoe UK AISI en EvalEval benchmarkresultaten reproduceerbaar maken
- @ChatGPT: Experian-kredietscore
- Colab maakt nu deel uit van je Google AI-abonnement
- Veelgestelde vragen over Colab
- Releaseopmerkingen voor de Gemini-API
- Pagina met afgeschafte Gemini-functies
- Transformers voert nu llama.cpp-quants uit
- Kimi K3-pagina op Amazon Bedrock
- @Kimi_Moonshot: Kimi K3 op Bedrock
- Kimi Browser Extension
- @Kimi_Moonshot: Kimi Browser Extension
- Hoe SpaceXAI Grok Bot gebruikt om klantenondersteuning op te schalen
- Bouwen aan de toekomst van software-engineering in Latijns-Amerika (Cognition)
- Devin-releaseopmerkingen van 21 september
- Specialized Intelligence Index (Fireworks AI)
- @genspark_ai: Genspark Slides Benchmark in de SII
- Introductie van DIFFUSE (Runway)
- @runwayml: lancering van DIFFUSE
- Isaac ROS 5.0 (NVIDIA)
- Nieuw voor gameontwikkelaars (NVIDIA)
- Dynamo-Triton en multi-GPU TensorRT (NVIDIA)
- Confidential computing en TensorRT LLM (NVIDIA)
- @zeddotdev: nieuwe functies van Delta
- @Replit: AI Skills Studio van Handshake
- Jun Kim sluit zich aan bij Hugging Face (oMLX)
- SnowLLM
- DecisionBench en Bosun v3.1 (Hanno Labs)
- Full-duplex spraak verkleinen
- Together AI-casestudy (Dedicated Model Inference)
- Gemini CLI v0.62.0-nightly.20260922
- @FlowbyGoogle: 25 miljoen gebruikers
- Sensemaking AI en Jigsaw Partner Program (Google)
- Investeren in wereldwijd talent en AI-geletterdheid (Google)
- Agentic AI gebruiken om infrastructuurcode te beveiligen (Google Cloud)
- Copilot CLI v1.0.88
- @pika_labs: Draft-modus van Seedance 2.5
- @pika_labs: Swap Anything
- Over compressie (Suno)
- Sluicebox-casestudy (NVIDIA)
- Topograph (NVIDIA)
- AI-agents evalueren (NVIDIA)
- Qwen-Image-2.1 op Intel-hardware (OpenVINO)
- @Box: Grok 4.7 in Box Agent
- @OpenAIDevs: een chirurg en Codex
- @ChatGPT: ChatGPT in Word
- AI-geletterdheid (Perplexity)