Zoeken

Claude Code leest AGENTS.md, Qwen3.8-Omni-Flash arriveert, Codex test spraakgesprekken

ai-powered-markdown-translator

Artikel vertaald van het Frans naar het Nederlands met gpt-5.6-sol.

Bekijk project op GitHub ↗

Deze vrijdag bewegen agenttools naar gedeelde indelingen toe: Claude Code leest voortaan AGENTS.md wanneer een project geen CLAUDE.md heeft, Antigravity voegt de catalogus met subagents toe aan de systeemprompt van zijn Markdown-agents, Codex specificeert het verbruik per subagent en MiniMax maakt de code van zijn terminalagent openbaar. De rest van de dag draait om twee modelreleases — Qwen3.8-Omni-Flash en Grok Voice Transcribe 2.0 — en een ongebruikelijke samenwerking: Anthropic plaatst beoordelaars van Accenture binnen zijn eigen bedrijf.


Claude Code leest AGENTS.md, isoleert subagents en verwijdert TaskOutput

18 september — Drie versies van Claude Code volgden elkaar in twintig uur op: 2.1.275 op 17 september om 22.33 uur UTC, 2.1.276 op 18 september om 02.12 uur UTC en 2.1.277 op 18 september om 18.06 uur UTC.

De meest structurele vernieuwing staat in één regel van versie 2.1.277. In een project zonder CLAUDE.md leest Claude Code AGENTS.md, het instructiebestand dat een gedeelde conventie is geworden voor verschillende codeagents op de markt. De keuze kan worden ingesteld in /config, onder ‘Project instructions’. De functie is nog niet beschikbaar op Bedrock, Vertex of Foundry.

Added AGENTS.md support: in a project with no CLAUDE.md, Claude Code reads AGENTS.md instead; change it under “Project instructions” in /config (not yet on Bedrock, Vertex or Foundry)

🇳🇱 Ondersteuning voor AGENTS.md toegevoegd: in een project zonder CLAUDE.md leest Claude Code in plaats daarvan AGENTS.md; de instelling kan worden gewijzigd onder ‘Project instructions’ in /config (nog niet op Bedrock, Vertex of Foundry). — CHANGELOG van Claude Code, anthropics/claude-code

Twee andere wijzigingen in dezelfde versie hebben betrekking op de veiligheid van de context. Resultaten van subagents worden naar de hoofdagent doorgestuurd onder een kop die ze als zodanig markeert, zodat tekst die door een subagent wordt teruggestuurd niet kan doorgaan voor een instructie van de sessie; daarnaast worden onzichtbare Unicode-opmaaktekens uit prompts verwijderd en wordt de opgeschoonde versie vóór verzending getoond. Versie 2.1.277 verwijdert ook de verouderde tool TaskOutput: Claude leest het uitvoerbestand van een achtergrondtaak voortaan met Read.

Versie 2.1.275 voegt een toets voor onmiddellijke verzending (ctrl+enter) toe, die de lopende beurt onderbreekt en alle berichten in de wachtrij in één keer verzendt, evenals synchronisatie naar de terminal van skills en plugins die op het claude.ai-account zijn geactiveerd. Wat de toeleveringsketen betreft, worden plugins uit npm met npm pack --ignore-scripts opgehaald en op integriteit gecontroleerd, waardoor installatiescripts van een pakket niet kunnen worden uitgevoerd. Versie 2.1.276, minder dan vier uur later gepubliceerd, verhelpt slechts één regressie in deze versie: een 400-fout waardoor alle verzoeken achter een proxy mislukten.

VersienummerPublicatie (UTC)Opvallende inhoud
2.1.27517/09 om 22.33 uOnmiddellijke verzending, synchronisatie van claude.ai-skills, npm --ignore-scripts
2.1.27618/09 om 02.12 uEén correctie: 400-fout achter een proxy
2.1.27718/09 om 18.06 uOndersteuning voor AGENTS.md, isolatie van subagents, verwijdering van TaskOutput

🔗 Releaseopmerkingen voor versie 2.1.277


Qwen3.8-Omni-Flash, het eerste agentische omni-modale model van Qwen

18 september — Qwen brengt Qwen3.8-Omni-Flash uit, gepresenteerd als zijn eerste omni-modale model dat rond agentische mogelijkheden is ontworpen. De aangekondigde verschuiving betreft niet langer het begrijpen van multimodale inhoud, maar het benutten ervan: de inhoud begrijpen, de taak plannen, deze met tools uitvoeren en het resultaat opleveren. Het model accepteert tekst, afbeeldingen, audio en video binnen een contextvenster van één miljoen tokens.

Meet Qwen3.8-Omni-Flash, Qwen’s first omni-modal model built around agentic capabilities!

🇳🇱 Dit is Qwen3.8-Omni-Flash, het eerste omni-modale model van Qwen dat rond agentische mogelijkheden is gebouwd.@Alibaba_Qwen op X

Bij de 29 door Qwen geselecteerde evaluaties stijgt de gemiddelde score met meer dan 25% ten opzichte van Qwen3.5-Omni-Plus, waarbij de winst zich concentreert op audio-videoagents. De herkenning van meerdere sprekers verbetert het sterkst.

Geselecteerde evaluatieQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71,034,558,9
UniClawBench69,667,169,0
AgenticVBench36,814,545,0
OmniVideoBench63,453,865,2
StreamingBench80,857,179,9
AliMeeting DER / cpWER (lager is beter)3,4 / 17,288,1 / 89,672,6 / 53,1

Het origineelste punt is agentische waarneming toegepast op lange video’s. In plaats van een opname van begin tot eind te verwerken, gaat het model uit van de gestelde vraag, beslist het zelf waarnaar het moet kijken en luisteren en lokaliseert het de informatie via opeenvolgende stappen van grof naar fijn. Op OmniVideoBench verhoogt deze modus de nauwkeurigheid van 63,4 naar 67,8, terwijl het verbruik daalt van 145.736 naar 79.117 tokens per verzoek, ongeveer 45,7% minder — een cijfer dat in het officiële artikel zelf wordt genoemd.

Ook het prijsaspect volgt: volgens de methodologie van Qwen daalt de prijs per uur audio-invoer met meer dan 98% ten opzichte van Qwen3.5-Omni-Plus. Tegelijkertijd worden twee componenten opengesteld: Qwen-MM-Plugins, compatibel met de agentomgevingen Codex, Claude Code, Qwen Code en Gemini CLI, en Qwen-Live Harness voor realtime-interactie. Een Realtime-variant is bedoeld voor continue interactie met lage latentie, met een eerste token na 591 tot 981 milliseconden.

🔗 Qwen-artikel over Qwen3.8-Omni-Flash


Codex CLI 0.155.0 introduceert experimentele spraakgesprekken

17 september — OpenAI brengt Codex CLI 0.155.0 uit, de eerste stabiele versie sinds 0.154.0 van 10 september, te installeren met npm install -g @openai/codex@0.155.0. Dit is de ontbrekende changelogvermelding voor de spraakagent die een dag eerder op X werd aangekondigd: de functie heet /voice, biedt live transcriptie en microfoonbediening en blijft experimenteel — alleen beschikbaar in ondersteunde builds (supported builds) en te activeren met /experimental.

De rest van de versie is minder opvallend, maar direct bruikbaarder. De terminalinterface krijgt live samenvattingen van de redenering in de statusregel en een eindtijdstip na elke geslaagde beurt. In het agentoverzicht kunnen taken worden verborgen, gearchiveerd en verwijderd, met details over het eigendom van worktrees en een bevestiging voordat schone beheerde worktrees worden verwijderd. Op compatibele Macs kunnen MCP-verzoeken uit lokale TUI-sessies met Touch ID worden goedgekeurd. Amazon Bedrock kan zijn AWS-inloggegevens via geconfigureerde opdrachten verkrijgen, met caching, vernieuwing na het verlopen en hervatting na een mislukte authenticatie.

Verschillende correcties hebben betrekking op de beveiliging: ontsnappingen van Windows-processen uit beperkte WSL-sandboxen worden geblokkeerd, bemiddelde shell-snapshots worden beter beschermd tegen het blootleggen van inloggegevens en een accountwissel maakt sessies voor bediening op afstand, de gecachte WebSocket-status en modelcatalogi van de vorige identiteit ongeldig.

Nieuw in de versieDetails
/voiceLive transcriptie en microfoonbediening, experimenteel via /experimental
TerminalinterfaceSamenvattingen van redeneringen in de statusregel, eindtijdstip van de beurt
AgentoverzichtVerbergen, archiveren en verwijderen van taken, eigendom van worktrees
Touch IDGoedkeuring van MCP-verzoeken in een lokale sessie op compatibele Macs
Amazon BedrockAWS-inloggegevens verkregen via een opdracht, met cache en vernieuwing

🔗 Releaseopmerkingen voor Codex CLI 0.155.0

Codex specificeert zijn verbruik per taak, subagent en gesprek

18 september — OpenAI Developers kondigt gedetailleerde verbruiksregistratie in Codex aan: de tool laat zien hoe taken, subagents en afzonderlijke gesprekken bijdragen aan het totale gebruik. De informatie staat in de desktopapp, onder Instellingen en vervolgens Usage & billing voor persoonlijke en Business-accounts, of onder Usage voor in aanmerking komende Enterprise-accounts; de app moet hiervoor up-to-date zijn. De aankondiging gaat niet vergezeld van een blogartikel of changelogvermelding.

De granulariteit is het echte onderwerp. Tot nu toe gaf een opgebruikt quotum niet aan waar het verbruik vandaan kwam; een uitsplitsing per subagent maakt duidelijk welke delegatie veel kost, zodat die kan worden herschreven. Het is de boekhoudkundige tegenhanger van de veralgemening van subagents in code-agentomgevingen.

🔗 Aankondiging van OpenAI Developers op X


Grok Voice Transcribe 2.0, de spraakherkenning van SpaceXAI tegen een ongewijzigd tarief

18 september — SpaceXAI kondigt Grok Voice Transcribe 2.0 aan, zijn nieuwe model voor spraakherkenning (speech-to-text), dat volgens het bedrijf bij hetzelfde tarief tweemaal zo nauwkeurig is als versie 1.0. Het model is gebaseerd op de audiofundering die Grok Voice al aandrijft, dat volgens het bedrijf dagelijks tienduizenden klantenservicegesprekken verwerkt en miljoenen uren videovoice-over transcribeert.

Het centrale argument draait om echte audio in plaats van laboratoriumaudio: instabiele telefoonverbindingen, concurrerende stemmen, lokale accenten en hardop gedicteerde telefoonnummers en e-mailadressen. SpaceXAI claimt de eerste plaats in nauwkeurigheid onder 32 streamingmodellen in het openbare klassement van Artificial Analysis en baseert zich op vier interne datasets uit productieverkeer — telefonie op 8 kHz, gesprekken met Grok, gedicteerde identificatiegegevens en korte spraakopdrachten in 19 talen.

De duidelijkste winst betreft meertaligheid. In de dataset met korte zinnen, die de minste context bieden om de taal te herkennen, daalt het woordfoutpercentage van 20,6% naar 6,8%. Het model detecteert de taal automatisch en volgt taalwisselingen tijdens een opname in één doorgang.

Gemeten metriekAangekondigde waarde
Geclaimde nauwkeurigheid tegenover Transcribe 1.0tweemaal zo hoog
Artificial Analysis-klassement (streaming)1e van 32 modellen
Foutpercentage bij korte zinnen (1.0 → 2.0)20,6% → 6,8%
Tarief voor batchverwerking0,10 dollar per uur audio
Tarief voor streaming0,20 dollar per uur audio
Onafhankelijk getranscribeerde kanalenmaximaal 8
Vakbegrippen per verzoekmaximaal 100

Het model ondersteunt batchverwerking en streaming, tijdstempels per woord met betrouwbaarheidsscore, scheiding van sprekers (diarization) zonder meerprijs en detectie van het einde van een spreekbeurt. Bestaande API-integraties krijgen de nauwkeurigheidswinst zonder codewijzigingen. Grok Voice Transcribe 2.0 wordt binnenkort het standaardmodel van de API en versie 1.0 wordt in de komende weken uitgefaseerd: om die te blijven gebruiken, moet grok-voice-transcribe-1.0 worden vastgezet.

🔗 Aankondiging van Grok Voice Transcribe 2.0


Anthropic plaatst beoordelaars van Accenture binnen het bedrijf

18 september — Anthropic kondigt een samenwerking met Accenture aan voor de onafhankelijke evaluatie van frontiermodellen, gepresenteerd als een belangrijke stap in de richting van de toezegging van zijn algemeen directeur om ingebedde beoordelaars (embedded) toe te laten. Het werk wordt uitgevoerd door Faculty, de in AI gespecialiseerde dochteronderneming van Accenture, en omvat modelevaluatie en red-teaming, evaluaties van alignment en tests van beveiligingsmaatregelen.

Het onderscheid met externe beoordelaars wordt expliciet gemaakt: een ingebedde beoordelaar werkt binnen het AI-bedrijf met toegang die vergelijkbaar is met die van een werknemer. Die kan modellen tijdens de training observeren, de beslissingen volgen die hun ontwikkeling en implementatie bepalen, rechtstreeks met werknemers spreken, controleren of veiligheidsbeloften worden nagekomen, incidenten melden en een beter geïnformeerde beschrijving van de voordelen en risico’s publiceren. Anthropic benadrukt dat deze opzet zijn verantwoordelijkheid niet vermindert, maar beter controleerbaar maakt.

De aankondiging is ongewoon openhartig over wat nog niet bestaat. Er is geen norm voor de informatie waartoe een ingebedde beoordelaar toegang zou moeten krijgen, noch voor de manier waarop bevindingen moeten worden gepubliceerd, noch is er een bestaand systeem om onafhankelijke evaluaties te financieren. Anthropic vindt dat deze financiering uiteindelijk uit gezamenlijke of publieke fondsen zou moeten komen; omdat zo’n mechanisme momenteel ontbreekt, financiert het bedrijf het werk van Accenture rechtstreeks — de zichtbaarste beperking van de constructie.

Onderdeel van de samenwerkingAangekondigde waarde
Uitvoerende entiteitFaculty, AI-dochteronderneming van Accenture
InvesteringMinstens 1 miljard dollar per partij, over vijf jaar
Bestreken gebiedEvaluatie, red-teaming, alignment, beveiligingsmaatregelen
ToegangsniveauVergelijkbaar met dat van een werknemer
FinancieringRechtstreeks door Anthropic, bij gebrek aan gezamenlijke fondsen
ExclusiviteitGeen, aan beide zijden

Anthropic geeft daarnaast aan met METR en andere non-profitbeoordelaars te overleggen om onderdelen van ingebedde evaluatie met hun eigen financiering uit te proberen, en kondigt voor de komende weken andere partners aan.

🔗 Aankondiging van Anthropic over ingebedde evaluatie


Antigravity: drie versies in twee dagen rond aangepaste agents

Google heeft kort na elkaar twee versies van zijn CLI en één versie van de Antigravity-app uitgebracht. Alle drie behandelen hetzelfde onderwerp vanuit drie invalshoeken: wat een aangepaste agent weet, wat hij kan weigeren en hoelang hij zonder toezicht kan blijven draaien. Ze bouwen voort op een intensieve reeks die op 11 september begon en waarvan versies 1.2.1 tot en met 1.2.4 hier niet zijn opgenomen.

CLI 1.2.6 opent een sessiegebonden Remote Control en heft de limiet van vijf minuten op

18 september — Acht dagen na 1.2.0, waarin de CLI een permanente systeemservice werd, kiest Google voor een tegengestelde aanpak met een tweede, veel lichtere vorm van Remote Control: een verbinding die tot de sessie beperkt is (session-scoped) en bij het opstarten wordt geopend met de vlag --remote-control of tijdens het gebruik met de opdracht /remote-control. Door /remote-control off te typen of de sessie te sluiten, wordt de tunnel afgebroken en het apparaat uit de lijst verwijderd. Waar 1.2.0 gericht was op een daemon die de sessie overleeft, is 1.2.6 op het tegenovergestelde gericht.

De tweede wijziging betreft de modus zonder interface (headless): de standaardtime-out voor uitvoeringen met -p / --prompt gaat van vijf minuten naar onbeperkt, tenzij --print-timeout expliciet is ingesteld. De derde wijziging structureert de foutrapportage: bij een fout van de agent of API schrijft de CLI een JSON-regel AGY_ERROR: {...} naar de foutuitvoer, met de canonieke status, de HTTP- of gRPC-code, of de fout opnieuw kan worden geprobeerd en een fout-ID, terwijl de afsluitcode van 1 naar 3 gaat. Een orkestratiescript kan zo een tijdelijke netwerkstoring onderscheiden van een definitieve fout zonder vrije tekst te analyseren.

CLI 1.2.5 geeft Markdown-agents eindelijk een overzicht van hun subagents

17 september — Tot nu toe kon een in Markdown gedefinieerde aangepaste agent invoke_subagent in zijn tools declareren zonder ooit te weten welke subagents bestonden: hij had de tool, maar niet het overzicht. De CLI voegt voortaan automatisch de catalogus van beschikbare subagents en de gebruiksinstructies toe aan zijn systeemprompt, waardoor delegeren daadwerkelijk mogelijk wordt.

De woordkeuze in de changelog vraagt om enige voorzichtigheid: het gaat om context die door het product zelf wordt toegevoegd, niet om een beveiligingslek of een correctie daarvan. De tweede verbetering behoudt de expliciete naam van een taak die naar de achtergrond is gestuurd en die eerder verloren ging tussen meldingen en takenlijsten. De vijf correcties pakken het opschonen van ongeldig gemaakte ID’s aan, evenals de afsluitcodes van onderbroken opdrachten en denkkaders die bevroren bleven.

Antigravity 2.15.0 laat aangepaste agents standaardprompts en -tools uitschakelen

18 september — Drie dagen na 2.14.0 brengt de app 7 verbeteringen en 16 correcties uit. De belangrijkste wijziging geeft aangepaste agents controle over hun eigen context: ze kunnen standaardpromptsecties en standaardtools uitschakelen en vervolgens alleen opnieuw invoeren wat ze nodig hebben. Voor een gespecialiseerde agent vermindert dit de opgelegde systeemprompt navenant.

De rest draait om navigatie en persistentie: Page Up, Page Down, Home en End laten door een gesprek bladeren, Escape verlaat het invoerveld en de geselecteerde aangepaste agent wordt na het opnieuw laden onthouden. Twee correcties betreffen de gegevensintegriteit: opgeslagen instellingen en de projectlijst konden worden overschreven wanneer de app zijn statusbestand niet kon lezen, en de toestemmingsinstellingen verzamelden duplicaten waardoor gespreksbestanden steeds groter werden.

🔗 Changelog van Antigravity


GitHub Copilot: een Sentry-canvas, zes verwijderde modellen en statistieken per aanpassing

Drie changelogvermeldingen in twee dagen wijzen op dezelfde zorg: meten wat teams daadwerkelijk met Copilot doen en opruimen wat ze niet meer gebruiken.

Het overzicht van 14 september licht twee nieuwe onderdelen uit

18 september — GitHub publiceert zijn wekelijkse Copilot-overzicht voor de week van 14 september. Het grootste deel van de inhoud herhaalt vermeldingen die al eerder in de changelog verschenen; slechts twee onderdelen waren nog niet afzonderlijk aangekondigd. Het eerste is het Sentry-canvas in de Copilot-app, dat een productiecrashrapport aan een correctie koppelt zonder de app te verlaten: het toont fouten, stacktraces (stack traces) en context, waarna de oorzaak kan worden onderzocht, een correctie kan worden gevalideerd en een pull request kan worden voorbereid. Dit is de eerste integratie van een tool voor foutmonitoring in canvassen, na Jira begin september.

Het tweede is de agentgolf van VS Code 1.138. In het venster Agents kan een agent in een lokale Dev Container worden uitgevoerd, met de tools en afhankelijkheden van het project — gefaseerde uitrol, Docker vereist. Inactieve sessies kunnen automatisch als voltooid worden gemarkeerd zodra al hun pull requests zijn samengevoegd, met optionele verwijdering na een respijtperiode; dit is beschikbaar als preview en moet expliciet worden ingeschakeld. Tot slot kan rechtstreeks vanuit een Agent Host-sessie een pull request worden aangemaakt.

🔗 Wekelijks Copilot-overzicht

Zes modellen verdwijnen op 19 oktober uit alle Copilot-interfaces

18 september — GitHub kondigt aan dat zes modellen op 19 oktober 2026 uit alle Copilot-interfaces worden verwijderd — Copilot Chat, inlinebewerkingen, ask- en agentmodi en codeaanvullingen. Het is de tweede uitfaseringsgolf die in september is aangekondigd.

Verwijderd modelVerwijderingsdatumVoorgesteld alternatief
Gemini 3.7 Flash19/10/2026Gemini 3.8 Flash
GPT-5.519/10/2026GPT-5.6 Sol
GPT-5.419/10/2026GPT-5.6 Sol
GPT-5.4 mini19/10/2026GPT-5.6 Luna
GPT-5 mini19/10/2026GPT-5.6 Luna
Grok 4.519/10/2026Grok 4.6

Wanneer modellen standaard worden ingeschakeld, worden de alternatieven automatisch geactiveerd voor Copilot Enterprise- en Business-klanten, tenzij een beheerder de algemene standaardwaarde heeft uitgeschakeld of het betreffende model expliciet heeft geblokkeerd; in dat geval kan toegang opnieuw worden verleend via het modelbeleid in de instellingen. Er is geen actie nodig om de modellen te verwijderen.

🔗 Aankondiging van de uitfasering van Copilot-modellen

De statistieken-API telt skills, agents, MCP-servers en CLI-plugins

17 september — De API voor Copilot-gebruiksstatistieken omvat voortaan vijf categorieën agentische CLI-aanpassingen: skills, aangepaste agents, MCP-servers, slash commands en plugins. De tabellen totals_by_skill, totals_by_custom_agent, totals_by_mcp, totals_by_slash_cmd en totals_by_plugin vermelden de vijf actiefste elementen met hun interaction_count, terwijl de velden distinct_*_use_count de verscheidenheid aan gebruikte elementen buiten deze top vijf tellen.

Twee nuances voorkomen misverstanden. Voor MCP-servers loopt de teller alleen op wanneer de CLI verbinding probeert te maken of opnieuw probeert te verbinden — ongeacht of dat lukt of mislukt — en niet bij elke toolaanroep via een bestaande verbinding. Pluginstatistieken tellen alleen aanroepen van skills die aan een plugin zijn gekoppeld: ze vormen een deelverzameling van de totale skillcijfers en mogen daar niet bij worden opgeteld. Om privacyredenen worden alleen door GitHub verstrekte namen weergegeven; door klanten gedefinieerde namen worden gegroepeerd onder other.

🔗 Agentische CLI-aanpassingen in de statistieken-API


Codeagents in de terminal: MiniMax maakt de zijne open source, Mistral stabiliseert zijn harness

Twee aankondigingen van twee niet-verwante partijen, op dezelfde dag en in dezelfde markt: de codeagent die in een terminal werkt, wordt gemeengoed en het onderscheid verschuift naar de licentie en de stabiliteit van het harness.

MiniMax publiceert de broncode van MiniMax Code CLI onder de MIT-licentie

18 september — MiniMax maakt versie 0.4.12 van de broncode van zijn codeagent voor de terminal openbaar. De tool wordt geïnstalleerd onder de naam mcode en biedt drie toegangspunten: een interactieve terminalinterface, een modus zonder interface (mcode exec) voor shellscripts, continue integratie en evaluaties, en een ACP-modus voor editors die compatibel zijn met het Agent Client Protocol. De tool leest projectbestanden, inspecteert verschillen en voert shellopdrachten en tests uit, binnen een systeem van toestemmingen en sandboxing.

De modelkeuze blijft open: enerzijds een MiniMax-account met het bijbehorende Token Plan, anderzijds een externe aanbieder zolang die een API-indeling aanbiedt die compatibel is met OpenAI of Anthropic. Daarnaast zijn er een geïntegreerde zoekfunctie, multimodale tools, het MCP-protocol, subagents en een pluginsysteem. De oorspronkelijke code wordt standaard onder de MIT-licentie gepubliceerd. De repository omvat de TUI, de CLI zonder interface en de ACP-modus, maar niet de desktop-app, hoewel problemen met die app er wel worden bijgehouden; codebijdragen worden voorlopig alleen geaccepteerd van medewerkers aan de repository.

🔗 Aankondiging van MiniMax op X

De Unified Harness van Vibe CLI is niet langer experimenteel

18 september — Mistral brengt Vibe CLI 2.25.5 uit, zes dagen na 2.25.4. De structurele wijziging staat in één regel van de releaseopmerkingen: de Unified Harness heeft niet langer het label ‘experimental’ en --legacy-harness dient voortaan als de gedocumenteerde uitwijkmogelijkheid naar het oude Python-harness. Na een reeks correctieve versies rond de beveiliging van goedkeuringen voor shellopdrachten wordt het nieuwe harness de bewust gekozen standaard — dat is het nieuws, niet het versienummer.

De omschakeling gaat gepaard met het inhalen van ontbrekende functionaliteit: de Unified Harness voegt nu de huidige Git-branch, de status van de repository en recente commits toe aan de systeeminstructies, hooks worden eindelijk binnen subagents uitgevoerd in plaats van stilzwijgend genegeerd en providers die zonder omgevingsvariabele voor een API-sleutel zijn geconfigureerd — lokale of zelfgehoste servers — werken weer. De aanscherping van toestemmingen gaat door: goedkeuringen voor shellopdrachten worden niet langer uitgebreid naar een ander programma of een andere omgeving, aanroepen van MCP-tools respecteren voortaan het toestemmingssysteem in plaats van het te omzeilen en smart approve omzeilt de regels van de gebruiker niet langer.

🔗 Releaseopmerkingen voor Vibe CLI 2.25.5


ChatGPT-plugins ondersteunen meerdere accounts tegelijk

18 september — Ondersteuning voor meerdere accounts komt beschikbaar voor de meeste ChatGPT-plugins. Het wordt mogelijk om een persoonlijk account, een zakelijk account en accounts voor nevenprojecten te koppelen en vervolgens de context van elk account in hetzelfde gesprek te gebruiken. Accounts worden gekoppeld vanuit de plugindirectory op chatgpt.com/plugins.

De aankondiging van het OpenAI Developers-account herhaalt een bericht van Max Stoiber dat een uur eerder werd gepubliceerd. Pluginontwikkelaars hoeven niets te doen: de functie wordt automatisch geactiveerd, zonder wijzigingen. Wie verder wil gaan, kan een tool profile aan de eigen MCP-server toevoegen, zodat ChatGPT weet hoe het gekoppelde accounts moet labelen — dat is de enige concrete actie die van hen wordt verwacht. De aankondiging, die om 18.10 uur Parijse tijd is gepubliceerd, gaat niet vergezeld van een blogbericht of changelogvermelding.

De beoogde toepassing is die van een ontwikkelaar die identiteiten per werkgever of project gescheiden houdt en tot nu toe van verbinding moest wisselen om van context te veranderen.

🔗 Aankondiging van meerdere accounts op X

🔗 Het oorspronkelijke bericht van Max Stoiber


Genspark voegt een wekelijks creditsaldo toe aan Plus- en Pro-abonnementen

18 september — Genspark wijzigt de voordelen van zijn Plus- en Pro-abonnementen door een wekelijks creditsaldo toe te voegen, zonder de abonnementsprijzen te veranderen. Dit saldo wordt elke week boven op het bestaande abonnement toegekend en dekt het gebruik in Standard-modus voor alle agents en tools van het platform: Super Agent, AI Chat, AI Image, AI Slides, AI Sheets, AI Docs en Deep Research.

Een tweede bericht in dezelfde thread beschrijft hoe dit werkt voor AI Chat en AI Image. Voor bestaande abonnees komt het saldo boven op wat ze al hebben en tot en met 31 december 2026 kunnen alle modellen van AI Chat en AI Image zonder creditkosten worden gebruikt, inclusief topmodellen zoals Opus; voor mensen die zich vanaf 18 september abonneren, zijn de basismodellen (core models) van AI Chat en AI Image gratis. Genspark verduidelijkt dat deze wijzigingen niet gelden voor Team- of Enterprise-abonnementen en verwijst voor de volledige voorwaarden naar zijn helpcentrum.

🔗 Aankondiging van Genspark op X


Google Research: wat AlphaGenome Atlas heeft opgeleverd, en simulaties die zichzelf testen

Twee onderzoekspublicaties op dezelfde dag, met één gemeenschappelijk punt: in beide gevallen wordt niet het model getoond, maar wat derden ermee hebben bereikt of wat de validatielus in plaats daarvan controleert.

AlphaGenome Atlas levert de eerste resultaten van zijn partners

17 september — Negen dagen na de publicatie van AlphaGenome Atlas, de voorspellende kaart van de 9 miljard mogelijke substituties in menselijk DNA, licht Google DeepMind een thread uit waarin drie samenwerkingen worden beschreven.

Wetenschappelijke partnerGerapporteerd resultaat
Stowers InstituteMeer dan 2.500 regulerende motieven in kaart gebracht
Universiteit van Exeter / UK BiobankMeer dan 54.000 deelnemers geanalyseerd, ruim 22% meer detectie van zeldzame genetische signalen
Broad InstituteKritieke mutatie in het DNM1-gen geïdentificeerd en vervolgens in het laboratorium bevestigd en gevalideerd

Regulerende motieven zijn DNA-sequenties die als schakelaars en dimmers voor genactiviteit werken. Het onderzoek in Exeter identificeerde ook nieuwe varianten die de hoeveelheid PLA2G7 beïnvloeden, een eiwit dat verband houdt met metabole gezondheid. De casus van het Broad Institute is de concreetste van de drie: bij een enorme lijst van mogelijke mutaties voor onverklaarde zeldzame ziekten helpt Atlas de juiste aan te wijzen, waarna laboratoriumonderzoek die bevestigt. Dit alles staat echter alleen in een thread op X, zonder uitgebreid blogbericht of bijbehorende publicatie.

🔗 AlphaGenome Atlas-thread op X

Gegenereerde onderwijssimulaties, vervolgens door een agent getest in Chrome

17 september — Gal Elidan en Yael Haramaty publiceren een experiment waarin generatieve interfaces (generative UI) worden toegepast op het maken van onderwijssimulaties. De docent houdt het initiatief: die stelt het onderwerp voor, waarna Google een reeks aanpasbare leerdoelen genereert die ter goedkeuring worden voorgelegd en als basis voor de generatie dienen. Elke interactieve toepassing is opgedeeld in niveaus met een oplopende moeilijkheidsgraad, met een gereedschapskist, stapsgewijze aanwijzingen en gedetailleerde oplossingen.

Het interessantste element is de zelfcorrectielus. De generatie wordt getoetst aan pedagogische, mechanische en presentatiecriteria, en sommige evaluaties worden door agents uitgevoerd: de oplosbaarheidstest opent een instantie van Chrome en bedient de simulatie zoals een gebruiker dat zou doen, waarbij ook adversariële acties worden geprobeerd, zoals schuifregelaars naar hun uiterste waarden duwen. De lus wordt herhaald totdat aan alle criteria is voldaan, ten koste van een langere generatietijd. Google publiceert meer dan 30 interactieve STEM-toepassingen in het Engels; een verzameling van 40 toepassingen is beoordeeld door Britse docenten, en een onderzoek onder 12 Amerikaanse docenten levert een gemiddelde score van 8 op 10 op.

🔗 Google Research-blogbericht over interactieve onderwijstoepassingen


Claude versnelt meer dan 30 biologiemodellen en financiert een eiwitwedstrijd

17 september — Anthropic publiceert een blogbericht waarin wordt beschreven hoe Claude in iets minder dan vier weken de inferentie heeft geoptimaliseerd van meer dan 30 open-source modellen die door biologen worden gebruikt — voor structuurvoorspelling, eiwitontwerp en eiwit- en genomische taalmodellen — met een gemiddelde versnelling van ongeveer 4x. Alle code wordt als open source gepubliceerd.

De technische kern draait om triangular attention en triangular multiplication, die zowel qua tijd als geheugen kubisch schalen. Claude ontwikkelde FlashPairformer, een reeks kernels die bij attention 2,7 tot 2,9x beter presteert dan de standaard in het vakgebied. Met een geheugenbesparende modus genaamd ‘Big’ kunnen systemen van meer dan 10.000 tokens nauwkeurig worden gevouwen op één GPU-node, terwijl het door AlphaFold3 voorspelde 40S-ribosoom 7.663 tokens telde. De werkwijze is minstens zo belangrijk: het werk werd begeleid door twee technische medewerkers zonder eerdere ervaring met inferentieoptimalisatie.

Tot slot sponsort Anthropic samen met Adaptyv Bio een eiwitontwerpwedstrijd rond vijf moeilijke problemen, met meer dan 5.000 experimenteel gevalideerde ontwerpen uit de community, tot 1 miljoen dollar aan Claude-tegoeden en 250.000 dollar aan rekenkracht van Modal.

🔗 Onderzoeksblogbericht van Anthropic


Open modellen en onderzoekslaboratoria: Muse komt naar Mac, Sakana onthult zijn frontiergroep

Meta brengt zijn Muse-agent naar macOS

18 september — Meta brengt Muse uit op Mac, aangekondigd in de nacht van 17 op 18 september. Het account @AIatMeta deelt een bericht over een persoonlijke agent die rechtstreeks op de computer van de gebruiker kan handelen, telkens met diens uitdrukkelijke toestemming. Er worden drie toepassingen genoemd: de downloadmap opruimen, een verloren bestand terugvinden en berichten en notities samenvatten.

De aankondiging bouwt voort op de lancering van Muse op 8 september, een agent aangedreven door Muse Spark 1.3 die tot nu toe beschikbaar was op iOS, Android, het web en WhatsApp. De overstap naar Mac betekent een nieuwe stap voor dit type product: de agent werkt niet langer in zijn eigen sandbox, maar met de persoonlijke bestanden van de gebruiker. Meta deelt geen prijs, beschikbare landen of systeemvereisten, en de beschikbaarstelling gaat niet gepaard met specifieke beveiligingsdocumentatie voor Mac — op de blog ai.meta.com is sinds 27 juli niets gepubliceerd.

🔗 Aankondiging van Meta op X

Sakana AI onthult de Frontier Intelligence Group en zijn visie op het paradigma

18 september — Sakana AI maakt het bestaan bekend van de Frontier Intelligence Group (FIG), een intern collectief dat sinds de begindagen van het bedrijf groeide. Het uitgangspunt is een vraag van Llion Jones, technisch directeur van Sakana AI en een van de uitvinders van de Transformer: volstaat het om de Transformer-architectuur met steeds meer data en rekenkracht op te schalen om AGI te bereiken? Het antwoord van het laboratorium is nee.

Daarin schuilt het nieuws, meer nog dan in de bijbehorende catalogus van onderzoeken. Het blogbericht somt de tekortkomingen op die het huidige paradigma niet heeft opgelost — modellen die vol overtuiging onjuiste informatie produceren, bezwijken in werkelijk nieuwe situaties en veel energie verbruiken — en plaatst daar biologische intelligentie tegenover, die voortdurend leert en op basis van veel minder data generaliseert. De groep hanteert vijf principes, waaronder de vrijheid om te falen zonder druk om hoge benchmarkscores te behalen. Een van de gepresenteerde onderzoeken, naar sparse Transformers in samenwerking met NVIDIA, vertrekt vanuit een gemeten vaststelling — meer dan 95% van de neuronen in een feed-forward-laag blijft stil tijdens het verwerken van een woord — en heeft geleid tot een dataformaat genaamd TwELL, dat is geaccepteerd voor ICML 2026.

🔗 Blogbericht van Sakana AI over de Frontier Intelligence Group


Generatieve video: Runway maakt zijn tegoeden uitwisselbaar, Pika brengt zijn eerste applicatie uit

Runway maakt zijn tegoeden uitwisselbaar tussen de webapplicatie en Runway Dev

18 september — Runway heft de scheiding tussen zijn twee producten op: gekochte tegoeden kunnen voortaan zowel in de webapplicatie als in Runway Dev, het aanbod voor ontwikkelaars, worden gebruikt. Tot nu toe werkten beide omgevingen met afzonderlijke tegoeden en contracten, zonder één centrale plek om het verbruik tussen projecten te volgen.

De wijziging omvat vier punten: één centraal aangeschafte tegoedenreserve op één factuur, een naadloze route tussen het bouwen van een workflow in de webapplicatie en het beschikbaar stellen daarvan via een API, uitgebreidere ondersteuning voor Runway Dev met toegang tot Applied AI Architects, en een vernieuwd overzicht voor workspace-analyse waarmee beheerders tegoeden tussen web- en Dev-workspaces kunnen overdragen. Tot en met 31 december 2026 gelden twee commerciële aanbiedingen: nieuwe bedrijven ontvangen bij ondertekening 10% extra tegoed, volgens de door Runway aangekondigde omrekening goed voor minimaal 130 minuten video of 12.000 afbeeldingen; bestaande klanten ontvangen 5.000 tegoeden en één dag ondersteuning door een Applied AI Architect in ruil voor een introductie bij de productmanager voor AI-applicaties.

🔗 Runway-blogbericht over uniforme prijzen

Pika lanceert Product Ad, van productfoto tot videoreclame

18 september — Een dag na de onthulling van zijn nieuwe creatieve platform brengt Pika de eerste applicatie ervoor uit: Product Ad. De applicatie neemt een of meer productafbeeldingen, combineert die met een geschreven briefing en maakt er een video van die als marktklaar wordt gepresenteerd.

GeneratieparameterVoorgestelde waarde
Beschikbare duur6 s, 15 s, 30 s, 60 s, 2 min
Uitvoerformaat16:9
Verwachte invoerproductafbeeldingen en geschreven briefing
Toegangaccount aanmaken vereist

Pika publiceert de aankondiging onder verwijzing naar zijn eigen bericht van de dag ervoor over de vernieuwing van het platform, waarmee Product Ad wordt gepositioneerd als onderdeel van een verwachte reeks applicaties en niet als een op zichzelf staande functie. Er wordt geen model genoemd en geen prijs bekendgemaakt.

🔗 Aankondiging van Pika op X


NVIDIA publiceert AIPerf, de opvolger van GenAI-Perf voor het meten van inferentie op grote schaal

18 september — NVIDIA presenteert AIPerf, zijn tool voor het meten van de prestaties van generatieve inferentie, aangeduid als de opvolger van GenAI-Perf en volledig vanaf nul herschreven. Het uitgangspunt is bekend: zodra een model is uitgerold, wordt de vraag ‘is het snel?’ vaak beantwoord met curl-commando’s of een geïmproviseerde loadgenerator, die cijfers opleveren waarop niet kan worden vertrouwd.

De breuk is architectonisch. Waar de meeste tools in één proces draaien en bij toenemende gelijktijdigheid tegen de global interpreter lock van Python aanlopen, verdeelt AIPerf het werk: workerprocessen genereren de belasting, afzonderlijke services verwerken de resultaten en het geheel wordt via ZMQ gecoördineerd. Het doel is expliciet: de meetclient mag zelf nooit de bottleneck worden.

Gerapporteerde indicatorWat deze meet
Time to First TokenTijd tussen het versturen van de aanvraag en de eerste token
Inter-Token LatencyTijd tussen twee opeenvolgende tokens tijdens de generatie
AanvraaglatentieEnd-to-endtijd van het volledige antwoord
UitvoertokendoorvoerTokens die per seconde over alle aanvragen worden geproduceerd
Gerapporteerde percentielenp25, p50, p75, p90, p95, p99
Typen endpointsmeer dan 15

De tool kan ook traces van werkelijk verkeer opnieuw afspelen in de formaten Mooncake, Baseten en WEKA. Het artikel benadrukt vooral het nut van distributies: een server waarvan de gemiddelde Time to First Token gezond lijkt maar waarvan de p99 sterk oploopt, blijft in geaggregeerde cijfers onopgemerkt en faalt in productie.

🔗 NVIDIA-blogbericht over AIPerf


Mistral ontkent een claim over ongeautoriseerde toegang tot zijn systemen

18 september — Mistral publiceert om 05.48 uur UTC een korte verklaring op zijn X-account als reactie op een claim over ongeautoriseerde toegang tot zijn systemen. Het bedrijf zegt een grondig onderzoek te hebben uitgevoerd, geen bewijs te hebben gevonden dat de claim ondersteunt en bevestigt dat zijn systemen niet zijn gecompromitteerd.

We are aware of a claim alleging unauthorized access to our systems. Following a thorough investigation, we have found no evidence to support this claim and can confirm that our systems have not been compromised.

🇳🇱 We zijn op de hoogte van een bewering dat ongeautoriseerde toegang tot onze systemen heeft plaatsgevonden. Na een grondig onderzoek hebben we geen bewijs gevonden dat deze bewering ondersteunt en kunnen we bevestigen dat onze systemen niet zijn gecompromitteerd.@MistralAI op X

Het bericht noemt de indiener van de claim niet, vermeldt noch de datum noch de aard ervan en geeft geen details over de reikwijdte van het onderzoek. Hier wordt uitsluitend het standpunt van Mistral weergegeven: de oorspronkelijke bewering kon niet worden geraadpleegd. De verklaring is in de betreffende periode het meest bekeken bericht van het account, en op de website van het bedrijf is geen aanvullende publicatie gevonden.


Korte berichten

  • Balyasny Asset Management vertelt hoe het Claude Fable 5 aanstuurt — het bedrijf, dat ongeveer 38 miljard dollar beheert, verkort de eerste analyse van een fusiearbitrage van drie tot vijf dagen tot minder dan één dag, met een agent die ongeveer 30 minuten draait en een menselijke beoordeling. 🔗 bron
  • Codex CLI 0.155.1 schakelt redeneersamenvattingen standaard weer uit — één correctie, een dag na 0.155.0: door ze standaard in te schakelen werden verzoeken afgewezen door providers die ze niet ondersteunen. 🔗 bron
  • Gemini CLI hervat zijn nightly-reeks na een dag zonder release — vier wijzigingen op 18 september, waaronder het behouden van het OAuth-refresh token bij een vernieuwing en het idempotent maken van het verwijderen van identificatiegegevens; de stable- en preview-kanalen blijven ongewijzigd. 🔗 bron
  • Kimi Code 2.0.1 versnelt het opstarten en hervatten van sessies — bugfixrelease 32 uur na 2.0.0: compactere sessie-index, sneller hervatten bij lange geschiedenissen, API-sleutel leesbaar uit een benoemde omgevingsvariabele en begrensde bestandsobservatoren. 🔗 bron
  • Qwen Code gaat naar previewversie v0.24.1 met een Playwright-browser-SDK — dit is geen stabiele versie; ze introduceert geïntegreerde browserbesturing met een Chrome-relay voor native messaging en de uitvoering van subagents in containers. 🔗 bron
  • Zed brengt stabiele versie 1.20.2 uit, met slechts twee correcties — bij betalingsfouten van externe modelproviders verschijnt niet langer een uitnodiging om over te stappen op Zed Pro in plaats van het oorspronkelijke bericht, en twee snippet-extensies voor dezelfde taal heffen elkaar niet langer op. 🔗 bron
  • Replit beweert dat Free Mode ‘30 keer’ ruimhartiger is, zonder gepubliceerde referentie — slechts één tweet, zonder link of changelog, die niet verduidelijkt waarmee deze factor wordt vergeleken: te beschouwen als een bewering van Replit, niet als een meting. 🔗 bron
  • Het Copilot-impactdashboard splitst betrokkenheid uit per functie — zeven oppervlakken over 28 dagen, met onderscheid tussen actieve en passieve code review, en een populatie in de adoptiefase die voortaan met een voortschrijdend venster wordt berekend. 🔗 bron
  • GitHub plant een introductielivestream over de Copilot SDK, in zes talen — sessies, tools, MCP-servers en streaming events, met speciale sessies voor .NET en Java, zonder vereisten vooraf. 🔗 bron
  • Runway Ruby behoudt het alfakanaal bij conversie naar HDR — de conversie van bronmateriaal naar HDR houdt de transparantie intact, in één stap; prijs en abonnementsniveau zijn niet gespecificeerd. 🔗 bron
  • MiniMax sluit zich aan bij Singtel AI Pass voor het Singaporese SkillsFuture-programma — MiniMax H3, MiniMax Agent en MiniMax Audio worden aan het aanbod toegevoegd, dat is bedoeld voor in aanmerking komende cursisten van meer dan 200 door de SWDA ondersteunde AI-cursussen; geen bedrag of tijdschema. 🔗 bron
  • VC-Attention versnelt de attention van MiniMax-H3 zonder hertraining — MiniMax deelt het werk van Nunchux AI over attention met lage precisie die op het bestaande model kan worden toegepast; Nunchux AI meldt een versnelling van 1,6x op B200 en 1,5x op B300 ten opzichte van FlashAttention-4. 🔗 bron
  • Wan3.0 eindigt als tweede in de videocategorie van de OpenArt Arena — Alibaba benadrukt shots van 30 seconden, native audio en ondersteuning voor elke referentie; positionering in een ranglijst van derden, zonder productvernieuwing. 🔗 bron
  • Synthesia opent zijn Amerikaanse hoofdkantoor in New York — bedrijfsnieuws zonder product, personeelsaantal of investeringsschema, twee dagen na de algemene beschikbaarheid van zijn Interactive Avatar API. 🔗 bron
  • Grok Imagine specificeert de kosten van een volledig met AI gemaakte pilotaflevering — de studio van PJaccetturo meldt negen werkdagen, 3.627 gegenereerde afbeeldingen en 3.043 gegenereerde video’s voor 2.677 dollar aan generatiekosten voor zijn pilotaflevering van de Odyssée-wedstrijd. 🔗 bron
  • BananaMind 2 Pro benadert SmolLM2 met twintig keer minder tokens — een model met 139 miljoen parameters, getraind op 100 miljard tokens en een RTX 5070 Ti, behaalt 42,78% op HellaSwag tegenover 43,22 voor SmolLM2-135M, dat op 2 biljoen tokens is getraind. 🔗 bron
  • Optimum-Intel v2.2.0 en OpenVINO GenAI 2026.4.0 breiden export naar Intel-hardware uit — Hugging Face en Intel brengen gezamenlijke versies uit voor Intel-processors, grafische kaarten en NPU’s, waarbij Mistral 3 nu kan worden geëxporteerd. 🔗 bron
  • AmberTrace Labs meet de betrouwbaarheid van de redenering van Olmo 3 onder RL met verifieerbare beloningen — bij probes die buiten de training zijn gehouden, stijgt de betrouwbaarheid van 0,238 naar 0,262: een positieve verschuiving en geen erosie, met gepubliceerde checkpoints. 🔗 bron
  • Together AI claimt de beste tijd tot de eerste token op DeepSeek V4.1 Flash — het bedrijf deelt de meting van een derde voor voorverwarmde verzoeken, zonder methode of waarde te publiceren: een bewering, geen verifieerbaar resultaat. 🔗 bron
  • Google Flow begeleidt twee ontwerpers tijdens de New York Fashion Week — tools op maat, ontworpen met Jane Wade en Sergio Hudson; een gebruiksdemonstratie, zonder nieuw model of uitgerolde functie. 🔗 bron
  • De Google AI Educator Series levert studiepunten op — de opleidingscursussen geven voortaan recht op universitaire studiepunten of punten voor permanente educatie. 🔗 bron

Wat dit betekent

Deze dag zegt vooral één ding: codeagents zijn niet langer gesloten producten en beginnen hun formaten te delen. Claude Code leest AGENTS.md wanneer een project geen CLAUDE.md heeft — dat wil zeggen dat Anthropic een elders gedefinieerd instructiebestand accepteert, zodat dezelfde repository voor meerdere tools kan dienen. Diezelfde dag voegt Antigravity de catalogus met beschikbare subagents toe aan de systeemprompt van zijn Markdown-agents, laat Vibe CLI hooks eindelijk binnen subagents uitvoeren, splitst Codex de kosten per subagent uit en plaatst Qwen Code zijn subagents in containers. Delegatie tussen agents was een configuratiebelofte; het wordt een mechanisme dat moet worden gedocumenteerd, geïsoleerd en gefactureerd. Claude Code trekt die logica van wantrouwen bovendien volledig door door resultaten van subagents van een speciale header te voorzien, zodat teruggestuurde tekst zich niet als instructie kan voordoen.

De markt voor terminalagents wordt intussen zichtbaar gemeengoed. MiniMax brengt zijn agent uit onder een MIT-licentie, met TUI, headless mode, ACP en vrije modelkeuze; Mistral verwijdert het label ‘experimenteel’ van zijn Unified Harness en documenteert --legacy-harness als uitweg; Kimi Code brengt 32 uur na zijn grote release een prestatiecorrectie uit. Wanneer vier leveranciers hetzelfde object met dezelfde toegangspunten aanbieden, verschuift de differentiatie: die zit dan in de licentie, de stabiliteit van de harness en het permissieregime — en precies daarop zijn de wijzigingen van vandaag bij zowel Mistral als Anthropic gericht.

Bij de modellen is de beweging dat audio en video eerder agentisch dan beschrijvend worden. Qwen3.8-Omni-Flash probeert een video niet langer te beschrijven, maar er een antwoord in te vinden: vanuit de vraag wint het 4,4 punten op OmniVideoBench terwijl het 45,7% minder tokens verbruikt — prestaties en besparing bewegen in dezelfde richting, wat zeldzaam is. Daartegenover kiest Grok Voice Transcribe 2.0 niet voor een laboratoriumdemonstratie, maar voor echt verkeer, met een foutpercentage op korte zinnen dat daalt van 20,6% naar 6,8% en een ongewijzigde prijs. De twee aankondigingen komen op hetzelfde neer: de waarde komt niet langer van de ondersteunde modaliteit, maar van wat het model besluit te verwerken.

Dan blijft de vraag wat laboratoria bereid zijn te laten verifiëren. Anthropic betaalt Accenture om beoordelaars binnen zijn eigen bedrijf te installeren, met toegang als medewerker — en erkent in dezelfde aankondiging dat er geen norm bestaat voor waartoe zo’n beoordelaar toegang zou moeten krijgen, hoe diens bevindingen moeten worden gepubliceerd of wie de beoordeling zou moeten financieren. Het is evenzeer een bekentenis als een voorziening. Daarnaast zijn de sterkste bewijzen van vandaag de resultaten die een derde kan reproduceren: de resultaten van Exeter en het Stowers Institute met AlphaGenome Atlas, de als open source gepubliceerde code voor biomoleculaire optimalisatie en de checkpoints van AmberTrace Labs. Het omgekeerde is net zo duidelijk zichtbaar: Replit noemt een factor 30 zonder referentie, Together AI deelt een ranglijst zonder methode, Mistral ontkent een beschuldiging die niemand heeft kunnen lezen. AIPerf komt in dit landschap precies op tijd — een meetinstrument dat begint met toe te geven dat degene die meet vaak het probleem is.


Bronnen