Zoeken

GitHub komt terug op de storing van 17 augustus, Meta AI lanceert WildArtifactBench, Pika onthult zijn audiomodellen

Artikel gegenereerd door kunstmatige intelligentie
GitHub komt terug op de storing van 17 augustus, Meta AI lanceert WildArtifactBench, Pika onthult zijn audiomodellen

ai-powered-markdown-translator

Artikel vertaald van fr naar nl met gpt-5.4-mini.

Bekijk project op GitHub ↗

Op 20 augustus 2026 publiceert de CTO van GitHub een gedetailleerd verslag van de storing van 17 augustus (7u47, tweede grote incident van de maand) en versnelt de migratie naar Azure. Meta AI presenteert WildArtifactBench, een nieuw evaluatiekader voor multimodale agents, naast uitgebreide demonstraties van Muse Spark 1.2. Pika Labs licht zijn volledige reeks audiomodellen toe (Music, SFX, Soundtrack) met cijfermatige benchmarks tegenover Suno, ElevenLabs en Stable Audio. Rond deze drie aankondigingen maakt Anthropic Claude Academy en beheerde agents krachtiger, lanceert Mistral een nieuwe laag voor documentonderzoek, en behandelen een vijftiental andere nieuwigheden ontwikkeling, open modellen en mediageneratie.


GitHub licht de storing van 7u47 van 17 augustus toe en versnelt zijn betrouwbaarheidsplan

20 augustus — Vladimir Fedorov, CTO van GitHub, publiceert een verslag van de storing van 17 augustus 2026, die 7 uur en 47 minuten duurde en github.com, authenticatie, GitHub Actions, de API’s, pull requests, issues en Copilot verstoorde. Het is het tweede significante incident van de maand, na een storing in Actions op 6 augustus. Geen van beide werd veroorzaakt door een code- of configuratiewijziging: het ging om capaciteitsstoringen.

Het incident begon toen een ongekende verkeerspiek de capaciteit van een kritisch infrastructuuronderdeel in het datacenter Central US van GitHub overschreed. De druk verspreidde zich door de systemen en veroorzaakte authenticatiefouten. De meeste diensten herstelden zich diezelfde dag, maar sommige Copilot-diensten deden er langer over: fouten daar veroorzaakten een lus van nieuwe pogingen aan clientzijde, waardoor het verkeer tijdens het herstel toenam.

Fedorov koppelt het incident aan de groei van het platform: sinds april zijn de maandelijkse commits gestegen van 1,4 naar 2,9 miljard. Sinds maart en april heeft GitHub meer dan 3 miljoen CPU-kernen en 120 petabyte opslag toegevoegd, terwijl het zijn migratie naar Azure versnelt: die bedient nu 58% van de belasting, tegenover 12% in mei. Als onmiddellijke correctie voert GitHub consistente limieten voor herpogingen tussen diensten in.

On August 17, GitHub experienced a significant outage that disrupted developers and organizations around the world. If you were trying to ship software that day, we let you down.

🇳🇱 Op 17 augustus kreeg GitHub te maken met een grote storing die ontwikkelaars en organisaties overal ter wereld trof. Als je die dag software probeerde te leveren, hebben we je in de steek gelaten.@Vlad_GitHub op X

🔗 De storing van 17 augustus, en het werk dat voor ons ligt (github.blog)


Meta AI onthult WildArtifactBench en breidt de demonstraties van Muse Spark 1.2 uit

20 augustus — In een thread van tien tweets presenteert Meta AI gelijktijdig een uitgebreide demonstratie van de multimodale mogelijkheden van Muse Spark 1.2 en de lancering van WildArtifactBench, een nieuw intern evaluatiekader voor multimodale agents. Het model wordt getoond terwijl het multimodale observaties analyseert en tools aanroept om een tweearmige robot te helpen een plastic eend terug te vinden, en vervolgens een bureau op te ruimen — met een voorbeeld van het onderscheid tussen een haarborstel en een make-upkwast om een lippenstift netjes op te bergen.

Twee concrete mogelijkheden worden uitgelicht: het genereren van digitale artefacten (webpagina’s, games) op basis van afbeeldingen, geëvalueerd op de werkelijke rendering in plaats van op een codevergelijking; en het interne gebruik van Muse Spark voor mediageneratie, in tandem met Muse Image en Muse Video.

De thread culmineert met WildArtifactBench: in plaats van strikte correctierasters op basis van een ground truth gebruikt het kader winrates en Elo-scores afkomstig van menselijke en agentische voorkeurbeoordelaars, om praktische multimodale workflows te dekken. Meta publiceert vandaag meteen 10 taken uit de benchmark en een document met ontwerpprincipes.

Today we’re also previewing WildArtifactBench, an internal evaluation framework designed to assess agents on complex, real-world tasks across diverse deliverable formats. By using win rates and Elo scores from human and agentic preference judges rather than strict ground-truth rubrics, it expands task coverage across practical multimodal workflows.

🇳🇱 Vandaag presenteren we ook WildArtifactBench, een intern evaluatiekader dat is ontworpen om agents te beoordelen op complexe echte taken, via uiteenlopende outputformaten. Door winrates en Elo-scores van menselijke en agentische voorkeurbeoordelaars te gebruiken in plaats van strikte correctierasters op basis van een ground truth, breidt het de taakdekking uit naar praktische multimodale workflows.@AIatMeta op X

🔗 Volledige thread @AIatMeta


Pika licht zijn Pika Audio Models-reeks toe tegenover Suno, ElevenLabs en Stable Audio

18-20 augustus — Na op 14 augustus zijn reeks « Pika Audio Models » te hebben aangekondigd, licht Pika Labs deze week drie producten toe, elk met cijfers.

Pika Music (20 augustus) accepteert vier invoermodaliteiten — tekst, songtekst, stemreferentie, muziekreferentie — die combineerbaar zijn in één latente diffusiedecoder. Het behaalt een score dicht bij de marktleider op Audiobox Aesthetics, en genereert een nummer van 90 seconden in gemiddeld 6,25 seconden, oftewel ongeveer 14,5 keer sneller dan de afspeelduur. Pika SFX (19 augustus) genereert geluidseffecten in minder dan een seconde, tot 95% goedkoper dan de concurrentie. Pika Soundtrack (18 augustus) synchroniseert muziek, voice-over en geluidseffecten met het beeld op basis van een in latente tokens gecomprimeerde video, en eindigt bovenaan qua audiovisuele afstemming op een panel van 67 sequenties.

AudiomodelBelangrijke metricPikaConcurrent
Pika MusicAudiobox Aesthetics (productie)8,064Suno : 8,151
Pika MusicSnelheid (nummer van 90s)6,25 s~14,5x de afspeelduur
Pika SFXGemiddelde latency (50 prompts)0,847 sElevenLabs v2 : 2,47 s
Pika SFXGemiddelde latency (50 prompts)0,847 sStable Audio 3 SFX : 2,64 s
Pika SoundtrackSemantische afstemming (ImageBind)0,2457Beste van het panel van 67 sequenties

De drie modellen zijn toegankelijk via de Pika API Club.

On our fixed-lyrics benchmark, Pika Music reached the top tier of Audiobox Aesthetics: Content Enjoyment: 7.403, Production Quality: 8.064. For context, Suno scored 7.412 and 8.151 on those respective measures.

🇳🇱 In onze benchmark met vaste songteksten bereikt Pika Music het hoogste niveau van Audiobox Aesthetics: inhoudsplezier: 7,403, productiekwaliteit: 8,064. Ter vergelijking: Suno behaalde 7,412 en 8,151 op dezelfde metingen.@pika_labs op X

🔗 Pika Music (20 augustus) · Pika Soundtrack (18 augustus) · Pika SFX (19 augustus)


Anthropic maakt Claude Academy, beheerde agents en Claude Code krachtiger

Claude Academy is beschikbaar

20 augustus — Anthropic lanceert Claude Academy, een platform met gratis cursussen en tutorials dat openstaat voor iedereen, ongeacht het niveau: van mensen die AI net ontdekken tot degenen die Claude al dagelijks gebruiken. Het initiatief is bedoeld als een stapsgewijs traject in plaats van louter productdocumentatie, met gelijke toegang voor beginners en gevorderde gebruikers. Een bijbehorende blogpost licht de pedagogische filosofie van Anthropic toe over het leren van AI en de plaats van Claude Academy binnen die aanpak, in een context waarin het bedrijf zijn onderwijsinitiatieven rond Claude uitbreidt, naast zijn productlanceringen.

🔗 Aankondiging @claudeai

Drie updates voor Claude Managed Agents

19 augustus — Anthropic kondigt drie ontwikkelingen aan voor Claude Managed Agents (Claude Developer Platform): geheugen is nu bruikbaar met Self-Hosted Sandboxes, waarbij het werk in een zelf gehoste sandbox kan worden opgeslagen voor volgende sessies; de tools web_search en web_fetch accepteren nu allowed_domains- of blocked_domains-parameters, om precies te beperken welke sites een agent kan raadplegen; en de Console-sessieweergave is opnieuw ontworpen voor multi-agent-sessies, met een minimap per agent op één regel, een streaming transcriptie gegroepeerd per iteratie, en een inspecteur die de kosten in dollars per thread en per sessie weergeeft.

🔗 Aankondiging @ClaudeDevs

Claude Code — nieuwe outputstijl Concise

20 augustus — Claude Code biedt een nieuwe outputstijl « Concise »: zodra deze is geactiveerd, zet Claude het resultaat bovenaan het antwoord en houdt het zijn antwoorden standaard kort, terwijl het de volledige details geeft als de gebruiker er expliciet om vraagt. Activeren gebeurt via /config → Output style, of rechtstreeks in de configuratie met "outputStyle": "Concise" in settings.json. Het is een instelling die in het dagelijks gebruik direct nuttig is voor gebruikers die in de terminal sneller leesbare antwoorden willen, zonder de mogelijkheid te verliezen om op verzoek een specifiek punt dieper uit te werken.

🔗 Aankondiging @ClaudeDevs


Devin van Cognition voegt speciale Slack-kanalen toe voor code

20 augustus — Cognition lanceert « Slack Code in Devin » in het kader van een officiële lanceringspartnerschap met Slack: de agent maakt nu proactief speciale Slack-kanalen aan voor elke codetaak, om het werk gefocust te houden in plaats van de gesprekken te vermengen in bestaande teamkanalen. Cognition geeft aan dat het specifiek de « persoonlijkheid » van Devin heeft herwerkt voor zijn gedrag in Slack, een toonaanpassing die past bij de context van teamchat in plaats van terminal of IDE. De aankondiging verankert Devin in de samenwerkingshulpmiddelen waar product- en niet-technische teams al communiceren, als aanvulling op zijn bestaande integraties (GitHub, Linear).

🔗 Aankondiging @cognition


Open modellen: Liquid AI, Sakana AI en een omvangrijke dataset voor robotica

LFM2.5-DSpark van Liquid AI, tot 3,2x snellere inferentie

20 augustus — Liquid AI publiceert LFM2.5-DSpark, « draft »-modellen met ~300M parameters die door speculatieve decodering de inferentie van de drie modellen uit de LFM2.5-familie versnellen, zonder kwaliteitsverlies — de uitvoersequentie blijft per ontwerp identiek aan de referentie-greedy decoding. Op GPU H100 bedraagt de gemeten gemiddelde versnelling 2,67x voor LFM2.5-2.6B (323 → 864 tok/s), 2,10x voor LFM2.5-1.2B en 2,54x voor LFM2.5-8B-A1B. Voor multi-toolscenario’s daalt de latency van functieaanroepen gemiddeld met 57%. De checkpoints zijn beschikbaar in safetensors en GGUF, met day-one ondersteuning voor llama.cpp en directe integratie in SGLang.

🔗 LFM2.5-DSpark op Hugging Face

Sakana Translate stapt over op de nieuwe generatie van Sakana Namazu

20 augustus — De gratis Japans-Engels-Chinees-vertaalservice van Sakana AI stapt over op de nieuwe generatie Namazu, met een vernieuwd basismodel en verbeterde trainingsmethoden. Op 160 Japans-Engelse vertaaltaken, geëvalueerd met de interne tool TransEvalnia, wordt Sakana Translate in meer dan 50% van de gevallen beter beoordeeld dan elk van de vergeleken concurrerende systemen. De drie bestaande functies (streamingvertaling tot ongeveer 5.000 tekens, correctie met stijldiff, vraag-en-antwoord over de vertaling) blijven gratis en draaien voortaan op het nieuwe model.

🔗 Aankondiging Sakana Translate

HiPHI, een omvangrijke open dataset van menselijke bewegingen voor robotica

19 augustus — Noitom Robotics publiceert HiPHI gratis voor onderzoek, 617,5 uur aan zeer nauwkeurige motion-captures van menselijke bewegingen met objectinteractie — volgens het bedrijf een van de grootste datasets van dit type ooit gepubliceerd. Beleid dat op deze dataset is getraind, werkt al op een echte Unitree G1-robot, onder het label #PhysicalAI. Dit soort open bronresourcen past in de bredere dynamiek van het opbouwen van datasets voor fysieke AI en robotica, een richting die nauwlettend wordt gevolgd door het Hugging Face-ecosysteem, dat de aankondiging heeft doorgegeven.

🔗 Aankondiging @noitomrobotics


Mediageneratie: HeyGen, Black Forest Labs, Ideogram en NVIDIA

HeyGen lanceert avatar-retouche (Retouch)

20 augustus — HeyGen integreert een avatar-retouchetool rechtstreeks in zijn video-editor: correctie van onvolkomenheden (puistjes, rimpels), aanpassing van make-up en belichting, met controle over het niveau van retouche om trouw te blijven aan de oorspronkelijke avatar. Het expliciete doel is om reshoots te vermijden die enkel verband houden met uiterlijk — één keer retoucheren en daarna de weergave op alle volgende video’s opnieuw gebruiken. HeyGen benadrukt dat de avatar na retouche herkenbaar blijft: het gaat niet om het genereren van een ander gezicht, maar om het verfijnen van het bestaande.

🔗 Aankondiging @HeyGen

Black Forest Labs lanceert FLUX Video Upscale (2K/4K)

20 augustus — Black Forest Labs voegt een native upscalingmodule toe aan FLUX 3 Video, om video’s in 2K/4K te produceren of om te zetten met scherpere gezichten, schonere texturen en meer detail op de achtergrond, terwijl de stilistische diversiteit en het realisme van FLUX 3 Video behouden blijven. De functie geldt ook voor externe video’s, niet alleen voor video’s die door FLUX zijn gegenereerd, en zou sneller zijn dan oplossingen van derden voor upscaling. Toegankelijk via de API en een speciale demo.

🔗 Aankondiging @bfl_ai

Ideogram publiceert een gequantiseerd open model en een image background remover op Runware

20 augustus — Runware host twee nieuwe Ideogram-modellen: Ideogram 4.0q, een gequantiseerde versie met open gewichten van Ideogram 4.0 (9,3 miljard parameters) met lay-outcontrole via begrenzingsvakken, gestructureerde JSON-prompting en LoRA-ondersteuning; en de Ideogram Background Remover, die uit elke afbeelding een transparante PNG-uitknip levert met goede randgetrouwheid, met name bij typografie en logo’s.

🔗 Aankondiging @runware

NVIDIA claimt de snelste open source-solver met cuOpt

19 augustus — NVIDIA stelt dat cuOpt, zijn open source-optimalisatiesolver, de snelste is op de Hans Mittelmann-benchmarks, een erkende referentie in het vakgebied, voor drie klassen van combinatorische en lineaire optimalisatieproblemen. Het bedrijf nodigt de community uit om het project rechtstreeks op GitHub te testen, in het verlengde van zijn strategie om softwaretools rond zijn hardware open te stellen — cuOpt richt zich in het bijzonder op logistieke en grootschalige planningsgebruikssituaties waar oplossingssnelheid een directe factor van operationele kosten wordt.

🔗 Aankondiging @NVIDIAAI


Mistral, Kimi en GLM-5.3: documentonderzoek en kosten/prestatieconcurrentie

Mistral lanceert Agentic Search, een iteratieve documentretrievallaag

20 augustus — Mistral kondigt Agentic Search aan, een documentzoeklaag die is ontworpen om de beperkingen van klassieke RAG te doorbreken, die vertrouwt op één enkele retrieval zonder mogelijkheid tot itereren. Het systeem geeft het model vijf tools geïnspireerd op bestandsoperaties (search, open, navigate, read, grep), werkt met bestaande indexen, vereist geen fine-tuning en is model-agnostisch — getest met Mistral Medium 3.5 en met Z.ai’s GLM-5.2. Op FinanceBench (368 SEC-dossiers) stijgt de nauwkeurigheid van Mistral Medium 3.5 van 26,7 % naar 86 %, en daalt de p90-latentie van 255 s naar 154 s. Op OfficeQA Pro behaalt GLM-5.2 een winst van 45,6 punten in nauwkeurigheid. Beschikbaar via de Mistral Search Toolkit, geïntegreerd in Studio en Vibe.

🔗 Agentic Search op mistral.ai

Kimi K3 bovenaan de Pareto-frontier voor kosten/prestaties van Agent Arena

19 augustus — Agent Arena (LMArena) publiceert een Pareto-frontier voor kosten/prestaties voor zijn evaluaties van agents op echte langetermijntaken. Kimi K3 (Max) van Moonshot staat daar op de 4e plaats met een prestatiewinst van +10,53 %, tegen een mediane kostprijs van 0,62 USD per taak — de laagste van de acht toonaangevende modellen, ver voor Claude Opus 5 (Max) met 3,37 USD per taak voor een nauwelijks hogere score (+12,0 %). Grok 4.5 haalt +6,1 % bij 0,22 USD per taak, en Qwen-3.8 Max +6,3 % bij 0,33 USD per taak.

🔗 Ranglijst @arena

GLM-5.3 van Z.ai native geïntegreerd in AutoClaw

20 augustus — AutoClaw, de werkagent van Z.ai, integreert GLM-5.3 native, gelanceerd op 18 augustus. Gebruikers van het GLM Coding Plan die hun abonnement koppelen, krijgen een tijdelijke 1,5x quota-boost en maandelijkse AutoClaw-credits (Lite 5K / Pro 10K / Max 26K); nieuwe gebruikers ontvangen 26K AutoClaw-credits (waarde 20 USD), geldig 30 dagen. GLM-5.3 behaalt bovendien een score van 69 op de officiële DeepSWE-ranglijst, dezelfde dag gerapporteerd door een externe ontwikkelaar.

🔗 Aankondiging @AutoClawAIer


OpenAI breidt ChatGPT desktop uit in Europa, ChatGPT Sites en de Codex SDK

ChatGPT desktop (Mac) breidt Computer History, multi-app-geheugen en Record & Replay uit naar Europa

20 augustus — OpenAI breidt in Europa (EEA, Verenigd Koninkrijk, Zwitserland) drie functies van de ChatGPT desktop-app voor Mac uit, die tot nu toe beperkt waren tot de Verenigde Staten: Computer History (al gelanceerd op 13 augustus) voor Pro-, Business- en Enterprise-gebruikers; een multi-app-geheugen waarmee ChatGPT zich de activiteit van de gebruiker over zijn apps en websites heen kan herinneren; en Record & Replay, dat een gebruikelijke workflow omzet in herbruikbare vaardigheid door die te tonen in plaats van te beschrijven, voor ChatGPT Work en Codex.

🔗 Aankondiging @OpenAI

ChatGPT Sites: URL-personalisatie en team-samenwerking met Codex

20 augustus — ChatGPT Sites, de in ChatGPT geïntegreerde tool voor het maken van websites, laat nu toe om de URL van de gepubliceerde site te personaliseren, zodat die het project weerspiegelt en makkelijker te herkennen en te delen is. OpenAI voegt ook de mogelijkheid toe om teamgenoten uit te nodigen als editors, om samen aan hetzelfde project te bouwen en het te publiceren. In deze collaboratieve modus beheert Codex Git-beheer en continue integratie op de achtergrond, waardoor niet-technische teams aan een site kunnen samenwerken zonder zelf versiebeheer of deployments te hoeven hanteren.

🔗 Aankondiging @OpenAIDevs

Nieuwe Exa-plugin voor ChatGPT Work en Codex

20 augustus — OpenAI lanceert een plugin, ontwikkeld met Exa AI Labs, die ChatGPT Work en Codex toegang geeft tot meer dan 100 miljard webpagina’s, onderzoeksartikelen en documenten. Deze plugin breidt de mogelijkheden voor informatiezoeking van Codex- en ChatGPT Work-agents uit voorbij hun gebruikelijke bronnen, in het verlengde van de strategie om derde-partijplugins te integreren voor het agentische ecosysteem van OpenAI, begin augustus ingezet met de lancering van de Agent Plugins.

🔗 Aankondiging @OpenAIDevs

Codex SDK: klantcases Cisco App Builder en Thrive Holdings/Crete

20 augustus — OpenAI zet twee implementaties van de Codex SDK in de verf: Cisco gebruikt die voor zijn App Builder, waarmee klanten in natuurlijke taal gepersonaliseerde apps voor Cisco Cloud Control kunnen maken; en Thrive Holdings, samen met Crete, bouwde een fiscaal voorbereidingssysteem dat 7.000 aangiften heeft verwerkt en de voorbereidingstijd met ongeveer een derde heeft verminderd. OpenAI benadrukt ook het bredere gebruik van de open-source Codex-harnas, geïntegreerd door teams in bestaande interne tools, waar hun eigen applicatie de interface, context en goedkeuringen beheert terwijl het harnas de agentische lus afhandelt.

🔗 Aankondiging @OpenAIDevs


Kort nieuws

  • AG-UI-adapter voor Claude Managed Agents — nieuw cookbook gepubliceerd met CopilotKit, dat elke discussie-thread koppelt aan een beheerde sessie met streaming van tekst, tools en redenering. 🔗 bron
  • Auto Mode configureren in natuurlijke taal — de Auto Mode-regels van Claude Code kunnen in natuurlijke taal worden geschreven; toevoegen van $defaults behoudt de ingebouwde regels. 🔗 bron
  • Claude Desktop start ongeveer 2x sneller op — fix voor throttling bij het opstarten op de achtergrond, op volle snelheid booten zelfs wanneer het venster verborgen is. 🔗 bron
  • v0 (Vercel) — GPT-5.6 Sol en Fast mode aan -50 % — prijspromotie tot 18 september 2026. 🔗 bron
  • Gratis SAT-oefentests in Gemini — terug-naar-school herinnering: inhoud gecontroleerd door The Princeton Review, directe terugkoppeling en uitleg van de antwoorden. 🔗 bron
  • Windows 11 arm64-image met Visual Studio 2026 algemeen beschikbaar — op de standaard en grotere GitHub-hosted runners. 🔗 bron
  • Code scanning voegt de afwijzingsreden « Mitigated » toe — om een waarschuwing te sluiten wanneer een externe controle het risico beperkt. 🔗 bron
  • Toegewijd GitHub Actions-pad voor GitHub Code Quality — geschiedenis en gebruiksrapporten nu gescheiden van andere runs. 🔗 bron
  • Tracking van de activering van GitHub Code Quality in het auditlogboek — drie nieuwe gebeurtenissen volgen activering, deactivering en parameterwijzigingen. 🔗 bron
  • CodeQL 2.26.3 verbetert GitHub Actions-query’s — modellering van JavaScript-, TypeScript- en Vue-bronnen. 🔗 bron
  • Luma belicht een klantcase voor een agency (Aperture) — -75 % kosten per acquisitie en een 9x groter advertentiebudget, via een systeem met drie onderdelen (intelligentie, menselijke validatie, feedbacklus). 🔗 bron
  • NVIDIA opent GeForce NOW voor Firefox — tot 1440p/120 fps voor Ultimate-abonnees, twaalf nieuwe games waaronder Gallipoli. 🔗 bron
  • Suno voegt offline playlists toe — als aanvulling op de playlistvernieuwing die de dag ervoor werd aangekondigd. 🔗 bron
  • Qwen3.8-27B leidt Harvey’s agentische juridische benchmark — open-weight model nr. 1 van de Legal Agent Benchmark. 🔗 bron
  • AI Futures: nieuwe OpenAI-blog over het bestuur van transformerende AI — verkenning van de risico’s van machtsconcentratie door transformerende AI. 🔗 bron
  • Stampli versnelt productlanceringen met ChatGPT Work en Codex — lancering van het Deep Finance-product in zes weken, productie teruggebracht van 243 naar 77 geschatte manuren. 🔗 bron

Wat dit betekent

De AI-infrastructuur raakt aan haar capaciteitsgrenzen, niet aan haar algoritmische grenzen. De storing van 17 augustus bij GitHub is geen bug: het is een platform waarvan het verkeer in vier maanden is verdubbeld (van 1,4 naar 2,9 miljard maandelijkse commits) en dat zijn capaciteitsachterstand inhaalt met Azure-migraties en miljoenen extra CPU-cores. Hetzelfde spanningsveld tussen schaal en betrouwbaarheid zien we aan modelzijde terug: Meta AI’s WildArtifactBench laat strikte correctierasters los ten gunste van Elo-scores, een erkenning dat de evaluatie van echte multimodale agents inmiddels verder gaat dan wat benchmarks met ground truth kunnen meten.

De competitie draait steeds meer om de verhouding tussen kosten en prestaties in plaats van alleen om ruwe prestaties. Op de Pareto-frontier van Agent Arena behaalt Kimi K3 (Max) een score die bijna gelijk is aan die van Claude Opus 5 (Max) voor een vijf keer lagere kost per taak. Mistral past dezelfde logica toe aan de documentzoekkant: Agentic Search verandert een éénstaps-RAG in een iteratief systeem dat de nauwkeurigheid op dense financiële documenten verdrievoudigt, zonder fine-tuning. En Liquid AI duwt de grens aan de inferentiekant met draft-modellen van 300 miljoen parameters die de snelheid van veel grotere modellen verdubbelen via speculative decoding.

Agentische platforms vergroten hun greep op bedrijfsworkflows in plaats van louter chatinterfaces te blijven. OpenAI stapelt integratieblokken op elkaar (Exa, Record & Replay, Codex SDK bij Cisco en Thrive Holdings) terwijl Anthropic governance-controls toevoegt (toegestane/geblokkeerde domeinen voor beheerde agents) en Cognition Devin rechtstreeks in Slack verankert. Dat zijn drie verschillende inzetten op hetzelfde speelveld: de standaardlaag worden waar niet-technische teams werk delegeren aan agents.

Tot slot wordt mediageneratie in hoog tempo gemeengoed. Pika publiceert benchmarks die bijna op gelijke hoogte liggen met Suno en tot 95 % goedkoper zijn dan ElevenLabs voor sound effects, terwijl Ideogram een beeldmodel met open weights op een externe infrastructuur (Runware) zet en Sakana AI zijn vertaling meet tegen de concurrentie op 160 nauwkeurige taken. Differentiatie draait niet langer om de simpele beschikbaarheid van een model, maar om publieke, verifieerbare benchmarkcijfers, en steeds gedetailleerder.


Bronnen