Zoeken

Claude Code schakelt standaard over naar Auto Mode, Astra geclassificeerd als kritiek voor cybersecurity bij OpenAI, NVIDIA onthult Cosmos 3

Artikel gegenereerd door kunstmatige intelligentie
Claude Code schakelt standaard over naar Auto Mode, Astra geclassificeerd als kritiek voor cybersecurity bij OpenAI, NVIDIA onthult Cosmos 3

ai-powered-markdown-translator

Artikel vertaald van fr naar nl met gpt-5.4-mini.

Bekijk project op GitHub ↗

Op 7 augustus 2026 schakelt Claude Code Auto Mode over naar de standaard toestemmingsmodus vanaf 14 augustus voor de Pro-, Max- en Team-abonnementen, op basis van een interne studie die 89% van de gevaarlijke opdrachten geblokkeerd zag tegenover 14% bij handmatige review. Op dezelfde dag classificeert OpenAI voor het eerst een van zijn aankomende modellen, Astra, op het kritieke niveau van zijn Preparedness Framework voor cybersecurity, en onthult NVIDIA Cosmos 3, een nieuwe familie open modellen voor robotica en autonome voertuigen die al is overgenomen door Doosan, LG, Samsung en Li Auto. Het plaatje wordt aangevuld door Claude Code’s berichten tussen sessies, een versoepeling van de biologische vangrails van Claude Fable 5, de algemene beschikbaarheid van Seedance 2.5 op Runway en Luma, en een vijftiental andere aankondigingen aan de kant van GitHub Copilot, Gemini en agentische codetools.


Claude Code: Auto Mode wordt op 14 augustus de standaard toestemmingsmodus

7 augustus — Anthropic kondigt aan dat vanaf 14 augustus Auto Mode de standaard toestemmingsmodus wordt in Claude Code voor gebruikers van de Pro-, Max- en Team-abonnementen. In plaats van vóór elke shell-opdracht of gevoelige actie om bevestiging te vragen, vertrouwt Auto Mode op een aparte classifier die elke toolaanroep analyseert en opdrachten die als gevaarlijk worden beschouwd automatisch blokkeert, zonder de gebruiker bij elke stap te onderbreken.

Anthropic rechtvaardigt deze wijziging met een interne studie onder 1.053 betalende testers, aan wie een toestemmingsprompt werd voorgelegd voor een duidelijk gevaarlijke opdracht (alleen tekst, er werd niets echt uitgevoerd). De menselijke testers herkenden het gevaar slechts in 13,6% van de gevallen, een percentage dat daalt tot ongeveer 5% na 50 opeenvolgende prompts door vermoeidheid. Auto Mode blokkeerde daarentegen dezelfde opdrachten in 89% van de gevallen, een stabiel percentage ongeacht de duur van de sessie.

Gemeten indicatorHandmatige goedkeuringAuto Mode
Eerste detectie13,6%89%
Detectie na 50 prompts~5%89% (stabiel)

Nog een concrete wijziging: de extra tokenkost van de classifier telt voortaan niet meer mee in de gebruikslimieten van de Pro-, Max- en Team-abonnementen, en een uitbreiding naar Enterprise-abonnementen en de API is voorzien zodra Auto Mode overal is uitgerold. Een in-app melding zal gebruikers waarschuwen voor de omschakeling, en beheerders kunnen defaultMode vastpinnen of Auto Mode uitschakelen via de beheerde instellingen.

The team and I use Auto mode exclusively, and have been for many months. I couldn’t imagine going back to permission prompts! Really excited to get this out to everyone.

🇳🇱 Samen met het team gebruiken we Auto Mode al maanden exclusief. Ik zou me niet kunnen voorstellen dat ik terug zou gaan naar toestemmingsprompts! Echt blij dat we dit voor iedereen kunnen uitrollen.@bcherny op X

🔗 Aankondiging @ClaudeDevs


OpenAI classificeert Astra als kritiek niveau voor cybersecurity

7 augustus — OpenAI kondigt aan dat zijn toekomstige model Astra het eerste is dat wordt geclassificeerd op het kritieke niveau (Critical) voor cybersecurity onder zijn Preparedness Framework, dat voor het eerst werd gepubliceerd in december 2023. Eerdere modellen, waaronder GPT-5.6 Sol, waren op deze as slechts op het hoge niveau (High) beoordeeld.

Volgens het raamwerk bereikt een model de kritieke drempel voor cybersecurity als het functionele zero-day exploits kan identificeren en ontwikkelen op veel geharde kritieke systemen zonder menselijke tussenkomst, of van begin tot eind een geheel nieuwe cyberaanvalsstrategie kan ontwerpen vanuit een eenvoudig hoog niveau-doel. De interne evaluaties van de afgelopen dagen op Astra, gecombineerd met externe expertbeoordelingen, hebben OpenAI ertoe gebracht te concluderen dat het dit niveau van capaciteit niet kan uitsluiten — vandaar deze transparantienotitie, gepubliceerd nog vóór het einde van de volledige testcampagne. Het bedrijf verduidelijkt dat Astra niet betrokken was bij het recente beveiligingsincident bij Hugging Face.

Als gevolg daarvan verscherpt OpenAI zijn interne controles: geïsoleerde testomgevingen, beperkte netwerk- en tooltoegang, versterkte versleuteling van modelgewichten, verhoogde monitoring en uitvoering in sandbox. Interne activiteiten met Astra die nog niet aan deze eisen voldoen, worden gepauzeerd, en monitors analyseren voortaan de redeneerketen van het model op al zijn agentische toepassingen om een beveiligingsreactie te activeren bij risicovol gedrag.

After evaluating one of our upcoming models, Astra, we’re treating it as our first “critical” model for cybersecurity under our Preparedness Framework. This is a scenario we’ve planned for, and we’re putting additional controls in place to ensure Astra’s further development happens safely and securely.

🇳🇱 Na een van onze toekomstige modellen, Astra, te hebben geëvalueerd, behandelen we het als ons eerste model dat ‘kritiek’ is op het gebied van cybersecurity onder ons Preparedness Framework. Dit is een scenario dat we hadden voorzien, en we voeren extra controles in om ervoor te zorgen dat de verdere ontwikkeling van Astra veilig en beveiligd verloopt.@OpenAI op X

🔗 OpenAI-transparantienota


NVIDIA onthult Cosmos 3, een familie open modellen voor fysieke AI

6 augustus — NVIDIA heeft Cosmos 3 onthuld, een nieuwe familie open modellen gericht op fysieke AI — robotica, autonome voertuigen, embedded vision — gepubliceerd in het kader van de serie Into the Omniverse. Er worden drie formaten aangeboden: Cosmos 3 Super voor high-fidelity modellering, Cosmos 3 Nano voor efficiënte redenering, en Cosmos 3 Edge voor embedded deployment.

Cosmos 3-variantParametersBeoogd gebruik
Cosmos 3 Super64 miljardHigh-fidelity modellering
Cosmos 3 Nano16 miljardEfficiënte redenering
Cosmos 3 Edge4 miljardEmbedded deployment

De familie claimt de eerste plaats in meerdere ranglijsten: Artificial Analysis (tekst-naar-beeld en beeld-naar-video generatie met open weights), PAI-Bench (wereldgeneratie) en RoboLab (robotische beleidsmodellen). Verschillende industriële spelers hebben al hun adoptie aangekondigd — Doosan Robotics, LG Electronics, Samsung Electronics en Skild AI aan de robotica-kant, Li Auto, Xiaomi en Afari aan de kant van autonome voertuigen — en de NVIDIA Cosmos Coalition breidt haar activiteiten uit naar Japan. De modellen zijn beschikbaar onder de open OpenMDW 1.1-licentie op Hugging Face en GitHub.

🔗 NVIDIA — Open World Models for Physical AI


Claude Code en Claude Fable 5: twee nieuwigheden aan de kant van Anthropic

Claude Code-sessies kunnen nu met elkaar praten

7 augustus — Claude Code introduceert berichten tussen sessies: in plaats van de context van een taak in een andere sessie opnieuw uit te leggen, is het nu mogelijk om Claude te vragen de informatie zelf door te geven. Het verzonden bericht is een samenvatting — niet de volledige geschiedenis en ook niet de bestanden van de oorspronkelijke sessie — die de ontvangende sessie tijdens de taak ophaalt, zonder vanaf nul te beginnen. De functie werkt in beide richtingen: een sessie kan een andere bevragen en het antwoord in zijn eigen gesprek ontvangen, of Claude kan dit bericht autonoom initiëren wanneer een wijziging invloed heeft op een parallelle taak — handig om twee agents op dezelfde refactor te coördineren. Nu beschikbaar op macOS en Linux.

🔗 Aankondiging @ClaudeDevs

Claude Fable 5 versoepelt zijn biologie-vangrails, -85% valse positieven

7 augustus — Anthropic heeft de biologische vangrails van Claude Fable 5 bijgewerkt om het aantal valse positieven te verlagen. Volgens interne tests vermindert de update de gevallen van ten onrechte geactiveerde terugval (fallback) op biologische onderwerpen met ongeveer 85%, over alle productoppervlakken heen — Fable kan nu een breder scala aan veelvoorkomende vragen over gezondheid en onderwijs behandelen zonder onnodige blokkade. De vangrail blijft actief voor dubbelgebruikstoepassingen — virologie, toxicologie, moleculair ontwerp — die nog steeds doorschuiven naar Opus 5: Fable 5 is dus niet bruikbaar voor professioneel biologisch onderzoek of medicijnontwikkeling. Anthropic zegt eraan te werken om die kloof te dichten via speciale vertrouwde toegangspaden.

🔗 Aankondiging @claudeai


Codetools: Amp-prijsmodel, Replit-SSO en Codex-beveiligingsreview

Amp herstructureert de prijs en de omvang van zijn orbs

7 augustus — Amp voegt een nieuw orb-formaat a1.medium toe (4 CPU, 8 GB RAM), 50% goedkoper dan de vorige a0.medium en beter geschikt voor de meerderheid van de projecten. De automatische pauze na inactiviteit gaat van 15 naar 5 minuten, waardoor de rekening van vergeten orbs op de achtergrond daalt. Het wordt ook mogelijk om de orb-grootte per gespreksthread te kiezen via de opdracht amp -ox en de vlag --orb-size.

Orb-grootteCPUGeheugenPrijs per uur
a1.tiny12 GB0,08 $
a1.medium48 GB0,33 $
a1.xxlarge1632 GB1,32 $

🔗 Amp — Size the orbs of production

Replit voegt Okta- en Entra ID-SSO toe, gratis tot oktober

6 augustus — Replit integreert single sign-on (SSO) voor ondernemingen in zijn gegenereerde apps, in samenwerking met Clerk. Klanten met een Pro-abonnement kunnen hun agent vragen Okta of Entra ID (OIDC of SAML) rechtstreeks in hun applicatie te configureren, zonder handmatige configuratie van de identiteitsprovider. De optie wordt zonder extra kosten aangeboden tot 1 oktober 2026. Multifactor, sessieduur en contro-frequentie zijn ook via de agent configureerbaar, in een speciaal authenticatie-commandocentrum.

🔗 Aankondiging @Replit

Codex Security Review: research preview voor beveiligingsanalyse van pull requests

6 augustus — OpenAI lanceert Codex Security Review in research preview, beschikbaar voor ChatGPT Enterprise-, Business-, Edu- en Pro-workspaces (niet beschikbaar op Plus). Tijdens de introductieperiode verbruikt de review geen ChatGPT-credits, onder voorbehoud van gebruikslimieten. De tool gaat verder dan de bestaande Code Review op beveiligingsvragen: hij analyseert de diff van de pull request, de context van de repository en een threat model, dat automatisch opnieuw wordt gegenereerd als er geen bestand wordt aangeleverd. Standaard tonen automatische reviews bevindingen met een Hoge en Kritieke ernst, terwijl handmatige reviews de Middelmatige ernst toevoegen — drempels die per bestandspad aanpasbaar zijn. Een handmatige review kan op elk moment worden gestart via de opmerking @codex security review.

🔗 Aankondiging @OpenAIDevs


Onderzoek en benchmarks: evaluatiekader voor AI-tutoren en code-duel

Ai2 lanceert TutorMoments, een evaluatiekader voor AI-tutoren

7 augustus — Ai2 publiceert TutorMoments, een open evaluatiekader dat meet of modellen een centrale onderwijsslag weten te hanteren: directe ondersteuning bieden aan de leerling, of hem alleen laten nadenken. De methodologie steunt op 462 gedeïdentificeerde transcripties van echte één-op-één wiskundetutorsessies (groep 3 tot en met brugklas), waarin leraren meer dan 1.500 belangrijke beslismomenten hebben geannoteerd. Eerste bevinding: de prompt telt enorm zwaar — met een neutrale instructie hebben alle modellen de neiging om te veel te helpen, maar het expliciet maken van de afweging in de prompt verbetert de scores duidelijk, met een grote variatie van model tot model.

Metriek (expliciete prompt)Score
Passende ondersteuning0,458
Verhoogde nauwgezetheid0,182
Vermijdt over-ondersteuning0,496

Ai2 publiceert de transcripties, de pipelinecode en de ruwe resultaten open toegankelijk.

🔗 Ai2 — TutorMoments

Together AI vergelijkt DeepSeek-V4 Flash-0731 en GPT-5.6 Luna op echte code

6 augustus — Together AI heeft 900 DeepSWE-uitvoeringen gedraaid op 113 echte software-engineeringtaken. GPT-5.6 Luna wint op ruwe nauwkeurigheid met 67,2% pass@1 tegenover 53,3% voor DeepSeek-V4 Flash-0731, een verschil van 14 punten dat overeind blijft in pass@4 (90,3% vs 80,5%). Het echte verschil zit in de kosten: met 0,10 $ per uitvoering lost DeepSeek 532 taken op voor 100 $/, tegenover 110 voor Luna bij 0,61 $ per uitvoering — dus ongeveer 4,8 keer meer oplossingen per dollar. Een cascadestrategie (eerst DeepSeek, opschalen naar Luna bij falen) lost 78,9% van de taken op voor 0,385 $ per stuk, een hoger percentage dan Luna alleen bij een 37% lagere kost per taak.

🔗 Together AI — vergelijking DeepSeek vs GPT-5.6 Luna


Gemini: creativiteit en reizen

Gemini Omni: vijf makers delen hun creatieve toepassingen

7 augustus — Google zet vijf makers in de schijnwerpers die Gemini Omni gebruiken — toegankelijk via de Gemini-app, Google Flow, AI Studio en de API — voor videobewerking en het visualiseren van ideeën met eenvoudige commando’s. Leon Lin legt dezelfde stedelijke scène vast vanuit 20 verschillende perspectieven door hoek en omgeving te veranderen; Carlos Santana transformeert een buitenscène via spraakopdracht (dag/nacht, bewolkte lucht, besneeuwde grond); Pan animeert alledaagse objecten op basis van schetsen; Jerrod Lew past meerdere visuele stijlen toe (live-action, anime, claymation) op dezelfde video in Google Flow; Hyperagent genereert voorstellen voor landschapsontwerp en geanimeerde dashboards. Het artikel illustreert de kernbelofte van Gemini Omni: videobewerking vereenvoudigen via natuurlijke taal, zonder technische vaardigheden.

🔗 Google — Gemini Omni Builders

Hoe Gemini gedetailleerde reisroutes opbouwt

6 augustus — Google beschrijft in vier stappen hoe Gemini werkt voor reisplanning, nu beschikbaar in de Gemini-app. Eerst realtime dataverzameling via Google Maps, Flights, Hotels en YouTube, met een Viator-integratie voor activiteiten. Daarna personaliseert de Personal Intelligence-functie de aanbevelingen op basis van gegevens die al in Gmail, Photos, Search en YouTube van de gebruiker zijn opgeslagen — bijvoorbeeld voorgestelde restaurants op basis van opgeslagen foto’s van eten. Vervolgens bouwt Gemini een samenhangend reisschema rekening houdend met reistijden, en kan Gemini Spark een keten van boekingsmails omzetten in één master-itinerair document. Ten slotte vult de assistent reserveringsformulieren in, vergelijkt huurauto’s en stelt inpaklijsten op — een reis naar Kyoto dient als voorbeeld in het artikel.

🔗 Google — hoe Gemini reizen plant


GitHub Copilot: governance van reviews en metrieken per agent

Code Quality dwingt niet langer automatisch een Copilot-review af

7 augustus — Sinds de activering van Code Quality op 20 juli 2026 maakte GitHub automatisch een ruleset aan die een Copilot-review op elke pull request vereiste. GitHub schakelt nu drie van deze triggers uit: de review bij het openen van een PR, de review bij nieuwe pushes en de review van concepten. Op bestaande repositories zijn de reeds aangemaakte rulesets aangepast met deze drie opties uitgeschakeld — de ruleset blijft bestaan maar werkt niet langer automatisch; op nieuwe repositories maakt het activeren van Code Quality deze vraag niet meer aan. Teams die automatische reviews willen behouden, moeten handmatig een ruleset aanmaken of wijzigen, op repository- of organisatieniveau. GitHub rechtvaardigt deze wijziging met een terugkerende vraag: een reviewer toevoegen moet een keuze blijven, geen opgelegde standaard.

🔗 GitHub-changelog

De Copilot usage metrics API detailleert activiteit per externe AI-agent

7 augustus — De Copilot usage metrics API biedt een nieuwe tabel totals_by_3rd_party_agent, die voor elke partneragent (Claude, Codex…) die in GitHub-workflows wordt uitgevoerd het volgende detailleert: een stabiele identificatie (agent_name, agent_id), het aantal door gebruikers gestarte taken en, in geaggregeerde rapporten, het aantal sessies. Deze gegevens zijn bedoeld voor bedrijfseigenaren, facturatiebeheerders, organisatie-eigenaren en houders van de rol « Copilot-metrics bekijken ». Het doel is om elke app-agent afzonderlijk te volgen en hun adoptie te vergelijken, voor uitrolbeslissingen die zijn gebaseerd op werkelijk gebruik in plaats van op aannames.

🔗 GitHub-changelog


Mediageneratie: video en stem

Seedance 2.5 wordt algemeen beschikbaar op Runway en Luma

7 augustus — Na een vroege toegang begin augustus is Seedance 2.5 nu algemeen beschikbaar op Runway: tot 50 referenties per generatie om multi-personage-universums te bouwen, clips van 30 seconden met geluid en dialogen, daarna bewerking/uitbreiding. Diezelfde dag kondigt Luma de komst van Seedance 2.5 op zijn platform aan met dezelfde mogelijkheden, aanstuurbaar via Luma Agents voor controle over scènes, camerastandpunten en ritme. Tegelijk bevestigt Pika via zijn Club-API dat Seedance 2.5 daar wordt aangeboden voor tot 88% minder dan andere API-aggregators, een tarief dat als permanent wordt gepresenteerd.

🔗 Aankondiging @runwayml

ElevenLabs licht de impact van ElevenAgents op ElevenReader Voice Chat toe

7 augustus — ElevenLabs deelt uitrolgegevens van ElevenAgents, die inmiddels in al zijn producten zijn doorgevoerd. Uitgelicht voorbeeld: ElevenReader Voice Chat, waarmee lezers van een audioboek halverwege vragen kunnen stellen in dezelfde stem als de verteller, zonder elementen te onthullen die verderop in het boek staan.

Gemeten metriekGeobserveerde waarde
Stijging van de gemiddelde luistertijd+24%
Voltooiingsgraad van het boek (5+ sessies)78%

De meest voorkomende vraag is een samenvatting van het verhaal, gevolgd door vragen over personages, thema’s en citaten.

🔗 Aankondiging @ElevenLabs

Suno lanceert Voices in zijn mobiele iOS- en Android-app

7 augustus — De functie Voices, waarmee je je eigen stem kunt opnemen om die in gegenereerde nummers te verwerken, is nu beschikbaar in de Suno mobiele app (iOS en Android) via de knop « + Voice » op het creatiescherm. De opname moet minstens één minuut duren. Pro- en Premier-abonnementen krijgen onbeperkte toegang, terwijl het gratis plan een beperkte versie heeft.

🔗 Aankondiging @suno


Korte berichten

  • Devin (Cognition) lanceert een programma van 65.000 dollar aan credits voor startups — Cognition start een startup-programma dat tot 65.000 dollar aan Devin-credits aanbiedt, in de lijn van vergelijkbare programma’s van de grote spelers in generatieve AI. 🔗 bron
  • v0 (Vercel) lanceert een Usage & Activity-dashboard — Volgt credits per dag, activiteit per lid of project, en details per bericht (datum, model, kosten), toegankelijk via Settings → Usage & Activity. 🔗 bron
  • Warp Agent CLI — geavanceerde personalisatie — Alle configuratie staat voortaan in een settings.toml-bestand dat door de agent kan worden bewerkt, met thema’s, animaties, een aanpasbare statusbalk en multi-agent-orchestratie. 🔗 bron
  • Replit behaalt een Guinness-wereldrecord voor de grootste AI-videocursus — 14.075 mensen hebben samen in één live sessie gebouwd, een door Guinness erkend record. 🔗 bron
  • SK Telecom publiceert A.X K2, een MoE van 688 miljard parameters onder Apache 2.0 — Koreaans mixture-of-experts-model, context van 256K tokens, open licentie voor commercieel gebruik. 🔗 bron
  • Hugging Face host een dataset met een miljoen afbeeldingen uit het publieke domein — 1.080.814 afbeeldingen, voornamelijk afkomstig uit 19e-eeuwse boeken, gepubliceerd op de Hub. 🔗 bron
  • Together AI claimt de beste throughput voor Kimi K3 op meerdere benchmarks — Moonshot AI zet Together AI op de eerste plaats of ex aequo op 3 van de 4 geteste benchmarks: OCRBench, MMMU Pro Vision en DeepSWE. 🔗 bron
  • Behind-the-scenes: Apollo 2 (Apptronik) op Gemini Robotics 2 — Google DeepMind publiceert een reeks promotionele content rond de humanoïde robot Apollo 2, draaiend op Gemini Robotics 2. 🔗 bron
  • « Relates to »-relatie tussen issues in preview en multi-selectvelden in GA — Nieuwe neutrale issue-relatie in publieke preview, en algemene beschikbaarheid van multi-selectvelden voor issues en projects. 🔗 bron
  • Secret scanning voegt een partner en nieuwe push-protection-detecties toe — Lovable Labs sluit zich aan bij het programma; nieuwe detecties waaronder mistral_ai_api_key, en verrijkte metadata op meldingen van Cohere, GoCardless en Square. 🔗 bron
  • MCP-allowlists in de beheerde bedrijfsinstellingen — Bedrijven kunnen de toegestane of geblokkeerde MCP-servers voor Copilot app, CLI en VS Code centraliseren via managed-settings.json. 🔗 bron
  • MiniMax H3 beschikbaar in Genspark AI Video Agent — Het videomodel dat begin augustus als open weights verscheen, is nu rechtstreeks toegankelijk in de videogeneratietool van Genspark. 🔗 bron
  • MiniMax H3 beschikbaar in Luma Agents — Videogeneratie tot 15 seconden in 2K met native stereo-geluid, aanstuurbaar via tekst, beeld, video en audio als referentie. 🔗 bron
  • De MiniMax H3-community produceert een distillatie-LoRA (20 → 4-8 stappen) — Vier dagen na het openen van de weights vermindert een community-LoRA het aantal samplingstappen van 20 naar 4-8. 🔗 bron
  • Genspark treedt toe tot de Unicorn Innovator Community van het World Economic Forum — Deelname aangekondigd, met een geplande aanwezigheid in Davos naast leiders uit het bedrijfsleven en de overheid. 🔗 bron
  • GitHub laat toe om open pull requests op organisatieniveau te beperken — Nieuwe optie om op organisatieniveau het aantal open PR’s van bijdragers zonder schrijfrechten te plafonneren. 🔗 bron
  • Genspark laat twee AI-agents (ChatGPT vs Claude) tegen elkaar strijden op limonadekraampjes — Marketingdemo waarbij elke agent een echt kraampje runt om te proberen 100 dollar in één dag te verdienen. 🔗 bron
  • HSP GRUPPE rolt ChatGPT Enterprise uit over zijn netwerk van fiscale advieskantoren — Duits netwerk voor fiscaal advies, audit en recht, dat ChatGPT Enterprise over 81 organisatiegroepen invoert. 🔗 bron

Wat dit betekent

Default security wordt tegelijk bij de grote labs ingevoerd, maar in verschillende vormen. Anthropic zet Auto Mode standaard aan op basis van een moeilijk te betwisten cijfer — 89% van de gevaarlijke commando’s geblokkeerd tegenover 14% bij vermoeide menselijke review — en gokt daarmee dat automatisering van veiligheidsbeoordeling nu betrouwbaarder is dan herhaalde menselijke aandacht. OpenAI kiest in een ander domein de omgekeerde route: in plaats van een controle losser te maken, voegt het er een toe door Astra al vóór het einde van de testcampagne als kritisch te classificeren. Codex Security Review, diezelfde week gelanceerd, zet die logica productmatig voort door de veiligheidsanalyse naar vóór de merge te verplaatsen in plaats van achteraf te reviewen. De drie aankondigingen vertellen hetzelfde verhaal: agentische veiligheid is geen handmatig aangevinkte optie meer, maar wordt een standaardlaag, of die zich nu uitdrukt in grotere autonomie of in strengere vangrails.

Het ecosysteem van open modellen wordt steeds meer beoordeeld op kosten en industriële adoptie in plaats van alleen op benchmarkscore. NVIDIA positioneert Cosmos 3 niet als zomaar een extra model, maar als infrastructuur die al is ingevoerd door Doosan, LG, Samsung en Li Auto nog vóór brede verspreiding. Together AI documenteert dezelfde afweging aan de codekant: GPT-5.6 Luna wint 14 punten pass@1 op DeepSeek-V4 Flash, maar DeepSeek levert 4,8 keer meer oplossingen per dollar, waardoor een cascade-strategie beide modellen afzonderlijk verslaat. SK Telecom voegt een Koreaans MoE-model van 688 miljard parameters onder een permissieve licentie toe aan dit al dichte landschap. Het gemeenschappelijke signaal: de competitie draait niet langer alleen om de capaciteitsgrens, maar om de verhouding tussen die capaciteit en de werkelijke gebruiksprijs.

Agentische ontwikkeltools krijgen een meer klassieke bedrijfsinfrastructuur — fijne facturatie, identiteit, governance — een teken van volwassenwording voorbij het simpele prototype. Amp splitst zijn cloudomgevingen voortaan op grootte en thread op, zoals elke infrastructuurprovider, Replit voegt tijdelijk gratis enterprise-SSO toe om adoptie te versnellen, en Claude Code laat zijn sessies een contextsamenvatting doorgeven in plaats van de gebruiker alles opnieuw te laten typen. Aan de GitHub-kant is de beweging bijna omgekeerd maar wijst ze naar dezelfde richting: Code Quality haalt de automatisering van het toevoegen van een Copilot-reviewer weg en maakt de keuze expliciet, terwijl de usage metrics API eindelijk laat zien wie, van Claude of Codex, het werk daadwerkelijk uitvoert in enterprise-workflows. Samen verschuiven deze aankondigingen de vraag van « welke agent is het slimst » naar « hoe beheer je een vloot agents ».

Mediageneratie blijft zich verspreiden over platforms in plaats van beperkt te blijven tot één speler. Seedance 2.5 wordt tegelijk algemeen beschikbaar op Runway en Luma, MiniMax H3 verspreidt zich binnen enkele dagen naar Genspark en Luma Agents en krijgt al een community-distillatie-LoRA, en ElevenLabs en Suno verfijnen gerichte toepassingen — contextuele vragen tijdens het luisteren naar een audioboek, spraakopname rechtstreeks vanaf mobiel. Deze snelle circulatie van hetzelfde model tussen meerdere producten, in enkele dagen voor MiniMax H3, laat zien hoezeer open weights creatieve verspreiding versnellen voorbij de oorspronkelijke uitgever.


Bronnen