Zoeken

OpenAI vertraagt zijn modellen vanwege het cyberrisico van Astra, Warp lanceert Warp Factories, Claude Code lanceert de Design-skill

Artikel gegenereerd door kunstmatige intelligentie
OpenAI vertraagt zijn modellen vanwege het cyberrisico van Astra, Warp lanceert Warp Factories, Claude Code lanceert de Design-skill

ai-powered-markdown-translator

Artikel vertaald van fr naar nl met gpt-5.4-mini.

Bekijk project op GitHub ↗

Op 18 augustus 2026 publiceert OpenAI een rapport waarin wordt uitgelegd waarom het de training van zijn nieuwste modellen heeft vertraagd vanwege de kritieke cybermogelijkheden van een model met de naam Astra, terwijl Warp een agentische infrastructuur voor bedrijven lanceert en Claude Code een interface-ontwerp-skill uitbrengt. Rond deze drie grote aankondigingen behandelen achttien andere nieuwtjes Anthropic, code-tools, open AI-onderzoek en platforms voor mediageneratie.


OpenAI vertraagt de uitrol van zijn modellen vanwege de kritieke cybermogelijkheden van Astra

18 augustus — OpenAI legt uit waarom het bedrijf de uitrol van zijn recente modellen heeft vertraagd. Twee gebeurtenissen lagen aan deze beslissing ten grondslag: het beveiligingsincident OpenAI-Hugging Face dat plaatsvond tijdens de evaluatie van een model, en voorlopige aanwijzingen dat een van de volgende modellen, met de naam Astra, de drempel voor “kritieke cybercapaciteit” zou kunnen overschrijden zoals gedefinieerd in zijn Preparedness Framework.

OpenAI heeft een pauze van twee weken waargenomen in reinforcement training (RL) op zijn nieuwste modellen die bedoeld zijn voor uitrol, terwijl het zijn onderzoeksomgevingen verhardde en red-teamde. De grootste geplande frontier-RL-run blijft opgeschort, in afwachting van kleinschaligere trainingen die de nieuwe beveiligingen valideren.

BeschermingDetail
MonitoringClassificatoren per token, waarschuwing gericht binnen 30 minuten
AfstemmingVermindering van schadelijke of niet-geautoriseerde acties
BeveiligingVersterkte netwerkscheiding, sandboxes voor onbetrouwbare code
Extra kostOngeveer 20 % extra gemonitorde inferentiecompute

Deze monitoring is verplicht voor elke RL-training en elke evaluatie met tools vanaf niveau “Zon”; sinds 7 augustus geldt een aanvullende vereiste voor elke inferentie van Astra met tools. OpenAI plant een technisch rapport over het Hugging Face-incident en een evolutie van zijn Preparedness Framework met externe organisaties.

As models become more capable, the risks associated with developing and testing them internally also grow. We temporarily paused reinforcement learning (RL) training on our latest models intended for deployment for two weeks while we hardened and red-teamed our research environments and expanded monitoring coverage. Our largest planned frontier RL run remains on hold while smaller-scale training and evaluations validate these safeguards and establish more evidence of alignment.

🇳🇱 Naarmate modellen capabeler worden, nemen ook de risico’s toe die verbonden zijn aan hun ontwikkeling en aan hun interne tests. We hebben de reinforcement training (RL) op onze nieuwste modellen die bedoeld zijn voor uitrol tijdelijk twee weken gepauzeerd, terwijl we onze onderzoeksomgevingen verhardden en red-teamden en de dekking van onze monitoring uitbreidden. Onze grootste geplande frontier-RL-run blijft opgeschort terwijl trainingen en evaluaties op kleinere schaal deze beveiligingen valideren en meer bewijsmateriaal voor afstemming opleveren.@OpenAI op X

🔗 OpenAI — Modelontwikkeling afstemmen op het tempo


Warp lanceert Warp Factories, infrastructuur voor cloud software factories

18 augustus — Warp kondigt Warp Factories aan, een open infrastructuur bedoeld voor bedrijven die hun eigen automatiseringslussen rond de softwarelevenscyclus bouwen: cloudagents triëren, specificeren, implementeren, reviewen en verifiëren het werk, terwijl mensen op belangrijke beslissingspunten in de lus blijven. De aankondiging benoemt twee problemen die door engineeringleiders zijn gemeld: de moeilijkheid om het rendement op investering van codingsagents op de lange termijn te meten, en governance, waarbij elke ontwikkelaar zijn eigen agent configureert en zo blinde vlekken in de beveiliging creëert.

Technisch gezien worden de factories geconfigureerd als code — de geclaimde analogie is “Terraform voor agentconfiguratie” — en ze accepteren elk model of elke harness, inclusief Claude Code of Codex rechtstreeks als harness. De agents hebben computer use-toegang op Linux en Mac om bugs te reproduceren en de correctheid van een wijziging aan te tonen, met het delen van opnames op pull requests. Een dashboard, een API en een SDK meten kosten en snelheid, met configureerbare zelfverbeteringsagents.

Warp beweert tegenwoordig ongeveer 30 % van zijn eigen taken via zijn interne factories te automatiseren en verwacht dat dit percentage snel zal groeien. Het bedrijf opent vandaag de toegang voor een beperkt aantal bedrijven, met een aanbod van 10.000 dollar aan factory-gebruikskredieten voor geselecteerde klanten.

Introducing Warp Factories: open, flexible infrastructure for building cloud software factories. - Configure your factory as code - Use any model and any harness - Measure quality with evals and benchmarks on your own data - Built-in self-improvement and memory

🇳🇱 Introductie van Warp Factories: een open en flexibele infrastructuur om cloud software factories te bouwen. Configureer je factory als code. Gebruik elk model en elke harness. Meet kwaliteit met evaluaties en benchmarks op je eigen gegevens. Zelfverbetering en ingebouwd geheugen.@warpdotdev op X

🔗 Aankondiging Warp Factories


Claude Code lanceert de /design-skill in voorlopige research

17 augustus — Anthropic lanceert een nieuwe skill /design voor Claude Code, momenteel in voorlopige research. Deze functie brengt de artboard-workflow van Claude Design, gebouwd op het bestaande artifacts-systeem, naar de CLI en de Desktop-app. Het commando /design genereert meerdere bewerkbare artboards die voorstellen voor gebruikersinterfaces weergeven: de gebruiker kiest degene die past, past die aan en vraagt Claude vervolgens om die in de code te implementeren.

Deze lancering brengt Claude Code dichter bij een gebruik voor interfaceontwerp, tot nu toe vooral voorbehouden aan gespecialiseerde tools, door het rechtstreeks in de workflow van de ontwikkelaar in de terminal of Desktop te integreren. De functie is beschikbaar voor de plannen Pro, Max, Team en Enterprise, en vereist een update van Claude Code om getest te kunnen worden. Er werden geen aanvullende details verstrekt (beperkingen van de research preview, roadmap, visuele voorbeelden) buiten deze lanceringsaankondiging.

Claude Code can design now. The new /design skill (research preview) brings Claude Design’s artboard workflow into the CLI and Desktop, built on artifacts. Run /design to get editable artboards for your UI — pick one, tweak it, then have Claude implement it.

🇳🇱 Claude Code kan nu interfaces ontwerpen. De nieuwe /design-skill (voorlopige research) brengt de artboard-workflow van Claude Design naar de CLI en de Desktop, gebouwd op de artifacts. Start /design om bewerkbare artboards voor je interface te krijgen — kies er een, pas hem aan en vraag Claude vervolgens om hem te implementeren.@ClaudeDevs op X

🔗 Beschikbaarheid Pro, Max, Team, Enterprise


Anthropic: Cowork algemeen beschikbaar, verlengde limieten, geoptimaliseerde CPU

Drie Anthropic-aankondigingen van vandaag gaan over toegang en prestaties van Claude Code en Cowork.

Claude Cowork beschikbaar op mobiel en web voor alle betaalde plannen

18 augustus — Claude Cowork, de samenwerkingsomgeving van Anthropic, is voortaan toegankelijk op mobiel en op het web voor alle betaalde plannen (Pro, Max, Team en Enterprise). Tot nu toe werd het voornamelijk genoemd rond zijn gedeelde zijpaneel tussen desktop, web en mobiel; deze aankondiging markeert een algemene beschikbaarstelling in plaats van een nieuwe functie: betaalde gebruikers vinden hun Cowork-sessies nu terug vanaf elk van deze drie toegangspunten, zonder aanvullende details over de interface of mogelijke mobiele beperkingen.

🔗 Aankondiging Claude Cowork

Verhoging van 50 % van de wekelijkse Claude Code-limieten verlengd tot 31 augustus

18 augustus — Anthropic verlengt tot 31 augustus de verhoging van 50 % van de wekelijkse gebruikslimieten van Claude Code, die aanvankelijk tijdelijk was. Het team hoopt deze wijziging permanent te maken, maar waarschuwt dat de sterke vraag naar zijn modellen in de komende weken tot capaciteitsdruk kan leiden, zonder definitieve datum voor een eindbeslissing. Deze aankondiging maakt deel uit van een reeks recente mededelingen rond de prestaties en het gebruik van Claude Code, en weerspiegelt aanhoudende vraagdruk op de infrastructuur van het product.

🔗 Aankondiging limieten Claude Code

Claude Code CLI gebruikt twee keer minder CPU op p99

18 augustus — Een patch laat nu de garbage collector (garbage collector) van Bun, de JavaScript-runtime van de tool, wachten tot het proces inactief is voordat hij wordt uitgevoerd. De trigger werd eerder geactiveerd op een vaste timer, mogelijk midden in een gespreksronde, op het moment dat Claude Code de processor het meest belastte. Resultaat: de CLI gebruikt nu twee keer minder CPU op het 99e percentiel, in het verlengde van andere prestatie-optimalisaties die begin augustus zijn gecommuniceerd.

🔗 Aankondiging CPU-optimalisatie


Codingsagents: spraakchat en native SSH

Amp en Warp vullen hun codingsagents aan met nieuwe interactiemodi.

Amp lanceert realtime spraakchat met Puck

18 augustus — Amp voegt realtime spraakgesprekken met Puck, zijn assistent-agent, toe, aangedreven door gpt-realtime-2.1, dat het werk overdraagt aan de reeds bestaande Puck-agent (aangedreven door GPT-5.6 Sol) en het antwoord hardop samenvat terwijl de volledige tekst in de chatthread zichtbaar blijft. Amp benadrukt verschillende gebruikssituaties: parallel werk coördineren, voortgangsupdates krijgen, of relevante Slack-berichten hardop laten voorlezen, zowel op kantoor als onderweg.

🔗 Praat met Puck

Amp lanceert een onderwijstarief van 10 dollar per maand

18 augustus — Studenten en docenten kunnen zich nu abonneren op Amp Megawatt Edu voor 10 dollar per maand, de helft van het gebruikelijke tarief. Het aanbod omvat Amp’s frontier-agent, orbs (afgelegen machines voor onbeheerde agents), onbeperkte codehosting (publiek en privé), 750 uur orb-gebruik per jaar en 10 dollar aan maandelijkse kredieten. Abonnees kunnen een bestaand ChatGPT-abonnement koppelen om toegang te krijgen tot GPT-5.6, of een X Premium+/SuperGrok-abonnement voor Grok 4.6; er wordt geen strikte verificatie van de studentenstatus toegepast.

🔗 Amp Megawatt Edu

Warp Agent CLI voegt native SSH-ondersteuning toe

17 augustus — De Warp Agent CLI, gratis te downloaden en compatibel met BYOK en Grok-abonnementen, maakt het nu mogelijk om de agent rechtstreeks uit te nodigen in een al actieve SSH-sessie — inclusief in vim, een SQL-REPL of andere tekstinterfaces — in plaats van zich te beperken tot het uitvoeren van losse commando’s. Er is geen extra CLI op de externe machine nodig: het commando ! ssh volstaat om direct naast de agent in de sessie te werken.

🔗 Warp Agent CLI en SSH


OpenAI: tieners, wereldwijde DevDay en agentische impact

Vier OpenAI-aankondigingen van vandaag gaan over de veiligheid van jonge gebruikers, internationaal bereik en de concrete impact van Codex.

ChatGPT for Teens: versterkte bescherming en educatief partnerschap met CodeAI

18 augustus — OpenAI lanceert ChatGPT for Teens, een ervaring speciaal voor tieners die Study Mode, anti-snelkoppelingherinneringen die een omzeiling van huiswerk kunnen detecteren, quizzen en educatieve visualisaties combineert, evenals Study Hours die door tieners of ouders kunnen worden ingepland. Het systeem schakelt automatisch over naar deze ervaring voor elke gebruiker waarvan wordt aangenomen dat die minderjarig is, met nieuwe evaluaties “jonger dan 18 jaar” die zijn gepubliceerd in de system cards (zelfbeschadiging, eetstoornissen, geweld, seksuele inhoud). Tegelijkertijd voorziet een signature-partnerschap met CodeAI in een jaar lang adviesraad voor kinderontwikkeling, uitbreiding van het programma “Hour of AI”, een “Builders Challenge” voor middelbare scholieren en ondersteuning voor de gratis cursus “AI Foundations”.

🔗 ChatGPT for Teens

DevDay Exchange: OpenAI mondialiseert zijn ontwikkelaarsevenement

18 augustus — Vanaf oktober 2026 lanceert OpenAI DevDay Exchange, een reeks ontwikkelaarsevenementen in acht steden: Bengaluru, Tokio, Seoel, Berlijn, Parijs, Londen, São Paulo en Mexico-Stad. Het verklaarde doel is om builders de kans te geven hun echte projecten te bespreken en rechtstreeks de OpenAI-teams te ontmoeten die de tools ontwikkelen (API, Codex, ChatGPT Work). Er worden op dit moment geen details over het precieze format of inschrijvingen verstrekt.

🔗 DevDay Exchange

Asana realiseert vijf jaar engineeringwerk in twee weken met Codex

18 augustus — Asana gebruikte Codex om Enzyme te verwijderen, een verouderd testsysteem dat de modernisering van zijn frontend-stack blokkeerde. Een project dat werd geschat op ongeveer vijf jaar werk en 6 miljoen dollar werd uitgevoerd in 1,5 week engineeringinspanning verspreid over twee kalenderweken, voor een totale kost van ongeveer 12.000 dollar. Vertrekkend van een prompt van vijf zinnen werkten maximaal vier Codex-agents parallel op afzonderlijke kopieën van de codebase, terwijl een ingenieur elke wijziging tweemaal per dag valideerde.

🔗 Casestudy Asana

OpenAI lanceert een initiatief om de democratische controle over AI in nationale veiligheid te versterken

18 augustus — OpenAI kondigt een initiatief aan met 5 miljoen dollar om democratische controle-instellingen te helpen toezicht te houden op het gebruik van AI in nationale veiligheid, via training, technische ondersteuning en OpenAI-kredieten. Drie principes sturen dit werk: AI moet het institutionele oordeel versterken en niet vervangen, overheidsgebruik moet traceerbaar blijven voor bevoegde toezichthoudende organen, en AI moet deze instellingen in staat stellen te handelen op de vereiste schaal. Over een periode van een jaar plant OpenAI pilotprojecten voor traceerbaarheid van overheidsbeslissingen met AI-ondersteuning, waarbij de deelnemende instellingen de controle over het bewijsmateriaal behouden.

🔗 Democratische controle en nationale veiligheid


Onderzoek en open modellen

Vier onderzoekspublicaties illustreren wat het openstellen van gewichten en gegevens mogelijk maakt om aan te tonen.

Sentence Transformers v6.0: multi-vector ColBERT-modellen krijgen een eerste klas

18 augustus — Hugging Face publiceert versie 6.0 van Sentence Transformers met de toevoeging van MultiVectorEncoder, waardoor late-interactie-modellen in ColBERT-stijl op gelijke voet komen te staan met de reeds ondersteunde dense, sparse en re-ranker modellen. Elke token in het document behoudt zijn eigen vector, en de eindscore telt de maximale overeenkomst van elke querytoken op (MaxSim-operator). Op de testbank NanoBEIR (13 datasets) behaalt de multi-vectorversie een gemiddelde NDCG@10 van 0,6868 tegenover 0,6764 voor de equivalente dense versie, tegen de prijs van hogere opslag (ongeveer 92 MB gecomprimeerd voor 4.874 passages). De bibliotheek voegt ook ondersteuning toe voor Flash Attention, waarmee de doorvoer met 2,44 wordt vermenigvuldigd in fp16-precisie.

🔗 Sentence Transformers v6.0

Ai2: Olmo 3 onthult een morfologische snelkoppeling in medische LLM-antwoorden

18 augustus — Onderzoekers van UT Austin, Northeastern University en het MD Anderson Cancer Center hebben Olmo 3 (7B Instruct), het volledig open model van Ai2, gebruikt om te testen of modellen vragen over medicijnen beantwoorden op basis van echte kennis of door de structuur van de naam te benutten (het achtervoegsel « -pril » duidt bijvoorbeeld op een ACE-remmer). Voor 51 tot 59 % van de geteste medicijnen is het antwoord van het model op de echte naam nauwelijks te onderscheiden van het antwoord op een verzonnen naam. De toegang tot de gewichten, gegevens en tussentijdse checkpoints van Olmo maakte het mogelijk deze snelkoppeling terug te voeren tot de trainingsgegevens — een traceerbaarheid die met propriëtaire modellen onmogelijk is.

🔗 Olmo 3 en morfologische snelkoppeling

IBM Research: agentisch geheugen afstemmen op het model

18 augustus — Een nieuw artikel uit de ALTK-Evolve-reeks van IBM Research laat zien dat agentisch geheugen — gedistilleerde instructies uit eerder werk van een agent — moet worden gedoseerd in functie van de capaciteit van het onderliggende model. Getest op acht modellen: gpt-oss-120b wint +16,1 punten in taakvoltooiingspercentage met gerichte selectieve terugwinning voor slechts +5 % tokens; DeepSeek-V3.2 gaat vooruit met +9,5 punten met volledige injectie van de instructies; GLM-5 laat geen meetbare winst zien, een geval van verzadiging. Contra-intuïtieve bevinding: de goedkoopste strategie levert vaak de beste nauwkeurigheid voor de zwakkere modellen.

🔗 ALTK-Evolve — agentisch geheugen

AlphaEvolve draagt bij aan een nieuw record voor matrixvermenigvuldiging

18 augustus — Google DeepMind kondigt een nieuw record aan voor omega (ω), de theoretische exponent van de snelst mogelijke snelheid voor het vermenigvuldigen van matrices, met ω < 2,371177. Dit resultaat komt voort uit een gezamenlijke inspanning van Google DeepMind, academische medewerkers en AlphaEvolve, de door Gemini aangedreven codeeragent die al bekendstaat om het verbeteren van verschillende algoritmen in 2025. Matrixvermenigvuldiging ligt aan de basis van een groot deel van de moderne informatica, waaronder de training en inferentie van AI-modellen — een theoretische winst op deze exponent reikt dus verder dan alleen academisch onderzoek.

🔗 Nieuw omega-record


Inference-economie: A/B-testing en kostenketen

Twee publicaties van Together AI meten de werkelijke kosten van productie-implementatie en modelvergelijking.

Together AI lanceert A/B-testing voor modellen op endpoint-niveau

18 augustus — Together AI integreert A/B-testing rechtstreeks in de endpoint-laag in plaats van in de applicatiecode: een experiment koppelt een controlemodel en tot 20 varianten, elk met een vast verkeerspercentage (95/5, 80/20, 50/50), onafhankelijk van het aantal replicas. Updates worden binnen 30 tot 60 seconden doorgevoerd met etag-bescherming tegen gelijktijdige overschrijvingen. Zodra een winnaar is geïdentificeerd, wordt die gepromoveerd via blue-green deployment en daarna wordt het experiment verwijderd: 100 % van het verkeer keert terug naar de controle zonder restlogica die aan de clientzijde moet worden opgeruimd.

🔗 A/B-testing Together AI

DeepSeek V4 Pro tegenover GPT-5.6 Sol en Claude Fable 5 op DeepSWE: kosten en cascade

17/18 augustus — Together AI publiceert twee onafhankelijke benchmarks van elk 904 rollouts (113 taken, 4 pogingen) waarin DeepSeek V4 Pro 0813 wordt vergeleken met GPT-5.6 Sol en Claude Fable 5 op DeepSWE, een testbank voor software-engineering.

VergelijkingPass@1 ProPass@1 concurrentKosten rollout ProKosten concurrentPro-first cascade
Pro vs GPT-5.6 Sol62,8 %72,7 %0,24 $8,37 $ (35x)83,0 % tegen 3,35 $/taak
Pro vs Claude Fable 562,8 %69,7 %0,24 $21,63 $ (90x)82,7 % tegen 8,28 $/taak

In pass@4 neemt Pro in beide gevallen de voorsprong terug (88,5 % tegenover 85,8 % tegen Sol, 88,5 % tegenover 84,1 % tegen Fable). De « Pro-first » cascade — Pro eerst uitvoeren, alleen opschalen bij mislukking — presteert beter dan elk afzonderlijk model tegen een fractie van de kosten.

🔗 DeepSWE-benchmark — GPT-5.6 Sol


Producten per e-mail en generatieve audio

Perplexity Computer toegankelijk via e-mail

18 augustus — Computer, de actie-agent van Perplexity, wordt voor al zijn gebruikers toegankelijk via e-mail: je hoeft alleen maar computer@perplexity.com te versturen, door te sturen of in cc te zetten op eender welke draad om een taak te starten. Elke e-mailtaak wordt uitgevoerd als een normale Computer-sessie, toegankelijk op web en mobiel, met hetzelfde auditlogboek als taken die vanuit de app worden gestart.

🔗 Computer via e-mail

Stability AI lanceert een DAW-plugin en een nieuwe webinterface voor Stable Audio 3.0

18 augustus — Stability AI kondigt twee bètatools aan voor Stable Audio 3.0, beide gebaseerd op « commercially-safe » modellen waarvan de gebruiker eigenaar is van de outputs. De DAW-plugin (macOS AU/VST3, Apple Silicon en Intel) genereert audio rechtstreeks als een instrumentale track gesynchroniseerd met het tempo, van korte sequenties tot zes minuten. De verrijkte webinterface op stableaudio.com voegt directionele prompts toe om een generatie bij te sturen, audio-naar-audio-transformatie, multitrack-mixing en per-track effecten. Deze tools brengen Stable Audio dichter bij professionele muziekproductieworkflows, in een veld waar Suno en Pika al concurrerende aanbiedingen hebben.

🔗 Stable Audio 3.0 — nieuwe tools


Kort nieuws

  • De Hugging Face Hub passeert 3 miljoen modellen — nieuwe mijlpaal voor het toonaangevende communityplatform voor open modellen. 🔗 Tweet
  • Sakana Namazu beschikbaar op OpenRouter en Vercel AI Gateway — het model achter Sakana Chat, gespecialiseerd in Japans en zakelijke context, wordt toegankelijk op deze twee distributieplatforms. 🔗 Tweet
  • Ai2 geeft MolmoMotion alvast een voorproefje vóór het webinar van 20 augustus — uitbreiding van Molmo voor het voorspellen van 3D-trajecten op basis van instructies in natuurlijke taal, open gewichten en gegevens worden later verwacht. 🔗 Tweet
  • Together AI: de adoptie van open modellen versnelt — een Brex-studie aangehaald door Together AI toont aan dat 14 van de 25 snelst groeiende softwareleveranciers AI aanbieden; het gebruik van tokens op Together steeg in een jaar van 30 miljard per maand naar 400 000 miljard. 🔗 Tweet
  • Josh Woodward licht de roadmap van de Gemini-app toe — vernieuwde Workspace-tools in testfase, verbeterd tool calling met Gemini 3.7 Flash, nieuwe Projects-interface en nu 49 ondersteunde connectors. 🔗 Tweet
  • HeyGen lanceert Brand Kits — vooraf geconfigureerde lettertypes, logo, hexcodes en uitspraakglossarium zodat elke gegenereerde avatarvideo in lijn blijft met de huisstijl, zonder nabewerking. 🔗 Tweet
  • NVIDIA bouwt TensorRT Model Connect met Codex-agents — een previewtool voor het converteren van Hugging Face-modellen naar TensorRT, volledig ontwikkeld met Codex-agents onder menselijke supervisie, open source-project. 🔗 Tweet
  • Cohere — Aidan Gomez over digitale soevereiniteit — de CEO waarschuwt voor de concentratie van de wereldwijde technologiesector rond enkele spelers en pleit ervoor om elk enkelvoudig faalpunt te vermijden. 🔗 Tweet

Wat dit betekent

AI-governance wordt nu vertaald naar concrete maatregelen in plaats van principes. De pauze van twee weken bij OpenAI rond de cybercapaciteiten van Astra, het initiatief van 5 miljoen dollar om democratische controle in de nationale veiligheid te versterken, en de aangescherpte bescherming van ChatGPT for Teens vormen één beweging: laboratoria documenteren publiekelijk de drempels die ze zichzelf opleggen, met verifieerbare cijfers (20 % extra rekenkosten, waarschuwing binnen 30 minuten) in plaats van louter intentieverklaringen.

De agentische infrastructuur wordt zelf een volwaardig product. Warp Factories biedt een laag voor governance en ROI-meting voor enterprise-codeeragents, Claude Code breidt zijn bereik uit naar interface-ontwerp met /design, en Amp voegt een spraaklaag toe aan zijn Puck-agent terwijl Warp zijn agents openstelt voor actieve SSH-sessies. In alle vier de gevallen gaat het verder dan codegeneratie: het doel is agents directe toegang te geven tot complete workflows, met ingebouwde governance en menselijke controle.

De openheid van gewichten en gegevens blijft wetenschappelijke waarde opleveren die propriëtaire modellen niet kunnen bieden. De ontdekking van Ai2 over de morfologische snelkoppeling van LLM’s in de farmacologie was alleen mogelijk omdat Olmo 3 zijn trainingsgegevens blootlegt; het IBM Research-artikel over agentisch geheugen kwantificeert modelspecifieke winsten (gpt-oss-120b, DeepSeek-V3.2, GLM-5) dankzij reproduceerbare tests; en de grens van 3 miljoen modellen op de Hugging Face Hub illustreert de schaal van dit open ecosysteem.

De kosten van inferentie blijven productkeuzes meer sturen dan brute performance. Tegenover GPT-5.6 Sol en Claude Fable 5 verliest DeepSeek V4 Pro op pass@1, maar wint het ruimschoots op prijs-kwaliteitverhouding, en een simpele « Pro-first » cascade dicht het grootste deel van de nauwkeurigheidskloof tegen een fractie van de kosten. Together AI drijft deze logica door tot in de infrastructuur zelf met A/B-testing op endpoint-niveau — modelvergelijking in productie wordt een platformfunctie, meer dan een kwestie van applicatiecode.


Bronnen