Zoeken

Gemini 3.8 Flash op het niveau van topmodellen voor een derde van de prijs, Muse Spark 1.3 bij Meta, Qwen3.8-Max-0902 bovenaan in Code Arena WebDev

ai-powered-markdown-translator

Artikel vertaald van het Frans naar het Nederlands met gpt-5.6-sol.

Bekijk project op GitHub ↗

Negenenveertig aankondigingen voor 2 september, het op twee na hoogste aantal sinds het begin van deze monitoring. Drie toonaangevende modellen verschenen op dezelfde dag — Gemini 3.8 Flash van Google, Muse Spark 1.3 van Meta Superintelligence Labs en Qwen3.8-Max-0902 van Alibaba — en geen van de drie legde de nadruk op de wedloop om ruwe scores.

Vier trends lopen door deze editie heen. Allereerst de prijs, die bij alle drie de lanceringen het centrale argument is geworden. Vervolgens lokale inference, waarbij videogeneratie naar een desktopcomputer komt en de code van een inference-engine voor Apple Silicon diezelfde avond wordt opengesteld. Daarnaast modelgovernance in ondernemingen, waarbij GitHub voor één model gegevensbewaring oplegt en voor alle andere de standaardinstelling laat kiezen. En tot slot cybersecurity, met een speciaal model dat is voorbehouden aan geselecteerde verdedigers en een alliantie die zich bij de Linux Foundation aansluit.


Gemini 3.8 Flash en 3.8 Flash Cyber, een model dat harder werkt voor hetzelfde tarief

2 september — Google presenteerde twee modellen van Tulsee Doshi (Senior Director, Product Management) en Raluca Ada Popa (Gemini Security Lead, Google DeepMind): Gemini 3.8 Flash en Gemini 3.8 Flash Cyber. Dit is de derde Flash-release in zes weken, terwijl 3.7 Flash pas drie weken bestond.

Beide varianten delen dezelfde basisintelligentie en Google schrijft een deel van de vooruitgang op het gebied van code en redeneren expliciet toe aan intensieve training binnen het cybersecuritydomein: het werk aan het defensieve model heeft het algemene model naar een hoger niveau getild. Het introductietarief blijft ongewijzigd ten opzichte van 3.7 Flash.

Kenmerk van Gemini 3.8 FlashGemeten waarde
Invoerprijs0,75 dollar per miljoen tokens
Uitvoerprijs3,75 dollar per miljoen tokens
HLE-Verified54,9 %

Eén punt verdient de aandacht van ontwikkelaars, want Google formuleert het zonder omwegen: het model verbruikt meer. De hogere betrouwbaarheid komt voort uit een ontwerpkeuze — bij complexe taken voert 3.8 Flash extra redeneerstappen uit en roept het iteratief tools aan. Bij hoge effort-niveaus loopt het tokenverbruik dus op en Google raadt aan het effort-niveau te verlagen of bij 3.7 Flash te blijven voor workloads waarbij rekenefficiëntie vooropstaat. De vorige versie blijft volledig ondersteund.

De Cyber-variant is het ongebruikelijkst. Deze is via het op dezelfde dag gelanceerde Fairwind-programma voorbehouden aan vertrouwde verdedigers en richt zich op de autonome ontdekking van kwetsbaarheden en vooral op de automatische correctie ervan.

CybersecuritytestGemini 3.8 Flash CyberVergelijkingspunten
CyberGym Pass@1 (C/C++-lekken ontdekken)86,2 %GPT-5.5-Cyber 85,6 % · Mythos 5 83,8 % · GPT-5.6 Sol 83,6 % · 3.5 Flash Cyber 77,5 %
Interne benchmark voor 20 programmeertalenmeer dan 70 %Breder bereik dan alleen C/C++
CWE-Bench pass@1 (correctie, Collinear)47,2 %Toonaangevend frontier-model met 47,8 %, maar tegen aanzienlijk hogere kosten

De interne implementatiecijfers ondersteunen eerder de positionering op het gebied van prijs-prestatie dan een absolute dominantie: het Chrome Security-team behaalt 2,6 keer zoveel geldige correcties als met de beste, veel grotere commerciële modellen, Wiz meet op zijn pentestbenchmark een recall die 7,5 tot 9,7 % hoger ligt tegen 2,3 tot 5,2 keer lagere kosten en het Cloud Vulnerability Research-team identificeerde in minder dan twee uur een kritieke fundamentele kwetsbaarheid, terwijl dit soort onderzoek doorgaans maanden vergt. Het algemene model is inmiddels al beschikbaar in Antigravity, de Gemini API via Google AI Studio en Android Studio, de interfacegeneratie van Stitch, Gemini Enterprise en voor Google AI Pro- en Ultra-abonnees in de Gemini-app, AI Mode van Google Search en Google Sheets.

🔗 Aankondiging van Gemini 3.8 Flash en 3.8 Flash Cyber

De CursorBench-score die de lancering documenteert

Cursor voegde Gemini 3.8 Flash enkele uren na de presentatie toe aan zijn modelkiezer en zijn eigen benchmark levert de beste beschikbare meting van de prestaties van het model onder agentische omstandigheden. Het logboek van CursorBench, gedateerd op dezelfde dag, vermeldt dat 3.8 Flash is gepromoveerd tot de Gemini-versie ‘Latest’ en dat 3.7 Flash naar een secundaire positie is verplaatst.

Model en effort-niveauCursorBench 3.2-scoreGemiddelde kosten per taakStappen per taak
Fable 5.1 Max73,4 %9,64 dollar70
Grok 4.6 Extra High70,8 %2,81 dollar46
Fable 5.1 High69,4 %4,80 dollar44
Opus 5 Extra High69,3 %7,35 dollar72
Gemini 3.8 Flash High69,2 %2,38 dollar161
Gemini 3.8 Flash Medium67,0 %1,93 dollar136
Gemini 3.7 Flash High61,6 %1,20 dollar99

De essentie is in één oogopslag duidelijk: met 69,2 % behaalt Gemini 3.8 Flash High een score die gelijkwaardig is aan Fable 5.1 High voor ongeveer de helft van de prijs, en aan Opus 5 Extra High voor een derde. Het verschil met de vorige generatie bedraagt 7,6 punten. De kolom met stappen herinnert echter aan de verborgen kosten van Googles ontwerpkeuze: 161 stappen per taak, tegenover 44 voor Fable 5.1 High. Cursor maakt onderaan de pagina zelf twee kanttekeningen — de resultaten vertonen variatie en de weergegeven kosten zijn gereconstrueerd op basis van de openbare tarieven per miljoen tokens, niet gemeten aan de hand van facturen.

🔗 Gemini 3.8 Flash in Cursor · 🔗 CursorBench-resultaten


Muse Spark 1.3, het agentische model van Meta Superintelligence Labs

2 september — Meta Superintelligence Labs bracht Muse Spark 1.3 uit, de opvolger van Muse Spark 1.2, die dezelfde dag werd geïmplementeerd in Muse Code en in de Meta Model API, toegankelijk via dev.meta.ai. Dit is de tweede release van het lab in twee dagen, na Muse Voice Transcribe.

De geclaimde invalshoek is niet de wedloop om scores, maar de praktische bruikbaarheid. Het model is ontworpen om langdurige werkzaamheden vol te houden door binnen één thread meerdere stromen te combineren: bij een open doel gebruikt het tools om uit ongeordende en tegenstrijdige bronnen zijn eigen context op te bouwen, vult het tekortkomingen in zijn plan aan en houdt het bij wat het heeft geleerd. Het ongebruikelijkste aspect betreft de samenwerking: Muse Spark 1.3 is getraind om verduidelijkende vragen te stellen wanneer een instructie dubbelzinnig is, de gebruiker om hulp te vragen wanneer het vastloopt en om bevestiging te vragen voordat het een actie met gevolgen uitvoert. Vergelijkingen door Meta-engineers wijzen op ongeveer 20 % minder toolaanroepen en 25 % minder tokens dan bij versie 1.2 — een verschil dat rechtstreeks zichtbaar is op de factuur.

Beoordeelde categorieBenchmarkMuse Spark 1.3Muse Spark 1.2GPT-5.6 SolOpus 5
AgentGDPVal-AA v2 (kenniswerk)1754161517101824
AgentOSWorld 2.0 (agentisch desktopgebruik)66,947,662,768,3
AgentDeepSearchQA (agentisch browsen)89,485,993,090,4
AgentAutomationBench (end-to-end-bedrijfsworkflow)49,438,246,750,3
Lange contextMRCR 512K-1M98,155,573,8
CoderenDeepSWE v1.1 (langdurig agentisch coderen)75,455,073,074,0
CoderenSWEAtlas CodeBase QnA59,446,253,552,7

Deze tabel verdient een aandachtige lezing. Muse Spark 1.3 domineert duidelijk bij lange context en coderen, maar Opus 5 presteert beter op de vier agentische tests die hier zijn opgenomen. Belangrijker nog: de vergelijking vond niet onder gelijke omstandigheden plaats, en dat blijkt uit de door Meta gepubliceerde methodologie: Muse Spark 1.3 en 1.2 werden beoordeeld op effort-niveau xhigh, terwijl Claude Opus 5 en GPT-5.6 Sol in max-modus werden getest. Er is slechts één uitzondering, DeepSWE v1.1, waar Muse Spark 1.3 in max werd gemeten — precies de modus die nog niet beschikbaar is en die volgens Meta wordt ingevoerd zodra de aanvullende veiligheidstests zijn afgerond.

Eén alinea uit de roadmap trekt de aandacht van het open ecosysteem.

Stay tuned for more updates soon, including bigger models, Muse Spark open weights, and more.

🇳🇱 Blijf op de hoogte voor binnenkort meer nieuws, waaronder grotere modellen, de open gewichten van Muse Spark en meer.@AIatMeta op X

Na een jaar waarin Meta het aantal releases met open gewichten duidelijk terugschroefde, is deze toezegging opmerkelijk — het blijft afwachten om welke versie het zal gaan, want er zijn geen datum of reikwijdte bekendgemaakt.

🔗 Introductie van Muse Spark 1.3


Qwen3.8-Max-0902 neemt de eerste plaats in Code Arena WebDev in

2 september — Qwen bracht een update van zijn vlaggenschipmodel uit: Qwen3.8-Max-0902, een gedateerde snapshot die ook reageert op de alias qwen3.8-max-2026-09-02. Het model behoudt de structurele kenmerken van de augustusversie — 2.400 miljard parameters en een contextvenster van 1 miljoen tokens — maar heeft een extra post-trainingfase ondergaan die is gericht op ‘Coding & Cowork’.

ModelkenmerkGepubliceerde waarde
Parameters2,4 T
Contextvenster1 M tokens
Maximale invoer991 K tokens (983 K in thinking-modus)
Maximale uitvoer131 K tokens
Redeneerbudget262 K tokens
Invoer- en uitvoerprijs2 dollar en 6 dollar per miljoen tokens
Expliciete cachelezing0,17 dollar per miljoen tokens
Impliciete cachelezing0,25 dollar per miljoen tokens
Expliciete cachecreatie2,50 dollar per miljoen tokens
Doorvoerlimieten1 M tokens per minuut, 15 K verzoeken per minuut

Het model accepteert afbeeldingen, tekst en video als invoer en biedt via de Responses API vijf geïntegreerde tools: code-interpreter, zoeken van afbeelding naar afbeelding, zoeken van tekst naar afbeelding, webextractor en zoeken op het web. Het is vanaf dezelfde dag via de API beschikbaar op QwenCloud.

Diezelfde dag publiceerde Arena.ai zijn resultaten voor Code Arena WebDev. Qwen3.8-Max-0902 komt daar rechtstreeks binnen op de eerste plaats van het algemene klassement met 1.691 punten, 22 punten meer dan de vorige versie, 3 punten voor Claude Opus 5 met de Max-instelling en 17 punten voor Kimi K3 met de Max-instelling. Bij een gemengde prijs van 5 dollar per miljoen tokens neemt het model de hoogst gewaardeerde positie aan Arena’s Pareto-frontier in, oftewel de beste verhouding tussen score en kosten van het hele klassement.

De uitsplitsing per categorie nuanceert het beeld: eerste in Data & Analytics en Consumer Product, tweede in Brand & Marketing, Gaming en Simulations, derde in Content Creation Tools en Reference-Based Design. De kracht van het model ligt dus meer bij data-applicaties en consumentenproducten dan bij overwegend creatieve taken. Arena kondigt aan dat Agent Arena-scores nog volgen.

🔗 Aankondiging van Qwen3.8-Max-0902


Inferentie verlaat de cloud: video op een bureau, een lokale engine met een open licentie

Dit is de onderstroom van de dag, en die laat zich niet vangen in één afzonderlijke aankondiging. Twee grote publicaties en vier subtielere signalen wijzen in dezelfde richting: lokaal uitvoeren wat gisteren nog een GPU in een datacenter vereiste.

2 september — Het FastVideo-team van het Hao AI Lab (UCSD) heeft de lokale port van FastH3 uitgebracht, zijn gedistilleerde versie van het open videomodel MiniMax H3. Het gezamenlijk genereren van video en audio vereiste tot nu toe een GPU in een datacenter; het model draait nu op één NVIDIA DGX Spark, twee via een QSFP-link verbonden DGX Sparks, of een Mac met Apple Silicon en minstens 36 GB unified memory.

De voornaamste beperking is niet de rekenkracht, maar het geheugen. De DGX Spark beschikt over 128 GB unified LPDDR5X met ongeveer 270 GB/s, circa een tiende van de bandbreedte van HBM in een datacenter, waarvan daadwerkelijk 121 GB beschikbaar is voor een workload. De pipeline werkt daarom in fasen: de prompt encoderen, de tekstencoder vrijgeven, de transformer laden, denoisen, deze vrijgeven en vervolgens de VAE laden. Op een discrete GPU maakt het terugkopiëren van de weights naar de host het device-geheugen vrij; op Spark komt die kopie opnieuw in dezelfde pool terecht. Het team heeft dit vervangen door de DiT rechtstreeks op de GPU te laden — de laadtijd van de transformer daalt van 445 s naar 39 s en een run van 768×1344 over 124 frames van 772 s naar 336 s.

TestmachineEerste generatieHerhaalde generatie
Apple M4 Max504 s465 s
DGX Spark264 s243 s
4x GB20010,2 s5,1 s

Vergeleken met het openbare vLLM-Omni-recept voor DGX Spark, dat 1.881 s nodig heeft voor vijf seconden video in 1024×576 met 50 stappen, komt FastH3 met vier stappen uit op 268 s, oftewel ongeveer 7x; de verhouding stijgt tot 8,4x bij 832×480 en daalt weer tot 7,9x bij 1344×768. Op M4 Max daalt het encoderen van een niet-gecachete prompt van ongeveer 80 s naar ongeveer 17 s, en de TAEH3-decoder brengt de decodeertijd terug van 102 s naar 1 s, terwijl het piekgeheugen van 11,0 naar 3,6 GiB daalt. De MLX-weights zijn in INT8, INT6 en INT4 gepubliceerd op Hugging Face, samen met het voor het eerst gepubliceerde FastVideo Cookbook. Het volgende aangekondigde doel: de RTX-familie, waaronder de 5090 en 4090.

Diezelfde avond heeft Perplexity de broncode van Lily vrijgegeven, de lokale inferentie-engine die het on-device-gedeelte van zijn hybride berekeningen op de Mac uitvoert. De engine was een dag eerder gepresenteerd in een onderzoeksblog; het nieuwe feit is de publicatie van de code onder de Apache-2.0-licentie in de repository perplexityai/pplx-garden, waar deze zich bij fabric-lib en pplx-unigram voegt.

De code bevestigt een keuze voor extreme specialisatie. Lily is geen generieke engine: hij laadt slechts één checkpoint, Qwen3.6-35B-A3B, affine gekwantiseerd naar 4 bits in MLX-formaat met een groepsgrootte van 64, die tijdens het laden wordt gecontroleerd. Dense Qwen-checkpoints, kleinere varianten, BF16, GGUF, AWQ, GPTQ, int8 en fp8 worden expliciet geweigerd. Lily is geschreven in Rust met Metal-kernels die bij het opstarten vanuit de broncode worden gecompileerd, gebruikt noch PyTorch noch MLX in zijn uitvoeringspad en vereist een Apple GPU van familie 10 of later — een M5 of nieuwer — met minimaal macOS 26. Ook het API-oppervlak is sterk beperkt: slechts drie routes, altijd greedy decoding, waarbij samplingparameters, streaming, tools en multimodale content worden geweigerd in plaats van genegeerd. Juist die beperkte opzet is interessant: Perplexity levert geen concurrent voor MLX-LM, maar toont aan dat een engine die op maat is gemaakt voor een bepaald platform en model beter presteert dan een generiek framework.

Vier andere publicaties van die dag wijzen in dezelfde richting en worden behandeld in de Korte berichten: TranslatePsy-Nano, vertaalmodellen van 17 tot 42 MB voor zeventien talen; het werk van i64 Systems rond experts van een MoE-model die op NVMe staan zonder ook maar één byte van de uitvoer te veranderen; het artikel van Cohere dat pleit voor de juiste dimensionering van kleine modellen in ondernemingen; en de DGX Spark-livestream van NVIDIA over het lokaal uitvoeren van Perplexity’s Portable Computer. Afzonderlijk leggen ze weinig gewicht in de schaal, maar samen verplaatsen ze de berekeningen van het datacenter naar het apparaat.

🔗 FastH3 lokaal · 🔗 Vrijgave van de broncode van Lily · 🔗 pplx-garden-repository


Anthropic stelt de broncode van Claude Commerce Agents open

2 september — Anthropic heeft Claude Commerce Agents als open source gepubliceerd, een referentierepository onder de Apache 2.0-licentie voor het bouwen van commerce agents. De aankondiging komt bewust vóór de feestdagenperiode, wanneer e-commerceteams hun implementaties plannen.

De blueprint bevat twee complete agents. De shopping agent bevindt zich in de applicatie van het bedrijf: hij doorzoekt de catalogus, stelt een verzameling artikelen samen voor een verzoek in natuurlijke taal, onthoudt de voorkeuren van de klant, toont producten, vergelijkingen en het winkelmandje in het gesprek, draagt het vervolgens over aan de checkout — en beantwoordt vragen van de klantenservice in dezelfde thread. De merchant agent is bedoeld voor de teams die de winkel draaiende houden: verkoopanalyse, waarschuwingen voor een artikel dat vóór een promotie uitverkocht dreigt te raken, prijsaanbevelingen op basis van historische gegevens en het opstellen van campagnes.

Onderdeel van de repositoryGeleverde inhoud
Geleverde agentsShopping agent (klant) en merchant agent (backoffice)
Uitvoerbare verticalsRetail, reizen, telecom, ticketverkoop
RuntimesMessages API, Claude Agent SDK, Claude Managed Agents (beta)
ImplementatieplatformsClaude API, Amazon Bedrock, Microsoft Foundry, Google Cloud Vertex AI
Claude Code-plugincommerce-builder@claude-commerce-agents
Technische vereistenPython 3.11 of hoger, Node 22
Reeds waargenomen resultatenBij retailers die shopping agents op Claude gebruiken: winkelmandjes tot 35% groter, kopers 60% meer geneigd om hun aankoop af te ronden

De scheiding tussen wat het model beslist en wat daadwerkelijk wordt uitgevoerd, is structureel en niet alleen declaratief. Aan de consumentenkant bevat de backend-interface die door de agent wordt aangeroepen eenvoudigweg geen betaalmethode. Aan de merchantkant levert elke schrijftool een in behandeling gestelde wijziging op met een server-side gegenereerde identifier, en de functie apply_change slaagt alleen voor identifiers die via een daadwerkelijk menselijke validatie-interface zijn goedgekeurd. Anthropic benadrukt dat dit een niet-onderhouden referentie-implementatie is die geen bijdragen accepteert: een startpunt om te forken, geen dependency om te volgen. Alle bedrijven in de demo’s zijn fictief en er worden geen bestellingen geplaatst of kaarten belast.

🔗 Aankondiging van Claude Commerce Agents · 🔗 commerce-agents-repository

Het technische deel: cache, latency en guardrails in code

De engineeringgids die bij de blueprint hoort, is op dezelfde dag gepubliceerd, ondertekend door Ali Shazal en Matthew Koen, en vat een jaar werk met retailers, marktplaatsen en spelers uit de reisbranche samen. Het eerste advies gaat tegen de intuïtie in: maak voor een agent die veel categorieën moet bestrijken niet per domein een subagent. Een commerce-gesprek is één sterk gekoppelde sessie en opsplitsing verslechtert de kwaliteit — de mogelijkheden komen van skills, niet van het vermenigvuldigen van agents.

Behandeld onderwerpDoor Anthropic opgegeven cijfer
Gerenderd commerce-antwoord500 tot 700 outputtokens
Lezen van gecachete tokensEen tiende van de kosten van nieuwe tokens
Cache schrijvenOpslag van ongeveer 1,25x, terugverdiend bij het tweede gebruik
Na te streven cachehitpercentage90 tot 99%
Snelheid van lezen uit de cache1,5 tot 2x sneller rond 100.000 tokens
Winst door geheugen13% meer feitelijke recall op de interne evaluatiesuite
Evaluatiegevallen per flow50 tot 100 om mee te beginnen

Voor de modelkeuze luidt de aanbeveling om te beginnen met Opus voor merchant agents, waarbij analyse domineert, en met Sonnet voor consumer agents, waarbij latency zwaarder weegt — en vervolgens de volledige evaluatiesuite uit te voeren voor elk model en elk effortniveau, waarbij de kosten per voltooide taak worden gemeten in plaats van per modelaanroep. De sectie over veiligheid laat niets aan duidelijkheid te wensen over.

The prompt is where safe behavior starts, but in commerce it can’t be where safety is enforced. The failures are financial and often irreversible, and a prompt rule is one injection or one bad sample away from being skipped.

🇳🇱 De prompt is waar veilig gedrag begint, maar in commerce kan dit niet de plek zijn waar veiligheid wordt afgedwongen. Fouten hebben financiële gevolgen en zijn vaak onomkeerbaar, en een promptregel kan met slechts één injectie of een ongunstige sample worden omzeild.Anthropic, Een gids voor de anatomie van effectieve commerce agents

Vier regels worden daarom in code afgedwongen, één keer gedefinieerd zodat ze door de drie runtimes kunnen worden gedeeld: het model bereidt voor, maar een persoon of policy voert uit; schrijf- en renderbewerkingen accepteren alleen identifiers die door de server zijn uitgegeven; transactielimieten moeten bestand zijn tegen herhaalde verzoeken; content van derden wordt opgeschoond.


Computerbesturing draait op de achtergrond in Claude Code en Claude Cowork

2 september — Computerbesturing (computer use) door Claude neemt niet langer het scherm over. Tot nu toe betekende het starten van zo’n taak dat je je machine moest afstaan: de andere vensters werden verborgen terwijl Claude in de goedgekeurde applicatie werkte. Voortaan gaat de taak zowel in Claude Cowork als in het tabblad Code van de desktopapplicatie op de achtergrond door, terwijl je met iets anders verdergaat.

De wijziging bevindt zich in beta, is voorbehouden aan Pro- en Max-abonnementen en beperkt tot macOS — terwijl computer use zelf als research preview beschikbaar blijft op macOS en Windows. Wie de functie al gebruikte, hoeft niets te activeren; anderen vinden haar in Settings > General, waarbij macOS ook de systeemmachtigingen Toegankelijkheid en Schermopname vereist.

Het beveiligingskader verandert niet. In tegenstelling tot de Bash-tool, die in een sandbox draait, wordt computer use op de echte desktop uitgevoerd. De toegangsniveaus blijven per applicatiecategorie vastgelegd en kunnen niet worden gewijzigd: alleen-weergeven voor browsers en tradingplatforms, alleen-klikken voor terminals en IDE’s — zodat Claude naar de specifieke tool wordt geleid in plaats van naar schermbesturing — en volledige controle voor de rest. Een goedkeuring geldt voor de huidige sessie, of voor dertig minuten binnen een sessie die vanuit Dispatch is gestart.

🔗 Aankondiging van computer use op de achtergrond


Cursor laat zijn cloud agents draaien op door de klant beheerde machines

2 september — Cursor heeft een door Jack Pertschuk ondertekend productartikel gepubliceerd waarmee zijn cloud agents worden opengesteld voor infrastructuur die eigendom is van de klant. Tot nu toe draaide een Cursor cloud agent op een toegewezen virtuele machine in de cloud van de leverancier. Met Self-Hosted Machines verschuift de uitvoering van tools naar machines binnen het netwerk van de onderneming, terwijl de agentloop, inferentie en planning bij Cursor blijven.

Het cijfer dat deze stap rechtvaardigt, wordt meteen genoemd: cloud agents produceren inmiddels meer dan 60% van de pull requests die Cursor intern merget. Wanneer een groeiend deel van het werk via deze agents verloopt, is de machine waarop ze worden uitgevoerd niet langer een detail. De leverancier noemt drie situaties die een team naar eigen machines drijven: tools uitvoeren in direct contact met het versiebeheersysteem en interne diensten, beschikken over specifieke hardware zoals GPU’s of Macs voor iOS-ontwikkeling, of een besturingssysteem gebruiken dat moeilijk in een cloud-agentimage te verpakken is.

Aspect van het systeemTechnisch detail
Registratiecommandoagent worker start, langdurige uitgaande HTTPS-verbinding
Richting van de verbindingCursor initieert nooit een inkomende verbinding naar het netwerk van de klant
Beschikbare configuratiesMy Machines (individuele werkplek of VM) en Pools (gedeelde teamqueue)
Hervatten na inactiviteitHibernation via snapshot, herstel met dezelfde workeridentifier
SandboxprovidersAWS Lambda, Cloudflare, Coder, Daytona, E2B, Modal, Namespace, Vercel
ComputerbesturingLinux wordt nu ondersteund, naast Macs, via Chrome of Chromium

Pools schalen op via een controller die de requestqueue bewaakt en machines start met een door het team aangeleverd script; als er geen worker beschikbaar is, wacht het verzoek. Voor het tussengeval tussen een machine resetten en haar ingeschakeld houden, die beide kostbaar zijn, introduceert Cursor hibernation: er wordt een snapshot van de inactieve machine gemaakt, waarna deze wordt uitgeschakeld; als binnen het reconnectievenster een nieuwe start plaatsvindt, wordt de snapshot hersteld. Omdat een pool niet aan een repository is gekoppeld, kan dezelfde queue meerdere repositories bedienen.

Er is één voorbehoud, dat het artikel zelf noemt: alleen de uitvoeringsomgeving wordt verplaatst. Tooloutputs worden voor inferentie teruggestuurd naar Cursor en kunnen code bevatten, en agenttranscripties kunnen daar worden verwerkt en opgeslagen. Dit is dus geen volledige isolatie, maar een verplaatsing van de plaats van uitvoering.

🔗 Self-Hosted Machines


Claude Fable 5.1 wordt algemeen beschikbaar bij integrators

1 en 2 september — Op de dag van de release werd Claude Fable 5.1 algemeen beschikbaar in GitHub Copilot; de volgende dag integreerde Genspark het in zijn Code Agent en Claw. Twee integrators in twee dagen, voor hetzelfde model: dit is een adoptiegolf, geen twee losstaande nieuwsberichten.

Bij GitHub is de dekking breed — Visual Studio Code, Visual Studio, Copilot CLI, de coding agent, de GitHub Copilot-app, github.com, GitHub Mobile op iOS en Android, de JetBrains-IDE’s, Xcode en Eclipse — voor de abonnementen Pro+, Max, Business en Enterprise, met een geleidelijke uitrol en facturering tegen het openbare tarief van de leverancier. Maar het opvallendste aspect van deze beschikbaarstelling is niet technisch, maar contractueel.

ToegangsvoorwaardeWat van toepassing is op Fable 5.1
BeheerdersbeleidStandaard uitgeschakeld, moet expliciet worden ingeschakeld
GegevensbewaringStandaard verplicht, voor de veiligheidsclassificatoren van Anthropic
Gebruik van bewaarde gegevensGeen training van de modellen van Anthropic
Andere Claude-modellenNulretentie blijft behouden, behalve voor Fable 5 en Fable 5.1
Vrijstelling van nulretentieIn aanmerking komende bedrijven, tot het einde van het kalenderjaar
Na de vrijstellingEnterprise Frontier Safeguards vereist

In tegenstelling tot de andere Claude-modellen van Copilot vereist Fable 5.1 standaard gegevensbewaring: Anthropic bewaart prompts en uitvoer om zijn veiligheidsclassificatoren te laten werken. Het inschakelen van het beleid geldt dus als expliciete aanvaarding van deze beperking, en als het uitgeschakeld blijft, is het model simpelweg niet beschikbaar. De uitweg is tijdelijk en selectief: in aanmerking komende bedrijven kunnen tot het einde van het kalenderjaar nulretentie behouden, terwijl Anthropic zijn Enterprise Frontier Safeguards uitrolt, die geautomatiseerd veiligheidstoezicht en door de klant beheerde opslag- en encryptiesleutels moeten bieden. Deelname kan niet via selfservice worden verkregen: ze verloopt via het verkoopteam van GitHub, dat niet door support kan worden omzeild, en zelfs na goedkeuring wordt niets automatisch geactiveerd.

Genspark claimt op zijn beurt een integratie vanaf de eerste dag in Genspark Code Agent en Claw, zonder benchmark of prijsdetails. De uitgever voegt zich bij de lijst van agentplatforms die binnen enkele uren na de release van het model zijn overgestapt, naast Cursor, Devin, Warp, v0, Amp en Perplexity Computer.

🔗 Fable 5.1 in GitHub Copilot · 🔗 Aankondiging van Genspark


GitHub legt uit hoe het Copilot goedkoper maakte zonder kwaliteitsverlies

2 september — GitHub publiceerde een technisch artikel van Erik Kristensen, samen met Napalys Klicius, over het verlagen van de kosten van Copilot. De tekst is ongebruikelijk voor dit soort artikelen: hij bevat cijfers, beschrijft mislukte experimenten en legt uit waarom een voor de hand liggende optimalisatie averechts kan uitpakken.

De openingstelling is contra-intuïtief. Het tellen van de tokens van één afzonderlijke interactie meet de efficiëntie niet: een beknopt antwoord van een tool dat informatie weglaat die de agent nodig heeft, dwingt hem de opdracht opnieuw uit te voeren, waardoor de taak uiteindelijk trager en duurder wordt. GitHub illustreert deze valkuil met RTK (Rust Token Killer), een hulpprogramma dat shell-uitvoer vóór het lezen inkort. Het verkortte sommige antwoorden inderdaad, maar de daaropvolgende herstelstappen voegden beurten toe: lokaal bespaarde tokens werden globaal weer uitgegeven. Het werd niet uitgerold.

Geëvalueerde wijzigingGemeten winst
Verwijdering van regelnummers, in offline testsOngeveer 5% lagere inferentiekosten
Verwijdering van regelnummers, in productie op de CLIOngeveer 3% lagere gemiddelde dagelijkse kosten per gebruiker
Compressie van de prompt van de tool task1.300 tokens per beurt verwijderd, 2,9% lagere genormaliseerde kosten per actief uur
Rechtstreekse levering van voltooid achtergrondwerkOngeveer 2,3% minder tokengerelateerd gebruik, gemeten in AI Credits
Regelnummers en compressie bij Copilot code reviewOngeveer 5% minder prompttokens per review, voor elk van beide
Eerdere migratie naar gedeelde bestandstoolsOngeveer 20% lagere reviewkosten
RTK (Rust Token Killer)Afgewezen, hogere totale kosten in de geteste configuratie

Het gekozen compressiebeleid is bewust conservatief en bestaat uit drie onderdelen: uitvoer die op broncode lijkt intact houden, zoekresultaten herschikken zonder iets te verwijderen, en alleen repetitieve ruis van installatie-, build- en testprocessen comprimeren. Compressie van git diff maakte deel uit van de eerste versies; die werd verwijderd nadat benchmarktaken lieten zien dat agents de oorspronkelijke uitvoer opnieuw openden.

De leerzaamste episode betreft promptcompressie. Een meta-prompting-lus, waarbij Copilot zijn eigen instructie iteratief herschrijft, halveerde de prompt van de tool task — maar het eerste online experiment bracht een regressie aan het licht die de offline evaluaties hadden gemist: de lus had een voorzichtige instructie over parallellisme omgezet in een strikte ordeningsregel, waardoor onafhankelijke agents serieel werden uitgevoerd. De oplossing verving witte en zwarte lijsten door één zin die de beslissing aan het model overliet. De laatste en nuttigste les: verbeteringen zijn niet overdraagbaar van het ene product naar het andere. Een compactere reeks instructies, geïnspireerd op de goede resultaten bij Copilot code review, liet de kosten voor Copilot CLI juist stijgen.

None of these changes made the model smarter. They removed work the model never needed to do.

🇳🇱 Geen van deze wijzigingen heeft het model intelligenter gemaakt. Ze hebben werk weggenomen dat het model nooit had hoeven doen.GitHub Blog, Hoe we AI-coding kostenefficiënter maken


De modellencatalogus van Copilot wordt opnieuw samengesteld

1 en 2 september — Twee changelogs uit dezelfde periode beschrijven de twee kanten van dezelfde herschikking: wat uit de Copilot-catalogus verdwijnt en wie voortaan het standaardmodel bepaalt.

Zes modellen zijn per 1 september uitgefaseerd in de meeste Copilot-ervaringen — Copilot Chat, online bewerkingen, ask- en agent-modi en codeaanvullingen.

Verwijderd modelDoor GitHub voorgesteld alternatief
Gemini 3.1 ProGemini 3.7 Flash
Claude Opus 4.5Claude Opus 4.7, Claude Opus 4.8 of Claude Opus 5
Claude Opus 4.6Claude Opus 4.7, Claude Opus 4.8 of Claude Opus 5
Claude Sonnet 4.5Claude Sonnet 5
Claude Sonnet 4.6Claude Sonnet 5
Raptor MiniMAI-Code-1.1-Flash

Er blijft één uitzondering bestaan: Claude Sonnet 4.6 blijft toegankelijk voor individuele abonnees met een jaarabonnement. Gebruikers hoeven niets te doen, maar Copilot Enterprise-beheerders moeten de vervangende modellen mogelijk expliciet inschakelen in hun beleid; anders verschijnen ze niet in VS Code of op github.com.

Tegelijkertijd kunnen in bedrijven beheerde instellingen voortaan elk model als standaard voor nieuwe gesprekken instellen. De granulariteit gaat verder dan het bedrijfsniveau: door de sleutel model als overridable te declareren en de configuratiebestanden van teams in team-mappings.json te bewerken, kan een beheerder elk team zijn eigen standaard laten kiezen, terwijl gebruikers die daar niet onder vallen de algemene instelling overnemen. De functie is algemeen beschikbaar voor Copilot Business en Copilot Enterprise, in de GitHub Copilot-app, Copilot CLI en Visual Studio Code.

🔗 Uitgefaseerde modellen · 🔗 Standaardmodel voor bedrijven


Het Ship Log van augustus: Copilot in Slack en Teams, en media in de CLI

1 en 2 september — Het maandelijkse overzicht dat GitHub als X-artikel publiceerde, is een promotioneel stuk, maar het onthult een levering uit augustus die nog niet was gemeld: GitHub Copilot is nu toegankelijk vanuit Slack en Microsoft Teams. De integratie brengt de agentmogelijkheden van Copilot CLI en de GitHub Copilot-app naar teamgesprekken — door GitHub te vermelden kunnen wijzigingen worden gepland, problemen worden onderzocht of codingtaken worden doorgegeven zonder de thread te verlaten.

Onderdeel van het Ship Log van augustusWat er is geleverd
Copilot in Slack en Microsoft TeamsAgentmogelijkheden van Copilot CLI en de Copilot-app
Copilot code review, diepte BalancedAlgemeen beschikbaar, naast Lite, standaard instelbaar per organisatie of repository
Nieuwe modellen opnieuw genoemdGemini 3.7 Flash, MAI-Code-1.1-Flash, Kimi K3 gehost door Fireworks AI
Promotie voor GPT-5.6 SolHalve prijs tot en met 3 september
Promotie voor automatische selectie30% korting voor Copilot Max-gebruikers
GitHub Copilot Day10 september 2026

Het overzicht documenteert ook de diepte Balanced van Copilot code review, die naast Lite algemeen beschikbaar is geworden: Balanced is bedoeld voor een diepgaandere analyse van pull requests, Lite voor rechtstreekse wijzigingen, en de standaarddiepte kan op organisatie- of repositoryniveau worden ingesteld.

Een andere levering van die maand vult het beeld aan de commandoregelzijde aan: de herhaalbare flag --attach van GitHub CLI, beschikbaar sinds gh v2.99.0, uploadt een lokale afbeelding of video en verwijst er inline naar in een issue, pull request of opmerking. De flag werkt voor de zes opdrachten die Markdown schrijven, en de verwerking van bestaande Markdown maakt hem praktisch bruikbaar: een lokaal pad waarnaar al in de inhoud wordt verwezen, wordt ter plekke herschreven, zodat ![alt](./login.png) zijn alternatieve tekst behoudt en naar de geüploade asset verwijst. De alternatieve tekst wordt na een # in het pad opgegeven. Ondersteunde formaten: PNG, JPEG, GIF, WebP, SVG, MP4, MOV en WebM, met limieten van 10 MB voor afbeeldingen en 100 MB voor video bij betaalde abonnementen. GitHub Enterprise Server wordt in deze versie niet ondersteund. GitHub benadrukt expliciet dat coding agents deze mogelijkheid overnemen en voortaan een resultaat kunnen tonen in plaats van het te beschrijven.

🔗 Ship Log van augustus 2026 · 🔗 Media in GitHub CLI


Fairwind Program, Googles cyberverdediging voor vertrouwde verdedigers

2 september — Op dezelfde dag als Gemini 3.8 Flash Cyber lanceerde Google het Fairwind Program, het kanaal waarlangs dit model wordt verspreid. De redenering van Four Flynn, vicepresident beveiliging en privacy, vertrekt vanuit een concreet dilemma voor verdedigingsteams: massale frontier-modellen invoeren die duur en moeilijk beheersbaar zijn op codebases van bedrijven, of terugvallen op kleinere open-weight-modellen die moeite hebben met het verhelpen van complexe kwetsbaarheden.

Het antwoord combineert Gemini 3.8 Flash Cyber met CodeMender, Googles framework voor automatische oplossingen. Het centrale argument draait niet om detectie maar om herstel: zwakke plekken opsporen creëert bewustzijn en angst, terwijl ze automatisch vinden en verhelpen veiligheid oplevert. De belofte is om binnen enkele minuten in plaats van weken geverifieerde en implementeerbare correcties te genereren, binnen de beveiligde cloudomgeving van de klantorganisatie.

De toegang wordt bewust gefaseerd, met drie prioritaire kringen: overheden en nationale cyberautoriteiten, beheerders van kritieke infrastructuur in de gezondheidszorg, telecommunicatie, energie en financiële netwerken, en centrale technologieplatforms. Deelnemende organisaties aanvaarden strikte beperkingen — de toegang beperken tot interne teams voor cybersecurity, incidentrespons of penetratietests, en beveiligingsmaatregelen zoals multifactorauthenticatie implementeren. Google meldt wereldwijd meer dan 650 deelnemende partners. Buiten het programma kan elke Google Cloud-klant CodeMender gebruiken met publiek beschikbare modellen op het Gemini Enterprise Agent Platform, als aanvulling op AI Threat Defense. Het bedrijf geeft daarnaast aan via Google.org inmiddels meer dan 100 miljoen dollar aan cumulatieve financiering voor cybersecurity te hebben verstrekt, waaronder 36 miljoen voor 35 cyberklinieken die meer dan 1.250 Amerikaanse ziekenhuizen, schooldistricten en gemeentelijke diensten hebben ondersteund.

🔗 Fairwind Program


Googles opdrachtregeltools: drie versies in twee dagen

1 en 2 september — Google heeft in twee dagen drie versies binnen hetzelfde domein uitgebracht, en samen wijzen ze op een duidelijke prioriteit: minder functionaliteiten, meer isolatie en stabiliteit.

Uitgebrachte versieDatumBelangrijkste inhoud
Gemini CLI v0.58.01 septemberZeven hoofdzakelijk beveiligingsgerichte wijzigingen, promotie naar het stabiele kanaal
Antigravity CLI 1.1.231 septemberTwee verbeteringen, elf correcties
Antigravity 2.12.02 septemberZeven verbeteringen, negen correcties

Het stabiele kanaal van Gemini CLI is overgegaan op v0.58.0, een promotie die onopgemerkt bleef omdat ze tweeëndertig minuten na de publicatie van previewversie v0.59.0 plaatsvond. De inhoud is vrijwel volledig defensief. De ingrijpendste correctie betreft de macOS-sandbox: het Seatbelt-profiel isoleert voortaan de sockets en binaries van Docker en containerruntimes, waarmee een klassieke ontsnappingsroute wordt afgesloten — een geïsoleerd proces dat de Docker-socket van de host kan bereiken, kan daar in de praktijk uit ontsnappen. Twee andere wijzigingen versterken de kern: de evaluatie van symbolische links wordt consistent bij het beheer van genegeerde paden, en de eerstelijnsveiligheidscontroles worden expliciet gedeclareerd in de configuratie van het schrijfbeleid.

Antigravity 2.12.0 brengt twee nieuwe functionaliteiten. Met het citeren van antwoorden kan een deel van een antwoord worden gemarkeerd om het opnieuw als context in de volgende prompt in te voegen — een direct antwoord op een alledaags probleem bij lange agentsessies. En de opdracht /boost, voorbehouden aan betalende gebruikers, verhoogt de redeneerinspanning via een multi-agent-redeneerpijplijn. Deze verschijnt op dezelfde dag als Gemini 3.8 Flash, waarvan Google erkent dat het harder werkt ten koste van meer tokens: beide ontwikkelingen gaan dezelfde kant op, namelijk expliciete controle door de gebruiker over het inspanningsniveau. De rest pakt concrete ergernissen aan: de algemene instellingen geven aan welke projecten een instelling overschrijven, terminalindelingen met gesplitst scherm blijven behouden wanneer vensters opnieuw worden geladen, en een bericht kan worden verzonden terwijl het dicteren doorgaat.

Antigravity CLI 1.1.23 vermindert ten slotte de belasting van subagent-streaming door trajectmetadata eenmaal per subtraject te verzenden in plaats van bij elke stap, en accepteert via Tab de modelnaam die als spooktekst in /model wordt voorgesteld. De elf correcties leggen vervelende dagelijkse gebreken bloot: crashes veroorzaakt door prompt-hooks, ontbrekende toolaanroep-ID’s bij het reconstrueren van de geschiedenis voor Gemini-modellen, toestemmingsprompts met algemene titels in plaats van leesbare beschrijvingen van de actie — een reëel probleem, want er wordt gevraagd een actie toe te staan die niet wordt beschreven — en subagents die met enable_mcp_tools=true waren gedeclareerd maar faalden door het ontbreken van een MCP-dispatcher.

🔗 Releaseopmerkingen voor Gemini CLI v0.58.0 · 🔗 Changelog van Antigravity


De Short Video Overviews van Gemini Notebook worden uitgebreid naar meer dan 70 talen

1 september — Gemini Notebook heeft zijn Short Video Overviews uitgebreid naar meer dan 70 talen, met drie nieuwe varianten van het Engels. De functionaliteit zet de bronnen van een notebook om in verticale video’s van ongeveer 60 seconden, die voortaan in de taal van de gebruiker kunnen worden gegenereerd.

De uitrol betreft het web en mobiele apparaten en blijft voorbehouden aan Ultra- en Pro-abonnees — waarbij het team in dezelfde thread aangeeft dat de uitrol naar Pro-gebruikers nog niet voltooid is. Twee details vullen de aankondiging aan: het aantal bronnen in een notebook telt niet mee bij de berekening van het tokenverbruik, en Pro-gebruikers behouden de mogelijkheid om Cinematic Video Overviews in het Engels te genereren. De overstap van alleen Engels naar 70 talen verandert de functionaliteit van een demonstratie in een werkelijk bruikbaar hulpmiddel buiten de Engelstalige wereld.

🔗 Aankondiging van Gemini Notebook


Editors worden multiplexers voor modellen

1 en 2 september — Twee ogenschijnlijk losstaande aankondigingen beschrijven dezelfde ontwikkeling: de ontwikkelomgeving wordt een toegangspunt tot modellen van derden, en de onderscheidende factor verschuift van de kwaliteit van het model naar de omstandigheden waaronder het draait.

Zed heeft zijn stabiele versie 1.18.0 uitgebracht, waarvan de belangrijkste inhoud te vinden is in de AI-sectie van de releaseopmerkingen. De editor haalt daarmee in één keer meerdere recente releases binnen: het contextvenster van 1 miljoen tokens van GPT-5.6 wordt ondersteund op Amazon Bedrock, Gemini 3.5 Flash-Lite wordt toegevoegd aan de Google AI-modellen, Grok 4.5 en Grok 4.6 worden toegevoegd aan de xAI-modellen, en de ondersteuning voor Claude Fable 5.1, dat de dag ervoor uitkwam, is verbeterd. Twee van deze vier toevoegingen zijn externe bijdragen die in de opmerkingen worden vermeld. Daar komen gebruiksverbeteringen voor het werken met agents bij — een verbroken verbinding met een externe agent opnieuw laden zonder te herstarten, lager geheugengebruik tijdens lange sessies en verbindingsfouten die de onbereikbare host bij naam noemen — plus een belangrijke correctie voor wie MCP-servers koppelt: OAuth-authenticatie mislukte bij servers die niet-standaard scopes vereisen.

Mistral heeft GLM 5.2 beschikbaar gemaakt in Vibe Code, zijn coding-agent, voor Pro- en Team-abonnementen. Het opmerkelijke punt is niet het model, maar de manier waarop het wordt aangeboden: Mistral host het in Europa op zijn eigen infrastructuur. Een Europese ontwikkelaar die GLM 5.2 vanuit Vibe Code gebruikt, doet dus een beroep op inferentie die door Mistral wordt uitgevoerd, zonder dat de verzoeken via de servers van Z.ai lopen. Dit is de concrete vertaling van de regionale inferentiepositionering die de editor sinds augustus verdedigt — en de situatie is dubbel veelzeggend, omdat Mistral zijn eigen Devstral-familie heeft en er desondanks voor kiest om in zijn tool een opengewichtenmodel aan te bieden dat door een concurrerend laboratorium is ontwikkeld.

🔗 Releaseopmerkingen voor Zed 1.18.0 · 🔗 GLM 5.2 in Vibe Code


NVIDIA: twee engineeringblogs en een alliantie die onder een nieuw bestuur komt

2 september — Drie publicaties van NVIDIA op dezelfde dag: twee technische en één over governance.

De eerste blog, het derde deel van de reeks over het co-design van modellen, geeft vijf regels voor het afstellen van speculative decoding. De techniek is bekend: een klein draftmodel stelt meerdere tokens voor die het doelmodel in één parallelle doorgang controleert. De praktische vraag blijft open — hoeveel tokens moeten worden gespeculeerd, en met welk mechanisme? Tijdens de verificatie groeit de rekenbelasting met (1 + D), maar blijft de geheugentoegang gelijk: de draftlengte D moet dus worden verhoogd tot het punt waarop de verificatie omslaat van memory-bound naar compute-bound. Bij een representatieve expert-GEMM maakt D = 7 het mogelijk dit regime te bereiken met een achtste van de batchgrootte die voor D = 0 nodig is. Wanneer attention de decodeertijd domineert, wordt de optimale lengte D = 128/G − 1, waarbij G het aantal query heads is dat één KV head deelt. Daarboven kunnen beter waarden worden gekozen waarbij G × (1 + D) een veelvoud is van 128, de tegelgrootte van de attention-kernel. De metingen zijn gebaseerd op SPEED-Bench, NVIDIA’s benchmark voor speculative decoding: met Qwen 3.5 122B A10B als doel bereikt het externe draftmodel 35B A3B een acceptatielengte van 6 bij D = 9. De blog benadrukt een vaak genegeerd punt — een hogere acceptatie betekent niet noodzakelijk een grotere versnelling — en sluit af met een waarschuwing: fine-tuning van het doelmodel verandert de uitvoerverdeling, waardoor een drafter die voor een bepaalde checkpoint is getraind aan acceptatie kan verliezen, zelfs wanneer het doelmodel verbetert.

De tweede blog is een CUDA-optimalisatietraject in zes stappen, opgebouwd rond één voorbeeld: drie RGB-afbeeldingen omzetten naar grijswaarden en vervolgens de mediaan berekenen van elke tegel van 32 × 32 pixels. Het uitgangspunt is opzettelijk foutieve code, die Compute Sanitizer onmiddellijk diagnosticeert — een schrijfactie buiten de grenzen van het gedeelde geheugen, veroorzaakt doordat een globale index werd gebruikt waar een blokindex nodig was.

OptimalisatiestapTotale tijdWinst van de stap
Startcode6,8 s
CUB (DeviceTransform en BlockRadixSort)635 msongeveer 10x
Gepoolde geheugencontainersongeveer 244 msongeveer 2,6x
Gepind geheugen25 msongeveer 10x
Eén CUDA-stream per afbeelding23 msongeveer 300x cumulatief

Alleen al het vervangen van de zelfgemaakte bubble sort door cub::BlockRadixSort verlaagt de berekening van de medianen van 2,142 s naar 773 µs, een factor 2717. Geen van deze stappen betreft low-level optimalisatie: het zijn vervangingen van API’s.

Ten slotte treedt de Open Secure AI Alliance, die NVIDIA mede heeft opgericht, toe tot de Linux Foundation. De stelling van de alliantie verlegt de focus van het gebruikelijke debat: een agent is niet alleen een taalmodel, maar een softwaresysteem dat bestaat uit modellen, harnassen die context bieden en guardrails die begrenzen wat het kan doen. Toch heeft het gesprek over veiligheid zich grotendeels alleen op het model gericht, terwijl beveiliging afhangt van het geheel — harnassen, alignmentmechanismen, uitvoeringsomgevingen, identiteit, beleid, observability en herstel. Er staat een verzoek om commentaar open voor SAFE (Shared AI Findings Exchange), een systeem voor het vertrouwelijk verzamelen van AI-gerelateerde incidenten en bijna-incidenten, in samenwerking met OpenSSF.

🔗 Speculative decoding · 🔗 Stapsgewijze CUDA-optimalisatie · 🔗 Open Secure AI Alliance


Equinix Inference Exchange, open modellen in 280 datacenters

2 september — Equinix heeft Equinix Inference Exchange aangekondigd, een programma voor gedistribueerde AI-inferentie dat zijn samenwerking met NVIDIA uitbreidt en Together AI daaraan toevoegt. De opzet bestaat uit drie lagen: Equinix levert de fysieke basis die via Equinix Fabric met clouds is verbonden, NVIDIA levert zijn gevalideerde enterprise-referentiearchitecturen en Together AI beheert daarbovenop het platform met ondersteuning voor meer dan 200 open-sourcemodellen, als gedeelde implementatie of in een specifieke single-tenantomgeving.

Het argument draait om de locatie van de inferentie en niet om de modelkeuze, met drie beoogde toepassingen: inferentie aan de rand van stedelijke netwerken om latency te verlagen, de migratie van workloads van gesloten propriëtaire modellen naar open alternatieven, en soevereine AI voor gereguleerde bedrijven. De cijfers over de reikwijdte geven een beeld van het gebruikte netwerk: meer dan 280 datacenters in 77 stedelijke gebieden, 230 cloud-opritten en meer dan 10.500 onderling verbonden bedrijven.

Er is echter een aandachtspunt rond de planning: het persbericht van Equinix vermeldt zwart-op-wit dat de oplossing vanaf het eerste kwartaal van 2027 beschikbaar zal zijn, terwijl het bericht van Together AI zijn platform beschrijft als reeds actief in de wereldwijde datacenters van Equinix. Dit is een aankondiging van een partnerschap en een roadmap, geen ingebruikname.

🔗 Persbericht van Equinix


BenchMIRT, de methode van Ai2 om te controleren wat benchmarks werkelijk meten

1 september — Ai2 heeft BenchMIRT gepubliceerd, een methode die een vraag stelt die zelden rechtstreeks wordt behandeld: meet een benchmark daadwerkelijk het vermogen dat hij beweert te meten? In plaats van uit te gaan van de eindscore, gaat de methode tot op het niveau van elke vraag en schat ze welke capaciteiten werkelijk bepalend zijn voor succes, op basis van de uit de psychometrie afkomstige itemresponstheorie (Item Response Theory), in haar multidimensionale variant. De training omvatte de resultaten van 100 opengewichtenmodellen, 16 benchmarks en meer dan 34.000 vragen.

Het stevigste resultaat is methodologisch: zonder dat werd aangegeven welke benchmark wat geacht werd te meten, bracht BenchMIRT uit zichzelf twee dominante dimensies naar voren, veiligheid en algemeen redeneervermogen, die identiek terugkwamen toen de analyse vanaf nul opnieuw werd uitgevoerd.

Gecontroleerde benchmarkCorrelatie met redenerenCorrelatie met veiligheidOordeel van de audit
MMLU-Pro0,97-0,21Komt overeen met het verklaarde doel
BBQ0,85-0,06Volgt het redeneervermogen ondanks zijn status als veiligheidstest
WMDP-0,890,21Meet de afwezigheid van gevaarlijke kennis
ToxiGen0,40-0,32Zwak op beide dimensies, benchmark verzadigd op 92%

BBQ, dat is ontworpen om te testen of een model op sociale stereotypen steunt, correleert dus voor 0,85 met algemeen redeneervermogen en helemaal niet met veiligheid: een slechte score zegt mogelijk meer over het redeneervermogen van het model dan over zijn gedrag. De tweede bijdrage is praktisch: door de vragen te rangschikken op onderscheidend vermogen laat Ai2 zien dat met slechts 10% ervan ongeveer dezelfde rangschikking van de modellen behouden blijft, en dat de methode het antwoord op een niet-geobserveerde vraag in 79% van de gevallen correct voorspelt, tegenover 70% voor een naïeve aanpak. Twee erkende beperkingen: alle trainingsmodellen dateren van vóór maart 2025, en de ontdekte dimensies hangen af van de aangeleverde reeks benchmarks.

🔗 BenchMIRT


Runway Dev MCP, de coding-agent neemt de media-integratie over

2 september — Runway heeft Runway Dev MCP gelanceerd, een gehoste MCP-server die zijn ontwikkelaarsplatform rechtstreeks koppelt aan de coding-tool die dagelijks wordt gebruikt — Claude, ChatGPT, Codex of Cursor. Het argument kan in één zin worden samengevat: de agent die de integratie heeft geschreven, kan voortaan het juiste model ervoor kiezen, de tools configureren waarop ze steunt en fouten opsporen.

De dienst bestrijkt de drie fasen van een integratie. Vóór de eerste API-aanroep bevraagt de agent de catalogus om te achterhalen welke modellen een project kan gebruiken, tegen welke prijs en met welke invoer, en haalt vervolgens het exacte aanvraagschema van het gekozen model op — met als doel meteen bij de eerste poging een correcte aanroep te doen in plaats van te gokken. In productie maakt en configureert de agent een Model Router die op basis van kosten, latency of kwaliteit tussen meerdere modellen kiest, met een kostenlimiet per generatie, en kan hij achterhalen welk model de router voor een bepaalde aanroep heeft gekozen. Dezelfde logica geldt voor Characters. De derde fase is debugging: wanneer een generatie mislukt, raadpleegt de agent de taak via een daarvoor gedefinieerde tool en leest hij de precieze reden voor de weigering — afwijzing door moderatie, limiet op de assetgrootte, onjuist gevormde request body — voordat hij het probleem corrigeert en de taak opnieuw start. Een Quickstart-menu maakt de API-sleutel aan en opent vervolgens Claude Code, Codex of Cursor met een vooraf opgesteld bericht.

🔗 Runway Dev MCP


DreamX-Creator 1.0, native audio-videogeneratie in 2K vanuit één afbeelding

2 september — Het AMAP-team van Alibaba heeft DreamX-Creator 1.0 gepresenteerd, een model met 7 miljard parameters onder de Apache 2.0-licentie dat vanuit één afbeelding en een tekstprompt een native gesynchroniseerde video- en audiostream in 2K produceert, zonder een videomodel en een audiomodel na elkaar te schakelen.

Het systeem bestaat uit drie bouwstenen: intermodale gekruiste aandacht met poorten (Gated Cross-Modal Attention), gecombineerd met progressieve gezamenlijke training, die bidirectionele interactie tussen beide streams mogelijk maakt; audio-video-reinforcement learning, gevoed door modaliteitsgevoelige multimodale feedback; en autorregressieve verfijning in één stap, die de video naar 2K brengt met behoud van beweging en de temporele synchronisatie van de audio.

De publicatie is op dit moment nog gedeeltelijk. De GitHub-repository, die een dag eerder werd opgezet, bevat de projectpresentatie en de roadmap, en het technische rapport is op arXiv verschenen. De gevalideerde gewichten, inferentiecode, configuraties en evaluatietools staan nog altijd vermeld als niet behaalde mijlpalen. Het werk bouwt voort op Wan2.2 en MOVA van OpenMOSS, die beide uitdrukkelijk worden bedankt.

🔗 Aankondiging van DreamX-Creator 1.0


De OpenAI API maakt onderscheid tussen te snelle opschaling en overbelasting van een model

2 september — OpenAI heeft gewijzigd hoe zijn API twee situaties meldt die clientapplicaties tot nu toe niet van elkaar konden onderscheiden.

HTTP-statusFoutcodeBetekenisAanbevolen handelwijze
429slow_downHet aanvraagtempo is te snel gestegenRetry-After respecteren, het tempo verlagen en het daarna geleidelijk opvoeren
503server_is_overloadedHet aangevraagde model is tijdelijk overbelastRetry-After respecteren en het opnieuw proberen; de wachttijd verlengen als de fout aanhoudt

Dit onderscheid heeft onmiddellijke praktische gevolgen voor alle retry-code. De documentatie verduidelijkt dat een fout slow_down kan optreden terwijl het verkeer binnen de limieten voor aanvragen en tokens per minuut van de organisatie blijft: de fout duidt niet op een uitgeput quotum, maar op een versnelling die als te abrupt wordt beschouwd — met andere woorden, een applicatie kan worden afgeremd zonder ook maar één weergegeven limiet te hebben overschreden. De gids over snelheidslimieten geeft een vuistregel: zodra het verkeer één miljoen invoertokens per minuut bereikt, mag het niet met meer dan 50% per vijftien minuten worden verhoogd. Wanneer de header Retry-After ontbreekt, beveelt OpenAI exponentiële backoff met een kleine willekeurige vertraging aan, om te voorkomen dat alle instanties van dezelfde dienst het gelijktijdig opnieuw proberen. Organisaties waarvan het gebruiksverkeer regelmatig tegen deze limieten aanloopt, worden verwezen naar Scale Tier, en voor GPT-5.6 en latere modellen naar Reserved Tier.

🔗 Changelog van de OpenAI API


Kort nieuws

  • Claude Code 2.1.258 — uitsluitend een bugfixrelease: het opstarten op macOS 12 Monterey, dat sinds 2.1.255 niet meer werkte, is hersteld, en externe en geplande sessies mislukken niet langer nadat een toestemming opnieuw is goedgekeurd. 🔗 CHANGELOG
  • Claude Campus Ambassadors — de sollicitaties zijn geopend, met dit jaar drie afzonderlijke trajecten: bachelor, master, doctoraat en postdoctoraal onderzoek. 🔗 Aankondiging
  • Nokia analyseert 50 miljoen regels code met Cursor — twee ingenieurs van de divisie Core Networks deden dit in twee weken, terwijl het team dacht ongeveer twaalf experts gedurende meerdere maanden nodig te hebben. Casestudy van de leverancier, zonder onafhankelijk meetprotocol. 🔗 Casestudy
  • TranslatePsy-Nano — Tether AI Research publiceert twee families compacte vertaalmodellen, EuroNano voor negen Europese talen en AfriNano voor acht Afrikaanse talen, in varianten van 42, 31 en 17 MB met één checkpoint per taalgroep. 🔗 Aankondiging
  • Puffin-World — een uniform multimodaal model dat de wereld weergeeft via drie native toestanden: fysica, geometrie en uiterlijk, gepubliceerd met de Puffin-16M-dataset. 🔗 Presentatie
  • De experts van een MoE op NVMe — i64 Systems laat de gewichten van de experts op NVMe staan met verificatie via een SHA-256-manifest, en meet byte voor byte identieke uitvoer tussen het geladen pad en het residentiële pad. 🔗 Technisch artikel
  • Sakana AI op de CiNet International Conference — technisch directeur Llion Jones en onderzoeker Kai Arulkumaran geven van 5 tot en met 7 oktober 2026 in Osaka een lezing over bruggen tussen neurowetenschappen en machine learning. 🔗 Aankondiging
  • Gemini CLI, nightly van 2 september — één wijziging: verbeterde validatie van bestemmingen en verbindingsroutering in hulpprogramma’s voor webophaling, in het verlengde van de netwerkversterkingen die eind augustus zijn begonnen. 🔗 Release notes
  • MrBeast sluit een meerjarig partnerschap met Google — de overeenkomst breidt de relatie met Beast Industries uit tot buiten YouTube, richting Gemini en Google Health, met op 5 september een eerste video waarin Gemini wordt gebruikt om te overleven in de jungle, de woestijn en het Noordpoolgebied. 🔗 Aankondiging
  • Samenvatting van Googles AI-aankondigingen in augustus — maandelijks artikel dat onderwerpen bundelt die gedurende de maand al zijn behandeld, zonder eigen nieuws. 🔗 Samenvatting
  • Enterprise Live Migrations algemeen beschikbaar — migratie van repositories van GitHub Enterprise Server naar de cloud met data residency en vrijwel geen onderbreking, aangestuurd via de extensie gh elm. Niet gerelateerd aan AI, maar voor de volledigheid vermeld. 🔗 Changelog
  • ElevenLabs benoemt Ashley Kramer tot Chief Revenue Officer — de enige publicatie van het bedrijf in deze periode; de productchangelog is sinds 24 augustus niet gewijzigd. 🔗 Aankondiging
  • NVIDIA zendt een livestream over DGX Spark uit op de Portable Computer van Perplexity — zesentwintig minuten over de lokale uitvoering ervan, zonder beschrijvende tekst of transcriptie. Het is de tweede demonstratie van de dag waarin DGX Spark als doelplatform voor lokale portering dient. 🔗 Uitzending
  • Kling AI documenteert de Elements van zijn MCP-server — tutorial over het behouden van de identiteit van een personage tussen shots; productuitleg en geen lancering. 🔗 Tutorial
  • Codex CLI 0.152.1 — bugfixrelease die ongeveer twintig uur na 0.152.0 verscheen: de Guardian-goedkeuringscontrole respecteert voortaan het Node REPL-beleid dat via de metadata van het model wordt doorgegeven. 🔗 Release notes
  • Cohere verdedigt de keuze voor kleine bedrijfsmodellen — de leverancier brengt Command R7B, Tiny Aya met 3,35 miljard parameters en North Mini Code, dat 33,4 scoort op de Coding Index van Artificial Analysis, samen om passende dimensionering te bepleiten. Geen lancering. 🔗 Artikel
  • Perplexity publiceert twee educatieve gidsen — over persoonlijke assistenten en het detecteren van hallucinaties. De tweede beschrijft post-training in twee stappen: de eerste ontwikkelt productgedrag, de tweede steunt op moeilijkere onderzoekstaken. 🔗 Gids

Wat dit betekent

De prijs is het belangrijkste argument geworden, ook bij frontier-modellen. Drie lanceringen op dezelfde dag, en geen daarvan benadrukt een recordscore. Google handhaaft voor Gemini 3.8 Flash het tarief van de vorige generatie en erkent dat zijn model meer tokens verbruikt — een zeldzame bekentenis die de aandacht verschuift van de vermelde prijs naar de werkelijke kosten van een taak. Qwen claimt uitdrukkelijk de top van Arena’s Pareto-frontier in plaats van zonder meer de eerste plaats. Meta drukt zijn winst niet uit in benchmarkpunten, maar in 20% minder tool calls en 25% minder tokens. De tabel van CursorBench levert de veelzeggendste meting van de dag: met 69,2% kost Gemini 3.8 Flash 2,38 dollar per taak, terwijl een vergelijkbare score bij Fable 5.1 4,80 dollar en bij Opus 5 7,35 dollar kostte. De kolom met stappen herinnert er echter aan dat deze prijs elders wordt betaald — 161 stappen tegenover 44.

De engineering van de harness wordt een meetbare economische hefboom. Het artikel van GitHub is het nuttigste document van de dag voor iedereen die op deze modellen bouwt: vier optimalisaties die het model zelf niet wijzigen en elk 2 tot 5% voordeel opleveren, inclusief documentatie van de mislukte experimenten. De engineeringgids van Anthropic zegt vanaf de andere kant hetzelfde — al bij het ontwerp streven naar een cache-hitpercentage van 90 tot 99%, en kosten per voltooide taak meten in plaats van per call. Beide komen samen op één punt dat door de modellenwedloop aan het zicht wordt onttrokken: bij een gelijkblijvend model bepaalt de harness een aanzienlijk deel van de rekening, en verbeteringen zijn niet overdraagbaar van het ene product naar het andere. GitHub toont dit aan doordat een optimalisatie die effectief was voor code review de kosten op de CLI verhoogde.

Inferentie verhuist naar de werkplek, en de locatie van de berekening wordt een ontwerpparameter. FastH3 maakt videogeneratie mogelijk op een Mac of desktopcomputer, Perplexity stelt de code open van een engine die slechts één model op één type hardware uitvoert, Tether publiceert vertaalmodellen van 17 MB, i64 Systems laat MoE-experts op NVMe draaien en Cohere pleit voor passende dimensionering. Deze beweging sluit van bovenaf aan op die van Equinix, NVIDIA en Together AI, die inferentie om redenen van latency en soevereiniteit over 280 datacenters verdelen. De rode draad is niet miniaturisering, maar specialisatie: Lily wint doordat het alles afwijst wat niet Qwen3.6-35B-A3B op Apple Silicon is, en Perplexity zet erop in dat die nauwe focus een voordeel is, geen beperking.

Controle en governance worden strenger en verlopen voortaan evenzeer via contracten als via technologie. GitHub verplicht dataretentie voor Fable 5.1 — met een vrijstelling die aan het einde van het kalenderjaar afloopt — terwijl het ieder bedrijfsteam de keuze van het standaardmodel geeft en op dezelfde dag zes modellen uit de catalogus verwijdert. Cursor verplaatst de uitvoering van agents naar het netwerk van de klant, maar verduidelijkt dat transcripties nog altijd bij Cursor worden verwerkt. Google beperkt zijn cyberdefensiemodel tot 650 geselecteerde partners, onder schriftelijk vastgelegde operationele voorwaarden. Mistral levert vanuit Europa een Chinees model en maakt daarvan zijn verkoopargument. Ten slotte herinnert BenchMIRT eraan dat de evaluatietools waarop een deel van deze beslissingen berust zelf ook een audit verdienen: een benchmark voor sociale bias die met 0,85 correleert met algemeen redeneervermogen en met -0,06 met veiligheid, meet niet wat het label beweert.


Bronnen