Zoeken

Grok 4.7 verschijnt dezelfde dag in Cursor en Copilot, OpenAI onthult meer dan 100 opgeloste wiskundeproblemen, Googlebook nu te reserveren

ai-powered-markdown-translator

Artikel vertaald van fr naar nl met gpt-5.6-sol.

Bekijk project op GitHub ↗

Maandag 21 september staat de dag in het teken van xAI: Grok 4.7 verschijnt en komt dezelfde dag nog beschikbaar in Cursor en GitHub Copilot, zonder vertraging tussen de aankondiging van het model en de komst ervan naar de tools. OpenAI kiest dezelfde dag om te onthullen dat een intern model, dat sinds 28 augustus wordt getraind, meer dan honderd openstaande wiskundeproblemen heeft opgelost, en om een adviesgroep van wiskundigen in te stellen na een verklaring die door 27 Fieldsmedaillewinnaars is ondertekend. Google opent de voorbestellingen voor de Googlebook, ElevenLabs plaatst een montageagent centraal in zijn video-editor en Hugging Face brengt zijn 3 tot 30 keer snellere tokenisatiebibliotheek opnieuw uit.


Grok 4.7 verschijnt bij xAI en komt dezelfde dag naar Cursor en GitHub Copilot

21 september — xAI brengt Grok 4.7 uit, zijn krachtigste model voor code en kenniswerk. Het basismodel is groter dan dat van Grok 4.6 en de fase van reinforcement learning is verlengd met een mix van taken waarin problemen die meerdere uren vergen zwaarder wegen. xAI verwacht daardoor een model dat zijn eigen werk beter controleert en beter overweg kan met lange contexten.

De cijfers schetsen eerder een gemengd profiel dan een dominante positie. De prijs verandert echter niet: 2 dollar per miljoen inputtokens en 6 dollar per miljoen outputtokens, net als Grok 4.6, oftewel de helft van de inputprijs van GPT-5.6 Sol en een vijfde van die van Fable 5.1. Het argument draait om deze prijs-prestatieverhouding.

Gepubliceerde metingGrok 4.7 (xHigh)Grok 4.6 (High)GPT-5.6 Sol (Max)Fable 5.1 (Max)
CursorBench 4.046,3 %40,4 %41,7 %51,8 %
Terminal-Bench 4.038,0 %20,3 %37,3 %57,9 %
EEBench (elektrotechniek)64,0 %53,0 %39,4 %56,4 %
Inputprijs (dollar / M tokens)22410
Outputprijs (dollar / M tokens)662050

De API biedt grok-4.7 aan met een context van 500.000 tokens en vier niveaus van redeneerinspanning, van low tot xhigh; de prijs verdubbelt boven 200.000 prompttokens. xAI benadrukt ook een volledig nieuwe reeks beveiligingsmaatregelen: de eerste plaats in de bioveiligheidsbenchmark van LatchBio met 62,4%, en 3,3% van de riskante cyberprompts voor dubbel gebruik die op HackerBench v0.3 werden doorgelaten.

Bij twee integratiepartners wordt het model onmiddellijk uitgerold. Cursor biedt het model vanaf de eerste dag aan — een gevolg van de overname van Anysphere door SpaceX, die op 14 augustus werd afgerond. Het model blijft eigendom van xAI: het bericht dat dezelfde dag op de blog van Cursor verscheen, bestaat uit één zin en verwijst naar de volledige aankondiging op x.ai. Het is xAI dat CursorBench 4.0 onder de aandacht brengt, de benchmark van Cursor voor langdurige taken, waarop Grok 4.7 bij een ongewijzigde prijs 46,3% behaalt. GitHub Copilot rolt het model op zijn beurt uit op al zijn platformen, van VS Code tot Xcode, voor abonnementen van Pro tot Enterprise. De facturering verdient daarbij aandacht: Grok 4.7 valt buiten het systeem van verzoekmultipliers en wordt op basis van gebruik tegen het openbare tarief van de leverancier gefactureerd. Omdat een nieuw model standaard wordt geactiveerd, is voor kostenbeheersing een actie in het modelbeleid nodig; niets doen volstaat niet.

🔗 Grok 4.7 — xAI 🔗 Grok 4.7 is nu beschikbaar in GitHub Copilot


OpenAI stelt een adviesgroep van wiskundigen in en onthult dat meer dan honderd openstaande problemen zijn opgelost

21 september — OpenAI kondigt aan samen te werken met een onafhankelijke adviesgroep van negen wiskundigen, die door henzelf is samengesteld en is ondergebracht bij het Institute for Advanced Study in Princeton. De context weegt zwaarder dan de aankondiging.

On August 28, we began training a new internal model. In addition to resolving the Navier–Stokes Millennium Prize problem, this model has now resolved more than 100 long-standing open problems across most areas of mathematics.

🇳🇱 Op 28 augustus zijn we begonnen met het trainen van een nieuw intern model. Naast het oplossen van het millenniumprobleem van Navier-Stokes heeft dit model inmiddels meer dan 100 al lang openstaande problemen uit de meeste deelgebieden van de wiskunde opgelost. — OpenAI, Adviesgroep voor wiskunde en kunstmatige intelligentie

Het model is niet publiekelijk benoemd en OpenAI schrijft dat het tempo van deze vooruitgang zijn eigen wiskundigen heeft verrast. Deze versnelling leidde tot een felle reactie: op 11 september werd een verklaring gepubliceerd met de titel „A Severe Misalignment of AI in Mathematics”, voorzien van een Zenodo-DOI en ondertekend door 27 Fieldsmedaillewinnaars, onder wie Terence Tao, Peter Scholze en Cédric Villani. Hun argument is niet dat de modellen fouten maken. Het oplossen van een groot probleem heeft altijd op nieuw inzicht gewezen, dat vervolgens door de gemeenschap verder werd uitgewerkt totdat het onderwezen kon worden; de ondertekenaars vrezen dat een massaproductie van ware of onware beweringen deze voedingsbodem vernietigt in plaats van voedt, en dat zulke overhaaste aankondigingen onvoldoende tijd laten voor een correcte uitwerking.

De constructie berust nadrukkelijk op onafhankelijkheid: de groep kan ongevraagd advies uitbrengen, zich publiekelijk uitspreken over de invloed van OpenAI op de wiskunde en zijn samenstelling wijzigen zonder goedkeuring van het bedrijf, terwijl zijn leden niet door OpenAI worden betaald. Dan blijft nog de zin die OpenAI aan het einde van dezelfde alinea plaatst: de groep zal het bedrijf niet adviseren over het tempo van zijn interne vooruitgang. De reikwijdte omvat dus de verspreiding van de resultaten, niet de totstandkoming ervan — alles behalve datgene wat het protest heeft veroorzaakt. Martin Hairer staat overigens op beide lijsten: als ondertekenaar van de verklaring en als lid van de groep.

🔗 Een ernstige ontsporing van AI in de wiskunde


Googlebook, de reeks Google-laptops die rond Gemini is ontworpen

21 september — Google opent de voorbestellingen voor de Googlebook, die het bedrijf als een volwaardige afzonderlijke categorie presenteert: de technologische stack van Android, desktopfundamenten die zijn geërfd van ChromeOS, en dat alles ontworpen rond Gemini. Er verschijnen tegelijkertijd vijf modellen, geproduceerd door Acer, ASUS, Dell, HP en Lenovo, vanaf 899 dollar. De leveringen beginnen op 4 oktober in de Verenigde Staten en op 5 oktober in Canada, het Verenigd Koninkrijk, Ierland, Frankrijk, Duitsland en Australië.

Aangekondigde eigenschapWaarde
Vanafprijs899 dollar
ProcessorsIntel Core Ultra Series 3 of Snapdragon X Elite
NPUmeer dan 45 TOPS
Werkgeheugenstandaard 16 GB, tot 32 GB
Accuduurtot 14 uur video, 16 uur internetten
Softwareondersteuningupdates tot 10 jaar

Drie Gemini-functies zijn specifiek voor het apparaat. Magic Pointer, dat wordt geactiveerd door met de cursor te schudden, brengt Gemini naar het element dat op het scherm wordt weergegeven — om bijvoorbeeld een verdachte e-mail te analyseren of meerdere afbeeldingen te combineren — en Google benadrukt dat de functie alleen op verzoek wordt geactiveerd en kan worden uitgeschakeld. Rambler zet een onsamenhangend dictaat om in gestructureerde tekst met koppen en takenlijsten, ook wanneer iemand midden in een zin van taal wisselt. Create My Widget genereert bureaubladwidgets op basis van een beschrijving in natuurlijke taal.

Voor ontwikkelaars wordt elk apparaat geleverd met Antigravity, Googles platform voor ontwikkelagents, en met een geïsoleerde Linux-omgeving met een volledige terminal — de documentatie vermeldt expliciet de mogelijkheid om daarin Claude Code of Antigravity CLI uit te voeren. Deze isolatie berust op een Level 5-gecertificeerde pKVM-hypervisor, die Google als een primeur in deze categorie presenteert, aangevuld met de hardwarematige Titan root of trust. De samenhang met de Android-telefoon doet de rest: een op de telefoon begonnen taak kan worden voortgezet en mobiele apps worden in een venster op het bureaublad gestreamd. Elke Googlebook omvat 12 maanden Google AI Pro met 5 TB opslag, 3 maanden YouTube Premium en Photoshop, en één jaar GeForce NOW.

🔗 Voorbestellingen voor de Googlebook


ElevenLabs voegt een montageagent toe aan Studio 4.0

21 september — ElevenLabs brengt Studio 4.0 uit in ElevenCreative, de update van zijn video-editor. Het uitgangspunt kan in één zin worden samengevat: alles gebeurt op dezelfde plek. Het genereren van video, afbeeldingen, stemmen, muziek en geluidseffecten wordt vanuit het project zelf gestart, alle modellen van ElevenCreative kunnen worden aangeroepen zonder de editor te verlaten, en de montage, ondertiteling en vervolgens de export volgen elkaar in dezelfde interface op. Een shot kan opnieuw worden bewerkt zonder de volledige generatie opnieuw te starten, en ondertitels kunnen net als iedere andere clip op de timeline worden bewerkt.

De meest bepalende vernieuwing is Studio Agent, een co-editor die in elk project aanwezig is.

Studio Agent is your AI co-editor, built into every project. Describe the change you want and it makes the edit. Step in and make cuts whenever you like, then hand the timeline back to the agent.

🇳🇱 Studio Agent is je AI-co-editor, ingebouwd in elk project. Beschrijf de gewenste wijziging en de agent voert de montage uit. Neem het over en maak je eigen cuts wanneer je wilt, en geef de timeline daarna weer terug aan de agent.@ElevenLabs op X

Juist deze wisselwerking onderscheidt de tool van een ondoorzichtig generatieproces: de editor neemt de controle over wanneer die dat wil en geeft daarna de timeline weer terug. Die is overigens opnieuw opgebouwd voor projecten met meerdere scènes en meerdere tracks — reclamecampagnes, tutorials en series korte formats — met zoomen tot op frameniveau, snapping van clips en het verplaatsen van een groep clips zonder dat de rest zijn synchronisatie verliest. Teamopmerkingen worden aan een specifieke clip of asset gekoppeld in plaats van over afzonderlijke threads te worden verspreid.

Goed om te weten voor de opvolging: op het moment van de scan bestond de aankondiging alleen op X, in een thread van zes berichten. De blog van ElevenLabs eindigde bij het bericht van 10 september en de changelog van de documentatie bij de vermelding van de 14e.

🔗 Studio 4.0 in ElevenCreative


Hugging Face brengt tokenizers v1 uit, 3 tot 30 keer sneller met identieke identifiers

21 september — Hugging Face brengt de release candidate van tokenizers v1 uit, de Rust-bibliotheek die tekst omzet in reeksen gehele getallen voordat een model die leest. Het uitgangspunt is eenvoudig: tokenisatie is nooit de bottleneck van machine-learningpipelines geweest, maar het evenwicht verschuift naarmate modellen sneller worden, en een GPU die op zijn processor wacht, is een inactieve GPU.

MetriekGemeten waarde
Versnelling van encoding ten opzichte van v0.23, één thread3 tot 30 keer
TestmachineApple M4 Max
Onder- en bovengrens van de bandbreedtet5-base en gpt2
Schaling over acht workers76 % van lineair
Geproduceerde tokenidentifiersidentiek aan v0.23
Installatie van de release candidatecargo add tokenizers --pre

De beperking die het team zichzelf oplegt, is interessanter dan de winst zelf: v1 produceert exact dezelfde tokenidentifiers als v0.23, de API, de woordenschat en de merge ranks veranderen niet, en de bibliotheek blijft algemeen toepasbaar in plaats van zich te specialiseren in BPE. Voor de update hoeft dus niets anders te worden gedaan dan de geïnstalleerde versie te wijzigen.

Zes veranderingen vormen de kern van het werk, waarvan de ongebruikelijkste bitcannon heet. De reguliere expressie die de tekst in pre-tokens opsplitst, is een vaste parameter die met de tokenizer wordt meegeleverd: er is geen reden om die bij elke encoding door een generieke engine te laten interpreteren. Hugging Face schrijft de splitsingsfunctie daarom met de hand en laat die via SIMD op bitstreams werken, waarbij per registerbewerking over 64 bytes wordt beslist. De keerzijde wordt bewust aanvaard: alleen herkende patronen (GPT-2, cl100k, o200k, Tekken, DeepSeek) profiteren ervan, terwijl de overige het regex-pad blijven gebruiken — wat het verschil tussen 3 en 30 verklaart. Daar komen een allocatie- en branchvrije mergeloop, een threadlokale woordcache en native parallelisme bij. De C- en C++-bindings die uitsluitend voor inference zijn bestemd, gericht op ExecuTorch en llama.cpp, zijn aangekondigd voor de release van 1.0.0.

🔗 tokenizers v1: encoding, decoding en schaling, gemeten


Devin Cloud komt naar de terminal, met SSH-toegang tot de machine van de agent

21 september — Cognition brengt Devin Cloud naar de terminal: devin --cloud, of /cloud vanuit een lopende sessie, maakt, bestuurt en hervat een cloudsessie zonder de CLI te verlaten. Het mechanisme berust op een symmetrisch commando: /handoff draagt de huidige taak over aan de virtuele machine van Devin — Mac, Linux of Windows — en voert, wanneer het vanuit de cloud wordt uitgevoerd, het omgekeerde traject uit door de branch van de pull request op te halen. Cloudsesses blijven bestaan nadat de terminal waarin ze zijn gestart, is afgesloten.

And for the first time, SSH into Devin’s dedicated VM, then /handoff the work back to your own device.

🇳🇱 En maak voor het eerst via SSH verbinding met de speciale virtuele machine van Devin, en haal het werk vervolgens met /handoff terug naar je eigen apparaat.@cognition op X

devin ssh biedt volledige toegang tot de omgeving die de agent heeft opgebouwd: code wijzigen, een ontwikkelserver starten, poorten doorsturen en bestanden ophalen via scp. De uitvoeringsomgeving is niet langer een black box. SWE-2-sessies zijn tot 8 oktober gratis in Devin Cloud.

🔗 Devin Cloud in je terminal


Qwen Code v0.24.3 instrumenteert zijn Web Shell en bewaart zijn sessies via JDBC

21 september — Qwen Code gaat een dag na v0.24.2 over op v0.24.3: eenendertig pull requests, zonder incompatibele wijzigingen. Het belangrijkste zichtbare werk betreft de Web Shell, waarvan de uitvoeringsresultaten niet langer platte tekst zijn, maar een structuur die de opdracht, de uitvoer, de uitvoeringsdetails en de verstreken tijd van elkaar scheidt. Een tabblad trajectory, standaard uitgeschakeld, toont de duur per beurt, de tijd tot het eerste token, het aantal tokens en de duur van elke toolaanroep.

Het minst zichtbare deel is waarschijnlijk het meest structureel. De runtime krijgt JDBC-persistentie voor zijn koppelingen en sessies, waardoor de toestand tussen meerdere brokerprocessen kan worden gedeeld en het eigenaarschap van een sessie na een herstart behouden blijft. De tools van de runtime worden bovendien via bwrap gerouteerd met een beleid van een onveranderlijke workspace — het rechtstreekse vervolg op de sandbox van de dag ervoor, waarvan de instelling nog altijd niet beschikbaar is. Diezelfde dag bevat de TypeScript SDK v0.1.14 deze CLI en volgt Qwen Code Desktop v0.24.3.

🔗 Releaseopmerkingen voor Qwen Code v0.24.3


Hugging Face brengt relore uit, een repositorygeheugen voor code-agents

21 september — Hugging Face brengt relore uit onder de Apache-2.0-licentie, een tool die een code-agent het geheugen van een repository geeft. Het uitgangspunt is een incident: voor Transformers-ticket #48630, geopend op 8 september, waren al twee correcties voorgesteld toen de continuous-integration-agent van het bedrijf op het punt stond een derde te schrijven. De informatie stond volledig op GitHub, maar was verspreid over tickets, pull requests en opmerkingen die vanuit het oorspronkelijke ticket niet zichtbaar waren.

relore indexeert deze geschiedenis door vast te leggen wie wat heeft gezegd: een beslissing van een maintainer weegt niet hetzelfde als een hypothese van een contributor, en door machines gegenereerde inhoud wordt standaard uitgesloten. Naast de index wordt een werkclone bijgehouden, die via dezelfde HTTP API wordt aangeboden, en query’s worden lokaal verwerkt — alleen de ingestie maakt verbinding met GitHub. De werkwoorden volgen: inflight vermeldt de threads die beweren een ticket af te sluiten, search --trust authoritative bracht PR #39847 naar boven als oorzaak van de regressie, why vertrekt vanuit een coderegel om de bijbehorende reviewopmerkingen terug te vinden. Tijdens een praktijktest meldde de agent dat defs hem een beter totaalbeeld van een bestand gaf dan het volledig lezen ervan, voor 5% van de tokens.

🔗 relore, repositorygeheugen voor code-agents


Perplexity traint Computer na op fouten van gebruikers en voegt video toe

21 september — Perplexity Research beschrijft hoe het bedrijf het model achter zijn Computer-agent natraint — terloops onthult het artikel dat dit GLM 5.2 is — op basis van echte gebruikerssessies. Synthetische omgevingen leveren gecontroleerde en gemakkelijk verifieerbare taken op; echte sessies leveren twee signalen die synthetische omgevingen niet produceren: correcties van gebruikers en fouten die tools teruggeven. Sessies met persoonsgegevens en sessies van gebruikers die training hebben geweigerd, worden vóór elke steekproeftrekking uitgesloten.

Elke beurt krijgt vervolgens een van drie behandelingen: imitatie via cross-entropy voor foutloze beurten uit geslaagde sessies, correctie via Kullback-Leibler-divergentie voor foutieve beurten met een geldige aanwijzing, of eenvoudig behoud in de context. Dezelfde set gewichten fungeert als docent en leerling, maar alleen de docent ziet de aanwijzing. Drie automatische beoordelaars wijzen mogelijk verantwoordelijke beurten aan en minstens twee moeten tot dezelfde conclusie komen, omdat de laatste beurt vóór de klacht slechts in ongeveer de helft van de gevallen de werkelijke oorzaak is.

Foutpercentage van toolsGemeten waarde
Offline, oorspronkelijke GLM 5.22,79%
Offline, alleen sampling met afwijzing1,35%
Offline, met zelfdistillatie0,87%
Online, tussen twee checkpoints2,24% en daarna 1,77%, relatief 21,2% minder

De auteurs zijn expliciet over wat deze cijfers niet aantonen: de offline vergeleken checkpoints zijn niet op dezelfde gegevens getraind, de resultaten per taak blijven wisselend en de ontevredenheid van gebruikers verandert niet significant, 2,58% tegenover 2,54%, in A/B-tests met ongeveer honderdduizend gebruikers per variant.

Diezelfde dag krijgt Computer videogeneratie, uitgevoerd door twee modellen van derden: MiniMax H3 en ByteDance Seedance 2.5. Of het nu om een campagneclip, productdemonstratie of visuele content voor sociale media gaat, de voltooide video verschijnt in dezelfde thread als de tekst en afbeeldingen die voor hetzelfde verzoek zijn geproduceerd. Beschikbaar voor Pro- en Max-abonnees, zonder vermelding van gratis toegang of beschikbaarheid via de API.

🔗 Leren van fouten uit de praktijk 🔗 Perplexity Computer en de videomodellen


Gemini Notebook stelt Live Chat en Interactive Learning Overviews algemeen beschikbaar

21 september — Gemini Notebook heeft diezelfde dag twee implementatiemijlpalen bereikt. Live Chat bereikt 100% van de Ultra-abonnees op mobiele apparaten: een realtime spraakgesprek met een notebook, in ongeveer 100 talen, ondersteund door de nieuwste audiomodellen van Google, met vrijwel volledig handsfree stapsgewijze begeleiding. Enkele uren later verlaten de Interactive Learning Overviews hun geleidelijke uitrol en worden ze toegankelijk voor alle gebruikers, zonder abonnementsvereiste; onder Reports brengen ze bronsamenvattingen en studioartefacten samen in één interactieve ruimte.

Beide functies waren op 15 september voorgesteld bij de aankondiging van de nieuwe studietools. De berichten van de 21e voegen geen functionaliteit toe: ze bevestigen de daadwerkelijke beschikbaarheid, volledig voor de eerste en voor iedereen toegankelijk voor de tweede.

🔗 Live Chat voor 100% uitgerold 🔗 Interactive Learning Overviews voor iedereen beschikbaar


Google.org stelt 4 miljoen dollar beschikbaar voor AI-training van docenten

21 september — Google.org stelt 4 miljoen dollar beschikbaar aan Digital Promise, aangekondigd in New York in de marge van de Algemene Vergadering van de Verenigde Naties. De financiering breidt de Google AI Educator Series uit, een gratis training die eerder dit jaar werd aangekondigd en bedoeld is voor de 6 miljoen docenten in het basis-, middelbaar en hoger onderwijs in de Verenigde Staten. De training is samen met ISTE ontworpen volgens een aanpak waarbij docenten andere docenten opleiden, richt zich op vaardigheden die van de ene tool naar de andere overdraagbaar zijn in plaats van op een specifiek product, en bestaat uit modules die in eigen tempo kunnen worden gevolgd en met digitale badges worden gevalideerd.

Digital Promise werkt op drie gebieden: de training aanpassen aan onderwijsinstanties van staten en schooldistricten, samenwerken met netwerken van community colleges voor docenten in de eerste cyclus, en gedurende twee jaar onderzoeken wat docenten in het hoger onderwijs daadwerkelijk helpt, waarna de resultaten in een gratis openbare gids worden gepubliceerd.

🔗 Google.org en Digital Promise


Runway breidt zijn Workflows uit met compositing, transparantie en dieptekaarten

21 september — Runway breidt zijn Workflows, de ketens van bewerkingen die in de applicatie worden samengesteld, uit met vijf bouwstenen voor postproductie: Compositing, Alpha, HDR, Depth Map en RGB Depth. Het argument wordt in de aankondiging in één zin samengevat: een groter deel van de productieketen (pipeline) op dezelfde plek bouwen, zonder tussen twee stappen naar een andere tool te hoeven overstappen. Compositing en het beheer van het alfakanaal zijn bedoeld voor het samenvoegen van meerdere beeldlagen; dieptekaarten dienen in hun beide vormen als geometrisch signaal om effecten aan te sturen die afhankelijk zijn van de afstand tot de camera. De aankondiging werd op X gedaan met een demonstratie van 31 seconden, zonder bijbehorend artikel op de nieuwspagina van Runway ten tijde van de scan.

🔗 Uitgebreide Workflows in Runway


NVIDIA lanceert DSX Ready, een kwalificatieprogramma voor de energievoorziening en koeling van AI-fabrieken

21 september — NVIDIA lanceert DSX Ready, een programma dat producten van partners kwalificeert aan de hand van de vereisten van zijn DSX-referentiearchitectuur voor AI-fabrieken. Het uitgangspunt is praktisch: energievoorziening, koeling, water, locatie en elektriciteitsnet bepalen tegenwoordig wat een bouwer daadwerkelijk kan implementeren, en apparatuur die niet goed op de rest van het ontwerp is afgestemd, zet rekencapaciteit niet om in nuttige productie.

Gekwalificeerde categoriePartners bij de lanceringKwalificatietraject
Energieopslag met batterijenHitachi Energy, LG Energy Solution, TeslaTests door de partner, beoordeling en goedkeuring door NVIDIA
Koeldistributie-eenhedenLG Electronics, LiquidStack, VertivZelfkwalificatiepakket

NVIDIA stelt een expliciete grens aan wat het label betekent: slagen voor de kwalificatie vervangt engineering op locatieniveau niet en biedt geen enkele garantie voor de stabiliteit van de locatie. Andere categorieën voor infrastructuur en software zullen geleidelijk worden toegevoegd.

🔗 NVIDIA DSX Ready


NVIDIA behandelt de beveiliging van agents als een engineeringprobleem, laag voor laag

21 september — NVIDIA publiceert een standpunt over de beveiliging van agentic systems: het is een engineeringprobleem en vereist dus vastgelegde eisen, toepasbare controles, aangewezen verantwoordelijken en bewijs dat de beveiligingsmaatregelen standhouden. De stack wordt opgedeeld in drie niveaus — modellen leveren de capaciteiten, harnesses organiseren context, tools en workflows, en de uitvoeringsomgeving biedt de infrastructuur waarin acties plaatsvinden — waarbij elk niveau zijn eigen controles heeft.

Het gekozen voorbeeld spreekt voor zich: een agent werkt een klantrecord bij, treft kwaadaardige instructies aan in een bijgevoegd document en probeert de gegevens naar een niet-geautoriseerde bestemming te exporteren. NVIDIA verwacht dan een netwerkbeleid dat de overdracht blokkeert en beveiligde logs die de poging tot toolaanroep, de autorisatiebeslissing en het resultaat vastleggen. Het recht om een record bij te werken omvat niet het recht om het te exporteren, en een agent kan toegang aanvragen zonder die ooit zelf te kunnen verlenen. Wat tooling betreft past OpenShell beleid toe buiten het bereik van de agent; Cisco bouwt DefenseClaw erbovenop en JFrog controleert de skills waartoe een agent toegang heeft.

Diezelfde dag past een tweede artikel dezelfde redenering toe op fysieke AI en koppelt die aan het Halos-fundament; het staat hieronder bij de korte berichten, samen met zijn twee marktprognoses.

🔗 De agent-stack beveiligen


Earth-2 verwerkt lokale waarnemingen om weersverwachtingen te actualiseren

21 september — NVIDIA publiceert een tutorial over de AI-tools voor data-assimilatie van Earth-2, bedoeld voor sectoren die al over eigen metingen beschikken: wind- en zonneparken, lokale radars en sensoren, en satellietwaarnemingen. De eerste techniek, SDA, wordt toegepast op diffusiemodellen zoals CorrDiff en StormCast: bij elke denoising-stap vergelijkt ze het tussenresultaat met de waarnemingen en stuurt ze de volgende stap bij, zonder hertraining.

Gemeten techniekBereik en resolutieGemelde verbetering in het voorbeeld
CorrDiff-SDAEuropa, van 0,25 graad naar 2,2 kmRMSE van wind 54% lager bij achtergehouden stations
StormCast-SDAContinentale Verenigde Staten, 3 km, geïnitialiseerd met HRRRRMSE van wind 7,2% lager over zes tijdstappen
HealDAWereldwijd, HEALPix-raster van 1 graadWereldwijde toestand van de atmosfeer binnen enkele seconden geschat

Het belang is in de eerste plaats operationeel: numerieke analyses vereisen aanzienlijke rekentijd en verschijnen op vaste tijdstippen, terwijl SDA voortdurend waarnemingen verwerkt en het verschil met het huidige tijdstip overbrugt. HealDA behandelt elke stroom op zijn beurt als een puntenwolk in ruimte en tijd, die op het doelraster wordt samengevoegd en vervolgens door een vision-transformer-achtig backbone-netwerk wordt geleid.

🔗 Data-assimilatie in Earth-2


Multiverse Computing snoeit blokken als een Ising-spinglas en wint 23 MMLU-punten

21 september — Volledige transformerblokken verwijderen is een van de goedkoopste manieren om een groot taalmodel te versnellen, en een van de meest brute: het model wordt letterlijk korter, maar als de verkeerde blokken worden verwijderd, stort het in. Multiverse Computing stelt dat de vraag verkeerd wordt gesteld. Bestaande methoden beoordelen elk blok afzonderlijk — magnitude, sensitivity, block influence — wat de auteurs als mean-field bestempelen, terwijl het effect van het verwijderen van een blok afhangt van de blokken die tegelijkertijd worden verwijderd.

De selectie wordt zo een binair optimalisatieprobleem onder beperkingen, dat wordt geprojecteerd op een Ising-spinglas: een systeem van ongeordende spins, met all-to-all-interacties en een vast aantal naar boven gerichte spins. Het praktische voordeel laat zich in één zin samenvatten: de energie van dit systeem is een goedkope proxy voor de score die het gesnoeide model zal behalen, waardoor een zeer groot aantal kandidaatconfiguraties kan worden gerangschikt zonder er ook maar één op benchmarks te evalueren. Bij 50% compressie van Llama-3.3-70B-Instruct claimen de auteurs een winst van bijna 23 procentpunten op MMLU ten opzichte van de beste concurrerende methode.

🔗 LLM’s snoeien als een natuurkundige


Kort nieuws

NVIDIA publiceerde op 21 september zeven artikelen en berichten: drie worden hierboven behandeld, de vier andere staan hier, zonder technische aankondiging.

  • NVIDIA roept op tot beveiliging op elke laag voor fysieke AI — opiniestuk gebaseerd op twee marktprognoses: volgens ABI Research zullen er tegen 2035 49 miljoen autonome voertuigen van niveau 3 tot en met 5 zijn geïnstalleerd en volgens Omdia zullen er tussen 2026 en 2035 ongeveer 60 miljoen industriële robots worden ingezet. Hieraan worden vier beveiligingsvereisten gekoppeld binnen het NVIDIA Halos-fundament. 🔗 bron
  • NVIDIA benadrukt de opschaling van het Egyptische AI-ecosysteem — ontvangst in het Grand Egyptian Museum met een openingstoespraak van Paolo Guglielmini, vicepresident EMEA. De inleiding vermeldt vooral dat AI-fabrieken in Zuid-Afrika, Marokko en Nigeria in gebruik worden genomen. 🔗 bron
  • NVIDIA noemt vijf bedrijven die AI toepassen op koolstofarme energie — overzicht gepubliceerd voor de New York Climate Week, van het versnellen van kernfusie tot het hergebruik van gerecyclede accu’s van elektrische voertuigen. ThinkLabs AI bouwt er digitale tweelingen en agents op CUDA om de doorlooptijd van netaansluitingen te verkorten. 🔗 bron
  • NVIDIA maakt de winnaars van de Golden Tickets voor GTC Berlin bekend — zes winnaars, door een jury gekozen voor de conferentie van 20 tot en met 22 oktober 2026. Geen technische inhoud. 🔗 bron
  • Qwen-Image-2.1 vanaf de eerste dag beschikbaar via vLLM, SGLang, ComfyUI en Hugging Face — SGLang-Diffusion draait het model op één RTX 4090 van 24 GB met offloading naar de processor, voor een generatie van 1024 bij 1024 in 18,7 seconden en een gebruik van 22,7 GiB. vLLM beschrijft het als een diffusietransformer met 7,1 miljard parameters, gekoppeld aan Qwen3-VL-8B. 🔗 bron
  • OpenAI Academy voegt vier leertrajecten toe — Build with AI, Lead AI Adoption, AI for Educators en AI for College Students voegen zich bij Apply AI at Work. Elke cursus eindigt met een beoordeling die een badge oplevert; het ontwikkelaarstraject maakt onderscheid tussen het aansturen van Codex en het bouwen op de API. 🔗 bron
  • Runway organiseert in San Francisco een hackathon rond zijn API — eendaags evenement op 30 september in de Masonic, in de marge van de Runway AI Summit, om een agent, applicatie of creatieve workflow te bouwen, zonder presentatiedossier of goedkeuringsprocedure. 🔗 bron
  • HeyGen zet Code2Video in de schijnwerpers, een benchmark ontwikkeld met Google DeepMind en Kaggle — de meting richt zich op een andere vraag dan het schrijven van code: of die code een video oplevert die het bekijken waard is. Gepubliceerd als reactie op een bericht over de agentische videostack op basis van codegeneratie. 🔗 bron
  • Suno toont geluidseffecten die via een eenvoudige beschrijving worden toegepast — demonstratie van één minuut, van warme verzadiging tot een experimenteler resultaat. Geen functienaam, geen betrokken abonnement en geen bijbehorend blogartikel: eerder productpromotie dan een lancering. 🔗 bron
  • Live demonstratie van Gemini voor winkelen op Discord — sessie aangekondigd voor dinsdag 22 september om 11.00 uur PT op de officiële Discord-server, gericht op het voorbereiden van een aankoop, het vergelijken van opties en zoeken aan de hand van een foto. Geen nieuwe functionaliteit. 🔗 bron
  • Together AI en Ollama kondigen een sessie over open code-agents aan — Parth Sareen van Ollama en Zain Hasan van Together AI leiden een sessie over het in productie nemen van code-agents op basis van open modellen. Datum noch locatie wordt in het bericht vermeld. 🔗 bron
  • Twee afgebroken trainingsruns van Boris-2 worden als open weights vrijgegeven — de eerste bleef steken op een loss van 3,100 bij 30 miljard tokens door incompatibiliteit tussen Muon- en AdamW-gradients; de tweede werd rond 7 miljard tokens stopgezet. Een relaas van mislukkingen dat leerzamer is dan de modellen zelf. 🔗 bron
  • Een vooraf geregistreerd protocol tegen directionele bias van beoordelingsmodellen — de hypothese luidt dat fouten bij narratieve tekst vaker neigen naar het expliciet benoemen van een gevoel dan naar de codering ervan. Het protocol is vóór enige gegevensverzameling gepubliceerd, inclusief het resultaat waarbij het construct zou worden ingetrokken en een door de auteur gemeld belangenconflict. 🔗 bron
  • Een reproductie van Jev met open bouwstenen komt 0,6 punt tekort — een gebruiker die zegt niet te kunnen programmeren, laat Claude Code een dag lang experimenteren om Jev opnieuw op te bouwen met open stacks die uitsluitend op een processor draaien. Acht mislukte benaderingen, die hij leerzamer vindt dan de aanpak die wel werkte. 🔗 bron
  • Jevini scheidt het ontwerp en de uitvoering van beslissingen — een groot reasoning-model ontwerpt een geversioneerde graaf van getypeerde beoordelingen, die door een klein beslissingsmodel op elke nieuwe situatie wordt uitgevoerd. Promotionele inhoud van de uitgever, die als zodanig moet worden behandeld. 🔗 bron
  • Cohere houdt het bij merkcommunicatie, zonder productaankondiging — een bericht van 20 september zet de campagne AI for Empowerment voort door de aan medeoprichter Aidan Gomez toegeschreven intentie te herformuleren, terwijl twee visuals van 21 september de ontwikkeling van het bedrijf tot aan de studentenhackathon Hack The North in Waterloo vertellen. Geen model, functionaliteit of prijs. 🔗 campagne · 🔗 hackathon

Wat dit betekent

Dag nul wordt de norm voor distributie. Grok 4.7 wacht niet: het is op de dag van de aankondiging al beschikbaar in Cursor en GitHub Copilot, en Qwen-Image-2.1 werd vanaf de release aangeboden door vLLM, SGLang, ComfyUI en Hugging Face. De tijd tussen de publicatie van een model en de beschikbaarheid ervan in alledaagse tools, die vroeger in weken werd gemeten, nadert nul — bij Cursor omdat de editor en het laboratorium sinds 14 augustus tot dezelfde groep behoren, elders omdat de integratie al vóór de aankondiging wordt voorbereid. De interessante vraag is niet langer wanneer een model beschikbaar komt, maar wat het zal kosten zodra het er is.

Dat is precies wat de factureringsregel van Copilot verandert. Grok 4.7 valt daar buiten het systeem van requestmultipliers en wordt op basis van gebruik tegen het openbare tarief van xAI gefactureerd. In combinatie met de automatische activering van nieuwe modellen verschuift dit een kostenbeslissing naar het platformbeheer: niets doen betekent dat er een kostenpost ontstaat die is gekoppeld aan de prijslijst van een externe leverancier. Voor xAI is het argument symmetrisch — dezelfde 2 dollar voor input als Grok 4.6, echte winst op Terminal-Bench, maar een plaats achter Fable 5.1 bij langdurige codetaken: wat hier wordt verkocht, is een prijs-prestatieverhouding, geen eerste plaats.

Rond agents vertellen drie uiteenlopende aankondigingen over dezelfde omslag: de uitvoeringsomgeving is niet langer een zwarte doos. devin ssh stelt de virtuele machine van de agent open voor een interactieve sessie, relore geeft de agent het geheugen van eerdere beslissingen in een repository in plaats van alleen de huidige staat van de code, Perplexity traint zijn model verder op precies de beurten waarin het bij gebruikers faalde, en Qwen Code routeert zijn tools via bwrap. NVIDIA levert het theoretische kader voor deze ontwikkeling door te stellen dat de beveiliging van een agent laag voor laag en buiten zijn bereik moet worden geregeld, met logs die als bewijs dienen. De inspecteerbare agent en de ingeperkte agent zijn twee kanten van dezelfde behoefte.

Dan blijft de vraag over die de aankondiging van OpenAI oproept zonder haar te behandelen. Een intern model dat in minder dan een maand meer dan honderd openstaande problemen oplost, heeft geleid tot een institutioneel antwoord — een onafhankelijke, onbetaalde adviesgroep die vrij is in haar opvattingen — waarvan het mandaat expliciet het tempo van de interne vooruitgang uitsluit, precies het onderwerp van het protest van de 27 Fields-medaillewinnaars. Het contrast met de rest van de dag is veelzeggend: terwijl het tempo van spectaculaire resultaten wordt besproken, behaalt een tokenization-library een factor 3 tot 30 sneller met de garantie van identieke identifiers, en ontleent een compressiemethode technieken aan spinglazen om bij 50% compressie 23 MMLU-punten te winnen. Dat werk haalt de krantenkoppen niet, maar bepaalt wel wat inference morgen zal kosten.


Bronnen