Zoeken

Demis Hassabis stelt een Standards Body voor grensmodellen voor, NVIDIA claimt 25x prestatie per watt, GPT-5.6 algemeen beschikbaar op Bedrock

Demis Hassabis stelt een Standards Body voor grensmodellen voor, NVIDIA claimt 25x prestatie per watt, GPT-5.6 algemeen beschikbaar op Bedrock

ai-powered-markdown-translator

Artikel vertaald van fr naar nl met gpt-5.4-mini.

Bekijk project op GitHub ↗

Deze week wordt gekenmerkt door een standpunt van Demis Hassabis over het bestuur van grens-AI, twee NVIDIA-publicaties die de efficiëntiewinsten van Blackwell kwantificeren en een nieuwe agent-gestuurde onderzoeksmethode, evenals de algemene beschikbaarheid van GPT-5.6 op Amazon Bedrock. De rest van het nieuws omvat een golf van open modellen (OCR, vision-language, binaire kwantisatie), meerdere GitHub- en Manus-vernieuwingen op het gebied van tooling, en de open-sourcerelease van de WANDR-benchmark door Perplexity.


Demis Hassabis stelt een kader voor grens-AI en een Standards Body voor

14 juli — In een lang artikel op X neemt Demis Hassabis, medeoprichter en CEO van Google DeepMind, stelling over de route naar artificial general intelligence (AGI). Hij is van mening dat een systeem met alle cognitieve vermogens van het menselijk brein waarschijnlijk nog maar enkele jaren verwijderd is, en vergelijkt de omvang van deze doorbraak met de ontdekking van elektriciteit of vuur, met een potentiële impact die tien keer groter is dan die van de industriële revolutie, aan tien keer de snelheid.

Hij waarschuwt echter: de huidige commerciële en geopolitieke race is zo intens dat er niet genoeg tijd overblijft om de risico’s goed te begrijpen (cybersecurity, en uiteindelijk nucleaire en biologische risico’s), noch om de controle te behouden over systemen die steeds autonomer worden en zichzelf kunnen verbeteren.

Zijn centrale voorstel: een Standards Body speciaal voor de evaluatie van grensmodellen, naar het model van een publiek-privaat partnerschap onder toezicht van de Amerikaanse federale overheid — vergelijkbaar met FINRA in de financiële sector — met een raad waarin onafhankelijke technische experts en vertegenwoordigers van open source zitting hebben. De financiering, grotendeels privaat, zou erop gericht zijn toptalent in de techniek aan te trekken en de rekenkracht te financieren die nodig is voor grootschalige tests. Hassabis positioneert de Verenigde Staten als het land dat het best geplaatst is om dit initiatief te starten, terwijl hij tegelijk oproept tot internationale samenwerking op het gebied van veiligheid.

If you stop to think about it, we’ve essentially found a way to make sand think. It’s miraculous. The magnitude of this technology’s impact will be unprecedented, perhaps 10x of the Industrial Revolution at 10x the speed.

🇳🇱 Als je erover nadenkt, hebben we in wezen een manier gevonden om zand te laten denken. Het is wonderbaarlijk. De omvang van de impact van deze technologie zal ongekend zijn, misschien tien keer die van de industriële revolutie, aan tien keer de snelheid.@demishassabis op X

🔗 Volledig artikel op X


NVIDIA — prestatie per watt, een sleutelmetriek voor de efficiëntie van AI-infrastructuur

14 juli — NVIDIA verdedigt prestatie per watt als de referentiemetriek voor de efficiëntie van AI-infrastructuur: in een context waarin de beschikbare elektrische stroom de zwaarste beperking vormt, bepaalt deze ratio hoeveel tokens een AI-fabriek kan produceren binnen een vaste vermogensgrens, en dus haar omzet en winstgevendheid.

Het bedrijf kwantificeert de winst van zijn Blackwell NVL72-platform ten opzichte van de Hopper-generatie:

Geëvalueerd modelPrestatie-per-watt-winst (Blackwell NVL72 vs Hopper)
DeepSeek V4 Protot 25x
GLM 5.1tot 20x
Kimi K2.6 (lange agentische workloads)tot 10x

Een deel van deze winst komt van de overgang van een GPU-domein met 8 units (Hopper) naar geïntegreerde racks met 72 GPU’s, met een zesde generatie NVLink Switch die in-network computing integreert (SHARP-technologie). Naast de hardware blijft software-optimalisatie aanzienlijke winst opleveren: tot 5x extra prestatie op DeepSeek V4 in slechts één maand, via de stack TensorRT-LLM, Dynamo, SGLang en vLLM.

Op het gebied van elektrische infrastructuur zou de DSX MaxLPS-technologie het mogelijk maken om tot 40% meer GPU’s te laten draaien bij hetzelfde vermogensbudget, dankzij gekoelde waterkoeling en dynamische vermogenssturing — terwijl vandaag slechts ongeveer 60% van de uit het net getrokken elektriciteit daadwerkelijk wordt omgezet in nuttig AI-werk in een fabriek. NVIDIA plaatst deze aanpak in het perspectief van zijn aankomende Vera Rubin-platform en noemt productie-implementaties bij Anthropic, OpenAI, CoreWeave, Perplexity en Fireworks AI.

🔗 NVIDIA-artikel


NVIDIA — Nemotron Labs: autonome RL-onderzoeksgedreven door agentvaardigheden

14 juli — NVIDIA presenteerde “RL Autoresearch”, een demonstratie van onderzoek in reinforcement learning, aangestuurd door een agent en gebaseerd op NeMo RL, NeMo Gym en herbruikbare vaardigheden. Het principe: geef een codeeragent een doel en een tijdsbudget, laat hem vervolgens zelf de trainingsomgeving opbouwen, het model trainen en evalueren, terwijl de onderzoeker zich beperkt tot het toezicht op de algemene richting van het werk.

In het getoonde voorbeeld moest de agent een vision-model leren om gekleurde sterren te tellen. Het model Qwen3-VL-2B ging van 25% naar 96,9% nauwkeurigheid, en de agent stelde zelf het volgende experiment voor dat moest worden uitgevoerd, zonder dat de onderzoeker dat dicteerde.

Een tweede voorbeeld, dat eerder onder post-training valt dan onder autonoom onderzoek, illustreert een verwant gebruik: een Cosmos 3 Nano-model, dat aanvankelijk niet in staat was een verkeerslicht te detecteren dat wel zichtbaar was in zero-shot evaluatie, werd via LoRA post-getraind voor de WTS-validatietaak (rijscenario’s met weer, verkeer en signalering). De nauwkeurigheid stijgt van 54,41% naar 87,14% na LoRA, en vervolgens naar 93,35% met toevoeging van NVIDIA TAO AutoML — en dat alles in minder dan een dag.

We gave a coding agent a goal and a time budget: build a training environment and teach a vision model to count colored stars.

🇳🇱 We hebben een codeeragent een doel en een tijdsbudget gegeven: een trainingsomgeving bouwen en een vision-model leren om gekleurde sterren te tellen.@NVIDIAAI op X

🔗 Aankondiging Nemotron Labs


Open modellen & onderzoek

Zeven publicaties markeren deze week op het gebied van open modellen en onderzoek, met name gedragen door Hugging Face, Together AI en Sakana AI.

Geëvalueerd modelUitgeverParametersLicentieBelangrijke benchmark
OvisOCR2Onafhankelijke auteur (HF)0,9 miljardApache 2.096,58 op OmniDocBench v1.6
MOSS-VL-RealtimeOpen_MOSS11 miljardApache 2.0Context van 256.000 tokens
Ternary Bonsai 27BPrismML~27,3 miljard (ternair)Gratis op Together AI99,20 op MATH-500

OvisOCR2: documentherkenning met 0,9 miljard parameters

OvisOCR2 claimt een score van 96,58 op OmniDocBench v1.6 en profileert zich als het eerste end-to-end model dat pipelinesystemen (OCR, lay-outdetectie en analyse die afzonderlijk worden verwerkt) overtreft. De auteur stelt een recept voor dat Hugging Face Jobs gebruikt om elk gegevensset via OCR naar markdown om te zetten, zonder lokale GPU. Opmerking: deze score en de kwalificatie “eerste end-to-end model” komen uit de aankondigingstweet en zijn niet geverifieerd in een volledige modelkaart.

🔗 Aankondiging OvisOCR2 op X

MOSS-VL-Realtime: open vision-language voor realtime video

Het Open_MOSS-team publiceert een vision-language-model van 11 miljard parameters dat is ontworpen voor continue analyse van videostreams in plaats van losse beelden: het blijft video observeren terwijl het zijn antwoord genereert, kan dit herzien als de situatie op het scherm verandert, en kiest ervoor stil te blijven bij gebrek aan voldoende bewijs. De varianten Base, Instruct en Realtime zijn allemaal uitgebracht onder Apache 2.0, met day-0-ondersteuning van de SGLang- en LMSYS-teams.

🔗 Aankondiging MOSS-VL-Realtime op X

LeRobot v0.6.0: native diepteondersteuning

De open-source roboticalibrary van Hugging Face voegt native end-to-end ondersteuning voor diepte (depth) toe: door een Intel RealSense-camera aan te sluiten en use_depth: true te activeren, worden dieptekaarten automatisch gesynchroniseerd met RGB-streams, gekwantiseerd in 12 bits en verliesloos gecodeerd in HEVC. De functionaliteit dekt SO-100/101, Koch, OpenArm, reBot en Unitree G1.

🔗 Aankondiging LeRobot v0.6.0 op X

Sakana Marlin: een “Virtual CSO” voor strategisch onderzoek

Sakana AI lanceert een autonome onderzoeksagent die ongeveer 8 uur diepgaand redeneert via de AB-MCTS-engine en een AI-Scientist-achtig proces, om te komen tot gestructureerde strategische opties in plaats van een samenvatting. De deliverables omvatten een rapport, bijlagen, referenties en dia’s. Het product is in bèta, met een gebruiksprijs (98 yen per krediet) of een Enterprise-aanbod op offertebasis.

Ternary Bonsai 27B: ternaire kwantisatie in telefoonformaat

PrismML publiceert een afgeleide van Qwen3.6 27B die in ternaire vorm is gekwantiseerd (g128-formaat, 1,71 bit per gewicht, ongeveer 9,4 keer compacter dan een FP16-basis), en volgens de uitgever 95% van de kwaliteit in volledige precisie behoudt.

Geëvalueerde benchmarkScore
MATH-50099,20
AIME 202590,84
HumanEval+93,90
Gemiddelde (15 thinking-benchmarks)80,49

Het model ondersteunt een context van 262.000 tokens en visuele input, en wordt gratis aangeboden op de serverless-infrastructuur van Together AI.

🔗 Aankondiging Ternary Bonsai 27B op X

Flash-BoN: de best-of-N opnieuw bekeken voor diffusie

Sayak Paul (Hugging Face) laat zien dat best-of-N een sterkere referentie vormt voor schaalvergroting bij diffusie-inferentie dan eerder werd gedacht, op voorwaarde dat ook de echte uitvoeringstijd wordt gemeten en niet alleen het aantal functie-evaluaties. Het team introduceert Flash-BoN, dat een bredere verkenning van samples verkiest boven herhaalde tussentijdse validaties.

🔗 Aankondiging Flash-BoN op X

Hugging Face opent ZeroGPU voor alle gebruikers

Toegang tot ZeroGPU-demo’s (gratis GPU op aanvraag) is nu beschikbaar voor alle Hugging Face-gebruikers, met een agent-skill waarmee een demo rechtstreeks vanuit een prompt in natuurlijke taal kan worden gebouwd.


GitHub, Copilot & Manus

Code scanning toont AI-beveiligingsdetecties op pull requests

14 juli — GitHub code scanning geeft nu AI-ondersteunde beveiligingsdetecties direct weer op pull requests, waardoor de dekking wordt uitgebreid naar talen en frameworks die niet door CodeQL worden ondersteund. De functie, in openbare preview, blijft informatief: ze blokkeert de merge niet, vereist dat de default setup van CodeQL is geactiveerd, een Copilot-licentie, en verbruikt alleen AI-credits bij een detectie.

🔗 GitHub changelog

Dependabot voert standaard een wachttijd in

14 juli — Dependabot wacht voortaan standaard drie dagen na de publicatie van een nieuwe versie voordat het een pull request voor een update opent, om de blootstelling aan supply-chain-aanvallen te beperken. Deze vertraging kan worden ingesteld via de optie cooldown van .github/dependabot.yml; beveiligingsupdates blijven onmiddellijk. De functie komt in GitHub Enterprise Server vanaf versie 3.23.

🔗 GitHub changelog

/security-review in de GitHub Copilot-app

14 juli — De opdracht /security-review is beschikbaar in openbare preview in de GitHub Copilot-app: ze analyseert lopende codewijzigingen en geeft resultaten terug die zijn gerangschikt op ernst en vertrouwensniveau, met suggesties die direct kunnen worden toegepast zonder de app te verlaten. Ze dekt onder meer injections, cross-site scripting en path traversal, en is toegankelijk voor de plannen Free, Pro, Business en Enterprise.

🔗 GitHub changelog

Manus genereert nu native .pptx-bestanden

14 juli — Manus genereerde eerder dia’s en converteerde die vervolgens naar .pptx; voortaan produceert het direct het native PowerPoint-bestand, met werkelijk bewerkbare grafieken (ze worden opnieuw getekend wanneer een waarde verandert) en de mogelijkheid om labels, raster en legenda wel of niet in te schakelen.

🔗 Manus-aankondiging

Manus lanceert automatische publicatie van gegenereerde sites

13 juli — De nieuwe optie auto-publish zet elke succesvolle build van een site automatisch live op de online URL, standaard uitgeschakeld. In combinatie met een wachtrij van wijzigingen verwijdert ze de laatste handmatige stap tussen bouwen en in productie nemen.

🔗 Manus-aankondiging


Beeld- en videogeneratie

Wan-Dancer-14B: open-source videogeneratie voor dans

14 juli — Alibaba maakt Wan-Dancer-14B open source, een lokaal uitvoerbaar model dat gespecialiseerd is in de generatie van ritmische dansvideo’s van lange duur, gericht op synchronisatie tussen beweging en muziek over langere reeksen in plaats van op eenvoudige clips.

🔗 Aankondiging Alibaba Wan

HeyGen: woord-voor-woord tijdstempeling voor realtime avatars

14 juli — HeyGen documenteert een niet-publieke stroom van zijn Avatar Realtime API: een woord-voor-woord tijdstempelkanaal ({mot, début, fin}) waarmee gebaren en spraak nauwkeurig kunnen worden gesynchroniseerd. De bevestiging van de verzending van een tekst komt na ongeveer 70 ms binnen, maar het woord wordt pas enkele seconden later daadwerkelijk uitgesproken, vandaar de noodzaak van een anker dat ongeveer vier keer per seconde opnieuw wordt berekend. Het mechanisme werd getest via een Twitch-uitzending die 24/7 liep, met 9.269 direct uitgesproken verdicts.

🔗 HeyGen-artikel

HeyGen — Figma → HyperFrames, dag 9/30

14 juli — De skill /figma importeert assets, merksjablonen, componenten, motion-timelines en storyboards rechtstreeks uit een Figma-bestand. Voor de demonstratie importeerde het team 27 kleuren en benoemde stijlen en reconstrueerde het een storyboard van acht frames als een live geïnterpreteerd opnamescript.

🔗 HyperFrames-repository

NVIDIA — Nemotron: gekwantificeerde feedback van klantbedrijven

14 juli — NVIDIA publiceert meerdere gekwantificeerde klantcases rond de open Nemotron-modellen: H Company haalde meer dan 76% nauwkeurigheid op OSWorld-Verified met Holotron 3 Nano; Harvey post-trainde Nemotron 3 Ultra voor een uitvoeringskost die minstens 10 keer lager ligt dan bij gesloten alternatieven; Arcee AI claimt ongeveer 20 keer goedkoper te zijn dan een vergelijkbaar gesloten model en toch tweede te staan op PinchBench; Abridge en YTL AI Labs pasten het respectievelijk aan voor klinische gesprekken en de Maleise taal.

🔗 NVIDIA-artikel


Anthropic

Claude for Teachers: gratis toegang voor K-12-leraren in de Verenigde Staten

14 juli — Anthropic lanceert gratis toegang tot de premiummogelijkheden van Claude voor geverifieerde K-12-leraren in de Verenigde Staten, met een bibliotheek aan pedagogische vaardigheden en een koppeling aan gevalideerde programma’s via Learning Commons, afgestemd op de standaarden van de 50 staten. Gesprekken worden nooit gebruikt voor modeltraining, en leerlinggegevens vallen onder een verwerkersovereenkomst die voldoet aan de FERPA-wetgeving.

🔗 Anthropic-aankondiging

Artifacts : openbaar delen, multiplayer-bewerking en creatie via Claude Tag

13 juli — Artifacts krijgen openbaar delen (iedereen met de link kan bekijken), gelijktijdige multiplayer-bewerking (Team- en Enterprise-abonnementen) en creatie vanuit Claude Tag in Slack op eenvoudig verzoek in een discussiethread.

🔗 Aankondiging Anthropic


OpenAI

GPT-5.6 nu algemeen beschikbaar op Amazon Bedrock

13 juli — De drie modellen GPT-5.6 die op 9 juli zijn gelanceerd — Sol (flagship-redenering), Terra (middenklasse) en Luna (snelle inferentie) — zijn voortaan algemeen beschikbaar op Amazon Bedrock, op de nieuwe Bedrock-inferentie-engine, ontworpen voor prestaties, beveiliging en schaal. Daarmee worden de toegangspunten tot GPT-5.6 uitgebreid, naast ChatGPT, de directe OpenAI-API en integraties van derden (Copilot, M365, Warp, Cursor, Devin).

🔗 Aankondiging AWS

Codex, standaard aanbevolen agent in JetBrains AI

14 juli — JetBrains maakt van Codex de standaard aanbevolen agent in JetBrains AI (IntelliJ IDEA, PyCharm, WebStorm), een niet-exclusieve keuze — de gebruiker kan op elk moment overschakelen naar een andere agent — die elke maand opnieuw wordt geëvalueerd naarmate de modellen evolueren.

🔗 Aankondiging JetBrains


Gemini

Gemini in Google Chrome gelanceerd in het Verenigd Koninkrijk

14 juli — Gemini wordt toegankelijk vanuit elk geopend Chrome-tabblad in het Verenigd Koninkrijk, zonder van context te wisselen: een pagina samenvatten, inhoud tussen tabbladen vergelijken, vragen beantwoorden over wat op het scherm wordt weergegeven.

🔗 Aankondiging Google UK

Eerste Gemini-rapport voor Zuidoost-Azië: recordadoptie en Gemini Spark

14 juli — Google publiceert zijn eerste “Gemini Southeast Asia Report”: het aantal actieve gebruikers is in een jaar meer dan verdubbeld op de zes belangrijkste markten (Indonesië, Maleisië, de Filipijnen, Singapore, Thailand, Vietnam), bijna 70 % van de verzoeken wordt in de lokale taal ingediend en er zijn het afgelopen jaar 5 miljard afbeeldingen gegenereerd via Nano Banana. Google rolt bij deze gelegenheid Gemini Spark uit, een proactieve agent die Workspace-taken kan beheren, in lokale talen voor abonnees van Advanced in de regio.

🔗 Google-rapport


Dev-tools & agents

Devin Fusion : een preview-agent die doorverwijst naar Fable 5

13 juli — Cognition lanceert Devin Fusion, een preview-agent beschikbaar in Devin Cloud, waar één model optreedt als manager die taken delegeert aan een goedkoper model in plaats van alles met één premium model uit te voeren. Volgens het team gedraagt Fable 5 zich als een manager die delegeert door volledige specificaties te schrijven, terwijl andere modellen zoals Opus 4.8 neigen tot micromanagement en hun context te overbelasten. Resultaat: een lagere kost per taak dan bij Opus 4.8, ondanks een hogere eenheidsprijs van Fable 5 — behalve bij sequentiële debugging, waar besparingen moeilijker te realiseren blijven.

🔗 Aankondiging Cognition

Perplexity opent zijn WANDR-benchmark als open source

14 juli — Perplexity publiceert WANDR (Wide ANd Deep Research), een interne benchmark ontworpen om zoekagenten te evalueren op brede en diepgaande taken: 500 taken, 170 495 individueel verifieerbare records, over drie moeilijkheidsniveaus. De beoordelaar haalt elke geciteerde pagina opnieuw op om te controleren of elke bewering wordt ondersteund door het onderliggende bewijs. Op zes geteste productie­systemen blijven de resultaten bescheiden: 0,363 in zachte F1 en slechts 0,133 in strikte F1, voor een kost per taak van 0,03 dollar tot 324,83 dollar, afhankelijk van de instellingen.

🔗 Aankondiging Perplexity op X · GitHub-benchmark


Korte berichten

  • Anthropic investeert 10 miljoen Canadese dollar om nieuw AI-onderzoek in Canada te financieren, in samenwerking met lokale instellingen. 🔗 bron
  • Cognition viert een jaar sinds de overname van Windsurf: geannualiseerde omzet gestegen van 73 miljoen naar meer dan 500 miljoen dollar, meer dan 20 miljoen regels code geschreven, consolidatie onder het merk Devin Desktop. 🔗 bron
  • Amp (Sourcegraph) publiceert een openbaar dashboard dat in realtime het gebruik van zijn agent-modi toont, zowel voor alle gebruikers als voor het interne team. 🔗 bron
  • Warp integreert Sentry via MCP, om root-cause-analyse (Seer) en het aanmaken van een pull request te koppelen zonder de terminal te verlaten. 🔗 bron
  • Composio komt naar Warp en verbindt agents met meer dan 1 000 applicaties (Gmail, Slack, Linear, Google Calendar). 🔗 bron
  • Zach Lloyd (CEO van Warp) publiceert een essay over de overgang van interactieve agents naar “cloud software factories” die de volledige softwarelevenscyclus automatiseren. 🔗 bron
  • Hugging Face Jobs laat nu toe om rechtstreeks een lokale map in een Job te koppelen via -v dossier:/chemin, zonder voorafgaande upload naar een repository. 🔗 bron
  • llama.cpp viert zijn 10 000e publicatie (release), zonder extra technische details. 🔗 bron
  • LlamaCoder v4 (Together AI) genereert complete applicaties in één prompt, herbouwd rond GLM 5.2 met een nieuwe WebAssembly-renderingengine, gratis en open source. 🔗 bron
  • NotebookLM vat zijn recente functies samen (automatische Drive-synchronisatie, vastpinnen van notebooks, herschikken van dia’s, mobiel delen) in afwachting van een aankomende niet-uitgewerkte aankondiging. 🔗 bron
  • GitHub laat voortaan de licentiekost van Code Quality schatten (actieve committers, maandelijkse projectie) vóór de overstap naar 10 dollar per actieve committer per maand, gepland op 20 juli 2026. 🔗 bron
  • NVIDIA lanceert “AI Model Co-Design”, een nieuwe reeks over de synergie tussen modelafmetingen en GPU-prestaties. 🔗 bron
  • Kling AI onthult de trailer van ODYSEEUS: The Fall, de tweede door AI gemaakte langspeelfilm van de studio Fountain 0, geregisseerd door Ash Koosha. 🔗 bron
  • OpenAI publiceert een Enterprise-gids over het sturen van AI-investeringen in het agentische tijdperk, gericht op het meten van nuttig werk per uitgegeven dollar. 🔗 bron
  • OpenAI beschrijft hoe verkoopteams ChatGPT Work gebruiken voor pipeline-notities, vergaderingsvoorbereidingen en diagnoses van vastgelopen deals. 🔗 bron
  • OpenAI beschrijft hoe data-science-teams ChatGPT Work gebruiken voor root-cause-notities, impactverslagen en specificaties van dashboards. 🔗 bron
  • Cohere is co-sponsor van de Hugging Face-hackathon en beloont twee projecten: Tiny Army (2e plaats, spoor Thousand-Token Wood) en Eyas, een video-surveillanceagent (prijs voor beste agent). 🔗 bron

Wat dit betekent

Op materieel vlak structureert NVIDIA zijn communicatie rond één idee: elektrische capaciteit, niet silicium, is voortaan de beperking die de winstgevendheid van een AI-fabriek bepaalt. De prestatiewinsten per watt van Blackwell (tot 25x op DeepSeek V4 Pro) en de Nemotron-klantcases, uitgedrukt in tientallen keren lagere kosten, vertellen hetzelfde verhaal: energie-efficiëntie en kost per token worden het belangrijkste verkoopargument, meer dan brute rekenkracht. De RL Autoresearch-demonstratie sluit daarbij aan door de onderzoeks-, trainings- en evaluatiecyclus zelf te willen automatiseren, tot nu toe grotendeels handmatig.

Aan de modelkant illustreert de week een snelle diversificatie van niches: ultralichte documentherkenning (OvisOCR2), continue videobegrip (MOSS-VL-Realtime), robotica met native diepte (LeRobot), en vooral de ternaire quantisatie van Bonsai 27B, die een multimodale capaciteit van 27 miljard parameters laat passen in een geheugenvoetafdruk die past bij een telefoon. Deze publicaties, gedragen door Hugging Face, Together AI, Sakana AI en onafhankelijke teams, tonen een open-source-ecosysteem dat de gesloten modellen nauw blijft volgen terwijl het de inferentiekosten sterk verlaagt.

Op het gebied van governance steekt de interventie van Demis Hassabis af tegen de gebruikelijke toon van productaankondigingen: ze stelt expliciet dat de huidige commerciële race het collectieve begrip van de risico’s achterop doet raken, en stelt een concreet mechanisme voor — een door de FINRA geïnspireerde Standards Body — in plaats van een loutere oproep tot voorzichtigheid. Dat dit voorstel komt van de CEO van Google DeepMind, midden in een week vol productlanceringen elders, illustreert de spanning tussen commerciële snelheid en regelgevende anticipatie die de hele sector doortrekt.

Tot slot blijft de ontwikkelaarstooling zich herstructureren rond delegatie tussen modellen in plaats van de race naar één enkel krachtiger model: Devin Fusion zet in op een manager-model dat delegeert aan een goedkoper uitvoerend model, GitHub breidt zijn door AI ondersteunde beveiligingsscanning rechtstreeks uit in pull requests, en Perplexity opent zijn WANDR-benchmark om de werkelijke grenzen van zoekagents objectief te maken — een nuttige herinnering dat zelfs de beste huidige systemen nog ver verwijderd zijn van volledige betrouwbaarheid bij fact-checking op grote schaal.


Bronnen