Zoeken

Claude ontdekt ongekende cryptografische kwetsbaarheden, Gemini Robotics ER 2 laat meerdere robots samenwerken, GPT-5.6 verlaagt zijn prijzen

Artikel gegenereerd door kunstmatige intelligentie
Claude ontdekt ongekende cryptografische kwetsbaarheden, Gemini Robotics ER 2 laat meerdere robots samenwerken, GPT-5.6 verlaagt zijn prijzen

ai-powered-markdown-translator

Artikel vertaald van fr naar nl met gpt-5.4-mini.

Bekijk project op GitHub ↗

30 juli 2026 wordt gedomineerd door twee onderzoeksdoorbraken: Claude Mythos, het interne onderzoeksmodel van Anthropic, ontdekt ongekende cryptografische kwetsbaarheden in een post-kwantum kandidaat van NIST en in een verzwakte versie van AES, terwijl Google DeepMind Gemini Robotics ER 2 lanceert, dat meerdere robots laat samenwerken aan één taak. Rond deze twee onderwerpen draaien een prijsverlaging bij OpenAI voor GPT-5.6, een gelijktijdige adoptie van gestapelde pull requests bij GitHub en Devin, verschillende releases van open modellen (Thinking Machines, Sakana AI, LightOn), en een golf aan updates aan de kant van agents (Perplexity, Genspark, Gemini).


Claude Mythos ontdekt ongekende cryptografische kwetsbaarheden (HAWK, AES)

30 juli — Anthropic publiceert onderzoek van zijn Frontier Red Team waaruit blijkt dat Claude Mythos Preview, zijn meest geavanceerde en niet-commerciële interne onderzoeksmodel, ongekende wiskundige kwetsbaarheden heeft ontdekt in twee belangrijke cryptografische algoritmen — verder dan de eenvoudige implementatiebugs die Claude al wist op te sporen in bibliotheken zoals OpenSSL. De aankondiging werd op 28 juli gepubliceerd op X, en daarna uitgebreid toegelicht in een volledig blogartikel.

Eerste resultaat: een verbeterde aanval tegen HAWK, kandidaat uit de derde ronde van de NIST-wedstrijd (de Amerikaanse normalisatieorganisatie) voor post-kwantum digitale handtekeningen. In 60 uur werk, tegen een geschatte kost van ongeveer 100.000 dollar aan API-gebruik, vond het model een aanval die de effectieve sleutellengte van HAWK-256 halveert — de geschatte kost van een volledige aanval daalt van 2^64 naar 2^38 bewerkingen. Tweede resultaat: op een versie van AES-128 die is teruggebracht tot 7 van de 10 rondes, versnelt een nieuwe techniek genaamd Möbius Bridge (brug van Möbius) de beste bekende aanvallen met een factor 200 tot 800, tegen een vergelijkbare kost — het model achtte de taak aanvankelijk onhaalbaar, maar bleef onder impuls van de onderzoekers volhouden, die daarna honderden uren besteedden aan het valideren van het resultaat.

Anthropic verduidelijkt dat geen enkel productiesysteem wordt geraakt: HAWK is slechts een niet-ingevoerde kandidaat, en de aanval op AES geldt alleen voor een verzwakte versie van de versleuteling — de volledige AES met 10 rondes is niet gebroken. Voorlopige resultaten raken ook LEA (sleutel in minder dan een uur teruggevonden op 13 rondes), Serpent-128 (volledige aanval op 6 rondes) en beperktere winst op Salsa20, Poseidon en SHA-1.

Om dit onderzoek verder uit te diepen werkt Anthropic samen met ETH Zurich, Tel Aviv University en TU Berlin aan CryptanalysisBench, een benchmark bedoeld om de cryptanalysecapaciteiten van modellen te meten.

Cryptografisch doelBehaald resultaat
HAWK-256 (post-kwantum handtekening)Effectieve sleutellengte gehalveerd (2^64 → 2^38), gevonden in 60 uur
AES-128 teruggebracht tot 7 van 10 rondesAanval 200 tot 800 keer sneller via de Möbius Bridge-techniek
LEA teruggebracht tot 13 van 24 rondesSleutelherstel in minder dan een uur op een desktopcomputer
Serpent-128 teruggebracht tot 6 van 32 rondesNieuwe volledige sleutelherstelaanval
Salsa20, Poseidon, SHA-1Winst van minder dan 10 keer op de best bekende aanvallen

🔗 Volledig onderzoek — Anthropic


Google DeepMind lanceert Gemini Robotics ER 2

30 juli — Google DeepMind lanceert Gemini Robotics ER 2 (Embodied Reasoning, belichaamd redeneren), zijn meest capabele model om robots van een hoog niveau brein te voorzien. Het begrijpt de fysieke wereld, voert gesprekken met mensen, plant meerstaps taken, en delegeert daarna de motorische uitvoering aan een vision-language-action-model van lager niveau; het kan ook standaard tools aanroepen zoals Google Search of door de ontwikkelaar gedefinieerde functies.

Vergeleken met de vorige versie (ER 1.6) ligt de belangrijkste vooruitgang bij continue videoverwerking: door een live videostream te observeren kan een robot zijn eigen voortgang volgen, zich aanpassen bij een fout en precies weten wanneer hij naar de volgende stap moet gaan. Google introduceert ook multi-robot samenwerking: verschillende machines (bijvoorbeeld een wheeled robot en een humanoïde) communiceren via gedeeld semantisch begrip om complexe taken te verdelen — gedemonstreerd met de Apollo 2-robots van Apptronik en Franka F3 Duo, die samen een garage opruimen.

Qua prestaties haalt het model 57,4 % nauwkeurigheid bij classificatie van taakvoortgang en 91,3 % bij het detecteren van het juiste moment om te handelen (gemiddelde afwijking van 0,96 seconde), met een uitvoeringssnelheid die 4 keer hoger ligt dan die van grotere modellen met vergelijkbare nauwkeurigheid. Op het gebied van veiligheid geeft Google aan dat dit zijn veiligste model tot nu toe is: het stopt een humanoïde robot correct wanneer een persoon nadert, en hervat pas zijn activiteit zodra de zone vrij is.

Het model is vanaf vandaag beschikbaar voor ontwikkelaars via de Gemini API en Google AI Studio, met beperkte vroege toegang op het Gemini Enterprise Agent-platform. Een demonstratie met een Spot-robot van Boston Dynamics, die op stemcommando een snack gaat halen, is ook gedocumenteerd, met code op GitHub.

Prestatie-indicatorGemeten resultaat
Classificatie van taakvoortgang57,4 % nauwkeurigheid
Detectie van het juiste moment om te handelen91,3 % nauwkeurigheid, gemiddelde afwijking van 0,96 seconde
Uitvoeringssnelheid vs. grotere modellen4 keer sneller

🔗 Officiële aankondiging — Google DeepMind


Cursor: cloudagents voltooien 56 % van de gemergde pull requests

30 juli — Cursor deelt een opvallende interne statistiek over de adoptie van zijn cloudagents: in december kwam slechts 1 gemergde pull request op 10 van een cloudagent; vandaag ligt dat cijfer op 56 %. Het bedrijf schrijft deze vooruitgang toe aan het geven van een eigen cloudmachine aan agents, met de mogelijkheid om hun uitvoeringsomgeving zelf te herstellen en te verbeteren — waardoor ze langere engineeringtaken van begin tot eind kunnen uitvoeren.

In December, 1 in 10 of our merged PRs came from cloud agents. Today, it’s 56%, as we use cloud agents to complete longer engineering tasks from start to finish. We got here by giving agents their own cloud computers and letting them fix and improve their environments.

🇳🇱 In december kwam 1 gemergde PR op 10 van cloudagents. Vandaag is dat 56 %, dankzij het gebruik van cloudagents om langere engineeringtaken van begin tot eind succesvol uit te voeren. We zijn hier gekomen door agents hun eigen cloudcomputer te geven en hen hun omgevingen te laten herstellen en verbeteren.@cursor_ai op X


Gestapelde pull requests komen in preview bij GitHub, Devin neemt ze dezelfde dag over

30 juli — Twee afzonderlijke aankondigingen, op dezelfde dag, rond één workflow: een grote wijziging opsplitsen in een reeks kleinere, onafhankelijk te reviewen pull requests.

GitHub maakt gestapelde pull requests algemeen beschikbaar

GitHub zet gestapelde pull requests in publieke preview op alle repositories. In plaats van één gigantische pull request of meerdere branches die handmatig opnieuw gebased moeten worden, wordt de wijziging opgesplitst in geordende lagen, elk te reviewen via een « stack map » die de huidige laag in de context van de hele stapel plaatst, en daarna samen te voegen in één enkele operatie. Het samenvoegen van de bovenste laag laat automatisch alles daaronder landen; het samenvoegen van een middelste laag rebased en retarget automatisch de resterende open lagen, zonder de bestaande branch protection te verliezen. De functie is beschikbaar via github.com, de CLI (extensie gh-stack), de mobiele app, en rechtstreeks vanuit een coding agent zoals GitHub Copilot dankzij de speciale vaardigheid gh-stack.

🔗 Gestapelde pull requests — GitHub

Devin (Cognition) ondersteunt ze nu native

Op dezelfde dag kondigt Devin, de software-engineering agent van Cognition, native ondersteuning aan voor GitHub stacked PRs: grote wijzigingen opdelen in kleinere diffs, comments in de hele stapel verwerken en corrigeren, en wijzigingen downstream automatisch opnieuw baseren wanneer een laag verandert. De gelijktijdige adoptie, zowel op platform- als op agentniveau, laat zien dat dit nieuwe reviewmodel direct ingeburgerd raakt in workflows die door autonome agents worden aangedreven, en niet alleen voor menselijke ontwikkelaars.

🔗 Devin — aankondiging van Cognition


Amp Labs sluit een partnerschap met bank Westpac

29 juli — Amp Labs, de service-/adviesdivisie van Amp (de onafhankelijke spin-off van Sourcegraph), kondigt een partnerschap aan met Westpac, een van de oudste Australische banken — een bedrijf van meer dan twee eeuwen oud. Doel: de manier veranderen waarop de bank haar technologie bouwt en levert, met name de migratie en modernisering van datasystemen die door miljoenen mensen worden gebruikt. Een toegewijd team gaat on site in Sydney werken, naast de ingenieurs van Westpac. Het artikel presenteert het founding team van het project — afkomstig van Block, Ethereum Foundation, Google en Canva — en opent een lokale werving in Sydney. Dit partnerschap illustreert de opkomst van serviceaanbiedingen rond coding agents, voorbij het loutere softwareabonnement: Amp Labs verkoopt voortaan ook een menselijke aanwezigheid op locatie, gekoppeld aan zijn agent.

🔗 Aankondiging — Amp Labs x Westpac


API-prijsverlaging voor GPT-5.6, Fast-modus voor Sol

30 juli — Voortbouwend op de efficiëntiewinsten van de dag ervoor (GPT-5.6 Sol heeft zijn eigen productie-kernels geoptimaliseerd, al eerder besproken), verlaagt OpenAI de API-prijzen van GPT-5.6 Luna, zijn snelste en goedkoopste model, met 80 %, en van GPT-5.6 Terra, zijn evenwichtige model voor algemeen gebruik, met 20 %. Deze verlagingen weerspiegelen zich ook in het kredietverbruik van Codex- en ChatGPT Work-abonnementen, zonder verandering in quota of abonnementsprijzen.

OpenAI introduceert ook een Fast-modus in de API, die het aanbod Priority Processing vervangt: voor GPT-5.6 Sol biedt deze tot 2,5 keer de snelheid van standaardverwerking, tegen het dubbele van de prijs, zonder verandering in intelligentie. Bestaande aanvragen met het label « priority » schakelen automatisch over naar deze nieuwe modus. Verschillende zakelijke klanten worden als getuigen aangehaald, waaronder Replit, Notion, Ramp, Blitzy, Cognition en Dust.

Model en modusPrijs vanaf 30 juli
GPT-5.6 Terra (invoer / uitvoer)2 dollar en 12 dollar per miljoen tokens
GPT-5.6 Luna (invoer / uitvoer)0,20 dollar en 1,20 dollar per miljoen tokens
GPT-5.6 Sol, Fast-modusTot 2,5 keer sneller, tegen het dubbele van de prijs

GPT‑5.6 Luna is the closest we’ve come to intelligence too cheap to meter. I’ve never seen a model this affordable be this powerful — it’s unlocking use cases for Replit we didn’t expect to build for a long time.

🇳🇱 GPT-5.6 Luna komt het dichtst in de buurt van een intelligentie die te goedkoop is om te meten. Ik heb nog nooit een model gezien dat zo betaalbaar is en toch zo krachtig — dat opent voor Replit gebruiksscenario’s die we dachten pas veel later te kunnen bouwen.Michele Catasta, President en Head of AI, Replit — geciteerd door OpenAI


Twee API-instellingen verdrievoudigen de scores van GPT-5.6 Sol op ARC-AGI-3

29 juli — OpenAI publiceert een analyse over de aanvankelijk lage scores van GPT-5.6 Sol (7,8 %) en GPT-5.5 (0,4 %) op de 2D-puzzelbenchmark ARC-AGI-3, terwijl Sol elders open wiskundeproblemen heeft opgelost en complexe videogames heeft verslagen. Het onderzoek toont aan dat het officiële benchmark-harnas het privéredeneren van het model na elke actie verwijdert en zijn geschiedenis afkapt via een sliding window, waardoor het zich zijn eerdere gedachten en acties niet kan herinneren.

Door het harnas opnieuw op te bouwen met de Responses API van OpenAI (de API die in productie wordt gebruikt in ChatGPT en Codex), door het behoud van redenering en compaction te activeren in plaats van truncatie, stijgt de score van GPT-5.6 Sol op de publieke set van 13,3 % naar 38,3 %, met 6 keer minder outputtokens — tegenover een geschatte menselijke referentie van 48 %. OpenAI trekt daaruit een algemene aanbeveling: gebruik de Responses API in plaats van de oudere Chat Completions API om evaluaties te krijgen die representatief zijn voor werkelijk gebruik.

Geteste configuratieBehaalde score (ARC-AGI-3)
Officieel benchmark-harnas13,3 %
Behouden redenering en compaction38,3 % (6 keer minder outputtokens)
Geschatte menselijke referentie48 %

🔗 Volledige analyse — OpenAI


GitHub Copilot in Visual Studio: juli-overzicht

30 juli — GitHub publiceert zijn maandelijkse update over GitHub Copilot in Visual Studio 2026, met vier nieuwigheden. Een nieuwe Agent (Preview) verschijnt in de Copilot Chat-kiezer, gebouwd op dezelfde Copilot SDK die GitHub Copilot CLI aandrijft — belofte van kortere antwoorden en succesvolle taken met minder heen-en-weer. Ingebouwde .NET- en Azure-vaardigheden, geschreven door de betreffende interne teams, verschijnen automatisch in de categorie « Built-in » van de toolkiezer zodra de betrokken workloads zijn geïnstalleerd (standaard uitgeschakeld). Een functie Review Selection laat toe code te selecteren, met rechtsklik, en vervolgens bruikbare inline feedback te krijgen. Ten slotte laten aangepaste instructies op organisatieniveau organisatie-eigenaren toe gedeelde voorkeuren te definiëren die automatisch op alle repositories worden toegepast — beperkt tot Business- en Enterprise-plannen, terwijl de andere drie nieuwigheden beschikbaar zijn op alle plannen.

🔗 Juli-overzicht — GitHub Copilot in Visual Studio


Genspark presenteert SecondBrain, persistente geheugenfunctie voor AI Workspace 6.0

29 juli — Genspark zet, via een media-optreden van zijn COO Wen Sang, een functie in de schijnwerpers die SecondBrain heet binnen AI Workspace 6.0 (al gelanceerd op 20 juli). De gekozen invalshoek: het “geheugenprobleem” van AI-agenten, die de context van een project van de ene sessie naar de andere vergeten. Met expliciete toestemming van de gebruiker maakt SecondBrain verbinding met e-mails, de agenda, de gespreksgeschiedenis, vergadernotities en externe tools (Gmail, Slack, Notion, HubSpot, Microsoft 365…) om een laag persoonlijke context op te bouwen die door Gensparks Super Agent kan worden benut. Verschillende concrete toepassingen worden gedocumenteerd: automatische wekelijkse samenvatting, briefing vóór een vergadering met de context van de deelnemers, of cross-search in alle verbonden bronnen. Genspark onderscheidt deze software van het product SecondBrain Note, een afzonderlijk verkocht fysiek opnameapparaat, dat slechts één optioneel invoerkanaal is naast andere.

🔗 SecondBrain — aankondiging Genspark


Perplexity lanceert Projects, evolutie van Spaces in Computer

30 juli — Perplexity vervangt de “Spaces” door Projects in Computer, zijn orkestratieomgeving voor agenten: persistente werkruimten voor langdurig werk, met een gedeeld en hiërarchisch bestandssysteem waarop opeenvolgende taken kunnen voortbouwen zonder opnieuw te beginnen. De Projects verbinden zich met Brain, het zelfverbeterende geheugensysteem van Computer, dat tussen taken door de bestanden en sessies van het Project herleest zodat elke nieuwe taak start met de opgebouwde context. Het collaboratieve aspect wordt benadrukt: meerdere leden van een team kunnen aan hetzelfde Project werken terwijl hun persoonlijke geheugen en connectors gescheiden blijven op hun eigen account. Perplexity claimt een mogelijke koppeling met meer dan 400 tools (Google Drive, Notion, Linear, Snowflake, GitHub), evenals integratie met Slack en Microsoft Teams. Bestaande Spaces migreren automatisch; vanaf vandaag beschikbaar voor alle gebruikers van Computer.

🔗 Spaces wordt Projects — Perplexity


Gemini Spark integreert Chrome en breidt uit naar 160+ landen

30 juli — Google breidt Gemini Spark, zijn assistent voor het automatiseren van webtaken, uit met een directe integratie in Chrome onder de naam Chrome auto browse. Met toestemming van de gebruiker kan Spark nu gebruikmaken van verbonden accounts en opgeslagen wachtwoorden van de browser om omslachtige taken uit te voeren — het plannen van bezoeken aan opgeslagen appartementen, of het zoeken naar vluchten en het starten van een boeking. Google verduidelijkt dat deze acties beschermd zijn tegen prompt-injectiepogingen, en dat gevoelige stappen zoals betalingen systematisch aan de gebruiker worden teruggegeven ter validatie. De functie start in de Verenigde Staten, met een geplande uitbreiding naar andere regio’s. Tegelijkertijd wordt de toegang tot Spark uitgebreid naar abonnees van Google AI Pro in meer dan 160 extra landen vanaf vandaag — een veel bredere uitbreiding dan die van 23 juli, die beperkt was tot de Verenigde Staten.

🔗 Updates Gemini Spark — Google


Nano Banana komt naar Google Earth

30 juli — Google Earth integreert nu Nano Banana 2, het beeldgeneratiemodel van Google, rechtstreeks in de webinterface. Het volstaat om in te zoomen op een locatie, te klikken op “create image” en te beschrijven wat men wil visualiseren: het model genereert een beeld dat verankerd is in de echte beeldvorming van de locatie (satelliet-, lucht- en 3D-beelden), en niet een generieke scène. Het artikel beschrijft vijf concrete toepassingen: een historische site reconstrueren (de ruïnes van Pompeï zoals ze waren in 78 na Chr.), educatieve infographics over een locatie maken, plannen voor vastgoed- of stedelijke ontwikkelingsprojecten produceren, een bouwproject visualiseren vóór de werkzaamheden, of gewoon een plek op fantasierijke wijze opnieuw verbeelden. De functie is vanaf vandaag wereldwijd beschikbaar voor alle gebruikers van Google Earth op het web, zonder geografische beperking of specifiek abonnementsniveau.

🔗 Nano Banana in Google Earth — Google


ElevenLabs lanceert Character Casting in ElevenCreative Audiobooks

30 juli — ElevenLabs lanceert Character Casting binnen ElevenCreative Audiobooks, zijn AI-suite voor de productie van audioboeken. De functie maakt het mogelijk om een volledig manuscript te importeren en vervolgens direct verschillende stemmen te beluisteren op echte dialogen uit de tekst, zodat aan elk personage een eigen stem kan worden toegewezen. Het doel is om de stemcasting te vereenvoudigen, een stap die tot nu toe handmatig en tijdrovend was in de productie van door AI gegenereerde audioboeken — de studio stemt de stem nu af op daadwerkelijk uitgesproken replieken in het boek in plaats van op een generieke demonstratietekst.

🔗 Character Casting — ElevenLabs


Inkling-Small: Thinking Machines publiceert, NVIDIA volgt dezelfde dag

30 juli — Thinking Machines (het laboratorium van Mira Murati) lanceert Inkling-Small, een gecomprimeerde versie van Inkling: in totaal 276 miljard parameters, 12 miljard actief, NVFP4-kwantisatie, voor prestaties die vergelijkbaar zijn met Inkling — vier keer zo groot — met volgens Hugging Face betere resultaten in code. De volledige gewichten worden open toegankelijk gepubliceerd, met fine-tuning mogelijk via Tinker en testen in de Tinker Playground (tekst, afbeelding, audio). Hugging Face versterkt de lancering dezelfde dag met een blog gewijd aan benchmarks en prestaties, en een modelcollectie op de Hub.

NVIDIA verrijkt de release dezelfde dag door de compatibiliteit van Inkling-Small met NVIDIA NeMo op DGX Station aan te kondigen, voor fine-tuning, evenals een checkpoint in het NVFP4-formaat dat rechtstreeks op Hugging Face wordt gepubliceerd. Deze hardwareondersteuning vanaf dag 0 illustreert de snelheid waarmee het ecosysteem zich tegenwoordig rond een open model van een derde partij coördineert: het laboratorium publiceert de gewichten, Hugging Face documenteert de prestaties, en NVIDIA garandeert de compatibiliteit van zijn fine-tuning-infrastructuur — allemaal in één dag.

Technische eigenschapGemeten waarde
Totale / actieve parameters276 miljard / 12 miljard
KwantisatieNVFP4
Hardwarecompatibiliteit dag-0NVIDIA NeMo op DGX Station

🔗 Lancering — Thinking Machines op X

🔗 NeMo/DGX-ondersteuning — NVIDIA op X


Sakana AI en NYU publiceren Dream-Cubed, dataset en modellen voor Minecraft

29 juli — Sakana AI publiceert, samen met de New York University (NYU), Dream-Cubed : Controllable Generative Modeling in Minecraft by Training on Billions of Cubes. De bijdrage is tweeledig: een uitgebreide dataset van Minecraft-werelden (tientallen miljarden “cubes” afkomstig uit procedurele terreinen en kaarten die door mensen met hun toestemming zijn gebouwd), en een familie van transformers die op deze cubes zijn getraind als tokenisatie-eenheid, in de stijl van woorden in taalmodellering. De modellen maken het mogelijk om interactieve 3D-omgevingen in realtime te genereren en te bewerken op cube-resolutie, met gerichte inpainting, grootschalige outpainting en door de gebruiker geconditioneerde generatie, over werelden van willekeurige grootte. De dataset, de trainingscode en het artikel worden open toegankelijk gepubliceerd.

🔗 Aankondiging — Sakana AI op X


Together AI en Y Combinator lanceren een dedicated GPU-cluster voor YC-startups

30 juli — Together AI en Y Combinator kondigen een partnerschap aan dat het eerste dedicated GPU-cluster voor de portefeuille van YC-startups oplevert. Het doel: de belangrijkste knelpunt van jonge AI-startups — toegang tot rekenkracht — wegnemen zonder hen te dwingen tot compute-contracten van meerdere jaren die vaak hun totale kaspositie overstijgen. Startups uit de YC-portefeuille kunnen hun GPU’s reserveren, provisioneren en zelf beheren via het self-serviceportaal van Together AI, voor ad-hoc behoeften aan inferentie en training, zonder langetermijnverplichting, terwijl ze profiteren van tarieven die normaal zijn voorbehouden aan langetermijncontracten. Op dezelfde dag zet Together AI een eerste concreet gebruik in de verf: de startup Osmosis_AI, die onderzoekt of een open-source model het niveau van een foundation model kan bereiken via reinforcement learning, getraind op dit cluster.

🔗 YC-dedicated GPU-cluster — Together AI


LightOn publiceert mDenseOn & mLateOn op de Hugging Face-blog

30 juli — Het Franse laboratorium LightOn AI publiceert op de Hugging Face-blog de collectie mDenseOn & mLateOn: informatiezoekmodellen (retrieval) met één vector en meerdere vectoren, evenals de bijbehorende datasets, gespecialiseerd in meertalige zoekopdrachten, lange context en code search — in totaal 18 onderdelen, gepubliceerd met open gewichten. Deze publicatie volgt hetzelfde patroon als de release van LiquidAI (LFM2.5-Encoders) op 28 juli: een extern laboratorium gebruikt de Hugging Face-blog als officieel lanceerkanaal, met de modelkaart en collectie rechtstreeks gehost op de Hub.

🔗 mDenseOn & mLateOn — Hugging Face-blog


Kort nieuws

  • Cognition werkt FrontierCode 1.1 bij — met de nieuwe tariefkortingen van GPT-5.6 Terra en Luna (zie hierboven) positioneert de serie zich nu op de Pareto-kost/prestatiecurve. 🔗 bron
  • Hugging Face lanceert Trackio Logbooks — versie 0.34.0 van Trackio legt automatisch de code, agenttraces en artefacten van een AI-experiment vast als een reproduceerbare statische HTML-bundel. 🔗 bron
  • Antigravity CLI gaat naar versie 1.1.8 — gestructureerde uitvoerformaten (json, stream-json) voor de printmodus, validatie via aangepast JSON-schema en verbeterde rechten voor samengestelde opdrachten. 🔗 bron
  • GitHub Models is officieel verwijderd — playground, modelcatalogus, inferentie-API en BYOK zijn niet langer toegankelijk voor welke klant dan ook; GitHub verwijst door naar Microsoft Foundry of GitHub Copilot. 🔗 bron
  • GitHub beperkt externe bediening tot beheerde apparaten — nieuwe enterprise-instelling remoteControl (requireSSO / disabled / enabled) voor Copilot-sessies met externe bediening, uitrolbaar via een privé-repository, MDM of configuratiebestand. 🔗 bron
  • Kimi K3 (Max) neemt de leiding in de Fullstack Code Arena-ranglijst — vóór GPT-5.6 Sol (xHigh) en Claude Fable 5, nog een teken dat open modellen gesloten modellen inhalen bij volledige ontwikkeltaken (zie Inkling-Small hierboven). 🔗 bron

Wat dit betekent

Fundamenteel onderzoek komt uit het laboratorium. Claude Mythos vindt nieuwe zwakke plekken in een post-quantum kandidaat van het NIST en in een verzwakte versie van AES — een onderzoeksdoorbraak, geen in productie uitbuitbare kwetsbaarheid, maar wel een illustratie van de snelheid waarmee een intern onderzoeksmodel een domein kan vooruithelpen dat mensen al decennialang bestuderen. Op dezelfde dag zorgt Gemini Robotics ER 2 ervoor dat belichaamde robotica evolueert van één enkele robot die opdrachten uitvoert naar meerdere machines die zich onderling coördineren voor een gedeelde taak. Google Earth verankert ook beeldgeneratie opnieuw in de echte wereld: Nano Banana tekent niet langer een generieke scène, maar een reconstructie of projectie op basis van satellietbeelden van een specifieke locatie — terwijl Gemini Spark, via Chrome, van tekst naar concrete actie op het echte web van de gebruiker gaat. Vier verschillende manieren, op 30 juli, waarop AI het puur conversationele terrein verlaat.

De economie van inferentie blijft in het voordeel van ontwikkelaars kantelen. OpenAI verlaagt de API-prijzen van GPT-5.6 Luna met 80% en van Terra met 20%, terwijl het een Fast-modus introduceert die twee keer zo duur is maar 2,5 keer sneller — twee tegenovergestelde manieren om de prijs af te stemmen op het werkelijke gebruik. Op dezelfde dag toont een analyse van OpenAI aan dat een eenvoudige wijziging in de API-configuratie (redenering behouden, compaction) de score van GPT-5.6 Sol op ARC-AGI-3 verdrievoudigt terwijl het output-tokenverbruik zes keer kleiner wordt — de prestaties van een model hangen net zozeer af van de omgeving waarin het draait als van het model zelf. Cognition trekt daar een onmiddellijke conclusie uit door zijn eigen benchmark FrontierCode bij te werken: met de nieuwe kortingen bevindt GPT-5.6 zich op de Pareto-kost/prestatiecurve.

Open modellen blijven gesloten modellen inhalen. Thinking Machines publiceert Inkling-Small met door NVIDIA ondersteunde hardware vanaf de lancering; Sakana AI en NYU openen een dataset en generatieve modellen voor Minecraft; LightOn publiceert zijn collectie meertalige informatiezoekmodellen — drie verschillende laboratoria die hetzelfde kanaal kiezen, de Hugging Face-blog, om hun werk op dezelfde dag te lanceren en te documenteren. Kimi K3 (Max), al koploper in de Agent Arena-ranglijst, neemt ook de eerste plaats in de Fullstack Code Arena-ranglijst, vóór GPT-5.6 Sol en Claude Fable 5. En Together AI pakt, samen met Y Combinator, aan wat nog altijd de echte bottleneck van dit ecosysteem is: toegang tot rekenkracht, door een dedicated GPU-cluster te leveren aan YC-AI-startups zonder hen te verplichten tot meerjarige verbintenissen.

De industrialisering van code-agenten versnelt. Bij Cursor is het aandeel gemergede pull requests afkomstig van cloud-agenten gestegen van 10% in december naar 56% vandaag. GitHub maakt gestapelde pull requests algemeen beschikbaar in publieke preview, en Devin (Cognition) ondersteunt ze op dezelfde dag natively — eenzelfde reviewworkflow die zowel aan platformzijde als aan agentzijde tegelijk wordt overgenomen. Amp Labs verkoopt ondertussen ook een menselijke aanwezigheid op locatie (een team ter plaatse in Sydney voor Westpac) naast zijn agent, terwijl GitHub Copilot in Visual Studio uitbreidt met een nieuwe agent gebaseerd op zijn SDK. Genspark en Perplexity werken aan een gerelateerd probleem, dat van geheugen: SecondBrain en Projects geven hun agenten allebei een persistente context tussen sessies, een voorwaarde om lange taken uit te voeren zonder telkens opnieuw te beginnen.


Bronnen