ai-powered-markdown-translatorArtikel vertaald van het Frans naar het Nederlands met gpt-5.6-sol.
GPT-6 Astra verlaat vierentwintig uur na de lancering de beperkte uitrol: het model wordt toegankelijk voor Pro-, Enterprise- en Business Premium-abonnementen, wordt algemeen beschikbaar in GitHub Copilot en behaalt de hoogste score die Perplexity ooit heeft gemeten op zijn benchmark voor gedocumenteerd onderzoek. Anthropic publiceert ondertussen het eerste computergeverifieerde bewijs van de laatste stelling van Fermat, in elf dagen geschreven door Claude. GitHub stelt HydraFusion open, een modus die voor elke taak zelf het model en de workflow kiest, Google brengt Lyria 3.5 uit in de Gemini-app en SpaceXAI stelt Grok Bot open voor bedrijven, met documentatie over een inkoopagent die bij zijn eigen werkgever meer dan 100.000 dollar aan besparingen heeft gevonden.
GPT-6 Astra verlaat de beperkte uitrol en wordt algemeen beschikbaar in Copilot
4 september — OpenAI kondigt om 22.13 uur Parijse tijd aan dat GPT-6 Astra de beperkte uitrol verlaat. Het model is toegankelijk voor alle Pro-, Enterprise- en Business Premium-gebruikers in ChatGPT Work en Codex, en de API stelt het voortaan zonder voorbehoud beschikbaar, terwijl de aankondiging van 3 september nog sprak van een geleidelijke uitrol. Plus-abonnees en Business-gebruikers moeten nog enkele dagen geduld hebben, zo wordt in hetzelfde bericht verduidelijkt.
| Betrokken platform | Toegang op 4 september |
|---|---|
| OpenAI API | Zonder voorbehoud beschikbaar |
| ChatGPT Work en Codex, Pro | Beschikbaar |
| Enterprise en Business Premium | Beschikbaar |
| Plus en overige Business | Enkele dagen vertraging |
🔗 Aankondiging van OpenAI op X
Algemeen beschikbaar in GitHub Copilot, vanaf de eerste dag tegen het openbare tarief
Diezelfde dag wordt GPT-6 Astra algemeen beschikbaar in GitHub Copilot. GitHub legt de nadruk op de werkwijze van het model en niet op zijn scores: in interne tests plant en valideert Astra tijdens de uitvoering, combineert het diagnose met verificatie en bevestigt het zelf zijn resultaten voordat het een taak als voltooid markeert. Daardoor presteert het beter op langdurige taken en heeft het minder stappen nodig dan eerdere OpenAI-modellen. De aankondiging bevat geen benchmarkcijfers.
Het model verschijnt op tien platformen, van Visual Studio Code en de JetBrains IDE’s tot Copilot CLI, GitHub Mobile, Xcode en Eclipse, maar blijft voorbehouden aan de abonnementen Pro+, Max, Business en Enterprise. Copilot Pro valt buiten de boot. De facturering verdient aandacht: voor Astra geldt bij betalen naar gebruik vanaf het begin het openbare tarief van de leverancier, zonder promotieperiode, terwijl Gemini 3.8 Flash, dat een dag eerder verscheen, tot en met 31 december 2026 een introductietarief krijgt.
Perplexity kent het zijn hoogste score op WANDR toe
Perplexity publiceerde op 3 september om 23.10 uur het resultaat van Astra op WANDR, zijn eigen benchmark voor grootschalig gedocumenteerd onderzoek. Het model behaalt een score van 0,682 tegen 11,98 dollar per taak, de hoogste score van alle modellen die het bedrijf heeft getest.
| Geëvalueerd model | WANDR-score | Kosten per taak | Meting gepubliceerd op |
|---|---|---|---|
| GPT-6 Astra | 0,682 | 11,98 dollar | 3 september 2026 |
| Claude Fable 5.1 | 0,601 | 12,76 dollar | 1 september 2026 |
Perplexity geeft ook twee relatieve verschillen: een 13,5 procent hogere score dan Claude Fable 5.1 tegen 6,1 procent lagere kosten, en 27,0 procent hoger dan Opus 5 tegen 3,3 procent hogere kosten. Daarbij zijn twee kanttekeningen nodig. WANDR is een eigen benchmark waarvan de gedetailleerde methodologie niet is gepubliceerd, en Perplexity is tevens klant van de modellen die het rangschikt. Voor Opus 5 is geen absolute waarde bekendgemaakt.
Drie correcties voor Codex CLI voltooien de integratie
Aan de commandoregelzijde werd versie 0.153.0, die in de nacht van 3 september verscheen, in minder dan twee dagen gevolgd door drie correcties die allemaal aan Astra waren gewijd. Versie 0.153.1 maakt het mogelijk het model via de API te configureren zonder het standaardmodel te wijzigen of het in de keuzelijst te laten verschijnen. Versie 0.153.2 corrigeert een label: de Fast-laag wordt beschreven als 2x zo snel in plaats van 1,5x, zonder dat de verwerking van verzoeken verandert. Versie 0.153.3, gepubliceerd op 4 september om 21.01 uur, voegt Astra toe aan de Amazon Bedrock-modelkeuzelijst voor de Mantle- en Runtime-routes en corrigeert de instructie aan het model voor asynchrone verduidelijkingsvragen.
OpenAI sloot de dag af met drie praktijkverslagen: twee artikelen op het ontwikkelaarsblog, het ene over een procedureel ruimteverkenningsspel dat in Codex is gebouwd en het andere over het ontwerp van een huis dat in Blender en Unreal Engine 5 wordt verkend, plus een artikel van Dominik Kundel over vijf veranderingen in de manier waarop hij Codex gebruikt.
🔗 Releaseopmerkingen voor Codex CLI 0.153.3 · 🔗 Een spel bouwen met Astra
Claude levert het eerste geformaliseerde bewijs van de laatste stelling van Fermat
4 september — Anthropic publiceert het eerste volledig door een computer geverifieerde bewijs van de laatste stelling van Fermat. Claude werkte elf dagen, grotendeels autonoom, om het in Lean te schrijven. Het bedrijf beschrijft het als het grootste Lean-bewijs dat ooit is opgebouwd.
| Gemeten metriek | Vastgestelde waarde |
|---|---|
| Duur van Claudes werk | 11 dagen |
| Geschreven regels Lean | 13 miljoen |
| Bewezen tussenstellingen | 29.500 |
| Eerste menselijke bewijs, door Wiles | 1995, 129 pagina’s |
| Tijd tussen het vermoeden en het bewijs | meer dan 350 jaar |
De stelling zegt dat geen enkel drietal positieve gehele getallen aan de vergelijking van Fermat voldoet voor een exponent groter dan twee. Pierre de Fermat krabbelde haar rond 1637 in de marge van zijn exemplaar van de Arithmetica van Diophantus. Het eerste correcte bewijs is van Sir Andrew Wiles uit 1995: 129 pagina’s, maandenlange menselijke verificatie en een eerste versie die in 1993 werd gepresenteerd, waarin een beoordelaar twee maanden later een kritieke fout blootlegde.
De eerste pogingen mislukten: de agents boekten snel succes, maar raakten daarna de draad kwijt. De doorbraak kwam dankzij Prove2Me, een open samenwerkingsplatform voor formalisering, gekoppeld aan een multi-agentharnas op basis van Claude Code. Het platform onderhoudt een gerichte acyclische graaf van beweringen waarmee agents het volgende bewijs kunnen kiezen om te proberen, scheidt beweringen en bewijzen in afzonderlijke bestanden om de Lean-compilatie te versnellen en bewaart van elke bewering een beschrijving in natuurlijke taal om zoeken en hergebruik mogelijk te maken. Het geproduceerde bewijs volgt de vereenvoudigde uiteenzetting van Wiles door Henri Darmon, Fred Diamond en Richard Taylor.
This extraordinary autoformalization achievement, which Anthropic researchers say only took 11 days, proves Fermat’s Last Theorem with no assumptions other than the axioms of mathematics.
🇳🇱 Deze buitengewone prestatie op het gebied van autoformalisering, waarvoor volgens de onderzoekers van Anthropic slechts elf dagen nodig waren, bewijst de laatste stelling van Fermat zonder andere aannames dan de axioma’s van de wiskunde. — Kevin Buzzard, beoordelaar van het resultaat, geciteerd op de onderzoekspagina van Anthropic
Anthropic presenteert verificatie, en niet ontdekking, als de kern van de zaak, in tegenstelling tot recent AI-onderzoek naar de Riemann-hypothese, dat nieuwe wiskunde opleverde. Naarmate het aantal bewijzen toeneemt, wordt collegiale toetsing een knelpunt dat in jaren wordt gemeten.
Met Project HydraFusion laat GitHub het hulpmiddel het model kiezen in plaats van de ontwikkelaar
4 september — GitHub stelt Project HydraFusion als onderzoekspreview open, een modus die niet langer één model aanwijst, maar een workflow. Waar de keuzelijst van Copilot vroeg om uit meer dan twintig modellen te kiezen, beslist HydraFusion voor elk verzoek zelf welk model de taak verwerkt en volgens welk uitvoeringsschema. Het wordt net als ieder ander model geselecteerd, maar orkestreert achter die ene keuze meerdere modellen.
Er bestaan momenteel drie schema’s. De modus Single vertrouwt de taak toe aan één model. In de modus Cascade stelt een efficiënt model een eerste oplossing op, waarna een kwaliteitspoort beslist om die te accepteren of naar een capabeler model op te schalen. In de modus Critique wordt het concept nagekeken door een onafhankelijke criticus uit een andere modelfamilie, die alleen leestoegang heeft.
| Geëvalueerde benchmark | Kostenverschil ten opzichte van Opus 5 | Kwaliteitsverschil ten opzichte van Opus 5 |
|---|---|---|
| TerminalBench 2.1 | 67 procent lager | plus 4,9 punten |
| DeepSWE | 36 procent lager | min 1,5 punt |
| CheckpointBench | 65 procent lager | min 0,1 punt |
De uitvoering wordt begrensd door vijf technische principes: geaggregeerde boekhouding van de kosten van elke stap, expliciete time-outs en annulering, beoordeling in een geïsoleerde context en zonder hulpmiddelen, ingebouwde beveiliging waarbij geen enkele correctie wordt toegepast als de workflow mislukt, en validatie van de routering vóór de uitvoering. GitHub erkent een compromis in de interface: de stappen worden getoond, maar tussentijdse concepten worden achtergehouden tot het eindresultaat, en het bedrijf geeft toe dat wachten zonder voldoende inzicht een reëel nadeel is.
De documentatie over de ontwikkeling is ongewoon openhartig: GitHub beschouwt TerminalBench 2.1 als de volledigste reeks runs, verduidelijkt dat de vooruitgang niet lineair verliep en erkent dat twee operationele storingen in het evaluatieharnas tussen 11 en 25 augustus ongeldige runs hebben opgeleverd. Deze runs zijn uit de trend verwijderd en vervolgens gecorrigeerd, en het bedrijf plaatst de beste werkpunten van de geregistreerde reeks op 25 augustus. Toegang verloopt via Copilot CLI voor alle abonnementen, tegen het standaardtarief op basis van het totale aantal tokens van de workflow, na /update en vervolgens /experimental on.
Lyria 3.5 verschijnt in de Gemini-app en in de API
4 september — Google brengt Lyria 3.5 uit, dat het presenteert als zijn muziekgenereermodel met de beste geluidsweergave, expressievere stemmen en rijkere arrangementen.
In de Gemini-app gaat de update gepaard met drie wijzigingen in de interface. De gebruiker kan een muziekgenre selecteren of beschrijven en kiezen tussen zang en een instrumentale uitvoering. Nieuwe gebruiksklare sjablonen (templates) dienen als vertrekpunt, of het nu gaat om achtergrondmuziek of een gepersonaliseerd verjaardagsnummer. De lengte van het nummer kan voortaan worden ingesteld, van een kort tot een lang formaat.
| Type platform | Toegang tot Lyria 3.5 |
|---|---|
| Grote publiek | Gemini-app op web en mobiel, wereldwijd |
| Professionele creatie | Google Flow Music |
| Ontwikkelaars | Gemini API, Google AI Studio, Google Vids |
Google positioneert het verwachte gebruik bij alledaagse behoeften en niet bij professionele productie: een begeleidingstrack voor een video, een merkjingle of een gepersonaliseerde beltoon. De distributie is breed en er wordt geen abonnementsbeperking genoemd. Het artikel bevat daarentegen geen cijfers over de audiokwaliteit, geen vergelijking met de vorige versie van Lyria en geen tarief voor toegang via de API.
SpaceXAI zet Grok aan het werk in bedrijven en publiceert de systeemprompt van zijn inkoopagent
3 en 4 september — SpaceXAI stelt Grok Bot open voor bedrijven. Het product, dat op 12 augustus werd gelanceerd, evolueert van een aanbod voor individuele abonnees en Cursor-teams naar een versie met toegangs-, netwerk- en auditcontroles. Het werk van elke gebruiker wordt in een geïsoleerde omgeving uitgevoerd en een Bot heeft standaard nergens toegang toe: hij kan alleen de accounts bereiken waarmee hij expliciet wordt verbonden. Klanten van Grok Enterprise en Cursor Enterprise krijgen twee weken gratis toegang en kunnen hun hele organisatie uitnodigen, inclusief mensen zonder bestaande licentie. SpaceXAI noemt Legora, Supermicro en ServiceTitan en stelt dat duizenden organisaties het product sinds de lancering hebben ingevoerd.
Het interessantste punt van de aankondiging is dat het intensiefste gebruik buiten engineering plaatsvindt: nachtelijke prospectie en beoordelingsschema’s bij werving, conceptmails en updates van presentaties bij verkoop, en het extraheren van vragen en antwoorden uit een webinar bij marketing.
De volgende dag publiceert het bedrijf een casestudy over een Bot die op zijn eigen inkoop werd losgelaten. De zogeheten Haggle Bot, verbonden met Slack, Notion, Drive, Gmail, Hex en Ramp, meldt meer dan 100.000 dollar aan directe besparingen.
| Vondst van de agent | Vastgesteld bedrag |
|---|---|
| Totale directe besparingen | meer dan 100.000 dollar |
| 90 dagen inactieve licenties, eerste product | 43 licenties, 14.220 dollar |
| Ongebruikte referenties, maandelijks product | 85.662 dollar per jaar |
De redactionele waarde van het artikel gaat verder dan deze cijfers: SpaceXAI publiceert het systeempromptsjabloon van de agent, gepresenteerd als een model dat voor de eigen organisatie kan worden ingevuld en waarvan de voorbeeldwaarden tussen punthaken staan. De sectie over machtigingen onderscheidt drie permanente regimes. Het eerste vraagt nooit om toestemming, met als voorbeelden het lezen van uitgavengegevens en berichten aan collega’s. Het tweede vereist telkens de uitdrukkelijke goedkeuring van de operator; het versturen van iets naar een leverancier is het gegeven voorbeeld. Het derde blijft onder alle omstandigheden verboden, met als voorbeelden ondertekenen, aankopen, abonnementen afsluiten, uitgaven goedkeuren en iedere bindende toezegging. Het artikel verduidelijkt in proza dat het team de agent zelfstandig intern onderzoek en coördinatie liet uitvoeren, maar uitdrukkelijke goedkeuring vereiste om geld uit te geven, voorwaarden te aanvaarden of naar een leverancier te schrijven.
🔗 Grok Bot voor Enterprise · 🔗 Haggle Bot losgelaten op de inkoop
Grok maakt via Plaid verbinding met Amerikaanse bankrekeningen
4 september — Grok kan voortaan verbinding maken met de financiële rekeningen van zijn gebruikers. De verbinding verloopt via Plaid, de technische tussenpartij die applicaties en financiële instellingen in de Verenigde Staten met elkaar verbindt, en de functie is per direct uitsluitend in dat land beschikbaar.
De drie door SpaceXAI gekozen voorbeelden schetsen het beoogde toepassingsgebied: achterhalen waar het geld van de afgelopen maand naartoe is gegaan, de prestaties van beleggingen volgen en controleren of men zich daadwerkelijk kan veroorloven wat er in het winkelmandje zit. Met andere woorden: analyse van eerdere uitgaven, portefeuilletracking en ondersteuning bij aankoopbeslissingen op het moment dat die zich aandienen. De aankondiging blijft beknopt en zegt niets over de verwerking van gegevens of de ondersteunde instellingen, afgezien van de vermelding van een beveiligde verbinding.
Dit bouwt voort op een reeks financiële integraties die begon met de koppeling met Interactive Brokers van 25 juni, maar de aard ervan verandert: waar Interactive Brokers zich richtte op actieve beleggers, stelt Plaid de assistent open voor de betaalrekeningen van het grote publiek.
Claude Code 2.1.260 en 2.1.261: diff-paneel, audit van skills en aangescherpte machtigingen
4 september — Twee versies van Claude Code verschijnen op dezelfde dag en vullen elkaar aan: de eerste biedt inzicht in het lopende werk, de tweede in wat de sessie verbruikt.
| Gepubliceerde versie | Verschijningstijd | Belangrijkste bijdragen |
|---|---|---|
| 2.1.260 | 4 september 01.48 uur | Paneel /diff, cachediagnose in /cost, correcties voor machtigingen |
| 2.1.261 | 4 september 21.58 uur | /skill-doctor, uitvoer tot 128.000 tekens, prompt voor subagent in bestand |
Versie 2.1.260 opent naast het gesprek in volledigschermmodus een diff-paneel dat tijdens het bewerken de niet-gecommitte wijzigingen weergeeft. Vooral worden meerdere kwetsbaarheden in de evaluatie van machtigingen verholpen: regels voor Edit, Write en Read waarvan het pad haakjes bevatte, werden als ongeldig geweigerd of door de Bash-sandbox genegeerd, waardoor naar mappen kon worden geschreven die alleen-lezen hadden moeten zijn; daarnaast werden zsh-opdrachten die een command substitution in een toewijzing REPORTTIME verborgen, automatisch goedgekeurd.
Versie 2.1.261 voegt /skill-doctor toe, dat de geladen maar ongebruikte skills en de contextkosten van elk ervan opsomt. De automatische modus behandelt een link die inhoud in de URL van een openbare diagramgenerator verpakt voortaan als een verzending naar een externe website.
🔗 Releaseopmerkingen 2.1.260 · 🔗 Releaseopmerkingen 2.1.261
Het commando ant apply zet Managed Agents om in versiebeheerde bestanden
4 september — Anthropic voegt ant apply toe aan zijn CLI ant. Het commando past op Managed Agents het declaratieve model toe waarmee infrastructuurteams vertrouwd zijn: de gewenste toestand wordt beschreven in bestanden in de repository, waarna het commando de API-resources met die beschrijving in overeenstemming brengt.
Het gaat om vijf typen resources: Managed Agent-omgevingen, de agents zelf, skills, geheugenopslagplaatsen (memory stores) en implementaties. Tot nu toe werden deze objecten aangemaakt via API-aanroepen of de console, zonder spoor in de repository. Door ze in bestanden te beschrijven, vallen ze onder codereview, versiebeheer en continuous-integration-pipelines. Het praktische voordeel is reproduceerbaarheid: een in een bestand beschreven agentomgeving kan identiek opnieuw worden aangemaakt, tussen branches worden vergeleken of zonder handmatige tussenkomst vanuit een pipeline worden geïmplementeerd.
De reeks van NVIDIA: duurzaam agentgeheugen, redeneren op Jetson en federatieve identiteit
3 en 4 september — Op dezelfde dag verschijnen drie publicaties op de technische blog van NVIDIA, elk over een andere laag van de stack.
De eerste is een open recept, gebouwd op NemoClaw: een agent die als kabinetschef fungeert en een duurzaam geheugen van het werk van zijn gebruiker bijhoudt. De stelling is in één zin samen te vatten: een nuttig agentgeheugen vereist structuur, selectieve retrieval en governance, niet alleen opslag. Het systeem berust op een zelfmodel (self model), een door mensen leesbare kennislaag in gestructureerde Markdown-pagina’s, aangevuld met een SQLite-register dat verplichtingen, rangschikkingen, correcties en auditgebeurtenissen bewaart. De uitvoering verloopt via NVIDIA OpenShell, dat het beleid voor toegang tot het bestandssysteem, processen en het netwerk in een sandbox afdwingt, terwijl de inloggegevens buiten de sandbox blijven.
| Gemeten metriek | Agentische RAG-basis | Zelfmodel | Vastgesteld verschil |
|---|---|---|---|
| Algehele nauwkeurigheid, over 186 vragen | 82,8 procent | 90,9 procent | plus 8,1 punten |
| Moeilijke vragen, over 31 vragen | 67,7 procent | 87,1 procent | plus 19,4 punten |
| Veranderende feiten volgen, over 5 | 60,0 procent | 100,0 procent | plus 40,0 punten |
| Trouw aan het corpus, over 13 vragen | 100,0 procent | 92,3 procent | min 7,7 punten |
Context can inform an action, but it cannot authorize one.
🇳🇱 Context kan een handeling verduidelijken, maar kan deze niet autoriseren. — NVIDIA-blogbericht over agentgeheugen
De tweede publicatie is een implementatiehandleiding die een omslag voor embedded AI markeert: NVFP4-kwantisatie in combinatie met speculative decoding haalt op Jetson AGX Thor en Orin tot 6,28 keer de decodeerdoorvoer van BF16. De optimale configuratie verschilt per model en NVIDIA benadrukt dit punt in plaats van één universele winnaar aan te wijzen: Nemotron 3.5 Lightning behaalt zijn beste resultaat met DSpark, tussen 123 en 138 outputtokens per seconde, en Qwen3.8-27B met DFlash2, tussen 27,7 en 34,4 tokens per seconde. De afsluitende waarschuwing is methodologisch: de doorvoer varieert naargelang de belasting, dus valideer de configuratie met prompts die representatief zijn voor de beoogde toepassing. De derde, bescheidener publicatie beschrijft de doorgifte van de identiteit van een gebruiker tussen federatieve Kubernetes-platforms en AI-platforms.
🔗 Edge-redeneren op Jetson · 🔗 Identiteit tussen federatieve platforms
De command-line-tools van Google: Gemini CLI gaat over op serie 0.60.0, Antigravity stelt Flash open voor bedrijven
3 en 4 september — Het nightly-kanaal van Gemini CLI verlaat serie 0.59.0 voor 0.60.0, met een release waarin beveiliging centraal staat. De opvallendste correctie verwijdert een hardgecodeerde Google CrUX-API-sleutel uit de component chrome-devtools-mcp. Twee andere wijzigingen scherpen de isolatie aan: de macOS Seatbelt-sandbox krijgt een geïsoleerde tijdelijke map en de extensielader past een versterkte padresolutie toe, gekoppeld aan grensvalidatie. De vierde wijziging verplicht in de OAuth-flow van MCP-servers tot identificatie van de issuer conform RFC 9207, als bescherming tegen aanvallen waarbij de autorisatie-instantie wordt vervangen.
Antigravity 2.12.2, dat een dag eerder verscheen, bevat slechts één verbetering en geen correcties: zakelijke gebruikers krijgen toegang tot de redeneermodellen Gemini 3.8 Flash door zich te authenticeren met de standaardinloggegevens van de applicatie (Application Default Credentials). Het praktische voordeel is dat het model aansluit op de standaardauthenticatiemethode van Google Cloud-implementaties, zonder individuele API-sleutel.
🔗 Gemini CLI v0.60.0 nightly · 🔗 Changelog van Antigravity
AI ten dienste van de wetenschap: een gekoppelde klimaatemulator en het volledige connectoom van een mannelijke fruitvlieg
3 en 4 september — Twee publicaties passen machine learning toe op enorme wetenschappelijke objecten in twee disciplines die niets met elkaar te maken hebben.
Ai2 publiceert SamudrACE-E3SMv3 onder de Apache 2.0-licentie op de Hugging Face Hub, een volledig gekoppelde atmosfeer-oceaan-klimaatemulator. Het doel van het werk is het gedrag van E3SM, het referentieklimaatmodel van het Amerikaanse ministerie van Energie, tegen veel lagere rekenkosten te reproduceren: hypothesen filteren voordat E3SM zelf wordt uitgevoerd en grote ensembles produceren waarmee klimaatvariabiliteit tegen lage kosten kan worden bemonsterd. De atmosfeer- (ACE) en oceaanemulators (Samudra) worden eerst afzonderlijk voorgetraind voordat ze worden gekoppeld en vervolgens geëvalueerd op 400 jaar aan nooit eerder geziene E3SM-gegevens, waarbij het gemiddelde klimaat standhoudt. Ai2 noemt expliciet een beperking: de emulator legt de dagelijkse neerslag vast tot en met het 99,99e percentiel, maar onderschat deze daarboven.
Het HHMI Janelia Research Campus, Google Research en hun medewerkers publiceren op hun beurt de eerste volledige kaart van de hersenen en het centrale zenuwstelsel van een volwassen mannelijke fruitvlieg: meer dan 166.000 neuronen, een record, verdeeld over 11.691 celtypen die met behulp van AI zijn geclassificeerd en door menselijke experts zijn gevalideerd. De methode berust op beeldvorming van dunne coupes, waarna miljoenen tweedimensionale beelden met computers tot driedimensionale neuronvormen worden samengesteld. Het belang ligt in de vergelijking met de eerder gepubliceerde kaart van het vrouwtje: de meeste neuronen zijn bij beide geslachten identiek, een minderheid is geslachtsspecifiek en een derde, dimorfe categorie komt bij beide voor maar maakt verbinding met andere naburige cellen. Drie begeleidende studies passen de kaart toe op zicht, smaak en sociaal gedrag.
🔗 SamudrACE-E3SMv3 op X · 🔗 Hersenkaart van de mannelijke fruitvlieg
Meta stelt het maximale redeneerniveau van Muse Spark 1.3 open voor het publiek
4 september — Meta maakt het redeneerniveau max van Muse Spark 1.3 openbaar, twee dagen na de aankondiging van het model zelf. Het niveau is beschikbaar in Muse Code en in de Meta Model API.
Wat verandert, is dus niet het model, maar de daadwerkelijke openstelling van het meest rekenintensieve redeneerniveau. Alexandr Wang, chief AI officer van Meta, verduidelijkt dat de winst betrekking heeft op coderen en agentische taken en raadt ook degenen die de niveaus high en xhigh al hadden getest aan om het model opnieuw te proberen. Hij voegt eraan toe dat de introductie plaatsvindt nadat de veiligheidstests zijn afgerond. Voor activering moet Muse Spark 1.3 worden geselecteerd en het redeneerniveau vervolgens op max worden ingesteld.
Bij deze beschikbaarstelling worden geen benchmarkcijfers gegeven: de thread publiceert geen score of vergelijking, alleen een kwalitatieve beoordeling van de auteur.
Percept-Lens, het protocol van Sakana AI voor de evaluatie van detectie van gegenereerde afbeeldingen
3 september — Sakana AI presenteert Percept-Lens, een out-of-distribution-evaluatiekader voor het detecteren van door AI gegenereerde afbeeldingen, dat is geaccepteerd voor ECCV 2026. De uitgangsconstatering is dat detectoren van synthetische afbeeldingen falen zodra meerdere factoren tegelijk veranderen: de generator, de stijl of prompt, en het brondomein. Percept-Lens brengt de evaluatie samen over 39 openbare datasets, oftewel 7,1 miljoen afbeeldingen.
De representatiestudie stelt een directe vraag: voegt het trainen van een classificatie-head nog iets toe boven op wat moderne encoders al scheiden? De auteurs construeren een reeks door de prior geconditioneerde Gaussiaanse discriminanten, oftewel closed-form-heads die zijn opgebouwd uit eerste- en tweede-ordestatistieken van de features. De beste trede van deze reeks kan vaak wedijveren met gepubliceerde detectie-heads en presteert soms beter, mits wordt vergeleken met dezelfde prior en encoder. De auteurs pleiten voor rapportage op het niveau van het triplet prior, encoder en head.
🔗 Blogbericht van Sakana AI · 🔗 arXiv-artikel
TAOT, topologiebewuste plaatsing van expertreplica’s
4 september — Het Baige-team van Baidu beschrijft TAOT, een methode voor het plaatsen van expertreplica’s bij het trainen van mixture-of-experts-modellen, die is opgenomen in zijn open source-framework LoongForge.
Het probleem is concreet. Wanneer een MoE-training vertraagt, ligt de oorzaak zelden bij de rekenkracht van de GPU’s, maar bij het onvermogen om de belasting tijdig opnieuw te verdelen: enkele experts worden hotspots en alle andere ranks moeten wachten. De klassieke oplossing bestaat erin de gewichten van een drukbezette expert tijdelijk te repliceren naar een inactieve rank, maar zodra het parallellismedomein groter wordt dan één node, zijn niet alle inactieve GPU’s gelijkwaardig: intra-node-verkeer loopt via NVLink, cross-node-verkeer via InfiniBand, en de kosten kunnen een orde van grootte verschillen.
| Gemeten metriek | Vastgestelde waarde |
|---|---|
| Tijd per iteratie, voor en na | 155,4 ms en vervolgens 108,8 ms, oftewel 1,43x |
| Versnelling van EP4 naar EP16 | tot 1,79x |
| Communicatiekosten ten opzichte van LPLB | tot 74 procent lager bij EP32 |
| Overhead van online planning | minder dan 1 procent van de tijd van de forward pass |
TAOT wordt gepresenteerd als de eerste methode die zowel het voordeel van het afvlakken van pieken als de kosten van het verplaatsen van gewichten tussen nodes in één doelfunctie opneemt. Waar LPLB van DeepSeek paden beperkt via vooraf gedefinieerde grafen, gebruikt TAOT een continue communicatiekostenmatrix met een flexibele topologische voorkeur: intra-node krijgt de voorkeur, cross-node blijft toegestaan maar is duurder. De overstap van rijgewijze naar kolomsgewijze matching verlaagt de resterende onbalans van 7 tot 10 procent naar 1 tot 2 procent.
Open Yap 1K, duizend uur full-duplexgesprekken vrij voor commercieel gebruik
3 september — The Agentic Data Company publiceert Open Yap 1K, een corpus van Engelstalige gesprekken in twee afzonderlijke kanalen, ontworpen voor full-duplex-spraakmodellen.
| Corpuselement | Openbare steekproef | Volledig corpus |
|---|---|---|
| Totale duur | 8,9 uur | 1.000 uur |
| Gesprekken | 16 | 1.602 |
| Toegepaste licentie | CC BY 4.0 | Open Yap, vrij commercieel gebruik |
| Toegangsmodus | Hugging Face Hub | Op aanvraag |
De auteurs positioneren het corpus expliciet als alternatief voor bestaande spraakcorpora zoals Fisher, Switchboard en CANDOR, met in de eerste plaats een technisch argument: het blogbericht vergelijkt een fragment uit Fisher English, gesampled op 8 kHz via de telefoonband, met een fragment uit Open Yap 1K om het verschil in audiokwaliteit te illustreren. De verzamelmethode, demografische kenmerken van de sprekers, kwaliteitsborging, toestemming en privacy zijn gedocumenteerd.
Daily Brief wordt gratis voor meer Amerikaanse Gemini-gebruikers
4 september — Google breidt de gratis toegang tot Daily Brief uit naar meer gebruikers van de Gemini-app in de Verenigde Staten. De functie werd op 21 mei geïntroduceerd.
Daily Brief werkt op de achtergrond en legt verbanden tussen de Google-applicaties van de gebruiker: e-mails, agenda, gesprekken en interesses worden samengevat in één doorzoekbare lijst met taken en prioriteiten, bedoeld als startpunt voor de dag. De aankondiging blijft beperkt tot de Verenigde Staten en vermeldt noch het percentage betrokken gebruikers, noch een tijdschema voor internationale uitbreiding.
🔗 Aankondiging van Gemini op X
Runway introduceert Team, een selfservice-abonnement voor teams met twee tot negen seats
4 september — Runway lanceert Team, waarmee het de leemte opvult tussen individuele abonnementen en een Enterprise-aanbod voor grote klanten. De wijziging heeft grote gevolgen voor het aanbod: Standard, Pro en Max worden voortaan expliciet individuele abonnementen en elk nieuw lid valt vanaf nu onder Team, terwijl bestaande werkruimten hun toegang en tarief behouden.
| Kenmerk van het abonnement | Aangekondigde waarde |
|---|---|
| Maandtarief per seat | 69 dollar |
| Jaartarief per seat | 55 dollar, oftewel 20 procent korting |
| Toegestaan aantal seats | 2 tot 9 |
| Maandelijkse credits per seat | 6 900, gestort in een gezamenlijke reserve |
| Gedeelde projecten en opslag | maximaal 100 projecten, 1 TB |
Het abonnement draait om gedeelde projecten waarin assets, referenties, Brand Kits, sessies en workflows worden ondergebracht. Runway onderbouwt het aanbod vanuit het oogpunt van consistente output: wanneer het hele team op basis van dezelfde referenties genereert, lijkt de tiende video op de eerste. Ongebruikte credits worden één maand meegenomen, een team deelt maximaal 20 agentvaardigheden en de Agent Connectors koppelen Figma, Dropbox en Notion aan de creatieve agent.
ElevenLabs breidt zijn initiatief 1 Million Voices uit naar Brazilië
4 september — ElevenLabs breidt zijn impactprogramma uit naar Brazilië en illustreert dit met een eerste Braziliaans verhaal. Eliane verloor als kind haar stem en Alberto werd op 46-jarige leeftijd blind; het bedrijf gaf Eliane een stem die lijkt op die van haar familie, waardoor ze voor het eerst met de man van wie ze houdt kan communiceren met een stem die haar identiteit uitdrukt.
De aankondiging gaat gepaard met twee lokale partnerschappen. De Associação Brasileira de Esclerose Lateral Amiotrófica, die in het land tot 10.000 mensen met amyotrofe laterale sclerose ondersteunt, biedt deze patiënten gratis toegang om hun stem te klonen. De Sociedade Brasileira de Fonoaudiologia zal Braziliaanse logopedisten opleiden in stemklonen, waarbij het bedrijf erop rekent dat de vaardigheid van behandelaars het aantal patiënten dat hiervan profiteert zal vergroten. Het initiatief 1 Million Voices is een toezegging in natura ter waarde van één miljard dollar en heeft sinds de lancering wereldwijd meer dan 11.000 mensen bereikt.
Kimi Code 0.41.0 voegt een multi-agentmodus toe en verwijdert een twee dagen oude beveiliging
4 september — Moonshot AI brengt Kimi Code 0.41.0 uit. De zichtbare vernieuwing is tower, een experimentele modus voor samenwerking tussen meerdere agents in de webinterface, die wordt gestart met de opdracht /tower of via het plusmenu van het invoerveld en een basistak als argument accepteert. Het contextbeheer krijgt twee aanpassingen: het model wordt vóór automatische compactie op de hoogte gebracht van zijn contextbudget en vervolgens verwezen naar het gebeurtenislogboek van de sessie om de exacte details terug te vinden. De bestandsgeschiedenis per beurt wordt permanent.
Het opvallendste punt is een terugdraaiing. Versie 0.40.0, uitgebracht op 2 september, had in de automatische toestemmingsmodus het blokkeren van destructieve opdrachten zoals shutdown, reboot en rm -rf ingevoerd. Versie 0.41.0 draait deze keuze terug en blokkeert in diezelfde modus niet langer gevaarlijke opdrachten, noch opdrachten die niet statisch kunnen worden geanalyseerd. De beveiliging heeft het twee dagen volgehouden. De reden wordt niet toegelicht in de release notes, maar statische analyse van shellopdrachten levert gemakkelijk fout-positieven op die legitiem werk blokkeren.
🔗 Release notes van Kimi Code 0.41.0
Perplexity licht Ivy, Tulip en ROSE toe, de eigen stack die zijn embeddings aanbiedt
4 september — Perplexity publiceert een technisch blogbericht dat een kijkje geeft onder de motorkap van de infrastructuur waarmee het zijn embedding- en rankingmodellen aanbiedt. Het bedrijf traint en serveert zijn eigen modellen, waaronder pplx-embed, en beschrijft zijn zoekindex als een index op exabyteschaal.
| Component van de stack | Gebruikte taal | Rol binnen de dienst |
|---|---|---|
| Ivy | Rust | HTTP-gateway, tokenisatie, opsplitsing en verdeling van batches |
| Tulip | Rust, tokio, tonic | gRPC-inferentieserver, planning en batching |
| ROSE | Python | Uitvoering van modellen, CUDA-kernels en -grafen |
Het uitgangspunt is het hergebruik van LLM-inferentiecode. Perplexity merkt op dat embedding in batches lijkt op de rekenkrachtgebonden prefill-fase, terwijl online embedding van een korte zoekopdracht lijkt op de geheugengebonden decode-fase. Dezelfde kernels worden daarom gebruikt voor pplx-embed en het decoderen van Qwen3.5, zonder key-value-cache voor embeddings en met attention-varianten die onregelmatige invoer ondersteunen en zo overbodige padding voorkomen. Voor de attention-kernels onderhoudt het team FlashInfer 2, FlashInfer 3 en FlashAttention 4 parallel in plaats van er één te kiezen; de keuze wordt per geval gemaakt op basis van het aantal heads en hun dimensie. De metingen worden vergeleken met vLLM v0.22.0, maar de cijfermatige resultaten staan alleen in grafieken.
🔗 Technisch blogbericht van Perplexity
Zed en Replit doen aankondigingen op X, zonder blogbericht of release notes
4 september — Twee aankondigingen over codeertools van derden verschijnen op dezelfde dag en beide berusten op één enkele publicatie op X, zonder ondersteunend blogbericht of release notes.
Zed meldt dat Delta vanaf nu toegankelijk is voor mensen die zijn ingeschreven voor de bèta op Windows, als antwoord op een gebruikersverzoek van 2 september. Het onderscheid is belangrijk: Delta is de op 12 augustus gelanceerde multiplayer-codeeromgeving met agents, waarmee meerdere teamleden samen met agents aan een gedeeld project kunnen werken. De Zed-editor zelf is al beschikbaar voor macOS, Linux en Windows. De aankondiging betreft dus niet de editor, maar Delta, waarvan de beschikbaarheid voor Windows sinds augustus nog op zich liet wachten. De precieze omvang van deze bèta en de inschrijvingsvoorwaarden blijven onbekend.
Replit heeft op zijn beurt een livesessie van één uur en 58 minuten uitgezonden met de titel ‘Replit MCP: Steer Your Agent From Anywhere’. De titel kondigt een MCP-server aan die de agent van het platform beschikbaar maakt voor protocolcompatibele clients, met als beoogd gebruik het starten van een taak en het volgen van de voortgang ervan vanuit een editor, terminal of externe assistent, zonder de webinterface te gebruiken. Het bericht bevat behalve deze titel geen andere tekst, geen link naar een blogbericht en geen expliciete formulering dat het om een lancering gaat.
🔗 Delta op Windows · 🔗 Replit MCP live
Kort nieuws
- Een API-endpoint geeft de geschiedenis van sterren terug zonder gebruikers prijs te geven — de REST API van GitHub retourneert aantallen sterren met tijdstempels zonder de accounts te identificeren die ze hebben toegekend, ter vervanging van de listing-endpoints die eerder dit jaar tot beheerders werden beperkt. 🔗 Changelog
- npm accepteert meerdere configuraties voor vertrouwde publicatie per package — drie wijzigingen zijn algemeen beschikbaar: meerdere en cumulatieve OIDC-configuraties per package, goedkeuring die wordt geblokkeerd zolang de antimalwarescan loopt en een preproductiegeschiedenis die zichtbaar is op het tabblad met versies. 🔗 Changelog
- GitHub Actions voegt een API voor de uitfasering van runners toe — de REST API geeft de einddatums voor ondersteuning van een runnerversie, een machtiging
vulnerability-alertsmaakt Dependabot-waarschuwingen alleen-lezen toegankelijk en vier eigenschappen van de contextjobgeven herbruikbare workflows hun oorspronkelijke identiteit. 🔗 Changelog - De documentaire The Story of VS Code verschijnt op 4 september — GitHub kondigt de uitzending aan van de officiële documentaire over Visual Studio Code op het YouTube-kanaal van de uitgever, na een trailer die op 1 september werd gepubliceerd. 🔗 Aankondiging
- Replit belicht een applicatie die in één week is gebouwd — Pep AI, in ongeveer een week door Cédric Roberge op het platform gebouwd, zou volgens Replit circa 130.000 dollar per maand opleveren, aldus een promotionele thread gevolgd door prijsadvies. 🔗 Replit-thread
- Zed publiceert een visuele aankondiging waarvan de inhoud niet kon worden geverifieerd — een bericht van vier woorden met één afbeelding, gepubliceerd op 4 september om 22.14 uur. De afbeelding werd tijdens de scan niet geladen en de publicatie gaat niet vergezeld van een blogbericht of release notes: niets maakt duidelijk wat ermee wordt aangekondigd. 🔗 Bericht
- Een volledig open LLM-ecosysteem voor het Armeens — een Hugging Face-collectie brengt het webcorpus ArmWeb, de geverifieerde wetenschappelijke dataset ArmSTEM en het model arm-gemma-e4b samen, met een aangekondigd artikel dat nog moet verschijnen. 🔗 Blogbericht
- VLM Run Gateway brengt OCR- en open-weight-visionmodellen samen achter één API — de gateway biedt via één toegangspunt modellen voor optische herkenning, vision-language en vision met open weights aan, waaronder PaddleOCR-VL-1.6. 🔗 Blogbericht
- Sakana AI opent op 5 oktober de deuren van zijn engineeringteam — de Engineer Open House keert terug op maandag 5 oktober 2026 van 18.00 tot 21.00 uur, in Toranomon of online, met inschrijving via connpass. 🔗 Aankondiging
- Google licht de sprints van zijn Gemini Enterprise-programma voor developer experience toe — een methodologisch blogbericht zonder lancering: de beschreven sprint richt zich op AI-governance binnen ondernemingen en levert bijgewerkte documentatie en gestandaardiseerde codevoorbeelden voor Agent Gateway en Semantic Governance. 🔗 Blogbericht
- Suno geeft zijn volgende generatie modellen een naam: de v6-familie — in een antwoord aan een gebruiker presenteert het officiële account deze als zijn beste werk tot nu toe, zonder datum of technische details, een dag nadat de nieuwe downloadlimieten van kracht werden. 🔗 Antwoord
- MiniMax en Together AI organiseren in Londen een avond over de economie van open modellen — het gezamenlijke evenement Open by Design: The Economics of AI in Production vindt plaats op 16 september en is de enige publicatie van MiniMax binnen deze periode. 🔗 Aankondiging
- Mistral brengt de AI Engineer-conferentie op 23 en 24 september terug naar Parijs — de terugkeer naar Station F brengt vicepresident engineering Lélio Renard-Lavaud samen met Black Forest Labs, Cognition en Hugging Face, nadat een eerdere editie was uitverkocht. 🔗 Aankondiging
- De WebMCP Challenge sluit de inzendingen — de sluiting volgt na twaalf uur uitstel vanwege de storing van 3 september; de projecten worden beoordeeld en de winnaars worden binnenkort bekendgemaakt. 🔗 Aankondiging
Wat dit betekent
De snelheid waarmee het ecosysteem een frontiermodel opneemt, is de echte graadmeter geworden. GPT-6 Astra werd op 3 september aangekondigd; op 4 september is het zonder voorbehoud beschikbaar in de API, algemeen beschikbaar op tien Copilot-oppervlakken, gemeten door een derde partij die het in productie gebruikt en geïntegreerd via drie opeenvolgende patches voor Codex CLI. Zo’n termijn van vierentwintig uur bestond een jaar geleden niet. Daardoor verschuift de vraag van lancering naar facturering: GitHub rekent voor Astra zonder promotieperiode het openbare tarief van de leverancier, terwijl Gemini 3.8 Flash tot het einde van het jaar een introductietarief krijgt. Wanneer alle modellen de dag na hun aankondiging beschikbaar zijn, wordt de prijs opnieuw de enige zichtbare onderscheidende factor voor de eindgebruiker.
HydraFusion pakt het probleem van de andere kant aan en is voor tooling het meest structurele nieuws van de dag. Kiezen tussen twintig modellen is werk dat maar weinig ontwikkelaars serieus doen, en GitHub stelt voor het helemaal niet meer te doen: je kiest een workflow en de tool bepaalt voor elk verzoek het model. De cijfers, 4,9 kwaliteitspunten meer tegen 67 procent lagere kosten dan Opus 5 op TerminalBench, zijn vooral belangrijk vanwege wat ze suggereren: de winst komt van de orkestratie, niet van een superieur model. Als dit resultaat buiten de benchmarkomstandigheden standhoudt, is het model niet langer het product, maar wordt het een verwisselbare component achter een kwaliteitspoort.
Agents in ondernemingen treden buiten engineering en de governance volgt. SpaceXAI zegt het expliciet: het intensiefste gebruik van Grok Bot vindt buiten code plaats, en het veelzeggendste cijfer van de dag komt uit een audit van softwareseats: 43 betaalde abonnementen zonder activiteit gedurende 90 dagen. Maar de werkelijke inhoud van deze aankondigingen is het machtigingenmechanisme. De door SpaceXAI gepubliceerde template voor de systeemprompt onderscheidt drie regimes: altijd toegestaan, per geval toegestaan en nooit toegestaan. NVIDIA formuleert hetzelfde principe in zijn blogbericht over het geheugen van agents: context kan een actie ondersteunen, maar kan die niet autoriseren. Twee los van elkaar staande partijen komen op dezelfde dag tot de conclusie dat een nuttige agent in de eerste plaats wordt bepaald door wat hem wordt verboden.
Bij command-line-tools ontwikkelt de beveiliging zich met horten en stoten in plaats van in een rechte lijn. Gemini CLI verwijdert een hardgecodeerde API-key en scherpt zijn sandbox aan, Claude Code corrigeert machtigingsregels waardoor mappen die alleen-lezen moesten zijn toch beschrijfbaar waren, en Kimi Code verwijdert twee dagen na invoering de blokkering van destructieve opdrachten. Dat laatste geval is het leerzaamst: statische analyse van shellopdrachten levert genoeg fout-positieven op om een beveiliging die op papier correct is in de praktijk ondraaglijk te maken. De veiligheid van deze tools wordt niet bepaald door de aankondiging van een beveiligingsmaatregel, maar door de vraag of die het contact met gebruikers overleeft.
Dan resteren de ontwikkelingen van vandaag in wiskunde en wetenschap, die op het moment zelf het moeilijkst te beoordelen zijn. Het in elf dagen formaliseren van het bewijs van Fermat levert geen nieuwe wiskunde op: het verifieert een dertig jaar oud resultaat. Juist daardoor is het interessant, want peerreview is de bottleneck die in jaren wordt gemeten, en Kevin Buzzard merkt op dat deze artefacten inmiddels robuust genoeg zijn om als basis voor ander werk te dienen. De klimaatemulator van Ai2 en het connectoom van de fruitvlieg volgen dezelfde logica: geen van beide doet een ontdekking, maar beide maken werk uitvoerbaar waarvan de kosten schaalvergroting onmogelijk maakten. Het is minder spectaculair dan autonome ontdekking en waarschijnlijk representatiever voor wat AI daadwerkelijk verandert in de wetenschappelijke praktijk.
Bronnen
- GPT-6 Astra beschikbaar voor Pro, Enterprise en Business Premium
- GPT-6 Astra algemeen beschikbaar in GitHub Copilot
- Perplexity evalueert GPT-6 Astra op WANDR
- Codex CLI 0.153.3
- Een game bouwen met Astra
- Formalisering van de laatste stelling van Fermat
- Bewijs van de laatste stelling van Fermat op GitHub
- Project HydraFusion
- Lyria 3.5 in de Gemini-app
- Grok Bot for Enterprise
- Haggle Bot, de inkoopagent van SpaceXAI
- Grok maakt via Plaid verbinding met financiële rekeningen
- Claude Code 2.1.260
- Claude Code 2.1.261
- De opdracht ant apply
- Een geheugengestuurde agent met NVIDIA NemoClaw
- Grensverleggend redeneren komt naar Jetson
- Gebruikersidentiteit overdragen tussen gefedereerde Kubernetes-platforms
- Gemini CLI v0.60.0 nightly
- Antigravity-wijzigingslogboek
- SamudrACE-E3SMv3 van Ai2
- Het volledige connectoom van een mannelijke fruitvlieg
- Muse Spark 1.3 max openbaar beschikbaar
- Percept-Lens van Sakana AI
- Percept-Lens-artikel op arXiv
- TAOT in LoongForge
- Open Yap 1K
- Daily Brief uitgebreid naar de Verenigde Staten
- Runway introduceert het Team-abonnement
- 1 Million Voices komt naar Brazilië
- Kimi Code 0.41.0
- Snelle embeddings op GPU’s bij Perplexity
- Delta in bèta beschikbaar voor Windows
- Replit MCP live
- Privacyvriendelijk endpoint voor de sterrengeschiedenis
- Meerdere configuraties voor vertrouwde npm-publicatie
- GitHub Actions-updates van begin september
- Het verhaal van VS Code
- Pep AI gebouwd op Replit
- Visuele aankondiging gepubliceerd door Zed
- Een open LLM-ecosysteem voor het Armeens
- VLM Run Gateway
- Engineer Open House van Sakana AI
- De sprints van het DevEx-programma van Gemini Enterprise
- Suno spreekt over de v6-familie
- Open by Design in Londen
- AI Engineer keert terug naar Parijs
- Afsluiting van de WebMCP Challenge