ai-powered-markdown-translatorArtikel vertaald van het Frans naar het Nederlands met gpt-5.6-sol.
Deze dinsdag lanceert Google Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking, twee modellen voor realtime spraakdialogen die op de achtergrond tools kunnen aanroepen zonder het gesprek te onderbreken. Anthropic brengt drie versies van Claude Code uit en voegt Salesforce toe aan Claude, terwijl OpenAI 14 oktober vastlegt als datum waarop GPT-5.5 uit ChatGPT en Codex wordt verwijderd. Agents vinden ook hun weg naar bestaande distributiekanalen, van HP dat Perplexity vooraf installeert tot Devin dat via AWS Marketplace wordt verkocht, en NVIDIA licht twee bouwstenen van zijn Vera Rubin-platform toe.
Gemini 3.8 Live en 3.8 Live Extended Thinking, twee spraakmodellen die tijdens het praten handelen
15 september — Google lanceert twee modellen voor realtime spraakdialogen, gepresenteerd door het Gemini Audio-team. Gemini 3.8 Live richt zich op schaal, snelheid en kosten: het accepteert visuele invoer in vrijwel realtime en schakelt gedurende het gesprek automatisch tussen 97 talen. Gemini 3.8 Live Extended Thinking is bedoeld voor taken die redenering in meerdere stappen vereisen: het redeneert en spreekt tegelijkertijd, bevestigt de ontvangst met korte verbale aanzetten en geeft commentaar op de voortgang van zijn achtergrondtaken; het denkniveau kan in de API worden ingesteld. Beide modellen voeren op de achtergrond tool- en API-aanroepen uit (asynchronous function calling) terwijl de audiorespons doorgaat.
The models talk, think, and handle tasks in the background without breaking your flow.
🇳🇱 De modellen praten, denken na en beheren taken op de achtergrond zonder de draad van uw gesprek te onderbreken. — @GoogleDeepMind op X
Google benadrukt ook de nauwkeurigheid bij gedicteerde alfanumerieke gegevens, zoals bevestigingscodes of dossiernummers, en presenteert deze modellen als een eenvoudiger alternatief voor cascade-architecturen, die transcriptie, tekstverwerking en spraaksynthese achter elkaar uitvoeren. Volgens de modelkaart van Gemini 3.8 Audio zijn ze gebaseerd op Gemini 3 Pro, accepteren ze audio, afbeeldingen, video en tekst binnen een context van 128K tokens, produceren ze maximaal 64K tokens als uitvoer en steunen ze op kennis tot en met januari 2025.
| Ranglijst of benchmark | Geëvalueerd model | Door Google gepubliceerde score |
|---|---|---|
| Speech to Speech Quality-index (Artificial Analysis) | 3.8 Live Extended Thinking | 82,6 (1e plaats) |
| τ-Voice | 3.8 Live Extended Thinking | 68,6 % |
| τ-Voice-banking (Sierra) | 3.8 Live Extended Thinking | 35,1 % |
| Big Bench Audio | 3.8 Live Extended Thinking | 97,7 % |
| Speech Agent Arena (Artificial Analysis) | 3.8 Live | 2e plaats |
Deze ranglijsten worden door derden bijgehouden, maar de genoemde scores zijn die welke Google publiceert. In de Live API schat Google de kosten van beide modellen op 0,005 dollar per minuut ingevoerde audio en 0,018 dollar per minuut uitgevoerde audio, op basis van 3 dollar per miljoen tokens voor invoer en 12 dollar voor uitvoer; Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel en Vision Agents worden als integrators genoemd.
| Distributiekanaal | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| Gemini API en Google AI Studio | Vanaf 15 september | Vanaf 15 september |
| Gemini Enterprise | Besloten preview | Besloten preview |
| Consumenten | Search Live | Gemini Live, Docs Live (Google AI Pro- en Ultra-abonnees), Gmail Live en Keep Live (alle Google AI-abonnees) |
In Search Live begeleidt het model gebruikers stap voor stap bij realtime probleemoplossing. Alle gegenereerde audio bevat het onzichtbare SynthID-watermerk.
🔗 Introductie van Gemini 3.8 Live en 3.8 Live Extended Thinking 🔗 Blogbericht voor ontwikkelaars over de Live API 🔗 Modelkaart van Gemini 3.8 Audio
Claude Code 2.1.271 tot en met 2.1.273: snelle modus in Remote, netwerk per opdracht en aangescherpte machtigingen
15 september — Anthropic brengt in iets meer dan 22 uur drie versies van Claude Code uit, waarvan de eerste net na middernacht Parijse tijd.
| Uitgebrachte versie | Datum en tijd (UTC) | Inhoud van de notities |
|---|---|---|
| 2.1.271 | 14 september, 22.12 u | 96 regels: snelle modus in Remote, allowed_domains per opdracht, omitClaudeMd, --accept-command |
| 2.1.272 | 15 september, 0.42 u | Eén regel: bugfixes en verbeteringen van de betrouwbaarheid |
| 2.1.273 | 15 september, 20.23 u | 64 regels: headers voor LLM-gateways, duplicatie van Remote Control-sessies, lokale classifier op Bedrock, Vertex en Foundry |
Versie 2.1.271 stelt de snelle modus (fast mode) open voor Claude Code Remote-sessies, zowel in de cloud als op zelfgehoste uitvoerders (self-hosted runners), waar de organisatie dit toestaat. In de automatische modus met sandbox accepteren Bash, PowerShell en Monitor een lijst allowed_domains per opdracht: de benodigde hosts worden samen met de opdracht beoordeeld en uitsluitend daarvoor geopend, terwijl de overige worden geweigerd. Het veld omitClaudeMd in de frontmatter van agents start een subagent zonder de gebruikers-, project- en lokale CLAUDE.md-bestanden, terwijl bestanden met beheerd beleid geladen blijven, en claude plugin install --accept-command <sha256> accepteert alleen de exacte opdracht die tijdens een eerdere doorgang in --json werd getoond, in plaats van een -y. Versie 2.1.273 maakt het mogelijk om vanuit de Claude-app een met claude --remote-control gestarte sessie te dupliceren (fork), waarna de gedupliceerde sessie op de achtergrond op de computer draait. De versie waarschuwt ook wanneer een MCP-server de verbinding verbreekt en de automatische herverbinding het opgeeft, en voegt requestheaders voor LLM-gateways toe, geactiveerd door CLAUDE_CODE_GATEWAY_HINT_HEADERS=1.
| Gewijzigd onderdeel | Nieuw gedrag |
|---|---|
| Terugkeer van een subagent in automatische modus | Speciale terugkoppelaanroep (hand-back call) die door de veiligheidsclassifier wordt beoordeeld, in plaats van controle achteraf van het laatste bericht |
!-opdrachten van skills en slash-opdrachten in automatische modus | Machtigingsregels van de standaardmodus in plaats van de classifier |
| Monitor-bewakingen | Verplichte deadline van maximaal 30 minuten (10 bij uitvoering van -p), waarbij Claude wordt gewaarschuwd om ze opnieuw te activeren |
| Dynamische workflows | Pauze bij de gebruikslimiet en automatische hervatting na de reset, in plaats van de agents af te breken |
| Automatische modus op Bedrock, Vertex en Foundry (2.1.273) | Voorlopig standaard een lokale classifier, CLAUDE_CODE_AUTO_MODE_SERVER=1 voor die van het platform |
Beide versies verhelpen ook verschillende problemen met machtigingscontroles. Opdrachten met een subshell, twee mapwisselingen of een reeks cd + git sloegen de prompt onder permissions.blockReadsOutsideWorkingDirectories over, en een subshell kon in de modus voor het omzeilen van machtigingen (bypass) een gevaarlijke rm verbergen. MCP-instellingen die via MDM of managed-settings.json waren opgelegd, werden genegeerd zodra er door de server beheerde instellingen bestonden. /resume en /teleport behielden de registratie van bestanden die in het vorige gesprek waren gelezen, waardoor Claude bestanden kon wijzigen die in het hervatte gesprek nooit waren gelezen. Ten slotte telde de contextmeter de beurten van de advisor-tool als ongeveer tweemaal hun werkelijke grootte, waardoor automatische compactie rond de helft van het contextvenster werd geactiveerd.
Geen van de drie notities vermeldt de Claude Mods die op 14 september werden aangekondigd; in issue #91870 menen testers uit de community echter dat versie 2.1.272 hun omgeving al heeft beïnvloed.
🔗 Release notes van Claude Code 2.1.271 🔗 Release notes van Claude Code 2.1.273
Salesforce in Claude, een verkoopplugin in bèta voor goedgekeurde organisaties
15 september — Anthropic lanceert Salesforce in Claude als bèta, waarmee de accounts, opportunities en pipeline van een verkoper in Claude beschikbaar komen. Het blogbericht presenteert een plugin die samen met Salesforce is ontworpen, terwijl het helpcentrum de bouw van de 37 verkoopskills aan Salesforce toeschrijft: accounts onderzoeken, gesprekken voorbereiden, de pipeline beoordelen of het CRM bijwerken. De plugin wordt vergezeld door twee connectors: Salesforce met lees- en schrijftoegang, en Slack voor zakelijke kanalen en teamthreads.
Salesforce blijft het bronsysteem: elke verkoper meldt zich aan met eigen inloggegevens, Claude leest alleen wat diens Salesforce-machtigingen toestaan en elke schrijfactie moet standaard worden goedgekeurd. De plugin werkt in chat en in Claude Cowork (web en desktop). De bèta is beschikbaar voor betaalde abonnementen, maar alleen voor organisaties die door Salesforce via de bèta-inschrijving zijn toegelaten en over de nieuwste enterprise-editie van Sales Cloud beschikken; hun Salesforce-beheerders vragen toegang aan via AgentExchange. GitLab, Siemens en Legora hebben de plugin uitgerold en 7.000 verkopers van Salesforce gebruiken hem.
🔗 Salesforce naar Claude brengen 🔗 Salesforce in Claude configureren voor uw organisatie
GPT-5.5 verdwijnt op 14 oktober uit ChatGPT, ChatGPT Work en Codex, maar blijft beschikbaar in de API
15 september — OpenAI kondigt op X het einde van GPT-5.5 in zijn applicaties aan, wat in het changelog van ChatGPT en Codex al bij 14 september was opgenomen. Op 14 oktober verdwijnt het model uit ChatGPT, ChatGPT Work en Codex voor alle abonnementen: consumenten, Business, Enterprise en Edu.
| Betrokken omgeving | Situatie op 14 oktober |
|---|---|
| ChatGPT en ChatGPT Work | GPT-5.5 verwijderd voor alle abonnementen |
| Codex met ChatGPT-login | GPT-5.5 verwijderd, overstap naar gpt-5.6-sol gevraagd |
| Codex met API-sleutel | GPT-5.5 blijft beschikbaar |
| OpenAI API | GPT-5.5 blijft beschikbaar |
Voor Codex met ChatGPT-login vraagt de documentatie om gpt-5.5 overal te vervangen waar het expliciet is geselecteerd: standaardinstellingen van de workspace, opgeslagen instellingen, beheerde configuraties, aangepaste agents, geplande taken en scripts. Het bericht van het account @ChatGPT noemt ook GPT-6 Astra als vervanger in Codex. De beheerdershandleiding waarschuwt dat het wijzigen van het standaardmodel geen toegang tot het model verleent: per client moet worden gecontroleerd of het vervangende model beschikbaar is voor de betrokken gebruikers. OpenAI hanteert opnieuw de opzegtermijn van één maand die werd toegepast op GPT-5.4 en GPT-5.4 mini, die op 31 augustus uit Codex werden verwijderd voor gebruikers die via ChatGPT waren aangemeld, na een aankondiging op 31 juli.
🔗 Changelog van ChatGPT en Codex 🔗 Bericht van @ChatGPT op X
HP installeert Perplexity vooraf op zijn Windows-pc’s, met een koppeling naar Autodesk Revit
15 september — Perplexity en HP kondigen aan dat de Perplexity-app voor Windows vooraf in de taakbalk van de pc’s van de fabrikant wordt geïnstalleerd, te beginnen met het mobiele workstation ZBook Ultra G3a, uitgerust met AMD Ryzen AI Max PRO-processors uit de 400-serie; andere modellen volgen in de komende maanden, zonder lijst, prijs of datum. Volgens het blogbericht maken de lokale AI-mogelijkheden van de ZBook Ultra G3a het mogelijk om alledaagse taken uit te voeren met Portable Computer, de lokale versie van de agent die zonder cloudcredits en offline werkt, maar de beschikbaarheid ervan hangt af van de apparaatconfiguratie: het blogbericht vermeldt de compatibele configuraties niet, terwijl de Windows-versie die de dag ervoor werd uitgebracht een NVIDIA RTX-GPU met minstens 24 GB videogeheugen vereiste.
Portable Computer maakt ook verbinding met Autodesk Revit, de software voor digitale bouwmodellering (Building Information Modeling), via de MCP-server van Revit 2027, die als technische preview (Tech Preview) wordt aangeboden als afzonderlijke module. De toegang is alleen-lezen: de agent beantwoordt vragen over het model, zoals het aantal deuren op een verdieping of hun brandwerendheid, en exporteert aanzichten, PDF’s en staten zonder het model te wijzigen. Personal Computer for Windows is beschikbaar voor Pro-, Max- en Enterprise-abonnees, onder Windows 10 en 11.
🔗 Perplexity komt met HP naar meer Windows-pc’s
Cognition sluit een overeenkomst met AWS en lanceert macOS in Devin Cloud
15 september — Cognition publiceert op dezelfde dag twee aankondigingen die door de infrastructuur met elkaar verbonden zijn: de Macs waarop Devin voortaan Apple-applicaties bouwt, zijn AWS EC2 Mac-hosts.
Een strategische samenwerkingsovereenkomst met AWS
Cognition en Amazon Web Services sluiten een meerjarige strategische samenwerkingsovereenkomst (Strategic Collaboration Agreement), waarvan de blogpost noch het bedrag, noch de exacte looptijd vermeldt. Twee elementen zijn al beschikbaar: Devin kan via AWS Marketplace worden aangeschaft en de Agent Toolkit for AWS kan rechtstreeks in Devin worden gebruikt. Verdere integraties in de AWS-omgevingen van klanten worden onderzocht, zonder tijdschema. Devin wordt geïmplementeerd in een single-tenantomgeving (single-tenant), in de door de klant gekozen AWS-regio, waarbij gegevens in een speciaal VPC worden bewaard en voor elke sessie één virtuele machine wordt gebruikt, die na afloop van het werk wordt verwijderd.
| Door Cognition genoemde klant | Bekendgemaakt resultaat |
|---|---|
| Mercedes-Benz | Meer dan 200.000 regels COBOL geanalyseerd, een op acht maanden geraamd project teruggebracht tot acht dagen |
| Niet nader genoemde autofabrikant | COBOL-workflow van 25.000 regels gemigreerd van een mainframe (mainframe) naar AWS Lambda, geraamde kosten 73% lager |
🔗 Blogpost van Cognition over de overeenkomst met AWS
macOS komt naar Devin Cloud
Op 31 juli toonde Cognition al Devin-cloudagents onder macOS, met Xcode en de iOS-simulator. De lancering van 15 september in Devin Cloud, voor het bouwen en verifiëren van iPhone-, iPad- en Mac-applicaties, brengt verschillende vernieuwingen: Devin stuurt de schermopname van zijn tests naar Slack, verstrekt een TestFlight-link om de applicatie te installeren en een nieuw paneel iOS Simulator toont de draaiende applicatie. De agent bedient applicaties ook via hun toegankelijkheidsboom, die beschikbaar is voor zijn computergebruikstool (computer use): hij zoekt een bedieningselement op aan de hand van de rol en naam ervan, voert er een actie op uit en leest vervolgens de boom opnieuw uit, terwijl schermafbeeldingen nog steeds worden gebruikt om de weergave te beoordelen. Deze laag is gebaseerd op de open-source accessibility-cli van Dioxus, waarvan het team zich op 10 september bij Cognition heeft aangesloten.
De macOS-VM’s draaien via Apples Virtualization.framework op fysieke AWS EC2 Mac-computers, met een NBD-interface (Network Block Device) die aan het snapshot-systeem (snapshots) is toegevoegd om een sessie te kunnen hervatten zonder de machine ingeschakeld te houden. Een Ethernet-gateway in de gebruikersruimte vervangt Apples beheerde NAT om het netwerkbeleid van elke sessie toe te passen. Noch de prijs, noch het betreffende abonnement wordt vermeld.
NVIDIA licht twee bouwstenen van Vera Rubin toe: Groq 3 LPX en NVLink 6
15 september — Twee blogposts op de technische blog van NVIDIA leggen uit hoe het Vera Rubin-platform energie bespaart bij inferentie en storingen in zijn netwerk opvangt. De onderstaande cijfers zijn afkomstig van NVIDIA.
Groq 3 LPX, deterministische uitvoering om de spanningsmarge te verkleinen
De ingebruikname van Groq 3 LPX werd hier op 24 augustus al behandeld; deze blogpost legt het mechanisme ervan uit. Vóór de uitvoering legt de compiler van de LPU-chips tot op de klokcyclus nauwkeurig vast wanneer elke berekening en elke gegevensoverdracht op de 256 chips van het rack plaatsvindt, waardoor hij de stroomvraag kan voorspellen. Twee technologieën maken hiervan gebruik: Preemptive Power (PEP) vraagt het voedingsnetwerk de spanning vlak vóór een vraagpiek te verhogen, en Clock Period Synthesis (CPS) verlengt de klokcycli waarin de stroom het snelst stijgt. Het doel is de spanningsmarge (voltage guardband) die elk circuit aanhoudt te verkleinen, aangezien die kostbaar is doordat het vermogen toeneemt met het kwadraat van de spanning: 10% extra spanning betekent 21% extra vermogen.
Bij interne tests neemt de spanningsval met meer dan 60% af. NVIDIA schat dat voor dezelfde belasting het benodigde vermogen met een „laag dubbelcijferig” percentage (low-double-digit) zou kunnen dalen ten opzichte van een vergelijkbaar niet-deterministisch systeem. Deze regelmechanismen komen in de tweede helft van 2026 naar Vera Rubin.
🔗 Blogpost van NVIDIA over de deterministische uitvoering van Groq 3 LPX
NVLink 6, een veerkrachtige stack van silicium tot software
NVLink 6 verbindt de 72 Rubin-GPU’s van een Vera Rubin NVL72-rack tot één domein; de volgens NVIDIA 10 keer hogere pakketdoorvoer dan generieke Ethernet-alternatieven werd hier op 21 juli al genoemd. Deze keer licht de blogpost de fouttolerantie laag voor laag toe.
| Niveau van de stack | Door NVIDIA beschreven mechanisme |
|---|---|
| Fysieke laag | Lichtgewicht foutcorrectie, aangevuld met hertransmissie op fysiek niveau (Physical Layer Retry) |
| Verbindingslaag | Creditgebaseerde flow control (credit-based flow control), die pakketverlies door zijn ontwerp voorkomt |
| Verbindingsbeheer | Softwarematig herstel in ongeveer 1,5 seconde via de NMX Controller |
| Inferentieservice | Shadow Engine Recovery (NVIDIA Dynamo): onderbreking teruggebracht van 283 naar 7,3 seconden op een B200-GPU |
| Checkpoints voor meerdere nodes | cuda-checkpoint ondersteund door NCCL als prototype, algemene beschikbaarheid verwacht tegen het einde van het jaar |
Creditgebaseerde flow control verzendt alleen een pakket als de volgende hop ruimte heeft om het te ontvangen, terwijl Ethernet op PFC en ECN steunt. Shadow Engine Recovery houdt een replica van de inferentie-engine gereed die al met eigen NCCL-communicators is geïnitialiseerd.
🔗 Blogpost van NVIDIA over de veerkracht van NVLink 6
Gemini Notebook kondigt spraakgesprekken met notebooks en een audiorecorder aan
15 september — Voor de start van het academische jaar krijgt Gemini Notebook een nieuw uiterlijk en kondigt het een reeks studiehulpmiddelen aan, waarvan de meeste nog moeten verschijnen.
| Aangekondigd studiehulpmiddel | Vermelde beschikbaarheid |
|---|---|
| Realtime spraakgesprekken met notebooks, op mobiele apparaten, in bijna 100 talen | Deze week voor volwassen Google AI Ultra-abonnees, binnenkort voor Google AI Pro en anderen |
| Audiorecorder in de mobiele applicatie | Vanaf volgende week |
| Interactieve leeroverzichten in Reports | In de komende weken, voor alle gebruikers |
| Quizzen met korte antwoorden, meerkeuzevragen of invulvragen | In de komende weken, voor alle gebruikers |
| Deelbare Short Video Overviews in meer dan 80 talen | Nu beschikbaar, tegenover meer dan 70 talen op 1 september |
Het spraakgesprek zal antwoorden op basis van de bronnen in het notebook en met de stem kunnen worden onderbroken, en de recorder zal een les of gedachte rechtstreeks in het notebook vastleggen, naast de bronnen. De leeroverzichten zullen samenvattingen, infographics, quizzen en flashcards (flashcards) combineren. Wat de studentenaanbiedingen betreft, die al in augustus werden gepresenteerd, verduidelijkt Google dat het gratis jaar Google AI Pro voor Amerikaanse studenten de limieten in Gemini Notebook verviervoudigt en dat het jaar Google AI Plus dat in meer dan 140 andere markten wordt aangeboden deze verdubbelt.
🔗 Scherp je studieroutine aan met nieuwe Gemini Notebook-tools
Antigravity 2.14.0 stelt de geïntegreerde terminal en Git open voor Enterprise- en Business-accounts
15 september — Antigravity 2.14.0, met 10 verbeteringen en 18 bugfixes, stelt de geïntegreerde terminal en Git-versiebeheer in de zijbalk open voor Enterprise- en Business-accounts; deze functies kwamen met versie 2.10.0 van 24 augustus al beschikbaar voor andere accounts. Gesprekken met een zeer lange geschiedenis laden sneller en gebruiken minder geheugen, en een redundante analyse van skills, regels en aanpassingsbestanden, die bij elk bericht opnieuw werd uitgevoerd, is verwijderd.
Een tijdelijke servicefout beëindigt de sessie niet langer: er wordt gedurende ongeveer twaalf minuten opnieuw geprobeerd, met een steeds langere wachttijd. Voltooide subagents worden niet langer als actief weergegeven, waardoor volgende berichten tot een herstart werden geblokkeerd, en een geheugenlek dat verband hield met de uitvoer van terminalopdrachten is verholpen. De titel van de versie verwijst naar een nieuw permissiesysteem, maar op dat punt beperken de release notes zich tot het hernoemen van de sectie met algemene instellingen naar „Global Permissions” en de optie om projectinstellingen over te nemen naar „Inherit Global”.
🔗 Changelog van Google Antigravity
IBM Research halveert de consistentiekloof van een agent met ALTK-Evolve
15 september — Op de Hugging Face-blog publiceert IBM Research het derde deel van zijn ALTK-Evolve-serie, ditmaal gewijd aan de uitvoeringsconsistentie van agents. Bij 168 AppWorld-taken slaagt een ReAct-agent onder GPT-4.1, ingesteld op temperatuur 0, gemiddeld in 77,4% van zijn uitvoeringen over vijf pogingen (Mean@5), maar voltooit hij alle vijf pogingen slechts bij 53,0% van de taken (Pass^5). IBM noemt dit verschil van 24,4 procentpunt de consistentiekloof (consistency gap).
De Consistency Analyzer detecteert instabiele beslissingen op basis van één geregistreerd traject: hij speelt elke stap offline opnieuw af door om vijf completions te vragen, zonder ground truth, zonder de taak opnieuw uit te voeren en zonder toegang tot de logits. Kwetsbare stappen worden consistentierichtlijnen (consistency guidelines), die tijdens de inferentie worden ingevoegd.
| Agentconfiguratie | Mean@5-score | Pass^5-score | Consistentiekloof |
|---|---|---|---|
| ReAct GPT-4.1 zonder richtlijnen | 77,4% | 53,0% | 24,4 punten |
| ReAct GPT-4.1 met consistentierichtlijnen | 81,0% | 69,0% | 12,0 punten |
Op gpt-oss-120b stijgt Pass^5 van 10,1% naar 16,1%. De Analyzer en het genereren van richtlijnen zijn geïntegreerd in de open-source repository van ALTK-Evolve.
🔗 Blogpost van IBM Research op de Hugging Face-blog
Aillis kiest Sakana Namazu voor Evidence Finder, 96,4% op het Japanse nationale geneeskunde-examen
14 september — Aillis, een Japans bedrijf dat medische hulpmiddelen op basis van machine learning ontwikkelt, neemt Sakana Namazu, het begin augustus door Sakana AI gelanceerde in het Japans gespecialiseerde LLM, in gebruik in Evidence Finder, zijn hulpmiddel voor het zoeken naar bewijsmateriaal voor artsen. Het persbericht, dat om 11.00 uur Tokio-tijd werd gepubliceerd, werd dezelfde dag om 15.30 uur Pacific Time door Sakana AI op X gedeeld, na ons overzicht van 14 september. Evidence Finder stelt op basis van de medische literatuur antwoorden op die hun referenties vermelden, waarvan de functie Verify het bestaan controleert; de twee bedrijven gaan ook samenwerken aan medische toepassingen.
De versie van Evidence Finder die op Sakana Namazu is gebaseerd, behaalt 96,4% (482 van de 500 punten) op de 120e editie van het Japanse nationale geneeskunde-examen, in februari 2026. Volgens Aillis’ overzicht van 1 september is dat de hoogste score van de binnenlandse foundation models die zijn aangewezen door het GENIAC-programma van het Japanse ministerie van Economie. Het persbericht maakt twee kanttekeningen: de productbeperkingen, waaronder het weigeren van vragen met afbeeldingen, werden voor deze test opgeheven, terwijl de commerciële dienst uitsluitend tekstvragen verwerkt, en Evidence Finder is geen medisch hulpmiddel.
🔗 Persbericht van Aillis op PR Times 🔗 Bericht van Sakana AI op X
Google becijfert het gebruik van AI en de maatschappelijke impact ervan
15 september — Google publiceert op dezelfde dag twee reeksen blogposts over het daadwerkelijke gebruik van AI en de maatschappelijke effecten ervan.
AI & Economy ATLAS wordt openbaar toegankelijk, met een studie over wetenschappers
AI & Economy ATLAS, het onderzoeksprogramma van het kantoor van Googles hoofdeconoom waaruit de cijfers over administratieve procedures kwamen die hier op 9 september werden genoemd, wordt een vrij toegankelijke interactieve ervaring: gebruikers kunnen er het gebruik van AI per beroep, thuis en per land vergelijken.
| Uitgelichte ATLAS-indicator | Door Google gepubliceerde waarde |
|---|---|
| India: aandeel van beroepen in kunst, design en media in het professionele AI-gebruik | 19%, oftewel 1,6 keer het wereldwijde gemiddelde |
| Verenigde Staten: aandeel van informatica en wiskunde | 30%, het dubbele van de rest van de wereld |
| Brazilië en Duitsland: aandeel van handmatige taken, zoals apparatuurdiagnostiek | 7%, tegenover 4% in Japan |
Een studie van Google, Google DeepMind en MIT FutureTech, gebaseerd op de analyse van 2.600 gespecialiseerde AI-modellen en een enquête onder meer dan 600 Amerikaanse en Britse wetenschappers, geeft aan dat bijna de helft van hen dagelijks AI gebruikt en zegt iets minder dan 7 uur per week te besparen. De auteurs wijzen ook op de nadelen: de tijd die wordt besteed aan het valideren van AI-uitvoer en een groeiende wachtrij van niet-geteste hypothesen, in afwachting van fysieke experimenten en klinische validaties.
🔗 Nieuwe inzichten uit Googles AI & Economy ATLAS
AI for Societal Impact: talen, Google.org-winnaars en FireSat
Volgens Google werken de technologieën van de groep in meer dan 300 talen, die door ruim 7 miljard mensen worden gesproken, en zijn verschillende datasets samen met lokale partners samengesteld. Google presenteert ook Language Explorer, een interactieve tool die de open database LinguaMeta visualiseert.
| Door Google genoemd initiatief | Bekendgemaakt cijfer |
|---|---|
| WAXAL, open spraakcorpus | 27 talen uit Sub-Saharaans Afrika |
| Project Vaani | Meer dan 30.000 uur spraak in 109 talen |
| Google.org Impact Challenge: AI for Government Innovation | 15 winnaars, 30 miljoen dollar, meer dan 2.600 aanmeldingen |
| FireSat | Eerste reeks operationele satellieten in een baan om de aarde, circa vijftig beoogd tegen 2030 voor elke 20 minuten een beeld |
| Planetary Prediction Engine, eind augustus gepresenteerd | Volgens Google werd 83% van de opkomende ebolahaarden in de Democratische Republiek Congo vooraf opgespoord |
De winnaars van Google.org, waaronder Code for America voor belastingaangiften en Johns Hopkins University voor verkeersveiligheid, krijgen vrijwillige begeleiding van Google-engineers en ontwerpen hun projecten als herbruikbare open-sourcemodellen.
🔗 AI voor iedereen in elke taal 🔗 15 organisaties die de publieke dienstverlening transformeren met AI 🔗 AI bouwen om de wetenschap te versnellen en levens te verbeteren 🔗 Bosbranden detecteren met AI
Kort nieuws
- Anthropic publiceert een handleiding voor de implementatie van Claude in salesteams — Building an AI-native revenue organization, dat op dezelfde dag verscheen als Salesforce in Claude, wordt gepresenteerd in een blogbericht waarin twee klanten worden genoemd: Cox Communications zegt in het eerste jaar een zevenvoudig rendement op zijn investering te hebben behaald en de kosten voor de validatie en verrijking van leads met 86% te hebben verlaagd, waarbij de nauwkeurigheid steeg van 18% naar 97%, en 88% van de circa 1.500 medewerkers van Cyera gebruikt Claude wekelijks. 🔗 bron
- Perplexity publiceert een handleiding over schaduw-AI (shadow AI) — het blogbericht bevat geen eigen gegevens en bundelt enquêtes van derden: ongeveer de helft van de werknemers zegt de regels van hun organisatie te hebben overtreden door AI te gebruiken (KPMG), en 82% van de respondenten in een enquête van de Cloud Security Alliance meldt onbekende agents op de systemen van hun organisatie. Het eindigt met een verkooppraatje voor Perplexity Enterprise en Comet for Enterprise, zonder nieuwe functionaliteit. 🔗 bron
- v0 wordt modelagnostisch (model-agnostic) — volgens één enkele tweet biedt de applicatiebouwtool van Vercel frontiermodellen en goedkope, open en snelle modellen aan via Vercel AI Gateway, waaronder Claude, GPT, Kimi, GLM, Grok en DeepSeek; noch de volledige lijst, noch de prijzen, noch de betrokken abonnementen worden vermeld. 🔗 bron
- Warp zet cijfers op zijn interne softwarefabriek — in een blogbericht over een methode in drie fasen (crawl, walk, run) voor de invoering van de softwarefabriek (software factory) meldt Zach Lloyd, CEO van Warp, dat de fabriek van het bedrijf ongeveer 75% van de wijzigingen aan warp.dev, zijn marketingsite, automatiseert; Warp Factories blijft in vroege toegang, waarbij gekwalificeerde bedrijven 10.000 dollar aan gratis gebruik krijgen. 🔗 bron
- Kimi Code 0.43.1 corrigeert zijn zwermen subagents — minder dan 19 uur na 0.43.0 publiceert Moonshot AI zeven correcties, waaronder het vrijgeven van geheugen wanneer een subagent klaar is, lichtere rendering en een lichtere event loop in grote zwermen, en een Ctrl+C dat voortaan alleen de subagents onderbreekt in plaats van de volledige CLI af te sluiten. 🔗 bron
- Gemini CLI v0.60.0 wordt stabiel — de versie neemt zonder wijzigingen de preview van 8 september en de elf bijbehorende beveiligingsverbeteringen over, terwijl v0.61.0-preview.0 de volgende reeks opent met drie correcties die al als nightly zijn gepubliceerd en een correctie voor de agent loop. 🔗 bron
- Copilot stelt toegestane waarden voor aangepaste repository-eigenschappen voor — bij het aanmaken van een aangepaste eigenschap (custom property) voor een onderneming of organisatie stelt Copilot waarden voor die met één klik kunnen worden geaccepteerd; de functie is beschikbaar als publieke preview voor Copilot Business en Enterprise, onder beheer van het beleid ‘Repository custom property suggestions’. 🔗 bron
- Grok Imagine wijzigt tekst in afbeeldingen, in bèta — met de beeld- en videogeneratietool van SpaceXAI kan tekst op elke afbeelding, zoals een uitnodiging, poster of advertentie, worden aangepast; de aankondiging vermeldt noch de abonnementen, noch de platforms, noch het gebruikte model. 🔗 bron
- MiniMax H3 haalt bij denoising meer dan tweemaal realtime — in een tweet die op 14 september om 16.34 uur Pacific Time werd gepubliceerd, na onze inventarisatie van diezelfde dag, meldt MiniMax dat H3 met SGLang-Diffusion en VDN-H3 in 9,0 seconden 14,4 seconden aan 768p-video genereert op 8 B200-GPU’s, zonder gemeten kwaliteitsverlies, als uitbreiding op het H3-ecosysteem dat op 14 september werd geïnventariseerd. 🔗 bron
- Retrieve-for-Train distilleert reinforcement learning in een klein diffusiemodel — dit werk van Google Research, afkomstig uit een ICML 2026-paper, traint een model met 4B parameters één keer offline via reinforcement learning (Reinforcement Learning) om uiteenlopende subquery’s te produceren en distilleert dit gedrag vervolgens in een diffusiemodel met 53,9 miljoen parameters, dat de volledige set in één doorgang genereert en daarmee een versnelling met een factor 12 tot 20 behaalt. 🔗 bron
- NVIDIA kwantificeert de keuze tussen een dicht model en een mixture of experts (Mixture-of-Experts, MoE) — dit educatieve blogbericht vergelijkt Gemma 4 31B, Qwen3.8-27B, Nemotron 3.5 Lightning en Mistral Small 4 aan de hand van gegevens van Artificial Analysis die op 31 augustus zijn verzameld: Lightning, met 30B parameters waarvan 3B actief, is 4 tot 5 keer sneller dan Qwen3.8-27B tegen een veertiende van de prijs, maar haalt minder dan de helft van diens capaciteitsscore. 🔗 bron
- NVIDIA FLARE 2.9 voegt Slurm toe — het framework voor federated learning (federated learning), dat sinds versie 2.8 Docker en Kubernetes ondersteunt, laat de drie omgevingen nu naast elkaar functioneren binnen één federatie en introduceert een overdraagbare beschrijving van resources per job. 🔗 bron
- Sakana Marlin voegt interactief lezen en PowerPoint-export toe — met interactief lezen (Interactive Reading) maakt de autonome onderzoeksassistent van Sakana AI het mogelijk om de agent vragen te stellen over zijn rapport en rechtstreeks een daarbij aangehaalde bron te openen die de bewering onderbouwt; daarnaast exporteert hij bewerkbare PowerPoint-presentaties met de URL’s van hun bronnen. 🔗 bron
- ShadowPEFT wordt opgenomen in de PEFT-bibliotheek — communityblogbericht: de methode, die een klein afkoppelbaar ‘schaduw’-netwerk aan het bevroren model koppelt, is samengevoegd met de hoofdbranch van PEFT en wordt in de volgende versie uitgebracht; op Llama-3.2-3B meten de auteurs 48,1% op GSM8K tegenover 46,9% voor LoRA, maar met een piekgeheugengebruik van 28,2 GB tegenover 22,3 GB. 🔗 bron
- RiverRider vergelijkt bestandslokalisatie met toeval — individuele bijdrage: op SWE-bench Verified plaatst een lokale encoder met 33 miljoen parameters in 45,8% van de gevallen het juiste bestand bovenaan, maar een ondergrens met gepermuteerde query’s vindt het al in 24,4% van de gevallen terug in de eerste 50 resultaten, waardoor de verhouding tussen signaal en toeval daalt van 45,8 naar 3,9. 🔗 bron
- EcoHash verdubbelt de concurrency van een RTX PRO 6000 op Qwen3.8-27B — een blogbericht van een inferenceprovider, die op 14 september al voor een ander onderwerp werd genoemd, gemeten op diens eigen dienst: door in vLLM 0.27.1 de multi-token prediction-head (multi-token prediction, MTP) van het model te activeren, daalt de tijd per token van 22 naar 13 ms en stijgt de volgehouden concurrency van 32 naar 64 verzoeken, een maximum dat in twee van de vier herhalingen werd bereikt, ten koste van 23% van de KV-cachecapaciteit. 🔗 bron
- DINO-X publiceert een onderzoeksmodel voor levervaten, inclusief de mislukkingen — een communitymodel dat uitsluitend voor onderzoek is bedoeld: deze ViT-Base met 86 miljoen parameters behaalt een externe AUROC van 0,9413 op 17.639 CT-slices, en de auteur publiceert ook de negatieve resultaten, waaronder een niet-uitgebracht model voor de dikke darm met een score van 0,6529. 🔗 bron
Wat dit betekent
Spraak wordt een volwaardige agentinterface. Gemini 3.8 Live en de variant Extended Thinking roepen op de achtergrond tools aan terwijl het antwoord doorgaat en besteden extra aandacht aan de nauwkeurigheid van gedicteerde codes en nummers, met geschatte kosten per minuut audio. Google plaatst de variant Extended Thinking, die commentaar geeft op de voortgang van zijn achtergrondtaken, onmiddellijk in zijn werktools met Docs Live, Gmail Live en Keep Live, terwijl Gemini Notebook op zijn beurt een spraakgesprek aankondigt dat is verankerd in de bronnen van elk notebook. De aandacht verschuift van de kwaliteit van de stem naar wat het model uitvoert terwijl het spreekt.
De tweede rode draad is distributie: agents komen bedrijfstools binnen via kanalen die al bestaan. Salesforce in Claude verschijnt met salesskills, connectors naar het CRM en Slack, en goedkeuring voor elke schrijfactie; HP installeert Perplexity vooraf in de taakbalk van zijn pc’s en koppelt het met alleen-lezen-toegang aan Revit-ontwerpen; Devin kan via AWS Marketplace worden aangeschaft en in een speciale VPC worden geïmplementeerd. In elk geval komt de agent naar de tool die het bedrijf al gebruikt, met de bijbehorende waarborgen: de Salesforce-rechten van de verkoper, alleen-lezen-toegang tot Revit en een speciale VPC bij AWS.
De derde rode draad draait om betrouwbaarheid en controle. Versies 2.1.271 en 2.1.273 van Claude Code laten feedback van subagents door de classifier beoordelen, openen het netwerk per commando en corrigeren omzeilingen van machtigingen via subshells of genegeerde MDM-instellingen. IBM Research laat zien dat een agent die op temperatuur 0 is ingesteld gemiddeld bij 77,4% van zijn uitvoeringen kan slagen, maar slechts bij 53,0% van de taken alle vijf uitvoeringen succesvol afrondt, en adviseert om Pass^k naast het gemiddelde te publiceren. NVIDIA stelt dezelfde eis aan hardware: NVLink 6 herstelt een verbinding in ongeveer 1,5 seconde en Shadow Engine Recovery verkort een inferenceonderbreking van 283 naar 7,3 seconden. De vraag is niet langer alleen of een agent slaagt, maar of hij elke keer slaagt, binnen verifieerbare grenzen.
De laatste rode draad betreft het tempo. OpenAI verwijdert GPT-5.5 één maand na de aankondiging uit zijn applicaties, zoals eerder met GPT-5.4, en vraagt de identifier overal te vervangen waar die expliciet is geselecteerd, tot en met geplande taken en scripts. Aan de toolkant brengt Claude Code drie versies in 22 uur uit, publiceert Kimi Code minder dan 19 uur na de vorige versie een correctie en promoveert Gemini CLI de preview van 8 september een week later tot stabiele versie. Tegelijkertijd verklaart v0, dat modellen tot nu toe één voor één aan zijn selector toevoegde, zich modelagnostisch en steunt het op Vercel AI Gateway: het model wordt er een verwisselbaar component.
Bronnen
- Google, Gemini 3.8 Live en 3.8 Live Extended Thinking
- Google, ontwikkelaarsblogbericht over de Live API
- Google DeepMind, modelkaart van Gemini 3.8 Audio
- Google DeepMind op X, aankondiging van Gemini 3.8 Live
- Claude Code, release notes 2.1.271
- Claude Code, release notes 2.1.273
- Claude, Bringing Salesforce into Claude
- Claude-helpcentrum, Salesforce in Claude configureren
- OpenAI, changelog van ChatGPT en Codex over de verwijdering van GPT-5.5
- ChatGPT op X, einde van GPT-5.5 in ChatGPT, ChatGPT Work en Codex
- Perplexity, Perplexity comes to more Windows PCs with HP
- Cognition, overeenkomst met AWS
- Devin, Bringing macOS to Devin
- NVIDIA, deterministische uitvoering van Groq 3 LPX
- NVIDIA, veerkracht van NVLink 6
- Google, nieuwe studietools van Gemini Notebook
- Google Antigravity, changelog
- Hugging Face, IBM Research en de consistentie van agents met ALTK-Evolve
- PR Times, persbericht van Aillis
- Sakana AI op X, doorplaatsing van het persbericht van Aillis
- Google, AI & Economy ATLAS
- Google, AI voor iedereen in elke taal
- Google.org, winnaars van AI for Government Innovation
- Google, AI bouwen om de wetenschap te versnellen en levens te verbeteren
- Google, bosbranden detecteren met AI
- Claude, Building an AI-native revenue organization
- Perplexity, Shadow AI
- v0 op X, modellen naar keuze via Vercel AI Gateway
- Warp, Adopting The Software Factory Model
- Kimi Code, release notes 0.43.1
- Gemini CLI, release notes v0.60.0
- GitHub Changelog, suggesties voor aangepaste eigenschappen door Copilot
- Grok Imagine op X, tekst in afbeeldingen wijzigen
- MiniMax op X, H3 met SGLang-Diffusion en VDN-H3
- Google Research, Retrieve-for-Train
- NVIDIA, dichte modellen of MoE
- NVIDIA, FLARE met Docker, Kubernetes en Slurm
- Sakana AI, update van Marlin
- Hugging Face, ShadowPEFT in PEFT
- Hugging Face, RiverRider en bestandslokalisatie
- Hugging Face, EcoHash en speculatief decoderen
- Hugging Face, DINO-X