Zoeken

Google Cloud lanceert zijn Gemini-agent voor het werk, HeyGen Voice en de dynamische workflows van Claude Managed Agents

ai-powered-markdown-translator

Artikel vertaald van het Frans naar het Nederlands met gpt-6.1-sol.

Bekijk project op GitHub ↗

Google Cloud presenteerde op 8 oktober, tijdens Gemini at Work 2026, de Gemini-agent: één agent voor al het werk binnen bedrijven, die continu in de cloud draait en zowel Gemini-modellen als Claude-modellen aanstuurt. HeyGen brengt ondertussen HeyGen Voice uit, zijn eerste eigen spraakmodel, dat bovenaan de Controlled Voice-ranglijst van Artificial Analysis komt te staan. Anthropic introduceert in Claude Managed Agents workflows die tot 1 000 agents per uitvoering kunnen starten. Op het gebied van code leert Codex het volgende bericht van de gebruiker te voorspellen en krijgt het onder Windows een nieuwe sandbox op basis van Microsoft Execution Containers.


Google Cloud lanceert de Gemini-agent, één agent voor al het werk

8 oktober — Tijdens Gemini at Work 2026 presenteerde Google Cloud de Gemini-agent, die het omschrijft als één universele agent voor het werk. Vanuit één invoerveld en één API beantwoordt hij vragen, voert hij kenniswerk uit, maakt hij afbeeldingen en media, en schrijft en voert hij code uit. Het idee van Thomas Kurian, CEO van Google Cloud: je geeft hem een doel in plaats van een reeks instructies.

De agent draait continu in de cloud, met één geheugen, en is overal beschikbaar: web, iOS, Android, Windows, Mac, opdrachtregel, Google Workspace, Microsoft 365 en Slack, of zonder interface (headless) in applicaties van derden. Een taak die meerdere uren of dagen duurt, loopt door als de computer is dichtgeklapt. Voor langdurig werk maakt hij tijdelijke subagents aan, elk met een eigen identiteit. Hij kan ook een collega-agent (coworker agent) met een vaste rol worden, met een eigen @agents.company.com-adres en opslag. Het model wordt een afzonderlijke keuze: volgens Google stuurt de agent al Gemini-modellen en Claude-modellen van Anthropic aan, en volgen later andere private en open modellen. Sectorgerichte varianten komen als preview beschikbaar voor de financiële sector (meer dan 50 basisskills, die CME Group en Deutsche Bank al gebruiken) en de juridische sector.

Aangekondigde controlecomponentDoor Google beschreven functie
Identiteit van elke agentCryptografisch geattesteerde identiteit, rechten per rol, auditlog op zijn naam
Agent SandboxGeïsoleerde uitvoering, met een eigen netwerkgrens
Agent GatewayNetwerkfirewall voor AI, waar al het verkeer van de agent doorheen gaat
Realtime bestedingslimietenIn Cloud Billing wordt de projectagent gepauzeerd, hervatten kan met één klik

Google Cloud presenteert ook cijfers: bijna 500 klanten hebben elk in één jaar meer dan 1 000 miljard tokens verwerkt, en bijna 90 % van de Fortune 100 gebruikt Gemini Enterprise. De blogpost noemt echter geen beschikbaarheidsdatum of prijs voor de agent zelf; Google Cloud noemt alleen grote klanten die hem vooraf hebben getest, zoals het sportmerk On voor de dynamische modelkeuze.

🔗 Gemini at Work 2026 (Google Cloud-blog)

Gemini Enterprise maakt Claude Opus 5.5 en Claude Sonnet 5.5 beschikbaar in de Antigravity-tools

8 oktober — Op dezelfde dag melden de release notes van Gemini Enterprise dat beheerders Claude Opus 5.5 en Claude Sonnet 5.5 kunnen inschakelen in Antigravity 2.0, de Antigravity CLI en de Antigravity-extensies voor IDE. De beheerder accepteert de gebruiksvoorwaarden rechtstreeks in de Google Cloud-console, zonder afzonderlijk Anthropic-account.

ActiveringsinstellingDoor Google opgegeven waarde
StandaardstatusModellen van derden uitgeschakeld, inschakeling door beheerders
FactureringswijzeOp basis van verbruik, binnen de bestedingslimiet van het project
Inference-locatiesglobal, us en eu
DenkniveausLow, Medium (standaard), High of Max

De ontwikkelaar behoudt zijn Gemini Enterprise-licentie en kiest Claude in de modelkiezer. Overschrijdingen (overages) moeten zijn ingeschakeld voordat een model van derden kan worden gebruikt. De kosten daarvan vallen binnen de gezamenlijke limiet voor alle modellen. Dezelfde pagina kondigt de algemene beschikbaarheid van Gemini 3.8 Flash in Singapore aan.

🔗 Release notes van Gemini Enterprise


Spraak: HeyGen Voice bovenaan de Controlled Voice-ranglijst, Mistral publiceert twee modellen voor het Arabisch

9 oktober — HeyGen lanceert HeyGen Voice, dat Joshua Xu presenteert als het eerste intern ontwikkelde spraakmodel van het bedrijf, dat tot nu toe bekendstond om zijn avatars. Het model is beschikbaar in HeyGen en via de API, voor 30 dollars per miljoen tekens; tot 31 oktober betalen API-gebruikers 15 dollars en wordt de korting automatisch toegepast.

De onderbouwing komt van Artificial Analysis, dat zijn resultaten anderhalve minuut vóór HeyGen publiceerde. Op de Controlled Voice-ranglijst, waar alle modellen met dezelfde 8 gekloonde stemmen spreken, in Amerikaans en Brits Engels, neemt HeyGen Voice de eerste plaats in met een Elo van 1 201 bij 1 468 deelnames. Het staat daar bovenaan in de categorieën Assistenten en Klantenservice, en ook in Brits Engels.

HeyGen Voice takes the #1 spot on the Artificial Analysis Controlled Voice TTS Arena Leaderboard, ahead of Alibaba’s Qwen-Audio-3.1-TTS-Plus and ElevenLabs’ Eleven v4 Turbo

🇳🇱 HeyGen Voice neemt de eerste plaats in op de Controlled Voice TTS Arena-ranglijst van Artificial Analysis, vóór Qwen-Audio-3.1-TTS-Plus van Alibaba en Eleven v4 Turbo van ElevenLabs. — @ArtificialAnlys op X

Beoordeeld modelElo Controlled Voice (9 oktober)API-prijs per miljoen tekens
HeyGen Voice1 20130 dollars (15 tot 31 oktober)
Qwen-Audio-3.1-TTS-Plus1 18219,3 dollars
Eleven v4 Turbo1 16640 dollars
Eleven v41 16280 dollars

Die eerste plaats geldt voor een specifiek onderdeel: het klonen van stemmen. Op de Provider Voice-ranglijst, waar elke aanbieder zijn eigen stemmen gebruikt, stonden Eleven v4 Turbo en Eleven v4 op de avond van 9 oktober nog bovenaan, terwijl HeyGen Voice niet bij de eerste acht stond. Voor uitspraakrobuustheid behaalt HeyGen Voice 83,1 %, goed voor de 10e plaats van 29.

Via de API gebeurt het klonen onmiddellijk: één opname, waarvan alleen de eerste drie minuten worden gebruikt, levert binnen enkele seconden een actieve stem op, zonder training. De synthese gebeurt in één keer (een WAV-bestand op 44,1 kHz) of via streaming, en Artificial Analysis heeft de standaardinstellingen van de API beoordeeld.

🔗 Aankondiging van HeyGen

Voxtral Mini 4B Realtime Arabic en LIDstral Arabic: twee modellen van Mistral voor het Arabisch

8 oktober — Mistral heeft zonder aankondiging twee open modellen voor het Arabisch onder de Apache 2.0-licentie op Hugging Face gepubliceerd. Voxtral Mini 4B Realtime Arabic transcribeert Arabische dialecten en Modern Standaardarabisch via streaming, ook wanneer sprekers midden in een gesprek van taal wisselen (code-switching). Het is verder getraind op basis van Voxtral Mini 4B Realtime en heeft ongeveer 4,4 miljard parameters. Volgens de modelkaart is het samen ontwikkeld met het Marokkaanse ministerie van Digitale Transformatie en Administratieve Hervorming, in het kader van de samenwerkingsovereenkomst die Mistral en Marokko in januari 2026 ondertekenden en die ook twee nieuwe benchmarks heeft opgeleverd, ISMA en Darija in the Wild.

Gepubliceerd modelFunctie van het modelResultaat volgens de modelkaart
Voxtral Mini 4B Realtime ArabicStreamingtranscriptie van het ArabischGemiddeld foutenpercentage per teken van 8,82 % op 7 benchmarks bij 480 ms, tegenover 7,91 % voor Voxtral Transcribe Arabic
LIDstral ArabicIdentificatie van taal en dialect, 51 klassen, op de processorF1 van 88,67 % voor Marokkaanse darija, tegenover 71,28 % voor GlotLID v3

🔗 Voxtral Mini 4B Realtime Arabic op Hugging Face · LIDstral Arabic op Hugging Face


Claude Managed Agents: dynamische workflows met tot 1 000 agents per uitvoering

9 oktober — Anthropic stelt de dynamische workflows (dynamic workflows) van Claude Managed Agents beschikbaar als publieke bèta, een nieuw type multiagent-orkestratie. De agent die de sessie leidt, schrijft zelf een programma dat de server op de achtergrond uitvoert door in fasen veel agents te starten en vervolgens hun resultaten te combineren. Zodra het type multiagent_20261001 is ingeschakeld, beslist de agent zelf om een uitvoering te starten.

Een uitvoering start tot 1 000 agents, waarvan 64 tegelijk, heeft standaard een levensduur van 24 uur, en een sessie kan er 10 open houden. De tokens ervan worden op dezelfde manier gefactureerd als die van de sessie en tellen mee voor het sessiebudget; Anthropic waarschuwt dat het er veel kunnen zijn en noemt een interne test met 70 bewust ingevoegde bugs in een codebase van 116 000 regels.

Configuratie van de test van AnthropicGevonden bugs bij 3 pogingen
Eén agent14, 15 en 27
Dynamische workflow66 bij elke poging

🔗 Aankondiging van @ClaudeDevs · Documentatie over workflowuitvoeringen


Codeagents: berichtvoorspellingen en een MXC-sandbox voor Codex, Claude Code 2.1.296, Vibe CLI 2.26.1

Codex krijgt op dezelfde dag twee nieuwe functies, terwijl Anthropic en Mistral nieuwe versies van hun opdrachtregelagents publiceren.

Codex voorspelt het volgende bericht van de gebruiker, als bèta voor Pro-abonnees

9 oktober — OpenAI stelt voorspellingen in de composer (composer predictions) als bèta beschikbaar in de Codex-desktopapp. Wanneer Codex klaar is met antwoorden, kan in het invoerveld een suggestie voor het volgende bericht verschijnen, op basis van de huidige conversatie, zonder informatie uit geheugens of gekoppelde applicaties op te halen. Met de Tab-toets wordt de suggestie ingevoegd; de tekst blijft bewerkbaar en wordt nooit automatisch verzonden. De suggestie betreft een volledig bericht, geen aanvulling woord voor woord.

BètavoorwaardeDoor OpenAI opgegeven waarde
Abonnement en leeftijdChatGPT Pro voor persoonlijk gebruik, 18 jaar en ouder
Conversaties en modellenLokale en SSH-conversaties, met GPT-6 Astra of GPT-6.1 Sol
StandaardinstellingIngeschakeld, uit te schakelen via General > Composer > Show predictions
Kosten tijdens de bètaTelt niet mee voor de gebruikslimieten van Codex, verbruikt geen credits

Verzonden berichten, inclusief geaccepteerde voorspellingen, tellen gewoon mee zoals gebruikelijk. De functie bestaat niet in Chat.

🔗 Aankondiging van @OpenAIDevs · Helpartikel van OpenAI

Codex onder Windows: een sandbox op basis van Microsoft Execution Containers

9 oktober — OpenAI voegt aan Codex onder Windows een sandboxmodus toe op basis van Microsoft Execution Containers (MXC), die Microsoft op 7 oktober algemeen beschikbaar heeft gemaakt. Deze vereist een compatibel Windows 11-apparaat (24H2 build 26100.9278 of 25H2 build 26200.9278) en belooft een snellere installatie, strengere netwerkcontrole en nauwkeuriger ingestelde bestandstoegang.

Volgens de documentatie wordt MXC de aanbevolen implementatie: het biedt ingebouwde procesisolatie, zonder een door een beheerder goedgekeurde configuratie, extra Windows-accounts of lokale firewallregels. De modi elevated en unelevated worden legacy-fallbacks. De desktopapp kiest automatisch MXC voor consumentenaccounts; in de CLI of in bedrijfsomgevingen wordt het ingeschakeld met prefer_mxc = true in config.toml, en een beheerder kan het blokkeren met allow_mxc = false. Er zijn twee beperkingen gedocumenteerd: het beheerde netwerk vereist allow_local_binding = true, en overgebleven child-processen stoppen zodra de opdracht op de voorgrond is voltooid.

🔗 Aankondiging van @OpenAIDevs · Documentatie over de Windows-sandbox

Claude Code 2.1.296: eigen compaction voor subagents en één model voor workflowagents

9 oktober — Claude Code 2.1.296 telt 79 vermeldingen, waaronder 56 fixes, en werd zonder bijbehorende tweet uitgebracht. De versie biedt vooral meer controle over subagents.

Nieuwe functie in deze versieWat deze verandert
autoCompactWindow (subagents, --agents)Een subagent voert eerder compaction van zijn context uit dan de hoofdconversatie
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODELAlle agents van een workflow gebruiken hetzelfde model, andere subagents behouden hun eigen model
Optie allow_large van ReadEen groot tekstbestand lezen met één aanroep, als de context dat toelaat
CLAUDE_CODE_OVERLOADED_RETRY_MAX_DELAY_MSLangere maximale wachttijd tussen twee nieuwe pogingen na een 529-fout
MCP-toolbeschrijvingen meteen meegestuurdStandaardlimiet verhoogd van 2 048 naar 4 096 tekens

/cost en de statusregel rekenen cache reads van Sonnet 5.5 voortaan mee tegen 0,10 dollar per miljoen tokens. Op het gebied van beveiliging verhelpt de versie problemen met beheerde PreToolUse-hooks die een aanroep weigerden zonder de beurt te beëindigen, Bash-controles die bepaalde opdrachten met BASH_ARGV0 automatisch goedkeurden, cloudsessies die de controles van de automodus oversloegen bij acties van Claude in Chrome, en wijzigingen met Edit en NotebookEdit die alle niet-ASCII-tekens in niet-UTF-8-bestanden vervingen en nu worden geweigerd.

🔗 Claude Code 2.1.296 op GitHub

Vibe CLI 2.26.1: het lokale Devstral-model verwijderd, een uitgebreidere niet-interactieve modus

9 oktober — Drie dagen na 2.26.0 en zonder tweet brengt Mistral Vibe CLI 2.26.1 uit. Ondanks het patchnummer bevat de versie 85 vermeldingen (23 toevoegingen, 24 wijzigingen, 36 fixes, 2 verwijderingen), waarvan 37 voor de nieuwe interface in Rust. Het meegeleverde lokale Devstral-model wordt verwijderd: een configuratie die dit model nog vastzet, schakelt met een waarschuwing terug naar het gehoste standaardmodel. Dat biedt nog maar twee denkniveaus, off en high, en geeft een contextvenster van 256k op, waarop de automatische compaction wordt afgestemd.

De niet-interactieve modus vibe -p krijgt een tijdslimiet, de mogelijkheid om de prompt uit een bestand of standaardinvoer te lezen, een export.json-rapport dat bij elke beëindiging wordt geschreven en afzonderlijke exitcodes: 1 voor een gebruiks- of configuratiefout, 2 voor een infrastructuurstoring, 3 voor een bereikte limiet of een weigering van het model. De Rust CLI voegt /proxy-setup, een verteller die de samenvatting van elke beurt hardop voorleest, /plugins en /whoami toe. Nieuwe instellingen verbieden de agent achtergrondprocessen of subagents, en de Document Library-connector blijft standaard uitgeschakeld.

🔗 Release notes van Vibe CLI 2.26.1


Generatieve beelden, video’s en games: Qwen-Image-2.1-Turbo, de Thinking-modus van Midjourney, Syren van Synthesia, Playground van Google

Een sneller en goedkoper beeldmodel, een generator die zijn eigen resultaat controleert, een agent die video’s monteert en een platform voor games zonder code.

Qwen-Image-2.1-Turbo: 8 stappen voor ruisonderdrukking en 0,016 dollar per afbeelding

9 oktober — Qwen brengt Qwen-Image-2.1-Turbo uit, een versneld checkpoint (accelerated checkpoint) van Qwen-Image-2.1 dat afbeeldingen genereert en bewerkt in 8 stappen voor ruisonderdrukking, op dezelfde architectuur met 7 miljard parameters. Volgens Qwen produceert het nog steeds 2K-afbeeldingen en ondersteunt het bewerkingen in natuurlijke taal, maar er worden geen kwaliteits- of snelheidscijfers voor deze specifieke versie gepubliceerd. De gewichten staan op Hugging Face en ModelScope, onder de onderzoekslicentie van Qwen (Qwen Research License). Het checkpoint bevat zijn samplingschema van 8 stappen en draait standaard met een CFG van 1.

Dezelfde dag stelt Qwen de API’s voor Qwen-Image-2.1 Pro en Turbo officieel beschikbaar; QwenCloud staat voor Turbo 120 verzoeken per minuut toe.

Model aangeboden via API (Model Studio)Prijs per afbeeldingGratis afbeeldingen
qwen-image-2.1-turbo0,016 dollar10
qwen-image-2.1-pro0,04 dollar10
qwen-image-2.0-pro0,075 dollar100

🔗 Aankondiging van Qwen · Modelpagina op Hugging Face

Midjourney test een Thinking-modus en introduceert gedeelde mappen op zijn alphasite

8 oktober — De alpha-changelog van Midjourney, die ‘s avonds is gepubliceerd, presenteert twee functies in een vroege versie, voorlopig uitsluitend beschikbaar op alpha.midjourney.com. De eerste is een test: bij een afbeelding die met V8.2 is gegenereerd of bewerkt, vraagt de knop Rerun (Thinking) het model om het resultaat te bekijken, vast te stellen waar het van de prompt afwijkt (objecten, lay-out, anatomie, tekst) en het opnieuw te genereren. Midjourney zegt betere resultaten te zien op het gebied van overeenstemming met de prompt, typografie en consistentie, en overweegt er een algemene modus van te maken.

De tweede is het delen van mappen: je nodigt Medewerkers uit, die rechtstreeks in de map genereren, of Lezers, en je kunt delen via een link of de map zelfs openstellen voor alle Midjourney-leden. Midjourney benadrukt dat delen de zichtbaarheid van afbeeldingen niet verandert: zonder de stealth-modus kunnen ze nog steeds op Explore en op profielen verschijnen.

🔗 Alpha-changelog van Midjourney · Test van de Thinking-modus (Midjourney)

Syren: Synthesia laat een agent video’s maken, in bèta

9 oktober — Synthesia lanceert Syren in bèta voor al zijn klanten, inclusief gratis accounts. Je beschrijft de gewenste video of levert documenten, afbeeldingen, video’s, PowerPoint-presentaties of YouTube-links aan, en Syren levert een afgewerkte video met bewegende grafische elementen (motion graphics), avatars, voice-over, muziek en tussenshots (b-roll), die je vervolgens in een gesprek bijstuurt. Volgens Peter Hill, technisch directeur van Synthesia, schrijft de agent de hele video als code, die een eigen renderingengine live afspeelt. Die engine wordt sinds juni gebruikt voor de animaties van Synthesia.

De video’s duren maximaal 3 minuten, in horizontaal of verticaal formaat, en worden in de browser gerenderd. Er wordt afgerekend met credits, zonder gedetailleerde tarieven, en Enterprise-beheerders kunnen de tool uitschakelen. Het automatisch aanleren van de merkidentiteit op basis van bestaande video’s wordt in het blogbericht aangekondigd voor binnenkort. Syren verschijnt vier dagen na HyperFrames Studio van HeyGen en een dag na Claude Motion van Anthropic, twee andere tools waarbij een agent de video produceert.

🔗 Introductie van Syren (Synthesia)

Playground: Google opent een platform om games te maken zonder te programmeren

7 oktober — Google lanceert Playground, een experimenteel gameplatform waarop je games maakt, speelt en deelt door ze met enkele prompts te beschrijven, zonder code te schrijven. In een gespreksinterface begin je met een leeg blad, een voorbeeld om te remixen of begeleide ondersteuning, waarna je op verzoek de fysica, regels, personages of omgeving aanpast.

De games draaien in de browser, zowel op telefoons als op computers, en kunnen privé blijven, via een link worden gedeeld of in de Explore-galerij verschijnen, met ranglijsten en multiplayer voor bepaalde genres; elke gepubliceerde game ondergaat een veiligheidscontrole. Playground is in de Verenigde Staten beschikbaar voor mensen van 18 jaar en ouder, met mogelijkheden om games te maken die afhangen van het Google AI-abonnement. Een integratie met Unity Spark, voor ambitieuzere 3D-games, wordt binnenkort in een gesloten bèta verwacht. Google vermeldt niet welk model het platform aandrijft.

🔗 Introductie van Playground (Google-blog)


Gezondheid: de klinische studie naar AMIE gepubliceerd in The Lancet

8 oktober — Google en het Beth Israel Deaconess Medical Center (BIDMC) publiceren in The Lancet een prospectieve haalbaarheidsstudie naar AMIE (Articulate Medical Intelligence Explorer), de conversationele IA van Google voor diagnostiek; volgens Google is dit de eerste publicatie ervan in het hoofdtijdschrift van The Lancet. Patiënten spraken tot vijf dagen vóór een spoedconsult met AMIE, waarna de arts de transcriptie en een samenvatting ontving.

Maatstaf van de studieGepubliceerd resultaat
Geïncludeerde patiënten (april tot november 2025), daarna gevolgd114, daarna 98
Stopzettingen om veiligheidsredenen0
Vastgestelde hallucinaties1
AMIE nuttig ter voorbereiding op het consult, volgens de arts33 van de 44 gevallen (75 %)
Diagnoses die overeenkomen met de uiteindelijke diagnose (Google)90 %

Het betreft een studie op één locatie, zonder controlegroep en gefinancierd door Alphabet; dit is geen toelating of uitrol: de auteurs vragen om grotere onderzoeken.

🔗 Blogbericht van Google · Het artikel in The Lancet


Onderzoek bij OpenAI: de reactie op de brief van drie onderzoekers van wie het bedrijf afscheid nam

9 oktober — In een verklaring op @OpenAINewsroom namens zijn onderzoeksleiders reageert OpenAI op de brief van drie onderzoekers van wie het naar eigen zeggen de week ervoor afscheid heeft genomen. Volgens OpenAI concludeerde een intern onderzoek dat zij duidelijke regels voor het omgaan met gevoelige informatie hadden overtreden, met een vertrouwensbreuk die verder ging dan wat hun brief beschrijft; OpenAI blijft bij zijn beslissing. Het bedrijf stelt dat deze beslissingen geen verband houden met het aankaarten van veiligheidszorgen of met publieke uitlatingen, en dat het geen werknemers ontslaat omdat zij zorgen hebben geuit.

De verklaring kondigt ook aan:

We are actively finalizing contracts with third-party safety assessors and will announce details in the coming weeks.

🇳🇱 We werken actief aan de afronding van contracten met externe veiligheidsevaluatoren en zullen de details de komende weken bekendmaken. — @OpenAINewsroom op X

OpenAI zegt het op één punt met de brief eens te zijn: het behouden van de monitorbaarheid (monitorability) van frontier-modellen vereist inzet van de hele sector, inclusief OpenAI. Dit artikel geeft de versie van OpenAI weer; de brief van de onderzoekers is niet geraadpleegd.


Open modellen maken: zes modellen voor ongeveer 103 dollar met ML Intern, de GPU-scheduler van Ai2

Twee praktijkverslagen over het maken van modellen: het ene vanuit de agent, het andere vanuit de rekenclusters.

ML Intern: zes open modellen voor ongeveer 103 dollar aan rekenkosten

8 oktober — De ML Intern-modus van HuggingChat, hier al op 1 en 8 oktober vanuit andere invalshoeken besproken, krijgt een eerste cijfermatig overzicht op het blog van Hugging Face: zes projecten die van begin tot eind zijn uitgevoerd, voor in totaal ongeveer 103 dollar aan rekenkosten. Elk project begint met een bericht en eindigt met een openbaar model op de Hub, inclusief evaluatie. De agent maakt een plan, vraagt toestemming vóór elke betaalde rekentaak, voert een korte test uit en traint, evalueert en publiceert vervolgens op de hardware van Hugging Face.

Model geproduceerd door ML InternGepubliceerd resultaatRekenkosten
Pocket Rewriter (0.8B)99,7 % geldige uitvoer, ongeveer een kwart van de tokens van de 9B-herschrijver van Qwen-Image 2.1Ongeveer 16 dollar
Citrus Doctor (Qwen3.5-2B)Van 14,9 % naar 52,8 % correcte diagnoses van citrusziektenOngeveer 1,90 dollar
Twee LoRA voor Qwen-Image 2.1Verandering van de kijkhoek, een krabbel vervangen door het gevraagde objectOngeveer 16 en 24,30 dollar
Huggy LoRA (FLUX.2 klein)LoRA voor een personageOngeveer 7,60 dollar
Agate 4 stappenDistillatie van een klein beeldmodel, van 50 stappen (100 passes met guidance) naar 4Ongeveer 37 dollar

🔗 Blogbericht van Hugging Face

De GPU-scheduler van Ai2: de mediane wachttijd daalt van 5 minuten naar 24 seconden

9 oktober — Ai2 beschrijft de nieuwe scheduler voor zijn GPU-clusters in een blogbericht van Jeremy Tryba. Duizenden NVIDIA H100-, B200- en B300-GPU’s, in clusters van 88 tot 1 024 GPU’s, worden gedeeld door ongeveer 150 onderzoekers, terwijl de vraag twee tot drie keer zo groot is als het aanbod. In het oude prioriteitensysteem werden GPU’s door lege taken « bezet gehouden » en eindigden alle workloads op de hoogste prioriteit.

Het nieuwe systeem berust op GPU-tijdbudgetten die over het organigram van de onderzoeksafdeling worden verdeeld, een hiërarchische eerlijke verdeling (fair-share) berekend over een voortschrijdende periode van zeven dagen en een « schedulingcontract »: elke workload geeft een beschermde duur van maximaal 8 uur op, waarna deze kan worden onderbroken en opnieuw in de wachtrij geplaatst. Niet-toegewezen tijd blijft gratis, maar kan altijd worden onderbroken.

Door Ai2 gemeten indicatorOude schedulerNieuwe scheduler
Mediane wachttijd, grootste H100-cluster5 minuten24 seconden
p90-wachttijd voor debugging-workloads2 uur30 seconden
Verschuldigde GPU-uren geleverd over 30 dagen—98 %

Reparaties waarvoor menselijke tussenkomst nodig is, nemen met 74 % af. Ai2 erkent beperkingen, zoals interactieve sessies die na 8 uur onderbreekbaar worden, terwijl ze vroeger een week konden duren, en publiceert geen code.

🔗 Blogbericht van Ai2


Beslismodellen: pplx-decider-v1.1-27b bovenaan Decision Bench, statistisch gelijk met negen andere

9 oktober — Het beslismodel van Perplexity, al besproken op 6 en 8 oktober, behaalt een extern resultaat. Op Decision Bench, de open source benchmark van Atlan Frontier Labs (1 071 gesloten vragen, 36 datasets, 15 gerangschikte modellen), behaalt pplx-decider-v1.1-27b de hoogste ruwe score, 94,5 %, tegen de laagste kosten, 0,017 dollar per 1 000 beslissingen. De site geeft echter dezelfde rang aan modellen waarvan de 95 %-betrouwbaarheidsintervallen elkaar overlappen: tien modellen delen de eerste plaats.

Model geëvalueerd op Decision BenchGemeten nauwkeurigheidKosten per 1 000 rijen
pplx-decider-v1.1-27b94,5 %0,017 dollar
DeepSeek V4.1 Flash94,2 %0,683 dollar
Gemini 3.5 Flash94,2 %3,32 dollar
Jev 1.1393,8 %0,044 dollar

Perplexity publiceert ook een praktische gids (cookbook) voor een navigatieagent, waarin de code, en nooit het model, bepaalt waarop wordt geklikt, en v1.1 vervangt v1 in de API.

🔗 Thread van @perplexitydevs · Ranglijst van Decision Bench


Grok Bot krijgt een eigen e-mailadres

9 oktober — Grok Bot, de agent van SpaceXAI, beschikt voortaan over een eigen e-mailadres. De Bot kan dit gebruiken om zich aan te melden voor diensten, namens de gebruiker contact op te nemen met bedrijven of een afspraak met iemand te plannen. De functie wordt dezelfde dag uitgerold: je hoeft alleen de Bot om een adres te vragen of @bot op X te vermelden, en binnen een team moet een beheerder de functie eerst activeren.

De aankondiging bestaat uit een thread van het account @bot, gedeeld door @grok, zonder blogbericht op x.ai. De vorm en het domein van de adressen worden niet vermeld, evenmin als de abonnementen waarvoor de functie beschikbaar is. Na de eigen Slack-identiteit voor Team Bots eind september krijgt de agent zo een eigen identiteit om extern te handelen.

🔗 Aankondiging van Grok Bot


ElevenLabs vestigt zich in Singapore, zijn hub voor Zuidoost-Azië

8 oktober — ElevenLabs maakt zijn komst naar Singapore officieel, waar het bedrijf een kantoor opent dat als hub moet dienen voor Zuidoost-Azië en, breder, voor de Aziatisch-Pacifische regio. Het blogbericht benadrukt de infrastructuur die er al is: sinds juli kunnen bedrijven hun gegevens in Singapore hosten, met opties zonder gegevensbewaring en een lagere latentie in de regio.

ElevenLabs noemt vooral zijn regionale klanten: Funding Societies, dat in vijf markten prospects kwalificeert met conversationele IA, Boost Bank in Maleisië, Salmon Group op de Filipijnen, MNC Group in Indonesië, of Rezonate, een gezondheidsplatform dat door 60 % van de openbare ziekenhuizen in Singapore wordt gebruikt. Er worden geen personeelsaantallen genoemd. De vestiging volgt op die in Brussel en Amsterdam, eind september en begin oktober.

🔗 Blogbericht van ElevenLabs


Kort nieuws

  • Projects in Claude Code — Anthropic heeft alle abonnees van Pro en Max op de wachtlijst toegang gegeven. Projects blijft in bèta: de wachtlijst blijft open, er volgt meer toegang naargelang de capaciteit, en volgens de documentatie is de functie nog niet beschikbaar voor Team of Enterprise. 🔗 bron
  • Gids voor agentautomatisering — Een gids op claude.dev beschrijft een referentie-implementatie op Claude Managed Agents die volgens een planning Slack-kanalen en GitHub pull requests leest en vervolgens een samenvatting in Slack publiceert. De gids beschrijft de zes componenten en hun maatregelen tegen veelvoorkomende storingen, zoals een onleesbare bron niet aanzien voor een rustige dag of het uitgavenplafond instellen op 3 tot 5 keer de kosten van een normale uitvoering. 🔗 bron
  • Block en Claude Fable — In een door Anthropic gepubliceerd interview legt Block uit dat Claude Fable zijn grote codemigraties ontwerpt en tot tientallen modellen van Opus of Sonnet aanstuurt, waarbij tijdens één migratie tot duizend pull requests worden samengevoegd; het samenvoegen en in productie nemen blijven voorbehouden aan mensen, met dubbele goedkeuring voor deployments. 🔗 bron
  • De Compliance API van Claude Enterprise — De endpoints voor gesprekken geven ook, in bèta en met de bestaande sleutel, de gesprekken uit de geïntegreerde Claude-ervaring terug: een gesprek dat in een cloudsessie wordt voortgezet, wordt als één gesprek teruggegeven, met het werk van Claude in de blokken tool_use en tool_result. 🔗 bron
  • Codex CLI 0.162.1 — Deze patch voor 0.162.0 verhelpt een crash van de TUI bij asynchrone vragen van meerdere regels en opstartproblemen wanneer een al draaiende achtergrondserver andere functie-instellingen had dan de CLI. 🔗 bron
  • Plugins per rol in ChatGPT Enterprise en Edu — Wanneer toegangscontrole op basis van rollen (RBAC) is ingeschakeld, stellen eigenaren en beheerders de toegang tot plugins per rol in: Available, Install of Disabled voor de workspace, en Default om een aangepaste rol die instelling te laten overnemen. 🔗 bron
  • Sophos en OpenAI Daybreak — Volgens het cybersecuritybedrijf brengen zijn met Daybreak gebouwde agents de gemiddelde responstijd voor de dossiers die ze behandelen terug van ongeveer 38 minuten naar ongeveer 89 seconden, en wordt 52 % van zijn MDR-dossiers van begin tot eind door IA opgelost; destructieve acties blijven onder menselijk toezicht. 🔗 bron
  • Asana en de navigatieagent van StackAI — Volgens Asana heeft GPT-6 Astra in Codex deze agent in ongeveer een week geoptimaliseerd: op GPT-6.1 Sol kost een testuitvoering 0,47 dollar en duurt die ongeveer vier minuten, oftewel 76 keer goedkoper en 5 keer sneller dan de oorspronkelijke productieconfiguratie. 🔗 bron
  • LegalOn en Codex — LegalOn Technologies zegt zijn geschatte dagelijkse kosten voor Codex met ongeveer 65 % te hebben verlaagd door van GPT-5.5 in onbeperkte snelle modus over te stappen op een taakverdeling tussen GPT-6 Luna, GPT-6.1 Sol en GPT-6 Astra, met snelle modus op aanvraag en plafonds per afdeling en per persoon. 🔗 bron
  • Gemini CLI v0.64.0-preview.1 — Deze preview onderdrukt foutpositieve meldingen van de waarschuwing Untrusted Command Flags Detected bij onschuldige shellcommando’s: opties voor alleen lezen zijn vrijgesteld, shellvariabelen blijven behouden en lussen zijn toegestaan wanneer elk subcommando zijn eigen ALLOW-regel heeft. Op 9 oktober is er geen nightly verschenen, en de stabiele versie blijft v0.63.0. 🔗 bron
  • Antigravity 2.22.0 — Plugins kunnen hun eigen interface in het zijpaneel tonen (UI Extensions), gesprekken kunnen via slepen tussen secties van de zijbalk worden verplaatst, en tijdstempels tonen de naam van de maand. 🔗 bron
  • Gemini 3.7 Flash deprecated — In de Gemini API worden aanroepen naar gemini-3.7-flash doorgestuurd naar gemini-3.8-flash, en de oude agent deep-research-pro-preview-12-2025 wordt op 23 oktober stopgezet ten gunste van deep-research-preview-04-2026 of deep-research-max-preview-04-2026. 🔗 bron
  • VST3- en AU-plugins voor Google Flow Music — Terugblik op 6 oktober: Spaces, de instrumenten en effecten die in natuurlijke taal worden gemaakt, kunnen als plugins worden geëxporteerd voor digitale audiowerkstations (Digital Audio Workstations), zoals de plugin No Chaser van producer Khris Riddick-Tynes. 🔗 bron
  • Google Earth AI en de volksgezondheid — Terugblik op 6 oktober: tijdens de Ebola-epidemie in de RDC hielp een prototype van een agent voor geospatiaal redeneren het Afrikakantoor van de OMS om binnen enkele minuten 48 bedreigde plaatsen en meer dan 45 500 mensen met een verhoogd risico te identificeren; het PDFM-model identificeert ook gebieden met een verhoogd risico op cholera tot 8 weken van tevoren. 🔗 bron
  • Facturering van Copilot code review — Organisatie-eigenaren kunnen reviews die hun leden met een licentie aanvragen in rekening brengen bij de organisatie die eigenaar is van de repository, in plaats van hun quotum aan te spreken, als betaald gebruik van AI Credits is ingeschakeld. Ook kunnen ze het starten van reviews voorbehouden aan licenties die door de organisatie of het bedrijf zijn verstrekt. 🔗 bron
  • Copilot CLI 1.0.95 — Deze versie is nu stabiel en authenticeert op macOS via de native broker van Microsoft Entra, met de browser als fallback; de preview 1.0.96-0 vermeldt in de tijdlijn wie over elke toestemming heeft beslist: de gebruiker, Assisted Permissions, een beleidsregel of de onbeheerde fallback. 🔗 bron
  • GitHub MCP Server 2.0 — Terugblik op 6 oktober: de officiële MCP-server van GitHub geeft getypeerde output terug, beschreven door outputschema’s (output schemas), voor agents in Code Mode of Programmatic Tool Calling; deze wordt alleen aangekondigd aan clients die de MCP-specificatie 2026-07-28 of later gebruiken. 🔗 bron
  • Claude Haiku 5.5 in Genspark — Genspark stelt het model beschikbaar in AI Chat, Code Agent en Claw en neemt daarbij de claim van Anthropic over dat het ongeveer 75 % goedkoper draait dan Haiku 4.5, zonder eigen abonnement of tarief. 🔗 bron
  • Meta VR-template voor v0 — Meta publiceert samen met Vercel een v0-template op basis van de Immersive Web SDK: je beschrijft een ervaring, v0 schrijft de code en toont een preview, en met één klik wordt die op Vercel gedeployd om in de browser van de Quest te openen; oog- en handtracking van de Meta VR Glasses, die in het voorjaar van 2027 worden verwacht, worden al ondersteund. 🔗 bron
  • v0 for teams — v0 presenteert in een video hoe je het werk van teamgenoten kunt bekijken, aan hun gesprekken kunt deelnemen en samen kunt bouwen; de tweet belicht functies die sinds september stapsgewijs zijn verschenen, zonder nieuw tarief. 🔗 bron
  • DeepSeek Harness 0.2.1-alpha.2 — De 26e preview, nog steeds zonder stabiele versie: de plugincatalogus installeert de pakketten Claude Code en Codex op aanvraag, er verschijnen twee experimentele plugins (Git Worktrees en vertaling van de redenering), en globale instructies kunnen uit een gedeeld AGENTS.md komen. 🔗 bron
  • OGX 1.5.0 — Het voormalige Llama Stack, dat in april een nieuwe naam kreeg en de organisatie meta-llama verliet, voegt native doorgifte via de API /v1/messages voor DeepSeek en Fireworks AI toe, een Text-Embeddings-Inference-provider, webzoeken met Exa en Serply en de MCP-client 2.x, met vier breaking changes. 🔗 bron
  • GenIA — Meta zet zonder aankondiging, onder de niet-commerciële licentie CC BY-NC 4.0, de code online van dit onderzoek met het Tübingen AI Center: het reconstrueert 3D-objecten uit één afbeelding, enkele aanzichten of een video door tijdens de inferentie de bevroren prior van SAM 3D Objects af te stemmen, zonder opnieuw te trainen. 🔗 bron
  • Label decision-model op de Hub — Hugging Face geeft beslissingsmodellen een eigen label, met een pictogram en een filter op de pagina Models; GGUF-bestanden voor beslissingsmodellen krijgen automatisch een label op basis van hun llama.cpp-metadata. 🔗 bron
  • Darwin-27B-ZTC-v2 — VIDRAFT kondigt aan dat de nieuwe versie van zijn beoordelingsmodel, onder Apache-2.0, de eerste plaats behaalt op de System One Mosaic Benchmark (137 benchmarks) met een Borda-score van 89,58, vóór OpenJev-27B (87,50) en Jev 1.13 (85,05); een rangschikking die de makers zelf melden en presenteren als een momentopname van een openbaar scorebord. 🔗 bron
  • De zekerheid van beslissingsmodellen — Stephen Solka laat in een communitybericht zien dat GPT-6 Luna Decisions, bevraagd via OpenRouter, bij 600 SHA-256-controles « komt niet overeen » antwoordt, met 50 % nauwkeurigheid en gemiddeld 99,8 % zekerheid; bij causaal redeneren selecteert een drempel van 99 % 47 juiste antwoorden uit 49, maar omvat die slechts 8,2 % van de gevallen. 🔗 bron
  • openai-math in reinforcement learning-omgevingen — FineEnvs zet 369 van de 405 in Lean geformaliseerde resultaten uit de publicatie openai/math om naar Harbor-omgevingen: de agent moet een stelling bewijzen in een Lean 4-sandbox, en Comparator kent de beloning alleen toe aan een volledig bewijs van de exacte stelling; een experimentele dataset onder Apache-2.0. 🔗 bron
  • JOSIE-2 — Gökdeniz Gülmez publiceert het technische rapport over deze familie van 2B, 4B en 9B, die op basis van Qwen3.5 op twee Mac M4’s verder is getraind, met ongeveer 3 000 geselecteerde voorbeelden: in redeneermodus behaalt JOSIE-2-4B 95,5 op ARC-Challenge (+12,1) en 69,2 op TruthfulQA (+20,3), op slechts twee benchmarks. 🔗 bron
  • Gradio 6.30 — gr.Workflow krijgt een appweergave, en het commando Run this node hergebruikt nog actuele upstream-resultaten in plaats van de hele subgraaf opnieuw uit te voeren; gr.ImageEditor behoudt het alfakanaal van geladen afbeeldingen. 🔗 bron
  • tokenizers 0.23.3 — Deze patch, uitsluitend voor het Python-pakket, ondersteunt huggingface_hub v2, waardoor Transformers volgens de release notes kan worden geïnstalleerd, en draait een breaking change uit 0.23.1 rond truncatie terug. 🔗 bron
  • Wetenschappelijke peerreview door IA — Sakana AI presenteert een artikel dat door TMLR is geaccepteerd: een benchmark voegt tegenstrijdige beweringen aan artikelen toe om te controleren of IA-reviewers die herkennen, en zijn systeem Multi-Layered Review detecteert er meer dan de andere geteste systemen, volgens de aankondiging van Sakana AI, die geen cijfers geeft. 🔗 bron
  • Suno Studio — Clips sluiten beter aan op de eerste tel en worden uitgerekt om het tempo van het project te volgen, fades worden exponentieel of logaritmisch, en de synthesizer, het toetsenbord en pluginweergaven kunnen worden losgekoppeld en zelfs op een tweede scherm worden gezet; Studio is inbegrepen in het Premier-abonnement. 🔗 bron
  • World Models’ Last Exam in Physics — Op dit natuurkunde-examen van Einsia voor videomodellen (40 taken, 9 categorieën, acht modellen) eindigt Seedance 2.5 bovenaan met 57,76 op 100, vóór MiniMax H3 (54,89), volgens MiniMax het beste open model, en Cosmos 3 Super van NVIDIA (42,46); een benchmark van een derde partij. 🔗 bron
  • Omniverse-simulaties gebouwd door agents — De blog van NVIDIA laat teams binnen het bedrijf zien die GPT-6 Astra, en in één geval Claude Fable 5, simulaties laten samenstellen met de bibliotheken ovphysx, ovstage, ovrtx en ovui, waaronder digital twins die in ongeveer drie dagen zijn gemaakt of verbeterd; er is geen nieuw product. 🔗 bron
  • Het beheer van een Shopify-winkel — Zodra de winkel is gekoppeld, kan Grok Bot bestellingen controleren, de voorraad volgen en productinformatie bijwerken; er wordt geen abonnement of limiet vermeld. 🔗 bron
  • Zoeken op X — Terugblik op 7 oktober: Grok Bot kan voor alle gebruikers X doorzoeken, lezen en monitoren zonder de X-connector te configureren, bijvoorbeeld om reacties op een product te volgen of een wekelijkse samenvatting van hun sector te ontvangen; eind augustus moest je nog je account koppelen. 🔗 bron
  • Grokipedia v0.3 — Volgens zijn officiële account heeft de door Grok geschreven encyclopedie in één week meer dan 4 400 door lezers aangevraagde artikelen gepubliceerd en voert ze meer dan 2 200 wijzigingen per dag door, met gemiddeld 78 bronnen per nieuw artikel; een pagina toont de wijzigingen nu live. 🔗 bron
  • De mistral CLI 0.8.0 — mistral apps deploy deployt ook workflowworkers en alle modules tegelijk, ook in continuous integration met alleen een API-sleutel, en mistral apps dev start een lokale Postgres-database in Docker; daar staat tegenover dat .env in de huidige directory niet meer wordt gelezen. 🔗 bron
  • De Python SDK van Mistral 3.2.0 — Chat- en agentaanroepen ondersteunen logaritmische waarschijnlijkheden (logprobs), zowel voor het antwoord als voor de prompt, evenals top_k, een herhalingspenalty en een minimumaantal tokens; een automatisch gegenereerde versie, zonder aankondiging. 🔗 bron
  • Qwen Code v0.25.1-preview.1 — De tweede preview van v0.25.1 in drie dagen, met 16 nieuwe functies en 27 nieuwe fixes, waaronder samenwerking tussen meerdere agents rond de sessie en PreToolUse-hooks die de input van een tool aanpassen met volledige hervalidatie; de stabiele versie is nog niet verschenen. 🔗 bron
  • Claude Haiku 5.5 in de Agent API van Perplexity — Terugblik op 7 oktober: de Agent API ondersteunt anthropic/claude-haiku-5-5 tegen het tarief van Anthropic, 0,10 dollar per miljoen inputtokens en 0,50 voor output tot 100 000 inputtokens, en daarna 0,50 en 2,50. 🔗 bron
  • Gedeelde of dedicated inferentie — Een gids van Cohere voor Embed en Rerank stelt dat de vorm van de aanvragen zwaarder weegt dan hun aantal, en berekent illustratieve break-evenpunten ten opzichte van een dedicated instance met één NVIDIA A10 GPU: ongeveer 4 aanvragen per minuut voor lange documenten, 20 voor een catalogus en 29 voor herrangschikking (reranking). 🔗 bron
  • Agent of MCP — Perplexity publiceert een gids die onderscheid maakt tussen de agent, die beslist, en MCP, dat de agent met tools verbindt, met een keuzetabel, het voorbeeld van een webwinkel en vier risico’s met bijbehorende voorzorgsmaatregelen; volgens de gids kunnen Claude, ChatGPT of Cursor een taak aan Computer toevertrouwen via de MCP-server van Perplexity. 🔗 bron

Wat dit betekent

Eén agent orkestreert inmiddels veel andere agents, en elk krijgt een identiteit. De Gemini-agent start subagents die elk hun eigen identiteit hebben en kan een collega-agent worden met een eigen adres; Claude Managed Agents laat een agent een programma schrijven dat er tot 1 000 start; Grok Bot krijgt een e-mailadres om buiten het platform te handelen, en Block laat Claude Fable tientallen modellen aansturen bij dezelfde migratie. De vraag die steeds meer speelt, is niet langer of de agent het kan, maar hoe je hem onder controle houdt. Google antwoordt met Agent Gateway, Agent Sandbox, een auditlog op naam van elke agent en realtime uitgavenlimieten; Anthropic met een sessiebudget dat alle uitvoeringen opschort zodra het is bereikt; OpenAI met een Windows-sandbox die strengere beperkingen oplegt aan netwerk- en bestandstoegang.

Het gebruik van meerdere modellen wordt ook bij de platforms zelf gemeengoed. Google, dat Gemini ontwikkelt, laat zijn eigen agent Claude-modellen orkestreren, maakt expliciet onderscheid tussen de keuze van het model en die van de agent, en stelt Claude Opus 5.5 en Sonnet 5.5 beschikbaar in Antigravity, waarbij de kosten onder dezelfde uitgavenlimiet vallen als die van zijn eigen modellen. Genspark en de Agent API van Perplexity voegen Claude Haiku 5.5 toe in de dagen na de lancering, LegalOn verdeelt zijn programmeerwerk over drie modellen van OpenAI afhankelijk van de aard van de taken, en Block bouwt een automatische modelkiezer.

De kosten per eenheid blijven dalen, en elke aankondiging drukt dat in cijfers uit: 0,016 dollar per afbeelding voor Qwen-Image-2.1-Turbo, 2,5 keer goedkoper dan de Pro-versie; 15 dollar per miljoen tekens voor HeyGen Voice tot en met 31 oktober, daarna 30, minder dan Eleven v4 Turbo; 0,017 dollar per 1 000 beslissingen voor pplx-decider-v1.1-27b; zes modellen gepubliceerd op de Hub voor ongeveer 103 dollar aan rekenkosten met ML Intern. De kopposities vragen daarentegen om een zorgvuldige interpretatie: HeyGen Voice staat alleen bovenaan de ranglijst met gecontroleerde stemmen, en pplx-decider deelt zijn positie met negen andere modellen waarvan de betrouwbaarheidsintervallen elkaar overlappen.

In de gezondheidszorg blijft voorzichtigheid geboden. Het in The Lancet gepubliceerde AMIE-onderzoek is een haalbaarheidsonderzoek, uitgevoerd op één locatie, zonder controlegroep en gefinancierd door Alphabet: 98 patiënten, geen enkel gesprek stopgezet om veiligheidsredenen, één vastgestelde hallucinatie. Het is een stap naar grotere onderzoeken, waar de auteurs zelf om vragen, geen goedkeuring of uitrol voor patiënten.


Bronnen