Zoeken

Meta publiceert zes wiskundige artikelen geschreven met Muse Spark, Perplexity lanceert zijn Decisions API, Anthropic opent de Claude Frontier Academy

ai-powered-markdown-translator

Artikel vertaald van het Frans naar het Nederlands met gpt-6.1-sol.

Bekijk project op GitHub ↗

Vrijdag 2 oktober publiceert Meta zes wiskundige artikelen die onderzoekers met zijn model Muse Spark hebben opgesteld; volgens Meta beantwoorden vijf daarvan onderzoeksvragen die nog openstonden. Anthropic trekt 100 miljoen dollar uit om 10 000 implementatie-engineers op te leiden met de Claude Frontier Academy en publiceert Claude Code 2.1.288, terwijl NVIDIA een DGX Spark van 64 Go aankondigt vanaf 4 999 dollar. Twee aankondigingen van de avond ervoor maken de dag compleet: de Decisions API van Perplexity, die antwoordt met waarschijnlijkheden en een model waarvan de gewichten openbaar zijn gemaakt, en de satelliet van Google die zijn eerste TPU’s naar een baan om de aarde brengt.


Meta publiceert zes wiskundige artikelen geschreven met Muse Spark, Ai2 stelt AstaBrief beschikbaar, de AI van Google voorspelt griep

2 oktober — Meta publiceert op zijn onderzoeksblog zes wiskundige artikelen die onderzoekers met Muse Spark, zijn eigen model, hebben opgesteld. Volgens Meta beantwoorden vijf daarvan onderzoeksvragen die tot dan toe openstonden, zonder dat de blogpost vermeldt welk artikel de uitzondering vormt. De wiskundigen hebben de afgelopen maanden met Muse Spark 1.1 en 1.2 in Thinking-modus gewerkt, rechtstreeks in de chatinterface van meta.ai, zonder een op maat gemaakte onderzoeksstructuur (custom research scaffold).

Following gold-medal-level performance from our AI models across five competitions in mathematics, physics, and chemistry, we asked a harder question: can AI contribute when a problem is genuinely open and without an existing solution path?

🇳🇱 Na prestaties op het niveau van een gouden medaille van onze AI-modellen in vijf competities in wiskunde, natuurkunde en scheikunde stelden we ons een moeilijkere vraag: kan AI bijdragen wanneer een probleem daadwerkelijk open is en er geen weg naar de oplossing bestaat? — @AIatMeta op X

Het beschreven protocol is strikt: een team van wiskundigen leidt het onderzoek, een tweede groep beoordeelt het werk, en elk artikel geeft aan welke passages voornamelijk door de onderzoekers of door de AI zijn geschreven. De bijdrage van het model verschilt sterk per artikel, van aanvullende berekeningen tot het schrijven van volledige secties:

Wiskundig vakgebiedDoor Meta aangekondigd resultaatBijdrage van Muse Spark volgens Meta
KansrekeningScherpe drempel voor het aanpassen van een ellipsoïde die door willekeurige Gaussische punten in hoge dimensies gaatBewijsstrategieën
DifferentiaalvergelijkingenExplosie in eindige tijd van radiale oplossingen met negatieve energie van de massakritische biharmonische niet-lineaire Schrödingervergelijking, een open vraag sinds 2015Berekeningen, toetsen van argumenten, herziening van het bewijs
GroepentheorieEen semi-abelse groep is niet noodzakelijk monomiaal: tegenvoorbeeld van orde 384 voor een vermoeden van M. Kida (2024)Zoekprogramma geschreven in GAP, dat het tegenvoorbeeld vond
OptimalisatieExacte regel die aangeeft wanneer een relaxatie via cycli het oorspronkelijke probleem volledig beschrijftProbabilistische herformulering, tegenvoorbeeld, bewijsstrategie
Arithmetische fysicaDe tweepuntsfunctie van de p-adische snaartheorie is gelijk aan een hoogtefunctie, op een veel ruimere klasse van krommen dan de Tate-krommeMogelijke bewijzen, drie technische secties geschreven
Niet-associatieve algebraTegenvoorbeeld van dimensie 3 voor een vermoeden over oplosbare evolutiealgebra’sTegenvoorbeeld en alternatieve karakteriseringen

Meta erkent dat drie van deze problemen ook elders zijn opgelost: drie in augustus gepubliceerde studies over de Gaussische drempel, een tegenvoorbeeld voor het vermoeden van Kida dat op 16 september door de AI-agent Nilradical werd gemeld, en tegenvoorbeelden over evolutiealgebra’s door Hu en Wen. Volgens Meta zijn zijn eigen resultaten onafhankelijk verkregen, via andere benaderingen. De aankondiging volgt op die van OpenAI, dat op 21 september meldde dat een intern model meer dan 100 open problemen had opgelost; Meta benadrukt het gebruik van een ongewijzigd model voor het brede publiek en de transparantie over de bijdrage van AI, waarbij alle bewijzen door wiskundigen zijn gecontroleerd, gecorrigeerd en herschreven.

🔗 Samen open onderzoeksvragen oplossen (Meta AI Research)

AstaBrief 8B: Ai2 stelt een model beschikbaar dat wetenschappelijke rapporten met bronverwijzingen schrijft

2 oktober — Ai2 stelt AstaBrief 8B beschikbaar, een model dat een onderzoeksvraag en literatuurfragmenten omzet in een wetenschappelijk rapport met bronverwijzingen. Het ondersteunt nu de Fast-modus van de functie « Generate a report » in Asta, het agentplatform van Ai2 voor de wetenschap, naast de Thinking-modus die door Claude wordt aangedreven. De aanpak blijft eenvoudig: Qwen3-8B, supervised fine-tuning (SFT) op 47 000 voorbeelden die door de ScholarQA-pipeline zijn geproduceerd, gevolgd door directe voorkeursoptimalisatie (DPO) op ongeveer 6 000 paren, zonder reinforcement learning. De gewichten, volgens de modelkaart onder de Apache-2.0-licentie, en de trainingsgegevens zijn gepubliceerd: een laboratorium kan het model op zijn eigen hardware draaien.

Het model schrijft zijn rapport in één keer. Over de volledige Asta-pipeline duurt een rapport gemiddeld 51,1 seconden in Fast-modus tegenover 178,5 in Thinking-modus, dus ongeveer 3,5 keer zo snel. In een kleine studie met menselijke beoordelaars (14 vragen, 3 onderzoekers) krijgt DR Tulu de algemene voorkeur, maar twee van de drie onderzoekers verkiezen AstaBrief voor de nauwkeurigheid van de bronverwijzingen. Ai2 waarschuwt dat het grootste deel van de training en evaluatie uit 2025 dateert en niet opnieuw is uitgevoerd tegenover de huidige modellen.

🔗 AstaBrief als open source beschikbaar stellen (Ai2)

Griep: een model ontwikkeld met de AI van Google eindigt als eerste van 39 in de FluSight-evaluatie van de CDC

30 september — Google kondigt aan dat een griepvoorspellingsmodel dat met zijn AI is ontwikkeld het beste was van het seizoen 2025-2026 in FluSight, het systeem van de Amerikaanse centra voor ziektebestrijding en -preventie (CDC) dat van oktober tot mei wekelijks voorspellingen van ziekenhuisopnames samenvoegt. Het seizoenseindrapport van de CDC bevestigt dit: van de 39 geselecteerde modellen uit de 53 inzendingen van 34 teams staat Google_SAI-FluEns bovenaan bij de individuele modellen, met een relatieve WIS van 0,56 (een foutscore: hoe lager, hoe beter de voorspelling), vóór drie modellen met 0,58, waaronder OHT_JHU-nbxd. Het FluSight-ensemble, dat de CDC voor hun publieke communicatie gebruiken, eindigt als 7e.

Deze voorspellingen zijn ontwikkeld met Empirical Research Assistance (ERA), een AI-tool van Google die optimalisatiealgoritmen voor verschillende wetenschappelijke vakgebieden genereert en toegankelijk is voor vertrouwde testers. Het bijbehorende onderzoeksartikel beschrijft een autonoom systeem dat zijn eigen voorspellingscode schrijft, evalueert en verbetert via een boomzoekprocedure die door een LLM wordt aangestuurd; het heeft ook modellen voor COVID-19 en het respiratoir syncytieel virus (RSV) geproduceerd.

🔗 Blogpost van Google Research · FluSight-rapport 2025-2026 van de CDC


Perplexity lanceert de Decisions API en stelt pplx-decider-v1-27b beschikbaar, llama.cpp biedt beslissingsmodellen aan

1 oktober — Perplexity stelt een nieuwe API beschikbaar, de Decisions API, en publiceert het model dat deze aandrijft, pplx-decider-v1-27b, onder de Apache 2.0-licentie. De aankondiging verscheen in de avond via @perplexitydevs, het ontwikkelaarsaccount van het bedrijf. In plaats van een antwoord te schrijven, geeft dit beslissingsmodel (decision model) een waarschijnlijkheidsverdeling over een vaste verzameling antwoorden terug: het leest tekst, JSON of afbeeldingen, maar schrijft geen antwoord, genereert geen code en legt zijn redenering niet uit.

Er zijn drie vraagtypen voorzien: noul geeft de waarschijnlijkheid van een ja terug, choice kiest uit 1 tot 255 opties met een waarschijnlijkheid voor elke optie en een betrouwbaarheidsscore, score plaatst de inhoud op een schaal met maximaal 10 niveaus. Een request kan tot 128 vragen over dezelfde inhoud stellen en moet, inclusief de vragen, onder 262 144 tokens aan invoer blijven. Het tarief is 0,04 dollar per miljoen invoertokens, de uitvoer is gratis en er worden geen kosten per request gerekend; elke organisatie kan 10 requests per seconde versturen, ongeacht haar abonnement. Perplexity richt zich op classificatie, routing en beoordeling aan de hand van een rubric: zijn referentievoorbeeld (cookbook) sorteert supporttickets, waarbij de Decisions API de eerste beslissing neemt en de Agent API de escalaties afhandelt.

Het model is gefinetuned op basis van Qwen3.8-27B; de gewichten op Hugging Face vereisen een CUDA-GPU met ruimte voor ongeveer 49 Gio, plus het werkgeheugen. De modelkaart vergelijkt het met Jev, een ander beslissingsmodel, en met zijn basismodel op elf benchmarks, waarbij de resultaten van pplx-decider-v1-27b via de API van Perplexity zijn gemeten:

Benchmark (nauwkeurigheid)Score van JevScore van Qwen3.8-27B (basismodel)Score van pplx-decider-v1-27b
WinoGrande90,70 %73,10 %83,30 %
FinancialPhraseBank76,98 %75,68 %84,18 %
RAGTruth77,27 %61,53 %88,80 %
JudgeBench78,57 %68,86 %78,29 %
BBH94,27 %72,80 %82,80 %
JevBench public hard73,27 %72,28 %70,30 %
TabFact89,80 %78,60 %90,60 %
ContractNLI77,45 %80,78 %80,78 %
Circa84,60 %87,00 %89,20 %
Belebele95,00 %93,20 %94,00 %
TruthfulQA binary92,00 %82,80 %85,40 %
Totaal (volgens de modelkaart)84,51 %74,76 %85,71 %

Op de rij Totaal, die in de aankondiging wordt uitgelicht, ligt pplx-decider-v1-27b voor op Jev, met 85,71 % tegenover 84,51 %, maar de modelkaart vermeldt niet hoe deze rij is berekend. Volgens de gepubliceerde tabel blijft Jev voor op zes van de elf benchmarks, waaronder BBH en WinoGrande, en op JevBench public hard eindigt het model van Perplexity zelfs achter zijn basismodel.

🔗 Aankondiging van @perplexitydevs · Documentatie van de Decisions API · pplx-decider-v1-27b op Hugging Face

llama.cpp biedt beslissingsmodellen aan via de API /v1/systemone, compatibel met Jev

2 oktober — De server van llama.cpp kan nu beslissingsmodellen aanbieden via een nieuw endpoint, /v1/systemone, dat is toegevoegd met PR nr. 29818, gemerged op 2 oktober. De blogpost van ggml-org, geschreven door Xuan-Son Nguyen en Victor Mustar, beschrijft het principe: je verstuurt een toestand (tekst, JSON, screenshot) en getypeerde vragen, choice, score (van 2 tot 10 niveaus) of noul (ja of nee), en het model geeft in één keer een waarschijnlijkheid per optie terug. De API gebruikt het System One-formaat dat door Jev, het model van TypeSafe, is geïntroduceerd: een bestaande client hoeft alleen zijn basis-URL te wijzigen. Een routermodus laadt op verzoek meerdere modellen op dezelfde server.

Ondersteund beslissingsmodelModelgrootteBasismodelMediane tijd per vraag
Julia-1 (meer dan 50 talen)144MmmBERT-small3 ms
Laya421MModernBERT-large5 ms
Kev-4B4BQwen3.5-4B-Base12 ms
lev4BQwen3.5-4B36 ms
OpenJev (leest ook afbeeldingen)27BQwen3.8-27B43 ms

De tijden zijn gemeten op een NVIDIA RTX PRO 6000. Het volgende aangekondigde model is Clef, dat Cloudflare op 1 oktober presenteerde met een API die compatibel is met die van Jev; ggml-org heeft op 2 oktober de GGUF-repositories van Clef en Clef-flash op Hugging Face aangemaakt.

🔗 Nieuw in llama.cpp: beslissingsmodellen


Anthropic lanceert de Claude Frontier Academy en trekt 100 miljoen dollar uit om 10 000 ingenieurs op te leiden

2 oktober — Anthropic lanceert de Claude Frontier Academy, een opleidingsprogramma met een toegezegde investering van 100 miljoen dollar. Het doel is om tegen eind 2027 10 000 ingenieurs voor geavanceerde implementaties (Frontier Deployed Engineers, FDE) op te leiden. De eerste cohorten bestaan uit ingenieurs van Accenture, Bain, Capgemini, Commonwealth Bank of Australia, Deloitte, McKinsey, Morgan Stanley en Novo Nordisk.

Het eerste programma, de Frontier Deployed Engineer Residency, volgt het model van de medische opleiding. Volgens de programmapagina begint het met een intensieve module van vier dagen: drie dagen op locatie om een Claude-systeem voor een gesimuleerd bedrijf te bouwen, gevolgd door een beoordeeld examen dat de badge Claude Resident Engineer oplevert. Daarna volgt een praktijkperiode van twaalf weken waarin deelnemers een implementatie van Claude binnen hun eigen organisatie leiden, en vervolgens een eindbeoordeling voor de badge Claude Frontier Deployed Engineer; de eerste worden begin 2027 verwacht.

De toegang blijft beperkt: deelname op voordracht, vroege toegang voor geselecteerde klanten en partners, cohorten in San Francisco, New York en Londen. De Academy bouwt voort op het Claude Partner Network (46 000 bedrijven, meer dan 175 000 certificeringen), dat in maart met 100 miljoen dollar werd gelanceerd; het bericht vermeldt niet of het nieuwe budget daar bovenop komt.

🔗 Aankondiging van Anthropic · Programmapagina


Agents: Claude Code 2.1.288, GLM 5.3 in Cursor, Replit, DeepSeek Harness en de SWE-sweep-benchmark

Claude Code 2.1.288 heft de limiet voor achtergrondopdrachten in interactieve sessies op

2 oktober — Claude Code 2.1.288 verschijnt met 89 wijzigingen, waaronder 64 bugfixes. De opvallendste verandering betreft opdrachten die op de achtergrond worden uitgevoerd: de tijdslimiet die in 2.1.285 werd ingevoerd (standaard 30 minuten, maximaal 2 uur) geldt alleen nog voor onbeheerde sessies (-p, Agent SDK, CI, cloud). In de terminal, de desktopapp en VS Code kan een achtergrondopdracht weer onbeperkt draaien.

Een prompt die per ongeluk met Ctrl+C is gewist, kan met de pijl omhoog worden teruggehaald, /code-review accepteert --max-findings om meer of minder problemen te melden, claude project purge wordt claude purge, en de mods, die de dag ervoor zijn geïntroduceerd, krijgen $.ui.selection(), dat de laatst geselecteerde tekst in de schermvullende weergave teruggeeft. Wanneer de API tijdens een antwoord een time-out geeft, gaan niet-interactieve sessies en subagents verder vanaf het gedeeltelijke antwoord in plaats van te mislukken. Op beveiligingsgebied wordt een gevaarlijke rm die in een bash -c-script is verstopt, in de modus bypassPermissions niet langer zonder bevestiging uitgevoerd, en een PreToolUse- of PermissionRequest-hook waarvoor de matching mislukt, blokkeert voortaan de aanroep in plaats van te worden genegeerd. Tot slot negeert de classifier voor de auto-modus aan de clientzijde voortaan een variabele ANTHROPIC_DEFAULT_SONNET_MODEL die naar Sonnet 5.5 of Opus 5.5 verwijst, en gebruikt hij in plaats daarvan Claude Sonnet 5.

Zes minuten na de release bracht @ClaudeDevs You should know onder de aandacht, een ingebouwde mod die een tweede agent start om boven de prompt informatie te tonen die je niet mag missen. De mod behoorde al tot de zes ingebouwde mods die op 1 oktober werden gepresenteerd en blijft standaard uitgeschakeld.

We’re adding a new plugin to Claude Code: You should Know. It scans Claude’s output for important information you might miss to help keep you in the loop. Enable it with: /plugin enable cc-plugin-you-should-know@builtin

🇳🇱 We voegen een nieuwe plugin toe aan Claude Code: You should Know. Hij doorzoekt de uitvoer van Claude op belangrijke informatie die je mogelijk over het hoofd ziet, om je op de hoogte te houden. Activeer hem met: /plugin enable cc-plugin-you-should-know@builtin — @ClaudeDevs op X

🔗 Release notes van Claude Code 2.1.288

GLM 5.3 en GLM 5.3 Flash komen naar Cursor

1 oktober — Cursor voegt GLM 5.3 en GLM 5.3 Flash, de open modellen van Z.ai, toe aan zijn modelkiezer en claimt dat GLM 5.3 Max op zijn eigen benchmark de eerste plaats onder de open modellen inneemt.

GLM 5.3 and GLM 5.3 Flash are now available in Cursor! GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0.

🇳🇱 GLM 5.3 en GLM 5.3 Flash zijn nu beschikbaar in Cursor! GLM 5.3 Max is het model met open gewichten met de hoogste score op CursorBench 4.0. — @cursor_ai op X

De bijgevoegde grafiek plaatst de modellen volgens hun CursorBench 4.0-score en hun gemiddelde kosten per taak, maar geeft slechts één punt een label: GLM 5.3, aangeduid met « (max) », met 42,6 % voor 5,05 dollars per taak. Volgens deze grafiek blijft GLM 5.3 onder Claude Opus 5.5, Claude Sonnet 5.5, Fable 5.1 en Grok 4.7, staan er geen andere open modellen in en ontbreekt GLM 5.3 Flash. Cursor heeft geen tarieven, bericht of methode gepubliceerd ter onderbouwing van zijn ranglijst.

Replit maakt GPT-6.1 Sol en Claude Sonnet 5.5 beschikbaar in Agent, en Jev in zijn AI Integrations

2 oktober — De changelog van Replit voegt twee recente modellen toe als opties in Replit Agent: Claude Sonnet 5.5 in de modus Power en GPT-6.1 Sol in de modus Max. Dezelfde vermelding maakt Jev, het beslissingsmodel dat eerder al tegenover pplx-decider-v1-27b werd genoemd, beschikbaar in de Replit AI Integrations: een applicatie kan inhoud classificeren, verzoeken routeren of potentiële klanten een score geven via snelle, gestructureerde beslissingen, zonder een API-sleutel te hoeven beheren. De documentatie vermeldt dat Jev via OpenRouter onder de identifier jev-latest wordt aangeboden. De instellingen openen voortaan op een volledige pagina, en Enterprise-accounts kunnen regels voor het hele bedrijf instellen, met uitzonderingen per team (Workspace). De vermelding noemt geen tarieven.

🔗 Changelog van Replit van 2 oktober

DeepSeek Harness kan op macOS en Windows worden geïnstalleerd

30 september — Het account @DeepSeekHarness kondigt een desktopversie aan van DeepSeek Harness, de open source agent-harness van DeepSeek, voor macOS en Windows. Op 2 oktober deelt het hoofdaccount @deepseek_ai de aankondiging en vermeldt het dat Linux-gebruikers het npm-pakket @deepseek-ai/dsh gebruiken. De installatieprogramma’s zijn te downloaden op de website van DeepSeek, voor macOS op ARM-chips en voor Windows x64.

De officiële pagina, met het label PREVIEW, beschrijft Harness als een wereldwijd beschikbare openbare preview die open source is. Het is gebaseerd op de architectuur « alles is een plugin » (everything is a plugin) van het framework Cordis en omvat kantoorwerk (bestanden, gegevens, documenten, presentaties), code, onderzoek met bronvermelding en achtergrondtaken, met een Creator-modus die via gesprekken nieuwe plugins laat schrijven. Het nieuwe zit in de distributie: de preview van 29 september had de opdracht dsh al in de desktopapp opgenomen, en op GitHub is nog geen stabiele versie gepubliceerd.

🔗 Aankondiging van @deepseek_ai · Pagina van DeepSeek Harness

SWE-sweep: een benchmark waarin agents zelf de te verhelpen bugs moeten vinden

1 oktober — Onderzoekers van Meta Superintelligence Labs, samen met Harvard, de Universiteit van Washington en Stanford, stellen SWE-sweep beschikbaar, een benchmark die codeagents vraagt om zelf de bugs in een echte repository op te sporen en er zo veel mogelijk te verhelpen, zonder aanwijzingen over hun aard of locatie. De dataset omvat 100 repositories en 4 068 bugs; de code, onder de MIT-licentie, is gebaseerd op het framework Harbor, en Ofir Press en John Yang behoren tot de auteurs. De op 1 oktober aangemaakte repository heeft nog geen bijbehorende aankondiging.

De ranglijst, bijgewerkt op 24 september en gemeten met de agent mini-SWE-agent, laat de omvang van de taak zien:

Positie in de ranglijstGetest modelVerholpen bugsTotale kosten
1Sol 5.6 (xhigh), OpenAI4,7 %7 230 dollars
2Luna 5.6 (xhigh), OpenAI2,5 %224 dollars
3Terra 5.6 (xhigh), OpenAI1,5 %357 dollars
4Luna 5.6 (high), OpenAI1,4 %28 dollars
5Opus 5 (xhigh), Anthropic1,3 %5 363 dollars

🔗 SWE-sweep


Rekenkracht en hardware: eerste TPU’s in een baan om de aarde, DGX Spark 64 Go, DeepGEMM en DeepEP op Ascend 950

Project Suncatcher: de prototypesatelliet van Google brengt zijn eerste TPU’s in een baan om de aarde

1 oktober — Een week na de aankondiging van zijn eerste test in een baan om de aarde heeft Google de prototypesatelliet van Project Suncatcher gelanceerd, een langdurig onderzoeksproject (moonshot) dat onderzoekt of de ruimte ooit infrastructuur voor machine learning op grote schaal zou kunnen huisvesten. De satelliet, gebouwd met Planet, bereikte zijn baan aan boord van Transporter-18, een gedeelde lancering van SpaceX; volgens Travis Beals van Google heeft het team contact gelegd en werkt de satelliet zoals verwacht.

De komende weken zal Google meten hoe zijn TPU’s de belasting van ruimtevluchten en extreme straling en temperaturen doorstaan; op aarde hadden Trillium-TPU’s al een stralingsdosis doorstaan die hoger was dan die van een missie van vijf jaar. Het door vakgenoten beoordeelde artikel dat het onderzoek beschrijft, verschijnt in het tijdschrift Joule. Bij het delen van de lancering op 2 oktober herhaalt @GoogleAI het argument achter het project: in een lage baan om de aarde is het zonlicht vrijwel constant en kunnen satellieten tot 8 keer meer zonne-energie produceren dan op aarde. De aangekondigde volgende stap: twee satellieten in 2027 om laserverbindingen te testen.

🔗 Het prototype van Project Suncatcher bevindt zich in een baan om de aarde · Het artikel in Joule · Het bericht van @GoogleAI

DGX Spark 64 Go: NVIDIA voegt een configuratie toe die vanaf 23 oktober wordt verkocht

2 oktober — NVIDIA voegt aan zijn DGX Spark een configuratie met 64 Go geünificeerd geheugen toe, naast het model met 128 Go. Deze wordt uitsluitend door zes partnerfabrikanten verkocht, Acer, ASUS, Dell, Gigabyte, HP en MSI, vanaf vrijdag 23 oktober, met een vanafprijs van 4 999 dollars; het bericht vermeldt de huidige prijs van het model met 128 Go niet. De basis blijft dezelfde: de GB10 Grace Blackwell-chip, DGX OS en de NVIDIA AI-softwarestack, om modellen met maximaal 100 miljard parameters op de machine te draaien.

Het belangrijkste argument is clustering: twee units die met een QSFP-kabel via hun ConnectX-7-netwerkkaarten zijn verbonden, delen hun geheugen.

Technische eigenschapEén DGX Spark 64 GoTwee DGX Spark 64 Go in een cluster
Geünificeerd geheugen64 Go128 Go gedeeld
Opgegeven modelomvangTot 100 miljard parametersTot 200 miljard parameters
Prestaties op Qwen 3.8 27B (NVIDIA-test)ReferentiewaardeTot 1,7 keer

De app NVIDIA Sync regelt dit met Cluster Assistant, dat de units detecteert en het netwerk instelt. NVIDIA Sync Model Launcher, aangekondigd voor het einde van de maand, zal Qwen3.8 27B downloaden en starten op één machine of een cluster, en OpenCode configureren om het model te gebruiken.

🔗 Bericht van NVIDIA over DGX Spark 64 Go

DeepSeek zet DeepGEMM en DeepEP over naar de Ascend 950-NPU’s van Huawei

29 en 30 september — DeepSeek heeft zonder aankondiging op GitHub twee ports van zijn rekenbibliotheken naar de Ascend-NPU’s van Huawei gepubliceerd. DeepGEMM-Ascend, waarvan de README de eerste versie op 30 september dateert, neemt de API van DeepGEMM ongewijzigd over: matrixvermenigvuldigingen in BF16, FP8 en FP4, MQA-logits en MegaMoE, onder de MIT-licentie, voor de Ascend 950-serie. DeepEP-Ascend zet de communicatiebibliotheek voor parallelisme tussen experts (expert parallelism) van MoE-modellen over, met de all-to-all-bewerkingen voor verdeling (dispatch) en recombinatie (combine).

Op Ascend 950DT meet DeepEP-Ascend een verdeling van 373 tot 375 Go/s bij 8 ranks en van 313 tot 320 Go/s bij 128 ranks; tot 32 ranks bereikt het ongeveer 90 tot 95 % van de fysieke bandbreedtelimiet. Deze cijfers zijn verkregen met een hardwarekit (HDK) voor een proof of concept die aan DeepSeek is geleverd en met een handmatige configuratie, die beide niet publiekelijk beschikbaar zijn gesteld; de README verwijst naar de commerciële versie, waarvan Huawei de beschikbaarheid rond 15 oktober verwacht.

🔗 DeepGEMM-Ascend op GitHub · DeepEP-Ascend op GitHub


Stem en audio: Suno Speech in bèta, ElevenLabs gecertificeerd voor FedRAMP 20x Class A

Suno Speech genereert spraak en achtergrondmuziek in één track

1 oktober — Suno stelt Speech in bèta beschikbaar, een functie die gesproken audio met originele achtergrondmuziek maakt, rechtstreeks in Suno: je voert een idee, een gedicht of een tekst in en beschrijft vervolgens de gewenste stem en muziekstijl. Suno presenteert Speech als het eerste audiomodel dat stem en muziek samen genereert, in één samenhangende track. De functie is een maand lang getest door een kleine groep gebruikers en is nu, na een update van de app, voor iedereen beschikbaar.

Het bericht, geschreven door productdirecteur Jack Brody, noemt vooral persoonlijke toepassingen: berichten van vrienden omzetten in dramatische voordrachten, spraakmemo’s op muziek zetten, meditaties of verhaaltjes voor het slapengaan. Suno waarschuwt dat de bèta nog onvolmaakt is: een Brits accent kan naar een Australisch accent verschuiven, en dramatische pauzes kunnen erg nadrukkelijk zijn. Tarieven, abonnementen en ondersteunde talen worden niet vermeld.

🔗 Introductie van Speech (Suno)

ElevenLabs gecertificeerd voor FedRAMP 20x Class A voor ElevenAgents en zijn spraak-API’s

1 oktober — ElevenLabs behaalt de certificering FedRAMP 20x Class A, het kader waarmee Amerikaanse federale instanties bepalen of een cloudproduct veilig met overheidsgegevens kan worden gebruikt. De certificering geldt voor ElevenAgents en de API’s Text to Speech en Speech to Text, op voorwaarde dat ze in Zero Retention Mode werken en de gegevens in de Verenigde Staten worden opgeslagen. Ze breidt het aanbod ElevenLabs for Government uit, en het bedrijf staat nu in de FedRAMP Marketplace. Volgens FedRAMP, aangehaald door ElevenLabs, volstaat Class A voor de meeste niet-gevoelige toepassingen van instanties; ElevenLabs noemt aanvragen voor uitkeringen, vergunningen, belastingen of het transcriberen van hoorzittingen.

ElevenLabs onderbouwt de aankondiging met bestaande implementaties bij de overheid:

Genoemde implementatie bij de overheidDoor ElevenLabs opgegeven cijfer
Nationale hulplijn voor werkgelegenheid (Oekraïne)25 % afgehandeld door conversationele agents
Hulplijnen voor uitkeringen en werkgelegenheid (Tsjechië)85 % van ongeveer 5 000 oproepen per dag afgehandeld
Stad Midland7 000 minder gemiste oproepen per maand (prognose)

🔗 Bericht van ElevenLabs


ChatGPT stelt Finances beschikbaar voor Free- en Go-gebruikers in de Verenigde Staten

2 oktober — Finances, de omgeving van ChatGPT voor persoonlijke financiën, wordt in de Verenigde Staten uitgebreid naar de Free- en Go-abonnementen, op het web, iOS en Android. De functie bestond al voor Plus- en Pro-abonnees: ze begon in mei als preview voor uitsluitend Pro-abonnees en kreeg op 21 september ondersteuning voor het volgen van de Experian-kredietscore voor Plus- en Pro-abonnees. Ze is nu beschikbaar voor de abonnementen Free, Go, Plus en Pro, nog steeds uitsluitend in de Verenigde Staten.

Het principe blijft hetzelfde: je koppelt je bank- en beleggingsrekeningen via Plaid en je kredietrapport via Experian, twee koppelingen die samen of afzonderlijk te gebruiken zijn. De pagina Finances brengt uitgaven, rekeningen, abonnementen, nettovermogen, beleggingen en je kredietscore samen. In het gesprek categoriseert ChatGPT uitgaven, herkent het abonnementen, vergelijkt het de maand met recente trends en ordent het voor de belastingen informatie en wijst het op mogelijkheden om te onderzoeken, zoals aftrekposten.

🔗 Release notes van ChatGPT · Finances in ChatGPT


SpaceXAI brengt zijn officiële TypeScript SDK uit als experimentele versie

2 oktober — SpaceXAI heeft zonder aankondiging de eerste publieke versie van zijn officiële TypeScript SDK uitgebracht. Versie 0.1.0 verscheen om 16 h 57 UTC, gevolgd om 18 h 25 UTC door versie 0.2.0, die de clientklasse xAI hernoemt naar SpaceXAI: een breaking change die de code afstemt op de nieuwe bedrijfsnaam. De SDK ondersteunt al de Responses API (streaming, compaction en gesprekken met meerdere beurten), de ingebouwde tools van het platform (zoeken op het web en op X, code uitvoeren, externe MCP-servers), het genereren en bewerken van afbeeldingen en video’s, en de API’s Files, Batch en Voice.

SDK-onderdeelVermeld detail
npm-pakket@xai-official/sdk
LicentieApache-2.0
VereistenNode.js 22.13 of nieuwer, ESM-project, geen runtime-afhankelijkheden
StatusExperimenteel, interfaces liggen vóór 1.0 nog niet vast

Standaard weigert de SDK in een browser of een Worker te draaien, om de geheime sleutel niet aan de clientzijde bloot te stellen. TypeScript-ontwikkelaars hebben daarmee een tegenhanger van de officiële Python SDK, waarvan versie 1.20.0 op 24 september verscheen.

🔗 CHANGELOG van de TypeScript SDK van SpaceXAI · Het pakket @xai-official/sdk op npm


Korte berichten

  • GPT-6.1 Sol in v0 — Op 29 september, de dag waarop het model verscheen, maakte v0, de applicatiegenerator van Vercel, GPT-6.1 Sol beschikbaar, enkele uren nadat het inloggen met een ChatGPT-abonnement had toegevoegd; de aankondiging vermeldt geen prijs of metingen specifiek voor v0. 🔗 bron
  • Nieuw agentdashboard in Grok Build — Het werd op 1 oktober aangekondigd, toont alle agents op één scherm met /dashboard, start taken parallel en plaatst een agent met Ctrl+W in zijn eigen git-worktree; Grok Build kreeg op 15 juni al een eerste dashboard. 🔗 bron
  • Nightly van Gemini CLI — Versie v0.64.0-nightly van 2 oktober bevat slechts acht fixes: Ctrl+C annuleert weer een lopende bewerking en de status ~/.gemini/state.json wordt atomair weggeschreven, met een back-up .bak die bij corruptie wordt teruggezet; de stabiele versie en de preview blijven ongewijzigd. 🔗 bron
  • Modellen verwijderd uit GitHub Copilot — Zoals aangekondigd op 3 september verdwijnen Gemini 3.5 Flash, Gemini 3.6 Flash, Kimi K2.7 Code en Claude Opus 4.7 uit alle Copilot-omgevingen; GitHub raadt Gemini 3.8 Flash, Kimi K3 en nu Claude Opus 5.5 aan, in plaats van Claude Opus 5. 🔗 bron
  • Een SKILL.md testen — In een communityartikel stelt Golda Manuel een methode voor, zonder gepubliceerde metingen, om te controleren of een skill door codeagents wordt gevonden, geladen en nuttig gebruikt: de door Claude Code of Codex verwachte locatie, activering bij drie niveaus van verzoeken en een vergelijking met en zonder skill op acht meetpunten. 🔗 bron
  • Manus licht Video Editor en Game Dev toe — Twee artikelen van 1 oktober gaan dieper in op Manus 2.0: Video Editor, in Manus Studio, plaatst elk onderdeel van een video op een eigen spoor (125 clips gemonteerd tot een film van 10 min 50 s met 195 cuts), en Game Dev past een game live aan; geen prijs of datum. 🔗 Video Editor · 🔗 Game Dev
  • AutoSynthData van ServiceNow — Het CoreAI-team van ServiceNow genereert geverifieerde trainingstaken op basis van fouten van een model: op EnterpriseOps Gym wint Gemma-4-26B-A4B-it 7,2 punten op Pass@1 in het domein Hybrid en stijgt het van 18,77 % naar 27,18 % in ITSM; er zijn geen code of data gepubliceerd. 🔗 bron
  • POCKET-Darwin-180B — VIDRAFT publiceert een GGUF-versie van 4 bits en 111 Go (tegenover 360 Go) van Darwin-180B-RSI, een MoE met 180 miljard parameters: 18,4 tot 21 tokens per seconde op alleen een processor, 4,17 op een laptop met een RTX 5060 van 8 Go, en 87,65 % op MMLU-Pro, net als het origineel, volgens de auteurs. 🔗 bron
  • Gids voor de GPT-6-modellen — OpenAI publiceert een gids voor startups: GPT-6 Astra voor de moeilijkste redeneertaken, GPT-6.1 Sol voor complexe code, onderzoek en computergebruik, GPT-6 Luna voor gerichte taken op grote schaal; gecachete tokens kosten afhankelijk van het model tot 95 % minder. 🔗 bron
  • ChatGPT scant meerdere pagina’s tot één PDF via de camera op iOS — wordt uitgerold, 1 oktober.
  • Chatham Financial en Codex — Het adviesbureau voor kapitaalmarkten heeft met Codex een applicatie voor transactievalidatie gebouwd: volgens de eerste metingen daalt de verificatietijd van ongeveer 30 minuten naar minder dan 4; zijn platform Onyx combineert GPT-5.6 Sol en Terra, GPT-5.4 en GPT-4.1. 🔗 bron
  • The Den en ChatGPT Work — Volgens een casestudy van OpenAI van 1 oktober bespaart het managementteam van deze club voor ouders in Denver 10 tot 15 uur per week met ChatGPT Work, gekoppeld aan Gmail, Slack en Google Drive; een subsidieaanvraag kost 2 uur in plaats van 3 dagen. 🔗 bron
  • GPT-6 Astra Ultrafast op Blackwell — NVIDIA verduidelijkt op 1 oktober dat de Ultrafast-variant van GPT-6 Astra, die OpenAI op 29 september lanceerde, op zijn Blackwell-GPU’s draait, tot 8 keer sneller dan de modus Astra Standard, en dat OpenAI zijn inferentiesoftware optimaliseert met zijn eigen modellen; geen nieuwe cijfers. 🔗 bron
  • RL Rollouts bij CoreWeave — Deze dienst, op 30 september gepresenteerd met CoreWeave Forge en op 2 oktober uitgelicht door NVIDIA, is gebouwd op NVIDIA Dynamo en laadt nieuwe checkpoints zonder onderbreking tijdens post-training met reinforcement learning; op Nemotron 3.5 Lightning is de latentie bij het herladen van het model met een factor 15 verbeterd. 🔗 bron
  • Eleven v4 in ElevenReader — Het meest expressieve stemmodel van ElevenLabs, gelanceerd op 28 september, komt naar zijn leesapp: artikelen, e-books en PDF’s in de gekozen stem, in meer dan 90 talen, op iOS, Android en het web. 🔗 bron
  • Alpha-changelog van Midjourney — Deze is gedateerd op 1 oktober en bevat vooral fixes, waaronder promptinstellingen die per map worden onthouden en stijlreferenties die in één chip worden gegroepeerd, voorafgaand aan nieuwe samenwerkingstools die voor de volgende week zijn aangekondigd. 🔗 bron
  • Grok 4.7 voor de halve prijs in Ramp Router — Tot 6 oktober biedt de LLM-gateway Ramp Router Grok 4.7 aan met 50 % korting, een aanbieding die door SpaceXAI wordt gedeeld; op de API van SpaceXAI kost het model 2 dollar voor input en 6 dollar voor output per miljoen tokens. 🔗 bron
  • Vertrouwelijke reacties op beveiligingsadviezen — GitHub maakt het mogelijk te reageren op een beveiligingsadvies van een repository zonder dat de melder dit ziet: alleen mensen met schrijftoegang kunnen deze reacties lezen, en raadplegingen worden gelogd; een REST API voor reacties gaat in publieke preview. 🔗 bron · 🔗 REST API
  • GraphQL API van de GitHub Advisory Database — Het object SecurityAdvisory krijgt vijf velden, waaronder de CVE-identificatie en de publicatiedatum bij de NVD, en de query securityAdvisories krijgt twee filters, op ernst en op ingetrokken status: hiervoor is de REST API niet meer nodig. 🔗 bron
  • Einde van de macOS 14-image in GitHub Actions — De uitfasering werd op 1 oktober aangekondigd en vindt plaats op 2 november, voorafgegaan door acht geplande onderbrekingen in oktober, van 14 h tot middernacht UTC; workflows moeten overstappen op macos-15 of macos-latest, dat naar macos-26 verwijst. 🔗 bron
  • AI-volwassenheid in bedrijven — Perplexity publiceert een gids die vier volwassenheidsfasen beschrijft, de kaders van Gartner, Deloitte en Google Cloud samenvat en een zelfbeoordelingsschema aanbiedt; volgens de aangehaalde enquête van McKinsey uit 2026 ziet 80 % van de respondenten winst in persoonlijke productiviteit, maar slechts 37 % een bijdrage aan de EBIT. 🔗 bron

Wat dit betekent

AI in de wetenschap wordt steeds vaker beoordeeld op criteria die niet afkomstig zijn van degenen die haar aankondigen. Meta beperkt zich niet tot het opsommen van resultaten: elk artikel vermeldt welke passages de AI heeft geschreven, een tweede groep wiskundigen leest ze na, en het artikel erkent dat drie van de problemen ook elders zijn opgelost. Het griepvoorspellingsmodel dat met AI van Google is ontwikkeld, ontleent zijn waarde aan een evaluatie door de CDC over een volledig seizoen, vergeleken met 38 andere modellen. Ai2 publiceert de gewichten en data van AstaBrief, maar waarschuwt dat de vergelijkingen uit 2025 stammen: een open model kun je controleren, een evaluatie veroudert.

Beslissingsmodellen worden in enkele dagen een volwaardige categorie. Na Jev, d1 van Liquid AI en Clef van Cloudflare biedt Perplexity zowel een API die per inputtoken wordt afgerekend als de gewichten van zijn model; llama.cpp draait deze modellen lokaal met hetzelfde System One-formaat, en Replit neemt Jev op in zijn integraties zonder API-sleutel. Voor een ontwikkelaar is het voordeel concreet: een waarschijnlijkheid per optie, verkregen in één enkele doorgang, in plaats van een tekstantwoord dat daarna moet worden geanalyseerd. De vergelijkingen vragen om voorzichtigheid: de rij Overall in de modelfiche plaatst pplx-decider-v1-27b vóór Jev, maar de gepubliceerde details geven Jev het voordeel op zes van de elf benchmarks.

Codeagents ontwikkelen zich sneller dan hun werkelijke autonomie. Wanneer het beste model op SWE-sweep zelfstandig een repository onderzoekt, vindt en verhelpt het slechts 4,7 % van de bugs, voor meer dan 7 000 dollar. Claude Code 2.1.288 besteedt het grootste deel van zijn 89 vermeldingen aan fixes, waaronder het hervatten na een API-time-out en meerdere aangescherpte toegangsregels, en licht een mod uit die het werk van de hoofdagent bewaakt. Anthropic pakt het andere knelpunt aan, menselijke vaardigheden, met 100 miljoen dollar om engineers op te leiden die een implementatie tot in productie kunnen begeleiden. Open modellen veroveren intussen hun plek in de tools, met GLM 5.3 in Cursor en DeepSeek Harness op de desktop.

De rekenhardware diversifieert zich ten slotte in drie richtingen. Google test TPU’s in een baan om de aarde die op een dag mogelijk tot 8 keer meer zonne-energie kunnen benutten dan op aarde, NVIDIA voegt aan zijn DGX Spark een configuratie van 64 Go toe waarvan er twee kunnen worden gekoppeld om 200 miljard parameters te bereiken, en DeepSeek maakt zijn low-levelbibliotheken met dezelfde API bruikbaar op de Ascend-chips van Huawei. Elk breidt op zijn eigen manier de locaties en de hardware uit waarop modellen kunnen draaien.


Bronnen