ai-powered-markdown-translatorArtikel vertaald van het Frans naar het Nederlands met gpt-6.1-sol.
Mistral stelt Mistral Large 4 beschikbaar in preview, een multimodaal model met 1 000 miljard parameters waarvan de API vanaf vandaag voor iedereen toegankelijk is en waarvan de gewichten voor eind oktober zijn toegezegd. Anthropic brengt Claude naar Google Docs, Sheets en Slides en vernieuwt zijn cyberverificatieprogramma met drie toegangsniveaus, terwijl Google DeepMind EmbeddingGemma 2 uitbrengt, een open en multimodaal model voor embeddings dat op een telefoon past. Ook de beslismodellen staan vandaag in de belangstelling: OpenAI stelt zijn Decisions API beschikbaar in publieke bèta, Perplexity halveert zijn prijs en een ranglijst van de community bepaalt hun onderlinge positie.
Mistral Large 4: 1 000 miljard parameters in preview, gewichten toegezegd voor eind oktober
6 oktober — Mistral AI lanceert Mistral Large 4 in publieke preview, met de bijnaam ML4 en, « zeer officieel », de Chonk. Het is het grootste model van het bedrijf tot nu toe: een van meet af aan multimodale mix van experts (Mixture-of-Experts) met 1 000 miljard parameters (1T), waarvan volgens het aankondigingsbericht 49 miljard actief zijn, die instructies, redeneren en agentische mogelijkheden samenbrengt in een context van een miljoen tokens. De modelpagina in de documentatie vermeldt andere cijfers, zonder het verschil uit te leggen: 1 050 miljard parameters, waarvan 52 miljard actief, plus een vision-encoder van 1,6 miljard.
De API is vanaf vandaag voor iedereen toegankelijk op Mistral Studio, maar de gewichten zijn nog niet gepubliceerd: Mistral belooft ze uiterlijk eind oktober, samen met details over de architectuur en de post-training. Ondertussen wordt het model in de praktijk getest door verantwoordelijken voor cyberbeveiliging, geverifieerde partners en overheidsinstanties, die toegang krijgen met minder strenge moderatie. ML4 is vanaf nul getraind op 3 800 NVIDIA Grace Blackwell GPU’s in de Europese datacenters van Mistral, waar ook de preview draait. Het bedrijf plant een Europese uitrol die het volledig zelf beheert, onder Europees recht, en presenteert het model als de eerste mijlpaal van de roadmap die wordt gefinancierd door zijn Series D-ronde van 3 miljard euro.
Cyberbeveiliging is de belangrijkste troef. Volgens Mistral behoort ML4 tot de vijf beste modellen van de Artificial Analysis Cyber Index en behaalt het 82 % op een van de tests daarvan, waarbij een echte kwetsbaarheid in open source-software moet worden gereproduceerd en vervolgens verholpen, de hoogste score van alle modellen. Het bedrijf stelt dat Claude Opus 5.5 en GPT-6 Astra op diezelfde test bijna nul scoren, omdat ze de taak weigeren.
| Geteste benchmark | Door Mistral aangekondigde score | Door Mistral aangehaalde vergelijking |
|---|---|---|
| DeepSWE v1.1 | 61,7 % | — |
| Coding Agent Index (gecombineerd) | 49,8 % | vóór DeepSeek V4 Pro 0813 en Qwen3.8 Max |
| Blinde menselijke beoordeling door Surge AI (code, uit 5) | 3,74, 2e van 5 | achter Claude Opus 5 (4,22) |
| Cybench (40 uitdagingen) | 93 % | — |
| AA Cyber Index, een kwetsbaarheid reproduceren en verhelpen | 82 % | hoogste score van alle modellen |
| AutomationBench (657 bedrijfsprocessen) | 59,9 % | vóór Kimi K3, MiMo-V2.6-Pro en DeepSeek V4 Pro |
Het bericht en de modelpagina verschillen ook over de prijs: de kaart in het bericht vermeldt 1,36 dollar per miljoen tokens voor invoer en 4,18 dollars voor uitvoer, terwijl de modelpagina die tarieven doorstreept en daarnaast een gehalveerde prijs toont, zonder looptijd of uitleg.
| Kenmerk van ML4 | Volgens het aankondigingsbericht | Volgens de modelpagina in de documentatie |
|---|---|---|
| Totaal aantal parameters | 1 000 miljard | 1 050 miljard |
| Actieve parameters | 49 miljard | 52 miljard |
| Invoer, per miljoen tokens | 1,36 dollar | 0,68 dollar (1,36 doorgestreept) |
| Uitvoer, per miljoen tokens | 4,18 dollars | 2,09 dollars (4,18 doorgestreept) |
Al deze scores zijn afkomstig van Mistral, dat aangeeft dat de reinforcement learning van de preview doorgaat zonder tekenen van verzadiging en de komende weken snelle vooruitgang verwacht.
🔗 Bericht van Mistral over Mistral Large 4 🔗 Pagina voor Mistral Large 4 in de documentatie
Claude for Google Workspace: Claude komt naar Docs, Sheets en Slides
6 oktober — Anthropic lanceert Claude for Google Workspace, een uitbreiding (add-on) die Claude opent in een zijpaneel van Google Docs, Sheets en Slides, in publieke bèta voor alle betaalde abonnementen. Claude leest het geopende bestand, ziet de huidige selectie (tekst, cellen of dia’s) en wijzigt het bestand rechtstreeks.
| Google-applicatie | Wat Claude daarin doet |
|---|---|
| Docs | Directe correcties en stijlwijzigingen, suggestiekaarten die kunnen worden toegepast of genegeerd bij ingrijpendere herschrijvingen |
| Sheets | Formules, draaitabellen, native grafieken, nieuwe tabbladen, verwerking van een bereik met Python voor een join of opschoning |
| Slides | Dia’s op basis van de lay-outs en het thema van de presentatie, controle op elementen die elkaar overlappen of buiten de dia vallen |
De gebruiker kiest de mate van autonomie: in de modus « vragen vóór wijzigingen » (Ask before edits), die standaard actief is, gaat elke wijziging via een goedkeuringskaart; in de modus « alle wijzigingen accepteren » (Accept all edits) werkt Claude verder zonder te stoppen. Als het paneel met het Claude-account is verbonden, gebruikt het dezelfde modellen, connectors en vaardigheden (skills). Bij Enterprise-abonnementen gelden de Compliance API, door de klant beheerde encryptiesleutels (CMEK) en de OpenTelemetry-auditexport ook voor de uitbreiding.
Claude now works inside Google Docs, Sheets, and Slides, and those files also open inside Claude. In Google Workspace, Claude sits in a sidebar next to your file, reads what you have open, and edits it in place. You can approve each edit before it lands.
🇳🇱 Claude werkt nu in Google Docs, Sheets en Slides, en deze bestanden kunnen ook in Claude worden geopend. In Google Workspace staat Claude in een zijpaneel naast uw bestand, leest het wat u hebt geopend en wijzigt het rechtstreeks. U kunt elke wijziging goedkeuren voordat die wordt toegepast. — @claudeai op X
Tegelijk komt de omgekeerde werkwijze beschikbaar: nieuwe connectors voor Google Docs, Sheets en Slides, eveneens in bèta, maken het mogelijk om vanuit Claude Google-bestanden aan te maken en te wijzigen, door een link te plakken of om een nieuw document te vragen. Bij ondersteunde configuraties opent het bestand in een paneel naast het gesprek, en volgt de toegang van Claude de deelrechten van Google. De uitbreiding wordt geïnstalleerd vanuit de Google Workspace Marketplace (Extensions > Claude > Open Claude) en beheerders kunnen deze uitrollen vanuit de Google Admin-console; bij Team en Enterprise moet een eigenaar eerst de connectors inschakelen. Google Workspace sluit hiermee aan bij Microsoft 365, waar Claude voor Excel, PowerPoint en Word sinds 7 mei algemeen beschikbaar is.
🔗 Bericht van Anthropic over Claude for Google Workspace
Cyber Verification Program: Anthropic stelt Opus 5.5, Sonnet 5.5 en Mythos 5.1 beschikbaar via drie toegangsniveaus
6 oktober — Anthropic vernieuwt zijn cyberverificatieprogramma (Cyber Verification Program, CVP), dat geverifieerde beveiligingsprofessionals toegang geeft tot mogelijkheden die zijn modellen voor het grote publiek blokkeren. Er bestonden al zes maanden twee regelingen naast elkaar: Project Glasswing, dat organisaties die verantwoordelijk zijn voor de meest kritieke software toegang gaf tot Claude Mythos, en een CVP met één niveau dat de veiligheidsbeperkingen van de Opus- en Sonnet-modellen versoepelde. Die worden samengevoegd tot drie niveaus, die allemaal toegang geven tot Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 en toekomstige modellen. De algemeen beschikbare modellen (Opus 5.5, Fable 5.1, Sonnet 5.5) behouden voorzichtige veiligheidsbeperkingen die het merendeel van de cybertaken blokkeren.
| Toegangsniveau | Ondersteunde toepassingen | Doelgroep en termijn |
|---|---|---|
| Defense Access | Operationeel beveiligingscentrum, incidentrespons, reverse engineering van malware, analyse van kwetsbaarheden | Beveiligingsteams, kritieke infrastructuur van elke omvang, open source-maintainers, onderzoekers; enkele dagen |
| Red Team Access | Defensieve toepassingen, plus geautoriseerde penetratietests en oefeningen met gesimuleerde aanvallen (red teaming) | Alleen organisaties, op systemen die ze mogen testen; enkele weken |
| Specialized Access | Tests van veiligheidssystemen: luchtvaart, elektriciteitsnetten, telecom, interbancaire overboekingen, administratieve netwerken | Enkele organisaties die samen met de Amerikaanse overheid afzonderlijk worden beoordeeld; Glasswing-leden worden overgezet |
Bij Red Team Access blijven acties die fysieke schade of grootschalige verstoring kunnen veroorzaken, zoals het inzetten van ransomware, in realtime geblokkeerd. Om zijn instellingen te controleren, heeft Anthropic Opus 5.5 CyScenarioBench laten uitvoeren, een evaluatie van cyberoperaties in meerdere stappen, met de veiligheidsbeperkingen van elk niveau (10 uitdagingen, elk met 5 pogingen).
| Door Anthropic geteste configuratie (Opus 5.5) | Resultaat op CyScenarioBench (50 pogingen) |
|---|---|
| Zonder CVP | Alle taken al bij de eerste prompt geblokkeerd |
| Defense Access | 46 pogingen op enig moment geblokkeerd, 4 geslaagd |
| Red Team Access | Geen blokkades, 34 taken geslaagd, overeenkomend met de 67,6 % van het model zonder veiligheidsbeperkingen |
Het bericht maakt ook een eerste balans van Glasswing op, met volgens Anthropic onvolledige cijfers: minstens 129 000 geverifieerde kwetsbaarheden die partners van april tot juli vonden, plus 5 500 via de open source-analyses van Anthropic, waarvan meer dan 33 000 in de categorieën kritiek of hoog vallen. Deze cijfers zijn gebaseerd op 33 partnerrapporten, en Anthropic schat de werkelijke impact « minstens vijf keer zo groot ». In een getuigenis die dezelfde dag verscheen, zegt Comcast met Claude Mythos Preview een kritieke authenticatiekwetsbaarheid te hebben gevonden bij het beoordelen van 258 systemen en ongeveer 170 miljoen regels code, en een analist van Booz Allen heeft in twaalf dagen 138 repositories doorgelicht.
Praktisch gezien vereist het programma dat gegevens worden bewaard om misbruik te monitoren, in afwachting van Enterprise Frontier Safeguards (EFS), waarmee deze gegevens later dit najaar in een cloud onder controle van de klant kunnen blijven; organisaties die Fable 5.1 of Mythos 5.1 al zonder gegevensbewaring gebruiken, kunnen dat ook met het CVP doen. Het programma is beschikbaar op Claude Platform, Vertex AI en Microsoft Foundry, en op Amazon Bedrock alleen voor klanten die voor EFS in aanmerking komen. Individuele aanmeldingen zijn alleen mogelijk voor Defense Access, met een betaald abonnement, en dit niveau moet uiterlijk 15 december overstappen op phishingbestendige multifactorauthenticatie en het gebruik van API-sleutels beëindigen. Er staat een webinar gepland op 14 oktober om 9 uur PT.
🔗 Bericht van Anthropic over het Cyber Verification Program 🔗 Helppagina van het Cyber Verification Program 🔗 Comcast en Booz Allen met Claude Mythos
EmbeddingGemma 2: het open model voor embeddings van Google wordt multimodaal
6 oktober — Google DeepMind brengt EmbeddingGemma 2 uit, de tweede generatie van zijn open model voor embeddings dat is ontworpen om op het apparaat te draaien. Het eerste EmbeddingGemma, dat volgens Google meer dan 20 miljoen keer is gedownload, verwerkte alleen tekst; het nieuwe model projecteert tekst (inclusief code), afbeeldingen, video en audio, afzonderlijk of gecombineerd, in één ruimte met 768 dimensies. Het is gebouwd op de architectuur van Gemma 4 en verschijnt onder de Apache 2.0-licentie.
Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space.
🇳🇱 Dit is EmbeddingGemma 2, ons eerste open model dat van nature multimodaal is, voor embeddings op het apparaat. Het gaat verder dan tekst en verenigt code, afbeeldingen, audio en video in een gedeelde ruimte. — @GoogleDeepMind op X
Het model heeft 740 miljoen parameters, maar is modulair: een tekstkern van 270M, waaraan naar behoefte een vision-encoder (170M) en een audio-encoder (300M) worden toegevoegd. Een toepassing met alleen tekst laadt dus slechts 270M parameters. Met kwantisatie meet Google op een Pixel 11 Pro ongeveer 191 Mo actief RAM-gebruik voor de tekstgewichten en 567 Mo voor het volledige multimodale model.
| Kenmerk van EmbeddingGemma 2 | Door Google aangekondigde waarde |
|---|---|
| Totaal aantal parameters | 740M (tekst 270M, vision 170M, audio 300M) |
| Vectordimensies | 768, in te korten tot 512, 256 of 128 |
| Contextvenster | 8K tokens, vier keer zo groot als bij de eerste versie |
| Actief RAM-gebruik op Pixel 11 Pro (gekwantiseerd) | ongeveer 191 Mo bij alleen tekst, 567 Mo bij multimodaal gebruik |
| MTEB Code | 78,68, tegenover 68,76 voor de eerste versie |
| MTEB meertalig v2 | 61,36, tegenover 61,15 voor de eerste versie |
Het leren van representaties « als matroesjkapoppen » (Matryoshka Representation Learning) maakt het mogelijk de vectoren in te korten, zodat tot zes keer minder opslagruimte nodig is; volgens de modelkaart wordt de kwaliteit tot 256 dimensies nauwelijks beïnvloed, en zijn 128 dimensies vooral geschikt voor toepassingen met alleen tekst. De duidelijkste winst betreft code, met volgens Google bijna tien punten meer op MTEB Code, terwijl de prestaties voor meertalige tekst op het eerdere niveau blijven.
De beoogde toepassingen zijn volledig lokaal zoeken en retrieval-augmented generation (RAG), bijvoorbeeld een fragment uit een video terugvinden op basis van een spraakmemo. Omdat het model de teksttokenizer (tokenizer) en de audio-encoder van Gemma 4 deelt, kunnen beide samen draaien met een kleiner geheugengebruik. De gewichten zijn beschikbaar op Hugging Face en Kaggle; de komst naar de Model Garden van Gemini Enterprise Agent Platform is aangekondigd voor « binnenkort », zonder datum. Het model wordt vanaf de release ondersteund door Transformers (versie 5.19.0), sentence-transformers, MLX, vLLM, llama.cpp, Ollama en LM Studio, en ook in de browser met transformers.js.
🔗 Aankondiging op de blog van Google 🔗 Modelkaart van EmbeddingGemma 2 🔗 Gewichten op Hugging Face
Beslissingsmodellen: OpenAI stelt zijn Decisions API open, Perplexity brengt Decider v1.1 uit en halveert de prijs, de Decision Index 0.3 rangschikt ze
Voor beslissingsmodellen, die een optie kiezen of een invoer een score geven in plaats van een vrij antwoord te formuleren, was het een drukke dag: twee aanbieders herzien hun aanbod en hun tarieven, en de communityranglijst voor deze categorie krijgt een nieuwe methodiek.
De Decisions API van OpenAI in publieke bèta
6 oktober — Een week nadat de Decisions API van OpenAI tijdens DevDay beperkt toegankelijk werd, gaat deze over naar publieke bèta, met algemene beschikbaarheid die « in de komende weken » wordt verwacht. De API beantwoordt gesloten vragen over tekst, een afbeelding of beide, met GPT-6 Luna, het enige beschikbare model, via een speciaal endpoint (POST /v1/decisions); volgens OpenAI komen de getypeerde antwoorden ongeveer 10 keer sneller dan met de Responses API. Het nieuws van vandaag is het tarief: 0,10 dollar per miljoen invoertokens, zonder kosten voor de uitvoer of de cache, met extra toeslagen voor regionale verwerking en lange contexten.
| Vraagtype | Beoogd gebruik | Teruggegeven resultaat |
|---|---|---|
Predicaat (predicate) | Een voorwaarde controleren, zoals een beschadigd product op een foto | Waarschijnlijkheid van 0 tot 1 dat de voorwaarde waar is |
Keuze (choice) | Een optie uit een opgegeven lijst kiezen | De optie, de waarschijnlijkheid van elke optie en een betrouwbaarheidsindicator |
Score (score) | Beoordelen op geordende niveaus, zoals de ernst van een incident | Een met de waarschijnlijkheden gewogen gemiddelde van de niveaus |
Meerdere vragen kunnen in één verzoek betrekking hebben op dezelfde invoer, en afbeeldingen moeten in base64 worden verstuurd, zonder gehoste URL of bestands-ID. De API ondersteunt het niet bewaren van gegevens (Zero Data Retention) en HIPAA-toepassingen voor klanten die daarvoor in aanmerking komen, met dataresidentie in de Verenigde Staten en Europa.
🔗 Handleiding voor de Decisions API 🔗 Changelog van de OpenAI API
pplx-decider-v1.1-27b van Perplexity en de halvering van de prijs
6 oktober — Vijf dagen na de lancering van zijn eigen Decisions API werkt Perplexity het model achter de API bij, in een thread op zijn ontwikkelaarsaccount, @perplexitydevs. Het model pplx-decider-v1.1-27b, dat met open gewichten onder de Apache 2.0-licentie op Hugging Face is gepubliceerd, behoudt de Qwen3.8-27B-basis van v1, leest tekst en afbeeldingen binnen een context van 250k tokens en verwijdert het causale masker (causal mask) uit zijn lagen met volledige attention. De Decisions API, die nu dit model aanbiedt, kost 0,02 dollar per miljoen invoertokens, de helft van de 0,04 dollar van v1, en de uitvoer blijft gratis.
| Categorie van de Decision Index (modelkaart op Hugging Face) | Score van Jev | Score van v1 | Score van v1.1 |
|---|---|---|---|
| Kennis (Knowledge) | 51,4 | 40,9 | 48,18 |
| Taal (Language) | 62,0 | 63,5 | 69,45 |
| Informatie ophalen (Retrieval) | 55,4 | 54,9 | 61,26 |
| Tools (Tools) | 75,1 | 79,3 | 78,88 |
| Kunst (Arts) | 37,7 | 39,4 | 44,66 |
| Gewogen totaalscore | 57,9 | 56,4 | 61,56 |
Volgens de modelkaart stijgt de totaalscore van 56,4 naar 61,56, boven de 57,9 van Jev, het beslissingsmodel van TypeSafe AI, dat op kennisgebied wel hoger blijft scoren. Perplexity beweert ook de beste score op de nieuwe Decision Index 0.3 te behalen. Om het model zelf te hosten, is een GPU nodig waarop ongeveer 49 Gio aan gewichten passen, plus de meegeleverde implementatie, omdat standaard causale inferentie het gemeten gedrag niet reproduceert.
🔗 De thread van @perplexitydevs op X 🔗 pplx-decider-v1.1-27b op Hugging Face
De Decision Index 0.3
6 oktober — apolinario, engineer bij Hugging Face, brengt versie 0.3 van de Decision Index uit, de communityranglijst voor open beslissingsmodellen die het Decision Model van Jev reproduceren. De ranglijst telt nu 112 modellen, waaronder 111 open reproducties, die op een NVIDIA RTX PRO 6000 draaien. De methode verandert: de volledige score (Full score) combineert 37 openbare benchmarks, niet-openbare tests die dezelfde vaardigheden meten en niet-openbare taken uit nieuwe domeinen, zodat de rangschikking de vaardigheden weerspiegelt en niet alleen de prestaties op bekende benchmarks. Er verschijnt ook een tabblad voor vision.
| Weergegeven positie | Gerangschikt model | Volledige score |
|---|---|---|
| 1 | Perplexity Decider v1.1 (27B) | 62,8 |
| 2 | Fastino GLiDE zonder redeneren (28B) | 60,2 |
| Referentie | Jev | 60,1 |
| 3 | Torchcast Decision 27B | 59,9 |
| 4 | deck31b (Gemma 4 31B) | 59,0 |
De twee scores van Decider v1.1 zijn niet hetzelfde: 61,56 is de score die Perplexity op zijn modelkaart publiceert, 62,8 is de score die deze ranglijst met de nieuwe methode berekent. De niet-openbare tests worden vanwege hun aard niet gepubliceerd.
🔗 De aankondiging van apolinario op X 🔗 De Decision Index 0.3
Computerbediening: OpenAI traint GPT-6 Astra op de contracten van Ironclad
6 oktober — OpenAI gaat onderzoekssamenwerkingen aan met softwareleveranciers om zijn agents effectiever te maken in bedrijfssoftware, als onderdeel van het werk aan computerbediening (computer use), en begint met Ironclad, specialist in contracten met IA-ondersteuning. De teams hebben 11 taken op juridisch gebied, voor verkoop en voor inkoop gedefinieerd, die volgens OpenAI elk 30 tot 40 minuten kosten voor een ervaren gebruiker en op 8 tot 50 criteria worden beoordeeld. Ironclad leverde gehoste omgevingen van zijn software aan, waarin de modellen via reinforcement learning werden getraind op synthetische taken die zijn afgeleid van openbare contracten uit de EDGAR-database van de SEC.
| Meting van OpenAI op de 11 taken | GPT-5.6 Sol (redenering High) | GPT-6 Astra (redenering Max) |
|---|---|---|
| Gemiddelde score | 41,6 % | 55,0 % (+32 %) |
| Geschatte gemiddelde tijd per poging (gesimuleerd) | 37,0 minuten | 19,2 minuten (-48 %) |
GPT-6 Astra is het eerste frontiermodel van OpenAI dat op deze taken is getraind, en een intern model dat tijdens de ontwikkeling ervan is gebruikt, haalt 63,7 %. Deze cijfers komen van OpenAI, en de tijden zijn gesimuleerd op basis van veronderstelde verwerkingssnelheden, niet gemeten bij klanten. OpenAI nodigt andere leveranciers uit taken voor te stellen die de huidige agents nog niet betrouwbaar uitvoeren.
🔗 Blogbericht van OpenAI over de samenwerking met Ironclad
API’s en platforms: niveaus en BAA van de OpenAI API, documenten en afbeeldingen in de Agent API van Perplexity, GLM-5.3 op Bedrock
Vier wijzigingen betreffen ontwikkelaars die inferentie inkopen: de toegangsvoorwaarden voor de API van OpenAI, de tools van de Agent API van Perplexity en een nieuw open model in het aanbod van AWS.
De gebruiksniveaus van de OpenAI API gaan van vijf naar drie
6 oktober — OpenAI vereenvoudigt de toegang tot de hoogste snelheidslimieten (rate limits) van zijn API: de vijf betaalde gebruiksniveaus worden er drie, Build, Launch en Grow. Het hoogste niveau, Grow, wordt bereikt na 500 dollar aan cumulatieve API-betalingen, tegenover 1 000 dollar voor het vroegere hoogste niveau. Organisaties die al op een betaald niveau zitten, worden automatisch overgezet, zonder dat ze iets hoeven te doen, en gaan vervolgens naar een hoger niveau zodra hun cumulatieve kredietaankopen de drempels bereiken; het gratis niveau blijft begrensd op 100 dollar per maand.
| Gebruiksniveau | Drempel voor cumulatieve aankopen | Maandelijks gebruiksplafond | Astra, Sol en Terra (verzoeken en tokens per minuut) | Luna (verzoeken en tokens per minuut) |
|---|---|---|---|---|
| Build | 5 dollars | 500 dollars | 5 000 en 1 000 000 | 5 000 en 2 000 000 |
| Launch | 100 dollars | 5 000 dollars | 10 000 en 4 000 000 | 10 000 en 10 000 000 |
| Grow | 500 dollars | 200 000 dollars | 15 000 en 40 000 000 | 30 000 en 180 000 000 |
🔗 De thread van @OpenAIDevs op X 🔗 Documentatie over snelheidslimieten
BAA en HIPAA-naleving via selfservice op de OpenAI API
5 oktober — Organisaties die beschermde gezondheidsgegevens met de API van OpenAI verwerken, kunnen nu zelf de zakelijke partnerovereenkomst (Business Associate Agreement, BAA) ondertekenen die de Amerikaanse HIPAA-wetgeving vereist. Via Settings > Organization > General accepteert een beheerder de standaard-BAA en schakelt ondersteuning voor HIPAA-naleving in, zonder enterprisecontract. Deze selfservice is beschikbaar voor organisaties die daarvoor in aanmerking komen en een gevestigde gebruiksgeschiedenis van de API hebben, en de activering kan via deze instellingen niet worden teruggedraaid. Voor maatwerkclausules moet nog steeds een verzoek per e-mail worden ingediend, met een antwoord binnen één tot twee werkdagen. OpenAI benadrukt dat alleen het ondertekenen van de BAA een toepassing nog niet HIPAA-conform maakt, en dat er voor ChatGPT Business geen BAA wordt aangeboden.
🔗 Hulpartikel van OpenAI over de BAA voor de API
De Agent API van Perplexity leest documenten en zoekt afbeeldingen
5 oktober — De changelog van de Perplexity API krijgt laat op de avond drie nieuwe vermeldingen. De Agent API accepteert nu PDF-, DOC-, DOCX-, TXT- en RTF-documenten als invoer, geïntegreerd in het verzoek of aangeduid met een openbare HTTPS-URL, waarbij de ondersteuning afhangt van het gekozen model en de gekozen aanbieder. Een nieuwe tool, image_search, zoekt afbeeldingen op het web en geeft gestructureerde resultaten terug, met het adres van de afbeelding en dat van de oorspronkelijke pagina: 1 tot 30 afbeeldingen per aanroep, standaard 5, filters voor domeinen en formaten, en veilig zoeken dat standaard is ingeschakeld. De tool kost 2,50 dollar per 1 000 geslaagde aanroepen, en mislukte aanroepen worden niet in rekening gebracht. De derde vermelding corrigeert de kostenberekening: antwoorden specificeren nu de kosten van extracties die in de sandbox zijn uitgevoerd, tegen het ongewijzigde tarief van GPT-6 Luna.
🔗 Changelog van de Perplexity API 🔗 Documentatie van de tool image_search
GLM-5.3 van Z.ai op Amazon Bedrock
6 oktober — Z.ai kondigt de komst van GLM-5.3, zijn vlaggenschipmodel met open gewichten, op Amazon Bedrock aan; de modelkaart van AWS vermeldt 5 oktober als lanceringsdatum. Het is een mixture of experts met 744 miljard parameters, waarvan ongeveer 40 miljard actief per token, met een context van een miljoen tokens en maximaal 128 000 uitvoertokens. De toegang is beperkt tot klanten die daarvoor in aanmerking komen en via hun AWS-accountteam gaan, en het model wordt alleen aangeboden via interregionale inferentie (profiel US of global), met promptcaching vanaf 1 024 tokens en de serviceniveaus Standard, Priority, Flex en Reserved. De modelkaart vermeldt geen prijs en verwijst naar de prijspagina van Bedrock. GLM-5.3 volgt op Kimi K3 (22 september) en Grok 4.7 (28 september), die in de afgelopen twee weken op Bedrock zijn verschenen.
🔗 Modelkaart van GLM 5.3 op Amazon Bedrock 🔗 De aankondiging van Z.ai op X
Code-agents: Claude Code 2.1.290 tot 2.1.292, cloudsessies, Vibe CLI 2.26.0, Antigravity en Replit
Code-agents krijgen vijf updates, van de terminal tot de editor: drie versies van Claude Code in minder dan twintig uur, een gids voor cloudsessies, een Vibe CLI waarvan de nieuwe interface in Rust wordt uitgebreid, de Antigravity-extensie voor VS Code en een Replit dat alle projecten van de gebruiker kan zien.
Claude Code 2.1.290 tot en met 2.1.292
5 en 6 oktober — Claude Code 2.1.290, uitgebracht op 5 oktober om 23.33 uur UTC, is een omvangrijke release: 190 items, waarvan 131 bugfixes. claude attach en claude logs accepteren een deel van de naam van een sessie in plaats van de identificatiecode, en /claude-api managed-agents-onboard zet het Managed Agents-model dat op een webpagina wordt beschreven om in ant apply-bestanden. Het budget voor webzoekopdrachten van de interactieve sessie stopt niet meer na 200 aanroepen: het wordt aangevuld met 100 aanroepen per uur. Op het gemiddelde inspanningsniveau (medium) meldt /code-review ook afwijkingen van de conventies in CLAUDE.md op Opus 5.5 en Sonnet 5.5. In Slack krijgt Claude Tag een snelle modus (!fast), een browser_batch-aanroep van Claude in Chrome krijgt 90 seconden in plaats van 60, en WebFetch kapt tekst boven de 100 000 tekens niet meer stilzwijgend af. pyright en meer vormen van ps vragen om toestemming, en verschillende kwetsbaarheden in de toestemmingscontrole worden verholpen: wildcards van rg en git grep die door de shell worden uitgebreid, CLAUDE.md-bestanden die via links buiten de werkmappen bereikbaar zijn, en een organisatiemod die door een gebruikersmod wordt omzeild. Vier uur later verhelpt 2.1.291 twee regressies: één die met 2.1.290 verscheen (antwoorden op toestemmingsprompts die in cloudsessies verloren gingen), en één die met 2.1.288 verscheen (de laatste berichten van een sessie die bij het afsluiten verloren gingen).
Op 6 oktober om 18.59 uur UTC voegt 2.1.292 (92 items, waarvan 64 bugfixes) een parameter effort toe aan de Agent-tool, om een subagent met het gevraagde inspanningsniveau te starten, en claude plugin install --marketplace, dat indien nodig de marktplaats (marketplace) toevoegt en vervolgens de plugin installeert. Lokale MCP-servers (stdio) onderhandelen nu standaard over protocol 2026-07-28 (MCP_PROTOCOL_NEGOTIATION=legacy om terug te schakelen), CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS verlengt de retries bij 529-fouten, en mods krijgen een event voor het automatisch aanvullen van prompts en een promptcache. Wat beveiliging betreft, omzeilen goedkeuringen van een PreToolUse-hook en de auto-modus niet meer de toestemmingsprompt voor het lezen van netwerkpaden (UNC), en worden <system-reminder>-tags die door een hook zijn geschreven geëscapet voordat ze Claude bereiken. De Artifact-tool toont eindelijk 200 artefacten in plaats van 50, en Code Review splitst zijn statistieken uit per repository. Noch 2.1.290, noch 2.1.292 is op X aangekondigd.
| Claude Code-versie | Publicatiedatum (UTC) | Aantal items | Belangrijkste vernieuwing |
|---|---|---|---|
| 2.1.290 | 5 oktober, 23 h 33 | 190, waarvan 131 bugfixes | Sessies aangeduid met hun naam, managed-agents-onboard, aangevuld WebSearch-budget |
| 2.1.291 | 6 oktober, 3 h 55 | 2 bugfixes | Twee regressies verholpen |
| 2.1.292 | 6 oktober, 18 h 59 | 92, waarvan 64 bugfixes | Inspanningsniveau van subagents, plugin en marktplaats in één commando, MCP 2026-07-28 |
🔗 Claude Code 2.1.290 🔗 Claude Code 2.1.291 🔗 Claude Code 2.1.292
De gids voor cloudsessies van Claude Code
6 oktober — Twee weken na het verschijnen van de preview van cloudsessies in Claude Code publiceert Anthropic op claude.dev een praktijkgids van Addy Osmani. Elke taak draait op een nieuwe virtuele machine met ongeveer 4 vCPU, 16 GB RAM en 30 GB schijfruimte, waarbij de repository op een nieuwe branch is gekloond, zonder extra rekenkosten bij de Pro-, Max-, Team- en Enterprise-abonnementen. De gids beschrijft zeven toepassingen: een lijst met openstaande taken (backlog) parallel afwerken, de werking van een fix laten aantonen met herhaalde uitvoeringen, lokaal plannen en vervolgens de sessie hervatten met claude --teleport, de voortgang volgen vanaf de telefoon, CI-fouten en reviewcommentaar aan Auto-fix toevertrouwen, routines starten en onveilige code uitvoeren in een wegwerp-VM. In zijn demonstratie waren alle drie de sessies 87 seconden na de eerste start klaar, en een project kan tot 200 nieuwe threads (threads) per dag starten. De gids licht ook de koppeling met GitHub toe: inloggen met GitHub en de Claude GitHub-app installeren zijn twee afzonderlijke toestemmingen, en alleen de tweede geeft toegang tot privérepositories. Het bonustegoed van 100 dollar (Pro) of 250 dollar (Max) moet vóór 7 oktober om 23.59 uur PT worden aangevraagd en vervalt op 4 november.
🔗 Praktijkgids voor cloudsessies op claude.dev 🔗 De herinnering van @ClaudeDevs over het bonustegoed
Vibe CLI 2.26.0
6 oktober — Mistral brengt Vibe CLI 2.26.0 uit, zijn codeagent voor de command line, dertien dagen na 2.25.8 en zonder aankondiging op X. Met 33 toevoegingen, 23 wijzigingen en 91 bugfixes is de update omvangrijk: 72 van de 147 items betreffen de nieuwe interface die in Rust is geschreven: een assistent bij de eerste start, spraakmodus (/voice), terugkerende prompts beschreven in natuurlijke taal met /loop, het doorsturen van de sessie naar Vibe Code Web met /teleport en het commando vibe update. Vibe draait nu altijd op de Unified Harness, zijn nieuwe uitvoeringsengine, en stopt met een expliciete foutmelding als die ontbreekt, in plaats van stilzwijgend terug te vallen op de oude engine. Plugins kunnen hun eigen MCP-server meeleveren, de fallback-API-sleutel die in ~/.vibe/.env is opgeslagen is alleen nog leesbaar voor de eigenaar, en de Rust CLI stuurt zijn gebruikstelemetrie (opstarttijd, gebruikte commando’s, gedetecteerde terminal) nu naar Mistral.
🔗 Release notes van Mistral Vibe v2.26.0
De Antigravity-extensie voor VS Code 1.7.0
5 oktober — Google brengt versie 1.7.0 van de Antigravity-extensie voor Visual Studio Code uit, die de agents van Google Antigravity naar de editor van Microsoft brengt (gesprekken in een zijpaneel, inline review van diffs, interactieve plannen), vanaf VS Code 1.90. Volgens de changelog wordt de extensie sinds begin september ongeveer wekelijks bijgewerkt, maar ze was hier nog nooit besproken. Deze 1.7.0 (6 verbeteringen, 9 bugfixes) verfijnt de codereview: de beslissingen Accept en Reject kunnen met het toetsenbord ongedaan worden gemaakt en opnieuw worden toegepast, de diffeditor met weergave naast elkaar krijgt knoppen Accept All en Reject All, en automatisch opslaan (Auto Save) in VS Code kan een lopende review niet meer overschrijven of afsluiten. Onder Windows melden native notificaties dat een taak is afgerond wanneer het venster niet op de voorgrond staat, en zowel Google Cloud Workstations als Cloud Shell krijgen interactieve authenticatie. Op dezelfde dag gaat de extensie voor Visual Studio naar 1.0.261005.0 en voegt ze diagnostische logs toe aan verstuurde feedback.
🔗 Changelog van Google Antigravity
Replit en de context van alle projecten
6 oktober — Replit kondigt aan voortaan over de context van alle projecten van een gebruiker te beschikken. Vanuit een nieuw gesprek kun je vragen om een bestaand project terug te vinden, er een functie aan toe te voegen of een project als referentie voor een ander te gebruiken; Replit leest dan de relevante bestanden en voert de wijzigingen uit als achtergrondtaken (background tasks), met links om de wijzigingen na te kijken. Het gekozen voorbeeld gaat verder dan alleen code: het kleurenpalet van een « Partner Marketing Hub » toepassen op twee andere projecten van een koffiemerk. De aankondiging bestaat uit één tweet met een video, zonder blogbericht, documentatie of prijsinformatie.
🔗 De aankondiging van Replit op X
De gestapelde pull requests van GitHub worden algemeen beschikbaar
6 oktober — GitHub stelt gestapelde pull requests (stacked pull requests), sinds 30 juli in publieke preview, beschikbaar voor alle abonnementen op github.com: een grote wijziging wordt opgesplitst in kleinere pull requests, die afzonderlijk worden gereviewd en vervolgens samen worden gemerged. GitHub Enterprise Server krijgt ze in een toekomstige versie. Volgens GitHub mergen repositories die stapels gebruiken 9 % meer code dan vergelijkbare repositories, en gebruikt meer dan twee derde van de top 1 % van de repositories ze, met een verbetering van 5 % in de tijd tot de merge.
De definitieve versie maakt het mergen soepeler. Wanneer de hoofdbranch verdergaat, behoudt « Rebase stack » de goedkeuringen voor ongewijzigde code en maakt het ondertekende vervangende commits; een stapel doorloopt de mergewachtrij (merge queue) als één groep, en een stapel waarvan de basisbranch wordt verwijderd krijgt een nieuw doel in plaats van te worden gesloten. Het automatisch mergen van een volledige stapel komt « in de komende weken ». Voor gebruik vanaf de command line en door agents ondersteunt de GitHub CLI-extensie gh stack Git-worktrees.
🔗 Changelog van GitHub over gestapelde pull requests
Meertalige modellen: Tiny Aya L2-Thinker van Cohere en Falcon-OCR-Arabic van TII
Twee kleine modellen richten zich op talen die grote modellen minder goed bedienen: het ene redeneert in de taal van de gebruiker, het andere leest documenten in het Arabisch.
Tiny Aya L2-Thinker van Cohere
6 oktober — Cohere pakt de taal aan waarin modellen redeneren: als ze in het Spaans, Arabisch of Swahili een vraag krijgen, denken de meeste eerst in het Engels voordat ze antwoorden. Het onderzoeksmodel Tiny Aya L2-Thinker (3,35 miljard parameters) redeneert in meer dan 93 % van de gevallen in de taal van de prompt, over 60 talen. De aanpak draait om de samenstelling van de data: ongeveer 1,7 miljoen Engelstalige redeneervoorbeelden, gegenereerd door gpt-oss-120b, laten het model slechts 12,8 % van de tijd in de taal van de gebruiker redeneren; ongeveer 5 000 vertaalde voorbeelden per taal, voor 44 talen, brengen dat percentage naar 86,1 %, en meertalige data zonder redeneringen breiden dit gedrag uit naar andere talen. Vergeleken met zijn tweelingmodel dat in het Engels redeneert, daalt de nauwkeurigheid op vijf van de zes benchmarks met hooguit twee tot drie punten; alleen op PolyMath, met wedstrijdwiskunde, is de daling duidelijk groter, doordat een stap met reinforcement learning ontbreekt. Het model verbruikt gemiddeld minder dan 5 000 tokens voor het redeneren. Modellen en data worden op Hugging Face gepubliceerd onder de niet-commerciële licentie CC-BY-NC 4.0; het blogbericht bespreekt een arXiv-artikel van 9 september.
🔗 Onderzoeksbericht van Cohere over Tiny Aya L2-Thinker
Falcon-OCR-Arabic van TII
6 oktober — TII, het instituut uit de Verenigde Arabische Emiraten dat de Falcon-modellen ontwikkelt, presenteert op de blog van Hugging Face Falcon-OCR-Arabic, een Arabische versie van zijn tekstherkenningsmodel Falcon OCR. Het behoudt zijn 270 miljoen parameters en zijn architectuur met early fusion, en is aangepast met supervised fine-tuning op echte en synthetische Arabische documenten, gevolgd door reinforcement learning. Op een benchmark die TII zelf heeft samengesteld (11 974 echte documenten, 15 categorieën) eindigt het als tweede van de 17 vergeleken modellen, en als eerste voor officiële documenten, administratieve formulieren, kassabonnen en facturen.
| Door TII geëvalueerd model | Tekstnauwkeurigheid | Table TEDS-score |
|---|---|---|
| Gemini 3.5 Flash | 84,34 % | 51,30 % |
| Falcon-OCR-Arabic (270M) | 81,87 % | 59,95 % |
| Claude Opus 5.5 | 79,22 % | 43,98 % |
| GPT Astra | 75,02 % | 51,23 % |
| Chandra OCR 2 (beste gespecialiseerde OCR) | 61,67 % | 32,63 % |
Het blogbericht biedt alleen een testomgeving (playground): tijdens onze controle waren er geen gewichten van Falcon-OCR-Arabic zichtbaar op de Hub, en er wordt geen licentie vermeld.
🔗 Het blogbericht van TII over Falcon-OCR-Arabic
Hugging Face-bibliotheken: Diffusers 0.41.0 integreert Qwen-Image 2.1, Transformers v5.19.0 voegt EmbeddingGemma 2 toe
De twee grote modelbibliotheken van Hugging Face brengen op dezelfde dag een release uit.
Diffusers 0.41.0 en Qwen-Image 2.1
6 oktober — Diffusers 0.41.0, de bibliotheek van Hugging Face voor diffusiemodellen, integreert Qwen-Image 2.1, het model van Alibaba dat beeldgeneratie en beeldbewerking combineert: het kan nu rechtstreeks worden gebruikt om beelden te genereren, te bewerken, beelden met een transparante achtergrond te maken (native RGBA-output) en LoRA’s te trainen, met een component voor visuele generatie van 7 miljard parameters. Het team verandert ook het releasetempo: net als Transformers zal Diffusers zijn minor releases voortaan afstemmen op de komst van nieuwe modellen, terwijl patch releases voorbehouden blijven aan bugfixes. Laden met tensorparallellisme stelt elke GPU in staat alleen zijn eigen deel van de gewichten te lezen, en de versie voegt de LTX-2.5 DFR-pipelines en optimalisaties voor Cosmos 3 toe. Daar staat tegenover dat ONNX-ondersteuning deprecated is ten gunste van Optimum.
🔗 Release notes van Diffusers 0.41.0
Transformers v5.19.0
6 oktober — Zes dagen na v5.18.0 voegt Transformers v5.19.0 het eerder besproken EmbeddingGemma 2 toe, met zijn inkortbare vectoren en vision- en audio-encoders die bij het laden kunnen worden uitgeschakeld. Bij gedistribueerde training krijgt expertparallellisme tokenverdeling (token dispatch), standaard ingeschakeld voor Qwen3 MoE en Mellum: de omvang ervan hoeft niet meer gelijk te zijn aan die van tensorparallellisme, en de Trainer werkt met deze modus. De cache kan nu per laag worden ingesteld, wat nuttig is voor heterogene modellen, en continue batchverwerking (continuous batching) ondersteunt XPU. De versie bevat zes breaking changes, waaronder het teruggeven van routerlogits voor alle MoE en het geleidelijk afschaffen van het prefix paged|.
🔗 Release notes van Transformers v5.19.0
Spraakagents: ElevenLabs lanceert ElevenAgents Architect in Alpha
6 oktober — ElevenLabs integreert in ElevenAgents, zijn platform voor gespreksagents, een expert met de naam Architect, die teams helpt hun spraak- of tekstagents te bouwen en te verbeteren door met hem te praten of hem te schrijven. Hij kent alle instellingen van ElevenAgents (kennisbank, prompts, flows, stemmen, guardrails, tools, simulaties) en hun onderlinge wisselwerking. Je kunt hem een vraag, een mislukte test, een stijging van het aantal overdrachten naar een mens of een bevinding van ElevenAgents Spotlight voorleggen: hij analyseert de transcripten, achterhaalt de oorzaak, stelt een wijziging voor en schrijft de simulaties die deze valideren. Hij bouwt ook een agent op basis van een eenvoudige beschrijving. Elke wijziging wordt aangeleverd als een concept met versiebeheer dat kan worden teruggedraaid, en er gaat niets in productie zonder goedkeuring. Architect is toegankelijk vanuit het product, maar ook vanuit Claude, Claude Code, ChatGPT, Cursor en Grok Bot. Hij is nu beschikbaar in Alpha, zonder vermelde tarieven of resultaatcijfers.
🔗 Blogbericht van ElevenLabs over ElevenAgents Architect
Generatieve video: FLUX 3 bovenaan Physics-IQ Verified volgens Black Forest Labs
6 oktober — Black Forest Labs claimt de eerste plaats op Physics-IQ, de benchmark van Google DeepMind die meet hoe goed videomodellen de fysieke wereld begrijpen: het model krijgt het begin van een gefilmd experiment uit de echte wereld te zien en moet het vervolg voorspellen (vloeistoffen, optica, mechanica van vaste stoffen). Het referentieklassement, Physics-IQ Verified, wordt bijgehouden door Anates Labs. In het onderdeel video naar video ligt FLUX 3 [large] duidelijk voor op Cosmos3 van NVIDIA, tegen hogere kosten per video.
| Model en methode (video naar video) | Physics-IQ Verified-score | Kosten per genormaliseerde video |
|---|---|---|
| FLUX 3 [large], beste van 8 generaties | 64,35 % | 16,43 dollars |
| FLUX 3 [large] | 61,11 % | 2,08 dollars |
| Cosmos3 Super (NVIDIA) | 50,80 % | 0,82 dollar |
| Cosmos3 Nano (NVIDIA) | 43,00 % | 0,82 dollar |
In het onderdeel afbeelding naar video haalt FLUX 3 [large] ook Physis-Lang in, de methode die NVIDIA op 29 september bovenaan plaatste. FLUX 3 [large] is een propriëtair model, en de thread vermeldt geen beschikbaarheidsdatum of prijs voor deze variant.
🔗 De thread van @bfl_ai op X 🔗 Physics-IQ Verified-klassement
Openbare evaluaties: GeoGuess Bench en RSI Arena
Twee evaluaties die voor het publiek toegankelijk zijn, wijken af van de gebruikelijke benchmarks: de ene laat modellen GeoGuessr spelen, de andere laat het publiek stemmen op modellen die door agents zijn getraind.
GeoGuess Bench
6 oktober — Hassan, verantwoordelijk voor de developer experience bij Together AI, publiceert GeoGuess Bench, een persoonlijke benchmark die modellen GeoGuessr laat spelen: elk model ziet dezelfde 210 straatfoto’s en plaatst een pin die volgens de formule van het spel wordt beoordeeld, met maximaal 25 000 punten per spel van vijf rondes. Claude Opus 5.5 neemt de leiding, vlak voor Claude Fable 5.1; de verrassing komt van Muse Glimmer 30B, het model met open weights van Meta, dat derde staat en GPT-6 Astra verslaat tegen ongeveer 45 keer lagere kosten per spel.
| Positie op GeoGuess Bench | Geëvalueerd model | Score op 25 000 | Kosten per spel |
|---|---|---|---|
| 1 | Claude Opus 5.5 | 23 412 | 0,064 dollar |
| 2 | Claude Fable 5.1 | 23 307 | 0,115 dollar |
| 3 | Muse Glimmer 30B (open) | 22 407 | 0,0049 dollar |
| 4 | GPT-6 Astra | 21 562 | 0,223 dollar |
| 5 | GPT-6.1 Sol | 21 194 | 0,042 dollar |
| 6 | GLM-5.3 Flash (open) | 21 183 | 0,0087 dollar |
GLM-5.3 Flash presteert daarmee even goed als GPT-6.1 Sol tegen ongeveer vijf keer lagere kosten. Het gaat om een persoonlijk project van een medewerker van Together AI, een aanbieder van inference voor open modellen, en niet om een evaluatie van het bedrijf; er staat geen Gemini-model tussen, en de code is gepubliceerd op GitHub.
🔗 Hassans aankondiging op X 🔗 GeoGuess Bench
RSI Arena
6 oktober — Zichen Chen kondigt een nieuwe ronde van RSI Arena aan (voor recursieve zelfverbetering, recursive self-improvement), ditmaal met Hugging Face. AI-agents kregen GPU’s en één opdracht: betere modellen trainen. Ze kozen zelf de data, schreven de code en voerden de experimenten uit. Nu de eerste trainingsronde is afgerond, wordt het publiek bij het proces betrokken: de modellen nemen het in duels tegen elkaar op, iedereen stemt, en de agents gebruiken die feedback voor nieuwe experimenten. De Inference Endpoints van Hugging Face stellen elk model live beschikbaar, en de site vermeldt tien agents, waaronder GPT-6 Astra, Grok 4.7, DeepSeek V4.1 Flash, GLM-5.3 en Muse Spark 1.3; het dashboard toonde 286,60 dollar aan API-uitgaven van de beschikbare 300 en 755,17 GPU-uren van de beschikbare 1 000. Het team belooft elk door de agents getraind model op de Hub te publiceren en aan het einde van het experiment alle artefacten: data, code en het volledige onderzoekstraject van elke agent.
🔗 De aankondiging van Zichen Chen op X 🔗 RSI Arena
GPU-infrastructuur: NVIDIA publiceert AICR v1.0
6 oktober — NVIDIA publiceert versie 1.0 van AI Cluster Runtime (AICR), een open project dat een einde wil maken aan het op de tast configureren van Kubernetes GPU-clusters. Een versneld cluster is afhankelijk van tientallen componenten met onafhankelijke versies (kernel, drivers, containeromgevingen, netwerk, opslag, operators, bibliotheken), en een combinatie die op de ene plek werkt, kan elders ongemerkt falen. AICR biedt daarvoor gevalideerde configuratierecepten met vastgelegde versies, uitgewerkt voor Helm, Argo CD, Flux of Helmfile en voorzien van ondertekende validatiebewijzen voor de geteste hardware. Versie 1.0 legt een compatibiliteitscontract vast: de CLI, de REST API, de Go SDK, de structuur van de deploymentpakketten en de artefactschema’s worden stabiele interfaces, en elke brekende wijziging vereist een nieuwe hoofdversie. NVIDIA meldt meer dan 100 bijdragers, van wie bijna de helft van buiten het bedrijf komt, en noemt integraties bij Pulumi Labs en in de multiclusterbeheerder k0rdent van Mirantis.
🔗 Bericht op het technische blog van NVIDIA
Claude Startups: tot 7 000 dollar aan producten en credits, en een Startup Stack van 45 000 dollar
6 oktober — Anthropic stelt Claude Startups, zijn programma voor oprichters die op Claude bouwen, breder open voor startups die minder dan vijf jaar geleden zijn opgericht of in de afgelopen twee jaar financiering hebben ontvangen.
| Programmavoordeel | Door Anthropic aangekondigde waarde |
|---|---|
| Eén jaar Claude Team, tot vijf Premium-plaatsen | 6 000 dollars (vijf plaatsen à 100 dollars per maand) |
| Eenmalig API-credit, beschikbaar na goedkeuring | 1 000 dollars |
| Totaal aan Claude-producten en credits | tot 7 000 dollars |
| Claude Startup Stack (partneraanbiedingen) | tot 45 000 dollars |
Het jaar Claude Team geldt voor bedrijven die nieuw zijn op Team, en de werkelijke waarde hangt af van het aantal en het type plaatsen. De Claude Startup Stack, die vandaag is toegevoegd, bundelt kortingen en credits van bedrijven die met Claude bouwen, waaronder Linear, Lovable, ElevenLabs, Granola en Hex; het maximumbedrag komt overeen met de totale waarde van alle aanbiedingen tegen de catalogusprijzen van september 2026, en deze aanbiedingen zijn niet allemaal te combineren. Het programma voegt ook gespreksmomenten met het Applied AI-team van Anthropic toe, hulp bij het publiceren van een vermelding op de Claude Marketplace en toegang tot evenementen.
🔗 Bericht van Anthropic over Claude Startups 🔗 De thread van @claudeai over de Claude Startup Stack
Korte berichten
- Claude Projects en een lokale map — Dan Fein van Anthropic kondigt aan dat cloudsessies van Claude Projects verbinding kunnen maken met een goedgekeurde map op de computer, die ze alleen benaderen wanneer een taak dat nodig heeft; de uitrol verloopt geleidelijk sinds 5 oktober, en volgens Boris Cherny is het team bijna zover (Bijna zover). 🔗 bron · 🔗 Boris Cherny
- Claude in Slack-groepsberichten — Claude kan nu net als elke andere deelnemer worden toegevoegd aan groepsberichten (group DMs) in Slack; hij antwoordt in een thread die hij blijft volgen en kan de persoonlijke connectors gebruiken van degene die hem aanspreekt, zonder nadere informatie over abonnementen of de planning. 🔗 bron
- Boris Cherny en zijn manier van prompten — Boris Cherny laat Opus 5.5 een interactieve begeleidende site bouwen voor een aflevering van de podcast Acquired over Home Depot, inclusief aquarellen; volgens hem is er geen geheim voor prompten: vertel het model wat je wilt, hoeveel moeite het eraan moet besteden en hoe het het resultaat moet controleren. 🔗 begeleidende site · 🔗 zijn manier van prompten
- Atlassian en OpenAI — Volgens een nieuwe overeenkomst zullen de frontiermodellen uit de GPT-6-familie, waaronder GPT-6 Astra, de agents van het Atlassian-platform en Rovo aandrijven; meer dan 3 000 ontwikkelaars van Atlassian gebruiken Codex al, en verdergaande Jira-integraties worden onderzocht, zonder dat een bedrag is bekendgemaakt. 🔗 bron
- Codex-widgets in ChatGPT voor iOS — Versie 1.2026.267 van ChatGPT voor iOS, van 2 oktober, voegt widgets voor het beginscherm toe voor recente Codex-taken op geselecteerde computers, andere widgets voor het resterende gebruik en de reset daarvan, ook op het vergrendelscherm, en een instelling die het toetsenbord openhoudt. 🔗 bron
- Gemini CLI v0.63.0 en v0.64.0-preview.0 — De stabiele v0.63.0 neemt de 15 vermeldingen van de previewversie van 29 september ongewijzigd over, en de previewversie v0.64.0-preview.0 bundelt de 16 vermeldingen uit de nightly-versies van 30 september tot en met 3 oktober: geen nieuwe inhoud, en de nightly-versie van 6 oktober is leeg. 🔗 bron
- Python SDK van Mistral 3.1.0 — Deze versie, die automatisch uit de API is gegenereerd, voegt in bèta veertien evaluatiebewerkingen toe onder de observability-module; de methoden
Runsworden verplaatst naarWorkflows.runs, wat bestaande code kan breken ondanks slechts een wijziging van de minor-versie. 🔗 bron - Qwen Code v0.25.1-preview.0 — Een dag na v0.25.0 brengt deze previewversie 13 functies en 27 fixes, waaronder een experimentele Kubernetes-runtime, Shell-commando’s en monitoring op de achtergrond voor de Managed Agent, en MCP-regels die een server met dezelfde naam niet langer toestaan. 🔗 bron
- TypeScript SDK van SpaceXAI 0.2.2 — Deze versie, die op 5 oktober zonder aankondiging is gepubliceerd, bevat slechts één wijziging: de optie
retryBeforeOutputgeldt ook voor een aanroep vancreate()zonder doorlopende gegevensstroom (streaming) die JSON verwacht. 🔗 bron - Falcon-Emirati-7B, het Emiratische dialect — TII specialiseert Falcon-H1-Arabic 7B in Emiratisch Arabisch: 84,83 % op Alyah, een benchmark met 1 173 vragen, en een dialectgetrouwheid van 0,52 tegenover hoogstens 0,05 voor ALLaM, Gemma 3 27B, Jais-2 en Fanar-2, volgens Gemini 3.7 Flash als beoordelaar; het model wordt alleen aangeboden op het chatplatform van TII. 🔗 bron
- Datasets 5.1.0 — De datasetbibliotheek, die op 5 oktober is gepubliceerd, leest nu Harbor-omgevingen voor reinforcement learning, het kolomgeoriënteerde formaat Vortex en vijf biologische formaten (FASTA, FASTQ, GenBank, PDB, mmCIF), en verhelpt een kwetsbaarheid waardoor een archief naar een naastgelegen directory kon schrijven. 🔗 bron
- TRL v1.14.2 — Deze patch verhelpt een ongemerkt verstoorde training: zonder vLLM stopten GRPO, RLOO en Distillation bij modellen zoals Gemma of Phi-3.5 niet aan het einde van de beurt en leerden ze alle daaropvolgende tekst tot de maximale lengte; ook drie crashes zijn verholpen. 🔗 bron
- Jev tegen campagnemails — In een communitybericht sorteert Stephen Solka zijn politieke e-mails met Jev (99 juiste antwoorden op 100 echte e-mails, één foutpositief), en vervolgens met een SetFit-classifier met 22,6 miljoen parameters die op een processor draait: 98 % op de proefevaluatie, maar 18 van de 23 bij moeilijke gevallen. 🔗 bron
- Open Together op 16 oktober — vLLM en Hugging Face organiseren Open Together, een bijeenkomst van open source-ontwikkelaars die op vrijdag 16 oktober in San Francisco de Open Source AI Week opent; volgens Jeff Boudier staan 150 mensen op de wachtlijst en is de capaciteit verdubbeld. 🔗 bron · 🔗 Jeff Boudier
- Copilot CLI 1.0.93-2 — Deze previewversie voegt een bedrijfsinstelling toe,
permissions.limitTo, die netwerkverzoeken beperkt tot beheerde domeinen, geeft GPT-6.1 Sol, GPT-6 Astra en Luna en de Claude 5.5-modellen een prominente plek in de modelkiezer, en leest gebruikersinstellingen voortaan alleen uit~/.copilot/settings.json. 🔗 bron - AI Scan in het beveiligingsoverzicht — Organisatie- en bedrijfsbeheerders zien nu in het beveiligingsoverzicht (security overview) van GitHub welke repositories AI-analyse van pull requests (AI Scan for pull requests) hebben ingeschakeld, met twee filters en een kolom in de CSV-export. 🔗 bron
- Detectie van secrets: Lovable, Pydantic en Supabase — De detectie van secrets (secret scanning) van GitHub herkent vijf nieuwe soorten secrets, waaronder de API-sleutel van Lovable, de Logfire-token en de sleutel van de Pydantic AI Gateway, evenals twee Supabase-tokens; Lovable Labs sluit zich ook aan bij het partnerprogramma. 🔗 bron
- Release notes van Devin van 5 oktober — Vooral verfijningen: een Terminal-tabblad in de werkruimte van de sessie (Files of Terminal openen maakt Devin wakker), inspanningsniveaus voor Devin Review die via triggeracties kunnen worden ingesteld, en codeanalyses (code scans) die op basis van een ID kunnen worden opgehaald via de API v3 of de MCP van Devin. 🔗 bron
- Delta en zijn eigen worktrees — Op het blog van Delta legt Conrad Irwin uit waarom de tool Git-worktrees vervangt: elke thread heeft een worktree die in DeltaDB is opgeslagen en tussen mensen, agents en machines wordt gerepliceerd, meerdere agents werken op dezelfde branch, en een script
.agents/prepareonder versiebeheer bereidt elke checkout voor; een bericht zonder nieuwe release. 🔗 bron - v0: persoonlijke accounts worden teamwerkruimtes — Persoonlijke accounts van v0 worden teamwerkruimtes, waarbij gesprekken, projecten en instellingen automatisch worden gemigreerd; de documentatie reserveert bepaalde functies, zoals teamsjablonen, echter voor de abonnementen Plus, Business en Enterprise. 🔗 bron
- v0 en het ChatGPT-abonnement op iOS — Het ChatGPT-abonnement, dat v0 sinds 29 september accepteert, is nu bruikbaar in zijn iOS-app, zonder prijs of verdere details. 🔗 bron
- Eleven v4 en Eleven v4 Turbo bovenaan — ElevenLabs kondigt aan dat zijn twee modellen voor spraaksynthese, die op 28 september zijn gelanceerd, de eerste twee plaatsen innemen in het klassement voor spraaksynthese (text to speech) van Artificial Analysis; v4 stond bij de lancering al op de eerste plaats. 🔗 bron
- HeyGen Video in 2K — Een week na de lancering gaat HeyGen Video naar een resolutie van 2K; volgens HeyGen staat het op basis van gebruik bovenaan het videoklassement van OpenRouter, zonder aparte prijs voor 2K, terwijl de cataloguspagina nog steeds 0,01 dollar per seconde tot eind oktober vermeldt. 🔗 bron
- Nano Banana 2.1 op Pika — Pika voegt Nano Banana 2.1, de nieuwe versie van Googles Nano Banana-model, toe aan zijn platform en zijn Pika API Club, met volgens Pika een betere beeldkwaliteit en meer snelheid; er wordt geen prijs of kostprijs in credits vermeld. 🔗 bron
- DOCA GPUNetIO — NVIDIA maakt DOCA GPUNetIO tot de gemeenschappelijke implementatie van het door de GPU aangestuurde netwerk (GDA-KI) voor NCCL, NVSHMEM en NIXL/UCX, als volledige versie in de DOCA SDK en als lichter open source-project gericht op RDMA Verbs. 🔗 bron
- Green contexts van CUDA — Een technisch bericht van NVIDIA laat zien hoe je SM’s voor een kritieke taak reserveert: op een Blackwell GPU met 148 SM reageert een kernel die 8 SM toegewezen krijgt in 0,007 ms, tegenover 0,140 ms met een stream (stream) met prioriteit en 3,727 ms zonder prioriteit. 🔗 bron
- Open modellen bij telecomoperators — In een opiniestuk verwijst NVIDIA naar zijn telecomonderzoek uit 2026, waarin 89 % van de respondenten open source belangrijk vindt, en naar de ervaringen van SoftBank, AT&T en Indosat; geen nieuw product. 🔗 bron
- Perplexity-gids voor samenwerkingstools — Perplexity vergelijkt tien samenwerkingstools met IA (Slack, Loom, Confluence, Airtable, Notion, ClickUp, Asana, Monday.com, Trello, Miro), hun IA-functies en de abonnementen waarin die zijn inbegrepen; geen productnieuws. 🔗 bron
Wat dit betekent
Beslismodellen worden een volwaardige categorie, met een eigen prijzenoorlog en ranglijst. Op dezelfde dag stelt OpenAI het tarief voor zijn Decisions API vast op 0,10 dollar per miljoen tokens als invoer, en verlaagt Perplexity zijn tarief naar 0,02 dollar, de helft van vijf dagen geleden; geen van beide brengt de uitvoer in rekening. Deze modellen schrijven geen teksten, ze kiezen of beoordelen: je betaalt voor wat ze lezen en wilt dat ze snel zijn, waarbij OpenAI antwoorden belooft die ongeveer tien keer sneller zijn dan met zijn Responses API. De Decision Index 0.3 fungeert als scheidsrechter voor de community, en de nieuwe besloten helft ervan is bedoeld om vaardigheden te meten in plaats van prestaties op bekende benchmarks. Het oordeel weegt al mee in de communicatie van de aanbieders: Perplexity verwijst ernaar in zijn aankondiging, hoewel de modelkaart een andere score vermeldt dan de ranglijst.
IA krijgt een plek in kantoortools in plaats van andersom. Claude komt na Excel, PowerPoint en Word naar Google Docs, Sheets en Slides, wordt toegevoegd aan groepsberichten in Slack, en de GPT-6-modellen gaan de agents van Rovo bij Atlassian aandrijven. Bij deze integraties draait het niet meer alleen om de kwaliteit van het model, maar ook om controle: een modus waarin elke wijziging moet worden goedgekeurd, connectors die de deelrechten van Google volgen, Enterprise-controles die op de module worden toegepast. Dezelfde logica is terug te zien in de agenttools van vandaag, van terug te draaien reviewbeslissingen in Antigravity tot concepten met versiebeheer in ElevenAgents Architect.
Bij cybersecurity hangt de mate van toegang af van de verificatie. Het CVP van Anthropic verandert het model niet, maar wel de veiligheidsmaatregelen: op CyScenarioBench gaat dezelfde Opus 5.5 van taken die zonder verificatie al bij de eerste prompt worden geblokkeerd naar 34 geslaagde taken van de 50 met Red Team Access. Mistral voert een ander argument aan: een model dat geen verzoeken weigert. Het claimt 82 % op een cybertest die Claude Opus 5.5 en GPT-6 Astra volgens Mistral weigeren af te leggen. De twee benaderingen komen op één punt samen: de ruimste toegang tot cybercapaciteiten loopt eerst via geverifieerde professionals, partners van Mistral vóór de publicatie van de gewichten of deelnemers aan het programma van Anthropic.
De modellen groeien ook aan beide uiteinden van het groottespectrum. Aan de bovenkant staat Mistral Large 4 met zijn 1 000 miljard parameters, waarvan de publicatie van de gewichten voor eind oktober is toegezegd; aan de onderkant staan EmbeddingGemma 2, dat op een telefoon in ongeveer 567 MB RAM past, Tiny Aya L2-Thinker met zijn 3,35 miljard parameters, of Falcon-OCR-Arabic met zijn 270 miljoen, voorlopig alleen als demonstratie. Veel cijfers van vandaag zijn echter door de aanbieder zelf gemeten: de scores van Mistral, de eerste plaats die Black Forest Labs claimt, de eigen benchmark van TII, de modelkaart van Perplexity, de taken van Ironclad die OpenAI beoordeelde of de door GitHub aangekondigde winst bij het mergen. Dat is vaak de enige beschikbare meting op de dag van een aankondiging; toetsing aan onafhankelijke evaluaties zal die betrouwbaarder maken, en dat is precies wat de gewichten van Mistral Large 4 mogelijk zullen maken zodra ze zijn gepubliceerd.
Bronnen
- Blogbericht van Mistral over Mistral Large 4
- Informatie over Mistral Large 4 in de documentatie
- Blogbericht van Anthropic over Claude for Google Workspace
- @claudeai op X, Claude for Google Workspace
- Blogbericht van Anthropic over het Cyber Verification Program
- Helppagina van het Cyber Verification Program
- Comcast en Booz Allen met Claude Mythos
- EmbeddingGemma 2 op het Google-blog
- Modelkaart van EmbeddingGemma 2
- @GoogleDeepMind op X, EmbeddingGemma 2
- EmbeddingGemma 2 op Hugging Face
- Gids voor de Decisions API van OpenAI
- Changelog van de OpenAI API
- @perplexitydevs op X, pplx-decider-v1.1-27b
- pplx-decider-v1.1-27b op Hugging Face
- @multimodalart op X, Decision Index 0.3
- De Decision Index 0.3
- Blogbericht van OpenAI over zijn samenwerking met Ironclad
- @OpenAIDevs op X, gebruiksniveaus
- Documentatie over de rate limits van de OpenAI API
- Helpartikel van OpenAI over de BAA voor de API
- Changelog van de Perplexity API
- Documentatie van de image_search-tool van Perplexity
- Informatie over GLM 5.3 op Amazon Bedrock
- @Zai_org op X, GLM-5.3 op Bedrock
- Claude Code 2.1.290
- Claude Code 2.1.291
- Claude Code 2.1.292
- Praktijkgids voor cloudsessies op claude.dev
- @ClaudeDevs op X, bonuskrediet voor cloudsessies
- Release notes van Mistral Vibe v2.26.0
- Changelog van Google Antigravity
- @Replit op X, context van alle projecten
- Changelog van GitHub over gestapelde pull requests
- Onderzoeksbericht van Cohere over Tiny Aya L2-Thinker
- Het blogbericht van TII over Falcon-OCR-Arabic
- Release notes van Diffusers 0.41.0
- Release notes van Transformers v5.19.0
- Blogbericht van ElevenLabs over ElevenAgents Architect
- @bfl_ai op X, FLUX 3 en Physics-IQ
- Ranglijst Physics-IQ Verified
- @nutlope op X, GeoGuess Bench
- GeoGuess Bench
- @my_cat_can_code op X, RSI Arena
- RSI Arena
- AICR v1.0 op het technische blog van NVIDIA
- Blogbericht van Anthropic over Claude Startups
- @claudeai op X, Claude Startup Stack
- Dan Fein op X, Claude Projects en een lokale map
- Boris Cherny op X, geleidelijke uitrol van Claude Projects
- Dan Fein op X, Claude in groepsberichten in Slack
- Boris Cherny op X, bijbehorende website van Acquired
- Boris Cherny op X, zijn manier om Claude te prompten
- Atlassian en OpenAI breiden hun partnerschap uit
- Changelog van ChatGPT en Codex, ChatGPT voor iOS 1.2026.267
- Gemini CLI v0.63.0
- Python SDK van Mistral v3.1.0
- Qwen Code v0.25.1-preview.0
- TypeScript SDK van SpaceXAI v0.2.2
- Het blogbericht van TII over Falcon-Emirati
- Datasets 5.1.0
- TRL v1.14.2
- Het blogbericht van Stephen Solka
- @vllm_project op X, Open Together
- Jeff Boudier op X, wachtlijst voor Open Together
- Copilot CLI 1.0.93-2
- Changelog van GitHub over de activeringsstatus van AI Scan
- Changelog van GitHub over de nieuwe detectors voor secrets
- Release notes van Devin van 5 oktober
- Bericht van Conrad Irwin op het blog van Delta
- Changelog van v0, persoonlijke accounts omzetten naar teamwerkruimten
- @v0 op X, ChatGPT-abonnement op iOS
- @ElevenLabs op X, Eleven v4 aan kop
- @HeyGenDev op X, HeyGen Video in 2K
- @pika_labs op X, Nano Banana 2.1 op Pika
- DOCA GPUNetIO op het technische blog van NVIDIA
- Green contexts op het technische blog van NVIDIA
- Open modellen en telecomoperators, NVIDIA-blog
- Perplexity-gids voor samenwerkingstools