ai-powered-markdown-translatorArtikel vertaald van het Frans naar het Nederlands met gpt-6.1-sol.
OpenAI voegt de komende weken een onzichtbaar watermerk toe aan de tekst van ChatGPT en Codex voor zijn gebruikers in de Europese Unie, als antwoord op de AI Act, die vereist dat gegenereerde tekst voor machines herkenbaar is, en stelt dit watermerk vanaf vandaag als optie beschikbaar voor klanten van zijn API wereldwijd. Bij agents doet geheugen zijn intrede: Cognition geeft Devin een geheugen dat tussen sessies behouden blijft en publiceert het formaat als open standaard, en Cohere lanceert North 2 met een geheugen dat de context van de ene sessie naar de volgende bewaart; GitHub publiceert op zijn beurt ReviewBench, een open benchmark voor codereview door AI. Bij de open modellen presenteert Reflection AI Beam, met 501 miljard parameters, waarvan de gewichten later in oktober worden beloofd.
Onzichtbaar watermerk van OpenAI: de tekst van ChatGPT en Codex gemarkeerd in de Europese Unie, een wereldwijde optie in de API
5 oktober โ OpenAI publiceert zijn antwoord op de Europese regels voor de herkomst van tekst. De AI Act verplicht aanbieders van generatieve AI om de tekst die ze produceren op een machinaal leesbare manier herkenbaar te maken; OpenAI reageert daarop stapsgewijs en waarschuwt meteen dat de huidige technologieรซn voor tekstwatermerken belangrijke beperkingen hebben (aanzienlijke beperkingen).
| Doelgroep | Wat er verandert | Aangekondigde planning |
|---|---|---|
| Gebruikers van ChatGPT en Codex in de Europese Unie, alle abonnementen | Onzichtbaar watermerk toegevoegd aan tekst die daarvoor in aanmerking komt | In de komende weken |
| API-klanten, wereldwijd | Optioneel watermerk (opt-in) op geselecteerde, niet genoemde modellen, standaard uitgeschakeld | Vanaf 5 oktober |
| Goedgekeurde onderzoekers en deskundige organisaties | Toegang tot de detector, per geval beoordeeld, op aanvraag | Aanmeldingen geopend op 5 oktober |
OpenAI maakt er wereldwijd geen standaardinstelling van en werkt met cloudpartners om de komende weken hetzelfde watermerk aan te bieden op de OpenAI-modellen die zij beschikbaar stellen. De technologie, textGrain, voegt een onzichtbaar statistisch signaal toe aan de woordkeuzes van het model, zonder zichtbare markering of speciale tekens; volgens OpenAI evenaart of overtreft ze de andere geteste benaderingen, waaronder SynthID voor tekst. Er is een technisch rapport gepubliceerd en OpenAI is van plan de code openbaar te maken. De detector is bij de lancering niet openbaar vanwege het risico op gemiste watermerken en foutpositieven: de toegang volgt de gedragscode (Code of Practice) van de Europese Commissie.
De gepubliceerde cijfers tonen vooral de beperkingen van de detectie:
| Meetomstandigheden | Gepubliceerd detectiepercentage |
|---|---|
| Passages van 200 tokens, inhoud op het gebied van psychologie, 1 % foutpositieven als doel | ongeveer 80 % |
| Passages van 400 tokens, inhoud op het gebied van psychologie, 1 % foutpositieven als doel | ongeveer 95 % |
| Inhoud op het gebied van wiskunde, dezelfde drempel van 1 % | aanzienlijk lager (waarde alleen in een grafiek weergegeven) |
| Passages van 400 tokens in het Engels (ELI5-dataset), onbewerkt | ongeveer 92 % |
| Dezelfde passages, 10 % van de woorden vervangen door synoniemen | 66 % |
| Dezelfde passages, 25 % van de woorden vervangen | 17 % |
Watermarks have limits. Theyโre often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.
๐ณ๐ฑ Watermerken hebben beperkingen. Ze zijn vaak niet te detecteren, vooral in korte passages. Het herschrijven of vertalen van een tekst kan het watermerk volledig verwijderen. โ @OpenAI op X
Wat de kwaliteit betreft, meet OpenAI geen significant verschil op acht benchmarks van GPT-6 Astra zonder en met watermerk (94,44 % tegenover 93,94 % op GPQA Diamond, 53,90 % tegenover 56,06 % op Terminal-Bench 4.0). Het blogbericht verduidelijkt ook wat een watermerk niet vertelt: noch het aandeel van menselijk werk, noch het eigendom van of de verantwoordelijkheid voor de tekst, noch de identiteit van de gebruiker, noch de juistheid; en de afwezigheid ervan bewijst niet dat een mens de tekst heeft geschreven. Voor afbeeldingen en audio verandert er niets: openai.com/verify en de Content Provenance API blijven toegankelijk voor organisaties, en sinds 19 mei wordt SynthID toegevoegd aan de C2PA-metadata van gegenereerde afbeeldingen.
๐ Blogbericht van OpenAI over de herkomst van tekst in de EU
Code-agents: Devin onthoudt informatie tussen sessies, Cursor, Qwen Code, Together Link en IBM Bob
5 oktober โ Cognition introduceert in Devin twee samenhangende functies: Memory, een geheugen dat van de ene sessie naar de volgende behouden blijft, en Dreaming, een dagelijkse ยซ droom ยป die het reorganiseert. Memory bewaart wat de agent leert tijdens het werken met elke gebruiker: voorkeuren, correcties, lessen uit een project of workflow. Het zijn geen samenvattingen van sessies, maar korte notities, elk gekoppeld aan de sessie waarin de les is geleerd, en dit geheugen blijft persoonlijk: het wordt geen gedeelde instructie voor de hele organisatie.
De notities staan in de Memory Drive, een blijvende Git-repository met Markdown-bestanden, geordend op repository, project of thema. Een bewust kort gehouden bestand MEMORY.md bundelt de algemene voorkeuren en de index van de rest: Devin ontvangt het aan het begin van elke sessie en haalt vervolgens nuttige notities op met de tools waarmee code wordt doorzocht, zonder het hele archief in zijn prompt te laden. Elke sessie werkt met haar eigen Git-kopie: Devin voegt updates uit andere sessies samen, een revisiecontrole wijst verouderde schrijfbewerkingen af en conflicten worden gemeld in plaats van stilzwijgend overschreven.
Dreaming is een dagelijkse achtergrondsessie (โs nachts, verduidelijkt de berichtenreeks van Cognition): Devin leest eerdere gesprekken opnieuw in het licht van zijn geheugen, voegt overlappende notities samen, verwijdert tijdelijke details, zoekt naar lessen die nog niet waren genoteerd en verwijdert geheugennotities die door geen enkele sessie zijn gebruikt. De toegang verloopt via devin.ai, menu Customize โ Memory; het blogbericht vermeldt niets over Devin Desktop of Devin CLI en kondigt geen tarieven aan.
Cognition publiceert het formaat ook als open standaard, Agent Memory Repo, onder de MIT-licentie. De specificatie, die openstaat voor bijdragen, beschrijft de cyclus van elke sessie (het geheugen klonen, doorzoeken, bijwerken zonder menselijke tussenkomst, na elke wijziging pushen) en het combineren van meerdere geheugens in รฉรฉn sessie, elk in een eigen repository met eigen toegangsrechten en geschiedenis. Tot de genoemde toepassingen behoren teamgeheugen en zwermen van agents (agent swarms):
In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didnโt hack anyone)
๐ณ๐ฑ Tijdens de eerste experimenten zagen we een zwerm Devin-agents het geheugen gebruiken om op grote schaal samen te werken zonder dat we hun dat vroegen (beloofd, ze hebben niemand gehackt). โ @cognition op X
Een ยซ droom ยป die het geheugen van een agent reorganiseert, bestond al bij Anthropic (Claude Managed Agents, in mei) en bij OpenAI (het geheugen van ChatGPT, in juni); wat hier verandert, is een geheugen in bestanden die met Git onder versiebeheer staan, gepubliceerd als specificatie die andere agents kunnen overnemen.
๐ Memory en Dreaming, blogbericht van Cognition ๐ Specificatie van Agent Memory Repo
Cursor: agents uit zijn SDK tijdens hun uitvoering aansturen
5 oktober โ Cursor breidt zijn SDK uit, waarmee zijn agents vanuit TypeScript- of Python-code kunnen worden gestart. De methode run.steer() voegt een bericht toe aan de lopende beurt van een agent; als een subagent op dat moment bezig is, gaat die op de achtergrond verder. Subagents op de achtergrond koppelen hun resultaten ook terug: hun resultaat komt bij de bovenliggende agent terecht als een extra beurt binnen dezelfde uitvoering, in plaats van verloren te gaan wanneer de beurt van de bovenliggende agent eindigt.
| SDK-vernieuwing | Bereik volgens de changelog |
|---|---|
run.steer(), aansturing tijdens de uitvoering | Lokale agents in TypeScript; bij een cloudagent wordt het bericht als een normale vervolgopdracht verzonden |
| Terugkoppeling van resultaten van subagents op de achtergrond | Lokale agents, in TypeScript en Python |
| MCP-annotaties van aangepaste tools (readOnlyHint, destructiveHintโฆ) | TypeScript; slechts aanwijzingen, die de SDK niet afdwingt |
| Vervangbare system prompt, regels en skills blijven geladen | Lokale agents in TypeScript; toegang per account geactiveerd |
Bij deze wijzigingen worden geen tarieven vermeld.
๐ De berichtenreeks van Cursor op X ๐ Changelog van de SDK van Cursor
Qwen Code v0.25.0: agents voor werkruimtes, e-mailkanaal en Mem0-geheugen
5 oktober โ Qwen publiceert v0.25.0 van Qwen Code, zijn programmeeragent voor de command line, de eerste stabiele versie sinds v0.24.7 van 29 september: 42 functies, waarvan 23 voor de Managed Agent, 79 fixes en geen bekende breaking changes. Drie toevoegingen, die allemaal expliciet moeten worden ingeschakeld, springen eruit. Agents voor werkruimtes werken nu lokaal samen: de daemon start en hervat hun beurten, en de Web Shell maakt het mogelijk agents en taken te beheren en vanuit een gesprek een agent aan te roepen met @agent. Deze blijvende agents ondersteunen het A2A 1.0-protocol via gedeelde toegang die verloopt en kan worden ingetrokken. Tot slot kan het Mem0-geheugen rechtstreeks op de CLI worden aangesloten: een endpoint en een sleutel opgeven volstaat, Qwen Code registreert zelf de bijbehorende MCP-server. Een e-mailkanaal geeft de agent ook een eigen mailbox, via IMAP en SMTP, en Code Mode voert de Bash-aanroepen die het model bundelt parallel uit. De TypeScript-SDK v0.1.18 en de Desktop-applicatie v0.25.0 volgden dezelfde ochtend, zonder tweet van Qwen.
๐ Release notes van Qwen Code v0.25.0
Together Link: Claude Code, Codex, OpenCode en Pi op open modellen
5 oktober โ Together AI lanceert Together Link in bรจta, waarmee al geรฏnstalleerde code-agents draaien op de open modellen die het platform host. Een installatiecommando (macOS of Linux) koppelt Claude Code, Claude Desktop, Codex, OpenCode en Pi aan zijn API, met de accountsleutel; de documentatie voegt ChatGPT Desktop toe en waarschuwt dat commandoโs, routing en de modellenlijst nog kunnen veranderen. Naast de Auto-modus worden vier modellen aangeboden, allemaal met 1M tokens context:
| Aangeboden model | Equivalent in het /model-menu van Claude Code |
|---|---|
| Kimi K3 | Opus |
| GLM 5.3 | Fable |
| GLM 5.3 Flash | Sonnet |
| DeepSeek V4.1 Flash | Haiku |
De Auto-modus, die standaard is geselecteerd, kan moeilijke taken aan Opus 5.5 toewijzen wanneer de gebruiker een Anthropic-sleutel opgeeft, maar het blogbericht en de documentatie beschrijven deze routing niet op dezelfde manier: volgens het blogbericht wordt de keuze รฉรฉn keer per sessie gemaakt om de promptcache te behouden, volgens de documentatie vindt er een selectie per verzoek plaats, alleen voor Claude Code en Claude Desktop. Together AI kondigt meer dan 50 % lagere uitgaven aan, zonder gepubliceerde methode, en toont na elke sessie de kosten naast wat die sessie op Opus 5.5 zou hebben gekost.
๐ Blogbericht van Together AI ๐ Documentatie van Together Link
Zelfgehoste IBM Bob steunt op Nemotron 3 Ultra van NVIDIA
5 oktober โ IBM legt uit waarom de zelfgehoste versie (self-hosted) van Bob, zijn agentische ontwikkelassistent, steunt op Nemotron 3 Ultra van NVIDIA, naast Poolside Laguna S 2.1. Deze optie, die de week ervoor algemeen beschikbaar werd, laat de assistent op de infrastructuur van de klant draaien, tot en met volledig geรฏsoleerde omgevingen (air-gapped). Het team beoordeelde de modellen op vier criteria (hardware footprint, nauwkeurigheid bij code, latentie, openheid van de gewichten) en testte ze met de agent harness van Bob, waarbij gesloten modellen van Anthropic, OpenAI en Google als referentie dienden. Nemotron was aanvankelijk te breedsprakig en werd samen met NVIDIA aangepast: prompts, samplingparameters, redeneerinstellingen en fixes in de harness. Volgens interne tests van IBM biedt Nemotron 3 Ultra op Blackwell-GPUโs tot ongeveer 4 keer lagere latentie dan geavanceerde SaaS-modellen die via het netwerk worden aangeroepen, en houdt het zich strikt aan de toolschemaโs; Laguna S 2.1 is gekozen vanwege zijn verhouding tussen prestaties en footprint. Het blogbericht publiceert geen nauwkeurigheidsscores.
๐ Blogbericht van IBM over zelfgehoste Bob
ReviewBench: GitHub lanceert een open benchmark voor codereviews door IA
5 oktober โ GitHub lanceert ReviewBench als onderzoekspreview (research preview), een open benchmark voor IA-agents die codereviews uitvoeren. De speciale website publiceert de volledige dataset, de ranglijst, de methodologie, de prompt en de configuratie van de beoordelaar, evenals een runner voor zelfstandig gebruik. Het blogbericht is geschreven door Michelle Zhou en Alejandro Carderera de Diego, en de dankbetuigingen noemen GitHub en Microsoft als betrokkenen bij het project.
Het corpus bestaat uit 219 pull requests uit 187 openbare open source-repositoryโs, in 19 talen. De verdelingen van talen en repositorygroottes weerspiegelen die van GitHub, vastgesteld op basis van 103,9 miljoen pull requests, met een bewuste weging ten gunste van middelgrote en grote wijzigingen. De ground truth (golden set) combineert menselijke reviewers, problemen die zijn afgeleid uit vervolgcommits, deterministische analysetools en meerdere toonaangevende LLMโs; de bevindingen worden gevalideerd door een LLM-beoordelaar, volgens het blogbericht Claude Sonnet 5. Senior engineers die niet bij de samenstelling van de dataset betrokken waren, hebben elke bevinding opnieuw gelabeld: hun oordeel komt in 96,6 % van de gevallen overeen met ReviewBench. De ยซ gegronde ยป recall (grounded), uitsluitend gemeten op de ground truth, dient als belangrijkste vergelijkingsmaatstaf.
Volgens de eerste ranglijst van GitHub staat Copilot code review bovenaan:
| Geteste agent (configuratie) | Gegronde F1 | Gegronde precisie | Gegronde recall | Uitvoerdatum |
|---|---|---|---|---|
| Copilot Code Review (Balanced) | 40,1 % | 87,8 % | 26,0 % | 1 oktober 2026 |
| Devin AI | 37,0 % | 84,0 % | 23,8 % | 28 september 2026 |
| Qodo | 35,1 % | 85,3 % | 22,1 % | 28 september 2026 |
| Codex (GPT-5.6 Sol ยท Ultra) | 32,3 % | 87,0 % | 19,9 % | 19 juli 2026 |
| Cubic | 27,3 % | 85,5 % | 16,3 % | 29 juni 2026 |
| Greptile | 27,2 % | 86,1 % | 16,2 % | 16 juni 2026 |
| Cursor | 17,3 % | 87,7 % | 9,6 % | 27 september 2026 |
De website verduidelijkt dat deze eerste vermeldingen door het ReviewBench-team zijn gemaakt door het openbare product van elke leverancier op de aangegeven datum uit te voeren, en dat de leveranciers deze niet hebben uitgevoerd of gecontroleerd. Iedereen kan nu zijn agent indienen: de deelnemer levert een containerimage en een modelsleutel, GitHub levert de beoordelaar, er volgen tests op 25 pull requests en vervolgens een volledige uitvoering in drie rondes; een score wordt pas gepubliceerd na goedkeuring door een maintainer, en alleen als die de vorige score van de agent verbetert of als het de eerste vermelding van de agent is.
GitHub gebruikt het ook om Copilot code review verder te ontwikkelen. In een A/B-test leverde een review met meerdere modellen op Lite-niveau, die meerdere onafhankelijke uitvoeringen combineert, 13,6 % meer recall op bij 8,0 % lagere kosten per review, in de richting die offline was voorspeld. Het blogbericht spreekt zichzelf tegen over het aantal opmerkingen: +61 % volgens de tekst, +25,0 % volgens de grafiek.
๐ Blogbericht van GitHub over ReviewBench ๐ Website en ranglijst van ReviewBench
Cohere lanceert North 2 en sluit een wereldwijde alliantie met PwC
5 oktober โ Cohere lanceert North 2, de nieuwe versie van North, zijn platform voor IA-agents voor bedrijven, dat op 9 september als ยซ binnenkort beschikbaar ยป werd aangekondigd en vervolgens voor oktober werd toegezegd. De lanceringsthread claimt meer dan 15 nieuwe functies (15+ nieuwe functies), een aantal dat het blogbericht niet overneemt. De kern van de versie is een nieuwe uitvoeringsomgeving voor agents (agent harness), opnieuw ontworpen voor automatiseringen en agents met meerdere stappen, op een platform dat agnostisch blijft: modellen van Cohere of modellen van de klant.
| Functioneel domein | Door Cohere genoemde vernieuwingen |
|---|---|
| Agents | Herbruikbare agents en automatiseringen, gemaakt met prompts en gedeeld binnen de organisatie; orchestratie van meerdere agents; geheugen dat de context van de ene sessie naar de volgende bewaart |
| Productiviteit | Vaardigheden (Skills), bibliotheken (Libraries) en applicaties die presentaties, dashboards en documenten maken; Automations, eind juli gelanceerd, met kant-en-klare sjablonen en een visuele editor |
| Connectoren | Slack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion en GitHub; aanbieders van financiรซle gegevens (PitchBook, FactSet en andere) alleen gepland |
| Uitrol en beveiliging | Zelf gehost, VPC, hybride, op locatie of volledig zonder netwerkverbinding; SOC 2 Type 2, ISO 27001 en ISO 42001; autonomiebeleid met menselijke goedkeuring van kritieke beslissingen |
| Governance | North Admin-console, verbruiksdrempels voor verzoeken en tokens per gebruiker of groep, waarschuwingen voordat de limieten worden bereikt |
Cohere noemt twee klanten, LG CNS in Zuid-Korea en Bell Cyber in Canada, en benadrukt een hogere doorvoer van zijn modellen op NVIDIA Blackwell- en Hopper-GPUโs, zonder cijfers, met een citaat van Kari Briski, hoofd generatieve IA bij NVIDIA. Er worden geen prijzen of uitrolplanning gegeven: het blogbericht verwijst naar een demo die bij de verkoopteams moet worden geboekt.
๐ Blogbericht over de lancering van North 2 ๐ Lanceringsthread van North 2 op X
De wereldwijde alliantie met PwC, die in Canada begint
5 oktober โ Op dezelfde dag kondigen PwC en Cohere een wereldwijde alliantie (wereldwijde alliantie) aan die in Canada begint, in een persbericht van PwC Canada vanuit Toronto dat door een kort blogbericht van Cohere wordt gedeeld. De rolverdeling is duidelijk: Cohere levert North, zijn bedrijfsmodellen en zijn tools voor het zoeken naar informatie; PwC brengt zijn expertise in sectoren, regelgeving, risicobeheer en transformatie in, van de keuze van use cases tot de integratie van IA met de gegevens en systemen van het bedrijf. De aangekondigde toepassingen omvatten zoeken binnen bedrijven, toegang tot kennis, diepgaand onderzoek, beslissingsondersteuning en taakautomatisering, in een private cloud, op locatie of in een omgeving zonder netwerkverbinding, met gereguleerde sectoren als primaire doelgroep. Het persbericht citeert Domenic Marino en Annie Veillet van PwC Canada en Aidan Gomez van Cohere; het noemt geen bedrag, geen klant en geen planning voor uitbreiding buiten Canada. Cohere had op 16 september al een alliantie met OpenText gesloten.
๐ Blogbericht van Cohere over de alliantie met PwC ๐ Persbericht van PwC Canada
Open modellen: Beam, MetaEncoder-30B en Gemma 4 voor plantengenomica
Drie open modellen staan vandaag in de belangstelling, in drie verschillende stadia: het ene is toegezegd, het andere zonder aankondiging gepubliceerd, en het laatste wordt een maand na zijn publicatie onder de aandacht gebracht.
Beam: het open model van Reflection AI met 501 miljard parameters
5 oktober โ Reflection AI presenteert Beam, zijn eerste model met open weights: een sparse MoE met 501 miljard parameters, waarvan 23 miljard actief, ontworpen voor code, redeneren en agenttaken, en van begin tot eind vanaf nul getraind. De pretraining omvatte 23 800 miljard tokens; tijdens de reinforcement learning-fase werden vier weken lang 10 500 NVIDIA GB300-GPUโs ingezet en werden meer dan 100 miljoen trajecten (rollouts) geproduceerd.
Volgens de tabellen van Reflection AI:
| Geteste benchmark | Beam | Nemotron 3 Ultra | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|
| SWE-bench Verified | 80,9 | 70,7 | โ | โ | โ | โ |
| SWE Bench Pro v1 | 65,5 | 46,4 | โ | โ | 67,7 | โ |
| Terminal Bench v2.1 | 80,1 | 56,4 | 88,2 | 88,3 | 86,6 | 90,6 |
| DeepSWE v1.1 | 44,4 | โ | 61,0 | 68,0 | 51,0 | 74,2 |
Een streepje geeft een score aan die niet in het blogbericht is vermeld. Reflection AI claimt redeneerscores die vergelijkbaar zijn met die van GLM-5.2, met 3 tot 4 keer minder rekenwerk voor inference, en erkent dat Kimi K3 voorop blijft in pure capaciteit. Er is nog niets te downloaden: Beam ondergaat laatste evaluaties en adversariรซle tests (red-teaming), vroege toegang verloopt via inschrijving, en de weights, het technische rapport, de modelkaart en ontwikkelaarstools zijn toegezegd voor later in oktober.
๐ Blogbericht van Reflection AI over Beam
MetaEncoder-30B, de beslissingsencoder die Meta zonder aankondiging publiceert
5 oktober โ Meta heeft MetaEncoder-30B op Hugging Face gepubliceerd, onder zijn organisatie facebook, zonder dat we een aankondiging hebben gevonden: de repository, aangemaakt op 30 september en gewijzigd op 5 oktober, had op het moment van onze inventarisatie slechts twee downloads. De modelkaart presenteert een multimodale ยซ System One ยป-encoder, het formaat van de beslissingsmodellen van Jev: het model krijgt een taak in natuurlijke taal (vraag, instructie, beschrijving van een toestand, criteria) en een lijst kandidaten, in tekstvorm met ondersteunende afbeeldingen en videoโs, en geeft elke kandidaat een score. Omdat taak en kandidaten afzonderlijk worden gecodeerd, wordt de vergelijking beperkt tot een scalair product, en kan een nearest-neighbor-index miljoenen kandidaten omvatten zonder het model opnieuw uit te voeren. MetaEncoder is een contrastieve fine-tuning van Muse Glimmer 30B, het agentmodel met open weights dat Meta in augustus uitbracht, waarvan het de Apache 2.0-licentie erft; downloaden vereist dat de voorwaarden worden geaccepteerd, en vLLM serveert het voor tekst en afbeeldingen.
| Evaluatiebenchmark | Score volgens de modelkaart | Gebruikte metriek |
|---|---|---|
| JEVBench (origineel / eenvoudig / moeilijk) | 0,9444 / 1,0000 / 0,7387 | Nauwkeurigheid |
| ImaJEV-Bench | 0,8958 | Nauwkeurigheid |
| NanoBEIR | 0,6632 | NDCG_linear@10 |
| MMEB-V3 (afbeeldingen / videoโs / visuele documenten) | 0,7897 / 0,6046 / 0,8138 | Hit@1 / Hit@1 / NDCG@5 |
๐ Modelkaart van MetaEncoder-30B op Hugging Face
Living Models combineert Gemma 4 en BOTANIC-1 om het ADN van planten te ontcijferen
5 oktober โ Google brengt in een X Article van @GoogleAI en op zijn Gemmaverse-showcase het werk van Living Models onder de aandacht, een laboratorium voor IA-biologie gevestigd in Parijs. Gemma 4 E4B coรถrdineert daar de analyse (verwerkingspipelines in de terminal, gegevensfiltering, toolaanroepen), lokaal via Ollama op รฉรฉn NVIDIA L4-GPU, terwijl BOTANIC-1, een genomisch foundation model dat is voorgetraind op 320 plantensoorten, het effect van mutaties beoordeelt; de bedrijfseigen genomen blijven op locatie. De casestudy bouwt voort op een ontdekking die Adnane Boualem bij INRAE deed: รฉรฉn gewijzigde letter in het CmEIN3-gen van de meloen verandert de bloem van vrouwelijk in hermafrodiet. Van de 2 494 kandidaat-puntmutaties komt de gevalideerde mutatie op de eerste plaats, zonder gelijke score, in minder dan vier minuten volgens het X Article.
| Geteste configuratie (20 uitvoeringen) | Recall@1 |
|---|---|
| Zonder begeleiding | 0,00 |
| Begeleiding door een expert | 0,15 |
| Met de score van BOTANIC-1 | 0,90 |
De Botanic1-modellen (van 0,3 tot 2 miljard parameters) en de bioRxiv-preprint dateren van begin september: het nieuwe is deze aandacht van Google en de gedetailleerde resultaten.
๐ X Article van Google AI ๐ Gemmaverse-pagina van Google DeepMind
Advertenties in ChatGPT: een visueel formaat op proef en uitgebreidere metingen
5 oktober โ OpenAI bereidt een visueel advertentieformaat voor ChatGPT voor: afbeeldingen zullen inspiratie rond een product, het gebruik ervan of de ervaring die het mogelijk maakt tonen. De eerste test vindt plaats tijdens het genereren van afbeeldingen, met advertenties die duidelijk gelabeld zijn en gescheiden worden van de afbeelding die wordt gemaakt; de test begint later deze maand in de Verenigde Staten, met een eerste groep adverteerders. OpenAI herhaalt dat advertenties geen invloed hebben op de antwoorden van ChatGPT, dat volgens het bedrijf elke week 1,2 miljard mensen bereikt.
Het grootste deel van de aankondigingen gaat over metingen: het doorgeven van conversies via Hightouch, Tealium en LiveRamp, tien genoemde attributiepartners (waaronder AppsFlyer, Adjust en Triple Whale), geografische incrementaliteitsexperimenten met Haus, Measured en WorkMagic, een conversievenster van รฉรฉn dag na een impressie in de rapportages en een indicator voor de kwaliteit van signalen (Event Quality Score). Voor merkveiligheid kunnen in aanmerking komende adverteerders uitdrukkingen uitsluiten (Negative Phrases), en evaluatiepilots zijn in voorbereiding met DoubleVerify en Integral Ad Science. De pixel en de Conversions API bestaan al sinds 5 mei.
| Door OpenAI gepubliceerd resultaat | Gepubliceerde waarde | Meting uitgevoerd door |
|---|---|---|
| Kosten per acquisitie voor WeightWatchers ten opzichte van zijn benchmark voor betaalde zoekadvertenties | โ15,3 % | DV Rockerbox |
| Incrementele aankopen bij het merk Dose door nieuwe klanten | 67 % | WorkMagic |
| Bezoekers van Portland Leather afkomstig van ChatGPT Ads en nieuw voor het merk | 93 % | Triple Whale |
๐ Blogbericht van OpenAI over het nieuwe advertentieformaat ๐ Bericht op het Ads-blog over metingen
Changelog van Perplexity van 5 oktober: browserextensie voor Computer, Wiley en Stripe Projects
5 oktober โ Perplexity publiceert een productchangelog met 18 onderdelen, dat op het moment van onze inventarisatie nog niet op X was gedeeld. Acht herhalen eerder behandelde aankondigingen (Automations, Claude Opus 5.5, videogeneratie, Skills American Express, Portable Computer op AMD, Fast Search, Profiles van de Agent API, Claude Fable 5.1), een negende voegt interactieve 3D-uitleg toe aan de grafieken van 1 oktober, en negen nieuwigheden zijn nog niet eerder aan bod gekomen:
| Niet eerder behandelde nieuwigheid | Platform of versie | Doelgroep |
|---|---|---|
| Extensie voor Chrome, Edge of Brave, waarmee Computer de browser kan gebruiken (Comet blijft de standaard) | Perplexity voor Mac 26.38.0 en hoger | Niet vermeld |
| Computer-taken in afzonderlijke tabbladen en vensters | Perplexity voor Mac 26.37.1 en hoger | Niet vermeld |
| Inspanningsmodus (Light, Standard, High, Ultra) op mobiel | iOS 26.38.0 en Android 2.100.0, en hoger | Pro, Max, Enterprise Pro, Enterprise Max |
| Tijdschriften en boeken van Wiley zonder afzonderlijk Wiley-abonnement | Perplexity en Computer | Alle abonnementen, wisselende premiumquota |
| GPT-6.1 Sol, dat ook de Light-inspanning van Computer aanstuurt in plaats van GPT-6 Sol | Perplexity en Computer | Betalende abonnees die in aanmerking komen |
| Begeleid gesprek om een eerste Computer-taak te starten | Web | Nieuwe gratis accounts |
| Een applicatie verbinden vanuit het invoerveld (Een app verbinden) | Computer op het Web | Niet vermeld |
| DocSend-connector voor datarooms voor investeringen (deal rooms) | Computer | DocSend-account dat in aanmerking komt |
| Stripe Projects: Perplexity API-sleutel aangemaakt vanuit de CLI van Stripe | CLI van Stripe | Ontwikkelaars van de Perplexity API |
Met Stripe Projects maakt รฉรฉn opdracht het project aan of koppelt het, genereert de sleutel en schrijft die naar het bestand .env, een configuratie die Perplexity voorstelt aan Claude Code, Cursor of Codex toe te vertrouwen.
๐ Changelog van Perplexity van 5 oktober
Generatieve creatie: Suno Albums en HyperFrames Studio van HeyGen
Suno voegt albums toe
5 oktober โ Suno voegt albums toe, die tot nu toe op zijn platform ontbraken. Volgens het blogbericht bij de aankondiging zet de functie de beste nummers om in complete projecten (volledige projecten), en kan een afspeellijst (playlist) die als album diende voortaan worden omgezet in een Album. Suno presenteert de artiesten van vijf eerste albums: naenia (Oakwood///diskrot), Old Soul (Isaiah Wallace), phenomenal (KakerMix///diskrot), Lost In a Dream (Dream Relic) en VOID (ECHLO). Het bedrijf vermeldt niet voor welke abonnementen dit geldt, hoeveel nummers een album kan bevatten of wat de precieze datum van ingebruikname is. In juni vroeg Suno zijn community al naar hun luisterervaring, met afspeellijsten, albums en radiozenders.
๐ Aankondiging van Suno op X ๐ 5 albums die je niet mag missen, blog van Suno
HyperFrames Studio, de video-editor van HeyGen ontworpen voor agents
5 oktober โ HyperFrames, het open source framework van HeyGen dat HTML-code omzet in video, wordt een desktopapplicatie. HyperFrames Studio presenteert zich als een video-editor die vanaf nul voor agents is gebouwd: je beschrijft de gewenste video, de agent (Claude Code, Codex of een eigen agent) levert een eerste montage, waarna de mens en de agent op dezelfde tijdlijn (timeline) werken. Je stuurt met handelingen in plaats van met een prompt: een element in het beeld omcirkelen, een opmerking aan een woord vastmaken of zelf knippen. De applicatie exporteert in 4K en biedt naar eigen zeggen honderden inspiratievoorbeelden en sjablonen; volgens het HyperFrames-account op X is ze gratis, en alleen een macOS-versie wordt als download aangeboden. Ze bouwt voort op de Studio Preview van juli, waarmee een met code gegenereerde video al visueel kon worden bewerkt.
๐ Aankondiging van HyperFrames Studio ๐ Gedeeld door HeyGen
Korte berichten
- Warp Factories op weg naar algemene beschikbaarheid โ In een blogbericht van 3 oktober over zijn herfstbijeenkomst geeft Warp aan dat Warp Factories, zijn infrastructuur voor agents, overgaat van vroege toegang naar algemene beschikbaarheid, zonder datum of prijs; het team zegt hiermee de kosten per PR in de afgelopen maand met 70 % te hebben verlaagd. ๐ bron
- Release notes van Devin van 2 oktober โ De toegangsinstellingen van Microsoft Teams worden nu toegepast, met รฉรฉn klik selecteer je alle beveiligingsbevindingen met dezelfde ernst (ook in API v3) en de aangeboden plugins tonen hun skills, MCP, hooks en regels vรณรณr installatie; het opbouwen van omgevingen voor grote Perforce-repositories krijgt 3 uur de tijd in plaats van na 10 minuten te mislukken. ๐ bron
- MCP TikTok Ads in Replit โ Replit voegt TikTok Ads toe aan zijn catalogus van meer dan 450 integraties: zodra het account is verbonden, kan zijn Agent TikTok-advertenties maken en beheren, doelgroepen bereiken en prestaties meten vanuit de werkruimte, zonder credits te verbruiken voor de verbinding. ๐ bron
- Cockle Finance op Replit โ Replit pint een video over Cockle Finance vast, waarvan de tool door Dan en zijn vader Steve op Replit is gebouwd om de toestroom van klanten bij te houden; volgens Replit heeft Dan zijn bedrijf in drie maanden met 15 % laten groeien, zonder te vermelden hoe dit is gemeten. ๐ bron
- Copilot CLI 1.0.92 als stabiele versie โ Deze versie bundelt de nieuwigheden uit de previewversies 1.0.92-0 tot -5; de enige nieuwe toevoeging: na aanmelding bij Microsoft Entra kiest de gebruiker welk account hij wil gebruiken,
/logoutsluit deze OAuth-sessies af en MCP-servers die door Entra worden beveiligd vernieuwen hun inloggegevens zonder tussenkomst. ๐ bron - Codex CLI 0.160.1 โ Deze patch voor 0.160.0 bevat slechts รฉรฉn backport: de Windows-variabelen SYSTEMROOT, TEMP en TMP blijven behouden bij het starten van externe MCP stdio-servers waarvan de externe omgeving expliciet is geconfigureerd; dit is de meest recente stabiele versie, aangezien er geen stabiele 0.161.0 is uitgebracht. ๐ bron
- Nightly van Gemini CLI van 5 oktober โ Deze bevat geen wijzigingen: hij is gebouwd op dezelfde commit als die van 3 oktober en verschilt alleen in de versienummers; het stabiele kanaal (v0.62.0) en het previewkanaal (v0.63.0-preview.0) blijven ongewijzigd. ๐ bron
- TypeScript SDK van SpaceXAI 0.2.1 โ Deze versie, uitgebracht op 2 oktober, voegt
toJson(schema)toe, dat gestructureerde output valideert met een Standard Schema-validator (Zod, Valibot of ArkType), en de optieretryBeforeOutput, die een streamingverzoek (streaming) opnieuw uitvoert als het is mislukt voordat er output was; bij een 429 zonder Retry-After-header wordt nu vanaf รฉรฉn seconde gewacht, tot maximaal 30 seconden, in plaats van 250 milliseconden. ๐ bron - Cresta Conductor op de Claude Agent SDK โ In de reeks van Anthropic over startups die met Claude bouwen, presenteert Cresta Conductor, een tool om in natuurlijke taal agents voor klantrelaties te bouwen, gebaseerd op de Claude Agent SDK; volgens Cresta heeft deze de tijd voor de eerste deployment in de eerste toepassingen ongeveer gehalveerd, zonder beschikbaarheidsdatum of prijs. ๐ bron
- npm: verlopen van configuraties voor vertrouwde publicatie โ Sinds 2 oktober verloopt een configuratie voor vertrouwde publicatie (trusted publishing) die voor geen enkele publicatie is gebruikt 48 uur na aanmaak, en npm weigert ook tokens afkomstig van
issue_comment-events in GitHub Actions, net als bijpull_request_target. ๐ bron - npm: publicatie klaarzetten maakt pakketten aan โ Sinds 2 oktober kan
npm stage publisheen pakket aanmaken dat nog niet bestaat, met een lokale sessie of een granulair token, ook als dat beperkt is tot klaarzetten (stage-only); de eerste versie moet door een maintainer worden gepromoveerd voordat die kan worden geรฏnstalleerd. ๐ bron - Agent API van Perplexity op Fast Search โ De presets low, medium en high van de Agent API gebruiken nu Fast Search voor de tool
web_search, waarbij de prijs van 2,50 naar 1 dollar per 1 000 aanroepen daalt en de zoekopdracht ongeveer 800 ms sneller wordt; de preset xhigh behoudt de standaardzoekfunctie. ๐ bron - RAG-gids van Perplexity โ Perplexity publiceert een gids met negen voorbeelden van generatie met opgehaalde informatie (retrieval-augmented generation, RAG) en zeven architecturen, waarbij het zichzelf noemt voor zijn webindex en Instant Buy-functie naast voorbeelden van derden zoals Zendesk of GitHub Copilot; geen productnieuws. ๐ bron
- Personeelsbestand van Cohere โ Volgens Cohere is het bedrijf gegroeid van ongeveer 400 werknemers begin 2026 naar meer dan 800 vandaag, een cijfer dat in een wervingsbericht wordt genoemd. ๐ bron
- IsoVGRBench en Logbook bij Meta โ Zonder aankondiging publiceert facebookresearch de code van IsoVGRBench, dat videobeloningmodellen evalueert op 16 000 paren die slechts in รฉรฉn aspect verschillen (bij vergelijking met dezelfde clip met door elkaar gehusselde frames antwoorden deze modellen vrijwel willekeurig), en die van Logbook, dat zich richt op gebeurtenissen in zeer lange audio-opnamen. ๐ bron
- FiftyOne leest LeRobot v3-datasets โ Volgens een communitybericht van Harpreet Sahota leest de open source toolkit FiftyOne nu het LeRobot v3-formaat rechtstreeks, zonder converter of kopieรซn van de videoโs; de demonstratie omvat 497 episodes afkomstig van de 50 robottypen in de communitydataset van LeRobot. ๐ bron
- FetchMan-data van Ai2 โ Deze dataset, die op 1 oktober zonder aankondiging is gepubliceerd, bevat 352 696 gesimuleerde episodes (52 miljoen frames, 902 instructies) waarin een humanoรฏde Unitree G1 objecten vastpakt, gegenereerd in MolmoSpaces, in LeRobot v3-formaat en onder de ODC-BY-licentie. ๐ bron
- P(doom) op Hugging Face-profielen โ Gebruikers van de Hub kunnen op hun profiel hun P(doom) tonen, hun schatting van de kans dat IA een existentiรซle catastrofe veroorzaakt; de antwoorden worden gebruikt voor een onderzoek waarvan over twee weken alleen geaggregeerde en geanonimiseerde resultaten worden gepubliceerd. ๐ bron
- hf-image-extensie โ Hugging Face stelt zonder aankondiging een extensie van zijn CLI beschikbaar die containerimages bouwt, pusht, pullt en start op zijn registry cr.hf.co; niet-gecomprimeerde lagen worden door Xet gededupliceerd, zodat een laag van 2 Go waarvan 100 Mo is gewijzigd volgens de README maar ongeveer 100 Mo verstuurt. ๐ bron
- Drie experimenten van Milos Kotlar โ In drie communityberichten maakt Milos Kotlar de KV-cache van een kleine transformer 2,71 keer compacter met 97,85 % overeenstemming over het volgende token, en verlaagt hij het aandeel tokens zonder expert bij MoE-routing van 13,84 % naar 8,09 %, zonder enige snelheidswinst. ๐ bron
- Audit van een LLM-beoordelaar door Stephen Yu โ Stephen Yu heeft op 38 400 samples de GLM-5.3-beoordelaar geaudit, die de feitelijke getrouwheid beoordeelt in de GRPO-beloning van zijn herschrijfmodel van 12B: betrouwbaar bij het herkennen dat een feit is gewijzigd, maar met ruis bij het beoordelen van de ernst; het tellen van foutieve outputs brengt een daling van 39 % aan het licht die de eerste telling verhulde. ๐ bron
- Symposium van Sakana AI in Tokio โ Sakana AI opent de inschrijving voor een gratis symposium op 26 oktober in de Hitotsubashi Hall in Tokio, in het Engels, met een lezing van Jรผrgen Schmidhuber en een gesprek met David Ha, PDG van Sakana AI. ๐ bron
- NVIDIA Inception-startups en borstkanker โ NVIDIA presenteert vier startups uit zijn Inception-programma die IA inzetten in het zorgtraject, waaronder iSono Health met zijn door de FDA toegelaten 3D-echografieapparaat ATUSA (ongeveer twee minuten per borst tegenover maximaal 45 minuten handmatig), Whiterabbit.ai, Ataraxis AI en SimBioSys; sommige van deze technologieรซn zijn niet door de FDA goedgekeurd. ๐ bron
Wat dit betekent
De herkomst van tekst wordt een wettelijke verplichting. Tot nu toe draaide de traceerbaarheid van gegenereerde inhoud vooral om beeld en audio, met watermerken en controleerbare metadata; de AI Act breidt die eis uit naar tekst, en OpenAI reageert hier stapsgewijs op: een watermerk dat standaard wordt toegepast op tekst van ChatGPT en Codex in de Europese Unie, een gewone optie in de API, een detector die is voorbehouden aan goedgekeurde organisaties. De gepubliceerde cijfers verklaren deze voorzichtigheid: ongeveer 95 % van de passages van 400 tokens wordt gedetecteerd bij inhoud over psychologie, met een beoogd percentage foutpositieven van 1 %, maar bij Engelstalige passages van 400 tokens verlaagt het vervangen van 10 % van de woorden door synoniemen de detectie van ongeveer 92 % naar 66 %, en herschrijven of vertalen kan het watermerk uitwissen. Het watermerk geeft een aanwijzing over de herkomst, geen bewijs, en de afwezigheid ervan zegt niets over de auteur.
Het geheugen van agents raakt ingeburgerd en wordt geleidelijk gestandaardiseerd. Devin bewaart zijn lessen in een Git-repository met Markdown-bestanden die Dreaming elke dag reorganiseert, en Cognition publiceert het formaat onder de MIT-licentie zodat andere agents het kunnen overnemen; North 2 bewaart de context van de ene sessie naar de volgende; Qwen Code integreert Mem0 rechtstreeks in zijn CLI. De benaderingen verschillen, met voor mensen leesbare bestanden met versiebeheer, een externe geheugendienst en een in een platform ingebouwde functie, maar ze voorzien in dezelfde behoefte: voorkomen dat een agent bij elke sessie opnieuw vanaf nul begint. De keuze van Cognition heeft een praktisch voordeel: elke notitie verwijst naar de sessie waarin de kennis is opgedaan, is in de interface te bekijken en behoudt haar Git-geschiedenis, zodat je kunt lezen en corrigeren wat de agent heeft onthouden.
Open modellen vinden via verschillende wegen hun weg naar ontwikkeltools. Together Link koppelt ze aan bestaande agents, waaronder Claude Code en Codex, en meldt een kostenverlaging van meer dan de helft; IBM laat de zelf gehoste versie van Bob op Nemotron 3 Ultra draaien voor bedrijven die hun ontwikkeling op hun eigen infrastructuur houden, tot en met omgevingen zonder netwerkverbinding; Reflection AI presenteert Beam als een open model toegespitst op code en agentische taken, met 80,9 op SWE-bench Verified volgens zijn eigen tabellen. Het gemeenschappelijke argument draait minder om de ruwe score, waarbij Reflection AI erkent dat Kimi K3 voorop blijft, dan om kosten, latentie en controle over de gegevens.
Veel cijfers van vandaag zijn afkomstig van degenen die ze publiceren. GitHub heeft ReviewBench ontworpen en de eerste ranglijst opgesteld, waarop Copilot code review bovenaan staat, zonder dat andere aanbieders de benchmark hebben uitgevoerd of geverifieerd; de latentie van Nemotron 3 Ultra komt uit interne tests van IBM; de besparingen van Together Link en de advertentieresultaten van ChatGPT zijn de cijfers die Together AI en OpenAI melden. GitHub publiceert wel zijn dataset, beoordelaar en methodologie en stelt inzendingen open: elke aanbieder kan de meting opnieuw uitvoeren met zijn eigen agent. Dat zal duidelijk maken of deze eerste ranglijst standhoudt.
Bronnen
- Onze aanpak van de EU-regels voor tekstherkomst (OpenAI)
- Thread van OpenAI over de beperkingen van watermerken
- Geheugen en dromen: hoe Devin leert door met je samen te werken (Cognition)
- Thread van Cognition op X
- Repository van Agent Memory
- Thread van Cursor over de SDK
- Changelog van de SDK van Cursor
- Qwen Code v0.25.0 op GitHub
- Together Link (Together AI)
- Documentatie van Together Link
- Waarom IBM voor NVIDIA Nemotron koos voor IBM Bob self-hosted
- ReviewBench: een open benchmark voor AI-code review (GitHub Blog)
- Website van ReviewBench
- North 2: AI voor bedrijven zonder compromissen (Cohere)
- Lanceringsthread van North 2 (Cohere op X)
- Samenwerking tussen Cohere en PwC (blog van Cohere)
- Persbericht van PwC Canada
- Maak kennis met Beam (Reflection AI)
- MetaEncoder-30B op Hugging Face
- X-artikel van Google AI over Living Models
- Living Models op Gemmaverse (Google DeepMind)
- Advertenties ontwikkelen voor de manier waarop mensen AI gebruiken (OpenAI)
- Meer manieren om ChatGPT Ads te meten
- Changelog van Perplexity van 5 oktober
- Aankondiging van albums door Suno
- 5 albums die je niet mag missen (Suno)
- Aankondiging van HyperFrames Studio
- Gedeeld door HeyGen
- Bouw de fabriek. Laat die draaien. Ga kajakken. (Warp)
- Release notes van Devin van 2 oktober
- MCP TikTok Ads in Replit
- Cockle Finance op Replit
- Copilot CLI v1.0.92
- Codex CLI 0.160.1
- Nightly van Gemini CLI van 5 oktober
- TypeScript-SDK van SpaceXAI v0.2.1
- Cresta en de Claude Agent SDK (blog van claude.com)
- Niet-gevalideerde npm-configuraties voor trusted publishing verlopen nu
- npm staged publishing ondersteunt nu het aanmaken van nieuwe packages
- Changelog van de Perplexity API
- 9 RAG-voorbeelden (blog van Perplexity)
- Personeelsbestand van Cohere
- Repository van IsoVGRBench
- FiftyOne en LeRobot v3 (Harpreet Sahota)
- FetchMan-data op Hugging Face
- P(doom) op de Hub (changelog van Hugging Face)
- Repository van hf-image
- KV-cache met een KL-budget (Milos Kotlar)
- Audit van de LLM-beoordelaar (Stephen Yu)
- Symposium van Sakana AI
- Van scan naar behandelplan (NVIDIA)