Zoeken

Claude Platform in algemene beschikbaarheid, GitHub Copilot verschijnt in Slack, DeepSeek lanceert een multimodaal model

ai-powered-markdown-translator

Artikel vertaald van fr naar nl met gpt-5.4-mini.

Bekijk project op GitHub ↗

Grote dag voor de bouwstenen van agentische infrastructuur: Anthropic brengt computer use, de browser tool, de Skills API en de Files API uit de bèta op Claude Platform, terwijl GitHub Copilot zich nestelt in Slack en Microsoft Teams. Aan modelzijde publiceert DeepSeek zijn eerste multimodale model en lanceert Pika Labs een vocale synthese die een ongeëvenaarde prijs-kwaliteitverhouding claimt. Daartussenin: een enorme egocentrische dataset, een studie over benchmarkbias in spraakherkenning, en een tiental opvallende updates bij Google DeepMind, GitHub, Z.ai, Qwen, Harvey en de tools voor video-/audiogeneratie.


Claude Platform: computer use, browser tool, Skills API en Files API in algemene beschikbaarheid

20 augustus — Anthropic kondigt de overgang naar algemene beschikbaarheid aan van vier bouwstenen om agents op Claude Platform te maken: computer use, de browser tool, de Skills API en de Files API. Het uitgesproken doel is om het aantal heen-en-weerbewegingen te verminderen dat nodig is om een taak te automatiseren in een applicatie zonder API, en om Claude Managed Agents te kunnen bouwen op versiebeheer­de skills en herbruikbare bestanden.

De nieuwe computer_toolset_20260801 stelt Claude in staat om meerdere acties per beurt achter elkaar uit te voeren (klik, invoer, toetsaanslag, schermafbeelding) in plaats van één heen-en-weerbeweging per afzonderlijke actie. Anthropic geeft aan dat klanten in vroege toegang 20 tot 40 % minder heen-en-weerbewegingen per taak zagen. De browser tool ontwikkelt zich parallel met browser_toolset_20260801: in plaats van pixels aan te sturen — kwetsbaar bij de kleinste wijziging in de lay-out — krijgt Claude voortaan de structuur van de pagina en kan het handelen op basis van elementreferenties.

Aan API-zijde maakt de Skills API het mogelijk om de procedure van een team één keer te uploaden, te versioneren en vast te zetten op een specifieke version_id of op latest. De Files API krijgt een parameter expires_in_seconds, een 5 keer hogere rate limit (500 verzoeken per minuut) en een quotum van 1 TB per organisatie. Anthropic publiceerde ook een AG-UI-adapter voor Managed Agents, die elke discussiethread koppelt aan een beheerde sessie en tekst, toolcalls en redenering naar de interface streamt.

BouwsteenNieuws van vandaag
Computer usecomputer_toolset_20260801, tot -40% minder heen-en-weerbewegingen per taak
Browser toolbrowser_toolset_20260801, aansturing via pagina-elementreferentie
Skills APIVersionering, vastzetten op version_id of latest
Files API500 verzoeken/minuut (x5), quotum van 1 TB per organisatie

🔗 Aankondiging Claude Platform


GitHub Copilot komt naar Slack en Microsoft Teams

21 augustus — GitHub Copilot verschijnt in openbare preview op Slack en Microsoft Teams. Het principe is in beide gevallen identiek: @GitHub vermelden in een direct bericht, een kanaal of een thread opent een cloudagentsessie die vragen over code en GitHub-activiteit kan beantwoorden, bugrapporten kan sorteren, storingen kan onderzoeken, wijzigingen kan implementeren in een beveiligde cloud-sandbox, en vervolgens pull requests kan openen met een link naar het oorspronkelijke gesprek.

Op Slack bouwt de integratie voort op Slack Code, het nieuwe agentische aanbod van Slack dat datzelfde weekend werd gelanceerd: GitHub Copilot kan speciale codekanalen openen waar het team diffs bekijkt en renderpreviews inspecteert zonder het oorspronkelijke gesprek te vervuilen. Op Teams wordt een discussie omgevormd tot een collectieve agentsessie die iedereen kan volgen en sturen; het werk gaat asynchroon door in de cloud-sandbox terwijl het team met iets anders bezig is.

Beschikbaarheid is voorbehouden aan organisaties met het Copilot Business- of Enterprise-plan. De beheerder activeert het Copilot-cloudagentbeleid en installeert de app voor Slack of Teams; repositorybeheerders kunnen een goedkeuring eisen voordat door de agent gegenereerde pull requests worden samengevoegd. Gebruik verbruikt AI-credits, en de cloud-sandbox wordt apart gefactureerd met configureerbare budgetten.

🔗 GitHub Copilot in Slack · 🔗 GitHub Copilot in Teams


DeepSeek-V4-Flash-Vision-Exp: DeepSeek’s eerste multimodale model op de API

21 augustus — DeepSeek zet DeepSeek-V4-Flash-Vision-Exp online, een experimenteel multimodaal model dat beschikbaar is onder de identificatie deepseek-v4-flash-vision-exp. Op puur tekstuele capaciteiten — agents, redenering, wereldkennis — evenaart het model DeepSeek-V4-Flash. De nieuwigheid zit elders: op benchmarks voor multimodale agents meldt DeepSeek een duidelijke sprong ten opzichte van V4-Flash, met prestaties die dichter bij Opus-4.8 liggen.

De multimodale ondersteuning aan API-zijde is volledig: gemengde invoer tekst + afbeelding (base64, externe URL, of via een nieuwe gratis Files API die dezelfde dag werd gelanceerd), compatibel met de drie bestaande formaten (Chat Completions, Messages, Responses). De prijs volgt de V4-Flash-tarieven, met een afbeeldingstokenisatie die is begrensd op 384 tokens per afbeelding. De Files API maakt het mogelijk om een afbeelding één keer te uploaden en te verwijzen via file_id, wat bandbreedte bespaart voor repetitieve agentische toepassingen. DeepSeek Harness 0.1.1, de open-source agent-harnas die op 13 augustus werd gelanceerd, is dezelfde dag bijgewerkt om het nieuwe model natively te ondersteunen.

OnderdeelDetail
Modeldeepseek-v4-flash-vision-exp
TekstcapaciteitenPariteit met DeepSeek-V4-Flash
Multimodale capaciteitenDicht bij Opus-4.8 op multimodale agentbenchmarks
AfbeeldingstariefTot 384 tokens/afbeelding, prijs V4-Flash
Ondersteunde API’sChat Completions, Messages, Responses
HarnasDeepSeek Harness 0.1.1 (natuurlijke ondersteuning)

DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.

🇳🇱 DeepSeek-V4-Flash-Vision-Exp is nu beschikbaar op het DeepSeek API-platform! Dit experimentele multimodale model evenaart DeepSeek-V4-Flash op tekstuele capaciteiten — inclusief agents, redenering en wereldkennis. Op multimodale agentbenchmarks maakt V4-Flash-Vision-Exp een grote sprong ten opzichte van V4-Flash, waardoor de prestaties van multimodale agents dichter bij die van Opus-4.8 komen.@deepseek_ai op X


Pika Speech: 3B-vocale synthese aan 1,2 seconde per minuut, tot 9x goedkoper dan ElevenLabs v3

21 augustus — Pika Labs breidt zijn Pika Audio-reeks uit met Pika Speech, een model voor vocale synthese met 3 miljard parameters. Het belangrijkste argument is snelheid: een real-time factor (RTF) van 0,02, oftewel een minuut spraak van studiokwaliteit op 48 kHz die in ongeveer 1,2 seconde wordt gegenereerd in lokale langvormtests, met verzoeken mogelijk tot vijf minuten ononderbroken spraak.

Op het vlak van ritmecontrole innoveert Pika Speech: in plaats van audio achteraf uit te rekken of samen te persen — de standaardmethode bij de meeste TTS-systemen — stuurt het model ritme en duur rechtstreeks aan via een « latent van het einde van de spraak » (EOS latent), een anker dat op het uiteindelijke doelbeeld is geplaatst. Dit anker vroeger plaatsen comprimeert het tempo; het later plaatsen laat de tekst meer ademen. Architecturaal combineert het team flow matching en distillatie via distribution matching, FlashAttention-3, en een « token packing » waardoor vijf zinssegmenten ongeveer twee keer zoveel kosten als één segment in plaats van vijf keer zoveel.

Qua kosten claimt Pika een voordeel tot 9x ten opzichte van ElevenLabs v3, 4,5x ten opzichte van Cartesia en ElevenLabs Turbo, en 2x ten opzichte van Fish Audio — zonder de exacte methodologie verder toe te lichten buiten deze verhoudingen. Het model is toegankelijk via de Pika API Club.

Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02. […] Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes it up to 9× more cost-efficient than ElevenLabs v3, 4.5× than Cartesia and ElevenLabs Turbo, and 2× than Fish Audio.

🇳🇱 Laten we het hebben over Pika Speech, een model voor vocale synthese met 3 miljard parameters en een real-time factor van 0,02. […] Pika Speech genereert een minuut 48 kHz-spraak van studiokwaliteit in ongeveer 1,2 seconde — en ondersteunt verzoeken tot vijf minuten. Deze efficiëntie maakt het tot 9 keer kosteneffectiever dan ElevenLabs v3, 4,5 keer meer dan Cartesia en ElevenLabs Turbo, en 2 keer meer dan Fish Audio.@pika_labs op X

🔗 Architectuurdetails


EgoSuite-Open100K: de grootste open menselijke egocentrische dataset

21 augustus — Lightwheel AI, in samenwerking met Hugging Face, open-source EgoSuite-Open100K, gepresenteerd als de grootste volledig geannoteerde menselijke egocentrische dataset die ooit vrij beschikbaar werd uitgebracht. Het nagestreefde doel is 100.000 uur aan menselijke eerstepersoonsdata; de eerste 10.000 uur zijn al beschikbaar, de rest wordt gefaseerd gepubliceerd.

De dataset bestrijkt meer dan 15.000 taken verspreid over meer dan 15.000 reële scènes — keukens, slaapkamers, magazijnen, assemblagelijnen — gegroepeerd in 7 categorieën van omgevingen en 128 soorten scènes. Elke sequentie is geannoteerd met handpose, lichaamshouding en semantiek op subtaakniveau, waarbij een deel van het corpus bovendien cameradekking op de pols heeft. Opvallend aan de licentie: in tegenstelling tot veel onderzoeksdatasets is EgoSuite-Open100K gelicentieerd voor commerciële training, niet alleen voor academisch gebruik.

De dataset wordt door de makers gepresenteerd als de eerste publieke bouwsteen van een bredere data-infrastructuur voor « Physical AI » (robotica en belichaamde AI) — het idee dat de opschaling van fysieke modellen voortaan afhangt van toegang tot massale, gedeelde menselijke data.

🔗 Aankondiging Lightwheel AI · 🔗 Hugging Face-doorverwijzing


Claude Security stapt over op Claude Mythos 5

21 augustus — Anthropic laat Claude Security, zijn tool voor kwetsbaarheidsscans, draaien op Claude Mythos 5, in openbare bèta voor alle Claude Enterprise-klanten. Het argument: profiteren van het meest capabele beveiligingsmodel van Anthropic op de eigen codebase zonder aparte modeltoegang — scans worden gefactureerd als standaard tokengebruik binnen het bestaande plan.

Concreet meldt de tool zich bij een GitHub-repository en analyseert Mythos 5 de code door de datastroom tussen bestanden te volgen en te redeneren over interacties tussen componenten. Elk resultaat komt terug met een CWE-categorie, een vertrouwensniveau, een ernstinschatting en een voorgestelde oplossing, die direct in Claude Code op het web wordt geopend. Anthropic grijpt de gelegenheid aan om een Defender Advantage Fund van 35 miljoen dollar aan credits voor open-sourcebeveiliging te lanceren, en is van plan zijn Cyber Verification Program in de komende weken uit te breiden.

🔗 Aankondiging Claude Security


GPT-5.6 Sol-prijzen: OpenAI verlaagt zijn API-prijzen, GitHub Copilot volgt

21 augustus — OpenAI verlaagt de API- en creditprijzen van GPT-5.6 Sol met meer dan 20 % voor de komende drie maanden. De maatregel is al actief aan de API-zijde en wordt in de loop van de dag uitgerold naar Codex en ChatGPT Work. Voor Codex-gebruikers op taakgebaseerde plannen (token-based) gaan aangekochte credits voortaan verder mee; het inbegrepen gebruik in Pro-, Plus- en Business-abonnementen blijft ongewijzigd — de prijsdaling komt dus vooral ten goede aan API-ontwikkelaars en token-gefactureerde gebruikers.

GPT-5.6 Sol aan -50% in GitHub Copilot

Parallel daaraan meldt GitHub een aparte promotie: -50 % op GPT-5.6 Sol in GitHub Copilot tot 3 september, bruikbaar in de app, de CLI en de IDE. Dit is een eenmalige korting aan Copilot-zijde, en moet niet worden verward met de permanente prijsverlaging van OpenAI hierboven — twee verschillende bedrijven, twee verschillende mechanismen op hetzelfde model.

🔗 OpenAI-prijsverlaging · 🔗 GitHub Copilot-promo


GLM-5.3 (Max) stijgt in Code Arena: WebDev

20 augustus — LMArena geeft aan dat GLM-5.3 (Max) van Z.ai de Pareto-grens (kwaliteit/kostprijsverhouding) van de ranglijst Code Arena: WebDev, gewijd aan het evalueren van modellen op webontwikkeltaken, heeft verschoven. Met 1597 punten zou het model 2e staan onder de open-gewichtenmodellen (zodra gepubliceerd) en 8e in totaal.

ModelPrijs ($/M tokens)Code Arena: WebDev-punten
GLM-5.3 (Max)$3,651597
Qwen3.8 (Max)$5,00
Gemini-3.7-flash-high$2,86lagere score
DeepSeek-v4-flash-high$1,10lagere score

Met $3,65 per miljoen tokens blijft GLM-5.3 (Max) binnen een prijsrange die vergelijkbaar is met Qwen3.8 (Max), terwijl het Gemini-3.7-flash-high en DeepSeek-v4-flash-high op deze ranglijst overtreft — een nieuw signaal van de concurrentiekracht van Z.ai op agentische webontwikkeling, als aanvulling op de reeds bekende resultaten op Terminal-Bench en de algemene Agent Arena.

🔗 LMArena-aankondiging


Harvey lanceert Tenet, een juridisch model gebouwd op Kimi K3

20 augustus — Harvey presenteert Tenet, zijn eerste nabehandelde model voor het recht, gebaseerd op een Kimi K3-basis (Moonshot AI) die verder is nabehandeld met Fireworks AI op een corpus van publieke juridische data, synthetische data en data van menselijke experts die langdurig juridisch werk simuleren.

Harvey meldt dat deze nabehandeling het volledige succespercentage van Tenet verhoogt tot 82 % op de LAB-benchmark en tot 22 % op LAB Contracts, vergeleken met de basis-Kimi K3 — met state of the art op LAB Contracts en de 2e plaats op LAB als geheel. De operationele kost van Tenet zou minder dan een kwart bedragen van die van de best presterende foundationmodellen op de markt. Daarnaast heeft Harvey drie gespecialiseerde subagents getraind: M&A-due diligence, tabelreview en kennis van het kantoor.

🔗 Aankondiging Harvey


Georgia Tech traceert de oorsprong van het sociale redeneren van Olmo 3

21 augustus — Een team van Georgia Tech heeft gebruikgemaakt van het feit dat de Olmo 3-stack van Ai2 volledig open is — gewichten, Dolma 3-pretrainingscorpus (1,26 miljard documenten), infrastructuur — om statistisch modelvaardigheden te koppelen aan de teksten die ze hebben voortgebracht, een experiment dat onmogelijk is op een gesloten model.

De methode is gebaseerd op influence-functies, toegepast op ongeveer 5,68 miljoen documenten die uit Dolma 3 zijn bemonsterd. Belangrijkste resultaat: teksten rijk aan dialogen en interpersoonlijk schrijven wegen zwaarder op de prestaties in sociaal redeneren dan op feitelijke kennis — en door de meest invloedrijke literaire documenten te verwijderen, daalde de prestatie op de SocialIQA-benchmark significant, wat de causaliteit bevestigt.

🔗 Ai2-artikel


Bias door «benchmark optimization» ontdekt in open-source ASR-modellen

21 augustus — Een team van Hume AI publiceert op de Hugging Face-blog een studie over een methodologische bias in spraakherkenning: sommige modellen zouden geoptimaliseerd lijken om de referentietranscripties van openbare benchmarks te reproduceren in plaats van de audio getrouw te transcriberen.

Van de 11 geteste open-source ASR-modellen zouden ongeveer 40 % van de VoxPopuli-fragmenten fouten in hun referenties bevatten, en 6 van de 11 modellen reproduceerden die fouten in plaats van de audio correct te transcriberen. Op LibriSpeech haalden de herstelscores voor gemaskeerde getallen 30 tot 40 %, wat erop wijst dat sommige modellen de tekst «aanvullen» in plaats van die te horen. De conclusie beveelt het gebruik van geheim gehouden evaluatiesets aan en een striktere scheiding tussen trainings- en testgegevens.

🔗 Hugging Face-studie


SenseNova-U1.5-8B-MoT: open beeldmodel zonder VAE of DiT

21 augustus — SenseNova brengt een model voor beeldgeneratie uit met open gewichten waarvan de aangekondigde prestaties vergelijkbaar zouden zijn met Nano Banana 2. De technische interesse zit in de architectuur: geen VAE, geen aparte tekstencoder, geen DiT — het model steunt op een «mixture of transformers», waarbij tekst- en beeldtokens verschillende gewichten gebruiken en elkaar wederzijds afstemmen, terwijl het denoisen rechtstreeks in de pixelruimte gebeurt in plaats van in een gecomprimeerde latente ruimte.

Deze aanpak contrasteert met de standaardstack van tekst-naar-beeld-diffusiemodellen, en de openheid van de gewichten zal de gemeenschap in staat stellen de aangekondigde prestatievergelijkingen onafhankelijk te verifiëren.

🔗 Aankondiging van SenseNova


Diffusers 0.40.0: Modular Diffusers verlaat de experimentele status

21 augustus — Hugging Face publiceert Diffusers 0.40.0. De meest structurele verandering is dat Modular Diffusers, het modulaire pipelinemodel van de bibliotheek, niet langer experimenteel is. De versie voegt integratie toe van meerdere recente open modellen (LTX2.5, MiniMax H3, MiniMax Music 3, Wan Animate 2), ondersteuning voor tensorparallelisme voor een selectie van modellen, en twee nieuwe quantization-backends (SDNQ, Nunchaku-Lite).

🔗 Aankondiging van Diffusers 0.40.0


Google DeepMind verkent AI in games met Fenris Creations

21 augustus — Google DeepMind kondigt een onderzoeks साझenschap aan met de studio Fenris Creations, in het verlengde van 15 jaar werk waarbij videogames als experimenteerterrein voor AI werden gebruikt, van Atari-beheersing tot Grandmaster-niveau op StarCraft II. Na SIMA, dat agents leerde 3D-werelden te begrijpen, wil DeepMind navigatie in echte menselijke dynamieken binnen een persistente wereld verkennen.

De samenwerking richt zich op vier open uitdagingen: continu leren (nieuwe vaardigheden verwerven zonder de vorige te vergeten), diep geheugensystemen die veel verder gaan dan de huidige contextvensters, langetermijnplanning (weken, maanden, jaren) en multi-agentdynamiek (samenwerking, onderhandeling, economie, opkomend gedrag). Het langetermijndoel is dubbel: samen met ontwikkelaars nieuwe game-ervaringen creëren en die vooruitgang hergebruiken voor problemen uit de echte wereld en wetenschappelijke ontdekking.

🔗 Aankondiging van Google DeepMind


Runway Ruby: conversie van SDR-video naar 16-bits HDR

21 augustus — Runway lanceert Ruby, een model dat een SDR-video (standard dynamic range) omzet naar 16-bits HDR, met als uitvoer EXR-sequenties of ProRes/HEVC 10-12-bits, in de BT.2020-kleurruimte met ondersteuning voor PQ of HLG — de standaarden die worden gebruikt in professionele postproductie en HDR-broadcast.

Ruby werkt even goed op een door de gebruiker geüploade video als op een door Runway gegenereerde output, met een limiet van 30 seconden. De functie is vanaf nu beschikbaar voor de plannen Max en Enterprise.

🔗 Aankondiging van Runway Ruby


NVIDIA AVO claimt 100 % op de ARC-AGI-3-benchmark

21 augustus — NVIDIA presenteert AVO, een generalistische code-agent, met een score van 100 % op ARC-AGI-3, een benchmark voor interactief redeneren. Volgens NVIDIA heeft AVO de 183 niveaus volbracht verspreid over de 25 openbare omgevingen van de benchmark, zonder expliciete instructies, uitgesproken regels of vooraf geformuleerde doelen.

AVO werkt via een continue lus van inspectie, planning, implementatie en evaluatie, en steunt op geheugen, tools en uitvoeringsfeedback om voort te bouwen op wat het in de loop van de tijd leert — een aanpak die bedoeld is om vooruitgang op langdurige taken vast te houden in plaats van bij elke nieuwe contextvenster van nul te beginnen.

🔗 Resultaat van ARC-AGI-3


HeyGen Look Packs: outfit en decor veranderen terwijl het gezicht behouden blijft

21 augustus — HeyGen lanceert Look Packs, een functie die de outfit en het decor van een avatarvideo verandert terwijl het gezicht van de persoon trouw behouden blijft — het argument is dat de meeste generatieve modellen ook de gelaatstrekken wijzigen wanneer ze het uiterlijk veranderen.

Het beoogde gebruik is de consistentie van persoonlijk merk over verschillende professionele contexten: vastgoed, juridisch, fitness, onderwijs, welzijn. Een B2B-contentmaker kan zo video’s produceren in outfits en decors die aangepast zijn aan elke sector, terwijl hij van video tot video herkenbaar blijft. Deze aankondiging past in het stevige ritme van HeyGen van de afgelopen dagen (Retouch op 20 augustus, Brand Kits en 4K-upscale op 18-19 augustus).

🔗 Aankondiging van Look Packs


Amp lanceert Explain Usage om het tokenverbruik uit te leggen

21 augustus — Amp voegt Explain Usage toe, een functie waarmee rechtstreeks aan Puck, de ingebouwde assistent, kan worden gevraagd om het eigen verbruik van tokens, credits en orb-grootte te analyseren. De gebruiker stelt een vraag in natuurlijke taal — «Welke threads hebben vandaag de meeste tokens verbruikt?» — en Puck leest de persoonlijke gebruiksgegevens en de metriek per thread om te antwoorden.

Er zijn twee toegangspunten: de vraag rechtstreeks aan Puck stellen, of op de speciale knop klikken op de gebruikspagina’s. Voor gebruikers die de ruwe data verkiezen, stelt Amp deze informatie ook beschikbaar via CLI (amp usage --details, amp threads usage <thread-id> --details).

🔗 Explain Usage


v0 (Vercel) voegt Vercel Connect toe om verbinding te maken met 100+ services

21 augustus — Apps en agents die in v0 zijn gebouwd, kunnen nu rechtstreeks verbinding maken met Slack, GitHub, Salesforce en meer dan 100 andere externe diensten via Vercel Connect, zonder dat de ontwikkelaar zelf de authenticatiestroom hoeft te beheren.

Het mechanisme steunt op herbruikbare teamconnectors gekoppeld aan tokens met een korte levensduur: zodra een connector aan de teamzijde is geconfigureerd, kan elke nieuwe app of gegenereerde agent die hergebruiken in plaats van telkens opnieuw volledige authenticatie te vragen. Daardoor positioneert v0 zich als een platform dat agents kan produceren die geïntegreerd zijn in de softwarestack van een bedrijf, niet alleen als geïsoleerde interfaces.

🔗 Vercel Connect


Gedeelde threads in Codex en ChatGPT Work

20 augustus — Codex en ChatGPT Work introduceren «gedeelde threads»: een alleen-lezen link die de volledige redenering van een sessie blootlegt — aanpak, beslissingen, context — in plaats van alleen een eindresultaat. Het doel is te vermijden dat de context van een pull request opnieuw moet worden samengesteld uit losse screenshots tijdens een code review, een diepgaande technische verkenning of een overdracht van een project tussen teamgenoten.

Het is een functie die aansluit bij recente aankondigingen rond ChatGPT Sites (meerdere bewerkers, aanpassing van URL’s) en die de positionering van Codex/ChatGPT Work als teamwerktool versterkt.

🔗 Gedeelde threads


Transparante achtergronden in preview voor GPT-Image-2

20 augustus — De GPT-Image-2-API laat nu, in preview, toe om afbeeldingen met transparante achtergrond te genereren. Het praktische nut is om herbruikbare assets te produceren — productvisuals, grafische designelementen, website-mock-ups, marketingcampagnes — die daarna zonder handmatige uitsnede op eender welke achtergrond kunnen worden geplaatst.

🔗 Transparante achtergronden


Kort nieuws

  • Zed — Antigravity installeert in één klik via het ACP Registry van Zed. 🔗 Tweet
  • trackio 0.36 — Hugging Face publiceert een update die ondersteuning toevoegt voor een nieuw type logbare data, zonder verdere toelichting. 🔗 Tweet
  • AI «full-stack» volgens Google DeepMind — Paige Bailey ontleedt de end-to-end-aanpak van Google in vijf lagen: infrastructuur, beveiliging, onderzoek, modellen/tools, producten. 🔗 Google-artikel
  • GitHub — beter beheer van geblokkeerde gebruikers: zoeken op naam, sorteren en paginering van lange lijsten. 🔗 Changelog
  • GitHub — het vastpinnen van weergaven, projecten en mijlpalen in de zijbalk van de repository gaat naar algemene beschikbaarheid, met meerdere gerelateerde verbeteringen (reactie-avatars, dashboarddichtheid). 🔗 Changelog
  • Manus verlengt de gratis toegang tot Manus 1.6 Lite en Manus 1.6 tot 28 augustus (SGT), binnen de limiet van het dagelijkse quota. 🔗 Tweet
  • Manus herinnert genotificeerde gebruikers eraan hun gegevens op te slaan vóór 23 augustus 7:59 uur (SGT), vóór de overgang naar een onafhankelijk bedrijf. 🔗 Tweet
  • Genspark lanceert een promotie tot 30 september: Design + GenTeam aan -90%, GenMail gratis, Slides Ultra Mode aan -50%. 🔗 Tweet
  • NVIDIA licht de verdeling toe tussen de harnas van een agent (wat hij probeert te doen) en de infrastructuur (wat hij echt kan doen) in een security deep dive van de agentische stack. 🔗 Tweet
  • NVIDIA publiceert het verslag van de Seattle Spark Hack Series op DGX Spark: winnende projecten in rampenrespons, gezondheid en offline overleving met Nemotron en NemoClaw. 🔗 Tweet
  • NVIDIA Cosmos 3 — een Cosmos Labs-video toont de posttraining van Cosmos 3 bij de partners Aigen en Linker Vision. 🔗 Tweet
  • Luma Labs zal spreken over creatieve agents tijdens Summer Signal, georganiseerd met GMI Cloud op 14 september. 🔗 Tweet
  • Synthesia — de CEO wordt geciteerd in een Forbes Tech-artikel over het meten van AI-adoptie op basis van resultaten in plaats van gebruik. 🔗 Tweet
  • Qwen3.8-27B zet zijn communautaire opmars voort: nieuwe NVFP4 + DFlash2-inferentierecepten in het SGLang-cookbook, lichtere versies gepubliceerd door Unsloth, 1e plaats op de Cline-codeagent-ranglijst in vier dagen, en een NVIDIA DGX Station dat meer dan 2713 tokens/seconde piek geaggregeerd rapporteert in BF16-servicemodus. 🔗 SGLang · 🔗 Unsloth · 🔗 Cline · 🔗 DGX Station
  • Qwen3.8-Max is nu bruikbaar in de code-tool Kilo Code voor het genereren van interfaces. 🔗 Tweet
  • Kimi Work publiceert een tweede tutorial voor financiële analisten: beleggersdashboard, bijwerken van financiële modellen, batchgeneratie van rapporten. 🔗 Tweet
  • GLM-5.3 blijft vooruitgaan: score van 69 op de officiële DeepSWE-ranglijst, beschikbaarheid op het WorkBuddy-platform, en verlenging van Build Week door Z.ai tot 23 augustus 18:00 uur (PT) met 100 miljoen gratis tokens voor de eerste 50.000 nieuwe ZCode-inschrijvers. 🔗 DeepSWE · 🔗 WorkBuddy · 🔗 Build Week
  • GPT-5.6 Sol — drie externe platforms (Router, Cloudflare AI Gateway, OpenCode Zen) bieden elk -50% tot half september, bovenop de al gedekte kortingen bij Devin, OpenRouter en v0. 🔗 Cloudflare AI Gateway

Wat dit betekent

De aankondiging van Anthropic-GitHub van vandaag schetst een fundamentele trend: de agentische infrastructuur verlaat de experimentele fase. De GA van computer use en de browser tool op het Claude Platform, gecombineerd met de komst van Copilot in Slack en Teams, geeft aan dat grote leveranciers niet langer alleen modellen verkopen — ze verkopen agents die kunnen handelen in de tools die teams al dagelijks gebruiken, zonder telkens via een speciale API-integratie te hoeven gaan. Het is evenzeer een verandering in distributie als in capaciteit: de agent gaat voortaan naar waar het werk gebeurt, in plaats van te eisen dat het werk naar hem komt.

Op het vlak van modellen bevestigt DeepSeek-V4-Flash-Vision-Exp dat multimodaliteit een verwachte standaard wordt in plaats van een onderscheidende factor — zelfs spelers die zich op economische efficiëntie positioneren (V4-Flash) integreren het nu native, met prestaties die dichter bij de beste gesloten modellen liggen. De concurrentie op agentische codebenchmarks (GLM-5.3 op Code Arena: WebDev, Qwen3.8-27B op Cline) illustreert dezelfde dynamiek aan de kant van ontwikkeltools: de prijsverschillen tussen open en gesloten modellen worden kleiner, wat OpenAI ertoe aanzet zijn API-tarieven voor GPT-5.6 Sol met meer dan 20% te verlagen.

De beweging naar volledige openheid — niet alleen van gewichten, maar ook van data en trainingsinfrastructuur — blijft wetenschappelijke vruchten afwerpen: de Georgia Tech-studie over Olmo 3 zou simpelweg niet mogelijk zijn geweest op een gesloten model, net zoals de Hume AI-studie over ASR-benchmarkbias herinnert eraan dat een leaderboardscore geen echte transcriptiekwaliteit garandeert. Het zijn twee nuttige herinneringen op het moment dat de sector meermaals recordscores aankondigt.

Ten slotte bevestigt de vermenigvuldiging van massale datasets met commerciële licentie — EgoSuite-Open100K vandaag, na verschillende gelijkaardige aankondigingen in de afgelopen weken — dat toegang tot echte menselijke data, niet alleen synthetische, een strategische kwestie wordt voor robotica en belichaamde AI, net zoals rekenkracht dat is geweest voor grote taalmodellen.


Bronnen