ai-powered-markdown-translatorArtikel vertaald van het Frans naar het Nederlands met gpt-5.6-sol.
Slechts twaalf aankondigingen, verdeeld over vijf domeinen, voor het weekend van 29 en 30 augustus — tegenover tweeëntwintig de dag ervoor en tweeënveertig op de 28e. Twee oorzaken stapelen zich op, en geen van beide mag worden verzwegen. De 29e is een zaterdag en de 30e een zondag: vrijwel alle officiële blogs hebben niets gepubliceerd. Bovendien viel X tijdens het verzamelen uit: de interface die de profieltijdlijnen levert, reageerde niet meer; drieëntwintig gevolgde accounts — die voor beeld- en videogeneratie en die voor ontwikkeltools — bleven onbereikbaar. Een aankondiging die uitsluitend via een tweet werd verspreid, kan daardoor aan de scan zijn ontsnapt.
De dag kent niettemin twee registers. Aan de productkant verbindt xAI Grok Bot met het X-netwerk en licht GitHub vijf ontwikkelingen voor Issues toe. Aan de onderzoekskant komt de oogst volledig van de Hugging Face-blog en individuele bijdragers: een lineaire probe die van het ene visionmodel naar dat van een concurrent kan worden overgebracht, een op één MacBook voorgetraind post-transformermodel, een Leech-rooster waarmee Qwen3-4B in 2,60 GB VRAM past, en een methode om een agent tijdens het genereren te onderbreken. Dit zijn onderzoeksprojecten, geen lanceringen.
Grok Bot maakt verbinding met X
29 augustus — xAI publiceerde in zijn nieuwsoverzicht een update voor Grok Bot, zijn aanbod van autonome agents: het product is voortaan nauwer geïntegreerd met X.
Het mechanisme bestaat uit het koppelen van een account. De gebruiker koppelt zijn X-account vanuit Grok Bot, waarna xAI automatisch een ontwikkelaarsaccount voor hem aanmaakt als hij er nog geen heeft — de stap die programmatische toegang tot het netwerk mogelijk maakt. Betalende abonnees van Grok Bot ontvangen bovendien gratis X API-tegoeden om aan de slag te gaan, zonder dat xAI het volume of de geldigheidsduur ervan vermeldt.
Zodra de connector is geactiveerd, kan een Bot posts zoeken, de tijdlijn van zijn eigenaar lezen, diens vermeldingen bekijken en samenvatten wat er op het netwerk rondgaat. Om te beginnen hoeft de gebruiker alleen Grok Bot te openen en de X-connector te gebruiken.
xAI noemt deze release uitdrukkelijk de eerste versie van de integratie en zegt het voornemen te hebben Grok Bots werkzaamheden op X verder te vereenvoudigen.
🔗 Grok Bot werkt voortaan met X
GitHub Issues: vijf vernieuwingen, waaronder een scopebewuste REST API voor afhankelijkheden
29 augustus — GitHub heeft vijf ontwikkelingen voor GitHub Issues toegelicht, rechtstreeks aangekondigd op X zonder bijbehorend changelogbericht: het bericht zelf is de primaire bron.
Vier daarvan verbeteren de navigatie. Weergaven kunnen in de zijbalk worden vastgezet, zodat een filter niet bij elke sessie opnieuw hoeft te worden opgebouwd. Bij reacties worden nu profielavatars weergegeven waar voorheen alleen het aantal stond. De dichtheid van het dashboard kan voortaan worden aangepast, wat nuttig is voor repositories met veel rijen. Gesloten sub-issues kunnen worden verborgen, waardoor bovenliggende issues die voor projectbewaking dienen overzichtelijker worden.
De vijfde is het belangrijkst voor automatisering: de REST API voor issue-afhankelijkheden wordt scopebewust (scope-aware). Afhankelijkheden tussen issues, die de volgorde beschrijven waarin taken moeten worden uitgevoerd, kunnen voortaan met inachtneming van de scope worden opgevraagd — wat rechtstreeks van belang is voor agents en scripts die op basis van de opvolging van een repository een werkplan opstellen. GitHub heeft niet vermeld volgens welke beschikbaarheidsregeling deze vijf wijzigingen worden uitgerold.
| Aangekondigde vernieuwing | Reikwijdte van de wijziging |
|---|---|
| Weergaven vastzetten in de zijbalk | Navigatie in Issues |
| Profielavatars bij reacties | Weergave van reacties |
| Aanpasbare dashboarddichtheid | Dashboard |
| Gesloten sub-issues verbergen | Bovenliggende issues en sub-issues |
| Scopebewuste REST API voor afhankelijkheden | REST API, afhankelijkheden tussen issues |
Gala, een op één MacBook voorgetraind post-transformermodel, leest 10 miljoen tokens met constante snelheid
29 augustus — Een familie van kleine taalmodellen met de werktitel Gala is in vijf dagen vanaf nul voorgetraind in pure MLX op één MacBook — M3 Max, GPU met 40 cores en 128 GB gedeeld geheugen.
Het experiment begint met een omkering van het perspectief. De Transformer is ontworpen voor hardware waarop dichte matrixvermenigvuldigingen overvloedig beschikbaar zijn en geheugen met hoge bandbreedte schaars is; een Mac is de tegenovergestelde machine. De gekozen architectuur stapelt daarom parameters en toestand op en beperkt het aantal FLOPs per token.
De eindtest bestaat uit het verwerken van 10,5 miljoen tokens echte FineWeb-tekst, met een batchgrootte van 1, op de laptop. Niets groeit: de recurrente toestand blijft over het hele bereik onveranderd op 3,07 MB en de decodeersnelheid neemt niet af. Ook het verlies over de volgende 2.000 tokens loopt niet op. De referentie-Transformer die op dezelfde gegevens is getraind, decodeert vanaf een context van 32k met 134 tokens/s en zou bij één miljoen tokens ongeveer 33 GB KV-cache vereisen.
| Bereikte context | Decodeersnelheid | Verlies over de volgende 2.000 tokens | Recurrente toestand |
|---|---|---|---|
| 32 768 | 382,3 tokens/s | 3,630 | 3,07 MB |
| 1 048 576 | 388,1 tokens/s | 3,534 | 3,07 MB |
| 5 242 880 | 386,2 tokens/s | 3,590 | 3,07 MB |
| 10 485 760 | 385,8 tokens/s | 3,296 | 3,07 MB |
De invoer blijft lineair met ongeveer 28.000 tokens/s, oftewel bijna zes minuten voor de tien miljoen. Het model is samen met zijn uitvoeringslogboeken gepubliceerd en het artikel wijdt een sectie aan wat het niet kan.
A post-transformer language model, pretrained from scratch on one MacBook in pure MLX, that reads 10M tokens of context at constant speed. Five days, every number measured, everything released.
🇳🇱 Een post-transformertaalmodel, vanaf nul voorgetraind op één MacBook in pure MLX, dat 10 miljoen contexttokens met constante snelheid leest. Vijf dagen, elk cijfer gemeten, alles is gepubliceerd. — Arjun Reddy, op de Hugging Face-blog
Een Leech-rooster in een CUDA-kernel laat Qwen3-4B in 2,60 GB VRAM passen
29 augustus — Het aantal bits per gewicht is de enige hefboom die bepaalt welke klasse machine een model kan hosten: met 2 bits daalt een model met 70 miljard parameters van 140 GB naar ongeveer 18 GB en past het op een kaart van 24 GB. De kwaliteit moet dan wel behouden blijven, en de beste gerapporteerde kwaliteit bij dit compressieniveau komt van vectorquantisatie in blokken van 24 op het Leech-rooster, werk van Qualcomm AI Research.
De blokkade zat in de software. De CUDA-kernel die bij dit artikel werd gepubliceerd, decodeert voor de eenvoud slechts één laag van het rooster en blijft trager dan concurrerende methoden. Het woordenboek dat bij 2 bits werkelijk nodig is, bestaat echter uit een vereniging van lagen: 301 equivalentieklassen en een index van 47 bits die één punt uit 1,1 × 10¹⁴ aanwijst. De auteur kon nergens een decoder voor deze index vinden.
Dus schreef hij die zelf. De wiskundige kern van het project — rooster, exacte zoekopdracht naar de dichtstbijzijnde buur, bijectieve indexering op 48 bits, sferische GPTQ — is zonder enige externe afhankelijkheid in Rust geïmplementeerd en wordt aangevuld met de ontbrekende gefuseerde CUDA-decoder.
| Gemeten element | Vastgestelde waarde |
|---|---|
| Gekwantiseerd model | Qwen3-4B |
| VRAM-voetafdruk | 2,60 GB |
| Generatiedoorvoer | 87 tokens/s |
| Equivalentieklassen bij 2 bits | 301 |
| Indexgrootte | 47 bits, uit 1,1 × 10¹⁴ punten |
| Model van 70 miljard bij 2 bits | van 140 GB naar ongeveer 18 GB |
Bij greedy decoding produceert het gekwantiseerde model dezelfde tokens als het dichte model, afgezien van het beslechten van een gelijke score. Twee kanttekeningen, door de auteur zelf gemaakt: zijn decoder blijft trager dan de concurrerende QTIP-kernel, die 2,40 keer minder bytes leest en 2,27 keer sneller draait; en de preprint is door de auteur zelf gedeponeerd en niet door vakgenoten beoordeeld. Code en gegevens zijn openbaar.
Een lineaire probe die op één visionmodel is getraind, kan op dat van een concurrent worden uitgelezen
30 augustus — Vier multimodale modellen van vier verschillende bedrijven encoderen dezelfde afbeeldingen. Ze zijn allemaal bevroren, geen ervan is gefinetuned, en hun verborgen toestanden hebben niet eens dezelfde breedte: 5.376, 5.120, 2.560 en 2.048 dimensies. Niets zou het mogelijk moeten maken dat een probe die op het ene model is geleerd, op een ander werkt. Toch werkt ze.
Het protocol is minimaal. Een lineaire probe — één enkele gewichtsmatrix — leert afbeeldingslabels te voorspellen op basis van de toestanden van een model en wordt vervolgens zonder hertraining uitgelezen op de toestanden van een ander model, via een met ridge regression geschatte transformatie waarbij alleen de trainingsrijen als brug tussen beide ruimtes dienen.
| Geëvalueerd domein | Eigen AUROC | Overgebrachte AUROC | Overdrachtskosten |
|---|---|---|---|
| Satellietbeelden, landgebruik met 17 klassen | 0,9507 | 0,9484 | 0,0024 |
| ChestX-ray14-röntgenfoto’s, 3 van de 4 modellen | 0,7440 | 0,7511 | negatief |
Bij thoraxradiografie — de officiële testlijst met 25.596 opnamen van patiënten die tijdens de training nooit zijn gezien — overtreft de overgebrachte score de eigen score, en vier van de zes kruisrichtingen presteren beter dan de eigen probe van het doelmodel. De meetdiscipline verklaart waarom het resultaat serieus moet worden genomen: de ruwe cosinus tussen niet-gerelateerde elementen loopt vóór correctie op tot 0,998, centrering brengt de vier aanbieders terug tot 0,005 of minder, en elke bewering wordt gepubliceerd met haar toevalsdrempel — 0,5014 met verwisselde labels op de satelliettestset.
Together AI plaatst GLM-5.3 vóór twee gesloten modellen wat betreft hallucinatieratio, zonder een benchmark te noemen
30 augustus — Together AI presenteert de lage hallucinatieratio van GLM-5.3 als een onderschat aspect van het model en vergelijkt die met twee vooraanstaande gesloten modellen.
| Vergeleken model | Hallucinatieratio ten opzichte van GLM-5.3 |
|---|---|
| GLM-5.3 | referentie |
| Claude Fable 5 | meer dan 2 keer zo hoog |
| GPT-5.6 Luna | meer dan 3 keer zo hoog |
De meting moet worden gelezen voor wat ze is. Together AI host GLM-5.3 en verkoopt de inferentie ervan: de bron is niet neutraal. Het bericht noemt noch de gebruikte benchmark, noch absolute waarden, noch de methode waarmee hallucinations zijn geteld — alleen verhoudingen. Een korte video begeleidt de post, maar de gepubliceerde tekst bevat geen enkel ruw cijfer. Dit moet dus als een relatieve rangschikking worden beschouwd, niet als een onafhankelijke evaluatie.
De invalshoek blijft opmerkelijk omdat ze het beeld van de voorgaande dagen aanvult: de op 29 augustus gepubliceerde DeepSWE-vergelijkingen maten programmeervaardigheid en kosten, niet de feitelijke betrouwbaarheid in productie.
an underrated part of glm-5.3 is its low hallucination rate
claude fable 5 is over 2x higher, while gpt-5.6 luna is over 3x higher
🇳🇱 Een onderschat aspect van GLM-5.3 is zijn lage hallucinatieratio. Die van Claude Fable 5 is meer dan 2 keer zo hoog, terwijl die van GPT-5.6 Luna meer dan 3 keer zo hoog is. — @togethercompute op X
🔗 Bericht van @togethercompute
Kort nieuws
- Reflexive Role Routing, een methode om een agent tijdens het genereren te onderbreken — Een probe met één lineaire laag leest tijdens het genereren twee waarden uit — de afwijking tussen het doel van de prompt en het huidige traject, en de geschatte kans dat de uitvoer de beoordeling doorstaat — die een bevroren controller gebruikt om te beslissen of de generatie moet worden onderbroken. Het proces is geformaliseerd als een semi-Markovbeslissing om de reeds geproduceerde context niet weg te gooien. Preprint gedeponeerd onder DOI 10.5281/zenodo.22171581. 🔗 Blogbericht op Hugging Face
- Een wegwerprisicobeoordeling, gegenereerd door een frontiermodel — Eén prompt laat een krachtig model een nieuwe benchmark maken waarvan het beoordelingsschema privé blijft binnen het gesprek; de geëvalueerde modellen leggen de test af, hun antwoorden worden voor beoordeling teruggestuurd en daarna wordt de benchmark weggegooid — de auteur beschouwt dit niet als een oplossing voor contaminatie, alleen als een manier om minder afhankelijk te zijn van steeds dezelfde openbare vragen. Het belang schuilt vooral in het verplichte onderscheid in de resultaten tussen bereidheid (willingness), vermogen (capability) en facilitering (enablement). 🔗 Blogbericht op Hugging Face
- De standaardfaalmodus van CUDA is stilte — Leerzame notitie uit de eerste week van GPU-programmering, geschreven op basis van het eenvoudigst mogelijke programma: het optellen van twee lijsten met duizend getallen. Wat de auteur trof, was niet hoe de GPU werkt, maar hoe geruisloos hij uitvalt. Geen aankondiging of modelrelease. 🔗 Blogbericht op Hugging Face
- GitHub vestigt opnieuw de aandacht op het groeperen van Dependabot-updates — Bij GCToolkit, een project van Microsoft, betrof ongeveer één op de zes commits de versie-upgrade van één enkele afhankelijkheid; drie wijzigingen in het bestand
dependabot.ymlwaren voldoende om de ruis te verminderen door updates te groeperen en hun frequentie te verlagen, zonder beveiligingspatches te vertragen. Het betreffende artikel dateert van 29 juli 2026: alleen het delen ervan vond plaats op 30 augustus. 🔗 Bericht van @github - WebMCP Challenge: deadline op 3 september en vraag-en-antwoordsessie op 31 augustus — OpenAI Developers herinnert eraan dat projecten voor de WebMCP-hackathon tot 3 september kunnen worden ingediend en kondigt in dezelfde thread een vraag-en-antwoordsessie (office hours) op Discord aan voor maandag 31 augustus om 11 am PT, samen met de wedstrijdpartners: Chrome, Cloudflare, Shopify, Vercel, Render en Netlify. De hackathon zelf was op 25 augustus aangekondigd. 🔗 Bericht van @OpenAIDevs
- Cohere publiceert drie foto’s van Waterloo zonder bijbehorende aankondiging — Het officiële account zet de Canadese positionering van het bedrijf voort, zonder lancering, cijfer of link. Geen feitelijke inhoud: vermeld voor de volledigheid van het tijdvenster. 🔗 Bericht van @cohere
Wat dit betekent
Consumentenhardware wordt opnieuw een ontwerpbeperking, geen limiet die je maar moet ondergaan. Twee van de projecten van dit weekend vertrekken vanuit hetzelfde uitgangspunt: de beschikbare machine bepaalt de architectuur, en niet andersom. Gala is ontworpen voor een Mac — veel geheugen, weinig FLOPs — en stapelt daarom parameters en toestand op in plaats van berekeningen per token; het resultaat is decodering die niet vertraagt tussen 32.768 en 10,5 miljoen tokens aan context. De kwantisering met een Leech-netwerk richt zich op het andere uiteinde van de keten: een model met 70 miljard parameters verkleinen van 140 GB tot ongeveer 18 GB, zodat het op een kaart past die particulieren bezitten. Geen van beide beweert met een frontiermodel te kunnen concurreren, en daar gaat het ook niet om: beide verschuiven de vraag van de modelgrootte naar de klasse van machines die het model kan draaien.
Een probe die op één model is geleerd, kan op dat van de buurman worden uitgelezen. Het verrassendste resultaat van de dag is ook het meest onopvallende. Als vier bevroren modellen van vier bedrijven beelden zo vergelijkbaar coderen dat één enkele gewichtsmatrix van het ene naar het andere kan worden overgedragen tegen een verlies van 0,0024 AUROC — of zelfs met een negatieve kost —, dan zijn de tools die boven op deze representaties zijn gebouwd niet langer gebonden aan de leverancier waarop ze zijn gekalibreerd. De paper maakt zelf deze praktische interpretatie, maar benoemt meteen de beperking die verhindert dat dit al een methode is: de transportafbeeldingen worden per modellenpaar afgestemd en niets wijst erop dat één ervan standhoudt op een model dat buiten die afstemming is gehouden. Nergens wordt de meetdiscipline losgelaten: anisotropie wordt vóór elke vergelijking gecorrigeerd en naast elke score wordt de toevalsondergrens gepubliceerd.
Betrouwbaarheidsclaims verschijnen zonder metrologie. Together AI plaatst GLM-5.3 vóór twee gesloten modellen wat betreft het hallucinatiepercentage, maar noemt geen benchmark, publiceert geen absolute waarden en beschrijft zijn telmethode niet — terwijl het bedrijf ook de inferentie verkoopt van het model dat het als eerste rangschikt. Het contrast met de onderzoeksartikelen van hetzelfde weekend is duidelijk: die publiceren hun toevalsondergrenzen naast hun resultaten en beschrijven hun protocollen uitvoerig. Een rapport zonder referentiekader is geen meting, maar een commercieel argument, en moet ook als zodanig worden gecategoriseerd.
Aan de productkant leverde het weekend alleen loodgieterswerk op — en juist daar worden agents gemaakt of gebroken. xAI brengt geen model uit: het koppelt Grok Bot aan X, maakt namens de gebruiker het ontwikkelaarsaccount aan en verstrekt API-tegoeden om de instapdrempel te verlagen. GitHub kondigt geen spectaculaire functie aan: het maakt zijn REST API voor issue-afhankelijkheden scopebewust. In beide gevallen veranderen de toegangsrechten en het bevraagbare oppervlak, niet de capaciteit van het model. Dit is het minst zichtbare en meest bepalende werk voor wie agents bouwt die een sociaal netwerk of een issuetracker moeten kunnen lezen.
Bronnen
- xAI — Grok Bot werkt nu met X
- GitHub — vijf nieuwigheden voor GitHub Issues
- Gala, een post-transformermodel getraind op een MacBook
- Kwantisering met een Leech-netwerk en een gefuseerde CUDA-decoder
- Lineaire probes overgedragen tussen bevroren vision-modellen
- Together AI — hallucinatiepercentage van GLM-5.3
- Reflexive Role Routing
- Wegwerprisicobeoordeling gegenereerd door een frontiermodel
- Leernotitie over het stille falen van CUDA
- GitHub — groepering van Dependabot-updates
- OpenAI Developers — WebMCP Challenge en vraag-en-antwoordsessie
- Cohere — foto’s van Waterloo