ai-powered-markdown-translatorArtikel översatt från franska till svenska med gpt-5.6-sol.
GPT-6 Astra lämnar den begränsade lanseringen tjugofyra timmar efter att modellen presenterades: den blir tillgänglig med abonnemangen Pro, Enterprise och Business Premium, blir allmänt tillgänglig i GitHub Copilot och uppnår det högsta resultat som Perplexity någonsin har uppmätt i sitt test för källbelagd informationssökning. Anthropic publicerar samtidigt det första datorverifierade beviset av Fermats stora sats, skrivet på elva dagar av Claude. GitHub öppnar HydraFusion, ett läge som självt väljer modell och workflow för varje uppgift, Google lanserar Lyria 3.5 i Gemini-appen och SpaceXAI öppnar Grok Bot för företag samt dokumenterar en inköpsagent som hittade besparingar på över 100 000 dollar hos den egna arbetsgivaren.
GPT-6 Astra lämnar den begränsade lanseringen och blir allmänt tillgänglig i Copilot
4 september — OpenAI meddelar klockan 22.13, Paris-tid, att GPT-6 Astra lämnar sin begränsade lansering. Modellen är tillgänglig för alla användare med Pro, Enterprise och Business Premium i ChatGPT Work och Codex, och API:et erbjuder den nu utan förbehåll, medan tillkännagivandet den 3 september fortfarande angav att tillgången var beroende av en stegvis lansering. Plus-prenumeranter och Business-användare får vänta ytterligare några dagar, enligt samma meddelande.
| Berörd plattform | Tillgång den 4 september |
|---|---|
| OpenAI API | Tillgängligt utan förbehåll |
| ChatGPT Work och Codex, Pro | Tillgängligt |
| Enterprise och Business Premium | Tillgängligt |
| Plus och övriga Business | Några dagars väntetid |
🔗 OpenAI:s tillkännagivande på X
Allmän tillgänglighet i GitHub Copilot, till ordinarie pris från första dagen
Samma dag blir GPT-6 Astra allmänt tillgänglig i GitHub Copilot. GitHub betonar modellens arbetsmetod snarare än dess resultat: i företagets interna tester planerar och validerar Astra under arbetets gång, kombinerar diagnostik med verifiering och bekräftar själv sina resultat innan en uppgift förklaras slutförd. Det ger bättre prestanda vid långvariga uppgifter med färre steg än tidigare OpenAI-modeller. Tillkännagivandet innehåller inga benchmarksiffror.
Modellen finns på tio plattformar, från Visual Studio Code och JetBrains IDE:er till Copilot CLI, GitHub Mobile, Xcode och Eclipse, men är förbehållen abonnemangen Pro+, Max, Business och Enterprise. Copilot Pro omfattas inte. Debiteringen är värd att notera: Astra debiteras enligt leverantörens ordinarie pris vid användningsbaserad betalning, utan introduktionsperiod, medan Gemini 3.8 Flash, som kom dagen innan, har ett introduktionspris till den 31 december 2026.
Perplexity ger modellen sitt bästa resultat på WANDR
Perplexity publicerade den 3 september klockan 23.10 Astras resultat på WANDR, företagets egen benchmark för storskalig källbelagd informationssökning. Modellen får 0,682 till en kostnad av 11,98 dollar per uppgift, det högsta resultatet bland samtliga modeller som företaget har testat.
| Utvärderad modell | WANDR-resultat | Kostnad per uppgift | Mätning publicerad |
|---|---|---|---|
| GPT-6 Astra | 0,682 | 11,98 dollar | 3 september 2026 |
| Claude Fable 5.1 | 0,601 | 12,76 dollar | 1 september 2026 |
Perplexity anger också två relativa skillnader: 13,5 procent högre resultat än Claude Fable 5.1 till 6,1 procent lägre kostnad samt 27,0 procent högre resultat än Opus 5 till 3,3 procent högre kostnad. Två förbehåll krävs. WANDR är en proprietär benchmark vars detaljerade metod inte har publicerats, och Perplexity är dessutom kund till modellerna som företaget rangordnar. Inget absolut värde har meddelats för Opus 5.
Tre korrigeringar av Codex CLI slutför integreringen
För kommandoraden följdes version 0.153.0, som publicerades natten till den 3 september, av tre korrigeringar på mindre än två dagar, samtliga ägnade åt Astra. Version 0.153.1 gör det möjligt att konfigurera modellen via API:et utan att ändra standardmodellen eller visa den i väljaren. Version 0.153.2 korrigerar en etikett: Fast-nivån beskrivs som 2x snabbare och inte 1,5x, utan någon förändring i hur förfrågningar behandlas. Version 0.153.3, publicerad den 4 september klockan 21.01, lägger till Astra i Amazon Bedrocks modellväljare för Mantle- och Runtime-rutter och korrigerar instruktionen som ges till modellen vid asynkrona klargörande frågor.
OpenAI avslutade dagen med tre erfarenhetsrapporter: två inlägg på utvecklarbloggen, det ena om ett procedurellt genererat rymdutforskningsspel byggt i Codex, det andra om utformningen av ett hus som går att utforska i Blender och Unreal Engine 5, samt en artikel av Dominik Kundel om fem förändringar i hur han använder Codex.
🔗 Versionsinformation för Codex CLI 0.153.3 · 🔗 Bygg ett spel med Astra
Claude står för det första formaliserade beviset av Fermats stora sats
4 september — Anthropic publicerar det första fullständigt datorverifierade beviset av Fermats stora sats. Claude arbetade i elva dagar, till stor del självständigt, med att skriva det i Lean. Företaget beskriver det som det största Lean-bevis som någonsin konstruerats.
| Uppmätt mått | Uppmätt värde |
|---|---|
| Längden på Claudes arbete | 11 dagar |
| Skrivna rader Lean | 13 miljoner |
| Bevisade mellanliggande satser | 29 500 |
| Första mänskliga beviset, av Wiles | 1995, 129 sidor |
| Tid mellan förmodan och bevis | mer än 350 år |
Satsen säger att ingen trippel av positiva heltal uppfyller Fermats ekvation för en exponent större än två. Pierre de Fermat klottrade ner den omkring 1637 i marginalen på sitt exemplar av Diofantos Aritmetiken. Det första korrekta beviset lades fram av Sir Andrew Wiles 1995: 129 sidor, månader av mänsklig granskning och en första version som presenterades 1993, där en granskare två månader senare upptäckte en kritisk brist.
De första försöken misslyckades eftersom agenterna nådde snabba framgångar innan de tappade tråden. Genombrottet kom med Prove2Me, en öppen samarbetsplattform för formalisering, kombinerad med ett multi-agent-ramverk baserat på Claude Code. Plattformen upprätthåller en riktad acyklisk graf över påståendena som hjälper agenterna att välja nästa bevis att försöka genomföra, separerar påståenden och bevis i olika filer för att påskynda kompileringen i Lean och bevarar en beskrivning av varje påstående på naturligt språk för att möjliggöra sökning och återanvändning. Det framtagna beviset följer Henri Darmons, Fred Diamonds och Richard Taylors förenklade framställning av Wiles bevis.
This extraordinary autoformalization achievement, which Anthropic researchers say only took 11 days, proves Fermat’s Last Theorem with no assumptions other than the axioms of mathematics.
🇸🇪 Denna extraordinära prestation inom automatisk formalisering, som enligt Anthropics forskare endast tog elva dagar, bevisar Fermats stora sats utan några andra antaganden än matematikens axiom. — Kevin Buzzard, granskare av resultatet, citerad på Anthropics forskningssida
Anthropic framställer betydelsen som en fråga om verifiering snarare än upptäckt, till skillnad från det senaste AI-arbetet kring Riemannhypotesen, som gav upphov till ny matematik. I takt med att mängden bevis ökar blir kollegial granskning en flaskhals som mäts i år.
🔗 Det fullständiga beviset på GitHub
Project HydraFusion låter GitHubs verktyg välja modell i stället för utvecklaren
4 september — GitHub öppnar Project HydraFusion som research preview, ett läge som inte längre betecknar en modell utan ett workflow. Medan Copilots väljare krävde att användaren valde bland över tjugo modeller avgör HydraFusion självt, för varje förfrågan, vilken modell som ska hantera uppgiften och enligt vilket körschema. Det väljs som vilken modell som helst men orkestrerar flera modeller bakom detta enda val.
För närvarande finns tre scheman. Läget Single överlåter uppgiften åt en enda modell. Läget Cascade låter en effektiv modell skriva ett första lösningsförslag, varefter en kvalitetskontroll beslutar om det ska godtas eller eskaleras till en mer kapabel modell. Läget Critique låter en oberoende skrivskyddad kritiker från en annan modellfamilj granska utkastet.
| Utvärderad benchmark | Kostnadsskillnad mot Opus 5 | Kvalitetsskillnad mot Opus 5 |
|---|---|---|
| TerminalBench 2.1 | 67 procent lägre | plus 4,9 poäng |
| DeepSWE | 36 procent lägre | minus 1,5 poäng |
| CheckpointBench | 65 procent lägre | minus 0,1 poäng |
Fem tekniska principer styr körningen: sammanräkning av kostnaden för varje steg, uttrycklig timeout och avbrytning, granskning i en isolerad kontext utan verktyg, inbyggd säkerhet vid applicering som innebär att ingen korrigering tillämpas om workflowet misslyckas samt validering av routingen före körning. GitHub gör en medveten kompromiss i gränssnittet genom att visa stegen men undanhålla mellanliggande utkast fram till slutresultatet, och medger att väntan utan tillräcklig insyn är en verklig nackdel.
Dokumentationen av utvecklingsarbetet är ovanligt rättfram: GitHub använder TerminalBench 2.1 som den mest fullständiga serien av körningar, förtydligar att utvecklingen inte varit linjär och medger att två driftfel i utvärderingsramverket gav ogiltiga körningar mellan den 11 och 25 augusti. Dessa körningar uteslöts från trenden och korrigerades därefter, och företaget placerar de bästa driftspunkterna i den registrerade serien den 25 augusti. Tillgång ges via Copilot CLI med samtliga abonnemang, till standardpriset baserat på det totala antalet tokens i workflowet, efter /update och sedan /experimental on.
Lyria 3.5 kommer till Gemini-appen och API:et
4 september — Google lanserar Lyria 3.5, som företaget beskriver som sin musikgenereringsmodell med den bästa ljudåtergivningen, med mer uttrycksfulla röster och fylligare arrangemang.
I Gemini-appen medför uppdateringen tre gränssnittsförändringar. Användaren kan välja eller beskriva sin musikgenre och välja mellan sång och instrumental musik. Nya färdiga mallar (templates) fungerar som utgångspunkt, oavsett om det gäller bakgrundsmusik eller en personlig födelsedagssång. Låtens längd blir konfigurerbar, från kort till långt format.
| Typ av plattform | Tillgång till Lyria 3.5 |
|---|---|
| Allmänheten | Gemini-appen på webben och mobilen, globalt |
| Professionellt skapande | Google Flow Music |
| Utvecklare | Gemini API, Google AI Studio, Google Vids |
Google placerar den förväntade användningen inom vardagliga behov snarare än professionell produktion: ett bakgrundsspår till en video, en varumärkesjingel eller en personlig ringsignal. Distributionen är bred och ingen abonnemangsbegränsning nämns. Blogginlägget anger däremot inga siffror för ljudkvaliteten, ingen jämförelse med den föregående versionen av Lyria och inget pris för API-åtkomst.
SpaceXAI sätter Grok i arbete på företag och publicerar systemprompten för sin inköpsagent
3 och 4 september — SpaceXAI öppnar Grok Bot för företag. Produkten, som lanserades den 12 augusti, går från ett erbjudande för individuella prenumeranter och Cursor-team till en version med åtkomst-, nätverks- och revisionskontroller. Varje användares arbete körs i en isolerad miljö, och en Bot har ingen åtkomst som standard: den kan endast nå de konton som den uttryckligen ansluts till. Kunder med Grok Enterprise och Cursor Enterprise får tillgång utan extra kostnad i två veckor och kan bjuda in hela sin organisation, även personer utan befintlig licens. SpaceXAI nämner Legora, Supermicro och ServiceTitan och uppger att tusentals organisationer har börjat använda produkten sedan lanseringen.
Det mest intressanta i tillkännagivandet är att den intensivaste användningen sker utanför teknikområdet: prospektering nattetid och bedömningsmatriser vid rekrytering, utkast till e-postmeddelanden och uppdateringar av presentationer inom försäljning samt extrahering av frågor och svar från webbinarier inom marknadsföring.
Dagen därpå publicerar företaget en fallstudie om en Bot som släppts lös på dess egna inköp. Den kallas Haggle Bot och är ansluten till Slack, Notion, Drive, Gmail, Hex och Ramp. Den rapporterar direkta besparingar på över 100 000 dollar.
| Agentens upptäckt | Identifierat belopp |
|---|---|
| Totala direkta besparingar | mer än 100 000 dollar |
| Inaktiva licenser under 90 dagar, första produkten | 43 licenser, 14 220 dollar |
| Outnyttjade referenser, månadsprodukt | 85 662 dollar per år |
Blogginläggets redaktionella intresse sträcker sig längre än dessa siffror: SpaceXAI publicerar agentens mall för systemprompten, presenterad som en modell att fylla i för den egna organisationen, där värdena anges som exempel inom vinkelparenteser. Dess behörighetsavsnitt skiljer mellan tre permanenta regelverk. Det första kräver aldrig godkännande, med läsning av utgiftsdata och meddelanden till kollegor som exempel. Det andra kräver uttryckligt godkännande av operatören varje gång, där varje meddelande till en leverantör är det angivna exemplet. Det tredje är förbjudet under alla omständigheter, och exemplen omfattar undertecknande, köp, tecknande av abonnemang, godkännande av utgifter och alla bindande åtaganden. Blogginlägget förklarar i löptext att teamet lät agenten sköta den interna efterforskningen och samordningen på egen hand, men krävde uttryckligt godkännande för att spendera pengar, acceptera villkor eller skriva till en leverantör.
🔗 Grok Bot för företag · 🔗 Haggle Bot släppt lös på inköpen
Grok ansluter till amerikanska bankkonton via Plaid
4 september — Grok kan nu ansluta till användarnas finansiella konton. Anslutningen sker via Plaid, den tekniska mellanhand som kopplar samman appar och banker i USA, och funktionen är omedelbart tillgänglig enbart i detta land.
De tre exempel som SpaceXAI har valt visar det avsedda användningsområdet: ta reda på vart den senaste månadens pengar tog vägen, följa sina investeringars utveckling och kontrollera om man faktiskt har råd med det som ligger i varukorgen. Med andra ord handlar det om analys av tidigare utgifter, portföljbevakning och beslutsstöd i köpsituationen. Tillkännagivandet är kortfattat och säger ingenting om databehandlingen eller vilka banker som stöds, utöver att anslutningen uppges vara säker.
Detta bygger vidare på en rad finansiella integrationer som inleddes med samarbetet med Interactive Brokers den 25 juni, men inriktningen är annorlunda: medan Interactive Brokers riktade sig till aktiva investerare öppnar Plaid assistenten för allmänhetens transaktionskonton.
Claude Code 2.1.260 och 2.1.261: diffpanel, granskning av skills och skärpta behörigheter
4 september — Två versioner av Claude Code släpps samma dag och kompletterar varandra: den första ger insyn i det pågående arbetet, den andra i vad sessionen förbrukar.
| Publicerad version | Lanseringstid | Viktiga nyheter |
|---|---|---|
| 2.1.260 | 4 september 01.48 | Panelen /diff, cachediagnostik i /cost, behörighetskorrigeringar |
| 2.1.261 | 4 september 21.58 | /skill-doctor, utdata på upp till 128 000 tecken, underagentens prompt i en fil |
Version 2.1.260 öppnar en diffpanel bredvid konversationen i helskärmsläge som visar ocommittade ändringar allt eftersom redigeringarna görs. Framför allt åtgärdar den flera brister i behörighetskontrollen: reglerna Edit, Write och Read, vars sökvägar innehöll parenteser, avvisades som ogiltiga eller ignorerades av Bash-sandlådan, vilket gjorde att mappar som skulle vara skrivskyddade ändå gick att skriva till. Dessutom godkändes zsh-kommandon automatiskt när de dolde en kommandosubstitution i en tilldelning av typen REPORTTIME.
Version 2.1.261 lägger till /skill-doctor, som listar inlästa skills som inte har använts och var och ens kontextkostnad. Dess automatiska läge behandlar nu en länk som paketerar innehåll i URL:en till en offentlig diagramgenerator som en överföring till en tredjepartswebbplats.
🔗 Versionsinformation för 2.1.260 · 🔗 Versionsinformation för 2.1.261
Kommandot ant apply lägger Managed Agents i versionshanterade filer
4 september — Anthropic lägger till ant apply i sitt CLI ant. Kommandot överför den deklarativa modell som infrastrukturteam är vana vid till Managed Agents: det önskade tillståndet beskrivs i filer i kodförrådet, varefter kommandot synkroniserar API-resurserna med denna beskrivning.
Fem resurstyper omfattas: Managed Agent-miljöer, agenterna själva, skills, minneslager (memory stores) och driftsättningar. Hittills skapades dessa objekt genom API-anrop eller via konsolen, utan några spår i kodförrådet. Genom att beskriva dem i filer kan de omfattas av kodgranskning, versionshantering och pipelines för kontinuerlig integration. Den praktiska fördelen är reproducerbarhet: en agentmiljö som beskrivs i en fil kan återskapas identiskt, jämföras mellan grenar eller driftsättas från en pipeline utan manuella ingrepp.
NVIDIA:s offensiv: beständigt agentminne, resonemang på Jetson och federerad identitet
3 och 4 september — Tre inlägg publicerades samma dag på NVIDIA:s teknikblogg och behandlar tre olika lager i stacken.
Det första är ett öppet recept byggt på NemoClaw: en stabschefsagent som upprätthåller ett beständigt minne av användarens arbete. Tesens kärna kan sammanfattas i en mening: ett användbart agentminne kräver struktur, selektiv hämtning och styrning, inte bara lagring. Lösningen bygger på en självmodell (self model), ett kunskapslager som människor kan läsa och som består av strukturerade Markdown-sidor, samt ett SQLite-register som bevarar åtaganden, rangordningar, korrigeringar och granskningshändelser. Körningen sker genom NVIDIA OpenShell, som i en sandlåda tillämpar policyer för åtkomst till filsystem, processer och nätverk, medan autentiseringsuppgifterna hålls utanför sandlådan.
| Uppmätt mått | Agentbaserad RAG-baslinje | Självmodell | Uppmätt skillnad |
|---|---|---|---|
| Övergripande träffsäkerhet, 186 frågor | 82,8 procent | 90,9 procent | plus 8,1 poäng |
| Svåra frågor, 31 frågor | 67,7 procent | 87,1 procent | plus 19,4 poäng |
| Spårning av föränderliga fakta, 5 | 60,0 procent | 100,0 procent | plus 40,0 poäng |
| Trohet mot korpusen, 13 frågor | 100,0 procent | 92,3 procent | minus 7,7 poäng |
Context can inform an action, but it cannot authorize one.
🇸🇪 Kontext kan vägleda en handling, men den kan inte ge tillstånd till den. — NVIDIA:s inlägg om agentminne
Den andra publikationen är en driftsättningsguide som markerar ett skifte för inbyggd AI: NVFP4-kvantisering i kombination med spekulativ avkodning ger upp till 6,28 gånger högre avkodningskapacitet än BF16 på Jetson AGX Thor och Orin. Den bästa konfigurationen varierar beroende på modell, och NVIDIA betonar detta i stället för att utse en universell vinnare: Nemotron 3.5 Lightning ger bäst resultat med DSpark, mellan 123 och 138 utgående tokens per sekund, medan Qwen3.8-27B presterar bäst med DFlash2, mellan 27,7 och 34,4 tokens per sekund. Den avslutande varningen är metodologisk: genomströmningen varierar beroende på belastningen, så konfigurationen bör valideras med prompter som är representativa för den avsedda tillämpningen. Den tredje, mer anspråkslösa publikationen beskriver hur en användares identitet överförs mellan federerade Kubernetes-plattformar och AI-plattformar.
🔗 Frontier-resonemang på Jetson · 🔗 Identitet mellan federerade plattformar
Googles kommandoradsverktyg: Gemini CLI går över till serien 0.60.0, Antigravity öppnar Flash för företag
3 och 4 september — Gemini CLI:s nightly-kanal lämnar serien 0.59.0 för 0.60.0, med en leverans som främst fokuserar på säkerhet. Den mest anmärkningsvärda korrigeringen tar bort en hårdkodad Google CrUX API-nyckel från komponenten chrome-devtools-mcp. Två andra ändringar stärker isoleringen: macOS-sandlådan Seatbelt får en isolerad temporär katalog, och tilläggsladdaren använder förstärkt sökvägsupplösning med validering av gränser. Den fjärde ändringen kräver att MCP-servrarnas OAuth-flöde identifierar utfärdaren i enlighet med RFC 9207, som skydd mot attacker genom utfärdarersättning.
Antigravity 2.12.2, som publicerades dagen innan, innehåller endast en förbättring och inga korrigeringar: företagsanvändare får åtkomst till resonemangsmodellerna Gemini 3.8 Flash genom autentisering med programmets standardinloggningsuppgifter (Application Default Credentials). Den praktiska nyttan är att modellen ansluts till det vanliga autentiseringssättet för Google Cloud-driftsättningar, utan en individuell API-nyckel.
🔗 Gemini CLI v0.60.0 nightly · 🔗 Antigravity-ändringslogg
AI i vetenskapens tjänst: en kopplad klimatemulator och den fullständiga konnektomen hos en bananflugshane
3 och 4 september — Två publikationer tillämpar maskininlärning på enorma vetenskapliga objekt inom två helt orelaterade ämnesområden.
Ai2 publicerar SamudrACE-E3SMv3 under Apache 2.0-licensen på Hugging Face Hub, en helt kopplad atmosfär–hav-klimatemulator. Syftet är att återskapa beteendet hos E3SM, det amerikanska energidepartementets klimatmodell, till en betydligt lägre beräkningskostnad: att sålla bland hypoteser innan själva E3SM körs och att producera stora ensembler som till låg kostnad samplar klimatvariabiliteten. Emulatorerna för atmosfären (ACE) och havet (Samudra) förtränas först separat innan de kopplas samman och utvärderas därefter på 400 år av tidigare osedda E3SM-data, där medelklimatet håller sig stabilt. Ai2 anger en uttrycklig begränsning: emulatorn fångar den dagliga nederbörden upp till den 99,99:e percentilen men underskattar den därutöver.
HHMI Janelia Research Campus, Google Research och deras samarbetspartner publicerar å sin sida den första fullständiga kartan över hjärnan och det centrala nervsystemet hos en vuxen bananflugshane: fler än 166 000 neuroner, ett rekord, fördelade på 11 691 celltyper som klassificerats med hjälp av AI och validerats av mänskliga experter. Metoden bygger på avbildning av tunna snitt och därefter datoriserad sammansättning av miljontals tvådimensionella bilder till tredimensionella neuronformer. Betydelsen ligger i jämförelsen med den tidigare publicerade kartan över honan: de flesta neuroner är identiska hos båda könen, en minoritet är könsspecifik och en tredje, så kallad dimorf kategori förekommer hos båda men kopplas till olika grannar. Tre kompletterande studier tillämpar kartan på syn, smak och socialt beteende.
🔗 SamudrACE-E3SMv3 på X · 🔗 Karta över bananflugshanens hjärna
Meta öppnar den maximala resonemangsnivån i Muse Spark 1.3 för allmänheten
4 september — Meta gör resonemangsnivån max i Muse Spark 1.3 offentligt tillgänglig, två dagar efter att själva modellen tillkännagavs. Nivån finns i Muse Code och Meta Model API.
Det som förändras är alltså inte modellen, utan den faktiska tillgången till dess mest beräkningskrävande resonemangsnivå. Alexandr Wang, chief AI officer på Meta, uppger att förbättringen gäller kodning och agentbaserade uppgifter och rekommenderar att modellen provas igen även av dem som redan har testat nivåerna high och xhigh. Han tillägger att lanseringen sker efter att säkerhetstesterna har slutförts. För att aktivera den väljer man Muse Spark 1.3 och ställer sedan in resonemangsnivån på max.
Inga benchmarksiffror följer med lanseringen: tråden publicerar varken resultat eller jämförelser, utan endast upphovspersonens kvalitativa bedömning.
🔗 Tillkännagivande från AI at Meta
Percept-Lens, Sakana AI:s protokoll för att utvärdera upptäckt av genererade bilder
3 september — Sakana AI presenterar Percept-Lens, ett utvärderingsramverk för out-of-distribution-detektering av AI-genererade bilder, antaget till ECCV 2026. Utgångspunkten är att detektorer för syntetiska bilder misslyckas så snart flera faktorer förändras samtidigt: generatorn, stilen eller prompten samt källdomänen. Percept-Lens förenar utvärderingen över 39 offentliga dataset, motsvarande 7,1 miljoner bilder.
Representationsstudien ställer en direkt fråga: tillför träningen av ett klassificeringshuvud fortfarande något utöver det som moderna kodare redan separerar? Författarna bygger en skala av gaussianiska diskriminanter som betingas av priorn, det vill säga huvuden i sluten form som baseras på första och andra ordningens statistik för egenskaperna. Det bästa steget på denna skala matchar ofta publicerade detektionshuvuden och överträffar dem ibland, förutsatt att jämförelsen görs med samma prior och kodare. Författarna förespråkar rapportering på nivån för trippeln prior, kodare och huvud.
🔗 Sakana AI:s blogginlägg · 🔗 arXiv-artikel
TAOT, placering av expertrepliker med hänsyn till nätverkstopologin
4 september — Baiges team på Baidu beskriver TAOT, en metod för placering av expertrepliker vid träning av mixture-of-experts-modeller, som levereras i deras open source-ramverk LoongForge.
Problemet är konkret. När MoE-träning blir långsammare beror det sällan på GPU:ernas beräkningskraft, utan på att belastningen inte kan balanseras om i tid: några få experter blir flaskhalsar och alla andra ranks väntar. Den klassiska lösningen är att tillfälligt replikera vikterna från en hårt belastad expert till en inaktiv rank, men när parallelliseringsdomänen sträcker sig bortom en nod är inte alla inaktiva GPU:er likvärdiga: trafik inom en nod går via NVLink, trafik mellan noder via InfiniBand, och kostnaden kan skilja sig med en storleksordning.
| Uppmätt mått | Uppmätt värde |
|---|---|
| Tid per iteration, före och efter | 155,4 ms respektive 108,8 ms, alltså 1,43x |
| Acceleration från EP4 till EP16 | upp till 1,79x |
| Kommunikationskostnad jämfört med LPLB | upp till 74 procent lägre vid EP32 |
| Overhead för schemaläggning online | mindre än 1 procent av tiden för forward-passet |
TAOT presenteras som den första metoden som i en enda målfunktion väger samman nyttan av att kapa belastningstoppar och kostnaden för att flytta vikter mellan noder. Där DeepSeeks LPLB begränsar vägarna genom fördefinierade grafer använder TAOT en kontinuerlig kommunikationskostnadsmatris med en mjuk topologisk preferens: trafik inom noden prioriteras, medan trafik mellan noder fortfarande är tillåten men dyrare. Övergången från radvis matchning till kolumnvis matchning minskar den återstående obalansen från 7–10 procent till 1–2 procent.
Open Yap 1K, tusen timmar full duplex-konversation fritt tillgängliga för kommersiellt bruk
3 september — The Agentic Data Company publicerar Open Yap 1K, en korpus med engelska samtal i två separata kanaler, utformad för röstmodeller med full duplex.
| Korpuselement | Offentligt urval | Fullständig korpus |
|---|---|---|
| Total längd | 8,9 timmar | 1 000 timmar |
| Samtal | 16 | 1 602 |
| Tillämpad licens | CC BY 4.0 | Open Yap, fritt för kommersiell användning |
| Åtkomstsätt | Hugging Face Hub | På begäran |
Författarna positionerar uttryckligen korpusen som ett alternativ till befintliga talkorpusar som Fisher, Switchboard och CANDOR, främst med ett tekniskt argument: inlägget jämför ett utdrag ur Fisher English, samplat i 8 kHz över telefonband, med ett utdrag ur Open Yap 1K för att illustrera skillnaden i ljudkvalitet. Insamlingsmetod, talarnas demografi, kvalitetssäkring, samtycke och integritet finns dokumenterade.
Daily Brief blir kostnadsfritt för fler amerikanska Gemini-användare
4 september — Google utökar den kostnadsfria tillgången till Daily Brief till fler användare av Gemini-appen i USA. Funktionen introducerades den 21 maj.
Daily Brief arbetar i bakgrunden och knyter samman användarens Google-appar: e-post, kalender, konversationer och intressen sammanfattas i en enda överskådlig lista över uppgifter och prioriteringar, presenterad som en startpunkt för dagen. Tillkännagivandet är fortfarande begränsat till USA och anger varken hur stor andel av användarna som berörs eller någon tidsplan för en internationell lansering.
🔗 Geminis tillkännagivande på X
Runway lanserar Team, ett självbetjäningsabonnemang för team med två till nio platser
4 september — Runway lanserar Team, som fyller tomrummet mellan de individuella abonnemangen och Enterprise-erbjudandet för storkunder. Förändringen påverkar produktutbudets struktur: Standard, Pro och Max blir uttryckligen individuella abonnemang, och varje ny medlem ansluts nu via Team, medan befintliga arbetsytor behåller sin åtkomst och sitt pris.
| Abonnemangsfunktion | Angivet värde |
|---|---|
| Månadspris per plats | 69 dollar |
| Årspris per plats | 55 dollar, det vill säga 20 procents rabatt |
| Tillåtet antal platser | 2 till 9 |
| Månatliga krediter per plats | 6 900, insatta i en gemensam pott |
| Delade projekt och lagringsutrymme | upp till 100 projekt, 1 TB |
Abonnemanget är organiserat kring delade projekt där tillgångar, referenser, Brand Kits, sessioner och workflows finns samlade. Runway framhåller enhetliga resultat som argument: när hela teamet genererar utifrån samma referenser liknar den tionde videon den första. Oanvända krediter överförs i en månad, ett team delar upp till 20 agentfärdigheter och Agent Connectors kopplar Figma, Dropbox och Notion till den kreativa agenten.
ElevenLabs utökar initiativet 1 Million Voices till Brasilien
4 september — ElevenLabs tar sitt samhällsinitiativ till Brasilien och illustrerar det med en första brasiliansk berättelse. Eliane har saknat sin röst sedan barndomen, och Alberto blev blind vid 46 års ålder. Företaget gav Eliane en röst som liknar hennes familjs, vilket för första gången gör det möjligt för henne att kommunicera med mannen hon älskar med en röst som uttrycker hennes identitet.
Tillkännagivandet åtföljs av två lokala partnerskap. Associação Brasileira de Esclerose Lateral Amiotrófica, som hjälper upp till 10 000 personer med amyotrofisk lateralskleros i landet, gör det möjligt för dessa patienter att få kostnadsfri tillgång till röstkloning. Sociedade Brasileira de Fonoaudiologia ska i sin tur utbilda brasilianska logopeder i röstkloning, eftersom företaget räknar med att behandlarnas vana vid tekniken ska öka antalet patienter som får hjälp. Initiativet 1 Million Voices är ett åtagande i form av produkter och tjänster värt en miljard dollar och har nått fler än 11 000 personer världen över sedan starten.
Kimi Code 0.41.0 lägger till ett multiagentläge och tar bort en två dagar gammal skyddsmekanism
4 september — Moonshot AI lanserar Kimi Code 0.41.0. Den synliga nyheten är tower, ett experimentellt läge för samarbete mellan flera agenter i webbgränssnittet, som aktiveras med kommandot /tower eller via plusmenyn i skrivfältet och tar emot en basgren som argument. Kontexthanteringen får två justeringar: modellen informeras om sin kontextbudget före en automatisk komprimering och hänvisas därefter till sessionens händelselogg för att återfinna de exakta detaljerna. Filhistoriken på tur-nivå blir permanent.
Den mest anmärkningsvärda punkten är ett återtagande. Version 0.40.0, som publicerades den 2 september, hade infört blockering av destruktiva kommandon som shutdown, reboot och rm -rf i läget för automatiska behörigheter. Version 0.41.0 upphäver detta beslut och slutar blockera farliga kommandon, liksom sådana som inte kan analyseras statiskt, i samma läge. Skyddsmekanismen varade i två dagar. Motivet förklaras inte i versionsinformationen, men statisk analys av shell-kommandon ger lätt falska positiva resultat som blockerar legitimt arbete.
🔗 Versionsinformation för Kimi Code 0.41.0
Perplexity beskriver Ivy, Tulip och ROSE, den egenutvecklade stacken som levererar dess embeddings
4 september — Perplexity publicerar ett tekniskt blogginlägg som ger en inblick i infrastrukturen som levererar företagets modeller för embedding och rankning (ranking). Företaget tränar och levererar sina egna modeller, däribland pplx-embed, och beskriver sitt sökindex som exabyteskaligt.
| Komponent i stacken | Använt språk | Roll i tjänsten |
|---|---|---|
| Ivy | Rust | HTTP-gateway, tokenisering, uppdelning och fördelning av batcher |
| Tulip | Rust, tokio, tonic | gRPC-inferensserver, schemaläggning och batchning |
| ROSE | Python | Modellkörning, CUDA-kärnor och grafer |
Grundtanken är att återanvända inferenskoden för LLM:er. Perplexity konstaterar att embedding i batcher liknar förifyllnadsfasen (prefill), som begränsas av beräkningskapaciteten, medan online-embedding av en kort fråga liknar avkodningsfasen (decode), som begränsas av minnet. Samma kärnor (kernels) används därför för pplx-embed och avkodningen av Qwen3.5, utan någon instansierad nyckel-värde-cache för embeddings och med uppmärksamhetsvarianter som accepterar oregelbundna indata (ragged) och undviker onödig utfyllnad. För uppmärksamhetskärnorna underhåller teamet FlashInfer 2, FlashInfer 3 och FlashAttention 4 parallellt i stället för att välja en enda, med ett val från fall till fall beroende på antalet huvuden och deras dimension. Mätningarna jämförs med vLLM v0.22.0, men de numeriska resultaten visas endast i diagram.
🔗 Perplexitys tekniska blogginlägg
Zed och Replit gör tillkännagivanden på X, utan blogginlägg eller versionsinformation
4 september — Två tillkännagivanden om kodningsverktyg från tredje part kommer samma dag, och båda bygger på ett enda inlägg på X, utan blogginlägg eller versionsinformation som stöd.
Zed uppger att Delta nu är tillgängligt för personer som deltar i betaversionen på Windows, som svar på en användarförfrågan från den 2 september. Skillnaden är viktig: Delta är den fleranvändarmiljö för kodning med agenter som lanserades den 12 augusti och som låter flera teammedlemmar arbeta med agenter i ett gemensamt projekt. Redigeraren Zed distribueras redan för macOS, Linux och Windows. Tillkännagivandet gäller alltså inte redigeraren utan Delta, vars tillgänglighet på Windows hade varit avvaktande sedan augusti. Den exakta omfattningen av betaversionen och villkoren för registrering är fortfarande okända.
Replit sände å sin sida en direktsession på en timme och 58 minuter med titeln ”Replit MCP: Styr din agent varifrån som helst”. Titeln aviserar en MCP-server som exponerar plattformens agent för protokollkompatibla klienter. Det avsedda användningsområdet är att starta en uppgift och följa dess förlopp från en redigerare, terminal eller tredjepartsassistent utan att använda webbgränssnittet. Meddelandet innehåller ingen annan text än denna titel, ingen länk till ett blogginlägg och ingen uttrycklig formulering om en lansering.
🔗 Delta på Windows · 🔗 Replit MCP direktsändning
Kortfattat
- En API-endpoint tillhandahåller historik över stjärnor utan att exponera användare — GitHubs REST API returnerar tidsstämplade antal stjärnor utan att identifiera kontona som tilldelade dem och ersätter därmed de listningsendpoints som reserverades för administratörer tidigare under året. 🔗 Ändringslogg
- npm tillåter flera konfigurationer för betrodd publicering per paket — tre förändringar blir allmänt tillgängliga: flera additiva OIDC-konfigurationer per paket, ett godkännande som blockeras så länge analysen mot skadlig kod pågår samt synlig historik över förproduktionsversioner på versionsfliken. 🔗 Ändringslogg
- GitHub Actions lägger till ett API för utfasning av runners — REST API:et anger slutdatum för stödet av en runner-version, behörigheten
vulnerability-alertsger skrivskyddad åtkomst till Dependabot-varningar och fyra egenskaper i kontextenjobger återanvändbara workflows deras ursprungliga identitet. 🔗 Ändringslogg - Dokumentären The Story of VS Code släpps den 4 september — GitHub uppmärksammar premiären av den officiella dokumentären om Visual Studio Code på utgivarens YouTube-kanal, efter att en trailer publicerades den 1 september. 🔗 Tillkännagivande
- Replit lyfter fram en app som byggdes på en vecka — Pep AI, som byggdes på plattformen av Cédric Roberge på ungefär en vecka, uppges enligt Replit generera omkring 130 000 dollar i månaden, i en reklamtråd följd av prissättningsråd. 🔗 Replit-tråd
- Zed publicerar ett visuellt tillkännagivande vars innehåll inte kunde verifieras — ett meddelande på fyra ord tillsammans med en enda bild, publicerat den 4 september kl. 22.14. Bilden laddades inte under granskningen och publiceringen åtföljs varken av ett blogginlägg eller versionsinformation: inget gör det möjligt att fastställa vad den tillkännager. 🔗 Meddelande
- Ett komplett öppet LLM-ekosystem för armeniska — en Hugging Face-samling förenar webbkorpusen ArmWeb, den verifierade vetenskapliga datamängden ArmSTEM och modellen arm-gemma-e4b, med en artikel som uppges vara på väg. 🔗 Blogginlägg
- VLM Run Gateway samlar OCR- och vision-modeller med öppna vikter bakom ett enda API — gatewayen exponerar modeller med öppna vikter för optisk teckenigenkänning, vision-language och datorseende via en enda endpoint, däribland PaddleOCR-VL-1.6. 🔗 Blogginlägg
- Sakana AI öppnar dörrarna till sitt ingenjörsteam den 5 oktober — Engineer Open House återkommer måndagen den 5 oktober 2026 kl. 18–21, i Toranomon eller online, med registrering via connpass. 🔗 Tillkännagivande
- Google beskriver sprintarna i sitt program för utvecklarupplevelsen i Gemini Enterprise — ett metodinriktat blogginlägg utan lansering: den beskrivna sprinten gäller styrning av AI i företag och levererar uppdaterad dokumentation samt standardiserade kodexempel för Agent Gateway och Semantic Governance. 🔗 Blogginlägg
- Suno namnger sin nästa modellgeneration, v6-familjen — i ett svar till en användare beskriver det officiella kontot den som företagets bästa arbete hittills, utan datum eller tekniska detaljer, dagen efter att de nya nedladdningsgränserna trädde i kraft. 🔗 Svar
- MiniMax och Together AI anordnar en kväll om ekonomin bakom öppna modeller i London — det gemensamma evenemanget Open by Design: The Economics of AI in Production äger rum den 16 september och är MiniMax enda publicering under perioden. 🔗 Tillkännagivande
- Mistral tar tillbaka konferensen AI Engineer till Paris den 23 och 24 september — återkomsten till Station F samlar teknikchefen Lélio Renard-Lavaud tillsammans med Black Forest Labs, Cognition och Hugging Face, efter att den föregående upplagan blivit fullbokad. 🔗 Tillkännagivande
- WebMCP Challenge stänger för bidrag — stängningen sker efter en tolv timmar lång senareläggning på grund av avbrottet den 3 september. Projekten granskas nu och vinnarna kommer att tillkännages inom kort. 🔗 Tillkännagivande
Vad det betyder
Den verkliga indikatorn har blivit hur snabbt ekosystemet tar till sig en frontier-modell. GPT-6 Astra tillkännagavs den 3 september; den 4 september finns den obegränsat tillgänglig i API:et, är allmänt tillgänglig på tio Copilot-ytor, har mätts av en tredje part som använder den i produktion och har integrerats genom tre på varandra följande korrigeringar i Codex CLI. En sådan tidsram på tjugofyra timmar fanns inte för ett år sedan. Den flyttar frågan från lansering till debitering: GitHub tillämpar leverantörens offentliga pris för Astra utan någon kampanjperiod, medan Gemini 3.8 Flash har introduktionspris till årets slut. När alla modeller blir tillgängliga dagen efter sina tillkännagivanden blir priset återigen den enda synliga särskiljande faktorn för slutanvändaren.
HydraFusion angriper problemet från andra hållet, och det är dagens mest strukturellt betydelsefulla nyhet för verktygen. Att välja mellan tjugo modeller är ett arbete som få utvecklare utför på allvar, och GitHub föreslår att man inte längre ska göra det alls: man väljer ett workflow och verktyget bestämmer modell för varje förfrågan. Siffrorna, 4,9 kvalitetspoäng mer till 67 procent lägre kostnad än Opus 5 på TerminalBench, är framför allt betydelsefulla för vad de antyder: vinsten kommer från orkestreringen, inte från en överlägsen modell. Om resultatet håller utanför testbänkens förhållanden upphör modellen att vara produkten och blir en utbytbar komponent bakom en kvalitetsport.
Agenter i företag lämnar ingenjörsavdelningen, och styrningen följer efter. SpaceXAI säger det uttryckligen: den intensivaste användningen av Grok Bot sker utanför kodning, och dagens mest talande siffra kommer från en granskning av programvarulicenser: 43 betalda abonnemang utan aktivitet på 90 dagar. Men det verkliga innehållet i dessa tillkännagivanden är behörighetsmekaniken. Mallen för systempromptar som SpaceXAI publicerat skiljer mellan tre regimer: alltid tillåtet, tillåtet från fall till fall och aldrig tillåtet. NVIDIA formulerar samma princip i sitt blogginlägg om agentminne: kontext kan ge underlag för en åtgärd, men kan inte ge behörighet till den. Två oberoende aktörer kommer samma dag fram till slutsatsen att en användbar agent i första hand definieras av vad den förbjuds att göra.
För kommandoradsverktyg går säkerheten framåt i sicksack snarare än i en rak linje. Gemini CLI tar bort en hårdkodad API-nyckel och förstärker sin sandbox, Claude Code korrigerar behörighetsregler som gjorde att mappar avsedda att vara skrivskyddade fortfarande kunde skrivas till, och Kimi Code tar bort blockeringen av destruktiva kommandon två dagar efter att den infördes. Det sistnämnda fallet är mest lärorikt: statisk analys av shell-kommandon ger tillräckligt många falska positiva resultat för att en skyddsmekanism som är korrekt på papperet ska bli outhärdlig i praktiken. Säkerheten i dessa verktyg avgörs inte när ett skydd tillkännages, utan av om det överlever mötet med användarna.
Kvar återstår dagens matematik och vetenskap, det som är svårast att bedöma i stunden. Fermatbeviset som formaliserades på elva dagar producerar ingen ny matematik: det verifierar ett trettio år gammalt resultat. Det är just detta som gör det intressant, eftersom sakkunniggranskning är flaskhalsen som mäts i år och Kevin Buzzard påpekar att dessa artefakter nu är tillräckligt robusta för att ligga till grund för annat arbete. Ai2:s klimatemulator och bananflugans konnektom följer samma logik: ingen av dem upptäcker något, men båda gör ett arbete praktiskt genomförbart vars kostnad tidigare omöjliggjorde storskalighet. Det är en mindre spektakulär användning än autonom upptäckt och sannolikt närmare det som AI faktiskt förändrar inom vetenskaplig verksamhet.
Källor
- GPT-6 Astra tillgänglig för Pro, Enterprise och Business Premium
- GPT-6 Astra allmänt tillgänglig i GitHub Copilot
- Perplexity utvärderar GPT-6 Astra med WANDR
- Codex CLI 0.153.3
- Bygg ett spel med Astra
- Formalisering av Fermats stora sats
- Beviset för Fermats stora sats på GitHub
- Project HydraFusion
- Lyria 3.5 i Gemini-appen
- Grok Bot för Enterprise
- Haggle Bot, SpaceXAIs inköpsagent
- Grok ansluter till finansiella konton via Plaid
- Claude Code 2.1.260
- Claude Code 2.1.261
- Kommandot ant apply
- En minnesdriven agent med NVIDIA NemoClaw
- Edge-resonemang kommer till Jetson
- Överföring av användaridentitet mellan federerade Kubernetes-plattformar
- Gemini CLI v0.60.0 nightly
- Ändringslogg för Antigravity
- SamudrACE-E3SMv3 från Ai2
- Det fullständiga konnektomet hos en bananflugshanne
- Muse Spark 1.3 max offentligt tillgänglig
- Percept-Lens från Sakana AI
- Percept-Lens-artikeln på arXiv
- TAOT i LoongForge
- Open Yap 1K
- Daily Brief utökas i USA
- Runway lanserar Team-abonnemanget
- 1 Million Voices kommer till Brasilien
- Kimi Code 0.41.0
- Snabba embeddings på GPU hos Perplexity
- Delta tillgängligt i betaversion för Windows
- Replit MCP i drift
- Integritetssäker endpoint för stjärnhistorik
- Flera konfigurationer för betrodd npm-publicering
- GitHub Actions-uppdateringar i början av september
- Berättelsen om VS Code
- Pep AI byggd på Replit
- Visuellt tillkännagivande publicerat av Zed
- Ett öppet LLM-ekosystem för armeniska
- VLM Run Gateway
- Sakana AI:s öppet hus för ingenjörer
- Sprintarna i Gemini Enterprises DevEx-program
- Suno antyder v6-familjen
- Open by Design i London
- AI Engineer återvänder till Paris
- WebMCP Challenge avslutas