ai-powered-markdown-translatorArtikel översatt från franska till svenska med gpt-6.1-sol.
Fredagen den 2 oktober publicerar Meta sex matematikartiklar som forskare har tagit fram med företagets modell Muse Spark; enligt Meta besvarar fem av dem forskningsfrågor som hittills varit öppna. Anthropic satsar 100 miljoner dollar på att utbilda 10 000 ingenjörer inom driftsättning genom Claude Frontier Academy och släpper Claude Code 2.1.288, samtidigt som NVIDIA tillkännager en DGX Spark med 64 GB från 4 999 dollar. Två tillkännagivanden från föregående kväll kompletterar dagens nyheter: Perplexitys Decisions API, som svarar med sannolikheter och använder en modell publicerad med öppna vikter, och Googles satellit som tar med företagets första TPU:er i omloppsbana.
Meta publicerar sex matematikartiklar skrivna med Muse Spark, Ai2 öppnar AstaBrief, Googles AI förutser influensa
2 oktober — Meta publicerar på sin forskningsblogg sex matematikartiklar som forskare har tagit fram med Muse Spark, företagets egen modell. Enligt Meta besvarar fem av dem forskningsfrågor som dittills varit öppna, utan att blogginlägget anger vilken artikel som är undantaget. Matematikerna har under de senaste månaderna arbetat med Muse Spark 1.1 och 1.2 i läget Thinking, direkt i chattgränssnittet på meta.ai, utan något specialanpassat forskningsramverk (custom research scaffold).
Following gold-medal-level performance from our AI models across five competitions in mathematics, physics, and chemistry, we asked a harder question: can AI contribute when a problem is genuinely open and without an existing solution path?
🇸🇪 Efter att våra AI-modeller presterat på guldmedaljnivå i fem tävlingar i matematik, fysik och kemi ställde vi oss en svårare fråga: kan AI bidra när ett problem verkligen är öppet och det inte finns någon väg till dess lösning? — @AIatMeta på X
Det redovisade protokollet är strikt: en grupp matematiker leder forskningen, en andra grupp granskar arbetet, och varje artikel anger vilka avsnitt som huvudsakligen skrivits av forskarna respektive av AI. Modellens bidrag varierar kraftigt mellan artiklarna, från kompletterande beräkningar till att skriva hela avsnitt:
| Matematiskt område | Resultat som Meta tillkännager | Muse Sparks bidrag enligt Meta |
|---|---|---|
| Sannolikhetsteori | Skarp tröskel för att anpassa en ellipsoid som går genom slumpmässiga gaussfördelade punkter i hög dimension | Bevisstrategier |
| Differentialekvationer | Divergens i ändlig tid för radiella lösningar med negativ energi till den icke-linjära biharmoniska Schrödingerekvationen med kritisk massa, en öppen fråga sedan 2015 | Beräkningar, prövning av argument, revidering av beviset |
| Gruppteori | En semiabelsk grupp är inte nödvändigtvis monomial: ett motexempel av ordning 384 till en förmodan av M. Kida (2024) | Sökprogram skrivet i GAP som hittade motexemplet |
| Optimering | Exakt regel som anger när en relaxation med cykler fångar det ursprungliga problemet | Sannolikhetsteoretisk omformulering, motexempel, bevisstrategi |
| Aritmetisk fysik | Tvåpunktsfunktionen i p-adisk strängteori är lika med en höjdfunktion, för en klass av kurvor som är mycket bredare än Tatekurvan | Bevisförslag, tre skrivna tekniska avsnitt |
| Icke-associativ algebra | Motexempel av dimension 3 till en förmodan om lösbara evolutionsalgebror | Motexempel och alternativa karakteriseringar |
Meta medger att tre av dessa problem också har lösts på andra håll: tre arbeten som publicerades i augusti om den gaussiska tröskeln, ett motexempel till Kidas förmodan som AI-agenten Nilradical rapporterade den 16 september, och motexempel om evolutionsalgebror av Hu och Wen. Enligt Meta har företagets egna resultat tagits fram oberoende, med andra angreppssätt. Tillkännagivandet följer på OpenAI:s besked den 21 september om att en intern modell hade löst över 100 öppna problem; Meta betonar användningen av en modell för allmänheten i befintligt skick och öppenheten kring AI:s bidrag, samtidigt som samtliga bevis fortfarande verifieras, korrigeras och skrivs om av matematiker.
🔗 Lösa öppna forskningsproblem tillsammans (Meta AI Research)
AstaBrief 8B: Ai2 släpper en öppen modell som skriver vetenskapliga rapporter med källhänvisningar
2 oktober — Ai2 släpper AstaBrief 8B som öppen modell. Den omvandlar en forskningsfråga och litteraturutdrag till en vetenskaplig rapport med källhänvisningar. Den driver nu läget Fast i funktionen ”Generate a report” i Asta, Ai2:s agentbaserade plattform för vetenskap, vid sidan av läget Thinking som drivs av Claude. Receptet är fortfarande enkelt: Qwen3-8B, övervakad finjustering (SFT) på 47 000 exempel som producerats av ScholarQA-pipelinen, följt av direkt preferensoptimering (DPO) på cirka 6 000 par, utan förstärkningsinlärning. Vikterna, som enligt modellkortet omfattas av licensen Apache-2.0, och träningsdata har publicerats: ett laboratorium kan köra modellen på sin egen hårdvara.
Modellen skriver sin rapport i en enda genomgång. Genom hela Asta-pipelinen tar en rapport i genomsnitt 51,1 sekunder i läget Fast jämfört med 178,5 i läget Thinking, alltså cirka 3,5 gånger snabbare. I en liten studie med mänskliga bedömare (14 frågor, 3 forskare) föredras DR Tulu totalt sett, men två av tre forskare föredrar AstaBrief när det gäller korrekta källhänvisningar. Ai2 påpekar att huvuddelen av träningen och utvärderingen gjordes 2025 och inte har upprepats mot dagens modeller.
🔗 AstaBrief släpps som open-source (Ai2)
Influensa: en modell utvecklad med Googles AI etta av 39 i CDC:s FluSight-utvärdering
30 september — Google meddelar att en modell för influensaprognoser som utvecklats med företagets AI var bäst under säsongen 2025-2026 i FluSight, det system hos USA:s centrum för sjukdomskontroll och förebyggande (CDC) som varje vecka, från oktober till maj, sammanställer prognoser för sjukhusinläggningar. CDC:s rapport efter säsongens slut bekräftar detta: bland de 39 modeller som valdes ut av de 53 som lämnades in av 34 grupper är den främsta enskilda modellen Google_SAI-FluEns, med ett relativt WIS på 0,56 (ett felmått: ju lägre det är, desto bättre är prognosen), före tre modeller på 0,58, däribland OHT_JHU-nbxd. FluSight-ensemblen, som CDC använder i sin offentliga kommunikation, kommer på 7:e plats.
Dessa prognoser har utvecklats med Empirical Research Assistance (ERA), ett AI-verktyg från Google som genererar optimeringsalgoritmer för olika vetenskapliga områden och är tillgängligt för betrodda testare. Den tillhörande forskningsartikeln beskriver ett autonomt system som skriver, utvärderar och förbättrar sin egen prognoskod genom trädsökning styrd av en LLM; det har också tagit fram modeller för COVID-19 och respiratoriskt syncytialvirus (VRS).
🔗 Blogginlägg från Google Research · CDC:s FluSight-rapport 2025-2026
Perplexity lanserar Decisions API och släpper pplx-decider-v1-27b som öppen modell, llama.cpp serverar beslutsmodeller
1 oktober — Perplexity öppnar ett nytt API, Decisions API, och publicerar modellen som driver det, pplx-decider-v1-27b, under licensen Apache 2.0. Tillkännagivandet kom på kvällen via @perplexitydevs, företagets utvecklarkonto. I stället för att skriva ett svar returnerar denna beslutsmodell (decision model) en sannolikhetsfördelning över en fast uppsättning svar: den läser text, JSON eller bilder, men skriver inga svar, genererar ingen kod och förklarar inte sitt resonemang.
Tre frågetyper stöds: noul returnerar sannolikheten för ett ja, choice väljer bland 1 till 255 alternativ med en sannolikhet för varje alternativ och ett konfidensmått, och score placerar innehållet på en skala med högst 10 nivåer. En förfrågan kan ställa upp till 128 frågor om samma innehåll och måste, inklusive frågorna, hålla sig under 262 144 tokens i indata. Priset är 0,04 dollar per miljon tokens i indata, utdata är gratis och ingen avgift tas ut per förfrågan; varje organisation kan skicka 10 förfrågningar per sekund, oavsett abonnemang. Perplexity riktar sig till klassificering, routing och poängsättning enligt en bedömningsmatris: företagets referensexempel (cookbook) sorterar supportärenden, där Decisions API fattar det första beslutet och Agent API hanterar eskaleringarna.
Modellen är finjusterad utifrån Qwen3.8-27B; dess vikter på Hugging Face kräver en CUDA-GPU med utrymme för cirka 49 GiB, plus arbetsminne. Modellkortet jämför den med Jev, en annan beslutsmodell, och med den egna basmodellen på elva benchmarks, där resultaten för pplx-decider-v1-27b mäts via Perplexitys API:
| Benchmark (träffsäkerhet) | Jevs resultat | Resultat för Qwen3.8-27B (basmodell) | Resultat för pplx-decider-v1-27b |
|---|---|---|---|
| WinoGrande | 90,70 % | 73,10 % | 83,30 % |
| FinancialPhraseBank | 76,98 % | 75,68 % | 84,18 % |
| RAGTruth | 77,27 % | 61,53 % | 88,80 % |
| JudgeBench | 78,57 % | 68,86 % | 78,29 % |
| BBH | 94,27 % | 72,80 % | 82,80 % |
| JevBench public hard | 73,27 % | 72,28 % | 70,30 % |
| TabFact | 89,80 % | 78,60 % | 90,60 % |
| ContractNLI | 77,45 % | 80,78 % | 80,78 % |
| Circa | 84,60 % | 87,00 % | 89,20 % |
| Belebele | 95,00 % | 93,20 % | 94,00 % |
| TruthfulQA binary | 92,00 % | 82,80 % | 85,40 % |
| Totalt (enligt modellkortet) | 84,51 % | 74,76 % | 85,71 % |
På raden Totalt, som lyfts fram i tillkännagivandet, ligger pplx-decider-v1-27b före Jev, 85,71 % mot 84,51 %, men modellkortet anger inte hur denna rad beräknas. Enligt den publicerade tabellen ligger Jev fortfarande före på sex av de elva benchmarksen, däribland BBH och WinoGrande, och på JevBench public hard hamnar Perplexitys modell till och med efter sin basmodell.
🔗 Tillkännagivande från @perplexitydevs · Dokumentation för Decisions API · pplx-decider-v1-27b på Hugging Face
llama.cpp serverar beslutsmodeller via API:et /v1/systemone, som är kompatibelt med Jev
2 oktober — Servern i llama.cpp kan nu servera beslutsmodeller via en ny endpoint, /v1/systemone, som infördes med PR nr 29818, som mergades den 2 oktober. Blogginlägget från ggml-org, skrivet av Xuan-Son Nguyen och Victor Mustar, beskriver principen: man skickar ett tillstånd (text, JSON, skärmbild) och typade frågor, choice, score (från 2 till 10 nivåer) eller noul (ja eller nej), och modellen returnerar en sannolikhet per alternativ i en enda genomgång. API:et använder formatet System One som introducerades av Jev, modellen från TypeSafe: en befintlig klient behöver bara byta bas-URL. Ett routerläge laddar flera modeller på begäran på samma server.
| Beslutsmodell som stöds | Modellstorlek | Basmodell | Mediantid per fråga |
|---|---|---|---|
| Julia-1 (över 50 språk) | 144M | mmBERT-small | 3 ms |
| Laya | 421M | ModernBERT-large | 5 ms |
| Kev-4B | 4B | Qwen3.5-4B-Base | 12 ms |
| lev | 4B | Qwen3.5-4B | 36 ms |
| OpenJev (läser även bilder) | 27B | Qwen3.8-27B | 43 ms |
Tiderna har mätts på en NVIDIA RTX PRO 6000. Nästa tillkännagivna modell är Clef, som Cloudflare presenterade den 1 oktober med ett API som är kompatibelt med Jevs; ggml-org skapade den 2 oktober GGUF-repositorierna för Clef och Clef-flash på Hugging Face.
🔗 Nytt i llama.cpp: beslutsmodeller
Anthropic lanserar Claude Frontier Academy och satsar 100 miljoner dollar på att utbilda 10 000 ingenjörer
2 oktober — Anthropic lanserar Claude Frontier Academy, ett utbildningsprogram med en finansieringssatsning på 100 miljoner dollar. Målet är att utbilda 10 000 ingenjörer för avancerad driftsättning (Frontier Deployed Engineers, FDE) före slutet av 2027. De första utbildningsgrupperna består av ingenjörer från Accenture, Bain, Capgemini, Commonwealth Bank of Australia, Deloitte, McKinsey, Morgan Stanley och Novo Nordisk.
Det första programmet, Frontier Deployed Engineer Residency, följer modellen för läkarutbildning. Enligt programsidan börjar det med en intensivmodul på fyra dagar: tre dagar på plats där deltagarna bygger ett Claude-system för ett simulerat företag, följt av ett betygsatt prov som ger utmärkelsen Claude Resident Engineer. Därefter följer tolv veckors praktiktjänstgöring där deltagarna genomför en driftsättning av Claude i sin egen organisation, och sedan en slutbedömning för utmärkelsen Claude Frontier Deployed Engineer; de första väntas i början av 2027.
Tillgången är fortsatt begränsad: deltagande efter nominering, tidig tillgång reserverad för utvalda kunder och partner, och utbildningsgrupper i San Francisco, New York och London. Academy bygger vidare på Claude Partner Network (46 000 företag, över 175 000 certifieringar), som lanserades i mars med 100 miljoner dollar; blogginlägget anger inte om det nya beloppet tillkommer utöver detta.
🔗 Anthropics tillkännagivande · Programsidan
Agenter: Claude Code 2.1.288, GLM 5.3 i Cursor, Replit, DeepSeek Harness och benchmarken SWE-sweep
Claude Code 2.1.288 tar bort tidsgränsen för bakgrundskommandon i interaktiva sessioner
2 oktober — Claude Code 2.1.288 kommer med 89 poster, varav 64 korrigeringar. Den mest synliga förändringen gäller kommandon som körs i bakgrunden: tidsgränsen som infördes i 2.1.285 (30 minuter som standard, högst 2 timmar) gäller nu bara obevakade sessioner (-p, Agent SDK, CI, cloud). I terminalen, skrivbordsappen och VS Code kan ett bakgrundskommando återigen köras utan tidsgräns.
En prompt som raderats av misstag med Ctrl+C kan återställas med uppåtpilen, /code-review accepterar --max-findings för att rapportera fler eller färre problem, claude project purge blir claude purge, och mods, som lanserades dagen innan, får $.ui.selection(), som returnerar den senast markerade texten i helskärmsläge. När API:et når sin tidsgräns mitt i ett svar fortsätter icke-interaktiva sessioner och underagenter från det partiella svaret i stället för att misslyckas. På säkerhetssidan släpps ett farligt rm som smygs in i ett bash -c-script inte längre igenom utan bekräftelse i bypassPermissions-läge, och en PreToolUse- eller PermissionRequest-hook vars matchning misslyckas blockerar nu anropet i stället för att ignoreras. Slutligen ignorerar klassificeraren för auto-läget på klientsidan nu en ANTHROPIC_DEFAULT_SONNET_MODEL-variabel som pekar på Sonnet 5.5 eller Opus 5.5, och använder Claude Sonnet 5 i stället.
Sex minuter efter releasen lyfte @ClaudeDevs fram You should know, en inbyggd mod som startar en sekundär agent med uppgift att visa information som inte bör missas ovanför prompten. Den ingick redan bland de sex inbyggda mods som presenterades den 1 oktober och är fortfarande avstängd som standard.
We’re adding a new plugin to Claude Code: You should Know. It scans Claude’s output for important information you might miss to help keep you in the loop. Enable it with: /plugin enable cc-plugin-you-should-know@builtin
🇸🇪 Vi lägger till en ny plugin i Claude Code: You should Know. Den söker igenom utdata från Claude efter viktig information som du kan missa, så att du hålls uppdaterad. Aktivera den med: /plugin enable cc-plugin-you-should-know@builtin — @ClaudeDevs på X
🔗 Versionsinformation för Claude Code 2.1.288
GLM 5.3 och GLM 5.3 Flash kommer till Cursor
1 oktober — Cursor lägger till GLM 5.3 och GLM 5.3 Flash, Z.ai:s öppna modeller, i sin modellväljare och hävdar att GLM 5.3 Max ligger på första plats bland öppna modeller i företagets egen benchmark.
GLM 5.3 and GLM 5.3 Flash are now available in Cursor! GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0.
🇸🇪 GLM 5.3 och GLM 5.3 Flash finns nu i Cursor! GLM 5.3 Max är modellen med öppna vikter som har högst betyg på CursorBench 4.0. — @cursor_ai på X
Det bifogade diagrammet placerar modellerna efter deras poäng på CursorBench 4.0 och genomsnittliga kostnad per uppgift, men bara en punkt har en etikett: GLM 5.3 märkt ”(max)”, med 42,6 % för 5,05 dollar per uppgift. Enligt diagrammet ligger GLM 5.3 under Claude Opus 5.5, Claude Sonnet 5.5, Fable 5.1 och Grok 4.7, ingen annan öppen modell finns med och GLM 5.3 Flash visas inte. Cursor har varken publicerat prisuppgifter, något blogginlägg eller någon metod som stöd för rankningen.
Replit gör GPT-6.1 Sol och Claude Sonnet 5.5 tillgängliga i Agent, och Jev i sina AI Integrations
2 oktober — Replits changelog lägger till två nya modeller att välja mellan i Replit Agent: Claude Sonnet 5.5 i Power-läge och GPT-6.1 Sol i Max-läge. Samma post gör Jev, beslutsmodellen som redan nämnts i jämförelse med pplx-decider-v1-27b, tillgänglig i Replit AI Integrations: en applikation kan klassificera innehåll, routa förfrågningar eller poängsätta potentiella kunder genom snabba och strukturerade beslut, utan att hantera en API-nyckel. Dokumentationen anger att Jev tillhandahålls under identifieraren jev-latest via OpenRouter. Inställningarna öppnas nu på en helsida, och Enterprise-konton kan ange regler för hela företaget, med undantag per team (Workspace). Posten anger inga priser.
🔗 Replits changelog från den 2 oktober
DeepSeek Harness kan installeras på macOS och Windows
30 september — Kontot @DeepSeekHarness tillkännager en skrivbordsversion av DeepSeek Harness, DeepSeeks agent-harness med öppen källkod, för macOS och Windows. Den 2 oktober delar huvudkontot @deepseek_ai tillkännagivandet och förtydligar att Linux-användare använder npm-paketet @deepseek-ai/dsh. Installationsprogrammen kan laddas ned från DeepSeeks webbplats, för macOS med ARM-chip och för Windows x64.
Den officiella sidan, märkt PREVIEW, presenterar Harness som en offentlig förhandsversion som är tillgänglig över hela världen och har öppen källkod. Den bygger på arkitekturen ”allt är en plugin” (everything is a plugin) i frameworket Cordis och omfattar kontorsarbete (filer, data, dokument, presentationer), kod, research med källhänvisningar och bakgrundsuppgifter, med ett Creator-läge som låter nya plugins skrivas genom samtal. Det nya är distributionsformen: förhandsversionen från den 29 september hade redan integrerat kommandot dsh i skrivbordsappen, och ingen stabil version har ännu publicerats på GitHub.
🔗 Tillkännagivandet från @deepseek_ai · Sidan för DeepSeek Harness
SWE-sweep: en benchmark där agenterna själva måste hitta bugs att åtgärda
1 oktober — Forskare vid Meta Superintelligence Labs, tillsammans med Harvard, University of Washington och Stanford, gör SWE-sweep tillgänglig, en benchmark som kräver att kodagenter själva upptäcker bugs i ett riktigt repo och åtgärdar så många som möjligt, utan ledtrådar om deras typ eller plats. Datasetet omfattar 100 repon och 4 068 bugs; koden, med MIT-licens, bygger på frameworket Harbor, och Ofir Press och John Yang finns bland författarna. Inget tillkännagivande har ännu publicerats om repot, som skapades den 1 oktober.
Rankningen, som uppdaterades den 24 september och mättes med agenten mini-SWE-agent, visar uppgiftens omfattning:
| Placering | Utvärderad modell | Åtgärdade bugs | Total kostnad |
|---|---|---|---|
| 1 | Sol 5.6 (xhigh), OpenAI | 4,7 % | 7 230 dollars |
| 2 | Luna 5.6 (xhigh), OpenAI | 2,5 % | 224 dollars |
| 3 | Terra 5.6 (xhigh), OpenAI | 1,5 % | 357 dollars |
| 4 | Luna 5.6 (high), OpenAI | 1,4 % | 28 dollars |
| 5 | Opus 5 (xhigh), Anthropic | 1,3 % | 5 363 dollars |
Beräkning och hårdvara: de första TPU:erna i omloppsbana, DGX Spark 64 Go, DeepGEMM och DeepEP på Ascend 950
Project Suncatcher: Googles prototypsatellit tar med de första TPU:erna till omloppsbana
1 oktober — En vecka efter att ha tillkännagett sitt första test i omloppsbana har Google skjutit upp prototypsatelliten för Project Suncatcher, ett långsiktigt forskningsprojekt (moonshot) som undersöker om rymden en dag skulle kunna hysa storskalig infrastruktur för maskininlärning. Satelliten, som byggts tillsammans med Planet, nådde omloppsbana ombord på Transporter-18, en samåkningsmission från SpaceX; enligt Travis Beals på Google har teamet etablerat kontakt och satelliten fungerar som planerat.
Under de kommande veckorna ska Google mäta hur företagets TPU:er klarar rymdfärdens påfrestningar och extrema strålnings- och temperaturförhållanden; på marken hade Trillium-TPU:er redan klarat en strålningsdos som överstiger den under ett femårigt uppdrag. Den sakkunniggranskade artikeln som beskriver forskningen publiceras i tidskriften Joule. När @GoogleAI delar uppskjutningen den 2 oktober påminner kontot om projektets argument: i låg omloppsbana är solljuset nästan konstant och satelliter kan producera upp till 8 gånger mer solenergi än på jorden. Nästa aviserade steg: två satelliter 2027 för att testa laserlänkar.
🔗 Prototypen för Project Suncatcher är i omloppsbana · Artikeln som publicerats i Joule · Inlägget som delats av @GoogleAI
DGX Spark 64 Go: NVIDIA lägger till en konfiguration som säljs från den 23 oktober
2 oktober — NVIDIA lägger till en konfiguration med 64 Go enhetligt minne för DGX Spark, vid sidan av modellen med 128 Go. Den kommer att säljas enbart av sex partnertillverkare, Acer, ASUS, Dell, Gigabyte, HP och MSI, från fredagen den 23 oktober, med ett startpris på 4 999 dollar; blogginlägget anger inte det aktuella priset för modellen med 128 Go. Grunden är densamma: GB10 Grace Blackwell-chip, DGX OS och NVIDIA AI:s mjukvarustack, för modeller med upp till 100 miljarder parametrar som körs på maskinen.
Huvudargumentet är möjligheten att koppla ihop enheter i ett kluster: två enheter som ansluts med en QSFP-kabel via sina ConnectX-7-nätverkskort delar på minnet.
| Teknisk egenskap | En DGX Spark 64 Go | Två DGX Spark 64 Go i ett kluster |
|---|---|---|
| Enhetligt minne | 64 Go | 128 Go gemensamt |
| Angiven modellstorlek | Upp till 100 miljarder parametrar | Upp till 200 miljarder parametrar |
| Prestanda på Qwen 3.8 27B (NVIDIA-test) | Referens | Upp till 1,7 gånger |
Appen NVIDIA Sync hanterar detta med Cluster Assistant, som upptäcker enheterna och konfigurerar nätverket. NVIDIA Sync Model Launcher, som aviserats till slutet av månaden, ska ladda ned och starta Qwen3.8 27B på en maskin eller ett kluster, och konfigurera OpenCode för att använda modellen.
🔗 NVIDIAs blogginlägg om DGX Spark 64 Go
DeepSeek portar DeepGEMM och DeepEP till Huaweis Ascend 950-NPU:er
29 och 30 september — DeepSeek har publicerat två portningar av sina beräkningsbibliotek till Huaweis Ascend-NPU:er på GitHub, utan något tillkännagivande. DeepGEMM-Ascend, vars README daterar den första versionen till den 30 september, använder exakt samma API som DeepGEMM: matrismultiplikationer i BF16, FP8 och FP4, MQA-logits och MegaMoE, med MIT-licens, för Ascend 950-serien. DeepEP-Ascend portar kommunikationsbiblioteket för expertparallellism (expert parallelism) i MoE-modeller, med all-to-all-operationerna för fördelning (dispatch) och återsammansättning (combine).
På Ascend 950DT mäter DeepEP-Ascend en fördelningshastighet på 373 till 375 Go/s med 8 ranks och 313 till 320 Go/s med 128 ranks; upp till 32 ranks når det cirka 90 till 95 % av den fysiska bandbreddsgränsen. Dessa siffror uppnåddes med ett hårdvarukit (HDK) för proof of concept som tillhandahållits DeepSeek och en manuell konfiguration, vilka inte distribueras offentligt; README hänvisar till den kommersiella versionen, som Huawei planerar att göra tillgänglig omkring den 15 oktober.
🔗 DeepGEMM-Ascend på GitHub · DeepEP-Ascend på GitHub
Röst och ljud: Suno Speech i beta, ElevenLabs certifierat enligt FedRAMP 20x Class A
Suno Speech genererar tal och bakgrundsmusik i samma spår
1 oktober — Suno gör Speech tillgängligt i beta, en funktion som skapar talat ljud med originalkomponerad bakgrundsmusik direkt i Suno: användaren skriver in en idé, en dikt eller en text och beskriver sedan önskad röst och musikstil. Suno presenterar Speech som den första ljudmodellen som genererar röst och musik tillsammans, i ett enda sammanhängande spår. Funktionen, som testats under en månad av en liten grupp användare, är nu tillgänglig för alla efter en uppdatering av appen.
Blogginlägget, undertecknat av produktchefen Jack Brody, nämner främst personliga användningsområden: meddelanden från vänner som förvandlas till dramatiska uppläsningar, röstanteckningar som tonsätts, meditationer eller godnattsagor. Suno påpekar att betan fortfarande har brister: en brittisk accent kan glida över till en australisk, och de dramatiska pauserna kan bli mycket markerade. Varken priser, abonnemang eller språk som stöds anges.
🔗 Vi presenterar Speech (Suno)
ElevenLabs certifierat enligt FedRAMP 20x Class A för ElevenAgents och sina röst-API:er
1 oktober — ElevenLabs får certifieringen FedRAMP 20x Class A, ramverket som amerikanska federala myndigheter använder för att avgöra om en cloud-produkt kan användas säkert med myndighetsdata. Certifieringen omfattar ElevenAgents och API:erna Text to Speech och Speech to Text, förutsatt att de körs i Zero Retention Mode med datalagring i USA. Den utökar erbjudandet ElevenLabs for Government, och företaget finns nu på FedRAMP Marketplace. Enligt FedRAMP, som citeras av ElevenLabs, räcker Class A-nivån för de flesta av myndigheternas användningsområden som inte är känsliga; ElevenLabs nämner ansökningar om förmåner, tillstånd, skatter och transkribering av förhandlingar.
ElevenLabs stöder tillkännagivandet med befintliga driftsättningar inom offentlig sektor:
| Nämnd driftsättning inom offentlig sektor | Siffra som anges av ElevenLabs |
|---|---|
| Nationell telefonlinje för sysselsättning (Ukraina) | 25 % hanteras av samtalsagenter |
| Telefonlinjer för förmåner och sysselsättning (Tjeckien) | 85 % av cirka 5 000 samtal per dag löses |
| Staden Midland | 7 000 färre missade samtal per månad (prognos) |
ChatGPT öppnar Finances för Free- och Go-användare i USA
2 oktober — Finances, ChatGPT:s utrymme för privatekonomi, utökas till abonnemangen Free och Go i USA, på webben, iOS och Android. Funktionen fanns redan för Plus- och Pro-abonnenter: den lanserades som en förhandsversion enbart för Pro-abonnenter i maj och fick den 21 september uppföljning av kreditpoäng från Experian för Plus- och Pro-abonnenter. Nu omfattar den abonnemangen Free, Go, Plus och Pro, fortfarande enbart i USA.
Principen är densamma: man kopplar sina bank- och investeringskonton via Plaid och sin kreditupplysning via Experian, två anslutningar som kan användas tillsammans eller var för sig. Sidan Finances samlar utgifter, räkningar, abonnemang, nettoförmögenhet, investeringar och kreditpoäng. I samtalet kategoriserar ChatGPT utgifterna, identifierar abonnemang, jämför månaden med den senaste tidens trender och organiserar skatteuppgifter samt pekar på möjligheter att undersöka, som avdrag.
🔗 Versionsinformation för ChatGPT · Finances i ChatGPT
SpaceXAI publicerar sitt officiella TypeScript-SDK i en experimentell version
2 oktober — SpaceXAI har utan något tillkännagivande publicerat den första offentliga versionen av sitt officiella TypeScript-SDK. Version 0.1.0 släpptes kl. 16.57 UTC, följd kl. 18.25 UTC av version 0.2.0, som byter namn på klientklassen xAI till SpaceXAI: en ändring som bryter bakåtkompatibiliteten och anpassar koden till företagets nya namn. SDK:t omfattar redan Responses API (streaming, compaction och samtal i flera turer), plattformens inbyggda verktyg (webbsökning och sökning på X, kodkörning, fjärranslutna MCP-servrar), generering och redigering av bilder och videor samt API:erna Files, Batch och Voice.
| Del av SDK:t | Observerad detalj |
|---|---|
| npm-paket | @xai-official/sdk |
| Licens | Apache-2.0 |
| Förutsättningar | Node.js 22.13 eller senare, ESM-projekt, inga beroenden vid körning |
| Status | Experimentellt, gränssnitten är inte fastställda före 1.0 |
Som standard vägrar SDK:t att köras i en webbläsare eller en Worker för att undvika att den hemliga nyckeln exponeras på klientsidan. TypeScript-utvecklare får därmed en motsvarighet till det officiella Python-SDK:t, vars version 1.20.0 släpptes den 24 september.
🔗 CHANGELOG för SpaceXAI:s TypeScript-SDK · Paketet @xai-official/sdk på npm
Kortnyheter
- GPT-6.1 Sol i v0 — Den 29 september, samma dag som modellen släpptes, gjorde Vercels appgenerator v0 GPT-6.1 Sol tillgänglig, några timmar efter att ha öppnat för anslutning med ett ChatGPT-abonnemang; tillkännagivandet anger varken pris eller mätvärden specifika för v0. 🔗 källa
- Ny agentöversikt i Grok Build — Den tillkännagavs den 1 oktober och visar alla agenter på en enda skärm med
/dashboard, startar uppgifter parallellt och placerar en agent i en egen git-worktree med Ctrl+W; Grok Build fick sin första översikt den 15 juni. 🔗 källa - Nightly-version av Gemini CLI — Version v0.64.0-nightly från den 2 oktober innehåller bara åtta korrigeringar: Ctrl+C avbryter återigen en pågående operation och tillståndet
~/.gemini/state.jsonskrivs atomiskt, med en säkerhetskopia.baksom återställs vid korruption; den stabila versionen och förhandsversionen är oförändrade. 🔗 källa - Modeller tas bort från GitHub Copilot — Som meddelades den 3 september försvinner Gemini 3.5 Flash, Gemini 3.6 Flash, Kimi K2.7 Code och Claude Opus 4.7 från alla Copilot-miljöer; GitHub föreslår Gemini 3.8 Flash, Kimi K3 och numera Claude Opus 5.5 i stället för Claude Opus 5. 🔗 källa
- Testa en SKILL.md — I ett communityinlägg föreslår Golda Manuel en metod, utan publicerade mätresultat, för att kontrollera att en färdighet hittas, laddas och är användbar för kodagenter: placering där Claude Code eller Codex förväntar sig den, aktivering vid tre nivåer av förfrågningar och jämförelse med och utan färdigheten utifrån åtta mått. 🔗 källa
- Manus beskriver Video Editor och Game Dev närmare — Två inlägg från den 1 oktober går djupare in på Manus 2.0: Video Editor i Manus Studio placerar varje del av en video på ett eget spår (125 klipp redigerade till en film på 10 min 50 s med 195 klippövergångar), och Game Dev justerar ett spel i realtid; varken pris eller datum anges. 🔗 Video Editor · 🔗 Game Dev
- AutoSynthData från ServiceNow — ServiceNows CoreAI-team genererar verifierade träningsuppgifter utifrån en modells misslyckanden: på EnterpriseOps Gym förbättrar Gemma-4-26B-A4B-it Pass@1 med 7,2 poäng inom området Hybrid och går från 18,77 % till 27,18 % inom ITSM; varken kod eller data har publicerats. 🔗 källa
- POCKET-Darwin-180B — VIDRAFT publicerar en 4-bitars GGUF-version på 111 GB (jämfört med 360 GB) av Darwin-180B-RSI, en MoE med 180 miljarder parametrar: mellan 18,4 och 21 tokens per sekund med enbart processor, 4,17 på en bärbar dator med en RTX 5060 på 8 GB och 87,65 % på MMLU-Pro, precis som originalet, enligt författarna. 🔗 källa
- Guide till GPT-6-modellerna — OpenAI publicerar en guide för startupföretag: GPT-6 Astra för de svåraste resonemangen, GPT-6.1 Sol för komplex kod, forskning och datoranvändning samt GPT-6 Luna för avgränsade uppgifter i stor skala; cachade tokens kostar upp till 95 % mindre beroende på modell. 🔗 källa
- ChatGPT skannar flera sidor till en enda PDF med kameran på iOS — under utrullning, 1 oktober.
- Chatham Financial och Codex — Konsultföretaget inom kapitalmarknader har byggt en applikation för transaktionsvalidering med Codex: enligt de första mätningarna minskar kontrolltiden från omkring 30 minuter till under 4; företagets plattform Onyx kombinerar GPT-5.6 Sol och Terra, GPT-5.4 och GPT-4.1. 🔗 källa
- The Den och ChatGPT Work — Enligt en fallstudie från OpenAI daterad den 1 oktober sparar ledningsgruppen för denna föräldraklubb i Denver 10 till 15 timmar per vecka med ChatGPT Work, anslutet till Gmail, Slack och Google Drive; en bidragsansökan tar 2 timmar i stället för 3 dagar. 🔗 källa
- GPT-6 Astra Ultrafast på Blackwell — NVIDIA förtydligar den 1 oktober att Ultrafast-nivån för GPT-6 Astra, som OpenAI lanserade den 29 september, körs på företagets Blackwell-GPU:er, upp till 8 gånger snabbare än läget Astra Standard, och att OpenAI optimerar sin inferensprogramvara med sina egna modeller; inga nya siffror anges. 🔗 källa
- RL Rollouts hos CoreWeave — Tjänsten presenterades den 30 september tillsammans med CoreWeave Forge och uppmärksammades av NVIDIA den 2 oktober. Den bygger på NVIDIA Dynamo och laddar nya checkpoints under pågående efterträning med förstärkningsinlärning; för Nemotron 3.5 Lightning förbättras latensen vid omladdning av modellen med en faktor 15. 🔗 källa
- Eleven v4 i ElevenReader — ElevenLabs mest uttrycksfulla röstmodell, som lanserades den 28 september, kommer till företagets läsapp: artiklar, e-böcker och PDF:er med vald röst, på över 90 språk, på iOS, Android och webben. 🔗 källa
- Midjourneys alpha-changelog — Den är daterad den 1 oktober och samlar främst korrigeringar, bland annat promptinställningar som sparas per mapp och stilreferenser som grupperas i en etikett, inför nya samarbetsverktyg som aviserats till veckan därpå. 🔗 källa
- Grok 4.7 till halva priset i Ramp Router — Fram till den 6 oktober erbjuder LLM-gatewayen Ramp Router Grok 4.7 med 50 % rabatt, ett erbjudande som SpaceXAI har uppmärksammat; modellen kostar 2 dollar för indata och 6 dollar för utdata per miljon tokens via SpaceXAI:s API. 🔗 källa
- Konfidentiella kommentarer om säkerhetsmeddelanden — GitHub gör det möjligt att kommentera ett säkerhetsmeddelande för ett repository utan att rapportören ser det: endast personer med skrivåtkomst kan läsa kommentarerna, och läsningarna loggas; ett REST-API för kommentarer blir tillgängligt som offentlig förhandsversion. 🔗 källa · 🔗 REST-API
- GraphQL-API för GitHub Advisory Database — Objektet SecurityAdvisory får fem nya fält, bland annat CVE-identifieraren och NVD:s publiceringsdatum, och frågan securityAdvisories får två filter, för allvarlighetsgrad och tillbakadragen status: det behövs inte längre någon omväg via REST-API:t. 🔗 källa
- Slutet för macOS 14-avbildningen i GitHub Actions — Avvecklingen tillkännagavs den 1 oktober och sker den 2 november, föregången av åtta planerade avbrott i oktober, från kl. 14 till midnatt UTC; workflows måste byta till macos-15 eller macos-latest, som pekar på macos-26. 🔗 källa
- AI-mognad i företag — Perplexity publicerar en guide som beskriver fyra mognadsstadier, sammanfattar ramverken från Gartner, Deloitte och Google Cloud och föreslår en mall för självutvärdering; enligt den McKinsey-undersökning från 2026 som guiden hänvisar till ser 80 % av de svarande förbättrad personlig produktivitet, men bara 37 % ett bidrag till EBIT. 🔗 källa
Vad det betyder
AI som tillämpas inom vetenskap bedöms allt oftare enligt kriterier som är oberoende av dem som presenterar den. Meta nöjer sig inte med att rada upp resultat: varje artikel anger vilka avsnitt AI har skrivit, en andra grupp matematiker granskar dem och inlägget medger att tre av problemen också har lösts på annat håll. Influensaprognosmodellen som har utvecklats med Googles AI får sitt värde genom en utvärdering som CDC genomfört under en hel säsong, i jämförelse med 38 andra modeller. Ai2 publicerar vikterna och data för AstaBrief, men påpekar att jämförelserna är från 2025: en öppen modell kan kontrolleras, en utvärdering åldras.
Beslutsmodeller blir på några dagar en egen kategori. Efter Jev, d1 från Liquid AI och Clef från Cloudflare erbjuder Perplexity både ett API som debiteras per ingående token och modellens vikter; llama.cpp kör dessa modeller lokalt med samma System One-format, och Replit lägger till Jev bland sina integrationer utan krav på API-nyckel. För en utvecklare är nyttan konkret: en sannolikhet för varje alternativ, beräknad i en enda körning, i stället för ett textsvar som sedan måste analyseras. Jämförelserna kräver försiktighet: raden Overall i modellbeskrivningen placerar pplx-decider-v1-27b före Jev, men de publicerade detaljerna ger Jev fördel i sex av elva benchmarks.
Kodagenter utvecklas snabbare än deras faktiska autonomi. När den bästa modellen lämnas ensam med ett repository på SWE-sweep hittar och åtgärdar den bara 4,7 % av buggarna, till en kostnad på över 7 000 dollar. Claude Code 2.1.288 ägnar merparten av sina 89 poster åt korrigeringar, bland annat återupptagning efter en API-timeout och flera skärpta behörighetsregler, och lyfter fram en mod som övervakar huvudagentens arbete. Anthropic tar sig an den andra flaskhalsen, människors kompetens, med 100 miljoner dollar för att utbilda ingenjörer som kan genomföra en driftsättning hela vägen till produktion. De öppna modellerna tar samtidigt plats i verktygen, med GLM 5.3 i Cursor och DeepSeek Harness på skrivbordet.
Beräkningshårdvaran breddas slutligen i tre riktningar. Google testar TPU:er i omloppsbana som en dag skulle kunna få tillgång till upp till 8 gånger mer solenergi än på jorden, NVIDIA lägger till en konfiguration på 64 GB för DGX Spark som kan kopplas ihop parvis för att nå 200 miljarder parametrar, och DeepSeek gör sina lågnivåbibliotek användbara med samma API på Huaweis Ascend-chip. Var och en breddar på sitt sätt var modeller kan köras och på vilken hårdvara.
Källor
- Lösa öppna forskningsproblem tillsammans (Meta AI Research)
- Tråd från @AIatMeta om de sex artiklarna
- AstaBrief görs till öppen källkod (Ai2)
- Inlägg från Google Research om influensaprognoser
- CDC:s FluSight-rapport 2025-2026
- Tillkännagivande av Decisions API från @perplexitydevs
- Dokumentation för Decisions API
- pplx-decider-v1-27b på Hugging Face
- Nytt i llama.cpp: beslutsmodeller (ggml-org)
- Claude Frontier Academy (Anthropic)
- Programsidan för Claude Frontier Academy
- Versionsinformation för Claude Code 2.1.288
- You should know lyfts fram av @ClaudeDevs
- GLM 5.3 i Cursor, tillkännagivande från @cursor_ai
- Replits changelog från den 2 oktober
- DeepSeek Harness uppmärksammas av @deepseek_ai
- Sidan för DeepSeek Harness
- SWE-sweep
- Prototypen för Project Suncatcher är i omloppsbana (Google)
- Artikel om Project Suncatcher i Joule
- Lanseringen uppmärksammas av @GoogleAI
- DGX Spark 64 GB (NVIDIA:s blogg)
- DeepGEMM-Ascend på GitHub
- DeepEP-Ascend på GitHub
- Presentation av Speech (Suno)
- ElevenLabs certifierat enligt FedRAMP 20x Class A
- Versionsinformation för ChatGPT
- Finances i ChatGPT (OpenAI:s hjälpcenter)
- CHANGELOG för SpaceXAI:s TypeScript-SDK
- Paketet @xai-official/sdk på npm
- GPT-6.1 Sol i v0 (@v0)
- Agentöversikt i Grok Build (@grok)
- Nightly v0.64.0 från den 2 oktober för Gemini CLI
- Utfasade modeller i GitHub Copilot
- Hjälper din SKILL.md kodagenter?
- Video Editor från Manus
- Game Dev från Manus
- AutoSynthData (ServiceNow)
- POCKET-Darwin-180B (VIDRAFT)
- En modellguide för GPT-6-familjen (OpenAI)
- Chatham Financial och OpenAI
- The Den och ChatGPT Work
- GPT-6 Astra Ultrafast på Blackwell (NVIDIA:s blogg)
- Presentation av CoreWeave Forge
- Eleven v4 i ElevenReader (@ElevenLabs)
- Midjourneys alpha-changelog från den 1 oktober
- Grok 4.7 i Ramp Router (@SpaceXAI)
- Konfidentiella kommentarer om säkerhetsmeddelanden (GitHub)
- REST-API för kommentarer om säkerhetsmeddelanden (GitHub)
- Nya fält i GraphQL-API:t SecurityAdvisory (GitHub)
- Avveckling av macOS 14-avbildningen i GitHub Actions
- Perplexitys guide till AI-mognad