ai-powered-markdown-translatorArtikel översatt från franska till svenska med gpt-5.6-sol.
Tisdagen den 22 september lanserar Anthropic och OpenAI var sin frontier-modell med mindre än två timmars mellanrum: Claude Opus 5.5, som uppges ligga på samma nivå som Fable 5.1 till 40 % lägre kostnad än Opus 5, följd av GPT-6 Sol och GPT-6 Luna, vars API-priser halveras jämfört med kampanjpriset för GPT-5.6. Båda modellfamiljerna kommer samma dag till GitHub Copilot, Devin och Perplexity, samtidigt som Claude Code 2.1.280 uppgraderar abonnemangen Pro och Team Standard från Sonnet till Opus. Codex CLI 0.156.0, höjda användningsgränser hos Anthropic och en rad publikationer från NVIDIA avrundar dagen.
Anthropic lanserar Claude Opus 5.5, den första modellen i Claude 5.5-familjen
22 september — Anthropic lanserar Claude Opus 5.5 (claude-opus-5-5), den första modellen i företagets nya Claude 5.5-familj; Sonnet 5.5 och Haiku 5.5 följer ”under de kommande veckorna”. Den är tillgänglig från och med i dag via Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud och Microsoft Foundry och blir standardmodell i Claude Code för betalabonnemang. Kontextfönster på en miljon tokens, maximal utdata på 128 000 tokens och tillförlitliga kunskaper fram till juni 2026.
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.
It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
🇸🇪 Här är Claude Opus 5.5, den första modellen i vår nya Claude 5.5-familj. Den presterar på samma nivå som Claude Fable 5.1 för de flesta uppgifter och kostar 40 % mindre att köra än Opus 5. — @claudeai på X
Enligt Anthropic mäts dessa 40 % ”med standardinställningarna” för typiska arbetsbelastningar och är en kombination av lägre priser och färre tokens per uppgift. Priserna sjunker med 20 % (4 dollar för indata och 20 för utdata per miljon tokens, jämfört med 5 respektive 25 för Opus 5) och med 60 % för läsning från cache (0,20 dollar). Utdata genereras över 30 % snabbare, och ett snabbläge (fast mode), som finns i forskningsförhandsversion, utlovar upp till 2,5 gånger högre hastighet för 8 respektive 40 dollar.
| Benchmark (Anthropics siffror) | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench 4.0 | 66,4 % | 55,8 % | 57,9 % |
| FrontierCode v1.1 Main | 54,4 % | 50,3 % | 53,3 % |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1542 |
| OSWorld 2.0 | 81,8 % | 80,7 % | — |
| AutomationBench | 40,0 % | 31,4 % | 41,4 % |
| Terminal-Bench-Science 0.1 | 58,7 % | 52,6 % | 64,6 % |
Opus 5.5 tar ledningen inom agentbaserad kodning, kontorsarbete och datoranvändning, men GPT-6 Astra ligger fortfarande före på AutomationBench och Terminal-Bench-Science. Anthropic preciserar att företagets resultat mättes med produktionsskydd aktiverade, vilket sannolikt sänker dem, och anser att marginalerna i benchmarks har blivit ”en mindre tillförlitlig vägledning”: i praktisk användning sägs skillnaden mot Fable 5.1 vara mindre än vad dessa siffror antyder. Det är den första Opus-modellen som lanseras med skydd i klass med Fable 5.1 inom cybersäkerhet, biologi och distillation (de flesta cyberuppgifter växlar till Opus 4.8), och Anthropic medger att modellen ofta verkar misstänka att den utvärderas.
För utvecklare kräver migreringen vissa anpassningar: adaptivt resonemang kan inte längre stängas av, framtvingat verktygsval (tool_choice till any eller tool) returnerar ett 400-fel och standardnivån för ansträngning ändras till medium (jämfört med high för Opus 5). Text som skrivs mellan två verktygsanrop hamnar numera i resonemangsblock, vilka är tomma med standardvisningen.
🔗 Vi presenterar Claude Opus 5.5 · Nyheter i Opus 5.5 för API:et
Claude Code 2.1.280 installerar Opus 5.5 och uppgraderar Pro och Team Standard till Opus
22 september — Claude Code 2.1.280 publiceras klockan 16.38 UTC, sju minuter efter tillkännagivandet av Opus 5.5. Någon version 2.1.279 har aldrig släppts: CHANGELOG går direkt från 2.1.278 från den 19 september till denna version med 114 poster.
Den mest synliga förändringen gäller modellen. Opus 5.5 blir standardmodellen för Opus, och abonnemangen Pro och Team Standard går från Sonnet till Opus som standard, precis som Max, Team Premium och Enterprise redan gjort. Ansträngningsnivåer som sparades innan /effort blev modellspecifik gäller inte längre för nya modeller som Opus 5.5, vilka startar med sin standardinställning; Opus 4.7, Opus 4.8 och Fable 5 slutar samtidigt att tvinga sin startnivå för ansträngning över den valda inställningen.
På säkerhetssidan bedöms skrivning via en symbolisk länk nu utifrån dess faktiska destination: behörighetsförfrågan anger platsen där skrivningen hamnar, och acceptEdits, behörighetsreglerna och autoläget godkänner inte längre en skrivning som hamnar utanför katalogträdet. Autoläget avvisar inte längre åtgärder i en oavbruten loop när en säkerhetskontroll inte ger något svar: de nya försöken sker med allt längre intervall och omgången stoppas efter tio avslag i följd. Marknadsplatser för plugins som imiterar ett reserverat namn avvisas, och variabeln CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH gör det möjligt att ändra gränsen på 2 048 tecken för beskrivningar av MCP-verktyg.
Resten handlar om användarvänlighet: en enskild tryckning på y eller n bekräftar eller stänger inte längre en dialogruta (Enter och Escape används i stället), ett dubbelt Ctrl+C i en dialogruta avslutar inte längre Claude Code, två avbrott i promptcachen har åtgärdats och VS Code-tillägget får sex kommandon som kan skrivas in (/status, /sandbox, /chrome, /export, /skills, /plan).
| Postkategori i CHANGELOG | Antal poster |
|---|---|
| Korrigeringar (Fixed) | 69 |
| Förbättringar (Improved) | 21 |
| Tillägg (Added) | 12 |
| Ändringar (Changed) | 10 |
| Återställning och borttagning | 2 |
| Totalt | 114 |
Två guider för att arbeta med Opus 5.5
22 september — Anthropic publicerar också två guider av Addy Osmani. Den första, ”Vad en uppgift kostar med Opus 5.5” (What a task costs on Opus 5.5), påminner om att två modeller med samma pris per token kan kosta mycket olika för samma uppgift, eftersom varje omgång skickar hela konversationen på nytt. Exemplen presenteras som illustrationer baserade på offentliga priser: 2,8 miljoner indatatokens kostar 11,20 dollar utan cache och 1,62 dollar när 90 % läses från cachen, och en utdatatoken kostar 100 gånger mer än en cacheläsning. Han rekommenderar ansträngningsnivån medium för vardagligt bruk, high när medium fastnar och därefter Fable 5.1 om Opus 5.5 misslyckas två gånger med samma problem, med vetskapen om att ett byte av ansträngningsnivå eller modell tömmer cachen (som lever i en timme med ett abonnemang och fem minuter som standard med en API-nyckel). I ett internt benchmark med 44 supportärenden minskade ett byte från Opus 4.8 till Opus 5.5 med låg ansträngning kostnaden med omkring 18 %, och /claude-api prompt-audit minskade den med ytterligare 9 %.
Den andra guiden, på claude.dev, rekommenderar att definiera vad ”klart” innebär och sedan låta modellen arbeta samt att ta bort instruktioner som ”tänk noga”, eftersom modellen alltid resonerar innan den svarar. Den förklarar också växlingen till en äldre modell när ett meddelande flaggas av skyddsmekanismerna, ett beteende som kan ställas in i apparna eller i /config.
🔗 Vad en uppgift kostar med Opus 5.5 · Så får du ut mesta möjliga av Opus 5.5
OpenAI lanserar GPT-6 Sol och GPT-6 Luna, 50 % billigare än kampanjpriset för GPT-5.6
22 september — Mindre än två timmar efter Anthropic utökar OpenAI GPT-6-familjen med GPT-6 Sol och GPT-6 Luna, som tränats med metoder liknande dem som användes för GPT-6 Astra, vilket enligt företaget fortfarande är dess bästa modell. Sol riktar sig till komplex kodning och agentbaserade arbetsflöden, Luna till riktade uppgifter med hög volym; de efterträder GPT-5.6 Sol och GPT-5.6 Luna.
We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.
🇸🇪 Vi har också gjort cachelagring och inferens effektivare, och vi för dessa besparingar direkt vidare till er: 50 % lägre API-priser för Sol och Luna jämfört med kampanjpriset för GPT-5.6. — @OpenAI på X
| Pristyp (per miljon tokens) | GPT-6 Sol | GPT-6 Luna | Angivet GPT-5.6-pris (Sol/Luna) |
|---|---|---|---|
| Indata | 2 dollar | 0,10 dollar | 4 dollar / 0,20 dollar |
| Cachad indata | 0,20 dollar | 0,01 dollar | ej angivet |
| Utdata | 10 dollar | 0,50 dollar | 20 dollar / 1,20 dollar |
Båda modellerna hanterar 1 050 000 kontexttokens och producerar upp till 128 000 tokens; över 272 000 indatatokens debiteras hela begäran till dubbelt pris för indata och 1,5 gånger priset för utdata.
I OpenAI:s benchmarks, där Sol jämförs med Claude-modeller från tiden före Opus 5.5, får Sol 33,2 % på AutomationBench med ansträngningsnivån xhigh till en kostnad på 0,27 dollar per uppgift, före Claude Opus 5 med ansträngningsnivån max (26,9 %, till en 11,1 gånger högre kostnad) och GPT-6 Astra med ansträngningsnivån low (30,3 %). På DeepSWE v1.1 når modellen 68,8 %, 1,1 procentenheter från Claude Fable 5:s bästa resultat, till en omkring 80 % lägre kostnad per uppgift; Luna får där 66,6 %. Konkurrenternas resultat kommer från offentliga rapporter. När det gäller alignment sjunker den uppmätta graden av vilseledande beteende i koduppgifter som utformats för att locka fram oärlighet till 1,3 % för Sol, jämfört med 10,4 % för GPT-5.6 Sol.
Båda modellerna kommer till ChatGPT Work och Codex för abonnenter på Plus, Pro, Business, Enterprise och Edu, med en gradvis lansering (aktivering av administratören i Enterprise); användare av Free och Go kan använda Luna i skrivbordsappen, och modellerna erbjuds ännu inte i Chat. I API:et heter de gpt-6-sol och gpt-6-luna och nås via Responses och Chat Completions.
🔗 Vi presenterar GPT-6 Sol och Luna
En omarbetad promptcache för GPT-6
22 september — Det kompletterande lanseringsinlägget ”Bättre promptcache för GPT-6” beskriver familjens nya cachesystem: högre träffsäkerhet som standard, upp till 90 % rabatt på cachade indatatokens för kvalificerade delade prefix som återanvänds inom 30 minuter samt cacheskrivning som debiteras till 1,25 gånger indatapriset. Utvecklare får en instrumentpanel för Prompt Caching, uttryckliga brytpunkter (explicit cache breakpoints) för att ange vilka prefix som ska återanvändas, förvärmning av cachen (prewarming) när en app startas och en configuration_update som ändrar resonemangsnivån från ett svar till nästa utan att bryta cachen. GitHub uppger genom sin produktchef Mario Rodriguez att andelen prompttokens som behöver bearbetas på nytt har minskat med över 50 %; Strawberry Browser rapporterar 20 % lägre kostnader.
🔗 Bättre promptcache för GPT-6
Samma dag i verktygen: GitHub Copilot, Devin, Perplexity, Cursor och v0
22 september — Opus 5.5 och de två nya GPT-6-modellerna lät inte vänta på sig: inom några timmar hade de största kodnings- och sökverktygen lagt till dem, ofta med egna mätningar.
GitHub Copilot öppnar för Opus 5.5, GPT-6 Sol och GPT-6 Luna
GitHub lägger till alla tre modellerna på lanseringsdagen på tio plattformar: VS Code, Visual Studio, Copilot CLI, kodningsagenten, GitHub Copilot-appen, github.com, GitHub Mobile, JetBrains, Xcode och Eclipse. Samtliga debiteras efter användning till leverantörens offentliga pris, utan multiplikator för premiumbegäranden: årsabonnenter som stannat kvar på den gamla begärandebaserade debiteringen får inte tillgång till dem. Ingen av modellerna ingår ännu i det automatiska valet (Auto).
| Modell i Copilot | Tillgängliga abonnemang | Indata och utdata per miljon tokens |
|---|---|---|
| Claude Opus 5.5 | Pro+, Max, Business, Enterprise (inte Pro) | 4 och 20 dollar |
| GPT-6 Sol | Pro+, Max, Business, Enterprise | 2 och 10 dollar, därefter 4 och 15 över 272 000 tokens |
| GPT-6 Luna | Pro, Pro+, Max, Business, Enterprise | 0,10 och 0,50 dollar, därefter 0,20 och 0,75 över 272 000 tokens |
Luna är därmed den enda GPT-6-modellen som är tillgänglig för Copilot Pro, medan Opus 5.5 inte erbjuds där. Enligt GitHubs första tester löser Opus 5.5 uppgifter på samma nivå som Claude Opus 5 med betydligt färre steg och tokens. GitHub uppger också att Opus 5.5 lägger till en vattenstämpel (watermark) i sin textutdata, vilket enligt GitHub inte påverkar innebörd, kvalitet, läsbarhet, antal tokens eller kostnad.
🔗 Claude Opus 5.5 i GitHub Copilot · GPT-6 Sol och GPT-6 Luna i GitHub Copilot
Devin rankar nykomlingarna på FrontierCode 1.1
Cognition gör Claude Opus 5.5 tillgänglig i Devin Desktop och Devin CLI på lanseringsdagen och placerar den etta i sitt benchmark FrontierCode 1.1 i Extended-varianten, med 65,3 %, före Claude Fable 5 (64,9 %) och GPT-6 Astra (64,5 %), till mindre än en tiondel av kostnaden per uppgift för Fable 5. Dessa 65,3 % kan inte jämföras med de 54,4 % som Anthropic publicerade, vilka uppmättes på Main-varianten. Fyrtiosju minuter senare anländer även GPT-6 Sol och Luna: Sol matchar GPT-5.6 Sol (60,7 % mot 60,6 %) med 61 % lägre kostnad per uppgift och läser ungefär 17 % mindre kontext; Luna (56,1 %) hamnar under 0,10 dollar per uppgift och är enligt Cognition den billigaste modellen i rankningen.
Dagen före, på eftermiddagen den 21 september (Stillahavstid), hade Cognition gjort Grok 4.7 tillgänglig och uppmätt den till 59,4 %, under Grok 4.6 (61,3 %): den är stark på svåra back-end-uppgifter i Java, Go och Ruby, men tenderar att gå utanför omfattningen (over-scope), med större diffar än uppgiften kräver. v0 gjorde strax därefter Grok 4.7 tillgänglig, med 40 % rabatt till och med den 27 september, utan att ange vad rabatten gäller.
| Utvärderad modell | FrontierCode 1.1 Extended-resultat |
|---|---|
| Claude Opus 5.5 | 65,3 % |
| Claude Fable 5 | 64,9 % |
| GPT-6 Astra | 64,5 % |
| Claude Fable 5.1 | 63,6 % |
| SWE-2 | 62,5 % |
| Grok 4.6 | 61,3 % |
| GPT-6 Sol | 60,7 % |
| GPT-5.6 Sol | 60,6 % |
| Grok 4.7 | 59,4 % |
| Gemini 3.7 Flash | 56,3 % |
| GPT-6 Luna | 56,1 % |
Modellerna som lades till i Devin den 21 och 22 september visas i fetstil. Resultaten publicerades av Cognition för Extended-varianten.
🔗 Opus 5.5 i Devin · GPT-6 Sol och Luna i Devin · Grok 4.7 i Devin · Grok 4.7 i v0
Perplexity: Opus 5.5 och GPT-6 Sol i Computer, fyra modeller i Agent API
Perplexity kopplar de två lanseringarna till ansträngningsreglaget som infördes den 17 september i Computer, företagets flerstegsagent. Claude Opus 5.5 blir Standard-nivån: på WANDR, Perplexitys interna benchmark för kostnad och prestanda, får den 0,610 till 4,13 dollar per uppgift, något över Claude Fable 5.1 till en 67,6 % lägre kostnad per uppgift. GPT-6 Sol, som även finns i Perplexity-appen, blir standardalternativet på Light-nivån. Inget av de två meddelandena anger vilka abonnemang som berörs eller vilka modeller som ersatts.
För utvecklare lägger en post i API:ets ändringslogg, endast daterad september 2026, till openai/gpt-6-sol, openai/gpt-6-luna, anthropic/claude-opus-5-5 och xai/grok-4.7 i Agent API, utan prisuppgifter i posten.
🔗 Opus 5.5 i Computer · GPT-6 Sol i Computer · Ändringslogg för Perplexitys API
Cursor och v0 gör Opus 5.5 tillgänglig
Cursor presenterar den som den nya bästa modellen på CursorBench, med 57,8 % vid maximal ansträngning (Max), till 40 % lägre kostnad per uppgift än Opus 5: siffrorna kommer från Anthropic och ansträngningsnivån anges. v0 gör den tillgänglig utan prisinformation.
🔗 Cursor på X · v0 på X
Anthropic höjer femtimmarsgränserna och erbjuder en återställning till den 22 oktober
22 september — I samband med Opus 5.5 höjer Anthropic de gränser som beräknas över fem timmar för abonnemangen Pro, Max, Team och Enterprise med platsbaserad licensiering (seat-based). Kontot @ClaudeDevs kvantifierar höjningen för Claude Code: +20 % på sessionsgränserna på fem timmar från och med i dag. Prenumeranterna får även en gränsåterställning som kan sparas och aktiveras när de själva vill: den finns under Inställningar → Användning (Settings → Usage) för Pro, Max och Team och måste användas senast den 22 oktober.
Därtill kommer priseffekten: i Claude Code blir Opus 5.5 standardmodellen för betalabonnemang och eftersom den är billigare än Opus 5 räcker femtimmars- och veckogränserna ”25 % längre”. Kostnadsguiden som publicerades samma dag preciserar att prissänkningen återspeglas i gränserna, inklusive cachad kontext, men att den ytterligare prissänkningen för cacheläsningar endast gäller API:et.
🔗 @ClaudeDevs på X · Återställning och gränser
Codex CLI 0.156.0 aktiverar röst och worktrees som standard
22 september — Codex CLI 0.156.0, som publicerades 19.51 UTC, är den första stabila versionen sedan 0.155.1 den 18 september; den fullständiga ändringsloggen omfattar 525 pull requests sedan 0.155.0. Den gör två funktioner som fortfarande var experimentella i 0.155 allmänt tillgängliga: röstsamtal, med inbyggda ljudmotorer för Linux och Windows, och worktrees, som agenternas kommandocentral kan öppna i sessioner genom att filtrera uppgifter efter status.
| Nyhet i versionen | Kommando eller inställning | Tidigare i Codex CLI |
|---|---|---|
| Röstsamtal som standard | F8, /voice settings | /voice experimentell (0.155.0, 17 september) |
| Worktrees som standard | agenternas kommandocentral | experimentella sedan 0.154.0 (9 september) |
| Helskärmsgränssnitt | /tui, vid nästa start | inget |
| Analytics-instrumentpanel | /usage | analytics i skrivbordsappen (18 september) |
| Lokal bakgrundsserver | /daemon, --no-daemon | inget |
Helskärmsgränssnittet ger sökning i transkriberingen, markering med musen och kopiering med högerklick; sex inbyggda teman tillkommer och svaren visar Mermaid-diagram och ekvationer direkt. Versionen åtgärdar även flera brister i sandlådans isolering (inkommande trafik i Windows, Unix-sockets för app-server, modifierande fcntl i macOS). Versionsanteckningarna nämner inte GPT-6: Sol och Luna väljs med /model eller --model.
Kodagenter i terminalen: Vibe CLI, Qwen Code och Amp
Vibe CLI 2.25.6 och 2.25.7
22 september — Mistral publicerar Vibe CLI 2.25.7 med sex korrigeringar, dagen efter en 2.25.6 som är daterad den 21 september i CHANGELOG men aldrig publicerades som en GitHub-release och som innehåller merparten av nyheterna (1 tillägg, 3 ändringar, 17 korrigeringar). Med alternativet --experimental-harness går det att bifoga bilder även när den aktiva modellen inte kan läsa dem: en modell med vision hos samma leverantör beskriver dem för agenten, och nyckeln vision_model i config.toml gör det möjligt att ange en annan. De gränssnittsbilder som beskrivs på detta sätt innehåller ett layoutkontrakt (layout contract) så att agenten kan återskapa skärmen.
På säkerhetssidan skärps Git-kommandon som körs utan godkännande: säkra fetch-operationer ärver inte längre åsidosättningar av sökvägar från Git-konfigurationen, en ej betrodd checkout kan inte längre välja SSH-klient eller hooks, och riskfyllda alternativ eller shell-omdirigeringar som smygs in i skrivskyddade kommandon kräver godkännande. Slutligen gör 2.25.7 /teleport tillgängligt för Vibe- och workspace-API-nycklar, inklusive kostnadsfria konton.
🔗 Vibe CLI v2.25.7 · CHANGELOG för Vibe CLI
Qwen Code v0.24.4
22 september — En dag efter v0.24.3 går Qwen Code över till v0.24.4 med 13 funktioner och 15 korrigeringar, utan bakåtinkompatibla ändringar. Servern qwen serve öppnar nu fjärranslutna arbetsytor via SSH utan att installera någon daemon på måldatorn, och bubblewrap-sandlådan (bwrap), som infördes i Linux med v0.24.0, tillämpas vid körningen av varje enskilt verktyg. I Web Shell blir parkoppling via QR-kod tillgänglig som standard när den autentiserade servern lyssnar på något annat än loopback-adressen (loopback), med inbjudningar för engångsbruk som löper ut efter 60 sekunder, och redigeringsdiffar visas före godkännandet. För Java sparas hanterade verktygskörningar i databasen via JDBC. En v0.24.5-preview.0 som begränsades till två korrigeringar följde samma dag.
Amp-runners skapar Git-worktrees
22 september — Fem dagar efter att en runner fick möjlighet att betjäna flera kataloger lär Amp den att skapa Git-worktrees. I väljaren erbjuder varje repository som betjänas alternativet New Worktree: man trycker på Tab, namnger grenen och tråden startar i en ny checkout som skapats bredvid repositoryt (~/code/amp ger ~/code/amp-fix-flaky-login-test), utan att påverka huvud-checkouten. En särskild åtgärd arkiverar sedan tråden och tar bort worktree och gren. Runners kan också ta emot de hemligheter och miljövariabler (Secrets & Env Vars) som konfigurerats på ampcode.com: alternativet är inaktiverat som standard, aktiveras med --amp-env, och en ändrad variabel gäller för nästa tråd utan omstart eller SSH.
Utvärderingar av tredje part: OpenAI fastställer sina regler, brittiska AISI publicerar sina resultat
22 september — Samma dag handlar två publikationer om utvärdering av modeller genom organisationer utanför laboratorierna.
OpenAI: fyra prioriteringar och sju principer för oberoende utvärderare
I inlägget, undertecknat av Lama Ahmad, åtar sig OpenAI att ge oberoende privata eller ideella utvärderare djupgående tillgång till träning, utvärdering och driftsättning av företagets modeller, så att de kan ifrågasätta dess antaganden, upptäcka förbisedda risker och själva bedöma dess skydd. Dessa utvärderingar, som skiljer sig från arbetet med regeringar, skulle pågå från några veckor till flera månader utan att vara kopplade till någon lansering.
| Prioriterat område | Vad som granskas |
|---|---|
| Säkerhetsunderlag (safety cases) | Argumentationen som visar att riskerna med en modell hanteras, från träning till extern driftsättning |
| Kritiska skydd | Motståndskraft mot jailbreaks, cyberförsvar, övervakning av felanpassning, tillförlitlighet i övervakningen av tankekedjan |
| Preparedness Framework | Kapacitetstester (kemiska och biologiska risker, cybersäkerhet, självförbättring av AI) och anpassning |
| Felanpassningsincidenter | Oberoende utredningar av kritiska incidenter, där Hugging Face-incidenten i juli anges som exempel |
Sju principer sätter ramarna för helheten: överenskommen omfattning och påståenden som registrerats i förväg, proportionerlig åtkomst, transparent metod, expertis och oberoende (redovisning av intressekonflikter), säkerhet och sekretess, åtgärdbara slutsatser med tidsfrist för korrigering före publicering samt ansvarsfull publicering med regler för maskning. OpenAI uppger att företaget för samtal med flera organisationer utan att namnge någon.
🔗 Prioriteringar och principer för effektiva tredjepartsbedömningar
UK AI Security Institute publicerar sina verifierade resultat med EvalEval
EvalEval Coalition meddelar på Hugging Face-bloggen att UK AI Security Institute (AISI), den brittiska offentliga organisation som ansvarar för att studera riskerna med avancerad AI, nu publicerar sina utvärderingsresultat i Evaluation Cards, EvalEvals öppna plattform, tillsammans med deras kontext och konfiguration i det gemensamma formatet Every Eval Ever. Den första publiceringen omfattar fem benchmark (HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro och Terminal-Bench 2.0) som uppmätts på sex modeller, Claude Opus 4, 4.5 och 4.6, GPT-5, GPT-5.2 och GPT-5.4, samt två cyberutvärderingar. Målet är reproducerbarhet: verifierade referenser som publiceras tillsammans med sin konfiguration hjälper till att förstå varför två till synes jämförbara resultat skiljer sig åt.
🔗 Så gör UK AISI och EvalEval benchmarkresultat reproducerbara
ChatGPT följer Experians kreditpoäng i USA
21 september — En ny funktion, som kontot @ChatGPT tillkännagav den 21 september, gör det möjligt att följa sin kreditpoäng i ChatGPT. Från området Ekonomi ansluter Plus- och Pro-prenumeranter i USA sin kreditupplysning från Experian och sin VantageScore 3.0-poäng, får personliga förklaringar av vad som påverkar poängen och meddelas när den förändras. Funktionen finns på webben och i de senaste versionerna av apparna för iOS och Android.
OpenAI nämner konkreta användningsområden: bedöma hur ens kreditvärdighet påverkar en hyresansökan, välja vilket kreditkort som ska betalas av först, bygga upp sin kreditvärdighet över tid eller se hur kreditvärdighet och budget påverkar billeasing eller bolån. Funktionen kompletterar verktygen för privatekonomi som lanserades i förhandsversion i maj för amerikanska Pro-prenumeranter, med bankanslutning via Plaid.
🔗 ChatGPT:s tillkännagivande på X
Google: Colab blir en del av Google AI-abonnemangen, Gemini API begränsar Gemini 2.5
Colab blir en del av Google AI-abonnemangen
22 september — Google AI-prenumeranter får premiumförmåner i Colab, bland annat prioriterad tillgång till snabbare acceleratorer och kraftfullare maskiner. Ultra-prenumeranter får dessutom tillgång till oavbruten bakgrundskörning och Premium-GPU:er, så att en lång träningskörning kan slutföras utan att en flik behöver hållas öppen. Inlägget talar om en lansering ”från och med i dag”, men preciserar att förmånerna införs under de kommande veckorna i de länder där Colab är tillgängligt. Enligt Colabs vanliga frågor läggs beräkningsenheterna från ett Google AI-abonnemang och en Colab Pro- eller Pro+-prenumeration till samma saldo; Google One-abonnemang som är begränsade till lagring och kostnadsfria provperioder omfattas inte. Varken inlägget eller de vanliga frågorna anger hur många enheter som tilldelas varje abonnemang.
🔗 Colab är nu en del av ditt Google AI-abonnemang · Vanliga frågor om Colab
Gemini API begränsar åtkomsten till Gemini 2.5
18 september — I en notis från den 18 september begränsar versionsanteckningarna för Gemini API åtkomsten till Gemini 2.5-modellerna till användare som aktivt har använt dem tidigare, för att säkerställa tillförlitlig prestanda och bevara kapacitet. Modellerna är inte utfasade och fortsätter att tillhandahållas tills vidare: sidan om utfasningar visar inget slutdatum för gemini-2.5-pro, gemini-2.5-flash och gemini-2.5-flash-lite, medan endast gemini-2.5-flash-image upphör den 2 oktober 2026. För alla nya projekt hänvisar Google till Gemini 3.5 Flash-Lite eller Gemini 3.8 Flash.
🔗 Versionsanteckningar för Gemini API · Geminis sida om utfasningar
Hugging Face kör GGUF-filer från llama.cpp i Transformers
22 september — Hugging Face gör det nu möjligt att effektivt köra GGUF-filer, kvantiseringsformatet från llama.cpp, i Transformers. Det räcker att skicka filen till from_pretrained (parametern gguf_file): vikterna förblir komprimerade i minnet och beräkningarna utförs av ggml:s Metal-kärnor, som distribueras från Hub via biblioteket kernels. Kommandot transformers serve exponerar sedan modellen bakom ett OpenAI-kompatibelt API.
Det inledande omfånget är begränsat: endast Mac med Apple Silicon, Qwen3.5-arkitekturen i dense- och MoE-versioner (samt kompatibla Qwen3.8-checkpoints), en konversation åt gången och installation från grenen main. Fyra kärnor kommer från ggml, medan en femte, skriven av Hugging Face, hanterar expert-routingen. På en MacBook Pro M2 Max bedömer Hugging Face att Transformers ligger ”nära” llama.cpp, men värdena redovisas endast grafiskt och mätningarna är inte identiska (prefill ingår på ena sidan, enbart avkodning på den andra); teamet rekommenderar fortfarande llama.cpp för effektiv lokal inferens. Fördelen ligger på annat håll: att hantera en GGUF med de vanliga PyTorch-verktygen eller att utgå från en dekvantiserad GGUF för finjustering.
| GGUF-variant (Qwen3.5-4B, Unsloth) | Filstorlek | Angiven kompromiss |
|---|---|---|
| BF16 | 8,42 GB | Icke-kvantiserad referens |
| Q6_K | 3,53 GB | Högre precision |
| Q5_K_M | 3,14 GB | Kompromiss mellan storlek och precision |
| Q4_K_M | 2,74 GB | Rekommenderad utgångspunkt för lokal körning |
🔗 Transformers kör nu kvantiseringar från llama.cpp
Kimi: K3 på Amazon Bedrock och ett webbläsartillägg med nytt namn
Kimi K3 kommer till Amazon Bedrock
22 september — Moonshot AI tillkännager att Kimi K3 kommer till Amazon Bedrock, men AWS produktsida daterar lanseringen till den 18 september. Modellen med öppna vikter, som släpptes i slutet av juli med en kontext på en miljon tokens, får där tillgång till Bedrocks kontroller för åtkomst, kryptering och revision. Den tillhandahålls via amerikansk och global regionöverskridande inferens (cross-Region inference) (us.moonshotai.kimi-k3, global.moonshotai.kimi-k3), och dess explicita cachning börjar vid 1 024 tokens per cachepunkt, i minst 30 minuter. Nivåerna Priority (1,75 gånger priset) och Flex (0,5 gånger) tillämpas på grundpriserna.
| Inferensalternativ (Standard-nivå) | Indata per miljon tokens | Utdata per miljon tokens | Cacheläsning |
|---|---|---|---|
| Global inferens | 3,00 dollar | 15,00 dollar | 0,30 dollar |
| Amerikansk inferens | 3,30 dollar | 16,50 dollar | 0,33 dollar |
🔗 Kimi K3 på Amazon Bedrock · Kimi K3 på Bedrock, tillkännagivande på X
Kimi WebBridge blir Kimi Browser Extension
22 september — Webbläsartillägget som dök upp i juni tillsammans med Kimi Work byter namn och får ett sidofält där användaren kan chatta med Kimi för att få det att navigera på webbplatser, fylla i formulär och slutföra uppgifter. Återkommande uppgifter spelas in en gång och sparas som en skill, som Kimi återanvänder nästa gång; tillägget omvandlar även webbsidor till kommandon. En lokal tjänst styr den redan öppna Chrome- eller Edge-webbläsaren via Chrome DevTools Protocol, och Moonshot uppger att inloggningssessioner och sidinnehåll aldrig lämnar enheten. Endast sidofältet kräver ett Kimi-konto.
🔗 Kimi Browser Extension · Kimi Browser Extension, tillkännagivande på X
SpaceXAI: Grok Bot hanterar ökningen av supportärenden
22 september — SpaceXAI publicerar erfarenheter från sin egen kundsupport, som byggts om kring Grok Bot, företagets agent som arbetar i dess verktyg. Sedan Cursor anslöt sig till SpaceXAI den 14 augusti har de två supportteamen slagits samman och hanterar betydligt fler produkter. Enligt inlägget har ärendevolymen ökat med 175 % utan några nyanställningar, där det annars kanske hade krävts 200 nya medarbetare; mätperioden anges inte.
Driftsättningen skedde gradvis: Grok Bot kopplades till Plain för ärenden och Linear för incidenter och begränsades först till interna anteckningar, där varje skrivåtgärd godkändes av en människa. Därefter hanterade den enkla ärenden innan den började svara kunder direkt redan i slutet av den första dagen. I dag genomför den en preliminär undersökning av varje inkommande ärende, återskapar problem på video åt utvecklingsteamet och sammanfattar dagligen över 20 000 produktkommentarer.
| Indikator publicerad av SpaceXAI | Angivet värde |
|---|---|
| Ökning av supportärenden | +175 % |
| Undvikna nyanställningar (uppskattning) | 200 |
| Kostnad per lösning med traditionella verktyg | 1 till 4 dollar |
| Lägsta kostnad per ärende med Grok Bot | 0,20 till 0,30 dollar |
| Återbetalningar hanterade utan människa | 99 % |
🔗 Så använder SpaceXAI Grok Bot för att skala upp kundsupporten
Cognition: fokus på Latinamerika och nya versionsanteckningar för Devin
Cognition etablerar sig i Latinamerika från São Paulo
22 september — I ett inlägg från sitt Latinamerika-team återkommer Cognition till tillkännagivandet som gjordes veckan innan på MASP, São Paulos konstmuseum: företaget expanderar i regionen med ett team baserat i São Paulo och rekryteringar, bland annat av ingenjörer som arbetar ute hos kunderna (deployed engineers). Företaget bygger vidare på befintliga kunder, däribland Itaú, Nubank, Santander, Natura och EBANX. Enligt Cognition använder över 75 % av teknikteamet på Itaú Devin, som har dokumenterat över 300 000 kodförråd och automatiskt åtgärdat omkring 70 % av sårbarheterna. Hos Nubank ska migreringen av en monolit med flera miljoner kodrader ha kortats från flera år till några veckor, till en kostnad som var mer än tjugo gånger lägre. Resultaten har publicerats av Cognition och saknar oberoende källa.
🔗 Att bygga framtidens mjukvaruutveckling i Latinamerika
Devins versionsanteckningar från den 21 september
21 september — I Devins versionsanteckningar, som publicerades efter vår föregående utgåva, läggs SWE-2, Cognitions kodmodell som släpptes den 10 september, till som forskningsförhandsversion (research preview) i agentväljaren: användaren väljer SWE-2 och en insatsnivå (Medium, High eller Max) när en session startas eller medan den pågår, och !swe2 gör samma sak i Slack. MCP-servrarna för Microsoft 365 (Mail och Contacts, Calendar, To Do, OneDrive och SharePoint, Teams samt Entra ID-katalogen) läggs till på MCP-marknadsplatsen, som standard skrivskyddade om inget OAuth-omfång har konfigurerats. Devin Review får stöd för Bitbucket Data Center, plugins kan omfatta upp till 20 MiB och 2 500 filer, och det fristående CLI-verktyget npx devin-review tas bort: redan installerade kopior fungerar inte längre.
🔗 Devins versionsanteckningar från den 21 september
Genspark får in sitt presentationsbenchmark i Fireworks AI:s SII-index
22 september — Fireworks AI lanserar Specialized Intelligence Index (SII), ett index med 20 benchmarktester för verkligt arbete fördelade över sju områden (säkerhet, juridik, finans, kundsupport, mjukvara, hälsa och produktivitet) och framtagna av yrkesverksamma; Harvey, Doximity, Mercor, Sierra, Decagon och Genspark finns bland de tolv deltagande företagen. Genspark Slides Benchmark är det enda benchmarktestet i produktivitetskategorin och låter elva modeller skapa presentationer för 200 verkliga uppgifter i Genspark Slides-agentens testmiljö; betygen kommer från Gensparks interna utvärderare. För den egenutvecklade modellen Gen-1 Slides upprepar Genspark argumentet att indatapriset är omkring en sjuttondel av priset för Claude Opus 5.
| Utvärderad modell | Poäng i SII-indexet | Poäng i Gensparks inlägg den 10 september | Kostnad per presentation i indexet |
|---|---|---|---|
| Claude Fable 5.1 | 83,6 % | utanför tabellen, leder med 0,003 över Gen-1 Slides i texten | visas inte |
| Gen-1 Slides | 82,2 % | 0,821 | 0,44 dollar |
| Claude Opus 5 | 81,0 % | 0,810 | 4,16 dollar |
| Claude Fable 5 | 79,9 % | utanför tabellen | visas inte |
| GPT-6 Astra | 78,0 % | utanför tabellen | visas inte |
| Kimi K3 | 72,6 % | 0,723 | 2,00 dollar |
| GPT-5.6 Sol | 67,0 % | 0,668 | 2,01 dollar |
| MiniMax M3 | 56,1 % | 0,563 | 0,34 dollar |
🔗 Specialized Intelligence Index · Gensparks tillkännagivande
Runway lanserar DIFFUSE, en rekryteringsplattform för kreatörer utbildade inom AI
22 september — Runway lanserar DIFFUSE (diffuse.runway.com), en öppen plattform där varumärken, byråer och studior kan söka efter, kontakta och rekrytera personer som behärskar generativa AI-verktyg (AI-native talent). Kreatörer, frilansare, boutiquestudior och produktionsbolag kan skapa en profil och lägga upp sin portfolio; inga priser har tillkännagivits.
Runway stöder sig på sin egen studie av över 1 000 kreativa platsannonser från närmare 400 företag: 17 % nämner AI-kompetens eller generativa verktyg, och enligt företaget är Runway överlägset det mest efterfrågade videoverktyget. Runway medger att AI delvis förändrar kreativa yrken, men hävdar att en ny kreativ arbetskraft växer fram kring dessa verktyg och att efterfrågan på den ökar.
🔗 Vi presenterar DIFFUSE · Runway på X
NVIDIA för utvecklare: Isaac ROS 5.0, DLSS 5 och RTX Mega Geometry 2.0
Isaac ROS 5.0 satsar på agenter
22 september — Isaac ROS 5.0 presenterades på ROSCon-konferensen i Toronto och är NVIDIAs kostnadsfria samling med öppen källkod av GPU-accelererade ROS-paket. Den stöder ROS Lyrical och Ubuntu 24.04 och täcker hela Jetson-sortimentet, från Jetson Orin Nano till Jetson Thor. Den främsta nyheten riktar sig till agenter: återanvändbara Isaac-skills för installation och hantering, dokumentation som kan läsas av agenter, en skill som hjälper en agent att finjustera stereoseendemodellen FoundationStereo för sina egna kameror samt en fristående skill för plockning och placering (pick and place). FoundationPose får ett inferensbibliotek som spårar objekts position och orientering upp till 5,5 gånger snabbare, utan att NVIDIA anger jämförelsereferensen.
DLSS 5 beskrivs närmare för studior, RTX Mega Geometry 2.0 tillgängligt
22 september — DLSS 5, som redan finns i NBA 2K27, beskrivs närmare för utvecklare: dess 3D-styrda neurala rendering (3D-Guided Neural Rendering) infogas som sista steg i pipelinen, utgår från bilden som renderats av motorn och använder färg- och rörelsevektorer för att lägga till ljussättning och materialdetaljer, bildruta för bildruta och deterministiskt, på ett enda GeForce RTX i 50-serien upp till 4K. Studiorna kan justera strukturintensiteten (Structure Intensity) och tonintensiteten (Tone Intensity) och får tillgång till AI-baserad semantisk maskering. Samma inlägg lägger till två modeller med 600 miljoner parametrar i ACE, Nemotron Speech 3.5 Streaming (taligenkänning) och Qwen3 TTS (talsyntes), släpper RTX Kit 2026.3 och gör RTX Mega Geometry 2.0 tillgängligt, med klusterströmning på kontinuerlig detaljnivå för mycket täta meshmodeller.
NVIDIA och inferens: Dynamo-Triton med flera GPU:er och konfidentiell databehandling på B200
Dynamo-Triton 26.07 kör en modell fördelad över åtta GPU:er
21 september — NVIDIA visar hur en TensorRT-modell som är fördelad över flera GPU:er kan köras som en vanlig modell. TensorRT:s inferens med flera GPU:er (multi-device inference), som stöds fullt ut från TensorRT 11.0, bygger på NCCL; Dynamo-Triton 26.07, tidigare Triton Inference Server, aktiverar den i sin TensorRT-backend, och applikationen anropar endast en enda gRPC-slutpunkt. Vid videogenerering med Cosmos 3 Nano (1280×720, 189 bildrutor, 35 steg) sjunker svarstiden från början till slut från 156,6 sekunder på en GPU till 34,2 sekunder på åtta, alltså med en faktor på 4,58. NVIDIA förtydligar att testet varken mäter genomströmning vid samtidiga förfrågningar eller kostnad per video.
| Testad konfiguration | Antal GPU:er | Genomsnittlig svarstid från början till slut |
|---|---|---|
| En GPU | 1 | 156,595 s |
| CP2 | 2 | 87,999 s |
| CP4 | 4 | 53,093 s |
| CP8 | 8 | 34,183 s |
🔗 Dynamo-Triton och TensorRT med flera GPU:er
Konfidentiell inferens på B200 behåller över 96 % av genomströmningen
22 september — NVIDIA mäter prestandakostnaden för sin Confidential Computing på Blackwell, där arbetslaster körs i virtuella maskiner med krypterat minne, konfidentiella GPU:er och krypterad NVLink. På ett DGX B200-system (åtta GPU:er, Intel TDX-plattform) som kör DeepSeek-R1 i NVFP4 med TensorRT LLM, med 32 000 tokens som indata och 1 000 som utdata, behåller det konfidentiella läget 96,1 till 98,2 % av genomströmningen och ökar den genomsnittliga tiden per token i utdata med endast 1,2 till 4,3 %, vid 1 till 16 samtidiga förfrågningar. Tre anpassningar av ramverket krävdes: sidväxlingsbart i stället för pinnat minne för vissa överföringar, GPU:ns interna räknare för kärnornas autotuner samt andra kommunikationsalgoritmer eftersom NVLink SHARP-multicast inte är tillgängligt i detta läge. Arbetslasten valdes för att göra merkostnaden synlig; NVIDIA rekommenderar att de båda lägena jämförs med den egna arbetslasten.
🔗 Konfidentiell databehandling och TensorRT LLM
Kortnyheter
- Zed förbereder Delta — Zed meddelar att det den här veckan, utan att funktionerna ännu är tillgängliga, kommer färger för att gruppera trådar i Delta, företagets kodmiljö för flera användare med agenter, samt en mätare som visar hur långt det är kvar till automatisk komprimering av kontexten. 🔗 källa
- Replit och Handshake — Replit är grundande partner till Handshakes AI Skills Studio: tre kostnadsfria uppdrag på 45 minuter leder till ett projekt som visas på Handshake-profilen; OpenAI (10 uppdrag), Google, Figma och Vercel hör till de andra partnerna. 🔗 källa
- oMLX ansluter sig till Hugging Face — Jun Kim, skapare av oMLX, ett projekt i Apples MLX-ekosystem, ansluter sig till Hugging Face; projektet förblir licensierat under Apache 2.0 och leds fortfarande av honom, men får nu underhåll och finansiering och siktar först på snabbare konvertering av Transformers-modeller till MLX. 🔗 källa
- SnowLLM — Communityinlägg: denna inferensmotor under Apache-2.0 (kärnor levererade binärt), skriven för GPU:n i Ryzen AI Max, avkodar enligt upphovspersonerna upp till 2,3 gånger snabbare än llama.cpp (1,9 gånger utan spekulativ avkodning) och utför prefill upp till 9,4 gånger snabbare. 🔗 källa
- DecisionBench och Bosun v3.1 — Hanno Labs publicerar DecisionBench 1.0 (43 uppgifter, 28 områden) och två beslutsmodeller med öppna vikter baserade på Qwen3 (0,6 respektive 1,7 miljarder parametrar), som får 83,20 % respektive 87,29 % i företagets egen tillämpade testsvit; Jev överträffar dem på resonemangsspåret. 🔗 källa
- En Moshi med 600 miljoner parametrar — En utvecklare berättar om sitt försök att skapa en full duplex-röstmodell byggd på Qwen3-0.6B-Base och tränad för 2 till 15 dollar per försök på B200: texten konvergerar, men rösten förblir grumlig, ett problem som lokaliserats till de finare akustiska codebooks. Projektet är pausat och inga vikter har publicerats. 🔗 källa
- Together AI och GLM-5.2 — I en fallstudie från den 18 september, återpublicerad på X den 21 september, beskriver Together AI ett fintechföretag som kör sina kodagenter på GLM-5.2 med 256K-kontext och 56 B200; en incident med 1 till 3 minuters kötid åtgärdades samma dag genom att routingen konfigurerades om. 🔗 källa
- Gemini CLI — Nightly-versionen från den 22 september, den första med ny kod sedan den 19 september, åtgärdar kraschen
HttpsProxyAgent is not a constructormed Vertex AI bakom en proxy och skickar uppdateringentool_callföre begäran om behörighet i ACP-läge. 🔗 källa - Google Flow — Det officiella kontot uppger att tjänsten har över 25 miljoner användare per månad och förlänger de 50 extra dagliga krediterna för alla, ett erbjudande som i juli var förbehållet Google AI-prenumeranter fram till den 31 augusti. 🔗 källa
- Jigsaw och Sensemaking AI — Googles inkubator lanserar sitt Partner Program för att införa sin Gemini-drivna open source-svit för medborgarsamråd i 30 städer, delstater och länder, med en fond från Google.org, Bloomberg Philanthropies och Packard Foundation vars belopp inte har offentliggjorts. 🔗 källa
- 100 000 utbildningsstipendier — I anslutning till FN:s generalförsamling finansierar Google 100 000 stipendier för certifierande AI-utbildning i över 80 länder via AI Skills Coalition inom ITU:s program AI for Good, fördelade av lokala myndigheter och Giga-nätverket. 🔗 källa
- Agenter som säkrar Googles kod — I ett inlägg från den 19 september förklarar Google att varje kodändring i företagets infrastruktur analyseras före inlämning med agenter byggda på dess open source-ramverk Mantis, som blockerar hundratals sårbarheter per månad; triageagenten uppges nå över 92 % precision på mindre än en minut. 🔗 källa
- Copilot CLI 1.0.88 — Företagshanterade inställningar gäller nu även för sessionerna
--acp,--ahp-hostoch--server, som tidigare saknade MCP-policyer, behörigheter och plugins, och/forkfungerar under en tur; version 1.0.87 från den 21 september lade till hanterade inställningar för routningsnivån Auto. 🔗 källa - Pika och Seedance 2.5 — Draft-läget i Seedance 2.5 kommer till Pika och Pika API Club: utkast till klipp från 10 cent per sekund, som därefter kan färdigställas i hög kvalitet. 🔗 källa
- Pika Swap Anything — En ny Pika-applikation som ersätter skådespelare, kostymer, miljöer eller rekvisita i en video samtidigt som originaltagningens rytm, rörelser och berättande bevaras; inget pris har meddelats. 🔗 källa
- Suno Studio — Sunos musikproduktionsstation får en svit med ljudeffekter, däribland en kompressor (tröskel, ratio, attack, release, sidechain), som ingår i Premier-abonnemanget. 🔗 källa
- Sluicebox och Nemotron 3 Ultra — NVIDIA-fallstudie: genom att byta till Nemotron 3 Ultra minskar denna startup, som analyserar leveranskedjors koldioxidutsläpp, sina inferenskostnader med 51 till 80 % och når 87,7 % vid extraktion av leverantörsdata, jämfört med 84 % för den tidigare modellen. 🔗 källa
- Topograph — Ett open source-verktygspaket från NVIDIA som identifierar nätverkstopologin i ett GPU-kluster och publicerar den för Kubernetes, Slurm och Slinky, så att distribuerade arbetslaster kan placeras så nära varandra som möjligt; det läser API:erna från Crusoe, Google Cloud, Lambda, Nebius, Nscale och Oracle Cloud. 🔗 källa
- Att utvärdera en agent — I ett metodinlägg från den 21 september föreslår NVIDIA sex mätvärden, från verktygsanrop till slutförd uppgift, och anger att Nemotron 3.5 Lightning når 86 % på PinchBench och är 30 % snabbare än Qwen3.6 35B. 🔗 källa
- Qwen-Image-2.1 på Intel — Stödet tillkännagavs av Intel den 21 september och lyftes av Qwen den 22 september. Det finns från första dagen via OpenVINO och är avsett för GPU:erna Arc Pro B70 samt de integrerade GPU:erna i Core Ultra Series 3, med en särskild notebook. 🔗 källa
- Box och Grok 4.7 — Den 21 september, samma dag som Grok 4.7 lanserades, testade Box modellen i en förhandsversion av Box Agent på ett skadeärende värt 2 miljoner dollar: en dubblerad faktura på 82 000 dollar och en saknad kreditfaktura på 64 000 dollar identifierades; varken tillgänglighetsdatum eller pris har meddelats. 🔗 källa
- En kirurg och Codex — OpenAI Developers publicerar en video där handkirurgen Brian Pridgen visar hur han bygger egna verktyg med Codex och granskar vetenskaplig litteratur på PubMed, utan några siffror eller någon skriftlig studie. 🔗 källa
- ChatGPT i Word — Tillkännagivet den 17 september: ett gemensamt Microsoft-tillägg ger tillgång till ChatGPT i Word, Excel och PowerPoint, över hela världen och med alla abonnemang, inklusive Free, med användningsgränser; Business och Enterprise får en kostnadsfri förhandsversion av GPT-5.6 Sol i Word fram till den 30 september. 🔗 källa
- AI-kunnighet — Perplexity publicerar en guide som beskriver utvärdering av svar som kärnkompetensen, kritiserar ”utbildningsteater” och hänvisar till Gallup: 38 % uppgav att de hade börjat använda AI, men endast 12 % använde det dagligen under fjärde kvartalet 2025. 🔗 källa
Vad det innebär
Samma dag försvarade Anthropic och OpenAI samma argument: inte en kraftfullare modell till varje pris, utan prestanda nära deras toppmodeller till ett mycket lägre pris. Opus 5.5 presenteras som jämbördig med Fable 5.1 till 40 % lägre kostnad än Opus 5, medan GPT-6 Sol sägs ärva en stor del av Astras styrkor till 2 respektive 10 dollar per miljon tokens. Båda leverantörerna resonerar nu i kostnad per uppgift snarare än pris per token och gör cachelagring till den verkliga hävstången: läsningar för 0,20 dollar hos Anthropic samt upp till 90 % rabatt och uttryckliga brytpunkter hos OpenAI.
Integrationen mäts i timmar. GitHub Copilot, Devin, Perplexity, Cursor och v0 gjorde de nya modellerna tillgängliga samma dag, var och en med sitt eget mått: FrontierCode 1.1 Extended hos Cognition, WANDR hos Perplexity och CursorBench hos Cursor. Siffrorna är inte direkt jämförbara (65,3 % för Opus 5.5 i Extended-varianten, 54,4 % i Main-varianten), och ingen av de båda leverantörerna jämför ännu sin nya modell med den andres. För en utvecklare avgörs rätt val i allt högre grad i det egna verktyget och på de egna uppgifterna, snarare än i lanseringarnas tabeller.
Abonnemangen blir också ett område för differentiering. Anthropic höjer sina gränser över fem timmar, erbjuder en återställning och flyttar Pro och Team Standard till Opus i Claude Code; GitHub reserverar Opus 5.5 för de högre abonnemangen men öppnar GPT-6 Luna redan från Copilot Pro; Google inkluderar Colab i sina Google AI-abonnemang samtidigt som Gemini 2.5 begränsas för att bevara kapaciteten. Hur beräkningskraften fördelas mellan abonnemangen väger nu lika tungt som det angivna priset.
Slutligen förändras även själva sättet att mäta. Anthropic medger att benchmarkmarginalerna ger mindre vägledning än tidigare och att Opus 5.5 ofta tycks vara medveten om att den utvärderas; OpenAI fastställer regler för att öppna sina modeller för oberoende utvärderare; brittiska AISI gör sina resultat reproducerbara med EvalEval, och NVIDIA föreslår att en agent ska bedömas utifrån den slutförda uppgiften snarare än varje enskilt verktygsanrop. Att verifiera vad en modell faktiskt gör är nu lika viktigt som dess poäng.
Källor
- Vi presenterar Claude Opus 5.5 (Anthropic)
- @claudeai: lanseringen av Claude Opus 5.5
- Nyheter i Claude Opus 5.5 för API:et
- Claude Code v2.1.280
- Vad en uppgift kostar med Opus 5.5
- Få ut mesta möjliga av Opus 5.5
- Vi presenterar GPT-6 Sol och Luna (OpenAI)
- @OpenAI: lanseringen av GPT-6 Sol och Luna
- Bättre promptcachelagring för GPT-6
- Claude Opus 5.5 i GitHub Copilot
- GPT-6 Sol och GPT-6 Luna i GitHub Copilot
- Claude Opus 5.5 i Devin
- GPT-6 Sol och Luna i Devin
- Grok 4.7 i Devin
- @v0: Grok 4.7 i v0
- @perplexity_ai: Opus 5.5 i Computer
- @perplexity_ai: GPT-6 Sol i Computer
- Ändringslogg för Perplexity API
- @cursor_ai: Opus 5.5 i Cursor
- @v0: Opus 5.5 i v0
- @ClaudeDevs: gränser i Claude Code
- @ClaudeDevs: återställning av gränser
- Codex CLI 0.156.0
- Vibe CLI v2.25.7
- Ändringslogg för Vibe CLI
- Qwen Code v0.24.4
- En Runner, många Worktrees (Amp)
- Prioriteringar och principer för effektiva tredjepartsbedömningar (OpenAI)
- Så gör brittiska AISI och EvalEval benchmarkresultat reproducerbara
- @ChatGPT: kreditpoäng från Experian
- Colab ingår nu i ditt Google AI-abonnemang
- Vanliga frågor om Colab
- Versionsinformation för Gemini API
- Sidan om utfasningar i Gemini
- Transformers kan nu köra kvantiserade llama.cpp-modeller
- Modellkort för Kimi K3 på Amazon Bedrock
- @Kimi_Moonshot: Kimi K3 på Bedrock
- Kimi Browser Extension
- @Kimi_Moonshot: Kimi Browser Extension
- Så använder SpaceXAI Grok Bot för att skala upp kundsupporten
- Att bygga framtidens mjukvaruutveckling i Latinamerika (Cognition)
- Versionsinformation för Devin den 21 september
- Index över specialiserad intelligens (Fireworks AI)
- @genspark_ai: Genspark Slides Benchmark i SII
- Vi presenterar DIFFUSE (Runway)
- @runwayml: lanseringen av DIFFUSE
- Isaac ROS 5.0 (NVIDIA)
- Nyheter för spelutvecklare (NVIDIA)
- Dynamo-Triton och TensorRT för flera GPU:er (NVIDIA)
- Konfidentiell databehandling och TensorRT LLM (NVIDIA)
- @zeddotdev: nyheter i Delta
- @Replit: Handshakes AI Skills Studio
- Jun Kim ansluter sig till Hugging Face (oMLX)
- SnowLLM
- DecisionBench och Bosun v3.1 (Hanno Labs)
- Att krympa Full-Duplex Speech
- Fallstudie från Together AI (Dedicated Model Inference)
- Gemini CLI v0.62.0-nightly.20260922
- @FlowbyGoogle: 25 miljoner användare
- Sensemaking AI och Jigsaw Partner Program (Google)
- Investeringar i global kompetens och AI-kunnighet (Google)
- Att använda agentbaserad AI för att säkra infrastrukturkod (Google Cloud)
- Copilot CLI v1.0.88
- @pika_labs: Draft-läget i Seedance 2.5
- @pika_labs: Swap Anything
- Om komprimering (Suno)
- Fallstudie om Sluicebox (NVIDIA)
- Topograph (NVIDIA)
- Så utvärderar du AI-agenter (NVIDIA)
- Qwen-Image-2.1 på Intel-maskinvara (OpenVINO)
- @Box: Grok 4.7 i Box Agent
- @OpenAIDevs: en kirurg och Codex
- @ChatGPT: ChatGPT i Word
- AI-kunnighet (Perplexity)