ai-powered-markdown-translatorArtikel översatt från franska till svenska med gpt-5.6-sol.
Denna måndag meddelar Boris Cherny att Claude Mods kommer till Claude Code. Det är plugins som bygger på hooks skrivna i TypeScript och som har kunnat testas sedan den 9 september. Samtidigt invänder Cohere-vd:n Aidan Gomez mot den trestegsplan som Dario Amodei publicerade i lördags för att bromsa utvecklingen av frontier-modeller. ElevenLabs förvandlar sitt MCP till en kreativ studio som är tillgänglig från ChatGPT, Claude eller Cursor, medan GitHub, Qwen och Kimi ger sina agenter nya inställningar och Perplexity tar sin lokala agent till Windows. Flera tekniska inlägg visar slutligen hur agentbaserad kodning och träning skalas upp, från Anthropics CI till Perplexitys nya databas.
Claude Mods, Claude Codes function hooks börjar testas
14 september — Boris Cherny på Anthropic meddelar att Claude Mods nu kommer (landing now) och hänvisar till GitHub-ärende #91870 i Claude Code-repot.
Claude Mods are landing now. Someone already built a Tetris-in-Claude mod See issue for the latest community update, technical details, and more cool demos
🇸🇪 Claude Mods kommer nu. Någon har redan byggt en Tetris-mod i Claude. Läs ärendet för communityns senaste lägesrapport, tekniska detaljer och fler coola demonstrationer. — @bcherny på X
Ärendet gäller förslaget Function Hooks, som Anthropic lade fram den 3 september: hooks skrivna i TypeScript och sammansatta som middleware-komponenter (middlewares), där alla sidoeffekter går genom ett $-objekt som administratörer kan granska och begränsa. I en lägesrapport från den 9 september meddelar poteat, som ansvarar för förslaget hos Anthropic, att leveransen ska ske inom några veckor och presenterar produktnamnet Claude Mods: en mod är helt enkelt ett plugin som använder function hooks. Källkoden till de tre första integrerade modsen (diff, sec-default och telemetry) publiceras i repot, fler funktioner i Claude Code ska migreras till denna form och testerna är öppna för alla som kör CLAUDE_CODE_ENABLE_FUNCTION_HOOKS=1 claude.
Det Tetris som Boris Cherny nämner kommer från en medlem av communityn, inte från Anthropic: personens plugin cc-arcade visar Tetris och sju andra spel ovanför prompten, som kan spelas medan Claude arbetar utan att förbruka några tokens. Upphovspersonen anser att API:et höll måttet, men att flera av dess begränsningar ännu inte är dokumenterade.
Funktionen är fortfarande experimentell: varken versionsanteckningarna för Claude Code, inklusive dem för 2.1.271 som publicerades den 14 september, eller dess dokumentation nämner Mods ännu.
🔗 Function Hooks-ärende #91870 på GitHub
Dario Amodei vill bromsa utvecklingen av frontier-modeller, Cohere invänder mot metoden
12 och 13 september — I lördags publicerade Anthropics vd Dario Amodei We Must Pace the Frontier på sin personliga webbplats, en essä som uppmanar branschen att bromsa takten i förbättringen av modellernas förmågor. Att styra takten (pacing) innebär inte att stoppa träningen, preciserar han, utan att ge företagen tid att anpassa och säkra sina modeller och ge tredje parter tid att verifiera detta. Han hänvisar till den acceleration som observerats sedan sommaren tack vare rekursiv självförbättring (recursive self-improvement), även hos Anthropic, samt incidenten mellan OpenAI och Hugging Face, där en svärm av agenter angrep mål som den inte hade anvisats.
Planen består av tre steg. Först integrerade utvärderare (embedded evaluators): ett tredjepartsteam, med METR som exempel, som får permanent åtkomst jämförbar med en anställds och fritt kan publicera sina slutsatser. Anthropic åtar sig på egen hand att införa detta omedelbart och uppmanar regeringar att kräva detsamma av andra frontier-företag. Därefter ska de ledande företagen i demokratiska länder samordna sig kring gemensamma säkerhetsstandarder och gränser för takten i okontrollerade framsteg. Essän bedömer att den effektivaste vägen fortfarande är reglering som omfattar alla amerikanska frontier-företag, även dem som inte skulle samarbeta frivilligt. Eftersom lagstiftning tar tid föreslår den parallellt standarder som företagen fastställer frivilligt sinsemellan, något som konkurrensrätten gör komplicerat:
For antitrust reasons, it’s helpful for the US government to mediate or at least enable these discussions — they don’t need to participate, but do need to issue a narrow waiver for certain kinds of safety conversations.
🇸🇪 Av konkurrensrättsliga skäl är det värdefullt att USA:s regering medlar i eller åtminstone möjliggör dessa diskussioner: den behöver inte delta, men bör bevilja ett snävt undantag för vissa typer av säkerhetssamtal. — Dario Amodei, vd för Anthropic, i We Must Pace the Frontier
Slutligen föreslås en global samordning, graderad från förbud mot uppenbart farliga användningsområden, såsom biologiska vapen, till en ”paus” där de deltagande regeringarna skulle begränsa den globala takten, ett utfall som Amodei bedömer som osannolikt på kort sikt.
13 september — Aidan Gomez, medgrundare och vd för Cohere, svarar i en debattartikel med titeln Who Gets to Define the Rules for AI?, med underrubriken ”evidensbaserade standarder, inte en kartell”. Cohere stöder oberoende granskning av de mest kapabla systemen, men tolkar den färdplan som Dario Amodei publicerade under veckan som en begäran om undantag från konkurrenslagstiftningen i säkerhetens namn. Enligt Aidan Gomez skulle en handfull laboratorier från ett enda land komma överens om standarderna och utvecklingstakten, varefter dessa regler skulle påtvingas andra utvecklare utan offentligt samråd eller omröstning.
Essän innehåller mycket riktigt den punkt som Cohere uppmärksammar: en samordnad strategi skulle ge frontier-utvecklarna denna tid ”utan att offra USA:s kommersiella fördel eller försprång inom AI”. Däremot står det ingenstans att andra utvecklare skulle behöva följa deltagarnas beslut: denna skyldighet är Coheres tolkning av den regulatoriska vägen, och den skriftliga begäran gäller ett snävt undantag som är begränsat till vissa säkerhetssamtal. Cohere ställer upp fyra pelare:
| Pelare som Cohere föreslår | Vad pelaren omfattar |
|---|---|
| Evidensbaserat riskramverk | Utformat av flera länder och publicerat tillsammans med meningsskiljaktigheterna, med regler knutna till förmågorna och inte utvecklarens identitet |
| Obligatorisk transparens | Dokumentation av utformning, förmågor, risker och riskreducerande åtgärder samt rapportering av allvarliga incidenter |
| Evidensbegränsade tester | Endast av förmågor som bedöms som farliga, exempelvis cyberattacker eller biokemiska vapen, med certifiering öppen för alla företag |
| Oberoende garantimekanismer | Revisioner enligt modeller från finans, luftfart och kärnkraft, där revisorn aldrig betalas av den granskade |
🔗 We Must Pace the Frontier, Dario Amodeis essä 🔗 Who Gets to Define the Rules for AI?, Coheres debattartikel
ElevenLabs gör sitt MCP till en kreativ studio, från röst till video
14 september — ElevenLabs utökar sin officiella MCP-server med skapandefunktioner: från den assistent där användaren redan arbetar kan den nu generera tal, transkriptioner, dubbningar, musik, ljudeffekter, bilder och videor. Det är samma MCP som ElevenLabs Agents, vilket kom till Claude den 17 augusti för administration av röstagenter: en enda installation täcker båda användningsområdena.
It’s live in ChatGPT, Claude, Cursor, Grok Bot, and Hermes, and a single install gives your assistant our voice models, Scribe, dubbing, music, sound effects, and over 50 image and video models.
🇸🇪 Det är tillgängligt i ChatGPT, Claude, Cursor, Grok Bot och Hermes, och med en enda installation får din assistent tillgång till våra röstmodeller, Scribe, dubbning, musik, ljudeffekter samt fler än 50 bild- och videomodeller. — @ElevenLabs på X
| Komponent tillgänglig via MCP | Användning som beskrivs i lanseringstråden |
|---|---|
| Talsyntes (Text to Speech) | Berättarröst med valfri röst ur biblioteket, levererad i konversationen |
| Scribe (Speech to Text) | Transkription som kan återanvändas som manus, undertexter eller grund för dubbning |
| Dubbning | Version på ett annat språk, via samma anslutning |
| Musik och ljudeffekter | Bakgrundsmusik och ljuddesign för ett komplett verk |
| Fler än 50 bild- och videomodeller | Generering, redigering, videoanimering och läppsynkronisering (lipsync) |
ElevenLabs lyfter fram kombinationen av dessa komponenter: en enda brief ska kunna producera manus, berättarröst, bakgrundsmusik, ljuddesign och video. De genererade filerna hamnar i arbetsytan ElevenCreative och kan sedan öppnas i Studio för att justera tidslinjen, finslipa berättandet, lägga musik och effekter i lager samt exportera.
Tråden anger varken listan över bild- och videomodeller, kreditförbrukningen eller vilka abonnemang som omfattas, och inget blogginlägg beskrev tillkännagivandet när vi gjorde vår genomgång.
🔗 Tillkännagivandet av ElevenLabs kreativa MCP
Copilot ställer in avvägningen mellan kostnad och kvalitet i sitt automatiska modellval
14 september — GitHub lägger till tre nivåer (tiers) i Copilots automatiska modellval (auto model selection). Alla tre använder samma modellpool och Auto fortsätter att utvärdera varje prompt: nivån styr endast avvägningen.
| Auto-nivå | Prioritet vid dirigering | Avsedd användning |
|---|---|---|
| Efficiency | Kostnad | Snabba och enkla uppgifter |
| Balance | Kostnad, kvalitet och latens | Löpande arbete |
| Intelligence | Kvalitet | Komplexa uppgifter |
Faktureringen förändras inte: det är den valda modellen som debiteras, och betalande abonnenter behåller sin rabatt på 10 %. Nivåerna lanseras i VS Code, Copilot CLI och GitHub Copilot-appen. Auto, som blev allmänt tillgängligt i VS Code i december 2025, kom till JetBrains i mars, CLI i april och Copilot cloud agent i maj. GPT-6 Astra, Claude Fable 5.1 och Gemini 3.8 Flash finns visserligen i Copilot, men ingår inte i Autos modellpool: de måste väljas manuellt.
🔗 GitHubs changelog om Auto-nivåerna
Portable Computer, Perplexitys lokala agent, kommer till Windows
14 september — Perplexity lanserar Portable Computer, den helt lokala versionen av agenten Computer, i sin Windows-app. Windows-stödet, som utlovades inom kort den 3 september när funktionen öppnades för Linux-datorer efter lanseringen på DGX Spark den 25 augusti, är nu faktiskt tillgängligt med ytterligare två funktioner: lokalt MCP, som styr skrivbordsprogram via deras MCP-servrar installerade på datorn, samt schemalagda uppgifter, som utför återkommande arbete direkt på maskinen.
| Åtkomstkrav | Publicerad information |
|---|---|
| Grafikkort | GeForce RTX eller RTX PRO med minst 24 GB VRAM |
| Berörda abonnemang | Pro och Max, både för privatpersoner och företag |
| Lokalt arbete | Inga Computer-krediter förbrukas |
Modellen, orkestreraren och schemaläggaren körs på datorn. En eskalering till Perplexity Search eller någon av fler än 15 frontier-modeller kräver användarens tillstånd. NVIDIAs inlägg nämner dessutom anslutningar till Outlook, OneDrive, Word, Google Drive, Gmail, Slack och GitHub, en integrerad webbläsare samt stöd för DGX Station som tillkännages utan datum. De två källorna skiljer sig åt när det gäller den lokala modellen: Perplexitys produktsida erbjuder endast PPLX 27B på RTX-datorer och reserverar Qwen 3.8 27B för DGX Spark, medan NVIDIA nämner Qwen 3.8 27B som exempel.
🔗 Perplexitys inlägg om Portable Computer för Windows 🔗 NVIDIAs inlägg om RTX-datorer
Qwen Code 0.23.4 och Kimi Code 0.43.0 omarbetar agenternas mål och verktyg
14 september — Två kommandoradsbaserade kodagenter publicerar en version samma dag, och båda ändrar såväl målen (goals) som sina MCP- och hook-verktyg. Qwen Code är Qwen-teamets agent och Kimi Code är Moonshot AI:s.
| Jämförelsepunkt | Qwen Code 0.23.4 | Kimi Code 0.43.0 |
|---|---|---|
| Publicering | 15.20 UTC, fyra dagar efter 0.23.3 | 12.03 UTC, fem dagar efter 0.42.0 |
| Mål (goals) | Valfria gränser för antal körningar (model.goalMaxTurns) och aktiva minuter (model.goalMaxActiveMinutes) | 24-timmarsgränsen borttagen, tid efter att sessionen stängts undantas från budgetarna |
| MCP och hooks | permission_mode, agent_id och prompt_id skickas till varje hook, verktygsnamn från Claude Code känns igen | Fältet deferred per MCP-server för att läsa in verktyg vid behov via select_tools |
| Agenter och sessioner | Delad agenttavla (agent board), Codex-exekverare för underagenter | Borttagning av en session från väljaren |
| Viktigt att observera | Två inkompatibla ändringar, däribland att timeouten för kommando-hooks nu läses i sekunder | Ingen bekräftelse krävs för ett rm -rf som endast avser /tmp eller /temp |
Qwen Code 0.23.4 listar 31 funktioner och 80 korrigeringar, varav flera berör integritet: huruvida texten i förfrågningar och svar skickas beror nu på inställningen logPrompts. I Kimi Code ligger den uppskjutna inläsningen av verktyg fortfarande bakom den experimentella flaggan tool-select, och en korrigering gör att select_tools, som tidigare saknades i agentprofilerna, nu sparas.
🔗 Versionsanteckningar för Qwen Code 0.23.4 🔗 Versionsanteckningar för Kimi Code 0.43.0
ChatGPT-skrivbordsappen för Linux, där Codex körs, stöder nu officiellt Arch Linux
14 september — OpenAI Developers tillkännager officiellt stöd för Arch Linux i ChatGPT-skrivbordsappen för Linux, där användaren hittar sina projekt, lokala filer och Codex. Den installeras med ett skript som OpenAI tillhandahåller för Arch och uppdateras sedan via pacman, distributionens pakethanterare, utan att paketet behöver paketeras om. Appen är fortfarande i förhandsversion och lanserades den 11 augusti för Ubuntu, Debian och Fedora. Dokumentationen anger dessutom att skriptet konfigurerar OpenAI:s signerade paketförråd och påminner om två begränsningar i förhandsversionen för Linux: Computer Use erbjuds ännu inte där, och det inbyggda stödet för Wayland är fortfarande experimentellt.
🔗 Meddelande från OpenAI Developers på X 🔗 Dokumentation för Linux-appen
Devin Plugins, agentstyrning utvecklad tillsammans med BlackRock
9 september — I ett inlägg som publicerades den 9 september på Devins blogg, utan något tillkännagivande på X, presenterar Cognition Devin Plugins, utvecklat tillsammans med BlackRock. Ett plugin är ett versionshanterat paket som samlar skills, regler, MCP-servrar, hooks och underagenter och tillämpas både på lokala agenter (Devin CLI, Devin Desktop) och molnsessioner. Det följer den öppna standarden Agent Plugins, som redan behandlades här i augusti.
Plugins installeras med omfattningen Personal, Organization eller Enterprise, och för varje omfattning anges de som obligatoriska, rekommenderade eller förbjudna, där den högsta behörighetsnivån har företräde. Cognition nämner hooks som blockerar agenternas åtkomst till produktionsinfrastruktur och produktionsdata, utom för SRE-teamet. Eftersom plugins är kopplade till Git-repositorier versionshanteras och granskas de som kod. En enhetlig marketplace utökade lanseringen redan den 11 september; blogginlägget anger varken pris eller erbjudande.
🔗 Devins blogginlägg om agentstyrning med BlackRock 🔗 Dokumentation för Devin Plugins
Claude for Financial Advisors, elva anslutningar och åtta skills för rådgivare
14 september — Anthropic lanserar Claude for Financial Advisors, en uppsättning anslutningar och skills för förmögenhetsrådgivare. Elva nya anslutningar tillkommer (Addepar, BlackRock, Charles Schwab, Envestnet, iCapital, Orion, SS&C Black Diamond, Wealthbox, Wealth.com, Vanguard och Zocks), och ett plugin som kan installeras från Cowork samlar åtta skills:
| Arbetsmoment | Pluginets skills |
|---|---|
| Före mötet | Pre-meeting prep, Prospect intake |
| Efter mötet | Post-meeting notes and follow-up |
| Förmögenhetsanalys | Portfolio rebalance review, Estate and tax brief, Alternative investments brief |
| Implementering och efterlevnad | Advisor onboarding, Compliance and AI policy |
Kritiska uppgifter kräver rådgivarens godkännande, och både investeringsrekommendationer och kundkommunikation måste fortfarande granskas av en människa. Anthropic rekommenderar Enterprise-erbjudandet till registrerade rådgivare (registered investment advisers) på grund av dess granskningsloggar, ger en användningskredit till firmor som ansöker om en ny licens före slutet av september och anordnar ett webbinarium den 18 september.
🔗 Claude for Financial Advisors
Agentbaserad kod sätter Anthropics CI under press
14 september — På Claudes blogg berättar Sachin Malhotra hur agentbaserad kod har satt Anthropics CI under press.
| Indikator publicerad av Anthropic | Angivet värde |
|---|---|
| Levererad kod per ingenjör och kvartal | 8 gånger genomsnittet för 2021–2025 |
| Andel kod skriven av Claude | 80 % |
| Volym av CI-jobb | 25-faldig ökning på sex månader |
| De tre korrigeringarnas livslängd | 70 dagar, 29 dagar, mindre än en dag |
| Slutlig omarbetning | 3 veckor, en enda ingenjör |
Flaskhalsen uppstod i tjänsten för testurval (test impact analysis), som väljer vilka tester som ska köras för varje PR. Den var utformad som en enda process och förbrukade tre korrigeringar innan den omarbetades enligt Claudes råd: tillståndet flyttades till ett minnesbaserat lager, medan bearbetningen gjordes tillståndslös och fördelades horisontellt. Författaren rekommenderar att planera för 25 gånger högre belastning inom två kvartal.
🔗 Agentbaserad kod sätter CI under press
CobbleDB ersätter DynamoDB i Perplexitys söktjänst
14 september — Perplexity beskriver CobbleDB, det distribuerade nyckel-värde-lager som nu förser företagets söktjänst med de försegmenterade textavsnitten och embeddings för varje sida, i stället för DynamoDB. Det bygger på RocksDB, med tre repliker per partition, minnescache och NVMe-lagring, och avstår avsiktligt från transaktioner. Uppmätta latenser i produktion för en grupperad läsning:
| Latenspercentil | Före, med DynamoDB | Efter, med CobbleDB |
|---|---|---|
| Median (p50) | 31,4 ms | 5,60 ms |
| 90:e percentilen (p90) | 56,7 ms | 9,77 ms |
| 99:e percentilen (p99) | 123 ms | 24,2 ms |
Perplexity förtydligar att detta är en före- och efterjämförelse av verklig trafik vid olika tidpunkter och att besparingen på minst 20 % jämfört med DynamoDB är en intern uppskattning. Enligt företaget skrevs de omkring 40 000 raderna Rust-kod i databasens kärna på två månader av två ingenjörer och hundratals agenter. En lansering som open source har aviserats, men inget datum har angetts.
🔗 Perplexitys blogginlägg om CobbleDB
TRL v1.14: asynkron GRPO med LoRA, distribuerad över HF Jobs
10 september — I ett officiellt blogginlägg från den 10 september beskriver Hugging Face en nyhet i TRL v1.14: AsyncGRPOTrainer, som separerar träning och generering, kan träna en LoRA-adapter och endast synkronisera den med vLLM, alltså några megabyte i stället för omkring 3 GB för en modell med 1,5 miljarder parametrar. Tränaren och vLLM-replikerna körs som separata Jobs, sammankopplade via en Storage Bucket.
| Uppmätt indikator | Första körningen | Femte körningen |
|---|---|---|
| Tid för 500 steg | 3 h 27 min | 53 min |
| Mediantid för ett steg | 22,9 s | 4,8 s |
| MFU forward + backward | 3,9 % | 23,5 % |
| Belöning under de sista 20 stegen | 0,438 | 0,416 |
Tre inställningar förklarar förbättringen: att paketera sekvenserna per mikrobatch, inaktivera omberäkning av aktiveringar (gradient checkpointing) och höja antalet samtidiga förfrågningar från 128 till 384, med en jämförbar belöning. Den ursprungliga uppsättningen kostar omkring 20 dollar i timmen, och skripten för att reproducera resultaten har publicerats.
🔗 Asynkron GRPO med LoRA över HF Jobs
Transformer Engine ökar genomströmningen för dropless MoE i JAX med 10,4 gånger
14 september — NVIDIA visar hur Transformer Engine påskyndar träningen i JAX av blandningar av experter utan att tokens kasseras (dropless MoE), där varje expert tar emot ett varierande antal tokens. För DeepSeek-V3 anger texten en förbättring på 10,4 gånger med GB200, medan bildtexten anger GB300 NVL72.
| Mätvärde publicerat av NVIDIA | Angivet värde |
|---|---|
| Ursprunglig genomströmning | 103 TFLOPS per GPU |
| Kommunikationens andel av kerneltiden | Inledningsvis 84 % |
| Genomströmning med Transformer Engine | 1 068 TFLOPS per GPU, alltså 10,4 gånger mer |
| Skalningseffektivitet med 1 024 GPU:er | 97 % |
Förbättringen kommer bland annat från en grouped GEMM i MXFP8, som behandlar alla experter i ett enda kernel-anrop, samt från dispatch- och combine-operationer som slagits samman via NCCL EP. Optimeringarna levereras i NGC MaxText-containern, och NVFP4 har aviserats som nästa steg.
🔗 NVIDIAs tekniska blogginlägg om dropless MoE i JAX
PC-ALM, Sakana AI:s lokala inlärning som tränar 1 000 lager utan bakåtpropagering
14 september — Sakana AI publicerar PC-ALM (Augmented Lagrangian Predictive Coding), en metod som ersätter bakåtpropagering (backpropagation) med lokal dynamik, där varje lager endast kommunicerar med sina grannlager. Den vidareutvecklar prediktiv kodning (predictive coding) genom att förse varje lager med duala variabler, Lagrangemultiplikatorer, som gör det till en proportionell-integral återkopplingsregulator; i ett linjärt nätverk återskapar dessa variabler exakt bakåtpropageringens kreditsignaler.
På MNIST ligger residual-MLP:er med bredden 32 omkring 2 procentenheter efter bakåtpropagering ända upp till 1 000 lager. På CIFAR-10 och Tiny ImageNet presterar PC-ALM bättre än vanlig prediktiv kodning, men resultaten visas endast i diagram. Sakana AI beskriver den som den första lokala metoden som, såvitt företaget känner till, kan träna så djupa nätverk, men på uppgifter som fortfarande är enkla. Artikeln och koden har publicerats.
🔗 Augmented Lagrangian Predictive Coding
Scribe v2 Medical, ElevenLabs medicinska transkribering, nu allmänt tillgänglig
11 september — Den allmänna tillgängligheten för Scribe v2 Medical, som tillkännagavs den 11 september enbart i dokumentationens ändringslogg, utan tweet eller blogginlägg, kompletterar ElevenLabs transkriberingserbjudande. Denna finjusterade version av Scribe v2 känner bättre igen läkemedelsnamn, anatomi, patologi och klinisk diktering, samtidigt som den behåller Scribe v2:s precision för vanligt tal. Modellen behandlar ljud i batcher, till samma pris som Scribe v2, med scribe_v2_medical som modellidentifierare och samma alternativ, från entitetsidentifiering till talardiarisering. ElevenLabs avser den för klinisk dokumentation, inskrivningssamtal och arbetsflöden för efterlevnad kring skyddade hälsouppgifter. Det tekniska databladet anger 15 % färre fel än Scribe v2 för isolerade medicinska termer samt stöd för fler än 90 språk.
🔗 ElevenLabs ändringslogg från den 11 september
Google Flow kommer till iPhone
10 september — Kontot @FlowbyGoogle tillkännagav den 10 september iOS-appen för Google Flow, Googles studio för AI-skapande. Enligt App Store-sidan är den gratis med köp i appen, endast tillgänglig för iPhone och kräver iOS 16 eller senare. Där går det att skapa och redigera bilder och videor med Googles generativa modeller, med utgångspunkt i kamerarullen eller kameran. Biblioteket hålls synkroniserat med desktop-versionen, och flera genereringar kan köras i bakgrunden, med en avisering när resultatet är klart. Sidan nämner ingen modell.
🔗 Meddelande från @FlowbyGoogle på X 🔗 Google Flow på App Store
Kortfattat
- Claude Tag inom hälso- och sjukvård, åtskilt från skyddade uppgifter — Eftersom Claude Tag ännu inte omfattas av Anthropics BAA-avtal begränsar Insight Health, Tennr och Medallion det till kanaler utan hälsouppgifter; hos Insight Health avslutas 97 % av de kritiska varningarna utan att en ingenjör behöver ingripa. De Claude Tag-krediter som erbjuds organisationer som ansluter det till GitHub löper ut den 1 oktober. 🔗 källa
- Anthropic och Accenture publicerar en guide för övergången från pilotprojekt till produktion — Den riktar sig till IT-chefer och utgår från två siffror från Accenture: endast 23 % av ledarna ser en varaktig effekt av AI i hela företaget, och 42 % av organisationerna saknar en enda ansvarig för dess kostnader och resultat. 🔗 källa
- Claude Fable 5.1 löser Cyphral Distich, ett kryptogram från 1653 — En demonstration från tredje part som beskrivs i ett blogginlägg från Vals AI daterat den 31 augusti och delades av Boris Cherny på kvällen den 13 september, Stillahavstid: 44 minuter och 176 000 tokens, utan mänsklig inblandning. Författaren medger att ledtråden var enkel. 🔗 källa
- Fyxer får 53 % av sina e-postutkast godkända utan ändringar — I denna fallstudie från OpenAI fördelar den digitala chefsassistenten arbetet mellan 30 och 50 specialiserade modeller, finjusterade utifrån användarnas korrigeringar, och såg sina årliga återkommande intäkter öka från 1 till 32 miljoner dollar under 2025. Ingen modell namnges. 🔗 källa
- Devin tar PagerDuty-jouren — Enligt versionsinformationen från den 11 september kan Devin sortera PagerDuty-incidenter och publicera sin utredning som incidentanteckningar, 21 MCP-servrar kan anslutas med OAuth med ett klick, och Sessions v1 API accepterar en
idempotency_key. 🔗 källa - DevFest 2026 från den 1 oktober till den 31 december — Google Developer Groups planerar fler än 800 evenemang i 115 länder, med workshoppar och maraton för att skapa agenter (agent-athons) kring Gemini, AI Studio, Antigravity och Web MCP. 🔗 källa
- Suno presenterar Studio Chat — Denna assistent i Suno Studio känner till varje spår och varje MIDI-fragment i projektet och kan sortera, byta namn på, färgkoda eller skriva en ny del direkt på tidslinjen. Varken tillgänglighet eller pris har tillkännagivits. 🔗 källa
- MiniMax H3:s open source-ekosystem växer — MiniMax lyfter fram tre communityprojekt: VDN, som omarbetar attention för att påskynda inferens, Alibaba PAI:s PDD Acc-LoRAs i åtta steg samt LightX2V:s Turbo LoRAs i fyra och åtta steg. 🔗 källa
- Runway beskriver produktionen av A Game of HORSE — En videohandledning, kortfilmens prompts och den nedladdningsbara skillen runway-sd-enhancer, som omvandlar en rå prompt till en produktionsprompt för en 15 sekunder lång scen. 🔗 källa
- Ai2 låter studenter vid University of Washington testa AutoDiscovery — Tio team testade agenten: användbara uppslag om batterier eller proteiner, men omkring hälften av hypoteserna var ologiska bland 24 000 simulerade reaktorkonfigurationer. Provkrediterna förlängs till den 31 december. 🔗 källa
- Archsloth för sina GGUF-versioner av Qwen närmare originalet — Ett communitybidrag från FINAL-Bench-teamet på Hugging Faces blogg: vid samma storlek som filen från unsloth minskar dess
Q4_K_Mav Qwen3-4B KL-divergensen med 54,4 % på koreanska och 33,2 % på engelska, tack vare två korrigerade AutoRound-alternativ. 🔗 källa - Eric Mey mäter OpenAI-kompatibiliteten hos en LangGraph-agent — Ett individuellt bidrag på samma communityblogg: de 37 förfrågningsfälten i Chat Completions har klassificerats och inget ignoreras längre utan varning, jämfört med 11 från början, men ett streamingfel undgick schemavalideringen. 🔗 källa
- EcoHash beräknar vad en RTX PRO 6000 med 96 GB kan betjäna — Ett blogginlägg från en inferensleverantör, uppmätt på den egna tjänsten med publicerade råa CSV-filer: qwen3.6-35b-a3b levererar sin första token på 170 ms (p95) och omkring 213 tokens per sekund, medan genomströmningen når omkring 11 500 tokens per sekund under samtidig belastning på Llama-3.1-8B. 🔗 källa
Vad det innebär
Den första röda tråden handlar om agenter som vi programmerar och sätter ramar för. Claude Mods låter var och en skriva sina egna hooks i TypeScript, men låter deras sidoeffekter gå via ett $-objekt som administratörer kan granska och begränsa. Devin Plugins tillämpar samma logik på företagsnivå, med plugins som är obligatoriska eller förbjudna beroende på omfattning, GitHub låter användaren välja avvägningen mellan kostnad och kvalitet för Autos routing, såväl Qwen Code som Kimi Code ställer in varaktigheten för sina mål, och Kimi Code kan läsa in sina MCP-verktyg vid behov. MCP fungerar också som distributionskanal: en enda installation för in ElevenLabs röst, musik och fler än 50 bild- och videomodeller i fem assistenter, utan att lämna konversationen.
Den andra röda tråden gäller den infrastruktur som denna agentbaserade kod utsätter för påfrestningar, eller själv bygger. Hos Anthropic, där Claude skriver 80 % av koden, har antalet CI-jobb ökat 25 gånger på sex månader, och omarbetningen av tjänsten för testurval tog tre veckor för en enda ingenjör. Hos Perplexity skrev två ingenjörer och hundratals agenter de 40 000 rader Rust som utgör CobbleDB, vars läslatens enligt de egna mätningarna är ungefär fem gånger lägre. Träningen följer samma utveckling: TRL kortar en GRPO-körning från 3 tim 27 min till 53 min, och Transformer Engine ökar genomströmningen för en dropless MoE med 10,4 gånger – två inlägg som lokaliserar flaskhalsen innan de undanröjer den.
Den tredje röda tråden är politisk: vem som bestämmer takten och reglerna. Tre dagar efter OpenAI:s debattartikel, som efterlyste en federal lag grundad på modellernas kapacitet, föreslår Dario Amodei att framstegen för frontier-modeller ska få en tydligare takt, med början i att öppna Anthropic för integrerade utvärderare, medan Aidan Gomez invänder mot metoden. De båda texterna är överens om en oberoende granskning av de mest kapabla systemen men skiljer sig åt om fortsättningen: å ena sidan reglering som omfattar alla amerikanska frontier-företag, tillsammans med standarder som diskuteras inom ramen för ett snävt antitrustundantag; å andra sidan ett riskramverk som utformas av flera länder och revisioner som aldrig betalas av dem som granskas. Diskussionen handlar mindre om principen för tillsyn än om vilka som skriver reglerna.
Den sista röda tråden gäller känsliga data, som AI hanterar med skyddsräcken inbyggda i produkten. Portable Computer behåller filer och förfrågningar på datorn och begär tillstånd innan något skickas till molnet; Scribe v2 Medical är avsett för klinisk diktering och arbetsflöden för efterlevnad kring skyddade hälsouppgifter; Claude Tag är inte täckt av BAA-avtalet och förblir därför begränsat till kanaler som inte innehåller sådana uppgifter; och Claude for Financial Advisors låter rådgivaren godkänna kritiska uppgifter. Ju närmare agenten kommer en patients journal eller en kunds portfölj, desto tydligare blir gränsen för vad den får göra på egen hand.
Källor
- Boris Cherny på X, Claude Mods
- Claude Code, ärende Function Hooks #91870
- Dario Amodei, We Must Pace the Frontier
- Dario Amodei på X, tillkännagivande av försöket
- Cohere, Who Gets to Define the Rules for AI?
- ElevenLabs på X, tillkännagivande av kreativ MCP
- ElevenLabs på X, kompatibla klienter
- GitHub Changelog, nivåer för automatiskt modellval
- GitHub Docs, About Copilot auto model selection
- Perplexity, Portable Computer för Windows
- Perplexity, produktsida för Portable Computer
- NVIDIA, Portable Computer på RTX-datorer
- Qwen Code, versionsinformation för 0.23.4
- Kimi Code, versionsinformation för 0.43.0
- OpenAI Developers på X, Arch Linux
- ChatGPT, applikation för Linux
- Devin, styrning av agenter med BlackRock
- Devin, dokumentation för plugins
- Claude, Claude for Financial Advisors
- Claude, Agentic coding is straining CI
- Perplexity, CobbleDB
- Hugging Face, Async GRPO with LoRA across HF Jobs
- NVIDIA, dropless MoE i JAX med Transformer Engine
- Sakana AI, PC-ALM
- ElevenLabs, ändringslogg för den 11 september
- Google Flow på X
- Google Flow i App Store
- Claude, Claude Tag inom hälso- och sjukvården
- Claude, guide från pilotprojekt till produktion med Accenture
- Boris Cherny på X, Cyphral Distich
- Vals AI, Claude Fable 5.1 Solves the Cyphral Distich
- OpenAI, fallstudie om Fyxer
- Devin, versionsinformation
- Google, DevFest 2026
- Suno på X, Studio Chat
- MiniMax på X, H3-ekosystemet
- Runway på X, A Game of HORSE
- Ai2, AutoDiscovery och studenterna vid University of Washington
- Hugging Face, Archsloth och AutoRound
- Hugging Face, OpenAI-kompatibilitet för en LangGraph-agent
- Hugging Face, EcoHash och RTX PRO 6000