ai-powered-markdown-translatorArtikel översatt från fr till sv med gpt-5.4-mini.
Stor dag för byggstenarna i agentisk infrastruktur: Anthropic släpper computer use, browser tool, Skills API och Files API ur beta på Claude Platform, samtidigt som GitHub Copilot flyttar in i Slack och Microsoft Teams. På modelsidan publicerar DeepSeek sin första multimodala modell och Pika Labs lanserar en röstsynthesizer som påstår sig ge ett aldrig tidigare skådat pris-prestandaförhållande. Däremellan finns en massiv egocentrisk datamängd, en studie om benchmark-bias inom taligenkänning och ett tiotal anmärkningsvärda uppdateringar hos Google DeepMind, GitHub, Z.ai, Qwen, Harvey samt verktyg för video- och ljudgenerering.
Claude Platform: computer use, browser tool, Skills API och Files API i allmän tillgänglighet
20 augusti — Anthropic meddelar att fyra byggstenar för att bygga agenter på Claude Platform nu går över till allmän tillgänglighet: computer use, browser tool, Skills API och Files API. Det uttalade målet är att minska antalet fram- och återgångar som behövs för att automatisera en uppgift i en applikation som saknar API, och att möjliggöra byggandet av Claude Managed Agents ovanpå versionshanterade skills och återanvändbara filer.
Den nya computer_toolset_20260801 gör att Claude kan kedja ihop flera handlingar per tur (klick, inmatning, tangenttryckning, skärmdump) i stället för en fram-och-återgång per isolerad åtgärd. Anthropic uppger att kunder i tidig åtkomst har sett 20 till 40 % färre fram- och återgångar per uppgift. Browser tool utvecklas samtidigt med browser_toolset_20260801: i stället för att sikta på pixlar — skört vid minsta layoutändring — får Claude nu sidans struktur och kan agera utifrån elementreferenser.
På API-sidan gör Skills API det möjligt att ladda upp ett teams process en enda gång, versionshantera den och fästa den vid ett specifikt version_id eller vid latest. Files API får en expires_in_seconds, en 5 gånger högre hastighetsgräns (500 förfrågningar per minut) och en kvot på 1 TB per organisation. Anthropic har också publicerat en AG-UI-adapter för Managed Agents, som mappar varje konversationstråd till en hanterad session och strömmar text, verktygskall och resonemang till gränssnittet.
| Byggsten | Dagens nyhet |
|---|---|
| Computer use | computer_toolset_20260801, upp till -40 % färre fram- och återgångar per uppgift |
| Browser tool | browser_toolset_20260801, målning via referens till sidelement |
| Skills API | Versionshantering, fästning vid version_id eller latest |
| Files API | 500 förfrågningar/minut (x5), kvot på 1 TB per organisation |
GitHub Copilot kommer till Slack och Microsoft Teams
21 augusti — GitHub Copilot landar i public preview på Slack och Microsoft Teams. Principen är densamma i båda fallen: att nämna @GitHub i ett direktmeddelande, en kanal eller en tråd öppnar en molnagent-session som kan svara på frågor om kod och GitHub-aktivitet, sortera felrapporter, undersöka fel, implementera ändringar i en säker molnsandlåda och sedan öppna pull requests med en länk tillbaka till den ursprungliga konversationen.
På Slack bygger integrationen på Slack Code, Slacks nya agentiska erbjudande som lanserades samma helg: GitHub Copilot kan öppna dedikerade kodkanaler där teamet granskar diffs och inspekterar renderförhandsvisningar utan att förorena den ursprungliga konversationen. På Teams förvandlas en diskussion till en kollektiv agent-session som alla kan följa och styra; arbetet fortsätter asynkront i molnsandlådan medan teamet gör annat.
Tillgänglighet begränsad till organisationer på planen Copilot Business eller Enterprise. Administratören aktiverar Copilot:s policy för molnagent och installerar appen för Slack eller Teams; förrådsadministratörer kan kräva godkännande innan sammanslagning av pull requests som agenten genererat. Användningen förbrukar AI-krediter, och molnsandlådan faktureras separat med konfigurerbara budgetar.
🔗 GitHub Copilot i Slack · 🔗 GitHub Copilot i Teams
DeepSeek-V4-Flash-Vision-Exp: DeepSeeks första multimodala modell på API:t
21 augusti — DeepSeek lägger upp DeepSeek-V4-Flash-Vision-Exp, en experimentell multimodal modell tillgänglig under identifieraren deepseek-v4-flash-vision-exp. På de rent textuella förmågorna — agenter, resonemang, världskunskap — matchar modellen DeepSeek-V4-Flash. Nyheten ligger någon annanstans: på benchmarks för multimodala agenter rapporterar DeepSeek ett tydligt lyft jämfört med V4-Flash, med prestanda som närmar sig Opus-4.8.
Stödet för multimodalitet på API-sidan är komplett: blandad inmatning text + bild (base64, extern URL eller via en ny gratis Files API som lanserades samma dag), kompatibel med de tre befintliga formaten (Chat Completions, Messages, Responses). Prissättningen följer V4-Flash-gridden, med bildtokenisering begränsad till 384 tokens per bild. Files API gör det möjligt att ladda upp en bild en enda gång och referera till den via file_id, en bandbreddsvinst för repetitiva agentiska användningar. DeepSeek Harness 0.1.1, den öppna källkodsagent-ramen som lanserades den 13 augusti, uppdaterades samma dag för att stödja den nya modellen nativt.
| Element | Detalj |
|---|---|
| Modell | deepseek-v4-flash-vision-exp |
| Textförmågor | Paritet med DeepSeek-V4-Flash |
| Multimodala förmågor | Nära Opus-4.8 i benchmarks för multimodala agenter |
| Bildpris | Upp till 384 tokens/bild, V4-Flash-pris |
| Stödda API:er | Chat Completions, Messages, Responses |
| Ramverk | DeepSeek Harness 0.1.1 (nativt stöd) |
DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.
🇸🇪 DeepSeek-V4-Flash-Vision-Exp är nu tillgänglig på DeepSeek API-plattformen! Denna experimentella multimodala modell matchar DeepSeek-V4-Flash på de textuella förmågorna — inklusive agenter, resonemang och världskunskap. På benchmarks för multimodala agenter tar V4-Flash-Vision-Exp ett stort kliv framåt jämfört med V4-Flash, och för de multimodala agenternas prestanda närmare Opus-4.8. — @deepseek_ai på X
Pika Speech: 3B-talsyntes till 1,2 sekunder per minut, upp till 9x billigare än ElevenLabs v3
21 augusti — Pika Labs breddar sitt Pika Audio-sortiment med Pika Speech, en modell för talsyntes med 3 miljarder parametrar. Huvudargumentet är hastigheten: en realtidsfaktor (RTF) på 0,02, vilket innebär att en minut 48 kHz-tal i studiokvalitet genereras på ungefär 1,2 sekunder i lokala långtidsliknande tester, med förfrågningar möjliga upp till fem minuter sammanhängande tal.
När det gäller kontroll av rytmen är Pika Speech innovativ: i stället för att stretcha eller komprimera ljudet i efterhand — standardmetoden hos de flesta TTS-system — styr modellen rytm och längd direkt tack vare ett « latent för talets slut » (EOS latent), ett ankare placerat vid den slutliga målbilden. Flyttas detta ankare tidigare komprimeras flödet; flyttas det senare får texten andas. Arkitekturellt kombinerar teamet flow matching och distributionsmatchande distillation, FlashAttention-3 och en « token packing » som gör att fem meningsegment kostar ungefär dubbelt så mycket som ett enda i stället för fem gånger.
På kostnadssidan hävdar Pika en fördel som kan nå 9x gentemot ElevenLabs v3, 4,5x gentemot Cartesia och ElevenLabs Turbo, och 2x gentemot Fish Audio — utan att detaljera den exakta metodiken utöver dessa kvoter. Modellen är tillgänglig via Pika API Club.
Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02. […] Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes it up to 9× more cost-efficient than ElevenLabs v3, 4.5× than Cartesia and ElevenLabs Turbo, and 2× than Fish Audio.
🇸🇪 Låt oss prata om Pika Speech, en modell för talsyntes med 3 miljarder parametrar och en realtidsfaktor på 0,02. […] Pika Speech genererar en minut 48 kHz-tal i studiokvalitet på ungefär 1,2 sekunder — och stöder förfrågningar på upp till fem minuter. Denna effektivitet gör den upp till 9 gånger mer kostnadseffektiv än ElevenLabs v3, 4,5 gånger mer än Cartesia och ElevenLabs Turbo, och 2 gånger mer än Fish Audio. — @pika_labs på X
EgoSuite-Open100K: den största öppna mänskliga egocentriska datamängden
21 augusti — Lightwheel AI, i partnerskap med Hugging Face, öppen källkodslägger EgoSuite-Open100K, presenterad som den största helt annoterade mänskliga egocentriska datamängden som någonsin publicerats i fri tillgång. Det uttalade målet är 100 000 timmar mänskliga data i första person; de första 10 000 timmarna finns redan tillgängliga, och resten publiceras stegvis.
Datamängden täcker mer än 15 000 uppgifter fördelade över mer än 15 000 verkliga scener — kök, sovrum, lager, monteringslinjer — grupperade i 7 kategorier av miljöer och 128 scenetyper. Varje sekvens annoteras med handpose, kroppspose och semantik på deluppgiftsnivå, och en del av korpusen har dessutom handledskameratäckning. En viktig punkt kring licens: till skillnad från många forskningsdatamängder är EgoSuite-Open100K licensierad för kommersiell träning, inte bara för akademiskt bruk.
Datasetet presenteras av sina skapare som den första offentliga byggstenen i en bredare datainfrastruktur för « Physical AI » (robotik och förkroppsligad AI) — tanken att uppskalningen av fysiska modeller nu beror på tillgång till massiva och delade mänskliga data.
🔗 Lightwheel AI-annonsering · 🔗 Hugging Face-sammanfattning
Claude Security går över till Claude Mythos 5
21 augusti — Anthropic kör Claude Security, sitt verktyg för sårbarhetsskanning, på Claude Mythos 5, i public beta för alla Claude Enterprise-kunder. Argumentet: att dra nytta av Anthropics mest kapabla säkerhetsmodell på sin kodbas utan separat modellåtkomst — skanningarna debiteras som vanlig tokenanvändning på den befintliga planen.
Konkret pekar verktyget på ett GitHub-repository och Mythos 5 analyserar koden genom att spåra datarörelser mellan filer och resonera om interaktioner mellan komponenter. Varje resultat kommer tillbaka med en CWE-kategori, en förtroendenivå, en bedömning av allvarlighetsgrad och ett föreslaget rättningsförslag, som öppnas direkt i Claude Code på webben. Anthropic passar också på att lansera en Defender Advantage Fund på 35 miljoner dollar i krediter för öppen källkodssäkerhet, och planerar att utvidga sitt Cyber Verification Program under de kommande veckorna.
GPT-5.6 Sol-prissättning: OpenAI sänker sina API-priser, GitHub Copilot följer efter
21 augusti — OpenAI sänker API-priserna och krediterna för GPT-5.6 Sol med över 20 % under de kommande tre månaderna. Åtgärden är redan aktiv på API-sidan och rullas ut i Codex och ChatGPT Work under dagen. För Codex-användare på uppgiftsplaner (token-based) räcker de inköpta krediterna nu längre; användningen som ingår i Pro-, Plus- och Business-abonnemang förblir däremot oförändrad — prisnedgången gynnar alltså främst API-utvecklare och tokenfakturerade användare.
GPT-5.6 Sol till -50 % i GitHub Copilot
Samtidigt vidarebefordrar GitHub en separat kampanj: -50 % på GPT-5.6 Sol i GitHub Copilot fram till 3 september, användbar i appen, CLI:n och IDE:n. Det är en engångsrabatt på Copilot-sidan, inte att förväxla med den permanenta prisnedgången från OpenAI som beskrivs ovan — två olika företag, två olika mekanismer för samma modell.
🔗 OpenAI:s prisnedgång · 🔗 GitHub Copilot-kampanj
GLM-5.3 (Max) klättrar på Code Arena: WebDev
20 augusti — LMArena uppger att GLM-5.3 (Max) från Z.ai har flyttat Pareto-fronten (pris/kvalitet) i rankingen Code Arena: WebDev, som är avsedd för utvärdering av modeller på webb utvecklingsuppgifter. Med 1597 poäng skulle modellen placera sig på 2:a plats bland modeller med öppna vikter (när de väl publiceras) och 8:a totalt.
| Modell | Pris ($/M tokens) | Poäng i Code Arena: WebDev |
|---|---|---|
| GLM-5.3 (Max) | $3,65 | 1597 |
| Qwen3.8 (Max) | $5,00 | — |
| Gemini-3.7-flash-high | $2,86 | lägre poäng |
| DeepSeek-v4-flash-high | $1,10 | lägre poäng |
Med $3,65 per miljon tokens ligger GLM-5.3 (Max) fortfarande i ett prisintervall jämförbart med Qwen3.8 (Max) samtidigt som den överträffar Gemini-3.7-flash-high och DeepSeek-v4-flash-high i denna ranking — ytterligare en signal om Z.ais konkurrenskraft inom agentisk webbutveckling, som komplement till de redan kända resultaten på Terminal-Bench och den generella Agent Arena.
Harvey lanserar Tenet, en juridisk modell byggd på Kimi K3
20 augusti — Harvey presenterar Tenet, sin första eftertränade modell för juridik, baserad på en Kimi K3-grund (Moonshot AI) som eftertränats med Fireworks AI på en korpus av offentliga juridiska data, syntetiska data och experthuman-data som simulerar långvarigt juridiskt arbete.
Harvey meddelar att denna efterträning höjer den fullständiga träffsäkerheten för Tenet till 82 % på LAB-benchmarken och 22 % på LAB Contracts, jämfört med den grundläggande Kimi K3 — med topplacering på LAB Contracts och 2:a plats på LAB totalt. Driftskostnaden för Tenet skulle vara mindre än en fjärdedel av de bäst presterande basmodellerna på marknaden. Som komplement har Harvey tränat tre specialistunderagenter: M&A-due diligence, granskning av tabeller och byråkunskap.
Georgia Tech spår ursprunget till Olmo 3:s sociala resonemang
21 augusti — Ett team vid Georgia Tech utnyttjade det faktum att Ai2:s Olmo 3-stack är helt öppen — vikter, förträningskorpusen Dolma 3 (1,26 miljarder dokument), infrastruktur — för att statistiskt koppla modellens förmågor till de texter som har producerat dem, ett experiment som är omöjligt på en sluten modell.
Metoden bygger på influensfunktioner, tillämpade på omkring 5,68 miljoner dokument som samplats i Dolma 3. Huvudresultatet: texter rika på dialog och interpersonellt skrivande påverkar prestation i socialt resonemang mer än faktakunskap — och när de mest inflytelserika litterära dokumenten togs bort sjönk prestationen på benchmarken SocialIQA markant, vilket bekräftar kausaliteten.
Bias för « benchmark optimization » upptäckt i öppna ASR-modeller
21 augusti — Ett team på Hume AI publicerar på Hugging Face-bloggen en studie om en metodbias inom taligenkänning: vissa modeller verkar vara optimerade för att återge referenstranskriptionerna i offentliga benchmarktester snarare än att troget transkribera ljudet.
Av 11 öppna ASR-modeller som testades innehöll omkring 40 % av de analyserade VoxPopuli-klippen fel i sina referenser, och 6 av 11 modeller återgav dessa fel i stället för att korrekt transkribera ljudet. På LibriSpeech nådde återvinningsgraderna för maskerade siffror 30 till 40 %, ett tecken på att vissa modeller « fyller i » texten i stället för att höra den. Slutsatsen rekommenderar användning av hemliga utvärderingsdatamängder och en striktare separation mellan tränings- och testdata.
SenseNova-U1.5-8B-MoT: öppen bildmodell utan VAE eller DiT
21 augusti — SenseNova släpper som öppna vikter en bildgenereringsmodell vars uppgivna prestanda skulle vara jämförbar med Nano Banana 2. Det tekniska intresset ligger i arkitekturen: ingen VAE, ingen separat textencoder, ingen DiT — modellen bygger på en « mixture of transformers », där text- och bildtokens använder separata vikter och förväntar varandra, och denoise sker direkt i pixelrummet snarare än i ett komprimerat latent rum.
Detta angreppssätt skiljer sig från standardstacken för text-till-bild-diffusionsmodeller, och dess viktöppenhet kommer att låta gemenskapen oberoende verifiera de uppgivna prestandajämförelserna.
Diffusers 0.40.0: Modular Diffusers lämnar experimentstadiet
21 augusti — Hugging Face släpper Diffusers 0.40.0. Den mest strukturerande förändringen är att Modular Diffusers lämnar experimentstadiet, bibliotekets system för modulära pipelines. Versionen lägger till integration av flera nya öppna modeller (LTX2.5, MiniMax H3, MiniMax Music 3, Wan Animate 2), stöd för tensorparallellism för ett urval av modeller, och två nya kvantiserings-backends (SDNQ, Nunchaku-Lite).
Google DeepMind utforskar AI i spel med Fenris Creations
21 augusti — Google DeepMind tillkännager ett forskningspartnerskap med studion Fenris Creations, i linje med 15 års arbete där videospel har använts som experimentell testmiljö för AI, från Atari-mästerskap till Grandmaster-nivå i StarCraft II. Efter SIMA, som lärde agenter att förstå 3D-världar, vill DeepMind utforska navigering i verkliga mänskliga dynamiker i ett ihållande universum.
Partnerskapet riktar sig mot fyra öppna utmaningar: kontinuerligt lärande (att skaffa nya färdigheter utan att glömma de tidigare), djupa minnessystem som går långt bortom dagens kontextfönster, långsiktig planering (veckor, månader, år) och fleragentsdynamik (samarbete, förhandling, ekonomi, framväxande beteenden). Det långsiktiga målet är dubbelt: att skapa nya spelupplevelser med utvecklare och att återanvända dessa framsteg för verkliga problem och vetenskaplig upptäckt.
Runway Ruby: konvertering av SDR-video till 16-bitars HDR
21 augusti — Runway lanserar Ruby, en modell som konverterar en SDR-video (standard dynamic range) till 16-bitars HDR, med export i EXR- eller ProRes/HEVC 10–12-bitarssekvenser, i färgrymden BT.2020 med stöd för PQ eller HLG — standarderna som används i professionell postproduktion och HDR-broadcast.
Ruby fungerar lika bra på en video som användaren laddat upp som på en output genererad av Runway, med en gräns på 30 sekunder. Funktionen är tillgänglig redan nu för planerna Max och Enterprise.
NVIDIA AVO gör anspråk på 100 % på benchmarken ARC-AGI-3
21 augusti — NVIDIA presenterar AVO, en allmän kodagent, med en poäng på 100 % på ARC-AGI-3, en benchmark för interaktivt resonemang. Enligt NVIDIA slutförde AVO de 183 nivåerna fördelade över benchmarkens 25 publika miljöer, utan explicita instruktioner, angivna regler eller förut formulerade mål.
AVO fungerar via en kontinuerlig loop av inspektion, planering, implementation och utvärdering, med stöd av minne, verktyg och exekveringsåterkoppling för att bygga vidare på det den lär sig över tid — ett angreppssätt som ska hålla uppe framstegen i långa uppgifter snarare än att börja om från noll vid varje nytt kontextfönster.
HeyGen Look Packs: ändra outfit och miljö samtidigt som ansiktet behålls
21 augusti — HeyGen lanserar Look Packs, en funktion som ändrar outfit och miljö i en avatarvideo samtidigt som personens ansikte bevaras troget — argumentet är att de flesta generativa modeller också ändrar ansiktsdragen när de ändrar utseendet.
Det avsedda användningsområdet är personlig varumärkeskonsekvens i olika yrkesmässiga sammanhang: fastigheter, juridik, fitness, utbildning, välmående. En B2B-innehållsskapare kan därmed producera videor i outfits och miljöer som passar varje sektor, samtidigt som personen förblir igenkännbar från video till video. Tillkännagivandet ingår i HeyGens höga takt de senaste dagarna (Retouch den 20 augusti, Brand Kits och 4K-upscale den 18–19 augusti).
Amp lanserar Explain Usage för att förklara sin tokenförbrukning
21 augusti — Amp lägger till Explain Usage, en funktion som gör det möjligt att direkt be Puck, den inbyggda assistenten, att analysera sin egen förbrukning av tokens, krediter och orb-storlek. Användaren ställer en fråga på naturligt språk — « Vilka trådar har förbrukat flest tokens idag? » — och Puck läser de personliga användningsdata och mått per tråd för att svara.
Det finns två ingångar: att ställa frågan direkt till Puck, eller att klicka på den dedikerade knappen på usage-sidorna. För användare som föredrar rådata exponerar Amp också dessa uppgifter via CLI (amp usage --details, amp threads usage <thread-id> --details).
v0 (Vercel) lägger till Vercel Connect för att ansluta till 100+ tjänster
21 augusti — Appar och agenter som byggs i v0 kan nu direkt ansluta till Slack, GitHub, Salesforce och mer än 100 andra tredjepartstjänster via Vercel Connect, utan att utvecklaren själv behöver hantera autentiseringsflödet.
Mekanismen bygger på återanvändbara teamkopplingar kopplade till kortlivade tokens: när en koppling väl har konfigurerats på teamnivå kan varje ny app eller agent som genereras återanvända den i stället för att begära fullständig autentisering varje gång. Detta positionerar v0 som en plattform som kan producera agenter integrerade i ett företags mjukvarustack, inte bara isolerade gränssnitt.
Delade trådar i Codex och ChatGPT Work
20 augusti — Codex och ChatGPT Work inför « delade trådar »: en skrivskyddad länk som exponerar hela resonemanget i en session — tillvägagångssätt, beslut, kontext — snarare än bara ett slutresultat. Målet är att undvika att behöva rekonstruera kontexten i en pull request från spridda skärmdumpar vid kodgranskning, djup teknisk utforskning eller projektöverlämning mellan teamkollegor.
Detta är en funktion som ligger i linje med de senaste tillkännagivandena kring ChatGPT Sites (fleranvändarredigering, anpassning av URL) och stärker Codex/ChatGPT Work:s positionering som verktyg för teamarbete.
Genomskinliga bakgrunder i förhandsversion för GPT-Image-2
20 augusti — API:t GPT-Image-2 gör det nu möjligt, i förhandsversion, att generera bilder med transparent bakgrund. Den praktiska nyttan är att producera återanvändbara tillgångar — produktbilder, grafiska designelement, webbplatsmockups, marknadsföringskampanjer — som sedan kan placeras på vilken bakgrund som helst utan manuell friläggning.
Kortnotiser
- Zed — Antigravity installeras med ett klick från Zeds ACP Registry. 🔗 Tweet
- trackio 0.36 — Hugging Face publicerar en uppdatering som lägger till stöd för en ny typ av loggningsbar data, utan ytterligare precisering. 🔗 Tweet
- AI « full-stack » enligt Google DeepMind — Paige Bailey delar upp Googles end-to-end-strategi i fem lager: infrastruktur, säkerhet, forskning, modeller/verktyg, produkter. 🔗 Google-artikel
- GitHub — bättre hantering av blockerade användare: sökning på namn, sortering och paginering av långa listor. 🔗 Changelog
- GitHub — att fästa vyer, projekt och milstolpar i repo-sidofältet går nu till allmän tillgänglighet, med flera relaterade förbättringar (reaktionsavatarer, dashboard-densitet). 🔗 Changelog
- Manus förlänger gratis tillgång till Manus 1.6 Lite och Manus 1.6 till den 28 augusti (SGT), inom ramen för den dagliga kvoten. 🔗 Tweet
- Manus påminner notifierade användare om att spara sina data före den 23 augusti kl. 07:59 (SGT), före övergången till ett fristående företag. 🔗 Tweet
- Genspark lanserar en kampanj fram till den 30 september: Design + GenTeam med -90 %, GenMail gratis, Slides Ultra Mode med -50 %. 🔗 Tweet
- NVIDIA beskriver fördelningen mellan en agents sele (vad den försöker göra) och infrastrukturen (vad den faktiskt kan göra) i en djupdykning i säkerheten för agentstacken. 🔗 Tweet
- NVIDIA publicerar summeringen av Spark Hack Series i Seattle på DGX Spark: vinnande projekt inom katastrofrespons, hälsa och offline-överlevnad med Nemotron och NemoClaw. 🔗 Tweet
- NVIDIA Cosmos 3 — en Cosmos Labs-video visar post-träningen av Cosmos 3 hos partnerna Aigen och Linker Vision. 🔗 Tweet
- Luma Labs kommer att tala om kreativa agenter under Summer Signal, arrangerat tillsammans med GMI Cloud den 14 september. 🔗 Tweet
- Synthesia — dess vd citeras i en Forbes Tech-artikel om att mäta AI-användning utifrån resultat snarare än användning. 🔗 Tweet
- Qwen3.8-27B fortsätter sitt community-momentum: nya NVFP4 + DFlash2-inferensrecept i SGLang-cookbooken, lättviktsversioner publicerade av Unsloth, 1:a plats på Cline:s kodagenttavla på fyra dagar, och en NVIDIA DGX Station som rapporterar mer än 2713 tokens/sekund i toppaggregat i BF16-serviceläge. 🔗 SGLang · 🔗 Unsloth · 🔗 Cline · 🔗 DGX Station
- Qwen3.8-Max går nu att använda i kodverktyget Kilo Code för generering av gränssnitt. 🔗 Tweet
- Kimi Work publicerar en andra handledning för finansanalytiker: investerardashboard, uppdatering av finansiella modeller, batchgenerering av rapporter. 🔗 Tweet
- GLM-5.3 fortsätter sin utveckling: poäng 69 på den officiella DeepSWE-rankingen, tillgänglighet på plattformen WorkBuddy, och förlängning av Build Week av Z.ai till den 23 augusti kl. 18:00 (PT) med 100 miljoner gratis tokens för de första 50 000 nya ZCode-registreringarna. 🔗 DeepSWE · 🔗 WorkBuddy · 🔗 Build Week
- GPT-5.6 Sol — tre tredjepartsplattformar (Router, Cloudflare AI Gateway, OpenCode Zen) erbjuder var och en -50 % till mitten av september, utöver de rabatter som redan omfattas hos Devin, OpenRouter och v0. 🔗 Cloudflare AI Gateway
Vad det betyder
Dagens tillkännagivande från Anthropic och GitHub visar en underliggande trend: agentinfrastrukturen lämnar experimentstadiet. GA för computer use och browser tool på Claude Platform, i kombination med att Copilot kommer till Slack och Teams, signalerar att de stora leverantörerna inte längre nöjer sig med att sälja modeller — de säljer agenter som kan agera i de verktyg som team redan använder i vardagen, utan att varje gång behöva en dedikerad API-integration. Det är lika mycket en förändring i distribution som i kapacitet: agenten går nu dit arbetet sker, snarare än att kräva att arbetet kommer till den.
På modellfronten bekräftar DeepSeek-V4-Flash-Vision-Exp att multimodalitet håller på att bli en förväntad standard snarare än en differentierare — även aktörer som positionerar sig på ekonomisk effektivitet (V4-Flash) integrerar det nu nativt, med prestanda som närmar sig de bästa slutna modellerna. Konkurrensen på de agentiska kodbenchmarkerna (GLM-5.3 på Code Arena: WebDev, Qwen3.8-27B på Cline) illustrerar samma dynamik på utvecklarverktygssidan: prisskillnaderna mellan öppna och slutna modeller krymper, vilket driver OpenAI att sänka sina API-priser med mer än 20 % på GPT-5.6 Sol i efterdyningarna.
Rörelsen mot fullständig öppenhet — inte bara vikter, utan även data och träningsinfrastruktur — fortsätter att ge vetenskaplig utdelning: Georgia Tech-studien om Olmo 3 hade helt enkelt inte varit möjlig på en sluten modell, precis som Hume AI:s studie om bias i ASR-benchmarktester påminner om att en leaderboard-poäng inte garanterar verklig transkriptionskvalitet. Det är två användbara påminnelser i en tid då industrin multiplicerar rekordannonseringar.
Slutligen bekräftar spridningen av massiva datamängder med kommersiell licens — EgoSuite-Open100K i dag, efter flera liknande tillkännagivanden de senaste veckorna — att tillgången till verkliga mänskliga data, inte bara syntetiska, håller på att bli en strategisk fråga för robotik och förkroppsligad AI, på samma sätt som beräkningskraften har varit det för stora språkmodeller.
Källor
- Claude Platform — GA computer use, browser tool, Skills API, Files API
- GitHub Copilot i Slack
- GitHub Copilot i Teams
- DeepSeek-V4-Flash-Vision-Exp
- Pika Speech
- Pika Speech-arkitektur i detalj
- EgoSuite-Open100K
- EgoSuite Hugging Face-spegel
- Claude Security på Mythos 5
- Prissänkning för GPT-5.6 Sol (API)
- GPT-5.6 Sol -50 % i GitHub Copilot
- GLM-5.3 (Max) på Code Arena: WebDev
- Harvey Tenet
- Georgia Tech kartlägger ursprunget till Olmo 3:s sociala resonemang
- Benchmark-optimeringsbias i ASR
- SenseNova-U1.5-8B-MoT
- Diffusers 0.40.0
- Google DeepMind × Fenris Creations
- Runway Ruby
- NVIDIA AVO på ARC-AGI-3
- HeyGen Look Packs
- Amp förklarar användning
- v0 Vercel Connect
- Delade trådar för Codex / ChatGPT Work
- Genomskinliga bakgrunder i GPT-Image-2
- Zed × Antigravity
- trackio 0.36
- Den fullstackade AI:n enligt Google DeepMind
- GitHub — hantering av blockerade användare
- GitHub — sidopanelens fästning
- Manus — förlängd gratis åtkomst
- Manus — påminnelse om säkerhetskopiering
- Genspark — kampanj
- NVIDIA — säkerhet i den agentiska stacken
- NVIDIA — DGX Spark-hackathon i Seattle
- NVIDIA Cosmos 3 — efterträning
- DGX Station — Qwen3.8-27B
- Luma Labs — Summer Signal
- Synthesia i Forbes
- Qwen3.8-27B — SGLang-receptbok
- Qwen3.8-27B — Unsloth
- Qwen3.8-27B — 1:a plats i Cline
- Qwen3.8-Max — Kilo Code
- Kimi Work — handledning för finansanalytiker
- GLM-5.3 — DeepSWE-poäng
- GLM-5.3 — WorkBuddy
- GLM-5.3 — Build Week Z.ai
- GPT-5.6 Sol — tredjepartsrabatter