ai-powered-markdown-translatorArtikel översatt från fr till sv med gpt-5.4-mini.
Den röda tråden den 15 juli är agenternas robusthet mot attacker: OpenAI lanserar GPT-Red, en automatiserad red teamer som stärker GPT-5.6 mot prompt-injektioner, samtidigt som Claude Code härdar sin CLI och Warps agent för kodgranskning gör det medvetna valet att bara ha läsbehörighet. Resten av dagen täcks av en våg av annonseringar kring kodningsagenter (Codex i Chrome, Grok Build som öppen källkod, Devin i Slack, GitHub Copilot), öppna modeller (Meta AI, Hugging Face, Ai2, Together AI) och flera nyheter från Google, mediegenerering, Perplexity och Cohere.
GPT-Red : OpenAI stärker GPT-5.6:s robusthet mot prompt-injektioner
15 juli — OpenAI presenterar GPT-Red, en automatiserad modell för red teaming som tränats internt för att stärka modellernas motståndskraft mot prompt-injektioner (prompt injection) — de attacker som gömmer en illvillig instruktion i ett dokument, en webbsida eller en verktygsutdata för att styra en agent bort från dess ursprungliga uppgift. I stället för att enbart förlita sig på mänskliga team för att hitta på attacker låter OpenAI denna utforskning skötas av en specialiserad modell som kan arbeta kontinuerligt och i stor skala.
Modellen tränas genom självspel (self-play) med förstärkningsinlärning: en angripare belönas när den lyckas framkalla ett oönskat beteende, medan en population av försvararmodeller lär sig att stå emot utan att skada sin ursprungliga uppgift. Detta nollsummespel har gett en angripare som kan slå nästan samtliga testade modeller, både interna och publika, ända upp till GPT-5.6.
Integrerad i träningen av GPT-5.6 har GPT-Red gjort det möjligt att minska modellens felfrekvens vid de svåraste direkta injektionerna med en faktor 6, jämfört med den bästa produktionsmodellen för fyra månader sedan. I ett akademiskt referensscenario (Dziemian et al., 2025) når den 84 % framgång jämfört med 13 % för mänskliga red teamers i samma fall.
OpenAI illustrerar den praktiska nyttan med två verkliga fallstudier. På en agent som hanterar en automat i sina lokaler (utvecklad av Andon Labs, i linje med projektet « Project Vend ») lyckades GPT-Red få ner priset på en dyr vara till 0,50 dollar, få en vara för över 100 dollar beställd för att sedan säljas vidare till samma reapris, och annullera en annan kunds beställning. På en Codex CLI-agent som konfronterades med tio scenarier för dataexfiltrering visade den sig mer effektiv och mer token-snål än en referensbas som använde en enkel prompt. Modellen förblir strikt intern — aldrig offentligt distribuerad — för att undvika att dess offensiva kapacitet hamnar i fel händer. Ett pre-print med metodbeskrivningen väntas publiceras under veckan.
| Mätt indikator | Mätt värde |
|---|---|
| GPT-Red:s framgångsgrad vs mänskliga red teamers (akademiskt scenario) | 84 % mot 13 % |
| Minskning av misslyckanden mot direkta injektioner (GPT-5.6 vs föregående) | 6x färre misslyckanden |
| Återstående felfrekvens för GPT-5.6 mot GPT-Red:s direkta injektioner | 0,05 % |
“Introducing GPT-Red. An internal automated red teamer on a mission to find our models’ prompt injection vulnerabilities at scale, helping us build stronger defenses before wider deployment.”
🇸🇪 Presentation av GPT-Red. En intern automatiserad red teamer vars uppdrag är att i stor skala hitta våra modellers sårbarheter för prompt-injektioner, så att vi kan bygga starkare försvar inför en bredare utrullning. — @OpenAI på X
Claude Code : artefakter kopplade till MCP och CLI v2.1.207 till v2.1.210
Artefakterna anropar nu MCP-anslutningar
15 juli — Claude Codes artefakter (Artifacts) kan nu anropa MCP-anslutningar (Model Context Protocol) för att bygga instrumentpaneler och applikationer som hämtar information och utför åtgärder på begäran, för varje besökare. En artefakt byggs en gång och hämtar sedan data live vid varje visning, med hjälp av den aktuella besökarens egna MCP-anslutningar — inte skaparns. Denna behörighetsmodell per besökare snarare än per skapare löser en uppenbar säkerhetsfråga för företagsanvändning: varje person ser endast de data som hon eller han själv har åtkomst till.
Funktionen är tillgänglig i Pro-, Max-, Team- och Enterprise-abonnemangen, men inte för offentligt delade artefakter — logiskt, eftersom åtkomsten till data beror på varje besökares anslutningar.
CLI v2.1.207 till v2.1.210 : skärmläsare, bantade transkript, skärpt säkerhet
15 juli — Anthropic har släppt fyra versioner av Claude Code CLI sedan den senaste bevakningen. Den mest omfattande, v2.1.208, lägger till ett skärmläsarläge (--ax-screen-reader), rättar minnesläckor som kan nå 64 MB i långa sessioner och minskar storleken på sessions-transkript med upp till 79 gånger i sessioner med hög redigeringsaktivitet. Den skärper också säkerheten: katastrofala raderingskommandon som innehåller backticks utlöser nu en bekräftelse, även i automatiskt läge och med --dangerously-skip-permissions.
V2.1.207 utökar det automatiska läget till Bedrock, Vertex AI och Foundry utan opt-in, och växlar dessa plattformar till Claude Opus 4.8 som standard. V2.1.210 lägger till en live-tidsräknare för långa verktygssamtal och skärper Agent-verktyget mot indirekt prompt-injektion via innehåll som läses av en subagent.
Kodningsagenter: Codex, Grok Build, Warp, Devin och GitHub Copilot
Codex i Chrome visar en automatiserad produktionssättningsplan
15 juli — OpenAI Developers delade en demonstration av Codex som används i Chrome för att omvandla en enkel begäran till en produktionssättningsplan: utifrån ett formulär bygger agenten en checklista, hämtar kontext från Google Drive, Slack och lokala filer, markerar punkter som kräver mänsklig uppföljning, uppdaterar den berörda portalen och skriver sedan ett svar — där det slutliga beslutet fortfarande ligger hos användaren i varje steg. Demonstrationen lyfter fram webbnavigering styrd av Codex, en funktion som redan dokumenterats i produktens changelog under namnet « Browser use ».
xAI öppnar källkoden för Grok Build
15 juli — xAI har öppnat källkoden för Grok Build, sin kommandoradsagent för kodning som lanserades i tidig beta i slutet av maj. Publiceringen omfattar fyra komponenter: agentens loop, verktygen (läsning, ändring, kodsökning, kommandokörning), terminalgränssnittet och expansionssystemet (skills, plugins, hooks, MCP-servrar, subagenter). Noterbart för utvecklare: Grok Build kan nu köras helt lokalt (local-first), ansluten till sin egen inferens och styrd via en config.toml-fil.
xAI har dessutom inaktiverat standardlagring av data för alla användare sedan den 12 juli och raderar tidigare lagrade koddata:
“In response to user questions about privacy: Since launch, Grok Build has fully respected zero data retention (ZDR). All users have always had the ability to disable data upload in the CLI. […] We disabled default retention for all Grok Build users starting on July 12th. Additionally, we are deleting all coding data that was previously retained, ensuring every user’s preferences are respected.”
🇸🇪 Som svar på användarnas frågor om integritet: sedan lanseringen har Grok Build alltid respekterat noll datalagring (ZDR). Alla användare har alltid haft möjlighet att stänga av dataöverföringen i CLI:n. […] Vi har inaktiverat standardlagringen för alla Grok Build-användare från och med den 12 juli. Dessutom raderar vi all tidigare lagrad koddata för att säkerställa att varje användares preferenser respekteras. — @SpaceXAI på X
Warp bygger en självförbättrande kodgranskningsagent
15 juli — Zach Lloyd, vd för Warp, publicerar den tredje delen i sin serie om « cloud software factory »: en kodgranskningsagent som kan förbättra sig automatiskt, efter inläggen om ticket-triage-agenten och agenten för att skriva specifikationer. Arkitekturen bygger på en granskningskompetens som analyserar pull request, diffen och specifikationerna, en GitHub-action som omvandlar dess utdata till kommentarer, samt en andra « extern loop »-agent som en gång per dag observerar mänsklig feedback för att själv föreslå en uppdatering av granskningskompetensen. Ett anmärkningsvärt designval: agenten har endast läsbehörighet till pull requests, medan publiceringen av kommentarer hanteras av GitHub-action-koden — för att begränsa risken för prompt-injektion.
🔗 Fullständigt inlägg på warp.dev
Devin flyttar in i Slack
15 juli — Cognition integrerar Devin direkt i Slack, i partnerskap med Slack, för att låta team undersöka problem, ställa frågor om en kodbas och starta utvecklingsuppgifter utan att lämna diskussionskanalen. Denna integration läggs till de ytor som redan erbjuds för Devin (CLI, IDE via Windsurf, GitHub) och svarar på insikten att många ingenjörsärenden börjar i Slack-meddelanden långt innan de blir formella ärenden.
GitHub Copilot : uppdatering av Visual Studio och BYOK-tillägg för JetBrains
14 juli — GitHub publicerar sin junisammanfattning för Copilot i Visual Studio: användningsfönster med proaktiva varningar före överskridande, förtroendevalidering för MCP-servrar (uppstartsjämförelse mot en känd referens, aktiverad som standard) och övergång till allmän tillgänglighet för C++-moderniseringsagenten. Andra förbättringar: förslag på redigering på lång distans, att lägga till en pull request som kontext i Copilot Chat och pull request-granskning integrerad i IDE:n — allt tillgängligt från Free till Enterprise.
För JetBrains utökar Copilot sitt BYOK-stöd (Bring Your Own Key) till anpassade OpenAI-kompatibla endpointar, lägger till en Claude-agentleverantör för att konfigurera agenter och färdigheter (publik förhandsversion, Pro och högre) och introducerar en lokal sandlåda samt en inbyggd felsökningsfärdighet för Copilot CLI.
🔗 Visual Studio-uppdatering · 🔗 JetBrains BYOK-tillägg
Öppna modeller : Meta AI, Hugging Face, Ai2 och Together AI
Meta AI tar full poäng i Asiatiska fysikolympiaden
14 juli — Meta AI skickade in en modell till den teoretiska delen av Asiatiska fysikolympiaden (APhO 2026), med tävlingskommitténs tillstånd. Resultatet: full poäng, 30 av 30, i nivå med de tre bästa mänskliga kandidaterna. Meta AI preciserar inte om det rör sig om Muse Spark 1.1 (dess senaste stora lansering, den 9 juli) eller en annan intern modell som inte är publik.
Hugging Face retar en ny modell med öppna vikter
15 juli — Hugging Face sände sent på dagen en livestream med den lite torra titeln (på engelska) « new open weights model », utan att avslöja namnet skriftligt — varken i tweeten, i broadcast-titeln eller på den officiella bloggen. Flera svar till tweeten frågar uttryckligen vilken modell det är och hur den står sig mot standardbenchmarks, utan att något skriftligt svar hade getts vid skrivtillfället. Återkommer så snart informationen publiceras skriftligt.
Ai2 avslutar SciArena efter 1 700 användare
15 juli — Ai2 har stängt SciArena, sin öppna utvärderingsplattform som testar modellernas förmåga att besvara frågor om vetenskaplig litteratur, bedömda av forskare snarare än av automatiska modeller. Slutresultat: omkring 1 700 användare och nära 3 900 insamlade röster. Den fullständiga metodiken och resultaten beskrivs i en artikel upplagd på arXiv.
Together AI tillhandahåller Inkling från dag 0 och lanserar TogetherLink
15 juli — Together AI gjorde Inkling, den nya modellen från Thinking Machines Lab, tillgänglig från lanseringen: en multimodal mixture of experts (MoE) med totalt 975 miljarder parametrar (40 miljarder aktiva per token), utrustad med ett kontextfönster på en miljon tokens och kapabel att bearbeta text, bild och ljud. Together AI har optimerat sin FlashAttention-4-kärna för denna arkitektur, som kombinerar frågevillkorad relativ attention och korta kausala konvolutioner.
Samma dag lanserade Together AI också TogetherLink, en öppen källkod-CLI för att köra vilken öppen modell som helst i de mest använda utvecklingsmiljöerna — demonstrationen lyfter fram GLM 5.2 som körs direkt i Codex och Claude Code.
| Mätt indikator | Mätt värde |
|---|---|
| Totalt antal parametrar (Inkling) | 975 Md |
| Aktiva parametrar per token | 40 Md |
| Kontextfönster | 1M tokens |
🔗 Stöd för Inkling dag 0 · 🔗 TogetherLink på X
Google DeepMind och Gemini Spark
DeepMind granskar flaskhalsen för vetenskaplig validering av AI-agenter
15 juli — Google DeepMind publicerar « Conjecture Machines », en essä om offentlig politik kring hur AI-agenter förändrar vetenskaplig forskning. Öppningsexemplet är slående: mikrobiologen José Penadés (Imperial College London) gav Co-Scientist ett problem som hans team hade arbetat med i nästan ett decennium; agenten återkom på två dagar med fem prioriterade hypoteser, där den första var den som hans team hade lagt år på att bevisa.
Essäen skiljer mellan två regimer: idéutveckling, där agenterna går snabbt framåt (via Co-Scientist eller AlphaEvolve), och validering, som fortfarande är långsam och kostsam — utom i matematik och datavetenskap, där den kan vara formell (verktyget Aletheia löste 6 av 10 problem i februariutmaningen « First Proof challenge »). Fyra prioriteringar föreslås för beslutsfattare: bred tillgång till agenter, utnyttjande av nationella data, investeringar i valideringsinfrastruktur och utveckling av peer review.
🔗 Tråd på X · 🔗 Hela essän på DeepMind
Gemini Spark utökar sin geografiska täckning och får fyra förbättringar
15 juli — Google breddar utrullningen av Gemini Spark, sin personliga agent som arbetar i bakgrunden för användaren, till fler länder och språk för Google AI Ultra-prenumeranter. Fyra förbättringar börjar rullas ut samma dag:
| Förbättring | Beskrivning |
|---|---|
| Redigering i Google Docs | Spark kan öppna och redigera ett dokument direkt |
| Djupare Workspace-integrering | Läsning av kommentarer i Google Sheets och Slides |
| Hastighet | Långa uppgifter körs snabbare |
| Förbättrad fler-källsourcing | Hämtning och granskning av flera källor parallellt för komplexa uppgifter |
Generering av media: Suno och Synthesia
Suno ansluter till iMessage-tangentbordet
15 juli — Suno lanserar ett tangentbords-tillägg för iMessage som gör det möjligt att generera och skicka musikstycken direkt från Messages-appen på iOS, utan att byta app. Uppdatering av Suno-appen till den senaste versionen krävs för att få åtkomst.
Synthesia lanserar Dubbing 2.0
15 juli — Synthesia tillkännager Dubbing 2.0, en omarbetning av sitt AI-drivna system för videodubbning baserad på en helt ny infrastruktur: avsevärt förbättrad läppsynk även i komplexa scener, mer uttrycksfulla röster, översättningar som bättre följer källvideons rytm och omedelbar redigering av transkriptioner utan en ny fullständig rendering. Varje användare får upp till 450 gratis minuter för att testa funktionen.
🔗 Fullständigt tillkännagivande
Perplexity och Cohere: infrastruktur och communityforskning
Perplexity avslöjar SPACE, Perplexity Computers sandbox-plattform
15 juli — Perplexity presenterar SPACE, det säkra exekveringslagret som driver Perplexity Computer: isolerade miljöer för kod, filer och långvariga agentsessioner, var och en implementerad som en virtuell maskin med sin egen gästkärna. Inloggningsuppgifter kommer aldrig in i sandlådan; en central nätverksgateway verkställer utgående policyer. Tack vare filsystemet btrfs (copy-on-write) hanterar SPACE 100 % av produktions-trafiken för Perplexity Computer sedan juni, och Perplexity planerar att utöka det till Linux-microVM:er, Windows-gäster och användarnas lokala maskiner.
| Mätt indikator | Före SPACE | Med SPACE |
|---|---|---|
| Medianlatens för att skapa en sandlåda | 185 ms | 60 ms (3,1x) |
| P90-latens för skapande | 447 ms | 89 ms (5,0x) |
Cohere publicerar resultaten från Expedition Tiny Aya
15 juli — Cohere Labs avslöjar resultaten från Expedition Tiny Aya, ett forskningsprogram med mentorskap byggt kring Tiny Aya, deras öppna och lätta modell som presterar på över 70 språk och kan köras lokalt, även på telefon. Community-projekten täcker utbildning (offline-röstkompanjon för barn, med ett nytt säkerhetsbenchmark), flerspråkig säkerhet (felanpassning som lärs in på ett språk kan överföras till ett annat) och lokal driftsättning (språkmedveten komprimering, kvantiserade assistenter i 4 bitar). Forskningen har accepterats till konferensen COLM 2026.
“Tiny Aya is Cohere Labs’ answer to a familiar problem: most AI is built for a handful of languages and needs serious hardware to run. Tiny Aya is open-weight, strong across 70+ languages, and light enough to run locally, even on a phone.”
🇸🇪 Tiny Aya är Cohere Labs svar på ett välbekant problem: de flesta AI-system är byggda för en handfull språk och kräver kraftfull hårdvara. Tiny Aya är öppen, presterar på över 70 språk och är tillräckligt lätt för att köras lokalt, även på en telefon. — Cohere Blogg
Kortnyheter
- Together AI förbättrar tillförlitligheten för sina GPU Clusters — passiva hälsokontroller, vägledd reparation av noder, ombyggd Slurm-stack och externt OIDC-stöd för produktions-GPU-kluster. 🔗 källa
- HeyGen beskriver metoden med de «sex besluten» för att prompta HyperFrames — tionde avsnittet i den dagliga serien om dess CLI-agent för videogenerering. 🔗 källa
- Kling AI publicerar ett nytt avsnitt i sin interaktiva serie «Choose a door» — communityn röstar i kommentarerna för att styra fortsättningen av skräckkortfilmen «You Can Never Leave». 🔗 källa
- Pika MCP lämnar experimentstadiet — anslutning av Pika till tredjepartsagenter (Claude, Codex, OpenClaw, HermesAgent) finns nu offentligt tillgänglig. 🔗 källa
- OpenAI Developers lanserar kbd-1.0-codex-micro — ett macropad med joystick utformat tillsammans med @work_louder för att styra dess Codex-genvägar, i begränsad upplaga. 🔗 källa
- Cohere publicerar en analys av den totala ägandekostnaden för AI i företagsmiljö — 92 till 96 % av organisationer som driftsätter generativ eller agentisk AI står inför högre kostnader än väntat, enligt Gartner, IDC och McKinsey. 🔗 källa
Vad det betyder
Agentsäkerhet håller på att bli ett eget ingenjörsområde snarare än en eftertanke. GPT-Red automatiserar red teaming genom self-play och tar det vidare till verkliga fall på en varuautomat och en Codex CLI-agent; Claude Code CLI v2.1.208 hårdnar sina egna destruktiva kommandon och sitt Agent-verktyg mot indirekt injektion; och Warp:s kodgranskningsagent väljer uttryckligen skrivskyddad åtkomst för att begränsa just den här attackfamiljen. Tre oberoende initiativ som samlas kring samma idé: ju mer agenter agerar själva på verkliga system, desto mer måste försvar mot promptinjektion bli en kontinuerlig och automatiserad disciplin, inte en engångschecklista.
Ekosystemet för kodningsagenter fortsätter att tätnas på alla fronter samtidigt. xAI öppnar källkoden till Grok Build och möjliggör helt lokal användning, Devin flyttar in i Slack för att fånga upp förfrågningar innan de ens blir ärenden, Codex rullas ut i Chrome för att styra uppgifter från början till slut, och GitHub Copilot utökar parallellt sitt BYOK-erbjudande och sin moderniseringsagent. Denna mångfald av strategier — öppen källkod, integrering i kommunikationsverktyg, autonom webbnavigering, flexibilitet mellan modellleverantörer — speglar en konkurrens där varje aktör söker en annan ingång till utvecklarnas dagliga arbetsflöde, snarare än en konvergens mot en enda dominerande modell.
Öppna modeller och infrastrukturen som betjänar dem utvecklas i tandem. Together AI illustrerar rörelsens två sidor genom att leverera Inkling redan första dagen och samtidigt publicera TogetherLink för att köra vilken öppen modell som helst i IDE:er, medan Ai2 stänger SciArena efter att ha samlat in nära 3 900 röster från forskare om tillförlitligheten i vetenskapliga svar genererade av AI. I bakgrunden ställer Google DeepMinds essä om flaskhalsen i vetenskaplig validering och Perplexitys sandbox-plattform SPACE samma fråga från två olika vinklar: hur man i stor skala och på ett säkert sätt verifierar vad allt mer autonoma agenter producerar.
På mer konsumentnära användningsområden fortsätter generativ AI att leta sig in i allt mer vardagliga ingångar — iMessage-tangentbordet för Suno, dokumentredigering i Workspace för Gemini Spark, videodubbning för Synthesia. Denna diversifiering följs av en mer stram påminnelse på företagssidan: Cohere:s analys av den totala ägandekostnaden för AI visar att 92 till 96 % av organisationerna spenderar mer än väntat, en påminnelse om att spridningen av agenter inte fritar någon från en rigorös ekonomisk hantering av den underliggande infrastrukturen.
Källor
- OpenAI — GPT-Red
- @OpenAI på X — GPT-Red
- @ClaudeDevs på X — MCP-artefakter
- CHANGELOG Claude Code
- @OpenAIDevs på X — Codex i Chrome
- xAI — Grok Build med öppen källkod
- @SpaceXAI på X — Grok Build-integritet
- Warp — självförbättrande kodgranskningsagent
- @cognition på X — Devin i Slack
- GitHub Copilot i Visual Studio — uppdatering i juni
- GitHub Copilot för JetBrains — BYOK-tillägg
- @AIatMeta på X — Fysikolympiaden
- @huggingface på X — livestream av ny modell
- @allen_ai på X — SciArena-resultat
- Together AI — dag 0-stöd för Inkling
- @nutlope på X — TogetherLink
- @GoogleDeepMind på X — Conjecture Machines
- Google DeepMind — Conjecture Machines (full essä)
- @GeminiApp på X — Gemini Spark
- @suno på X — iMessage-tangentbordet
- Synthesia — Dubbing 2.0
- @perplexity_ai på X — SPACE
- @cohere på X — Expedition Tiny Aya
- Cohere Blog — Tiny Aya i det vilda
- Together AI — tillförlitlighet för GPU Clusters
- @HeyGen på X — HyperFrames Dag 10
- @Kling_ai på X — Choose a door
- @pika_labs på X — Pika MCP
- @OpenAIDevs på X — kbd-1.0-codex-micro
- Cohere Blog — den totala ägandekostnaden för AI