Sök

Claude upptäcker tidigare okända kryptografiska brister, Gemini Robotics ER 2 får flera robotar att samarbeta, GPT-5.6 sänker sina priser

Artikel genererad av artificiell intelligens
Claude upptäcker tidigare okända kryptografiska brister, Gemini Robotics ER 2 får flera robotar att samarbeta, GPT-5.6 sänker sina priser

ai-powered-markdown-translator

Artikel översatt från fr till sv med gpt-5.4-mini.

Visa projekt på GitHub ↗

Den 30 juli 2026 domineras av två forskningsgenombrott: Claude Mythos, Anthropics interna forskningsmodell, upptäcker tidigare okända kryptografiska brister i en postkvantkandidat från NIST och i en försvagad version av AES, medan Google DeepMind lanserar Gemini Robotics ER 2, som kan få flera robotar att samarbeta kring samma uppgift. Runt dessa två ämnen kretsar en prissänkning hos OpenAI för GPT-5.6, ett samtidig införande av staplade pull requests hos GitHub och Devin, flera släpp av öppna modeller (Thinking Machines, Sakana AI, LightOn), samt en våg av uppdateringar på agentsidan (Perplexity, Genspark, Gemini).


Claude Mythos upptäcker tidigare okända kryptografiska brister (HAWK, AES)

30 juli — Anthropic publicerar en studie från sitt Frontier Red Team som visar att Claude Mythos Preview, företagets mest avancerade interna forskningsmodell som inte är kommersiellt tillgänglig, har upptäckt tidigare okända matematiska brister i två stora kryptografiska algoritmer — utöver de rena implementationsbuggar som Claude redan kunde identifiera i bibliotek som OpenSSL. Tillkännagivandet publicerades den 28 juli på X, och beskrevs sedan mer detaljerat i ett fullständigt blogginlägg.

Första resultatet: en förbättrad attack mot HAWK, kandidat i den tredje omgången av NIST-tävlingen (den amerikanska standardiseringsmyndigheten) för postkvantdigitala signaturer. På 60 timmars arbete, till en kostnad på cirka 100 000 dollar i API-användning, hittade modellen en attack som halverar den effektiva nyckelstorleken för HAWK-256 — den uppskattade kostnaden för en fullständig attack går från 2^64 till 2^38 operationer. Andra resultatet: på en version av AES-128 reducerad till 7 av 10 rundor accelererar en ny teknik som döpts till Möbius Bridge (Möbius-bryggan) de bästa kända attackerna med 200 till 800 gånger, till en liknande kostnad — modellen bedömde först uppgiften som ogenomförbar innan den fortsatte på forskarnas uppmaning, som därefter lade flera hundra timmar på att validera resultatet.

Anthropic betonar att inga system i produktion berörs: HAWK är endast en kandidat som ännu inte har driftsatts, och attacken mot AES gäller bara en försvagad version av chiffret — full AES med 10 rundor är inte knäckt. Preliminära resultat gäller också LEA (nyckel återställd på mindre än en timme vid 13 rundor), Serpent-128 (fullständig attack vid 6 rundor) samt mer begränsade förbättringar för Salsa20, Poseidon och SHA-1.

För att fördjupa dessa forskningsinsatser samarbetar Anthropic med ETH Zurich, Tel Aviv University och TU Berlin för att bygga CryptanalysisBench, ett testbäddssystem för att mäta modellers kryptanalysförmåga.

Kryptografiskt målUppnått resultat
HAWK-256 (postkvantsignatur)Effektiv nyckelstorlek halverad (2^64 → 2^38), hittad på 60 timmar
AES-128 reducerad till 7 av 10 rundorAttack 200 till 800 gånger snabbare via tekniken Möbius Bridge
LEA reducerad till 13 av 24 rundorNyckelåterställning på mindre än en timme på en stationär dator
Serpent-128 reducerad till 6 rundorNy fullständig attack för återställning av nyckel
Salsa20, Poseidon, SHA-1Vinster under 10 gånger jämfört med de bästa kända attackerna

🔗 Fullständig forskning — Anthropic


Google DeepMind lanserar Gemini Robotics ER 2

30 juli — Google DeepMind lanserar Gemini Robotics ER 2 (Embodied Reasoning, förkroppsligat resonemang), deras mest kapabla modell för att ge robotar en hög nivå av intelligens. Den förstår den fysiska världen, samtalar med människor, planerar flerstegsuppgifter och delegerar sedan den motoriska exekveringen till en lägre nivå av vision-språk-handlingsmodell; den kan också inbyggt anropa verktyg som Google Search eller funktioner definierade av utvecklaren.

Jämfört med den tidigare versionen (ER 1.6) ligger det viktigaste framsteget i kontinuerlig videoförståelse: genom att observera ett livevideoflöde kan en robot följa sin egen framsteg, anpassa sig vid fel och veta exakt när den ska gå vidare till nästa steg. Google introducerar också flerrobotssamarbete: olika maskiner (en hjulrobot och en humanoid, till exempel) kommunicerar via en gemensam semantisk förståelse för att fördela komplexa uppgifter — demonstrerat med Apptroniks Apollo 2-robotar och Franka F3 Duo, som städar ett garage tillsammans.

När det gäller prestanda uppnår modellen 57,4 % precision i klassificering av uppgiftsframsteg och 91,3 % i att upptäcka rätt tidpunkt att agera (genomsnittlig avvikelse på 0,96 sekund), med en exekveringshastighet som är 4 gånger högre än större modeller med jämförbar precision. När det gäller säkerhet uppger Google att detta är deras säkraste modell hittills: den stoppar korrekt en humanoidrobot när en person närmar sig och återupptar bara sin aktivitet när området är fritt.

Modellen är tillgänglig från och med idag för utvecklare via Gemini API och Google AI Studio, med begränsad förtida åtkomst på plattformen Gemini Enterprise Agent. En demonstration med en Spot-robot från Boston Dynamics, som hämtar ett snack på röstkommando, är också dokumenterad, med kod på GitHub.

PrestandaindikatorMätt resultat
Klassificering av uppgiftsframsteg57,4 % precision
Identifiering av rätt tidpunkt att agera91,3 % precision, genomsnittlig avvikelse 0,96 sekund
Exekveringshastighet jämfört med större modeller4 gånger snabbare

🔗 Officiellt tillkännagivande — Google DeepMind


Cursor: molnagenter slutför 56 % av de mergade pull requests

30 juli — Cursor delar en markant intern siffra om införandet av sina molnagenter: i december kom bara 1 av 10 mergade pull requests från en molnagent; idag är siffran 56 %. Företaget tillskriver denna utveckling att agenterna får sin egen molnmaskin, med möjlighet att själva rätta och förbättra sin exekveringsmiljö — vilket gör att de kan genomföra längre ingenjörsuppgifter från början till slut.

In December, 1 in 10 of our merged PRs came from cloud agents. Today, it’s 56%, as we use cloud agents to complete longer engineering tasks from start to finish. We got here by giving agents their own cloud computers and letting them fix and improve their environments.

🇸🇪 I december kom 1 mergad PR av 10 från molnagenter. I dag är det 56 %, tack vare användningen av molnagenter för att genomföra längre ingenjörsuppgifter från början till slut. Vi kom hit genom att ge agenterna sin egen molndator och låta dem rätta och förbättra sina miljöer.@cursor_ai på X


Staplade pull requests går in i förhandsversion hos GitHub, Devin tar dem i bruk samma dag

30 juli — Två separata tillkännagivanden, samma dag, kring ett enda arbetsflöde: att dela upp en stor förändring i en serie mindre pull requests som kan granskas oberoende.

GitHub gör staplade pull requests mer allmänt tillgängliga

GitHub för staplade pull requests till offentlig förhandsversion i alla repositories. I stället för en jättelik pull request eller flera grenar som måste rebasas manuellt, delas förändringen upp i ordnade lager, där varje lager kan granskas via en ”stack map” som visar det aktuella lagrets position i helheten, och därefter mergas i en enda operation. Att merge:a det översta lagret gör automatiskt att allt under det landar; att merge:a ett mellanlager rebasar och omdirigerar automatiskt de öppna lagren, utan att förlora befintligt brancheskydd. Funktionen är tillgänglig via github.com, CLI:n (tillägget gh-stack), mobilappen, och direkt från en kodningsagent som GitHub Copilot tack vare den dedikerade färdigheten gh-stack.

🔗 Staplade pull requests — GitHub

Devin (Cognition) stöder dem inbyggt

Samma dag tillkännager Devin, Cognitions agent för mjukvaruteknik, inbyggt stöd för GitHubs staplade PR:er: dela upp stora förändringar i mindre diffs, behandla och rätta granskningskommentarer genom hela stacken, och rebase:a automatiskt nedströmsändringar när ett lager förändras. Den samtidiga anpassningen, både på plattforms- och agentsidan, visar att denna nya granskningsmodell etableras direkt i arbetsflöden som styrs av autonoma agenter, och inte bara för mänskliga utvecklare.

🔗 Devin — tillkännagivande från Cognition


Amp Labs ingår partnerskap med banken Westpac

29 juli — Amp Labs, tjänste-/konsultdelen av Amp (den fristående avknoppningen från Sourcegraph), tillkännager ett partnerskap med Westpac, en av Australiens äldsta banker — ett företag som är över två sekel gammalt. Målet: att förändra hur banken bygger och levererar sin teknik, särskilt migrering och modernisering av datasystem som används av miljontals människor. Ett dedikerat team kommer att arbeta på plats i Sydney tillsammans med Westpacs ingenjörer. Artikeln presenterar projektets grundarteam — med bakgrund från Block, Ethereum Foundation, Google och Canva — och öppnar för lokal rekrytering i Sydney. Detta partnerskap illustrerar hur tjänsteerbjudanden kring kodningsagenter växer fram, bortom den rena mjukvaruabonnemanget: Amp Labs säljer nu en mänsklig närvaro på plats, uppbackad av sin agent.

🔗 Tillkännagivande — Amp Labs x Westpac


Prissänkning på GPT-5.6 API, Fast-läge för Sol

30 juli — Med stöd i effektivitetsvinsterna från dagen innan (GPT-5.6 Sol optimerade själv sina produktionskärnor, vilket redan har täckts), sänker OpenAI API-priserna för GPT-5.6 Luna, deras snabbaste och billigaste modell, med 80 %, och för GPT-5.6 Terra, deras balanserade modell för vardagsbruk, med 20 %. Dessa sänkningar avspeglas också i kreditförbrukningen för abonnemangen Codex och ChatGPT Work, utan förändring av kvoter eller abonnemangspriser.

OpenAI inför också ett Fast-läge i API:t, som ersätter erbjudandet Priority Processing: för GPT-5.6 Sol ger det upp till 2,5 gånger hastigheten jämfört med standardbehandling, till dubbelt pris, utan någon förändring i intelligens. Befintliga förfrågningar märkta med ”priority” flyttas automatiskt till detta nya läge. Flera företagskunder nämns som vittnen, däribland Replit, Notion, Ramp, Blitzy, Cognition och Dust.

Modell och lägePrissättning från och med 30 juli
GPT-5.6 Terra (inmatning / utmatning)2 dollar och 12 dollar per miljon tokens
GPT-5.6 Luna (inmatning / utmatning)0,20 dollar och 1,20 dollar per miljon tokens
GPT-5.6 Sol, Fast-lägeUpp till 2,5 gånger snabbare, till dubbelt pris

GPT‑5.6 Luna is the closest we’ve come to intelligence too cheap to meter. I’ve never seen a model this affordable be this powerful — it’s unlocking use cases for Replit we didn’t expect to build for a long time.

🇸🇪 GPT-5.6 Luna är det närmaste man kommer en intelligens som är för billig för att mätas. Jag har aldrig sett en så prisvärd modell vara så kraftfull — det öppnar upp användningsfall för Replit som vi inte trodde att vi skulle kunna bygga på länge.Michele Catasta, President och Head of AI, Replit — citerad av OpenAI


Två API-inställningar tredubblar GPT-5.6 Sols poäng på ARC-AGI-3

29 juli — OpenAI publicerar en analys av de ursprungligen låga resultaten för GPT-5.6 Sol (7,8 %) och GPT-5.5 (0,4 %) på 2D-pussel-benchmarken ARC-AGI-3, trots att Sol samtidigt har löst öppna matematiska problem och slagit komplexa videospel. Undersökningen visar att benchmarkens officiella harness tar bort modellens privata resonemang efter varje handling och kapar dess historik med ett glidande fönster, vilket hindrar den från att minnas sina tidigare tankar och handlingar.

Genom att bygga om harnessen med OpenAI:s Responses API (det som används i produktion i ChatGPT och Codex), aktivera bevarat resonemang och komprimering i stället för trunkering, går GPT-5.6 Sols score på den offentliga uppsättningen från 13,3 % till 38,3 %, med 6 gånger färre utgående tokens — för en uppskattad mänsklig referens på 48 %. OpenAI drar en generell rekommendation: använd Responses API i stället för det äldre Chat Completions API för att få utvärderingar som speglar verklig användning.

Testad konfigurationUppnått resultat (ARC-AGI-3)
Officiellt benchmark-harness13,3 %
Bevarat resonemang och komprimering38,3 % (6 gånger färre utgående tokens)
Uppskattad mänsklig referens48 %

🔗 Fullständig analys — OpenAI


GitHub Copilot i Visual Studio: juliöversikt

30 juli — GitHub publicerar sin månatliga uppdatering om GitHub Copilot i Visual Studio 2026, med fyra nyheter. En ny Agent (Preview) dyker upp i Copilot Chat-väljaren, byggd på samma Copilot SDK som driver GitHub Copilot CLI — med löfte om kortare svar och uppgifter som lyckas med färre rundor fram och tillbaka. Inbyggda .NET- och Azure-färdigheter, skrivna av respektive interna team, visas automatiskt i kategorin ”Built-in” i verktygsväljaren så snart de relevanta arbetsbelastningarna är installerade (inaktiverade som standard). Funktionen Review Selection låter dig markera kod, högerklicka och få användbara inline-kommentarer. Slutligen gör anpassade instruktioner på organisationsnivå det möjligt för organisationsägare att definiera delade preferenser som tillämpas automatiskt på alla repositories — reserverat för Business- och Enterprise-planerna, medan de tre andra nyheterna finns tillgängliga på alla planer.

🔗 Juliöversikt — GitHub Copilot i Visual Studio


Genspark presenterar SecondBrain, persistent minne för AI Workspace 6.0

29 juli — Genspark lyfter, via ett medieframträdande av sin COO Wen Sang, fram en funktion kallad SecondBrain inom AI Workspace 6.0 (redan lanserad den 20 juli). Vinkeln är det så kallade ”minnesproblemet” hos AI-agenter, som glömmer ett projekts sammanhang från en session till nästa. Med uttryckligt användartillstånd kopplar SecondBrain upp sig mot e-post, kalender, chattlogik, mötesanteckningar och externa verktyg (Gmail, Slack, Notion, HubSpot, Microsoft 365…) för att bygga ett personligt kontextlager som Gensparks Super Agent kan använda. Flera konkreta användningsområden dokumenteras: automatisk veckosammanfattning, brief inför möten med deltagarkontext, eller tvärsökning i alla anslutna källor. Genspark skiljer denna mjukvara från produkten SecondBrain Note, en separat såld fysisk inspelningsenhet, som bara är en valfri ingångskanal bland andra.

🔗 SecondBrain — Genspark tillkännagivande


Perplexity lanserar Projects, en vidareutveckling av Spaces i Computer

30 juli — Perplexity ersätter ”Spaces” med Projects i Computer, sin agentorkestreringsmiljö: beständiga arbetsytor för långvarigt arbete, med ett delat och hierarkiskt filsystem som efterföljande uppgifter kan bygga vidare på utan att börja från noll. Projects kopplar till Brain, Computer:s självförbättrande minnessystem, som mellan uppgifter läser Projectets filer och sessioner på nytt så att varje ny uppgift startar med det ackumulerade sammanhanget. Den kollaborativa aspekten lyfts fram: flera medlemmar i ett team kan arbeta i samma Project samtidigt som de behåller sitt personliga minne och sina kopplingar avskilda till sina egna konton. Perplexity uppger stöd för mer än 400 verktyg (Google Drive, Notion, Linear, Snowflake, GitHub), samt integrationer med Slack och Microsoft Teams. Befintliga Spaces migreras automatiskt; tillgängligt från och med idag för alla Computer-användare.

🔗 Spaces blir Projects — Perplexity


Gemini Spark integreras i Chrome och expanderar till 160+ länder

30 juli — Google utökar Gemini Spark, sin assistent för automatisering av webbaserade uppgifter, med en direkt integration i Chrome kallad Chrome auto browse. Med användarens tillstånd kan Spark nu använda webbläsarens inloggade konton och sparade lösenord för att utföra tidskrävande ärenden — planera besök till sparade lägenheter, eller söka efter flyg och påbörja en bokning. Google förtydligar att dessa åtgärder är skyddade mot prompt injection-försök, och att känsliga steg som betalningar alltid skickas tillbaka till användaren för godkännande. Funktionen startar i USA, med en planerad expansion till andra regioner. Samtidigt breddas åtkomsten till Spark till Google AI Pro-prenumeranter i mer än 160 ytterligare länder med start idag — en betydligt större expansion än den den 23 juli, som var begränsad till USA.

🔗 Uppdateringar för Gemini Spark — Google


Nano Banana landar i Google Earth

30 juli — Google Earth integrerar nu Nano Banana 2, Googles bildgenereringsmodell, direkt i sitt webbgränssnitt. Det räcker att zooma in på en plats, klicka på ”create image” och beskriva vad man vill visualisera: modellen genererar en bild förankrad i platsens verkliga bildmaterial (satellit-, flyg- och 3D-vyer), inte en generisk scen. Artikeln går igenom fem konkreta användningsområden: återskapa en historisk plats (ruinerna i Pompeji såsom de var år 78 e.Kr.), skapa pedagogiska infografiker om en plats, ta fram planunderlag för fastighets- eller stadsutvecklingsprojekt, visualisera ett byggprojekt före arbetet, eller helt enkelt föreställa sig en plats på ett fantasifullt sätt. Funktionen är tillgänglig från och med idag, globalt, för alla Google Earth-användare på webben, utan geografiska begränsningar eller särskilda abonnemangsnivåer.

🔗 Nano Banana i Google Earth — Google


ElevenLabs lanserar Character Casting i ElevenCreative Audiobooks

30 juli — ElevenLabs lanserar Character Casting inom ElevenCreative Audiobooks, sin AI-drivna produktionssvit för ljudböcker. Funktionen gör det möjligt att importera ett komplett manuskript och sedan förhandslyssna på olika röster direkt på verkliga dialoger i texten, för att ge varje karaktär en egen röst. Målet är att förenkla röstcastingen, ett steg som hittills varit manuellt och tidskrävande i produktionen av AI-genererade ljudböcker — studion kan nu matcha rösten mot repliker som faktiskt uttalas i boken i stället för mot en generisk demotext.

🔗 Character Casting — ElevenLabs


Inkling-Small: Thinking Machines publicerar, NVIDIA följer samma dag

30 juli — Thinking Machines (Mira Muratis laboratorium) lanserar Inkling-Small, en komprimerad version av Inkling: 276 miljarder parametrar totalt, 12 miljarder aktiva, NVFP4-kvantisering, för prestanda jämförbara med Inkling — fyra gånger större — med bättre resultat i kod enligt Hugging Face. De fullständiga vikterna publiceras öppet, med möjlighet till fine-tuning via Tinker och testning i Tinker Playground (text, bild, ljud). Hugging Face förstärker lanseringen samma dag med ett blogginlägg om benchmarks och prestanda, samt en modellkollektion på Hub.

NVIDIA förstärker släppet samma dag genom att tillkännage kompatibilitet för Inkling-Small med NVIDIA NeMoDGX Station, för fine-tuning, samt en dedikerad checkpoint i formatet NVFP4 som publiceras direkt på Hugging Face. Detta tillgängliga hårdvarustöd redan vid lanseringstidpunkten (day-0) visar hur snabbt ekosystemet nu samordnar sig kring en öppen tredjepartsmodell: laboratoriet publicerar vikterna, Hugging Face dokumenterar prestandan, och NVIDIA garanterar kompatibiliteten med sin fine-tuning-infrastruktur — allt på en enda dag.

Teknisk egenskapMätt värde
Totala / aktiva parametrar276 miljarder / 12 miljarder
KvantiseringNVFP4
Dag-0-hårdvarukompatibilitetNVIDIA NeMo på DGX Station

🔗 Lansering — Thinking Machines på X

🔗 NeMo/DGX-stöd — NVIDIA på X


Sakana AI och NYU publicerar Dream-Cubed, dataset och modeller för Minecraft

29 juli — Sakana AI publicerar, tillsammans med New York University (NYU), Dream-Cubed: Controllable Generative Modeling in Minecraft by Training on Billions of Cubes. Bidraget är dubbelt: en stor datamängd av Minecraft-världar (tiotals miljarder ”kuber” från proceduralt genererade terränger och kartor byggda av människor med deras samtycke), och en familj transformermodeller tränade på dessa kuber som tokeniseringsenhet, i likhet med ord i språkmodellering. Modellerna gör det möjligt att generera och redigera interaktiva 3D-miljöer i realtid på kubnivå, med riktad inpainting, storskalig outpainting och användarstyrd generering, på världar av godtycklig storlek. Datasetet, träningskoden och artikeln publiceras öppet.

🔗 Tillkännagivande — Sakana AI på X


Together AI och Y Combinator lanserar ett dedikerat GPU-kluster för YC-startups

30 juli — Together AI och Y Combinator tillkännager ett partnerskap som levererar det första dedikerade GPU-klustret för YC-startupportföljen. Målet: att undanröja den största flaskhalsen för unga AI-startups — tillgången till beräkningskraft — utan att tvinga dem att säkra fleråriga compute-avtal som ofta överstiger hela deras kassa. Startups i YC-portföljen kan själva reservera, provisionera och hantera sina GPU:er via Together AI:s self-service-portal, för punktvisa behov av inferens och träning, utan långsiktiga åtaganden, samtidigt som de får ta del av de priser som normalt är reserverade för långtidsavtal. Samma dag lyfter Together AI fram ett första konkret användningsfall: startupen Osmosis_AI, som undersöker om en open source-modell kan nå nivån hos en foundation model genom reinforcement learning, tränad på detta kluster.

🔗 Dedikerat YC-GPU-kluster — Together AI


LightOn publicerar mDenseOn & mLateOn på Hugging Face-bloggen

30 juli — Det franska laboratoriet LightOn AI publicerar på Hugging Face-bloggen kollektionen mDenseOn & mLateOn: enkla- och multivektorbaserade modeller för informationssökning (retrieval), samt tillhörande dataset, specialiserade på flerspråkig sökning, långt sammanhang och kodsökning — totalt 18 element, publicerade som öppna vikter. Denna publicering följer samma mönster som LiquidAI:s (LFM2.5-Encoders) publicering den 28 juli: ett tredjepartslabb använder Hugging Face-bloggen som officiell lanseringskanal, med modellkortet och kollektionen direkt värd på Hub.

🔗 mDenseOn & mLateOn — Hugging Face-bloggen


Kortnotiser

  • Cognition uppdaterar FrontierCode 1.1 — med de nya prisrabatterna för GPT-5.6 Terra och Luna (se ovan) positionerar sig serien nu på Pareto-kostnads/prestandakurvan. 🔗 källa
  • Hugging Face lanserar Trackio Logbooks — version 0.34.0 av Trackio fångar automatiskt kod, agentspår och artefakter från ett AI-experiment som ett reproducerbart statiskt HTML-bundle. 🔗 källa
  • Antigravity CLI går till version 1.1.8 — strukturerade utdataformat (json, stream-json) för print-läget, anpassad JSON-schema-validering och förbättrade behörigheter för sammansatta kommandon. 🔗 källa
  • GitHub Models tas officiellt bort — playground, modellkatalog, inferens-API och BYOK är inte längre tillgängliga för någon kund; GitHub hänvisar till Microsoft Foundry eller GitHub Copilot. 🔗 källa
  • GitHub begränsar fjärrstyrning till hanterade enheter — ny företagsinställning remoteControl (requireSSO / disabled / enabled) för Copilot-sessioner med fjärrstyrning, kan rullas ut via privat repo, MDM eller konfigurationsfil. 🔗 källa
  • Kimi K3 (Max) tar förstaplatsen i Fullstack Code Arena — före GPT-5.6 Sol (xHigh) och Claude Fable 5, ännu ett tecken på att öppna modeller kommer ikapp stängda modeller i uppgifter för fullstack-utveckling (se Inkling-Small ovan). 🔗 källa

Vad det betyder

Grundforskningen lämnar laboratoriet. Claude Mythos hittar tidigare okända svagheter i en NIST-kandidat för postkvantkryptografi och i en försvagad version av AES — ett forskningsgenombrott, inte en exploaterbar produktionssårbarhet, men det illustrerar hur snabbt en intern forskningsmodell kan driva ett område som människor har studerat i årtionden. Samma dag förvandlar Gemini Robotics ER 2 den förkroppsligade robotiken från en enda robot som lyder instruktioner till flera maskiner som samordnar sig med varandra för en gemensam uppgift. Google Earth förankrar i sin tur bildgenerering i den verkliga världen: Nano Banana ritar inte längre en generisk scen, utan en rekonstruktion eller projektion utifrån satellitbilder av en specifik plats — medan Gemini Spark, via Chrome, går från text till konkret handling på användarens verkliga webben. Fyra olika sätt, denna 30 juli, att få AI att lämna det rent konversationsbaserade området.

Inferensekonomin fortsätter att luta till utvecklarnas fördel. OpenAI sänker API-priserna för GPT-5.6 Luna med 80 % och Terra med 20 %, samtidigt som de introducerar ett Fast-läge som är dubbelt så dyrt men 2,5 gånger snabbare — två motsatta sätt att matcha priset med faktisk användning. Samma dag visar en OpenAI-analys att en enkel konfigurationsändring av API:t (resonemang bevarat, komprimering) tredubblar GPT-5.6 Sol:s poäng på ARC-AGI-3 samtidigt som utgående tokenförbrukning delas med sex — en modells prestanda beror lika mycket på seleen som kör den som på modellen själv. Cognition drar en omedelbar konsekvens och uppdaterar sitt eget benchmark FrontierCode: med de nya rabatterna hamnar GPT-5.6 på Pareto-kurvan för kostnad/prestanda.

Öppna modeller fortsätter att komma ikapp de stängda. Thinking Machines publicerar Inkling-Small med NVIDIA-hårdvarustöd tillgängligt redan vid lansering; Sakana AI och NYU öppnar ett dataset och generativa modeller för Minecraft; LightOn publicerar sin kollektion av flerspråkiga informationssökningsmodeller — tre olika laboratorier som väljer samma kanal, Hugging Face-bloggen, för att lansera och dokumentera sitt arbete samma dag. Kimi K3 (Max), redan i topp i Agent Arena-rankingen, tar också förstaplatsen i Fullstack Code Arena, före GPT-5.6 Sol och Claude Fable 5. Och Together AI, tillsammans med Y Combinator, angriper det som fortfarande är den verkliga flaskhalsen i ekosystemet: tillgången till beräkningskraft, genom att leverera ett dedikerat GPU-kluster till YC-portföljens AI-startups utan att tvinga dem till fleråriga åtaganden.

Industrialiserandet av kodagenter accelererar. Hos Cursor har andelen mergade pull requests från molnagenter ökat från 10 % i december till 56 % idag. GitHub generaliserar i offentlig förhandsversion staplade pull requests, och Devin (Cognition) stödjer dem nativt samma dag — samma granskningsarbetsflöde antaget samtidigt på plattforms- och agentsidan. Amp Labs säljer å sin sida numera mänsklig närvaro på plats (ett team on-site i Sydney för Westpac) utöver sin agent, medan GitHub utökar Copilot i Visual Studio med en ny agent baserad på dess SDK. Genspark och Perplexity går framåt med ett närliggande problem, minnet: SecondBrain och Projects ger båda sina agenter ett beständigt sammanhang mellan sessioner, en förutsättning för att kunna köra långa uppgifter utan att börja om från noll varje gång.


Källor