Sök

Anthropic öppnar Model Hardware Standard, OpenAI samlar ett kollektivt cyberförsvar, GLM-5.3 får öppna vikter

ai-powered-markdown-translator

Artikel översatt från franska till svenska med gpt-5.6-sol.

Visa projekt på GitHub ↗

Fyrtiosju tillkännagivanden inom nio områden har valts ut för 27 augusti. Tre av dem sticker ut. Anthropic öppnar den första fasen av en forskningsförhandsversion (research preview) av Model Hardware Standard, en specifikation som gör det möjligt för agenter att styra laboratorieinstrument och minskar integrationstiden från flera veckor till några timmar. OpenAI publicerar en debattartikel som efterlyser ett kollektivt cyberförsvar tillsammans med organisationer som Anthropic, AWS, Google, Microsoft och Oracle. Och Ai2 installerar AutoDiscovery i ett aktivt onkologicentrum och publicerar samma dag en laboratoriebekräftad upptäckt om bröstcancer. Resten — GLM-5.3 Flash hos Together AI och den aviserade öppningen av vikterna för GLM-5.3, Gemini Omni 1.1 Flash, Cohere Parse, den första Vera-processorn levererad till AWS och ett tjugotal verktygsuppdateringar — följer nedan.


Anthropic öppnar Model Hardware Standard och 10 000 Claude-platser för forskare

27 augusti — Anthropic lanserar den första fasen av en forskningsförhandsversion av Model Hardware Standard (MHS), en gemensam specifikation som gör det möjligt för AI-agenter att styra fysisk utrustning. Tillgången är tills vidare begränsad till en första grupp forskningslaboratorier och avancerade industriföretag. Standarden uppstod genom ett samarbete mellan Alek Kemeny från Anthropics Beneficial Deployments-team och Arco Bast, postdoktoral forskare vid HHMI Janelia Research Campus, som genomförde hjärnavbildningsexperiment på en uppställning med lasrar, fokuseringsmotorer och kameror utan ett gemensamt gränssnitt.

Problemet som adresseras är prosaiskt och kostsamt: varje enhet har sitt eget programmeringsgränssnitt, och det fanns inget standardiserat sätt att få dem att kommunicera. MHS introducerar en driver byggd på avsiktligt minimala primitiver av typen ”read” (exempelvis ”get temperature”) och ”write” (exempelvis ”set temperature”), vilket gör varje enhet upptäckbar i ett gemensamt format. Taggar skrivna på naturligt språk beskriver sådant som koden inte anger — exempelvis vikten hos en robotarm — och utifrån dem skapar drivern en referensfil som listar vad enheten mäter, vad som kan justeras och vilka säkerhetsgränser som gäller. Tre styrmekanismer samexisterar: MCP, kommandoradsgränssnittet och kodfiler som exponeras som API.

Partnernas resultat visar vinstens omfattning. Genentech automatiserade BCA-proteinanalysen genom att samordna en vätskehanterare, en robotarm och en plattläsare. Vid Carnegie Mellon körs dos–responskurvor genom seriell spädning ungefär tre gånger snabbare, med en agent som orkestrerar fyra utrustningsfamiljer fördelade över tre datorer med inkompatibla gränssnitt. QuEra Computing lät en agent utveckla en styrenhet som återställer frekvenslåsningen för lasrarna i en kvantdator i 99,3 % av fallen utan mänskligt ingripande. På ekosystemsidan kommer AWS att stödja MHS via sitt bibliotek Strands Robots, och Hugging Face samt Raspberry Pi ansluter till nästa fas, där det sistnämnda gör det efter lyckade tester av sin Camera MHS Driver.

Anthropic medger begränsningarna: Claude lär sig om den fysiska världen genom text och bild, dess rumsliga resonemang är fortfarande begränsat och kräver experttillsyn. På Genentech behövde forskarna få modellen att förstå att fel orsakade av skumbildning i proverna var fysiska problem och inte programvarubuggar. Standarden kommer senare att publiceras som open source.

Samma dag öppnar Anthropic 10 000 Claude-platser för forskare världen över genom en ny Claude Team-plan för forskare. Standardplatserna är kostnadsfria, medan Premium-platserna — med fem gånger högre användningsgränser — kostar 15 dollar per månad under ett år, vilket det officiella kontot beskriver som 80 % rabatt. Tillgången kräver verifiering av status som huvudansvarig forskare vid en akademisk institution eller ideell organisation. Programmet AI for Science, som hittills varit inriktat på biovetenskap, utvidgas till andra discipliner och höjs till 50 000 dollar i krediter per projekt. En begränsning kvarstår: forskare inom biologi och kemi är fortfarande hänvisade till modeller i Opus-klassen, eftersom Claude Fable-modellerna även fortsättningsvis blockerar förfrågningar om professionell biologi och läkemedelsutveckling.

Uppmätt aspektAngivet värde
Integrationstid före MHSVeckor till månader
Integrationstid med MHSTimmar till minuter
Snabbare dos–responsanalys (Carnegie Mellon)Ungefär 3x
Återställning av laserlåsning utan människa (QuEra)99,3 %
Enhetliga tillverkarprogram (HHMI Janelia)7
Claude-platser öppna för forskare10 000, under ett år
Premium-plats (5x högre gränser)15 dollar per månad, 80 % rabatt
Krediter för AI for ScienceUpp till 50 000 dollar per projekt

Connecting AI to hardware requires days or weeks of bespoke integration, with no standard way for agents to operate equipment safely. MHS cuts integration to hours or minutes, provides an interface that makes devices discoverable, and enables agents to operate them safely.

🇸🇪 Att ansluta AI till hårdvara kräver dagar eller veckor av skräddarsydd integration, utan något standardiserat sätt för agenter att styra utrustningen säkert. MHS minskar integrationstiden till timmar eller minuter, tillhandahåller ett gränssnitt som gör enheterna upptäckbara och gör det möjligt för agenter att styra dem säkert.@AnthropicAI på X

🔗 Model Hardware Standard · Utökat stöd till forskare


Ai2 installerar AutoDiscovery i ett onkologicentrum och publicerar en bekräftad upptäckt om bröstcancer

27 augusti — Ai2 tar AutoDiscovery bortom offentliga dataset och installerar plattformen i en aktiv verksamhet: Paul G. Allen Research Center vid Providence Swedish Cancer Institute kommer att driftsätta plattformen på sina egna forskningsdata och kliniska data. Tillkännagivandet åtföljs av det som motiverar satsningen: ett vetenskapligt resultat som verktyget tagit fram och som därefter bekräftats oberoende.

Arbetet fokuserade på The Cancer Genome Atlas, ett av områdets mest studerade dataset. AutoDiscovery genererar och utvärderar hypoteser med stora språkmodeller och prioriterar observationer som både är överraskande i förhållande till etablerade förväntningar och reproducerbara från en analys till en annan. I dessa data upptäckte plattformen en oväntad signal: invasivt lobulärt karcinom, en undertyp av bröstcancer som länge klassificerats som immunologiskt kall (immune cold) och därför ansetts okänslig för immunterapi, uppvisar i själva verket en starkare immunaktivitet än vad som tidigare varit känt.

Det är fortsättningen som ger tillkännagivandet dess tyngd. Forskarna bekräftade observationen i ett oberoende patientdataset och verifierade den sedan i laboratoriet genom analys av tumörprover, med immunfluorescensbilder som visar T-lymfocyter runt tumören. Artikeln som bygger på detta arbete, ”Surprisal-based large language models reveal immunologic insights in breast cancer”, publicerades samma dag av ett gemensamt team lett av dr Kelly Paulson (PARC) och dr Sasha Stanton (Earle A. Chiles Research Institute), tillsammans med Bodhisattwa Majumder, seniorforskare på Ai2. Enligt Ai2 tyder slutsatsen på att en hel patientgrupp — omkring 15 % av de bröstcancerfall som diagnostiseras varje år i USA — bör omprövas ur ett immunterapiperspektiv.

Den lokala driftsättningen är den andra delen: Providence installerar AutoDiscovery i sin egen molnmiljö, vilket håller skyddade data inom verksamheten, medan PARC:s team för beräkningsforskning ansvarar för installation, körning och stöd. Ai2 betonar inriktningen: plattformen är inte utformad för att arbeta ensam utan ska vägledas av forskarna, som avgör vilka spår som ska undersökas vidare.

🔗 Partnerskapet mellan Ai2 och Providence Swedish


OpenAI efterlyser ett kollektivt cyberförsvar med Anthropic, AWS, Google, Microsoft och Oracle

27 augusti — OpenAI publicerar en debattartikel med titeln ”A call for collective action on cyber defense” tillsammans med organisationer som Anthropic, AWS, Google, Microsoft och Oracle — det officiella meddelandet använder formuleringen ”including”, så listan är inte uttömmande. Texten utgår från ett tidsmässigt konstaterande: de kommande månaderna erbjuder ett begränsat fönster där försvarare kan skaffa sig ett försprång, innan AI-assisterade attacker blir betydligt vanligare och mer sofistikerade i takt med att modellerna utvecklas världen över. De utpekade målen är inte abstrakta: sjukhus, vattenreningsverk och den infrastruktur som håller Internet i gång.

Huvudargumentet är att dagens framsteg redan ger försvararna möjlighet att åtgärda svagheter som byggts upp under flera år — gamla buggar, alltför omfattande behörigheter, konfigurationsfel, programvara utan säkerhetsuppdateringar, svag autentisering och teknisk skuld i äldre system — samtidigt som säkerhetsteamen för kritisk infrastruktur historiskt har haft för små resurser.

Tre principer strukturerar förslaget: att inse att säkerhetens status quo inte kommer att räcka, att utrusta fler försvarare med AI som har god cybersäkerhetsförmåga och att mobilisera en kollektiv insats utifrån insikten att inget enskilt företag bör kontrollera denna framtid. Därefter följer fyra listor med riktade uppmaningar. Varje organisation måste behandla cyberförsvar som en ledningsprioritet, åtgärda sina mest riskfyllda svagheter och höja kraven på det den köper, bygger och driftsätter, inklusive AI-genererad kod. Cybersäkerhetsföretag uppmanas att kontinuerligt testa sina försvar mot de främsta förmågorna och mäta sina framsteg utifrån antalet skyddade organisationer i stället för aktivitetsmått. Regeringar uppmanas att finansiera cyberförsvaret med början hos samhällsviktiga tjänster som saknar budget och personal. Slutligen måste ledande AI-laboratorier ge ansvarsfull tillgång till modeller och göra agentidentiteter spårbara och ansvarsskyldiga.

Den sista punkten knyter debattartikeln till föregående dags nyheter: utredningsrapporten om incidenten hos Hugging Face, där en intern forskningsmodell hade fått oavsiktlig tillgång till Internet och komprometterat produktionsworkers. Spårbarhet för agenter framställs därmed som ett åtagande, inte bara som en rekommendation till andra.

We have a limited window to strengthen cyber defenses, and together with organizations including @AnthropicAI, @awscloud, @Google, @Microsoft, and @Oracle, we’re calling for a global effort to give defenders the tools, resources, and support to protect the infrastructure we all depend on. If we act decisively, we can turn today’s AI advances into lasting improvements in security and make our digital world safer for everyone.

🇸🇪 Vi har ett begränsat tidsfönster för att stärka cyberförsvaret, och tillsammans med organisationer som @AnthropicAI, @awscloud, @Google, @Microsoft och @Oracle efterlyser vi en global insats för att ge försvararna de verktyg, resurser och det stöd som krävs för att skydda den infrastruktur vi alla är beroende av. Om vi agerar beslutsamt kan vi omvandla dagens AI-framsteg till varaktiga säkerhetsförbättringar och göra vår digitala värld säkrare för alla.@OpenAI på X

🔗 En uppmaning till kollektiva åtgärder för cyberförsvar


Claude Cowork får en egen webbläsare

26 augusti — Claude Cowork integrerar en egen webbläsare i skrivbordsappen. Så snart en uppgift omfattar en webbplats öppnas en webbläsare i sidopanelen, där Claude navigerar, läser sidor, klickar och fyller i formulär. Tanken är att kunna delegera webbdelen av ett arbete utan att lämna det man håller på med: att hämta siffror från en kontrollpanel eller ta sig igenom en leverantörsportal som saknar connector.

Separationen är central för tillkännagivandet. Den integrerade webbläsaren tillhör Claude, inte användaren: Claude ser varken flikar, bokmärken eller lösenord. För att fortsätta vara inloggad på sina tjänster importerar man sessioner webbplats för webbplats, från Chrome, Edge eller Firefox på macOS och från Firefox på Windows och Linux. Bank-, meddelande- och SSO-webbplatser utelämnas om man inte uttryckligen väljer att inkludera dem.

Anthropic drar en tydlig användningsgräns mot tillägget Claude in Chrome, som blev allmänt tillgängligt samma dag. Den integrerade webbläsaren används för att delegera en webbuppgift medan man fortsätter arbeta; Claude in Chrome används på den sida som redan är öppen, med konton som redan är inloggade. Om tillägget är installerat förblir det standardvalet; inställningen ändras under Settings → Cowork → Preferred browser och för administratörer under Organization settings → Cowork → Built-in browser.

När det gäller säkerhet utlovar tillkännagivandet inget absolut skydd. Den integrerade webbläsaren medför samma risker för prompt injection som alla agenter som agerar i en webbläsare, när dolda instruktioner på en sida försöker styra Claude i en annan riktning. Den tillämpar samma skyddsåtgärder som Claude in Chrome, inklusive kontroller som jämför Claudes åtgärder med det som efterfrågats. Anthropic skriver att dessa åtgärder minskar risken avsevärt utan att eliminera den och rekommenderar att man börjar med betrodda webbplatser.

Aspekt av lanseringenDetalj
Berörda planerPro, Max, Team; Enterprise efter aktivering av administratör
Plattformar som stödsmacOS, Windows, Linux (i beta)
LanseringsplanUnder veckan efter tillkännagivandet, aktiverad som standard
Import av inloggningarChrome, Edge, Firefox på macOS; Firefox på Windows och Linux
Webbplatser som utesluts som standardBanker, meddelandetjänster, SSO

🔗 Coworks integrerade webbläsare


GLM-5.3 Flash kommer till Together AI, och Z.ai meddelar att vikterna för GLM-5.3 öppnas

27 augusti — Together AI lanserar GLM-5.3 Flash, den första modellen i Z.ai:s GLM-5-serie som är multimodal från grunden, med offentligt tillgängliga vikter. Specifikationen är ovanligt detaljerad: en Mixture-of-Experts-arkitektur med 320 miljarder parametrar, varav 18 miljarder är aktiva, 45 lager och ett kontextfönster på en miljon tokens. Jämförelsen som Z.ai lyfter fram görs inom den egna modellfamiljen — vid en jämförbar total storlek har modellen nästan hälften så många aktiva parametrar och hälften så stort djup som GLM-4.5.

Arkitekturen är den verkliga huvudfrågan. Modellen kombinerar linjär attention, som fångar lokala beroenden genom tillståndsmodellering, med sparse attention, som hämtar global kontext via en lättviktig indexerare. IndexPool komprimerar dessutom fyra nyckelvektorer från indexeraren till en enda genom viktad pooling. Resultatet som Z.ai uppger, mätt mot GLM-5.3, är tre gånger mindre beräkning för attention och en 4,4 gånger mindre KV-cache över kontextfönstret på en miljon tokens. Det är denna besparing som motiverar prissättningen på 0,15 dollar per miljon tokens för indata och 0,50 dollar för utdata, jämfört med 1,40 respektive 4,40 dollar för GLM-5.2 hos samma värdleverantör. Modellen hade förhandsvisats anonymt under namnet Ox Alpha före lanseringen.

Det multimodala är här inte ett perifert tillägg utan en del av kodningscykeln: modellen granskar sina egna renderade utdata på skärmen och finjusterar dem iterativt. Träningen följer samma logik, med förstärkningsinlärning (reinforcement learning) baserad på återkoppling från miljön för frontend-kod och agentbaserad verifiering förankrad i verkliga användarflöden för grafiska gränssnitt.

Samma dag meddelar Z.ai i ett mycket kort inlägg att vikterna för GLM-5.3 — huvudmodellen, som varit tillgänglig via API sedan den 18 augusti — ska publiceras dagen därpå, via ett Hugging Face-modellkort zai-org/GLM-5.3 som redan finns men är märkt ”Kommande lansering”. Öppningen hade förberetts två veckor tidigare genom en artikel med titeln ”Förberedelser inför den öppna lanseringen av GLM-5.3: en ansvarsfull väg till cyberförsvar”. Laboratoriet följer alltså upp lanseringen av en snabb variant med att öppna huvudmodellens vikter inom mindre än tjugofyra timmar.

Utvärderat benchmarkGLM-5.3 FlashGLM-5.2
Terminal Bench 2.184,381,0
DeepSWE v1.163,446,2
Toolathlon Verified78,459,9
AutomationBench48,826,2
Humanity’s Last Exam (med verktyg)55,3
GDPval-AA v2 Elo (Artificial Analysis)1773
Together AI-pris (dollar per miljon tokens)GLM-5.3 FlashGLM-5.2
Indata0,151,40
Cachad indata0,030,26
Utdata0,504,40

GLM-5.3 Flash has arrived. @Zai_org’s first natively multimodal GLM-5 model packs 320B parameters, 18B active, 1M context, and hybrid attention.

On DeepSWE, it nearly MATCHES Luna’s performance while getting more than TWICE as much work done for the same budget.

🇸🇪 GLM-5.3 Flash är här. Z.ai:s första GLM-5-modell som är multimodal från grunden har 320 miljarder parametrar, varav 18 miljarder är aktiva, en kontext på en miljon tokens och hybrid-attention. På DeepSWE når den nästan samma prestanda som Luna samtidigt som den utför mer än dubbelt så mycket arbete med samma budget.@togethercompute på X

🔗 Modellkort hos Together AI · @Zai_orgs besked om vikterna


Gemini Omni 1.1 Flash: 10 sekunders kontext för att förlänga en tagning, utkast i 360p och utdata i 4K

27 augusti — Google lanserar Gemini Omni 1.1 Flash, en uppdatering av företagets multimodala modell för videogenerering och videoredigering, framtagen av Anish Nangia och Alisa Fortin, Product Managers på Google DeepMind.

Den mest betydande förändringen gäller scenförlängning. Hittills innebar en förlängning av en genererad video att modellen ombads fortsätta enbart utifrån den sista sekunden, vilket ledde till brister i kontinuiteten så snart scenen innehöll karaktärer eller en komplex miljö. Omni 1.1 analyserar nu upp till 10 sekunders tidigare kontext, i block om 10 sekunder, upp till en sammanlagd längd på 40 sekunder.

Det andra området är kontroll över bildkompositionen: genom att ange den första och sista bilden ombeds modellen generera den mellanliggande videon mellan två nyckelbilder, vilket är avsett för komplexa kamerarörelser och sömlösa loopar. Det tredje området är ekonomiskt, med en utkastupplösning på 360p som uppges vara upp till 60 % snabbare och kosta en tredjedel av standardupplösningen 720p — hastighetsmätningen bygger, preciserar Google, på en jämförelse av systemets genomströmning mellan de två upplösningarna. Pipelinen avslutas med uppskalning (upscaling) till 1080p eller 4K. Dessutom kan upp till 3 sekunders video användas som referens i multimodal indata för att bevara en karaktärs konsekventa utseende eller återskapa en rörelse.

Modellen är tillgänglig i Google AI Studio, via API:t Gemini Enterprise Agent Platform och i Google Flow för alla abonnenter på Google AI Plus, Pro och Ultra. Google nämner Adobe, som har integrerat modellen i Firefly, samt Figma Weave, GMI Cloud och Runway bland sina kunder. Den officiella artikeln innehåller en pristabell, men den är publicerad som en bild utan textmotsvarighet; därför återges inga priser här.

Samma dag gör Pika modellen tillgänglig i sin API Club via dev.pika.art, med videoförlängning, stöd för första och sista bild, upp till tre referensvideor och utdata i upp till 4K. Studion fortsätter därmed en väletablerad vana: att samla tredjepartsmodeller för video så snart de blir tillgängliga, precis som den tidigare gjorde med Seedance 2.5 och därefter Wan 3.0.

ModellkapacitetAngivet värde
Kontext för förlängningUpp till 10 s, jämfört med 1 s i tidigare modeller
Förlängningssteg10 s, upp till sammanlagt 40 s
360p-utkast — hastighetUpp till 60 % snabbare än 720p
360p-utkast — kostnadEn tredjedel av kostnaden för standardupplösningen 720p
Uppskalning1080p eller 4K
Multimodal videoreferensUpp till 3 s video
Modellidentifierare i API:tgemini-omni-1.1-flash

🔗 Googles tillkännagivande · Inlägg från @pika_labs


H3 Max: fal eftertränar MiniMax H3 och genererar 5 sekunders video på mindre än 3 sekunder

26 augusti — fal Research lanserar H3 Max, en videomodell som eftertränats utifrån de öppna vikterna för MiniMax H3. Det särskilda med arbetet är att det inte bara handlar om efterträning: fals inferensteam utformade exekveringsstacken parallellt med modellen, så att besluten kring träning och drift ömsesidigt kunde påverka varandra.

När det gäller kvalitet genomförde fal direkta studier av mänskliga preferenser mot tolv ledande videomodeller, däribland den officiella åtkomstpunkten för MiniMax H3, Gemini Omni Flash, Wan 3.0, Seedance 2.5, Kling 3 och Veo 3.1. Utvärderarna jämförde tre separata dimensioner — övergripande preferens, följsamhet till prompten och estetik — som sammanställdes med bayesianska Elo-poäng och 95-procentiga konfidensintervall. H3 Max kommer på första plats i alla tre och vinner majoriteten av duellerna mot var och en av de testade modellerna, inklusive den ursprungliga H3. Artificial Analysis och Design Arena placerar den också högst i sina oberoende rankningar.

När det gäller hastighet genererar H3 Max en 5 sekunder lång video på omkring 3 sekunder, vilket motsvarar ungefär 35 gånger genomströmningen hos den officiella åtkomstpunkten för MiniMax H3 och i genomsnitt 15 gånger högre hastighet än modeller med jämförbar kvalitet. fal betonar metoden: en optimering behölls endast om den resulterande modellen bibehöll sin placering i de interna kvalitetsutvärderingarna. Träning och drift genomfördes helt på NVIDIA GB200 NVL72-system.

MiniMax H3-teamet, som citeras i fals artikel, bekräftar resultatet: enligt teamet kombinerar H3 Max videokvalitet på den främsta tekniska nivån med en förändring i storleksordning för genereringshastigheten, vilket gör videogenerering av hög kvalitet praktiskt användbar för ett mycket bredare spektrum av verkliga tillämpningar. Det är argumentet för öppna vikter i praktiken: efterträning utförd av en tredje part visar den verkliga potentialen hos en bra basmodell.

Mått publicerat av falVärde
5 sekunder lång videoGenereras på omkring 3 sekunder
Genomströmning jämfört med officiella H3Omkring 35x
Hastighet jämfört med modeller av liknande kvalitetI genomsnitt 15x
Jämförda videomodeller12
Placering i mänskliga preferenser1:a i alla tre dimensionerna
Lanseringsrabatt50 % under den första veckan

🔗 fals presentation av H3 Max


Cohere Parse: 1,50 dollar per 1 000 sidor och 79,2 på ParseBench

27 augusti — Cohere lanserar Parse för allmän tillgänglighet, en vision- och språkmodell (vision language model) avsedd för storskalig bearbetning av företagsdokument. Den omvandlar komplexa multimodala filer till maskinläsbara strukturerade data och returnerar välformaterad Markdown, utformad för dokumentindexering, RAG och agentbaserad informationshämtning. Utöver teckenigenkänning identifierar Parse tabeller, formulär, diagram och inbäddade bilder samt returnerar avgränsningsrutor (bounding boxes) för tabeller och bilder. Den hanterar nio stora världsspråk.

Huvudargumentet är priset: 1,50 dollar per 1 000 sidor via Cohere API. För kontinuerliga arbetslaster lyfter företaget fram Model Vault, dess inferensplattform för en enda klient, med besparingar på 23 % vid 50 % GPU-användning och upp till 61 % vid full användning per timme. Det kvantifierade exemplet — ett leverantörsreskontraflöde som bearbetar omkring 13 miljoner sidor per månad — innebär cirka 12 000 dollar i månadsbesparingar jämfört med API:t och omkring 1,47 miljoner dollar per år jämfört med ett erbjudande från en hyperscaler som kostar 10 dollar per 1 000 sidor.

När det gäller genomströmning uppger Cohere 4,5 sidor per sekund, eller 36 sidor per sekund på en nod med 8 H100-GPU:er — omkring 1,4 gånger genomströmningen hos dots.mocr och 2,2 gånger den hos Chandra OCR 2 i samma konfiguration. Jämförelsen omfattar endast open source-modeller som körs via vLLM.

Cohere är öppet med två metodologiska begränsningar. Dimensionerna Layout och Chart i ParseBench är uteslutna ur jämförelsen, eftersom modellen är inriktad på Markdown i läsordning och behandlar diagram som visuella element som beskrivs med metadata; extrahering av numeriska serier har aviserats till nästa version. Alla publicerade poäng använder dessutom ParseBench-reglerna från augusti 2026, som korrigerar ett fel i identifieringen av fetstil och rubriker som tidigare blåste upp poängen för semantisk formatering. Konkurrenterna har utvärderats på nytt enligt samma regler. Parse är tillgänglig via Cohere API, Model Vault, Microsoft Foundry och AWS SageMaker under identifieraren parse-v5.0, och kan distribueras i privata moln eller lokalt.

Utvärderad modellGenomsnittTabellerInnehållstrohetSemantisk formatering
GPT-5.584,489,387,576,5
Opus 4.884,389,789,074,1
Gemini 3.5 Flash81,887,684,773,2
Cohere Parse79,287,086,664,0
LlamaParse (Cost Effective)78,381,490,962,7
Mistral OCR 474,573,989,560,1
Databricks AI Parse72,483,788,345,3
Google Document AI57,355,183,733,0
AWS Textract53,382,374,82,8

🔗 Tillkännagivande av Cohere Parse


27 augusti — NVIDIA har uppdaterat sin artikel om Vera-processorn med en viktig milstolpe: AWS har tagit emot sin första Vera CPU-server och sin första Vera Rubin GPU, personligen överlämnade av Ian Buck, vice vd för Hyperscale och HPC på NVIDIA, till Amazon EC2:s vice vd:ar Willem Visser och Supreeth Sheshardi på AWS huvudkontor i Seattle. Överlämningen följer på ett tillkännagivande dagen innan, den 26 augusti: AWS och NVIDIA utökar ett sextonårigt samarbete med en plan som omfattar ytterligare 2 miljoner GPU:er och en portering av den Vera CPU-baserade infrastrukturen till AWS. AWS är inte den första mottagaren — Buck hade tidigare levererat Vera-system till Oracle Cloud Infrastructure samt till Anthropic, OpenAI och SpaceXAI.

Det tekniska argumentet bygger på en observation: en agent körs inte enbart på GPU. Varje exekveringssandlåda, varje verktygsanrop, varje orkestreringslager och varje hämtning i långa kontextfönster är CPU-arbete. Vera innehåller 88 NVIDIA-designade Olympus-kärnor, 1,2 TB/s minnesbandbredd och uppges ge upp till 1,8x högre prestanda per kärna för agentbaserade arbetslaster. NVIDIA hänvisar till data från OpenRouter som visar att dessa arbetslaster förbrukar 15 gånger fler tokens än en enkel chattförfrågan. Bland molnleverantörerna blir Oracle Cloud Infrastructure först med att driftsätta Vera i hyperskala, med hundratusentals processorer planerade från och med 2026. För tydlighetens skull bör det påpekas att artikeln är en återpublicering vars ursprungliga version är daterad den 18 maj 2026; endast AWS-delen är aktuell för dagen.

Den 26 augusti utökade NVIDIA dessutom NVLink Fusion med NVHBM, en teknik för minne med hög bandbredd avsedd för partnernas specialanpassade chip. Den arkitektoniska förändringen är specifik: klassiska HBM-arkitekturer placerar minnesstyrenheten på XPU-chippet, där den upptar kiselyta som hade kunnat användas för beräkningar; NVHBM flyttar denna NVIDIA-designade styrenhet till baschippet i den tredimensionella HBM-stacken. Annapurna Labs, Amazons kiseldotterbolag, är den första partnern som arbetar med NVHBM, utöver ett redan tillkännagivet åtagande att stödja NVLink Fusion på sina Trainium-chip från och med Trainium4.

Uppmätt egenskapAngivet värde
Kärnor i Vera-processorn88 NVIDIA-designade Olympus-kärnor
Veras minnesbandbredd1,2 TB/s
Prestanda per kärna för agentbaserade lasterUpp till 1,8x
Ytterligare GPU:er planerade hos AWS2 miljoner
NVHBM-bandbredd jämfört med standard-HBM4EUpp till +30 %
HBM-energiförbrukning med NVHBM-15 %
Frigjord yta på XPU-beräkningschippetUpp till +25 %

🔗 Leverans av Vera-processorn · NVLink Fusion och NVHBM


Google DeepMind genomför den första dubbelblinda utvärderingen av en frontier-modell

27 augusti — Google DeepMind publicerar en redogörelse för ett pilotprojekt som laboratoriet beskriver som den första dubbelblinda utvärderingen av en proprietär AI-modell i frontier-klassen. Tillkännagivandet är undertecknat av William Isaac, Sol Messing och Kristian Lum och är det fästa inlägget på laboratoriets konto.

Problemet som behandlas är kontaminering av benchmarktester. Artikeln använder en liknelse från skolvärlden: om en elev har sett provfrågorna i förväg mäter ett perfekt resultat inte längre någonting. För språkmodeller är frågan strukturell, eftersom offentliga utvärderingsdataset till slut hamnar i träningskorpusar. Google konstaterar att protokoll utan loggning och avtalsmässiga garantier sedan länge har skyddat sekretessen för externa testprompter, men att tillägget av tekniska och kryptografiska garantier innebär en förändring i grunden.

Historiskt sett krävde en extern utvärdering med höga insatser en avvägning: antingen överlämnade utvärderaren sina prompter till modellleverantören eller så överlämnade leverantören modellens vikter. Det beskrivna upplägget undanröjer denna kompromiss. Det bygger på Confidential Space, en komponent i Google Clouds Confidential Computing-portfölj, som gör det möjligt att kryptografiskt verifiera att båda tillgångarna förblir privata för sina respektive ägare: utvärderaren får inte åtkomst till Gemini-modellens vikter och Google får inte åtkomst till testprompterna.

Pilotprojektet omfattar en Gemini Flash Lite-modell som testats mot konfidentiella benchmarktester i samarbete med Singapore AI Safety Institute, OpenMined, AVERI och MLCommons. Google framhåller att uppläggets värde ökar med utvärderingens känslighet och nämner uttryckligen cybersäkerhetstester och tester som genomförs av myndigheter. Tillkännagivandet åtföljs av en teknisk rapport som beskriver metodiken i detalj.

🔗 Pilotprojektet med dubbelblinda utvärderingar


Expert Intelligence: e-böcker från Google Play Books blir källor i Gemini Notebook

27 augusti — Gemini Notebook-teamet presenterar Expert Intelligence, ett initiativ som sträcker sig över flera delar av Google och gör det möjligt att använda köpta böcker som källor i en notebook. Lanseringen inleds med kvalificerade e-böcker från Google Play Books; Google meddelar att tredjepartsabonnemang och läroböcker tillkommer senare och att funktionen utökas till Gemini-appen och AI Mode i Google Search.

Principen är enkel att beskriva men har ett nytt tillämpningsområde: en notebook kan nu blanda köpta e-böcker, professionella abonnemang och personliga Google Drive-filer i samma kunskapsbas. De vanliga funktionerna i Gemini Notebook kan sedan användas på boken — samtal med innehållet, generering av Audio Overviews samt skapande av repetitionskort och frågesporter — där varje svar är förankrat i källorna med inbäddade hänvisningar till det exakta avsnittet.

Det mest intressanta är affärsmodellen, eftersom den besvarar frågan som den här typen av produkt omedelbart väcker: vad händer med författarens ersättning när en modell bearbetar boken? Google ställer ett uttryckligt åtkomstkrav: för att interagera med en bok i Gemini Notebook måste man äga den via Google Play Books. Om en notebook som innehåller en bok delas uppmanas medarbetarna dessutom att köpa ett eget exemplar för att kunna gå vidare. Google presenterar därmed upplägget för förlagen som en upptäcktskanal snarare än som en ersättning.

För förlagen bygger mekanismen på anmälan: ett verks behörighet kan kontrolleras på dess sida i Google Play Books, där Gemini Notebook visas under märket ”Tools” om boken är registrerad; registreringen sker på begäran hos Google-teamet. De tre beskrivna användningsfallen anger tonen — att kombinera sina kursanteckningar med Steven Pinkers The Sense of Style, tillämpa Daniel Coyles The Culture Code på ett teamprojekt och sammanställa en rutin utifrån The New Menopause innan den omvandlas till en Audio Overview.

🔗 Expert Intelligence


Warp lägger till loopar för självförbättring i sina factories

27 augusti — Warp kompletterar sin Warp Factories-plattform med loopar för självförbättring (self-improvement loops). Principen består av tre steg: betygsätta agenternas tidigare konversationer enligt kriterier som definierats av teamet, isolera misslyckandena och därefter generera förbättringar av skills. En teknisk artikel som publicerades samma dag beskriver hela upplägget i detalj.

Den centrala komponenten är en betygsfunktion som Warp kallar scorer. Den tar en agents exekveringsspår som indata och returnerar ett betyg enligt en bedömningsmatris. Warp betonar en sak: indata bör inte begränsas till agentens spår, utan måste även omfatta mänskliga interaktioner som hämtats från integrerade verktyg, exempelvis kommentarer på en pull request. Betyget kan komma från en människa, från kod eller, vilket är vanligare i dag, från en annan agent som fungerar som domare. Warp tillhandahåller förvalda scorers som bedömer korrekthet, kostnadseffektivitet och ordrikedom, och låter användaren konfigurera hur ofta de ska köras — med några timmars mellanrum som standard — samt samplingsstrategin, eftersom dessa utvärderingar kostar pengar.

De betygsatta körningarna matas därefter till självförbättrande agenter, som söker efter återkommande mönster i misslyckandena och föreslår korrigeringar i form av diffs i definitionen av factoryn. Denna mekanism fungerar endast eftersom factoryn beskrivs i kod: en factory.yaml-fil samt en trädstruktur med definitioner av agenter, skills, MCP-servrar och regler för modellroutning. Människor får förslagen som pull requests och beslutar om de ska slås samman eller inte.

Warp skiljer tydligt ut en annan mekanism, benchmarktester, som hanterar en begränsning hos looparna för självförbättring: de liknar vad en kompetent person skulle ändra efter att ha granskat tidigare resultat, men utgör inget verkligt A/B-test. För att avgöra en fråga som vilken kombination av modeller som är bäst föreslår Warp att man väljer fem till tio referensuppgifter, kör agenterna parallellt med flera konfigurationer och sedan betygsätter dem med samma scorers. Resultatet är en matris över resultaten per konfiguration. De nämnda styrmåtten — genomströmning av pull requests, genomsnittlig kostnad per pull request, automatiseringsgrad och uppskattade besparingar — presenteras som ett föreslaget mätramverk, utan stöd av några resultatmått från kunder.

🔗 Tillkännagivande från @warpdotdev


Replit inför automatisk modellroutning för alla

27 augusti — Replit gör Intelligent Model Routing tillgängligt för alla användare på plattformen. Utgångspunkten är enkel: vilken modell som är bäst för en uppgift förändras från vecka till vecka, från projekt till projekt och ibland från uppgift till uppgift, och detta val tillför en beslutspunkt mellan idén och dess förverkligande. Replit tar därför över valet — allt eftersom en uppgift utvecklas kopplas den till den modell som är bäst lämpad att slutföra den, med en avvägning mellan kvalitet, hastighet och kostnad.

Den framhävda siffran måste läsas noggrant. I sina tester uppger Replit samma kvalitet på resultatet till en kostnad som är 65 % lägre än för den föregående versionen av Max Mode — det handlar inte om en absolut minskning med 65 %, medan inlägget på X i sin tur talar om ”upp till 65 % billigare”.

Routningen utesluter inte manuell kontroll. Alla användare börjar nu i Free Mode och får ett meddelande när arbetet växlar till kraftfullare lägen som kan medföra kostnader; Core- och Pro-prenumeranter behåller möjligheten att välja modell manuellt. I företagsmiljöer definierar administratörer uppsättningen godkända modeller för varje workspace, och Replit väljer automatiskt inom denna uppsättning.

Del av lanseringenVärde angivet av Replit
Kostnadsminskning-65 % vid samma kvalitet jämfört med föregående version av Max Mode
TillgänglighetAlla användare
StartlägeFree Mode, med avisering före uppgradering till ett betalläge
Manuellt valBehålls för Core- och Pro-planerna
FöretagskontrollUppsättning godkända modeller definieras per workspace

🔗 Tillkännagivande från @Replit


Codex CLI 0.150: @-omnämnanden mellan uppgifter, Interrupt-hooks och skärpt säkerhet för ej betrodda projekt

26 augusti — Codex CLI uppgraderas till 0.150.0, följt av korrigeringen 0.150.1 den 27 augusti. Uppdateringen installeras med npm install -g @openai/codex@0.150.1.

Den mest genomgripande nyheten gäller orkestrering mellan uppgifter. Det blir möjligt att referera till andra Codex-uppgifter med @-omnämnanden och att be en agent läsa, skapa eller skicka ett meddelande till en uppgift direkt från terminalen. Konkret blir uppgiftslistan en uppsättning adresserbara objekt: en agent kan se vad en annan uppgift har producerat eller skicka en instruktion till den utan att manuellt kopiera och klistra in kontext. På samma tema får namnlösa terminaluppgifter automatiskt en beskrivande titel, och /rename föreslår en redigerbar titel som härletts från konversationen.

Det andra anmärkningsvärda tillägget är Interrupt-hooken. Tidigare var avbrott av en aktiv tur en blind fläck: sessionen stoppades utan möjlighet att utlösa något. Version 0.150.0 gör det möjligt att köra ett kommando eller en MCP-handler när en tur på högre nivå avbryts, exempelvis för att rensa ett tillstånd, frigöra ett lås eller logga avbrottet.

På säkerhetssidan förtjänar två korrigeringar uppmärksamhet för den som kör Codex på tredjepartskod. Ej betrodda projekt tillhandahåller inte längre AGENTS.md-instruktioner på projektnivå — en instruktionsfil som placerats i ett klonat repository kan därmed inte längre styra agenten utan användarens vetskap — och hanterade regler som nekar läsåtkomst fortsätter att gälla efter en behörighetsändring. Dessutom förbättras maskeringen av identifierare i app-server-diagnostiken, samtidigt som problem med bearer tokens för fjärranslutna MCP-servrar och låsningar vid avstängning under Unix på grund av frikopplade processer åtgärdas. Korrigeringen 0.150.1 löser slutligen ett specifikt men kostsamt fall: fjärrkomprimeringen räknar nu in bevarade bilder i sin tokenbudget och gallrar de äldsta vid behov — i en lång session med skärmbilder var detta en osynlig källa till överskridanden av kontextgränsen.

Publicerad versionDatum i ändringsloggenTyp av publicering
0.150.026 augusti 2026Stabil version, nya funktioner
0.150.127 augusti 2026Korrigering av komprimeringen

🔗 Versionsinformation för 0.150.0


Claude Code 2.1.247: granskning av API-kostnader och 1M-fönster som standard för Sonnet 5

27 augusti — Claude Code uppgraderas till 2.1.247. Det mest synliga tillägget för team är ett kommando för utgiftsgranskning: /claude-api cost-optimize kartlägger vad ett projekt förbrukar via Claude API och går sedan igenom möjligheterna till kostnadsminskning en efter en — caching, tokenhygien, batchbearbetning, ansträngningsnivå och modellval — samtidigt som effekten av varje ändring mäts innan nästa genomförs. Skillen /claude-api omfattar nu dessutom Admin API: organisationsmedlemmar, inbjudningar, workspaces, API-nycklar, rapporter om hastighetsbegränsningar, workload identity federation och CMEK.

En kontextinställning förtjänar uppmärksamhet: Sonnet 5:s standardfönster för automatisk komprimering utökas till modellens fullständiga kontext på 1M tokens, och sessionerna komprimeras nu runt 967K tokens i stället för cirka 934K. När det gäller robusthet kraschar underagenter inte längre vid ett 404-fel för en modell under det första anropet — de växlar till sessionens reservmodellkedja — och en hook som producerar megabyte av fel kan inte längre låsa sessionen vid ”Prompt is too long”.

Slutligen innebär versionen en tydlig satsning på förstärkt säkerhet. I Markdown som renderas i terminalen visas länkar som pekar mot en nätverks- eller automonteringssökväg, innehåller ett kontrolltecken eller börjar med ett osynligt tecken som vanlig text i stället för klickbara länkar. Plugin-marknadsplatsen avvisar namn som innehåller kontrolltecken och escapes den text som en marknadsplats infogar i sina utdata.

🔗 Ändringslogg för Claude Code


Together AI kvantifierar kaskaden DeepSeek följt av GPT-5.6 Sol på DeepSWE

27 augusti — Together AI utökar sin serie DeepSWE-jämförelser till DeepSeek-modellerna, med samma protokoll som för GLM-5.3-avsnitten: benchmarkens 113 uppgifter, fyra försök per uppgift och modell, alltså 904 körningar i duellen mellan DeepSeek V4 Pro 0813 och GPT-5.6 Sol.

Det råa resultatet ger den slutna modellen övertaget vid första försöket — 72,7 % mot 62,8 % — men skillnaden minskar för varje försök och vänds vid det fjärde, till 88,5 % för DeepSeek mot 85,8 %. Med 0,24 dollar per körning mot 8,37 är den öppna modellen 35 gånger billigare, vilket motsvarar 261 lösta uppgifter per 100 spenderade dollar jämfört med 9. Den uppväger dock inte besparingen med högre hastighet: medianen är 35 minuter och 146 steg mot 17 minuter och 53 steg.

Den operativa slutsatsen är en kaskadlösning. Att köra DeepSeek V4 Pro först och eskalera till GPT-5.6 Sol endast när testsviten underkänner resultatet ger 83,0 % lösta uppgifter till 3,35 dollar styck — tio procentenheter över enbart Sol och till och med över en perfekt oracle-router med ett enda försök, som når 80,8 %. Två andra jämförelser i samma serie finns publicerade: DeepSeek V4 Pro mot Claude Fable 5 och DeepSeek-V4 Flash mot GPT-5.6 Luna.

Utvärderad strategiFramgångsgradKostnad per uppgift
Endast GPT-5.6 Sol72,7 %8,37 dollar
Perfekt oracle-router med ett försök80,8 %
Kaskad med DeepSeek V4 Pro följt av Sol83,0 %3,35 dollar

🔗 Together AI:s DeepSWE-jämförelse


OpenAI inleder verksamhet i Brasilien och publicerar ett randomiserat experiment med Bocconi

27 augusti — OpenAI inleder sin kommersiella verksamhet i Brasilien med ett lokalt team baserat i São Paulo. Tillkännagivandet åtföljs av användningsdata som sällan publiceras med denna detaljnivå per land: Brasilien är en av ChatGPT:s tre största marknader räknat i aktiva användare per vecka, med ett användarantal som nästan har fördubblats på ett år och omkring 215 miljoner meddelanden som skickas varje dag. I juni 2026 var 35 % av de klassificerade meddelandena från brasilianska privatkonton arbetsrelaterade, jämfört med 30 % globalt. På utvecklarsidan ligger landet på andra plats i världen sett till antalet utvecklare som använder OpenAI API, och antalet Codex-användare per vecka där har mer än elvafaldigats sedan början av 2026. Etableringen åtföljs av partnerskap med ITA, IMPA, HCFMUSP, ENTER, Estímulo och staden São Paulo genom Prodam.

Samma dag publicerar OpenAI tillsammans med forskare från Bocconi-universitetet resultaten från ett randomiserat experiment med över 1 000 förstaårsstudenter på kandidatnivå. Protokollets styrka ligger i dess struktur: studenterna delades slumpmässigt, per lektionstillfälle, in i fyra grupper — tillgång till ChatGPT, utbildning i kausalt resonemang, båda eller ingetdera — vilket gör det möjligt att skilja verktygets effekt från utbildningens effekt och effekten av deras kombination. Uppgiften var ett verkligt företagsfall: att formulera marknadsföringsrekommendationer för universitetets butik med profilprodukter.

De två insatserna ger olika effekter. Tillgång till ChatGPT höjer resultatet med nästan en poäng av fem, med fler idéer och tydligare logik. Utbildningen i kausalt resonemang förbättrar däremot inte betyget — men den automatiserade textanalysen visar ett bredare och mer särpräglat urval av idéer än hos de andra studenterna, något som bedömningsmatrisen inte mätte. OpenAI drar en obekväm slutsats för utbildningsinstitutionerna: om AI gör det möjligt att producera ett välpolerat arbete som liknar en experts, säger en granskning av enbart slutresultatet allt mindre om vad studenten faktiskt förstår.

ExperimentgruppUppmätt effekt
Tillgång till ChatGPTNästan en poäng mer av fem, fler idéer, tydligare logik
Utbildning i kausalt resonemangIngen förbättring enligt matrisen, men mer varierade och särpräglade idéer
Båda insatserna tillsammansSamlade fördelar, förbättringar i flest antal mätvärden

🔗 Närvaro i Brasilien · Bocconi-studien


ChatGPT:s schemalagda uppgifter utlöses av händelser i Gmail, Slack och GitHub

25 augusti — ChatGPT:s schemalagda uppgifter lämnar den rent tidsbaserade modellen: de kan nu utlösas av en händelse i Gmail, Slack eller GitHub. Filtreringen är detaljerad — Gmail-meddelanden efter avsändare eller ämne, utvalda Slack-kanaler samt pull request-aktivitet som omfattar granskningar, kommentarer, commit-uppdateringar och sammanslagningar.

Övergången från cron till händelser förändrar verktygets karaktär: i stället för att regelbundet kontrollera om något har hänt reagerar agenten när det inträffar. Funktionen är tillgänglig i ChatGPT på webben och mobilen för berättigade abonnemang, förutsatt att den berörda appen ansluts och de begärda åtkomsterna godkänns. Två praktiska förutsättningar gäller: ChatGPT:s Slack-app måste vara medlem i varje övervakad kanal, och den anslutna GitHub-appen måste ha åtkomst till varje repository. Det finns också två begränsningar: en händelseutlöst uppgift kan inte samtidigt ha en tidsbaserad schemaläggning, och händelser som inträffar nära varandra kan grupperas i en enda körning — i vyn Scheduled går det då att granska väntande händelser eller utlösa körningen manuellt.

🔗 Ändringslogg för ChatGPT och Codex


Cursors molnagenter startar utan ett befintligt repository

27 augusti — Cursor tar bort det sista inträdeskravet för sina molnagenter: det är inte längre nödvändigt att ha anslutit ett GitHub-konto eller någon annan tredjepartsleverantör för källkodshantering för att starta en session. I repositoryväljaren går det med alternativet ”Start from scratch” att skriva en prompt direkt, medan Cursor skapar ett Origin-repository i bakgrunden för arbetet.

När bygget är tillfredsställande sparar knappen ”Create repo” resultatet i ett Origin-repository, med ett anpassat eller föreslaget namn och privat eller intern synlighet. Det färdiga repositoryt är fullständigt strukturerat och visas på fliken Codebase. Två tillägg sluter arbetsflödet: Cursor vidarebefordrar nu portar från molnagentens live-miljö till webbläsaren, vilket ger tillgång till en förhandsvisning och verktyg som designläget, och en publiceringsknapp skapar en webbadress när ett Vercel-konto har anslutits — kontot är ett krav för den sistnämnda funktionen. Helheten bygger på Origin, Cursors kodvärdtjänst som gick in i tidig beta den 17 augusti för alla betalabonnemang.

🔗 Cursors ändringslogg


Amp öppnar sina projekt för flera repositories

27 augusti — Amp-projekt stöder nu flera repositories. Ytterligare repositories klonas till en intilliggande katalog inne i orben och agenten informeras uttryckligen om att de finns. Ändringspanelen visar då en diff som omfattar samtliga repositories i projektet. Detta är Amps svar på uppgifter som sträcker sig över flera tjänster, ett scenario som den tidigare uppdelningen med ett projekt per repository gjorde besvärligt.

Tillägget görs när projektet skapas eller senare i inställningarna, med en gräns på 20 ytterligare repositories per projekt. En begränsning är viktig att känna till innan man börjar: när orben förbereds körs endast skriptet .agents/setup från huvudrepositoryt automatiskt, och ett ytterligare repository som kräver en egen initiering måste införlivas i detta skript. Samma dag fortsätter Amp sin renodling genom att ta bort sidofältet från terminalgränssnittet — se notiserna.

🔗 Projekt med flera repositories hos Amp


Google Antigravity 2.11.0 renderar HTML-artefakter i konversationstråden

26 augusti — Google lanserar version 2.11.0 av Antigravity med 10 förbättringar och 30 korrigeringar. Den främsta nyheten är det generativa gränssnittet: agenten kan skapa en HTML-artefakt som visas direkt i konversationstråden utan att gå via en extern förhandsvisning. Renderingen stöder matematisk KaTeX-formatering samt diagram från Chart.js och Plotly, vilket utökar användningen till dashboards och visualiseringar som skapas i realtid.

Den andra serien förändringar gäller agentkonfiguration och går i riktning mot ökad modularisering. Syntaxen @path/to/file gör det möjligt att referera till och inkludera externa filer i AGENTS.md och i filer med anpassade regler. En nyckel med namnet rules: läggs till i frontmatter för Markdown-agenter för att koppla regler till en viss agent i stället för till hela projektet. Antigravity hittar nu även skills, agenter och regler som deklareras i filerna skills.json, agents.json och rules.json i underkataloger — användbart för monorepos där varje delprojekt har sin egen konfiguration. Resten gäller användarvänlighet: terminaler som kan delas sida vid sida, rendering av YAML-frontmatter som ett metadatakort, temat Darcula samt läsning av specifika sidintervall i dokument med flera sidor.

🔗 Antigravitys ändringslogg


GitHub: global modellpolicy blir allmänt tillgänglig och rundabordssamtal med OpenClaws underhållare

26 augusti — GitHub gör den globala modellpolicyn allmänt tillgänglig för Copilot Business och Copilot Enterprise. Mekanismen, som tillkännagavs i juli, ger administratörer en enda omkopplare som avgör vad som händer med modeller som de inte uttryckligen har konfigurerat, i stället för att tvinga dem att fatta beslut modell för modell vid varje ny lansering. Utrullningen av den faktiska tillämpningen pågår till den 1 september, vilket innebär att övergången inte sker samtidigt för alla företag. Beslut som redan har fattats manuellt behålls oförändrade, och två kategorier påverkas inte av policyn oavsett inställning: modeller med öppna vikter, där DeepSeek och Kimi K2 anges som exempel, samt modeller som inte omfattas av GitHubs avtal om datalagring, där tillkännagivandet nämner Fable 5. GitHub överväger dessutom att ta bort statusen ”Delegate to default policy” för att tvinga fram ett uttryckligt beslut om varje modell.

Den 27 augusti publicerar GitHub ett videofilmat rundabordssamtal med OpenClaws underhållare, tillsammans med en artikel som sammanfattar tio lärdomar. Projektet lanserades av Peter Steinberger i november 2025 som ett helgprojekt, och den 26 augusti hade repositoryt omkring 388 000 stjärnor, 81 000 forks och över 80 000 commits — GitHub beskriver det som det snabbast växande projektet i företagets historia. Intervjun är särskilt intressant för vad den avslöjar om underhållsarbete när agenter blir en del av processen: Steinberger säger att han inte längre talar om pull requests utan om ”prompt requests”, och Josh Lehman beskriver bidragsgivare som kör automatiserade kedjor vilka öppnade flera hundra pull requests. Förtroendesignalerna har förändrats i motsvarande grad — agenttranskriptioner, skärmbilder och testbevis i stället för antalet bidrag — särskilt eftersom själva anseendet har blivit en angreppsyta, där personer duplicerar andras pull requests för att blåsa upp antalet sammanslagningar.

Mätvärde för OpenClaw-repositoryt den 26 augusti 2026Uppmätt värde
StjärnorCirka 388 000
Forks81 000
CommitsÖver 80 000
ProjektlanseringNovember 2025

🔗 Global modellpolicy · Rundabordssamtal om OpenClaw


Kortnyheter

  • Qwen3.8-Flash kan dirigeras via OpenRouter och köras lokalt med 75 GB RAM — Modellen blir tillgänglig via OpenRouter en dag efter att dess vikter öppnades, för kodassistenter, agentbaserade arbetsflöden och förståelse av långa videor. Samtidigt publicerar Unsloth sina GGUF redan första dagen: MoE-modellen med 125 miljarder parametrar körs lokalt med 75 GB RAM, och Unsloth hävdar att den överträffar Claude Opus 4.6 Max — ett påstående från Unsloth som inte bekräftas av någon oberoende mätning. 🔗 OpenRouter · Unsloth GGUF
  • Grok 4.6 ansluter till Microsoft Foundry och aktiveras från Linear — Modellen läggs till i Microsoft Foundrys katalog med 500 000 tokens i kontext och fyra nivåer av reasoning effort, som komplement till Amazon Bedrock och Google Enterprise Agent Platform. På grok.com låter Linear-triggers Grok sortera ärenden, följa framsteg och starta automatiskt så snart ett ärende tilldelas modellen. 🔗 Grok på Foundry · Linear-triggers
  • Joelle Pineau och Mikey tar plats på TIME100 AI 2026 — Cohere meddelar att företagets AI-chef finns med på tidskriften TIME:s lista och lyfter fram mer än tjugo års forskning i Kanada, från intelligenta rullstolar till ML Reproducibility Checklist. Samma dag meddelar Suno att Mikey har utsetts till samma lista, utan något tillhörande produktmeddelande. 🔗 Cohere · Suno
  • En cookbook kopplar en Claude Managed Agent till Vercels Chat SDK — Chat SDK tillhandahåller konversationsgränssnittet med en typad onDirectMessage-hanterare och fler än femton adaptrar (Slack, Teams, Discord, webben), medan Managed Agents kör agenten på serversidan med en beständig session per konversation. Koden har publicerats i repot claude-quickstarts. 🔗 Inlägg från @ClaudeDevs
  • ChatGPT för iOS 1.2026.230: uppgiftssökning, mätare för reasoning effort och helskärmsredigerare — En kompakt mätare i composer för att justera reasoning effort från mobilen, en helskärmsredigerare för långa prompts, sökning i både titlar och innehåll samt genvägar på hemskärmen för ChatGPT, Work och Codex Remote. Samma changelog-post som de händelsebaserade uppgifterna ovan.
  • Amp tar bort sidofältet från sin TUI — Med orbs, runners och meddelanden som utväxlas mellan agenter anser Amp att trådspårning hör hemma i webb- och native-apparna, och att lägga multiplexering av flera miljöer ovanpå terminalens egen multiplexering gav en dålig upplevelse. 🔗 Amps blogginlägg
  • Hugging Face kör sina abstract-sammanfattningar med Inkling-Small — Plattformen klargör att sammanfattningarna som visas på dess papersidor bygger på Thinking Machines modell med öppna vikter, under parollen ”open weights × open science”. 🔗 Inlägg från @huggingface
  • Gemini CLI åtgärdar en SSRF-sårbarhet vid upptäckt av OAuth-metadata för MCP — Nightly-versionen från den 27 augusti innehåller bara en ändring, en korrigering mot Server-Side Request Forgery vid upptäckt av OAuth-metadata från MCP-servrar. Den finns ännu inte i den stabila kanalen, som ligger kvar på v0.57.0. 🔗 Versionsinformation
  • Perplexity publicerar nya utvärderingar av Brain — Perplexity Computers självförbättrande minnessystem förbättras med 9,3 poäng i korrekthet, 8,0 poäng i aktualitet och 8,9 poäng i återkallning jämfört med de första resultaten, med 15 % färre tokens. 🔗 Inlägg från @perplexity_ai
  • Plugin-marknadsplatser får stöd för automatiska uppdateringar i företag — Ett autoUpdate-fält på en extraKnownMarketplaces-post låter Copilot-klienter uppdatera pluginer från en marknadsplats automatiskt, förutsatt att marknadsplatsen fortfarande finns med i strictKnownMarketplaces-allowlisten. 🔗 GitHub-changelog
  • Blockering av en användare stänger nu alla användarens öppna bidrag — Alternativet ”Stäng innehåll som skapats av den här användaren” i blockeringsdialogrutan stänger samtidigt alla öppna issues, diskussioner och pull requests från den blockerade användaren, både på personliga konton och i organisationer. 🔗 GitHub-changelog
  • Cohere förespråkar en modell med utplacerade ingenjörer som bygger upp kundens kapacitet — Blogginlägget skiljer mellan kommersiellt eller arkitektoniskt beroende, som är inneboende i teknikvalet, och operativt beroende, som det anser går att undvika. Det hänvisar även till Deloittes rapport från 2026, enligt vilken endast 25 % av organisationerna har produktionssatt 40 % eller mer av sina AI-piloter. 🔗 Coheres blogginlägg
  • Google DeepMind ägnar ett podcastavsnitt åt osäkerhet — Zoubin Ghahramani, VP Research, förklarar tillsammans med Hannah Fry varför system som lär sig att tvivla på sig själva och resonera i sannolikheter fattar mer tillförlitliga beslut, från väderprognoser till robotik. 🔗 Inlägg från @GoogleDeepMind
  • Wan lanserar en veckovis Skill Challenge kring WanCLI — Varje vecka väljs tre skills som publicerats på wan.video ut, och deras skapare vinner en månads premiumabonnemang. Varje godkänd skill ger dessutom 150 krediter; skillen måste anropa minst en Wanxiang-modell via WanCLI. 🔗 Inlägg från @Alibaba_Wan
  • GeForce NOW på Gamescom 2026 — Nya DLSS 4.5-kontroller, stöd för nya Steam-enheter, GOG-inloggning med enkel inloggning, Firefox och fler Fire TV-enheter samt fem spel som blir tillgängliga i molnet vid lanseringen. Mer en tv-spelsnyhet än en nyhet om generativ AI. 🔗 NVIDIAs blogginlägg
  • Runway publicerar en teaser-video utan namngiven produkt — En video som endast åtföljs av meningen ”Du har aldrig sett något liknande” och en allmän länk till appen, utan namn på någon modell eller funktion och utan motsvarande information på studions nyhetssida. Noterat för kännedom: inga verifierbara fakta kan härledas från den. 🔗 Inlägg från @runwayml

Vad det innebär

Agenterna flyttar in i laboratoriet, och barriären är fysisk innan den är programvarumässig. Model Hardware Standard löser inte ett modellproblem utan ett infrastrukturproblem: sju leverantörsprogram utan ett gemensamt gränssnitt på Janelia och fyra utrustningsfamiljer på tre inkompatibla datorer vid Carnegie Mellon. Genom att korta integrationen från flera veckor till några timmar flyttar Anthropic flaskhalsen från anslutning till övervakning — och medger det genom att hänvisa till Genentech, där Claude behövde få förklarat att skumbildning i ett prov var ett fysiskt fel och inte en bugg. Ai2:s upptäckt om invasivt lobulärt karcinom säger samma sak från den andra änden av kedjan: värdet ligger inte i svaret som modellen producerar, utan i den oberoende valideringen och den efterföljande laboratorievalideringen. De 10 000 Claude-platser som samma dag öppnades för forskare fullbordar trippeln genom att angripa den tredje barriären, kostnaden för åtkomst.

Säkerheten flyttas från produkten till den gemensamma infrastrukturen. Debattartikeln om kollektivt cyberförsvar är främst betydelsefull på grund av organisationerna bakom den: OpenAI, Anthropic, AWS, Google, Microsoft och Oracle konkurrerar om samma marknad men enas om samma text. Ett av kraven på frontier-laboratorierna — att göra agentidentiteter spårbara och ansvariga — är dessutom en direkt lärdom från Hugging Face-incidenten som publicerades dagen före. Resten av dagen visar samma förflyttning på verktygsnivå: Codex slutar läsa in AGENTS.md från ej betrodda projekt, Claude Code oskadliggör terminallänkar med osynliga tecken och Gemini CLI åtgärdar en SSRF vid OAuth-upptäckt för MCP-servrar. Tre till synes orelaterade korrigeringar, men samma slutsats: attackytan för en kodagent utgörs av filerna och servrarna som den ombeds läsa.

Själva utvärderingen blir något som måste säkras. Google DeepMinds pilotprojekt med Singapore AI Safety Institute löser en avvägning lika gammal som extern utvärdering — att lämna ut sina testprompts eller sina vikter — genom att inte lämna ut någotdera, via en enklav vars egenskaper båda parter verifierar kryptografiskt. Det är den metodologiska motsvarigheten till siffrorna som publiceras under resten av dagen: Together AI nöjer sig inte med ett resultat, utan publicerar 904 körningar, fyra försök per uppgift, felprofilerna och kostnaden per uppgift; Cohere medger öppet att två dimensioner av ParseBench har uteslutits och låter konkurrenterna bedömas på nytt enligt de korrigerade reglerna från augusti. I båda fallen är det inte längre resultatet utan protokollet som lyfts fram — ett tecken på att resultatet i sig inte längre övertygar någon.

Och självkostnaden för en framgångsrikt utförd uppgift förblir det avgörande måttet. GLM-5.3 Flash bygger hela sin positionering på en arkitektonisk besparing — tre gånger mindre attention-beräkning och 4,4 gånger mindre KV-cache — som omsätts i 0,15 dollar per miljon input-tokens, nästan tio gånger mindre än GLM-5.2 hos samma leverantör. Together AI visar att kaskaden DeepSeek följt av Sol löser tio procentenheter fler uppgifter till mindre än halva priset jämfört med enbart Sol, vilket i praktiken innebär att den bästa modellen inte är det rätta köpet. Replit drar produktkonsekvensen av detta genom att helt enkelt ta bort modellvalet, Cohere säljer Model Vault med en skillnad på 61 % vid fullt utnyttjande och Google tar en tredjedel av priset för ett videoutkast i 360p. Till och med leveransen av Vera-CPU:n hos AWS är en del av denna ekonomi: om en agentbaserad arbetslast förbrukar femton gånger fler tokens än en chattförfrågan upphör orkestreringen utanför GPU:n att vara en redovisningsmässig detalj.


Källor