Sök

OpenAI ska vattenmärka text från ChatGPT och Codex i Europeiska unionen, Devin minns mellan sessioner, GitHub lanserar ReviewBench

ai-powered-markdown-translator

Artikel översatt från franska till svenska med gpt-6.1-sol.

Visa projekt på GitHub ↗

OpenAI kommer under de kommande veckorna att lägga till en osynlig vattenmärkning i text från ChatGPT och Codex för sina användare i Europeiska unionen, som svar på AI Act som kräver att genererad text görs maskinellt identifierbar, och gör redan i dag denna vattenmärkning tillgänglig som ett valbart alternativ för sina API-kunder världen över. Bland agenterna får minnet fäste: Cognition ger Devin ett minne mellan sessioner och publicerar formatet som en öppen standard, och Cohere lanserar North 2 med ett minne som behåller kontexten från en session till nästa; GitHub publicerar samtidigt ReviewBench, ett öppet benchmark för kodgranskning med AI. Bland de öppna modellerna presenterar Reflection AI Beam, med 501 miljarder parametrar, vars vikter utlovas senare i oktober.


OpenAI:s osynliga vattenmärkning: text från ChatGPT och Codex märks i Europeiska unionen, ett globalt alternativ i API:et

5 oktober — OpenAI publicerar sitt svar på de europeiska reglerna om textens ursprung. AI Act kräver att leverantörer av generativ AI gör texten de producerar identifierbar på ett maskinläsbart sätt; OpenAI svarar stegvis och påpekar redan från början att dagens tekniker för vattenmärkning av text har betydande begränsningar (betydande begränsningar).

Berörd målgruppVad som förändrasMeddelad tidsplan
Användare av ChatGPT och Codex i Europeiska unionen, alla abonnemangOsynlig vattenmärkning läggs till i text som uppfyller kriteriernaUnder de kommande veckorna
API-kunder världen överValbar vattenmärkning (opt-in) på utvalda, ej namngivna modeller, avstängd som standardFrån och med den 5 oktober
Godkända forskare och expertorganisationerTillgång till detektorn efter ansökan och individuell prövningAnsökan öppnar den 5 oktober

OpenAI gör inte detta till en global standardinställning och samarbetar med molnpartner för att under de kommande veckorna erbjuda samma vattenmärkning på de OpenAI-modeller som de tillhandahåller. Tekniken, textGrain, lägger till en osynlig statistisk signal i modellens ordval, utan synlig märkning eller specialtecken; enligt OpenAI matchar eller överträffar den de andra testade metoderna, däribland SynthID för text. En teknisk rapport publiceras och OpenAI planerar att göra koden öppen. Detektorn är däremot inte offentlig vid lanseringen, på grund av risken för missade vattenmärken och falska positiva resultat: tillgången följer EU-kommissionens uppförandekod (Code of Practice).

De publicerade siffrorna visar framför allt detektionens begränsningar:

MätförhållandenPublicerad detektionsgrad
Textavsnitt på 200 tokens, psykologiskt innehåll, mål på 1 % falska positiva resultatcirka 80 %
Textavsnitt på 400 tokens, psykologiskt innehåll, mål på 1 % falska positiva resultatcirka 95 %
Matematiskt innehåll, samma tröskel på 1 %betydligt lägre (värdet anges endast i ett diagram)
Textavsnitt på 400 tokens på engelska (ELI5-dataset), obearbetadecirka 92 %
Samma textavsnitt, 10 % av orden ersatta med synonymer66 %
Samma textavsnitt, 25 % av orden ersatta17 %

Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.

🇸🇪 Vattenmärken har begränsningar. De går ofta inte att upptäcka, särskilt i korta textavsnitt. Att skriva om eller översätta en text kan ta bort vattenmärket helt. — @OpenAI på X

När det gäller kvalitet uppmäter OpenAI ingen signifikant skillnad på åtta benchmarks med GPT-6 Astra utan respektive med vattenmärkning (94,44 % mot 93,94 % på GPQA Diamond, 53,90 % mot 56,06 % på Terminal-Bench 4.0). Inlägget preciserar också vad ett vattenmärke inte säger: varken hur stor del av arbetet en människa gjort, vem som äger eller ansvarar för texten, användarens identitet eller textens korrekthet; och dess frånvaro bevisar inte att en människa har skrivit texten. För bilder och ljud förändras ingenting: openai.com/verify och Content Provenance API förblir tillgängliga för organisationer, och SynthID kompletterar sedan den 19 maj C2PA-metadata för genererade bilder.

🔗 OpenAI:s inlägg om textens ursprung i EU


5 oktober — Cognition inför två sammanhängande funktioner i Devin: Memory, ett minne som består från en session till nästa, och Dreaming, en daglig «dröm» som omorganiserar det. Memory behåller det agenten lär sig när den arbetar med varje användare: preferenser, korrigeringar och lärdomar från ett projekt eller arbetsflöde. Det är inga sessionssammanfattningar utan korta anteckningar, var och en kopplad till sessionen där lärdomen drogs, och detta minne förblir personligt: det blir ingen instruktion som delas av hela organisationen.

Anteckningarna finns i Memory Drive, ett beständigt Git-repository med Markdown-filer ordnade efter repository, projekt eller tema. En avsiktligt kort fil, MEMORY.md, samlar de allmänna preferenserna och ett index över resten: Devin får den i början av varje session och hämtar sedan användbara anteckningar med samma verktyg som används för att navigera i kod, utan att ladda in hela arkivet i sin prompt. Varje session arbetar med sin egen Git-kopia: Devin slår samman uppdateringar från andra sessioner, en revisionskontroll avvisar inaktuella skrivningar och konflikter rapporteras i stället för att skrivas över i tysthet.

Dreaming är en daglig bakgrundssession (på natten, preciserar Cognitions tråd): Devin läser om tidigare samtal i ljuset av sitt minne, slår samman överlappande anteckningar, tar bort tillfälliga detaljer, söker efter lärdomar som inte hade noterats och raderar minnen som ingen session har använt. Funktionen nås på devin.ai, via menyn Customize → Memory; inlägget säger ingenting om Devin Desktop eller Devin CLI och meddelar inga priser.

Cognition publicerar också formatet som en öppen standard, Agent Memory Repo, under MIT-licens. Specifikationen, som är öppen för bidrag, beskriver varje sessions cykel (klona minnet, söka, uppdatera utan en människa i loopen, pusha efter varje ändring) och hur flera minnen kan kombineras i samma session, vart och ett i sitt eget repository med egna behörigheter och egen historik. Bland de nämnda användningsområdena finns teamminne och agentsvärmar (agent swarms):

In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)

🇸🇪 Under tidiga experiment såg vi en svärm av Devin-agenter använda minnet för att samordna sig i stor skala utan att vi bad dem om det (vi lovar, de har inte hackat någon). — @cognition på X

En «dröm» som omorganiserar en agents minne fanns redan hos Anthropic (Claude Managed Agents, i maj) och hos OpenAI (ChatGPT:s minne, i juni); det nya här är ett minne i filer som versionshanteras med Git, publicerat som en specifikation som andra agenter kan använda.

🔗 Memory och Dreaming, inlägg från Cognition 🔗 Specifikationen för Agent Memory Repo

Cursor: styra agenterna i dess SDK under körning

5 oktober — Cursor utökar sitt SDK, som används för att starta dess agenter från TypeScript- eller Python-kod. Metoden run.steer() skickar in ett meddelande i en agents pågående tur; om en underagent arbetar just då övergår den till bakgrunden och fortsätter. Underagenter i bakgrunden rapporterar också tillbaka: deras resultat återkommer till den överordnade agenten som en extra tur i samma körning, i stället för att gå förlorat när den överordnade agentens tur avslutas.

Nyhet i SDK:tOmfattning enligt changelog
run.steer(), styrning under körningLokala agenter i TypeScript; hos en molnagent skickas meddelandet som en vanlig uppföljning
Återföring av resultat från underagenter i bakgrundenLokala agenter, i TypeScript och Python
MCP-annoteringar för anpassade verktyg (readOnlyHint, destructiveHint…)TypeScript; endast anvisningar som SDK:t inte tvingar fram efterlevnad av
Systemprompt som kan bytas ut, regler och skills laddas fortfarandeLokala agenter i TypeScript; tillgång aktiveras konto för konto

Inga priser anges i samband med dessa ändringar.

🔗 Cursors tråd på X 🔗 Changelog för Cursors SDK

Qwen Code v0.25.0: agenter för arbetsytor, e-postkanal och Mem0-minne

5 oktober — Qwen publicerar v0.25.0 av Qwen Code, sin kommandoradsagent för programmering, den första stabila versionen sedan v0.24.7 den 29 september: 42 funktioner, varav 23 för Managed Agent, 79 buggfixar och inga kända ändringar som bryter kompatibiliteten. Tre tillägg, som alla måste aktiveras uttryckligen, utmärker sig. Agenter för arbetsytor samarbetar nu lokalt: demonen startar och återupptar deras turer, och Web Shell gör det möjligt att hantera agenter och uppgifter och anropa en agent med @agent från en diskussion. Dessa beständiga agenter får stöd för protokollet A2A 1.0 genom delningar som löper ut och kan återkallas. Slutligen kan Mem0-minnet kopplas direkt till CLI:et: det räcker att ange en endpoint och en nyckel, så registrerar Qwen Code själv motsvarande MCP-server. En e-postkanal ger också agenten en egen brevlåda, via IMAP och SMTP, och Code Mode kör parallellt de Bash-anrop som modellen grupperar. TypeScript-SDK:t v0.1.18 och Desktop-appen v0.25.0 följde samma morgon, utan någon tweet från Qwen.

🔗 Versionsinformation för Qwen Code v0.25.0

5 oktober — Together AI lanserar Together Link i beta, som kör redan installerade kodagenter på de öppna modeller som driftas på plattformen. Ett installationskommando (macOS eller Linux) kopplar Claude Code, Claude Desktop, Codex, OpenCode och Pi till dess API med kontots nyckel; dokumentationen lägger till ChatGPT Desktop och förvarnar om att kommandon, routning och modellistan fortfarande kan ändras. Förutom läget Auto erbjuds fyra modeller, alla med en kontext på 1M tokens:

Erbjuden modellMotsvarighet i menyn /model i Claude Code
Kimi K3Opus
GLM 5.3Fable
GLM 5.3 FlashSonnet
DeepSeek V4.1 FlashHaiku

Auto-läget, som väljs som standard, kan tilldela svåra uppgifter till Opus 5.5 när användaren anger en Anthropic-nyckel, men inlägget och dokumentationen beskriver denna routning på olika sätt: enligt inlägget görs ett enda val per session för att bevara promptcachen, medan dokumentationen beskriver ett val för varje förfrågan som är begränsat till Claude Code och Claude Desktop. Together AI uppger en kostnadsminskning på mer än 50 %, utan någon publicerad metod, och visar efter varje session dess kostnad intill den kostnad sessionen skulle ha haft med Opus 5.5.

🔗 Inlägg från Together AI 🔗 Dokumentation för Together Link

Den självhostade versionen av IBM Bob bygger på Nemotron 3 Ultra från NVIDIA

5 oktober — IBM förklarar varför den självhostade (self-hosted) versionen av Bob, dess agentiska utvecklingsassistent, bygger på Nemotron 3 Ultra från NVIDIA tillsammans med Poolside Laguna S 2.1. Detta alternativ, som blev allmänt tillgängligt föregående vecka, kör assistenten på kundens infrastruktur, även i frånkopplade miljöer (air-gapped). Teamet bedömde modellerna utifrån fyra kriterier (hårdvaruåtgång, precision i kod, latens och vikternas öppenhet) genom att testa dem med Bobs agentramverk, med slutna modeller från Anthropic, OpenAI och Google som referens. Nemotron var till en början för ordrik och justerades tillsammans med NVIDIA: prompts, samplingsparametrar, inställningar för resonemang och korrigeringar i agentramverket. Enligt IBM:s interna tester erbjuder Nemotron 3 Ultra upp till ungefär 4 gånger lägre latens på Blackwell-GPU:er än ledande SaaS-modeller som anropas över nätverket och följer verktygsscheman strikt; Laguna S 2.1 har valts för sitt förhållande mellan prestanda och resursbehov. Inlägget publicerar inga precisionsresultat.

🔗 IBM:s inlägg om självhostade Bob


ReviewBench: GitHub lanserar ett öppet benchmark för kodgranskning med IA

5 oktober — GitHub lanserar ReviewBench i en förhandsversion för forskning (research preview), ett öppet benchmark för agenter som granskar kod med IA. Den särskilda webbplatsen publicerar hela datamängden, rankingen, metodiken, prompten och domarens konfiguration samt ett verktyg för egna körningar. Inlägget är skrivet av Michelle Zhou och Alejandro Carderera de Diego, och i tackavsnittet nämns GitHub och Microsoft som deltagare i projektet.

Datamängden omfattar 219 pull requests från 187 offentliga open source-repon, i 19 språk. Fördelningen av språk och repostorlekar speglar GitHubs fördelningar, fastställda utifrån 103,9 miljoner pull requests, med en avsiktlig viktning mot medelstora och stora ändringar. Facit (golden set) kombinerar mänskliga granskare, problem som härleds från uppföljande commits, deterministiska analysverktyg och flera ledande LLM; fynden valideras av en LLM-domare, enligt inlägget Claude Sonnet 5. Seniora ingenjörer som inte deltog i skapandet av datamängden har märkt upp varje fynd på nytt: deras bedömning stämmer överens med ReviewBench i 96,6 % av fallen. Förankrad recall (grounded), som mäts enbart mot facit, används som huvudsakligt jämförelsemått.

Enligt GitHubs första ranking ligger Copilot code review högst:

Utvärderad agent (konfiguration)Förankrat F1Förankrad precisionFörankrad recallKördatum
Copilot Code Review (Balanced)40,1 %87,8 %26,0 %1 oktober 2026
Devin AI37,0 %84,0 %23,8 %28 september 2026
Qodo35,1 %85,3 %22,1 %28 september 2026
Codex (GPT-5.6 Sol · Ultra)32,3 %87,0 %19,9 %19 juli 2026
Cubic27,3 %85,5 %16,3 %29 juni 2026
Greptile27,2 %86,1 %16,2 %16 juni 2026
Cursor17,3 %87,7 %9,6 %27 september 2026

Webbplatsen förtydligar att dessa första resultat togs fram av ReviewBench-teamet genom att köra varje leverantörs offentligt tillgängliga produkt vid angivet datum, och att leverantörerna varken har genomfört eller verifierat körningarna. Vem som helst kan nu lämna in sin agent: deltagaren tillhandahåller en containeravbildning och en modellnyckel, GitHub tillhandahåller domaren, och tester på 25 pull requests följs av en fullständig körning i tre omgångar; ett resultat publiceras först efter godkännande av en maintainer, och bara om det förbättrar agentens tidigare resultat eller är agentens första bidrag.

GitHub använder det också för att vidareutveckla Copilot code review. I ett A/B-test gav en granskning med flera modeller på Lite-nivån, som kombinerar flera oberoende körningar, 13,6 % högre recall med 8,0 % lägre kostnad per granskning, i den riktning som förutsågs offline. Inlägget motsäger sig självt när det gäller antalet kommentarer: +61 % enligt texten, +25,0 % enligt diagrammet.

🔗 GitHubs inlägg om ReviewBench 🔗 ReviewBenchs webbplats och ranking


Cohere lanserar North 2 och ingår en global allians med PwC

5 oktober — Cohere lanserar North 2, den nya versionen av North, företagets plattform för IA-agenter i företag, som utannonserades som ”snart tillgänglig” den 9 september och sedan utlovades till oktober. Lanseringstråden uppger över 15 nya funktioner (15+ nya funktioner), ett antal som inte upprepas i inlägget. Kärnan i versionen är ett nytt ramverk för agenter (agent harness), omarbetat för automatiseringar och agenter med flera steg, på en plattform som förblir modellagnostisk: modeller från Cohere eller kundens modeller.

FunktionsområdeNyheter som Cohere nämner
AgenterÅteranvändbara agenter och automatiseringar, skapade med prompt och delade inom organisationen; orkestrering av flera agenter; minne som bevarar kontexten mellan sessioner
ProduktivitetFärdigheter (Skills), bibliotek (Libraries) och appar som skapar presentationer, dashboards och dokument; Automations, lanserat i slutet av juli, med färdiga mallar och en visuell editor
AnslutningsmodulerSlack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion och GitHub; leverantörer av finansiella data (PitchBook, FactSet och andra) är endast planerade
Driftsättning och säkerhetEgen drift, VPC, hybrid, lokalt eller helt frånkopplat; SOC 2 Type 2, ISO 27001 och ISO 42001; autonomipolicyer med mänskligt godkännande av kritiska beslut
StyrningNorth Admin-konsol, förbrukningsnivåer för förfrågningar och tokens per användare eller grupp, varningar innan taken nås

Cohere nämner två kunder, LG CNS i Sydkorea och Bell Cyber i Kanada, och framhåller högre genomströmning för sina modeller på NVIDIA Blackwell- och Hopper-GPU:er, utan siffror, med ett citat från Kari Briski, ansvarig för generativ IA hos NVIDIA. Inga priser eller något införandeschema anges: inlägget hänvisar till en demonstration som bokas hos säljteamen.

🔗 Lanseringsinlägg för North 2 🔗 Lanseringstråd för North 2 på X

Den globala alliansen med PwC, som börjar i Kanada

5 oktober — Samma dag tillkännager PwC och Cohere en global allians (global alliance) som börjar i Kanada, i ett pressmeddelande från PwC Canada daterat i Toronto som återges i ett kort inlägg från Cohere. Rollfördelningen är tydlig: Cohere tillhandahåller North, sina företagsmodeller och sina verktyg för informationssökning; PwC bidrar med sin kompetens inom branscher, regelverk, riskhantering och omställning, från valet av användningsfall till integrationen av IA med företagets data och system. De utannonserade användningsområdena omfattar sökning inom företaget, tillgång till kunskap, fördjupad informationssökning, beslutsstöd och automatisering av uppgifter, i privata moln, lokalt eller i frånkopplade miljöer, med reglerade sektorer som främsta målgrupp. Pressmeddelandet citerar Domenic Marino och Annie Veillet från PwC Canada samt Aidan Gomez från Cohere; det anger varken belopp, kunder eller någon tidsplan utöver Kanada. Cohere hade redan ingått en allians med OpenText den 16 september.

🔗 Coheres inlägg om alliansen med PwC 🔗 Pressmeddelande från PwC Canada


Öppna modeller: Beam, MetaEncoder-30B och Gemma 4 inom växtgenomik

Tre öppna modeller är aktuella i dag, i tre olika skeden: den ena är utlovad, den andra har lagts ut utan tillkännagivande och den sista lyfts fram en månad efter publiceringen.

Beam: Reflection AI:s öppna modell med 501 miljarder parametrar

5 oktober — Reflection AI presenterar Beam, sin första modell med öppna vikter: en gles MoE med 501 miljarder parametrar, varav 23 miljarder är aktiva, utformad för kod, resonemang och agentiska uppgifter och tränad från grunden genom hela processen. Förträningen omfattade 23 800 miljarder tokens; fasen med förstärkningsinlärning använde 10 500 NVIDIA GB300-GPU:er under fyra veckor och genererade över 100 miljoner trajektorier (rollouts).

Enligt Reflection AI:s tabeller:

Utvärderat benchmarkBeamNemotron 3 UltraGLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
SWE-bench Verified80,970,7————
SWE Bench Pro v165,546,4——67,7—
Terminal Bench v2.180,156,488,288,386,690,6
DeepSWE v1.144,4—61,068,051,074,2

Ett streck anger ett resultat som inte redovisas i inlägget. Reflection AI uppger resonemangsresultat som är jämförbara med GLM-5.2 med 3 till 4 gånger mindre beräkningsarbete vid inferens, och medger att Kimi K3 fortfarande ligger före i rå kapacitet. Inget går ännu att ladda ned: Beam genomgår slutliga utvärderingar och adversariella tester (red-teaming), tidig åtkomst kräver registrering, och vikterna, den tekniska rapporten, modellkortet och verktyg för utvecklare utlovas till senare i oktober.

🔗 Reflection AI:s inlägg om Beam

MetaEncoder-30B, beslutsenkodern som Meta lägger ut utan tillkännagivande

5 oktober — Meta har lagt ut MetaEncoder-30B på Hugging Face under sin organisation facebook, utan något tillkännagivande som vi har kunnat hitta: repot, som skapades den 30 september och ändrades den 5 oktober, hade bara två nedladdningar när vi kontrollerade det. Modellkortet presenterar en multimodal ”System One”-enkoder, formatet för Jevs beslutsmodeller: den får en uppgift i naturligt språk (fråga, instruktion, tillståndsbeskrivning, kriterier) och en lista med kandidater, i text med bilder och videor som stöd, och poängsätter varje kandidat. Eftersom uppgiften och kandidaterna kodas separat reduceras jämförelsen till en skalärprodukt, och ett index för närmaste grannar kan täcka miljontals kandidater utan att köra modellen igen. MetaEncoder är en kontrastiv finjustering av Muse Glimmer 30B, den agentiska modell med öppna vikter som Meta släppte i augusti, och ärver dess Apache 2.0-licens; nedladdningen kräver att villkor godkänns, och vLLM stöder servering av modellen för text och bild.

UtvärderingssvitResultat enligt modellkortetAnvänt mått
JEVBench (original / lätt / svår)0,9444 / 1,0000 / 0,7387Träffsäkerhet
ImaJEV-Bench0,8958Träffsäkerhet
NanoBEIR0,6632NDCG_linear@10
MMEB-V3 (bild / video / visuella dokument)0,7897 / 0,6046 / 0,8138Hit@1 / Hit@1 / NDCG@5

🔗 Modellkort för MetaEncoder-30B på Hugging Face

Living Models kombinerar Gemma 4 och BOTANIC-1 för att avkoda växternas ADN

5 oktober — Google lyfter fram arbetet från Living Models, ett laboratorium för IA-biologi baserat i Paris, i en X Article från @GoogleAI och på sin Gemmaverse-sida. Gemma 4 E4B orkestrerar analysen (bearbetningskedjor i terminalen, datafiltrering, verktygsanrop), lokalt via Ollama på en enda NVIDIA L4-GPU, medan BOTANIC-1, en genomisk grundmodell som förtränats på 320 växtarter, bedömer mutationernas effekt; de proprietära genomen stannar lokalt. Fallstudien bygger på en upptäckt gjord vid INRAE av Adnane Boualem: en enda ändrad bokstav i melonens CmEIN3-gen gör att blomman går från honlig till hermafroditisk. Bland de 2 494 punktmutationer som är kandidater hamnar den validerade mutationen ensam på första plats, på mindre än fyra minuter enligt X Article.

Testad konfiguration (20 körningar)Recall@1
Utan vägledning0,00
Expertvägledning0,15
Med BOTANIC-1:s poäng0,90

Botanic1-modellerna (från 0,3 till 2 miljarder parametrar) och preprinten på bioRxiv är från början av september: nyheten är att Google lyfter fram dem samt de detaljerade resultaten.

🔗 X Article från Google AI 🔗 Google DeepMinds Gemmaverse-sida


Reklam i ChatGPT: ett visuellt format testas och mätningen utökas

5 oktober — OpenAI förbereder ett visuellt annonsformat för ChatGPT: bilder ska visa inspiration kring en produkt, dess användning eller den upplevelse den möjliggör. Det första testet sker under bildgenerering, med annonser som är tydligt märkta och åtskilda från bilden som håller på att skapas; det inleds senare den här månaden i USA, med en första grupp annonsörer. OpenAI påminner om att reklamen inte påverkar svaren från ChatGPT, som enligt företaget når 1,2 miljarder personer varje vecka.

Merparten av tillkännagivandena gäller mätning: överföring av konverteringar via Hightouch, Tealium och LiveRamp, tio namngivna attributionspartners (bland annat AppsFlyer, Adjust och Triple Whale), geografiska inkrementalitetsexperiment med Haus, Measured och WorkMagic, ett konverteringsfönster på en dag efter annonsvisning i rapporterna och ett mått på signalkvalitet (Event Quality Score). När det gäller varumärkessäkerhet kan kvalificerade annonsörer utesluta uttryck (Negative Phrases), och pilotprojekt för utvärdering förbereds med DoubleVerify och Integral Ad Science. Pixeln och Conversions API finns sedan den 5 maj.

Resultat publicerat av OpenAIPublicerat värdeMätning utförd av
Kostnad per förvärv för WeightWatchers jämfört med dess benchmark för betald sökning−15,3 %DV Rockerbox
Inkrementella köp av varumärket Dose gjorda av nya kunder67 %WorkMagic
Besökare hos Portland Leather som kom från ChatGPT Ads och var nya för varumärket93 %Triple Whale

🔗 OpenAI:s inlägg om det nya annonsformatet 🔗 Inlägg på Ads-bloggen om mätning


Perplexitys changelog den 5 oktober: webbläsartillägg för Computer, Wiley och Stripe Projects

5 oktober — Perplexity publicerar en changelog med 18 avsnitt, utan att den hade delats på X vid vår genomgång. Åtta tar upp tillkännagivanden som redan har behandlats (Automations, Claude Opus 5.5, videogenerering, American Express Skills, Portable Computer på AMD, Fast Search, Profiles i Agent API, Claude Fable 5.1), ett nionde lägger till interaktiva 3D-förklaringar till diagrammen från den 1 oktober, och nio nyheter presenteras för första gången:

Nyhet som presenteras för första gångenPlattform eller versionBerörda användare
Tillägg för Chrome, Edge eller Brave som låter Computer använda webbläsaren (Comet är fortfarande standard)Perplexity för Mac 26.38.0 och senareInte angivet
Computer-uppgifter i separata flikar och fönsterPerplexity för Mac 26.37.1 och senareInte angivet
Ansträngningsnivå (Light, Standard, High, Ultra) på mobileniOS 26.38.0 och Android 2.100.0, och senarePro, Max, Enterprise Pro, Enterprise Max
Tidskrifter och böcker från Wiley utan separat Wiley-abonnemangPerplexity och ComputerAlla abonnemang, varierande premiumkvoter
GPT-6.1 Sol, som även driver Computers ansträngningsnivå Light i stället för GPT-6 SolPerplexity och ComputerKvalificerade betalande abonnenter
Guidad konversation för att starta en första Computer-uppgiftWebbenNya gratiskonton
Anslutning av en app från inmatningsfältet (Anslut en app)Computer på webbenInte angivet
DocSend-anslutning för datarum för investeringar (deal rooms)ComputerKvalificerat DocSend-konto
Stripe Projects: API-nyckel för Perplexity skapad via Stripes CLIStripes CLIUtvecklare som använder Perplexitys API

Med Stripe Projects skapar eller ansluter ett kommando projektet, genererar nyckeln och skriver den till filen .env, en konfiguration som Perplexity föreslår att man överlåter åt Claude Code, Cursor eller Codex.

🔗 Perplexitys changelog den 5 oktober


Generativt skapande: Suno Albums och HyperFrames Studio från HeyGen

Suno lägger till album

5 oktober — Suno lägger till album, som hittills saknats på plattformen. Enligt blogginlägget som följer med tillkännagivandet förvandlar funktionen användarnas bästa låtar till kompletta projekt (fullängdsprojekt), och en spellista (playlist) som fungerade som ett album kan nu omvandlas till ett Album. Suno presenterar artisterna bakom de fem första albumen: naenia (Oakwood///diskrot), Old Soul (Isaiah Wallace), phenomenal (KakerMix///diskrot), Lost In a Dream (Dream Relic) och VOID (ECHLO). Företaget anger varken vilka abonnemang som omfattas, antalet låtar per album eller det exakta lanseringsdatumet. Redan i juni frågade Suno sin community om lyssningsupplevelsen med spellistor, album och radiokanaler.

🔗 Sunos tillkännagivande på X 🔗 5 album du inte får missa, Sunos blogg

HyperFrames Studio, HeyGens videoredigerare utformad för agenter

5 oktober — HyperFrames, HeyGens open source-ramverk som omvandlar HTML-kod till video, blir en skrivbordsapp. HyperFrames Studio presenteras som en videoredigerare byggd från grunden för agenter: man beskriver den önskade videon, agenten (Claude Code, Codex eller en egen agent) levererar en första klippning, och sedan arbetar människan och agenten på samma tidslinje (timeline). Man styr med handgrepp i stället för med en prompt: ringar in ett element i bilden, fäster en kommentar vid ett ord eller klipper själv. Appen exporterar i 4K och uppges erbjuda hundratals inspirationskällor och mallar; enligt HyperFrames konto på X är den gratis, och endast en macOS-version finns att ladda ned. Den bygger vidare på Studio Preview från juli, där det redan gick att visuellt redigera en video som genererats med kod.

🔗 Tillkännagivande av HyperFrames Studio 🔗 Delat av HeyGen


Notiser

  • Warp Factories på väg mot allmän tillgänglighet — I ett blogginlägg den 3 oktober om sitt höstseminarium uppger Warp att Warp Factories, företagets agentinfrastruktur, håller på att gå från tidig åtkomst till allmän tillgänglighet, utan att ange datum eller pris; teamet säger sig ha minskat kostnaden per PR med 70 % den senaste månaden genom att använda den. 🔗 källa
  • Devins versionsinformation den 2 oktober — Åtkomstinställningarna för Microsoft Teams tillämpas nu, ett klick markerar alla säkerhetsfynd med samma allvarlighetsgrad (även i API v3), och de plugins som erbjuds visar sina skills, MCP, hooks och regler före installation; miljöbyggen för stora Perforce-repon får 3 timmar på sig i stället för att misslyckas efter 10 minuter. 🔗 källa
  • MCP TikTok Ads i Replit — Replit lägger till TikTok Ads i sin katalog med över 450 integrationer: när kontot har anslutits kan dess Agent skapa och hantera TikTok-annonser, nå målgrupper och mäta resultat från arbetsytan, utan att anslutningen förbrukar krediter. 🔗 källa
  • Cockle Finance på Replit — Replit fäster en video om Cockle Finance, vars verktyg byggdes på Replit av Dan och hans pappa Steve för att följa kundinflödet; enligt Replit ökade Dan sin verksamhet med 15 % på tre månader, utan att det anges vad som mättes. 🔗 källa
  • Copilot CLI 1.0.92 som stabil version — Den här versionen samlar nyheterna från förhandsversionerna 1.0.92-0 till -5; den enda nya funktionen är att användaren efter en Microsoft Entra-inloggning väljer vilket konto som ska användas, /logout stänger dessa OAuth-sessioner och MCP-servrar som skyddas av Entra förnyar sina autentiseringsuppgifter utan ingripande. 🔗 källa
  • Codex CLI 0.160.1 — Den här korrigeringen av 0.160.0 innehåller bara en backport: Windows-variablerna SYSTEMROOT, TEMP och TMP bevaras när fjärranslutna MCP stdio-servrar startas med en uttryckligen konfigurerad fjärrmiljö; det är den senaste stabila versionen, eftersom ingen stabil 0.161.0 har släppts. 🔗 källa
  • Nightly-versionen av Gemini CLI den 5 oktober — Den innehåller inga ändringar: den bygger på samma commit som versionen från den 3 oktober och skiljer sig bara i versionsnummer, medan den stabila kanalen (v0.62.0) och förhandskanalen (v0.63.0-preview.0) är oförändrade. 🔗 källa
  • SpaceXAIs TypeScript SDK 0.2.1 — Den här versionen, som publicerades den 2 oktober, lägger till toJson(schema), som validerar strukturerad utdata med en Standard Schema-validerare (Zod, Valibot eller ArkType), och alternativet retryBeforeOutput, som gör ett nytt försök med en strömmande begäran (streaming) som misslyckats innan någon utdata har skickats; vid en 429 utan Retry-After-header är väntetiden nu från en sekund upp till 30 sekunder, i stället för 250 millisekunder. 🔗 källa
  • Cresta Conductor på Claude Agent SDK — I Anthropics serie om startups som bygger med Claude presenterar Cresta Conductor, ett verktyg för att bygga kundserviceagenter med naturligt språk, byggt på Claude Agent SDK; enligt Cresta har det ungefär halverat tiden för den första driftsättningen i de tidiga användningsfallen, utan att datum för tillgänglighet eller pris anges. 🔗 källa
  • npm: konfigurationer för betrodd publicering löper ut — Sedan den 2 oktober löper en konfiguration för betrodd publicering (trusted publishing) som inte har använts för någon publicering ut 48 timmar efter att den skapats, och npm avvisar även tokens från GitHub Actions-händelser av typen issue_comment, liksom för pull_request_target. 🔗 källa
  • npm: väntande publicering skapar paket — Sedan den 2 oktober kan npm stage publish skapa ett paket som ännu inte finns, med en lokal session eller en token med detaljerade behörigheter, även en som är begränsad till att lägga publiceringen i vänteläge (stage-only); den första versionen blir möjlig att installera först när en underhållare godkänner publiceringen. 🔗 källa
  • Perplexitys Agent API på Fast Search — Förinställningarna low, medium och high i Agent API använder nu Fast Search för verktyget web_search, vilket sänker priset från 2,50 till 1 dollar per 1 000 anrop och gör det omkring 800 ms snabbare; förinställningen xhigh behåller standardsökningen. 🔗 källa
  • Perplexitys RAG-guide — Perplexity publicerar en guide med nio exempel på generering förstärkt med informationshämtning (retrieval-augmented generation, RAG) och sju arkitekturer, där företaget tar upp sitt eget webbindex och sin funktion Instant Buy vid sidan av externa exempel som Zendesk och GitHub Copilot; inga produktnyheter. 🔗 källa
  • Coheres personalstyrka — Enligt Cohere har företaget gått från omkring 400 anställda i början av 2026 till över 800 i dag, en siffra som anges i ett rekryteringsinlägg. 🔗 källa
  • IsoVGRBench och Logbook hos Meta — Utan tillkännagivande publicerar facebookresearch koden för IsoVGRBench, som utvärderar belöningsmodeller för video på 16 000 par som bara skiljer sig åt i ett avseende (när de ställs inför samma klipp med bildrutorna i omkastad ordning svarar modellerna nästan slumpmässigt), samt koden för Logbook, som handlar om händelser i mycket långa ljudinspelningar. 🔗 källa
  • FiftyOne läser LeRobot v3-dataset — Enligt ett communityinlägg av Harpreet Sahota läser open source-verktygslådan FiftyOne nu LeRobot v3-formatet direkt, utan konverterare eller kopiering av videorna; demonstrationen omfattar 497 episoder från de 50 robottyperna i LeRobots communitydataset. 🔗 källa
  • FetchMan-data från Ai2 — Detta dataset, som publicerades den 1 oktober utan tillkännagivande, samlar 352 696 simulerade episoder (52 miljoner bildrutor, 902 instruktioner) där en humanoid Unitree G1 griper föremål, genererade i MolmoSpaces, i LeRobot v3-format och under ODC-BY-licens. 🔗 källa
  • P(doom) på Hugging Face-profiler — Användare på Hub kan visa sin P(doom) på profilen, alltså sin uppskattning av sannolikheten för att AI orsakar en existentiell katastrof; svaren ingår i en undersökning där endast aggregerade och anonymiserade resultat kommer att publiceras, om två veckor. 🔗 källa
  • Tillägget hf-image — Hugging Face släpper, utan tillkännagivande, ett tillägg till sitt CLI som bygger, pushar, pullar och kör containeravbilder på registret cr.hf.co; okomprimerade lager dedupliceras av Xet, så ett lager på 2 Go där 100 Mo har ändrats skickar bara omkring 100 Mo enligt README. 🔗 källa
  • Tre experiment av Milos Kotlar — I tre communityinlägg gör Milos Kotlar en liten transformers KV-cache 2,71 gånger mer kompakt med 97,85 % överensstämmelse om nästa token, och sänker andelen tokens utan expert i en MoE-routing från 13,84 % till 8,09 %, utan någon hastighetsvinst. 🔗 källa
  • Stephen Yus granskning av en LLM-domare — Stephen Yu har med 38 400 exempel granskat GLM-5.3-domaren som bedömer faktatrohet i GRPO-belöningen för hans omskrivningsmodell på 12B: den är tillförlitlig när det gäller att upptäcka att ett faktum har ändrats, men brusig i bedömningen av hur allvarlig ändringen är; att räkna felaktiga utdata visar en minskning på 39 % som den första beräkningen dolde. 🔗 källa
  • Sakana AI-symposium i Tokyo — Sakana AI öppnar anmälan till ett kostnadsfritt symposium den 26 oktober i Hitotsubashi Hall i Tokyo, på engelska, med en föreläsning av Jürgen Schmidhuber och ett samtal med David Ha, vd för Sakana AI. 🔗 källa
  • NVIDIA Inception-startups och bröstcancer — NVIDIA presenterar fyra startups i sitt Inception-program som använder AI i vårdkedjan, däribland iSono Health och dess FDA-godkända 3D-ultraljudssystem ATUSA (omkring två minuter per bröst jämfört med upp till 45 minuter manuellt), Whiterabbit.ai, Ataraxis AI och SimBioSys; vissa av dessa tekniker är inte godkända av FDA. 🔗 källa

Vad det innebär

Att kunna spåra textens ursprung blir ett regulatoriskt krav. Hittills har spårbarheten för genererat innehåll främst gällt bild och ljud, med vattenmärken och verifierbara metadata; AI Act utvidgar kravet till text, och OpenAI svarar stegvis: vattenmärkning som tillämpas automatiskt på text från ChatGPT och Codex i EU, ett valbart alternativ i API:et och en detektor som bara är tillgänglig för godkända organisationer. De publicerade siffrorna förklarar försiktigheten: omkring 95 % av avsnitten på 400 tokens upptäcks i innehåll inom psykologi, med ett mål på 1 % falska positiva, men i engelska avsnitt på 400 tokens sjunker detektionen från omkring 92 % till 66 % när 10 % av orden ersätts med synonymer, och en omskrivning eller översättning kan ta bort vattenmärket. Vattenmärket ger en indikation på ursprunget, ingen bevisning, och dess frånvaro säger ingenting om upphovspersonen.

Agenternas minne etableras och börjar standardiseras. Devin sparar sina lärdomar i ett Git-repo med Markdown-filer som Dreaming omorganiserar varje dag, och Cognition publicerar formatet under MIT-licens så att andra agenter kan använda det; North 2 bevarar kontexten mellan sessioner; Qwen Code kopplar Mem0 direkt till sitt CLI. Tillvägagångssätten skiljer sig åt, mellan versionshanterade filer som människor kan läsa, en extern minnestjänst och en funktion inbyggd i en plattform, men de svarar mot samma behov: att en agent inte ska börja om från noll vid varje session. Cognitions val har en praktisk fördel: varje anteckning hänvisar till sessionen där lärdomen uppstod, kan läsas i gränssnittet och behåller sin Git-historik, vilket gör det möjligt att läsa och korrigera det som agenten har kommit ihåg.

Öppna modeller kommer in i kodverktygen via flera vägar. Together Link kopplar dem till befintliga agenter, inklusive Claude Code och Codex, och uppger att kostnaden minskar med mer än hälften; IBM kör den självhostade versionen av Bob på Nemotron 3 Ultra för företag som behåller utvecklingen på sin egen infrastruktur, även i miljöer utan nätanslutning; Reflection AI presenterar Beam som en öppen modell anpassad för kod och agentbaserade uppgifter, med 80,9 på SWE-bench Verified enligt företagets egna tabeller. Det gemensamma argumentet handlar mindre om råpoängen, där Reflection AI medger att Kimi K3 fortfarande ligger före, och mer om kostnad, latens och kontroll över data.

Många av dagens siffror kommer från dem som publicerar dem. GitHub har utformat ReviewBench och tagit fram den första rankningen där Copilot code review ligger i topp, utan att andra leverantörer har kört eller verifierat den; latensen för Nemotron 3 Ultra kommer från IBMs interna tester; besparingarna med Together Link och annonseringsresultaten för ChatGPT är de som Together AI och OpenAI uppger. GitHub publicerar dock sitt dataset, sin domare och sin metodik och öppnar för bidrag: varje leverantör kan göra om mätningen med sin egen agent. Det är det som kommer att göra det möjligt att avgöra om den första rankningen håller.


Källor