ai-powered-markdown-translatorArtikel översatt från franska till svenska med gpt-6.1-sol.
OpenAI kommer under de kommande veckorna att lägga till en osynlig vattenmärkning i text från ChatGPT och Codex för sina användare i Europeiska unionen, som svar på AI Act som kräver att genererad text görs maskinellt identifierbar, och gör redan i dag denna vattenmärkning tillgänglig som ett valbart alternativ för sina API-kunder världen över. Bland agenterna får minnet fäste: Cognition ger Devin ett minne mellan sessioner och publicerar formatet som en öppen standard, och Cohere lanserar North 2 med ett minne som behåller kontexten från en session till nästa; GitHub publicerar samtidigt ReviewBench, ett öppet benchmark för kodgranskning med AI. Bland de öppna modellerna presenterar Reflection AI Beam, med 501 miljarder parametrar, vars vikter utlovas senare i oktober.
OpenAI:s osynliga vattenmärkning: text från ChatGPT och Codex märks i Europeiska unionen, ett globalt alternativ i API:et
5 oktober — OpenAI publicerar sitt svar på de europeiska reglerna om textens ursprung. AI Act kräver att leverantörer av generativ AI gör texten de producerar identifierbar på ett maskinläsbart sätt; OpenAI svarar stegvis och påpekar redan från början att dagens tekniker för vattenmärkning av text har betydande begränsningar (betydande begränsningar).
| Berörd målgrupp | Vad som förändras | Meddelad tidsplan |
|---|---|---|
| Användare av ChatGPT och Codex i Europeiska unionen, alla abonnemang | Osynlig vattenmärkning läggs till i text som uppfyller kriterierna | Under de kommande veckorna |
| API-kunder världen över | Valbar vattenmärkning (opt-in) på utvalda, ej namngivna modeller, avstängd som standard | Från och med den 5 oktober |
| Godkända forskare och expertorganisationer | Tillgång till detektorn efter ansökan och individuell prövning | Ansökan öppnar den 5 oktober |
OpenAI gör inte detta till en global standardinställning och samarbetar med molnpartner för att under de kommande veckorna erbjuda samma vattenmärkning på de OpenAI-modeller som de tillhandahåller. Tekniken, textGrain, lägger till en osynlig statistisk signal i modellens ordval, utan synlig märkning eller specialtecken; enligt OpenAI matchar eller överträffar den de andra testade metoderna, däribland SynthID för text. En teknisk rapport publiceras och OpenAI planerar att göra koden öppen. Detektorn är däremot inte offentlig vid lanseringen, på grund av risken för missade vattenmärken och falska positiva resultat: tillgången följer EU-kommissionens uppförandekod (Code of Practice).
De publicerade siffrorna visar framför allt detektionens begränsningar:
| Mätförhållanden | Publicerad detektionsgrad |
|---|---|
| Textavsnitt på 200 tokens, psykologiskt innehåll, mål på 1 % falska positiva resultat | cirka 80 % |
| Textavsnitt på 400 tokens, psykologiskt innehåll, mål på 1 % falska positiva resultat | cirka 95 % |
| Matematiskt innehåll, samma tröskel på 1 % | betydligt lägre (värdet anges endast i ett diagram) |
| Textavsnitt på 400 tokens på engelska (ELI5-dataset), obearbetade | cirka 92 % |
| Samma textavsnitt, 10 % av orden ersatta med synonymer | 66 % |
| Samma textavsnitt, 25 % av orden ersatta | 17 % |
Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.
🇸🇪 Vattenmärken har begränsningar. De går ofta inte att upptäcka, särskilt i korta textavsnitt. Att skriva om eller översätta en text kan ta bort vattenmärket helt. — @OpenAI på X
När det gäller kvalitet uppmäter OpenAI ingen signifikant skillnad på åtta benchmarks med GPT-6 Astra utan respektive med vattenmärkning (94,44 % mot 93,94 % på GPQA Diamond, 53,90 % mot 56,06 % på Terminal-Bench 4.0). Inlägget preciserar också vad ett vattenmärke inte säger: varken hur stor del av arbetet en människa gjort, vem som äger eller ansvarar för texten, användarens identitet eller textens korrekthet; och dess frånvaro bevisar inte att en människa har skrivit texten. För bilder och ljud förändras ingenting: openai.com/verify och Content Provenance API förblir tillgängliga för organisationer, och SynthID kompletterar sedan den 19 maj C2PA-metadata för genererade bilder.
🔗 OpenAI:s inlägg om textens ursprung i EU
Kodagenter: Devin minns mellan sessioner, Cursor, Qwen Code, Together Link och IBM Bob
5 oktober — Cognition inför två sammanhängande funktioner i Devin: Memory, ett minne som består från en session till nästa, och Dreaming, en daglig «dröm» som omorganiserar det. Memory behåller det agenten lär sig när den arbetar med varje användare: preferenser, korrigeringar och lärdomar från ett projekt eller arbetsflöde. Det är inga sessionssammanfattningar utan korta anteckningar, var och en kopplad till sessionen där lärdomen drogs, och detta minne förblir personligt: det blir ingen instruktion som delas av hela organisationen.
Anteckningarna finns i Memory Drive, ett beständigt Git-repository med Markdown-filer ordnade efter repository, projekt eller tema. En avsiktligt kort fil, MEMORY.md, samlar de allmänna preferenserna och ett index över resten: Devin får den i början av varje session och hämtar sedan användbara anteckningar med samma verktyg som används för att navigera i kod, utan att ladda in hela arkivet i sin prompt. Varje session arbetar med sin egen Git-kopia: Devin slår samman uppdateringar från andra sessioner, en revisionskontroll avvisar inaktuella skrivningar och konflikter rapporteras i stället för att skrivas över i tysthet.
Dreaming är en daglig bakgrundssession (på natten, preciserar Cognitions tråd): Devin läser om tidigare samtal i ljuset av sitt minne, slår samman överlappande anteckningar, tar bort tillfälliga detaljer, söker efter lärdomar som inte hade noterats och raderar minnen som ingen session har använt. Funktionen nås på devin.ai, via menyn Customize → Memory; inlägget säger ingenting om Devin Desktop eller Devin CLI och meddelar inga priser.
Cognition publicerar också formatet som en öppen standard, Agent Memory Repo, under MIT-licens. Specifikationen, som är öppen för bidrag, beskriver varje sessions cykel (klona minnet, söka, uppdatera utan en människa i loopen, pusha efter varje ändring) och hur flera minnen kan kombineras i samma session, vart och ett i sitt eget repository med egna behörigheter och egen historik. Bland de nämnda användningsområdena finns teamminne och agentsvärmar (agent swarms):
In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)
🇸🇪 Under tidiga experiment såg vi en svärm av Devin-agenter använda minnet för att samordna sig i stor skala utan att vi bad dem om det (vi lovar, de har inte hackat någon). — @cognition på X
En «dröm» som omorganiserar en agents minne fanns redan hos Anthropic (Claude Managed Agents, i maj) och hos OpenAI (ChatGPT:s minne, i juni); det nya här är ett minne i filer som versionshanteras med Git, publicerat som en specifikation som andra agenter kan använda.
🔗 Memory och Dreaming, inlägg från Cognition 🔗 Specifikationen för Agent Memory Repo
Cursor: styra agenterna i dess SDK under körning
5 oktober — Cursor utökar sitt SDK, som används för att starta dess agenter från TypeScript- eller Python-kod. Metoden run.steer() skickar in ett meddelande i en agents pågående tur; om en underagent arbetar just då övergår den till bakgrunden och fortsätter. Underagenter i bakgrunden rapporterar också tillbaka: deras resultat återkommer till den överordnade agenten som en extra tur i samma körning, i stället för att gå förlorat när den överordnade agentens tur avslutas.
| Nyhet i SDK:t | Omfattning enligt changelog |
|---|---|
run.steer(), styrning under körning | Lokala agenter i TypeScript; hos en molnagent skickas meddelandet som en vanlig uppföljning |
| Återföring av resultat från underagenter i bakgrunden | Lokala agenter, i TypeScript och Python |
| MCP-annoteringar för anpassade verktyg (readOnlyHint, destructiveHint…) | TypeScript; endast anvisningar som SDK:t inte tvingar fram efterlevnad av |
| Systemprompt som kan bytas ut, regler och skills laddas fortfarande | Lokala agenter i TypeScript; tillgång aktiveras konto för konto |
Inga priser anges i samband med dessa ändringar.
🔗 Cursors tråd på X 🔗 Changelog för Cursors SDK
Qwen Code v0.25.0: agenter för arbetsytor, e-postkanal och Mem0-minne
5 oktober — Qwen publicerar v0.25.0 av Qwen Code, sin kommandoradsagent för programmering, den första stabila versionen sedan v0.24.7 den 29 september: 42 funktioner, varav 23 för Managed Agent, 79 buggfixar och inga kända ändringar som bryter kompatibiliteten. Tre tillägg, som alla måste aktiveras uttryckligen, utmärker sig. Agenter för arbetsytor samarbetar nu lokalt: demonen startar och återupptar deras turer, och Web Shell gör det möjligt att hantera agenter och uppgifter och anropa en agent med @agent från en diskussion. Dessa beständiga agenter får stöd för protokollet A2A 1.0 genom delningar som löper ut och kan återkallas. Slutligen kan Mem0-minnet kopplas direkt till CLI:et: det räcker att ange en endpoint och en nyckel, så registrerar Qwen Code själv motsvarande MCP-server. En e-postkanal ger också agenten en egen brevlåda, via IMAP och SMTP, och Code Mode kör parallellt de Bash-anrop som modellen grupperar. TypeScript-SDK:t v0.1.18 och Desktop-appen v0.25.0 följde samma morgon, utan någon tweet från Qwen.
🔗 Versionsinformation för Qwen Code v0.25.0
Together Link: Claude Code, Codex, OpenCode och Pi på öppna modeller
5 oktober — Together AI lanserar Together Link i beta, som kör redan installerade kodagenter på de öppna modeller som driftas på plattformen. Ett installationskommando (macOS eller Linux) kopplar Claude Code, Claude Desktop, Codex, OpenCode och Pi till dess API med kontots nyckel; dokumentationen lägger till ChatGPT Desktop och förvarnar om att kommandon, routning och modellistan fortfarande kan ändras. Förutom läget Auto erbjuds fyra modeller, alla med en kontext på 1M tokens:
| Erbjuden modell | Motsvarighet i menyn /model i Claude Code |
|---|---|
| Kimi K3 | Opus |
| GLM 5.3 | Fable |
| GLM 5.3 Flash | Sonnet |
| DeepSeek V4.1 Flash | Haiku |
Auto-läget, som väljs som standard, kan tilldela svåra uppgifter till Opus 5.5 när användaren anger en Anthropic-nyckel, men inlägget och dokumentationen beskriver denna routning på olika sätt: enligt inlägget görs ett enda val per session för att bevara promptcachen, medan dokumentationen beskriver ett val för varje förfrågan som är begränsat till Claude Code och Claude Desktop. Together AI uppger en kostnadsminskning på mer än 50 %, utan någon publicerad metod, och visar efter varje session dess kostnad intill den kostnad sessionen skulle ha haft med Opus 5.5.
🔗 Inlägg från Together AI 🔗 Dokumentation för Together Link
Den självhostade versionen av IBM Bob bygger på Nemotron 3 Ultra från NVIDIA
5 oktober — IBM förklarar varför den självhostade (self-hosted) versionen av Bob, dess agentiska utvecklingsassistent, bygger på Nemotron 3 Ultra från NVIDIA tillsammans med Poolside Laguna S 2.1. Detta alternativ, som blev allmänt tillgängligt föregående vecka, kör assistenten på kundens infrastruktur, även i frånkopplade miljöer (air-gapped). Teamet bedömde modellerna utifrån fyra kriterier (hårdvaruåtgång, precision i kod, latens och vikternas öppenhet) genom att testa dem med Bobs agentramverk, med slutna modeller från Anthropic, OpenAI och Google som referens. Nemotron var till en början för ordrik och justerades tillsammans med NVIDIA: prompts, samplingsparametrar, inställningar för resonemang och korrigeringar i agentramverket. Enligt IBM:s interna tester erbjuder Nemotron 3 Ultra upp till ungefär 4 gånger lägre latens på Blackwell-GPU:er än ledande SaaS-modeller som anropas över nätverket och följer verktygsscheman strikt; Laguna S 2.1 har valts för sitt förhållande mellan prestanda och resursbehov. Inlägget publicerar inga precisionsresultat.
🔗 IBM:s inlägg om självhostade Bob
ReviewBench: GitHub lanserar ett öppet benchmark för kodgranskning med IA
5 oktober — GitHub lanserar ReviewBench i en förhandsversion för forskning (research preview), ett öppet benchmark för agenter som granskar kod med IA. Den särskilda webbplatsen publicerar hela datamängden, rankingen, metodiken, prompten och domarens konfiguration samt ett verktyg för egna körningar. Inlägget är skrivet av Michelle Zhou och Alejandro Carderera de Diego, och i tackavsnittet nämns GitHub och Microsoft som deltagare i projektet.
Datamängden omfattar 219 pull requests från 187 offentliga open source-repon, i 19 språk. Fördelningen av språk och repostorlekar speglar GitHubs fördelningar, fastställda utifrån 103,9 miljoner pull requests, med en avsiktlig viktning mot medelstora och stora ändringar. Facit (golden set) kombinerar mänskliga granskare, problem som härleds från uppföljande commits, deterministiska analysverktyg och flera ledande LLM; fynden valideras av en LLM-domare, enligt inlägget Claude Sonnet 5. Seniora ingenjörer som inte deltog i skapandet av datamängden har märkt upp varje fynd på nytt: deras bedömning stämmer överens med ReviewBench i 96,6 % av fallen. Förankrad recall (grounded), som mäts enbart mot facit, används som huvudsakligt jämförelsemått.
Enligt GitHubs första ranking ligger Copilot code review högst:
| Utvärderad agent (konfiguration) | Förankrat F1 | Förankrad precision | Förankrad recall | Kördatum |
|---|---|---|---|---|
| Copilot Code Review (Balanced) | 40,1 % | 87,8 % | 26,0 % | 1 oktober 2026 |
| Devin AI | 37,0 % | 84,0 % | 23,8 % | 28 september 2026 |
| Qodo | 35,1 % | 85,3 % | 22,1 % | 28 september 2026 |
| Codex (GPT-5.6 Sol · Ultra) | 32,3 % | 87,0 % | 19,9 % | 19 juli 2026 |
| Cubic | 27,3 % | 85,5 % | 16,3 % | 29 juni 2026 |
| Greptile | 27,2 % | 86,1 % | 16,2 % | 16 juni 2026 |
| Cursor | 17,3 % | 87,7 % | 9,6 % | 27 september 2026 |
Webbplatsen förtydligar att dessa första resultat togs fram av ReviewBench-teamet genom att köra varje leverantörs offentligt tillgängliga produkt vid angivet datum, och att leverantörerna varken har genomfört eller verifierat körningarna. Vem som helst kan nu lämna in sin agent: deltagaren tillhandahåller en containeravbildning och en modellnyckel, GitHub tillhandahåller domaren, och tester på 25 pull requests följs av en fullständig körning i tre omgångar; ett resultat publiceras först efter godkännande av en maintainer, och bara om det förbättrar agentens tidigare resultat eller är agentens första bidrag.
GitHub använder det också för att vidareutveckla Copilot code review. I ett A/B-test gav en granskning med flera modeller på Lite-nivån, som kombinerar flera oberoende körningar, 13,6 % högre recall med 8,0 % lägre kostnad per granskning, i den riktning som förutsågs offline. Inlägget motsäger sig självt när det gäller antalet kommentarer: +61 % enligt texten, +25,0 % enligt diagrammet.
🔗 GitHubs inlägg om ReviewBench 🔗 ReviewBenchs webbplats och ranking
Cohere lanserar North 2 och ingår en global allians med PwC
5 oktober — Cohere lanserar North 2, den nya versionen av North, företagets plattform för IA-agenter i företag, som utannonserades som ”snart tillgänglig” den 9 september och sedan utlovades till oktober. Lanseringstråden uppger över 15 nya funktioner (15+ nya funktioner), ett antal som inte upprepas i inlägget. Kärnan i versionen är ett nytt ramverk för agenter (agent harness), omarbetat för automatiseringar och agenter med flera steg, på en plattform som förblir modellagnostisk: modeller från Cohere eller kundens modeller.
| Funktionsområde | Nyheter som Cohere nämner |
|---|---|
| Agenter | Återanvändbara agenter och automatiseringar, skapade med prompt och delade inom organisationen; orkestrering av flera agenter; minne som bevarar kontexten mellan sessioner |
| Produktivitet | Färdigheter (Skills), bibliotek (Libraries) och appar som skapar presentationer, dashboards och dokument; Automations, lanserat i slutet av juli, med färdiga mallar och en visuell editor |
| Anslutningsmoduler | Slack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion och GitHub; leverantörer av finansiella data (PitchBook, FactSet och andra) är endast planerade |
| Driftsättning och säkerhet | Egen drift, VPC, hybrid, lokalt eller helt frånkopplat; SOC 2 Type 2, ISO 27001 och ISO 42001; autonomipolicyer med mänskligt godkännande av kritiska beslut |
| Styrning | North Admin-konsol, förbrukningsnivåer för förfrågningar och tokens per användare eller grupp, varningar innan taken nås |
Cohere nämner två kunder, LG CNS i Sydkorea och Bell Cyber i Kanada, och framhåller högre genomströmning för sina modeller på NVIDIA Blackwell- och Hopper-GPU:er, utan siffror, med ett citat från Kari Briski, ansvarig för generativ IA hos NVIDIA. Inga priser eller något införandeschema anges: inlägget hänvisar till en demonstration som bokas hos säljteamen.
🔗 Lanseringsinlägg för North 2 🔗 Lanseringstråd för North 2 på X
Den globala alliansen med PwC, som börjar i Kanada
5 oktober — Samma dag tillkännager PwC och Cohere en global allians (global alliance) som börjar i Kanada, i ett pressmeddelande från PwC Canada daterat i Toronto som återges i ett kort inlägg från Cohere. Rollfördelningen är tydlig: Cohere tillhandahåller North, sina företagsmodeller och sina verktyg för informationssökning; PwC bidrar med sin kompetens inom branscher, regelverk, riskhantering och omställning, från valet av användningsfall till integrationen av IA med företagets data och system. De utannonserade användningsområdena omfattar sökning inom företaget, tillgång till kunskap, fördjupad informationssökning, beslutsstöd och automatisering av uppgifter, i privata moln, lokalt eller i frånkopplade miljöer, med reglerade sektorer som främsta målgrupp. Pressmeddelandet citerar Domenic Marino och Annie Veillet från PwC Canada samt Aidan Gomez från Cohere; det anger varken belopp, kunder eller någon tidsplan utöver Kanada. Cohere hade redan ingått en allians med OpenText den 16 september.
🔗 Coheres inlägg om alliansen med PwC 🔗 Pressmeddelande från PwC Canada
Öppna modeller: Beam, MetaEncoder-30B och Gemma 4 inom växtgenomik
Tre öppna modeller är aktuella i dag, i tre olika skeden: den ena är utlovad, den andra har lagts ut utan tillkännagivande och den sista lyfts fram en månad efter publiceringen.
Beam: Reflection AI:s öppna modell med 501 miljarder parametrar
5 oktober — Reflection AI presenterar Beam, sin första modell med öppna vikter: en gles MoE med 501 miljarder parametrar, varav 23 miljarder är aktiva, utformad för kod, resonemang och agentiska uppgifter och tränad från grunden genom hela processen. Förträningen omfattade 23 800 miljarder tokens; fasen med förstärkningsinlärning använde 10 500 NVIDIA GB300-GPU:er under fyra veckor och genererade över 100 miljoner trajektorier (rollouts).
Enligt Reflection AI:s tabeller:
| Utvärderat benchmark | Beam | Nemotron 3 Ultra | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|
| SWE-bench Verified | 80,9 | 70,7 | — | — | — | — |
| SWE Bench Pro v1 | 65,5 | 46,4 | — | — | 67,7 | — |
| Terminal Bench v2.1 | 80,1 | 56,4 | 88,2 | 88,3 | 86,6 | 90,6 |
| DeepSWE v1.1 | 44,4 | — | 61,0 | 68,0 | 51,0 | 74,2 |
Ett streck anger ett resultat som inte redovisas i inlägget. Reflection AI uppger resonemangsresultat som är jämförbara med GLM-5.2 med 3 till 4 gånger mindre beräkningsarbete vid inferens, och medger att Kimi K3 fortfarande ligger före i rå kapacitet. Inget går ännu att ladda ned: Beam genomgår slutliga utvärderingar och adversariella tester (red-teaming), tidig åtkomst kräver registrering, och vikterna, den tekniska rapporten, modellkortet och verktyg för utvecklare utlovas till senare i oktober.
🔗 Reflection AI:s inlägg om Beam
MetaEncoder-30B, beslutsenkodern som Meta lägger ut utan tillkännagivande
5 oktober — Meta har lagt ut MetaEncoder-30B på Hugging Face under sin organisation facebook, utan något tillkännagivande som vi har kunnat hitta: repot, som skapades den 30 september och ändrades den 5 oktober, hade bara två nedladdningar när vi kontrollerade det. Modellkortet presenterar en multimodal ”System One”-enkoder, formatet för Jevs beslutsmodeller: den får en uppgift i naturligt språk (fråga, instruktion, tillståndsbeskrivning, kriterier) och en lista med kandidater, i text med bilder och videor som stöd, och poängsätter varje kandidat. Eftersom uppgiften och kandidaterna kodas separat reduceras jämförelsen till en skalärprodukt, och ett index för närmaste grannar kan täcka miljontals kandidater utan att köra modellen igen. MetaEncoder är en kontrastiv finjustering av Muse Glimmer 30B, den agentiska modell med öppna vikter som Meta släppte i augusti, och ärver dess Apache 2.0-licens; nedladdningen kräver att villkor godkänns, och vLLM stöder servering av modellen för text och bild.
| Utvärderingssvit | Resultat enligt modellkortet | Använt mått |
|---|---|---|
| JEVBench (original / lätt / svår) | 0,9444 / 1,0000 / 0,7387 | Träffsäkerhet |
| ImaJEV-Bench | 0,8958 | Träffsäkerhet |
| NanoBEIR | 0,6632 | NDCG_linear@10 |
| MMEB-V3 (bild / video / visuella dokument) | 0,7897 / 0,6046 / 0,8138 | Hit@1 / Hit@1 / NDCG@5 |
🔗 Modellkort för MetaEncoder-30B på Hugging Face
Living Models kombinerar Gemma 4 och BOTANIC-1 för att avkoda växternas ADN
5 oktober — Google lyfter fram arbetet från Living Models, ett laboratorium för IA-biologi baserat i Paris, i en X Article från @GoogleAI och på sin Gemmaverse-sida. Gemma 4 E4B orkestrerar analysen (bearbetningskedjor i terminalen, datafiltrering, verktygsanrop), lokalt via Ollama på en enda NVIDIA L4-GPU, medan BOTANIC-1, en genomisk grundmodell som förtränats på 320 växtarter, bedömer mutationernas effekt; de proprietära genomen stannar lokalt. Fallstudien bygger på en upptäckt gjord vid INRAE av Adnane Boualem: en enda ändrad bokstav i melonens CmEIN3-gen gör att blomman går från honlig till hermafroditisk. Bland de 2 494 punktmutationer som är kandidater hamnar den validerade mutationen ensam på första plats, på mindre än fyra minuter enligt X Article.
| Testad konfiguration (20 körningar) | Recall@1 |
|---|---|
| Utan vägledning | 0,00 |
| Expertvägledning | 0,15 |
| Med BOTANIC-1:s poäng | 0,90 |
Botanic1-modellerna (från 0,3 till 2 miljarder parametrar) och preprinten på bioRxiv är från början av september: nyheten är att Google lyfter fram dem samt de detaljerade resultaten.
🔗 X Article från Google AI 🔗 Google DeepMinds Gemmaverse-sida
Reklam i ChatGPT: ett visuellt format testas och mätningen utökas
5 oktober — OpenAI förbereder ett visuellt annonsformat för ChatGPT: bilder ska visa inspiration kring en produkt, dess användning eller den upplevelse den möjliggör. Det första testet sker under bildgenerering, med annonser som är tydligt märkta och åtskilda från bilden som håller på att skapas; det inleds senare den här månaden i USA, med en första grupp annonsörer. OpenAI påminner om att reklamen inte påverkar svaren från ChatGPT, som enligt företaget når 1,2 miljarder personer varje vecka.
Merparten av tillkännagivandena gäller mätning: överföring av konverteringar via Hightouch, Tealium och LiveRamp, tio namngivna attributionspartners (bland annat AppsFlyer, Adjust och Triple Whale), geografiska inkrementalitetsexperiment med Haus, Measured och WorkMagic, ett konverteringsfönster på en dag efter annonsvisning i rapporterna och ett mått på signalkvalitet (Event Quality Score). När det gäller varumärkessäkerhet kan kvalificerade annonsörer utesluta uttryck (Negative Phrases), och pilotprojekt för utvärdering förbereds med DoubleVerify och Integral Ad Science. Pixeln och Conversions API finns sedan den 5 maj.
| Resultat publicerat av OpenAI | Publicerat värde | Mätning utförd av |
|---|---|---|
| Kostnad per förvärv för WeightWatchers jämfört med dess benchmark för betald sökning | −15,3 % | DV Rockerbox |
| Inkrementella köp av varumärket Dose gjorda av nya kunder | 67 % | WorkMagic |
| Besökare hos Portland Leather som kom från ChatGPT Ads och var nya för varumärket | 93 % | Triple Whale |
🔗 OpenAI:s inlägg om det nya annonsformatet 🔗 Inlägg på Ads-bloggen om mätning
Perplexitys changelog den 5 oktober: webbläsartillägg för Computer, Wiley och Stripe Projects
5 oktober — Perplexity publicerar en changelog med 18 avsnitt, utan att den hade delats på X vid vår genomgång. Åtta tar upp tillkännagivanden som redan har behandlats (Automations, Claude Opus 5.5, videogenerering, American Express Skills, Portable Computer på AMD, Fast Search, Profiles i Agent API, Claude Fable 5.1), ett nionde lägger till interaktiva 3D-förklaringar till diagrammen från den 1 oktober, och nio nyheter presenteras för första gången:
| Nyhet som presenteras för första gången | Plattform eller version | Berörda användare |
|---|---|---|
| Tillägg för Chrome, Edge eller Brave som låter Computer använda webbläsaren (Comet är fortfarande standard) | Perplexity för Mac 26.38.0 och senare | Inte angivet |
| Computer-uppgifter i separata flikar och fönster | Perplexity för Mac 26.37.1 och senare | Inte angivet |
| Ansträngningsnivå (Light, Standard, High, Ultra) på mobilen | iOS 26.38.0 och Android 2.100.0, och senare | Pro, Max, Enterprise Pro, Enterprise Max |
| Tidskrifter och böcker från Wiley utan separat Wiley-abonnemang | Perplexity och Computer | Alla abonnemang, varierande premiumkvoter |
| GPT-6.1 Sol, som även driver Computers ansträngningsnivå Light i stället för GPT-6 Sol | Perplexity och Computer | Kvalificerade betalande abonnenter |
| Guidad konversation för att starta en första Computer-uppgift | Webben | Nya gratiskonton |
| Anslutning av en app från inmatningsfältet (Anslut en app) | Computer på webben | Inte angivet |
| DocSend-anslutning för datarum för investeringar (deal rooms) | Computer | Kvalificerat DocSend-konto |
| Stripe Projects: API-nyckel för Perplexity skapad via Stripes CLI | Stripes CLI | Utvecklare som använder Perplexitys API |
Med Stripe Projects skapar eller ansluter ett kommando projektet, genererar nyckeln och skriver den till filen .env, en konfiguration som Perplexity föreslår att man överlåter åt Claude Code, Cursor eller Codex.
🔗 Perplexitys changelog den 5 oktober
Generativt skapande: Suno Albums och HyperFrames Studio från HeyGen
Suno lägger till album
5 oktober — Suno lägger till album, som hittills saknats på plattformen. Enligt blogginlägget som följer med tillkännagivandet förvandlar funktionen användarnas bästa låtar till kompletta projekt (fullängdsprojekt), och en spellista (playlist) som fungerade som ett album kan nu omvandlas till ett Album. Suno presenterar artisterna bakom de fem första albumen: naenia (Oakwood///diskrot), Old Soul (Isaiah Wallace), phenomenal (KakerMix///diskrot), Lost In a Dream (Dream Relic) och VOID (ECHLO). Företaget anger varken vilka abonnemang som omfattas, antalet låtar per album eller det exakta lanseringsdatumet. Redan i juni frågade Suno sin community om lyssningsupplevelsen med spellistor, album och radiokanaler.
🔗 Sunos tillkännagivande på X 🔗 5 album du inte får missa, Sunos blogg
HyperFrames Studio, HeyGens videoredigerare utformad för agenter
5 oktober — HyperFrames, HeyGens open source-ramverk som omvandlar HTML-kod till video, blir en skrivbordsapp. HyperFrames Studio presenteras som en videoredigerare byggd från grunden för agenter: man beskriver den önskade videon, agenten (Claude Code, Codex eller en egen agent) levererar en första klippning, och sedan arbetar människan och agenten på samma tidslinje (timeline). Man styr med handgrepp i stället för med en prompt: ringar in ett element i bilden, fäster en kommentar vid ett ord eller klipper själv. Appen exporterar i 4K och uppges erbjuda hundratals inspirationskällor och mallar; enligt HyperFrames konto på X är den gratis, och endast en macOS-version finns att ladda ned. Den bygger vidare på Studio Preview från juli, där det redan gick att visuellt redigera en video som genererats med kod.
🔗 Tillkännagivande av HyperFrames Studio 🔗 Delat av HeyGen
Notiser
- Warp Factories på väg mot allmän tillgänglighet — I ett blogginlägg den 3 oktober om sitt höstseminarium uppger Warp att Warp Factories, företagets agentinfrastruktur, håller på att gå från tidig åtkomst till allmän tillgänglighet, utan att ange datum eller pris; teamet säger sig ha minskat kostnaden per PR med 70 % den senaste månaden genom att använda den. 🔗 källa
- Devins versionsinformation den 2 oktober — Åtkomstinställningarna för Microsoft Teams tillämpas nu, ett klick markerar alla säkerhetsfynd med samma allvarlighetsgrad (även i API v3), och de plugins som erbjuds visar sina skills, MCP, hooks och regler före installation; miljöbyggen för stora Perforce-repon får 3 timmar på sig i stället för att misslyckas efter 10 minuter. 🔗 källa
- MCP TikTok Ads i Replit — Replit lägger till TikTok Ads i sin katalog med över 450 integrationer: när kontot har anslutits kan dess Agent skapa och hantera TikTok-annonser, nå målgrupper och mäta resultat från arbetsytan, utan att anslutningen förbrukar krediter. 🔗 källa
- Cockle Finance på Replit — Replit fäster en video om Cockle Finance, vars verktyg byggdes på Replit av Dan och hans pappa Steve för att följa kundinflödet; enligt Replit ökade Dan sin verksamhet med 15 % på tre månader, utan att det anges vad som mättes. 🔗 källa
- Copilot CLI 1.0.92 som stabil version — Den här versionen samlar nyheterna från förhandsversionerna 1.0.92-0 till -5; den enda nya funktionen är att användaren efter en Microsoft Entra-inloggning väljer vilket konto som ska användas,
/logoutstänger dessa OAuth-sessioner och MCP-servrar som skyddas av Entra förnyar sina autentiseringsuppgifter utan ingripande. 🔗 källa - Codex CLI 0.160.1 — Den här korrigeringen av 0.160.0 innehåller bara en backport: Windows-variablerna SYSTEMROOT, TEMP och TMP bevaras när fjärranslutna MCP stdio-servrar startas med en uttryckligen konfigurerad fjärrmiljö; det är den senaste stabila versionen, eftersom ingen stabil 0.161.0 har släppts. 🔗 källa
- Nightly-versionen av Gemini CLI den 5 oktober — Den innehåller inga ändringar: den bygger på samma commit som versionen från den 3 oktober och skiljer sig bara i versionsnummer, medan den stabila kanalen (v0.62.0) och förhandskanalen (v0.63.0-preview.0) är oförändrade. 🔗 källa
- SpaceXAIs TypeScript SDK 0.2.1 — Den här versionen, som publicerades den 2 oktober, lägger till
toJson(schema), som validerar strukturerad utdata med en Standard Schema-validerare (Zod, Valibot eller ArkType), och alternativetretryBeforeOutput, som gör ett nytt försök med en strömmande begäran (streaming) som misslyckats innan någon utdata har skickats; vid en 429 utan Retry-After-header är väntetiden nu från en sekund upp till 30 sekunder, i stället för 250 millisekunder. 🔗 källa - Cresta Conductor på Claude Agent SDK — I Anthropics serie om startups som bygger med Claude presenterar Cresta Conductor, ett verktyg för att bygga kundserviceagenter med naturligt språk, byggt på Claude Agent SDK; enligt Cresta har det ungefär halverat tiden för den första driftsättningen i de tidiga användningsfallen, utan att datum för tillgänglighet eller pris anges. 🔗 källa
- npm: konfigurationer för betrodd publicering löper ut — Sedan den 2 oktober löper en konfiguration för betrodd publicering (trusted publishing) som inte har använts för någon publicering ut 48 timmar efter att den skapats, och npm avvisar även tokens från GitHub Actions-händelser av typen
issue_comment, liksom förpull_request_target. 🔗 källa - npm: väntande publicering skapar paket — Sedan den 2 oktober kan
npm stage publishskapa ett paket som ännu inte finns, med en lokal session eller en token med detaljerade behörigheter, även en som är begränsad till att lägga publiceringen i vänteläge (stage-only); den första versionen blir möjlig att installera först när en underhållare godkänner publiceringen. 🔗 källa - Perplexitys Agent API på Fast Search — Förinställningarna low, medium och high i Agent API använder nu Fast Search för verktyget
web_search, vilket sänker priset från 2,50 till 1 dollar per 1 000 anrop och gör det omkring 800 ms snabbare; förinställningen xhigh behåller standardsökningen. 🔗 källa - Perplexitys RAG-guide — Perplexity publicerar en guide med nio exempel på generering förstärkt med informationshämtning (retrieval-augmented generation, RAG) och sju arkitekturer, där företaget tar upp sitt eget webbindex och sin funktion Instant Buy vid sidan av externa exempel som Zendesk och GitHub Copilot; inga produktnyheter. 🔗 källa
- Coheres personalstyrka — Enligt Cohere har företaget gått från omkring 400 anställda i början av 2026 till över 800 i dag, en siffra som anges i ett rekryteringsinlägg. 🔗 källa
- IsoVGRBench och Logbook hos Meta — Utan tillkännagivande publicerar facebookresearch koden för IsoVGRBench, som utvärderar belöningsmodeller för video på 16 000 par som bara skiljer sig åt i ett avseende (när de ställs inför samma klipp med bildrutorna i omkastad ordning svarar modellerna nästan slumpmässigt), samt koden för Logbook, som handlar om händelser i mycket långa ljudinspelningar. 🔗 källa
- FiftyOne läser LeRobot v3-dataset — Enligt ett communityinlägg av Harpreet Sahota läser open source-verktygslådan FiftyOne nu LeRobot v3-formatet direkt, utan konverterare eller kopiering av videorna; demonstrationen omfattar 497 episoder från de 50 robottyperna i LeRobots communitydataset. 🔗 källa
- FetchMan-data från Ai2 — Detta dataset, som publicerades den 1 oktober utan tillkännagivande, samlar 352 696 simulerade episoder (52 miljoner bildrutor, 902 instruktioner) där en humanoid Unitree G1 griper föremål, genererade i MolmoSpaces, i LeRobot v3-format och under ODC-BY-licens. 🔗 källa
- P(doom) på Hugging Face-profiler — Användare på Hub kan visa sin P(doom) på profilen, alltså sin uppskattning av sannolikheten för att AI orsakar en existentiell katastrof; svaren ingår i en undersökning där endast aggregerade och anonymiserade resultat kommer att publiceras, om två veckor. 🔗 källa
- Tillägget hf-image — Hugging Face släpper, utan tillkännagivande, ett tillägg till sitt CLI som bygger, pushar, pullar och kör containeravbilder på registret cr.hf.co; okomprimerade lager dedupliceras av Xet, så ett lager på 2 Go där 100 Mo har ändrats skickar bara omkring 100 Mo enligt README. 🔗 källa
- Tre experiment av Milos Kotlar — I tre communityinlägg gör Milos Kotlar en liten transformers KV-cache 2,71 gånger mer kompakt med 97,85 % överensstämmelse om nästa token, och sänker andelen tokens utan expert i en MoE-routing från 13,84 % till 8,09 %, utan någon hastighetsvinst. 🔗 källa
- Stephen Yus granskning av en LLM-domare — Stephen Yu har med 38 400 exempel granskat GLM-5.3-domaren som bedömer faktatrohet i GRPO-belöningen för hans omskrivningsmodell på 12B: den är tillförlitlig när det gäller att upptäcka att ett faktum har ändrats, men brusig i bedömningen av hur allvarlig ändringen är; att räkna felaktiga utdata visar en minskning på 39 % som den första beräkningen dolde. 🔗 källa
- Sakana AI-symposium i Tokyo — Sakana AI öppnar anmälan till ett kostnadsfritt symposium den 26 oktober i Hitotsubashi Hall i Tokyo, på engelska, med en föreläsning av Jürgen Schmidhuber och ett samtal med David Ha, vd för Sakana AI. 🔗 källa
- NVIDIA Inception-startups och bröstcancer — NVIDIA presenterar fyra startups i sitt Inception-program som använder AI i vårdkedjan, däribland iSono Health och dess FDA-godkända 3D-ultraljudssystem ATUSA (omkring två minuter per bröst jämfört med upp till 45 minuter manuellt), Whiterabbit.ai, Ataraxis AI och SimBioSys; vissa av dessa tekniker är inte godkända av FDA. 🔗 källa
Vad det innebär
Att kunna spåra textens ursprung blir ett regulatoriskt krav. Hittills har spårbarheten för genererat innehåll främst gällt bild och ljud, med vattenmärken och verifierbara metadata; AI Act utvidgar kravet till text, och OpenAI svarar stegvis: vattenmärkning som tillämpas automatiskt på text från ChatGPT och Codex i EU, ett valbart alternativ i API:et och en detektor som bara är tillgänglig för godkända organisationer. De publicerade siffrorna förklarar försiktigheten: omkring 95 % av avsnitten på 400 tokens upptäcks i innehåll inom psykologi, med ett mål på 1 % falska positiva, men i engelska avsnitt på 400 tokens sjunker detektionen från omkring 92 % till 66 % när 10 % av orden ersätts med synonymer, och en omskrivning eller översättning kan ta bort vattenmärket. Vattenmärket ger en indikation på ursprunget, ingen bevisning, och dess frånvaro säger ingenting om upphovspersonen.
Agenternas minne etableras och börjar standardiseras. Devin sparar sina lärdomar i ett Git-repo med Markdown-filer som Dreaming omorganiserar varje dag, och Cognition publicerar formatet under MIT-licens så att andra agenter kan använda det; North 2 bevarar kontexten mellan sessioner; Qwen Code kopplar Mem0 direkt till sitt CLI. Tillvägagångssätten skiljer sig åt, mellan versionshanterade filer som människor kan läsa, en extern minnestjänst och en funktion inbyggd i en plattform, men de svarar mot samma behov: att en agent inte ska börja om från noll vid varje session. Cognitions val har en praktisk fördel: varje anteckning hänvisar till sessionen där lärdomen uppstod, kan läsas i gränssnittet och behåller sin Git-historik, vilket gör det möjligt att läsa och korrigera det som agenten har kommit ihåg.
Öppna modeller kommer in i kodverktygen via flera vägar. Together Link kopplar dem till befintliga agenter, inklusive Claude Code och Codex, och uppger att kostnaden minskar med mer än hälften; IBM kör den självhostade versionen av Bob på Nemotron 3 Ultra för företag som behåller utvecklingen på sin egen infrastruktur, även i miljöer utan nätanslutning; Reflection AI presenterar Beam som en öppen modell anpassad för kod och agentbaserade uppgifter, med 80,9 på SWE-bench Verified enligt företagets egna tabeller. Det gemensamma argumentet handlar mindre om råpoängen, där Reflection AI medger att Kimi K3 fortfarande ligger före, och mer om kostnad, latens och kontroll över data.
Många av dagens siffror kommer från dem som publicerar dem. GitHub har utformat ReviewBench och tagit fram den första rankningen där Copilot code review ligger i topp, utan att andra leverantörer har kört eller verifierat den; latensen för Nemotron 3 Ultra kommer från IBMs interna tester; besparingarna med Together Link och annonseringsresultaten för ChatGPT är de som Together AI och OpenAI uppger. GitHub publicerar dock sitt dataset, sin domare och sin metodik och öppnar för bidrag: varje leverantör kan göra om mätningen med sin egen agent. Det är det som kommer att göra det möjligt att avgöra om den första rankningen håller.
Källor
- Vårt förhållningssätt till EU:s regler om textproveniens (OpenAI)
- OpenAI:s tråd om vattenmärkningens begränsningar
- Minne och drömmar: så lär sig Devin av att arbeta med dig (Cognition)
- Cognitions tråd på X
- Repo för agentminne
- Cursors tråd om SDK
- Ändringslogg för Cursors SDK
- Qwen Code v0.25.0 på GitHub
- Together Link (Together AI)
- Dokumentation för Together Link
- Varför IBM valde NVIDIA Nemotron för IBM Bob i egen drift
- ReviewBench: ett öppet benchmark för code review med AI (GitHub Blog)
- ReviewBench-webbplatsen
- North 2: AI för företag utan kompromisser (Cohere)
- Lanseringstråden för North 2 (Cohere på X)
- Alliansen mellan Cohere och PwC (Coheres blogg)
- Pressmeddelande från PwC Canada
- Vi presenterar Beam (Reflection AI)
- MetaEncoder-30B på Hugging Face
- Google AI:s artikel på X om Living Models
- Living Models på Gemmaverse (Google DeepMind)
- Vi utvecklar annonsering för hur människor använder AI (OpenAI)
- Fler sätt att mäta ChatGPT Ads
- Perplexitys ändringslogg från den 5 oktober
- Sunos tillkännagivande av album
- 5 album du inte får missa (Suno)
- Tillkännagivande av HyperFrames Studio
- Vidaredelning från HeyGen
- Bygg fabriken. Låt den gå. Paddla kajak. (Warp)
- Versionsanteckningar för Devin från den 2 oktober
- MCP TikTok Ads i Replit
- Cockle Finance på Replit
- Copilot CLI v1.0.92
- Codex CLI 0.160.1
- Nightly-version av Gemini CLI från den 5 oktober
- SpaceXAI:s TypeScript-SDK v0.2.1
- Cresta och Claude Agent SDK (claude.com-bloggen)
- Ovaliderade konfigurationer för npm trusted publishing löper nu ut
- npm staged publishing stöder nu skapandet av nya paket
- Ändringslogg för Perplexitys API
- 9 RAG-exempel (Perplexitys blogg)
- Coheres personalstyrka
- IsoVGRBench-repo
- FiftyOne och LeRobot v3 (Harpreet Sahota)
- FetchMan-data på Hugging Face
- P(doom) på Hub (Hugging Faces ändringslogg)
- hf-image-repo
- KV-cache med KL-budget (Milos Kotlar)
- Granskning av LLM-domaren (Stephen Yu)
- Sakana AI:s symposium
- Från skanning till behandlingsplan (NVIDIA)