Cerca

OpenAI applicherà una filigrana al testo di ChatGPT e Codex nell'Unione europea, Devin ricorda tra le sessioni, GitHub lancia ReviewBench

ai-powered-markdown-translator

Articolo tradotto dal fr all’it con gpt-6.1-sol.

Vedi progetto su GitHub ↗

OpenAI aggiungerà nelle prossime settimane una filigrana invisibile al testo di ChatGPT e di Codex per i suoi utenti dell’Unione europea, in risposta all’AI Act che impone di rendere il testo generato identificabile da una macchina, e rende disponibile da oggi questa filigrana come opzione ai clienti della sua API in tutto il mondo. Sul fronte degli agenti, la memoria prende piede: Cognition dota Devin di una memoria tra le sessioni e ne pubblica il formato come standard aperto, e Cohere lancia North 2 con una memoria che conserva il contesto da una sessione all’altra; GitHub pubblica invece ReviewBench, un benchmark aperto per la revisione del codice tramite IA. Sul fronte dei modelli aperti, Reflection AI presenta Beam, con 501 miliardi di parametri, i cui pesi sono promessi per più avanti a ottobre.


Filigrana invisibile di OpenAI: il testo di ChatGPT e Codex contrassegnato nell’Unione europea, un’opzione mondiale nell’API

5 ottobre — OpenAI pubblica la sua risposta alle regole europee sulla provenienza del testo. L’AI Act impone ai fornitori di IA generativa di rendere il testo che producono identificabile in un formato leggibile da una macchina; OpenAI risponde per tappe, avvertendo fin da subito che le attuali tecnologie di filigrana del testo presentano limiti importanti (limiti significativi).

Pubblico interessatoCosa cambiaTempistiche annunciate
Utenti di ChatGPT e di Codex nell’Unione europea, tutti i pianiFiligrana invisibile aggiunta al testo idoneoNelle prossime settimane
Clienti dell’API, in tutto il mondoFiligrana opzionale (opt-in) su modelli selezionati, non specificati, disattivata per impostazione predefinitaDal 5 ottobre
Ricercatori e organizzazioni esperte approvatiAccesso al rilevatore, caso per caso, previa candidaturaCandidature aperte il 5 ottobre

OpenAI non la rende un’impostazione predefinita a livello mondiale e collabora con partner cloud per offrire, nelle prossime settimane, la stessa filigrana sui modelli OpenAI che mettono a disposizione. La tecnologia, textGrain, aggiunge un segnale statistico invisibile alle scelte lessicali del modello, senza segni visibili né caratteri speciali; secondo OpenAI, eguaglia o supera gli altri approcci testati, tra cui SynthID per il testo. È stato pubblicato un rapporto tecnico e OpenAI prevede di renderne aperto il codice. Il rilevatore, invece, non è pubblico al lancio, a causa del rischio di filigrane non rilevate e di falsi positivi: l’accesso segue il Codice di buone pratiche (Code of Practice) della Commissione europea.

I dati pubblicati mostrano soprattutto i limiti del rilevamento:

Condizione di misurazioneTasso di rilevamento pubblicato
Passaggi di 200 tokens, contenuti di psicologia, obiettivo di 1 % di falsi positivicirca 80 %
Passaggi di 400 tokens, contenuti di psicologia, obiettivo di 1 % di falsi positivicirca 95 %
Contenuti di matematica, stessa soglia di 1 %nettamente più basso (valore indicato solo in un grafico)
Passaggi di 400 tokens in inglese (dataset ELI5), non modificaticirca 92 %
Stessi passaggi, 10 % delle parole sostituite con sinonimi66 %
Stessi passaggi, 25 % delle parole sostituite17 %

Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.

🇮🇹 Le filigrane hanno dei limiti. Spesso non sono rilevabili, soprattutto nei passaggi brevi. Riscrivere o tradurre un testo può eliminare completamente la filigrana. — @OpenAI su X

Quanto alla qualità, OpenAI non rileva differenze significative su otto benchmark di GPT-6 Astra senza e con filigrana (94,44 % contro 93,94 % su GPQA Diamond, 53,90 % contro 56,06 % su Terminal-Bench 4.0). L’articolo precisa anche cosa non indica una filigrana: né la quota di lavoro umano, né la proprietà o la responsabilità del testo, né l’identità dell’utente, né l’accuratezza; e la sua assenza non dimostra che il testo sia stato scritto da un essere umano. Per le immagini e l’audio, nulla cambia: openai.com/verify e la Content Provenance API restano accessibili alle organizzazioni, e dal 19 maggio SynthID si aggiunge ai metadati C2PA delle immagini generate.

🔗 Articolo di OpenAI sulla provenienza del testo nell’UE


5 ottobre — Cognition introduce in Devin due funzioni collegate: Memory, una memoria che persiste da una sessione all’altra, e Dreaming, un «sogno» quotidiano che la riorganizza. Memory conserva ciò che l’agente impara lavorando con ciascun utente: preferenze, correzioni, lezioni apprese da un progetto o da un flusso di lavoro. Non sono riassunti delle sessioni, ma brevi note, ciascuna collegata alla sessione in cui è stata appresa la lezione, e questa memoria resta personale: non diventa un’istruzione condivisa da tutta l’organizzazione.

Le note risiedono nel Memory Drive, un repository Git persistente di file Markdown organizzati per repository, progetto o tema. Un file MEMORY.md, volutamente breve, raccoglie le preferenze generali e l’indice del resto: Devin lo riceve all’inizio di ogni sessione, poi cerca le note utili con gli strumenti che usa per esplorare il codice, senza caricare l’intero archivio nel suo prompt. Ogni sessione lavora sulla propria copia Git: Devin integra gli aggiornamenti delle altre sessioni, un controllo della revisione rifiuta le scritture obsolete e i conflitti vengono segnalati anziché essere sovrascritti in silenzio.

Dreaming è una sessione quotidiana in background (di notte, precisa il thread di Cognition): Devin rilegge le conversazioni passate alla luce della sua memoria, unisce le note che si sovrappongono, rimuove i dettagli transitori, cerca le lezioni che non erano state annotate ed elimina i ricordi che nessuna sessione ha utilizzato. L’accesso avviene su devin.ai, dal menu Customize → Memory; l’articolo non dice nulla su Devin Desktop né su Devin CLI e non annuncia alcun prezzo.

Cognition pubblica anche il formato come standard aperto, Agent Memory Repo, con licenza MIT. La specifica, aperta ai contributi, descrive il ciclo di ogni sessione (clonare la memoria, cercare, aggiornare senza intervento umano, eseguire il push dopo ogni modifica) e la composizione di più memorie nella stessa sessione, ciascuna nel proprio repository con i propri permessi e la propria cronologia. Tra gli usi citati figurano la memoria di squadra e gli sciami di agenti (agent swarms):

In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)

🇮🇹 Durante i primi esperimenti, abbiamo visto uno sciame di Devin usare la memoria per coordinarsi su larga scala senza che glielo chiedessimo (promesso, non hanno hackerato nessuno). — @cognition su X

Un «sogno» che riorganizza la memoria di un agente esisteva già in Anthropic (Claude Managed Agents, a maggio) e in OpenAI (memoria di ChatGPT, a giugno); ciò che cambia qui è una memoria in file versionati con Git, pubblicata come specifica che altri agenti possono adottare.

🔗 Memoria e sogni, articolo di Cognition 🔗 Specifica Agent Memory Repo

Cursor: guidare gli agenti del suo SDK durante l’esecuzione

5 ottobre — Cursor arricchisce il suo SDK, che serve a lanciare i suoi agenti da codice TypeScript o Python. Il metodo run.steer() inserisce un messaggio nel turno in corso di un agente; se in quel momento un sottoagente è al lavoro, passa in background e continua. Anche i sottoagenti in background comunicano i propri risultati: il loro risultato torna all’agente principale come un turno aggiuntivo della stessa esecuzione, anziché andare perso quando termina il turno dell’agente principale.

Novità dell’SDKAmbito indicato dal changelog
run.steer(), controllo durante l’esecuzioneAgenti locali in TypeScript; su un agente cloud, il messaggio viene inviato come una normale richiesta di continuazione
Restituzione dei risultati dei sottoagenti in backgroundAgenti locali, in TypeScript e in Python
Annotazioni MCP degli strumenti personalizzati (readOnlyHint, destructiveHint…)TypeScript; semplici indicazioni, di cui l’SDK non impone il rispetto
Prompt di sistema sostituibile, regole e skill sempre caricatiAgenti locali in TypeScript; accesso abilitato account per account

Queste modifiche non sono accompagnate da alcun prezzo.

🔗 Il thread di Cursor su X 🔗 Changelog dell’SDK di Cursor

Qwen Code v0.25.0: agenti dello spazio di lavoro, canale e-mail e memoria Mem0

5 ottobre — Qwen pubblica la v0.25.0 di Qwen Code, il suo agente di programmazione da riga di comando, prima versione stabile dalla v0.24.7 del 29 settembre: 42 funzionalità, di cui 23 per il Managed Agent, 79 correzioni e nessuna modifica incompatibile nota. Spiccano tre aggiunte, tutte da attivare esplicitamente. Gli agenti dello spazio di lavoro ora collaborano in locale: il demone avvia e riprende i loro turni, e il Web Shell permette di gestire agenti e attività e di chiamarne uno con @agent da una conversazione. Questi agenti persistenti si aprono al protocollo A2A 1.0, tramite condivisioni con scadenza e revocabili. Infine, la memoria Mem0 si collega direttamente alla CLI: basta indicare un endpoint e una chiave, e Qwen Code registra autonomamente il server MCP corrispondente. Un canale e-mail dà inoltre all’agente una propria casella di posta, tramite IMAP e SMTP, e il Code Mode esegue in parallelo le chiamate Bash che il modello raggruppa. L’SDK TypeScript v0.1.18 e l’applicazione Desktop v0.25.0 sono arrivati nella stessa mattinata, senza un tweet di Qwen.

🔗 Note di rilascio di Qwen Code v0.25.0

5 ottobre — Together AI lancia in beta Together Link, che fa girare gli agenti di programmazione già installati sui modelli aperti ospitati dalla piattaforma. Un comando di installazione (macOS o Linux) collega Claude Code, Claude Desktop, Codex, OpenCode e Pi alla sua API, con la chiave dell’account; la documentazione aggiunge ChatGPT Desktop e avverte che comandi, routing ed elenco dei modelli possono ancora cambiare. Oltre alla modalità Auto, vengono proposti quattro modelli, tutti con 1M di tokens di contesto:

Modello propostoEquivalente nel menu /model di Claude Code
Kimi K3Opus
GLM 5.3Fable
GLM 5.3 FlashSonnet
DeepSeek V4.1 FlashHaiku

La modalità Auto, selezionata per impostazione predefinita, può affidare i compiti difficili a Opus 5.5 quando l’utente fornisce una chiave Anthropic, ma l’articolo e la documentazione non descrivono questo routing allo stesso modo: una scelta effettuata una sola volta per sessione per preservare la cache del prompt secondo l’articolo, una selezione richiesta per richiesta riservata a Claude Code e Claude Desktop secondo la documentazione. Together AI annuncia una riduzione della spesa di oltre il 50 %, senza pubblicare la metodologia, e mostra dopo ogni sessione il suo costo accanto a quello che avrebbe avuto su Opus 5.5.

🔗 Articolo di Together AI 🔗 Documentazione di Together Link

IBM Bob ospitato in proprio si basa su Nemotron 3 Ultra di NVIDIA

5 ottobre — IBM spiega perché la versione ospitata in proprio (self-hosted) di Bob, il suo assistente di sviluppo agentico, si basa su Nemotron 3 Ultra di NVIDIA, insieme a Poolside Laguna S 2.1. Questa opzione, entrata in disponibilità generale la settimana precedente, fa girare l’assistente sull’infrastruttura del cliente, anche in ambienti disconnessi (air-gapped). Il team ha valutato i modelli secondo quattro criteri (impronta hardware, accuratezza nel codice, latenza, apertura dei pesi), testandoli con l’harness dell’agente Bob e usando come riferimento modelli chiusi di Anthropic, OpenAI e Google. Inizialmente troppo prolisso, Nemotron è stato adattato insieme a NVIDIA: prompt, parametri di campionamento, impostazioni di ragionamento e correzioni dell’harness. Secondo test interni di IBM, Nemotron 3 Ultra offre una latenza fino a circa 4 volte inferiore su GPU Blackwell rispetto a modelli SaaS di punta chiamati via rete e rispetta rigorosamente gli schemi degli strumenti; Laguna S 2.1 è stato scelto per il suo rapporto prestazioni/impronta. L’articolo non pubblica alcun punteggio di accuratezza.

🔗 Articolo di IBM su Bob ospitato in proprio


ReviewBench: GitHub lancia un benchmark aperto per la revisione del codice tramite IA

5 ottobre — GitHub lancia in anteprima di ricerca (research preview) ReviewBench, un benchmark aperto per gli agenti di revisione del codice tramite IA. Il sito dedicato pubblica il dataset completo, la classifica, la metodologia, il prompt e la configurazione del giudice, oltre a uno strumento di esecuzione self-service. L’articolo è firmato da Michelle Zhou e Alejandro Carderera de Diego, e i ringraziamenti coinvolgono GitHub e Microsoft nel progetto.

Il corpus riunisce 219 pull request provenienti da 187 repository open source pubblici, in 19 linguaggi. Le distribuzioni dei linguaggi e delle dimensioni dei repository riproducono quelle di GitHub, determinate su 103,9 milioni di pull request, con una ponderazione esplicita a favore delle modifiche medie e grandi. La verità di riferimento (golden set) combina revisori umani, problemi dedotti dai commit successivi, strumenti di analisi deterministici e diversi LLM all’avanguardia; i rilievi vengono convalidati da un giudice LLM, Claude Sonnet 5 secondo l’articolo. Ingegneri senior estranei alla costruzione del dataset hanno rietichettato ogni rilievo: il loro verdetto concorda con ReviewBench nel 96,6 % dei casi. Il recall «ancorato» (grounded), misurato sulla sola verità di riferimento, costituisce il principale criterio di confronto.

Secondo la classifica iniziale di GitHub, Copilot code review è in testa:

Agente valutato (configurazione)F1 ancoratoPrecisione ancorataRecall ancoratoData di esecuzione
Copilot Code Review (Balanced)40,1 %87,8 %26,0 %1º ottobre 2026
Devin AI37,0 %84,0 %23,8 %28 settembre 2026
Qodo35,1 %85,3 %22,1 %28 settembre 2026
Codex (GPT-5.6 Sol · Ultra)32,3 %87,0 %19,9 %19 luglio 2026
Cubic27,3 %85,5 %16,3 %29 giugno 2026
Greptile27,2 %86,1 %16,2 %16 giugno 2026
Cursor17,3 %87,7 %9,6 %27 settembre 2026

Il sito precisa che questi primi risultati sono stati prodotti dal team ReviewBench eseguendo il prodotto pubblico di ciascun fornitore alla data indicata, e che i fornitori non li hanno né eseguiti né verificati. Chiunque può ora sottoporre il proprio agente: immagine del container e chiave del modello fornite dal candidato, giudice fornito da GitHub, prove su 25 pull request e poi esecuzione completa in tre passaggi; un punteggio viene pubblicato solo dopo la convalida da parte di un maintainer, e soltanto se migliora il precedente punteggio dell’agente o se si tratta del suo primo risultato.

GitHub lo usa anche per far evolvere Copilot code review. In un test A/B, una revisione con più modelli del livello Lite, che combina diverse esecuzioni indipendenti, ha aumentato il recall del 13,6 % con un costo per revisione in calo dell’8,0 %, nella direzione prevista offline. L’articolo si contraddice sul volume dei commenti: +61 % secondo il testo, +25,0 % secondo il grafico.

🔗 Articolo di GitHub su ReviewBench 🔗 Sito e classifica di ReviewBench


Cohere lancia North 2 e stringe un’alleanza globale con PwC

5 ottobre — Cohere lancia North 2, la nuova versione di North, la sua piattaforma di agenti IA per le imprese, annunciata come «presto disponibile» il 9 settembre e poi promessa per ottobre. Il thread di lancio rivendica oltre 15 nuove funzionalità (15+ new features), un conteggio che l’articolo non riprende. Il cuore della versione è un nuovo harness per agenti (agent harness), ripensato per automazioni e agenti in più fasi, su una piattaforma che rimane agnostica: modelli di Cohere o modelli del cliente.

Ambito funzionaleNovità citate da Cohere
AgentiAgenti e automazioni riutilizzabili, creati tramite prompt e condivisi nell’organizzazione; orchestrazione multi-agente; memoria che conserva il contesto da una sessione all’altra
ProduttivitàCompetenze (Skills), librerie (Libraries) e applicazioni che producono presentazioni, dashboard e documenti; Automations, lanciate a fine luglio, con modelli pronti all’uso ed editor visuale
ConnettoriSlack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion e GitHub; fornitori di dati finanziari (PitchBook, FactSet e altri) soltanto previsti
Deployment e sicurezzaSelf-hosted, VPC, ibrido, on-premise o completamente disconnesso; SOC 2 Type 2, ISO 27001 e ISO 42001; politiche di autonomia con convalida umana delle decisioni critiche
GovernanceConsole North Admin, soglie di consumo di richieste e token per utente o gruppo, avvisi prima del raggiungimento dei limiti

Cohere cita due clienti, LG CNS in Corea del Sud e Bell Cyber in Canada, e mette in evidenza un throughput migliore dei suoi modelli sulle GPU NVIDIA Blackwell e Hopper, senza cifre, con una citazione di Kari Briski, responsabile dell’IA generativa di NVIDIA. Non vengono indicati né prezzi né un calendario di deployment: l’articolo rimanda a una demo da prenotare presso i team commerciali.

🔗 Articolo di lancio di North 2 🔗 Thread di lancio di North 2 su X

L’alleanza globale con PwC, che parte dal Canada

5 ottobre — Lo stesso giorno, PwC e Cohere annunciano un’alleanza globale (global alliance) che comincia dal Canada, in un comunicato di PwC Canada datato Toronto e ripreso da un breve articolo di Cohere. La ripartizione dei ruoli è chiara: Cohere fornisce North, i suoi modelli aziendali e i suoi strumenti di recupero delle informazioni; PwC apporta le proprie competenze settoriali, normative, di gestione dei rischi e di trasformazione, dalla scelta dei casi d’uso all’integrazione dell’IA con i dati e i sistemi aziendali. Gli utilizzi annunciati comprendono la ricerca aziendale, l’accesso alle conoscenze, la ricerca approfondita, il supporto alle decisioni e l’automazione delle attività, in cloud privato, on-premise o in ambienti disconnessi, con i settori regolamentati come obiettivo prioritario. Il comunicato cita Domenic Marino e Annie Veillet, di PwC Canada, e Aidan Gomez, di Cohere; non indica né importi, né clienti, né un calendario oltre al Canada. Cohere aveva già concluso un’alleanza con OpenText il 16 settembre.

🔗 Articolo di Cohere sull’alleanza con PwC 🔗 Comunicato di PwC Canada


Modelli aperti: Beam, MetaEncoder-30B e Gemma 4 nella genomica vegetale

Tre modelli aperti sono al centro delle notizie del giorno, in tre fasi diverse: uno è promesso, un altro viene pubblicato senza annuncio, l’ultimo viene messo in evidenza un mese dopo la pubblicazione.

Beam: il modello aperto da 501 miliardi di parametri di Reflection AI

5 ottobre — Reflection AI presenta Beam, il suo primo modello a pesi aperti: un MoE sparso da 501 miliardi di parametri, di cui 23 miliardi attivi, progettato per il codice, il ragionamento e le attività agentiche, e addestrato interamente da zero. Il preaddestramento ha utilizzato 23 800 miliardi di token; la fase di apprendimento per rinforzo ha impiegato 10 500 GPU NVIDIA GB300 per quattro settimane e prodotto oltre 100 milioni di traiettorie (rollouts).

Secondo le tabelle di Reflection AI:

Benchmark valutatoBeamNemotron 3 UltraGLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
SWE-bench Verified80,970,7————
SWE Bench Pro v165,546,4——67,7—
Terminal Bench v2.180,156,488,288,386,690,6
DeepSWE v1.144,4—61,068,051,074,2

Un trattino indica un punteggio non riportato nell’articolo. Reflection AI rivendica punteggi di ragionamento paragonabili a quelli di GLM-5.2 con un carico computazionale di inferenza da 3 a 4 volte inferiore, e riconosce che Kimi K3 resta superiore in termini di capacità grezza. Non è ancora possibile scaricare nulla: Beam è nelle fasi finali di valutazione e nei test avversariali (red-teaming), l’accesso anticipato richiede un’iscrizione, e i pesi, il rapporto tecnico, la scheda del modello e gli strumenti per sviluppatori sono promessi più avanti a ottobre.

🔗 Articolo di Reflection AI su Beam

MetaEncoder-30B, l’encoder decisionale che Meta pubblica senza annuncio

5 ottobre — Meta ha pubblicato su Hugging Face, sotto la sua organizzazione facebook, MetaEncoder-30B, senza che sia stato trovato un annuncio: il repository, creato il 30 settembre e modificato il 5 ottobre, contava soltanto due download al momento della nostra rilevazione. La scheda presenta un encoder multimodale «System One», il formato dei modelli decisionali di Jev: riceve un compito in linguaggio naturale (domanda, istruzione, descrizione dello stato, criteri) e un elenco di candidati, in testo con immagini e video di supporto, e assegna un punteggio a ciascun candidato. Poiché il compito e i candidati vengono codificati separatamente, il confronto si riduce a un prodotto scalare, e un indice dei vicini più prossimi può coprire milioni di candidati senza eseguire nuovamente il modello. MetaEncoder è un fine-tuning contrastivo di Muse Glimmer 30B, il modello agentico a pesi aperti rilasciato da Meta ad agosto, da cui eredita la licenza Apache 2.0; il download richiede l’accettazione di condizioni, e vLLM ne supporta l’esecuzione per testo e immagini.

Benchmark di valutazionePunteggio secondo la scheda del modelloMetrica utilizzata
JEVBench (originale / facile / difficile)0,9444 / 1,0000 / 0,7387Accuratezza
ImaJEV-Bench0,8958Accuratezza
NanoBEIR0,6632NDCG_linear@10
MMEB-V3 (immagine / video / documenti visivi)0,7897 / 0,6046 / 0,8138Hit@1 / Hit@1 / NDCG@5

🔗 Scheda di MetaEncoder-30B su Hugging Face

Living Models combina Gemma 4 e BOTANIC-1 per decodificare il DNA delle piante

5 ottobre — Google mette in evidenza, in un X Article di @GoogleAI e nella sua vetrina Gemmaverse, il lavoro di Living Models, un laboratorio di biologia IA con sede a Parigi. Gemma 4 E4B orchestra l’analisi (pipeline nel terminale, filtraggio dei dati, chiamate agli strumenti), in locale tramite Ollama su una sola GPU NVIDIA L4, mentre BOTANIC-1, un modello di fondazione genomico preaddestrato su 320 specie vegetali, valuta l’effetto delle mutazioni; i genomi proprietari rimangono on-premise. Il caso di studio riprende una scoperta condotta all’INRAE da Adnane Boualem: una sola lettera modificata nel gene CmEIN3 del melone trasforma il fiore da femminile a ermafrodita. Tra le 2 494 mutazioni puntiformi candidate, la mutazione convalidata risulta prima, senza ex aequo, in meno di quattro minuti secondo l’X Article.

Configurazione testata (20 esecuzioni)Recall@1
Senza guida0,00
Guida esperta0,15
Con il punteggio di BOTANIC-10,90

I modelli Botanic1 (da 0,3 a 2 miliardi di parametri) e il preprint bioRxiv risalgono all’inizio di settembre: la novità è questa presentazione da parte di Google e il dettaglio dei risultati.

🔗 X Article di Google AI 🔗 Pagina Gemmaverse di Google DeepMind


Pubblicità in ChatGPT: un formato visivo in fase di test e una misurazione ampliata

5 ottobre — OpenAI prepara un formato pubblicitario visivo per ChatGPT: le immagini mostreranno l’ispirazione attorno a un prodotto, il suo utilizzo o l’esperienza che rende possibile. Il primo test avrà luogo durante la generazione di immagini, con annunci chiaramente etichettati e separati dall’immagine in fase di creazione; inizierà più avanti questo mese negli Stati Uniti, con un primo gruppo di inserzionisti. OpenAI ricorda che la pubblicità non influenza le risposte di ChatGPT, che secondo l’azienda raggiunge 1,2 miliardi di persone ogni settimana.

La maggior parte degli annunci riguarda la misurazione: invio delle conversioni tramite Hightouch, Tealium e LiveRamp, dieci partner di attribuzione nominati (tra cui AppsFlyer, Adjust e Triple Whale), esperimenti geografici di incrementalità con Haus, Measured e WorkMagic, finestra di conversione post-impression di un giorno nei report e indicatore di qualità dei segnali (Event Quality Score). Sul fronte della brand safety, gli inserzionisti idonei possono escludere espressioni (Negative Phrases), e sono in preparazione progetti pilota di valutazione con DoubleVerify e Integral Ad Science. Il pixel e la Conversions API esistono già dal 5 maggio.

Risultato pubblicato da OpenAIValore pubblicatoMisurazione effettuata da
Costo per acquisizione di WeightWatchers rispetto al suo benchmark di ricerca a pagamento−15,3 %DV Rockerbox
Acquisti incrementali del marchio Dose effettuati da nuovi clienti67 %WorkMagic
Visitatori di Portland Leather provenienti da ChatGPT Ads e nuovi per il marchio93 %Triple Whale

🔗 Articolo di OpenAI sul nuovo formato pubblicitario 🔗 Articolo del blog Ads sulla misurazione


Changelog di Perplexity del 5 ottobre: estensione del browser per Computer, Wiley e Stripe Projects

5 ottobre — Perplexity pubblica un changelog del prodotto con 18 voci, senza rilanci su X al momento della nostra rilevazione. Otto riprendono annunci già trattati (Automations, Claude Opus 5.5, generazione video, Skills American Express, Portable Computer su AMD, Fast Search, Profiles dell’Agent API, Claude Fable 5.1), una nona aggiunge spiegazioni 3D interattive ai grafici del 1° ottobre e nove novità sono inedite:

Novità ineditaPiattaforma o versioneUtenti interessati
Estensione per Chrome, Edge o Brave, che consente a Computer di usare il browser (Comet resta l’opzione predefinita)Perplexity per Mac 26.38.0 e successiveNon specificato
Attività di Computer in schede e finestre separatePerplexity per Mac 26.37.1 e successiveNon specificato
Modalità di elaborazione (Light, Standard, High, Ultra) su dispositivi mobiliiOS 26.38.0 e Android 2.100.0, e successivePro, Max, Enterprise Pro, Enterprise Max
Riviste e libri di Wiley senza un abbonamento Wiley separatoPerplexity e ComputerTutti i piani, quote premium variabili
GPT-6.1 Sol, che alimenta anche il livello di elaborazione Light di Computer al posto di GPT-6 SolPerplexity e ComputerAbbonati a pagamento idonei
Conversazione guidata per avviare una prima attività di ComputerWebNuovi account gratuiti
Collegamento di un’applicazione dall’area di inserimento (Collega un’app)Computer sul WebNon specificato
Connettore DocSend per le data room dedicate agli investimenti (deal rooms)ComputerAccount DocSend idoneo
Stripe Projects: chiave dell’API Perplexity creata dalla CLI di StripeCLI di StripeSviluppatori dell’API Perplexity

Con Stripe Projects, un comando crea o collega il progetto, genera la chiave e la scrive nel file .env, una configurazione che Perplexity propone di affidare a Claude Code, Cursor o Codex.

🔗 Changelog di Perplexity del 5 ottobre


Creazione generativa: Suno Albums e HyperFrames Studio di HeyGen

Suno aggiunge gli album

5 ottobre — Suno aggiunge gli album, finora assenti dalla sua piattaforma. Secondo il post che accompagna l’annuncio, la funzione trasforma i propri brani migliori in progetti completi (progetti di lunga durata), e una lista di riproduzione (playlist) che fungeva da album può ora essere convertita in Album. Suno presenta gli artisti dei primi cinque album: naenia (Oakwood///diskrot), Old Soul (Isaiah Wallace), phenomenal (KakerMix///diskrot), Lost In a Dream (Dream Relic) e VOID (ECHLO). L’azienda non specifica né i piani interessati, né il numero di brani per album, né la data esatta di attivazione. A giugno, Suno aveva già chiesto alla propria comunità informazioni sull’esperienza di ascolto, tra playlist, album e radio.

🔗 Annuncio di Suno su X 🔗 5 album da non perdere, blog di Suno

HyperFrames Studio, l’editor video di HeyGen progettato per gli agenti

5 ottobre — HyperFrames, il framework open source di HeyGen che trasforma il codice HTML in video, diventa un’applicazione desktop. HyperFrames Studio si presenta come un editor video costruito da zero per gli agenti: si descrive il video desiderato, l’agente (Claude Code, Codex o un agente sviluppato internamente) fornisce un primo montaggio, poi la persona e l’agente lavorano sulla stessa linea temporale (timeline). La direzione si impartisce con gesti anziché con prompt: cerchiare un elemento dell’immagine, appuntare un commento a una parola o effettuare personalmente un taglio. L’applicazione esporta in 4K e dichiara di offrire centinaia di spunti e modelli; è gratuita secondo l’account HyperFrames su X, e al download è disponibile solo una versione macOS. Prosegue il lavoro dell’anteprima Studio Preview di luglio, che consentiva già di modificare visivamente un video generato tramite codice.

🔗 Annuncio di HyperFrames Studio 🔗 Rilancio di HeyGen


Notizie brevi

  • Warp Factories verso la disponibilità generale — In un post del 3 ottobre sul proprio seminario autunnale, Warp indica che Warp Factories, la sua infrastruttura di agenti, sta passando dall’accesso anticipato alla disponibilità generale, senza indicare date o prezzi; il team afferma di aver ridotto del 70 % il costo per PR nell’ultimo mese grazie al suo utilizzo. 🔗 fonte
  • Note di rilascio di Devin del 2 ottobre — Le impostazioni di accesso di Microsoft Teams vengono ora applicate, un clic seleziona tutti i rilievi di sicurezza con lo stesso livello di gravità (API v3 compresa) e i plugin proposti mostrano skills, MCP, hooks e regole prima dell’installazione; la creazione degli ambienti su grandi repository Perforce dispone di 3 ore invece di fallire dopo 10 minuti. 🔗 fonte
  • MCP TikTok Ads in Replit — Replit aggiunge TikTok Ads al proprio catalogo di oltre 450 integrazioni: una volta collegato l’account, il suo Agent può creare e gestire annunci TikTok, raggiungere il pubblico e misurare le performance dall’area di lavoro, senza consumare crediti per il collegamento. 🔗 fonte
  • Cockle Finance su Replit — Replit mette in evidenza un video su Cockle Finance, il cui strumento è stato costruito su Replit da Dan e suo padre Steve per monitorare l’afflusso di clienti; secondo Replit, Dan ha fatto crescere la propria attività del 15 % in tre mesi, senza specificare la metrica. 🔗 fonte
  • Copilot CLI 1.0.92 nella versione stabile — Questa versione riunisce le novità delle versioni preliminari da 1.0.92-0 a -5; l’unica novità inedita riguarda l’accesso con Microsoft Entra, dopo il quale l’utente sceglie l’account da usare, /logout chiude queste sessioni OAuth e i server MCP protetti da Entra rinnovano le proprie credenziali senza intervento. 🔗 fonte
  • Codex CLI 0.160.1 — Questa correzione della 0.160.0 contiene un solo backport: le variabili Windows SYSTEMROOT, TEMP e TMP vengono conservate all’avvio di server MCP stdio remoti il cui ambiente remoto è configurato esplicitamente; è l’ultima versione stabile, dato che non è stata pubblicata alcuna 0.161.0 stabile. 🔗 fonte
  • Nightly di Gemini CLI del 5 ottobre — Non contiene alcuna modifica: costruita sullo stesso commit di quella del 3 ottobre, differisce solo per i numeri di versione, e i canali stabile (v0.62.0) e di anteprima (v0.63.0-preview.0) restano invariati. 🔗 fonte
  • SDK TypeScript di SpaceXAI 0.2.1 — Pubblicata il 2 ottobre, questa versione aggiunge toJson(schema), che convalida l’output strutturato con un validatore Standard Schema (Zod, Valibot o ArkType), e l’opzione retryBeforeOutput, che ritenta una richiesta in flusso continuo (streaming) fallita prima di produrre qualsiasi output; un 429 senza header Retry-After comporta ora un’attesa a partire da un secondo, fino a 30 secondi, anziché da 250 millisecondi. 🔗 fonte
  • Cresta Conductor sul Claude Agent SDK — Nella serie di Anthropic dedicata alle startup che costruiscono con Claude, Cresta presenta Conductor, uno strumento per creare agenti di assistenza clienti in linguaggio naturale costruito sul Claude Agent SDK; secondo Cresta, ha ridotto di circa la metà il tempo di implementazione iniziale nei primi casi d’uso, senza indicare date di disponibilità o prezzi. 🔗 fonte
  • npm: scadenza delle configurazioni di pubblicazione attendibile — Dal 2 ottobre, una configurazione di pubblicazione attendibile (trusted publishing) che non è stata usata per alcuna pubblicazione scade 48 ore dopo la creazione, e npm rifiuta anche i token provenienti dagli eventi issue_comment di GitHub Actions, come già avviene per pull_request_target. 🔗 fonte
  • npm: la pubblicazione in attesa crea pacchetti — Dal 2 ottobre, npm stage publish può creare un pacchetto che non esiste ancora, con una sessione locale o un token granulare, anche limitato alla messa in attesa (stage-only); la prima versione attende la promozione da parte di un maintainer prima di poter essere installata. 🔗 fonte
  • Agent API di Perplexity su Fast Search — I preset low, medium e high dell’Agent API usano ora Fast Search per lo strumento web_search, passando da 2,50 a 1 dollaro per 1 000 invocazioni e risultando circa 800 ms più veloci; il preset xhigh mantiene la ricerca standard. 🔗 fonte
  • Guida RAG di Perplexity — Perplexity pubblica una guida con nove esempi di generazione aumentata tramite recupero (retrieval-augmented generation, RAG) e sette architetture, citando il proprio indice web e la propria funzione Instant Buy accanto a esempi di terze parti come Zendesk o GitHub Copilot; nessuna novità di prodotto. 🔗 fonte
  • Personale di Cohere — Secondo Cohere, l’azienda è passata da circa 400 dipendenti all’inizio del 2026 a oltre 800 oggi, cifra fornita in un messaggio di reclutamento. 🔗 fonte
  • IsoVGRBench e Logbook in Meta — Senza annunci, facebookresearch pubblica il codice di IsoVGRBench, che valuta i modelli di ricompensa video su 16 000 coppie che differiscono per un solo aspetto (di fronte alla stessa clip con i fotogrammi mescolati, questi modelli rispondono quasi a caso), e quello di Logbook, dedicato agli eventi in registrazioni audio molto lunghe. 🔗 fonte
  • FiftyOne legge i dataset LeRobot v3 — Secondo un post della comunità di Harpreet Sahota, il toolkit open source FiftyOne legge ora nativamente il formato LeRobot v3, senza convertitori né copie dei video; la dimostrazione riguarda 497 episodi tratti dai 50 tipi di robot del dataset della comunità di LeRobot. 🔗 fonte
  • FetchMan-data di Ai2 — Pubblicato il 1° ottobre senza annunci, questo dataset raccoglie 352 696 episodi simulati (52 milioni di fotogrammi, 902 istruzioni) di presa di oggetti da parte di un umanoide Unitree G1, generati in MolmoSpaces, nel formato LeRobot v3 e con licenza ODC-BY. 🔗 fonte
  • P(doom) sui profili Hugging Face — Gli utenti dell’Hub possono mostrare sul proprio profilo il loro P(doom), la loro stima della probabilità che l’IA provochi una catastrofe esistenziale; le risposte alimentano un’indagine di cui saranno pubblicati solo risultati aggregati e anonimizzati, tra due settimane. 🔗 fonte
  • Estensione hf-image — Hugging Face rende disponibile, senza annunci, un’estensione della propria CLI che costruisce, carica, scarica e avvia immagini di container sul suo registro cr.hf.co; i layer non compressi vengono deduplicati da Xet, per cui un layer di 2 Go modificato per 100 Mo invia solo circa 100 Mo secondo il README. 🔗 fonte
  • Tre esperimenti di Milos Kotlar — In tre post della comunità, Milos Kotlar rende la cache KV di un piccolo transformer 2,71 volte più compatta con il 97,85 % di concordanza sul token successivo, e riduce la quota di token senza esperto in un routing MoE dal 13,84 % all’8,09 %, senza alcun guadagno di velocità. 🔗 fonte
  • Audit di un giudice LLM di Stephen Yu — Stephen Yu ha sottoposto ad audit, su 38 400 campioni, il giudice GLM-5.3 che valuta la fedeltà ai fatti nella ricompensa GRPO del suo modello di riscrittura da 12B: affidabile nell’individuare che un fatto è cambiato, ma rumoroso nel valutarne la gravità; contare gli output errati rivela una diminuzione del 39 % che il primo conteggio nascondeva. 🔗 fonte
  • Simposio di Sakana AI a Tokyo — Sakana AI apre le iscrizioni a un simposio gratuito il 26 ottobre presso la Hitotsubashi Hall di Tokyo, in inglese, con una conferenza di Jürgen Schmidhuber e un colloquio con David Ha, CEO di Sakana AI. 🔗 fonte
  • Startup NVIDIA Inception e tumore al seno — NVIDIA presenta quattro startup del proprio programma Inception che applicano l’IA al percorso di cura, tra cui iSono Health e il suo ecografo 3D ATUSA autorizzato dalla FDA (circa due minuti per seno contro un massimo di 45 minuti manualmente), Whiterabbit.ai, Ataraxis AI e SimBioSys; alcune di queste tecnologie non sono approvate dalla FDA. 🔗 fonte

Che cosa significa

La provenienza del testo diventa un obbligo normativo. Finora, la tracciabilità dei contenuti generati riguardava soprattutto immagini e audio, con filigrane e metadati verificabili; l’AI Act estende il requisito al testo, e OpenAI risponde per fasi: filigrana applicata automaticamente al testo di ChatGPT e Codex nell’Unione europea, semplice opzione nell’API, rilevatore riservato a organizzazioni approvate. I dati pubblicati spiegano questa prudenza: circa il 95 % dei passaggi di 400 token viene rilevato su contenuti di tipo psicologico, con un obiettivo dell’1 % di falsi positivi, ma su passaggi di 400 token in inglese, sostituire il 10 % delle parole con sinonimi riduce il rilevamento da circa il 92 % al 66 %, e una riscrittura o una traduzione può cancellare la filigrana. La filigrana fornisce un indizio di provenienza, non una prova, e la sua assenza non dice nulla sull’autore.

La memoria degli agenti prende piede e comincia a standardizzarsi. Devin conserva le proprie lezioni in un repository Git di file Markdown che Dreaming riorganizza ogni giorno, e Cognition ne pubblica il formato con licenza MIT affinché altri agenti lo adottino; North 2 conserva il contesto da una sessione all’altra; Qwen Code collega Mem0 direttamente alla propria CLI. Gli approcci differiscono, tra file versionati leggibili da una persona, servizio di memoria esterno e funzione integrata in una piattaforma, ma rispondono allo stesso bisogno: evitare che un agente riparta da zero a ogni sessione. La scelta di Cognition ha un vantaggio pratico: ogni nota rimanda alla sessione in cui è stata appresa, si può consultare nell’interfaccia e conserva la propria cronologia Git, permettendo di leggere e correggere ciò che l’agente ha memorizzato.

I modelli aperti entrano negli strumenti di sviluppo attraverso più canali. Together Link li collega ad agenti esistenti, compresi Claude Code e Codex, dichiarando una spesa ridotta di oltre la metà; IBM fa funzionare la versione self-hosted di Bob su Nemotron 3 Ultra per le aziende che mantengono lo sviluppo sulla propria infrastruttura, fino agli ambienti disconnessi; Reflection AI presenta Beam come un modello aperto progettato per il codice e le attività agentiche, con 80,9 su SWE-bench Verified secondo le proprie tabelle. L’argomento comune riguarda meno il punteggio grezzo, dove Reflection AI riconosce che Kimi K3 resta davanti, e più il costo, la latenza e il controllo dei dati.

Molti dei numeri di oggi provengono da chi li pubblica. GitHub ha progettato ReviewBench e prodotto la classifica iniziale in cui Copilot code review è al primo posto, senza esecuzione né verifica da parte degli altri produttori; la latenza di Nemotron 3 Ultra proviene da test interni di IBM; i risparmi di Together Link e i risultati pubblicitari di ChatGPT sono quelli dichiarati da Together AI e OpenAI. GitHub pubblica tuttavia il proprio dataset, il proprio giudice e la propria metodologia, e apre all’invio di risultati: ogni produttore può ripetere la misurazione con il proprio agente. È questo che permetterà di dire se la classifica iniziale regge.


Fonti