ai-powered-markdown-translatorArticolo tradotto dal francese all’italiano con gpt-6.1-sol.
Mercoledì 30 settembre, Google annuncia Gemini 4 Argon, un modello di frontiera distribuito inizialmente ai difensori cyber di fiducia del Fairwind Program, con un limite di output portato a 1 milione di token. OpenAI afferma di aver sventato una campagna coordinata di estrazione del ragionamento protetto dei suoi modelli, il cui nucleo attribuisce a individui associati a Moonshot AI. Cohere lancia Embed 5 con un proprio metodo di valutazione, Ideogram 4.5 promette ritocchi successivi senza artefatti e HeyGen rilascia un modello video basato su MiniMax H3; sul fronte degli sviluppatori, Claude Code 2.1.286, Zed 1.22.0 e VS Code 1.140 escono lo stesso giorno.
Gemini 4 Argon: il nuovo modello di frontiera di Google, inizialmente per i difensori cyber
30 settembre — Google annuncia Gemini 4 Argon, il suo nuovo modello di frontiera, in un post firmato da Koray Kavukcuoglu, vicepresidente senior di Google DeepMind e architetto capo dell’IA di Google (Chief AI Architect). Argon è progettato per supportare un ragionamento approfondito su flussi di lavoro lunghi e complessi (long-horizon workflows), in tre ambiti: l’ingegneria del software in condizioni reali, il lavoro intellettuale in azienda (diritto, finanza) e la cyberdifesa.
Il modello non è ancora aperto al pubblico. Viene distribuito inizialmente a un gruppo di difensori cyber di fiducia del Fairwind Program, lanciato il 2 settembre con Gemini 3.8 Flash Cyber, che lo ricevono, come i team interni di Google, senza misure di protezione cyber (cyber guardrails). Gli sviluppatori, le aziende e il grande pubblico seguiranno «appena possibile», a partire dai clienti paganti dell’API e dagli abbonati a Google AI Ultra, senza una data annunciata. Nel frattempo, Google rafforza il rifiuto delle richieste dannose in ambito cyber e NRBC, il monitoraggio della catena di pensiero e delle azioni del modello, e isola gli addestramenti e le valutazioni ad alto rischio in sandbox sigillate; l’azienda afferma inoltre di partecipare al processo volontario del governo statunitense per l’accesso ai modelli prima del loro rilascio.
Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.
🇮🇹 Ecco Gemini 4 Argon, il nostro nuovo modello di frontiera. È progettato per flussi di lavoro complessi nella programmazione, nel lavoro intellettuale in azienda e nella cyberdifesa, e viene distribuito da oggi a un gruppo di tester di fiducia tramite il nostro Fairwind Program. — @GoogleDeepMind su X
Il prezzo è già fissato: al lancio, 2 dollari per milione di token in input e 10 dollari in output, ossia la tariffa di GPT-6.1 Sol lanciato il giorno prima, poi 4 e 20 dollari al termine di un periodo la cui durata non è indicata; l’input in cache costa il 95 % in meno dell’input. Il limite di output passa a 1 milione di token, rispetto ai 64K precedenti, il più alto del settore secondo Google: il modello può produrre centinaia di migliaia di token in un’unica traiettoria per risolvere un problema difficile.
| Prezzo per milione di token | Tariffa di lancio | Tariffa dopo il periodo di lancio |
|---|---|---|
| Input | 2 dollars | 4 dollars |
| Output | 10 dollars | 20 dollars |
La pagina di Google DeepMind confronta Argon con GPT-6 Astra, Claude Fable 5.1 e Claude Opus 5.5 su diciannove righe. Argon ottiene il punteggio migliore in 13 di esse, condivide il primo posto con GPT-6 Astra su CWE-bench v1 (68 %) e viene superato in 5. Il codice agentico è l’ambito più conteso: primo su DeepSWE v1.1 (77,9 %) e su Vibe Code Bench, Argon si classifica ultimo dei quattro su FrontierSWE v2 e su Terminal-bench 4.0. Il suo vantaggio è netto nel lavoro intellettuale, in particolare sul Legal Agent Benchmark di Harvey (19,6 % contro un massimo del 6,7 % per gli altri tre), e nel contesto lungo tra 256K e 1M token. Il punteggio migliore di ogni riga è in grassetto.
| Benchmark valutato (ambito) | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index (lavoro intellettuale) | 68,9 % | 63,1 % | 65,8 % | 67,0 % |
| AutomationBench (lavoro intellettuale) | 51,3 % | 41,4 % | 31,4 % | 42,5 % |
| Vals Finance Agent v2 (lavoro intellettuale) | 65,4 % | 53,5 % | 58,9 % | 58,6 % |
| Legal Agent Benchmark di Harvey (lavoro intellettuale) | 19,6 % | 5,4 % | 6,7 % | 3,8 % |
| DeepSWE v1.1 (codice agentico) | 77,9 % | 74,1 % | 67,4 % | 74,2 % |
| FrontierSWE v2 (codice agentico) | 55,0 % | 65,5 % | 56,3 % | 62,3 % |
| Vibe Code Bench (codice agentico) | 91,9 % | 89,6 % | 90,3 % | 90,3 % |
| Terminal-bench 4.0 (codice agentico) | 57,4 % | 58,2 % | 57,9 % | 66,4 % |
| PostTrainBench (ingegneria ML) | 45,3 % | 44,3 % | 40,2 % | 49,3 % |
| Terminal-Bench Science 0.1 (scienze e matematica) | 57,6 % | 68,1 % | 52,6 % | 63,3 % |
| LABBench 2 (scienze e matematica) | 88,8 % | 85,4 % | 68,6 % | 73,1 % |
| RiemannBench (scienze e matematica) | 76,0 % | 72,0 % | 65,6 % | 69,6 % |
| GraphWalks BFS fino a 128K (contesto lungo, F1) | 99,7 % | 98,7 % | 91,4 % | 90,6 % |
| GraphWalks BFS da 256K a 1M (contesto lungo, F1) | 84,2 % | 71,8 % | 65,0 % | 66,8 % |
| Agent’s Last Exam (uso del computer) | 39,5 % | 34,2 % | — | 38,2 % |
| OSWorld-2.0, sottoinsieme offline, punteggio parziale (uso del computer) | 69,2 % | 72,6 % | — | — |
| Chartography (comprensione multimodale) | 71,6 % | 71,0 % | 46,2 % | 66,3 % |
| LVBench (comprensione multimodale) | 91,7 % | 87,5 % | 79,7 % | 83,7 % |
| CWE-bench v1 (cybersicurezza) | 68,0 % | 68,0 % | 58,0 % | 67,0 % |
In Google, migliaia di dipendenti lo usano già. Su libgav1, il decoder video open source di Google, alcuni agenti Argon hanno sostituito 32 000 righe di codice SIMD di un porting Rust esistente con Rust sicuro: il decoder ottenuto è 2,7 volte più veloce di quel porting, con un output video identico. Altri agenti hanno preparato ottimizzazioni della memoria per i data center che, una volta distribuite, dovrebbero liberare oltre 300 TiB. In ambito cybersicurezza, Wiz lo usa nella sua iniziativa Scan for Good: Argon ha scoperto, in un software sanitario utilizzato da ospedali di tutto il mondo, una vulnerabilità critica che esponeva dati personali sensibili e che i precedenti modelli di frontiera non avevano rilevato.
🔗 Gemini 4 Argon: la nostra prossima era di intelligenza di frontiera (blog di Google) 🔗 Pagina Gemini di Google DeepMind e tabella dei benchmark
OpenAI afferma di aver sventato una campagna di distillazione e ne attribuisce il nucleo a individui associati a Moonshot AI
30 settembre — In un post della sua sezione Security, OpenAI afferma di aver individuato e poi neutralizzato una campagna coordinata volta a estrarre il ragionamento protetto (protected reasoning) dei suoi modelli, ossia la traccia interna che un modello produce per svolgere un compito. L’azienda la considera una distillazione avversaria (adversarial distillation): l’uso sistematico e non autorizzato degli output o del ragionamento di un modello per addestrare, riprodurre o migliorare un altro modello.
Secondo OpenAI, gli operatori non hanno violato la crittografia, compromesso un database o avuto accesso diretto alle conversazioni memorizzate degli utenti. Hanno manipolato gli scambi affinché il ragionamento protetto riapparisse in una forma visibile, per esempio copiando il ragionamento cifrato di una conversazione per chiedere a un modello, in un’altra conversazione, di decifrarlo e trascriverlo. Ricercatori indipendenti avevano segnalato tramite divulgazione responsabile vulnerabilità simili, descritte nell’articolo «Sottrarre tracce di ragionamento dalle API di LLM proprietari» presentato su arXiv il 10 agosto; OpenAI conferma che questi percorsi di attacco erano reali.
| Fase della campagna | Data o volume rilevato da OpenAI |
|---|---|
| Inizio dell’attività, a basso volume | 1º luglio |
| Picchi di attività | 24 e 25 luglio |
| Richieste secondo lo schema di estrazione durante i picchi | 16 000, provenienti da oltre 4 000 utenti |
| Gruppo collegato a questo schema | oltre 15 000 utenti |
| Neutralizzazione completa del gruppo | 28 luglio |
Sull’attribuzione, il post resta prudente: non è accertato che tutti gli operatori facciano capo a uno stesso attore, e le 16 000 richieste dei picchi sono tentativi di estrazione, non necessariamente riusciti. OpenAI attribuisce tuttavia un nucleo dell’attività a individui associati a Moonshot AI, lo sviluppatore di Kimi.
… we attribute a core cluster of the activity to individuals associated with Moonshot AI …
🇮🇹 … attribuiamo un nucleo dell’attività a individui associati a Moonshot AI … — OpenAI, post della sezione Security
In risposta, OpenAI ha bandito o limitato gli account fraudolenti, inasprito i controlli sulle registrazioni e sull’infrastruttura, ampliato il monitoraggio delle reti collegate e rafforzato la protezione del ragionamento nascosto tra utenti, spazi di lavoro, organizzazioni e famiglie di modelli. Ha chiuso una via che consentiva di riproporre il ragionamento cifrato di un altro utente per recuperarne il contenuto, e ha aggiunto controlli che rilevano e trattengono un output in streaming (streaming) che potrebbe esporlo. I risultati sono stati condivisi tramite il Frontier Model Forum e canali governativi: secondo OpenAI, la tecnica non è specifica dei suoi modelli, e qualsiasi sistema che renda il ragionamento trasferibile o riproponibile può essere esposto a rischi simili. L’azienda presenta la distillazione avversaria come un rischio per la sicurezza dei modelli e la sicurezza nazionale, poiché un ragionamento estratto può servire ad addestrare un altro modello senza le misure di protezione dell’originale. Il tema non è nuovo: a febbraio, Anthropic aveva attribuito campagne di distillazione a DeepSeek, Moonshot AI e MiniMax, e dal 24 settembre Anthropic fattura le richieste bloccate in diverse categorie, tra cui l’estrazione del ragionamento.
🔗 Articolo «Sottrarre tracce di ragionamento dalle API di LLM proprietari» su arXiv
Embeddings: Cohere lancia Embed 5 e la metrica RCP-nDCG@10, Perplexity pubblica pplx-embed-v2-context-9b-preview
30 settembre — Cohere lancia Embed 5, una famiglia di modelli di embeddings per la ricerca aziendale, in due fasce che condividono lo stesso spazio di embeddings: Embed 5 Pro, per la massima qualità e l’indicizzazione offline, ed Embed 5 Fast, per la ricerca interattiva, il RAG ad alto volume e la ricerca agentica. È possibile indicizzare un corpus con Pro e poi interrogarlo con Fast senza reindicizzare nulla, a condizione di mantenere la stessa dimensione di output: su 40 dataset di sviluppo, questa configurazione raccomandata da Cohere conserva in media il 98,4 % della qualità di un sistema interamente basato su Pro, contro il 96,6 % di un sistema interamente basato su Fast.
I due modelli leggono fino a 128K token, accettano testo, immagini o entrambi fusi in un unico vettore, coprono oltre 100 lingue e producono vettori da 256 a 2 048 dimensioni in float, int8 o formato binario. Cohere consiglia 1 024 dimensioni in int8, ovvero 1 Ko per vettore contro 8 Ko in float32 a 2 048 dimensioni. Pro costa 0,12 dollari per milione di token di testo e Fast 0,08 dollari, un terzo in meno, con un throughput documentale mediamente 2,4 volte superiore; le immagini vengono fatturate a 0,40 dollari per milione di token per entrambi. Embed 5 è disponibile da oggi tramite l’API Cohere, Model Vault, Microsoft Foundry e Amazon SageMaker, oltre che in North, e può essere distribuito in ambienti privati con vLLM.
| Benchmark (metrica) | Embed 5 Pro | Embed 5 Fast | Altri modelli citati |
|---|---|---|---|
| ViDoRe V3, 8 domini (RCP-nDCG@10) | 85,8 | 84,5 | Voyage 4 Large 83,7 ; Gemini Embedding 2 83,2 ; OpenAI text-embedding-3-large 75,5 |
| FinanceBench (RCP-nDCG@10) | 80,1 | 80,0 | Pro 21,4 punti davanti a OpenAI text-embedding-3-large |
| FinQA (RCP-nDCG@10) | 90,0 | 88,8 | — |
| ViDoRe V3 Finance (RCP-nDCG@10) | 85,0 | 83,9 | — |
| PDF analizzati, media della suite (RCP-nDCG@10) | 84,8 | 83,4 | Voyage 4 Large 83,6 ; Gemini Embedding 2 80,8 ; Embed 4 78,6 |
| Testo e immagine fusi, 5 dataset (nDCG@10) | 82,3 | 81,2 | Gemini Embedding 2 61,3 |
| Immagine di pagina, 5 dataset finanziari (nDCG@10) | 77,0 | 73,2 | Embed 4 71,1 ; Voyage Multimodal 3.5 70,1 ; Gemini Embedding 2 56,7 |
| 5 lingue europee (nDCG@10 o RCP-nDCG@10) | 77 | — | Voyage 4 Large 76 ; Gemini Embedding 2 73 |
La maggior parte di questi punteggi è espressa in RCP-nDCG@10, il metodo di valutazione che Cohere pubblica lo stesso giorno (vedi sotto): una nota del post precisa che riordina un insieme fisso di candidati e misura quindi la qualità del ranking anziché il recupero di primo livello. Il secondo prospetto multilingue merita una lettura completa: Cohere vi sottolinea i progressi rispetto a Embed 4, fino a 13 punti in farsi, ma su queste dieci lingue Gemini Embedding 2 supera Embed 5 Pro in nove, con il cinese come unica eccezione, e Voyage 4 Large lo supera in cinque. Cohere presenterà Embed 5 durante una sessione su X l’8 ottobre.
🔗 Post di Cohere su Embed 5 · Annuncio di @cohere su X
RCP-nDCG@10, la metrica con cui Cohere misura Embed 5
30 settembre — Cohere pubblica anche RCP-nDCG@10 (Rubric-Calibrated Preferences nDCG@10), il suo metodo di valutazione della ricerca. Il punto di partenza: nDCG, la metrica di MTEB e BEIR, confronta i risultati con un elenco di documenti annotati in anticipo, inevitabilmente incompleto, per cui un documento pertinente mai annotato non contribuisce al punteggio; nello studio di Cohere, il 28 % dei documenti contrassegnati come non pertinenti viene invece giudicato utile da valutatori umani. RCP-nDCG@10 affida la valutazione a un giudice IA calibrato, che risponde a cinque domande sì/no identiche per ogni query e confronta i documenti in gruppi. Validazione alla cieca con 46 annotatori su 289 confronti a coppie: quando le due metriche indicano vincitori diversi, i valutatori umani danno ragione a RCP-nDCG nel 70 % dei casi. L’articolo, il codice e i dati sono pubblicati, e il principale maintainer di MTEB ne annuncia l’integrazione. Cohere afferma di aver ottimizzato rispetto a questa metrica la quinta generazione di Embed e Rerank, quest’ultima ancora senza una data, e avverte che questi modelli non risulteranno sempre i migliori secondo il solo nDCG storico.
🔗 Post di Cohere su RCP-nDCG@10 · Codice e dati su GitHub
Perplexity pubblica pplx-embed-v2-context-9b-preview e il benchmark context-bench
30 settembre — Perplexity pubblica in anteprima, con licenza MIT su Hugging Face, pplx-embed-v2-context-9b-preview, un modello di embeddings contestuali: ogni frammento di un documento viene codificato tenendo conto dell’intero documento, affinché un passaggio che dice «lei» rimanga associato all’entità corretta. Anziché da un solo frammento «di riferimento» (gold passage) per query, il modello apprende da un insegnante, il modello di compressione del contesto di Perplexity, che assegna un punteggio a ogni token del documento: impara così a ritrovare la risposta e i passaggi che la giustificano. Valutato alla cieca su context-bench, un benchmark privato di turbopuffer, cofirmatario del post (2 099 query, 38 894 documenti), supera voyage-context-4; su ConTEB ottiene la media migliore senza vincere in tutte le attività. Perplexity avverte che i pesi e l’interfaccia possono ancora cambiare, e prepara l’accesso tramite la propria API, senza una data.
| Misura pubblicata da Perplexity | pplx-embed-v2-context-9b-preview | Differenza rispetto a voyage-context-4 |
|---|---|---|
| Recall delle risposte su context-bench, a K = 10 | 45,5 % | +14,4 punti |
| Recall delle evidenze su context-bench, a K = 10 | 40,6 % | +5,0 punti |
| Spazio di archiviazione per vettore (1 024 dimensioni, int8) | 1 Ko | 8 volte meno di voyage-context-4 in float32 |
🔗 Post di Perplexity Research · Modello su Hugging Face
Ideogram 4.5: un modello di editing delle immagini pensato per ritocchi successivi
30 settembre — Ideogram lancia Ideogram 4.5, che presenta come «il modello di editing più preciso». La constatazione di partenza: a ogni ritocco, i modelli di immagini aggiungono artefatti, spostamenti di pixel e derive cromatiche, tanto che un’immagine diventa rapidamente inutilizzabile dopo diversi passaggi. Ideogram 4.5 è progettato per eliminare questo accumulo e rendere possibile l’editing in più turni (multi-turn editing).
Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.
🇮🇹 Ecco Ideogram 4.5, il modello di editing più preciso. A ogni ritocco, i modelli più avanzati aggiungono artefatti, spostamenti di pixel e cambiamenti di colore. Ideogram 4.5 elimina l’accumulo di artefatti, rendendo possibile l’editing in più turni. Disponibile in Ideogram, nell’API e presso i partner di lancio. Pesi aperti a breve. — @ideogram_ai su X
Per sostenere questo punto, Ideogram pubblica un confronto affiancato degli stessi ritocchi successivi con GPT Image 2.5 Sunburst, Nano Banana Pro e Nano Banana 2, i cui output diventerebbero, secondo l’azienda, inutilizzabili dopo pochi ritocchi. Il confronto è visivo, senza punteggi numerici. Gli esempi coprono il colore e l’illuminazione (ombre, riflessi e alte luci seguono il cambiamento senza alterare la composizione), la modifica del testo, la fotografia di prodotto, l’arredamento d’interni, il restauro graduale di vecchie foto, il passaggio da uno schizzo o da una mappa di profondità a un’immagine e il ritaglio.
Il modello introduce anche l’editing a qualsiasi risoluzione (Zoom editing): una zona di un’immagine ad alta definizione, da 24,2 megapixel (4 016 × 6 016 pixel) nell’esempio di Ideogram, viene ritoccata senza ridurre l’immagine, preservandone i bordi per reintegrarla senza giunzioni visibili. Pur essendo pensato per l’editing mirato, il modello si comporta molto bene anche nell’editing generale, secondo Ideogram.
| Elemento dell’annuncio | Cosa sappiamo |
|---|---|
| Disponibilità | dal 30 settembre in Ideogram e nell’API |
| Partner di lancio | Pika e Luma, che lo annunciano lo stesso giorno |
| Pesi aperti | promessi «a breve», come quelli di Ideogram 4.0 pubblicati a giugno |
| Prezzo | non pubblicato |
🔗 Pagina del modello Ideogram 4.5
HeyGen Video: un modello video basato su MiniMax H3, accessibile tramite API
30 settembre — HeyGen lancia HeyGen Video, un modello di generazione video destinato alle aziende che vogliono un video di qualità professionale senza sostenerne il costo. Basato su MiniMax H3 e sottoposto a post-training da HeyGen, produce un video a partire da un testo o da un’immagine, con l’audio generato nella stessa chiamata, ed è utilizzabile tramite l’API di HeyGen e su OpenRouter, Runware e ComfyUI.
Sul fronte dei prezzi coesistono tre cifre. Il prezzo parte da 0,01 dollari al secondo fino alla fine di ottobre, con uno sconto del 50 % sul prezzo standard di 0,02 dollari, secondo la pagina del catalogo. La sua tabella comparativa riporta invece il prezzo di listino in 768p con audio, prima delle promozioni di lancio: 0,03 dollari al secondo. Anche a questo prezzo, HeyGen Video è il più economico tra i modelli confrontati.
| Modello confrontato | Prezzo di listino al secondo (768p, audio) | Elo interno di HeyGen (HeyGen Video = 1 000) |
|---|---|---|
| HeyGen Video | 0,03 dollar | 1 000 |
| Seedance 2.0 | 0,303 dollar | 955 |
| H3 Max | 0,08 dollar | 952 |
| H3 Max Turbo | 0,04 dollar | 920 |
| H3 Max balanced | 0,08 dollar | 860 |
| Kling 3.0 Pro | 0,168 dollar | 857 |
| Veo 3.1 | 0,40 dollar | 744 |
Per la qualità, HeyGen si basa su una valutazione interna condotta su query di Artificial Analysis Arena (4 800 voti), con un Elo normalizzato a 1 000 per il proprio modello. Nel confronto alla cieca con H3 Max, il 55,8 % dei 650 voti esprime una preferenza per HeyGen Video, in un intervallo dal 49 al 62 % che non esclude la parità. Per una clip di 10 secondi da immagine a video, il tempo di inferenza del diffusion transformer scende a 3,7 secondi, contro 4,1 per H3 Max Turbo e 8,3 per H3 Max, escluso il tempo di generazione delle didascalie.
MiniMax ha accolto con favore il lancio e ha messo in evidenza lo stesso giorno un altro modello derivato da H3: Boreal-H3 di Creatify, un modello video ottimizzato per la pubblicità.
🔗 Catalogo di HeyGen Video · Annuncio di @HeyGen su X
Assistenti e agenti generalisti: le skills di Gemini, Manus Flex e Grok Bot
L’applicazione Gemini lancia le skills, che sostituiranno le Gems
30 settembre — Google lancia le skills nell’applicazione Gemini: istruzioni salvate una sola volta, richiamate digitando una barra obliqua seguita dal loro nome. Gemini può anche crearle a partire dalle conversazioni e avviarle autonomamente quando un prompt corrisponde, più skills possono essere combinate e ciascuna può includere file di riferimento (testo semplice, PDF, immagini). Già presenti in Gemini Spark, arrivano nella chat di Gemini in tutto il mondo, per tutti i livelli di abbonamento Google AI e, per il momento, per gli utenti dai 18 anni in su; i clienti Workspace seguiranno nelle prossime settimane. Le skills sostituiranno le Gems, che scompariranno a partire da novembre per gli account personali, a marzo 2027 per Workspace business, enterprise e nonprofit e a giugno 2027 per il settore dell’istruzione, con una migrazione automatica. Anche Opal, lo strumento per creare miniapplicazioni, chiuderà a novembre, così come le «Gems by Google Labs», che non verranno migrate.
🔗 Lascia che le skills di Gemini si occupino delle tue attività più ripetitive (blog di Google)
Manus Flex: la propria chiave API nell’agente Manus
29 settembre — Manus lancia Manus Flex, che permette di alimentare Manus con la chiave API di un provider di inferenza supportato (bring your own API key). Finora Manus sceglieva autonomamente il modello e forniva l’harness e l’infrastruttura dell’agente; con Flex, la chiave di un provider alimenta gli stessi progetti, strumenti, ambienti di esecuzione e flussi di lavoro dell’agente, con un modello principale e un livello di sforzo di ragionamento a scelta. La fatturazione è ripartita: l’inferenza viene fatturata direttamente dal provider, mentre gli altri servizi e l’infrastruttura utilizzati da un’attività continuano a consumare crediti Manus. OpenRouter, Fireworks e Modal sono i primi tre membri del programma di partnership per l’inferenza (Manus Flex Inference Partner Program). Il post, pubblicato il giorno dopo il lancio di Manus 2.0, non indica né un piano, né un prezzo, né un elenco di modelli.
Grok Bot affida il codice a Cursor e gestisce le pull requests
30 settembre — Due giorni dopo Team Bots, SpaceXAI potenzia Grok Bot per lo sviluppo software. In un thread dell’account @bot, l’azienda annuncia che i suoi Bots possono affidare attività di programmazione a Cursor, gestire le pull requests grazie a plugin GitHub e Origin (quest’ultimo non viene descritto) e condividere dimostrazioni video di ciò che realizzano. SpaceXAI pubblica anche, sotto forma di modelli da installare (templates), i Bots del proprio team di ingegneria, ciascuno fornito con le proprie skills, routine e connettori. Il thread non specifica né un piano, né un prezzo, né una data, e non è accompagnato da alcun post su x.ai. Il legame con Cursor non è nuovo: Grok Bot for Enterprise era stato offerto per due settimane ai clienti Grok e Cursor Enterprise all’inizio di settembre; ciò che cambia è che un Bot delega autonomamente il lavoro di programmazione.
Robotica e modelli del mondo: Praxis-1 di Runway, MolmoAct 2 di Ai2 e Physis-Lang di NVIDIA
Runway presenta Praxis-1, un modello d’azione del mondo a pesi aperti
30 settembre — Runway presenta Praxis-1, il suo primo modello d’azione del mondo (world action model) a pesi aperti, destinato a controllare robot reali. Si basa sullo stesso preaddestramento video dei suoi modelli del mondo, come Solaris o GWM Worlds 2, e si propone come modello di policy generalista per sviluppatori e ricercatori di robotica. La scommessa di Runway: le dimostrazioni robotiche sono rare, i video quasi illimitati. Nelle sue dimostrazioni, la stessa policy passa da uno studio a una cucina senza riaddestramento. Nulla è ancora scaricabile: Praxis-1 è in fase di test presso Noble Machines, Standard Bots e Ultra, ciascuno sul proprio hardware, e il rilascio pubblico, pesi compresi, è annunciato per i prossimi mesi.
| Misura pubblicata da Runway | Risultato annunciato |
|---|---|
| Correlazione tra simulazione nel modello del mondo e risultati reali | 0,95 |
| Errore finale di posizionamento dopo il fine-tuning, con video web | 16,1 cm |
| Stesso errore con video di un robot teleoperato | 16,0 cm |
MolmoAct 2 di Ai2 in testa a Reality Check, dopo il fine-tuning da parte dell’organizzatore del benchmark
30 settembre — Ai2 annuncia che MolmoAct 2, il suo modello di robotica completamente aperto, si classifica primo per tasso di successo complessivo su Reality Check, un benchmark indipendente di manipolazione in condizioni reali, con una precisazione significativa: i modelli vengono sottoposti a fine-tuning dall’organizzatore, Poke & Wiggle, sui compiti del benchmark. Lanciato il giorno prima da questa società, Reality Check conta 14 400 esecuzioni su robot reali, su stazioni FR3 Duo installate al Deutsches Museum di Monaco, in dieci ambienti (smistare viti, collegare un connettore DC, aprire una cassetta degli attrezzi con un cacciavite…). Due ambiti restano «in arrivo»: oggetti collocati fuori dalla zona di addestramento e un mid-training su 100 ore di dati delle stazioni.
| Modello valutato | Successo complessivo | Successo dopo circa 10 dimostrazioni per ambiente | Successo dopo circa 300 dimostrazioni per ambiente |
|---|---|---|---|
| MolmoAct 2 | 28 % | 4 % | 44 % |
| Pi 0.5 | 21 % | 5 % | 33 % |
| DiT-Flow | 19 % | 2 % | 29 % |
| GR00T N1.7 | 12 % | 4 % | 19 % |
🔗 Tweet di Ai2 · Classifica Reality Check
Physis-Lang: didascalie che spiegano la fisica ai modelli del mondo
29 settembre — Ricercatori di NVIDIA, del MIT e dell’università di Oxford pubblicano Physis-Lang, un framework che aggiunge ragionamento fisico alle didascalie dei video per migliorare i modelli del mondo. Le didascalie rendono esplicite le cause, le leggi in gioco e gli effetti; un critico specializzato individua le affermazioni mancanti o non supportate, un agente perfeziona le istruzioni per la creazione delle didascalie e gli insuccessi del modello servono a cercare i video che ne colmeranno le lacune. Secondo NVIDIA, aggiungere questo ragionamento al solo prompt, senza riaddestramento, migliora di 5,62 punti il punteggio PhyGenBench di Cosmos 3. Con l’addestramento, Physis-Lang su Cosmos3-Super e Cosmos3-Nano occupa i primi due posti della classifica Physics-IQ Verified nella generazione da immagine a video (48,2 e 43,3, contro 42,7 del precedente miglior punteggio). PhyGenBench e VideoPhy-2 vengono valutati da GPT-5.5, e Veo 3.1 mantiene un leggero vantaggio sull’insieme completo di VideoPhy-2.
| Benchmark di fisica nei video | Cosmos3-Nano | Veo 3.1 | Physis-Lang su Cosmos3-Nano |
|---|---|---|---|
| PhyGenBench | 61,67 | 65,63 | 71,04 |
| Physics-IQ Verified | 40,23 | 34,99 | 43,41 |
| VideoPhy-2 Hard | 48,31 | 58,43 | 62,36 |
| VideoPhy-2, insieme completo | 60,41 | 68,87 | 68,02 |
🔗 Pagina del progetto Physis-Lang · Annuncio di @NVIDIAAI su X
Modelli aperti: Hunmin-397B-A17B-CUA e JEV-27B-VL
Hunmin-397B-A17B-CUA innesta le capacità di agente di Qwen-CUA su un MoE da 397 miliardi di parametri
30 settembre — Sul blog della community di Hugging Face, hojun Lee descrive Hunmin-397B-A17B-CUA, un modello per l’uso del computer (computer use) pubblicato con licenza Apache-2.0 dall’organizzazione mncai, con una riserva espressa dagli stessi autori: le valutazioni sono interne, con una sola esecuzione per i benchmark degli agenti, e non sono confrontabili con le classifiche pubblicate (il modello di base vi ottiene 48,16 su OSWorld, contro i 62,2 annunciati su OSWorld-Verified). Il modello si basa su Qwen3.5-397B-A17B, una miscela di esperti con 17 miliardi di parametri attivi, e l’intero progetto è stato realizzato su un unico nodo con otto B200. Il team ha calcolato la differenza tra i pesi del proprio modello di base e quelli di Qwen-CUA, già specializzato, e ne ha innestato soltanto una versione a rango ridotto su una selezione di moduli: questo solo trasferimento porta OSWorld-316 da 48,84 a 68,25, senza ereditare la debolezza di Qwen-CUA nel grounding visivo. Un fine-tuning seguito da apprendimento per rinforzo GRPO aggiunge 4,3 punti.
| Benchmark di valutazione (protocollo interno) | Base Qwen3.5-397B | Hunmin-CUA | Qwen-CUA (fonte) |
|---|---|---|---|
| OSWorld, 360 compiti | 48,16 | 70,45 | 77,12 |
| WindowsAgentArena, 153 compiti | 41,77 | 50,85 | 56,68 |
| ScreenSpot-Pro | 72,74 | 75,61 | 62,20 |
| KMMLU-Pro (coreano) | 77,91 | 76,12 | 71,41 |
🔗 Articolo su Hunmin-CUA · Pesi su Hugging Face
AutoTrust AI pubblica JEV-27B-VL, un modello decisionale aperto che valuta anche le immagini
30 settembre — AutoTrust AI pubblica con licenza Apache-2.0 JEV-27B-VL, la versione dotata di visione di JEV-27B, il suo modello decisionale aperto presentato il 27 settembre. Gli si mostrano immagini e testo, gli si pone una domanda e risponde in un solo passaggio con una probabilità calibrata per ogni opzione, in un centinaio di millisecondi; quando la domanda lo richiede, ragiona passo dopo passo osservando le immagini. Eppure la sua testa decisionale non ha visto alcuna immagine durante l’addestramento. Test principale: su MicroLens, un dataset pubblico di un’app di video brevi, ordina 20 video candidati per 200 utenti basandosi soltanto sulle miniature e ottiene un’AUC pari a quella di un filtraggio collaborativo addestrato su 59 045 utenti, con un tasso migliore di presenza del video giusto nella top 5. Gli autori ricordano che questo risultato proviene da un unico campione di 200 utenti.
| Metodo di raccomandazione su MicroLens | AUC | Video giusto nella top 5 |
|---|---|---|
| JEV-27B-VL, sole miniature, senza dati di interazione | 0,727 | 59 % |
| Filtraggio collaborativo addestrato su 59 045 utenti | 0,728 | 49 % |
| JEV-27B-VL, soli titoli | 0,649 | 46 % |
| Ordine casuale | 0,489 | 21 % |
Classifiche: l’Open TTS Leaderboard di Hugging Face e AURORA di LILT
Hugging Face lancia l’Open TTS Leaderboard, una classifica aperta della sintesi vocale
30 settembre — Hugging Face lancia l’Open TTS Leaderboard, una classifica della sintesi vocale (text-to-speech, TTS) incentrata sui modelli aperti e multilingue. L’Hub conta oltre 8 000 modelli TTS, ma le arene di voto di riferimento faticano a tenere il passo e sottorappresentano i modelli aperti: secondo l’articolo, soltanto 16 dei 92 modelli classificati da Artificial Analysis sono a pesi aperti. La classifica sostituisce quindi i voti con misure oggettive: l’intelligibilità (tasso di errore per parola o per carattere tra il testo richiesto e la sua trascrizione tramite Qwen3 ASR), la velocità (inferenza in batch e tempo prima del primo suono, su H200 e su processore) e la fedeltà di una voce clonata (similarità WavLM). Valutare un modello richiede poche ore anziché alcune settimane di voti. In inglese, sono in testa Kokoro-82M, supertonic-3 e s2-pro di Fish Audio; in ambito multilingue, OmniVoice, s2-pro e Fun-CosyVoice3-0.5B. Gli autori avvertono che non vengono misurate né la naturalezza né l’espressività e pubblicheranno i loro script di valutazione «presto».
🔗 Articolo sull’Open TTS Leaderboard · La classifica su Hugging Face
LILT lancia AURORA, una classifica multilingue dei compiti degli agenti
30 settembre — LILT lancia AURORA, una classifica che valuta i modelli di punta su compiti per agenti in lingue diverse dall’inglese, tutti progettati e verificati da esperti madrelingua, senza traduzione automatica. Al lancio comprende quattro benchmark: un Terminal-Bench multilingue con 324 compiti di programmazione in dieci lingue, una versione multilingue di τ³-bench per l’assistenza clienti, MultiChallenge per il rispetto delle istruzioni in contesti lunghi e GAIA-v2-LILT per il ragionamento agentico. Claude Opus 5.5 guida il Terminal-Bench multilingue e si classifica primo su τ³-bench in ciascuna delle cinque lingue. Su GAIA, i modelli guadagnano in media 20,7 punti sulla versione verificata da LILT rispetto a una traduzione automatica: per LILT, questo divario misura l’errore introdotto dalla traduzione. Uno stesso dialogo consuma inoltre circa 1,4 volte più token in coreano o in arabo che in inglese.
| Modello valutato (Terminal-Bench multilingue, estratto) | Successo medio |
|---|---|
| Claude Opus 5.5 (effort high) | 76,4 % |
| Claude Opus 5 (effort high) | 73,5 % |
| Gemini 3.8 Flash | 67,3 % |
| GPT-6 Sol | 64,8 % |
| Command A+ | 4,3 % |
🔗 Articolo di LILT su AURORA · La classifica AURORA
Settore pubblico e imprese: Claude for Government, l’agente d’acquisto di Anthropic e OpenAI con America’s SBDC
Claude for Government diventa generalmente disponibile
30 settembre — Claude for Government esce dalla beta: Anthropic ne annuncia la disponibilità generale per le agenzie federali e quelle degli Stati americani. La piattaforma, in beta pubblica da luglio, offre le capacità di programmazione e di lavoro agentico di Claude in un ambiente autorizzato FedRAMP High, con funzionalità paragonabili a quelle dei clienti commerciali; il CLI Claude Code e Claude for Microsoft 365 vi arrivano in accesso anticipato. Nessuna licenza per postazione: le agenzie pagano l’utilizzo per fasce fisse, con un tetto rigido che impedisce di superare il budget impegnato, e le mappature dei gruppi SCIM stabiliscono, per livello di postazione, limiti di frequenza, tetti in dollari e modelli consentiti. Sul fronte dei controlli, le operazioni sensibili sul lato Anthropic richiedono l’approvazione di due persone, le esportazioni dei dati di utilizzo contengono soltanto dati di misurazione e la cronologia delle conversazioni resta sul dispositivo gestito dall’agenzia. Anthropic non pubblica alcuna tariffa.
🔗 Claude for Government è ora generalmente disponibile
In Anthropic, un agente basato su Managed Agents accoglie le richieste commerciali
30 settembre — Anthropic racconta come il suo team commerciale abbia riprogettato l’accoglienza delle richieste in entrata, decine di migliaia al mese, con un agente d’acquisto basato su Claude Managed Agents, in beta. Presente nelle pagine Contact Sales e Pricing, in claude.ai e nelle e-mail, pone alcune domande, consiglia un piano e un numero di postazioni, poi accompagna all’acquisto, passa la mano a un commerciale con l’intera cronologia oppure si limita a rispondere; il cliente può scegliere una persona fin dall’inizio. Secondo l’articolo, firmato da Carl Johnson, l’agente gestisce migliaia di conversazioni al giorno; i potenziali clienti che inoltra diventano opportunità commerciali con una frequenza più che doppia rispetto al vecchio modulo e concludono l’acquisto circa cinque giorni prima, mentre la quota di conversazioni che richiedono un commerciale per concludere è diminuita di circa la metà. Un solo ingegnere ha costruito la prima versione in poche settimane; l’agente indirizza spesso i piccoli team verso il piano Team anziché Enterprise, una scelta che Anthropic ha deciso di accettare.
OpenAI collabora con America’s SBDC e pubblica un rapporto sulle piccole imprese
30 settembre — OpenAI collabora con America’s SBDC, la rete nazionale dei centri americani per lo sviluppo delle piccole imprese, che assiste 1 milione di imprenditori all’anno. In una prima fase, attraverso il programma di formatori della community di OpenAI Academy (Community Trainer Program), avviato come progetto pilota il 23 settembre, OpenAI prevede di formare circa 150 consulenti, che terranno workshop di tre ore nelle reti SBDC, con l’obiettivo di raggiungere almeno 1 000 piccole imprese in presenza. Lo stesso giorno, il rapporto «Piccole imprese, maggiori capacità» quantifica l’utilizzo: nella settimana dal 9 al 15 settembre, circa 4 milioni di dipendenti di imprese con meno di 500 persone hanno utilizzato i prodotti di OpenAI, di cui quasi uno su cinque in un’impresa con meno di 10 dipendenti. Ad agosto, i token di output agentici, in particolare quelli di ChatGPT Work e Codex, rappresentavano due terzi dei token di output delle piccole imprese, contro un terzo ad aprile.
🔗 Articolo di OpenAI sulle piccole imprese
Runway Ads: un motore autonomo per la pubblicità basata sulle performance
30 settembre — Runway lancia Runway Ads, che gestisce dall’inizio alla fine la parte creativa delle campagne a pagamento. Si collegano un account pubblicitario e un kit del brand: lo strumento, basato su Runway Agent, genera contenuti creativi video e immagini, pubblica le varianti approvate su Meta, Google e TikTok, analizza le loro performance e produce la serie successiva sulla base di ciò che ha attirato la spesa. Localizza ogni contenuto creativo secondo le regole stabilite dal team, compreso il testo sullo schermo, lo ridimensiona per ogni formato, lo sottopone a un controllo automatico del brand e rispetta i limiti di budget. L’approvazione umana è attiva per impostazione predefinita; la pubblicazione automatica può essere abilitata per campagna o per tipo di variante.
| Indicatore interno di Runway, da luglio | Risultato pubblicato nel post |
|---|---|
| Annunci pubblicitari a settimana | da 77 a circa 900 |
| Ritorno sulla spesa pubblicitaria | raddoppiato |
| Conversione | circa +34 %, tasso di clic stabile |
| Costo per abbonato | −41 % |
Runway Ads è attualmente in fase pilota presso partner aziendali selezionati. Il tweet di annuncio promette una disponibilità su larga scala nelle prossime settimane e afferma che lo strumento ha anche consentito di aggiungere 100 milioni di dollari di ARR (ricavi annuali ricorrenti) da luglio, una cifra assente dal post.
🔗 Post su Runway Ads · Tweet di @runwayml
ElevenLabs valutata a 22 miliardi di dollari dopo un’offerta di riacquisto da 300 milioni
30 settembre — ElevenLabs ha concluso un’offerta di riacquisto di azioni (tender offer) da 300 milioni di dollari destinata ai suoi dipendenti, che la valuta a 22 miliardi di dollari, il doppio della valutazione ottenuta nel round di serie D di febbraio. L’operazione è guidata da Wellington e T. Rowe Price; EQT, Goldman Sachs, GIC, OTPP, Sapphire Ventures e BDT & MSD entrano nel capitale, accanto a investitori esistenti come Andreessen Horowitz, Lightspeed e ICONIQ. I clienti aziendali rappresentano il 55 % del fatturato: ElevenAgents gestisce oltre 15 milioni di conversazioni a settimana, tre volte più che a febbraio, e i suoi ricavi annuali ricorrenti sono più che triplicati nel periodo. Secondo un’analisi dei suoi clienti, gli agenti vocali risolvono le richieste il 31 % più velocemente degli agenti di chat. L’azienda conta oltre 800 dipendenti, quattro anni dopo un primo round con una valutazione di 9 milioni di dollari.
Vera Rubin NVL72 in produzione presso CoreWeave, Cognition misura un throughput fino a 4,8 volte superiore
30 settembre — In occasione di CoreWeave Fully Connected, a San Francisco, NVIDIA illustra l’entrata in produzione di Vera Rubin NVL72 presso CoreWeave: la piattaforma, con la rete Spectrum-X Ethernet 102.4T, è disponibile su CoreWeave Cloud, che ha ricevuto i suoi primi rack di produzione all’inizio del mese. Cognition, l’azienda che sviluppa Devin, è il primo cliente a eseguirvi carichi di lavoro di produzione: nei primi test su attività tratte da FrontierCode, ha misurato un throughput totale di token per l’inferenza di SWE-2 fino a 4,8 volte superiore rispetto a GB200 NVL72. CoreWeave offrirà anche la CPU Vera, progettata per gli agenti: 128 CPU e 11 264 core per rack, sufficienti a eseguire oltre 11 000 ambienti isolati simultanei, con sandbox degli agenti che si avviano più di tre volte più velocemente. CoreWeave lancia infine CoreWeave Forge, che riunisce Weights & Biases, OpenPipe e marimo per chiudere il ciclo dalla produzione all’addestramento; il suo apprendimento per rinforzo serverless (serverless RL) viene dichiarato 1,4 volte più veloce, con costi inferiori del 40 %.
🔗 Post di NVIDIA su CoreWeave e Vera Rubin
Agenti di coding e strumenti di sviluppo: Claude Code 2.1.286, Zed 1.22.0, Gemini CLI, VS Code 1.140, HydraFusion e un server MCP per gcloud
Claude Code 2.1.286: segnalibri in VS Code, tentativi limitati e modalità bare più restrittiva
30 settembre — Claude Code 2.1.286, pubblicato alle 19:10 UTC, comprende 88 voci, di cui 49 correzioni. La richiesta di autorizzazione indica la propria posizione quando si accumulano più richieste (« 2 of 5 »), e l’estensione VS Code introduce segnalibri (bookmarks) per conservare le risposte di Claude in un pannello laterale, una riga Domande che riprende le domande poste da Claude e le risposte scelte, e anteprime delle opzioni nelle schede delle domande. Due cambiamenti di comportamento sono rilevanti: un unico limite copre ora i nuovi tentativi di una chiamata al modello, per un massimo di 14 richieste con le impostazioni predefinite, e --bare connette soltanto i server MCP nominati nella riga di comando, senza promemoria di sistema né attività in background. Se esiste una skill denominata verify, Claude viene invitato a eseguirla subito prima di ogni commit, tranne per la documentazione o i test, e i plugin rifiutano le fonti npm che sono repository git o cartelle. Infine, quando l’API rifiuta il modello predefinito, Claude Code riprova una volta con il modello precedente dello stesso livello invece di fallire a ogni turno.
🔗 Note di rilascio di Claude Code 2.1.286
Zed 1.22.0: un modello per ogni sottoagente
30 settembre — Zed pubblica la versione stabile 1.22.0, incentrata sui sottoagenti: lo strumento spawn_agent accetta un parametro facoltativo model, per avviare un sottoagente con un modello diverso da quello configurato o ereditato dall’agente padre, e la scheda di ogni sottoagente mostra il modello utilizzato. I sottoagenti compattano inoltre automaticamente il proprio contesto, il che consente loro, secondo Zed, di gestire attività più lunghe. Sul fronte dei modelli, GPT-6.1 Sol arriva in BYOK con una chiave API OpenAI, Grok 4.7 passa alla versione stabile come modello consigliato su SuperGrok e xAI, e l’elenco dei modelli OpenCode Zen e Go viene recuperato dinamicamente. La versione corregge una perdita di circa 2 Mo di memoria per ogni comando completato nel terminale e modifica una scorciatoia: la chiusura del dock attivo passa a ctrl-alt-w su tutte le piattaforme. In totale, 18 novità e 37 correzioni.
🔗 Note di rilascio di Zed 1.22.0
Gemini CLI: v0.62.0 stabile e un’anteprima che esegue i piani senza conferma
29 settembre — Gemini CLI pubblica due versioni in serata (UTC). La v0.62.0 diventa stabile alle 21:17: le sue 19 voci riprendono l’anteprima e le nightly presentate dal 16 al 24 settembre (titoli strutturati delle chiamate agli strumenti MCP, conservazione del token di aggiornamento OAuth (refresh token), Gemini 3.8 Flash e 3.5 Flash Lite). La novità si trova nell’anteprima v0.63.0-preview.0, pubblicata alle 20:58: in modalità non interattiva, l’agente ora redige ed esegue il proprio piano senza attendere conferma (PR 29539), mentre le istruzioni del Plan Mode gli facevano rispondere con un semplice messaggio di allineamento, senza alcuna chiamata agli strumenti. Un limite maxChars pari a 0 o inferiore disattiva inoltre il troncamento degli output degli strumenti (PR 29542). La nightly del 30 settembre inaugura la serie 0.64.0: in modalità ACP, il CLI riporta finalmente l’utilizzo standard, mentre client come Zed o OpenHands sovrastimavano la fatturazione di circa 3 volte, secondo la PR 29549.
🔗 Gemini CLI v0.63.0-preview.0 · Gemini CLI v0.62.0
VS Code 1.140 adotta l’harness Copilot
30 settembre — Visual Studio Code 1.140 arriva in versione stabile con l’harness Copilot (Copilot harness): basato sul Copilot SDK, offre all’agente di VS Code il comportamento e le capacità dell’app GitHub Copilot e di Copilot CLI, e viene eseguito in un processo host dedicato, basato sull’Agent Host Protocol, così che si possa accedere alla stessa sessione da più finestre; le note avvertono che potrebbe essere già selezionato per impostazione predefinita per alcuni utenti. In via sperimentale, le sessioni con più cartelle assegnano a ogni chat una propria cartella o un proprio worktree, e l’agente può delegare una sessione a un host remoto, scelto in base al sistema, alla memoria, al numero di CPU e al modello. Arrivano tre controlli per le aziende: la spiegazione, nella chat, delle versioni minime richieste dall’amministratore, un livello predefinito della modalità Auto stabilito da un’impostazione gestita (autoTier), e l’aggiunta dell’identità dell’utente ai dati OpenTelemetry di Copilot, opzione disattivata per impostazione predefinita.
🔗 Note di rilascio di VS Code 1.140
HydraFusion arriva in VS Code e nell’app GitHub Copilot
30 settembre — GitHub estende HydraFusion, l’orchestrazione di più modelli lanciata il 4 settembre in Copilot CLI, a VS Code (a partire dalla versione 1.140, o Insiders) e all’app GitHub Copilot, sempre in anteprima di ricerca. HydraFusion si sceglie nel selettore come un modello, ma non lo è: tratta la scelta del flusso di lavoro come un problema di ottimizzazione e seleziona uno di tre schemi. In modalità Single, un solo modello risolve l’attività; in modalità Cascade, un modello efficiente redige la risposta e un controllo qualità accetta il risultato o passa a un modello più potente; in modalità Critique, un critico in sola lettura, appartenente a un’altra famiglia di modelli, esamina il risultato, poi l’autore lo revisiona una volta. Mentre la modalità Auto sceglie un modello per ogni richiesta, HydraFusion coordina più modelli nello stesso turno. È disponibile nei piani Copilot Pro, Pro+, Business ed Enterprise; in Business ed Enterprise un amministratore deve attivare le anteprime; GitHub non pubblica nuove cifre.
🔗 HydraFusion in VS Code e nell’app GitHub Copilot
Google Cloud rende disponibile in anteprima un server MCP remoto che esegue gcloud e bq
Google Cloud aggiunge ai suoi server MCP remoti gestiti il Google Cloud CLI remote MCP server, in anteprima pubblica. Riunisce centinaia di comandi degli strumenti da riga di comando gcloud e bq (BigQuery) dietro due strumenti MCP, run_gcloud_command e run_bq_command. Google giustifica la scelta della riga di comando con due argomenti: un comando racchiude operazioni in più passaggi che l’API richiederebbe di orchestrare, e i modelli sono stati ampiamente addestrati sulla documentazione pubblica di questi comandi. Il server remoto evita di installare il CLI nell’ambiente dell’agente, rendendo queste operazioni accessibili alle piattaforme di agenti ospitate sul web, come Gemini Enterprise. I comandi vengono eseguiti in una sandbox isolata, dietro un proxy con accesso alla rete limitato e senza credenziali già presenti nell’ambiente (ambient credentials), ciascuno con i permessi IAM dell’identità chiamante, autenticata tramite Agent Identity o OAuth 2.0; Model Armor può filtrare prompt e risposte, e ogni chiamata può essere registrata nei log di audit. Il server non viene fatturato di per sé: vengono fatturate soltanto le risorse create e gli eventuali trasferimenti di dati.
🔗 Potenzia i tuoi agenti con il Google Cloud CLI remote MCP server (blog di Google Cloud)
Notizie brevi
- Codex CLI 0.159.2 — Pubblicata il 29 settembre alle 23 h 57 UTC, questa versione contiene un solo fix in backport: su Windows, le finestre della console non lampeggiano più quando Codex avvia processi in background o comandi nella sua sandbox. 🔗 fonte
- Plaid in Amp — Le modalità di Amp che utilizzano GPT-6 Astra ottengono Plaid, basato sul livello ultraveloce di OpenAI: richieste fino a 6 volte più rapide con un costo per token moltiplicato per 6, riservato all’inferenza fornita da Amp; i sub-agenti restano alla velocità fast o standard e Amp non pubblica alcun prezzo. 🔗 fonte
- Warp e Factories as Code — Warp presenta la configurazione delle sue fabbriche software come «il Terraform degli agenti»: un repository descrive agenti, automazioni, accessi e misurazioni. Il formato factory.yaml risale a fine agosto; la guida interattiva descrive in dettaglio l’accesso federato ad AWS o GCP, i webhook e le integrazioni con Slack, Linear o Jira. 🔗 thread di Warp · 🔗 guida alla configurazione
- Devin presso Crosby — In un caso di studio di Cognition, lo studio legale newyorkese Crosby, con una dozzina di ingegneri per oltre 50 avvocati, affida a Devin la prima risposta agli incidenti: da 20 a 40 bug e avvisi esaminati al giorno, la maggior parte in circa 5 minuti, e almeno il 50 % di rumore in meno su Sentry. 🔗 fonte
- claude.dev — Anthropic presenta ufficialmente claude.dev come la casa degli sviluppatori che creano con Claude: approfondimenti tecnici, guide su Claude Code e API, sezioni Agents, Engineering, Playbooks e Skills, e una pagina Terminal come sorpresa nascosta. Alcuni post del sito venivano già condivisi dal 22 settembre. 🔗 fonte
- Sites di ChatGPT modificabili — Secondo le note di rilascio del 29 settembre, un Site pubblicato si modifica con Edit site e si pianifica da Automations su Plus e Pro; in Enterprise, i Sites privati possono utilizzare le applicazioni connesse, con un’impostazione Allow use in Sites per ciascun plugin, disattivata per impostazione predefinita. 🔗 note di rilascio di ChatGPT · 🔗 note Enterprise ed Edu
- Kimi Work 3.2.15 — La versione del 30 settembre introduce la modifica collaborativa tra umani e IA dei documenti Notion e Feishu nel browser integrato, comprime per impostazione predefinita la sequenza delle attività dell’agente e corregge la corruzione dei file durante la modifica simultanea di un PPT. 🔗 fonte
- Cue gestisce le finanze — L’applicazione di agenti personali lanciata con Manus 2.0 monitora ora abbonamenti e tendenze di spesa e gestisce i conti bancari con il pilota automatico, tramite Plaid; non sono specificati paesi, piani o condizioni. 🔗 fonte
- GPT-6.1 Sol in Genspark — Genspark rende disponibile GPT-6.1 Sol in AI Chat, Code Agent e Claw il giorno dopo il suo lancio, riprendendo l’argomentazione di OpenAI (un’intelligenza vicina ad Astra a un quinto del suo prezzo API), senza specificare piani o costi in crediti. 🔗 fonte
- Qwen3.8-27B-pi — Thomas Kim pubblica sotto Apache-2.0 una versione affinata di Qwen3.8-27B per l’harness Pi che riordina i livelli di sforzo: su Terminal-Bench 2.1, il livello medium eguaglia il modello di base in xhigh (67 task su 89) con circa il 41 % di token di output in meno. 🔗 fonte
- Qwen3.8-27B su Nebius — Qwen rilancia l’arrivo del suo modello denso da 27 miliardi di parametri su Nebius Token Factory, annunciato il 28 settembre, per il codice, la ricerca e i flussi agentici; non sono comunicati prezzi né throughput. 🔗 fonte
- Bekko System One v0 — Yuichi Tateno pubblica tre modelli decisionali da 17M, 68M e 400M di parametri, di cui i due più piccoli funzionano in un browser, e il benchmark S1MB: il 400M ottiene 50,60 contro 59,59 per Jev 1.13, ma 54,48 contro 96,27 nella generalizzazione. 🔗 fonte
- ZooWork Instinct Tuned 4B — SRP pubblica sotto Apache-2.0 un modello decisionale da 4 miliardi di parametri, basato su Qwen3.5-4B, che assegna un punteggio alle opzioni in un unico passaggio senza decodificare: 198 su 231 (85,71 %) sui task pubblici di JevBench, utilizzati durante lo sviluppo, precisano gli autori. 🔗 fonte
- Transformers v5.18.0 — Hugging Face aggiunge quattro architetture, Nemotron 3 Diarization e NemotronH Omni di NVIDIA, HyperCLOVAX Vision V2 di NAVER e GTE, e segnala sei modifiche che rompono la compatibilità. 🔗 fonte
- TaskSmith — Adithya S K, che lavora sugli ambienti di apprendimento per rinforzo presso Hugging Face, pubblica un orchestratore che trasforma una pull request in un ambiente RL verificabile: 50 ambienti ricavati da TRL, PEFT, Accelerate, Diffusers e Transformers, distribuiti come task Harbor. 🔗 fonte
- TraceML 0.4.1 — Lo strumento open source misura ora l’intero gruppo di un aggiornamento dell’ottimizzatore; su ResNet-50 e una GPU T4, l’attesa dei dati passa dal 23 % dello step a meno di 2 ms dopo la regolazione del caricamento, con un overhead mediano dello 0,35 %. 🔗 fonte
- Transformer con loop — Su un modello giocattolo da 54 106 parametri e 260 casi verificabili, a parità di budget di 80 passaggi di blocco, un loop apprende tutti i 260 casi, due loop 125,3 e otto 37,0 in media: moltiplicare i passaggi non ha reso l’apprendimento più economico. 🔗 fonte
- Una valutazione che sa dire di no — Il tutorial di Eric Mey mostra, sul sentiment delle recensioni cinematografiche (SST-2), una valutazione che respinge un modello pur essendo migliore di 7 punti sui dati tenuti da parte, perché un comportamento critico peggiora; i suoi script vengono eseguiti in meno di un minuto su CPU. 🔗 fonte
- 10 000 assicurati sintetici — Intelligent Actuaries pubblica sotto CC-BY-4.0 uno studio sintetico sulle decadenze e sui riscatti delle polizze vita: 10 000 assicurati fittizi in dieci mercati, per un totale di 27 692 record polizza-anno 2023-2025 nel formato dell’indagine SOA-LIMRA. 🔗 fonte
- cuObject e SCADA Server SDK — NVIDIA porta in disponibilità generale le librerie cuObject per l’accesso allo storage a oggetti tramite RDMA, senza passare dalla memoria della CPU, e lancia lo SCADA Server SDK, di cui IBM ha realizzato un prototipo con Storage Scale, nell’ambito di un’iniziativa Storage-Next con oltre 40 partecipanti. 🔗 fonte
- NeMo Relay e Hermes Agent — Un tutorial di NVIDIA cofirmato da Teknium, di Nous Research, analizza le tracce di un agente Hermes: su 108 esecuzioni, le correzioni degli strumenti fanno passare Qwen3 Coder 30B da 19 a 22 successi su 27, al prezzo di 4,9 chiamate al modello invece di 3,8. 🔗 fonte
- OpenShell per OpenClaw Enterprise — NVIDIA propone il suo ambiente open source OpenShell per governare gli agenti di OpenClaw Enterprise, un piano di controllo open source per agenti persistenti annunciato il giorno prima dalla fondazione OpenClaw con Red Hat, NVIDIA e OpenAI. 🔗 fonte
- Prove di GitHub Advanced Security — I clienti GitHub Team possono avviare autonomamente una prova di GitHub Code Security e GitHub Secret Protection dalla pagina Overview dell’organizzazione, dalla pagina di fatturazione o da un Risk Assessment; la durata non è specificata. 🔗 fonte
- GHE.com e X25519 — A partire dal 7 ottobre 2026, GitHub Enterprise Cloud con residenza dei dati rifiuterà i client TLS che propongono soltanto X25519 per lo scambio di chiavi; P-256 e P-384 restano supportati e SSH non è interessato. 🔗 fonte
- Due casi di studio di Runway — Il marchio francese di bevande Bonjour ha prodotto oltre 500 varianti pubblicitarie con Runway e riallocato oltre 50 000 euro di budget di produzione; la World Juggling Federation ha affidato a una sola persona la grafica di una trasmissione di un’ora per ESPN. 🔗 Bonjour · 🔗 World Juggling Federation
- Ad Variants in Luma — Luma mette in evidenza una funzione che adatta una pubblicità completata a più dimensioni e mercati all’interno della stessa campagna, senza indicare tariffe, piani o data di lancio, e senza un post. 🔗 fonte
- Microduck in produzione — Pollen Robotics annuncia che 10 950 Microduck, il suo piccolo robot bipede da 399 dollari addestrato in simulazione, con uno stack di apprendimento per rinforzo open source, usciranno dalla linea tra il 10 dicembre e il 10 gennaio, in lotti settimanali. 🔗 fonte
- Cognition assume — L’azienda che sviluppa Devin accoglie Chris Degnan, ex CRO di Snowflake, come direttore dei ricavi, il giorno dopo l’arrivo di Alex Stamos come responsabile della sicurezza dei sistemi informativi (CISO). 🔗 Chris Degnan · 🔗 Alex Stamos
- Claude Founder House — Anthropic organizza giornate per fondatori a San Francisco durante la SF Tech Week (dal 6 all’8 ottobre, alla Terra Gallery) e a Stoccolma il 14 ottobre, con conferenze, workshop e sessioni con il suo team Applied AI. 🔗 fonte
- AI Engineer Paris — Mistral traccia il bilancio dell’evento tenutosi la settimana precedente a Station F: oltre 900 partecipanti, 60 relatori, 57 conferenze e 22 partner, senza annunci di prodotti. 🔗 fonte
- Borse di dottorato NVIDIA — Le candidature al Graduate Fellowship Program 2027-2028 sono aperte fino al 30 ottobre 2026, con un massimo di 60 000 dollari per dottorando; dal 2002 sono state assegnate oltre 220 borse. 🔗 fonte
Cosa significa
La sicurezza determina ormai il calendario dei modelli di frontiera. Gemini 4 Argon prosegue la logica del Fairwind Program: i difensori cyber fidati lo ricevono per primi, senza misure di salvaguardia cyber, e gli altri seguiranno «il prima possibile», senza una data, mentre vengono rafforzate le protezioni. Lo stesso giorno, OpenAI mostra l’altra faccia del problema: ciò che occorre proteggere non è più soltanto il modello, ma anche il suo ragionamento. Che sia opera di un unico attore o meno, la campagna il cui nucleo viene attribuito da OpenAI a individui associati a Moonshot AI rende la traccia di ragionamento una risorsa da difendere, con contromisure tecniche e uno scambio di informazioni tra laboratori e governi.
Buona parte dei numeri di oggi deriva da misurazioni progettate o condotte da chi fa gli annunci. Cohere valuta Embed 5 con la metrica che pubblica lo stesso giorno e avverte essa stessa che i suoi modelli potrebbero apparire meno validi con la vecchia metrica; HeyGen si basa su un Elo interno, Hunmin su un protocollo interno, con una sola esecuzione per i benchmark degli agenti, e su Reality Check è l’organizzatore ad aver affinato i modelli. Perplexity, invece, sottopone il proprio modello a una valutazione alla cieca su un benchmark privato di turbopuffer, e sia l’Open TTS Leaderboard sia AURORA sostituiscono i voti o la traduzione automatica con task e misurazioni verificabili. Prima di confrontare due punteggi, bisogna guardare chi li ha prodotti.
La generazione di immagini e video viene giudicata sempre più in base all’uso e al costo. Ideogram 4.5 non promette un’immagine più bella, ma un’immagine che regge ritocchi in sequenza; HeyGen Video viene venduto al secondo, a un prezzo inferiore a tutti i modelli del suo listino, e mostra che un modello di base come MiniMax H3 può dare origine a varianti specializzate, da HeyGen a Creatify. Runway Ads completa la catena fino alla spesa pubblicitaria, e la valutazione di ElevenLabs, raddoppiata da febbraio, si basa sulla domanda delle aziende di agenti conversazionali.
Per gli sviluppatori, l’harness diventa un prodotto a tutti gli effetti, distinto dal modello. VS Code adotta l’harness di Copilot per allineare il suo agente all’app e alla CLI, HydraFusion coordina più modelli nello stesso turno, Zed lascia che l’agente scelga un modello per ciascun sub-agente e Manus apre il suo harness alle chiavi API di fornitori terzi. Gemini CLI esegue ora i propri piani senza intervento umano in modalità non interattiva, Claude Code rende più restrittivo --bare per gli usi tramite script e Google Cloud espone gcloud e bq agli agenti in una sandbox, con i permessi IAM del chiamante. La domanda emerge persino nell’infrastruttura: il primo cliente di Vera Rubin NVL72 in produzione presso CoreWeave è Cognition, l’azienda che sviluppa Devin.
Fonti
- Gemini 4 Argon: la nostra nuova era dell’intelligenza di frontiera (blog Google)
- Pagina Gemini di Google DeepMind
- Annuncio di Gemini 4 Argon di @GoogleDeepMind
- Post di OpenAI sulla campagna di distillazione
- Sottrarre tracce di ragionamento dalle API di LLM proprietari (arXiv)
- Post di Cohere su Embed 5
- Annuncio di Embed 5 di @cohere
- Post di Cohere su RCP-nDCG@10
- Codice e dati di RCP-nDCG su GitHub
- Post di Perplexity Research sull’embedding contestuale
- pplx-embed-v2-context-9b-preview su Hugging Face
- Annuncio di Ideogram 4.5 di @ideogram_ai
- Pagina del modello Ideogram 4.5
- Catalogo HeyGen Video
- Annuncio di HeyGen Video di @HeyGen
- Skills nell’applicazione Gemini (blog Google)
- Presentazione di Manus Flex
- Thread di @bot su Grok Bot e Cursor
- Praxis-1 su Runway Research
- Tweet di Ai2 su MolmoAct 2 e Reality Check
- Classifica Reality Check di Poke & Wiggle
- Pagina del progetto Physis-Lang
- Annuncio di Physis-Lang di @NVIDIAAI
- Post su Hunmin-CUA
- Pesi di Hunmin-397B-A17B-CUA
- Post su JEV-27B-VL
- Post dell’Open TTS Leaderboard
- Open TTS Leaderboard su Hugging Face
- Post di LILT su AURORA
- Classifica AURORA
- Claude for Government è ora in disponibilità generale
- Come il team commerciale di Anthropic ha riprogettato la gestione dei contatti in entrata con Claude Managed Agents
- Post di OpenAI sulle piccole imprese
- Post su Runway Ads
- Tweet di @runwayml su Runway Ads
- Post di ElevenLabs sull’offerta di riacquisto
- Post di NVIDIA su CoreWeave e Vera Rubin
- Note di rilascio di Claude Code 2.1.286
- Note di rilascio di Zed 1.22.0
- Gemini CLI v0.63.0-preview.0
- Gemini CLI v0.62.0
- Note di rilascio di VS Code 1.140
- HydraFusion in VS Code e nell’app GitHub Copilot
- Server MCP remoto di Google Cloud CLI (blog Google Cloud)
- Codex CLI 0.159.2
- Plaid Speed in Amp
- Thread di @warpdotdev su Factories as Code
- Factories as Code, Warp
- Caso di studio Crosby, Devin
- Presentazione di claude.dev di @ClaudeDevs
- Note di rilascio di ChatGPT
- Note di rilascio di ChatGPT Enterprise ed Edu
- Note di rilascio di Kimi Work
- Cue e la gestione delle finanze
- GPT-6.1 Sol in Genspark
- Qwen3.8-27B-pi
- Qwen3.8-27B su Nebius Token Factory
- Bekko System One v0
- ZooWork Instinct Tuned 4B
- Transformers v5.18.0
- TaskSmith
- TraceML 0.4.1 e il Trainer di Transformers
- Addestrare transformer con loop
- Scrivere una valutazione che sappia dire di no
- Diecimila assicurati sintetici
- cuObject e SCADA Server SDK
- NeMo Relay e Hermes Agent
- OpenShell per OpenClaw Enterprise
- Prove di GitHub Advanced Security per GitHub Team
- Fine del TLS limitato a X25519 su GHE.com
- Caso di studio Bonjour, Runway
- Caso di studio World Juggling Federation, Runway
- Ad Variants in Luma
- Microduck, Pollen Robotics
- Chris Degnan presso Cognition
- Alex Stamos presso Cognition
- Claude Founder House
- Bilancio di AI Engineer Paris di @MistralDevs
- Borse di dottorato NVIDIA