ai-powered-markdown-translatorArticolo tradotto dal fr all’it con gpt-6.1-sol.
GPT-6 e Intelligent UI arrivano per tutti gli utenti di ChatGPT: GPT-6 Sol per i piani a pagamento dal 7 ottobre, GPT-6 Luna per Free e Go a partire dall’8 ottobre. Anthropic completa la sua famiglia 5.5 con Claude Haiku 5.5, a partire da 0,10 dollari per milione di token in ingresso, mentre l’evento Windows di Microsoft apre i preordini dei PC RTX Spark e annuncia che GitHub Copilot potrà presto affidare le proprie attività a un modello locale. OpenAI pubblica anche 722 manoscritti di risultati matematici prodotti da un modello interno.
ChatGPT passa a GPT-6 e Intelligent UI per tutti, legge i file audio e prepara College Planner
7 ottobre — OpenAI estende GPT-6 a tutti gli utenti di ChatGPT. Non si tratta di un nuovo modello di base: GPT-6 Sol e GPT-6 Luna erano già disponibili per i clienti a pagamento da settembre (ne abbiamo parlato qui il 22 settembre). Questa volta, le versioni di ottobre di questi due modelli, ottimizzate per le conversazioni quotidiane, arrivano nella scheda Chat: GPT-6 Sol per Plus, Pro, Business ed Enterprise dal 7 ottobre, GPT-6 Luna per Free e Go a partire dall’8 ottobre. Sostituiscono GPT-5.6 Sol e GPT-5.6 Luna in ChatGPT, mentre Codex e ChatGPT Work restano sulle versioni di settembre. OpenAI afferma così di rivolgersi agli oltre 1,2 miliardi di persone che utilizzano ChatGPT ogni settimana.
La novità più visibile si chiama Intelligent UI. GPT-6 compone le proprie risposte con testo, elementi visivi e componenti interattivi (grafici, pulsanti, moduli, diagrammi interattivi, mappe) e può creare su richiesta un piccolo strumento, come un calcolatore di risparmio, uno strumento per dividere il conto o un gioco; quando basta un testo semplice, ChatGPT si limita a quello. Per farlo, OpenAI si basa su una libreria di componenti nativi e su un compilatore che visualizza l’interfaccia durante la generazione. Intelligent UI funziona con i livelli di effort da Instant a Extra High, senza una quota separata, ma non con il livello Pro, affidato a GPT-6 Pro (basato su GPT-6 Astra), né nelle vecchie applicazioni desktop per macOS e Windows.
Secondo cambiamento: ChatGPT può iniziare a rispondere mentre ragiona o utilizza strumenti, per poi completare la risposta senza un nuovo prompt. Secondo valutazioni interne di OpenAI, GPT-6 Instant inizia a rispondere in media il 44 % prima di GPT-5.6 Instant alle domande che richiedono una ricerca web, e GPT-6 Extra High comincia negli stessi tempi di GPT-5.6 Medium, con un punteggio complessivo migliore di GPT-5.6 Extra High.
| Piano o impostazione dell’effort | Modello utilizzato in ChatGPT | Tempistiche e dettagli |
|---|---|---|
| Plus, Pro, Business ed Enterprise | GPT-6 Sol (Instant, Medium, High, Extra High) | Distribuzione mondiale dal 7 ottobre |
| Free e Go | GPT-6 Luna | A partire dall’8 ottobre |
| Effort Pro (Pro 100 e 200 dollari, Business, Enterprise) | GPT-6 Pro, basato su GPT-6 Astra | Senza Intelligent UI |
| ChatGPT Work e Codex | Versioni di settembre di GPT-6 Sol e GPT-6 Luna | Nessun cambiamento |
Sul fronte della sicurezza, la scheda di sistema pubblicata lo stesso giorno classifica queste versioni al livello di capacità «High» nella cybersicurezza e nella biologia e chimica secondo il Preparedness Framework, senza raggiungere tale soglia nell’automiglioramento; riprendono le misure di protezione di GPT-5.6, con una migliore resistenza ai tentativi di aggiramento (jailbreaks), anche su più turni. Nell’API, lo snapshot chat-latest punta ora a questo nuovo modello di ChatGPT, e OpenAI raccomanda la famiglia GPT-6 per l’uso in produzione.
GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.
🇮🇹 GPT-6 e Intelligent UI sono ora in fase di distribuzione in ChatGPT per tutti. In ChatGPT, Intelligent UI fornisce risposte rapide e interattive che rendono le domande quotidiane più visive, gli argomenti complessi più facili da comprendere e mettono immediatamente a disposizione strumenti interattivi adatti alla tua attività. — @OpenAI su X
🔗 GPT-6 e Intelligent UI per tutti · Scheda di sistema, aggiornamento di ottobre · GPT-6 e altri modelli in ChatGPT
I file audio in ChatGPT
6 ottobre — ChatGPT accetta ora file audio come allegati. Si allega una registrazione a una conversazione per ottenere una trascrizione, un riepilogo o risposte sul suo contenuto, oppure per trasformare una riunione, un’intervista o una lezione in appunti strutturati, o persino in una bozza di e-mail di follow-up. La funzione è riservata agli abbonamenti e agli spazi di lavoro a pagamento, Enterprise compreso: il piano Free non vi ha accesso «per il momento». I formati accettati sono WAV, MP3, OGG, FLAC, AAC, M4A e PCM, oltre a WebM e MP4 se contengono solo audio, fino a 512 Mo per file. OpenAI avverte che le trascrizioni possono contenere errori, che l’identificazione dei parlanti resta poco affidabile e che le prestazioni variano a seconda delle lingue.
🔗 Note di rilascio di ChatGPT · Caricamento di file e audio in ChatGPT
ChatGPT for Teens: primi dati di utilizzo e College Planner in arrivo
7 ottobre — OpenAI fa un primo bilancio di ChatGPT for Teens, l’esperienza applicata per impostazione predefinita agli account identificati come appartenenti a minori di 18 anni. Secondo l’azienda, quasi 1,2 milioni di adolescenti hanno utilizzato le Learning Visualizations in una settimana e oltre 180 000 lo Study Mode; vi trascorrono in media meno di 15 minuti al giorno, e meno del 2 % supera tre ore consecutive. La novità annunciata, College Planner, arriverà «presto», inizialmente negli Stati Uniti per gli studenti delle scuole superiori dal 10° al 12° anno che puntano a un percorso universitario di quattro anni: un unico piano riunirà requisiti di ammissione, scadenze, attività e procedure per ottenere aiuti finanziari, borse di studio comprese. OpenAI sostiene anche College Advising Corps e, per tre anni, il Digital Wellness Lab del Boston Children’s Hospital, senza comunicare l’importo.
🔗 Aiutare gli adolescenti a imparare, pianificare e plasmare il futuro dell’AI
Claude Haiku 5.5, circa il 75 % meno costoso di Haiku 4.5 secondo Anthropic
7 ottobre — Quindici giorni dopo Opus 5.5 e nove giorni dopo Sonnet 5.5, Anthropic completa la famiglia Claude 5.5 con Claude Haiku 5.5 (claude-haiku-5-5). Il modello è pensato per attività ad alto volume e sensibili ai costi (riepiloghi, compattazioni del contesto, query di database, classificazione), per il ruolo di sottoagente di Opus 5.5 e Sonnet 5.5 sul codice e per gli utilizzi in cui la velocità conta, come l’assistenza clienti in tempo reale o il controllo di un browser: è il modello più veloce di Anthropic a velocità standard, mentre gli Opus in Fast Mode restano più rapidi. È anche il primo Haiku dotato di un’impostazione dell’effort (medium per impostazione predefinita), con un contesto di 1 milione di token e fino a 128 000 token in uscita.
La tariffa prevede due fasce. Fino a 100 000 token di prompt, Haiku 5.5 costa 0,10 dollari per milione di token in ingresso e 0,50 dollari in uscita, ossia il 90 % in meno di Haiku 4.5; oltre tale soglia, passa a 0,50 e 2,50 dollari, il 50 % in meno. Il risparmio di «circa il 75 %» messo in evidenza è una media calcolata da Anthropic: il 90 % delle richieste inviate a Haiku 4.5 restava sotto la soglia, e il nuovo sistema di suddivisione in token (tokenizer) conta circa il 30 % di token in più per lo stesso testo.
| Tipo di tariffa (per milione di token) | Haiku 5.5 fino a 100 000 token di prompt | Haiku 5.5 oltre 100 000 token | Haiku 4.5 |
|---|---|---|---|
| Token in ingresso | 0,10 dollari | 0,50 dollari | 1 dollaro |
| Token in uscita | 0,50 dollari | 2,50 dollari | 5 dollari |
| Letture della cache | 0,01 dollari | 0,05 dollari | 0,10 dollari |
| Scritture nella cache | 0,125 dollari | 0,625 dollari | 1,25 dollari |
Nei benchmark pubblicati da Anthropic, il divario rispetto a Haiku 4.5 è ampio, e Haiku 5.5 supera GPT-6 Luna di OpenAI ovunque compaiano entrambi. Resta invece dietro Sonnet 5.5, che Anthropic continua a raccomandare, insieme a Opus 5.5, per il codice agentico complesso.
| Benchmark valutato (dati di Anthropic) | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 (codice agentico) | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| OSWorld 2.1, sottoinsieme offline | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity’s Last Exam, senza strumenti | 45,9 % | 10,2 % | — | 56,9 % |
| FrontierCode 1.1, Main | 46,4 % | — | 42,4 % | 52,1 % (effort Xhigh) |
| Chartography, senza strumenti | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Sei clienti hanno raccontato le proprie prove in anteprima: HubSpot cita il 92,8 % sulla sua suite CRM, il miglior punteggio ottenuto finora, AlphaSense 0,84 contro 0,76 per Haiku 4.5 su 400 richieste, e Box 11 punti in più con una latenza circa dimezzata. La migrazione da Haiku 4.5 richiede lavoro: la guida elenca undici cambiamenti, tra cui la rimozione di budget_tokens, dei parametri temperature, top_p e top_k e del precompilamento, e il comando /claude-api migrate di Claude Code ne automatizza una parte. Sul fronte della sicurezza, Anthropic descrive misure di protezione cyber più restrittive di quelle di Haiku 4.5, ma un po’ meno di quelle degli altri suoi modelli recenti: più attività difensive consentite rispetto a Sonnet 5.5, mentre i test di penetrazione restano bloccati.
Il lancio è accompagnato da una riduzione dei prezzi: le letture della cache di Sonnet 5.5 passano da 0,20 a 0,10 dollari per milione di token dal 7 ottobre, rendendo il modello circa il 20 % meno costoso per la maggior parte delle attività agentiche, secondo Anthropic. Haiku 5.5 è disponibile da subito sull’API Claude, Amazon Web Services, Google Cloud e Microsoft Azure, oltre che in Claude Code.
Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.
🇮🇹 Ecco Claude Haiku 5.5: il piccolo modello più economico, più veloce e più performante che abbiamo mai pubblicato. In media, farlo funzionare costa circa il 75 % in meno rispetto a Claude Haiku 4.5. — @claudeai su X
🔗 Annuncio di Claude Haiku 5.5 · Guida alla migrazione a Haiku 5.5
Haiku 5.5 in Cursor: 48,4 % su CursorBench
7 ottobre — Cursor rende disponibile Claude Haiku 5.5 fin dal giorno del lancio, da attivare nelle impostazioni dei modelli. Secondo Cursor, costa 10 volte meno di Claude Haiku 4.5 per le richieste brevi. Su CursorBench, la classifica che Cursor pubblica sul proprio sito, Haiku 5.5 con effort Max si colloca al 10° posto con un tasso di successo del 48,4 % per 1,12 dollari per attività, appena davanti a Sonnet 5.5 con effort High, i cui costi Cursor ha ricalcolato il 7 ottobre per tenere conto della nuova tariffa, e davanti a Opus 5 con effort Max. Svolge però più lavoro: in media 325 934 token e 163 passaggi per attività, contro 37 391 token e 41 passaggi per Sonnet 5.5 con effort High.
| Configurazione testata da Cursor | Posizione in classifica | Punteggio CursorBench | Costo per attività |
|---|---|---|---|
| Opus 5.5, effort Max | 1 | 57,8 % | 13,43 dollari |
| Haiku 5.5, effort Max | 10 | 48,4 % | 1,12 dollari |
| Sonnet 5.5, effort High | 11 | 47,8 % | 1,20 dollari |
| Opus 5, effort Max | 13 | 46,6 % | 11,95 dollari |
| Haiku 5.5, effort Low | 54 | 30,9 % | 0,08 dollari |
🔗 Annuncio di Cursor su X · Classifica CursorBench
Un credito API mensile da 100 a 500 dollari per i piani Max e Team
7 ottobre — Annunciato nello stesso post di Haiku 5.5, arriva un credito mensile utilizzabile sulla Claude Platform per gli abbonati Max e Team, con un rilascio distribuito su alcuni giorni. Serve a creare i propri strumenti, applicazioni e agenti con l’API; secondo @ClaudeDevs, funziona con tutti i modelli, compreso Haiku 5.5, sia nel proprio codice sia in strumenti di terze parti.
| Piano interessato | Credito API mensile |
|---|---|
| Max 5x | 100 dollari |
| Max 20x | 200 dollari |
| Team, postazione Standard | 20 dollari per postazione |
| Team, postazione Premium | 100 dollari per postazione |
| Tetto di un team Team | 500 dollari, condivisi |
| Free, Pro ed Enterprise | Non idonei |
Su Team, i crediti delle postazioni si sommano in un fondo comune: tre postazioni Standard e due Premium danno, per esempio, 260 dollari al mese. Il credito copre tutti i modelli dell’API Claude, compresa l’API Message Batches, oltre al Playground della Console, Claude Managed Agents e Claude Agent SDK. Non copre Claude Code nell’uso interattivo (terminale, IDE, applicazione desktop o web), né l’uso aggiuntivo oltre i limiti del piano, né i modelli Claude erogati tramite Amazon Bedrock, Google Cloud Vertex AI o Microsoft Foundry, e non modifica i limiti d’uso di Claude, Claude Code o Cowork.
Per richiederlo, occorre avere un abbonamento attivo da almeno sette giorni su un piano idoneo, quindi collegare un’organizzazione della Claude Console dalle impostazioni di fatturazione di claude.ai, senza aggiungere un metodo di pagamento. È possibile collegare una sola organizzazione e soltanto l’assistenza può cambiarla. Il credito si rinnova a ogni ciclo di fatturazione, non è cumulabile tra un ciclo e l’altro e viene utilizzato prima dei crediti acquistati; una volta esaurito, le chiamate si interrompono fino al credito successivo, a meno che l’organizzazione non abbia acquistato crediti o attivato la ricarica automatica, e non viene addebitato nulla sull’abbonamento Claude. A maggio, Anthropic aveva annunciato un credito mensile per l’uso programmatico a partire dal 15 giugno; la pagina di assistenza precisa che il nuovo credito non corrisponde a quei «crediti Agent SDK», che indica come non disponibili.
🔗 Pagina di assistenza: crediti API mensili dei piani Max e Team · Annuncio di @ClaudeDevs
IA locale su Windows: NVIDIA apre i preordini dei PC RTX Spark e presenta in anteprima DGX Station for Windows
7 ottobre — NVIDIA e Microsoft sfruttano l’evento Windows AI and Surface, organizzato a San Francisco con un dialogo tra Jensen Huang e Satya Nadella, per lanciare sul mercato RTX Spark, il chip per PC Windows annunciato a Build il 2 giugno. I preordini dei computer portatili sono aperti dal 7 ottobre, con disponibilità il 16 ottobre; i mini-PC seguiranno a novembre. Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI e Gigabyte preparano le loro macchine, e Microsoft presenta un Surface Laptop Ultra costruito attorno al chip. Il post di NVIDIA non indica alcun prezzo.
RTX Spark abbina una GPU Blackwell RTX e una CPU Grace collegate a 600 Go/s, per un petaflop di calcolo IA in FP4 e fino a 128 Go di memoria unificata. NVIDIA mette in evidenza l’esecuzione locale di modelli di grandi dimensioni, senza invio di dati al cloud né contatore d’uso, con lo stesso stack CUDA dei suoi server. Il chip si rivolge anche ai creator (NVFP4, codifica AV1 e 4:2:2 hardware) e ai giocatori, con giochi in 1440p a oltre 100 fotogrammi al secondo grazie a DLSS 5.
Per le aziende, NVIDIA presenta in anteprima DGX Station for Windows, anch’essa annunciata a Build a giugno, che descrive come il primo supercomputer IA desktop dell’ecosistema Windows: consente di eseguire in locale modelli dell’ordine di mille miliardi di parametri senza uscire da Windows, mentre gli strumenti Linux restano accessibili tramite WSL. Non ci sono né una data né un prezzo, soltanto un’iscrizione per ricevere una notifica. Da parte sua, Microsoft porta alla disponibilità generale Microsoft Execution Containers (MXC), l’infrastruttura che esegue gli agenti in background sotto il controllo di Windows.
| Elemento confrontato | RTX Spark | DGX Station for Windows |
|---|---|---|
| Chip | GPU Blackwell RTX (fino a 6 144 core) e CPU Grace (fino a 20 core) | Superchip GB300 Grace Blackwell Ultra Desktop |
| Memoria | Fino a 128 Go, unificata | 748 Go, coerente |
| Calcolo IA in FP4 | 1 petaflop | Fino a 20 petaflop |
| Disponibilità annunciata | Portatili in preordine, disponibili il 16 ottobre; mini-PC a novembre | Anteprima, senza data né prezzo |
🔗 Post di NVIDIA sull’evento Windows
Sviluppare in locale su Windows: Copilot instraderà le richieste verso MAI Code 1.1 Flash, il suo sandbox passa alla disponibilità generale, Replit prepara un’applicazione desktop
7 ottobre — GitHub Copilot sarà presto in grado di scegliere autonomamente tra un modello eseguito sulla macchina dello sviluppatore e un modello nel cloud. Secondo il post di Microsoft e GitHub pubblicato sul blog Microsoft Command Line, questo instradamento arriverà «entro la fine del mese»: non è ancora disponibile. GitHub lo presenta come il passo successivo di Project HydraFusion, il suo orchestratore che distribuisce già le attività tra più modelli, e sottolinea un risparmio di crediti IA, senza quantificarlo.
Sono previste due modalità d’uso in Copilot CLI, nell’app GitHub Copilot e in VS Code. La modalità Auto sceglierà, a ogni turno, tra inferenza locale e cloud in base al contesto dell’attività e allo stato della cache; lo sviluppatore potrà anche indicare personalmente un modello locale, MAI Code 1.1 Flash tramite il fornitore Windows ML oppure qualsiasi modello esposto da un punto di accesso locale (endpoint) compatibile con l’API di OpenAI. Il post lo ricorda: l’inferenza locale non rende la sessione offline.
La dimostrazione viene eseguita su un Surface Laptop Ultra dotato di RTX Spark. Microsoft AI vi esegue una versione locale di MAI Code 1.1 Flash, una miscela di esperti (mixture-of-experts) specializzata nel codice, con 137 miliardi di parametri, di cui 6,8 miliardi attivi. Quantizzato a circa 3,3 bit per peso, occupa 53 Go, l’80 % in meno rispetto alla variante cloud, con un picco di memoria di 75,5 Go a 256 000 token di contesto.
| Benchmark valutato (test Microsoft del 5 ottobre) | MAI Code 1.1 Flash | Versione quantizzata sul dispositivo | GPT OSS 120B (versione GGUF di Unsloth) |
|---|---|---|---|
| SWE-Bench Verified (500 attività) | 72,6 % | 70,80 % | 32,0 % |
| Terminal-Bench 2.1 (89 attività) | 62,9 % | 66,29 % | 23,6 % |
Microsoft precisa che questi test sono stati eseguiti su un ambiente di esecuzione llama.cpp per Windows ARM64 e che i risultati variano in base al dispositivo e alla configurazione. Un primo componente è già disponibile nel terminale: dalla versione di anteprima 1.0.94-0 di Copilot CLI, il comando /model rileva i modelli di un’istanza Ollama locale. Non viene aggiunto nulla senza conferma, Ollama e il modello devono essere già installati e vengono proposti soltanto i modelli che supportano la chiamata di strumenti e il flusso continuo (streaming).
🔗 Portare modelli locali e strumenti in sandbox su Windows e GitHub Copilot · Rilevare i modelli locali in GitHub Copilot CLI
Il sandbox locale di Copilot passa alla disponibilità generale
7 ottobre — Il sandbox locale di GitHub Copilot esce dall’anteprima pubblica aperta il 2 giugno: passa alla disponibilità generale in Copilot CLI, nell’app GitHub Copilot e nelle sessioni VS Code che utilizzano Agent Host, senza costi aggiuntivi. Gli strumenti e i comandi avviati da Copilot vengono quindi eseguiti con un accesso limitato ai file, alla rete, alle credenziali di Git e GitHub CLI e ad altre funzionalità del sistema, secondo criteri definiti dallo sviluppatore o dalla sua organizzazione; un’azienda può imporre impostazioni che gli sviluppatori non possono allentare, indipendentemente dal modello utilizzato. Il motore, Microsoft eXecution Container (MXC), è una libreria open source del team Windows che si basa su ProcessContainer su Windows, Seatbelt su macOS e bubblewrap su Linux, senza macchina virtuale. I suoi limiti sono esplicitati: gli strumenti integrati per i file sono controllati da Copilot stesso e non dal sistema, e i server MCP remoti restano al di fuori del sandbox locale.
🔗 Il sandbox locale di GitHub Copilot è ora generalmente disponibile
Replit crea le applicazioni in locale su Windows
7 ottobre — Replit annuncia, insieme a Microsoft, l’anteprima di un’applicazione desktop che crea ed esegue le applicazioni direttamente sul computer dell’utente, su Windows. Replit offriva già un’applicazione desktop: la novità consiste in questa creazione locale, in cui ogni build viene eseguita nel proprio sandbox, basato su Microsoft Execution Containers e su OpenShell, l’ambiente di esecuzione open source di NVIDIA. L’accesso anticipato avviene tramite una lista d’attesa, senza data né prezzo, e non viene menzionata alcuna versione per macOS. Replit ha presentato questa anteprima sul palco durante l’evento Windows del 7 ottobre.
🔗 Annuncio di Replit su X · Lista d’attesa per l’anteprima
OpenAI pubblica 722 manoscritti di risultati matematici prodotti da un modello interno
6 ottobre — OpenAI pubblica in un’unica volta un ampio insieme di risultati matematici prodotti da un modello interno all’avanguardia, che non è disponibile al pubblico. Annunciato la sera del 6 ottobre, il repository GitHub openai/math raccoglie 722 manoscritti raggruppati in 372 famiglie suddivise per disciplina: un risultato principale può essere accompagnato da argomentazioni complementari, conseguenze o dimostrazioni alternative.
La grande maggioranza dei risultati deriva dalla stessa procedura: circa 4 000 problemi sottoposti al modello, con una media equivalente a tre ore di ragionamento di ChatGPT Pro per risultato. OpenAI spiega di aver esteso le proprie valutazioni a problemi di ricerca aperti dopo aver saturato le valutazioni matematiche esistenti. Due lavori fanno eccezione a questa procedura: una regione priva di zeri della funzione zeta di Riemann, la cui stesura è stata rivista da una persona per migliorarne la leggibilità, e la dimostrazione di un caso particolare della congettura di Hodge, quello delle varietà abeliane CM.
| Indicatore pubblicato da OpenAI | Valore annunciato |
|---|---|
| Manoscritti pubblicati | 722 |
| Famiglie di risultati | 372 |
| Problemi sottoposti al modello | Circa 4 000 |
| Calcolo medio per risultato | Circa tre ore di ragionamento di ChatGPT Pro |
| Sintesi del ragionamento pubblicate | 10 |
Non tutti i risultati vengono verificati allo stesso modo. Molte dimostrazioni sono formalizzate in Lean, un linguaggio che permette di verificare una dimostrazione al computer, ma non tutte: OpenAI avverte che «alcuni risultati non formalizzati potrebbero contenere errori», promette di correggerli rapidamente e aggiungerà progressivamente nuove formalizzazioni. Le dieci sintesi del ragionamento del modello riguardano temi come l’esponente di irrazionalità di π, le congetture di Mahler, la congettura di finitezza diretta di Kaplansky in caratteristica due o l’isomorfismo dei fattori di gruppi liberi.
La pubblicazione stessa è stata preparata insieme al gruppo consultivo indipendente sulla matematica e l’IA dell’Institute for Advanced Study: protocolli di revisione e citazione, correzioni pubblicate come nuove versioni, cronologia conservata. OpenAI annuncia anche il finanziamento di workshop, conferenze e programmi dedicati a questi risultati e afferma di lavorare a un accesso «responsabile» degli scienziati al modello che li ha prodotti, senza indicare una tempistica.
We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.
🇮🇹 Pubblichiamo un’ampia gamma di nuovi risultati matematici prodotti da un modello interno all’avanguardia. Abbiamo consultato il gruppo consultivo indipendente sulla matematica e l’intelligenza artificiale dell’Institute for Advanced Study e ci siamo basati sui suoi consigli e sulle sue raccomandazioni pubbliche per decidere come pubblicare questi risultati. — @OpenAI su X
🔗 Condividere i progressi dell’IA nella matematica · Repository openai/math su GitHub
Perplexity pubblica pplx-embed-v2-late, embeddings multivettoriali per testo e immagini
7 ottobre — Perplexity Research pubblica pplx-embed-v2-late, due modelli di embeddings a interazione tardiva (late interaction) da 0.6B e 9B parametri, disponibili su Hugging Face con licenza MIT. Mentre un embedding denso comprime ogni documento in un unico vettore, questi modelli di tipo ColBERT mantengono un vettore di 128 dimensioni per token e assegnano un punteggio a ogni coppia query-documento tramite MaxSim: ogni token della query viene associato al token più vicino del documento. Cercano in testi, immagini e pagine renderizzate (PDF, diapositive, scansioni) senza passare dall’OCR, preservando così tabelle, figure e impaginazione.
I modelli nelle due taglie condividono lo stesso spazio di embeddings, perché vengono distillati token per token da un modello insegnante interno da 18B, derivato da una base da 27B. Un corpus indicizzato con il 9B può quindi essere interrogato con query codificate dal 0.6B: su ViDoRe v3 per le immagini, questa configurazione raggiunge il 63,5 %, contro il 62,3 % con il 0.6B su entrambi i lati, senza costi aggiuntivi per la query. Il 0.6B, ottenuto tramite pruning da Qwen3.5-0.8B, funge quindi da encoder leggero per le query, anche sul dispositivo.
| Benchmark valutato (misurazioni di Perplexity) | Punteggio del 9B | Punteggio del 0.6B | Termine di confronto |
|---|---|---|---|
| 72 attività specializzate (nDCG@10) | 81,3 % | 78,0 % | Il 9B supera di 1,6 punti il modello successivo |
| Q2D-Web, ricerca web (Recall@1000) | 74,8 % | 73,6 % | nemotron-embed-8b: 69,3 % |
| ViDoRe v3 per le immagini (nDCG@10) | 65,2 % | 62,3 % | Solo EVIE supera il 9B |
| BrowseComp+ (agente GPT-OSS-120B) | 64,0 % | — | Il successivo miglior ColBERT: 4,9 punti in meno |
| MADQA (agente Gemini 3.5 Flash) | 92,4 % | 90,1 % | Mixedbread Agentic Search: 93,4 % |
Il 9B non vince ovunque, e Perplexity lo scrive: EVIE, di Tencent, lo supera su ViDoRe v3 per le immagini, gemini-embedding-2 su MIRACL-Vision e sul benchmark interno PPLX-Q2I, mentre Mixedbread Agentic Search ottiene un punteggio migliore su MADQA, uno scarto che Perplexity ritiene compreso nel proprio intervallo di confidenza. L’azienda riconosce anche che lo spazio di archiviazione e il costo del calcolo dei punteggi aumentano con la lunghezza dei documenti. Un rapporto tecnico è annunciato « più avanti quest’anno », e Perplexity prevede di rendere progressivamente disponibili i suoi embeddings a interazione tardiva, densi e contestuali sulla propria piattaforma API, senza indicare una data.
🔗 Articolo di Perplexity Research · pplx-embed-v2-late-9b su Hugging Face
Agenti di codice: Claude Code 2.1.293, Codex CLI 0.161.0, Cursor su iOS, Antigravity 2.21.0 e Warp Factories
Cinque strumenti per agenti di codice si evolvono: Claude Code adotta Haiku 5.5, Codex CLI si connette ai server MCP dal terminale, Cursor si controlla da un iPhone, Antigravity raggruppa le azioni del proprio agente e Warp si apre agli strumenti di Microsoft.
Claude Code 2.1.293 passa a Haiku 5.5 come modello predefinito
7 ottobre — Pubblicata pochi minuti dopo l’annuncio di Haiku 5.5, la versione 2.1.293 di Claude Code lo rende il modello Haiku predefinito sull’API Anthropic. Aggiunge un campo agentType al payload di subagentStatusLine, per distinguere i sottoagenti personalizzati, e un’opzione isDeferred che espone fin dall’inizio lo schema degli strumenti dichiarati dai mod. Il grosso consiste in 38 correzioni su 56 voci: Claude poteva collocare dopo una compattazione le ultime azioni compiute prima di essa, per poi rimuovere o rifare un lavoro già completato; le regole limitate a un percorso e i CLAUDE.md annidati vengono caricati anche quando Claude legge un file con cat o grep in Bash; viene eliminata una perdita di memoria delle connessioni MCP HTTP. Due modifiche recenti vengono annullate (il messaggio di rifiuto della modalità auto della 2.1.281, una correzione delle sessioni cloud della 2.1.290), e il limite delle regole di canale di Claude Tag passa da 20 a 50.
🔗 Claude Code 2.1.293 su GitHub
Codex CLI 0.161.0 rende Daybreak opzionale
7 ottobre — Codex CLI 0.161.0 è la prima versione stabile dalla 0.160.1 del 5 ottobre. Il comando /mcp login <name> permette di connettersi a un server MCP senza uscire dalla sessione di terminale in corso, e le conversazioni vocali consentono ora di scegliere il microfono, l’altoparlante e i canali di ingresso. Daybreak, la gamma cyber di OpenAI, diventa opzionale: l’interruttore /daybreak e lo stato Daybreak nella riga di stato rimangono nascosti finché l’utente non lo attiva con --enable cli_daybreak (o features.cli_daybreak=true), e senza questa opzione il routing Cyber automatico viene omesso. Per un singolo turno, codex exec --cyber-access-program seleziona un programma di accesso Cyber. Su Amazon Bedrock, il multi-agent V2 e lo sforzo di ragionamento Ultra arrivano sui modelli compatibili, e Bedrock Mantle accetta le regioni AWS GovCloud. Le correzioni riguardano i permessi, la ripresa dei thread e il rilevamento di un database SQLite danneggiato.
Cursor controlla da iOS gli agenti del computer
6 ottobre — L’applicazione iOS di Cursor mostra ora gli agenti in esecuzione in locale sul computer: si vede cosa fa ciascuno e gli si può rispondere, e il tweet di annuncio menziona anche l’avvio di nuove attività. Gli agenti rimangono sulla macchina e l’applicazione vi si connette: il computer deve quindi restare acceso e online, e un’impostazione Keep this computer awake impedisce che entri in sospensione, con la macchina collegata all’alimentazione e lo schermo aperto. La funzione è attiva per impostazione predefinita, tranne nelle organizzazioni Enterprise, dove deve essere attivata da un amministratore; l’abbinamento viene confermato nell’applicazione desktop, e gli agenti cloud non sono necessari. L’applicazione iOS uscita a fine giugno metteva in evidenza gli agenti cloud: ora sono gli agenti locali a diventare accessibili dal telefono.
Antigravity 2.21.0 raggruppa le azioni del proprio agente
6 ottobre — L’applicazione Antigravity di Google passa alla versione 2.21.0, con 9 miglioramenti e 14 correzioni. La ricerca avanzata ritrova una conversazione in base al suo contenuto, con ⌘+K (Ctrl+K su Windows). La scheda delle attività pianificate (Scheduled Tasks) diventa Automations: da lì si può avviare subito un’automazione con Run Now, oppure chiedere all’agente di guidare la creazione di una nuova con Create with Prompt. Le modifiche ai file, i comandi del terminale e le letture che l’agente esegue tra due risposte vengono ora raggruppati in un’unica riga comprimibile, accompagnata da un breve riepilogo. Tra le correzioni, un video MP4 o MOV troncato letto dall’agente poteva far fallire tutto il seguito della conversazione, e un file di impostazioni salvato con il Blocco note di Windows o PowerShell smetteva di funzionare. Il changelog avverte che una versione può impiegare qualche giorno per raggiungere tutti gli utenti.
Warp Factories si apre a Microsoft Teams e Azure DevOps
7 ottobre — Warp apre Warp Factories, la sua piattaforma di fabbriche di software (software factories), a Microsoft Teams e Azure DevOps Services. In Teams, menzionare l’applicazione Warp in un canale o in un thread configurato affida l’attività alla fabbrica insieme al contesto della conversazione; la fabbrica comunica i progressi nello stesso thread e vi invia le proprie pull request per la revisione. In Azure DevOps, si menziona la fabbrica da un elemento di lavoro (work item) o da una pull request, oppure si avviano esecuzioni in risposta ai loro eventi; ogni fabbrica riceve una propria identità per le operazioni Git, con accesso limitato ai repository scelti. Entrambe le integrazioni sono disponibili per tutti i clienti di Warp Factories. Warp presenta questo duplice supporto nativo come una novità assoluta nel settore; Devin si integrava già con Teams e Azure DevOps Server.
API e piattaforme: i toolsets computer use e browser use degli SDK Claude, Grok 4.7 su Microsoft Foundry
Due annunci per gli sviluppatori che costruiscono su modelli ospitati: Anthropic semplifica il controllo di un computer o di un browser, e Grok 4.7 arriva in disponibilità generale su Microsoft.
I toolsets computer use e browser use degli SDK Claude
7 ottobre — Gli SDK Python e TypeScript di Claude integrano, in beta, gli insiemi di strumenti (toolsets) computer use e browser use. Finora, l’API indicava cosa Claude voleva cliccare o digitare, e bisognava scrivere un proprio ciclo per tradurre ogni azione in un comando. Ora è il SDK a gestire questo ciclo: lo sviluppatore crea una sottoclasse di BetaAbstractBrowserToolset20260801 o BetaAbstractComputerToolset20260801, scrive un metodo per ogni azione, e il SDK instrada le chiamate, applica le policy fornite per URL e file, richiede le approvazioni e costruisce i risultati restituiti al modello. Anthropic non fornisce né un browser né un driver pronto all’uso: si collega la propria automazione o un driver di Browser Use, Browserbase, E2B o Daytona, e nel repository claude-quickstarts è pubblicato un esempio minimo in Chrome DevTools Protocol. L’esecuzione di JavaScript e l’invio di file sono disattivati per impostazione predefinita, e senza una policy per gli URL nessun indirizzo viene verificato.
🔗 Thread di @ClaudeDevs su X · Documentazione dei toolsets del SDK
Grok 4.7 in disponibilità generale su Microsoft Foundry
7 ottobre — Grok 4.7, il modello di SpaceXAI uscito il 21 settembre, è disponibile su Microsoft Foundry, ha annunciato @SpaceXAI nella notte. La documentazione di Microsoft lo classifica in disponibilità generale, tra i modelli venduti direttamente da Azure: testo e immagini in ingresso, contesto di 500 000 tokens (ingresso e uscita combinati), chiamate agli strumenti, accesso tramite Chat Completions o Responses API, e sforzo di ragionamento da low a xhigh, con high come valore predefinito. Microsoft si impegna a offrire i modelli Grok in disponibilità generale, a partire da Grok 4.7, per almeno sei mesi; Grok 4.6 vi figura ancora in anteprima. La pagina dei prezzi di Azure non elencava ancora Grok 4.7 la sera del 7 ottobre. Dopo Amazon Bedrock (28 settembre) e Google Cloud in anteprima (1° ottobre), Grok 4.7 è quindi disponibile presso i tre grandi fornitori di cloud.
🔗 Distribuire e usare i modelli Grok in Microsoft Foundry
Modelli aperti: Open d1 di Liquid AI, Bolmo di Ai2 su Nature con Bwen 8B e Blama 8B
Due pubblicazioni con pesi aperti, una per prendere decisioni rapide alla periferia della rete, l’altra per leggere il testo byte per byte.
Open d1, i modelli decisionali aperti di Liquid AI
7 ottobre — Liquid AI apre la propria famiglia di modelli decisionali con Open d1: due modelli con pesi aperti, d1-3B (testo e immagini) e d1-omni-600M (testo con immagini o audio), quest’ultimo in una versione iniziale per la ricerca. Non generano testo: assegnano in un solo passaggio una probabilità a ogni risposta consentita. Secondo Liquid AI, d1-3B ottiene 48,57 sul Decision Index 0.2.1, il miglior punteggio sotto i 10 miliardi di parametri, davanti a Decider 35B-A3B (47,11), e una media di 82,9 su sette dataset pubblici. Misurata insieme a NVIDIA, la sua latenza per una domanda va da 8 ms su una RTX 4090 a 50 ms su un Jetson Orin Nano, abbastanza per puntare alla periferia della rete (edge). Non è stato pubblicato alcun benchmark per la visione o l’audio. I pesi sono su Hugging Face con la licenza proprietaria di Liquid AI (lfm1.0), con versioni GGUF; il d1 del 29 settembre era accessibile soltanto tramite API.
🔗 Articolo di Liquid AI su Hugging Face
Bolmo di Ai2 su Nature, con Bwen 8B e Blama 8B
7 ottobre — Ai2 pubblica su Nature, online il 7 ottobre, il metodo alla base di Bolmo, la sua famiglia di modelli completamente aperti che leggono direttamente i byte anziché le sottoparole. Leggere i byte evita i punti ciechi di un vocabolario fisso (ortografia, stringhe insolite, alcuni sistemi di scrittura), ma finora richiedeva un addestramento completo da zero. La conversione in byte (byteifying) parte invece da un modello a sottoparole già performante e lo trasforma con un breve addestramento aggiuntivo. Bolmo 1B e 7B, derivati da Olmo, risalgono a dicembre; Ai2 presenta anche Bwen 8B (derivato da Qwen 3 8B, licenza Apache-2.0) e Blama 8B (derivato da Llama 3 8B, licenza llama3), i cui repository esistono dal 26 agosto, oltre a checkpoint « Stage 1 » in cui viene addestrato soltanto il nuovo livello per i byte. Secondo Ai2, i due modelli si avvicinano ai rispettivi modelli di origine e Bwen 8B supera Bolmo 7B, senza cifre pubblicate.
SynthID Detector aperto a tutti per verificare immagini, video e suoni
7 ottobre — Google apre a tutti SynthID Detector, lo strumento che rileva le filigrane invisibili SynthID nei contenuti generati dall’IA. Presentato l’anno scorso in una versione preliminare destinata ai professionisti dei media, è accessibile su synthid.com, in tutto il mondo e in inglese. Si può caricare un’immagine, un video o un file audio. La verifica copre i contenuti di Google e quelli dei suoi partner OpenAI, NVIDIA e Kakao, e presto Apple. Il portale avverte che non si tratta di un rilevatore di IA generalista: un contenuto prodotto da un modello senza SynthID, o pesantemente modificato, può risultare « non rilevato ». Google dichiara oltre 180 miliardi di immagini e video e 240 000 anni di audio con filigrana dal 2023, rispetto ai 100 miliardi e ai 60 000 anni annunciati a luglio, e oltre un milione di verifiche al giorno in Search, nell’applicazione Gemini e in Chrome.
🔗 Google estende SynthID Detector per i contenuti IA
Sicurezza: il classificatore di GitHub per i segreti esposti
7 ottobre — GitHub mette in servizio un classificatore ModernBERT perfezionato tramite fine-tuning, dedicato ai segreti esposti e realizzato insieme a Microsoft Applied Sciences: legge il codice attorno a un valore per individuare probabili credenziali, comprese password prive di un formato riconoscibile. Valuta un insieme di candidati in meno di 2 ms e potrebbe, secondo GitHub, « più che raddoppiare » i segreti bloccati durante il push. Da subito, gli avvisi per le password rilevate dall’IA passano a questo modello, senza costi aggiuntivi. La protezione dei push tramite IA, in anteprima privata, dovrebbe arrivare « più avanti questo mese » per le organizzazioni idonee, e le verifiche del comando /security-review di Copilot entreranno « presto » in anteprima privata, in entrambi i casi con crediti IA. L’articolo di Erin Havens, responsabile del prodotto sicurezza di GitHub, ricorda che una pull request su tre coinvolge un agente IA e che la protezione dei push blocca soltanto circa il 30 % dei nuovi segreti rilevati.
🔗 La protezione dei segreti deve crescere di pari passo con il software
Infrastruttura: GitHub ricostruisce Git per l’attività degli agenti
6 ottobre — GitHub ricostruisce la propria infrastruttura Git per tenere il passo con lo sviluppo agentico. Secondo il post di ingegneria di Brian Celenza, l’attività Git totale è passata da 218,2 a 473,3 miliardi di eventi al mese tra settembre 2025 e agosto 2026; sviluppatori e agenti hanno prodotto 7,38 miliardi di commit a settembre 2026, più di cinque volte il dato di un anno prima, e i push sono aumentati di 4,9 volte. L’architettura attuale, Spokes, replica ogni repository su più server e convalida ogni aggiornamento con un voto a maggioranza: aggiungere copie per le letture rallenta quindi le scritture. La nuova architettura separa storage e calcolo, con i dati di riferimento in Azure Blob Storage e processi leggeri (workers) che servono le letture da una cache. Nei suoi benchmark interni, GitHub misura un throughput di scrittura fino a 35 volte superiore, senza indicare una data per il passaggio.
🔗 Costruire un’infrastruttura Git per lo sviluppo su scala agentica
IA vocale: ElevenLabs firma un protocollo d’intesa con uno Stato indiano
7 ottobre — In occasione del suo Summit di Bengaluru, ElevenLabs ha firmato il suo primo protocollo d’intesa (MOU) con il governo di uno Stato indiano, per un progetto pilota di IA vocale. L’azienda non nomina lo Stato e non fornisce né tempistiche, né ambito, né importo: l’annuncio si limita a un tweet, senza un post sul blog. Il dato che lo accompagna chiarisce la posta in gioco: nell’ultimo anno, ElevenAgents ha condotto più di 100 milioni di conversazioni in India, di cui oltre il 70 % in hindi, kannada, tamil e telugu. Il Summit ha riunito più di 500 dirigenti d’azienda, sviluppatori e partner.
🔗 Annuncio di @ElevenLabs su X
Ricerca: PivotOPD, il metodo di NVIDIA per recuperare dall’errore decisivo di un agente
7 ottobre — I ricercatori di NVIDIA presentano PivotOPD, un metodo di addestramento per gli agenti che eseguono più turni d’azione consecutivi. La loro osservazione: su ALFWorld, il 59 % dei fallimenti di tre modelli Qwen3 contiene un «errore pivot», commesso nelle prime fasi, dopo il quale l’agente prosegue nella direzione sbagliata. PivotOPD estende la distillazione on-policy (on-policy distillation): a ogni errore pivot, un modello insegnante indica l’azione corretta, poi un’azione di recupero per i turni successivi, così che l’allievo impari a evitare l’errore e a riprendersi. Nel confronto con 13 metodi di riferimento, ottiene la media migliore su ALFWorld, WebShop e Search-based QA con allievi Qwen3 da 1.7B e 8B, e recupera dal 72,7 % dei 72 errori pivot riprodotti, contro il 20,3 % della distillazione standard. Il miglioramento si trasferisce al codice: un allievo Nemotron-3.5 passa dal 62,8 % al 66,0 % su SWE-Bench Verified. L’articolo è su arXiv; la pubblicazione del codice è annunciata a breve.
🔗 Pagina del progetto PivotOPD
Ottimizzazione: mPDLP distribuisce i programmi lineari giganteschi su più GPU in cuOpt
7 ottobre — NVIDIA aggiunge a cuOpt, la sua libreria open source di ottimizzazione, mPDLP, un solutore di programmazione lineare distribuito su più GPU collegate tramite NVLink, per grandi problemi di pianificazione (catene logistiche, reti elettriche). Raggruppando sulla stessa GPU le variabili e i vincoli interdipendenti, limita gli scambi e riduce fino a 6 volte la memoria di picco per GPU. Su un nodo DGX B200, l’accelerazione raggiunge 11,4 volte per il calcolo PDLP e 4,2 volte sull’intero processo; rispetto a D-PDLP, mPDLP è da 1,2 a 2,5 volte più veloce sulla maggior parte dei grandi problemi, ma più lento sulle tre istanze più grandi e sui problemi piccoli. Kinaxis risolve 3,3 volte più velocemente una catena logistica con oltre 135 milioni di variabili su otto H100, PSR risolve oltre 5 volte più velocemente un modello energetico con 185 milioni di variabili su otto B200.
Robotica: i robot assemblano i vassoi di test GB300
7 ottobre — Il Seattle Robotics Lab di NVIDIA racconta come insegna ai robot ad assemblare i vassoi di test dei GB300, che verificano i moduli prima della spedizione. Con Foxconn, che produce questi sistemi, sono state scelte due operazioni: posizionare e avvitare in 16 punti una sbarra collettrice e collegare quattro connettori montati su cavi flessibili. Il requisito stabilito con Foxconn è un tasso di successo del 99,5 %, in un tempo non superiore al doppio di quello di un operatore qualificato, senza collisioni. I robot si avvicinano all’obiettivo senza raggiungerlo: oltre il 95 % di successo in 160 secondi per la sbarra, contro un obiettivo di 124, e dal 90 al 95 % per i connettori, con 40 secondi per cavo. Il team combina una pipeline classica di percezione e controllo, la stima della posa DOPER e l’apprendimento per rinforzo in Isaac Lab, corretto sul robot reale. NVIDIA promette di pubblicare DOPER e il suo orchestratore TALOS, senza indicare una data.
🔗 Post del blog tecnico NVIDIA sui vassoi GB300
Notizie brevi
- L’app iOS di ChatGPT 1.2026.272 — Mostra le anteprime delle pagine direttamente nelle risposte, apre i link delle attività Codex nell’applicazione e, sul versante Codex Mobile, ripensa il selettore di approvazione e accelera il flusso dei thread lunghi. 🔗 fonte
- Radisson Hotel Group — Secondo uno studio di caso di OpenAI, il suo plugin ChatGPT, sviluppato in sei settimane con Accenture Song, converte circa 1,5 volte meglio della sua ricerca organica nel periodo luglio-agosto 2026, e il 54 % degli eventi di pagamento e prenotazione della sua campagna pubblicitaria in ChatGPT è attribuito a semplici visualizzazioni degli annunci. 🔗 fonte
- Jump Trading — La società di trading quantitativo affida ad agenti GPT-6 Astra analisi che possono durare diversi giorni incrociando numerose fonti di dati, con una revisione umana alla fine del processo; lo studio di caso di OpenAI non pubblica alcun dato sui miglioramenti. 🔗 fonte
- Estensioni dei plugin ChatGPT — Nel thread del suo tutorial video, OpenAI Developers cita Adobe, Canva, Figma, Shopify, Instacart e Atlassian tra le aziende che le utilizzano, oltre a tldraw e MagicPath; presentate il 29 settembre, avviano un plugin dalla barra laterale, gestiscono le menzioni @ e aggiungono visualizzatori di file. 🔗 fonte
- Every e Claude Managed Agents — Il team di Every ha costruito su Claude Managed Agents un agente aziendale che tutti utilizzano in Slack per condividere le proprie skills a ogni nuovo modello, poi lo ha reso disponibile ai propri abbonati; Anthropic rilancia un’intervista video, senza dati numerici. 🔗 fonte
- Zed 1.23 e anteprima 1.24.1 — La 1.23 diventa stabile con la sua anteprima dei file JSONL e NDJSON, e l’anteprima 1.24.1 permette di trascinare una scheda del terminale nell’Agent Panel, accetta modelli Amazon Bedrock personalizzati con strumenti, immagini e ragionamento, crea tag Git e riduce di circa il 23 % le dimensioni del binario Linux. 🔗 fonte
- Puck, il meta-agente di Amp — Ora accetta più conversazioni separate: il pulsante + ne apre una, un clic sul suo nome permette di passare dall’una all’altra, e quelle rimaste inattive per tre giorni vengono archiviate separatamente. 🔗 fonte
- Copilot CLI 1.0.93 — Diventata stabile, applica le modifiche alla configurazione dei server MCP tra un turno e l’altro, senza riavviare la sessione, e rende disponibile a tutti la sandbox dei comandi tramite /sandbox e —sandbox; anche il SDK Copilot 1.0.17 diventa stabile. 🔗 fonte
- Le metriche di utilizzo di Copilot — Sottostimavano l’attività degli agenti da quando diversi IDE fanno passare le proprie sessioni attraverso il Copilot SDK; la correzione richiede un aggiornamento (VS Code 1.139.0 già disponibile, Visual Studio 18.12 a ottobre, JetBrains a fine ottobre, Eclipse e Xcode entro novembre), e i dati persi non verranno recuperati. 🔗 fonte
- Gemini CLI v0.65.0-nightly.20261007 — Questa versione nightly inaugura la serie 0.65.0 con cinque correzioni, di cui due contro la perdita di dati: le impostazioni del progetto diventano di sola lettura in una cartella non attendibile, dove
gemini mcp addpoteva svuotare.gemini/settings.json, e uscire immediatamente da una sessione ripresa non ne elimina più la cronologia. 🔗 fonte - Transformers.js 4.3.1 — Il giorno dopo il lancio di EmbeddingGemma 2, la libreria calcola i suoi embeddings multimodali (740 milioni di parametri, 768 dimensioni) direttamente nel browser, tramite WebGPU o WASM, oppure in Node.js. 🔗 fonte
- RL Environment Explorer — Adithya S K, di Hugging Face, presenta questo Space di FineEnvs per esplorare, visualizzare e avviare gli ambienti di apprendimento per rinforzo dell’Hub (OpenEnv, Harbor, MiMo, Verifiers, NeMo Gym): oltre 12 milioni di voci di attività, provenienti soprattutto da alcuni grandi ambienti OpenEnv. 🔗 fonte
- Seb-9B — Stas Veretennikov pubblica questo modello decisionale locale con licenza Apache-2.0 (testo, JSON o immagine, fino a 20 opzioni), che ottiene una media di 0,792 su 17 suite pubbliche contro 0,786 di Jev 1.13; l’autore ha effettuato tutte le misurazioni e precisa che i suoi dati di addestramento comprendevano la parte di addestramento di uno dei benchmark, senza i relativi casi di test. 🔗 fonte
- Nemotron alle olimpiadi 2026 — NVIDIA descrive la ricetta comune (affinamento supervisionato, apprendimento per rinforzo, ciclo che genera, verifica e corregge) alla base di 535,4 su 600 all’IOI 2026, con partecipazione non ufficiale, e di 30 su 42 all’IMO 2026, con una soglia per l’oro di 29, e pubblica il benchmark Nemotron-IMO-Bench con 200 problemi. 🔗 fonte
- Instadocs: AI Gone Wild — Netflix annuncia per il 12 ottobre questo documentario che ricostruisce l’attacco informatico subito da Hugging Face a luglio, condotto secondo Netflix da agenti autonomi creati da ricercatori di OpenAI. 🔗 fonte
- Runway nel catalogo delle applicazioni di ChatGPT — Una volta installato il plugin e collegato l’account Runway, una menzione @Runway in una conversazione gli affida la generazione di immagini o video; Runway non precisa né il prezzo né il costo in crediti. 🔗 fonte
- Face Swap di Luma — La funzione sostituisce il volto di un personaggio in un’inquadratura esistente per iterare senza ricominciare tutto; l’annuncio si limita a due tweet, senza pagina del prodotto, prezzo o dettagli sul modello. 🔗 fonte
- DSX Air — NVIDIA mostra come testare le modifiche di una fabbrica IA su questo gemello digitale: gli agenti applicano la modifica, verificano configurazione, sicurezza e isolamento, poi producono un rapporto, mentre il passaggio in produzione resta soggetto a una convalida umana; un post sul metodo, senza dati numerici. 🔗 fonte
- cuPhoton — Un tutorial di NVIDIA applica questo toolkit open source all’analisi di immagini astronomiche su GPU, dalla lettura dei file FITS alla revisione dei candidati; i miglioramenti annunciati, fino a 14 900 volte, riguardano alcune operazioni e non l’intera elaborazione. 🔗 fonte
- Cosmos e SynthID — I contenuti generati dai modelli NVIDIA Cosmos su build.nvidia.com portano la filigrana SynthID e ora possono essere verificati da chiunque con il rilevatore reso accessibile da Google. 🔗 fonte
- Il SDK TypeScript di SpaceXAI 0.2.3 — Aggiunge un livello di servizio
fast, intercambiabile conpriority, e l’identificatoregrok-imagine-video-1.5-lite, un modello video più leggero assente dalle note di rilascio: secondo i dati della pagina dei modelli, non accetta audio in ingresso e costa quattro volte meno al secondo rispetto agrok-imagine-video-1.5in 480p. 🔗 fonte - Guida RAG vs. LLM — Perplexity pubblica una guida didattica che presenta RAG e LLM come complementari, distingue tre tipi di RAG (ingenuo, modulare, avanzato) e precisa quando basta un LLM da solo; nessuna nuova funzionalità o dato numerico. 🔗 fonte
Cosa significa
I piccoli modelli diventano il prodotto di massa. Dall’8 ottobre è GPT-6 Luna a rispondere agli utenti gratuiti di ChatGPT, e Anthropic propone Haiku 5.5 a 0,10 dollari per milione di token in ingresso sotto i 100 000 token di prompt, dimezzando al contempo il prezzo delle letture della cache di Sonnet 5.5. Questi modelli assorbono la maggior parte del volume: conversazioni quotidiane, sottoagenti, riassunti, compattazioni. La classifica di Cursor ricorda tuttavia che il prezzo per token non dice tutto: con effort Max, Haiku 5.5 consuma quasi nove volte più token per attività rispetto a Sonnet 5.5 con effort High, con un costo per attività appena inferiore (1,12 dollari contro 1,20). Il credito API mensile dei piani Max e Team invita invece gli abbonati a provare questi modelli nel proprio codice.
L’IA torna anche sulla postazione di lavoro. I portatili RTX Spark arrivano il 16 ottobre, DGX Station for Windows promette fino a 20 petaflop su una scrivania, e Copilot dovrebbe affidare autonomamente alcune attività a MAI Code 1.1 Flash in locale entro la fine del mese. Replit ora costruisce le applicazioni sulla macchina dell’utente. Gli agenti che eseguono codice su un computer personale pongono una questione di sicurezza, e lo stesso componente ricorre ovunque: Microsoft Execution Containers (MXC), in disponibilità generale su Windows, isola sia i comandi di Copilot sia le build di Replit. GitHub, da parte sua, distribuisce un classificatore dedicato ai segreti divulgati e ricostruisce la propria infrastruttura Git, perché una pull request su tre coinvolge già un agente e i commit sono aumentati di oltre cinque volte in un anno.
La risposta diventa anche un’interfaccia. Con Intelligent UI, ChatGPT risponde con grafici, moduli o un piccolo strumento costruito su richiesta, e comincia a rispondere prima di aver finito di ragionare. Sul versante degli sviluppatori, i SDK di Claude supportano il ciclo di computer use e browser use, e Cursor permette di seguire da un iPhone gli agenti che lavorano sul computer e di rispondere loro. In questi tre casi, il testo è ormai soltanto una parte dello scambio: l’IA mostra, clicca e riferisce, l’utente supervisiona.
Infine, molti dei dati del giorno sono misurati da chi li pubblica: i benchmark di Haiku 5.5 da Anthropic, quelli di MAI Code 1.1 Flash da Microsoft, Q2D-Web da Perplexity, che lo ha progettato, i punteggi di Open d1 da Liquid AI, e il throughput di scrittura aumentato di 35 volte dai test interni di GitHub. La stessa OpenAI avverte che i risultati non formalizzati dei suoi 722 manoscritti possono contenere errori, e i suoi miglioramenti di velocità per GPT-6 provengono da valutazioni interne. Queste misurazioni restano utili per collocare i prodotti gli uni rispetto agli altri; le valutazioni esterne, come la classifica CursorBench, in cui un produttore di strumenti misura il modello di un altro, permetteranno di verificarle tramite riscontri incrociati.
Fonti
- GPT-6 e Intelligent UI per tutti (OpenAI)
- Annuncio di GPT-6 per tutti (@OpenAI)
- Scheda di sistema di GPT-6 Sol e GPT-6 Luna, aggiornamento di ottobre
- GPT-6 e altri modelli in ChatGPT
- Note di rilascio di ChatGPT
- Caricare file e audio su ChatGPT
- Aiutare gli adolescenti a imparare, pianificare e plasmare il futuro dell’AI (OpenAI)
- Annuncio di Claude Haiku 5.5 (Anthropic)
- Lancio di Claude Haiku 5.5 (@claudeai)
- Guida alla migrazione a Haiku 5.5
- Haiku 5.5 in Cursor (@cursor_ai)
- Classifica CursorBench
- Crediti API mensili dei piani Max e Team (assistenza Claude)
- Annuncio del credito API (@ClaudeDevs)
- RTX Spark e DGX Station for Windows (blog NVIDIA)
- Portare modelli locali e strumenti in sandbox su Windows e GitHub Copilot (Microsoft Command Line)
- Scopri i modelli locali in GitHub Copilot CLI
- Il sandboxing locale per GitHub Copilot è ora disponibile per tutti
- Anteprima dell’applicazione desktop Replit (@Replit)
- Lista d’attesa dell’applicazione desktop Replit
- Condividere i progressi dell’IA in matematica (OpenAI)
- Repository openai/math
- Annuncio dei risultati matematici (@OpenAI)
- Embedding multimodali oltre un singolo vettore (Perplexity Research)
- pplx-embed-v2-late-9b su Hugging Face
- Claude Code 2.1.293
- Codex CLI 0.161.0
- Controllo remoto per gli agenti locali (changelog di Cursor)
- Changelog di Antigravity
- Warp Factories, Microsoft Teams e Azure DevOps (blog di Warp)
- Toolsets computer use e browser use negli SDK (@ClaudeDevs)
- Documentazione dei toolsets dell’SDK Claude
- Distribuire e utilizzare i modelli Grok in Microsoft Foundry
- Open d1 (Liquid AI su Hugging Face)
- Bolmo su Nature (Ai2)
- Google amplia SynthID Detector per i contenuti AI
- La protezione dei segreti deve crescere insieme al software (GitHub)
- Costruire un’infrastruttura Git per lo sviluppo su larga scala con agenti (GitHub)
- Protocollo d’intesa con uno Stato indiano (@ElevenLabs)
- PivotOPD (NVIDIA Research)
- mPDLP in cuOpt (blog tecnico NVIDIA)
- Le macchine che costruiscono le macchine (blog tecnico NVIDIA)
- Changelog di ChatGPT e Codex, ChatGPT per iOS 1.2026.272
- Radisson Hotel Group porta la ricerca di hotel in ChatGPT (OpenAI)
- Come Jump Trading amplia la ricerca quantitativa con ChatGPT (OpenAI)
- Estensioni dei plugin ChatGPT (@OpenAIDevs)
- Every e Claude Managed Agents (@claudeai)
- Zed v1.24.1-pre
- Tanti, tanti Pucks (Amp)
- Copilot CLI 1.0.93
- Aggiorna il tuo IDE per ripristinare l’attività degli agenti nelle metriche di utilizzo di Copilot
- Gemini CLI v0.65.0-nightly.20261007
- Transformers.js 4.3.1
- RL Environment Explorer (@adithya_s_k)
- Seb-9B a confronto diretto (blog Hugging Face)
- Nemotron all’IOI e all’IMO 2026 (blog Hugging Face)
- Instadocs: AI fuori controllo (@netflix)
- Runway in ChatGPT (@runwayml)
- Face Swap (@LumaLabsAI)
- Convalidare le modifiche alle AI factory con digital twins e agenti AI (blog tecnico NVIDIA)
- Analisi delle immagini scientifiche più rapida con NVIDIA cuPhoton
- Cosmos e SynthID (@NVIDIAAI)
- SDK TypeScript di SpaceXAI 0.2.3
- RAG vs. LLM (Perplexity)