ai-powered-markdown-translatorArticolo tradotto dal francese all’italiano con gpt-6.1-sol.
Venerdì 2 ottobre, Meta pubblica sei articoli di matematica elaborati da ricercatori con il suo modello Muse Spark; secondo Meta, cinque di essi rispondono a quesiti di ricerca rimasti aperti. Anthropic impegna 100 milioni di dollari per formare 10 000 ingegneri specializzati nel deployment con la Claude Frontier Academy e pubblica Claude Code 2.1.288, mentre NVIDIA annuncia un DGX Spark da 64 GB a partire da 4 999 dollari. Due annunci della sera precedente completano la giornata: la Decisions API di Perplexity, che risponde con probabilità usando un modello pubblicato con pesi aperti, e il satellite di Google che porta in orbita le sue prime TPU.
Meta pubblica sei articoli di matematica scritti con Muse Spark, Ai2 rende disponibile AstaBrief, l’IA di Google prevede l’influenza
2 ottobre — Meta pubblica sul suo blog di ricerca sei articoli di matematica elaborati da ricercatori con Muse Spark, il suo modello proprietario. Secondo Meta, cinque di essi forniscono una risposta a quesiti di ricerca fino ad allora aperti, senza che il post precisi quale faccia eccezione. Negli ultimi mesi i matematici hanno lavorato con Muse Spark 1.1 e 1.2 in modalità Thinking, direttamente nell’interfaccia di chat di meta.ai, senza una struttura di ricerca su misura (custom research scaffold).
Following gold-medal-level performance from our AI models across five competitions in mathematics, physics, and chemistry, we asked a harder question: can AI contribute when a problem is genuinely open and without an existing solution path?
🇮🇹 Dopo prestazioni da medaglia d’oro dei nostri modelli di IA in cinque competizioni di matematica, fisica e chimica, ci siamo posti una domanda più difficile: l’IA può contribuire quando un problema è davvero aperto e non esiste alcun percorso verso la sua soluzione? — @AIatMeta su X
Il protocollo dichiarato è rigoroso: un team di matematici guida la ricerca, un secondo gruppo rivede il lavoro e ogni articolo indica i passaggi redatti principalmente dai ricercatori o dall’IA. Il contributo del modello varia molto da un articolo all’altro, dai calcoli di supporto alla stesura di intere sezioni:
| Ambito matematico | Risultato annunciato da Meta | Contributo di Muse Spark secondo Meta |
|---|---|---|
| Probabilità | Soglia precisa per adattare un ellissoide passante per punti gaussiani casuali in alta dimensione | Strategie di dimostrazione |
| Equazioni differenziali | Esplosione in tempo finito delle soluzioni radiali a energia negativa dell’equazione di Schrödinger non lineare biarmonica a massa critica, quesito aperto dal 2015 | Calcoli, verifica di argomentazioni, revisione della dimostrazione |
| Teoria dei gruppi | Un gruppo semiabeliano non è necessariamente monomiale: controesempio di ordine 384 a una congettura di M. Kida (2024) | Programma di ricerca scritto in GAP, che ha trovato il controesempio |
| Ottimizzazione | Regola esatta che indica quando un rilassamento per cicli cattura il problema originale | Riformulazione probabilistica, controesempio, strategia di dimostrazione |
| Fisica aritmetica | La funzione a due punti della teoria delle stringhe p-adica è uguale a una funzione altezza, su una classe di curve molto più ampia della curva di Tate | Proposte di dimostrazione, tre sezioni tecniche redatte |
| Algebra non associativa | Controesempio di dimensione 3 a una congettura sulle algebre di evoluzione risolubili | Controesempio e caratterizzazioni alternative |
Meta riconosce che tre di questi problemi sono stati risolti anche altrove: tre lavori pubblicati in agosto sulla soglia gaussiana, un controesempio alla congettura di Kida segnalato il 16 settembre dall’agente IA Nilradical e controesempi sulle algebre di evoluzione di Hu e Wen. Secondo Meta, i suoi risultati sono stati ottenuti indipendentemente, con altri approcci. L’annuncio segue quello di OpenAI, che il 21 settembre affermava che un modello interno aveva risolto più di 100 problemi aperti; Meta insiste sull’uso di un modello destinato al grande pubblico, così com’è, e sulla trasparenza riguardo al contributo dell’IA, con tutte le dimostrazioni comunque verificate, corrette e riscritte da matematici.
🔗 Risolvere insieme problemi di ricerca aperti (Meta AI Research)
AstaBrief 8B: Ai2 rende disponibile un modello che redige rapporti scientifici corredati di citazioni
2 ottobre — Ai2 rende disponibile AstaBrief 8B, un modello che trasforma una domanda di ricerca ed estratti della letteratura in un rapporto scientifico corredato di citazioni. Ora alimenta la modalità Fast della funzione « Generate a report » di Asta, la piattaforma agentica di Ai2 per la scienza, accanto alla modalità Thinking basata su Claude. La procedura resta semplice: Qwen3-8B, un fine-tuning supervisionato (SFT) su 47 000 esempi prodotti dalla pipeline ScholarQA, poi un’ottimizzazione diretta delle preferenze (DPO) su circa 6 000 coppie, senza apprendimento per rinforzo. I pesi, con licenza Apache-2.0 secondo la scheda del modello, e i dati di addestramento sono pubblicati: un laboratorio può eseguirlo sul proprio hardware.
Il modello scrive il rapporto in un unico passaggio. Nell’intera pipeline di Asta, un rapporto richiede in media 51,1 secondi in modalità Fast contro 178,5 in modalità Thinking, risultando quindi circa 3,5 volte più veloce. In un piccolo studio con valutatori umani (14 domande, 3 ricercatori), DR Tulu prevale nella preferenza complessiva, ma due ricercatori su tre preferiscono AstaBrief per l’accuratezza delle citazioni. Ai2 avverte che gran parte dell’addestramento e della valutazione risale al 2025 e non è stata ripetuta con i modelli attuali.
🔗 Pubblicazione open source di AstaBrief (Ai2)
Influenza: un modello sviluppato con l’IA di Google primo su 39 nella valutazione FluSight dei CDC
30 settembre — Google annuncia che un modello di previsione dell’influenza sviluppato con la sua IA è stato il migliore della stagione 2025-2026 in FluSight, il sistema dei Centri statunitensi per il controllo e la prevenzione delle malattie (CDC) che aggrega ogni settimana, da ottobre a maggio, le previsioni dei ricoveri ospedalieri. Il rapporto di fine stagione dei CDC lo conferma: sui 39 modelli selezionati tra i 53 presentati da 34 team, il primo dei modelli individuali è Google_SAI-FluEns, con un WIS relativo di 0,56 (un punteggio di errore: più è basso, migliore è la previsione), davanti a tre modelli a 0,58, tra cui OHT_JHU-nbxd. L’ensemble FluSight, che i CDC usano per la loro comunicazione pubblica, arriva 7°.
Queste previsioni sono state sviluppate con Empirical Research Assistance (ERA), uno strumento di IA di Google che genera algoritmi di ottimizzazione per diversi ambiti scientifici, disponibile a tester fidati. L’articolo di ricerca associato descrive un sistema autonomo che scrive, valuta e migliora il proprio codice di previsione attraverso una ricerca ad albero guidata da un LLM; ha anche prodotto modelli per il COVID-19 e il virus respiratorio sinciziale (VRS).
🔗 Post di Google Research · Rapporto FluSight 2025-2026 dei CDC
Perplexity lancia la Decisions API e rende disponibile pplx-decider-v1-27b, llama.cpp serve i modelli di decisione
1° ottobre — Perplexity rende disponibile una nuova API, la Decisions API, e pubblica con licenza Apache 2.0 il modello che la alimenta, pplx-decider-v1-27b. L’annuncio è arrivato in serata tramite @perplexitydevs, l’account dell’azienda dedicato agli sviluppatori. Invece di redigere una risposta, questo modello di decisione (decision model) restituisce una distribuzione di probabilità su un insieme fisso di risposte: legge testo, JSON o immagini, ma non scrive risposte, non genera codice e non spiega il proprio ragionamento.
Sono previsti tre tipi di domande: noul restituisce la probabilità di un sì, choice sceglie tra 1 e 255 opzioni con una probabilità per ciascuna e un indice di confidenza, score colloca il contenuto su una scala di massimo 10 livelli. Una richiesta può porre fino a 128 domande sullo stesso contenuto e deve rimanere, domande comprese, sotto i 262 144 token in ingresso. La tariffa è di 0,04 dollari per milione di token in ingresso, l’output è gratuito e non viene addebitato alcun costo per richiesta; ogni organizzazione può inviare 10 richieste al secondo, indipendentemente dal proprio piano. Perplexity punta alla classificazione, al routing e alla valutazione secondo una griglia: il suo esempio di riferimento (cookbook) smista ticket di supporto, con la Decisions API che prende la prima decisione e l’Agent API che gestisce le escalation.
Il modello è sottoposto a fine-tuning a partire da Qwen3.8-27B; i suoi pesi, su Hugging Face, richiedono una GPU CUDA capace di ospitare circa 49 GiB, più la memoria di lavoro. La sua scheda lo confronta con Jev, un altro modello di decisione, e con il suo modello di base su undici benchmark, con i risultati di pplx-decider-v1-27b misurati tramite l’API di Perplexity:
| Benchmark (accuratezza) | Punteggio di Jev | Punteggio di Qwen3.8-27B (modello di base) | Punteggio di pplx-decider-v1-27b |
|---|---|---|---|
| WinoGrande | 90,70 % | 73,10 % | 83,30 % |
| FinancialPhraseBank | 76,98 % | 75,68 % | 84,18 % |
| RAGTruth | 77,27 % | 61,53 % | 88,80 % |
| JudgeBench | 78,57 % | 68,86 % | 78,29 % |
| BBH | 94,27 % | 72,80 % | 82,80 % |
| JevBench public hard | 73,27 % | 72,28 % | 70,30 % |
| TabFact | 89,80 % | 78,60 % | 90,60 % |
| ContractNLI | 77,45 % | 80,78 % | 80,78 % |
| Circa | 84,60 % | 87,00 % | 89,20 % |
| Belebele | 95,00 % | 93,20 % | 94,00 % |
| TruthfulQA binary | 92,00 % | 82,80 % | 85,40 % |
| Complessivo (secondo la scheda) | 84,51 % | 74,76 % | 85,71 % |
Nella riga Complessivo, messa in evidenza nell’annuncio, pplx-decider-v1-27b supera Jev, con 85,71 % contro 84,51 %, ma la scheda non precisa come venga calcolata questa riga. Secondo la tabella pubblicata, Jev resta davanti in sei degli undici benchmark, tra cui BBH e WinoGrande, e su JevBench public hard il modello di Perplexity si colloca persino dietro al proprio modello di base.
🔗 Annuncio di @perplexitydevs · Documentazione della Decisions API · pplx-decider-v1-27b su Hugging Face
llama.cpp serve i modelli di decisione con l’API /v1/systemone, compatibile con Jev
2 ottobre — Il server di llama.cpp ora può servire modelli di decisione tramite un nuovo endpoint, /v1/systemone, introdotto con la PR n° 29818, integrata il 2 ottobre. Il post di ggml-org, firmato da Xuan-Son Nguyen e Victor Mustar, ne descrive il principio: si invia uno stato (testo, JSON, screenshot) e domande tipizzate, choice, score (da 2 a 10 livelli) o noul (sì o no), e il modello restituisce una probabilità per opzione in un unico passaggio. L’API riprende il formato System One introdotto da Jev, il modello di TypeSafe: un client esistente deve solo cambiare l’URL di base. Una modalità router carica più modelli su richiesta sullo stesso server.
| Modello di decisione supportato | Dimensione del modello | Modello di base | Tempo mediano per domanda |
|---|---|---|---|
| Julia-1 (oltre 50 lingue) | 144M | mmBERT-small | 3 ms |
| Laya | 421M | ModernBERT-large | 5 ms |
| Kev-4B | 4B | Qwen3.5-4B-Base | 12 ms |
| lev | 4B | Qwen3.5-4B | 36 ms |
| OpenJev (legge anche le immagini) | 27B | Qwen3.8-27B | 43 ms |
I tempi sono misurati su una NVIDIA RTX PRO 6000. Prossimo modello annunciato: Clef, che Cloudflare ha presentato il 1° ottobre con un’API compatibile con quella di Jev; ggml-org ha creato il 2 ottobre i repository GGUF di Clef e Clef-flash su Hugging Face.
🔗 Novità in llama.cpp: modelli di decisione
Anthropic lancia la Claude Frontier Academy e impegna 100 milioni di dollari per formare 10 000 ingegneri
2 ottobre — Anthropic lancia la Claude Frontier Academy, un programma di formazione sostenuto da un impegno finanziario di 100 milioni di dollari. L’obiettivo è formare 10 000 ingegneri di deployment di frontiera (Frontier Deployed Engineers, FDE) entro la fine del 2027. Le prime coorti riuniscono ingegneri di Accenture, Bain, Capgemini, Commonwealth Bank of Australia, Deloitte, McKinsey, Morgan Stanley e Novo Nordisk.
Il primo programma, la Frontier Deployed Engineer Residency, riprende il modello della formazione medica. Secondo la pagina del programma, inizia con un modulo intensivo di quattro giorni: tre giorni in presenza per costruire un sistema Claude per un’azienda simulata, poi una prova valutata che conferisce il badge Claude Resident Engineer. Seguono dodici settimane di residenza durante le quali si realizza un deployment di Claude nella propria organizzazione, poi una valutazione finale per il badge Claude Frontier Deployed Engineer; i primi sono attesi all’inizio del 2027.
L’accesso rimane ristretto: partecipazione su nomina, accesso anticipato riservato a clienti e partner selezionati, coorti a San Francisco, New York e Londra. L’Academy amplia il Claude Partner Network (46 000 aziende, oltre 175 000 certificazioni), lanciato a marzo con 100 milioni di dollari; il post non specifica se il nuovo stanziamento si aggiunga a quello precedente.
🔗 Annuncio di Anthropic · Pagina del programma
Agenti: Claude Code 2.1.288, GLM 5.3 in Cursor, Replit, DeepSeek Harness e il benchmark SWE-sweep
Claude Code 2.1.288 elimina il limite dei comandi in background nelle sessioni interattive
2 ottobre — Claude Code 2.1.288 arriva con 89 voci, di cui 64 correzioni. Il cambiamento più evidente riguarda i comandi avviati in background: il limite di tempo introdotto dalla 2.1.285 (30 minuti per impostazione predefinita, 2 ore al massimo) si applica ora soltanto alle sessioni senza supervisione (-p, Agent SDK, CI, cloud). Nel terminale, nell’applicazione desktop e in VS Code, un comando in background può nuovamente essere eseguito senza limiti.
Un prompt cancellato per errore con Ctrl+C si recupera premendo la freccia su, /code-review accetta --max-findings per segnalare più o meno problemi, claude project purge diventa claude purge, e i mod, lanciati il giorno prima, ricevono $.ui.selection(), che restituisce l’ultimo testo selezionato a schermo intero. Quando l’API va in timeout durante una risposta, le sessioni non interattive e i sottoagenti ripartono dalla risposta parziale invece di fallire. Sul fronte della sicurezza, un rm pericoloso inserito in uno script bash -c non è più consentito senza conferma in modalità bypassPermissions, e un hook PreToolUse o PermissionRequest il cui matching fallisce ora blocca la chiamata invece di essere ignorato. Infine, il classificatore della modalità auto lato client ora ignora una variabile ANTHROPIC_DEFAULT_SONNET_MODEL che indica Sonnet 5.5 o Opus 5.5, e utilizza invece Claude Sonnet 5.
Sei minuti dopo la release, @ClaudeDevs ha messo in evidenza You should know, un mod integrato che avvia un agente secondario incaricato di mostrare sopra il prompt le informazioni da non perdere. Figurava già tra i sei mod integrati presentati il 1° ottobre e rimane disattivato per impostazione predefinita.
We’re adding a new plugin to Claude Code: You should Know. It scans Claude’s output for important information you might miss to help keep you in the loop. Enable it with: /plugin enable cc-plugin-you-should-know@builtin
🇮🇹 Aggiungiamo un nuovo plugin a Claude Code: You should Know. Analizza l’output di Claude alla ricerca di informazioni importanti che potrebbero sfuggirvi, per tenervi aggiornati. Attivatelo con: /plugin enable cc-plugin-you-should-know@builtin — @ClaudeDevs su X
🔗 Note di rilascio di Claude Code 2.1.288
GLM 5.3 e GLM 5.3 Flash arrivano in Cursor
1° ottobre — Cursor aggiunge GLM 5.3 e GLM 5.3 Flash, i modelli aperti di Z.ai, al suo selettore di modelli, e rivendica per GLM 5.3 Max il primo posto tra i modelli aperti nel proprio benchmark.
GLM 5.3 and GLM 5.3 Flash are now available in Cursor! GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0.
🇮🇹 GLM 5.3 e GLM 5.3 Flash sono ora disponibili in Cursor! GLM 5.3 Max è il modello a pesi aperti con il punteggio più alto su CursorBench 4.0. — @cursor_ai su X
Il grafico allegato colloca i modelli in base al loro punteggio CursorBench 4.0 e al costo medio per attività, ma etichetta un solo punto: quello di GLM 5.3 contrassegnato da « (max) », al 42,6 % per 5,05 dollari per attività. Secondo questo grafico, GLM 5.3 rimane sotto Claude Opus 5.5, Claude Sonnet 5.5, Fable 5.1 e Grok 4.7, non vi figura nessun altro modello aperto e GLM 5.3 Flash non compare. Cursor non ha pubblicato né prezzi, né un post, né una metodologia a sostegno della propria classifica.
Replit rende disponibili GPT-6.1 Sol e Claude Sonnet 5.5 in Agent, e Jev nelle sue AI Integrations
2 ottobre — Il changelog di Replit aggiunge due modelli recenti tra le opzioni di Replit Agent: Claude Sonnet 5.5 in modalità Power e GPT-6.1 Sol in modalità Max. La stessa voce rende disponibile Jev, il modello decisionale già citato nel confronto con pplx-decider-v1-27b, nelle Replit AI Integrations: un’applicazione può classificare contenuti, fare il routing delle richieste o assegnare punteggi ai potenziali clienti tramite decisioni rapide e strutturate, senza gestire una chiave API. La documentazione precisa che Jev viene fornito con l’identificativo jev-latest tramite OpenRouter. Le impostazioni si aprono ora a pagina intera, e gli account Enterprise possono stabilire regole per tutta l’azienda, con eccezioni per ciascun team (Workspace). La voce non indica alcun prezzo.
🔗 Changelog di Replit del 2 ottobre
DeepSeek Harness si installa su macOS e Windows
30 settembre — L’account @DeepSeekHarness annuncia una versione desktop di DeepSeek Harness, l’harness per agenti open source di DeepSeek, per macOS e Windows. Il 2 ottobre, l’account principale @deepseek_ai rilancia l’annuncio e precisa che gli utenti Linux utilizzano il pacchetto npm @deepseek-ai/dsh. Gli installer si scaricano dal sito di DeepSeek, per macOS su chip ARM e per Windows x64.
La pagina ufficiale, contrassegnata da PREVIEW, presenta Harness come una versione di anteprima pubblica disponibile in tutto il mondo, e open source. Si basa sull’architettura « tutto è un plugin » (everything is a plugin) del framework Cordis e copre il lavoro d’ufficio (file, dati, documenti, presentazioni), il codice, la ricerca con citazione delle fonti e le attività in background, con una modalità Creator che fa scrivere nuovi plugin attraverso la conversazione. La novità riguarda la distribuzione: l’anteprima del 29 settembre integrava già il comando dsh nell’applicazione desktop, e su GitHub non è ancora stata pubblicata alcuna versione stabile.
🔗 Annuncio di @deepseek_ai · Pagina di DeepSeek Harness
SWE-sweep: un benchmark in cui gli agenti devono trovare da soli i bug da correggere
1° ottobre — Ricercatori di Meta Superintelligence Labs, insieme a Harvard, all’università di Washington e a Stanford, rendono disponibile SWE-sweep, un benchmark che chiede agli agenti di codice di scoprire autonomamente i bug di un vero repository e di correggerne il maggior numero possibile, senza indizi sulla loro natura o posizione. Il dataset copre 100 repository e 4 068 bug; il codice, con licenza MIT, si basa sul framework Harbor, e Ofir Press e John Yang figurano tra gli autori. Nessun annuncio accompagna ancora il repository, creato il 1° ottobre.
La classifica, aggiornata il 24 settembre e misurata con l’agente mini-SWE-agent, mostra l’entità del compito:
| Posizione in classifica | Modello valutato | Bug risolti | Costo totale |
|---|---|---|---|
| 1 | Sol 5.6 (xhigh), OpenAI | 4,7 % | 7 230 dollars |
| 2 | Luna 5.6 (xhigh), OpenAI | 2,5 % | 224 dollars |
| 3 | Terra 5.6 (xhigh), OpenAI | 1,5 % | 357 dollars |
| 4 | Luna 5.6 (high), OpenAI | 1,4 % | 28 dollars |
| 5 | Opus 5 (xhigh), Anthropic | 1,3 % | 5 363 dollars |
Calcolo e hardware: prime TPU in orbita, DGX Spark 64 Go, DeepGEMM e DeepEP su Ascend 950
Project Suncatcher: il satellite prototipo di Google porta le sue prime TPU in orbita
1° ottobre — Una settimana dopo aver annunciato il suo primo test in orbita, Google ha lanciato il satellite prototipo di Project Suncatcher, un progetto di ricerca a lungo termine (moonshot) che cerca di capire se lo spazio potrebbe un giorno ospitare un’infrastruttura di machine learning su larga scala. Costruito con Planet, il satellite ha raggiunto l’orbita a bordo di Transporter-18, una missione di lancio condiviso di SpaceX; secondo Travis Beals, di Google, il team ha stabilito il contatto e il satellite funziona come previsto.
Nelle prossime settimane, Google misurerà come le sue TPU sopportano le sollecitazioni del volo spaziale e i livelli estremi di radiazioni e temperatura; a terra, le TPU Trillium avevano già sopportato una dose di radiazioni superiore a quella di una missione di cinque anni. L’articolo sottoposto a peer review che descrive in dettaglio la ricerca viene pubblicato sulla rivista Joule. Rilanciando il lancio il 2 ottobre, @GoogleAI ricorda la motivazione del progetto: in orbita bassa, la luce del sole è quasi costante e i satelliti possono produrre fino a 8 volte più energia solare che sulla Terra. Prossimo passo annunciato: due satelliti nel 2027 per testare collegamenti laser.
🔗 Il prototipo di Project Suncatcher è in orbita · L’articolo pubblicato su Joule · La condivisione di @GoogleAI
DGX Spark 64 Go: NVIDIA aggiunge una configurazione in vendita dal 23 ottobre
2 ottobre — NVIDIA aggiunge al suo DGX Spark una configurazione con 64 Go di memoria unificata, accanto al modello da 128 Go. Sarà venduta soltanto tramite sei produttori partner, Acer, ASUS, Dell, Gigabyte, HP e MSI, a partire da venerdì 23 ottobre, al prezzo iniziale di 4 999 dollari; il post non indica il prezzo attuale del modello da 128 Go. La base rimane la stessa: chip GB10 Grace Blackwell, DGX OS e stack software NVIDIA AI, per modelli fino a 100 miliardi di parametri eseguiti sulla macchina.
Il punto di forza principale è il clustering: due unità collegate tramite un cavo QSFP sulle loro schede di rete ConnectX-7 mettono in comune la memoria.
| Caratteristica tecnica | Un DGX Spark 64 Go | Due DGX Spark 64 Go in cluster |
|---|---|---|
| Memoria unificata | 64 Go | 128 Go messi in comune |
| Dimensione del modello dichiarata | Fino a 100 miliardi di parametri | Fino a 200 miliardi di parametri |
| Prestazioni su Qwen 3.8 27B (test NVIDIA) | Riferimento | Fino a 1,7 volte |
L’applicazione NVIDIA Sync se ne occupa tramite Cluster Assistant, che rileva le unità e configura la rete. NVIDIA Sync Model Launcher, annunciato per la fine del mese, scaricherà e avvierà Qwen3.8 27B su una macchina o un cluster, e configurerà OpenCode per utilizzarlo.
🔗 Post di NVIDIA su DGX Spark 64 Go
DeepSeek porta DeepGEMM e DeepEP sulle NPU Ascend 950 di Huawei
29 e 30 settembre — DeepSeek ha pubblicato su GitHub, senza annuncio, due porting delle sue librerie di calcolo verso le NPU Ascend di Huawei. DeepGEMM-Ascend, il cui README indica il 30 settembre come data della prima versione, riproduce senza modifiche l’API di DeepGEMM: moltiplicazioni di matrici in BF16, FP8 e FP4, logits MQA e MegaMoE, con licenza MIT, per la serie Ascend 950. DeepEP-Ascend porta la libreria di comunicazione per il parallelismo degli esperti (expert parallelism) dei modelli MoE, con le operazioni all-to-all di distribuzione (dispatch) e ricombinazione (combine).
Su Ascend 950DT, DeepEP-Ascend misura una distribuzione da 373 a 375 Go/s con 8 rank e da 313 a 320 Go/s con 128 rank; fino a 32 rank, raggiunge circa il 90–95 % del limite fisico della larghezza di banda. Questi risultati sono stati ottenuti con un kit hardware (HDK) per una proof of concept fornito a DeepSeek e una configurazione manuale, non distribuiti pubblicamente; il README rimanda alla versione commerciale, di cui Huawei prevede la disponibilità intorno al 15 ottobre.
🔗 DeepGEMM-Ascend su GitHub · DeepEP-Ascend su GitHub
Voce e audio: Suno Speech in beta, ElevenLabs certificata FedRAMP 20x Class A
Suno Speech genera voce parlata e musica di sottofondo in un’unica traccia
1° ottobre — Suno rende disponibile in beta Speech, una funzione che crea audio parlato su una musica di sottofondo originale, direttamente in Suno: si inserisce un’idea, una poesia o un testo, poi si descrivono la voce e lo stile musicale desiderati. Suno presenta Speech come il primo modello audio che genera voce e musica insieme, in un’unica traccia coerente. Testata per un mese con un piccolo gruppo di utenti, la funzione è ora disponibile a tutti, dopo un aggiornamento dell’applicazione.
Il post, firmato dal direttore di prodotto Jack Brody, cita soprattutto utilizzi personali: messaggi degli amici trasformati in letture teatrali, note vocali messe in musica, meditazioni o storie della buonanotte. Suno avverte che la beta rimane imperfetta: un accento britannico può virare verso quello australiano, e le pause drammatiche possono essere molto accentuate. Non sono specificati né prezzi, né piani, né lingue supportate.
🔗 Presentazione di Speech (Suno)
ElevenLabs certificata FedRAMP 20x Class A per ElevenAgents e le sue API vocali
1° ottobre — ElevenLabs ottiene la certificazione FedRAMP 20x Class A, il quadro attraverso cui le agenzie federali statunitensi stabiliscono se un prodotto cloud può essere utilizzato in sicurezza con dati governativi. Copre ElevenAgents e le API Text to Speech e Speech to Text, a condizione che funzionino in Zero Retention Mode con residenza dei dati negli Stati Uniti. Amplia l’offerta ElevenLabs for Government, e l’azienda figura ora nel FedRAMP Marketplace. Secondo FedRAMP, citato da ElevenLabs, il livello Class A è sufficiente per la maggior parte degli utilizzi non sensibili delle agenzie; ElevenLabs cita le domande di prestazioni sociali, i permessi, le imposte o la trascrizione delle udienze.
ElevenLabs sostiene l’annuncio con deployment pubblici esistenti:
| Deployment pubblico citato | Cifra dichiarata da ElevenLabs |
|---|---|
| Linea nazionale per l’impiego (Ucraina) | 25 % gestiti da agenti conversazionali |
| Linee per le prestazioni sociali e l’impiego (Cechia) | 85 % di circa 5 000 chiamate al giorno risolte |
| Città di Midland | 7 000 chiamate perse in meno al mese (proiezione) |
ChatGPT apre Finances agli utenti Free e Go negli Stati Uniti
2 ottobre — Finances, lo spazio di ChatGPT dedicato alle finanze personali, si estende ai piani Free e Go negli Stati Uniti, sul web, iOS e Android. La funzione era già disponibile per gli abbonati Plus e Pro: introdotta in anteprima solo per gli abbonati Pro a maggio, il 21 settembre aveva ricevuto il monitoraggio del punteggio di credito Experian per gli abbonati Plus e Pro. Ora copre i piani Free, Go, Plus e Pro, sempre solo negli Stati Uniti.
Il principio resta lo stesso: si collegano i propri conti bancari e di investimento tramite Plaid e il proprio rapporto di credito tramite Experian, due connessioni utilizzabili insieme o separatamente. La pagina Finances raccoglie spese, bollette, abbonamenti, patrimonio netto, investimenti e punteggio di credito. Nella conversazione, ChatGPT classifica le spese, individua gli abbonamenti, confronta il mese con le tendenze recenti e, per le imposte, organizza le informazioni e segnala possibilità da esaminare, come le deduzioni.
🔗 Note di rilascio di ChatGPT · Finances in ChatGPT
SpaceXAI pubblica il suo SDK TypeScript ufficiale in versione sperimentale
2 ottobre — SpaceXAI ha pubblicato senza annunci la prima versione pubblica del suo SDK TypeScript ufficiale. La 0.1.0 è uscita alle 16 h 57 UTC, seguita alle 18 h 25 UTC da una 0.2.0 che rinomina la classe client xAI in SpaceXAI: un breaking change che allinea il codice al nuovo nome dell’azienda. Il SDK copre già la Responses API (streaming, compaction e conversazioni su più turni), gli strumenti integrati della piattaforma (ricerca web e ricerca su X, esecuzione di codice, server MCP remoti), la generazione e la modifica di immagini e video, oltre alle API Files, Batch e Voice.
| Elemento del SDK | Dettaglio rilevato |
|---|---|
| Pacchetto npm | @xai-official/sdk |
| Licenza | Apache-2.0 |
| Requisiti | Node.js 22.13 o successivo, progetto ESM, nessuna dipendenza di runtime |
| Stato | Sperimentale, interfacce non definitive prima della 1.0 |
Per impostazione predefinita, il SDK rifiuta di funzionare in un browser o in un Worker, per evitare di esporre la chiave segreta lato client. Gli sviluppatori TypeScript dispongono così di un equivalente del SDK Python ufficiale, la cui versione 1.20.0 è uscita il 24 settembre.
🔗 CHANGELOG del SDK TypeScript di SpaceXAI · Il pacchetto @xai-official/sdk su npm
Notizie in breve
- GPT-6.1 Sol in v0 — Il 29 settembre, giorno dell’uscita del modello, v0, il generatore di applicazioni di Vercel, ha reso disponibile GPT-6.1 Sol, poche ore dopo aver consentito il collegamento con un abbonamento ChatGPT; l’annuncio non indica né prezzi né misurazioni specifiche per v0. 🔗 fonte
- Nuova dashboard degli agenti in Grok Build — Annunciata il 1° ottobre, mostra tutti gli agenti su un’unica schermata con
/dashboard, avvia attività in parallelo e colloca un agente nel proprio worktree git con Ctrl+W; Grok Build aveva ricevuto una prima dashboard il 15 giugno. 🔗 fonte - Nightly di Gemini CLI — La v0.64.0-nightly del 2 ottobre contiene solo otto correzioni: Ctrl+C annulla nuovamente un’operazione in corso e lo stato
~/.gemini/state.jsonviene scritto in modo atomico, con una copia di backup.bakripristinata in caso di corruzione; la versione stabile e quella di anteprima restano invariate. 🔗 fonte - Modelli rimossi da GitHub Copilot — Come annunciato il 3 settembre, Gemini 3.5 Flash, Gemini 3.6 Flash, Kimi K2.7 Code e Claude Opus 4.7 vengono rimossi da tutte le esperienze Copilot; GitHub suggerisce Gemini 3.8 Flash, Kimi K3 e ora Claude Opus 5.5, al posto di Claude Opus 5. 🔗 fonte
- Testare uno SKILL.md — In un post della community, Golda Manuel propone un metodo, senza misurazioni pubblicate, per verificare che una skill venga trovata, caricata e sia utile agli agenti di coding: posizione prevista da Claude Code o Codex, attivazione a tre livelli di richiesta, confronto con e senza skill su otto metriche. 🔗 fonte
- Manus approfondisce Video Editor e Game Dev — Due post del 1° ottobre approfondiscono Manus 2.0: Video Editor, in Manus Studio, colloca ogni elemento di un video sulla propria traccia (125 clip montate in un filmato di 10 min 50 s con 195 tagli), mentre Game Dev modifica un gioco in tempo reale; nessun prezzo né data. 🔗 Video Editor · 🔗 Game Dev
- AutoSynthData di ServiceNow — Il team CoreAI di ServiceNow genera attività di addestramento verificate a partire dagli errori di un modello: su EnterpriseOps Gym, Gemma-4-26B-A4B-it guadagna 7,2 punti di Pass@1 nel dominio Hybrid e passa dal 18,77 % al 27,18 % in ITSM; né codice né dati pubblicati. 🔗 fonte
- POCKET-Darwin-180B — VIDRAFT pubblica una versione GGUF a 4 bit da 111 Go (contro 360 Go) di Darwin-180B-RSI, un MoE da 180 miliardi di parametri: da 18,4 a 21 token al secondo con il solo processore, 4,17 su un portatile con RTX 5060 da 8 Go e 87,65 % su MMLU-Pro come l’originale, secondo gli autori. 🔗 fonte
- Guida ai modelli GPT-6 — OpenAI pubblica una guida per le startup: GPT-6 Astra per i ragionamenti più difficili, GPT-6.1 Sol per il codice complesso, la ricerca e l’uso del computer, GPT-6 Luna per le attività mirate su larga scala; i token in cache costano fino al 95 % in meno a seconda del modello. 🔗 fonte
- ChatGPT digitalizza più pagine in un unico PDF dalla fotocamera su iOS — in fase di distribuzione, 1° ottobre.
- Chatham Financial e Codex — La società di consulenza sui mercati dei capitali ha costruito con Codex un’applicazione per la convalida delle transazioni: secondo le prime misurazioni, la verifica passa da circa 30 minuti a meno di 4; la sua piattaforma Onyx combina GPT-5.6 Sol e Terra, GPT-5.4 e GPT-4.1. 🔗 fonte
- The Den e ChatGPT Work — Secondo un caso di studio di OpenAI datato 1° ottobre, il team dirigente di questo club di Denver per genitori risparmia da 10 a 15 ore alla settimana con ChatGPT Work, collegato a Gmail, Slack e Google Drive; una domanda di sovvenzione richiede 2 ore invece di 3 giorni. 🔗 fonte
- GPT-6 Astra Ultrafast su Blackwell — NVIDIA precisa il 1° ottobre che il livello Ultrafast di GPT-6 Astra, lanciato da OpenAI il 29 settembre, funziona sulle sue GPU Blackwell, fino a 8 volte più velocemente della modalità Astra Standard, e che OpenAI ottimizza il proprio software di inferenza con i propri modelli; nessun nuovo dato numerico. 🔗 fonte
- RL Rollouts presso CoreWeave — Presentato il 30 settembre insieme a CoreWeave Forge e ripreso da NVIDIA il 2 ottobre, questo servizio basato su NVIDIA Dynamo carica a caldo i nuovi checkpoint durante un post-training con apprendimento per rinforzo; su Nemotron 3.5 Lightning, la latenza di ricaricamento del modello migliora di 15 volte. 🔗 fonte
- Eleven v4 in ElevenReader — Il modello vocale più espressivo di ElevenLabs, lanciato il 28 settembre, arriva nella sua applicazione di lettura: articoli, libri digitali e PDF con la voce scelta, in oltre 90 lingue, su iOS, Android e sul web. 🔗 fonte
- Changelog alpha di Midjourney — Datato 1° ottobre, raccoglie soprattutto correzioni, tra cui i parametri dei prompt memorizzati per cartella e i riferimenti di stile raggruppati in un badge, in attesa dei nuovi strumenti collaborativi annunciati per la settimana successiva. 🔗 fonte
- Grok 4.7 a metà prezzo in Ramp Router — Fino al 6 ottobre, il gateway LLM Ramp Router propone Grok 4.7 con il 50 % di sconto, un’offerta ripresa da SpaceXAI; il modello costa 2 dollari in input e 6 dollari in output per milione di token sull’API di SpaceXAI. 🔗 fonte
- Commenti riservati sugli avvisi di sicurezza — GitHub permette di commentare un avviso di sicurezza di un repository senza che l’autore della segnalazione lo veda: solo le persone con accesso in scrittura possono leggere questi commenti, le cui consultazioni vengono registrate nei log; un’API REST per i commenti entra in anteprima pubblica. 🔗 fonte · 🔗 API REST
- API GraphQL della GitHub Advisory Database — L’oggetto SecurityAdvisory acquisisce cinque campi, tra cui l’identificativo CVE e la data di pubblicazione da parte della NVD, e la query securityAdvisories due filtri, per gravità e per stato di ritiro: non è più necessario passare dall’API REST. 🔗 fonte
- Fine dell’immagine macOS 14 in GitHub Actions — Annunciato il 1° ottobre, il ritiro avverrà il 2 novembre, preceduto da otto interruzioni programmate a ottobre, dalle 14 h a mezzanotte UTC; i workflow devono passare a macos-15 o a macos-latest, che punta a macos-26. 🔗 fonte
- Maturità dell’IA in azienda — Perplexity pubblica una guida che descrive quattro stadi di maturità, riassume i framework di Gartner, Deloitte e Google Cloud e propone una griglia di autovalutazione; secondo l’indagine 2026 di McKinsey che cita, l’80 % degli intervistati riscontra aumenti della produttività personale, ma solo il 37 % un contributo all’EBIT. 🔗 fonte
Cosa significa
L’IA applicata alla scienza viene valutata sempre più secondo criteri esterni a chi la annuncia. Meta non si limita a mettere in fila risultati: ogni articolo indica quali passaggi ha scritto l’IA, un secondo gruppo di matematici li rivede e il post riconosce che tre dei problemi sono stati risolti anche altrove. Il modello di previsione dell’influenza progettato con l’IA di Google trae il suo valore da una valutazione condotta dai CDC su un’intera stagione, a confronto con altri 38 modelli. Ai2 pubblica i pesi e i dati di AstaBrief, ma avverte che i suoi confronti risalgono al 2025: un modello aperto può essere verificato, una valutazione invecchia.
I modelli decisionali diventano in pochi giorni una categoria a tutti gli effetti. Dopo Jev, d1 di Liquid AI e Clef di Cloudflare, Perplexity propone sia un’API fatturata per token di input sia i pesi del suo modello; llama.cpp serve questi modelli in locale con lo stesso formato System One e Replit inserisce Jev nelle sue integrazioni senza chiave API. Per uno sviluppatore, l’interesse è concreto: una probabilità per ogni opzione, ottenuta in un solo passaggio, al posto di una risposta testuale da analizzare successivamente. I confronti richiedono prudenza: la riga Overall della scheda colloca pplx-decider-v1-27b davanti a Jev, ma i dettagli pubblicati danno il vantaggio a Jev in sei benchmark su undici.
Gli agenti di coding progrediscono più velocemente della loro autonomia reale. Lasciato da solo davanti a un repository su SWE-sweep, il modello migliore trova e corregge solo il 4,7 % dei bug, per oltre 7 000 dollari. Claude Code 2.1.288 dedica la maggior parte delle sue 89 voci a correzioni, tra cui la ripresa dopo un timeout dell’API e diverse regole sui permessi rese più restrittive, e mette in evidenza un mod che sorveglia il lavoro dell’agente principale. Anthropic affronta l’altro collo di bottiglia, le competenze umane, con 100 milioni di dollari per formare ingegneri capaci di portare un deployment fino alla produzione. I modelli aperti, dal canto loro, si guadagnano un posto negli strumenti, con GLM 5.3 in Cursor e DeepSeek Harness sul desktop.
L’hardware di calcolo, infine, si diversifica in tre direzioni. Google testa in orbita TPU che un giorno potrebbero beneficiare di un’energia solare fino a 8 volte maggiore rispetto alla Terra, NVIDIA aggiunge al suo DGX Spark una configurazione da 64 Go da abbinare in coppia per raggiungere 200 miliardi di parametri e DeepSeek rende le sue librerie di basso livello utilizzabili, con la stessa API, sui chip Ascend di Huawei. Ognuno, a modo suo, amplia i luoghi e l’hardware su cui i modelli possono funzionare.
Fonti
- Risolvere insieme problemi di ricerca aperti (Meta AI Research)
- Thread di @AIatMeta sui sei articoli
- AstaBrief diventa open source (Ai2)
- Post di Google Research sulle previsioni dell’influenza
- Rapporto FluSight 2025-2026 dei CDC
- Annuncio della Decisions API da parte di @perplexitydevs
- Documentazione della Decisions API
- pplx-decider-v1-27b su Hugging Face
- Novità in llama.cpp: modelli decisionali (ggml-org)
- Claude Frontier Academy (Anthropic)
- Pagina del programma Claude Frontier Academy
- Note di rilascio di Claude Code 2.1.288
- You should know evidenziato da @ClaudeDevs
- GLM 5.3 in Cursor, annuncio di @cursor_ai
- Changelog di Replit del 2 ottobre
- DeepSeek Harness ripreso da @deepseek_ai
- Pagina di DeepSeek Harness
- SWE-sweep
- Il prototipo di Project Suncatcher è in orbita (Google)
- Articolo di Project Suncatcher su Joule
- Lancio ripreso da @GoogleAI
- DGX Spark 64 Go (blog NVIDIA)
- DeepGEMM-Ascend su GitHub
- DeepEP-Ascend su GitHub
- Presentazione di Speech (Suno)
- ElevenLabs certificato FedRAMP 20x Class A
- Note di rilascio di ChatGPT
- Finances in ChatGPT (centro assistenza OpenAI)
- CHANGELOG del SDK TypeScript di SpaceXAI
- Il pacchetto @xai-official/sdk su npm
- GPT-6.1 Sol in v0 (@v0)
- Dashboard degli agenti di Grok Build (@grok)
- Nightly v0.64.0 del 2 ottobre di Gemini CLI
- Modelli deprecati di GitHub Copilot
- Il tuo SKILL.md aiuta gli agenti di coding?
- Video Editor di Manus
- Game Dev di Manus
- AutoSynthData (ServiceNow)
- POCKET-Darwin-180B (VIDRAFT)
- Una guida ai modelli della famiglia GPT-6 (OpenAI)
- Chatham Financial e OpenAI
- The Den e ChatGPT Work
- GPT-6 Astra Ultrafast su Blackwell (blog NVIDIA)
- Presentazione di CoreWeave Forge
- Eleven v4 in ElevenReader (@ElevenLabs)
- Changelog alpha di Midjourney del 1° ottobre
- Grok 4.7 in Ramp Router (@SpaceXAI)
- Commenti riservati sugli avvisi di sicurezza (GitHub)
- API REST dei commenti sugli avvisi di sicurezza (GitHub)
- Nuovi campi dell’API GraphQL SecurityAdvisory (GitHub)
- Ritiro dell’immagine macOS 14 da GitHub Actions
- Guida di Perplexity sulla maturità dell’IA