ai-powered-markdown-translatorArticolo tradotto dal francese all’italiano con gpt-5.6-sol.
Quarantanove annunci nella giornata del 2 settembre, il terzo volume più elevato dall’inizio di questo monitoraggio. Tre modelli di primo piano sono usciti lo stesso giorno — Gemini 3.8 Flash di Google, Muse Spark 1.3 di Meta Superintelligence Labs e Qwen3.8-Max-0902 di Alibaba — e nessuno dei tre ha posto l’accento sulla corsa ai punteggi grezzi.
Quattro tendenze attraversano questa edizione. Innanzitutto il prezzo, diventato l’argomento centrale di tutti e tre i lanci. Poi l’inferenza locale, con la generazione video che arriva su una macchina desktop e un motore di inferenza per Apple Silicon il cui codice viene aperto la stessa sera. La governance dei modelli in azienda, dove GitHub impone la conservazione dei dati per un modello e consente di scegliere l’impostazione predefinita per tutti gli altri. E la cybersicurezza, con un modello dedicato riservato a difensori selezionati e un’alleanza che entra nella Linux Foundation.
Gemini 3.8 Flash e 3.8 Flash Cyber, un modello che lavora più intensamente allo stesso prezzo
2 settembre — Google ha presentato due modelli firmati da Tulsee Doshi (Senior Director, Product Management) e Raluca Ada Popa (Gemini Security Lead, Google DeepMind): Gemini 3.8 Flash e Gemini 3.8 Flash Cyber. È la terza versione Flash in sei settimane, mentre 3.7 Flash esisteva da appena tre settimane.
Le due varianti condividono la stessa intelligenza di base e Google attribuisce esplicitamente una parte dei progressi nel codice e nel ragionamento a un addestramento approfondito nel campo della cybersicurezza: il lavoro svolto per il modello difensivo ha migliorato anche il modello generalista. Il prezzo di lancio rimane invariato rispetto a 3.7 Flash.
| Caratteristica di Gemini 3.8 Flash | Valore misurato |
|---|---|
| Prezzo dell’input | 0,75 dollari per milione di token |
| Prezzo dell’output | 3,75 dollari per milione di token |
| HLE-Verified | 54,9 % |
Un aspetto merita l’attenzione degli sviluppatori, perché Google lo afferma senza mezzi termini: il modello consuma di più. L’aumento dell’affidabilità deriva da una scelta progettuale — nei compiti complessi, 3.8 Flash esegue ulteriori passaggi di ragionamento e richiama gli strumenti in modo iterativo. Ai livelli di effort elevati, il consumo di token aumenta quindi, e Google consiglia di ridurre il livello di effort o di continuare a utilizzare 3.7 Flash per i carichi in cui l’efficienza di calcolo è prioritaria. La versione precedente resta pienamente supportata.
La variante Cyber è la più insolita. Riservata a difensori fidati tramite il programma Fairwind lanciato lo stesso giorno, punta alla scoperta autonoma delle vulnerabilità e soprattutto alla loro correzione automatica.
| Prova di cybersicurezza | Gemini 3.8 Flash Cyber | Termini di confronto |
|---|---|---|
| CyberGym Pass@1 (scoperta di falle C/C++) | 86,2 % | GPT-5.5-Cyber 85,6 % · Mythos 5 83,8 % · GPT-5.6 Sol 83,6 % · 3.5 Flash Cyber 77,5 % |
| Benchmark interno su 20 linguaggi | oltre il 70 % | Ambito più ampio rispetto al solo C/C++ |
| CWE-Bench pass@1 (correzione, Collinear) | 47,2 % | Modello di frontiera leader al 47,8 %, ma con un costo nettamente superiore |
I dati relativi all’implementazione interna avvalorano il posizionamento costo/prestazioni più che una supremazia assoluta: il team Chrome Security ottiene 2,6 volte più correzioni valide rispetto ai migliori modelli commerciali, molto più grandi; Wiz misura un recall superiore dal 7,5 al 9,7 % nel proprio benchmark di penetration testing a un costo da 2,3 a 5,2 volte inferiore; e il team Cloud Vulnerability Research ha individuato una vulnerabilità fondamentale critica in meno di due ore, mentre una ricerca di questo tipo richiede normalmente mesi. Il modello generalista, dal canto suo, è già disponibile in Antigravity, nell’API Gemini tramite Google AI Studio e Android Studio, nella generazione di interfacce di Stitch, in Gemini Enterprise e, per gli abbonati a Google AI Pro e Ultra, nell’applicazione Gemini, nell’AI Mode di Google Search e in Google Sheets.
🔗 Annuncio di Gemini 3.8 Flash e 3.8 Flash Cyber
Il punteggio CursorBench che documenta il lancio
Cursor ha aggiunto Gemini 3.8 Flash al proprio selettore di modelli poche ore dopo la presentazione, e il suo benchmark offre la migliore misurazione disponibile delle prestazioni del modello in condizioni agentiche. Il registro di CursorBench, datato lo stesso giorno, indica che 3.8 Flash è stato promosso a versione Gemini «Latest» e che 3.7 Flash è passato in posizione secondaria.
| Modello e livello di effort | Punteggio CursorBench 3.2 | Costo medio per attività | Passaggi per attività |
|---|---|---|---|
| Fable 5.1 Max | 73,4 % | 9,64 dollari | 70 |
| Grok 4.6 Extra High | 70,8 % | 2,81 dollari | 46 |
| Fable 5.1 High | 69,4 % | 4,80 dollari | 44 |
| Opus 5 Extra High | 69,3 % | 7,35 dollari | 72 |
| Gemini 3.8 Flash High | 69,2 % | 2,38 dollari | 161 |
| Gemini 3.8 Flash Medium | 67,0 % | 1,93 dollari | 136 |
| Gemini 3.7 Flash High | 61,6 % | 1,20 dollari | 99 |
Il quadro si coglie a colpo d’occhio: con il 69,2 %, Gemini 3.8 Flash High ottiene un punteggio equivalente a Fable 5.1 High a circa metà prezzo e a Opus 5 Extra High a un terzo del prezzo. Il divario rispetto alla generazione precedente è di 7,6 punti. La colonna dei passaggi ricorda tuttavia il costo nascosto della scelta progettuale di Google: 161 passaggi per attività, contro i 44 di Fable 5.1 High. Cursor stesso segnala due riserve a piè di pagina — i risultati presentano una certa variabilità e il costo indicato è ricostruito a partire dalle tariffe pubbliche per milione di token, non misurato sulla fattura.
🔗 Gemini 3.8 Flash in Cursor · 🔗 Risultati di CursorBench
Muse Spark 1.3, il modello agentico di Meta Superintelligence Labs
2 settembre — Meta Superintelligence Labs ha pubblicato Muse Spark 1.3, successore di Muse Spark 1.2, distribuito lo stesso giorno in Muse Code e nella Meta Model API accessibile da dev.meta.ai. È la seconda uscita del laboratorio in due giorni, dopo Muse Voice Transcribe.
L’obiettivo dichiarato non è la corsa ai punteggi, bensì l’effettiva usabilità. Il modello è progettato per sostenere attività di lungo periodo gestendo contemporaneamente più flussi in un unico thread: di fronte a un obiettivo aperto, utilizza strumenti per costruire il proprio contesto a partire da fonti disordinate e contraddittorie, corregge le lacune del proprio piano e tiene traccia di ciò che ha appreso. L’aspetto più insolito riguarda la collaborazione: Muse Spark 1.3 è addestrato a porre domande di chiarimento quando un’istruzione è ambigua, a chiedere aiuto all’utente quando è bloccato e a richiedere conferma prima di un’azione con conseguenze. I confronti effettuati dagli ingegneri di Meta gli attribuiscono circa il 20 % in meno di chiamate agli strumenti e il 25 % in meno di token rispetto alla versione 1.2 — una differenza che si riflette direttamente sulla fattura.
| Categoria valutata | Benchmark | Muse Spark 1.3 | Muse Spark 1.2 | GPT-5.6 Sol | Opus 5 |
|---|---|---|---|---|---|
| Agente | GDPVal-AA v2 (lavoro intellettuale) | 1754 | 1615 | 1710 | 1824 |
| Agente | OSWorld 2.0 (uso agentico del computer) | 66,9 | 47,6 | 62,7 | 68,3 |
| Agente | DeepSearchQA (navigazione agentica) | 89,4 | 85,9 | 93,0 | 90,4 |
| Agente | AutomationBench (flusso aziendale end-to-end) | 49,4 | 38,2 | 46,7 | 50,3 |
| Contesto lungo | MRCR 512K-1M | 98,1 | 55,5 | 73,8 | – |
| Codifica | DeepSWE v1.1 (codice agentico di lunga durata) | 75,4 | 55,0 | 73,0 | 74,0 |
| Codifica | SWEAtlas CodeBase QnA | 59,4 | 46,2 | 53,5 | 52,7 |
Questa tabella merita una lettura attenta. Muse Spark 1.3 domina nettamente nel contesto lungo e nella codifica, ma Opus 5 lo supera nelle quattro prove agentiche qui considerate. Soprattutto, il confronto non è stato condotto ad armi pari, come afferma la metodologia pubblicata da Meta: Muse Spark 1.3 e 1.2 sono stati valutati al livello di effort xhigh, mentre Claude Opus 5 e GPT-5.6 Sol lo sono stati in modalità max. Una sola eccezione: DeepSWE v1.1, in cui Muse Spark 1.3 è stato misurato in modalità max — proprio la modalità che non è ancora disponibile, poiché Meta afferma che arriverà una volta completati gli ulteriori test di sicurezza.
Un paragrafo della roadmap richiama l’attenzione per l’ecosistema aperto.
Stay tuned for more updates soon, including bigger models, Muse Spark open weights, and more.
🇮🇹 Restate sintonizzati per altre novità in arrivo, tra cui modelli più grandi, i pesi aperti di Muse Spark e molto altro. — @AIatMeta su X
Dopo un anno in cui Meta ha ridotto sensibilmente le proprie uscite con pesi aperti, l’impegno è degno di nota — resta da vedere quale versione sarà interessata, poiché non sono state indicate né una data né una portata precisa.
🔗 Presentazione di Muse Spark 1.3
Qwen3.8-Max-0902 conquista il primo posto nella Code Arena WebDev
2 settembre — Qwen ha pubblicato un aggiornamento del proprio modello di punta: Qwen3.8-Max-0902, uno snapshot datato che risponde anche all’alias qwen3.8-max-2026-09-02. Il modello conserva le caratteristiche strutturali della versione di agosto — 2.400 miliardi di parametri e una finestra di contesto da 1 milione di token — ma ha ricevuto un’ulteriore fase di post-addestramento orientata a «Coding & Cowork».
| Caratteristica del modello | Valore pubblicato |
|---|---|
| Parametri | 2,4 T |
| Finestra di contesto | 1 M token |
| Input massimo | 991 K token (983 K in modalità thinking) |
| Output massimo | 131 K token |
| Budget di ragionamento | 262 K token |
| Prezzo di input e output | 2 dollari e 6 dollari per milione di token |
| Lettura esplicita della cache | 0,17 dollari per milione di token |
| Lettura implicita della cache | 0,25 dollari per milione di token |
| Creazione esplicita della cache | 2,50 dollari per milione di token |
| Limiti di throughput | 1 M token al minuto, 15 K richieste al minuto |
Il modello accetta immagini, testo e video in input ed espone cinque strumenti integrati tramite la Responses API: interprete di codice, ricerca da immagine a immagine, ricerca da testo a immagine, estrattore web e ricerca web. È disponibile tramite API su QwenCloud dallo stesso giorno.
Lo stesso giorno, Arena.ai ha pubblicato i propri risultati sulla Code Arena WebDev. Qwen3.8-Max-0902 entra direttamente al primo posto della classifica generale con 1.691 punti, ovvero 22 punti in più rispetto alla versione precedente, 3 punti davanti a Claude Opus 5 con impostazione Max e 17 punti davanti a Kimi K3 con impostazione Max. Con un prezzo misto di 5 dollari per milione di token, il modello occupa la posizione con il punteggio più elevato sulla frontiera di Pareto di Arena, vale a dire il miglior rapporto punteggio-costo dell’intera classifica.
Il dettaglio per categoria sfuma il quadro: primo in Data & Analytics e Consumer Product, secondo in Brand & Marketing, Gaming e Simulations, terzo in Content Creation Tools e Reference-Based Design. La forza del modello riguarda quindi più le applicazioni di dati e i prodotti di largo consumo che le attività prevalentemente creative. Arena annuncia l’arrivo dei punteggi di Agent Arena.
🔗 Annuncio di Qwen3.8-Max-0902
L’inferenza abbandona il cloud: video su un computer desktop, un motore locale con licenza aperta
È la tendenza di fondo della giornata e non è racchiusa in nessun singolo annuncio. Due importanti pubblicazioni e quattro segnali più discreti vanno nella stessa direzione: eseguire localmente ciò che fino a ieri richiedeva una GPU da data center.
2 settembre — Il team FastVideo dell’Hao AI Lab (UCSD) ha pubblicato il porting locale di FastH3, la sua versione distillata del modello video aperto MiniMax H3. Finora, generare congiuntamente video e audio richiedeva una GPU da data center; ora il modello funziona su una NVIDIA DGX Spark, due DGX Spark collegate tramite QSFP oppure un Mac Apple Silicon dotato di almeno 36 GB di memoria unificata.
Il vincolo principale non è la potenza di calcolo, ma la memoria. La DGX Spark integra 128 GB di LPDDR5X unificata a circa 270 GB/s, vale a dire più o meno un decimo della larghezza di banda di una HBM da data center, dei quali 121 GB sono effettivamente disponibili per un carico di lavoro. La pipeline procede quindi per fasi: codificare il prompt, liberare l’encoder di testo, caricare il transformer, eseguire il denoising, liberarlo e infine caricare il VAE. Su una GPU discreta, ricopiare i pesi sull’host libera la memoria del device; su Spark, questa copia ricade nello stesso pool. Il team l’ha eliminata a favore del caricamento diretto del DiT sulla GPU: il caricamento del transformer scende da 445 s a 39 s e un’esecuzione a 768×1344 su 124 immagini da 772 s a 336 s.
| Macchina di test | Prima generazione | Generazione ripetuta |
|---|---|---|
| Apple M4 Max | 504 s | 465 s |
| DGX Spark | 264 s | 243 s |
| 4x GB200 | 10,2 s | 5,1 s |
Rispetto alla ricetta pubblica vLLM-Omni per DGX Spark, che richiede 1 881 s a 1024×576 per cinque secondi di video e 50 passaggi, FastH3 in quattro passaggi scende a 268 s, cioè circa 7x; il rapporto sale a 8,4x a 832×480 e ridiscende a 7,9x a 1344×768. Su M4 Max, la codifica di un prompt non memorizzato nella cache passa da circa 80 s a circa 17 s, mentre il decoder TAEH3 riduce la decodifica da 102 s a 1 s, abbassando il picco di memoria da 11,0 a 3,6 GiB. I pesi MLX sono pubblicati in INT8, INT6 e INT4 su Hugging Face, insieme al FastVideo Cookbook, pubblicato per la prima volta. Prossimo obiettivo annunciato: la famiglia RTX, incluse 5090 e 4090.
La stessa sera, Perplexity ha reso open source Lily, il motore di inferenza locale che esegue sul dispositivo la parte locale del suo calcolo ibrido su Mac. Il motore era stato presentato il giorno precedente in un articolo di ricerca; la novità è la pubblicazione del codice con licenza Apache-2.0 nel repository perplexityai/pplx-garden, dove si aggiunge a fabric-lib e pplx-unigram.
Il codice conferma una scelta di specializzazione estrema. Lily non è un motore generico: carica un solo checkpoint, Qwen3.6-35B-A3B quantizzato affine a 4 bit in formato MLX con una dimensione del gruppo pari a 64, verificato durante il caricamento. I checkpoint Qwen densi, le varianti più piccole, BF16, GGUF, AWQ, GPTQ, int8 e fp8 vengono esplicitamente rifiutati. Scritto in Rust con kernel Metal compilati dai sorgenti all’avvio, non utilizza né PyTorch né MLX nel proprio percorso di esecuzione e richiede una GPU Apple di famiglia 10 o successiva — un M5 o più recente — con almeno macOS 26. Anche la superficie API è estremamente ridotta: soltanto tre route, decodifica sempre greedy, parametri di campionamento, streaming, strumenti e contenuti multimodali rifiutati anziché ignorati. Proprio questa ristrettezza è l’aspetto interessante: Perplexity non presenta un concorrente di MLX-LM, ma dimostra che un motore realizzato su misura per una determinata piattaforma e un determinato modello supera un framework generico.
Altre quattro pubblicazioni della giornata vanno nella stessa direzione e sono riprese nelle Notizie brevi: TranslatePsy-Nano, modelli di traduzione da 17 a 42 MB che coprono diciassette lingue; il lavoro di i64 Systems sugli esperti di un modello MoE residenti su NVMe senza modificare un solo byte dell’output; l’articolo di Cohere a favore del corretto dimensionamento dei piccoli modelli nelle aziende; e la diretta DGX Spark di NVIDIA dedicata all’esecuzione locale del Portable Computer di Perplexity. Nessuna ha un grande peso singolarmente, ma tutte spostano il calcolo dal data center al dispositivo.
🔗 FastH3 in locale · 🔗 Pubblicazione del codice di Lily · 🔗 Repository pplx-garden
Anthropic rende open source Claude Commerce Agents
2 settembre — Anthropic ha pubblicato come open source Claude Commerce Agents, un repository di riferimento con licenza Apache 2.0 per costruire agenti commerciali. L’annuncio arriva intenzionalmente prima della stagione delle festività, periodo in cui i team e-commerce pianificano i propri deployment.
Il blueprint contiene due agenti completi. L’agente di acquisto opera nell’applicazione dell’azienda: cerca nel catalogo, compone un insieme di articoli per una richiesta formulata in linguaggio naturale, memorizza le preferenze del cliente, mostra prodotti, confronti e carrello nella conversazione, quindi passa il controllo al checkout — e risponde alle domande del servizio clienti nello stesso thread. L’agente commerciante è rivolto ai team che gestiscono il negozio: analisi delle vendite, avvisi su un articolo esaurito prima di una promozione, raccomandazioni sui prezzi basate sui dati storici, redazione di campagne.
| Elemento del repository | Contenuto fornito |
|---|---|
| Agenti forniti | Agente di acquisto (cliente) e agente commerciante (back-office) |
| Verticali eseguibili | Retail, viaggi, telecomunicazioni, biglietteria |
| Runtime | Messages API, Claude Agent SDK, Claude Managed Agents (beta) |
| Piattaforme di deployment | Claude API, Amazon Bedrock, Microsoft Foundry, Google Cloud Vertex AI |
| Plugin Claude Code | commerce-builder@claude-commerce-agents |
| Prerequisiti tecnici | Python 3.11 o versione successiva, Node 22 |
| Risultati già osservati | Presso i rivenditori che utilizzano agenti di acquisto basati su Claude: carrelli fino al 35% più grandi, acquirenti con una propensione all’acquisto del 60% superiore |
La separazione tra ciò che il modello decide e ciò che viene effettivamente eseguito è strutturale, non dichiarativa. Sul versante del consumatore, l’interfaccia backend chiamata dall’agente semplicemente non contiene alcun metodo di pagamento. Sul versante del commerciante, ogni strumento di scrittura produce una modifica messa in attesa, accompagnata da un identificatore generato lato server, e la funzione apply_change viene completata soltanto per gli identificatori approvati tramite una vera interfaccia di convalida umana. Anthropic precisa che si tratta di un’implementazione di riferimento non mantenuta, che non accetta contributi: un punto di partenza da cui creare un fork, non una dipendenza da seguire. Tutte le aziende presenti nelle dimostrazioni sono fittizie e nulla effettua ordini né addebita carte.
🔗 Annuncio di Claude Commerce Agents · 🔗 Repository commerce-agents
La parte tecnica: cache, latenza e misure di sicurezza nel codice
Pubblicata lo stesso giorno e firmata da Ali Shazal e Matthew Koen, la guida ingegneristica che accompagna il blueprint riassume un anno di lavoro con rivenditori, marketplace e operatori del settore dei viaggi. Il primo consiglio va controcorrente: per un agente che deve coprire numerose categorie, non creare un sotto-agente per ogni dominio. Una conversazione commerciale è una singola sessione fortemente interconnessa e la suddivisione ne peggiora la qualità: le capacità derivano dalle skill, non dalla moltiplicazione degli agenti.
| Argomento trattato | Valore indicativo fornito da Anthropic |
|---|---|
| Risposta commerciale visualizzata | Da 500 a 700 token di output |
| Lettura dei token nella cache | Un decimo del costo dei token nuovi |
| Scrittura nella cache | Sovrapprezzo di circa 1,25x, ammortizzato dal secondo utilizzo |
| Tasso di successo della cache | Dal 90 al 99% |
| Velocità delle letture dalla cache | Da 1,5 a 2x più rapide intorno a 100 000 token |
| Beneficio della memoria | 13% di richiamo fattuale in più sulla suite di valutazione interna |
| Casi di valutazione per flusso | Da 50 a 100 per iniziare |
Per la scelta del modello, la raccomandazione è partire da Opus per gli agenti commercianti, dove predomina l’analisi, e da Sonnet per gli agenti rivolti ai consumatori, dove la latenza ha più peso — quindi eseguire l’intera suite di valutazione con ciascun modello e ciascun livello di effort, misurando il costo per attività completata anziché per chiamata al modello. La sezione sulla sicurezza, invece, non lascia spazio ad ambiguità.
The prompt is where safe behavior starts, but in commerce it can’t be where safety is enforced. The failures are financial and often irreversible, and a prompt rule is one injection or one bad sample away from being skipped.
🇮🇹 Il prompt è il punto in cui inizia un comportamento sicuro, ma nel commercio non può essere il punto in cui la sicurezza viene applicata. I guasti hanno conseguenze finanziarie e spesso irreversibili, e una regola nel prompt può essere aggirata da una singola injection o da un campione errato. — Anthropic, Guida all’anatomia degli agenti commerciali efficaci
Quattro regole vengono quindi applicate nel codice e definite una sola volta per essere condivise dai tre runtime: il modello prepara, ma è una persona o una policy ad applicare; le scritture e i rendering accettano soltanto identificatori emessi dal server; le transazioni soggette a limiti devono resistere alle richieste ripetute; i contenuti di terze parti vengono sanificati.
Il controllo del computer passa in background in Claude Code e Claude Cowork
2 settembre — Il controllo del computer (computer use) da parte di Claude non monopolizza più lo schermo. Finora, avviare un’attività di questo tipo equivaleva a cedere il proprio computer: le altre finestre venivano nascoste mentre Claude lavorava nell’applicazione approvata. Ora, sia in Claude Cowork sia nella scheda Code dell’applicazione desktop, l’attività prosegue in background mentre si continua a fare altro.
La modifica è in beta, riservata ai piani Pro e Max e limitata a macOS, mentre il computer use stesso rimane disponibile in research preview su macOS e Windows. Chi utilizzava già la funzione non deve attivare nulla; gli altri la troveranno in Settings > General, tenendo presente che macOS richiede anche le autorizzazioni di sistema Accessibilità e Registrazione schermo.
Il quadro di sicurezza, invece, non cambia. A differenza dello strumento Bash, che viene eseguito in una sandbox, il computer use opera sul desktop reale. I livelli di accesso rimangono stabiliti per categoria di applicazione e non possono essere modificati: sola visualizzazione per i browser e le piattaforme di trading, solo clic per i terminali e gli IDE — così da indirizzare Claude verso lo strumento dedicato anziché verso il controllo dello schermo — e controllo completo per tutto il resto. Un’approvazione vale per la sessione in corso oppure per trenta minuti in una sessione avviata da Dispatch.
🔗 Annuncio del computer use in background
Cursor esegue i propri agenti cloud su macchine gestite dal cliente
2 settembre — Cursor ha pubblicato un articolo di prodotto firmato da Jack Pertschuk che apre i suoi agenti cloud a un’infrastruttura di proprietà del cliente. Finora, un agente cloud Cursor veniva eseguito su una macchina virtuale dedicata nel cloud dell’azienda. Con Self-Hosted Machines, l’esecuzione degli strumenti passa a macchine situate nella rete dell’azienda, mentre il ciclo dell’agente, l’inferenza e la pianificazione rimangono presso Cursor.
Il dato che giustifica la mossa viene fornito subito: gli agenti cloud producono ormai più del 60% delle pull request che Cursor integra internamente. Quando una quota crescente del lavoro passa attraverso questi agenti, la macchina sulla quale vengono eseguiti smette di essere un dettaglio. L’azienda individua tre situazioni che spingono un team verso le proprie macchine: eseguire gli strumenti a diretto contatto con il gestore dei sorgenti e i servizi interni, disporre di hardware specifico come GPU o Mac per lo sviluppo iOS oppure utilizzare un sistema operativo difficile da includere in un’immagine per agenti cloud.
| Aspetto del sistema | Dettaglio tecnico |
|---|---|
| Comando di registrazione | agent worker start, connessione HTTPS persistente in uscita |
| Direzione della connessione | Cursor non avvia mai connessioni in entrata verso la rete del cliente |
| Configurazioni disponibili | My Machines (postazione o VM individuale) e Pools (coda condivisa del team) |
| Ripristino dopo inattività | Ibernazione tramite snapshot, ripristino con lo stesso identificatore del worker |
| Fornitori di sandbox | AWS Lambda, Cloudflare, Coder, Daytona, E2B, Modal, Namespace, Vercel |
| Controllo del computer | Ora è supportato anche Linux, oltre ai Mac, tramite Chrome o Chromium |
I pool aumentano la capacità tramite un controller che monitora la coda delle richieste e avvia le macchine con uno script fornito dal team; se nessun worker è libero, la richiesta rimane in attesa. Per il caso intermedio tra il ripristino di una macchina e il mantenerla accesa, costoso in entrambi i casi, Cursor introduce l’ibernazione: la macchina inattiva viene sottoposta a snapshot e arrestata e, se un nuovo avvio avviene entro la finestra di riconnessione, lo snapshot viene ripristinato. Poiché un pool non è legato a un repository, la stessa coda può servirne diversi.
Una riserva, sollevata dallo stesso articolo: viene spostato soltanto l’ambiente di esecuzione. Gli output degli strumenti vengono inviati a Cursor per l’inferenza e possono contenere codice, mentre le trascrizioni degli agenti possono essere elaborate e archiviate presso Cursor. Non si tratta quindi di un isolamento completo, ma di uno spostamento del luogo di esecuzione.
Claude Fable 5.1 diventa disponibile per tutti presso gli integratori
1° e 2 settembre — Il giorno stesso del suo rilascio, Claude Fable 5.1 è diventato disponibile per tutti in GitHub Copilot; il giorno successivo, Genspark lo ha integrato nel suo Code Agent e in Claw. Due integratori in due giorni, per lo stesso modello: è un’ondata di adozione, non due notizie isolate.
In GitHub, la copertura è ampia — Visual Studio Code, Visual Studio, Copilot CLI, il coding agent, l’applicazione GitHub Copilot, github.com, GitHub Mobile su iOS e Android, gli IDE JetBrains, Xcode ed Eclipse — per i piani Pro+, Max, Business ed Enterprise, con un’implementazione progressiva e una fatturazione secondo la tariffa pubblica del fornitore. Ma l’aspetto più rilevante di questa disponibilità non è tecnico, bensì contrattuale.
| Condizione di accesso | Cosa si applica a Fable 5.1 |
|---|---|
| Criterio dell’amministratore | Disattivato per impostazione predefinita, da attivare esplicitamente |
| Conservazione dei dati | Obbligatoria per impostazione predefinita, per i classificatori di sicurezza di Anthropic |
| Utilizzo dei dati conservati | Nessun addestramento dei modelli di Anthropic |
| Altri modelli Claude | Conservazione zero mantenuta, eccetto Fable 5 e Fable 5.1 |
| Esenzione dalla conservazione zero | Aziende idonee, fino alla fine dell’anno solare |
| Dopo l’esenzione | Enterprise Frontier Safeguards obbligatori |
A differenza degli altri modelli Claude di Copilot, Fable 5.1 richiede per impostazione predefinita la conservazione dei dati: Anthropic conserva prompt e output per far funzionare i propri classificatori di sicurezza. Attivare il criterio equivale quindi ad accettare esplicitamente questo vincolo, mentre lasciarlo disattivato rende semplicemente il modello non disponibile. La via d’uscita è temporanea e selettiva: le aziende idonee possono mantenere la conservazione zero fino alla fine dell’anno solare, mentre Anthropic implementa i suoi Enterprise Frontier Safeguards, che dovranno offrire un monitoraggio automatizzato della sicurezza e chiavi di archiviazione e crittografia controllate dal cliente. L’idoneità non può essere ottenuta in modalità self-service: occorre rivolgersi al team commerciale di GitHub, che il supporto non può aggirare, e anche dopo l’approvazione non viene attivato nulla automaticamente.
Genspark, dal canto suo, rivendica un’integrazione fin dal primo giorno in Genspark Code Agent e in Claw, senza benchmark né dettagli sui prezzi. L’azienda si aggiunge all’elenco delle piattaforme agentiche che hanno adottato il modello nelle ore successive al rilascio, insieme a Cursor, Devin, Warp, v0, Amp e Perplexity Computer.
🔗 Fable 5.1 in GitHub Copilot · 🔗 Annuncio di Genspark
GitHub spiega come ha reso Copilot meno costoso senza degradarne la qualità
2 settembre — GitHub ha pubblicato un articolo tecnico firmato da Erik Kristensen, con Napalys Klicius, sulla riduzione dei costi di Copilot. Il testo è insolito per questo genere di contenuti: fornisce cifre, descrive gli esperimenti falliti e spiega perché un’ottimizzazione apparentemente ovvia possa produrre l’effetto contrario.
La tesi iniziale è controintuitiva. Contare i token di una singola interazione non misura l’efficienza: una risposta concisa di uno strumento che omette un’informazione necessaria all’agente lo costringe a eseguire nuovamente il comando, rendendo l’attività complessivamente più lenta e costosa. GitHub illustra la trappola con RTK (Rust Token Killer), un’utilità che abbrevia l’output della shell prima della lettura. Abbreviava effettivamente alcune risposte, ma i successivi passaggi di recupero aggiungevano turni: token risparmiati localmente, spesi globalmente. Non è stato distribuito.
| Modifica valutata | Risparmio misurato |
|---|---|
| Rimozione dei numeri di riga, nei test offline | Circa il 5 % in meno di costi di inferenza |
| Rimozione dei numeri di riga, in produzione sulla CLI | Circa il 3 % in meno di costo medio giornaliero per utente |
Compressione del prompt dello strumento task | 1 300 token rimossi per turno, 2,9 % in meno di costo normalizzato per ora attiva |
| Consegna diretta del lavoro in background completato | Circa il 2,3 % in meno di utilizzo legato ai token, misurato in AI Credits |
| Numeri di riga e compressione in Copilot code review | Circa il 5 % di token del prompt per revisione, per ciascuno dei due |
| Precedente migrazione agli strumenti per file condivisi | Circa il 20 % in meno di costi di revisione |
| RTK (Rust Token Killer) | Scartato, costo complessivo maggiore nella configurazione testata |
La politica di compressione adottata è volutamente prudente e si articola in tre parti: mantenere intatti gli output che sembrano codice sorgente, riorganizzare i risultati di ricerca senza eliminare nulla e comprimere soltanto il rumore ripetitivo prodotto da installazione, build e test. La compressione di git diff faceva parte delle prime versioni; è stata rimossa dopo che alcune attività di benchmark hanno mostrato agenti che riaprivano l’output originale.
L’episodio più istruttivo riguarda la compressione del prompt. Un ciclo di meta-prompting, nel quale Copilot riscrive iterativamente le proprie istruzioni, ha dimezzato il prompt dello strumento task — ma il primo esperimento online ha rivelato una regressione sfuggita alle valutazioni offline: il ciclo aveva trasformato un’indicazione prudente sul parallelismo in una rigida regola di ordinamento, serializzando agenti indipendenti. La correzione ha sostituito le liste consentite e vietate con un’unica frase che lascia la decisione al modello. L’ultimo insegnamento, il più utile: i miglioramenti non sono trasferibili da un prodotto all’altro. Un insieme di istruzioni più conciso, ispirato ai buoni risultati ottenuti con Copilot code review, ha fatto aumentare i costi su Copilot CLI.
None of these changes made the model smarter. They removed work the model never needed to do.
🇮🇹 Nessuna di queste modifiche ha reso il modello più intelligente. Hanno eliminato attività che il modello non aveva mai avuto bisogno di svolgere. — GitHub Blog, Come rendiamo più efficiente in termini di costi la programmazione con l’AI
Il catalogo dei modelli di Copilot si riorganizza
1° e 2 settembre — Due changelog dello stesso periodo descrivono le due facce della medesima riorganizzazione: cosa esce dal catalogo di Copilot e chi decide ora il modello predefinito.
Dal 1° settembre sei modelli sono deprecati nella maggior parte delle esperienze Copilot — Copilot Chat, modifiche online, modalità ask e agent, completamenti del codice.
| Modello ritirato | Alternativa suggerita da GitHub |
|---|---|
| Gemini 3.1 Pro | Gemini 3.7 Flash |
| Claude Opus 4.5 | Claude Opus 4.7, Claude Opus 4.8 o Claude Opus 5 |
| Claude Opus 4.6 | Claude Opus 4.7, Claude Opus 4.8 o Claude Opus 5 |
| Claude Sonnet 4.5 | Claude Sonnet 5 |
| Claude Sonnet 4.6 | Claude Sonnet 5 |
| Raptor Mini | MAI-Code-1.1-Flash |
Rimane un’eccezione: Claude Sonnet 4.6 resta accessibile agli abbonati individuali con piano annuale. Non è richiesta alcuna azione da parte dell’utente, ma gli amministratori di Copilot Enterprise potrebbero dover attivare esplicitamente i modelli sostitutivi nei propri criteri; in caso contrario, questi non compariranno né in VS Code né su github.com.
Allo stesso tempo, le impostazioni gestite a livello aziendale consentono ora di scegliere qualsiasi modello come predefinito per le nuove conversazioni. La granularità va oltre l’azienda: dichiarando la chiave model come overridable e modificando i file di configurazione dei team in team-mappings.json, un amministratore può consentire a ciascun team di scegliere il proprio modello predefinito, mentre gli utenti non interessati ereditano l’impostazione globale. La funzionalità è disponibile per tutti su Copilot Business e Copilot Enterprise, nell’applicazione GitHub Copilot, in Copilot CLI e in Visual Studio Code.
🔗 Modelli deprecati · 🔗 Modello predefinito in azienda
Lo Ship Log di agosto: Copilot in Slack e Teams e contenuti multimediali nella CLI
1° e 2 settembre — Il riepilogo mensile pubblicato da GitHub sotto forma di Articolo X è un’iniziativa promozionale, ma presenta una novità di agosto che non era stata riportata: GitHub Copilot è ora accessibile da Slack e Microsoft Teams. L’integrazione porta le capacità agentiche di Copilot CLI e dell’applicazione GitHub Copilot nelle conversazioni dei team — menzionare GitHub consente di pianificare modifiche, analizzare un problema o inoltrare un’attività di programmazione senza abbandonare la conversazione.
| Elemento dello Ship Log di agosto | Cosa è stato rilasciato |
|---|---|
| Copilot in Slack e Microsoft Teams | Capacità agentiche di Copilot CLI e dell’applicazione Copilot |
| Copilot code review, profondità Balanced | Disponibilità generale, accanto a Lite, impostazione predefinita configurabile per organizzazione o repository |
| Nuovi modelli ricordati | Gemini 3.7 Flash, MAI-Code-1.1-Flash, Kimi K3 ospitato da Fireworks AI |
| Promozione su GPT-5.6 Sol | Metà prezzo fino al 3 settembre |
| Promozione sulla selezione automatica | Sconto del 30 % per gli utenti Copilot Max |
| GitHub Copilot Day | 10 settembre 2026 |
Il riepilogo documenta anche la profondità Balanced di Copilot code review, diventata disponibile per tutti accanto a Lite: Balanced punta a un’analisi più approfondita delle pull request, Lite alle modifiche dirette, e la profondità predefinita può essere configurata a livello di organizzazione o repository.
Un’altra novità del mese completa il quadro per la riga di comando: il flag ripetibile --attach di GitHub CLI, disponibile da gh v2.99.0, carica un’immagine o un video locale e lo inserisce online in una issue, una pull request o un commento. Funziona con i sei comandi che scrivono Markdown, e il dettaglio che lo rende utilizzabile è la gestione del Markdown esistente: un percorso locale già indicato nel corpo viene riscritto sul posto, così  conserva il proprio testo alternativo e punta all’asset caricato. Il testo alternativo si specifica dopo un # nel percorso. Formati accettati: PNG, JPEG, GIF, WebP, SVG, MP4, MOV e WebM, con un limite di 10 MB per le immagini e di 100 MB per i video sui piani a pagamento. GitHub Enterprise Server non è supportato in questa versione. GitHub sottolinea esplicitamente che gli agenti di programmazione ereditano questa capacità e possono ora mostrare un risultato anziché descriverlo.
🔗 Ship Log di agosto 2026 · 🔗 Contenuti multimediali in GitHub CLI
Fairwind Program, la difesa informatica di Google riservata ai difensori fidati
2 settembre — Lo stesso giorno di Gemini 3.8 Flash Cyber, Google ha lanciato il Fairwind Program, il canale attraverso cui viene distribuito questo modello. Il ragionamento esposto da Four Flynn, vicepresidente per la sicurezza e la privacy, parte da un dilemma concreto per i team di difesa: adottare enormi modelli di frontiera, costosi e difficili da gestire sulle codebase aziendali, oppure ripiegare su modelli più piccoli a pesi aperti, che faticano a correggere vulnerabilità complesse.
La risposta abbina Gemini 3.8 Flash Cyber a CodeMender, l’infrastruttura di correzione automatica di Google. L’argomento centrale non è il rilevamento, ma la remediation: individuare le debolezze genera consapevolezza e timore, mentre trovarle e correggerle automaticamente offre sicurezza. La promessa è generare correzioni verificate e distribuibili in pochi minuti anziché in settimane, all’interno dell’ambiente cloud sicuro dell’organizzazione cliente.
L’accesso è deliberatamente graduale, con tre categorie prioritarie: governi e autorità informatiche nazionali, operatori di infrastrutture critiche nei settori sanitario, delle telecomunicazioni, dell’energia e delle reti finanziarie, e piattaforme tecnologiche centrali. Le organizzazioni partecipanti accettano vincoli rigorosi — limitare l’accesso ai team interni di cybersicurezza, risposta agli incidenti o penetration testing e implementare protezioni come l’autenticazione multifattore. Google annuncia più di 650 partner partecipanti nel mondo. Al di fuori del programma, qualsiasi cliente Google Cloud può utilizzare CodeMender con modelli disponibili pubblicamente su Gemini Enterprise Agent Platform, come complemento ad AI Threat Defense. L’azienda afferma inoltre di aver superato complessivamente i 100 milioni di dollari di finanziamenti per la cybersicurezza tramite Google.org, di cui 36 milioni destinati a 35 cliniche informatiche che hanno sostenuto più di 1 250 ospedali, distretti scolastici e servizi municipali statunitensi.
Gli strumenti a riga di comando di Google: tre versioni in due giorni
1° e 2 settembre — Google ha distribuito tre versioni riguardanti lo stesso ambito in due giorni, e nel complesso emerge una priorità chiara: meno funzionalità, più isolamento e stabilità.
| Versione pubblicata | Data | Contenuto predominante |
|---|---|---|
| Gemini CLI v0.58.0 | 1° settembre | Sette modifiche incentrate sulla sicurezza, promozione al canale stabile |
| Antigravity CLI 1.1.23 | 1° settembre | Due miglioramenti, undici correzioni |
| Antigravity 2.12.0 | 2 settembre | Sette miglioramenti, nove correzioni |
Il canale stabile di Gemini CLI è passato alla v0.58.0, una promozione passata inosservata perché avvenuta trentadue minuti dopo la pubblicazione della preview v0.59.0. Il contenuto è quasi interamente difensivo. La correzione più sostanziale riguarda la sandbox di macOS: il profilo Seatbelt ora isola i socket e i binari di Docker e dei runtime dei container, chiudendo così una classica via di evasione — un processo confinato che raggiunge il socket Docker dell’host può, in pratica, evadere. Altre due modifiche rafforzano il nucleo: la valutazione dei link simbolici diventa coerente nella gestione dei percorsi ignorati e i controlli di sicurezza di primo livello vengono dichiarati esplicitamente nella configurazione della policy di scrittura.
Antigravity 2.12.0 introduce due novità funzionali. La citazione delle risposte consente di evidenziare una parte di una risposta per reinserirla come contesto nel prompt successivo — una risposta diretta a un problema quotidiano delle lunghe sessioni agentiche. Inoltre, il comando /boost, riservato agli utenti paganti, intensifica lo sforzo di riflessione attraverso una pipeline di ragionamento multi-agent. Arriva lo stesso giorno di Gemini 3.8 Flash, per il quale Google dichiara apertamente un’elaborazione più intensa al prezzo di un maggior numero di token: entrambe le iniziative vanno nella stessa direzione, quella di un controllo esplicito da parte dell’utente sul livello di sforzo. Il resto riguarda inconvenienti concreti: le impostazioni generali indicano quali progetti sovrascrivono una configurazione, i layout del terminale a schermo diviso sopravvivono ai ricaricamenti della finestra e si può inviare un messaggio mentre la dettatura è in corso.
Antigravity CLI 1.1.23, infine, alleggerisce lo streaming dei subagent inviando i metadati della traiettoria una volta per ogni sottotraiettoria anziché a ogni passaggio, e accetta tramite Tab il nome del modello suggerito come testo fantasma in /model. Le sue undici correzioni rivelano difetti fastidiosi nell’uso quotidiano: arresti anomali provocati dagli hook dei prompt, identificatori delle chiamate agli strumenti omessi durante la ricostruzione della cronologia per i modelli Gemini, richieste di autorizzazione che mostravano titoli generici anziché descrizioni leggibili delle azioni — un problema concreto, perché veniva chiesto di autorizzare un’azione senza descriverla — e subagent dichiarati con enable_mcp_tools=true che non funzionavano per l’assenza di un dispatcher MCP.
🔗 Note di rilascio di Gemini CLI v0.58.0 · 🔗 Changelog di Antigravity
Le Short Video Overviews di Gemini Notebook arrivano in oltre 70 lingue
1° settembre — Gemini Notebook ha esteso le sue Short Video Overviews a oltre 70 lingue, aggiungendo anche tre nuove varianti dell’inglese. La funzionalità trasforma le fonti di un notebook in video verticali di circa 60 secondi, ora generabili nella lingua dell’utente.
Il lancio riguarda il web e i dispositivi mobili e rimane riservato agli abbonati Ultra e Pro — il team ha precisato nello stesso thread che la distribuzione agli utenti Pro non è ancora completa. Due dettagli completano l’annuncio: il numero di fonti presenti in un notebook non rientra nel calcolo del consumo di token e gli utenti Pro mantengono la possibilità di generare Cinematic Video Overviews in inglese. Il passaggio dall’inglese a 70 lingue trasforma la funzionalità da dimostrazione a strumento realmente utilizzabile al di fuori del mondo anglofono.
Gli editor diventano multiplexer di modelli
1° e 2 settembre — Due annunci apparentemente non collegati descrivono lo stesso fenomeno: l’ambiente di sviluppo diventa un punto di accesso a modelli di terze parti e l’elemento distintivo si sposta dalla qualità del modello alle condizioni in cui viene eseguito.
Zed ha pubblicato la versione stabile 1.18.0, il cui contenuto più significativo si trova nella sezione IA delle note di rilascio. L’editor recupera in un colpo solo diverse uscite recenti: la finestra di contesto da 1 milione di token di GPT-5.6 è supportata su Amazon Bedrock, Gemini 3.5 Flash-Lite entra a far parte dei modelli Google AI, Grok 4.5 e Grok 4.6 si aggiungono ai modelli xAI e viene migliorato il supporto per Claude Fable 5.1, pubblicato il giorno precedente. Due di queste quattro novità sono contributi esterni accreditati nelle note. Si aggiungono elementi ergonomici specifici per il lavoro con gli agenti — ripristino di una connessione interrotta con un agente esterno senza riavvio, consumo di memoria ridotto durante le sessioni lunghe, errori di connessione che indicano il nome dell’host irraggiungibile — e una correzione degna di nota per chi collega server MCP: l’autenticazione OAuth non funzionava con i server che richiedevano scope non standard.
Mistral, dal canto suo, ha reso disponibile GLM 5.2 in Vibe Code, il suo agente di coding, per i piani Pro e Team. L’aspetto rilevante non è il modello, ma il modo in cui viene erogato: Mistral lo ospita in Europa sulla propria infrastruttura. Uno sviluppatore europeo che utilizza GLM 5.2 da Vibe Code si avvale quindi di un’inferenza gestita da Mistral, senza che le sue richieste transitino dai server di Z.ai. È la concretizzazione del posizionamento sull’inferenza regionale che l’azienda sostiene da agosto — e la situazione è doppiamente rivelatrice, perché Mistral dispone della propria famiglia Devstral e sceglie comunque di offrire nel proprio strumento un modello open-weight sviluppato da un laboratorio concorrente.
🔗 Note di rilascio di Zed 1.18.0 · 🔗 GLM 5.2 in Vibe Code
NVIDIA: due articoli di ingegneria e un’alleanza che cambia organizzazione di riferimento
2 settembre — Tre pubblicazioni di NVIDIA nello stesso giorno, due tecniche e una sulla governance.
Il primo articolo, terzo capitolo della serie sul co-design dei modelli, propone cinque regole per configurare lo speculative decoding. La tecnica è nota: un piccolo modello di draft propone diversi token che il modello target verifica in un unico passaggio parallelo. La questione pratica rimane aperta — quanti token sottoporre a speculazione e con quale meccanismo. Durante la verifica, il calcolo cresce con (1 + D), ma gli accessi alla memoria rimangono invariati: occorre quindi aumentare la lunghezza del draft D fino al punto in cui la verifica passa da memory-bound a compute-bound. Su un GEMM di un expert rappresentativo, D = 7 consente di raggiungere questo regime con un ottavo della dimensione del batch necessaria con D = 0. Quando l’attention domina il tempo di decoding, la lunghezza ottimale diventa D = 128/G − 1, dove G è il numero di query head che condividono una KV head; oltre tale valore, è preferibile scegliere valori per i quali G × (1 + D) è un multiplo di 128, la dimensione del tile del kernel di attention. Le misurazioni si basano su SPEED-Bench, il benchmark di speculative decoding di NVIDIA: con Qwen 3.5 122B A10B come target, il draft esterno 35B A3B raggiunge una lunghezza di accettazione pari a 6 con D = 9. L’articolo insiste su un punto spesso trascurato — un’accettazione più elevata non implica un’accelerazione maggiore — e si conclude con un avvertimento: il fine-tuning del target modifica la sua distribuzione di output, per cui un drafter addestrato per uno specifico checkpoint può registrare una riduzione dell’accettazione anche quando il target migliora.
Il secondo articolo è un percorso di ottimizzazione CUDA in sei fasi, costruito attorno a un unico esempio: convertire tre immagini RGB in scala di grigi, quindi calcolare la mediana di ogni tile di 32 × 32 pixel. Il punto di partenza è un codice intenzionalmente errato, che Compute Sanitizer diagnostica immediatamente — una scrittura fuori limite nella memoria condivisa, causata dall’uso di un indice globale dove era previsto un indice di blocco.
| Fase di ottimizzazione | Tempo totale | Guadagno della fase |
|---|---|---|
| Codice iniziale | 6,8 s | — |
| CUB (DeviceTransform e BlockRadixSort) | 635 ms | circa 10x |
| Container di memoria in pool | circa 244 ms | circa 2,6x |
| Memoria pinned | 25 ms | circa 10x |
| Uno stream CUDA per immagine | 23 ms | circa 300x cumulato |
La sola sostituzione dell’algoritmo bubble sort artigianale con cub::BlockRadixSort riduce il calcolo delle mediane da 2,142 s a 773 µs, vale a dire un fattore 2717. Nessuna di queste fasi riguarda un’ottimizzazione di basso livello: si tratta di sostituzioni di API.
Infine, l’Open Secure AI Alliance, che NVIDIA ha contribuito a fondare, entra nella Linux Foundation. La tesi sostenuta dall’alleanza sposta il fulcro del dibattito abituale: un agente non è soltanto un modello linguistico, ma un sistema software composto da modelli, harness che gli forniscono contesto e guardrail che delimitano ciò che può fare. Eppure, il dibattito sulla safety si è concentrato in gran parte soltanto sul modello, mentre la sicurezza dipende dall’intero sistema — harness, meccanismi di alignment, ambienti di esecuzione, identità, policy, osservabilità e ripristino. È aperta una richiesta di commenti su SAFE (Shared AI Findings Exchange), un meccanismo per la raccolta riservata degli incidenti e dei quasi incidenti legati all’IA, in collaborazione con OpenSSF.
🔗 Speculative decoding · 🔗 Ottimizzazione CUDA passo dopo passo · 🔗 Open Secure AI Alliance
Equinix Inference Exchange, modelli aperti in 280 data center
2 settembre — Equinix ha annunciato Equinix Inference Exchange, un programma di inferenza IA distribuita che amplia la collaborazione con NVIDIA e vi aggiunge Together AI. La configurazione si basa su tre livelli: Equinix fornisce l’infrastruttura fisica collegata ai cloud tramite Equinix Fabric, NVIDIA mette a disposizione le proprie architetture di riferimento enterprise validate e Together AI gestisce la piattaforma sovrastante, con il supporto di oltre 200 modelli open source, in modalità condivisa oppure in un ambiente single-tenant dedicato.
L’argomentazione verte sulla localizzazione dell’inferenza più che sulla scelta del modello, con tre casi d’uso mirati: l’inferenza nell’edge metropolitano per ridurre la latenza, la migrazione dei workload da modelli proprietari chiusi ad alternative aperte e l’IA sovrana per le aziende regolamentate. I dati relativi alla presenza geografica danno la misura della rete coinvolta: oltre 280 data center in 77 aree metropolitane, 230 rampe di accesso al cloud e più di 10.500 aziende interconnesse.
Occorre tuttavia prestare attenzione alla tempistica: il comunicato di Equinix afferma esplicitamente che la soluzione sarà disponibile a partire dal primo trimestre del 2027, mentre il messaggio di Together AI descrive la propria piattaforma come già attiva nei data center globali di Equinix. Si tratta dell’annuncio di una partnership e di una roadmap, non dell’entrata in servizio.
BenchMIRT, il metodo di Ai2 per verificare che cosa misurano davvero i benchmark
1° settembre — Ai2 ha pubblicato BenchMIRT, un metodo che pone una domanda affrontata raramente in modo diretto: un benchmark misura davvero la capacità che dichiara di misurare? Anziché ragionare sul punteggio finale, scende al livello di ogni domanda e stima quali capacità determinino effettivamente il successo, basandosi sulla teoria di risposta all’item (Item Response Theory) proveniente dalla psicometria, nella sua variante multidimensionale. L’addestramento ha utilizzato i risultati di 100 modelli open-weight, 16 benchmark e oltre 34.000 domande.
Il risultato più solido è di natura metodologica: senza che gli venisse indicato quale benchmark avrebbe dovuto misurare una determinata capacità, BenchMIRT ha fatto emergere autonomamente due dimensioni predominanti, la sicurezza e il ragionamento generale, ritrovate in modo identico ripetendo l’analisi da zero.
| Benchmark verificato | Correlazione con il ragionamento | Correlazione con la sicurezza | Esito della verifica |
|---|---|---|---|
| MMLU-Pro | 0,97 | -0,21 | Coerente con l’obiettivo dichiarato |
| BBQ | 0,85 | -0,06 | Segue il ragionamento nonostante sia un test di sicurezza |
| WMDP | -0,89 | 0,21 | Misura l’assenza di conoscenze pericolose |
| ToxiGen | 0,40 | -0,32 | Debole su entrambe, benchmark saturo al 92 % |
BBQ, progettato per verificare se un modello si basa su stereotipi sociali, presenta quindi una correlazione di 0,85 con il ragionamento generale e nessuna correlazione con la sicurezza: un punteggio basso potrebbe dire di più sul ragionamento del modello che sul suo comportamento. Il secondo contributo è pratico: classificando le domande in base al potere discriminante, Ai2 mostra che mantenendone soltanto il 10 % si conserva approssimativamente la stessa classifica dei modelli e che il metodo predice correttamente la risposta a una domanda non osservata nel 79 % dei casi, contro il 70 % di un approccio ingenuo. Due limiti dichiarati: tutti i modelli di addestramento risalgono a prima di marzo 2025 e le dimensioni individuate dipendono dall’insieme di benchmark fornito.
Runway Dev MCP, l’agente di coding assume il controllo dell’integrazione multimediale
2 settembre — Runway ha lanciato Runway Dev MCP, un server MCP ospitato che collega direttamente la sua piattaforma per sviluppatori allo strumento di coding utilizzato ogni giorno — Claude, ChatGPT, Codex o Cursor. L’argomentazione si riassume in una frase: l’agente che ha scritto l’integrazione può ora scegliere il modello più adatto, configurare gli strumenti sui quali si basa ed eseguirne il debugging.
Il servizio copre i tre momenti di un’integrazione. Prima della prima chiamata API, l’agente interroga il catalogo per sapere quali modelli può utilizzare un progetto, a quale prezzo e con quali input, quindi recupera lo schema esatto della richiesta per il modello selezionato — con l’obiettivo di effettuare correttamente la chiamata al primo tentativo, anziché procedere per supposizioni. In produzione, crea e configura un Model Router che arbitra tra più modelli in base al costo, alla latenza o alla qualità, con un limite di costo per generazione, e può individuare quale modello sia stato scelto dal router per una determinata chiamata. La stessa logica si applica ai Characters. Il terzo momento è il debugging: quando una generazione non riesce, l’agente consulta il task tramite uno strumento dedicato e legge il motivo esatto del rifiuto — rifiuto dovuto alla moderazione, limite delle dimensioni dell’asset, corpo della richiesta malformato — prima di correggere e riprovare. Un menu Quickstart crea la chiave API e poi apre Claude Code, Codex o Cursor con un messaggio già preparato.
DreamX-Creator 1.0, generazione audio-video nativa in 2K da una singola immagine
2 settembre — Il team AMAP di Alibaba ha presentato DreamX-Creator 1.0, un modello da 7 miliardi di parametri con licenza Apache 2.0 che parte da una singola immagine e da un prompt testuale per produrre flussi video e audio sincronizzati nativamente in 2K, senza concatenare in cascata un modello video e uno audio.
Il sistema si articola in tre componenti: un’attenzione incrociata intermodale con porte (Gated Cross-Modal Attention) associata a un addestramento congiunto progressivo, che consente un’interazione bidirezionale tra i due flussi; un apprendimento per rinforzo audio-video alimentato da un feedback multimodale sensibile alla modalità; e un raffinamento autoregressivo in un solo passaggio che porta il video in 2K preservando al contempo il movimento e la sincronizzazione temporale dell’audio.
La pubblicazione rimane per ora parziale. Il repository GitHub, inizializzato il giorno precedente, contiene la presentazione del progetto e la relativa roadmap, mentre il rapporto tecnico è stato pubblicato su arXiv. I pesi convalidati, il codice di inferenza, le configurazioni e gli strumenti di valutazione figurano ancora come traguardi non raggiunti. Il lavoro si basa su Wan2.2 e su MOVA di OpenMOSS, entrambi esplicitamente ringraziati.
🔗 Annuncio di DreamX-Creator 1.0
L’API OpenAI distingue un aumento del carico troppo rapido da un sovraccarico del modello
2 settembre — OpenAI ha modificato il modo in cui la sua API segnala due situazioni che finora le applicazioni client non potevano distinguere.
| Stato HTTP | Codice di errore | Significato | Comportamento da adottare |
|---|---|---|---|
| 429 | slow_down | La frequenza delle richieste è aumentata troppo rapidamente | Rispettare Retry-After, ridurre la frequenza, quindi aumentarla nuovamente in modo graduale |
| 503 | server_is_overloaded | Il modello richiesto è temporaneamente sovraccarico | Rispettare Retry-After e riprovare, aumentando l’attesa se l’errore persiste |
La distinzione ha una conseguenza pratica immediata per qualsiasi codice di retry. La documentazione precisa che un errore slow_down può verificarsi anche quando il traffico rimane entro i limiti di richieste e token al minuto dell’organizzazione: non segnala l’esaurimento di una quota, bensì un’accelerazione ritenuta troppo brusca — in altre parole, un’applicazione può essere rallentata senza aver superato alcun limite visualizzato. La guida sui limiti di frequenza propone una regola empirica: una volta che il traffico ha raggiunto un milione di token di input al minuto, non aumentarlo di oltre il 50% ogni quindici minuti. Quando l’header Retry-After è assente, OpenAI raccomanda un backoff esponenziale accompagnato da un breve ritardo casuale, per evitare che tutte le istanze dello stesso servizio riprovino contemporaneamente. Le organizzazioni il cui traffico a consumo incontra regolarmente questi limiti vengono indirizzate verso Scale Tier e, per GPT-5.6 e i modelli successivi, verso Reserved Tier.
Notizie in breve
- Claude Code 2.1.258 — versione esclusivamente correttiva: è stato ripristinato l’avvio su macOS 12 Monterey, non funzionante dalla versione 2.1.255, e le sessioni remote e pianificate non falliscono più dopo una nuova approvazione delle autorizzazioni. 🔗 CHANGELOG
- Claude Campus Ambassadors — le candidature sono aperte con tre percorsi distinti quest’anno: laurea di primo livello, studi universitari avanzati, dottorato e post-dottorato. 🔗 Annuncio
- Nokia analizza 50 milioni di righe di codice con Cursor — due ingegneri della divisione Core Networks in due settimane, laddove il team stimava di dover impiegare una dozzina di esperti per diversi mesi. Caso di studio del fornitore, senza un protocollo di misurazione indipendente. 🔗 Caso di studio
- TranslatePsy-Nano — Tether AI Research pubblica due famiglie di modelli di traduzione compatti, EuroNano per nove lingue europee e AfriNano per otto lingue africane, in varianti da 42, 31 e 17 MB con un unico checkpoint per gruppo linguistico. 🔗 Annuncio
- Puffin-World — un modello multimodale unificato che rappresenta il mondo attraverso tre stati nativi, fisica, geometria e aspetto, pubblicato insieme al dataset Puffin-16M. 🔗 Presentazione
- Gli esperti di un MoE residenti su NVMe — i64 Systems mantiene i pesi degli esperti su NVMe con verifica tramite manifesto SHA-256 e rileva output identici byte per byte tra il percorso caricato e quello residente. 🔗 Articolo tecnico
- Sakana AI alla CiNet International Conference — Llion Jones, direttore tecnico, e il ricercatore Kai Arulkumaran terranno una conferenza sui ponti tra neuroscienze e machine learning dal 5 al 7 ottobre 2026 a Osaka. 🔗 Annuncio
- Gemini CLI, nightly del 2 settembre — un’unica modifica: il miglioramento della convalida della destinazione e dell’instradamento della connessione nelle utility di recupero web, in continuità con gli interventi di rafforzamento della rete avviati a fine agosto. 🔗 Note di rilascio
- MrBeast stringe una partnership pluriennale con Google — l’accordo estende oltre YouTube il rapporto con Beast Industries, verso Gemini e Google Health, con un primo video il 5 settembre in cui Gemini viene utilizzato per sopravvivere nella giungla, nel deserto e nell’Artico. 🔗 Annuncio
- Riepilogo degli annunci sull’IA di Google ad agosto — articolo mensile che raccoglie elementi già trattati nel corso del mese, senza novità proprie. 🔗 Riepilogo
- Enterprise Live Migrations disponibile a livello generale — migrazione dei repository da GitHub Enterprise Server al cloud con residenza dei dati e interruzione quasi nulla, gestita tramite l’estensione
gh elm. Non correlato all’IA, segnalato per completezza. 🔗 Changelog - ElevenLabs nomina Ashley Kramer direttrice dei ricavi — unica pubblicazione dell’azienda nel periodo, dato che il changelog del prodotto non è stato aggiornato dal 24 agosto. 🔗 Annuncio
- NVIDIA trasmette una diretta DGX Spark sul Portable Computer di Perplexity — ventisei minuti dedicati alla sua esecuzione locale, senza testo descrittivo né trascrizione. È la seconda dimostrazione della giornata a fare di DGX Spark una piattaforma di destinazione per l’esecuzione locale. 🔗 Trasmissione
- Kling AI documenta gli Elements del proprio server MCP — tutorial sulla conservazione dell’identità di un personaggio tra le inquadrature; materiale didattico sul prodotto, non un lancio. 🔗 Tutorial
- Codex CLI 0.152.1 — versione correttiva pubblicata una ventina di ore dopo la 0.152.0: la revisione delle approvazioni Guardian ora rispetta le policy del REPL Node trasmesse dai metadati del modello. 🔗 Note di rilascio
- Cohere sostiene la scelta dei piccoli modelli in azienda — il fornitore riunisce Command R7B, Tiny Aya da 3,35 miliardi di parametri e North Mini Code, accreditato di 33,4 nel Coding Index di Artificial Analysis, per sostenere il corretto dimensionamento. Nessun lancio. 🔗 Articolo
- Perplexity pubblica due guide didattiche — sugli assistenti personali e sul rilevamento delle allucinazioni. La seconda descrive un post-addestramento in due fasi: la prima sviluppa i comportamenti del prodotto, mentre la seconda si basa su attività di ricerca più difficili. 🔗 Guida
Che cosa significa
Il prezzo è diventato l’argomento principale, anche per i modelli di frontiera. Tre lanci nello stesso giorno e nessuno mette in evidenza un punteggio record. Google mantiene per Gemini 3.8 Flash il prezzo della generazione precedente e ammette che il suo modello consuma più token — un’ammissione rara, che sposta la questione dal prezzo dichiarato al costo reale di un’attività. Qwen rivendica esplicitamente il vertice della frontiera di Pareto di Arena anziché il primo posto assoluto. Meta quantifica il proprio miglioramento non in punti di benchmark, ma nel 20% di chiamate agli strumenti e nel 25% di token in meno. E la tabella CursorBench fornisce il dato più eloquente della giornata: con il 69,2%, Gemini 3.8 Flash costa 2,38 dollari per attività, mentre un punteggio equivalente ne richiedeva 4,80 con Fable 5.1 e 7,35 con Opus 5. La colonna dei passaggi ricorda tuttavia che questo prezzo viene pagato altrove — 161 passaggi contro 44.
L’ingegneria dell’harness diventa una leva economica misurabile. L’articolo di GitHub è il documento più utile della giornata per chiunque sviluppi su questi modelli: quattro ottimizzazioni che non modificano il modello e che consentono ciascuna di guadagnare dal 2 al 5%, con gli esperimenti falliti documentati. La guida all’ingegneria di Anthropic dice la stessa cosa dall’altro lato — puntare fin dalla progettazione a una percentuale di successo della cache compresa tra il 90 e il 99%, e considerare il costo per attività completata anziché per chiamata. Entrambe convergono su un aspetto che la corsa ai modelli nasconde: a parità di modello, l’harness determina una parte significativa del costo e i miglioramenti non sono trasferibili da un prodotto all’altro. GitHub lo dimostra avendo osservato che un’ottimizzazione efficace per la code review aumentava il costo sulla CLI.
L’inferenza arriva sulla postazione di lavoro e il luogo di esecuzione dei calcoli diventa un parametro di progettazione. FastH3 rende possibile la generazione video su un Mac o un computer desktop, Perplexity rende pubblico il codice di un motore che esegue un solo modello su un unico tipo di hardware, Tether pubblica traduttori da 17 MB, i64 Systems mantiene gli esperti di un MoE su NVMe e Cohere sostiene il corretto dimensionamento. Questo movimento si congiunge, dall’alto, con quello di Equinix, NVIDIA e Together AI, che distribuiscono l’inferenza in 280 data center per ragioni di latenza e sovranità. Il filo conduttore non è la miniaturizzazione, ma la specializzazione: Lily prevale perché esclude tutto ciò che non sia Qwen3.6-35B-A3B su Apple Silicon, e la scommessa di Perplexity è che questa ristrettezza sia un vantaggio, non un limite.
Il controllo e la governance si irrigidiscono e passano ormai tanto dal contratto quanto dalla tecnica. GitHub impone la conservazione dei dati per Fable 5.1 — con un’esenzione che scade alla fine dell’anno solare — consentendo al contempo a ogni team aziendale di scegliere il modello predefinito, e rimuove sei modelli dal catalogo nello stesso giorno. Cursor trasferisce l’esecuzione degli agenti nella rete del cliente, precisando tuttavia che le trascrizioni continuano a essere elaborate presso la propria infrastruttura. Google riserva il proprio modello di cyberdifesa a 650 partner selezionati, soggetti a condizioni operative scritte. Mistral offre dall’Europa un modello cinese e ne fa il proprio argomento distintivo. Infine, BenchMIRT ricorda che gli strumenti di valutazione su cui si basa una parte di queste decisioni meritano a loro volta una verifica: un benchmark sui bias sociali che presenta una correlazione di 0,85 con il ragionamento generale e di -0,06 con la sicurezza non misura ciò che dichiara la sua etichetta.
Fonti
- Gemini 3.8 Flash e 3.8 Flash Cyber
- Risultati di CursorBench
- Gemini 3.8 Flash in Cursor
- Presentazione di Muse Spark 1.3
- Roadmap di Muse Spark
- Qwen3.8-Max-0902
- Risultati di Code Arena WebDev
- FastH3 in locale su DGX Spark e Apple Silicon
- Codice sorgente di Lily
- Pubblicazione del codice di Lily
- Claude Commerce Agents
- Repository commerce-agents
- La guida all’ingegneria degli agenti commerciali
- Computer use in background
- Cursor Self-Hosted Machines
- Claude Fable 5.1 in GitHub Copilot
- Genspark integra Fable 5.1
- Come rendiamo più efficiente in termini di costi la programmazione con l’IA
- Modelli Copilot deprecati
- Modello predefinito nelle impostazioni gestite a livello aziendale
- Registro delle pubblicazioni di agosto 2026
- Contenuti multimediali in GitHub CLI
- Fairwind Program
- Gemini CLI v0.58.0
- Changelog di Antigravity
- Short Video Overviews in 70 lingue
- Zed v1.18.0
- GLM 5.2 in Vibe Code
- Co-design e speculative decoding
- La moderna cassetta degli attrezzi CUDA nella pratica
- Open Secure AI Alliance
- Equinix Inference Exchange
- BenchMIRT
- Runway Dev MCP
- DreamX-Creator 1.0
- Changelog dell’API OpenAI
- CHANGELOG di Claude Code
- Claude Campus Ambassadors
- Nokia e Cursor
- TranslatePsy-Nano
- Puffin-World
- Gli esperti di un MoE su NVMe
- Sakana AI alla CiNet International Conference
- Gemini CLI, nightly del 2 settembre
- MrBeast, Gemini e Google Health
- Annunci sull’IA di Google nell’agosto 2026
- Enterprise Live Migrations
- ElevenLabs nomina Ashley Kramer
- Diretta su DGX Spark e Perplexity Portable Computer
- Gli Elements di Kling MCP
- Codex CLI 0.152.1
- Cohere e i piccoli modelli
- Guide didattiche di Perplexity