ai-powered-markdown-translatorArticolo tradotto dal fr al it con gpt-5.4-mini.
Il 6 agosto 2026, OpenAI unifica l’esperienza ChatGPT attorno a un GPT-5.6 Sol comune alle modalità rapida e ragionamento per gli abbonati a pagamento, con il 68% di errori fattuali in meno, mentre GPT-5.6 Luna passa a chat illimitate gratuite. Lo stesso giorno, Kimi K3 arriva in disponibilità generale in GitHub Copilot, Google DeepMind pubblica su Nature WeatherNext, il suo modello aperto che prevede i cicloni con cinque giorni di anticipo, e Alibaba apre la beta pubblica di Wan3.0 per la generazione video di 30 secondi. Meta completa la settimana con benchmark di Artificial Analysis che collocano Muse Spark 1.2 quasi alla frontiera e un bilancio di cinque risultati di livello oro in Olimpiadi scientifiche internazionali, mentre una quindicina di annunci coprono gli strumenti di codice agentico (Amp, Devin, Replit, Warp, Cursor), l’ecosistema open-weight (Hugging Face, Sakana, Together AI) e la generazione media (ElevenLabs, Suno).
ChatGPT passa a GPT-5.6 Sol unificato, GPT-5.6 Luna diventa gratuito illimitato
6 agosto — OpenAI unifica l’esperienza di conversazione in ChatGPT attorno a una versione aggiornata di GPT-5.6 Sol per gli abbonati a pagamento. Finora, gli utenti Plus e Pro passavano manualmente da un modello rapido (Instant) a un modello di ragionamento approfondito. D’ora in poi, GPT-5.6 Sol gestisce entrambe le modalità in un’unica esperienza, con un cursore dello sforzo di ragionamento (slider) regolabile al volo — una semplificazione diretta dell’interfaccia, in risposta al feedback degli utenti sulla confusione tra le due vecchie modalità.
Sul fronte dell’affidabilità, OpenAI presenta un dato concreto: nella sua valutazione di factuality ad alto impatto (finanza, medicina, diritto), la nuova versione di GPT-5.6 Sol produce il 68% in meno di risposte contenenti errori fattuali rispetto a GPT-5.5 Instant. Questo è l’argomento centrale di questo aggiornamento, presentato come un guadagno di affidabilità più che un salto di capacità grezze.
Sul fronte dell’offerta gratuita, anche gli utenti Free e Go ottengono un accesso ampliato a GPT-5.6 Luna: conversazioni testuali illimitate a partire dal 7 agosto e comparsa di un pulsante «Think» per attivare più ragionamento sulle domande difficili — una funzionalità finora riservata alle offerte a pagamento.
| Elemento monitorato | Dettaglio numerico |
|---|---|
| Errori fattuali finanza/medicina/diritto | -68% vs GPT-5.5 Instant |
| GPT-5.6 Sol + cursore (Plus/Pro) | disponibile dal 6 agosto |
| Chat illimitate GPT-5.6 Luna (Free/Go) | disponibile dal 7 agosto |
Un punto di perimetro da notare: questo aggiornamento riguarda solo l’esperienza Chat di ChatGPT — la versione di GPT-5.6 Sol che alimenta ChatGPT Work e Codex non è modificata da questo annuncio.
Kimi K3 disponibile in versione generale in GitHub Copilot
6 agosto — GitHub annuncia la disponibilità generale di Kimi K3, il modello open-weight di Moonshot AI, in Copilot. Il rollout è progressivo sulle offerte Pro, Pro+, Max, Business ed Enterprise, e il modello è accessibile da tutte le superfici Copilot: Visual Studio Code, Visual Studio, Copilot CLI, l’agente cloud, l’app GitHub Copilot, github.com, GitHub Mobile, oltre ai plugin JetBrains, XCode ed Eclipse.
📣 @Kimi_Moonshot’s Kimi K3, an open-weight model, is now generally available and rolling out in GitHub Copilot. The model shows frontier-level abilities on agentic coding with highly cost-effective pricing. It is hosted by @FireworksAI_HQ.
🇮🇹 📣 Kimi K3 di @Kimi_Moonshot, un modello a pesi aperti, è ora in disponibilità generale e viene distribuito in GitHub Copilot. Il modello mostra capacità di livello frontiera nel codice agentico, con una tariffazione molto competitiva. È ospitato da @FireworksAI_HQ. — @github su X
Il modello è ospitato tramite Fireworks AI, con una fatturazione a consumo allineata alle tariffe del fornitore — il changelog non dettaglia né prezzi precisi né finestra di contesto. Per le organizzazioni Business ed Enterprise, Kimi K3 è disattivato per impostazione predefinita: gli amministratori devono attivare esplicitamente la policy del modello prima che i team possano accedervi. Questo arrivo si inserisce nella strategia multi-modello di Copilot, che aveva già integrato Kimi K2.7 Code all’inizio di agosto.
WeatherNext: Google DeepMind prevede i cicloni con cinque giorni di anticipo, pesi aperti
6 agosto — Google DeepMind pubblica sulla rivista Nature i risultati di WeatherNext, il suo modello di IA dedicato alla previsione dei cicloni tropicali. Il modello raggiunge una precisione all’avanguardia nel prevedere la traiettoria e l’intensità di una tempesta, offrendo in media 24 ore di tempo aggiuntivo rispetto ai metodi precedenti per prepararsi.
Predicting cyclones accurately can help save lives - and every hour of lead time counts. Published in @Nature, our AI model WeatherNext achieves state-of-the-art accuracy in forecasting a storm’s track and intensity, giving us a critical extra 24 hours to prepare on average.
🇮🇹 Prevedere con precisione i cicloni può salvare vite — e ogni ora di anticipo conta. Pubblicato su @Nature, il nostro modello di IA WeatherNext raggiunge una precisione all’avanguardia nella previsione della traiettoria e dell’intensità di una tempesta, dandoci in media 24 ore di tempo aggiuntivo per prepararci. — @GoogleDeepMind su X
Durante l’uragano Melissa, WeatherNext ha fornito previsioni precoci del suo impatto come categoria 5, con cinque giorni di anticipo e un livello di confidenza dell’80%. Il modello, addestrato su diversi anni di dati atmosferici globali e quasi 5 000 cicloni storici, genera ogni scenario di previsione probabilistica su 15 giorni in meno di un minuto su un chip TPU. Google DeepMind fornisce ora 1 000 previsioni probabilistiche per tempesta, accessibili tramite lo strumento WeatherLab.
| Indicatore misurato | Valore misurato |
|---|---|
| Tempo aggiuntivo di preparazione | +24h in media |
| Allerta uragano Melissa (categoria 5) | 5 giorni di anticipo, confidenza 80% |
| Cicloni storici nell’addestramento | ~5 000 |
Punto notevole per l’ecosistema: il codice e i pesi del modello sono aperti su GitHub, liberamente disponibili sia per la ricerca accademica sia per la previsione operativa.
Wan3.0 (Alibaba) entra in beta pubblica con video nativi di 30 secondi
6 agosto — Alibaba lancia la beta pubblica di Wan3.0, la nuova generazione del suo modello di generazione video, con tre aspetti messi in evidenza: una generazione video nativa che può arrivare fino a 30 secondi in un unico passaggio, un rendering visivo definito «reality-grade» (personaggi più espressivi, migliore coerenza delle referenze da una scena all’altra), e una funzione di Omni-Reference che estende la comprensione del modello oltre il testo, l’immagine, l’audio e il video: Wan3.0 può ora leggere documenti strutturati (doc, xls, ppt, pdf, ecc.) e generare un video direttamente a partire dal loro contenuto.
La beta è disponibile da subito su Alibaba Cloud Model Studio e Qwen Cloud, con un arrivo imminente sull’app Wan riservata ai membri.
| Risoluzione video | Prezzo API (per secondo generato) |
|---|---|
| 480p | 0,05 $ |
| 720p | 0,10 $ |
| 1080p | 0,20 $ |
L’accesso API completo dovrebbe aprirsi progressivamente nelle prossime settimane. Questo lancio posiziona Wan3.0 di fronte ai recenti annunci della concorrenza sulla generazione video di lunga durata con controllo multimodale fine — FLUX 3 Video di Black Forest Labs, Seedance 2.5 di ByteDance, MiniMax H3 — un segmento in cui la capacità di generare clip da 20 a 30 secondi con un ricco controllo delle referenze diventa un argomento centrale di differenziazione.
Muse Spark 1.2 di Meta si avvicina alla frontiera, secondo Artificial Analysis
5-6 agosto — La società di analisi indipendente Artificial Analysis pubblica la sua valutazione completa di Muse Spark 1.2, il modello di Meta lanciato insieme all’agente Muse Code. Sull’AA Intelligence Index, ottiene un punteggio di 54 (variante xhigh), in aumento di 3 punti rispetto a Muse Spark 1.1 (51) e di 11 punti rispetto a Muse Spark 1.0 (43, uscito ad aprile) — la sua terza release in quattro mesi. Questo punteggio lo colloca di fatto a pari merito con GPT-5.5 (xhigh, 55) e Grok 4.5 (high, 54), appena dietro ai modelli di punta attuali: Claude Opus 5 (max, 61), Claude Fable 5 (max, 60), GPT-5.6 Sol (max, 59) e Kimi K3 (max, 57).
Il principale progresso riguarda il lavoro di conoscenza agentica, punto debole individuato al lancio di Muse Spark 1.1: il punteggio GDPval-AA v2 Elo sale da 1371 a 1631, collocando il modello al 5° posto tra tutti i modelli valutati, davanti a Claude Opus 4.8 (1588).
| Indicatore misurato | Muse Spark 1.1 | Muse Spark 1.2 |
|---|---|---|
| AA Intelligence Index (xhigh) | 51 | 54 |
| GDPval-AA v2 Elo | 1371 | 1631 |
| Terminal-Bench 2.1 | 78% | 80% |
| Costo per task (Intelligence Index) | 0,29 $ | 0,40 $ |
Sul fronte dei costi, Muse Spark 1.2 resta tra i modelli più efficienti del suo livello di intelligenza, a 0,40 $ per task con una tariffazione API invariata (1,25 $ / 4,25 $ per milione di token in input/output). Solo Grok 4.5 e GPT-5.6 Sol (medium) sono più economici nel suo gruppo. Sul Vals Index, Muse Spark 1.2 entra anche nella top 5 a soli 0,69 $ per test — tre volte meno costoso di Kimi K3, dieci volte meno costoso di Claude Fable 5, Opus 5 e GPT-5.6 Sol.
Meta rivendica risultati di livello oro in cinque Olimpiadi scientifiche internazionali
6 agosto — Meta Superintelligence Labs (MSL) annuncia di aver iscritto versioni interne della famiglia Muse Spark a cinque competizioni scientifiche internazionali di alto livello nel 2026, per misurare i progressi reali nel ragionamento invece che sui benchmark sintetici — un bilancio cumulativo dopo una prima medaglia in fisica già riportata a luglio.
To understand whether we’re making genuine progress on reasoning, we entered our AI models in five international STEM Olympiad competitions this year. The results: Asian Physics Olympiad (APhO): Perfect score on the theory exam — gold medal. International Physics Olympiad (IPhO): Perfect score — gold medal. International Mathematical Olympiad (IMO): Gold medal, top 4% of human participants. International Chemistry Olympiad (IChO): Gold-medal level. Romanian Masters of Mathematics (RMM): Gold-medal level.
🇮🇹 Per capire se stiamo davvero migliorando nel ragionamento, quest’anno abbiamo iscritto i nostri modelli di IA a cinque competizioni internazionali di scienze. Risultati: Olimpiade Asiatica di Fisica (APhO) — punteggio perfetto alla prova teorica, medaglia d’oro. Olimpiade Internazionale di Fisica (IPhO) — punteggio perfetto, medaglia d’oro. Olimpiade Internazionale di Matematica (IMO) — medaglia d’oro, top 4% dei partecipanti umani. Olimpiade Internazionale di Chimica (IChO) — livello medaglia d’oro. Romanian Masters of Mathematics (RMM) — livello medaglia d’oro. — @shuchaobi su X
| Competizione scientifica | Risultato ottenuto |
|---|---|
| APhO (fisica, Asia) | Punteggio perfetto alla prova teorica — oro |
| IPhO (fisica, internazionale) | Punteggio perfetto alla prova teorica — oro |
| IMO (matematica) | Oro, top 4% dei partecipanti umani |
| IChO (chimica) | Livello medaglia d’oro |
| RMM (matematica, Romania) | Livello medaglia d’oro |
Tre di queste competizioni (APhO, IPhO, IMO) erano prove in diretta, corrette dai giudici ufficiali secondo gli stessi criteri dei candidati umani. Meta precisa che i modelli utilizzati non avevano accesso ad alcuno strumento esterno — niente ricerca web, niente interprete di codice, niente calcolatrice — con un’orchestrazione multi-agente in ragionamento parallelo.
Strumenti di sviluppo IA: Portals, sandbox remoti, routing dei modelli
Cinque annunci restringono questa settimana il divario tra sviluppo locale e ambienti remoti o multi-modello.
Amp lancia i Portals — anteprima live delle app negli Orbs
6 agosto — Amp aggiunge i Portals, disponibili da subito in tutti gli orb (l’ambiente di sviluppo remoto di Amp), una funzionalità che espone direttamente nel browser i servizi HTTP in esecuzione all’interno di un orb. Finora, testare in diretta le modifiche fatte dall’agente richiedeva di configurare una VPN o di destreggiarsi con le porte. Tecnicamente, l’agente crea o rileva un file .amp/services.yaml ed esegue amp orb services ensure per avviare l’applicazione, esposta poi tramite una connessione HTTPS sicura. I Portals sono accessibili a chiunque abbia accesso al thread, il che permette a più membri di un team di vedere gli stessi cambiamenti in diretta, anche quando l’orb si risveglia dopo una sospensione.
Devin Outposts gira ora su Vercel Sandbox
5 agosto — Cognition estende Devin Outposts (lanciato a fine luglio per eseguire Devin nativamente su qualsiasi computer) con un’integrazione a Vercel Sandbox, disponibile da subito. L’agente può ora costruire e testare un’applicazione in una microVM isolata sull’infrastruttura di Vercel, con accesso a Docker, connessione a reti private via VPN e ripresa da uno snapshot del file system che conserva intatti repository, dipendenze e stato di build. Questa integrazione avvicina Devin Outposts alle offerte di ambienti cloud effimeri simili a quelle di Amp (Orbs) o di Warp, con il vantaggio di basarsi sull’infrastruttura Vercel già usata da molti team front-end.
Replit fa girare le scansioni di sicurezza durante la build, con Semgrep
5 agosto — Replit annuncia, in collaborazione con Semgrep, che le sue scansioni di sicurezza vengono ora eseguite durante la compilazione dell’applicazione invece che solo alla fine — un’evoluzione che risponde direttamente a una richiesta degli utenti. Queste scansioni sono attive per impostazione predefinita e si integrano nell’insieme di funzionalità Replit Auto-Protect, che mette in sicurezza automaticamente le applicazioni generate dall’agente. Replit indica che il suo Agent esegue già oltre 100 000 scansioni al giorno, un dato che illustra la scala a cui lo strumento viene usato per il vibe coding in produzione, con rilevamento e correzione delle vulnerabilità prima della messa online.
Warp introduce i router di modelli personalizzati
5 agosto — Poco più di una settimana dopo il lancio del Warp Agent CLI, Warp aggiunge router di modelli personalizzati, disponibili da subito per tutti gli utenti. Diventa possibile definire le proprie regole di routing in linguaggio naturale («invia le attività semplici a Minimax», «invia le correzioni di bug a Kimi K3»), e ogni richiesta viene poi automaticamente indirizzata verso il modello ritenuto più adatto. Questi router si aggiungono al routing automatico già integrato nel CLI e funzionano con modelli open weight, in BYOK (bring your own key), oppure tramite un abbonamento SuperGrok — una risposta diretta alla tendenza osservata in diversi strumenti concorrenti a orchestrare più modelli in base al compito invece di puntare su un unico modello frontiera.
Cursor dettagli Cursor Router — fino al 68% di risparmio senza perdita di qualità
6 agosto — Cursor pubblica un post tecnico che dettaglia il funzionamento di Cursor Router, il suo sistema di selezione automatica del modello lanciato il 22 luglio — quindi non un lancio, ma un articolo di approfondimento con dati inediti. Il router funziona in due fasi: « Compass » stima innanzitutto la complessità del compito prevedendo la probabilità di soddisfazione dell’utente, poi un classificatore per tassonomia (dominio, tipo di attività, modificatori come le modifiche visive) seleziona il modello frontier più performante su quella categoria precisa. Il router distribuisce le richieste tra Grok (attività routinarie), Sol/GPT-5.6 (pianificazione), Opus (esecuzione) e Fable (debugging) — Opus 5 è stato aggiunto dopo il lancio iniziale. Cursor fornisce cifre concrete: la modalità « Auto Intelligence » offrirebbe una soddisfazione utente superiore a Fable da solo per un costo inferiore del 68%, e la modalità « Auto Balance » supererebbe Opus 4.8 con un costo inferiore del 41%.
🔗 Cursor — come funziona Cursor Router
Ecosistema open-weight: inferenza, storage e ricerca autonoma
Tre annunci consolidano l’infrastruttura attorno ai modelli a peso aperto, sia lato hosting sia lato ricerca.
Baseten diventa fornitore di inferenza ufficiale su Hugging Face
6 agosto — Baseten, piattaforma di infrastruttura IA specializzata nell’inferenza serverless, entra a far parte degli Inference Providers di Hugging Face. L’integrazione consente di avviare inferenza ospitata da Baseten direttamente dalle pagine dei modelli dell’Hub, tramite l’interfaccia web o gli SDK Python e JavaScript. Il supporto iniziale copre tre principali modelli open-weight: DeepSeek V4 Flash, Kimi K3 e GLM-5.2, con altri tipi di attività previsti in seguito. Gli abbonati PRO ricevono 2 $ di crediti di inferenza mensili validi su tutti i fornitori, mentre gli account gratuiti dispongono di quote più limitate. L’integrazione espone un formato API compatibile con OpenAI tramite il router di Hugging Face, semplificando il cambio di fornitore senza riscrivere il codice di chiamata.
Ai2 estende la sua partnership con Hugging Face — storage portato a ~2 petabyte
5 agosto — Ai2 (Allen Institute for AI) amplia la propria partnership con Hugging Face per accelerare la diffusione dei suoi lavori in scienza aperta. Lo storage allocato sull’Hub viene quasi triplicato, passando a circa 2 petabyte, e il traffico non è più soggetto ai limiti di banda standard — un vantaggio significativo per il download dei dataset più grandi e dei modelli multi-checkpoint. Ai2 precisa che le sue risorse sono state scaricate più di 50 milioni di volte dalla primavera 2024, e che gli artefatti legati al suo modello MolmoAct 2 hanno superato 400.000 download in tre settimane. La partnership copre l’intero portafoglio Ai2: i modelli Olmo e Molmo, il modello di osservazione terrestre OlmoEarth, oltre a diversi dataset di valutazione. Secondo Ai2, l’organizzazione pubblica ogni anno più nuovi artefatti sull’Hub di qualsiasi altra struttura seguita da Hugging Face, con oltre 900 modelli e 1.200 dataset al suo attivo.
🔗 Ai2 — partnership Hugging Face
Sakana Marlin — agente di ricerca autonomo e lancio di Marlin Insights
6 agosto — Sakana AI mette in evidenza Sakana Marlin, descritto come un « Virtual CSO » (direttore scientifico virtuale) capace di ragionare e condurre ricerche in autonomia per diverse ore. L’azienda indica che questa capacità si basa su due pilastri di ricerca pubblicati dai suoi team: AB-MCTS, accettato come spotlight a NeurIPS 2025, e AI Scientist, pubblicato su Nature. Sakana AI ha anche lanciato Marlin Insights, una serie di progetti di ricerca prodotti da Marlin; il primo numero analizza l’esito della crisi dello stretto di Hormuz e i motivi per cui gli Stati Uniti, nonostante la loro superiorità militare, faticano a trovare una via d’uscita. Questo lancio illustra la strategia di Sakana AI di trasformare la propria ricerca fondamentale in prodotti di analisi autonoma orientati alle imprese, in continuità con i suoi recenti deployment commerciali (Daiwa Securities, Namazu).
GitHub Copilot e l’ecosistema: dati aperti, design riutilizzabile, comandi slash
Aggiornamento Q1 2026 del GitHub Innovation Graph
5 agosto — GitHub pubblica l’aggiornamento trimestrale (Q1 2026) del suo Innovation Graph, progetto di dati aperti che segue l’attività di sviluppo globale. Il filo di tweet mette in evidenza un’accelerazione dell’attività di push Git in diversi paesi al di fuori dei mercati tradizionali, oltre a un aumento del 16% trimestre su trimestre della collaborazione open source transfrontaliera nel Q1 2026, con progressi notevoli per l’Unione europea, l’India e Singapore dal 2020.
| Paese monitorato | Git pushes (Q1 2020 → Q1 2026) |
|---|---|
| India | 4,4M → 45M |
| Vietnam | 630K → 5,1M |
| Pakistan | 240K → 3,5M |
L’insieme dei dataset resta aperto e scaricabile, consentendo di esplorare più nel dettaglio queste dinamiche per paese e per periodo.
🔗 Fil @github — Innovation Graph
Genspark Design — sistema di design riutilizzabile tra progetti
6 agosto — Genspark lancia Genspark Design, una funzionalità disponibile da subito che trasforma automaticamente un progetto già costruito (colori, tipografia, componenti) in un sistema di design riutilizzabile per i progetti successivi. L’obiettivo è evitare di ricominciare la linea grafica da capo a ogni nuovo progetto: una landing page generata in seguito eredita lo stesso stile di un’app esistente, senza interventi manuali. Questo annuncio si aggiunge ai recenti sforzi di Genspark intorno alla generazione di interfacce e alle suite da ufficio (GenOffice), e si rivolge agli utenti che realizzano in serie più progetti generati dall’IA cercando una coerenza visiva senza configurazioni ripetute.
Guida ai comandi slash nell’app GitHub Copilot
6 agosto — GitHub pubblica una guida che dettaglia i sei comandi slash disponibili nell’app GitHub Copilot desktop, accessibili digitando « / » nell’area chat. Coprono l’intero ciclo di lavoro: pianificazione, messa alla prova di un approccio, implementazione automatizzata, revisione incrociata da parte di un altro modello, creazione di interfacce interattive e orchestrazione multi-repository — distinguendosi dai comandi slash del CLI, che puntano al terminale anziché all’app desktop.
| Comando slash | Funzione svolta |
|---|---|
/plan | Suddivide il compito prima di codificare |
/spar | Avvocato del diavolo per mettere alla prova un approccio |
/autopilot | Trasforma un piano in codice |
/rubber-duck | Revisione indipendente da parte di un altro modello |
/orchestrate | Coordina il lavoro tra più repository |
🔗 GitHub — guida ai comandi slash
Generazione media: doppiaggio e trasparenza audio
ElevenLabs lancia Dubbing v2 su ElevenAPI
6 agosto — ElevenLabs rende generalmente disponibile su ElevenAPI la versione 2 del suo motore di doppiaggio (Dubbing v2), che esisteva già come prodotto, per consentire agli sviluppatori di integrare il doppiaggio IA direttamente nelle proprie applicazioni. Tecnicamente, Dubbing v2 si basa direttamente sulle prestazioni audio originali invece che su una trascrizione piatta, preservando così il tono, l’emozione e la dizione della voce sorgente. Il modello adatta la cadenza per una dizione naturale in più di 90 lingue, con una traduzione « sync-aware » che allinea automaticamente inizio e fine delle battute senza regolazioni manuali. Per i casi d’uso aziendali, una modalità di editing granulare consente di importare la propria trascrizione e rigenerare solo i segmenti modificati invece dell’intero doppiaggio — l’intera pipeline (traduzione, clonazione vocale, doppiaggio, sincronizzazione) è esposta tramite una sola API.
Suno distribuisce strumenti di trasparenza e aggiorna le sue regole della community
6 agosto — Suno pubblica un post firmato dal suo CEO Mikey Shulman, esponendo i principi che l’azienda dice di voler seguire per costruire « responsabilmente » il futuro della musica generata dall’IA. In concreto, l’annuncio introduce il rilascio di tecnologie di watermarking e fingerprinting audio per identificare i brani generati sulla piattaforma, presentate come resistenti alla falsificazione senza degradare l’ascolto, oltre a future restrizioni sul download mirate a limitare la distribuzione massiccia verso le piattaforme di streaming pur preservando gli usi professionali e creativi. L’annuncio è accompagnato da un aggiornamento delle Community Guidelines che ora vieta esplicitamente la ricreazione di brani esistenti, l’uso della voce o dell’immagine di una persona senza consenso e le pratiche di spam o di aggiramento automatizzato della moderazione, con sanzioni che vanno dall’avvertimento al ban definitivo.
Agenti e plugin: standard aperti e modelli subagent
Agent Plugins — standard aperto per i plugin degli agenti
6 agosto — OpenAI annuncia Agent Plugins, un nuovo standard aperto progettato con AWS, Cursor, GitHub, VS Code e Vercel per impacchettare Agent Skills e configurazioni di server MCP in un formato comune. L’obiettivo è consentire agli sviluppatori di costruire un plugin una sola volta e riutilizzarlo in più client di agenti compatibili, invece di duplicare l’integrazione per ogni strumento. Al lancio, i client compatibili elencati sono Codex, ChatGPT, Cursor, GitHub Copilot, Kiro e VS Code — un perimetro ampio che copre sia l’ecosistema OpenAI sia diversi concorrenti diretti nel campo degli agenti di codice. I tweet non dettagliano il meccanismo tecnico preciso (formato del manifesto, processo di pubblicazione) né una data di disponibilità generale oltre al lancio annunciato.
Perplexity Computer distribuisce GPT-5.6 Terra e Luna come modelli subagent
6 agosto — Perplexity distribuisce due nuovi modelli GPT-5.6 all’interno di Computer, la sua piattaforma di subagent e automazioni: Terra e Luna. Terra diventa il modello predefinito per tutti i subagent di Computer e funge anche da modello orchestratore; Luna è posizionato come il modello principale delle automazioni pianificate. Secondo Perplexity, Terra è progettato per il lavoro complesso orientato all’obiettivo, un profilo adatto al ruolo di subagent che deve scomporre un compito ed eseguirlo in autonomia. Sul benchmark WANDR, Terra otterrebbe un punteggio superiore di 11 punti rispetto a quello di Claude Sonnet, offrendo al contempo una riduzione dei costi di un ordine di grandezza. Questa introduzione di modelli specializzati per ruolo illustra un’architettura di agenti sempre più differenziata in Perplexity.
Brevi
- Together AI sostiene che Kimi K3 sia quasi due volte migliore di Claude Fable 5 sul benchmark legale Harvey LAB-AA — Senza dettagli metodologici pubblicati, da considerare come una rivendicazione marketing di un fornitore di inferenza. 🔗 fonte
- Hugging Face mette in evidenza Cadena, un decompilatore di mesh 3D in CAD modificabile — Demo Spaces che converte un file 3D statico in un programma CAD modificabile passo dopo passo, ad esempio per allargare un foro senza ricostruire il modello. 🔗 fonte
- Il CEO di Hugging Face difende una regolazione IA per strati — Clément Delangue sostiene il nuovo quadro normativo statunitense che distingue tra pesi dei modelli, API e applicazioni, ritenendolo protettivo per l’open source. 🔗 fonte
- Together AI dettaglia la sua architettura multi-datacenter con disponibilità del 99,9% — Traffico distribuito in diretta su due siti simultaneamente, con capacità di assorbire la perdita completa di un datacenter senza interruzione del servizio. 🔗 fonte
- Gemini Omni: la generazione gratuita di 10 video prorogata fino all’11 agosto — L’offerta, che avrebbe dovuto terminare il 4 agosto, resta accessibile fino all’11 agosto 2026, 23:59 (ora del Pacifico). 🔗 fonte
- GenOffice disponibile su Linux — La suite da ufficio IA open source di Genspark, già su macOS e Windows, è ora compilabile e disponibile su Linux. 🔗 fonte
- Flux 3 disponibile nell’agente video IA di Genspark — Integrazione di Flux 3 (Black Forest Labs) con audio nativo e dialogo multilingue, per clip fino a 20 secondi in 1080p. 🔗 fonte
- Qwen3.8-Max sale nelle classifiche pubbliche — Alibaba rivendica il 5º posto dell’Artificial Analysis Intelligence Index e il 1º posto dell’Agentic Index, dopo un 2º posto sull’Image-to-WebDev Arena il giorno prima. 🔗 fonte
- Qwen-Image-3.0-Pro distribuito su Qwen Cloud e fal.ai — Il modello di generazione di immagini di Alibaba, già classificato 5º al mondo, diventa accessibile direttamente su Qwen Cloud e sulla piattaforma di terze parti fal.ai. 🔗 fonte
- OpenAI e l’American Psychological Association collaborano su IA e salute mentale dei giovani — Partnership per sviluppare raccomandazioni e salvaguardie basate su prove attorno al benessere dei giovani utenti. 🔗 fonte
- OpenAI pubblica i dati Signals sull’uso mondiale di ChatGPT — Nuovi indicatori per paese sull’adozione e sulle tendenze d’uso, senza dettagli numerici accessibili a questa data. 🔗 fonte
- Cohere collabora con l’Università di Waterloo per un certificato in trasformazione IA — Il nuovo certificato « AI Transformation & Change Management » deve preparare gli studenti all’adozione responsabile dell’IA in azienda. 🔗 fonte
Cosa significa
La settimana illustra una svolta chiara: l’intelligenza d’avanguardia diventa l’opzione predefinita invece di un costoso extra opzionale. OpenAI unifica ChatGPT attorno a un GPT-5.6 Sol che gestisce sia la velocità sia il ragionamento profondo, rendendo al tempo stesso Luna illimitato e gratuito per gli account Free e Go. GitHub segue una logica simile sul fronte degli sviluppatori generalizzando Kimi K3, un modello open-weight, in Copilot per l’insieme delle sue offerte a pagamento. In entrambi i casi, la novità non è un salto nelle capacità grezze ma un cambiamento di distribuzione: modelli prima riservati ai livelli premium o alle integrazioni su misura diventano la configurazione standard, spostando la concorrenza verso l’affidabilità percepita e il costo di accesso piuttosto che verso il punteggio grezzo su un benchmark.
La misurazione della capacità IA diventa essa stessa un terreno di competizione strutturato. Muse Spark 1.2 di Meta si avvicina quasi al limite secondo Artificial Analysis, con un costo per attività che resta tra i più bassi della sua categoria, mentre Meta Superintelligence Labs rivendica risultati di livello oro in cinque Olimpiadi scientifiche internazionali senza uso di strumenti — una dimostrazione pubblica pensata per convincere oltre le leaderboard abituali. In parallelo, l’infrastruttura che ospita questi modelli aperti si professionalizza: Baseten diventa fornitore ufficiale di inferenza su Hugging Face per DeepSeek V4 Flash, Kimi K3 e GLM-5.2, Ai2 quasi triplica il proprio storage sull’Hub, e Sakana AI trasforma la sua ricerca fondamentale in un prodotto di ricerca autonoma con Marlin. Il filo conduttore: il valore si sposta dal modello isolato verso l’ecosistema che lo distribuisce, lo ospita e lo verifica.
Gli strumenti di coding agentico convergono verso la stessa idea: nessun singolo modello domina più tutte le attività, quindi occorre instradare in modo intelligente. Cursor descrive come il suo router combini stima della complessità e classificazione per tassonomia per ridurre i costi fino al 68% senza perdita di soddisfazione percepita, Warp introduce regole di routing in linguaggio naturale, e Amp come Devin estendono i loro ambienti remoti (Portals, integrazione Vercel Sandbox) per avvicinare lo sviluppo cloud al comfort del locale. Replit, da parte sua, sposta le scansioni di sicurezza Semgrep a monte del build anziché a valle, a oltre 100 000 scansioni al giorno a questa scala. Insieme, questi annunci delineano una generazione di strumenti in cui l’intelligenza non è più l’unica leva: l’orchestrazione, la sicurezza predefinita e l’integrazione infrastrutturale contano altrettanto.
Al di là dei modelli linguistici, la settimana mostra l’IA inserirsi sia in usi a impatto diretto sia nella produzione creativa su larga scala. WeatherNext di Google DeepMind, pubblicato in Nature e disponibile in pesi aperti, offre in media 24 ore di anticipo aggiuntive per prevedere un ciclone — un’applicazione in cui l’interesse generale prevale chiaramente sulla competizione commerciale. Al contrario, Wan3.0 di Alibaba, ElevenLabs e Suno illustrano la rapida maturazione della generazione media: video nativo di 30 secondi con controllo multimodale, doppiaggio condizionato sulla performance vocale originale ora in disponibilità generale via API, e strumenti di watermarking distribuiti in risposta alle preoccupazioni sull’autenticità dei contenuti generati. Queste due direzioni, scienza aperta e creazione commerciale, avanzano allo stesso ritmo ma con implicazioni di responsabilità molto diverse.
Fonti
- OpenAI — Migliorare GPT-5.6 Sol in ChatGPT
- @github su X — Kimi K3 in GA in Copilot
- GitHub — Changelog Kimi K3
- @GoogleDeepMind su X — WeatherNext
- @Alibaba_Wan su X — Wan3.0
- @ArtificialAnlys su X — Muse Spark 1.2
- @shuchaobi su X — cinque Olimpiadi scientifiche
- @AIatMeta su X — staffetta Olimpiadi
- Amp — Portals
- @cognition su X — Devin Outposts su Vercel Sandbox
- @Replit su X — scansioni di sicurezza durante il build
- @warpdotdev su X — router di modelli personalizzati
- Cursor — come funziona Cursor Router
- Hugging Face — Baseten
- Ai2 — partnership Hugging Face
- @SakanaAILabs su X — Sakana Marlin
- @github su X — Innovation Graph Q1 2026
- @genspark_ai su X — Genspark Design
- GitHub — guida ai comandi slash
- @ElevenLabs su X — Dubbing v2 su ElevenAPI
- @suno su X — trasparenza e regole comunitarie
- @OpenAIDevs su X — Agent Plugins
- @perplexity_ai su X — GPT-5.6 Terra e Luna in Computer
- @togethercompute su X — Kimi K3 vs Claude Fable 5 (Harvey LAB-AA)
- @HuggingApps su X — Cadena
- @ClementDelangue su X — regolazione IA per livello
- @togethercompute su X — architettura multi-datacenter
- @GeminiApp su X — Gemini Omni prolungato
- @genspark_ai su X — GenOffice su Linux
- @genspark_ai su X — Flux 3 nell’agente video
- @Alibaba_Qwen su X — classifiche Qwen3.8-Max
- @Alibaba_Qwen su X — Qwen-Image-3.0-Pro
- OpenAI — partnership APA
- OpenAI — dati Signals
- @cohere su X — partnership Waterloo