ai-powered-markdown-translatorArticolo tradotto dal fr al it con gpt-5.4-mini.
Il 20 agosto 2026, il CTO di GitHub pubblica un bilancio dettagliato della panne del 17 agosto (7h47, secondo incidente grave del mese) e accelera la migrazione verso Azure. Meta AI presenta WildArtifactBench, un nuovo quadro di valutazione per agenti multimodali, insieme a dimostrazioni ampliate di Muse Spark 1.2. Pika Labs dettaglia la sua gamma completa di modelli audio (Music, SFX, Soundtrack) con benchmark numerici rispetto a Suno, ElevenLabs e Stable Audio. Attorno a questi tre annunci, Anthropic potenzia Claude Academy e gli agenti gestiti, Mistral lancia un nuovo livello di ricerca documentale e una quindicina di altre novità coprono sviluppo, modelli aperti e generazione media.
GitHub dettaglia la panne di 7h47 del 17 agosto e accelera il suo piano di affidabilità
20 agosto — Vladimir Fedorov, CTO di GitHub, pubblica un bilancio della panne del 17 agosto 2026, durata 7 ore e 47 minuti e responsabile di disservizi su github.com, autenticazione, GitHub Actions, API, pull request, issue e Copilot. È il secondo incidente significativo del mese, dopo una panne di Actions il 6 agosto. Né l’uno né l’altro è stato causato da una modifica di codice o di configurazione: si è trattato di guasti di capacità.
L’incidente è iniziato quando un picco di traffico senza precedenti ha superato la capacità di un componente infrastrutturale critico nel data center Central US di GitHub. La pressione si è propagata attraverso i sistemi, provocando fallimenti di autenticazione. La maggior parte dei servizi si è ripresa nel corso della giornata, ma alcuni servizi Copilot hanno impiegato più tempo: lì gli errori hanno innescato un ciclo di nuovi tentativi lato client che ha amplificato il traffico durante il recupero.
Fedorov collega l’incidente alla crescita della piattaforma: da aprile, i commit mensili sono passati da 1,4 a 2,9 miliardi. Da marzo e aprile, GitHub ha aggiunto oltre 3 milioni di core CPU e 120 petabyte di storage, accelerando al tempo stesso la migrazione verso Azure: oggi questo serve il 58% del carico, contro il 12% di maggio. Come correzione immediata, GitHub introduce limiti di tentativi coerenti tra i servizi.
On August 17, GitHub experienced a significant outage that disrupted developers and organizations around the world. If you were trying to ship software that day, we let you down.
🇮🇹 Il 17 agosto, GitHub ha subito una grave panne che ha colpito sviluppatori e organizzazioni in tutto il mondo. Se quel giorno stavate cercando di consegnare software, vi abbiamo delusi. — @Vlad_GitHub su X
🔗 La panne del 17 agosto e il lavoro che ci aspetta (github.blog)
Meta AI svela WildArtifactBench ed estende le dimostrazioni di Muse Spark 1.2
20 agosto — In un filo di dieci post, Meta AI presenta in parallelo una dimostrazione estesa delle capacità multimodali di Muse Spark 1.2 e il lancio di WildArtifactBench, un nuovo quadro di valutazione interno per agenti multimodali. Il modello viene mostrato mentre analizza osservazioni multimodali e chiama strumenti per guidare un robot bimanuale incaricato di ritrovare un’anatra di plastica, poi di riordinare una scrivania — con un esempio di distinzione tra una spazzola per capelli e un pennello da trucco per sistemare correttamente un rossetto.
Vengono messe in evidenza due capacità concrete: la generazione di artefatti digitali (pagine web, giochi) a partire da immagini, valutata sul rendering reale anziché su un confronto di codice; e l’uso interno di Muse Spark per la generazione di media, in tandem con Muse Image e Muse Video.
Il filo culmina con WildArtifactBench: invece di griglie di correzione rigide basate su una verità terreno, il quadro utilizza tassi di vittoria (win rate) e punteggi Elo derivati da giudici di preferenza umani e agentici, per coprire flussi di lavoro multimodali pratici. Meta pubblica da oggi 10 task del benchmark insieme a un documento di principi di progettazione.
Today we’re also previewing WildArtifactBench, an internal evaluation framework designed to assess agents on complex, real-world tasks across diverse deliverable formats. By using win rates and Elo scores from human and agentic preference judges rather than strict ground-truth rubrics, it expands task coverage across practical multimodal workflows.
🇮🇹 Presentiamo oggi anche WildArtifactBench, un quadro di valutazione interno progettato per valutare gli agenti su compiti reali complessi, attraverso formati di deliverable diversi. Usando tassi di vittoria e punteggi Elo derivati da giudici di preferenza umani e agentici invece di griglie di correzione rigide basate su una verità terreno, amplia la copertura dei compiti ai flussi di lavoro multimodali pratici. — @AIatMeta su X
Pika dettaglia la sua gamma Pika Audio Models rispetto a Suno, ElevenLabs e Stable Audio
18-20 agosto — Dopo aver annunciato la sua gamma «Pika Audio Models» il 14 agosto, Pika Labs dettaglia questa settimana tre prodotti, ciascuno con numeri.
Pika Music (20 agosto) accetta quattro modalità di input — testo, parole, riferimento vocale, riferimento musicale — combinabili in un unico decoder di diffusione latente. Ottiene un punteggio vicino al leader di mercato su Audiobox Aesthetics e genera una canzone di 90 secondi in media in 6,25 secondi, cioè circa 14,5 volte più veloce della durata di ascolto. Pika SFX (19 agosto) genera effetti sonori in meno di un secondo, fino al 95% più economico della concorrenza. Pika Soundtrack (18 agosto) sincronizza musica, voice-over ed effetti sonori sull’immagine a partire da un video compresso in token latenti, e si colloca al primo posto nell’allineamento audiovisivo su un panel di 67 sequenze.
| Modello audio | Metrica chiave | Pika | Concorrente |
|---|---|---|---|
| Pika Music | Audiobox Aesthetics (produzione) | 8,064 | Suno : 8,151 |
| Pika Music | Velocità (canzone di 90s) | 6,25 s | ~14,5x la durata di ascolto |
| Pika SFX | Latenza media (50 prompt) | 0,847 s | ElevenLabs v2 : 2,47 s |
| Pika SFX | Latenza media (50 prompt) | 0,847 s | Stable Audio 3 SFX : 2,64 s |
| Pika Soundtrack | Allineamento semantico (ImageBind) | 0,2457 | Migliore del panel di 67 sequenze |
I tre modelli sono accessibili tramite il Pika API Club.
On our fixed-lyrics benchmark, Pika Music reached the top tier of Audiobox Aesthetics: Content Enjoyment: 7.403, Production Quality: 8.064. For context, Suno scored 7.412 and 8.151 on those respective measures.
🇮🇹 Nel nostro benchmark con testo fisso, Pika Music raggiunge il livello più alto di Audiobox Aesthetics: piacere dei contenuti: 7,403, qualità di produzione: 8,064. A titolo di confronto, Suno ha ottenuto 7,412 e 8,151 su queste stesse metriche. — @pika_labs su X
🔗 Pika Music (20 agosto) · Pika Soundtrack (18 agosto) · Pika SFX (19 agosto)
Anthropic potenzia Claude Academy, gli agenti gestiti e Claude Code
Claude Academy è disponibile
20 agosto — Anthropic lancia Claude Academy, una piattaforma di corsi e tutorial gratuiti e aperti a tutti, qualunque sia il livello: dalle persone che scoprono l’IA a quelle che usano già Claude ogni giorno. L’iniziativa si propone come un percorso progressivo più che come una semplice documentazione di prodotto, con un accesso identico per principianti e utenti avanzati. Un post associato dettaglia la filosofia pedagogica di Anthropic sull’apprendimento dell’IA e il ruolo di Claude Academy in questo approccio, in un contesto in cui l’azienda moltiplica le iniziative di formazione attorno a Claude, accanto ai suoi lanci di prodotto.
Tre aggiornamenti per Claude Managed Agents
19 agosto — Anthropic annuncia tre evoluzioni di Claude Managed Agents (Claude Developer Platform): la memoria è ora utilizzabile con le Self-Hosted Sandboxes, così il lavoro svolto in una sandbox auto-ospitata può essere salvato per le sessioni successive; gli strumenti web_search e web_fetch accettano ora parametri allowed_domains o blocked_domains, per restringere con precisione i siti che un agente può consultare; e il viewer di sessione Console è stato ripensato per le sessioni multi-agente, con una minimappa a una riga per agente, una trascrizione in streaming raggruppata per iterazione e un inspector che mostra il costo in dollari per thread e per sessione.
Claude Code — nuovo stile di output Concise
20 agosto — Claude Code propone un nuovo stile di output «Concise»: una volta attivato, Claude privilegia il risultato in cima alla risposta e mantiene le risposte brevi per impostazione predefinita, fornendo però il dettaglio completo se l’utente lo richiede esplicitamente. L’attivazione avviene tramite /config → Output style, oppure direttamente in configurazione con "outputStyle": "Concise" in settings.json. È un’impostazione direttamente utile nella vita quotidiana per gli utenti che cercano risposte più rapide da leggere nel terminale, senza perdere la possibilità di approfondire un punto specifico su richiesta esplicita.
Devin di Cognition aggiunge canali Slack dedicati al codice
20 agosto — Cognition lancia «Slack Code in Devin» nell’ambito di una partnership di lancio ufficiale con Slack: l’agente crea ora proattivamente canali Slack dedicati a ogni task di codice, per mantenere il lavoro concentrato invece di mescolare gli scambi nei canali di team esistenti. Cognition indica di aver ripensato in modo specifico la «personalità» di Devin per il suo comportamento in Slack, una regolazione del tono adatta al contesto di chat di team piuttosto che al terminale o all’IDE. L’annuncio ancora Devin negli strumenti di collaborazione dove i team di prodotto e non tecnici si scambiano già messaggi, in aggiunta alle sue integrazioni esistenti (GitHub, Linear).
Modelli aperti: Liquid AI, Sakana AI e un vasto dataset per la robotica
LFM2.5-DSpark di Liquid AI, fino a 3,2x di accelerazione dell’inferenza
20 agosto — Liquid AI pubblica LFM2.5-DSpark, modelli «draft» da ~300M parametri che accelerano tramite decodifica speculativa l’inferenza dei tre modelli della famiglia LFM2.5, senza perdita di qualità — la sequenza di output resta identica alla decodifica greedy di riferimento per costruzione. Su GPU H100, l’accelerazione media misurata è di 2,67x per LFM2.5-2.6B (323 → 864 tok/s), 2,10x per LFM2.5-1.2B e 2,54x per LFM2.5-8B-A1B. Per gli scenari multi-tool, la latenza delle function call diminuisce in media del 57%. I checkpoint sono disponibili in safetensors e GGUF, con supporto day-one per llama.cpp e integrazione diretta in SGLang.
🔗 LFM2.5-DSpark su Hugging Face
Sakana Translate passa alla nuova generazione di Sakana Namazu
20 agosto — Il servizio gratuito di traduzione giapponese-inglese-cinese di Sakana AI passa alla nuova generazione di Namazu, combinando un modello di base rinnovato e metodi di addestramento migliorati. Su 160 task di traduzione giapponese-inglese valutati con lo strumento interno TransEvalnia, Sakana Translate viene giudicato migliore in oltre il 50% dei casi rispetto a ciascuno dei sistemi concorrenti confrontati. Le tre funzionalità esistenti (traduzione in streaming fino a circa 5.000 caratteri, correzione con diff di stile, domande e risposte sulla traduzione) restano gratuite e girano ora sul nuovo modello.
HiPHI, un vasto dataset aperto di movimento umano per la robotica
19 agosto — Noitom Robotics pubblica gratuitamente per la ricerca HiPHI, 617,5 ore di motion capture umano ad alta precisione con interazione con oggetti — uno dei più grandi dataset di questo tipo mai pubblicati secondo l’azienda. Politiche addestrate su questo dataset funzionano già su un robot Unitree G1 reale, sotto l’etichetta #PhysicalAI. Questo tipo di risorsa aperta si inserisce nella dinamica più ampia di costruzione di dataset per l’IA fisica e la robotica, un asse seguito da vicino dall’ecosistema Hugging Face che ha rilanciato l’annuncio.
Generazione media: HeyGen, Black Forest Labs, Ideogram e NVIDIA
HeyGen lancia il ritocco dell’avatar (Retouch)
20 agosto — HeyGen integra uno strumento di ritocco dell’avatar direttamente nel suo editor video: correzione delle imperfezioni (brufoli, rughe), regolazione del trucco e dell’illuminazione, con un controllo del livello di ritocco per restare fedeli all’avatar originale. L’obiettivo dichiarato è evitare i reshoot dovuti unicamente a questioni di aspetto — ritoccare una volta e poi riutilizzare il rendering in tutti i video successivi. HeyGen insiste sul fatto che l’avatar resti riconoscibile dopo il ritocco: non si tratta di generare un volto diverso, ma di rifinire quello esistente.
Black Forest Labs lancia FLUX Video Upscale (2K/4K)
20 agosto — Black Forest Labs aggiunge un modulo di upscaling nativo a FLUX 3 Video, per produrre o convertire video in 2K/4K con volti più nitidi, texture più pulite e maggiore dettaglio sullo sfondo, mantenendo la diversità stilistica e il realismo propri di FLUX 3 Video. La funzionalità si applica anche a video esterni, non solo a quelli generati da FLUX, e sarebbe più veloce delle soluzioni di upscaling di terze parti. Accessibile tramite API e una demo dedicata.
Ideogram pubblica un modello aperto quantizzato e un rimuovi-sfondo su Runware
20 agosto — Runware ospita due nuovi modelli Ideogram: Ideogram 4.0q, una versione quantizzata in pesi aperti di Ideogram 4.0 (9,3 miliardi di parametri) con controllo del layout tramite bounding box, prompting JSON strutturato e supporto LoRA; e Ideogram Background Remover, che fornisce da qualsiasi immagine un ritaglio PNG trasparente con buona fedeltà dei contorni, in particolare su tipografia e loghi.
NVIDIA rivendica il solver open source più veloce con cuOpt
19 agosto — NVIDIA afferma che cuOpt, il suo solver di ottimizzazione open source, è il più veloce nei benchmark Hans Mittelmann, riferimento riconosciuto del settore, su tre classi di problemi di ottimizzazione combinatoria e lineare. L’azienda invita la community a testare il progetto direttamente su GitHub, in continuità con la sua strategia di apertura degli strumenti software attorno al proprio hardware — cuOpt mira in particolare ai casi d’uso di logistica e pianificazione su larga scala, dove la velocità di risoluzione diventa un fattore diretto di costo operativo.
Mistral, Kimi e GLM-5.3 : ricerca documentale e competitività costo/prestazioni
Mistral lancia Agentic Search, un livello di recupero documentale iterativo
20 agosto — Mistral annuncia Agentic Search, un livello di ricerca documentale progettato per superare i limiti del RAG classico, che si basa su un recupero in un unico passaggio senza possibilità di iterare. Il sistema fornisce al modello cinque strumenti ispirati alle operazioni sui file (search, open, navigate, read, grep), funziona con gli indici esistenti, non richiede fine-tuning ed è agnostico rispetto al modello — testato con Mistral Medium 3.5 e con GLM-5.2 di Z.ai. Su FinanceBench (368 depositi SEC), l’accuratezza di Mistral Medium 3.5 passa dal 26,7 % all’86 %, la latenza p90 scende da 255 s a 154 s. Su OfficeQA Pro, GLM-5.2 guadagna 45,6 punti di accuratezza. Disponibile tramite il Mistral Search Toolkit, integrato in Studio e Vibe.
🔗 Agentic Search su mistral.ai
Kimi K3 in testa alla frontiera di Pareto costo/prestazioni di Agent Arena
19 agosto — Agent Arena (LMArena) pubblica una frontiera di Pareto costo/prestazioni per le sue valutazioni di agenti su compiti reali a lungo orizzonte. Kimi K3 (Max) di Moonshot si classifica 4º con un guadagno di prestazioni di +10,53 %, per un costo mediano di 0,62 USD per compito — il più basso tra gli otto modelli di punta, molto davanti a Claude Opus 5 (Max) a 3,37 USD per compito per un punteggio appena superiore (+12,0 %). Grok 4.5 raggiunge +6,1 % a 0,22 USD per compito, e Qwen-3.8 Max +6,3 % a 0,33 USD per compito.
GLM-5.3 di Z.ai integrato nativamente in AutoClaw
20 agosto — AutoClaw, l’agente di lavoro di Z.ai, integra nativamente GLM-5.3, lanciato il 18 agosto. Gli utenti del GLM Coding Plan che collegano il loro abbonamento beneficiano di un boost temporaneo della quota di 1,5x e di crediti AutoClaw mensili (Lite 5K / Pro 10K / Max 26K); i nuovi utenti ricevono 26K crediti AutoClaw (valore 20 USD), validi per 30 giorni. GLM-5.3 ottiene inoltre un punteggio di 69 nella classifica ufficiale DeepSWE, riportato lo stesso giorno da uno sviluppatore esterno.
OpenAI estende ChatGPT desktop in Europa, ChatGPT Sites e il Codex SDK
ChatGPT desktop (Mac) estende Computer History, la memoria multi-app e Record & Replay in Europa
20 agosto — OpenAI estende in Europa (EEA, Regno Unito, Svizzera) tre funzionalità dell’app ChatGPT desktop per Mac, finora limitate agli Stati Uniti: Computer History (già lanciata il 13 agosto) per gli utenti Pro, Business ed Enterprise; una memoria multi-app che permette a ChatGPT di ricordare l’attività dell’utente tra le sue applicazioni e i suoi siti web; e Record & Replay, che trasforma un flusso di lavoro abituale in una competenza riutilizzabile mostrandolo invece di descriverlo, per ChatGPT Work e Codex.
ChatGPT Sites: personalizzazione dell’URL e collaborazione di team con Codex
20 agosto — ChatGPT Sites, lo strumento di creazione di siti web integrato in ChatGPT, permette ora di personalizzare l’URL del sito pubblicato, così che rifletta il progetto e sia più facile da riconoscere e condividere. OpenAI aggiunge anche la possibilità di invitare dei compagni di team come editor, per costruire e pubblicare insieme sullo stesso progetto. In questa modalità collaborativa, Codex gestisce la gestione Git e l’integrazione continua in background, il che permette a team non tecnici di collaborare su un sito senza gestire direttamente versioning o deployment.
Nuovo plugin Exa per ChatGPT Work e Codex
20 agosto — OpenAI lancia un plugin sviluppato con Exa AI Labs che dà a ChatGPT Work e a Codex accesso a più di 100 miliardi di pagine web, articoli di ricerca e documenti. Questo plugin amplia le capacità di ricerca informativa degli agenti Codex e di ChatGPT Work oltre le loro fonti abituali, in continuità con la strategia di integrazione di plugin di terze parti per l’ecosistema agentico di OpenAI, avviata all’inizio di agosto con il lancio degli Agent Plugins.
Codex SDK: casi cliente Cisco App Builder e Thrive Holdings/Crete
20 agosto — OpenAI mette in evidenza due implementazioni del Codex SDK: Cisco lo utilizza per il suo App Builder, che permette ai clienti di creare applicazioni personalizzate per Cisco Cloud Control in linguaggio naturale; e Thrive Holdings, con Crete, ha costruito un sistema di preparazione fiscale che ha elaborato 7.000 dichiarazioni, riducendo il tempo di preparazione di circa un terzo. OpenAI sottolinea anche l’uso più ampio del harness Codex open source, integrato da team in strumenti interni esistenti, dove la loro applicazione gestisce interfaccia, contesto e approvazioni mentre il harness gestisce il ciclo agentico.
Brevi
- Adattatore AG-UI per Claude Managed Agents — nuovo cookbook pubblicato con CopilotKit, che mappa ogni thread di conversazione a una sessione gestita con streaming di testo, strumenti e ragionamento. 🔗 fonte
- Configurare Auto Mode in linguaggio naturale — le regole Auto Mode di Claude Code possono essere scritte in linguaggio naturale; aggiungere
$defaultsconserva le regole integrate. 🔗 fonte - Claude Desktop si avvia circa 2x più veloce — correzione del throttling all’avvio in background, boot a piena velocità anche con finestra nascosta. 🔗 fonte
- v0 (Vercel) — GPT-5.6 Sol e Fast mode a -50 % — promozione tariffaria fino al 18 settembre 2026. 🔗 fonte
- Test bianchi SAT gratuiti in Gemini — promemoria di inizio anno scolastico: contenuto verificato da The Princeton Review, ritorno immediato e spiegazioni delle risposte. 🔗 fonte
- Immagine Windows 11 arm64 con Visual Studio 2026 in disponibilità generale — sui runner GitHub-hosted standard e larger. 🔗 fonte
- Code scanning aggiunge il motivo di rifiuto « Mitigated » — per chiudere un alert quando un controllo esterno attenua il rischio. 🔗 fonte
- Percorso GitHub Actions dedicato per GitHub Code Quality — cronologia e report di utilizzo ora separati dagli altri run. 🔗 fonte
- Tracciamento dell’attivazione di GitHub Code Quality nel journal di audit — tre nuovi eventi tracciano attivazione, disattivazione e modifiche dei parametri. 🔗 fonte
- CodeQL 2.26.3 migliora le query GitHub Actions — modellazione delle sorgenti JavaScript, TypeScript e Vue. 🔗 fonte
- Luma dettaglia un caso cliente agenzia (Aperture) — -75 % di costo per acquisizione e budget pubblicitario moltiplicato per 9, tramite un sistema a tre componenti (intelligenza, validazione umana, ciclo di feedback). 🔗 fonte
- NVIDIA apre GeForce NOW a Firefox — fino a 1440p/120 fps per gli abbonati Ultimate, dodici nuovi giochi tra cui Gallipoli. 🔗 fonte
- Suno aggiunge le playlist offline — in aggiunta alla revisione delle playlist annunciata il giorno prima. 🔗 fonte
- Qwen3.8-27B in testa al benchmark giuridico agentico di Harvey — modello in pesi aperti numero 1 del Legal Agent Benchmark. 🔗 fonte
- AI Futures: nuovo blog OpenAI sulla governance dell’IA trasformativa — esplorazione dei rischi di concentrazione del potere legati all’IA trasformativa. 🔗 fonte
- Stampli accelera i lanci di prodotto con ChatGPT Work e Codex — lancio del prodotto Deep Finance in sei settimane, produzione ridotta da 243 a 77 ore-uomo stimate. 🔗 fonte
Cosa significa
L’infrastruttura IA sta toccando i suoi limiti di capacità, non i suoi limiti algoritmici. Il blackout del 17 agosto su GitHub non è un bug: è una piattaforma il cui traffico è raddoppiato in quattro mesi (da 1,4 a 2,9 miliardi di commit mensili) che sta recuperando il suo debito di capacità a colpi di migrazione Azure e di milioni di core CPU aggiunti. Lo stesso fenomeno di tensione tra scala e affidabilità si ritrova sul lato dei modelli: WildArtifactBench di Meta AI abbandona le griglie di correzione rigide a favore di punteggi Elo, un’ammissione che la valutazione degli agenti multimodali reali supera ormai ciò che benchmark con ground truth possono misurare.
La competizione si gioca sempre più sul rapporto costo/prestazioni piuttosto che sulla sola prestazione grezza. Sulla frontiera di Pareto di Agent Arena, Kimi K3 (Max) ottiene un punteggio quasi equivalente a Claude Opus 5 (Max) per un costo per compito cinque volte inferiore. Mistral applica la stessa logica sul fronte della ricerca documentale: Agentic Search trasforma un RAG a passaggio unico in un sistema iterativo che triplica l’accuratezza su documenti finanziari densi, senza fine-tuning. E Liquid AI spinge il cursore sul lato dell’inferenza locale, con modelli draft da 300 milioni di parametri che raddoppiano la velocità di modelli molto più grandi tramite decoding speculativo.
Le piattaforme agentiche ampliano la loro presa sui flussi di lavoro aziendali invece di restare semplici interfacce di chat. OpenAI moltiplica i blocchi di integrazione (Exa, Record & Replay, Codex SDK presso Cisco e Thrive Holdings) mentre Anthropic aggiunge controlli di governance (domini consentiti/bloccati per gli agenti gestiti) e Cognition ancora Devin direttamente in Slack. Sono tre scommesse diverse sullo stesso terreno: diventare il livello predefinito in cui i team non tecnici delegano lavoro agli agenti.
Infine, la generazione di contenuti media si sta banalizzando a velocità accelerata. Pika pubblica benchmark quasi alla pari con Suno e fino al 95 % più economici di ElevenLabs sugli effetti sonori, mentre Ideogram mette un modello d’immagine in pesi aperti su un’infrastruttura terza (Runware) e Sakana AI misura la sua traduzione contro la concorrenza su 160 compiti precisi. La differenziazione non si gioca più sulla semplice disponibilità di un modello, ma su numeri di benchmark pubblici, verificabili e sempre più dettagliati.
Fonti
- The August 17 outage, and the work ahead (github.blog)
- @Vlad_GitHub su X
- Thread completo @AIatMeta
- @AIatMeta — WildArtifactBench
- Pika Music
- Pika Music — benchmark
- Pika SFX
- Pika Soundtrack
- @claudeai — Claude Academy
- @ClaudeDevs — Managed Agents
- @ClaudeDevs — Claude Code Concise
- @cognition — Slack Code in Devin
- LFM2.5-DSpark su Hugging Face
- Sakana Translate — annuncio
- @noitomrobotics — HiPHI
- @HeyGen — Retouch
- @bfl_ai — FLUX Video Upscale
- @runware — Ideogram 4.0q
- @NVIDIAAI — cuOpt
- Mistral — Agentic Search
- @arena — frontiera di Pareto
- @AutoClawAIer — GLM-5.3
- @OpenAI — ChatGPT desktop Europe
- @OpenAIDevs — ChatGPT Sites
- @OpenAIDevs — plugin Exa
- @OpenAIDevs — Codex SDK
- @ClaudeDevs — Adattatore AG-UI
- @lydiahallie — Auto Mode
- @ClaudeDevs — Claude Desktop più veloce
- @v0 — promozione GPT-5.6 Sol
- Gemini — test bianchi SAT (blog.google)
- GitHub Changelog — Windows 11 arm64 VS2026
- GitHub Changelog — motivo di rifiuto Mitigated
- GitHub Changelog — percorso Actions Code Quality
- GitHub Changelog — audit log Code Quality
- GitHub Changelog — CodeQL 2.26.3
- @LumaLabsAI — caso cliente Aperture
- NVIDIA — GeForce NOW Firefox
- @suno — playlist offline
- @Alibaba_Qwen — Qwen3.8-27B
- OpenAI — AI Futures
- OpenAI — Stampli