ai-powered-markdown-translatorArticolo tradotto dal francese all’italiano con gpt-6.1-sol.
Google Cloud ha presentato l’8 ottobre, a Gemini at Work 2026, l’agente Gemini: un unico agente per tutto il lavoro in azienda, che funziona continuamente nel cloud e orchestra sia i modelli Gemini sia i modelli Claude. HeyGen, dal canto suo, lancia HeyGen Voice, il suo primo modello vocale sviluppato internamente, che conquista la vetta della classifica Controlled Voice di Artificial Analysis, mentre Anthropic introduce in Claude Managed Agents workflow capaci di avviare fino a 1 000 agenti per esecuzione. Sul fronte del codice, Codex impara a prevedere il prossimo messaggio dell’utente e adotta su Windows una nuova sandbox basata sui Microsoft Execution Containers.
Google Cloud lancia l’agente Gemini, un unico agente per tutto il lavoro
8 ottobre — A Gemini at Work 2026, Google Cloud ha presentato l’agente Gemini, che descrive come un agente unico e universale per il lavoro. Da un unico campo di immissione e un’unica API, risponde alle domande, svolge lavoro intellettuale, crea immagini e contenuti multimediali, scrive ed esegue codice. L’idea sostenuta da Thomas Kurian, CEO di Google Cloud: affidargli un obiettivo anziché una sequenza di istruzioni.
L’agente funziona continuamente nel cloud, con un’unica memoria, ed è presente ovunque: web, iOS, Android, Windows, Mac, riga di comando, Google Workspace, Microsoft 365 e Slack, oppure senza interfaccia (headless) nelle applicazioni di terze parti. Un’attività di diverse ore o diversi giorni continua anche a computer chiuso. Per i lavori lunghi, crea subagenti temporanei, ciascuno dotato di un’identità, e può diventare un agente collega (coworker agent) con un ruolo permanente, un proprio indirizzo @agents.company.com e uno spazio di archiviazione. Il modello diventa una scelta separata: secondo Google, l’agente orchestra già i modelli Gemini e i modelli Claude di Anthropic, mentre altri modelli privati e aperti seguiranno. Sono in arrivo in anteprima varianti settoriali per la finanza (oltre 50 skill di base, già utilizzate da CME Group e Deutsche Bank) e per il settore legale.
| Componente di controllo annunciato | Ruolo descritto da Google |
|---|---|
| Identità di ogni agente | Identità attestata crittograficamente, permessi per ruolo, registro di audit a suo nome |
| Agent Sandbox | Esecuzione isolata, con un proprio perimetro di rete |
| Agent Gateway | Firewall di rete per l’IA, attraverso cui passa tutto il traffico dell’agente |
| Limiti di spesa in tempo reale | In Cloud Billing, l’agente del progetto si mette in pausa, ripresa con un clic |
Google Cloud presenta anche i suoi numeri: quasi 500 clienti hanno elaborato ciascuno oltre 1 000 miliardi di token in un anno e quasi il 90 % delle aziende Fortune 100 utilizza Gemini Enterprise. L’articolo, però, non indica né una data di disponibilità né un prezzo per l’agente stesso; Google Cloud cita soltanto grandi clienti che l’hanno provato in anteprima, come il marchio sportivo On per la scelta dinamica del modello.
🔗 Gemini at Work 2026 (blog di Google Cloud)
Gemini Enterprise rende Claude Opus 5.5 e Claude Sonnet 5.5 disponibili negli strumenti Antigravity
8 ottobre — Lo stesso giorno, le note di rilascio di Gemini Enterprise consentono agli amministratori di attivare Claude Opus 5.5 e Claude Sonnet 5.5 in Antigravity 2.0, nell’Antigravity CLI e nelle estensioni Antigravity per IDE. L’amministratore accetta le relative condizioni d’uso direttamente nella console Google Cloud, senza un account Anthropic separato.
| Parametro di attivazione | Valore indicato da Google |
|---|---|
| Stato predefinito | Modelli di terze parti disattivati, attivazione da parte degli amministratori |
| Modalità di fatturazione | A consumo, entro il limite di spesa del progetto |
| Località di inferenza | global, us ed eu |
| Livelli di ragionamento | Low, Medium (predefinito), High o Max |
Lo sviluppatore mantiene la propria licenza Gemini Enterprise e sceglie Claude nel selettore dei modelli. Il superamento dei limiti (overages) deve essere abilitato prima di accedere a un modello di terze parti, il cui costo rientra nel limite comune a tutti i modelli. La stessa pagina annuncia la disponibilità generale di Gemini 3.8 Flash a Singapore.
🔗 Note di rilascio di Gemini Enterprise
Voce: HeyGen Voice in cima alla classifica Controlled Voice, Mistral pubblica due modelli per l’arabo
9 ottobre — HeyGen lancia HeyGen Voice, che Joshua Xu presenta come il primo modello vocale sviluppato internamente dall’azienda, finora conosciuta per i suoi avatar. Il modello è disponibile in HeyGen e tramite API, a 30 dollari per milione di caratteri; fino al 31 ottobre, gli utenti dell’API pagano 15 dollari, con lo sconto applicato automaticamente.
Il dato a sostegno arriva da Artificial Analysis, che ha pubblicato i suoi risultati un minuto e mezzo prima di HeyGen. Nella sua classifica Controlled Voice, in cui tutti i modelli parlano con le stesse 8 voci clonate, in inglese americano e britannico, HeyGen Voice conquista il primo posto con un Elo di 1 201 su 1 468 apparizioni. È primo nelle categorie Assistenti e Servizio clienti, oltre che in inglese britannico.
HeyGen Voice takes the #1 spot on the Artificial Analysis Controlled Voice TTS Arena Leaderboard, ahead of Alibaba’s Qwen-Audio-3.1-TTS-Plus and ElevenLabs’ Eleven v4 Turbo
🇮🇹 HeyGen Voice conquista il primo posto nella classifica Controlled Voice TTS Arena di Artificial Analysis, davanti a Qwen-Audio-3.1-TTS-Plus di Alibaba ed Eleven v4 Turbo di ElevenLabs. — @ArtificialAnlys su X
| Modello valutato | Elo Controlled Voice (9 ottobre) | Prezzo API per milione di caratteri |
|---|---|---|
| HeyGen Voice | 1 201 | 30 dollari (15 fino al 31 ottobre) |
| Qwen-Audio-3.1-TTS-Plus | 1 182 | 19,3 dollari |
| Eleven v4 Turbo | 1 166 | 40 dollari |
| Eleven v4 | 1 162 | 80 dollari |
Questo primo posto ha un ambito preciso: riguarda la clonazione della voce. Nella classifica Provider Voice, in cui ogni fornitore utilizza le proprie voci, Eleven v4 Turbo ed Eleven v4 restavano in testa la sera del 9 ottobre, senza HeyGen Voice tra i primi otto. Quanto alla robustezza della pronuncia, HeyGen Voice ottiene l’83,1 %, classificandosi al 10º posto su 29.
Sul fronte API, la clonazione è istantanea: una sola registrazione, di cui vengono utilizzati soltanto i primi tre minuti, produce una voce attiva in pochi secondi, senza addestramento. La sintesi avviene in un unico blocco (file WAV a 44,1 kHz) oppure in streaming, e Artificial Analysis ha valutato le impostazioni predefinite dell’API.
Voxtral Mini 4B Realtime Arabic e LIDstral Arabic: due modelli di Mistral per l’arabo
8 ottobre — Mistral ha pubblicato su Hugging Face, senza alcun annuncio, due modelli aperti con licenza Apache 2.0 dedicati all’arabo. Voxtral Mini 4B Realtime Arabic trascrive in streaming i dialetti arabi e l’arabo standard moderno, anche quando i parlanti cambiano lingua durante la conversazione (code-switching). Ottimizzato a partire da Voxtral Mini 4B Realtime, conta circa 4,4 miliardi di parametri. Secondo la sua scheda, è stato sviluppato congiuntamente con il ministero marocchino della Transizione digitale e della Riforma amministrativa, nell’ambito del partenariato firmato tra Mistral e il Marocco nel gennaio 2026, che ha prodotto anche due nuovi benchmark, ISMA e Darija in the Wild.
| Modello pubblicato | Funzione del modello | Risultato secondo la scheda |
|---|---|---|
| Voxtral Mini 4B Realtime Arabic | Trascrizione dell’arabo in streaming | Tasso medio di errore per carattere dell’8,82 % su 7 benchmark a 480 ms, contro il 7,91 % di Voxtral Transcribe Arabic |
| LIDstral Arabic | Identificazione della lingua e del dialetto, 51 classi, su processore | F1 dell’88,67 % sulla darija marocchina, contro il 71,28 % di GlotLID v3 |
🔗 Voxtral Mini 4B Realtime Arabic su Hugging Face · LIDstral Arabic su Hugging Face
Claude Managed Agents: workflow dinamici fino a 1 000 agenti per esecuzione
9 ottobre — Anthropic rende disponibili in beta pubblica i workflow dinamici (dynamic workflows) di Claude Managed Agents, un nuovo tipo di orchestrazione multiagente. L’agente che conduce la sessione scrive autonomamente un programma, che il server esegue in background avviando numerosi agenti per fasi, prima di combinarne i risultati. Una volta attivato il tipo multiagent_20261001, è l’agente a decidere di avviare un’esecuzione.
Un’esecuzione avvia fino a 1 000 agenti, di cui 64 contemporaneamente, dura 24 ore per impostazione predefinita e una sessione può mantenerne 10 aperte. I suoi token vengono fatturati come quelli della sessione e rientrano nel suo budget; Anthropic avverte che possono essere numerosi e cita un test interno su 70 bug introdotti in una base di codice di 116 000 righe.
| Configurazione del test di Anthropic | Bug trovati in 3 prove |
|---|---|
| Agente singolo | 14, 15 e 27 |
| Workflow dinamico | 66 in ogni prova |
🔗 Annuncio di @ClaudeDevs · Documentazione delle esecuzioni di workflow
Agenti di codice: previsioni dei messaggi e sandbox MXC per Codex, Claude Code 2.1.296, Vibe CLI 2.26.1
Codex riceve due novità lo stesso giorno, mentre Anthropic e Mistral pubblicano nuove versioni dei loro agenti da riga di comando.
Codex prevede il prossimo messaggio dell’utente, in beta per gli abbonati Pro
9 ottobre — OpenAI rende disponibili in beta le previsioni del compositore (composer predictions) nell’applicazione desktop Codex. Quando Codex ha finito di rispondere, nel campo di immissione può comparire un suggerimento per il messaggio successivo, elaborato a partire dalla conversazione in corso, senza consultare le memorie né le applicazioni connesse. Il tasto Tab lo inserisce; il testo resta modificabile e non viene mai inviato automaticamente. Il suggerimento riguarda un messaggio completo, anziché un completamento parola per parola.
| Condizione della beta | Valore indicato da OpenAI |
|---|---|
| Piano ed età | ChatGPT Pro personale, 18 anni e oltre |
| Conversazioni e modelli | Conversazioni locali e SSH, con GPT-6 Astra o GPT-6.1 Sol |
| Impostazione predefinita | Attivata, disattivabile in General > Composer > Show predictions |
| Costo durante la beta | Non rientra nei limiti d’uso di Codex, senza consumo di crediti |
I messaggi inviati, comprese le previsioni accettate, continuano a essere conteggiati normalmente. La funzione non è disponibile in Chat.
🔗 Annuncio di @OpenAIDevs · Articolo di assistenza di OpenAI
Codex su Windows: una sandbox basata sui Microsoft Execution Containers
9 ottobre — OpenAI aggiunge a Codex su Windows una modalità sandbox basata sui Microsoft Execution Containers (MXC), che Microsoft ha reso generalmente disponibili il 7 ottobre. Richiede un dispositivo Windows 11 compatibile (24H2 build 26100.9278 o 25H2 build 26200.9278) e promette una configurazione più rapida, un controllo di rete più rigoroso e un accesso ai file regolato in modo più preciso.
Secondo la documentazione, MXC diventa l’implementazione consigliata: isola nativamente i processi, senza una configurazione approvata da un amministratore, senza account Windows aggiuntivi né regole firewall locali. Le modalità elevated e unelevated diventano opzioni di ripiego legacy. L’applicazione desktop sceglie autonomamente MXC per gli account consumer; nella CLI o in azienda, si attiva con prefer_mxc = true in config.toml e un amministratore può bloccarlo con allow_mxc = false. Sono documentati due limiti: la rete gestita richiede allow_local_binding = true e i processi figli ancora attivi vengono arrestati al termine del comando in primo piano.
🔗 Annuncio di @OpenAIDevs · Documentazione della sandbox Windows
Claude Code 2.1.296: compattazione specifica per i subagenti e modello unico per gli agenti di workflow
9 ottobre — Claude Code 2.1.296 conta 79 voci, di cui 56 correzioni, e non è stata accompagnata da alcun tweet. Offre soprattutto un maggiore controllo sui subagenti.
| Novità della versione | Cosa cambia |
|---|---|
autoCompactWindow (subagenti, --agents) | Un subagente compatta il proprio contesto prima della conversazione principale |
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODEL | Tutti gli agenti di un workflow sullo stesso modello, gli altri subagenti mantengono il proprio |
Opzione allow_large di Read | Lettura di un grande file di testo in una sola chiamata, se il contesto lo consente |
CLAUDE_CODE_OVERLOADED_RETRY_MAX_DELAY_MS | Intervallo massimo più lungo tra due nuovi tentativi dopo un errore 529 |
| Descrizioni degli strumenti MCP inviate subito | Limite predefinito aumentato da 2 048 a 4 096 caratteri |
/cost e la riga di stato conteggiano ora le letture della cache di Sonnet 5.5 a 0,10 dollari per milione di token. Sul fronte della sicurezza, la versione corregge gli hook PreToolUse gestiti che rifiutavano una chiamata senza terminare il turno, i controlli Bash che approvavano automaticamente alcuni comandi che utilizzavano BASH_ARGV0, le sessioni cloud che saltavano i controlli della modalità auto sulle azioni di Claude in Chrome e le modifiche Edit e NotebookEdit che sostituivano tutti i caratteri non ASCII nei file non UTF-8, ora rifiutate.
🔗 Claude Code 2.1.296 su GitHub
Vibe CLI 2.26.1: rimosso il modello Devstral locale, una modalità non interattiva più completa
9 ottobre — Tre giorni dopo la 2.26.0 e senza tweet, Mistral pubblica Vibe CLI 2.26.1. Nonostante il numero di patch, la versione conta 85 voci (23 aggiunte, 24 modifiche, 36 correzioni, 2 rimozioni), di cui 37 per la nuova interfaccia in Rust. Rimuove il modello Devstral locale che era incluso: una configurazione che lo specifica ancora torna, con un avviso, al modello ospitato predefinito. Quest’ultimo offre ormai solo due livelli di ragionamento, off e high, e dichiara una finestra di contesto di 256k, su cui si basa la compattazione automatica.
La modalità non interattiva vibe -p acquisisce un limite di tempo, la lettura del prompt da un file o dallo standard input, un rapporto export.json scritto a ogni uscita e codici di uscita distinti: 1 per un errore d’uso o di configurazione, 2 per un guasto dell’infrastruttura, 3 per un limite raggiunto o un rifiuto del modello. La Rust CLI aggiunge /proxy-setup, un narratore che legge ad alta voce il riepilogo di ogni turno, /plugins e /whoami. Nuove impostazioni vietano all’agente i processi in background o i subagenti, e il connettore Document Library rimane disattivato per impostazione predefinita.
🔗 Note di rilascio di Vibe CLI 2.26.1
Immagini, video e giochi generativi: Qwen-Image-2.1-Turbo, modalità Thinking di Midjourney, Syren di Synthesia, Playground di Google
Un modello di immagini più veloce ed economico, un generatore che rivede il proprio lavoro, un agente che monta video e una piattaforma di giochi senza codice.
Qwen-Image-2.1-Turbo: 8 passi di denoising e 0,016 dollari per immagine
9 ottobre — Qwen pubblica Qwen-Image-2.1-Turbo, un checkpoint accelerato (accelerated checkpoint) di Qwen-Image-2.1 che genera e ritocca immagini in 8 passi di denoising, sulla stessa architettura da 7 miliardi di parametri. Secondo Qwen, produce ancora immagini 2K e accetta ritocchi in linguaggio naturale, ma non viene pubblicato alcun dato sulla qualità o sulla velocità specifico di questa versione. I pesi sono su Hugging Face e ModelScope, sotto la licenza di ricerca di Qwen (Qwen Research License). Il checkpoint include il proprio schema di campionamento in 8 passi e funziona per impostazione predefinita con un CFG di 1.
Lo stesso giorno, Qwen apre ufficialmente le API Qwen-Image-2.1 Pro e Turbo; QwenCloud consente 120 richieste al minuto per Turbo.
| Modello disponibile via API (Model Studio) | Prezzo per immagine | Immagini gratuite |
|---|---|---|
| qwen-image-2.1-turbo | 0,016 dollari | 10 |
| qwen-image-2.1-pro | 0,04 dollari | 10 |
| qwen-image-2.0-pro | 0,075 dollari | 100 |
🔗 Annuncio di Qwen · Scheda Hugging Face
Midjourney testa una modalità Thinking e apre le cartelle condivise sul suo sito alpha
8 ottobre — Il changelog alpha di Midjourney, pubblicato in serata, presenta due funzioni in versione preliminare, riservate per ora al sito alpha.midjourney.com. La prima è un test: su un’immagine prodotta con V8.2, durante la generazione o la modifica, il pulsante Rerun (Thinking) chiede al modello di esaminare il risultato, individuare dove si discosta dal prompt (oggetti, impaginazione, anatomia, testo) e generare di nuovo. Midjourney afferma di riscontrare risultati migliori nella fedeltà al prompt, nella tipografia e nella coerenza, e valuta di farne una modalità generale.
La seconda è la condivisione delle cartelle: si invitano Collaboratori, che generano direttamente nella cartella, o Lettori, e si può condividere tramite link, oppure aprire la cartella a qualsiasi membro di Midjourney. Midjourney precisa che la condivisione non cambia la visibilità delle immagini: senza la modalità stealth, possono ancora apparire su Explore e sui profili.
🔗 Changelog alpha di Midjourney · Test della modalità Thinking (Midjourney)
Syren: Synthesia affida la creazione video a un agente, in beta
9 ottobre — Synthesia lancia Syren in beta per tutti i suoi clienti, compresi gli account gratuiti. Si descrive il video desiderato, oppure si forniscono documenti, immagini, video, presentazioni PowerPoint o link YouTube, e Syren consegna un video finito con animazioni grafiche (motion graphics), avatar, voci fuori campo, musica e riprese di copertura (b-roll), che si corregge poi conversando. Secondo Peter Hill, direttore tecnico di Synthesia, l’agente scrive l’intero video sotto forma di codice, che un motore di rendering sviluppato internamente, utilizzato per le animazioni di Synthesia da giugno, riproduce in tempo reale.
I video durano fino a 3 minuti, in formato orizzontale o verticale, e il rendering avviene nel browser. La fatturazione avviene a crediti, senza prezzi dettagliati, e gli amministratori Enterprise possono disattivare lo strumento. Nel post si annuncia come imminente l’apprendimento automatico dell’identità del brand a partire dai video esistenti. Syren arriva quattro giorni dopo HyperFrames Studio di HeyGen e il giorno dopo Claude Motion di Anthropic, altri due strumenti in cui un agente produce il video.
🔗 Presentazione di Syren (Synthesia)
Playground: Google apre una piattaforma per creare giochi senza programmare
7 ottobre — Google lancia Playground, una piattaforma di gioco sperimentale in cui si creano, si giocano e si condividono giochi descrivendoli con pochi prompt, senza scrivere codice. In un’interfaccia conversazionale, si parte da una pagina bianca, da un esempio da rielaborare o da un percorso guidato, poi si modificano su richiesta la fisica, le regole, i personaggi o l’ambientazione.
I giochi funzionano nel browser, sia sul telefono sia sul computer, e possono rimanere privati, essere condivisi tramite link o entrare nella galleria Explore, con classifiche e multiplayer per alcuni generi; ogni gioco pubblicato passa un controllo di sicurezza. Playground è aperto negli Stati Uniti a chi ha almeno 18 anni, con diritti di creazione che dipendono dall’abbonamento Google AI. Un’integrazione con Unity Spark, per giochi 3D più ambiziosi, è annunciata a breve in beta chiusa. Google non precisa quale modello alimenti la piattaforma.
🔗 Presentazione di Playground (blog Google)
Salute: lo studio clinico di AMIE pubblicato su The Lancet
8 ottobre — Google e il Beth Israel Deaconess Medical Center (BIDMC) pubblicano su The Lancet uno studio prospettico di fattibilità di AMIE (Articulate Medical Intelligence Explorer), l’IA conversazionale di Google per la diagnosi; secondo Google, è la sua prima pubblicazione nella rivista principale di The Lancet. I pazienti hanno conversato con AMIE fino a cinque giorni prima di una visita urgente, e il medico riceveva poi la trascrizione e un riepilogo.
| Misura dello studio | Risultato pubblicato |
|---|---|
| Pazienti inclusi (da aprile a novembre 2025), poi seguiti | 114, poi 98 |
| Interruzioni per motivi di sicurezza | 0 |
| Allucinazioni rilevate | 1 |
| AMIE utile per preparare la visita, secondo il medico | 33 casi su 44 (75 %) |
| Diagnosi concordanti con la diagnosi finale (Google) | 90 % |
Lo studio è stato condotto in un solo centro, senza gruppo di controllo e con finanziamenti di Alphabet; non costituisce né un’autorizzazione né una messa in servizio: gli autori chiedono sperimentazioni più ampie.
🔗 Post di Google · L’articolo su The Lancet
Ricerca in OpenAI: la risposta alla lettera di tre ricercatori con cui l’azienda ha interrotto il rapporto
9 ottobre — In una nota pubblicata su @OpenAINewsroom a nome dei suoi responsabili della ricerca, OpenAI risponde alla lettera di tre ricercatori con cui afferma di aver interrotto il rapporto la settimana precedente. Secondo OpenAI, un’indagine interna ha concluso che avevano violato regole chiare sul trattamento di informazioni sensibili, con una rottura del rapporto di fiducia che va oltre quanto esposto nella loro lettera; OpenAI conferma la propria decisione. Afferma che queste decisioni non dipendono né dall’aver sollevato preoccupazioni sulla sicurezza né dall’essersi espressi, e che non licenzia alcun dipendente per aver manifestato preoccupazioni.
La nota annuncia anche:
We are actively finalizing contracts with third-party safety assessors and will announce details in the coming weeks.
🇮🇹 Stiamo finalizzando attivamente contratti con valutatori di sicurezza terzi e ne annunceremo i dettagli nelle prossime settimane. — @OpenAINewsroom su X
OpenAI si dice d’accordo con la lettera su un punto: preservare la monitorabilità (monitorability) dei modelli di frontiera richiede un impegno di tutto il settore, OpenAI compresa. Questo articolo riporta la versione di OpenAI; la lettera dei ricercatori non è stata consultata.
Realizzare modelli aperti: sei modelli per circa 103 dollari con ML Intern, lo scheduler di GPU di Ai2
Due resoconti sulla realizzazione dei modelli: uno dal lato dell’agente, l’altro dal lato dei cluster di calcolo.
ML Intern: sei modelli aperti per circa 103 dollari di calcolo
8 ottobre — Già presentata qui il 1° e l’8 ottobre da altre prospettive, la modalità ML Intern di HuggingChat riceve un primo bilancio quantitativo sul blog di Hugging Face: sei progetti portati a termine dall’inizio alla fine, per circa 103 dollari di calcolo complessivi. Ognuno parte da un messaggio e si conclude con un modello pubblico sul Hub, valutazione compresa. L’agente pianifica, chiede l’autorizzazione prima di qualsiasi attività di calcolo a pagamento, avvia un breve test, poi addestra, valuta e pubblica sull’hardware di Hugging Face.
| Modello prodotto da ML Intern | Risultato pubblicato | Costo di calcolo |
|---|---|---|
| Pocket Rewriter (0.8B) | 99,7 % di output validi, circa un quarto dei tokens del riscrittore da 9B di Qwen-Image 2.1 | Circa 16 dollari |
| Citrus Doctor (Qwen3.5-2B) | Dal 14,9 % al 52,8 % di diagnosi corrette delle malattie degli agrumi | Circa 1,90 dollari |
| Due LoRA per Qwen-Image 2.1 | Cambio dell’angolo di visuale, scarabocchio sostituito dall’oggetto richiesto | Circa 16 e 24,30 dollari |
| Huggy LoRA (FLUX.2 klein) | LoRA di un personaggio | Circa 7,60 dollari |
| Agate 4 passi | Distillazione di un piccolo modello di immagini, da 50 passi (100 passaggi con la guidance) a 4 | Circa 37 dollari |
Lo scheduler di GPU di Ai2: l’attesa mediana passa da 5 minuti a 24 secondi
9 ottobre — Ai2 descrive il nuovo scheduler dei suoi cluster di GPU in un post firmato da Jeremy Tryba. Migliaia di GPU NVIDIA H100, B200 e B300, in cluster da 88 a 1 024 GPU, sono condivise da circa 150 ricercatori, con una domanda da due a tre volte superiore all’offerta. Il vecchio sistema a priorità lasciava GPU «monopolizzate» da attività vuote e vedeva tutti i carichi finire alla priorità massima.
Il nuovo si basa su budget di tempo GPU distribuiti lungo l’organigramma della ricerca, una condivisione equa gerarchica (fair-share) calcolata su una finestra mobile di sette giorni e un «contratto di scheduling»: ogni carico dichiara una durata protetta di al massimo 8 ore, dopo la quale può essere soggetto a preemption e rimesso in coda. Il tempo non allocato rimane gratuito, ma sempre soggetto a preemption.
| Indicatore misurato da Ai2 | Vecchio scheduler | Nuovo scheduler |
|---|---|---|
| Attesa mediana, cluster H100 più grande | 5 minuti | 24 secondi |
| Attesa p90 dei carichi di debug | 2 ore | 30 secondi |
| Ore GPU dovute erogate in 30 giorni | — | 98 % |
Le riparazioni che richiedono un intervento umano diminuiscono del 74 %. Ai2 riconosce alcuni limiti, come le sessioni interattive che diventano soggette a preemption dopo 8 ore, mentre prima potevano durare una settimana, e non pubblica alcun codice.
Modelli decisionali: pplx-decider-v1.1-27b in testa a Decision Bench, a pari merito statistico con altri nove
9 ottobre — Già trattato il 6 e l’8 ottobre, il modello decisionale di Perplexity ottiene un risultato esterno. Su Decision Bench, benchmark open source di Atlan Frontier Labs (1 071 domande chiuse, 36 dataset, 15 modelli classificati), pplx-decider-v1.1-27b raggiunge il miglior punteggio grezzo, 94,5 %, al costo più basso, 0,017 dollari per 1 000 decisioni. Il sito assegna però la stessa posizione ai modelli i cui intervalli di confidenza al 95 % si sovrappongono: dieci modelli condividono il primo posto.
| Modello valutato su Decision Bench | Precisione misurata | Costo per 1 000 righe |
|---|---|---|
| pplx-decider-v1.1-27b | 94,5 % | 0,017 dollari |
| DeepSeek V4.1 Flash | 94,2 % | 0,683 dollari |
| Gemini 3.5 Flash | 94,2 % | 3,32 dollari |
| Jev 1.13 | 93,8 % | 0,044 dollari |
Perplexity pubblica anche una guida pratica (cookbook) per un agente di navigazione, in cui è il codice, mai il modello, a decidere i clic, e la v1.1 sostituisce la v1 nell’API.
🔗 Thread di @perplexitydevs · Classifica Decision Bench
Grok Bot riceve il proprio indirizzo e-mail
9 ottobre — Grok Bot, l’agente di SpaceXAI, dispone ora del proprio indirizzo e-mail. Il Bot può usarlo per iscriversi a servizi, contattare aziende a nome dell’utente o fissare un appuntamento con qualcuno. La funzione viene resa disponibile il giorno stesso: basta chiedere un indirizzo al Bot o menzionare @bot su X e, in un team, un amministratore deve prima attivarla.
L’annuncio si limita a un thread dell’account @bot, rilanciato da @grok, senza un post su x.ai. Non precisa né il formato né il dominio degli indirizzi, né i piani interessati. Dopo l’identificativo Slack proprio dei Team Bots a fine settembre, l’agente acquisisce così un’identità propria per agire all’esterno.
ElevenLabs si insedia a Singapore, il suo hub per il Sud-est asiatico
8 ottobre — ElevenLabs ufficializza il proprio arrivo a Singapore, dove l’azienda apre un ufficio destinato a fungere da hub per il Sud-est asiatico e, più in generale, per l’Asia-Pacifico. Il post mette in evidenza l’infrastruttura già presente: da luglio, le aziende possono ospitare i propri dati a Singapore, con opzioni senza conservazione e una latenza ridotta nella regione.
ElevenLabs cita soprattutto i suoi clienti regionali: Funding Societies, che qualifica i potenziali clienti tramite IA conversazionale in cinque mercati, Boost Bank in Malesia, Salmon Group nelle Filippine, MNC Group in Indonesia, oppure Rezonate, una piattaforma sanitaria utilizzata dal 60 % degli ospedali pubblici di Singapore. Non vengono forniti dati sul numero di dipendenti. L’apertura segue quelle di Bruxelles e Amsterdam, a fine settembre e inizio ottobre.
In breve
- Projects in Claude Code — Anthropic ha dato accesso a tutti gli abbonati Pro e Max iscritti alla lista d’attesa. Projects resta in beta: la lista rimane aperta, seguiranno altri accessi in base alla capacità e la funzione non è ancora disponibile su Team né Enterprise, secondo la documentazione. 🔗 fonte
- Guida alle automazioni degli agenti — Una guida di claude.dev descrive un’implementazione di riferimento su Claude Managed Agents, che legge a intervalli programmati i canali Slack e le pull requests GitHub e poi pubblica un riepilogo su Slack, e ne illustra i sei componenti con le relative contromisure ai guasti comuni, come evitare di scambiare una fonte illeggibile per una giornata tranquilla o fissare il tetto di spesa da 3 a 5 volte il costo di un’esecuzione normale. 🔗 fonte
- Block e Claude Fable — In un’intervista pubblicata da Anthropic, Block spiega che Claude Fable progetta le sue grandi migrazioni di codice e coordina fino a decine di modelli Opus o Sonnet, arrivando a integrare fino a un migliaio di pull requests in una stessa migrazione; merge e rilasci in produzione restano riservati agli esseri umani, con doppia approvazione dei deployment. 🔗 fonte
- La Compliance API di Claude Enterprise — I suoi endpoint (endpoints) di conversazione restituiscono anche, in beta e con la chiave esistente, le conversazioni dell’esperienza Claude unificata: una conversazione proseguita in una sessione cloud viene restituita come un’unica conversazione, con il lavoro di Claude nei blocchi
tool_useetool_result. 🔗 fonte - Codex CLI 0.162.1 — Questa correzione della 0.162.0 elimina un crash della TUI sulle domande asincrone di più righe e gli errori di avvio quando un server in background già in esecuzione aveva impostazioni delle funzionalità diverse da quelle della CLI. 🔗 fonte
- Plugin per ruolo in ChatGPT Enterprise ed Edu — Quando il controllo degli accessi basato sui ruoli (RBAC) è attivo, proprietari e amministratori impostano l’accesso ai plugin per ciascun ruolo: Available, Install o Disabled per lo spazio di lavoro, Default affinché un ruolo personalizzato erediti questa impostazione. 🔗 fonte
- Sophos e OpenAI Daybreak — Secondo il fornitore di cybersicurezza, i suoi agenti costruiti con Daybreak riducono il tempo medio di risposta dei casi che trattano da circa 38 minuti a circa 89 secondi e il 52 % dei suoi casi MDR viene risolto dall’IA dall’inizio alla fine; le azioni distruttive restano sotto supervisione umana. 🔗 fonte
- Asana e l’agente di navigazione di StackAI — Secondo Asana, GPT-6 Astra in Codex ha ottimizzato questo agente in circa una settimana: su GPT-6.1 Sol, un’esecuzione di test costa 0,47 dollari e richiede circa quattro minuti, risultando 76 volte meno costosa e 5 volte più veloce della configurazione di produzione originale. 🔗 fonte
- LegalOn e Codex — LegalOn Technologies afferma di aver ridotto di circa il 65 % i propri costi giornalieri stimati di Codex passando da GPT-5.5 in modalità rapida senza limiti a una ripartizione dei compiti tra GPT-6 Luna, GPT-6.1 Sol e GPT-6 Astra, con modalità rapida su richiesta e tetti di spesa per servizio e per persona. 🔗 fonte
- Gemini CLI v0.64.0-preview.1 — Questa preview elimina i falsi positivi dell’avviso Untrusted Command Flags Detected sui comandi shell innocui: opzioni di sola lettura esentate, variabili shell preservate, cicli consentiti quando ogni sottocomando ha la propria regola ALLOW. Il 9 ottobre non è uscita alcuna nightly e la versione stabile resta la v0.63.0. 🔗 fonte
- Antigravity 2.22.0 — I plugin possono mostrare la propria interfaccia nel pannello laterale (UI Extensions), le conversazioni si organizzano trascinandole da una sezione all’altra della barra laterale e i timestamp mostrano il nome del mese. 🔗 fonte
- Gemini 3.7 Flash deprecato — Nell’API Gemini, le chiamate a
gemini-3.7-flashvengono reindirizzate versogemini-3.8-flashe il vecchio agentedeep-research-pro-preview-12-2025verrà disattivato il 23 ottobre, a favore dideep-research-preview-04-2026o dideep-research-max-preview-04-2026. 🔗 fonte - Plugin VST3 e AU per Google Flow Music — Notizia del 6 ottobre ripresa ora: gli Spaces, questi strumenti ed effetti creati in linguaggio naturale, si esportano come plugin per le workstation audio digitali (Digital Audio Workstations), come il plugin No Chaser del produttore Khris Riddick-Tynes. 🔗 fonte
- Google Earth AI e la salute pubblica — Notizia del 6 ottobre ripresa ora: durante l’epidemia di Ebola nella RDC, un prototipo di agente di ragionamento geospaziale ha permesso all’ufficio africano dell’OMS di individuare in pochi minuti 48 località esposte e oltre 45 500 persone a rischio; il modello PDFM individua anche zone a rischio di colera fino a 8 settimane in anticipo. 🔗 fonte
- Fatturazione di Copilot code review — I proprietari delle organizzazioni possono addebitare all’organizzazione proprietaria del repository le revisioni richieste dai propri membri titolari di licenza, anziché consumare la loro quota, se l’utilizzo a pagamento degli AI Credits è attivo, e riservare l’avvio delle revisioni alle licenze fornite dall’organizzazione o dall’azienda. 🔗 fonte
- Copilot CLI 1.0.95 — Passata alla versione stabile, si autentica su macOS tramite il broker nativo di Microsoft Entra, con fallback sul browser; la versione preliminare 1.0.96-0 indica nella cronologia chi ha deciso su ogni autorizzazione: l’utente, Assisted Permissions, una policy o il fallback senza supervisione. 🔗 fonte
- GitHub MCP Server 2.0 — Notizia del 6 ottobre ripresa ora: il server MCP ufficiale di GitHub restituisce output tipizzati, descritti da schemi di output (output schemas), per gli agenti in Code Mode o Programmatic Tool Calling; vengono dichiarati solo ai client della specifica MCP 2026-07-28 o successiva. 🔗 fonte
- Claude Haiku 5.5 in Genspark — Genspark rende disponibile il modello in AI Chat, Code Agent e Claw, riprendendo le argomentazioni di Anthropic: circa il 75 % meno costoso da eseguire rispetto a Haiku 4.5, senza un piano né una tariffa dedicati. 🔗 fonte
- Template Meta VR per v0 — Meta pubblica insieme a Vercel un template v0 basato sull’Immersive Web SDK: si descrive un’esperienza, v0 la codifica e ne mostra l’anteprima, un clic la distribuisce su Vercel per aprirla nel browser del Quest; lo sguardo e le mani dei Meta VR Glasses, attesi nella primavera 2027, sono già supportati. 🔗 fonte
- v0 for teams — v0 presenta in un video questo modo di vedere il lavoro dei propri compagni di squadra, unirsi alle loro conversazioni e costruire insieme; il tweet mette in evidenza funzionalità arrivate per fasi da settembre, senza nuove tariffe. 🔗 fonte
- DeepSeek Harness 0.2.1-alpha.2 — 26ª versione preliminare, ancora senza una versione stabile: il catalogo dei plugin installa su richiesta i pacchetti Claude Code e Codex, compaiono due plugin sperimentali (Git Worktrees, traduzione del ragionamento) e le istruzioni globali possono provenire da un AGENTS.md condiviso. 🔗 fonte
- OGX 1.5.0 — L’ex Llama Stack, rinominato ad aprile e uscito dall’organizzazione meta-llama, aggiunge il passthrough nativo dell’API /v1/messages per DeepSeek e Fireworks AI, un provider Text-Embeddings-Inference, la ricerca web Exa e Serply e il client MCP 2.x, con quattro modifiche incompatibili. 🔗 fonte
- GenIA — Meta pubblica senza annuncio, con licenza non commerciale CC BY-NC 4.0, il codice di questo lavoro svolto con il Tübingen AI Center: ricostruisce oggetti 3D da un’immagine, alcune viste o un video allineando durante l’inferenza il prior congelato di SAM 3D Objects, senza riaddestramento. 🔗 fonte
- Etichetta decision-model sull’Hub — Hugging Face assegna ai modelli decisionali una propria etichetta, con un’icona e un filtro nella pagina Models; i GGUF decisionali vengono etichettati automaticamente a partire dai loro metadati llama.cpp. 🔗 fonte
- Darwin-27B-ZTC-v2 — VIDRAFT annuncia che la nuova versione del suo modello giudice, sotto Apache-2.0, si porta in testa al System One Mosaic Benchmark (137 benchmark) con un punteggio Borda di 89,58, davanti a OpenJev-27B (87,50) e Jev 1.13 (85,05); una classifica dichiarata dai suoi autori, che la presentano come un’istantanea di una tabella pubblica. 🔗 fonte
- La confidenza dei modelli decisionali — Stephen Solka mostra in un post della community che GPT-6 Luna Decisions, interrogato tramite OpenRouter, risponde «non corrisponde» a 600 verifiche SHA-256, con il 50 % di accuratezza e il 99,8 % di confidenza media; nel ragionamento causale, una soglia al 99 % isola 47 risposte corrette su 49, ma copre solo l’8,2 % dei casi. 🔗 fonte
- openai-math in ambienti di apprendimento per rinforzo — FineEnvs porta in ambienti Harbor 369 dei 405 risultati formalizzati in Lean della pubblicazione openai/math: l’agente deve dimostrare un teorema in una sandbox Lean 4 e Comparator assegna la ricompensa solo a una dimostrazione completa dell’enunciato esatto; un set sperimentale sotto Apache-2.0. 🔗 fonte
- JOSIE-2 — Gökdeniz Gülmez pubblica il rapporto tecnico di questa famiglia da 2B, 4B e 9B sottoposta a post-addestramento a partire da Qwen3.5 su due Mac M4, con circa 3 000 esempi selezionati: in modalità ragionamento, JOSIE-2-4B raggiunge 95,5 su ARC-Challenge (+12,1) e 69,2 su TruthfulQA (+20,3), su due soli benchmark. 🔗 fonte
- Gradio 6.30 —
gr.Workflowaggiunge una vista applicazione e il comando Run this node riutilizza i risultati a monte ancora aggiornati anziché rieseguire l’intero sottografo;gr.ImageEditorconserva il canale alfa delle immagini caricate. 🔗 fonte - tokenizers 0.23.3 — Questa correzione del solo pacchetto Python accetta
huggingface_hubv2, sbloccando l’installazione di Transformers secondo le note, e annulla una modifica incompatibile della 0.23.1 sul troncamento. 🔗 fonte - Revisione scientifica tramite IA — Sakana AI presenta un articolo accettato a TMLR: un benchmark inserisce negli articoli affermazioni contraddittorie per verificare se i revisori IA le individuano e il suo sistema Multi-Layered Review ne rileva più degli altri sistemi testati, secondo l’annuncio di Sakana AI, che non fornisce alcun dato numerico. 🔗 fonte
- Suno Studio — Le clip si allineano meglio al primo tempo e si allungano per seguire il tempo del progetto, le dissolvenze diventano esponenziali o logaritmiche e il sintetizzatore, la tastiera e le viste dei plugin si possono sganciare e spostare anche su un secondo schermo; Studio è incluso nell’abbonamento Premier. 🔗 fonte
- World Models’ Last Exam in Physics — In questo esame di fisica di Einsia per modelli video (40 compiti, 9 categorie, otto modelli), Seedance 2.5 arriva primo con 57,76 su 100, davanti a MiniMax H3 (54,89), miglior modello aperto secondo MiniMax, e Cosmos 3 Super di NVIDIA (42,46); un benchmark di terze parti. 🔗 fonte
- Simulazioni Omniverse costruite dagli agenti — Il blog NVIDIA mostra team dell’azienda che fanno assemblare a GPT-6 Astra, e in un caso a Claude Fable 5, simulazioni con le librerie ovphysx, ovstage, ovrtx e ovui, tra cui gemelli digitali creati o migliorati in circa tre giorni; nessun nuovo prodotto. 🔗 fonte
- La gestione di un negozio Shopify — Una volta collegato il negozio, Grok Bot può verificare gli ordini, monitorare le scorte e tenere aggiornate le schede prodotto; non vengono specificati né piani né limiti. 🔗 fonte
- La ricerca su X — Notizia del 7 ottobre ripresa ora: Grok Bot può cercare, leggere e monitorare X per tutti gli utenti, senza configurare il connettore X, per esempio per seguire i riscontri su un prodotto o ricevere una sintesi settimanale del proprio settore; a fine agosto era ancora necessario collegare il proprio account. 🔗 fonte
- Grokipedia v0.3 — Secondo il suo account ufficiale, l’enciclopedia scritta da Grok ha pubblicato in una settimana oltre 4 400 articoli richiesti dai lettori ed effettuato più di 2 200 modifiche al giorno, con 78 fonti in media per nuovo articolo; una pagina mostra ora le sue modifiche in diretta. 🔗 fonte
- La CLI mistral 0.8.0 —
mistral apps deploydistribuisce anche i worker dei workflow e tutti i moduli contemporaneamente, anche nell’integrazione continua con una semplice chiave API, emistral apps devavvia un database Postgres locale in Docker; in compenso, il.envdella directory corrente non viene più letto. 🔗 fonte - L’SDK Python di Mistral 3.2.0 — Le chiamate di chat e degli agenti accettano le probabilità logaritmiche (logprobs), sia sulla risposta sia sul prompt, oltre a
top_k, una penalità di ripetizione e un numero minimo di token; versione generata automaticamente, senza annuncio. 🔗 fonte - Qwen Code v0.25.1-preview.1 — Seconda versione preliminare della v0.25.1 in tre giorni, con 16 nuove funzionalità e 27 nuove correzioni, tra cui una collaborazione multi-agente incentrata sulla sessione e hook PreToolUse che modificano l’input di uno strumento con riconvalida completa; la versione stabile non è ancora uscita. 🔗 fonte
- Claude Haiku 5.5 nell’Agent API di Perplexity — Notizia del 7 ottobre ripresa ora: l’Agent API accetta
anthropic/claude-haiku-5-5alla tariffa di Anthropic, 0,10 dollari per milione di token in input e 0,50 in output fino a 100 000 token di input, poi 0,50 e 2,50 oltre tale soglia. 🔗 fonte - Inferenza condivisa o dedicata — Una guida di Cohere per Embed e Rerank sostiene che la forma delle richieste conta più del loro numero e calcola soglie di convenienza illustrative rispetto a un’istanza dedicata con una GPU NVIDIA A10: circa 4 richieste al minuto per documenti lunghi, 20 per un catalogo, 29 per il riordinamento (reranking). 🔗 fonte
- Agente o MCP — Perplexity pubblica una guida che distingue l’agente, che decide, da MCP, che lo collega agli strumenti, con una tabella per orientare la scelta, l’esempio di un negozio online e quattro rischi con le relative misure di protezione; secondo la guida, Claude, ChatGPT o Cursor possono affidare un compito a Computer tramite il server MCP di Perplexity. 🔗 fonte
Cosa significa
Un agente ne orchestra ormai molti altri, e ciascuno riceve un’identità. L’agente Gemini avvia sottoagenti dotati ciascuno della propria e può diventare un agente collega con un proprio indirizzo; Claude Managed Agents consente a un agente di scrivere un programma che ne avvia fino a 1 000; Grok Bot riceve un indirizzo e-mail per agire all’esterno, e Block affida a Claude Fable la direzione di decine di modelli nella stessa migrazione. La domanda che si impone non è più se l’agente sia capace di svolgere un compito, ma come tenerlo sotto controllo. Google risponde con Agent Gateway, Agent Sandbox, un registro di audit intestato a ciascun agente e limiti di spesa in tempo reale; Anthropic con un budget di sessione che sospende tutte le esecuzioni una volta raggiunto; OpenAI con un ambiente sandbox Windows più restrittivo per la rete e i file.
L’approccio multimodello si afferma nelle piattaforme stesse. Google, che sviluppa Gemini, fa orchestrare modelli Claude dal proprio agente, separa esplicitamente la scelta del modello da quella dell’agente e rende disponibili Claude Opus 5.5 e Sonnet 5.5 in Antigravity, fatturati entro lo stesso limite di spesa dei suoi modelli. Genspark e l’Agent API di Perplexity aggiungono Claude Haiku 5.5 nei giorni successivi al suo lancio, LegalOn distribuisce il lavoro di programmazione tra tre modelli di OpenAI in base alla natura dei compiti, e Block costruisce un selettore automatico di modelli.
Il costo unitario continua a diminuire, e ogni annuncio lo quantifica: 0,016 dollari per immagine per Qwen-Image-2.1-Turbo, 2,5 volte meno della versione Pro; 15 dollari per milione di caratteri per HeyGen Voice fino al 31 ottobre, poi 30, meno di Eleven v4 Turbo; 0,017 dollari per 1 000 decisioni per pplx-decider-v1.1-27b; sei modelli pubblicati sull’Hub con circa 103 dollari di calcolo tramite ML Intern. I primi posti richiedono invece una lettura attenta: HeyGen Voice è primo solo nella classifica con voci controllate, e pplx-decider condivide la sua posizione con altri nove modelli i cui intervalli di confidenza si sovrappongono.
In ambito sanitario, la prudenza resta d’obbligo. Lo studio su AMIE pubblicato su The Lancet è uno studio di fattibilità, condotto in un unico centro, senza gruppo di controllo e finanziato da Alphabet: 98 pazienti, nessuna conversazione interrotta per motivi di sicurezza, un’allucinazione rilevata. È un passo verso sperimentazioni più ampie, richieste dagli stessi autori, non un’autorizzazione né un impiego con i pazienti.
Fonti
- Gemini at Work 2026 (blog Google Cloud)
- Note di rilascio di Gemini Enterprise
- Annuncio di HeyGen Voice (@HeyGen)
- Risultati di Artificial Analysis (@ArtificialAnlys)
- Voxtral Mini 4B Realtime Arabic (Hugging Face)
- LIDstral Arabic (Hugging Face)
- Workflow dinamici di Claude Managed Agents (@ClaudeDevs)
- Documentazione delle esecuzioni dei workflow (Claude Platform)
- Previsioni del compositore in Codex (@OpenAIDevs)
- Articolo di assistenza sulle previsioni del compositore (OpenAI)
- Sandbox MXC per Codex su Windows (@OpenAIDevs)
- Documentazione della sandbox Windows (ChatGPT Learn)
- Claude Code 2.1.296 (GitHub)
- Vibe CLI 2.26.1 (GitHub)
- Qwen-Image-2.1-Turbo (@Alibaba_Qwen)
- Qwen-Image-2.1-Turbo (Hugging Face)
- Changelog alpha di Midjourney
- Test della modalità Thinking (Midjourney)
- Syren (Synthesia)
- Playground (blog Google)
- Studio clinico su AMIE (blog Google)
- Studio su AMIE pubblicato su The Lancet
- Nota dei responsabili della ricerca di OpenAI (@OpenAINewsroom)
- Sei modelli con ML Intern (blog Hugging Face)
- Scheduler GPU di Ai2 (blog Ai2)
- pplx-decider-v1.1-27b su Decision Bench (@perplexitydevs)
- Classifica Decision Bench
- Indirizzo e-mail di Grok Bot (@bot)
- ElevenLabs a Singapore (blog ElevenLabs)
- Projects in Claude Code (@ClaudeDevs)
- Creare automazioni efficaci con gli agenti (claude.dev)
- Block e Claude Fable (claude.com)
- Note di rilascio della Claude Platform
- Codex CLI 0.162.1 (GitHub)
- Note di rilascio di ChatGPT Enterprise ed Edu
- Sophos e OpenAI Daybreak (OpenAI)
- Asana e l’agente di navigazione di StackAI (OpenAI)
- LegalOn e Codex (OpenAI)
- Gemini CLI v0.64.0-preview.1 (GitHub)
- Changelog di Antigravity
- Note di rilascio dell’API Gemini
- Plugin di Google Flow Music (blog Google)
- Google Earth AI e la salute pubblica (blog Google)
- Fatturazione di Copilot code review (changelog GitHub)
- Copilot CLI 1.0.95 (GitHub)
- GitHub MCP Server 2.0.0 (GitHub)
- Claude Haiku 5.5 in Genspark (@genspark_ai)
- Modello Meta VR per v0 (Meta)
- v0 per i team (@v0)
- DeepSeek Harness 0.2.1-alpha.2 (GitHub)
- OGX 1.5.0 (GitHub)
- GenIA (GitHub)
- Modelli decisionali sull’Hub (changelog Hugging Face)
- Darwin-27B-ZTC-v2 e il System One Mosaic Benchmark (blog Hugging Face)
- La confidenza dei modelli decisionali (blog Hugging Face)
- FineEnvs/openai-math (Hugging Face)
- Rapporto tecnico di JOSIE-2 (blog Hugging Face)
- Gradio 6.30.0 (GitHub)
- tokenizers 0.23.3 (GitHub)
- Revisione scientifica tramite l’IA (@SakanaAILabs)
- Aggiornamento di Suno Studio (@suno)
- L’ultimo esame di fisica dei World Models (Einsia)
- Simulazioni Omniverse create da agenti (blog NVIDIA)
- Grok Bot e Shopify (@bot)
- Grok Bot e la ricerca su X (@bot)
- Bilancio di Grokipedia v0.3 (@Grokipedia)
- CLI mistral 0.8.0 (GitHub)
- SDK Python di Mistral 3.2.0 (GitHub)
- Qwen Code v0.25.1-preview.1 (GitHub)
- Modelli dell’Agent API (Perplexity)
- Inferenza condivisa o dedicata per Embed e Rerank (blog Cohere)
- Agente o MCP (blog Perplexity)