Cerca

Claude Platform in disponibilità generale, GitHub Copilot arriva in Slack, DeepSeek lancia un modello multimodale

ai-powered-markdown-translator

Articolo tradotto dal fr al it con gpt-5.4-mini.

Vedi progetto su GitHub ↗

Giornata intensa per i mattoni di infrastruttura agentica: Anthropic porta computer use, il browser tool, la Skills API e la Files API dalla beta alla disponibilità generale su Claude Platform, mentre GitHub Copilot si installa in Slack e Microsoft Teams. Sul fronte dei modelli, DeepSeek pubblica il suo primo modello multimodale e Pika Labs lancia un sintetizzatore vocale che rivendica un rapporto qualità/prezzo senza precedenti. Nel mezzo, un enorme set di dati egocentrico, uno studio sui bias dei benchmark nel riconoscimento vocale e una decina di aggiornamenti notevoli presso Google DeepMind, GitHub, Z.ai, Qwen, Harvey e gli strumenti di generazione video/audio.


Claude Platform: computer use, browser tool, Skills API e Files API in disponibilità generale

20 agosto — Anthropic annuncia il passaggio in disponibilità generale di quattro elementi per costruire agenti su Claude Platform: computer use, il browser tool, la Skills API e la Files API. L’obiettivo dichiarato è ridurre il numero di andata e ritorno necessari per automatizzare un’attività in un’applicazione che non dispone di API, e consentire di costruire Claude Managed Agents su skills versionate e file riutilizzabili.

Il nuovo computer_toolset_20260801 consente a Claude di concatenare più azioni per turno (clic, inserimento, tasto della tastiera, acquisizione dello schermo) invece di un andata e ritorno per singola azione isolata. Anthropic indica che i clienti in accesso anticipato hanno osservato dal 20 al 40 % di andata e ritorno in meno per attività. Il browser tool si evolve in parallelo con browser_toolset_20260801: invece di puntare su pixel — fragile al minimo cambiamento di layout — Claude riceve ora la struttura della pagina e può agire su riferimenti di elementi.

Sul fronte API, la Skills API permette di caricare la procedura di un team una sola volta, versionarla e fissarla a un version_id preciso o a latest. La Files API ottiene un parametro expires_in_seconds, un limite di velocità 5 volte più alto (500 richieste al minuto) e una quota di 1 To per organizzazione. Anthropic ha anche pubblicato un adattatore AG-UI per i Managed Agents, che mappa ogni thread di conversazione su una sessione gestita e trasmette testo, chiamate agli strumenti e ragionamento verso l’interfaccia.

ElementoNovità del giorno
Computer usecomputer_toolset_20260801, fino a -40% di andata e ritorno per attività
Browser toolbrowser_toolset_20260801, targeting tramite riferimento all’elemento di pagina
Skills APIVersionamento, fissaggio a version_id o latest
Files API500 richieste/minuto (x5), quota di 1 To per organizzazione

🔗 Annuncio Claude Platform


GitHub Copilot arriva in Slack e Microsoft Teams

21 agosto — GitHub Copilot debutta in anteprima pubblica su Slack e Microsoft Teams. Il principio è identico in entrambi i casi: menzionare @GitHub in un messaggio diretto, un canale o un thread apre una sessione di agente cloud capace di rispondere a domande sul codice e sull’attività GitHub, ordinare segnalazioni di bug, indagare su errori, implementare modifiche in una sandbox cloud sicura e poi aprire pull request con un link alla conversazione originale.

Su Slack, l’integrazione si appoggia a Slack Code, la nuova offerta agentica di Slack lanciata lo stesso weekend: GitHub Copilot può aprire canali di codice dedicati dove il team consulta i diff e ispeziona anteprime di rendering senza inquinare la conversazione originale. Su Teams, una discussione si trasforma in una sessione di agente collettiva che tutti possono seguire e orientare; il lavoro prosegue in modo asincrono nella sandbox cloud mentre il team fa altro.

Disponibilità riservata alle organizzazioni con piano Copilot Business o Enterprise. L’amministratore attiva la policy di agente cloud Copilot e installa l’app per Slack o Teams; gli amministratori del repository possono richiedere un’approvazione prima dell’unione delle pull request generate dall’agente. L’uso consuma crediti IA e la sandbox cloud viene fatturata separatamente con budget configurabili.

🔗 GitHub Copilot in Slack · 🔗 GitHub Copilot in Teams


DeepSeek-V4-Flash-Vision-Exp: primo modello multimodale di DeepSeek sull’API

21 agosto — DeepSeek mette online DeepSeek-V4-Flash-Vision-Exp, un modello multimodale sperimentale disponibile con l’identificatore deepseek-v4-flash-vision-exp. Sulle capacità puramente testuali — agenti, ragionamento, conoscenza del mondo — il modello eguaglia DeepSeek-V4-Flash. La novità è altrove: nei benchmark di agenti multimodali, DeepSeek annuncia un salto netto rispetto a V4-Flash, con prestazioni che si avvicinano a Opus-4.8.

Il supporto multimodale lato API è completo: input misto testo + immagine (base64, URL esterno o tramite una nuova Files API gratuita lanciata lo stesso giorno), compatibile con i tre formati esistenti (Chat Completions, Messages, Responses). Il prezzo segue la griglia V4-Flash, con una tokenizzazione delle immagini limitata a 384 token per immagine. La Files API consente di caricare un’immagine una sola volta e referenziarla con file_id, un guadagno di banda per gli usi agentici ripetitivi. DeepSeek Harness 0.1.1, il harness di agente open source lanciato il 13 agosto, è stato aggiornato lo stesso giorno per supportare nativamente il nuovo modello.

ElementoDettaglio
Modellodeepseek-v4-flash-vision-exp
Capacità testualiParità con DeepSeek-V4-Flash
Capacità multimodaliVicine a Opus-4.8 nei benchmark di agenti multimodali
Prezzo immagineFino a 384 token/immagine, prezzo V4-Flash
API supportateChat Completions, Messages, Responses
HarnessDeepSeek Harness 0.1.1 (supporto nativo)

DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.

🇮🇹 DeepSeek-V4-Flash-Vision-Exp è ora disponibile sulla piattaforma API DeepSeek! Questo modello multimodale sperimentale eguaglia DeepSeek-V4-Flash nelle capacità testuali — inclusi agenti, ragionamento e conoscenza del mondo. Nei benchmark di agenti multimodali, V4-Flash-Vision-Exp fa un balzo importante rispetto a V4-Flash, avvicinando le prestazioni degli agenti multimodali a quelle di Opus-4.8.@deepseek_ai su X


Pika Speech: sintesi vocale 3B a 1,2 secondi al minuto, fino a 9x meno costosa di ElevenLabs v3

21 agosto — Pika Labs amplia la sua gamma Pika Audio con Pika Speech, un modello di sintesi vocale da 3 miliardi di parametri. L’argomento principale è la velocità: un fattore tempo reale (RTF) di 0,02, cioè un minuto di parlato 48 kHz di qualità studio generato in circa 1,2 secondi in test locali in forma estesa, con richieste possibili fino a cinque minuti di parlato continuo.

Sul controllo del ritmo, Pika Speech innova: invece di allungare o comprimere l’audio a posteriori — il metodo standard nella maggior parte dei sistemi TTS — il modello controlla ritmo e durata direttamente grazie a un « latent di fine del parlato » (EOS latent), un’ancora collocata sull’immagine finale target. Spostare questa ancora più avanti comprime il ritmo; spostarla più tardi lascia respirare il testo. Sul lato architetturale, il team combina flow matching e distillazione tramite allineamento della distribuzione, FlashAttention-3 e un « token packing » che fa sì che cinque segmenti di frase costino circa due volte il prezzo di uno solo invece di cinque volte.

Sui costi, Pika rivendica un vantaggio che può arrivare a 9x rispetto a ElevenLabs v3, 4,5x rispetto a Cartesia e ElevenLabs Turbo, e 2x rispetto a Fish Audio — senza dettagliare la metodologia esatta oltre a questi rapporti. Il modello è accessibile tramite il Pika API Club.

Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02. […] Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes it up to 9× more cost-efficient than ElevenLabs v3, 4.5× than Cartesia and ElevenLabs Turbo, and 2× than Fish Audio.

🇮🇹 Parliamo di Pika Speech, un modello di sintesi vocale da 3 miliardi di parametri con un fattore tempo reale di 0,02. […] Pika Speech genera un minuto di parlato 48 kHz di qualità studio in circa 1,2 secondi — e supporta richieste fino a cinque minuti. Questa efficienza lo rende fino a 9 volte più conveniente di ElevenLabs v3, 4,5 volte più di Cartesia e ElevenLabs Turbo, e 2 volte più di Fish Audio.@pika_labs su X

🔗 Dettaglio architetturale


EgoSuite-Open100K: il più grande set di dati egocentrico umano aperto

21 agosto — Lightwheel AI, in collaborazione con Hugging Face, open-source EgoSuite-Open100K, presentato come il più grande set di dati egocentrico umano completamente annotato mai pubblicato in accesso libero. L’obiettivo dichiarato è 100.000 ore di dati umani in prima persona; le prime 10.000 ore sono già disponibili, il resto viene pubblicato per fasi.

Il set di dati copre più di 15.000 attività distribuite su oltre 15.000 scene reali — cucine, camere da letto, magazzini, linee di assemblaggio — raggruppate in 7 categorie di ambienti e 128 tipi di scene. Ogni sequenza è annotata con posa della mano, posa del corpo e semantica a livello di sottoattività, e una parte del corpus dispone inoltre di copertura da telecamera al polso. Punto notevole sul fronte licenza: a differenza di molti dataset di ricerca, EgoSuite-Open100K è licenziato per l’addestramento commerciale, non solo accademico.

Il dataset viene presentato dai suoi creatori come il primo mattone pubblico di un’infrastruttura dati più ampia per la “Physical AI” (robotica e IA incarnata) — l’idea che la scalabilità dei modelli fisici dipenda ormai dall’accesso a dati umani massicci e condivisi.

🔗 Annuncio Lightwheel AI · 🔗 Rilancio Hugging Face


Claude Security passa su Claude Mythos 5

21 agosto — Anthropic esegue Claude Security, il suo strumento di scansione delle vulnerabilità, su Claude Mythos 5, in beta pubblica per tutti i clienti Claude Enterprise. L’argomento: beneficiare del modello di sicurezza più capace di Anthropic sul proprio codebase senza accesso separato al modello — le scansioni sono fatturate come utilizzo di token standard sul piano esistente.

In pratica, lo strumento si collega a un repository GitHub e Mythos 5 analizza il codice tracciando il flusso dei dati tra i file e ragionando sulle interazioni tra componenti. Ogni risultato torna con una categoria CWE, un livello di confidenza, una valutazione della severità e una correzione suggerita, che si apre direttamente in Claude Code sul web. Anthropic approfitta dell’occasione per lanciare un Defender Advantage Fund dotato di 35 milioni di dollari di crediti per la sicurezza open source, e prevede di estendere il proprio Cyber Verification Program nelle prossime settimane.

🔗 Annuncio Claude Security


Tariffazione GPT-5.6 Sol: OpenAI abbassa i prezzi API, GitHub Copilot segue

21 agosto — OpenAI riduce di oltre il 20 % i prezzi API e i crediti di GPT-5.6 Sol per i prossimi tre mesi. La misura è già attiva sul fronte API e viene distribuita in Codex e ChatGPT Work nel corso della giornata. Per gli utenti Codex sui piani a consumo (token-based), i crediti acquistati ora durano di più; l’uso incluso negli abbonamenti Pro, Plus e Business, invece, resta invariato — il taglio avvantaggia quindi soprattutto gli sviluppatori API e gli utenti fatturati a token.

GPT-5.6 Sol a -50% in GitHub Copilot

In parallelo, GitHub rilancia una promozione distinta: -50 % su GPT-5.6 Sol in GitHub Copilot fino al 3 settembre, utilizzabile nell’app, nella CLI e nell’IDE. Si tratta di uno sconto una tantum lato Copilot, da non confondere con il ribasso tariffario permanente di OpenAI descritto sopra — due aziende diverse, due meccanismi distinti sullo stesso modello.

🔗 Riduzione tariffaria OpenAI · 🔗 Promo GitHub Copilot


GLM-5.3 (Max) sale su Code Arena: WebDev

20 agosto — LMArena indica che GLM-5.3 (Max) di Z.ai ha spostato la frontiera di Pareto (rapporto qualità/costo) della classifica Code Arena: WebDev, dedicata alla valutazione dei modelli su attività di sviluppo web. Con 1597 punti, il modello si posizionerebbe 2º tra i modelli a pesi aperti (una volta pubblicati) e 8º in assoluto.

ModelloPrezzo ($/M token)Punti Code Arena: WebDev
GLM-5.3 (Max)$3,651597
Qwen3.8 (Max)$5,00
Gemini-3.7-flash-high$2,86punteggio inferiore
DeepSeek-v4-flash-high$1,10punteggio inferiore

A $3,65 per milione di token, GLM-5.3 (Max) resta in una fascia di prezzo paragonabile a Qwen3.8 (Max) pur superando Gemini-3.7-flash-high e DeepSeek-v4-flash-high in questa classifica — un nuovo segnale della competitività di Z.ai nello sviluppo web agentico, in aggiunta ai risultati già noti su Terminal-Bench e sulla Agent Arena generale.

🔗 Annuncio LMArena


Harvey lancia Tenet, un modello giuridico costruito su Kimi K3

20 agosto — Harvey presenta Tenet, il suo primo modello post-addestrato per il diritto, a partire da una base Kimi K3 (Moonshot AI) post-addestrata con Fireworks AI su un corpus di dati legali pubblici, dati sintetici e dati di esperti umani che simulano lavoro giuridico di lunga durata.

Harvey annuncia che questo post-addestramento aumenta il tasso di successo completo di Tenet dell’82 % sul benchmark LAB e del 22 % su LAB Contracts, rispetto al Kimi K3 di base — con lo stato dell’arte su LAB Contracts e il 2º posto su LAB nel suo insieme. Il costo operativo di Tenet sarebbe inferiore a un quarto di quello dei modelli di fondazione più performanti del mercato. In aggiunta, Harvey ha addestrato tre sottagenti specialisti: due diligence M&A, revisione di tabelle e conoscenza dello studio.

🔗 Annuncio Harvey


Georgia Tech traccia le origini del ragionamento sociale di Olmo 3

21 agosto — Un team di Georgia Tech ha sfruttato il fatto che la pila Olmo 3 di Ai2 è completamente aperta — pesi, corpus di pre-addestramento Dolma 3 (1,26 miliardi di documenti), infrastruttura — per mettere in relazione in modo statistico capacità del modello con i testi che le hanno prodotte, un esperimento impossibile su un modello chiuso.

Il metodo si basa su funzioni di influenza, applicate a circa 5,68 milioni di documenti campionati in Dolma 3. Risultato principale: i testi ricchi di dialoghi e scrittura interpersonale incidono di più sulle prestazioni nel ragionamento sociale che sulle conoscenze fattuali — e rimuovendo i documenti letterari più influenti, le prestazioni sul benchmark SocialIQA sono calate in modo significativo, confermando la causalità.

🔗 Articolo Ai2


Bias di «benchmark optimization» rilevato nei modelli ASR open source

21 agosto — Un team di Hume AI pubblica sul blog di Hugging Face uno studio su un bias metodologico nel riconoscimento vocale: alcuni modelli sembrerebbero ottimizzati per riprodurre le trascrizioni di riferimento dei benchmark pubblici piuttosto che per trascrivere fedelmente l’audio.

Su 11 modelli ASR open source testati, circa il 40 % dei segmenti VoxPopuli analizzati conterrebbe errori nelle loro reference, e 6 modelli su 11 riproducevano questi errori invece di trascrivere correttamente l’audio. Su LibriSpeech, i tassi di recupero dei numeri mascherati raggiungevano il 30-40 %, segno che alcuni modelli «riempiono» il testo invece di ascoltarlo. La conclusione raccomanda l’uso di set di valutazione tenuti segreti e una separazione più rigorosa tra dati di addestramento e di test.

🔗 Studio Hugging Face


SenseNova-U1.5-8B-MoT : modello di immagini aperto senza VAE né DiT

21 agosto — SenseNova pubblica in pesi aperti un modello di generazione di immagini le cui prestazioni dichiarate sarebbero comparabili a Nano Banana 2. L’interesse tecnico sta nell’architettura: niente VAE, niente encoder di testo separato, niente DiT — il modello si basa su una «mixture of transformers», in cui i token di testo e immagine usano pesi distinti e si attendono a vicenda, con la denoising effettuata direttamente nello spazio dei pixel invece che in uno spazio latente compresso.

Questo approccio si discosta dallo stack standard dei modelli di diffusione text-to-image, e l’apertura dei pesi permetterà alla comunità di verificare in modo indipendente i confronti di prestazioni dichiarati.

🔗 Annuncio SenseNova


Diffusers 0.40.0 : Modular Diffusers esce dallo stato sperimentale

21 agosto — Hugging Face pubblica Diffusers 0.40.0. Il cambiamento più strutturante è l’uscita dallo stato sperimentale per Modular Diffusers, il sistema di pipeline modulari della libreria. La versione aggiunge l’integrazione di diversi modelli aperti recenti (LTX2.5, MiniMax H3, MiniMax Music 3, Wan Animate 2), il supporto al parallelismo tensoriale per una selezione di modelli, e due nuovi backend di quantizzazione (SDNQ, Nunchaku-Lite).

🔗 Annuncio Diffusers 0.40.0


Google DeepMind esplora l’IA nei giochi con Fenris Creations

21 agosto — Google DeepMind annuncia una partnership di ricerca con lo studio Fenris Creations, nel proseguimento di 15 anni di lavori che usano i videogiochi come terreno di sperimentazione per l’IA, dalla padronanza di Atari fino al livello Grandmaster su StarCraft II. Dopo SIMA, che ha insegnato ad agenti a comprendere mondi 3D, DeepMind vuole esplorare la navigazione in dinamiche umane reali all’interno di un universo persistente.

La partnership mira a quattro sfide aperte: l’apprendimento continuo (acquisire nuove competenze senza dimenticare le precedenti), sistemi di memoria profonda che vadano ben oltre le finestre di contesto attuali, la pianificazione a lungo orizzonte (settimane, mesi, anni) e le dinamiche multi-agente (cooperazione, negoziazione, economia, comportamenti emergenti). L’obiettivo a lungo termine è duplice: creare nuove esperienze di gioco con gli sviluppatori e riutilizzare questi progressi per problemi del mondo reale e per la scoperta scientifica.

🔗 Annuncio Google DeepMind


Runway Ruby : conversione video SDR verso HDR a 16 bit

21 agosto — Runway lancia Ruby, un modello che converte un video SDR (standard dynamic range) in HDR a 16 bit, con output in sequenze EXR o ProRes/HEVC a 10-12 bit, nello spazio colore BT.2020 con supporto PQ o HLG — gli standard usati nella post-produzione professionale e nel broadcast HDR.

Ruby funziona sia su un video caricato dall’utente sia su un output generato da Runway, con un limite di 30 secondi. La funzionalità è disponibile da subito per i piani Max e Enterprise.

🔗 Annuncio Runway Ruby


NVIDIA AVO rivendica il 100 % sul benchmark ARC-AGI-3

21 agosto — NVIDIA presenta AVO, un agente di codice generalista, con un punteggio del 100 % su ARC-AGI-3, un benchmark di ragionamento interattivo. Secondo NVIDIA, AVO ha completato i 183 livelli distribuiti sui 25 ambienti pubblici del benchmark, senza istruzioni esplicite, regole enunciate né obiettivi formulati in anticipo.

AVO funziona tramite un ciclo continuo di ispezione, pianificazione, implementazione e valutazione, facendo leva su memoria, strumenti e feedback di esecuzione per costruire su ciò che apprende nel tempo — un approccio pensato per mantenere la progressione su compiti lunghi invece di ripartire da zero a ogni nuova finestra di contesto.

🔗 Risultato ARC-AGI-3


HeyGen Look Packs : cambiare abito e sfondo mantenendo il viso

21 agosto — HeyGen lancia Look Packs, una funzionalità che cambia l’abbigliamento e lo sfondo di un video avatar mantenendo fedelmente il viso della persona — l’argomento è che la maggior parte dei modelli generativi modifica anche i tratti del viso quando cambia l’aspetto.

L’uso previsto è la coerenza del brand personale in diversi contesti professionali: immobiliare, legale, fitness, istruzione, benessere. Un creatore di contenuti B2B può così produrre video in abiti e sfondi adatti a ogni settore restando riconoscibile da un video all’altro. Questo annuncio si inserisce nel ritmo sostenuto di HeyGen degli ultimi giorni (Retouch il 20 agosto, Brand Kits e upscale 4K il 18-19 agosto).

🔗 Annuncio Look Packs


Amp lancia Explain Usage per spiegare il consumo di token

21 agosto — Amp aggiunge Explain Usage, una funzionalità che permette di chiedere direttamente a Puck, l’assistente integrato, di analizzare il proprio consumo di token, crediti e dimensione dell’orb. L’utente pone una domanda in linguaggio naturale — «Quali thread hanno consumato più token oggi?» — e Puck legge i dati di utilizzo personali e le metriche per thread per rispondere.

Esistono due punti di ingresso: porre la domanda direttamente a Puck, oppure cliccare sul pulsante dedicato nelle pagine di utilizzo. Per gli utenti che preferiscono i dati grezzi, Amp espone queste informazioni anche via CLI (amp usage --details, amp threads usage <thread-id> --details).

🔗 Explain Usage


v0 (Vercel) aggiunge Vercel Connect per connettersi a oltre 100 servizi

21 agosto — Le app e gli agenti costruiti in v0 possono ora connettersi direttamente a Slack, GitHub, Salesforce e oltre 100 altri servizi di terze parti tramite Vercel Connect, senza che lo sviluppatore debba gestire da solo il flusso di autenticazione.

Il meccanismo si basa su connettori di team riutilizzabili associati a token a breve durata: una volta configurato un connettore lato team, ogni nuova app o agente generato può riutilizzarlo invece di richiedere ogni volta un’autenticazione completa. Questo posiziona v0 come una piattaforma capace di produrre agenti integrati nello stack software di un’azienda, non solo interfacce isolate.

🔗 Vercel Connect


Thread condivisi in Codex e ChatGPT Work

20 agosto — Codex e ChatGPT Work introducono i «thread condivisi»: un link in sola lettura che espone il ragionamento completo di una sessione — percorso, decisioni, contesto — invece di un semplice risultato finale. L’obiettivo è evitare di ricostruire il contesto di una pull request da screenshot sparsi durante una revisione del codice, un’esplorazione tecnica approfondita o un passaggio di consegne tra compagni di team.

È una funzionalità che si inserisce nella continuità degli annunci recenti attorno a ChatGPT Sites (editing multiutente, personalizzazione dell’URL) e rafforza il posizionamento di Codex/ChatGPT Work come strumento di lavoro di squadra.

🔗 Thread condivisi


Sfondi trasparenti in anteprima per GPT-Image-2

20 agosto — L’API GPT-Image-2 permette ora, in anteprima, di generare immagini con sfondo trasparente. L’interesse pratico è produrre asset riutilizzabili — visual di prodotto, elementi di design grafico, mockup di siti web, campagne marketing — che si possono poi collocare su qualsiasi sfondo senza ritocco manuale del ritaglio.

🔗 Sfondi trasparenti


Brevi

  • Zed — Antigravity si installa con un clic dal registro ACP di Zed. 🔗 Tweet
  • trackio 0.36 — Hugging Face pubblica un aggiornamento che aggiunge il supporto a un nuovo tipo di dato loggabile, senza altri dettagli. 🔗 Tweet
  • L’IA «full-stack» secondo Google DeepMind — Paige Bailey scompone l’approccio end-to-end di Google in cinque livelli: infrastruttura, sicurezza, ricerca, modelli/strumenti, prodotti. 🔗 Articolo Google
  • GitHub — migliore gestione degli utenti bloccati: ricerca per nome, ordinamento e paginazione degli elenchi lunghi. 🔗 Changelog
  • GitHub — il fissaggio di viste, progetti e milestone nella barra laterale del repository passa in disponibilità generale, con diversi miglioramenti collegati (avatar delle reazioni, densità della dashboard). 🔗 Changelog
  • Manus prolunga l’accesso gratuito a Manus 1.6 Lite e Manus 1.6 fino al 28 agosto (SGT), entro il limite del quota giornaliera. 🔗 Tweet
  • Manus ricorda agli utenti notificati di salvare i propri dati prima del 23 agosto alle 7:59 (SGT), prima del suo passaggio a impresa indipendente. 🔗 Tweet
  • Genspark lancia una promozione fino al 30 settembre: Design + GenTeam a -90 %, GenMail gratuito, Slides Ultra Mode a -50 %. 🔗 Tweet
  • NVIDIA dettaglia la ripartizione tra l’imbracatura di un agente (ciò che cerca di fare) e l’infrastruttura (ciò che può davvero fare) in un deep dive sulla sicurezza dello stack agentico. 🔗 Tweet
  • NVIDIA pubblica il bilancio dello Spark Hack Series di Seattle su DGX Spark: progetti vincitori in risposta ai disastri, salute e sopravvivenza offline con Nemotron e NemoClaw. 🔗 Tweet
  • NVIDIA Cosmos 3 — un video Cosmos Labs mostra il post-training di Cosmos 3 presso i partner Aigen e Linker Vision. 🔗 Tweet
  • Luma Labs interverrà sugli agenti creativi durante Summer Signal, organizzato con GMI Cloud il 14 settembre. 🔗 Tweet
  • Synthesia — il suo CEO è citato in un articolo Forbes Tech sulla misurazione dell’adozione dell’IA in base ai risultati invece che all’uso. 🔗 Tweet
  • Qwen3.8-27B continua la sua spinta comunitaria: nuove ricette di inferenza NVFP4 + DFlash2 nel cookbook SGLang, versioni alleggerite pubblicate da Unsloth, 1° posto nella classifica dell’agente di codice Cline in quattro giorni, e una DGX Station NVIDIA che riporta oltre 2713 token/secondo di picco aggregato in servizio BF16. 🔗 SGLang · 🔗 Unsloth · 🔗 Cline · 🔗 DGX Station
  • Qwen3.8-Max è ora utilizzabile nello strumento di codice Kilo Code per la generazione di interfacce. 🔗 Tweet
  • Kimi Work pubblica un secondo tutorial per gli analisti finanziari: dashboard per investitori, aggiornamento di modelli finanziari, generazione di report in batch. 🔗 Tweet
  • GLM-5.3 continua la sua avanzata: punteggio di 69 nella classifica ufficiale DeepSWE, disponibilità sulla piattaforma WorkBuddy, e proroga di Build Week da parte di Z.ai fino al 23 agosto alle 18:00 (PT) con 100 milioni di token gratuiti per i primi 50 000 nuovi iscritti ZCode. 🔗 DeepSWE · 🔗 WorkBuddy · 🔗 Build Week
  • GPT-5.6 Sol — tre piattaforme di terze parti (Router, Cloudflare AI Gateway, OpenCode Zen) offrono ciascuna -50 % fino a metà settembre, oltre agli sconti già coperti su Devin, OpenRouter e v0. 🔗 Cloudflare AI Gateway

Cosa significa

L’annuncio Anthropic-GitHub di oggi disegna una tendenza di fondo: l’infrastruttura agentica esce dalla fase sperimentale. La GA di computer use e del browser tool sulla Claude Platform, combinata con l’arrivo di Copilot in Slack e Teams, segnala che i grandi fornitori non si limitano più a vendere modelli — vendono agenti capaci di agire negli strumenti che i team usano già ogni giorno, senza passare ogni volta per un’integrazione API dedicata. È un cambiamento di distribuzione tanto quanto di capacità: l’agente va ormai dove si svolge il lavoro, invece di richiedere che il lavoro venga da lui.

Sul fronte dei modelli, DeepSeek-V4-Flash-Vision-Exp conferma che il multimodale sta diventando uno standard atteso più che un fattore distintivo — anche gli attori orientati all’efficienza economica (V4-Flash) lo integrano ormai nativamente, con prestazioni che si avvicinano ai migliori modelli chiusi. La competizione sui benchmark agentici di codice (GLM-5.3 su Code Arena: WebDev, Qwen3.8-27B su Cline) illustra la stessa dinamica sul versante degli strumenti di sviluppo: i divari di prezzo tra modelli aperti e chiusi si stanno riducendo, il che spinge OpenAI ad abbassare i prezzi API di oltre il 20 % su GPT-5.6 Sol di conseguenza.

Il movimento verso l’apertura totale — non solo dei pesi, ma anche dei dati e dell’infrastruttura di addestramento — continua a dare frutti scientifici: lo studio di Georgia Tech su Olmo 3 semplicemente non sarebbe stato possibile su un modello chiuso, così come lo studio Hume AI sui bias di benchmark ASR ricorda che un punteggio da leaderboard non garantisce una qualità reale di trascrizione. Sono due richiami utili nel momento in cui il settore moltiplica gli annunci di punteggi record.

Infine, la moltiplicazione di dataset massicci con licenza commerciale — EgoSuite-Open100K oggi, dopo diversi annunci simili nelle ultime settimane — conferma che l’accesso a dati umani reali, non solo sintetici, sta diventando una posta strategica per la robotica e l’IA incarnata, allo stesso titolo del calcolo per i grandi modelli linguistici.


Fonti