Căutare

Google Cloud lansează agentul său Gemini pentru muncă, HeyGen Voice și workflow-urile dinamice din Claude Managed Agents

ai-powered-markdown-translator

Articol tradus din fr în ro cu gpt-6.1-sol.

Vezi proiectul pe GitHub ↗

Google Cloud a prezentat pe 8 octombrie, la Gemini at Work 2026, agentul Gemini: un singur agent pentru întreaga activitate din companii, care rulează continuu în cloud și orchestrează atât modelele Gemini, cât și modelele Claude. HeyGen lansează, la rândul său, HeyGen Voice, primul său model vocal dezvoltat intern, care ocupă primul loc în clasamentul Controlled Voice de la Artificial Analysis, în timp ce Anthropic introduce în Claude Managed Agents workflow-uri capabile să lanseze până la 1 000 de agenți per execuție. În domeniul programării, Codex învață să prezică următorul mesaj al utilizatorului și adoptă pe Windows un nou sandbox bazat pe Microsoft Execution Containers.


Google Cloud lansează agentul Gemini, un singur agent pentru întreaga activitate

8 octombrie — La Gemini at Work 2026, Google Cloud a prezentat agentul Gemini, pe care îl descrie ca pe un agent unic și universal pentru muncă. Dintr-un singur câmp de introducere și printr-un singur API, acesta răspunde la întrebări, se ocupă de munca intelectuală, creează imagini și conținut media, scrie și execută cod. Ideea susținută de Thomas Kurian, CEO al Google Cloud: îi încredințezi un obiectiv în locul unei serii de instrucțiuni.

Agentul rulează continuu în cloud, cu o singură memorie, și este disponibil peste tot: web, iOS, Android, Windows, Mac, linie de comandă, Google Workspace, Microsoft 365 și Slack, sau fără interfață (headless) în aplicații terțe. O sarcină de mai multe ore sau zile continuă cu calculatorul închis. Pentru lucrările îndelungate, creează subagenți temporari, fiecare cu propria identitate, și poate deveni un agent coleg (coworker agent) cu rol permanent, cu propria adresă @agents.company.com și propriul spațiu de stocare. Modelul devine o alegere separată: potrivit Google, agentul orchestrează deja modelele Gemini și modelele Claude de la Anthropic, urmând să fie adăugate și alte modele private și deschise. Variante sectoriale devin disponibile în versiune preliminară pentru finanțe (peste 50 de skills de bază, deja utilizate de CME Group și Deutsche Bank) și domeniul juridic.

Componentă de control anunțatăRol descris de Google
Identitatea fiecărui agentIdentitate atestată criptografic, permisiuni în funcție de rol, jurnal de audit în numele său
Agent SandboxExecuție izolată, cu propria limită de rețea
Agent GatewayFirewall de rețea pentru AI, prin care trece tot traficul agentului
Plafoane de cheltuieli în timp realÎn Cloud Billing, agentul proiectului este pus pe pauză, reluare cu un clic

Google Cloud prezintă și propriile cifre: aproape 500 de clienți au procesat fiecare peste 1 000 de miliarde de tokens într-un an, iar aproape 90 % dintre companiile Fortune 100 folosesc Gemini Enterprise. Articolul nu precizează însă nici data disponibilității, nici prețul agentului în sine; Google Cloud menționează doar clienți mari care l-au testat în avanpremieră, precum marca sportivă On, pentru alegerea dinamică a modelului.

🔗 Gemini at Work 2026 (blogul Google Cloud)

Gemini Enterprise permite utilizarea Claude Opus 5.5 și Claude Sonnet 5.5 în instrumentele Antigravity

8 octombrie — În aceeași zi, notele de versiune pentru Gemini Enterprise le permit administratorilor să activeze Claude Opus 5.5 și Claude Sonnet 5.5 în Antigravity 2.0, Antigravity CLI și extensiile Antigravity pentru IDE. Administratorul acceptă condițiile lor de utilizare direct în consola Google Cloud, fără un cont Anthropic separat.

Parametru de activareValoare indicată de Google
Stare implicităModele terțe dezactivate, activare de către administratori
Mod de facturareÎn funcție de consum, în limita plafonului de cheltuieli al proiectului
Locații de inferențăglobal, us și eu
Niveluri de raționamentLow, Medium (implicit), High sau Max

Dezvoltatorul își păstrează licența Gemini Enterprise și alege Claude în selectorul de modele. Depășirile (overages) trebuie activate înainte de a accesa un model terț, al cărui cost intră în plafonul comun tuturor modelelor. Aceeași pagină anunță disponibilitatea generală a Gemini 3.8 Flash în Singapore.

🔗 Notele de versiune pentru Gemini Enterprise


Voce: HeyGen Voice pe primul loc în clasamentul Controlled Voice, Mistral publică două modele pentru arabă

9 octombrie — HeyGen lansează HeyGen Voice, pe care Joshua Xu îl prezintă ca fiind primul model vocal dezvoltat intern de compania cunoscută până acum pentru avatarurile sale. Modelul este disponibil în HeyGen și prin API, la 30 de dolari per milion de caractere; până pe 31 octombrie, utilizatorii API plătesc 15 dolari, reducerea fiind aplicată automat.

Argumentul vine de la Artificial Analysis, care și-a publicat rezultatele cu un minut și jumătate înainte de HeyGen. În clasamentul său Controlled Voice, unde toate modelele vorbesc cu aceleași 8 voci clonate, în engleză americană și britanică, HeyGen Voice ocupă primul loc cu un Elo de 1 201 din 1 468 de apariții. Este pe primul loc în categoriile Asistenți și Serviciul clienți, precum și în engleză britanică.

HeyGen Voice takes the #1 spot on the Artificial Analysis Controlled Voice TTS Arena Leaderboard, ahead of Alibaba’s Qwen-Audio-3.1-TTS-Plus and ElevenLabs’ Eleven v4 Turbo

🇷🇴 HeyGen Voice ocupă primul loc în clasamentul Controlled Voice TTS Arena de la Artificial Analysis, înaintea Qwen-Audio-3.1-TTS-Plus de la Alibaba și Eleven v4 Turbo de la ElevenLabs. — @ArtificialAnlys pe X

Model evaluatElo Controlled Voice (9 octombrie)Preț API per milion de caractere
HeyGen Voice1 20130 de dolari (15 până pe 31 octombrie)
Qwen-Audio-3.1-TTS-Plus1 18219,3 dolari
Eleven v4 Turbo1 16640 de dolari
Eleven v41 16280 de dolari

Acest prim loc are un domeniu precis: se referă la clonarea vocilor. În clasamentul Provider Voice, unde fiecare furnizor își folosește propriile voci, Eleven v4 Turbo și Eleven v4 rămâneau în frunte în seara de 9 octombrie, fără ca HeyGen Voice să se numere printre primele opt. La robustețea pronunției, HeyGen Voice obține 83,1 %, adică locul 10 din 29.

În API, clonarea este instantanee: o singură înregistrare, din care sunt folosite doar primele trei minute, oferă o voce activă în câteva secunde, fără antrenare. Sinteza se face integral (fișier WAV la 44,1 kHz) sau în streaming, iar Artificial Analysis a evaluat setările implicite ale API.

🔗 Anunțul HeyGen

Voxtral Mini 4B Realtime Arabic și LIDstral Arabic: două modele Mistral pentru arabă

8 octombrie — Mistral a publicat pe Hugging Face, fără un anunț, două modele deschise sub licența Apache 2.0 dedicate limbii arabe. Voxtral Mini 4B Realtime Arabic transcrie în streaming dialectele arabe și araba standard modernă, inclusiv atunci când vorbitorii schimbă limba în timpul conversației (code-switching). Ajustat pornind de la Voxtral Mini 4B Realtime, acesta are aproximativ 4,4 miliarde de parametri. Potrivit fișei sale, a fost dezvoltat împreună cu Ministerul marocan al Tranziției Digitale și al Reformei Administrative, în cadrul parteneriatului semnat între Mistral și Maroc în ianuarie 2026, care a produs și două noi benchmarks, ISMA și Darija in the Wild.

Model publicatFuncția modeluluiRezultat potrivit fișei
Voxtral Mini 4B Realtime ArabicTranscriere în streaming a limbii arabeRată medie de eroare per caracter de 8,82 % pe 7 benchmarks la 480 ms, față de 7,91 % pentru Voxtral Transcribe Arabic
LIDstral ArabicIdentificarea limbii și a dialectului, 51 de clase, pe procesorF1 de 88,67 % pentru darija marocană, față de 71,28 % pentru GlotLID v3

🔗 Voxtral Mini 4B Realtime Arabic pe Hugging Face · LIDstral Arabic pe Hugging Face


Claude Managed Agents: workflow-uri dinamice cu până la 1 000 de agenți per execuție

9 octombrie — Anthropic deschide în versiune beta publică workflow-urile dinamice (dynamic workflows) din Claude Managed Agents, un nou tip de orchestrare multiagent. Agentul care conduce sesiunea scrie singur un program, pe care serverul îl execută în fundal, lansând numeroși agenți în etape, înainte de a le combina rezultatele. Odată activat tipul multiagent_20261001, agentul decide când să lanseze o execuție.

O execuție lansează până la 1 000 de agenți, dintre care 64 simultan, durează implicit 24 de ore, iar o sesiune poate menține 10 execuții deschise. Tokens utilizați sunt facturați la fel ca cei ai sesiunii și sunt incluși în bugetul acesteia; Anthropic avertizează că pot fi numeroși și menționează un test intern cu 70 de bug-uri introduse într-o bază de cod de 116 000 de linii.

Configurația testului AnthropicBug-uri găsite în 3 încercări
Agent singur14, 15 și 27
Workflow dinamic66 la fiecare încercare

🔗 Anunțul @ClaudeDevs · Documentația execuțiilor de workflow


Agenți de programare: predicții de mesaje și sandbox MXC pentru Codex, Claude Code 2.1.296, Vibe CLI 2.26.1

Codex primește două noutăți în aceeași zi, în timp ce Anthropic și Mistral publică versiuni noi ale agenților lor pentru linia de comandă.

Codex prezice următorul mesaj al utilizatorului, în versiune beta pentru abonații Pro

9 octombrie — OpenAI deschide în versiune beta predicțiile din câmpul de compunere (composer predictions) în aplicația desktop Codex. Când Codex a terminat de răspuns, în câmpul de introducere poate apărea o sugestie pentru următorul mesaj, construită pe baza conversației curente, fără a căuta în memorii sau în aplicațiile conectate. Tasta Tab o inserează; textul rămâne editabil și nu este trimis niciodată automat. Sugestia vizează un mesaj complet, nu o completare cuvânt cu cuvânt.

Condiție pentru versiunea betaValoare indicată de OpenAI
Abonament și vârstăChatGPT Pro personal, 18 ani și peste
Conversații și modeleConversații locale și SSH, cu GPT-6 Astra sau GPT-6.1 Sol
Setare implicităActivată, poate fi dezactivată în General > Composer > Show predictions
Cost în timpul versiunii betaÎn afara limitelor de utilizare Codex, fără consum de credite

Mesajele trimise, inclusiv predicțiile acceptate, sunt contabilizate în continuare în mod normal. Funcția nu există în Chat.

🔗 Anunțul @OpenAIDevs · Articolul de ajutor OpenAI

Codex pe Windows: un sandbox bazat pe Microsoft Execution Containers

9 octombrie — OpenAI adaugă în Codex pe Windows un mod sandbox bazat pe Microsoft Execution Containers (MXC), pe care Microsoft le-a pus la dispoziție generală pe 7 octombrie. Acesta necesită un dispozitiv Windows 11 compatibil (24H2 build 26100.9278 sau 25H2 build 26200.9278) și promite o configurare mai rapidă, un control mai strict al rețelei și permisiuni de acces la fișiere ajustate mai fin.

Potrivit documentației, MXC devine implementarea recomandată: izolează nativ procesele, fără o configurare aprobată de un administrator, fără conturi Windows suplimentare sau reguli locale de firewall. Modurile elevated și unelevated devin opțiuni vechi de rezervă. Aplicația desktop alege automat MXC pentru conturile de consumatori; în CLI sau în companii, acesta se activează cu prefer_mxc = true în config.toml, iar un administrator îl poate bloca prin allow_mxc = false. Sunt documentate două limite: rețeaua gestionată necesită allow_local_binding = true, iar procesele copil rămase se opresc la încheierea comenzii din prim-plan.

🔗 Anunțul @OpenAIDevs · Documentația sandbox-ului Windows

Claude Code 2.1.296: compaction specifică subagenților și model unic pentru agenții de workflow

9 octombrie — Claude Code 2.1.296 include 79 de intrări, dintre care 56 de corecții, și nu a fost însoțită de niciun tweet. Aceasta oferă în special mai mult control asupra subagenților.

Noutate în versiuneCe schimbă
autoCompactWindow (subagenți, --agents)Un subagent își compactează contextul mai devreme decât conversația principală
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODELToți agenții unui workflow folosesc același model, ceilalți subagenți și-l păstrează pe al lor
Opțiunea allow_large din ReadCitirea unui fișier text mare într-un singur apel, dacă o permite contextul
CLAUDE_CODE_OVERLOADED_RETRY_MAX_DELAY_MSInterval maxim mai lung între două reîncercări după o eroare 529
Descrierile instrumentelor MCP trimise de la începutLimita implicită crește de la 2 048 la 4 096 de caractere

/cost și linia de stare contabilizează acum citirile din cache pentru Sonnet 5.5 la 0,10 dolari per milion de tokens. În privința securității, versiunea corectează hooks PreToolUse gestionate care refuzau un apel fără să încheie tura, verificări Bash care aprobau automat anumite comenzi folosind BASH_ARGV0, sesiuni cloud care omiteau verificările modului auto pentru acțiuni Claude in Chrome și modificări Edit și NotebookEdit care înlocuiau toate caracterele non-ASCII din fișierele non-UTF-8, acum refuzate.

🔗 Claude Code 2.1.296 pe GitHub

Vibe CLI 2.26.1: modelul local Devstral eliminat, un mod neinteractiv mai complet

9 octombrie — La trei zile după 2.26.0 și fără vreun tweet, Mistral publică Vibe CLI 2.26.1. În ciuda numărului de versiune de corecție, versiunea cuprinde 85 de intrări (23 de adăugări, 24 de modificări, 36 de remedieri, 2 eliminări), dintre care 37 pentru noua interfață în Rust. Aceasta elimină modelul local Devstral care era inclus: o configurație care încă îl specifică explicit revine, cu un avertisment, la modelul găzduit implicit. Acesta oferă acum doar două niveluri de raționament, off și high, și declară o fereastră de context de 256k, la care se aliniază compactarea automată.

Modul neinteractiv vibe -p primește o limită de timp, citirea promptului dintr-un fișier sau de la intrarea standard, un raport export.json scris la fiecare încheiere a execuției și coduri de ieșire distincte: 1 pentru o eroare de utilizare sau de configurare, 2 pentru o defecțiune a infrastructurii, 3 pentru atingerea unei limite sau un refuz al modelului. Rust CLI adaugă /proxy-setup, un narator care citește cu voce tare rezumatul fiecărei runde, /plugins și /whoami. Noi setări îi interzic agentului procesele în fundal sau subagenții, iar conectorul Document Library rămâne dezactivat implicit.

🔗 Notele versiunii Vibe CLI 2.26.1


Imagini, videoclipuri și jocuri generative: Qwen-Image-2.1-Turbo, modul Thinking al Midjourney, Syren de la Synthesia, Playground de la Google

Un model de imagine mai rapid și mai ieftin, un generator care își verifică rezultatele, un agent care montează videoclipuri și o platformă de jocuri fără cod.

Qwen-Image-2.1-Turbo: 8 etape de eliminare a zgomotului și 0,016 dolari pe imagine

9 octombrie — Qwen publică Qwen-Image-2.1-Turbo, un checkpoint accelerat (accelerated checkpoint) al Qwen-Image-2.1 care generează și retușează imagini în 8 etape de eliminare a zgomotului, pe aceeași arhitectură cu 7 miliarde de parametri. Potrivit Qwen, acesta produce în continuare imagini 2K și acceptă retușuri în limbaj natural, dar nu este publicată nicio cifră privind calitatea sau viteza specifică acestei versiuni. Ponderile sunt disponibile pe Hugging Face și ModelScope, sub licența de cercetare Qwen (Qwen Research License). Checkpointul include propriul program de eșantionare în 8 etape și rulează implicit cu un CFG de 1.

În aceeași zi, Qwen deschide oficial API-urile Qwen-Image-2.1 Pro și Turbo; QwenCloud acordă 120 de cereri pe minut pentru Turbo.

Model disponibil prin API (Model Studio)Preț pe imagineImagini gratuite
qwen-image-2.1-turbo0,016 dolari10
qwen-image-2.1-pro0,04 dolari10
qwen-image-2.0-pro0,075 dolari100

🔗 Anunțul Qwen · Fișa Hugging Face

Midjourney testează un mod Thinking și deschide accesul la foldere partajate pe site-ul său alpha

8 octombrie — Changelogul alpha al Midjourney, publicat seara, prezintă două funcții într-o versiune timpurie, disponibile deocamdată doar pe site-ul alpha.midjourney.com. Prima este un test: pentru o imagine produsă cu V8.2, prin generare sau editare, butonul Rerun (Thinking) îi cere modelului să examineze rezultatul, să identifice unde se abate de la prompt (obiecte, aranjare în pagină, anatomie, text) și să genereze din nou. Midjourney spune că observă rezultate mai bune în privința fidelității față de prompt, a tipografiei și a coerenței și ia în calcul transformarea acestuia într-un mod general.

A doua este partajarea folderelor: pot fi invitați Colaboratori, care generează direct în folder, sau Cititori, iar folderul poate fi partajat prin link sau chiar deschis tuturor membrilor Midjourney. Midjourney precizează că partajarea nu schimbă vizibilitatea imaginilor: fără modul stealth, acestea pot apărea în continuare în Explore și pe profiluri.

🔗 Changelogul alpha al Midjourney · Testul modului Thinking (Midjourney)

Syren: Synthesia încredințează crearea videoclipurilor unui agent, în versiune beta

9 octombrie — Synthesia lansează Syren în versiune beta pentru toți clienții săi, inclusiv conturile gratuite. Utilizatorul descrie videoclipul dorit sau furnizează documente, imagini, videoclipuri, prezentări PowerPoint ori linkuri YouTube, iar Syren livrează un videoclip finalizat cu animații grafice (motion graphics), avataruri, voce din off, muzică și cadre de completare (b-roll), care poate fi apoi corectat prin conversație. Potrivit lui Peter Hill, directorul tehnic al Synthesia, agentul scrie întregul videoclip sub formă de cod, pe care un motor de randare propriu, folosit pentru animațiile Synthesia din iunie, îl redă în timp real.

Videoclipurile au o durată de până la 3 minute, în format orizontal sau vertical, și sunt randate în browser. Facturarea se face pe bază de credite, fără un tarif detaliat, iar administratorii Enterprise pot dezactiva instrumentul. Articolul anunță că învățarea automată a identității de brand pe baza videoclipurilor existente va fi disponibilă în curând. Syren apare la patru zile după HyperFrames Studio de la HeyGen și la o zi după Claude Motion de la Anthropic, alte două instrumente în care un agent produce videoclipul.

🔗 Prezentarea Syren (Synthesia)

Playground: Google deschide o platformă pentru crearea jocurilor fără programare

7 octombrie — Google lansează Playground, o platformă experimentală de jocuri pe care utilizatorii creează, joacă și partajează jocuri descriindu-le prin câteva prompturi, fără să scrie cod. Într-o interfață conversațională, aceștia pornesc de la o pagină goală, de la un exemplu de remixat sau cu îndrumare, apoi ajustează la cerere fizica, regulile, personajele ori decorul.

Jocurile rulează în browser, atât pe telefon, cât și pe computer, și pot rămâne private, pot fi partajate prin link sau pot fi adăugate în galeria Explore, cu clasamente și multiplayer pentru anumite genuri; fiecare joc publicat trece printr-o verificare de siguranță. Playground este disponibil în Statele Unite pentru persoanele de 18 ani și peste, cu drepturi de creare care depind de abonamentul Google AI. O integrare cu Unity Spark, pentru jocuri 3D mai ambițioase, este anunțată pentru viitorul apropiat în versiune beta închisă. Google nu precizează ce model susține platforma.

🔗 Prezentarea Playground (blogul Google)


Sănătate: studiul clinic despre AMIE publicat în The Lancet

8 octombrie — Google și Beth Israel Deaconess Medical Center (BIDMC) publică în The Lancet un studiu prospectiv de fezabilitate despre AMIE (Articulate Medical Intelligence Explorer), IA conversațională de diagnostic a Google; potrivit Google, aceasta este prima sa publicație în revista principală a Lancet. Pacienții au conversat cu AMIE cu până la cinci zile înaintea unei consultații de urgență, iar medicul primea apoi transcrierea și un rezumat.

Măsură din studiuRezultat publicat
Pacienți incluși (aprilie–noiembrie 2025), apoi urmăriți114, apoi 98
Opriri din motive de siguranță0
Halucinații identificate1
AMIE util pentru pregătirea consultației, potrivit medicului33 de cazuri din 44 (75 %)
Diagnostice conforme cu diagnosticul final (Google)90 %

Realizat într-un singur centru, fără grup de control și finanțat de Alphabet, studiul nu reprezintă nici o autorizare, nici o implementare: autorii solicită studii mai ample.

🔗 Articolul Google · Articolul din The Lancet


Cercetare la OpenAI: răspunsul la scrisoarea a trei cercetători de care compania s-a despărțit

9 octombrie — Într-o notă publicată pe @OpenAINewsroom în numele responsabililor săi pentru cercetare, OpenAI răspunde la scrisoarea a trei cercetători de care spune că s-a despărțit în săptămâna precedentă. Potrivit OpenAI, o anchetă internă a concluzionat că aceștia încălcaseră reguli clare privind tratarea informațiilor sensibile, cu o pierdere a încrederii care depășește ceea ce prezintă scrisoarea lor; OpenAI își menține decizia. Compania afirmă că aceste decizii nu au legătură nici cu semnalarea unor preocupări de siguranță, nici cu exprimarea publică și că nu concediază niciun angajat pentru exprimarea unor îngrijorări.

Nota anunță și:

We are actively finalizing contracts with third-party safety assessors and will announce details in the coming weeks.

🇷🇴 Definitivăm în mod activ contracte cu evaluatori terți de siguranță și vom anunța detaliile în următoarele săptămâni. — @OpenAINewsroom pe X

OpenAI spune că este de acord cu scrisoarea într-o privință: păstrarea capacității de monitorizare (monitorability) a modelelor de frontieră necesită un angajament din partea întregii industrii, inclusiv OpenAI. Acest articol prezintă versiunea OpenAI; scrisoarea cercetătorilor nu a fost consultată.


Crearea de modele deschise: șase modele pentru aproximativ 103 dolari cu ML Intern, planificatorul de GPU al Ai2

Două relatări din practică despre crearea modelelor: una din perspectiva agentului, cealaltă din perspectiva clusterelor de calcul.

ML Intern: șase modele deschise pentru aproximativ 103 dolari în costuri de calcul

8 octombrie — Prezentat deja aici pe 1 și 8 octombrie din alte perspective, modul ML Intern al HuggingChat beneficiază de un prim bilanț cu cifre pe blogul Hugging Face: șase proiecte realizate de la început până la sfârșit, cu un cost total de calcul de aproximativ 103 dolari. Fiecare pornește de la un mesaj și se încheie cu un model public pe Hub, inclusiv evaluarea. Agentul planifică, cere autorizare înaintea oricărei sarcini de calcul contra cost, lansează un test scurt, apoi antrenează, evaluează și publică folosind hardware-ul Hugging Face.

Model produs de ML InternRezultat publicatCost de calcul
Pocket Rewriter (0.8B)99,7 % de ieșiri valide, aproximativ un sfert din tokenii modelului de reformulare de 9B al Qwen-Image 2.1Aproximativ 16 dolari
Citrus Doctor (Qwen3.5-2B)De la 14,9 % la 52,8 % de diagnostice corecte pentru bolile citricelorAproximativ 1,90 dolari
Două LoRA pentru Qwen-Image 2.1Schimbarea unghiului de vedere, mâzgăleală înlocuită cu obiectul solicitatAproximativ 16 și 24,30 dolari
Huggy LoRA (FLUX.2 klein)LoRA de personajAproximativ 7,60 dolari
Agate 4 pașiDistilarea unui model mic de imagine, de la 50 de pași (100 de treceri cu ghidare) la 4Aproximativ 37 de dolari

🔗 Articolul Hugging Face

Planificatorul de GPU al Ai2: timpul median de așteptare scade de la 5 minute la 24 de secunde

9 octombrie — Ai2 detaliază noul planificator al clusterelor sale de GPU într-un articol semnat de Jeremy Tryba. Mii de GPU NVIDIA H100, B200 și B300, în clustere de 88 până la 1 024 de GPU, sunt partajate de aproximativ 150 de cercetători, pentru o cerere de două până la trei ori mai mare decât oferta. Vechiul sistem bazat pe priorități lăsa GPU «acaparate» de sarcini goale și vedea toate sarcinile ajungând la prioritatea maximă.

Noul sistem se bazează pe bugete de timp GPU distribuite de-a lungul organigramei de cercetare, o partajare echitabilă ierarhică (fair-share) calculată pe o fereastră mobilă de șapte zile și un «contract de planificare»: fiecare sarcină declară o durată protejată de cel mult 8 ore, după care poate fi întreruptă și reintrodusă în coadă. Timpul nealocat rămâne gratuit, dar poate fi întotdeauna întrerupt.

Indicator măsurat de Ai2Vechiul planificatorNoul planificator
Așteptare mediană, cel mai mare cluster H1005 minute24 de secunde
Așteptare p90 a sarcinilor de depanare2 ore30 de secunde
Ore GPU cuvenite furnizate în 30 de zile—98 %

Reparațiile care necesită intervenție umană scad cu 74 %. Ai2 recunoaște limite, precum sesiunile interactive care pot fi întrerupte după 8 ore, deși înainte puteau dura o săptămână, și nu publică niciun cod.

🔗 Articolul Ai2


Modele de decizie: pplx-decider-v1.1-27b în fruntea Decision Bench, la egalitate statistică cu alte nouă

9 octombrie — Prezentat deja pe 6 și 8 octombrie, modelul de decizie al Perplexity obține un rezultat extern. Pe Decision Bench, un benchmark open source al Atlan Frontier Labs (1 071 de întrebări închise, 36 de seturi de date, 15 modele clasate), pplx-decider-v1.1-27b obține cel mai bun scor brut, 94,5 %, la cel mai mic cost, 0,017 dolari pentru 1 000 de decizii. Totuși, site-ul acordă același rang modelelor ale căror intervale de încredere de 95 % se suprapun: zece modele împart primul loc.

Model evaluat pe Decision BenchPrecizie măsuratăCost pentru 1 000 de rânduri
pplx-decider-v1.1-27b94,5 %0,017 dolari
DeepSeek V4.1 Flash94,2 %0,683 dolari
Gemini 3.5 Flash94,2 %3,32 dolari
Jev 1.1393,8 %0,044 dolari

Perplexity publică și un ghid practic (cookbook) pentru un agent de navigare, în care codul, niciodată modelul, decide clicurile, iar v1.1 înlocuiește v1 în API.

🔗 Firul de postări al @perplexitydevs · Clasamentul Decision Bench


Grok Bot primește propria adresă de e-mail

9 octombrie — Grok Bot, agentul SpaceXAI, dispune acum de propria adresă de e-mail. Botul o poate folosi pentru a se înscrie la servicii, a contacta companii în numele utilizatorului sau a stabili o întâlnire cu cineva. Funcția este disponibilă din aceeași zi: este suficient să îi ceri Botului o adresă sau să menționezi @bot pe X, iar într-o echipă, un administrator trebuie mai întâi să o activeze.

Anunțul constă într-un fir de postări al contului @bot, redistribuit de @grok, fără un articol pe x.ai. Acesta nu precizează nici formatul, nici domeniul adreselor, nici planurile vizate. După identificatorul Slack propriu al Team Bots de la sfârșitul lui septembrie, agentul primește astfel o identitate proprie pentru a acționa în exterior.

🔗 Anunțul Grok Bot


ElevenLabs se instalează în Singapore, hubul său pentru Asia de Sud-Est

8 octombrie — ElevenLabs își oficializează sosirea în Singapore, unde compania deschide un birou destinat să servească drept hub pentru Asia de Sud-Est și, mai larg, pentru Asia-Pacific. Articolul pune în evidență infrastructura deja existentă: din iulie, companiile își pot găzdui datele în Singapore, cu opțiuni fără păstrarea datelor și o latență redusă în regiune.

ElevenLabs menționează în special clienții săi regionali: Funding Societies, care își califică potențialii clienți prin IA conversațională pe cinci piețe, Boost Bank din Malaezia, Salmon Group din Filipine, MNC Group din Indonezia sau Rezonate, o platformă de sănătate folosită de 60 % dintre spitalele publice din Singapore. Nu este precizat numărul de angajați. Această deschidere urmează celor din Bruxelles și Amsterdam, de la sfârșitul lui septembrie și începutul lui octombrie.

🔗 Articolul ElevenLabs


Știri pe scurt

  • Projects în Claude Code — Anthropic a acordat acces tuturor abonaților Pro și Max înscriși pe lista de așteptare. Projects rămâne în beta: lista rămâne deschisă, vor urma alte accesuri în funcție de capacitate, iar funcția nu este încă disponibilă pe Team sau Enterprise, potrivit documentației. 🔗 sursă
  • Ghid pentru automatizările agenților — Un ghid claude.dev descrie o implementare de referință pe Claude Managed Agents, care citește după un program canale Slack și pull requests GitHub, apoi publică un rezumat în Slack, și detaliază cele șase componente ale acesteia, împreună cu măsurile împotriva defecțiunilor frecvente, precum evitarea confundării unei surse imposibil de citit cu o zi liniștită sau stabilirea plafonului de cheltuieli la 3 până la 5 ori costul unei rulări normale. 🔗 sursă
  • Block și Claude Fable — Într-un interviu publicat de Anthropic, Block explică faptul că Claude Fable proiectează marile sale migrări de cod și coordonează până la zeci de modele Opus sau Sonnet, ajungând să integreze până la o mie de pull requests într-o singură migrare; integrările și lansările în producție rămân rezervate oamenilor, cu dublă aprobare pentru deployment-uri. 🔗 sursă
  • Compliance API din Claude Enterprise — Punctele sale de acces (endpoints) pentru conversații returnează și, în beta și cu cheia existentă, conversațiile din experiența unificată Claude: o conversație continuată într-o sesiune cloud este returnată ca una singură, cu activitatea lui Claude în blocurile tool_use și tool_result. 🔗 sursă
  • Codex CLI 0.162.1 — Această corecție pentru 0.162.0 elimină o blocare a TUI la întrebările asincrone pe mai multe rânduri și erorile de pornire apărute când un server de fundal deja pornit nu avea aceleași setări ale funcționalităților ca CLI. 🔗 sursă
  • Pluginuri în funcție de rol în ChatGPT Enterprise și Edu — Când este activat controlul accesului bazat pe roluri (RBAC), proprietarii și administratorii configurează accesul la pluginuri pentru fiecare rol: Available, Install sau Disabled pentru spațiul de lucru, Default pentru ca un rol personalizat să moștenească această setare. 🔗 sursă
  • Sophos și OpenAI Daybreak — Potrivit furnizorului de soluții de securitate cibernetică, agenții săi construiți cu Daybreak reduc timpul mediu de răspuns pentru cazurile pe care le gestionează de la aproximativ 38 de minute la aproximativ 89 de secunde, iar 52 % dintre cazurile sale MDR sunt rezolvate integral de IA; acțiunile distructive rămân sub supraveghere umană. 🔗 sursă
  • Asana și agentul de navigare StackAI — Potrivit Asana, GPT-6 Astra din Codex a optimizat acest agent în aproximativ o săptămână: pe GPT-6.1 Sol, o rulare de test costă 0,47 dolari și durează aproximativ patru minute, fiind de 76 de ori mai ieftină și de 5 ori mai rapidă decât configurația inițială din producție. 🔗 sursă
  • LegalOn și Codex — LegalOn Technologies afirmă că și-a redus cu aproximativ 65 % costurile zilnice estimate pentru Codex, trecând de la GPT-5.5 în mod rapid nelimitat la repartizarea sarcinilor între GPT-6 Luna, GPT-6.1 Sol și GPT-6 Astra, cu mod rapid la cerere și plafoane pentru fiecare departament și fiecare persoană. 🔗 sursă
  • Gemini CLI v0.64.0-preview.1 — Această versiune preview elimină rezultatele fals pozitive ale avertismentului Untrusted Command Flags Detected pentru comenzile shell inofensive: opțiunile doar pentru citire sunt exceptate, variabilele shell sunt păstrate, iar buclele sunt permise când fiecare subcomandă are propria regulă ALLOW. Nicio versiune nightly nu a fost lansată pe 9 octombrie, iar versiunea stabilă rămâne v0.63.0. 🔗 sursă
  • Antigravity 2.22.0 — Pluginurile își pot afișa propria interfață în panoul lateral (UI Extensions), conversațiile pot fi organizate prin glisare și fixare dintr-o secțiune în alta a barei laterale, iar marcajele temporale afișează numele lunii. 🔗 sursă
  • Gemini 3.7 Flash depreciat — În API-ul Gemini, apelurile către gemini-3.7-flash sunt redirecționate către gemini-3.8-flash, iar vechiul agent deep-research-pro-preview-12-2025 va fi oprit pe 23 octombrie, în favoarea deep-research-preview-04-2026 sau deep-research-max-preview-04-2026. 🔗 sursă
  • Pluginuri VST3 și AU pentru Google Flow Music — Știre din 6 octombrie, inclusă acum: Spaces, aceste instrumente și efecte create în limbaj natural, pot fi exportate ca pluginuri pentru stațiile de lucru audio digitale (Digital Audio Workstations), precum pluginul No Chaser al producătorului Khris Riddick-Tynes. 🔗 sursă
  • Google Earth AI și sănătatea publică — Știre din 6 octombrie, inclusă acum: în timpul epidemiei de Ebola din RDC, un prototip de agent de raționament geospațial a permis biroului OMS pentru Africa să identifice în câteva minute 48 de localități expuse și peste 45 500 de persoane aflate în pericol; modelul PDFM identifică și zone cu risc de holeră cu până la 8 săptămâni înainte. 🔗 sursă
  • Facturarea Copilot code review — Proprietarii organizațiilor pot factura organizației care deține depozitul revizuirile solicitate de membrii lor care dețin licențe, în loc să consume cota acestora, dacă este activată utilizarea contra cost a AI Credits, și pot limita declanșarea revizuirilor la licențele furnizate de organizație sau de întreprindere. 🔗 sursă
  • Copilot CLI 1.0.95 — Ajunsă în versiune stabilă, aceasta se autentifică pe macOS prin brokerul nativ Microsoft Entra, cu browserul ca opțiune de rezervă; versiunea preliminară 1.0.96-0 indică în cronologie cine a decis pentru fiecare permisiune: utilizatorul, Assisted Permissions, o politică sau mecanismul de rezervă pentru funcționarea nesupravegheată. 🔗 sursă
  • GitHub MCP Server 2.0 — Știre din 6 octombrie, inclusă acum: serverul MCP oficial GitHub returnează ieșiri tipizate, descrise prin scheme de ieșire (output schemas), pentru agenții în Code Mode sau Programmatic Tool Calling; acestea sunt anunțate doar clienților care folosesc specificația MCP 2026-07-28 sau o versiune ulterioară. 🔗 sursă
  • Claude Haiku 5.5 în Genspark — Genspark pune modelul la dispoziție în AI Chat, Code Agent și Claw, reluând argumentele Anthropic, potrivit cărora rularea sa costă cu aproximativ 75 % mai puțin decât cea a Haiku 4.5, fără abonament sau tarife proprii. 🔗 sursă
  • Șablon Meta VR pentru v0 — Meta publică împreună cu Vercel un șablon v0 bazat pe Immersive Web SDK: descrii o experiență, v0 o programează și o previzualizează, iar un clic o lansează pe Vercel pentru a o deschide în browserul Quest; urmărirea privirii și a mâinilor pentru Meta VR Glasses, așteptate în primăvara lui 2027, este deja acceptată. 🔗 sursă
  • v0 for teams — v0 prezintă într-un videoclip această modalitate de a vedea munca coechipierilor, de a te alătura conversațiilor lor și de a construi împreună; tweet-ul evidențiază funcționalități introduse treptat începând din septembrie, fără un tarif nou. 🔗 sursă
  • DeepSeek Harness 0.2.1-alpha.2 — A 26-a versiune preliminară, încă fără o versiune stabilă: catalogul de pluginuri instalează la cerere pachetele Claude Code și Codex, apar două pluginuri experimentale (Git Worktrees, traducerea raționamentului), iar instrucțiunile globale pot proveni dintr-un AGENTS.md partajat. 🔗 sursă
  • OGX 1.5.0 — Fostul Llama Stack, redenumit în aprilie și mutat în afara organizației meta-llama, adaugă passthrough nativ pentru API-ul /v1/messages pentru DeepSeek și Fireworks AI, un furnizor Text-Embeddings-Inference, căutare web Exa și Serply și clientul MCP 2.x, cu patru modificări incompatibile cu versiunile anterioare. 🔗 sursă
  • GenIA — Meta publică fără anunț, sub licența necomercială CC BY-NC 4.0, codul acestei lucrări realizate împreună cu Tübingen AI Center: acesta reconstruiește obiecte 3D dintr-o imagine, câteva vederi sau un videoclip, aliniind la momentul inferenței priorul înghețat al SAM 3D Objects, fără reantrenare. 🔗 sursă
  • Eticheta decision-model pe Hub — Hugging Face oferă modelelor de decizie propria etichetă, cu o pictogramă și un filtru pe pagina Models; fișierele GGUF pentru decizie sunt etichetate automat pe baza metadatelor lor llama.cpp. 🔗 sursă
  • Darwin-27B-ZTC-v2 — VIDRAFT anunță că noua versiune a modelului său evaluator, sub Apache-2.0, ocupă primul loc în System One Mosaic Benchmark (137 de benchmark-uri), cu un scor Borda de 89,58, înaintea OpenJev-27B (87,50) și Jev 1.13 (85,05); un clasament raportat de autorii săi, care îl prezintă drept o captură a unui clasament public. 🔗 sursă
  • Încrederea modelelor de decizie — Stephen Solka arată într-o postare comunitară că GPT-6 Luna Decisions, interogat prin OpenRouter, răspunde « nu corespunde » la 600 de verificări SHA-256, cu 50 % acuratețe și 99,8 % încredere medie; în raționamentul cauzal, un prag de 99 % izolează 47 de răspunsuri corecte din 49, dar acoperă doar 8,2 % dintre cazuri. 🔗 sursă
  • openai-math în medii de învățare prin întărire — FineEnvs transpune în medii Harbor 369 dintre cele 405 rezultate formalizate în Lean din publicația openai/math: agentul trebuie să demonstreze o teoremă într-un sandbox Lean 4, iar Comparator acordă recompensa doar pentru o demonstrație completă a enunțului exact; set experimental sub Apache-2.0. 🔗 sursă
  • JOSIE-2 — Gökdeniz Gülmez publică raportul tehnic al acestei familii de 2B, 4B și 9B, post-antrenate pornind de la Qwen3.5 pe două Mac M4, cu aproximativ 3 000 de exemple selectate: în modul de raționament, JOSIE-2-4B atinge 95,5 pe ARC-Challenge (+12,1) și 69,2 pe TruthfulQA (+20,3), pe doar două benchmark-uri. 🔗 sursă
  • Gradio 6.30 — gr.Workflow primește o vizualizare de tip aplicație, iar comanda Run this node reutilizează rezultatele din amonte încă actuale, în loc să ruleze din nou întregul subgraf; gr.ImageEditor păstrează canalul alpha al imaginilor încărcate. 🔗 sursă
  • tokenizers 0.23.3 — Această corecție, aplicată doar pachetului Python, acceptă huggingface_hub v2, ceea ce deblochează instalarea Transformers potrivit notelor, și anulează o modificare incompatibilă cu versiunile anterioare introdusă în 0.23.1 privind trunchierea. 🔗 sursă
  • Evaluare științifică de către IA — Sakana AI prezintă un articol acceptat la TMLR: un benchmark inserează afirmații contradictorii în articole pentru a verifica dacă evaluatorii IA le identifică, iar sistemul său Multi-Layered Review detectează mai multe decât celelalte sisteme testate, potrivit anunțului Sakana AI, care nu oferă nicio cifră. 🔗 sursă
  • Suno Studio — Clipurile se aliniază mai bine cu primul timp și se întind pentru a urma tempoul proiectului, estompările devin exponențiale sau logaritmice, iar sintetizatorul, claviatura și vizualizările pluginurilor pot fi desprinse și afișate chiar și pe un al doilea ecran; Studio este inclus în abonamentul Premier. 🔗 sursă
  • World Models’ Last Exam in Physics — La acest examen de fizică Einsia pentru modele video (40 de sarcini, 9 categorii, opt modele), Seedance 2.5 ocupă primul loc cu 57,76 din 100, înaintea MiniMax H3 (54,89), cel mai bun model deschis potrivit MiniMax, și Cosmos 3 Super de la NVIDIA (42,46); un benchmark independent. 🔗 sursă
  • Simulări Omniverse construite de agenți — Blogul NVIDIA prezintă echipe din companie care folosesc GPT-6 Astra și, într-un caz, Claude Fable 5 pentru a asambla simulări cu bibliotecile ovphysx, ovstage, ovrtx și ovui, inclusiv gemeni digitali creați sau îmbunătățiți în aproximativ trei zile; niciun produs nou. 🔗 sursă
  • Gestionarea unui magazin Shopify — Odată conectat magazinul, Grok Bot poate verifica comenzile, urmări stocurile și menține actualizate fișele produselor; nu sunt precizate nici planul de abonament, nici limitele. 🔗 sursă
  • Căutarea pe X — Știre din 7 octombrie, inclusă acum: Grok Bot poate căuta, citi și monitoriza X pentru toți utilizatorii, fără configurarea conectorului X, de exemplu pentru a urmări părerile despre un produs sau a primi o sinteză săptămânală a sectorului lor; la sfârșitul lui august, încă era necesară conectarea contului. 🔗 sursă
  • Grokipedia v0.3 — Potrivit contului său oficial, enciclopedia redactată de Grok a publicat într-o săptămână peste 4 400 de articole solicitate de cititori și a efectuat peste 2 200 de modificări pe zi, cu o medie de 78 de surse pentru fiecare articol nou; o pagină transmite acum modificările sale în direct. 🔗 sursă
  • CLI-ul mistral 0.8.0 — mistral apps deploy lansează și workerii pentru workflows și toate modulele simultan, inclusiv în integrarea continuă cu o simplă cheie API, iar mistral apps dev pornește o bază de date Postgres locală în Docker; în schimb, .env din directorul curent nu mai este citit. 🔗 sursă
  • SDK-ul Python Mistral 3.2.0 — Apelurile de chat și de agenți acceptă probabilități logaritmice (logprobs), atât pentru răspuns, cât și pentru prompt, precum și top_k, o penalizare pentru repetiție și un număr minim de tokens; versiune generată automat, fără anunț. 🔗 sursă
  • Qwen Code v0.25.1-preview.1 — A doua versiune preliminară a v0.25.1 în trei zile, cu 16 funcționalități și 27 de corecții noi, inclusiv o colaborare între mai mulți agenți centrată pe sesiune și hooks PreToolUse care modifică intrarea unui instrument cu revalidare completă; versiunea stabilă nu a fost încă lansată. 🔗 sursă
  • Claude Haiku 5.5 în Agent API de la Perplexity — Știre din 7 octombrie, inclusă acum: Agent API acceptă anthropic/claude-haiku-5-5 la tariful Anthropic, 0,10 dolari pe milion de tokens de intrare și 0,50 pentru ieșire până la 100 000 de tokens de intrare, apoi 0,50 și 2,50 peste acest prag. 🔗 sursă
  • Inferență partajată sau dedicată — Un ghid Cohere pentru Embed și Rerank susține că forma cererilor contează mai mult decât numărul lor și calculează praguri orientative de rentabilitate în comparație cu o instanță dedicată cu un GPU NVIDIA A10: aproximativ 4 cereri pe minut pentru documente lungi, 20 pentru un catalog, 29 pentru reordonare (reranking). 🔗 sursă
  • Agent sau MCP — Perplexity publică un ghid care face distincția între agent, care decide, și MCP, care îl conectează la instrumente, cu un tabel pentru alegerea soluției, exemplul unui magazin online și patru riscuri împreună cu măsurile lor de protecție; potrivit ghidului, Claude, ChatGPT sau Cursor pot încredința o sarcină lui Computer prin serverul MCP Perplexity. 🔗 sursă

Ce înseamnă acest lucru

Un agent orchestrează acum mulți alți agenți, iar fiecare primește o identitate. Agentul Gemini lansează subagenți care au fiecare propria identitate și poate deveni un agent colaborator cu propria adresă; Claude Managed Agents permite unui agent să scrie un program care lansează până la 1 000 de agenți; Grok Bot primește o adresă de e-mail pentru a acționa în exterior, iar Block îi încredințează lui Claude Fable coordonarea a zeci de modele în cadrul aceleiași migrări. Întrebarea care se pune tot mai des nu mai este dacă agentul știe să facă treaba, ci cum poate fi ținut sub control. Google răspunde prin Agent Gateway, Agent Sandbox, un jurnal de audit în numele fiecărui agent și plafoane de cheltuieli în timp real; Anthropic printr-un buget de sesiune care suspendă toate execuțiile odată ce este atins; OpenAI printr-un sandbox Windows mai strict în privința rețelei și a fișierelor.

Utilizarea mai multor modele se extinde chiar în cadrul platformelor. Google, care dezvoltă Gemini, își folosește propriul agent pentru a orchestra modele Claude, separă explicit alegerea modelului de cea a agentului și oferă acces la Claude Opus 5.5 și Sonnet 5.5 în Antigravity, facturate în cadrul aceluiași plafon de cheltuieli ca modelele sale. Genspark și Agent API de la Perplexity adaugă Claude Haiku 5.5 în zilele care urmează lansării sale, LegalOn își distribuie munca de programare între trei modele OpenAI în funcție de natura sarcinilor, iar Block construiește un selector automat de modele.

Costul unitar continuă să scadă, iar fiecare anunț îl cuantifică: 0,016 dolari pe imagine pentru Qwen-Image-2.1-Turbo, de 2,5 ori mai puțin decât versiunea Pro; 15 dolari pe milion de caractere pentru HeyGen Voice până la 31 octombrie, apoi 30, mai puțin decât Eleven v4 Turbo; 0,017 dolari pentru 1 000 de decizii pentru pplx-decider-v1.1-27b; șase modele publicate pe Hub cu aproximativ 103 dolari cheltuiți pe calcul folosind ML Intern. Primele locuri cer însă o interpretare atentă: HeyGen Voice ocupă primul loc doar în clasamentul cu voci controlate, iar pplx-decider își împarte poziția cu alte nouă modele ale căror intervale de încredere se suprapun.

În sănătate, prudența rămâne necesară. Studiul AMIE publicat în The Lancet este un studiu de fezabilitate, desfășurat într-un singur centru, fără grup de control și finanțat de Alphabet: 98 de pacienți, nicio conversație oprită din motive de siguranță, o halucinație identificată. Este un pas spre studii mai ample, pe care chiar autorii le solicită, nu o autorizare sau o implementare în rândul pacienților.


Surse