Căutare

Claude Dashboards și Claude Motion, Cyber Mission și OSS Scanner, GPT-6.1 Sol în Ultrafast

ai-powered-markdown-translator

Articol tradus din fr în ro cu gpt-6.1-sol.

Vezi proiectul pe GitHub ↗

Anthropic adaugă două funcții în Claude, Claude Dashboards pentru panouri de bord actualizate și Claude Motion pentru animații scrise în cod, și scoate Docs, Slides și Design din beta pentru toate abonamentele, inclusiv Free. În aceeași zi, compania își lansează Cyber Mission, cu un program de apărare a infrastructurilor critice și OSS Scanner, care oferă proiectelor open source scanări gratuite cu cele mai puternice modele ale sale. OpenAI lansează, la rândul său, nivelul Ultrafast pentru GPT-6.1 Sol, de până la 8 ori mai rapid decât modul Standard, în timp ce Anthropic și NVIDIA se angajează să contribuie la Genesis Mission cu 150 de milioane, respectiv 1 miliard de dolari.


Claude Dashboards și Claude Motion în beta, Docs, Slides și Design pentru toate abonamentele

8 octombrie — Anthropic adaugă două funcții în Claude. Cu Claude Dashboards, în beta pentru abonamentele plătite, se conectează o platformă de date a companiei (Amazon Redshift, BigQuery, ClickHouse, Databricks sau Snowflake) sau un alt conector, precum oportunitățile Salesforce, apoi se pune o întrebare în limbaj obișnuit: Claude scrie interogarea, construiește panoul de bord și îl actualizează când datele se schimbă. Un clic pe o valoare afișează interogarea care o produce, iar fiecare grafic indică momentul în care datele sale au fost actualizate. Anthropic îl destinează întrebărilor rapide și exploratorii; pentru analize mai aprofundate, panoul de bord poate fi trimis către Amplitude, Grafana, Hex, Mixpanel, Omni, Perplexity, PostHog sau Sigma, urmând să fie adăugate Looker, monday.com și Tableau.

Claude Motion, în beta pentru Team și Enterprise, vizează animațiile scurte: un videoclip explicativ de 30 de secunde pornind de la un raport trimestrial, un grafic animat într-o prezentare sau o demonstrație de produs. Deoarece nu intervine niciun model de generare video, animația nu conține nici secvențe, nici persoane generate de IA.

Claude Motion turns reports, charts, or product walkthroughs into short animations. Claude writes each one as code, with no video model involved, so you can change any word, number, or timing, then export an MP4. In beta on Team and Enterprise plans.

🇷🇴 Claude Motion transformă rapoarte, grafice sau demonstrații de produs în animații scurte. Claude le scrie pe fiecare în cod, fără niciun model video, astfel încât puteți modifica orice cuvânt, număr sau temporizare, apoi puteți exporta un MP4. În beta pentru abonamentele Team și Enterprise. — @claudeai pe X

În aceeași zi, Claude Docs, Slides și Design pierd eticheta beta și devin disponibile pentru toate abonamentele, inclusiv Free. Potrivit Anthropic, de la introducerea lor în conversații, pe 16 septembrie, au fost create peste 45 de milioane de documente, prezentări și designuri. Ieșirea din beta aduce suport pentru CMEK la artefacte, alegerea modelelor de artefacte de către administratori, editarea în colaborare cu Claude, partajarea în afara organizației dacă administratorul o permite, exporturi PowerPoint și PDF care redau fidel conținutul din editor, trimiterea directă către Google Slides și editarea din aplicația mobilă.

Funcția vizatăStarea la 8 octombrieAbonamente vizate
Claude DashboardsBetaAbonamente plătite
Claude MotionBetaTeam și Enterprise
Claude Docs, Slides și DesignIeșire din betaToate, inclusiv Free
claude.ai/design (site separat)Deschis până la 14 decembrie—

Consecință practică: site-ul separat claude.ai/design, integrat acum în Claude, rămâne deschis până pe 14 decembrie. Sistemele de design (design systems) ale unei organizații se migrează într-un singur pas de pe pagina Artifacts, însă conversațiile și comentariile de pe site-ul separat, precum și linkurile sale publice, vor dispărea la închiderea acestuia. În Enterprise, Dashboards și Motion sunt dezactivate implicit, în timp ce Docs, Slides și Design se vor activa implicit pe 15 octombrie.

🔗 Articol Claude: Dashboards și Motion · Fir @claudeai

Runway și Luma, parteneri de lansare pentru Claude Motion

8 octombrie — Două companii din domeniul generării video se prezintă drept parteneri de lansare pentru Claude Motion. În Runway, orice animație poate fi exportată pentru a adăuga secvențe generate, a retușa cadre descriind schimbarea dorită și a lăsa Runway Agent să asambleze un montaj mai lung în jurul animației; același format 16:9 poate fi adaptat și în formate verticale și pătrate. În Luma, animațiile se deschid direct prin conectorul Luma (MCP) adăugat în Claude: modelele video Ray și Uni le schimbă stilul păstrând mișcarea, le reîncadrează în 9:16, 1:1, 4:3 sau 21:9, iar agentul Luma produce alte versiuni ale acestora. Nici Runway, nici Luma nu precizează vreun tarif sau cost în credite. Anthropic menționează și Adobe, Descript, HeyGen, Higgsfield și invideo printre instrumentele cu care se poate continua o animație, Canva și Captions fiind anunțate pentru viitorul apropiat.

🔗 Articol Runway · Articol Luma


Anthropic Cyber Mission: un program pentru infrastructurile critice și OSS Scanner pentru open source

8 octombrie — La două zile după extinderea Cyber Verification Program, Anthropic lansează Anthropic Cyber Mission, prezentată ca un angajament pe termen lung pentru securizarea sistemelor de care depinde toată lumea. Constatarea inițială provine din Project Glasswing: găsirea vulnerabilităților nu a fost niciodată atât de ușoară, însă verificarea, prioritizarea și remedierea lor rămân dificile. Misiunea începe în două domenii, infrastructurile critice și software-ul open source; sunt anunțate și alte domenii, fără o dată.

Pentru infrastructurile critice, Critical Infrastructure Defense Program (CIDP) pune la dispoziția furnizorilor operatorilor de tehnologii operaționale modele Claude de frontieră, ingineri la fața locului și cercetările Anthropic privind amenințările: automate, software de control și rețele industriale din sectorul electricității, al apei sau al transporturilor, care adesea nu pot fi oprite pentru aplicarea unui patch. Participă unsprezece parteneri fondatori: Accenture, Booz Allen, CrowdStrike, Deloitte, Dragos, Hitachi, Insane Cyber, Nozomi Networks, Palo Alto Networks, PwC și Rockwell Automation. Programul începe cu un grup restrâns și urmează să se extindă la alți parteneri și în alte sectoare în lunile următoare.

Pentru open source, OSS Scanner, inspirat de OSS-Fuzz de la Google, oferă gratuit proiectelor înscrise scanări periodice cu cele mai puternice modele Anthropic, inclusiv Claude Mythos. Fiecare raport include un instrument de reproducere, o explicație și, când există, un patch candidat, însă este trimis fără verificare umană: Anthropic se așteaptă la o rată a rezultatelor pozitive reale de peste 90 % și avertizează că unele rapoarte vor conține erori, precum evaluarea greșită a severității. Serviciul răspunde blocajului descris de echipa Frontier Red Team: vulnerabilitățile găsite depășesc cu mult capacitatea oamenilor de a le tria.

Indicator publicat de AnthropicValoare publicată
Vulnerabilități candidate găsite în șase luniPeste 29 000
Vulnerabilități verificate și triate manualAproximativ 6 000
Vulnerabilități critice sau de severitate ridicată verificate (48 de proiecte)97
Acceptate conform nivelului cerut pentru divulgarea coordonată (CVD)85, adică 88 %
Reale, dar duplicate, sau nevalide11 și 1
Ponderea vulnerabilităților găsite de LLM pe platforma de testare CyberGymSub 20 % la începutul anului trecut, peste 85 % anul acesta

wolfSSL indică faptul că, dintre cele 74 de rapoarte primite, toate, cu excepția a două, au fost valide, iar cinci au devenit CVE. Înscrierea se face printr-un pull request în depozitul GitHub anthropics/oss-scanner și este rezervată responsabililor principali ai proiectelor considerate critice, de la caz la caz, iar Defender Advantage Fund, lansat în august, menține serviciul gratuit. Prognoza Anthropic este prudentă: în următorii doi ani, IA va favoriza apărarea, însă nu neapărat pe termen scurt, deoarece exploatarea costă mai puțin, în timp ce verificarea, divulgarea și remedierea rămân lente.

🔗 Articol Anthropic: Anthropic Cyber Mission · Articol Frontier Red Team despre OSS Scanner · Depozitul anthropics/oss-scanner


Ultrafast pentru GPT-6.1 Sol: de până la 8 ori mai rapid, la 12 și 60 de dolari pentru un milion de tokens

8 octombrie — Anunțat ca disponibil „în curând” pe 29 septembrie, nivelul Ultrafast ajunge pe GPT-6.1 Sol. OpenAI Developers indică faptul că este lansat în aceeași zi în API, în Codex și în ChatGPT Work, cu o inteligență prezentată ca apropiată de cea a GPT-6 Astra. OpenAI îl destinează activităților în care fiecare secundă contează: depanarea unei defecțiuni, navigarea agenților prin aplicații sau oferirea unor experiențe în direct.

Ultrafast is rolling out today for GPT-6.1 Sol in the API, Codex, and ChatGPT Work. Near-Astra intelligence at up to 8x faster speeds than Sol Standard, so you can build as fast as the ideas come.

🇷🇴 Ultrafast este lansat astăzi pentru GPT-6.1 Sol în API, Codex și ChatGPT Work. O inteligență apropiată de Astra, de până la 8 ori mai rapidă decât Sol în modul Standard, pentru a construi la fel de repede cum vin ideile. — @OpenAIDevs pe X

În API, este suficient să apelați gpt-6.1-sol cu service_tier: "ultrafast" în Responses API. Modul este disponibil tuturor utilizatorilor API, în limita ratelor de utilizare, cu procesare globală și rezidența datelor în Statele Unite și în Uniunea Europeană, în timp ce GPT-6 Astra în Ultrafast rămâne limitat la rezidența în Statele Unite. Tariful urmează regula aplicată deja la Astra: de șase ori prețul Standard, adică 12 dolari pentru un milion de tokens la intrare și 60 de dolari la ieșire, de cinci ori mai puțin decât GPT-6 Astra în Ultrafast (60 și 300 de dolari).

Mod de procesare pentru gpt-6.1-solPreț la intrareIntrare în cacheScriere în cachePreț la ieșire
Standard, context scurt2,00 dollars0,10 dollar2,50 dollars10,00 dollars
Fast, context scurt4,00 dollars0,20 dollar5,00 dollars20,00 dollars
Ultrafast, context scurt12,00 dollars0,60 dollar15,00 dollars60,00 dollars
Ultrafast, context lung24,00 dollars1,20 dollar30,00 dollars90,00 dollars

Tarife pentru un milion de tokens, conform paginii Pricing a API din 8 octombrie.

În Codex și ChatGPT Work, accesul este rezervat abonamentului Pro 500, spațiilor Enterprise eligibile facturate în funcție de utilizare și ofertelor Edu cu credite. În Enterprise, Ultrafast este dezactivat implicit, iar proprietarii spațiului de lucru trebuie să îl activeze pentru anumiți utilizatori sau pentru toți. Documentația Codex detaliază costul: limitele incluse în abonament sunt consumate de 8 ori mai repede decât în modul Standard, iar creditele cumpărate și utilizarea Enterprise la cerere sunt facturate de șase ori mai scump. Celelalte abonamente cu autoservire nu au acces la lansare, nici măcar cu credite cumpărate.

🔗 Changelog al API OpenAI · Tarifele API OpenAI · Ultrafast în Codex (documentație)


Știință: 150 de milioane de dolari de la Anthropic și 1 miliard de la NVIDIA pentru Genesis Mission, o hartă a cerului în ultraviolet

Două angajamente în cadrul Genesis Mission, programul federal american care urmărește să accelereze descoperirile științifice prin IA, au fost anunțate pe 8 octombrie la același summit, „Science: A New Golden Age”, organizat la Washington de Office of Science and Technology Policy (OSTP) al Casei Albe. În aceeași zi, Anthropic arată ce poate produce Claude Science pentru un astrofizician.

Anthropic: 150 de milioane de dolari pe trei ani și Claude pentru peste 15 agenții federale

8 octombrie — Anthropic se angajează să aloce 150 de milioane de dolari pe trei ani pentru Genesis Mission. Finanțarea trebuie să facă Claude accesibil pentru peste 15 agenții membre ale misiunii, printre care NASA, National Institutes of Health și National Science Foundation. Concret, Anthropic va furniza Claude, Claude Code și credite API pentru câteva sute de proiecte de cercetare, va colabora cu agențiile și laboratoarele naționale la prioritățile administrației, inclusiv energia de fuziune și calculul cuantic, și va asigura instruire și suport tehnic. Angajamentul continuă parteneriatul încheiat în decembrie 2025 cu Departamentul Energiei; în iulie, Google DeepMind (40 de milioane de dolari) și OpenAI (17 milioane de dolari) își anunțaseră propriile angajamente în cadrul misiunii.

🔗 Articol Anthropic: angajamentul în cadrul Genesis Mission · Tweet @AnthropicAI

NVIDIA: 1 miliard de dolari pe cinci ani pentru știința americană

8 octombrie — La același eveniment, NVIDIA anunță angajamente în valoare de 1 miliard de dolari pe cinci ani, pentru a dezvolta capacitatea Statelor Unite de cercetare și dezvoltare în domeniul superinteligenței, în sectoare precum calculul cuantic, sănătatea și securitatea energetică. Comunicatul menționează trei componente, fără a repartiza suma: sprijin pentru instituțiile universitare de cercetare, investiții pentru accelerarea poziției de lider a Statelor Unite în calculul cuantic și sprijin pentru furnizorii cloud care deservesc misiunile guvernului. NVIDIA afirmă că participă și la mai multe proiecte finanțate în faza 2 a Genesis Mission, anunțate în aceeași zi, în domeniile calculului cuantic, fuziunii, proiectării de acceleratoare și microelectronicii, și amintește de parteneriatul său cu DOE, care include cel mai mare supercalculator științific al departamentului, la Argonne National Laboratory.

🔗 Comunicat NVIDIA

Prima hartă completă a cerului în ultraviolet, realizată cu Claude Science

8 octombrie — Blogul Anthropic Science povestește cum Brice Ménard, astrofizician la Universitatea Johns Hopkins și cercetător la Anthropic, a realizat cu Claude Science ceea ce Anthropic prezintă drept prima hartă completă a cerului în ultraviolet. Cartografierea spațială GALEX (NASA, 2003-2013) acoperea doar aproximativ două treimi din cer, prin circa 38 000 de observații. Claude a coordonat agenți care au reunit și au calibrat reciproc datele publice de observație, apoi au completat treimea lipsă prin reconstrucție (inpainting), pornind de la relația dintre ultraviolet și celelalte lungimi de undă. În zonele mascate intenționat, estimările diferă cu aproximativ 10 % de măsurătorile reale.

The work would have taken humans weeks of work, but, with Claude, just took a few days while Ménard worked on other projects.

🇷🇴 Această muncă le-ar fi luat oamenilor săptămâni, dar, cu Claude, a durat doar câteva zile, în timp ce Ménard lucra la alte proiecte. — @AnthropicAI pe X

🔗 Postare Anthropic Science


Utilizări interzise și abuzuri: politica de utilizare Anthropic pentru 2026 și două operațiuni de influență dezmembrate de OpenAI

Două publicații din 8 octombrie arată ce interzic laboratoarele și cum depistează abuzurile: Anthropic își rescrie politica de utilizare, iar OpenAI detaliază două operațiuni de influență pe care le-a interzis.

Anthropic publică versiunea 2026 a politicii sale de utilizare, în vigoare din 12 noiembrie

8 octombrie — Anthropic publică actualizarea anuală a politicii sale de utilizare (Usage Policy), care va intra în vigoare pe 12 noiembrie. Este vorba în principal despre clarificări, bazate pe abuzurile observate. O nouă secțiune reunește regulile privind campaniile înșelătoare și activitatea artificială, până acum dispersate, și vizează orice activitate înșelătoare, politică sau comercială, inclusiv crearea de instrumente pentru operațiuni de influență. Secțiunea electorală, redenumită « nu subminați procesele democratice » (Do Not Undermine Democratic Processes), renunță la interdicția generală privind vizarea personalizată a alegătorilor, care bloca utilizări civice precum informarea alegătorilor în alte limbi. Textul precizează și că interdicția privind armele acoperă software-ul și componentele acestora, precum și înarmarea dronelor, interzice urmărirea persoanelor fără consimțământul lor și interzice, doar în cazurile extreme, comportamentele abuzive persistente și nejustificate față de modele.

🔗 Postare Anthropic: actualizarea politicii de utilizare pentru 2026

OpenAI dezmembrează Dark Clark și Bogus Bylines, inclusiv prima sa operațiune de categoria 5

8 octombrie — OpenAI publică un raport despre două operațiuni clandestine de influență pe care le-a interzis și care mențineau în activitate entități false (false front) cu ajutorul modelelor sale. « Dark Clark », de origine rusă, viza America Latină: operatorii săi își redactau în principal rapoartele interne cu ChatGPT și administrau un pseudocentru de cercetare, Social Research Center, condus de un personaj fictiv, « Mia Clark ». « Bogus Bylines », de origine iraniană, a plasat aproape 100 de articole sub șapte semnături false de jurnaliști occidentali în aproximativ douăsprezece publicații online, dintre care una avea aproape 2 milioane de abonați pe Facebook. OpenAI afirmă că a dezvăluit 30 de operațiuni de acest tip în doi ani și jumătate.

Operațiune dezmembratăOriginea conturilorȚinta principalăCategoria pe IO Breakout Scale (1 până la 6)
Dark ClarkRusiaAmerica Latină5, o premieră potrivit OpenAI
Bogus Bylines, articoleIranMass-media online internaționale4
Bogus Bylines, comentariiIranRețele sociale2

🔗 Raportul OpenAI despre operațiunile cu fațadă falsă


Claude Haiku 5.5 în instrumente terțe: GitHub Copilot îl oferă începând cu planul Pro, Devin îi acordă un scor de 58,4 %

Lansat pe 7 octombrie, Claude Haiku 5.5 a ajuns în aceeași zi în două instrumente de programare, fiecare comparându-l cu Claude Sonnet 5.

GitHub Copilot: Haiku 5.5 în toate planurile plătite, inclusiv Pro

7 octombrie — La puțin peste două ore după lansarea sa de către Anthropic, Claude Haiku 5.5 devine disponibil general în GitHub Copilot pentru planurile Pro, Pro+, Max, Business și Enterprise: inclusiv Pro, la fel ca Claude Sonnet 5.5 și spre deosebire de GPT-6.1 Sol la sfârșitul lui septembrie. Poate fi selectat în zece interfețe, de la VS Code la Xcode. GitHub îl recomandă pentru subagenți, modificări rapide și sarcini în terminal; potrivit primelor sale teste, a egalat Claude Sonnet 5 în numeroase sarcini de programare, cu mult mai puțini tokens și mai puține etape, fără cifre publicate. Este facturat la tariful public: 0,10 dolari per milion de tokens de intrare și 0,50 dolari la ieșire până la 100 000 de tokens de intrare, apoi 0,50 și 2,50 dolari, adică de zece ori mai puțin decât Claude Haiku 4.5 pentru primul prag.

🔗 Claude Haiku 5.5 în GitHub Copilot · Modele și tarife GitHub Copilot

Devin: 58,4 % pe FrontierCode 1.1, înaintea Claude Sonnet 5

7 octombrie — Cognition oferă acces la Claude Haiku 5.5 în Devin. Pe FrontierCode 1.1, benchmark-ul său proprietar care evaluează modelele pe sarcini reale de inginerie în funcție de calitatea codului și de posibilitatea de a-l integra, Haiku 5.5 obține 58,4 %, înaintea Claude Sonnet 5, la aproximativ o optime din costul acestuia per sarcină, potrivit Cognition, care nu oferă o sumă exactă. Se alătură și asistenților (sidekicks) din Devin Fusion, care asociază un model principal cu un model auxiliar: cu Claude Opus 5.5 ca model principal și Haiku 5.5 ca model auxiliar, Fusion păstrează un scor de 66,2, reducând în același timp costul și latența.

Model evaluat de CognitionScor FrontierCode 1.1 Extended
Claude Sonnet 556,2
Kimi K358,2
Claude Haiku 5.558,4
GPT-6.1 Sol60,4
Claude Sonnet 5.564,4
Claude Opus 5.565,3

🔗 Claude Haiku 5.5 în Devin


Agenți de programare: Claude Code 2.1.295, Codex CLI 0.162.0, Antigravity CLI 1.3.1, VS Code 1.141 și Delta 0.19

Cinci instrumente cu agenți de programare evoluează: Claude Code își consolidează mecanismele hooks, Codex CLI gestionează worktrees, Antigravity CLI regândește revizuirea modificărilor, VS Code organizează sesiunile agenților într-o grilă, iar Delta permite lucrul în echipă.

Claude Code 2.1.295: hooks care blochează acțiunile atunci când eșuează

8 octombrie — Claude Code a avut două versiuni în aceeași zi. Versiunea 2.1.294 corectează hooks prompt și agent redactate ca instrucțiuni în limbaj natural, care puteau permite ceea ce trebuiau să blocheze. Versiunea 2.1.295 cuprinde 143 de intrări, dintre care 97 de remedieri. Cu noua opțiune onFailure: "block" pentru hooks de tip command și HTTP, un hook care nu pornește, depășește timpul alocat sau returnează un cod neașteptat blochează acțiunea în loc să o permită; mai multe remedieri merg în aceeași direcție, pentru mecanismele de protecție ale mods și opțiunile --tools și --restricted. Claude Code acceptă și Program Status Protocol (OSC 7501), care permite terminalelor compatibile să afișeze dacă agentul lucrează, așteaptă sau a terminat, iar descrierile instrumentelor MCP încărcate prin căutarea de instrumente cresc de la 2 048 la 16 384 de caractere.

🔗 Claude Code 2.1.295 · Claude Code 2.1.294

Codex CLI 0.162.0: worktrees gestionate și sarcini fixate

8 octombrie — Codex CLI 0.162.0, prima versiune stabilă după 0.161.0 din ziua precedentă, enumeră 225 de PR. Când funcția worktrees este activată, Codex dispune de instrumente pentru a crea și a lista worktrees Git gestionate pornind de la proiecte locale de încredere, iar centrul de comandă al agenților permite fixarea unei sarcini cu tasta p, într-un grup « Pinned » partajat atunci când serverul permite acest lucru. Terminalul primește /copy pentru a parcurge și a copia blocurile transcrierii, Ctrl+Insert pentru a copia o selecție și o setare a vitezei de derulare, iar URL-urile devin accesibile prin clic inclusiv în aprobări și în prompturile MCP. Furnizorii de modele personalizate compatibili cu Responses API pot declara accesul web în timp real și compactarea la distanță. În privința remedierilor, apply_patch păstrează sfârșiturile de linie CRLF, sandbox-ul Linux este întărit, iar versiunile pentru Windows primesc un program de instalare PowerShell semnat.

🔗 Notele versiunii Codex CLI 0.162.0

Antigravity CLI 1.3.1: revizuire regândită în /diff, nivel mediu de detaliu în mod implicit

7 octombrie — CLI-ul Antigravity a avut cinci versiuni între 2 și 7 octombrie. Versiunea 1.3.1 îmbunătățește revizuirea codului în terminal: în vizualizarea fișierelor din /diff, săgețile stânga și dreapta deschid fișierul alăturat la prima sa modificare, fiecare fișier își păstrează poziția, n și N trec la fișierul următor sau precedent, iar antetul indică poziția curentă. Cele zece remedieri ale sale vizează în special /rewind în conversațiile foarte lungi, pluginurile pe Windows și sesiunile cu cheia GEMINI_API_KEY, care reîncearcă atunci când conexiunea cu API-ul Gemini se întrerupe. Versiunea 1.3.0 din 6 octombrie schimbă nivelul implicit de detaliu de la « high » la « medium », care grupează apelurile de instrumente și reflecțiile în rezumate concise; /config permite revenirea la setarea anterioară. Mai devreme, versiunea 1.2.16 încredința generarea de imagini unui subagent integrat, iar versiunea 1.2.15 aducea fișiere binare Android pentru Termux.

🔗 Jurnalul de modificări Antigravity, fila CLI

VS Code 1.141: sesiuni de agenți în grilă și curățarea worktrees

7 octombrie — VS Code 1.141 se concentrează pe sesiunile agenților Copilot. Fereastra Agents poate aranja mai multe sesiuni într-o grilă, iar comanda Chat: Open Worktree Cleanup afișează spațiul pe disc ocupat de worktrees ale sesiunilor inactive pentru a le șterge, la cerere sau automat după integrarea unui pull request. Conversațiile începute în Copilot CLI sau în aplicația GitHub Copilot apar de la prima lor solicitare, fără reîncărcarea editorului, iar o conversație Codex deschisă în aplicația ChatGPT sau în Codex CLI poate fi continuată aici cu istoricul său: alegând un model Copilot, utilizatorul continuă cu abonamentul GitHub Copilot, de exemplu după ce a atins limita de utilizare ChatGPT. Pentru companii, sandbox-ul harness-ului Copilot poate fi impus prin setările administrate, în versiune preliminară, iar acest harness devine treptat opțiunea implicită pentru utilizatorii care au funcțiile experimentale activate.

🔗 Notele versiunii VS Code 1.141

Delta 0.19: mențiuni între colegi și căsuță de primire

7 octombrie — Zed Industries publică Delta 0.19.0, mediul său de programare în echipă cu agenți, urmat pe 8 octombrie de versiunea 0.19.1 cu remedieri. Acum poate fi menționat un coleg într-un mesaj sau comentariu tastând @ urmat de numele său de utilizator, iar notificarea ajunge într-o nouă căsuță de primire (Inbox). Agentul @delta citește și modifică o mare parte din setări direct din conversație. O setare, Agent Thread Creation, împiedică agenții să creeze conversații de nivel superior fără a dezactiva subagenții, agentul poate combina worktrees din mai multe fire de discuție, iar comenzile CLI se execută fără a deschide o fereastră. În total, notele enumeră 11 noutăți, 22 de îmbunătățiri și 45 de remedieri. Pe 8 octombrie, o postare distribuită de Zed povestește cum echipa a înlocuit Google Docs cu Delta pentru documentele sale interne.

🔗 Notele versiunilor Delta · Postare Delta despre renunțarea la Google Docs


Media generativă: Nano Banana 2.1, Brand Kit și ElevenReader în Brazilia la ElevenLabs, SemanTok de la Stability AI

Patru anunțuri despre imagini, video și voce: un model de imagini la jumătate de preț la Google, un ghid de identitate vizuală reutilizabil și o aplicație de lectură audio la ElevenLabs, precum și o cercetare despre generarea video la Stability AI.

Nano Banana 2.1 devine disponibil general în API-ul Gemini, la jumătate de preț

6 octombrie — Google a trecut Nano Banana 2.1 (gemini-nano-banana-2.1) la disponibilitate generală în API-ul Gemini și Google AI Studio, fără o postare pe blog. Acest model de generare și editare a imaginilor actualizează Nano Banana 2, cu o calitate vizuală mai bună, o redare mai bună a textului, personaje mai consecvente de la o rundă la alta și formate panoramice, de la 1:4 la 8:1, fără artefacte de îmbinare a segmentelor în 2K și 4K. Acceptă până la 14 imagini de referință și se bazează pe căutarea Google. Prețul per imagine este înjumătățit în 1K și 2K, iar Google depreciază Nano Banana 2 (gemini-3.1-flash-image), fără o dată de oprire.

Preț la ieșireNano Banana 2.1Nano Banana 2
Imagine 1K0,0336 dollar0,067 dollar
Imagine 2K0,0504 dollar0,101 dollar
Imagine 4K0,113 dollar0,151 dollar
Milion de tokens de imagine30 dollars60 dollars

🔗 Notele versiunilor API-ului Gemini · Fișa Nano Banana 2.1

Brand Kit de la ElevenLabs: ghidul de identitate vizuală păstrat în spațiul de lucru

8 octombrie — ElevenLabs adaugă Brand Kit în ElevenCreative, suita sa de creație. Culorile, fonturile, siglele cu regulile lor de utilizare, imaginile de referință și regulile mărcii, inclusiv ceea ce marca nu face niciodată, formează un singur obiect în spațiul de lucru, care poate fi invocat prin @ în Image & Video, în Flows sau prin agentul ElevenCreative. Potrivit firului de postări ElevenLabs, un kit poate fi creat în câteva minute prin lipirea adresei unui site sau prin încărcarea resurselor organizației; întreaga echipă generează apoi conținut pe baza acelorași instrucțiuni, iar o agenție poate crea câte un kit pentru fiecare client. ElevenLabs vrea să extindă kiturile la vocea și sunetul mărcii, fără o dată precizată. Brand Kit este disponibil acum, fără un tarif precizat; HeyGen (august) și Runway (septembrie) oferă deja instrumente comparabile.

🔗 Postare ElevenLabs: Brand Kit · Fir de postări @ElevenLabs

SemanTok de la Stability AI: un model de 201M care egalează un model de 3,4 ori mai mare

7 octombrie — Echipa Interactive Research de la Stability AI prezintă SemanTok, un tokenizer video pentru modelele de lume (world models) care generează video token cu token, anunțat pe X pe 8 octombrie. În tokenizers « de la general la detaliat » (coarse-to-fine), primii tokens descriu scena în ansamblu, iar următorii adaugă detaliile; SemanTok face ca acești primi tokens să fie mai bogați în sens, deci mai ușor de prezis. Pentru aceasta, injectează în encoder caracteristici DINO înghețate și adaugă head-uri ușoare care le reconstruiesc din fiecare prefix de tokens. Potrivit Stability AI, un model autoregresiv de 201M de parametri construit pe SemanTok egalează sau depășește un model VideoFlexTok de 3,4 ori mai mare, iar prefixele scurte costă mai puțin de prezis. Articolul este pe arXiv; nu sunt menționate nici codul, nici ponderile.

🔗 Postare de cercetare Stability AI · Articol pe arXiv

ElevenReader ajunge în Brazilia cu vocea lui Fábio Porchat și 70 000 de cărți

8 octombrie — ElevenLabs lansează în Brazilia ElevenReader, aplicația sa care transformă cărți, documente și articole în conținut audio, gratuită pe iOS și Android, cu vocea actorului și comediantului Fábio Porchat. Catalogul se bazează pe un parteneriat cu Bookwire Brasil: 70 000 de titluri în portugheza braziliană, licențiate de principalele edituri din țară, dintre care majoritatea nu aveau o ediție audio. ElevenLabs a produs și Dom Casmurro, de Machado de Assis, citit de Fábio Porchat, cu muzică originală și design sonor. Potrivit directorului general al Bookwire Brasil, aceasta este cea mai amplă selecție de cărți braziliene oferită vreodată în format audio.

Oferta în BraziliaCondiții de acces
Aplicația ElevenReader (iOS, Android)Gratuită
Dom Casmurro citit de Fábio PorchatGratuit pentru toți
70 000 de titluri sub licență BookwireCu ElevenReader Ultra, preț nespecificat

🔗 Articolul ElevenLabs: ElevenReader în Brazilia


Modele specializate: LightOnOCR-3 pentru documente, Falcon-ASR pentru arabă, Carbon-A pentru genomuri

Trei modele specializate, dintre care două cu ponderi deschise, pentru citirea documentelor, transcrierea limbii arabe și adnotarea genomurilor.

LightOnOCR-3: trei modele OCR deschise care identifică și structura paginii

8 octombrie — LightOn publică sub licența Apache 2.0 LightOnOCR-3, în trei dimensiuni (0.8B, 1B și 4B). Pe lângă transcrierea unei pagini, modelele pot identifica fiecare regiune a acesteia: cu promptul de ancorare vizuală (grounding), fiecare bloc este precedat de o casetă de delimitare etichetată, imaginile primesc o scurtă descriere, iar graficele devin tabele HTML cu date. Pe o H100, modelul 4B procesează cu 21 % mai multe pagini pe secundă decât Chandra-OCR-2, construit, la fel ca acesta, pe Qwen3.5. LightOn precizează că scorurile sale sunt calculate după o normalizare a ieșirilor, publicată împreună cu depozitul, care modifică semnificativ scorurile tuturor modelelor de top.

Set de evaluareLightOnOCR-3-4BLightOnOCR-3-0.8BLightOnOCR-3-1BReferință citată
olmOCR-Bench, scor general86,385,584,5Infinity Parser Pro (35,1B) 87,6 ; Chandra 2 85,8
ParseBench, cinci categorii75,174,671,4Infinity Parser Pro 74,3
fr-bench-pdf2md, documente în franceză74,170,569,6Chandra 2 69,0 ; MistralOCR4.1 54,1

🔗 Articol despre LightOnOCR-3

Falcon-ASR: 1,6 miliarde de parametri pentru araba emirateză, fără ponderi publicate

7 octombrie — Technology Innovation Institute (TII) din Abu Dhabi prezintă Falcon-ASR, un model de recunoaștere vocală cu 1,6 miliarde de parametri, axat pe limba arabă și, în special, pe dialectul emiratez. Același set de ponderi transcrie și engleza, franceza, spaniola și portugheza, fără să fie necesară precizarea limbii, cu un marcaj temporal pentru fiecare cuvânt. La fel ca Falcon-OCR-Arabic și Falcon-Emirati, prezentate cu o zi înainte, acesta este disponibil doar ca demonstrație: TII anunță acces prin API și aplicații native, fără să publice ponderile.

Evaluarea ratei erorilor la nivel de cuvânt (WER)Scorul Falcon-ASRReferință citată
Media a șase seturi de date în arabă (Open Universal Arabic ASR)20,92 %23,17 %, cel mai bun rezultat publicat la 30 septembrie
Arabă emirateză, evaluare internă a TII22,73 %Qwen3-Omni, pe locul doi, cu 4,07 puncte mai mult
Media a șapte seturi de date în engleză (Open ASR Leaderboard)5,74 %Nicio referință citată

🔗 Articol despre Falcon-ASR

Carbon-A: 566 de milioane de gene candidate pentru 22 617 specii

8 octombrie — Echipa de biologie a Hugging Face (HuggingFaceBio) publică Carbon-A, un model cu 1,2 miliarde de parametri sub licența MIT, care identifică regiunile ce codifică proteine direct în ADN, folosind un singur model pentru mamifere, plante, ciuperci și protiști. Pe 42 de genomuri de referință, atinge un scor F1 mediu la nivel de nucleotide de 0,944 și depășește, potrivit autorilor, cele șapte instrumente comparate, printre care AUGUSTUS, Helixer și Tiberius. Echipa l-a rulat pe genomurile eucariote din GenBank pentru a construi Carbon Annotation Database: 48 167 de asamblări din 22 617 taxoni și 566 de milioane de loci codanți preziși, adică de 11 ori mai mulți taxoni decât în corpusul de antrenare. O validare în laborator cu ActiveSite și UCSD, prin secvențierea integrală a ARN-ului, confirmă o parte dintre gene; autorii precizează că acest lucru dovedește transcrierea, dar nu încă producerea proteinelor. Un nou lot este prevăzut peste trei săptămâni.

🔗 Articol despre Carbon-A


Antrenare prin întărire: cele 1 004 medii TermGrade și TRL v1.15.0

Două publicații pentru învățarea prin întărire: medii de terminal evaluate prin scoruri și o bibliotecă ce permite antrenarea pe secvențe mai lungi.

TermGrade: 1 004 medii de terminal evaluate de șase modele

8 octombrie — Compania ai& publică TermGrade, 1 004 medii de terminal pentru antrenarea și evaluarea agenților prin învățare prin întărire. Fiecare sarcină rulează într-un container Linux cu instrucțiuni și teste și a fost păstrată numai dacă propria soluție de referință trecea testele: dintre cele 66 165 de sarcini candidate scrise de DeepSeek-V4-Pro, 1,5 % au trecut acest filtru. Șase configurații de modele deschise, de la Kimi-K3 la gemma-4-31B-it, au fost testate pe fiecare sarcină, iar cele 36 144 de încercări sunt publicate, inclusiv eșecurile. Un model învață cel mai mult din sarcinile pe care le rezolvă cu succes aproximativ o dată din două: antrenat pe 151 de sarcini din această categorie, gemma-4-31B-it obține 46,1 pe Terminal-Bench 2.1, cu 3,1 puncte mai mult decât modelul de bază și cu 2,1 puncte mai mult, în medie, pe cinci antrenări. Totul este publicat sub licența Apache-2.0.

🔗 Articol despre TermGrade · Colecția TermGrade pe Hugging Face

TRL v1.15.0: un cap LM fuzionat pentru secvențe de până la 6,9 ori mai lungi

8 octombrie — TRL v1.15.0, biblioteca de antrenare de la Hugging Face, introduce un cap LM fuzionat (fused LM head) care calculează direct log-probabilitățile și entropia fiecărui token cu un kernel Triton, fără să construiască vreodată tensorul complet de logits; acesta este activat implicit pentru SFT, DPO, KTO, GRPO, RLOO și distilare. La 8 192 tokens, vârful consumului de memorie scade cu 52 până la 82 %, în funcție de metodă. Aceste măsurători au fost efectuate pe o B300 limitată la 79 Gio, cu ponderile aleatorii ale gemma-3-1b, al cărui vocabular cuprinde 262 000 tokens; câștigul este cel mai mare pentru modelele mici cu vocabular mare. Versiunea introduce și incompatibilități: suportul pentru Python 3.10 este eliminat, use_liger_kernel este depreciat, iar trainerul experimental MiniLLM este eliminat.

Metodă de antrenareLungime maximă în v1.14.2 (tokens)Lungime maximă în v1.15.0 (tokens)Factor de creștere
DPO10 24059 392×5,80
KTO (lot de 2)9 21663 488×6,89
GRPO28 672114 688×4,00
RLOO23 552100 352×4,26
SFT (pierdere nll)20 480107 520×5,25

🔗 Notele versiunii TRL v1.15.0


Inferență: llama.cpp în Windows ML, ML Drift în open source, Together AI pe B300 de la IBM Cloud

Trei anunțuri pentru rularea modelelor, de la PC-ul cu Windows la un cluster de GPU-uri.

llama.cpp ajunge în Windows ML, în stadiu experimental

7 octombrie — La evenimentul său Windows, Microsoft adaugă în Windows ML, cadrul său de inferență locală, suport experimental pentru llama.cpp: se descarcă un model GGUF de pe Hugging Face și se rulează local prin aceeași stivă Windows ML, folosind noi API dedicate unor sarcini specifice. O API nativă de execuție pentru Windows, de nivel mai scăzut, intră și ea în stadiul de previzualizare experimentală. Microsoft afirmă că contribuie direct la proiectul llama.cpp împreună cu NVIDIA și comunitatea: kerneluri CUDA optimizate, o planificare mai bună între procesor și GPU, CUDA graphs, decodare speculativă (Eagle-3, MTP, D-Flash2), execuție pe mai multe GPU-uri și formatul NVFP4. Articolul prezintă aceste noutăți pe PC-uri echipate cu cipuri NVIDIA RTX Spark, precum Surface Laptop Ultra. Pe X, Georgi Gerganov, de la llama.cpp, salută prezența proiectului la evenimentul Windows și vede în aceasta un semn că stivele software și hardware se întâlnesc în sfârșit.

🔗 Articolul Microsoft Foundry on Windows · Postarea @ggerganov

ML Drift: motorul GPU al LiteRT publicat în open source

8 octombrie — Echipa Google AI Edge publică în open source, sub licența Apache 2.0, ML Drift, motorul său de calcul pe GPU pentru inferența pe dispozitiv. Acesta ascunde diferențele dintre OpenGL ES, OpenCL, Metal și WebGPU, servește drept motor de accelerare GPU pentru LiteRT, este disponibil ca bibliotecă autonomă și înlocuiește delegatul GPU al TensorFlow Lite, care nu va mai primi funcționalități noi. Motorul schimbă kernelurile în funcție de faptul că LLM-ul citește promptul sau generează tokens și oferă un ghid SKILL.md pentru ca agenții de programare să scrie și să verifice shaders. Rulează deja în producție: cu până la 40 % mai puțină latență per imagine pentru efectele YouTube Shorts și un câștig de până la 30 % pentru Lightroom și Photoshop pe dispozitive mobile, potrivit articolului; pe Gemma, Google măsoară un consum de memorie cu până la 12 % mai mic decât în alte cadre software (frameworks).

🔗 Anunțul ML Drift pe Google Developers Blog · Depozitul google-ai-edge/ml-drift

Together AI, primul client al unui cluster de inferență cu GPU-uri B300 pe IBM Cloud

6 octombrie — Together AI anunță că lucrează cu IBM și NVIDIA pentru a-și extinde capacitatea de inferență destinată companiilor, începând cu un cluster mare de GPU-uri NVIDIA B300 găzduit pe IBM Cloud și interconectat prin rețeaua Ethernet Spectrum-X de la NVIDIA. Potrivit Together AI, acesta este primul cluster dedicat de inferență de o asemenea amploare pe IBM Cloud, iar compania este primul său client: ea operează stratul de inferență, IBM furnizează serviciile cloud, iar NVIDIA cipurile și rețeaua. Together AI justifică această extindere prin cererea pentru modele deschise: afirmă că procesează lunar sute de mii de miliarde de tokens pentru peste un milion de dezvoltatori. Articolul nu precizează nici dimensiunea clusterului, nici un calendar.

🔗 Articolul Together AI · Postarea @togethercompute


Știri pe scurt

  • Control mai rapid al Codex — În aplicația desktop ChatGPT, Codex ia în considerare mai devreme un mesaj de continuare trimis în timpul unei sarcini, pentru a corecta o abordare sau a schimba direcția; setarea Follow-up behavior stabilește dacă aceste mesaje ghidează execuția în curs sau așteaptă următoarea. 🔗 sursă
  • ChatGPT Go în Warp — Abonații la planul ChatGPT Go îl pot folosi acum în Warp pentru orice întrebare legată de terminal sau sarcină de programare; potrivit unui membru al echipei Sign in with ChatGPT de la OpenAI, citat de Warp, utilizarea inclusă este disponibilă clienților Go, pe lângă Plus și Pro, în toate aplicațiile partenere. 🔗 sursă
  • Oracle — Potrivit unui studiu de caz OpenAI, Oracle are 130 000 de utilizatori activi ai ChatGPT și peste 95 000 ai Codex; o cercetare a pieței talentelor care necesita 2 până la 4 zile se pregătește în 15 până la 20 de minute, iar Codex traduce întrebările de afaceri în interogări SQL. 🔗 sursă
  • Pollo AI — Această platformă de creare video, care declară că are peste 26 de milioane de utilizatori, direcționează cererile agentului său prin GPT-5.6, încredințează sarcinile dificile modelului GPT-6 Astra și toate imaginile sale modelului GPT-Image-2.5 și afirmă că reduce cu peste 50 % timpul petrecut pentru alegerea unui model. 🔗 sursă
  • Notele de versiune Devin din 7 octombrie — O secțiune de notificări reunește alertele sesiunilor, cu trimitere configurabilă pe telefon, starea cozii de merge se afișează în întreaga aplicație, iar cheile private salvate ca secrete sunt mascate linie cu linie în ieșirea comenzilor. 🔗 sursă
  • Copilot CLI 1.0.94 — Ajunsă în versiune stabilă după șase versiuni preliminare, adaugă Claude Haiku 5.5 în selectorul de modele, transmite codul shell afișat evaluatorului Assisted Permissions pentru a evita aprobările inutile și permite activarea unui server MCP înainte de detectarea acestuia. 🔗 sursă
  • Gemini CLI v0.65.0-nightly.20261008 — Telemetria acceptă antete OTLP personalizate (telemetry.otlpHeaders), o solicitare deschisă din octombrie 2025; CLI nu mai intră într-o buclă între verificare și OAuth, iar istoricul se încheie întotdeauna cu un mesaj al utilizatorului, ceea ce evită o eroare 400 după /rewind. 🔗 sursă
  • SDK Antigravity 0.1.21 izolează API-urile experimentale și configurează skill-urile subagenților — Prima versiune înscrisă în changelog de la 0.1.18 din 21 septembrie: un decorator @beta și un modul google.antigravity.beta separă versiunile preliminare de API-ul stabil, iar skills_config permite unui subagent să moștenească skill-urile agentului părinte, să le înlocuiască sau să nu le folosească. 🔗 sursă
  • Developer Knowledge API — Google prezintă ecosistemul acestui API, care furnizează documentația sa pentru dezvoltatori (Google Cloud, Firebase, Android) în Markdown actualizat: o comandă gcloud developer-knowledge preinstalată în Cloud Shell, un skill pentru agenți de programare conectat la un server MCP, cu Antigravity, Claude Code, Cursor și GitHub Copilot menționate, și biblioteci în șapte limbaje. 🔗 sursă
  • AQuA — Google Cloud publică, drept implementare de referință, acest agent de calitate (Ambient Quality Agent), care eșantionează până la 1 000 de sesiuni ale unui agent ADK în producție, grupează eșecurile, le urmărește în BigQuery și lansează o diagnosticare a cauzelor cu Gemini 3.8 Flash. 🔗 sursă
  • Ciornele intră în limitele pentru pull requests — Ca răspuns la contribuțiile de calitate scăzută, GitHub permite includerea pull requests în stadiul de ciornă în limitele per utilizator, în timp ce până acum un contribuitor putea deschide un număr nelimitat. 🔗 sursă
  • Arhivarea pull requests — Nu mai este rezervată administratorilor: rolurile triage, write, maintain și admin pot arhiva o pull request, ceea ce o închide, o ascunde publicului și blochează orice activitate nouă, inclusiv comentariile administratorilor. 🔗 sursă
  • Cronologiile GitHub și cititoarele de ecran — Cititoarele de ecran parcurg cronologiile pentru issues și pull requests ca liste, cu numărul de elemente și poziția curentă, și anunță evenimentele încărcate, pe github.com și GitHub Enterprise Server 3.23. 🔗 sursă
  • Paper Reproductions with ML Intern — Abubakar Abid anunță la Hugging Face o funcție care încredințează agenților reproducerea independentă a experimentelor dintr-un articol publicat, pornind de la Paper Pages, pentru a produce artefacte deschise care ajută la identificarea lucrărilor solide; fără cifre sau documentație. 🔗 sursă
  • Chatul Hugging Face prin SSH — Adrien Carreira, responsabil de infrastructura Hugging Face, prezintă un chat cu modele deschise, accesibil prin comanda ssh chat.hf.co, fără configurare sau cheie; nu este însoțit de documentație sau de o listă de modele. 🔗 sursă
  • huggingface_hub 2.2.0 — O mică versiune cu remedieri: hf jobs stats returnează acum un snapshot, apoi redă controlul (-f pentru urmărire în timp real), toate descărcările paralele trec prin hf_xet, iar două modificări rup compatibilitatea. 🔗 sursă
  • swarmlab — Hugging Face a deschis, fără anunț, această platformă de testare care studiază cum roiuri de agenți LLM de la furnizori diferiți găsesc adevărul sau se dezbină, în funcție de topologia schimburilor, întârzieri și roluri; o linie de YAML este suficientă pentru a testa o ipoteză. 🔗 sursă
  • Darwin-27B-ZTC — VIDRAFT publică sub Apache-2.0 un evaluator care returnează într-o singură trecere o distribuție de probabilități pentru răspunsurile posibile, fără să genereze vreun token: o acuratețe de 0,743 în zero-shot pe 2 000 de evaluări typed-decisions și un scor Brier de 0,097, potrivit autorilor săi. 🔗 sursă
  • Superfluid — basecompute publică sub Apache-2.0 acest server LLM local, compatibil cu API-urile OpenAI, Anthropic și Ollama, care acordă prioritate întrebărilor interactive față de activitatea agenților: un timp de răspuns de 0,36 secunde cu opt agenți activi, față de peste 10 secunde pentru llama-server, potrivit autorilor săi. 🔗 sursă
  • funes 1.8.0 — Instrumentul care indexează sesiunile agenților de programare adaugă un model de embeddings multilingv: pentru 30 de întrebări despre 2 000 de conversații în chineză, conversația corectă apare în primele opt rezultate de 30 de ori din 30, față de 23, iar rangul reciproc mediu crește de la 0,601 la 0,983. 🔗 sursă
  • GLiNER și limbile indiene — O postare a comunității arată că, prin păstrarea semnelor combinante în cuvinte, fără reantrenare, F1 mediu în zero-shot al GLiNER2 crește de la 13,2 la 68,0 pe nouă limbi indiene, iar cel al unei versiuni cu fine-tuning în hindi de la 59,9 la 82,6. 🔗 sursă
  • Multilingual Terminal-Bench — LILT detaliază platforma sa de testare cu 324 de sarcini de programare în zece limbi: Claude Opus 5.5 depășește Opus 5 cu aproximativ 3 puncte, cu un număr de tokens cu 30 % mai mic, ceea ce înseamnă un cost per sarcină cu aproximativ 45 % mai mic; Gemini 3.8 Flash are o mediană de 41 de ture per sarcină, față de 5 pentru GPT-6 Sol. 🔗 sursă
  • Primitive colective GPU — Milos Kotlar prezice timpul de comunicare al cinci primitive pe patru RTX 4090 cu o eroare medie de 10,9 %, față de 22,9 % pentru un model comun, dar cu un caz extrem de 61,6 %. 🔗 sursă
  • Best-of-N în raționamentul video — facebookresearch publică online, fără anunț și sub licența necomercială CC BY-NC 4.0, codul studiului Selecting or Solving? despre selecția best-of-N și juriile de verificatori în raționamentul video. 🔗 sursă
  • KDD Cup 2026 Data Agents — NVIDIA detaliază harness-ul care a clasat echipa sa KGMON pe locul al doilea cu un LLM mic impus: date convertite în tabele SQLite, schemă furnizată de la început, un set mic de instrumente, citirea țintită a documentelor; postarea nu oferă nici scorul, nici numele modelului. 🔗 sursă
  • Microduck — Matthieu Lapeyre, de la Pollen Robotics, anunță peste trei ore de autonomie cu o baterie de 2 600 mAh pentru acest mic robot biped echipat cu noua placă electronică proprie, cu un procesor a cărui temperatură maximă este de 60 °C în loc de 114 °C. 🔗 sursă
  • Albume pe Suno — Prezentată pe 5 octombrie, funcția este disponibilă: utilizatorii își reunesc piesele într-o lansare completă, aleg coperta, stabilesc ordinea pieselor și publică la momentul dorit; nu sunt precizate nici planul, nici limita numărului de piese. 🔗 sursă
  • HeyGen și Ryan Serhant — HeyGen lansează o serie video zilnică prezentată de avatarul oficial al agentului imobiliar Ryan Serhant, care apare în serialul Netflix Owning Manhattan, pe Instagram, TikTok și X; fără detalii financiare. 🔗 sursă
  • Runway și Tech Coalition — Runway se alătură acestei alianțe împotriva exploatării sexuale online a copiilor și programului său Lantern de partajare a semnalelor între platforme și reamintește măsurile sale de protecție: filtrarea datelor, teste adversariale, hashing, raportare către NCMEC și proveniență C2PA. 🔗 sursă
  • SpaceXAI și Omarchy — SpaceXAI devine sponsor fondator al Omacom Foundation cu 1,5 milioane de dolari în tokens Grok; Grok 4.7 și succesorii săi vor alimenta agenții proiectului, inclusiv Omabot, care examinează pull requests. 🔗 sursă
  • Ghidul Perplexity privind măsurile de protecție — Perplexity publică un ghid care plasează măsurile de protecție pentru IA în trei momente (intrare, acțiunea agenților, ieșire), compară cinci tipuri de protecții și ilustrează șapte cazuri, de la injecția de prompt la halucinație; fără funcționalități noi. 🔗 sursă
  • pplx-decider-v1.1-27b pe OpenRouter — Modelul de decizie cu ponderi deschise al Perplexity ajunge pe OpenRouter la tariful Decisions API: 0,02 dolari per milion de tokens de intrare, ieșire gratuită, context de 262 000 tokens. 🔗 sursă
  • Cohere la Ottawa — Cohere își deschide primul birou la Ottawa, lângă parcul Lansdowne, unde lucrează deja aproape 30 de angajați (comercializare, inginerie, infrastructură, securitate, IA suverană); nu sunt precizate nici suprafața, nici obiectivul privind numărul de angajați. 🔗 sursă

Ce înseamnă acest lucru

Asistentul produce acum și materiale de lucru, pe lângă răspunsuri. Un tablou de bord Claude Dashboards se actualizează când datele se schimbă, o animație Claude Motion poate fi în continuare modificată cuvânt cu cuvânt deoarece este scrisă în cod, iar Docs, Slides și Design, ieșite din beta pentru toate planurile, raportează deja peste 45 de milioane de creații. Aceste materiale circulă apoi în instrumentele existente: tabloul de bord ajunge în Grafana sau PostHog, animația în Runway sau Luma, care îi adaugă cadre generate. Brand Kit de la ElevenLabs urmează aceeași logică: ghidul de identitate vizuală devine un obiect al spațiului de lucru, apelat prin @, în locul unei instrucțiuni de repetat în fiecare prompt.

Securitatea trece la o altă scară, atât în apărare, cât și în aplicarea regulilor. Anthropic constată că găsirea vulnerabilităților nu a fost niciodată atât de ușoară: peste 29 000 de vulnerabilități candidate în șase luni, dintre care aproximativ 6 000 triate manual. OSS Scanner își asumă trimiterea rapoartelor fără verificare umană, cu o proporție estimată de peste 90 % de rezultate corect pozitive, pentru a reduce acest blocaj. Regulile de utilizare devin în paralel mai clare: politica Anthropic din 2026 grupează campaniile înșelătoare într-o secțiune dedicată, iar OpenAI prezintă Dark Clark drept prima operațiune de categoria 5 pe care a destructurat-o de la începutul publicării rapoartelor sale. În instrumente, Claude Code 2.1.295 permite acum ca un hook care eșuează să blocheze acțiunea în loc să o lase să treacă.

Viteza și prețul devin setări pe care le putem alege. Ultrafast vinde GPT-6.1 Sol de șase ori mai scump pentru o viteză de până la 8 ori mai mare; potrivit GitHub și Cognition, Claude Haiku 5.5 egalează sau depășește Sonnet 5 la programare, la aproximativ o optime din costul per sarcină, conform Cognition; Nano Banana 2.1 înjumătățește prețul unei imagini 1K. Inferența se extinde de la dispozitiv, cu llama.cpp în Windows ML și ML Drift pe GPU-urile telefoanelor și calculatoarelor, până la clusterul de B300 al cărui prim client pe IBM Cloud este Together AI, iar TRL reduce cu 52 până la 82 % consumul maxim de memorie al unui antrenament cu 8 192 tokens.

În fine, multe dintre cifrele de astăzi sunt măsurate chiar de cei care le publică. FrontierCode este benchmark-ul proprietar al Cognition, GitHub spune că Haiku 5.5 egalează Sonnet 5 fără să publice cifre, LightOn își calculează scorurile după o normalizare care le modifică pe cele ale tuturor modelelor de top, TII evaluează Falcon-ASR în dialectul emiratez doar pe un set de date intern și nu îi publică ponderile, iar autorii Carbon-A îl compară ei înșiși cu șapte instrumente. Știința deschisă oferă o contrapondere: TermGrade își publică cele 36 144 de încercări, inclusiv eșecurile, Carbon-A baza sa de 566 de milioane de gene candidate, iar harta ultravioletă Claude Science distinge pixel cu pixel ceea ce este măsurat de ceea ce este prezis. Cele 150 de milioane de dolari de la Anthropic și miliardul de la NVIDIA pentru Genesis Mission împing în aceeași direcție: punerea acestor instrumente în mâinile cercetătorilor.


Surse