Căutare

Mistral Large 4 în versiune preliminară, Claude ajunge în Google Docs, Sheets și Slides, Anthropic își extinde programul de securitate cibernetică

ai-powered-markdown-translator

Articol tradus din fr în ro cu gpt-6.1-sol.

Vezi proiectul pe GitHub ↗

Mistral lansează în versiune preliminară Mistral Large 4, un model multimodal cu 1 000 de miliarde de parametri, al cărui API este accesibil tuturor începând de astăzi și ale cărui ponderi sunt promise pentru sfârșitul lunii octombrie. Anthropic integrează Claude în Google Docs, Sheets și Slides și își reorganizează programul de verificare pentru securitate cibernetică în trei niveluri de acces, în timp ce Google DeepMind publică EmbeddingGemma 2, un model de embeddings deschis și multimodal care încape pe un telefon. Și modelele de decizie au parte de o zi plină: OpenAI își deschide API-ul Decisions în beta publică, Perplexity își reduce prețul la jumătate, iar un clasament realizat de comunitate le departajează.


Mistral Large 4: 1 000 de miliarde de parametri în versiune preliminară, ponderi promise pentru sfârșitul lunii octombrie

6 octombrie — Mistral AI lansează în versiune preliminară publică Mistral Large 4, supranumit ML4 și, „foarte oficial”, Chonk. Este cel mai mare model al companiei de până acum: un amestec de experți (Mixture-of-Experts) multimodal nativ, cu 1 000 de miliarde de parametri (1T), dintre care 49 de miliarde sunt activi potrivit articolului de anunț, care combină respectarea instrucțiunilor, raționamentul și capacitățile agentice într-un context de un milion de tokens. Fișa din documentație oferă alte cifre, fără să explice diferența: 1 050 de miliarde de parametri, dintre care 52 de miliarde sunt activi, plus un encoder vizual de 1,6 miliarde.

API-ul este deschis tuturor începând de astăzi pe Mistral Studio, dar ponderile nu sunt încă publicate: Mistral le promite până la sfârșitul lunii octombrie, împreună cu detalii despre arhitectură și post-antrenare. Între timp, modelul este testat în condiții reale de responsabili de securitate cibernetică, parteneri verificați și autorități de stat, care îl accesează cu o moderare redusă. ML4 a fost antrenat de la zero pe 3 800 de GPU-uri NVIDIA Grace Blackwell în centrele de date europene ale Mistral, care deservesc și versiunea preliminară. Compania prevede o implementare europeană pe care o operează integral, sub incidența legislației europene, și prezintă modelul ca pe primul reper al foii de parcurs finanțate prin runda sa de serie D, în valoare de 3 miliarde de euro.

Securitatea cibernetică este principalul argument. Potrivit Mistral, ML4 se numără printre primele cinci modele din Artificial Analysis Cyber Index și obține 82 % la unul dintre testele acestuia, care constă în reproducerea unei vulnerabilități reale dintr-un program open source și apoi remedierea ei, cel mai bun scor dintre toate modelele. Compania afirmă că Claude Opus 5.5 și GPT-6 Astra obțin aproape zero la același test, deoarece refuză sarcina.

Benchmark evaluatScor anunțat de MistralComparație citată de Mistral
DeepSWE v1.161,7 %—
Coding Agent Index (combinat)49,8 %înaintea DeepSeek V4 Pro 0813 și Qwen3.8 Max
Evaluare umană în orb realizată de Surge AI (cod, din 5)3,74, locul 2 din 5după Claude Opus 5 (4,22)
Cybench (40 de provocări)93 %—
AA Cyber Index, reproducerea și apoi remedierea unei vulnerabilități82 %cel mai bun scor dintre toate modelele
AutomationBench (657 de procese de afaceri)59,9 %înaintea Kimi K3, MiMo-V2.6-Pro și DeepSeek V4 Pro

Articolul și fișa diferă și în privința prețului: cardul din articol afișează 1,36 dolari per milion de tokens la intrare și 4,18 dolari la ieșire, în timp ce fișa afișează aceste tarife tăiate și, alături, un preț redus la jumătate, fără să precizeze durata sau să ofere o explicație.

Caracteristică ML4Potrivit articolului de anunțPotrivit fișei din documentație
Parametri în total1 000 de miliarde1 050 de miliarde
Parametri activi49 de miliarde52 de miliarde
Intrare, per milion de tokens1,36 dollar0,68 dollar (1,36 tăiat)
Ieșire, per milion de tokens4,18 dollars2,09 dollars (4,18 tăiat)

Toate aceste scoruri provin de la Mistral, care precizează că învățarea prin întărire a versiunii preliminare continuă fără semne de saturație și anticipează progrese rapide în săptămânile următoare.

🔗 Articolul Mistral despre Mistral Large 4 🔗 Fișa Mistral Large 4 din documentație


Claude for Google Workspace: Claude se instalează în Docs, Sheets și Slides

6 octombrie — Anthropic lansează Claude for Google Workspace, un modul suplimentar (add-on) care deschide Claude într-un panou lateral în Google Docs, Sheets și Slides, în beta publică pentru toate abonamentele plătite. Claude citește fișierul deschis, vede selecția curentă (text, celule sau diapozitive) și modifică direct fișierul.

Aplicație GoogleCe face Claude în aceasta
DocsCorecturi și schimbări de stil direct în document, carduri de sugestii de aplicat sau ignorat pentru rescrierile mai ample
SheetsFormule, tabele pivot, grafice native, file noi, procesarea unui interval cu Python pentru o îmbinare sau o curățare
SlidesDiapozitive create pe baza machetelor și a temei prezentării, verificarea elementelor care se suprapun sau depășesc marginile

Utilizatorul alege gradul de autonomie: în modul „solicită aprobarea înainte de modificări” (Ask before edits), activ implicit, fiecare modificare trece printr-un card de aprobare; în modul „acceptă toate modificările” (Accept all edits), Claude continuă fără să se oprească. Conectat la contul Claude, panoul folosește aceleași modele, conectori și competențe (skills). Pentru abonamentele Enterprise, Compliance API, cheile de criptare gestionate de client (CMEK) și exportul de audit OpenTelemetry se aplică și modulului.

Claude now works inside Google Docs, Sheets, and Slides, and those files also open inside Claude. In Google Workspace, Claude sits in a sidebar next to your file, reads what you have open, and edits it in place. You can approve each edit before it lands.

🇷🇴 Claude funcționează acum în Google Docs, Sheets și Slides, iar aceste fișiere se deschid și în Claude. În Google Workspace, Claude apare într-un panou lateral lângă fișierul dumneavoastră, citește ceea ce ați deschis și îl modifică direct. Puteți aproba fiecare modificare înainte de a fi aplicată. — @claudeai pe X

În același timp, devine disponibilă și funcționarea în sens invers: noi conectori Google Docs, Sheets și Slides, și ei în beta, permit crearea și modificarea fișierelor Google din Claude, prin lipirea unui link sau solicitarea unui document nou. În configurațiile acceptate, fișierul se deschide într-un panou lângă conversație, iar accesul lui Claude respectă permisiunile de partajare Google. Modulul se instalează din Google Workspace Marketplace (Extensions > Claude > Open Claude), iar administratorii îl pot implementa din consola Google Admin; pe Team și Enterprise, un proprietar trebuie mai întâi să activeze conectorii. Google Workspace se alătură astfel Microsoft 365, unde Claude pentru Excel, PowerPoint și Word este în disponibilitate generală din 7 mai.

🔗 Articolul Anthropic despre Claude for Google Workspace


Cyber Verification Program: Anthropic deschide accesul la Opus 5.5, Sonnet 5.5 și Mythos 5.1 pe trei niveluri

6 octombrie — Anthropic își reorganizează programul de verificare pentru securitate cibernetică (Cyber Verification Program, CVP), care le oferă profesioniștilor verificați din domeniul securității acces la capacități pe care modelele sale pentru publicul larg le blochează. De șase luni coexistau două mecanisme: Project Glasswing, care oferea acces la Claude Mythos organizațiilor responsabile de cele mai critice programe software, și un CVP cu un singur nivel, care relaxa măsurile de protecție ale modelelor Opus și Sonnet. Acestea se unifică într-un program cu trei niveluri, toate oferind acces la Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 și la modelele viitoare. Modelele aflate în disponibilitate generală (Opus 5.5, Fable 5.1, Sonnet 5.5) păstrează măsuri de protecție prudente, care blochează majoritatea activităților cibernetice.

Nivel de accesUtilizări acoperitePublic vizat și termen
Defense AccessCentru de operațiuni de securitate, răspuns la incidente, inginerie inversă a programelor malware, analiză a vulnerabilitățilorEchipe de securitate, infrastructuri critice de orice dimensiune, responsabili de întreținerea proiectelor open source, cercetători; câteva zile
Red Team AccessUtilizări defensive, plus teste de penetrare și exerciții de atac simulat (red teaming) autorizateDoar organizații, pe sistemele pe care sunt autorizate să le testeze; câteva săptămâni
Specialized AccessTestarea sistemelor critice pentru siguranță: aviație, rețele electrice, telecomunicații, transferuri interbancare, rețele administrativeCâteva organizații evaluate individual împreună cu guvernul american; membrii Glasswing transferați

În Red Team Access, acțiunile care pot provoca daune fizice sau perturbări masive, precum implementarea unui ransomware, rămân blocate în timp real. Pentru a-și verifica setările, Anthropic a supus Opus 5.5 la CyScenarioBench, o evaluare a operațiunilor cibernetice în mai multe etape, cu măsurile de protecție ale fiecărui nivel (10 provocări, câte 5 încercări).

Configurație testată de Anthropic (Opus 5.5)Rezultat la CyScenarioBench (50 de încercări)
Fără CVPToate sarcinile blocate de la primul prompt
Defense Access46 de încercări blocate la un moment dat, 4 reușite
Red Team AccessNicio blocare, 34 de sarcini reușite, echivalentul procentului de 67,6 % obținut de modelul fără măsuri de protecție

Articolul prezintă și un prim bilanț al Glasswing, cu cifre parțiale potrivit Anthropic: cel puțin 129 000 de vulnerabilități verificate descoperite de parteneri din aprilie până în iulie, plus 5 500 prin analizele open source ale Anthropic, dintre care peste 33 000 clasificate drept critice sau cu severitate ridicată. Aceste cifre se bazează pe 33 de rapoarte ale partenerilor, iar Anthropic estimează că impactul real este „de cel puțin cinci ori mai mare”. Într-o mărturie publicată în aceeași zi, Comcast spune că a descoperit cu Claude Mythos Preview o vulnerabilitate critică de autentificare, evaluând 258 de sisteme și aproximativ 170 de milioane de linii de cod, iar un analist Booz Allen a examinat 138 de depozite în douăsprezece zile.

Din punct de vedere practic, programul impune păstrarea datelor pentru monitorizarea abuzurilor, în așteptarea Enterprise Frontier Safeguards (EFS), care va permite mai târziu în această toamnă păstrarea acestor date într-un cloud controlat de client; organizațiile care folosesc deja Fable 5.1 sau Mythos 5.1 cu retenție zero pot proceda la fel și cu CVP. Programul este disponibil pe Claude Platform, Vertex AI și Microsoft Foundry, iar pe Amazon Bedrock doar pentru clienții eligibili pentru EFS. O cerere individuală poate fi depusă doar pentru Defense Access, în cadrul unui abonament plătit, iar acest nivel va trebui să adopte până la 15 decembrie o autentificare multifactor rezistentă la phishing și să renunțe la cheile API. Un webinar este programat pe 14 octombrie la ora 9 PT.

🔗 Articolul Anthropic despre Cyber Verification Program 🔗 Pagina de ajutor pentru Cyber Verification Program 🔗 Comcast și Booz Allen cu Claude Mythos


EmbeddingGemma 2: modelul deschis de embeddings al Google devine multimodal

6 octombrie — Google DeepMind publică EmbeddingGemma 2, a doua generație a modelului său deschis de embeddings conceput pentru a rula pe dispozitiv. Primul EmbeddingGemma, descărcat de peste 20 de milioane de ori potrivit Google, procesa doar text; noul model proiectează textul (inclusiv codul), imaginile, materialele video și audio, separat sau în combinație, în același spațiu cu 768 de dimensiuni. Construit pe arhitectura Gemma 4, este lansat sub licența Apache 2.0.

Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space.

🇷🇴 Vă prezentăm EmbeddingGemma 2, primul nostru model deschis nativ multimodal pentru embeddings pe dispozitiv. Acesta depășește textul pentru a unifica codul, imaginile, materialele audio și video într-un spațiu comun. — @GoogleDeepMind pe X

Modelul are 740 de milioane de parametri, dar este modular: un nucleu pentru text de 270M, la care se adaugă, la cerere, un encoder vizual (170M) și un encoder audio (300M). Prin urmare, o aplicație care folosește doar text încarcă numai 270M de parametri. Cu cuantizare, Google măsoară pe un Pixel 11 Pro aproximativ 191 Mo de RAM activă pentru ponderile componentei text și 567 Mo pentru modelul multimodal complet.

Caracteristică a EmbeddingGemma 2Valoare anunțată de Google
Număr total de parametri740M (text 270M, viziune 170M, audio 300M)
Dimensiunile vectorilor768, cu posibilitatea de trunchiere la 512, 256 sau 128
Fereastră de context8K tokens, de patru ori mai mare decât la prima versiune
RAM activă pe Pixel 11 Pro (cuantizat)aproximativ 191 Mo doar pentru text, 567 Mo în modul multimodal
MTEB Code78,68, față de 68,76 pentru prima versiune
MTEB multilingv v261,36, față de 61,15 pentru prima versiune

Învățarea reprezentărilor „în păpuși rusești” (Matryoshka Representation Learning) permite scurtarea vectorilor, reducând de până la șase ori spațiul de stocare necesar; potrivit fișei modelului, calitatea rămâne puțin afectată până la 256 de dimensiuni, iar 128 de dimensiuni sunt potrivite mai ales pentru utilizările exclusiv textuale. Cea mai clară îmbunătățire privește codul, cu aproape zece puncte în plus pe MTEB Code potrivit Google, în timp ce textul multilingv rămâne la nivelul anterior.

Utilizările vizate sunt căutarea și generarea augmentată prin recuperarea informațiilor (RAG), desfășurate integral local, de exemplu găsirea unui fragment dintr-un material video pornind de la o notiță vocală. Deoarece modelul folosește același segmentator de text (tokenizer) și același encoder audio ca Gemma 4, cele două pot rula împreună cu un consum redus de memorie. Ponderile sunt disponibile pe Hugging Face și Kaggle; disponibilitatea în Model Garden al Gemini Enterprise Agent Platform este anunțată pentru „în curând”, fără o dată. Modelul este acceptat încă de la lansare de Transformers (versiunea 5.19.0), sentence-transformers, MLX, vLLM, llama.cpp, Ollama și LM Studio, precum și în browser prin transformers.js.

🔗 Anunțul de pe blogul Google 🔗 Fișa modelului EmbeddingGemma 2 🔗 Ponderile pe Hugging Face


Modele de decizie: OpenAI își deschide API-ul Decisions, Perplexity publică Decider v1.1 și îi înjumătățește prețul, iar Decision Index 0.3 le clasifică

Modelele de decizie, care aleg o opțiune sau evaluează o intrare în loc să redacteze un răspuns liber, au avut ziua lor: doi furnizori își revizuiesc oferta și tarifele, iar clasamentul comunitar al categoriei își schimbă metoda.

API-ul Decisions al OpenAI în beta publică

6 octombrie — La o săptămână după deschiderea accesului limitat la DevDay, API-ul Decisions al OpenAI intră în beta publică, disponibilitatea generală fiind așteptată „în următoarele săptămâni”. Acesta răspunde la întrebări închise despre un text, o imagine sau ambele, folosind GPT-6 Luna, singurul model disponibil, printr-un endpoint dedicat (POST /v1/decisions); potrivit OpenAI, răspunsurile sale cu tipuri definite sosesc de aproximativ 10 ori mai repede decât prin Responses API. Noutatea zilei este tariful: 0,10 dolari per milion de tokens de intrare, fără facturarea ieșirii sau a cache-ului, la care se adaugă costurile suplimentare pentru procesarea regională și contextul lung.

Tip de întrebareUtilizare vizatăRezultat returnat
Predicat (predicate)Verificarea unei condiții, precum un produs deteriorat într-o fotografieProbabilitate de la 0 la 1 ca acea condiție să fie adevărată
Alegere (choice)Selectarea unei opțiuni dintr-o listă furnizatăOpțiunea, probabilitatea fiecăreia și un indice de încredere
Scor (score)Evaluarea pe niveluri ordonate, precum gravitatea unui incidentMedia nivelurilor ponderată cu probabilitățile

Mai multe întrebări pot viza aceeași intrare într-o singură solicitare, iar imaginile trebuie trimise în base64, fără URL găzduit sau identificator de fișier. API-ul acceptă nepăstrarea datelor (Zero Data Retention) și utilizările HIPAA pentru clienții eligibili, cu rezidența datelor în Statele Unite și în Europa.

🔗 Ghidul API-ului Decisions 🔗 Changelog-ul API-ului OpenAI

pplx-decider-v1.1-27b de la Perplexity și înjumătățirea prețului

6 octombrie — La cinci zile după lansarea propriului Decisions API, Perplexity actualizează modelul care îl susține, într-un fir de postări de pe contul său pentru dezvoltatori, @perplexitydevs. Publicat cu ponderi deschise sub licența Apache 2.0 pe Hugging Face, pplx-decider-v1.1-27b păstrează baza Qwen3.8-27B a versiunii v1, citește text și imagini într-un context de 250k tokens și elimină masca cauzală (causal mask) a straturilor sale cu atenție completă. Decisions API, care oferă acum acest model, costă 0,02 dolari per milion de tokens de intrare, de două ori mai puțin decât cei 0,04 dolari ai versiunii v1, iar ieșirea rămâne gratuită.

Categorie din Decision Index (fișa Hugging Face)Scorul JevScorul v1Scorul v1.1
Cunoștințe (Knowledge)51,440,948,18
Limbaj (Language)62,063,569,45
Recuperarea informațiilor (Retrieval)55,454,961,26
Instrumente (Tools)75,179,378,88
Arte (Arts)37,739,444,66
Scor global ponderat57,956,461,56

Potrivit fișei modelului, scorul global crește de la 56,4 la 61,56, depășind cele 57,9 ale Jev, modelul de decizie al TypeSafe AI, care rămâne totuși în față la cunoștințe. Perplexity afirmă, de asemenea, că obține cel mai bun scor în noul Decision Index 0.3. Pentru a-l găzdui pe cont propriu, este necesar un GPU capabil să încarce aproximativ 49 Gio de ponderi și implementarea furnizată, deoarece inferența cauzală standard nu reproduce comportamentul măsurat.

🔗 Firul de postări al @perplexitydevs pe X 🔗 pplx-decider-v1.1-27b pe Hugging Face

Decision Index 0.3

6 octombrie — apolinario, inginer la Hugging Face, publică versiunea 0.3 a Decision Index, clasamentul comunitar al modelelor de decizie deschise care reproduc Decision Model al Jev. Acesta include acum 112 modele, dintre care 111 reproduceri deschise, care rulează pe o NVIDIA RTX PRO 6000. Metoda se schimbă: scorul complet (Full score) combină 37 de benchmark-uri publice, teste private care măsoară aceleași competențe și sarcini private din domenii noi, astfel încât poziția să reflecte competențele, nu doar reușita la benchmark-uri cunoscute. Apare și o filă pentru viziune.

Poziție afișatăModel clasificatScor complet
1Perplexity Decider v1.1 (27B)62,8
2Fastino GLiDE fără raționament (28B)60,2
ReferințăJev60,1
3Torchcast Decision 27B59,9
4deck31b (Gemma 4 31B)59,0

Cele două scoruri ale Decider v1.1 nu trebuie confundate: 61,56 este cel publicat în fișa Perplexity, iar 62,8 este cel calculat de acest clasament folosind noua sa metodă. Testele private, prin natura lor, nu sunt publicate.

🔗 Anunțul lui apolinario pe X 🔗 Decision Index 0.3


Controlul computerului: OpenAI antrenează GPT-6 Astra pe contractele Ironclad

6 octombrie — OpenAI lansează colaborări de cercetare cu furnizori de software pentru a-și face agenții mai eficienți în aplicațiile de afaceri, un proiect de control al computerului (computer use), și începe cu Ironclad, specialist în contracte asistate de IA. Echipele au definit 11 sarcini juridice, comerciale și de achiziții, fiecare necesitând între 30 și 40 de minute pentru un utilizator experimentat, potrivit OpenAI, evaluate pe baza a 8 până la 50 de criterii. Ironclad a furnizat medii găzduite ale aplicației sale, în care modelele s-au antrenat prin învățare prin întărire pe sarcini sintetice extrase din contracte publice din baza EDGAR a SEC.

Măsurătoare OpenAI pentru cele 11 sarciniGPT-5.6 Sol (raționament High)GPT-6 Astra (raționament Max)
Scor mediu41,6 %55,0 % (+32 %)
Timp mediu estimat per încercare (simulat)37,0 minute19,2 minute (-48 %)

GPT-6 Astra este primul model de frontieră al OpenAI antrenat pe aceste sarcini, iar un model intern folosit în timpul dezvoltării sale atinge 63,7 %. Aceste cifre provin de la OpenAI, iar timpii sunt simulați pe baza unor viteze de procesare presupuse, fără a fi măsurați la clienți. OpenAI invită alți furnizori să propună sarcini pe care agenții actuali încă nu le îndeplinesc în mod fiabil.

🔗 Articolul OpenAI despre colaborarea cu Ironclad


API-uri și platforme: niveluri și BAA pentru API-ul OpenAI, documente și imagini în Agent API al Perplexity, GLM-5.3 pe Bedrock

Patru schimbări îi vizează pe dezvoltatorii care cumpără servicii de inferență: condițiile de acces la API-ul OpenAI, instrumentele Agent API al Perplexity și un nou model deschis în catalogul AWS.

Nivelurile de utilizare ale API-ului OpenAI trec de la cinci la trei

6 octombrie — OpenAI simplifică accesul la cele mai ridicate limite ale ratei de solicitări (rate limits) ale API-ului său: cele cinci niveluri de utilizare cu plată devin trei, Build, Launch și Grow. Cel mai înalt, Grow, se obține cu 500 de dolari în plăți API cumulate, față de 1 000 de dolari pentru vechiul nivel maxim. Organizațiile aflate deja pe un nivel cu plată sunt transferate automat, fără nicio acțiune din partea lor, apoi trec la un nivel superior când achizițiile cumulate de credite ating pragurile; nivelul gratuit rămâne plafonat la 100 de dolari pe lună.

Nivel de utilizarePrag de achiziții cumulatePlafon lunar de utilizareAstra, Sol și Terra (solicitări și tokens pe minut)Luna (solicitări și tokens pe minut)
Build5 dolari500 dolari5 000 și 1 000 0005 000 și 2 000 000
Launch100 dolari5 000 dolari10 000 și 4 000 00010 000 și 10 000 000
Grow500 dolari200 000 dolari15 000 și 40 000 00030 000 și 180 000 000

🔗 Firul de postări al @OpenAIDevs pe X 🔗 Documentația limitelor ratei de solicitări

BAA și conformitatea cu HIPAA în regim de autoservire pe API-ul OpenAI

5 octombrie — Organizațiile care procesează date de sănătate protejate prin API-ul OpenAI pot acum să semneze singure acordul de partener comercial (Business Associate Agreement, BAA) cerut de legea americană HIPAA. În Settings > Organization > General, un administrator acceptă BAA standard și activează suportul pentru conformitatea cu HIPAA, fără un contract enterprise. Acest regim de autoservire este rezervat organizațiilor eligibile care au un istoric stabilit de utilizare a API-ului, iar activarea nu poate fi anulată din aceste setări. Clauzele personalizate necesită în continuare o solicitare prin e-mail, cu un răspuns în una până la două zile lucrătoare. OpenAI reamintește că semnarea BAA nu face, de una singură, o aplicație conformă și că nu se oferă niciun BAA pentru ChatGPT Business.

🔗 Articolul de ajutor OpenAI despre BAA pentru API

Agent API al Perplexity citește documente și caută imagini

5 octombrie — Changelog-ul API-ului Perplexity primește trei intrări spre sfârșitul serii. Agent API acceptă acum ca intrare documente PDF, DOC, DOCX, TXT și RTF, incluse în solicitare sau indicate printr-un URL HTTPS public, compatibilitatea depinzând de modelul și furnizorul aleși. Un instrument nou, image_search, caută imagini pe web și returnează rezultate structurate, cu adresa imaginii și cea a paginii sale de origine: de la 1 la 30 de imagini per apel, 5 implicit, filtre pentru domenii și formate și căutare sigură activată implicit. Costă 2,50 dolari pentru 1 000 de invocări reușite, iar apelurile eșuate nu sunt facturate. A treia intrare corectează calculul costurilor: răspunsurile detaliază acum costul extragerilor efectuate în sandbox, la tariful neschimbat al GPT-6 Luna.

🔗 Changelog-ul API-ului Perplexity 🔗 Documentația instrumentului image_search

GLM-5.3 de la Z.ai pe Amazon Bedrock

6 octombrie — Z.ai anunță disponibilitatea GLM-5.3, modelul său emblematic cu ponderi deschise, pe Amazon Bedrock; fișa AWS datează lansarea pe 5 octombrie. Este un model de tip mixture-of-experts cu 744 de miliarde de parametri, dintre care aproximativ 40 de miliarde activi per token, cu un context de un milion de tokens și până la 128 000 de tokens la ieșire. Accesul este rezervat clienților eligibili, care trebuie să contacteze echipa lor de cont AWS, iar modelul este oferit doar prin inferență între regiuni (profil US sau global), cu stocarea în cache a prompturilor începând de la 1 024 de tokens și nivelurile de serviciu Standard, Priority, Flex și Reserved. Fișa nu indică un preț și trimite la pagina de tarife Bedrock. GLM-5.3 urmează după Kimi K3 (22 septembrie) și Grok 4.7 (28 septembrie), devenite disponibile pe Bedrock în ultimele două săptămâni.

🔗 Fișa GLM 5.3 pe Amazon Bedrock 🔗 Anunțul Z.ai pe X


Agenți de programare: Claude Code 2.1.290 până la 2.1.292, sesiuni cloud, Vibe CLI 2.26.0, Antigravity și Replit

Agenții de programare primesc cinci actualizări, de la terminal la editor: trei versiuni Claude Code în mai puțin de douăzeci de ore, un ghid al sesiunilor cloud, un Vibe CLI a cărui nouă interfață în Rust se extinde, extensia Antigravity pentru VS Code și un Replit care vede toate proiectele utilizatorului.

Claude Code de la 2.1.290 la 2.1.292

5 și 6 octombrie — Publicată pe 5 octombrie la 23 h 33 UTC, Claude Code 2.1.290 este o versiune amplă: 190 de intrări, dintre care 131 de corecții. claude attach și claude logs acceptă o parte din numele unei sesiuni în locul identificatorului acesteia, iar /claude-api managed-agents-onboard transformă modelul Managed Agents descris de o pagină web în fișiere ant apply. Bugetul de căutare web al sesiunii interactive nu se mai oprește după 200 de apeluri: se reîncarcă în ritm de 100 de apeluri pe oră. La nivelul mediu de efort (medium), /code-review semnalează și abaterile de la convențiile din CLAUDE.md pe Opus 5.5 și Sonnet 5.5. În Slack, Claude Tag primește un mod rapid (!fast), un apel browser_batch din Claude in Chrome dispune de 90 de secunde în loc de 60, iar WebFetch nu mai trunchiază fără avertizare textul care depășește 100 000 de caractere. pyright și mai multe forme de ps solicită permisiune, iar mai multe vulnerabilități legate de permisiuni sunt corectate: caractere wildcard din rg și git grep expandate de shell, fișiere CLAUDE.md legate în afara directoarelor de lucru, un mod de organizație ocolit de un mod de utilizator. Patru ore mai târziu, 2.1.291 corectează două regresii, una apărută cu 2.1.290 (răspunsuri la solicitările de permisiune pierdute în sesiunile cloud), cealaltă cu 2.1.288 (ultimele mesaje ale unei sesiuni pierdute la ieșire).

Pe 6 octombrie la 18 h 59 UTC, 2.1.292 (92 de intrări, dintre care 64 de corecții) adaugă un parametru effort la instrumentul Agent, pentru a lansa un subagent la nivelul de efort solicitat, și claude plugin install --marketplace, care adaugă piața de pluginuri (marketplace) dacă este necesar, apoi instalează pluginul. Serverele MCP locale (stdio) negociază acum implicit protocolul 2026-07-28 (MCP_PROTOCOL_NEGOTIATION=legacy pentru a reveni), CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS prelungește reîncercările în cazul erorilor 529, iar mod-urile primesc un eveniment de autocompletare a promptului și cache pentru prompturi. În privința securității, aprobările unui hook PreToolUse și modul auto nu mai ocolesc solicitarea de permisiune pentru citirea căilor de rețea (UNC), iar etichetele <system-reminder> scrise de un hook sunt escapate înainte de a ajunge la Claude. Instrumentul Artifact listează în sfârșit 200 de artefacte în loc de 50, iar Code Review își defalcă statisticile pe depozite. Nici 2.1.290, nici 2.1.292 nu au fost anunțate pe X.

Versiunea Claude CodeData publicării (UTC)Numărul de intrăriPrincipala noutate
2.1.2905 octombrie, 23 h 33190, dintre care 131 de corecțiiSesiuni identificate după nume, managed-agents-onboard, buget WebSearch reîncărcat
2.1.2916 octombrie, 3 h 552 corecțiiDouă regresii corectate
2.1.2926 octombrie, 18 h 5992, dintre care 64 de corecțiiEfortul subagenților, plugin și piață de pluginuri într-o singură comandă, MCP 2026-07-28

🔗 Claude Code 2.1.290 🔗 Claude Code 2.1.291 🔗 Claude Code 2.1.292

Ghidul sesiunilor cloud din Claude Code

6 octombrie — La două săptămâni după lansarea versiunii preliminare a sesiunilor cloud din Claude Code, Anthropic publică pe claude.dev un ghid practic semnat de Addy Osmani. Fiecare sarcină rulează pe o mașină virtuală nouă, cu aproximativ 4 vCPU, 16 Go de RAM și 30 Go de disc, cu depozitul clonat pe o ramură nouă, fără costuri suplimentare de calcul pentru abonamentele Pro, Max, Team și Enterprise. Ghidul descrie șapte utilizări: rezolvarea în paralel a unei liste de sarcini în așteptare (backlog), verificarea unei corecții prin execuții repetate, planificarea locală urmată de reluarea sesiunii cu claude --teleport, urmărirea de pe telefon, încredințarea eșecurilor CI și a comentariilor de revizuire către Auto-fix, declanșarea rutinelor și executarea de cod nesigur într-o VM de unică folosință. În demonstrația sa, toate cele trei sesiuni s-au încheiat la 87 de secunde după prima lansare, iar un proiect poate lansa până la 200 de fire noi (threads) pe zi. Ghidul detaliază și conectarea la GitHub: autentificarea cu GitHub și instalarea aplicației Claude GitHub sunt două permisiuni distincte, iar numai a doua permite accesul la depozitele private. Creditul bonus de 100 de dolari (Pro) sau 250 de dolari (Max) trebuie revendicat înainte de 7 octombrie la 23 h 59 PT și expiră pe 4 noiembrie.

🔗 Ghid practic al sesiunilor cloud pe claude.dev 🔗 Mesajul de reamintire al @ClaudeDevs despre creditul bonus

Vibe CLI 2.26.0

6 octombrie — Mistral publică Vibe CLI 2.26.0, agentul său de programare în linia de comandă, la treisprezece zile după 2.25.8 și fără un anunț pe X. Cu 33 de adăugiri, 23 de modificări și 91 de corecții, actualizarea este substanțială: 72 dintre cele 147 de intrări privesc noua interfață scrisă în Rust: asistent pentru prima lansare, mod vocal (/voice), prompturi recurente descrise în limbaj natural cu /loop, trimiterea sesiunii către Vibe Code Web cu /teleport și comanda vibe update. Vibe rulează acum întotdeauna pe Unified Harness, noul său motor de execuție, și se oprește cu o eroare explicită dacă acesta lipsește, în loc să revină fără avertizare la vechiul motor. Pluginurile pot include propriul server MCP, cheia API de rezervă stocată în ~/.vibe/.env poate fi citită acum doar de proprietarul său, iar Rust CLI transmite acum către Mistral telemetria de utilizare (timpul de pornire, comenzile folosite, terminalul detectat).

🔗 Notele de versiune pentru Mistral Vibe v2.26.0

Extensia Antigravity pentru VS Code 1.7.0

5 octombrie — Google publică versiunea 1.7.0 a extensiei Antigravity pentru Visual Studio Code, care aduce agenții Google Antigravity în editorul Microsoft (conversație în panoul lateral, revizuirea diff-urilor în linie, planuri interactive), începând cu VS Code 1.90. Actualizată aproximativ săptămânal de la începutul lunii septembrie, potrivit changelog-ului său, aceasta nu fusese prezentată aici până acum. Această versiune 1.7.0 (6 îmbunătățiri, 9 corecții) îmbunătățește revizuirea codului: deciziile Accept și Reject pot fi anulate și refăcute de la tastatură, editorul de diff cu afișare alăturată primește butoanele Accept All și Reject All, iar salvarea automată (Auto Save) din VS Code nu mai poate suprascrie sau închide o revizuire în curs. Pe Windows, notificările native semnalează încheierea unei sarcini când fereastra nu este în prim-plan, iar Google Cloud Workstations și Cloud Shell primesc autentificare interactivă. În aceeași zi, extensia pentru Visual Studio trece la 1.0.261005.0 și atașează jurnale de diagnostic la feedbackul trimis.

🔗 Changelog-ul Google Antigravity

Replit și contextul tuturor proiectelor

6 octombrie — Replit anunță că dispune acum de contextul tuturor proiectelor unui utilizator. Dintr-o conversație nouă, i se poate cere să găsească un proiect existent, să îi adauge o funcționalitate sau să folosească un proiect drept referință pentru altul; Replit citește apoi fișierele relevante și lansează modificările ca sarcini în fundal (background tasks), cu linkuri pentru revizuirea schimbărilor. Exemplul ales depășește simpla programare: aplicarea paletei de culori a unui „Partner Marketing Hub” la alte două proiecte ale unei mărci de cafea. Anunțul constă într-un tweet însoțit de un videoclip, fără articol, documentație sau preț.

🔗 Anunțul Replit pe X


Pull requests în stivă de pe GitHub trec la disponibilitate generală

6 octombrie — GitHub pune la dispoziția tuturor planurilor de pe github.com pull requests în stivă (stacked pull requests), aflate în previzualizare publică din 30 iulie: o modificare amplă este împărțită în pull requests mai mici, revizuite separat și apoi îmbinate împreună. GitHub Enterprise Server le va primi într-o versiune viitoare. Potrivit GitHub, depozitele care folosesc stive îmbină cu 9 % mai mult cod decât depozitele comparabile, iar peste două treimi dintre depozitele din top 1 % le folosesc, cu o îmbunătățire de 5 % a timpului până la îmbinare.

Versiunea finală reduce dificultățile întâmpinate la îmbinare. Când ramura principală avansează, „Rebase stack” păstrează aprobările pentru codul nemodificat și produce commituri de înlocuire semnate; o stivă traversează coada de îmbinare (merge queue) ca un singur grup, iar o stivă a cărei ramură de bază este ștearsă este redirecționată în loc să fie închisă. Îmbinarea automată a unei stive întregi va sosi „în următoarele săptămâni”. Pentru utilizarea din linia de comandă și de către agenți, extensia gh stack pentru GitHub CLI acceptă worktrees Git.

🔗 Changelog-ul GitHub despre pull requests în stivă


Modele multilingve: Tiny Aya L2-Thinker de la Cohere și Falcon-OCR-Arabic de la TII

Două modele mici vizează limbi pentru care modelele mari oferă rezultate mai slabe: unul raționează în limba utilizatorului, celălalt citește documente în arabă.

Tiny Aya L2-Thinker de la Cohere

6 octombrie — Cohere abordează limba în care raționează modelele: întrebate în spaniolă, arabă sau swahili, cele mai multe gândesc în engleză înainte de a răspunde. Modelul său de cercetare Tiny Aya L2-Thinker (3,35 miliarde de parametri) raționează în limba promptului în peste 93 % din cazuri, pentru 60 de limbi. Rețeta constă în amestecul de date: aproximativ 1,7 milioane de exemple de raționament în engleză, generate de gpt-oss-120b, îl fac să raționeze în limba utilizatorului doar în 12,8 % din cazuri; aproximativ 5 000 de exemple traduse pentru fiecare limbă, pentru 44 de limbi, ridică această rată la 86,1 %, iar datele multilingve fără raționament extind acest comportament la alte limbi. Față de modelul său geamăn care raționează în engleză, precizia scade cu cel mult două până la trei puncte pe cinci dintre cele șase benchmarkuri; numai PolyMath, care vizează matematica de competiție, înregistrează o scădere mai pronunțată, din cauza lipsei unei etape de învățare prin întărire. Modelul consumă în medie mai puțin de 5 000 de tokens de reflecție. Modelele și datele sunt publicate pe Hugging Face sub licența necomercială CC-BY-NC 4.0; articolul prezintă o lucrare arXiv din 9 septembrie.

🔗 Articolul de cercetare al Cohere despre Tiny Aya L2-Thinker

Falcon-OCR-Arabic de la TII

6 octombrie — TII, institutul din Emiratele Arabe Unite care dezvoltă modelele Falcon, prezintă pe blogul Hugging Face Falcon-OCR-Arabic, o versiune arabă a modelului său de recunoaștere a textului Falcon OCR. Acesta își păstrează cei 270 de milioane de parametri și arhitectura cu fuziune timpurie și a fost adaptat prin fine-tuning supervizat pe documente arabe reale și sintetice, apoi prin învățare prin întărire. Pe un set de evaluare construit chiar de TII (11 974 de documente reale, 15 categorii), se clasează pe locul al doilea dintre cele 17 modele comparate și pe primul loc pentru documente oficiale, formulare administrative, bonuri și facturi.

Model evaluat de TIIAcuratețea textuluiScor Table TEDS
Gemini 3.5 Flash84,34 %51,30 %
Falcon-OCR-Arabic (270M)81,87 %59,95 %
Claude Opus 5.579,22 %43,98 %
GPT Astra75,02 %51,23 %
Chandra OCR 2 (cel mai bun OCR dedicat)61,67 %32,63 %

Articolul oferă doar un spațiu de testare (playground): pe Hub nu apăreau ponderi pentru Falcon-OCR-Arabic la momentul verificării noastre și nu este menționată nicio licență.

🔗 Articolul TII despre Falcon-OCR-Arabic


Bibliotecile Hugging Face: Diffusers 0.41.0 integrează Qwen-Image 2.1, Transformers v5.19.0 adaugă EmbeddingGemma 2

Cele două mari biblioteci de modele ale Hugging Face publică o versiune în aceeași zi.

Diffusers 0.41.0 și Qwen-Image 2.1

6 octombrie — Diffusers 0.41.0, biblioteca Hugging Face pentru modelele de difuzie, integrează Qwen-Image 2.1, modelul Alibaba care reunește generarea și editarea imaginilor: acesta poate fi folosit acum direct pentru a genera, edita, produce imagini cu fundal transparent (ieșire RGBA nativă) și antrena LoRA, cu o componentă de generare vizuală de 7 miliarde de parametri. Echipa își schimbă și ritmul: asemenea Transformers, Diffusers își va programa de acum versiunile minore în funcție de apariția unor modele noi, versiunile de corecție rămânând rezervate corecțiilor. Încărcarea cu paralelism tensorial permite fiecărui GPU să citească doar partea sa din ponderi, iar versiunea adaugă pipeline-urile LTX-2.5 DFR și optimizări pentru Cosmos 3. În schimb, suportul ONNX este depreciat în favoarea Optimum.

🔗 Notele de versiune pentru Diffusers 0.41.0

Transformers v5.19.0

6 octombrie — La șase zile după v5.18.0, Transformers v5.19.0 adaugă EmbeddingGemma 2, prezentat mai sus, cu vectorii săi care pot fi scurtați și encoderele pentru viziune și audio care pot fi dezactivate la încărcare. În privința antrenării distribuite, paralelismul experților primește distribuirea tokenurilor (token dispatch), activată implicit pentru Qwen3 MoE și Mellum: dimensiunea sa nu mai trebuie să fie egală cu cea a paralelismului tensorial, iar Trainer funcționează cu acest mod. Cache-ul se configurează acum separat pentru fiecare strat, ceea ce este util pentru modelele eterogene, iar procesarea continuă în loturi (continuous batching) acceptă XPU. Versiunea include șase modificări incompatibile cu versiunile anterioare, printre care returnarea valorilor logits ale routerului pentru toate modelele MoE și renunțarea treptată la prefixul paged|.

🔗 Notele de versiune pentru Transformers v5.19.0


Agenți vocali: ElevenLabs lansează ElevenAgents Architect în Alpha

6 octombrie — ElevenLabs integrează în ElevenAgents, platforma sa de agenți conversaționali, un expert numit Architect, care ajută echipele să își construiască și să își îmbunătățească agenții vocali sau textuali vorbindu-i sau scriindu-i. Acesta cunoaște toate setările ElevenAgents (bază de cunoștințe, prompturi, secvențe, voci, mecanisme de protecție, instrumente, simulări) și modul în care interacționează. I se poate prezenta o întrebare, un test eșuat, o creștere a transferurilor către un operator uman sau o constatare din ElevenAgents Spotlight: analizează transcrierile, identifică sursa problemei, propune o modificare și scrie simulările care o validează. Construiește și un agent pornind de la o simplă descriere. Fiecare modificare este livrată ca schiță cu versiune și reversibilă, iar nimic nu ajunge în producție fără aprobare. Architect este accesibil din produs, dar și din Claude, Claude Code, ChatGPT, Cursor și Grok Bot. Este disponibil chiar acum în Alpha, fără preț sau rezultate cuantificate.

🔗 Articolul ElevenLabs despre ElevenAgents Architect


Video generativ: FLUX 3 conduce clasamentul Physics-IQ Verified, potrivit Black Forest Labs

6 octombrie — Black Forest Labs revendică primul loc în Physics-IQ, benchmarkul Google DeepMind care măsoară înțelegerea lumii fizice de către modelele video: modelului i se arată începutul unui experiment real filmat, iar acesta trebuie să prezică ce urmează (fluide, optică, mecanica solidelor). Clasamentul de referință, Physics-IQ Verified, este gestionat de Anates Labs. În categoria video către video, FLUX 3 [large] depășește clar Cosmos3 de la NVIDIA, la un cost mai mare per videoclip.

Model și metodă (video către video)Scor Physics-IQ VerifiedCost per videoclip normalizat
FLUX 3 [large], cea mai bună dintre 8 generări64,35 %16,43 dollars
FLUX 3 [large]61,11 %2,08 dollars
Cosmos3 Super (NVIDIA)50,80 %0,82 dollar
Cosmos3 Nano (NVIDIA)43,00 %0,82 dollar

În categoria imagine către video, FLUX 3 [large] depășește și Physis-Lang, metoda pe care NVIDIA o plasa pe primul loc pe 29 septembrie. FLUX 3 [large] este un model proprietar, iar firul de postări nu oferă nici o dată de disponibilitate, nici un preț pentru această variantă.

🔗 Firul de postări al @bfl_ai pe X 🔗 Clasamentul Physics-IQ Verified


Evaluări publice: GeoGuess Bench și RSI Arena

Două evaluări deschise publicului se îndepărtează de benchmarkurile obișnuite: una pune modelele să joace GeoGuessr, cealaltă invită publicul să voteze modele antrenate de agenți.

GeoGuess Bench

6 octombrie — Hassan, responsabil pentru experiența dezvoltatorilor la Together AI, publică GeoGuess Bench, un instrument personal de evaluare care pune modelele să joace GeoGuessr: fiecare vede aceleași 210 fotografii stradale și plasează un marcaj punctat conform formulei jocului, până la 25 000 de puncte per partidă de cinci runde. Claude Opus 5.5 preia conducerea, imediat înaintea Claude Fable 5.1; surpriza vine de la Muse Glimmer 30B, modelul Meta cu ponderi deschise, clasat pe locul al treilea și înaintea GPT-6 Astra, la un cost de aproximativ 45 de ori mai mic per partidă.

Poziție în GeoGuess BenchModel evaluatScor din 25 000Cost per partidă
1Claude Opus 5.523 4120,064 dollar
2Claude Fable 5.123 3070,115 dollar
3Muse Glimmer 30B (deschis)22 4070,0049 dollar
4GPT-6 Astra21 5620,223 dollar
5GPT-6.1 Sol21 1940,042 dollar
6GLM-5.3 Flash (deschis)21 1830,0087 dollar

GLM-5.3 Flash se ridică astfel la nivelul GPT-6.1 Sol, la un cost de aproximativ cinci ori mai mic. Este proiectul personal al unui angajat Together AI, furnizor de inferență pentru modele deschise, și nu o evaluare a companiei; nu include niciun model Gemini, iar codul este publicat pe GitHub.

🔗 Anunțul lui Hassan pe X 🔗 GeoGuess Bench

RSI Arena

6 octombrie — Zichen Chen anunță o nouă rundă de RSI Arena (pentru autoîmbunătățire recursivă, recursive self-improvement), de această dată împreună cu Hugging Face. Agenții IA au primit GPU-uri și o singură misiune, să antreneze modele mai bune: și-au ales singuri datele, au scris codul și au desfășurat experimentele. După încheierea primei runde de antrenare, publicul intră în circuit: modelele se confruntă în dueluri, fiecare participant votează, iar agenții folosesc acest feedback pentru noi experimente. Inference Endpoints de la Hugging Face pun la dispoziție fiecare model în timp real, iar site-ul enumeră zece agenți, printre care GPT-6 Astra, Grok 4.7, DeepSeek V4.1 Flash, GLM-5.3 și Muse Spark 1.3; tabloul său de bord afișa cheltuieli API de 286,60 dolari din 300 și 755,17 ore GPU din 1 000. Echipa promite să publice pe Hub fiecare model antrenat de agenți și, la sfârșitul experimentului, toate artefactele: datele, codul și parcursul complet de cercetare al fiecărui agent.

🔗 Anunțul lui Zichen Chen pe X 🔗 RSI Arena


Infrastructură GPU: NVIDIA publică AICR v1.0

6 octombrie — NVIDIA publică versiunea 1.0 a AI Cluster Runtime (AICR), un proiect deschis care își propune să pună capăt clusterelor Kubernetes cu GPU configurate prin încercări. Un cluster accelerat depinde de zeci de componente cu versiuni independente (nucleu, drivere, medii de containere, rețea, stocare, operatori, biblioteci), iar o combinație care funcționează într-un loc poate eșua fără avertisment în altul. AICR răspunde prin rețete cu versiuni fixate și validate, generate pentru Helm, Argo CD, Flux sau Helmfile și însoțite de dovezi semnate ale validării pe hardware-ul testat. Versiunea v1.0 stabilește un contract de compatibilitate: CLI, API REST, SDK Go, structura pachetelor de deployment și schemele artefactelor devin interfețe stabile, iar orice modificare incompatibilă va necesita o nouă versiune majoră. NVIDIA afirmă că proiectul are peste 100 de contributori, dintre care aproape jumătate din afara companiei, și menționează integrări la Pulumi Labs și în managerul multicluster k0rdent de la Mirantis.

🔗 Articolul de pe blogul tehnic NVIDIA


Claude Startups: până la 7 000 de dolari în produse și credite și o Startup Stack de 45 000 de dolari

6 octombrie — Anthropic extinde accesul la Claude Startups, programul său pentru fondatorii care construiesc pe Claude, către startupurile înființate de mai puțin de cinci ani sau finanțate în ultimii doi ani.

Beneficiu al programuluiValoare anunțată de Anthropic
Un an de Claude Team, până la cinci locuri Premium6 000 dollars (cinci locuri la 100 dollars pe lună)
Credit API unic, disponibil imediat după aprobare1 000 dollars
Totalul produselor și creditelor Claudepână la 7 000 dollars
Claude Startup Stack (oferte ale partenerilor)până la 45 000 dollars

Anul de Claude Team se aplică firmelor care încep să folosească Team, iar valoarea sa reală depinde de numărul și tipul locurilor. Claude Startup Stack, noutatea zilei, reunește reduceri și credite de la companii care construiesc cu Claude, printre care Linear, Lovable, ElevenLabs, Granola și Hex; plafonul său corespunde valorii cumulate a tuturor ofertelor la prețurile de catalog din septembrie 2026, iar aceste oferte nu pot fi toate cumulate. Programul adaugă sesiuni de discuții cu echipa Applied AI a Anthropic, ajutor pentru publicarea unei pagini de prezentare pe Claude Marketplace și acces la evenimente.

🔗 Articolul Anthropic despre Claude Startups 🔗 Firul de postări al @claudeai despre Claude Startup Stack


Știri pe scurt

  • Claude Projects și dosarul local — Dan Fein, de la Anthropic, anunță că sesiunile cloud ale Claude Projects se pot conecta la un dosar aprobat de pe computer, pe care îl accesează doar atunci când o sarcină are nevoie de el; lansarea se desfășoară treptat începând din 5 octombrie, iar echipa este aproape gata (Aproape gata), potrivit lui Boris Cherny. 🔗 sursă · 🔗 Boris Cherny
  • Claude în mesajele de grup Slack — Claude poate fi acum adăugat în mesajele de grup (group DMs) din Slack ca orice participant; răspunde într-un fir pe care continuă să îl urmărească și poate folosi conectorii personali ai persoanei care îl solicită, fără precizări despre planuri sau calendar. 🔗 sursă
  • Boris Cherny și modul său de a formula prompturi — Boris Cherny îi cere lui Opus 5.5 să construiască un site interactiv care însoțește un episod al podcastului Acquired dedicat Home Depot, inclusiv acuarele; potrivit lui, nu există niciun secret în formularea prompturilor: spune-i modelului ce vrei, cât efort să depună și cum să verifice rezultatul. 🔗 site însoțitor · 🔗 modul său de a formula prompturi
  • Atlassian și OpenAI — În baza unui nou acord, modelele de frontieră din familia GPT-6, inclusiv GPT-6 Astra, vor alimenta agenții platformei Atlassian și ai Rovo; peste 3 000 de dezvoltatori Atlassian folosesc deja Codex, iar integrări Jira mai aprofundate sunt în studiu, fără a fi comunicată vreo sumă. 🔗 sursă
  • Widgeturi Codex în ChatGPT pentru iOS — Versiunea 1.2026.267 a ChatGPT pentru iOS, din 2 octombrie, adaugă widgeturi pe ecranul principal pentru sarcinile Codex recente de pe computerele selectate, altele pentru cota de utilizare rămasă și resetarea acesteia, disponibile și pe ecranul de blocare, precum și o setare care menține tastatura deschisă. 🔗 sursă
  • Gemini CLI v0.63.0 și v0.64.0-preview.0 — Versiunea stabilă v0.63.0 reproduce identic cele 15 intrări ale versiunii preliminare din 29 septembrie, iar versiunea preliminară v0.64.0-preview.0 reunește cele 16 intrări ale versiunilor nocturne din 30 septembrie până în 3 octombrie: niciun conținut nou, iar versiunea nocturnă din 6 octombrie este goală. 🔗 sursă
  • SDK Python de la Mistral 3.1.0 — Generată automat din API, această versiune adaugă în beta paisprezece operațiuni de evaluare în modulul de observabilitate; metodele Runs sunt mutate în Workflows.runs, ceea ce poate afecta funcționarea codului existent, în ciuda unei simple schimbări de versiune minoră. 🔗 sursă
  • Qwen Code v0.25.1-preview.0 — La o zi după v0.25.0, această versiune preliminară aduce 13 funcționalități și 27 de corecții, inclusiv un mediu de execuție Kubernetes experimental, comenzi Shell și monitorizare în fundal pentru Managed Agent, precum și reguli MCP care nu mai autorizează un server cu același nume. 🔗 sursă
  • SDK TypeScript de la SpaceXAI 0.2.2 — Publicată pe 5 octombrie fără anunț, această versiune conține o singură modificare: opțiunea retryBeforeOutput se aplică și unui apel create() fără flux continuu (streaming) care așteaptă JSON. 🔗 sursă
  • Falcon-Emirati-7B, dialectul emiratez — TII specializează Falcon-H1-Arabic 7B în araba emirateză: 84,83 % pe Alyah, un benchmark cu 1 173 de întrebări, și o fidelitate față de dialect de 0,52, față de cel mult 0,05 pentru ALLaM, Gemma 3 27B, Jais-2 și Fanar-2, potrivit unui evaluator Gemini 3.7 Flash; modelul este oferit doar pe platforma de chat a TII. 🔗 sursă
  • Datasets 5.1.0 — Publicată pe 5 octombrie, biblioteca pentru seturi de date citește acum mediile de învățare prin întărire Harbor, formatul columnar Vortex și cinci formate biologice (FASTA, FASTQ, GenBank, PDB, mmCIF) și remediază o vulnerabilitate care permitea unei arhive să scrie într-un director vecin. 🔗 sursă
  • TRL v1.14.2 — Această corecție repară o antrenare denaturată fără avertisment: fără vLLM, GRPO, RLOO și Distillation nu se opreau la sfârșitul replicii pentru modele precum Gemma sau Phi-3.5 și învățau tot textul care urma, până la lungimea maximă; sunt remediate și trei blocări. 🔗 sursă
  • Jev împotriva e-mailurilor de campanie — Într-un articol al comunității, Stephen Solka își sortează e-mailurile politice cu Jev (99 de răspunsuri corecte din 100 de e-mailuri reale, un fals pozitiv), apoi cu un clasificator SetFit de 22,6 milioane de parametri care rulează pe procesor: 98 % la evaluarea pilot, dar 18 din 23 pentru cazurile dificile. 🔗 sursă
  • Open Together pe 16 octombrie — vLLM și Hugging Face organizează Open Together, o întâlnire a dezvoltatorilor open source care va deschide Open Source AI Week vineri, 16 octombrie, la San Francisco; potrivit lui Jeff Boudier, 150 de persoane se află pe lista de așteptare, iar capacitatea a fost dublată. 🔗 sursă · 🔗 Jeff Boudier
  • Copilot CLI 1.0.93-2 — Această versiune preliminară adaugă o setare pentru companii, permissions.limitTo, care limitează cererile de rețea la domenii administrate, scoate în evidență GPT-6.1 Sol, GPT-6 Astra și Luna și modelele Claude 5.5 în selector și citește setările utilizatorului doar din ~/.copilot/settings.json. 🔗 sursă
  • AI Scan în prezentarea generală a securității — Administratorii organizațiilor și companiilor văd acum, în prezentarea generală a securității (security overview) de pe GitHub, ce depozite au activat analiza cu IA a pull requests (AI Scan for pull requests), cu două filtre și o coloană în exportul CSV. 🔗 sursă
  • Detectarea secretelor: Lovable, Pydantic și Supabase — Detectarea secretelor (secret scanning) de pe GitHub recunoaște cinci noi tipuri de secrete, inclusiv cheia API Lovable, tokenul Logfire și cheia Pydantic AI Gateway, precum și două tokenuri Supabase; Lovable Labs se alătură și programului său de parteneriat. 🔗 sursă
  • Notele de versiune Devin din 5 octombrie — În principal ajustări finale: o filă Terminal în spațiul de lucru al sesiunii (deschiderea Files sau Terminal îl reactivează pe Devin), niveluri de efort pentru Devin Review configurabile prin acțiunile de declanșare și analize de cod (code scans) care pot fi recuperate prin identificator folosind API v3 sau MCP de la Devin. 🔗 sursă
  • Delta și propriile worktrees — Pe blogul Delta, Conrad Irwin explică de ce instrumentul înlocuiește worktrees Git: fiecare fir are propriul worktree înregistrat în DeltaDB și replicat între persoane, agenți și mașini, mai mulți agenți lucrează pe aceeași ramură, iar un script .agents/prepare gestionat prin controlul versiunilor pregătește fiecare checkout; articolul nu anunță o versiune nouă. 🔗 sursă
  • v0: conturile personale devin spații de echipă — Conturile personale v0 devin spații de lucru pentru echipe, cu conversațiile, proiectele și setările migrate automat; documentația rezervă însă anumite funcții, precum șabloanele de echipă, planurilor Plus, Business și Enterprise. 🔗 sursă
  • v0 și abonamentul ChatGPT pe iOS — Abonamentul ChatGPT, acceptat de v0 din 29 septembrie, poate fi acum folosit în aplicația sa iOS, fără prețuri sau detalii suplimentare. 🔗 sursă
  • Eleven v4 și Eleven v4 Turbo în frunte — ElevenLabs anunță că cele două modele ale sale de sinteză vocală lansate pe 28 septembrie ocupă primele două locuri în clasamentul de sinteză vocală (text to speech) al Artificial Analysis; v4 era deja primul la lansare. 🔗 sursă
  • HeyGen Video în 2K — La o săptămână după lansare, HeyGen Video trece la rezoluția 2K; HeyGen afirmă că este primul în clasamentul video al OpenRouter după utilizare, fără un preț specific pentru 2K, pagina de catalog afișând în continuare 0,01 dolari pe secundă până la sfârșitul lui octombrie. 🔗 sursă
  • Nano Banana 2.1 pe Pika — Pika adaugă pe platforma sa și în Pika API Club Nano Banana 2.1, noua versiune a modelului Nano Banana de la Google, cu o calitate vizuală mai bună și o viteză mai mare, potrivit Pika; nu este precizat niciun preț sau cost în credite. 🔗 sursă
  • DOCA GPUNetIO — NVIDIA transformă DOCA GPUNetIO în implementarea comună a rețelei controlate de GPU (GDA-KI) pentru NCCL, NVSHMEM și NIXL/UCX, într-o versiune completă în SDK DOCA și într-un proiect open source mai ușor, axat pe RDMA Verbs. 🔗 sursă
  • Green contexts din CUDA — Un articol tehnic NVIDIA arată cum se pot rezerva SM pentru o sarcină critică: pe un GPU Blackwell cu 148 SM, un kernel limitat la 8 SM răspunde în 0,007 ms, față de 0,140 ms cu un flux (stream) prioritar și 3,727 ms fără prioritate. 🔗 sursă
  • Modele deschise la operatorii telecom — Într-un articol în care își prezintă poziția, NVIDIA citează sondajul său telecom din 2026, în care 89 % dintre respondenți consideră că open source este important, și mărturiile SoftBank, AT&T și Indosat ; niciun produs nou. 🔗 sursă
  • Ghidul Perplexity pentru instrumentele de colaborare — Perplexity compară zece instrumente de colaborare dotate cu AI (Slack, Loom, Confluence, Airtable, Notion, ClickUp, Asana, Monday.com, Trello, Miro), funcțiile lor de AI și planurile care le includ ; nicio noutate de produs. 🔗 sursă

Ce înseamnă asta

Modelele de decizie devin o categorie de sine stătătoare, cu propriul război al prețurilor și propriul clasament. În aceeași zi, OpenAI stabilește prețul API-ului său Decisions la 0,10 dolari per milion de tokens de intrare, iar Perplexity îl reduce pe al său la 0,02 dolari, de două ori mai puțin decât acum cinci zile ; niciunul dintre cei doi nu taxează ieșirea. Aceste modele nu redactează, ci aleg sau acordă scoruri : plata se face pentru ceea ce citesc și se dorește ca ele să fie rapide, OpenAI promițând răspunsuri de aproximativ zece ori mai rapide decât cu Responses API. Decision Index 0.3 servește drept arbitru al comunității, iar noua sa jumătate privată urmărește să măsoare competențe, mai degrabă decât reușita pe benchmark-uri cunoscute. Verdictul său cântărește deja în comunicarea furnizorilor : Perplexity îl invocă în anunțul său, chiar dacă fișa modelului său indică un alt scor decât clasamentul.

AI se integrează în instrumentele de birou, mai degrabă decât invers. Claude intră în Google Docs, Sheets și Slides după Excel, PowerPoint și Word, se alătură mesajelor de grup din Slack, iar modelele GPT-6 vor alimenta agenții Rovo de la Atlassian. În aceste integrări, problema nu mai este doar calitatea modelului, ci și controlul : un mod care cere aprobarea fiecărei modificări, conectori care respectă permisiunile de partajare din Google, controale Enterprise aplicate modulului. Aceeași logică se regăsește în instrumentele pentru agenți prezentate astăzi, de la deciziile de review care pot fi anulate în Antigravity până la schițele cu versiuni din ElevenAgents Architect.

În domeniul securității cibernetice, accesul se acordă pe niveluri, în funcție de verificare. CVP de la Anthropic nu schimbă modelul, ci măsurile sale de protecție : pe CyScenarioBench, același Opus 5.5 trece de la sarcini blocate încă de la primul prompt, în absența verificării, la 34 de sarcini îndeplinite din 50 în Red Team Access. Mistral avansează un alt argument, cel al unui model care nu refuză : declară un scor de 82 % la un test de securitate cibernetică pe care Claude Opus 5.5 și GPT-6 Astra, potrivit Mistral, refuză să îl susțină. Cele două abordări au un punct comun : accesul cel mai larg la capacitățile de securitate cibernetică trece mai întâi prin profesioniști verificați, parteneri ai Mistral înainte de publicarea ponderilor sau membri ai programului Anthropic.

Modelele se extind și spre ambele extreme ale dimensiunii. La capătul superior, Mistral Large 4 și cei 1 000 de miliarde de parametri ai săi, ale cărui ponderi sunt promise pentru sfârșitul lui octombrie ; la capătul inferior, EmbeddingGemma 2, care încape în aproximativ 567 Mo de RAM pe un telefon, Tiny Aya L2-Thinker și cei 3,35 miliarde de parametri ai săi sau Falcon-OCR-Arabic și cele 270 de milioane ale sale, deocamdată doar în demonstrație. Totuși, multe dintre cifrele zilei sunt măsurate chiar de furnizor : scorurile Mistral, primul loc revendicat de Black Forest Labs, benchmark-ul propriu al TII, fișa Perplexity, sarcinile Ironclad evaluate de OpenAI sau câștigurile la îmbinare anunțate de GitHub. Aceasta este adesea singura măsurătoare disponibilă în ziua unui anunț ; ar fi util să fie verificată prin evaluări independente, lucru pe care îl vor permite tocmai ponderile Mistral Large 4 odată publicate.


Surse