ai-powered-markdown-translatorArticol tradus din fr în ro cu gemini-3.8-flash-medium.
Miercuri, 30 septembrie, Google anunță Gemini 4 Argon, un model de frontieră care se lansează mai întâi pentru apărătorii cibernetici de încredere din Fairwind Program, cu o ieșire extinsă la 1 milion de tokenuri. OpenAI afirmă că a dejucat o campanie coordonată de extragere a raționamentului protejat al modelelor sale, atribuind nucleul acesteia unor persoane asociate cu Moonshot AI. Cohere lansează Embed 5 cu propria sa metodă de evaluare, Ideogram 4.5 promite retușuri succesive fără artefacte, iar HeyGen lansează un model video bazat pe MiniMax H3; pe partea de dezvoltatori, Claude Code 2.1.286, Zed 1.22.0 și VS Code 1.140 sunt lansate în aceeași zi.
Gemini 4 Argon: noul model de frontieră de la Google, mai întâi pentru apărătorii cibernetici
30 septembrie — Google anunță Gemini 4 Argon, noul său model de frontieră, într-o postare semnată de Koray Kavukcuoglu, vicepreședinte senior la Google DeepMind și arhitect-șef pentru AI la Google (Chief AI Architect). Argon este conceput pentru a susține un raționament aprofundat pe fluxuri de lucru lungi și complexe (long-horizon workflows), pe trei direcții: ingineria software în condiții reale, munca bazată pe cunoaștere în întreprinderi (juridic, finanțe) și apărarea cibernetică.
Modelul nu este încă deschis publicului larg. Acesta este implementat mai întâi pentru un grup de apărători cibernetici de încredere din Fairwind Program, lansat pe 2 septembrie cu Gemini 3.8 Flash Cyber, care îl primesc, la fel ca echipele interne ale Google, fără mecanisme de protecție cibernetică (cyber guardrails). Dezvoltatorii, companiile și publicul larg vor urma „cât mai curând posibil”, începând cu clienții plătitori ai API-ului și abonații Google AI Ultra, fără o dată anunțată. Până atunci, Google consolidează refuzul solicitărilor dăunătoare în domeniul cibernetic și NRBC, monitorizarea lanțului de raționament și a acțiunilor modelului, și își izolează antrenamentele și evaluările cu risc ridicat în sandbox-uri sigilate; compania declară, de asemenea, că participă la procesul voluntar al guvernului american de acces la modele înainte de lansare.
Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.
🇷🇴 Vă prezentăm Gemini 4 Argon, noul nostru model de frontieră. Este conceput pentru fluxuri de lucru complexe în programare, munca bazată pe cunoaștere în întreprinderi și apărare cibernetică și este implementat începând de astăzi pentru un grup de testeri de încredere prin intermediul Fairwind Program. — @GoogleDeepMind pe X
Tariful este deja stabilit: ca preț de lansare, 2 dolari per milion de tokenuri de intrare și 10 dolari de ieșire, adică același tarif ca pentru GPT-6.1 Sol lansat în ajun, apoi 4 și 20 de dolari la sfârșitul unei perioade a cărei durată nu este specificată; intrarea din cache costă cu 95% mai puțin decât intrarea standard. Limita de ieșire crește la 1 milion de tokenuri, față de 64K anterior, cea mai mare din industrie conform Google: modelul poate genera sute de mii de tokenuri într-o singură traiectorie pentru a rezolva o problemă dificilă.
| Preț per milion de tokenuri | Tarif de lansare | Tarif după perioada de lansare |
|---|---|---|
| Intrare | 2 dolari | 4 dolari |
| Ieșire | 10 dolari | 20 dolari |
Pagina Google DeepMind compară Argon cu GPT-6 Astra, Claude Fable 5.1 și Claude Opus 5.5 pe nouăsprezece linii. Argon obține cel mai bun scor pe 13 dintre acestea, împarte primul loc cu GPT-6 Astra pe CWE-bench v1 (68%) și este devansat pe 5. Codul agentic este terenul cel mai disputat: primul pe DeepSWE v1.1 (77,9%) și pe Vibe Code Bench, Argon termină pe ultimul loc dintre cele patru pe FrontierSWE v2 și pe Terminal-bench 4.0. Avansul său este clar în munca bazată pe cunoaștere, în special pe Legal Agent Benchmark de la Harvey (19,6% față de 6,7% în cel mai bun caz pentru celelalte trei), și pe context lung între 256K și 1M de tokenuri. Cel mai bun scor de pe fiecare linie este îngroșat.
| Benchmark evaluat (domeniu) | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index (muncă bazată pe cunoaștere) | 68,9 % | 63,1 % | 65,8 % | 67,0 % |
| AutomationBench (muncă bazată pe cunoaștere) | 51,3 % | 41,4 % | 31,4 % | 42,5 % |
| Vals Finance Agent v2 (muncă bazată pe cunoaștere) | 65,4 % | 53,5 % | 58,9 % | 58,6 % |
| Legal Agent Benchmark de la Harvey (muncă bazată pe cunoaștere) | 19,6 % | 5,4 % | 6,7 % | 3,8 % |
| DeepSWE v1.1 (cod agentic) | 77,9 % | 74,1 % | 67,4 % | 74,2 % |
| FrontierSWE v2 (cod agentic) | 55,0 % | 65,5 % | 56,3 % | 62,3 % |
| Vibe Code Bench (cod agentic) | 91,9 % | 89,6 % | 90,3 % | 90,3 % |
| Terminal-bench 4.0 (cod agentic) | 57,4 % | 58,2 % | 57,9 % | 66,4 % |
| PostTrainBench (inginerie ML) | 45,3 % | 44,3 % | 40,2 % | 49,3 % |
| Terminal-Bench Science 0.1 (științe și matematică) | 57,6 % | 68,1 % | 52,6 % | 63,3 % |
| LABBench 2 (științe și matematică) | 88,8 % | 85,4 % | 68,6 % | 73,1 % |
| RiemannBench (științe și matematică) | 76,0 % | 72,0 % | 65,6 % | 69,6 % |
| GraphWalks BFS până la 128K (context lung, F1) | 99,7 % | 98,7 % | 91,4 % | 90,6 % |
| GraphWalks BFS de la 256K la 1M (context lung, F1) | 84,2 % | 71,8 % | 65,0 % | 66,8 % |
| Agent’s Last Exam (utilizare a computerului) | 39,5 % | 34,2 % | — | 38,2 % |
| OSWorld-2.0, subset offline, scor parțial (utilizare a computerului) | 69,2 % | 72,6 % | — | — |
| Chartography (înțelegere multimodală) | 71,6 % | 71,0 % | 46,2 % | 66,3 % |
| LVBench (înțelegere multimodală) | 91,7 % | 87,5 % | 79,7 % | 83,7 % |
| CWE-bench v1 (securitate cibernetică) | 68,0 % | 68,0 % | 58,0 % | 67,0 % |
La Google, mii de angajați îl folosesc deja. Pe libgav1, decodorul video open source de la Google, agenți Argon au înlocuit 32.000 de linii de cod SIMD dintr-un portaj Rust existent cu Rust sigur: decodorul obținut este de 2,7 ori mai rapid decât acest portaj, cu o ieșire video identică. Alți agenți au pregătit pentru centrele de date optimizări de memorie care ar trebui să elibereze peste 300 TiB odată implementate. În securitate cibernetică, Wiz îl utilizează în inițiativa sa Scan for Good: Argon a descoperit acolo, într-un software de sănătate utilizat de spitale din întreaga lume, o vulnerabilitate critică ce expune date personale sensibile, pe care modelele de frontieră anterioare o rataseră.
🔗 Gemini 4 Argon: our next era of frontier intelligence (blog Google) 🔗 Pagina Gemini de la Google DeepMind și tabelul benchmark-urilor
OpenAI afirmă că a dejucat o campanie de distilare și atribuie nucleul acesteia unor persoane asociate cu Moonshot AI
30 septembrie — Într-o postare din rubrica sa Security, OpenAI afirmă că a identificat și apoi a neutralizat o campanie coordonată menită să extragă raționamentul protejat (protected reasoning) al modelelor sale, adică urma internă pe care un model o generează pentru a rezolva o sarcină. Compania consideră această acțiune o distilare ostilă (adversarial distillation): utilizarea sistematică și neautorizată a rezultatelor sau a raționamentului unui model pentru a antrena, reproduce sau îmbunătăți un alt model.
Potrivit OpenAI, operatorii nu au spart criptarea, nu au compromis o bază de date și nici nu au accesat direct conversațiile stocate ale utilizatorilor. Aceștia au manipulat schimburile de mesaje pentru ca raționamentul protejat să reapară într-o formă vizibilă, de exemplu copiind raționamentul criptat dintr-o conversație pentru a cere unui model, într-o altă conversație, să îl decripteze și să îl transcrie. Cercetători independenți semnalaseră prin divulgare responsabilă vulnerabilități similare, descrise în articolul „Stealing Reasoning Traces from Proprietary LLM APIs” trimis pe arXiv pe 10 august; OpenAI confirmă că aceste căi de atac erau reale.
| Etapa campaniei | Dată sau volum constatat de OpenAI |
|---|---|
| Începutul activității, la volum redus | 1 iulie |
| Vârfuri de activitate | 24 și 25 iulie |
| Solicitări care urmează tiparul de extragere în timpul vârfurilor | 16.000, provenite de la peste 4.000 de utilizatori |
| Grup asociat acestui tipar | peste 15.000 de utilizatori |
| Neutralizarea completă a grupului | 28 iulie |
În ceea ce privește atribuirea, postarea rămâne prudentă: nu este stabilit dacă toți operatorii aparțin aceluiași actor, iar cele 16.000 de solicitări din momentele de vârf sunt tentative de extragere, nu neapărat reușite. Totuși, OpenAI atribuie un nucleu al activității unor persoane asociate cu Moonshot AI, dezvoltatorul Kimi.
… we attribute a core cluster of the activity to individuals associated with Moonshot AI …
🇷🇴 … atribuim un nucleu al activității unor persoane asociate cu Moonshot AI … — OpenAI, postare din rubrica Security
Ca răspuns, OpenAI a blocat sau restricționat conturile frauduloase, a înăsprit controalele de înregistrare și de infrastructură, a extins monitorizarea rețelelor asociate și a consolidat protecția raționamentului ascuns între utilizatori, spații de lucru, organizații și familii de modele. Aceasta a închis o cale care permitea reluarea raționamentului criptat al unui alt utilizator pentru a-i recupera conținutul și a adăugat controale care detectează și rețin o ieșire în flux continuu (streaming) susceptibilă de a-l expune. Rezultatele au fost partajate prin intermediul Frontier Model Forum și pe canale guvernamentale: potrivit OpenAI, tehnica nu este specifică modelelor sale, iar orice sistem care face raționamentul portabil sau repetabil poate fi expus unor riscuri similare. Compania prezintă distilarea ostilă ca pe un risc la adresa siguranței și securității naționale, un raționament extras putând servi la antrenarea unui alt model fără mecanismele de siguranță ale originalului. Subiectul nu este nou: în februarie, Anthropic atribuise campanii de distilare companiilor DeepSeek, Moonshot AI și MiniMax, iar din 24 septembrie Anthropic facturează solicitările blocate din mai multe categorii, inclusiv extragerea de raționament.
🔗 Articolul „Stealing Reasoning Traces from Proprietary LLM APIs” pe arXiv
Embeddings: Cohere lansează Embed 5 și metrica RCP-nDCG@10, Perplexity publică pplx-embed-v2-context-9b-preview
30 septembrie — Cohere lansează Embed 5, o familie de modele de embeddings pentru căutarea enterprise, în două niveluri care împart același spațiu de embeddings: Embed 5 Pro, pentru calitate maximă și indexare offline, și Embed 5 Fast, pentru căutare interactivă, RAG de volum mare și căutare agentică. Se poate indexa un corpus cu Pro și apoi interoga cu Fast fără a reindexa nimic, cu condiția păstrării aceleiași dimensiuni de ieșire: pe 40 de seturi de date de dezvoltare, această schemă recomandată de Cohere păstrează în medie 98,4% din calitatea unui sistem complet Pro, față de 96,6% pentru un sistem exclusiv Fast.
Ambele modele citesc până la 128K tokeni, acceptă text, imagini sau ambele fuzionate într-un singur vector, acoperă peste 100 de limbi și produc vectori de la 256 la 2.048 de dimensiuni în float, int8 sau binar. Cohere recomandă 1.024 de dimensiuni în int8, adică 1 KB per vector față de 8 KB în float32 la 2.048 de dimensiuni. Pro costă 0,12 dolari per milion de tokeni de text, iar Fast 0,08 dolari, cu o treime mai puțin, pentru un volum de documente procesat de 2,4 ori mai mare în medie; imaginile sunt taxate cu 0,40 dolari per milion de tokeni pentru ambele. Embed 5 este disponibil începând de astăzi prin API-ul Cohere, Model Vault, Microsoft Foundry și Amazon SageMaker, precum și în North, și poate fi implementat privat cu vLLM.
| Benchmark (metrică) | Embed 5 Pro | Embed 5 Fast | Alte modele citate |
|---|---|---|---|
| ViDoRe V3, 8 domenii (RCP-nDCG@10) | 85,8 | 84,5 | Voyage 4 Large 83,7 ; Gemini Embedding 2 83,2 ; OpenAI text-embedding-3-large 75,5 |
| FinanceBench (RCP-nDCG@10) | 80,1 | 80,0 | Pro cu 21,4 puncte în fața OpenAI text-embedding-3-large |
| FinQA (RCP-nDCG@10) | 90,0 | 88,8 | — |
| ViDoRe V3 Finance (RCP-nDCG@10) | 85,0 | 83,9 | — |
| PDF-uri analizate, media suitei (RCP-nDCG@10) | 84,8 | 83,4 | Voyage 4 Large 83,6 ; Gemini Embedding 2 80,8 ; Embed 4 78,6 |
| Text și imagine fuzionate, 5 seturi (nDCG@10) | 82,3 | 81,2 | Gemini Embedding 2 61,3 |
| Imagine de pagină, 5 seturi financiare (nDCG@10) | 77,0 | 73,2 | Embed 4 71,1 ; Voyage Multimodal 3.5 70,1 ; Gemini Embedding 2 56,7 |
| 5 limbi europene (nDCG@10 sau RCP-nDCG@10) | 77 | — | Voyage 4 Large 76 ; Gemini Embedding 2 73 |
Majoritatea acestor scoruri sunt exprimate în RCP-nDCG@10, metoda de evaluare pe care Cohere o publică în aceeași zi (vezi mai jos): o notă din articol precizează că aceasta reordonează un set fix de candidați și măsoară astfel calitatea reclasării mai degrabă decât regăsirea de prim nivel. Al doilea tabel multilingv merită o lectură completă: Cohere își subliniază progresele față de Embed 4, cu până la 13 puncte în farsi, dar pe aceste zece limbi, Gemini Embedding 2 devansează Embed 5 Pro pe nouă dintre ele, chineza fiind singura excepție, iar Voyage 4 Large îl devansează pe cinci. Cohere va prezenta Embed 5 în cadrul unei sesiuni pe X pe 8 octombrie.
🔗 Articolul Cohere despre Embed 5 · Anunțul @cohere pe X
RCP-nDCG@10, metrica prin care Cohere evaluează Embed 5
30 septembrie — Cohere publică și RCP-nDCG@10 (Rubric-Calibrated Preferences nDCG@10), metoda sa de evaluare a căutării. Punct de plecare: nDCG, metrica din MTEB și BEIR, compară rezultatele cu o listă de documente adnotate în prealabil, inevitabil incompletă, astfel încât un document relevant care nu a fost adnotat niciodată nu aduce niciun punct; în studiul Cohere, 28% dintre documentele marcate ca nerelevante sunt totuși considerate utile de către evaluatori umani. RCP-nDCG@10 încredințează evaluarea unui judecător AI calibrat, care răspunde la cinci întrebări de tip da/nu identice pentru fiecare interogare și compară documentele în grupuri. Validare oarbă cu 46 de adnotatori pe 289 de dueluri: atunci când cele două metrici desemnează câștigători diferiți, oamenii îi dau dreptate lui RCP-nDCG în 70% din cazuri. Articolul, codul și datele sunt publicate, iar coordonatorul principal de întreținere al MTEB anunță integrarea sa. Cohere afirmă că a optimizat pentru această metrică a cincea generație de Embed și Rerank, cea din urmă încă fără o dată stabilită, și avertizează că aceste modele s-ar putea să nu pară întotdeauna cele mai bune doar pe baza nDCG-ului istoric.
🔗 Articolul Cohere despre RCP-nDCG@10 · Cod și date pe GitHub
Perplexity publică pplx-embed-v2-context-9b-preview și benchmarkul context-bench
30 septembrie — Perplexity publică în versiune preliminară, sub licență MIT pe Hugging Face, pplx-embed-v2-context-9b-preview, un model de embeddings contextuale: fiecare fragment dintr-un document este codificat având în vedere întregul document, astfel încât un pasaj care conține „ea” să rămână asociat cu entitatea corectă. În loc de un singur fragment de referință (gold passage) per interogare, modelul învață de la un profesor (teacher), modelul de compresie de context al Perplexity, care punctează fiecare token din document: învață astfel să regăsească răspunsul și pasajele care îl justifică. Supus unei evaluări oarbe pe context-bench, un benchmark privat de la turbopuffer, co-semnatar al articolului (2.099 de interogări, 38.894 de documente), acesta depășește voyage-context-4; pe ConTEB, obține cea mai bună medie fără a câștiga toate sarcinile. Perplexity avertizează că ponderile și interfața se pot modifica în continuare și pregătește un acces prin API-ul său, fără o dată anunțată.
| Măsurătoare publicată de Perplexity | pplx-embed-v2-context-9b-preview | Diferență față de voyage-context-4 |
|---|---|---|
| Recall al răspunsului pe context-bench, la K = 10 | 45,5 % | +14,4 puncte |
| Recall al dovezilor pe context-bench, la K = 10 | 40,6 % | +5,0 puncte |
| Stocare per vector (1.024 dimensiuni, int8) | 1 KB | de 8 ori mai puțin decât voyage-context-4 în float32 |
🔗 Articolul Perplexity Research · Model pe Hugging Face
Ideogram 4.5: un model de editare a imaginilor conceput pentru retușuri succesive
30 septembrie — Ideogram lansează Ideogram 4.5, pe care îl prezintă drept „cel mai precis model de editare”. Premisa de plecare: la fiecare retuș, modelele de imagine adaugă artefacte, decalaje de pixeli și deviații de culoare, astfel încât o imagine devine rapid inutilizabilă după mai multe iterații. Ideogram 4.5 este conceput pentru a elimina această acumulare și a face posibilă editarea în mai multe etape (multi-turn editing).
Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.
🇷🇴 Vă prezentăm Ideogram 4.5, cel mai precis model de editare. La fiecare retuș, modelele de vârf adaugă artefacte, deplasări de pixeli și modificări de culoare. Ideogram 4.5 elimină acumularea de artefacte, făcând posibilă editarea în mai multe etape. Disponibil în Ideogram, în API și la partenerii de lansare. Ponderi open-source în curând. — @ideogram_ai pe X
Pentru a susține acest punct de vedere, Ideogram publică o comparație alăturată a acelorași retușuri succesive cu GPT Image 2.5 Sunburst, Nano Banana Pro și Nano Banana 2, ale căror rezultate ar deveni, conform acestuia, inutilizabile după doar câteva retușuri. Comparația este vizuală, fără scoruri numerice. Exemplele acoperă culoarea și iluminarea (umbrele, reflexiile și zonele luminoase urmăresc modificarea fără a afecta compoziția), modificarea textului, fotografia de produs, designul interior, restaurarea fotografiilor vechi pas cu pas, trecerea de la o schiță sau o hartă de profunzime la o imagine și decuparea.
Modelul introduce, de asemenea, editarea la orice rezoluție (Zoom editing): o zonă dintr-o imagine de înaltă definiție, de 24,2 megapixeli (4.016 × 6.016 pixeli) în exemplul Ideogram, este retușată fără a reduce imaginea, marginile acesteia fiind păstrate pentru a o reintegra fără îmbinări vizibile. Deși este gândit pentru editare precisă și localizată, modelul se comportă foarte bine și la editarea generală, conform Ideogram.
| Elementul anunțului | Ce se știe |
|---|---|
| Disponibilitate | din 30 septembrie în Ideogram și prin API |
| Parteneri de lansare | Pika și Luma, care îl anunță în aceeași zi |
| Ponderi deschise | promise „în curând”, precum cele ale Ideogram 4.0 publicate în iunie |
| Preț | nepublicat |
🔗 Pagina modelului Ideogram 4.5
HeyGen Video: un model video construit pe MiniMax H3, disponibil prin API
30 septembrie — HeyGen lansează HeyGen Video, un model de generare video destinat companiilor care își doresc videoclipuri la calitate de producție fără a plăti costul aferent. Construit pe MiniMax H3 și post-antrenat de HeyGen, acesta produce video pe baza unui text sau a unei imagini, cu sunet generat în același apel, și se utilizează prin intermediul API-ului HeyGen, precum și pe OpenRouter, Runware și ComfyUI.
În ceea ce privește prețul, coexistă trei cifre. Tariful pornește de la 0,01 dolari pe secundă până la sfârșitul lunii octombrie, adică o reducere de 50% față de tariful standard de 0,02 dolari, conform paginii din catalog. Grila sa comparativă reține însă prețul de listă în 768p cu audio, înainte de promoțiile de lansare: 0,03 dolari pe secundă. Chiar și la acest preț, HeyGen Video este cel mai accesibil dintre modelele comparate.
| Model comparat | Preț de listă pe secundă (768p, audio) | Elo intern al HeyGen (HeyGen Video = 1.000) |
|---|---|---|
| HeyGen Video | 0,03 dolari | 1.000 |
| Seedance 2.0 | 0,303 dolari | 955 |
| H3 Max | 0,08 dolari | 952 |
| H3 Max Turbo | 0,04 dolari | 920 |
| H3 Max balanced | 0,08 dolari | 860 |
| Kling 3.0 Pro | 0,168 dolari | 857 |
| Veo 3.1 | 0,40 dolari | 744 |
În privința calității, HeyGen se bazează pe o evaluare internă efectuată pe baza prompturilor din Artificial Analysis Arena (4.800 de voturi), cu un scor Elo ajustat la 1.000 pentru modelul său. În preferințele oarbe față de H3 Max, 55,8% din cele 650 de voturi merg către HeyGen Video, într-un interval de 49 până la 62% care nu exclude egalitatea. Pentru un clip de 10 secunde din imagine în video, timpul de inferență al transformerului de difuzie scade la 3,7 secunde, comparativ cu 4,1 pentru H3 Max Turbo și 8,3 pentru H3 Max, excluzând timpul de descriere/subtitrare.
MiniMax a salutat lansarea și a evidențiat în aceeași zi un alt model derivat din H3: Boreal-H3 de la Creatify, un model video optimizat pentru publicitate.
🔗 Catalog HeyGen Video · Anunțul @HeyGen pe X
Asistenți și agenți generaliști: abilitățile (skills) Gemini, Manus Flex și Grok Bot
Aplicația Gemini lansează abilitățile (skills), care vor înlocui Gems
30 septembrie — Google lansează abilitățile (skills) în aplicația Gemini: instrucțiuni salvate o singură dată, apelate prin tastarea unei bare oblice urmate de numele lor. De asemenea, Gemini poate crea abilități pornind de la conversații și le poate rula automat atunci când un prompt se potrivește; mai multe abilități se pot cumula, iar fiecare poate include fișiere de referință (text simplu, PDF, imagini). Deja prezente în Gemini Spark, acestea ajung în chatul Gemini din întreaga lume, pentru toate nivelurile de abonament Google AI și, deocamdată, pentru utilizatorii de peste 18 ani; clienții Workspace vor urma în săptămânile următoare. Abilitățile vor înlocui funcția Gems, care va dispărea începând din noiembrie pentru conturile personale, în martie 2027 pentru Workspace business, enterprise și nonprofit, și în iunie 2027 pentru educație, printr-o migrare automată. Opal, instrumentul de creare de mini-aplicații, se va închide de asemenea în noiembrie, la fel ca „Gems by Google Labs”, care nu vor fi migrate.
🔗 Let skills in Gemini tackle your most repetitive tasks (blog Google)
Manus Flex: propria cheie API în agentul Manus
29 septembrie — Manus lansează Manus Flex, care permite utilizarea Manus cu propria cheie API a unui furnizor de inferență acceptat (bring your own API key). Până acum, Manus își alegea singur modelul și furniza cadrul de execuție și infrastructura de agent; cu Flex, cheia unui furnizor alimentează aceleași proiecte, instrumente, medii de rulare și fluxuri de lucru ale agentului, cu un model principal și un nivel de efort de raționament la alegere. Facturarea este împărțită: inferența este facturată direct de furnizor, în timp ce celelalte servicii și infrastructura mobilizate de o sarcină continuă să consume credite Manus. OpenRouter, Fireworks și Modal sunt primii trei membri ai programului de parteneriat pentru inferență (Manus Flex Inference Partner Program). Articolul, publicat la o zi după lansarea Manus 2.0, nu oferă detalii despre abonamente, prețuri sau lista modelelor.
Grok Bot încredințează codul lui Cursor și gestionează pull request-urile
30 septembrie — La două zile după Team Bots, SpaceXAI îmbunătățește Grok Bot pentru dezvoltarea software. Într-un fir de discuție al contului @bot, compania anunță că boții săi pot delega sarcini de programare către Cursor, pot gestiona pull request-uri prin intermediul unor pluginuri GitHub și Origin (acesta din urmă nefiind descris) și pot distribui demonstrații video cu ceea ce construiesc. SpaceXAI publică, de asemenea, sub formă de șabloane instalabile (templates), boții propriei sale echipe de inginerie, fiecare livrat cu abilitățile, rutinele și conectorii săi. Firul de discuție nu specifică vreun abonament, tarif sau dată, și niciun articol nu îl însoțește pe x.ai. Conexiunea cu Cursor nu este o noutate: Grok Bot for Enterprise a fost oferit gratuit timp de două săptămâni clienților Grok și Cursor Enterprise la începutul lunii septembrie; noutatea este că un bot își deleagă acum singur activitatea de codare.
Robotică și modele ale lumii: Praxis-1 de la Runway, MolmoAct 2 de la Ai2 și Physis-Lang de la NVIDIA
Runway prezintă Praxis-1, un model de acțiune asupra lumii cu ponderi deschise
30 septembrie — Runway prezintă Praxis-1, primul său model de acțiune asupra lumii (world action model) cu ponderi deschise, destinat controlului roboților reali. Acesta se bazează pe aceeași pre-antrenare video ca modelele sale de lume, cum ar fi Solaris sau GWM Worlds 2, și își propune să fie un model de politică generalist pentru dezvoltatorii și cercetătorii din robotică. Pariul celor de la Runway: demonstrațiile robotice sunt rare, în timp ce conținutul video este aproape nelimitat. În demonstrațiile lor, o aceeași politică trece dintr-un studio într-o bucătărie fără reantrenare. Nimic nu poate fi încă descărcat: Praxis-1 este în faza de testare la Noble Machines, Standard Bots și Ultra, fiecare pe propriul hardware, iar lansarea sa publică, inclusiv a ponderilor, este anunțată pentru lunile următoare.
| Măsurătoare publicată de Runway | Rezultat anunțat |
|---|---|
| Corelație între simularea în modelul de lume și rezultatele reale | 0,95 |
| Eroare finală de plasare după ajustare, cu video de pe web | 16,1 cm |
| Aceeași eroare cu video de la robot teleoperat | 16,0 cm |
MolmoAct 2 de la Ai2 în fruntea Reality Check, după reglare fină de către organizatorul benchmarkului
30 septembrie — Ai2 anunță că MolmoAct 2, modelul său de robotică complet deschis, se clasează pe primul loc la rata globală de succes în Reality Check, un benchmark independent de manipulare în condiții reale, cu o nuanță importantă: modelele sunt reglate fin de către organizator, Poke & Wiggle, pe sarcinile benchmarkului. Lansat cu o zi înainte de această companie, Reality Check include 14 400 de execuții pe roboți reali, pe stații FR3 Duo instalate la Deutsches Museum din München, în zece medii (sortarea șuruburilor, conectarea unei mufe DC, deschiderea unei cutii de scule cu șurubelnița…). Două direcții rămân „în curând”: obiecte plasate în afara zonei de antrenare și o etapă intermediară de antrenare pe 100 de ore de date colectate de la stații.
| Model evaluat | Rată globală de succes | Rată de succes după aproximativ 10 demonstrații per mediu | Rată de succes după aproximativ 300 de demonstrații per mediu |
|---|---|---|---|
| MolmoAct 2 | 28 % | 4 % | 44 % |
| Pi 0.5 | 21 % | 5 % | 33 % |
| DiT-Flow | 19 % | 2 % | 29 % |
| GR00T N1.7 | 12 % | 4 % | 19 % |
🔗 Tweet de la Ai2 · Clasamentul Reality Check
Physis-Lang: descrieri care explică fizica pentru modelele de lume
29 septembrie — Cercetători de la NVIDIA, MIT și Universitatea din Oxford publică Physis-Lang, un cadru de lucru care adaugă raționament fizic descrierilor video pentru a îmbunătăți modelele de lume. Descrierile fac explicite cauzele, legile implicate și efectele; un critic specializat identifică afirmațiile lipsă sau nefondate, un agent ajustează instrucțiunile de adnotare, iar eșecurile modelului sunt utilizate pentru a căuta videoclipurile care îi vor acoperi lacunele. Conform NVIDIA, adăugarea acestui raționament exclusiv în prompt, fără reantrenare, îmbunătățește cu 5,62 puncte scorul PhyGenBench al modelului Cosmos 3. Cu antrenare, Physis-Lang pe Cosmos3-Super și Cosmos3-Nano ocupă primele două locuri în clasamentul Physics-IQ Verified pentru imagine-în-video (48,2 și 43,3, față de 42,7 pentru cel mai bun scor anterior). PhyGenBench și VideoPhy-2 sunt evaluate de GPT-5.5, iar Veo 3.1 păstrează un ușor avantaj pe setul complet VideoPhy-2.
| Benchmark de fizică video | Cosmos3-Nano | Veo 3.1 | Physis-Lang pe Cosmos3-Nano |
|---|---|---|---|
| PhyGenBench | 61,67 | 65,63 | 71,04 |
| Physics-IQ Verified | 40,23 | 34,99 | 43,41 |
| VideoPhy-2 Hard | 48,31 | 58,43 | 62,36 |
| VideoPhy-2, set complet | 60,41 | 68,87 | 68,02 |
🔗 Pagina proiectului Physis-Lang · Anunțul lui @NVIDIAAI pe X
Modele deschise: Hunmin-397B-A17B-CUA și JEV-27B-VL
Hunmin-397B-A17B-CUA grefează capacitățile de agent ale Qwen-CUA pe un MoE de 397 de miliarde de parametri
30 septembrie — Pe blogul comunității Hugging Face, hojun Lee detaliază Hunmin-397B-A17B-CUA, un model de utilizare a computerului (computer use) lansat sub licența Apache-2.0 de organizația mncai, cu o rezervă formulată chiar de autori: evaluările sunt realizate intern, cu o singură rulare pentru benchmarkurile de agenți, și nu sunt comparabile cu clasamentele publicate (baza obține 48,16 pe OSWorld, față de 62,2 anunțate pe OSWorld-Verified). Modelul se bazează pe Qwen3.5-397B-A17B, o mixtură de experți cu 17 miliarde de parametri activi, iar întregul proiect a încăput pe un singur nod cu opt B200. Echipa a calculat diferența de ponderi dintre baza sa și Qwen-CUA, deja specializat, și a grefat doar o versiune de rang redus pe o selecție de module: numai acest transfer crește scorul OSWorld-316 de la 48,84 la 68,25, fără a prelua slăbiciunea Qwen-CUA în ancorarea vizuală. O reglare fină urmată de o învățare prin consolidare GRPO adaugă 4,3 puncte.
| Banc de evaluare (protocol intern) | Bază Qwen3.5-397B | Hunmin-CUA | Qwen-CUA (sursă) |
|---|---|---|---|
| OSWorld, 360 de sarcini | 48,16 | 70,45 | 77,12 |
| WindowsAgentArena, 153 de sarcini | 41,77 | 50,85 | 56,68 |
| ScreenSpot-Pro | 72,74 | 75,61 | 62,20 |
| KMMLU-Pro (coreeană) | 77,91 | 76,12 | 71,41 |
🔗 Articolul Hunmin-CUA · Ponderi pe Hugging Face
AutoTrust AI publică JEV-27B-VL, un model de decizie deschis care evaluează și imagini
30 septembrie — AutoTrust AI publică sub licența Apache-2.0 JEV-27B-VL, versiunea dotată cu vedere a modelului JEV-27B, modelul său decizional deschis prezentat pe 27 septembrie. I se prezintă imagini și text, i se adresează o întrebare, iar acesta răspunde într-o singură trecere cu o probabilitate calibrată pentru fiecare opțiune, în aproximativ o sută de milisecunde; când întrebarea o cere, acesta raționează pas cu pas analizând imaginile. Totuși, capul său decizional nu a văzut nicio imagine în timpul antrenării. Testul principal: pe MicroLens, un set public de date pentru aplicații video scurte, clasifică 20 de videoclipuri candidate pentru 200 de utilizatori doar pe baza miniaturilor și obține un scor AUC la egalitate cu o filtrare colaborativă antrenată pe 59 045 de utilizatori, având o rată mai bună de videoclipuri potrivite în top 5. Autorii amintesc că acest rezultat provine dintr-un singur eșantion de 200 de utilizatori.
| Metodă de recomandare pe MicroLens | AUC | Videoclip bun în top 5 |
|---|---|---|
| JEV-27B-VL, doar miniaturi, fără date de interacțiune | 0,727 | 59 % |
| Filtrare colaborativă antrenată pe 59 045 de utilizatori | 0,728 | 49 % |
| JEV-27B-VL, doar titluri | 0,649 | 46 % |
| Ordine aleatorie | 0,489 | 21 % |
Clasamente: Open TTS Leaderboard de la Hugging Face și AURORA de la LILT
Hugging Face lansează Open TTS Leaderboard, un clasament deschis al sintezei vocale
30 septembrie — Hugging Face lansează Open TTS Leaderboard, un clasament al sintezei vocale (text-to-speech, TTS) axat pe modele deschise și multilingve. Hub-ul numără peste 8 000 de modele TTS, însă arenele de votare de referință țin cu greu pasul și subreprezintă modelele deschise: conform articolului, doar 16 dintre cele 92 de modele clasificate de Artificial Analysis au ponderi deschise. Astfel, clasamentul înlocuiește voturile cu măsurători obiective: inteligibilitatea (rata de eroare pe cuvânt sau pe caracter între textul cerut și transcrierea sa de către Qwen3 ASR), viteza (inferență în loturi și timpul până la primul sunet, pe H200 și pe procesor) și fidelitatea unei voci clonate (similaritate WavLM). Evaluarea unui model durează câteva ore în loc de câteva săptămâni de votare. În limba engleză, Kokoro-82M, supertonic-3 și s2-pro de la Fish Audio conduc; la nivel multilingv, OmniVoice, s2-pro și Fun-CosyVoice3-0.5B. Autorii avertizează că nici naturalețea, nici expresivitatea nu sunt măsurate și că își vor publica scripturile de evaluare „în curând”.
🔗 Articolul despre Open TTS Leaderboard · Clasamentul pe Hugging Face
LILT lansează AURORA, un clasament multilingv al sarcinilor de agent
30 septembrie — LILT lansează AURORA, un clasament care evaluează modelele de vârf pe sarcini de agent în alte limbi decât engleza, toate concepute și verificate de experți nativi, fără traducere automată. Patru benchmarkuri deschid lista: un Terminal-Bench multilingv de 324 de sarcini de codare în zece limbi, o versiune multilingvă a τ³-bench pentru suport clienți, MultiChallenge pentru urmărirea instrucțiunilor în context lung și GAIA-v2-LILT pentru raționament agentic. Claude Opus 5.5 conduce în Terminal-Bench multilingv și se clasează pe primul loc în τ³-bench în fiecare dintre cele cinci limbi. Pe GAIA, modelele câștigă în medie 20,7 puncte pe versiunea auditată de LILT în comparație cu o traducere automată: pentru LILT, această diferență măsoară eroarea introdusă de traducere. De asemenea, același dialog consumă de aproximativ 1,4 ori mai multe tokenuri în coreeană sau arabă decât în engleză.
| Model evaluat (Terminal-Bench multilingv, extras) | Rată medie de succes |
|---|---|
| Claude Opus 5.5 (effort high) | 76,4 % |
| Claude Opus 5 (effort high) | 73,5 % |
| Gemini 3.8 Flash | 67,3 % |
| GPT-6 Sol | 64,8 % |
| Command A+ | 4,3 % |
🔗 Articolul AURORA de la LILT · Clasamentul AURORA
Sectorul public și companii: Claude for Government, agentul de vânzări Anthropic și OpenAI cu America’s SBDC
Claude for Government devine disponibil general
30 septembrie — Claude for Government iese din faza beta: Anthropic anunță disponibilitatea sa generală pentru agențiile federale și agențiile statale din SUA. Platforma, aflată în beta publică din iulie, oferă capacitățile de codare și de lucru agentic ale lui Claude într-un mediu autorizat FedRAMP High, cu funcții comparabile cu cele ale clienților comerciali; CLI-ul Claude Code și Claude for Microsoft 365 devin accesibile aici în regim de acces timpuriu. Nu există licențiere per utilizator: agențiile plătesc utilizarea pe tranșe fixe, cu o limită strictă care împiedică depășirea bugetului alocat, iar mapările de grupuri SCIM stabilesc, pe niveluri de cont, limite de debit, plafoane financiare și modele autorizate. În ceea ce privește controlul, operațiunile sensibile din partea Anthropic necesită o aprobare din partea a două persoane, exporturile de utilizare conțin doar date metrice, iar istoricul conversațiilor rămâne pe dispozitivul gestionat de agenție. Anthropic nu publică niciun tarif.
🔗 Claude for Government is now generally available
La Anthropic, un agent construit pe Managed Agents gestionează solicitările comerciale primite
30 septembrie — Anthropic relatează modul în care echipa sa de vânzări a regândit primirea solicitărilor de intrare, zeci de mii pe lună, cu ajutorul unui agent de achiziții construit pe Claude Managed Agents, aflat în fază beta. Prezent pe paginile Contact Sales și Pricing, în claude.ai și în e-mailuri, acesta adresează câteva întrebări, recomandă un abonament și un număr de licențe, apoi ghidează spre achiziție, redirecționează către un reprezentant comercial transmițând tot istoricul sau se limitează la a răspunde; clientul poate alege un operator uman încă de la început. Potrivit articolului semnat de Carl Johnson, agentul susține mii de conversații pe zi; leadurile pe care le transmite devin oportunități de peste două ori mai des decât prin vechiul formular și finalizează achiziția cu aproximativ cinci zile mai repede, iar procentul conversațiilor care necesită un agent de vânzări pentru semnare a scăzut cu circa jumătate. Un singur inginer a construit prima versiune în câteva săptămâni; agentul orientează adesea echipele mici către planul Team în loc de Enterprise, decizie pe care Anthropic a ales să și-o asume pe deplin.
🔗 How Anthropic’s sales team rebuilt inbound with Claude Managed Agents
OpenAI se asociază cu America’s SBDC și publică un raport despre întreprinderile mici
30 septembrie — OpenAI încheie un parteneriat cu America’s SBDC, rețeaua națională a centrelor de dezvoltare a micilor afaceri din SUA, care sprijină 1 milion de antreprenori pe an. Într-o primă fază, prin programul de formatori comunitari al OpenAI Academy (Community Trainer Program), lansat ca proiect pilot pe 23 septembrie, OpenAI intenționează să formeze aproximativ 150 de consultanți, care vor susține ateliere de trei ore în cadrul rețelelor SBDC, cu scopul de a ajunge fizic la cel puțin 1 000 de întreprinderi mici. În aceeași zi, raportul „Small Businesses, Bigger Capabilities” prezintă date privind utilizarea: în săptămâna 9–15 septembrie, aproximativ 4 milioane de angajați din companii cu mai puțin de 500 de salariați au utilizat produsele OpenAI, dintre care aproape unul din cinci într-o întreprindere cu mai puțin de 10 angajați. În august, tokenurile de ieșire agentice, în special cele ale ChatGPT Work și Codex, reprezentau două treimi din totalul tokenurilor de ieșire ale micilor întreprinderi, față de o treime în aprilie.
🔗 Articolul OpenAI despre întreprinderile mici
Runway Ads: un motor autonom pentru publicitatea de performanță
30 septembrie — Runway lansează Runway Ads, care preia de la un capăt la altul partea creativă a campaniilor plătite. Se conectează un cont publicitar și un kit de brand: instrumentul, construit pe Runway Agent, generează creații video și imagine, publică variantele aprobate pe Meta, Google și TikTok, analizează performanțele acestora și produce următorul val în jurul a ceea ce a atras cheltuielile. Acesta localizează fiecare creație conform unor reguli stabilite de echipă, inclusiv textul de pe ecran, o redimensionează pentru fiecare format, o supune unui control automat de brand și respectă limitele de buget. Aprobarea umană este activată implicit; publicarea automată poate fi activată per campanie sau per tip de variantă.
| Indicator intern Runway, din iulie | Rezultat publicat în articol |
|---|---|
| Reclame pe săptămână | de la 77 la aproximativ 900 |
| Randamentul cheltuielilor publicitare | dublat |
| Conversie | aproximativ +34%, rată de clic stabilă |
| Cost per abonat | −41% |
Runway Ads este pentru moment în fază pilot la parteneri enterprise selectați. Tweetul de anunț promite o implementare pe scară largă în săptămânile următoare și afirmă că instrumentul a permis, de asemenea, adăugarea a 100 de milioane de dolari în ARR (venit anual recurent) din iulie, o cifră absentă din articol.
🔗 Articol Runway Ads · Tweet de la @runwayml
ElevenLabs evaluată la 22 de miliarde de dolari după o ofertă de răscumpărare de 300 de milioane
30 septembrie — ElevenLabs a finalizat o ofertă de răscumpărare de acțiuni (tender offer) de 300 de milioane de dolari destinată angajaților săi, care o evaluează la 22 de miliarde de dolari, dublul evaluării sale din runda Series D din februarie. Operațiunea este condusă de Wellington și T. Rowe Price; EQT, Goldman Sachs, GIC, OTPP, Sapphire Ventures și BDT & MSD intră în acționariat, alături de investitori existenți precum Andreessen Horowitz, Lightspeed și ICONIQ. Clienții enterprise reprezintă 55% din venituri: ElevenAgents procesează peste 15 milioane de conversații pe săptămână, de trei ori mai mult decât în februarie, iar venitul său anual recurent s-a triplat cu mult în această perioadă. Conform unei analize a clienților săi, agenții vocali rezolvă solicitările cu 31% mai rapid decât agenții de chat. Compania are peste 800 de angajați, la patru ani după o primă rundă la o evaluare de 9 milioane de dolari.
Vera Rubin NVL72 în producție la CoreWeave, Cognition măsoară un debit de până la 4,8 ori mai mare
30 septembrie — Cu ocazia evenimentului CoreWeave Fully Connected din San Francisco, NVIDIA detaliază trecerea în producție a Vera Rubin NVL72 la CoreWeave: platforma, împreună cu rețeaua Spectrum-X Ethernet 102.4T, este disponibilă pe CoreWeave Cloud, care a primit primele sale rackuri de producție mai devreme în cursul lunii. Cognition, dezvoltatorul lui Devin, este primul client care rulează sarcini de producție pe aceasta: în timpul primelor teste pe sarcini extrase din FrontierCode, a măsurat un debit total de tokenuri pentru inferența SWE-2 de până la 4,8 ori mai mare decât cu GB200 NVL72. De asemenea, CoreWeave va oferi procesorul Vera CPU, conceput pentru agenți: 128 de procesoare și 11.264 de nuclee per rack, suficient pentru a rula peste 11.000 de medii izolate simultan, cu sandboxuri pentru agenți care pornesc de peste trei ori mai rapid. În cele din urmă, CoreWeave lansează CoreWeave Forge, care reunește Weights & Biases, OpenPipe și marimo pentru a închide bucla de la producție la antrenare; învățarea prin consolidare serverless (serverless RL) a acestuia este anunțată ca fiind de 1,4 ori mai rapidă, cu costuri mai mici cu 40%.
🔗 Articol NVIDIA despre CoreWeave și Vera Rubin
Agenți de cod și instrumente de dezvoltare: Claude Code 2.1.286, Zed 1.22.0, Gemini CLI, VS Code 1.140, HydraFusion și un server MCP pentru gcloud
Claude Code 2.1.286: marcaje în VS Code, reîncercări plafonate și mod bare restrâns
30 septembrie — Claude Code 2.1.286, lansat la ora 19:10 UTC, include 88 de intrări, dintre care 49 de remedieri. Solicitarea de permisiune indică poziția atunci când se acumulează mai multe cereri („2 of 5”), iar extensia VS Code primește marcaje (bookmarks) pentru a păstra răspunsurile lui Claude într-un panou lateral, un rând Întrebări care reia întrebările puse de Claude și răspunsurile alese, precum și previzualizări ale opțiunilor în cardurile de întrebare. Două modificări de comportament sunt importante: o singură limită acoperă acum reîncercările unui apel de model, respectiv maximum 14 cereri cu setările implicite, iar --bare conectează doar serverele MCP numite în linia de comandă, fără mementouri de sistem sau sarcini de fundal. Dacă există un skill numit verify, Claude primește instrucțiunea de a-l rula chiar înainte de fiecare commit, cu excepția documentației sau a testelor, iar pluginurile refuză sursele npm care sunt depozite git sau foldere. În cele din urmă, când API-ul refuză modelul implicit, Claude Code reîncearcă o dată cu modelul anterior de același nivel în loc să eșueze la fiecare pas.
🔗 Notele versiunii Claude Code 2.1.286
Zed 1.22.0: un model per subagent
30 septembrie — Zed lansează versiunea sa stabilă 1.22.0, axată pe subagenți: instrumentul spawn_agent acceptă un parametru opțional model, pentru a lansa un subagent pe un alt model decât cel configurat sau moștenit de la părinte, iar cardul fiecărui subagent afișează modelul utilizat. Subagenții își compactează automat și contextul, ceea ce le permite, conform Zed, să gestioneze sarcini mai lungi. În privința modelelor, GPT-6.1 Sol sosește în regim BYOK cu o cheie API OpenAI, Grok 4.7 trece la versiunea stabilă ca model recomandat la SuperGrok și xAI, iar lista de modele OpenCode Zen și Go este preluată din mers. Versiunea remediază o scurgere de memorie de aproximativ 2 MO per comandă finalizată în terminal și modifică o comandă rapidă: închiderea dockului activ trece la ctrl-alt-w pe toate platformele. În total, 18 noutăți și 37 de remedieri.
Gemini CLI: v0.62.0 în versiune stabilă și o versiune preliminară care execută planurile fără confirmare
29 septembrie — Gemini CLI lansează două versiuni în cursul serii (UTC). Versiunea v0.62.0 trece în versiune stabilă la ora 21:17: cele 19 intrări ale sale preiau versiunea preliminară și versiunile nightly prezentate între 16 și 24 septembrie (titluri structurate ale apelurilor de instrumente MCP, păstrarea tokenului de reîmprospătare OAuth (refresh token), Gemini 3.8 Flash și 3.5 Flash Lite). Noutatea constă în versiunea preliminară v0.63.0-preview.0, lansată la ora 20:58: în modul non-interactiv, agentul redactează și își execută acum planul fără a aștepta confirmarea (PR 29539), în timp ce instrucțiunile din Plan Mode îl determinau să răspundă cu un simplu mesaj de aliniere, fără niciun apel de instrument. O limită maxChars de 0 sau mai mică dezactivează, de asemenea, trunchierea ieșirilor instrumentelor (PR 29542). Versiunea nightly din 30 septembrie deschide seria 0.64.0: în modul ACP, CLI-ul raportează în sfârșit utilizarea standard, în timp ce clienți precum Zed sau OpenHands supraestimau facturarea de aproximativ 3 ori, conform PR 29549.
🔗 Gemini CLI v0.63.0-preview.0 · Gemini CLI v0.62.0
VS Code 1.140 adoptă hamul Copilot
30 septembrie — Visual Studio Code 1.140 este lansat în versiune stabilă cu hamul Copilot (Copilot harness): bazat pe Copilot SDK, acesta îi oferă agentului din VS Code comportamentul și capacitățile aplicației GitHub Copilot și ale Copilot CLI și rulează într-un proces gazdă dedicat, bazat pe Agent Host Protocol, astfel încât o aceeași sesiune poate fi accesată din mai multe ferestre; notele avertizează că este posibil să fie deja selectat implicit pentru anumiți utilizatori. Ca funcționalitate experimentală, sesiunile multi-folder oferă fiecărui chat propriul folder sau worktree, iar agentul poate delega o sesiune către o gazdă la distanță, aleasă în funcție de sistem, memorie, număr de procesoare și model. Trei mecanisme de control sosesc pentru mediul enterprise: explicarea în chat a versiunilor minime cerute de administrator, un nivel implicit al modului Auto stabilit printr-o setare gestionată (autoTier) și adăugarea identității utilizatorului la datele OpenTelemetry ale Copilot, opțiune dezactivată implicit.
🔗 Notele versiunii VS Code 1.140
HydraFusion sosește în VS Code și în aplicația GitHub Copilot
30 septembrie — GitHub extinde HydraFusion, orchestrarea multi-model lansată pe 4 septembrie în Copilot CLI, la VS Code (începând cu versiunea 1.140 sau Insiders) și la aplicația GitHub Copilot, aflată în continuare în fază preliminară de cercetare. HydraFusion se alege din selector ca un model, însă nu este unul: tratează alegerea fluxului de lucru ca pe o problemă de optimizare și reține una dintre cele trei scheme. În modul Single, un singur model rezolvă sarcina; în modul Cascade, un model eficient redactează, iar un control al calității acceptă rezultatul sau redirecționează către un model mai puternic; în modul Critique, un recenzent doar în citire, dintr-o altă familie de modele, revizuiește, după care redactantul modifică o singură dată. Dacă modul Auto alege un model per cerere, HydraFusion coordonează mai multe modele în cadrul aceluiași pas. Este disponibil în Copilot Pro, Pro+, Business și Enterprise, un administrator trebuind să activeze versiunile preliminare în Business și Enterprise; GitHub nu publică nicio cifră nouă.
🔗 HydraFusion in VS Code and the GitHub Copilot app
Google Cloud deschide în versiune preliminară un server MCP la distanță care execută gcloud și bq
Google Cloud adaugă la serverele sale MCP gestionate la distanță Google Cloud CLI remote MCP server, în versiune preliminară publică. Acesta reunește sute de comenzi ale instrumentelor în linie de comandă gcloud și bq (BigQuery) în spatele a două instrumente MCP, run_gcloud_command și run_bq_command. Google justifică alegerea liniei de comandă prin două argumente: o comandă încapsulează operațiuni în mai multe etape pe care API-ul le-ar forța să fie orchestrate, iar modelele au fost antrenate pe scară largă pe documentația publică a acestor comenzi. Serverul la distanță evită instalarea CLI-ului în mediul agentului, ceea ce deschide aceste operațiuni către platformele de agenți găzduite pe web, cum ar fi Gemini Enterprise. Comenzile se execută într-un sandbox izolat, în spatele unui proxy cu rețea restricționată și fără credențiale ambientale (ambient credentials), fiecare cu permisiunile IAM ale identității apelante, autentificată prin Agent Identity sau OAuth 2.0; Model Armor poate filtra prompturile și răspunsurile, iar fiecare apel poate fi înregistrat în jurnalele de audit. Serverul nu este taxat în sine: sunt facturate doar resursele create și eventualele transferuri de date.
🔗 Empower your agents with the Google Cloud CLI remote MCP server (blog Google Cloud)
Pe scurt
- Codex CLI 0.159.2 — Lansată pe 29 septembrie la ora 23:57 UTC, această versiune conține doar un patch backportat: sub Windows, ferestrele de consolă nu mai pâlpâie atunci când Codex lansează procese în fundal sau comenzi în mediul său sandbox. 🔗 sursă
- Plaid în Amp — Modurile Amp care utilizează GPT-6 Astra primesc Plaid, bazat pe nivelul ultrarapid al OpenAI: interogări de până la 6 ori mai rapide pentru un cost per token de 6 ori mai mare, rezervat inferenței furnizate de Amp; subagenții rămân la viteza fast sau standard, iar Amp nu publică niciun preț. 🔗 sursă
- Warp și Factories as Code — Warp prezintă configurarea fabricilor sale software drept „Terraform-ul agenților”: un depozit descrie agenții, automatizările, accesul și măsurarea. Formatul factory.yaml datează de la sfârșitul lunii august; ghidul interactiv detaliază accesul federat la AWS sau GCP, webhookurile și integrările Slack, Linear sau Jira. 🔗 fir de discuție de la Warp · 🔗 ghid de configurare
- Devin la Crosby — Într-un studiu de caz realizat de Cognition, firma de avocatură newyorkeză Crosby, cu o duzină de ingineri pentru peste 50 de avocați, îi încredințează lui Devin primul răspuns la incidente: între 20 și 40 de buguri și alerte examinate pe zi, în aproximativ 5 minute pentru majoritatea, și cu cel puțin 50% mai puțin zgomot Sentry. 🔗 sursă
- claude.dev — Anthropic prezintă oficial claude.dev ca fiind casa dezvoltatorilor care construiesc cu Claude: analize tehnice detaliate, ghiduri Claude Code și API, secțiunile Agents, Engineering, Playbooks și Skills, precum și o pagină Terminal ca surpriză ascunsă. Articole de pe site erau deja preluate încă din 22 septembrie. 🔗 sursă
- Site-uri ChatGPT editabile — Conform notelor de lansare din 29 septembrie, un Site publicat poate fi modificat cu Edit site și programat din Automations pe Plus și Pro; în Enterprise, Site-urile private se pot baza pe aplicațiile conectate, cu o setare Allow use in Sites per plugin, dezactivată în mod implicit. 🔗 note de lansare ChatGPT · 🔗 note Enterprise și Edu
- Kimi Work 3.2.15 — Versiunea din 30 septembrie introduce coeditarea om-IA a documentelor Notion și Feishu în browserul integrat, restrânge în mod implicit desfășurarea acțiunilor agentului și rezolvă coruperea fișierelor la editarea simultană a unui PPT. 🔗 sursă
- Cue gestionează finanțele — Aplicația de agenți personali lansată odată cu Manus 2.0 urmărește acum abonamentele și tendințele de cheltuieli și trece conturile bancare pe pilot automat, prin Plaid; nu sunt specificate țări, abonamente sau condiții. 🔗 sursă
- GPT-6.1 Sol în Genspark — Genspark introduce GPT-6.1 Sol în AI Chat, Code Agent și Claw la o zi după lansare, preluând argumentele OpenAI (o inteligență apropiată de Astra pentru o cincime din prețul API-ului său), fără a specifica un abonament sau un cost în credite. 🔗 sursă
- Qwen3.8-27B-pi — Thomas Kim publică sub licență Apache-2.0 un fine-tuning pentru Qwen3.8-27B adaptat pentru harness-ul Pi, care restabilește ordinea nivelurilor de efort: pe Terminal-Bench 2.1, nivelul medium egalează modelul de bază la nivelul xhigh (67 de sarcini din 89) cu aproximativ 41% mai puține tokenuri de ieșire. 🔗 sursă
- Qwen3.8-27B la Nebius — Qwen semnalează sosirea modelului său dens de 27 de miliarde de parametri pe Nebius Token Factory, anunțată pe 28 septembrie, pentru cod, cercetare și fluxuri agentice; nu au fost comunicate prețul sau lățimea de bandă. 🔗 sursă
- Bekko System One v0 — Yuichi Tateno publică trei modele de decizie de 17M, 68M și 400M de parametri, dintre care cele două mai mici rulează într-un browser, alături de benchmark-ul S1MB: cel de 400M obține 50,60 față de 59,59 pentru Jev 1.13, dar 54,48 față de 96,27 la generalizare. 🔗 sursă
- ZooWork Instinct Tuned 4B — SRP publică sub licență Apache-2.0 un model de decizie de 4 miliarde de parametri, construit pe Qwen3.5-4B, care evaluează opțiunile dintr-o singură trecere, fără decodare: 198 din 231 (85,71%) pe sarcinile publice din JevBench, utilizate în timpul dezvoltării, precizează autorii. 🔗 sursă
- Transformers v5.18.0 — Hugging Face adaugă patru arhitecturi, Nemotron 3 Diarization și NemotronH Omni de la NVIDIA, HyperCLOVAX Vision V2 de la NAVER și GTE, și semnalează șase modificări care rup compatibilitatea. 🔗 sursă
- TaskSmith — Adithya S K, care lucrează la medii de învățare prin consolidare la Hugging Face, publică un orchestrator care transformă un pull request într-un mediu RL verificabil: 50 de medii preluate din TRL, PEFT, Accelerate, Diffusers și Transformers, livrate ca sarcini Harbor. 🔗 sursă
- TraceML 0.4.1 — Instrumentul open-source măsoară acum întregul grup al unei actualizări de optimizator; pe ResNet-50 și un GPU T4, timpul de așteptare a datelor scade de la 23% dintr-un pas la mai puțin de 2 ms după optimizarea încărcării, pentru o creștere mediană de cost de procesare de doar 0,35%. 🔗 sursă
- Transformer cu buclă — Pe un model didactic de 54.106 parametri și 260 de cazuri verificabile, la un buget egal de 80 de treceri prin blocuri, o buclă învață toate cele 260 de cazuri, două bucle învață 125,3, iar opt învață 37,0 în medie: multiplicarea trecerilor nu a făcut procesul de învățare mai economic. 🔗 sursă
- O evaluare care știe să spună nu — Ghidul lui Eric Mey arată, pe analiza sentimentelor din recenziile de filme (SST-2), o evaluare care respinge un model deși acesta este mai bun cu 7 puncte pe date reținute (held-out), deoarece un comportament critic se degradează; scripturile sale rulează în mai puțin de un minut pe procesor. 🔗 sursă
- 10.000 de asigurați sintetici — Intelligent Actuaries publică sub CC-BY-4.0 un studiu sintetic privind rezilierile și răscumpărările din asigurările de viață: 10.000 de asigurați fictivi pe zece piețe, reprezentând 27.692 de înregistrări poliță-an 2023-2025 în formatul sondajului SOA-LIMRA. 🔗 sursă
- cuObject și SCADA Server SDK — NVIDIA lansează în disponibilitate generală bibliotecile cuObject pentru accesul la stocarea de obiecte prin RDMA, fără a trece prin memoria CPU-ului, și lansează SCADA Server SDK, prototipat de IBM cu Storage Scale, în cadrul inițiativei Storage-Next la care participă peste 40 de actori. 🔗 sursă
- NeMo Relay și Hermes Agent — Un tutorial NVIDIA cosemnat de Teknium, de la Nous Research, monitorizează un agent Hermes: pe parcursul a 108 rulări, remedierile de instrumente cresc rata de succes a Qwen3 Coder 30B de la 19 la 22 de reușite din 27, cu prețul a 4,9 apeluri de model în loc de 3,8. 🔗 sursă
- OpenShell pentru OpenClaw Enterprise — NVIDIA propune mediul său open-source OpenShell pentru guvernarea agenților din OpenClaw Enterprise, un plan de control open-source pentru agenți persistenți anunțat cu o zi înainte de fundația OpenClaw împreună cu Red Hat, NVIDIA și OpenAI. 🔗 sursă
- Versiuni de încercare pentru GitHub Advanced Security — Clienții GitHub Team pot iniția direct o versiune de încercare pentru GitHub Code Security și GitHub Secret Protection, din pagina Overview a organizației, pagina de facturare sau dintr-un Risk Assessment; durata nu este precizată. 🔗 sursă
- GHE.com și X25519 — Începând cu 7 octombrie 2026, GitHub Enterprise Cloud cu rezidență a datelor va refuza clienții TLS care oferă doar X25519 pentru acordul de chei; P-256 și P-384 rămân acceptate, iar conexiunile SSH nu sunt afectate. 🔗 sursă
- Două studii de caz la Runway — Brandul francez de băuturi Bonjour a produs peste 500 de variante publicitare cu Runway și a realocat peste 50.000 de euro din costurile de producție; World Juggling Federation a încredințat unei singure persoane grafica pentru o emisiune de o oră difuzată pe ESPN. 🔗 Bonjour · 🔗 World Juggling Federation
- Ad Variants la Luma — Luma evidențiază o funcție care declină o reclamă finalizată în mai multe dimensiuni și pentru mai multe piețe în cadrul aceleiași campanii, fără informații despre tarif, abonament, dată de lansare sau vreun articol dedicat. 🔗 sursă
- Microduck intră în producție — Pollen Robotics anunță că 10.950 de unități Microduck, micul său robot biped de 399 de dolari antrenat în simulare, cu o stivă open-source de învățare prin consolidare, vor ieși de pe linia de asamblare între 10 decembrie și 10 ianuarie, în loturi săptămânale. 🔗 sursă
- Cognition face angajări — Dezvoltatorul lui Devin îl primește pe Chris Degnan, fost CRO la Snowflake, în funcția de director de venituri, la o zi după sosirea lui Alex Stamos ca responsabil cu securitatea sistemelor informatice (CISO). 🔗 Chris Degnan · 🔗 Alex Stamos
- Claude Founder House — Anthropic organizează evenimente dedicate fondatorilor la San Francisco în timpul SF Tech Week (între 6 și 8 octombrie, la Terra Gallery) și la Stockholm pe 14 octombrie, incluzând conferințe, ateliere și sesiuni directe cu echipa Applied AI. 🔗 sursă
- AI Engineer Paris — Mistral prezintă bilanțul evenimentului desfășurat săptămâna precedentă la Station F: peste 900 de participanți, 60 de vorbitori, 57 de conferințe și 22 de parteneri, fără lansări de produse. 🔗 sursă
- Burse doctorale NVIDIA — Înscrierile pentru Graduate Fellowship Program 2027-2028 sunt deschise până pe 30 octombrie 2026, oferind până la 60.000 de dolari per doctorand; peste 220 de burse au fost acordate din 2002 până în prezent. 🔗 sursă
Ce înseamnă acest lucru
Securitatea dictează acum calendarul modelelor de frontieră. Gemini 4 Argon continuă logica Fairwind Program: apărătorii cibernetici de încredere îl primesc primii, fără mecanisme de protecție cibernetică, iar ceilalți vor urma „cât mai curând posibil”, fără o dată certă, în timpul necesar consolidării măsurilor de protecție. În aceeași zi, OpenAI arată cealaltă fațetă a problemei: ceea ce trebuie protejat nu mai este doar modelul, ci și raționamentul acestuia. Indiferent dacă provine sau nu de la un singur actor, campania al cărei nucleu OpenAI îl atribuie unor persoane asociate cu Moonshot AI transformă urmele de raționament într-un activ ce trebuie apărat, prin contramăsuri tehnice și schimb de informații între laboratoare și guverne.
O bună parte din cifrele de astăzi provine din măsurători concepute sau efectuate chiar de cei care fac anunțurile. Cohere evaluează Embed 5 cu metrica pe care o publică în aceeași zi și avertizează el însuși că modelele sale ar putea părea mai puțin performante la vechile măsurători; HeyGen se bazează pe un scor Elo intern, Hunmin pe un protocol propriu, cu o singură rulare pentru benchmarkurile de agenți, iar pe Reality Check, organizatorul a fost cel care a finisat modelele. În schimb, Perplexity își supune modelul unei evaluări în orb pe un benchmark privat al turbopuffer, iar Open TTS Leaderboard și AURORA înlocuiesc voturile sau traducerea automată cu sarcini și măsurători verificabile. Înainte de a compara două scoruri, trebuie să verificăm cine le-a produs.
Generarea de imagini și videoclipuri este judecată din ce în ce mai mult prin prisma utilizării practice și a costului. Ideogram 4.5 nu promite o imagine mai frumoasă, ci o imagine care rezistă la retușuri repetate; HeyGen Video se vinde la secundă, mai ieftin decât toate modelele din grila sa, și demonstrează că un model de bază precum MiniMax H3 poate da naștere unor versiuni specializate, de la HeyGen la Creatify. Runway Ads închide ciclul până la cheltuielile publicitare, iar evaluarea ElevenLabs, dublată din februarie, se sprijină pe cererea companiilor pentru agenți conversaționali.
Pentru dezvoltatori, harness-ul devine un produs de sine stătător, distinct de model. VS Code adoptă harness-ul Copilot pentru a-și alinia agentul la aplicație și CLI, HydraFusion coordonează mai multe modele în aceeași interacțiune, Zed îi permite agentului să aleagă un model per subagent, iar Manus își deschide harness-ul către cheile API ale furnizorilor terți. Gemini CLI își execută acum planurile fără intervenție umană în modul non-interactiv, Claude Code înăsprește cerințele pentru --bare în scenariile scriptate, iar Google Cloud expune gcloud și bq către agenți într-un sandbox, respectând drepturile IAM ale apelantului. Cererea se reflectă direct în infrastructură: primul client pentru Vera Rubin NVL72 în producție la CoreWeave este Cognition, dezvoltatorul lui Devin.
Surse
- Gemini 4 Argon: our next era of frontier intelligence (blog Google)
- Page Gemini de Google DeepMind
- Annonce de Gemini 4 Argon par @GoogleDeepMind
- Billet d’OpenAI sur la campagne de distillation
- Stealing Reasoning Traces from Proprietary LLM APIs (arXiv)
- Billet Embed 5 de Cohere
- Annonce d’Embed 5 par @cohere
- Billet RCP-nDCG@10 de Cohere
- Code et données de RCP-nDCG sur GitHub
- Billet de Perplexity Research sur l’embedding contextuel
- pplx-embed-v2-context-9b-preview sur Hugging Face
- Annonce d’Ideogram 4.5 par @ideogram_ai
- Page du modèle Ideogram 4.5
- Catalogue HeyGen Video
- Annonce de HeyGen Video par @HeyGen
- Skills dans l’application Gemini (blog Google)
- Introducing Manus Flex
- Fil de @bot sur Grok Bot et Cursor
- Praxis-1 sur Runway Research
- Tweet d’Ai2 sur MolmoAct 2 et Reality Check
- Classement Reality Check de Poke & Wiggle
- Page du projet Physis-Lang
- Annonce de Physis-Lang par @NVIDIAAI
- Billet Hunmin-CUA
- Poids de Hunmin-397B-A17B-CUA
- Billet JEV-27B-VL
- Billet de l’Open TTS Leaderboard
- Open TTS Leaderboard sur Hugging Face
- Billet AURORA de LILT
- Classement AURORA
- Claude for Government is now generally available
- How Anthropic’s sales team rebuilt inbound with Claude Managed Agents
- Billet d’OpenAI sur les petites entreprises
- Billet Runway Ads
- Tweet de @runwayml sur Runway Ads
- Billet d’ElevenLabs sur l’offre de rachat
- Billet NVIDIA sur CoreWeave et Vera Rubin
- Notes de version de Claude Code 2.1.286
- Notes de version de Zed 1.22.0
- Gemini CLI v0.63.0-preview.0
- Gemini CLI v0.62.0
- Notes de version de VS Code 1.140
- HydraFusion in VS Code and the GitHub Copilot app
- Serveur MCP distant de Google Cloud CLI (blog Google Cloud)
- Codex CLI 0.159.2
- Plaid Speed dans Amp
- Fil de @warpdotdev sur Factories as Code
- Factories as Code, Warp
- Étude de cas Crosby, Devin
- Présentation de claude.dev par @ClaudeDevs
- Notes de version de ChatGPT
- Notes de version de ChatGPT Enterprise et Edu
- Notes de version de Kimi Work
- Cue et la gestion des finances
- GPT-6.1 Sol dans Genspark
- Qwen3.8-27B-pi
- Qwen3.8-27B sur Nebius Token Factory
- Bekko System One v0
- ZooWork Instinct Tuned 4B
- Transformers v5.18.0
- TaskSmith
- TraceML 0.4.1 et le Trainer de Transformers
- Entraîner des transformeurs bouclés
- Write an eval that can say no
- Dix mille assurés synthétiques
- cuObject et SCADA Server SDK
- NeMo Relay et Hermes Agent
- OpenShell pour OpenClaw Enterprise
- Essais de GitHub Advanced Security pour GitHub Team
- Fin du TLS limité à X25519 sur GHE.com
- Étude de cas Bonjour, Runway
- Étude de cas World Juggling Federation, Runway
- Ad Variants dans Luma
- Microduck, Pollen Robotics
- Chris Degnan chez Cognition
- Alex Stamos chez Cognition
- Claude Founder House
- Bilan d’AI Engineer Paris par @MistralDevs
- Graduate Fellowships de NVIDIA