ai-powered-markdown-translatorArticol tradus din fr în ro cu gpt-6.1-sol.
OpenAI va adăuga în următoarele săptămâni un filigran invizibil textului ChatGPT și Codex pentru utilizatorii săi din Uniunea Europeană, ca răspuns la AI Act, care impune ca textul generat să poată fi identificat de o mașină, și oferă începând de astăzi acest filigran ca opțiune clienților API-ului său din întreaga lume. În domeniul agenților, memoria își face loc: Cognition îi oferă lui Devin o memorie între sesiuni și publică formatul acesteia ca standard deschis, iar Cohere lansează North 2 cu o memorie care păstrează contextul de la o sesiune la alta; GitHub publică, la rândul său, ReviewBench, un benchmark deschis pentru revizuirea codului cu AI. În domeniul modelelor deschise, Reflection AI prezintă Beam, cu 501 miliarde de parametri, ale cărui ponderi sunt promise pentru mai târziu în octombrie.
Filigranul invizibil al OpenAI: textul ChatGPT și Codex marcat în Uniunea Europeană, o opțiune globală în API
5 octombrie — OpenAI își publică răspunsul la normele europene privind proveniența textului. AI Act impune furnizorilor de AI generativă să facă textul pe care îl produc identificabil într-un mod care poate fi citit de o mașină; OpenAI răspunde în etape, avertizând de la început că tehnologiile actuale de filigranare a textului au limite importante (limitări semnificative).
| Public vizat | Ce se schimbă | Calendar anunțat |
|---|---|---|
| Utilizatorii ChatGPT și Codex din Uniunea Europeană, toate abonamentele | Filigran invizibil adăugat textului eligibil | În următoarele săptămâni |
| Clienții API-ului, din întreaga lume | Filigran opțional (opt-in) pe modele selectate, ale căror nume nu sunt precizate, dezactivat implicit | Începând cu 5 octombrie |
| Cercetători și organizații de specialitate aprobate | Acces la detector, de la caz la caz, pe bază de cerere | Înscrieri deschise pe 5 octombrie |
OpenAI nu îl activează implicit la nivel global și lucrează cu parteneri cloud pentru a oferi, în următoarele săptămâni, același filigran pe modelele OpenAI pe care aceștia le furnizează. Tehnologia, textGrain, adaugă un semnal statistic invizibil în alegerile de cuvinte ale modelului, fără marcaj vizibil sau caracter special; potrivit OpenAI, aceasta egalează sau depășește celelalte abordări testate, inclusiv SynthID pentru text. Este publicat un raport tehnic, iar OpenAI intenționează să deschidă codul sursă. Detectorul, în schimb, nu este public la lansare, din cauza riscului de filigrane nedetectate și de rezultate fals pozitive: accesul urmează Codul de bune practici (Code of Practice) al Comisiei Europene.
Cifrele publicate arată mai ales limitele detecției:
| Condiții de măsurare | Rata de detecție publicată |
|---|---|
| Pasaje de 200 tokens, conținut de tip psihologie, țintă de 1 % rezultate fals pozitive | aproximativ 80 % |
| Pasaje de 400 tokens, conținut de tip psihologie, țintă de 1 % rezultate fals pozitive | aproximativ 95 % |
| Conținut de tip matematică, același prag de 1 % | mult mai mică (valoare indicată doar într-un grafic) |
| Pasaje de 400 tokens în engleză (setul ELI5), nemodificate | aproximativ 92 % |
| Aceleași pasaje, 10 % dintre cuvinte înlocuite cu sinonime | 66 % |
| Aceleași pasaje, 25 % dintre cuvinte înlocuite | 17 % |
Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.
🇷🇴 Filigranele au limite. Ele sunt adesea nedetectabile, mai ales în pasajele scurte. Rescrierea sau traducerea unui text poate elimina complet filigranul. — @OpenAI pe X
În privința calității, OpenAI nu măsoară diferențe semnificative pe opt benchmark-uri pentru GPT-6 Astra fără și cu filigran (94,44 % față de 93,94 % pe GPQA Diamond, 53,90 % față de 56,06 % pe Terminal-Bench 4.0). Articolul precizează și ce nu indică un filigran: nici proporția muncii umane, nici proprietatea sau responsabilitatea asupra textului, nici identitatea utilizatorului, nici corectitudinea; iar absența lui nu dovedește că un om a scris textul. Pentru imagini și audio, nimic nu se schimbă: openai.com/verify și Content Provenance API rămân accesibile organizațiilor, iar SynthID se adaugă din 19 mai metadatelor C2PA ale imaginilor generate.
🔗 Articolul OpenAI despre proveniența textului în UE
Agenți de cod: Devin își amintește între sesiuni, Cursor, Qwen Code, Together Link și IBM Bob
5 octombrie — Cognition introduce în Devin două funcții asociate: Memory, o memorie care persistă de la o sesiune la alta, și Dreaming, un „vis” zilnic care o reorganizează. Memory păstrează ceea ce agentul învață lucrând cu fiecare utilizator: preferințe, corecții, lecții învățate dintr-un proiect sau dintr-un flux de lucru. Acestea sunt scurte note, nu rezumate ale sesiunilor, fiecare legată de sesiunea în care a fost învățată lecția, iar această memorie rămâne personală: nu devine o instrucțiune comună întregii organizații.
Notele sunt păstrate în Memory Drive, un depozit Git persistent de fișiere Markdown organizate pe depozit, proiect sau temă. Un fișier MEMORY.md, menținut în mod intenționat scurt, reunește preferințele generale și indexul celorlalte note: Devin îl primește la începutul fiecărei sesiuni, apoi caută notele utile cu instrumentele pe care le folosește pentru a explora codul, fără a încărca întreaga arhivă în prompt. Fiecare sesiune lucrează pe propria copie Git: Devin îmbină actualizările din celelalte sesiuni, o verificare a reviziei respinge scrierile bazate pe versiuni învechite, iar conflictele sunt semnalate în loc să fie suprascrise în tăcere.
Dreaming este o sesiune zilnică în fundal (noaptea, precizează firul de postări al Cognition): Devin recitește conversațiile trecute prin prisma memoriei sale, îmbină notele care se suprapun, elimină detaliile temporare, caută lecțiile care nu fuseseră notate și șterge amintirile pe care nicio sesiune nu le-a folosit. Accesul se face pe devin.ai, din meniul Customize → Memory; articolul nu spune nimic despre Devin Desktop sau Devin CLI și nu anunță niciun preț.
Cognition publică și formatul ca standard deschis, Agent Memory Repo, sub licența MIT. Specificația, deschisă contribuțiilor, descrie ciclul fiecărei sesiuni (clonarea memoriei, căutarea, actualizarea fără intervenție umană, trimiterea modificărilor după fiecare schimbare) și combinarea mai multor memorii într-o singură sesiune, fiecare în propriul depozit, cu propriile drepturi și propriul istoric. Printre utilizările menționate se numără memoria de echipă și roiurile de agenți (agent swarms):
In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)
🇷🇴 În primele experimente, am văzut un roi de Devin folosind memoria pentru a se coordona la scară largă fără să le cerem noi acest lucru (promitem, nu au atacat informatic pe nimeni). — @cognition pe X
Un „vis” care reorganizează memoria unui agent exista deja la Anthropic (Claude Managed Agents, în mai) și la OpenAI (memoria ChatGPT, în iunie); ceea ce se schimbă aici este o memorie în fișiere versionate cu Git, publicată ca specificație pe care o pot adopta și alți agenți.
🔗 Memory and dreaming, articolul Cognition 🔗 Specificația Agent Memory Repo
Cursor: ghidarea agenților din SDK-ul său în timpul execuției
5 octombrie — Cursor își extinde SDK-ul, care permite lansarea agenților săi din cod TypeScript sau Python. Metoda run.steer() introduce un mesaj în runda curentă a unui agent; dacă un subagent lucrează în acel moment, acesta trece în fundal și continuă. Subagenții din fundal își raportează și rezultatele: rezultatul lor revine la agentul părinte ca o rundă suplimentară a aceleiași execuții, în loc să se piardă când se încheie runda părintelui.
| Noutate în SDK | Domeniu de aplicare indicat de changelog |
|---|---|
run.steer(), ghidare în timpul execuției | Agenți locali în TypeScript; pe un agent cloud, mesajul este trimis ca o relansare obișnuită |
| Returnarea rezultatelor subagenților din fundal | Agenți locali, în TypeScript și Python |
| Adnotări MCP ale instrumentelor personalizate (readOnlyHint, destructiveHint…) | TypeScript; simple indicații, a căror respectare nu este impusă de SDK |
| Prompt de sistem care poate fi înlocuit, regulile și skills sunt încărcate în continuare | Agenți locali în TypeScript; acces activat individual pentru fiecare cont |
Aceste schimbări nu sunt însoțite de niciun preț.
🔗 Firul de postări al Cursor pe X 🔗 Changelog-ul SDK-ului Cursor
Qwen Code v0.25.0: agenți ai spațiului de lucru, canal de e-mail și memorie Mem0
5 octombrie — Qwen publică v0.25.0 a Qwen Code, agentul său de programare în linia de comandă, prima versiune stabilă după v0.24.7 din 29 septembrie: 42 de funcționalități, dintre care 23 pentru Managed Agent, 79 de remedieri și nicio schimbare cunoscută care să rupă compatibilitatea. Se remarcă trei adăugiri, toate necesitând activare explicită. Agenții spațiului de lucru colaborează acum local: daemon-ul le lansează și le reia rundele, iar Web Shell permite gestionarea agenților și a sarcinilor și solicitarea unuia dintre ei cu @agent dintr-o conversație. Acești agenți persistenți oferă acces prin protocolul A2A 1.0, prin partajări care expiră și pot fi revocate. În sfârșit, memoria Mem0 se conectează direct la CLI: este suficient să indici un endpoint și o cheie, iar Qwen Code înregistrează singur serverul MCP corespunzător. Un canal de e-mail îi oferă agentului și propria căsuță poștală, prin IMAP și SMTP, iar Code Mode execută în paralel apelurile Bash pe care modelul le grupează. SDK-ul TypeScript v0.1.18 și aplicația Desktop v0.25.0 au urmat în aceeași dimineață, fără un tweet din partea Qwen.
🔗 Notele versiunii Qwen Code v0.25.0
Together Link: Claude Code, Codex, OpenCode și Pi pe modele deschise
5 octombrie — Together AI lansează în beta Together Link, care rulează agenții de cod deja instalați pe modelele deschise găzduite de platformă. O comandă de instalare (macOS sau Linux) conectează Claude Code, Claude Desktop, Codex, OpenCode și Pi la API-ul său, cu cheia contului; documentația adaugă ChatGPT Desktop și avertizează că comenzile, rutarea și lista de modele se mai pot schimba. Pe lângă modul Auto, sunt oferite patru modele, toate cu 1M de tokens de context:
| Model oferit | Echivalent în meniul /model din Claude Code |
|---|---|
| Kimi K3 | Opus |
| GLM 5.3 | Fable |
| GLM 5.3 Flash | Sonnet |
| DeepSeek V4.1 Flash | Haiku |
Modul Auto, selectat implicit, poate încredința sarcinile dificile modelului Opus 5.5 când utilizatorul furnizează o cheie Anthropic, însă articolul și documentația nu descriu această rutare în același mod: o alegere făcută o singură dată pe sesiune pentru a păstra cache-ul de prompt, potrivit articolului, o selecție pentru fiecare cerere, rezervată Claude Code și Claude Desktop, potrivit documentației. Together AI anunță o reducere a cheltuielilor de peste 50 %, fără a publica metoda, și afișează după fiecare sesiune costul acesteia alături de cel pe care l-ar fi avut pe Opus 5.5.
🔗 Articolul Together AI 🔗 Documentația Together Link
IBM Bob găzduit pe infrastructura proprie se bazează pe Nemotron 3 Ultra de la NVIDIA
5 octombrie — IBM explică de ce versiunea Bob găzduită pe infrastructura proprie (self-hosted), asistentul său de dezvoltare agentică, se bazează pe Nemotron 3 Ultra de la NVIDIA, alături de Poolside Laguna S 2.1. Această opțiune, devenită disponibilă general în săptămâna precedentă, rulează asistentul pe infrastructura clientului, inclusiv în medii deconectate (air-gapped). Echipa a evaluat modelele după patru criterii (amprenta hardware, precizia în cod, latența, deschiderea ponderilor), testându-le cu harness-ul de agent al Bob, modelele închise de la Anthropic, OpenAI și Google servind drept referință. Inițial prea vorbăreț, Nemotron a fost ajustat împreună cu NVIDIA: prompt-uri, parametri de eșantionare, setări de raționament și remedieri ale harness-ului. Potrivit testelor interne IBM, Nemotron 3 Ultra oferă o latență de până la aproximativ 4 ori mai mică pe GPU Blackwell decât modelele SaaS de vârf apelate prin rețea și respectă strict schemele instrumentelor; Laguna S 2.1 este ales pentru raportul dintre performanță și amprenta hardware. Articolul nu publică niciun scor de precizie.
🔗 Articolul IBM despre Bob găzduit pe infrastructura proprie
ReviewBench: GitHub lansează un benchmark deschis pentru revizuirea codului cu IA
5 octombrie — GitHub lansează în versiune preliminară de cercetare (research preview) ReviewBench, un benchmark deschis pentru agenții de revizuire a codului cu IA. Site-ul dedicat publică setul complet de date, clasamentul, metodologia, promptul și configurația evaluatorului, precum și un instrument de execuție în regim de autoservire. Articolul este semnat de Michelle Zhou și Alejandro Carderera de Diego, iar mulțumirile sale menționează contribuția GitHub și Microsoft la proiect.
Corpusul reunește 219 pull requests din 187 de repository-uri publice open source, în 19 limbaje. Distribuțiile limbajelor și dimensiunilor repository-urilor reproduc distribuțiile GitHub, stabilite pe baza a 103,9 milioane de pull requests, cu o pondere mai mare acordată în mod deliberat modificărilor medii și mari. Setul de referință (golden set) combină evaluări umane, probleme deduse din commiturile ulterioare, instrumente de analiză deterministe și mai multe LLM de vârf; constatările sunt validate de un evaluator LLM, Claude Sonnet 5 potrivit articolului. Ingineri seniori care nu au participat la construirea setului au reetichetat fiecare constatare: verdictul lor coincide cu ReviewBench în 96,6 % dintre cazuri. Recall-ul „ancorat” (grounded), măsurat exclusiv pe setul de referință, servește drept criteriu principal de comparație.
Potrivit clasamentului inițial GitHub, Copilot code review ocupă primul loc:
| Agent evaluat (configurație) | F1 ancorat | Precizie ancorată | Recall ancorat | Data execuției |
|---|---|---|---|---|
| Copilot Code Review (Balanced) | 40,1 % | 87,8 % | 26,0 % | 1 octombrie 2026 |
| Devin AI | 37,0 % | 84,0 % | 23,8 % | 28 septembrie 2026 |
| Qodo | 35,1 % | 85,3 % | 22,1 % | 28 septembrie 2026 |
| Codex (GPT-5.6 Sol · Ultra) | 32,3 % | 87,0 % | 19,9 % | 19 iulie 2026 |
| Cubic | 27,3 % | 85,5 % | 16,3 % | 29 iunie 2026 |
| Greptile | 27,2 % | 86,1 % | 16,2 % | 16 iunie 2026 |
| Cursor | 17,3 % | 87,7 % | 9,6 % | 27 septembrie 2026 |
Site-ul precizează că aceste prime rezultate au fost obținute de echipa ReviewBench prin rularea produsului public al fiecărui furnizor, la data indicată, și că furnizorii nici nu au efectuat aceste rulări, nici nu le-au verificat. Oricine își poate înscrie acum agentul: imaginea containerului și cheia modelului sunt furnizate de candidat, evaluatorul este furnizat de GitHub, se fac teste pe 25 de pull requests, apoi o execuție completă în trei treceri; un scor este publicat numai după validarea de către un responsabil de întreținere a proiectului și numai dacă îmbunătățește scorul anterior al agentului sau reprezintă primul său rezultat.
GitHub îl folosește și pentru a îmbunătăți Copilot code review. Într-un test A/B, o revizuire cu mai multe modele din nivelul Lite, care combină mai multe execuții independente, a obținut o creștere de 13,6 % a recall-ului, cu un cost per revizuire redus cu 8,0 %, în direcția anticipată în evaluarea offline. Articolul se contrazice în privința volumului de comentarii: +61 % potrivit textului, +25,0 % potrivit graficului său.
🔗 Articolul GitHub despre ReviewBench 🔗 Site-ul și clasamentul ReviewBench
Cohere lansează North 2 și încheie o alianță globală cu PwC
5 octombrie — Cohere lansează North 2, noua versiune a North, platforma sa de agenți IA pentru companii, anunțată ca „disponibilă în curând” pe 9 septembrie și apoi promisă pentru octombrie. Firul de lansare anunță peste 15 funcționalități noi (15+ funcționalități noi), un număr pe care articolul nu îl reia. Elementul central al versiunii este un nou cadru de execuție pentru agenți (agent harness), reproiectat pentru automatizări și agenți cu mai multe etape, pe o platformă care rămâne agnostică: modele Cohere sau modele ale clientului.
| Domeniu funcțional | Noutăți menționate de Cohere |
|---|---|
| Agenți | Agenți și automatizări reutilizabile, create prin prompt și partajate în organizație; orchestrare multi-agent; memorie care păstrează contextul de la o sesiune la alta |
| Productivitate | Abilități (Skills), biblioteci (Libraries) și aplicații care generează prezentări, panouri de control și documente; Automations, lansate la sfârșitul lunii iulie, cu șabloane gata de utilizare și editor vizual |
| Conectori | Slack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion și GitHub; furnizori de date financiare (PitchBook, FactSet și alții) doar planificați |
| Implementare și securitate | Găzduire proprie, VPC, hibrid, la sediu sau complet deconectat; SOC 2 Type 2, ISO 27001 și ISO 42001; politici de autonomie cu validare umană a deciziilor critice |
| Guvernanță | Consola North Admin, niveluri de consum pentru cereri și tokens per utilizator sau grup, alerte înainte de atingerea limitelor |
Cohere menționează doi clienți, LG CNS din Coreea de Sud și Bell Cyber din Canada, și evidențiază un debit mai bun al modelelor sale pe GPU NVIDIA Blackwell și Hopper, fără cifre, cu un citat de la Kari Briski, care coordonează IA generativă la NVIDIA. Nu sunt oferite prețuri și nici un calendar de implementare: articolul trimite la o demonstrație care trebuie programată cu echipele de vânzări.
🔗 Articolul de lansare a North 2 🔗 Firul de lansare a North 2 pe X
Alianța globală cu PwC, care începe în Canada
5 octombrie — În aceeași zi, PwC și Cohere anunță o alianță globală (alianță globală) care începe în Canada, într-un comunicat PwC Canada datat la Toronto, preluat de un scurt articol Cohere. Împărțirea rolurilor este clară: Cohere furnizează North, modelele sale pentru companii și instrumentele sale de căutare a informațiilor; PwC contribuie cu expertiza sa sectorială, în reglementare, gestionarea riscurilor și transformare, de la alegerea cazurilor de utilizare până la integrarea IA cu datele și sistemele companiei. Utilizările anunțate acoperă căutarea în cadrul companiei, accesul la cunoștințe, cercetarea aprofundată, sprijinul pentru luarea deciziilor și automatizarea sarcinilor, în cloud privat, la sediu sau într-un mediu deconectat, având ca țintă principală sectoarele reglementate. Comunicatul îi citează pe Domenic Marino și Annie Veillet de la PwC Canada și pe Aidan Gomez de la Cohere; nu oferă nicio sumă, niciun client și niciun calendar dincolo de Canada. Cohere încheiase deja o alianță cu OpenText pe 16 septembrie.
🔗 Articolul Cohere despre alianța cu PwC 🔗 Comunicatul PwC Canada
Modele deschise: Beam, MetaEncoder-30B și Gemma 4 în genomica plantelor
Trei modele deschise sunt în centrul știrilor zilei, în trei etape diferite: unul este promis, altul este publicat fără anunț, iar ultimul este promovat la o lună după publicare.
Beam: modelul deschis cu 501 de miliarde de parametri de la Reflection AI
5 octombrie — Reflection AI prezintă Beam, primul său model cu ponderi deschise: un MoE cu activare rară, cu 501 de miliarde de parametri, dintre care 23 de miliarde activi, conceput pentru cod, raționament și sarcini agentice și antrenat integral de la zero. Preantrenarea a folosit 23 800 de miliarde de tokens; etapa de învățare prin întărire a mobilizat 10 500 GPU NVIDIA GB300 timp de patru săptămâni și a produs peste 100 de milioane de traiectorii (rollouts).
Potrivit tabelelor Reflection AI:
| Benchmark evaluat | Beam | Nemotron 3 Ultra | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|
| SWE-bench Verified | 80,9 | 70,7 | — | — | — | — |
| SWE Bench Pro v1 | 65,5 | 46,4 | — | — | 67,7 | — |
| Terminal Bench v2.1 | 80,1 | 56,4 | 88,2 | 88,3 | 86,6 | 90,6 |
| DeepSWE v1.1 | 44,4 | — | 61,0 | 68,0 | 51,0 | 74,2 |
O liniuță indică un scor care nu este raportat în articol. Reflection AI susține că obține scoruri de raționament comparabile cu cele ale GLM-5.2, folosind de 3 până la 4 ori mai puține calcule de inferență, și recunoaște că Kimi K3 rămâne în față în ceea ce privește capacitatea brută. Nimic nu poate fi descărcat încă: Beam se află în evaluările finale și în teste adversariale (red-teaming), accesul anticipat necesită înscriere, iar ponderile, raportul tehnic, fișa modelului și instrumentele pentru dezvoltatori sunt promise pentru mai târziu în octombrie.
🔗 Articolul Reflection AI despre Beam
MetaEncoder-30B, encoderul de decizie pe care Meta îl publică fără anunț
5 octombrie — Meta a publicat pe Hugging Face, în organizația sa facebook, MetaEncoder-30B, fără să fi fost identificat vreun anunț: repository-ul, creat pe 30 septembrie și modificat pe 5 octombrie, avea doar două descărcări la momentul verificării noastre. Fișa prezintă un encoder multimodal „System One”, formatul modelelor de decizie ale Jev: i se oferă o sarcină în limbaj natural (întrebare, instrucțiune, descriere de stare, criterii) și o listă de candidați, în format text, cu imagini și videoclipuri ca suport, iar acesta acordă un scor fiecărui candidat. Deoarece sarcina și candidații sunt codificați separat, comparația se reduce la un produs scalar, iar un index al celor mai apropiați vecini poate acoperi milioane de candidați fără a rula din nou modelul. MetaEncoder este o ajustare contrastivă a Muse Glimmer 30B, modelul agentic cu ponderi deschise lansat de Meta în august, de la care moștenește licența Apache 2.0; descărcarea necesită acceptarea unor condiții, iar vLLM îl servește pentru text și imagine.
| Benchmark | Scor potrivit fișei modelului | Metrică utilizată |
|---|---|---|
| JEVBench (original / ușor / dificil) | 0,9444 / 1,0000 / 0,7387 | Acuratețe |
| ImaJEV-Bench | 0,8958 | Acuratețe |
| NanoBEIR | 0,6632 | NDCG_linear@10 |
| MMEB-V3 (imagine / video / documente vizuale) | 0,7897 / 0,6046 / 0,8138 | Hit@1 / Hit@1 / NDCG@5 |
🔗 Fișa MetaEncoder-30B pe Hugging Face
Living Models combină Gemma 4 și BOTANIC-1 pentru a decoda ADN-ul plantelor
5 octombrie — Google evidențiază, într-un X Article al @GoogleAI și în galeria sa Gemmaverse, activitatea Living Models, un laborator de biologie IA cu sediul la Paris. Gemma 4 E4B orchestrează analiza (lanțuri de procesare în terminal, filtrarea datelor, apeluri de instrumente), local prin Ollama, pe un singur GPU NVIDIA L4, în timp ce BOTANIC-1, un model de bază pentru genomică preantrenat pe 320 de specii vegetale, evaluează efectul mutațiilor; genomurile proprietare rămân la sediu. Studiul de caz reia o descoperire făcută la INRAE de Adnane Boualem: schimbarea unei singure litere în gena CmEIN3 a pepenelui galben transformă floarea din femelă în hermafrodită. Dintre cele 2 494 de mutații punctuale candidate, mutația validată ocupă primul loc, fără egalitate de scor, în mai puțin de patru minute, potrivit X Article.
| Configurație testată (20 de execuții) | Recall@1 |
|---|---|
| Fără ghidare | 0,00 |
| Ghidare de specialitate | 0,15 |
| Cu scorul BOTANIC-1 | 0,90 |
Modelele Botanic1 (de la 0,3 la 2 miliarde de parametri) și preprintul bioRxiv datează de la începutul lunii septembrie: noutatea constă în această promovare de către Google și în detalierea rezultatelor.
🔗 X Article al Google AI 🔗 Pagina Gemmaverse a Google DeepMind
Publicitate în ChatGPT: un format vizual în teste și o măsurare extinsă
5 octombrie — OpenAI pregătește un format publicitar vizual pentru ChatGPT: imaginile vor prezenta inspirația asociată unui produs, utilizarea acestuia sau experiența pe care o face posibilă. Primul test va avea loc în timpul generării de imagini, cu reclame etichetate clar și separate de imaginea în curs de creare; va începe mai târziu în această lună în Statele Unite, cu un prim grup de agenți de publicitate. OpenAI reamintește că publicitatea nu influențează răspunsurile ChatGPT, care ajunge, potrivit companiei, la 1,2 miliarde de persoane în fiecare săptămână.
Majoritatea anunțurilor se referă la măsurare: transmiterea conversiilor prin Hightouch, Tealium și LiveRamp, zece parteneri de atribuire numiți (inclusiv AppsFlyer, Adjust și Triple Whale), experimente geografice de incrementalitate cu Haus, Measured și WorkMagic, o fereastră de conversie de o zi după afișare în rapoarte și un indicator al calității semnalelor (Event Quality Score). În ceea ce privește siguranța mărcilor, agenții de publicitate eligibili pot exclude expresii (Negative Phrases), iar proiecte-pilot de evaluare sunt în pregătire cu DoubleVerify și Integral Ad Science. Pixelul și Conversions API există deja din 5 mai.
| Rezultat publicat de OpenAI | Valoare publicată | Măsurare realizată de |
|---|---|---|
| Costul per achiziție al WeightWatchers comparativ cu benchmarkul său pentru căutarea plătită | −15,3 % | DV Rockerbox |
| Achiziții incrementale ale mărcii Dose efectuate de clienți noi | 67 % | WorkMagic |
| Vizitatori ai Portland Leather proveniți din ChatGPT Ads și noi pentru marcă | 93 % | Triple Whale |
🔗 Articolul OpenAI despre noul format publicitar 🔗 Articolul de pe blogul Ads despre măsurare
Changelog Perplexity din 5 octombrie: extensie de browser pentru Computer, Wiley și Stripe Projects
5 octombrie — Perplexity publică un changelog de produs cu 18 rubrici, fără să fie preluat pe X la momentul verificării noastre. Opt reiau anunțuri deja acoperite (Automations, Claude Opus 5.5, generare video, Skills American Express, Portable Computer pe AMD, Fast Search, Profiles din Agent API, Claude Fable 5.1), o a noua adaugă explicații 3D interactive la graficele din 1 octombrie, iar nouă noutăți sunt prezentate pentru prima dată:
| Noutate prezentată pentru prima dată | Platformă sau versiune | Public vizat |
|---|---|---|
| Extensie pentru Chrome, Edge sau Brave, care permite Computer să folosească browserul (Comet rămâne opțiunea implicită) | Perplexity pentru Mac 26.38.0 și versiunile ulterioare | Neprecizat |
| Sarcini Computer în file și ferestre separate | Perplexity pentru Mac 26.37.1 și versiunile ulterioare | Neprecizat |
| Mod de efort (Light, Standard, High, Ultra) pe mobil | iOS 26.38.0 și Android 2.100.0, și versiunile ulterioare | Pro, Max, Enterprise Pro, Enterprise Max |
| Reviste și cărți Wiley fără un abonament Wiley separat | Perplexity și Computer | Toate planurile, cote premium variabile |
| GPT-6.1 Sol, care susține și nivelul de efort Light al Computer în locul GPT-6 Sol | Perplexity și Computer | Abonați eligibili la planuri cu plată |
| Conversație ghidată pentru lansarea unei prime sarcini Computer | Web | Conturi gratuite noi |
| Conectarea unei aplicații din zona de introducere a textului (Conectează o aplicație) | Computer pe Web | Neprecizat |
| Conector DocSend pentru camerele de date destinate investițiilor (deal rooms) | Computer | Cont DocSend eligibil |
| Stripe Projects: cheie pentru API Perplexity creată din CLI Stripe | CLI Stripe | Dezvoltatori care folosesc API Perplexity |
Cu Stripe Projects, o comandă creează sau conectează proiectul, generează cheia și o scrie în fișierul .env, o configurare pe care Perplexity propune să o încredințeze lui Claude Code, Cursor sau Codex.
🔗 Changelog Perplexity din 5 octombrie
Creație generativă: Suno Albums și HyperFrames Studio de la HeyGen
Suno adaugă albumele
5 octombrie — Suno adaugă albumele, care lipseau până acum de pe platforma sa. Potrivit articolului care însoțește anunțul, funcția transformă cele mai bune piese în proiecte complete (proiecte de lungă durată), iar o listă de redare (playlist) care ținea loc de album poate fi acum convertită într-un Album. Suno prezintă artiștii primelor cinci albume: naenia (Oakwood///diskrot), Old Soul (Isaiah Wallace), phenomenal (KakerMix///diskrot), Lost In a Dream (Dream Relic) și VOID (ECHLO). Furnizorul nu precizează nici planurile vizate, nici numărul de piese pe album, nici data exactă a lansării. În iunie, Suno își întreba deja comunitatea despre experiența de ascultare, între liste de redare, albume și posturi de radio.
🔗 Anunțul Suno pe X 🔗 5 albume pe care nu le poți rata, blogul Suno
HyperFrames Studio, editorul video de la HeyGen conceput pentru agenți
5 octombrie — HyperFrames, framework-ul open source de la HeyGen care transformă codul HTML în video, devine o aplicație desktop. HyperFrames Studio se prezintă ca un editor video construit de la zero pentru agenți: descrii videoclipul dorit, agentul (Claude Code, Codex sau un agent propriu) livrează un prim montaj, apoi omul și agentul lucrează pe aceeași axă temporală (timeline). Dirijarea se face prin gesturi, în loc de prompturi: încercuiești un element din imagine, fixezi un comentariu la un cuvânt sau faci singur o tăietură. Aplicația exportă în 4K și susține că oferă sute de surse de inspirație și șabloane; este gratuită potrivit contului HyperFrames de pe X, iar pentru descărcare este oferită doar o versiune macOS. Ea continuă versiunea de previzualizare Studio Preview din iulie, care permitea deja editarea vizuală a unui videoclip generat prin cod.
🔗 Anunțul HyperFrames Studio 🔗 Anunțul preluat de HeyGen
Știri pe scurt
- Warp Factories se îndreaptă spre disponibilitatea generală — Într-un articol din 3 octombrie despre seminarul său de toamnă, Warp arată că Warp Factories, infrastructura sa de agenți, trece de la acces anticipat la disponibilitate generală, fără a preciza o dată sau un preț; echipa spune că, folosind-o, și-a redus costul per PR cu 70 % în ultima lună. 🔗 sursă
- Notele de versiune Devin din 2 octombrie — Setările de acces Microsoft Teams sunt acum aplicate, un clic selectează toate constatările de securitate cu același nivel de gravitate (inclusiv prin API v3), iar pluginurile propuse își afișează skills, MCP, hooks și regulile înainte de instalare; crearea mediilor pentru repository-uri Perforce mari are la dispoziție 3 ore, în loc să eșueze după 10 minute. 🔗 sursă
- MCP TikTok Ads în Replit — Replit adaugă TikTok Ads în catalogul său de peste 450 de integrări: odată conectat contul, Agentul său poate crea și gestiona reclame TikTok, poate ajunge la audiențe și poate măsura performanța din spațiul de lucru, fără consum de credite pentru conectare. 🔗 sursă
- Cockle Finance pe Replit — Replit fixează o înregistrare video despre Cockle Finance, al cărui instrument a fost construit pe Replit de Dan și de tatăl său, Steve, pentru a urmări afluxul de clienți; potrivit Replit, Dan și-a crescut activitatea cu 15 % în trei luni, fără să precizeze indicatorul folosit. 🔗 sursă
- Copilot CLI 1.0.92 în versiune stabilă — Această versiune reunește noutățile din versiunile preliminare 1.0.92-0 până la -5; singura noutate suplimentară este că, după autentificarea prin Microsoft Entra, utilizatorul alege contul de folosit,
/logoutînchide aceste sesiuni OAuth, iar serverele MCP protejate de Entra își reînnoiesc datele de autentificare fără intervenție. 🔗 sursă - Codex CLI 0.160.1 — Această corecție pentru 0.160.0 conține doar un backport: variabilele Windows SYSTEMROOT, TEMP și TMP sunt păstrate la pornirea serverelor MCP stdio la distanță al căror mediu la distanță este configurat explicit; aceasta este cea mai recentă versiune stabilă, deoarece nu a fost lansată nicio versiune stabilă 0.161.0. 🔗 sursă
- Versiunea nightly Gemini CLI din 5 octombrie — Nu conține nicio modificare: construită pe același commit ca cea din 3 octombrie, diferă doar prin numerele de versiune, iar canalele stabil (v0.62.0) și preliminar (v0.63.0-preview.0) rămân neschimbate. 🔗 sursă
- SDK TypeScript SpaceXAI 0.2.1 — Publicată pe 2 octombrie, această versiune adaugă
toJson(schema), care validează ieșirea structurată cu un validator Standard Schema (Zod, Valibot sau ArkType), și opțiunearetryBeforeOutput, care retrimite o cerere în flux continuu (streaming) ce a eșuat înainte de a produce vreo ieșire; în cazul unui 429 fără antet Retry-After, așteptarea pornește acum de la o secundă și ajunge până la 30 de secunde, în loc de 250 de milisecunde. 🔗 sursă - Cresta Conductor pe Claude Agent SDK — În seria Anthropic dedicată startupurilor care construiesc cu Claude, Cresta prezintă Conductor, un constructor de agenți pentru relații cu clienții în limbaj natural, construit pe Claude Agent SDK; potrivit Cresta, acesta a redus cu aproximativ jumătate timpul de implementare inițială în primele sale cazuri de utilizare, fără a preciza o dată de disponibilitate sau un preț. 🔗 sursă
- npm: expirarea configurațiilor de publicare de încredere — Din 2 octombrie, o configurație de publicare de încredere (trusted publishing) care nu a fost folosită pentru nicio publicare expiră la 48 de ore după creare, iar npm respinge și tokenurile provenite din evenimente
issue_commentale GitHub Actions, la fel ca pentrupull_request_target. 🔗 sursă - npm: publicarea în așteptare creează pachete — Din 2 octombrie,
npm stage publishpoate crea un pachet care nu există încă, folosind o sesiune locală sau un token granular, inclusiv unul limitat la punerea în așteptare (stage-only); prima versiune așteaptă promovarea de către un maintainer înainte de a putea fi instalată. 🔗 sursă - Agent API Perplexity pe Fast Search — Presetările low, medium și high din Agent API folosesc acum Fast Search pentru instrumentul
web_search, la un cost redus de la 2,50 la 1 dolar pentru 1 000 de invocări și cu o execuție mai rapidă cu aproximativ 800 ms; presetarea xhigh păstrează căutarea standard. 🔗 sursă - Ghidul RAG Perplexity — Perplexity publică un ghid cu nouă exemple de generare augmentată prin recuperare (retrieval-augmented generation, RAG) și șapte arhitecturi, menționându-se pe sine pentru indexul său web și funcția Instant Buy, alături de exemple ale unor terți precum Zendesk sau GitHub Copilot; nicio noutate de produs. 🔗 sursă
- Numărul de angajați la Cohere — Potrivit Cohere, compania a trecut de la aproximativ 400 de angajați la începutul lui 2026 la peste 800 astăzi, cifră oferită într-un mesaj de recrutare. 🔗 sursă
- IsoVGRBench și Logbook la Meta — Fără anunț, facebookresearch publică codul IsoVGRBench, care evaluează modelele de recompensă video pe 16 000 de perechi ce diferă doar într-un singur aspect (în comparația cu același clip cu cadrele amestecate, aceste modele răspund aproape la întâmplare), și codul Logbook, dedicat evenimentelor din înregistrări audio foarte lungi. 🔗 sursă
- FiftyOne citește seturile de date LeRobot v3 — Potrivit unui articol comunitar al lui Harpreet Sahota, setul de instrumente open source FiftyOne citește acum nativ formatul LeRobot v3, fără convertor sau copierea videoclipurilor; demonstrația folosește 497 de episoade din cele 50 de tipuri de roboți ale setului de date comunitar LeRobot. 🔗 sursă
- FetchMan-data de la Ai2 — Publicat pe 1 octombrie fără anunț, acest set de date reunește 352 696 de episoade simulate (52 de milioane de cadre, 902 instrucțiuni) de prindere a obiectelor de către un humanoid Unitree G1, generate în MolmoSpaces, în format LeRobot v3 și sub licență ODC-BY. 🔗 sursă
- P(doom) pe profilurile Hugging Face — Utilizatorii Hub își pot afișa pe profil P(doom), estimarea probabilității ca IA să provoace o catastrofă existențială; răspunsurile contribuie la un sondaj din care vor fi publicate doar rezultate agregate și anonimizate, peste două săptămâni. 🔗 sursă
- Extensia hf-image — Hugging Face lansează, fără anunț, o extensie a CLI-ului său care construiește, publică, descarcă și rulează imagini de containere pe registrul său cr.hf.co; straturile necomprimate sunt deduplicate de Xet, astfel încât un strat de 2 Go modificat cu 100 Mo trimite doar aproximativ 100 Mo, potrivit README. 🔗 sursă
- Trei experimente ale lui Milos Kotlar — În trei articole comunitare, Milos Kotlar face cache-ul KV al unui transformer mic de 2,71 ori mai compact, cu o concordanță de 97,85 % privind următorul token, și reduce proporția tokenurilor fără expert într-o rutare MoE de la 13,84 % la 8,09 %, fără niciun câștig de viteză. 🔗 sursă
- Auditul unui evaluator LLM de către Stephen Yu — Stephen Yu a auditat, pe 38 400 de eșantioane, evaluatorul GLM-5.3 care notează fidelitatea față de fapte în recompensa GRPO a modelului său de rescriere de 12B: fiabil în detectarea modificării unui fapt, dar cu rezultate zgomotoase în evaluarea gravității; numărarea ieșirilor eronate dezvăluie o scădere de 39 % pe care prima numărătoare o ascundea. 🔗 sursă
- Simpozionul Sakana AI la Tokyo — Sakana AI deschide înscrierile la un simpozion gratuit pe 26 octombrie, la Hitotsubashi Hall din Tokyo, în limba engleză, cu o prelegere a lui Jürgen Schmidhuber și un interviu cu David Ha, directorul general al Sakana AI. 🔗 sursă
- Startupurile NVIDIA Inception și cancerul de sân — NVIDIA prezintă patru startupuri din programul său Inception care aplică IA în parcursul de îngrijire, printre care iSono Health și ecograful său 3D ATUSA autorizat de FDA (aproximativ două minute pentru fiecare sân, față de până la 45 de minute manual), Whiterabbit.ai, Ataraxis AI și SimBioSys; unele dintre aceste tehnologii nu sunt aprobate de FDA. 🔗 sursă
Ce înseamnă toate acestea
Proveniența textului devine o obligație impusă de reglementări. Până acum, trasabilitatea conținutului generat viza mai ales imaginile și materialele audio, prin filigrane și metadate verificabile; AI Act extinde cerința la text, iar OpenAI răspunde în etape: filigran aplicat implicit textului din ChatGPT și Codex în Uniunea Europeană, simplă opțiune în API, detector rezervat organizațiilor aprobate. Cifrele publicate explică această prudență: aproximativ 95 % dintre pasajele de 400 de tokenuri sunt detectate în conținut din domeniul psihologiei, cu o rată vizată de 1 % de rezultate fals pozitive, însă, pentru pasaje de 400 de tokenuri în engleză, înlocuirea a 10 % dintre cuvinte cu sinonime reduce detectarea de la aproximativ 92 % la 66 %, iar o rescriere sau o traducere poate șterge filigranul. Filigranul oferă un indiciu despre proveniență, nu o dovadă, iar absența lui nu spune nimic despre autor.
Memoria agenților se consolidează și începe să se standardizeze. Devin își păstrează lecțiile învățate într-un repository Git cu fișiere Markdown pe care Dreaming îl reorganizează zilnic, iar Cognition publică formatul sub licență MIT pentru ca și alți agenți să îl adopte; North 2 păstrează contextul de la o sesiune la alta; Qwen Code conectează Mem0 direct la CLI-ul său. Abordările diferă, între fișiere versionate care pot fi citite de un om, un serviciu de memorie extern și o funcție integrată într-o platformă, dar răspund aceleiași nevoi: ca un agent să nu pornească de la zero la fiecare sesiune. Alegerea Cognition are un avantaj practic: fiecare notă trimite la sesiunea în care a fost învățată, poate fi consultată în interfață și își păstrează istoricul Git, ceea ce permite citirea și corectarea a ceea ce a reținut agentul.
Modelele deschise intră în instrumentele de programare pe mai multe căi. Together Link le conectează la agenți existenți, inclusiv Claude Code și Codex, anunțând cheltuieli reduse cu mai mult de jumătate; IBM rulează versiunea Bob găzduită pe infrastructura proprie pe Nemotron 3 Ultra pentru companiile care își păstrează dezvoltarea pe propria infrastructură, inclusiv în medii deconectate; Reflection AI prezintă Beam ca pe un model deschis conceput pentru cod și sarcini agentice, cu 80,9 pe SWE-bench Verified potrivit propriilor tabele. Argumentul comun ține mai puțin de scorul brut, unde Reflection AI recunoaște că Kimi K3 rămâne în față, și mai mult de cost, latență și controlul datelor.
Multe dintre cifrele zilei provin de la cei care le publică. GitHub a conceput ReviewBench și a produs clasamentul inițial în care Copilot code review ocupă primul loc, fără rulare sau verificare de către ceilalți furnizori; latența Nemotron 3 Ultra provine din teste interne IBM; economiile Together Link și rezultatele publicitare ChatGPT sunt cele anunțate de Together AI și OpenAI. GitHub își publică totuși setul de date, evaluatorul și metodologia și permite trimiterea de rezultate: fiecare furnizor poate repeta măsurarea cu propriul agent. Acest lucru va permite să se stabilească dacă acest clasament inițial se confirmă.
Surse
- Abordarea noastră privind normele EU pentru proveniența textelor (OpenAI)
- Firul de discuții al OpenAI despre limitele filigranului
- Memorie și visare: cum învață Devin lucrând cu tine (Cognition)
- Firul de discuții al Cognition pe X
- Depozitul Agent Memory
- Firul de discuții al Cursor despre SDK
- Changelog-ul SDK-ului Cursor
- Qwen Code v0.25.0 pe GitHub
- Together Link (Together AI)
- Documentația Together Link
- De ce a ales IBM NVIDIA Nemotron pentru IBM Bob în regim self-hosted
- ReviewBench: un benchmark deschis pentru code review cu AI (blogul GitHub)
- Site-ul ReviewBench
- North 2: AI pentru companii fără compromisuri (Cohere)
- Firul de discuții despre lansarea North 2 (Cohere pe X)
- Alianța dintre Cohere și PwC (blogul Cohere)
- Comunicatul PwC Canada
- Vă prezentăm Beam (Reflection AI)
- MetaEncoder-30B pe Hugging Face
- Articolul Google AI de pe X despre Living Models
- Living Models pe Gemmaverse (Google DeepMind)
- Dezvoltarea publicității pentru modul în care oamenii folosesc AI (OpenAI)
- Mai multe modalități de a măsura performanța ChatGPT Ads
- Changelog-ul Perplexity din 5 octombrie
- Anunțul Suno despre albume
- 5 albume pe care nu le poți rata (Suno)
- Anunțul HyperFrames Studio
- Redistribuire de către HeyGen
- Construiește fabrica. Las-o să funcționeze. Mergi cu caiacul. (Warp)
- Notele de versiune Devin din 2 octombrie
- MCP TikTok Ads în Replit
- Cockle Finance pe Replit
- Copilot CLI v1.0.92
- Codex CLI 0.160.1
- Versiunea Nightly a Gemini CLI din 5 octombrie
- SDK-ul TypeScript al SpaceXAI v0.2.1
- Cresta și Claude Agent SDK (blogul claude.com)
- Configurațiile npm trusted publishing nevalidate expiră acum
- npm staged publishing permite acum crearea de pachete noi
- Changelog-ul API-ului Perplexity
- 9 exemple de RAG (blogul Perplexity)
- Numărul de angajați ai Cohere
- Depozitul IsoVGRBench
- FiftyOne și LeRobot v3 (Harpreet Sahota)
- FetchMan-data pe Hugging Face
- P(doom) pe Hub (changelog-ul Hugging Face)
- Depozitul hf-image
- Cache KV cu un buget KL (Milos Kotlar)
- Auditul evaluatorului LLM (Stephen Yu)
- Simpozionul Sakana AI
- De la scanare la planul de tratament (NVIDIA)