Szukaj

OpenAI będzie oznaczać tekst ChatGPT i Codex znakami wodnymi w Unii Europejskiej, Devin zapamiętuje informacje między sesjami, GitHub wprowadza ReviewBench

Artykuł wygenerowany przez sztuczną inteligencję
OpenAI będzie oznaczać tekst ChatGPT i Codex znakami wodnymi w Unii Europejskiej, Devin zapamiętuje informacje między sesjami, GitHub wprowadza ReviewBench

ai-powered-markdown-translator

Artykuł przetłumaczony z francuskiego na polski za pomocą gpt-6.1-sol.

Zobacz projekt na GitHubie ↗

OpenAI będzie w najbliższych tygodniach dodawać niewidoczny znak wodny do tekstu ChatGPT i Codex dla użytkowników w Unii Europejskiej, w odpowiedzi na AI Act, który wymaga, aby wygenerowany tekst był rozpoznawalny maszynowo, a już dziś udostępnia ten znak wodny jako opcję klientom swojego API na całym świecie. Wśród agentów zadomawia się pamięć: Cognition wyposaża Devin w pamięć między sesjami i publikuje jej format jako otwarty standard, a Cohere wprowadza North 2 z pamięcią zachowującą kontekst między sesjami; GitHub z kolei publikuje ReviewBench, otwarty benchmark przeglądu kodu przez AI. Wśród otwartych modeli Reflection AI prezentuje Beam, liczący 501 miliardów parametrów, którego wagi mają zostać udostępnione w dalszej części października.


Niewidoczny znak wodny OpenAI: tekst ChatGPT i Codex oznaczany w Unii Europejskiej, opcja dostępna na całym świecie w API

5 października — OpenAI publikuje swoją odpowiedź na europejskie przepisy dotyczące pochodzenia tekstu. AI Act wymaga od dostawców generatywnej AI, aby wytwarzany przez nich tekst był rozpoznawalny w sposób czytelny dla maszyny; OpenAI odpowiada na to etapami, od razu uprzedzając, że obecne technologie znakowania tekstu mają istotne ograniczenia (istotne ograniczenia).

Grupa odbiorcówCo się zmieniaZapowiedziany harmonogram
Użytkownicy ChatGPT i Codex w Unii Europejskiej, wszystkie planyNiewidoczny znak wodny dodawany do tekstu spełniającego kryteriaW najbliższych tygodniach
Klienci API na całym świecieOpcjonalny znak wodny (opt-in) w wybranych, niewymienionych z nazwy modelach, domyślnie wyłączonyOd 5 października
Zatwierdzeni badacze i organizacje eksperckieDostęp do detektora przyznawany indywidualnie na podstawie zgłoszeniaZgłoszenia otwarte 5 października

OpenAI nie włącza tego ustawienia domyślnie na całym świecie i współpracuje z partnerami chmurowymi, aby w najbliższych tygodniach zaoferować ten sam znak wodny w udostępnianych przez nich modelach OpenAI. Technologia textGrain dodaje niewidoczny sygnał statystyczny do doboru słów przez model, bez widocznego oznaczenia ani znaków specjalnych; według OpenAI dorównuje ona innym testowanym podejściom, w tym SynthID dla tekstu, lub je przewyższa. Opublikowano raport techniczny, a OpenAI planuje udostępnić kod. Sam detektor nie jest publicznie dostępny w chwili premiery ze względu na ryzyko niewykrycia znaków wodnych i wyników fałszywie dodatnich: dostęp jest przyznawany zgodnie z Kodeksem dobrych praktyk (Code of Practice) Komisji Europejskiej.

Opublikowane liczby pokazują przede wszystkim ograniczenia wykrywania:

Warunki pomiaruOpublikowany wskaźnik wykrywania
Fragmenty po 200 tokens, treści o tematyce psychologicznej, docelowo 1 % wyników fałszywie dodatnichokoło 80 %
Fragmenty po 400 tokens, treści o tematyce psychologicznej, docelowo 1 % wyników fałszywie dodatnichokoło 95 %
Treści o tematyce matematycznej, ten sam próg 1 %znacznie niższy (wartość podana tylko na wykresie)
Fragmenty po 400 tokens w języku angielskim (zbiór ELI5), bez przeróbekokoło 92 %
Te same fragmenty, 10 % słów zastąpionych synonimami66 %
Te same fragmenty, 25 % słów zastąpionych17 %

Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.

🇵🇱 Znaki wodne mają ograniczenia. Często są niewykrywalne, szczególnie w krótkich fragmentach. Przeredagowanie lub przetłumaczenie tekstu może całkowicie usunąć znak wodny. — @OpenAI na X

Jeśli chodzi o jakość, OpenAI nie odnotowuje istotnej różnicy w ośmiu benchmarkach GPT-6 Astra bez znaku wodnego i z nim (94,44 % wobec 93,94 % w GPQA Diamond, 53,90 % wobec 56,06 % w Terminal-Bench 4.0). Wpis wyjaśnia też, czego znak wodny nie wskazuje: ani udziału pracy człowieka, ani własności tekstu czy odpowiedzialności za niego, ani tożsamości użytkownika, ani poprawności; jego brak nie dowodzi też, że tekst napisał człowiek. W przypadku obrazów i audio nic się nie zmienia: openai.com/verify i Content Provenance API pozostają dostępne dla organizacji, a od 19 maja SynthID uzupełnia metadane C2PA generowanych obrazów.

🔗 Wpis OpenAI o pochodzeniu tekstu w UE


5 października — Cognition wprowadza w Devin dwie powiązane funkcje: Memory, pamięć zachowywaną między sesjami, oraz Dreaming, codzienny „sen”, który ją reorganizuje. Memory zachowuje to, czego agent uczy się podczas pracy z każdym użytkownikiem: preferencje, poprawki, wnioski z projektu lub przepływu pracy. Nie są to podsumowania sesji, lecz krótkie notatki, każda powiązana z sesją, w której wyciągnięto dany wniosek, a pamięć ta pozostaje osobista: nie staje się instrukcją wspólną dla całej organizacji.

Notatki znajdują się w Memory Drive, trwałym repozytorium Git z plikami Markdown uporządkowanymi według repozytorium, projektu lub tematu. Celowo krótki plik MEMORY.md zawiera ogólne preferencje i indeks pozostałych materiałów: Devin otrzymuje go na początku każdej sesji, a następnie wyszukuje przydatne notatki za pomocą narzędzi służących mu do przeglądania kodu, bez wczytywania całego archiwum do swojego promptu. Każda sesja pracuje na własnej kopii Git: Devin scala aktualizacje z innych sesji, kontrola rewizji odrzuca zapisy oparte na nieaktualnej wersji, a konflikty są zgłaszane zamiast po cichu nadpisywane.

Dreaming to codzienna sesja w tle (w nocy, jak precyzuje wątek Cognition): Devin ponownie czyta wcześniejsze rozmowy w świetle swojej pamięci, scala pokrywające się notatki, usuwa przejściowe szczegóły, szuka wniosków, których wcześniej nie zapisano, i usuwa wpisy pamięci, z których nie skorzystała żadna sesja. Dostęp jest możliwy na devin.ai, w menu Customize → Memory; wpis nie wspomina o Devin Desktop ani Devin CLI i nie podaje żadnych cen.

Cognition publikuje również format jako otwarty standard Agent Memory Repo na licencji MIT. Specyfikacja, otwarta na wkład społeczności, opisuje cykl każdej sesji (klonowanie pamięci, wyszukiwanie, aktualizowanie bez udziału człowieka, wysyłanie po każdej zmianie) oraz łączenie wielu pamięci w jednej sesji, każdej we własnym repozytorium z własnymi uprawnieniami i historią. Wśród wymienionych zastosowań znajdują się pamięć zespołu i roje agentów (agent swarms):

In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)

🇵🇱 Podczas pierwszych eksperymentów widzieliśmy, jak rój agentów Devin używał pamięci do koordynowania działań na dużą skalę, choć ich o to nie prosiliśmy (obiecujemy, nie włamali się do nikogo). — @cognition na X

„Sen” reorganizujący pamięć agenta istniał już w Anthropic (Claude Managed Agents, w maju) i OpenAI (pamięć ChatGPT, w czerwcu); nowością jest tutaj pamięć w plikach wersjonowanych za pomocą Git, opublikowana jako specyfikacja, którą mogą przyjąć inni agenci.

🔗 Pamięć i śnienie, wpis Cognition 🔗 Specyfikacja Agent Memory Repo

Cursor: kierowanie agentami SDK podczas ich działania

5 października — Cursor rozszerza swoje SDK, które służy do uruchamiania jego agentów z kodu TypeScript lub Python. Metoda run.steer() wprowadza wiadomość do bieżącej tury agenta; jeśli w tym momencie pracuje subagent, przechodzi on do tła i kontynuuje pracę. Subagenci działający w tle również przekazują wyniki: ich rezultat wraca do agenta nadrzędnego jako dodatkowa tura tego samego uruchomienia, zamiast przepadać po zakończeniu tury nadrzędnej.

Nowość w SDKZakres wskazany w changelogu
run.steer(), sterowanie podczas działaniaLokalni agenci w TypeScript; w przypadku agenta chmurowego wiadomość trafia jako zwykła kontynuacja
Zwrot wyników subagentów działających w tleLokalni agenci w TypeScript i Python
Adnotacje MCP własnych narzędzi (readOnlyHint, destructiveHint…)TypeScript; tylko wskazówki, których SDK nie egzekwuje
Wymienny prompt systemowy, reguły i skills nadal wczytywaneLokalni agenci w TypeScript; dostęp włączany indywidualnie dla poszczególnych kont

Zmianom tym nie towarzyszy żaden cennik.

🔗 Wątek Cursor na X 🔗 Changelog SDK Cursor

Qwen Code v0.25.0: agenci obszaru roboczego, kanał e-mail i pamięć Mem0

5 października — Qwen publikuje v0.25.0 Qwen Code, swojego agenta programistycznego działającego w wierszu poleceń, pierwszą stabilną wersję od v0.24.7 z 29 września: 42 funkcje, w tym 23 dla Managed Agent, 79 poprawek i żadnych znanych zmian naruszających kompatybilność. Wyróżniają się trzy dodatki, z których każdy trzeba jawnie włączyć. Agenci obszaru roboczego współpracują teraz lokalnie: demon uruchamia i wznawia ich tury, a Web Shell pozwala zarządzać agentami i zadaniami oraz zwrócić się do jednego z nich za pomocą @agent z poziomu rozmowy. Ci trwale działający agenci obsługują teraz protokół A2A 1.0 poprzez udostępnienia, które wygasają i można je wycofać. Wreszcie pamięć Mem0 łączy się bezpośrednio z CLI: wystarczy wskazać punkt końcowy i klucz, a Qwen Code sam rejestruje odpowiedni serwer MCP. Kanał e-mail daje też agentowi własną skrzynkę obsługiwaną przez IMAP i SMTP, a Code Mode wykonuje równolegle wywołania Bash grupowane przez model. SDK TypeScript v0.1.18 i aplikacja Desktop v0.25.0 ukazały się tego samego ranka, bez tweeta Qwen.

🔗 Informacje o wydaniu Qwen Code v0.25.0

5 października — Together AI wprowadza wersję beta Together Link, która uruchamia już zainstalowanych agentów programistycznych na otwartych modelach hostowanych przez platformę. Polecenie instalacyjne (macOS lub Linux) łączy Claude Code, Claude Desktop, Codex, OpenCode i Pi z jej API za pomocą klucza konta; dokumentacja dodaje ChatGPT Desktop i uprzedza, że polecenia, routing i lista modeli mogą się jeszcze zmienić. Oprócz trybu Auto dostępne są cztery modele, każdy z kontekstem 1M tokenów:

Dostępny modelOdpowiednik w menu /model w Claude Code
Kimi K3Opus
GLM 5.3Fable
GLM 5.3 FlashSonnet
DeepSeek V4.1 FlashHaiku

Domyślnie wybrany tryb Auto może powierzać trudne zadania Opus 5.5, gdy użytkownik poda klucz Anthropic, ale wpis i dokumentacja opisują ten routing inaczej: według wpisu wybór dokonywany jest raz na sesję, aby zachować cache promptu, a według dokumentacji każde żądanie jest klasyfikowane osobno, wyłącznie w Claude Code i Claude Desktop. Together AI zapowiada obniżenie wydatków o ponad 50 %, bez opublikowanej metody pomiaru, i po każdej sesji wyświetla jej koszt obok kosztu, jaki miałaby na Opus 5.5.

🔗 Wpis Together AI 🔗 Dokumentacja Together Link

IBM Bob hostowany we własnej infrastrukturze opiera się na Nemotron 3 Ultra firmy NVIDIA

5 października — IBM wyjaśnia, dlaczego wersja Bob hostowana we własnej infrastrukturze (self-hosted), czyli jego asystenta programowania opartego na agentach, korzysta z Nemotron 3 Ultra firmy NVIDIA obok Poolside Laguna S 2.1. Opcja ta, udostępniona powszechnie w poprzednim tygodniu, uruchamia asystenta na infrastrukturze klienta, także w środowiskach odłączonych od sieci (air-gapped). Zespół oceniał modele według czterech kryteriów (zapotrzebowanie na zasoby sprzętowe, poprawność kodu, opóźnienia, otwartość wag), testując je z warstwą wykonawczą agenta Bob, przy czym zamknięte modele Anthropic, OpenAI i Google służyły za punkt odniesienia. Początkowo zbyt rozwlekły Nemotron został dostrojony we współpracy z NVIDIA: zmieniono prompty, parametry próbkowania, ustawienia rozumowania i wprowadzono poprawki w warstwie wykonawczej. Według wewnętrznych testów IBM Nemotron 3 Ultra oferuje na GPU Blackwell nawet około 4 razy niższe opóźnienia niż czołowe modele SaaS wywoływane przez sieć i ściśle przestrzega schematów narzędzi; Laguna S 2.1 wybrano ze względu na stosunek wydajności do zapotrzebowania na zasoby. Wpis nie publikuje żadnych wyników pomiarów poprawności.

🔗 Wpis IBM o Bob hostowanym we własnej infrastrukturze


ReviewBench: GitHub wprowadza otwarty benchmark przeglądu kodu przez IA

5 października — GitHub udostępnia w badawczej wersji zapoznawczej (research preview) ReviewBench, otwarty benchmark dla agentów przeglądu kodu przez IA. Dedykowana strona publikuje pełny zbiór danych, ranking, metodologię, prompt i konfigurację sędziego, a także narzędzie do samodzielnego przeprowadzania testów. Autorami wpisu są Michelle Zhou i Alejandro Carderera de Diego, a podziękowania wskazują na udział GitHub i Microsoft w projekcie.

Korpus obejmuje 219 pull requests ze 187 publicznych repozytoriów open source, w 19 językach. Rozkłady języków i wielkości repozytoriów odwzorowują rozkłady GitHub, ustalone na podstawie 103,9 miliona pull requests, z celowym nadaniem większej wagi średnim i dużym zmianom. Zbiór referencyjny (golden set) łączy ustalenia ludzkich recenzentów, problemy wywnioskowane z późniejszych commitów, deterministyczne narzędzia analityczne i kilka czołowych LLM; ustalenia zatwierdza sędzia LLM, według wpisu Claude Sonnet 5. Doświadczeni inżynierowie, którzy nie uczestniczyli w tworzeniu zbioru, ponownie przypisali etykiety każdemu ustaleniu: ich oceny zgadzają się z ReviewBench w 96,6 % przypadków. Główną miarą porównania jest „zakotwiczona” czułość (grounded), mierzona wyłącznie na zbiorze referencyjnym.

Według początkowego rankingu GitHub pierwsze miejsce zajmuje Copilot code review:

Oceniany agent (konfiguracja)Zakotwiczony F1Zakotwiczona precyzjaZakotwiczona czułośćData uruchomienia
Copilot Code Review (Balanced)40,1 %87,8 %26,0 %1 października 2026
Devin AI37,0 %84,0 %23,8 %28 września 2026
Qodo35,1 %85,3 %22,1 %28 września 2026
Codex (GPT-5.6 Sol · Ultra)32,3 %87,0 %19,9 %19 lipca 2026
Cubic27,3 %85,5 %16,3 %29 czerwca 2026
Greptile27,2 %86,1 %16,2 %16 czerwca 2026
Cursor17,3 %87,7 %9,6 %27 września 2026

Strona wyjaśnia, że te pierwsze wyniki uzyskał zespół ReviewBench, uruchamiając publicznie dostępny produkt każdego dostawcy we wskazanym dniu, a dostawcy ani nie przeprowadzali tych testów, ani ich nie weryfikowali. Każdy może teraz zgłosić swojego agenta: zgłaszający dostarcza obraz kontenera i klucz modelu, GitHub zapewnia sędziego, najpierw odbywają się testy na 25 pull requests, a następnie pełny test w trzech przebiegach; wynik jest publikowany dopiero po zatwierdzeniu przez opiekuna projektu i tylko wtedy, gdy poprawia poprzedni wynik agenta albo jest jego pierwszym zgłoszeniem.

GitHub wykorzystuje benchmark również do rozwijania Copilot code review. W teście A/B wielomodelowy przegląd na poziomie Lite, łączący kilka niezależnych uruchomień, zwiększył czułość o 13,6 % przy spadku kosztu jednego przeglądu o 8,0 %, zgodnie z kierunkiem zmian przewidzianym w testach offline. Wpis podaje sprzeczne informacje o liczbie komentarzy: +61 % w tekście, +25,0 % na wykresie.

🔗 Wpis GitHub o ReviewBench 🔗 Strona i ranking ReviewBench


Cohere wprowadza North 2 i zawiera z PwC globalny sojusz

5 października — Cohere wprowadza North 2, nową wersję North, swojej platformy agentów IA dla przedsiębiorstw, zapowiedzianą 9 września jako „wkrótce dostępna”, a następnie obiecaną na październik. Wątek premierowy deklaruje ponad 15 nowych funkcji (15+ nowych funkcji), ale wpis nie powtarza tej liczby. Sercem tej wersji jest nowe środowisko wykonawcze agentów (agent harness), przeprojektowane z myślą o wieloetapowych automatyzacjach i agentach, na platformie, która nadal pozostaje niezależna od modeli: można korzystać z modeli Cohere lub modeli klienta.

Obszar funkcjonalnyNowości wymienione przez Cohere
AgenciAgenci i automatyzacje wielokrotnego użytku, tworzone za pomocą promptu i udostępniane w organizacji; orkiestracja wielu agentów; pamięć zachowująca kontekst między sesjami
ProduktywnośćUmiejętności (Skills), biblioteki (Libraries) i aplikacje tworzące prezentacje, pulpity i dokumenty; Automations, wprowadzone pod koniec lipca, z gotowymi szablonami i edytorem wizualnym
KonektorySlack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion i GitHub; dostawcy danych finansowych (PitchBook, FactSet i inni) są dopiero planowani
Wdrożenie i bezpieczeństwoSamodzielny hosting, VPC, wdrożenie hybrydowe, lokalne lub całkowicie odłączone od sieci; SOC 2 Type 2, ISO 27001 i ISO 42001; zasady autonomii z zatwierdzaniem krytycznych decyzji przez człowieka
ZarządzanieKonsola North Admin, progi wykorzystania zapytań i tokenów na użytkownika lub grupę, alerty przed osiągnięciem limitów

Cohere wymienia dwóch klientów, LG CNS w Korei Południowej i Bell Cyber w Kanadzie, oraz podkreśla większą przepustowość swoich modeli na GPU NVIDIA Blackwell i Hopper, bez podawania liczb, przytaczając wypowiedź Kari Briski, odpowiedzialnej za generatywną IA w NVIDIA. Nie podano cen ani harmonogramu wdrożenia: wpis odsyła do rezerwacji demonstracji u zespołów sprzedaży.

🔗 Wpis premierowy North 2 🔗 Wątek premierowy North 2 na X

Globalny sojusz z PwC, który rozpoczyna się w Kanadzie

5 października — Tego samego dnia PwC i Cohere ogłaszają globalny sojusz (globalny sojusz), rozpoczynający się w Kanadzie, w komunikacie PwC Canada opatrzonym datą i miejscem Toronto, który przekazuje krótki wpis Cohere. Podział ról jest jasny: Cohere dostarcza North, swoje modele dla przedsiębiorstw i narzędzia do wyszukiwania informacji; PwC wnosi wiedzę branżową, regulacyjną, z zakresu zarządzania ryzykiem i transformacji, od wyboru zastosowań po integrację IA z danymi i systemami przedsiębiorstwa. Zapowiedziane zastosowania obejmują wyszukiwanie w przedsiębiorstwie, dostęp do wiedzy, pogłębione badania, wspomaganie decyzji i automatyzację zadań, w chmurze prywatnej, lokalnie lub w środowisku odłączonym od sieci, z sektorami regulowanymi jako główną grupą docelową. Komunikat przytacza wypowiedzi Domenica Marino i Annie Veillet z PwC Canada oraz Aidana Gomeza z Cohere; nie podaje kwot, klientów ani harmonogramu wykraczającego poza Kanadę. Cohere zawarło już wcześniej sojusz z OpenText, 16 września.

🔗 Wpis Cohere o sojuszu z PwC 🔗 Komunikat PwC Canada


Modele otwarte: Beam, MetaEncoder-30B i Gemma 4 w genomice roślin

Trzy otwarte modele pojawiają się w dzisiejszych wiadomościach, każdy na innym etapie: jeden został zapowiedziany, drugi udostępniony bez ogłoszenia, a trzeci wyróżniony miesiąc po publikacji.

Beam: otwarty model Reflection AI o 501 miliardach parametrów

5 października — Reflection AI przedstawia Beam, swój pierwszy model o otwartych wagach: MoE o rzadkiej aktywacji, liczący 501 miliardów parametrów, z czego 23 miliardy są aktywne, zaprojektowany do programowania, rozumowania i zadań agentowych oraz wytrenowany w całości od zera. Trening wstępny objął 23 800 miliardów tokenów; etap uczenia ze wzmocnieniem wykorzystywał 10 500 GPU NVIDIA GB300 przez cztery tygodnie i wygenerował ponad 100 milionów trajektorii (rollouts).

Według tabel Reflection AI:

Oceniany benchmarkBeamNemotron 3 UltraGLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
SWE-bench Verified80,970,7————
SWE Bench Pro v165,546,4——67,7—
Terminal Bench v2.180,156,488,288,386,690,6
DeepSWE v1.144,4—61,068,051,074,2

Kreska oznacza wynik niepodany we wpisie. Reflection AI deklaruje wyniki rozumowania porównywalne z GLM-5.2 przy od 3 do 4 razy mniejszych nakładach obliczeniowych podczas inferencji i przyznaje, że Kimi K3 nadal wyprzedza Beam pod względem samych możliwości. Niczego nie można jeszcze pobrać: Beam przechodzi końcowe oceny i testy adwersarialne (red-teaming), wczesny dostęp wymaga rejestracji, a wagi, raport techniczny, karta modelu i narzędzia dla programistów mają zostać udostępnione w dalszej części października.

🔗 Wpis Reflection AI o Beam

MetaEncoder-30B, enkoder decyzyjny, który Meta udostępnia bez ogłoszenia

5 października — Meta udostępniła na Hugging Face, w swojej organizacji facebook, MetaEncoder-30B, bez odnalezionego ogłoszenia: repozytorium, utworzone 30 września i zmodyfikowane 5 października, miało zaledwie dwa pobrania w chwili naszego sprawdzenia. Karta przedstawia multimodalny enkoder „System One” w formacie modeli decyzyjnych Jev: otrzymuje on zadanie w języku naturalnym (pytanie, instrukcję, opis stanu, kryteria) i listę kandydatów w formie tekstu uzupełnionego obrazami i filmami, a następnie ocenia każdego kandydata. Ponieważ zadanie i kandydaci są kodowani oddzielnie, porównanie sprowadza się do iloczynu skalarnego, a indeks najbliższych sąsiadów może obsługiwać miliony kandydatów bez ponownego uruchamiania modelu. MetaEncoder powstał przez kontrastowe dostrojenie Muse Glimmer 30B, modelu agentowego o otwartych wagach wydanego przez Meta w sierpniu, po którym dziedziczy licencję Apache 2.0; pobranie wymaga zaakceptowania warunków, a vLLM zapewnia jego obsługę dla tekstu i obrazów.

Zestaw ewaluacyjnyWynik według karty modeluZastosowana metryka
JEVBench (oryginalny / łatwy / trudny)0,9444 / 1,0000 / 0,7387Dokładność
ImaJEV-Bench0,8958Dokładność
NanoBEIR0,6632NDCG_linear@10
MMEB-V3 (obrazy / wideo / dokumenty wizualne)0,7897 / 0,6046 / 0,8138Hit@1 / Hit@1 / NDCG@5

🔗 Karta MetaEncoder-30B na Hugging Face

Living Models łączy Gemma 4 i BOTANIC-1, aby dekodować ADN roślin

5 października — Google wyróżnia w X Article opublikowanym przez @GoogleAI i w swojej witrynie Gemmaverse pracę Living Models, laboratorium biologii IA z siedzibą w Paryżu. Gemma 4 E4B koordynuje tam analizę (potoki przetwarzania w terminalu, filtrowanie danych, wywołania narzędzi), lokalnie przez Ollama na jednym GPU NVIDIA L4, natomiast BOTANIC-1, genomowy model bazowy wytrenowany wstępnie na 320 gatunkach roślin, ocenia skutki mutacji; niepubliczne genomy pozostają na miejscu. Studium przypadku wykorzystuje odkrycie dokonane w INRAE przez Adnane’a Boualema: zmiana jednej litery w genie CmEIN3 melona przekształca kwiat żeński w obupłciowy. Spośród 2 494 potencjalnych mutacji punktowych potwierdzona mutacja trafia na pierwsze miejsce, bez remisu, w mniej niż cztery minuty według X Article.

Testowana konfiguracja (20 uruchomień)Recall@1
Bez wskazówek0,00
Wskazówki eksperckie0,15
Z wynikiem BOTANIC-10,90

Modele Botanic1 (od 0,3 do 2 miliardów parametrów) i preprint na bioRxiv pochodzą z początku września: nowością jest ich wyróżnienie przez Google i szczegółowe wyniki.

🔗 X Article Google AI 🔗 Strona Gemmaverse Google DeepMind


Reklamy w ChatGPT: test formatu wizualnego i rozszerzone pomiary

5 października — OpenAI przygotowuje wizualny format reklamowy dla ChatGPT: obrazy będą pokazywać inspiracje związane z produktem, jego zastosowanie lub doświadczenie, które umożliwia. Pierwszy test odbędzie się podczas generowania obrazów, z reklamami wyraźnie oznaczonymi i oddzielonymi od tworzonego obrazu; rozpocznie się w dalszej części tego miesiąca w Stanach Zjednoczonych, z pierwszą grupą reklamodawców. OpenAI przypomina, że reklamy nie wpływają na odpowiedzi ChatGPT, które według firmy co tydzień docierają do 1,2 miliarda osób.

Większość zapowiedzi dotyczy pomiarów: przesyłania konwersji przez Hightouch, Tealium i LiveRamp, dziesięciu wymienionych partnerów zajmujących się atrybucją (w tym AppsFlyer, Adjust i Triple Whale), eksperymentów geograficznych mierzących inkrementalność z Haus, Measured i WorkMagic, jednodniowego okna konwersji po wyświetleniu reklamy w raportach oraz wskaźnika jakości sygnałów (Event Quality Score). W zakresie bezpieczeństwa marek uprawnieni reklamodawcy mogą wykluczać wyrażenia (Negative Phrases), a pilotażowe oceny są przygotowywane z DoubleVerify i Integral Ad Science. Piksel i Conversions API są z kolei dostępne od 5 maja.

Wynik opublikowany przez OpenAIOpublikowana wartośćPomiar przeprowadzony przez
Koszt pozyskania klienta WeightWatchers w porównaniu z własnym benchmarkiem płatnych reklam w wyszukiwarce−15,3 %DV Rockerbox
Przyrostowe zakupy marki Dose dokonane przez nowych klientów67 %WorkMagic
Odwiedzający Portland Leather z ChatGPT Ads, którzy byli nowymi odbiorcami marki93 %Triple Whale

🔗 Wpis OpenAI o nowym formacie reklamowym 🔗 Wpis na blogu Ads o pomiarach


Changelog Perplexity z 5 października: rozszerzenie przeglądarki dla Computer, Wiley i Stripe Projects

5 października — Perplexity publikuje changelog produktu obejmujący 18 sekcji, którego w chwili naszego przeglądu nie udostępniono na X. Osiem z nich powtarza już opisane zapowiedzi (Automations, Claude Opus 5.5, generowanie wideo, Skills American Express, Portable Computer na AMD, Fast Search, Profiles w Agent API, Claude Fable 5.1), dziewiąta dodaje interaktywne objaśnienia 3D do wykresów z 1 października, a dziewięć kolejnych to wcześniej nieopisane nowości:

Wcześniej nieopisana nowośćPlatforma lub wersjaOdbiorcy
Rozszerzenie dla Chrome, Edge lub Brave, które pozwala Computer korzystać z przeglądarki (domyślny pozostaje Comet)Perplexity dla Mac 26.38.0 i nowszeNie podano
Zadania Computer w osobnych kartach i oknachPerplexity dla Mac 26.37.1 i nowszeNie podano
Poziom wysiłku (Light, Standard, High, Ultra) na urządzeniach mobilnychiOS 26.38.0 i Android 2.100.0 oraz nowszePro, Max, Enterprise Pro, Enterprise Max
Czasopisma i książki Wiley bez osobnej subskrypcji WileyPerplexity i ComputerWszystkie plany, zróżnicowane limity premium
GPT-6.1 Sol, który obsługuje też poziom wysiłku Light w Computer zamiast GPT-6 SolPerplexity i ComputerUprawnieni płatni subskrybenci
Rozmowa prowadzona krok po kroku, by rozpocząć pierwsze zadanie ComputerWebNowe bezpłatne konta
Podłączanie aplikacji z pola wprowadzania tekstu (Połącz aplikację)Computer w wersji WebNie podano
Konektor DocSend do pokoi danych dotyczących inwestycji (deal rooms)ComputerUprawnione konto DocSend
Stripe Projects: klucz API Perplexity tworzony z poziomu CLI StripeCLI StripeDeweloperzy API Perplexity

W Stripe Projects jedno polecenie tworzy lub podłącza projekt, generuje klucz i zapisuje go w pliku .env; Perplexity proponuje powierzyć tę konfigurację Claude Code, Cursor lub Codex.

🔗 Changelog Perplexity z 5 października


Twórczość generatywna: Suno Albums i HyperFrames Studio od HeyGen

Suno dodaje albumy

5 października — Suno dodaje albumy, których dotąd brakowało na jego platformie. Według wpisu towarzyszącego zapowiedzi funkcja przekształca najlepsze utwory użytkownika w kompletne projekty (projekty o pełnej długości), a listę odtwarzania (playlistę), która pełniła rolę albumu, można teraz przekształcić w Album. Suno przedstawia twórców pięciu pierwszych albumów: naenia (Oakwood///diskrot), Old Soul (Isaiah Wallace), phenomenal (KakerMix///diskrot), Lost In a Dream (Dream Relic) i VOID (ECHLO). Firma nie podaje ani planów objętych tą funkcją, ani liczby utworów na album, ani dokładnej daty jej udostępnienia. Już w czerwcu Suno pytało swoją społeczność o wrażenia ze słuchania, uwzględniając listy odtwarzania, albumy i stacje radiowe.

🔗 Zapowiedź Suno na X 🔗 5 albumów, których nie możesz przegapić, blog Suno

HyperFrames Studio, edytor wideo HeyGen zaprojektowany dla agentów

5 października — HyperFrames, framework open source od HeyGen, który przekształca kod HTML w wideo, staje się aplikacją desktopową. HyperFrames Studio przedstawia się jako edytor wideo zbudowany od podstaw dla agentów: użytkownik opisuje oczekiwane wideo, agent (Claude Code, Codex lub własny agent) przygotowuje pierwszy montaż, a następnie człowiek i agent pracują na tej samej osi czasu (timeline). Pracą steruje się gestami zamiast promptami: można obrysować element obrazu, przypiąć komentarz do słowa albo samodzielnie wykonać cięcie. Aplikacja eksportuje w 4K i deklaruje setki inspiracji oraz szablonów; według konta HyperFrames na X jest bezpłatna, a do pobrania dostępna jest tylko wersja macOS. Jest rozwinięciem zaprezentowanej w lipcu wersji Studio Preview, która już pozwalała wizualnie edytować wideo wygenerowane za pomocą kodu.

🔗 Zapowiedź HyperFrames Studio 🔗 Udostępnienie przez HeyGen


W skrócie

  • Warp Factories zmierza do ogólnej dostępności — We wpisie z 3 października o swoim jesiennym seminarium Warp informuje, że Warp Factories, jego infrastruktura agentów, przechodzi z wczesnego dostępu do ogólnej dostępności, bez podania daty ani cen; zespół twierdzi, że dzięki niej w ostatnim miesiącu obniżył koszt na PR o 70 %. 🔗 źródło
  • Informacje o wydaniu Devin z 2 października — Ustawienia dostępu w Microsoft Teams są teraz egzekwowane, jednym kliknięciem można zaznaczyć wszystkie wykryte problemy bezpieczeństwa o tym samym poziomie istotności (również w API v3), a oferowane pluginy pokazują swoje skills, MCP, hooks i reguły przed instalacją; budowanie środowisk dla dużych repozytoriów Perforce ma teraz limit 3 godzin, zamiast kończyć się błędem po 10 minutach. 🔗 źródło
  • MCP TikTok Ads w Replit — Replit dodaje TikTok Ads do swojego katalogu ponad 450 integracji: po podłączeniu konta jego Agent może tworzyć reklamy TikTok i zarządzać nimi, docierać do grup odbiorców oraz mierzyć wyniki z poziomu przestrzeni roboczej, bez zużywania kredytów za samo połączenie. 🔗 źródło
  • Cockle Finance na Replit — Replit przypina wideo poświęcone Cockle Finance, którego narzędzie zbudowali na Replit Dan i jego ojciec Steve, aby śledzić napływ klientów; według Replit Dan rozwinął swoją działalność o 15 % w ciągu trzech miesięcy, bez wskazania miary tego wzrostu. 🔗 źródło
  • Copilot CLI 1.0.92 w wersji stabilnej — Ta wersja zbiera nowości z wydań testowych od 1.0.92-0 do -5; jedyna nowość: po zalogowaniu przez Microsoft Entra użytkownik wybiera konto, którego chce używać, /logout zamyka te sesje OAuth, a serwery MCP chronione przez Entra odświeżają swoje dane uwierzytelniające bez interwencji. 🔗 źródło
  • Codex CLI 0.160.1 — To wydanie naprawcze wersji 0.160.0 zawiera tylko jeden backport: zmienne Windows SYSTEMROOT, TEMP i TMP są zachowywane podczas uruchamiania zdalnych serwerów MCP stdio, których zdalne środowisko skonfigurowano jawnie; to najnowsza wersja stabilna, ponieważ nie wydano żadnej stabilnej wersji 0.161.0. 🔗 źródło
  • Nightly Gemini CLI z 5 października — Nie zawiera żadnych zmian: zbudowano ją na podstawie tego samego commitu co wersję z 3 października, różni się wyłącznie numerami wersji, a kanały stabilny (v0.62.0) i testowy (v0.63.0-preview.0) pozostają bez zmian. 🔗 źródło
  • SDK TypeScript od SpaceXAI 0.2.1 — Opublikowana 2 października wersja dodaje toJson(schema), który waliduje ustrukturyzowane dane wyjściowe za pomocą walidatora Standard Schema (Zod, Valibot lub ArkType), oraz opcję retryBeforeOutput, która ponawia nieudane żądanie strumieniowe (streaming), jeśli nie wygenerowało jeszcze żadnych danych wyjściowych; po odpowiedzi 429 bez nagłówka Retry-After czas oczekiwania zaczyna się teraz od jednej sekundy i sięga 30 sekund, zamiast 250 milisekund. 🔗 źródło
  • Cresta Conductor oparty na Claude Agent SDK — W serii Anthropic poświęconej startupom budującym z Claude Cresta przedstawia Conductor, kreator agentów obsługi klienta wykorzystujący język naturalny i oparty na Claude Agent SDK; według Cresta skrócił on o około połowę czas początkowego wdrożenia w pierwszych zastosowaniach, bez podania daty dostępności ani cen. 🔗 źródło
  • npm: wygasanie konfiguracji zaufanego publikowania — Od 2 października konfiguracja zaufanego publikowania (trusted publishing), która nie posłużyła do żadnej publikacji, wygasa po 48 godzinach od utworzenia, a npm odrzuca także tokeny pochodzące ze zdarzeń issue_comment w GitHub Actions, tak jak w przypadku pull_request_target. 🔗 źródło
  • npm: publikacja oczekująca tworzy pakiety — Od 2 października npm stage publish może tworzyć pakiet, który jeszcze nie istnieje, przy użyciu lokalnej sesji lub tokena o szczegółowo określonych uprawnieniach, w tym ograniczonego do przygotowania publikacji (stage-only); pierwsza wersja czeka na dopuszczenie do publikacji przez opiekuna pakietu, zanim będzie można ją zainstalować. 🔗 źródło
  • Agent API Perplexity korzysta z Fast Search — Ustawienia wstępne low, medium i high w Agent API korzystają teraz z Fast Search dla narzędzia web_search, obniżając koszt z 2,50 do 1 dolara za 1 000 wywołań i skracając czas odpowiedzi o około 800 ms; ustawienie xhigh zachowuje standardowe wyszukiwanie. 🔗 źródło
  • Przewodnik RAG Perplexity — Perplexity publikuje przewodnik z dziewięcioma przykładami generowania wspomaganego wyszukiwaniem (retrieval-augmented generation, RAG) i siedmioma architekturami, wskazując własny indeks sieci Web i funkcję Instant Buy obok przykładów firm trzecich, takich jak Zendesk czy GitHub Copilot; bez żadnych nowości produktowych. 🔗 źródło
  • Zatrudnienie w Cohere — Według Cohere liczba pracowników firmy wzrosła z około 400 na początku 2026 roku do ponad 800 obecnie, co podano we wpisie rekrutacyjnym. 🔗 źródło
  • IsoVGRBench i Logbook w Meta — Bez zapowiedzi facebookresearch publikuje kod IsoVGRBench, który ocenia modele nagrody dla wideo na 16 000 parach różniących się tylko jednym aspektem (przy porównaniu z tym samym klipem o przemieszanej kolejności klatek modele te odpowiadają niemal losowo), oraz kod Logbook, poświęconego zdarzeniom w bardzo długich nagraniach audio. 🔗 źródło
  • FiftyOne odczytuje zbiory LeRobot v3 — Według wpisu społecznościowego Harpreeta Sahoty zestaw narzędzi open source FiftyOne odczytuje teraz natywnie format LeRobot v3, bez konwertera ani kopiowania wideo; demonstracja obejmuje 497 epizodów pochodzących z 50 typów robotów ze społecznościowego zbioru LeRobot. 🔗 źródło
  • FetchMan-data od Ai2 — Ten zbiór, opublikowany 1 października bez zapowiedzi, obejmuje 352 696 symulowanych epizodów (52 miliony klatek, 902 polecenia) chwytania przedmiotów przez humanoida Unitree G1, wygenerowanych w MolmoSpaces, w formacie LeRobot v3 i na licencji ODC-BY. 🔗 źródło
  • P(doom) na profilach Hugging Face — Użytkownicy Hub mogą wyświetlać na swoim profilu własne P(doom), czyli oszacowanie prawdopodobieństwa, że IA spowoduje katastrofę egzystencjalną; odpowiedzi zasilają ankietę, z której za dwa tygodnie zostaną opublikowane wyłącznie zagregowane i zanonimizowane wyniki. 🔗 źródło
  • Rozszerzenie hf-image — Hugging Face udostępnia bez zapowiedzi rozszerzenie swojego CLI, które buduje, wysyła, pobiera i uruchamia obrazy kontenerów w rejestrze cr.hf.co; nieskompresowane warstwy są deduplikowane przez Xet, dzięki czemu warstwa o wielkości 2 Go, w której zmieniono 100 Mo, przesyła według README tylko około 100 Mo. 🔗 źródło
  • Trzy eksperymenty Milosa Kotlara — W trzech wpisach społecznościowych Milos Kotlar zmniejsza rozmiar cache KV małego transformera 2,71 razy przy 97,85 % zgodności co do następnego tokena i obniża odsetek tokenów bez eksperta w routingu MoE z 13,84 % do 8,09 %, bez żadnego wzrostu szybkości. 🔗 źródło
  • Audyt sędziego LLM przeprowadzony przez Stephena Yu — Stephen Yu przeprowadził na 38 400 próbkach audyt sędziego GLM-5.3, który ocenia wierność faktom w funkcji nagrody GRPO jego modelu do przeredagowywania tekstu o rozmiarze 12B: niezawodnie wykrywa zmianę faktu, ale jego oceny powagi tej zmiany są obarczone szumem; zliczanie błędnych wyników ujawnia spadek o 39 %, który ukrywało pierwotne liczenie. 🔗 źródło
  • Sympozjum Sakana AI w Tokio — Sakana AI otwiera zapisy na bezpłatne sympozjum 26 października w Hitotsubashi Hall w Tokio, prowadzone po angielsku, z wykładem Jürgena Schmidhubera i rozmową z Davidem Ha, dyrektorem generalnym Sakana AI. 🔗 źródło
  • Startupy NVIDIA Inception i rak piersi — NVIDIA przedstawia cztery startupy ze swojego programu Inception, które wykorzystują IA na ścieżce leczenia, w tym iSono Health z dopuszczonym przez FDA ultrasonografem 3D ATUSA (około dwóch minut na pierś wobec nawet 45 minut przy badaniu ręcznym), Whiterabbit.ai, Ataraxis AI i SimBioSys; niektóre z tych technologii nie są zatwierdzone przez FDA. 🔗 źródło

Co to oznacza

Ustalanie pochodzenia tekstu staje się obowiązkiem regulacyjnym. Dotąd identyfikowalność generowanych treści dotyczyła głównie obrazów i audio, dzięki znakom wodnym i weryfikowalnym metadanym; AI Act rozszerza ten wymóg na tekst, a OpenAI odpowiada na to etapami: znak wodny automatycznie stosowany w tekstach z ChatGPT i Codex w Unii Europejskiej, jedynie opcjonalny w API, detektor dostępny wyłącznie dla zatwierdzonych organizacji. Opublikowane liczby wyjaśniają tę ostrożność: wykrywanych jest około 95 % fragmentów o długości 400 tokenów w treściach psychologicznych, przy docelowym 1 % wyników fałszywie dodatnich, ale w angielskich fragmentach o długości 400 tokenów zastąpienie 10 % słów synonimami obniża wykrywalność z około 92 % do 66 %, a przeredagowanie lub tłumaczenie może usunąć znak wodny. Znak wodny jest wskazówką dotyczącą pochodzenia, a nie dowodem, a jego brak nic nie mówi o autorze.

Pamięć agentów upowszechnia się i zaczyna się standaryzować. Devin przechowuje zdobyte doświadczenia w repozytorium Git z plikami Markdown, które Dreaming porządkuje codziennie, a Cognition publikuje ten format na licencji MIT, aby mogli go przyjąć inni agenci; North 2 zachowuje kontekst między sesjami; Qwen Code podłącza Mem0 bezpośrednio do swojego CLI. Podejścia różnią się — od wersjonowanych plików czytelnych dla człowieka, przez zewnętrzną usługę pamięci, po funkcję zintegrowaną z platformą — ale odpowiadają na tę samą potrzebę: aby agent nie zaczynał od zera przy każdej sesji. Rozwiązanie wybrane przez Cognition ma praktyczną zaletę: każda notatka odsyła do sesji, podczas której agent przyswoił daną informację, jest dostępna w interfejsie i zachowuje historię w Git, co pozwala czytać i poprawiać to, co agent zapamiętał.

Otwarte modele trafiają do narzędzi do pracy z kodem kilkoma drogami. Together Link podłącza je do istniejących agentów, w tym Claude Code i Codex, deklarując obniżenie wydatków o ponad połowę; IBM uruchamia samodzielnie hostowaną wersję Bob na Nemotron 3 Ultra dla firm, które prowadzą prace programistyczne na własnej infrastrukturze, także w środowiskach odłączonych od sieci; Reflection AI przedstawia Beam jako otwarty model dostosowany do kodu i zadań agentowych, z wynikiem 80,9 w SWE-bench Verified według własnych tabel. Wspólny argument dotyczy w mniejszym stopniu samego wyniku, pod względem którego Reflection AI przyznaje, że Kimi K3 nadal prowadzi, a w większym — kosztów, opóźnień i kontroli nad danymi.

Wiele dzisiejszych liczb pochodzi od tych, którzy je publikują. GitHub opracował ReviewBench i przygotował początkowy ranking, w którym Copilot code review zajmuje pierwsze miejsce, bez przeprowadzenia testów ani weryfikacji przez innych dostawców; dane o opóźnieniu Nemotron 3 Ultra pochodzą z wewnętrznych testów IBM; oszczędności z Together Link i wyniki reklam w ChatGPT to deklaracje Together AI i OpenAI. GitHub publikuje jednak swój zbiór danych, sędziego i metodologię oraz otwiera możliwość zgłaszania wyników: każdy dostawca może powtórzyć pomiar z własnym agentem. To pozwoli ustalić, czy początkowy ranking się utrzyma.


Źródła