Szukaj

Google zapowiada Gemini 4 Argon, OpenAI twierdzi, że udaremniło kampanię destylacji, Cohere wprowadza Embed 5

ai-powered-markdown-translator

Artykuł przetłumaczony z fr na pl za pomocą gemini-3.8-flash-medium.

Zobacz projekt na GitHubie ↗

W środę 30 września Google ogłasza Gemini 4 Argon, model graniczny, który w pierwszej kolejności trafia do zaufanych obrońców cyberbezpieczeństwa w ramach Fairwind Program, z limitem wyjściowym zwiększonym do 1 miliona tokenów. OpenAI twierdzi, że udaremniło skoordynowaną kampanię ekstrakcji chronionego rozumowania ze swoich modeli, której trzon przypisuje osobom powiązanym z Moonshot AI. Cohere wprowadza Embed 5 z własną metodą ewaluacji, Ideogram 4.5 obiecuje kolejne edycje bez artefaktów, a HeyGen wypuszcza model wideo oparty na MiniMax H3; po stronie deweloperów tego samego dnia debiutują Claude Code 2.1.286, Zed 1.22.0 i VS Code 1.140.


Gemini 4 Argon: nowy model graniczny Google, w pierwszej kolejności dla obrońców cyberbezpieczeństwa

30 września — Google zapowiada Gemini 4 Argon, swój nowy model graniczny, we wpisie podpisanym przez Koraya Kavukcuoglu, starszego wiceprezesa Google DeepMind i głównego architekta AI w Google (Chief AI Architect). Argon został zaprojektowany, aby wspierać pogłębione rozumowanie w długich i złożonych przepływach pracy (long-horizon workflows) na trzech polach: inżynierii oprogramowania w warunkach rzeczywistych, pracy umysłowej w przedsiębiorstwach (prawo, finanse) oraz cyberobronie.

Model nie jest jeszcze dostępny publicznie. W pierwszej kolejności jest wdrażany dla grupy zaufanych obrońców cyberbezpieczeństwa z Fairwind Program, uruchomionego 2 września wraz z Gemini 3.8 Flash Cyber, którzy otrzymują go — podobnie jak wewnętrzne zespoły Google — bez barier ochronnych dla cyberbezpieczeństwa (cyber guardrails). Deweloperzy, przedsiębiorstwa i szeroka publiczność uzyskają do niego dostęp „tak szybko, jak to możliwe”, począwszy od płatnych klientów API i subskrybentów Google AI Ultra, bez ogłoszonej konkretnej daty. Do tego czasu Google wzmacnia odrzucanie szkodliwych zapytań z zakresu cyberzagrożeń oraz CBRN, monitorowanie łańcucha myśli i działań modelu, a także izoluje swoje szkolenia i ewaluacje wysokiego ryzyka w szczelnych piaskownicach; firma deklaruje również udział w dobrowolnym procesie rządu USA dotyczącym dostępu do modeli przed ich premierą.

Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.

🇵🇱 Oto Gemini 4 Argon, nasz nowy model graniczny. Został zaprojektowany z myślą o złożonych przepływach pracy w programowaniu, pracy umysłowej w przedsiębiorstwach oraz cyberobronie i od dziś jest wdrażany dla grupy zaufanych testerów w ramach naszego Fairwind Program. — @GoogleDeepMind na X

Cennik został już ustalony: w ramach ceny powitalnej 2 dolary za milion tokenów wejściowych i 10 dolarów za wyjściowe, czyli tyle samo, co GPT-6.1 Sol uruchomiony dzień wcześniej, a następnie 4 i 20 dolarów po zakończeniu okresu promocyjnego, którego długość nie została podana; wejście buforowane kosztuje o 95% mniej niż wejście standardowe. Limit wyjściowy wzrasta do 1 miliona tokenów w porównaniu z 64K wcześniej — według Google jest to najwyższa wartość w branży: model może wygenerować setki tysięcy tokenów w ramach jednej trajektorii, aby rozwiązać trudny problem.

Cena za milion tokenówCennik powitalnyCennik po okresie powitalnym
Wejście2 dolary4 dolary
Wyjście10 dolarów20 dolarów

Strona Google DeepMind porównuje model Argon z GPT-6 Astra, Claude Fable 5.1 i Claude Opus 5.5 w dziewiętnastu wierszach. Argon uzyskuje najwyższy wynik w 13 z nich, dzieli pierwsze miejsce z GPT-6 Astra na CWE-bench v1 (68%) i ustępuje w 5. Kodowanie agentowe jest najbardziej spornym polem: pierwszy w DeepSWE v1.1 (77,9%) i Vibe Code Bench, Argon zajmuje ostatnie miejsce z tej czwórki w FrontierSWE v2 i Terminal-bench 4.0. Jego przewaga jest wyraźna w pracy umysłowej, zwłaszcza w Legal Agent Benchmark od Harvey (19,6% wobec maksymalnie 6,7% u pozostałych trzech), a także w długim kontekście między 256K a 1M tokenów. Najlepszy wynik w każdym wierszu został pogrubiony.

Oceniany benchmark (dziedzina)Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
Vals Index (praca umysłowa)68,9%63,1%65,8%67,0%
AutomationBench (praca umysłowa)51,3%41,4%31,4%42,5%
Vals Finance Agent v2 (praca umysłowa)65,4%53,5%58,9%58,6%
Legal Agent Benchmark od Harvey (praca umysłowa)19,6%5,4%6,7%3,8%
DeepSWE v1.1 (kodowanie agentowe)77,9%74,1%67,4%74,2%
FrontierSWE v2 (kodowanie agentowe)55,0%65,5%56,3%62,3%
Vibe Code Bench (kodowanie agentowe)91,9%89,6%90,3%90,3%
Terminal-bench 4.0 (kodowanie agentowe)57,4%58,2%57,9%66,4%
PostTrainBench (inżynieria ML)45,3%44,3%40,2%49,3%
Terminal-Bench Science 0.1 (nauki ścisłe i matematyka)57,6%68,1%52,6%63,3%
LABBench 2 (nauki ścisłe i matematyka)88,8%85,4%68,6%73,1%
RiemannBench (nauki ścisłe i matematyka)76,0%72,0%65,6%69,6%
GraphWalks BFS do 128K (długi kontekst, F1)99,7%98,7%91,4%90,6%
GraphWalks BFS od 256K do 1M (długi kontekst, F1)84,2%71,8%65,0%66,8%
Agent’s Last Exam (obsługa komputera)39,5%34,2%—38,2%
OSWorld-2.0, podzbiór offline, wynik częściowy (obsługa komputera)69,2%72,6%——
Chartography (rozumienie multimodalne)71,6%71,0%46,2%66,3%
LVBench (rozumienie multimodalne)91,7%87,5%79,7%83,7%
CWE-bench v1 (cyberbezpieczeństwo)68,0%68,0%58,0%67,0%

W Google korzystają z niego już tysiące pracowników. W przypadku libgav1, otwartoźródłowego dekodera wideo od Google, agenci Argon zastąpili 32 000 linii kodu SIMD z istniejącego portu w języku Rust bezpiecznym kodem Rust: uzyskany dekoder jest 2,7 razy szybszy niż ten port, przy zachowaniu identycznego obrazu wyjściowego. Inni agenci przygotowali dla centrów danych optymalizacje pamięci, które po wdrożeniu mają uwolnić ponad 300 TiB. W dziedzinie cyberbezpieczeństwa Wiz wykorzystuje go w swojej inicjatywie Scan for Good: Argon wykrył tam w oprogramowaniu medycznym używanym przez szpitale na całym świecie krytyczną podatność narażającą wrażliwe dane osobowe, którą pominęły wcześniejsze modele graniczne.

🔗 Gemini 4 Argon: our next era of frontier intelligence (blog Google) 🔗 Strona Gemini w Google DeepMind i tabela benchmarków


OpenAI twierdzi, że udaremniło kampanię destylacji i przypisuje jej trzon osobom powiązanym z Moonshot AI

30 września — We wpisie w sekcji Security OpenAI informuje, że wykryło, a następnie zneutralizowało skoordynowaną kampanię mającą na celu wyekstrahowanie chronionego rozumowania (protected reasoning) ze swoich modeli, czyli wewnętrznego śladu, który model generuje podczas pracy nad zadaniem. Firma postrzega to jako wrogą destylację (adversarial distillation): systematyczne i nieautoryzowane wykorzystywanie wyników lub rozumowania danego modelu do trenowania, odtwarzania lub ulepszania innego modelu.

Według OpenAI operatorzy nie złamali szyfrowania, nie naruszyli bazy danych ani nie uzyskali bezpośredniego dostępu do zapisanych konwersacji użytkowników. Zamiast tego manipulowali interakcjami w taki sposób, aby chronione rozumowanie pojawiło się w widocznej formie, na przykład kopiując zaszyfrowane rozumowanie z jednej rozmowy, by poprosić model w innej rozmowie o jego odszyfrowanie i transkrypcję. Niezależni badacze zgłaszali w ramach odpowiedzialnego ujawniania zbliżone podatności, opisane w artykule „Stealing Reasoning Traces from Proprietary LLM APIs” zgłoszonym na arXiv 10 sierpnia; OpenAI potwierdza, że te ścieżki ataku były realne.

Etap kampaniiData lub skala odnotowana przez OpenAI
Początek aktywności, o niskim natężeniu1 lipca
Szczyty aktywności24 i 25 lipca
Zapytania zgodne ze schematem ekstrakcji podczas szczytów16 000, pochodzące od ponad 4 000 użytkowników
Grupa powiązana z tym schematemponad 15 000 użytkowników
Całkowita neutralizacja grupy28 lipca

W kwestii atrybucji wpis pozostaje ostrożny: nie ustalono, czy wszyscy operatorzy podlegają jednemu podmiotowi, a 16 000 zapytań w okresach szczytowych to próby ekstrakcji, niekoniecznie udane. OpenAI przypisuje jednak trzon tej działalności osobom powiązanym z Moonshot AI, twórcą Kimi.

… we attribute a core cluster of the activity to individuals associated with Moonshot AI …

🇵🇱 … przypisujemy trzon tej działalności osobom powiązanym z Moonshot AI … — OpenAI, wpis w sekcji Security

W odpowiedzi OpenAI zablokowało lub ograniczyło konta dopuszczające się nadużyć, zaostrzyło kontrole rejestracji i infrastruktury, rozszerzyło monitorowanie powiązanych sieci oraz wzmocniło ochronę ukrytego rozumowania między użytkownikami, przestrzeniami roboczymi, organizacjami i rodzinami modeli. Zamknięto ścieżkę umożliwiającą odtwarzanie zaszyfrowanego rozumowania innego użytkownika w celu odzyskania jego zawartości i dodano mechanizmy kontrolne wykrywające oraz wstrzymujące strumieniowane wyjście (streaming), które mogłoby je ujawnić. Wyniki przekazano za pośrednictwem Frontier Model Forum oraz kanałów rządowych: według OpenAI technika ta nie dotyczy wyłącznie jej modeli, a każdy system czyniący rozumowanie przenośnym lub możliwym do ponownego odtworzenia może być narażony na podobne ryzyka. Firma przedstawia wrogą destylację jako zagrożenie dla bezpieczeństwa i bezpieczeństwa narodowego, ponieważ wyekstrahowane rozumowanie może posłużyć do trenowania innego modelu bez barier ochronnych obecnych w oryginale. Temat nie jest nowy: w lutym Anthropic przypisało kampanie destylacji firmom DeepSeek, Moonshot AI i MiniMax, a od 24 września Anthropic nalicza opłaty za zablokowane zapytania w kilku kategoriach, w tym za ekstrakcję rozumowania.

🔗 Artykuł „Stealing Reasoning Traces from Proprietary LLM APIs” na arXiv


Embeddings: Cohere wprowadza Embed 5 i metrykę RCP-nDCG@10, Perplexity publikuje pplx-embed-v2-context-9b-preview

30 września — Cohere wprowadza Embed 5, rodzinę modeli embeddingów do wyszukiwania w przedsiębiorstwach, w dwóch wariantach dzielących tę samą przestrzeń embeddingów: Embed 5 Pro, zapewniający maksymalną jakość i indeksowanie offline, oraz Embed 5 Fast, przeznaczony do wyszukiwania interaktywnego, RAG o dużym wolumenie i wyszukiwania agentowego. Korpus można zaindeksować za pomocą Pro, a następnie przeszukiwać go za pomocą Fast bez konieczności ponownego indeksowania czegokolwiek, pod warunkiem zachowania tego samego wymiaru wyjściowego: na 40 zbiorach danych rozwojowych ten zalecany przez Cohere schemat zachowuje średnio 98,4% jakości systemu opartego w całości na Pro, w porównaniu z 96,6% w przypadku systemu opartego wyłącznie na Fast.

Oba modele przetwarzają do 128 tys. tokenów, akceptują tekst, obrazy lub oba te elementy połączone w jednym wektorze, obsługują ponad 100 języków i generują wektory o wymiarach od 256 do 2048 w formacie float, int8 lub binarnym. Cohere zaleca 1024 wymiary w formacie int8, co daje 1 KB na wektor w porównaniu z 8 KB w formacie float32 przy 2048 wymiarach. Pro kosztuje 0,12 dolara za milion tokenów tekstu, a Fast 0,08 dolara – o jedną trzecią mniej – oferując średnio 2,4-krotnie wyższą przepustowość dokumentów; przetwarzanie obrazu kosztuje w obu przypadkach 0,40 dolara za milion tokenów. Embed 5 jest dostępny od dziś za pośrednictwem API Cohere, Model Vault, Microsoft Foundry i Amazon SageMaker, a także w North, i może być wdrażany prywatnie za pomocą vLLM.

Benchmark (metryka)Embed 5 ProEmbed 5 FastInne wymienione modele
ViDoRe V3, 8 domen (RCP-nDCG@10)85,884,5Voyage 4 Large 83,7; Gemini Embedding 2 83,2; OpenAI text-embedding-3-large 75,5
FinanceBench (RCP-nDCG@10)80,180,0Pro 21,4 punktu przed OpenAI text-embedding-3-large
FinQA (RCP-nDCG@10)90,088,8—
ViDoRe V3 Finance (RCP-nDCG@10)85,083,9—
Przeanalizowane pliki PDF, średnia pakietu (RCP-nDCG@10)84,883,4Voyage 4 Large 83,6; Gemini Embedding 2 80,8; Embed 4 78,6
Tekst i obraz połączone, 5 zbiorów (nDCG@10)82,381,2Gemini Embedding 2 61,3
Obraz strony, 5 zbiorów finansowych (nDCG@10)77,073,2Embed 4 71,1; Voyage Multimodal 3.5 70,1; Gemini Embedding 2 56,7
5 języków europejskich (nDCG@10 lub RCP-nDCG@10)77—Voyage 4 Large 76; Gemini Embedding 2 73

Większość z tych wyników wyrażono w RCP-nDCG@10, metodzie ewaluacji, którą Cohere publikuje tego samego dnia (patrz poniżej): przypis we wpisie precyzuje, że dokonuje ona ponownego rankingu ustalonego zbioru kandydatów i tym samym mierzy jakość rankingu, a nie wyszukiwania pierwszego poziomu. Druga tabela wielojęzyczna zasługuje na dokładne zapoznanie się: Cohere podkreśla w niej swoje postępy w stosunku do Embed 4, aż do 13 punktów w języku perskim, jednak w przypadku tych dziesięciu języków Gemini Embedding 2 wyprzedza Embed 5 Pro w dziewięciu z nich, z chińskim jako jedynym wyjątkiem, a Voyage 4 Large wyprzedza go w pięciu. Cohere zaprezentuje Embed 5 podczas sesji na X 8 października.

🔗 Wpis Cohere o Embed 5 · Ogłoszenie @cohere na X

RCP-nDCG@10, metryka, którą Cohere mierzy Embed 5

30 września — Cohere publikuje również RCP-nDCG@10 (Rubric-Calibrated Preferences nDCG@10), swoją metodę oceny wyszukiwania. Punkt wyjścia: nDCG, metryka MTEB i BEIR, porównuje wyniki z listą dokumentów zaanotowanych wcześniej, siłą rzeczy niekompletną, przez co trafny dokument, który nigdy nie został oznaczony, nie przynosi żadnych punktów; w badaniu Cohere 28% dokumentów oznaczonych jako nietrafne zostało jednak ocenionych przez ludzi jako przydatne. RCP-nDCG@10 powierza ocenę skalibrowanemu sędziemu AI, który odpowiada na pięć identycznych pytań tak/nie dla każdego zapytania i porównuje dokumenty w grupach. Ślepa walidacja z udziałem 46 analityków w 289 pojedynkach wykazała, że gdy obie metryki wskazują różnych zwycięzców, ludzie przyznają rację RCP-nDCG w 70% przypadków. Artykuł, kod i dane zostały opublikowane, a główny opiekun MTEB zapowiada jej integrację. Cohere twierdzi, że zoptymalizowało pod kątem tej metryki swoją piątą generację Embed i Rerank (ta ostatnia wciąż bez daty), i ostrzega, że modele te mogą nie zawsze wypadać najlepiej przy ocenie wyłącznie za pomocą historycznego nDCG.

🔗 Wpis Cohere o RCP-nDCG@10 · Kod i dane na GitHubie

Perplexity publikuje pplx-embed-v2-context-9b-preview i benchmark context-bench

30 września — Perplexity publikuje w wersji zapoznawczej, na licencji MIT na platformie Hugging Face, pplx-embed-v2-context-9b-preview – model kontekstowych embeddingów: każdy fragment dokumentu jest kodowany z uwzględnieniem całego dokumentu, aby fragment ze słowem „ona” pozostał powiązany z właściwym podmiotem. Zamiast pojedynczego fragmentu wzorcowego (gold passage) na zapytanie, model uczy się od modelu-nauczyciela, czyli modelu kompresji kontekstu Perplexity, który ocenia każdy token dokumentu: dzięki temu uczy się odnajdywać odpowiedź oraz fragmenty, które ją uzasadniają. W ślepym teście na context-bench, prywatnym benchmarku firmy turbopuffer, współautora wpisu (2 099 zapytań, 38 894 dokumenty), wyprzedza voyage-context-4; na ConTEB uzyskuje najwyższą średnią, nie wygrywając jednak we wszystkich zadaniach. Perplexity ostrzega, że wagi i interfejs mogą jeszcze ulec zmianie, oraz przygotowuje dostęp przez swoje API, na razie bez podania daty.

Metryka opublikowana przez Perplexitypplx-embed-v2-context-9b-previewRóżnica względem voyage-context-4
Recall odpowiedzi na context-bench, przy K = 1045,5 %+14,4 punktu
Recall dowodów na context-bench, przy K = 1040,6 %+5,0 punktu
Pamięć na wektor (1 024 wymiary, int8)1 KB8 razy mniej niż voyage-context-4 w float32

🔗 Wpis Perplexity Research · Model na Hugging Face


Ideogram 4.5: model edycji obrazów stworzony z myślą o kolejnych poprawkach

30 września — Ideogram wprowadza Ideogram 4.5, prezentując go jako „najbardziej precyzyjny model do edycji”. Punkt wyjścia: przy każdej poprawce modele do edycji obrazu dodają artefakty, przesunięcia pikseli i zniekształcenia kolorów, przez co obraz po kilku seriach modyfikacji szybko staje się bezużyteczny. Ideogram 4.5 został zaprojektowany tak, aby wyeliminować tę kumulację i umożliwić edycję wieloetapową (multi-turn editing).

Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.

🇵🇱 Oto Ideogram 4.5, najbardziej precyzyjny model do edycji. Przy każdej modyfikacji czołowe modele dodają artefakty, przesunięcia pikseli i zmiany kolorów. Ideogram 4.5 eliminuje kumulację artefaktów, umożliwiając edycję wieloetapową. Dostępny w Ideogram, przez API oraz u partnerów premierowych. Otwarte wagi już wkrótce. — @ideogram_ai na X

Aby to potwierdzić, Ideogram publikuje bezpośrednie porównanie tych samych kolejnych modyfikacji z modelami GPT Image 2.5 Sunburst, Nano Banana Pro i Nano Banana 2, których rezultaty – według niego – stają się bezużyteczne po zaledwie kilku poprawkach. Porównanie ma charakter wizualny, bez ocen liczbowych. Przykłady obejmują kolor i oświetlenie (cienie, refleksy i jasne partie podążają za zmianą bez naruszania kompozycji), modyfikację tekstu, fotografię produktową, projektowanie wnętrz, stopniową renowację starych zdjęć, przekształcanie szkicu lub mapy głębi w obraz oraz kadrowanie.

Model wprowadza także edycję w dowolnej rozdzielczości (Zoom editing): obszar obrazu w wysokiej rozdzielczości, liczącego 24,2 megapiksela (4016 × 6016 pikseli) w przykładzie Ideogram, można modyfikować bez pomniejszania obrazu, zachowując jego krawędzie, aby wkomponować go z powrotem bez widocznych łączeń. Choć model stworzono z myślą o edycji ukierunkowanej, według Ideogram bardzo dobrze radzi sobie również z edycją ogólną.

Element ogłoszeniaCo o tym wiadomo
Dostępnośćod 30 września w Ideogram i przez API
Partnerzy premierowiPika i Luma, które ogłaszają to tego samego dnia
Otwarte wagiobiecane „wkrótce”, podobnie jak w przypadku Ideogram 4.0 opublikowanych w czerwcu
Cenniknieopublikowany

🔗 Strona modelu Ideogram 4.5


HeyGen Video: model wideo oparty na MiniMax H3, udostępniony przez API

30 września — HeyGen wprowadza HeyGen Video, model generowania wideo skierowany do firm, które oczekują wideo o jakości produkcyjnej bez ponoszenia wysokich kosztów. Zbudowany na bazie MiniMax H3 i dotrenowany przez HeyGen, tworzy wideo z tekstu lub obrazu, z dźwiękiem generowanym w ramach tego samego wywołania, i jest dostępny przez API HeyGen, a także na platformach OpenRouter, Runware i ComfyUI.

W kwestii cen funkcjonują trzy różne wartości. Stawka wynosi początkowo 0,01 dolara za sekundę do końca października, co oznacza 50% zniżki w stosunku do standardowej ceny 0,02 dolara według strony cennika. Z kolei tabela porównawcza uwzględnia cenę katalogową w rozdzielczości 768p z dźwiękiem, przed promocjami premierowymi: 0,03 dolara za sekundę. Nawet w tej cenie HeyGen Video jest najtańszym z porównywanych modeli.

Porównywany modelCena katalogowa za sekundę (768p, audio)Wewnętrzny ranking Elo HeyGen (HeyGen Video = 1 000)
HeyGen Video0,03 dolara1 000
Seedance 2.00,303 dolara955
H3 Max0,08 dolara952
H3 Max Turbo0,04 dolara920
H3 Max balanced0,08 dolara860
Kling 3.0 Pro0,168 dolara857
Veo 3.10,40 dolara744

W kwestii jakości HeyGen opiera się na wewnętrznej ocenie przeprowadzonej na zapytaniach z Artificial Analysis Arena (4800 głosów), z rankingiem Elo znormalizowanym do 1000 dla swojego modelu. W ślepym teście preferencji w starciu z H3 Max 55,8% z 650 głosów przypadło HeyGen Video, w przedziale od 49 do 62%, który nie wyklucza remisu. W przypadku 10-sekundowego klipu z obrazu na wideo czas wnioskowania transformera dyfuzyjnego spada do 3,7 sekundy, w porównaniu z 4,1 sekundy dla H3 Max Turbo i 8,3 sekundy dla H3 Max, nie licząc czasu generowania opisów.

Firma MiniMax z zadowoleniem przyjęła premierę i tego samego dnia wyróżniła inny model bazujący na H3: Boreal-H3 od Creatify, model wideo zoptymalizowany pod kątem reklam.

🔗 Katalog HeyGen Video · Ogłoszenie @HeyGen na X


Asystenci i agenci ogólnego przeznaczenia: skills w Gemini, Manus Flex i Grok Bot

Aplikacja Gemini wprowadza skills, które zastąpią Gems

30 września — Google wprowadza funkcję skills w aplikacji Gemini: instrukcje zapisywane raz, wywoływane przez wpisanie ukośnika wraz z ich nazwą. Gemini może je także tworzyć na podstawie rozmów i uruchamiać samodzielnie, gdy prompt na to wskazuje; wiele skills można łączyć, a każda z nich może zawierać pliki referencyjne (zwykły tekst, pliki PDF, obrazy). Dostępne już w Gemini Spark, trafiają teraz do czatu Gemini na całym świecie, dla wszystkich poziomów subskrypcji Google AI oraz – na ten moment – dla użytkowników od 18. roku życia; klienci Workspace dołączą w nadchodzących tygodniach. Skills zastąpią Gems, które zaczną znikać od listopada w przypadku kont osobistych, w marcu 2027 r. dla Workspace business, enterprise i nonprofit oraz w czerwcu 2027 r. dla sektora edukacji, z automatyczną migracją. Opal, narzędzie do tworzenia mini-aplikacji, również zostanie zamknięte w listopadzie, podobnie jak „Gems by Google Labs”, które nie zostaną zmigrowane.

🔗 Niech skills w Gemini zajmą się najbardziej powtarzalnymi zadaniami (blog Google)

Manus Flex: własny klucz API w agencie Manus

29 września — Manus wprowadza Manus Flex, umożliwiający zasilanie agenta Manus własnym kluczem API od obsługiwanego dostawcy wnioskowania (bring your own API key). Do tej pory Manus sam wybierał model oraz zapewniał szkielet i infrastrukturę agenta; dzięki Flex klucz dostawcy zasila te same projekty, narzędzia, środowiska wykonawcze i przepływy pracy agenta, z możliwością wyboru modelu głównego oraz poziomu wysiłku rozumowania. Rozliczenia są rozdzielone: wnioskowanie jest fakturowane bezpośrednio przez dostawcę, podczas gdy pozostałe usługi i infrastruktura wykorzystywane przez zadanie nadal zużywają kredyty Manus. OpenRouter, Fireworks i Modal to trzej pierwsi członkowie programu partnerskiego wnioskowania (Manus Flex Inference Partner Program). Wpis, opublikowany dzień po premierze Manus 2.0, nie podaje żadnego planu, cennika ani listy modeli.

🔗 Przedstawiamy Manus Flex

Grok Bot powierza pisanie kodu Cursorowi i zarządza pull requestami

30 września — Dwa dni po zapowiedzi Team Bots firma SpaceXAI wzmacnia Grok Bota w obszarze tworzenia oprogramowania. W wątku opublikowanym przez konto @bot twórcy ogłaszają, że ich boty mogą delegować zadania programistyczne do Cursora, zarządzać pull requestami za pomocą wtyczek do GitHuba i Origin (ten ostatni nie został opisany) oraz udostępniać demonstracje wideo tworzonych rozwiązań. SpaceXAI udostępnia również, w postaci szablonów do zainstalowania (templates), boty własnego zespołu inżynieryjnego, z których każdy wyposażony jest we własne skills, rutyny i konektory. Wątek nie precyzuje planu, cennika ani daty, a na x.ai nie pojawił się żaden towarzyszący wpis. Powiązanie z Cursorem nie jest nowe: Grok Bot for Enterprise był na początku września bezpłatnie udostępniony na dwa tygodnie klientom Grok i Cursor Enterprise; nowością jest to, że bot sam deleguje pracę programistyczną.

🔗 Wątek @bot na X


Robotyka i modele świata: Praxis-1 od Runway, MolmoAct 2 od Ai2 i Physis-Lang od NVIDIA

Runway prezentuje Praxis-1, model działania w świecie o otwartych wagach

30 września — Runway prezentuje Praxis-1, swój pierwszy model działania w świecie (world action model) o otwartych wagach, przeznaczony do sterowania prawdziwymi robotami. Bazuje na tym samym wstępnym trenowaniu wideo co jego modele świata, takie jak Solaris czy GWM Worlds 2, i ma służyć jako ogólny model polityki dla programistów oraz badaczy robotyki. Założenie Runway: demonstracje robotyczne są rzadkie, natomiast wideo jest niemal nieograniczone. Ta sama polityka przechodzi w ich demonstracjach ze studia do kuchni bez ponownego trenowania. Na razie nic nie jest jeszcze dostępne do pobrania: Praxis-1 jest testowany przez Noble Machines, Standard Bots i Ultra, każdy na własnym sprzęcie, a jego publiczne wydanie, wraz z wagami, zapowiedziano na najbliższe miesiące.

Wskaźnik opublikowany przez RunwayOgłoszony wynik
Korelacja między symulacją w modelu świata a wynikami w świecie rzeczywistym0,95
Końcowy błąd pozycjonowania po dopasowaniu z użyciem wideo z sieci16,1 cm
Ten sam błąd z użyciem wideo z teleoperowanego robota16,0 cm

🔗 Praxis-1 na Runway Research

MolmoAct 2 od Ai2 na czele Reality Check po dostrojeniu przez organizatora benchmarku

30 września — Ai2 ogłasza, że MolmoAct 2, jego w pełni otwarty model robotyczny, zajął pierwsze miejsce pod względem ogólnego wskaźnika sukcesu w Reality Check, niezależnym benchmarku manipulacji w warunkach rzeczywistych, z jednym istotnym zastrzeżeniem: modele są w nim dostrajane przez organizatora, Poke & Wiggle, do zadań testowych. Uruchomiony dzień wcześniej przez tę firmę Reality Check obejmuje 14 400 uruchomień na prawdziwych robotach, na stacjach FR3 Duo zainstalowanych w Deutsches Museum w Monachium, w dziesięciu środowiskach (sortowanie śrub, podłączanie złącza DC, otwieranie skrzynki z narzędziami śrubokrętem…). Dwa kierunki pozostają oznaczone jako „wkrótce”: obiekty umieszczone poza obszarem treningowym oraz trening uzupełniający (mid-training) na 100 godzinach danych ze stacji.

Oceniany modelOgólny sukcesSukces po ok. 10 demonstracjach na środowiskoSukces po ok. 300 demonstracjach na środowisko
MolmoAct 228 %4 %44 %
Pi 0.521 %5 %33 %
DiT-Flow19 %2 %29 %
GR00T N1.712 %4 %19 %

🔗 Tweet Ai2 · Ranking Reality Check

Physis-Lang: podpisy wyjaśniające fizykę modelom świata

29 września — Naukowcy z firmy NVIDIA, MIT oraz Uniwersytetu Oksfordzkiego opublikowali Physis-Lang, framework wprowadzający wnioskowanie fizyczne do podpisów wideo w celu ulepszenia modeli świata. Podpisy explicite określają przyczyny, zachodzące prawa oraz skutki; wyspecjalizowany krytyk wykrywa brakujące lub niepoparte dowodami twierdzenia, agent udoskonala instrukcje generowania podpisów, a błędy modelu służą do wyszukiwania filmów, które uzupełnią jego braki. Według NVIDII samo dodanie takiego wnioskowania do promptu, bez ponownego trenowania, poprawia wynik PhyGenBench modelu Cosmos 3 o 5,62 punktu. Po wytrenowaniu Physis-Lang na modelach Cosmos3-Super i Cosmos3-Nano zajmuje dwa pierwsze miejsca w rankingu Physics-IQ Verified w kategorii image-to-video (48,2 i 43,3 wobec 42,7 dla poprzedniego najlepszego wyniku). PhyGenBench i VideoPhy-2 są oceniane przez GPT-5.5, a Veo 3.1 zachowuje niewielką przewagę w pełnym zestawie VideoPhy-2.

Benchmark fizyki wideoCosmos3-NanoVeo 3.1Physis-Lang na Cosmos3-Nano
PhyGenBench61,6765,6371,04
Physics-IQ Verified40,2334,9943,41
VideoPhy-2 Hard48,3158,4362,36
VideoPhy-2, pełny zestaw60,4168,8768,02

🔗 Strona projektu Physis-Lang · Ogłoszenie @NVIDIAAI na X


Otwarte modele: Hunmin-397B-A17B-CUA i JEV-27B-VL

Hunmin-397B-A17B-CUA przeszczepia możliwości agentowe Qwen-CUA do modelu MoE o 397 miliardach parametrów

30 września — Na blogu społeczności Hugging Face hojun Lee szczegółowo opisuje Hunmin-397B-A17B-CUA, model obsługi komputera (computer use) udostępniony na licencji Apache-2.0 przez organizację mncai, z zastrzeżeniem zgłoszonym przez samych autorów: ewaluacje przeprowadzono we własnym zakresie, przy zaledwie jednym uruchomieniu dla benchmarków agentowych, przez co nie są one bezpośrednio porównywalne z opublikowanymi rankingami (model bazowy uzyskał w nich 48,16 w OSWorld, w porównaniu z 62,2 deklarowanymi w OSWorld-Verified). Model bazuje na Qwen3.5-397B-A17B, architekturze Mixture of Experts z 17 miliardami aktywnych parametrów, a cały projekt zmieścił się na jednym węźle z ośmioma procesorami B200. Zespół obliczył różnicę wag między modelem bazowym a wyspecjalizowanym już Qwen-CUA i przeszczepił jedynie jej wersję o obniżonej randze do wybranych modułów: sam ten transfer podniósł wynik w OSWorld-316 z 48,84 do 68,25, nie przejmując słabości Qwen-CUA w zakotwiczeniu wizualnym. Dostrojenie, a następnie uczenie przez wzmacnianie metodą GRPO dodały kolejne 4,3 punktu.

Benchmark ewaluacyjny (protokół własny)Baza Qwen3.5-397BHunmin-CUAQwen-CUA (źródło)
OSWorld, 360 zadań48,1670,4577,12
WindowsAgentArena, 153 zadania41,7750,8556,68
ScreenSpot-Pro72,7475,6162,20
KMMLU-Pro (koreański)77,9176,1271,41

🔗 Wpis o Hunmin-CUA · Wagi na Hugging Face

AutoTrust AI publikuje JEV-27B-VL, otwarty model decyzyjny oceniający również obrazy

30 września — AutoTrust AI udostępnia na licencji Apache-2.0 model JEV-27B-VL, wzbogaconą o funkcje widzenia wersję JEV-27B – swojego otwartego modelu decyzyjnego zaprezentowanego 27 września. Pokazuje mu się obrazy oraz tekst i zadaje pytanie, a model w jednym przebiegu odpowiada ze skalibrowanym prawdopodobieństwem dla każdej opcji w około sto milisekund; gdy wymaga tego pytanie, analizuje sprawę krok po kroku, przyglądając się obrazom. Mimo to jego głowica decyzyjna nie widziała żadnego obrazu podczas treningu. Główny test: w MicroLens, publicznym zbiorze danych z aplikacji z krótkimi materiałami wideo, klasyfikuje 20 kandydujących filmów dla 200 użytkowników wyłącznie na podstawie miniatur i osiąga identyczny wskaźnik AUC jak filtracja kolaboratywna wyuczona na 59 045 użytkownikach, uzyskując wyższy odsetek trafnych filmów w pierwszej piątce. Autorzy przypominają, że wynik ten pochodzi z pojedynczego zbioru obejmującego 200 użytkowników.

Metoda rekomendacji w MicroLensAUCTrafny film w top 5
JEV-27B-VL, tylko miniatury, bez danych o interakcjach0,72759 %
Filtracja kolaboratywna wyuczona na 59 045 użytkownikach0,72849 %
JEV-27B-VL, tylko tytuły0,64946 %
Kolejność losowa0,48921 %

🔗 Wpis o JEV-27B-VL


Rankingi: Open TTS Leaderboard od Hugging Face i AURORA od LILT

Hugging Face uruchamia Open TTS Leaderboard, otwarty ranking syntezy mowy

30 września — Hugging Face uruchamia Open TTS Leaderboard, ranking syntezy mowy (text-to-speech, TTS) skupiony na modelach otwartych i wielojęzycznych. W serwisie Hub znajduje się ponad 8 000 modeli TTS, jednak wiodące areny głosowania słabo nadążają za tempem rozwoju i niedostatecznie reprezentują modele otwarte: według wpisu zaledwie 16 z 92 modeli sklasyfikowanych przez Artificial Analysis to modele o otwartych wagach. Ranking zastępuje więc głosowanie obiektywnymi pomiarami: zrozumiałością (wskaźnik błędu na poziomie słów lub znaków między tekstem źródłowym a jego transkrypcją przez Qwen3 ASR), szybkością (wnioskowanie wsadowe i czas do pierwszego dźwięku, na układach H200 i procesorach CPU) oraz wiernością klonowanego głosu (podobieństwo WavLM). Ewaluacja modelu trwa kilka godzin zamiast kilku tygodni zbierania głosów. W języku angielskim prowadzą Kokoro-82M, supertonic-3 i s2-pro od Fish Audio; w kategorii wielojęzycznej – OmniVoice, s2-pro i Fun-CosyVoice3-0.5B. Autorzy ostrzegają, że ani naturalność, ani ekspresyjność nie są mierzone, a skrypty ewaluacyjne opublikują „wkrótce”.

🔗 Wpis o Open TTS Leaderboard · Ranking na Hugging Face

LILT uruchamia AURORA, wielojęzyczny ranking zadań agentowych

30 września — LILT uruchamia AURORA, ranking sprawdzający wiodące modele w nieanglojęzycznych zadaniach agentowych, w całości przygotowanych i zweryfikowanych przez rodzimych ekspertów, bez użycia tłumaczenia maszynowego. Otwierają go cztery benchmarki: wielojęzyczny Terminal-Bench z 324 zadaniami programistycznymi w dziesięciu językach, wielojęzyczna wersja τ³-bench do obsługi klienta, MultiChallenge do wykonywania instrukcji w długim kontekście oraz GAIA-v2-LILT do wnioskowania agentowego. Claude Opus 5.5 prowadzi w wielojęzycznym Terminal-Bench i zajmuje pierwsze miejsce w τ³-bench w każdym z pięciu języków. W przypadku GAIA modele uzyskują średnio o 20,7 punktu więcej w wersji zweryfikowanej przez LILT w porównaniu z tłumaczeniem maszynowym: zdaniem LILT różnica ta mierzy błąd wprowadzany przez tłumaczenie. Ten sam dialog zużywa również około 1,4 razy więcej tokenów w języku koreańskim lub arabskim niż w angielskim.

Oceniany model (Terminal-Bench wielojęzyczny, fragment)Średni wskaźnik sukcesu
Claude Opus 5.5 (effort high)76,4 %
Claude Opus 5 (effort high)73,5 %
Gemini 3.8 Flash67,3 %
GPT-6 Sol64,8 %
Command A+4,3 %

🔗 Wpis AURORA od LILT · Ranking AURORA


Sektor publiczny i przedsiębiorstwa: Claude for Government, agent zakupowy Anthropic i OpenAI ze stowarzyszeniem America’s SBDC

Claude for Government wchodzi w fazę ogólnej dostępności

30 września — Claude for Government wychodzi z fazy beta: Anthropic ogłasza jego ogólną dostępność dla agencji federalnych oraz instytucji stanowych w USA. Platforma, znajdująca się w publicznej becie od lipca, zapewnia możliwości programistyczne i pracę agentową Claude w środowisku certyfikowanym na poziomie FedRAMP High, oferując funkcje porównywalne z wersją dla klientów komercyjnych; interfejs CLI Claude Code oraz Claude for Microsoft 365 trafiają do niego we wczesnym dostępie. Brak licencjonowania na stanowisko: instytucje płacą za użycie w stałych transzach, ze sztywnym limitem zapobiegającym przekroczeniu zaplanowanego budżetu, a mapowanie grup SCIM ustala dla poszczególnych poziomów stanowisk limity zapytań, pułapy kwotowe oraz dozwolone modele. W zakresie kontroli wrażliwe operacje po stronie Anthropic wymagają zatwierdzenia przez dwie osoby, eksporty danych o użyciu zawierają wyłącznie dane telemetryczne, a historia rozmów pozostaje na urządzeniu zarządzanym przez agencję. Anthropic nie publikuje żadnego cennika.

🔗 Claude for Government is now generally available

W Anthropic agent oparty na Managed Agents obsługuje zapytania sprzedażowe

30 września — Anthropic opisuje, jak jego zespół sprzedaży przebudował obsługę zapytań przychodzących (dziesiątki tysięcy miesięcznie) za pomocą agenta zakupowego stworzonego na bazie platformy Claude Managed Agents, będącej w fazie beta. Dostępny na stronach Contact Sales i Pricing, wewnątrz claude.ai oraz w wiadomościach e-mail, zadaje kilka pytań, rekomenduje plan taryfowy i liczbę stanowisk, a następnie prowadzi do zakupu, przekazuje sprawę handlowcowi wraz z pełną historią lub po prostu udziela odpowiedzi; klient może od samego początku wybrać kontakt z człowiekiem. Według wpisu autorstwa Carla Johnsona agent prowadzi tysiące rozmów dziennie; przekazywani przez niego potencjalni klienci ponad dwukrotnie częściej stają się szansami sprzedażowymi niż w przypadku dawnego formularza i finalizują transakcję o około pięć dni szybciej, a odsetek rozmów wymagających udziału handlowca do domknięcia umowy spadł o około połowę. Pierwszą wersję zbudował pojedynczy inżynier w zaledwie kilka tygodni; agent często kieruje małe zespoły do planu Team zamiast Enterprise, na co Anthropic w pełni świadomie przystał.

🔗 How Anthropic’s sales team rebuilt inbound with Claude Managed Agents

OpenAI nawiązuje współpracę z America’s SBDC i publikuje raport o małych firmach

30 września — OpenAI nawiązuje współpracę z America’s SBDC, ogólnokrajową siecią amerykańskich centrów rozwoju małych przedsiębiorstw, wspierającą milion przedsiębiorców rocznie. W pierwszym etapie, w ramach programu trenerów społecznościowych OpenAI Academy (Community Trainer Program) uruchomionego pilotażowo 23 września, OpenAI planuje przeszkolić około 150 doradców, którzy poprowadzą trzygodzinne warsztaty w sieciach SBDC, stawiając sobie za cel dotarcie do co najmniej 1 000 małych firm w trybie stacjonarnym. Tego samego dnia w raporcie „Small Businesses, Bigger Capabilities” przedstawiono dane liczbowe dotyczące wykorzystania: w tygodniu od 9 do 15 września około 4 miliony pracowników firm zatrudniających poniżej 500 osób korzystało z produktów OpenAI, z czego niemal co piąty w firmie liczącej mniej niż 10 pracowników. W sierpniu tokeny wyjściowe z operacji agentowych, generowane zwłaszcza przez ChatGPT Work i Codex, stanowiły dwie trzecie tokenów wyjściowych małych firm, w porównaniu z jedną trzecią w kwietniu.

🔗 Wpis OpenAI na temat małych firm


Runway Ads: autonomiczny silnik do reklamy efektywnościowej

30 września — Runway wprowadza Runway Ads, narzędzie kompleksowo obsługujące warstwę kreatywną kampanii płatnych. Wystarczy podłączyć konto reklamowe i zestaw materiałów marki (brand kit): narzędzie, oparte na Runway Agent, generuje kreacje wideo i graficzne, publikuje zatwierdzone warianty na platformach Meta, Google i TikTok, analizuje ich wyniki i tworzy kolejną pulę kreacji skupioną wokół tego, co generowało wydatki. Lokalizuje każdą kreację według reguł ustalonych przez zespół, w tym tekst na ekranie, zmienia jej rozmiar dla każdego formatu, poddaje ją automatycznej weryfikacji zgodności z marką i przestrzega limitów budżetowych. Zatwierdzanie przez człowieka jest domyślnie włączone; automatyczną publikację można odblokować dla poszczególnych kampanii lub typów wariantów.

Wewnętrzny wskaźnik Runway, od lipcaWynik opublikowany we wpisie
Reklamy tygodniowood 77 do około 900
Zwrot z wydatków na reklamępodwojony
Konwersjaokoło +34%, stabilny wskaźnik klikalności
Koszt na subskrybenta−41%

Runway Ads jest obecnie w fazie pilotażowej u wybranych partnerów korporacyjnych. Tweet z zapowiedzią obiecuje szerokie wdrożenie w nadchodzących tygodniach i twierdzi, że narzędzie pozwoliło także dodać 100 milionów dolarów ARR (rocznego powtarzalnego przychodu) od lipca — liczba ta nie pojawia się we wpisie na blogu.

🔗 Wpis o Runway Ads · Tweet @runwayml


ElevenLabs wycenione na 22 miliardy dolarów po ofercie odkupu akcji o wartości 300 milionów

30 września — ElevenLabs sfinalizowało ofertę odkupu akcji pracowniczych (tender offer) o wartości 300 milionów dolarów, co wycenia firmę na 22 miliardy dolarów — dwukrotnie więcej niż przy wycenie z rundy serii D w lutym. Operacji przewodzą Wellington oraz T. Rowe Price; do grona inwestorów dołączają EQT, Goldman Sachs, GIC, OTPP, Sapphire Ventures oraz BDT & MSD, obok dotychczasowych inwestorów, takich jak Andreessen Horowitz, Lightspeed i ICONIQ. Klienci korporacyjni generują 55% przychodów: ElevenAgents obsługuje ponad 15 milionów rozmów tygodniowo (trzykrotnie więcej niż w lutym), a roczny powtarzalny przychód firmy w tym okresie wzrósł ponad trzykrotnie. Według analizy przeprowadzonej wśród klientów głosowi agenci rozwiązują zgłoszenia o 31% szybciej niż agenci tekstowi. Firma zatrudnia ponad 800 pracowników, cztery lata po pierwszej rundzie finansowania przy wycenie wynoszącej 9 milionów dolarów.

🔗 Wpis ElevenLabs


Vera Rubin NVL72 produkcyjnie w CoreWeave, Cognition odnotowuje do 4,8 razy wyższą przepustowość

30 września — Podczas konferencji CoreWeave Fully Connected w San Francisco NVIDIA szczegółowo opisała wdrożenie produkcyjne Vera Rubin NVL72 w CoreWeave: platforma wraz z siecią Spectrum-X Ethernet 102.4T jest dostępna w CoreWeave Cloud, która otrzymała swoje pierwsze szafy serwerowe produkcyjne wcześniej w tym miesiącu. Cognition, twórca Devina, jest pierwszym klientem uruchamiającym tam obciążenia produkcyjne: podczas wstępnych testów na zadaniach zaczerpniętych z FrontierCode odnotowano do 4,8 razy wyższą całkowitą przepustowość tokenów przy inferencji SWE-2 w porównaniu z GB200 NVL72. CoreWeave zaoferuje także procesor Vera CPU, zaprojektowany z myślą o agentach: 128 procesorów i 11 264 rdzenie na szafę, co pozwala na jednoczesne uruchamianie ponad 11 000 izolowanych środowisk z piaskownicami agentów uruchamiającymi się ponad trzykrotnie szybciej. CoreWeave wprowadza także CoreWeave Forge, które łączy Weights & Biases, OpenPipe oraz marimo, umożliwiając domknięcie pętli od produkcji z powrotem do trenowania; bezserwerowe uczenie przez wzmacnianie (serverless RL) ma być 1,4 raza szybsze przy kosztach niższych o 40%.

🔗 Wpis NVIDIA na temat CoreWeave i Vera Rubin


Agenci kodujący i narzędzia deweloperskie: Claude Code 2.1.286, Zed 1.22.0, Gemini CLI, VS Code 1.140, HydraFusion oraz serwer MCP dla gcloud

Claude Code 2.1.286: zakładki w VS Code, ograniczona liczba ponowień i zaostrzony tryb bare

30 września — Claude Code 2.1.286, wydany o 19:10 UTC, zawiera 88 pozycji na liście zmian, w tym 49 poprawek. Monit o uprawnienia wskazuje swoją pozycję w kolejce, gdy nakłada się na siebie kilka żądań („2 of 5”), a rozszerzenie do VS Code zyskuje zakładki (bookmarks) pozwalające zachować odpowiedzi Claude’a w panelu bocznym, wiersz Questions podsumowujący pytania zadane przez Claude’a i wybrane odpowiedzi oraz podglądy opcji w kartach pytań. Istotne są dwie zmiany w zachowaniu: pojedynczy limit obejmuje teraz ponowienia wywołań modelu, czyli maksymalnie 14 zapytań przy ustawieniach domyślnych, a --bare łączy się już wyłącznie z serwerami MCP wskazanymi w wierszu poleceń, bez przypomnień systemowych ani zadań w tle. Jeśli istnieje umiejętność o nazwie verify, Claude jest zachęcany do jej uruchomienia tuż przed każdym commitem, z wyjątkiem dokumentacji lub testów, a wtyczki odrzucają źródła npm będące repozytoriami git lub katalogami. Wreszcie, gdy API odrzuca model domyślny, Claude Code ponawia próbę raz na poprzednim modelu tego samego poziomu, zamiast kończyć niepowodzeniem przy każdej turze.

🔗 Informacje o wydaniu Claude Code 2.1.286

Zed 1.22.0: osobny model dla każdego podagenta

30 września — Zed udostępnia stabilną wersję 1.22.0, skupioną na podagentach: narzędzie spawn_agent przyjmuje opcjonalny parametr model, pozwalający uruchomić podagenta na innym modelu niż skonfigurowany lub odziedziczony po agencie nadrzędnym, a karta każdego podagenta wyświetla używany model. Podagenci automatycznie kompresują również swój kontekst, co według twórców Zeda pozwala im obsługiwać dłuższe zadania. Jeśli chodzi o modele, GPT-6.1 Sol trafia do obsługi w trybie BYOK z kluczem API OpenAI, Grok 4.7 przechodzi do wersji stabilnej jako zalecany model w SuperGrok i xAI, a lista modeli OpenCode Zen i Go jest pobierana w locie. Wydanie naprawia wyciek około 2 MB pamięci na każde zakończone polecenie w terminalu i zmienia skrót klawiszowy: zamykanie aktywnego doku przyjmuje postać ctrl-alt-w na wszystkich platformach. Łącznie 18 nowości i 37 poprawek.

🔗 Informacje o wydaniu Zed 1.22.0

Gemini CLI: stabilna wersja v0.62.0 i wersja wstępna wykonująca plany bez potwierdzenia

29 września — Gemini CLI publikuje wieczorem (UTC) dwa wydania. Wersja v0.62.0 osiąga stan stabilny o 21:17: jej 19 pozycji obejmuje zmiany z wersji poglądowej i wydań nightly z okresu od 16 do 24 września (ustrukturyzowane tytuły wywołań narzędzi MCP, zachowywanie tokena odświeżania OAuth (refresh token), Gemini 3.8 Flash i 3.5 Flash Lite). Nowość pojawia się w wersji poglądowej v0.63.0-preview.0, wydanej o 20:58: w trybie nieinteraktywnym agent tworzy teraz i realizuje swój plan bez oczekiwania na potwierdzenie (PR 29539), podczas gdy instrukcje trybu Plan Mode nakazywały mu dotąd odpowiadać jedynie krótką wiadomością potwierdzającą, bez żadnych wywołań narzędzi. Limit maxChars równy 0 lub mniejszy wyłącza także obcinanie danych wyjściowych narzędzi (PR 29542). Wydanie nightly z 30 września otwiera serię 0.64.0: w trybie ACP interfejs CLI w końcu poprawnie raportuje standardowe zużycie, podczas gdy klienci tacy jak Zed czy OpenHands zawyżali rozliczenia około 3-krotnie, jak wynika z PR 29549.

🔗 Gemini CLI v0.63.0-preview.0 · Gemini CLI v0.62.0

VS Code 1.140 przyjmuje Copilot harness

30 września — Visual Studio Code 1.140 debiutuje w wersji stabilnej z Copilot harness (Copilot harness): oparte na Copilot SDK rozwiązanie zapewnia agentowi VS Code zachowanie i możliwości aplikacji GitHub Copilot oraz Copilot CLI, a także działa w dedykowanym procesie hosta bazującym na protokole Agent Host Protocol, dzięki czemu do tej samej sesji można dołączyć z wielu okien; informacje o wydaniu ostrzegają, że dla niektórych użytkowników może być ono już domyślnie wybrane. W ramach funkcji eksperymentalnych sesje wielofolderowe przydzielają każdemu czatowi własny katalog lub drzewo robocze (worktree), a agent może oddelegować sesję do zdalnego hosta, dobieranego według systemu, pamięci, liczby procesorów oraz modelu. Dla przedsiębiorstw wprowadzono trzy mechanizmy kontroli: wyjaśnienie w czacie minimalnych wersji wymaganych przez administratora, domyślny poziom trybu Auto określany przez zarządzane ustawienie (autoTier) oraz dodawanie tożsamości użytkownika do danych OpenTelemetry Copilota — opcja ta jest domyślnie wyłączona.

🔗 Notes de version de VS Code 1.140

HydraFusion trafia do VS Code i aplikacji GitHub Copilot

30 września — GitHub rozszerza dostępność HydraFusion — mechanizmu orkiestracji wielu modeli udostępnionego 4 września w Copilot CLI — na VS Code (od wersji 1.140 lub w wydaniach Insiders) oraz aplikację GitHub Copilot, nadal w fazie research preview. HydraFusion wybiera się w selektorze tak jak model, lecz modelem nie jest: traktuje dobór przepływu pracy jako problem optymalizacyjny i wybiera jeden z trzech schematów. W trybie Single pojedynczy model rozwiązuje zadanie; w trybie Cascade wydajny model generuje treść, a mechanizm kontroli jakości akceptuje wynik lub przekazuje zadanie do mocniejszego modelu; w trybie Critique model recenzujący (w trybie tylko do odczytu, pochodzący z innej rodziny modeli) analizuje wynik, po czym model tworzący dokonuje jednej korekty. Podczas gdy tryb Auto dobiera jeden model na zapytanie, HydraFusion koordynuje pracę wielu modeli w ramach tej samej tury. Funkcja jest dostępna w planach Copilot Pro, Pro+, Business i Enterprise, przy czym w wersjach Business i Enterprise włączenie wydań poglądowych wymaga zgody administratora; GitHub nie podaje żadnych nowych danych liczbowych.

🔗 HydraFusion in VS Code and the GitHub Copilot app

Google Cloud otwiera w wersji zapoznawczej zdalny serwer MCP wykonujący polecenia gcloud i bq

Google Cloud dołącza do swoich zarządzanych zdalnych serwerów MCP rozwiązanie Google Cloud CLI remote MCP server w ramach publicznej wersji zapoznawczej. Grupuje ono setki poleceń narzędzi wiersza poleceń gcloud i bq (BigQuery) za dwoma narzędziami MCP: run_gcloud_command oraz run_bq_command. Google uzasadnia wybór wiersza poleceń dwoma argumentami: pojedyncze polecenie zamyka w sobie wieloetapowe operacje, które w przypadku API wymagałyby orkiestracji, a ponadto modele były intensywnie trenowane na publicznej dokumentacji tych poleceń. Zdalny serwer pozwala uniknąć instalowania interfejsu CLI w środowisku agenta, co udostępnia te operacje internetowym platformom agentowym, takim jak Gemini Enterprise. Polecenia wykonują się w izolowanej piaskownicy, za proxy o ograniczonym dostępie do sieci i bez poświadczeń domyślnych (ambient credentials), każde z uprawnieniami IAM tożsamości wywołującej, uwierzytelnionej przez Agent Identity lub OAuth 2.0; Model Armor może filtrować prompty i odpowiedzi, a każde wywołanie można rejestrować w dziennikach audytowych. Sam serwer nie jest dodatkowo płatny: rozliczane są wyłącznie utworzone zasoby oraz ewentualny transfer danych.

🔗 Empower your agents with the Google Cloud CLI remote MCP server (blog Google Cloud)


W skrócie

  • Codex CLI 0.159.2 — Opublikowana 29 września o 23:57 UTC wersja zawiera jedynie backportowaną poprawkę: w systemie Windows okna konsoli już nie migają, gdy Codex uruchamia procesy w tle lub polecenia w swojej piaskownicy. 🔗 źródło
  • Plaid w Amp — Tryby Amp korzystające z GPT-6 Astra zyskują Plaid, oparty na ultraszybkim poziomie OpenAI: zapytania do 6 razy szybsze przy 6-krotnie wyższym koszcie za token, zarezerwowanym dla wnioskowania dostarczanego przez Amp; podagenci pozostają przy prędkości fast lub standard, a Amp nie publikuje żadnego cennika. 🔗 źródło
  • Warp i Factories as Code — Warp przedstawia konfigurację swoich fabryk oprogramowania jako „Terraform dla agentów”: repozytorium opisuje agentów, automatyzacje, dostęp i pomiary. Format factory.yaml pochodzi z końca sierpnia; interaktywny przewodnik szczegółowo opisuje dostęp federacyjny do AWS lub GCP, webhooki oraz integracje ze Slackiem, Linearem czy Jirą. 🔗 wątek Warp · 🔗 przewodnik po konfiguracji
  • Devin w Crosby — W studium przypadku firmy Cognition nowojorska kancelaria prawna Crosby, licząca kilkunastu inżynierów na ponad 50 prawników, powierza Devinowi wstępną reakcję na incydenty: od 20 do 40 błędów i alertów analizowanych dziennie, w większości w około 5 minut, oraz co najmniej 50% mniej szumu w Sentry. 🔗 źródło
  • claude.dev — Anthropic oficjalnie prezentuje claude.dev jako dom dla programistów tworzących z Claude: analizy techniczne, przewodniki po Claude Code i API, działy Agents, Engineering, Playbooks i Skills oraz stronę Terminal w formie easter egga. Wpisy z tej witryny były udostępniane już od 22 września. 🔗 źródło
  • Edytowalne Witryny ChatGPT — Zgodnie z informacjami o wydaniu z 29 września opublikowaną Witrynę (Site) można edytować za pomocą Edit site i harmonogramować z poziomu Automations w planach Plus i Pro; w Enterprise prywatne Witryny mogą opierać się na połączonych aplikacjach, z ustawieniem Allow use in Sites dla poszczególnych wtyczek, domyślnie wyłączonym. 🔗 informacje o wydaniu ChatGPT · 🔗 informacje Enterprise i Edu
  • Kimi Work 3.2.15 — Wersja z 30 września wprowadza współedycję dokumentów Notion i Feishu przez człowieka i AI we wbudowanej przeglądarce, domyślnie zwija przebieg działań agenta i naprawia uszkadzanie plików podczas jednoczesnej edycji prezentacji PPT. 🔗 źródło
  • Cue zarządza finansami — Aplikacja osobistych agentów uruchomiona wraz z Manus 2.0 śledzi teraz subskrypcje oraz trendy wydatków i przełącza konta bankowe na autopilota za pośrednictwem Plaid; bez podania krajów, planu ani warunków. 🔗 źródło
  • GPT-6.1 Sol w Genspark — Dzień po premierze Genspark udostępnia GPT-6.1 Sol w AI Chat, Code Agent i Claw, powtarzając argumentację OpenAI (inteligencja zbliżona do Astry za jedną piątą jej ceny API), bez sprecyzowania planu ani kosztu w punktach. 🔗 źródło
  • Qwen3.8-27B-pi — Thomas Kim publikuje na licencji Apache-2.0 dostrojenie Qwen3.8-27B dla uprzęży Pi, które porządkuje poziomy wysiłku: w teście Terminal-Bench 2.1 poziom medium dorównuje modelowi bazowemu w xhigh (67 z 89 zadań) przy około 41% mniejszej liczbie tokenów wyjściowych. 🔗 źródło
  • Qwen3.8-27B w Nebius — Qwen informuje o pojawieniu się swojego gęstego modelu o 27 miliardach parametrów na platformie Nebius Token Factory, ogłoszonym 28 września, przeznaczonym do kodu, wyszukiwania i przepływów agentowych; nie podano cen ani przepustowości. 🔗 źródło
  • Bekko System One v0 — Yuichi Tateno publikuje trzy modele decyzyjne o 17M, 68M i 400M parametrów, z których dwa mniejsze działają w przeglądarce, oraz benchmark S1MB: model 400M uzyskuje 50,60 w porównaniu do 59,59 dla Jev 1.13, lecz 54,48 wobec 96,27 w generalizacji. 🔗 źródło
  • ZooWork Instinct Tuned 4B — SRP publikuje na licencji Apache-2.0 model decyzyjny o 4 miliardach parametrów, oparty na Qwen3.5-4B, który ocenia opcje w jednym przebiegu bez dekodowania: 198 z 231 (85,71%) w publicznych zadaniach JevBench, używanych podczas prac rozwojowych, jak precyzują autorzy. 🔗 źródło
  • Transformers v5.18.0 — Hugging Face dodaje cztery architektury: Nemotron 3 Diarization i NemotronH Omni firmy NVIDIA, HyperCLOVAX Vision V2 firmy NAVER oraz GTE, a także sygnalizuje sześć zmian wprowadzających niezgodność wsteczną. 🔗 źródło
  • TaskSmith — Adithya S K, zajmujący się środowiskami uczenia przez wzmacnianie w Hugging Face, publikuje orkiestrator przekształcający pull request w weryfikowalne środowisko RL: 50 środowisk zaczerpniętych z TRL, PEFT, Accelerate, Diffusers i Transformers, dostarczanych jako zadania Harbor. 🔗 źródło
  • TraceML 0.4.1 — To otwartoźródłowe narzędzie mierzy teraz całą grupę aktualizacji optymalizatora; na modelu ResNet-50 i GPU T4 oczekiwanie na dane spada z 23% kroku do poniżej 2 ms po dostrojeniu ładowania, przy medianie narzutu wynoszącej 0,35%. 🔗 źródło
  • Zapętlony transformator — Na zabawkowym modelu o 54 106 parametrach i 260 weryfikowalnych przypadkach, przy jednakowym budżecie 80 przebiegów bloków, jedna pętla uczy się 260 przypadków, dwie pętle średnio 125,3, a osiem 37,0: zwielokrotnienie przebiegów nie uczyniło uczenia bardziej ekonomicznym. 🔗 źródło
  • Ewaluacja, która potrafi powiedzieć „nie” — Samouczek Erica Meya pokazuje na przykładzie analizy sentymentu recenzji filmowych (SST-2) ewaluację odrzucającą model, który uzyskał wynik lepszy o 7 punktów na zbiorze testowym, ponieważ pewne kluczowe zachowanie ulega degradacji; jego skrypty wykonują się w mniej niż minutę na procesorze. 🔗 źródło
  • 10 000 syntetycznych ubezpieczonych — Intelligent Actuaries publikuje na licencji CC-BY-4.0 syntetyczne badanie wygaśnięć i wykupów ubezpieczeń na życie: 10 000 fikcyjnych ubezpieczonych na dziesięciu rynkach, czyli 27 692 rekordy poliso-lat z lat 2023–2025 w formacie badania SOA-LIMRA. 🔗 źródło
  • cuObject i SCADA Server SDK — NVIDIA ogłasza ogólną dostępność bibliotek cuObject umożliwiających dostęp do pamięci obiektowej przez RDMA z pominięciem pamięci procesora, oraz wprowadza SCADA Server SDK, stworzony prototypowo przez IBM z wykorzystaniem Storage Scale w ramach inicjatywy Storage-Next zrzeszającej ponad 40 podmiotów. 🔗 źródło
  • NeMo Relay i Hermes Agent — Samouczek firmy NVIDIA współautorstwa Tekniuma z Nous Research analizuje działanie agenta Hermes: w 108 uruchomieniach poprawki narzędzi zwiększają liczbę sukcesów Qwen3 Coder 30B z 19 do 22 na 27, kosztem 4,9 wywołania modelu zamiast 3,8. 🔗 źródło
  • OpenShell dla OpenClaw Enterprise — NVIDIA oferuje swoje otwartoźródłowe środowisko OpenShell do zarządzania agentami OpenClaw Enterprise — otwartoźródłową płaszczyzną kontroli dla agentów trwałych, ogłoszoną dzień wcześniej przez fundację OpenClaw wraz z Red Hatem, NVIDIĄ i OpenAI. 🔗 źródło
  • Wersje próbne GitHub Advanced Security — Klienci GitHub Team mogą samodzielnie uruchomić wersję próbną GitHub Code Security i GitHub Secret Protection z poziomu strony Overview organizacji, strony rozliczeń lub Risk Assessment; czasu trwania nie określono. 🔗 źródło
  • GHE.com i X25519 — Od 7 października 2026 r. GitHub Enterprise Cloud z rezydentnością danych będzie odrzucać klientów TLS oferujących wyłącznie X25519 do uzgadniania kluczy; P-256 i P-384 pozostają obsługiwane, a zmiana nie dotyczy SSH. 🔗 źródło
  • Dwa studia przypadków w Runway — Francuska marka napojów Bonjour wyprodukowała ponad 500 wariantów reklamowych za pomocą Runway i zaalokowała ponownie ponad 50 000 euro z budżetu produkcyjnego; World Juggling Federation powierzyła jednej osobie oprawę graficzną godzinnego programu dla ESPN. 🔗 Bonjour · 🔗 World Juggling Federation
  • Ad Variants w Luma — Luma promuje funkcję, która dostosowuje gotową reklamę do wielu rozmiarów i rynków w ramach tej samej kampanii, bez podania cen, planu taryfowego, daty premiery ani wpisu na blogu. 🔗 źródło
  • Microduck w produkcji — Pollen Robotics ogłasza, że 10 950 egzemplarzy Microducka — małego dwunożnego robota za 399 dolarów, wytrenowanego w symulacji, z otwartoźródłowym stosem uczenia przez wzmacnianie — opuści linię produkcyjną między 10 grudnia a 10 stycznia w cotygodniowych partiach. 🔗 źródło
  • Cognition rekrutuje — Twórca Devina wita Chrisa Degnana, byłego CRO w Snowflake, na stanowisku dyrektora ds. przychodów, dzień po dołączeniu Alexa Stamosa jako dyrektora ds. bezpieczeństwa informacji (CISO). 🔗 Chris Degnan · 🔗 Alex Stamos
  • Claude Founder House — Anthropic organizuje dni dla założycieli w San Francisco podczas SF Tech Week (od 6 do 8 października w Terra Gallery) oraz w Sztokholmie 14 października, oferując wykłady, warsztaty i spotkania z zespołem Applied AI. 🔗 źródło
  • AI Engineer Paris — Mistral podsumowuje wydarzenie, które odbyło się w poprzednim tygodniu w Station F: ponad 900 uczestników, 60 prelegentów, 57 prelekcji i 22 partnerów, bez zapowiedzi nowych produktów. 🔗 źródło
  • Stypendia doktoranckie NVIDIA — Zgłoszenia do programu Graduate Fellowship Program 2027–2028 są otwarte do 30 października 2026 r., z kwotą do 60 000 dolarów na doktoranta; od 2002 roku przyznano ponad 220 stypendiów. 🔗 źródło

Co to oznacza

Bezpieczeństwo wyznacza obecnie harmonogram modeli granicznych. Gemini 4 Argon kontynuuje logikę programu Fairwind: zaufani obrońcy cybernetyczni otrzymują go jako pierwsi, bez cybernetycznych zabezpieczeń, a pozostali dołączą „tak szybko, jak to możliwe”, bez podania daty — na czas wzmocnienia zabezpieczeń. Tego samego dnia OpenAI pokazuje drugą stronę medalu: chronić należy już nie tylko sam model, ale także proces jego rozumowania. Niezależnie od tego, czy stał za nią jeden podmiot, kampania, której trzon OpenAI przypisuje osobom powiązanym z Moonshot AI, czyni ze śladu rozumowania zasób wymagający obrony za pomocą technicznych środków zaradczych i wymiany informacji między laboratoriami a rządami.

Znaczna część dzisiejszych liczb pochodzi z pomiarów opracowanych lub przeprowadzonych przez samych ogłaszających. Cohere ocenia Embed 5 za pomocą metryki, którą publikuje tego samego dnia, i samo ostrzega, że jego modele mogą wypadać gorzej według starej miary; HeyGen opiera się na wewnętrznym rankingu Elo, Hunmin na autorskim protokole z pojedynczym uruchomieniem dla benchmarków agentowych, a w Reality Check to organizator dostroił modele. Z kolei Perplexity poddaje swój model ślepym testom na prywatnym benchmarku turbopuffera, a Open TTS Leaderboard oraz AURORA zastępują głosowania czy tłumaczenie maszynowe weryfikowalnymi zadaniami i pomiarami. Zanim porówna się dwa wyniki, warto sprawdzić, kto je wygenerował.

Generowanie obrazów i wideo jest coraz częściej oceniane przez pryzmat użyteczności oraz kosztów. Ideogram 4.5 nie obiecuje ładniejszego obrazu, lecz taki, który znosi seryjne poprawki; HeyGen Video sprzedawany jest na sekundy, taniej niż jakikolwiek model w jego cenniku, i pokazuje, że model bazowy pokroju MiniMax H3 może dać wyspecjalizowane warianty — od HeyGen po Creatify. Runway Ads domyka łańcuch aż po wydatki na reklamę, a wycena ElevenLabs, która podwoiła się od lutego, opiera się na popycie przedsiębiorstw na agentów konwersacyjnych.

Od strony programistów uprząż staje się pełnoprawnym produktem, odrębnym od samego modelu. VS Code przejmuje uprząż Copilota, aby zrównać swojego agenta z aplikacją i CLI, HydraFusion koordynuje wiele modeli w ramach jednej tury, Zed pozwala agentowi wybierać model dla każdego podagenta, a Manus otwiera swoją uprząż na klucze API zewnętrznych dostawców. Gemini CLI wykonuje teraz swoje plany bez udziału człowieka w trybie nieinteraktywnym, Claude Code zaostrza reguły --bare na potrzeby zastosowań skryptowych, a Google Cloud udostępnia narzędzia gcloud i bq agentom w piaskownicy z uprawnieniami IAM wywołującego. Popyt widać nawet na poziomie infrastruktury: pierwszym produkcyjnym klientem systemu Vera Rubin NVL72 w CoreWeave jest Cognition, twórca Devina.


Źródła