Szukaj

Jalapeño publikuje swoje pierwsze zmierzone wyniki, WebMCP Challenge łączy sześć platform, Perplexity uruchamia swojego agenta lokalnie

ai-powered-markdown-translator

Przetłumaczony artykuł z fr na pl za pomocą gpt-5.4-mini.

Zobacz projekt na GitHubie ↗

Pięćdziesiąt jeden ogłoszeń w ciągu dwudziestu czterech godzin, rozłożonych na dziewięć obszarów: dzień 25 sierpnia jest najintensywniejszy w tygodniu. Wyłaniają się z niego cztery ruchy. OpenAI publikuje pierwsze zmierzone wyniki Jalapeño, swojego własnego układu do inferencji, i od razu uruchamia dziesięciodniowy hackathon wokół WebMCP z Chrome, Cloudflare, Shopify, Vercel, Render i Netlify. Perplexity przenosi całość swojego agenta Computer na maszynę użytkownika. IBM otwiera Granite 4.2, swoją pierwszą rodzinę modeli rozumowania. A Anthropic ujednolica pamięć Claude między czatem a Cowork, czyniąc ją czytelną i edytowalną plik po pliku. Reszta — WeatherNext Cyclones w użyciu w National Hurricane Center, runda Seria B Stability AI, około dwudziestu aktualizacji narzędzi — znajduje się poniżej.


WebMCP : jeden standard, jego wsparcie produktowe, wewnętrzne zastosowanie i konkurs, który ma go rozruszać

25 sierpnia — OpenAI uruchamia WebMCP Challenge, dziesięciodniowy hackathon poświęcony wciąż eksperymentalnemu otwartemu standardowi, który zmienia sposób, w jaki agenci wchodzą w interakcję z siecią. Cel jest konkretny: dziś agent, który ma wykonać zadanie na stronie internetowej, musi zgadywać, jak poruszać się po interfejsie zaprojektowanym dla oczu i myszy. WebMCP odwraca logikę — sama strona udostępnia ustrukturyzowane narzędzia, do których agent wywołuje bezpośrednio.

Sam konkurs nie jest najbardziej znaczącym elementem ogłoszenia. To zgranie, które ono ujawnia: Chrome (Google), Cloudflare, Shopify, Vercel, Render i Netlify łączą siły z OpenAI wokół tego samego standardu. Ślad tego widać też w składzie jury: Sarah Drasner (Distinguished Engineer, Chrome), Andrew Galloni (VP Research & Innovation, Cloudflare), Jude Gao (zespół Next.js Core, Vercel), Ilya Grigorik (Distinguished Engineer, Shopify), Sean Roberts (VP of Applied AI, Netlify), Justin Rushing (Browser Agent Lead, OpenAI) oraz Alex Nahas, twórca MCP-B.

The WebMCP Challenge is here. We’ve teamed up with @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render, and @Netlify for a 10-day hackathon. Up for grabs: $35,000 in cash prizes, Codex Micros, ChatGPT Pro subscriptions, and more prizes from our supporters.

🇵🇱 WebMCP Challenge wystartował. Połączyliśmy siły z @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render i @Netlify, aby zorganizować dziesięciodniowy hackathon. Do zdobycia: 35 000 dolarów nagród pieniężnych, Codex Micro, subskrypcje ChatGPT Pro i inne nagrody od naszych partnerów.@OpenAIDevs na X

Harmonogram jest napięty, a kryteria oceny są jasno określone: użyteczność, oryginalność, wykonanie, przemyślane wykorzystanie WebMCP oraz jakość doświadczenia człowiek-agent. Zgłoszenia i nadsyłanie projektów odbywają się przez Devpost. OpenAI publikuje też demonstracyjne aplikacje natywne dla agentów, aby pobudzić projekty — modelowanie 3D sterowane przez agenta, wspólne pisanie, w którym agent komentuje pod własną tożsamością, generator spersonalizowanych krzyżówek, Wandernote do przekształcania notatek z podróży w plan trasy oraz eksplorację danych przez DuckDB-Wasm w przeglądarce. Start od istniejącej aplikacji i dodanie do niej WebMCP jest dozwolone.

Element konkursuZgłoszony szczegół
Czas trwania10 dni
Otwarcie zgłoszeń25 sierpnia 2026, 12:00 PT
Termin nadsyłania3 września 2026, 13:00 PT
Ogłoszenie zwycięzców23 września 2026 (data orientacyjna)
Łączna pula nagród35 000 dolarów
Nagroda dla laureata (top 10)3 000 dolarów, rok ChatGPT Pro, klawiatura Codex Micro, gadżety
Platforma zgłoszeńDevpost

Element produktowy, który sprawia, że standard staje się użyteczny na co dzień, pojawia się tego samego dnia: wbudowana przeglądarka desktopowej aplikacji ChatGPT oraz ChatGPT Sites potrafią już korzystać z WebMCP. Gdy ChatGPT lub Codex odwiedza kompatybilną stronę, agent wykrywa narzędzia udostępnione przez stronę i korzysta z nich automatycznie zamiast błądzić po interfejsie — konieczna jest aktualizacja do najnowszej wersji desktopowej aplikacji. Druga połowa pętli jest po stronie produkcji: można poprosić Codex o stworzenie aplikacji zgodnej z WebMCP, a następnie wdrożyć ją bezpośrednio w Sites. Warto też zauważyć asymetrię wsparcia z Chrome, gdzie WebMCP pozostaje za eksperymentalną flagą lub origin trial, podczas gdy przeglądarka ChatGPT obsługuje go natywnie.

Pozostaje trzeci wątek, najbardziej pouczający: OpenAI dokumentuje własne wewnętrzne zastosowanie. Inżynier firmy opowiada, jak przestał pisać automatyzację dla każdego zadania, aby zbudować Runme, internetową aplikację notebooków open source stworzoną do współpracy z Codex. Wpisuje tam krótki cel z jasnymi instrukcjami — sprawdzić poprzednie wykonanie, przygotować szczegółowy plan, czekać na zatwierdzenie przed rozpoczęciem, dokumentować wykonane polecenia i ich interpretację — a Codex czyta notebook i aktualizuje go w trakcie pracy. Dwa wybory architektoniczne zasługują na uwagę. Najpierw trwałość: notebooki są zapisywane w Google Drive, a Runme generuje równolegle towarzyszący indeks Markdown *.index.md, który Drive potrafi indeksować, dzięki czemu agent może odnaleźć poprzednie wykonanie jako kontekst operacyjny. Następnie ekspozycja możliwości: Runme jest aplikacją kliencką serwowaną statycznie, a dodanie serwera wyłącznie po to, by wystawić klasyczny punkt dostępu MCP, wprowadziłoby dodatkową infrastrukturę i przeniosłoby przetwarzanie danych notebooka. WebMCP pozwala aplikacji rejestrować swoje narzędzia bezpośrednio z poziomu przeglądarki.

🔗 WebMCP Challenge · Wsparcie w ChatGPT desktop i Sites · Codex, Runme i WebMCP w OpenAI


Jalapeño : OpenAI publikuje pierwsze liczby dotyczące swojego układu do inferencji i potwierdza strategię compute

25 sierpnia — OpenAI publikuje pierwsze zmierzone wyniki Jalapeño, pierwszego układu do inferencji, który zaprojektowała samodzielnie. Znaczenie ogłoszenia nie sprowadza się wyłącznie do surowych zysków, lecz do natury kompromisu, który ma ono znosić: istniejące systemy inferencji zazwyczaj muszą wybierać między przepustowością a opóźnieniem, podczas gdy Jalapeño deklaruje oba w jednej architekturze.

Pomiary opierają się na InferenceX, publicznym benchmarku SemiAnalysis, który symuluje pełne przetwarzanie zapytania. Przetestowano trzy otwarte modele — GPT-OSS 120B, DeepSeek R1 670B i Kimi K2.5 1T — w zestawieniu z systemami komercyjnymi. Wybór normalizacji względem wata, a nie układu, jest wyraźny i wygodny: Jalapeño zużywa dwa razy mniej niż systemy, z którymi jest porównywana. Jalapeño jest ogłoszona na 700 W, a zmierzone stałe zużycie utrzymało się na poziomie 550 W lub mniej w testowanych obciążeniach, wobec 1 200 W dla GB200 i 1 400 W dla GB300.

Oceniany model (porównywany system)Szczytowa przepustowość na kWOpóźnienie end-to-endMinimalne TBT
GPT-OSS 120B (GB200, 1 200 W)≈1,9x (85 448 vs 44 960)≈1,7x (1,03 s vs 1,80 s)≈2,7x (0,69 vs 1,87 ms)
DeepSeek R1 670B (GB300, 1 400 W)≈1,7x (19 641 vs 11 781)≈3,6x (1,65 s vs 5,99 s)≈4,1x (1,43 vs 5,90 ms)
Kimi K2.5 1T (GB300, 1 400 W)≈1,5x (18 195 vs 11 862)≈3,4x (1,56 s vs 5,31 s)≈3,8x (1,44 vs 5,48 ms)

Dla wszystkich trzech modeli OpenAI deklaruje od 1,5 do 1,9 razy więcej pracy AI na wat przy szczytowej przepustowości oraz od 1,7 do 3,6 razy mniejsze opóźnienie end-to-end niż w systemach porównawczych, a także nawet od 2,1 do 4,1 razy lepszą wydajność przy bardzo interaktywnych obciążeniach. Technicznie zyski wynikają ze współprojektowania układu, pamięci, sieci, oprogramowania i systemu na poziomie racka. Inferencja przechodzi przez dwie fazy o różnych gardłach: prefill, który przetwarza prompt i nasyca obliczenia, oraz decode, który generuje tokeny pojedynczo i zależy przede wszystkim od przepustowości pamięci. Jalapeño stara się minimalizować przesuwanie danych, a stan modelu — łącznie z cache KV — może być umieszczony jawnie i utrzymywany lokalnie, podczas gdy system aktywuje właściwą kombinację obliczeń, pamięci i sieci w zależności od fazy.

Najciekawszy dla programisty jest jednak udział AI w samym projektowaniu układu. OpenAI podaje, że od projektu początkowego do tapeoutu minęło dziewięć miesięcy, dzięki skróceniu pętli projektowania, pomiaru i weryfikacji. Układ został pomyślany jako przewidywalny cel programistyczny zarówno dla AI, jak i dla ludzi: praca opisywana przez lokalne tensory, jawna komunikacja, przewidywalna synchronizacja. Z Codex i GPT-Astra zespół w dwa miesiące przeniósł trzy modele z otwartymi wagami, których nie było w pierwotnym planie produkcyjnym, a w wybranych blokach attention i mixture-of-experts GPT-OSS generowane przez AI jądra działają 1,5 do 1,8 razy szybciej niż implementacje napisane przez ludzkich ekspertów. Warto zachować tu niuans: liczby te dotyczą wybranych bloków, a nie całego modelu. Harmonogram pozostaje ostrożny — trwają kwalifikacje produkcyjne, oprogramowanie nadal dojrzewa, wdrożenie do infrastruktury OpenAI zapowiedziano na koniec roku, Gen 2 jest w zaawansowanym rozwoju, a Gen 3 zaczyna się wyłaniać.

Tego samego dnia Sarah Friar publikuje wpis, który wyjaśnia ekonomiczną logikę stojącą za tym wszystkim. Deklaruje w nim szeroki portfel compute — Microsoft i NVIDIA jako fundament, uzupełnione przez AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy i SoftBank — z argumentem zarówno handlowym, jak i technicznym: zachowanie wiarygodnego wyboru między dostawcami pozwala kierować każde obciążenie do najlepszego stosunku wydajności do ceny i utrzymywać dyscyplinę cenową. Konkretna liczba towarzyszy temu wywodowi: w Artificial Analysis Coding Agent Index GPT-5.6 Sol przy maksymalnym rozumowaniu osiąga nowy rekord, zużywając przy tym o 54% mniej tokenów wyjściowych niż inny czołowy model. Tekst otwarcie przyjmuje też paradoks Jevonsa — uczynienie inteligencji tańszą nie zmniejsza jej zużycia, lecz rozszerza zakres opłacalnych zastosowań. Po stronie infrastruktury Project Camellia w Georgii jest przedstawiany z obiegiem zamkniętym dla wody i zobowiązaniami podlegającymi corocznemu publicznemu niezależnemu audytowi. OpenAI wyjaśnia, że będzie nadal szeroko wdrażać akceleratory NVIDIA i innych partnerów, zarówno do treningu, jak i do inferencji.

🔗 Jalapeño — pierwsze wyniki · The full stack behind abundant intelligence


Perplexity Portable Computer: wszystko działa na maszynie, z potwierdzającymi to benchmarkami

25 sierpnia — Perplexity uruchamia Portable Computer, odmianę swojego agenta Computer, która działa w całości na komputerze użytkownika. Zmiana jest bardziej architektoniczna niż kosmetyczna: lokalnie uruchamia się nie tylko model, ale cały łańcuch orkiestracji — orkiestrator, planista, router narzędzi, harmonogram, trwała kolejka zadań i lokalny indeks wyszukiwania.

Dziś uruchamiamy Portable Computer na @NVIDIA DGX Spark.

Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency.

🇵🇱 Dziś uruchamiamy Portable Computer na @NVIDIA DGX Spark. Portable Computer to w pełni lokalna wersja Perplexity Computer, w której całe środowisko wykonawcze — orkiestrujący LLM, LLM podagentów, szkielet agenta — działa na waszym lokalnym sprzęcie. Żadnych zależności od chmury.@perplexity_ai na X

Ogłoszenie zostało przygotowane wspólnie z NVIDIA i najpierw kieruje się na DGX Spark — platformę Grace Blackwell GB10, CPU Arm z 20 rdzeniami, GPU NVIDIA, 128 GB pamięci zunifikowanej — z zapowiedzianym rozszerzeniem na komputery z GPU RTX. Do wyboru są dwa modele, Qwen 3.8 27B lub PPLX 27B, czyli wersja modelu Qwen po post-treningu wykonanym przez Perplexity, a NVIDIA Nemotron 3.5 Lightning, otwarty model 30B, ma dołączyć do selektora. Praca wykonywana lokalnie nie zużywa żadnych kredytów. Eskalacja do chmury nadal jest możliwa — aktualne informacje, przeglądarka, połączone aplikacje albo jeden z 15 modeli frontier i więcej — ale wymaga wyraźnej zgody użytkownika. Łączniki Google Drive, Gmail, Slack i GitHub działają z urządzenia, dyktowanie odbywa się lokalnie przez NVIDIA Nemotron 3.5 ASR Model bez opuszczania maszyny przez dźwięk, a wykonywanie kodu odbywa się w odizolowanym piaskownicowym środowisku (sandbox). Portable Computer jest zarezerwowany dla subskrybentów Pro i Max posiadających DGX Spark, najpierw na Linuxie, potem na Windows, z instalacją jednym kliknięciem z poziomu aplikacji.

Tego samego dnia zespół inżynierów publikuje dane, które dokumentują to uruchomienie. Teza brzmi, że model i szkielet (harness) muszą być projektowane razem: generyczne szkielety zakładają, że model frontier poradzi sobie z długim kontekstem i planowaniem na szerokim horyzoncie, co słabiej wychodzi modelom lokalnym.

Zmierzony benchmarkComputer (Qwen 3.8 27B)PiHermesComputer + PPLX 27B
Local Knowledge Work Bench (53 zadania)82,6 %77,6 %74,0 %85,4 %
BrowseComp (1 266 zadań)66,7 %50,2 %43,9 %
ParseBench-100 (dokumenty multimodalne)65,1 %13,9 %34,6 %

Na BrowseComp Computer zużywa przy okazji o 61 % mniej czasu i o 16 % mniej tokenów niż Hermes oraz o 51 % mniej czasu i 70 % mniej tokenów niż Pi. Cztery decyzje projektowe tłumaczą tę różnicę: minimalny prompt systemowy, możliwości modularne w postaci skills ładowanych i rozładowywanych w trakcie trajektorii, często używane łączniki (Gmail, GitHub, Outlook, Google Calendar) zamienione na kompaktowe narzędzia wiersza poleceń zamiast udostępniane przez serwery MCP, których definicje pochłaniają kontekst, oraz zawsze aktywne, niekonfigurowalne piaskownicowe środowisko — jeśli jest niedostępne, szkielet wyłącza się przed jakimkolwiek wywołaniem narzędzia zamiast przechodzić do niewyizolowanego wykonania. Perplexity odnotowuje też praktyczną obserwację: Qwen 3.8 27B deklaruje okno 260K tokenów, ale empirycznie zaczyna mieć trudności powyżej 100K.

Terminal Bench 2.1 (89 zadań)WynikKoszt API na wykonanie
Qwen 3.8 27B, 100 % lokalnie59,6 %około 0
Qwen 3.8 27B + porada Claude Opus 573,0 %0,415 USD
Claude Opus 5 samodzielnie82,4 %0,65 USD

Mechanizm eskalacji do modelu doradczego (advisor) jest najciekawszym elementem raportu: odzyskuje około trzy piąte różnicy względem frontier za mniej więcej dwie trzecie jego kosztu, a decyzja pozostaje w rękach użytkownika. Przed każdym wywołaniem szkielet wybiera odpowiedni kontekst, stosuje klasyfikator danych osobowych i pokazuje użytkownikowi, co opuściłoby urządzenie; model doradczy zwraca wyłącznie tekst i nie ma bezpośredniego dostępu ani do plików, ani do narzędzi. Post-trening PPLX 27B łączy z kolei dostrajanie przez odrzucanie (rejection fine-tuning), a następnie uczenie ze wzmocnieniem na syntetycznych środowiskach uruchamianych w kontenerach Docker, bez jakichkolwiek rzeczywistych danych użytkownika. Zapowiedziano raport techniczny oraz udostępnienie benchmarku ewaluacyjnego w open source.

🔗 Lokalne benchmarki szkieletu · Portable Computer — wpis Perplexity


Claude: jedna pamięć między chatem a Cowork, czytelna plik po pliku

25 sierpnia — Anthropic usuwa granicę między dwiema pamięciami, które dotąd współistniały. To, co Claude pamięta z waszych rozmów w czacie, jest teraz dokładnie tym samym, czym dysponuje w Claude Cowork, i odwrotnie jest również prawdą. W praktyce, gdy Cowork wykonuje zadanie w chmurze, startuje z kontekstem nagromadzonym przez miesiące: priorytetami na kwartał, stanem zaawansowania projektów, preferencjami redakcyjnymi rozmówcy. Anthropic podaje celowo przyziemne przykłady — poprosić o status dla swojego przełożonego bez konieczności doprecyzowania, o kogo chodzi i jak ta osoba lubi otrzymywać informacje.

Druga zmiana jest subtelniejsza, ale zmienia codzienne zachowanie: pamięć aktualizuje się w trakcie rozmowy, a nie na podstawie streszczenia wygenerowanego po fakcie. Wystarczy wspomnieć, że termin został przesunięty na wrzesień, by kolejna rozmowa to uwzględniła. Formuła „zapamiętaj to” nadal pozostaje dostępna, aby wymusić zapis konkretnego elementu, a pamięć można w każdej chwili wstrzymać lub zresetować.

Jeśli chodzi o przejrzystość, Anthropic wybrał reprezentację czytelną zamiast czarnej skrzynki: wszystko, co Claude zapamiętuje, pojawia się w postaci krótkich plików, pogrupowanych tematycznie, w Ustawieniach, a następnie w Pamięci. Każdy z nich można przeczytać, poprawić lub usunąć. Praktyczna korzyść jest natychmiastowa — poprawienie starej nazwy swojej firmy w jednym pliku wystarcza, by wszystkie kolejne rozmowy używały właściwej.

Obsługa tematów wrażliwych jest najciekawszym punktem z perspektywy decyzji produktowych. Domyślnie Claude nie zapamiętuje tego, co dotyczy zdrowia, pochodzenia, etniczności, przekonań religijnych, poglądów politycznych ani tożsamości płciowej. Anthropic przyznaje jednak, że granica jest osobista, i oferuje opcjonalne ustawienie pozwalające uwzględniać te tematy — tak, by Claude mógł przypomnieć sobie nietolerancję glutenu, gdy proponuje przepisy. To ustawienie nie działa wstecz i można je wyłączyć w dowolnym momencie. Jedna kategoria pozostaje wykluczona niezależnie od ustawienia: numery identyfikacyjne, historia karna, status migracyjny oraz szerzej wszystko, co narusza Zasady dopuszczalnego użytkowania. Claude wyraźnie sygnalizuje, kiedy nie może zapisać informacji tego typu, co jest decyzją projektową faworyzującą widoczną odmowę zamiast cichego filtrowania.

Aspekt pamięciOpisane zachowanie
ZakresJedna wspólna pamięć dla chatu i Claude Cowork
Moment aktualizacjiW trakcie rozmowy, zamiast podsumowania po jej zakończeniu
Format przechowywaniaKrótkie pliki pogrupowane tematycznie, czytelne i edytowalne osobno
Tematy wrażliweDomyślnie nie są zapamiętywane, można je włączyć ustawieniem, bez efektu wstecznego
Stałe wykluczeniaNumery identyfikacyjne, historia karna, status migracyjny
Plany Free, Pro i MaxPamięć aktywna domyślnie w sieci, na komputerze i na urządzeniach mobilnych
Plany Team i EnterpriseOtwierana przez administratora, wyłączona dla użytkownika do czasu aktywacji

🔗 Pamięć Claude działa wszędzie · Ogłoszenie @claudeai


IBM otwiera Granite 4.2, swoją pierwszą rodzinę modeli do rozumowania, oraz dwa modele ASR 470M

25 sierpnia — IBM publikuje Granite 4.2, przedstawioną jako pierwszą rodzinę gęstych modeli językowych typu decoder-only, zaprojektowanych wprost do rozumowania. Podczas gdy poprzednie generacje stawiały na wydajność i klasyczne zadania biznesowe, ta wersja umieszcza rozumowanie w centrum i czyni je modułowym: każdy model udostępnia trzy tryby — thinking, non-thinking oraz low-effort — które aplikacja wybiera w zależności od budżetu opóźnienia i tokenów, jaki jest gotowa opłacić. Trzy rozmiary (3B, 8B, 30B) współdzielą tę samą architekturę i ten sam pipeline, więc przejście między nimi jest bezbolesne po stronie integracji.

Architektura pozostaje klasyczna: uwaga GQA z 40 głowami dla 8 głów KV, RoPE z θ równym 10 milionów, aby utrzymać kontekst 131 072 tokenów, MLP SwiGLU, normalizacja RMSNorm, trening w bfloat16 na klastrze NVIDIA GB200 NVL72 hostowanym przez CoreWeave. Pre-trening startuje od zera na około 15 000 miliardach tokenów podzielonych na pięć faz. To, co naprawdę wyróżnia Granite 4.2, to post-trening: pipeline wzmocnienia złożony z wyspecjalizowanych etapów zamiast pojedynczego przebiegu, w asynchronicznym GRPO z przyciętym próbkowaniem ważonym, tak że połówki generująca i trenująca pętli nigdy nawzajem się nie blokują. Curriculum obejmuje trzy przebiegi RLVR z weryfikowalnymi nagrodami, ukierunkowane wzmacniacze dla śledzenia instrukcji i kodu, dwa etapy software engineering w kontekście 128K, etap terminalowy, etap wyszukiwania, a następnie wyrównanie RLHF. Blok wzmocnienia agentowego jest stosowany wyłącznie do modeli 8B i 30B, co wyjaśnia różnicę w wydajności kodowania agentowego między 3B a jego większymi braćmi.

Benchmark opublikowany przez IBM3B Dense8B Dense30B Dense
SWE-Bench Verified47,6757,00
SWE-Bench Multilingual30,7841,89
Terminal-Bench 2.120,5629,24
τ³-bench45,7858,0662,00
AIME2578,3386,6789,17
GPQA54,8064,1466,41
LiveCodeBench v669,7173,2475,77
MMLU-Pro67,8474,0477,60
RULER 128K55,3071,4181,38

Publikacja nie ogranicza się do wag bfloat16: cztery warianty skwantyzowane towarzyszą wydaniu dla vLLM — dynamiczne FP8 na kanał bez kalibracji, NVFP4 i MXFP4 przez GPTQ skalibrowane na 2 000 próbkach SFT — a także czternaście formatów GGUF dla llama.cpp, od Q2_K do Q8_0. Obsługiwanych jest dwanaście języków, w tym francuski, a trzy szkielety kodowania agentowego są udokumentowane już pierwszego dnia: OpenCode, Pi i OpenHands. W kwestii jakości danych IBM opisuje łańcuch, w którym GPT-OSS-120B i Gemma 4 służą jako sędziowie oceniający próbki SFT, przed lokalną i globalną deduplikacją za pomocą haszowania SHA-256.

Tego samego dnia IBM publikuje Granite Speech 5.0 Turbo CTC, dwa modele rozpoznawania mowy angielskiej o 470 milionach parametrów, różniące się wyłącznie danymi treningowymi i licencją — Apache 2.0 dla wariantu standardowego, CC-BY-NC-SA-4.0 dla wariantu trenowanego na dodatkowych danych. Zmiana architektury jest znacząca: wcześniejsze Granite Speech łączyły encoder akustyczny, projektor i LLM, natomiast te są wyłącznie encoderami. Stos nakłada 16 bloków Conformer, stosuje auto-conditioning na wyjściu ósmego bloku, zastępuje uwagę iloczynem skalarnym uwagą blokową (chunkwise), aby uniknąć kwadratowej skalowalności, i optymalizuje bezpośrednio stratę CTC. Prawdziwą nowością jest liczba tokenów: operacje podpróbkowania zmieniają strumień z 100 ramek na sekundę na wyjściu spektrogramu log-Mel do 12,5 na sekundę, co wyjaśnia „Turbo” w nazwie. Wyniki są raportowane na OpenASR Leaderboard i FFASR Leaderboard dla pola dalekiego, z wykresami Pareto szybkość/dokładność zamiast pojedynczych wyników, oraz z demonstracją ciągłego rozpoznawania uruchamianą w przeglądarce przez WebGPU, ograniczoną do Chrome i Edge.

🔗 Granite 4.2 — ścieżka techniczna · Granite Speech 5.0 Turbo CTC


WeatherNext Cyclones, pierwszy model AI używany w czasie rzeczywistym przez National Hurricane Center

25 sierpnia — Google AI opisuje WeatherNext Cyclones, model prognozowania cyklonów tropikalnych pochodzący z Google DeepMind i Google Research. Ogłoszenie jest godne uwagi mniej ze względu na surową wydajność niż z powodu tego, co mówi o przejściu meteorologicznej AI z laboratorium do operacyjnego użycia.

Atakowany problem ma charakter strukturalny. Dotychczas śledzenie cyklonu wymagało kompromisu: modele fizyczne uruchamiane na superkomputerach dobrze oddają duże struktury atmosferyczne przemierzające planetę, ale zrozumienie lokalnej, intensywnej fizyki decydującej o sile burzy wymuszało przejście na zupełnie inne modele regionalne. WeatherNext Cyclones eliminuje to przełączanie, przewidując jednocześnie trajektorię, intensywność i rozmiar.

Zapowiadany zysk to pełny dzień dodatkowego wyprzedzenia względem poprzednich systemów. Google ujmuje porównanie w wymowny sposób: prognozy trzydniowe osiągają dziś dokładność dawnych prognoz dwudniowych, co historycznie wymagało dekady postępu metodologicznego. Drugą korzyścią jest charakter probabilistyczny: model jest wystarczająco szybki, by generować do 1 000 symulacji na burzę, zastępując pojedynczą „najbardziej prawdopodobną” trajektorię wachlarzem scenariuszy. Dzięki temu szybkie nasilanie staje się bardziej czytelne, definiowane jako wzrost maksymalnych podtrzymywanych wiatrów o co najmniej 30 węzłów w ciągu 24 godzin. W tym roku 1 000 probabilistycznych prognoz na burzę jest dostarczanych synoptykom za pośrednictwem WeatherLab.

Najbardziej znaczący pozostaje rzeczywisty deployment. Podczas sezonu huraganowego 2025 WeatherNext Cyclones został poddany próbie w ramach amerykańskiego National Hurricane Center — po raz pierwszy ta instytucja używa modeli AI w operacjach czasu rzeczywistego. Meteorolodzy korzystali z niego, by wyznaczyć prognozę lądowania huraganu Melissa w kategorii 5 na Jamajce, dając lokalnym władzom dodatkowy czas na przygotowania. Artykuł ukazał się w Nature, a Google zapowiada publikację kodu i wag modelu w open source na GitHubie.

Aspekt modeluWkład WeatherNext Cyclones
Prognozowane wielkościTrajektoria, intensywność i rozmiar w jednym przebiegu
Zysk wyprzedzeniaJeden dzień; prognoza 3-dniowa = dokładność dawnej 2-dniowej
Symulacje na burzęDo 1 000
Wdrożenie operacyjneU.S. National Hurricane Center, sezon huraganowy 2025
Udokumentowany przypadekLądowanie huraganu Melissa kategorii 5 na Jamajce
Próg intensyfikacjiPonad 30 węzłów maksymalnych podtrzymywanych wiatrów w 24 h
Tryb udostępnieniaWeatherLab; kod i wagi w open source na GitHubie

🔗 Ogłoszenie @GoogleAI · Wpis Google DeepMind


Stability AI zamyka rundę B na 76 milionów dolarów z EA, Sony Music, Universal i Warner

25 sierpnia — Stability AI ogłasza zamknięcie rundy B: 76 milionów dolarów świeżego kapitału, co podnosi łączne finansowanie do 232 milionów od przejęcia kontroli nad firmą przez Prem Akkaraju w czerwcu 2024 roku, łącznie z dwiema rundami udziałowymi i obligacjami zamiennymi. Kwota pozostaje skromna jak na skalę sektora, ale prawdziwym tematem jest skład inwestorów.

Do kapitału wchodzą cztery ciężkie marki rozrywki: Electronic Arts w obszarze gier, Sony Music Group, Universal Music Group i Warner Music Group w muzyce. Trzy największe wytwórnie płytowe są teraz akcjonariuszami tego samego laboratorium. Dołączają też AMD Ventures i Pacific Alliance Ventures. Ci inwestorzy nie pojawiają się znikąd: EA, Universal i Warner były już strategicznymi partnerami Stability AI od jesieni 2025 roku. Runda zamienia więc istniejące umowy handlowe w udziały kapitałowe.

Drugi sygnał dotyczy lojalności inwestorów finansowych. Coatue, Greycroft, Kadmos Capital, Sean Parker i Eric Schmidt dokładają kapitał po raz drugi z rzędu pod nowym kierownictwem — co, po burzliwym okresie, przez jaki Stability AI przeszło w 2023 i 2024 roku, stanowi potwierdzenie. Thomas Laffont, współzałożyciel Coatue, dołącza do rady nadzorczej, w której zasiadają już James Cameron, Sean Parker, Dana Settle i Prem Akkaraju.

This unmatched group of investors is an affirmation of our vision where generative AI empowers every producer, musician, and storyteller. Stability is unique in the AI field because we are creative people making tools for creatives.

🇵🇱 Ta wyjątkowa grupa inwestorów potwierdza naszą wizję: generatywnej AI, która daje możliwości każdemu producentowi, muzykowi i opowiadaczowi historii. Stability jest wyjątkowe w dziedzinie AI, ponieważ jesteśmy twórcami budującymi narzędzia dla twórców. — Prem Akkaraju, CEO Stability AI, komunikat z 25 sierpnia

Przyjęta strategia to model niszowego laboratorium: nie model ogólny, lecz narzędzia dla profesjonalistów kreatywnych, budowane razem z podmiotami posiadającymi prawa, a nie przeciwko nim. To dokładnie kierunek Stable Audio 3.0, rodziny modeli z otwartymi wagami, trenowanej na w pełni licencjonowanych danych, rozszerzonej 18 sierpnia o wtyczkę do stacji roboczych audio. Pieniądze mają finansować kolejne produkty, badania stosowane i dział usług profesjonalnych.

🔗 Ogłoszenie @StabilityAI


ChatGPT po stronie przedsiębiorstw: wtyczka Admin, rozszerzenie wieloprzeglądarkowe i miejsce Premium za 100 dolarów

25 sierpnia — Trzy ogłoszenia OpenAI kierują się do tej samej grupy odbiorców: organizacji wdrażających ChatGPT i Codex na dużą skalę.

Najbardziej istotna jest wtyczka Admin dla ChatGPT Work i Codex, która łączy w jednej rozmowie to, co dotąd wymagało przechodzenia między pulpitami analitycznymi, ekranami ustawień i raportami. Zakres obejmuje codzienne zadania: zrozumienie adopcji i zużycia kredytów, wykrywanie członków lub grup zbliżających się do limitów, zarządzanie dołączeniami i odejściami, sprawdzanie faktycznych uprawnień i diagnozowanie problemów z dostępem, dostosowywanie limitów użycia oraz rozpatrywanie próśb o wydatki w odniesieniu do rzeczywistego zużycia. Najciekawsza jest automatyzacja bez pisania kodu: oczekujące prośby o użycie mogą być kierowane do Slacka lub Microsoft Teams w celu zatwierdzenia w narzędziu, którego walidatorzy już używają, a prośby o dostęp do funkcji mogą być przyznawane automatycznie, gdy spełniają z góry zdefiniowane kryteria, przy czym wyjątki trafiają do człowieka. Strukturalnie ważny punkt po stronie bezpieczeństwa: wtyczka działa w obrębie istniejącej roli i uprawnień użytkownika i nie rozszerza żadnego dostępu, a każde polecenie jest mapowane na obsługiwaną akcję odczytu lub zapisu ze strukturalnym wynikiem. OpenAI przytacza własne użycie — agent ChatGPT Work w Slacku obsługuje wewnętrzne prośby IT, a wdrożone przepływy pracy rozwiązują około 45% wolumenu zgłoszeń, likwidując backlog w momencie, gdy wolumen wsparcia mniej więcej się podwoił.

Drugie ogłoszenie: rozszerzenie przeglądarkowe ChatGPT wychodzi poza Chrome i obsługuje Microsoft Edge, Brave, Opera oraz Vivaldi. Zmiana ma znaczenie dla osób pracujących w alternatywnej przeglądarce z wyboru prywatności albo z konieczności wynikającej z polityki firmy. Wyróżniono dwa zastosowania: przenoszenie kontekstu otwartych kart do zadania za pomocą wzmianki @ tab w ChatGPT Desktop, tak aby Codex pracował na podstawie już wyświetlanej dokumentacji lub zgłoszenia; oraz pozwolenie agentowi sterować przeglądarką w celu wykonywania konkretnych zadań webowych, przy czym anulowanie subskrypcji pojawia się wśród podanych przykładów.

Trzecie ogłoszenie, bardziej lakoniczne: miejsce Premium za 100 dolarów dołącza do oferty ChatGPT Business, pozycjonowanej dla małych firm i startupów z planem przedstawianym jako elastyczny i skalowalny wraz z rozmiarem zespołu. Ogłoszenie zostało opublikowane na X bez szczegółowego wpisu na blogu, a dokładny skład tego miejsca nie został określony w komunikacie.

🔗 Wtyczka Admin · Rozszerzenie wieloprzeglądarkowe · Miejsce Premium ChatGPT Business


NVIDIA: Gamescom dla RTX Spark i SANA, która zmniejsza latencję MiniMax H3 27-krotnie

25 sierpnia — NVIDIA wykorzystuje Gamescom, odbywający się w tym tygodniu w Kolonii, by rozbudować katalog RTX Spark, swojej platformy komputerów z Windows, oczekiwanej tej jesieni. Electronic Arts, Embark Studios i Ubisoft dołączają do KRAFTON, NetEase, Riot Games i XBOX, które zadeklarowały się już podczas COMPUTEX w maju. Wymienione tytuły obejmują różne wymagania techniczne: EA SPORTS F1 25 i Apex Legends po stronie EA, Anno 117: Pax Romana w Ubisoft, ARC Raiders i THE FINALS w Embark Studios.

Najbardziej konkretny punkt dotyczy antycheata. Uruchomienie gry nie wystarcza: duże tytuły sieciowe zależą od systemów antycheatowych, które muszą zostać przeniesione na każdą platformę, inaczej gra pozostaje niegrywalna w trybie wieloosobowym. NVIDIA ogłasza współpracę z EA, aby natywnie przenieść EA Javelin Anticheat na RTX Spark — właśnie tego typu szczegół infrastrukturalny decyduje o realnej adopcji nowej platformy PC. Po stronie renderingu DLSS 4.5 Ray Reconstruction jest dostępne natychmiast, z modelem transformer drugiej generacji, który zastępuje klasyczne odszumiacze siecią trenowaną na superkomputerze. Path tracing trafia do CONTROL Resonant i 007 First Light, Gears of War: E-Day integruje RTX Mega Geometry, a technologie NVIDIA ACE są zapowiedziane w Aniimo na początek 2027 roku.

Druga odsłona tego samego gracza, z 24 sierpnia, jest bardziej techniczna. MiniMax relacjonuje wyniki osiągnięte przez zespół SANA firmy NVIDIA na Sol Engine zastosowanym do jego modelu wideo H3: dziesięć sekund wideo w 768p generowane na jednym GB200 spada z 414 sekund do 14,93 sekundy, czyli przyspieszenie wynosi 27,7x. Metoda nie opiera się na optymalizacji jąder, lecz na podziale generowania na dwa przebiegi — szkic w niskiej rozdzielczości tworzony przez H3 w 4 krokach, a następnie etap dopracowania do docelowej rozdzielczości powierzony LTX w 3 krokach z Sol-Attn. Łącznie siedem kroków. Drugą dźwignią jest zastąpienie kosztownych dekodowań VAE przez TAEH3 i TAEHV, lżejsze dekodery, przy jednoczesnym utrzymaniu latentów w stabilnym stanie na potrzeby etapu dopracowania.

Pomiar na MiniMax H3Zmierzona wartość
Mierzony ładunek10 s wideo w 768p, jeden GB200
Latencja przed414 s
Latencja po14,93 s
Współczynnik przyspieszenia27,7x
Kroki generowania4 (szkic H3 w niskiej rozdzielczości) + 3 (LTX)
Zastąpione dekoderyTAEH3 i TAEHV zamiast dekodów VAE
Przepustowość na węzeł378 000 wideo miesięcznie, ponad 97% marginesu GPU

Szacowana przepustowość to estymacja MiniMax, a nie pomiar produkcyjny, i należy ją tak właśnie odczytywać. Kierunek jest jednak jasny: przy piętnastu sekundach na dziesięć sekund wideo wysokiej wierności generowanie wideo wychodzi z asynchronicznego renderowania wsadowego do niemal interaktywnej infrastruktury.

🔗 NVIDIA na Gamescomie · SANA i Sol Engine na H3


Chińskie modele otwarte stają się punktem odniesienia dla badań, a Qwen3.8-27B wchodzi do top 10 Code Arena

25 sierpnia — Qwen przekazuje tego samego ranka dwa wyniki, a drugi nadaje sens pierwszemu.

Pierwszy to ranking. Qwen3.8-27B trafia do klasyfikacji Code Arena: WebDev, oceniającej modele pod kątem generowania interfejsów webowych, na 9. miejsce w klasyfikacji ogólnej z 1595 punktami. Jest jedynym modelem o swojej kategorii rozmiaru w top 10 i znajduje się zaledwie sześć miejsc za Qwen3.8-Max, znacznie większym modelem. Arena podkreśla, że model ten przesuwa granicę Pareto rankingu, i podaje wymowny punkt odniesienia: Gemma 4-31B, porównywalny rozmiarem, ale wydany w kwietniu, zajmuje 80. miejsce.

Oceniany modelMiejsce w Code Arena: WebDevLiczba punktówUwagi z rankingu
GLM-5.3 (Max)8. miejsce ogólnie1597Stan na 20 sierpnia, 2. wśród modeli otwartych
Qwen3.8-27B9. miejsce ogólnie1595Jedyny model tego rozmiaru w top 10
Qwen3.8-MaxSześć miejsc przed 27Bn.d.Znacznie większy model z tej samej rodziny
Gemma 4-31B80. miejsce ogólnien.d.Wydany w kwietniu 2026

Drugi wynik to pomiar użycia. Nathan Lambert, który współkierował projektem Olmo w Ai2, zlecił Codexowi przejrzenie 500 000 artykułów arXiv z dziedziny AI i uczenia maszynowego opublikowanych od premiery ChatGPT, aby zidentyfikować modele otwarte rzeczywiście używane w badaniach. Odwrócenie widać w dwóch liczbach: w 2024 roku około 30% artykułów wspominało amerykański model otwarty, a 10% chiński; dziś około 40% cytuje chiński otwarty LLM, a tylko 25 do 30% amerykański.

Rodzina modeliUdział artykułów cytujących LLM
OpenAI (modele zamknięte)około 37%
Qwenokoło 33%
Gemini, Claude10 do 15%
Gemma, Mistral5 do 10%
Olmookoło 1%

W szczegółach Qwen jest wspominany w jednej trzeciej artykułów cytujących jakikolwiek LLM. Llama osiągnęła szczyt około kwietnia 2025 roku na poziomie 30%, dokładnie w momencie premiery Llama 4, i od tego czasu spada. Lambert sam stawia ważne zastrzeżenie: publikacje pozostają w tyle za premierami modeli, ponieważ badania wymagają czasu — te liczby opisują stan trwających prac, a nie aktualne preferencje chwili. W tle widać szerszy trend, odrębny od pojedynku open vs. closed: odsetek artykułów AI wspominających LLM wzrósł z 10,43% w styczniu 2023 roku do ponad 50% w 2026 roku.

🔗 Qwen3.8-27B na Code Arena · Relacja Qwen z analizy arXiv · Analiza @natolambert


Claude Code przechodzi do 2.1.245, a renderowanie Claude w sieci staje się 4 razy płynniejsze

W oknie pojawiły się dwie wersje Claude Code, a ich zawartość wyraźnie celuje w wdrożenia organizacyjne. CHANGELOG nie zawiera dat, ale historia Git je umiejscawia: 2.1.243 pojawia się w commicie z 24 sierpnia o 23:40 UTC, a 2.1.245 w tym z 25 sierpnia o 05:13 UTC.

Dodane ustawienieDotyczy wersjiZnaczenie praktyczne
modelPricing2.1.243Ceny kontraktowe w /cost, pasku stanu i telemetrii
modelPicker2.1.243Uporządkowana i oznaczona lista modeli dla /model
promptCacheTtl / subagentPromptCacheTtl2.1.243Godzinny cache promptu dla rozmowy, 5 min dla subagentów
Ventilation Loops w /usage2.1.243Wykrywanie zbaczających z kursu zadań /loop
Logowanie bez klucza przez Console2.1.243Organizacje, które zakazują kluczy API
Poprawka glibc 2.442.1.245Awaria przy uruchamianiu na Arch Linux, CachyOS i Fedora Rawhide

Najbardziej znaczącym ustawieniem jest modelPricing: dotąd wyświetlane koszty opierały się na stawce publicznej, a teraz organizacja może wprowadzić własne stawki kontraktowe per model i współczynnik rabatu, co sprawia, że liczby stają się bezpośrednio użyteczne do wewnętrznego refakturowania. Para promptCacheTtl i subagentPromptCacheTtl rozwiązuje konkretny kompromis ekonomiczny dla użytkowników z kluczem API: trzymać godzinny cache dla głównej rozmowy, gdzie kontekst pozostaje stabilny, a jednocześnie ograniczyć subagentów do pięciu minut, bo ich konteksty są bardziej zmienne. Po stronie poprawek zdalne serwery MCP w trybie nieinteraktywnym nie pozostają już zablokowane po przerwaniu połączenia, /resume nie ogranicza się już do pięćdziesięciu najnowszych sesji, a sesje milczące przez ponad dziesięć minut wygasają teraz po około trzech minutach przed ponowną próbą i jasnym błędem.

24 sierpnia Anthropic ogłasza ponadto, że przepisał silnik wyświetlający odpowiedzi będące jeszcze w trakcie generowania w Claude web i desktop. Zasada jest klasyczna w renderowaniu interfejsów: dotykać tylko tego, co nadal się zmienia, zamiast przerysowywać całą odpowiedź przy każdym nowym fragmencie. Przy długiej odpowiedzi różnica jest strukturalna — koszt renderowania przestaje rosnąć wraz z długością już wyświetlonego tekstu. Zapowiedziane zyski są spójne: około 4 razy większa płynność, 9 razy mniej zacięć na słabszym laptopie, 4,5 razy krótsze najgorsze zawieszenie interfejsu i utrzymane 120 klatek na sekundę od początku do końca na MacBooku 120 Hz. Ciekawy jest docelowy odbiorca: najbardziej zyskują skromniejsze konfiguracje.

🔗 CHANGELOG Claude Code · Renderowanie 4x płynniejsze, @ClaudeDevs


Agenci kodu się uprzemysławiają: Warp publikuje format swoich factories, Rohlik zleca agentom pisanie 90% kodu

24 sierpnia pod koniec dnia — Warp pokazuje wewnętrzną mechanikę Warp Factories, swojej ogłoszonej 18 sierpnia platformy agentów cloud: wybrany format konfiguracji i otwarcie dostępu wczesnego. Punkt wyjścia jest jasno określony — Warp przenosi własnych agentów poza lokalne maszyny ze względów jakościowych i kosztowych, a potrzebował opisać środowiska, uprzęże i uprawnienia bezpieczeństwa jak wersjonowany kod.

Element konfiguracjiWybrana wartość
Plik definicjifactory.yaml, schemaVersion: v1alpha1
Kluczowe elementyname, repositories (owner / name), agentDefaults.model
Definicja agentaagents/<nom>/agent.md z agentType (FOREMAN, REVIEW…) i model
Wyzwalaczeautomations/<nom>/automation.md : agent, triggers (dostawca, zdarzenie)
Dostępne interfejsyCLI (warp agent run-cloud), API REST, SDK TypeScript, serwer MCP
Dostęp wczesnyDo 10 000 USD darmowego użycia dla kwalifikujących się klientów

Rozdzielenie jest interesujące: agenci nie są opisywani w jednym YAML-u, lecz w osobnych plikach Markdown, dzięki czemu definicja agenta staje się dokumentem czytelnym i łatwym do porównywania. Warp stosuje tę receptę do samego siebie — jego wewnętrzna factory, nazwana „wilson”, obejmuje repozytoria takie jak warp-server czy warp-terraform, deklaruje sekrety i serwery MCP oraz porządkuje agentów według ról (code-review, foreman, implementation, spec, triage) w 34 liniach. Liczby podawane na stronie z prośbą o dostęp są argumentami handlowymi nieweryfikowalnymi z zewnątrz: 200 000 uruchomień agentów dziennie, ponad 30% scalonych pull requestów bez poprawek, 20% niższy koszt na pull request.

25 sierpnia Cognition publikuje z kolei studium przypadku zdecydowanie lepiej udokumentowane niż poprzednie. Rohlik Group to internetowy dystrybutor żywności, który narodził się w Czechach, działa w pięciu krajach, jest rentowny i w ubiegłym roku osiągnął ponad 1,3 miliarda dolarów przychodu; dostarcza cotygodniowy komplet 17 000 produktów w mniej niż godzinę albo w 15-minutowych oknach. Liczba, która porządkuje artykuł: około 90% kodu jest dziś tam generowane przez agentów, a organizacja inżynierska określa się jako „agent-mostly”.

To nie jest wynik uzyskany przez samo podłączenie narzędzia. Rohlik mówi, że zaczął rok temu, od pierwszego doświadczenia z Devin, uznanego za bugujące. To, co zmieniło sytuację, to fundamenty po stronie klienta: ponad pięćdziesiąt wewnętrznych i zewnętrznych integracji MCP, z zasadą, że każde nowe narzędzie musi być dostępne dla agentów od pierwszego dnia, warstwa semantyczna nad hurtownią danych Snowflake oraz baza wiedzy dająca agentom kontekst, który przekazałoby się nowemu współpracownikowi. Praca trafia do Devina z miejsca, w którym powstaje: rozmowy na Slacku o błędzie albo dokumentu specyfikacji Linear rozwijanego aż do pull requestu. Deklarowane rezultaty — podwojony throughput inżynierski od listopada, integracja robotyki AutoStore dostarczona w osiem miesięcy, podczas gdy branża potrzebuje dwóch do trzech lat, prototypowanie skrócone z miesiąca do jednego dnia — pozostają tym, co podaje strona klienta opublikowana przez dostawcę. Najbardziej wymowny efekt jest gdzie indziej: najlepsi inżynierowie spędzają teraz 80% czasu na przeglądaniu kodu, a około 30% użycia Devina w Rohlik to analiza danych przez użytkowników biznesowych.

🔗 Format factory.yaml, @warpdotdev · Studium przypadku Rohlik, @cognition · Strona klienta Devin


GitHub: cztery ćwiczenia o workflow agentowych i zakładka Customize w ogólnej dostępności

25 sierpnia — GitHub udostępnia cztery nowe ćwiczenia na swojej platformie nauki GitHub Skills. Punkt widzenia jest jasny: zamiast dokumentować agentowe nowości roku, GitHub proponuje ćwiczenie ich w repozytorium demonstracyjnym, z instrukcjami dostarczanymi wraz z pull requestami.

Opublikowane ćwiczenieTemat ćwiczenia
Agent Orchestration Build Your AI Dream TeamAgenci niestandardowi w Copilot CLI: planowanie, projektowanie, budowanie, walidacja, przekazywanie
Agentic Workflows that Read the RoomRozszerzenie gh aw, agentowy workflow w Markdown, zmiany przesyłane przez pull requesty
Idea to Merge with the Copilot AppOd sesji do scalonego pull requestu, całkowicie w aplikacji GitHub Copilot
Ship with QualityZautomatyzowane sygnały jakości, pokrycie testami, wymuszone kontrole na pull requestach

Najbardziej godne uwagi z czwórki jest pierwsze: to pierwszy raz, kiedy GitHub proponuje prowadzoną ścieżkę po orkiestracji wielu agentów w swoim CLI, temacie dotąd dokumentowanym wyłącznie opisowo. Drugie wprowadza rozszerzenie gh aw, z ważnym dla bezpieczeństwa założeniem — zmiany proponowane przez workflow przechodzą przez pull requesty, zamiast być stosowane bezpośrednio, co zachowuje punkt ludzkiej kontroli.

Tego samego dnia aplikacja GitHub Copilot zyskuje zakładkę Customize w ogólnej dostępności. Jej zadaniem jest zebranie w jednej przestrzeni czterech mechanizmów rozszerzania wprowadzonych osobno w ostatnich miesiącach: serwerów MCP, pluginów, skills i canvases. Widok Featured pokazuje wybór redakcyjny z każdej kategorii dla użytkownika, który wie, co chce zrobić, ale nie wie, jaki typ rozszerzenia temu odpowiada, a serwery MCP dostają własną nawigację z opcjami wyróżnianymi według popularności i ścieżką według kategorii. Changelog ilustruje użyteczność canvases konkretnym przypadkiem: canvas Azure DevOps do sortowania issue, priorytetyzacji backlogu, przypisywania follow-upów, a następnie przekazania zadania Copilotowi, aby zbadał sprawę, zaimplementował rozwiązanie albo przygotował review.

🔗 Cztery ćwiczenia GitHub Skills · Zakładka Customize w ogólnej dostępności


Narzędzia Google dla deweloperów: Gemini CLI 0.57.0 i Antigravity 2.10.0

25 sierpnia — Google publikuje stabilną wersję 0.57.0 Gemini CLI, a kwadrans wcześniej preview 0.58.0. Zawartość tej wersji mówi mniej o nowych funkcjach niż o tym, jak Google utrzymuje swoje narzędzie: spośród 24 wpisów changelogu 13 zaczyna się od [SSR Agent] Issue Fix i odsyła do numerów issue często starych, od 19239 do 28518. Te poprawki dotyczą narastających irytacji z backlogu — bezterminowego zawieszania interfejsu terminala, któremu dodano timeouty, mylącego administracyjnego komunikatu o błędzie dla kont osobistych, braku odstępu po sugestiach autouzupełniania, renderowania terminala, które nie odświeżało się po wyjściu z zewnętrznego edytora. Innymi słowy, Google przepuszcza agenta przez własny dług techniczny, a rezultat trafia bezpośrednio do stabilnej wersji.

Opublikowana wersjaData i godzina (UTC)Kanał wydaniaNajważniejsze punkty
v0.57.025 sierpnia, 18:37:14Stable13 poprawek [SSR Agent], walidacja evals, context retries
v0.58.0-preview.025 sierpnia, 18:22:01PreviewIzolacja Docker w profilu Seatbelt macOS, sprawdzacze bezpieczeństwa

Po stronie funkcji wysiłek skupia się na ewaluacji, z komendą walidacji evals i formatterem wywołań narzędzi integrującym podsumowania niepowodzeń. Niezawodność też rośnie: błędy pojemności wywołują ciche retries uwzględniające kontekst, a anulowanie wieloturowego zapytania powoduje pełny rollback zamiast stanu częściowego. Dla osób szukających not wydań warto odnotować, że plik docs/changelogs/index.md repozytorium nie został zaktualizowany poza v0.54.0 z 6 sierpnia.

Cztery dni po 2.9.1 i jej Remote Control, Google Antigravity przechodzi do 2.10.0 24 sierpnia i wypełnia dwie luki, które zmuszały do wychodzenia z narzędzia: zintegrowany terminal i natywną kontrolę wersji Git, oba umieszczone bezpośrednio w pasku bocznym. To spójne z trajektorią produktu — Antigravity pozycjonuje się jako środowisko, w którym steruje się agentami, a nie edytuje kod linia po linii, ale trzeba jeszcze móc uruchomić komendę i obejrzeć diff bez zmiany okna. Reszta wersji rozszerza to, co można wysłać do agenta i co widać z jego pracy: pliki audio dołączają do akceptowanych załączników, interaktywny komentarz na obrazach pozwala anotować wizualizację, by ukierunkować agenta, a wzbogacone podglądy wykonania narzędzi MCP czynią czytelnym to, co faktycznie zrobił serwer narzędzi. Google podaje 13 ulepszeń i 8 poprawek, z progresywnym wdrażaniem.

🔗 Gemini CLI v0.57.0 · Changelog Antigravity


Anthropic finansuje 5 milionów dolarów niezależnych ewaluacji dotyczących dobrostanu

25 sierpnia — Anthropic uruchamia program grantów o wartości 5 milionów dolarów, przeznaczony na finansowanie niezależnych badań nad wpływem AI na dobrostan jej użytkowników. Laureaci otrzymują bezpośrednie finansowanie, dostęp do modeli i wsparcie techniczne, ale pracują całkowicie niezależnie: ich ewaluacje są publikowane jako open source i mogą być wykorzystywane przez całą branżę. Nabór wniosków trwa do 21 września, a kandydaci wybrani do złożenia pełnej propozycji zostaną powiadomieni przed 5 października.

Argumentacja techniczna wyjaśnia, dlaczego ta dziedzina opiera się zwykłym metodom ewaluacji. W przypadku większości zachowań modelu wystarczy przejrzeć pojedynczą odpowiedź, by ocenić, czy jest dokładna i odpowiednia. Dobrostan wymaga kontekstu: osoba w kryzysie nie musi od razu wspominać o myślach autoagresywnych, a porady dotyczące rozsądnego bilansu żywieniowego, poprawne w jednym przypadku, mogą stać się potencjalnie niebezpieczne, jeśli dana osoba ma historię zaburzeń odżywiania. Zespół Safeguards publikuje równolegle pięć kryteriów rygoru: jasno określić, co jest mierzone, włączyć klinicystów i specjalistów dziedzinowych do projektowania, testować zarówno środki ostrożności, jak i szkody — czyli oceniać ryzyko nadmiernej uległości tak samo jak nadmiernej odmowy — odzwierciedlać rzeczywiste użycie poprzez scenariusze wieloturowe oraz walidować automatyczne korektory wobec prawdziwych ekspertów. To trzecie kryterium, symetria między nadmierną zgodnością a nadmierną odmową, odróżnia to podejście od zwykłego zaostrzenia zabezpieczeń.

🔗 Granty badawcze dotyczące dobrostanu


Quantization-Aware Healing : model 4-bit, który przewyższa swój oryginał w pełnej precyzji

25 sierpnia — Standardowy pipeline do uczynienia dużego modelu gotowym do wdrożenia obejmuje trzy etapy: skompresować architekturę, skwantyzować wynik, a potem naprawić utratę jakości. Dominującym przepisem na ten ostatni etap jest QAT (quantization-aware training), które wstawia operacje pozornej kwantyzacji i ponownie trenuje; alternatywą jest QAD, które destyluje z modelu skompresowanego w pełnej precyzji. W obu przypadkach uczeń może co najwyżej dogonić swojego skompresowanego nauczyciela, a więc dziedziczy sufit wyznaczony przez kompresję.

Multiverse Computing proponuje zmianę jednej linii: destylować bezpośrednio z modelu oryginalnego, tego sprzed kompresji. Kwantyzacja przestaje wtedy być kosztownym postprocessingiem, a staje się pełnoprawnym etapem uczenia. Efekt jest intuicyjnie zaskakujący — zastosowana do GPT-OSS 120B skompresowanego do 60B, a następnie skwantyzowanego do MXFP4, metoda daje model 4-bitowy, który dorównuje lub przewyższa własne źródło bfloat16 na siedmiu z dziewięciu benchmarków, z największymi zyskami tam, gdzie kompresja boli najbardziej: +7,4 punktu na AA-LCR w rozumowaniu długiego kontekstu oraz +5,6 na AIME 2025. Dwa jedyne spadki, na MMLU-Pro i SciCode, pozostają poniżej półtora punktu.

Bezpośrednie porównanie z QAT przy identycznym pipeline może być praktycznie najcenniejszym wynikiem. Na GPT-OSS 9B skwantyzowanym do MXFP4 obie metody osiągają porównywalny szczyt, 54,9 wobec 54,6, ale nie za tę samą cenę: QAH dochodzi do niego w około stu krokach i utrzymuje go, podczas gdy QAT potrzebuje około 700 kroków, by tam dotrzeć, po czym się pogarsza. Konkretna konsekwencja jest inna pod względem ryzyka wdrożenia — checkpoint QAT wymaga uważnego monitorowania wczesnego zatrzymania, checkpoint QAH znacznie mniej.

🔗 Quantization-Aware Healing


Gradio integruje gr.Workflow, budowniczy pipeline’ów AI w grafie

25 sierpnia — Hugging Face publikuje przewodnik przedstawiający gr.Workflow, prymityw teraz zintegrowany z Gradio. Punkt wyjścia jest prosty: większość ciekawych aplikacji AI nie jest pojedynczym wywołaniem modelu, lecz łańcuchem — generujemy obraz, wycinamy z niego tło, wyciągamy z niego voice-over, prosimy LLM o tytuł. Dotąd złożenie takiego łańcucha i estetyczne wystawienie go wymagało napisania zarówno logiki, jak i interfejsu. gr.Workflow scala oba elementy: opisuje się kroki jako graf typowanych węzłów, a graf sam staje się interfejsem.

Korzyść dla deweloperów wykracza poza pokaz wizualny. Każde wyjście grafu automatycznie dostaje własny endpoint REST: przykładowe studio medialne, które łączy generację FLUX, wycinanie tła, syntezę mowy i LLM, wystawia trzy osobne trasy (/sticker, /voiceover, /episode_title), możliwe do wywołania z kodu bez przechodzenia przez interfejs. Węzły potrafią rozmawiać z czterema światami — modelami hostowanymi przez Inference Providers Hugging Face, innymi publicznymi Spaces Gradio używanymi jako klocki, pojedynczym wierszem zbioru danych z Hub oraz dowolnym Pythonem. Ten ostatni punkt otwiera najwięcej drzwi: węzeł operatora ozdobiony @spaces.GPU rezerwuje GPU ZeroGPU na czas swojego wykonania, co pozwala uruchamiać własne wagi. Pięć rzeczywiście wdrożonych aplikacji w Spaces towarzyszy przewodnikowi, w tym profiler zbiorów danych i demonstracja, która animuje nieruchomy obraz z Lightricks/LTX-Video.

🔗 Przewodnik gr.Workflow


ElevenLabs uruchamia Composer, edytor piosenek sekcja po sekcji

25 sierpnia — ElevenLabs ogłasza Composer, edytor piosenek działający sekcja po sekcji. Zasada łamie dominujący tryb generowania modeli muzycznych: zamiast tworzyć cały utwór jednym przebiegiem i uruchamiać wszystko od nowa, gdy jakiś fragment nie pasuje, Composer pozwala poprawiać osobno zwrotkę, refren lub bridge. Dostępne są cztery punkty startowe — własny tekst, istniejący utwór, który przyniesiesz, pusta karta albo zwykły prompt — a utwór buduje się potem poprzez kolejne poprawki.

To drugi ruch ElevenLabs w stronę muzyki po Eleven Music, i przychodzi w intensywnym tygodniu dla firmy, ponieważ CLI v1 ukazał się dzień wcześniej. Pozycjonowanie jest spójne z resztą sektora audio: Suno wypuściło Studio 2.0 13 sierpnia, Pika opublikowała swoją linię Pika Music 18 sierpnia, a Stability AI dostarczyło tego samego dnia wtyczkę do stacji roboczych audio. Precyzyjna kontrola nad strukturą utworu, a nie surowa jakość generacji, stała się polem rywalizacji. Jest jednak zastrzeżenie: ogłoszeniu nie towarzyszy wpis na blogu, a o planach dających dostęp do Composer, formatach eksportu ani dostępie do API nic nie wiadomo.

🔗 Ogłoszenie Composer, @ElevenLabs


LiveAvatar znosi wszelkie limity współbieżności i schodzi do 0,01 USD za minutę

25 sierpnia — HeyGen ogłasza zniesienie limitów współbieżności w LiveAvatar, swoim produkcie awatarów czasu rzeczywistego. Sformułowanie podkreśla naturę zmiany: limity nie są podnoszone, lecz znikają. Jedna sesja czy dziesięć tysięcy działają na tym samym API, bez wcześniejszego negocjowania limitu. Ogłoszeniu towarzyszą dwa parametry — rendering pozostaje w pełnym ciele 1080p, a cena spada do 0,01 USD za minutę przy skali.

Ten poziom ceny zmienia charakter możliwych zastosowań: przy jednym centie za minutę awatar czasu rzeczywistego staje się opłacalny dla masowego supportu klienta, szkoleń czy kiosków interaktywnych, czyli przypadków, w których to koszt jednostkowy dotąd decydował o wykonalności. Zniesienie limitu współbieżności to najciekawszy technicznie punkt. Platformy awatarów czasu rzeczywistego zwykle ograniczają liczbę równoczesnych sesji, ponieważ każda sesja stale zużywa GPU; zniesienie tego sufitu wymaga albo dużego zapasu mocy, albo wzrostu efektywności modelu. HeyGen publikuje wpis wyjaśniający swoje podejście, lecz szczegóły techniczne nie były dostępne w momencie skanu.

🔗 Nielimitowana współbieżność w LiveAvatar


Grok 4.6 trafia do OpenCode Go

25 sierpnia — Grok 4.6 dołącza do OpenCode Go, abonamentowej oferty agenta kodu open source OpenCode. Ogłoszenie pochodzi od OpenCode pod koniec dnia, a konto @grok relacjonuje je pół godziny później. Konkret dla deweloperów to limit: 169 zapytań na każde 5 godzin dla użytkowników planu Go. To limit kroczący, nie miesięczny, co dobrze pasuje do typowego dla sesji wspomaganego kodowania użycia w zrywach.

Ta integracja wpisuje się w serię otwarć Grok 4.6 na narzędzia firm trzecich: model trafił do GitHub Copilot 14 sierpnia, do Amazon Bedrock 19 sierpnia, a następnie do Gemini Enterprise Agent Platform od Google 21 sierpnia. xAI wcześniej połączyło już OpenCode ze swoimi subskrypcjami SuperGrok i X Premium w maju 2026 — dzisiejszy dodatek nie dotyczy więc samego dostępu do OpenCode, lecz obecności modelu 4.6 w planie Go, z dołączonym limitem zamiast konieczności dostarczania własnej subskrypcji xAI.

🔗 Relacja @grok · Ogłoszenie @opencode


Cohere publikuje badanie IDC o adopcji suwerennej AI w 2026 roku

25 sierpnia — Cohere publikuje wyniki InfoBriefu zamówionego w IDC na temat adopcji suwerennej AI w sektorach regulowanych. Badanie objęło ponad 500 starszych decydentów z firm osiągających ponad miliard dolarów przychodu w Kanadzie, Stanach Zjednoczonych, Wielkiej Brytanii i Niemczech, w okresie od kwietnia do maja 2026.

Najbardziej znaczący wynik dotyczy mniej adopcji niż zamieszania pojęciowego. Co trzeci lider ma trudność z opisaniem suwerennej AI własnymi słowami, a jedynie 13% deklaruje bardzo wysoką świadomość tematu. Wśród tych, którzy potrafią ją zdefiniować, 52% ujmuje ją jako kontrolę lokalną lub krajową, a 35% mówi o cyfrowej niezależności. Różnica przebiega też przez strukturę organizacji: osoby odpowiedzialne za IT wykazują świadomość dwukrotnie wyższą niż osoby po stronie biznesu.

Badany sektorUcieczka danych i zgodność jako główna obawaPrzewaga konkurencyjna jako motyw
Usługi finansowe82 %21 %
Przemysł77 %32 %
Telekomunikacja75 %37 %
Opieka zdrowotna74 %28 %
Energetyka70 %21 %

Jeśli chodzi o motywacje, konsensus jest wyraźny i przekrojowy: ucieczka danych, prywatność i zgodność z przepisami zajmują pierwsze miejsce we wszystkich badanych sektorach. Przewaga konkurencyjna pojawia się jako motyw drugorzędny, ale rosnący, wyraźniej akcentowany w Kanadzie (35%) i Stanach Zjednoczonych (28%) niż w Niemczech (23%) czy Wielkiej Brytanii (18%). Badanie oczywiście wspiera pozycjonowanie Cohere, którego platforma agentowa North działa w infrastrukturze i jurysdykcji wybranej przez klienta; pozostaje jednak fakt, że liczby pochodzą z zidentyfikowanego źródła. IDC przewiduje ponadto, że do 2028 roku CIO w międzynarodowych korporacjach zwiększą o 65% inwestycje w modułowe środowiska chmury suwerennej i lokalizację danych.

🔗 State of Sovereign AI Adoption 2026


Krótkie wiadomości

  • Bain & Company dołącza do Claude Partner Network — Firma zostaje partnerem Global Premier, wspieranym wdrożeniem Claude wśród swoich 19 000 pracowników; ponad 7 000 aktywnych użytkowników już w fazie pilotażu, a ponad dwie trzecie uczestników przyjęło Claude for Excel. 🔗 Wpis Anthropic
  • Amp wyjaśnia, czym są orbs — Notatka Thorstena Balla w odpowiedzi na zamieszanie wokół nazwy: orb to zdalny agent, którym można sterować z poziomu webu, telefonu lub CLI. Dwie użyteczne uwagi o kosztach: nieograniczony sen nie jest naliczany, a liczba jednoczesnych orbów nie ma limitu. 🔗 Notatka Amp
  • Together AI otwiera Qwen3.8 27B na fine-tuning i dedykowaną inferencję — Model staje się dostępny zarówno do dostrajania na własnych danych, jak i do Dedicated Model Inference na zarezerwowanym sprzęcie. 🔗 Tweet @togethercompute
  • FINAL-Bench otwiera FINCHAL, konkurs prognoz finansowych dla agentów — Z pulą 2 000 dolarów, wymaga pozycji zamiast prognoz i publikuje sufit szczęścia (luck ceiling), aby oddzielić umiejętność od przypadku. 🔗 Wpis FINAL-Bench
  • Au-Zone publikuje EdgeFirst Model Zoo — Cztery rodziny YOLO do detekcji i segmentacji mierzone na rzeczywistym, wbudowanym krzemie, a każdy opublikowany wynik odsyła do sesji walidacyjnej, która go wygenerowała, w przeciwieństwie do nieprzejrzystych TOPS deklarowanych przez producentów. 🔗 Wpis EdgeFirst
  • Inteligentne dyktowanie Gemini dla macOS — Dyktowanie w dowolnym oknie pulpitu, z automatycznym usuwaniem wahań i uwzględnianiem poprawek w środku zdania; głos służy też do podsumowywania plików i przepisywania tekstu. 🔗 Przewodnik blog.google
  • Reguły push akceptują wyjątki ścieżek — W publicznej wersji zapoznawczej reguły Restrict file paths i Restrict file size mogą wyłączać konkretne ścieżki, na przykład blokować JAR-y wszędzie poza **/gradle/wrapper/*.jar. 🔗 Dziennik zmian GitHub
  • Blokowanie użytkownika z poziomu powiadomienia bezpieczeństwa — Działanie odbywa się przez menu z trzema kropkami w opisie lub komentarzu, w publicznych repozytoriach, bez wchodzenia z powrotem do ustawień; powiadomienie pozostaje nienaruszone. 🔗 Dziennik zmian GitHub
  • Manus sygnalizuje duży popyt na odzyskiwanie danych — Nieudane przywracanie trzeba uruchomić ponownie później tego samego dnia; jasna instrukcja, by zachować pakiety kopii zapasowych nienaruszone i bez zmian. 🔗 Tweet @ManusAI
  • Kling publikuje trzy przewodniki po swoim serwerze MCP — Połącz Kling z asystentem zgodnym z MCP, aby odtworzyć zatwierdzoną konfigurację twórczą i generować warianty wsadowo; dwa z trzech poradników jako klienta wymieniają Claude Code. 🔗 Blog Kling
  • Wan 3.0 trafia na Runway i Replicate — Runway integruje go 24 sierpnia z wieloma referencyjnymi wejściami obrazowymi, wideo i audio; Replicate podąża 25 sierpnia, podkreślając natywne 30 sekund w jednym ujęciu z zsynchronizowanym dźwiękiem. 🔗 Tweet @runwayml
  • Runway ogłasza nowych prelegentów na swój AI Summit — Rozszerzony program o robotykę, pojazdy autonomiczne, marketing i infrastrukturę na wrześniowe wydarzenie w San Francisco. 🔗 Tweet @runwayml
  • MiniMax publikuje indeks integracji H3 — Awesome MiniMax H3 Integrations kataloguje to, co powstaje wokół otwartego modelu wideo, w tym konfiguracje działające na 24 GB VRAM. 🔗 Tweet @MiniMax_AI
  • Luma uruchamia Dream Lab Weekly — Pierwszy odcinek serii wideo poświęconej kreatywnym profesjonalistom Luma i ich cotygodniowej pracy nad produktem. 🔗 Tweet @LumaLabsAI
  • NVIDIA publikuje sesję Nemotron Labs o routingu otwartych modeli — 55-minutowa transmisja na żywo zatytułowana Get Started with Open Model Routing, będąca rozwinięciem prac nad Nemotron 3.5 Lightning i NeMo Switchyard. 🔗 Tweet @NVIDIAAI
  • Tydzień do końca konkursu Grok Imagine na Odysei — Trzeba stworzyć scenę zaczerpniętą z Odysei, pokazującą możliwości wideo i głosu narzędzia; nagrody wynoszą 100 000, 50 000 i 25 000 dolarów. 🔗 Tweet @grok
  • Pula resetów limitów dla subskrybentów Plus i Pro — Zamiast czekać na okno resetu, użytkownik zużywa zarezerwowany reset; jeden darmowy na start i kolejne przez polecenia, z współdzielonymi kredytami workspace po stronie Business. 🔗 Dziennik zmian ChatGPT i Codex

Co to oznacza

Krzem znów staje się tematem laboratoryjnym dla modeli. OpenAI tego samego dnia publikuje pierwsze zmierzone liczby dotyczące własnego układu do inferencji oraz wpis wyjaśniający jego strategię compute. To nie jest przypadek w kalendarzu: dostawca modeli, który projektuje swój krzem, mierzy go na publicznym benchmarku strony trzeciej i otwarcie stawia na portfel dziesięciu partnerów, zmienia charakter konkurencji. Pytanie przestaje brzmieć „który model jest najlepszy”, a zaczyna „jaki jest koszt na skutecznie wykonane zadanie”, a odpowiedź rozstrzyga się równie mocno w racku, jak i w wagach. Być może najbardziej znaczący szczegół jest gdzie indziej: AI posłużyła do zaprojektowania układu i napisania jego kerneli, a wejście do produkcji zajęło dziewięć miesięcy, przy czym wygenerowane implementacje przewyższają te stworzone przez ludzkich ekspertów na wybranych blokach. Pętla się domyka — modele projektują sprzęt, na którym same będą działać.

AI wraca na urządzenie, a liczby zaczynają za tym nadążać. Trzy sygnały z tego samego dnia wskazują w tym samym kierunku. Perplexity uruchamia całego swojego agenta lokalnie na DGX Spark, bez zużywania kredytów, a eskalacja do chmury pozostaje decyzją użytkownika. Multiverse Computing publikuje metodę, w której model 4-bitowy dorównuje lub przewyższa źródło w pełnej precyzji, co odbiera zwyczajny argument przeciw agresywnej kwantyzacji. Au-Zone publikuje pomiary wizji na wbudowanym krzemie, krytykując reklamowane TOPS za to, że nie mówią nic o tym, co dany model rzeczywiście zrobi. Żaden z tych trzech projektów nie twierdzi, że dorównuje frontierowi: uczciwa liczba Perplexity to 59,6 % lokalnie wobec 82,4 % dla samego Claude Opus 5 na Terminal Bench 2.1. Ale przejście do modelu doradczego odzyskuje trzy piąte różnicy za dwie trzecie kosztu, i to właśnie ten kompromis, bardziej niż parytet, sprawia, że lokalne uruchamianie staje się obronione.

Otwarte wagi umacniają się jako pozycja domyślna. Analiza 500 000 artykułów arXiv, przytoczona przez Qwen, dokumentuje już widoczny odwrót: otwarte modele chińskie wzrosły z 10 % do około 40 % wzmianek, podczas gdy otwarte modele amerykańskie tkwią między 25 a 30 %. Qwen3.8-27B wchodzący do top 10 Code Arena jako jedyny model tej wielkości, GLM-5.3, który wyprzedzał GPT-5.6 Sol i Claude Fable 5 na DeepSWE w wielu próbach przy koszcie 2,1 do 5,4 razy niższym, IBM otwierający Granite 4.2 z czterema wariantami kwantyzowanymi i czternastoma formatami GGUF już pierwszego dnia — ta sama logika powtarza się raz za razem. Otwieranie wag nie jest już ruchem nadrabiającym zaległości, lecz sposobem na stanie się domyślną infrastrukturą dla innych, z zastrzeżeniem, które sam Nathan Lambert stawia wprost: publikacje pozostają w tyle za wydaniami, a te krzywe opisują prace w toku, a nie aktualne preferencje.

A sieć przygotowuje się do bycia czytaną przez agentów, a nie przez oczy. WebMCP Challenge to konkurs z pulą 35 000 dolarów, więc niewielką; to, co ujawnia, jest jednak warte więcej. Chrome, Cloudflare, Shopify, Vercel, Render i Netlify ustawiają się razem z OpenAI wokół standardu, który wymaga od witryn udostępniania ustrukturyzowanych narzędzi zamiast pozwalania agentom zgadywać interfejs. Tego samego dnia ChatGPT desktop potrafi natywnie korzystać z WebMCP, Codex umie tworzyć i wdrażać zgodną aplikację, a OpenAI dokumentuje wewnętrzne użycie protokołu w narzędziu do notatników. To zbieżne podejście pokrywa się z tym, co Rohlik opisuje ze swojej strony, mając ponad pięćdziesiąt integracji MCP i zasadę, że każde nowe narzędzie musi być dostępne dla agentów od pierwszego dnia. Warstwa interfejsu dla agentów przestaje być tematem badawczym, a staje się wymaganiem inżynieryjnym.


Źródła