ai-powered-markdown-translatorPrzetłumaczony artykuł z fr na pl za pomocą gpt-5.4-mini.
Pięćdziesiąt jeden ogłoszeń w ciągu dwudziestu czterech godzin, rozłożonych na dziewięć obszarów: dzień 25 sierpnia jest najintensywniejszy w tygodniu. Wyłaniają się z niego cztery ruchy. OpenAI publikuje pierwsze zmierzone wyniki Jalapeño, swojego własnego układu do inferencji, i od razu uruchamia dziesięciodniowy hackathon wokół WebMCP z Chrome, Cloudflare, Shopify, Vercel, Render i Netlify. Perplexity przenosi całość swojego agenta Computer na maszynę użytkownika. IBM otwiera Granite 4.2, swoją pierwszą rodzinę modeli rozumowania. A Anthropic ujednolica pamięć Claude między czatem a Cowork, czyniąc ją czytelną i edytowalną plik po pliku. Reszta — WeatherNext Cyclones w użyciu w National Hurricane Center, runda Seria B Stability AI, około dwudziestu aktualizacji narzędzi — znajduje się poniżej.
WebMCP : jeden standard, jego wsparcie produktowe, wewnętrzne zastosowanie i konkurs, który ma go rozruszać
25 sierpnia — OpenAI uruchamia WebMCP Challenge, dziesięciodniowy hackathon poświęcony wciąż eksperymentalnemu otwartemu standardowi, który zmienia sposób, w jaki agenci wchodzą w interakcję z siecią. Cel jest konkretny: dziś agent, który ma wykonać zadanie na stronie internetowej, musi zgadywać, jak poruszać się po interfejsie zaprojektowanym dla oczu i myszy. WebMCP odwraca logikę — sama strona udostępnia ustrukturyzowane narzędzia, do których agent wywołuje bezpośrednio.
Sam konkurs nie jest najbardziej znaczącym elementem ogłoszenia. To zgranie, które ono ujawnia: Chrome (Google), Cloudflare, Shopify, Vercel, Render i Netlify łączą siły z OpenAI wokół tego samego standardu. Ślad tego widać też w składzie jury: Sarah Drasner (Distinguished Engineer, Chrome), Andrew Galloni (VP Research & Innovation, Cloudflare), Jude Gao (zespół Next.js Core, Vercel), Ilya Grigorik (Distinguished Engineer, Shopify), Sean Roberts (VP of Applied AI, Netlify), Justin Rushing (Browser Agent Lead, OpenAI) oraz Alex Nahas, twórca MCP-B.
The WebMCP Challenge is here. We’ve teamed up with @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render, and @Netlify for a 10-day hackathon. Up for grabs: $35,000 in cash prizes, Codex Micros, ChatGPT Pro subscriptions, and more prizes from our supporters.
🇵🇱 WebMCP Challenge wystartował. Połączyliśmy siły z @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render i @Netlify, aby zorganizować dziesięciodniowy hackathon. Do zdobycia: 35 000 dolarów nagród pieniężnych, Codex Micro, subskrypcje ChatGPT Pro i inne nagrody od naszych partnerów. — @OpenAIDevs na X
Harmonogram jest napięty, a kryteria oceny są jasno określone: użyteczność, oryginalność, wykonanie, przemyślane wykorzystanie WebMCP oraz jakość doświadczenia człowiek-agent. Zgłoszenia i nadsyłanie projektów odbywają się przez Devpost. OpenAI publikuje też demonstracyjne aplikacje natywne dla agentów, aby pobudzić projekty — modelowanie 3D sterowane przez agenta, wspólne pisanie, w którym agent komentuje pod własną tożsamością, generator spersonalizowanych krzyżówek, Wandernote do przekształcania notatek z podróży w plan trasy oraz eksplorację danych przez DuckDB-Wasm w przeglądarce. Start od istniejącej aplikacji i dodanie do niej WebMCP jest dozwolone.
| Element konkursu | Zgłoszony szczegół |
|---|---|
| Czas trwania | 10 dni |
| Otwarcie zgłoszeń | 25 sierpnia 2026, 12:00 PT |
| Termin nadsyłania | 3 września 2026, 13:00 PT |
| Ogłoszenie zwycięzców | 23 września 2026 (data orientacyjna) |
| Łączna pula nagród | 35 000 dolarów |
| Nagroda dla laureata (top 10) | 3 000 dolarów, rok ChatGPT Pro, klawiatura Codex Micro, gadżety |
| Platforma zgłoszeń | Devpost |
Element produktowy, który sprawia, że standard staje się użyteczny na co dzień, pojawia się tego samego dnia: wbudowana przeglądarka desktopowej aplikacji ChatGPT oraz ChatGPT Sites potrafią już korzystać z WebMCP. Gdy ChatGPT lub Codex odwiedza kompatybilną stronę, agent wykrywa narzędzia udostępnione przez stronę i korzysta z nich automatycznie zamiast błądzić po interfejsie — konieczna jest aktualizacja do najnowszej wersji desktopowej aplikacji. Druga połowa pętli jest po stronie produkcji: można poprosić Codex o stworzenie aplikacji zgodnej z WebMCP, a następnie wdrożyć ją bezpośrednio w Sites. Warto też zauważyć asymetrię wsparcia z Chrome, gdzie WebMCP pozostaje za eksperymentalną flagą lub origin trial, podczas gdy przeglądarka ChatGPT obsługuje go natywnie.
Pozostaje trzeci wątek, najbardziej pouczający: OpenAI dokumentuje własne wewnętrzne zastosowanie. Inżynier firmy opowiada, jak przestał pisać automatyzację dla każdego zadania, aby zbudować Runme, internetową aplikację notebooków open source stworzoną do współpracy z Codex. Wpisuje tam krótki cel z jasnymi instrukcjami — sprawdzić poprzednie wykonanie, przygotować szczegółowy plan, czekać na zatwierdzenie przed rozpoczęciem, dokumentować wykonane polecenia i ich interpretację — a Codex czyta notebook i aktualizuje go w trakcie pracy. Dwa wybory architektoniczne zasługują na uwagę. Najpierw trwałość: notebooki są zapisywane w Google Drive, a Runme generuje równolegle towarzyszący indeks Markdown *.index.md, który Drive potrafi indeksować, dzięki czemu agent może odnaleźć poprzednie wykonanie jako kontekst operacyjny. Następnie ekspozycja możliwości: Runme jest aplikacją kliencką serwowaną statycznie, a dodanie serwera wyłącznie po to, by wystawić klasyczny punkt dostępu MCP, wprowadziłoby dodatkową infrastrukturę i przeniosłoby przetwarzanie danych notebooka. WebMCP pozwala aplikacji rejestrować swoje narzędzia bezpośrednio z poziomu przeglądarki.
🔗 WebMCP Challenge · Wsparcie w ChatGPT desktop i Sites · Codex, Runme i WebMCP w OpenAI
Jalapeño : OpenAI publikuje pierwsze liczby dotyczące swojego układu do inferencji i potwierdza strategię compute
25 sierpnia — OpenAI publikuje pierwsze zmierzone wyniki Jalapeño, pierwszego układu do inferencji, który zaprojektowała samodzielnie. Znaczenie ogłoszenia nie sprowadza się wyłącznie do surowych zysków, lecz do natury kompromisu, który ma ono znosić: istniejące systemy inferencji zazwyczaj muszą wybierać między przepustowością a opóźnieniem, podczas gdy Jalapeño deklaruje oba w jednej architekturze.
Pomiary opierają się na InferenceX, publicznym benchmarku SemiAnalysis, który symuluje pełne przetwarzanie zapytania. Przetestowano trzy otwarte modele — GPT-OSS 120B, DeepSeek R1 670B i Kimi K2.5 1T — w zestawieniu z systemami komercyjnymi. Wybór normalizacji względem wata, a nie układu, jest wyraźny i wygodny: Jalapeño zużywa dwa razy mniej niż systemy, z którymi jest porównywana. Jalapeño jest ogłoszona na 700 W, a zmierzone stałe zużycie utrzymało się na poziomie 550 W lub mniej w testowanych obciążeniach, wobec 1 200 W dla GB200 i 1 400 W dla GB300.
| Oceniany model (porównywany system) | Szczytowa przepustowość na kW | Opóźnienie end-to-end | Minimalne TBT |
|---|---|---|---|
| GPT-OSS 120B (GB200, 1 200 W) | ≈1,9x (85 448 vs 44 960) | ≈1,7x (1,03 s vs 1,80 s) | ≈2,7x (0,69 vs 1,87 ms) |
| DeepSeek R1 670B (GB300, 1 400 W) | ≈1,7x (19 641 vs 11 781) | ≈3,6x (1,65 s vs 5,99 s) | ≈4,1x (1,43 vs 5,90 ms) |
| Kimi K2.5 1T (GB300, 1 400 W) | ≈1,5x (18 195 vs 11 862) | ≈3,4x (1,56 s vs 5,31 s) | ≈3,8x (1,44 vs 5,48 ms) |
Dla wszystkich trzech modeli OpenAI deklaruje od 1,5 do 1,9 razy więcej pracy AI na wat przy szczytowej przepustowości oraz od 1,7 do 3,6 razy mniejsze opóźnienie end-to-end niż w systemach porównawczych, a także nawet od 2,1 do 4,1 razy lepszą wydajność przy bardzo interaktywnych obciążeniach. Technicznie zyski wynikają ze współprojektowania układu, pamięci, sieci, oprogramowania i systemu na poziomie racka. Inferencja przechodzi przez dwie fazy o różnych gardłach: prefill, który przetwarza prompt i nasyca obliczenia, oraz decode, który generuje tokeny pojedynczo i zależy przede wszystkim od przepustowości pamięci. Jalapeño stara się minimalizować przesuwanie danych, a stan modelu — łącznie z cache KV — może być umieszczony jawnie i utrzymywany lokalnie, podczas gdy system aktywuje właściwą kombinację obliczeń, pamięci i sieci w zależności od fazy.
Najciekawszy dla programisty jest jednak udział AI w samym projektowaniu układu. OpenAI podaje, że od projektu początkowego do tapeoutu minęło dziewięć miesięcy, dzięki skróceniu pętli projektowania, pomiaru i weryfikacji. Układ został pomyślany jako przewidywalny cel programistyczny zarówno dla AI, jak i dla ludzi: praca opisywana przez lokalne tensory, jawna komunikacja, przewidywalna synchronizacja. Z Codex i GPT-Astra zespół w dwa miesiące przeniósł trzy modele z otwartymi wagami, których nie było w pierwotnym planie produkcyjnym, a w wybranych blokach attention i mixture-of-experts GPT-OSS generowane przez AI jądra działają 1,5 do 1,8 razy szybciej niż implementacje napisane przez ludzkich ekspertów. Warto zachować tu niuans: liczby te dotyczą wybranych bloków, a nie całego modelu. Harmonogram pozostaje ostrożny — trwają kwalifikacje produkcyjne, oprogramowanie nadal dojrzewa, wdrożenie do infrastruktury OpenAI zapowiedziano na koniec roku, Gen 2 jest w zaawansowanym rozwoju, a Gen 3 zaczyna się wyłaniać.
Tego samego dnia Sarah Friar publikuje wpis, który wyjaśnia ekonomiczną logikę stojącą za tym wszystkim. Deklaruje w nim szeroki portfel compute — Microsoft i NVIDIA jako fundament, uzupełnione przez AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy i SoftBank — z argumentem zarówno handlowym, jak i technicznym: zachowanie wiarygodnego wyboru między dostawcami pozwala kierować każde obciążenie do najlepszego stosunku wydajności do ceny i utrzymywać dyscyplinę cenową. Konkretna liczba towarzyszy temu wywodowi: w Artificial Analysis Coding Agent Index GPT-5.6 Sol przy maksymalnym rozumowaniu osiąga nowy rekord, zużywając przy tym o 54% mniej tokenów wyjściowych niż inny czołowy model. Tekst otwarcie przyjmuje też paradoks Jevonsa — uczynienie inteligencji tańszą nie zmniejsza jej zużycia, lecz rozszerza zakres opłacalnych zastosowań. Po stronie infrastruktury Project Camellia w Georgii jest przedstawiany z obiegiem zamkniętym dla wody i zobowiązaniami podlegającymi corocznemu publicznemu niezależnemu audytowi. OpenAI wyjaśnia, że będzie nadal szeroko wdrażać akceleratory NVIDIA i innych partnerów, zarówno do treningu, jak i do inferencji.
🔗 Jalapeño — pierwsze wyniki · The full stack behind abundant intelligence
Perplexity Portable Computer: wszystko działa na maszynie, z potwierdzającymi to benchmarkami
25 sierpnia — Perplexity uruchamia Portable Computer, odmianę swojego agenta Computer, która działa w całości na komputerze użytkownika. Zmiana jest bardziej architektoniczna niż kosmetyczna: lokalnie uruchamia się nie tylko model, ale cały łańcuch orkiestracji — orkiestrator, planista, router narzędzi, harmonogram, trwała kolejka zadań i lokalny indeks wyszukiwania.
Dziś uruchamiamy Portable Computer na @NVIDIA DGX Spark.
Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency.
🇵🇱 Dziś uruchamiamy Portable Computer na @NVIDIA DGX Spark. Portable Computer to w pełni lokalna wersja Perplexity Computer, w której całe środowisko wykonawcze — orkiestrujący LLM, LLM podagentów, szkielet agenta — działa na waszym lokalnym sprzęcie. Żadnych zależności od chmury. — @perplexity_ai na X
Ogłoszenie zostało przygotowane wspólnie z NVIDIA i najpierw kieruje się na DGX Spark — platformę Grace Blackwell GB10, CPU Arm z 20 rdzeniami, GPU NVIDIA, 128 GB pamięci zunifikowanej — z zapowiedzianym rozszerzeniem na komputery z GPU RTX. Do wyboru są dwa modele, Qwen 3.8 27B lub PPLX 27B, czyli wersja modelu Qwen po post-treningu wykonanym przez Perplexity, a NVIDIA Nemotron 3.5 Lightning, otwarty model 30B, ma dołączyć do selektora. Praca wykonywana lokalnie nie zużywa żadnych kredytów. Eskalacja do chmury nadal jest możliwa — aktualne informacje, przeglądarka, połączone aplikacje albo jeden z 15 modeli frontier i więcej — ale wymaga wyraźnej zgody użytkownika. Łączniki Google Drive, Gmail, Slack i GitHub działają z urządzenia, dyktowanie odbywa się lokalnie przez NVIDIA Nemotron 3.5 ASR Model bez opuszczania maszyny przez dźwięk, a wykonywanie kodu odbywa się w odizolowanym piaskownicowym środowisku (sandbox). Portable Computer jest zarezerwowany dla subskrybentów Pro i Max posiadających DGX Spark, najpierw na Linuxie, potem na Windows, z instalacją jednym kliknięciem z poziomu aplikacji.
Tego samego dnia zespół inżynierów publikuje dane, które dokumentują to uruchomienie. Teza brzmi, że model i szkielet (harness) muszą być projektowane razem: generyczne szkielety zakładają, że model frontier poradzi sobie z długim kontekstem i planowaniem na szerokim horyzoncie, co słabiej wychodzi modelom lokalnym.
| Zmierzony benchmark | Computer (Qwen 3.8 27B) | Pi | Hermes | Computer + PPLX 27B |
|---|---|---|---|---|
| Local Knowledge Work Bench (53 zadania) | 82,6 % | 77,6 % | 74,0 % | 85,4 % |
| BrowseComp (1 266 zadań) | 66,7 % | 50,2 % | 43,9 % | — |
| ParseBench-100 (dokumenty multimodalne) | 65,1 % | 13,9 % | 34,6 % | — |
Na BrowseComp Computer zużywa przy okazji o 61 % mniej czasu i o 16 % mniej tokenów niż Hermes oraz o 51 % mniej czasu i 70 % mniej tokenów niż Pi. Cztery decyzje projektowe tłumaczą tę różnicę: minimalny prompt systemowy, możliwości modularne w postaci skills ładowanych i rozładowywanych w trakcie trajektorii, często używane łączniki (Gmail, GitHub, Outlook, Google Calendar) zamienione na kompaktowe narzędzia wiersza poleceń zamiast udostępniane przez serwery MCP, których definicje pochłaniają kontekst, oraz zawsze aktywne, niekonfigurowalne piaskownicowe środowisko — jeśli jest niedostępne, szkielet wyłącza się przed jakimkolwiek wywołaniem narzędzia zamiast przechodzić do niewyizolowanego wykonania. Perplexity odnotowuje też praktyczną obserwację: Qwen 3.8 27B deklaruje okno 260K tokenów, ale empirycznie zaczyna mieć trudności powyżej 100K.
| Terminal Bench 2.1 (89 zadań) | Wynik | Koszt API na wykonanie |
|---|---|---|
| Qwen 3.8 27B, 100 % lokalnie | 59,6 % | około 0 |
| Qwen 3.8 27B + porada Claude Opus 5 | 73,0 % | 0,415 USD |
| Claude Opus 5 samodzielnie | 82,4 % | 0,65 USD |
Mechanizm eskalacji do modelu doradczego (advisor) jest najciekawszym elementem raportu: odzyskuje około trzy piąte różnicy względem frontier za mniej więcej dwie trzecie jego kosztu, a decyzja pozostaje w rękach użytkownika. Przed każdym wywołaniem szkielet wybiera odpowiedni kontekst, stosuje klasyfikator danych osobowych i pokazuje użytkownikowi, co opuściłoby urządzenie; model doradczy zwraca wyłącznie tekst i nie ma bezpośredniego dostępu ani do plików, ani do narzędzi. Post-trening PPLX 27B łączy z kolei dostrajanie przez odrzucanie (rejection fine-tuning), a następnie uczenie ze wzmocnieniem na syntetycznych środowiskach uruchamianych w kontenerach Docker, bez jakichkolwiek rzeczywistych danych użytkownika. Zapowiedziano raport techniczny oraz udostępnienie benchmarku ewaluacyjnego w open source.
🔗 Lokalne benchmarki szkieletu · Portable Computer — wpis Perplexity
Claude: jedna pamięć między chatem a Cowork, czytelna plik po pliku
25 sierpnia — Anthropic usuwa granicę między dwiema pamięciami, które dotąd współistniały. To, co Claude pamięta z waszych rozmów w czacie, jest teraz dokładnie tym samym, czym dysponuje w Claude Cowork, i odwrotnie jest również prawdą. W praktyce, gdy Cowork wykonuje zadanie w chmurze, startuje z kontekstem nagromadzonym przez miesiące: priorytetami na kwartał, stanem zaawansowania projektów, preferencjami redakcyjnymi rozmówcy. Anthropic podaje celowo przyziemne przykłady — poprosić o status dla swojego przełożonego bez konieczności doprecyzowania, o kogo chodzi i jak ta osoba lubi otrzymywać informacje.
Druga zmiana jest subtelniejsza, ale zmienia codzienne zachowanie: pamięć aktualizuje się w trakcie rozmowy, a nie na podstawie streszczenia wygenerowanego po fakcie. Wystarczy wspomnieć, że termin został przesunięty na wrzesień, by kolejna rozmowa to uwzględniła. Formuła „zapamiętaj to” nadal pozostaje dostępna, aby wymusić zapis konkretnego elementu, a pamięć można w każdej chwili wstrzymać lub zresetować.
Jeśli chodzi o przejrzystość, Anthropic wybrał reprezentację czytelną zamiast czarnej skrzynki: wszystko, co Claude zapamiętuje, pojawia się w postaci krótkich plików, pogrupowanych tematycznie, w Ustawieniach, a następnie w Pamięci. Każdy z nich można przeczytać, poprawić lub usunąć. Praktyczna korzyść jest natychmiastowa — poprawienie starej nazwy swojej firmy w jednym pliku wystarcza, by wszystkie kolejne rozmowy używały właściwej.
Obsługa tematów wrażliwych jest najciekawszym punktem z perspektywy decyzji produktowych. Domyślnie Claude nie zapamiętuje tego, co dotyczy zdrowia, pochodzenia, etniczności, przekonań religijnych, poglądów politycznych ani tożsamości płciowej. Anthropic przyznaje jednak, że granica jest osobista, i oferuje opcjonalne ustawienie pozwalające uwzględniać te tematy — tak, by Claude mógł przypomnieć sobie nietolerancję glutenu, gdy proponuje przepisy. To ustawienie nie działa wstecz i można je wyłączyć w dowolnym momencie. Jedna kategoria pozostaje wykluczona niezależnie od ustawienia: numery identyfikacyjne, historia karna, status migracyjny oraz szerzej wszystko, co narusza Zasady dopuszczalnego użytkowania. Claude wyraźnie sygnalizuje, kiedy nie może zapisać informacji tego typu, co jest decyzją projektową faworyzującą widoczną odmowę zamiast cichego filtrowania.
| Aspekt pamięci | Opisane zachowanie |
|---|---|
| Zakres | Jedna wspólna pamięć dla chatu i Claude Cowork |
| Moment aktualizacji | W trakcie rozmowy, zamiast podsumowania po jej zakończeniu |
| Format przechowywania | Krótkie pliki pogrupowane tematycznie, czytelne i edytowalne osobno |
| Tematy wrażliwe | Domyślnie nie są zapamiętywane, można je włączyć ustawieniem, bez efektu wstecznego |
| Stałe wykluczenia | Numery identyfikacyjne, historia karna, status migracyjny |
| Plany Free, Pro i Max | Pamięć aktywna domyślnie w sieci, na komputerze i na urządzeniach mobilnych |
| Plany Team i Enterprise | Otwierana przez administratora, wyłączona dla użytkownika do czasu aktywacji |
🔗 Pamięć Claude działa wszędzie · Ogłoszenie @claudeai
IBM otwiera Granite 4.2, swoją pierwszą rodzinę modeli do rozumowania, oraz dwa modele ASR 470M
25 sierpnia — IBM publikuje Granite 4.2, przedstawioną jako pierwszą rodzinę gęstych modeli językowych typu decoder-only, zaprojektowanych wprost do rozumowania. Podczas gdy poprzednie generacje stawiały na wydajność i klasyczne zadania biznesowe, ta wersja umieszcza rozumowanie w centrum i czyni je modułowym: każdy model udostępnia trzy tryby — thinking, non-thinking oraz low-effort — które aplikacja wybiera w zależności od budżetu opóźnienia i tokenów, jaki jest gotowa opłacić. Trzy rozmiary (3B, 8B, 30B) współdzielą tę samą architekturę i ten sam pipeline, więc przejście między nimi jest bezbolesne po stronie integracji.
Architektura pozostaje klasyczna: uwaga GQA z 40 głowami dla 8 głów KV, RoPE z θ równym 10 milionów, aby utrzymać kontekst 131 072 tokenów, MLP SwiGLU, normalizacja RMSNorm, trening w bfloat16 na klastrze NVIDIA GB200 NVL72 hostowanym przez CoreWeave. Pre-trening startuje od zera na około 15 000 miliardach tokenów podzielonych na pięć faz. To, co naprawdę wyróżnia Granite 4.2, to post-trening: pipeline wzmocnienia złożony z wyspecjalizowanych etapów zamiast pojedynczego przebiegu, w asynchronicznym GRPO z przyciętym próbkowaniem ważonym, tak że połówki generująca i trenująca pętli nigdy nawzajem się nie blokują. Curriculum obejmuje trzy przebiegi RLVR z weryfikowalnymi nagrodami, ukierunkowane wzmacniacze dla śledzenia instrukcji i kodu, dwa etapy software engineering w kontekście 128K, etap terminalowy, etap wyszukiwania, a następnie wyrównanie RLHF. Blok wzmocnienia agentowego jest stosowany wyłącznie do modeli 8B i 30B, co wyjaśnia różnicę w wydajności kodowania agentowego między 3B a jego większymi braćmi.
| Benchmark opublikowany przez IBM | 3B Dense | 8B Dense | 30B Dense |
|---|---|---|---|
| SWE-Bench Verified | — | 47,67 | 57,00 |
| SWE-Bench Multilingual | — | 30,78 | 41,89 |
| Terminal-Bench 2.1 | — | 20,56 | 29,24 |
| τ³-bench | 45,78 | 58,06 | 62,00 |
| AIME25 | 78,33 | 86,67 | 89,17 |
| GPQA | 54,80 | 64,14 | 66,41 |
| LiveCodeBench v6 | 69,71 | 73,24 | 75,77 |
| MMLU-Pro | 67,84 | 74,04 | 77,60 |
| RULER 128K | 55,30 | 71,41 | 81,38 |
Publikacja nie ogranicza się do wag bfloat16: cztery warianty skwantyzowane towarzyszą wydaniu dla vLLM — dynamiczne FP8 na kanał bez kalibracji, NVFP4 i MXFP4 przez GPTQ skalibrowane na 2 000 próbkach SFT — a także czternaście formatów GGUF dla llama.cpp, od Q2_K do Q8_0. Obsługiwanych jest dwanaście języków, w tym francuski, a trzy szkielety kodowania agentowego są udokumentowane już pierwszego dnia: OpenCode, Pi i OpenHands. W kwestii jakości danych IBM opisuje łańcuch, w którym GPT-OSS-120B i Gemma 4 służą jako sędziowie oceniający próbki SFT, przed lokalną i globalną deduplikacją za pomocą haszowania SHA-256.
Tego samego dnia IBM publikuje Granite Speech 5.0 Turbo CTC, dwa modele rozpoznawania mowy angielskiej o 470 milionach parametrów, różniące się wyłącznie danymi treningowymi i licencją — Apache 2.0 dla wariantu standardowego, CC-BY-NC-SA-4.0 dla wariantu trenowanego na dodatkowych danych. Zmiana architektury jest znacząca: wcześniejsze Granite Speech łączyły encoder akustyczny, projektor i LLM, natomiast te są wyłącznie encoderami. Stos nakłada 16 bloków Conformer, stosuje auto-conditioning na wyjściu ósmego bloku, zastępuje uwagę iloczynem skalarnym uwagą blokową (chunkwise), aby uniknąć kwadratowej skalowalności, i optymalizuje bezpośrednio stratę CTC. Prawdziwą nowością jest liczba tokenów: operacje podpróbkowania zmieniają strumień z 100 ramek na sekundę na wyjściu spektrogramu log-Mel do 12,5 na sekundę, co wyjaśnia „Turbo” w nazwie. Wyniki są raportowane na OpenASR Leaderboard i FFASR Leaderboard dla pola dalekiego, z wykresami Pareto szybkość/dokładność zamiast pojedynczych wyników, oraz z demonstracją ciągłego rozpoznawania uruchamianą w przeglądarce przez WebGPU, ograniczoną do Chrome i Edge.
🔗 Granite 4.2 — ścieżka techniczna · Granite Speech 5.0 Turbo CTC
WeatherNext Cyclones, pierwszy model AI używany w czasie rzeczywistym przez National Hurricane Center
25 sierpnia — Google AI opisuje WeatherNext Cyclones, model prognozowania cyklonów tropikalnych pochodzący z Google DeepMind i Google Research. Ogłoszenie jest godne uwagi mniej ze względu na surową wydajność niż z powodu tego, co mówi o przejściu meteorologicznej AI z laboratorium do operacyjnego użycia.
Atakowany problem ma charakter strukturalny. Dotychczas śledzenie cyklonu wymagało kompromisu: modele fizyczne uruchamiane na superkomputerach dobrze oddają duże struktury atmosferyczne przemierzające planetę, ale zrozumienie lokalnej, intensywnej fizyki decydującej o sile burzy wymuszało przejście na zupełnie inne modele regionalne. WeatherNext Cyclones eliminuje to przełączanie, przewidując jednocześnie trajektorię, intensywność i rozmiar.
Zapowiadany zysk to pełny dzień dodatkowego wyprzedzenia względem poprzednich systemów. Google ujmuje porównanie w wymowny sposób: prognozy trzydniowe osiągają dziś dokładność dawnych prognoz dwudniowych, co historycznie wymagało dekady postępu metodologicznego. Drugą korzyścią jest charakter probabilistyczny: model jest wystarczająco szybki, by generować do 1 000 symulacji na burzę, zastępując pojedynczą „najbardziej prawdopodobną” trajektorię wachlarzem scenariuszy. Dzięki temu szybkie nasilanie staje się bardziej czytelne, definiowane jako wzrost maksymalnych podtrzymywanych wiatrów o co najmniej 30 węzłów w ciągu 24 godzin. W tym roku 1 000 probabilistycznych prognoz na burzę jest dostarczanych synoptykom za pośrednictwem WeatherLab.
Najbardziej znaczący pozostaje rzeczywisty deployment. Podczas sezonu huraganowego 2025 WeatherNext Cyclones został poddany próbie w ramach amerykańskiego National Hurricane Center — po raz pierwszy ta instytucja używa modeli AI w operacjach czasu rzeczywistego. Meteorolodzy korzystali z niego, by wyznaczyć prognozę lądowania huraganu Melissa w kategorii 5 na Jamajce, dając lokalnym władzom dodatkowy czas na przygotowania. Artykuł ukazał się w Nature, a Google zapowiada publikację kodu i wag modelu w open source na GitHubie.
| Aspekt modelu | Wkład WeatherNext Cyclones |
|---|---|
| Prognozowane wielkości | Trajektoria, intensywność i rozmiar w jednym przebiegu |
| Zysk wyprzedzenia | Jeden dzień; prognoza 3-dniowa = dokładność dawnej 2-dniowej |
| Symulacje na burzę | Do 1 000 |
| Wdrożenie operacyjne | U.S. National Hurricane Center, sezon huraganowy 2025 |
| Udokumentowany przypadek | Lądowanie huraganu Melissa kategorii 5 na Jamajce |
| Próg intensyfikacji | Ponad 30 węzłów maksymalnych podtrzymywanych wiatrów w 24 h |
| Tryb udostępnienia | WeatherLab; kod i wagi w open source na GitHubie |
🔗 Ogłoszenie @GoogleAI · Wpis Google DeepMind
Stability AI zamyka rundę B na 76 milionów dolarów z EA, Sony Music, Universal i Warner
25 sierpnia — Stability AI ogłasza zamknięcie rundy B: 76 milionów dolarów świeżego kapitału, co podnosi łączne finansowanie do 232 milionów od przejęcia kontroli nad firmą przez Prem Akkaraju w czerwcu 2024 roku, łącznie z dwiema rundami udziałowymi i obligacjami zamiennymi. Kwota pozostaje skromna jak na skalę sektora, ale prawdziwym tematem jest skład inwestorów.
Do kapitału wchodzą cztery ciężkie marki rozrywki: Electronic Arts w obszarze gier, Sony Music Group, Universal Music Group i Warner Music Group w muzyce. Trzy największe wytwórnie płytowe są teraz akcjonariuszami tego samego laboratorium. Dołączają też AMD Ventures i Pacific Alliance Ventures. Ci inwestorzy nie pojawiają się znikąd: EA, Universal i Warner były już strategicznymi partnerami Stability AI od jesieni 2025 roku. Runda zamienia więc istniejące umowy handlowe w udziały kapitałowe.
Drugi sygnał dotyczy lojalności inwestorów finansowych. Coatue, Greycroft, Kadmos Capital, Sean Parker i Eric Schmidt dokładają kapitał po raz drugi z rzędu pod nowym kierownictwem — co, po burzliwym okresie, przez jaki Stability AI przeszło w 2023 i 2024 roku, stanowi potwierdzenie. Thomas Laffont, współzałożyciel Coatue, dołącza do rady nadzorczej, w której zasiadają już James Cameron, Sean Parker, Dana Settle i Prem Akkaraju.
This unmatched group of investors is an affirmation of our vision where generative AI empowers every producer, musician, and storyteller. Stability is unique in the AI field because we are creative people making tools for creatives.
🇵🇱 Ta wyjątkowa grupa inwestorów potwierdza naszą wizję: generatywnej AI, która daje możliwości każdemu producentowi, muzykowi i opowiadaczowi historii. Stability jest wyjątkowe w dziedzinie AI, ponieważ jesteśmy twórcami budującymi narzędzia dla twórców. — Prem Akkaraju, CEO Stability AI, komunikat z 25 sierpnia
Przyjęta strategia to model niszowego laboratorium: nie model ogólny, lecz narzędzia dla profesjonalistów kreatywnych, budowane razem z podmiotami posiadającymi prawa, a nie przeciwko nim. To dokładnie kierunek Stable Audio 3.0, rodziny modeli z otwartymi wagami, trenowanej na w pełni licencjonowanych danych, rozszerzonej 18 sierpnia o wtyczkę do stacji roboczych audio. Pieniądze mają finansować kolejne produkty, badania stosowane i dział usług profesjonalnych.
ChatGPT po stronie przedsiębiorstw: wtyczka Admin, rozszerzenie wieloprzeglądarkowe i miejsce Premium za 100 dolarów
25 sierpnia — Trzy ogłoszenia OpenAI kierują się do tej samej grupy odbiorców: organizacji wdrażających ChatGPT i Codex na dużą skalę.
Najbardziej istotna jest wtyczka Admin dla ChatGPT Work i Codex, która łączy w jednej rozmowie to, co dotąd wymagało przechodzenia między pulpitami analitycznymi, ekranami ustawień i raportami. Zakres obejmuje codzienne zadania: zrozumienie adopcji i zużycia kredytów, wykrywanie członków lub grup zbliżających się do limitów, zarządzanie dołączeniami i odejściami, sprawdzanie faktycznych uprawnień i diagnozowanie problemów z dostępem, dostosowywanie limitów użycia oraz rozpatrywanie próśb o wydatki w odniesieniu do rzeczywistego zużycia. Najciekawsza jest automatyzacja bez pisania kodu: oczekujące prośby o użycie mogą być kierowane do Slacka lub Microsoft Teams w celu zatwierdzenia w narzędziu, którego walidatorzy już używają, a prośby o dostęp do funkcji mogą być przyznawane automatycznie, gdy spełniają z góry zdefiniowane kryteria, przy czym wyjątki trafiają do człowieka. Strukturalnie ważny punkt po stronie bezpieczeństwa: wtyczka działa w obrębie istniejącej roli i uprawnień użytkownika i nie rozszerza żadnego dostępu, a każde polecenie jest mapowane na obsługiwaną akcję odczytu lub zapisu ze strukturalnym wynikiem. OpenAI przytacza własne użycie — agent ChatGPT Work w Slacku obsługuje wewnętrzne prośby IT, a wdrożone przepływy pracy rozwiązują około 45% wolumenu zgłoszeń, likwidując backlog w momencie, gdy wolumen wsparcia mniej więcej się podwoił.
Drugie ogłoszenie: rozszerzenie przeglądarkowe ChatGPT wychodzi poza Chrome i obsługuje Microsoft Edge, Brave, Opera oraz Vivaldi. Zmiana ma znaczenie dla osób pracujących w alternatywnej przeglądarce z wyboru prywatności albo z konieczności wynikającej z polityki firmy. Wyróżniono dwa zastosowania: przenoszenie kontekstu otwartych kart do zadania za pomocą wzmianki @ tab w ChatGPT Desktop, tak aby Codex pracował na podstawie już wyświetlanej dokumentacji lub zgłoszenia; oraz pozwolenie agentowi sterować przeglądarką w celu wykonywania konkretnych zadań webowych, przy czym anulowanie subskrypcji pojawia się wśród podanych przykładów.
Trzecie ogłoszenie, bardziej lakoniczne: miejsce Premium za 100 dolarów dołącza do oferty ChatGPT Business, pozycjonowanej dla małych firm i startupów z planem przedstawianym jako elastyczny i skalowalny wraz z rozmiarem zespołu. Ogłoszenie zostało opublikowane na X bez szczegółowego wpisu na blogu, a dokładny skład tego miejsca nie został określony w komunikacie.
🔗 Wtyczka Admin · Rozszerzenie wieloprzeglądarkowe · Miejsce Premium ChatGPT Business
NVIDIA: Gamescom dla RTX Spark i SANA, która zmniejsza latencję MiniMax H3 27-krotnie
25 sierpnia — NVIDIA wykorzystuje Gamescom, odbywający się w tym tygodniu w Kolonii, by rozbudować katalog RTX Spark, swojej platformy komputerów z Windows, oczekiwanej tej jesieni. Electronic Arts, Embark Studios i Ubisoft dołączają do KRAFTON, NetEase, Riot Games i XBOX, które zadeklarowały się już podczas COMPUTEX w maju. Wymienione tytuły obejmują różne wymagania techniczne: EA SPORTS F1 25 i Apex Legends po stronie EA, Anno 117: Pax Romana w Ubisoft, ARC Raiders i THE FINALS w Embark Studios.
Najbardziej konkretny punkt dotyczy antycheata. Uruchomienie gry nie wystarcza: duże tytuły sieciowe zależą od systemów antycheatowych, które muszą zostać przeniesione na każdą platformę, inaczej gra pozostaje niegrywalna w trybie wieloosobowym. NVIDIA ogłasza współpracę z EA, aby natywnie przenieść EA Javelin Anticheat na RTX Spark — właśnie tego typu szczegół infrastrukturalny decyduje o realnej adopcji nowej platformy PC. Po stronie renderingu DLSS 4.5 Ray Reconstruction jest dostępne natychmiast, z modelem transformer drugiej generacji, który zastępuje klasyczne odszumiacze siecią trenowaną na superkomputerze. Path tracing trafia do CONTROL Resonant i 007 First Light, Gears of War: E-Day integruje RTX Mega Geometry, a technologie NVIDIA ACE są zapowiedziane w Aniimo na początek 2027 roku.
Druga odsłona tego samego gracza, z 24 sierpnia, jest bardziej techniczna. MiniMax relacjonuje wyniki osiągnięte przez zespół SANA firmy NVIDIA na Sol Engine zastosowanym do jego modelu wideo H3: dziesięć sekund wideo w 768p generowane na jednym GB200 spada z 414 sekund do 14,93 sekundy, czyli przyspieszenie wynosi 27,7x. Metoda nie opiera się na optymalizacji jąder, lecz na podziale generowania na dwa przebiegi — szkic w niskiej rozdzielczości tworzony przez H3 w 4 krokach, a następnie etap dopracowania do docelowej rozdzielczości powierzony LTX w 3 krokach z Sol-Attn. Łącznie siedem kroków. Drugą dźwignią jest zastąpienie kosztownych dekodowań VAE przez TAEH3 i TAEHV, lżejsze dekodery, przy jednoczesnym utrzymaniu latentów w stabilnym stanie na potrzeby etapu dopracowania.
| Pomiar na MiniMax H3 | Zmierzona wartość |
|---|---|
| Mierzony ładunek | 10 s wideo w 768p, jeden GB200 |
| Latencja przed | 414 s |
| Latencja po | 14,93 s |
| Współczynnik przyspieszenia | 27,7x |
| Kroki generowania | 4 (szkic H3 w niskiej rozdzielczości) + 3 (LTX) |
| Zastąpione dekodery | TAEH3 i TAEHV zamiast dekodów VAE |
| Przepustowość na węzeł | 378 000 wideo miesięcznie, ponad 97% marginesu GPU |
Szacowana przepustowość to estymacja MiniMax, a nie pomiar produkcyjny, i należy ją tak właśnie odczytywać. Kierunek jest jednak jasny: przy piętnastu sekundach na dziesięć sekund wideo wysokiej wierności generowanie wideo wychodzi z asynchronicznego renderowania wsadowego do niemal interaktywnej infrastruktury.
🔗 NVIDIA na Gamescomie · SANA i Sol Engine na H3
Chińskie modele otwarte stają się punktem odniesienia dla badań, a Qwen3.8-27B wchodzi do top 10 Code Arena
25 sierpnia — Qwen przekazuje tego samego ranka dwa wyniki, a drugi nadaje sens pierwszemu.
Pierwszy to ranking. Qwen3.8-27B trafia do klasyfikacji Code Arena: WebDev, oceniającej modele pod kątem generowania interfejsów webowych, na 9. miejsce w klasyfikacji ogólnej z 1595 punktami. Jest jedynym modelem o swojej kategorii rozmiaru w top 10 i znajduje się zaledwie sześć miejsc za Qwen3.8-Max, znacznie większym modelem. Arena podkreśla, że model ten przesuwa granicę Pareto rankingu, i podaje wymowny punkt odniesienia: Gemma 4-31B, porównywalny rozmiarem, ale wydany w kwietniu, zajmuje 80. miejsce.
| Oceniany model | Miejsce w Code Arena: WebDev | Liczba punktów | Uwagi z rankingu |
|---|---|---|---|
| GLM-5.3 (Max) | 8. miejsce ogólnie | 1597 | Stan na 20 sierpnia, 2. wśród modeli otwartych |
| Qwen3.8-27B | 9. miejsce ogólnie | 1595 | Jedyny model tego rozmiaru w top 10 |
| Qwen3.8-Max | Sześć miejsc przed 27B | n.d. | Znacznie większy model z tej samej rodziny |
| Gemma 4-31B | 80. miejsce ogólnie | n.d. | Wydany w kwietniu 2026 |
Drugi wynik to pomiar użycia. Nathan Lambert, który współkierował projektem Olmo w Ai2, zlecił Codexowi przejrzenie 500 000 artykułów arXiv z dziedziny AI i uczenia maszynowego opublikowanych od premiery ChatGPT, aby zidentyfikować modele otwarte rzeczywiście używane w badaniach. Odwrócenie widać w dwóch liczbach: w 2024 roku około 30% artykułów wspominało amerykański model otwarty, a 10% chiński; dziś około 40% cytuje chiński otwarty LLM, a tylko 25 do 30% amerykański.
| Rodzina modeli | Udział artykułów cytujących LLM |
|---|---|
| OpenAI (modele zamknięte) | około 37% |
| Qwen | około 33% |
| Gemini, Claude | 10 do 15% |
| Gemma, Mistral | 5 do 10% |
| Olmo | około 1% |
W szczegółach Qwen jest wspominany w jednej trzeciej artykułów cytujących jakikolwiek LLM. Llama osiągnęła szczyt około kwietnia 2025 roku na poziomie 30%, dokładnie w momencie premiery Llama 4, i od tego czasu spada. Lambert sam stawia ważne zastrzeżenie: publikacje pozostają w tyle za premierami modeli, ponieważ badania wymagają czasu — te liczby opisują stan trwających prac, a nie aktualne preferencje chwili. W tle widać szerszy trend, odrębny od pojedynku open vs. closed: odsetek artykułów AI wspominających LLM wzrósł z 10,43% w styczniu 2023 roku do ponad 50% w 2026 roku.
🔗 Qwen3.8-27B na Code Arena · Relacja Qwen z analizy arXiv · Analiza @natolambert
Claude Code przechodzi do 2.1.245, a renderowanie Claude w sieci staje się 4 razy płynniejsze
W oknie pojawiły się dwie wersje Claude Code, a ich zawartość wyraźnie celuje w wdrożenia organizacyjne. CHANGELOG nie zawiera dat, ale historia Git je umiejscawia: 2.1.243 pojawia się w commicie z 24 sierpnia o 23:40 UTC, a 2.1.245 w tym z 25 sierpnia o 05:13 UTC.
| Dodane ustawienie | Dotyczy wersji | Znaczenie praktyczne |
|---|---|---|
modelPricing | 2.1.243 | Ceny kontraktowe w /cost, pasku stanu i telemetrii |
modelPicker | 2.1.243 | Uporządkowana i oznaczona lista modeli dla /model |
promptCacheTtl / subagentPromptCacheTtl | 2.1.243 | Godzinny cache promptu dla rozmowy, 5 min dla subagentów |
Ventilation Loops w /usage | 2.1.243 | Wykrywanie zbaczających z kursu zadań /loop |
| Logowanie bez klucza przez Console | 2.1.243 | Organizacje, które zakazują kluczy API |
| Poprawka glibc 2.44 | 2.1.245 | Awaria przy uruchamianiu na Arch Linux, CachyOS i Fedora Rawhide |
Najbardziej znaczącym ustawieniem jest modelPricing: dotąd wyświetlane koszty opierały się na stawce publicznej, a teraz organizacja może wprowadzić własne stawki kontraktowe per model i współczynnik rabatu, co sprawia, że liczby stają się bezpośrednio użyteczne do wewnętrznego refakturowania. Para promptCacheTtl i subagentPromptCacheTtl rozwiązuje konkretny kompromis ekonomiczny dla użytkowników z kluczem API: trzymać godzinny cache dla głównej rozmowy, gdzie kontekst pozostaje stabilny, a jednocześnie ograniczyć subagentów do pięciu minut, bo ich konteksty są bardziej zmienne. Po stronie poprawek zdalne serwery MCP w trybie nieinteraktywnym nie pozostają już zablokowane po przerwaniu połączenia, /resume nie ogranicza się już do pięćdziesięciu najnowszych sesji, a sesje milczące przez ponad dziesięć minut wygasają teraz po około trzech minutach przed ponowną próbą i jasnym błędem.
24 sierpnia Anthropic ogłasza ponadto, że przepisał silnik wyświetlający odpowiedzi będące jeszcze w trakcie generowania w Claude web i desktop. Zasada jest klasyczna w renderowaniu interfejsów: dotykać tylko tego, co nadal się zmienia, zamiast przerysowywać całą odpowiedź przy każdym nowym fragmencie. Przy długiej odpowiedzi różnica jest strukturalna — koszt renderowania przestaje rosnąć wraz z długością już wyświetlonego tekstu. Zapowiedziane zyski są spójne: około 4 razy większa płynność, 9 razy mniej zacięć na słabszym laptopie, 4,5 razy krótsze najgorsze zawieszenie interfejsu i utrzymane 120 klatek na sekundę od początku do końca na MacBooku 120 Hz. Ciekawy jest docelowy odbiorca: najbardziej zyskują skromniejsze konfiguracje.
🔗 CHANGELOG Claude Code · Renderowanie 4x płynniejsze, @ClaudeDevs
Agenci kodu się uprzemysławiają: Warp publikuje format swoich factories, Rohlik zleca agentom pisanie 90% kodu
24 sierpnia pod koniec dnia — Warp pokazuje wewnętrzną mechanikę Warp Factories, swojej ogłoszonej 18 sierpnia platformy agentów cloud: wybrany format konfiguracji i otwarcie dostępu wczesnego. Punkt wyjścia jest jasno określony — Warp przenosi własnych agentów poza lokalne maszyny ze względów jakościowych i kosztowych, a potrzebował opisać środowiska, uprzęże i uprawnienia bezpieczeństwa jak wersjonowany kod.
| Element konfiguracji | Wybrana wartość |
|---|---|
| Plik definicji | factory.yaml, schemaVersion: v1alpha1 |
| Kluczowe elementy | name, repositories (owner / name), agentDefaults.model |
| Definicja agenta | agents/<nom>/agent.md z agentType (FOREMAN, REVIEW…) i model |
| Wyzwalacze | automations/<nom>/automation.md : agent, triggers (dostawca, zdarzenie) |
| Dostępne interfejsy | CLI (warp agent run-cloud), API REST, SDK TypeScript, serwer MCP |
| Dostęp wczesny | Do 10 000 USD darmowego użycia dla kwalifikujących się klientów |
Rozdzielenie jest interesujące: agenci nie są opisywani w jednym YAML-u, lecz w osobnych plikach Markdown, dzięki czemu definicja agenta staje się dokumentem czytelnym i łatwym do porównywania. Warp stosuje tę receptę do samego siebie — jego wewnętrzna factory, nazwana „wilson”, obejmuje repozytoria takie jak warp-server czy warp-terraform, deklaruje sekrety i serwery MCP oraz porządkuje agentów według ról (code-review, foreman, implementation, spec, triage) w 34 liniach. Liczby podawane na stronie z prośbą o dostęp są argumentami handlowymi nieweryfikowalnymi z zewnątrz: 200 000 uruchomień agentów dziennie, ponad 30% scalonych pull requestów bez poprawek, 20% niższy koszt na pull request.
25 sierpnia Cognition publikuje z kolei studium przypadku zdecydowanie lepiej udokumentowane niż poprzednie. Rohlik Group to internetowy dystrybutor żywności, który narodził się w Czechach, działa w pięciu krajach, jest rentowny i w ubiegłym roku osiągnął ponad 1,3 miliarda dolarów przychodu; dostarcza cotygodniowy komplet 17 000 produktów w mniej niż godzinę albo w 15-minutowych oknach. Liczba, która porządkuje artykuł: około 90% kodu jest dziś tam generowane przez agentów, a organizacja inżynierska określa się jako „agent-mostly”.
To nie jest wynik uzyskany przez samo podłączenie narzędzia. Rohlik mówi, że zaczął rok temu, od pierwszego doświadczenia z Devin, uznanego za bugujące. To, co zmieniło sytuację, to fundamenty po stronie klienta: ponad pięćdziesiąt wewnętrznych i zewnętrznych integracji MCP, z zasadą, że każde nowe narzędzie musi być dostępne dla agentów od pierwszego dnia, warstwa semantyczna nad hurtownią danych Snowflake oraz baza wiedzy dająca agentom kontekst, który przekazałoby się nowemu współpracownikowi. Praca trafia do Devina z miejsca, w którym powstaje: rozmowy na Slacku o błędzie albo dokumentu specyfikacji Linear rozwijanego aż do pull requestu. Deklarowane rezultaty — podwojony throughput inżynierski od listopada, integracja robotyki AutoStore dostarczona w osiem miesięcy, podczas gdy branża potrzebuje dwóch do trzech lat, prototypowanie skrócone z miesiąca do jednego dnia — pozostają tym, co podaje strona klienta opublikowana przez dostawcę. Najbardziej wymowny efekt jest gdzie indziej: najlepsi inżynierowie spędzają teraz 80% czasu na przeglądaniu kodu, a około 30% użycia Devina w Rohlik to analiza danych przez użytkowników biznesowych.
🔗 Format factory.yaml, @warpdotdev · Studium przypadku Rohlik, @cognition · Strona klienta Devin
GitHub: cztery ćwiczenia o workflow agentowych i zakładka Customize w ogólnej dostępności
25 sierpnia — GitHub udostępnia cztery nowe ćwiczenia na swojej platformie nauki GitHub Skills. Punkt widzenia jest jasny: zamiast dokumentować agentowe nowości roku, GitHub proponuje ćwiczenie ich w repozytorium demonstracyjnym, z instrukcjami dostarczanymi wraz z pull requestami.
| Opublikowane ćwiczenie | Temat ćwiczenia |
|---|---|
| Agent Orchestration Build Your AI Dream Team | Agenci niestandardowi w Copilot CLI: planowanie, projektowanie, budowanie, walidacja, przekazywanie |
| Agentic Workflows that Read the Room | Rozszerzenie gh aw, agentowy workflow w Markdown, zmiany przesyłane przez pull requesty |
| Idea to Merge with the Copilot App | Od sesji do scalonego pull requestu, całkowicie w aplikacji GitHub Copilot |
| Ship with Quality | Zautomatyzowane sygnały jakości, pokrycie testami, wymuszone kontrole na pull requestach |
Najbardziej godne uwagi z czwórki jest pierwsze: to pierwszy raz, kiedy GitHub proponuje prowadzoną ścieżkę po orkiestracji wielu agentów w swoim CLI, temacie dotąd dokumentowanym wyłącznie opisowo. Drugie wprowadza rozszerzenie gh aw, z ważnym dla bezpieczeństwa założeniem — zmiany proponowane przez workflow przechodzą przez pull requesty, zamiast być stosowane bezpośrednio, co zachowuje punkt ludzkiej kontroli.
Tego samego dnia aplikacja GitHub Copilot zyskuje zakładkę Customize w ogólnej dostępności. Jej zadaniem jest zebranie w jednej przestrzeni czterech mechanizmów rozszerzania wprowadzonych osobno w ostatnich miesiącach: serwerów MCP, pluginów, skills i canvases. Widok Featured pokazuje wybór redakcyjny z każdej kategorii dla użytkownika, który wie, co chce zrobić, ale nie wie, jaki typ rozszerzenia temu odpowiada, a serwery MCP dostają własną nawigację z opcjami wyróżnianymi według popularności i ścieżką według kategorii. Changelog ilustruje użyteczność canvases konkretnym przypadkiem: canvas Azure DevOps do sortowania issue, priorytetyzacji backlogu, przypisywania follow-upów, a następnie przekazania zadania Copilotowi, aby zbadał sprawę, zaimplementował rozwiązanie albo przygotował review.
🔗 Cztery ćwiczenia GitHub Skills · Zakładka Customize w ogólnej dostępności
Narzędzia Google dla deweloperów: Gemini CLI 0.57.0 i Antigravity 2.10.0
25 sierpnia — Google publikuje stabilną wersję 0.57.0 Gemini CLI, a kwadrans wcześniej preview 0.58.0. Zawartość tej wersji mówi mniej o nowych funkcjach niż o tym, jak Google utrzymuje swoje narzędzie: spośród 24 wpisów changelogu 13 zaczyna się od [SSR Agent] Issue Fix i odsyła do numerów issue często starych, od 19239 do 28518. Te poprawki dotyczą narastających irytacji z backlogu — bezterminowego zawieszania interfejsu terminala, któremu dodano timeouty, mylącego administracyjnego komunikatu o błędzie dla kont osobistych, braku odstępu po sugestiach autouzupełniania, renderowania terminala, które nie odświeżało się po wyjściu z zewnętrznego edytora. Innymi słowy, Google przepuszcza agenta przez własny dług techniczny, a rezultat trafia bezpośrednio do stabilnej wersji.
| Opublikowana wersja | Data i godzina (UTC) | Kanał wydania | Najważniejsze punkty |
|---|---|---|---|
| v0.57.0 | 25 sierpnia, 18:37:14 | Stable | 13 poprawek [SSR Agent], walidacja evals, context retries |
| v0.58.0-preview.0 | 25 sierpnia, 18:22:01 | Preview | Izolacja Docker w profilu Seatbelt macOS, sprawdzacze bezpieczeństwa |
Po stronie funkcji wysiłek skupia się na ewaluacji, z komendą walidacji evals i formatterem wywołań narzędzi integrującym podsumowania niepowodzeń. Niezawodność też rośnie: błędy pojemności wywołują ciche retries uwzględniające kontekst, a anulowanie wieloturowego zapytania powoduje pełny rollback zamiast stanu częściowego. Dla osób szukających not wydań warto odnotować, że plik docs/changelogs/index.md repozytorium nie został zaktualizowany poza v0.54.0 z 6 sierpnia.
Cztery dni po 2.9.1 i jej Remote Control, Google Antigravity przechodzi do 2.10.0 24 sierpnia i wypełnia dwie luki, które zmuszały do wychodzenia z narzędzia: zintegrowany terminal i natywną kontrolę wersji Git, oba umieszczone bezpośrednio w pasku bocznym. To spójne z trajektorią produktu — Antigravity pozycjonuje się jako środowisko, w którym steruje się agentami, a nie edytuje kod linia po linii, ale trzeba jeszcze móc uruchomić komendę i obejrzeć diff bez zmiany okna. Reszta wersji rozszerza to, co można wysłać do agenta i co widać z jego pracy: pliki audio dołączają do akceptowanych załączników, interaktywny komentarz na obrazach pozwala anotować wizualizację, by ukierunkować agenta, a wzbogacone podglądy wykonania narzędzi MCP czynią czytelnym to, co faktycznie zrobił serwer narzędzi. Google podaje 13 ulepszeń i 8 poprawek, z progresywnym wdrażaniem.
🔗 Gemini CLI v0.57.0 · Changelog Antigravity
Anthropic finansuje 5 milionów dolarów niezależnych ewaluacji dotyczących dobrostanu
25 sierpnia — Anthropic uruchamia program grantów o wartości 5 milionów dolarów, przeznaczony na finansowanie niezależnych badań nad wpływem AI na dobrostan jej użytkowników. Laureaci otrzymują bezpośrednie finansowanie, dostęp do modeli i wsparcie techniczne, ale pracują całkowicie niezależnie: ich ewaluacje są publikowane jako open source i mogą być wykorzystywane przez całą branżę. Nabór wniosków trwa do 21 września, a kandydaci wybrani do złożenia pełnej propozycji zostaną powiadomieni przed 5 października.
Argumentacja techniczna wyjaśnia, dlaczego ta dziedzina opiera się zwykłym metodom ewaluacji. W przypadku większości zachowań modelu wystarczy przejrzeć pojedynczą odpowiedź, by ocenić, czy jest dokładna i odpowiednia. Dobrostan wymaga kontekstu: osoba w kryzysie nie musi od razu wspominać o myślach autoagresywnych, a porady dotyczące rozsądnego bilansu żywieniowego, poprawne w jednym przypadku, mogą stać się potencjalnie niebezpieczne, jeśli dana osoba ma historię zaburzeń odżywiania. Zespół Safeguards publikuje równolegle pięć kryteriów rygoru: jasno określić, co jest mierzone, włączyć klinicystów i specjalistów dziedzinowych do projektowania, testować zarówno środki ostrożności, jak i szkody — czyli oceniać ryzyko nadmiernej uległości tak samo jak nadmiernej odmowy — odzwierciedlać rzeczywiste użycie poprzez scenariusze wieloturowe oraz walidować automatyczne korektory wobec prawdziwych ekspertów. To trzecie kryterium, symetria między nadmierną zgodnością a nadmierną odmową, odróżnia to podejście od zwykłego zaostrzenia zabezpieczeń.
🔗 Granty badawcze dotyczące dobrostanu
Quantization-Aware Healing : model 4-bit, który przewyższa swój oryginał w pełnej precyzji
25 sierpnia — Standardowy pipeline do uczynienia dużego modelu gotowym do wdrożenia obejmuje trzy etapy: skompresować architekturę, skwantyzować wynik, a potem naprawić utratę jakości. Dominującym przepisem na ten ostatni etap jest QAT (quantization-aware training), które wstawia operacje pozornej kwantyzacji i ponownie trenuje; alternatywą jest QAD, które destyluje z modelu skompresowanego w pełnej precyzji. W obu przypadkach uczeń może co najwyżej dogonić swojego skompresowanego nauczyciela, a więc dziedziczy sufit wyznaczony przez kompresję.
Multiverse Computing proponuje zmianę jednej linii: destylować bezpośrednio z modelu oryginalnego, tego sprzed kompresji. Kwantyzacja przestaje wtedy być kosztownym postprocessingiem, a staje się pełnoprawnym etapem uczenia. Efekt jest intuicyjnie zaskakujący — zastosowana do GPT-OSS 120B skompresowanego do 60B, a następnie skwantyzowanego do MXFP4, metoda daje model 4-bitowy, który dorównuje lub przewyższa własne źródło bfloat16 na siedmiu z dziewięciu benchmarków, z największymi zyskami tam, gdzie kompresja boli najbardziej: +7,4 punktu na AA-LCR w rozumowaniu długiego kontekstu oraz +5,6 na AIME 2025. Dwa jedyne spadki, na MMLU-Pro i SciCode, pozostają poniżej półtora punktu.
Bezpośrednie porównanie z QAT przy identycznym pipeline może być praktycznie najcenniejszym wynikiem. Na GPT-OSS 9B skwantyzowanym do MXFP4 obie metody osiągają porównywalny szczyt, 54,9 wobec 54,6, ale nie za tę samą cenę: QAH dochodzi do niego w około stu krokach i utrzymuje go, podczas gdy QAT potrzebuje około 700 kroków, by tam dotrzeć, po czym się pogarsza. Konkretna konsekwencja jest inna pod względem ryzyka wdrożenia — checkpoint QAT wymaga uważnego monitorowania wczesnego zatrzymania, checkpoint QAH znacznie mniej.
Gradio integruje gr.Workflow, budowniczy pipeline’ów AI w grafie
25 sierpnia — Hugging Face publikuje przewodnik przedstawiający gr.Workflow, prymityw teraz zintegrowany z Gradio. Punkt wyjścia jest prosty: większość ciekawych aplikacji AI nie jest pojedynczym wywołaniem modelu, lecz łańcuchem — generujemy obraz, wycinamy z niego tło, wyciągamy z niego voice-over, prosimy LLM o tytuł. Dotąd złożenie takiego łańcucha i estetyczne wystawienie go wymagało napisania zarówno logiki, jak i interfejsu. gr.Workflow scala oba elementy: opisuje się kroki jako graf typowanych węzłów, a graf sam staje się interfejsem.
Korzyść dla deweloperów wykracza poza pokaz wizualny. Każde wyjście grafu automatycznie dostaje własny endpoint REST: przykładowe studio medialne, które łączy generację FLUX, wycinanie tła, syntezę mowy i LLM, wystawia trzy osobne trasy (/sticker, /voiceover, /episode_title), możliwe do wywołania z kodu bez przechodzenia przez interfejs. Węzły potrafią rozmawiać z czterema światami — modelami hostowanymi przez Inference Providers Hugging Face, innymi publicznymi Spaces Gradio używanymi jako klocki, pojedynczym wierszem zbioru danych z Hub oraz dowolnym Pythonem. Ten ostatni punkt otwiera najwięcej drzwi: węzeł operatora ozdobiony @spaces.GPU rezerwuje GPU ZeroGPU na czas swojego wykonania, co pozwala uruchamiać własne wagi. Pięć rzeczywiście wdrożonych aplikacji w Spaces towarzyszy przewodnikowi, w tym profiler zbiorów danych i demonstracja, która animuje nieruchomy obraz z Lightricks/LTX-Video.
ElevenLabs uruchamia Composer, edytor piosenek sekcja po sekcji
25 sierpnia — ElevenLabs ogłasza Composer, edytor piosenek działający sekcja po sekcji. Zasada łamie dominujący tryb generowania modeli muzycznych: zamiast tworzyć cały utwór jednym przebiegiem i uruchamiać wszystko od nowa, gdy jakiś fragment nie pasuje, Composer pozwala poprawiać osobno zwrotkę, refren lub bridge. Dostępne są cztery punkty startowe — własny tekst, istniejący utwór, który przyniesiesz, pusta karta albo zwykły prompt — a utwór buduje się potem poprzez kolejne poprawki.
To drugi ruch ElevenLabs w stronę muzyki po Eleven Music, i przychodzi w intensywnym tygodniu dla firmy, ponieważ CLI v1 ukazał się dzień wcześniej. Pozycjonowanie jest spójne z resztą sektora audio: Suno wypuściło Studio 2.0 13 sierpnia, Pika opublikowała swoją linię Pika Music 18 sierpnia, a Stability AI dostarczyło tego samego dnia wtyczkę do stacji roboczych audio. Precyzyjna kontrola nad strukturą utworu, a nie surowa jakość generacji, stała się polem rywalizacji. Jest jednak zastrzeżenie: ogłoszeniu nie towarzyszy wpis na blogu, a o planach dających dostęp do Composer, formatach eksportu ani dostępie do API nic nie wiadomo.
🔗 Ogłoszenie Composer, @ElevenLabs
LiveAvatar znosi wszelkie limity współbieżności i schodzi do 0,01 USD za minutę
25 sierpnia — HeyGen ogłasza zniesienie limitów współbieżności w LiveAvatar, swoim produkcie awatarów czasu rzeczywistego. Sformułowanie podkreśla naturę zmiany: limity nie są podnoszone, lecz znikają. Jedna sesja czy dziesięć tysięcy działają na tym samym API, bez wcześniejszego negocjowania limitu. Ogłoszeniu towarzyszą dwa parametry — rendering pozostaje w pełnym ciele 1080p, a cena spada do 0,01 USD za minutę przy skali.
Ten poziom ceny zmienia charakter możliwych zastosowań: przy jednym centie za minutę awatar czasu rzeczywistego staje się opłacalny dla masowego supportu klienta, szkoleń czy kiosków interaktywnych, czyli przypadków, w których to koszt jednostkowy dotąd decydował o wykonalności. Zniesienie limitu współbieżności to najciekawszy technicznie punkt. Platformy awatarów czasu rzeczywistego zwykle ograniczają liczbę równoczesnych sesji, ponieważ każda sesja stale zużywa GPU; zniesienie tego sufitu wymaga albo dużego zapasu mocy, albo wzrostu efektywności modelu. HeyGen publikuje wpis wyjaśniający swoje podejście, lecz szczegóły techniczne nie były dostępne w momencie skanu.
🔗 Nielimitowana współbieżność w LiveAvatar
Grok 4.6 trafia do OpenCode Go
25 sierpnia — Grok 4.6 dołącza do OpenCode Go, abonamentowej oferty agenta kodu open source OpenCode. Ogłoszenie pochodzi od OpenCode pod koniec dnia, a konto @grok relacjonuje je pół godziny później. Konkret dla deweloperów to limit: 169 zapytań na każde 5 godzin dla użytkowników planu Go. To limit kroczący, nie miesięczny, co dobrze pasuje do typowego dla sesji wspomaganego kodowania użycia w zrywach.
Ta integracja wpisuje się w serię otwarć Grok 4.6 na narzędzia firm trzecich: model trafił do GitHub Copilot 14 sierpnia, do Amazon Bedrock 19 sierpnia, a następnie do Gemini Enterprise Agent Platform od Google 21 sierpnia. xAI wcześniej połączyło już OpenCode ze swoimi subskrypcjami SuperGrok i X Premium w maju 2026 — dzisiejszy dodatek nie dotyczy więc samego dostępu do OpenCode, lecz obecności modelu 4.6 w planie Go, z dołączonym limitem zamiast konieczności dostarczania własnej subskrypcji xAI.
🔗 Relacja @grok · Ogłoszenie @opencode
Cohere publikuje badanie IDC o adopcji suwerennej AI w 2026 roku
25 sierpnia — Cohere publikuje wyniki InfoBriefu zamówionego w IDC na temat adopcji suwerennej AI w sektorach regulowanych. Badanie objęło ponad 500 starszych decydentów z firm osiągających ponad miliard dolarów przychodu w Kanadzie, Stanach Zjednoczonych, Wielkiej Brytanii i Niemczech, w okresie od kwietnia do maja 2026.
Najbardziej znaczący wynik dotyczy mniej adopcji niż zamieszania pojęciowego. Co trzeci lider ma trudność z opisaniem suwerennej AI własnymi słowami, a jedynie 13% deklaruje bardzo wysoką świadomość tematu. Wśród tych, którzy potrafią ją zdefiniować, 52% ujmuje ją jako kontrolę lokalną lub krajową, a 35% mówi o cyfrowej niezależności. Różnica przebiega też przez strukturę organizacji: osoby odpowiedzialne za IT wykazują świadomość dwukrotnie wyższą niż osoby po stronie biznesu.
| Badany sektor | Ucieczka danych i zgodność jako główna obawa | Przewaga konkurencyjna jako motyw |
|---|---|---|
| Usługi finansowe | 82 % | 21 % |
| Przemysł | 77 % | 32 % |
| Telekomunikacja | 75 % | 37 % |
| Opieka zdrowotna | 74 % | 28 % |
| Energetyka | 70 % | 21 % |
Jeśli chodzi o motywacje, konsensus jest wyraźny i przekrojowy: ucieczka danych, prywatność i zgodność z przepisami zajmują pierwsze miejsce we wszystkich badanych sektorach. Przewaga konkurencyjna pojawia się jako motyw drugorzędny, ale rosnący, wyraźniej akcentowany w Kanadzie (35%) i Stanach Zjednoczonych (28%) niż w Niemczech (23%) czy Wielkiej Brytanii (18%). Badanie oczywiście wspiera pozycjonowanie Cohere, którego platforma agentowa North działa w infrastrukturze i jurysdykcji wybranej przez klienta; pozostaje jednak fakt, że liczby pochodzą z zidentyfikowanego źródła. IDC przewiduje ponadto, że do 2028 roku CIO w międzynarodowych korporacjach zwiększą o 65% inwestycje w modułowe środowiska chmury suwerennej i lokalizację danych.
🔗 State of Sovereign AI Adoption 2026
Krótkie wiadomości
- Bain & Company dołącza do Claude Partner Network — Firma zostaje partnerem Global Premier, wspieranym wdrożeniem Claude wśród swoich 19 000 pracowników; ponad 7 000 aktywnych użytkowników już w fazie pilotażu, a ponad dwie trzecie uczestników przyjęło Claude for Excel. 🔗 Wpis Anthropic
- Amp wyjaśnia, czym są orbs — Notatka Thorstena Balla w odpowiedzi na zamieszanie wokół nazwy: orb to zdalny agent, którym można sterować z poziomu webu, telefonu lub CLI. Dwie użyteczne uwagi o kosztach: nieograniczony sen nie jest naliczany, a liczba jednoczesnych orbów nie ma limitu. 🔗 Notatka Amp
- Together AI otwiera Qwen3.8 27B na fine-tuning i dedykowaną inferencję — Model staje się dostępny zarówno do dostrajania na własnych danych, jak i do Dedicated Model Inference na zarezerwowanym sprzęcie. 🔗 Tweet @togethercompute
- FINAL-Bench otwiera FINCHAL, konkurs prognoz finansowych dla agentów — Z pulą 2 000 dolarów, wymaga pozycji zamiast prognoz i publikuje sufit szczęścia (luck ceiling), aby oddzielić umiejętność od przypadku. 🔗 Wpis FINAL-Bench
- Au-Zone publikuje EdgeFirst Model Zoo — Cztery rodziny YOLO do detekcji i segmentacji mierzone na rzeczywistym, wbudowanym krzemie, a każdy opublikowany wynik odsyła do sesji walidacyjnej, która go wygenerowała, w przeciwieństwie do nieprzejrzystych TOPS deklarowanych przez producentów. 🔗 Wpis EdgeFirst
- Inteligentne dyktowanie Gemini dla macOS — Dyktowanie w dowolnym oknie pulpitu, z automatycznym usuwaniem wahań i uwzględnianiem poprawek w środku zdania; głos służy też do podsumowywania plików i przepisywania tekstu. 🔗 Przewodnik blog.google
- Reguły push akceptują wyjątki ścieżek — W publicznej wersji zapoznawczej reguły Restrict file paths i Restrict file size mogą wyłączać konkretne ścieżki, na przykład blokować JAR-y wszędzie poza
**/gradle/wrapper/*.jar. 🔗 Dziennik zmian GitHub - Blokowanie użytkownika z poziomu powiadomienia bezpieczeństwa — Działanie odbywa się przez menu z trzema kropkami w opisie lub komentarzu, w publicznych repozytoriach, bez wchodzenia z powrotem do ustawień; powiadomienie pozostaje nienaruszone. 🔗 Dziennik zmian GitHub
- Manus sygnalizuje duży popyt na odzyskiwanie danych — Nieudane przywracanie trzeba uruchomić ponownie później tego samego dnia; jasna instrukcja, by zachować pakiety kopii zapasowych nienaruszone i bez zmian. 🔗 Tweet @ManusAI
- Kling publikuje trzy przewodniki po swoim serwerze MCP — Połącz Kling z asystentem zgodnym z MCP, aby odtworzyć zatwierdzoną konfigurację twórczą i generować warianty wsadowo; dwa z trzech poradników jako klienta wymieniają Claude Code. 🔗 Blog Kling
- Wan 3.0 trafia na Runway i Replicate — Runway integruje go 24 sierpnia z wieloma referencyjnymi wejściami obrazowymi, wideo i audio; Replicate podąża 25 sierpnia, podkreślając natywne 30 sekund w jednym ujęciu z zsynchronizowanym dźwiękiem. 🔗 Tweet @runwayml
- Runway ogłasza nowych prelegentów na swój AI Summit — Rozszerzony program o robotykę, pojazdy autonomiczne, marketing i infrastrukturę na wrześniowe wydarzenie w San Francisco. 🔗 Tweet @runwayml
- MiniMax publikuje indeks integracji H3 — Awesome MiniMax H3 Integrations kataloguje to, co powstaje wokół otwartego modelu wideo, w tym konfiguracje działające na 24 GB VRAM. 🔗 Tweet @MiniMax_AI
- Luma uruchamia Dream Lab Weekly — Pierwszy odcinek serii wideo poświęconej kreatywnym profesjonalistom Luma i ich cotygodniowej pracy nad produktem. 🔗 Tweet @LumaLabsAI
- NVIDIA publikuje sesję Nemotron Labs o routingu otwartych modeli — 55-minutowa transmisja na żywo zatytułowana Get Started with Open Model Routing, będąca rozwinięciem prac nad Nemotron 3.5 Lightning i NeMo Switchyard. 🔗 Tweet @NVIDIAAI
- Tydzień do końca konkursu Grok Imagine na Odysei — Trzeba stworzyć scenę zaczerpniętą z Odysei, pokazującą możliwości wideo i głosu narzędzia; nagrody wynoszą 100 000, 50 000 i 25 000 dolarów. 🔗 Tweet @grok
- Pula resetów limitów dla subskrybentów Plus i Pro — Zamiast czekać na okno resetu, użytkownik zużywa zarezerwowany reset; jeden darmowy na start i kolejne przez polecenia, z współdzielonymi kredytami workspace po stronie Business. 🔗 Dziennik zmian ChatGPT i Codex
Co to oznacza
Krzem znów staje się tematem laboratoryjnym dla modeli. OpenAI tego samego dnia publikuje pierwsze zmierzone liczby dotyczące własnego układu do inferencji oraz wpis wyjaśniający jego strategię compute. To nie jest przypadek w kalendarzu: dostawca modeli, który projektuje swój krzem, mierzy go na publicznym benchmarku strony trzeciej i otwarcie stawia na portfel dziesięciu partnerów, zmienia charakter konkurencji. Pytanie przestaje brzmieć „który model jest najlepszy”, a zaczyna „jaki jest koszt na skutecznie wykonane zadanie”, a odpowiedź rozstrzyga się równie mocno w racku, jak i w wagach. Być może najbardziej znaczący szczegół jest gdzie indziej: AI posłużyła do zaprojektowania układu i napisania jego kerneli, a wejście do produkcji zajęło dziewięć miesięcy, przy czym wygenerowane implementacje przewyższają te stworzone przez ludzkich ekspertów na wybranych blokach. Pętla się domyka — modele projektują sprzęt, na którym same będą działać.
AI wraca na urządzenie, a liczby zaczynają za tym nadążać. Trzy sygnały z tego samego dnia wskazują w tym samym kierunku. Perplexity uruchamia całego swojego agenta lokalnie na DGX Spark, bez zużywania kredytów, a eskalacja do chmury pozostaje decyzją użytkownika. Multiverse Computing publikuje metodę, w której model 4-bitowy dorównuje lub przewyższa źródło w pełnej precyzji, co odbiera zwyczajny argument przeciw agresywnej kwantyzacji. Au-Zone publikuje pomiary wizji na wbudowanym krzemie, krytykując reklamowane TOPS za to, że nie mówią nic o tym, co dany model rzeczywiście zrobi. Żaden z tych trzech projektów nie twierdzi, że dorównuje frontierowi: uczciwa liczba Perplexity to 59,6 % lokalnie wobec 82,4 % dla samego Claude Opus 5 na Terminal Bench 2.1. Ale przejście do modelu doradczego odzyskuje trzy piąte różnicy za dwie trzecie kosztu, i to właśnie ten kompromis, bardziej niż parytet, sprawia, że lokalne uruchamianie staje się obronione.
Otwarte wagi umacniają się jako pozycja domyślna. Analiza 500 000 artykułów arXiv, przytoczona przez Qwen, dokumentuje już widoczny odwrót: otwarte modele chińskie wzrosły z 10 % do około 40 % wzmianek, podczas gdy otwarte modele amerykańskie tkwią między 25 a 30 %. Qwen3.8-27B wchodzący do top 10 Code Arena jako jedyny model tej wielkości, GLM-5.3, który wyprzedzał GPT-5.6 Sol i Claude Fable 5 na DeepSWE w wielu próbach przy koszcie 2,1 do 5,4 razy niższym, IBM otwierający Granite 4.2 z czterema wariantami kwantyzowanymi i czternastoma formatami GGUF już pierwszego dnia — ta sama logika powtarza się raz za razem. Otwieranie wag nie jest już ruchem nadrabiającym zaległości, lecz sposobem na stanie się domyślną infrastrukturą dla innych, z zastrzeżeniem, które sam Nathan Lambert stawia wprost: publikacje pozostają w tyle za wydaniami, a te krzywe opisują prace w toku, a nie aktualne preferencje.
A sieć przygotowuje się do bycia czytaną przez agentów, a nie przez oczy. WebMCP Challenge to konkurs z pulą 35 000 dolarów, więc niewielką; to, co ujawnia, jest jednak warte więcej. Chrome, Cloudflare, Shopify, Vercel, Render i Netlify ustawiają się razem z OpenAI wokół standardu, który wymaga od witryn udostępniania ustrukturyzowanych narzędzi zamiast pozwalania agentom zgadywać interfejs. Tego samego dnia ChatGPT desktop potrafi natywnie korzystać z WebMCP, Codex umie tworzyć i wdrażać zgodną aplikację, a OpenAI dokumentuje wewnętrzne użycie protokołu w narzędziu do notatników. To zbieżne podejście pokrywa się z tym, co Rohlik opisuje ze swojej strony, mając ponad pięćdziesiąt integracji MCP i zasadę, że każde nowe narzędzie musi być dostępne dla agentów od pierwszego dnia. Warstwa interfejsu dla agentów przestaje być tematem badawczym, a staje się wymaganiem inżynieryjnym.
Źródła
- OpenAI — WebMCP Challenge
- OpenAI — ogłoszenie WebMCP Challenge na X
- OpenAI — WebMCP w ChatGPT desktop i Sites
- OpenAI — automatyzacja powtarzalnej pracy z Codex, Runme i WebMCP
- OpenAI — Jalapeño, pierwsze wyniki
- OpenAI — The full stack behind abundant intelligence
- OpenAI — wtyczka Admin dla ChatGPT Work i Codex
- OpenAI — rozszerzenie przeglądarki na Edge, Brave, Opera i Vivaldi
- OpenAI — premiumowe biurko ChatGPT Business
- ChatGPT i Codex — changelog
- Perplexity — uruchomienie Portable Computer
- Perplexity — wpis o Portable Computer
- Perplexity — benchmarki lokalnego harnessu
- Anthropic — pamięć Claude działa wszędzie
- Anthropic — ogłoszenie pamięci na X
- Anthropic — CHANGELOG Claude Code
- Anthropic — streaming 4x płynniejszy
- Anthropic — stypendia badawcze dotyczące dobrostanu
- Anthropic — Bain & Company dołącza do Claude Partner Network
- IBM — Granite 4.2
- IBM — Granite Speech 5.0 Turbo CTC
- Multiverse Computing — Quantization-Aware Healing
- Hugging Face — przewodnik gr.Workflow
- FINAL-Bench — konkurs FINCHAL
- Au-Zone — EdgeFirst Model Zoo
- Together AI — Qwen3.8 27B w fine-tuningu i dedykowanej inferencji
- Google AI — WeatherNext Cyclones
- Google DeepMind — WeatherNext Cyclones
- Google — Gemini CLI v0.57.0
- Google — changelog Antigravity
- Google — inteligentne dyktowanie Gemini dla macOS
- Stability AI — runda B o wartości 76 milionów dolarów
- Stability AI — ogłoszenie na X
- NVIDIA — Gamescom i RTX Spark
- MiniMax — SANA i Sol Engine na H3
- MiniMax — indeks integracji H3
- NVIDIA — sesja Nemotron Labs o routingu otwartych modeli
- Qwen — Qwen3.8-27B na Code Arena WebDev
- Qwen — relacja z analizy arXiv
- Nathan Lambert — prześwietlono 500 000 artykułów arXiv
- Warp — format factory.yaml i wczesny dostęp
- Cognition — studium przypadku Rohlik Group
- Devin — strona klienta Rohlik Group
- Amp — wyjaśnienie orbów
- GitHub — cztery nowe ćwiczenia GitHub Skills
- GitHub — zakładka Customize w ogólnej dostępności
- GitHub — wyjątki ścieżek w regułach push
- GitHub — blokada na podstawie powiadomienia o bezpieczeństwie
- Manus — aktualizacja dotycząca przywracania danych
- ElevenLabs — Composer
- HeyGen — nieograniczona konkurencja na LiveAvatar
- Kling — przewodniki po serwerze MCP
- Runway — Wan 3.0 dostępny na platformie
- Runway — nowi prelegenci AI Summit
- Luma — Dream Lab Weekly
- xAI — Grok 4.6 w OpenCode Go
- OpenCode — Grok 4.6 w planie Go
- xAI — konkurs Grok Imagine na Odysei
- Cohere — State of Sovereign AI Adoption 2026