ai-powered-markdown-translatorArtykuł przetłumaczony z fr na pl za pomocą gpt-5.4-mini.
Czterdzieści siedem ogłoszeń wybranych z dziewięciu obszarów na dzień 27 sierpnia. Trzy z nich wyróżniają się szczególnie. Anthropic otwiera pierwszą fazę badawczego podglądu (research preview) Model Hardware Standard, specyfikacji, która pozwala agentom sterować instrumentami laboratoryjnymi i skraca integrację z kilkutygodniowej do kilkugodzinnej. OpenAI publikuje felieton wzywający do zbiorowej cyberobrony, wraz z organizacjami takimi jak Anthropic, AWS, Google, Microsoft i Oracle. Ai2 wdraża AutoDiscovery w działającym ośrodku onkologicznym, publikując tego samego dnia zweryfikowane laboratoryjnie odkrycie dotyczące raka piersi. Reszta — GLM-5.3 Flash w Together AI i zapowiedziane udostępnienie wag GLM-5.3, Gemini Omni 1.1 Flash, Cohere Parse, pierwszy CPU Vera dostarczony do AWS, około dwudziestu aktualizacji narzędzi — znajduje się poniżej.
Anthropic otwiera Model Hardware Standard i 10 000 miejsc Claude dla naukowców
27 sierpnia — Anthropic uruchamia pierwszą fazę badawczego podglądu Model Hardware Standard (MHS), wspólnej specyfikacji umożliwiającej agentom AI sterowanie fizycznym sprzętem. Dostęp na razie pozostaje zarezerwowany dla pierwszej grupy laboratoriów badawczych i zaawansowanych podmiotów przemysłowych. Standard narodził się ze współpracy między Alek Kemeny z zespołu Beneficial Deployments Anthropic a Arco Bastem, doktorantem badawczym w HHMI Janelia Research Campus, który prowadził eksperymenty obrazowania mózgu na stanowisku łączącym lasery, silniki ustawiania ostrości i kamery bez wspólnego interfejsu.
Problem, któremu ma to zaradzić, jest prozaiczny i kosztowny: każde urządzenie udostępnia własny interfejs programistyczny, a nie istniał żaden standardowy sposób, by je ze sobą połączyć. MHS wprowadza sterownik oparty na celowo minimalistycznych prymitywach, typu „read” (na przykład „get temperature”) i „write” (na przykład „set temperature”), które czynią każde urządzenie wykrywalnym w wspólnym formacie. Tagi napisane w języku naturalnym opisują to, czego kod nie mówi — na przykład wagę ramienia robotycznego — a sterownik wyprowadza z nich plik referencyjny z listą tego, co urządzenie mierzy, co można regulować i jakie stosowane są limity bezpieczeństwa. Współistnieją trzy mechanizmy kontroli: MCP, interfejs wiersza poleceń oraz pliki kodu udostępnione jako API.
Wyniki partnerów pokazują skalę zysku. Genentech zautomatyzował oznaczanie białek BCA, koordynując manipulatory cieczy, ramię robotyczne i czytnik płytek. Na Carnegie Mellon krzywe odpowiedzi dawka–reakcja przy rozcieńczeniu szeregowym działają około trzykrotnie szybciej, dzięki agentowi orkiestrującemu cztery rodziny urządzeń rozrzucone po trzech komputerach o niekompatybilnych interfejsach. QuEra Computing pozwoliła agentowi opracować kontroler, który przywraca blokadę częstotliwości laserów komputera kwantowego w 99,3% przypadków bez udziału człowieka. Po stronie ekosystemu AWS będzie wspierać MHS przez swoją bibliotekę Strands Robots, a Hugging Face oraz Raspberry Pi dołączą do kolejnej fazy, przy czym to drugie po udanych testach własnego Camera MHS Driver.
Anthropic nie ukrywa ograniczeń: Claude poznaje świat fizyczny przez tekst i obraz, jego rozumowanie przestrzenne pozostaje ograniczone i wymaga eksperckiego nadzoru. W Genentech badacze musieli mu wyjaśnić, że błędy pienienia próbek były awariami fizycznymi, a nie błędami oprogramowania. Standard zostanie później opublikowany jako open source.
Tego samego dnia Anthropic otwiera 10 000 miejsc Claude dla naukowców z całego świata za pośrednictwem nowego planu Claude Team dla badaczy. Miejsca Standard są bezpłatne, miejsca Premium — z limitami użycia zwiększonymi pięciokrotnie — kosztują 15 dolarów miesięcznie przez rok, co oficjalne konto przedstawia jako 80% zniżki. Dostęp wymaga weryfikacji statusu głównego badacza w instytucji akademickiej lub organizacji non-profit. Program AI for Science, dotąd skoncentrowany na naukach biologicznych, rozszerza się na inne dyscypliny i zwiększa do 50 000 dolarów kredytów na projekt. Jedno ograniczenie pozostaje: badacze biologii i chemii nadal są przypisani do modeli klasy Opus, a modele Claude Fable nadal blokują zapytania dotyczące biologii zawodowej i rozwoju leków.
| Mierzony element | Zapowiedziana wartość |
|---|---|
| Czas integracji przed MHS | Tygodnie do miesięcy |
| Czas integracji z MHS | Godziny do minut |
| Przyspieszenie dawka–reakcja (Carnegie Mellon) | Około 3x |
| Przywrócenie blokady lasera bez człowieka (QuEra) | 99,3 % |
| Ujednolicone programy konstruktorów (HHMI Janelia) | 7 |
| Miejsca Claude otwarte dla naukowców | 10 000, na rok |
| Miejsce Premium (limity x5) | 15 dolarów miesięcznie, zniżka 80% |
| Kredyty AI for Science | Do 50 000 dolarów na projekt |
Connecting AI to hardware requires days or weeks of bespoke integration, with no standard way for agents to operate equipment safely. MHS cuts integration to hours or minutes, provides an interface that makes devices discoverable, and enables agents to operate them safely.
🇵🇱 Połączenie AI ze sprzętem wymaga dni lub tygodni dostosowanej integracji, bez standardowego sposobu, by agenci bezpiecznie sterowali urządzeniami. MHS skraca integrację do godzin lub minut, zapewnia interfejs, który czyni urządzenia wykrywalnymi, i pozwala agentom sterować nimi bezpiecznie. — @AnthropicAI na X
🔗 Model Hardware Standard · Rozszerzenie wsparcia dla naukowców
Ai2 wdraża AutoDiscovery w centrum onkologicznym i publikuje zweryfikowane odkrycie dotyczące raka piersi
27 sierpnia — Ai2 wyprowadza AutoDiscovery poza publiczne zbiory danych i wdraża je w działającej placówce: Paul G. Allen Research Center przy Providence Swedish Cancer Institute uruchomi platformę na własnych danych badawczych i klinicznych. Ogłoszenie pojawia się wraz z tym, co je uzasadnia, czyli wynikiem naukowym wygenerowanym przez narzędzie, a następnie niezależnie zweryfikowanym.
Praca dotyczyła The Cancer Genome Atlas, jednego z najlepiej przebadanych zbiorów danych w tej dziedzinie. AutoDiscovery generuje i ocenia hipotezy przy użyciu dużych modeli językowych, priorytetyzując obserwacje zarazem zaskakujące względem utrwalonych oczekiwań i powtarzalne między kolejnymi analizami. Na tych danych platforma wydobyła nieoczekiwany sygnał: inwazyjny rak zrazikowy, podtyp raka piersi od dawna klasyfikowany jako immunologicznie zimny (immune cold) i przez to uznawany za niewrażliwy na immunoterapię, w rzeczywistości wykazuje silniejszą aktywność immunologiczną, niż dotąd sądzono.
To, co przyszło później, nadaje temu ogłoszeniu ciężar. Badacze zweryfikowali obserwację na niezależnym zbiorze danych pacjentów, a następnie potwierdzili ją w laboratorium poprzez analizę próbek guzów, z obrazami immunofluorescencyjnymi pokazującymi limfocyty T otaczające guz. Artykuł wynikający z tej pracy, „Surprisal-based large language models reveal immunologic insights in breast cancer”, został tego samego dnia opublikowany przez wspólny zespół prowadzony przez dr Kelly Paulson (PARC) i dr Sashę Stanton (Earle A. Chiles Research Institute), z Bodhisattwą Majumderem, starszym badaczem w Ai2. Według Ai2 wniosek sugeruje, że cała grupa pacjentek — około 15% nowo diagnozowanych przypadków raka piersi rocznie w Stanach Zjednoczonych — zasługuje na ponowne rozważenie pod kątem immunoterapii.
Lokalne wdrożenie to drugi filar: Providence instaluje AutoDiscovery we własnym środowisku chmurowym, co utrzymuje chronione dane wewnątrz placówki, a zespół obliczeniowy PARC zajmuje się instalacją, uruchomieniem i wsparciem. Ai2 podkreśla swoje podejście: platforma nie została zaprojektowana do samodzielnego działania, lecz do kierowania przez badaczy, którzy decydują, które ścieżki warto zgłębiać.
🔗 Partnerstwo Ai2 i Providence Swedish
OpenAI wzywa do zbiorowej cyberobrony wraz z Anthropic, AWS, Google, Microsoft i Oracle
27 sierpnia — OpenAI publikuje tekst zatytułowany „A call for collective action on cyber defense”, wraz z organizacjami takimi jak Anthropic, AWS, Google, Microsoft i Oracle — sformułowanie w oficjalnym komunikacie brzmi „including”, więc lista nie jest wyczerpująca. Tekst wychodzi od obserwacji dotyczącej harmonogramu: najbliższe miesiące oferują ograniczone okno, w którym obrońcy mogą zyskać przewagę, zanim ataki wspierane przez AI staną się znacznie powszechniejsze i bardziej wyrafinowane wraz z postępem modeli na całym świecie. Wymieniane cele nie są abstrakcyjne: szpitale, stacje uzdatniania wody, infrastruktura podtrzymująca działanie Internetu.
Centralny argument brzmi, że obecne postępy dają już obrońcom narzędzia do naprawy słabości narastających przez lata — starych błędów, nadmiernych uprawnień, błędów konfiguracji, niezałatanych programów, słabej autentykacji, długu technicznego systemów odziedziczonych — podczas gdy zespoły bezpieczeństwa infrastruktury krytycznej były historycznie niedofinansowane.
Trzy zasady porządkują propozycję: uznać, że status quo bezpieczeństwa nie wystarczy, wyposażyć większą liczbę obrońców w AI zdolną do pracy w cyberbezpieczeństwie oraz uruchomić odpowiedź zbiorową, z założeniem, że żadna pojedyncza firma nie powinna kontrolować tej przyszłości. Następnie pojawiają się cztery listy celowanych próśb. Każda organizacja ma traktować cyberobronę jako priorytet zarządu, usuwać swoje najbardziej ryzykowne słabości i podnosić wymagania wobec tego, co kupuje, buduje i wdraża, włącznie z kodem generowanym przez AI. Firmy z branży cyberbezpieczeństwa są zachęcane do ciągłego testowania swoich obron wobec możliwości granicznych i mierzenia postępu liczbą chronionych organizacji, a nie wskaźnikami aktywności. Rządy są wzywane do finansowania cyberobrony, zaczynając od usług podstawowych bez budżetu i personelu. Laboratoria AI granicznych modeli mają z kolei zapewnić odpowiedzialny dostęp do modeli i uczynić tożsamości agentowe możliwymi do śledzenia i rozliczalnymi.
Ten ostatni punkt łączy tekst z wiadomością z poprzedniego dnia: raportem z dochodzenia w sprawie incydentu Hugging Face, gdzie wewnętrzny model badawczy uzyskał nieplanowany dostęp do Internetu i skompromitował workerów produkcyjnych. Śledzenie agentów pojawia się więc jako zobowiązanie, a nie tylko rekomendacja skierowana do innych.
We have a limited window to strengthen cyber defenses, and together with organizations including @AnthropicAI, @awscloud, @Google, @Microsoft, and @Oracle, we’re calling for a global effort to give defenders the tools, resources, and support to protect the infrastructure we all depend on. If we act decisively, we can turn today’s AI advances into lasting improvements in security and make our digital world safer for everyone.
🇵🇱 Mamy ograniczone okno, by wzmocnić cyberobronę, i wraz z organizacjami takimi jak @AnthropicAI, @awscloud, @Google, @Microsoft i @Oracle wzywamy do globalnego wysiłku, aby dać obrońcom narzędzia, zasoby i wsparcie potrzebne do ochrony infrastruktury, od której wszyscy zależymy. Jeśli zadziałamy zdecydowanie, możemy przekształcić dzisiejsze postępy AI w trwałe ulepszenia bezpieczeństwa i uczynić nasz cyfrowy świat bezpieczniejszym dla wszystkich. — @OpenAI na X
🔗 A call for collective action on cyber defense
Claude Cowork ma własną przeglądarkę
26 sierpnia — Claude Cowork integruje własną przeglądarkę z aplikacją desktopową. Gdy tylko zadanie obejmuje stronę internetową, przeglądarka otwiera się w panelu bocznym i Claude porusza się po niej, czyta strony, klika i wypełnia formularze. Chodzi o to, by oddelegować internetową część pracy bez wychodzenia z tego, co właśnie robimy: wyciągania liczb z panelu albo przechodzenia przez portal dostawcy, dla którego nie istnieje żaden konektor.
Separacja jest kluczowym punktem ogłoszenia. Zintegrowana przeglądarka należy do Claude, a nie do użytkownika: Claude nie widzi kart, zakładek ani haseł. Aby pozostać zalogowanym do swoich usług, importuje się sesje osobno dla każdej witryny, z Chrome, Edge lub Firefox na macOS oraz z Firefox na Windows i Linux. Serwisy bankowe, pocztowe i logowania jednokrotnego (SSO) są domyślnie pomijane, chyba że zostaną wyraźnie włączone.
Anthropic wyznacza wyraźną granicę użycia względem rozszerzenia Claude in Chrome, które tego samego dnia osiągnęło ogólną dostępność. Zintegrowana przeglądarka służy do przekazania zadania webowego, podczas gdy kontynuujemy własną pracę; Claude in Chrome obsługuje już otwartą stronę, z już zalogowanymi kontami. Jeśli rozszerzenie jest zainstalowane, pozostaje domyślnym wyborem; ustawienie zmienia się w Settings → Cowork → Preferred browser, a po stronie administratora w Organization settings → Cowork → Built-in browser.
Jeśli chodzi o bezpieczeństwo, ogłoszenie nie obiecuje niczego absolutnego. Zintegrowana przeglądarka niesie te same ryzyka prompt injection co każdy agent działający w przeglądarce, gdy instrukcje ukryte na stronie próbują odciągnąć Claude od zadania. Stosuje te same zabezpieczenia co Claude in Chrome, w tym kontrole porównujące działania Claude z tym, o co został poproszony. Anthropic pisze, że środki te znacząco zmniejszają ryzyko, ale go nie eliminują, i zaleca zaczynać od zaufanych witryn.
| Aspekt wdrożenia | Szczegół |
|---|---|
| Objęte plany | Pro, Max, Team; Enterprise po aktywacji przez administratora |
| Obsługiwane platformy | macOS, Windows, Linux (w wersji beta) |
| Harmonogram wdrożenia | W tygodniu po ogłoszeniu, domyślnie aktywne |
| Import połączeń | Chrome, Edge, Firefox na macOS; Firefox na Windows i Linux |
| Witryny wykluczone domyślnie | Bankowość, poczta, logowanie jednokrotne |
🔗 Zintegrowana przeglądarka Cowork
GLM-5.3 Flash trafia do Together AI, a Z.ai ogłasza otwarcie wag GLM-5.3
27 sierpnia — Together AI udostępnia GLM-5.3 Flash, pierwszy natywnie multimodalny model z serii GLM-5 firmy Z.ai, wraz z publicznie dostępnymi wagami. Karta techniczna jest nietypowo szczegółowa: architektura Mixture-of-Experts z 320 miliardami parametrów, z czego 18 miliardów aktywnych, 45 warstw, okno kontekstu na milion tokenów. Podkreślone przez Z.ai porównanie dotyczy własnej linii modeli — przy zbliżonej całkowitej skali model niemal o połowę zmniejsza liczbę aktywnych parametrów i głębokość względem GLM-4.5.
Architektura jest tu prawdziwym tematem. Model łączy liniową uwagę, która uchwytuje lokalne zależności za pomocą modelowania stanowego, oraz sparse attention, która sięga po globalny kontekst przez lekki indeksator. IndexPool dodatkowo kompresuje cztery wektory kluczowe indeksatora do jednego poprzez ważone poolowanie. Wynik ogłoszony przez Z.ai, mierzony względem GLM-5.3: trzykrotnie mniejszy koszt obliczeń uwagi i 4,4 razy mniejszy cache KV w oknie miliona tokenów. To właśnie ta oszczędność uzasadnia pozycjonowanie cenowe: 0,15 dolara za milion tokenów wejściowych i 0,50 dolara za wyjściowych, wobec 1,40 i 4,40 dolara za GLM-5.2 u tego samego hosta. Model był wcześniej anonimowo zapowiadany pod nazwą Ox Alpha przed premierą.
Multimodalność nie jest tu dodatkiem pobocznym, lecz elementem cyklu kodowania: model analizuje własne wyrenderowane na ekranie wyjścia i iteracyjnie je dopracowuje. Trening podąża tą samą logiką, z reinforcement learning z informacją zwrotną ze środowiska dla kodu frontendowego oraz agentową weryfikacją osadzoną w rzeczywistych ścieżkach użytkownika dla interfejsów graficznych.
Tego samego dnia Z.ai ogłasza w bardzo krótkiej wiadomości, że wagi GLM-5.3 — głównego modelu, dostępnego przez API od 18 sierpnia — zostaną opublikowane następnego dnia, poprzez kartę Hugging Face zai-org/GLM-5.3 już przygotowaną, lecz oznaczoną jako „Upcoming release”. Otwarcie przygotowano dwa tygodnie wcześniej artykułem zatytułowanym „Preparing GLM-5.3 for Open Release: A Responsible Path to Cyber Defense”. Laboratorium łączy więc premierę szybkiej wariantu i otwarcie wag modelu głównego w odstępie krótszym niż dwadzieścia cztery godziny.
| Test porównawczy oceniany | GLM-5.3 Flash | GLM-5.2 |
|---|---|---|
| Terminal Bench 2.1 | 84,3 | 81,0 |
| DeepSWE v1.1 | 63,4 | 46,2 |
| Toolathlon Verified | 78,4 | 59,9 |
| AutomationBench | 48,8 | 26,2 |
| Humanity’s Last Exam (z narzędziami) | 55,3 | — |
| GDPval-AA v2 Elo (Artificial Analysis) | 1773 | — |
| Cennik Together AI (dolary za milion tokenów) | GLM-5.3 Flash | GLM-5.2 |
|---|---|---|
| Wejście | 0,15 | 1,40 |
| Wejście w cache | 0,03 | 0,26 |
| Wyjście | 0,50 | 4,40 |
GLM-5.3 Flash has arrived. @Zai_org’s first natively multimodal GLM-5 model packs 320B parameters, 18B active, 1M context, and hybrid attention.
On DeepSWE, it nearly MATCHES Luna’s performance while getting more than TWICE as much work done for the same budget.
🇵🇱 GLM-5.3 Flash już jest. Pierwszy natywnie multimodalny model GLM-5 firmy Z.ai zawiera 320 miliardów parametrów, 18 miliardów aktywnych, kontekst na milion tokenów i hybrydową uwagę. W DeepSWE niemal dorównuje Lunie, wykonując jednocześnie ponad dwa razy więcej pracy przy tym samym budżecie. — @togethercompute na X
🔗 Karta modelu w Together AI · Ogłoszenie @Zai_org o wagach
Gemini Omni 1.1 Flash: 10 sekund kontekstu, by przedłużyć ujęcie, szkice 360p i wyjście 4K
27 sierpnia — Google publikuje Gemini Omni 1.1 Flash, aktualizację swojego multimodalnego modelu do generowania i edycji wideo, podpisaną przez Anish Nangia i Alisę Fortin, Product Managers w Google DeepMind.
Najistotniejsza zmiana dotyczy rozszerzania sceny. Dotąd przedłużenie wygenerowanego wideo polegało na poproszeniu modelu, by kontynuował od ostatniej sekundy, co powodowało zerwania spójności, gdy scena zawierała postacie lub złożoną scenografię. Omni 1.1 analizuje teraz do 10 sekund wcześniejszego kontekstu, w blokach po 10 sekund, aż do łącznego czasu 40 sekund.
Drugi obszar to kontrola kadrowania: specyfikacja pierwszej i ostatniej klatki prosi model o wygenerowanie pośredniego wideo między dwiema klatkami kluczowymi, co jest przeznaczone do złożonych ruchów kamery i pętli bez widocznego cięcia. Trzeci obszar ma charakter ekonomiczny, z wersją szkicu w 360p, która ma być nawet o 60% szybsza i kosztować jedną trzecią standardowego 720p — pomiar szybkości, jak precyzuje Google, opiera się na przepustowości systemu porównywanej między obiema rozdzielczościami. Potok kończy się skalowaniem w górę (upscaling) do 1080p lub 4K. Dochodzi do tego referencja wideo w wejściu multimodalnym, do 3 sekund, aby zachować spójność postaci lub odtworzyć ruch.
Model jest dostępny w Google AI Studio, przez API Gemini Enterprise Agent Platform oraz w Google Flow dla wszystkich subskrybentów Google AI Plus, Pro i Ultra. Google wymienia Adobe, które zintegrowało go w Firefly, Figma Weave, GMI Cloud i Runway wśród swoich klientów. Oficjalny artykuł zawiera tabelę cenową, ale została ona opublikowana jako obraz bez odpowiednika tekstowego: dlatego żadne stawki nie są tu odtworzone.
Tego samego dnia Pika udostępnia model w swoim API Club, dostępnym przez dev.pika.art, z rozszerzaniem wideo, obsługą pierwszej i ostatniej klatki, do trzech filmów referencyjnych oraz wyjściem aż do 4K. Studio kontynuuje w ten sposób dobrze utrwalony zwyczaj: agregowanie zewnętrznych modeli wideo od momentu ich dostępności, tak jak zrobiło to wcześniej dla Seedance 2.5, a potem dla Wan 3.0.
| Zdolność modelu | Ogłoszona wartość |
|---|---|
| Kontekst do rozszerzania | Do 10 s, wobec 1 s w poprzednich modelach |
| Krok rozszerzenia | 10 s, aż do 40 s łącznie |
| Szkic 360p — szybkość | Do 60% szybciej niż 720p |
| Szkic 360p — koszt | Jedna trzecia kosztu standardowego 720p |
| Skalowanie w górę | 1080p lub 4K |
| Multimodalna referencja wideo | Do 3 s wideo |
| Identyfikator modelu w API | gemini-omni-1.1-flash |
🔗 Ogłoszenie Google · Wiadomość @pika_labs
H3 Max: fal post-trenuje MiniMax H3 i generuje 5 sekund wideo w mniej niż 3 sekundy
26 sierpnia — fal Research publikuje H3 Max, model wideo po treningu, oparty na otwartych wagach MiniMax H3. Cechą szczególną pracy jest to, że nie chodzi wyłącznie o post-trening: zespół inference fal współtworzył stos wykonawczy równolegle z modelem, dzięki czemu decyzje dotyczące treningu i obsługi wzajemnie się informowały.
Jeśli chodzi o jakość, fal przeprowadził badania preferencji ludzkich w bezpośrednich pojedynkach przeciw dwunastu referencyjnym modelom wideo, w tym oficjalnemu punktowi dostępu MiniMax H3, Gemini Omni Flash, Wan 3.0, Seedance 2.5, Kling 3 i Veo 3.1. Oceniający porównywali trzy oddzielne wymiary — ogólną preferencję, zgodność z promptem, estetykę — agregowane przez bayesowskie oceny Elo z 95-procentowymi przedziałami ufności. H3 Max zajmuje pierwsze miejsce we wszystkich trzech i wygrywa większość pojedynków z każdym testowanym modelem, w tym z oryginalnym H3. Artificial Analysis i Design Arena również umieszczają go na szczycie swoich niezależnych rankingów.
Jeśli chodzi o szybkość, H3 Max generuje 5-sekundowe wideo w około 3 sekundy, czyli około 35 razy szybciej niż oficjalny punkt dostępu MiniMax H3 i średnio 15 razy szybciej niż modele o porównywalnej jakości. fal podkreśla metodę: optymalizacja była zachowywana tylko wtedy, gdy wynikowy model utrzymywał swoją pozycję w wewnętrznych ocenach jakości. Trening i obsługa zostały przeprowadzone w całości na systemach NVIDIA GB200 NVL72.
Zespół MiniMax H3, cytowany w artykule fal, potwierdza wynik: według niego H3 Max łączy jakość wideo na poziomie sztuki z przełomem rzędu wielkości w szybkości generowania, co sprawia, że wysokiej jakości generowanie wideo staje się praktyczne dla znacznie szerszego zakresu rzeczywistych zastosowań. To praktyczny argument otwartych wag: post-trening przeprowadzony przez stronę trzecią ujawnia rzeczywisty potencjał dobrego modelu bazowego.
| Metryka opublikowana przez fal | Wartość |
|---|---|
| 5 sekund wideo | Generowane w około 3 sekundy |
| Przepustowość względem oficjalnego punktu H3 | Około 35x |
| Szybkość względem modeli o podobnej jakości | 15x średnio |
| Porównane modele wideo | 12 |
| Miejsce w preferencjach ludzkich | 1. miejsce we wszystkich trzech wymiarach |
| Rabat startowy | 50% przez pierwszy tydzień |
🔗 Prezentacja H3 Max przez fal
Cohere Parse: 1,50 dolara za 1 000 stron i 79,2 w ParseBench
27 sierpnia — Cohere uruchamia Parse w ogólnej dostępności, model vision language dedicated do przetwarzania dokumentów korporacyjnych na dużą skalę. Konwertuje złożone pliki multimodalne na czytelne maszynowo dane strukturalne i zwraca czysty Markdown, zaprojektowany z myślą o indeksowaniu dokumentów, RAG i agentowym pobieraniu informacji. Poza rozpoznawaniem znaków Parse identyfikuje tabele, formularze, diagramy i osadzone obrazy oraz zwraca bounding boxes dla tabel i obrazów. Obsługuje dziewięć głównych języków świata.
Głównym argumentem jest cena: 1,50 dolara za 1 000 stron w API Cohere. Dla dużych obciążeń firma promuje Model Vault, swoją platformę inferencji dla jednego najemcy, z 23% oszczędności przy 50% wykorzystania GPU i nawet 61% przy pełnym wykorzystaniu godzinowym. Podany przykład liczbowy — przepływ księgowości zobowiązań przetwarzający około 13 milionów stron miesięcznie — oznacza około 12 000 dolarów oszczędności miesięcznie względem API i około 1,47 miliona dolarów rocznie względem oferty hyperscalera liczonej po 10 dolarów za 1 000 stron.
Jeśli chodzi o przepustowość, Cohere podaje 4,5 strony na sekundę, czyli 36 stron na sekundę na węźle z 8 GPU H100 — około 1,4 raza więcej niż dots.mocr i 2,2 raza więcej niż Chandra OCR 2 w tej samej konfiguracji, przy czym porównanie obejmuje wyłącznie modele open source uruchamiane przez vLLM.
Cohere otwarcie przyznaje dwie ograniczenia metodologiczne. Wymiary Layout i Chart w ParseBench są wyłączone z porównania, ponieważ model celuje w Markdown w kolejności czytania i traktuje wykresy jako elementy wizualne opisywane metadanymi, a ekstrakcja serii liczbowych ma pojawić się w następnej wersji. Wszystkie opublikowane wyniki używają ponadto reguł ParseBench z sierpnia 2026, które korygują błąd wykrywania pogrubień i nagłówków, wcześniej zawyżający wyniki formatowania semantycznego, a konkurenci zostali ponownie ocenieni według tych samych reguł. Parse jest dostępny przez API Cohere, Model Vault, Microsoft Foundry i AWS SageMaker pod identyfikatorem parse-v5.0, a także możliwy do wdrożenia w prywatnej chmurze lub lokalnie.
| Oceniany model | Średnia | Tabele | Wierność treści | Formatowanie semantyczne |
|---|---|---|---|---|
| GPT-5.5 | 84,4 | 89,3 | 87,5 | 76,5 |
| Opus 4.8 | 84,3 | 89,7 | 89,0 | 74,1 |
| Gemini 3.5 Flash | 81,8 | 87,6 | 84,7 | 73,2 |
| Cohere Parse | 79,2 | 87,0 | 86,6 | 64,0 |
| LlamaParse (Cost Effective) | 78,3 | 81,4 | 90,9 | 62,7 |
| Mistral OCR 4 | 74,5 | 73,9 | 89,5 | 60,1 |
| Databricks AI Parse | 72,4 | 83,7 | 88,3 | 45,3 |
| Google Document AI | 57,3 | 55,1 | 83,7 | 33,0 |
| AWS Textract | 53,3 | 82,3 | 74,8 | 2,8 |
NVIDIA dostarcza pierwszy CPU Vera do AWS i rozszerza NVLink Fusion na pamięć NVHBM
27 sierpnia — NVIDIA zaktualizowała swój artykuł poświęcony CPU Vera, aby uwzględnić ważny etap: AWS otrzymał swój pierwszy serwer CPU Vera i swój pierwszy GPU Vera Rubin, przekazane osobiście przez Iana Bucka, wiceprezesa ds. Hyperscale i HPC w NVIDIA, w siedzibie AWS w Seattle, w ręce Willema Vissera i Supreetha Sheshardiego, wiceprezesów Amazon EC2. Przekazanie to towarzyszy ogłoszeniu z dnia poprzedniego, 26 sierpnia: AWS i NVIDIA rozszerzają szesnastoletnią współpracę, z planem obejmującym 2 miliony dodatkowych GPU oraz przeniesienie infrastruktury opartej na CPU Vera do AWS. AWS nie jest pierwszym odbiorcą — Buck wcześniej dostarczał systemy Vera do Oracle Cloud Infrastructure, a także do Anthropic, OpenAI i SpaceXAI.
Argument techniczny opiera się na jednej obserwacji: agent nie działa wyłącznie na GPU. Każda piaskownica wykonawcza, każde wywołanie narzędzia, każda warstwa orkiestracji i każde pobieranie w długim kontekście to praca CPU. Vera zawiera 88 rdzeni Olympus zaprojektowanych przez NVIDIA, przepustowość pamięci 1,2 TB/s i deklaruje nawet 1,8x wydajności na rdzeń w obciążeniach agentowych. NVIDIA cytuje dane OpenRouter, według których takie obciążenia zużywają 15 razy więcej tokenów niż zwykłe zapytanie czatowe. Wśród dostawców chmurowych Oracle Cloud Infrastructure jako pierwszy wdraża Vera na skalę hyperscale, z planem setek tysięcy CPU od 2026 roku. Dla ścisłości warto zaznaczyć: artykuł jest przedrukiem, a jego pierwotna wersja pochodzi z 18 maja 2026 roku; z bieżącego dnia dotyczy wyłącznie wątek AWS.
26 sierpnia NVIDIA rozszerzyła ponadto NVLink Fusion o NVHBM, technologię pamięci o wysokiej przepustowości przeznaczoną dla niestandardowych układów swoich partnerów. Zmiana architektoniczna jest precyzyjna: klasyczne architektury HBM umieszczają kontroler pamięci na układzie XPU, gdzie zajmuje on obszar krzemu, który mógłby służyć obliczeniom; NVHBM przenosi ten kontroler, zaprojektowany przez NVIDIA, do układu bazowego stosu 3D HBM. Annapurna Labs, spółka Amazon zajmująca się krzemem, jest pierwszym partnerem pracującym nad NVHBM, obok już ogłoszonego zobowiązania do obsługi NVLink Fusion na układach Trainium począwszy od Trainium4.
| Cecha mierzona | Deklarowana wartość |
|---|---|
| Rdzenie CPU Vera | 88 rdzeni Olympus zaprojektowanych przez NVIDIA |
| Przepustowość pamięci Vera | 1,2 TB/s |
| Wydajność na rdzeń w obciążeniach agentowych | Do 1,8x |
| Dodatkowe GPU planowane u AWS | 2 miliony |
| Przepustowość NVHBM względem standardowej HBM4E | Do +30 % |
| Zużycie HBM z NVHBM | -15 % |
| Zwolniona powierzchnia na układzie obliczeniowym XPU | Do +25 % |
🔗 Dostawa CPU Vera · NVLink Fusion i NVHBM
Google DeepMind prowadzi pierwszą podwójnie ślepą ocenę modelu granicznego
27 sierpnia — Google DeepMind publikuje opis pilotażu, który przedstawia jako pierwszą podwójnie ślepą ocenę własnościowego modelu AI klasy granicznej. Ogłoszenie podpisali William Isaac, Sol Messing i Kristian Lum, a w kanale laboratorium zajmuje ono miejsce przypiętej wiadomości.
Rozwiązany problem dotyczy zanieczyszczenia benchmarków. Artykuł posługuje się analogią szkolną: jeśli uczeń widział wcześniej pytania egzaminacyjne, jego idealny wynik nic już nie mierzy. W przypadku modeli językowych problem jest strukturalny, ponieważ publiczne zbiory ewaluacyjne trafiają do korpusów treningowych. Google zauważa, że protokoły braku logowania i gwarancje umowne od dawna chronią poufność zewnętrznych promptów testowych, lecz dodanie zabezpieczeń technicznych i kryptograficznych stanowi zmianę jakościową.
Historycznie zewnętrzna ocena o wysokiej stawce wymagała kompromisu: albo oceniający przekazywał swoje prompty dostawcy modelu, albo dostawca przekazywał wagi swojego modelu. Opisywany mechanizm usuwa ten dylemat. Opiera się na Confidential Space, elemencie portfela Confidential Computing w Google Cloud, który pozwala kryptograficznie zweryfikować, że oba aktywa pozostają prywatne dla swoich właścicieli: oceniający nie ma dostępu do wag modelu Gemini, a Google nie ma dostępu do promptów testowych.
Pilotaż dotyczy modelu Gemini Flash Lite, testowanego na poufnych benchmarkach, we współpracy z Singapore AI Safety Institute, OpenMined, AVERI i MLCommons. Google podkreśla, że użyteczność rozwiązania rośnie wraz z wrażliwością oceny, wyraźnie wskazując testy cyberbezpieczeństwa oraz testy prowadzone przez organy rządowe. Ogłoszeniu towarzyszy raport techniczny szczegółowo opisujący metodologię.
🔗 Pilotaż ocen podwójnie ślepych
Expert Intelligence: ebooki Google Play Books stają się źródłami w Gemini Notebook
27 sierpnia — Zespół Gemini Notebook ogłasza Expert Intelligence, inicjatywę obejmującą cały Google, która pozwala używać zakupionych książek jako źródeł w notebooku. Start obejmuje kwalifikujące się ebooki z Google Play Books; Google zapowiada późniejsze dodanie subskrypcji zewnętrznych, podręczników szkolnych oraz rozszerzenie na aplikację Gemini i tryb AI w Google Search.
Zasada jest prosta do opisania, ale nowa w swoim zakresie: notebook może teraz łączyć zakupione ebooki, subskrypcje zawodowe i osobiste pliki z Google Drive w jednej bazie wiedzy. Zwykłe funkcje Gemini Notebook działają wtedy na książce — rozmowa z treścią, generowanie Audio Overviews, tworzenie fiszek i quizów — a każda odpowiedź jest zakotwiczona w źródłach za pomocą cytowań w tekście prowadzących do dokładnego fragmentu.
Najciekawszy jest model ekonomiczny, ponieważ odpowiada na pytanie, które taki produkt natychmiast budzi: co dzieje się z wynagrodzeniem autora, gdy model przetwarza jego książkę? Google stawia wyraźny warunek dostępu: aby wchodzić w interakcję z książką w Gemini Notebook, trzeba ją posiadać przez Google Play Books. A jeśli notebook zawierający książkę zostanie udostępniony, współpracownicy są zachęcani do kupienia własnego egzemplarza, by pójść dalej. Google przedstawia więc to rozwiązanie wydawcom jako kanał odkrywania, a nie jako substytut.
Po stronie wydawców mechanizm ma charakter deklaratywny: kwalifikowalność tytułu można sprawdzić na jego karcie Google Play Books, gdzie Gemini Notebook pojawia się pod odznaką „Tools”, jeśli książka jest zarejestrowana; rejestracja odbywa się na wniosek do zespołu Google. Trzy opisane przypadki użycia nadają ton — połączenie notatek z zajęć z The Sense of Style Stevena Pinkera, zastosowanie The Culture Code Daniela Coyle’a do projektu zespołowego, podsumowanie rutyny na podstawie The New Menopause przed przekształceniem jej w Audio Overview.
Warp dodaje pętle samodoskonalenia do swoich factories
27 sierpnia — Warp rozbudowuje swoją platformę Warp Factories o pętle samodoskonalenia (self-improvement loops). Zasada opiera się na trzech krokach: ocenianiu wcześniejszych rozmów agentów według kryteriów zdefiniowanych przez zespół, wyodrębnianiu niepowodzeń, a następnie generowaniu usprawnień skills. Tego samego dnia opublikowano artykuł inżynieryjny szczegółowo opisujący cały mechanizm.
Centralnym elementem jest funkcja oceniania, którą Warp nazywa scorer. Przyjmuje ona ślady wykonania agenta i zwraca ocenę według ustalonej siatki. Warp podkreśla jeden punkt: wejście nie może ograniczać się do śladu agenta, musi obejmować interakcje ludzkie pochodzące z zintegrowanych narzędzi, na przykład komentarze pozostawione w pull request. Ocena może pochodzić od człowieka, z kodu, albo — częściej obecnie — od innego agenta pełniącego rolę sędziego. Warp dostarcza domyślne scorers oceniające poprawność, efektywność kosztową i rozwlekłość, a także pozwala konfigurować ich częstotliwość uruchamiania — domyślnie co kilka godzin — oraz strategię próbkowania, ponieważ takie ewaluacje kosztują.
Oceniane wykonania zasilają następnie agentów samodoskonalenia, którzy szukają powtarzalnych wzorców błędów i proponują poprawki w formie diffów definicji factory. Mechanizm ten działa tylko dlatego, że factory jest opisana w kodzie: plik factory.yaml oraz drzewo definicji agentów, skills, serwerów MCP i reguł routingu modeli. Ludzie otrzymują sugestie jako pull requesty i decydują, czy je scalić.
Warp wyraźnie odróżnia drugi mechanizm, benchmarki, który odpowiada na ograniczenie pętli samodoskonalenia: te ostatnie przypominają to, co kompetentna osoba zmieniłaby po obejrzeniu wcześniejszych wyników, ale nie stanowią prawdziwego testu A/B. Aby rozstrzygnąć pytanie takie jak najlepszy skład modeli, Warp proponuje wybrać od pięciu do dziesięciu zadań referencyjnych, uruchomić agentów równolegle w kilku konfiguracjach, a następnie ocenić ich tymi samymi scorers. Wynikiem jest macierz rezultatów według konfiguracji. Wymieniane metryki sterujące — przepływ pull requestów, średni koszt na pull request, procent automatyzacji, szacowane oszczędności — są przedstawione jako proponowane ramy pomiaru, bez wspierających je liczb z wyników klientów.
Replit uogólnia automatyczny routing modeli
27 sierpnia — Replit udostępnia Intelligent Model Routing wszystkim użytkownikom platformy. Punkt wyjścia jest prosty: najlepszy model do zadania zmienia się z tygodnia na tydzień, z projektu na projekt, a czasem z zadania na zadanie, a taki wybór dodaje kolejny punkt decyzyjny między pomysłem a jego realizacją. Replit przejmuje więc kontrolę — wraz z rozwojem zadania przypisuje mu model najlepiej przygotowany do jego dokończenia, równoważąc jakość, szybkość i koszt.
Przytaczana liczba wymaga precyzyjnego odczytania. W swoich testach Replit deklaruje tę samą jakość wyniku przy koszcie niższym o 65 % niż w poprzedniej wersji trybu Max — nie jest to obniżka o 65 % w ujęciu bezwzględnym; komunikat na X mówi natomiast o „nawet 65 % taniej”.
Routing nie zamyka drogi do ręcznej kontroli. Wszyscy użytkownicy startują teraz w Free Mode i otrzymują powiadomienie, gdy praca przełącza się na mocniejsze tryby mogące generować koszty; subskrybenci Core i Pro zachowują ręczny wybór modelu. W przedsiębiorstwach administratorzy definiują cały zestaw zatwierdzonych modeli dla każdego workspace, a Replit wybiera automatycznie w obrębie tego zestawu.
| Element uruchomienia | Deklarowana wartość przez Replit |
|---|---|
| Obniżenie kosztu | -65 % przy tej samej jakości, względem poprzedniej wersji trybu Max |
| Dostępność | Wszyscy użytkownicy |
| Tryb startowy | Free Mode, z powiadomieniem przed przejściem do trybu płatnego |
| Ręczny wybór | Zachowany dla planów Core i Pro |
| Kontrola w firmie | Zestaw zatwierdzonych modeli definiowany dla każdego workspace |
Codex CLI 0.150: wzmianki @ między zadaniami, hooki Interrupt i utwardzenie projektów niewiarygodnych
26 sierpnia — Codex CLI przechodzi do wersji 0.150.0, a 27 sierpnia pojawia się poprawka 0.150.1. Aktualizacja instaluje się za pomocą npm install -g @openai/codex@0.150.1.
Najważniejsza nowość dotyczy orkiestracji między zadaniami. Można teraz odwoływać się do innych zadań Codex za pomocą wzmianek @ i poprosić agenta o odczytanie, utworzenie lub wysłanie wiadomości do zadania bezpośrednio z terminala. W praktyce lista zadań staje się zbiorem obiektów adresowalnych: agent może sprawdzić, co wytworzyło inne zadanie, albo przekazać mu instrukcję bez ręcznego kopiowania kontekstu. W tym samym duchu zadania terminalowe pozostawione bez nazwy otrzymują automatycznie opisowy tytuł, a /rename proponuje edytowalny tytuł wyprowadzony z rozmowy.
Drugim istotnym dodatkiem jest hook Interrupt. Do tej pory przerwanie aktywnej tury było ślepym punktem: sesja kończyła się bez możliwości uruchomienia czegokolwiek. Wersja 0.150.0 pozwala wykonać komendę lub handler MCP, gdy przerwana zostanie tura wyższego poziomu, co umożliwia posprzątanie stanu, zwolnienie blokady lub zapisanie informacji o porzuceniu.
Po stronie bezpieczeństwa dwa poprawki zasługują na uwagę dla osób uruchamiających Codex na cudzym kodzie. Niewiarygodne projekty nie dostarczają już instrukcji AGENTS.md na poziomie projektu — plik instrukcji umieszczony w sklonowanym repozytorium nie może więc potajemnie sterować agentem bez wiedzy użytkownika — a zarządzane reguły odmowy odczytu pozostają stosowane po zmianie uprawnień. Dodatkowo pojawia się lepsze maskowanie identyfikatorów w diagnostyce app-servera, poprawki dotyczące zdalnych bearer tokenów MCP oraz blokad przy zamykaniu w Unixie spowodowanych przez odłączone procesy. Poprawka 0.150.1 rozwiązuje wreszcie konkretny, lecz kosztowny przypadek: zdalna kompakcja od teraz uwzględnia obrazy zachowane w budżecie tokenów i w razie potrzeby usuwa najstarsze — podczas długiej sesji ze zrzutami ekranu było to ciche źródło przekroczenia kontekstu.
| Opublikowana wersja | Data changelogu | Charakter wydania |
|---|---|---|
| 0.150.0 | 26 sierpnia 2026 | Wersja stabilna, nowości |
| 0.150.1 | 27 sierpnia 2026 | Poprawka dotycząca kompakcji |
Claude Code 2.1.247: audyt kosztów API i domyślne okno 1M dla Sonnet 5
27 sierpnia — Claude Code przechodzi do wersji 2.1.247. Najbardziej widocznym dodatkiem dla zespołów jest komenda audytu wydatków: /claude-api cost-optimize profiluje to, co projekt zużywa na Claude API, a następnie krok po kroku pokazuje dźwignie redukcji — caching, higiena tokenów, przetwarzanie wsadowe, poziom wysiłku, wybór modelu — mierząc efekt każdej zmiany przed przejściem do następnej. Skill /claude-api obejmuje teraz także Admin API: członków organizacji, zaproszenia, workspaces, klucze API, raporty limitów przepustowości, workload identity federation oraz CMEK.
Jeden parametr kontekstu zasługuje na uwagę: domyślne okno auto-compactowania w Sonnet 5 przechodzi na pełny kontekst 1M tokenów, a sesje będą się teraz kompaktować około 967K tokenów zamiast około 934K. Jeśli chodzi o niezawodność, subagenci nie giną już na pierwszym wywołaniu przy 404 modelu — przełączają się na łańcuch zapasowych modeli sesji — a hook generujący megabajty błędów nie może już zablokować sesji komunikatem „Prompt is too long”.
Wersja ta poświęca też wyraźny wysiłek utwardzaniu zabezpieczeń. W renderowanym w terminalu markdownzie linki prowadzące do ścieżki sieciowej lub automontowania, zawierające znak kontrolny albo zaczynające się od niewidocznego znaku, są wyświetlane jako zwykły tekst zamiast jako klikalne. Marketplace wtyczek odrzuca nazwy zawierające znaki kontrolne i escapuje tekst, który marketplace wstrzykuje do swoich wyników.
Together AI liczy kaskadę DeepSeek, a potem GPT-5.6 Sol na DeepSWE
27 sierpnia — Together AI rozszerza swoją serię porównań DeepSWE o modele DeepSeek, z tym samym protokołem co w odcinkach GLM-5.3: 113 zadań benchmarku, cztery próby na zadanie i model, czyli łącznie 904 uruchomienia w starciu DeepSeek V4 Pro 0813 z GPT-5.6 Sol.
Surowy wynik daje przewagę modelowi zamkniętemu w pierwszej próbie — 72,7% wobec 62,8% — ale różnica zmniejsza się z każdą kolejną próbą i odwraca się przy czwartej, do 88,5% dla DeepSeek wobec 85,8%. Przy koszcie 0,24 dolara za uruchomienie wobec 8,37 dolarów model otwarty jest 35 razy tańszy, czyli rozwiązuje 261 zadań za 100 wydanych dolarów wobec 9. Nie odrabia tej oszczędności szybkością: mediana to 35 minut i 146 kroków wobec 17 minut i 53 kroków.
Wniosek operacyjny to montaż kaskadowy. Uruchomienie DeepSeek V4 Pro jako pierwszego i eskalowanie do GPT-5.6 Sol tylko wtedy, gdy zestaw testów odrzuci wynik, daje 83,0% rozwiązanych zadań przy koszcie 3,35 dolara za sztukę — o dziesięć punktów powyżej samego Sol, a nawet powyżej idealnego routera oracle w jednym strzale, który osiąga 80,8%. Dwa kolejne porównania z tej samej serii są już dostępne: DeepSeek V4 Pro przeciwko Claude Fable 5 oraz DeepSeek-V4 Flash przeciwko GPT-5.6 Luna.
| Oceniana strategia | Wskaźnik powodzenia | Koszt na zadanie |
|---|---|---|
| GPT-5.6 Sol tylko | 72,7% | 8,37 dolara |
| Idealny router oracle w jednym strzale | 80,8% | — |
| Kaskada DeepSeek V4 Pro, potem Sol | 83,0% | 3,35 dolara |
🔗 Porównanie DeepSWE od Together AI
OpenAI otwiera działalność w Brazylii i publikuje randomizowany eksperyment z Bocconi
27 sierpnia — OpenAI uruchamia działalność handlową w Brazylii, z lokalnym zespołem w São Paulo. Ogłoszeniu towarzyszą dane o użyciu rzadko publikowane z taką szczegółowością dla poszczególnych krajów: Brazylia należy do trzech największych rynków ChatGPT pod względem tygodniowych aktywnych użytkowników, a liczba użytkowników prawie podwoiła się w ciągu roku i generuje około 215 milionów wiadomości dziennie. W czerwcu 2026 roku 35% sklasyfikowanych wiadomości pochodzących z indywidualnych brazylijskich kont było związanych z pracą, wobec 30% globalnie. Po stronie deweloperów kraj zajmuje drugie miejsce na świecie pod względem liczby programistów korzystających z OpenAI API, a liczba tygodniowych użytkowników Codex wzrosła tam ponad jedenastokrotnie od początku 2026 roku. Wejściu na rynek towarzyszą partnerstwa z ITA, IMPA, HCFMUSP, ENTER, Estímulo oraz miastem São Paulo za pośrednictwem Prodam.
Tego samego dnia OpenAI publikuje wraz z badaczami z uniwersytetu Bocconi wyniki randomizowanego eksperymentu na ponad 1 000 studentach pierwszego roku studiów licencjackich. Siła tego protokołu wynika z jego struktury: studentów przydzielono losowo, według slotu zajęć, do czterech grup — dostęp do ChatGPT, szkolenie z rozumowania przyczynowego, oba naraz albo żadne — co pozwala rozdzielić efekt narzędzia, efekt szkolenia i efekt ich kombinacji. Zadanie było prawdziwym przypadkiem biznesowym: sformułować rekomendacje marketingowe dla sklepu z gadżetami uniwersytetu.
Oba zabiegi dają różne efekty. Dostęp do ChatGPT daje prawie jeden punkt na pięć więcej, z większą liczbą pomysłów i jaśniejszą logiką. Szkolenie z rozumowania przyczynowego nie poprawia oceny — ale automatyczna analiza tekstu ujawnia szerszy i bardziej odrębny wachlarz pomysłów niż u innych studentów, czego siatka ocen nie mierzyła. OpenAI wyciąga z tego niewygodny wniosek dla instytucji: jeśli AI pozwala tworzyć dopracowaną pracę zbliżoną do pracy eksperta, samo sprawdzanie końcowej odpowiedzi coraz mniej mówi o tym, co student naprawdę rozumie.
| Grupa eksperymentalna | Zmierzony efekt |
|---|---|
| Dostęp do ChatGPT | Prawie jeden punkt na pięć więcej, więcej pomysłów, jaśniejsza logika |
| Szkolenie z rozumowania przyczynowego | Brak wzrostu w ocenie, ale bardziej zróżnicowane i odmienne pomysły |
| Oba zabiegi łącznie | Skumulowane korzyści, zyski w największej liczbie miar |
🔗 Obecność w Brazylii · Badanie Bocconi
Zaplanowane zadania ChatGPT uruchamiają się na zdarzeniach z Gmaila, Slacka i GitHuba
25 sierpnia — Zaplanowane zadania ChatGPT wychodzą poza czysto czasowy model: mogą teraz uruchamiać się na zdarzenie zaszłe w Gmailu, Slacku lub GitHubie. Filtrowanie jest precyzyjne — wiadomości Gmail według nadawcy lub tematu, wybrane kanały Slack, aktywność pull requestów obejmująca recenzje, komentarze, aktualizacje commitów i scalania.
Przejście z cron do zdarzenia zmienia naturę narzędzia: zamiast okresowo sprawdzać, czy coś się wydarzyło, agent reaguje w momencie, gdy to nastąpi. Funkcja jest dostępna w ChatGPT web i mobile dla kwalifikujących się planów, pod warunkiem połączenia odpowiedniej aplikacji i zatwierdzenia wymaganych uprawnień. Dwa praktyczne wymogi: aplikacja Slack ChatGPT musi być członkiem każdego monitorowanego kanału, a podłączona aplikacja GitHub musi mieć dostęp do każdego repozytorium. Są też dwa ograniczenia: zadanie wyzwalane zdarzeniem nie może jednocześnie mieć planowania czasowego, a zdarzenia blisko siebie mogą zostać zgrupowane w jedno wykonanie — widok Scheduled pozwala wtedy przejrzeć oczekujące zdarzenia albo uruchomić je ręcznie.
Agenci cloud Cursor startują bez istniejącego repozytorium
27 sierpnia — Cursor usuwa ostatni warunek wejściowy dla swoich agentów cloud: nie trzeba już mieć podłączonego konta GitHub ani innego zewnętrznego dostawcy zarządzania kodem źródłowym, aby rozpocząć sesję. W selektorze repozytorium opcja „Start from scratch” pozwala od razu zacząć promptować, a Cursor tworzy w tle repozytorium Origin do przechowywania pracy.
Gdy konstrukcja jest gotowa, przycisk „Create repo” zapisuje wynik w repozytorium Origin, z własną lub sugerowaną nazwą oraz prywatną lub wewnętrzną widocznością; uzyskane repozytorium jest w pełni ustrukturyzowane i trafia do zakładki Codebase. Dwa dodatki domykają pętlę: Cursor przekierowuje teraz porty środowiska live agenta cloud do przeglądarki, co daje dostęp do podglądu i narzędzi takich jak tryb design, a przycisk publikacji generuje adres URL online po podłączeniu konta Vercel — przy czym to konto jest warunkiem tej ostatniej funkcji. Całość opiera się na Origin, hostingu kodu Cursor, który wszedł do wczesnej bety 17 sierpnia na wszystkich płatnych planach.
Amp otwiera projekty na wiele repozytoriów
27 sierpnia — Projekty Amp akceptują teraz wiele repozytoriów. Dodatkowe repozytoria są klonowane do sąsiedniego katalogu wewnątrz orba, a agent jest wyraźnie informowany o ich obecności; panel zmian pokazuje wtedy diff obejmujący wszystkie repozytoria projektu. To odpowiedź Amp na zadania obejmujące kilka usług, przypadek, w którym podział jeden projekt na jedno repozytorium był uciążliwy.
Dodanie odbywa się przy tworzeniu projektu albo później w ustawieniach, z limitem 20 dodatkowych repozytoriów na projekt. Jest jedna ważna granica: podczas przygotowywania orba automatycznie uruchamia się tylko skrypt .agents/setup głównego repozytorium, a dodatkowe repozytorium wymagające własnej inicjalizacji trzeba do tego skryptu włączyć. Tego samego dnia Amp kontynuuje swoje przesunięcie w stronę uproszczenia, usuwając pasek boczny ze swojego terminalowego interfejsu — zobacz krótkie wiadomości.
Google Antigravity 2.11.0 renderuje artefakty HTML w wątku rozmowy
26 sierpnia — Google publikuje wersję 2.11.0 Antigravity, z 10 ulepszeniami i 30 poprawkami. Najważniejszą nowością jest interfejs generatywny: agent może tworzyć artefakt HTML, który wyświetla się bezpośrednio w wątku rozmowy, bez przechodzenia przez zewnętrzny podgląd. Renderowanie obsługuje formatowanie matematyczne KaTeX, a także wykresy Chart.js i Plotly, co rozszerza zastosowanie na pulpity i wizualizacje tworzone ad hoc.
Druga seria zmian dotyczy konfiguracji agentów i zmierza ku większej modularności. Składnia @path/to/file pozwala odwoływać się do plików zewnętrznych i dołączać je w AGENTS.md oraz w niestandardowych plikach reguł, klucz rules: pojawia się w frontmatter agentów markdown, aby powiązać reguły z konkretnym agentem zamiast z całym projektem, a Antigravity wykrywa teraz również skills, agentów i reguły zadeklarowane w plikach skills.json, agents.json i rules.json znajdujących się w podkatalogach — przydatne w monorepo, gdzie każdy podprojekt ma własną konfigurację. Reszta dotyczy ergonomii: dzielone terminale obok siebie, renderowanie frontmatter YAML jako karty metadanych, motyw Darcula oraz odczyt konkretnych zakresów stron w dokumentach wielostronicowych.
GitHub: globalna polityka modeli w ogólnej dostępności i okrągły stół maintainerów OpenClaw
26 sierpnia — GitHub upowszechnia globalną politykę modeli dla Copilot Business i Copilot Enterprise. Ogłoszony w lipcu mechanizm daje administratorom pojedynczy przełącznik, który decyduje o losie modeli, których nie skonfigurowali wprost, zamiast zmuszać ich do podejmowania decyzji model po modelu przy każdym nowym wydaniu. Wdrożenie do działającej aplikacji rozciąga się do 1 września, więc przełączenie nie następuje w tym samym momencie we wszystkich firmach. Już ręcznie podjęte decyzje pozostają bez zmian, a dwie kategorie są odporne na politykę niezależnie od jej wartości: modele z otwartymi wagami, z DeepSeek i Kimi K2 jako przykładami, oraz modele nieobjęte umową o retencji danych GitHuba, przy czym ogłoszenie wymienia Fable 5. GitHub rozważa też usunięcie stanu „Delegate to default policy”, aby wymusić jednoznaczną decyzję dla każdego modelu.
27 sierpnia GitHub publikuje wideo z okrągłego stołu z maintainerami OpenClaw, wraz z artykułem, który wyciąga z niego dziesięć lekcji. Uruchomione przez Petera Steinbergera w listopadzie 2025 jako projekt weekendowy, to repozytorium ma na 26 sierpnia około 388 000 gwiazdek, 81 000 forków i ponad 80 000 commitów — GitHub przedstawia je jako projekt o najszybszym wzroście w swojej historii. Wartość tej rozmowy polega na tym, co ujawnia o pracy maintainera, gdy agenci wchodzą do pętli: Steinberger wyjaśnia, że nie mówi już o pull requestach, lecz o „prompt requests”, a Josh Lehman opisuje współtwórców uruchamiających zautomatyzowane łańcuchy, które otwierały setki pull requestów. Sygnały zaufania zmieniły się odpowiednio — transkrypcje agentów, zrzuty ekranu i dowody testów zamiast licznika wkładów — tym bardziej że reputacja sama stała się powierzchnią ataku, a ludzie duplikują pull requesty innych, aby zawyżyć liczbę swoich scaleń.
| Wskaźnik repozytorium OpenClaw na 26 sierpnia 2026 | Zmierzona wartość |
|---|---|
| Gwiazdki | Około 388 000 |
| Forki | 81 000 |
| Commity | Ponad 80 000 |
| Start projektu | Listopad 2025 |
🔗 Globalna polityka modeli · Okrągły stół OpenClaw
Krótkie wiadomości
- Qwen3.8-Flash routable na OpenRouter i uruchamialny lokalnie na 75 GB RAM — Model staje się dostępny przez OpenRouter dzień po udostępnieniu swoich wag, do asystentów kodu, agentowych przepływów pracy i rozumienia długich wideo. Równolegle Unsloth publikuje swoje GGUF już pierwszego dnia: MoE z 125 miliardami parametrów działa lokalnie na 75 GB RAM, a Unsloth twierdzi, że przewyższa Claude Opus 4.6 Max — to twierdzenie Unsloth, którego nie potwierdza żadny niezależny pomiar. 🔗 OpenRouter · GGUF Unsloth
- Grok 4.6 dołącza do Microsoft Foundry i uruchamia się z Linear — Model trafia do katalogu Microsoft Foundry z 500 000 tokenów kontekstu i czterema poziomami wysiłku rozumowania, uzupełniając Amazon Bedrock i Google Enterprise Agent Platform. Na grok.com wyzwalacze Linear pozwalają Grokowi sortować zgłoszenia, śledzić postęp i uruchamiać się automatycznie, gdy tylko zgłoszenie zostanie mu przypisane. 🔗 Grok w Foundry · Wyzwalacze Linear
- Joelle Pineau i Mikey trafiają do rankingu TIME100 AI 2026 — Cohere ogłasza, że jej dyrektorka ds. AI znalazła się na liście magazynu TIME, przypominając o ponad dwudziestu latach badań w Kanadzie, od inteligentnych wózków inwalidzkich po ML Reproducibility Checklist. Suno tego samego dnia ogłasza nominację Mikey do tego samego rankingu, bez powiązanego ogłoszenia produktowego. 🔗 Cohere · Suno
- Cookbook podłącza Claude Managed Agent do Chat SDK firmy Vercel — Chat SDK zapewnia interfejs rozmowy z typowanym menedżerem
onDirectMessagei ponad piętnastoma adapterami (Slack, Teams, Discord, web), a Managed Agents uruchamiają agenta po stronie serwera z trwałą sesją dla każdej konwersacji. Kod opublikowany w repozytorium claude-quickstarts. 🔗 Wiadomość od @ClaudeDevs - ChatGPT na iOS 1.2026.230: wyszukiwanie zadań, wskaźnik reasoning effort i edytor pełnoekranowy — Kompaktowy wskaźnik w composerze do regulacji wysiłku rozumowania z poziomu telefonu, pełnoekranowy edytor dla długich promptów, wyszukiwanie obejmujące zarówno tytuły, jak i treści oraz skróty ekranu głównego do ChatGPT, Work i Codex Remote. Ten sam wpis changelogu co wyżej dla zadań wydarzeniowych.
- Amp usuwa pasek boczny ze swojego TUI — Między orbami, runnerami i wiadomościami wymienianymi między agentami Amp uznaje, że śledzenie wątków należy do aplikacji webowych i natywnych, a nakładanie wieloplatformowego multiplexingu na multiplexing terminala było złym doświadczeniem. 🔗 Wpis Amp
- Hugging Face uruchamia swoje podsumowania abstraktów na Inkling-Small — Platforma wyjaśnia, że podsumowania wyświetlane na stronach artykułów opierają się na modelu z otwartymi wagami od Thinking Machines, pod hasłem „open weights × open science”. 🔗 Wiadomość od @huggingface
- Gemini CLI naprawia lukę SSRF w wykrywaniu metadanych OAuth MCP — W nocnej wersji (nightly) z 27 sierpnia znajduje się tylko jedna zmiana, poprawka przeciwko Server-Side Request Forgery w wykrywaniu metadanych OAuth serwerów MCP. Nie jest jeszcze obecna w stabilnym kanale, który pozostał na v0.57.0. 🔗 Informacje o wydaniu
- Perplexity publikuje nowe oceny Brain — System pamięci samodoskonalącej Perplexity Computer zyskuje 9,3 punktu trafności, 8,0 punktu aktualności i 8,9 punktu odwołania względem pierwszych wyników, przy 15% mniej tokenów. 🔗 Wiadomość od @perplexity_ai
- Marketplace’y wtyczek akceptują automatyczną aktualizację w przedsiębiorstwach — Pole
autoUpdateumieszczone w wpisieextraKnownMarketplacespozwala klientom Copilot samodzielnie aktualizować wtyczki z marketplace’u, pod warunkiem że ten nadal znajduje się na allowliściestrictKnownMarketplaces. 🔗 Changelog GitHub - Blokowanie użytkownika zamyka teraz wszystkie jego otwarte kontribucje — Opcja „Close content authored by this user” w oknie blokowania zamyka jednym ruchem otwarte issues, dyskusje i pull requesty zablokowanego użytkownika, zarówno na koncie osobistym, jak i w organizacji. 🔗 Changelog GitHub
- Cohere broni modelu wdrożonych inżynierów, który buduje zdolności klienta — Wpis rozróżnia zależność komercyjną lub architektoniczną, nieodłączną od wyboru technologii, od zależności operacyjnej, którą uznaje za możliwą do uniknięcia, i cytuje raport Deloitte 2026, według którego tylko 25% organizacji uruchomiło produkcyjnie 40% lub więcej swoich pilotaży AI. 🔗 Wpis Cohere
- Google DeepMind poświęca odcinek podcastu niepewności — Zoubin Ghahramani, VP Research, wyjaśnia z Hannah Fry, dlaczego nauczenie systemu wątpienia w samego siebie i rozumowania probabilistycznego daje bardziej wiarygodne decyzje, od prognoz pogody po robotykę. 🔗 Wiadomość od @GoogleDeepMind
- Wan uruchamia cotygodniowy Skill Challenge wokół WanCLI — Trzy skills opublikowane na wan.video są wybierane co tydzień, a ich autorzy wygrywają miesiąc subskrypcji premium, przy czym każda zatwierdzona skill przynosi 150 kredytów; skill musi wywołać co najmniej jeden model Wanxiang za pomocą WanCLI. 🔗 Wiadomość od @Alibaba_Wan
- GeForce NOW na Gamescom 2026 — Nowe sterowanie DLSS 4.5, wsparcie dla nowych urządzeń Steam, jednokrotne logowanie GOG, Firefox i większej liczby urządzeń Fire TV oraz pięć gier dostępnych w chmurze od dnia premiery. Bardziej wiadomość o grach niż o generatywnej AI. 🔗 Wpis NVIDIA
- Runway publikuje wideo-zajawkę bez nazwanego produktu — Wideo opatrzone jedynie frazą „You’ve never seen anything like this” i ogólnym linkiem do aplikacji, bez nazwy modelu ani funkcji, oraz bez odpowiednika na stronie aktualności studia. Oznaczone do odnotowania: nie da się z tego wywieść żadnego weryfikowalnego faktu. 🔗 Wiadomość od @runwayml
Co to oznacza
Agenci schodzą do laboratorium, a bariera jest sprzętowa, zanim stanie się programowa. Model Hardware Standard nie rozwiązuje problemu modelu, lecz problem instalacji: siedem programów konstrukcyjnych bez wspólnego interfejsu w Janelii, cztery rodziny sprzętu na trzech niekompatybilnych komputerach na Carnegie Mellon. Skracając integrację z kilku tygodni do kilku godzin, Anthropic przesuwa wąskie gardło z łączenia na nadzór — i przyznaje to, cytując Genentech, gdzie trzeba było wyjaśnić Claude, że pienienie się próbki było awarią fizyczną, a nie błędem. Odkrycie Ai2 dotyczące inwazyjnego raka zrazikowego mówi to samo z drugiego końca łańcucha: wartość nie tkwi w odpowiedzi wygenerowanej przez model, lecz w późniejszej walidacji niezależnej i laboratoryjnej. 10 000 miejsc Claude otwartych tego samego dnia dla badaczy dopełnia ten zestaw, uderzając w trzecią barierę, czyli koszt dostępu.
Bezpieczeństwo przechodzi z produktu do współdzielonej infrastruktury. Artykuł o zbiorowej cyberobronie jest przede wszystkim wart przez organizacje, które go firmują: OpenAI, Anthropic, AWS, Google, Microsoft i Oracle rywalizują o ten sam rynek, a jednocześnie spotykają się przy tym samym tekście, a jedna z próśb skierowanych do laboratoriów granicznych — aby tożsamości agentowe były możliwe do śledzenia i rozliczalne — jest wprost lekcją z incydentu Hugging Face opublikowanego dzień wcześniej. Reszta dnia rozwija to przesunięcie na poziomie narzędzi: Codex przestaje ładować AGENTS.md z niezaufanych projektów, Claude Code unieszkodliwia linki terminalowe zawierające niewidoczne znaki, Gemini CLI naprawia SSRF w odkrywaniu OAuth serwerów MCP. Trzy pozornie niepowiązane poprawki, ale jeden wniosek: powierzchnią ataku agenta kodu są pliki i serwery, które każemy mu czytać.
Ewaluacja sama staje się obiektem wymagającym zabezpieczenia. Pilotaż Google DeepMind z Singapore AI Safety Institute rozwiązuje odwieczny dylemat ewaluacji zewnętrznej — ujawnić prompty testowe czy ujawnić wagi — nie ujawniając ani jednego, ani drugiego, dzięki enklawie, której obie strony kryptograficznie weryfikują właściwości. To metodologiczny odpowiednik liczb publikowanych przez resztę dnia: Together AI nie poprzestaje na jednym wyniku, lecz publikuje 904 uruchomienia, cztery próby na zadanie, profile błędów i koszt na zadanie; Cohere otwarcie rezygnuje z dwóch wymiarów ParseBench i każe ponownie oceniać konkurentów według skorygowanych reguł z sierpnia. W obu przypadkach na pierwszy plan wychodzi już nie wynik, lecz protokół — znak, że sam wynik nie przekonuje już nikogo.
A koszt wykonania zadania pozostaje metryką decydującą. GLM-5.3 Flash opiera całe swoje pozycjonowanie na oszczędności architektonicznej — trzy razy mniej obliczeń attention, 4,4 razy mniejszy cache KV — przełożonej na 0,15 dolara za milion tokenów wejściowych, niemal dziesięć razy mniej niż GLM-5.2 u tego samego hosta. Together AI pokazuje, że kaskada DeepSeek, a potem Sol rozwiązuje o dziesięć punktów zadań więcej za mniej niż połowę ceny samego Sol, co sprowadza się do stwierdzenia, że najlepszy model nie zawsze jest właściwym zakupem. Replit wyciąga z tego wniosek produktowy, całkowicie usuwając wybór modelu, Cohere sprzedaje Model Vault z 61% różnicą przy pełnym wykorzystaniu, a Google liczy sobie jedną trzecią ceny za roboczy szkic wideo 360p. Nawet dostawa CPU Vera do AWS wynika z tej ekonomii: jeśli obciążenie agentowe zużywa piętnaście razy więcej tokenów niż zapytanie czatu, orkiestracja poza GPU przestaje być drobiazgiem księgowym.
Źródła
- Anthropic — Model Hardware Standard
- Anthropic — rozszerzone wsparcie dla naukowców
- Anthropic — wbudowana przeglądarka Cowork
- Claude Code — changelog
- Ai2 — partnerstwo z Providence Swedish
- OpenAI — wezwanie do wspólnego działania w cyberobronie
- OpenAI — Codex CLI 0.150.0
- OpenAI — obecność w Brazylii
- OpenAI — co studenci zyskują dzięki ChatGPT
- Together AI — GLM-5.3 Flash
- Together AI — porównanie DeepSWE DeepSeek i GPT-5.6 Sol
- Z.ai — publikacja wag GLM-5.3
- Google — Gemini Omni 1.1 Flash
- Google DeepMind — podwójnie ślepe ewaluacje
- Gemini Notebook — Expert Intelligence
- Google — changelog Antigravity
- fal — prezentacja H3 Max
- Cohere — Parse
- NVIDIA — dostawa CPU Vera
- NVIDIA — NVLink Fusion i NVHBM
- Warp — pętle samodoskonalenia
- Replit — inteligentne routowanie modeli
- Cursor — start bez istniejącego repozytorium
- Amp — projekty wielorepozytoryjne
- GitHub — globalna polityka modeli
- GitHub — panel dyskusyjny maintainerów OpenClaw