ai-powered-markdown-translatorArtykuł przetłumaczony z fr na pl za pomocą gpt-5.6-sol.
W ten piątek narzędzia agentowe zbliżają się do wspólnych formatów: Claude Code odczytuje teraz AGENTS.md, gdy projekt nie ma CLAUDE.md, Antigravity wstrzykuje katalog podagentów do promptu systemowego swoich agentów Markdown, Codex szczegółowo przedstawia zużycie zasobów przez poszczególne podagenty, a MiniMax udostępnia kod swojego agenta terminalowego. Resztę dnia wypełniają premiery dwóch modeli — Qwen3.8-Omni-Flash i Grok Voice Transcribe 2.0 — oraz nietypowe partnerstwo: Anthropic umieszcza ewaluatorów Accenture wewnątrz własnej firmy.
Claude Code czyta AGENTS.md, izoluje podagentów i usuwa TaskOutput
18 września — W ciągu dwudziestu godzin ukazały się trzy wersje Claude Code: 2.1.275 17 września o 22:33 UTC, 2.1.276 18 września o 02:12 UTC i 2.1.277 18 września o 18:06 UTC.
Najbardziej znacząca zmiana mieści się w jednym wierszu informacji o wersji 2.1.277. W projekcie pozbawionym CLAUDE.md Claude Code odczytuje AGENTS.md, plik instrukcji, który stał się wspólną konwencją dla kilku dostępnych na rynku agentów programistycznych. Ustawienie można zmienić w /config, w sekcji „Instrukcje projektu”. Funkcja nie jest jeszcze dostępna w Bedrock, Vertex ani Foundry.
Added AGENTS.md support: in a project with no CLAUDE.md, Claude Code reads AGENTS.md instead; change it under “Project instructions” in /config (not yet on Bedrock, Vertex or Foundry)
🇵🇱 Dodano obsługę AGENTS.md: w projekcie bez CLAUDE.md Claude Code odczytuje zamiast niego AGENTS.md; ustawienie można zmienić w sekcji „Instrukcje projektu” w /config (funkcja nie jest jeszcze dostępna w Bedrock, Vertex ani Foundry). — CHANGELOG Claude Code, anthropics/claude-code
Dwie inne zmiany w tej samej wersji dotyczą bezpieczeństwa kontekstu. Wyniki podagentów trafiają do agenta głównego pod nagłówkiem oznaczającym je jako takie, aby tekst zwrócony przez podagenta nie mógł zostać uznany za instrukcję sesji; z promptów usuwane są też niewidoczne znaki formatujące Unicode, a oczyszczona wersja jest wyświetlana przed wysłaniem. Wersja 2.1.277 usuwa również przestarzałe narzędzie TaskOutput: Claude odczytuje teraz plik wyjściowy zadania działającego w tle za pomocą Read.
Wersja 2.1.275 dodaje klawisz natychmiastowego wysyłania (ctrl+enter), który przerywa bieżącą turę i jednocześnie wysyła wszystkie wiadomości z kolejki, a także synchronizację z terminalem skills i plugins aktywowanych na koncie claude.ai. W zakresie łańcucha dostaw plugins pochodzące z npm są pobierane przez npm pack --ignore-scripts z weryfikacją integralności, co uniemożliwia uruchamianie skryptów instalacyjnych pakietu. Wersja 2.1.276, opublikowana niespełna cztery godziny później, naprawia tylko regresję z tej wersji: błąd 400 powodujący niepowodzenie wszystkich żądań przesyłanych przez proxy.
| Numer wersji | Publikacja (UTC) | Najważniejsza zawartość |
|---|---|---|
| 2.1.275 | 17.09 o 22:33 | Natychmiastowe wysyłanie, synchronizacja skills z claude.ai, npm --ignore-scripts |
| 2.1.276 | 18.09 o 02:12 | Pojedyncza poprawka: błąd 400 za proxy |
| 2.1.277 | 18.09 o 18:06 | Obsługa AGENTS.md, izolacja podagentów, usunięcie TaskOutput |
Qwen3.8-Omni-Flash, pierwszy agentowy model omni-modalny Qwen
18 września — Qwen publikuje Qwen3.8-Omni-Flash, przedstawiany jako pierwszy model omni-modalny firmy zaprojektowany wokół możliwości agentowych. Zapowiadana zmiana nie dotyczy już rozumienia treści multimodalnych, lecz ich wykorzystania: zrozumienia treści, zaplanowania zadania, wykonania go za pomocą narzędzi i dostarczenia rezultatu. Model przyjmuje tekst, obrazy, dźwięk i wideo w oknie kontekstowym liczącym milion tokenów.
Meet Qwen3.8-Omni-Flash, Qwen’s first omni-modal model built around agentic capabilities!
🇵🇱 Oto Qwen3.8-Omni-Flash, pierwszy model omni-modalny Qwen zbudowany wokół możliwości agentowych. — @Alibaba_Qwen na X
W 29 ewaluacjach wybranych przez Qwen średni wynik wzrasta o ponad 25% względem Qwen3.5-Omni-Plus, przy czym największe postępy dotyczą agentów audio-wideo. Największa zmiana nastąpiła w rozpoznawaniu wielu mówców.
| Wybrana ewaluacja | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71,0 | 34,5 | 58,9 |
| UniClawBench | 69,6 | 67,1 | 69,0 |
| AgenticVBench | 36,8 | 14,5 | 45,0 |
| OmniVideoBench | 63,4 | 53,8 | 65,2 |
| StreamingBench | 80,8 | 57,1 | 79,9 |
| AliMeeting DER / cpWER (mniej znaczy lepiej) | 3,4 / 17,2 | 88,1 / 89,6 | 72,6 / 53,1 |
Najbardziej oryginalnym elementem jest percepcja agentowa zastosowana do długich materiałów wideo. Zamiast przetwarzać nagranie od początku do końca, model wychodzi od zadanego pytania, sam decyduje, co obejrzeć i czego posłuchać, oraz lokalizuje informacje w kolejnych przejściach od ogółu do szczegółu. W OmniVideoBench tryb ten zwiększa dokładność z 63,4 do 67,8, jednocześnie zmniejszając zużycie ze 145 736 do 79 117 tokenów na żądanie, czyli o około 45,7% — jest to wartość podana wprost w oficjalnym wpisie.
W ślad za tym idą ceny: zgodnie z metodologią Qwen cena za godzinę wejściowego dźwięku spada o ponad 98% względem Qwen3.5-Omni-Plus. Jednocześnie udostępniono dwa komponenty: Qwen-MM-Plugins, zgodny z harnessami Codex, Claude Code, Qwen Code i Gemini CLI, oraz Qwen-Live Harness do interakcji w czasie rzeczywistym. Wariant Realtime jest przeznaczony do ciągłej interakcji o niskim opóźnieniu, z pierwszym tokenem po 591–981 milisekundach.
🔗 Wpis Qwen o Qwen3.8-Omni-Flash
Codex CLI 0.155.0 eksperymentalnie wprowadza rozmowy głosowe
17 września — OpenAI publikuje Codex CLI 0.155.0, pierwszą stabilną wersję od wydania 0.154.0 z 10 września, instalowaną przez npm install -g @openai/codex@0.155.0. To brakująca pozycja w changelogu agenta głosowego zapowiedzianego dzień wcześniej na X: funkcja nosi nazwę /voice, oferuje transkrypcję na żywo i sterowanie mikrofonem oraz pozostaje eksperymentalna — jest dostępna tylko w obsługiwanych kompilacjach (supported builds) i trzeba ją aktywować przez /experimental.
Pozostała część wydania jest mniej efektowna, ale bardziej bezpośrednio użyteczna. Interfejs terminalowy otrzymuje podsumowania rozumowania na żywo w wierszu stanu oraz znacznik czasu zakończenia po każdej pomyślnie ukończonej turze. Widok agentów pozwala ukrywać, archiwizować i usuwać zadania, pokazuje szczegóły własności worktrees i prosi o potwierdzenie przed usunięciem czystych, zarządzanych worktrees. Na zgodnych komputerach Mac żądania MCP z lokalnych sesji TUI można zatwierdzać za pomocą Touch ID. Amazon Bedrock może pobierać dane uwierzytelniające AWS ze skonfigurowanych poleceń, z obsługą pamięci podręcznej, odświeżania po wygaśnięciu i ponawiania po nieudanym uwierzytelnieniu.
Kilka poprawek dotyczy bezpieczeństwa: zablokowano ucieczki procesów Windows z ograniczonych sandboxów WSL, wzmocniono pośredniczone snapshoty powłoki przed ujawnieniem danych uwierzytelniających, a zmiana konta unieważnia sesje zdalnego sterowania, zapisany w pamięci podręcznej stan WebSocket oraz katalogi modeli należące do poprzedniej tożsamości.
| Nowość w wersji | Szczegóły |
|---|---|
/voice | Transkrypcja na żywo i sterowanie mikrofonem, eksperymentalnie przez /experimental |
| Interfejs terminalowy | Podsumowania rozumowania w wierszu stanu, znacznik czasu zakończenia tury |
| Widok agentów | Ukrywanie, archiwizowanie i usuwanie zadań, własność worktrees |
| Touch ID | Zatwierdzanie żądań MCP w sesji lokalnej na zgodnych komputerach Mac |
| Amazon Bedrock | Dane uwierzytelniające AWS pobierane poleceniem, z cache i odświeżaniem |
🔗 Informacje o wersji Codex CLI 0.155.0
Codex szczegółowo przedstawia zużycie według zadania, podagenta i rozmowy
18 września — OpenAI Developers zapowiada szczegółowe śledzenie zużycia w Codex: narzędzie pokazuje, w jaki sposób zadania, podagenty i poszczególne rozmowy składają się na całkowite użycie. Informacje znajdują się w aplikacji desktopowej, w Ustawieniach, a następnie w sekcji Użycie i rozliczenia dla kont osobistych i Business lub w sekcji Użycie dla kwalifikujących się kont Enterprise; aby z nich korzystać, trzeba mieć aktualną wersję. Zapowiedzi nie towarzyszy żaden wpis na blogu ani pozycja w changelogu.
Najważniejsza jest szczegółowość. Do tej pory wyczerpany limit nie wskazywał źródła zużycia; rozbicie według podagentów pozwala ustalić, która delegacja jest kosztowna, i ją przepisać. To księgowy odpowiednik upowszechnienia podagentów w harnessach programistycznych.
🔗 Zapowiedź OpenAI Developers na X
Grok Voice Transcribe 2.0, rozpoznawanie mowy SpaceXAI w niezmienionej cenie
18 września — SpaceXAI zapowiada Grok Voice Transcribe 2.0, swój nowy model rozpoznawania mowy (speech-to-text), opisywany jako dwukrotnie dokładniejszy od wersji 1.0 przy tej samej cenie. Model opiera się na fundamencie audio, który już zasila Grok Voice, przetwarzający według firmy dziesiątki tysięcy połączeń z obsługą klienta dziennie i transkrybujący miliony godzin narracji wideo.
Główny argument dotyczy rzeczywistych nagrań, a nie dźwięku laboratoryjnego: niestabilnych linii telefonicznych, nakładających się głosów, lokalnych akcentów oraz numerów telefonów i adresów e-mail dyktowanych na głos. SpaceXAI deklaruje pierwsze miejsce pod względem dokładności wśród 32 modeli strumieniowych w publicznym rankingu Artificial Analysis i opiera się na czterech wewnętrznych zbiorach pochodzących z ruchu produkcyjnego — telefonii 8 kHz, rozmowach z Grok, dyktowanych identyfikatorach oraz krótkich poleceniach głosowych w 19 językach.
Największa poprawa dotyczy wielojęzyczności. W zbiorze krótkich zdań, które dostarczają najmniej kontekstu do rozpoznania języka, współczynnik błędów słów spada z 20,6% do 6,8%. Model automatycznie wykrywa język i śledzi jego zmiany w trakcie nagrania w jednym przebiegu.
| Zmierzona metryka | Deklarowana wartość |
|---|---|
| Deklarowana dokładność względem Transcribe 1.0 | dwukrotnie wyższa |
| Ranking Artificial Analysis (tryb strumieniowy) | 1. miejsce wśród 32 modeli |
| Współczynnik błędów dla krótkich zdań (1.0 → 2.0) | 20,6% → 6,8% |
| Cena przetwarzania wsadowego | 0,10 dolara za godzinę dźwięku |
| Cena przetwarzania strumieniowego | 0,20 dolara za godzinę dźwięku |
| Kanały transkrybowane niezależnie | do 8 |
| Terminy branżowe na żądanie | do 100 |
Model obsługuje przetwarzanie wsadowe i strumieniowe, znaczniki czasu na poziomie słów z wynikiem ufności, rozdzielanie mówców (diarization) bez dodatkowych opłat oraz wykrywanie końca tury wypowiedzi. Istniejące integracje API otrzymują większą dokładność bez zmiany kodu. Grok Voice Transcribe 2.0 wkrótce stanie się domyślnym modelem API, a wersja 1.0 zostanie uznana za przestarzałą w nadchodzących tygodniach: aby przy niej pozostać, trzeba będzie przypiąć grok-voice-transcribe-1.0.
🔗 Zapowiedź Grok Voice Transcribe 2.0
Anthropic umieszcza ewaluatorów Accenture wewnątrz firmy
18 września — Anthropic ogłasza partnerstwo z Accenture dotyczące niezależnej ewaluacji modeli frontier, przedstawiane jako ważny krok w realizacji zobowiązania dyrektora generalnego do przyjmowania zintegrowanych ewaluatorów (embedded). Prace poprowadzi Faculty, spółka zależna Accenture specjalizująca się w AI, i obejmą ewaluację oraz red-teaming modeli, ewaluacje alignmentu i testowanie guardrails.
Różnica względem ewaluatorów zewnętrznych jest wyraźna: zintegrowany ewaluator pracuje wewnątrz firmy AI i ma dostęp porównywalny z dostępem pracownika. Może obserwować modele podczas trenowania, śledzić decyzje dotyczące ich budowy i wdrażania, rozmawiać bezpośrednio z pracownikami, sprawdzać przestrzeganie zobowiązań w zakresie bezpieczeństwa, zgłaszać incydenty i publikować lepiej udokumentowany opis korzyści oraz zagrożeń. Anthropic podkreśla, że rozwiązanie to nie zmniejsza odpowiedzialności firmy, lecz ułatwia jej weryfikację.
Zapowiedź jest wyjątkowo szczera w kwestii tego, czego jeszcze nie ma. Nie istnieją żadne standardy dotyczące informacji, do których zintegrowany ewaluator powinien mieć dostęp, sposobu publikowania ustaleń ani systemu finansowania niezależnej ewaluacji. Anthropic uważa, że docelowo finansowanie powinno pochodzić ze wspólnych lub publicznych funduszy; ponieważ taki mechanizm obecnie nie istnieje, firma bezpośrednio finansuje pracę Accenture — co stanowi najbardziej widoczne ograniczenie tego rozwiązania.
| Element partnerstwa | Deklarowana wartość |
|---|---|
| Podmiot realizujący | Faculty, spółka AI należąca do Accenture |
| Inwestycja | Co najmniej 1 miliard dolarów na stronę w ciągu pięciu lat |
| Zakres | Ewaluacja, red-teaming, alignment, guardrails |
| Poziom dostępu | Porównywalny z dostępem pracownika |
| Finansowanie | Bezpośrednio przez Anthropic z braku wspólnych funduszy |
| Wyłączność | Brak po obu stronach |
Anthropic informuje ponadto, że prowadzi rozmowy z METR i innymi ewaluatorami non-profit w sprawie eksperymentowania z elementami zintegrowanej ewaluacji w ramach ich własnego finansowania, oraz zapowiada kolejnych partnerów w nadchodzących tygodniach.
🔗 Zapowiedź Anthropic dotycząca zintegrowanej ewaluacji
Antigravity: trzy wersje w dwa dni poświęcone niestandardowym agentom
Google opublikował kolejno dwie wersje swojego CLI i jedną wersję aplikacji Antigravity. Wszystkie trzy podejmują ten sam temat z trzech perspektyw: co wie niestandardowy agent, czego może odmówić i jak długo może działać bez nadzoru. Stanowią kontynuację intensywnej serii rozpoczętej 11 września, której wersje od 1.2.1 do 1.2.4 nie zostały tutaj uwzględnione.
CLI 1.2.6 udostępnia Remote Control powiązany z sesją i znosi limit pięciu minut
18 września — Osiem dni po wersji 1.2.0, która przekształciła CLI w trwałą usługę systemową, Google obiera przeciwny kierunek, wprowadzając drugą, znacznie lżejszą formę Remote Control: połączenie ograniczone do sesji (session-scoped), otwierane za pomocą flagi --remote-control podczas uruchamiania lub polecenia /remote-control w trakcie działania. Wpisanie /remote-control off lub zamknięcie sesji usuwa tunel i urządzenie z listy. Podczas gdy wersja 1.2.0 stawiała na demona działającego po zakończeniu sesji, 1.2.6 zmierza w przeciwnym kierunku.
Druga zmiana dotyczy trybu bez interfejsu (headless): domyślny limit czasu wykonań -p / --prompt zostaje wydłużony z pięciu minut do nieograniczonego czasu, chyba że jawnie podano --print-timeout. Trzecia porządkuje raportowanie błędów — w przypadku awarii agenta lub API CLI zapisuje na standardowym wyjściu błędów wiersz JSON AGY_ERROR: {...} zawierający kanoniczny status, kod HTTP lub gRPC, informację o możliwości ponowienia oraz identyfikator błędu, a kod wyjścia zmienia się z 1 na 3. Skrypt orkiestrujący może więc odróżnić tymczasową awarię sieci od trwałego błędu bez analizowania swobodnego tekstu.
CLI 1.2.5 wreszcie udostępnia agentom Markdown katalog ich podagentów
17 września — Dotychczas niestandardowy agent zdefiniowany w Markdown mógł zadeklarować invoke_subagent w swoich narzędziach, ale nie wiedział, jakie podagenty istnieją: miał narzędzie, lecz nie katalog. CLI dodaje teraz automatycznie do jego promptu systemowego katalog dostępnych podagentów oraz instrukcję ich użycia, dzięki czemu delegowanie faktycznie działa.
Terminologia changelogu wymaga zastrzeżenia: jest to dodanie kontekstu przez sam produkt, a nie luka bezpieczeństwa ani poprawka. Drugie usprawnienie zachowuje jawną nazwę zadania wysłanego do pracy w tle, która wcześniej ginęła między powiadomieniami a listami zadań. Pięć poprawek obejmuje usuwanie unieważnionych identyfikatorów, kody wyjścia przerwanych poleceń oraz ramki rozumowania, które pozostawały zawieszone.
Antigravity 2.15.0 pozwala niestandardowym agentom wyłączać domyślne prompty i narzędzia
18 września — Trzy dni po wersji 2.14.0 aplikacja publikuje 7 usprawnień i 16 poprawek. Główna zmiana daje niestandardowym agentom kontrolę nad ich własnym kontekstem: mogą wyłączać domyślne sekcje promptu i domyślne narzędzia, a następnie ponownie wprowadzać tylko te, których potrzebują. W przypadku wyspecjalizowanego agenta odpowiednio ogranicza to narzucony prompt systemowy.
Pozostałe zmiany dotyczą nawigacji i trwałości ustawień: Page Up, Page Down, Home i End przewijają rozmowę, Escape przenosi fokus poza pole wprowadzania, a wybrany niestandardowy agent jest zapamiętywany po ponownym wczytaniu. Dwie poprawki dotyczą integralności danych — zapisane ustawienia i lista projektów mogły zostać nadpisane, gdy aplikacji nie udało się odczytać pliku stanu, a ustawienia uprawnień gromadziły duplikaty, przez które rosły pliki rozmów.
GitHub Copilot: canvas Sentry, sześć wycofanych modeli i metryki według personalizacji
Trzy wpisy w changelogu opublikowane w ciągu dwóch dni pokazują tę samą troskę: mierzyć, jak zespoły rzeczywiście korzystają z Copilot, i usuwać to, czego już nie używają.
Podsumowanie z 14 września wyodrębnia dwa nowe elementy
18 września — GitHub publikuje cotygodniowe podsumowanie Copilot za tydzień rozpoczynający się 14 września. Większość zestawienia powtarza wpisy opublikowane już wcześniej w changelogu; tylko dwa elementy nie zostały nigdy ogłoszone oddzielnie. Pierwszym jest canvas Sentry w aplikacji Copilot, który łączy raport o awarii produkcyjnej z poprawką bez opuszczania aplikacji: wyświetla błędy, ślady stosu (stack traces) i kontekst, a następnie umożliwia zbadanie przyczyny, zweryfikowanie poprawki i przygotowanie pull request. Jest to pierwsza integracja narzędzia do monitorowania błędów w canvases, po Jira na początku września.
Drugim jest fala agentów w VS Code 1.138. Okno Agents może uruchomić agenta w lokalnym Dev Container, z narzędziami i zależnościami projektu — funkcja jest wdrażana stopniowo i wymaga Docker. Nieaktywne sesje mogą być automatycznie oznaczane jako zakończone po scaleniu wszystkich ich pull requests, z opcjonalnym usunięciem po okresie karencji; funkcja jest dostępna w wersji zapoznawczej i wymaga jawnego włączenia. Ponadto pull request można utworzyć bezpośrednio z sesji Agent Host.
🔗 Cotygodniowe podsumowanie Copilot
Sześć modeli znika ze wszystkich interfejsów Copilot 19 października
18 września — GitHub zapowiada wycofanie sześciu modeli ze wszystkich interfejsów Copilot — Copilot Chat, edycji inline, trybów ask i agent oraz uzupełniania kodu — 19 października 2026 roku. Jest to druga fala wycofań zapowiedziana we wrześniu.
| Wycofywany model | Data wycofania | Sugerowana alternatywa |
|---|---|---|
| Gemini 3.7 Flash | 19/10/2026 | Gemini 3.8 Flash |
| GPT-5.5 | 19/10/2026 | GPT-5.6 Sol |
| GPT-5.4 | 19/10/2026 | GPT-5.6 Sol |
| GPT-5.4 mini | 19/10/2026 | GPT-5.6 Luna |
| GPT-5 mini | 19/10/2026 | GPT-5.6 Luna |
| Grok 4.5 | 19/10/2026 | Grok 4.6 |
Przy domyślnym włączaniu modeli alternatywy są automatycznie aktywowane dla klientów Copilot Enterprise i Business, chyba że administrator wyłączył globalne ustawienie domyślne lub jawnie zablokował dany model; w takim przypadku dostęp można ponownie otworzyć za pomocą zasad modeli w ustawieniach. Wycofanie modeli nie wymaga żadnych działań.
🔗 Ogłoszenie o wycofaniu modeli Copilot
API metryk zlicza skills, agentów, serwery MCP i plugins CLI
17 września — API metryk użycia Copilot obejmuje teraz pięć kategorii agentowych personalizacji CLI: skills, niestandardowych agentów, serwery MCP, slash commands i plugins. Tabele totals_by_skill, totals_by_custom_agent, totals_by_mcp, totals_by_slash_cmd i totals_by_plugin przedstawiają pięć najaktywniejszych elementów wraz z ich interaction_count, natomiast pola distinct_*_use_count zliczają różnorodność elementów używanych poza tą pierwszą piątką.
Dwa niuanse zapobiegają błędnym interpretacjom. W przypadku serwerów MCP licznik zwiększa się tylko wtedy, gdy CLI próbuje nawiązać lub ponownie nawiązać połączenie — niezależnie od powodzenia — a nie przy każdym wywołaniu narzędzia w ramach już ustanowionego połączenia. Metryki plugins zliczają wyłącznie wywołania skills powiązanych z plugin: stanowią podzbiór łącznej liczby skills i nie należy ich do niej dodawać. Ze względów prywatności wyświetlane są tylko nazwy dostarczone przez GitHub, natomiast nazwy zdefiniowane przez klientów są grupowane pod other.
🔗 Agentowe personalizacje CLI w API metryk
Agenci kodujący w terminalu: MiniMax otwiera własnego, Mistral stabilizuje swój harness
Dwa ogłoszenia od dwóch niepowiązanych podmiotów, tego samego dnia i na tym samym rynku: agent kodujący działający w terminalu staje się powszechny, a obszarem różnicowania stają się licencja i stabilność harnessu.
MiniMax publikuje kod MiniMax Code CLI na licencji MIT
18 września — MiniMax udostępnia kod źródłowy swojego terminalowego agenta kodującego w wersji 0.4.12. Narzędzie instaluje się pod nazwą mcode i oferuje trzy punkty wejścia: interaktywny interfejs terminalowy, tryb bez interfejsu (mcode exec) przeznaczony do skryptów shell, ciągłej integracji i ewaluacji oraz tryb ACP dla edytorów zgodnych z Agent Client Protocol. Odczytuje pliki projektu, analizuje różnice, wykonuje polecenia shell i testy, działając w ramach systemu uprawnień i sandbox.
Wybór modelu pozostaje otwarty: z jednej strony konto MiniMax i jego Token Plan, z drugiej dostawca zewnętrzny, o ile udostępnia format API zgodny z OpenAI lub Anthropic. Do tego dochodzą zintegrowane wyszukiwanie, narzędzia multimodalne, protokół MCP, podagenci i system plugins. Własny kod projektu jest domyślnie publikowany na licencji MIT. Repozytorium obejmuje TUI, CLI bez interfejsu oraz tryb ACP, ale nie aplikację desktopową, choć zawiera jej system śledzenia błędów; propozycje zmian w kodzie są obecnie przyjmowane wyłącznie od współpracowników repozytorium.
Unified Harness w Vibe CLI traci status eksperymentalny
18 września — Mistral publikuje Vibe CLI 2.25.5, sześć dni po wersji 2.25.4. Kluczowa zmiana mieści się w jednym wierszu informacji o wydaniu: Unified Harness nie jest już oznaczony jako „experimental”, a udokumentowaną drogą powrotu do starego harnessu Python jest teraz --legacy-harness. Po serii wydań naprawczych skupionych na bezpieczeństwie zatwierdzania poleceń shell nowy harness staje się oficjalnym rozwiązaniem domyślnym — istotna jest ta informacja, a nie numer wersji.
Zmianie towarzyszy nadrabianie braków funkcjonalnych: Unified Harness wprowadza teraz bieżącą gałąź Git, stan repozytorium i ostatnie commity do instrukcji systemowych, hooks wreszcie wykonują się wewnątrz podagentów, zamiast być po cichu ignorowane, a dostawcy skonfigurowani bez zmiennej środowiskowej z kluczem API — serwery lokalne lub samodzielnie hostowane — znów działają. Zaostrzanie uprawnień trwa nadal: zatwierdzenia poleceń shell nie rozszerzają się już na inny program lub środowisko, wywołania narzędzi MCP respektują teraz system uprawnień, zamiast go omijać, a smart approve przestaje obchodzić reguły użytkownika.
🔗 Informacje o wydaniu Vibe CLI 2.25.5
Plugins ChatGPT obsługują jednocześnie wiele kont
18 września — Obsługa wielu kont trafia do większości plugins ChatGPT. Można teraz połączyć konto osobiste, konto służbowe i konta pobocznych projektów, a następnie przywoływać kontekst z każdego z nich w tej samej rozmowie. Konta łączy się z poziomu katalogu plugins pod adresem chatgpt.com/plugins.
Ogłoszenie na koncie OpenAI Developers powtarza wiadomość Maxa Stoibera opublikowaną godzinę wcześniej. Deweloperzy plugins nie muszą nic robić: funkcja włącza się automatycznie, bez żadnych zmian. Osoby, które chcą pójść o krok dalej, mogą dodać narzędzie profile do swojego serwera MCP, aby ChatGPT potrafił oznaczać połączone konta — jest to jedyne konkretne działanie, jakiego się od nich oczekuje. Ogłoszeniu opublikowanemu o 18:10 czasu paryskiego nie towarzyszy żaden wpis na blogu ani w changelogu.
Docelowy przypadek użycia to deweloper rozdzielający swoje tożsamości według pracodawcy lub projektu, który dotychczas musiał zmieniać połączenie, aby przełączać kontekst.
🔗 Ogłoszenie obsługi wielu kont na X
🔗 Oryginalna wiadomość Maxa Stoibera
Genspark dodaje cotygodniową pulę kredytów do planów Plus i Pro
18 września — Genspark zmienia korzyści w ramach subskrypcji Plus i Pro, dodając do nich cotygodniową pulę kredytów bez zmiany cen planów. Pula jest przyznawana co tydzień niezależnie od już wykupionego planu i pokrywa użycie w trybie Standard we wszystkich agentach i narzędziach platformy: Super Agent, AI Chat, AI Image, AI Slides, AI Sheets, AI Docs oraz Deep Research.
Druga wiadomość w tym samym wątku szczegółowo opisuje działanie w przypadku AI Chat i AI Image. Obecni subskrybenci otrzymują tę pulę oprócz środków, którymi już dysponują, a do 31 grudnia 2026 roku wszystkie modele AI Chat i AI Image można wykorzystywać bez zużywania kredytów, w tym flagowe modele takie jak Opus; osoby, które wykupią subskrypcję od 18 września, otrzymują bezpłatny dostęp do podstawowych modeli (core models) AI Chat i AI Image. Genspark zaznacza, że zmiany te nie dotyczą planów Team ani Enterprise, i odsyła do swojego centrum pomocy po szczegółowe warunki.
Google Research: rezultaty AlphaGenome Atlas i samoweryfikujące się symulacje
Dwie publikacje badawcze tego samego dnia łączy wspólny element: w obu przypadkach pokazano nie sam model, lecz to, co uzyskały z niego podmioty trzecie, albo to, co w jego zastępstwie sprawdza pętla walidacyjna.
AlphaGenome Atlas przedstawia pierwsze wyniki swoich partnerów
17 września — Dziewięć dni po publikacji AlphaGenome Atlas, mapy przewidującej skutki 9 miliardów możliwych substytucji w ludzkim DNA, Google DeepMind przypina wątek opisujący szczegółowo trzy współprace.
| Partner naukowy | Zgłoszony wynik |
|---|---|
| Stowers Institute | Zmapowano ponad 2 500 motywów regulatorowych |
| University of Exeter / UK Biobank | Przeanalizowano ponad 54 000 uczestników, wykryto o ponad 22% więcej rzadkich sygnałów genetycznych |
| Broad Institute | Zidentyfikowano krytyczną mutację genu DNM1, a następnie potwierdzono ją i zweryfikowano laboratoryjnie |
Motywy regulatorowe to sekwencje DNA, które działają jak przełączniki i potencjometry aktywności genów. Badanie przeprowadzone w Exeter wykryło również nowe warianty wpływające na stężenie PLA2G7, białka związanego ze zdrowiem metabolicznym. Przypadek Broad Institute jest najbardziej konkretny z całej trójki: wobec ogromnej listy możliwych mutacji w niewyjaśnionych chorobach rzadkich Atlas pomaga wskazać właściwą, którą następnie potwierdzają badania laboratoryjne. Całość przedstawiono jednak wyłącznie w wątku na X, bez szczegółowego wpisu ani powiązanej publikacji.
🔗 Wątek AlphaGenome Atlas na X
Wygenerowane symulacje edukacyjne, następnie przetestowane przez agenta w Chrome
17 września — Gal Elidan i Yael Haramaty publikują eksperyment wykorzystujący interfejs generatywny (generative UI) do tworzenia symulacji edukacyjnych. Inicjatywa pozostaje po stronie nauczyciela: proponuje on temat, Google generuje zestaw edytowalnych celów nauczania, które wymagają jego zatwierdzenia i służą jako podstawa do generowania. Każdy materiał interaktywny jest podzielony na poziomy o rosnącym stopniu trudności, z zestawem narzędzi, stopniowanymi wskazówkami i szczegółowymi rozwiązaniami.
Najciekawszym elementem jest pętla samokorekty. Generowanie jest kontrolowane według kryteriów pedagogicznych, mechanicznych i prezentacyjnych, a niektóre oceny mają charakter agentowy: test rozwiązywalności otwiera instancję Chrome i obsługuje symulację tak, jak robiłby to użytkownik, próbując również działań kontradyktoryjnych, takich jak przesuwanie suwaków do skrajnych wartości. Pętla powtarza się, aż wszystkie kryteria zostaną spełnione, kosztem dłuższego czasu generowania. Google publikuje ponad 30 interaktywnych materiałów STEM w języku angielskim; kolekcja 40 materiałów została oceniona przez brytyjskich nauczycieli, a badanie przeprowadzone wśród 12 amerykańskich nauczycieli przyniosło średnią ocenę 8 na 10.
🔗 Wpis Google Research o interaktywnych materiałach edukacyjnych
Claude przyspiesza ponad 30 modeli biologicznych i finansuje konkurs projektowania białek
17 września — Anthropic publikuje wpis opisujący, jak Claude zoptymalizował inferencję ponad 30 modeli open source używanych przez biologów — do przewidywania struktur, projektowania białek oraz tworzenia modeli językowych białek i genomiki — w niecałe cztery tygodnie, osiągając średnio około czterokrotne przyspieszenie. Cały kod został opublikowany jako open source.
Techniczny rdzeń prac dotyczy uwagi trójkątnej i mnożenia trójkątnego, których złożoność czasowa i pamięciowa jest sześcienna. Claude stworzył FlashPairformer, zestaw kerneli, który przewyższa standard branżowy od 2,7 do 2,9 raza w przypadku mechanizmu uwagi. Tryb niskiego zużycia pamięci nazwany „Big” pozwala precyzyjnie przewidywać fałdowanie układów liczących ponad 10 000 tokenów na pojedynczym węźle GPU, podczas gdy rybosom 40S przewidziany przez AlphaFold3 liczył 7 663 tokeny. Równie ważna jest metodologia: prace nadzorowało dwóch członków personelu technicznego bez wcześniejszego doświadczenia w optymalizacji inferencji.
Anthropic wraz z Adaptyv Bio współfinansuje również konkurs projektowania białek obejmujący pięć trudnych problemów, z ponad 5 000 projektów społeczności zweryfikowanych eksperymentalnie, nagrodami do 1 miliona dolarów w kredytach Claude oraz zasobami obliczeniowymi o wartości 250 000 dolarów zapewnionymi przez Modal.
Otwarte modele i laboratoria: Muse trafia na Maca, Sakana ujawnia swój zespół badań pionierskich
Meta wprowadza swojego agenta Muse na macOS
18 września — Meta udostępnia Muse na Macu, co ogłoszono w nocy z 17 na 18 września. Konto @AIatMeta przekazuje publikację opisującą osobistego agenta zdolnego do bezpośredniego działania na komputerze użytkownika, za każdym razem za jego wyraźną zgodą. Wymieniono trzy zastosowania: porządkowanie folderu pobranych plików, odnajdywanie zagubionego pliku oraz podsumowywanie wiadomości i notatek.
Ogłoszenie stanowi rozszerzenie premiery Muse z 8 września, agenta opartego na Muse Spark 1.3, dotychczas dostępnego na iOS, Androidzie, w internecie i WhatsApp. Wejście na Maca oznacza kolejny etap rozwoju tego rodzaju produktu: agent nie działa już we własnym środowisku izolowanym, lecz na osobistych plikach użytkownika. Meta nie podaje ceny, krajów dostępności ani wymagań systemowych, a udostępnieniu nie towarzyszy żaden dokument dotyczący bezpieczeństwa na Macu — blog ai.meta.com nie opublikował niczego od 27 lipca.
Sakana AI ujawnia Frontier Intelligence Group i swoje stanowisko wobec obecnego paradygmatu
18 września — Sakana AI ogłasza istnienie Frontier Intelligence Group (FIG), wewnętrznego zespołu rozwijanego od początków firmy. Punktem wyjścia jest pytanie zadane przez Lliona Jonesa, dyrektora technicznego Sakana AI i jednego z twórców Transformera: czy skalowanie architektury Transformer za pomocą coraz większej ilości danych i mocy obliczeniowej wystarczy, aby osiągnąć AGI? Odpowiedź laboratorium brzmi: nie.
To właśnie tutaj znajduje się najważniejsza informacja, bardziej niż w towarzyszącym jej katalogu prac. Wpis wymienia problemy, których obecny paradygmat nie rozwiązał — modele z przekonaniem generujące fałszywe informacje, zawodzące w obliczu naprawdę nowych sytuacji i zużywające dużo energii — oraz przeciwstawia im inteligencję biologiczną, która uczy się w sposób ciągły i generalizuje na podstawie znacznie mniejszej ilości danych. Grupa przyjmuje pięć zasad, w tym swobodę ponoszenia porażek bez presji na wyniki benchmarków. Wśród zaprezentowanych prac znajdują się rzadkie Transformery opracowane wraz z NVIDIA, które wychodzą od zmierzonej obserwacji — ponad 95% neuronów warstwy feed-forward pozostaje nieaktywnych podczas przetwarzania słowa — i doprowadziły do powstania formatu danych o nazwie TwELL, przyjętego na ICML 2026.
🔗 Wpis Sakana AI o Frontier Intelligence Group
Generowanie wideo: Runway ujednolica kredyty, Pika wydaje swoją pierwszą aplikację
Runway umożliwia wymienne korzystanie z kredytów w aplikacji webowej i Runway Dev
18 września — Runway znosi podział między swoimi dwoma produktami: zakupione kredyty można teraz wykorzystywać zarówno w aplikacji webowej, jak i w Runway Dev, ofercie przeznaczonej dla deweloperów. Dotychczas oba środowiska korzystały z oddzielnych pul, osobnych umów i nie miały jednego miejsca do śledzenia zużycia w różnych projektach.
Zmianie towarzyszą cztery elementy: jedna pula kupowana centralnie na jednej fakturze, płynne przejście między budowaniem przepływu pracy w aplikacji webowej a udostępnianiem go przez API, rozszerzone wsparcie dla Runway Dev z dostępem do Applied AI Architects oraz przeprojektowany widok analityczny przestrzeni roboczej, który pozwala administratorom przenosić kredyty między przestrzeniami webowymi i Dev. Dwie oferty handlowe obowiązują do 31 grudnia 2026 roku: 10% dodatkowych kredytów przy podpisaniu umowy dla nowych firm, co według przelicznika podanego przez Runway odpowiada co najmniej 130 minutom wideo lub 12 000 obrazów, a dla obecnych klientów — 5 000 kredytów oraz jeden dzień pracy Applied AI Architect w zamian za polecenie firmie osoby odpowiedzialnej za aplikacje AI.
🔗 Wpis Runway o ujednoliconych cenach
Pika uruchamia Product Ad, przekształcając zdjęcie produktu w reklamę wideo
18 września — Dzień po zaprezentowaniu swojej nowej platformy kreatywnej Pika udostępnia jej pierwszą aplikację: Product Ad. Aplikacja przyjmuje jedno lub kilka zdjęć produktu, łączy je z pisemnym briefem i tworzy na tej podstawie wideo przedstawiane jako gotowe do wprowadzenia na rynek.
| Parametr generowania | Oferowana wartość |
|---|---|
| Dostępne długości | 6 s, 15 s, 30 s, 60 s, 2 min |
| Format wyjściowy | 16:9 |
| Oczekiwane dane | zdjęcia produktu i pisemny brief |
| Dostęp | wymagane utworzenie konta |
Pika publikuje ogłoszenie, przywołując własną wiadomość z poprzedniego dnia dotyczącą przebudowy platformy, co umieszcza Product Ad w serii oczekiwanych aplikacji, a nie przedstawia go jako odrębną funkcję. Nie wskazano żadnego modelu ani nie podano ceny.
NVIDIA publikuje AIPerf, następcę GenAI-Perf do pomiaru inferencji na dużą skalę
18 września — NVIDIA prezentuje AIPerf, swoje narzędzie do pomiaru wydajności inferencji generatywnej, określane jako następca GenAI-Perf i napisane od podstaw. Punkt wyjścia jest znajomy: po wdrożeniu modelu pytanie „czy działa szybko?” często rozstrzyga się za pomocą poleceń curl lub improwizowanego generatora obciążenia, które dostarczają niewiarygodnych wyników.
Przełom ma charakter architektoniczny. Podczas gdy większość narzędzi działa w pojedynczym procesie i przy rosnącej współbieżności napotyka globalną blokadę interpretera Python, AIPerf rozdziela pracę: procesy robocze generują obciążenie, oddzielne usługi przetwarzają wyniki, a całość jest koordynowana przez ZMQ. Cel jest jasno określony — klient pomiarowy nigdy nie może sam stać się wąskim gardłem.
| Raportowany wskaźnik | Co mierzy |
|---|---|
| Time to First Token | Czas od wysłania żądania do otrzymania pierwszego tokenu |
| Inter-Token Latency | Opóźnienie między kolejnymi tokenami podczas generowania |
| Opóźnienie żądania | Łączny czas uzyskania pełnej odpowiedzi |
| Przepustowość tokenów wyjścia | Tokeny generowane na sekundę we wszystkich żądaniach |
| Raportowane percentyle | p25, p50, p75, p90, p95, p99 |
| Typy punktów końcowych | ponad 15 |
Narzędzie potrafi również odtwarzać ślady rzeczywistego ruchu w formatach Mooncake, Baseten i WEKA. Artykuł podkreśla przede wszystkim użyteczność rozkładów: serwer, którego średni czas do pierwszego tokenu wygląda prawidłowo, ale którego p99 gwałtownie rośnie, pozostaje niezauważony w danych zagregowanych i zawodzi w środowisku produkcyjnym.
Mistral zaprzecza twierdzeniom o nieautoryzowanym dostępie do swoich systemów
18 września — Mistral publikuje o 05:48 UTC krótki komunikat na swoim koncie X w odpowiedzi na twierdzenie o nieautoryzowanym dostępie do jego systemów. Firma informuje, że przeprowadziła szczegółowe dochodzenie, nie znalazła żadnych dowodów potwierdzających to twierdzenie i potwierdza, że jej systemy nie zostały naruszone.
We are aware of a claim alleging unauthorized access to our systems. Following a thorough investigation, we have found no evidence to support this claim and can confirm that our systems have not been compromised.
🇵🇱 Wiemy o zarzucie dotyczącym nieautoryzowanego dostępu do naszych systemów. Po przeprowadzeniu szczegółowego dochodzenia nie znaleźliśmy żadnych dowodów potwierdzających ten zarzut i możemy potwierdzić, że nasze systemy nie zostały naruszone. — @MistralAI na X
Wiadomość nie wskazuje autora tego twierdzenia, nie określa jego daty ani charakteru i nie podaje żadnych szczegółów dotyczących zakresu dochodzenia. Przedstawiono tutaj stanowisko Mistral i wyłącznie ono: nie udało się dotrzeć do pierwotnego zarzutu. Komunikat jest najczęściej wyświetlaną wiadomością tego konta w omawianym okresie, a na stronie firmy nie znaleziono żadnej dodatkowej publikacji.
Krótkie wiadomości
- Balyasny Asset Management opowiada, jak wyznacza ramy korzystania z Claude Fable 5 — firma, która zarządza około 38 miliardami dolarów, skraca wstępną analizę arbitrażu fuzji z trzech–pięciu dni do mniej niż jednego dnia dzięki agentowi działającemu przez około 30 minut i weryfikacji przez człowieka. 🔗 źródło
- Codex CLI 0.155.1 ponownie domyślnie wyłącza podsumowania rozumowania — jedyna poprawka wydana dzień po wersji 0.155.0: ich automatyczne włączanie powodowało odrzucanie żądań przez dostawców, którzy ich nie obsługują. 🔗 źródło
- Gemini CLI wznawia serię wydań nightly po dniu przerwy — cztery zmiany 18 września, w tym zachowywanie refresh tokena OAuth podczas odnowienia oraz idempotentne usuwanie danych uwierzytelniających; kanały stable i preview pozostają bez zmian. 🔗 źródło
- Kimi Code 2.0.1 przyspiesza uruchamianie i wznawianie sesji — wydanie poprawek 32 godziny po wersji 2.0.0: kompaktowanie indeksu sesji, szybsze wznawianie długich historii, możliwość odczytu klucza API z nazwanej zmiennej środowiskowej oraz ograniczona liczba obserwatorów plików. 🔗 źródło
- Qwen Code trafia do wersji preview v0.24.1 z przeglądarkowym SDK Playwright — nie jest to wersja stable; wprowadza zintegrowane sterowanie przeglądarką z mostem natywnej komunikacji Chrome oraz uruchamianie podagentów w kontenerach. 🔗 źródło
- Zed publikuje wersję stable 1.20.2 zawierającą tylko dwie poprawki — błędy płatności u zewnętrznych dostawców modeli nie wyświetlają już zaproszenia do przejścia na Zed Pro zamiast pierwotnego komunikatu, a dwa rozszerzenia snippets dla tego samego języka nie wyłączają się już wzajemnie. 🔗 źródło
- Replit twierdzi, że Free Mode jest „30 razy” hojniejszy, nie publikując punktu odniesienia — jedynie tweet, bez linku ani changelogu, który nie precyzuje, z czym porównywany jest ten współczynnik: należy traktować to jako deklarację Replit, a nie pomiar. 🔗 źródło
- Panel wpływu Copilot rozbija zaangażowanie według funkcji — siedem obszarów w okresie 28 dni, z rozróżnieniem między aktywnym a pasywnym code review oraz populacją fazy adopcji obliczaną teraz w oknie kroczącym. 🔗 źródło
- GitHub planuje transmisję na żywo wprowadzającą do SDK Copilot w sześciu językach — sesje, narzędzia, serwery MCP i zdarzenia strumieniowe, z osobnymi sesjami poświęconymi .NET i Java, bez wymagań wstępnych. 🔗 źródło
- Runway Ruby zachowuje kanał alfa podczas konwersji do HDR — konwersja materiału do HDR zachowuje nienaruszoną przezroczystość w jednym kroku; nie podano ceny ani wymaganego poziomu subskrypcji. 🔗 źródło
- MiniMax dołącza do Singtel AI Pass w ramach singapurskiego programu SkillsFuture — MiniMax H3, MiniMax Agent i MiniMax Audio wchodzą do oferty skierowanej do uprawnionych uczestników ponad 200 kursów AI wspieranych przez SWDA; nie podano kwoty ani harmonogramu. 🔗 źródło
- VC-Attention przyspiesza mechanizm attention w MiniMax-H3 bez ponownego trenowania — MiniMax informuje o pracach Nunchux AI nad mechanizmem attention o niskiej precyzji, który można zastosować do istniejącego modelu; Nunchux AI deklaruje przyspieszenie 1,6x na B200 i 1,5x na B300 względem FlashAttention-4. 🔗 źródło
- Wan3.0 zajmuje drugie miejsce w kategorii wideo w OpenArt Arena — Alibaba podkreśla 30-sekundowe ujęcia, natywny dźwięk i obsługę dowolnych materiałów referencyjnych; jest to pozycja w zewnętrznym rankingu, bez nowości produktowych. 🔗 źródło
- Synthesia otwiera swoją amerykańską siedzibę w Nowym Jorku — wiadomość korporacyjna bez informacji o produkcie, zatrudnieniu ani harmonogramie inwestycji, dwa dni po ogólnym udostępnieniu Interactive Avatar API. 🔗 źródło
- Grok Imagine przedstawia koszt pilota wyprodukowanego w całości przy użyciu AI — studio PJaccetturo informuje o dziewięciu dniach pracy, 3627 wygenerowanych obrazach i 3043 wygenerowanych filmach oraz koszcie generowania wynoszącym 2677 dolarów w przypadku odcinka pilotażowego konkursu Odyseja. 🔗 źródło
- BananaMind 2 Pro zbliża się do SmolLM2, wykorzystując dwadzieścia razy mniej tokenów — model ze 139 milionami parametrów, wytrenowany na 100 miliardach tokenów i karcie RTX 5070 Ti, osiąga 42,78% w HellaSwag wobec 43,22 dla SmolLM2-135M, wytrenowanego na 2 bilionach tokenów. 🔗 źródło
- Optimum-Intel v2.2.0 i OpenVINO GenAI 2026.4.0 rozszerzają eksport na sprzęt Intel — Hugging Face i Intel publikują wspólne wydania obejmujące procesory, karty graficzne i NPU Intel, a Mistral 3 można teraz eksportować. 🔗 źródło
- AmberTrace Labs mierzy wierność rozumowania Olmo 3 podczas RL z weryfikowalną nagrodą — w testach diagnostycznych wyłączonych z treningu wierność rośnie z 0,238 do 0,262: jest to pozytywna zmiana, a nie pogorszenie; opublikowano również checkpointy. 🔗 źródło
- Together AI deklaruje najkrótszy czas do pierwszego tokena w DeepSeek V4.1 Flash — firma powtarza pomiar strony trzeciej dotyczący rozgrzanych żądań, nie publikując ani metody, ani wartości: jest to deklaracja, a nie weryfikowalny wynik. 🔗 źródło
- Google Flow wspiera dwoje twórców podczas Nowojorskiego Tygodnia Mody — niestandardowe narzędzia zaprojektowane z Jane Wade i Sergio Hudsonem; prezentacja zastosowania, bez nowego modelu ani wdrożonej funkcji. 🔗 źródło
- Google AI Educator Series umożliwia uzyskanie punktów akademickich — kursy szkoleniowe pozwalają teraz uzyskać punkty akademickie lub punkty w ramach kształcenia ustawicznego. 🔗 źródło
Co to oznacza
Ten dzień pokazuje przede wszystkim jedno: agenci do kodowania przestają być zamkniętymi produktami i zaczynają współdzielić formaty. Claude Code odczytuje AGENTS.md, gdy projekt nie ma CLAUDE.md — oznacza to, że Anthropic akceptuje plik instrukcji zdefiniowany gdzie indziej, aby to samo repozytorium mogło obsługiwać wiele narzędzi. Tego samego dnia Antigravity umieszcza w systemowym prompcie swoich agentów Markdown katalog dostępnych podagentów, Vibe CLI wreszcie uruchamia hooki wewnątrz podagentów, Codex rozbija rachunek według podagentów, a Qwen Code umieszcza swoich w kontenerach. Delegowanie zadań między agentami było obietnicą konfiguracyjną; staje się mechanizmem, który trzeba dokumentować, izolować i rozliczać. Claude Code doprowadza zresztą logikę nieufności do końca, oznaczając wyniki podagentów specjalnym nagłówkiem, aby przekazany wyżej tekst nie mógł podszyć się pod instrukcję.
Rynek agentów terminalowych szybko staje się czymś powszednim. MiniMax publikuje własnego na licencji MIT, z TUI, trybem bez interfejsu, ACP i swobodnym wyborem modelu; Mistral usuwa etykietę „eksperymentalny” ze swojego Unified Harness i opisuje --legacy-harness jako wyjście awaryjne; Kimi Code wydaje poprawkę wydajności 32 godziny po swojej wersji głównej. Gdy czterech dostawców oferuje ten sam produkt z takimi samymi punktami wejścia, zróżnicowanie przenosi się gdzie indziej: zależy od licencji, stabilności harnessu i modelu uprawnień — i właśnie tych obszarów dotyczą dzisiejsze zmiany zarówno w Mistral, jak i Anthropic.
W przypadku modeli obserwujemy przejście od opisowego do agentowego wykorzystania audio i wideo. Qwen3.8-Omni-Flash nie próbuje już opisywać filmu, lecz znaleźć w nim odpowiedź: wychodząc od pytania, zyskuje 4,4 punktu w OmniVideoBench, zużywając jednocześnie o 45,7% mniej tokenów — wydajność i oszczędność zmierzają w tym samym kierunku, co zdarza się rzadko. Z kolei Grok Voice Transcribe 2.0 nie stawia na demonstrację laboratoryjną, ale na rzeczywisty ruch: współczynnik błędów dla krótkich zdań spada z 20,6% do 6,8%, a cena pozostaje bez zmian. Oba ogłoszenia prowadzą do tego samego wniosku: wartość nie wynika już z obsługiwanej modalności, lecz z tego, co model postanawia przetworzyć.
Pozostaje pytanie, co laboratoria zgadzają się poddać weryfikacji. Anthropic płaci Accenture za umieszczenie ewaluatorów wewnątrz własnej firmy i zapewnienie im dostępu pracowniczego — a w tym samym ogłoszeniu przyznaje, że nie istnieje żadna norma określająca, do czego taki ewaluator powinien mieć dostęp, jak publikować jego ustalenia ani kto powinien go finansować. Jest to w równym stopniu przyznanie się do problemu, co środek zaradczy. Najmocniejsze dowody tego dnia to natomiast te, które strona trzecia może odtworzyć: wyniki Exeter i Stowers Institute dotyczące AlphaGenome Atlas, opublikowany jako open source kod optymalizacji biomolekularnej oraz checkpointy AmberTrace Labs. Odwrotne przypadki są równie widoczne: Replit podaje współczynnik 30 bez punktu odniesienia, Together AI powtarza ranking bez metodologii, a Mistral zaprzecza zarzutowi, którego nikt nie mógł przeczytać. W tym krajobrazie AIPerf pojawia się w idealnym momencie — jako narzędzie pomiarowe, które zaczyna od przyznania, że problemem często jest sam mierzący.
Źródła
- Claude Code, informacje o wersji 2.1.277
- CHANGELOG Claude Code
- Qwen, wpis o Qwen3.8-Omni-Flash
- Alibaba Qwen na X, ogłoszenie modelu
- Codex CLI, informacje o wersji 0.155.0
- OpenAI Developers na X, szczegółowe zestawienie zużycia w Codex
- SpaceXAI, Grok Voice Transcribe 2.0
- Anthropic, zintegrowana ewaluacja z Accenture
- Changelog Antigravity
- GitHub, cotygodniowe podsumowanie Copilot z 14 września
- GitHub, wycofanie sześciu modeli Copilot
- GitHub, agentowe personalizacje CLI w API metryk
- MiniMax na X, udostępnienie kodu MiniMax Code CLI
- Vibe CLI, informacje o wersji 2.25.5
- OpenAI Developers na X, pluginy obsługujące wiele kont
- Max Stoiber na X, pierwotna wiadomość o wielu kontach
- Genspark na X, cotygodniowe saldo Plus i Pro
- Google DeepMind na X, wyniki partnerów AlphaGenome Atlas
- Google Research, edukacyjne materiały interaktywne tworzone przez interfejs generatywny
- Anthropic Research, Claude i modelowanie biomolekularne
- Meta AI na X, Muse dla Mac
- Sakana AI, Frontier Intelligence Group
- Runway, ujednolicone ceny
- Pika na X, premiera Product Ad
- NVIDIA, pomiar inferencji na dużą skalę za pomocą AIPerf
- Mistral AI na X, dementi z 18 września