ai-powered-markdown-translatorArtykuł przetłumaczony z fr na pl za pomocą gpt-5.6-sol.
Czterdzieści dziewięć ogłoszeń w dniu 2 września — trzeci najwyższy wynik od początku tego monitoringu. Tego samego dnia ukazały się trzy czołowe modele — Gemini 3.8 Flash od Google, Muse Spark 1.3 od Meta Superintelligence Labs oraz Qwen3.8-Max-0902 od Alibaba — i żaden z nich nie eksponował wyścigu o surowe wyniki.
Przez to wydanie przewijają się cztery nurty. Po pierwsze cena, która stała się głównym argumentem we wszystkich trzech premierach. Następnie lokalna inferencja: generowanie wideo trafia na komputer stacjonarny, a tego samego wieczoru zostaje otwarty kod silnika inferencji dla Apple Silicon. Dalej zarządzanie modelami w przedsiębiorstwach, gdzie GitHub narzuca retencję danych dla jednego modelu, a dla wszystkich pozostałych pozostawia wybór ustawienia domyślnego. I wreszcie cyberbezpieczeństwo, z wyspecjalizowanym modelem dostępnym wyłącznie dla wybranych obrońców oraz sojuszem dołączającym do Linux Foundation.
Gemini 3.8 Flash i 3.8 Flash Cyber — model, który pracuje intensywniej w tej samej cenie
2 września — Google zaprezentował dwa modele sygnowane przez Tulsee Doshi (Senior Director, Product Management) oraz Ralucę Adę Popę (Gemini Security Lead, Google DeepMind): Gemini 3.8 Flash i Gemini 3.8 Flash Cyber. To trzecia premiera Flash w ciągu sześciu tygodni, a 3.7 Flash istniał zaledwie od trzech tygodni.
Oba warianty mają tę samą bazową inteligencję, a Google wprost przypisuje część postępów w programowaniu i rozumowaniu intensywnemu treningowi w dziedzinie cyberbezpieczeństwa: prace nad modelem obronnym podniosły poziom modelu ogólnego przeznaczenia. Cena premierowa pozostaje bez zmian względem 3.7 Flash.
| Cecha Gemini 3.8 Flash | Zmierzona wartość |
|---|---|
| Cena danych wejściowych | 0,75 dolara za milion tokenów |
| Cena danych wyjściowych | 3,75 dolara za milion tokenów |
| HLE-Verified | 54,9% |
Jeden aspekt zasługuje na uwagę deweloperów, ponieważ Google ujmuje go bez ogródek: model zużywa więcej zasobów. Wzrost niezawodności wynika z decyzji projektowej — przy złożonych zadaniach 3.8 Flash wykonuje dodatkowe kroki rozumowania i iteracyjnie wywołuje narzędzia. Przy wysokich poziomach wysiłku rośnie więc rachunek za tokeny, a Google zaleca obniżenie poziomu wysiłku lub pozostanie przy 3.7 Flash w przypadku obciążeń, dla których priorytetem jest efektywność obliczeniowa. Poprzednia wersja pozostaje w pełni wspierana.
Wariant Cyber jest bardziej nietypowy. Dostępny wyłącznie dla zaufanych obrońców za pośrednictwem uruchomionego tego samego dnia programu Fairwind, ma służyć do autonomicznego wykrywania luk, a przede wszystkim do ich automatycznego usuwania.
| Test cyberbezpieczeństwa | Gemini 3.8 Flash Cyber | Punkty odniesienia |
|---|---|---|
| CyberGym Pass@1 (wykrywanie luk C/C++) | 86,2% | GPT-5.5-Cyber 85,6% · Mythos 5 83,8% · GPT-5.6 Sol 83,6% · 3.5 Flash Cyber 77,5% |
| Wewnętrzny benchmark dla 20 języków | ponad 70% | Zakres szerszy niż samo C/C++ |
| CWE-Bench pass@1 (naprawa, Collinear) | 47,2% | Czołowy model graniczny osiąga 47,8%, ale przy znacznie wyższym koszcie |
Dane z wewnętrznych wdrożeń potwierdzają pozycjonowanie oparte na relacji kosztu do wydajności, a nie na bezwzględnej dominacji: zespół Chrome Security uzyskuje 2,6 raza więcej prawidłowych poprawek niż przy użyciu najlepszych, znacznie większych modeli komercyjnych; Wiz odnotowuje recall wyższy o 7,5–9,7% w swoim benchmarku testów penetracyjnych przy koszcie od 2,3 do 5,2 raza niższym; a zespół Cloud Vulnerability Research zidentyfikował krytyczną, fundamentalną lukę w niecałe dwie godziny, podczas gdy takie badania zwykle wymagają miesięcy. Model ogólnego przeznaczenia jest już wdrożony w Antigravity, Gemini API za pośrednictwem Google AI Studio i Android Studio, generatorze interfejsów Stitch oraz Gemini Enterprise, a także udostępniony subskrybentom Google AI Pro i Ultra w aplikacji Gemini, AI Mode wyszukiwarki Google i Google Sheets.
🔗 Ogłoszenie Gemini 3.8 Flash i 3.8 Flash Cyber
Wynik CursorBench dokumentujący premierę
Cursor dodał Gemini 3.8 Flash do swojego selektora modeli kilka godzin po prezentacji, a jego własny benchmark dostarcza najlepszej dostępnej miary możliwości modelu w warunkach agentowych. Dziennik CursorBench, opatrzony datą tego samego dnia, informuje, że 3.8 Flash awansował do rangi wersji Gemini „Latest”, a 3.7 Flash przeszedł na pozycję drugorzędną.
| Model i poziom wysiłku | Wynik CursorBench 3.2 | Średni koszt zadania | Kroki na zadanie |
|---|---|---|---|
| Fable 5.1 Max | 73,4% | 9,64 dolara | 70 |
| Grok 4.6 Extra High | 70,8% | 2,81 dolara | 46 |
| Fable 5.1 High | 69,4% | 4,80 dolara | 44 |
| Opus 5 Extra High | 69,3% | 7,35 dolara | 72 |
| Gemini 3.8 Flash High | 69,2% | 2,38 dolara | 161 |
| Gemini 3.8 Flash Medium | 67,0% | 1,93 dolara | 136 |
| Gemini 3.7 Flash High | 61,6% | 1,20 dolara | 99 |
Wnioski są jasne: z wynikiem 69,2% Gemini 3.8 Flash High dorównuje Fable 5.1 High za mniej więcej połowę ceny oraz Opus 5 Extra High za jedną trzecią ceny. Różnica względem poprzedniej generacji wynosi 7,6 punktu. Kolumna z liczbą kroków przypomina jednak o ukrytym koszcie decyzji projektowej Google: 161 kroków na zadanie w porównaniu z 44 w przypadku Fable 5.1 High. Sam Cursor zamieszcza na dole strony dwa zastrzeżenia — wyniki wykazują zmienność, a podany koszt został odtworzony na podstawie publicznych stawek za milion tokenów, a nie zmierzony na podstawie rachunku.
🔗 Gemini 3.8 Flash w Cursor · 🔗 Wyniki CursorBench
Muse Spark 1.3 — model agentowy Meta Superintelligence Labs
2 września — Meta Superintelligence Labs opublikowało Muse Spark 1.3, następcę Muse Spark 1.2, wdrożonego tego samego dnia w Muse Code oraz Meta Model API dostępnym pod adresem dev.meta.ai. To druga premiera laboratorium w ciągu dwóch dni, po Muse Voice Transcribe.
Deklarowanym celem nie jest wyścig o wyniki, lecz rzeczywista użyteczność. Model zaprojektowano z myślą o długoterminowej pracy i obsłudze wielu strumieni w jednym wątku: wobec otwartego celu wykorzystuje narzędzia, aby samodzielnie zbudować własny kontekst na podstawie nieuporządkowanych i sprzecznych źródeł, uzupełnia braki w swoim planie i śledzi zdobytą wiedzę. Najbardziej nietypowy element dotyczy współpracy: Muse Spark 1.3 wytrenowano tak, by zadawał pytania doprecyzowujące, gdy polecenie jest niejednoznaczne, prosił użytkownika o pomoc, gdy utknie, oraz zabiegał o potwierdzenie przed wykonaniem działania niosącego konsekwencje. Porównania przeprowadzone przez inżynierów Meta wskazują, że model wykonuje około 20% mniej wywołań narzędzi i zużywa 25% mniej tokenów niż wersja 1.2 — różnicę tę widać bezpośrednio na rachunku.
| Oceniana kategoria | Benchmark | Muse Spark 1.3 | Muse Spark 1.2 | GPT-5.6 Sol | Opus 5 |
|---|---|---|---|---|---|
| Agent | GDPVal-AA v2 (praca intelektualna) | 1754 | 1615 | 1710 | 1824 |
| Agent | OSWorld 2.0 (agentowe korzystanie z komputera) | 66,9 | 47,6 | 62,7 | 68,3 |
| Agent | DeepSearchQA (agentowa nawigacja) | 89,4 | 85,9 | 93,0 | 90,4 |
| Agent | AutomationBench (kompletny przepływ biznesowy) | 49,4 | 38,2 | 46,7 | 50,3 |
| Długi kontekst | MRCR 512K-1M | 98,1 | 55,5 | 73,8 | – |
| Programowanie | DeepSWE v1.1 (długie programowanie agentowe) | 75,4 | 55,0 | 73,0 | 74,0 |
| Programowanie | SWEAtlas CodeBase QnA | 59,4 | 46,2 | 53,5 | 52,7 |
Ta tabela wymaga uważnej lektury. Muse Spark 1.3 zdecydowanie dominuje w długim kontekście i programowaniu, ale Opus 5 wyprzedza go we wszystkich czterech uwzględnionych tutaj testach agentowych. Co ważniejsze, porównania nie przeprowadzono na równych warunkach, co wynika z metodologii opublikowanej przez Meta: Muse Spark 1.3 i 1.2 oceniono na poziomie wysiłku xhigh, podczas gdy Claude Opus 5 oraz GPT-5.6 Sol — w trybie max. Jedynym wyjątkiem jest DeepSWE v1.1, gdzie Muse Spark 1.3 zmierzono w trybie max — właśnie tym, który nie jest jeszcze dostępny; Meta informuje, że pojawi się po zakończeniu dodatkowych testów bezpieczeństwa.
Jeden akapit planu rozwoju przykuwa uwagę z perspektywy otwartego ekosystemu.
Stay tuned for more updates soon, including bigger models, Muse Spark open weights, and more.
🇵🇱 Wkrótce przekażemy więcej wiadomości, w tym o większych modelach, otwartych wagach Muse Spark i nie tylko. — @AIatMeta na X
Po roku, w którym Meta wyraźnie ograniczyła publikowanie modeli z otwartymi wagami, ta deklaracja jest godna uwagi — nie wiadomo jednak jeszcze, której wersji będzie dotyczyć, ponieważ nie podano ani daty, ani zakresu.
🔗 Przedstawiamy Muse Spark 1.3
Qwen3.8-Max-0902 zajmuje pierwsze miejsce w Code Arena WebDev
2 września — Qwen opublikował aktualizację swojego flagowego modelu: Qwen3.8-Max-0902, datowany snapshot odpowiadający również aliasowi qwen3.8-max-2026-09-02. Model zachowuje parametry strukturalne sierpniowej wersji — 2,4 biliona parametrów i okno kontekstowe liczące milion tokenów — lecz przeszedł dodatkowy etap post-treningu ukierunkowany na „Coding & Cowork”.
| Cecha modelu | Opublikowana wartość |
|---|---|
| Parametry | 2,4 T |
| Okno kontekstowe | 1 M tokenów |
| Maksymalne dane wejściowe | 991 K tokenów (983 K w trybie thinking) |
| Maksymalne dane wyjściowe | 131 K tokenów |
| Budżet rozumowania | 262 K tokenów |
| Cena wejścia i wyjścia | 2 dolary i 6 dolarów za milion tokenów |
| Odczyt jawnego cache | 0,17 dolara za milion tokenów |
| Odczyt niejawnego cache | 0,25 dolara za milion tokenów |
| Utworzenie jawnego cache | 2,50 dolara za milion tokenów |
| Limity przepustowości | 1 M tokenów na minutę, 15 K żądań na minutę |
Model przyjmuje na wejściu obrazy, tekst i wideo oraz udostępnia pięć zintegrowanych narzędzi przez Responses API: interpreter kodu, wyszukiwanie obrazu na podstawie obrazu, wyszukiwanie obrazu na podstawie tekstu, ekstraktor treści internetowych i wyszukiwarkę internetową. Od tego samego dnia jest dostępny przez API w QwenCloud.
Tego samego dnia Arena.ai opublikowała wyniki Code Arena WebDev. Qwen3.8-Max-0902 od razu zajmuje pierwsze miejsce w klasyfikacji generalnej z 1691 punktami — o 22 punkty więcej niż poprzednia wersja, 3 punkty przed Claude Opus 5 z ustawieniem Max i 17 punktów przed Kimi K3 z ustawieniem Max. Przy mieszanej cenie wynoszącej 5 dolarów za milion tokenów model zajmuje najwyżej ocenianą pozycję na granicy Pareto Arena, czyli oferuje najlepszą relację wyniku do kosztu w całym rankingu.
Szczegółowe wyniki według kategorii dają bardziej zniuansowany obraz: pierwsze miejsce w Data & Analytics oraz Consumer Product, drugie w Brand & Marketing, Gaming i Simulations, a trzecie w Content Creation Tools oraz Reference-Based Design. Mocną stroną modelu są więc bardziej aplikacje wykorzystujące dane i produkty konsumenckie niż zadania o dominującym charakterze kreatywnym. Arena zapowiada publikację wyników Agent Arena.
Inferencja opuszcza chmurę: wideo na biurku, lokalny silnik na otwartej licencji
To główny nurt dzisiejszych wydarzeń, którego nie da się zamknąć w żadnym pojedynczym ogłoszeniu. Dwie duże publikacje i cztery mniej wyraźne sygnały zmierzają w tym samym kierunku: lokalnego uruchamiania tego, co jeszcze wczoraj wymagało GPU w centrum danych.
2 września — Zespół FastVideo z Hao AI Lab (UCSD) opublikował lokalny port FastH3, swojej wydestylowanej wersji otwartego modelu wideo MiniMax H3. Wspólne generowanie obrazu i dźwięku wymagało dotąd GPU z centrum danych; model działa teraz na NVIDIA DGX Spark, dwóch urządzeniach DGX Spark połączonych łączem QSFP albo komputerze Mac z Apple Silicon, wyposażonym w co najmniej 36 GB pamięci zunifikowanej.
Głównym ograniczeniem nie jest moc obliczeniowa, lecz pamięć. DGX Spark ma 128 GB zunifikowanej pamięci LPDDR5X o przepustowości około 270 GB/s, czyli mniej więcej jednej dziesiątej przepustowości pamięci HBM z centrum danych, z czego 121 GB jest faktycznie dostępnych dla zadania. Pipeline działa więc etapami: koduje prompt, zwalnia enkoder tekstu, ładuje transformer, przeprowadza odszumianie, zwalnia go, a następnie ładuje VAE. Na oddzielnym GPU skopiowanie wag do pamięci hosta zwalnia pamięć urządzenia; na Spark kopia trafia z powrotem do tej samej puli. Zespół usunął ten krok na rzecz bezpośredniego ładowania DiT na GPU — czas ładowania transformera spadł z 445 s do 39 s, a uruchomienie 768×1344 dla 124 klatek z 772 s do 336 s.
| Maszyna testowa | Pierwsze generowanie | Kolejne generowanie |
|---|---|---|
| Apple M4 Max | 504 s | 465 s |
| DGX Spark | 264 s | 243 s |
| 4x GB200 | 10,2 s | 5,1 s |
W porównaniu z publiczną konfiguracją vLLM-Omni dla DGX Spark, która potrzebuje 1 881 s dla rozdzielczości 1024×576, pięciu sekund wideo i 50 kroków, czterokrokowy FastH3 schodzi do 268 s, czyli jest około 7x szybszy; przewaga rośnie do 8,4x przy 832×480 i spada do 7,9x przy 1344×768. Na M4 Max kodowanie promptu bez cache skraca się z około 80 s do około 17 s, a dekoder TAEH3 zmniejsza czas dekodowania ze 102 s do 1 s, obniżając szczytowe zużycie pamięci z 11,0 do 3,6 GiB. Wagi MLX opublikowano w formatach INT8, INT6 i INT4 na Hugging Face wraz z FastVideo Cookbook, który ukazał się po raz pierwszy. Następny zapowiedziany cel: rodzina RTX, w tym 5090 i 4090.
Tego samego wieczoru Perplexity udostępniło kod Lily, lokalnego silnika inferencyjnego obsługującego część obliczeń hybrydowych wykonywaną na urządzeniu na komputerach Mac. Silnik przedstawiono dzień wcześniej we wpisie badawczym; nowością jest publikacja kodu na licencji Apache-2.0 w repozytorium perplexityai/pplx-garden, gdzie dołącza on do fabric-lib i pplx-unigram.
Kod potwierdza podejście oparte na skrajnej specjalizacji. Lily nie jest silnikiem ogólnego przeznaczenia: ładuje tylko jeden checkpoint, Qwen3.6-35B-A3B skwantyzowany do 4 bitów metodą affine w formacie MLX, z rozmiarem grupy 64, weryfikowany podczas ładowania. Jawnie odrzucane są gęste checkpointy Qwen, mniejsze warianty, BF16, GGUF, AWQ, GPTQ, int8 i fp8. Silnik napisano w Rust, z kernelami Metal kompilowanymi ze źródeł podczas uruchamiania; w ścieżce wykonania nie korzysta ani z PyTorch, ani z MLX i wymaga GPU Apple rodziny 10 lub nowszej — M5 albo późniejszego — oraz co najmniej macOS 26. Powierzchnia API jest równie ograniczona: tylko trzy trasy, zawsze zachłanne dekodowanie, a parametry próbkowania, streaming, narzędzia i treści multimodalne są odrzucane, a nie ignorowane. Właśnie ta wąska specjalizacja jest interesująca: Perplexity nie dostarcza konkurenta dla MLX-LM, lecz dowód, że silnik skrojony pod konkretną platformę i model przewyższa framework ogólnego przeznaczenia.
Cztery inne dzisiejsze publikacje zmierzają w tym samym kierunku i zostały omówione w skrócie: TranslatePsy-Nano, modele tłumaczeniowe o rozmiarach od 17 do 42 MB, obsługujące siedemnaście języków; prace i64 Systems nad ekspertami modelu MoE przechowywanymi na NVMe bez zmiany choćby jednego bajtu danych wyjściowych; wpis Cohere opowiadający się za właściwym doborem rozmiaru małych modeli w przedsiębiorstwach; oraz transmisja na żywo NVIDIA poświęcona DGX Spark i lokalnemu uruchamianiu Portable Computer firmy Perplexity. Żadna z tych publikacji osobno nie ma wielkiej wagi, ale wszystkie przenoszą obliczenia z centrum danych na urządzenie.
🔗 FastH3 lokalnie · 🔗 Udostępnienie kodu Lily · 🔗 Repozytorium pplx-garden
Anthropic udostępnia kod Claude Commerce Agents
2 września — Anthropic opublikował jako open source Claude Commerce Agents, referencyjne repozytorium na licencji Apache 2.0 do tworzenia agentów handlowych. Ogłoszenie celowo pojawia się przed sezonem świątecznym, kiedy zespoły e-commerce planują swoje wdrożenia.
Blueprint zawiera dwóch kompletnych agentów. Agent zakupowy działa w aplikacji przedsiębiorstwa: przeszukuje katalog, dobiera zestaw artykułów na podstawie prośby sformułowanej w języku naturalnym, zapamiętuje preferencje klienta, wyświetla produkty, porównania i koszyk w rozmowie, a następnie przekazuje proces do checkoutu — i odpowiada na pytania działu obsługi klienta w tym samym wątku. Agent sprzedawcy jest przeznaczony dla zespołów prowadzących sklep: analizuje sprzedaż, ostrzega o produkcie, którego zabraknie przed promocją, rekomenduje ceny na podstawie historii i redaguje kampanie.
| Element repozytorium | Dostarczona zawartość |
|---|---|
| Dostępni agenci | Agent zakupowy (klient) i agent sprzedawcy (back-office) |
| Uruchamialne branże | Handel detaliczny, podróże, telekomunikacja, sprzedaż biletów |
| Środowiska uruchomieniowe | Messages API, Claude Agent SDK, Claude Managed Agents (beta) |
| Platformy wdrożeniowe | Claude API, Amazon Bedrock, Microsoft Foundry, Google Cloud Vertex AI |
| Plugin Claude Code | commerce-builder@claude-commerce-agents |
| Wymagania techniczne | Python 3.11 lub nowszy, Node 22 |
| Zaobserwowane już wyniki | U detalistów korzystających z agentów zakupowych opartych na Claude: koszyki nawet o 35% większe, kupujący o 60% bardziej skłonni do finalizacji |
Rozdzielenie tego, o czym decyduje model, od tego, co jest faktycznie wykonywane, ma charakter strukturalny, a nie deklaratywny. Po stronie konsumenta interfejs backendu wywoływany przez agenta po prostu nie zawiera żadnej metody płatności. Po stronie sprzedawcy każde narzędzie zapisujące tworzy oczekującą zmianę wraz z identyfikatorem wygenerowanym po stronie serwera, a funkcja apply_change kończy się powodzeniem wyłącznie dla identyfikatorów zatwierdzonych za pośrednictwem rzeczywistego interfejsu weryfikacji przez człowieka. Anthropic zaznacza, że jest to nieutrzymywana implementacja referencyjna, która nie przyjmuje wkładu od społeczności: punkt wyjścia do utworzenia forka, a nie zależność do śledzenia. Wszystkie przedsiębiorstwa w demonstracjach są fikcyjne, a system nie składa żadnych zamówień ani nie obciąża kart.
🔗 Ogłoszenie Claude Commerce Agents · 🔗 Repozytorium commerce-agents
Warstwa techniczna: cache, opóźnienia i zabezpieczenia w kodzie
Opublikowany tego samego dnia i podpisany przez Alego Shazala oraz Matthew Koena przewodnik inżynieryjny towarzyszący blueprintowi podsumowuje rok pracy z detalistami, platformami handlowymi i firmami z branży turystycznej. Pierwsza rada idzie pod prąd: w przypadku agenta, który musi obsługiwać wiele kategorii, nie należy tworzyć osobnego podagenta dla każdej domeny. Rozmowa handlowa jest pojedynczą, silnie powiązaną sesją, a jej podział pogarsza jakość — możliwości zapewniają skills, a nie mnożenie agentów.
| Omawiany temat | Wartość podana przez Anthropic |
|---|---|
| Wygenerowana odpowiedź handlowa | Od 500 do 700 tokenów wyjściowych |
| Odczyt tokenów z cache | Jedna dziesiąta kosztu nowych tokenów |
| Zapis do cache | Narzut około 1,25x, zwracający się od drugiego użycia |
| Docelowy współczynnik trafień cache | Od 90 do 99% |
| Szybkość odczytów z cache | Od 1,5 do 2x szybciej przy około 100 000 tokenów |
| Korzyść z pamięci | O 13% wyższe odtwarzanie faktów w wewnętrznym zestawie ewaluacyjnym |
| Liczba przypadków ewaluacyjnych na przepływ | Od 50 do 100 na początek |
Jeśli chodzi o wybór modelu, zalecenie brzmi: zacząć od Opus dla agentów sprzedawcy, gdzie dominuje analiza, i od Sonnet dla agentów konsumenckich, gdzie większe znaczenie ma opóźnienie — następnie przeprowadzić cały zestaw ewaluacyjny dla każdego modelu i każdego poziomu wysiłku, mierząc koszt wykonanego zadania, a nie pojedynczego wywołania modelu. Sekcja dotycząca bezpieczeństwa nie pozostawia żadnych wątpliwości.
The prompt is where safe behavior starts, but in commerce it can’t be where safety is enforced. The failures are financial and often irreversible, and a prompt rule is one injection or one bad sample away from being skipped.
🇵🇱 Prompt jest miejscem, w którym zaczyna się bezpieczne zachowanie, ale w handlu nie może być miejscem, w którym bezpieczeństwo jest egzekwowane. Skutki awarii są finansowe i często nieodwracalne, a regułę w prompcie można obejść pojedynczym atakiem prompt injection lub jednym nieprawidłowym wynikiem próbkowania. — Anthropic, Przewodnik po anatomii skutecznych agentów handlowych
Cztery reguły są zatem egzekwowane w kodzie i definiowane tylko raz, aby mogły być współdzielone przez trzy środowiska uruchomieniowe: model przygotowuje, ale człowiek lub polityka wykonuje; operacje zapisu i renderowania akceptują wyłącznie identyfikatory wydane przez serwer; transakcje z limitami muszą być odporne na powtarzane żądania; treści pochodzące od podmiotów trzecich są oczyszczane.
Sterowanie komputerem działa w tle w Claude Code i Claude Cowork
2 września — Sterowanie komputerem (computer use) przez Claude nie zajmuje już całego ekranu. Dotąd uruchomienie takiego zadania oznaczało oddanie maszyny: pozostałe okna były ukrywane na czas pracy Claude w zatwierdzonej aplikacji. Teraz zarówno w Claude Cowork, jak i na karcie Code aplikacji desktopowej zadanie jest kontynuowane w tle, podczas gdy użytkownik może zajmować się czymś innym.
Zmiana jest dostępna w wersji beta, wyłącznie w planach Pro i Max oraz tylko na macOS — choć sam computer use nadal jest dostępny jako research preview na macOS i Windows. Osoby, które już korzystały z tej funkcji, nie muszą niczego włączać; pozostali znajdą ją w Settings > General, przy czym macOS wymaga również systemowych uprawnień Dostępność i Nagrywanie ekranu.
Zasady bezpieczeństwa pozostają bez zmian. W przeciwieństwie do narzędzia Bash, które działa w sandboxie, computer use wykonuje operacje na rzeczywistym pulpicie. Poziomy dostępu nadal są ustalone według kategorii aplikacji i nie można ich zmieniać: tylko podgląd w przypadku przeglądarek i platform tradingowych, tylko kliknięcia w przypadku terminali i IDE — co skłania Claude do korzystania z dedykowanego narzędzia zamiast sterowania ekranem — oraz pełna kontrola w pozostałych przypadkach. Zgoda obowiązuje przez bieżącą sesję albo przez trzydzieści minut w sesji uruchomionej z Dispatch.
🔗 Ogłoszenie sterowania komputerem w tle
Cursor uruchamia swoich agentów cloud na maszynach zarządzanych przez klienta
2 września — Cursor opublikował wpis produktowy autorstwa Jacka Pertschuka, który umożliwia uruchamianie agentów cloud na infrastrukturze należącej do klienta. Dotychczas agent cloud Cursor działał na dedykowanej maszynie wirtualnej w chmurze wydawcy. Dzięki Self-Hosted Machines wykonywanie narzędzi przenosi się na maszyny znajdujące się w sieci przedsiębiorstwa, podczas gdy pętla agenta, inferencja i planowanie pozostają po stronie Cursor.
Uzasadniająca tę decyzję liczba pojawia się od razu: agenci cloud tworzą obecnie ponad 60% pull requestów, które Cursor scala wewnętrznie. Gdy rosnąca część pracy przechodzi przez tych agentów, maszyna, na której działają, przestaje być szczegółem. Wydawca wskazuje trzy sytuacje, które skłaniają zespół do korzystania z własnych maszyn: uruchamianie narzędzi w bezpośrednim sąsiedztwie systemu zarządzania kodem źródłowym i usług wewnętrznych, dostęp do specjalnego sprzętu, takiego jak GPU lub komputery Mac do tworzenia aplikacji na iOS, albo użycie systemu operacyjnego, który trudno umieścić w obrazie agenta cloud.
| Aspekt rozwiązania | Szczegóły techniczne |
|---|---|
| Polecenie rejestracji | agent worker start, długotrwałe wychodzące połączenie HTTPS |
| Kierunek połączenia | Cursor nigdy nie inicjuje połączenia przychodzącego do sieci klienta |
| Dostępne konfiguracje | My Machines (pojedyncza stacja lub VM) i Pools (współdzielona kolejka zespołu) |
| Wznowienie po bezczynności | Hibernacja za pomocą snapshotu, przywracanie z tym samym identyfikatorem workera |
| Dostawcy sandboxów | AWS Lambda, Cloudflare, Coder, Daytona, E2B, Modal, Namespace, Vercel |
| Sterowanie komputerem | Linux jest teraz obsługiwany, obok komputerów Mac, przez Chrome lub Chromium |
Pule skalują się za pomocą kontrolera, który monitoruje kolejkę żądań i uruchamia maszyny przy użyciu skryptu dostarczonego przez zespół; jeśli żaden worker nie jest wolny, żądanie czeka. Dla wariantu pośredniego między resetowaniem maszyny a pozostawieniem jej uruchomionej — kosztownych rozwiązań w obu przypadkach — Cursor wprowadza hibernację: nieaktywna maszyna jest zapisywana jako snapshot i wyłączana, a jeśli ponowne uruchomienie nastąpi w oknie ponownego połączenia, snapshot zostaje przywrócony. Ponieważ pula nie jest powiązana z repozytorium, jedna kolejka może obsługiwać wiele repozytoriów.
Pozostaje jedno zastrzeżenie, które sam wpis wyraźnie wskazuje: przenosi się wyłącznie środowisko wykonawcze. Wyniki działania narzędzi wracają do Cursor na potrzeby inferencji i mogą zawierać kod, a transkrypcje agentów mogą być tam przetwarzane i przechowywane. Nie jest to więc pełna izolacja, lecz zmiana miejsca wykonywania operacji.
Claude Fable 5.1 staje się ogólnie dostępny u integratorów
1 i 2 września — W dniu premiery Claude Fable 5.1 stał się ogólnie dostępny w GitHub Copilot; następnego dnia Genspark zintegrował go ze swoim Code Agentem i Claw. Dwóch integratorów w dwa dni, dla tego samego modelu: to fala adopcji, a nie dwie odrębne wiadomości.
W przypadku GitHub zakres jest szeroki — Visual Studio Code, Visual Studio, Copilot CLI, coding agent, aplikacja GitHub Copilot, github.com, GitHub Mobile na iOS i Androidzie, IDE JetBrains, Xcode oraz Eclipse — dla planów Pro+, Max, Business i Enterprise, ze stopniowym wdrażaniem i rozliczaniem według publicznej stawki dostawcy. Najbardziej godny uwagi aspekt tego udostępnienia nie ma jednak charakteru technicznego, lecz umowny.
| Warunek dostępu | Zasady mające zastosowanie do Fable 5.1 |
|---|---|
| Polityka administratora | Domyślnie wyłączona, wymaga jawnego włączenia |
| Przechowywanie danych | Domyślnie obowiązkowe na potrzeby klasyfikatorów bezpieczeństwa Anthropic |
| Wykorzystanie zachowanych danych | Bez trenowania modeli Anthropic |
| Inne modele Claude | Zachowane zerowe przechowywanie, z wyjątkiem Fable 5 i Fable 5.1 |
| Zwolnienie z zerowego przechowywania | Kwalifikujące się przedsiębiorstwa, do końca roku kalendarzowego |
| Po zakończeniu zwolnienia | Wymagane Enterprise Frontier Safeguards |
W przeciwieństwie do pozostałych modeli Claude w Copilot, Fable 5.1 domyślnie wymaga przechowywania danych: Anthropic zachowuje prompty i dane wyjściowe, aby obsługiwać swoje klasyfikatory bezpieczeństwa. Włączenie polityki oznacza zatem wyraźną akceptację tego ograniczenia, a pozostawienie jej wyłączonej po prostu uniemożliwia korzystanie z modelu. Wyjście awaryjne jest tymczasowe i selektywne: kwalifikujące się przedsiębiorstwa mogą zachować zerowe przechowywanie do końca roku kalendarzowego, podczas gdy Anthropic wdraża Enterprise Frontier Safeguards, które mają zapewnić zautomatyzowany nadzór nad bezpieczeństwem oraz kontrolowane przez klienta klucze przechowywania i szyfrowania. Kwalifikacji nie można uzyskać samodzielnie: wymaga ona kontaktu z zespołem sprzedaży GitHub, którego pomoc techniczna nie może ominąć, a nawet po zatwierdzeniu nic nie zostaje włączone automatycznie.
Genspark ze swojej strony deklaruje integrację już pierwszego dnia z Genspark Code Agent i Claw, bez benchmarków ani szczegółów dotyczących cen. Firma dołącza do listy platform agentowych, które przeszły na nowy model w ciągu kilku godzin od jego premiery, obok Cursor, Devin, Warp, v0, Amp i Perplexity Computer.
🔗 Fable 5.1 w GitHub Copilot · 🔗 Ogłoszenie Genspark
GitHub wyjaśnia, jak obniżył koszt Copilot bez pogorszenia jakości
2 września — GitHub opublikował artykuł techniczny autorstwa Erika Kristensena, przygotowany z udziałem Napalysa Kliciusa, poświęcony obniżaniu kosztu Copilot. Tekst jest nietypowy dla tego rodzaju publikacji: podaje liczby, opisuje nieudane eksperymenty i wyjaśnia, dlaczego pozornie oczywista optymalizacja może przynieść odwrotny skutek.
Teza otwierająca jest sprzeczna z intuicją. Liczenie tokenów w pojedynczej interakcji nie mierzy wydajności: zwięzła odpowiedź narzędzia, która pomija informację potrzebną agentowi, zmusza go do ponownego uruchomienia polecenia, przez co całe zadanie staje się wolniejsze i droższe. GitHub ilustruje tę pułapkę za pomocą RTK (Rust Token Killer), narzędzia skracającego dane wyjściowe powłoki przed ich odczytaniem. Faktycznie skracało ono niektóre odpowiedzi, lecz następujące później działania służące odzyskaniu informacji dodawały kolejne tury: tokeny zaoszczędzone lokalnie były wydawane globalnie. Narzędzia nie wdrożono.
| Oceniana zmiana | Zmierzona korzyść |
|---|---|
| Usunięcie numerów wierszy w testach offline | Około 5% niższy koszt wnioskowania |
| Usunięcie numerów wierszy w produkcyjnej wersji CLI | Około 3% niższy średni dzienny koszt na użytkownika |
Kompresja promptu narzędzia task | Usunięcie 1 300 tokenów na turę, 2,9% niższy znormalizowany koszt na aktywną godzinę |
| Bezpośrednie dostarczanie ukończonej pracy w tle | Około 2,3% niższe zużycie związane z tokenami, mierzone w AI Credits |
| Numery wierszy i kompresja w Copilot code review | Około 5% tokenów promptu na przegląd dla każdej z obu zmian |
| Wcześniejsza migracja do współdzielonych narzędzi plikowych | Około 20% niższy koszt przeglądu |
| RTK (Rust Token Killer) | Odrzucono, całkowity koszt wzrósł w testowanej konfiguracji |
Przyjęta polityka kompresji jest celowo zachowawcza i składa się z trzech części: zachowania bez zmian danych wyjściowych przypominających kod źródłowy, reorganizowania wyników wyszukiwania bez usuwania czegokolwiek oraz kompresowania wyłącznie powtarzalnego szumu związanego z instalacją, buildem i testami. Kompresja git diff była częścią pierwszych wersji; usunięto ją, gdy zadania benchmarkowe wykazały, że agenci ponownie otwierali oryginalne dane wyjściowe.
Najbardziej pouczający epizod dotyczy kompresji promptu. Pętla meta-promptingu, w której Copilot iteracyjnie przepisywał własną instrukcję, zmniejszyła o połowę prompt narzędzia task — jednak pierwszy eksperyment online ujawnił regresję pominiętą w ocenach offline: pętla przekształciła ostrożną instrukcję dotyczącą równoległości w ścisłą regułę kolejności wykonywania, serializując niezależnych agentów. Poprawka zastąpiła białe i czarne listy jednym zdaniem pozostawiającym decyzję modelowi. Ostatni i najbardziej użyteczny wniosek: korzyści nie przenoszą się z jednego produktu na drugi. Bardziej zwarty zestaw instrukcji, zainspirowany dobrymi wynikami uzyskanymi w Copilot code review, spowodował wzrost kosztu w Copilot CLI.
None of these changes made the model smarter. They removed work the model never needed to do.
🇵🇱 Żadna z tych zmian nie uczyniła modelu inteligentniejszym. Usunęły one pracę, której model nigdy nie musiał wykonywać. — GitHub Blog, Jak zwiększamy efektywność kosztową programowania z AI
Katalog modeli Copilot zmienia swój skład
1 i 2 września — Dwa changelogi opublikowane w tym samym czasie opisują dwie strony tej samej reorganizacji: co znika z katalogu Copilot i kto odtąd decyduje o modelu domyślnym.
Od 1 września sześć modeli jest wycofywanych w większości funkcji Copilot — Copilot Chat, edycjach online, trybach ask i agent oraz uzupełnianiu kodu.
| Wycofywany model | Alternatywa sugerowana przez GitHub |
|---|---|
| Gemini 3.1 Pro | Gemini 3.7 Flash |
| Claude Opus 4.5 | Claude Opus 4.7, Claude Opus 4.8 lub Claude Opus 5 |
| Claude Opus 4.6 | Claude Opus 4.7, Claude Opus 4.8 lub Claude Opus 5 |
| Claude Sonnet 4.5 | Claude Sonnet 5 |
| Claude Sonnet 4.6 | Claude Sonnet 5 |
| Raptor Mini | MAI-Code-1.1-Flash |
Pozostaje jeden wyjątek: Claude Sonnet 4.6 nadal jest dostępny dla indywidualnych subskrybentów korzystających z planu rocznego. Użytkownik nie musi podejmować żadnych działań, ale administratorzy Copilot Enterprise mogą być zmuszeni do jawnego włączenia modeli zastępczych w swoich politykach, w przeciwnym razie nie pojawią się one ani w VS Code, ani na github.com.
Jednocześnie ustawienia zarządzane w przedsiębiorstwach pozwalają teraz wybrać dowolny model jako domyślny dla nowych rozmów. Szczegółowość ustawień wykracza poza poziom przedsiębiorstwa: deklarując klucz model jako overridable i edytując pliki konfiguracyjne zespołu w team-mappings.json, administrator może pozwolić każdemu zespołowi wybrać własny model domyślny, podczas gdy użytkownicy nieobjęci takim ustawieniem dziedziczą ustawienie globalne. Funkcja jest ogólnie dostępna w Copilot Business i Copilot Enterprise, w aplikacji GitHub Copilot, Copilot CLI oraz Visual Studio Code.
🔗 Wycofywane modele · 🔗 Domyślny model w przedsiębiorstwie
Sierpniowy Ship Log: Copilot w Slack i Teams oraz multimedia w CLI
1 i 2 września — Comiesięczne podsumowanie opublikowane przez GitHub w formie artykułu na X ma charakter promocyjny, ale ujawnia sierpniową nowość, o której wcześniej nie informowano: GitHub Copilot jest teraz dostępny w Slack i Microsoft Teams. Integracja przenosi możliwości agentowe Copilot CLI i aplikacji GitHub Copilot do rozmów zespołowych — wzmianka o GitHub pozwala planować zmiany, badać problem lub przekazywać zadanie programistyczne bez opuszczania wątku.
| Element sierpniowego Ship Log | Co udostępniono |
|---|---|
| Copilot w Slack i Microsoft Teams | Możliwości agentowe Copilot CLI i aplikacji Copilot |
| Copilot code review, poziom Balanced | Ogólna dostępność obok Lite, domyślne ustawienie konfigurowalne dla organizacji lub repozytorium |
| Przypomnienie o nowych modelach | Gemini 3.7 Flash, MAI-Code-1.1-Flash, Kimi K3 hostowany przez Fireworks AI |
| Promocja na GPT-5.6 Sol | Połowa ceny do 3 września |
| Promocja na wybór automatyczny | 30% zniżki dla użytkowników Copilot Max |
| GitHub Copilot Day | 10 września 2026 |
Podsumowanie dokumentuje również poziom Balanced w Copilot code review, który stał się ogólnie dostępny obok Lite: Balanced zapewnia bardziej dogłębną analizę pull requestów, Lite służy do bezpośrednich zmian, a domyślny poziom można ustawić na poziomie organizacji lub repozytorium.
Kolejna nowość z tego miesiąca uzupełnia obraz po stronie wiersza poleceń: powtarzalna flaga --attach w GitHub CLI, dostępna od wersji gh v2.99.0, przesyła lokalny obraz lub film i umieszcza odwołanie do niego online w issue, pull requeście albo komentarzu. Działa z sześcioma poleceniami zapisującymi Markdown, a szczegółem decydującym o jej użyteczności jest obsługa istniejącego Markdownu: lokalna ścieżka już wskazana w treści zostaje przepisana w miejscu, dzięki czemu  zachowuje tekst alternatywny i wskazuje na przesłany zasób. Tekst alternatywny podaje się po # w ścieżce. Obsługiwane formaty: PNG, JPEG, GIF, WebP, SVG, MP4, MOV i WebM, z limitem 10 MB dla obrazów oraz 100 MB dla filmów w płatnych planach. GitHub Enterprise Server nie jest obsługiwany w tej wersji. GitHub wyraźnie podkreśla, że agenci programistyczni dziedziczą tę możliwość i mogą teraz pokazać wynik zamiast go opisywać.
🔗 Ship Log z sierpnia 2026 · 🔗 Multimedia w GitHub CLI
Fairwind Program, cyberobrona Google zarezerwowana dla zaufanych obrońców
2 września — Tego samego dnia co Gemini 3.8 Flash Cyber Google uruchomił Fairwind Program, kanał dystrybucji tego modelu. Uzasadnienie przedstawione przez Foura Flynna, wiceprezesa ds. bezpieczeństwa i prywatności, wychodzi od konkretnego dylematu zespołów obronnych: wdrażać ogromne modele graniczne, kosztowne i trudne do opanowania w korporacyjnych bazach kodu, czy wybrać mniejsze modele z otwartymi wagami, które słabo radzą sobie z naprawianiem złożonych luk w zabezpieczeniach.
Odpowiedź łączy Gemini 3.8 Flash Cyber z CodeMender, systemem automatycznego naprawiania Google. Głównym argumentem nie jest wykrywanie, lecz usuwanie zagrożeń: identyfikowanie słabości buduje świadomość i lęk, natomiast ich automatyczne znajdowanie i naprawianie zapewnia bezpieczeństwo. Obietnica polega na generowaniu zweryfikowanych, gotowych do wdrożenia poprawek w ciągu kilku minut zamiast tygodni, wewnątrz bezpiecznego środowiska chmurowego organizacji klienta.
Dostęp jest celowo przyznawany etapami, z trzema priorytetowymi kręgami: rządami i krajowymi organami ds. cyberbezpieczeństwa, operatorami infrastruktury krytycznej w ochronie zdrowia, telekomunikacji, energetyce i sieciach finansowych oraz kluczowymi platformami technologicznymi. Uczestniczące organizacje akceptują ścisłe ograniczenia — zawężenie dostępu do wewnętrznych zespołów ds. cyberbezpieczeństwa, reagowania na incydenty lub testów penetracyjnych oraz wdrożenie zabezpieczeń takich jak uwierzytelnianie wieloskładnikowe. Google informuje o ponad 650 uczestniczących partnerach na całym świecie. Poza programem każdy klient Google Cloud może korzystać z CodeMender z publicznie dostępnymi modelami na Gemini Enterprise Agent Platform, jako uzupełnienie AI Threat Defense. Firma informuje ponadto, że łączna wartość finansowania cyberbezpieczeństwa za pośrednictwem Google.org przekroczyła 100 milionów dolarów, w tym 36 milionów przeznaczonych na 35 klinik cyberbezpieczeństwa, które wsparły ponad 1 250 amerykańskich szpitali, okręgów szkolnych i służb miejskich.
Narzędzia Google w wierszu poleceń: trzy wersje w dwa dni
1 i 2 września — Google wydało w ciągu dwóch dni trzy wersje dotyczące tego samego obszaru, a razem wskazują one wyraźny priorytet: mniej funkcji, więcej izolacji i stabilności.
| Wydana wersja | Data | Dominująca zawartość |
|---|---|---|
| Gemini CLI v0.58.0 | 1 września | Siedem zmian głównie związanych z bezpieczeństwem, awans do kanału stabilnego |
| Antigravity CLI 1.1.23 | 1 września | Dwa ulepszenia, jedenaście poprawek |
| Antigravity 2.12.0 | 2 września | Siedem ulepszeń, dziewięć poprawek |
Stabilny kanał Gemini CLI przeszedł na wersję v0.58.0 — awans ten pozostał niezauważony, ponieważ nastąpił trzydzieści dwie minuty po opublikowaniu wersji preview v0.59.0. Zawartość ma niemal wyłącznie charakter defensywny. Najbardziej znacząca poprawka dotyczy piaskownicy macOS: profil Seatbelt izoluje teraz sockety i pliki binarne Docker oraz środowisk uruchomieniowych kontenerów, zamykając klasyczną drogę ucieczki — ograniczony proces, który uzyska dostęp do socketu Docker hosta, może w praktyce wydostać się z izolacji. Dwie kolejne zmiany wzmacniają rdzeń: rozwiązywanie dowiązań symbolicznych działa teraz spójnie podczas obsługi ignorowanych ścieżek, a moduły sprawdzające bezpieczeństwo najwyższego poziomu są jawnie deklarowane w konfiguracji polityki zapisu.
Antigravity 2.12.0 wprowadza dwie nowe funkcje. Cytowanie odpowiedzi pozwala zaznaczyć fragment odpowiedzi i ponownie wprowadzić go jako kontekst w następnym prompcie — to bezpośrednia odpowiedź na codzienny problem długich sesji agentowych. Natomiast polecenie /boost, dostępne wyłącznie dla płatnych użytkowników, zwiększa wysiłek rozumowania za pomocą wieloagentowego pipeline’u rozumowania. Pojawia się tego samego dnia co Gemini 3.8 Flash, o którym Google otwarcie mówi, że pracuje intensywniej kosztem większej liczby tokenów: oba posunięcia zmierzają w tym samym kierunku — ku jawnej kontroli poziomu wysiłku przez użytkownika. Pozostałe zmiany rozwiązują rzeczywiste niedogodności: ustawienia ogólne wskazują, które projekty nadpisują daną konfigurację, układy terminala z podzielonym ekranem przetrwają przeładowanie okna, a wiadomość można wysłać podczas trwającego dyktowania.
Wreszcie Antigravity CLI 1.1.23 odciąża streaming subagentów, wysyłając metadane trajektorii raz na podtrajektorię zamiast na każdym etapie, oraz pozwala za pomocą Tab zaakceptować nazwę modelu sugerowaną jako tekst zastępczy w /model. Jedenaście poprawek ujawnia uciążliwe codzienne problemy: awarie wywoływane przez hooki promptów, pomijanie identyfikatorów wywołań narzędzi podczas rekonstrukcji historii dla modeli Gemini, prośby o uprawnienia wyświetlające ogólne tytuły zamiast czytelnych opisów działań — to prawdziwy problem, ponieważ użytkownik jest proszony o autoryzację działania, którego mu nie opisano — oraz subagenci zadeklarowani za pomocą enable_mcp_tools=true, którzy nie działali z powodu braku dispatchera MCP.
🔗 Informacje o wersji Gemini CLI v0.58.0 · 🔗 Dziennik zmian Antigravity
Short Video Overviews w Gemini Notebook trafiają do ponad 70 języków
1 września — Gemini Notebook rozszerzył obsługę Short Video Overviews na ponad 70 języków, dodając przy tym trzy nowe warianty języka angielskiego. Funkcja przekształca źródła notebooka w pionowe filmy trwające około 60 sekund, które można teraz generować w języku użytkownika.
Wdrożenie obejmuje wersję webową i mobilną, ale pozostaje ograniczone do subskrybentów Ultra i Pro — zespół zaznaczył w tym samym wątku, że udostępnianie funkcji użytkownikom Pro nie zostało jeszcze zakończone. Ogłoszenie uzupełniają dwa szczegóły: liczba źródeł znajdujących się w notebooku nie jest uwzględniana przy obliczaniu zużycia tokenów, a użytkownicy Pro nadal mogą generować Cinematic Video Overviews w języku angielskim. Przejście z języka angielskiego do 70 języków zmienia tę funkcję z demonstracji w narzędzie, którego rzeczywiście można używać poza światem anglojęzycznym.
Edytory stają się multiplekserami modeli
1 i 2 września — Dwa pozornie niepowiązane ogłoszenia opisują ten sam trend: środowisko programistyczne staje się punktem dostępu do modeli innych firm, a wyróżnikiem przestaje być jakość modelu i stają się nim warunki, w których model działa.
Zed opublikował stabilną wersję 1.18.0, której najważniejsza zawartość znajduje się w sekcji poświęconej AI w informacjach o wydaniu. Edytor za jednym razem nadrabia kilka niedawnych premier: okno kontekstowe GPT-5.6 liczące 1 milion tokenów jest obsługiwane w Amazon Bedrock, Gemini 3.5 Flash-Lite dołącza do modeli Google AI, Grok 4.5 i Grok 4.6 dołączają do modeli xAI, a obsługa wydanego dzień wcześniej Claude Fable 5.1 została ulepszona. Dwie z tych czterech pozycji to wkład zewnętrznych autorów wymienionych w informacjach o wydaniu. Dochodzą do tego usprawnienia ergonomii pracy z agentami — ponowne wczytywanie zerwanego połączenia z agentem zewnętrznym bez restartu, mniejsze zużycie pamięci podczas długich sesji, błędy połączenia wskazujące nieosiągalny host — oraz poprawka istotna dla osób podłączających serwery MCP: uwierzytelnianie OAuth nie działało z serwerami wymagającymi niestandardowych zakresów.
Z kolei Mistral udostępnił GLM 5.2 w swoim agencie programistycznym Vibe Code dla planów Pro i Team. Najważniejszy nie jest sam model, lecz sposób jego udostępniania: Mistral hostuje go w Europie we własnej infrastrukturze. Europejski programista korzystający z GLM 5.2 za pośrednictwem Vibe Code wysyła więc żądania do inferencji obsługiwanej przez Mistral, bez przekazywania ich przez serwery Z.ai. To praktyczna realizacja strategii regionalnej inferencji, której firma broni od sierpnia — a sytuacja jest podwójnie znamienna, ponieważ Mistral ma własną rodzinę Devstral, a mimo to decyduje się oferować w swoim narzędziu model z otwartymi wagami opracowany przez konkurencyjne laboratorium.
🔗 Informacje o wersji Zed 1.18.0 · 🔗 GLM 5.2 w Vibe Code
NVIDIA: dwa artykuły techniczne i sojusz przechodzący pod nowy nadzór
2 września — Tego samego dnia NVIDIA opublikowała trzy materiały: dwa techniczne i jeden dotyczący zarządzania.
Pierwszy artykuł, będący trzecią częścią serii o współprojektowaniu modeli, przedstawia pięć zasad dostrajania speculative decoding. Technika jest znana: mały model draft proponuje kilka tokenów, które model docelowy weryfikuje w jednym równoległym przebiegu. Praktyczne pytanie pozostaje otwarte — ile tokenów przewidywać i za pomocą jakiego mechanizmu. Podczas weryfikacji ilość obliczeń rośnie wraz z (1 + D), ale liczba dostępów do pamięci pozostaje bez zmian: należy więc zwiększać długość draft D do momentu, gdy weryfikacja przejdzie z ograniczenia przepustowością pamięci do ograniczenia mocą obliczeniową. W reprezentatywnym GEMM eksperta wartość D = 7 pozwala osiągnąć ten stan przy jednej ósmej rozmiaru batcha wymaganego dla D = 0. Gdy czas dekodowania jest zdominowany przez mechanizm attention, optymalna długość wynosi D = 128/G − 1, gdzie G jest liczbą głów zapytania współdzielących jedną głowę KV; powyżej tej wartości lepiej wybierać takie wartości, dla których G × (1 + D) jest wielokrotnością 128, czyli rozmiaru kafelka kernela attention. Pomiary opierają się na SPEED-Bench, benchmarku speculative decoding firmy NVIDIA: przy Qwen 3.5 122B A10B jako modelu docelowym zewnętrzny draft 35B A3B osiąga długość akceptacji 6 dla D = 9. Artykuł podkreśla często pomijany fakt — wyższy poziom akceptacji nie oznacza większego przyspieszenia — i kończy się ostrzeżeniem: fine-tuning modelu docelowego zmienia jego rozkład wyjściowy, przez co drafter wytrenowany dla określonego checkpointu może osiągać niższy poziom akceptacji nawet wtedy, gdy model docelowy zostanie ulepszony.
Drugi artykuł to sześcioetapowa ścieżka optymalizacji CUDA, zbudowana wokół jednego przykładu: konwersji trzech obrazów RGB do skali szarości, a następnie obliczenia mediany dla każdego kafelka o wymiarach 32 × 32 piksele. Punktem wyjścia jest celowo błędny kod, który Compute Sanitizer natychmiast diagnozuje — zapis poza zakresem w pamięci współdzielonej, spowodowany użyciem indeksu globalnego tam, gdzie oczekiwano indeksu bloku.
| Etap optymalizacji | Łączny czas | Przyspieszenie na etapie |
|---|---|---|
| Kod początkowy | 6,8 s | — |
| CUB (DeviceTransform i BlockRadixSort) | 635 ms | około 10x |
| Kontenery z pulą pamięci | około 244 ms | około 2,6x |
| Pamięć przypięta | 25 ms | około 10x |
| Jeden strumień CUDA na obraz | 23 ms | około 300x łącznie |
Samo zastąpienie własnego sortowania bąbelkowego przez cub::BlockRadixSort skraca obliczanie median z 2,142 s do 773 µs, czyli 2717 razy. Żaden z tych etapów nie jest optymalizacją niskopoziomową: są to zamiany API.
Wreszcie Open Secure AI Alliance, którego współzałożycielem była NVIDIA, dołącza do Linux Foundation. Teza promowana przez sojusz przesuwa punkt ciężkości typowej debaty: agent nie jest tylko modelem językowym, lecz systemem oprogramowania złożonym z modeli, warstw zapewniających im kontekst oraz zabezpieczeń ograniczających zakres ich działania. Tymczasem dyskusja o bezpieczeństwie koncentrowała się głównie na samym modelu, choć bezpieczeństwo zależy od całego systemu — warstw wykonawczych, mechanizmów dostrajania, środowisk uruchomieniowych, tożsamości, polityk, obserwowalności i odzyskiwania. Otwarto konsultacje dotyczące SAFE (Shared AI Findings Exchange), mechanizmu poufnego gromadzenia informacji o incydentach i zdarzeniach potencjalnie wypadkowych związanych z AI, opracowywanego we współpracy z OpenSSF.
🔗 Speculative decoding · 🔗 Optymalizacja CUDA krok po kroku · 🔗 Open Secure AI Alliance
Equinix Inference Exchange — otwarte modele w 280 centrach danych
2 września — Equinix ogłosił Equinix Inference Exchange, program rozproszonej inferencji AI, który rozszerza współpracę firmy z NVIDIA i włącza do niej Together AI. Konstrukcja opiera się na trzech warstwach: Equinix zapewnia fizyczną bazę połączoną z chmurami za pośrednictwem Equinix Fabric, NVIDIA dostarcza zatwierdzone referencyjne architektury klasy enterprise, a Together AI uruchamia na tej podstawie platformę obsługującą ponad 200 modeli open source, zarówno we współdzielonym wdrożeniu, jak i w dedykowanym środowisku przeznaczonym dla jednego klienta.
Głównym argumentem jest lokalizacja inferencji, a nie wybór modelu, przy czym wskazano trzy zastosowania: inferencję na brzegu sieci w obszarach metropolitalnych w celu zmniejszenia opóźnień, migrację obciążeń z zamkniętych modeli własnościowych do otwartych alternatyw oraz suwerenną AI dla przedsiębiorstw podlegających regulacjom. Dane dotyczące zasięgu pokazują skalę wykorzystywanej sieci: ponad 280 centrów danych w 77 obszarach metropolitalnych, 230 punktów dostępu do chmury i ponad 10 500 połączonych przedsiębiorstw.
Należy jednak zwrócić uwagę na harmonogram: komunikat Equinix wyraźnie wskazuje, że rozwiązanie będzie dostępne od pierwszego kwartału 2027 roku, podczas gdy wiadomość Together AI opisuje platformę jako już działającą w centrach danych Equinix na całym świecie. Jest to ogłoszenie partnerstwa i planu rozwoju, a nie uruchomienie usługi.
BenchMIRT — metoda Ai2 do audytowania tego, co naprawdę mierzą benchmarki
1 września — Ai2 opublikowało BenchMIRT, metodę stawiającą pytanie, które rzadko podejmuje się bezpośrednio: czy benchmark rzeczywiście mierzy zdolność, którą deklaruje? Zamiast analizować końcowy wynik, metoda schodzi do poziomu poszczególnych pytań i szacuje, jakie zdolności faktycznie decydują o sukcesie, wykorzystując pochodzącą z psychometrii teorię odpowiedzi na pozycje testowe (Item Response Theory) w jej wariancie wielowymiarowym. Trening przeprowadzono na wynikach 100 modeli z otwartymi wagami, 16 benchmarkach i ponad 34 000 pytań.
Najbardziej przekonujący rezultat ma charakter metodologiczny: bez informacji o tym, co poszczególne benchmarki miały mierzyć, BenchMIRT samodzielnie wyodrębnił dwa dominujące wymiary — bezpieczeństwo i ogólne rozumowanie — które pojawiły się w identycznej postaci po ponownym przeprowadzeniu analizy od zera.
| Audytowany benchmark | Korelacja z rozumowaniem | Korelacja z bezpieczeństwem | Werdykt audytu |
|---|---|---|---|
| MMLU-Pro | 0,97 | -0,21 | Zgodny z deklarowanym celem |
| BBQ | 0,85 | -0,06 | Odzwierciedla rozumowanie mimo statusu testu bezpieczeństwa |
| WMDP | -0,89 | 0,21 | Mierzy brak niebezpiecznej wiedzy |
| ToxiGen | 0,40 | -0,32 | Słaby w obu wymiarach, benchmark nasycony na poziomie 92% |
BBQ, zaprojektowany do sprawdzania, czy model opiera się na stereotypach społecznych, koreluje zatem na poziomie 0,85 z ogólnym rozumowaniem i wcale nie koreluje z bezpieczeństwem: słaby wynik może mówić więcej o zdolności rozumowania modelu niż o jego zachowaniu. Drugi wkład ma charakter praktyczny: klasyfikując pytania według ich mocy dyskryminacyjnej, Ai2 pokazuje, że zachowanie zaledwie 10% z nich pozwala uzyskać mniej więcej ten sam ranking modeli, a metoda prawidłowo przewiduje odpowiedź na nieobserwowane pytanie w 79% przypadków, wobec 70% dla podejścia naiwnego. Autorzy wskazują dwa ograniczenia: wszystkie modele treningowe pochodzą sprzed marca 2025 roku, a odkryte wymiary zależą od dostarczonego zbioru benchmarków.
Runway Dev MCP — agent programistyczny przejmuje kontrolę nad integracją multimediów
2 września — Runway uruchomił Runway Dev MCP, hostowany serwer MCP, który podłącza platformę deweloperską firmy bezpośrednio do narzędzia programistycznego używanego na co dzień — Claude, ChatGPT, Codex lub Cursor. Argument można streścić w jednym zdaniu: agent, który napisał integrację, może teraz wybrać dla niej odpowiedni model, skonfigurować narzędzia, na których się opiera, oraz ją debugować.
Usługa obejmuje trzy etapy integracji. Przed pierwszym wywołaniem API agent sprawdza katalog, aby ustalić, z jakich modeli może korzystać projekt, jaka jest ich cena i jakie dane wejściowe przyjmują, a następnie pobiera dokładny schemat żądania wybranego modelu — celem jest prawidłowe wykonanie wywołania już przy pierwszej próbie, zamiast zgadywania. W środowisku produkcyjnym tworzy i konfiguruje Model Router, który dokonuje wyboru między kilkoma modelami w zależności od kosztu, opóźnienia lub jakości, z limitem kosztu na generowanie, oraz może ustalić, który model router wybrał dla danego wywołania. Ta sama logika ma zastosowanie do Characters. Trzecim etapem jest debugowanie: gdy generowanie kończy się niepowodzeniem, agent sprawdza zadanie za pomocą zdefiniowanego narzędzia i odczytuje dokładną przyczynę odrzucenia — odrzucenie przez moderację, przekroczenie limitu rozmiaru zasobu, nieprawidłowo sformułowane body żądania — po czym wprowadza poprawkę i ponawia próbę. Menu Quickstart tworzy klucz API, a następnie otwiera Claude Code, Codex lub Cursor z gotową wiadomością.
DreamX-Creator 1.0, natywne generowanie audio-wideo w 2K z jednego obrazu
2 września — Zespół AMAP firmy Alibaba zaprezentował DreamX-Creator 1.0, model o 7 miliardach parametrów na licencji Apache 2.0, który na podstawie jednego obrazu i promptu tekstowego tworzy natywnie zsynchronizowane strumienie wideo i audio w 2K, bez kaskadowego łączenia modelu wideo z modelem audio.
System opiera się na trzech elementach: bramkowanej uwadze krzyżowej między modalnościami (Gated Cross-Modal Attention) połączonej ze stopniowym wspólnym treningiem, co umożliwia dwukierunkową interakcję między oboma strumieniami; uczeniu ze wzmocnieniem audio-wideo zasilanym multimodalną informacją zwrotną uwzględniającą modalność; oraz jednoetapowym udoskonalaniu autoregresywnym, które podnosi rozdzielczość wideo do 2K, zachowując ruch i synchronizację czasową dźwięku.
Publikacja pozostaje na tym etapie częściowa. Repozytorium GitHub, utworzone dzień wcześniej, zawiera prezentację projektu i jego plan rozwoju, a raport techniczny ukazał się w serwisie arXiv. Zweryfikowane wagi, kod inferencji, konfiguracje i narzędzia ewaluacyjne nadal figurują jako niezrealizowane kamienie milowe. Praca bazuje na Wan2.2 oraz MOVA od OpenMOSS, którym autorzy wyraźnie składają podziękowania.
🔗 Ogłoszenie DreamX-Creator 1.0
API OpenAI rozróżnia zbyt szybkie zwiększanie obciążenia od przeciążenia modelu
2 września — OpenAI zmieniło sposób, w jaki jego API sygnalizuje dwie sytuacje, których aplikacje klienckie nie mogły dotąd rozróżnić.
| Status HTTP | Kod błędu | Znaczenie | Zalecane działanie |
|---|---|---|---|
| 429 | slow_down | Tempo żądań wzrosło zbyt szybko | Przestrzegać Retry-After, zmniejszyć tempo, a następnie stopniowo je zwiększać |
| 503 | server_is_overloaded | Żądany model jest tymczasowo przeciążony | Przestrzegać Retry-After, a następnie ponowić próbę; wydłużyć opóźnienie, jeśli błąd się utrzymuje |
To rozróżnienie ma bezpośrednie praktyczne konsekwencje dla każdego kodu obsługującego ponawianie prób. Dokumentacja precyzuje, że błąd slow_down może wystąpić nawet wtedy, gdy ruch mieści się w obowiązujących organizację limitach liczby żądań i tokenów na minutę: nie oznacza wyczerpania limitu, lecz przyspieszenie uznane za zbyt gwałtowne — innymi słowy, aplikacja może zostać spowolniona, mimo że nie przekroczyła żadnego wyświetlanego limitu. Przewodnik dotyczący limitów przepustowości podaje praktyczną regułę: gdy ruch osiągnie milion tokenów wejściowych na minutę, nie należy zwiększać go o więcej niż 50% co piętnaście minut. Gdy nagłówek Retry-After jest nieobecny, OpenAI zaleca wykładniczy backoff z niewielkim losowym opóźnieniem, aby wszystkie instancje tej samej usługi nie ponawiały prób jednocześnie. Organizacje, których ruch rozliczany według użycia regularnie napotyka te ograniczenia, są kierowane do Scale Tier, a w przypadku GPT-5.6 i kolejnych modeli — do Reserved Tier.
W skrócie
- Claude Code 2.1.258 — wydanie zawierające wyłącznie poprawki: przywrócono uruchamianie na macOS 12 Monterey, które nie działało od wersji 2.1.255, a sesje zdalne i zaplanowane nie kończą się już niepowodzeniem po ponownym zatwierdzeniu uprawnienia. 🔗 CHANGELOG
- Claude Campus Ambassadors — otwarto zgłoszenia do trzech odrębnych ścieżek w tym roku: studia licencjackie, studia magisterskie, doktorat i staż podoktorski. 🔗 Ogłoszenie
- Nokia analizuje 50 milionów linii kodu za pomocą Cursor — dwóch inżynierów z działu Core Networks zrobiło to w dwa tygodnie, podczas gdy zespół szacował, że trzeba będzie zaangażować około tuzina ekspertów na kilka miesięcy. Studium przypadku przygotowane przez dostawcę, bez niezależnego protokołu pomiarowego. 🔗 Studium przypadku
- TranslatePsy-Nano — Tether AI Research publikuje dwie rodziny kompaktowych modeli tłumaczeniowych: EuroNano dla dziewięciu języków europejskich i AfriNano dla ośmiu języków afrykańskich, w wariantach o rozmiarze 42, 31 i 17 MB, z jednym punktem kontrolnym na grupę językową. 🔗 Ogłoszenie
- Puffin-World — ujednolicony model multimodalny, który reprezentuje świat za pomocą trzech natywnych stanów: fizyki, geometrii i wyglądu, opublikowany wraz ze zbiorem danych Puffin-16M. 🔗 Prezentacja
- Eksperci MoE przechowywani na NVMe — i64 Systems przechowuje wagi ekspertów na NVMe z weryfikacją za pomocą manifestu SHA-256 i odnotowuje identyczne co do bajtu wyniki dla ścieżki wynajmowanej i rezydentnej. 🔗 Wpis techniczny
- Sakana AI na CiNet International Conference — dyrektor techniczny Llion Jones i badacz Kai Arulkumaran wygłoszą prelekcję o powiązaniach między neuronauką a uczeniem maszynowym podczas konferencji odbywającej się od 5 do 7 października 2026 roku w Osace. 🔗 Ogłoszenie
- Gemini CLI, wydanie nightly z 2 września — tylko jedna zmiana: ulepszona walidacja miejsca docelowego i trasowanie połączeń w narzędziach do pobierania treści z sieci, będące kontynuacją wzmacniania zabezpieczeń sieciowych rozpoczętego pod koniec sierpnia. 🔗 Informacje o wydaniu
- MrBeast zawiera wieloletnie partnerstwo z Google — umowa rozszerza relację z Beast Industries poza YouTube na Gemini i Google Health, a pierwsze wideo ukaże się 5 września i pokaże wykorzystanie Gemini do przetrwania w dżungli, na pustyni i w Arktyce. 🔗 Ogłoszenie
- Podsumowanie sierpniowych ogłoszeń Google dotyczących AI — comiesięczny wpis zbierający informacje omówione już w ciągu miesiąca, bez żadnych własnych nowości. 🔗 Podsumowanie
- Enterprise Live Migrations w ogólnej dostępności — migracja repozytoriów z GitHub Enterprise Server do chmury z rezydencją danych i niemal zerową przerwą w działaniu, zarządzana przez rozszerzenie
gh elm. Bez związku z AI, odnotowane dla kompletności. 🔗 Dziennik zmian - ElevenLabs mianuje Ashley Kramer dyrektorką ds. przychodów — jedyna publikacja firmy w tym okresie; dziennik zmian produktu nie był aktualizowany od 24 sierpnia. 🔗 Ogłoszenie
- NVIDIA transmituje na żywo prezentację DGX Spark dotyczącą Portable Computer od Perplexity — dwadzieścia sześć minut poświęconych jego lokalnemu uruchomieniu, bez opisu tekstowego ani transkrypcji. To druga tego dnia demonstracja przedstawiająca DGX Spark jako platformę docelową do lokalnego portowania. 🔗 Transmisja
- Kling AI dokumentuje Elements swojego serwera MCP — samouczek dotyczący zachowania tożsamości postaci między ujęciami; materiał edukacyjny o produkcie, a nie premiera. 🔗 Samouczek
- Codex CLI 0.152.1 — wydanie naprawcze opublikowane około dwudziestu godzin po wersji 0.152.0: przegląd zatwierdzeń Guardian respektuje teraz zasady REPL Node przekazywane przez metadane modelu. 🔗 Informacje o wydaniu
- Cohere broni wyboru małych modeli dla przedsiębiorstw — dostawca zestawia Command R7B, Tiny Aya z 3,35 miliarda parametrów oraz North Mini Code, który uzyskał wynik 33,4 w Coding Index firmy Artificial Analysis, aby uzasadnić właściwe dobieranie rozmiaru modeli. Bez premiery. 🔗 Wpis
- Perplexity publikuje dwa poradniki edukacyjne — o osobistych asystentach i wykrywaniu halucynacji. Drugi opisuje dwuetapowy post-trening: pierwszy etap rozwija zachowania produktu, a drugi opiera się na trudniejszych zadaniach badawczych. 🔗 Poradnik
Co to oznacza
Cena stała się głównym argumentem, także wśród modeli granicznych. Trzy premiery jednego dnia i żadna nie eksponuje rekordowego wyniku. Google utrzymuje cenę poprzedniej generacji dla Gemini 3.8 Flash i przyznaje, że jego model zużywa więcej tokenów — to rzadkie wyznanie, które przenosi uwagę z podawanej ceny na rzeczywisty koszt zadania. Qwen wyraźnie deklaruje osiągnięcie szczytu granicy Pareto w Arena, zamiast bezwzględnego pierwszego miejsca. Meta mierzy swoje korzyści nie w punktach benchmarkowych, lecz w 20% mniejszej liczbie wywołań narzędzi i 25% mniejszej liczbie tokenów. A tabela CursorBench dostarcza najbardziej wymownego pomiaru dnia: przy wyniku 69,2% Gemini 3.8 Flash kosztuje 2,38 dolara za zadanie, podczas gdy porównywalny wynik kosztował 4,80 dolara w przypadku Fable 5.1 i 7,35 dolara w przypadku Opus 5. Kolumna liczby kroków przypomina jednak, że za tę cenę płaci się gdzie indziej — 161 kroków zamiast 44.
Inżynieria środowiska wykonawczego staje się mierzalną dźwignią ekonomiczną. Artykuł GitHub jest najbardziej użytecznym dokumentem dnia dla każdego, kto buduje rozwiązania na bazie tych modeli: cztery optymalizacje, które nie zmieniają modelu, a każda z nich pozwala zaoszczędzić od 2 do 5%, wraz z udokumentowanymi nieudanymi eksperymentami. Przewodnik Anthropic po inżynierii mówi to samo z drugiej strony — już na etapie projektowania należy dążyć do skuteczności cache na poziomie od 90 do 99%, a koszt mierzyć na wykonane zadanie, nie na wywołanie. Oba źródła są zgodne w kwestii, którą przesłania wyścig modeli: przy niezmienionym modelu środowisko wykonawcze decyduje o znacznej części rachunku, a korzyści nie przenoszą się z jednego produktu na drugi. GitHub dowodzi tego, pokazując, że optymalizacja skuteczna przy code review zwiększyła koszt w CLI.
Inferencja trafia na stacje robocze, a miejsce wykonywania obliczeń staje się parametrem projektowym. FastH3 umożliwia generowanie wideo na komputerze Mac lub maszynie stacjonarnej, Perplexity udostępnia kod silnika obsługującego tylko jeden model na jednym rodzaju sprzętu, Tether publikuje translatory o rozmiarze 17 MB, i64 Systems umieszcza ekspertów MoE na NVMe, a Cohere opowiada się za właściwym doborem rozmiaru. Ruch ten łączy się odgórnie z działaniami Equinix, NVIDIA i Together AI, które rozprowadzają inferencję w 280 centrach danych ze względu na opóźnienia i suwerenność. Wspólnym wątkiem nie jest miniaturyzacja, lecz specjalizacja: Lily wygrywa, ponieważ odrzuca wszystko poza Qwen3.6-35B-A3B na Apple Silicon, a zakład Perplexity polega na tym, że ta wąska specjalizacja jest zaletą, a nie ograniczeniem.
Kontrola i zarządzanie stają się bardziej rygorystyczne i są obecnie realizowane zarówno poprzez umowy, jak i rozwiązania techniczne. GitHub narzuca retencję danych dla Fable 5.1 — z wyjątkiem wygasającym z końcem roku kalendarzowego — jednocześnie umożliwiając każdemu zespołowi w przedsiębiorstwie wybór domyślnego modelu i usuwając tego samego dnia sześć modeli z katalogu. Cursor przenosi wykonywanie agentów do sieci klienta, zastrzegając zarazem, że transkrypcje nadal są przetwarzane u niego. Google udostępnia swój model cyberobrony 650 wybranym partnerom, pod warunkiem spełnienia pisemnych wymagań operacyjnych. Mistral udostępnia chiński model z Europy i czyni z tego swój argument. Wreszcie BenchMIRT przypomina, że narzędzia ewaluacyjne, na których opiera się część tych decyzji, same zasługują na audyt: benchmark uprzedzeń społecznych, który koreluje na poziomie 0,85 z ogólnym rozumowaniem i na poziomie -0,06 z bezpieczeństwem, nie mierzy tego, co głosi jego etykieta.
Źródła
- Gemini 3.8 Flash i 3.8 Flash Cyber
- Wyniki CursorBench
- Gemini 3.8 Flash w Cursor
- Przedstawiamy Muse Spark 1.3
- Plan rozwoju Muse Spark
- Qwen3.8-Max-0902
- Wyniki Code Arena WebDev
- FastH3 lokalnie na DGX Spark i Apple Silicon
- Kod źródłowy Lily
- Udostępnienie kodu Lily
- Claude Commerce Agents
- Repozytorium commerce-agents
- Przewodnik po inżynierii agentów handlowych
- Computer use w tle
- Cursor Self-Hosted Machines
- Claude Fable 5.1 w GitHub Copilot
- Genspark integruje Fable 5.1
- Jak zwiększamy efektywność kosztową programowania z AI
- Wycofywane modele Copilot
- Domyślny model w ustawieniach zarządzanych dla przedsiębiorstw
- Dziennik wdrożeń z sierpnia 2026
- Multimedia w GitHub CLI
- Program Fairwind
- Gemini CLI v0.58.0
- Dziennik zmian Antigravity
- Short Video Overviews w 70 językach
- Zed v1.18.0
- GLM 5.2 w Vibe Code
- Współprojektowanie i speculative decoding
- Nowoczesny zestaw narzędzi CUDA w praktyce
- Open Secure AI Alliance
- Equinix Inference Exchange
- BenchMIRT
- Runway Dev MCP
- DreamX-Creator 1.0
- Dziennik zmian API OpenAI
- CHANGELOG Claude Code
- Claude Campus Ambassadors
- Nokia i Cursor
- TranslatePsy-Nano
- Puffin-World
- Eksperci MoE na NVMe
- Sakana AI na CiNet International Conference
- Gemini CLI, wydanie nightly z 2 września
- MrBeast, Gemini i Google Health
- Ogłoszenia Google dotyczące AI z sierpnia 2026
- Enterprise Live Migrations
- ElevenLabs mianuje Ashley Kramer
- Transmisja na żywo o DGX Spark i Perplexity Portable Computer
- Elements w Kling MCP
- Codex CLI 0.152.1
- Cohere i małe modele
- Poradniki edukacyjne Perplexity