Szukaj

Claude Code sterowany z telefonu, GLM-5.3 wyprzedza GPT-5.6 Sol i Claude Fable 5, Perplexity opisuje swoją pamięć Brain

Artykuł wygenerowany przez sztuczną inteligencję
Claude Code sterowany z telefonu, GLM-5.3 wyprzedza GPT-5.6 Sol i Claude Fable 5, Perplexity opisuje swoją pamięć Brain

ai-powered-markdown-translator

Przetłumaczony artykuł z fr na pl za pomocą gpt-5.4-mini.

Zobacz projekt na GitHubie ↗

22 sierpnia Anthropic udostępnia Claude Code Remote Control do uruchamiania sesji z telefonu, a Google wyposaża Antigravity w równoważną funkcję do zdalnego sterowania swoimi agentami. Po stronie modeli dwa porównania Together AI pokazują, że otwarty model GLM-5.3 dorównuje GPT-5.6 Sol i Claude Fable 5 albo je przewyższa na benchmarku DeepSWE, przy ułamku kosztu. Perplexity szczegółowo opisuje również architekturę Brain, swojej wersjonowanej pamięci agentowej z Git, a NotebookLM staje się dostępny dla wszystkich użytkowników z integracją w Trybie AI Google Search. W programie także: Replit odświeża tryby agenta, Runway otwiera ofertę licencji modeli, OpenAI wzmacnia kontrolę kosztów API i swój zestaw bezpieczeństwa Codex, a Grok Bot rozszerza dostęp.


Claude Code Remote Control: większa niezawodność i uruchamianie sesji z telefonu

22 sierpnia — Anthropic publikuje na X wątek z kilkoma poprawkami niezawodności dla Remote Control, funkcji pozwalającej sterować sesją Claude Code z telefonu, gdy działa ona na zdalnym komputerze. Synchronizacja stanu między telefonem a maszyną nie pozostawia już widmowej sesji wyświetlanej po zamknięciu Claude Code, przerwy w łączności sieciowej (zmiana Wi‑Fi, zamknięcie pokrywy) wyzwalają teraz automatyczne ponowne połączenie, a otwieranie dużych sesji jest wyraźnie szybsze na iOS. Trzy komendy slash zyskują dedykowane zachowanie mobilne (/clear, /compact, /diff). Nowość produktowa: można uruchomić sesję bezpośrednio z telefonu — każda maszyna uruchamiająca claude remote-control pojawia się jako karta urządzenia w zakładce Code, którą można wybrać, aby zainicjować sesję zdalnie.

Your phone now stays in sync with what’s running on your machine. Resuming a session on your laptop keeps the phone on the live session instead of archiving it. When Claude Code exits, your phone shows it offline within seconds instead of leaving a stale session hanging around.

🇵🇱 Twój telefon pozostaje teraz zsynchronizowany z tym, co działa na twojej maszynie. Wznowienie sesji na laptopie utrzymuje telefon na aktywnej sesji zamiast ją archiwizować. Gdy Claude Code kończy pracę, telefon pokazuje go jako offline w ciągu kilku sekund, zamiast pozostawiać wyświetloną nieaktualną sesję.@ClaudeDevs na X

🔗 Pełny wątek na X 🔗 Dokumentacja Remote Control


Replit: Conversations, przemianowane tryby Agenta (Power/Max), Routines i Memories w becie

22 sierpnia — Replit publikuje swój tygodniowy przegląd This Week in Replit z trzema nowymi funkcjami. Conversations pozwala rozpocząć pomysł na aplikację od etapu badania i ideacji konwersacyjnej, zanim przejdzie się do budowy, bez utraty zebranego kontekstu — częsty problem, gdy ten etap zaczynał się w innym asystencie AI. Tryby Agenta zostają przemianowane: dawny tryb Economy staje się Power, a dawny tryb Power staje się Max, przy identycznym koszcie obu. Wreszcie Routines i Memories trafiają do bety: Routines planują wykonanie zadania na podstawie rozmowy i automatycznie zwracają wynik, opierając się na systemie trwałej pamięci. Ogłoszenia te zaprezentowano na żywo podczas Friday Showcase Replit.

🔗 Wątek z ogłoszeniem


Together AI porównuje GLM-5.3 z GPT-5.6 Sol i Claude Fable 5 na DeepSWE

21 sierpnia — Tego samego dnia Together AI publikuje dwa niezależne porównania zestawiające GLM-5.3, najnowszy otwarty model Zhipu/Z.ai, z dwoma zamkniętymi punktami odniesienia na DeepSWE, swoim benchmarku inżynierii oprogramowania (113 zadań, 4 próby na konfigurację, maksymalny wysiłek, 904 uruchomienia łącznie). W starciu z GPT-5.6 Sol GLM-5.3 przegrywa na pierwszej próbie, ale dogania go już przy drugiej i wyprzedza przy czwartej, przy znacznie niższym koszcie. W starciu z Claude Fable 5 początkowa różnica jest niemal zerowa i wyraźnie rośnie na korzyść GLM-5.3 przy wielu próbach — Claude Fable 5 wypada jako najdroższa konfiguracja w porównaniu. Kaskada GLM-5.3 do Sol, która eskaluje tylko w przypadku niepowodzenia testów, osiąga 85,9% skuteczności przy koszcie 6,61 dolara za zadanie, wynik lepszy niż idealny router-orakel (83,8%).

PorównanieWynik przy pierwszej próbieWynik po 4 próbachKoszt na uruchomienie
GLM-5.3 vs GPT-5.6 Sol69,0 % vs 72,7 %87,6 % vs 85,8 %3,99 $ vs 8,37 $ (2,1× taniej)
GLM-5.3 vs Claude Fable 569,0 % vs 69,7 %87,6 % vs 84,1 %3,99 $ vs 21,63 $ (5,4× taniej)

Don’t pick one. Run GLM-5.3 first, escalate to GPT-5.6 Sol when the tests fail. That cascade solves 85.9% of DeepSWE tasks at $6.61 each. Sol alone solves 72.7% at $8.37. Thirteen points better, 21% cheaper.

🇵🇱 Nie wybieraj jednego modelu. Uruchom najpierw GLM-5.3, a do GPT-5.6 Sol eskaluj wtedy, gdy testy kończą się niepowodzeniem. Ta kaskada rozwiązuje 85,9% zadań DeepSWE za 6,61 dolara każde. Sam Sol rozwiązuje 72,7% za 8,37 dolara. O trzynaście punktów lepiej, o 21% taniej.Together AI, oficjalny blog

🔗 Porównanie GLM-5.3 vs Claude Fable 5


21 sierpnia — Konto X NotebookLM, przemianowane na Gemini Notebook, ogłasza, że odświeżone doświadczenie „Notebook” jest już dostępne dla wszystkich użytkowników w sieci (wersja mobilna ma pojawić się później), po stopniowym wdrażaniu. Kolejna istotna zmiana: notesy są teraz dostępne bezpośrednio z Trybu AI Google Search, co przybliża narzędzie do streszczania dokumentów do głównej wyszukiwarki Google. Ogłoszenie obejmuje także dwie poprawki po stronie Chat: lepsze renderowanie i kopiowanie równań matematycznych oraz naprawę błędu, który wyświetlał cyfry odwrócone w językach pisanych od prawej do lewej (arabski, hebrajski). Na kolejne tygodnie zapowiedziano więcej nowości.

🔗 Ogłoszenie na X


OpenAI dodaje śledzenie wydatków według klucza API do paneli Usage and Spend

21 sierpnia — OpenAI dodaje szczegółowość według klucza API do paneli Usage and Spend na swojej platformie dla deweloperów. Do tej pory agregowane na poziomie organizacji lub projektu śledzenie wydatków pozwala teraz wyodrębnić wkład każdego pojedynczego klucza API, aby precyzyjnie zidentyfikować, które aplikacje lub które przepływy pracy najbardziej obciążają rachunek. Funkcji towarzyszą konfigurowalne limity wydatków na poziomie organizacji lub projektu, z możliwością ustawienia twardych limitów, które automatycznie odcinają ruch po osiągnięciu progu. Kontrole te są dostępne z poziomu interfejsu API Platform oraz przez Admin API, aby włączyć je w programowe przepływy pracy. OpenAI przedstawia tę aktualizację jako uzupełnienie obniżki cen GPT-5.6 Sol ogłoszonej tego samego dnia.

🔗 Ogłoszenie na X


Codex Security: praktyczny przewodnik i open source CLI do obrony cybernetycznej (Daybreak)

21 sierpnia — OpenAI publikuje przewodnik opisujący ekosystem Daybreak, swoją platformę obrony cybernetycznej wspieraną przez AI, od wstępnego triage w ChatGPT aż po przygotowanie zweryfikowanej poprawki. Najbardziej konkretnym elementem dla deweloperów jest Codex Security CLI, narzędzie open source wydane jako pakiet npm (@openai/codex-security), używalne do skanowania lokalnego repozytorium (npx @openai/codex-security scan .) i możliwe do zintegrowania w CI/CD (GitHub Actions, GitLab CI/CD) z eksportem w formacie SARIF. Godna uwagi nowość: bulk-scan, który audytuje cały portfel repozytoriów na podstawie inwentarza CSV, z możliwością wznowienia po przerwaniu i konfigurowalnymi parametrami współbieżności. OpenAI rozróżnia też dwa poziomy dostępu: Daybreak Blue (triage podatności, weryfikacja poprawek) dla zatwierdzonych obrońców oraz Daybreak Red (zaawansowane wyszukiwanie podatności, red teaming), zarezerwowany dla mniejszej liczby autoryzowanych zastosowań. Codex Security cloud przeanalizował już ponad 30 milionów commitów w ponad 30 000 baz kodu.

🔗 Pełny przewodnik


Grok Bot rozszerza dostęp na więcej planów i staje się darmowy w wersji próbnej

21 sierpnia — Dziesięć dni po starcie bety Grok Bot rozszerza dostęp na szerszy zestaw planów: SuperGrok Plus, SuperGrok Heavy, a także oferty Cursor (Pro+, Ultra i wszystkie plany Teams). Użytkownicy spoza tych planów otrzymują teraz darmowy, limitowany czasowo okres próbny. Te autonomiczne agenty AI dysponują własnym środowiskiem cloud z dostępem do przeglądarki i terminala, do zadań takich jak prospecting sprzedażowy, tworzenie pełnych stron internetowych (w tym zakup domeny i wdrożenie), sortowanie skrzynek mailowych, obsługa klienta czy notatki ze spotkań. Kilka Botów może działać równolegle w jednej grupie, a tryb „routine” pozwala Botowi nauczyć się zadania, obserwując, jak użytkownik wykonuje je po raz pierwszy. Otwarto listę oczekujących dla firmowych wdrożeń na większą skalę.

🔗 Ogłoszenie na X


Runway opisuje swoją strategię enterprise i ofertę licencji modeli

21 sierpnia — Nowy dyrektor handlowy Runway, Sean Holcombe, opisuje w artykule strategię enterprise firmy: przychody ponad dwukrotnie wyższe rok do roku, retencja netto powyżej 300% i wyraźna ekspansja międzynarodowa (Europa powyżej 20% bazy enterprise, Japonia stała się największym rynkiem azjatyckim). Najbardziej istotnym ogłoszeniem jest uruchomienie oferty licencji modeli: zamiast rozliczanego z użycia dostępu przez API, niektórzy klienci enterprise będą mogli otrzymać wagi zamkniętych modeli oraz zastrzeżony framework do trenowania i inferencji, który mogą hostować i dostrajać bezpośrednio w swoim własnym środowisku. Runway celuje w cztery profile: firmy posiadające własną kreatywną własność intelektualną, platformy mające już zasoby obliczeniowe, organizacje podlegające silnym ograniczeniom regulacyjnym oraz podmioty o bardzo dużej skali.

🔗 Pełny wpis


Perplexity opisuje Brain, system pamięci agentowej Computer

19 sierpnia — Perplexity szczegółowo opisuje działanie Brain, trwałego systemu pamięci lokalnego agenta Computer. Zamiast klasycznej bazy wektorowej Brain organizuje pamięć w formie wersjonowanej przez Git wiki wiedzy, rozdzielonej na trzy warstwy w systemie plików piaskownicy: knowledge/ (wiki), notes/ (destylowane fragmenty) oraz sessions/ (surowe transkrypcje). Dedykowany „Memory Agent” ładuje na żądanie odpowiednie pliki zamiast kopiować całe drzewo katalogów przy każdym uruchomieniu, a agentom działającym w tle, nazwanym „Dream”, zajmuje się utrzymywaniem wiki offline w czterech krokach, z weryfikacją przed publikacją.

Mierzona metrykaBez BrainZ Brain
Trafność (wewnętrzny benchmark, 640 pytań)0,6000,661
Pamięć dowodów (wewnętrzny benchmark)0,5730,625
Trafność w produkcji (ostatnie 30 dni)punkt odniesienia+9,3 punktu

🔗 Artykuł techniczny


Krótkie wiadomości

  • Devin (Cognition) — dodatkowa zniżka 20% na GPT-5.6 Sol — OpenAI dodaje 20% obniżki ceny GPT-5.6 Sol na 3 miesiące, która dochodzi do już obowiązującej od 18 sierpnia zniżki 70%: łączna redukcja dla Devin Desktop i CLI sięga teraz 76% do 3 października 2026. 🔗 Ogłoszenie
  • Google Antigravity 2.9.1 — Remote Control do zdalnego sterowania agentami — Nowa funkcja pozwalająca uruchamiać i monitorować lokalną sesję agenta z dowolnej przeglądarki, z poprawą wydajności i lepszym odzyskiwaniem po błędach. 🔗 Changelog
  • Auto model selection z -30% dla Copilot Max — Promocja na automatyczny wybór modelu (Claude, GPT lub Microsoft AI) dla subskrybentów Copilot Max, ważna do 30 września 2026. 🔗 Ogłoszenie · 🔗 Data zakończenia
  • GitHub Universe 2026 — ponowne uruchomienie sprzedaży biletów — Marketingowe wznowienie konferencji GitHub Universe 2026 za pomocą krótkiego wideo, bez powiązanego ogłoszenia produktowego. 🔗 Wideo
  • Midjourney — duży changelog dla alfy strony — Dwa tygodnie poprawek UX na alpha.midjourney.com: foldery projektów, powrót Upscale/Zoom/Vary, trwałość ustawień i poprawki wydajności. 🔗 Changelog
  • MiniMax sugeruje start modelu M3 na SambaNova — W odpowiedzi na enigmatyczne ogłoszenie SambaNova MiniMax daje do zrozumienia, że wkrótce pojawi się model M3, bez podania specyfikacji ani daty premiery. 🔗 Tweet
  • Grok 4.6 dostępny na Google Enterprise Agent Platform — Model trafia do Model Garden (dawniej Vertex AI), z oknem kontekstu 500 000 tokenów i ceną 2 $ / 6 $ za milion tokenów odpowiednio wejściowych/wyjściowych. 🔗 Ogłoszenie
  • Cohere aktywuje tryb lokalny dla dyktowania głosowego przez superwhisper — Tryb „Go Local” łączy Cohere Transcribe i otwarty model S1-mini (0,6 miliarda parametrów) od superwhisper, z transkrypcją w całości na urządzeniu. 🔗 Ogłoszenie

Co to oznacza

Dwa niezależne ogłoszenia, niezwiązane ze sobą, zbiegają się dziś wokół tego samego ruchu: oddzielenia sterowania agentem AI od maszyny, na której faktycznie działa. W Anthropic Claude Code Remote Control pozwala teraz rozpocząć sesję bezpośrednio z telefonu, z automatycznym ponownym połączeniem i synchronizacją stanu między urządzeniami. W Google Antigravity wprowadza własną funkcję „Remote Control”: sterowanie i monitorowanie lokalnej sesji agenta z dowolnej przeglądarki. W obu przypadkach obliczenia i wykonanie pozostają zakotwiczone na stacji roboczej — mobilne staje się okno sterowania. To rozdzielenie odpowiada na dziś już powszechny sposób użycia: uruchomić długie zadanie na swojej maszynie deweloperskiej, a następnie śledzić je i przejąć nad nim kontrolę z innego urządzenia, bez przerywania trwającego wykonania.

Drugi widoczny dziś ruch dotyczy ekonomii modeli. Dwa porównania Together AI pokazują GLM-5.3, otwarty model Zhipu/Z.ai, dorównujący GPT-5.6 Sol i Claude Fable 5 albo je przewyższający na tym samym benchmarku inżynierii oprogramowania, przy koszcie od 2 do 5 razy niższym. To nie jest odosobniony przypadek: w tym samym tygodniu xAI mnoży integracje chmurowe dla Grok 4.6 (Google Enterprise Agent Platform po GitHub Copilot i Amazon Bedrock), OpenAI przyznaje użytkownikom Devin łączny rabat 76% na GPT-5.6 Sol, a Replit rozszerza własne tryby agenta. Konkurencja nie toczy się już wyłącznie o surową zdolność modeli, ale o stosunek kosztów do efektywności i dostępność wieloplatformową — teren, na którym modele otwarte, połączone ze strategiami kaskadowania między modelami, stają się pełnoprawnym argumentem handlowym wobec modeli zamkniętych.

Trzeci wątek, bardziej dyskretny, również przewija się przez ten dzień: trwała pamięć staje się samodzielnym elementem infrastruktury dla agentów AI. Perplexity opisuje architekturę Brain, wersjonowanego wiki wiedzy z Git, które organizuje pamięć jego agenta Computer zamiast upychać ją w klasycznej bazie wektorowej, z mierzonymi korzyściami w dokładności i przywoływaniu dowodów. W tym samym czasie Google rozszerza dostęp do przeprojektowanego doświadczenia Notebook w NotebookLM i integruje je bezpośrednio z trybem AI w Google Search, jeszcze bardziej zbliżając narzędzie do syntezy dokumentów do głównej wyszukiwarki. W obu przypadkach wartość dodana nie wynika już wyłącznie z bazowego modelu, lecz z tego, jak uporządkowana, odnajdywana i ponownie wykorzystywana jest historia oraz zgromadzona wiedza z jednej sesji do drugiej.

Ostatni aspekt dotyczy dojrzałości narzędzi przeznaczonych dla technicznych zespołów i bezpieczeństwa w przedsiębiorstwach. OpenAI dodaje śledzenie wydatków per klucz API oraz ściśle konfigurowalne limity do swoich pulpitów, dokładnie w momencie, gdy publikuje szczegółowy przewodnik po Codex Security, z otwartoźródłowym CLI zdolnym do audytu całego portfela repozytoriów. Te dwa ogłoszenia, opublikowane tego samego dnia przez ten sam zespół, rysują spójną odpowiedź na wspólną obawę organizacji wdrażających agentów AI na dużą skalę: utrzymać precyzyjną kontrolę nad kosztami i powierzchnią bezpieczeństwa, nie rezygnując z szybkości, którą obiecują te narzędzia.


Źródła