Szukaj

Claude Platform w ogólnej dostępności, GitHub Copilot trafia do Slacka, DeepSeek uruchamia model multimodalny

ai-powered-markdown-translator

Przetłumaczony artykuł z fr na pl za pomocą gpt-5.4-mini.

Zobacz projekt na GitHubie ↗

Duży dzień dla elementów infrastruktury agentowej: Anthropic udostępnia computer use, browser tool, Skills API i Files API w wersji GA na Claude Platform, podczas gdy GitHub Copilot zadomawia się w Slacku i Microsoft Teams. Po stronie modeli DeepSeek publikuje swój pierwszy model multimodalny, a Pika Labs uruchamia syntezator mowy, który ma oferować bezprecedensowy stosunek jakości do ceny. Pomiędzy nimi: ogromny egocentryczny zbiór danych, badanie nad błędami benchmarków w rozpoznawaniu mowy oraz kilkanaście istotnych aktualizacji w Google DeepMind, GitHub, Z.ai, Qwen, Harvey i narzędziach do generowania wideo/audio.


Claude Platform: computer use, browser tool, Skills API i Files API w ogólnej dostępności

20 sierpnia — Anthropic ogłasza przejście czterech elementów do ogólnej dostępności w celu budowy agentów na Claude Platform: computer use, browser tool, Skills API i Files API. Deklarowany cel to zmniejszenie liczby koniecznych iteracji tam i z powrotem, aby zautomatyzować zadanie w aplikacji, która nie ma API, oraz umożliwienie tworzenia Claude Managed Agents na wersjonowanych skills i wielokrotnego użytku plikach.

Nowy computer_toolset_20260801 pozwala Claude wykonywać kilka działań na turę (kliknięcie, wpisanie tekstu, naciśnięcie klawisza, zrzut ekranu) zamiast jednego obiegu na pojedyncze działanie. Anthropic podaje, że klienci w programie wczesnego dostępu zaobserwowali o 20 do 40% mniej iteracji na zadanie. Równolegle browser tool rozwija się wraz z browser_toolset_20260801: zamiast celować w piksele — co jest kruche przy najmniejszej zmianie układu — Claude otrzymuje teraz strukturę strony i może działać na referencjach elementów.

Po stronie API Skills API pozwala przesłać procedurę zespołu tylko raz, wersjonować ją i przypiąć do konkretnego version_id albo do latest. Files API zyskuje parametr expires_in_seconds, 5 razy wyższy limit przepustowości (500 żądań na minutę) oraz limit 1 TB na organizację. Anthropic opublikowało też adapter AG-UI dla Managed Agents, który mapuje każdy wątek rozmowy na sesję zarządzaną i przesyła tekst, wywołania narzędzi oraz rozumowanie do interfejsu.

ElementDzisiejsza nowość
Computer usecomputer_toolset_20260801, do -40% mniej iteracji na zadanie
Browser toolbrowser_toolset_20260801, celowanie po referencji elementu strony
Skills APIWersjonowanie, przypinanie do version_id lub latest
Files API500 żądań/minutę (x5), limit 1 TB na organizację

🔗 Ogłoszenie Claude Platform


GitHub Copilot trafia do Slacka i Microsoft Teams

21 sierpnia — GitHub Copilot debiutuje w publicznej wersji zapoznawczej w Slacku i Microsoft Teams. Zasada jest identyczna w obu przypadkach: wspomnienie @GitHub w wiadomości prywatnej, kanale lub wątku otwiera sesję agenta w chmurze zdolnego odpowiadać na pytania o kod i aktywność GitHub, sortować raporty błędów, badać niepowodzenia, wdrażać zmiany w bezpiecznej chmurowej piaskownicy, a następnie otwierać pull requesty z linkiem do oryginalnej rozmowy.

W Slacku integracja opiera się na Slack Code, nowej agentowej ofercie Slacka uruchomionej tego samego weekendu: GitHub Copilot może otwierać dedykowane kanały kodu, w których zespół przegląda diffs i inspekcjonuje podglądy renderowania bez zaśmiecania oryginalnej rozmowy. W Teams rozmowa zamienia się w zbiorczą sesję agenta, którą każdy może śledzić i kierować; praca trwa asynchronicznie w chmurowej piaskownicy, podczas gdy zespół zajmuje się czymś innym.

Dostępność zarezerwowana dla organizacji na planie Copilot Business lub Enterprise. Administrator włącza politykę agenta chmurowego Copilot i instaluje aplikację dla Slacka lub Teams; administratorzy repozytoriów mogą wymagać zatwierdzenia przed scaleniem pull requestów wygenerowanych przez agenta. Użycie zużywa kredyty AI, a chmurowa piaskownica jest rozliczana osobno z konfigurowalnymi budżetami.

🔗 GitHub Copilot w Slacku · 🔗 GitHub Copilot w Teams


DeepSeek-V4-Flash-Vision-Exp : pierwszy multimodalny model DeepSeek w API

21 sierpnia — DeepSeek udostępnia DeepSeek-V4-Flash-Vision-Exp, eksperymentalny model multimodalny dostępny pod identyfikatorem deepseek-v4-flash-vision-exp. W zakresie czysto tekstowych możliwości — agenci, rozumowanie, wiedza o świecie — model dorównuje DeepSeek-V4-Flash. Nowość jest gdzie indziej: w benchmarkach agentów multimodalnych DeepSeek ogłasza wyraźny skok względem V4-Flash, z wynikami zbliżającymi się do Opus-4.8.

Obsługa multimodalna po stronie API jest pełna: mieszane wejście tekst + obraz (base64, zewnętrzny URL lub przez nowy, darmowy Files API uruchomiony tego samego dnia), kompatybilne z trzema istniejącymi formatami (Chat Completions, Messages, Responses). Cennik odpowiada tabeli V4-Flash, z tokenizacją obrazów ograniczoną do 384 tokenów na obraz. Files API pozwala przesłać obraz tylko raz i odwoływać się do niego przez file_id, co daje oszczędność przepustowości przy powtarzalnych zastosowaniach agentowych. DeepSeek Harness 0.1.1, otwartoźródłowy harness agentowy uruchomiony 13 sierpnia, został tego samego dnia zaktualizowany, aby natywnie wspierać nowy model.

ElementSzczegół
Modeldeepseek-v4-flash-vision-exp
Możliwości tekstoweParitet z DeepSeek-V4-Flash
Możliwości multimodalneBlisko Opus-4.8 w benchmarkach agentów multimodalnych
Cena obrazuDo 384 tokenów/obraz, cena V4-Flash
Obsługiwane APIChat Completions, Messages, Responses
HarnessDeepSeek Harness 0.1.1 (natywne wsparcie)

DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.

🇵🇱 DeepSeek-V4-Flash-Vision-Exp jest już dostępny na platformie API DeepSeek! Ten eksperymentalny model multimodalny dorównuje DeepSeek-V4-Flash w możliwościach tekstowych — w tym w agentach, rozumowaniu i wiedzy o świecie. W benchmarkach agentów multimodalnych V4-Flash-Vision-Exp wykonuje duży skok względem V4-Flash, zbliżając wydajność agentów multimodalnych do poziomu Opus-4.8.@deepseek_ai na X


Pika Speech : synteza mowy 3B za 1,2 sekundy na minutę, nawet 9x taniej niż ElevenLabs v3

21 sierpnia — Pika Labs rozszerza swoją ofertę Pika Audio o Pika Speech, model syntezy mowy liczący 3 miliardy parametrów. Główny atut to szybkość: współczynnik czasu rzeczywistego (RTF) 0,02, czyli minuta mowy 48 kHz w jakości studyjnej generowana w około 1,2 sekundy w lokalnych testach długiej formy, z możliwymi zapytaniami do pięciu minut ciągłej mowy.

W zakresie kontroli tempa Pika Speech wprowadza nowość: zamiast rozciągać lub kompresować audio po fakcie — standardowa metoda w większości systemów TTS — model kontroluje tempo i czas trwania bezpośrednio dzięki „latentowi końca mowy” (EOS latent), kotwicy umieszczonej przy docelowym obrazie końcowym. Przesunięcie tej kotwicy wcześniej kompresuje tempo; przesunięcie jej później pozwala tekstowi oddychać. Po stronie architektury zespół łączy flow matching i distillation by distribution matching, FlashAttention-3 oraz „token packing”, dzięki któremu pięć segmentów zdania kosztuje około dwa razy tyle co jeden, zamiast pięć razy tyle.

Jeśli chodzi o koszty, Pika deklaruje przewagę sięgającą 9x względem ElevenLabs v3, 4,5x względem Cartesia i ElevenLabs Turbo oraz 2x względem Fish Audio — bez podawania dokładnej metodologii poza tymi wskaźnikami. Model jest dostępny przez Pika API Club.

Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02. […] Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes it up to 9× more cost-efficient than ElevenLabs v3, 4.5× than Cartesia and ElevenLabs Turbo, and 2× than Fish Audio.

🇵🇱 Porozmawiajmy o Pika Speech, modelu syntezy mowy o 3 miliardach parametrów ze współczynnikiem czasu rzeczywistego 0,02. […] Pika Speech generuje minutę mowy 48 kHz w jakości studyjnej w około 1,2 sekundy — i obsługuje zapytania do pięciu minut. Ta wydajność czyni go nawet 9 razy bardziej opłacalnym niż ElevenLabs v3, 4,5 razy bardziej niż Cartesia i ElevenLabs Turbo oraz 2 razy bardziej niż Fish Audio.@pika_labs na X

🔗 Szczegóły architektury


EgoSuite-Open100K : największy otwarty ludzki zbiór danych egocentrycznych

21 sierpnia — Lightwheel AI, we współpracy z Hugging Face, open-source EgoSuite-Open100K, przedstawiany jako największy w pełni anotowany ludzki zbiór danych egocentrycznych, jaki kiedykolwiek opublikowano w wolnym dostępie. Zakładany cel to 100 000 godzin danych ludzkich z perspektywy pierwszej osoby; pierwsze 10 000 godzin jest już dostępne, a reszta będzie publikowana etapami.

Zbiór danych obejmuje ponad 15 000 zadań rozłożonych na ponad 15 000 rzeczywistych scen — kuchnie, sypialnie, magazyny, linie montażowe — zgrupowanych w 7 kategoriach środowisk i 128 typach scen. Każda sekwencja jest anotowana pozycją dłoni, pozycją ciała i semantyką na poziomie podzadań, a część korpusu ma dodatkowo pokrycie kamerą na nadgarstku. Istotny punkt dotyczący licencji: w przeciwieństwie do wielu zbiorów badawczych EgoSuite-Open100K jest licencjonowany do komercyjnego treningu, a nie tylko do celów akademickich.

Twórcy przedstawiają ten dataset jako pierwszy publiczny element szerszej infrastruktury danych dla „Physical AI” (robotyka i ucieleśniona AI) — idei, że skalowanie modeli fizycznych zależy dziś od dostępu do masowych, współdzielonych danych ludzkich.

🔗 Ogłoszenie Lightwheel AI · 🔗 Relacja Hugging Face


Claude Security przechodzi na Claude Mythos 5

21 sierpnia — Anthropic uruchamia Claude Security, swoje narzędzie do skanowania podatności, na Claude Mythos 5, w publicznej becie dla wszystkich klientów Claude Enterprise. Argument: wykorzystanie najbardziej zaawansowanego modelu bezpieczeństwa Anthropic na własnej bazie kodu bez osobnego dostępu do modelu — skany są rozliczane jako standardowe użycie tokenów w istniejącym planie.

W praktyce narzędzie trafia do repozytorium GitHub, a Mythos 5 analizuje kod, śledząc przepływ danych między plikami i rozumując o interakcjach między komponentami. Każdy wynik zwraca kategorię CWE, poziom zaufania, ocenę istotności i sugerowaną poprawkę, która otwiera się bezpośrednio w Claude Code w przeglądarce. Anthropic przy okazji uruchamia Defender Advantage Fund z pulą 35 milionów dolarów kredytów na bezpieczeństwo open source i planuje rozszerzyć swój Cyber Verification Program w nadchodzących tygodniach.

🔗 Ogłoszenie Claude Security


Cennik GPT-5.6 Sol: OpenAI obniża ceny API, GitHub Copilot podąża za tym

21 sierpnia — OpenAI obniża ceny API i kredytów GPT-5.6 Sol o ponad 20% na najbliższe trzy miesiące. Zmiana jest już aktywna po stronie API i wdrażana w Codex oraz ChatGPT Work w ciągu dnia. Dla użytkowników Codex na planach rozliczanych za zadanie (token-based) zakupione kredyty wystarczą teraz na dłużej; natomiast użycie zawarte w subskrypcjach Pro, Plus i Business pozostaje bez zmian — obniżka najbardziej korzysta więc deweloperom API i użytkownikom rozliczanym za token.

GPT-5.6 Sol -50% w GitHub Copilot

Równolegle GitHub relacjonuje osobną promocję: -50% na GPT-5.6 Sol w GitHub Copilot do 3 września, dostępne w aplikacji, CLI i IDE. To jednorazowa zniżka po stronie Copilot, której nie należy mylić ze stałą obniżką cenową OpenAI opisaną powyżej — dwie różne firmy, dwa odrębne mechanizmy dotyczące tego samego modelu.

🔗 Obniżka cenowa OpenAI · 🔗 Promocja GitHub Copilot


GLM-5.3 (Max) wspina się w Code Arena: WebDev

20 sierpnia — LMArena informuje, że GLM-5.3 (Max) od Z.ai przesunął granicę Pareto (stosunek jakości do kosztu) w rankingu Code Arena: WebDev, poświęconym ocenie modeli w zadaniach związanych z tworzeniem stron internetowych. Z wynikiem 1597 punktów model plasowałby się na 2. miejscu wśród modeli o otwartych wagach (po publikacji) i na 8. miejscu w klasyfikacji ogólnej.

ModelCena ($/M tokenów)Punkty Code Arena: WebDev
GLM-5.3 (Max)$3,651597
Qwen3.8 (Max)$5,00
Gemini-3.7-flash-high$2,86słabszy wynik
DeepSeek-v4-flash-high$1,10słabszy wynik

Przy $3,65 za milion tokenów GLM-5.3 (Max) pozostaje w przedziale cenowym porównywalnym z Qwen3.8 (Max), a jednocześnie przewyższa Gemini-3.7-flash-high i DeepSeek-v4-flash-high w tym rankingu — to kolejny sygnał konkurencyjności Z.ai w agentowym web developmencie, obok już znanych wyników w Terminal-Bench i ogólnym Agent Arena.

🔗 Ogłoszenie LMArena


Harvey uruchamia Tenet, model prawny zbudowany na Kimi K3

20 sierpnia — Harvey przedstawia Tenet, swój pierwszy model po-treningowy dla prawa, oparty na bazie Kimi K3 (Moonshot AI) po-trenowanej z Fireworks AI na korpusie publicznych danych prawnych, danych syntetycznych oraz danych ekspertów ludzkich symulujących długotrwałą pracę prawniczą.

Harvey ogłasza, że to dalsze trenowanie zwiększa pełny współczynnik sukcesu Tenet o 82% w benchmarku LAB oraz o 22% w LAB Contracts względem bazowego Kimi K3 — z najlepszym wynikiem w sztuce na LAB Contracts i 2. miejscem w całym LAB. Koszt eksploatacji Tenet ma być niższy niż jedna czwarta kosztu najlepiej działających modeli bazowych na rynku. Dodatkowo Harvey wytrenowało trzech wyspecjalizowanych podagentów: due diligence M&A, przegląd tabel oraz wiedza o kancelarii.

🔗 Ogłoszenie Harvey


Georgia Tech śledzi źródła społecznego rozumowania Olmo 3

21 sierpnia — Zespół z Georgia Tech wykorzystał fakt, że stos Olmo 3 od Ai2 jest całkowicie otwarty — wagi, korpus pretreningowy Dolma 3 (1,26 miliarda dokumentów), infrastruktura — aby statystycznie powiązać możliwości modelu z tekstami, które je wytworzyły, co byłoby niemożliwe w przypadku modelu zamkniętego.

Metoda opiera się na funkcjach wpływu, zastosowanych do około 5,68 miliona dokumentów wylosowanych z Dolma 3. Główny wynik: teksty bogate w dialogi i pisanie interpersonalne mają większy wpływ na wyniki w rozumowaniu społecznym niż na wiedzę faktograficzną — a po usunięciu najbardziej wpływowych dokumentów literackich wyniki na benchmarku SocialIQA znacząco spadły, potwierdzając związek przyczynowy.

🔗 Artykuł Ai2


Wykryto błąd „benchmark optimization” w otwartoźródłowych modelach ASR

21 sierpnia — Zespół Hume AI publikuje na blogu Hugging Face badanie dotyczące błędu metodologicznego w rozpoznawaniu mowy: niektóre modele wydają się zoptymalizowane pod kątem odtwarzania referencyjnych transkrypcji z publicznych benchmarków, a nie wiernego przepisywania dźwięku.

Spośród 11 testowanych otwartoźródłowych modeli ASR około 40 % analizowanych fragmentów VoxPopuli zawierało błędy w referencjach, a 6 modeli z 11 odtwarzało te błędy zamiast poprawnie transkrybować dźwięk. W LibriSpeech wskaźniki odzyskiwania ukrytych liczb sięgały 30–40 %, co wskazuje, że niektóre modele „dopowiadają” tekst zamiast go słyszeć. Wniosek zaleca używanie tajnych zbiorów ewaluacyjnych i ściślejsze oddzielenie danych treningowych od testowych.

🔗 Badanie Hugging Face


SenseNova-U1.5-8B-MoT: otwarty model obrazu bez VAE i bez DiT

21 sierpnia — SenseNova publikuje w otwartych wagach model generowania obrazów, którego deklarowane osiągi miałyby być porównywalne z Nano Banana 2. Techniczna atrakcyjność wynika z architektury: brak VAE, brak osobnego enkodera tekstu, brak DiT — model opiera się na „mixture of transformers”, gdzie tokeny tekstu i obrazu używają odrębnych wag i wzajemnie się oczekują, a odszumianie odbywa się bezpośrednio w przestrzeni pikseli, a nie w skompresowanej przestrzeni latentnej.

To podejście wyraźnie różni się od standardowego stosu modeli dyfuzyjnych tekst-obraz, a otwarcie wag pozwoli społeczności niezależnie zweryfikować deklarowane porównania wydajności.

🔗 Ogłoszenie SenseNova


Diffusers 0.40.0: Modular Diffusers wychodzi ze statusu eksperymentalnego

21 sierpnia — Hugging Face publikuje Diffusers 0.40.0. Najbardziej strukturalną zmianą jest wyjście ze statusu eksperymentalnego dla Modular Diffusers, modułowego systemu pipeline’ów tej biblioteki. Wersja dodaje integrację kilku nowych otwartych modeli (LTX2.5, MiniMax H3, MiniMax Music 3, Wan Animate 2), obsługę paralelizmu tensorowego dla wybranych modeli oraz dwa nowe backendy kwantyzacji (SDNQ, Nunchaku-Lite).

🔗 Ogłoszenie Diffusers 0.40.0


Google DeepMind bada AI w grach razem z Fenris Creations

21 sierpnia — Google DeepMind ogłasza partnerstwo badawcze ze studiem Fenris Creations, w kontynuacji 15 lat prac wykorzystujących gry wideo jako poligon doświadczalny dla AI — od opanowania Atari po poziom Grandmaster w StarCraft II. Po SIMA, które nauczyło agentów rozumieć światy 3D, DeepMind chce badać nawigację w rzeczywistych ludzkich dynamikach w obrębie trwałego uniwersum.

Partnerstwo skupia się na czterech otwartych wyzwaniach: uczeniu ciągłym (zdobywanie nowych umiejętności bez zapominania poprzednich), systemach głębokiej pamięci daleko wykraczających poza dzisiejsze okna kontekstu, planowaniu długoterminowym (tygodnie, miesiące, lata) oraz dynamice wieloagentowej (współpraca, negocjacje, ekonomia, zachowania emergentne). Długoterminowy cel jest podwójny: tworzyć nowe doświadczenia growe z deweloperami i ponownie wykorzystywać te postępy do problemów świata rzeczywistego oraz odkryć naukowych.

🔗 Ogłoszenie Google DeepMind


Runway Ruby: konwersja wideo SDR do HDR 16 bitów

21 sierpnia — Runway uruchamia Ruby, model, który konwertuje wideo SDR (standard dynamic range) do HDR 16 bitów, z wyjściem w sekwencjach EXR lub ProRes/HEVC 10–12 bitów, w przestrzeni barw BT.2020 z obsługą PQ lub HLG — standardów używanych w profesjonalnej postprodukcji i broadcastowym HDR.

Ruby działa zarówno na wideo przesłanym przez użytkownika, jak i na outputcie wygenerowanym przez Runway, z limitem 30 sekund. Funkcja jest już dostępna dla planów Max i Enterprise.

🔗 Ogłoszenie Runway Ruby


NVIDIA AVO twierdzi, że osiągnął 100 % na benchmarku ARC-AGI-3

21 sierpnia — NVIDIA przedstawia AVO, ogólnego agenta kodowego, z wynikiem 100 % na ARC-AGI-3, benchmarku interaktywnego rozumowania. Według NVIDIA, AVO ukończył 183 poziomy rozłożone na 25 publicznych środowisk benchmarku, bez jawnych instrukcji, wypowiedzianych reguł ani wcześniej sformułowanych celów.

AVO działa poprzez ciągłą pętlę inspekcji, planowania, implementacji i oceny, korzystając z pamięci, narzędzi i informacji zwrotnej z wykonania, aby budować na tym, czego uczy się z czasem — podejście mające utrzymywać postęp przy długich zadaniach zamiast zaczynać od zera przy każdym nowym oknie kontekstu.

🔗 Wynik ARC-AGI-3


HeyGen Look Packs: zmiana ubioru i tła z zachowaniem twarzy

21 sierpnia — HeyGen uruchamia Look Packs, funkcję, która zmienia ubiór i tło wideo awatara, jednocześnie wiernie zachowując twarz osoby — argumentem jest to, że większość modeli generatywnych zmienia również rysy twarzy podczas zmiany wyglądu.

Zakładane zastosowanie to spójność marki osobistej w różnych kontekstach zawodowych: nieruchomości, prawo, fitness, edukacja, well-being. Twórca treści B2B może więc produkować wideo w strojach i sceneriach dopasowanych do każdego sektora, pozostając rozpoznawalnym z filmu na film. Ogłoszenie wpisuje się w intensywne tempo HeyGen z ostatnich dni (Retouch 20 sierpnia, Brand Kits i upscale 4K 18–19 sierpnia).

🔗 Ogłoszenie Look Packs


Amp uruchamia Explain Usage, by wyjaśniać zużycie tokenów

21 sierpnia — Amp dodaje Explain Usage, funkcję, która pozwala bezpośrednio poprosić Pucka, wbudowanego asystenta, o analizę własnego zużycia tokenów, kredytów i rozmiaru orb. Użytkownik zadaje pytanie w języku naturalnym — „Które thready zużyły dziś najwięcej tokenów?” — a Puck odczytuje osobiste dane użycia i metryki per thread, aby odpowiedzieć.

Istnieją dwa punkty wejścia: zadać pytanie bezpośrednio Puckowi albo kliknąć dedykowany przycisk na stronach użycia. Dla użytkowników preferujących surowe dane Amp udostępnia te informacje także przez CLI (amp usage --details, amp threads usage <thread-id> --details).

🔗 Explain Usage


v0 (Vercel) dodaje Vercel Connect, by łączyć się z 100+ usługami

21 sierpnia — Aplikacje i agenci budowani w v0 mogą teraz łączyć się bezpośrednio ze Slack, GitHub, Salesforce i ponad 100 innymi usługami zewnętrznymi przez Vercel Connect, bez konieczności samodzielnego zarządzania przez dewelopera przepływem autoryzacji.

Mechanizm opiera się na wielokrotnego użytku konektorach zespołowych powiązanych z tokenami krótkoterminowymi: po skonfigurowaniu konektora po stronie zespołu każda nowa aplikacja lub agent może go ponownie wykorzystać zamiast za każdym razem prosić o pełną autoryzację. To pozycjonuje v0 jako platformę zdolną tworzyć agentów zintegrowanych ze stosem software’owym firmy, a nie tylko odizolowane interfejsy.

🔗 Vercel Connect


Współdzielone wątki w Codex i ChatGPT Work

20 sierpnia — Codex i ChatGPT Work wprowadzają „współdzielone wątki”: link tylko do odczytu, który ujawnia pełne rozumowanie sesji — podejście, decyzje, kontekst — zamiast samego końcowego wyniku. Celem jest uniknięcie rekonstruowania kontekstu pull requesta z rozproszonych zrzutów ekranu podczas przeglądu kodu, dogłębnej eksploracji technicznej lub przekazywania projektu między członkami zespołu.

To funkcja wpisująca się w ciąg ostatnich ogłoszeń dotyczących ChatGPT Sites (edycja wieloosobowa, personalizacja URL) i wzmacniająca pozycjonowanie Codex/ChatGPT Work jako narzędzia do pracy zespołowej.

🔗 Współdzielone wątki


Przezroczyste tła w wersji zapoznawczej dla GPT-Image-2

20 sierpniaGPT-Image-2 API pozwala teraz, w wersji zapoznawczej, generować obrazy z przezroczystym tłem. Praktyczna korzyść polega na tworzeniu wielokrotnego użytku assetów — wizualizacji produktów, elementów projektowania graficznego, makiet stron internetowych, kampanii marketingowych — które można następnie umieścić na dowolnym tle bez ręcznej retuszerskiej wycinki.

🔗 Przezroczyste tła


Krótkie informacje

  • Zed — Antigravity instaluje się jednym kliknięciem z ACP Registry Zeda. 🔗 Tweet
  • trackio 0.36 — Hugging Face publikuje aktualizację dodającą obsługę nowego typu logowalnych danych, bez dalszych szczegółów. 🔗 Tweet
  • „full-stack” AI według Google DeepMind — Paige Bailey rozkłada podejście Google end-to-end na pięć warstw: infrastruktura, bezpieczeństwo, badania, modele/narzędzia, produkty. 🔗 Artykuł Google
  • GitHub — lepsze zarządzanie zablokowanymi użytkownikami: wyszukiwanie po nazwie, sortowanie i paginacja długich list. 🔗 Changelog
  • GitHub — przypinanie widoków, projektów i kamieni milowych na pasku bocznym repozytorium przechodzi do ogólnej dostępności, z kilkoma powiązanymi usprawnieniami (awatary reakcji, gęstość dashboardu). 🔗 Changelog
  • Manus przedłuża darmowy dostęp do Manus 1.6 Lite i Manus 1.6 do 28 sierpnia (SGT), w granicach dziennego limitu. 🔗 Tweet
  • Manus przypomina powiadomionym użytkownikom o zapisaniu danych przed 23 sierpnia 7:59 (SGT), przed przejściem do niezależnej spółki. 🔗 Tweet
  • Genspark uruchamia promocję do 30 września: Design + GenTeam -90 %, GenMail gratis, Slides Ultra Mode -50 %. 🔗 Tweet
  • NVIDIA szczegółowo opisuje rozdział między uprzężą agenta (to, co próbuje zrobić) a infrastrukturą (to, co naprawdę może zrobić) w deep dive dotyczącym bezpieczeństwa stosu agentowego. 🔗 Tweet
  • NVIDIA publikuje podsumowanie Spark Hack Series z Seattle na DGX Spark: zwycięskie projekty w obszarze reagowania na katastrofy, zdrowia i przetrwania offline z Nemotron i NemoClaw. 🔗 Tweet
  • NVIDIA Cosmos 3 — wideo Cosmos Labs pokazuje post-training Cosmos 3 u partnerów Aigen i Linker Vision. 🔗 Tweet
  • Luma Labs wystąpi o agentach kreatywnych podczas Summer Signal, organizowanego z GMI Cloud 14 września. 🔗 Tweet
  • Synthesia — jej CEO jest cytowany w artykule Forbes Tech o mierzeniu adopcji AI przez wyniki, a nie przez użycie. 🔗 Tweet
  • Qwen3.8-27B kontynuuje swój społecznościowy rozpęd: nowe receptury inferencji NVFP4 + DFlash2 w cookbooku SGLang, lżejsze wersje opublikowane przez Unsloth, 1. miejsce w rankingu agenta kodu Cline w cztery dni oraz NVIDIA DGX Station raportująca ponad 2713 tokenów/s jako szczyt zagregowany w usłudze BF16. 🔗 SGLang · 🔗 Unsloth · 🔗 Cline · 🔗 DGX Station
  • Qwen3.8-Max jest już dostępny w narzędziu do kodu Kilo Code do generowania interfejsów. 🔗 Tweet
  • Kimi Work publikuje drugi poradnik dla analityków finansowych: pulpit inwestora, aktualizacja modeli finansowych, generowanie raportów wsadowych. 🔗 Tweet
  • GLM-5.3 nadal się rozwija: wynik 69 w oficjalnym rankingu DeepSWE, dostępność na platformie WorkBuddy oraz przedłużenie Build Week przez Z.ai do 23 sierpnia 18:00 (PT) z 100 milionami darmowych tokenów dla pierwszych 50 000 nowych rejestracji ZCode. 🔗 DeepSWE · 🔗 WorkBuddy · 🔗 Build Week
  • GPT-5.6 Sol — trzy platformy zewnętrzne (Router, Cloudflare AI Gateway, OpenCode Zen) oferują każda -50 % do połowy września, ponad rabatami już uwzględnionymi w Devin, OpenRouter i v0. 🔗 Cloudflare AI Gateway

Co to oznacza

Dzisiejsze ogłoszenie Anthropic-GitHub rysuje wyraźny trend: infrastruktura agentowa wychodzi ze stadium eksperymentalnego. GA computer use i browser tool na Claude Platform, połączone z pojawieniem się Copilota w Slack i Teams, sygnalizują, że najwięksi dostawcy nie ograniczają się już do sprzedaży modeli — sprzedają agentów zdolnych działać w narzędziach, których zespoły używają już na co dzień, bez konieczności każdorazowej dedykowanej integracji API. To zmiana równie mocno dystrybucyjna, co funkcjonalna: agent idzie tam, gdzie dzieje się praca, zamiast wymagać, by praca przyszła do niego.

Na poziomie modeli DeepSeek-V4-Flash-Vision-Exp potwierdza, że multimodalność staje się oczekiwanym standardem, a nie wyróżnikiem — nawet gracze pozycjonowani na efektywność kosztową (V4-Flash) integrują ją teraz natywnie, osiągając wyniki zbliżone do najlepszych modeli zamkniętych. Rywalizacja na benchmarkach agentowych kodu (GLM-5.3 na Code Arena: WebDev, Qwen3.8-27B na Cline) pokazuje tę samą dynamikę po stronie narzędzi deweloperskich: różnice cenowe między modelami otwartymi i zamkniętymi się zawężają, co popycha OpenAI do obniżenia cen API o ponad 20 % na GPT-5.6 Sol niemal równocześnie.

Ruch w stronę pełnej otwartości — nie tylko wag, ale też danych i infrastruktury treningowej — nadal przynosi owoce naukowe: badanie Georgia Tech nad Olmo 3 po prostu nie byłoby możliwe na modelu zamkniętym, podobnie jak badanie Hume AI nad biasem benchmarków ASR przypomina, że wynik w leaderboardzie nie gwarantuje rzeczywistej jakości transkrypcji. To dwa użyteczne przypomnienia w momencie, gdy branża mnoży ogłoszenia o rekordowych wynikach.

Wreszcie, mnożenie się ogromnych zbiorów danych na licencji komercyjnej — EgoSuite-Open100K dziś, po kilku podobnych ogłoszeniach w ostatnich tygodniach — potwierdza, że dostęp do rzeczywistych danych ludzkich, nie tylko syntetycznych, staje się strategiczną kwestią dla robotyki i ucieleśnionej AI, podobnie jak obliczenia stały się nią dla dużych modeli językowych.


Źródła