ai-powered-markdown-translatorPrzetłumaczony artykuł z fr na pl za pomocą gpt-5.4-mini.
7 sierpnia 2026 r. Claude Code przełącza Auto Mode na domyślny tryb uprawnień od 14 sierpnia dla planów Pro, Max i Team, w oparciu o wewnętrzne badanie mierzące 89% zablokowanych niebezpiecznych poleceń wobec 14% w ręcznej weryfikacji. Tego samego dnia OpenAI po raz pierwszy klasyfikuje jeden ze swoich przyszłych modeli, Astra, na poziomie krytycznym w swoim Preparedness Framework dla cyberbezpieczeństwa, a NVIDIA ujawnia Cosmos 3, nową rodzinę otwartych modeli dla robotyki i pojazdów autonomicznych, już przyjętą przez Doosan, LG, Samsung i Li Auto. Obraz uzupełniają: wiadomości między sesjami w Claude Code, złagodzenie biologicznych zabezpieczeń Claude Fable 5, ogólna dostępność Seedance 2.5 w Runway i Luma oraz kilkanaście innych ogłoszeń po stronie GitHub Copilot, Gemini i narzędzi do kodu agentowego.
Claude Code : Auto Mode staje się domyślnym trybem uprawnień 14 sierpnia
7 sierpnia — Anthropic ogłasza, że od 14 sierpnia Auto Mode stanie się domyślnym trybem uprawnień w Claude Code dla użytkowników planów Pro, Max i Team. Zamiast prosić o potwierdzenie przed każdą komendą shell lub wrażliwą akcją, Auto Mode opiera się na osobnym klasyfikatorze, który analizuje każde wywołanie narzędzia i automatycznie blokuje polecenia uznane za niebezpieczne, bez przerywania użytkownikowi na każdym kroku.
Anthropic uzasadnia tę zmianę wewnętrznym badaniem przeprowadzonym wśród 1 053 płacących testerów, którym pokazano monit o uprawnienia dla wyraźnie niebezpiecznego polecenia (sam tekst, nic nie było naprawdę wykonywane). Ludzcy testerzy wykryli zagrożenie tylko w 13,6% przypadków, a wskaźnik ten spada do około 5% po 50 kolejnych monitach pod wpływem zmęczenia. Auto Mode zablokował te same polecenia w 89% przypadków, a wynik pozostawał stabilny niezależnie od długości sesji.
| Mierzony wskaźnik | Ręczne zatwierdzanie | Auto Mode |
|---|---|---|
| Początkowe wykrycie | 13,6% | 89% |
| Wykrycie po 50 monitach | ~5% | 89% (stabilnie) |
Kolejna konkretna zmiana: dodatkowy koszt tokenów klasyfikatora nie liczy się już do limitów użycia planów Pro, Max i Team, a rozszerzenie na plany Enterprise i API jest planowane po pełnym wdrożeniu Auto Mode wszędzie. Powiadomienie w aplikacji poinformuje użytkowników o przełączeniu, a administratorzy mogą przypiąć defaultMode lub wyłączyć Auto Mode za pomocą zarządzanych ustawień.
The team and I use Auto mode exclusively, and have been for many months. I couldn’t imagine going back to permission prompts! Really excited to get this out to everyone.
🇵🇱 Z zespołem korzystamy wyłącznie z Auto Mode od kilku miesięcy. Nie wyobrażam sobie wrócić do monitów o uprawnienia! Naprawdę cieszy mnie, że możemy udostępnić to wszystkim. — @bcherny na X
OpenAI klasyfikuje Astra na poziom krytyczny dla cyberbezpieczeństwa
7 sierpnia — OpenAI ogłasza, że jego przyszły model Astra jest pierwszym sklasyfikowanym na poziomie krytycznym (Critical) dla cyberbezpieczeństwa w ramach Preparedness Framework, opublikowanego po raz pierwszy w grudniu 2023 r. Poprzednie modele, w tym GPT-5.6 Sol, były oceniane na tym obszarze jedynie jako wysokie (High).
Zgodnie z ramami model osiąga próg krytyczny w cyberbezpieczeństwie, jeśli potrafi identyfikować i rozwijać funkcjonalne exploity zero-day na wielu utwardzonych systemach krytycznych bez udziału człowieka albo zaprojektować od podstaw strategię cyberataku bez precedensu, wychodząc od prostego celu wysokiego poziomu. Wewnętrzne oceny przeprowadzone w ostatnich dniach na Astra, połączone z zewnętrznymi ekspertyzami, doprowadziły OpenAI do wniosku, że nie może wykluczyć takiego poziomu możliwości — stąd ta notatka o przejrzystości, opublikowana jeszcze przed zakończeniem pełnej kampanii testów. Firma podkreśla, że Astra nie był zaangażowany w niedawny incydent bezpieczeństwa w Hugging Face.
W konsekwencji OpenAI wzmacnia swoje wewnętrzne zabezpieczenia: odizolowane środowiska testowe, ograniczony dostęp do sieci i narzędzi, wzmocnione szyfrowanie wag modelu, zwiększony nadzór i wykonywanie w sandboxie. Wewnętrzne działania z udziałem Astra, które jeszcze nie spełniają tych wymagań, zostały wstrzymane, a monitory analizują teraz łańcuch rozumowania modelu we wszystkich jego zastosowaniach agentowych, aby uruchomić reakcję bezpieczeństwa w razie zachowania wysokiego ryzyka.
After evaluating one of our upcoming models, Astra, we’re treating it as our first “critical” model for cybersecurity under our Preparedness Framework. This is a scenario we’ve planned for, and we’re putting additional controls in place to ensure Astra’s further development happens safely and securely.
🇵🇱 Po ocenie jednego z naszych przyszłych modeli, Astra, traktujemy go jako nasz pierwszy model „krytyczny” w obszarze cyberbezpieczeństwa w ramach naszego Preparedness Framework. Taki scenariusz przewidywaliśmy i wprowadzamy dodatkowe zabezpieczenia, aby zagwarantować, że dalszy rozwój Astra będzie przebiegał bezpiecznie. — @OpenAI na X
🔗 Notatka o przejrzystości OpenAI
NVIDIA prezentuje Cosmos 3, rodzinę otwartych modeli dla AI fizycznej
6 sierpnia — NVIDIA zaprezentowała Cosmos 3, nową rodzinę otwartych modeli przeznaczonych dla AI fizycznej — robotyki, pojazdów autonomicznych, wbudowanej wizji — opublikowaną w ramach serii Into the Omniverse. Dostępne są trzy rozmiary: Cosmos 3 Super do modelowania wysokiej wierności, Cosmos 3 Nano do efektywnego rozumowania oraz Cosmos 3 Edge do wdrożenia na urządzeniu.
| Wariant Cosmos 3 | Parametry | Docelowe zastosowanie |
|---|---|---|
| Cosmos 3 Super | 64 miliardy | Modelowanie wysokiej wierności |
| Cosmos 3 Nano | 16 miliardów | Efektywne rozumowanie |
| Cosmos 3 Edge | 4 miliardy | Wdrożenie na urządzeniu |
Rodzina deklaruje pierwsze miejsca w kilku rankingach: Artificial Analysis (generowanie tekst-obraz i obraz-wideo w otwartych wagach), PAI-Bench (generowanie światów) oraz RoboLab (polityki robotyczne). Kilku producentów już ogłosiło jej wdrożenie — Doosan Robotics, LG Electronics, Samsung Electronics i Skild AI po stronie robotyki, Li Auto, Xiaomi i Afari po stronie pojazdów autonomicznych — a NVIDIA Cosmos Coalition rozszerza działalność na Japonię. Modele są dostępne na otwartej licencji OpenMDW 1.1 na Hugging Face i GitHub.
🔗 NVIDIA — Open World Models for Physical AI
Claude Code i Claude Fable 5 : dwie nowości po stronie Anthropic
Sesje Claude Code mogą teraz rozmawiać ze sobą
7 sierpnia — Claude Code wprowadza wiadomości między sesjami: zamiast ponownie wyjaśniać kontekst zadania w innej sesji, można teraz poprosić Claude, aby sam przekazał informację. Wysłana wiadomość jest streszczeniem — nie pełną historią ani plikami z sesji źródłowej — które sesja docelowa odbiera w trakcie zadania, bez zaczynania od zera. Funkcja działa w obie strony: jedna sesja może zapytać inną i otrzymać odpowiedź we własnej rozmowie, albo Claude może zainicjować taką wiadomość samodzielnie, gdy zmiana wpływa na równoległe zadanie — przydatne do koordynowania dwóch agentów przy tym samym refaktorze. Dostępne od razu na macOS i Linux.
Claude Fable 5 łagodzi swoje biologiczne zabezpieczenia, -85% fałszywych pozytywów
7 sierpnia — Anthropic zaktualizował biologiczne zabezpieczenia Claude Fable 5, aby ograniczyć fałszywe pozytywy. Według testów wewnętrznych aktualizacja zmniejsza o około 85% przypadki błędnego uruchamiania trybu awaryjnego (fallback) na tematy biologiczne, we wszystkich powierzchniach produktowych — Fable może teraz obsługiwać szerszy zakres zwykłych pytań z obszaru zdrowia i edukacji bez zbędnych blokad. Zabezpieczenie pozostaje aktywne w zastosowaniach dual use — wirologia, toksykologia, projektowanie molekularne — które nadal przełączają się na Opus 5: Fable 5 nie nadaje się więc do profesjonalnych badań biologicznych ani do opracowywania leków. Anthropic twierdzi, że pracuje nad wypełnieniem tej luki poprzez dedykowane ścieżki dostępu oparte na zaufaniu.
Narzędzia do kodu : wycena Amp, SSO Replit i przegląd bezpieczeństwa Codex
Amp restrukturyzuje wycenę i rozmiar swoich orbs
7 sierpnia — Amp dodaje nowy rozmiar orba a1.medium (4 CPU, 8 GB RAM), 50% tańszy od starego a0.medium i lepiej dopasowany do większości projektów. Opóźnienie automatycznego wstrzymania po bezczynności spada z 15 do 5 minut, zmniejszając rachunek za orby pozostawione w tle. Można też wybrać rozmiar orba dla wątku rozmowy za pomocą komendy amp -ox i jej flagi --orb-size.
| Rozmiar orba | CPU | Pamięć | Cena za godzinę |
|---|---|---|---|
| a1.tiny | 1 | 2 GB | 0,08 $ |
| a1.medium | 4 | 8 GB | 0,33 $ |
| a1.xxlarge | 16 | 32 GB | 1,32 $ |
🔗 Amp — Size the orbs of production
Replit dodaje SSO Okta i Entra ID, za darmo do października
6 sierpnia — Replit integruje firmowe logowanie jednokrotne (SSO) w swoich generowanych aplikacjach, we współpracy z Clerk. Klienci planu Pro mogą poprosić swojego agenta o skonfigurowanie Okta lub Entra ID (OIDC albo SAML) bezpośrednio w aplikacji, bez ręcznej konfiguracji dostawcy tożsamości. Opcja jest dostępna bez dodatkowych kosztów do 1 października 2026 r.. Wieloczynnikowe uwierzytelnianie, czas trwania sesji i częstotliwość weryfikacji również można konfigurować przez agenta, w dedykowanym centrum sterowania uwierzytelnianiem.
Codex Security Review : podgląd badawczy do analizy bezpieczeństwa pull requestów
6 sierpnia — OpenAI uruchamia Codex Security Review w podglądzie badawczym, dostępnym dla workspace’ów ChatGPT Enterprise, Business, Edu i Pro (niedostępne w Plus). W okresie wprowadzania przegląd nie zużywa kredytów ChatGPT, z zastrzeżeniem limitów użycia. Narzędzie idzie dalej niż istniejący Code Review w kwestiach bezpieczeństwa: analizuje diff pull requesta, kontekst repozytorium i model zagrożeń, automatycznie regenerowany, jeśli nie podano żadnego pliku. Domyślnie automatyczne przeglądy raportują ustalenia o wysokiej i krytycznej wadze, a ręczne przeglądy dodają wagę średnią — progi te można dostosować według ścieżki pliku. Ręczny przegląd można uruchomić w dowolnym momencie za pomocą komentarza @codex security review.
Badania i benchmarki : ramy oceny dla tutorów AI i pojedynek kodu
Ai2 uruchamia TutorMoments, ramy oceny dla tutorów AI
7 sierpnia — Ai2 publikuje TutorMoments, otwarte ramy oceny, które mierzą, czy modele potrafią obsłużyć centralny kompromis nauczania: zapewnić uczniowi bezpośrednie wsparcie albo pozwolić mu samodzielnie pomyśleć. Metodologia opiera się na 462 zanonimizowanych transkrypcjach rzeczywistych sesji indywidualnych korepetycji z matematyki (od klasy 1 do 6), w których nauczyciele oznaczyli ponad 1 500 kluczowych momentów decyzyjnych. Pierwszy wniosek: prompt ma ogromne znaczenie — przy neutralnej instrukcji wszystkie modele mają tendencję do zbyt dużej pomocy, ale explicytne opisanie kompromisu w prompcie wyraźnie poprawia wyniki, przy dużych różnicach między modelami.
| Metryka (prompt jawny) | Wynik |
|---|---|
| Odpowiednie wspieranie | 0,458 |
| Zwiększona rygorystyczność | 0,182 |
| Unikanie nadmiernego wsparcia | 0,496 |
Ai2 publikuje transkrypcje, kod pipeline’u i surowe wyniki w otwartym dostępie.
Together AI porównuje DeepSeek-V4 Flash-0731 i GPT-5.6 Luna na prawdziwym kodzie
6 sierpnia — Together AI uruchomiło 900 wykonań DeepSWE na 113 rzeczywistych zadaniach inżynierii oprogramowania. GPT-5.6 Luna wygrywa pod względem czystej dokładności z 67,2% pass@1 wobec 53,3% dla DeepSeek-V4 Flash-0731, a różnica 14 punktów utrzymuje się przy pass@4 (90,3% vs 80,5%). Prawdziwa różnica dotyczy kosztu: przy 0,10 $ za wykonanie DeepSeek rozwiązuje 532 zadania za 100 $, podczas gdy Luna 110 przy 0,61 $ za wykonanie — czyli około 4,8 razy więcej rozwiązań za dolara. Strategia kaskadowa (najpierw DeepSeek, eskalacja do Luny w razie niepowodzenia) rozwiązuje 78,9% zadań po 0,385 $ każde, co daje wyższy wskaźnik niż sama Luna przy obniżonym koszcie na zadanie o 37%.
🔗 Together AI — porównanie DeepSeek vs GPT-5.6 Luna
Gemini : kreatywność i podróże
Gemini Omni : pięciu twórców dzieli się swoimi kreatywnymi zastosowaniami
7 sierpnia — Google pokazuje pięciu twórców, którzy używają Gemini Omni — dostępnego przez aplikację Gemini, Google Flow, AI Studio i API — do edycji wideo i wizualizowania pomysłów za pomocą prostych poleceń. Leon Lin uchwyca tę samą scenę miejską z 20 różnymi perspektywami, zmieniając kąt i otoczenie; Carlos Santana przekształca scenę zewnętrzną za pomocą poleceń głosowych (dzień/noc, pochmurne niebo, zaśnieżony grunt); Pan animuje przedmioty codziennego użytku na podstawie szkiców; Jerrod Lew nakłada kilka stylów wizualnych (ujęcie realistyczne, anime, claymation) na to samo wideo w Google Flow; Hyperagent generuje propozycje projektów krajobrazu i animowane pulpity nawigacyjne. Artykuł ilustruje centralną obietnicę Gemini Omni: uprościć montaż wideo dzięki językowi naturalnemu, bez umiejętności technicznych.
🔗 Google — Gemini Omni Builders
Jak Gemini tworzy szczegółowe trasy podróży
6 sierpnia — Google opisuje w czterech krokach, jak działa Gemini w planowaniu podróży, dostępne od teraz w aplikacji Gemini. Najpierw pozyskiwanie danych w czasie rzeczywistym przez Google Maps, Flights, Hotels i YouTube, z integracją Viator dla aktywności. Następnie funkcja Personal Intelligence personalizuje rekomendacje na podstawie danych już przechowywanych przez użytkownika w Gmailu, Photos, Search i YouTube — na przykład restauracji sugerowanych na podstawie zapisanych zdjęć jedzenia. Gemini następnie buduje spójny plan podróży, uwzględniając czasy przejazdu, a Gemini Spark może przekształcić łańcuch e-maili z rezerwacjami w główny dokument planu podróży. Na koniec asystent wypełnia formularze rezerwacyjne, porównuje samochody na wynajem i tworzy listy rzeczy do spakowania — artykuł jako przykład wykorzystuje podróż do Kioto.
🔗 Google — jak Gemini planuje podróże
GitHub Copilot : zarządzanie przeglądami i metryki per agent
Code Quality nie wymusza już automatycznie przeglądu Copilot
7 sierpnia — Od czasu włączenia Code Quality 20 lipca 2026 r. GitHub automatycznie tworzył ruleset wymagający przeglądu Copilot przy każdym pull request. GitHub wyłącza teraz trzy z tych wyzwalaczy: przegląd przy otwarciu PR, przegląd przy nowych pushach oraz przegląd szkiców. W istniejących repozytoriach już utworzone rulesety zostały zmodyfikowane tak, by te trzy opcje były wyłączone — ruleset pozostaje w mocy, ale nie działa już automatycznie; w nowych repozytoriach włączenie Code Quality nie tworzy już tego wymagania. Zespoły, które chcą zachować automatyczne przeglądy, muszą ręcznie utworzyć lub zmodyfikować ruleset na poziomie repozytorium albo organizacji. GitHub uzasadnia tę zmianę powtarzającą się prośbą: dodanie recenzenta powinno pozostać wyborem, a nie narzuconym domyślnym ustawieniem.
API Copilot usage metrics opisuje aktywność według zewnętrznego agenta AI
7 sierpnia — API Copilot usage metrics udostępnia nową tabelę totals_by_3rd_party_agent, która dla każdego partnerskiego agenta (Claude, Codex…) uruchamianego w workflow GitHub pokazuje: stały identyfikator (agent_name, agent_id), liczbę zadań uruchomionych przez użytkowników oraz, w raportach zagregowanych, liczbę sesji. Dane te są przeznaczone dla właścicieli firm, menedżerów rozliczeń, właścicieli organizacji oraz osób z rolą „Wyświetlanie metryk Copilot”. Celem jest wyraźne śledzenie każdego agenta aplikacyjnego i porównywanie ich adopcji, aby podejmować decyzje wdrożeniowe na podstawie rzeczywistego użycia, a nie przypuszczeń.
Generowanie mediów: wideo i głos
Seedance 2.5 staje się ogólnodostępny w Runway i Luma
7 sierpnia — Po wczesnym dostępie na początku sierpnia, Seedance 2.5 jest teraz ogólnie dostępny w Runway: do 50 referencji na generację do budowania wielopostaciowych światów, klipy 30-sekundowe z dźwiękiem i dialogami, a następnie edycja/rozszerzanie. Tego samego dnia Luma ogłasza dodanie Seedance 2.5 do swojej platformy z tymi samymi możliwościami, sterowanymi przez Luma Agents do kontroli scen, kątów kamery i tempa. Równolegle Pika potwierdza za pośrednictwem swojego API Club, że Seedance 2.5 jest tam oferowany nawet o 88% taniej niż u innych agregatorów API, a stawka ta jest przedstawiana jako stała.
ElevenLabs opisuje wpływ ElevenAgents na ElevenReader Voice Chat
7 sierpnia — ElevenLabs udostępnia dane z wdrożenia ElevenAgents, które zostały upowszechnione we wszystkich jego produktach. Wyróżniony przykład to ElevenReader Voice Chat, który pozwala czytelnikom audiobooka zadawać pytania w trakcie słuchania, tym samym głosem co narrator, bez ujawniania elementów znajdujących się dalej w książce.
| Mierzona metryka | Zaobserwowana wartość |
|---|---|
| Wzrost średniego czasu słuchania | +24% |
| Wskaźnik ukończenia książki (5+ sesji) | 78% |
Najczęstsze zapytanie dotyczy streszczenia fabuły, a następnie pytań o postacie, motywy i cytaty.
Suno uruchamia Voices w swojej aplikacji mobilnej na iOS i Android
7 sierpnia — Funkcja Voices, która pozwala nagrać własny głos i wykorzystać go w generowanych utworach, jest teraz dostępna w mobilnej aplikacji Suno (iOS i Android) za pomocą przycisku „+ Voice” na ekranie tworzenia. Nagranie musi trwać co najmniej jedną minutę. Subskrypcje Pro i Premier mają nielimitowany dostęp, a plan darmowy oferuje ograniczoną wersję.
Krótkie wiadomości
- Devin (Cognition) uruchamia program kredytowy o wartości 65 000 dolarów dla startupów — Cognition otwiera program startupowy oferujący do 65 000 dolarów w kredytach Devin, w ślad za podobnymi programami największych graczy generatywnej AI. 🔗 źródło
- v0 (Vercel) uruchamia pulpit Usage & Activity — Śledzenie kredytów dziennie, aktywności według członka lub projektu oraz szczegóły według wiadomości (data, model, koszt), dostępne z poziomu Settings → Usage & Activity. 🔗 źródło
- Warp Agent CLI — zaawansowana personalizacja — Cała konfiguracja znajduje się teraz w pliku
settings.toml, edytowalnym przez agenta, z motywami, animacjami, konfigurowalnym paskiem stanu i orkiestracją wielu agentów. 🔗 źródło - Replit zdobywa rekord Guinnessa za największy kurs wideo o AI — 14 075 osób wspólnie tworzyło podczas jednej sesji na żywo, ustanawiając rekord uznany przez Guinnessa. 🔗 źródło
- SK Telecom publikuje A.X K2, model MoE o 688 miliardach parametrów na Apache 2.0 — Koreański model typu mixture-of-experts, kontekst 256K tokenów, otwarta licencja do użytku komercyjnego. 🔗 źródło
- Hugging Face hostuje zbiór danych z milionem obrazów z domeny publicznej — 1 080 814 obrazów, głównie pochodzących z książek z XIX wieku, opublikowanych na Hubie. 🔗 źródło
- Together AI twierdzi, że osiąga najlepszą przepustowość dla Kimi K3 w kilku benchmarkach — Moonshot AI stawia Together AI na pierwszym miejscu lub ex aequo w 3 z 4 testowanych benchmarków: OCRBench, MMMU Pro Vision i DeepSWE. 🔗 źródło
- Kulisy: Apollo 2 (Apptronik) na Gemini Robotics 2 — Google DeepMind publikuje serię materiałów promocyjnych wokół humanoidalnego robota Apollo 2, działającego na Gemini Robotics 2. 🔗 źródło
- Relacja „Relates to” między issues w podglądzie a polami wielokrotnego wyboru w GA — Nowa neutralna relacja issues w publicznym podglądzie oraz przejście pól wielokrotnego wyboru dla issues i projects do ogólnej dostępności. 🔗 źródło
- Secret scanning dodaje partnera i nowe detektory push protection — Lovable Labs dołącza do programu; nowe detektory obejmują m.in.
mistral_ai_api_key, a także wzbogacone metadane w alertach Cohere, GoCardless i Square. 🔗 źródło - Allowlisty MCP w zarządzanych ustawieniach przedsiębiorstwa — Firmy mogą centralizować dozwolone lub zablokowane serwery MCP dla Copilot app, CLI i VS Code za pomocą
managed-settings.json. 🔗 źródło - MiniMax H3 dostępny w Genspark AI Video Agent — Model wideo udostępniony na otwartych wagach na początku sierpnia jest teraz bezpośrednio dostępny w narzędziu do generowania wideo Genspark. 🔗 źródło
- MiniMax H3 dostępny w Luma Agents — Generowanie do 15 sekund wideo 2K z natywnym dźwiękiem stereo, sterowane tekstem, obrazem, wideo i dźwiękiem jako referencją. 🔗 źródło
- Społeczność MiniMax H3 tworzy LoRA destylacyjną (20 → 4-8 kroków) — Cztery dni po udostępnieniu wag społecznościowa LoRA zmniejsza liczbę kroków próbkowania z 20 do 4-8. 🔗 źródło
- Genspark dołącza do Unicorn Innovator Community Forum Ekonomicznego Świata — Ogłoszono udział z planowaną obecnością w Davos u boku liderów świata biznesu i rządów. 🔗 źródło
- GitHub pozwala ograniczać otwarte pull requests na poziomie organizacji — Nowa opcja pozwala ograniczyć na poziomie organizacji liczbę PR otwartych przez współtwórców bez uprawnień do zapisu. 🔗 źródło
- Genspark ustawia przeciwko sobie dwóch agentów AI (ChatGPT vs Claude) przy stoiskach z lemoniadą — Demonstracja marketingowa, w której każdy agent prowadzi prawdziwe stoisko, by spróbować zarobić 100 dolarów w jeden dzień. 🔗 źródło
- HSP GRUPPE wdraża ChatGPT Enterprise w całej sieci firm doradztwa podatkowego — Niemiecka sieć doradztwa podatkowego, audytu i prawa, przyjmująca ChatGPT Enterprise w 81 grupach organizacyjnych. 🔗 źródło
Co to oznacza
Bezpieczeństwo domyślne wchodzi jednocześnie w największych laboratoriach, ale w różnych formach. Anthropic ustawia Auto Mode jako domyślny na podstawie liczby trudnej do podważenia — 89% niebezpiecznych poleceń zablokowanych wobec 14% w zmęczonej, ludzkiej rewizji — stawiając na to, że automatyzacja oceny bezpieczeństwa jest dziś bardziej niezawodna niż powtarzalna ludzka uwaga. OpenAI idzie odwrotną drogą na innym polu: zamiast luzować kontrolę, dodaje ją, klasyfikując Astrę jako krytyczną jeszcze przed końcem kampanii testowej. Codex Security Review, uruchomiony w tym samym tygodniu, rozwija tę logikę po stronie produktu, przesuwając analizę bezpieczeństwa przed merge, zamiast opierać się na rewizji post factum. Trzy ogłoszenia opowiadają tę samą historię: bezpieczeństwo agentowe przestaje być opcją zaznaczaną ręcznie, a staje się warstwą domyślną — czy to w postaci większej autonomii, czy wzmocnionych barier ochronnych.
Ekosystem modeli otwartych jest coraz częściej oceniany przez pryzmat kosztu i adopcji w przemyśle, a nie wyłącznie wyniku benchmarku. NVIDIA pozycjonuje Cosmos 3 nie jako kolejny model, ale jako infrastrukturę już przyjętą przez Doosan, LG, Samsung i Li Auto jeszcze przed szerokim wdrożeniem. Together AI dokumentuje ten sam kompromis po stronie kodu: GPT-5.6 Luna zyskuje 14 punktów pass@1 na DeepSeek-V4 Flash, ale DeepSeek oferuje 4,8 razy więcej rozwiązań za dolara, do tego stopnia, że strategia kaskadowa bije oba modele rozpatrywane osobno. SK Telecom dorzuca do tego obrazu koreański MoE z 688 miliardami parametrów na liberalnej licencji. Wspólny sygnał: rywalizacja nie toczy się już wyłącznie na granicy możliwości, ale na relacji między tą mocą a jej realną ceną użycia.
Narzędzia do rozwoju agentowego zyskują bardziej klasyczną infrastrukturę korporacyjną — szczegółowe rozliczanie, tożsamość, governance — co świadczy o dojrzewaniu wykraczającym poza sam prototyp. Amp dzieli teraz swoje środowiska chmurowe według rozmiaru i wątku tak jak każdy dostawca infrastruktury, Replit dodaje bezpłatny firmowy SSO na czas przyspieszenia adopcji, a Claude Code pozwala przekazywać między sesjami podsumowanie kontekstu zamiast zmuszać użytkownika do ponownego wpisywania wszystkiego. Po stronie GitHuba ruch jest niemal odwrotny, ale prowadzi w tym samym kierunku: Code Quality usuwa automatyzm dodawania recenzenta Copilot, czyniąc wybór explicite, podczas gdy API usage metrics wreszcie pokazuje, kto — Claude czy Codex — faktycznie wykonuje pracę w workflow przedsiębiorstwa. Razem te ogłoszenia przesuwają rozmowę z „który agent jest najmądrzejszy” do „jak zarządzać flotą agentów”.
Generowanie mediów nadal rozprzestrzenia się przez platformy, zamiast pozostawać zamknięte w rękach jednego gracza. Seedance 2.5 trafia do ogólnej dostępności jednocześnie w Runway i Luma, MiniMax H3 rozprzestrzenia się w ciągu kilku dni do Genspark i Luma Agents, jednocześnie otrzymując już społecznościową LoRA destylacyjną, a ElevenLabs i Suno dopracowują wyspecjalizowane zastosowania — pytania kontekstowe podczas słuchania audiobooka, nagrywanie głosu bezpośrednio z telefonu. Ta szybka cyrkulacja tego samego modelu między wieloma produktami, w przypadku MiniMax H3 w zaledwie kilka dni, pokazuje, jak bardzo otwarte wagi przyspieszają twórczą dyfuzję poza oryginalnym wydawcą.
Źródła
- Ogłoszenie @ClaudeDevs — Auto Mode jako domyślny
- @bcherny na X
- OpenAI — notatka o przejrzystości Astra
- @OpenAI na X — Astra
- NVIDIA — Open World Models for Physical AI
- Ogłoszenie @ClaudeDevs — wiadomości między sesjami
- Ogłoszenie @claudeai — Claude Fable 5
- Amp — Size the orbs of production
- Ogłoszenie @Replit — SSO
- Ogłoszenie @OpenAIDevs — Codex Security Review
- Ai2 — TutorMoments
- Together AI — porównanie DeepSeek vs GPT-5.6 Luna
- Google — Gemini Omni Builders
- Google — jak Gemini planuje podróże
- Dziennik zmian GitHub — Code Quality
- Dziennik zmian GitHub — Copilot usage metrics API
- Ogłoszenie @runwayml — Seedance 2.5
- Ogłoszenie @ElevenLabs — ElevenAgents
- Ogłoszenie @suno — Voices
- Ogłoszenie @cognition — Devin startup program
- Ogłoszenie @v0 — Usage & Activity
- Ogłoszenie @warpdotdev — personalizacja
- Ogłoszenie @Replit — rekord Guinnessa
- Ogłoszenie @SKtelecom — A.X K2
- Ogłoszenie @vanstriendaniel — zbiór danych Hugging Face
- Ogłoszenie @togethercompute — przepustowość Kimi K3
- Ogłoszenie @GoogleDeepMind — Apollo 2
- Dziennik zmian GitHub — Relates to i wielokrotny wybór
- Dziennik zmian GitHub — secret scanning
- Dziennik zmian GitHub — allowlisty MCP
- Ogłoszenie @genspark_ai — MiniMax H3 w Genspark
- Ogłoszenie @LumaLabsAI — MiniMax H3 w Luma Agents
- Ogłoszenie @MiniMax_AI — LoRA destylacyjna
- Ogłoszenie @genspark_ai — WEF
- Dziennik zmian GitHub — limity PR według organizacji
- Ogłoszenie @genspark_ai — stoiska z lemoniadą
- OpenAI — HSP GRUPPE