ai-powered-markdown-translatorArtykuł przetłumaczony z fr na pl za pomocą gpt-6-sol.
23 września Anthropic przedstawia swoje laboratorium biologii molekularnej i jego pierwszy wynik: ART, nieznany układ enzymatyczny wykryty w DNA bakteriofagów przez około 950 agentów Claude. Google wprowadza Gemini 3.8 Flash TTS i Flash-Lite TTS, dwa modele syntezy mowy, które tworzą i klonują głosy, Black Forest Labs publikuje FLUX 3 Action, model z otwartymi wagami do sterowania robotami, a Perplexity przedstawia pierwszy audyt bezpieczeństwa SPACE, środowiska izolowanego, w którym działają jego agenci.
Anthropic otwiera laboratorium biologii molekularnej, w którym Claude odkrywa ART
23 września — Anthropic przedstawia nową grupę badawczą zajmującą się naukami o życiu. Grupa, utworzona wiosną i działająca w rejonie Zatoki San Francisco, ma własne laboratorium biologii molekularnej. Jej pierwszy wynik: agenci Claude wykryli w DNA bakteriofagów, czyli wirusów infekujących bakterie, nigdy wcześniej nieopisany układ enzymatyczny. Anthropic nazwał go ART (array-associated reverse transcriptases, odwrotne transkryptazy związane z układem powtórzeń).
Wszystko zaczęło się od promptu: znaleźć w obszernej bazie sekwencji DNA nowe przykłady odwrotnych transkryptaz, enzymów przepisujących RNA na DNA. W ciągu 21 godzin około 950 agentów zużyło 210 milionów tokenów, zebrało ponad 200 000 odwrotnych transkryptaz, wyodrębniło 3 500 nowych układów kandydujących i wybrało 20 najbardziej obiecujących. Każdemu towarzyszył raport zrozumiały dla człowieka. Według Anthropic taka analiza zajmuje ekspertowi tygodnie, a nawet miesiące; udział człowieka ograniczył się do początkowego promptu i eksperymentów laboratoryjnych.
| Etap badań | Zmierzona wartość |
|---|---|
| Czas poszukiwań | 21 godzin |
| Zaangażowani agenci Claude | około 950 |
| Zużyte tokeny | 210 milionów |
| Zebrane odwrotne transkryptazy | ponad 200 000 |
| Nowe układy kandydujące | 3 500 |
| Wybrani i przeanalizowani kandydaci | 20 |
ART składa się z trzech elementów: odwrotnej transkryptazy, sąsiedniego genu o nieznanej funkcji oraz długiego układu regularnie rozmieszczonych, powtarzających się sekwencji DNA, przypominającego układ CRISPR. Sama transkryptaza, znaleziona w olbrzymim fagu, była już znana; według Anthropic Claude „wydaje się pierwszym”, który zauważył niekodujący układ powtórzeń i towarzyszące mu białko. Pierwsze eksperymenty pokazują, że z tego układu powstają odrębne, krótkie cząsteczki RNA. Anthropic zachowuje ostrożność: funkcja ART pozostaje nieznana, a dalsze eksperymenty trwają. Według Anthropic tylko nieliczne znane układy mają takie cechy i wszystkie można programować do cięcia, kopiowania i wklejania DNA.
Claude has discovered a previously unknown enzyme system hidden in the DNA of bacteriophages. Beside the enzyme’s gene sits a long array of repeating DNA—a structure that looks somewhat similar to CRISPR.
🇵🇱 Claude odkrył nieznany dotąd układ enzymatyczny ukryty w DNA bakteriofagów. Obok genu enzymu znajduje się długi układ powtarzającego się DNA, którego struktura przypomina nieco CRISPR. — @AnthropicAI na X
Laboratorium pracuje wyłącznie na poziomach bezpieczeństwa biologicznego BSL-1 i BSL-2 i nie zajmuje się żadnymi patogenami zdolnymi do zakażania ludzi; wszystkie czynności laboratoryjne wykonują naukowcy. Zespół używa Claude Science i Claude Code, czasem wraz z własnym narzędziem koordynującym wiele sesji równolegle. Ponieważ jedna seria badań przynosi setki, a nawet tysiące raportów, same hipotezy stają się przedmiotem analizy: cechy hipotez, które badacze uznają za warte sprawdzenia, pomagają dopracować instrukcje dla Claude. Feng Zhang, pionier edycji genomu metodą CRISPR (MIT i Broad Institute), zapoznał się z preprintem i uważa go za ekscytujący przykład wkładu agentów AI w odkrycia biologiczne. Anthropic publikuje preprint i zachęca naukowców do przesyłania pytań badawczych.
🔗 Claude odkrywa nowy układ enzymatyczny z powtórzeniami podobnymi do CRISPR · Preprint (PDF)
Gemini 3.8 Flash TTS i Flash-Lite TTS: Google tworzy i klonuje głosy
23 września — Google dodaje do rodziny Gemini dwa modele syntezy mowy (text-to-speech), które przedstawia jako swoje najbardziej ekspresyjne modele audio: Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS. Oba są ogólnie dostępne w API Gemini i Google AI Studio wraz z nowym endpointem Voices; wpis w rejestrze zmian API nosi datę 22 września, a publiczne ogłoszenie ukazało się 23 września.
Oba modele mają różne zastosowania. Flash TTS służy do tworzenia głosów: rolę, akcent i charakter głosu opisuje się językiem naturalnym, a następnie kieruje każdą wypowiedzią, określając sposób mówienia, rytm i zmiany dialektu. Google przeznacza go do gier wideo, audiobooków i podcastów. Flash-Lite TTS jest nastawiony na dużą skalę i niski koszt: dubbing na dużą skalę, masową produkcję audio i agentów głosowych działających w czasie rzeczywistym; ma zastąpić gemini-3.1-flash-tts-preview. Oba obsługują dialogi dwóch głosów w jednym skrypcie, wiele godzin nagrań bez zauważalnej zmiany barwy głosu oraz znaczniki takie jak <laughs>, <sigh> czy |mhm|.
We wpisie zapowiedziano ponad 2 000 gotowych głosów, w tym warianty regionalne, takie jak francuski używany w Quebecu; dokumentacja API opisuje natomiast 30 głosów studyjnych i rozszerzoną bibliotekę kilkuset głosów. Do sklonowania głosu wystarczy 30-sekundowa próbka, pod warunkiem nagrania ustnej zgody właściciela głosu, a każde wygenerowane nagranie ma znak wodny SynthID. Istotna informacja dla czytelników z Francji: według uwagi we wpisie klonowanie głosu przez AI Studio nie jest dostępne w Europejskim Obszarze Gospodarczym, Wielkiej Brytanii, Szwajcarii, Indiach, Illinois ani Teksasie. Zapowiedziano również, że wkrótce pojawi się możliwość remiksowania istniejących głosów.
| Cecha modelu | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| Identyfikator API | gemini-3.8-flash-tts | gemini-3.8-flash-lite-tts |
| Obsługiwane języki (dokumentacja API) | 130 | 101 |
| Przeznaczenie | Tworzenie, precyzyjna reżyseria | Duża skala, dubbing, agenci głosowi |
| Wyjściowe audio, cena Standard do 31/12/2026 (milion tokenów) | 9 dolarów | 6 dolarów |
| Wyjściowe audio, cena Standard od 01/01/2027 (milion tokenów) | 18 dolarów | 12 dolarów |
| Produkt dla użytkowników indywidualnych | Gemini Notebook | Google Vids (zapowiedziana narracja) |
Dla porównania Gemini 3.1 Flash TTS Preview kosztuje 20 dolarów za milion wyjściowych tokenów audio. Google powołuje się przy premierze na zewnętrzne oceny: Flash TTS zajmuje pierwsze miejsce w Voice Design Benchmark firmy Hume AI (71,4), a oba modele zajmują dwa pierwsze miejsca w Overall Quality Index firmy Hume AI. „Wkrótce” trafią też do Gemini Enterprise przez API.
🔗 Ogłoszenie Google · Informacje o wersjach API Gemini · Cennik API
FLUX 3 Action: Black Forest Labs publikuje model z otwartymi wagami do sterowania robotami
23 września — Black Forest Labs, znane z modeli obrazu FLUX, publikuje FLUX 3 Action, model działania w świecie (World Action Model) o 7 miliardach parametrów, przeznaczony do sterowania robotami. Model wywodzi się z multimodalnej podstawy FLUX 3 i w jednym obliczeniu przewiduje przyszłe obrazy oraz polecenia ruchowe na podstawie obrazu z kamer i położenia przegubów. Wagi są otwarte (karta checkpointu DROID na Hugging Face podaje licencję „flux-kommunity-license”), a laboratorium publikuje także kod, opis procesu dostrajania, benchmarki i przykłady możliwe do odtworzenia.
An open weights 7B World Action Model that achieves first place on the RoboLab benchmark. It outperforms the previous best open model by 6.1 percentage points while using 56% fewer parameters and running up to 3.95x faster.
🇵🇱 Model działania w świecie o 7B parametrach i otwartych wagach, który zajmuje pierwsze miejsce w benchmarku RoboLab. Wyprzedza poprzedni najlepszy model otwarty o 6,1 punktu procentowego, mając o 56 % mniej parametrów i działając nawet 3,95 razy szybciej. — @bfl_ai na X
| Oceniany model | Typ modelu | Dostęp do wag | Skuteczność RoboLab-120 | Liczba parametrów |
|---|---|---|---|---|
| FLUX 3 Action | WAM | Otwarte | 42,92 % | 7B |
| OASIS WAM | VLM + WAM | Zamknięte | 39,0 % | – |
| Cosmos3-Nano-Policy | WAM | Otwarte | 36,8 % | 16B |
| Phoenix | TAMP+FM | Zamknięte | 34,4 % | – |
| BiMind v0.1 | VLA | Zamknięte | 33,3 % | – |
| π0.5 | VLA | Otwarte | 28,0 % | 3,3B |
| DreamZero | WAM | Otwarte | 25,7 % | 14B |
| GR00T N1.6 | VLA | Otwarte | 7,2 % | 3B |
Poprzednim najlepszym modelem otwartym był Cosmos3-Nano-Policy firmy NVIDIA. Stwierdzenie „nawet 3,95 razy szybciej” odnosi się do Cosmos 3 Nano w FP8: przewaga wynosi od 1,52 do 3,95 razy, zależnie od GPU. W porównaniu z π0.5, najskuteczniejszym otwartym modelem łączącym obraz, język i działanie (VLA), wariant destylowany do jednego kroku (38,3 %) działa szybciej na GPU stacji roboczych i centrów danych, lecz wolniej na RTX 5090; przewiduje za to 2,13 sekundy ruchu na jedną predykcję, wobec 1 sekundy w przypadku π0.5.
We wpisie sprawdzono także hybrydową strategię sterowania, w której GPT-6 Astra firmy OpenAI nadzoruje robota: FLUX 3 Action połączony z Astra przy niskim poziomie wysiłku (low) kończy sukcesem 90 % epizodów, przy koszcie 8,77 dolara i czasie około 8 minut na sukces. Sam Astra przy poziomie wysiłku „xhigh” wykonuje wszystkie zadania, ale kosztuje 13,47 dolara i potrzebuje 16 minut na sukces. W ślepej ocenie przeprowadzonej przez Positronic Robotics na prawdziwym ramieniu Franka FLUX 3 Action uzyskał 28 sukcesów na 30 prób, Cosmos 3 Nano — 27, a π0.5 — 13. Na Hugging Face dostępne są trzy checkpointy (base, SO-101 i DROID), a model zintegrowano z LeRobot we współpracy z NVIDIA, z możliwością wdrożenia na Jetson.
🔗 FLUX 3 Action (Black Forest Labs) · Kolekcja Hugging Face
Escaping SPACE: Perplexity publikuje pierwszy audyt bezpieczeństwa środowiska izolowanego Computer
23 września — Perplexity Secure Intelligence Institute publikuje pierwszą część raportu z testów penetracyjnych (red-teaming) SPACE, środowiska izolowanego, w którym działają agenci Perplexity Computer, zaprezentowanego 15 lipca. To pierwsza opublikowana ocena bezpieczeństwa SPACE. Każde środowisko izolowane jest mikro maszyną wirtualną Firecracker, odizolowaną od maszyny gospodarza, a przypisana mu brama egzekwuje zasady wychodzącego ruchu sieciowego.
Dziewięć modeli otrzymało dostęp root w maszynie wirtualnej i dwa zadania typu „capture the flag”: przekroczyć granicę między VM a gospodarzem, aby zdobyć pozorowany identyfikator AWS, albo dotrzeć do adresu URL blokowanego przez politykę sieciową. Protokół uwzględniał dostęp do kodu źródłowego SPACE lub jego brak oraz dwa poziomy dostępu do sieci: brak dostępu lub dostęp częściowy (repozytoria pakietów PyPI i Ubuntu, wyszukiwarka internetowa Perplexity). Dla każdej konfiguracji przewidziano trzy próby. Wynik: w 108 próbach ani razu nie udało się wydostać z VM na maszynę gospodarza, nawet przy dostępie do kodu źródłowego. Filtrowanie sieciowe zadziałało, gdy cały ruch był blokowany (0 z 54 prób); przy częściowym dostępie do sieci 11 z 54 prób zakończyło się jednak dotarciem do zabronionego celu przed wprowadzeniem poprawki.
| Oceniany model | Sukcesy z kodem źródłowym | Sukcesy bez kodu źródłowego |
|---|---|---|
| Claude Opus 5.0 | 3 próby z 3 | Brak |
| GPT-5.6 Sol | 3 próby z 3 | 2 próby z 3 |
| Kimi K3 | 2 próby z 3 | Brak |
| GPT-5.6 Cyber | Brak | 1 próba z 3 |
| Pięć innych ocenianych modeli | Brak | Brak |
Wykorzystano dwie luki. Pierwsza polegała na podszyciu się pod odpowiedź DNS: agent wstrzykiwał fałszywą odpowiedź wiążącą pypi.org z adresem celu, a brama, która nie sprawdzała pochodzenia odpowiedzi, zapisywała ją; wymagało to wewnętrznego adresu widocznego tylko w kodzie źródłowym. Druga wynikała ze współdzielenia adresów IP przez CDN: GPT-5.6 Sol zlecił fiddle.fastly.dev pobranie zabronionego adresu URL, ponieważ usługę można było osiągnąć pod tym samym adresem co PyPI. GPT-5.6 Cyber skorzystał z usługi obrazów Taboola i generatora zrzutów ekranu thum.io, a następnie odczytał flagę za pomocą rozpoznawania znaków. Claude Opus 5.0 wykrył ten sposób, ale go odrzucił, uznając, że narusza polecenie, by nie atakować żadnego zewnętrznego systemu. Kimi K3 był jedynym modelem z otwartymi wagami, któremu się powiodło. Dwóch modeli nie udało się ocenić: Fable odmówił wykonania zadania mimo przystąpienia Perplexity do programu Cyber Verification Program firmy Anthropic, a GPT-6 Astra również odmówił.
Luki odkryte 26 sierpnia zostały usunięte: każdy pakiet wychodzący musi mieć adres przypisany do swojej VM, a brama sama kończy połączenie TLS, aby sprawdzić nazwę serwera (SNI) i host HTTP. Podczas ponownej oceny w konfiguracji najkorzystniejszej dla atakującego modelom nie udało się już zdobyć flagi. Perplexity przetestował następnie, bez udziału agentów, dziesięć zewnętrznych platform środowisk izolowanych: w ośmiu dało się obejść co najmniej jedno zabezpieczenie, w tym na platformach E2B, Vercel Sandbox, Modal Sandboxes i Daytona Sandbox, natomiast Cloudflare Sandbox i NVIDIA OpenShell oparły się próbom. Wszyscy dostawcy, powiadomieni 1 września, odpowiedzieli; do 10 września Daytona, Deno i microsandbox wprowadzili poprawki, a Vercel i Modal uznali to zachowanie za znane ograniczenie. Zapowiedziano drugą część raportu, poświęconą strategiom modeli, lecz nie podano daty jej publikacji.
Claude Code 2.1.281: możliwość wyłączenia informacji o autorstwie i zaostrzenie trybu auto
23 września — Wydana o 19:19 UTC, dzień po wersji 2.1.280, aktualizacja Claude Code 2.1.281 zawiera 176 pozycji, w tym 112 poprawek. Dwie zmiany są odczuwalne na co dzień: ustawienie "attribution": false w settings.json usuwa wszelkie informacje o autorstwie z commitów i pull requestów, a natychmiastowe wysłanie wiadomości (ctrl+enter) przenosi działające narzędzia w tło zamiast anulować bieżącą turę.
Tryb auto staje się bardziej restrykcyjny: gdy przegląd przez klasyfikator odbywa się po stronie serwera, nawet polecenia shell służące wyłącznie do odczytu czekają na jego werdykt. Warto odnotować poprawkę bezpieczeństwa: rekurencyjne rm wymierzone w podstawienie polecenia, takie jak rm -rf "$(pwd)", wykonywało się bez potwierdzenia w trybie auto i przy użyciu --dangerously-skip-permissions; teraz wymaga potwierdzenia nawet wtedy, gdy obowiązuje reguła zezwalająca na Bash. Aby nie blokować sesji bez nadzoru, monit dotyczący niebezpiecznego rm czeka dwie minuty, po czym odrzuca polecenie i sugeruje jego przepisanie.
Zmiana niezgodna wstecznie dla runnerów utrzymywanych we własnej infrastrukturze: skrypty pośredniczące (wrappers) lub hooki, które dodają --system-prompt, muszą przejść na --system-prompt-file. Administratorzy mogą korzystać z bramy Claude apps, aby wywoływać Amazon Bedrock z rolą IAM uzyskaną przez STS (assume_role), w razie potrzeby w innym koncie AWS, oraz stosować zabezpieczenie Bedrock przy każdym żądaniu.
Produkty Anthropic: szybsze claude.ai i szerszy Marketplace
Dwa ogłoszenia produktowe Anthropic, opublikowane tego samego dnia, uzupełniają wiadomości ze świata badań.
claude.ai trzy razy szybsze w ciągu dwóch tygodni
23 września — Na claude.dev troje inżynierów Anthropic opisuje dwutygodniowy sprint przeprowadzony w sierpniu, dzięki któremu claude.ai i aplikacja komputerowa stały się około trzy razy szybsze. Cała praca toczyła się na jednym kanale Slack, z udziałem Claude Tag (beta), opartego na wewnętrznym modelu badawczym „mniej więcej porównywalnym z Opus 5.5”: Claude wykrywał wąskie gardła, tworzył benchmarki, proponował poprawki i monitorował wdrożenia, a ludzie wyznaczali cele i zatwierdzali każdą zmianę. Rezultat: ponad 3 000 scalonych zmian, bez incydentów widocznych dla klientów i bez cofania wdrożeń.
| Mierzona operacja (75. percentyl) | Przed sprintem | Po sprincie |
|---|---|---|
| Strona claude.ai gotowa do pisania | 3,1 s | 0,55 s |
| Nowa sesja Claude Code (komputer) | 0,8 s | 0,3 s |
| Sesja w chmurze Claude Cowork (komputer) | 2,6 s | 0,73 s |
| Średnia geometryczna z 13 pomiarów | – | 3,1x szybciej |
Metoda opiera się na jednej idei: gdy Claude ma konkretny wynik do pobicia, może optymalizować. Zespół przekształcił więc deterministyczne pomiary w progi CI, które mogą tylko maleć. Część tych korzyści, w tym około cztery razy płynniejszy streaming, ogłoszono już 24 sierpnia.
🔗 Jak przyspieszyliśmy claude.ai trzykrotnie w dwa tygodnie
Claude Marketplace łączy konektory, agentów i integratorów
23 września — Anthropic rozszerza Claude Marketplace, uruchomiony w marcu w ograniczonej wersji wstępnej. Oferta obejmuje teraz trzy grupy: ponad 2 000 konektorów i pluginów (Atlassian, Google, Microsoft, Notion, Salesforce…), agentów i produktów opartych na Claude (CrowdStrike, Cursor, Harvey, Legora, Lovable, Snowflake), za które firmy mogą płacić z części swojego zobowiązania wydatkowego wobec Anthropic, oraz firmy doradcze należące do Claude Partner Network (Accenture, Boston Consulting Group, Deloitte). Dostawcy mają trzy drogi dołączenia: zbudować konektor lub plugin przy użyciu MCP i Agent Skills, zgłosić agenta lub produkt albo przystąpić do Partner Network. Towarzyszący wpis pokazuje mechanizm zakupowy: CodeRabbit sfinansował plan Vercel ze swojego budżetu objętego zobowiązaniem wobec Anthropic, a umowę zawarto w tydzień. Płatności w ramach tego zobowiązania pozostają dostępne w ograniczonej wersji wstępnej, po potwierdzeniu uprawnień.
ChatGPT: Voice zaczyna działać, fiszki i Privacy Center
Voice korzysta z pluginów i trafia do ChatGPT Work
23 września — OpenAI rozszerza ChatGPT Voice w dwóch kierunkach. Tryb głosowy Live może teraz podczas rozmowy w przeglądarce, na iOS i Androidzie korzystać z pluginów oraz aplikacji połączonych z kontem, takich jak poczta, kalendarz czy Slack. Voice trafia też do ChatGPT Work w przeglądarce i na urządzeniach mobilnych: można głosowo zlecić utworzenie dokumentu, prezentacji lub arkusza kalkulacyjnego, użycie połączonej aplikacji albo wykonanie zadania w przeglądarce, które po zakończeniu rozmowy można kontynuować pisemnie.
Jeśli chodzi o modele, wpis OpenAI na X podaje, że Voice może też korzystać z GPT-6 Astra, Sol i Luna; artykuł pomocy wyjaśnia natomiast, że Live działa na GPT-Live-1 lub GPT-Live-1 mini, zależnie od planu, bez szczegółów na temat roli modeli GPT-6. Użytkownicy planów Free i Go mają Voice w Chat wraz z pluginami dostępnymi w ich planie; Voice w Work wymaga dostępu do obu funkcji, a uruchomione w ten sposób zadania wliczają się do zwykłego wykorzystania Work. Live nie obsługuje wideo ani udostępniania ekranu. Globalne wdrożenie trwa od 23 września i obejmuje najnowszą wersję aplikacji.
🔗 Ogłoszenie OpenAI na X · Artykuł pomocy o ChatGPT Voice
Fiszki i centrum prywatności
22 września — ChatGPT potrafi teraz tworzyć interaktywne fiszki (flashcards) na podstawie tematu lub przesłanych notatek. Dotknięcie karty ją odwraca, po czym można zaznaczyć, czy znało się odpowiedź, czy trzeba do niej wrócić; kolejność kart można przetasować. Fiszki są automatycznie zapisywane w bibliotece. Funkcja jest dostępna na urządzeniach mobilnych i w przeglądarce we wszystkich planach, także bezpłatnym.
21 września — Warto nadrobić wcześniejszą wiadomość: na tej samej stronie informacji o wersjach dzień wcześniej zapowiedziano centrum prywatności (Privacy Center), wdrażane dla zalogowanych użytkowników planów Free, Go, Plus i Pro. W jednym miejscu zbiera ono informacje o prywatności rozmów, pamięci, personalizacji, wykorzystaniu danych, połączonych aplikacjach i bezpieczeństwie konta, wraz z bezpośrednimi odnośnikami do ustawień. W przeglądarce otwiera się je z menu konta (Help, następnie Privacy Center), a na urządzeniach mobilnych z ustawień.
🔗 Informacje o wersjach ChatGPT
Dwa nowe benchmarki: zdrowie psychiczne i obsługa inferencji
MentalHealthBench (OpenAI)
23 września — OpenAI publikuje MentalHealthBench, otwarty benchmark mierzący odpowiedzi modeli w realistycznych rozmowach dotyczących zdrowia psychicznego, od codziennych rozmów z elementem emocjonalnym po sytuacje kryzysowe. Powstał we współpracy z ponad 80 licencjonowanymi psychologami i psychiatrami z 22 krajów, posługującymi się 19 językami. Syntetyczne rozmowy przedstawiają cztery grupy: dorosłych, nastolatków w wieku od 13 do 17 lat, opiekunów i klinicystów. Dla każdej rozmowy eksperci napisali kryteria z wagami od -10 do +10; zachowano tylko te zatwierdzone przez co najmniej dwóch z trzech ekspertów, bez sprzeciwu trzeciego. Ocena jest automatyczna, z GPT-5.6 Sol w roli oceniającego, a wynik obejmuje dziesięć wymiarów, takich jak bezpieczeństwo, dopytywanie o kontekst czy poszanowanie autonomii użytkownika. OpenAI twierdzi, że modele regularnie robią postępy, zwłaszcza w dopytywaniu o kontekst, ale wyniki poszczególnych modeli przedstawiono wyłącznie na wykresach we wpisie. OpenAI przypomina, że ChatGPT nie zastępuje terapii ani profesjonalnej opieki.
🔗 Przedstawiamy MentalHealthBench
SWE-Serve (NVIDIA)
23 września — Zespół NVIDIA odpowiedzialny za dane i ocenę modeli Nemotron publikuje SWE-Serve, opracowany wraz z zespołem SGLang: 83 pull requesty rzeczywiście scalone z tym silnikiem obsługi inferencji przekształcono w 53 wykonalne zadania (dekodowanie spekulatywne, obsługa modeli, kernels, cache, API usługi). Główny wynik pokazuje różnicę między testami lokalnymi a działającą usługą: w 19 zadaniach uruchamiających prawdziwy serwer te same poprawki osiągają 69,4 % skuteczności bez testów działającej usługi, ale 45,9 % z pełnym zestawem weryfikacyjnym. Około jedna trzecia poprawek przechodzących pozostałe kontrole zawodzi więc po załadowaniu modelu i wysłaniu do niego zapytań.
| Oceniany model (maks. rozumowanie) | pass@1 w 3 próbach | Średni koszt zadania |
|---|---|---|
| Claude Opus 5 | 75 % | 17,40 dolara |
| GPT-5.6 Sol | 75 % | 12,26 dolara |
| Kimi K3 | 64 % | 7,24 dolara |
| GPT-5.6 Luna | 64 % | 0,95 dolara |
| DeepSeek V4 Flash (0731) | 55 % | 0,69 dolara |
Jedenaście modeli oceniono przy użyciu prostego agenta bez dostępu do internetu; tabela nie obejmuje Claude Opus 5.5, GPT-6 Sol i Luna, wydanych 22 września, ani GPT-6 Astra. Zadania i zestawy weryfikacyjne są publicznie dostępne.
🔗 Jak SWE-Serve ujawnia różnicę między testami lokalnymi a działającą usługą · Repozytorium GitHub
Generowanie wideo trafia do programów montażowych
Runway w DaVinci Resolve Studio
23 września — Dwa tygodnie po wydaniu pluginów do Premiere Pro i After Effects Runway trafia do DaVinci Resolve Studio, programu montażowego Blackmagic Design. Bezpłatny plugin na macOS i Windows otwiera się przez Workspace, a następnie Workflow Integrations. Można w nim generować obrazy i filmy na podstawie promptu, a potem jednym kliknięciem importować je do Media Pool i na oś czasu, bez używania przeglądarki. Funkcja Edit Studio działa na już zmontowanym ujęciu: panel eksportuje wybrany fragment, a Aleph 2.0 renderuje go ponownie w nowym stylu i z tą samą długością, na podstawie maksymalnie pięciu edytowanych klatek kluczowych. Wymagany jest DaVinci Resolve Studio 19 lub nowszy; generowanie jest dostępne we wszystkich płatnych planach Runway i zużywa posiadane kredyty, a koszt każdej operacji jest wyświetlany przed zatwierdzeniem.
🔗 Runway jest już w DaVinci Resolve
Bezpłatny Gemini Omni 1.1 Flash w Google Vids
23 września — Każda osoba z kontem Google lub Google Workspace może teraz bezpłatnie generować filmy za pomocą Gemini Omni 1.1 Flash w Google Vids, pod adresem vids.new na komputerze. Wersja 1.1 dodaje trzy polecenia: przedłużenie sceny z zachowaniem postaci, oświetlenia i scenerii, ustawienie dokładnej długości klipu tak, by pasował do narracji głosowej, oraz generowanie bezpośrednio w 1080p. Każdy klip zawiera znak wodny SynthID. Pełne wdrożenie rozpoczyna się 23 września i może potrwać od 1 do 3 dni; płatne plany pozwalają generować więcej materiałów, ale nie podano konkretnych limitów. Google zapowiada, że wkrótce do Vids trafi narracja tworzona przez Gemini 3.8 Flash-Lite TTS w ponad 100 językach.
Made On YouTube 2026: Gemini Omni przy montażu Shorts
23 września — Podczas corocznego wydarzenia Made On YouTube firma YouTube wprowadza Gemini Omni do konwersacyjnego asystenta montażu w Shorts i aplikacji YouTube Create: proste instrukcje tekstowe wystarczą, by wycinać fragmenty wypowiedzi, synchronizować muzykę, dodawać tekstowe zachęty do oglądania lub zmieniać kolejność ujęć. Transmisje na żywo zyskują automatyczny dubbing (Live auto-dubbing), YouTube Music otrzymuje Ask Music do układania kolejek odtwarzania przez rozmowę, a Podcast Lineup co tydzień dostarcza generowane przez AI mówione omówienia polecanych podcastów. Twórcy dostają również rozszerzone wykrywanie podobieństwa, które pomaga chronić ich głos i wizerunek. Termin podano tylko dla spersonalizowanych kanałów głównych (Custom Feeds): pojawią się tej jesieni dla widzów w USA; pozostałe funkcje nie mają jeszcze dokładnego harmonogramu.
🔗 Made On YouTube 2026 · Podsumowanie Google
Asystenci łączą się z kolejnymi aplikacjami
Gemini: nowa fala połączonych aplikacji
23 września — Google wdraża nową grupę aplikacji, które można połączyć z Gemini; konto @GeminiApp opisuje te integracje jako połączenia MCP. Wpis wymienia 14 nazw w trzech grupach: produktywność (Airtable, Linear, monday.com, PandaDoc, Wispr AI, Zoho), tworzenie treści (Adobe, Picsart, Squarespace, Webflow) i życie codzienne (apartments.com, Experian, Peloton, SeatGeek); wpis @GeminiApp na X mówi natomiast o 13 nowych aplikacjach. Usługi te można włączyć w ustawieniach lub wywołać podczas rozmowy, wpisując @. Podane przykłady to poprawienie oświetlenia zdjęcia za pomocą Adobe i sprawdzenie swojej oceny kredytowej przez Experian. Wpis nie określa, jakich krajów ani planów dotyczy wdrożenie.
🔗 Ogłoszenie Google · Ogłoszenie @GeminiApp
Muse, agent Meta: Shopify, PayPal, Expedia, Instacart, a następnie ElevenLabs i HeyGen
22 i 23 września — Muse, osobisty agent uruchomiony przez Meta 8 września, ogłosił w ciągu niespełna 24 godzin cztery konektory do usług handlowych. Według oficjalnego konta @Muse wszystkie będą dostępne „wkrótce”, bez podania daty, ceny ani krajów. 23 września dołączenie zapowiedziały także dwie firmy zajmujące się generatywnymi mediami: ElevenLabs, bez daty dostępności, oraz HeyGen, korzystający ze swojego serwera MCP.
| Zapowiedziana usługa | Zastosowanie opisane w ogłoszeniu | Ogłoszone przez | Zapowiedziana dostępność |
|---|---|---|---|
| Shopify | Płatność jednym ruchem w całym internecie | @Muse | Wkrótce |
| PayPal | Płatności obsługiwane przez agenta na całym świecie | @Muse | Wkrótce |
| Expedia | Rezerwacja hoteli | @Muse | Wkrótce |
| Instacart | Dostawa zakupów do domu | @Muse | Wkrótce |
| ElevenLabs | Narracja głosowa, ścieżki dźwiękowe i filmy | @ElevenLabs | Nie podano |
| HeyGen | Film z własnym awatarem i głosem, gotowy do publikacji | @HeyGen | Nie podano |
🔗 Cztery konektory zapowiedziane przez @Muse · ElevenLabs trafia do Muse · HeyGen dołącza do Muse
Grok Bot w samochodach Tesla oraz w Google Slides, Sheets i Docs
22 września — Tesla zapowiada wprowadzenie Grok Bot, agenta SpaceXAI, do swoich samochodów: dzięki Connectors Grok może obsługiwać skrzynkę pocztową, porządkować kalendarz lub wracać do istniejących plików, rozmów i zadań, podczas gdy kierowca trzyma ręce na kierownicy. Konto @grok udostępnia ogłoszenie tego samego wieczoru. Aktywacja wymaga trzech kroków: zalogowania się do aplikacji Grok w samochodzie, dodania Connectors w aplikacji mobilnej lub witrynie Grok, a następnie wykupienia SuperGrok, niezbędnego do korzystania z Grok Bot. W komunikatach nie określono modeli samochodów ani krajów objętych wdrożeniem.
Tego samego dnia konto @bot ogłasza, że Grok Bot łączy się natywnie z Google Slides, Sheets i Docs, lepiej obsługuje załączniki do e-maili (odczyt i dodawanie plików) oraz może kierować ruch podczas przeglądania internetu przez sieć użytkownika. SpaceXAI zapowiada też szybsze wykonywanie zadań i sprawniejszą aplikację komputerową, nie podając danych liczbowych.
🔗 Wpis udostępniony przez @grok · Ogłoszenie Tesli · Wątek Grok Bot
Antigravity: agenci działający lokalnie i polecenie /plan
SDK uruchamia swoich agentów lokalnie z Gemma 4 26B
23 września — SDK Antigravity, który udostępnia z poziomu Pythona funkcje agentowe Google Antigravity, obsługuje teraz przepływy pracy działające w całości lokalnie. Początkowa obsługa obejmuje Gemma 4 26B A4B uruchamiany przez LiteRT (Google AI Edge) na komputerze z ponad 24 GB VRAM lub pamięci zunifikowanej; LocalOpenAIAgentConfig łączy się z dowolnym serwerem zgodnym z OpenAI, takim jak Ollama, LM Studio czy vLLM. Google wskazuje na brak kosztów API i limitów przepustowości, kod pozostający na komputerze oraz hybrydowe przepływy pracy. W pokazanym przykładzie Gemini 3.8 Flash planuje w chmurze audyt trzech podatnych modułów, zużywając 95 tokenów i nie widząc kodu, podczas gdy lokalne instancje Gemma 4 26B odtwarzają luki, piszą poprawki i sprawdzają ich działanie; 97,2% tokenów (3 322) pozostaje lokalnie. Nowości pojawiły się w SDK 0.1.18 z 21 września, który usuwa również narzędzie do zadawania interaktywnych pytań ASK_QUESTION z domyślnego zestawu narzędzi, aby agenci mogli działać samodzielnie.
🔗 Ogłoszenie Google Developers
Antigravity 2.16.0 i 2.17.0, CLI 1.2.8 i 1.2.9
22 września — Aplikacja Antigravity wydaje tego samego dnia dwie wersje. Wersja 2.17.0 wprowadza polecenie /plan: agent przygotowuje plan, który można przejrzeć i zmienić, zanim napisze choćby jedną linię kodu. Ustawienie Plan Review Policy ma trzy tryby: przegląd każdego planu, pozostawienie decyzji agentowi lub pominięcie przeglądu. Wersja ta przeznacza też na reguły budżet 20 000 tokenów i odczytuje konfigurację dla poszczególnych repozytoriów z .gemini/config.json; wcześniejszy .agents/settings.json nie jest już uwzględniany. Wersja 2.16.0 umożliwia połączenie z dystrybucją WSL, dołączanie do promptu dokumentów Word, Excel i PowerPoint przez przeciągnięcie oraz wyświetla podagentów na kartach aktualizowanych na żywo.
| Wersja aplikacji | Liczba usprawnień | Liczba poprawek | Główna nowość |
|---|---|---|---|
| 2.16.0 | 12 | 15 | WSL, załączniki Office, karty podagentów |
| 2.17.0 | 11 | 10 | /plan, budżet 20 000 tokenów na reguły |
22 i 23 września — W terminalu CLI 1.2.9 dodaje składnię @ do pisania bezpośrednio do podagenta i zwiększa niezawodność trybu headless: zadania w tle mogą być oczekiwane przez maksymalnie 30 minut, zamiast być anulowane kilka sekund po tym, jak agent przestanie być aktywny. Wersja 1.2.8 zmienia kompakcję kontekstu i ogranicza czas dyktowania głosowego do 3 min 30 s.
Google DeepMind: szyfrowana pamięć trwała dla Private AI Compute
23 września — Google DeepMind opisuje, jak zamierza wyposażyć Private AI Compute, swoją platformę przetwarzania w sprzętowo izolowanych enklawach chmurowych, w pamięć trwałą. Dotąd platforma była „bezstanowa”: cały kontekst znikał po zakończeniu zadania. Nowa warstwa działa jak szyfrowany sejf w chmurze, którego klucze pozostają wyłącznie na urządzeniach użytkownika. Według Google sprawia to, że nikt, łącznie z samym Google, nie ma dostępu do danych. Gdy model potrzebuje informacji, bezpieczna enklawa tymczasowo odszyfrowuje dane w izolowanej pamięci, przetwarza żądanie, zapisuje nowy kontekst i natychmiast ponownie go szyfruje. Podany przykład to odnalezienie na komputerze instrukcji montażu przeglądanych wcześniej za pomocą inteligentnych okularów.
To zapowiedź architektury sformułowana w czasie przyszłym, bez daty udostępnienia ani nazwy produktu. Aby uzasadnić zaufanie do rozwiązania, Google publikuje zaktualizowaną białą księgę, publiczny rejestr swojego oprogramowania serwerowego odporny na manipulacje, który urządzenia będą mogły sprawdzić przed wysłaniem danych osobowych, oraz wyniki niezależnego audytu przeprowadzonego przez firmę, której nazwy nie podaje.
Qwen: agenci dla smartfonów i tańsze audio
Qwen Intelligence: trzech agentów dla producentów telefonów
23 września — Qwen wprowadza Qwen Intelligence, ofertę agentów dla smartfonów skierowaną przede wszystkim do producentów telefonów. Moduły (planowanie, wykonywanie zadań, obraz, pamięć) można łączyć według potrzeb, a mechanizm routingu dzieli obliczenia między urządzenie a chmurę. Na start dostępni są trzej agenci: Mobile Planner planuje złożone zadania, Mobile-Use je wykonuje, korzystając najpierw z API, a w razie potrzeby z interfejsu graficznego (82,1 w MobileWorld, 97,2 w AndroidDaily, 90% skuteczności od początku do końca według Qwen), natomiast Mobile Creative generuje obraz w 3 sekundy. Qwen udostępnia cztery benchmarki, ale nie udostępnia wag ani kodu agentów. Opłaty za Mobile-Use i Mobile Creative są już naliczane według użycia, a uruchomienie rozliczeń za Mobile Planner zapowiedziano „wkrótce”.
| Oceniany model lub system (według Qwen) | Wynik ogólny MobilePA-Bench |
|---|---|
| Qwen-Planner-Agent 27B | 77,05 % |
| GPT-6 Astra | 76,84 % |
| Claude Opus 5 | 75,71 % |
| Claude Fable 5 | 74,53 % |
| GLM 5.3 | 73,88 % |
🔗 Ogłoszenie Qwen na X · Raport Qwen-Planner-Agent
Qwen-Audio-3.1: nawet o 95% taniej
23 września — Qwen-Audio-3.1 aktualizuje trzy modele audio Qwen: rozpoznawanie mowy (ASR), syntezę mowy (TTS) i rozmowę w czasie rzeczywistym (Realtime). Dodaje też dwa kolejne: TTS-Next, który w jednym przebiegu generuje głos, efekty i dźwięk tła, oraz ASR-Next, który rozróżnia mówców, dodaje znaczniki czasu do transkrypcji i rozpoznaje emocje oraz dźwięki otoczenia. Realtime jednocześnie słucha i mówi, a jego wypowiedź można przerwać. W QwenCloud qwen-audio-3.1-realtime-plus kosztuje 6,4 dolara za milion wejściowych tokenów audio i 24 dolary za milion wyjściowych tokenów tekstu i audio, przy kontekście 262K tokenów; ASR dla plików kosztuje 0,15 dolara za milion tokenów wejściowych. Udostępniono tylko te dwa API, pozostałe zapowiedziano „wkrótce”.
| Rodzina modeli | Zapowiedziana obniżka cen |
|---|---|
| TTS | około 70 % |
| Realtime | około 85 % |
| ASR | do 95 % |
🔗 Ogłoszenie Qwen-Audio-3.1 na X · Qwen-Audio-3.1-Realtime w QwenCloud
Mistral Vibe: połączenie Chat i Work, ściślejsze uprawnienia w CLI
Połączenie Chat i Work, baza wiedzy w wersji zapoznawczej
22 września — Mistral publikuje cztery informacje o wydaniach Vibe, swojego asystenta (wcześniej Le Chat), bez osobnego wpisu ani posta na X. Najważniejsza zmiana łączy Chat i Work w jedno środowisko: pytanie zadaje się lub zadanie uruchamia w tym samym miejscu, przełącznik Fast / Think zastępuje zmianę trybu, a Skills zastępują Chat Agents, przy czym Deep Research staje się jedną z nich. Migracja kont Free, Pro i Teams rozpoczęła się 14 września; firmy dołączą od 1 października, w okresie około sześciu miesięcy. Agentowa baza wiedzy (Agentic Knowledge Base), dostępna w publicznej wersji zapoznawczej, zastępuje nieprzejrzystą pamięć stronami, które można przeglądać i edytować, oraz wskazuje źródło każdego przywołanego faktu. Mini App Canvas generuje z promptu małe aplikacje React, które można udostępniać, a arkusze Excel lub CSV trafiają do Vibe Work w płatnych planach.
🔗 Informacje o wydaniach Mistral
Vibe CLI 2.25.8 usuwa sposoby obchodzenia uprawnień
23 września — Vibe CLI 2.25.8 zawiera 5 nowości i 38 poprawek, w tym kilka dotyczących bezpieczeństwa uprawnień. Lista dozwolonych ścieżek względnych nie zezwala już na dostęp do pliku tylko dlatego, że jego ścieżka kończy się tym samym fragmentem. Symbole wieloznaczne w poleceniach shell nie pozwalają już ominąć sprawdzania ścieżek poza katalogiem roboczym, a uprawnienie przyznane katalogowi nadrzędnemu nie obejmuje już automatycznie jego podkatalogów, więc niektóre prośby o zatwierdzenie mogą pojawić się ponownie. Informacje o wydaniu po raz pierwszy wspominają też o „Rust CLI”, którego dotyczy 18 pozycji; pozwala on między innymi konfigurować zdalne projekty Vibe Code. W środowiskach firmowych konfiguracja narzucona przez organizację obowiązuje już od otwarcia sesji Unified Harness. Poprawiono też logowanie OAuth do serwerów MCP, które wydają sekret klienta, takich jak Supabase.
🔗 Informacje o wydaniu Vibe CLI 2.25.8
Otwarci agenci programistyczni dostępni z wiersza poleceń
ZCode staje się open source po problemach z bezpieczeństwem
21 września — Uzupełnienie: Z.ai udostępniło kod ZCode, swojego środowiska dla agentów programistycznych przedstawianego jako oficjalne narzędzie GLM-5.3, w odpowiedzi na problemy z bezpieczeństwem zgłoszone przez społeczność. Konto @zcode_ai informuje, że niezbędne poprawki zostały ukończone, i przeprasza. Repozytorium zai-org/ZCode na licencji Apache-2.0 zawiera klientów, usługi backendowe, CLI i środowisko uruchomieniowe agenta; 23 września miało około 6 500 gwiazdek.
With respect to the code data referenced by the community, we confirm that no such data is retained and that it has never been used for model training.
🇵🇱 W odniesieniu do danych kodu, o których mówiła społeczność, potwierdzamy, że żadne z tych danych nie są przechowywane i nigdy nie posłużyły do trenowania modeli. — @zcode_ai na X
Według ZCode sytuację oceniły następnie dwie organizacje: CAICT stwierdził, że bucket Alibaba Cloud OSS „zcode-prod” nie zawiera już danych, a NSFOCUS potwierdził, że usunięto zarówno jego obiekty, jak i sam bucket. Obie organizacje odnotowały, że klient v3.14.0 zawiera poprawkę, funkcja Repo Wiki została usunięta, a mechanizm przesyłający migawki lokalnych repozytoriów jest wyłączony. Z.ai zapowiada stały program zgłaszania luk z nagrodami i obiecuje opublikować pełny raport z oceny.
🔗 Kod źródłowy ZCode na GitHub
Kimi Code 2.1.0 wzmacnia zabezpieczenia
23 września — Moonshot wydaje Kimi Code 2.1.0 (2 nowości, 18 poprawek). Widoczną nowością jest eksperymentalny układ pełnoekranowy, wybierany w /settings i włączany po ponownym uruchomieniu. Kilka poprawek wzmacnia bezpieczeństwo: narzędzia do obsługi plików nie mogą już wychodzić poza katalog roboczy przez dowiązania symboliczne, lokalna konfiguracja projektu jest stosowana dopiero po zatwierdzeniu obszaru roboczego, konfiguracja git repozytorium nie może już uruchamiać poleceń podczas operacji git w tle, a dodatkowe katalogi wskazujące na katalog domowy lub katalog główny są odrzucane. OAuth dla serwerów MCP żąda teraz dostępu offline, co eliminuje konieczność ponownej autoryzacji co godzinę. Jednocześnie Moonshot zarchiwizował wcześniejszy Kimi CLI napisany w Pythonie (11 424 gwiazdki), którego wersje 1.51.0 i 1.52.0 odsyłają do Kimi Code.
🔗 Informacje o wydaniu Kimi Code 2.1.0
DeepSeek Harness 0.1.7-rc.1 w wersji zapoznawczej
23 września — DeepSeek wydaje v0.1.7-rc.1 DeepSeek Harness, swojego otwartego środowiska dla agentów na licencji MIT, zaprezentowanego 13 sierpnia. To wersja kandydująca (release candidate): od sierpnia w repozytorium pojawiło się 21 wersji zapoznawczych, ale dotąd nie było żadnej stabilnej wersji. Najważniejsze nowości są eksperymentalne: tryb Computer Use, który pozwala agentowi obsługiwać lokalny komputer i robić zrzuty ekranu (przez Cua Driver MCP lub natywny sterownik), oraz trzy backendy do sterowania przeglądarką (Playwright MCP, Chrome DevTools MCP, Stagehand). Interfejs webowy zyskuje wbudowane terminale i przegląd zmian z diffami, tryb headless odczytuje zadania ze standardowego wejścia i emituje zdarzenia w JSON, a agent może pracować w zdalnym środowisku przez SSH. Trzeba przygotować się na migracje: oficjalny adapter DeepSeek korzysta wyłącznie z Messages API, backendy wykonawcze E2B zostają usunięte, a eksperymentalny tryb zespołowy zwiększa liczbę współpracujących agentów z 8 do 16.
🔗 DeepSeek Harness v0.1.7-rc.1
GenCode, agent programistyczny Genspark
23 września — Genspark wprowadza GenCode, agenta programistycznego zintegrowanego ze swoją Super App, dostępnego na macOS, Windows i Linux oraz z wiersza poleceń. Głównym atutem jest wybór modelu dla każdego zadania — Claude, GPT, DeepSeek lub modelu o otwartych wagach — z jednego konta i bez konfigurowania klucza API; Genspark zapowiada modele otwarte za „od 1/10 do 1/20 kosztu”. GenCode w jednym kroku przejmuje instrukcje, reguły i pamięć przygotowane dla Claude Code. README pakietu npm @genspark/gencode wyjaśnia jego pochodzenie: wywodzi się z opencode, agenta programistycznego open source, ale pozostaje własnościowym produktem niezwiązanym z tym projektem, który celowo współdzieli katalog .opencode/ w repozytoriach. Koszt jest wyświetlany w kredytach Genspark na każdym etapie.
🔗 GenCode · Ogłoszenie Genspark na X
GitHub Copilot: wspomagane zatwierdzanie i lokalna piaskownica
Copilot dla JetBrains 1.18.0
22 września — Wersja 1.18.0 Copilot dla IDE JetBrains wprowadza w publicznej wersji zapoznawczej wspomagane zatwierdzanie (assisted approvals): w sesjach agenta wywołania narzędzi uznane za mało ryzykowne są zatwierdzane automatycznie, a działania o większym ryzyku nadal wymagają decyzji. Można też ponownie edytować wcześniejszą wiadomość: Copilot cofa wtedy rozmowę i zmiany w plikach przed wysłaniem nowej instrukcji. Agent Codex dostępny w Copilot dla JetBrains zyskuje tryb planowania, w którym można przejrzeć, dopracować lub zatwierdzić sposób działania przed wprowadzeniem zmian. Sesje obsługują też skills oraz instrukcje organizacyjne i firmowe. Wbudowany serwer MCP GitHub, domyślnie aktywny, można teraz wyłączyć. Użytkownicy IDE JetBrains 2025.1 otrzymają powiadomienie zachęcające do przejścia na wersję 2026.1 lub nowszą.
🔗 Nowości w Copilot dla JetBrains
Aplikacja Copilot izoluje swoje sesje lokalne
23 września — Aplikacja GitHub Copilot, program komputerowy GitHub przeznaczony dla jego agentów, otrzymuje lokalną piaskownicę w publicznej wersji zapoznawczej. Konfigurowana osobno dla każdego projektu ogranicza zasoby dostępne dla poleceń w sesji lokalnej: system plików (katalogi z prawem odczytu i zapisu, tylko do odczytu lub niedostępne), sieć (połączenia wychodzące z internetem i siecią lokalną) oraz dane uwierzytelniające (Git przez HTTPS, GitHub CLI). Ustawienia zarządzane przez firmę mogą zaostrzyć te zasady. Jeśli system operacyjny nie potrafi zastosować żądanych zasad, shell piaskownicy kończy działanie z błędem zamiast uruchamiać się bez ochrony. Piaskownica jest domyślnie wyłączona; można ją włączyć dla nowych sesji projektu albo za pomocą /sandbox on dla trwającej sesji. Nie obejmuje sesji chmurowych ani zdalnych hostów, a jej ustawienia są niezależne od ustawień Copilot CLI.
🔗 Lokalna piaskownica w aplikacji GitHub Copilot
Cursor: dwa boty do wdrożeń produkcyjnych, o 7% mniej tokenów
Rollouts i Security Review
23 września — Cursor wprowadza dwa boty przeznaczone do ostatniego etapu dostarczania kodu, dostępne w planach Teams i Enterprise. Po otwarciu każdego pull requestu Rollouts publikuje plan monitorowania (ryzyka, oczekiwany efekt, sygnały do sprawdzenia), a po każdym wdrożeniu porównuje go z logami, metrykami i śladami oraz wydaje ocenę dla każdego środowiska: działa prawidłowo, wykryto regresję albo wynik jest nierozstrzygający. W razie regresji wskazuje podejrzaną zmianę i może otworzyć PR cofający ją do zatwierdzenia; sam niczego nie scala ani nie cofa. Security Review sprawdza każdy pull request i zgłasza luki możliwe do wykorzystania (iniekcje, obejścia uwierzytelniania, sekrety pozostawione w kodzie, SSRF…), podając dla każdej wagę, sposób ataku i proponowaną poprawkę. Przez 10 dni kredyty próbne pozwalają przetestować Rollouts na około 50 zmianach w Teams i 500 w Enterprise.
O 7 % niższy koszt w tokenach bez utraty jakości
23 września — Cursor opisuje, jak obniżył o 7 % koszt działania swojego agenta liczony w tokenach, bez pogorszenia jakości. Ponieważ nowsze modele nie potrzebują już długich list zakazów, prompt systemowy skrócono o około 66 %; cięcia potwierdzono testami A/B na rzeczywistym ruchu. Wbudowane narzędzia, z których większość jest używana w mniej niż 20 % rozmów, są teraz ładowane na żądanie.
| Sposób optymalizacji | Efekt zmierzony przez Cursor |
|---|---|
| Skrócony prompt systemowy | usunięto około 66 % promptu |
| Wbudowane narzędzia ładowane na żądanie | o 60 % mniej tokenów opisujących narzędzia w kontekście statycznym |
| Jawne punkty kontrolne cache | o 20 % mniej nieudanych trafień przy zimnym cache |
| Numer wiersza co dziesięć wierszy | o 1,6 % mniej tokenów odczytywanych z cache |
| Wszystkie zmiany łącznie | o 7 % niższy koszt w tokenach dla użytkowników |
NVIDIA: otwarta diarizacja i AI Day Singapore
Nemotron 3 Diarization rozróżnia do ośmiu rozmówców
23 września — NVIDIA publikuje na Hugging Face Nemotron 3 Diarization, model o otwartych wagach i 100 milionach parametrów, który ustala, kto i kiedy mówi w rozmowie, także gdy głosy się nakładają. Śledzi do ośmiu rozmówców, podczas gdy jego poprzednik Streaming Sortformer śledził czterech, i działa zarówno na nagraniach, jak i na strumieniu na żywo, z regulowanym opóźnieniem bufora od 30,4 do 0,32 sekundy. Nie transkrybuje słów: podaje przedziały czasowe dla poszczególnych rozmówców, które można połączyć z modelem transkrypcji. Według pierwszych wyników Diarization-Bench od VoiceArena zajmuje pierwsze miejsce wśród 12 systemów, z błędem diarizacji 14,72 % wobec 19,3 % u kolejnego systemu; jak zaznacza NVIDIA, ten wstępny ranking może się jeszcze zmienić. W porównaniu z poprzednim modelem błąd spada średnio o 41 % w ośmiu zestawach ewaluacyjnych, przy niewielkim pogorszeniu wyników dla rozmów dwóch osób w CALLHOME. Licencja OpenMDW 1.1.
| Opublikowany pomiar | Nemotron 3 Diarization | Poprzedni model |
|---|---|---|
| Maksymalna liczba śledzonych rozmówców | 8 | 4 |
| Przepustowość przy 30,4 s (partie po 32, RTX PRO 5000) | 15 113 razy szybciej niż czas rzeczywisty | 2 619 razy |
| Błąd DIHARD III przy 30,4 s | 12,73 % | 19,09 % |
🔗 Nemotron 3 Diarization na blogu Hugging Face
AI Day Singapore: Vera Rubin i Nemotron w Azji Południowo-Wschodniej
22 września — We wpisie opublikowanym 22 września o 19:30 czasu PT, podczas AI Day Singapore (22 i 23 września), NVIDIA przedstawia Sea Limited, spółkę macierzystą Shopee, Garena i Monee, jako pierwszą firmę w regionie ASEAN, która wdroży jej platformę Vera Rubin do opracowywania i wdrażania modeli oraz agentów na większą skalę. Pozostała część wpisu pokazuje lokalne zastosowania otwartych modeli Nemotron: AI Singapore rozszerza o modele Nemotron rodzinę SEA-LION, przeznaczoną do obsługi języków regionu; w Wietnamie Viettel AI dostroił Nemotron 3 Super do języka wietnamskiego, osiągając najlepszy wynik w benchmarku VMLU; w Tajlandii iApp Technology dostosowała Nemotron 3 Nano do tajskiego prawa w postaci OpenThai 2.0 Legal, opublikowanego jako open source modelu, na którym działa prawny chatbot Thanoy używany przez około 43 000 osób.
🔗 Podczas AI Day Singapore NVIDIA i partnerzy prezentują postępy AI w Azji Południowo-Wschodniej
Wdrażanie AI do produkcji bez zakłóceń
Dwie zapowiedzi łączy ta sama idea: sprawdzenie działania pod rzeczywistym obciążeniem przed przekierowaniem ruchu lub aktualizacją maszyn.
Wdrożenia kanarkowe Together AI
22 września — Together AI opisuje stopniowe wdrożenia w usłudze Dedicated Model Inference, dostępne od aktualizacji z 15 września: pozwalają zmienić model obsługujący endpoint bez przerwy w działaniu i bez zmiany URL. Dostępne są trzy strategie: wdrożenie kanarkowe zwiększa udział nowego modelu etapami (domyślnie 5 %, 25 %, 50 %, a następnie 100 %), wdrożenie blue-green przekierowuje cały ruch naraz, a stopniowa wymiana zastępuje repliki pojedynczo. Po każdym etapie wdrożenia kanarkowego mechanizm kontrolny porównuje opóźnienie lub odsetek błędów z wynikami starego modelu i wstrzymuje wdrożenie, jeśli wyniki się pogarszają. W opublikowanej demonstracji przejście z Qwen2.5-7B na Qwen3.5-9B zatrzymano już przy 10 % ruchu z powodu wzrostu opóźnienia p95 o 137 % (1 740 ms wobec 734 ms); przywrócenie starego modelu odbyło się bez błędu w żadnym z 6 800 obsłużonych żądań.
🔗 Wdrożenia kanarkowe: aktualizacja modeli w środowisku produkcyjnym bez przestojów
NVCRE i NodeWright od NVIDIA
23 września — NVIDIA opisuje dwa projekty open source (Apache 2.0) w ramach DSX OS, warstwy oprogramowania swojej platformy fabryk AI, przeznaczone dla klastrów GPU działających pod Kubernetes. NVIDIA Cluster Readiness Engine (NVCRE) wychodzi z założenia, że klaster może przejść wszystkie kontrole stanu, a mimo to zawieść podczas trenowania rozproszonego. Dlatego sprawdza go przy rzeczywistych obciążeniach (testy komunikacji NCCL, diagnostyka DCGM, wstępne trenowanie NeMo) na grupach węzłów dobranych według topologii, wskazuje wadliwe węzły, a w trybie diagnostycznym dzieli niesprawne grupy na pół, aż wyodrębni podejrzane węzły. Wpis wymienia wśród tych obciążeń modele Nemotron 5 o 8 i 56 miliardach parametrów, bez dalszych szczegółów. NodeWright, wcześniej Skyhook i używany w środowisku produkcyjnym NVIDIA, aktualizuje system węzłów (ustawienia jądra, agenty bezpieczeństwa, poprawki luk), czekając na zakończenie chronionych zadań. Robi to falami o stałej, liniowej lub wykładniczej wielkości, które zatrzymują się automatycznie, jeśli zbyt wiele partii zakończy się niepowodzeniem.
🔗 Sprawdź gotowość klastra GPU przed uruchomieniem obciążeń AI · NodeWright
Dwa otwarte zbiory danych: rozmowy wielu osób i korpus naukowy
Basis Conversations 1500
23 września — Basis publikuje na Hugging Face Basis Conversations 1500: 1 502 godziny spontanicznych rozmów 2 645 osób z 33 krajów, prowadzonych w 22 językach, od angielskiego po megrelijski i xhosa. W każdej rozmowie uczestniczą od dwóch do czterech osób, a głos każdej z nich jest zapisany na osobnej, zsynchronizowanej ścieżce (FLAC 48 kHz). Pozwala to badać nakładanie się wypowiedzi, przerwania i kolejność zabierania głosu, z którymi według zespołu modele wciąż mają trudności. Około 100 godzin szczegółowo oznaczyli ludzie (113 096 ocen): wspierające lub poirytowane krótkie reakcje głosowe, niezręczną ciszę oraz współpracujące lub rywalizujące nakładanie się wypowiedzi. Dostarczone transkrypcje powstały automatycznie i nie powinny służyć jako dane docelowe do trenowania bez weryfikacji. Wpis przedstawia zbiór jako dostępny do użytku komercyjnego i badawczego, ale obowiązuje licencja Basis (basis-data-license-1.0), a dostęp wymaga ręcznego zatwierdzenia.
QVAC Genesis III
23 września — Tether AI Research publikuje QVAC Genesis III, trzecią część syntetycznego korpusu przeznaczonego do wstępnego trenowania małych modeli w naukach ścisłych, technice, inżynierii i matematyce. Po dodaniu 43,06 miliarda tokenów całość obejmuje 191,43 miliarda tokenów i około 160 milionów dokumentów z 19 dziedzin; towarzyszący jej artykuł przyjęto na konferencję COLM 2026. Metoda polega na zadawaniu pytań małemu modelowi uczniowskiemu Qwen3-1.7B-Base: błędna odpowiedź staje się podstawą wyjaśnienia korygującego, a poprawna — analizy każdej możliwej odpowiedzi. Model o 1,7 miliarda parametrów, trenowany od podstaw na tym korpusie, osiąga wyraźnie lepsze wyniki niż taki sam model trenowany na Cosmopedia-v2 przy jednakowym budżecie tokenów. Korpus opublikowano na licencji niekomercyjnej (CC-BY-NC 4.0), a dla wytrenowanego na nim modelu zapowiedziano licencję Apache 2.0.
| Oceniany benchmark | Przewaga nad Cosmopedia-v2 (jednakowy budżet tokenów) |
|---|---|
| ARC-Easy | +28,57 punktu |
| ARC-Challenge | +21,35 punktu |
| GPQA Diamond | +2,52 punktu |
| MMLU STEM | +15,03 punktu |
AI dla klimatu i produkcji żywności
Ai2 i Global Fishing Watch monitorują oceany za pomocą agentów
23 września — Podczas Climate Week w Nowym Jorku Ai2 i Global Fishing Watch ogłaszają partnerstwo, którego celem jest wykorzystanie AI, a zwłaszcza agentów, do monitorowania oceanów i kontroli rybołówstwa. Obie organizacje współpracowały już wcześniej; teraz przechodzą do wspólnego opracowywania rozwiązań: jednego pipeline’u wykrywania, nowych modeli wizyjnych analizujących obrazy satelitarne w czasie rzeczywistym oraz agentów zdolnych łączyć wiele źródeł danych. Global Fishing Watch zyska dostęp do OlmoEarth, platformy obserwacji Ziemi od Ai2 opartej na otwartych modelach, aby oznaczać swoje dane i trenować własne modele. Wykrycia statków w czasie rzeczywistym z Skylight trafią do portalu dla zarządców obszarów morskich, a oba zespoły będą rozwijać agentów takich jak Shippy, którego analityk może zapytać o historię statku. Ogłoszenie nie zawiera harmonogramu ani kwoty finansowania.
🔗 Ai2 i Global Fishing Watch łączą siły, by wykorzystać agentów AI do monitorowania oceanów
Google.org i Gates Foundation dla 200 milionów drobnych rolników
18 i 22 września — Przypomnienie: Google.org i Gates Foundation rozszerzają wspólną inicjatywę, aby udostępnić narzędzia AI dotyczące klimatu, rolnictwa i języków 200 milionom drobnych rolników w Afryce Subsaharyjskiej i Azji Południowej, zamiast pierwotnie planowanych 50 milionów. Obaj partnerzy przeznaczają na nią łącznie 100 milionów dolarów, przy wsparciu technicznym badaczy i inżynierów Google. Komunikat Gates Foundation pochodzi z 18 września; blog.google opisał go wieczorem 22 września. Program finansuje lokalne organizacje, takie jak Wadhwani AI i Digital Green w Indiach, włącza prognozy oparte na AI do platformy klimatycznej TomorrowNow, mapuje działki z rozdzielczością poniżej jednego metra i wspiera otwarte zbiory danych głosowych i tekstowych w ponad 40 językach afrykańskich. Drobni rolnicy produkują niemal 35 % żywności na świecie.
🔗 Ogłoszenie Google.org · Komunikat Gates Foundation
Krótkie wiadomości
- Anthropic: modernizacja kodu — W serii „Notes from the Field” dwoje inżynierów Anthropic oddelegowanych do klientów, Jonah Ezekiel i Lexie Tonelli, proponuje sześć etapów przygotowania modernizacji kodu prowadzonej przez agentów: określenie celu, „certyfikat” testów, etapowy przegląd przez ludzi, wymagania wstępne, przepływ pracy agentów, a następnie uruchomienie. Nie podają kosztów: radzą zmierzyć je w projekcie pilotażowym. 🔗 źródło
- Boris Cherny weryfikuje Claude Agent SDK w Lean — Wieczorem 22 września Boris Cherny (Claude Code) opisał, jak za pomocą Opus 5.5 i asystenta dowodzenia Lean formalnie zweryfikował Claude Agent SDK: kilka krótkich promptów zaowocowało 16 pull requestami naprawiającymi błędy i problemy związane z równoczesnym wykonywaniem operacji. Mówi, że używa również TLA+. 🔗 źródło
- Codex CLI 0.156.1 — Ta poprawka do wersji 0.156.0 dodaje GPT-6 Sol i GPT-6 Luna do listy wyboru modeli w CLI; komunikat wyświetlany po osiągnięciu limitu żądań zaleca teraz Luna, a użytkownikom GPT-5.5 i GPT-5.6 proponowana jest migracja. 🔗 źródło
- Airbnb i GPT-6 Astra — Nowa umowa rozszerza dostęp zespołów inżynieryjnych i produktowych Airbnb do modeli OpenAI, w tym GPT-6 Astra, przez API OpenAI i Amazon Bedrock. Dyrektor ds. technologii, Ahmad Al-Dahle, twierdzi, że jego zespoły dostarczają około 80% więcej funkcji niż rok temu; wartości umowy nie ujawniono. 🔗 źródło
- OpenAI Academy ma dwa lata — Od września 2024 roku zorganizowano ponad 250 wydarzeń, które dotarły do ponad 4 milionów osób. OpenAI testuje program trenerów społecznościowych (Community Trainer Program), w którym pracownicy organizacji partnerskich uczą się prowadzić warsztaty po przejściu oceny. 🔗 źródło
- Wyświetlacz LED zamieniony w asystenta głosowego — Na blogu OpenAI Developers Sid Rampally opisuje, jak Codex pomógł mu podłączyć i zaprogramować panel LED o rozdzielczości 128 × 64 pikseli, sterowany przez Raspberry Pi; GPT-Live-1 prowadzi rozmowę, a wyszukiwanie informacji i obsługę wyświetlacza przekazuje GPT-5.6 Luna przez Responses API. 🔗 źródło
- MedGemma przekracza 10 milionów pobrań — Google opisuje praktyczne zastosowania swoich otwartych modeli medycznych: badania przesiewowe raka szyjki macicy u ponad 3 500 kobiet w Zambii, projekty pilotażowe w szpitalu AIIMS w Delhi oraz wykrywanie gruźlicy w Indonezji. Google przypomina, że wyniki modeli nie powinny bezpośrednio służyć do stawiania diagnozy. 🔗 źródło
- Gemini Notebook w Google Docs — Po wpisaniu @ w Docs można wskazać notebook jako źródło: Gemini opiera tworzony tekst na zawartych w nim materiałach, dodaje cytowania w tekście i łączy je z e-mailami oraz plikami przez Workspace Intelligence. Funkcja jest dostępna w planach Business Standard i Plus, Enterprise Standard i Plus, Education Plus oraz dla subskrybentów Google AI Pro i Ultra. 🔗 źródło
- Sześć narzędzi Google Flow — Google Labs publikuje sześć narzędzi zbudowanych przez twórców za pomocą Google Flow Tools: Mondo Sónico (zsynchronizowane efekty dźwiękowe), CaptionCast (animowane napisy), ThumbnailForge (miniatury), Surface (tekstury na powierzchniach 3D), CollageMotion Pro i SwissFlow Studio (motion design); każde można skopiować i przerobić. 🔗 źródło
- Google Beam dostarczany we Francji — Beam, platforma komunikacji wideo Google, która ma odtwarzać wrażenie spotkania twarzą w twarz i jest sprzedawana we współpracy z HP, trafia już do sześciu krajów, w tym do Francji, za pośrednictwem 18 partnerów. Wewnętrzne badanie wskazuje, że zespoły czują się o 50% bardziej zintegrowane i odbywają o 21% mniej spotkań kontrolnych. 🔗 źródło
- Android Enterprise i agenci Gemini — Gemini może wykonywać zadania w różnych aplikacjach na podstawie kontekstu widocznego na ekranie, a zabezpieczenia uniemożliwiają osobistym agentom dostęp do profilu służbowego; administratorzy mogą ograniczyć lub wyłączyć automatyzację AI na wszystkich zarządzanych urządzeniach. 🔗 źródło
- AI Brief po francusku — Zamknięta wersja beta AI Brief, która pomaga prowadzić kampanie AI Max w Google Ads na podstawie opisu własnymi słowami, staje się dostępna po francusku, niderlandzku, niemiecku, włosku, japońsku, portugalsku i hiszpańsku. 🔗 źródło
- Gemini CLI: wydanie nightly z 23 września — To tylko wydanie nightly, a nie wersja stabilna: dodaje Gemini 3.8 Flash i Gemini 3.5 Flash Lite, dostępne od razu przez klucz API, Vertex AI lub bramę, a z kontem Google po włączeniu funkcji eksperymentalnych. We wtorek 22 września nie ukazała się żadna wersja stabilna. 🔗 źródło
- EcoHash mierzy efekty optymalizacji wideo — Na karcie RTX PRO 6000 z 96 GB pamięci EcoHash skraca czas generowania wideo przez MiniMax H3 ze 174,8 do 40,8 sekundy, a wideo z tekstu przez Wan2.2 ze 132,3 do 10,7 sekundy, wykorzystując LoRA poddaną destylacji do 4 kroków; trzy z dziesięciu wypróbowanych ustawień, w tym oba tryby kompilacji, niczego nie zmieniły. 🔗 źródło
- Tatar krymski: uniknięto zafałszowanego testu — Twórca modelu rozpoznawania mowy dla języka krymskotatarskiego odkrył, że cztery audiobooki znalazły się w jego korpusie dwukrotnie: 96,9% fragmentów głównego zbioru testowego miało odpowiednik w danych treningowych. Po poprawieniu zbioru, dostrojeniu modelu przez LoRA i zmianie ustawień dekodera współczynnik błędnie rozpoznanych słów spadł z 0,3463 do 0,1701. 🔗 źródło
- Falcon-H1 i mlx-lm — W mlx-lm 0.31.3, bez cache KV, podczas treningu wykonywana jest tylko pierwsza z 66 warstw Falcon-H1: każda LoRA trenuje się bez błędu ani ostrzeżenia na modelu jednowarstwowym. Poprawka zajmuje jedną linię, a zgłoszenie problemu jest już otwarte. 🔗 źródło
- Agenci i wkład w open source — Quentin Gallouédec (Hugging Face) uważa, że wkład tworzony przez agentów zaciera sygnał rzeczywistej potrzeby i pochłania czas opiekunów projektów na przegląd; apeluje, by przestać wysyłać agentów do losowych projektów i zacząć od korzystania z danego projektu. 🔗 źródło
- Phionyx w IETF — Autor Phionyx zgłasza indywidualny projekt dokumentu Claim-Preserving Exchange of AI Evaluation Evidence, którego celem jest zachowanie warunków i ograniczeń wyniku ewaluacji przy przenoszeniu go między systemami; żadna grupa robocza nie przyjęła tego tekstu. 🔗 źródło
- Kimi Work 3.2.12 — Agent biurowy Moonshot pozwala zaznaczyć fragment pliku PPT, Excel, Word lub Markdown i zlecić jego precyzyjną zmianę; znika limit rozmiaru załączników. 🔗 źródło
- Qwen-Image-2.1 na czele otwartych modeli — Według Arena Qwen-Image-2.1 staje się najlepszym otwartym modelem zarówno w edycji obrazów (1 367 punktów, 16. miejsce w klasyfikacji ogólnej), jak i w generowaniu obrazów z tekstu (1 228 punktów, 17. miejsce w klasyfikacji ogólnej). 🔗 źródło
- OpenTelemetry w aplikacji Copilot — Administratorzy mogą eksportować ślady sesji agentów z aplikacji GitHub Copilot (żądania do modeli, użyte narzędzia) do swoich narzędzi monitorujących przez właściwość
telemetrywmanaged-settings.json; treść promptów i odpowiedzi jest domyślnie wyłączona. 🔗 źródło - Copilot CLI i C++ — Microsoft C++ Language Server w Copilot CLI tworzy teraz trwały indeks symboli z całego projektu, domyślnie włączony; pierwsze tworzenie indeksu może trwać długo i zużywać dużo pamięci, a GitHub nie podaje wielkości uzyskanego przyspieszenia. 🔗 źródło
- Pull request z milionem linii — We wpisie technicznym GitHub wyjaśnia, jak aplikacja Copilot wyświetla pull request obejmujący 2 200 plików, ponad milion linii i ponad 400 komentarzy: układ kodu oblicza z wyprzedzeniem, a położenie komentarzy mierzy w pobliżu widocznego obszaru. 🔗 źródło
- Genspark dodaje Opus 5.5, GPT-6 i Grok 4.7 — W nocy 23 września Genspark udostępnia Claude Opus 5.5, Grok 4.7, GPT-6 Sol i GPT-6 Luna w AI Chat, Code Agent i Claw, powtarzając argumenty dostawców modeli, bez podania planów ani cen. 🔗 źródło
- Badanie GitHub i Yale — Wśród 1 039 użytkowników GitHub w Stanach Zjednoczonych 71% deklaruje obawy o wpływ AI na środowisko, a osiem na dziesięć osób chce narzędzi do pisania kodu zużywającego mniej energii; GitHub zaznacza, że próba, złożona z osób, które zgodziły się otrzymywać jego komunikaty marketingowe, nie jest reprezentatywna. 🔗 źródło
- Zed 1.21.0 — Wersja stabilna udostępnia Claude Opus 5.5 oraz GPT-6 Astra, Sol i Luna z własnym kluczem API, dodaje logowanie przez SuperGrok w panelu Agent i domyślnie zapobiega usypianiu komputera podczas pracy agenta. 🔗 źródło
- Warp — GPT-6 Sol i Luna, a następnie Claude Opus 5.5, trafiają do terminala Warp i Warp Agent CLI; Grok 4.7 jest dostępny dla osób, które połączą swoją subskrypcję Grok. Ogłoszono jedynie dostępność, bez cen. 🔗 źródło
- Devin w Microsoft Teams — Devin, dotąd ograniczony do kanałów, odpowiada teraz także w wiadomościach bezpośrednich i czatach grupowych, uruchamia Automations z kanału oraz wysyła karty z pytaniem lub prośbą o zatwierdzenie; aplikacja nie wymaga żadnych nowych uprawnień. 🔗 źródło
- Scribe v2 Medical — Model transkrypcji klinicznej ElevenLabs, dostępny od 11 września, doczekał się oficjalnego ogłoszenia z nową daną: popełnia o 35% mniej błędów w rozpoznawaniu słów w nagraniach klinicznych niż Scribe v2. Cena zaczyna się od 0,22 dolara za godzinę. 🔗 źródło
- Sora 2 znika z ElevenLabs — ElevenLabs usuwa Sora 2 i Sora 2 Pro ze swojego studia, ponieważ OpenAI zamyka API Sora 24 września, zgodnie z terminem ogłoszonym przez OpenAI 24 marca; korzystające z nich procesy trzeba przenieść na inny model wideo, taki jak Gemini Omni 1.1 Flash. 🔗 źródło
- Cohere Model Vault w Kanadzie — Cohere ogłasza dostępność Model Vault, swojej dedykowanej platformy do inferencji dla jednego klienta, w Kanadzie, bez wskazania regionu chmurowego, dostawcy ani ceny; strona produktu nie wymienia jeszcze Kanady. 🔗 źródło
- Cohere i zarządzanie zmianą — We wpisie Katherine Correia (Cohere) zachęca, by traktować AI jak uczestnika pracy, klasyfikować zadania jako możliwe do sprawdzenia, wymagające oceny lub mieszane oraz ustalać zasady jej użycia dla poszczególnych zastosowań; nie przedstawia produktu ani danych liczbowych. 🔗 źródło
Co to oznacza
Wynik Anthropic przenosi agentów piszących kod w obszar biologii podstawowej. Około 950 agentów Claude przeanalizowało ponad 200 000 odwrotnych transkryptaz w 21 godzin, a ludzie włączyli się tylko na początku, formułując prompt, i na końcu, przeprowadzając eksperymenty. Wąskie gardło przesuwa się na wybór hipotez, który Anthropic bada teraz jako osobny problem badawczy. Ostrożność nadal jest konieczna: funkcja ART pozostaje nieznana, a wynik ma na razie postać preprintu. Ta sama metoda uruchamiania wielu agentów i wyznaczania im mierzalnych ram pojawia się w sprincie, który przyspieszył claude.ai i przyniósł ponad 3 000 zmian, oraz w formalnej weryfikacji Claude Agent SDK w Lean.
Bezpieczeństwo środowisk izolowanych dla agentów staje się przedmiotem publicznej dyskusji. Audyt Perplexity rozróżnia dwie granice: izolacja maszyny wirtualnej wytrzymała wszystkie 108 prób, natomiast filtrowanie sieciowe zawiodło 11 razy w 54 próbach przeciwko modelom, które wykorzystały niedostatecznie sprawdzany DNS lub współdzielone adresy CDN; w 8 z 10 platform firm trzecich występował co najmniej jeden sposób obejścia zabezpieczeń. Dwa modele, Fable i GPT-6 Astra, odmówiły udziału w teście. Tego samego dnia aplikacja GitHub Copilot udostępnia lokalne środowisko izolowane, które w razie problemu z ochroną przerywa działanie; tryb auto w Claude Code przekazuje klasyfikatorowi nawet polecenia służące wyłącznie do odczytu, a Vibe CLI i Kimi Code usuwają możliwości obejścia mechanizmów autoryzacji. Dwa dni wcześniej ZCode upublicznił swój kod po problemach zgłoszonych przez społeczność.
Głos staje się interfejsem do wykonywania działań. Gemini 3.8 Flash TTS i Flash-Lite TTS obniżają koszt generowania dźwięku ponad dwukrotnie względem poprzedniej wersji zapoznawczej (9 i 6 dolarów za milion tokenów do końca 2026 roku, wobec wcześniejszych 20 dolarów) i dodają odtwarzanie głosu wymagające zarejestrowanej zgody, niedostępne w Europejskim Obszarze Gospodarczym przez AI Studio. Qwen ogłasza obniżki cen od 70 do 95% w swojej ofercie audio, NVIDIA udostępnia model rozróżniający ośmiu mówców, a Basis publikuje 1 500 godzin rozmów z nakładającymi się głosami. Równocześnie ChatGPT Voice przechodzi od rozmowy do działania dzięki pluginom i zadaniom ChatGPT Work.
Otwiera się także obszar fizycznej AI, choć „otwartość” ma tu różne znaczenia. FLUX 3 Action zajmuje pierwsze miejsce w RoboLab-120 dzięki modelowi o 7 miliardach parametrów, trafia do LeRobot we współpracy z NVIDIA i pokazuje, że szybka, niezawodna polityka zmniejsza potrzebę kosztownego rozumowania: koszt jednego sukcesu wynosi 8,77 dolara z GPT-6 Astra jako modelem nadzorującym, wobec 13,47 dolara przy użyciu samego Astra. „Otwarty” oznacza jednak różne warunki: osobną licencję dla FLUX 3 Action i Basis Conversations 1500, licencję niekomercyjną dla QVAC Genesis III oraz opublikowane benchmarki bez wag modelu w przypadku Qwen Intelligence. Dla osób chcących ponownie wykorzystać te zasoby licencja jest równie ważna jak wynik.
Źródła
- Claude odkrywa nowy system enzymatyczny z powtórzeniami podobnymi do CRISPR (Anthropic)
- Preprint ART (PDF, Anthropic)
- @AnthropicAI: system enzymatyczny odkryty przez Claude
- Gemini 3.8 Flash TTS i Flash-Lite TTS (Google)
- Informacje o wersji Gemini API z 22 września
- Cennik Gemini API
- FLUX 3 Action (Black Forest Labs)
- @bfl_ai: premiera FLUX 3 Action
- Kolekcja FLUX 3 Action w Hugging Face
- Ucieczka z SPACE, część I (Perplexity)
- Claude Code v2.1.281
- Jak w dwa tygodnie trzykrotnie przyspieszyliśmy claude.ai (claude.dev)
- Claude Marketplace (Anthropic)
- @OpenAI: ChatGPT Voice z pluginami i w ChatGPT Work
- Artykuł pomocy dotyczący ChatGPT Voice
- Informacje o wersjach ChatGPT
- Przedstawiamy MentalHealthBench (OpenAI)
- SWE-Serve (NVIDIA)
- Repozytorium NVIDIA/swe-serve
- Runway jest już dostępny w DaVinci Resolve
- Gemini Omni 1.1 Flash w Google Vids
- Made On YouTube 2026
- Podsumowanie Made On YouTube 2026 (Google)
- Nowe aplikacje połączone z Gemini
- @GeminiApp: 13 nowych aplikacji połączonych z Gemini
- @Muse: wkrótce cztery nowe konektory
- @ElevenLabs: ElevenLabs pojawi się w Muse
- @HeyGen: HeyGen dołącza do Muse
- @grok: Grok Bot w samochodach Tesla
- @Tesla: Grok i Connectors
- @bot: Grok Bot połączony z Google Slides, Sheets i Docs
- Modele lokalne w SDK Antigravity (Google Developers)
- Lista zmian Antigravity
- Pamięć trwała dla Private AI Compute (Google DeepMind)
- @Alibaba_Qwen: Qwen Intelligence
- Raport Qwen-Planner-Agent
- @Alibaba_Qwen: Qwen-Audio-3.1
- Qwen-Audio-3.1-Realtime w QwenCloud
- Informacje o wersjach Mistral
- Vibe CLI 2.25.8
- @zcode_ai: udostępnienie kodu ZCode
- Repozytorium zai-org/ZCode
- Kimi Code 2.1.0
- DeepSeek Harness v0.1.7-rc.1
- GenCode (Genspark)
- @genspark_ai: premiera GenCode
- Copilot dla JetBrains 1.18.0 (lista zmian GitHub)
- Lokalny sandbox w aplikacji GitHub Copilot (lista zmian GitHub)
- Rollouts i Security Review (lista zmian Cursor)
- Większa efektywność wykorzystania tokenów (Cursor)
- Nemotron 3 Diarization (NVIDIA, blog Hugging Face)
- AI Day Singapore (NVIDIA)
- Wdrożenia kanarkowe (Together AI)
- NVIDIA Cluster Readiness Engine (NVIDIA)
- NodeWright (NVIDIA)
- Basis Conversations 1500 (blog Hugging Face)
- QVAC Genesis III (blog Hugging Face)
- Ai2 i Global Fishing Watch (Skylight)
- Google.org i Gates Foundation (blog.google)
- Komunikat Gates Foundation
- Jak przygotować się do projektów modernizacji kodu z wykorzystaniem AI (Anthropic)
- @bcherny: formalna weryfikacja Claude Agent SDK w Lean
- Codex CLI 0.156.1
- Airbnb i GPT-6 Astra (OpenAI)
- Dwa lata OpenAI Academy
- Jak ożywiłem swój wyświetlacz LED (OpenAI Developers)
- MedGemma a zdrowie na świecie (Google)
- Gemini Notebook w Google Docs (Workspace Updates)
- Sześć narzędzi Google Flow (Google Labs)
- Google Beam rozszerza działalność na sześć krajów (Google)
- Nowości w Android Enterprise 2026 (Google)
- AI Brief i AI Max (Google Ads)
- Gemini CLI v0.62.0-nightly.20260923
- Trzy z dziesięciu optymalizacji nic nie dały (EcoHash)
- Rozpoznawanie mowy w języku krymskotatarskim (blog Hugging Face)
- Dostrajanie Falcon-H1 na Macu (blog Hugging Face)
- Droga do piekła open source jest wybrukowana dobrymi intencjami (blog Hugging Face)
- Panel pokazuje PASS. Co dokładnie przeszło test? (Phionyx)
- Informacje o wersjach Kimi Work
- @arena: Qwen-Image-2.1 pierwszym modelem otwartym
- OpenTelemetry w aplikacji GitHub Copilot
- Analiza kodu C++ w Copilot CLI
- Wyświetlanie ogromnych pull requestów w aplikacji GitHub Copilot
- @genspark_ai: Claude Opus 5.5 w Genspark
- Badanie GitHub i Yale dotyczące efektywności tworzenia oprogramowania
- Zed 1.21.0
- @warpdotdev: GPT-6 Sol i Luna w Warp
- Devin, Microsoft Teams i Microsoft 365
- @ElevenLabs: Scribe v2 Medical
- Lista zmian ElevenLabs z 23 września
- @cohere: Model Vault w Kanadzie
- Zarządzanie zmianą związaną z AI (Cohere)