ai-powered-markdown-translatorArtykuł przetłumaczony z francuskiego na polski za pomocą gpt-5.6-sol.
W ten wtorek Google wprowadza Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking, dwa modele dialogu głosowego działające w czasie rzeczywistym, które potrafią wywoływać narzędzia w tle bez przerywania rozmowy. Anthropic publikuje trzy wersje Claude Code i wprowadza Salesforce do Claude, a OpenAI wyznacza 14 października jako datę wycofania GPT-5.5 z ChatGPT i Codex. Agenci trafiają również do istniejących kanałów dystrybucji — od HP, które preinstaluje Perplexity, po Devin sprzedawany w AWS Marketplace — a NVIDIA przedstawia szczegóły dwóch elementów swojej platformy Vera Rubin.
Gemini 3.8 Live i 3.8 Live Extended Thinking — dwa modele głosowe, które działają podczas rozmowy
15 września — Google wprowadza dwa modele dialogu głosowego działające w czasie rzeczywistym, zaprezentowane przez zespół Gemini Audio. Gemini 3.8 Live jest ukierunkowany na skalę, szybkość i koszt: przyjmuje dane wizualne niemal w czasie rzeczywistym i automatycznie przełącza się między 97 językami w toku rozmowy. Gemini 3.8 Live Extended Thinking jest przeznaczony do zadań wymagających wieloetapowego rozumowania: jednocześnie rozumuje i mówi, potwierdza przyjęcie polecenia krótkimi wstępami słownymi oraz informuje o postępach zadań wykonywanych w tle; poziom jego rozumowania można ustawić w API. Oba modele wykonują wywołania narzędzi i API w tle (asynchronous function calling), podczas gdy odpowiedź dźwiękowa jest kontynuowana.
The models talk, think, and handle tasks in the background without breaking your flow.
🇵🇱 Modele mówią, rozumują i wykonują zadania w tle bez przerywania toku rozmowy. — @GoogleDeepMind na X
Google podkreśla również dokładność rozpoznawania dyktowanych danych alfanumerycznych, takich jak kody potwierdzające czy numery spraw, i przedstawia te modele jako prostszą alternatywę dla architektur kaskadowych, które kolejno wykonują transkrypcję, przetwarzanie tekstu i syntezę mowy. Według karty modelu Gemini 3.8 Audio bazują one na Gemini 3 Pro, przyjmują dźwięk, obrazy, wideo i tekst w kontekście 128K tokens, generują do 64K tokens na wyjściu i wykorzystują wiedzę aktualną do stycznia 2025 roku.
| Ranking lub benchmark | Oceniany model | Wynik opublikowany przez Google |
|---|---|---|
| Wskaźnik Speech to Speech Quality (Artificial Analysis) | 3.8 Live Extended Thinking | 82,6 (1. miejsce) |
| τ-Voice | 3.8 Live Extended Thinking | 68,6 % |
| τ-Voice-banking (Sierra) | 3.8 Live Extended Thinking | 35,1 % |
| Big Bench Audio | 3.8 Live Extended Thinking | 97,7 % |
| Speech Agent Arena (Artificial Analysis) | 3.8 Live | 2. miejsce |
Rankingi te są prowadzone przez podmioty zewnętrzne, ale przytoczone wyniki pochodzą z publikacji Google. W Live API Google szacuje koszt obu modeli na 0,005 dolara za minutę dźwięku wejściowego i 0,018 dolara za minutę dźwięku wyjściowego, przy stawce 3 dolarów za milion tokens na wejściu i 12 dolarów na wyjściu; Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel i Vision Agents są wymieniane jako integratorzy.
| Kanał dystrybucji | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| Gemini API i Google AI Studio | Od 15 września | Od 15 września |
| Gemini Enterprise | Prywatna wersja zapoznawcza | Prywatna wersja zapoznawcza |
| Użytkownicy indywidualni | Search Live | Gemini Live, Docs Live (subskrybenci Google AI Pro i Ultra), Gmail Live i Keep Live (wszyscy subskrybenci Google AI) |
W Search Live model prowadzi użytkownika krok po kroku przez rozwiązywanie problemu w czasie rzeczywistym. Cały generowany dźwięk zawiera niewidoczny znak wodny SynthID.
🔗 Przedstawiamy Gemini 3.8 Live i 3.8 Live Extended Thinking 🔗 Wpis dla deweloperów o Live API 🔗 Karta modelu Gemini 3.8 Audio
Claude Code 2.1.271–2.1.273: tryb szybki w Remote, sieć konfigurowana dla każdej komendy i zaostrzone uprawnienia
15 września — Anthropic publikuje trzy wersje Claude Code w ciągu nieco ponad 22 godzin, pierwszą tuż po północy czasu paryskiego.
| Opublikowana wersja | Data i godzina (UTC) | Zawartość informacji o wydaniu |
|---|---|---|
| 2.1.271 | 14 września, 22:12 | 96 wierszy: tryb szybki w Remote, allowed_domains dla każdej komendy, omitClaudeMd, --accept-command |
| 2.1.272 | 15 września, 0:42 | Jeden wiersz: poprawki błędów i zwiększenie niezawodności |
| 2.1.273 | 15 września, 20:23 | 64 wiersze: nagłówki dla bram LLM, duplikowanie sesji Remote Control, lokalny klasyfikator w Bedrock, Vertex i Foundry |
Wersja 2.1.271 udostępnia tryb szybki (fast mode) sesjom Claude Code Remote, zarówno w chmurze, jak i na samodzielnie hostowanych środowiskach wykonawczych (self-hosted runners), tam, gdzie organizacja na to zezwala. W trybie automatycznym z sandboxem Bash, PowerShell i Monitor przyjmują listę allowed_domains dla każdej komendy: wymagane hosty są sprawdzane wraz z komendą i udostępniane wyłącznie na czas jej wykonania, a pozostałe są odrzucane. Pole omitClaudeMd w frontmatter agentów uruchamia subagenta bez plików CLAUDE.md użytkownika, projektu i lokalnych, przy czym pliki zarządzanych zasad pozostają załadowane, a claude plugin install --accept-command <sha256> akceptuje wyłącznie dokładną komendę wyświetloną podczas wcześniejszego przejścia w --json, zamiast -y. Wersja 2.1.273 umożliwia zduplikowanie (fork) w aplikacji Claude sesji uruchomionej za pomocą claude --remote-control; zduplikowana sesja działa następnie w tle na komputerze. Ostrzega również, gdy serwer MCP traci połączenie i automatyczne ponowne łączenie zostaje przerwane, oraz dodaje nagłówki żądań dla bram LLM, aktywowane przez CLAUDE_CODE_GATEWAY_HINT_HEADERS=1.
| Zmieniony element | Nowe zachowanie |
|---|---|
| Powrót subagenta w trybie automatycznym | Dedykowane wywołanie zwrotne (hand-back call) sprawdzane przez klasyfikator bezpieczeństwa zamiast późniejszej kontroli jego ostatniej wiadomości |
Komendy ! skills i komendy slash w trybie automatycznym | Reguły uprawnień trybu domyślnego zamiast klasyfikatora |
| Monitorowanie przez Monitor | Obowiązkowy limit czasu wynoszący maksymalnie 30 minut (10 przy wykonywaniu -p), z powiadomieniem Claude o konieczności ponownego uruchomienia |
| Dynamiczne workflows | Wstrzymanie po osiągnięciu limitu użycia i automatyczne wznowienie po jego zresetowaniu zamiast porzucenia agentów |
| Tryb automatyczny w Bedrock, Vertex i Foundry (2.1.273) | Na razie domyślnie lokalny klasyfikator, CLAUDE_CODE_AUTO_MODE_SERVER=1 dla klasyfikatora platformy |
Obie wersje poprawiają także kilka mechanizmów kontroli uprawnień. Komendy zawierające subshell, dwie zmiany katalogu lub ciąg cd + git pomijały monit przy permissions.blockReadsOutsideWorkingDirectories, a subshell mógł ukryć niebezpieczne rm w trybie omijania uprawnień (bypass). Ustawienia MCP narzucone przez MDM lub managed-settings.json były ignorowane, gdy tylko istniały ustawienia zarządzane po stronie serwera. /resume i /teleport zachowywały historię plików odczytanych w poprzedniej rozmowie, przez co Claude mógł modyfikować pliki, których wznowiona rozmowa nigdy nie odczytała. Wreszcie wskaźnik kontekstu liczył tury narzędzia advisor jako około dwukrotnie większe niż w rzeczywistości, co uruchamiało automatyczną kompakcję mniej więcej w połowie okna.
Żadna z trzech informacji o wydaniu nie wspomina o Claude Mods zapowiedzianych 14 września; w zgłoszeniu #91870 testerzy ze społeczności uważają jednak, że wersja 2.1.272 już wpłynęła na ich działanie.
🔗 Informacje o wydaniu Claude Code 2.1.271 🔗 Informacje o wydaniu Claude Code 2.1.273
Salesforce in Claude — plugin sprzedażowy w wersji beta dla zatwierdzonych organizacji
15 września — Anthropic uruchamia w wersji beta Salesforce in Claude, który udostępnia w Claude konta, szanse sprzedaży i pipeline handlowca. Wpis przedstawia plugin opracowany wspólnie z Salesforce, podczas gdy centrum pomocy przypisuje Salesforce stworzenie jego 37 sprzedażowych skills: wyszukiwania kont, przygotowywania rozmów, przeglądu pipeline’u czy aktualizacji CRM. Towarzyszą mu dwa connectory: Salesforce z uprawnieniami do odczytu i zapisu oraz Slack do kanałów biznesowych i wątków zespołowych.
Salesforce pozostaje systemem referencyjnym: każdy handlowiec loguje się własnymi danymi uwierzytelniającymi, Claude odczytuje wyłącznie dane dopuszczone przez jego uprawnienia Salesforce, a każda operacja zapisu domyślnie wymaga zatwierdzenia. Plugin działa w chat i Claude Cowork (w wersji webowej i desktopowej). Wersja beta obejmuje płatne plany, ale tylko organizacje zaakceptowane przez Salesforce za pośrednictwem formularza rejestracyjnego do bety i dysponujące najnowszą edycją Enterprise usługi Sales Cloud; ich administratorzy Salesforce składają wniosek o dostęp w AgentExchange. GitLab, Siemens i Legora wdrożyły rozwiązanie, a korzysta z niego 7 000 handlowców Salesforce.
🔗 Wprowadzenie Salesforce do Claude 🔗 Konfigurowanie Salesforce in Claude dla organizacji
GPT-5.5 opuści ChatGPT, ChatGPT Work i Codex 14 października, ale pozostanie w API
15 września — OpenAI ogłasza na X zakończenie obsługi GPT-5.5 w swoich aplikacjach, co zostało już wpisane do changelogu ChatGPT i Codex z datą 14 września. 14 października model zostanie wycofany z ChatGPT, ChatGPT Work i Codex we wszystkich planach: dla użytkowników indywidualnych, Business, Enterprise i Edu.
| Objęty obszar | Stan na 14 października |
|---|---|
| ChatGPT i ChatGPT Work | GPT-5.5 wycofany ze wszystkich planów |
| Codex z logowaniem przez ChatGPT | GPT-5.5 wycofany, wymagane przejście na gpt-5.6-sol |
| Codex z kluczem API | GPT-5.5 nadal dostępny |
| OpenAI API | GPT-5.5 nadal dostępny |
W przypadku Codex z logowaniem przez ChatGPT dokumentacja zaleca zastąpienie gpt-5.5 wszędzie tam, gdzie został wybrany jawnie: w domyślnych parametrach workspace’u, zapisanych ustawieniach, zarządzanych konfiguracjach, niestandardowych agentach, zaplanowanych zadaniach i skryptach. Wiadomość z konta @ChatGPT wymienia również GPT-6 Astra jako następcę w Codex. Przewodnik dla administratorów ostrzega, że zmiana modelu domyślnego nie zapewnia dostępu do modelu: dla każdego klienta trzeba sprawdzić, czy następca jest dostępny dla odpowiednich użytkowników. OpenAI ponownie stosuje miesięczny okres wyprzedzenia wykorzystany w przypadku GPT-5.4 i GPT-5.4 mini, które 31 sierpnia wycofano z Codex dla użytkowników zalogowanych przez ChatGPT po ogłoszeniu z 31 lipca.
🔗 Changelog ChatGPT i Codex 🔗 Wiadomość od @ChatGPT na X
HP preinstaluje Perplexity na swoich komputerach z Windows i dodaje połączenie z Autodesk Revit
15 września — Perplexity i HP ogłaszają preinstalowanie aplikacji Perplexity dla Windows na pasku zadań komputerów tego producenta, począwszy od mobilnej stacji roboczej ZBook Ultra G3a wyposażonej w procesory AMD Ryzen AI Max PRO serii 400; w nadchodzących miesiącach dołączą kolejne modele, ale nie podano ich listy, cen ani dat. Według wpisu możliwości lokalnej AI w ZBook Ultra G3a pozwalają wykonywać typowe zadania za pomocą Portable Computer, lokalnej wersji agenta działającej bez kredytów chmurowych i bez połączenia z siecią, lecz jej dostępność zależy od konfiguracji urządzenia: wpis nie wymienia zgodnych konfiguracji, podczas gdy opublikowana dzień wcześniej wersja dla Windows wymagała GPU NVIDIA RTX z co najmniej 24 GB pamięci wideo.
Portable Computer łączy się również z Autodesk Revit, oprogramowaniem do modelowania informacji o budynku (Building Information Modeling), za pośrednictwem serwera MCP programu Revit 2027, oferowanego w technicznej wersji zapoznawczej (Tech Preview) jako osobny moduł. Dostęp jest tylko do odczytu: agent odpowiada na pytania dotyczące modelu, takie jak liczba drzwi na danym piętrze lub ich klasa odporności ogniowej, oraz eksportuje widoki, pliki PDF i zestawienia bez modyfikowania modelu. Personal Computer for Windows jest dostępny dla subskrybentów Pro, Max i Enterprise w systemach Windows 10 i 11.
🔗 Perplexity trafia na więcej komputerów z Windows dzięki HP
Cognition podpisuje umowę z AWS i uruchamia macOS w Devin Cloud
15 września — Cognition publikuje tego samego dnia dwa ogłoszenia powiązane infrastrukturą: komputery Mac, na których Devin tworzy teraz aplikacje Apple, są hostami AWS EC2 Mac.
Strategiczne porozumienie o współpracy z AWS
Cognition i Amazon Web Services zawierają wieloletnie strategiczne porozumienie o współpracy (Strategic Collaboration Agreement), przy czym we wpisie nie podano ani jego wartości, ani dokładnego czasu trwania. Dwa elementy są już dostępne: Devin można kupić za pośrednictwem AWS Marketplace, a Agent Toolkit for AWS można używać bezpośrednio w Devin. Rozważane są bardziej zaawansowane integracje ze środowiskami AWS klientów, ale nie podano harmonogramu. Devin jest wdrażany w środowisku przeznaczonym dla jednego klienta (single-tenant), w regionie AWS wybranym przez klienta, a dane są przechowywane w dedykowanym VPC; każda sesja działa na osobnej maszynie wirtualnej, usuwanej po zakończeniu pracy.
| Klient wymieniony przez Cognition | Ogłoszony rezultat |
|---|---|
| Mercedes-Benz | Przeanalizowano ponad 200 000 linii COBOL-u, projekt szacowany na osiem miesięcy skrócono do ośmiu dni |
| Nienazwany producent samochodów | Przepływ COBOL liczący 25 000 linii przeniesiono z komputera centralnego (mainframe) do AWS Lambda, szacowany koszt niższy o 73 % |
🔗 Wpis Cognition o porozumieniu z AWS
macOS trafia do Devin Cloud
Już 31 lipca Cognition prezentowało działających w chmurze agentów Devin pod macOS, z Xcode i symulatorem iOS. Premiera z 15 września w Devin Cloud, umożliwiająca tworzenie i testowanie aplikacji na iPhone’a, iPada i Maca, przynosi kilka nowości: Devin wysyła na Slacku nagranie ekranu ze swoich testów, przekazuje link TestFlight do zainstalowania aplikacji, a nowy panel iOS Simulator pokazuje uruchomioną aplikację. Agent obsługuje również aplikacje za pośrednictwem ich drzewa dostępności, udostępnionego jego narzędziu do korzystania z komputera (computer use): wyszukuje element sterujący według jego roli i nazwy, wykonuje na nim działanie, a następnie ponownie odczytuje drzewo; zrzuty ekranu nadal służą do oceny wyglądu. Warstwa ta opiera się na otwartoźródłowym accessibility-cli firmy Dioxus, której zespół dołączył do Cognition 10 września.
Maszyny wirtualne macOS działają z użyciem Virtualization.framework firmy Apple na fizycznych komputerach Mac w AWS EC2 Mac, a do systemu migawek (snapshots) dodano interfejs NBD (Network Block Device), aby można było wznowić sesję bez utrzymywania włączonej maszyny. Brama Ethernet działająca w przestrzeni użytkownika zastępuje zarządzany przez Apple NAT, aby stosować politykę sieciową każdej sesji. Nie podano ani ceny, ani planu, którego dotyczy ta funkcja.
NVIDIA przedstawia szczegóły dwóch elementów Vera Rubin: Groq 3 LPX i NVLink 6
15 września — Dwa wpisy na technicznym blogu NVIDIA wyjaśniają, w jaki sposób platforma Vera Rubin oszczędza energię podczas inferencji i radzi sobie z awariami swojej sieci. Poniższe dane pochodzą od NVIDIA.
Groq 3 LPX — deterministyczne wykonywanie zmniejszające margines napięcia
Uruchomienie produkcyjne Groq 3 LPX opisano tutaj 24 sierpnia; ten wpis wyjaśnia jego mechanizm. Przed rozpoczęciem wykonywania kompilator układów LPU określa z dokładnością do cyklu zegara moment każdego obliczenia i każdego transferu danych między 256 układami w szafie, dzięki czemu może przewidywać pobór prądu. Wykorzystują to dwie technologie: Preemptive Power (PEP) nakazuje sieci zasilającej podnieść napięcie tuż przed szczytem zapotrzebowania, a Clock Period Synthesis (CPS) wydłuża cykle zegara, podczas których natężenie prądu rośnie najszybciej. Celem jest zmniejszenie marginesu napięcia (voltage guardband), utrzymywanego w każdym układzie, który jest kosztowny, ponieważ moc rośnie proporcjonalnie do kwadratu napięcia: napięcie wyższe o 10 % oznacza moc wyższą o 21 %.
W testach wewnętrznych spadek napięcia zmniejszył się o ponad 60 %. NVIDIA szacuje, że przy takim samym obciążeniu wymagana moc może spaść o „kilkanaście procent” (low-double-digit) w porównaniu z podobnym systemem niedeterministycznym. Mechanizmy te trafią do Vera Rubin w drugiej połowie 2026 roku.
🔗 Wpis NVIDIA o deterministycznym wykonywaniu w Groq 3 LPX
NVLink 6 — stos mechanizmów odporności od układów krzemowych po oprogramowanie
NVLink 6 łączy 72 procesory GPU Rubin w szafie Vera Rubin NVL72 w jedną domenę; deklarowana przez NVIDIA dziesięciokrotnie większa niż w ogólnych rozwiązaniach Ethernet przepustowość pakietów była już wspomniana tutaj 21 lipca. Tym razem wpis szczegółowo omawia odporność na awarie, warstwa po warstwie.
| Poziom stosu | Mechanizm opisany przez NVIDIA |
|---|---|
| Warstwa fizyczna | Uproszczona korekcja błędów, uzupełniona retransmisją na poziomie fizycznym (Physical Layer Retry) |
| Warstwa łącza | Sterowanie przepływem oparte na kredytach (credit-based flow control), z założenia bez utraty pakietów |
| Zarządzanie łączami | Programowe przywracanie działania w około 1,5 sekundy za pośrednictwem NMX Controller |
| Usługa inferencji | Shadow Engine Recovery (NVIDIA Dynamo): skrócenie przerwy z 283 do 7,3 sekundy na GPU B200 |
| Checkpointy wielowęzłowe | cuda-checkpoint obsługiwany przez NCCL w wersji prototypowej, ogólna dostępność oczekiwana do końca roku |
Sterowanie przepływem oparte na kredytach wysyła pakiet tylko wtedy, gdy następny węzeł ma miejsce na jego odebranie, podczas gdy Ethernet opiera się na PFC i ECN. Z kolei Shadow Engine Recovery utrzymuje replikę silnika inferencyjnego, już zainicjalizowaną z własnymi komunikatorami NCCL.
🔗 Wpis NVIDIA o odporności NVLink 6
Gemini Notebook zapowiada rozmowy głosowe z notebookami i rejestrator dźwięku
15 września — Z okazji rozpoczęcia roku akademickiego Gemini Notebook zmienia wygląd i zapowiada serię narzędzi do nauki, z których większość zostanie udostępniona dopiero później.
| Zapowiedziane narzędzie do nauki | Podana dostępność |
|---|---|
| Rozmowa głosowa w czasie rzeczywistym z notebookami, na urządzeniach mobilnych, w niemal 100 językach | W tym tygodniu dla pełnoletnich subskrybentów Google AI Ultra, wkrótce dla Google AI Pro i pozostałych użytkowników |
| Rejestrator dźwięku w aplikacji mobilnej | Od przyszłego tygodnia |
| Interaktywne materiały edukacyjne w Reports | W najbliższych tygodniach, dla wszystkich użytkowników |
| Quizy z krótką odpowiedzią, wielokrotnego wyboru lub z lukami | W najbliższych tygodniach, dla wszystkich użytkowników |
| Short Video Overviews w ponad 80 językach, z możliwością udostępniania | Dostępne już teraz, wobec ponad 70 języków 1 września |
Rozmowa głosowa będzie odpowiadać na podstawie źródeł w notebooku i będzie można przerwać ją głosem, natomiast rejestrator pozwoli zapisać wykład lub przemyślenia bezpośrednio w notebooku, obok źródeł. Materiały edukacyjne będą łączyć podsumowania, infografiki, quizy i fiszki (flashcards). Jeśli chodzi o oferty studenckie, przedstawione już w sierpniu, Google wyjaśnia, że bezpłatny rok Google AI Pro dla studentów w Stanach Zjednoczonych czterokrotnie zwiększa limity w Gemini Notebook, a roczna oferta Google AI Plus dostępna na ponad 140 innych rynkach podwaja je.
🔗 Udoskonal swoją rutynę nauki dzięki nowym narzędziom Gemini Notebook
Antigravity 2.14.0 udostępnia zintegrowany terminal i Git kontom Enterprise i Business
15 września — Antigravity 2.14.0, zawierający 10 ulepszeń i 18 poprawek, udostępnia kontom Enterprise i Business zintegrowany terminal oraz kontrolę wersji Git na pasku bocznym, które dla pozostałych kont pojawiły się w wersji 2.10.0 z 24 sierpnia. Rozmowy z bardzo długą historią ładują się szybciej i zużywają mniej pamięci, a nadmiarowa analiza skills, reguł i plików personalizacji, uruchamiana ponownie przy każdej wiadomości, została usunięta.
Wśród poprawek znalazła się obsługa przejściowego błędu usługi, który nie kończy już sesji: operacja jest ponawiana z rosnącym opóźnieniem przez około dwanaście minut. Zakończone sub-agenty nie są już wyświetlane jako aktywne, blokując kolejne wiadomości aż do ponownego uruchomienia, a wyciek pamięci związany z danymi wyjściowymi poleceń terminala został naprawiony. Tytuł wydania wspomina o nowym systemie uprawnień, ale informacje o wersji ograniczają się w tej kwestii do zmiany nazwy sekcji ustawień ogólnych na „Global Permissions” oraz opcji dziedziczenia ustawień projektu na „Inherit Global”.
🔗 Dziennik zmian Google Antigravity
IBM Research zmniejsza o połowę lukę spójności agenta dzięki ALTK-Evolve
15 września — Na blogu Hugging Face IBM Research publikuje trzecią część swojej serii ALTK-Evolve, tym razem poświęconą spójności wykonywania zadań przez agentów. W 168 zadaniach AppWorld agent ReAct działający na GPT-4.1 z temperaturą ustawioną na 0 osiąga średnio powodzenie w 77,4 % wykonań w pięciu próbach (Mean@5), lecz wszystkie pięć prób kończy powodzeniem tylko w przypadku 53,0 % zadań (Pass^5). IBM nazywa tę różnicę wynoszącą 24,4 punktu luką spójności (consistency gap).
Consistency Analyzer wykrywa niestabilne decyzje na podstawie pojedynczej zarejestrowanej trajektorii: odtwarza offline każdy krok, żądając pięciu uzupełnień, bez danych referencyjnych, bez ponownego uruchamiania zadania i bez dostępu do logitów. Wrażliwe kroki są przekształcane we wskazówki dotyczące spójności (consistency guidelines), wstrzykiwane podczas inferencji.
| Konfiguracja agenta | Wynik Mean@5 | Wynik Pass^5 | Luka spójności |
|---|---|---|---|
| ReAct GPT-4.1 bez wskazówek | 77,4 % | 53,0 % | 24,4 punktu |
| ReAct GPT-4.1 ze wskazówkami dotyczącymi spójności | 81,0 % | 69,0 % | 12,0 punktów |
W przypadku gpt-oss-120b wynik Pass^5 wzrasta z 10,1 % do 16,1 %. Analyzer i generowanie wskazówek są zintegrowane z otwartoźródłowym repozytorium ALTK-Evolve.
🔗 Wpis IBM Research na blogu Hugging Face
Aillis wdraża Sakana Namazu w Evidence Finder, osiągając 96,4 % na japońskim państwowym egzaminie lekarskim
14 września — Aillis, japońska firma opracowująca urządzenia medyczne oparte na uczeniu maszynowym, wdraża Sakana Namazu — specjalizowany w języku japońskim LLM wprowadzony na początku sierpnia przez Sakana AI — w swoim narzędziu Evidence Finder do wyszukiwania dowodów naukowych dla lekarzy. Komunikat opublikowany o godz. 11 czasu tokijskiego został udostępniony przez Sakana AI na X tego samego dnia o godz. 15:30 czasu pacyficznego, po naszym zestawieniu z 14 września. Evidence Finder tworzy na podstawie literatury medycznej odpowiedzi cytujące źródła, których istnienie sprawdza funkcja Verify; obie firmy rozpoczynają również wspólne prace nad zastosowaniami medycznymi.
Wersja Evidence Finder oparta na Sakana Namazu uzyskuje 96,4 % (482 punkty na 500) podczas 120. edycji japońskiego państwowego egzaminu lekarskiego w lutym 2026 roku. Według zestawienia Aillis z 1 września jest to najlepszy wynik wśród krajowych modeli bazowych wyznaczonych przez program GENIAC japońskiego Ministerstwa Gospodarki. W komunikacie zamieszczono dwa zastrzeżenia: na potrzeby tego testu zniesiono ograniczenia produktu, w tym odrzucanie pytań zawierających obrazy, podczas gdy usługa komercyjna obsługuje wyłącznie pytania tekstowe; ponadto Evidence Finder nie jest urządzeniem medycznym.
🔗 Komunikat Aillis w PR Times 🔗 Udostępnienie Sakana AI na X
Google przedstawia dane o wykorzystaniu AI i jej wpływie społecznym
15 września — Tego samego dnia Google publikuje dwie serie wpisów poświęconych rzeczywistemu wykorzystaniu AI i jej skutkom społecznym.
AI & Economy ATLAS zostaje udostępniony publicznie wraz z badaniem dotyczącym naukowców
AI & Economy ATLAS, program badawczy biura głównego ekonomisty Google, z którego pochodziły przytoczone tutaj 9 września dane dotyczące formalności administracyjnych, staje się ogólnodostępnym interaktywnym narzędziem: można w nim porównywać wykorzystanie AI według zawodów, w domu oraz w poszczególnych krajach.
| Wyróżniony wskaźnik ATLAS | Wartość opublikowana przez Google |
|---|---|
| Indie: udział zawodów związanych ze sztuką, projektowaniem i mediami w profesjonalnym wykorzystaniu AI | 19 %, czyli 1,6 raza więcej niż średnia światowa |
| Stany Zjednoczone: udział informatyki i matematyki | 30 %, dwa razy więcej niż w pozostałej części świata |
| Brazylia i Niemcy: udział zadań manualnych, takich jak diagnostyka sprzętu | 7 %, wobec 4 % w Japonii |
Badanie Google, Google DeepMind i MIT FutureTech, oparte na analizie 2 600 specjalistycznych modeli AI oraz ankiecie przeprowadzonej wśród ponad 600 naukowców ze Stanów Zjednoczonych i Wielkiej Brytanii, wskazuje, że niemal połowa z nich korzysta z AI codziennie i deklaruje oszczędność nieco poniżej 7 godzin tygodniowo. Autorzy zwracają również uwagę na minusy: czas poświęcany na weryfikację wyników generowanych przez AI oraz rosnącą kolejkę nieprzetestowanych hipotez, oczekujących na eksperymenty fizyczne i walidacje kliniczne.
🔗 Nowe wnioski z AI & Economy ATLAS firmy Google
AI for Societal Impact: języki, laureaci Google.org i FireSat
Według Google technologie grupy działają w ponad 300 językach, którymi posługuje się ponad 7 miliardów osób, a kilka zbiorów danych opracowano z lokalnymi partnerami. Google prezentuje również Language Explorer, interaktywne narzędzie wizualizujące otwartą bazę LinguaMeta.
| Inicjatywa wymieniona przez Google | Podana wartość |
|---|---|
| WAXAL, otwarty korpus głosowy | 27 języków Afryki Subsaharyjskiej |
| Project Vaani | Ponad 30 000 godzin mowy w 109 językach |
| Google.org Impact Challenge: AI for Government Innovation | 15 laureatów, 30 milionów dolarów, ponad 2 600 zgłoszeń |
| FireSat | Pierwsza partia działających satelitów na orbicie, docelowo około pięćdziesięciu do 2030 roku, aby wykonywać zdjęcie co 20 minut |
| Planetary Prediction Engine, zaprezentowany pod koniec sierpnia | Według Google 83% powstających ognisk Eboli w Demokratycznej Republice Konga wykryto z wyprzedzeniem |
Laureaci Google.org, wśród nich Code for America za rozwiązanie do składania zeznań podatkowych oraz Johns Hopkins University za projekt dotyczący bezpieczeństwa drogowego, korzystają z wolontariackiego wsparcia inżynierów Google i projektują swoje rozwiązania jako otwarte modele wielokrotnego użytku.
🔗 AI dla wszystkich, w każdym języku 🔗 15 organizacji przekształcających usługi publiczne za pomocą AI 🔗 Tworzenie AI, aby przyspieszyć naukę i poprawić jakość życia 🔗 Wykrywanie pożarów lasów za pomocą AI
W skrócie
- Anthropic publikuje przewodnik dotyczący wdrażania Claude w zespołach sprzedażowych — wydany tego samego dnia co Salesforce in Claude dokument Building an AI-native revenue organization przedstawiono we wpisie, w którym wymieniono dwóch klientów: Cox Communications twierdzi, że w pierwszym roku uzyskał siedmiokrotny zwrot z inwestycji i obniżył o 86% koszt weryfikacji oraz wzbogacania danych o potencjalnych klientach, zwiększając dokładność z 18% do 97%, natomiast 88% spośród około 1 500 pracowników Cyera korzysta z Claude co tydzień. 🔗 źródło
- Perplexity publikuje przewodnik na temat ukrytej AI (shadow AI) — wpis nie zawiera własnych danych i zestawia badania podmiotów trzecich: około połowa pracowników przyznaje, że złamała zasady swojej organizacji, korzystając z AI (KPMG), a 82% respondentów badania Cloud Security Alliance zgłasza obecność nieznanych agentów w systemach swojej organizacji. Kończy się on prezentacją argumentów na rzecz Perplexity Enterprise i Comet for Enterprise, bez żadnej nowej funkcji. 🔗 źródło
- v0 staje się niezależny od modeli (model-agnostic) — według pojedynczego tweeta narzędzie Vercel do tworzenia aplikacji oferuje najnowocześniejsze, tanie, otwarte i szybkie modele udostępniane przez Vercel AI Gateway, w tym Claude, GPT, Kimi, GLM, Grok i DeepSeek; nie podano ani pełnej listy, ani cen, ani objętych tym rozwiązaniem planów. 🔗 źródło
- Warp podaje dane liczbowe dotyczące swojej wewnętrznej fabryki oprogramowania — w opisującym trzyetapową metodę (crawl, walk, run) wdrażania fabryki oprogramowania (software factory) wpisie Zach Lloyd, CEO Warp, informuje, że fabryka firmy automatyzuje około 75% zmian w warp.dev, jej witrynie marketingowej; Warp Factories pozostaje we wczesnym dostępie, a zakwalifikowane przedsiębiorstwa otrzymują 10 000 dolarów na korzystanie z usługi. 🔗 źródło
- Kimi Code 0.43.1 naprawia roje swoich subagentów — niecałe 19 godzin po wersji 0.43.0 Moonshot AI publikuje siedem poprawek, obejmujących zwalnianie pamięci po zakończeniu działania subagenta, odciążenie renderowania i pętli zdarzeń w dużych rojach oraz zmianę działania Ctrl+C, które przerywa teraz wyłącznie pracę subagentów, zamiast zamykać cały CLI. 🔗 źródło
- Gemini CLI v0.60.0 trafia do kanału stable — wersja bez zmian przejmuje preview z 8 września i zawarte w nim jedenaście zmian zwiększających odporność, a v0.61.0-preview.0 rozpoczyna kolejną serię z trzema poprawkami opublikowanymi już w kanale nightly oraz poprawką pętli agenta. 🔗 źródło
- Copilot sugeruje dozwolone wartości niestandardowych właściwości repozytoriów — podczas tworzenia niestandardowej właściwości (custom property) przedsiębiorstwa lub organizacji Copilot proponuje wartości, które można zaakceptować jednym kliknięciem; funkcja jest dostępna w publicznej wersji zapoznawczej dla Copilot Business i Enterprise oraz podlega zasadzie „Repository custom property suggestions”. 🔗 źródło
- Grok Imagine umożliwia edycję tekstu na obrazach w wersji beta — narzędzie SpaceXAI do generowania obrazów i filmów pozwala retuszować tekst widoczny na dowolnym obrazie, takim jak zaproszenie, plakat czy reklama; w ogłoszeniu nie wskazano ani planów, ani platform, ani używanego modelu. 🔗 źródło
- MiniMax H3 osiąga podczas odszumiania ponad dwukrotność prędkości czasu rzeczywistego — w tweecie opublikowanym 14 września o 16:34 czasu pacyficznego, po naszym zestawieniu z tego samego dnia, MiniMax informuje, że dzięki SGLang-Diffusion i VDN-H3 model H3 generuje 14,4 sekundy filmu 768p w 9,0 sekund na 8 GPU B200, bez zmierzonego pogorszenia jakości, rozwijając ekosystem H3 opisany 14 września. 🔗 źródło
- Retrieve-for-Train destyluje uczenie przez wzmacnianie do małego modelu dyfuzyjnego — w tej pracy pochodzącej z artykułu ICML 2026 Google Research jednorazowo trenuje offline model o 4B parametrów metodą uczenia przez wzmacnianie (Reinforcement Learning), aby generował różnorodne podzapytania, a następnie destyluje to zachowanie do modelu dyfuzyjnego o 53,9 miliona parametrów, który tworzy cały zestaw w jednym przebiegu, zapewniając przyspieszenie od 12 do 20 razy. 🔗 źródło
- NVIDIA ujmuje liczbowo wybór między modelem gęstym a mieszanką ekspertów (Mixture-of-Experts, MoE) — ten wpis edukacyjny porównuje Gemma 4 31B, Qwen3.8-27B, Nemotron 3.5 Lightning i Mistral Small 4 na podstawie danych Artificial Analysis zebranych 31 sierpnia: Lightning, mający 30B parametrów, z czego 3B aktywnych, działa od 4 do 5 razy szybciej niż Qwen3.8-27B za jedną czternastą ceny, osiągając mniej niż połowę jego wyniku zdolności. 🔗 źródło
- NVIDIA FLARE 2.9 dodaje Slurm — framework uczenia federacyjnego (federated learning), który od wersji 2.8 obsługuje Docker i Kubernetes, pozwala teraz współdziałać wszystkim trzem środowiskom w ramach jednej federacji i wprowadza przenośny opis zasobów dla każdego zadania. 🔗 źródło
- Sakana Marlin dodaje interaktywne czytanie i eksport do PowerPoint — dzięki interaktywnemu czytaniu (Interactive Reading) autonomiczny asystent badawczy Sakana AI umożliwia zadawanie agentowi pytań dotyczących jego raportu i otwieranie przywołanego źródła uzasadniającego dane stwierdzenie; eksportuje również edytowalne prezentacje PowerPoint zawierające adresy URL ich źródeł. 🔗 źródło
- ShadowPEFT trafia do biblioteki PEFT — wpis społecznościowy: metoda, która dołącza do zamrożonego modelu małą, odłączaną sieć „cieniową”, została scalona z główną gałęzią PEFT i znajdzie się w jej kolejnej wersji; na Llama-3.2-3B autorzy uzyskali 48,1% w GSM8K wobec 46,9% dla LoRA, ale szczytowe zużycie pamięci wyniosło 28,2 GB wobec 22,3 GB. 🔗 źródło
- RiverRider porównuje lokalizowanie plików z wynikiem losowym — indywidualny wkład: w SWE-bench Verified lokalny enkoder o 33 milionach parametrów umieszcza właściwy plik na pierwszym miejscu w 45,8% przypadków, ale punkt odniesienia wykorzystujący permutowane zapytania znajduje go już wśród pierwszych 50 wyników w 24,4% przypadków, co obniża stosunek sygnału do wyniku losowego z 45,8 do 3,9. 🔗 źródło
- EcoHash podwaja współbieżność RTX PRO 6000 na Qwen3.8-27B — wpis dostawcy inferencji, cytowanego już 14 września w innym kontekście, oparty na pomiarach we własnej usłudze: włączenie w vLLM 0.27.1 głowicy modelu do przewidywania wielu tokenów (multi-token prediction, MTP) skraca czas na token z 22 do 13 ms i zwiększa utrzymywaną współbieżność z 32 do 64 zapytań — pułap ten osiągnięto w dwóch z czterech powtórzeń — kosztem 23% pojemności pamięci podręcznej KV. 🔗 źródło
- DINO-X publikuje model badawczy dotyczący naczyń wątrobowych wraz z opisem niepowodzeń — model społecznościowy przeznaczony wyłącznie do badań: ten ViT-Base o 86 milionach parametrów osiąga zewnętrzne AUROC na poziomie 0,9413 na 17 639 przekrojach tomografii komputerowej, a jego autor publikuje również negatywne wyniki, w tym nieudostępniony model specjalistyczny dla jelita grubego z wynikiem 0,6529. 🔗 źródło
Co to oznacza
Głos staje się pełnoprawnym interfejsem agenta. Gemini 3.8 Live i jego wariant Extended Thinking wywołują narzędzia w tle, podczas gdy odpowiedź jest kontynuowana, oraz dbają o dokładność dyktowanych kodów i numerów, przy koszcie szacowanym za minutę dźwięku. Google natychmiast umieszcza wariant Extended Thinking, który informuje o postępach zadań wykonywanych w tle, w swoich narzędziach do pracy wraz z Docs Live, Gmail Live i Keep Live, a Gemini Notebook zapowiada z kolei rozmowę głosową opartą na źródłach każdego notebooka. Punkt ciężkości przesuwa się z jakości głosu na to, co model wykonuje w trakcie mówienia.
Drugi wątek dotyczy dystrybucji: agenci trafiają do narzędzi biznesowych kanałami, które już istnieją. Salesforce in Claude pojawia się ze skills sprzedażowymi, konektorami do CRM i Slack oraz zatwierdzaniem każdego zapisu; HP fabrycznie instaluje Perplexity na pasku zadań swoich komputerów i łączy je w trybie tylko do odczytu z projektami Revit; Devin można kupić w AWS Marketplace i wdrożyć w dedykowanym VPC. W każdym przypadku agent trafia do narzędzia, z którego firma już korzysta, wraz z jego zabezpieczeniami: uprawnieniami sprzedawcy w Salesforce, dostępem tylko do odczytu w Revit i dedykowanym VPC w AWS.
Trzeci wątek wiąże się z niezawodnością i kontrolą. Wersje 2.1.271 i 2.1.273 Claude Code przekazują wyniki subagentów do sprawdzenia przez klasyfikator, otwierają dostęp do sieci dla poszczególnych poleceń i naprawiają możliwości obchodzenia uprawnień za pomocą podpowłok lub ignorowanych ustawień MDM. IBM Research pokazuje, że agent ustawiony na temperaturę 0 może średnio pomyślnie ukończyć 77,4% uruchomień, lecz wszystkie pięć uruchomień zakończyć powodzeniem tylko w 53,0% zadań, i zaleca publikowanie Pass^k obok średniej. NVIDIA stosuje ten sam wymóg do sprzętu: NVLink 6 odzyskuje połączenie w około 1,5 sekundy, a Shadow Engine Recovery skraca przerwę w inferencji z 283 do 7,3 sekundy. Pytanie nie brzmi już tylko, czy agent odnosi sukces, lecz czy robi to za każdym razem i w możliwych do zweryfikowania granicach.
Ostatni wątek dotyczy tempa. OpenAI wycofa GPT-5.5 ze swoich aplikacji miesiąc po ogłoszeniu, podobnie jak wcześniej GPT-5.4, i prosi o zastąpienie identyfikatora wszędzie tam, gdzie został jawnie wybrany, włącznie z zaplanowanymi zadaniami i skryptami. Jeśli chodzi o narzędzia, Claude Code publikuje trzy wersje w ciągu 22 godzin, Kimi Code wydaje poprawkę niecałe 19 godzin po poprzedniej wersji, a Gemini CLI przenosi do kanału stable, tydzień później, preview z 8 września. Jednocześnie v0, który dotychczas dodawał modele do swojego selektora pojedynczo, deklaruje niezależność od modeli i opiera się na Vercel AI Gateway: model staje się tam wymiennym komponentem.
Źródła
- Google, Gemini 3.8 Live i 3.8 Live Extended Thinking
- Google, wpis dla deweloperów na temat Live API
- Google DeepMind, karta modelu Gemini 3.8 Audio
- Google DeepMind na X, ogłoszenie Gemini 3.8 Live
- Claude Code, informacje o wersji 2.1.271
- Claude Code, informacje o wersji 2.1.273
- Claude, Bringing Salesforce into Claude
- Centrum pomocy Claude, konfigurowanie Salesforce in Claude
- OpenAI, dziennik zmian ChatGPT i Codex dotyczący wycofania GPT-5.5
- ChatGPT na X, koniec GPT-5.5 w ChatGPT, ChatGPT Work i Codex
- Perplexity, Perplexity comes to more Windows PCs with HP
- Cognition, umowa z AWS
- Devin, Bringing macOS to Devin
- NVIDIA, deterministyczne wykonywanie Groq 3 LPX
- NVIDIA, odporność NVLink 6
- Google, nowe narzędzia do nauki w Gemini Notebook
- Google Antigravity, dziennik zmian
- Hugging Face, IBM Research i spójność agentów z ALTK-Evolve
- PR Times, komunikat prasowy Aillis
- Sakana AI na X, udostępnienie komunikatu prasowego Aillis
- Google, AI & Economy ATLAS
- Google, AI dla wszystkich, w każdym języku
- Google.org, laureaci AI for Government Innovation
- Google, Building AI to accelerate science and improve lives
- Google, wykrywanie pożarów lasów za pomocą AI
- Claude, Building an AI-native revenue organization
- Perplexity, Shadow AI
- v0 na X, wybór modeli za pośrednictwem Vercel AI Gateway
- Warp, Adopting The Software Factory Model
- Kimi Code, informacje o wersji 0.43.1
- Gemini CLI, informacje o wersji v0.60.0
- GitHub Changelog, sugestie niestandardowych właściwości od Copilot
- Grok Imagine na X, edycja tekstu na obrazach
- MiniMax na X, H3 z SGLang-Diffusion i VDN-H3
- Google Research, Retrieve-for-Train
- NVIDIA, modele gęste lub MoE
- NVIDIA, FLARE z Docker, Kubernetes i Slurm
- Sakana AI, aktualizacja Marlin
- Hugging Face, ShadowPEFT w PEFT
- Hugging Face, RiverRider i lokalizowanie plików
- Hugging Face, EcoHash i dekodowanie spekulatywne
- Hugging Face, DINO-X