Szukaj

Google wprowadza Gemini 3.8 Live, Salesforce trafia do Claude, a GPT-5.5 opuści ChatGPT 14 października

ai-powered-markdown-translator

Artykuł przetłumaczony z francuskiego na polski za pomocą gpt-5.6-sol.

Zobacz projekt na GitHubie ↗

W ten wtorek Google wprowadza Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking, dwa modele dialogu głosowego działające w czasie rzeczywistym, które potrafią wywoływać narzędzia w tle bez przerywania rozmowy. Anthropic publikuje trzy wersje Claude Code i wprowadza Salesforce do Claude, a OpenAI wyznacza 14 października jako datę wycofania GPT-5.5 z ChatGPT i Codex. Agenci trafiają również do istniejących kanałów dystrybucji — od HP, które preinstaluje Perplexity, po Devin sprzedawany w AWS Marketplace — a NVIDIA przedstawia szczegóły dwóch elementów swojej platformy Vera Rubin.


Gemini 3.8 Live i 3.8 Live Extended Thinking — dwa modele głosowe, które działają podczas rozmowy

15 września — Google wprowadza dwa modele dialogu głosowego działające w czasie rzeczywistym, zaprezentowane przez zespół Gemini Audio. Gemini 3.8 Live jest ukierunkowany na skalę, szybkość i koszt: przyjmuje dane wizualne niemal w czasie rzeczywistym i automatycznie przełącza się między 97 językami w toku rozmowy. Gemini 3.8 Live Extended Thinking jest przeznaczony do zadań wymagających wieloetapowego rozumowania: jednocześnie rozumuje i mówi, potwierdza przyjęcie polecenia krótkimi wstępami słownymi oraz informuje o postępach zadań wykonywanych w tle; poziom jego rozumowania można ustawić w API. Oba modele wykonują wywołania narzędzi i API w tle (asynchronous function calling), podczas gdy odpowiedź dźwiękowa jest kontynuowana.

The models talk, think, and handle tasks in the background without breaking your flow.

🇵🇱 Modele mówią, rozumują i wykonują zadania w tle bez przerywania toku rozmowy.@GoogleDeepMind na X

Google podkreśla również dokładność rozpoznawania dyktowanych danych alfanumerycznych, takich jak kody potwierdzające czy numery spraw, i przedstawia te modele jako prostszą alternatywę dla architektur kaskadowych, które kolejno wykonują transkrypcję, przetwarzanie tekstu i syntezę mowy. Według karty modelu Gemini 3.8 Audio bazują one na Gemini 3 Pro, przyjmują dźwięk, obrazy, wideo i tekst w kontekście 128K tokens, generują do 64K tokens na wyjściu i wykorzystują wiedzę aktualną do stycznia 2025 roku.

Ranking lub benchmarkOceniany modelWynik opublikowany przez Google
Wskaźnik Speech to Speech Quality (Artificial Analysis)3.8 Live Extended Thinking82,6 (1. miejsce)
τ-Voice3.8 Live Extended Thinking68,6 %
τ-Voice-banking (Sierra)3.8 Live Extended Thinking35,1 %
Big Bench Audio3.8 Live Extended Thinking97,7 %
Speech Agent Arena (Artificial Analysis)3.8 Live2. miejsce

Rankingi te są prowadzone przez podmioty zewnętrzne, ale przytoczone wyniki pochodzą z publikacji Google. W Live API Google szacuje koszt obu modeli na 0,005 dolara za minutę dźwięku wejściowego i 0,018 dolara za minutę dźwięku wyjściowego, przy stawce 3 dolarów za milion tokens na wejściu i 12 dolarów na wyjściu; Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel i Vision Agents są wymieniane jako integratorzy.

Kanał dystrybucjiGemini 3.8 LiveGemini 3.8 Live Extended Thinking
Gemini API i Google AI StudioOd 15 wrześniaOd 15 września
Gemini EnterprisePrywatna wersja zapoznawczaPrywatna wersja zapoznawcza
Użytkownicy indywidualniSearch LiveGemini Live, Docs Live (subskrybenci Google AI Pro i Ultra), Gmail Live i Keep Live (wszyscy subskrybenci Google AI)

W Search Live model prowadzi użytkownika krok po kroku przez rozwiązywanie problemu w czasie rzeczywistym. Cały generowany dźwięk zawiera niewidoczny znak wodny SynthID.

🔗 Przedstawiamy Gemini 3.8 Live i 3.8 Live Extended Thinking 🔗 Wpis dla deweloperów o Live API 🔗 Karta modelu Gemini 3.8 Audio


Claude Code 2.1.271–2.1.273: tryb szybki w Remote, sieć konfigurowana dla każdej komendy i zaostrzone uprawnienia

15 września — Anthropic publikuje trzy wersje Claude Code w ciągu nieco ponad 22 godzin, pierwszą tuż po północy czasu paryskiego.

Opublikowana wersjaData i godzina (UTC)Zawartość informacji o wydaniu
2.1.27114 września, 22:1296 wierszy: tryb szybki w Remote, allowed_domains dla każdej komendy, omitClaudeMd, --accept-command
2.1.27215 września, 0:42Jeden wiersz: poprawki błędów i zwiększenie niezawodności
2.1.27315 września, 20:2364 wiersze: nagłówki dla bram LLM, duplikowanie sesji Remote Control, lokalny klasyfikator w Bedrock, Vertex i Foundry

Wersja 2.1.271 udostępnia tryb szybki (fast mode) sesjom Claude Code Remote, zarówno w chmurze, jak i na samodzielnie hostowanych środowiskach wykonawczych (self-hosted runners), tam, gdzie organizacja na to zezwala. W trybie automatycznym z sandboxem Bash, PowerShell i Monitor przyjmują listę allowed_domains dla każdej komendy: wymagane hosty są sprawdzane wraz z komendą i udostępniane wyłącznie na czas jej wykonania, a pozostałe są odrzucane. Pole omitClaudeMd w frontmatter agentów uruchamia subagenta bez plików CLAUDE.md użytkownika, projektu i lokalnych, przy czym pliki zarządzanych zasad pozostają załadowane, a claude plugin install --accept-command <sha256> akceptuje wyłącznie dokładną komendę wyświetloną podczas wcześniejszego przejścia w --json, zamiast -y. Wersja 2.1.273 umożliwia zduplikowanie (fork) w aplikacji Claude sesji uruchomionej za pomocą claude --remote-control; zduplikowana sesja działa następnie w tle na komputerze. Ostrzega również, gdy serwer MCP traci połączenie i automatyczne ponowne łączenie zostaje przerwane, oraz dodaje nagłówki żądań dla bram LLM, aktywowane przez CLAUDE_CODE_GATEWAY_HINT_HEADERS=1.

Zmieniony elementNowe zachowanie
Powrót subagenta w trybie automatycznymDedykowane wywołanie zwrotne (hand-back call) sprawdzane przez klasyfikator bezpieczeństwa zamiast późniejszej kontroli jego ostatniej wiadomości
Komendy ! skills i komendy slash w trybie automatycznymReguły uprawnień trybu domyślnego zamiast klasyfikatora
Monitorowanie przez MonitorObowiązkowy limit czasu wynoszący maksymalnie 30 minut (10 przy wykonywaniu -p), z powiadomieniem Claude o konieczności ponownego uruchomienia
Dynamiczne workflowsWstrzymanie po osiągnięciu limitu użycia i automatyczne wznowienie po jego zresetowaniu zamiast porzucenia agentów
Tryb automatyczny w Bedrock, Vertex i Foundry (2.1.273)Na razie domyślnie lokalny klasyfikator, CLAUDE_CODE_AUTO_MODE_SERVER=1 dla klasyfikatora platformy

Obie wersje poprawiają także kilka mechanizmów kontroli uprawnień. Komendy zawierające subshell, dwie zmiany katalogu lub ciąg cd + git pomijały monit przy permissions.blockReadsOutsideWorkingDirectories, a subshell mógł ukryć niebezpieczne rm w trybie omijania uprawnień (bypass). Ustawienia MCP narzucone przez MDM lub managed-settings.json były ignorowane, gdy tylko istniały ustawienia zarządzane po stronie serwera. /resume i /teleport zachowywały historię plików odczytanych w poprzedniej rozmowie, przez co Claude mógł modyfikować pliki, których wznowiona rozmowa nigdy nie odczytała. Wreszcie wskaźnik kontekstu liczył tury narzędzia advisor jako około dwukrotnie większe niż w rzeczywistości, co uruchamiało automatyczną kompakcję mniej więcej w połowie okna.

Żadna z trzech informacji o wydaniu nie wspomina o Claude Mods zapowiedzianych 14 września; w zgłoszeniu #91870 testerzy ze społeczności uważają jednak, że wersja 2.1.272 już wpłynęła na ich działanie.

🔗 Informacje o wydaniu Claude Code 2.1.271 🔗 Informacje o wydaniu Claude Code 2.1.273


Salesforce in Claude — plugin sprzedażowy w wersji beta dla zatwierdzonych organizacji

15 września — Anthropic uruchamia w wersji beta Salesforce in Claude, który udostępnia w Claude konta, szanse sprzedaży i pipeline handlowca. Wpis przedstawia plugin opracowany wspólnie z Salesforce, podczas gdy centrum pomocy przypisuje Salesforce stworzenie jego 37 sprzedażowych skills: wyszukiwania kont, przygotowywania rozmów, przeglądu pipeline’u czy aktualizacji CRM. Towarzyszą mu dwa connectory: Salesforce z uprawnieniami do odczytu i zapisu oraz Slack do kanałów biznesowych i wątków zespołowych.

Salesforce pozostaje systemem referencyjnym: każdy handlowiec loguje się własnymi danymi uwierzytelniającymi, Claude odczytuje wyłącznie dane dopuszczone przez jego uprawnienia Salesforce, a każda operacja zapisu domyślnie wymaga zatwierdzenia. Plugin działa w chat i Claude Cowork (w wersji webowej i desktopowej). Wersja beta obejmuje płatne plany, ale tylko organizacje zaakceptowane przez Salesforce za pośrednictwem formularza rejestracyjnego do bety i dysponujące najnowszą edycją Enterprise usługi Sales Cloud; ich administratorzy Salesforce składają wniosek o dostęp w AgentExchange. GitLab, Siemens i Legora wdrożyły rozwiązanie, a korzysta z niego 7 000 handlowców Salesforce.

🔗 Wprowadzenie Salesforce do Claude 🔗 Konfigurowanie Salesforce in Claude dla organizacji


GPT-5.5 opuści ChatGPT, ChatGPT Work i Codex 14 października, ale pozostanie w API

15 września — OpenAI ogłasza na X zakończenie obsługi GPT-5.5 w swoich aplikacjach, co zostało już wpisane do changelogu ChatGPT i Codex z datą 14 września. 14 października model zostanie wycofany z ChatGPT, ChatGPT Work i Codex we wszystkich planach: dla użytkowników indywidualnych, Business, Enterprise i Edu.

Objęty obszarStan na 14 października
ChatGPT i ChatGPT WorkGPT-5.5 wycofany ze wszystkich planów
Codex z logowaniem przez ChatGPTGPT-5.5 wycofany, wymagane przejście na gpt-5.6-sol
Codex z kluczem APIGPT-5.5 nadal dostępny
OpenAI APIGPT-5.5 nadal dostępny

W przypadku Codex z logowaniem przez ChatGPT dokumentacja zaleca zastąpienie gpt-5.5 wszędzie tam, gdzie został wybrany jawnie: w domyślnych parametrach workspace’u, zapisanych ustawieniach, zarządzanych konfiguracjach, niestandardowych agentach, zaplanowanych zadaniach i skryptach. Wiadomość z konta @ChatGPT wymienia również GPT-6 Astra jako następcę w Codex. Przewodnik dla administratorów ostrzega, że zmiana modelu domyślnego nie zapewnia dostępu do modelu: dla każdego klienta trzeba sprawdzić, czy następca jest dostępny dla odpowiednich użytkowników. OpenAI ponownie stosuje miesięczny okres wyprzedzenia wykorzystany w przypadku GPT-5.4 i GPT-5.4 mini, które 31 sierpnia wycofano z Codex dla użytkowników zalogowanych przez ChatGPT po ogłoszeniu z 31 lipca.

🔗 Changelog ChatGPT i Codex 🔗 Wiadomość od @ChatGPT na X


HP preinstaluje Perplexity na swoich komputerach z Windows i dodaje połączenie z Autodesk Revit

15 września — Perplexity i HP ogłaszają preinstalowanie aplikacji Perplexity dla Windows na pasku zadań komputerów tego producenta, począwszy od mobilnej stacji roboczej ZBook Ultra G3a wyposażonej w procesory AMD Ryzen AI Max PRO serii 400; w nadchodzących miesiącach dołączą kolejne modele, ale nie podano ich listy, cen ani dat. Według wpisu możliwości lokalnej AI w ZBook Ultra G3a pozwalają wykonywać typowe zadania za pomocą Portable Computer, lokalnej wersji agenta działającej bez kredytów chmurowych i bez połączenia z siecią, lecz jej dostępność zależy od konfiguracji urządzenia: wpis nie wymienia zgodnych konfiguracji, podczas gdy opublikowana dzień wcześniej wersja dla Windows wymagała GPU NVIDIA RTX z co najmniej 24 GB pamięci wideo.

Portable Computer łączy się również z Autodesk Revit, oprogramowaniem do modelowania informacji o budynku (Building Information Modeling), za pośrednictwem serwera MCP programu Revit 2027, oferowanego w technicznej wersji zapoznawczej (Tech Preview) jako osobny moduł. Dostęp jest tylko do odczytu: agent odpowiada na pytania dotyczące modelu, takie jak liczba drzwi na danym piętrze lub ich klasa odporności ogniowej, oraz eksportuje widoki, pliki PDF i zestawienia bez modyfikowania modelu. Personal Computer for Windows jest dostępny dla subskrybentów Pro, Max i Enterprise w systemach Windows 10 i 11.

🔗 Perplexity trafia na więcej komputerów z Windows dzięki HP


Cognition podpisuje umowę z AWS i uruchamia macOS w Devin Cloud

15 września — Cognition publikuje tego samego dnia dwa ogłoszenia powiązane infrastrukturą: komputery Mac, na których Devin tworzy teraz aplikacje Apple, są hostami AWS EC2 Mac.

Strategiczne porozumienie o współpracy z AWS

Cognition i Amazon Web Services zawierają wieloletnie strategiczne porozumienie o współpracy (Strategic Collaboration Agreement), przy czym we wpisie nie podano ani jego wartości, ani dokładnego czasu trwania. Dwa elementy są już dostępne: Devin można kupić za pośrednictwem AWS Marketplace, a Agent Toolkit for AWS można używać bezpośrednio w Devin. Rozważane są bardziej zaawansowane integracje ze środowiskami AWS klientów, ale nie podano harmonogramu. Devin jest wdrażany w środowisku przeznaczonym dla jednego klienta (single-tenant), w regionie AWS wybranym przez klienta, a dane są przechowywane w dedykowanym VPC; każda sesja działa na osobnej maszynie wirtualnej, usuwanej po zakończeniu pracy.

Klient wymieniony przez CognitionOgłoszony rezultat
Mercedes-BenzPrzeanalizowano ponad 200 000 linii COBOL-u, projekt szacowany na osiem miesięcy skrócono do ośmiu dni
Nienazwany producent samochodówPrzepływ COBOL liczący 25 000 linii przeniesiono z komputera centralnego (mainframe) do AWS Lambda, szacowany koszt niższy o 73 %

🔗 Wpis Cognition o porozumieniu z AWS

macOS trafia do Devin Cloud

Już 31 lipca Cognition prezentowało działających w chmurze agentów Devin pod macOS, z Xcode i symulatorem iOS. Premiera z 15 września w Devin Cloud, umożliwiająca tworzenie i testowanie aplikacji na iPhone’a, iPada i Maca, przynosi kilka nowości: Devin wysyła na Slacku nagranie ekranu ze swoich testów, przekazuje link TestFlight do zainstalowania aplikacji, a nowy panel iOS Simulator pokazuje uruchomioną aplikację. Agent obsługuje również aplikacje za pośrednictwem ich drzewa dostępności, udostępnionego jego narzędziu do korzystania z komputera (computer use): wyszukuje element sterujący według jego roli i nazwy, wykonuje na nim działanie, a następnie ponownie odczytuje drzewo; zrzuty ekranu nadal służą do oceny wyglądu. Warstwa ta opiera się na otwartoźródłowym accessibility-cli firmy Dioxus, której zespół dołączył do Cognition 10 września.

Maszyny wirtualne macOS działają z użyciem Virtualization.framework firmy Apple na fizycznych komputerach Mac w AWS EC2 Mac, a do systemu migawek (snapshots) dodano interfejs NBD (Network Block Device), aby można było wznowić sesję bez utrzymywania włączonej maszyny. Brama Ethernet działająca w przestrzeni użytkownika zastępuje zarządzany przez Apple NAT, aby stosować politykę sieciową każdej sesji. Nie podano ani ceny, ani planu, którego dotyczy ta funkcja.

🔗 Wprowadzenie macOS do Devin


15 września — Dwa wpisy na technicznym blogu NVIDIA wyjaśniają, w jaki sposób platforma Vera Rubin oszczędza energię podczas inferencji i radzi sobie z awariami swojej sieci. Poniższe dane pochodzą od NVIDIA.

Groq 3 LPX — deterministyczne wykonywanie zmniejszające margines napięcia

Uruchomienie produkcyjne Groq 3 LPX opisano tutaj 24 sierpnia; ten wpis wyjaśnia jego mechanizm. Przed rozpoczęciem wykonywania kompilator układów LPU określa z dokładnością do cyklu zegara moment każdego obliczenia i każdego transferu danych między 256 układami w szafie, dzięki czemu może przewidywać pobór prądu. Wykorzystują to dwie technologie: Preemptive Power (PEP) nakazuje sieci zasilającej podnieść napięcie tuż przed szczytem zapotrzebowania, a Clock Period Synthesis (CPS) wydłuża cykle zegara, podczas których natężenie prądu rośnie najszybciej. Celem jest zmniejszenie marginesu napięcia (voltage guardband), utrzymywanego w każdym układzie, który jest kosztowny, ponieważ moc rośnie proporcjonalnie do kwadratu napięcia: napięcie wyższe o 10 % oznacza moc wyższą o 21 %.

W testach wewnętrznych spadek napięcia zmniejszył się o ponad 60 %. NVIDIA szacuje, że przy takim samym obciążeniu wymagana moc może spaść o „kilkanaście procent” (low-double-digit) w porównaniu z podobnym systemem niedeterministycznym. Mechanizmy te trafią do Vera Rubin w drugiej połowie 2026 roku.

🔗 Wpis NVIDIA o deterministycznym wykonywaniu w Groq 3 LPX

NVLink 6 łączy 72 procesory GPU Rubin w szafie Vera Rubin NVL72 w jedną domenę; deklarowana przez NVIDIA dziesięciokrotnie większa niż w ogólnych rozwiązaniach Ethernet przepustowość pakietów była już wspomniana tutaj 21 lipca. Tym razem wpis szczegółowo omawia odporność na awarie, warstwa po warstwie.

Poziom stosuMechanizm opisany przez NVIDIA
Warstwa fizycznaUproszczona korekcja błędów, uzupełniona retransmisją na poziomie fizycznym (Physical Layer Retry)
Warstwa łączaSterowanie przepływem oparte na kredytach (credit-based flow control), z założenia bez utraty pakietów
Zarządzanie łączamiProgramowe przywracanie działania w około 1,5 sekundy za pośrednictwem NMX Controller
Usługa inferencjiShadow Engine Recovery (NVIDIA Dynamo): skrócenie przerwy z 283 do 7,3 sekundy na GPU B200
Checkpointy wielowęzłowecuda-checkpoint obsługiwany przez NCCL w wersji prototypowej, ogólna dostępność oczekiwana do końca roku

Sterowanie przepływem oparte na kredytach wysyła pakiet tylko wtedy, gdy następny węzeł ma miejsce na jego odebranie, podczas gdy Ethernet opiera się na PFC i ECN. Z kolei Shadow Engine Recovery utrzymuje replikę silnika inferencyjnego, już zainicjalizowaną z własnymi komunikatorami NCCL.

🔗 Wpis NVIDIA o odporności NVLink 6


Gemini Notebook zapowiada rozmowy głosowe z notebookami i rejestrator dźwięku

15 września — Z okazji rozpoczęcia roku akademickiego Gemini Notebook zmienia wygląd i zapowiada serię narzędzi do nauki, z których większość zostanie udostępniona dopiero później.

Zapowiedziane narzędzie do naukiPodana dostępność
Rozmowa głosowa w czasie rzeczywistym z notebookami, na urządzeniach mobilnych, w niemal 100 językachW tym tygodniu dla pełnoletnich subskrybentów Google AI Ultra, wkrótce dla Google AI Pro i pozostałych użytkowników
Rejestrator dźwięku w aplikacji mobilnejOd przyszłego tygodnia
Interaktywne materiały edukacyjne w ReportsW najbliższych tygodniach, dla wszystkich użytkowników
Quizy z krótką odpowiedzią, wielokrotnego wyboru lub z lukamiW najbliższych tygodniach, dla wszystkich użytkowników
Short Video Overviews w ponad 80 językach, z możliwością udostępnianiaDostępne już teraz, wobec ponad 70 języków 1 września

Rozmowa głosowa będzie odpowiadać na podstawie źródeł w notebooku i będzie można przerwać ją głosem, natomiast rejestrator pozwoli zapisać wykład lub przemyślenia bezpośrednio w notebooku, obok źródeł. Materiały edukacyjne będą łączyć podsumowania, infografiki, quizy i fiszki (flashcards). Jeśli chodzi o oferty studenckie, przedstawione już w sierpniu, Google wyjaśnia, że bezpłatny rok Google AI Pro dla studentów w Stanach Zjednoczonych czterokrotnie zwiększa limity w Gemini Notebook, a roczna oferta Google AI Plus dostępna na ponad 140 innych rynkach podwaja je.

🔗 Udoskonal swoją rutynę nauki dzięki nowym narzędziom Gemini Notebook


Antigravity 2.14.0 udostępnia zintegrowany terminal i Git kontom Enterprise i Business

15 września — Antigravity 2.14.0, zawierający 10 ulepszeń i 18 poprawek, udostępnia kontom Enterprise i Business zintegrowany terminal oraz kontrolę wersji Git na pasku bocznym, które dla pozostałych kont pojawiły się w wersji 2.10.0 z 24 sierpnia. Rozmowy z bardzo długą historią ładują się szybciej i zużywają mniej pamięci, a nadmiarowa analiza skills, reguł i plików personalizacji, uruchamiana ponownie przy każdej wiadomości, została usunięta.

Wśród poprawek znalazła się obsługa przejściowego błędu usługi, który nie kończy już sesji: operacja jest ponawiana z rosnącym opóźnieniem przez około dwanaście minut. Zakończone sub-agenty nie są już wyświetlane jako aktywne, blokując kolejne wiadomości aż do ponownego uruchomienia, a wyciek pamięci związany z danymi wyjściowymi poleceń terminala został naprawiony. Tytuł wydania wspomina o nowym systemie uprawnień, ale informacje o wersji ograniczają się w tej kwestii do zmiany nazwy sekcji ustawień ogólnych na „Global Permissions” oraz opcji dziedziczenia ustawień projektu na „Inherit Global”.

🔗 Dziennik zmian Google Antigravity


IBM Research zmniejsza o połowę lukę spójności agenta dzięki ALTK-Evolve

15 września — Na blogu Hugging Face IBM Research publikuje trzecią część swojej serii ALTK-Evolve, tym razem poświęconą spójności wykonywania zadań przez agentów. W 168 zadaniach AppWorld agent ReAct działający na GPT-4.1 z temperaturą ustawioną na 0 osiąga średnio powodzenie w 77,4 % wykonań w pięciu próbach (Mean@5), lecz wszystkie pięć prób kończy powodzeniem tylko w przypadku 53,0 % zadań (Pass^5). IBM nazywa tę różnicę wynoszącą 24,4 punktu luką spójności (consistency gap).

Consistency Analyzer wykrywa niestabilne decyzje na podstawie pojedynczej zarejestrowanej trajektorii: odtwarza offline każdy krok, żądając pięciu uzupełnień, bez danych referencyjnych, bez ponownego uruchamiania zadania i bez dostępu do logitów. Wrażliwe kroki są przekształcane we wskazówki dotyczące spójności (consistency guidelines), wstrzykiwane podczas inferencji.

Konfiguracja agentaWynik Mean@5Wynik Pass^5Luka spójności
ReAct GPT-4.1 bez wskazówek77,4 %53,0 %24,4 punktu
ReAct GPT-4.1 ze wskazówkami dotyczącymi spójności81,0 %69,0 %12,0 punktów

W przypadku gpt-oss-120b wynik Pass^5 wzrasta z 10,1 % do 16,1 %. Analyzer i generowanie wskazówek są zintegrowane z otwartoźródłowym repozytorium ALTK-Evolve.

🔗 Wpis IBM Research na blogu Hugging Face


Aillis wdraża Sakana Namazu w Evidence Finder, osiągając 96,4 % na japońskim państwowym egzaminie lekarskim

14 września — Aillis, japońska firma opracowująca urządzenia medyczne oparte na uczeniu maszynowym, wdraża Sakana Namazu — specjalizowany w języku japońskim LLM wprowadzony na początku sierpnia przez Sakana AI — w swoim narzędziu Evidence Finder do wyszukiwania dowodów naukowych dla lekarzy. Komunikat opublikowany o godz. 11 czasu tokijskiego został udostępniony przez Sakana AI na X tego samego dnia o godz. 15:30 czasu pacyficznego, po naszym zestawieniu z 14 września. Evidence Finder tworzy na podstawie literatury medycznej odpowiedzi cytujące źródła, których istnienie sprawdza funkcja Verify; obie firmy rozpoczynają również wspólne prace nad zastosowaniami medycznymi.

Wersja Evidence Finder oparta na Sakana Namazu uzyskuje 96,4 % (482 punkty na 500) podczas 120. edycji japońskiego państwowego egzaminu lekarskiego w lutym 2026 roku. Według zestawienia Aillis z 1 września jest to najlepszy wynik wśród krajowych modeli bazowych wyznaczonych przez program GENIAC japońskiego Ministerstwa Gospodarki. W komunikacie zamieszczono dwa zastrzeżenia: na potrzeby tego testu zniesiono ograniczenia produktu, w tym odrzucanie pytań zawierających obrazy, podczas gdy usługa komercyjna obsługuje wyłącznie pytania tekstowe; ponadto Evidence Finder nie jest urządzeniem medycznym.

🔗 Komunikat Aillis w PR Times 🔗 Udostępnienie Sakana AI na X


Google przedstawia dane o wykorzystaniu AI i jej wpływie społecznym

15 września — Tego samego dnia Google publikuje dwie serie wpisów poświęconych rzeczywistemu wykorzystaniu AI i jej skutkom społecznym.

AI & Economy ATLAS zostaje udostępniony publicznie wraz z badaniem dotyczącym naukowców

AI & Economy ATLAS, program badawczy biura głównego ekonomisty Google, z którego pochodziły przytoczone tutaj 9 września dane dotyczące formalności administracyjnych, staje się ogólnodostępnym interaktywnym narzędziem: można w nim porównywać wykorzystanie AI według zawodów, w domu oraz w poszczególnych krajach.

Wyróżniony wskaźnik ATLASWartość opublikowana przez Google
Indie: udział zawodów związanych ze sztuką, projektowaniem i mediami w profesjonalnym wykorzystaniu AI19 %, czyli 1,6 raza więcej niż średnia światowa
Stany Zjednoczone: udział informatyki i matematyki30 %, dwa razy więcej niż w pozostałej części świata
Brazylia i Niemcy: udział zadań manualnych, takich jak diagnostyka sprzętu7 %, wobec 4 % w Japonii

Badanie Google, Google DeepMind i MIT FutureTech, oparte na analizie 2 600 specjalistycznych modeli AI oraz ankiecie przeprowadzonej wśród ponad 600 naukowców ze Stanów Zjednoczonych i Wielkiej Brytanii, wskazuje, że niemal połowa z nich korzysta z AI codziennie i deklaruje oszczędność nieco poniżej 7 godzin tygodniowo. Autorzy zwracają również uwagę na minusy: czas poświęcany na weryfikację wyników generowanych przez AI oraz rosnącą kolejkę nieprzetestowanych hipotez, oczekujących na eksperymenty fizyczne i walidacje kliniczne.

🔗 Nowe wnioski z AI & Economy ATLAS firmy Google

AI for Societal Impact: języki, laureaci Google.org i FireSat

Według Google technologie grupy działają w ponad 300 językach, którymi posługuje się ponad 7 miliardów osób, a kilka zbiorów danych opracowano z lokalnymi partnerami. Google prezentuje również Language Explorer, interaktywne narzędzie wizualizujące otwartą bazę LinguaMeta.

Inicjatywa wymieniona przez GooglePodana wartość
WAXAL, otwarty korpus głosowy27 języków Afryki Subsaharyjskiej
Project VaaniPonad 30 000 godzin mowy w 109 językach
Google.org Impact Challenge: AI for Government Innovation15 laureatów, 30 milionów dolarów, ponad 2 600 zgłoszeń
FireSatPierwsza partia działających satelitów na orbicie, docelowo około pięćdziesięciu do 2030 roku, aby wykonywać zdjęcie co 20 minut
Planetary Prediction Engine, zaprezentowany pod koniec sierpniaWedług Google 83% powstających ognisk Eboli w Demokratycznej Republice Konga wykryto z wyprzedzeniem

Laureaci Google.org, wśród nich Code for America za rozwiązanie do składania zeznań podatkowych oraz Johns Hopkins University za projekt dotyczący bezpieczeństwa drogowego, korzystają z wolontariackiego wsparcia inżynierów Google i projektują swoje rozwiązania jako otwarte modele wielokrotnego użytku.

🔗 AI dla wszystkich, w każdym języku 🔗 15 organizacji przekształcających usługi publiczne za pomocą AI 🔗 Tworzenie AI, aby przyspieszyć naukę i poprawić jakość życia 🔗 Wykrywanie pożarów lasów za pomocą AI


W skrócie

  • Anthropic publikuje przewodnik dotyczący wdrażania Claude w zespołach sprzedażowych — wydany tego samego dnia co Salesforce in Claude dokument Building an AI-native revenue organization przedstawiono we wpisie, w którym wymieniono dwóch klientów: Cox Communications twierdzi, że w pierwszym roku uzyskał siedmiokrotny zwrot z inwestycji i obniżył o 86% koszt weryfikacji oraz wzbogacania danych o potencjalnych klientach, zwiększając dokładność z 18% do 97%, natomiast 88% spośród około 1 500 pracowników Cyera korzysta z Claude co tydzień. 🔗 źródło
  • Perplexity publikuje przewodnik na temat ukrytej AI (shadow AI) — wpis nie zawiera własnych danych i zestawia badania podmiotów trzecich: około połowa pracowników przyznaje, że złamała zasady swojej organizacji, korzystając z AI (KPMG), a 82% respondentów badania Cloud Security Alliance zgłasza obecność nieznanych agentów w systemach swojej organizacji. Kończy się on prezentacją argumentów na rzecz Perplexity Enterprise i Comet for Enterprise, bez żadnej nowej funkcji. 🔗 źródło
  • v0 staje się niezależny od modeli (model-agnostic) — według pojedynczego tweeta narzędzie Vercel do tworzenia aplikacji oferuje najnowocześniejsze, tanie, otwarte i szybkie modele udostępniane przez Vercel AI Gateway, w tym Claude, GPT, Kimi, GLM, Grok i DeepSeek; nie podano ani pełnej listy, ani cen, ani objętych tym rozwiązaniem planów. 🔗 źródło
  • Warp podaje dane liczbowe dotyczące swojej wewnętrznej fabryki oprogramowania — w opisującym trzyetapową metodę (crawl, walk, run) wdrażania fabryki oprogramowania (software factory) wpisie Zach Lloyd, CEO Warp, informuje, że fabryka firmy automatyzuje około 75% zmian w warp.dev, jej witrynie marketingowej; Warp Factories pozostaje we wczesnym dostępie, a zakwalifikowane przedsiębiorstwa otrzymują 10 000 dolarów na korzystanie z usługi. 🔗 źródło
  • Kimi Code 0.43.1 naprawia roje swoich subagentów — niecałe 19 godzin po wersji 0.43.0 Moonshot AI publikuje siedem poprawek, obejmujących zwalnianie pamięci po zakończeniu działania subagenta, odciążenie renderowania i pętli zdarzeń w dużych rojach oraz zmianę działania Ctrl+C, które przerywa teraz wyłącznie pracę subagentów, zamiast zamykać cały CLI. 🔗 źródło
  • Gemini CLI v0.60.0 trafia do kanału stable — wersja bez zmian przejmuje preview z 8 września i zawarte w nim jedenaście zmian zwiększających odporność, a v0.61.0-preview.0 rozpoczyna kolejną serię z trzema poprawkami opublikowanymi już w kanale nightly oraz poprawką pętli agenta. 🔗 źródło
  • Copilot sugeruje dozwolone wartości niestandardowych właściwości repozytoriów — podczas tworzenia niestandardowej właściwości (custom property) przedsiębiorstwa lub organizacji Copilot proponuje wartości, które można zaakceptować jednym kliknięciem; funkcja jest dostępna w publicznej wersji zapoznawczej dla Copilot Business i Enterprise oraz podlega zasadzie „Repository custom property suggestions”. 🔗 źródło
  • Grok Imagine umożliwia edycję tekstu na obrazach w wersji beta — narzędzie SpaceXAI do generowania obrazów i filmów pozwala retuszować tekst widoczny na dowolnym obrazie, takim jak zaproszenie, plakat czy reklama; w ogłoszeniu nie wskazano ani planów, ani platform, ani używanego modelu. 🔗 źródło
  • MiniMax H3 osiąga podczas odszumiania ponad dwukrotność prędkości czasu rzeczywistego — w tweecie opublikowanym 14 września o 16:34 czasu pacyficznego, po naszym zestawieniu z tego samego dnia, MiniMax informuje, że dzięki SGLang-Diffusion i VDN-H3 model H3 generuje 14,4 sekundy filmu 768p w 9,0 sekund na 8 GPU B200, bez zmierzonego pogorszenia jakości, rozwijając ekosystem H3 opisany 14 września. 🔗 źródło
  • Retrieve-for-Train destyluje uczenie przez wzmacnianie do małego modelu dyfuzyjnego — w tej pracy pochodzącej z artykułu ICML 2026 Google Research jednorazowo trenuje offline model o 4B parametrów metodą uczenia przez wzmacnianie (Reinforcement Learning), aby generował różnorodne podzapytania, a następnie destyluje to zachowanie do modelu dyfuzyjnego o 53,9 miliona parametrów, który tworzy cały zestaw w jednym przebiegu, zapewniając przyspieszenie od 12 do 20 razy. 🔗 źródło
  • NVIDIA ujmuje liczbowo wybór między modelem gęstym a mieszanką ekspertów (Mixture-of-Experts, MoE) — ten wpis edukacyjny porównuje Gemma 4 31B, Qwen3.8-27B, Nemotron 3.5 Lightning i Mistral Small 4 na podstawie danych Artificial Analysis zebranych 31 sierpnia: Lightning, mający 30B parametrów, z czego 3B aktywnych, działa od 4 do 5 razy szybciej niż Qwen3.8-27B za jedną czternastą ceny, osiągając mniej niż połowę jego wyniku zdolności. 🔗 źródło
  • NVIDIA FLARE 2.9 dodaje Slurm — framework uczenia federacyjnego (federated learning), który od wersji 2.8 obsługuje Docker i Kubernetes, pozwala teraz współdziałać wszystkim trzem środowiskom w ramach jednej federacji i wprowadza przenośny opis zasobów dla każdego zadania. 🔗 źródło
  • Sakana Marlin dodaje interaktywne czytanie i eksport do PowerPoint — dzięki interaktywnemu czytaniu (Interactive Reading) autonomiczny asystent badawczy Sakana AI umożliwia zadawanie agentowi pytań dotyczących jego raportu i otwieranie przywołanego źródła uzasadniającego dane stwierdzenie; eksportuje również edytowalne prezentacje PowerPoint zawierające adresy URL ich źródeł. 🔗 źródło
  • ShadowPEFT trafia do biblioteki PEFT — wpis społecznościowy: metoda, która dołącza do zamrożonego modelu małą, odłączaną sieć „cieniową”, została scalona z główną gałęzią PEFT i znajdzie się w jej kolejnej wersji; na Llama-3.2-3B autorzy uzyskali 48,1% w GSM8K wobec 46,9% dla LoRA, ale szczytowe zużycie pamięci wyniosło 28,2 GB wobec 22,3 GB. 🔗 źródło
  • RiverRider porównuje lokalizowanie plików z wynikiem losowym — indywidualny wkład: w SWE-bench Verified lokalny enkoder o 33 milionach parametrów umieszcza właściwy plik na pierwszym miejscu w 45,8% przypadków, ale punkt odniesienia wykorzystujący permutowane zapytania znajduje go już wśród pierwszych 50 wyników w 24,4% przypadków, co obniża stosunek sygnału do wyniku losowego z 45,8 do 3,9. 🔗 źródło
  • EcoHash podwaja współbieżność RTX PRO 6000 na Qwen3.8-27B — wpis dostawcy inferencji, cytowanego już 14 września w innym kontekście, oparty na pomiarach we własnej usłudze: włączenie w vLLM 0.27.1 głowicy modelu do przewidywania wielu tokenów (multi-token prediction, MTP) skraca czas na token z 22 do 13 ms i zwiększa utrzymywaną współbieżność z 32 do 64 zapytań — pułap ten osiągnięto w dwóch z czterech powtórzeń — kosztem 23% pojemności pamięci podręcznej KV. 🔗 źródło
  • DINO-X publikuje model badawczy dotyczący naczyń wątrobowych wraz z opisem niepowodzeń — model społecznościowy przeznaczony wyłącznie do badań: ten ViT-Base o 86 milionach parametrów osiąga zewnętrzne AUROC na poziomie 0,9413 na 17 639 przekrojach tomografii komputerowej, a jego autor publikuje również negatywne wyniki, w tym nieudostępniony model specjalistyczny dla jelita grubego z wynikiem 0,6529. 🔗 źródło

Co to oznacza

Głos staje się pełnoprawnym interfejsem agenta. Gemini 3.8 Live i jego wariant Extended Thinking wywołują narzędzia w tle, podczas gdy odpowiedź jest kontynuowana, oraz dbają o dokładność dyktowanych kodów i numerów, przy koszcie szacowanym za minutę dźwięku. Google natychmiast umieszcza wariant Extended Thinking, który informuje o postępach zadań wykonywanych w tle, w swoich narzędziach do pracy wraz z Docs Live, Gmail Live i Keep Live, a Gemini Notebook zapowiada z kolei rozmowę głosową opartą na źródłach każdego notebooka. Punkt ciężkości przesuwa się z jakości głosu na to, co model wykonuje w trakcie mówienia.

Drugi wątek dotyczy dystrybucji: agenci trafiają do narzędzi biznesowych kanałami, które już istnieją. Salesforce in Claude pojawia się ze skills sprzedażowymi, konektorami do CRM i Slack oraz zatwierdzaniem każdego zapisu; HP fabrycznie instaluje Perplexity na pasku zadań swoich komputerów i łączy je w trybie tylko do odczytu z projektami Revit; Devin można kupić w AWS Marketplace i wdrożyć w dedykowanym VPC. W każdym przypadku agent trafia do narzędzia, z którego firma już korzysta, wraz z jego zabezpieczeniami: uprawnieniami sprzedawcy w Salesforce, dostępem tylko do odczytu w Revit i dedykowanym VPC w AWS.

Trzeci wątek wiąże się z niezawodnością i kontrolą. Wersje 2.1.271 i 2.1.273 Claude Code przekazują wyniki subagentów do sprawdzenia przez klasyfikator, otwierają dostęp do sieci dla poszczególnych poleceń i naprawiają możliwości obchodzenia uprawnień za pomocą podpowłok lub ignorowanych ustawień MDM. IBM Research pokazuje, że agent ustawiony na temperaturę 0 może średnio pomyślnie ukończyć 77,4% uruchomień, lecz wszystkie pięć uruchomień zakończyć powodzeniem tylko w 53,0% zadań, i zaleca publikowanie Pass^k obok średniej. NVIDIA stosuje ten sam wymóg do sprzętu: NVLink 6 odzyskuje połączenie w około 1,5 sekundy, a Shadow Engine Recovery skraca przerwę w inferencji z 283 do 7,3 sekundy. Pytanie nie brzmi już tylko, czy agent odnosi sukces, lecz czy robi to za każdym razem i w możliwych do zweryfikowania granicach.

Ostatni wątek dotyczy tempa. OpenAI wycofa GPT-5.5 ze swoich aplikacji miesiąc po ogłoszeniu, podobnie jak wcześniej GPT-5.4, i prosi o zastąpienie identyfikatora wszędzie tam, gdzie został jawnie wybrany, włącznie z zaplanowanymi zadaniami i skryptami. Jeśli chodzi o narzędzia, Claude Code publikuje trzy wersje w ciągu 22 godzin, Kimi Code wydaje poprawkę niecałe 19 godzin po poprzedniej wersji, a Gemini CLI przenosi do kanału stable, tydzień później, preview z 8 września. Jednocześnie v0, który dotychczas dodawał modele do swojego selektora pojedynczo, deklaruje niezależność od modeli i opiera się na Vercel AI Gateway: model staje się tam wymiennym komponentem.


Źródła