Szukaj

Google Cloud uruchamia agenta Gemini do pracy, HeyGen Voice i dynamiczne workflow Claude Managed Agents

ai-powered-markdown-translator

Artykuł przetłumaczony z francuskiego na polski za pomocą gpt-6.1-sol.

Zobacz projekt na GitHubie ↗

Google Cloud zaprezentował 8 października na Gemini at Work 2026 agenta Gemini: jednego agenta do wszystkich zadań w firmie, który działa nieprzerwanie w chmurze i zarządza zarówno modelami Gemini, jak i modelami Claude. HeyGen z kolei wprowadza HeyGen Voice, swój pierwszy własny model głosowy, który obejmuje prowadzenie w rankingu Controlled Voice od Artificial Analysis, a Anthropic udostępnia w Claude Managed Agents workflow zdolne uruchomić do 1 000 agentów w ramach jednego uruchomienia. W obszarze kodowania Codex uczy się przewidywać kolejną wiadomość użytkownika i wprowadza w Windows nowy sandbox oparty na Microsoft Execution Containers.


Google Cloud uruchamia agenta Gemini, jednego agenta do wszystkich zadań w pracy

8 października — Na Gemini at Work 2026 Google Cloud zaprezentował agenta Gemini, którego opisuje jako jednego, uniwersalnego agenta do pracy. Z poziomu jednego pola wprowadzania i jednego API odpowiada on na pytania, wykonuje pracę intelektualną, tworzy obrazy i multimedia, pisze i wykonuje kod. Idea przedstawiona przez Thomasa Kuriana, dyrektora generalnego Google Cloud: powierza się mu cel zamiast sekwencji instrukcji.

Agent działa nieprzerwanie w chmurze, korzysta z jednej pamięci i jest dostępny wszędzie: w przeglądarce, na iOS, Androidzie, Windows i Mac, w wierszu poleceń, Google Workspace, Microsoft 365 i Slack, a także bez interfejsu (headless) w aplikacjach innych firm. Zadanie trwające kilka godzin lub kilka dni jest kontynuowane nawet przy zamkniętym komputerze. Przy długich zadaniach tworzy tymczasowych subagentów, z których każdy ma własną tożsamość, i może stać się agentem współpracownikiem (coworker agent) o stałej roli, z własnym adresem @agents.company.com i przestrzenią na dane. Wybór modelu staje się osobną decyzją: według Google agent zarządza już modelami Gemini i modelami Claude od Anthropic, a kolejne modele zamknięte i otwarte mają dołączyć później. Wersje branżowe trafiają do wersji zapoznawczej dla finansów (ponad 50 podstawowych skills, już wykorzystywanych przez CME Group i Deutsche Bank) i sektora prawnego.

Zapowiedziany element kontroliRola opisana przez Google
Tożsamość każdego agentaTożsamość poświadczona kryptograficznie, uprawnienia według ról, dziennik audytu przypisany do agenta
Agent SandboxIzolowane wykonywanie z własną granicą sieciową
Agent GatewayZapora sieciowa dla AI, przez którą przechodzi cały ruch agenta
Limity wydatków w czasie rzeczywistymW Cloud Billing agent projektu zostaje wstrzymany, wznowienie jednym kliknięciem

Google Cloud przedstawia też swoje dane: blisko 500 klientów przetworzyło po ponad 1 000 miliardów tokenów w ciągu roku, a prawie 90 % firm z Fortune 100 korzysta z Gemini Enterprise. Wpis nie podaje jednak ani daty udostępnienia, ani ceny samego agenta; Google Cloud wymienia jedynie dużych klientów, którzy przetestowali go przed premierą, takich jak marka sportowa On w zakresie dynamicznego wyboru modelu.

🔗 Gemini at Work 2026 (blog Google Cloud)

Gemini Enterprise udostępnia Claude Opus 5.5 i Claude Sonnet 5.5 w narzędziach Antigravity

8 października — Tego samego dnia informacje o wydaniu Gemini Enterprise informują o możliwości włączenia przez administratorów Claude Opus 5.5 i Claude Sonnet 5.5 w Antigravity 2.0, Antigravity CLI i rozszerzeniach Antigravity dla IDE. Administrator akceptuje warunki korzystania z tych modeli bezpośrednio w konsoli Google Cloud, bez osobnego konta Anthropic.

Parametr aktywacjiWartość podana przez Google
Stan domyślnyModele innych firm wyłączone, aktywacja przez administratorów
Tryb rozliczaniaWedług zużycia, w ramach limitu wydatków projektu
Lokalizacje inferencjiglobal, us i eu
Poziomy rozumowaniaLow, Medium (domyślnie), High lub Max

Programista zachowuje licencję Gemini Enterprise i wybiera Claude w selektorze modeli. Rozliczanie przekroczeń (overages) trzeba włączyć przed udostępnieniem modelu innej firmy, którego koszt wlicza się do limitu wspólnego dla wszystkich modeli. Ta sama strona zapowiada ogólną dostępność Gemini 3.8 Flash w Singapurze.

🔗 Informacje o wydaniach Gemini Enterprise


Głos: HeyGen Voice na szczycie rankingu Controlled Voice, Mistral publikuje dwa modele dla języka arabskiego

9 października — HeyGen wprowadza HeyGen Voice, który Joshua Xu przedstawia jako pierwszy model głosowy opracowany wewnętrznie przez firmę, znaną dotąd z awatarów. Model jest dostępny w HeyGen i przez API w cenie 30 dolarów za milion znaków; do 31 października użytkownicy API płacą 15 dolarów, a zniżka jest naliczana automatycznie.

Argumentem są wyniki Artificial Analysis, opublikowane półtorej minuty przed ogłoszeniem HeyGen. W rankingu Controlled Voice, w którym wszystkie modele mówią tymi samymi 8 sklonowanymi głosami w amerykańskiej i brytyjskiej odmianie angielskiego, HeyGen Voice zajmuje pierwsze miejsce z wynikiem Elo 1 201 przy 1 468 wystąpieniach. Zajmuje tam pierwsze miejsce w kategoriach Asystenci i Obsługa klienta, a także w brytyjskiej odmianie angielskiego.

HeyGen Voice takes the #1 spot on the Artificial Analysis Controlled Voice TTS Arena Leaderboard, ahead of Alibaba’s Qwen-Audio-3.1-TTS-Plus and ElevenLabs’ Eleven v4 Turbo

🇵🇱 HeyGen Voice zajmuje pierwsze miejsce w rankingu Controlled Voice TTS Arena od Artificial Analysis, wyprzedzając Qwen-Audio-3.1-TTS-Plus od Alibaba i Eleven v4 Turbo od ElevenLabs. — @ArtificialAnlys na X

Oceniany modelElo Controlled Voice (9 października)Cena API za milion znaków
HeyGen Voice1 20130 dolarów (15 do 31 października)
Qwen-Audio-3.1-TTS-Plus1 18219,3 dolara
Eleven v4 Turbo1 16640 dolarów
Eleven v41 16280 dolarów

To pierwsze miejsce ma ściśle określony zakres: dotyczy klonowania głosu. W rankingu Provider Voice, w którym każdy dostawca używa własnych głosów, wieczorem 9 października na czele nadal pozostawały Eleven v4 Turbo i Eleven v4, a HeyGen Voice nie znalazł się w pierwszej ósemce. Pod względem niezawodności wymowy HeyGen Voice uzyskuje 83,1 %, co daje mu 10. miejsce na 29.

W API klonowanie jest natychmiastowe: jedno nagranie, z którego wykorzystywane są tylko pierwsze trzy minuty, pozwala uzyskać aktywny głos w kilka sekund, bez treningu. Synteza odbywa się jednorazowo (plik WAV przy 44,1 kHz) lub strumieniowo, a Artificial Analysis ocenił domyślne ustawienia API.

🔗 Ogłoszenie HeyGen

Voxtral Mini 4B Realtime Arabic i LIDstral Arabic: dwa modele Mistral dla języka arabskiego

8 października — Mistral opublikował na Hugging Face, bez ogłoszenia, dwa otwarte modele na licencji Apache 2.0 przeznaczone dla języka arabskiego. Voxtral Mini 4B Realtime Arabic transkrybuje strumieniowo dialekty arabskie i współczesny standardowy język arabski, także wtedy, gdy rozmówcy zmieniają język w trakcie rozmowy (code-switching). Dostrojony na bazie Voxtral Mini 4B Realtime, ma około 4,4 miliarda parametrów. Według karty modelu został opracowany wspólnie z marokańskim Ministerstwem Transformacji Cyfrowej i Reformy Administracyjnej w ramach partnerstwa podpisanego między Mistral a Marokiem w styczniu 2026 roku, które zaowocowało również dwoma nowymi benchmarkami, ISMA i Darija in the Wild.

Opublikowany modelFunkcja modeluWynik według karty modelu
Voxtral Mini 4B Realtime ArabicStrumieniowa transkrypcja języka arabskiegoŚredni wskaźnik błędów znakowych 8,82 % w 7 benchmarkach przy 480 ms, wobec 7,91 % dla Voxtral Transcribe Arabic
LIDstral ArabicIdentyfikacja języka i dialektu, 51 klas, na procesorzeF1 wynoszące 88,67 % dla marokańskiej dariji, wobec 71,28 % dla GlotLID v3

🔗 Voxtral Mini 4B Realtime Arabic na Hugging Face · LIDstral Arabic na Hugging Face


Claude Managed Agents: dynamiczne workflow z nawet 1 000 agentów na uruchomienie

9 października — Anthropic udostępnia w publicznej wersji beta dynamiczne workflow (dynamic workflows) w Claude Managed Agents, nowy rodzaj orkiestracji wielu agentów. Agent prowadzący sesję sam pisze program, który serwer wykonuje w tle, uruchamiając wielu agentów etapami, a następnie łącząc ich wyniki. Po włączeniu typu multiagent_20261001 to agent decyduje o rozpoczęciu uruchomienia.

Jedno uruchomienie obejmuje do 1 000 agentów, w tym 64 jednocześnie, domyślnie trwa 24 godziny, a sesja może utrzymywać 10 otwartych uruchomień. Jego tokeny są rozliczane tak samo jak tokeny sesji i wliczają się do jej budżetu; Anthropic ostrzega, że może ich być dużo, i przytacza wewnętrzny test z 70 błędami celowo umieszczonymi w bazie kodu liczącej 116 000 wierszy.

Konfiguracja testu AnthropicBłędy znalezione w 3 próbach
Sam agent14, 15 i 27
Dynamiczny workflow66 w każdej próbie

🔗 Ogłoszenie @ClaudeDevs · Dokumentacja uruchomień workflow


Agenci do kodowania: przewidywanie wiadomości i sandbox MXC dla Codex, Claude Code 2.1.296, Vibe CLI 2.26.1

Codex otrzymuje dwie nowości tego samego dnia, a Anthropic i Mistral publikują nowe wersje swoich agentów działających w wierszu poleceń.

Codex przewiduje kolejną wiadomość użytkownika, w wersji beta dla abonentów Pro

9 października — OpenAI udostępnia w wersji beta przewidywanie wiadomości w edytorze (composer predictions) w aplikacji desktopowej Codex. Gdy Codex skończy odpowiadać, w polu wprowadzania może pojawić się sugestia kolejnej wiadomości, utworzona na podstawie bieżącego wątku, bez sięgania do pamięci ani połączonych aplikacji. Klawisz Tab ją wstawia; tekst można nadal edytować i nigdy nie jest wysyłany automatycznie. Sugestia obejmuje całą wiadomość, a nie uzupełnianie słowo po słowie.

Warunek wersji betaWartość podana przez OpenAI
Plan i wiekOsobisty ChatGPT Pro, 18 lat i więcej
Wątki i modeleWątki lokalne i SSH, z GPT-6 Astra lub GPT-6.1 Sol
Ustawienie domyślneWłączone, można wyłączyć w General > Composer > Show predictions
Koszt w wersji betaPoza limitami użycia Codex, bez zużywania kredytów

Wysłane wiadomości, w tym zaakceptowane przewidywania, nadal są rozliczane standardowo. Funkcja nie jest dostępna w Chat.

🔗 Ogłoszenie @OpenAIDevs · Artykuł pomocy OpenAI

Codex w Windows: sandbox oparty na Microsoft Execution Containers

9 października — OpenAI dodaje do Codex w Windows tryb sandbox oparty na Microsoft Execution Containers (MXC), które Microsoft udostępnił ogólnie 7 października. Wymaga on zgodnego urządzenia z Windows 11 (24H2 build 26100.9278 lub 25H2 build 26200.9278) i obiecuje szybszą konfigurację, ściślejszą kontrolę sieci oraz bardziej szczegółowe ustawienia dostępu do plików.

Według dokumentacji MXC staje się zalecaną implementacją: natywnie izoluje procesy, bez konfiguracji zatwierdzanej przez administratora, dodatkowych kont Windows ani lokalnych reguł zapory. Tryby elevated i unelevated stają się starszymi rozwiązaniami awaryjnymi. Aplikacja desktopowa sama wybiera MXC dla kont konsumenckich; w CLI lub w firmie włącza się go przez prefer_mxc = true w config.toml, a administrator może go zablokować przez allow_mxc = false. Udokumentowano dwa ograniczenia: zarządzana sieć wymaga allow_local_binding = true, a pozostałe procesy potomne są zatrzymywane po zakończeniu polecenia działającego na pierwszym planie.

🔗 Ogłoszenie @OpenAIDevs · Dokumentacja sandbox w Windows

Claude Code 2.1.296: compaction dla subagentów i jeden model dla agentów workflow

9 października — Claude Code 2.1.296 zawiera 79 pozycji, w tym 56 poprawek, i nie towarzyszył mu żaden tweet. Przede wszystkim daje większą kontrolę nad subagentami.

Nowość w wersjiCo zmienia
autoCompactWindow (subagenci, --agents)Subagent wykonuje compaction swojego kontekstu wcześniej niż główna rozmowa
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODELWszyscy agenci workflow korzystają z tego samego modelu, pozostali subagenci zachowują własny
Opcja allow_large w ReadOdczyt dużego pliku tekstowego w jednym wywołaniu, jeśli pozwala na to kontekst
CLAUDE_CODE_OVERLOADED_RETRY_MAX_DELAY_MSDłuższy maksymalny odstęp między dwiema ponownymi próbami po błędzie 529
Opisy narzędzi MCP wysyłane od razuDomyślny limit zwiększony z 2 048 do 4 096 znaków

/cost i wiersz stanu rozliczają teraz odczyty z cache dla Sonnet 5.5 po 0,10 dolara za milion tokenów. W zakresie bezpieczeństwa wersja naprawia zarządzane hooks PreToolUse, które odrzucały wywołanie bez kończenia tury, kontrole Bash, które automatycznie zatwierdzały niektóre polecenia używające BASH_ARGV0, sesje w chmurze, które pomijały kontrole trybu auto przy działaniach Claude in Chrome, oraz modyfikacje Edit i NotebookEdit, które zastępowały wszystkie znaki spoza ASCII w plikach innych niż UTF-8 i są teraz odrzucane.

🔗 Claude Code 2.1.296 na GitHub

Vibe CLI 2.26.1: usunięto lokalny model Devstral, rozbudowano tryb nieinteraktywny

9 października — Trzy dni po 2.26.0 i bez tweeta Mistral publikuje Vibe CLI 2.26.1. Mimo numeru wskazującego na wydanie poprawkowe wersja zawiera 85 pozycji (23 dodatki, 24 zmiany, 36 poprawek, 2 usunięcia), w tym 37 dotyczących nowego interfejsu w Rust. Usuwa dołączony wcześniej lokalny model Devstral: konfiguracja, która nadal wskazuje go na stałe, wraca z ostrzeżeniem do domyślnego modelu hostowanego. Ten oferuje teraz jedynie dwa poziomy rozumowania, off i high, i deklaruje okno kontekstu 256k, do którego dostosowuje się automatyczna kompakcja.

Tryb nieinteraktywny vibe -p zyskuje limit czasu, odczyt promptu z pliku lub standardowego wejścia, raport export.json zapisywany przy każdym zakończeniu oraz osobne kody wyjścia: 1 przy błędzie użycia lub konfiguracji, 2 przy awarii infrastruktury, 3 po osiągnięciu limitu lub odmowie modelu. Rust CLI dodaje /proxy-setup, narratora odczytującego na głos podsumowanie każdej tury, /plugins oraz /whoami. Nowe ustawienia zabraniają agentowi korzystania z procesów działających w tle lub subagentów, a konektor Document Library pozostaje domyślnie wyłączony.

🔗 Informacje o wydaniu Vibe CLI 2.26.1


Generatywne obrazy, filmy i gry: Qwen-Image-2.1-Turbo, tryb Thinking w Midjourney, Syren od Synthesia, Playground od Google

Szybszy i tańszy model obrazowy, generator sprawdzający własne wyniki, agent montujący filmy i platforma gier bez kodowania.

Qwen-Image-2.1-Turbo: 8 kroków odszumiania i 0,016 dolara za obraz

9 października — Qwen publikuje Qwen-Image-2.1-Turbo, przyspieszony checkpoint (accelerated checkpoint) Qwen-Image-2.1, który generuje i edytuje obrazy w 8 krokach odszumiania, wykorzystując tę samą architekturę z 7 miliardami parametrów. Według Qwen nadal tworzy obrazy 2K i umożliwia edycję za pomocą języka naturalnego, ale nie opublikowano żadnych danych liczbowych dotyczących jakości ani szybkości tej wersji. Wagi są dostępne na Hugging Face i ModelScope na licencji badawczej Qwen (Qwen Research License). Checkpoint zawiera własny harmonogram próbkowania w 8 krokach i domyślnie działa z CFG równym 1.

Tego samego dnia Qwen oficjalnie udostępnia API Qwen-Image-2.1 Pro i Turbo; QwenCloud przyznaje Turbo limit 120 żądań na minutę.

Model udostępniany przez API (Model Studio)Cena za obrazDarmowe obrazy
qwen-image-2.1-turbo0,016 dolara10
qwen-image-2.1-pro0,04 dolara10
qwen-image-2.0-pro0,075 dolara100

🔗 Ogłoszenie Qwen · Karta modelu na Hugging Face

Midjourney testuje tryb Thinking i udostępnia współdzielone foldery na swojej stronie alpha

8 października — Changelog wersji alpha Midjourney, opublikowany wieczorem, przedstawia dwie funkcje we wczesnej wersji, na razie dostępne wyłącznie w serwisie alpha.midjourney.com. Pierwsza jest testem: przy obrazie utworzonym za pomocą V8.2, podczas generowania lub edycji, przycisk Rerun (Thinking) poleca modelowi przyjrzeć się wynikowi, wskazać, gdzie odbiega on od promptu (obiekty, układ, anatomia, tekst), i wygenerować obraz ponownie. Midjourney twierdzi, że obserwuje lepsze wyniki pod względem zgodności z promptem, typografii i spójności, i rozważa przekształcenie tej funkcji w ogólny tryb.

Druga to udostępnianie folderów: można zapraszać Współpracowników, którzy generują bezpośrednio w folderze, lub Czytelników, a także udostępniać folder przez link, a nawet otworzyć go dla wszystkich członków Midjourney. Midjourney zaznacza, że udostępnianie nie zmienia widoczności obrazów: bez trybu stealth mogą one nadal pojawiać się w Explore i na profilach.

🔗 Changelog wersji alpha Midjourney · Test trybu Thinking (Midjourney)

Syren: Synthesia powierza tworzenie filmów agentowi w wersji beta

9 października — Synthesia udostępnia Syren w wersji beta wszystkim swoim klientom, także posiadaczom bezpłatnych kont. Opisuje się oczekiwany film lub dostarcza dokumenty, obrazy, filmy, prezentacje PowerPoint albo linki YouTube, a Syren dostarcza gotowy film z animacjami graficznymi (motion graphics), awatarami, narracją, muzyką i ujęciami uzupełniającymi (b-roll), który można następnie poprawiać w rozmowie. Według Petera Hilla, dyrektora technicznego Synthesia, agent zapisuje cały film w formie kodu, który autorski silnik renderujący, używany do animacji Synthesia od czerwca, odtwarza na żywo.

Filmy trwają do 3 minut, mają format poziomy lub pionowy i są renderowane w przeglądarce. Rozliczenie odbywa się za pomocą kredytów, bez szczegółowego cennika, a administratorzy Enterprise mogą wyłączyć narzędzie. We wpisie zapowiedziano, że automatyczne uczenie się tożsamości marki na podstawie istniejących filmów pojawi się wkrótce. Syren pojawia się cztery dni po HyperFrames Studio od HeyGen i dzień po Claude Motion od Anthropic, dwóch innych narzędziach, w których agent tworzy film.

🔗 Prezentacja Syren (Synthesia)

Playground: Google udostępnia platformę do tworzenia gier bez programowania

7 października — Google uruchamia Playground, eksperymentalną platformę gier, na której można tworzyć gry, grać w nie i je udostępniać, opisując je kilkoma promptami, bez pisania kodu. W interfejsie konwersacyjnym zaczyna się od pustej strony, przykładu do przerobienia lub procesu z przewodnikiem, a następnie na żądanie dostosowuje fizykę, zasady, postacie lub otoczenie.

Gry działają w przeglądarce, zarówno na telefonie, jak i na komputerze, i mogą pozostać prywatne, być udostępniane przez link lub trafić do galerii Explore, z rankingami i trybem wieloosobowym w niektórych gatunkach; każda opublikowana gra przechodzi kontrolę bezpieczeństwa. Playground jest dostępny w Stanach Zjednoczonych dla osób w wieku co najmniej 18 lat, a uprawnienia do tworzenia zależą od abonamentu Google AI. Integracja z Unity Spark, pozwalająca tworzyć bardziej rozbudowane gry 3D, ma wkrótce trafić do zamkniętej bety. Google nie podaje, jaki model napędza platformę.

🔗 Prezentacja Playground (blog Google)


Zdrowie: badanie kliniczne AMIE opublikowane w The Lancet

8 października — Google i Beth Israel Deaconess Medical Center (BIDMC) publikują w The Lancet prospektywne badanie wykonalności AMIE (Articulate Medical Intelligence Explorer), konwersacyjnej AI Google do diagnostyki; według Google to jego pierwsza publikacja w głównym czasopiśmie The Lancet. Pacjenci rozmawiali z AMIE do pięciu dni przed pilną konsultacją, a lekarz otrzymywał następnie transkrypcję i podsumowanie.

Mierzony parametr badaniaOpublikowany wynik
Pacjenci włączeni do badania (od kwietnia do listopada 2025), następnie objęci obserwacją114, następnie 98
Przerwania ze względów bezpieczeństwa0
Odnotowane halucynacje1
AMIE przydatne w przygotowaniu wizyty według lekarza33 przypadki na 44 (75 %)
Diagnozy zgodne z ostateczną diagnozą (Google)90 %

Badanie przeprowadzono w jednym ośrodku, bez grupy kontrolnej i przy finansowaniu Alphabet; nie jest ono ani dopuszczeniem, ani wdrożeniem: autorzy postulują szerzej zakrojone badania.

🔗 Wpis Google · Artykuł w The Lancet


Badania w OpenAI: odpowiedź na list trzech badaczy, z którymi firma zakończyła współpracę

9 października — W notatce opublikowanej na @OpenAINewsroom w imieniu swoich liderów badań OpenAI odpowiada na list trzech badaczy, z którymi, jak twierdzi, zakończyła współpracę w poprzednim tygodniu. Według OpenAI wewnętrzne dochodzenie wykazało, że naruszyli oni jasne zasady postępowania z wrażliwymi informacjami, co spowodowało utratę zaufania wykraczającą poza to, co przedstawia ich list; OpenAI podtrzymuje swoją decyzję. Firma twierdzi, że decyzje te nie wynikały ani ze zgłaszania obaw dotyczących bezpieczeństwa, ani z zabrania głosu, i że nie zwalnia żadnego pracownika za wyrażanie obaw.

W notatce zapowiedziano również:

We are actively finalizing contracts with third-party safety assessors and will announce details in the coming weeks.

🇵🇱 Aktywnie finalizujemy umowy z zewnętrznymi podmiotami oceniającymi bezpieczeństwo i ogłosimy szczegóły w najbliższych tygodniach. — @OpenAINewsroom na X

OpenAI deklaruje zgodę z listem w jednym punkcie: zachowanie możliwości monitorowania (monitorability) modeli frontier wymaga zaangażowania całej branży, w tym OpenAI. Ten artykuł przedstawia wersję OpenAI; nie zapoznano się z listem badaczy.


Tworzenie otwartych modeli: sześć modeli za około 103 dolary dzięki ML Intern, scheduler GPU Ai2

Dwa opisy doświadczeń z tworzeniem modeli: jeden od strony agenta, drugi od strony klastrów obliczeniowych.

ML Intern: sześć otwartych modeli za około 103 dolary kosztów obliczeń

8 października — Tryb ML Intern w HuggingChat, przedstawiony już tutaj 1 i 8 października z innych perspektyw, doczekał się pierwszego podsumowania liczbowego na blogu Hugging Face: sześć projektów zrealizowanych od początku do końca, za łącznie około 103 dolary kosztów obliczeń. Każdy zaczyna się od wiadomości i kończy publicznym modelem na platformie Hub, wraz z ewaluacją. Agent planuje, prosi o zgodę przed każdym płatnym zadaniem obliczeniowym, uruchamia krótki test, a następnie trenuje, ocenia i publikuje na sprzęcie Hugging Face.

Model utworzony przez ML InternOpublikowany wynikKoszt obliczeń
Pocket Rewriter (0.8B)99,7 % poprawnych wyników, około jednej czwartej tokenów używanych przez model 9B do przeformułowywania tekstu w Qwen-Image 2.1Około 16 dolarów
Citrus Doctor (Qwen3.5-2B)Wzrost z 14,9 % do 52,8 % poprawnych diagnoz chorób cytrusówOkoło 1,90 dolara
Dwa LoRA dla Qwen-Image 2.1Zmiana kąta widzenia, zastąpienie bazgrołu wskazanym obiektemOkoło 16 i 24,30 dolarów
Huggy LoRA (FLUX.2 klein)LoRA postaciOkoło 7,60 dolara
Agate 4 krokiDestylacja małego modelu obrazowego, z 50 kroków (100 przebiegów z guidance) do 4Około 37 dolarów

🔗 Wpis Hugging Face

Scheduler GPU Ai2: mediana czasu oczekiwania spada z 5 minut do 24 sekund

9 października — Ai2 przedstawia szczegóły nowego schedulera swoich klastrów GPU we wpisie, którego autorem jest Jeremy Tryba. Tysiące GPU NVIDIA H100, B200 i B300, w klastrach liczących od 88 do 1 024 GPU, są tam współdzielone przez około 150 badaczy, a popyt jest dwa do trzech razy większy niż podaż. Stary system priorytetów pozwalał, by GPU były „okupowane” przez puste zadania, a wszystkie obciążenia ostatecznie osiągały maksymalny priorytet.

Nowy opiera się na budżetach czasu GPU rozdzielanych zgodnie ze strukturą organizacyjną zespołów badawczych, hierarchicznym sprawiedliwym podziale (fair-share) obliczanym dla ruchomego okresu siedmiu dni oraz „kontrakcie szeregowania”: każde obciążenie deklaruje chroniony czas działania, maksymalnie 8 godzin, po którym może zostać wywłaszczone i ponownie umieszczone w kolejce. Nieprzydzielony czas nadal jest bezpłatny, ale korzystające z niego zadania zawsze mogą zostać wywłaszczone.

Wskaźnik mierzony przez Ai2Stary schedulerNowy scheduler
Mediana czasu oczekiwania, największy klaster H1005 minut24 sekundy
Czas oczekiwania p90 dla zadań debugowania2 godziny30 sekund
Dostarczone należne godziny GPU w ciągu 30 dni—98 %

Liczba napraw wymagających interwencji człowieka spada o 74 %. Ai2 przyznaje, że są ograniczenia, takie jak sesje interaktywne, które po 8 godzinach mogą zostać wywłaszczone, choć wcześniej mogły trwać tydzień, i nie publikuje żadnego kodu.

🔗 Wpis Ai2


Modele decyzyjne: pplx-decider-v1.1-27b na czele Decision Bench, w statystycznym remisie z dziewięcioma innymi

9 października — Model decyzyjny Perplexity, omawiany już 6 i 8 października, uzyskuje wynik zewnętrznej oceny. W Decision Bench, benchmarku open source Atlan Frontier Labs (1 071 pytań zamkniętych, 36 zbiorów danych, 15 sklasyfikowanych modeli), pplx-decider-v1.1-27b osiąga najwyższy wynik surowy, 94,5 %, przy najniższym koszcie, 0,017 dolara za 1 000 decyzji. Serwis przyznaje jednak tę samą pozycję modelom, których przedziały ufności na poziomie 95 % się nakładają: dziesięć modeli dzieli pierwsze miejsce.

Model oceniony w Decision BenchZmierzona dokładnośćKoszt za 1 000 wierszy
pplx-decider-v1.1-27b94,5 %0,017 dolara
DeepSeek V4.1 Flash94,2 %0,683 dolara
Gemini 3.5 Flash94,2 %3,32 dolara
Jev 1.1393,8 %0,044 dolara

Perplexity publikuje również praktyczny przewodnik (cookbook) po agencie przeglądania, w którym o kliknięciach decyduje kod, nigdy model, a v1.1 zastępuje v1 w API.

🔗 Wątek @perplexitydevs · Ranking Decision Bench


Grok Bot otrzymuje własny adres e-mail

9 października — Grok Bot, agent SpaceXAI, ma teraz własny adres e-mail. Bot może używać go do rejestrowania się w usługach, kontaktowania się z firmami w imieniu użytkownika lub umawiania z kimś spotkania. Funkcja zostaje wdrożona tego samego dnia: wystarczy poprosić agenta o adres lub oznaczyć @bot na X, a w zespole administrator musi najpierw ją włączyć.

Ogłoszenie ogranicza się do wątku na koncie @bot, udostępnionego przez @grok, bez wpisu na x.ai. Nie podaje ani formatu, ani domeny adresów, ani objętych funkcją planów. Po własnym identyfikatorze Slack dla Team Bots pod koniec września agent zyskuje więc własną tożsamość do działania na zewnątrz.

🔗 Ogłoszenie Grok Bot


ElevenLabs rozpoczyna działalność w Singapurze, swoim hubie dla Azji Południowo-Wschodniej

8 października — ElevenLabs oficjalnie ogłasza wejście do Singapuru, gdzie otwiera biuro mające pełnić rolę hubu dla Azji Południowo-Wschodniej i szerzej dla regionu Azji i Pacyfiku. Wpis podkreśla już istniejącą infrastrukturę: od lipca firmy mogą hostować swoje dane w Singapurze, z opcjami bez retencji i mniejszymi opóźnieniami w regionie.

ElevenLabs wymienia przede wszystkim swoich regionalnych klientów: Funding Societies, które kwalifikuje potencjalnych klientów za pomocą konwersacyjnej AI na pięciu rynkach, Boost Bank w Malezji, Salmon Group na Filipinach, MNC Group w Indonezji czy Rezonate, platformę zdrowotną używaną przez 60 % publicznych szpitali w Singapurze. Nie podano liczby pracowników. Otwarcie biura następuje po otwarciu placówek w Brukseli i Amsterdamie pod koniec września i na początku października.

🔗 Wpis ElevenLabs


Krótkie wiadomości

  • Projects w Claude Code — Anthropic udostępnił funkcję wszystkim abonentom Pro i Max zapisanym na listę oczekujących. Projects pozostaje w wersji beta: lista nadal jest otwarta, kolejne osoby otrzymają dostęp w miarę dostępnych zasobów, a według dokumentacji funkcja nie jest jeszcze dostępna w Team ani Enterprise. 🔗 źródło
  • Przewodnik po automatyzacjach agentów — Przewodnik na claude.dev opisuje implementację referencyjną opartą na Claude Managed Agents, która zgodnie z harmonogramem odczytuje kanały Slack i pull requesty GitHub, a następnie publikuje podsumowanie w Slack. Szczegółowo przedstawia sześć komponentów oraz zabezpieczenia przed typowymi awariami, takie jak unikanie uznawania nieczytelnego źródła za oznakę spokojnego dnia czy ustalanie limitu wydatków na poziomie od 3 do 5 razy większym niż koszt zwykłego uruchomienia. 🔗 źródło
  • Block i Claude Fable — W wywiadzie opublikowanym przez Anthropic firma Block wyjaśnia, że Claude Fable projektuje duże migracje jej kodu i kieruje pracą nawet dziesiątek modeli Opus lub Sonnet, co pozwala scalać nawet tysiąc pull requestów w ramach jednej migracji; scalanie i wdrażanie na produkcję pozostają zarezerwowane dla ludzi, a wdrożenia wymagają podwójnego zatwierdzenia. 🔗 źródło
  • Compliance API w Claude Enterprise — Punkty końcowe (endpoints) dotyczące rozmów zwracają również, w wersji beta i przy użyciu istniejącego klucza, rozmowy z ujednoliconego środowiska Claude: rozmowa kontynuowana w sesji w chmurze jest zwracana jako jedna całość, z pracą Claude w blokach tool_use i tool_result. 🔗 źródło
  • Codex CLI 0.162.1 — Ta poprawka do wersji 0.162.0 usuwa awarię TUI przy wielowierszowych pytaniach asynchronicznych oraz błędy uruchamiania występujące, gdy już działający serwer w tle miał inne ustawienia funkcji niż CLI. 🔗 źródło
  • Wtyczki według ról w ChatGPT Enterprise i Edu — Gdy włączona jest kontrola dostępu oparta na rolach (RBAC), właściciele i administratorzy ustalają dostęp do wtyczek dla każdej roli: Available, Install lub Disabled dla obszaru roboczego, a Default pozwala roli niestandardowej odziedziczyć to ustawienie. 🔗 źródło
  • Sophos i OpenAI Daybreak — Według dostawcy rozwiązań cyberbezpieczeństwa jego agenci zbudowani z użyciem Daybreak skracają średni czas reakcji na obsługiwane sprawy z około 38 minut do około 89 sekund, a 52 % spraw MDR jest rozwiązywanych w całości przez AI; działania destrukcyjne pozostają pod nadzorem ludzi. 🔗 źródło
  • Asana i agent nawigacyjny StackAI — Według Asany GPT-6 Astra w Codex zoptymalizował tego agenta w około tydzień: przy użyciu GPT-6.1 Sol uruchomienie testowe kosztuje 0,47 dolara i trwa około czterech minut, czyli jest 76 razy tańsze i 5 razy szybsze niż pierwotna konfiguracja produkcyjna. 🔗 źródło
  • LegalOn i Codex — LegalOn Technologies twierdzi, że obniżyło szacowane dzienne koszty Codex o około 65 %, przechodząc z GPT-5.5 w nielimitowanym trybie szybkim na podział zadań między GPT-6 Luna, GPT-6.1 Sol i GPT-6 Astra, z trybem szybkim na żądanie oraz limitami dla poszczególnych działów i osób. 🔗 źródło
  • Gemini CLI v0.64.0-preview.1 — Ta wersja zapoznawcza eliminuje fałszywe alarmy ostrzeżenia Untrusted Command Flags Detected przy nieszkodliwych poleceniach powłoki: opcje tylko do odczytu są wyłączone z kontroli, zmienne powłoki są zachowywane, a pętle dozwolone, gdy każde podpolecenie ma swoją regułę ALLOW. 9 października nie ukazała się żadna wersja nightly, a wersją stabilną pozostaje v0.63.0. 🔗 źródło
  • Antigravity 2.22.0 — Wtyczki mogą wyświetlać własny interfejs w panelu bocznym (UI Extensions), rozmowy można porządkować, przeciągając je między sekcjami paska bocznego, a znaczniki czasu wyświetlają nazwę miesiąca. 🔗 źródło
  • Gemini 3.7 Flash oznaczony jako przestarzały — W API Gemini wywołania gemini-3.7-flash są przekierowywane do gemini-3.8-flash, a stary agent deep-research-pro-preview-12-2025 zostanie wyłączony 23 października na rzecz deep-research-preview-04-2026 lub deep-research-max-preview-04-2026. 🔗 źródło
  • Wtyczki VST3 i AU dla Google Flow Music — Uzupełnienie z 6 października: Spaces, czyli instrumenty i efekty tworzone w języku naturalnym, można eksportować jako wtyczki do cyfrowych stacji roboczych audio (Digital Audio Workstations), takie jak wtyczka No Chaser producenta Khrisa Riddick-Tynesa. 🔗 źródło
  • Google Earth AI i zdrowie publiczne — Uzupełnienie z 6 października: podczas epidemii Eboli w DRK prototyp agenta rozumowania geoprzestrzennego pozwolił biuru WHO w Afryce wskazać w ciągu kilku minut 48 zagrożonych miejscowości i ponad 45 500 osób narażonych na ryzyko; model PDFM identyfikuje również obszary zagrożone cholerą z wyprzedzeniem do 8 tygodni. 🔗 źródło
  • Rozliczanie Copilot code review — Właściciele organizacji mogą obciążać organizację będącą właścicielem repozytorium kosztami przeglądów zamawianych przez jej członków posiadających licencje, zamiast zużywać ich limity, jeśli włączone jest płatne korzystanie z AI Credits. Mogą też ograniczyć możliwość uruchamiania przeglądów do licencji zapewnianych przez organizację lub przedsiębiorstwo. 🔗 źródło
  • Copilot CLI 1.0.95 — Wydana jako wersja stabilna, uwierzytelnia się na macOS przez natywnego brokera Microsoft Entra, z przeglądarką jako rozwiązaniem zapasowym; wersja zapoznawcza 1.0.96-0 wskazuje na osi czasu, kto podjął decyzję w sprawie każdego uprawnienia: użytkownik, Assisted Permissions, polityka lub mechanizm zapasowy działający bez nadzoru. 🔗 źródło
  • GitHub MCP Server 2.0 — Uzupełnienie z 6 października: oficjalny serwer MCP GitHub zwraca wyniki z określonymi typami, opisane przez schematy wyjściowe (output schemas), dla agentów w Code Mode lub Programmatic Tool Calling; ich dostępność jest ogłaszana wyłącznie klientom zgodnym ze specyfikacją MCP 2026-07-28 lub nowszą. 🔗 źródło
  • Claude Haiku 5.5 w Genspark — Genspark udostępnia model w AI Chat, Code Agent i Claw, powtarzając argument Anthropic o kosztach działania niższych o około 75 % niż w przypadku Haiku 4.5, bez osobnego planu abonamentowego ani cennika. 🔗 źródło
  • Szablon Meta VR dla v0 — Meta publikuje wraz z Vercel szablon v0 oparty na Immersive Web SDK: użytkownik opisuje doświadczenie, v0 tworzy jego kod i podgląd, a jedno kliknięcie wdraża je na Vercel, by można było otworzyć je w przeglądarce Quest; śledzenie wzroku i dłoni w Meta VR Glasses, których premiera jest oczekiwana wiosną 2027, jest już obsługiwane. 🔗 źródło
  • v0 for teams — v0 prezentuje na filmie sposób podglądania pracy członków zespołu, dołączania do ich rozmów i wspólnego tworzenia; tweet wyróżnia funkcje wprowadzane etapami od września, bez nowego cennika. 🔗 źródło
  • DeepSeek Harness 0.2.1-alpha.2 — 26. wersja zapoznawcza, nadal bez wersji stabilnej: katalog wtyczek instaluje na żądanie pakiety Claude Code i Codex, pojawiają się dwie eksperymentalne wtyczki (Git Worktrees, tłumaczenie rozumowania), a instrukcje globalne mogą pochodzić ze wspólnego AGENTS.md. 🔗 źródło
  • OGX 1.5.0 — Dawny Llama Stack, przemianowany w kwietniu i przeniesiony poza organizację meta-llama, dodaje natywne przekazywanie wywołań API /v1/messages do DeepSeek i Fireworks AI, dostawcę Text-Embeddings-Inference, wyszukiwanie internetowe Exa i Serply oraz klienta MCP 2.x, wraz z czterema zmianami naruszającymi kompatybilność. 🔗 źródło
  • GenIA — Meta udostępnia bez ogłoszenia, na niekomercyjnej licencji CC BY-NC 4.0, kod pracy prowadzonej wspólnie z Tübingen AI Center: rekonstruuje ona obiekty 3D z obrazu, kilku widoków lub filmu, dopasowując podczas inferencji zamrożony prior SAM 3D Objects, bez ponownego trenowania. 🔗 źródło
  • Etykieta decision-model na Hub — Hugging Face nadaje modelom decyzyjnym własną etykietę, z ikoną i filtrem na stronie Models; pliki GGUF modeli decyzyjnych są oznaczane automatycznie na podstawie ich metadanych llama.cpp. 🔗 źródło
  • Darwin-27B-ZTC-v2 — VIDRAFT ogłasza, że nowa wersja jego modelu oceniającego, na licencji Apache-2.0, zajmuje pierwsze miejsce w System One Mosaic Benchmark (137 testów) z wynikiem Borda 89,58, przed OpenJev-27B (87,50) i Jev 1.13 (85,05); to ranking podany przez autorów, którzy przedstawiają go jako zapis stanu publicznej tabeli wyników. 🔗 źródło
  • Pewność modeli decyzyjnych — Stephen Solka pokazuje we wpisie społecznościowym, że GPT-6 Luna Decisions, odpytywany przez OpenRouter, odpowiada „nie pasuje” na 600 weryfikacji SHA-256, osiągając 50 % trafności i 99,8 % średniej pewności; w rozumowaniu przyczynowym próg 99 % wyodrębnia 47 poprawnych odpowiedzi spośród 49, ale obejmuje tylko 8,2 % przypadków. 🔗 źródło
  • openai-math w środowiskach uczenia ze wzmocnieniem — FineEnvs przenosi do środowisk Harbor 369 z 405 wyników sformalizowanych w Lean z publikacji openai/math: agent musi udowodnić twierdzenie w piaskownicy Lean 4, a Comparator przyznaje nagrodę wyłącznie za kompletny dowód dokładnie podanego twierdzenia; eksperymentalny zbiór na licencji Apache-2.0. 🔗 źródło
  • JOSIE-2 — Gökdeniz Gülmez publikuje raport techniczny dotyczący tej rodziny modeli 2B, 4B i 9B, poddanej dalszemu treningowi na bazie Qwen3.5 na dwóch komputerach Mac M4, z użyciem około 3 000 wybranych przykładów: w trybie rozumowania JOSIE-2-4B osiąga 95,5 w ARC-Challenge (+12,1) i 69,2 w TruthfulQA (+20,3), w zaledwie dwóch testach. 🔗 źródło
  • Gradio 6.30 — gr.Workflow zyskuje widok aplikacji, a polecenie Run this node ponownie wykorzystuje nadal aktualne wyniki poprzedzających węzłów zamiast wykonywać cały podgraf od nowa; gr.ImageEditor zachowuje kanał alfa wczytywanych obrazów. 🔗 źródło
  • tokenizers 0.23.3 — Ta poprawka dotycząca wyłącznie pakietu Python obsługuje huggingface_hub v2, co według informacji o wydaniu odblokowuje instalację Transformers, i wycofuje zmianę dotyczącą obcinania z wersji 0.23.1, która naruszała kompatybilność. 🔗 źródło
  • Recenzowanie prac naukowych przez AI — Sakana AI przedstawia artykuł przyjęty do TMLR: test umieszcza w artykułach sprzeczne twierdzenia, by sprawdzić, czy recenzenci AI je wykrywają, a system Multi-Layered Review wykrywa ich więcej niż pozostałe testowane systemy, według ogłoszenia Sakana AI, które nie podaje żadnych liczb. 🔗 źródło
  • Suno Studio — Klipy lepiej dopasowują się do pierwszej miary taktu i rozciągają, by podążać za tempem projektu, efekty stopniowego narastania i wyciszania stają się wykładnicze lub logarytmiczne, a syntezator, klawiaturę i widoki wtyczek można odłączać i przenosić nawet na drugi ekran; Studio jest wliczone w abonament Premier. 🔗 źródło
  • World Models’ Last Exam in Physics — W tym egzaminie z fizyki firmy Einsia dla modeli wideo (40 zadań, 9 kategorii, osiem modeli) Seedance 2.5 zajmuje pierwsze miejsce z wynikiem 57,76 na 100, przed MiniMax H3 (54,89), najlepszym modelem otwartym według MiniMax, oraz Cosmos 3 Super firmy NVIDIA (42,46); to benchmark zewnętrzny. 🔗 źródło
  • Symulacje Omniverse budowane przez agentów — Blog NVIDIA pokazuje zespoły firmy, które zlecają GPT-6 Astra, a w jednym przypadku Claude Fable 5, składanie symulacji z użyciem bibliotek ovphysx, ovstage, ovrtx i ovui, w tym cyfrowych bliźniaków tworzonych lub ulepszanych w około trzy dni; nie pojawia się żaden nowy produkt. 🔗 źródło
  • Zarządzanie sklepem Shopify — Po podłączeniu sklepu Grok Bot może sprawdzać zamówienia, śledzić stany magazynowe i aktualizować karty produktów; nie podano planu abonamentowego ani limitów. 🔗 źródło
  • Wyszukiwanie na X — Uzupełnienie z 7 października: Grok Bot może wyszukiwać, czytać i monitorować X dla wszystkich użytkowników bez konfigurowania konektora X, na przykład w celu śledzenia opinii o produkcie lub otrzymywania cotygodniowego podsumowania swojej branży; pod koniec sierpnia nadal trzeba było podłączyć własne konto. 🔗 źródło
  • Grokipedia v0.3 — Według jej oficjalnego konta encyklopedia tworzona przez Grok opublikowała w ciągu tygodnia ponad 4 400 artykułów zamówionych przez czytelników i wprowadza ponad 2 200 zmian dziennie, ze średnio 78 źródłami na nowy artykuł; jedna ze stron pokazuje teraz wprowadzane zmiany na żywo. 🔗 źródło
  • CLI mistral 0.8.0 — mistral apps deploy wdraża również workery workflow oraz wszystkie moduły jednocześnie, także w ramach ciągłej integracji przy użyciu samego klucza API, a mistral apps dev uruchamia lokalną bazę Postgres w Docker; w zamian .env z bieżącego katalogu nie jest już odczytywany. 🔗 źródło
  • SDK Python Mistral 3.2.0 — Wywołania czatu i agentów obsługują logarytmy prawdopodobieństw (logprobs), zarówno dla odpowiedzi, jak i promptu, a także top_k, karę za powtórzenia i minimalną liczbę tokenów; wersja wygenerowana automatycznie, bez ogłoszenia. 🔗 źródło
  • Qwen Code v0.25.1-preview.1 — Druga wersja zapoznawcza v0.25.1 w ciągu trzech dni, z 16 nowymi funkcjami i 27 poprawkami, w tym współpracą wielu agentów skupioną wokół sesji oraz hookami PreToolUse modyfikującymi dane wejściowe narzędzia z pełną ponowną walidacją; wersja stabilna jeszcze się nie ukazała. 🔗 źródło
  • Claude Haiku 5.5 w Agent API Perplexity — Uzupełnienie z 7 października: Agent API obsługuje anthropic/claude-haiku-5-5 według cennika Anthropic, 0,10 dolara za milion tokenów wejściowych i 0,50 za wyjściowe przy maksymalnie 100 000 tokenów wejściowych, a powyżej tego progu odpowiednio 0,50 i 2,50. 🔗 źródło
  • Inferencja współdzielona lub dedykowana — Przewodnik Cohere dla Embed i Rerank wskazuje, że charakter zapytań ma większe znaczenie niż ich liczba, i oblicza przykładowe progi opłacalności względem dedykowanej instancji z jednym GPU NVIDIA A10: około 4 zapytań na minutę dla długich dokumentów, 20 dla katalogu i 29 dla ponownego ustalania rankingu (reranking). 🔗 źródło
  • Agent czy MCP — Perplexity publikuje przewodnik, który odróżnia agenta podejmującego decyzje od MCP łączącego go z narzędziami, z tabelą pomagającą dokonać wyboru, przykładem sklepu internetowego i czterema zagrożeniami wraz z zabezpieczeniami; według przewodnika Claude, ChatGPT lub Cursor mogą zlecić zadanie Computer przez serwer MCP Perplexity. 🔗 źródło

Co to oznacza

Jeden agent koordynuje teraz pracę wielu innych, a każdy otrzymuje własną tożsamość. Agent Gemini uruchamia podagentów, z których każdy ma własną tożsamość, i może stać się agentem współpracownikiem z własnym adresem; Claude Managed Agents pozwala agentowi napisać program, który uruchamia nawet 1 000 innych agentów; Grok Bot otrzymuje adres e-mail, by działać na zewnątrz, a Block powierza Claude Fable kierowanie dziesiątkami modeli podczas jednej migracji. Coraz ważniejsze staje się pytanie nie o to, czy agent potrafi wykonać zadanie, lecz o to, jak zachować nad nim kontrolę. Google odpowiada za pomocą Agent Gateway, Agent Sandbox, dziennika audytu przypisanego do każdego agenta i limitów wydatków egzekwowanych w czasie rzeczywistym; Anthropic — budżetem sesji, którego osiągnięcie wstrzymuje wszystkie uruchomienia; OpenAI — piaskownicą Windows z surowszymi ograniczeniami dostępu do sieci i plików.

Korzystanie z wielu modeli upowszechnia się na samych platformach. Google, które rozwija Gemini, powierza swojemu agentowi koordynowanie modeli Claude, wyraźnie oddziela wybór modelu od wyboru agenta i udostępnia Claude Opus 5.5 oraz Sonnet 5.5 w Antigravity, rozliczając je w ramach tego samego limitu wydatków co własne modele. Genspark i Agent API firmy Perplexity dodają Claude Haiku 5.5 w ciągu kilku dni od jego premiery, LegalOn rozdziela zadania związane z kodem między trzy modele OpenAI zależnie od rodzaju zadań, a Block buduje automatyczny selektor modeli.

Koszt jednostkowy nadal spada, a każde ogłoszenie podaje konkretne liczby: 0,016 dolara za obraz w Qwen-Image-2.1-Turbo, 2,5 raza mniej niż w wersji Pro; 15 dolarów za milion znaków w HeyGen Voice do 31 października, a następnie 30, mniej niż w Eleven v4 Turbo; 0,017 dolara za 1 000 decyzji w pplx-decider-v1.1-27b; sześć modeli opublikowanych na Hub przy koszcie obliczeń wynoszącym około 103 dolary dzięki ML Intern. Pierwsze miejsca wymagają jednak uważnej interpretacji: HeyGen Voice zajmuje pierwsze miejsce tylko w rankingu z kontrolowanymi głosami, a pplx-decider dzieli swoją pozycję z dziewięcioma innymi modelami, których przedziały ufności nakładają się na siebie.

W ochronie zdrowia nadal należy zachować ostrożność. Badanie AMIE opublikowane w The Lancet jest badaniem wykonalności, przeprowadzonym w jednym ośrodku, bez grupy kontrolnej i finansowanym przez Alphabet: 98 pacjentów, żadnej rozmowy przerwanej ze względów bezpieczeństwa, jedna odnotowana halucynacja. To krok w stronę badań na większą skalę, do których wzywają sami autorzy, a nie dopuszczenie do stosowania ani wdrożenie w opiece nad pacjentami.


Źródła