ai-powered-markdown-translatorArtykuł przetłumaczony z fr na pl za pomocą gpt-6.1-sol.
GPT-6 i Intelligent UI trafiają do wszystkich użytkowników ChatGPT: GPT-6 Sol w płatnych planach od 7 października, GPT-6 Luna w planach Free i Go od 8 października. Anthropic uzupełnia rodzinę 5.5 o Claude Haiku 5.5, z ceną od 0,10 dolara za milion tokenów wejściowych, a podczas wydarzenia poświęconego Windows Microsoft rozpoczyna przedsprzedaż komputerów RTX Spark i ogłasza, że GitHub Copilot będzie wkrótce mógł powierzać zadania lokalnemu modelowi. OpenAI publikuje również 722 manuskrypty z wynikami matematycznymi uzyskanymi przez wewnętrzny model.
ChatGPT przechodzi na GPT-6 i Intelligent UI dla wszystkich, odczytuje pliki audio i przygotowuje College Planner
7 października — OpenAI udostępnia GPT-6 wszystkim użytkownikom ChatGPT. Nie jest to nowy model bazowy: GPT-6 Sol i GPT-6 Luna były już dostępne dla płacących klientów od września (omawialiśmy je tutaj 22 września). Tym razem październikowe wersje obu modeli, dostrojone do codziennych rozmów, trafiają do zakładki Chat: GPT-6 Sol w planach Plus, Pro, Business i Enterprise od 7 października, GPT-6 Luna w planach Free i Go od 8 października. Zastępują GPT-5.6 Sol i GPT-5.6 Luna w ChatGPT, podczas gdy Codex i ChatGPT Work pozostają przy wersjach wrześniowych. OpenAI kieruje więc tę ofertę do ponad 1,2 miliarda osób korzystających z ChatGPT każdego tygodnia.
Najbardziej widoczna nowość nazywa się Intelligent UI. GPT-6 tworzy odpowiedzi z tekstu, wizualizacji i elementów interaktywnych (wykresów, przycisków, formularzy, interaktywnych diagramów, map) i może na żądanie przygotować niewielkie narzędzie, takie jak kalkulator oszczędności, narzędzie do podziału rachunku czy gra; gdy wystarczy zwykły tekst, ChatGPT na nim poprzestaje. OpenAI wykorzystuje do tego bibliotekę natywnych komponentów oraz kompilator, który wyświetla interfejs w trakcie generowania. Intelligent UI działa na poziomach wysiłku od Instant do Extra High, bez osobnego limitu, ale nie przy poziomie Pro, obsługiwanym przez GPT-6 Pro (napędzany przez GPT-6 Astra), ani w starszych aplikacjach desktopowych na macOS i Windows.
Druga zmiana: ChatGPT może zacząć odpowiadać, gdy jeszcze rozumuje lub korzysta z narzędzi, a następnie uzupełnić odpowiedź bez nowego promptu. Według wewnętrznych ocen OpenAI GPT-6 Instant zaczyna odpowiadać średnio o 44 % wcześniej niż GPT-5.6 Instant na pytania wymagające wyszukiwania w internecie, a GPT-6 Extra High rozpoczyna odpowiedź po takim samym czasie jak GPT-5.6 Medium, uzyskując lepszy wynik ogólny niż GPT-5.6 Extra High.
| Plan lub ustawienie poziomu wysiłku | Model używany w ChatGPT | Harmonogram i szczegóły |
|---|---|---|
| Plus, Pro, Business i Enterprise | GPT-6 Sol (Instant, Medium, High, Extra High) | Globalne wdrożenie od 7 października |
| Free i Go | GPT-6 Luna | Od 8 października |
| Poziom Pro (Pro 100 i 200 dolarów, Business, Enterprise) | GPT-6 Pro, napędzany przez GPT-6 Astra | Bez Intelligent UI |
| ChatGPT Work i Codex | Wrześniowe wersje GPT-6 Sol i GPT-6 Luna | Bez zmian |
W kwestii bezpieczeństwa opublikowana tego samego dnia karta systemowa klasyfikuje te wersje na poziomie zdolności „High” w cyberbezpieczeństwie oraz biologii i chemii według Preparedness Framework, przy czym nie osiągają one tego progu w samodoskonaleniu; przejmują zabezpieczenia GPT-5.6, z większą odpornością na próby ich obejścia (jailbreaks), również w rozmowach obejmujących wiele tur. W API wersja chat-latest wskazuje teraz na ten nowy model ChatGPT, a OpenAI zaleca rodzinę GPT-6 do zastosowań produkcyjnych.
GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.
🇵🇱 GPT-6 i Intelligent UI są teraz udostępniane wszystkim w ChatGPT. W ChatGPT Intelligent UI zapewnia szybkie, interaktywne odpowiedzi, które nadają codziennym pytaniom bardziej wizualną formę, ułatwiają zrozumienie złożonych tematów i natychmiast udostępniają interaktywne narzędzia dostosowane do Twojego zadania. — @OpenAI na X
🔗 GPT-6 i Intelligent UI dla wszystkich · Karta systemowa, aktualizacja październikowa · GPT-6 i inne modele w ChatGPT
Pliki audio w ChatGPT
6 października — ChatGPT przyjmuje teraz pliki audio jako załączniki. Do rozmowy można dołączyć nagranie, aby uzyskać transkrypcję, podsumowanie lub odpowiedzi dotyczące jego treści, albo przekształcić spotkanie, wywiad lub wykład w uporządkowane notatki, a nawet szkic e-maila podsumowującego. Funkcja jest dostępna wyłącznie w płatnych subskrypcjach i obszarach roboczych, w tym Enterprise: plan Free nie ma do niej dostępu „na razie”. Obsługiwane formaty to WAV, MP3, OGG, FLAC, AAC, M4A i PCM, a także WebM i MP4, jeśli zawierają wyłącznie audio, do 512 MB na plik. OpenAI uprzedza, że transkrypcje mogą zawierać błędy, identyfikacja mówców nadal jest mało wiarygodna, a skuteczność różni się w zależności od języka.
🔗 Informacje o aktualizacjach ChatGPT · Przesyłanie plików i audio do ChatGPT
ChatGPT for Teens: pierwsze dane o użytkowaniu i nadchodzący College Planner
7 października — OpenAI przedstawia pierwsze podsumowanie działania ChatGPT for Teens, wersji domyślnie stosowanej na kontach osób zidentyfikowanych jako niepełnoletnie. Według firmy w ciągu tygodnia niemal 1,2 miliona nastolatków korzystało z Learning Visualizations, a ponad 180 000 ze Study Mode; spędzają tam średnio mniej niż 15 minut dziennie, a mniej niż 2 % przekracza trzy godziny nieprzerwanego użytkowania. Zapowiedziana nowość, College Planner, pojawi się „wkrótce”, najpierw w Stanach Zjednoczonych dla uczniów klas od 10. do 12. planujących czteroletnie studia na uniwersytecie: jeden plan połączy wymagania rekrutacyjne, terminy, zadania i procedury ubiegania się o pomoc finansową, w tym stypendia. OpenAI wspiera również College Advising Corps, a przez trzy lata także Digital Wellness Lab w Boston Children’s Hospital, nie ujawniając kwoty.
🔗 Pomoc nastolatkom w nauce, planowaniu i kształtowaniu przyszłości AI
Claude Haiku 5.5, około 75 % tańszy od Haiku 4.5 według Anthropic
7 października — Piętnaście dni po Opus 5.5 i dziewięć dni po Sonnet 5.5 Anthropic uzupełnia rodzinę Claude 5.5 o Claude Haiku 5.5 (claude-haiku-5-5). Model jest przeznaczony do zadań wykonywanych na dużą skalę, w których koszty mają duże znaczenie (podsumowania, kompaktowanie kontekstu, zapytania do baz danych, klasyfikacja), do roli subagenta Opus 5.5 i Sonnet 5.5 przy pracy z kodem oraz do zastosowań, w których liczy się szybkość, takich jak obsługa klienta na żywo czy sterowanie przeglądarką: to najszybszy model Anthropic przy standardowej prędkości, choć modele Opus w Fast Mode pozostają szybsze. To również pierwszy Haiku z ustawieniem poziomu wysiłku (domyślnie medium), z kontekstem 1 miliona tokenów i maksymalnie 128 000 tokenów wyjściowych.
Cennik obejmuje dwa progi. Do 100 000 tokenów promptu Haiku 5.5 kosztuje 0,10 dolara za milion tokenów wejściowych i 0,50 dolara za milion tokenów wyjściowych, czyli o 90 % mniej niż Haiku 4.5; powyżej tego progu ceny rosną do 0,50 i 2,50 dolara, czyli o 50 % mniej. Podkreślane oszczędności rzędu „około 75 %” to średnia obliczona przez Anthropic: 90 % zapytań wysyłanych do Haiku 4.5 mieściło się poniżej progu, a nowy sposób podziału na tokeny (tokenizer) nalicza około 30 % więcej tokenów dla tego samego tekstu.
| Rodzaj opłaty (za milion tokenów) | Haiku 5.5 do 100 000 tokenów promptu | Haiku 5.5 powyżej 100 000 tokenów | Haiku 4.5 |
|---|---|---|---|
| Tokeny wejściowe | 0,10 dolara | 0,50 dolara | 1 dolar |
| Tokeny wyjściowe | 0,50 dolara | 2,50 dolara | 5 dolarów |
| Odczyty cache | 0,01 dolara | 0,05 dolara | 0,10 dolara |
| Zapisy cache | 0,125 dolara | 0,625 dolara | 1,25 dolara |
W benchmarkach opublikowanych przez Anthropic przewaga nad Haiku 4.5 jest duża, a Haiku 5.5 wyprzedza GPT-6 Luna od OpenAI wszędzie tam, gdzie uwzględniono oba modele. Pozostaje jednak za Sonnet 5.5, którego Anthropic nadal zaleca, wraz z Opus 5.5, do złożonego programowania agentowego.
| Oceniany benchmark (dane Anthropic) | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 (programowanie agentowe) | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| OSWorld 2.1, podzbiór offline | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity’s Last Exam, bez narzędzi | 45,9 % | 10,2 % | — | 56,9 % |
| FrontierCode 1.1, Main | 46,4 % | — | 42,4 % | 52,1 % (poziom Xhigh) |
| Chartography, bez narzędzi | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Sześciu klientów podzieliło się wynikami wczesnych testów: HubSpot podaje 92,8 % w swoim zestawie testów CRM, co jest jego najlepszym dotychczasowym wynikiem, AlphaSense uzyskał 0,84 wobec 0,76 dla Haiku 4.5 na 400 zapytaniach, a Box — o 11 punktów więcej przy około dwukrotnie mniejszym opóźnieniu. Migracja z Haiku 4.5 wymaga pracy: przewodnik wymienia jedenaście zmian, w tym wycofanie budget_tokens, parametrów temperature, top_p i top_k oraz wstępnego wypełniania, a polecenie /claude-api migrate w Claude Code automatyzuje część tego procesu. W kwestii bezpieczeństwa Anthropic opisuje zabezpieczenia cybernetyczne jako bardziej restrykcyjne niż w Haiku 4.5, ale nieco mniej niż w pozostałych nowych modelach firmy: więcej dozwolonych zadań obronnych niż w Sonnet 5.5, testy penetracyjne nadal zablokowane.
Premierze towarzyszy obniżka cen: od 7 października odczyty cache w Sonnet 5.5 tanieją z 0,20 do 0,10 dolara za milion tokenów, co według Anthropic sprawia, że model jest około 20 % tańszy w większości zadań agentowych. Haiku 5.5 jest już dostępny przez API Claude, Amazon Web Services, Google Cloud i Microsoft Azure, a także w Claude Code.
Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.
🇵🇱 Oto Claude Haiku 5.5: najtańszy, najszybszy i najwydajniejszy mały model, jaki kiedykolwiek udostępniliśmy. Średnio koszt jego użytkowania jest o około 75 % niższy niż w przypadku Claude Haiku 4.5. — @claudeai na X
🔗 Ogłoszenie Claude Haiku 5.5 · Przewodnik migracji do Haiku 5.5
Haiku 5.5 w Cursor: 48,4 % w CursorBench
7 października — Cursor udostępnia Claude Haiku 5.5 już w dniu premiery; można go włączyć w ustawieniach modeli. Według Cursor w przypadku krótkich zapytań kosztuje on 10 razy mniej niż Claude Haiku 4.5. W CursorBench, rankingu publikowanym przez Cursor na swojej stronie, Haiku 5.5 na poziomie Max zajmuje 10. miejsce z 48,4 % skuteczności przy koszcie 1,12 dolara za zadanie, tuż przed Sonnet 5.5 na poziomie High, którego koszty Cursor przeliczył 7 października, aby uwzględnić nowy cennik, oraz przed Opus 5 na poziomie Max. Wykonuje jednak więcej pracy: średnio 325 934 tokeny i 163 kroki na zadanie, wobec 37 391 tokenów i 41 kroków dla Sonnet 5.5 na poziomie High.
| Konfiguracja testowana przez Cursor | Miejsce w rankingu | Wynik CursorBench | Koszt zadania |
|---|---|---|---|
| Opus 5.5, poziom Max | 1 | 57,8 % | 13,43 dolara |
| Haiku 5.5, poziom Max | 10 | 48,4 % | 1,12 dolara |
| Sonnet 5.5, poziom High | 11 | 47,8 % | 1,20 dolara |
| Opus 5, poziom Max | 13 | 46,6 % | 11,95 dolara |
| Haiku 5.5, poziom Low | 54 | 30,9 % | 0,08 dolara |
🔗 Ogłoszenie Cursor na X · Ranking CursorBench
Miesięczne środki na API w wysokości od 100 do 500 dolarów w planach Max i Team
7 października — W tym samym wpisie, w którym ogłoszono Haiku 5.5, zapowiedziano miesięczne środki do wykorzystania na Claude Platform dla subskrybentów Max i Team. Ich udostępnianie potrwa kilka dni. Środki służą do tworzenia własnych narzędzi, aplikacji i agentów za pomocą API; według @ClaudeDevs można je wykorzystać ze wszystkimi modelami, w tym Haiku 5.5, zarówno we własnym kodzie, jak i w narzędziach innych firm.
| Objęty plan | Miesięczne środki na API |
|---|---|
| Max 5x | 100 dolarów |
| Max 20x | 200 dolarów |
| Team, stanowisko Standard | 20 dolarów na stanowisko |
| Team, stanowisko Premium | 100 dolarów na stanowisko |
| Limit dla zespołu Team | 500 dolarów, wspólna pula |
| Free, Pro i Enterprise | Nie kwalifikują się |
W planie Team środki przypisane do stanowisk sumują się we wspólnej puli: na przykład trzy stanowiska Standard i dwa Premium dają 260 dolarów miesięcznie. Środki obejmują wszystkie modele API Claude, w tym API Message Batches, a także Playground w Console, Claude Managed Agents i Claude Agent SDK. Nie obejmują interaktywnego korzystania z Claude Code (w terminalu, IDE, aplikacji komputerowej lub przeglądarce), dodatkowego użycia ponad limity planu ani modeli Claude udostępnianych przez Amazon Bedrock, Google Cloud Vertex AI lub Microsoft Foundry. Nie zmieniają też limitów użycia Claude, Claude Code ani Cowork.
Aby otrzymać środki, trzeba mieć aktywną od co najmniej siedmiu dni subskrypcję kwalifikującego się planu, a następnie powiązać organizację Claude Console w ustawieniach rozliczeń na claude.ai, bez dodawania metody płatności. Można powiązać tylko jedną organizację, a zmienić ją może wyłącznie dział wsparcia. Środki odnawiają się w każdym cyklu rozliczeniowym, nie przechodzą na kolejny okres i są wykorzystywane przed środkami zakupionymi; po ich wyczerpaniu wywołania zostają wstrzymane do kolejnego przyznania środków, chyba że organizacja kupiła środki lub włączyła automatyczne doładowanie. Żadne opłaty nie są naliczane w ramach subskrypcji Claude. W maju Anthropic zapowiedziało miesięczne środki na korzystanie programistyczne od 15 czerwca; strona pomocy wyjaśnia, że nowe środki nie są tymi „środkami Agent SDK”, które według niej są niedostępne.
🔗 Strona pomocy: miesięczne środki na API w planach Max i Team · Ogłoszenie @ClaudeDevs
Lokalna AI w Windows: NVIDIA otwiera przedsprzedaż komputerów RTX Spark i prezentuje zapowiedź DGX Station for Windows
7 października — NVIDIA i Microsoft wykorzystują wydarzenie Windows AI and Surface, zorganizowane w San Francisco z udziałem Jensena Huanga i Satyi Nadelli w rozmowie, aby wprowadzić na rynek RTX Spark, układ do komputerów z Windows zapowiedziany na Build 2 czerwca. Przedsprzedaż laptopów rozpoczęła się 7 października, a ich dostępność zaplanowano na 16 października; mini-PC pojawią się w listopadzie. Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI i Gigabyte przygotowują komputery, a Microsoft prezentuje Surface Laptop Ultra zbudowany wokół tego układu. Wpis NVIDIA nie podaje żadnej ceny.
RTX Spark łączy GPU Blackwell RTX i CPU Grace połączeniem o przepustowości 600 Go/s, zapewniając petaflop mocy obliczeniowej AI w FP4 i do 128 Go pamięci zunifikowanej. NVIDIA podkreśla możliwość lokalnego uruchamiania dużych modeli, bez wysyłania danych do chmury i bez licznika użycia, z tym samym stosem CUDA co na jej serwerach. Układ jest przeznaczony także dla twórców (NVFP4, kodowanie AV1 i sprzętowe 4:2:2) oraz graczy, oferując gry w 1440p z ponad 100 klatkami na sekundę dzięki DLSS 5.
Dla firm NVIDIA prezentuje zapowiedź DGX Station for Windows, również ogłoszonej na Build w czerwcu. Opisuje ją jako pierwszy biurkowy superkomputer AI w ekosystemie Windows: pozwalający lokalnie uruchamiać modele liczące około biliona parametrów bez opuszczania Windows, z narzędziami Linux nadal dostępnymi przez WSL. Nie ma daty ani ceny, jedynie możliwość zapisania się na powiadomienie. Microsoft z kolei udostępnia ogólnie Microsoft Execution Containers (MXC), infrastrukturę uruchamiającą agentów w tle pod kontrolą Windows.
| Porównywany element | RTX Spark | DGX Station for Windows |
|---|---|---|
| Układ | GPU Blackwell RTX (do 6 144 rdzeni) i CPU Grace (do 20 rdzeni) | Superukład GB300 Grace Blackwell Ultra Desktop |
| Pamięć | Do 128 Go, zunifikowana | 748 Go, spójna |
| Obliczenia AI w FP4 | 1 petaflop | Do 20 petaflopów |
| Zapowiedziana dostępność | Laptopy w przedsprzedaży, dostępne 16 października; mini-PC w listopadzie | Zapowiedź, bez daty ani ceny |
🔗 Wpis NVIDIA o wydarzeniu Windows
Lokalne programowanie w Windows: Copilot będzie kierować zadania do MAI Code 1.1 Flash, jego sandbox staje się ogólnie dostępny, Replit przygotowuje aplikację komputerową
7 października — GitHub Copilot wkrótce będzie potrafił samodzielnie wybierać między modelem działającym na komputerze programisty a modelem w chmurze. Według wpisu Microsoft i GitHub opublikowanego na blogu Microsoft Command Line funkcja tego routingu pojawi się „do końca miesiąca”: nie jest jeszcze dostępna. GitHub przedstawia ją jako kolejny etap Project HydraFusion, swojego narzędzia do orkiestracji, które już rozdziela zadania między kilka modeli, i podkreśla oszczędność środków na AI, nie podając jej wielkości.
W Copilot CLI, aplikacji GitHub Copilot i VS Code przewidziano dwa sposoby korzystania z tej funkcji. Tryb Auto będzie w każdej turze wybierał między lokalną inferencją a chmurą w zależności od kontekstu zadania i stanu cache; programista będzie też mógł samodzielnie wskazać model lokalny: MAI Code 1.1 Flash przez dostawcę Windows ML lub dowolny model udostępniony przez lokalny punkt dostępu (endpoint) zgodny z API OpenAI. Wpis przypomina: lokalna inferencja nie sprawia, że sesja działa offline.
Demonstracja działa na Surface Laptop Ultra wyposażonym w RTX Spark. Microsoft AI uruchamia na nim lokalną wersję MAI Code 1.1 Flash, modelu typu mieszanka ekspertów (mixture-of-experts) wyspecjalizowanego w kodzie, ze 137 miliardami parametrów, z których 6,8 miliarda jest aktywnych. Po kwantyzacji do około 3,3 bitów na wagę zajmuje 53 Go, o 80 % mniej niż wariant chmurowy, a szczytowe zużycie pamięci wynosi 75,5 Go przy kontekście 256 000 tokenów.
| Oceniany benchmark (testy Microsoft z 5 października) | MAI Code 1.1 Flash | Wersja skwantyzowana na urządzeniu | GPT OSS 120B (wersja GGUF od Unsloth) |
|---|---|---|---|
| SWE-Bench Verified (500 zadań) | 72,6 % | 70,80 % | 32,0 % |
| Terminal-Bench 2.1 (89 zadań) | 62,9 % | 66,29 % | 23,6 % |
Microsoft wyjaśnia, że testy przeprowadzono w środowisku wykonawczym llama.cpp dla Windows ARM64 i że wyniki zależą od urządzenia i konfiguracji. Pierwszy element jest już dostępny w terminalu: od wersji zapoznawczej 1.0.94-0 Copilot CLI polecenie /model wykrywa modele lokalnej instancji Ollama. Nic nie jest dodawane bez potwierdzenia, Ollama i model muszą być już zainstalowane, a proponowane są wyłącznie modele obsługujące wywoływanie narzędzi i przesyłanie strumieniowe (streaming).
🔗 Lokalne modele i narzędzia w sandboxie trafiają do Windows i GitHub Copilot · Wykrywanie lokalnych modeli w GitHub Copilot CLI
Lokalny sandbox Copilot staje się ogólnie dostępny
7 października — Lokalny sandbox GitHub Copilot wychodzi z publicznej wersji zapoznawczej udostępnionej 2 czerwca: staje się ogólnie dostępny w Copilot CLI, aplikacji GitHub Copilot i sesjach VS Code korzystających z Agent Host, bez dodatkowych kosztów. Narzędzia i polecenia uruchamiane przez Copilot działają wtedy z ograniczonym dostępem do plików, sieci, danych uwierzytelniających Git i GitHub CLI oraz innych możliwości systemu, zgodnie z zasadami ustalonymi przez programistę lub jego organizację; firma może narzucić ustawienia, których programiści nie mogą złagodzić, niezależnie od używanego modelu. Silnik Microsoft eXecution Container (MXC) to biblioteka open source zespołu Windows, która korzysta z ProcessContainer w Windows, Seatbelt w macOS i bubblewrap w Linux, bez maszyny wirtualnej. Jej ograniczenia są udokumentowane: wbudowane narzędzia do obsługi plików są kontrolowane przez sam Copilot, a nie przez system, a zdalne serwery MCP pozostają poza lokalnym sandboxem.
🔗 Lokalny sandbox dla GitHub Copilot jest już ogólnie dostępny
Replit buduje aplikacje lokalnie w Windows
7 października — Replit wraz z Microsoft ogłasza wersję zapoznawczą aplikacji komputerowej, która buduje i uruchamia aplikacje bezpośrednio na komputerze użytkownika z Windows. Replit oferował już aplikację komputerową: nowością jest lokalne budowanie, w którym każdy build działa we własnym sandboxie, opartym na Microsoft Execution Containers i OpenShell, środowisku wykonawczym open source od NVIDIA. Wczesny dostęp wymaga zapisania się na listę oczekujących, bez podanej daty ani ceny, a o wersji dla macOS nie wspomniano. Replit zaprezentował tę wersję zapoznawczą na scenie podczas wydarzenia Windows 7 października.
🔗 Ogłoszenie Replit na X · Lista oczekujących na wersję zapoznawczą
OpenAI publikuje 722 manuskrypty wyników matematycznych uzyskanych przez wewnętrzny model
6 października — OpenAI publikuje jednocześnie obszerny zbiór wyników matematycznych uzyskanych przez zaawansowany wewnętrzny model, który nie jest publicznie dostępny. Repozytorium GitHub openai/math, ogłoszone wieczorem 6 października, zawiera 722 manuskrypty zebrane w 372 rodziny uporządkowane według dziedzin: głównemu wynikowi mogą towarzyszyć dodatkowe argumenty, wnioski lub alternatywne dowody.
Zdecydowana większość wyników pochodzi z tej samej procedury: modelowi przedstawiono około 4 000 problemów, a każdy wynik wymagał średnio odpowiednika trzech godzin rozumowania ChatGPT Pro. OpenAI wyjaśnia, że rozszerzyło swoje ewaluacje o otwarte problemy badawcze po osiągnięciu maksymalnych wyników w dotychczasowych ewaluacjach matematycznych. Dwie prace stanowią wyjątek od tej procedury: obszar wolny od zer funkcji dzeta Riemanna, którego opis został poprawiony przez człowieka dla większej czytelności, oraz dowód szczególnego przypadku hipotezy Hodge’a dotyczącego rozmaitości abelowych CM.
| Wskaźnik opublikowany przez OpenAI | Podana wartość |
|---|---|
| Opublikowane manuskrypty | 722 |
| Rodziny wyników | 372 |
| Problemy przedstawione modelowi | Około 4 000 |
| Średnie obliczenia na wynik | Około trzech godzin rozumowania ChatGPT Pro |
| Opublikowane podsumowania rozumowania | 10 |
Nie wszystkie wyniki są weryfikowane w ten sam sposób. Wiele dowodów sformalizowano w Lean, języku umożliwiającym komputerową weryfikację dowodu, ale nie wszystkie: OpenAI ostrzega, że „niektóre niesformalizowane wyniki mogą zawierać błędy”, obiecuje je szybko poprawiać i będzie na bieżąco dodawać nowe formalizacje. Dziesięć podsumowań rozumowania modelu dotyczy takich tematów jak wykładnik niewymierności π, hipotezy Mahlera, hipoteza Kaplansky’ego o bezpośredniej skończoności w charakterystyce dwa czy izomorfizm faktorów grup wolnych.
Samą publikację przygotowano we współpracy z niezależną grupą doradczą ds. matematyki i AI przy Institute for Advanced Study: ustalono procedury recenzowania i cytowania, poprawki publikowane jako nowe wersje oraz zachowanie historii. OpenAI zapowiada też finansowanie warsztatów, konferencji i programów poświęconych tym wynikom i informuje, że pracuje nad „odpowiedzialnym” dostępem naukowców do modelu, który je uzyskał, bez podania harmonogramu.
We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.
🇵🇱 Publikujemy szeroki zbiór nowych wyników matematycznych uzyskanych przez zaawansowany wewnętrzny model. Skonsultowaliśmy się z niezależną grupą doradczą ds. matematyki i sztucznej inteligencji przy Institute for Advanced Study i oparliśmy się na jej wskazówkach oraz publicznych rekomendacjach, podejmując decyzję o sposobie publikacji tych wyników. — @OpenAI na X
🔗 Dzielenie się postępami AI w matematyce · Repozytorium openai/math na GitHub
Perplexity publikuje pplx-embed-v2-late, wielowektorowe embeddings dla tekstu i obrazów
7 października — Perplexity Research publikuje pplx-embed-v2-late, dwa modele embeddings z późną interakcją (late interaction), o 0.6B i 9B parametrów, dostępne na Hugging Face na licencji MIT. Podczas gdy gęsty embedding kompresuje każdy dokument do jednego wektora, te modele typu ColBERT zachowują dla każdego tokenu wektor o 128 wymiarach i oceniają każdą parę zapytanie–dokument za pomocą MaxSim: każdy token zapytania jest dopasowywany do najbliższego tokenu dokumentu. Wyszukują w tekście, obrazach i wyrenderowanych stronach (PDF, slajdach, skanach) bez korzystania z OCR, co pozwala zachować tabele, ilustracje i układ strony.
Oba rozmiary współdzielą tę samą przestrzeń embeddings, ponieważ są destylowane token po tokenie z wewnętrznego modelu nauczycielskiego o 18B parametrów, wywodzącego się z modelu bazowego o 27B parametrów. Korpus zindeksowany modelem 9B można więc przeszukiwać za pomocą zapytań zakodowanych modelem 0.6B: na ViDoRe v3 dla obrazów ta konfiguracja osiąga 63,5 %, wobec 62,3 % z modelem 0.6B po obu stronach, bez dodatkowego kosztu obsługi zapytania. Model 0.6B, uzyskany przez przycięcie Qwen3.5-0.8B, służy zatem jako lekki enkoder zapytań, także bezpośrednio na urządzeniu.
| Oceniany benchmark (pomiary Perplexity) | Wynik 9B | Wynik 0.6B | Punkt odniesienia |
|---|---|---|---|
| 72 zadania specjalistyczne (nDCG@10) | 81,3 % | 78,0 % | 9B wyprzedza kolejny model o 1,6 punktu |
| Q2D-Web, wyszukiwanie w internecie (Recall@1000) | 74,8 % | 73,6 % | nemotron-embed-8b: 69,3 % |
| ViDoRe v3 dla obrazów (nDCG@10) | 65,2 % | 62,3 % | Tylko EVIE wyprzedza 9B |
| BrowseComp+ (agent GPT-OSS-120B) | 64,0 % | — | Kolejny najlepszy ColBERT: o 4,9 punktu mniej |
| MADQA (agent Gemini 3.5 Flash) | 92,4 % | 90,1 % | Mixedbread Agentic Search: 93,4 % |
9B nie wygrywa wszędzie i Perplexity o tym pisze: EVIE od Tencent wyprzedza go na ViDoRe v3 dla obrazów, gemini-embedding-2 na MIRACL-Vision i wewnętrznym benchmarku PPLX-Q2I, a Mixedbread Agentic Search osiąga lepszy wynik na MADQA — różnicę, którą Perplexity uznaje za mieszczącą się w swoim przedziale ufności. Firma przyznaje też, że zapotrzebowanie na pamięć masową i koszt obliczania ocen rosną wraz z długością dokumentów. Raport techniczny zapowiedziano „na później w tym roku”, a Perplexity planuje stopniowo udostępniać na swojej platformie API embeddings z późną interakcją, gęste i kontekstowe, bez podania daty.
🔗 Wpis Perplexity Research · pplx-embed-v2-late-9b na Hugging Face
Agenci programistyczni: Claude Code 2.1.293, Codex CLI 0.161.0, Cursor na iOS, Antigravity 2.21.0 i Warp Factories
Pięć narzędzi z agentami programistycznymi otrzymuje nowe funkcje: Claude Code wdraża Haiku 5.5, Codex CLI łączy się z serwerami MCP z terminala, Cursor można obsługiwać z iPhone’a, Antigravity grupuje działania swojego agenta, a Warp wprowadza obsługę narzędzi Microsoft.
Claude Code 2.1.293 domyślnie używa Haiku 5.5
7 października — Wydana kilka minut po ogłoszeniu Haiku 5.5 wersja 2.1.293 Claude Code ustawia go jako domyślny model Haiku w API Anthropic. Dodaje pole agentType do danych subagentStatusLine, aby rozróżniać niestandardowych subagentów, oraz opcję isDeferred, która od początku udostępnia schemat narzędzi zadeklarowanych przez mody. Większość zmian to 38 poprawek spośród 56 pozycji: Claude mógł błędnie umieszczać swoje ostatnie działania sprzed kompakcji w czasie po niej, a następnie cofać lub ponownie wykonywać ukończoną pracę; reguły ograniczone do określonej ścieżki i zagnieżdżone pliki CLAUDE.md ładują się także wtedy, gdy Claude odczytuje plik za pomocą cat lub grep w Bash; usunięto wyciek pamięci związany z połączeniami MCP HTTP. Wycofano dwie niedawne zmiany (komunikat odmowy trybu auto z wersji 2.1.281, poprawkę sesji cloud z wersji 2.1.290), a limit reguł kanału Claude Tag wzrósł z 20 do 50.
🔗 Claude Code 2.1.293 na GitHub
Codex CLI 0.161.0 uzależnia dostęp do Daybreak od włączenia opcji
7 października — Codex CLI 0.161.0 to pierwsza stabilna wersja od wydania 0.160.1 z 5 października. Polecenie /mcp login <name> pozwala połączyć się z serwerem MCP bez opuszczania bieżącej sesji terminala, a rozmowy głosowe zyskują wybór mikrofonu, głośnika i kanałów wejściowych. Daybreak, oferta OpenAI z dziedziny cyberbezpieczeństwa, wymaga teraz włączenia opcji: przełącznik /daybreak i stan Daybreak w wierszu statusu pozostają ukryte, dopóki użytkownik nie aktywuje tej opcji za pomocą --enable cli_daybreak (lub features.cli_daybreak=true), a bez niej automatyczny routing Cyber jest pomijany. Na jedną turę codex exec --cyber-access-program wybiera program dostępu Cyber. W Amazon Bedrock obsługa multi-agent V2 i poziomu wysiłku rozumowania Ultra trafia do kompatybilnych modeli, a Bedrock Mantle obsługuje regiony AWS GovCloud. Poprawki dotyczą uprawnień, wznawiania wątku i wykrywania uszkodzonej bazy SQLite.
Cursor pozwala sterować z iOS agentami na komputerze
6 października — Aplikacja Cursor na iOS wyświetla teraz agentów działających lokalnie na komputerze: można zobaczyć, co robi każdy z nich, i mu odpowiedzieć, a tweet zapowiadający tę funkcję wspomina także o uruchamianiu nowych zadań. Agenci pozostają na komputerze, a aplikacja łączy się z nim: komputer musi więc być włączony i online, a ustawienie Keep this computer awake zapobiega jego uśpieniu, gdy jest podłączony do zasilania i ma otwarty ekran. Funkcja jest domyślnie włączona, z wyjątkiem organizacji Enterprise, gdzie musi ją włączyć administrator; parowanie zatwierdza się w aplikacji na komputerze, a agenci cloud nie są wymagani. Aplikacja na iOS wydana pod koniec czerwca eksponowała agentów cloud: teraz to agenci lokalni stają się dostępni z telefonu.
Antigravity 2.21.0 grupuje działania swojego agenta
6 października — Aplikacja Antigravity od Google przechodzi na wersję 2.21.0, z 9 usprawnieniami i 14 poprawkami. Wyszukiwanie zaawansowane odnajduje rozmowę na podstawie jej treści, za pomocą ⌘+K (Ctrl+K w Windows). Zakładka zaplanowanych zadań (Scheduled Tasks) zmienia nazwę na Automations: można w niej natychmiast uruchomić automatyzację za pomocą Run Now lub poprosić agenta o pomoc w utworzeniu nowej za pomocą Create with Prompt. Modyfikacje plików, polecenia terminala i odczyty wykonywane przez agenta między dwiema odpowiedziami są teraz grupowane w jednym zwijanym wierszu z krótkim podsumowaniem. Wśród naprawionych błędów: ucięty film MP4 lub MOV odczytany przez agenta mógł powodować awarię całej dalszej rozmowy, a plik ustawień zapisany w Notatniku Windows lub PowerShell przestawał działać. Changelog informuje, że dotarcie nowej wersji do wszystkich użytkowników może potrwać kilka dni.
Warp Factories wprowadza obsługę Microsoft Teams i Azure DevOps
7 października — Warp rozszerza Warp Factories, swoją platformę fabryk oprogramowania (software factories), o Microsoft Teams i Azure DevOps Services. W Teams wzmianka o aplikacji Warp w skonfigurowanym kanale lub wątku przekazuje zadanie fabryce wraz z kontekstem rozmowy; fabryka informuje o postępach w tym samym wątku i przesyła tam swoje pull requests do przeglądu. W Azure DevOps można wspomnieć fabrykę w elemencie pracy (work item) lub pull request albo uruchamiać zadania w odpowiedzi na związane z nimi zdarzenia; każda fabryka otrzymuje własną tożsamość do operacji Git, z dostępem ograniczonym do wybranych repozytoriów. Obie integracje są dostępne dla wszystkich klientów Warp Factories. Warp przedstawia natywną obsługę obu usług jako pierwszą w branży; Devin już wcześniej integrował się z Teams i Azure DevOps Server.
API i platformy: toolsets computer use i browser use w SDK Claude, Grok 4.7 na Microsoft Foundry
Dwie zapowiedzi dla deweloperów tworzących rozwiązania oparte na hostowanych modelach: Anthropic upraszcza sterowanie komputerem lub przeglądarką, a Grok 4.7 trafia do ogólnej dostępności w Microsoft.
Toolsets computer use i browser use w SDK Claude
7 października — SDK Claude dla Python i TypeScript integrują w wersji beta zestawy narzędzi (toolsets) computer use i browser use. Dotychczas API wskazywało, co Claude chce kliknąć lub wpisać, i trzeba było napisać własną pętlę przekładającą każde działanie na polecenie. SDK teraz obsługuje tę pętlę: deweloper tworzy podklasę BetaAbstractBrowserToolset20260801 lub BetaAbstractComputerToolset20260801, pisze metodę dla każdego działania, a SDK kieruje wywołania do właściwych metod, stosuje dostarczone polityki dotyczące URL i plików, prosi o zatwierdzenia i tworzy wyniki zwracane modelowi. Anthropic nie dostarcza przeglądarki ani gotowego sterownika: podłącza się własną automatyzację lub sterownik Browser Use, Browserbase, E2B albo Daytona, a minimalny przykład wykorzystujący Chrome DevTools Protocol opublikowano w repozytorium claude-quickstarts. Wykonywanie JavaScript i wysyłanie plików są domyślnie wyłączone, a bez polityki URL żaden adres nie jest sprawdzany.
🔗 Wątek @ClaudeDevs na X · Dokumentacja toolsets w SDK
Grok 4.7 w ogólnej dostępności na Microsoft Foundry
7 października — Grok 4.7, model SpaceXAI wydany 21 września, jest dostępny na Microsoft Foundry, jak ogłosiło w nocy @SpaceXAI. Dokumentacja Microsoft klasyfikuje go jako ogólnie dostępny, wśród modeli sprzedawanych bezpośrednio przez Azure: tekst i obraz na wejściu, kontekst 500 000 tokenów (łącznie wejście i wyjście), wywoływanie narzędzi, dostęp przez Chat Completions lub Responses API oraz wysiłek rozumowania od low do xhigh, domyślnie high. Microsoft zobowiązuje się oferować modele Grok w ogólnej dostępności, począwszy od Grok 4.7, przez co najmniej sześć miesięcy; Grok 4.6 nadal figuruje tam w wersji testowej. Wieczorem 7 października strona z cennikiem Azure nie wymieniała jeszcze Grok 4.7. Po Amazon Bedrock (28 września) i Google Cloud w wersji testowej (1 października) Grok 4.7 jest zatem oferowany przez trzech największych dostawców cloud.
🔗 Wdrażanie i używanie modeli Grok w Microsoft Foundry
Otwarte modele: Open d1 od Liquid AI, Bolmo od Ai2 w Nature wraz z Bwen 8B i Blama 8B
Dwie publikacje modeli o otwartych wagach: jedna służy szybkiemu podejmowaniu decyzji na brzegu sieci, druga odczytywaniu tekstu bajt po bajcie.
Open d1, otwarte modele decyzyjne Liquid AI
7 października — Liquid AI otwiera swoją rodzinę modeli decyzyjnych za pomocą Open d1: dwóch modeli o otwartych wagach, d1-3B (tekst i obraz) oraz d1-omni-600M (tekst z obrazem lub dźwiękiem), przy czym ten ostatni jest we wczesnej wersji badawczej. Nie generują tekstu: w jednym przebiegu przypisują prawdopodobieństwo każdej dozwolonej odpowiedzi. Według Liquid AI d1-3B osiąga 48,57 w Decision Index 0.2.1, najlepszy wynik poniżej 10 miliardów parametrów, wyprzedzając Decider 35B-A3B (47,11), oraz średnią 82,9 na siedmiu publicznych zbiorach danych. Jego opóźnienie odpowiedzi na jedno pytanie, zmierzone z NVIDIA, wynosi od 8 ms na RTX 4090 do 50 ms na Jetson Orin Nano, co pozwala celować w zastosowania na brzegu sieci (edge). Nie opublikowano żadnego benchmarku dla obrazu ani dźwięku. Wagi są dostępne na Hugging Face na autorskiej licencji Liquid AI (lfm1.0), wraz z wersjami GGUF; d1 z 29 września był dostępny wyłącznie przez API.
🔗 Wpis Liquid AI na Hugging Face
Bolmo od Ai2 w Nature, wraz z Bwen 8B i Blama 8B
7 października — Ai2 przedstawia w artykule opublikowanym online w Nature 7 października metodę stojącą za Bolmo, swoją rodziną w pełni otwartych modeli, które odczytują bezpośrednio bajty zamiast fragmentów słów. Odczytywanie bajtów pozwala uniknąć luk wynikających ze stałego słownika (pisownia, nietypowe ciągi znaków, niektóre systemy pisma), ale dotychczas wymagało pełnego treningu od zera. Konwersja na bajty (byteifying) zaczyna natomiast od już skutecznego modelu opartego na fragmentach słów i przekształca go przez krótki dodatkowy trening. Bolmo 1B i 7B, wywodzące się z Olmo, pochodzą z grudnia; Ai2 przedstawia też Bwen 8B (wywodzący się z Qwen 3 8B, licencja Apache-2.0) i Blama 8B (wywodzący się z Llama 3 8B, licencja llama3), których repozytoria istnieją od 26 sierpnia, a także punkty kontrolne „Stage 1”, w których trenowana jest tylko nowa warstwa bajtowa. Według Ai2 oba modele zbliżają się wynikami do swoich modeli źródłowych, a Bwen 8B przewyższa Bolmo 7B, bez opublikowanych danych liczbowych.
🔗 Wpis Ai2
SynthID Detector dostępny dla wszystkich do sprawdzania obrazów, filmów i dźwięków
7 października — Google udostępnia wszystkim SynthID Detector, narzędzie wykrywające niewidoczne znaki wodne SynthID w treściach wygenerowanych przez IA. Zaprezentowane w zeszłym roku we wstępnej wersji dla profesjonalistów z branży mediów, jest dostępne na synthid.com, na całym świecie i w języku angielskim. Można przesłać do niego obraz, film lub plik audio. Weryfikacja obejmuje treści Google oraz jego partnerów OpenAI, NVIDIA i Kakao, a wkrótce także Apple. Portal uprzedza, że nie jest to uniwersalny detektor IA: treść pochodząca z modelu bez SynthID lub mocno zmodyfikowana może otrzymać wynik „nie wykryto”. Google podaje, że od 2023 roku oznaczono znakami wodnymi ponad 180 miliardów obrazów i filmów oraz 240 000 lat nagrań audio, wobec 100 miliardów i 60 000 lat ogłoszonych w lipcu, a w Search, aplikacji Gemini i Chrome przeprowadza się ponad milion weryfikacji dziennie.
🔗 Google rozszerza SynthID Detector do wykrywania treści AI
Bezpieczeństwo: klasyfikator GitHub do wykrywania ujawnionych sekretów
7 października — GitHub wdraża dostrojony klasyfikator ModernBERT, przeznaczony do wykrywania ujawnionych sekretów i opracowany z Microsoft Applied Sciences: odczytuje kod otaczający daną wartość, aby wykrywać prawdopodobne dane uwierzytelniające, w tym hasła bez rozpoznawalnego formatu. Ocenia partię kandydatów w mniej niż 2 ms i według GitHub mógłby „ponad dwukrotnie zwiększyć” liczbę sekretów blokowanych przy push. Od teraz alerty dotyczące haseł wykrytych przez IA przechodzą na ten model, bez dodatkowych opłat. Ochrona pushów przez IA, w prywatnej wersji testowej, ma pojawić się „jeszcze w tym miesiącu” dla organizacji spełniających warunki, a kontrole polecenia /security-review w Copilot trafią „wkrótce” do prywatnej wersji testowej — obie funkcje będą rozliczane w kredytach IA. Esej Erin Havens, odpowiedzialnej za produkty bezpieczeństwa w GitHub, przypomina, że jedna na trzy pull requests angażuje agenta IA, a ochrona pushów zatrzymuje tylko około 30 % nowo wykrytych sekretów.
🔗 Ochrona sekretów musi skalować się wraz z oprogramowaniem
Infrastruktura: GitHub przebudowuje Git pod kątem aktywności agentów
6 października — GitHub przebudowuje swoją infrastrukturę Git, aby nadążyć za rozwojem oprogramowania z udziałem agentów. Według wpisu inżynierskiego Briana Celenzy całkowita aktywność Git wzrosła z 218,2 do 473,3 miliarda zdarzeń miesięcznie między wrześniem 2025 a sierpniem 2026; deweloperzy i agenci wygenerowali we wrześniu 2026 7,38 miliarda commitów, ponad pięć razy więcej niż rok wcześniej, a liczba operacji push wzrosła 4,9 raza. Obecna architektura, Spokes, replikuje każde repozytorium na kilku serwerach i zatwierdza każdą aktualizację głosowaniem większościowym: dodawanie kopii do obsługi odczytów spowalnia więc zapis. Nowa architektura oddziela przechowywanie danych od obliczeń, umieszczając dane referencyjne w Azure Blob Storage i wykorzystując lekkie procesy (workers), które obsługują odczyty z cache. W wewnętrznych benchmarkach GitHub odnotowuje nawet 35 razy większą przepustowość zapisu, ale nie podaje daty przejścia na nową architekturę.
🔗 Budowa infrastruktury Git na potrzeby rozwoju oprogramowania z udziałem agentów na dużą skalę
Głosowa IA: ElevenLabs podpisuje memorandum z jednym z indyjskich stanów
7 października — Podczas swojego Summit w Bengaluru ElevenLabs podpisało pierwsze memorandum (MOU) z rządem jednego z indyjskich stanów w sprawie pilotażu głosowej IA. Firma nie podaje nazwy stanu, harmonogramu, zakresu ani kwoty: ogłoszenie ogranicza się do jednego tweeta, bez wpisu na blogu. Towarzyszące mu dane pokazują skalę przedsięwzięcia: w ciągu ostatniego roku ElevenAgents przeprowadziło w Indiach ponad 100 milionów rozmów, z czego ponad 70 % w językach hindi, kannada, tamilskim i telugu. Summit zgromadził ponad 500 przedstawicieli kierownictwa firm, deweloperów i partnerów.
Badania: PivotOPD, metoda NVIDIA pozwalająca naprawić kluczowy błąd agenta
7 października — Badacze NVIDIA przedstawiają PivotOPD, metodę trenowania agentów wykonujących działania w wielu kolejnych turach. Ich obserwacja: w ALFWorld 59 % niepowodzeń trzech modeli Qwen3 zawiera „błąd kluczowy”, popełniony wcześnie, po którym agent kontynuuje działania w niewłaściwym kierunku. PivotOPD rozszerza destylację zgodną z bieżącą polityką (on-policy distillation): przy każdym błędzie kluczowym model nauczyciel wskazuje właściwe działanie, a następnie działanie naprawcze na kolejne tury, dzięki czemu model uczeń uczy się zarówno unikać błędu, jak i wychodzić z jego skutków. W porównaniu z 13 metodami referencyjnymi uzyskuje najlepszy średni wynik na ALFWorld, WebShop i Search-based QA z modelami uczniami Qwen3 1.7B i 8B oraz pozwala naprawić 72,7 % spośród 72 odtworzonych błędów kluczowych, wobec 20,3 % przy standardowej destylacji. Poprawa przenosi się na programowanie: wynik modelu ucznia Nemotron-3.5 rośnie z 62,8 % do 66,0 % na SWE-Bench Verified. Artykuł jest dostępny na arXiv; publikację kodu zapowiedziano wkrótce.
Optymalizacja: mPDLP rozdziela gigantyczne problemy programowania liniowego między kilka GPU w cuOpt
7 października — NVIDIA dodaje do cuOpt, swojej biblioteki optymalizacyjnej open source, mPDLP, solver programowania liniowego działający na kilku GPU połączonych przez NVLink, przeznaczony do dużych problemów planowania (łańcuchy dostaw, sieci elektroenergetyczne). Grupując współzależne zmienne i ograniczenia na jednym GPU, ogranicza wymianę danych i zmniejsza szczytowe zużycie pamięci na GPU nawet 6 razy. Na węźle DGX B200 przyspieszenie sięga 11,4 raza dla obliczeń PDLP i 4,2 raza dla całego procesu; w porównaniu z D-PDLP mPDLP jest od 1,2 do 2,5 raza szybszy dla większości dużych problemów, ale wolniejszy dla trzech największych instancji i małych problemów. Kinaxis rozwiązuje 3,3 raza szybciej problem łańcucha dostaw obejmujący ponad 135 milionów zmiennych na ośmiu H100, a PSR ponad 5 razy szybciej model energetyczny obejmujący 185 milionów zmiennych na ośmiu B200.
Robotyka: roboty montują tace testowe GB300
7 października — Seattle Robotics Lab NVIDIA opisuje, jak uczy roboty montowania tac testowych GB300, które sprawdzają moduły przed wysyłką. Wspólnie z Foxconn, producentem tych systemów, wybrano dwa zadania: umieszczenie i przykręcenie szyny zbiorczej w 16 punktach oraz podłączenie czterech złączy na elastycznych kablach. Wymaganie ustalone z Foxconn to 99,5 % skuteczności, w czasie nie dłuższym niż dwukrotność czasu wykwalifikowanego operatora, bez kolizji. Roboty zbliżają się do tego celu, ale go nie osiągają: ponad 95 % skuteczności w 160 sekund dla szyny, wobec zakładanych 124, oraz od 90 do 95 % dla złączy, przy 40 sekundach na kabel. Zespół łączy klasyczny system percepcji i sterowania, estymację pozycji i orientacji DOPER oraz uczenie przez wzmacnianie w Isaac Lab, korygowane na fizycznym robocie. NVIDIA obiecuje opublikować DOPER i swój orkiestrator TALOS, nie podając daty.
🔗 Wpis na blogu technicznym NVIDIA o tacach GB300
W skrócie
- Aplikacja ChatGPT na iOS 1.2026.272 — Wyświetla podglądy stron bezpośrednio w odpowiedziach, otwiera linki do zadań Codex w aplikacji, a w Codex Mobile zmienia sposób wyboru trybu zatwierdzania i przyspiesza obsługę długich wątków. 🔗 źródło
- Radisson Hotel Group — Według studium przypadku OpenAI jego plugin ChatGPT, zbudowany w sześć tygodni z Accenture Song, osiąga około 1,5 raza wyższą konwersję niż ruch z wyszukiwania organicznego w okresie lipiec–sierpień 2026, a 54 % zdarzeń płatności i rezerwacji w jego kampanii reklamowej w ChatGPT przypisuje się samym wyświetleniom reklam. 🔗 źródło
- Jump Trading — Firma zajmująca się tradingiem ilościowym powierza agentom GPT-6 Astra analizy, które mogą trwać kilka dni i zestawiać liczne źródła danych, z przeglądem przez człowieka na końcu procesu; studium przypadku OpenAI nie podaje żadnych liczbowych danych o korzyściach. 🔗 źródło
- Rozszerzenia pluginów ChatGPT — W wątku towarzyszącym samouczkowi wideo OpenAI Developers wymienia Adobe, Canva, Figma, Shopify, Instacart i Atlassian wśród firm, które z nich korzystają, obok tldraw i MagicPath; zaprezentowane 29 września rozszerzenia uruchamiają plugin z paska bocznego, obsługują wzmianki @ i dodają przeglądarki plików. 🔗 źródło
- Every i Claude Managed Agents — Zespół Every zbudował na Claude Managed Agents agenta firmowego, którego każdy używa w Slack do udostępniania swoich skills każdemu nowemu modelowi, a następnie udostępnił go subskrybentom; Anthropic udostępnia wywiad wideo, bez danych liczbowych. 🔗 źródło
- Zed 1.23 i wersja zapoznawcza 1.24.1 — Wersja 1.23 staje się stabilna wraz z podglądem plików JSONL i NDJSON, a wersja zapoznawcza 1.24.1 pozwala przeciągnąć kartę terminala do Agent Panel, obsługuje niestandardowe modele Amazon Bedrock z narzędziami, obrazami i rozumowaniem, tworzy tagi Git i zmniejsza plik binarny dla Linux o około 23 %. 🔗 źródło
- Puck, metaagent Amp — Obsługuje teraz kilka oddzielnych rozmów: przycisk + otwiera nową, kliknięcie jego nazwy pozwala przełączać się między nimi, a rozmowy nieaktywne przez trzy dni są odkładane osobno. 🔗 źródło
- Copilot CLI 1.0.93 — Wydana jako wersja stabilna, stosuje zmiany konfiguracji serwerów MCP między turami bez ponownego uruchamiania sesji i udostępnia wszystkim sandbox poleceń przez /sandbox i —sandbox; Copilot SDK 1.0.17 również staje się wersją stabilną. 🔗 źródło
- Metryki użycia Copilot — Zaniżały aktywność agentów, odkąd kilka IDE obsługuje ich sesje przez Copilot SDK; poprawka wymaga aktualizacji (VS Code 1.139.0 już teraz, Visual Studio 18.12 w październiku, JetBrains pod koniec października, Eclipse i Xcode do listopada), a utracone dane nie zostaną odzyskane. 🔗 źródło
- Gemini CLI v0.65.0-nightly.20261007 — To wydanie nightly rozpoczyna serię 0.65.0 z pięcioma poprawkami, w tym dwiema zapobiegającymi utracie danych: ustawienia projektu stają się dostępne tylko do odczytu w niezaufanym folderze, w którym
gemini mcp addmogło opróżnić.gemini/settings.json, a natychmiastowe wyjście ze wznowionej sesji nie usuwa już jej historii. 🔗 źródło - Transformers.js 4.3.1 — Dzień po premierze EmbeddingGemma 2 biblioteka oblicza jego multimodalne embeddingi (740 milionów parametrów, 768 wymiarów) bezpośrednio w przeglądarce, przez WebGPU lub WASM, albo w Node.js. 🔗 źródło
- RL Environment Explorer — Adithya S K z Hugging Face przedstawia ten Space FineEnvs do przeglądania, wizualizowania i uruchamiania środowisk uczenia przez wzmacnianie z Hub (OpenEnv, Harbor, MiMo, Verifiers, NeMo Gym): ponad 12 milionów wpisów zadań, pochodzących głównie z kilku dużych środowisk OpenEnv. 🔗 źródło
- Seb-9B — Stas Veretennikov publikuje ten lokalny model decyzyjny na licencji Apache-2.0 (tekst, JSON lub obraz, do 20 opcji), który uzyskuje średni wynik 0,792 na 17 publicznych zestawach testów, wobec 0,786 dla Jev 1.13; autor przeprowadził wszystkie pomiary i zaznacza, że dane treningowe zawierały część treningową jednego z benchmarków, bez jego przypadków testowych. 🔗 źródło
- Nemotron na olimpiadach 2026 — NVIDIA szczegółowo opisuje wspólny schemat (dostrajanie nadzorowane, uczenie przez wzmacnianie, pętla generowania, weryfikacji i korekty), który pozwolił uzyskać 535,4 na 600 na IOI 2026 przy nieoficjalnym udziale oraz 30 na 42 na IMO 2026 przy progu złota wynoszącym 29, i publikuje benchmark Nemotron-IMO-Bench obejmujący 200 problemów. 🔗 źródło
- Instadocs: AI Gone Wild — Netflix zapowiada na 12 października ten dokument odtwarzający cyberatak na Hugging Face z lipca, przeprowadzony według Netflix przez autonomicznych agentów stworzonych przez badaczy OpenAI. 🔗 źródło
- Runway w katalogu aplikacji ChatGPT — Po zainstalowaniu pluginu i połączeniu konta Runway wzmianka @Runway w rozmowie zleca mu generowanie obrazów lub filmów; Runway nie podaje cen ani kosztu w kredytach. 🔗 źródło
- Face Swap od Luma — Funkcja zastępuje twarz postaci w istniejącym ujęciu, pozwalając wprowadzać kolejne zmiany bez zaczynania wszystkiego od nowa; ogłoszenie ogranicza się do dwóch tweetów, bez strony produktu, cen ani szczegółów dotyczących modelu. 🔗 źródło
- DSX Air — NVIDIA pokazuje, jak testować zmiany w fabryce IA na tym cyfrowym bliźniaku: agenci wprowadzają modyfikację, sprawdzają konfigurację, bezpieczeństwo i izolację, a następnie przedstawiają raport, przy czym wdrożenie produkcyjne nadal wymaga zatwierdzenia przez człowieka; wpis opisuje metodę, bez danych liczbowych. 🔗 źródło
- cuPhoton — Samouczek NVIDIA wykorzystuje ten zestaw narzędzi open source do analizy obrazów astronomicznych na GPU, od odczytu plików FITS po przegląd kandydatów; deklarowane przyspieszenia, sięgające 14 900 razy, dotyczą wybranych operacji, a nie całego procesu przetwarzania. 🔗 źródło
- Cosmos i SynthID — Treści generowane przez modele NVIDIA Cosmos na build.nvidia.com zawierają znak wodny SynthID i każdy może je teraz sprawdzić za pomocą detektora udostępnionego przez Google. 🔗 źródło
- TypeScript SDK SpaceXAI 0.2.3 — Dodaje poziom usługi
fast, zamienny zpriority, oraz identyfikatorgrok-imagine-video-1.5-lite, odnoszący się do lżejszego modelu wideo niewymienionego w informacjach o wydaniu: według danych ze strony modeli nie przyjmuje on audio na wejściu i kosztuje cztery razy mniej za sekundę niżgrok-imagine-video-1.5w 480p. 🔗 źródło - Poradnik RAG vs. LLM — Perplexity publikuje poradnik edukacyjny przedstawiający RAG i LLM jako rozwiązania uzupełniające się, rozróżnia trzy rodzaje RAG (naiwny, modułowy, zaawansowany) i wyjaśnia, kiedy wystarcza sam LLM; bez nowych funkcji ani danych liczbowych. 🔗 źródło
Co to oznacza
Małe modele stają się produktem masowym. Od 8 października bezpłatnym użytkownikom ChatGPT odpowiada GPT-6 Luna, a Anthropic ustala cenę Haiku 5.5 na 0,10 dolara za milion tokenów wejściowych przy promptach poniżej 100 000 tokenów, jednocześnie obniżając o połowę cenę odczytów cache Sonnet 5.5. Te modele biorą na siebie większość obciążenia: codzienne rozmowy, podagentów, streszczenia, compactions. Ranking Cursor przypomina jednak, że cena za token nie mówi wszystkiego: przy poziomie rozumowania Max Haiku 5.5 zużywa na zadanie prawie dziewięć razy więcej tokenów niż Sonnet 5.5 przy poziomie High, przy zaledwie nieco niższym koszcie zadania (1,12 dolara wobec 1,20). Z kolei miesięczne środki na API w planach Max i Team zachęcają subskrybentów do wypróbowania tych modeli we własnym kodzie.
IA trafia też na komputery użytkowników. Laptopy RTX Spark pojawią się 16 października, DGX Station for Windows obiecuje do 20 petaflopów na biurku, a do końca miesiąca Copilot ma samodzielnie powierzać część zadań lokalnie działającemu MAI Code 1.1 Flash. Replit buduje teraz aplikacje na komputerze użytkownika. Wykonywanie kodu przez agentów na komputerze osobistym rodzi pytanie o bezpieczeństwo, a ten sam element pojawia się wszędzie: Microsoft Execution Containers (MXC), ogólnie dostępne w Windows, izoluje zarówno polecenia Copilot, jak i buildy Replit. GitHub z kolei wdraża klasyfikator przeznaczony do wykrywania ujawnionych sekretów i przebudowuje swoją infrastrukturę Git, ponieważ już co trzeci pull request angażuje agenta, a liczba commitów wzrosła ponad pięciokrotnie w ciągu roku.
Odpowiedź także staje się interfejsem. Dzięki Intelligent UI ChatGPT odpowiada za pomocą wykresów, formularzy lub niewielkiego narzędzia tworzonego na żądanie i zaczyna odpowiadać, zanim skończy rozumować. Po stronie deweloperów SDK Claude obsługują pętlę computer use i browser use, a Cursor pozwala śledzić z iPhone’a agentów pracujących na komputerze i im odpowiadać. We wszystkich trzech przypadkach tekst jest już tylko częścią wymiany: IA wyświetla, klika i zdaje relację, a użytkownik nadzoruje.
Wreszcie wiele dzisiejszych liczb pochodzi z pomiarów wykonanych przez tych, którzy je publikują: benchmarki Haiku 5.5 od Anthropic, MAI Code 1.1 Flash od Microsoft, Q2D-Web od Perplexity, które go zaprojektowało, wyniki Open d1 od Liquid AI oraz 35-krotny wzrost przepustowości zapisu z wewnętrznych testów GitHub. Sama OpenAI ostrzega, że niesformalizowane wyniki zawarte w jej 722 manuskryptach mogą zawierać błędy, a deklarowane przyspieszenia GPT-6 pochodzą z wewnętrznych ocen. Te pomiary pozostają przydatne do porównywania produktów; zewnętrzne oceny, takie jak ranking CursorBench, w którym producent narzędzi ocenia model innej firmy, pozwolą je zweryfikować.
Źródła
- GPT-6 i Intelligent UI dla wszystkich (OpenAI)
- Zapowiedź GPT-6 dla wszystkich (@OpenAI)
- Karta systemowa GPT-6 Sol i GPT-6 Luna, październikowa aktualizacja
- GPT-6 i inne modele w ChatGPT
- Informacje o wydaniach ChatGPT
- Przesyłanie plików i nagrań audio do ChatGPT
- Pomoc nastolatkom w nauce, planowaniu i kształtowaniu przyszłości AI (OpenAI)
- Zapowiedź Claude Haiku 5.5 (Anthropic)
- Premiera Claude Haiku 5.5 (@claudeai)
- Przewodnik migracji do Haiku 5.5
- Haiku 5.5 w Cursor (@cursor_ai)
- Ranking CursorBench
- Miesięczne kredyty API w planach Max i Team (pomoc techniczna Claude)
- Zapowiedź kredytu API (@ClaudeDevs)
- RTX Spark i DGX Station for Windows (blog NVIDIA)
- Wprowadzenie lokalnych modeli i narzędzi działających w sandboxie do Windows i GitHub Copilot (Microsoft Command Line)
- Odkryj lokalne modele w GitHub Copilot CLI
- Lokalny sandboxing w GitHub Copilot jest już ogólnie dostępny
- Wersja zapoznawcza aplikacji desktopowej Replit (@Replit)
- Lista oczekujących na aplikację desktopową Replit
- Dzielenie się postępami AI w matematyce (OpenAI)
- Repozytorium openai/math
- Ogłoszenie wyników matematycznych (@OpenAI)
- Multimodalne embeddings wykraczające poza pojedynczy wektor (Perplexity Research)
- pplx-embed-v2-late-9b na Hugging Face
- Claude Code 2.1.293
- Codex CLI 0.161.0
- Zdalne sterowanie lokalnymi agentami (changelog Cursor)
- Changelog Antigravity
- Warp Factories, Microsoft Teams i Azure DevOps (blog Warp)
- Zestawy narzędzi computer use i browser use w SDK (@ClaudeDevs)
- Dokumentacja zestawów narzędzi SDK Claude
- Wdrażanie i używanie modeli Grok w Microsoft Foundry
- Open d1 (Liquid AI na Hugging Face)
- Bolmo w Nature (Ai2)
- Google rozszerza SynthID Detector do wykrywania treści AI
- Ochrona sekretów musi skalować się wraz z oprogramowaniem (GitHub)
- Tworzenie infrastruktury Git do rozwoju oprogramowania na skalę pracy agentów (GitHub)
- Memorandum o porozumieniu z indyjskim stanem (@ElevenLabs)
- PivotOPD (NVIDIA Research)
- mPDLP w cuOpt (blog techniczny NVIDIA)
- Maszyny, które tworzą maszyny (blog techniczny NVIDIA)
- Changelog ChatGPT i Codex, ChatGPT na iOS 1.2026.272
- Radisson Hotel Group wprowadza wyszukiwanie hoteli do ChatGPT (OpenAI)
- Jak Jump Trading skaluje badania ilościowe za pomocą ChatGPT (OpenAI)
- Rozszerzenia pluginów ChatGPT (@OpenAIDevs)
- Every i Claude Managed Agents (@claudeai)
- Zed v1.24.1-pre
- Wiele, wiele Pucks (Amp)
- Copilot CLI 1.0.93
- Zaktualizuj IDE, aby przywrócić dane o aktywności agentów w metrykach użycia Copilot
- Gemini CLI v0.65.0-nightly.20261007
- Transformers.js 4.3.1
- RL Environment Explorer (@adithya_s_k)
- Seb-9B w bezpośrednim porównaniu (blog Hugging Face)
- Nemotron na IOI i IMO 2026 (blog Hugging Face)
- Instadocs: AI wymykająca się spod kontroli (@netflix)
- Runway w ChatGPT (@runwayml)
- Face Swap (@LumaLabsAI)
- Weryfikowanie zmian w fabrykach AI za pomocą cyfrowych bliźniaków i agentów AI (blog techniczny NVIDIA)
- Szybsza analiza obrazów naukowych z NVIDIA cuPhoton
- Cosmos i SynthID (@NVIDIAAI)
- SDK TypeScript SpaceXAI 0.2.3
- RAG a LLM (Perplexity)