Szukaj

Runway wprowadza Solaris, model generujący interfejsy bez kodu, ChatGPT Ads osiąga roczne tempo przychodów na poziomie 1 miliarda dolarów, Together AI podpisuje umowę na 250 MW w Arabii Saudyjskiej

Artykuł wygenerowany przez sztuczną inteligencję
Runway wprowadza Solaris, model generujący interfejsy bez kodu, ChatGPT Ads osiąga roczne tempo przychodów na poziomie 1 miliarda dolarów, Together AI podpisuje umowę na 250 MW w Arabii Saudyjskiej

ai-powered-markdown-translator

Artykuł przetłumaczony z francuskiego na polski za pomocą gpt-5.6-sol.

Zobacz projekt na GitHubie ↗

Osiemnaście ogłoszeń z 30 i 31 sierpnia, przy bardzo nierównym rozkładzie: w niedzielę nie pojawiła się żadna oficjalna publikacja, a niemal cały materiał pochodzi z poniedziałku. Nadrobiono zaległości spowodowane awarią X, o której informowano w wydaniu z 30 sierpnia: konta niedostępne tego dnia ponownie przejrzano w ujęciu trzydniowym, nie znajdując żadnych pominiętych ogłoszeń.

Wyłaniają się trzy główne wątki. Po pierwsze, bezprecedensowy model — pierwszy model świata interfejsu firmy Runway. Następnie dwa kamienie milowe w biznesie: osiągnięcie przez platformę reklamową OpenAI rocznego tempa przychodów w wysokości miliarda dolarów oraz podpisana przez Together AI umowa infrastrukturalna na 250 MW. Na koniec fala narzędzi dla programistów od GitHub, NVIDIA i Amp, uzupełniona trzema pracami badawczymi opublikowanymi na blogu społeczności Hugging Face.


Runway wprowadza Solaris, swój pierwszy model świata interfejsu

31 sierpnia — Runway zaprezentował Solaris, pierwszy model z rodziny określanej przez laboratorium mianem modeli świata interfejsu (Interface World Models). Zasadę można ująć w jednym zdaniu: zamiast tworzyć kod, który dopiero później wyświetli interfejs, model generuje bezpośrednio sam interfejs, klatka po klatce, i reaguje w czasie rzeczywistym na kliknięcia oraz przeciąganie elementów.

Punktem wyjścia jest obserwacja dotycząca procesu tworzenia oprogramowania. Makietę trzeba najpierw przełożyć na kod, zanim zacznie cokolwiek robić, a takie tłumaczenie pociąga za sobą podwójny koszt: każde zachowanie musi zostać zdefiniowane z wyprzedzeniem, przez co oprogramowanie zostaje utrwalone jeszcze przed pojawieniem się pierwszego użytkownika, a wizualne bogactwo pierwotnego projektu ginie po drodze. Solaris eliminuje etap pośredni, a cały obraz staje się interfejsem.

Od strony technicznej model opiera się na Gen-4.5, modelu wideo firmy Runway, i stanowi rozwinięcie GWM-1, jej ogólnego modelu świata. Dane wejściowe użytkownika warunkują następną klatkę tak samo jak tekst lub obraz, dzięki czemu zależność między działaniem a jego wizualnym rezultatem jest przyswajana bez programowania jakiegokolwiek zachowania. Przejście do działania w czasie rzeczywistym wymagało trzech etapów: przekształcenia generowania w proces autoregresyjny przebiegający klatka po klatce, destylacji wieloetapowego odszumiania do kilku etapów, a następnie wytrenowania szybkiego modelu na jego własnych wynikach. LLM decyduje o rozwoju sceny, podczas gdy model świata ją renderuje.

Kryterium oceniane przez uczestnikówSolarisInterfejs zakodowany (Claude Opus 5)Oceny równoważne
Zgodność z podaną instrukcją61 %24 %13 %
Naturalność zachowania w scenie71 %21 %6 %
Cecha technicznaZmierzona wartość
Model bazowyGen-4.5, stanowiący rozwinięcie GWM-1
Utrzymywana rozdzielczość720p
Próg interaktywnościokoło 0,5 s opóźnienia
Badanie użytkowników250 uczestników, 30 przykładów, niemal 7 500 ocen parami
Benchmark rekonstrukcji30 interfejsów, podobieństwo strukturalne (SSIM) i deskryptory DINOv3

Różnica jest znacznie wyraźniejsza w naturalności zachowania niż w samej zgodności z instrukcją, a Runway dostrzega w tym fundamentalną odmienność obu podejść: zakodowany interfejs często potrafi odtworzyć żądaną zmianę, lecz traktuje ją jako odizolowaną aktualizację, podczas gdy model, który nauczył się zachowania obiektów, generuje reakcję spójną z pozostałą częścią sceny. Laboratorium wskazuje także drugie, mniej oczywiste zastosowanie: trenowanie agentów, którym stale regenerujące się środowisko zapewniałoby nieustannie zmieniające się interfejsy, w tym układy, które nigdy wcześniej nie istniały.

Runway opisuje również to, czego Solaris jeszcze nie potrafi, a lista jest obszerna: stabilny i czytelny tekst pozostaje jednym z najtrudniejszych problemów generowania wideo, mimo że interfejsy zależą od niego bardziej niż jakakolwiek inna dziedzina; osadzenie w faktach wymaga warunkowania generowania zweryfikowanymi danymi; zachowanie spójności podczas długich sesji pozostaje przedmiotem badań; a generowany interfejs nadal musi współpracować z technologiami wspomagającymi i API dostępności. Publiczne udostępnienie jest przygotowywane wraz z partnerami, a o wcześniejszy dostęp można ubiegać się za pomocą formularza.

Today, we’re sharing new research on Solaris, our first Interface World Model. Solaris is a new kind of operating system that generates interactive interfaces frame by frame, in real time, with no code.

🇵🇱 Dziś przedstawiamy nowe badania nad Solaris, naszym pierwszym Interface World Model. Solaris to nowy rodzaj systemu operacyjnego, który generuje interaktywne interfejsy klatka po klatce, w czasie rzeczywistym i bez kodu.@runwayml na X

🔗 Runway — Przedstawiamy Solaris


ChatGPT Ads osiąga roczne tempo przychodów na poziomie miliarda dolarów i uruchamia samoobsługę w czterech nowych regionach

31 sierpnia — OpenAI opublikowało wpis poświęcony ChatGPT Ads, swojej platformie reklamowej zintegrowanej z ChatGPT, informując, że w mniej niż 200 dni od uruchomienia platforma osiągnęła roczne tempo przychodów (annualized revenue run rate) na poziomie miliarda dolarów. Od razu warto zaznaczyć istotne zastrzeżenie: nie chodzi o miliard już uzyskany, lecz o przychód z ostatniego okresu przeliczony na dwanaście miesięcy. Platforma reklamowa istniejąca krócej niż dwieście dni z definicji nie mogła jeszcze uzyskać całorocznych przychodów w takim tempie. Otwarcie samoobsługowego zakupu za pośrednictwem Ads Manager w Indiach, Europie, na Bliskim Wschodzie i w Afryce Północnej zapowiedziano na późniejszą część dnia.

OpenAI przedstawia reklamę jako jeden z filarów swojego modelu biznesowego, obok subskrypcji konsumenckich, ofert dla przedsiębiorstw oraz API rozliczanych według użycia, i wyraźnie wiąże ją z finansowaniem bezpłatnego poziomu, dzięki któremu ChatGPT pozostaje dostępny dla ponad miliarda aktywnych użytkowników tygodniowo. System opiera się na czterech zobowiązaniach: reklamy są zawsze wyraźnie oznaczone i oddzielone od odpowiedzi, reklama nie wpływa na udzielane odpowiedzi, reklamodawcy nie mają dostępu do prywatnych rozmów, a użytkownik kontroluje stopień personalizacji swoich doświadczeń reklamowych.

Metryka opublikowana przez OpenAIPodana wartość
Roczne tempo przychodów (projekcja)1 miliard dolarów
Czas od uruchomieniamniej niż 200 dni
Reklamodawcy na platformiedziesiątki tysięcy
Obsługiwane już krajeponad 40
Nowe rynki otwarte w modelu samoobsługowymIndie, Europa, Bliski Wschód, Afryka Północna
Partnerzy technologiczni i pomiarowiponad 50
Aktywni użytkownicy ChatGPT tygodniowoponad 1 miliard
Podany zwrot z wydatków reklamowych w ciągu 28 dni3x u jednego reklamodawcy e-commerce
Ruch reklamowy pochodzący od nowych klientówponad 80 % u jednego partnera technologicznego

Opisana ścieżka prowadzi od sprzedaży zarządzanej do platformy z otwartym dostępem. Początkowy model opierał się na agencjach i partnerach; uruchomienie Ads Manager w maju otworzyło platformę reklamową dla małych i średnich przedsiębiorstw, które odpowiadają już za znaczącą część działalności. Jeśli chodzi o narzędzia, licytacja CPC oraz licytacja zoptymalizowana pod kątem wyników (outcome-optimized bidding) stanowią większość kampanii, natomiast Pixel i API Conversions są podstawą pomiarów. OpenAI zauważa również, że reklamodawcy spoza Stanów Zjednoczonych odpowiadają za coraz większą część przychodów.

W dalszej perspektywie firma zapowiada nowe rynki, formaty, cele i opcje zakupu oraz deklaruje zamiar zbadania bardziej naturalnych sposobów interakcji przedsiębiorstw z konsumentami wewnątrz ChatGPT — czyli formatów mniej odseparowanych od rozmowy niż obecne reklamy.

🔗 OpenAI — Kamień milowy w rozszerzaniu dostępu do AI


Together AI: 250 MW w Arabii Saudyjskiej, GLM-5.3 na czele indeksu agentowego i nowy klient

31 sierpnia — Together AI ogłosiło podpisanie umowy infrastrukturalnej dotyczącej centrum danych o mocy 250 MW w Arabii Saudyjskiej, budowanego wspólnie z HUMAIN. Laboratorium oczekuje, że działalność tego centrum będzie generować 5 miliardów dolarów przychodu rocznie, i przedstawia przedsięwzięcie jako jedną z największych umów na infrastrukturę AI zawartych z myślą o open source. Wiadomość została przypięta na koncie laboratorium, co odróżnia ją od jego zwykłej komunikacji dotyczącej modeli.

Liczbę tę należy interpretować ostrożnie, ponieważ ogłoszenie zestawia trzy pozbawione czasownika fragmenty, pozostawiając niejasność co do tego, czego dotyczy 5 miliardów. Rozstrzyga to relacja New York Timesa: kwota opisuje oczekiwany przychód tego centrum danych, a nie całej firmy. Potwierdza to skala wartości, ponieważ ten sam artykuł podaje, że w lipcu 2026 r. wycena Together AI wynosiła 8,3 miliarda dolarów — spółka o takiej wycenie nie osiąga 5 miliardów dolarów rocznych przychodów.

Na uwagę zasługuje również sama konstrukcja przedsięwzięcia, ponieważ nie jest to zakup mocy obliczeniowej. Jak również podaje New York Times, HUMAIN dostarcza 120 000 półprzewodników oraz 250 MW mocy, a Together AI wykorzystuje te układy, przekazując w zamian część swoich przychodów. Laboratorium nie finansuje więc infrastruktury: korzysta z niej w zamian za część swoich obrotów. Dokładnie do tego odwołuje się wątek, przeciwstawiając partnerstwa odblokowujące dostęp do mocy obliczeniowej wyścigowi, w którym każdy samodzielnie pozyskiwałby własne miliardy. HUMAIN, utworzony w ubiegłym roku z inicjatywy następcy tronu Mohammeda bin Salmana, jest częścią saudyjskich działań zmierzających do zbudowania branży AI i ograniczenia zależności kraju od ropy naftowej.

Argument przedstawiony w wątku dotyczy nie tyle skali, ile charakteru ograniczenia. Together AI opisuje energię jako prawdziwe obecne wąskie gardło, a umowę jako sposób na uzyskanie dostępu do skali, której firma tej wielkości nie mogłaby sfinansować z własnego bilansu. Laboratorium wyraźnie przeciwstawia ten model podejściu zamkniętych laboratoriów, których infrastruktura przez długi czas była finansowana przez hyperscalerów.

Taka interpretacja rzuca światło na szczególne miejsce Together AI w ekosystemie: laboratorium nie publikuje modeli frontier, lecz udostępnia modele innych podmiotów — DeepSeek, GLM, Kimi, MiniMax i Nemotron. Jego ograniczeniem nie są więc badania, lecz dostępna moc obliczeniowa potrzebna do obsługi modeli z otwartymi wagami poniżej cen własnościowych API. Umowa na 250 MW bezpośrednio odpowiada na tę potrzebę.

Element umowyPodana wartość
Moc centrum danych250 MW
Półprzewodniki dostarczone przez HUMAIN120 000
Oczekiwany roczny przychód centrum danych5 miliardów dolarów
Świadczenie przekazywane HUMAINczęść przychodów Together AI
Wycena Together AI w lipcu 2026 r.8,3 miliarda dolarów
Partner przemysłowyHUMAIN
LokalizacjaArabia Saudyjska
Data i godzina ogłoszenia31 sierpnia 2026, 13:26 UTC

Ostatnia kwestia, której Together AI nie komentuje w swoim wątku: ten sam artykuł zauważa, że lokalizacja w Arabii Saudyjskiej pozwala uniknąć oporu napotykanego w Stanach Zjednoczonych przy budowie centrów danych.

We just signed one of the largest AI infrastructure deals for open source, period. 250MW data center. $5B+ in annualized revenue. Built with @HUMAIN in Saudi Arabia.

🇵🇱 Właśnie podpisaliśmy jedną z największych umów na infrastrukturę AI dla open source, bez dwóch zdań. Centrum danych o mocy 250 MW. Ponad 5 miliardów dolarów rocznego przychodu. Zbudowane z @HUMAIN w Arabii Saudyjskiej.@togethercompute na X

GLM-5.3 dołącza do liderów indeksu agentowego Artificial Analysis

31 sierpnia — Szósty dzień z rzędu, w którym GLM-5.3 trafia do wiadomości: po udostępnieniu wag przez Z.ai 28 sierpnia oraz uruchomieniu modelu w serverless API Together AI 29 sierpnia tym razem wyróżnia go niezależny ranking. W indeksie agentowym Artificial Analysis model osiąga 59 punktów. Together AI precyzyjnie opisuje wynik: GLM-5.3 zajmuje ex aequo pierwsze miejsce (ties for the top spot) i wyprzedza (beating) GPT-5.6 Sol oraz Claude Fable 5. Przewaga dotyczy więc tych dwóch modeli; z Claude Opus 5, który również uzyskał 59 punktów, GLM-5.3 dzieli pierwsze miejsce.

Najbardziej pouczająca jest tu metoda. Z.ai nie wytrenowało nowego modelu bazowego: zachowano bazę GLM-5.2, a cała poprawa wynika z post-treningu, skalowanego jednocześnie w trzech wymiarach — większej liczby środowisk o długim horyzoncie, większej różnorodności zadań oraz większej ilości compute przeznaczonego na RL.

Oceniany modelWynik w indeksie agentowym
GLM-5.3 (max)59
Claude Opus 5 (max)59
GLM-5.3 Flash58
GPT-5.6 Sol (max)58
Claude Fable 5 (z trybem awaryjnym)57

🔗 Wiadomość od @togethercompute

Greptile wybiera Together AI na głównego dostawcę inferencji

31 sierpnia — Ostatni, skromniejszy sygnał dnia: Greptile, narzędzie do przeglądu kodu za pomocą AI używane przez ponad 11 000 zespołów, wybrało Together AI na swojego głównego dostawcę inferencji. Narzędzie analizuje pull requests z pełnym kontekstem repozytorium, a jego profil obciążenia obejmuje długie konteksty i duże wolumeny tokenów — dokładnie takie zastosowanie, w którym różnica kosztów między modelami z otwartymi wagami a własnościowymi API staje się decydująca.

🔗 Wiadomość od @togethercompute


GitHub Copilot w VS Code: cztery sierpniowe wersje podsumowane w jednym changelogu

31 sierpnia — GitHub publikuje podsumowanie zmian w Copilot w Visual Studio Code z sierpnia 2026 roku, obejmujące cztery wersje edytora, od v1.132 do v1.135. Motywem przewodnim tego cyklu jest organizacja pracy z wieloma agentami: okno Agents przestaje być zwykłą listą rozmów i staje się przestrzenią, w której współistnieje wiele sesji zachowywanych w niezmienionym stanie.

Jeśli chodzi o sesje, czaty można rozmieszczać obok siebie w grupach poziomych lub pionowych, a układ jest przywracany po powrocie. Polecenie /btw otwiera poboczną rozmowę, która współdzieli kontekst i pamięć podręczną promptów rozmowy głównej, podczas gdy ta nadal działa: pozwala to zadać dodatkowe pytanie bez przerywania pracy uruchomionego agenta. Kontrolka osi czasu promptów, dostępna z marginesu transkrypcji, umożliwia bezpośrednie przejście do promptu i przejrzenie wynikających z niego zmian w plikach. Agent Host pozwala wielu oknom VS Code łączyć się z tą samą sesją, a eksperymentalne polecenie /rubber-duck uruchamia uzupełniający model, aby wychwycić pominięte szczegóły i przypadki brzegowe.

Dwie kwestie dotyczą bezpośrednio miejsca Claude w edytorze: eksperymentalne ustawienie otwiera okno Agents bez logowania do GitHub, gdy Claude skonfigurowano przy użyciu klucza API, a sesje Claude pozwalają w dowolnym momencie przełączać się między modelami z subskrypcji Anthropic i modelami z subskrypcji Copilot. VS Code obsługuje ponadto instalowanie przenośnych pluginów agentów zgodnych ze standardem Agent Plugins 1.0, których można używać w innych kompatybilnych klientach agentów.

Obszar changeloguNajważniejsze nowości
Sesje i workflowCzaty obok siebie, /btw, oś czasu promptów, Agent Plugins 1.0, /rubber-duck, Agent Host
Claude w VS CodeOkno Agents bez logowania do GitHub za pomocą klucza API, przełączanie między modelami Anthropic i Copilot
Czat i przeglądWyszukiwanie w transkrypcji, przypięte przewijanie, hybrydowy edytor Markdown, tokeny według modelu
Wbudowana przeglądarkaGrupowe opisywanie elementów HTML, automatyczne przeładowywanie, domyślny edytor HTML
DyktowanieWielojęzyczne przetwarzanie na urządzeniu, instrukcje czyszczenia, czyszczenie dostosowane do shell

Czat zyskuje wreszcie narzędzia do czytania potrzebne w coraz dłuższych rozmowach: wyszukiwanie tekstu w całej transkrypcji z uwzględnianiem wielkości liter, całych słów i wyrażeń regularnych, przypięte przewijanie utrzymujące bieżący prompt w widoku oraz wyświetlanie po najechaniu na stopkę odpowiedzi zużycia tokenów według modelu, z podziałem na wejście, wejście z pamięci podręcznej i wyjście — przydatna przejrzystość, odkąd rozliczenia zależą od pamięci podręcznej. Wbudowana przeglądarka pozwala zaznaczyć i opisać wiele elementów HTML na stronie, aby zbiorczo przetworzyć uwagi dotyczące interfejsu, a dyktowanie działa na urządzeniu w wielu językach i zachowuje składnię poleceń podczas dyktowania w terminalu, zamiast wstawiać wypowiedziane znaki interpunkcyjne.

🔗 GitHub Changelog — Copilot w VS Code, wersje z sierpnia 2026


NVIDIA wprowadza swoje komponenty programowe do biologii i pojazdów autonomicznych

31 sierpnia — NVIDIA opublikowała tutorial dokumentujący integrację przeprowadzoną wspólnie z Anthropic: BioNeMo Agent Toolkit jest teraz dostępny w Claude Science, środowisku badań naukowych Anthropic. Rozwiązywany problem dotyczy specjalistycznych narzędzi — agent ogólnego przeznaczenia może rozpoznać, że zadanie wymaga zwinięcia białka, ale niekoniecznie wie, który model uruchomić, jak sformatować zapytanie ani które parametry są istotne. Toolkit pakuje ponad dekadę modeli, bibliotek i workflow BioNeMo — z zakresu biologii, chemii, genomiki i odkrywania leków — w skills wywoływane przez agenta. Według wewnętrznych benchmarków NVIDIA dokładność wykonywania zadań wzrasta z 60 do 100%, a efektywność wykorzystania tokenów jest mniej więcej dwukrotnie wyższa.

Tutorial łączy trzy mikroserwisy NIM: najpierw MSA Search do zbudowania kontekstu ewolucyjnego, a następnie OpenFold3 i Boltz-2 do niezależnego przewidywania struktury. Najbardziej wymowna demonstracja dotyczy roli wielokrotnego dopasowania sekwencji — bez niego pewność interfejsu gwałtownie spada w obu modelach, a zwiększenie budżetu próbkowania niczego nie zmienia. Warto wskazać dwa zastrzeżenia: barierę sprzętową, obejmującą GPU L40S lub H100 i około 700 GB przestrzeni dyskowej, oraz ostrożność interpretacyjną podkreślaną przez NVIDIA, która przypomina, że wynik pewności nie dowodzi interakcji, i przedstawia zgodność dwóch niezależnych modeli jako solidną hipotezę, a nie dowód.

Miara pewności interfejsu (iPTM)OpenFold3Boltz-2
Heteromer z dopasowaniem MSA0,850,82
Heteromer bez dopasowania MSA0,140,19
RMSD Cα rdzenia, monomer względem heteromeru0,68 Å0,65 Å

🔗 Tutorial NVIDIA — BioNeMo NIM w Claude Science

Omniverse NuRec dostosowuje stos percepcji do pojazdu, który jeszcze nie istnieje

31 sierpnia — Tego samego dnia NVIDIA publikuje drugi tutorial techniczny, tym razem poświęcony autonomicznej jeździe. Punktem wyjścia jest stwierdzenie, że stos percepcji kształtuje pojazd, który go wykorzystuje: przeniesiony z SUV-a do sedana nie postrzega już świata w ten sam sposób, ponieważ zmieniają się położenie czujników, kalibracja, pola widzenia, przesłonięcia i geometria nadwozia. Zbieranie i opisywanie rzeczywistego zbioru danych dla każdej linii pojazdów jest kosztowne, a na początku prac rozwojowych często niemożliwe.

Omniverse NuRec pozwala ponownie wykorzystać wcześniej zarejestrowane przejazdy: rekonstruuje każdą scenę, a następnie odtwarza ją z perspektywy konfiguracji czujników pojazdu docelowego. Zespoły mogą dzięki temu sprawdzić, jak wyglądałby dany scenariusz z perspektywy nowego układu kamer i gdzie zmiany geometrii tworzą martwe pola. NVIDIA zaznacza, że rzeczywiste dane z jazdy pozostają niezbędne do zakotwiczenia i walidacji wydajności: dane syntetyczne służą do dostosowania modeli, zanim powstanie dedykowany zbiór danych, a nie do jego zastąpienia. Sceny są udostępniane w Hugging Face w formacie USDZ wraz z repozytorium skills przeznaczonych dla agentów kodujących.

🔗 Tutorial NVIDIA — Omniverse NuRec


Amp przypisuje pokój rozmów audio i wideo do każdego wątku

31 sierpnia — Amp przypisuje pokój rozmów na żywo do każdego wątku. Funkcja o nazwie Space to Talk otwiera przestrzeń audio i wideo powiązaną z samym wątkiem: wystarczy nacisnąć klawisz Enter, aby do niej wejść, włączyć kamerę i udostępnić ekran, podczas gdy agent kontynuuje pracę w tym samym wątku.

Podkreślaną zaletą jest wyeliminowanie etapów pośrednich, a rozwiązanie to rozwija kierunek współpracy obrany przez Amp latem: najpierw współdzielenie kontroli nad orbem między członkami zespołu (Multiplayer, 22 lipca), a następnie zapraszanie przez wzmiankę bezpośrednio w wątku (Pass the Orb to the Left Hand Side, 19 sierpnia). Wątek staje się jednym miejscem spotkań zespołu i agenta. Amp przyznaje również, że zakres funkcji pozostaje otwarty: burze mózgów, tablica lub rozmowa z Puckiem i innymi agentami są wymieniane jako przyszłe kierunki, a nie jako już udostępnione funkcje.

No links to paste, no calendar invite, no other app. The call lives where the work lives.

🇵🇱 Żadnych linków do wklejania, żadnych zaproszeń w kalendarzu, żadnej innej aplikacji. Rozmowa odbywa się tam, gdzie wykonywana jest praca.Amp, nota Space to Talk


VLANeXt, ujednolicona baza kodu dla modeli vision-language-action

31 sierpnia — Zespół publikuje na blogu Hugging Face VLANeXt, badawczą bazę kodu poświęconą modelom vision-language-action (vision-language-action, VLA). Zasada działania tych modeli jest prosta: model vision-language łączy to, co widzi robot, z instrukcją w języku naturalnym, a następnie wyprowadza z tego działanie w świecie fizycznym.

Problem ma charakter metodologiczny. Dziedzina rozwija się szybko, ale ulega fragmentacji: między poszczególnymi publikacjami zmieniają się backbone, głowica polityki, reprezentacja działań, strategia trenowania i protokół ewaluacji. Wyniki są często przedstawiane jako solidne, ale ustalenie, co rzeczywiście odpowiada za wysoką wydajność modelu VLA, pozostaje trudne z powodu braku możliwości wyizolowania zmiennych.

Zamiast dodawać kolejną architekturę autorzy wrócili do bazowego punktu odniesienia typu RT-2 / OpenVLA i metodycznie zbadali przestrzeń projektową, aby wyłonić z niej recepturę; praca ta zaowocowała publikacją ICML „VLANeXt: Recipes for Building Strong VLA Models”. Od tego czasu bazę kodu rozszerzono poza zakres tego badania o backbone’y różnej wielkości, uczenie ukrytych działań, modelowanie predykcyjne w przestrzeni ukrytej i modelowanie świat–działanie. Udostępnia ona sześć punktów wyjścia: VLANeXt-LAM, -S, -L, -XL, -JEPA i -WAM.

🔗 Wpis na Hugging Face


W skrócie

  • Claude Code 2.1.252, wersja zawierająca wyłącznie poprawki — Cztery poprawki i żadnych nowych funkcji: polecenia Bash kończące się błędem na niektórych komputerach Mac, opcja „always allow” niezapisywana w projekcie bez pliku .claude/settings.local.json, sesje Remote Control zawieszające się na kilka minut po zakończeniu działania narzędzia przy pogorszonym połączeniu z claude.ai oraz powiadomienia o zadaniach w tle generujących dużo danych wyjściowych, które powodowały przekroczenie limitu rozmiaru żądań API. 🔗 CHANGELOG Claude Code
  • Flow udostępnia na komputerach kontrolę pierwszej i ostatniej klatki — Google Flow informuje, że kontrola pierwszej i ostatniej klatki Gemini Omni 1.1 Flash, zaprezentowana wraz z modelem 27 sierpnia, jest już dostępna na komputerach. Wyróżniony sposób użycia: podanie tego samego obrazu na obu końcach w celu utworzenia pętli. 🔗 Wiadomość od @FlowbyGoogle
  • Ostatni dzień na udział w konkursie Grok Imagine — xAI przypomniało, że termin zgłoszeń do konkursu wideo rozpoczętego 17 sierpnia upływa tego samego dnia. Uczestnicy mieli stworzyć scenę z Odysei Homera prezentującą możliwości wideo i głosowe modelu; trzy najlepsze realizacje dzielą między siebie 175 000 dolarów, otrzymując odpowiednio 100 000, 50 000 i 25 000 dolarów. 🔗 Wiadomość od @grok
  • QwenCloud zamyka Arena i zapowiada sesję w Bangkoku — Qwen Cloud Arena, wyzwanie poświęcone agentom generującym treści dla transgranicznego e-commerce, zakończyło przyjmowanie zgłoszeń o północy czasu pekińskiego po udziale ponad 800 uczestników, a etap oceny rozpoczął się następnego dnia. Kilka godzin wcześniej QwenCloud zapowiedział sesję podczas Qwen Conference w Bangkoku 4 września, poświęconą temu samemu podejściu opartemu na trzech punktach dostępu — stronie internetowej, Skills i CLI — które przedstawiono już w Hongkongu. 🔗 Zamknięcie Arena · 🔗 Sesja w Bangkoku
  • GitHub rozpoczyna ankietę dotyczącą dostosowań dostępności stosowanych przez programistów — Firma chce udokumentować narzędzia, ustawienia produktów i osobiste dostosowania umożliwiające pracę w dobrych warunkach, bez wymogu deklarowania niepełnosprawności ani uznawania się za użytkownika narzędzi dostępności. Odpowiedzi można przesyłać do 30 września. Temat niezwiązany ze sztuczną inteligencją. 🔗 Wiadomość od @github
  • otoSpeech Task, korpus full-duplex opublikowany wraz z zadaniem — Dwadzieścia godzin anglojęzycznych rozmów dwóch osób, 58 sesji obejmujących siedem zadań wymagających współpracy i 11 025 zdarzeń ze znacznikami czasu, na licencji CC BY 4.0. Jego cechą szczególną jest to, że obrazy widziane przez każdego rozmówcę, ich działania i odpowiedzi referencyjne znajdują się na tej samej osi czasu co dźwięk. 🔗 Wpis na Hugging Face
  • YOLO26-RGB, model usuwania deszczu wywodzący się z głowicy głębi — Dwa modele usuwania deszczu uzyskane przez zastąpienie jednokanałowej głowicy głębi w YOLO26-depth trzykanałową głowicą rekonstrukcji RGB: 5,25 mln parametrów przy około 109 obrazach/s w 1080p oraz 12,13 mln przy około 92 obrazach/s i jakości wyższej o 0,1 dB. 🔗 Wpis na Hugging Face

Co to oznacza

Generowanie interfejsu zamiast kodu, który go tworzy. Solaris przesuwa granicę między projektowaniem a wykonaniem. Cały obecny łańcuch oprogramowania opiera się na tłumaczeniu — makieta staje się kodem, a kod generuje obraz — zaś Runway mierzy koszt tego tłumaczenia: podczas odtwarzania 30 interfejsów ze zrzutu ekranu wszystkie testowane modele multimodalne tracą informacje, a degradacja pogłębia się wraz ze wzrostem bogactwa wizualnego. Usunięcie etapu pośredniego jest radykalną propozycją, a ograniczenia wymieniane przez samo laboratorium pokazują, gdzie napotyka ona przeszkody: tekst, który nie pozostaje na swoim miejscu, brak gwarantowanego oparcia w faktach oraz dostępność, którą trzeba zbudować od podstaw, ponieważ wygenerowany obraz nie udostępnia czytnikom ekranu żadnej struktury. Są to fundamentalne przeszkody, a nie niedopracowane szczegóły.

Dwa sposoby płacenia za moc obliczeniową, ogłoszone tego samego dnia. OpenAI wykazuje w swojej działalności reklamowej roczne tempo przychodów na poziomie miliarda dolarów — jest to prognoza na dwanaście miesięcy, a nie faktyczny wpływ środków — i przedstawia je jako filar ekonomiczny równorzędny z subskrypcjami: reklamy finansują bezpłatny poziom usługi, która deklaruje ponad miliard użytkowników tygodniowo. Together AI z kolei nie monetyzuje odbiorców ani nie kupuje dodatkowych zasobów: uzyskuje w Arabii Saudyjskiej 250 MW i 120 000 chipów w zamian za udział w swoich przychodach, wskazując energię jako rzeczywiste wąskie gardło sektora. Obie firmy odpowiadają na to samo ograniczenie z dwóch przeciwnych końców łańcucha i żadna z tych odpowiedzi nie jest neutralna: jedna wprowadza do produktu interes komercyjny, druga przenosi infrastrukturę tam, gdzie napotyka ona mniejszy opór polityczny.

Rywalizacja agentowa rozgrywa się obecnie po pre-treningu. Wynik GLM-5.3 w indeksie agentowym Artificial Analysis jest istotny przede wszystkim ze względu na sposób, w jaki go osiągnięto: Z.ai zachowało bazę GLM-5.2 i zwiększyło skalę wyłącznie post-treningu — środowisk o długim horyzoncie, różnorodności zadań oraz mocy obliczeniowej przeznaczonej na RL. Jeśli dołączenie do czołówki rankingu agentowego nie wymaga już ponownego trenowania modelu bazowego, to najcięższa pozycja kosztowa przestaje być jedynym czynnikiem decydującym o miejscu w rankingu, a cykl aktualizacji modelu odpowiednio się skraca. Jest to również najbardziej ekonomiczne wyjaśnienie sześciodniowej sekwencji dotyczącej tego modelu — od otwarcia wag 28. dnia miesiąca do osiągnięcia tej pozycji w rankingu 31. dnia.

Narzędzia deweloperskie reorganizują się wokół wielu agentów działających jednocześnie. Changelog Copilot poświęca cały cykl na przekształcenie okna Agents w przestrzeń roboczą — czaty obok siebie, rozmowę boczną współdzielącą cache promptów, chronologię promptów oraz wiele okien podłączonych do tej samej sesji — a nie jedynie listę rozmów. Amp dołącza do wątku pokój rozmów, aby ludzka dyskusja odbywała się tam, gdzie pracuje agent. NVIDIA natomiast pakuje dziesięć lat bibliotek naukowych w wywoływalne skills i udostępnia drugie repozytorium skills przeznaczonych do rekonstrukcji scen drogowych. Trzej bardzo różni gracze zmierzają ku tej samej idei: agentowi nie brakuje już możliwości modelu, lecz współdzielonego kontekstu i specjalistycznych narzędzi, które można mu udostępnić.


Źródła