ai-powered-markdown-translatorArtykuł przetłumaczony z francuskiego na polski za pomocą gpt-5.6-sol.
NVIDIA Research publikuje Sol-H3, stos inferencyjny, który skraca generowanie pięciu sekund wideo poniżej czasu odtwarzania klipu, na licencji Apache 2.0. Tego samego dnia jeden z wydawców publikuje na Hugging Face dwie serie modeli dostosowanych do procesorów, z obietnicami niepopartymi żadnymi pomiarami, podczas gdy indyjski zespół udostępnia korpus mowy z hałasem, w którym każdy znacznik czasu przechodzi udokumentowany proces weryfikacji. Google Research rozszerza ponadto na Azję testy tras lotniczych omijających smugi kondensacyjne.
Sol-H3 generuje pięć sekund wideo w 1,653 sekundy, szybciej niż trwa jego odtwarzanie
7 września — Zespół Efficient AI z NVIDIA Research wraz ze swoim laboratorium w Singapurze publikuje Sol-H3, kompletny stos inferencyjny dla modelu wideo MiniMax-H3. Wynik można ująć w jednym zdaniu: pięć sekund wideo w rozdzielczości 1344×768 przy 24 klatkach na sekundę, ze stereofonicznym dźwiękiem generowanym w tym samym przebiegu, powstaje w 1,653 sekundy na systemie z ośmioma akceleratorami B300 Blackwell. Model tworzy więc klip szybciej, niż widz jest w stanie go obejrzeć.
Porównanie dotyczy pełnych profili, a nie tylko zmiany jądra mechanizmu attention. Profil referencyjny Base H3 Dense wykorzystuje 50 kroków schedulera, czyli 49 przebiegów w przód sieci DiT; Sol-H3 wykorzystuje ich zaledwie cztery.
| Konfiguracja sprzętowa | Wygenerowany czas | Base H3, 50 kroków | Sol-H3, 4 kroki | Przyspieszenie |
|---|---|---|---|---|
| 8× B300 | 5 s | 18,250 s | 1,653 s | 11,04× |
| 8× B300 | 10 s | 50,660 s | 3,732 s | 13,57× |
| 8× B300 | 15 s | 99,513 s | 6,612 s | 15,05× |
| 4× B300 | 5 s | 35,328 s | 2,918 s | 12,11× |
| 4× B300 | 15 s | 194,930 s | 12,542 s | 15,54× |
| 1× B300 | 5 s | 129,898 s | 13,745 s | 9,45× |
Przyspieszenie osiąga maksimum 15,54× na czterech B300 dla piętnastu sekund wideo. Protokół opisano wyjątkowo precyzyjnie: są to mediany z trzech uruchomień po rozgrzewce, przy identycznym prompcie i ziarnie; pomiar obejmuje kodowanie tekstu, odszumianie DiT i dekodowanie VAE, lecz wyklucza ładowanie modelu oraz końcowe kodowanie MP4.
Stos łączy dwa komponenty opracowane oddzielnie: Sol-Engine jako runtime do inferencji wideo oraz Sol-Attn do stosowanego w locie mechanizmu sparse attention, bez ponownego trenowania. Dochodzą do tego sfuzowane jądra, komunikacja między GPU w INT8 dla projekcji QKV i w FP8 dla danych wyjściowych, równoległe i wsadowe dekodowanie VAE oraz buforowanie parametrów AdaLN. Przygotowanie mechanizmu sparse attention skraca się z 1,206 do 0,285 milisekundy, dekodowanie VAE z 7,55 do 0,602 sekundy, a na każdym GPU zwalnia się około 24 GB pamięci.
Dwie decyzje sprawiają, że publikacja nadaje się do wykorzystania poza demonstracją: kod zostaje udostępniony na licencji Apache 2.0, a każdy wytrenowany już dla MiniMax-H3 niskokrokowy LoRA (few-step) można podłączyć do tego samego runtime. Otwarty dostęp do API za pośrednictwem Reactor od pierwszego dnia pozwala przeprowadzić testy bez zajmowania ośmiu B300.
For us, the bigger milestone is crossing from “fast generation” into “faster than playback.” That opens the path toward continuous 24 FPS generation and truly interactive video systems.
🇵🇱 Dla nas prawdziwym kamieniem milowym jest przejście od „szybkiego generowania” do generowania „szybszego niż odtwarzanie”. Otwiera to drogę do ciągłego generowania przy 24 FPS i prawdziwie interaktywnych systemów wideo. — @xieenze_jr na X
🔗 Strona projektu Sol-H3, NVIDIA Research
🔗 Dostęp do API od pierwszego dnia za pośrednictwem Reactor
Otwarty korpus oznacza czasowo 106 892 rzeczywiste hałasy w 58 językach indyjskich
7 września — Zespół ARTPARK z Indian Institute of Science publikuje Vaani Noise Event Timestamp Dataset, warstwę ręcznych adnotacji nałożoną na korpus spontanicznej mowy Project Vaani. Każdy hałas w tle ma oznaczony typ oraz czas rozpoczęcia i zakończenia z dokładnością do milisekundy.
| Właściwość korpusu | Wartość |
|---|---|
| Łączny czas nagrań z adnotacjami | ponad 122 godziny |
| Zdarzenia hałasowe ze znacznikami czasu | 106 892, w 7 kategoriach |
| Segmenty mowy i mówcy | 72 756 segmentów, 38 541 głosów |
| Zakres językowy i geograficzny | 58 języków, 30 stanów |
| Zbiór zweryfikowany i zbiór surowy | około 22 h i około 100 h |
Istotna jest tutaj metodologia: mowę i hałas rejestrowano razem, za pomocą zwykłych telefonów, bez dodawania syntetycznego hałasu ani późniejszego miksowania. Niewerbalne dźwięki wydawane przez ludzi, kaszel i śmiech, występują w około 38 procentach segmentów, lecz trwają krócej niż pół sekundy; zwierzęta i ruch uliczny pojawiają się rzadziej i trwają znacznie dłużej, a łącznie odpowiadają za największą część czasu hałasu. Każdy znacznik czasu przechodzi proces adnotacji, kontrolę spójności, ponowną kontrolę wewnętrzną, a następnie niezależny audyt losowo wybranej jednej dziesiątej korpusu: jeśli choć jeden element nie przejdzie kontroli, cała partia jest wykonywana od nowa.
🔗 Wpis ARTPARK-IISc na Hugging Face
CMS Manhattan publikuje dwie serie modeli dla procesorów bez potwierdzających je benchmarków
6 września — Wydawca CMS Manhattan udostępnia na Hugging Face dwie publikacje otwartych wag przeznaczonych do inferencji na procesorach zamiast na kartach graficznych. Oba wpisy zostały opublikowane przez samego wydawcę modeli i wszystkie poniższe informacje należy tak właśnie traktować.
Pierwsza z nich, seria JiRack Ultra, obejmuje cztery modele z ternarnymi wagami 1,58-bitowymi w stylu BitNet, wywodzące się według wydawcy z architektury DeepSeek-R1-Distill-Qwen-32B. Najciekawszym elementem nie jest kwantyzacja, lecz tokenizer rozszerzony o tokeny przeznaczone do routingu, wywoływania narzędzi, znaczników sterowania robotami i multimediów, co ukierunkowuje modele na systemy agentowe i robotykę wbudowaną. Druga publikacja, JiRackDeltaNet_27b, wykorzystuje model Qwen 3.8 o 27 miliardach parametrów przeniesiony na architekturę DeltaNet, która naprzemiennie stosuje pełny mechanizm attention i warstwy Gated DeltaNet spokrewnione z modelami przestrzeni stanów, a deklarowany kontekst wynosi 262 144 tokenów.
| Seria modeli | Baza deklarowana przez wydawcę | Format opublikowanych wag | Licencja i pakiet |
|---|---|---|---|
| JiRack Ultra, cztery rozmiary | DeepSeek-R1-Distill-Qwen-32B | ternarne wagi 1,58-bitowe, GGUF od Q2_K do Q4_K_M | wagi na Hubie, obrazy Docker i interfejs dostępny w ramach subskrypcji |
| JiRack DeltaNet 27B | Qwen 3.8 27B przeniesiony na DeltaNet | standardowe pliki GGUF llama.cpp utworzone z FP16 | wagi na licencji MIT, obraz Docker i interfejs za 12 dolarów rocznie na użytkownika |
Czytelnik powinien uwzględnić dwa zastrzeżenia. Pomimo etykiet ternary i bitnet w repozytorium DeltaNet opublikowana seria GGUF odpowiada standardowym kwantyzacjom llama.cpp, a nie odrębnemu ternarnemu punktowi kontrolnemu, co przyznano w samym wpisie. Ponadto obietnica jakości zbliżonej do Opus 4.6 Max, użyta w tytule drugiego wpisu, nie jest poparta żadnym wynikiem benchmarku: brakuje właśnie opublikowanego pomiaru porównawczego, który pozwoliłby ocenić te modele na podstawie czegoś więcej niż ich dokumentacja.
🔗 Seria JiRack Ultra na Hugging Face
🔗 JiRack DeltaNet 27B na Hugging Face
Dlaczego środowiska RL działają dziś, a nie działały w 2016 roku
7 września — Sergio Paniego publikuje na blogu Hugging Face retrospektywę, której punktem wyjścia jest zastanawiająca obserwacja: opis OpenAI Universe opublikowany w grudniu 2016 roku mógłby dziś bez żadnych zmian znaleźć się we wpisie czołowego laboratorium. Repozytorium jest jednak zarchiwizowane.
Chronologia prowadzi od Arcade Learning Environment z 2012 roku do OpenAI Gym z 2016 roku i jego minimalistycznego słownika, reset() oraz step(), przeniesionego od tamtej pory do Gymnasium pod egidą Farama Foundation. Następnie pojawia się fala rozwiązań dziedzinowych, od World of Bits przez WebArena po SWE-bench i Terminal-Bench: zadanie często zaczyna jako benchmark, zanim stanie się środowiskiem treningowym.
Sednem analizy jest pięć elementów, których brakowało w 2016 roku: nie było modelu wstępnie wytrenowanego, który mógłby posłużyć za punkt wyjścia, zadanie wykraczało poza możliwości ówczesnych systemów, interfejs zaprojektowano dla człowieka zamiast dla maszyny, nie istniała żadna metoda radzenia sobie z rzadkimi nagrodami, a koordynowanie tysięcy jednorazowych sandboxów było niemożliwe. GRPO i weryfikowalne nagrody zapewniają dziś czwarty element. Artykuł kończy się omówieniem OpenEnv, standardowego interfejsu zapowiedzianego w październiku 2025 roku przez zespół PyTorch w Meta oraz Hugging Face, a także rynku środowisk, na którym działają Prime Intellect i Mechanize.
Google kieruje ponad 80 lotów Cathay Pacific trasą omijającą smugi kondensacyjne
7 września — Google Research rozszerza na region Azji i Pacyfiku testy unikania smug kondensacyjnych, a Cathay Pacific zostaje pierwszym komercyjnym partnerem lotniczym projektu w tym regionie. Rozwiązanie na papierze jest proste: nieznacznie dostosować wysokość lotu, aby ominąć zimne i wilgotne obszary, w których smugi utrzymują się jako warstwy zatrzymujące ciepło.
| Wskaźnik z pierwszej fazy | Wartość |
|---|---|
| Loty objęte projektem w siatce Cathay Pacific | ponad 100 |
| Loty, które faktycznie odbyły się trasą omijającą smugi | ponad 80 |
| Szacowane ograniczenie ocieplającego wpływu smug | około 40 % |
| Udział korytarza Hongkong–Singapur w uzyskanych korzyściach | ponad 50 % |
| Udział smug w klimatycznym oddziaływaniu lotnictwa | około jednej trzeciej |
System łączy prognozy tworzone przez modele Google, zdjęcia satelitarne i zaawansowane dane meteorologiczne. Prognozy trafiają do kokpitu za pośrednictwem pokładowego Wi-Fi oraz elektronicznej dokumentacji lotu przewoźnika (Electronic Flight Folder), bez zakłócania standardowych procedur, a korekty mieszczą się w ustalonych parametrach bezpieczeństwa. Rozpoczyna się rozszerzona druga faza, w której partnerem jest Contrails.org.
Contrail mitigation remains one of the most immediately available, scalable, and cost-effective ways to reduce aviation’s climate footprint, and it can get started now, with today’s aircrafts and fuel.
🇵🇱 Ograniczanie smug kondensacyjnych pozostaje jednym z najbardziej dostępnych od ręki, skalowalnych i ekonomicznych sposobów zmniejszania śladu klimatycznego lotnictwa i można je rozpocząć już teraz, z wykorzystaniem dzisiejszych samolotów i paliw. — Kemal Armada i Max Vogler, Google Research
Genspark dodaje Muse Spark 1.3 do trzech swoich produktów
7 września — Genspark integruje model Meta Muse Spark 1.3 z AI Chat, Code Agent i Claw, pięć dni po jego ogłoszeniu. Platforma przytacza dwie wartości podane przez Meta jako uzasadnienie tego wyboru: o 20 procent mniej wywołań narzędzi i o 25 procent mniejsze zużycie tokenów — dwie metryki bezpośrednio wpływające na koszt agenta działającego w pętli przy długotrwałych zadaniach.
Prawdziwym sygnałem jest tempo. W ciągu sześciu dni Genspark zintegrował cztery modele różnych dostawców: Claude Fable 5.1 2 września, Gemini 3.8 Flash 3 września, GPT-6 Astra 5 września i Muse Spark 1.3 7 września. Platforma pozycjonuje się nie tyle jako model, ile jako warstwa orkiestracji, która wchłania rozwiązania wszystkich laboratoriów w ciągu kilku dni od ich publikacji.
Krótkie informacje
- Replit otwiera swoje pierwsze międzynarodowe biuro w Londynie — firma ustanawia je centrum swoich europejskich operacji we współpracy z burmistrzem Londynu Sadiqiem Khanem, rządem Wielkiej Brytanii oraz London & Partners, a także zapowiada pilotażowy program podnoszenia kwalifikacji realizowany z TLMA dla młodych londyńczyków, którzy nie pracują ani się nie kształcą. 🔗 Publikacja
- Tolquane, biblioteka Python do komponowalnej równoległości — ten sam graf wykonuje się bez zmiany kodu w wątkach, procesach, trybie async, środowisku rozproszonym lub sekwencyjnie, osiągając 5,6-krotność wydajności bazowej w Python 3.14t bez globalnej blokady, wobec 0,9-krotności w wątkach z GIL. Nieblokowanie przyjęto w niej jako zasadę projektową, a błąd wskazuje nazwy zablokowanych węzłów. 🔗 Wpis
- Dedykowana akcja do instalowania umiejętności agenta — firmware Aiden kieruje teraz URL umiejętności do pojedynczej akcji, która przygotowuje ją, weryfikuje, a następnie publikuje atomowo. Odtworzenie operacji na rzeczywistym agencie skraca ślad obejmujący wiele narzędzi do jednego wywołania. 🔗 Wpis
- Together AI zestawia GLM-5.3 Flash z GPT-5.6 Terra pod względem kosztu zadania — identyczny wynik w indeksie inteligencji Artificial Analysis, lecz według dostawcy hostingu koszt zadania jest niższy o 82 procent; firma nie publikuje ani metody obliczeń, ani szczegółowego wpisu, a sama udostępnia porównywany model. 🔗 Publikacja
- Manifest na rzecz brazylijskiego ekosystemu AI — portugalskojęzyczny tekst rozwijający metaforę naturalnego ekosystemu w odniesieniu do krajowej społeczności AI, bez modelu, zbioru danych i pomiarów. Odnotowany dla kompletności. 🔗 Wpis
- Google DeepMind wybiera 16 organizacji do swojego akceleratora AI for the Planet w regionie Azji i Pacyfiku — pierwsza edycja rozpoczyna się intensywnym szkoleniem (bootcamp) w Singapurze, po którym następują trzy miesiące dostępu do modeli AnthroKrishi, ForestCast, AlphaEarth Foundations, SpeciesNet i Perch; projekty podzielono na ochronę przyrody, zrównoważone rolnictwo i rozwiązania węglowe. 🔗 Wpis
- GitHub ponownie promuje canvases w swojej aplikacji Copilot — wznowienie promocji artykułu z 17 sierpnia, przedstawiającego canvas jako wspólną, trwałą przestrzeń, w której stan prac pozostaje widoczny, wraz z rzadko publikowaną liczbą: od 2 000 do 3 000 AI Credits na zbudowanie każdego z dwóch przytoczonych przykładów. 🔗 Publikacja
- GitHub udostępnia generator pseudonimów dla GitHub Universe — promocyjna inicjatywa społecznościowa przed edycją z października 2026 roku, niezwiązana z AI ani z żadną funkcją produktu. 🔗 Publikacja
- Synthesia przedstawia trzy kierunki swoich badań na ECCV 2026 — generatywne awatary sterowane dźwiękiem, badania nad głosem stosowane w rozpoznawaniu mowy oraz interaktywne awatary, pod szyldem modelu świata skoncentrowanego na człowieku. 🔗 Publikacja
- Mati Staniszewski przewiduje konwersacyjny test Turinga w ciągu sześciu–dwunastu miesięcy — współzałożyciel i dyrektor generalny ElevenLabs mówi o tym w podcaście GDIY, którego wywiad udostępniono z francuskim dubbingiem za pośrednictwem usługi audio firmy. 🔗 Publikacja
- QwenCloud publikuje podsumowanie Qwen Conference Thailand 2026 — niemal 400 klientów i deweloperów spotkało się 4 września w Bangkoku; zaprezentowano także kompleksową demonstrację, w której sam agent jest klientem — od rejestracji po płatność i wystawienie faktury, bez udziału człowieka. 🔗 Publikacja
- Cohere udostępnia reportaż CNN o Toronto jako światowym centrum AI — komunikat bez zapowiedzi produktu, wskazujący na trzecie miejsce miasta na świecie pod względem talentów technologicznych według CBRE, ponad 2 miliardy dolarów przeznaczone w ramach kanadyjskiej strategii narodowej oraz deklarowany przez Cohere napływ zapytań od klientów po wprowadzeniu kontroli eksportu modeli Anthropic. 🔗 Publikacja
Co to oznacza
Przekroczenie progu przez Sol-H3 nie jest po prostu kolejnym rekordem na liście. Dopóki wyprodukowanie klipu trwa dłużej niż jego obejrzenie, generowanie wideo pozostaje pracą wsadową: uruchamiamy proces, czekamy, oglądamy. Zejście poniżej tego progu otwiera inną kategorię zastosowań, w której obraz powstaje podczas oglądania. Dla praktyka istotne jest to, że wzrost wydajności nie wynika z nowego modelu: model pozostaje ten sam, zmienia się jedynie stos inferencyjny. Piętnastokrotne przyspieszenie tkwiło zatem w inżynierii wykonania, a nie w wagach modelu; rozwiązanie opublikowano na licencji Apache 2.0, zachowując zgodność z istniejącymi LoRA.
Ten dzień ukazuje dwa sposoby publikowania otwartych wag. Z jednej strony mamy dwa samodzielnie opublikowane wpisy, których twierdzenia o jakości nie opierają się na żadnych porównywalnych pomiarach, z etykietami repozytoriów nieodpowiadającymi rzeczywiście udostępnionemu formatowi, oraz porównanie kosztu zadania ogłoszone przez dostawcę hostingu zwycięskiego modelu bez opublikowania metodologii. Z drugiej strony jest korpus mowy, w którym każdy znacznik czasu przechodzi przez ścieżkę audytu, a zespół wyraźnie oddziela 22 zweryfikowane godziny od 100 godzin, które nie zostały zweryfikowane. W publicznym repozytorium, gdzie publikować może każdy, rygor weryfikacji staje się jedynym użytecznym sygnałem, a jego wytworzenie kosztuje więcej niż chwytliwy tytuł.
Retrospektywa środowisk RL oraz tempo integracji Genspark opisują tę samą zmianę w dwóch skalach. Pierwsza wyjaśnia, dlaczego pomysł z 2016 roku działa dzisiaj: nie brakowało algorytmów, lecz otaczającej je infrastruktury — od modelu początkowego po jednorazowe sandboxy. Druga pokazuje, czym staje się ta infrastruktura, gdy jest już dostępna i platforma podłącza cztery modele od czterech dostawców w ciągu sześciu dni. W obu przypadkach wartość przenosi się z modelu do otaczającej go warstwy, a warstwa ta ulega standaryzacji — z OpenEnv po jednej stronie i orkiestratorami obsługującymi wiele modeli po drugiej.
Pozostają jeszcze działania niezwiązane z wyścigiem modeli. Próba przeprowadzona z Cathay Pacific dotyczy istniejących samolotów i paliw: jedynym dodatkiem jest prognoza dostarczana do kokpitu we właściwym momencie, co ma zapewnić szacowaną redukcję o około 40 procent podczas objętych nią lotów. Korpus Vaani obejmuje 58 języków indyjskich, w tym kilka, dla których nie istniały wcześniej żadne zasoby mowy z zakłóceniami, a akcelerator DeepMind dla regionu Azji i Pacyfiku udostępnia wyspecjalizowane modele szesnastu zespołom terenowym. Żaden z tych trzech projektów nie ma benchmarku do pobicia. Ich ograniczenia leżą gdzie indziej — w danych, które trzeba zgromadzić, i we wdrożeniu, które musi się udać — i właśnie tam rozstrzyga się różnica między demonstracją a mierzalnym efektem.
Źródła
- Sol-H3, ogłoszenie Enze Xie na X
- Strona projektu Sol-H3, NVIDIA Research
- Dostęp do API Sol-H3 przez Reactor
- Vaani Noise Event Timestamp Dataset, ARTPARK-IISc
- Seria JiRack Ultra, CMS Manhattan
- JiRack DeltaNet 27B, CMS Manhattan
- Historia środowisk RL, Hugging Face
- Unikanie smug kondensacyjnych podczas lotów ultradługodystansowych, Google Research
- Muse Spark 1.3 w Genspark
- Replit otwiera swoje londyńskie biuro
- Tolquane, komponowalna równoległość w Python
- Bezpośrednia instalacja umiejętności w firmware Aiden
- Together AI porównuje GLM-5.3 Flash i GPT-5.6 Terra
- Manifest na rzecz brazylijskiego ekosystemu AI
- Akcelerator AI for the Planet w regionie Azji i Pacyfiku, Google DeepMind
- Canvases w aplikacji Copilot
- Generator pseudonimów dla GitHub Universe
- Synthesia na ECCV 2026
- Mati Staniszewski w podcaście GDIY
- Podsumowanie Qwen Conference Thailand 2026
- Cohere udostępnia reportaż CNN o Toronto