Szukaj

Qwen-Image-2.1 łączy generowanie i edycję w otwartych wagach, piaskownica Antigravity trafia na Windows, trzynaście weryfikatorów na jednym zbiorze testowym

Artykuł wygenerowany przez sztuczną inteligencję
Qwen-Image-2.1 łączy generowanie i edycję w otwartych wagach, piaskownica Antigravity trafia na Windows, trzynaście weryfikatorów na jednym zbiorze testowym

ai-powered-markdown-translator

Artykuł przetłumaczony z fr na pl za pomocą gpt-5.6-sol.

Zobacz projekt na GitHubie ↗

W sobotę i niedzielę laboratoria milczały: ani DeepSeek, ani Meta, ani Ai2, ani Sakana, ani Mistral, ani xAI niczego nie opublikowały, a oficjalne konta związane z otwartymi modelami przez dwa dni pozostawały puste. Pojawiła się tylko jedna prawdziwa premiera: Qwen-Image-2.1, opublikowany w niedzielę po południu z otwartymi wagami. Większość pozostałych informacji sprowadza się do pięciu wpisów na społecznościowym blogu Hugging Face, wersji Antigravity, która niczego nie naprawia, oraz dwóch wpisów w changelogu GitHub nadrobionych z 18 września — był to spokojny dzień, którego nie ma powodu sztucznie rozdmuchiwać.


Qwen-Image-2.1, jeden model do generowania, edycji i tworzenia przezroczystych obrazów

20 września — Qwen opublikował Qwen-Image-2.1, swój model do generowania i edycji obrazów, z otwartymi wagami na Hugging Face, ModelScope i GitHub. Głównym argumentem nie jest rozmiar, lecz unifikacja: ten sam zestaw wag obsługuje tworzenie na podstawie instrukcji tekstowej oraz retuszowanie istniejących obrazów, podczas gdy wcześniej te dwa zastosowania wymagały dwóch modeli.

Najbardziej konkretną nowością jest natywna przezroczystość: model bezpośrednio tworzy i modyfikuje warstwy RGBA, a instrukcja określa, czy wynik ma zawierać kanał przezroczystości. Qwen oferował tę funkcję od grudnia 2025 roku za pośrednictwem dedykowanego modelu Qwen-Image-Layered, który został obecnie wchłonięty. Znika jeden etap wycinania: można wyodrębnić obiekt ze zdjęcia jako warstwę nadającą się do ponownego wykorzystania albo zastąpić tekst na przezroczystej warstwie.

W zakresie edycji model przyjmuje do 10 obrazów referencyjnych dla jednej kompozycji, a obszar przeznaczony do retuszu można wskazać kolorowym okręgiem, namalowaną adnotacją lub maską dostarczoną osobno — ta trzecia metoda istnieje dlatego, że dwie pierwsze zasłaniają oryginalną zawartość. Wydajność opiera się na mechanizmie uwagi o mieszanej granularności, przy czym dane wejściowe do edycji tworzą statyczny kontekst zapisywany w pamięci podręcznej już na pierwszym etapie.

Element technicznyDeklarowana wartość
Parametry generowania obrazu7 miliardów, w 32 warstwach Single-Stream DiT
Obsługiwane obrazy referencyjneMaksymalnie 10
Przezroczystość wynikówNatywne warstwy RGBA, zarówno przy generowaniu, jak i edycji
Wchłonięty model dedykowanyQwen-Image-Layered, opublikowany w grudniu 2025 roku
Obsługa od pierwszego dniavLLM-Omni i ComfyUI

Qwen publikuje porównanie w Qwen-Image-Bench, ale jego wartości widnieją wyłącznie na grafice we wpisie, dlatego nie zostały tutaj przytoczone.

Generate, edit, and create transparent images with one model: a 7.1B DiT paired with Qwen3-VL-8B.

🇵🇱 Generowanie, edytowanie i tworzenie przezroczystych obrazów za pomocą jednego modelu: DiT z 7,1 miliarda parametrów połączony z Qwen3-VL-8B.@vllm_project na X

🔗 Ogłoszenie


Qwen Code v0.24.2, pełna obsługa głosowa w Web Shell i rozbudowana piaskownica bwrap

Ten sam wydawca, ten sam dzień, zupełnie inny produkt. 20 września — opublikowana nieco ponad dwadzieścia cztery godziny po v0.24.1 wersja v0.24.2 działającego w wierszu poleceń agenta programistycznego Qwen jest pierwszą w tej serii bez żadnych zmian niekompatybilnych wstecz, podczas gdy każda z dwóch poprzednich zawierała po jednej takiej zmianie.

Piaskownica bubblewrap otrzymuje kompletną podstawę wykonawczą: ustrukturyzowane uruchamianie procesów, nadzór i izolowane workery. W tym samym duchu obszar roboczy o nierozstrzygniętym poziomie zaufania wymaga teraz podjęcia jednoznacznej decyzji. W Web Shell funkcja Live Voice staje się rzeczywiście użyteczna: model i głos można wybrać na karcie konfiguracji, a podczas rozmowy wyświetlany jest poziom mikrofonu. Dla osób prowadzących równolegle wiele sesji każdy przychodzący komunikat jest teraz oceniany pod kątem sesji, do której został skierowany, a pamięć podręczna promptu zostaje zachowana dla narzędzi uruchamianych z opóźnieniem.

🔗 Informacje o wydaniu


Weryfikowanie odpowiedzi bez generowania tokena oraz ranking, którego autor jest sędzią we własnej sprawie

20 września — Dwa wpisy tego samego dnia, dotyczące tego samego zbioru 2 018 elementów. Pierwszy przedstawia Zero-Token Confidence: sonda w jednym przebiegu w przód odczytuje ostatni stan ukryty modelu i wyprowadza z niego skalibrowane prawdopodobieństwo, nie generując ani jednego tokena. Pytanie modelu, czy jest pewny, daje pole pod krzywą wynoszące 0,5000, czyli wynik losowy; odczytanie jego stanu wewnętrznego daje 0,8801 w 0,0615 sekundy, wobec 1,631 sekundy potrzebnej na wygenerowanie odpowiedzi. W drugim wpisie testowanych jest trzynaście weryfikatorów: tylko trzy przekraczają 0,70, a ZTC wyprzedza JEV o 0,0014, czyli o nierozróżnialną różnicę.

Najbardziej solidny fakt kryje się gdzie indziej: metoda referencyjna, która uwzględnia wyłącznie długość i formatowanie odpowiedzi, nigdy zaś jej treść, osiąga 0,7036 i pokonuje osiem z trzynastu systemów. Zastrzeżenie: autor rankingu nie jest neutralną stroną trzecią — informuje, że mierzy również własny system, nie wskazując, który z trzynastu nim jest, a oba wpisy ukazały się tego samego dnia. Liczby mogą być prawidłowe, lecz niezależność rankingu nie została potwierdzona.

🔗 ZTC · ranking


LoRA za 54 dolary, która jednocześnie naprawia i psuje

20 września — ScalablyAI wytrenowało za 53,88 dolara dwa adaptery LoRA dla Qwen3.8-27B na podstawie 143 145 bloków użycia narzędzi pozostawionych przez platformę agentową firmy, a następnie oceniło je na zestawie testowym zamrożonym przed pierwszym krokiem treningu.

Wynik jest dwojaki. W 73 stanach odzyskiwania po odrzuconym wywołaniu narzędzia adapter zwiększa liczbę sukcesów z 31 do 38, przy czym siedem przypadków zmienia się na jego korzyść, a żaden na niekorzyść. Jednak w 73 decyzjach dotyczących prawidłowej trajektorii wynik spada z 49 do 45, czyli o pięć i pół punktu przy granicy ustalonej na dwa. Ponieważ odłączenie adaptera jest operacją niepodzielną, uniknięcie regresji wymagało rezygnacji także z poprawy: oba adaptery zostały odrzucone. Stąd przyjęta architektura — z jednej strony 433 edytowalne reguły pamięci, z drugiej niezmieniane wagi.

If every useful experience immediately changes the weights, learning and corruption can become the same operation, and at production sample sizes you cannot tell which one you performed.

🇵🇱 Jeżeli każde użyteczne doświadczenie natychmiast zmienia wagi, uczenie się i uszkadzanie mogą stać się tą samą operacją, a przy liczebności danych dostępnych w środowisku produkcyjnym nie da się ustalić, którą z nich właśnie wykonano.pavle-scalably na blogu Hugging Face

🔗 Pełny raport i rejestr dowodów


SeamFlow umieszcza szwy UV tam, gdzie zrobiłby to artysta

20 września — Rozwinięcie powierzchni 3D do postaci 2D wymaga jej przecięcia; dobre rozwinięcie umieszcza te szwy tam, gdzie będą najmniej widoczne. SeamFlow, przedstawiony przez Meshy AI wspólnie z City University of Hong Kong, Bambu Lab i Nanyang Technological University, zmienia reprezentację jeszcze przed modelem: każda krawędź siatki staje się tokenem, a binarna etykieta zostaje rozluźniona do wartości ciągłej, dzięki czemu można zastosować dopasowywanie przepływów (flow matching).

Korzyści mają charakter strukturalny: nie jest potrzebny etap projekcji ani arbitralna kolejność tokenów, a każde przewidziane cięcie przebiega po istniejącej krawędzi. Model wytrenowany na 350 000 siatek Objaverse ze szwami utworzonymi przez profesjonalistów umieszcza cięcia w załamaniach: średni kąt dwuścienny wzdłuż szwów wynosi 67,59 stopnia, wobec 56,65 dla xatlas i 55,97 dla PartUV. Rozwinięcie zajmuje mu 5,63 sekundy wobec 11,46 sekundy dla autoregresyjnego punktu odniesienia, a jako pierwszy wybór wskazywany jest w 61,0% przypadków, wobec 19,1% dla następnego rozwiązania.

🔗 SeamFlow


Antigravity 2.15.1 udostępnia piaskownicę na Windows, ale jej nie włącza

19 września — Informacje o Antigravity 2.15.1 mieszczą się w jednym wierszu: izolowanie plików i sieci w piaskownicy trafia na Windows. Jedno usprawnienie, żadnych poprawek, podczas gdy wersja 2.15.0 z poprzedniego dnia zawierała ich odpowiednio siedem i szesnaście — to ukierunkowany dodatek, a nie wydanie konserwacyjne.

Prawdziwym tematem jest różnica względem pozostałych platform. W Linux piaskownica opiera się na przestrzeniach nazw jądra; w macOS — na profilach Seatbelt narzędzia sandbox-exec; w obu przypadkach jest domyślnie aktywna. W Windows zastosowany mechanizm nie został udokumentowany, aktywacja nadal wymaga ręcznego zaznaczenia pola „Enable Sandbox Mode (Preview)”, a żadne z trzech proponowanych ustawień bezpieczeństwa — Default, Full machine, Turbo mode — jej nie włącza: zaznaczenie pola przełącza ustawienie na Custom. Google zapowiada ujednolicenie w przyszłej wersji, ale nie podaje terminu.

🔗 Changelog Antigravity


W skrócie

  • Pięciu anotatorów, ta sama instrukcja, pięć różnych odpowiedzi — dla 100 tureckich scen i ludzkiego punktu odniesienia obejmującego 9 wyników pozytywnych pięciu anotatorów maszynowych wskazuje od 0 do 78 wyników pozytywnych, a wszystkie współczynniki kappa Cohena mieszczą się między 0,000 a 0,185 mimo surowej zgodności wynoszącej od 74,7 do 86,3%. Autor, który deklaruje, że opracował oceniany schemat, przypomina, iż projektant nie jest neutralnym sędzią możliwości przeniesienia własnego schematu. 🔗 źródło
  • Wydanie nightly Gemini CLI z 20 września nie zawiera żadnych zmian — tag v0.62.0-nightly.20260920.gcfbcaa8df wskazuje ten sam commit co poprzedniego dnia, z identycznym sufiksem hasha, a strona wydania nie zawiera sekcji „What’s Changed”. Kanały stable (v0.60.0) i preview (v0.61.0-preview.0) również pozostają bez zmian. 🔗 źródło
  • Eyeball, plugin Copilot CLI napisany przez prawnika z GitHub, jest open source — narzędzie osadza zrzuty ekranu dokumentu źródłowego przy analizowanej klauzuli, tak aby analizę i potwierdzający ją materiał można było czytać obok siebie. Repozytorium dvelton/eyeball jest publiczne, udostępnione na licencji MIT, napisane w Pythonie, ma 35 gwiazdek i nie otrzymało żadnego commitu od 5 kwietnia 2026 roku. 🔗 źródło
  • Tokeny npm ograniczone do przygotowywania wydań, dostępne od 18 września — uprawnienie „Read and write (stage only)” pozwala potokowi ciągłej integracji przesłać wersję za pomocą npm stage publish, ale nie umożliwia jej opublikowania; publikacja wymaga zatwierdzenia 2FA przez opiekuna. Blokada jest egzekwowana po stronie rejestru, również w przypadku tokena skonfigurowanego tak, aby omijać 2FA; npm usunie możliwość bezpośredniej publikacji w styczniu 2027 roku. 🔗 źródło
  • Regułą pokrycia kodu można zarządzać przez API REST, również od 18 września — opcja zestawu reguł „Restrict code coverage”, która narzuca minimalny próg lub ogranicza dopuszczalny spadek w pull request, staje się ogólnie dostępna w API, a tym samym również w infrastrukturze jako kodzie. Funkcja jest zastrzeżona dla GitHub Enterprise Cloud i GitHub Team, bez GitHub Enterprise Server. 🔗 źródło
  • Wan promuje funkcję Peel-Off Sticker — konto Alibaba Wan pokazuje moduł wan.video, który osadza prywatne zdjęcie w scenie i animuje je za pomocą Wan 3.0. Nie jest to premiera: wiadomość nie podaje daty udostępnienia, ceny ani żadnej miary jakości. 🔗 źródło
  • Cohere publikuje cztery zdjęcia z konferencji ALL IN w Montrealu — wiadomość z 19 września informuje o obecności Aston Martin F1 i Magnusa Carlsena u boku firmy. Nie zawiera żadnego ogłoszenia produktowego, żadnych danych liczbowych ani żadnego linku. 🔗 źródło

Co to oznacza

Jedyna weekendowa premiera modelu ma otwarte wagi i konsoliduje istniejące funkcje, zamiast dodawać kolejny model. Qwen-Image-2.1 nie zajmuje miejsca obok Qwen-Image-Layered: wchłania go i eliminuje dziewięciomiesięczny model dedykowany, integrując przezroczystość z modelem głównym. Ten sam proces dotyczy generowania i edycji, połączonych w jednym zestawie wag. Dla osób tworzących materiały wizualne oznacza to krótszy proces — jeden model do załadowania, bezpośrednio użyteczną warstwę RGBA i brak etapu wycinania — a ekosystem dotrzymał kroku już w dniu premiery, udostępniając działające integracje vLLM-Omni i ComfyUI.

Trzy niedzielne wpisy opisują to samo zagadnienie z trzech perspektyw: czy można ufać wynikom modelu i jakim kosztem. Zero-Token Confidence odpowiada przez pryzmat kosztu — 0,0615 sekundy wobec 1,631, ponieważ weryfikator generujący tokeny konkuruje z agentem o ten sam budżet. Ranking trzynastu weryfikatorów odpowiada przez pryzmat pomiaru, a płynący z niego wniosek jest nieprzyjemny dla branży: metoda referencyjna analizująca jedynie długość i formatowanie odpowiedzi pokonuje osiem z trzynastu rozwiązań. Poprzeczka, którą trzeba pokonać, aby wykazać, że weryfikator naprawdę analizuje treść, znajduje się zatem wyżej, niż sugerują wyniki większości systemów — a przyznanie przez autora, że mierzy także własny system, przemawia za oczekiwaniem na niezależne powtórzenie badania.

Raport ScalablyAI dodaje wymiar, którego brakuje dwóm pozostałym: odwracalność. Aktualizacja wag za 54 dolary przyniosła w tym samym artefakcie zmierzoną poprawę odzyskiwania po błędzie i możliwe pogorszenie prawidłowych decyzji, przy liczebności danych, która nie pozwala środowisku produkcyjnemu rozstrzygnąć różnicy. Ponieważ nie da się odłączyć połowy adaptera, trzeba było odrzucić go w całości. Wniosek operacyjny — tanią do cofnięcia wiedzę przechowuje się w plikach tekstowych, a wagi zmienia się wyłącznie po przejściu zamrożonego zestawu testowego — stanowi użyteczną przeciwwagę dla narracji o samodoskonalącej się AI.

W obszarze narzędzi izolacja zapewniana przez system operacyjny staje się podstawą, a nie opcją. Qwen Code czyni bubblewrap fundamentem wewnętrznego środowiska wykonawczego, Antigravity przenosi swoją piaskownicę na Windows, a npm wprowadza token, który może przygotować wersję, lecz nie może jej opublikować: trzech dostawców w ciągu trzech dni przenosi bezpieczeństwo ze sfery deklaracji do wartości domyślnych. Z jednym zastrzeżeniem dotyczącym Windows: piaskownica, którą trzeba włączyć ręcznie i której nie aktywuje żadne z trzech proponowanych ustawień, nie jest jeszcze zabezpieczeniem domyślnym, a różnica względem macOS i Linux pozostanie pełna, dopóki Google nie przedstawi harmonogramu.


Źródła