Szukaj

Claude odkrywa nieznane wcześniej luki kryptograficzne, Gemini Robotics ER 2 umożliwia współpracę wielu robotów, GPT-5.6 obniża ceny

Artykuł wygenerowany przez sztuczną inteligencję
Claude odkrywa nieznane wcześniej luki kryptograficzne, Gemini Robotics ER 2 umożliwia współpracę wielu robotów, GPT-5.6 obniża ceny

ai-powered-markdown-translator

Przetłumaczono z fr na pl za pomocą gpt-5.4-mini.

Zobacz projekt na GitHubie ↗

30 lipca 2026 roku dominuje dwa przełomy badawcze: Claude Mythos, wewnętrzny model badawczy Anthropic, odkrywa nieznane wcześniej luki kryptograficzne w kandydatach postkwantowych NIST oraz w osłabionej wersji AES, podczas gdy Google DeepMind uruchamia Gemini Robotics ER 2, zdolny do doprowadzenia wielu robotów do współpracy przy jednym zadaniu. Wokół tych dwóch tematów pojawia się obniżka cen w OpenAI dla GPT-5.6, jednoczesne wdrożenie stacked pull requests w GitHub i Devin, kilka premier otwartych modeli (Thinking Machines, Sakana AI, LightOn) oraz fala aktualizacji po stronie agentów (Perplexity, Genspark, Gemini).


Claude Mythos odkrywa nieznane wcześniej luki kryptograficzne (HAWK, AES)

30 lipca — Anthropic publikuje badanie swojego Frontier Red Team, pokazujące, że Claude Mythos Preview, jego najbardziej zaawansowany, niewydany komercyjnie wewnętrzny model badawczy, odkrył nieznane wcześniej matematyczne luki w dwóch kluczowych algorytmach kryptograficznych — wykraczające poza zwykłe błędy implementacyjne, które Claude potrafił już wykrywać w bibliotekach takich jak OpenSSL. Ogłoszenie opublikowano 28 lipca na X, a następnie szczegółowo opisano w pełnym wpisie na blogu.

Pierwszy wynik: ulepszony atak na HAWK, kandydata trzeciej rundy konkursu NIST (amerykańskiej instytucji normalizacyjnej) na podpisy cyfrowe postkwantowe. W ciągu 60 godzin pracy, przy koszcie około 100 000 dolarów w API, model znalazł atak, który o połowę zmniejsza efektywny rozmiar klucza HAWK-256 — szacowany koszt pełnego ataku spada z 2^64 do 2^38 operacji. Drugi wynik: na wersji AES-128 zredukowanej do 7 rund z 10 nowa technika nazwana Möbius Bridge (most Möbiusa) przyspiesza najlepsze znane ataki od 200 do 800 razy, przy podobnym koszcie — model najpierw uznał zadanie za niewykonalne, po czym wytrwał dzięki zachęcie badaczy, którzy następnie poświęcili kilkaset godzin na walidację wyniku.

Anthropic podkreśla, że żaden system produkcyjny nie jest zagrożony: HAWK to jedynie niewdrożony kandydat, a atak na AES dotyczy wyłącznie osłabionej wersji szyfrowania — pełne AES z 10 rundami nie zostało złamane. Wstępne wyniki obejmują też LEA (odzysk klucza w mniej niż godzinę przy 13 rundach), Serpent-128 (pełny atak przy 6 rundach) oraz mniejsze korzyści dla Salsa20, Poseidon i SHA-1.

Aby pogłębić te badania, Anthropic łączy siły z ETH Zurich, Tel Aviv University i TU Berlin, by zbudować CryptanalysisBench — zestaw testowy służący do mierzenia możliwości kryptanalizy modeli.

Cel kryptograficznyOsiągnięty wynik
HAWK-256 (podpis postkwantowy)Efektywny rozmiar klucza zmniejszony o połowę (2^64 → 2^38), znalezione w 60 godzin
AES-128 zredukowany do 7 rund z 10Atak 200 do 800 razy szybszy dzięki technice Möbius Bridge
LEA zredukowany do 13 rund z 24Odzysk klucza w mniej niż godzinę na komputerze stacjonarnym
Serpent-128 zredukowany do 6 rund z 32Nowy pełny atak odzyskiwania klucza
Salsa20, Poseidon, SHA-1Zyski mniejsze niż 10 razy względem najlepszych znanych ataków

🔗 Pełne badanie — Anthropic


Google DeepMind uruchamia Gemini Robotics ER 2

30 lipca — Google DeepMind uruchamia Gemini Robotics ER 2 (Embodied Reasoning, rozumowanie ucieleśnione), swój najbardziej zdolny model do nadawania robotom wysokopoziomowego „mózgu”. Rozumie świat fizyczny, rozmawia z ludźmi, planuje wieloetapowe zadania, a następnie deleguje wykonanie motoryczne do niższego modelu vision-language-action; może też natywnie wywoływać narzędzia takie jak Google Search lub funkcje zdefiniowane przez dewelopera.

W porównaniu z poprzednią wersją (ER 1.6), główny postęp dotyczy ciągłego rozumienia wideo: obserwując strumień wideo na żywo, robot może śledzić własne postępy, dostosowywać się w przypadku błędu i dokładnie wiedzieć, kiedy przejść do następnego etapu. Google wprowadza też współpracę wielu robotów: różne maszyny (na przykład robot na kołach i humanoid) komunikują się poprzez wspólne rozumienie semantyczne, aby podzielić się złożonymi zadaniami — pokazano to na przykładzie robotów Apollo 2 firmy Apptronik i Franka F3 Duo, które wspólnie sprzątają garaż.

Jeśli chodzi o wydajność, model osiąga 57,4% trafności w klasyfikacji postępu zadania i 91,3% w wykrywaniu właściwego momentu działania (średni odstęp 0,96 sekundy), przy szybkości działania 4 razy wyższej niż w przypadku większych modeli o porównywalnej dokładności. W kwestii bezpieczeństwa Google twierdzi, że jest to jego najbezpieczniejszy model do tej pory: poprawnie zatrzymuje robota humanoidalnego, gdy zbliża się człowiek, i wznawia aktywność dopiero wtedy, gdy obszar jest wolny.

Model jest dostępny już dziś dla deweloperów przez API Gemini i Google AI Studio, z ograniczonym wczesnym dostępem na platformie Gemini Enterprise Agent. Udokumentowano też demonstrację z robotem Spot od Boston Dynamics, który na polecenie głosowe idzie po przekąskę, wraz z kodem na GitHubie.

Wskaźnik wydajnościZmierzony wynik
Klasyfikacja postępu zadania57,4% trafności
Wykrywanie właściwego momentu działania91,3% trafności, średni odstęp 0,96 sekundy
Szybkość działania vs większe modele4 razy szybciej

🔗 Oficjalne ogłoszenie — Google DeepMind


Cursor: agenci w chmurze kończą 56% mergowanych pull requestów

30 lipca — Cursor dzieli się znaczącą wewnętrzną statystyką dotyczącą adopcji swoich agentów w chmurze: w grudniu tylko 1 mergowany pull request na 10 pochodził od agenta cloud; dziś wskaźnik ten wynosi 56%. Firma przypisuje ten wzrost temu, że agentom daje się własną maszynę w chmurze, z możliwością samodzielnego naprawiania i ulepszania swojego środowiska wykonawczego — co pozwala im realizować dłuższe zadania inżynieryjne od początku do końca.

In December, 1 in 10 of our merged PRs came from cloud agents. Today, it’s 56%, as we use cloud agents to complete longer engineering tasks from start to finish. We got here by giving agents their own cloud computers and letting them fix and improve their environments.

🇵🇱 W grudniu 1 mergowany PR na 10 pochodził od agentów w chmurze. Dziś to 56%, dzięki wykorzystywaniu agentów w chmurze do skutecznego prowadzenia dłuższych zadań inżynieryjnych od początku do końca. Doszliśmy do tego, dając agentom własny komputer w chmurze i pozwalając im naprawiać oraz ulepszać ich środowiska.@cursor_ai na X


Stacked pull requests trafiają do wersji prewiejnej w GitHubie, Devin wdraża je tego samego dnia

30 lipca — Dwie odrębne zapowiedzi tego samego dnia wokół jednego workflow: podzielenia dużej zmiany na serię mniejszych, niezależnie recenzowanych pull requestów.

GitHub uogólnia stacked pull requests

GitHub wprowadza stacked pull requests do publicznej wersji prewiejnej we wszystkich repozytoriach. Zamiast jednego ogromnego pull requesta albo wielu gałęzi wymagających ręcznego rebase, zmiana jest dzielona na uporządkowane warstwy, z których każda może być recenzowana za pomocą „stack map”, pokazującej miejsce bieżącej warstwy w całej strukturze, a następnie mergowana w jednej operacji. Zmergowanie najwyższej warstwy automatycznie przenosi wszystko znajdujące się poniżej; zmergowanie warstwy pośredniej automatycznie robi rebase i retarget otwartych warstw niżej, bez utraty istniejących zabezpieczeń gałęzi. Funkcja jest dostępna przez github.com, CLI (rozszerzenie gh-stack), aplikację mobilną oraz bezpośrednio z agenta kodującego, takiego jak GitHub Copilot, dzięki dedykowanej umiejętności gh-stack.

🔗 Stacked pull requests — GitHub

Devin (Cognition) obsługuje je natywnie

Tego samego dnia Devin, agent inżynierii oprogramowania od Cognition, ogłasza natywne wsparcie dla stacked PRs od GitHuba: dzielenie dużych zmian na mniejsze diffy, przetwarzanie i poprawianie uwag z code review w całym stosie oraz automatyczny rebase zmian zależnych, gdy zmienia się jedna warstwa. Jednoczesna adopcja po stronie platformy i po stronie agenta pokazuje, że ten nowy model recenzji szybko zakorzenia się w workflow sterowanych przez autonomicznych agentów, a nie tylko w pracy ludzkich developerów.

🔗 Devin — ogłoszenie Cognition


Amp Labs podpisuje partnerstwo z bankiem Westpac

29 lipca — Amp Labs, dział usług i konsultingu Amp (niezależnego spin-offu Sourcegraph), ogłasza partnerstwo z Westpac, jednym z najstarszych australijskich banków — firmą mającą ponad dwa wieki historii. Celem jest zmiana sposobu, w jaki bank buduje i dostarcza technologię, zwłaszcza migracja i modernizacja systemów danych używanych przez miliony osób. Dedykowany zespół będzie pracować na miejscu w Sydney, razem z inżynierami Westpac. Artykuł przedstawia zespół założycielski projektu — wywodzący się z Block, Ethereum Foundation, Google i Canva — oraz otwiera lokalną rekrutację w Sydney. To partnerstwo pokazuje rosnącą rolę ofert usługowych wokół agentów kodujących, wykraczających poza sam abonament software’owy: Amp Labs sprzedaje teraz obecność ludzi na miejscu, wspieraną przez własnego agenta.

🔗 Ogłoszenie — Amp Labs x Westpac


Obniżka cen API GPT-5.6, tryb Fast dla Sol

30 lipca — W oparciu o wzrosty wydajności osiągnięte dzień wcześniej (GPT-5.6 Sol sam zoptymalizował swoje produkcyjne kerny, już opisane), OpenAI obniża ceny API GPT-5.6 Luna, swojego najszybszego i najtańszego modelu, o 80%, oraz GPT-5.6 Terra, swojego zbalansowanego modelu do codziennego użytku, o 20%. Obniżki widać również w zużyciu kredytów w subskrypcjach Codex i ChatGPT Work, bez zmian w limitach ani cenach abonamentu.

OpenAI wprowadza także tryb Fast w API, zastępujący ofertę Priority Processing: dla GPT-5.6 Sol zapewnia on do 2,5 razy większą szybkość niż standardowe przetwarzanie, za dwukrotność ceny, bez zmiany inteligencji. Istniejące zapytania oznaczone jako „priority” automatycznie przechodzą na ten nowy tryb. Przywołano kilku klientów korporacyjnych, w tym Replit, Notion, Ramp, Blitzy, Cognition i Dust.

Model i trybCennik od 30 lipca
GPT-5.6 Terra (wejście / wyjście)2 dolary i 12 dolarów za milion tokenów
GPT-5.6 Luna (wejście / wyjście)0,20 dolara i 1,20 dolara za milion tokenów
GPT-5.6 Sol, tryb FastDo 2,5 razy szybciej, za dwukrotność ceny

GPT‑5.6 Luna is the closest we’ve come to intelligence too cheap to meter. I’ve never seen a model this affordable be this powerful — it’s unlocking use cases for Replit we didn’t expect to build for a long time.

🇵🇱 GPT-5.6 Luna jest najbliższy inteligencji zbyt taniej, by ją mierzyć. Nigdy nie widziałem modelu tak przystępnego cenowo, a jednocześnie tak potężnego — otwiera to przed Replit przypadki użycia, których nie sądziliśmy, że będziemy w stanie zbudować tak szybko.Michele Catasta, Prezes i Head of AI, Replit — cytowany przez OpenAI


Dwie zmiany API potrajają wyniki GPT-5.6 Sol na ARC-AGI-3

29 lipca — OpenAI publikuje analizę początkowo niskich wyników GPT-5.6 Sol (7,8%) i GPT-5.5 (0,4%) na benchmarku zagadek 2D ARC-AGI-3, mimo że Sol rozwiązał już otwarte problemy matematyczne i pokonał złożone gry wideo. Dochodzenie pokazuje, że oficjalny harness benchmarku usuwa prywatne rozumowanie modelu po każdym działaniu i przycina jego historię za pomocą okna przesuwnego, przez co model nie może pamiętać wcześniejszych myśli i działań.

Po odtworzeniu harnessu z użyciem Responses API OpenAI (tego używanego produkcyjnie w ChatGPT i Codex), z włączeniem zachowywania rozumowania i kompakcji zamiast przycinania, wynik GPT-5.6 Sol na publicznym zbiorze rośnie z 13,3% do 38,3%, przy 6 razy mniejszej liczbie tokenów wyjściowych — wobec szacowanego ludzkiego punktu odniesienia na poziomie 48%. OpenAI wyciąga z tego ogólne zalecenie: używać Responses API zamiast starszego Chat Completions API, aby uzyskać ewaluacje bardziej reprezentatywne dla rzeczywistego użycia.

Testowana konfiguracjaOsiągnięty wynik (ARC-AGI-3)
Oficjalny harness benchmarku13,3%
Zachowane rozumowanie i kompakcja38,3% (6 razy mniej tokenów wyjściowych)
Szacowany ludzki punkt odniesienia48%

🔗 Pełna analiza — OpenAI


GitHub Copilot w Visual Studio: podsumowanie lipca

30 lipca — GitHub publikuje miesięczne podsumowanie GitHub Copilot w Visual Studio 2026, z czterema nowościami. W selektorze Copilot Chat pojawia się nowy Agent (Preview), oparty na tym samym Copilot SDK, które zasila GitHub Copilot CLI — obietnica krótszych odpowiedzi i skuteczniej wykonywanych zadań przy mniejszej liczbie iteracji. Wbudowane kompetencje .NET i Azure, napisane przez odpowiednie zespoły wewnętrzne, pojawiają się automatycznie w kategorii „Built-in” selektora narzędzi, gdy tylko zainstalowane są odpowiednie workloady (domyślnie wyłączone). Funkcja Review Selection pozwala zaznaczyć kod, kliknąć prawym przyciskiem i uzyskać użyteczne komentarze inline. Na koniec niestandardowe instrukcje na poziomie organizacji pozwalają właścicielom organizacji definiować wspólne preferencje stosowane automatycznie do wszystkich repozytoriów — zarezerwowane dla planów Business i Enterprise, podczas gdy trzy pozostałe nowości są dostępne we wszystkich planach.

🔗 Podsumowanie lipca — GitHub Copilot w Visual Studio


Genspark prezentuje SecondBrain, trwałą pamięć dla AI Workspace 6.0

29 lipca — Genspark podkreśla, za pośrednictwem wystąpienia medialnego swojej COO Wen Sang, funkcję nazwaną SecondBrain w ramach AI Workspace 6.0 (uruchomionego już 20 lipca). Wybrany kąt: „problem pamięci” agentów AI, którzy zapominają kontekst projektu z jednej sesji na drugą. Za wyraźną zgodą użytkownika SecondBrain łączy się z e-mailami, kalendarzem, historią rozmów, notatkami ze spotkań i zewnętrznymi narzędziami (Gmail, Slack, Notion, HubSpot, Microsoft 365…) , aby stworzyć osobistą warstwę kontekstu, z której może korzystać Super Agent Genspark. Udokumentowano kilka konkretnych zastosowań: automatyczne cotygodniowe podsumowanie, brief przed spotkaniem z kontekstem uczestników albo przekrojowe wyszukiwanie we wszystkich podłączonych źródłach. Genspark odróżnia to oprogramowanie od produktu SecondBrain Note, fizycznego urządzenia do nagrywania sprzedawanego osobno, które jest tylko opcjonalnym kanałem wejściowym spośród innych.

🔗 SecondBrain — ogłoszenie Genspark


Perplexity uruchamia Projects, ewolucję Spaces w Computer

30 lipca — Perplexity zastępuje „Spaces” przez Projects w Computer, swoim środowisku orkiestracji agentów: trwałe przestrzenie robocze do długotrwałej pracy, z współdzielonym i hierarchicznym systemem plików, na którym kolejne zadania mogą się opierać bez zaczynania od zera. Projects łączą się z Brain, samodoskonalącym się systemem pamięci Computer, który między zadaniami odczytuje pliki i sesje Project, aby każde nowe zadanie zaczynało się z nagromadzonym kontekstem. Podkreślany jest aspekt współpracy: wielu członków zespołu może pracować nad tym samym Project, zachowując jednocześnie własną pamięć osobistą i konektory odizolowane od ich własnego konta. Perplexity deklaruje możliwość połączenia z ponad 400 narzędziami (Google Drive, Notion, Linear, Snowflake, GitHub), a także integrację ze Slackiem i Microsoft Teams. Istniejące Spaces migrują automatycznie; dostępne już dziś dla wszystkich użytkowników Computer.

🔗 Spaces staje się Projects — Perplexity


Gemini Spark integruje Chrome i rozszerza dostęp do 160+ krajów

30 lipca — Google rozszerza Gemini Spark, swojego asystenta automatyzacji zadań webowych, o bezpośrednią integrację z Chrome o nazwie Chrome auto browse. Za zgodą użytkownika Spark może teraz korzystać z połączonych kont i zapisanych haseł przeglądarki, aby wykonywać żmudne czynności — planować wizyty w zapisanych mieszkaniach albo wyszukiwać loty i rozpocząć rezerwację. Google zaznacza, że działania te są chronione przed próbami prompt injection, a wrażliwe kroki, takie jak płatności, są każdorazowo przekazywane użytkownikowi do zatwierdzenia. Funkcja startuje w Stanach Zjednoczonych, z planowanym rozszerzeniem na inne regiony. Równolegle dostęp do Sparka zostaje rozszerzony na subskrybentów Google AI Pro w ponad 160 dodatkowych krajach, począwszy od dziś — to znacznie szersze rozszerzenie niż 23 lipca, ograniczone do Stanów Zjednoczonych.

🔗 Aktualizacje Gemini Spark — Google


Nano Banana trafia do Google Earth

30 lipca — Google Earth integruje teraz Nano Banana 2, model generowania obrazów Google, bezpośrednio ze swoim interfejsem webowym. Wystarczy przybliżyć konkretne miejsce, kliknąć „create image” i opisać, co chce się zobaczyć: model generuje obraz osadzony w rzeczywistej wizualizacji miejsca (widoki satelitarne, lotnicze i 3D), a nie ogólną scenę. Artykuł opisuje pięć konkretnych zastosowań: odtworzenie miejsca historycznego (ruiny Pompejów tak, jak wyglądały w 78 r. n.e.), tworzenie infografik edukacyjnych o danym miejscu, przygotowywanie planów projektów nieruchomości lub urbanistycznych, wizualizację projektu budowlanego przed rozpoczęciem prac, albo po prostu fantazyjne przeobrażenie miejsca. Funkcja jest dostępna już dziś, globalnie, dla wszystkich użytkowników Google Earth w sieci, bez ograniczeń geograficznych ani szczególnego progu subskrypcji.

🔗 Nano Banana w Google Earth — Google


ElevenLabs uruchamia Character Casting w ElevenCreative Audiobooks

30 lipca — ElevenLabs uruchamia Character Casting w ElevenCreative Audiobooks, swoim pakiecie do produkcji audiobooków z użyciem AI. Funkcja pozwala zaimportować pełny manuskrypt, a następnie podejrzeć różne głosy bezpośrednio na rzeczywistych dialogach z tekstu, aby przypisać odrębny głos każdej postaci. Celem jest uproszczenie castingu głosowego, etapu dotychczas ręcznego i czasochłonnego w produkcji audiobooków generowanych przez AI — studio dopasowuje teraz głos do faktycznie wypowiadanych kwestii w książce, a nie do ogólnego tekstu demonstracyjnego.

🔗 Character Casting — ElevenLabs


Inkling-Small: Thinking Machines publikuje, NVIDIA odpowiada tego samego dnia

30 lipca — Thinking Machines (laboratorium Miry Murati) uruchamia Inkling-Small, skompresowaną wersję Inkling: łącznie 276 miliardów parametrów, 12 miliardów aktywnych, kwantyzacja NVFP4, dla wyników porównywalnych z Inkling — cztery razy większym — przy lepszych rezultatach w kodzie według Hugging Face. Pełne wagi zostają opublikowane jako otwarty dostęp, z możliwością fine-tuningu przez Tinker i testów w Tinker Playground (tekst, obraz, audio). Hugging Face wzmacnia premierę tego samego dnia, publikując blog poświęcony benchmarkom i wydajności oraz kolekcję modeli na Hubie.

NVIDIA wzbogaca wydanie tego samego dnia, ogłaszając zgodność Inkling-Small z NVIDIA NeMo na DGX Station do fine-tuningu, a także dedykowany checkpoint w formacie NVFP4 opublikowany bezpośrednio na Hugging Face. Ta dostępna od startu (day-0) obsługa sprzętowa pokazuje, jak szybko ekosystem koordynuje się dziś wokół otwartego modelu strony trzeciej: laboratorium publikuje wagi, Hugging Face dokumentuje wydajność, a NVIDIA gwarantuje zgodność swojej infrastruktury fine-tuningowej — wszystko w ciągu jednego dnia.

Cecha technicznaZmierzona wartość
Parametry całkowite / aktywne276 miliardów / 12 miliardów
KwantyzacjaNVFP4
Zgodność sprzętowa day-0NVIDIA NeMo na DGX Station

🔗 Premiera — Thinking Machines na X

🔗 Wsparcie NeMo/DGX — NVIDIA na X


Sakana AI i NYU publikują Dream-Cubed, dataset i modele dla Minecrafta

29 lipca — Sakana AI publikuje, wraz z New York University (NYU), Dream-Cubed : Controllable Generative Modeling in Minecraft by Training on Billions of Cubes. Wkład jest podwójny: ogromny zbiór danych światów Minecrafta (dziesiątki miliardów „sześcianów” pochodzących z terenów proceduralnych i map zbudowanych przez ludzi za ich zgodą) oraz rodzina transformerów trenowanych na tych sześcianach jako jednostkach tokenizacji, na wzór słów w modelowaniu języka. Modele pozwalają generować i na bieżąco edytować interaktywne środowiska 3D o rozdzielczości sześcianu, z precyzyjnym inpaintingiem, outpaintingiem na dużą skalę oraz generacją warunkowaną przez użytkownika, na światach o dowolnym rozmiarze. Zbiór danych, kod treningowy i artykuł zostają opublikowane jako otwarty dostęp.

🔗 Ogłoszenie — Sakana AI na X


Together AI i Y Combinator uruchamiają dedykowany klaster GPU dla startupów YC

30 lipca — Together AI i Y Combinator ogłaszają partnerstwo, w ramach którego powstaje pierwszy dedykowany klaster GPU dla portfela startupów YC. Cel: usunąć główne wąskie gardło młodych startupów AI — dostęp do mocy obliczeniowej — bez zmuszania ich do zabezpieczania wieloletnich kontraktów na compute, które często przekraczają ich całkowitą płynność finansową. Startupy z portfela YC mogą rezerwować, provisionować i samodzielnie zarządzać swoimi GPU poprzez portal self-service Together AI, do doraźnych potrzeb wnioskowania i treningu, bez długoterminowych zobowiązań, jednocześnie korzystając ze stawek zwykle zastrzeżonych dla kontraktów długoterminowych. Tego samego dnia Together AI wskazuje pierwszy konkretny przypadek użycia: startup Osmosis_AI, który sprawdza, czy model open source może osiągnąć poziom modelu bazowego dzięki uczeniu ze wzmocnieniem, trenowany na tym klastrze.

🔗 Dedykowany klaster GPU YC — Together AI


LightOn publikuje mDenseOn i mLateOn na blogu Hugging Face

30 lipca — Francuskie laboratorium LightOn AI publikuje na blogu Hugging Face kolekcję mDenseOn & mLateOn: modele wyszukiwania informacji (retrieval) jedno-wektorowe i wielowektorowe, a także powiązane zbiory danych, wyspecjalizowane w wyszukiwaniu wielojęzycznym, długim kontekście i wyszukiwaniu kodu — 18 elementów łącznie, opublikowanych jako otwarte wagi. Ta publikacja podąża tym samym schematem co wydanie LiquidAI (LFM2.5-Encoders) z 28 lipca: zewnętrzne laboratorium korzysta z bloga Hugging Face jako oficjalnego kanału premiery, a karta modelu i kolekcja są hostowane bezpośrednio na Hubie.

🔗 mDenseOn i mLateOn — blog Hugging Face


Krótkie wiadomości

  • Cognition aktualizuje FrontierCode 1.1 — wraz z nowymi obniżkami cen GPT-5.6 Terra i Luna (zob. wyżej), seria ustawia się teraz na krzywej Pareto koszt/wydajność. 🔗 źródło
  • Hugging Face uruchamia Trackio Logbooks — wersja 0.34.0 Trackio automatycznie zapisuje kod, ślady agentów i artefakty eksperymentu AI jako odtwarzalny statyczny bundle HTML. 🔗 źródło
  • Antigravity CLI przechodzi do wersji 1.1.8 — formaty ustrukturyzowanego wyjścia (json, stream-json) dla trybu print, walidacja za pomocą własnego schematu JSON i ulepszone uprawnienia dla poleceń złożonych. 🔗 źródło
  • GitHub Models został oficjalnie wycofany — playground, katalog modeli, API inferencji i BYOK nie są już dostępne dla żadnego klienta; GitHub przekierowuje do Microsoft Foundry lub GitHub Copilot. 🔗 źródło
  • GitHub ogranicza zdalne sterowanie do zarządzanych urządzeń — nowy parametr firmowy remoteControl (requireSSO / disabled / enabled) dla sesji Copilot w zdalnym sterowaniu, wdrażalny przez prywatne repozytorium, MDM lub plik konfiguracyjny. 🔗 źródło
  • Kimi K3 (Max) obejmuje prowadzenie w rankingu Fullstack Code Arena — wyprzedzając GPT-5.6 Sol (xHigh) i Claude Fable 5, to kolejny znak, że modele otwarte doganiają modele zamknięte w zadaniach pełnego rozwoju (zob. Inkling-Small wyżej). 🔗 źródło

Co to oznacza

Badania podstawowe wychodzą z laboratorium. Claude Mythos znajduje nieznane wcześniej luki w kandydacie postkwantowym NIST i w osłabionej wersji AES — to przełom badawczy, a nie luka możliwa do wykorzystania w produkcji, ale pokazuje, jak szybko wewnętrzny model badawczy może przesuwać dziedzinę, którą ludzie badają od dekad. Tego samego dnia Gemini Robotics ER 2 przenosi robotykę ucieleśnioną z jednego robota wykonującego polecenia na wiele maszyn, które koordynują się między sobą, aby wykonać wspólne zadanie. Google Earth z kolei zakotwicza generowanie obrazów w rzeczywistym świecie: Nano Banana nie rysuje już ogólnej sceny, lecz rekonstrukcję lub wizualizację na podstawie obrazu satelitarnego konkretnego miejsca — podczas gdy Gemini Spark, przez Chrome, przechodzi od tekstu do konkretnego działania w rzeczywistym internecie użytkownika. Cztery różne sposoby, 30 lipca, na wyprowadzenie AI z czysto konwersacyjnego pola.

Ekonomia inferencji nadal przechyla się na korzyść twórców. OpenAI obniża ceny API GPT-5.6 Luna o 80% i Terra o 20%, jednocześnie wprowadzając tryb Fast, dwa razy droższy, ale 2,5 razy szybszy — dwa przeciwstawne sposoby dopasowania ceny do rzeczywistego użycia. Tego samego dnia analiza OpenAI pokazuje, że sama zmiana konfiguracji API (zachowane rozumowanie, kompresja) potraja wynik GPT-5.6 Sol na ARC-AGI-3, jednocześnie dzieląc przez sześć zużycie tokenów wyjściowych — wydajność modelu zależy równie mocno od uprzęży, która go uruchamia, jak od samego modelu. Cognition wyciąga z tego natychmiastowy wniosek, aktualizując własny benchmark FrontierCode: przy nowych zniżkach GPT-5.6 znajduje się na krzywej Pareto koszt/wydajność.

Otwarte modele nadal doganiają modele zamknięte. Thinking Machines publikuje Inkling-Small ze wsparciem sprzętowym NVIDIA dostępnym od premiery; Sakana AI i NYU otwierają zbiór danych i modele generatywne dla Minecrafta; LightOn publikuje swoją kolekcję wielojęzycznych modeli wyszukiwania informacji — trzy odrębne laboratoria wybierają ten sam kanał, blog Hugging Face, aby tego samego dnia uruchomić i udokumentować swoje prace. Kimi K3 (Max), już prowadzący w rankingu Agent Arena, zajmuje też pierwsze miejsce w rankingu Fullstack Code Arena, wyprzedzając GPT-5.6 Sol i Claude Fable 5. A Together AI wraz z Y Combinator bierze się za to, co wciąż pozostaje prawdziwym wąskim gardłem tego ekosystemu: dostęp do mocy obliczeniowej, dostarczając dedykowany klaster GPU startupom AI z portfela YC bez zmuszania ich do wieloletnich zobowiązań.

Industrializacja agentów kodujących przyspiesza. W Cursor udział scalonych pull requestów pochodzących od agentów chmurowych wzrósł z 10% w grudniu do 56% dziś. GitHub uogólnia w publicznej wersji preview stacked pull requests, a Devin (Cognition) natywnie obsługuje je tego samego dnia — ten sam workflow przeglądu przyjmowany równocześnie po stronie platformy i po stronie agenta. Amp Labs z kolei sprzedaje teraz także ludzką obecność na miejscu (zespół on-site w Sydney dla Westpac) obok swojego agenta, a GitHub rozbudowuje Copilota w Visual Studio o nowego agenta opartego na swoim SDK. Genspark i Perplexity pracują nad pokrewnym problemem, czyli pamięcią: SecondBrain i Projects dają swoim agentom trwały kontekst między sesjami, co jest warunkiem wykonywania długich zadań bez zaczynania od zera za każdym razem.


Źródła