Szukaj

NVIDIA pozyskuje 500 miliardów dolarów na swoją infrastrukturę AI, Alibaba publikuje Qwen3.8-2.4T-A95B w otwartych wagach, Zed uruchamia Delta

Artykuł wygenerowany przez sztuczną inteligencję
NVIDIA pozyskuje 500 miliardów dolarów na swoją infrastrukturę AI, Alibaba publikuje Qwen3.8-2.4T-A95B w otwartych wagach, Zed uruchamia Delta

ai-powered-markdown-translator

Przetłumaczony artykuł z fr na pl za pomocą gpt-5.4-mini.

Zobacz projekt na GitHubie ↗

12 sierpnia 2026 roku NVIDIA ogłasza partnerstwa finansowe przekraczające 500 miliardów dolarów, aby zbudować infrastrukturę AI następnej dekady, podczas gdy Alibaba publikuje otwarte wagi Qwen3.8-2.4T-A95B, swojego modelu rozumowania o 2 400 miliardach parametrów. Zed ujawnia Delta, wieloosobowe środowisko do kodowania z agentami, Google DeepMind uruchamia SL2T do tłumaczenia języka migowego na tekst na Pixel 11, a Suno podpisuje globalne partnerstwo z BMG. Wśród nowości także: nowe otwarte modele w Cohere i Liquid AI, postępy po stronie narzędzi deweloperskich (Devin, Replit, GitHub Copilot) oraz badanie OpenAI dotyczące adopcji agentowej AI w przedsiębiorstwach.


NVIDIA mobilizuje ponad 500 miliardów dolarów na infrastrukturę AI

12 sierpnia — NVIDIA ogłasza partnerstwa z sześcioma dużymi graczami z sektora finansów i inwestycji — Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs i KKR — aby uruchomić niezależne platformy finansowania, których celem jest pozyskanie ponad 500 miliardów dolarów kapitału zewnętrznego. Cel: długofalowe wsparcie budowy „AI factories”, czyli ogromnych centrów danych przeznaczonych do treningu i inferencji modeli.

NVIDIA przedstawia ten ruch jako strukturalny zwrot dla branży: finansowanie wdrażania mocy obliczeniowych AI nie opierałoby się już wyłącznie na bilansach samych firm technologicznych, lecz odtąd korzystałoby z wyspecjalizowanych wehikułów finansowania, wspieranych przez czołowe instytucje finansowe, a nie tylko przez największe spółki sektora.

Ogłoszenie to wpisuje się w ciąg innych inicjatyw NVIDIA dotyczących infrastruktury, opisanych w ostatnich dniach: architektury zasilania 800 V prądem stałym dla przyszłych generacji akceleratorów oraz programu NSF regionalnych centrów AI w Stanach Zjednoczonych. Potwierdza ono skalę zapotrzebowania na kapitał, potrzebny do obsłużenia popytu na obliczenia, w momencie gdy wyścig o infrastrukturę AI przyspiesza u wszystkich największych dostawców chmury.

🔗 Oficjalny wpis NVIDIA


Alibaba publikuje otwarte wagi Qwen3.8-2.4T-A95B, modelu rozumowania o 2 400 miliardach parametrów

12 sierpnia — Alibaba publikuje otwarte wagi Qwen3.8-2.4T-A95B, flagowego modelu zapowiedzianego na początku sierpnia pod nazwą Qwen3.8-Max. Jest to faktyczne wydanie wag: model Mixture-of-Experts o drobnej ziarnistości, liczący łącznie 2 400 miliardów parametrów, z których 95 miliardów aktywuje się na token, przeznaczony do wymagających zadań rozumowania i agentowych.

Architektura przeplata pełne warstwy attention i attention liniowe: pierwsze zapewniają interakcję token-po-tokenie, drugie opierają się na ograniczonym stanie rekurencyjnym, aby kontrolować pamięć wraz ze wzrostem kontekstu. Model obsługuje okno kontekstu do 1 miliona tokenów, długość wyjścia do 128K tokenów oraz konfigurowalną kontrolę głębokości rozumowania (low/high/xhigh), co pozwala balansować koszt obliczeń i jakość odpowiedzi zależnie od zadania.

NVIDIA, która opisuje wdrożenie w osobnym wpisie technicznym, podaje natywną przepustowość przekraczającą 4 000 tokenów na sekundę na GPU na GB300 NVL72 (72 GPU Blackwell Ultra) w precyzji FP8, z planowanymi optymalizacjami NVFP4 w przyszłości.

Mierzony wskaźnikZmierzona wartość
Łączne / aktywne parametry2 400 miliardów / 95 miliardów
Okno kontekstudo 1 miliona tokenów
Przepustowość na GPUponad 4 000 tokenów/s (GB300 NVL72, FP8)
Przepustowość na użytkownikaponad 350 tokenów/s
Dostępność wagHugging Face, ModelScope

Wagi są dostępne na Hugging Face i ModelScope, z obsługiwanym wdrożeniem przez SGLang, vLLM, NVIDIA Dynamo i NVIDIA NIM; fine-tuning jest możliwy przez NVIDIA NeMo AutoModel (LoRA i SFT).

🔗 Ogłoszenie NVIDIA na X · Wpis techniczny NVIDIA


Zed uruchamia Delta, wieloosobowe środowisko do kodowania z agentami

12 sierpnia — Zed ujawnia Delta, wieloosobowe środowisko do kodowania z agentami i przeglądania tego, co tworzą. Produkt opiera się na DeltaDB, bazie danych zaprezentowanej we wczesnym dostępie na początku lipca pod nazwą „Google Docs dla kodu”. Delta stanowi jej pierwsze praktyczne zastosowanie, a pierwsze zaproszenia do prywatnej bety zostały wysłane od 12 sierpnia.

W Delta rozmowa z agentem sama staje się dokumentem: kursor działa wszędzie w wątku, z tymi samymi skrótami klawiaturowymi co w edytorze kodu. Aby odpowiedzieć na konkretny punkt, wystarczy ustawić na nim kursor i zacząć pisać, bez żadnych ograniczeń w obrębie wątku.

Przegląd odbywa się dokładnie tam, gdzie miała miejsce praca: agent, który napisał kod, pozostaje obecny w wątku, dzięki czemu można zadać mu bezpośrednio pytanie zamiast odtwarzać jego intencję na podstawie diffu. Wątek można udostępnić jednym kliknięciem, a członkowie zespołu uczestniczą w nim jak pełnoprawni uczestnicy — mogą przeglądać historię, współedytować prompty albo wrócić do pracy kilka dni później, nie zastanawiając się, czy ostatni kod został rzeczywiście zacommitowany.

Delta is built on DeltaDB, which keeps your code and conversation in sync for everyone in the thread, in real-time. It works with the git repo you already have. Every edit and conversation is captured between your commits.

🇵🇱 Delta opiera się na DeltaDB, które utrzymuje kod i rozmowę zsynchronizowane w czasie rzeczywistym dla wszystkich w wątku. Działa to z repozytorium git, które już masz. Każda edycja i każda rozmowa są przechwytywane między twoimi commitami.@zeddotdev na X

Zed stopniowo rozszerza zaproszenia w nadchodzących tygodniach; zapisy na listę oczekujących są otwarte.

🔗 Ogłoszenie na X


SL2T: Google DeepMind tłumaczy język migowy na tekst na Pixel 11

12 sierpnia — Google DeepMind przedstawia SL2T (sign-language-to-text), model, który bezpośrednio zamienia język migowy na tekst pisany. Funkcja trafia na Androida: użytkownicy mogą teraz komunikować się gestami bezpośrednio w Gboard i Live Transcribe zamiast pisać, do wyszukiwania w sieci, pisania wiadomości czy wysyłania zapytań do Gemini.

Technicznie system opiera się na modelu MediaPipe Holistic uruchamianym on-device, który śledzi pozycje ciała (dłonie, ramiona, tułów, głowę, twarz) zamiast zapisywać surowe wideo — oryginalny materiał wideo jest natychmiast usuwany, a na serwery w celu tłumaczenia trafiają wyłącznie geometryczne współrzędne pozycji. Takie podejście chroni prywatność, jednocześnie umożliwiając bezpośrednie tłumaczenie współrzędnych na tekst, bez pośrednich adnotacji, które dotąd ograniczały precyzję istniejących systemów.

Model został wytrenowany na ponad 100 000 godzin danych obejmujących ponad 50 języków migowych, z czego około 25% stanowi amerykański język migowy (ASL). Na benchmarku FLEURS-ASL SL2T osiąga wynik zero-shot 70 BLEURT, który Google DeepMind określa jako znacząco lepszy od wszystkich wcześniej raportowanych wyników.

W prace rozwojowe na każdym etapie była zaangażowana społeczność osób niesłyszących poprzez dedykowany komitet doradczy, który współtworzył wspólny raport o wpływie, opisujący możliwości i ograniczenia systemu. Funkcja startuje z ASL na angielski na Pixel 11, a w przyszłości planowana jest obsługa innych urządzeń i języków migowych.

SL2T is state-of-the-art on academic benchmarks, plus it’s optimized for real-world use like one-handed signing while holding a phone. To protect privacy, it tracks body poses on-device, while our servers translate them into text.

🇵🇱 SL2T osiąga stan sztuki w benchmarkach akademickich i jest zoptymalizowany pod rzeczywiste użycie, na przykład do migania jedną ręką podczas trzymania telefonu. Aby chronić prywatność, śledzi on pozy ciała na urządzeniu, a nasze serwery tłumaczą te dane na tekst.@GoogleDeepMind na X

🔗 Oficjalne ogłoszenie Google DeepMind


Suno ogłasza globalne partnerstwo z BMG

12 sierpnia — Suno ogłasza globalne partnerstwo z BMG (Bertelsmann Music Group), jedną z największych na świecie wytwórni płytowych i firm wydawnictwa muzycznego. Firma określa tę umowę jako „landmark” (kamień milowy) w budowie ekosystemu kreatywnego, który łączy artystów i autorów piosenek zamiast ich omijać.

Partnerstwo to wpisuje się w szczególny kontekst: w latach 2024–2025 Suno było przedmiotem pozwów ze strony trzech największych koncernów fonograficznych — Universal Music Group, Warner Music Group i Sony Music — za nieautoryzowane wykorzystanie chronionych nagrań podczas trenowania swoich modeli. Umowa z BMG oznacza więc strategiczny zwrot w stronę negocjowanych relacji licencyjnych z branżą muzyczną zamiast sporu sądowego, trendu już zainicjowanego po stronie wideo przez umowę między Runway a Bertelsmann w lipcu — a BMG właśnie wchodzi w skład tej grupy.

Komunikat nie podaje szczegółów finansowych ani dokładnego zakresu umowy (katalog dostępny do treningu, wynagrodzenie dla uprawnionych podmiotów, narzędzia proponowane artystom BMG). Te elementy mają zostać doprecyzowane w nadchodzących oficjalnych komunikatach Suno i BMG.

🔗 Ogłoszenie na X


Narzędzia deweloperskie oparte na agentach: Devin, Replit, VS Code i JetBrains

Kilka narzędzi deweloperskich wspieranych przez AI rozwija się równolegle 12 sierpnia, między nowymi dostępnymi modelami, kontrolą infrastruktury i standaryzacją wtyczek agentowych.

Grok 4.6 dostępny w Devin, Cognition klasyfikuje go poniżej Opus 5 i Fable 5

Cognition dodaje Grok 4.6 (xAI, ogłoszony tego samego dnia) jako model dostępny w Devin. Zespół pozycjonuje go jako znaczącą poprawę względem Grok 4.5, stawiając go przed GPT-5.6 Sol i tuż za Opus 5 oraz Fable 5 w swoim wewnętrznym rankingu. Cognition podkreśla szczególną moc w dogłębnym eksplorowaniu kodu i analizie przyczyny źródłowej przed jakąkolwiek modyfikacją — to istotne w złożonych zadaniach debugowania, gdzie Devin musi zrozumieć system, zanim go ruszy.

🔗 Ogłoszenie na X

Replit pozwala wybrać region hostingu workspace’ów (Pro/Enterprise)

Replit udostępnia klientom Pro i Enterprise możliwość wyboru regionu hostingu dla nowych workspace’ów: Ameryka Północna, Europa i Azja. Cel jest dwojaki: zmniejszyć odczuwalne opóźnienia podczas pracy i dać kontrolę nad lokalizacją danych oraz podglądów opublikowanych aplikacji, co często jest wymagane w środowisku korporacyjnym (zgodność, bliskość użytkowników). Funkcja dołącza do już istniejącej możliwości wyboru regionu opublikowanych aplikacji i jest dostępna natychmiast dla kwalifikujących się kont.

🔗 Ogłoszenie na X

Agent Plugins 1.0 trafia do VS Code, Copilot CLI i aplikacji Copilot

Otwarty standard Agent Plugins 1.0, opublikowany 6 sierpnia wspólnie z AWS, Anysphere (Cursor), Microsoftem, OpenAI i Vercel — a od tego czasu dołączony także przez Google jako maintainer — trafia teraz do VS Code, Copilot CLI i aplikacji Copilot. Jeden raz spakowana wtyczka (umiejętności agenta + serwery MCP) może być instalowana z marketplace’u Awesome Copilot i działa bez zmian w wielu kompatybilnych klientach, bez obowiązkowej migracji istniejących wtyczek Copilot. Dla firm zarządzanie odbywa się przez managed-settings.json, dostępne w planach Copilot Business i Enterprise.

🔗 Changelog GitHub

Copilot dla JetBrains zyskuje trwałą pamięć i dostęp do lokalnego Ollama

GitHub Copilot dla JetBrains otrzymuje dużą aktualizację: trwała pamięć pozwala teraz zachowywać i przywoływać przydatne informacje z jednej sesji czatu agentowego do następnej, eliminując potrzebę powtarzania kontekstu projektu lub preferencji. Kolejną istotną nowością jest to, że Ollama staje się dostawcą BYOK (Bring Your Own Key), dając dostęp do modeli uruchamianych lokalnie bezpośrednio w selektorze modeli JetBrains. Firmy zyskują też kontrole serwerowe nad dostępnością wtyczek, dostępem MCP i zachowaniem omijania uprawnień.

🔗 Changelog GitHub


Otwarty modele i AI na urządzeniu

Po stronie modeli kilka laboratoriów publikuje jedne po drugich otwarte wersje zoptymalizowane pod inferencję lokalną i rozumienie dokumentów.

Hugging Face: Transformers.js przekracza 10 milionów miesięcznych pobrań

Clément Delangue, prezes Hugging Face, ogłasza, że Transformers.js, biblioteka pozwalająca uruchamiać modele AI bezpośrednio w przeglądarce, przekracza próg 10 milionów miesięcznych pobrań — to wzrost bliski 10x w zaledwie sześć miesięcy, rozwijany wewnętrznie od trzech lat. Delangue wiąże ten wzrost z szerszym trendem: przenoszeniem coraz większej części obciążeń AI na lokalne środowiska, z powodów kosztowych, prywatności i odporności na braki mocy obliczeniowej. Komunikat nie zawiera dodatkowych szczegółów technicznych: to ogłoszenie o dynamice projektu już istniejącego.

🔗 Oficjalny tweet

Ai2: OlmoEarth Studio umożliwia teraz eksport niestandardowych embeddingów

Ai2 (Allen Institute for AI) dodaje do OlmoEarth Studio obliczanie i eksport wektorów embeddingów obserwacji Ziemi w trzech wariantach: Nano (128 wymiarów, 1,4 miliona parametrów), Tiny (192 wymiary, 6,2 miliona) oraz Base (768 wymiarów, 89 milionów). Wektory, przechowywane w formacie Cloud-Optimized GeoTIFF, mogą być bezpośrednio używane w standardowych narzędziach GIS (QGIS, GDAL, rasterio). Pokazane przypadki użycia obejmują wyszukiwanie podobieństwa, segmentację few-shot — mapa pokrycia terenu wytrenowana na 60 oznaczonych pikselach osiąga ważony F1 na poziomie 0,84 — oraz wykrywanie zmian w czasie. Modele i kod zostały opublikowane na Hugging Face i GitHub.

🔗 Wpis Hugging Face

Liquid AI: LFM2.5-VL-3B, model vision-language dla edge

Liquid AI publikuje LFM2.5-VL-3B, model vision-language o 3,1 miliarda parametrów zoptymalizowany pod inferencję na urządzeniu. Łączy on encoder wizualny SigLIP2 400M z tekstowym backbone’em o 2,6 miliarda parametrów, wytrenowanym na około 34 000 miliardów tokenów. W benchmarkach uzyskuje 81,0% na MMBench (wobec 80,0% w poprzedniej wersji), 87,9% w lokalizacji RefCOCO oraz 91,1% w DocVQA. Jeśli chodzi o szybkość: 228 tokenów/sekundę na CPU (M5 Max) i 20 tokenów/sekundę na urządzeniach mobilnych (Galaxy S26 Ultra), przy zużyciu pamięci około 3 GB. Model jest dostępny na Hugging Face z integracjami llama.cpp, MLX, vLLM i SGLang.

🔗 Wpis Hugging Face

Cohere uruchamia North Micro Vision, swój najmniejszy model vision-language

Cohere rozszerza swoją rodzinę modeli North o North Micro Vision, swój najmniejszy dotąd model vision-language. Ten model o 2,4 miliarda parametrów został zaprojektowany do zaawansowanego rozumienia dokumentów i udostępniony jako open source na licencji Apache 2.0, a jego wagi są dostępne na Hugging Face. Mimo niewielkich rozmiarów obsługuje przetwarzanie obrazu w natywnej rozdzielczości, wieloturowe rozmowy łączące obraz i tekst, rozumowanie przestrzenne oraz wielojęzyczne rozumienie obrazów. Cohere twierdzi, że przewyższa Gemma 4 E2B i Ministral 3 3B w szerokim zakresie benchmarków rozumienia wizualnego, nie podając jednak w ogłoszeniu dokładnych liczb.

🔗 Ogłoszenie na X


Połączone asystenty: Gemini i Runway rozszerzają swoje integracje

Gemini dodaje 14 nowych połączonych aplikacji

Google rozszerza listę aplikacji, które można łączyć bezpośrednio z Gemini z poziomu ustawień: 14 nowych usług dołącza do katalogu, w tym Zoho Bigin, Granola, Wix, GetYourGuide, Ticketmaster, OpenTable, Pandora, iHeartRadio, Thumbtack, Zocdoc oraz Otter.ai. Po połączeniu usługi wystarczy poprosić Gemini, na przykład: „Znajdź wizytę u okulisty blisko pracy na Zocdoc”, aby asystent bezpośrednio z nią współpracował. Wdrażanie odbywa się stopniowo w ciągu najbliższych tygodni, kontynuując strategię Google polegającą na uczynieniu z Gemini jednego punktu dostępu do wielu usług zewnętrznych.

🔗 Oficjalne ogłoszenie Google

Runway łączy Agent z Figma, Dropbox i Notion

Runway dodaje do Agenta, swojego zintegrowanego z platformą asystenta produkcyjnego, łączniki Figma, Dropbox i Notion, aby zasoby kreatywne nie pozostawały odizolowane w oddzielnych narzędziach. Agent może teraz bezpośrednio synchronizować projekty, pliki i dokumenty z tych zewnętrznych platform do jednego obszaru roboczego. Funkcja jest dostępna na wszystkich płatnych planach, zgodnie ze strategią Runway polegającą na uczynieniu z Agenta centralnego centrum produkcji medialnej, połączonego z istniejącym ekosystemem narzędzi zespołów kreatywnych.

🔗 Ogłoszenie na X


Badanie OpenAI dotyczące adopcji agentowej AI w przedsiębiorstwach

OpenAI publikuje dwa uzupełniające się badania dotyczące wykorzystania AI w przedsiębiorstwach: „Enterprise Signals”, praktyczny obraz agentowej AI u swoich klientów, oraz towarzyszący working paper o rozprzestrzenianiu się adopcji między firmami, zawodami i poziomami seniority. Główny wniosek: wykorzystanie przesuwa się z asysty do wykonywania zadań. W czerwcu Codex wygenerował 64% łącznego wolumenu tokenów wytwarzanych przez Codex i ChatGPT u klientów enterprise. Różnica między najbardziej zaawansowanymi firmami a resztą rośnie: „frontier firms” (top 10% pod względem miesięcznego użycia) generują teraz 8,3 razy więcej tokenów wyjściowych na aktywnego użytkownika niż typowe przedsiębiorstwa, wobec współczynnika 2,6 w styczniu. Od lutego liczba tygodniowych użytkowników Codex w przedsiębiorstwach wzrosła 108-krotnie w sektorze prawnym i 41-krotnie w sprzedaży, wobec 5-krotnego wzrostu w inżynierii.

🔗 Pełne badanie OpenAI


Krótkie informacje

  • Grok 4.6 dostępny w v0 (Vercel) — tego samego dnia co ogłoszenie xAI, v0 dodaje Grok 4.6 do selektora modeli do generowania aplikacji. 🔗 Tweet
  • Open_MOSS publikuje wersje FP8/NF4 modelu MOSS-VL — kwantyzowane wersje MOSS-VL-Instruct i MOSS-VL-Realtime do lokalnej inferencji przy zaledwie 24 GB VRAM. 🔗 Tweet
  • Google AI Studio oferuje wizualizator 3D całkowitego zaćmienia Słońca z 12 sierpnia — śledzenie w czasie rzeczywistym cienia Księżyca na globie, z symulacją lokalnego nieba z Reykjavíku lub Walencji. 🔗 Tweet
  • GitHub Enterprise Server 3.22 w wersji release candidate — Copilot CLI w środowisku odłączonym od sieci, Enterprise Teams w powszechnej dostępności oraz dopracowane kontrolki dla secret scanning i rulesets. 🔗 Changelog
  • Rule insights dostępne na poziomie organizacji (publiczna wersja preview) — panel audytu rulesets wychodzi poza poziom repository, z eksportem CSV. 🔗 Changelog
  • Automatyczna migracja reguł ochrony gałęzi do rulesets — przycisk „Convert to ruleset” automatycznie tłumaczy klasyczną regułę na równoważny ruleset. 🔗 Changelog
  • Seedance 2.5 trafia do agenta wideo AI od Genspark — generowanie 30 sekund w jednym przebiegu, do 30 obrazów oraz 10 referencyjnych klipów wideo/audio. 🔗 Tweet
  • Genspark w Grant Thornton — przyspieszone generowanie propozycji — firma generuje odpowiedzi na przetargi na podstawie jednego promptu, z systematycznym ludzkim przeglądem. 🔗 Tweet
  • GitHub Monthly Enterprise Roundup — wydanie sierpień 2026 — roundup podkreśla przejście AI od uzupełniania kodu do kompleksowych, zarządzanych workflowów inżynieryjnych. 🔗 Tweet
  • LTX-2.5 dostępny na Runway — otwarty world model od Lightricks, opublikowany 11 sierpnia, trafia do katalogu modeli Runway. 🔗 Tweet
  • FLUX 3 dostępny na Luma — pierwszy zunifikowany model multimodalny Black Forest Labs (obraz, wideo, audio) trafia do Luma, z natywnym generowaniem wideo do audio. 🔗 Tweet
  • Nemotron 3.5 Lightning dostępny w Agent API Perplexity — otwarty model 30B MoE od NVIDIA dołącza do warstwy wykonywania o dużym wolumenie dla agentów Perplexity. 🔗 Tweet
  • Qwen-Image-3.0 dostępny na OpenArt — model generowania obrazów od Alibaba rozszerza dystrybucję na nową platformę zewnętrzną. 🔗 Tweet
  • Qwen3.8-Max awansuje na 4. miejsce w Legal Research Bench — model przechodzi z 22. na 4. pozycję w tym specjalistycznym rankingu badań prawnych. 🔗 Tweet
  • Modele Daybreak (cyberbezpieczeństwo) dostępne przez Amazon Bedrock — Daybreak Blue i Daybreak Red od OpenAI dostępne dla uprawnionych obrońców bezpośrednio z konsoli Bedrock. 🔗 OpenAI

Co to oznacza

Finansowanie infrastruktury AI zmienia skalę: 500 miliardów dolarów zmobilizowanych przez NVIDIA od tradycyjnych podmiotów finansowych (Apollo, BlackRock, Goldman Sachs, KKR…) oznacza przejście od modelu finansowanego wyłącznie z bilansów firm technologicznych do dedykowanych wehikułów kapitałowych. Ten makroekonomiczny ruch łączy się z bardziej konkretną rzeczywistością: Qwen3.8-2.4T-A95B, opublikowany tego samego dnia, działa natywnie z prędkością ponad 4 000 tokenów na sekundę na GPU na infrastrukturze NVIDIA GB300 — apetyt na kapitał i zapotrzebowanie na obliczenia wzajemnie się napędzają, a każdy nowy masywny model jeszcze bardziej uzasadnia zapowiedziane inwestycje.

Otwarcie wag nadal rozszerza się na wszystkich skalach: od granicznego modelu Alibaba o 2 400 miliardach parametrów po mały vision-language model Cohere o 2,4 miliarda parametrów, a także LFM2.5-VL-3B od Liquid AI, zaprojektowany do działania na telefonach. Ta dywersyfikacja według rozmiaru — nie tylko według wydajności — potwierdza dynamikę mierzoną przez Hugging Face: Transformers.js był pobierany 10 milionów razy miesięcznie, czyli prawie 10 razy więcej niż sześć miesięcy temu, co dowodzi, że lokalna inferencja wychodzi ze stadium eksperymentalnego i staje się pełnoprawną opcją produkcyjną.

Narzędzia programistyczne wspierane przez AI zbliżają się do bogatszych formatów współpracy. Zed przekształca wymianę z agentem w współdzielony i wersjonowany dokument za pomocą Delta, GitHub standaryzuje wtyczki agentów w VS Code, Copilot CLI i JetBrains poprzez Agent Plugins 1.0, a Devin i v0 integrują Grok 4.6 w dniu jego premiery w xAI. Wspólny mianownik: narzędzia te przestają być jedynie odizolowanymi asystentami, a stają się warstwami interoperacyjnej infrastruktury, gdzie wybór modelu bazowego i pamięć między sesjami liczą się równie mocno jak samo generowanie kodu.

Wreszcie, AI coraz głębiej wnika w codzienne zastosowania i relacje przemysłowe negocjowane raczej niż narzucane. SL2T od Google DeepMind tłumaczy język migowy bezpośrednio na Pixel 11, wykorzystując architekturę zaprojektowaną z myślą o prywatności, Gemini i Runway rozszerzają swoje łączniki o dziesiątki usług zewnętrznych, a Suno podpisuje z BMG umowę licencyjną, która kontrastuje z pozwami sądowymi z lat 2024–2025 — to sygnał, że branża muzyczna negocjuje dziś z modelami generatywnymi zamiast systematycznie z nimi walczyć. Po stronie enterprise badanie OpenAI potwierdza, że to przejście do agentowego wykonywania zadań już wyraźnie pogłębia się między najbardziej zaawansowanymi organizacjami a resztą.


Źródła