ai-powered-markdown-translatorArtykuł przetłumaczony z francuskiego na polski za pomocą gpt-5.6-sol.
11 lipca agenci wychodzą poza kod i zaczynają oddziaływać na rzeczywisty świat: Replit łączy swojego agenta z Ramp, aby autonomicznie zakładać spółki oraz zarządzać środkami pieniężnymi, fakturami i wydatkami, GitHub publikuje open source dataset ponad 40 milionów repozytoriów dotyczący rozkładu językowego kodu, a HeyGen ogłasza dwie nowości dla deweloperów — przezroczysty materiał wideo WebM oraz automatyczny montaż zsynchronizowany z nagraniami mówionymi. Pika demonstruje z kolei zaawansowane możliwości edycji wideo za pomocą modelu, który nazywa „Gemini Omni” — nazwy, której Google dotychczas nie potwierdził. Obraz uzupełnia pięć krótkich wiadomości, od telefonicznej linii głosowej Together AI po partnerstwo infrastrukturalne Cohere z NVIDIA i CoreWeave.
Replit uruchamia Ramp for Agents: jego agenci zarządzają teraz finansami przedsiębiorstwa
11 lipca — Replit ogłosił partnerstwo z Ramp, platformą do zarządzania finansami i kartami firmowymi, dzięki któremu jego agent może wyjść poza generowanie kodu i zajmować się rzeczywistymi formalnościami finansowymi. W praktyce agent Replit może teraz pomóc w założeniu spółki (inkorporacji), złożyć wniosek o konto Ramp dla tego podmiotu, a następnie przygotować przedsiębiorstwo do wydawania pieniędzy, opłacania faktur i zarządzania środkami pieniężnymi — wszystko w ramach rozmowy w języku naturalnym.
Premiera wpisuje się w dotychczasową strategię Replit, który udostępnił już swojego agenta w obszarze e-commerce (integracja z Shopify, czerwiec 2026) oraz zwiększania widoczności (SEO Agent, czerwiec 2026). Produkt korzysta ze specjalnej strony obsługiwanej przez Ramp, „Finance for the Agent Economy”, która zapewnia agentom karty, przelewy i konta bankowe wraz z wbudowanymi mechanizmami kontroli każdego wydanego dolara.
“Ramp for Agents.
Replit Agent can now incorporate your company, apply for Ramp, and get your business ready to spend, pay bills, and manage money.
Every company used to start with paperwork. The next one starts with a prompt.”
🇵🇱 Ramp for Agents. Agent Replit może teraz założyć Twoją spółkę, złożyć wniosek o konto Ramp i przygotować Twoje przedsiębiorstwo do wydawania pieniędzy, opłacania faktur i zarządzania środkami pieniężnymi. Kiedyś każde przedsiębiorstwo zaczynało od dokumentów — następne zaczyna się od promptu. — @Replit na X
GitHub publikuje Multilingual Repositories Dataset
11 lipca — GitHub opublikował GitHub Multilingual Repositories Dataset, nowy open source dataset przeznaczony dla badaczy i deweloperów pracujących nad wielojęzyczną AI. Obejmuje on ponad 40 milionów repozytoriów i ponad 80 milionów wierszy klasyfikacji, wskazując, gdzie na platformie znajdują się pliki README, issues i pull requests napisane w językach innych niż angielski.
| Mierzony wskaźnik | Zmierzona wartość |
|---|---|
| Objęte repozytoria | 40M+ |
| Wiersze klasyfikacji | 80M+ |
| Repozytoria z README po portugalsku (język wiodący) | 3M+ |
| Język dominujący w tekstach issues | Koreański |
Liczby wyróżnione przez GitHub ujawniają konkretne trendy językowe: język koreański dominuje w tekstach issues, podczas gdy portugalski zajmuje pierwsze miejsce w plikach README, występując w ponad 3 milionach repozytoriów. Nie jest to funkcja Copilot w ścisłym znaczeniu, lecz publikacja badawcza i zbiór otwartych danych, zgodne z pozycjonowaniem GitHub jako platformy deweloperskiej napędzanej przez AI.
🔗 Tweet @github — Multilingual Repositories Dataset
Pika edytuje filmy za pomocą modelu, który nazywa „Gemini Omni”
11 lipca — Pika opublikowała demonstrację wideo prezentującą zaawansowane funkcje edycji zastosowane do filmu przesłanego przez użytkownika: zmianę tła, kąta kamery i stroju, dodawanie efektów wizualnych, a nawet dubbing głosu w języku francuskim — wszystko przedstawione przez Pika jako możliwe „with Gemini Omni”.
“Drop in your video and change the background, change the angle, swap the outfit, add visual effects, even make it speak French — all with Gemini Omni”
🇵🇱 Prześlij swój film i zmień tło, zmień kąt, zmień strój, dodaj efekty wizualne, a nawet spraw, by mówił po francusku — wszystko dzięki Gemini Omni. — @pika_labs na X
Zastrzeżenie redakcyjne: nazwa „Gemini Omni” nie pojawia się dotychczas w żadnym oficjalnym komunikacie Google ani DeepMind — przegląd poświęcony ogłoszeniom dotyczącym Gemini nie wykazał żadnych nowych informacji 11 lipca. Jest to nazwa używana przez samą Pika na określenie modelu stanowiącego podstawę tej funkcji; jego istnienie i dokładna natura nie zostały niezależnie potwierdzone. Tę wiadomość należy traktować jako funkcję zapowiedzianą przez Pika, a nie jako premierę produktu potwierdzoną przez Google.
Umiarkowane zaangażowanie jak na to konto (15 000 wyświetleń, 80 polubień), wyraźnie poniżej najważniejszych publikacji Pika — co sugeruje zapowiedź funkcji, a nie premierę flagowego produktu.
HeyGen wzmacnia swój ekosystem deweloperski: przezroczyste wideo i automatyczny montaż
Dwa ogłoszenia HeyGen tego samego dnia: jedno dotyczące formatu wyjściowego wideo, drugie automatyzacji montażu.
Przezroczysty materiał wideo WebM przez API, CLI i MCP
11 lipca — HeyGen ogłosił nową opcję wyjściową wideo w swoim API, CLI i serwerze MCP: format WebM z przezroczystym kanałem alfa. Po ustawieniu parametru output_format: "webm" w endpointcie /v3/videos wygenerowane filmy z awatarami są zwracane z rzeczywiście przezroczystym tłem (natywnym kanałem alfa), bez konieczności używania zielonego tła (green screen) i późniejszego wycinania.
Funkcja jest przeznaczona dla deweloperów, którzy umieszczają filmy z awatarami w większych produkcjach — montażach, nakładkach i scenach 3D. Powiązany wątek przedstawia konkretny przykład: awatar wkomponowany bezpośrednio w scenę three.js w stylu Minecraft.
🔗 Tweet @HeyGen — przezroczysty materiał WebM
„Talking-Head-Recut Skill” synchronizuje elementy graficzne z nagraniem mówionym
11 lipca — Szósty odcinek serii codziennych demonstracji dotyczących HyperFrames, środowiska produkcji wideo sterowanego przez agenta od HeyGen: „Talking-Head-Recut Skill” nakłada elementy graficzne (animowane tytuły, liczniki, karty i cytaty) na film typu „gadająca głowa”, automatycznie synchronizując je z wypowiadaną treścią. Agent odczytuje transkrypcję, decyduje, które elementy zasługują na oprawę graficzną, a następnie projektuje każdą kartę zgodnie z dostarczoną identyfikacją wizualną.
Demonstracja pokazuje cały proces od początku do końca na podstawie jednego promptu: wyszukanie aktualnego tematu (ogłoszenie GPT-5.6 przez OpenAI), skrypt oparty na źródłach, awatar wygenerowany bezpośrednio z CLI HeyGen, identyfikacja wizualna pobrana na żywo z chatgpt.com, a następnie finalny rendering z napisami i muzyką — bez edytora wideo i kamery. Skill jest udokumentowany jako open source na GitHub.
🔗 Tweet @HeyGen — Talking-Head-Recut Skill 🔗 GitHub — skill talking-head-recut
W skrócie
- Together AI uruchamia telefoniczną linię głosową — minimalistyczny tweet („Po co pisać, skoro można zadzwonić?”) odsyła do
docs.together.ai/call, który otwiera dialer telefoniczny (+1 415-723-8167, wew. 676), łączący dzwoniącego z asystentem głosowym napędzanym przez platformę inferencyjną Together AI; nie opublikowano powiązanego wpisu na blogu. 🔗 Tweet @togethercompute - Pika udostępnia eksperymentalny serwer MCP —
experiment.pika.art(„Pika MCP – Dodaj kreatywności swojemu agentowi”) umożliwia agentom AI bezpośrednie wywoływanie kreatywnych funkcji generowania i edycji wideo Pika z poziomu ich środowiska agentowego. 🔗 Tweet @pika_labs - MiniMax i Fireworks AI optymalizują kernel M3 na Blackwell — nowy kernel „KV-stationary”, opracowany przez Fireworks AI dla otwartego modelu M3 od MiniMax, odczytuje każdy wybrany blok tylko raz, zachowując korzyści wynikające z sparse attention i osiągając około 980 TFLOP/s na GPU B200. 🔗 Tweet @MiniMax_AI
- GPT-Live wdrożony w 100% na całym świecie — funkcja głosowa full-duplex OpenAI, uruchomiona 8 lipca, osiągnęła pełne wdrożenie w ChatGPT; OpenAI tymczasowo podwaja limit korzystania z funkcji głosowych na weekend 11–12 lipca. 🔗 Tweet @athyuttamre
- Cohere podkreśla swoje partnerstwo z NVIDIA i CoreWeave — komunikacja korporacyjna na X dotycząca niezawodności i ochrony infrastruktury dla dużych przedsiębiorstw wdrażających AI, bez szczegółów technicznych ani powiązanego artykułu. 🔗 Tweet @cohere
Co to oznacza
Produkcja wideo staje się pipeline’em w pełni sterowanym przez agenta, od montażu po dystrybucję. HeyGen eliminuje klasyczny etap techniczny — wycinanie zielonego tła — udostępniając natywny kanał alfa przez API, CLI i MCP, a także automatyzuje synchronizację elementów graficznych z nagraniami mówionymi za pomocą Talking-Head-Recut Skill: jeden prompt wystarcza teraz do stworzenia opartego na źródłach filmu z oprawą graficzną i napisami, bez kamery ani edytora. Pika rozwija tę samą koncepcję w postprodukcji, wykorzystując model, który nazywa „Gemini Omni”, do zmiany tła, kąta i stroju w istniejącym filmie — nazwa ta, wobec braku oficjalnego potwierdzenia ze strony Google, ilustruje również tendencję do nadawania komponentom technicznym efektownych nazw, aby stworzyć wrażenie większej mocy, co należy traktować z należytą ostrożnością.
Agenci wychodzą poza kod i wkraczają w administrację oraz finanse przedsiębiorstw. Ramp for Agents pozwala agentowi Replit zakładać spółki, otwierać konta Ramp oraz zarządzać środkami pieniężnymi i fakturami — na obszarze, który do tej pory pozostawał domeną ludzi. Ten sam kierunek, choć na mniejszą skalę, widać w Pika MCP, który udostępnia kreatywne możliwości Pika zewnętrznym agentom AI za pośrednictwem eksperymentalnego serwera MCP: agent nie tylko tworzy, lecz także koordynuje usługi podmiotów trzecich w imieniu użytkownika.
Fundamenty wielojęzycznej AI i inferencji na dużą skalę stają się coraz bardziej otwarte. Multilingual Repositories Dataset od GitHub dokumentuje na podstawie 40 milionów repozytoriów, gdzie faktycznie występują język koreański, portugalski i inne języki w globalnym kodzie — to zasób dla każdego badacza pracującego nad modelami wielojęzycznymi. Kernel KV-stationary opracowany przez Fireworks AI dla M3 od MiniMax ilustruje podobną pracę nad infrastrukturą inferencyjną, zachowując na Blackwell teoretyczne korzyści wynikające ze sparse attention. Rozszerzone partnerstwo Cohere z NVIDIA i CoreWeave dopełnia ten obraz: niezawodność infrastruktury staje się samodzielnym argumentem sprzedażowym dla AI dla przedsiębiorstw.
Głos umacnia się jako pełnoprawny kanał produktu, a nie jedynie funkcja dodatkowa. GPT-Live osiąga pełne wdrożenie w OpenAI zaledwie trzy dni po premierze, z podwojonymi limitami zachęcającymi do wypróbowania; Together AI z kolei uruchamia linię telefoniczną, która bezpośrednio łączy dzwoniącego z asystentem głosowym napędzanym przez jej platformę inferencyjną. Dwa różne podejścia — jedno zintegrowane z istniejącą aplikacją, drugie dostępne ze zwykłego telefonu — oparte na tym samym założeniu: interfejs głosowy staje się pełnoprawnym punktem dostępu do modeli, a nie tylko jedną z wielu opcji.
Źródła
- Tweet @Replit — Ramp for Agents
- Tweet @github — Multilingual Repositories Dataset
- Tweet @pika_labs — edycja wideo za pomocą „Gemini Omni”
- Tweet @HeyGen — przezroczysty materiał WebM
- Tweet @HeyGen — Talking-Head-Recut Skill
- GitHub — skill talking-head-recut
- Tweet @togethercompute — telefoniczna linia głosowa
- Tweet @pika_labs — Pika MCP
- Tweet @MiniMax_AI — kernel M3 na Blackwell
- Tweet @athyuttamre — GPT-Live wdrożony w 100%
- Tweet @cohere — partnerstwo z NVIDIA i CoreWeave