ai-powered-markdown-translatorPrzetłumaczony artykuł z fr na pl za pomocą gpt-5.4-mini.
11 lipca agenci wychodzą poza kod, by dotykać świata rzeczywistego: Replit łączy swojego agenta z Ramp, aby autonomicznie zakładać spółki oraz zarządzać gotówką, fakturami i wydatkami, GitHub publikuje open source’owy zbiór danych obejmujący ponad 40 milionów repozytoriów o rozkładzie językowym kodu, a HeyGen ogłasza dwa developerowe komunikaty — przezroczyste wyjście wideo WebM oraz automatyczny montaż zsynchronizowany z nagranymi filmami mówionymi. Pika z kolei demonstruje zaawansowane możliwości edycji wideo za pomocą modelu, który nazywa „Gemini Omni”, co jak dotąd nie zostało potwierdzone przez Google. Pięć krótkich wiadomości dopełnia obraz, od linii telefonicznej Together AI po partnerstwo infrastrukturalne Cohere z NVIDIA i CoreWeave.
Replit uruchamia Ramp for Agents: jego agenci zarządzają teraz finansami firmy
11 lipca — Replit ogłosił partnerstwo z Ramp, platformą do zarządzania finansami i kartami firmowymi, umożliwiając swojemu agentowi wyjście poza generowanie kodu i przejęcie rzeczywistych działań finansowych. W praktyce agent Replit może teraz pomóc w założeniu spółki (incorporation), złożyć wniosek o konto Ramp dla tego podmiotu, a następnie przygotować firmę do wydawania pieniędzy, opłacania faktur i zarządzania gotówką — wszystko z poziomu rozmowy w języku naturalnym.
Premiera wpisuje się w kontynuację strategii Replit, który wcześniej otworzył swojego agenta na e-commerce (integracja Shopify, czerwiec 2026) oraz na wykrywalność (SEO Agent, czerwiec 2026). Produkt korzysta z dedykowanej strony obsługiwanej przez Ramp, „Finance for the Agent Economy”, która dostarcza agentom karty, przelewy i konta bankowe wraz z wbudowanymi kontrolami ograniczającymi każdą wydaną złotówkę.
“Ramp for Agents.
Agent Replit może teraz założyć twoją spółkę, złożyć wniosek o Ramp i przygotować twoją firmę do wydawania pieniędzy, opłacania rachunków oraz zarządzania finansami.
Every company used to start with paperwork. The next one starts with a prompt.”
🇵🇱 Ramp for Agents. Agent Replit może teraz założyć twoją spółkę, złożyć wniosek o Ramp i przygotować twoją firmę do wydawania pieniędzy, opłacania rachunków oraz zarządzania finansami. Każda firma kiedyś zaczynała od papierkowej roboty — następna zaczyna od promptu. — @Replit na X
GitHub publikuje Multilingual Repositories Dataset
11 lipca — GitHub opublikował GitHub Multilingual Repositories Dataset, nowy open source’owy zbiór danych przeznaczony dla badaczy i deweloperów pracujących nad wielojęzyczną AI. Obejmuje on ponad 40 milionów repozytoriów i ponad 80 milionów wierszy klasyfikacji, mapując, gdzie na platformie znajdują się README, issues i pull requesty napisane w języku innym niż angielski.
| Mierzony wskaźnik | Zmierzona wartość |
|---|---|
| Repozytoria objęte analizą | 40M+ |
| Wiersze klasyfikacji | 80M+ |
| Repozytoria README w portugalskim (dominujący język) | 3M+ |
| Dominujący język tekstów issues | Koreański |
Dane wyróżnione przez GitHub ujawniają konkretne trendy językowe: koreański dominuje w tekstach issues, podczas gdy portugalski prowadzi w README, z ponad 3 milionami objętych repozytoriów. Nie jest to funkcja Copilot jako taka, lecz publikacja badawcza i danych otwartych, zgodna z pozycjonowaniem GitHub jako platformy deweloperskiej napędzanej przez AI.
🔗 Tweet @github — Multilingual Repositories Dataset
Pika edytuje wideo za pomocą modelu, który nazywa „Gemini Omni”
11 lipca — Pika opublikowała demonstrację wideo pokazującą zaawansowane funkcje edycji zastosowane do filmu wgranego przez użytkownika: zmianę tła, zmianę kąta kamery, zmianę stroju, dodawanie efektów wizualnych, a nawet dubbing głosu na francuski — wszystko przedstawione przez Pika jako możliwe „with Gemini Omni”.
“Drop in your video and change the background, change the angle, swap the outfit, add visual effects, even make it speak French — all with Gemini Omni”
🇵🇱 Zaimportuj swój film i zmień tło, zmień kąt, zmień strój, dodaj efekty wizualne, a nawet spraw, by mówił po francusku — wszystko dzięki Gemini Omni. — @pika_labs na X
Ostrożność redakcyjna: nazwa „Gemini Omni” nie pojawia się dziś w żadnym oficjalnym ogłoszeniu Google ani DeepMind — dedykowany skan ogłoszeń Gemini nie wykazał żadnej nowości tego 11 lipca. To nazwa używana przez samą Pika do określenia modelu stojącego za tą funkcją; jego istnienie i dokładna natura nie zostały niezależnie potwierdzone. Tę wiadomość należy odczytywać jako funkcję ogłoszoną przez Pika, a nie jako potwierdzone przez Google uruchomienie produktu.
Umiarkowane zaangażowanie konta (15 000 wyświetleń, 80 polubień), wyraźnie poniżej największych publikacji Pika — znak, że chodzi raczej o ogłoszenie funkcji niż o premierę flagowego produktu.
HeyGen wzmacnia swój ekosystem dla deweloperów: przezroczyste wideo i automatyczny montaż
Dwa ogłoszenia tego samego dnia od HeyGen — jedno dotyczące formatu wyjściowego wideo, drugie automatyzacji montażu.
Przezroczyste wyjście wideo WebM przez API, CLI i MCP
11 lipca — HeyGen ogłosił nową opcję wyjścia wideo w swoim API, CLI i serwerze MCP: format WebM z przezroczystym kanałem alfa. Ustawiając parametr output_format: "webm" na endpointcie /v3/videos, wygenerowane filmy z awatarami zwracane są z rzeczywiście przezroczystym tłem (natywny kanał alfa), bez potrzeby używania zielonego tła (green screen) i późniejszego wycinania.
Ta funkcja jest skierowana do deweloperów, którzy składają filmy z awatarami w większych produkcjach — montażu, nakładkach, integracji z scenami 3D. Powiązany wątek pokazuje konkretny przykład: awatar skomponowany bezpośrednio w scenie three.js w stylu Minecrafta.
🔗 Tweet @HeyGen — przezroczyste wyjście WebM
„Talking-Head-Recut Skill” synchronizuje grafiki z filmem mówionym
11 lipca — Szósty odcinek serii codziennych demonstracji wokół HyperFrames, środowiska produkcji wideo sterowanego przez agenta od HeyGen: „Talking-Head-Recut Skill” nakłada grafiki oprawy (animowane tytuły, liczniki, karty, cytaty) na wideo typu „gadająca głowa”, automatycznie synchronizując je z wypowiedzią. Agent czyta transkrypcję, decyduje, które elementy zasługują na grafikę, a następnie tworzy każdą kartę zgodnie z dostarczonym style guide’em.
Demonstracja pokazuje działanie od początku do końca na podstawie jednego promptu: wyszukiwanie tematu newsowego (ogłoszenie GPT-5.6 od OpenAI), skrypt z podaniem źródeł, awatar wygenerowany bezpośrednio z CLI HeyGen, styl graficzny pobrany na żywo z chatgpt.com, a następnie finalny render z napisami i muzyką — bez edytora wideo i bez kamery. Skill jest udokumentowany jako open source na GitHub.
🔗 Tweet @HeyGen — Talking-Head-Recut Skill 🔗 GitHub — talking-head-recut skill
Krótkie wiadomości
- Together AI uruchamia linię telefoniczną dla głosu — minimalistyczny tweet („Po co pisać, skoro możesz zadzwonić?”) odsyła do
docs.together.ai/call, które otwiera wybieranie numeru telefonu (+1 415-723-8167, ext. 676), łącząc dzwoniącego z asystentem głosowym opartym na platformie inferencyjnej Together AI, bez powiązanego wpisu na blogu. 🔗 Tweet @togethercompute - Pika uruchamia eksperymentalny serwer MCP —
experiment.pika.art(„Pika MCP – Make Your Agent Creative”) pozwala agentom AI wywoływać kreatywne możliwości generowania i edycji wideo Pika bezpośrednio ze swojego środowiska agentowego. 🔗 Tweet @pika_labs - MiniMax i Fireworks AI optymalizują kernel M3 na Blackwell — nowy kernel „KV-stationary” opracowany przez Fireworks AI dla otwartego modelu M3 od MiniMax odczytuje każdy wybrany blok tylko raz, zachowując korzyści z sparse attention i osiągając około 980 TFLOP/s na GPU B200. 🔗 Tweet @MiniMax_AI
- GPT-Live wdrożony w 100% na całym świecie — pełnodupleksowa funkcja głosowa OpenAI, uruchomiona 8 lipca, osiąga pełne wdrożenie w ChatGPT; OpenAI tymczasowo podwaja limit użycia głosu na weekend 11–12 lipca. 🔗 Tweet @athyuttamre
- Cohere podkreśla partnerstwo z NVIDIA i CoreWeave — komunikacja instytucjonalna na X dotycząca niezawodności i ochrony infrastruktury dla dużych firm wdrażających AI, bez szczegółów technicznych i bez powiązanego artykułu. 🔗 Tweet @cohere
Co to oznacza
Produkcja wideo staje się w pełni sterowanym przez agenta pipeline’em — od montażu po dystrybucję. HeyGen usuwa klasyczny techniczny krok — wycinanie zielonego tła — udostępniając natywny kanał alfa przez API, CLI i MCP, oraz automatyzuje synchronizację grafik z filmami mówionymi dzięki Talking-Head-Recut Skill: jeden prompt wystarcza dziś, by stworzyć film ze źródłami, oprawą i napisami, bez kamery i bez edytora. Pika popycha tę samą logikę w stronę postprodukcji, oferując model, który nazywa „Gemini Omni”, do zmiany tła, kąta i stroju w istniejącym wideo — a taka atrybucja, bez oficjalnego potwierdzenia Google, pokazuje też tendencję do nadawania technicznym komponentom efektownej nazwy, do czego warto podchodzić z należytą ostrożnością.
Agenci wychodzą poza kod i wchodzą w administrację oraz finanse firmy. Ramp for Agents pozwala agentowi Replit zakładać spółkę, otwierać konto Ramp oraz zarządzać gotówką i fakturami — obszarem, który do tej pory pozostawał wyłącznie po stronie człowieka. Ten sam ruch widać na mniejszą skalę w Pika MCP, które otwiera kreatywne możliwości Pika dla zewnętrznych agentów AI poprzez eksperymentalny serwer MCP: agent nie tylko tworzy, ale także orkiestruje usługi zewnętrzne w imieniu użytkownika.
Fundamenty wielojęzycznej AI i inferencji na dużą skalę nadal się otwierają. Zbiór danych GitHub Multilingual Repositories Dataset dokumentuje w skali 40 milionów repozytoriów, gdzie naprawdę „mieszkają” koreański, portugalski i inne języki światowego kodu — to zasób dla każdego badacza pracującego nad modelami wielojęzycznymi. Kernel KV-stationary opracowany przez Fireworks AI dla M3 od MiniMax ilustruje tę samą pracę infrastrukturalną po stronie inferencji, zachowując na Blackwell teoretyczne korzyści sparse attention. Wzmocnione partnerstwo Cohere z NVIDIA i CoreWeave dopełnia ten obraz: niezawodność infrastruktury staje się pełnoprawnym argumentem sprzedażowym dla AI dla przedsiębiorstw.
Głos coraz mocniej staje się odrębnym kanałem produktowym, a nie tylko dodatkiem. GPT-Live osiąga pełne wdrożenie w OpenAI zaledwie trzy dni po premierze, a limity zostają podwojone, by zachęcić do testów; Together AI z kolei uruchamia linię telefoniczną, która bezpośrednio łączy dzwoniącego z asystentem głosowym napędzanym przez ich platformę inferencyjną. Dwa różne podejścia — jedno zintegrowane z istniejącą aplikacją, drugie dostępne z klasycznego telefonu — dla tego samego zakładu: interfejs głosowy staje się pełnoprawnym punktem wejścia do modeli, a nie tylko jedną z wielu opcji.
Źródła
- Tweet @Replit — Ramp for Agents
- Tweet @github — Multilingual Repositories Dataset
- Tweet @pika_labs — edycja wideo z „Gemini Omni”
- Tweet @HeyGen — przezroczyste wyjście WebM
- Tweet @HeyGen — Talking-Head-Recut Skill
- GitHub — talking-head-recut skill
- Tweet @togethercompute — linia telefoniczna
- Tweet @pika_labs — Pika MCP
- Tweet @MiniMax_AI — kernel M3 na Blackwell
- Tweet @athyuttamre — GPT-Live wdrożony w 100%
- Tweet @cohere — partnerstwo NVIDIA i CoreWeave