ai-powered-markdown-translatorgpt-5.4-mini로 fr에서 ko로 번역된 기사.
7월 11일, 에이전트들이 코드를 넘어 현실 세계로 나섰다. Replit은 자사 에이전트를 Ramp와 연결해 법인 설립과 자금, 청구서, 지출을 자율적으로 관리하게 했고, GitHub는 코드의 언어 분포에 관한 4천만 개가 넘는 저장소 오픈 소스 데이터셋을 공개했으며, HeyGen은 투명 WebM 비디오 출력과 음성 비디오용 자동 동기화 편집이라는 두 가지 개발자용 발표를 연달아 내놓았다. Pika는 한편으로 자신이 « Gemini Omni »라고 부르는 모델을 통해 고급 비디오 편집 기능을 시연했지만, 이는 현재까지 Google이 확인한 적 없는 명칭이다. 여기에 Together AI의 음성 통화 라인부터 NVIDIA 및 CoreWeave와의 Cohere 인프라 파트너십까지, 다섯 개의 짧은 소식이 전체 그림을 완성한다.
Replit, Ramp for Agents 출시: 이제 에이전트가 회사의 재무를 관리한다
7월 11일 — Replit은 금융 관리 및 기업 카드 플랫폼인 Ramp와의 파트너십을 발표하며, 자사 에이전트가 코드 생성 범위를 넘어 실제 금융 업무까지 처리할 수 있게 되었다고 밝혔다. 구체적으로, Replit 에이전트는 이제 회사 설립(법인 설립)을 지원하고, 해당 법인을 위한 Ramp 계정 신청을 진행한 뒤, 자연어 대화만으로도 회사가 돈을 쓰고, 청구서를 지불하며, 자금 흐름을 관리할 수 있도록 준비시킬 수 있다.
이번 출시는 Replit이 이미 자사 에이전트를 이커머스(Shopify 통합, 2026년 6월)와 검색 가능성(SEO Agent, 2026년 6월)으로 확장해 온 전략의 연장선에 있다. 이 제품은 Ramp가 운영하는 전용 페이지인 « Finance for the Agent Economy »를 통해 제공되며, 여기서는 에이전트가 카드, 송금, 은행 계좌를 사용할 수 있고, 각 지출 금액을 제어하기 위한 내장 통제 기능도 함께 제공된다.
“Ramp for Agents.
Replit Agent can now incorporate your company, apply for Ramp, and get your business ready to spend, pay bills, and manage money.
Every company used to start with paperwork. The next one starts with a prompt.”
🇰🇷 Ramp for Agents. Replit 에이전트는 이제 귀사의 법인 설립을 진행하고, Ramp를 신청하며, 지출하고 청구서를 지불하고 자금을 관리할 수 있도록 회사를 준비시킬 수 있습니다. 예전에는 모든 회사가 서류 작업에서 시작했지만, 다음 회사는 프롬프트에서 시작합니다. — @Replit X에서
GitHub, Multilingual Repositories Dataset 공개
7월 11일 — GitHub는 다국어 AI를 연구하는 연구자와 개발자를 위한 새로운 오픈 소스 데이터셋인 GitHub Multilingual Repositories Dataset를 공개했다. 이 데이터셋은 4천만 개가 넘는 저장소와 8천만 줄이 넘는 분류 데이터를 포함하며, 플랫폼에서 영어가 아닌 언어로 작성된 README, issue, pull request가 어디에 존재하는지 지도로 보여준다.
| 측정 지표 | 측정값 |
|---|---|
| 포함된 저장소 | 40M+ |
| 분류 라인 | 80M+ |
| 포르투갈어 README 저장소(주도 언어) | 3M+ |
| issue 텍스트의 주도 언어 | 한국어 |
GitHub가 강조한 수치는 실제 언어적 경향을 보여준다. issue 텍스트는 한국어가 우세하고, README는 포르투갈어가 앞서며 관련 저장소가 300만 개가 넘는다. 이는 엄밀히 말해 Copilot 기능 발표가 아니라, 연구용 및 개방형 데이터 공개이며, AI 기반 개발 플랫폼으로서의 GitHub 포지셔닝을 이어가는 행보다.
🔗 @github 트윗 — Multilingual Repositories Dataset
Pika, 자신이 « Gemini Omni »라고 부르는 모델로 비디오 편집
7월 11일 — Pika는 사용자가 가져온 비디오에 고급 편집 기능을 적용하는 시연 영상을 공개했다. 배경 변경, 카메라 각도 변경, 의상 변경, 시각 효과 추가, 심지어 프랑스어 더빙까지 가능하며, 이 모든 것이 Pika가 « Gemini Omni »를 통해 구현된다고 소개된다.
“Drop in your video and change the background, change the angle, swap the outfit, add visual effects, even make it speak French — all with Gemini Omni”
🇰🇷 비디오를 가져와 배경을 바꾸고, 각도를 바꾸고, 의상을 바꾸고, 시각 효과를 추가하고, 심지어 프랑스어로 말하게 하세요 — 모두 Gemini Omni로 가능합니다. — @pika_labs X에서
편집상 유의: « Gemini Omni »라는 이름은 현재까지 공식 Google 또는 DeepMind 발표 어디에도 등장하지 않는다. Gemini 발표 전용 스캔에서도 7월 11일 해당 소식은 확인되지 않았다. 이는 Pika가 이 기능의 기반 모델을 지칭하기 위해 사용한 이름일 뿐이며, 그 존재와 정확한 성격은 독립적으로 확인되지 않았다. 이 소식은 Google이 확인한 제품 출시가 아니라, Pika가 발표한 기능으로 읽어야 한다.
계정 반응은 보통 수준이었다(조회수 15,000회, 좋아요 80개). 이는 Pika의 주요 게시물보다 확실히 낮은 수치로, 대형 제품 출시라기보다 기능 발표에 가깝다는 신호다.
HeyGen, 개발자 생태계를 강화하다: 투명 비디오와 자동화된 편집
같은 날 HeyGen은 두 가지 발표를 내놓았다. 하나는 비디오 출력 형식에 관한 것이고, 다른 하나는 편집 자동화에 관한 것이다.
API, CLI, MCP에서 투명 WebM 비디오 출력
7월 11일 — HeyGen은 자사의 API, CLI, MCP 서버에서 사용할 수 있는 새로운 비디오 출력 옵션을 발표했다. 바로 알파 채널이 투명한 WebM 형식이다. output_format: "webm" 매개변수를 /v3/videos 엔드포인트에 설정하면, 생성된 아바타 비디오는 실제로 투명한 배경(natvie alpha channel)을 포함해 돌아오며, 후처리로 배경을 따로 지워야 하는 녹색 배경(green screen) 방식이 필요 없다.
이 기능은 더 큰 제작 흐름 속에서 아바타 비디오를 조합하는 개발자를 겨냥한다. 편집, 오버레이, 3D 장면 통합 같은 용도다. 관련 스레드는 구체적인 예시를 보여준다. 아바타가 Minecraft 스타일의 three.js 장면 안에 직접 합성되는 장면이다.
« Talking-Head-Recut Skill »이 음성 비디오에 그래픽을 자동 동기화
7월 11일 — HeyGen의 에이전트 기반 비디오 제작 환경인 HyperFrames를 둘러싼 일일 시연 시리즈의 여섯 번째 에피소드에서, « Talking-Head-Recut Skill »은 말하는 사람의 얼굴 영상에 제목 애니메이션, 카운터, 카드, 인용구 같은 오버레이 그래픽을 자동으로 올리고, 이를 발화 내용과 자동으로 동기화한다. 에이전트는 전사를 읽고 어떤 요소가 그래픽으로 들어갈 가치가 있는지 판단한 뒤, 제공된 그래픽 가이드라인에 따라 각 카드를 그린다.
이 시연은 단 하나의 프롬프트에서 시작해 끝까지 이어지는 흐름을 보여준다. OpenAI의 GPT-5.6 발표라는 화제 찾기, 출처가 있는 스크립트, HeyGen CLI에서 직접 생성된 아바타, chatgpt.com에서 실시간으로 가져온 그래픽 가이드라인, 그리고 자막과 음악까지 포함한 최종 렌더링 — 비디오 편집기나 카메라 없이 진행된다. 이 스킬은 GitHub에 오픈 소스로 문서화되어 있다.
🔗 @HeyGen 트윗 — Talking-Head-Recut Skill 🔗 GitHub — talking-head-recut skill
짧은 소식
- Together AI, 음성 통화 라인 출시 — 아주 짧은 트윗(« Why type when you can call? »)이
docs.together.ai/call로 연결되며, 여는 전화 다이얼러(+1 415-723-8167, 내선 676)를 통해 Together AI의 추론 플랫폼으로 구동되는 음성 비서와 발신자를 연결한다. 별도의 블로그 글은 없다. 🔗 @togethercompute 트윗 - Pika, 실험적 MCP 서버 공개 —
experiment.pika.art(« Pika MCP – Make Your Agent Creative »)는 AI 에이전트가 자신의 에이전트 환경에서 직접 Pika의 창의적 비디오 생성 및 편집 기능을 호출할 수 있게 한다. 🔗 @pika_labs 트윗 - MiniMax와 Fireworks AI, Blackwell에서 M3 커널 최적화 — Fireworks AI가 MiniMax의 공개 모델 M3를 위해 개발한 새로운 « KV-stationary » 커널은 선택된 각 블록을 한 번만 읽어 sparse attention의 이점을 유지하며, B200 GPU에서 약 980 TFLOP/s에 도달한다. 🔗 @MiniMax_AI 트윗
- GPT-Live, 전 세계 100% 배포 완료 — 7월 8일 출시된 OpenAI의 full-duplex 음성 기능이 ChatGPT 전체 배포를 완료했다. OpenAI는 7월 11~12일 주말 동안 음성 사용 한도를 일시적으로 두 배로 늘린다. 🔗 @athyuttamre 트윗
- Cohere, NVIDIA 및 CoreWeave와의 파트너십 부각 — AI를 배포하는 대기업을 위한 신뢰성과 인프라 보호를 둘러싼 X상의 기관 커뮤니케이션이며, 기술적 세부사항이나 관련 기사 안내는 없다. 🔗 @cohere 트윗
이것이 의미하는 바
비디오 제작은 편집부터 배포까지 완전히 에이전트가 주도하는 파이프라인이 되고 있다. HeyGen은 API, CLI, MCP에서 알파 채널을 네이티브로 제공함으로써 녹색 배경 제거라는 전통적인 기술 단계를 없애고, Talking-Head-Recut Skill을 통해 음성 비디오 위에 그래픽을 자동 동기화한다. 이제 하나의 프롬프트만으로도 출처가 있는 영상, 꾸며진 영상, 자막이 포함된 영상을 카메라나 편집기 없이 만들 수 있다. Pika는 같은 논리를 후반 제작 쪽으로 밀어붙이며, 자신이 « Gemini Omni »라고 부르는 모델로 기존 비디오의 배경, 각도, 의상을 바꾸고자 한다. 다만 Google의 공식 확인이 없다는 점은, 이런 기술적 구성 요소에 강한 이름을 붙여 힘을 부여하려는 경향도 함께 보여주며, 그만큼 신중하게 받아들여야 한다.
에이전트는 코드를 넘어 회사의 행정과 재무로 진입하고 있다. Ramp for Agents는 Replit의 에이전트가 회사를 설립하고 Ramp 계정을 열며 자금과 청구서를 관리하게 한다. 이 영역은 지금까지 철저히 사람이 맡아 왔다. 같은 흐름은 더 작은 규모에서 Pika MCP에서도 보인다. 실험적 MCP 서버를 통해 Pika의 창의적 기능을 제3자 AI 에이전트가 사용할 수 있게 하면서, 에이전트는 더 이상 단순히 생성만 하지 않고 사용자를 대신해 외부 서비스를 조율한다.
다국어 AI와 대규모 추론의 기반은 계속 개방되고 있다. GitHub의 Multilingual Repositories Dataset은 4천만 개 저장소 규모에서 한국어, 포르투갈어, 그리고 전 세계 코드 언어가 실제로 어디에 존재하는지를 문서화한다. 다국어 모델을 연구하는 모든 연구자에게 유용한 자원이다. MiniMax의 M3를 위해 Fireworks AI가 개발한 KV-stationary 커널은 추론 인프라 측면에서 같은 작업을 보여주며, Blackwell에서 sparse attention의 이론적 이득을 유지한다. Cohere가 NVIDIA 및 CoreWeave와 강화한 파트너십은 이 그림을 완성한다. 인프라의 신뢰성 자체가 엔터프라이즈 AI의 핵심 판매 포인트가 되고 있다.
음성은 이제 주변 기능이 아니라 독립적인 제품 채널로 자리잡고 있다. GPT-Live는 출시 3일 만에 OpenAI에서 전체 배포에 도달했고, 시도를 유도하기 위해 사용 한도까지 두 배로 늘었다. 한편 Together AI는 발신자를 자사 추론 플랫폼으로 구동되는 음성 비서와 바로 연결하는 전화 라인을 열었다. 기존 앱에 통합된 방식과 일반 전화기로 접근하는 방식이라는 서로 다른 두 접근이지만, 같은 결론을 향한다. 음성 인터페이스는 더 이상 부가 옵션이 아니라, 모델로 들어가는 하나의 정식 진입점이 되고 있다.
출처
- @Replit 트윗 — Ramp for Agents
- @github 트윗 — Multilingual Repositories Dataset
- @pika_labs 트윗 — « Gemini Omni »를 사용한 비디오 편집
- @HeyGen 트윗 — 투명 WebM 출력
- @HeyGen 트윗 — Talking-Head-Recut Skill
- GitHub — talking-head-recut skill
- @togethercompute 트윗 — 음성 통화 라인
- @pika_labs 트윗 — Pika MCP
- @MiniMax_AI 트윗 — Blackwell의 M3 커널
- @athyuttamre 트윗 — GPT-Live 100% 배포
- @cohere 트윗 — NVIDIA 및 CoreWeave 파트너십