Le 11 juillet, les agents sortent du code pour toucher au monde réel : Replit associe son agent à Ramp pour incorporer une société et gérer trésorerie, factures et dépenses de façon autonome, GitHub publie un dataset open source de plus de 40 millions de dépôts sur la répartition linguistique du code, et HeyGen enchaîne deux annonces développeur — sortie vidéo WebM transparente et montage automatique synchronisé sur des vidéos parlées. Pika démontre de son côté des capacités d’édition vidéo avancées via un modèle qu’elle nomme « Gemini Omni », une attribution non confirmée par Google à ce jour. Cinq brèves complètent le tableau, de la ligne d’appel vocale de Together AI au partenariat infrastructure de Cohere avec NVIDIA et CoreWeave.
Replit lance Ramp for Agents : ses agents gèrent désormais les finances de l’entreprise
11 juillet — Replit a annoncé un partenariat avec Ramp, plateforme de gestion financière et de cartes d’entreprise, permettant à son agent d’aller au-delà de la génération de code pour prendre en charge des démarches financières réelles. Concrètement, l’agent Replit peut désormais accompagner la création d’une société (incorporation), soumettre une demande de compte Ramp pour cette entité, puis préparer l’entreprise à dépenser de l’argent, payer ses factures et gérer sa trésorerie — depuis une conversation en langage naturel.
Le lancement s’inscrit dans la continuité de la stratégie de Replit, qui a déjà ouvert son agent à l’e-commerce (intégration Shopify, juin 2026) et à la découvrabilité (SEO Agent, juin 2026). Le produit passe par une page dédiée opérée par Ramp, « Finance for the Agent Economy », qui fournit aux agents cartes, virements et comptes bancaires avec des contrôles intégrés pour encadrer chaque dollar dépensé.
“Ramp for Agents.
Replit Agent can now incorporate your company, apply for Ramp, and get your business ready to spend, pay bills, and manage money.
Every company used to start with paperwork. The next one starts with a prompt.”
🇫🇷 Ramp for Agents. L’agent Replit peut désormais incorporer votre société, demander un compte Ramp, et préparer votre entreprise à dépenser de l’argent, payer ses factures et gérer sa trésorerie. Chaque entreprise commençait autrefois par de la paperasse — la suivante commence par un prompt. — @Replit sur X
GitHub publie le Multilingual Repositories Dataset
11 juillet — GitHub a publié le GitHub Multilingual Repositories Dataset, un nouveau jeu de données open source destiné aux chercheurs et développeurs qui travaillent sur l’IA multilingue. Il couvre plus de 40 millions de dépôts et plus de 80 millions de lignes de classification, cartographiant où vivent les README, issues et pull requests rédigés dans une langue autre que l’anglais sur la plateforme.
| Indicateur mesuré | Valeur mesurée |
|---|---|
| Dépôts couverts | 40M+ |
| Lignes de classification | 80M+ |
| Dépôts README en portugais (langue dominante) | 3M+ |
| Langue dominante des textes d’issues | Coréen |
Les chiffres mis en avant par GitHub révèlent des tendances linguistiques concrètes : le coréen domine les textes d’issues, tandis que le portugais arrive en tête pour les README, avec plus de 3 millions de dépôts concernés. Il ne s’agit pas d’une fonctionnalité Copilot à proprement parler, mais d’une publication de recherche et de données ouvertes, dans la continuité du positionnement de GitHub comme plateforme de développement propulsée par l’IA.
🔗 Tweet @github — Multilingual Repositories Dataset
Pika édite des vidéos avec un modèle qu’elle nomme « Gemini Omni »
11 juillet — Pika a publié une démonstration vidéo mettant en avant des fonctions d’édition avancées appliquées à une vidéo importée par l’utilisateur : changement de fond, changement d’angle de caméra, changement de tenue, ajout d’effets visuels, et même doublage de la voix en français — le tout présenté par Pika comme rendu possible « with Gemini Omni ».
“Drop in your video and change the background, change the angle, swap the outfit, add visual effects, even make it speak French — all with Gemini Omni”
🇫🇷 Importez votre vidéo et changez le fond, changez l’angle, changez la tenue, ajoutez des effets visuels, faites-la même parler français — le tout avec Gemini Omni. — @pika_labs sur X
Prudence éditoriale : le nom « Gemini Omni » n’apparaît dans aucune annonce officielle Google ou DeepMind à ce jour — le scan dédié aux annonces Gemini n’a relevé aucune actualité ce 11 juillet. Il s’agit du nom utilisé par Pika elle-même pour désigner le modèle sous-jacent à cette fonctionnalité ; son existence et sa nature exactes ne sont pas établies de façon indépendante. Cette actualité doit être lue comme une fonctionnalité annoncée par Pika, et non comme un lancement de produit confirmé par Google.
Engagement modéré pour le compte (15 000 vues, 80 likes), nettement en dessous des publications majeures de Pika — signe d’une annonce de fonctionnalité plutôt que d’un lancement de produit phare.
HeyGen muscle son écosystème développeur : vidéo transparente et montage automatisé
Deux annonces le même jour pour HeyGen, l’une sur le format de sortie vidéo, l’autre sur l’automatisation du montage.
Sortie vidéo WebM transparente sur API, CLI et MCP
11 juillet — HeyGen a annoncé une nouvelle option de sortie vidéo sur son API, sa CLI et son serveur MCP : le format WebM avec canal alpha transparent. En définissant le paramètre output_format: "webm" sur l’endpoint /v3/videos, les vidéos d’avatar générées reviennent avec un fond réellement transparent (canal alpha natif), sans recourir à un fond vert (green screen) à détourer après coup.
Cette fonctionnalité cible les développeurs qui composent des vidéos d’avatar dans des productions plus larges — montage, superpositions, intégration dans des scènes 3D. Le thread associé illustre un exemple concret : un avatar composité directement dans une scène three.js façon Minecraft.
🔗 Tweet @HeyGen — sortie WebM transparente
La « Talking-Head-Recut Skill » synchronise les graphismes sur une vidéo parlée
11 juillet — Sixième épisode d’une série de démonstrations quotidiennes autour de HyperFrames, l’environnement de production vidéo piloté par agent de HeyGen : la « Talking-Head-Recut Skill » superpose des graphismes d’habillage (titres animés, compteurs, cartes, citations) sur une vidéo de type « tête parlante », synchronisés automatiquement avec le discours prononcé. L’agent lit la transcription, décide quels éléments méritent un graphique, puis dessine chaque carte dans la charte graphique fournie.
La démonstration illustre le fonctionnement de bout en bout à partir d’un seul prompt : recherche d’un sujet d’actualité (l’annonce GPT-5.6 d’OpenAI), script sourcé, avatar généré directement depuis la CLI de HeyGen, charte graphique reprise en direct depuis chatgpt.com, puis rendu final avec sous-titres et musique — sans éditeur vidéo ni caméra. Le skill est documenté en open source sur GitHub.
🔗 Tweet @HeyGen — Talking-Head-Recut Skill 🔗 GitHub — talking-head-recut skill
Brèves
- Together AI lance une ligne d’appel vocal — un tweet minimaliste (« Why type when you can call? ») renvoie vers
docs.together.ai/call, qui ouvre un numéroteur téléphonique (+1 415-723-8167, ext. 676) mettant en relation l’appelant avec un assistant vocal propulsé par la plateforme d’inférence de Together AI, sans article de blog associé. 🔗 Tweet @togethercompute - Pika met en ligne un serveur MCP expérimental —
experiment.pika.art(« Pika MCP – Make Your Agent Creative ») permet à des agents IA d’appeler les capacités créatives de génération et édition vidéo de Pika directement depuis leur environnement agentique. 🔗 Tweet @pika_labs - MiniMax et Fireworks AI optimisent le kernel M3 sur Blackwell — un nouveau kernel « KV-stationary » développé par Fireworks AI pour le modèle ouvert M3 de MiniMax lit chaque bloc sélectionné une seule fois, préservant les gains de l’attention creuse (sparse attention) et atteignant environ 980 TFLOP/s sur un GPU B200. 🔗 Tweet @MiniMax_AI
- GPT-Live déployé à 100 % dans le monde entier — la fonctionnalité vocale full-duplex d’OpenAI, lancée le 8 juillet, atteint son déploiement complet sur ChatGPT ; OpenAI double temporairement la limite d’usage vocal pour le weekend du 11-12 juillet. 🔗 Tweet @athyuttamre
- Cohere met en avant son partenariat avec NVIDIA et CoreWeave — communication institutionnelle sur X autour de la fiabilité et de la protection de l’infrastructure pour les grandes entreprises qui déploient de l’IA, sans détail technique ni article associé. 🔗 Tweet @cohere
Ce que ça signifie
La production vidéo devient un pipeline entièrement piloté par agent, du montage à la distribution. HeyGen élimine une étape technique classique — le détourage du fond vert — en rendant le canal alpha natif sur API, CLI et MCP, et automatise la synchronisation de graphismes sur des vidéos parlées via sa Talking-Head-Recut Skill : un seul prompt suffit désormais à produire une vidéo sourcée, habillée et sous-titrée sans caméra ni éditeur. Pika pousse la même logique côté post-production, avec un modèle qu’elle nomme « Gemini Omni » pour changer fond, angle et tenue d’une vidéo existante — une attribution qui, faute de confirmation officielle Google, illustre aussi une tendance à surnommer des briques techniques pour leur donner un vernis de puissance, à prendre avec la prudence qui s’impose.
Les agents sortent du code pour toucher à l’administratif et au financier d’une entreprise. Ramp for Agents laisse l’agent de Replit incorporer une société, ouvrir un compte Ramp et gérer trésorerie et factures — un territoire qui, jusqu’ici, restait strictement humain. Le même mouvement se retrouve, à plus petite échelle, dans le Pika MCP, qui ouvre les capacités créatives de Pika à des agents IA tiers via un serveur MCP expérimental : l’agent ne se contente plus de produire, il orchestre des services tiers pour le compte de l’utilisateur.
Les fondations de l’IA multilingue et de l’inférence à grande échelle continuent de s’ouvrir. Le Multilingual Repositories Dataset de GitHub documente, à l’échelle de 40 millions de dépôts, où vivent réellement le coréen, le portugais et les autres langues du code mondial — une ressource pour tout chercheur travaillant sur des modèles multilingues. Le kernel KV-stationary développé par Fireworks AI pour le M3 de MiniMax illustre le même travail d’infrastructure côté inférence, en préservant sur Blackwell les gains théoriques de l’attention creuse. Le partenariat renforcé de Cohere avec NVIDIA et CoreWeave complète ce tableau : la fiabilité de l’infrastructure devient un argument de vente à part entière pour l’IA d’entreprise.
La voix s’installe comme un canal produit à part entière, plutôt qu’une simple fonctionnalité annexe. GPT-Live atteint son déploiement complet chez OpenAI trois jours seulement après son lancement, avec des limites doublées pour inciter à l’essai ; Together AI, de son côté, ouvre une ligne téléphonique reliant directement l’appelant à un assistant vocal propulsé par sa plateforme d’inférence. Deux approches différentes — l’une intégrée à une application existante, l’autre accessible depuis un téléphone classique — pour le même pari : l’interface vocale devient un point d’entrée à part entière vers les modèles, pas seulement une option parmi d’autres.
Sources
- Tweet @Replit — Ramp for Agents
- Tweet @github — Multilingual Repositories Dataset
- Tweet @pika_labs — édition vidéo avec « Gemini Omni »
- Tweet @HeyGen — sortie WebM transparente
- Tweet @HeyGen — Talking-Head-Recut Skill
- GitHub — talking-head-recut skill
- Tweet @togethercompute — ligne d’appel vocal
- Tweet @pika_labs — Pika MCP
- Tweet @MiniMax_AI — kernel M3 sur Blackwell
- Tweet @athyuttamre — GPT-Live déployé à 100 %
- Tweet @cohere — partenariat NVIDIA et CoreWeave