खोजें

Replit ने स्वायत्त वित्तीय एजेंटों के लिए Ramp for Agents लॉन्च किया, GitHub ने 40M रिपॉज़िटरी का बहुभाषी डेटासेट प्रकाशित किया, HeyGen ने पारदर्शी WebM वीडियो आउटपुट खोला

Replit ने स्वायत्त वित्तीय एजेंटों के लिए Ramp for Agents लॉन्च किया, GitHub ने 40M रिपॉज़िटरी का बहुभाषी डेटासेट प्रकाशित किया, HeyGen ने पारदर्शी WebM वीडियो आउटपुट खोला

ai-powered-markdown-translator

GPT-5.4-मिनी के साथ फ़्रेंच से हिंदी में अनूदित लेख।

GitHub पर प्रोजेक्ट देखें ↗

11 जुलाई को एजेंट कोड से निकलकर वास्तविक दुनिया तक पहुँच गए: Replit ने अपने एजेंट को Ramp के साथ जोड़ा ताकि वह स्वायत्त रूप से कंपनी शामिल कर सके, ट्रेज़री, बिल और खर्चों का प्रबंधन कर सके; GitHub ने बहुभाषी कोड के भाषाई वितरण पर 4 करोड़ से अधिक रिपॉज़िटरी का ओपन सोर्स डेटासेट प्रकाशित किया; और HeyGen ने डेवलपर के लिए दो घोषणाएँ कीं — पारदर्शी WebM वीडियो आउटपुट और बोले गए वीडियो पर स्वचालित समन्वित संपादन। Pika ने दूसरी ओर, एक मॉडल के माध्यम से उन्नत वीडियो संपादन क्षमताएँ दिखाईं जिसे वह « Gemini Omni » कहती है, लेकिन यह श्रेय फिलहाल Google द्वारा पुष्टि नहीं किया गया है। पाँच छोटी खबरें तस्वीर पूरी करती हैं, Together AI की वॉइस कॉल लाइन से लेकर Cohere की NVIDIA और CoreWeave के साथ इंफ्रास्ट्रक्चर साझेदारी तक।


Replit ने Ramp for Agents लॉन्च किया : उसके एजेंट अब कंपनी के वित्त संभालते हैं

11 जुलाई — Replit ने Ramp के साथ एक साझेदारी की घोषणा की, जो वित्तीय प्रबंधन और कंपनी कार्ड्स का प्लेटफ़ॉर्म है, जिससे उसका एजेंट कोड जनरेशन से आगे बढ़कर वास्तविक वित्तीय कार्यों को संभाल सकेगा। व्यावहारिक रूप से, Replit एजेंट अब एक कंपनी के गठन (incorporation) में मदद कर सकता है, उस इकाई के लिए Ramp खाते का अनुरोध जमा कर सकता है, और फिर कंपनी को पैसा खर्च करने, बिल चुकाने और ट्रेज़री प्रबंधित करने के लिए तैयार कर सकता है — वह भी प्राकृतिक भाषा में बातचीत के माध्यम से।

यह लॉन्च Replit की उस रणनीति की निरंतरता है, जिसने पहले ही अपने एजेंट को ई-कॉमर्स (Shopify एकीकरण, जून 2026) और खोजयोग्यता (SEO Agent, जून 2026) तक खोल दिया था। उत्पाद Ramp द्वारा संचालित एक समर्पित पेज, « Finance for the Agent Economy », से होकर गुजरता है, जो एजेंटों को कार्ड, ट्रांसफ़र और बैंक खाते प्रदान करता है, साथ ही हर खर्च किए गए डॉलर पर नियंत्रण रखने के लिए अंतर्निहित नियंत्रण भी देता है।

“Ramp for Agents.

Replit Agent can now incorporate your company, apply for Ramp, and get your business ready to spend, pay bills, and manage money.

Every company used to start with paperwork. The next one starts with a prompt.”

🇮🇳 Ramp for Agents. Replit एजेंट अब आपकी कंपनी शामिल कर सकता है, Ramp के लिए आवेदन कर सकता है, और आपके व्यवसाय को पैसा खर्च करने, बिल चुकाने और ट्रेज़री प्रबंधित करने के लिए तैयार कर सकता है। कभी हर कंपनी की शुरुआत कागज़ी कार्रवाई से होती थी — अगली शुरुआत एक prompt से होगी।@Replit पर X


GitHub ने Multilingual Repositories Dataset प्रकाशित किया

11 जुलाई — GitHub ने GitHub Multilingual Repositories Dataset प्रकाशित किया, जो बहुभाषी AI पर काम करने वाले शोधकर्ताओं और डेवलपर्स के लिए बनाया गया एक नया ओपन सोर्स डेटासेट है। इसमें 4 करोड़ से अधिक रिपॉज़िटरी और 8 करोड़ से अधिक classification lines शामिल हैं, जो यह मैप करता है कि प्लेटफ़ॉर्म पर अंग्रेज़ी के अलावा किसी अन्य भाषा में लिखे गए README, issues और pull requests कहाँ रहते हैं।

मापी गई सूचकांकमापी गई मूल्य
कवर की गई रिपॉज़िटरी40M+
classification lines80M+
पुर्तगाली README रिपॉज़िटरी (प्रमुख भाषा)3M+
issues टेक्स्ट की प्रमुख भाषाकोरियाई

GitHub द्वारा उजागर किए गए आँकड़े वास्तविक भाषाई रुझान दिखाते हैं: issues टेक्स्ट में कोरियाई का वर्चस्व है, जबकि README के लिए पुर्तगाली सबसे आगे है, जहाँ 3 मिलियन से अधिक रिपॉज़िटरी प्रभावित हैं। यह सीधे तौर पर Copilot की कोई सुविधा नहीं है, बल्कि शोध और खुले डेटा का एक प्रकाशन है, जो GitHub के AI-चालित विकास मंच होने की स्थिति के अनुरूप है।

🔗 Tweet @github — Multilingual Repositories Dataset


Pika ने एक ऐसे मॉडल के साथ वीडियो संपादित किए जिसे वह « Gemini Omni » कहती है

11 जुलाई — Pika ने एक वीडियो डेमो प्रकाशित किया जिसमें उपयोगकर्ता द्वारा आयात किए गए वीडियो पर लागू उन्नत संपादन सुविधाएँ दिखाई गईं: पृष्ठभूमि बदलना, कैमरा कोण बदलना, कपड़े बदलना, विज़ुअल इफ़ेक्ट जोड़ना, और यहाँ तक कि फ्रेंच में आवाज़ डब करना — और यह सब Pika के अनुसार « with Gemini Omni » के कारण संभव हुआ।

“Drop in your video and change the background, change the angle, swap the outfit, add visual effects, even make it speak French — all with Gemini Omni”

🇮🇳 अपना वीडियो आयात करें और पृष्ठभूमि बदलें, कोण बदलें, पहनावा बदलें, विज़ुअल इफ़ेक्ट जोड़ें, यहाँ तक कि उसे फ्रेंच में बोलने दें — यह सब Gemini Omni के साथ।@pika_labs पर X

संपादकीय सावधानी: « Gemini Omni » नाम आज तक किसी भी आधिकारिक Google या DeepMind घोषणा में नहीं आया है — Gemini घोषणाओं के लिए समर्पित स्कैन में 11 जुलाई को कोई खबर नहीं मिली। यह Pika द्वारा स्वयं उस अंतर्निहित मॉडल को नाम देने के लिए उपयोग किया गया नाम है; इसका अस्तित्व और सटीक प्रकृति स्वतंत्र रूप से स्थापित नहीं हैं। इस खबर को Pika द्वारा घोषित एक सुविधा के रूप में पढ़ा जाना चाहिए, न कि Google द्वारा पुष्टि किए गए उत्पाद लॉन्च के रूप में।

खाते के लिए मध्यम engagement (15,000 views, 80 likes), जो Pika की प्रमुख पोस्टों से काफी कम है — यह किसी प्रमुख उत्पाद लॉन्च के बजाय एक feature घोषणा का संकेत है।


HeyGen ने अपने developer ecosystem को और मजबूत किया: पारदर्शी वीडियो और स्वचालित संपादन

HeyGen के लिए उसी दिन दो घोषणाएँ, एक वीडियो आउटपुट format पर और दूसरी संपादन automation पर।

API, CLI और MCP पर पारदर्शी WebM वीडियो आउटपुट

11 जुलाई — HeyGen ने अपने API, अपनी CLI और अपने MCP server पर एक नया वीडियो आउटपुट विकल्प घोषित किया: पारदर्शी alpha channel वाला WebM format। endpoint output_format: "webm" पर पैरामीटर /v3/videos सेट करने पर, avatar videos वास्तविक रूप से पारदर्शी background (native alpha channel) के साथ लौटती हैं, बिना green screen का सहारा लिए, जिसे बाद में cut out करना पड़े।

यह सुविधा उन developers को लक्ष्य करती है जो avatar videos को बड़े productions में जोड़ते हैं — editing, overlays, 3D scenes में integration। संबंधित thread एक ठोस उदाहरण दिखाता है: एक avatar सीधे Minecraft-style three.js scene में composited।

🔗 Tweet @HeyGen — पारदर्शी WebM आउटपुट

« Talking-Head-Recut Skill » बोले गए वीडियो पर graphics को sync करती है

11 जुलाईHyperFrames के दैनिक demonstration series का छठा episode, जो HeyGen का agent-driven video production environment है: « Talking-Head-Recut Skill » “talking head” प्रकार के वीडियो पर, बोली गई बात के साथ स्वचालित रूप से sync होने वाले decorative graphics (animated titles, counters, cards, quotes) overlay करती है। agent transcript पढ़ता है, तय करता है कि किन तत्वों को graphic बनना चाहिए, फिर दिए गए graphic style में हर card को draw करता है।

यह demo एक ही prompt से end-to-end काम करना दिखाता है: एक current events विषय की खोज (OpenAI की GPT-5.6 घोषणा), sourced script, HeyGen CLI से सीधे उत्पन्न avatar, chatgpt.com से live लिया गया graphic style, फिर subtitles और music के साथ अंतिम render — बिना video editor या camera के। यह skill GitHub पर open source में documented है।

🔗 Tweet @HeyGen — Talking-Head-Recut Skill 🔗 GitHub — talking-head-recut skill


संक्षिप्त खबरें

  • Together AI ने एक voice call line लॉन्च की — एक न्यूनतम ट्वीट (« Why type when you can call? ») docs.together.ai/call की ओर इशारा करता है, जो एक telephone dialer (+1 415-723-8167, ext. 676) खोलता है और कॉल करने वाले को Together AI की inference platform द्वारा संचालित एक voice assistant से जोड़ता है, बिना किसी संबंधित blog post के। 🔗 Tweet @togethercompute
  • Pika ने एक experimental MCP server ऑनलाइन कियाexperiment.pika.art (« Pika MCP – Make Your Agent Creative ») AI agents को Pika की generation और video editing creative capabilities को सीधे अपने agentic environment से कॉल करने देता है। 🔗 Tweet @pika_labs
  • MiniMax और Fireworks AI ने Blackwell पर M3 kernel को optimize किया — MiniMax के open model M3 के लिए Fireworks AI द्वारा विकसित नया « KV-stationary » kernel हर चयनित block को केवल एक बार पढ़ता है, sparse attention के लाभों को बनाए रखते हुए और B200 GPU पर लगभग 980 TFLOP/s तक पहुँचता है। 🔗 Tweet @MiniMax_AI
  • GPT-Live दुनिया भर में 100% तैनात हो गया — 8 जुलाई को लॉन्च की गई OpenAI की full-duplex voice सुविधा ChatGPT पर अपनी पूर्ण तैनाती तक पहुँच गई; OpenAI 11-12 जुलाई के weekend के लिए voice usage limit को अस्थायी रूप से दोगुना कर रहा है। 🔗 Tweet @athyuttamre
  • Cohere ने NVIDIA और CoreWeave के साथ अपनी साझेदारी को रेखांकित किया — बड़े उद्यमों के लिए infrastructure reliability और protection के इर्द-गिर्द X पर institutional communication, बिना तकनीकी विवरण या संबंधित लेख के। 🔗 Tweet @cohere

इसका क्या अर्थ है

वीडियो production अब montage से लेकर distribution तक पूरी तरह agent-driven pipeline बनती जा रही है। HeyGen एक पारंपरिक तकनीकी चरण — green screen removal — को हटाकर API, CLI और MCP पर native alpha channel उपलब्ध कराता है, और अपनी Talking-Head-Recut Skill के माध्यम से बोले गए वीडियो पर graphics की synchronization को स्वचालित करता है: अब एक ही prompt से source, styled और subtitled वीडियो कैमरा या editor के बिना तैयार हो सकती है। Pika post-production की इसी logic को आगे बढ़ाता है, एक ऐसे model के साथ जिसे वह « Gemini Omni » कहती है ताकि मौजूदा वीडियो की background, angle और outfit बदली जा सके — और यह attribution, Google की आधिकारिक पुष्टि के अभाव में, इस प्रवृत्ति को भी दिखाती है कि तकनीकी components को शक्ति का आभास देने के लिए नए नाम दिए जाते हैं, जिसे उचित सावधानी के साथ ही लेना चाहिए।

Agents code से निकलकर किसी कंपनी के administrative और financial कामों में प्रवेश कर रहे हैं। Ramp for Agents Replit के agent को कंपनी शामिल करने, Ramp खाता खोलने और ट्रेज़री तथा बिलों का प्रबंधन करने देता है — ऐसा क्षेत्र जो अब तक पूरी तरह मानव के पास था। यही movement छोटे पैमाने पर Pika MCP में भी दिखता है, जो एक experimental MCP server के माध्यम से Pika की creative capabilities को third-party AI agents के लिए खोलता है: agent अब केवल produce नहीं करता, बल्कि उपयोगकर्ता की ओर से third-party services का orchestration करता है।

बहुभाषी AI और बड़े पैमाने पर inference की नींव खुलती जा रही है। GitHub का Multilingual Repositories Dataset 4 करोड़ रिपॉज़िटरी के पैमाने पर दस्तावेज़ित करता है कि कोरियाई, पुर्तगाली और दुनिया भर के code की अन्य भाषाएँ वास्तव में कहाँ रहती हैं — यह बहुभाषी मॉडलों पर काम करने वाले हर शोधकर्ता के लिए एक संसाधन है। MiniMax के M3 के लिए Fireworks AI द्वारा विकसित KV-stationary kernel Blackwell पर sparse attention के सैद्धांतिक लाभों को सुरक्षित रखते हुए infrastructure-side inference के उसी कार्य को दर्शाता है। NVIDIA और CoreWeave के साथ Cohere की मजबूत साझेदारी इस तस्वीर को पूरा करती है: infrastructure reliability स्वयं enterprise AI के लिए एक बिक्री-तर्क बन गई है।

आवाज़ एक अलग उत्पाद चैनल के रूप में स्थापित हो रही है, न कि केवल एक सहायक सुविधा के रूप में। GPT-Live अपने लॉन्च के केवल तीन दिन बाद ही OpenAI में पूरी तरह तैनात हो गया, और प्रयोग को प्रोत्साहित करने के लिए सीमाएँ दोगुनी कर दी गईं; दूसरी ओर Together AI अपनी inference platform द्वारा संचालित voice assistant से कॉल करने वाले को सीधे जोड़ने वाली एक phone line खोलता है। दो अलग-अलग approaches — एक मौजूदा application में एकीकृत, दूसरी एक पारंपरिक फोन से सुलभ — एक ही दाँव के लिए: voice interface models तक पहुँच का एक पूर्ण प्रवेश-बिंदु बन रही है, न कि केवल कई विकल्पों में से एक।


स्रोत