ai-powered-markdown-translatorgpt-5.4-mini के साथ fr से hi में अनुवादित लेख।
4 अगस्त 2026 छह बड़ी घोषणाओं के नाम रहा: Warp अपने कोड एजेंट को एक स्वायत्त CLI के रूप में अलग करता है, GitHub Spark को Copilot के पक्ष में हटाने की योजना बनाता है, OpenAI ChatGPT की वॉइस स्टैक की पूरी पुनर्रचना का विवरण देता है, Black Forest Labs FLUX 3 Video लॉन्च करता है, NVIDIA स्वायत्त वाहनों के लिए अपना खुला मॉडल Alpamayo 2 Super प्रकाशित करता है, और Mistral Shieldstral, अपने ओपन-वेट्स सुरक्षा वर्गीकारक, का अनावरण करता है। इन रिलीज़ों के आसपास Cursor, Amp, DeepSeek, Liquid AI, Google, GitHub Copilot, Pika और Open Secure AI Alliance कई अपडेट जारी करते हैं।
Warp ने Agent CLI लॉन्च किया, किसी भी टर्मिनल के लिए एक स्वायत्त कोड एजेंट
4 अगस्त — Warp अपने कोड एजेंट को Warp टर्मिनल से अलग करता है और उसे एक स्वायत्त CLI के रूप में पेश करता है, जिसे किसी भी एमुलेटर में इंस्टॉल किया जा सकता है: Ghostty, iTerm 2, VS Code, या Windows, Mac और Linux के मूल टर्मिनल। इसकी आर्किटेक्चर एजेंट और शेल के बीच PTY कनेक्शनों की एक मल्टीप्लेक्सिंग परत पर आधारित है, जो tmux जैसी है; इससे स्थायी सत्र संभव होते हैं, जहाँ संदर्भ खोए बिना डायरेक्टरी बदली जा सकती है (cd), लक्ष्य मशीन पर कोई बाइनरी इंस्टॉल किए बिना दूरस्थ नियंत्रण किया जा सकता है, और vim, sqlite, Python REPL या htop जैसे इंटरैक्टिव फुल-स्क्रीन अनुप्रयोगों को नियंत्रित किया जा सकता है।
फीचर्स की बात करें तो, एजेंट स्वतः एक शेल कमांड और प्राकृतिक भाषा के प्रॉम्प्ट में अंतर करता है, आर्ग्युमेंट्स और flags को पूरा करता है, और कार्य की जटिलता के अनुसार उसे अलग-अलग मॉडलों तक रूट करता है — फ्रंटियर मॉडल हों या ओपन-वेट मॉडल, YAML के जरिए अनुकूलन योग्य राउटरों के साथ। यह मल्टी-एजेंट ऑर्केस्ट्रेशन और क्लाउड स्विचओवर को भी संभालता है।
| समर्थित वातावरण | विवरण |
|---|---|
| संगत टर्मिनल | Ghostty, iTerm 2, VS Code, Windows/Mac/Linux के मूल टर्मिनल |
| मासिक सदस्यता | 18 $/माह, 20 $ की inference क्रेडिट शामिल |
| पे-एज़-यू-गो क्रेडिट | 10 $ से शुरू |
| अन्य विकल्प | OpenAI-संगत API कुंजी, या SuperGrok सदस्यता |
यह लॉन्च Warp को प्रतिस्पर्धी CLI एजेंटों (Codex CLI, Claude Code, Gemini CLI) के सामने स्थापित करता है, और केवल एक मॉडल रैपर के बजाय गहरी शेल एकीकरण और क्लाउड ऑर्केस्ट्रेशन पर दांव लगाता है।
🔗 Warp ब्लॉग — Introducing the Warp Agent CLI
GitHub Spark अब नए उपयोगकर्ताओं को स्वीकार नहीं करता, हटाने की योजना तय
4 अगस्त — GitHub Spark, अपनी प्राकृतिक भाषा-आधारित ऐप निर्माण प्लेटफ़ॉर्म, जिसे एक समर्पित inference इंजन (llm()) के साथ लॉन्च किया गया था, को धीरे-धीरे हटा रहा है। 4 अगस्त से नए खाते और नए ऐप बनाना बंद कर दिया गया है।
| हटाने का मील का पत्थर | तारीख |
|---|---|
| नए खातों और ऐप्स का अंत | 4 अगस्त 2026 |
| कोड निर्यात करने की अंतिम तिथि | 31 अगस्त 2026 |
GitHub Models (मोटर llm()) का हटना | 30 जुलाई 2026 (पहले से प्रभावी) |
मौजूदा उपयोगकर्ताओं के पास 31 अगस्त तक अपने ऐप्स का कोड निर्यात करने का समय है, Spark workbench के मेनू (बटन … → Create repository) के जरिए। पहले से डिप्लॉय किए गए ऐप्स इस तारीख के बाद भी काम करते रहेंगे, लेकिन जो ऐप्स llm() फ़ंक्शन का उपयोग करते हैं, उन्हें किसी अन्य inference प्रदाता पर स्विच करना होगा, क्योंकि GitHub Models — जो उन्हें शक्ति देता था — खुद जुलाई के अंत में हटा दिया गया था।
GitHub इस निर्णय को यह कहकर उचित ठहराता है कि Spark के लॉन्च के बाद से AI मॉडल और agentic development टूल्स काफी आगे बढ़ गए हैं, और अब निर्माता Copilot in VS Code, Copilot CLI, या GitHub Copilot ऐप जैसे एकीकृत workflows को प्राथमिकता देते हैं, न कि एक अलग prototyping प्लेटफ़ॉर्म को। यह एक consolidation का संकेत है: GitHub एक अलग “vibe coding” उत्पाद को बंद कर रहा है ताकि अपना AI ऑफर Copilot के आसपास केंद्रित कर सके।
🔗 GitHub Changelog — Upcoming deprecation of GitHub Spark
GPT-Live : OpenAI ने छह महीनों में ChatGPT की आवाज़ आर्किटेक्चर को पुनर्निर्मित किया
3 अगस्त — OpenAI अपने वॉइस सिस्टम की तीसरी पीढ़ी, GPT-Live, का विवरण देता है और बताता है कि पिछली आर्किटेक्चर — जो एक “turn detector” पर आधारित थी, जिसका काम यह अनुमान लगाना था कि उपयोगकर्ता कब बोलना समाप्त कर चुका है — बातचीत की स्वाभाविकता को क्यों सीमित करती थी: बहुत जल्दी अनुमान लगाने पर बात काट जाती है, बहुत देर से अनुमान लगाने पर जवाब फीका पड़ता है। GPT-Live इस डिटेक्टर को ऑडियो पथ से हटा देता है: वॉइस मॉडल full-duplex है, यानी सुनने और बोलने दोनों में एक साथ सक्षम। जब अधिक गहरे reasoning या किसी टूल कॉल की आवश्यकता होती है, GPT-Live फ्रंटियर मॉडलों (जैसे GPT-5.5) से असिंक्रोनस रूप से सलाह लेता है, बिना बातचीत को बाधित किए।
इंजीनियरिंग की बात करें तो, OpenAI ने मीडिया frontend और inference logic को Go में पुनर्लेखित किया, एक Python asyncio implementation को बदलते हुए, जिससे फ्रेम डिलीवरी की नियमितता इतनी बेहतर हुई कि नए सिस्टम का p95 पुराने सिस्टम के p50 के बराबर हो गया। ट्रांसपोर्ट WebRTC पर आधारित है, जो पैकेट लॉस और clock drift को ऑडियो को सूक्ष्म रूप से खींचकर समायोजित करता है। ठोस परिणाम: एक वॉइस सत्र शुरू करने के लिए नेटवर्क के छह round-trip की जगह अब केवल एक रह गया है। यह आर्किटेक्चर पहले से ही ChatGPT Voice की नई क्षमताओं को शक्ति दे रहा है, जिनमें desktop ऐप से कंप्यूटर का नियंत्रण भी शामिल है।
GPT-Live can listen while it speaks. To make that feel natural at ChatGPT scale, we rebuilt the voice stack from client to model. This new architecture keeps audio flowing continuously, so deeper reasoning and tool use don’t interrupt the conversation.
🇮🇳 GPT-Live सुनते हुए बोल भी सकता है। इसे ChatGPT के स्तर पर स्वाभाविक बनाने के लिए, हमने क्लाइंट से लेकर मॉडल तक पूरी वॉइस स्टैक को फिर से बनाया। यह नई आर्किटेक्चर निरंतर ऑडियो प्रवाह बनाए रखती है, ताकि गहन reasoning और टूल का उपयोग बातचीत को बाधित न करें। — @OpenAI on X
🔗 हमने छह महीनों में प्रतिक्रियाशील वॉइस AI के लिए एक रियल-टाइम सिस्टम कैसे बनाया
FLUX 3 Video (Black Forest Labs) : आधिकारिक लॉन्च, API और Runway पर उपलब्ध
4 अगस्त — Black Forest Labs 30 जुलाई को दिखाए गए पूर्वावलोकन के बाद FLUX 3 Video का लॉन्च आधिकारिक बनाता है। मॉडल 20 सेकंड तक के क्लिप 720p और 1080p native में उत्पन्न करता है, native audio के साथ सिंक्रनाइज़्ड (इफेक्ट्स, ambiance, आवाज़, सटीक lip-sync) और लगभग पंद्रह भाषाओं में संवाद, जिनमें अंग्रेज़ी, चीनी, स्पेनिश, फ़्रेंच, जर्मन और जापानी शामिल हैं। यह text-to-video, image-to-video को प्रारंभिक छवि, अंतिम छवि या क्रम में कई keyframes के साथ संभालता है, video continuation, और scene में स्वाभाविक रूप से घुलने-मिलने वाला text overlay भी प्रदान करता है।
Draft mode रचनात्मक दिशाओं को तेज़ी से और कम लागत पर खोजने की सुविधा देता है, उसके बाद पूर्ण गुणवत्ता में final render, जो सत्यापित preview के विषय, composition और movement को बनाए रखता है:
| उत्पादन चरण | मूल्य |
|---|---|
| तेज़ पूर्वावलोकन (Draft mode) | $0,06 प्रति सेकंड |
| पूर्ण गुणवत्ता final render | $0,17 प्रति सेकंड से शुरू |
| अधिकतम अवधि | 20 सेकंड, 1080p native |
मॉडल अभी BFL API के माध्यम से और चयनित साझेदारों पर उपलब्ध है — Runway ने इसे लॉन्च के दिन ही एकीकृत कर दिया। Black Forest Labs आगे बेहतर controllability, multimodal references (छवि, वीडियो, ऑडियो), FLUX 3 Image मॉडल, और FLUX 3 Dev नामक एक ओपन-वेट्स वेरिएंट की घोषणा करता है।
🔗 @bfl_ai on X (FLUX 3 Video घोषणा)
NVIDIA Alpamayo 2 Super, स्वायत्त वाहनों के लिए खुला reasoning मॉडल
4 अगस्त — NVIDIA Alpamayo 2 Super लॉन्च करता है, जो robotaxis, स्वायत्त वाहनों, ट्रकों और शटल्स के लिए एक खुला vision-language-action (VLA) reasoning मॉडल है। यह एक NVIDIA Cosmos 3 Super reasoner को diffusion-based action expert के साथ जोड़ता है, reinforcement learning के माध्यम से post-training के साथ, और 360-डिग्री कैमरा कवरेज के साथ।
| मॉडल घटक | आकार |
|---|---|
| Cosmos 3 Super reasoner | 32 अरब पैरामीटर |
| diffusion action expert | 2 अरब पैरामीटर |
| कुल Alpamayo 2 Super | 34 अरब पैरामीटर |
प्रत्येक ड्राइविंग परिदृश्य के लिए, मॉडल पाँच संयुक्त आउटपुट देता है: नियोजित trajectory, कारण-श्रृंखला reasoning trace, meta-action (रास्ता देना, लेन बदलना, रुकना), प्रशिक्षण के लिए self-labels reasoning, और कैमरा छवि में स्थित दृश्य प्रश्नों के उत्तर। LingoQA benchmark पर, NVIDIA पहले स्थान का दावा करता है, GPT-4o को 23,2 अंकों से पीछे छोड़ते हुए। मॉडल permissive OpenMDW-1.1 लाइसेंस के तहत जारी किया गया है, weights और inference code तुरंत Hugging Face पर उपलब्ध हैं, ताकि बिना अतिरिक्त अनुमति के व्यावसायिक डिप्लॉयमेंट किया जा सके।
Today, we’re launching Alpamayo 2 Super, our frontier open reasoning model for autonomous vehicles. Beyond seeing, Alpamayo understands and reasons through the complex world - thinks before it acts. […] We’re releasing it for commercial use under OpenMDW-1.1 so teams can inspect it, fine-tune it and deploy it—open models advance safety and security. The next wave of AI is robotics—and it starts with autonomous vehicles.
🇮🇳 आज हम Alpamayo 2 Super लॉन्च कर रहे हैं, जो स्वायत्त वाहनों के लिए हमारा अत्याधुनिक खुला reasoning मॉडल है। केवल देखने से आगे, Alpamayo एक जटिल दुनिया को समझता और उस पर तर्क करता है — यह कार्य करने से पहले सोचता है। […] हम इसे OpenMDW-1.1 लाइसेंस के तहत व्यावसायिक उपयोग के लिए प्रकाशित कर रहे हैं ताकि टीमें इसे निरीक्षण कर सकें, fine-tune कर सकें और तैनात कर सकें — खुले मॉडल सुरक्षा को आगे बढ़ाते हैं। AI की अगली लहर robotics है — और इसकी शुरुआत स्वायत्त वाहनों से होती है। — @JensenHuang on X
🔗 NVIDIA ब्लॉग — Alpamayo 2 Super, open model now available
Shieldstral : Mistral ने 3B का ओपन-वेट्स मॉडरेशन मॉडल प्रकाशित किया
4 अगस्त — Mistral Shieldstral लॉन्च करता है, 3 अरब पैरामीटर वाला एक content moderation मॉडल, जो Apache 2.0 लाइसेंस के तहत ओपन-वेट्स में प्रकाशित किया गया है। पारंपरिक fixed-category classifiers के विपरीत, Shieldstral moderation को एक binary question-answer task की तरह मानता है: moderation policy inference के समय प्राकृतिक भाषा में दी जाती है, जिससे बिना retraining के उसे अनुकूलित किया जा सकता है। मॉडल multimodal है (text और image) और discrete label के बजाय calibrated, continuous safety score लौटाता है।
| कवर किया गया कार्य | विवरण |
|---|---|
| Prompts की classification और उत्तरों का moderation | इनपुट और आउटपुट दोनों में समस्याग्रस्त सामग्री का पता लगाता है |
| Refusal detection | पहचानता है जब कोई assistant अनुरोध को अस्वीकार करता है |
| Toxicity detection | टेक्स्ट और छवि |
| नीति-आधारित अनुकूली मूल्यांकन | प्राकृतिक भाषा के प्रॉम्प्ट, बिना retraining के |
Mistral बताता है कि Shieldstral text safety, refusal detection, policy adaptability और multimodal evaluation के मामले में 7 गुना बड़े खुले guardrail मॉडल्स के बराबर या उनसे बेहतर है। मॉडल 16 GB के एकल NVIDIA GPU पर चलता है, जिससे यह मानक infrastructure, यहाँ तक कि local deployment, के लिए भी सुलभ बनता है। Shieldstral Open Secure AI Alliance का पहला सदस्य भी है, वह क्षेत्रीय गठबंधन जिसकी नई SAFE guidelines का विवरण इस लेख में नीचे दिया गया है। weights Hugging Face पर उपलब्ध हैं (mistralai/Shieldstral-1.0-3B)।
कोड टूल्स : Cursor, Amp और Warp तेज़ी ला रहे हैं
Cursor का open-source Mixture-of-Kittens (MoK), उसका MoE training megakernel
4 अगस्त — Cursor open source में Mixture-of-Kittens (MoK) प्रकाशित करता है, जो Mixture-of-Experts आर्किटेक्चर के लिए एक training “megakernel” है, जिसे NVIDIA NVL72 nodes के लिए डिज़ाइन किया गया है। यह kernel MoE से जुड़ी पूरी communication और computation को एक ही deterministic operation में मिला देता है। MoK पहले से ही Cursor में production training चला रहा है, हज़ारों GPU पर।
We’re open-sourcing Mixture-of-Kittens (MoK), our MoE training megakernel for NVL72s. It fuses all Mixture-of-Experts communication and computation into a single, fully deterministic kernel, and runs up to 2.37x faster than the strongest public baselines.
🇮🇳 हम open source में Mixture-of-Kittens (MoK) प्रकाशित कर रहे हैं, जो NVL72 के लिए हमारा MoE training megakernel है। यह Mixture-of-Experts से जुड़ी पूरी communication और computation को एक ही पूरी तरह deterministic kernel में मिला देता है, और सार्वजनिक सर्वोत्तम benchmarks से 2,37x तक तेज़ चलता है। — @cursor_ai on X
Cursor पर मापा गया लाभ: उनकी पिछली DeepEP-आधारित stack की तुलना में end-to-end training throughput में 1,41x वृद्धि।
Amp अपने orbs में किसी भी फ़ाइल को संलग्न करने देता है
4 अगस्त — Amp के “orbs”, उसके cloud agents, अब किसी भी फ़ाइल को attachment के रूप में स्वीकार करते हैं: वीडियो, logs, PDF, spreadsheets, datasets। टीम कई ठोस उपयोगों का उल्लेख करती है: किसी ऐप की स्क्रीन रिकॉर्ड करके Amp को वह ठीक कराने के लिए दिखाना, log files से debugging करना, spreadsheets को interactive websites में बदलना, या audio और video का transcription करना। घोषणा में इन उदाहरणों से परे न तो फ़ाइल आकार की कोई सीमा बताई गई है और न ही सटीक formats।
Warp cloud agents को computer use के जरिए अपना काम सत्यापित करने की क्षमता देता है
3-4 अगस्त — Warp की “cloud software factory” श्रृंखला का चौथा भाग: एक नया verify-behavior skill cloud agents को mouse/keyboard नियंत्रण देता है, ताकि वे रिपोर्ट किए गए bugs को पुनः उत्पन्न कर सकें (mode reproduce) या यह सत्यापित कर सकें कि कोई फ़ीचर अपनी specification से मेल खाता है (mode verify), जिसमें प्राथमिकता video capture को दी जाती है। एक Warp engineer ने आंतरिक डिप्लॉयमेंट की पुष्टि की, और तीन उपयोग बताए: fix और before/after वीडियो के साथ bugs को पुनः उत्पन्न करना, नए उपयोगकर्ता की तरह onboarding यात्रा को पूरा करना, और UI को तेज़ी से सत्यापित करने के लिए Slack या pull request में demo वीडियो पोस्ट करना।
🔗 Warp ब्लॉग — Computer use verification
GitHub Copilot : डेवलपर्स और टीमों के लिए चार नई सुविधाएँ
क्लाउड एजेंट के लिए अनुकूलन योग्य reasoning स्तर
3 अगस्त — Copilot cloud agent को task सौंपते समय, अब मॉडल के reasoning स्तर को चुना जा सकता है, उन मॉडलों के लिए जो इसका समर्थन करते हैं। उच्च स्तर जटिल समस्याओं पर उत्तरों को बेहतर बना सकता है, लेकिन token खपत अधिक होगी। यह सभी Copilot paid plans पर उपलब्ध है: Pro, Pro+, Business, Enterprise और Max।
🔗 GitHub Changelog — Customize the reasoning level
टिप्पणियों से Copilot automatisations शुरू करना
3 अगस्त — Copilot cloud agent automations अब issue या pull request टिप्पणी पर ट्रिगर हो सकती हैं, जिन्हें repository के Agents → Automations टैब से कॉन्फ़िगर किया जा सकता है। तीन उपयोग-केस बताए गए हैं: PR टिप्पणी से documentation उत्पन्न करना, issue टिप्पणी में रिपोर्ट की गई stack trace का विश्लेषण करना, या स्वचालित रूप से follow-up tasks बनाना। यह Copilot Pro, Pro+, Max, Business और Enterprise के लिए उपलब्ध है (enterprise खातों के लिए admin-side policy activation के साथ)।
🔗 GitHub Changelog — Trigger Copilot automations with comments
GitHub की कानूनी टीम Copilot CLI का उपयोग कैसे करती है
4 अगस्त — GitHub के दो आंतरिक वकीलों ने, जिनके पास development अनुभव नहीं था, Copilot CLI के साथ टूल्स बनाए। Ngandu Kasuku (Principal Product Counsel) ने terms-ai बनाया, एक repository जो drafting instructions और contract templates को केंद्रीकृत करती है, जिससे review और drafting समय लगभग आधा हो गया। Jesse Geraci (Online Safety Counsel) ने source code का विश्लेषण करने और DMCA notifications का मूल्यांकन करने के लिए एक application विकसित की, जिसे बाद में license compliance और NDA risk assessment तक विस्तारित किया गया।
🔗 GitHub Blog — How the GitHub legal team used Copilot CLI
कोड कवरेज का स्वचालित सक्रियण, AI-जनित
4 अगस्त — किसी रिपॉज़िटरी की Code Quality सेटिंग्स में, एक नया AI एजेंट स्वतः एक code coverage workflow बनाता है: यह प्रोजेक्ट बनाता है, परीक्षण चलाता है, coverage रिपोर्ट तैयार करता है और उसे GitHub पर भेज देता है, वह भी डिफ़ॉल्ट रूप से न्यूनतम अनुमतियों के साथ। उपयोगकर्ता को समीक्षा और मर्ज करने के लिए तैयार एक pull request मिलती है। यह सुविधा सार्वजनिक preview में है, और github.com, GitHub Enterprise Cloud तथा Team पर उपलब्ध है (अभी Enterprise Server पर नहीं)।
🔗 GitHub Changelog — कोड कवरेज स्वचालित सक्षमकरण
खुले मॉडल और production उपलब्धता
DeepSeek V4 Flash Together AI पर production में उपलब्ध
4 अगस्त — DeepSeek V4 Flash, DeepSeek का तेज़ मॉडल जो जुलाई के अंत में लॉन्च हुआ था, अब Together AI पर production में उपलब्ध है, coding, tool use और लंबे समय तक चलने वाले agents के लिए high-throughput deployment path के साथ। Together AI terminal और full-stack tasks पर बेहतर coding, reasoning effort के तीन स्तर (low, high, maximum), और generation को तेज़ करने के लिए DSpark नामक speculative decoding को प्रमुखता देता है।
Liquid AI ने LFM2.5-2.6B जारी किया, 100% स्थानीय agents के लिए compact model
4 अगस्त — Liquid AI LFM2.5-2.6B जारी करता है, 2.6 billion parameters वाला एक model जो पूरी तरह local पर चलने वाले agents के लिए बनाया गया है, laptop से लेकर phone तक, और 128K tokens की context window के साथ। 2 से 4 गुना बड़े models की तुलना में, यह instruction following में शीर्ष पर है (AIME25 पर 51.87%, LiveCodeBench पर 59.41%) और tool use पर लगभग सभी tested models से आगे है। गति के मामले में: Apple M5 Max पर 220 tokens/second, AMD Ryzen पर 113 tokens/second, और phone पर लगभग 30 tokens/second। Hugging Face पर उपलब्ध, llama.cpp, MLX, vLLM, SGLang और ONNX के साथ compatible।
🔗 Hugging Face Blog — LFM2.5-2.6B
Google और Kaggle ने अपने मुफ्त AI agents course का निष्कर्ष साझा किया
3 अगस्त — Google और Kaggle अपने पाँच-दिवसीय मुफ्त course “AI Agents Intensive: Vibe Coding” का निष्कर्ष प्रकाशित करते हैं, जो production conditions में AI agents के design और deployment पर केंद्रित था। साझा किए गए आँकड़े: 353,000 registered participants, session के दौरान Kaggle Discord पर 392,000 active लोग, और 12,000 से अधिक participants से 6,000 से अधिक final project submissions। Google याद दिलाता है कि Kaggle के साथ उसके intensive courses ने 2024 से अब तक कुल 2 million से अधिक learners को जोड़ा है। सभी सामग्री Kaggle Learn पर self-learning के लिए उपलब्ध रहती है।
🔗 Google Blog — हमारा 353,000-व्यक्ति vibe coding course कैसे चला
मीडिया generation और agentic ecosystem की सुरक्षा
Pika ने API Club लॉन्च किया, 100 से अधिक models का aggregator
4 अगस्त — Pika Labs API Club लॉन्च करता है, 10 $ प्रति माह का subscription जो एक ही API के माध्यम से 100 से अधिक media generation models (video, image, audio, LLM) तक पहुँच देता है, Fal या Runway Dev जैसे providers की तुलना में बड़े discounts के साथ: Seedance 2.0 पर 87% तक, MiniMax H3 पर 50% तक, GPT Image 2 पर 25% तक। Pika का कहना है कि उसने providers से बेहतर prices negotiated किए और अपनी margin बहुत कम रखी, उन aggregation platforms के जवाब में जिन पर वह 3 गुना तक markup लगाने का आरोप लगाती है। यह launch Pika को, जो एक consumer video generation tool के रूप में जाना जाता था, developers और creators के लिए API aggregator के रूप में reposition करता है।
HeyGen ने real estate के लिए automated video formats लॉन्च किए
3 अगस्त — HeyGen “HeyGen for Real Estate” पेश करता है, जो real estate agents के लिए video formats की एक series है, और हर format उपयोगकर्ता के personal avatar का पुनः उपयोग करता है। आज का format, “Hosted Home Tour”, किसी property का guided tour बनाता है: उपयोगकर्ता किसी listing (Zillow) का लिंक चिपकाता है, वैकल्पिक रूप से एक script जोड़ता है, और tool स्वचालित रूप से एक video तैयार करता है जिसमें avatar listing की जानकारी के आधार पर tour प्रस्तुत करता है। श्रृंखला के अन्य formats में “Market Update” और “Listing Spotlight” शामिल हैं।
Open Secure AI Alliance ने Black Hat में अपने SAFE guidelines प्रस्तुत किए
4 अगस्त — Las Vegas में Black Hat 2026 conference के अवसर पर, Open Secure AI Alliance — NVIDIA के नेतृत्व वाला coalition जिसमें अब 120 से अधिक संगठन शामिल हैं (Cisco, CrowdStrike, Hugging Face, Red Hat, Microsoft, Amazon, आदि) — कई contributions की घोषणा करता है। Linux Foundation SAFE (Shared AI Findings Exchange) पर एक request for comments प्रकाशित करती है, जो AI security incidents को confidential रूप से collect और analyze करने, recurring control failures की पहचान करने, और evidence-based recommendations प्रकाशित करने के लिए प्रस्तावित framework है — यह approach threat intelligence sharing से प्रेरित collective defense की है।
Amazon alliance में शामिल होता है और अपना Strands Agents toolkit तथा Cedar authorization language योगदान देता है। Uber open-source ADR (Agentic AI Detection and Response) जारी करता है, एक framework जो production में प्रतिदिन 200,000 से अधिक agent sessions को संभालता है। Mistral इसमें Shieldstral योगदान देता है, जिसका उल्लेख इस article में ऊपर किया गया है और जो alliance का पहला model member बन गया है।
🔗 NVIDIA Blog — Open Secure AI Alliance contributions
OpenAI: Apple को जवाब और नए education plugins
Apple is getting this wrong : OpenAI ने Apple के मुकदमे का जवाब दिया
3 अगस्त — OpenAI Apple द्वारा दायर शिकायत पर एक विस्तृत जवाब प्रकाशित करता है, और आरोपों के तीन हिस्सों पर बिंदुवार प्रतिक्रिया देता है। संपर्कों की समयरेखा पर, OpenAI का कहना है कि Apple अब स्वीकार करता है कि उसके बाहरी वकीलों ने गलत व्यक्ति को लिखा था, और OpenAI के General Counsel के साथ कथित बातचीत कभी हुई ही नहीं। एक पूर्व कर्मचारी के मामले में, जिस पर जाने के बाद confidential information तक पहुँचने का आरोप था (Apple में अंतिम दिन: 22 जनवरी 2026), OpenAI iMessage exchanges प्रकाशित करता है जो दिखाते हैं कि Apple के कर्मचारियों ने ही उससे फ़ाइलें ढूँढने में मदद माँगी थी। 24 साल Apple में काम कर चुके एक पूर्व executive के मामले में, जिस पर trade secrets का उपयोग करने की कोशिश का संदेह था, OpenAI का कहना है कि Apple की कोई confidential information न तो माँगी गई और न उपयोग की गई। OpenAI Apple की preliminary injunction याचिका को “गलत जानकारी पर आधारित और पूरी तरह अनावश्यक” कहता है।
🔗 OpenAI — Apple is getting this wrong
ChatGPT Work और Codex के लिए तीन नए education plugins
4 अगस्त — नए शैक्षणिक सत्र के लिए, OpenAI ChatGPT Edu और ChatGPT for Teachers deployments के लिए तीन plugins लॉन्च करता है: K-12 Educator (प्राथमिक/माध्यमिक के लिए विभेदित संसाधन), College Educator (उच्च शिक्षा के लिए course design और LMS export), और College Student (निर्देशित tutoring, revision sheets, और छात्र द्वारा चुने गए sources से quiz)। लेख में OpenAI और American Federation of Teachers की साझेदारी का उल्लेख है, जो अमेरिकी K-12 शिक्षकों को AI के उपयोग में प्रशिक्षित करने के लिए पाँच-वर्षीय पहल है।
🔗 OpenAI — ChatGPT Work और Codex के साथ सीखें और सिखाएँ
संक्षिप्त समाचार
- Devin Fusion intelligence में 4% आगे बढ़ा और 27% कम खर्चीला है — Cognition internal FrontierCode 1.1 benchmark पर Devin Fusion के harness और models को सुधारता है, जो तुरंत Devin Cloud में उपलब्ध है। 🔗 स्रोत
- Sakana AI AIRoA में शामिल हुआ — कंपनी Japanese Association of AI Robotics की सदस्य बनती है, ताकि world models और physical AI पर उसके RSI Lab के साथ सहयोग हो सके। 🔗 स्रोत
- llama-macos, Hugging Face टीम द्वारा प्रमुखता से दिखाया गया utility — macOS widget (
brew install --cask llama-app) जो machine के अनुसार models सुझाता है और web interface के साथ llama.cpp server लॉन्च करता है। 🔗 स्रोत - Copilot किस चीज़ तक पहुँच सकता है, उस पर और सूक्ष्म नियंत्रण — GitHub Copilot के access पर बढ़ा हुआ नियंत्रण घोषित करता है, हालांकि अभी कोई विस्तृत changelog साथ नहीं है। 🔗 स्रोत
- Copilot CLI के local sandboxing पर समृद्ध documentation — GitHub terminal में local sandboxing को सक्रिय और कॉन्फ़िगर करने पर अपनी documentation को प्रमुखता देता है। 🔗 स्रोत
- Air editor ACP के माध्यम से GitHub Copilot को custom agent के रूप में जोड़ता है — तीसरे पक्ष का tool Air अब Agent Client Protocol के माध्यम से custom agents का समर्थन करता है, Copilot कॉन्फ़िगर करने के लिए guide के साथ। 🔗 स्रोत
- Managed settings के लिए enterprise team-स्तरीय specialization — enterprise administrators समर्पित configuration files के साथ विशिष्ट teams को लक्षित कर सकते हैं। 🔗 स्रोत
- डिफ़ॉल्ट, बड़े पैमाने पर custom code scanning configuration — एक नया repository property default setup पर custom CodeQL configuration लागू करने देता है। 🔗 स्रोत
- Copilot Billing Preview app हटाई गई — Copilot खर्चों का प्रबंधन अब सीधे GitHub billing settings में किया जाता है। 🔗 स्रोत
- Dependabot branch names का customization —
dependabot.ymlमें नए विकल्प, जो Dependabot द्वारा बनाए गए branch names के लिए prefix, length और separators निर्धारित करते हैं। 🔗 स्रोत - CodeQL 2.26.2 में Swift 6.3.3 और Kotlin 2.4.10 का समर्थन जोड़ा गया — GitHub के static analysis engine का अपडेट। 🔗 स्रोत
- Triage role अब issue निर्माण प्रतिबंधों को बायपास कर सकता है — इस role वाले उपयोगकर्ता issue बना सकते हैं, भले ही कोई repository इस action को केवल collaborators तक सीमित करे। 🔗 स्रोत
- Wan (Alibaba) — Camera-to-Image — Wan के real-time suite की नई क्षमता: camera तुरंत वास्तविक परिवेश को anime-शैली के animated scene में बदल देता है। 🔗 स्रोत
- NVIDIA NSF State and Regional AI Hubs कार्यक्रम में शामिल हुआ — अमेरिकी National Science Foundation के regional AI infrastructure hubs कार्यक्रम में भागीदारी, अनुसंधान और शिक्षा के लिए। 🔗 स्रोत
- NVIDIA ने SCADA का विवरण दिया, AI के लिए तेज़ storage access — ऐसी तकनीक जो GPUs को लगभग memory जैसी गति से storage तक सीधे पहुँचने देती है। 🔗 स्रोत
- Stability AI और MusicHackspace ने मॉन्ट्रियल में Stable Audio 3.0 हैकाथॉन आयोजित किया — MUTEK festival के साथ साझेदारी में, 22 और 23 अगस्त को 48 घंटे का हैकाथॉन। 🔗 स्रोत
- Qwen-Image-3.0-Pro विश्व में 5वें स्थान पर पहुँचा — Alibaba किसी निर्दिष्ट न किए गए ranking पर अपने image generation model की बड़ी छलांग की घोषणा करता है। 🔗 स्रोत
- Z.ai (GLM) और Tencent Cloud ने सिंगापुर में अपना पहला community meetup आयोजित किया — GLM-5.2 की agentic क्षमताओं और CodeBuddy तथा WorkBuddy के साथ उसके एकीकरण की प्रस्तुति। 🔗 स्रोत
- Circles ने OpenAI API और Codex के साथ telecom अनुभव को अनुकूलित किया — enterprise case study: +22% ARPU, -9% churn, ग्राहक समर्थन की 65% स्वायत्त समाधान दर। 🔗 स्रोत
इसका क्या मतलब है
Code tools अब केवल IDE के दायरे से बाहर निकलते जा रहे हैं। Warp अपने CLI agent को अलग करता है जो किसी भी terminal को नियंत्रित कर सकता है, GitHub Copilot cloud agent को customizable reasoning level और comment-based triggers मिलते हैं, Amp किसी भी प्रकार की file को attachment के रूप में स्वीकार करता है, और Warp अपने cloud agents को computer use के माध्यम से अपना काम स्वयं जाँचने की क्षमता देता है। GitHub की legal team का testimony, जिसने बिना development experience के Copilot CLI के साथ अपने खुद के tools बनाए, एक बड़े बदलाव को दिखाता है: ये agents अब उतने ही non-developers के लिए भी हैं जितने engineers के लिए।
Agents की यह बढ़ती ताकत proliferation के बजाय platforms के consolidation के साथ आ रही है। GitHub Spark, अपनी natural language application prototyping platform, को लॉन्च के डेढ़ साल बाद बंद कर रहा है, और इसके बदले Copilot पर अपने अलग-अलग surfaces (VS Code, CLI, app, cloud agent) में एक एकल दांव लगा रहा है। यह संकेत है कि standalone “vibe coding” market कुछ integrated offerings के इर्द-गिर्द सिमट रहा है, बजाय अलग-अलग products को बढ़ाने के।
Agentic AI की security एक structured ecosystem के रूप में संगठित हो रही है। Mistral Shieldstral प्रकाशित करता है, एक open-weights moderation classifier जो एक ही GPU पर चलता है, और Open Secure AI Alliance का पहला model member बन जाता है — 120 से अधिक संगठनों का coalition, जो अब Linux Foundation के माध्यम से AI security incidents के confidential sharing के लिए SAFE framework प्रस्तावित करता है, जो classic cybersecurity threat intelligence से सीधे प्रेरित है। Amazon और Uber भी अपने-अपने open source tools इसमें योगदान देते हैं। यह इस बात का संकेत है कि agents की सुरक्षा अब isolated proprietary उपायों के जोड़ के बजाय एक collective और documented प्रयास बन रही है।
अंत में, media generation और real-time compute की अर्थव्यवस्था access cost के मामले में लगातार सस्ती होती जा रही है। FLUX 3 Video final render से पहले ideas को explore करने के लिए $0.06 प्रति second का Draft mode पेश करता है, Pika अपने consumer product को 10 $ प्रति माह के API aggregator में बदल देता है ताकि अन्य platforms के ऊँचे margins से बचा जा सके, और NVIDIA open weights में Alpamayo 2 Super प्रकाशित करता है ताकि autonomous driving industry के पास zero से शुरू करने के बजाय एक साझा reasoning base हो। यही रुझान voice की तरफ भी दिखता है: OpenAI द्वारा GPT-Live का पुनर्रचना, जो एक voice session के startup time को छह गुना घटा देती है, दिखाती है कि real-time infrastructure भी अब उतना ही active optimization का क्षेत्र बन गया है, जितना स्वयं models।
स्रोत
- Warp — Warp Agent CLI का परिचय
- GitHub Changelog — GitHub Spark के आगामी बंद होने की सूचना
- OpenAI — हमने प्रतिक्रियाशील वॉइस AI के लिए एक रियलटाइम सिस्टम कैसे बनाया
- @OpenAI X पर — GPT-Live थ्रेड
- @bfl_ai X पर — FLUX 3 Video
- NVIDIA Blog — Alpamayo 2 Super, अब उपलब्ध ओपन मॉडल
- @JensenHuang X पर — Alpamayo 2 Super
- Mistral — Shieldstral
- @cursor_ai X पर — Mixture-of-Kittens
- Amp News — Attach Anything
- Warp Blog — कंप्यूटर उपयोग सत्यापन
- GitHub Changelog — Copilot cloud agent के लिए तर्क स्तर को अनुकूलित करें
- GitHub Changelog — टिप्पणियों के साथ Copilot automations ट्रिगर करें
- GitHub Blog — GitHub legal team ने Copilot CLI का उपयोग कैसे किया
- GitHub Changelog — Code coverage का स्वचालित सक्षमकरण
- @togethercompute X पर — DeepSeek V4 Flash
- Hugging Face Blog — LFM2.5-2.6B
- Google Blog — AI Agents Intensive recap 2026
- @pika_labs X पर — API Club
- NVIDIA Blog — Open Secure AI Alliance के योगदान
- @HeyGen X पर — Hosted Home Tour
- OpenAI — Apple इसे गलत समझ रहा है
- OpenAI — ChatGPT Work और Codex के साथ सीखें और सिखाएँ
- @cognition X पर — Devin Fusion
- @SakanaAILabs X पर — AIRoA
- @mervenoyann X पर — llama-macos
- @github X पर — Copilot पहुँच नियंत्रण
- @github X पर — Copilot CLI का sandboxing
- @getsome_air X पर — ACP के माध्यम से Copilot
- GitHub Changelog — Enterprise टीम विशेषीकरण
- GitHub Changelog — बड़े पैमाने पर Code scanning का डिफ़ॉल्ट सेटअप
- GitHub Changelog — Copilot Billing Preview ऐप को समाप्त करना
- GitHub Changelog — Dependabot pull request branch नामों को अनुकूलित करें
- GitHub Changelog — CodeQL 2.26.2
- GitHub Changelog — Triage role issue निर्माण प्रतिबंधों को बायपास कर सकता है
- @Alibaba_Wan X पर — Camera-to-Image
- NVIDIA Blog — NSF State and Regional AI Hub कार्यक्रम
- NVIDIA Blog — SCADA, AI के लिए त्वरित स्टोरेज एक्सेस
- @StabilityAI X पर — Stable Audio 3.0 हैकाथॉन
- @Alibaba_Qwen X पर — Qwen-Image-3.0-Pro
- @tencentcloud X पर — Z.ai सिंगापुर मीटअप
- OpenAI — Circles