खोजें

MiniMax ने H3 लॉन्च किया, खुले वज़न की घोषणा, Together AI ने टोकन वृद्धि 10000 गुना होने का दावा किया, GitHub ने जोखिमभरे npm टोकनों पर लगाम लगाई

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
MiniMax ने H3 लॉन्च किया, खुले वज़न की घोषणा, Together AI ने टोकन वृद्धि 10000 गुना होने का दावा किया, GitHub ने जोखिमभरे npm टोकनों पर लगाम लगाई

ai-powered-markdown-translator

gpt-5.4-mini के साथ fr से hi में अनुवादित लेख।

GitHub पर प्रोजेक्ट देखें ↗

MiniMax ने H3 लॉन्च किया, एक सामान्य-उद्देश्य वाला मल्टीमॉडल मॉडल, जिसमें मूल स्टीरियो ध्वनि और घोषित खुले वज़न « अगले कुछ दिनों में » शामिल हैं। Together AI ने सेवा दिए गए टोकनों की मात्रा में भारी वृद्धि का दावा किया है, जबकि GitHub ने खातों पर कब्ज़ा करने वाले हमलों की लहर के बाद npm टोकनों की सुरक्षा कड़ी कर दी है। इन तीन विषयों के आसपास, दिन खास तौर पर इमेज और वीडियो जनरेशन (Runway, Wan Video, Luma, Black Forest Labs, Ideogram), कोड-एजेंट टूलिंग (Devin, Replit, GitHub Actions) और OpenAI तथा Google में मॉडल ट्रांज़िशन के मामले में काफी व्यस्त रहा।


MiniMax H3 : एक सामान्य-उद्देश्य वाला मल्टीमॉडल मॉडल, खुले वज़न की घोषणा

31 जुलाई — MiniMax ने H3 लॉन्च किया, जिसे एक सामान्य-उद्देश्य वाला मल्टीमॉडल जनरेशन मॉडल बताया गया है। पिछली पीढ़ियों (Hailuo 01 और 02) के विपरीत, जो कार्यों को विशेष मॉडलों में बाँटती थीं, H3 इन क्षमताओं को एक ही मॉडल में एकीकृत करता है, जो पाठ, छवि, वीडियो और ऑडियो के मिश्रित संदर्भ को समझ सकता है। इसकी सबसे प्रमुख विशेषता वीडियो के साथ संयुक्त रूप से जनरेट की गई मूल स्टीरियो ध्वनि है, जो 2K रिज़ॉल्यूशन में 15 सेकंड तक की क्लिप्स पर उपलब्ध है।

MiniMax आक्रामक कीमत-प्रदर्शन स्थिति पर ज़ोर देता है: 2K में प्रति सेकंड कीमत « मुख्यधारा » मॉडलों की कीमत के एक-तिहाई से भी कम बताई गई है, और 768p में, उन्हीं मॉडलों के 720p की कीमत के आधे से भी कम। H3 कई मालिकाना घटकों (Contextual Omni Representation, H3-VAE, H3-Omni Transformer, In-Context Regeneration) पर आधारित है और संपादन को सामान्यीकृत ढंग से संभालता है: image-to-image, image-to-video, audio-to-audio, video-to-video motion transfer, साथ ही टेक्स्ट और ब्रांड तत्वों का सटीक रेंडरिंग — जो वीडियो जनरेशन मॉडलों में अक्सर एक कमजोर बिंदु होता है।

MiniMax ने मॉडल के वज़न जल्द ही सार्वजनिक करने की भी घोषणा की है, जिसे हार्डवेयर संगतता तेज़ करने और ऐतिहासिक रूप से बंद मॉडलों के प्रभुत्व वाले क्षेत्र में open source समुदाय का समर्थन करने के एक तरीके के रूप में प्रस्तुत किया गया है। लॉन्च के साथ लगभग पंद्रह भागीदारों पर day-0 तैनाती भी हुई, जिनमें Runway, Pika, Leonardo.Ai, OpenRouter और Krea शामिल हैं।

विशेषताविवरण
रिज़ॉल्यूशनडिफ़ॉल्ट रूप से 2K
अधिकतम अवधि15 सेकंड
ऑडियोमूल स्टीरियो, संयुक्त रूप से जनरेट किया गया
2K में कीमतmainstream मॉडलों की कीमत/सेकंड के एक-तिहाई से कम
768p में कीमत720p mainstream की कीमत के आधे से कम
खुले वज़न« अगले कुछ दिनों में » घोषित

MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities — Today, we’re launching MiniMax H3, a general-purpose multimodal generation model. H3 understands unified context across text, images, video, and audio, generating video with native stereo sound, up to 15 seconds at 2K resolution.

🇮🇳 MiniMax H3: एक खुला मॉडल जो कार्यों और विधाओं के बीच की सीमाएँ मिटा देता है — आज हम MiniMax H3 लॉन्च कर रहे हैं, एक सामान्य-उद्देश्य वाला मल्टीमॉडल जनरेशन मॉडल। H3 पाठ, छवियों, वीडियो और ऑडियो में एकीकृत संदर्भ को समझता है, और 2K रिज़ॉल्यूशन में 15 सेकंड तक मूल स्टीरियो ध्वनि के साथ वीडियो जनरेट करता है।@MiniMax_AI on X

🔗 पूरक फ़िल — @MiniMax_AI on X


Runway पर Grok Imagine Video 1.5 उपलब्ध

1 अगस्त — Runway अपने तृतीय-पक्ष मॉडल कैटलॉग का विस्तार जारी रखते हुए xAI के जनरेशन मॉडल के वीडियो संस्करण Grok Imagine Video 1.5 को सीधे अपनी प्लेटफ़ॉर्म पर उपलब्ध करा रहा है। यह इंटीग्रेशन Runway की उस रणनीति का हिस्सा है जिसमें वह कई प्रकाशकों के frontier मॉडलों को — पिछले दिन उसने MiniMax H3 भी जोड़ा था — अपनी creative production प्लेटफ़ॉर्म में एकत्रित करता है, बजाय इसके कि केवल अपने Gen मॉडलों पर निर्भर रहे।

🔗 घोषणा — @runwayml on X


Wan Video (Alibaba) ने स्केच और टेक्स्ट के लिए Realtime मोड लॉन्च किया

31 जुलाई — Alibaba ने wan video के Labs सेक्शन में एक Realtime मोड ऑनलाइन किया, जो ड्रॉइंग के साथ-साथ एक स्केच को photorealistic दृश्य में बदल देता है — पतली-सी आकृति, लगभग-सा आयत, कुछ रेखाएँ — बिना किसी स्पष्ट जनरेशन चरण या « generate » बटन के। उसी दिन, Alibaba ने एक दूसरा Realtime मोड भी प्रस्तुत किया, इस बार टेक्स्ट के लिए: उपयोगकर्ता के वर्णन टाइप करते ही छवि सीधे संपादित होती रहती है, वाक्य दर वाक्य, बिना किसी लोडिंग स्क्रीन के। ये दोनों फ़ीचर इमेज जनरेशन अनुभव को पारंपरिक prompt/generation चक्र की बजाय ड्रॉइंग या वर्ड-प्रोसेसिंग जैसी सतत बातचीत के क़रीब ले आते हैं।

🔗 घोषणा — @Alibaba_Wan on X


Luma ने Layers लॉन्च किया, Uni-1 से संचालित लेयर्ड इमेज एडिटिंग

30 जुलाई — Luma ने Luma Agents के भीतर Layers तैनात किया है, जो उसके Uni-1 मॉडल से संचालित है। विचार यह है: एजेंट से किसी मौजूदा छवि के लेयर्स निकालने के लिए कहना (Luma द्वारा जनरेट की गई या उपयोगकर्ता द्वारा आयातित), फिर साधारण बातचीत के ज़रिए किसी विशिष्ट तत्व को संशोधित करना, जबकि छवि के बाकी हिस्से को जस का तस रखना — चाहे वह सामने रखा गया उत्पाद हो, पृष्ठभूमि हो, या कोई टेक्स्ट। Luma इस सुविधा को दो उदाहरणों से दिखाता है: एक साधारण सपाट JPG से rebranding पोस्टर का पूर्ण पुनर्निर्माण, और प्रकाश या सेटिंग को छुए बिना एक दृश्य में किसी अलग-थलग वस्तु को जोड़ना। उद्देश्य लक्षित और पुनरावृत्तीय रिटचिंग को संभव बनाना है, बजाय एक छोटे-से बदलाव के लिए पूरी छवि को फिर से जनरेट करने के।

🔗 घोषणा — @LumaLabsAI on X


Black Forest Labs ने FLUX 3 का एक पूर्वावलोकन दिखाया

30 जुलाई — Black Forest Labs (BFL), FLUX मॉडलों के प्रकाशक, ने अपने आगामी मॉडल FLUX 3 का पहला सार्वजनिक पूर्वावलोकन Nous Research के Hermes agent पर 48 घंटे की अस्थायी पहुँच के माध्यम से दिया। यह agent कई जनरेट किए गए plans को जोड़कर एक ही end-to-end prompt से पूरी short film तैयार करता है। इस घोषणा के साथ Nous Research द्वारा पूरे सप्ताह आयोजित एक short-film प्रतियोगिता और उसके बाद वाले शुक्रवार को San Francisco में होने वाले BFL कार्यक्रम में FLUX 3 की प्रत्यक्ष प्रस्तुति भी शामिल है। BFL ने इस चरण में न तो सामान्य उपलब्धता की तारीख साझा की है, न ही मॉडल की क्षमताओं पर कोई तकनीकी विवरण।

🔗 घोषणा — @bfl_ai on X


Ideogram ने Pruna AI के साथ P-Image-Ideogram लॉन्च किया, Pareto-उत्तम मॉडलों की श्रृंखला

30 जुलाई — Ideogram ने Pruna AI के साथ मिलकर P-Image-Ideogram नामक इमेज मॉडलों की एक नई श्रृंखला लॉन्च की है, जो गुणवत्ता, गति और लागत पर एक साथ अनुकूलित है। यह मॉडल चार quality मोड (Very low, Low, Medium, High), 1K और 2K में मूल जनरेशन, और प्रति छवि 0,003 डॉलर की शुरुआती कीमत, साथ ही मोड के अनुसार 3 से 8 सेकंड के बीच घोषित latency प्रदान करता है। Design Arena रैंकिंग (अंधे मानव वोट) में, Ideogram preference/cost और preference/speed के लिए एक नया Pareto frontier दावा करता है: 1K में, सबसे किफ़ायती मोड लगभग 3 सेकंड की जनरेशन के लिए 0,3 ¢/image आता है, यानी मूल्यांकित मॉडलों के औसत से लगभग 8,6 गुना तेज़। ComfyUI, Runware, Replicate, Leonardo.Ai और Together AI सहित लगभग पंद्रह साझेदार प्लेटफ़ॉर्म्स पर तुरंत तैनाती।

गुणवत्ता मोडरिज़ॉल्यूशन1K में कीमतअनुमानित विलंबता
Very lowमूल 1K/2K0,3 ¢/image~3 s
Lowमूल 1K/2K0,75 ¢/image~3 s
Mediumमूल 1K/2Kनिर्दिष्ट नहीं8 s तक
Highमूल 1K/2Kनिर्दिष्ट नहीं8 s तक

🔗 घोषणा — @ideogram_ai on X


Devin ने Outposts लॉन्च किया, किसी भी कंप्यूटर पर एप्लिकेशन का मूल निष्पादन

31 जुलाई — Devin के प्रकाशक Cognition ने Outposts नाम की एक नई सुविधा की घोषणा की है। यह Devin agent को सीधे किसी भी कंप्यूटर पर एप्लिकेशन मूल रूप से चलाने और उनका परीक्षण करने देती है, बजाय इसके कि वह केवल अलग-थलग cloud environments पर निर्भर रहे। यह क्षमता Cognition की हालिया native execution घोषणाओं की निरंतरता में आती है — कल घोषित macOS cloud agents के माध्यम से native iOS support — और उन कार्यों के दायरे को बढ़ाने का लक्ष्य रखती है जिन्हें Devin शुरू से अंत तक संभाल सकता है, जिसमें उपयोगकर्ता के workstation की विशिष्ट hardware या software configuration भी शामिल है।

🔗 घोषणा — @cognition on X


Replit ने Model Selector, Follow-up Tasks और एक नया usage पेज तैनात किया

31 जुलाई — अपने साप्ताहिक राउंडअप « This Week in Replit » में, Replit कई नई सुविधाओं का विवरण देता है। Model Selector अब Core और Pro योजनाओं के लिए उपलब्ध है, जिसमें मालिकाना मॉडलों के साथ-साथ खुले वज़न वाले मॉडल भी शामिल हैं — उपयोगकर्ता नियंत्रण रख सकता है, या Replit को स्वतः सिफारिश करने दे सकता है। Follow-up Tasks इस सप्ताह सभी उपयोगकर्ताओं के लिए उपलब्ध हो गया है: किसी कार्य को पूरा करने के बाद, Agent अगला कदम सुझाता है जिसे एक क्लिक में सक्रिय किया जा सकता है और जो पृष्ठभूमि में निष्पादित होता है। दो और समायोजन इस सप्ताह को पूरा करते हैं: पुनर्निर्मित usage पेज, जो तारीख, संसाधन, परियोजना, workspace, समूह और उपयोगकर्ता के अनुसार लगभग real-time ट्रैकिंग प्रदान करता है, और एक विस्तारित user session (डिफ़ॉल्ट logout 7 से बढ़ाकर 14 दिन)।

सुविधास्थिति
Model Selectorऑनलाइन, Core और Pro योजनाएँ, खुले मॉडल शामिल
Follow-up Tasksसभी उपयोगकर्ताओं के लिए तैनात
usage पेजपुनर्निर्मित, लगभग real-time ट्रैकिंग
session अवधि7 से 14 दिन तक बढ़ाई गई

🔗 घोषणा — @Replit on X


Together AI : open inference का scale-up

Together AI इस सप्ताह dedicated inference के आसपास कई घोषणाएँ कर रहा है, दो अलग-अलग पहलुओं पर: उपयोग पक्ष पर भारी वृद्धि का एक आँकड़ा, और अंतर्निहित infrastructure के autoscaling पर एक विस्तृत तकनीकी लेख।

सेवा दिए गए टोकनों की वृद्धि 10000 से अधिक गुना

1 अगस्त — Together AI एक प्रभावशाली वृद्धि आँकड़ा पेश करता है: सेवा दिए गए टोकनों की इसकी मात्रा 30 अरब प्रति माह से बढ़कर 400000 अरब (400 ट्रिलियन) प्रति माह हो गई है, यानी 10000 गुना से भी अधिक। कंपनी इस प्रगति को proprietary बंद APIs की बजाय open-weight मॉडलों की ओर बड़े पैमाने के कार्यभार के migration से जोड़ती है। यह आँकड़ा किसी स्पष्ट संदर्भ अवधि के बिना प्रस्तुत किया गया है, इसलिए इसकी तुलनात्मक उपयोगिता सीमित रहती है।

Josh had to stop @vipulved and ask him to repeat the number: @wolfejosh Together AI went from serving 30B tokens a month to 400T. Over 10,000x growth as AI-native companies and enterprises move scaled workloads to open model.

🇮🇳 Josh को @vipulved को बीच में रोककर यह संख्या दोहराने के लिए कहना पड़ा: Together AI 30 अरब सेवा-प्राप्त टोकनों प्रति माह से बढ़कर 400000 अरब पर पहुँच गया है। 10000 गुना से अधिक की वृद्धि, जो AI-native कंपनियों और बड़े खातों के अपने बड़े पैमाने के कार्यभार के लिए खुले मॉडलों की ओर migration से संचालित है।@togethercompute on X

समर्पित inference के autoscaling को संचालित करने के लिए आठ मीट्रिक

31 जुलाई — Together AI अपनी Dedicated Model Inference के autoscaling पर एक तकनीकी लेख प्रकाशित करता है। शुरुआती निष्कर्ष: web दुनिया से विरासत में मिले पारंपरिक मीट्रिक (CPU/GPU उपयोग) LLM inference engine पर वास्तविक दबाव को नहीं दर्शाते — एक GPU 60% उपयोग दिखा सकता है जबकि उसकी queue पहले से ही संतृप्त हो, क्योंकि उपयोग गणना की तीव्रता को मापता है, प्रतीक्षा में पड़े भार को नहीं। लेख inference-नेटिव आठ मीट्रिकों का वर्णन करता है, जिन्हें तीन परिवारों (concurrency, SLO, efficiency) में बाँटा गया है, और inflight_requests को डिफ़ॉल्ट मीट्रिक के रूप में सुझाता है। यह H100 GPU पर cold start की वास्तविक लागत भी बताता है: एक base model के लिए लगभग 86 सेकंड, 18 GB fine-tune के लिए 145 सेकंड, और एक replica जोड़ने के लिए लगभग 2,5 मिनट।

मापी गई अवस्था1×H100 पर अवधि
base मॉडल तैनाती86 s
fine-tune (18 GB) तैनाती145 s
1 से 2 replicas तक वृद्धि~2,5 min

🔗 पूर्ण तकनीकी लेख


Ai2 — इन्फ़िनी-ग्राम आधारित अध्ययन AI-लिखी पुस्तकों में उधार ली गई भाषा का पता लगाता है

31 जुलाई — Ai2 (Allen Institute for AI) अपने infini-gram इंजन पर आधारित एक अध्ययन को उजागर करता है, जो विशाल पाठ कॉर्पस को index करता है और किसी भी वाक्यांश के सटीक प्रकट होने की आवृत्ति गिनता है, जिससे किसी वाक्य-रचना के संभावित स्रोतों तक पहुँचा जा सकता है। Tuhin Chakrabarty (Stony Brook University) की टीम ने « दुर्लभ अभिव्यक्तियाँ » — ऐसी संरचनाएँ जो अधिकतम पाँच Google Books में दिखाई देती हैं और indexed web में अनुपस्थित हैं — को अलग किया और self-published, उच्च AI-सामग्री-निर्धारित किताबों, AI-नहीं-पाई गई self-published किताबों, और पुरस्कृत साहित्य के बीच उनकी उपस्थिति दर की तुलना की। परिणाम: उच्च AI-सामग्री वाली किताबों में दुर्लभ अभिव्यक्तियों का अनुपात काफ़ी अधिक है, जो प्रशिक्षण डेटा से आए पैटर्न पर अधिक निर्भरता का संकेत देता है।

मूल्यांकित समूहदुर्लभ अभिव्यक्तियों में कवरेज
शीर्ष 200 self-published, AI strongly detected41,6 %
शीर्ष 200 self-published, AI not detected37,2 %
पुरस्कृत या नामांकित साहित्य (संदर्भ)19,1 %

🔗 पूर्ण लेख — Ai2


Gemini 3.5 Flash Cyber, प्रतिबंधित पहुँच वाला cybersécurité-समर्पित मॉडल

31 जुलाई — Google ने चुपचाप अपनी Flash मॉडल family में एक नया सदस्य जोड़ा है: Gemini 3.5 Flash Cyber। इस महीने घोषित उपभोक्ता संस्करणों (3.6 Flash, 3.5 Flash-Lite) के विपरीत, यह मॉडल एक बहुत ही विशिष्ट उपयोग के लिए बनाया गया है — बड़े पैमाने पर software vulnerabilities का पता लगाना और उन्हें ठीक करना — और केवल इसी use case के लिए अनुकूलित एक किफ़ायती मॉडल बना रहता है। पहुँच जानबूझकर governments और trusted partners तक सीमित है, जिससे यह सभी के लिए खुला commercial product होने के बजाय defensive cybersecurity tool बन जाता है। इस घोषणा के साथ न तो कोई dedicated product page है, न benchmark, न architecture विवरण: अभी उपलब्ध एकमात्र स्रोत @GoogleAI का एक biweekly recap thread है, जो फिलहाल इसके बारे में कही जा सकने वाली बातों की गहराई सीमित करता है।

उसी recap thread में Gemini Notebook (पूर्व NotebookLM) में Collections की भी घोषणा की गई है, जो notebooks को समूहित करने का एक नया तरीका है। यहाँ भी, केवल एक वाक्य, बिना किसी capture या संबद्ध documentation के।

🔗 सारांश थ्रेड — @GoogleAI on X


Copilot Gemini 2.5 Pro और Gemini 3 Flash को अप्रचलित करता है

31 जुलाई — GitHub अपनी Copilot की सभी सुविधाओं (Chat, inline edits, ask और agent modes, code completions) से Gemini 2.5 Pro और Gemini 3 Flash को हटा रहा है, और उपयोगकर्ता पक्ष पर किसी कार्रवाई की आवश्यकता नहीं है — मॉडल स्वतः चयनकों से गायब हो जाएंगे। उपयोगकर्ताओं को Gemini 3.1 Pro (Preview) और Gemini 3.6 Flash पर स्विच करने के लिए कहा जा रहा है। प्रशासनिक पक्ष में, Enterprise संगठनों को यह सत्यापित करना होगा कि उनकी model policies इन प्रतिस्थापनों की अनुमति देती हैं, इससे पहले कि उनकी टीमें उन्हें VS Code और github.com पर Copilot Chat के selector में देख पाएँ। यह अप्रचलन Copilot में पेश किए गए मॉडलों के तेज़ी से बदलते रोटेशन की गति को दर्शाता है, जहाँ पिछली पीढ़ी के Gemini संस्करण Google के सबसे नए iterations के लिए जगह छोड़ रहे हैं।

🔗 आधिकारिक Changelog


npm 2FA bypass के लिए GAT tokens पर प्रतिबंध लगाता है

31 जुलाई — GitHub npm के granular access tokens (GAT) की क्षमताओं को सीमित कर रहा है, जब उन्हें two-factor authentication (2FA) को bypass करने के लिए कॉन्फ़िगर किया गया हो। अब तक, इस तरह का leaked token किसी account पर पूरा नियंत्रण लेने के लिए इस्तेमाल हो सकता था: दूसरे tokens बनाना, maintainer जोड़ना, package permissions बदलना। अब, इन संवेदनशील operations के लिए interactive 2FA challenge ज़रूरी होगा, भले ही token सामान्यतः 2FA से मुक्त हो। यह उपाय तुरंत प्रभावी है; एक दूसरा चरण जनवरी 2027 के लिए योजनाबद्ध है, जब ये tokens सीधे packages publish करने की क्षमता भी खो देंगे, जिससे automation teams trusted publishing (OIDC-आधारित) की ओर बढ़ेंगी। केवल npm tokens प्रभावित हैं — सामान्य GitHub tokens (PAT, GitHub App, Actions) बिना किसी बदलाव के काम करते रहेंगे। यह हाल के महीनों में open source ecosystem में देखे गए npm package takeover attacks की लहर पर एक सीधी प्रतिक्रिया है।

🔗 आधिकारिक Changelog


GitHub Actions में actions को refer करने के लिए self-repository syntax

30 जुलाई — GitHub Actions एक नया syntax, $/, पेश कर रहा है, ताकि उसी repository में स्थित किसी action या reusable workflow को संदर्भित किया जा सके जिस repository में calling workflow है। अब तक, इस तरह के internal reference के लिए या तो ./ का उपयोग करना पड़ता था, जिसके साथ explicit checkout step जोड़ना पड़ता था, या फिर version को hardcode करना पड़ता था। $/ के साथ, reference अपने आप चल रहे exact commit की ओर संकेत करता है, बिना अतिरिक्त checkout step के, और हर जगह काम करता है जहाँ ./ का उपयोग होता था: workflow steps, composite actions, nested composition, और reusable workflows के calls। इस नए फीचर के लिए runner version 2.336.0 या उससे नया होना चाहिए। इसका मुख्य लाभ: संगठनों को ऐसी policies लागू करने देना जो actions को पूर्ण commit SHAs पर pin करने की मांग करती हैं, जबकि internal references को चल रहे ref के साथ स्वतः synced रखा जा सके।

🔗 आधिकारिक Changelog


OpenAI 31 अगस्त को ChatGPT से GPT-5.4 और GPT-5.4 mini हटाता है

31 जुलाई — OpenAI ने घोषणा की है कि 31 अगस्त से account के माध्यम से sign in करने वाले उपयोगकर्ताओं के लिए ChatGPT interface से GPT-5.4 और GPT-5.4 mini हटा दिए जाएँगे। हालाँकि, दोनों models OpenAI API के माध्यम से तथा API key से authenticated Codex sessions में उपलब्ध रहेंगे — यानी यह अंतर ChatGPT app/web उपयोगकर्ताओं को प्रभावित करता है, लेकिन API या API key के साथ Codex का उपयोग करने वाले developers को नहीं। यह घोषणा जुलाई के अंत की GPT-5.6 (Luna/Terra) pricing update की निरंतरता में है, जो ChatGPT lineup को सबसे नए models की ओर तेज़ी से ले जा रही है।

🔗 घोषणा — @OpenAIDevs on X


Codex CLI में ImageGen: नया lightbox और canvas

30 जुलाई — OpenAI Devs ने Codex CLI में अंतर्निहित ImageGen function को एक नए “lightbox” interface और एक dedicated canvas के साथ अपडेट किया है। यह बदलाव Codex workflow के भीतर सीधे generated images की exploration और fine-tuning को आसान बनाने के लिए है, बिना context बदले। यह एक नया model नहीं, बल्कि ergonomics में सुधार है, लेकिन यह OpenAI में प्राथमिकता से ट्रैक किए जाने वाले CLI tool को सीधे प्रभावित करता है।

🔗 घोषणा — @OpenAIDevs on X


संक्षिप्त समाचार

  • Amp — orbs की शुरुआत 20 % तेज़, Puck assistant GPT-5.6 Sol पर स्विच — Amp लगभग 20 % तेज़ orb (remote machines) startup और उपयोगकर्ताओं की बहुत आलोचनात्मक प्रतिक्रिया के बाद अपने Puck assistant को GPT-5.6 Sol पर स्विच करने की घोषणा करता है। 🔗 स्रोत
  • Hugging Face ने DeepSeek-V4-Flash-0731 के लिए एक मुफ्त public endpoint जारी किया — Hugging Face का एक कर्मचारी रिलीज़ के उसी दिन, OpenAI-compatible, token-रहित मुफ्त endpoint ऑनलाइन करता है ताकि model का परीक्षण किया जा सके। 🔗 स्रोत
  • Sakana AI — OSINT Diver 2026 CTF में 5वाँ स्थान — Fugu-ultra 1.1-आधारित OSINT agent का उपयोग करने वाली Sakana AI की एक defense/intelligence टीम 850 से अधिक सहभागी teams में 5वें स्थान पर रहती है। 🔗 स्रोत
  • Together AI पर Kimi K3 — OpenRouter के अनुसार सबसे कम कीमत और सबसे अच्छा cache rate — OpenRouter dashboard के डेटा से पता चलता है कि Together AI, Kimi K3 के लिए सबसे कम rates में से एक और prompt cache के सबसे अच्छे success rates में से एक प्रदान करता है। 🔗 स्रोत
  • एक खुला video model (Marlin-2B) लगभग 10 डॉलर में 370 घंटे के public archives को searchable बनाता है — समुदाय का एक सदस्य Hugging Face Jobs पर Marlin-2B के साथ Prelinger Archives की 1 864 फिल्मों को index करता है, जिससे 23 148 searchable moments बनते हैं। 🔗 स्रोत
  • GitHub developers के बीच accessibility tools के उपयोग का सर्वेक्षण करता है — यह survey 31 अगस्त 2026 तक disability वाले developers के बीच accessibility technologies के उपयोग पर खुला है। 🔗 स्रोत
  • Seedance 2.5 Luma पर भी घोषित — Luma अपनी platform पर जल्द आने वाले Seedance 2.5 का teaser देता है, लेकिन कोई तारीख निर्दिष्ट नहीं करता। 🔗 स्रोत
  • Ideogram Object Remover Runware पर उपलब्ध — Ideogram का object removal tool OmniEraser benchmark पर सर्वोत्तम FID score का दावा करता है, और इसके लिए कोई prompt आवश्यक नहीं है। 🔗 स्रोत
  • SGLang NVIDIA DGX Spark cluster पर Inkling-Small support जोड़ता है — ConnectX-7 में जुड़े 2 DGX Spark systems पर 1 की concurrency के साथ 24 tokens/second का measured throughput। 🔗 स्रोत
  • ChatGPT desktop — Activity view और animal icon के माध्यम से Voice shortcut — नई Activity view pending conversations और project updates को एक साथ लाती है, साथ ही ChatGPT Voice के लिए एक shortcut भी देती है। 🔗 स्रोत
  • गणित और सैद्धांतिक कंप्यूटर विज्ञान में दस प्रगतियाँ — OpenAI ज्यामिति, cryptography और complexity में खुले प्रश्नों पर दस परिणाम साझा करता है; विस्तृत सामग्री देखी नहीं जा सकती, स्रोत robots के लिए अवरुद्ध है। 🔗 स्रोत
  • यूरोप में जिम्मेदार AI को आगे बढ़ाना — OpenAI, AI Act के सामने यूरोप में AI governance के समर्थन में अपने सुरक्षा, पारदर्शिता और provenance practices प्रस्तुत करता है; विस्तृत सामग्री देखी नहीं जा सकती, स्रोत अवरुद्ध है। 🔗 स्रोत
  • Univé ChatGPT Enterprise के साथ AI-तैयार workforce बना रहा है — डच insurer Univé के ChatGPT Enterprise rollout पर case study; विस्तृत सामग्री देखी नहीं जा सकती, स्रोत अवरुद्ध है। 🔗 स्रोत
  • OpenAI का कहना है कि उसने कंबोडिया-आधारित धोखाधड़ी नेटवर्क को ध्वस्त कर दिया — निवेश, भावनात्मक, जुए और identity theft scams के लिए ChatGPT का उपयोग; विस्तृत सामग्री देखी नहीं जा सकती, स्रोत अवरुद्ध है। 🔗 स्रोत
  • avatarin GPT-Realtime के साथ 24/7 retail agent बना रहा है — Yamada Denki के लिए multilingual customer support: दो हफ्तों में 30 000 उपयोगकर्ता, आधिकारिक सारांश के अनुसार 92 % सकारात्मक समीक्षाएँ; विस्तृत सामग्री देखी नहीं जा सकती, स्रोत अवरुद्ध है। 🔗 स्रोत

इसका क्या अर्थ है

Media generation बड़े पैमाने पर वितरण और conversational editing की दौड़ को तेज़ कर रही है। MiniMax H3 एक unified text/image/video/audio model और “अगले कुछ दिनों में” promised open weights के साथ आगे बढ़ रहा है, और इसे लगभग पंद्रह partners के यहाँ day-0 पर तैनात किया गया है। यही गति Ideogram (P-Image-Ideogram, चार quality modes और प्रति image 0,003 डॉलर से शुरू होने वाला pricing), Wan Video (Realtime mode बिना “generate” button के) और Luma (Layers, conversation के माध्यम से एक-एक layer editing) में भी दिखती है: अब value सिर्फ किसी model की raw quality पर नहीं, बल्कि iteration speed और launch के साथ multi-platform integration पर भी निर्भर करती है। Black Forest Labs, FLUX 3 के 48-hour preview को एक third-party agent के लिए सीमित करके, विपरीत दृष्टिकोण अपनाता है — सामान्य उपलब्धता के बजाय नियंत्रित teaser।

Open models की inference scale बदल रही है, और उपयोग तकनीक जितना ही documented हो रहा है। Together AI एक महीने में अपने served token volume में 10 000 गुना से अधिक वृद्धि का दावा करता है, जो enterprises के open models की ओर migration से प्रेरित है, और साथ ही LLM inference के लिए पारंपरिक autoscaling metrics की सीमाओं पर एक विस्तृत technical article प्रकाशित करता है। इसके पूरक के रूप में, infini-gram पर आधारित Ai2 study इस open model wave पर एक अप्रत्याशित रोशनी डालती है: self-published books के आधार पर यह दस्तावेज़ करती है कि AI-generated texts प्रशिक्षण में देखे गए formulations के कितने करीब रहते हैं — यह याद दिलाते हुए कि inference की scalability, produced content की originality पर मूल प्रश्नों को समाप्त नहीं करती।

Code agents के tooling और supply-chain security समानांतर में आगे बढ़ रहे हैं, हालांकि हमेशा एक ही दिशा में नहीं। Devin अपने execution scope को Outposts के साथ किसी भी computer तक बढ़ाता है, Replit autonomy features (Follow-up Tasks, Model Selector) को बढ़ाता है, और GitHub Actions $/ syntax के साथ internal actions का referencing आसान बनाता है। इसी समय, GitHub npm security को कड़ा करता है, interactive 2FA challenge को उन tokens पर भी लागू करके जिन्हें bypass के लिए configured किया गया है, हाल के महीनों में देखी गई account takeover लहर के सीधे जवाब में — यह संकेत है कि agents के बढ़ते automation के साथ-साथ access controls का parallel hardening भी हो रहा है।

दो खिलाड़ी अलग-अलग कारणों से अपने कुछ models तक पहुँच कड़ी कर रहे हैं। OpenAI 31 अगस्त से sign in करने वाले उपयोगकर्ताओं के लिए ChatGPT से GPT-5.4 और GPT-5.4 mini हटाता है, जबकि उन्हें API के माध्यम से उपलब्ध रखता है — यह एक lineup clarification है, न कि पूर्ण removal। दूसरी ओर, Google Gemini 3.5 Flash Cyber, software vulnerabilities की detection और correction के लिए समर्पित एक आर्थिक model, केवल governments और trusted partners के लिए आरक्षित करता है: यह इस बात का संकेत है कि कुछ laboratories अब स्पष्ट रूप से सीमित defensive-use models और public-facing models के बीच अंतर कर रही हैं।


स्रोत