खोजें

Together AI पर DeepSeek V4.1 Flash उपलब्ध, प्रति कार्य GPT-5.6 Sol से तीन गुना सस्ता होने का दावा; Perplexity ने अपने Agent API को कस्टम कनेक्टरों के लिए खोला

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Together AI पर DeepSeek V4.1 Flash उपलब्ध, प्रति कार्य GPT-5.6 Sol से तीन गुना सस्ता होने का दावा; Perplexity ने अपने Agent API को कस्टम कनेक्टरों के लिए खोला

ai-powered-markdown-translator

gpt-5.6-sol के साथ फ़्रेंच से हिंदी में अनुवादित लेख।

GitHub पर प्रोजेक्ट देखें ↗

इस रविवार कोई नया मॉडल नहीं आया, लेकिन डेवलपरों के लिए दो ठोस नई सुविधाएँ आई हैं। 10 सितंबर को जारी DeepSeek V4.1 Flash, DeepSeek की व्यस्त घंटों वाली दर पर Together AI में आ गया है, और Together इसे प्रति कार्य GPT-5.6 Sol से तीन गुना सस्ता बताता है—हालाँकि इस दावे को कुछ बारीकियों के साथ पढ़ना चाहिए; वहीं Perplexity अब अपने Agent API में किसी MCP सर्वर को हमेशा के लिए एक बार पंजीकृत करने देता है। Sakana AI ने Royal Society के एक विशेष अंक पर फिर चर्चा की है, और Hugging Face के सामुदायिक ब्लॉग के तीन योगदानकर्ता अपने-अपने तरीके से परिणामों के सत्यापन पर विचार करते हैं।


Together AI पर DeepSeek V4.1 Flash उपलब्ध, प्रति कार्य GPT-5.6 Sol से तीन गुना सस्ता होने का दावा

13 सितंबर — DeepSeek V4.1 Flash अब Together AI पर serverless और समर्पित deployment, दोनों रूपों में उपलब्ध है। इसकी कीमत प्रति दस लाख input tokens के लिए 0.30 डॉलर और output के लिए 1.20 डॉलर है: ये ठीक वही कीमतें हैं जो व्यस्त घंटों में DeepSeek API की हैं और जिन्हें DeepSeek कम व्यस्त घंटों में आधा कर देता है।

Together का दावा है कि Artificial Analysis के मापों के अनुसार यह मॉडल agentic benchmarks पर प्रति कार्य एक-तिहाई लागत में GPT-5.6 Sol को पीछे छोड़ता है:

तुलना का मापDeepSeek V4.1 FlashGPT-5.6 Sol (high)
AutomationBench-AA69 %55 %
Terminal-Bench v4.027 %21 %
GDPval-AA v216321524
प्रति कार्य औसत लागत (Intelligence Index)0.27 डॉलर0.81 डॉलर

दो बारीकियाँ हैं: Together की अपनी मॉडल शीट reasoning में V4.1 Flash को GPT-5.6 Sol से पीछे रखती है (GPQA Diamond पर 90.9 के मुकाबले 94.1% और HLE पर 36.8 के मुकाबले 47%); और Terminal-Bench v4.0 पर Artificial Analysis द्वारा मापा गया लाभ, DeepSeek की ओर से 10 सितंबर को प्रकाशित तालिका में उलट जाता है, जिसमें V4.1 Flash को 31.2 और GPT-5.6 Sol को 39.9 अंक दिए गए थे।

🔗 X पर Together AI की घोषणा


Perplexity ने अपने Agent API को कस्टम कनेक्टरों के लिए खोला, MCP सर्वर हमेशा के लिए एक बार पंजीकृत

13 सितंबर — Perplexity ने अपने Agent API में कस्टम कनेक्टर (custom connectors) जोड़े हैं। कोई administrator अपने project (Project) के connectors में किसी दूरस्थ MCP सर्वर को केवल एक बार पंजीकृत करता है: नाम, URL, API key द्वारा authentication या कोई authentication नहीं, तथा Streamable HTTP या SSE transport। Perplexity सर्वर की access key सुरक्षित रखता है और project की किसी भी API key से भेजे गए अनुरोधों में type: "connector" के साथ केवल connector identifier देना होता है।

इसके विपरीत, अनुरोध में भेजे गए MCP सर्वर (type: "mcp") के साथ उसका URL और credentials हर call में जाते हैं, और केवल Streamable HTTP के माध्यम से। ये connectors, GitHub, Slack, Google Drive और Datadog के लिए 27 अगस्त को आए managed connectors (managed connectors) का विस्तार हैं; Linear और Notion जुड़ने के बाद अब इनकी संख्या छह है। Tool discovery डिफ़ॉल्ट रूप से deferred रहती है, जिससे मॉडल उपयोगी schemas लोड करने से पहले खोज करता है; इसलिए max_steps को पर्याप्त ऊँचा रखना चाहिए। किसी विशेष मूल्य का उल्लेख नहीं किया गया है।

🔗 Perplexity connectors का दस्तावेज़ीकरण 🔗 Perplexity API का changelog


संक्षिप्त समाचार

  • Sakana AI ने world models (world models) को समर्पित विशेष अंक पर फिर चर्चा की — 12 सितंबर की जापानी भाषा की पोस्ट, Philosophical Transactions of the Royal Society A के उस अंक के बारे में है जो 14 मई 2026 को प्रकाशित हुआ था और जिसकी भूमिका Sakana AI के CEO David Ha ने तेरह अन्य सहलेखकों के साथ लिखी है। नई बात पोस्ट है, अंक का प्रकाशन नहीं। 🔗 स्रोत
  • REINFORCE उस जाल से निकलता है जिसमें सटीक gradient ascent अटका रहता है — यह Hugging Face के सामुदायिक ब्लॉग में एक व्यक्तिगत योगदान है, किसी प्रयोगशाला का प्रकाशन नहीं: एक ही reader द्वारा सत्यापन के बयालीस दौरों के बाद RDTvlokip दिखाते हैं कि 20,000 steps पर सटीक ascent, 12 में से किसी भी परीक्षण में अस्पष्टता-रहित code (एक bijection) तक नहीं पहुँचता, जबकि REINFORCE 12 में से 11 परीक्षणों में पहुँचता है। हालाँकि ये सभी आँकड़े Adam optimizer पर निर्भर हैं। 🔗 स्रोत
  • Phionyx ने AI audits के लिए proof contract प्रस्तावित किया — एक और व्यक्तिगत योगदान: Ali Toygar Abak यह रोकना चाहते हैं कि कोई dashboard या report चुपचाप किसी proof द्वारा स्थापित बात का दायरा बढ़ा दे; उदाहरण के लिए, अस्वीकृत tool call को अंततः guardrail द्वारा रोकी गई घटना के रूप में प्रस्तुत कर दिया जाए। प्रत्येक दावे से जुड़े metadata के आठ समूहों वाला उनका प्रस्ताव अभी engineering और testing की योजना है, जिसका कोई experimental result नहीं है। 🔗 स्रोत
  • darkc0de ने agent models को सत्यापित परिणाम पाने में लगे समय के आधार पर आँकने का प्रस्ताव दिया — तीसरा व्यक्तिगत योगदान: Sonny DeSorbo का तर्क है कि कमज़ोर लेकिन तेज़ मॉडल, किसी धीमे मॉडल का पहला प्रयास पूरा होने से पहले स्वयं को कई बार सुधार सकता है। वे Persistent Challenge Completion नामक benchmark की रूपरेखा प्रस्तुत करते हैं, जो प्रति सेकंड सत्यापित कार्य को मापता है। यह बिना प्रयोग वाला विचार है, जिसे लेखक स्वयं बहुत गंभीरता से न लेने के लिए कहते हैं। 🔗 स्रोत

इसका क्या अर्थ है

पहला विषय agents की tooling से संबंधित है। Custom connectors के साथ MCP सर्वर, हर अनुरोध में दोहराया जाने वाला parameter न रहकर project का resource बन जाता है: administrator इसे एक बार पंजीकृत करता है, Perplexity इसकी access key सुरक्षित रखता है, और Agent API को call करने वाले code को अब इसे साथ भेजने की आवश्यकता नहीं रहती। इस प्रकार Perplexity, अगस्त के अंत में आए managed connectors की व्यवस्था को हर किसी के MCP servers तक विस्तारित करता है—चाहे वे API key से सुरक्षित हों या उनमें authentication न हो—और साथ ही Streamable HTTP के अतिरिक्त SSE transport भी स्वीकार करता है। इसकी कीमत deferred tool discovery के रूप में चुकानी पड़ती है, जिसके कारण मॉडल को कार्रवाई से पहले खोजने के लिए पर्याप्त steps देने होते हैं। इस तरह किसी tool को जोड़ना, प्रत्येक call में दोहराई जाने वाली setting से अधिक, पूरे project के लिए एक बार किया जाने वाला प्रशासनिक कार्य बन जाता है।

दूसरा विषय कीमत और मापन का है। Together AI, MIT license के अंतर्गत प्रकाशित open model को ठीक DeepSeek की व्यस्त घंटों वाली दर पर उपलब्ध कराता है: जो उपयोगकर्ता अपने calls को कम व्यस्त घंटों में केंद्रित कर सकते हैं, उनके लिए DeepSeek API अब भी दो गुना सस्ता है। प्रति कार्य बताई गई लागत को भी उसके अंतरों के साथ समझना चाहिए। Together का दावा agentic benchmarks से संबंधित है, reasoning से नहीं, जहाँ V4.1 Flash अब भी GPT-5.6 Sol से पीछे है। यहाँ तक कि Terminal-Bench v4.0 जैसे agentic test पर भी ranking स्रोत पर निर्भर करती है: Artificial Analysis में V4.1 Flash, GPT-5.6 Sol से आगे है (27 बनाम 21%), लेकिन DeepSeek की तालिका में पीछे है (31.2 बनाम 39.9)। आज की तीनों सामुदायिक पोस्ट सत्यापन की इसी आवश्यकता की ओर लौटती हैं: RDTvlokip ने अपने परिणामों को एक ही reader द्वारा समीक्षा के बयालीस दौरों से गुज़ारा; Phionyx यह रोकना चाहते हैं कि कोई report चुपचाप proof द्वारा स्थापित बात का दायरा बढ़ा दे; और darkc0de पहले प्रयास की सफलता के बजाय प्रति सेकंड सत्यापित कार्य को मापने का प्रस्ताव देते हैं। चाहे वह score हो, लागत हो या audit का निष्कर्ष, प्रश्न यही रहता है कि वह आँकड़ा किन परिस्थितियों में प्राप्त हुआ।


स्रोत