खोजें

Microsoft का ThinkingBox बेंचमार्क प्रति कार्य 20 प्रयासों के साथ OpenEnv पर आया, Exgentic डेटासेट ने OpenTelemetry प्रारूप में 10,000 ट्रेसेस एकत्रित किए

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Microsoft का ThinkingBox बेंचमार्क प्रति कार्य 20 प्रयासों के साथ OpenEnv पर आया, Exgentic डेटासेट ने OpenTelemetry प्रारूप में 10,000 ट्रेसेस एकत्रित किए

ai-powered-markdown-translator

gemini-3.8-flash-high द्वारा फ्रेंच से हिंदी में अनुवादित लेख।

GitHub पर प्रोजेक्ट देखें ↗

शनिवार और रविवार की दरमियानी रात, Microsoft और Hugging Face ने ThinkingBox को OpenEnv से जोड़ा: यह बेंचमार्क 507 व्यावसायिक कार्यों को 20-20 बार फिर से चलाता है और एजेंटों का मूल्यांकन डेटाबेस की अंतिम स्थिति के आधार पर करता है, और यहाँ दोहराव से रैंकिंग बदल जाती है। रविवार, 4 अक्टूबर को, तीन लेखकों ने Exgentic Agent LLM Traces का विवरण दिया, जो Hub के Exgentic संगठन के तहत प्रकाशित OpenTelemetry प्रारूप में एजेंटों के 10,000 निष्पादन हैं। संक्षेप में, Claude Code 2.1.289 और Copilot CLI 1.0.92-4 ने अपने सुरक्षा उपायों (गार्डरेल्स) को मजबूत किया है, Feyn ने Meta के SAM 3 पर निर्मित एक मैट-कटआउट मॉडल MultiMatte प्रस्तुत किया है, और ChatGPT Enterprise 1 अक्टूबर से Admin console में अपने प्लगइन्स का प्रबंधन कर रहा है।


Microsoft और Hugging Face ने ThinkingBox को OpenEnv से जोड़ा: प्रति कार्य 20 प्रयास, और बदल गई रैंकिंग

3 अक्टूबर — Microsoft और Hugging Face के एक संयुक्त ब्लॉग पोस्ट में, Tuhin Kundu (Microsoft) ने ThinkingBox का विवरण दिया, जो एक ऐसा बेंचमार्क है जो AI एजेंटों का मूल्यांकन इस आधार पर करता है कि वे डेटाबेस में क्या छोड़ते हैं, न कि उनके उत्तरों पर। Toloka के साथ Microsoft Copilot Studio टीम द्वारा निर्मित, यह नया नहीं है (20 अगस्त का शोध पत्र, अगस्त के अंत में प्रकाशित डेटासेट): नवीनता यह है कि इसे Hugging Face द्वारा होस्ट किए गए एजेंटों के लिए खुले वातावरण इंटरफ़ेस OpenEnv से जोड़ा गया है, और 18 मॉडलों के परिणाम प्रकाशित किए गए हैं।

इसके 507 सिंथेटिक व्यावसायिक वर्कफ़्लो (workflows) एक स्वच्छ स्थिति से 20-20 बार फिर से चलाए जाते हैं, और नियतात्मक निर्णायक डेटाबेस की अंतिम स्थिति की तुलना अपेक्षित स्थिति से करते हैं। लेखकों के अनुसार परिणाम; उनकी लागत, OpenRouter की सूची दरों (Claude Opus 5.5 के लिए Anthropic की दरों) के आधार पर अनुमानित, एक तुलनात्मक संकेतक है, कोई बिल नहीं:

मूल्यांकित मॉडलसमग्र pass@120 में से 20 बार सफल कार्य (507 में से)विश्वसनीय कार्य प्रति लागत
Claude Opus 5.567,16 %2417,80 डॉलर
Claude Opus 566,50 %24113,30 डॉलर
GPT-5.465,36 %1286,80 डॉलर
GPT-5.6 Sol61,91 %829,76 डॉलर
GPT-6 Astra58,31 %2317,45 डॉलर
Kimi-K3 (ओपन वेट्स)57,37 %6820,68 डॉलर

दोहराव रैंकिंग को बदल देता है: सर्वश्रेष्ठ ओपन-वेट्स मॉडल Kimi-K3, 507 में से 476 कार्यों को कम से कम एक बार हल करता है, लेकिन सभी 20 प्रयासों में केवल 68 कार्य ही हल कर पाता है, जबकि Claude Opus 5 और Claude Opus 5.5 दोनों के लिए यह संख्या 241 है। टीम के अनुसार, पाँच में से लगभग चार विफलताएँ तर्क के बजाय उपकरणों के उपयोग के कारण होती हैं। कोड MIT लाइसेंस के तहत है, और डेटा CDLA-Permissive-2.0 के तहत है।

A trajectory is a claim. Database state is the evidence. Repetition is the trust test.

🇮🇳 एक ट्रैजेक्टरी एक दावा है। डेटाबेस की स्थिति प्रमाण है। दोहराव विश्वसनीयता की परीक्षा है। — Microsoft और Hugging Face का ब्लॉग पोस्ट

🔗 ThinkingBox-Bench डेटासेट · OpenEnv में ThinkingBox


Exgentic Agent LLM Traces: OpenTelemetry प्रारूप में संरक्षित 10,000 एजेंट निष्पादन

4 अक्टूबर — Hugging Face के कम्युनिटी ब्लॉग पर, Lena Dankin, Elron Bandel और Michal Shmueli-Scheuer ने Exgentic Agent LLM Traces प्रस्तुत किया, जो Hub के Exgentic संगठन के तहत प्रकाशित एक डेटासेट है: 10,000 एजेंट निष्पादन और 242,000 मॉडल कॉल, जिनमें से प्रत्येक को OpenTelemetry के GenAI सम्मेलनों के अनुसार संरक्षित किया गया है, साथ ही प्रत्येक निष्पादन का स्कोर और लागत भी शामिल है।

ये निष्पादन छह बेंचमार्क (SWE-bench, BrowseComp Plus, AppWorld और τ²-bench के तीन वेरिएंट) और पांच एजेंट डिज़ाइनों तक को कवर करते हैं। औसतन, Claude Opus 4.5 प्रति निष्पादन 2.4 मिलियन टोकन की खपत करता है, जबकि GPT-5.2 के लिए यह 552,000 है।

दो आपत्तियां: पांचों मॉडल पिछली पीढ़ियों के हैं (DeepSeek-V3.2, Kimi-K2.5, GPT-5.2, Claude Opus 4.5 और Gemini 3 Pro), और यह पोस्ट 10 जून को बनाए गए एक रिपॉजिटरी को आज की रिलीज़ के रूप में प्रस्तुत करती है, जिसके कार्ड में किसी लाइसेंस की घोषणा नहीं की गई है।

🔗 ब्लॉग पोस्ट · Hugging Face पर डेटासेट


संक्षेप में

  • Claude Code 2.1.289 — 27 प्रविष्टियों वाला यह संस्करण उन चार मामलों को ठीक करता है जहाँ deny और ask अनुमति नियम लागू नहीं हो रहे थे; उपयोगकर्ता द्वारा स्थापित प्लगइन अब प्रबंधित MCP सर्वर के कनेक्शन टूल विवरणों को फिर से नहीं लिख सकता है, और 18 अन्य प्रविष्टियाँ मॉड्स और प्लगइन्स से संबंधित हैं। 🔗 स्रोत
  • Copilot CLI 1.0.92-4 और SDK Copilot 1.0.17-preview.4 — पूर्वावलोकन में मौजूद CLI (नवीनतम स्थिर: 1.0.91) किसी सेटिंग को सूचीबद्ध करने, पढ़ने, सेट करने और हटाने के लिए copilot config सब-कमांड जोड़ती है, और जब तक स्पष्ट रूप से कॉन्फ़िगर न किया गया हो, सैंडबॉक्स शेल में परिवेशी GITHUB_TOKEN को पास नहीं करती है; SDK को सब-एजेंट के पहले प्रॉम्प्ट को समृद्ध करने और फिर उसकी प्रतिक्रिया का निरीक्षण करने या उसे बदलने के लिए OnSubagentStart और OnSubagentStop हुक मिलते हैं। 🔗 CLI · 🔗 SDK
  • Feyn का MultiMatte — यह मैट-कटआउट मॉडल टेक्स्ट द्वारा निर्देशित होता है: आप रखने वाली वस्तु का नाम बताते हैं, मॉडल बाकी हिस्से को हटा देता है, एक अल्फा मास्क (alpha matte) के साथ जो बालों और धुंधले क्षेत्रों को बेहतर ढंग से प्रस्तुत करता है। Meta के SAM 3 पर निर्मित और LoRA एडेप्टर द्वारा फाइन-ट्यून किया गया, यह लेखकों के अनुसार DIS-VD पर 0.901 का S-measure प्राप्त करता है, जबकि SAM 3 के लिए यह 0.667 है; इसके वज़न, उनके मॉडल कार्ड के अनुसार Apache 2.0 के तहत, 20 अगस्त से ऑनलाइन उपलब्ध हैं। 🔗 स्रोत
  • Admin console में ChatGPT Enterprise प्लगइन्स — 1 अक्टूबर को, Enterprise और Edu रिलीज़ नोट्स ने घोषणा की कि ChatGPT Enterprise वर्कस्पेस के मालिक और व्यवस्थापक अब Admin console के Plugins और Marketplaces पेजों में प्लगइन्स और उनके बाज़ारों (marketplaces) का प्रबंधन करते हैं; एप्लिकेशन मौजूदा अनुमतियों के साथ Workspace settings > Apps में ही रहते हैं। 🔗 स्रोत

इसके क्या मायने हैं

ThinkingBox किसी एजेंट से पूछे जाने वाले सवाल को बदल देता है: अब यह नहीं कि क्या वह किसी कार्य को पूरा करना जानता है, बल्कि यह कि क्या वह इसे हर बार पूरा करता है। एक प्रयास में, Kimi-K3 GPT-6 Astra से एक अंक से भी कम की दूरी पर रहता है; बीस प्रयासों में, वह हर बार केवल 68 कार्यों में ही सफल होता है, जबकि GPT-6 Astra 231 में। किसी ऐसे व्यक्ति के लिए जो डेटाबेस को संशोधित करने वाले कार्यों को किसी एजेंट को सौंपता है, यह दूसरा आंकड़ा ही मायने रखता है, और यह बेंचमार्क एजेंट द्वारा किए गए दावे के बजाय डेटाबेस की अंतिम स्थिति के आधार पर इसे मापता है।

लागत भी इसी तर्क का अनुसरण करती है। केवल उन कार्यों के संदर्भ में जो प्रत्येक प्रयास में सफल रहे, यह GPT-5.4 को सबसे सस्ता (6.80 डॉलर प्रति विश्वसनीय कार्य) बताता है, न कि GPT-5.6 Sol को, जो प्रति सफल प्रयास सबसे सस्ता (0.127 डॉलर) होने के बावजूद पीछे रह जाता है; वहीं Kimi-K3 प्रति विश्वसनीय कार्य 20.68 डॉलर बैठता है, जो GPT-5.4 से तीन गुना अधिक है। जैसा कि लेखक याद दिलाते हैं, ये राशियाँ एक तुलनात्मक सूचक हैं, कोई अंतिम बिल नहीं।

Exgentic Agent LLM Traces के लेखक एक समान सीमा से शुरुआत करते हैं: एक बेंचमार्क निष्पादन को केवल एक स्कोर तक सीमित कर देता है, जबकि ट्रेस चुने गए उपकरणों, संदर्भ की वृद्धि और त्रुटि के बाद सुधार को दिखाता है। प्रत्येक कॉल को एक मानक प्रारूप में संरक्षित करके, वे इसे किसी संदर्भ के सामने एजेंट को डीबग करने, किसी अन्य मॉडल के साथ किसी चरण को फिर से चलाने या वास्तविक एजेंट लोड के तहत एक इंफ़रेंस इंफ़्रास्ट्रक्चर का परीक्षण करने के साधन के रूप में देखते हैं; एक टीम पहले से ही Kubernetes SIG के बेंचमार्क टूल inference-perf के साथ ऐसा कर रही है, और इसके परिणाम बाद में घोषित किए जाएंगे।


स्रोत