ai-powered-markdown-translatorgemini-3.8-flash-high द्वारा फ्रेंच से हिंदी में अनुवादित लेख।
शनिवार और रविवार की दरमियानी रात, Microsoft और Hugging Face ने ThinkingBox को OpenEnv से जोड़ा: यह बेंचमार्क 507 व्यावसायिक कार्यों को 20-20 बार फिर से चलाता है और एजेंटों का मूल्यांकन डेटाबेस की अंतिम स्थिति के आधार पर करता है, और यहाँ दोहराव से रैंकिंग बदल जाती है। रविवार, 4 अक्टूबर को, तीन लेखकों ने Exgentic Agent LLM Traces का विवरण दिया, जो Hub के Exgentic संगठन के तहत प्रकाशित OpenTelemetry प्रारूप में एजेंटों के 10,000 निष्पादन हैं। संक्षेप में, Claude Code 2.1.289 और Copilot CLI 1.0.92-4 ने अपने सुरक्षा उपायों (गार्डरेल्स) को मजबूत किया है, Feyn ने Meta के SAM 3 पर निर्मित एक मैट-कटआउट मॉडल MultiMatte प्रस्तुत किया है, और ChatGPT Enterprise 1 अक्टूबर से Admin console में अपने प्लगइन्स का प्रबंधन कर रहा है।
Microsoft और Hugging Face ने ThinkingBox को OpenEnv से जोड़ा: प्रति कार्य 20 प्रयास, और बदल गई रैंकिंग
3 अक्टूबर — Microsoft और Hugging Face के एक संयुक्त ब्लॉग पोस्ट में, Tuhin Kundu (Microsoft) ने ThinkingBox का विवरण दिया, जो एक ऐसा बेंचमार्क है जो AI एजेंटों का मूल्यांकन इस आधार पर करता है कि वे डेटाबेस में क्या छोड़ते हैं, न कि उनके उत्तरों पर। Toloka के साथ Microsoft Copilot Studio टीम द्वारा निर्मित, यह नया नहीं है (20 अगस्त का शोध पत्र, अगस्त के अंत में प्रकाशित डेटासेट): नवीनता यह है कि इसे Hugging Face द्वारा होस्ट किए गए एजेंटों के लिए खुले वातावरण इंटरफ़ेस OpenEnv से जोड़ा गया है, और 18 मॉडलों के परिणाम प्रकाशित किए गए हैं।
इसके 507 सिंथेटिक व्यावसायिक वर्कफ़्लो (workflows) एक स्वच्छ स्थिति से 20-20 बार फिर से चलाए जाते हैं, और नियतात्मक निर्णायक डेटाबेस की अंतिम स्थिति की तुलना अपेक्षित स्थिति से करते हैं। लेखकों के अनुसार परिणाम; उनकी लागत, OpenRouter की सूची दरों (Claude Opus 5.5 के लिए Anthropic की दरों) के आधार पर अनुमानित, एक तुलनात्मक संकेतक है, कोई बिल नहीं:
| मूल्यांकित मॉडल | समग्र pass@1 | 20 में से 20 बार सफल कार्य (507 में से) | विश्वसनीय कार्य प्रति लागत |
|---|---|---|---|
| Claude Opus 5.5 | 67,16 % | 241 | 7,80 डॉलर |
| Claude Opus 5 | 66,50 % | 241 | 13,30 डॉलर |
| GPT-5.4 | 65,36 % | 128 | 6,80 डॉलर |
| GPT-5.6 Sol | 61,91 % | 82 | 9,76 डॉलर |
| GPT-6 Astra | 58,31 % | 231 | 7,45 डॉलर |
| Kimi-K3 (ओपन वेट्स) | 57,37 % | 68 | 20,68 डॉलर |
दोहराव रैंकिंग को बदल देता है: सर्वश्रेष्ठ ओपन-वेट्स मॉडल Kimi-K3, 507 में से 476 कार्यों को कम से कम एक बार हल करता है, लेकिन सभी 20 प्रयासों में केवल 68 कार्य ही हल कर पाता है, जबकि Claude Opus 5 और Claude Opus 5.5 दोनों के लिए यह संख्या 241 है। टीम के अनुसार, पाँच में से लगभग चार विफलताएँ तर्क के बजाय उपकरणों के उपयोग के कारण होती हैं। कोड MIT लाइसेंस के तहत है, और डेटा CDLA-Permissive-2.0 के तहत है।
A trajectory is a claim. Database state is the evidence. Repetition is the trust test.
🇮🇳 एक ट्रैजेक्टरी एक दावा है। डेटाबेस की स्थिति प्रमाण है। दोहराव विश्वसनीयता की परीक्षा है। — Microsoft और Hugging Face का ब्लॉग पोस्ट
🔗 ThinkingBox-Bench डेटासेट · OpenEnv में ThinkingBox
Exgentic Agent LLM Traces: OpenTelemetry प्रारूप में संरक्षित 10,000 एजेंट निष्पादन
4 अक्टूबर — Hugging Face के कम्युनिटी ब्लॉग पर, Lena Dankin, Elron Bandel और Michal Shmueli-Scheuer ने Exgentic Agent LLM Traces प्रस्तुत किया, जो Hub के Exgentic संगठन के तहत प्रकाशित एक डेटासेट है: 10,000 एजेंट निष्पादन और 242,000 मॉडल कॉल, जिनमें से प्रत्येक को OpenTelemetry के GenAI सम्मेलनों के अनुसार संरक्षित किया गया है, साथ ही प्रत्येक निष्पादन का स्कोर और लागत भी शामिल है।
ये निष्पादन छह बेंचमार्क (SWE-bench, BrowseComp Plus, AppWorld और τ²-bench के तीन वेरिएंट) और पांच एजेंट डिज़ाइनों तक को कवर करते हैं। औसतन, Claude Opus 4.5 प्रति निष्पादन 2.4 मिलियन टोकन की खपत करता है, जबकि GPT-5.2 के लिए यह 552,000 है।
दो आपत्तियां: पांचों मॉडल पिछली पीढ़ियों के हैं (DeepSeek-V3.2, Kimi-K2.5, GPT-5.2, Claude Opus 4.5 और Gemini 3 Pro), और यह पोस्ट 10 जून को बनाए गए एक रिपॉजिटरी को आज की रिलीज़ के रूप में प्रस्तुत करती है, जिसके कार्ड में किसी लाइसेंस की घोषणा नहीं की गई है।
🔗 ब्लॉग पोस्ट · Hugging Face पर डेटासेट
संक्षेप में
- Claude Code 2.1.289 — 27 प्रविष्टियों वाला यह संस्करण उन चार मामलों को ठीक करता है जहाँ deny और ask अनुमति नियम लागू नहीं हो रहे थे; उपयोगकर्ता द्वारा स्थापित प्लगइन अब प्रबंधित MCP सर्वर के कनेक्शन टूल विवरणों को फिर से नहीं लिख सकता है, और 18 अन्य प्रविष्टियाँ मॉड्स और प्लगइन्स से संबंधित हैं। 🔗 स्रोत
- Copilot CLI 1.0.92-4 और SDK Copilot 1.0.17-preview.4 — पूर्वावलोकन में मौजूद CLI (नवीनतम स्थिर: 1.0.91) किसी सेटिंग को सूचीबद्ध करने, पढ़ने, सेट करने और हटाने के लिए
copilot configसब-कमांड जोड़ती है, और जब तक स्पष्ट रूप से कॉन्फ़िगर न किया गया हो, सैंडबॉक्स शेल में परिवेशीGITHUB_TOKENको पास नहीं करती है; SDK को सब-एजेंट के पहले प्रॉम्प्ट को समृद्ध करने और फिर उसकी प्रतिक्रिया का निरीक्षण करने या उसे बदलने के लिएOnSubagentStartऔरOnSubagentStopहुक मिलते हैं। 🔗 CLI · 🔗 SDK - Feyn का MultiMatte — यह मैट-कटआउट मॉडल टेक्स्ट द्वारा निर्देशित होता है: आप रखने वाली वस्तु का नाम बताते हैं, मॉडल बाकी हिस्से को हटा देता है, एक अल्फा मास्क (alpha matte) के साथ जो बालों और धुंधले क्षेत्रों को बेहतर ढंग से प्रस्तुत करता है। Meta के SAM 3 पर निर्मित और LoRA एडेप्टर द्वारा फाइन-ट्यून किया गया, यह लेखकों के अनुसार DIS-VD पर 0.901 का S-measure प्राप्त करता है, जबकि SAM 3 के लिए यह 0.667 है; इसके वज़न, उनके मॉडल कार्ड के अनुसार Apache 2.0 के तहत, 20 अगस्त से ऑनलाइन उपलब्ध हैं। 🔗 स्रोत
- Admin console में ChatGPT Enterprise प्लगइन्स — 1 अक्टूबर को, Enterprise और Edu रिलीज़ नोट्स ने घोषणा की कि ChatGPT Enterprise वर्कस्पेस के मालिक और व्यवस्थापक अब Admin console के Plugins और Marketplaces पेजों में प्लगइन्स और उनके बाज़ारों (marketplaces) का प्रबंधन करते हैं; एप्लिकेशन मौजूदा अनुमतियों के साथ Workspace settings > Apps में ही रहते हैं। 🔗 स्रोत
इसके क्या मायने हैं
ThinkingBox किसी एजेंट से पूछे जाने वाले सवाल को बदल देता है: अब यह नहीं कि क्या वह किसी कार्य को पूरा करना जानता है, बल्कि यह कि क्या वह इसे हर बार पूरा करता है। एक प्रयास में, Kimi-K3 GPT-6 Astra से एक अंक से भी कम की दूरी पर रहता है; बीस प्रयासों में, वह हर बार केवल 68 कार्यों में ही सफल होता है, जबकि GPT-6 Astra 231 में। किसी ऐसे व्यक्ति के लिए जो डेटाबेस को संशोधित करने वाले कार्यों को किसी एजेंट को सौंपता है, यह दूसरा आंकड़ा ही मायने रखता है, और यह बेंचमार्क एजेंट द्वारा किए गए दावे के बजाय डेटाबेस की अंतिम स्थिति के आधार पर इसे मापता है।
लागत भी इसी तर्क का अनुसरण करती है। केवल उन कार्यों के संदर्भ में जो प्रत्येक प्रयास में सफल रहे, यह GPT-5.4 को सबसे सस्ता (6.80 डॉलर प्रति विश्वसनीय कार्य) बताता है, न कि GPT-5.6 Sol को, जो प्रति सफल प्रयास सबसे सस्ता (0.127 डॉलर) होने के बावजूद पीछे रह जाता है; वहीं Kimi-K3 प्रति विश्वसनीय कार्य 20.68 डॉलर बैठता है, जो GPT-5.4 से तीन गुना अधिक है। जैसा कि लेखक याद दिलाते हैं, ये राशियाँ एक तुलनात्मक सूचक हैं, कोई अंतिम बिल नहीं।
Exgentic Agent LLM Traces के लेखक एक समान सीमा से शुरुआत करते हैं: एक बेंचमार्क निष्पादन को केवल एक स्कोर तक सीमित कर देता है, जबकि ट्रेस चुने गए उपकरणों, संदर्भ की वृद्धि और त्रुटि के बाद सुधार को दिखाता है। प्रत्येक कॉल को एक मानक प्रारूप में संरक्षित करके, वे इसे किसी संदर्भ के सामने एजेंट को डीबग करने, किसी अन्य मॉडल के साथ किसी चरण को फिर से चलाने या वास्तविक एजेंट लोड के तहत एक इंफ़रेंस इंफ़्रास्ट्रक्चर का परीक्षण करने के साधन के रूप में देखते हैं; एक टीम पहले से ही Kubernetes SIG के बेंचमार्क टूल inference-perf के साथ ऐसा कर रही है, और इसके परिणाम बाद में घोषित किए जाएंगे।
स्रोत
- ThinkingBox पर Microsoft और Hugging Face का संयुक्त ब्लॉग पोस्ट
- Hugging Face पर ThinkingBox-Bench डेटासेट
- OpenEnv प्रलेखन में ThinkingBox वातावरण
- GitHub पर ThinkingBox का कोड
- GitHub पर ThinkingBox का डेटा
- Exgentic Agent LLM Traces (Hugging Face ब्लॉग)
- Exgentic/agent-llm-traces-v2 डेटासेट
- Claude Code v2.1.289
- Claude Code का चेंजलॉग
- Copilot CLI v1.0.92-4
- GitHub Copilot SDK v1.0.17-preview.4
- MultiMatte (Feyn का ब्लॉग पोस्ट)
- Hugging Face पर feyninc/multimatte मॉडल
- ChatGPT Enterprise और Edu रिलीज़ नोट्स