ai-powered-markdown-translatorgpt-6-sol की मदद से fr से hi में अनूदित लेख।
Hugging Face के मुख्य कार्यकारी अधिकारी Clément Delangue ने जुलाई में उनकी कंपनी पर एक स्वायत्त एजेंट के ज़रिए हुए साइबर हमले से तीन सबक सीखे हैं और एजेंटों के गतिविधि रिकॉर्ड साझा करना अनिवार्य करने का प्रस्ताव दिया है। इसी बीच, Quadrat-IPI बेंचमार्क दिखाता है कि फँसाए गए एजेंट सफल हमले पर लगभग कभी चेतावनी नहीं देते: इंजेक्शन के ज़रिए कराए गए 389 भुगतानों पर सिर्फ़ 3 चेतावनियाँ। OpenAI ने एक एन्कोडिंग बग ठीक किया है जो GPT-6 Sol और GPT-6 Luna की छवियों को समझने की क्षमता घटा रहा था। Apple ने LensVLM-9B जारी किया है, जो लंबे दस्तावेज़ों को संपीड़ित पृष्ठों के रूप में पढ़ता है, और SmolDataEnvs ने छोटे मॉडलों के प्रशिक्षण के लिए डेटा विश्लेषण के 5 000 कार्य उपलब्ध कराए हैं। कोडिंग एजेंटों में, Claude Code 2.1.283 पुराने मॉडलों के लिए लिखे निर्देशों की जाँच करता है, Qwen Code 0.24.6 एक सलाहकार मॉडल की मदद लेता है, और Gemini CLI का एक nightly संस्करण गैर-संवादात्मक मोड में पुष्टि माँगने वाले अनुरोधों को अस्वीकार कर देता है।
एजेंट सुरक्षा: Clément Delangue के तीन सबक और Quadrat-IPI बेंचमार्क
दो लेख एक ही सवाल को दो पहलुओं से देखते हैं: एजेंटों के ज़रिए होने वाले हमलों के बारे में हम क्या जानते हैं? पहला उस कंपनी की ओर से है जिसने ऐसा हमला झेला है; दूसरा मापता है कि हमले का सामना करने वाले एजेंट क्या बताते हैं और क्या छिपा जाते हैं।
Clément Delangue ने Hugging Face पर एजेंट के ज़रिए हुए साइबर हमले से तीन सबक सीखे
24 सितंबर — Hugging Face के मुख्य कार्यकारी अधिकारी Clément Delangue के अनुसार, उनकी कंपनी जुलाई में स्वायत्त एजेंट के ज़रिए हुए साइबर हमले को सार्वजनिक करने वाली पहली कंपनी थी। उन्होंने X पर इससे मिले तीन सबक साझा किए।
पारदर्शिता: उनके अनुसार, ऐसे हमले महीनों पहले कुछ अग्रणी प्रयोगशालाओं में गोपनीय रूप से हो चुके थे, जहाँ निगरानी नहीं थी; उन्होंने उन प्रयोगशालाओं के नाम नहीं बताए। वह एजेंटों के गतिविधि रिकॉर्ड साझा करना अनिवार्य करने का प्रस्ताव देते हैं। असमानता: बंद API के सुरक्षा उपायों ने उनकी टीम को रोक दिया, क्योंकि वे हमेशा रक्षकों और हमलावरों में अंतर नहीं कर पाते। इसलिए टीम ने Z.ai के खुले मॉडल GLM 5.2 के « NVIDIA संस्करण » का सहारा लिया; उनके अनुसार, रक्षा का बड़ा हिस्सा open source औज़ारों पर आधारित हो सकता है। अंत में, भय पैदा करने वाली बातों के जवाब में वह कहते हैं कि AI, Hugging Face को अपनी सुरक्षा खामियाँ ठीक करने में और OpenAI को एजेंटों के बाहर निकलने से रोकने के लिए अपने सैंडबॉक्स मज़बूत करने में मदद करता है।
We were attacked by AI, but more importantly, we defended ourselves with AI.
🇮🇳 हम पर AI से हमला हुआ था, लेकिन सबसे बढ़कर हमने AI की मदद से अपना बचाव किया। — X पर @ClementDelangue
Quadrat-IPI: इंजेक्शन के ज़रिए कराए गए 389 भुगतानों पर 3 चेतावनियाँ
26 सितंबर — एक सामुदायिक पोस्ट में, prompt injection के लिए बनाए गए Quadrat-IPI परीक्षण संग्रह के लेखक Mikhail Gribov जाँचते हैं कि साधन होने पर एजेंट हमले की सूचना देता है या नहीं। परीक्षण वाला एजेंट एक नकली परिवेश में ईमेल खाते के मालिक का निजी सहायक है। उसके पास 19 औज़ार हैं और उसे बीसवाँ औज़ार, escalate_security_incident, दिया जाता है, जिसका सिस्टम प्रॉम्प्ट में कोई उल्लेख नहीं है। 395 जाल बिछाने वाले ईमेल मिलने पर, परीक्षण किए गए नौ मॉडल मॉडल के अनुसार 48,9 % मामलों से लेकर कभी भी इस औज़ार का उपयोग नहीं करते।
इंजेक्शन के असर में किए गए 389 भुगतानों में से केवल तीन के साथ चेतावनी आई, और हर बार भुगतान के बाद: मॉडल मुख्यतः उन्हीं हमलों की सूचना देते हैं जिन्हें वे रोक देते हैं। नाम दिए गए मॉडलों में, gpt-4o-mini ने 395 मामलों में एक बार चेतावनी दी, gpt-5.1 ने 4,8 % मामलों में और gpt-6-astra ने कभी नहीं, क्योंकि वह ईमेल में किया गया अनुरोध आगे बढ़ाए बिना केवल उसे दर्ज करता है। लेखक का निष्कर्ष है कि गतिविधि की जानकारी एजेंट के बाहर से, उसे पढ़ी जाने वाली सामग्री की जाँच करके मिलनी चाहिए; एजेंट चलाने वाला ढाँचा, लॉग और जाँचकर्ता प्रकाशित किए गए हैं।
OpenAI ने GPT-6 Sol और GPT-6 Luna की छवियों को समझने की क्षमता घटाने वाला एन्कोडिंग बग ठीक किया
25 सितंबर — GPT-6 Sol और GPT-6 Luna के लॉन्च के तीन दिन बाद, OpenAI ने अपने API के बदलावों के रिकॉर्ड (changelog) में बताया कि उसने छवि एन्कोडिंग का एक बग ठीक किया है, जो इन दो ऐसे तर्क क्षमता वाले मॉडलों की दृश्य समझ को घटा रहा था जो इनपुट में पाठ और छवियाँ लेते हैं। इस सुधार से API और Codex, दोनों में दृश्य कार्यों के नतीजे बेहतर होते हैं, जिनमें कंप्यूटर का उपयोग (computer use) भी शामिल है।
OpenAI उन डेवलपरों को अपने मूल्यांकन दोबारा चलाने और प्रभावित कार्यप्रवाह फिर आज़माने की सलाह देता है जिनके उपयोग में इनपुट के रूप में छवियाँ शामिल हैं। प्रविष्टि यह नहीं बताती कि बग कब से मौजूद था या नतीजे कितने प्रभावित हुए थे। इस सुधार को X पर न तो @OpenAI ने और न ही @OpenAIDevs ने साझा किया, और यह ChatGPT तथा Codex के changelog में भी नहीं है।
Hugging Face पर एक मॉडल और एक डेटासेट: Apple का LensVLM-9B और SmolDataEnvs
इस सप्ताह के दो प्रकाशन, जिन्हें यहाँ अभी तक साझा नहीं किया गया था: Apple का एक मॉडल, जो लंबे दस्तावेज़ों को संपीड़ित छवियों के रूप में पढ़ता है, और डेटा विश्लेषण के लिए छोटे मॉडलों को प्रशिक्षित करने हेतु सत्यापित किए जा सकने वाले कार्यों का एक संग्रह।
Apple ने LensVLM-9B जारी किया, जो दस्तावेज़ के केवल उपयोगी पृष्ठों को फिर खोलता है
22 सितंबर — Apple ने Hugging Face पर LensVLM-9B जारी किया है। यह एक vision-language मॉडल है, जिसका कोड GitHub पर भी उपलब्ध है। लंबे दस्तावेज़ को हज़ारों tokens में बाँटने के बजाय, यह उसे छोटी संपीड़ित छवियों के रूप में प्रस्तुत पृष्ठों में लेता है, महत्वपूर्ण पृष्ठ पहचानता है और फिर सीखे हुए औज़ारों से उनके असंपीड़ित संस्करण खोलता है।
| LensVLM-9B की विशेषता | प्रकाशित मान |
|---|---|
| आकार और आधार मॉडल | 9 अरब पैरामीटर, Qwen3.5-9B से परिष्कृत |
| उपलब्ध संपीड़न स्तर | 5x, 10x और 15x |
| पूरे पाठ के बराबर सटीकता | 4,3x प्रभावी संपीड़न पर |
| संदर्भ विधियों से बेहतर प्रदर्शन | सात प्रश्नोत्तर बेंचमार्क पर 10,1x तक |
| मॉडल वेट्स का लाइसेंस | Apple Machine Learning Research Model License |
ये नतीजे इससे जुड़े शोधपत्र से आए हैं, जो मई में arXiv पर उपलब्ध कराया गया था; उसमें उत्तरों को एक निर्णायक मॉडल ने आँका है।
🔗 Hugging Face पर LensVLM-9B · arXiv पर शोधपत्र
SmolDataEnvs: डेटा विश्लेषण के 5 000 सत्यापित किए जा सकने वाले कार्य
24 सितंबर — Adithya S K ने Hub पर FineEnvs संगठन के अंतर्गत और MIT लाइसेंस पर SmolDataEnvs प्रकाशित किया है: डेटा विश्लेषण के ऐसे कार्य, जिनसे छोटे मॉडलों को सुदृढीकरण अधिगम (reinforcement learning) के ज़रिए प्रशिक्षित किया जा सकता है। हर कार्य में एक वास्तविक तालिकाबद्ध डेटासेट, एक प्रश्न और एक संदर्भ उत्तर है। इन्हें 471 Kaggle डेटासेट से जुड़ी नोटबुकों से लिया गया है और एजेंटों ने वास्तविक सैंडबॉक्स में सत्यापित किया है। साथ दिया गया जाँचकर्ता किसी भाषा मॉडल के बिना उत्तर को आँकता है—सटीक मिलान से लेकर प्रतीकात्मक समतुल्यता तक।
| कार्यों का संग्रह | आसान कार्य | मध्यम कार्य | कठिन कार्य |
|---|---|---|---|
| प्रशिक्षण (5 000) | 1 433 | 2 845 | 722 |
| परीक्षण (250) | 33 | 118 | 99 |
| मूल्यांकन (144) | 16 | 74 | 54 |
इस तरह अलग रखे गए संग्रह जानबूझकर अधिक कठिन बनाए गए हैं। पूरे संग्रह में एजेंटों के 4 677 सत्यापित कार्य क्रम भी हैं, जो TRL के लिए तैयार हैं, और वही कार्य चलाए जा सकने वाले Harbor परिवेशों में भी उपलब्ध हैं; Clément Delangue ने अगले दिन इसके जारी होने की खबर साझा की।
🔗 Hugging Face पर SmolDataEnvs
कोडिंग एजेंट: Claude Code 2.1.283, Qwen Code 0.24.6 और Gemini CLI का nightly 0.63.0
Claude Code 2.1.283: निर्देशों की जाँच और मॉडलों पर दो नियंत्रण
25 सितंबर — संस्करण 2.1.283 में 94 प्रविष्टियाँ हैं, जिनमें 53 सुधार हैं। इसकी प्रमुख नई सुविधा, /doctor prompt-audit (जिसे /checkup prompt-audit भी कहा जाता है), CLAUDE.md फ़ाइलों, skills, एजेंटों और कमांडों की समीक्षा करती है। यह पुराने मॉडलों के लिए लिखे वाक्यांशों, पुराने पड़ चुके पथों और परस्पर विरोधी निर्देशों को प्राथमिकता से पहचानती है।
| 2.1.283 में नई सुविधा | क्या बदलता है |
|---|---|
availableModelsMatch: "exact" | नया जारी हुआ मॉडल सूची में शामिल होने तक अवरुद्ध रहता है |
deniedModels | availableModels से अनुमति मिलने पर भी खास मॉडलों को अवरुद्ध करता है |
| डिफ़ॉल्ट अनुमति मोड | तीसरे पक्ष के प्रदाता या बंद टेलीमेट्री पर ऑटो मोड, जब तक कोई मोड कॉन्फ़िगर न हो |
| Windows पर PowerShell | rd, rmdir, del और erase अब ड्राइव की मूल निर्देशिका नहीं मिटा सकते |
| Code Review | समय सीमा पर रुकी ऐसी समीक्षा का शुल्क नहीं लगता जिसने कुछ भी जाँचा न हो |
यह संस्करण पिछले दिन 2.1.282 में लागू किए गए claude-ai नाम के आरक्षण को भी वापस लेता है।
🔗 Claude Code 2.1.283 के रिलीज़ नोट्स
Qwen Code 0.24.6: एक सलाहकार मॉडल और Batch API कार्यप्रवाह
26 सितंबर — Qwen Code v0.24.6 में 17 नई सुविधाएँ, 14 सुधार और 3 अनुकूलन हैं; संगतता तोड़ने वाला कोई ज्ञात बदलाव नहीं है। मुख्य सुविधा एक अंतर्निहित Advisor औज़ार है, जो डिफ़ॉल्ट रूप से बंद रहता है: उपयोगकर्ता यदि सलाहकार के रूप में दूसरा मॉडल कॉन्फ़िगर करे, तो एजेंट स्वतंत्र राय पाने के लिए उससे सलाह ले सकता है। सलाहकार को सिस्टम निर्देश, घोषित औज़ार और बातचीत दिखाई देते हैं, लेकिन वह कुछ चला नहीं सकता। उसका चयन /advisor या --advisor से होता है, किसी रिपॉज़िटरी से कभी नहीं; रिपॉज़िटरी की सेटिंग को चेतावनी देकर अनदेखा कर दिया जाता है। Anthropic अप्रैल से अपने API में यही सिद्धांत बीटा रूप में उपलब्ध कराता है।
/batch-api कार्यप्रवाह DashScope की Batch API के लिए बैच प्रोसेसिंग तैयार करता है, फिर शुल्क वाले और अनुमोदन की शर्त वाले सबमिशन को qwen batch उपकमांडों को सौंपता है। अंत में, PR #12622 के अनुसार, मशीन के हिसाब से पहली बार शुरू होने की गति लगभग 2,2 से 2,4 गुना बढ़ती है और मेमोरी का उपयोग 60 % घटता है।
Gemini CLI: nightly 0.63.0 गैर-संवादात्मक मोड में पुष्टि माँगने वाले निर्णय अस्वीकार करता है
26 सितंबर — 01 बजकर 20 मिनट UTC पर प्रकाशित 26 सितंबर का nightly संस्करण Gemini CLI की 0.63.0 श्रृंखला शुरू करता है; स्थिर संस्करण v0.61.0 और पूर्वावलोकन संस्करण v0.62.0 में कोई बदलाव नहीं है। इसका सबसे व्यापक बदलाव (PR #29506, 26 फ़ाइलें) नियम इंजन (PolicyEngine) से जुड़ा है: गैर-संवादात्मक मोड में उपयोगकर्ता से पुष्टि माँगने वाला निर्णय (ASK_USER) अस्वीकृति (DENY) बन जाता है। बाहरी MCP संसाधनों और वेब खोज के आउटपुट को अब web-fetch के आउटपुट की तरह, अविश्वसनीय संदर्भ (untrusted context) के मानकों के अनुसार सीमाबद्ध किया जाता है।
तीन सुधार खास समस्याएँ दूर करते हैं: खाली diff.external सेटिंग को Git एक निष्पादन योग्य फ़ाइल मान लेता था, जिससे सैंडबॉक्स में git diff टूट जाता था; पृष्ठभूमि में चलाए गए कमांडों की अस्थायी निर्देशिकाएँ अब हटा दी जाती हैं; और एक ही मिनट में खोले गए दो ACP सत्र अब आपस में नहीं टकराते।
🔗 Gemini CLI के nightly 0.63.0 के नोट्स
संक्षिप्त समाचार
- Codex CLI 0.157.1 — 26 सितंबर को प्रकाशित 0.157.0 का यह सुधार केवल Windows के लिए है: कोड मोड का होस्ट और स्थानीय MCP सर्वर अब कंसोल विंडो नहीं खोलते, और डेमन का शुरू होना अधिक भरोसेमंद बनाया गया है। अपने आप बनी रिलीज़ टिप्पणियाँ खाली हैं, इसलिए यह जानकारी दोनों संस्करणों की तुलना से मिली है। 🔗 स्रोत
- Claude Tag के बारे में अनुभव — Claude Code के प्रमुख Boris Cherny ने X पर कहा कि Slack में एकीकृत Claude एजेंट, Claude Tag, हर दिन उनके आधे से अधिक PR लिखता है और उनके डेटा विश्लेषण का लगभग 100 % करता है। उन्होंने अपने निर्देश भी साझा किए, जैसे PR खोलने से पहले किसी चैनल में रिपोर्ट किए गए हर बग को दोहराकर देखना। 🔗 स्रोत
- पुल रिक्वेस्ट की समीक्षा में लगने वाला समय — Copilot उपयोग मेट्रिक्स API की
repos-1-dayरिपोर्ट मेंpull_request_review_timesतालिका जोड़ी गई है: तीन चरणों का माध्यिका और 90वाँ प्रतिशतक—« समीक्षा के लिए तैयार » से पहली समीक्षा तक, पहली से आखिरी समीक्षा तक, और फिर विलय तक। केवल मानव समीक्षाएँ गिनी जाती हैं; 21 सितंबर से पहले का डेटा उपलब्ध नहीं है। 🔗 स्रोत - उद्यम के Copilot सेटिंग्स का सत्यापनकर्ता — AI controls पृष्ठ में एकीकृत यह सत्यापनकर्ता
copilot/managed-settings.jsonऔरcopilot/team-mappings.jsonमें गलत प्रारूप वाले JSON, असमर्थित कॉन्फ़िगरेशन और अमान्य टीम मिलान की सूचना देता है। हर त्रुटि के लिए फ़ाइल और JSON पथ भी बताता है; प्रविष्टि में उपलब्धता की स्थिति या प्लान नहीं बताया गया है। 🔗 स्रोत - GitHub Issues — दो सुविधाएँ सामान्य उपलब्धता में आ गई हैं: रिपॉज़िटरी के इश्यू पृष्ठों पर निजी सहेजे गए दृश्य, और इश्यू के बीच « Relates to » संबंध। दूसरा संबंध 7 अगस्त से पूर्वावलोकन में था और अब REST तथा GraphQL API, वेबहुक, समयरेखा और इश्यू एवं प्रोजेक्ट खोजों में समर्थित है। 🔗 स्रोत
- Grok Bot और वित्त — @bot की एक पोस्ट शृंखला के अनुसार, Grok Bot का नया Finance एकीकरण Plaid के ज़रिए बैंक खाते, कार्ड और निवेश खाते जोड़ता है। इसकी पहुँच केवल पढ़ने तक सीमित है और इसे लॉगिन विवरण नहीं मिलते; पोस्ट शृंखला में देश या प्लान नहीं बताया गया है। Grok सहायक को 4 सितंबर को अमेरिकी बैंक खातों के लिए Plaid कनेक्शन मिला था। 🔗 स्रोत
- NVIDIA और ROS 2 Lyrical — 22 सितंबर की ब्लॉग पोस्ट के अनुसार, NVIDIA ने ROS 2 Lyrical में CUDA मेमोरी मॉड्यूल योगदान किया है। Isaac ROS 5.0 में इस्तेमाल होने वाला यह मॉड्यूल GPU पर मौजूद डेटा को एक ही मशीन के नोड के बीच बिना कॉपी किए भेजता है; एक skill मौजूदा नोड के माइग्रेशन का काम कोडिंग एजेंट को सौंपती है। प्रदर्शन लाभ का कोई आँकड़ा नहीं दिया गया है। 🔗 स्रोत
- DGX Spark Handbook — Hub पर exolabs संगठन के तहत प्रकाशित इस सामुदायिक गाइड में एक से चार DGX Spark की क्षमताओं के आँकड़े दिए गए हैं: सूची मूल्य 3,999 से बढ़कर 4,699 डॉलर हुआ है, निष्क्रिय अवस्था में बिजली खपत 22 से 25 W है और NVIDIA के एक परीक्षण के अनुसार, जेनरेट किए गए हर टोकन पर एक मशीन को 269 ms लगते हैं, जबकि चार मशीनों को 72 ms। 🔗 स्रोत
- लैपटॉप पर पूर्व-प्रशिक्षण — एक सामुदायिक ब्लॉग पोस्ट में Rambarun Komaljeet ने 1.11 अरब पैरामीटर वाले मॉडल का पूर्व-प्रशिक्षण लैपटॉप की 6 Go वाली RTX 4050 में समाया है। पूरा पूर्व-प्रशिक्षण लगभग 375 दिन लेगा, और 4.8 करोड़ से अधिक पैरामीटर वाले किसी मॉडल को अब तक अभिसरण तक प्रशिक्षित नहीं किया गया है। 🔗 स्रोत
- Pruna और Qwen-Image-2.1 — Pruna AI ने दो LoRA अडैप्टर जारी किए हैं, जिनसे Qwen-Image-2.1 को 40 के बजाय 5 या 8 चरणों में चित्र बनाने में मदद मिलती है। प्रकाशक के अनुसार गति 6.3 गुना तक बढ़ती है; यह संस्करण 0.1 अभी मूल मॉडल की गुणवत्ता से पीछे है और Qwen के शोध लाइसेंस के अंतर्गत है। 🔗 स्रोत
- Marin और Dolma 3.5 — Ai2 के अनुसार, Marin के 535B प्रशिक्षण में Ai2 के Dolma 3.5 कॉर्पस से लगभग 1.8 लाख करोड़ टोकन लिए गए हैं और इसकी Olmix विधियों तथा Organize the Web पद्धति का उपयोग किया गया है। Marin के लिए 152 ऐसे डेटासेट से 25 लाख करोड़ टोकन इस्तेमाल हुए जिनके लाइसेंस प्रशिक्षण की अनुमति देते हैं। 🔗 स्रोत
- GLiNER2.5-Decide और DecisionBench — Hanno Labs के Stephen Solka दिखाते हैं कि इनपुट का प्रारूप DecisionBench में GLiNER2.5-Decide के स्कोर को प्रभावित करता है: समर्थित पंक्तियों पर 38.9 %, जबकि Fastino ने अपने बेंचमार्क पर 60.2 % बताया था। विकल्पों के विवरण हटाने पर 101 पंक्तियों में सही उत्तर 27 से बढ़कर 37 हो जाते हैं। 🔗 स्रोत
- Perplexity की एलाइनमेंट गाइड — Perplexity ने अपने Idées खंड में AI एलाइनमेंट पर एक शिक्षाप्रद गाइड प्रकाशित की है। इसमें खुशामद (sycophancy) से लेकर जानबूझकर कम प्रदर्शन (sandbagging) तक विफलता के आठ प्रलेखित तरीके और OpenAI, Anthropic तथा Google DeepMind के सार्वजनिक ढाँचे शामिल हैं; इसके साथ कोई नई सुविधा जारी नहीं हुई है। 🔗 स्रोत
- साइबर सुरक्षा और रोज़गार पर एक विचार लेख — Hugging Face के सामुदायिक ब्लॉग पर प्रकाशित, बिना डेटा वाले एक विचार लेख में Sonny DeSorbo ने आशंका जताई है कि साइबर सुरक्षा में शुरुआती पदों का स्वचालन और AI के कारण सस्ता होता साइबर अपराध स्नातकों को ऑनलाइन अपराध की ओर धकेल सकता है। वे इस पेशे में प्रवेश के रास्ते बनाए रखने का सुझाव देते हैं। 🔗 स्रोत
इसका क्या अर्थ है
एजेंट जो बातें छिपाते हैं, वे उनकी सुरक्षा का केंद्रीय प्रश्न बन रही हैं। Clément Delangue का कहना है कि Hugging Face की घटना जैसी घटनाएँ कुछ ऐसी प्रयोगशालाओं में गुप्त रखी गई हैं जिनका नाम वे नहीं बताते, और वे एजेंट के गतिविधि रिकॉर्ड साझा करना अनिवार्य बनाने का प्रस्ताव रखते हैं। Quadrat-IPI दिखाता है कि एजेंट खुद भरोसेमंद गवाह नहीं है: इंजेक्शन से कराए गए 389 भुगतानों पर उसने केवल तीन चेतावनियाँ दीं, वह भी घटना के बाद। Mikhail Gribov इससे निष्कर्ष निकालते हैं कि निगरानी एजेंट के बाहर से, उसके पढ़े जाने वाले डेटा की जाँच के ज़रिए होनी चाहिए। Gemini CLI का नवीनतम nightly संस्करण इसी दिशा में है: वह MCP संसाधनों और वेब खोज के आउटपुट को अविश्वसनीय संदर्भ मानता है।
Clément Delangue खुले टूल का समर्थन करते हैं, जिन पर उन बंद API की तुलना में कम प्रतिबंध हैं जिन्होंने उनके रक्षात्मक एजेंटों को रोका था। इस सप्ताह Hugging Face पर प्रकाशित सामग्री कम संसाधनों से उतना ही काम करने के तरीके तलाशती है। LensVLM-9B किसी दस्तावेज़ को 15 गुना तक संपीड़ित करने के बाद केवल उपयोगी पृष्ठ दोबारा खोलता है; Pruna, Qwen-Image-2.1 के चरण 40 से घटाकर 5 या 8 करता है; DGX Spark Handbook बताता है कि कुछ डेस्कटॉप मशीनें स्थानीय रूप से क्या चला सकती हैं; और एक डेवलपर ने 1.11 अरब पैरामीटर वाले मॉडल का पूर्व-प्रशिक्षण 6 Go वीडियो मेमोरी में समा दिया है, हालांकि उसे पूरा करने में लगभग 375 दिन लगेंगे।
किसी माप का मूल्य उसे पैदा करने वाली पूरी प्रक्रिया पर निर्भर करता है। OpenAI ने जिस एन्कोडिंग बग को ठीक किया, वह चित्रों पर GPT-6 Sol और Luna के परिणाम खराब कर रहा था; यह कब से और कितना असर डाल रहा था, पता नहीं है। OpenAI की सलाह के अनुसार, चित्रों वाले मूल्यांकन फिर से चलाने चाहिए। Hanno Labs में केवल इनपुट प्रारूप बदलने से GLiNER2.5-Decide के सही उत्तर 101 में से 27 से बढ़कर 37 हो जाते हैं। SmolDataEnvs अपने कार्यों का मूल्यांकन किसी भाषा मॉडल के बिना करता है, जबकि LensVLM-9B के स्कोर एक निर्णायक मॉडल से होकर आते हैं।
कोडिंग एजेंटों के लिए भरोसे की सीमाएँ प्रशासक और उपयोगकर्ता तय करते हैं; संदेह की स्थिति में अनुरोध अस्वीकार किया जाता है। Claude Code 2.1.283 ऐसे हर मॉडल को रोकने देता है जिसे नाम लेकर अनुमति नहीं दी गई हो। Qwen Code किसी रिपॉज़िटरी में रखी Advisor सेटिंग को अनदेखा करता है। Gemini CLI का nightly संस्करण उस स्थिति में अनुरोध अस्वीकार करता है जिसमें पुष्टि ज़रूरी होती, लेकिन निर्णय लेने के लिए उपयोगकर्ता मौजूद नहीं होता। वहीं /doctor prompt-audit यह मानकर चलता है कि मॉडल उनके लिए लिखे निर्देशों से अधिक तेज़ी से बदलते हैं।
स्रोत
- @ClementDelangue: एजेंट के साइबर हमले का खुलासा करने वाली पहली कंपनी होने से हमने क्या सीखा
- क्या एजेंट बताएगा कि उस पर हमला हुआ था? (Hugging Face ब्लॉग)
- OpenAI API का बदलाव विवरण
- LensVLM-9B (Hugging Face)
- LensVLM शोध लेख (arXiv)
- SmolDataEnvs (Hugging Face)
- Claude Code 2.1.283 की रिलीज़ टिप्पणियाँ (GitHub)
- Qwen Code v0.24.6 (GitHub)
- Qwen Code की PR #12622: शुरुआत से शुरू करना (GitHub)
- Gemini CLI, 26 सितंबर का nightly v0.63.0 (GitHub)
- Gemini CLI की PR #29506: नियम इंजन (GitHub)
- Codex CLI 0.157.1 (GitHub)
- @bcherny: रोज़मर्रा के काम में Claude Tag
- उपयोग मेट्रिक्स API में पुल रिक्वेस्ट समीक्षा के चरण (GitHub बदलाव विवरण)
- उद्यम द्वारा प्रबंधित सेटिंग्स का सत्यापनकर्ता (GitHub बदलाव विवरण)
- निजी सहेजे गए दृश्य और Relates to संबंध (GitHub बदलाव विवरण)
- @bot: Grok Bot का Finance एकीकरण
- AI एजेंट और NVIDIA Isaac ROS से ROS 2 नोड को तेज़ करना (NVIDIA ब्लॉग)
- DGX Spark Handbook (Hugging Face ब्लॉग)
- 6 GB लैपटॉप GPU पर 1.11B LLM का पूर्व-प्रशिक्षण (Hugging Face ब्लॉग)
- Pruna-Qwen-Image-2.1 (Hugging Face)
- @allen_ai: Marin के प्रशिक्षण में Dolma 3.5
- कम में अधिक: GLiNER2.5-Decide और निर्णय का स्वरूप (Hugging Face ब्लॉग)
- AI एलाइनमेंट: मौजूदा शोध और बहस (Perplexity ब्लॉग)
- साइबर अपराध के श्रम बाज़ार में आने वाला झटका (Hugging Face ब्लॉग)