ai-powered-markdown-translatorمقال مترجم من الفرنسية إلى العربية باستخدام gpt-5.6-sol.
تسعة وأربعون إعلانًا في يوم 2 سبتمبر، وهو ثالث أعلى حجم منذ بدء هذه المتابعة. صدرت ثلاثة نماذج رائدة في اليوم نفسه — Gemini 3.8 Flash من Google، وMuse Spark 1.3 من Meta Superintelligence Labs، وQwen3.8-Max-0902 من Alibaba — ولم يركز أي منها على سباق النتائج الخام.
تسري أربعة توجهات في هذه النشرة. أولها السعر، الذي أصبح الحجة المحورية في عمليات الإطلاق الثلاث جميعها. ثم الاستدلال المحلي، مع وصول توليد الفيديو إلى جهاز مكتبي وإتاحة الشيفرة المصدرية لمحرك استدلال خاص بـApple Silicon في المساء نفسه. ثم حوكمة النماذج في المؤسسات، حيث يفرض GitHub الاحتفاظ بالبيانات لنموذج واحد ويتيح اختيار الإعداد الافتراضي لجميع النماذج الأخرى. وأخيرًا الأمن السيبراني، مع نموذج مخصص للمدافعين المختارين وتحالف ينضم إلى Linux Foundation.
Gemini 3.8 Flash و3.8 Flash Cyber، نموذج يعمل بجهد أكبر بالسعر نفسه
2 سبتمبر — كشفت Google عن نموذجين قدّمتهما Tulsee Doshi (المديرة الأولى لإدارة المنتجات) وRaluca Ada Popa (مسؤولة أمن Gemini في Google DeepMind): وهما Gemini 3.8 Flash وGemini 3.8 Flash Cyber. وهذا ثالث إصدار من Flash خلال ستة أسابيع، فيما لم يكن قد مضى على إطلاق 3.7 Flash سوى ثلاثة أسابيع.
تشترك النسختان في الذكاء الأساسي نفسه، وتعزو Google صراحةً جانبًا من التقدم في البرمجة والاستدلال إلى تدريب مكثف في مجال الأمن السيبراني: فالعمل المنجز على النموذج الدفاعي رفع مستوى النموذج العام. ولم يتغير السعر التمهيدي مقارنةً بـ3.7 Flash.
| خاصية Gemini 3.8 Flash | القيمة المقاسة |
|---|---|
| سعر الإدخال | 0,75 دولار لكل مليون token |
| سعر الإخراج | 3,75 دولارات لكل مليون token |
| HLE-Verified | 54,9 % |
هناك نقطة تستحق انتباه المطورين، إذ تصوغها Google بوضوح: النموذج يستهلك موارد أكثر. ويأتي تحسن الموثوقية نتيجة خيار تصميمي — ففي المهام المعقدة، ينفّذ 3.8 Flash خطوات استدلال إضافية ويستدعي الأدوات بصورة تكرارية. لذلك ترتفع فاتورة الـtoken عند مستويات الجهد العالية، وتوصي Google بخفض مستوى الجهد أو البقاء على 3.7 Flash لأعباء العمل التي تكون فيها كفاءة الحوسبة هي الأولوية. ولا يزال الإصدار السابق مدعومًا بالكامل.
نسخة Cyber هي الأكثر غرابة. فهي مخصصة للمدافعين الموثوق بهم من خلال برنامج Fairwind الذي أُطلق في اليوم نفسه، وتهدف إلى الاكتشاف الذاتي للثغرات، ولا سيما إصلاحها تلقائيًا.
| اختبار الأمن السيبراني | Gemini 3.8 Flash Cyber | نقاط المقارنة |
|---|---|---|
| CyberGym Pass@1 (اكتشاف ثغرات C/C++) | 86,2 % | GPT-5.5-Cyber 85,6 % · Mythos 5 83,8 % · GPT-5.6 Sol 83,6 % · 3.5 Flash Cyber 77,5 % |
| معيار داخلي يشمل 20 لغة | أكثر من 70 % | نطاق أوسع من C/C++ وحدهما |
| CWE-Bench pass@1 (الإصلاح، Collinear) | 47,2 % | النموذج الحدّي الرائد عند 47,8 %، ولكن بتكلفة أعلى بكثير |
تدعم أرقام النشر الداخلي تموضع التكلفة مقابل الأداء، بدلًا من الهيمنة المطلقة: إذ يحصل فريق Chrome Security على إصلاحات صالحة أكثر بمقدار 2,6 مرة مقارنةً بأفضل النماذج التجارية الأكبر بكثير، وتقيس Wiz استرجاعًا أعلى بنسبة تتراوح بين 7,5 و9,7 % في معيار اختبار الاختراق لديها، بتكلفة أقل بما يتراوح بين 2,3 و5,2 مرة، فيما حدّد فريق Cloud Vulnerability Research ثغرة أساسية حرجة خلال أقل من ساعتين، في حين يستغرق البحث عادةً أشهرًا. أما النموذج العام، فقد نُشر بالفعل في Antigravity، وواجهة Gemini API عبر Google AI Studio وAndroid Studio، وفي توليد الواجهات داخل Stitch، وGemini Enterprise، كما أُتيح لمشتركي Google AI Pro وUltra في تطبيق Gemini، وAI Mode في Google Search، وGoogle Sheets.
🔗 إعلان Gemini 3.8 Flash و3.8 Flash Cyber
نتيجة CursorBench التي توثّق الإطلاق
أضاف Cursor نموذج Gemini 3.8 Flash إلى محدد النماذج لديه بعد ساعات قليلة من الإعلان، ويوفر اختباره الخاص أفضل قياس متاح لأداء النموذج في الظروف الوكيلية. ويشير سجل CursorBench المؤرخ في اليوم نفسه إلى ترقية 3.8 Flash إلى إصدار Gemini «الأحدث»، وانتقال 3.7 Flash إلى مرتبة ثانوية.
| النموذج ومستوى الجهد | نتيجة CursorBench 3.2 | متوسط التكلفة لكل مهمة | الخطوات لكل مهمة |
|---|---|---|---|
| Fable 5.1 Max | 73,4 % | 9,64 دولارات | 70 |
| Grok 4.6 Extra High | 70,8 % | 2,81 دولارًا | 46 |
| Fable 5.1 High | 69,4 % | 4,80 دولارات | 44 |
| Opus 5 Extra High | 69,3 % | 7,35 دولارات | 72 |
| Gemini 3.8 Flash High | 69,2 % | 2,38 دولارًا | 161 |
| Gemini 3.8 Flash Medium | 67,0 % | 1,93 دولار | 136 |
| Gemini 3.7 Flash High | 61,6 % | 1,20 دولار | 99 |
الخلاصة واضحة: بنتيجة 69,2 %، يحقق Gemini 3.8 Flash High نتيجة مماثلة لـFable 5.1 High بنحو نصف السعر، ومماثلة لـOpus 5 Extra High بثلث السعر. ويبلغ الفارق عن الجيل السابق 7,6 نقاط. غير أن عمود الخطوات يذكّر بالتكلفة الخفية لخيار Google التصميمي: 161 خطوة لكل مهمة، مقابل 44 لـFable 5.1 High. ويضع Cursor بنفسه تحفظين في أسفل الصفحة — فالنتائج تتضمن قدرًا من التفاوت، والتكلفة المعروضة أُعيد احتسابها انطلاقًا من الأسعار العامة لكل مليون token، ولم تُقَس من فاتورة فعلية.
🔗 Gemini 3.8 Flash في Cursor · 🔗 نتائج CursorBench
Muse Spark 1.3، النموذج الوكيلي من Meta Superintelligence Labs
2 سبتمبر — نشرت Meta Superintelligence Labs نموذج Muse Spark 1.3، خليفة Muse Spark 1.2، وجرى نشره في اليوم نفسه ضمن Muse Code وفي Meta Model API المتاحة عبر dev.meta.ai. وهذا ثاني إصدار للمختبر خلال يومين، بعد Muse Voice Transcribe.
لا تتمثل الزاوية المعلنة في سباق النتائج، بل في قابلية الاستخدام الفعلية. صُمم النموذج لمواصلة العمل طويل الأمد مع التنقل بين عدة مسارات داخل سلسلة واحدة: فعند مواجهة هدف مفتوح، يستخدم الأدوات لبناء سياقه الخاص انطلاقًا من مصادر غير مرتبة ومتناقضة، ويصحح أوجه القصور في خطته، ويتتبع ما تعلمه. ويتعلق الجانب الأكثر غرابة بالتعاون: فقد دُرّب Muse Spark 1.3 على طرح أسئلة توضيحية عندما تكون التعليمات ملتبسة، وطلب مساعدة المستخدم عندما يتعثر، وطلب التأكيد قبل تنفيذ إجراء ذي تبعات. وتنسب المقارنات التي أجراها مهندسو Meta إليه انخفاضًا بنحو 20 % في استدعاءات الأدوات و25 % في استهلاك الـtoken مقارنةً بالإصدار 1.2 — وهو فارق يظهر مباشرةً في الفاتورة.
| الفئة المقيّمة | المعيار | Muse Spark 1.3 | Muse Spark 1.2 | GPT-5.6 Sol | Opus 5 |
|---|---|---|---|---|---|
| وكيل | GDPVal-AA v2 (العمل المعرفي) | 1754 | 1615 | 1710 | 1824 |
| وكيل | OSWorld 2.0 (الاستخدام الوكيلي للحاسوب) | 66,9 | 47,6 | 62,7 | 68,3 |
| وكيل | DeepSearchQA (التصفح الوكيلي) | 89,4 | 85,9 | 93,0 | 90,4 |
| وكيل | AutomationBench (مسار العمل من البداية للنهاية) | 49,4 | 38,2 | 46,7 | 50,3 |
| سياق طويل | MRCR 512K-1M | 98,1 | 55,5 | 73,8 | – |
| برمجة | DeepSWE v1.1 (برمجة وكيلية طويلة) | 75,4 | 55,0 | 73,0 | 74,0 |
| برمجة | SWEAtlas CodeBase QnA | 59,4 | 46,2 | 53,5 | 52,7 |
يستحق هذا الجدول قراءة متأنية. يتفوق Muse Spark 1.3 بوضوح في السياق الطويل والبرمجة، لكن Opus 5 يسبقه في الاختبارات الوكيلية الأربعة المختارة هنا. والأهم أن المقارنة لم تُجرَ في ظروف متكافئة، وهذا ما توضحه المنهجية التي نشرتها Meta: فقد جرى تقييم Muse Spark 1.3 و1.2 عند مستوى الجهد xhigh، بينما جرى تقييم Claude Opus 5 وGPT-5.6 Sol في وضع max. وهناك استثناء واحد فقط، هو DeepSWE v1.1، حيث قيس Muse Spark 1.3 في وضع max — وهو تحديدًا الوضع الذي لم يُتح بعد، إذ تشير Meta إلى أنه سيصل بعد اكتمال اختبارات الأمان الإضافية.
تلفت فقرة من خارطة الطريق الانتباه بالنسبة إلى المنظومة المفتوحة.
Stay tuned for more updates soon, including bigger models, Muse Spark open weights, and more.
🇸🇦 ترقبوا قريبًا مزيدًا من الأخبار، بما في ذلك نماذج أكبر، والأوزان المفتوحة لـMuse Spark، والمزيد. — @AIatMeta على X
بعد عام خفّضت فيه Meta بوضوح إصداراتها ذات الأوزان المفتوحة، يُعد هذا الالتزام لافتًا — ويبقى أن نرى أي إصدار سيشمله، إذ لم يُذكر أي موعد أو نطاق.
Qwen3.8-Max-0902 يحتل المركز الأول في Code Arena WebDev
2 سبتمبر — نشر Qwen تحديثًا لنموذجه الرائد: Qwen3.8-Max-0902، وهي لقطة مؤرخة تستجيب أيضًا للاسم البديل qwen3.8-max-2026-09-02. ويحتفظ النموذج بالخصائص البنيوية لإصدار أغسطس — 2 400 مليار معلمة ونافذة سياق بسعة مليون token — لكنه خضع لمرحلة إضافية من التدريب اللاحق الموجه إلى «البرمجة والعمل التعاوني».
| خاصية النموذج | القيمة المنشورة |
|---|---|
| المعلمات | 2,4 T |
| نافذة السياق | 1 M token |
| الحد الأقصى للإدخال | 991 K token (983 K في وضع thinking) |
| الحد الأقصى للإخراج | 131 K token |
| ميزانية الاستدلال | 262 K token |
| سعر الإدخال والإخراج | 2 دولار و6 دولارات لكل مليون token |
| قراءة ذاكرة التخزين المؤقت الصريحة | 0,17 دولار لكل مليون token |
| قراءة ذاكرة التخزين المؤقت الضمنية | 0,25 دولار لكل مليون token |
| إنشاء ذاكرة التخزين المؤقت الصريحة | 2,50 دولار لكل مليون token |
| حدود معدل النقل | 1 M token في الدقيقة، و15 K طلبًا في الدقيقة |
يقبل النموذج الصور والنصوص ومقاطع الفيديو كمدخلات، ويوفر خمس أدوات مدمجة عبر Responses API: مفسر شيفرة، وبحثًا من صورة إلى صورة، وبحثًا من نص إلى صورة، ومستخرج ويب، وبحث ويب. وأصبح متاحًا عبر API على QwenCloud في اليوم نفسه.
وفي اليوم نفسه، نشرت Arena.ai نتائجها في Code Arena WebDev. ودخل Qwen3.8-Max-0902 مباشرةً في المركز الأول بالترتيب العام محققًا 1 691 نقطة، أي أكثر من الإصدار السابق بـ22 نقطة، ومتقدمًا بـ3 نقاط على Claude Opus 5 عند إعداد Max، وبـ17 نقطة على Kimi K3 عند إعداد Max. وبسعر مختلط يبلغ 5 دولارات لكل مليون token، يحتل النموذج الموقع الأعلى تقييمًا على حدود Pareto لدى Arena، أي إنه يقدم أفضل نسبة بين النتيجة والتكلفة في التصنيف بأكمله.
تضفي تفاصيل الفئات مزيدًا من الدقة على الصورة: المركز الأول في Data & Analytics وConsumer Product، والثاني في Brand & Marketing وGaming وSimulations، والثالث في Content Creation Tools وReference-Based Design. ومن ثم تتركز قوة النموذج في تطبيقات البيانات والمنتجات الموجهة لعامة المستهلكين أكثر من المهام ذات الطابع الإبداعي. وتعلن Arena عن نتائج Agent Arena مرتقبة.
الاستدلال يغادر السحابة: فيديو على سطح المكتب، ومحرك محلي بترخيص مفتوح
هذا هو التيار العميق لهذا اليوم، ولا تختزله أيٌّ من الإعلانات منفردة. إصداران رئيسيان وأربع إشارات أقل بروزًا تتحرك في الاتجاه نفسه: تشغيل ما كان يتطلب بالأمس GPU في مركز بيانات، محليًا.
2 سبتمبر — نشر فريق FastVideo في Hao AI Lab (UCSD) النسخة المحلية من FastH3، وهي نسخته المقطّرة من نموذج الفيديو المفتوح MiniMax H3. كان توليد الفيديو والصوت معًا يتطلب حتى الآن GPU في مركز بيانات؛ أما الآن فيعمل النموذج على NVIDIA DGX Spark، أو جهازي DGX Spark متصلين عبر وصلة QSFP، أو جهاز Mac بمعالج Apple Silicon يضم ما لا يقل عن 36 غيغابايت من الذاكرة الموحّدة.
القيد الرئيسي ليس القدرة الحاسوبية، بل الذاكرة. يحتوي DGX Spark على 128 غيغابايت من ذاكرة LPDDR5X الموحّدة بسرعة تقارب 270 غيغابايت/ثانية، أي نحو عُشر عرض نطاق ذاكرة HBM في مراكز البيانات، مع إتاحة فعلية تبلغ 121 غيغابايت لأحد الأحمال. لذلك يعمل خط المعالجة على مراحل: ترميز الـ prompt، وتحرير مُرمّز النص، وتحميل الـ transformer، وإزالة الضوضاء، ثم تحريره وتحميل VAE. على GPU منفصل، يؤدي نسخ الأوزان إلى المضيف إلى تحرير ذاكرة الجهاز؛ أما على Spark، فتعود هذه النسخة إلى المجمّع نفسه. أزال الفريق هذه العملية لصالح تحميل DiT مباشرة على GPU — فانخفض تحميل الـ transformer من 445 ثانية إلى 39 ثانية، وانخفض تشغيل بدقة 768×1344 على 124 صورة من 772 ثانية إلى 336 ثانية.
| جهاز الاختبار | التوليد الأول | التوليد المتكرر |
|---|---|---|
| Apple M4 Max | 504 s | 465 s |
| DGX Spark | 264 s | 243 s |
| 4x GB200 | 10,2 s | 5,1 s |
مقارنةً بالوصفة العامة vLLM-Omni المخصصة لـ DGX Spark، التي تتطلب 1 881 ثانية بدقة 1024×576 لإنتاج فيديو مدته خمس ثوانٍ عبر 50 خطوة، ينخفض FastH3 بأربع خطوات إلى 268 ثانية، أي نحو 7x؛ وترتفع النسبة إلى 8,4x بدقة 832×480 ثم تنخفض إلى 7,9x بدقة 1344×768. على M4 Max، ينخفض ترميز prompt غير مخزّن مؤقتًا من نحو 80 ثانية إلى نحو 17 ثانية، ويخفض مُفكّك الترميز TAEH3 زمن فك الترميز من 102 ثانية إلى ثانية واحدة، مع تقليص ذروة الذاكرة من 11,0 إلى 3,6 غيبيبايت. نُشرت أوزان MLX بصيغ INT8 وINT6 وINT4 على Hugging Face، مصحوبةً بـ FastVideo Cookbook الذي نُشر للمرة الأولى. والهدف التالي المُعلن: عائلة RTX، بما فيها 5090 و4090.
في المساء نفسه، فتحت Perplexity مصدر Lily، وهو محرك الاستدلال المحلي الذي يشغّل الجزء المنفّذ على الجهاز من حوسبتها الهجينة على Mac. كان المحرك قد قُدّم في اليوم السابق ضمن تدوينة بحثية؛ والجديد هو نشر الشفرة بترخيص Apache-2.0 في مستودع perplexityai/pplx-garden، حيث ينضم إلى fabric-lib وpplx-unigram.
تؤكد الشفرة تبنّي نهج شديد التخصص. Lily ليس محركًا عامًا: فهو لا يحمّل سوى checkpoint واحد، هو Qwen3.6-35B-A3B المكمّم إلى 4 bits بطريقة affine وبتنسيق MLX، مع حجم مجموعة يبلغ 64، ويُتحقق منه عند التحميل. وتُرفض صراحةً checkpoints الكثيفة من Qwen، والنسخ الأصغر، وBF16، وGGUF، وAWQ، وGPTQ، وint8، وfp8. كُتب المحرك بلغة Rust مع نوى Metal تُجمّع من المصدر عند بدء التشغيل، ولا يستخدم PyTorch أو MLX في مسار التنفيذ، ويتطلب GPU من Apple من العائلة 10 أو أحدث — أي M5 أو أحدث — مع macOS 26 على الأقل. كما أن نطاق API محدود بالقدر نفسه: ثلاثة مسارات فقط، وفك ترميز جشع دائمًا، مع رفض معاملات أخذ العينات وstreaming والأدوات والمحتوى متعدد الوسائط بدلًا من تجاهلها. وهذا التضييق هو النقطة المثيرة للاهتمام: لا تقدم Perplexity منافسًا لـ MLX-LM، بل برهانًا على أن محركًا مصممًا خصيصًا لمنصة ونموذج محددين يتفوق على framework عام.
أربعة إصدارات أخرى لهذا اليوم تسير في الاتجاه نفسه، وهي مذكورة في قسم الأخبار الموجزة: TranslatePsy-Nano، وهي نماذج ترجمة يتراوح حجمها بين 17 و42 ميغابايت وتغطي سبع عشرة لغة؛ وعمل i64 Systems حول خبراء نموذج MoE المقيمين على NVMe من دون تغيير بايت واحد في المخرجات؛ وتدوينة Cohere التي تدافع عن اختيار الحجم المناسب للنماذج الصغيرة في المؤسسات؛ والبث المباشر لـ DGX Spark من NVIDIA المخصص للتشغيل المحلي لـ Portable Computer من Perplexity. لا يحمل أي منها وزنًا كبيرًا منفردًا، لكنها جميعًا تنقل الحوسبة من مركز البيانات إلى الجهاز.
🔗 FastH3 محليًا · 🔗 فتح مصدر Lily · 🔗 مستودع pplx-garden
Anthropic تفتح مصدر Claude Commerce Agents
2 سبتمبر — نشرت Anthropic مشروع Claude Commerce Agents كمصدر مفتوح، وهو مستودع مرجعي بترخيص Apache 2.0 لبناء وكلاء للتجارة. ويأتي الإعلان عمدًا قبل موسم العطلات، وهي الفترة التي تخطط فيها فرق التجارة الإلكترونية لعمليات النشر الخاصة بها.
يتضمن الـ blueprint وكيلين متكاملين. يعيش وكيل التسوق داخل تطبيق المؤسسة: يبحث في الكتالوج، ويجمع مجموعة من العناصر استجابةً لطلب مصاغ بلغة طبيعية، ويتذكر تفضيلات العميل، ويعرض المنتجات والمقارنات وسلة التسوق داخل المحادثة، ثم يسلّم المهمة إلى checkout — ويجيب عن أسئلة خدمة العملاء في سلسلة المحادثة نفسها. أما وكيل التاجر، فهو موجّه إلى الفرق التي تدير المتجر: تحليل المبيعات، والتنبيه بشأن نفاد أحد المنتجات قبل حملة ترويجية، وتقديم توصيات للأسعار استنادًا إلى السجل، وصياغة الحملات.
| عنصر المستودع | المحتوى المقدَّم |
|---|---|
| الوكلاء المتاحون | وكيل التسوق (العميل) ووكيل التاجر (back-office) |
| القطاعات القابلة للتشغيل | البيع بالتجزئة، والسفر، والاتصالات، وحجز التذاكر |
| بيئات التشغيل | Messages API، وClaude Agent SDK، وClaude Managed Agents (beta) |
| منصات النشر | Claude API، وAmazon Bedrock، وMicrosoft Foundry، وGoogle Cloud Vertex AI |
| إضافة Claude Code | commerce-builder@claude-commerce-agents |
| المتطلبات التقنية | Python 3.11 أو أحدث، وNode 22 |
| النتائج المرصودة بالفعل | لدى تجار التجزئة الذين يشغّلون وكلاء تسوق على Claude: سلال أكبر بنسبة تصل إلى 35 %، ومتسوقون أكثر ميلًا إلى إتمام الشراء بنسبة 60 % |
الفصل بين ما يقرره النموذج وما يُنفّذ فعليًا فصلٌ بنيوي لا تصريحي. فمن جهة المستهلك، لا تتضمن واجهة backend التي يستدعيها الوكيل أي طريقة للدفع أصلًا. ومن جهة التاجر، تنتج كل أداة كتابة تغييرًا معلّقًا مصحوبًا بمعرّف مولّد على جانب الخادم، ولا تنجح الدالة apply_change إلا مع المعرّفات التي جرى اعتمادها عبر واجهة فعلية للتحقق البشري. وتوضح Anthropic أن هذا تنفيذ مرجعي غير خاضع للصيانة ولا يقبل مساهمات: إنه نقطة بداية لإجراء fork، لا تبعية ينبغي تتبّعها. جميع المؤسسات الواردة في العروض التوضيحية خيالية، ولا يجري أي شيء طلب شراء أو خصمًا من بطاقة.
🔗 إعلان Claude Commerce Agents · 🔗 مستودع commerce-agents
الجانب التقني: التخزين المؤقت، وزمن الاستجابة، وضوابط الحماية في الشفرة
نُشر في اليوم نفسه دليل هندسي مصاحب للـ blueprint بتوقيع Ali Shazal وMatthew Koen، ويلخص عامًا من العمل مع تجار التجزئة والأسواق وشركات السفر. ونصيحته الأولى تخالف المتوقع: عند التعامل مع وكيل يتعين عليه تغطية فئات عديدة، لا ينبغي إنشاء وكيل فرعي لكل مجال. فمحادثة التجارة جلسة واحدة شديدة الترابط، ويؤدي تقسيمها إلى تراجع الجودة — إذ تأتي القدرات من skills، لا من مضاعفة عدد الوكلاء.
| الموضوع المتناول | المؤشر الرقمي الذي قدمته Anthropic |
|---|---|
| استجابة التجارة المعروضة | من 500 إلى 700 token من المخرجات |
| قراءة tokens المخزنة مؤقتًا | عُشر تكلفة tokens الجديدة |
| كتابة ذاكرة التخزين المؤقت | زيادة بنحو 1,25x، وتُسترد تكلفتها بدءًا من الاستخدام الثاني |
| معدل نجاح ذاكرة التخزين المؤقت المستهدف | من 90 إلى 99 % |
| سرعة القراءات من ذاكرة التخزين المؤقت | أسرع بمقدار 1,5 إلى 2x عند نحو 100 000 token |
| مكسب الذاكرة | زيادة بنسبة 13 % في استرجاع الحقائق ضمن حزمة التقييم الداخلية |
| حالات التقييم لكل تدفق | من 50 إلى 100 للبدء |
في اختيار النموذج، تتمثل التوصية في البدء بـ Opus لوكلاء التجار، حيث يغلب التحليل، وبـ Sonnet لوكلاء المستهلكين، حيث يكون لزمن الاستجابة وزن أكبر — ثم تشغيل حزمة التقييم كاملةً على كل نموذج وكل مستوى جهد، مع قياس التكلفة لكل مهمة منجزة بدلًا من كل استدعاء للنموذج. أما قسم السلامة فلا يحتمل اللبس.
The prompt is where safe behavior starts, but in commerce it can’t be where safety is enforced. The failures are financial and often irreversible, and a prompt rule is one injection or one bad sample away from being skipped.
🇸🇦 الـ prompt هو المكان الذي يبدأ فيه السلوك الآمن، لكنه لا يمكن أن يكون، في التجارة، المكان الذي تُطبَّق فيه السلامة. فالإخفاقات مالية وغالبًا لا يمكن التراجع عنها، ولا تفصل قاعدةً في الـ prompt عن تجاوزها سوى عملية injection واحدة أو عينة سيئة واحدة. — Anthropic، دليل لتشريح وكلاء التجارة الفعّالين
لذلك تُطبّق أربع قواعد في الشفرة، وتُعرّف مرة واحدة لتتشاركها بيئات التشغيل الثلاث: يُعِدّ النموذج الإجراء، لكن شخصًا أو سياسةً يطبّقه؛ ولا تقبل عمليات الكتابة والعرض سوى المعرّفات الصادرة عن الخادم؛ ويجب أن تصمد المعاملات المحدودة بسقف أمام الطلبات المتكررة؛ ويجري تعقيم محتوى الأطراف الثالثة.
التحكم في الحاسوب ينتقل إلى الخلفية في Claude Code وClaude Cowork
2 سبتمبر — لم يعد تحكم Claude في الحاسوب (computer use) يستأثر بالشاشة. فحتى الآن، كان تشغيل مثل هذه المهمة يعني التنازل عن الجهاز: تُخفى النوافذ الأخرى طوال مدة عمل Claude داخل التطبيق المعتمد. أما الآن، فتستمر المهمة في الخلفية، سواء في Claude Cowork أو ضمن علامة تبويب Code في تطبيق desktop، بينما يواصل المستخدم عملًا آخر.
لا يزال التغيير في مرحلة beta، وهو مخصص لباقتي Pro وMax ومحدود بنظام macOS — في حين تظل ميزة computer use نفسها متاحة في research preview على macOS وWindows. ولا يحتاج من كانوا يستخدمون الميزة بالفعل إلى تفعيل أي شيء؛ أما الآخرون فسيجدونها في Settings > General، مع العلم أن macOS يتطلب أيضًا أذونات النظام لإمكانية الوصول وتسجيل الشاشة.
أما الإطار الأمني فلا يتغير. فعلى خلاف أداة Bash التي تعمل داخل sandbox، تُنفّذ ميزة computer use على سطح المكتب الحقيقي. وتظل مستويات الوصول محددة حسب فئة التطبيق ولا يمكن تعديلها: العرض فقط للمتصفحات ومنصات التداول، والنقر فقط للـ terminals وبيئات IDE — بما يدفع Claude إلى استخدام الأداة المخصصة بدلًا من التحكم في الشاشة — والتحكم الكامل لبقية التطبيقات. ويسري الاعتماد طوال الجلسة الحالية، أو لمدة ثلاثين دقيقة في جلسة أُطلقت عبر Dispatch.
🔗 إعلان computer use في الخلفية
Cursor يشغّل وكلاءه السحابيين على أجهزة يديرها العميل
2 سبتمبر — نشرت Cursor تدوينة منتج بتوقيع Jack Pertschuk تتيح تشغيل وكلائها السحابيين على بنية تحتية يملكها العميل. حتى الآن، كان وكيل Cursor السحابي يعمل على آلة افتراضية مخصصة داخل سحابة الشركة. ومع Self-Hosted Machines، ينتقل تنفيذ الأدوات إلى أجهزة موجودة داخل شبكة المؤسسة، بينما تظل حلقة الوكيل والاستدلال والتخطيط لدى Cursor.
يَرِد الرقم الذي يبرر هذه الخطوة منذ البداية: تنتج الوكلاء السحابية الآن أكثر من 60 % من pull requests التي تدمجها Cursor داخليًا. وعندما تمر حصة متزايدة من العمل عبر هذه الوكلاء، يتوقف الجهاز الذي تعمل عليه عن كونه تفصيلًا ثانويًا. وتحدد الشركة ثلاث حالات تدفع فريقًا إلى استخدام أجهزته الخاصة: تنفيذ الأدوات على اتصال مباشر بمدير الشفرة المصدرية والخدمات الداخلية، أو استخدام عتاد خاص مثل GPU أو أجهزة Mac لتطوير iOS، أو تشغيل نظام تشغيل يصعب تضمينه في صورة لوكيل سحابي.
| جانب من النظام | التفاصيل التقنية |
|---|---|
| أمر التسجيل | agent worker start، اتصال HTTPS صادر طويل الأمد |
| اتجاه الاتصال | لا تبدأ Cursor مطلقًا اتصالًا واردًا إلى شبكة العميل |
| الإعدادات المتاحة | My Machines (محطة عمل أو VM فردية) وPools (قائمة انتظار مشتركة للفريق) |
| الاستئناف بعد الخمول | إسبات عبر snapshot، واستعادة باستخدام معرّف worker نفسه |
| مزودو sandboxes | AWS Lambda، وCloudflare، وCoder، وDaytona، وE2B، وModal، وNamespace، وVercel |
| التحكم في الحاسوب | أصبح Linux مدعومًا، إلى جانب أجهزة Mac، عبر Chrome أو Chromium |
تتوسع الـ pools عبر controller يراقب قائمة انتظار الطلبات ويشغّل الأجهزة باستخدام script يقدمه الفريق؛ وإذا لم يتوفر أي worker، ينتظر الطلب. وللحالة الوسطى بين إعادة تهيئة الجهاز وإبقائه قيد التشغيل، وهما خياران مكلفان، تقدم Cursor وضع الإسبات: يُلتقط snapshot للجهاز الخامل ثم يُوقف، وإذا وصل طلب إعادة تشغيل ضمن نافذة إعادة الاتصال، يُستعاد الـ snapshot. ولأن الـ pool غير مرتبط بمستودع بعينه، يمكن لقائمة انتظار واحدة أن تخدم عدة مستودعات.
وهناك تحفظ تطرحه التدوينة نفسها: الذي ينتقل هو بيئة التنفيذ وحدها. إذ تُرسل مخرجات الأدوات إلى Cursor لإجراء الاستدلال وقد تتضمن شفرة، كما يمكن معالجة نصوص جلسات الوكلاء وتخزينها هناك. لذا فهذه ليست عزلة كاملة، بل نقل لمكان التنفيذ.
يدخل Claude Fable 5.1 مرحلة التوفر العام لدى جهات التكامل
1 و2 سبتمبر — في يوم إصداره نفسه، أصبح Claude Fable 5.1 متاحًا بصورة عامة في GitHub Copilot؛ وفي اليوم التالي، دمجته Genspark في Code Agent وClaw. جهتا تكامل خلال يومين للنموذج نفسه: إنها موجة تبنٍّ، وليست خبرين منفصلين.
لدى GitHub، التغطية واسعة — Visual Studio Code وVisual Studio وCopilot CLI وcoding agent وتطبيق GitHub Copilot وgithub.com وGitHub Mobile على iOS وAndroid وبيئات JetBrains IDE وXcode وEclipse — وذلك لخطط Pro+ وMax وBusiness وEnterprise، مع طرح تدريجي وفوترة وفق السعر العام للمورّد. لكن أبرز جوانب هذا الإتاحة ليس تقنيًا، بل تعاقدي.
| شرط الوصول | ما ينطبق على Fable 5.1 |
|---|---|
| سياسة المسؤول | معطّلة افتراضيًا، ويجب تفعيلها صراحةً |
| الاحتفاظ بالبيانات | إلزامي افتراضيًا لمصنّفات السلامة التابعة لـAnthropic |
| استخدام البيانات المحتفَظ بها | لا تُستخدم لتدريب نماذج Anthropic |
| نماذج Claude الأخرى | يستمر انعدام الاحتفاظ، باستثناء Fable 5 وFable 5.1 |
| إعفاء انعدام الاحتفاظ | للمؤسسات المؤهلة، حتى نهاية السنة التقويمية |
| بعد انتهاء الإعفاء | يلزم استخدام Enterprise Frontier Safeguards |
على خلاف نماذج Claude الأخرى في Copilot، يفرض Fable 5.1 الاحتفاظ بالبيانات افتراضيًا: تحتفظ Anthropic بالمطالبات والمخرجات لتشغيل مصنّفات السلامة لديها. ولذلك يُعد تفعيل السياسة قبولًا صريحًا بهذا القيد، بينما يؤدي إبقاؤها معطّلة ببساطة إلى عدم إتاحة النموذج. أما سبيل الاستثناء فمؤقت وانتقائي: يمكن للمؤسسات المؤهلة مواصلة العمل دون الاحتفاظ بالبيانات حتى نهاية السنة التقويمية، ريثما تنشر Anthropic منظومة Enterprise Frontier Safeguards، التي يُفترض أن توفر مراقبة آلية للسلامة ومفاتيح للتخزين والتشفير يتحكم فيها العميل. ولا يمكن الحصول على الأهلية بالخدمة الذاتية: إذ يجب المرور عبر فريق مبيعات GitHub، ولا يستطيع الدعم تجاوز هذه الخطوة، وحتى بعد الموافقة لا يجري تفعيل أي شيء تلقائيًا.
من جهتها، تؤكد Genspark أنها دمجت النموذج منذ اليوم الأول في Genspark Code Agent وClaw، من دون نشر معيار أداء أو تفاصيل للتسعير. وبذلك تنضم الشركة إلى قائمة المنصات الوكيلة التي تبنّت النموذج خلال الساعات التالية لإطلاقه، إلى جانب Cursor وDevin وWarp وv0 وAmp وPerplexity Computer.
🔗 Fable 5.1 في GitHub Copilot · 🔗 إعلان Genspark
توضح GitHub كيف جعلت Copilot أقل تكلفة من دون تدهور الجودة
2 سبتمبر — نشرت GitHub مقالًا هندسيًا بقلم Erik Kristensen وبمشاركة Napalys Klicius، حول خفض تكلفة Copilot. ويُعد النص غير معتاد في هذا السياق: فهو يقدم أرقامًا، ويصف التجارب التي أخفقت، ويوضح لماذا قد يأتي التحسين البديهي بنتائج عكسية.
الفرضية الافتتاحية مخالفة للحدس. فعدّ الرموز في تفاعل منفرد لا يقيس الكفاءة: إذ إن استجابة أداة موجزة تحذف معلومة يحتاج إليها الوكيل تجبره على إعادة تشغيل الأمر، ما يجعل المهمة أبطأ وأعلى تكلفة إجمالًا. وتوضح GitHub هذا المأزق باستخدام RTK (Rust Token Killer)، وهي أداة مساعدة تختصر مخرجات shell قبل قراءتها. لقد نجحت بالفعل في اختصار بعض الاستجابات، لكن خطوات الاستعادة اللاحقة أضافت جولات أخرى: رموز وُفّرت محليًا ثم أُنفقت على المستوى الإجمالي. ولذلك لم تُنشر الأداة.
| التغيير الذي جرى تقييمه | المكسب المقاس |
|---|---|
| إزالة أرقام الأسطر في الاختبارات غير المتصلة | انخفاض تكلفة الاستدلال بنحو 5% |
| إزالة أرقام الأسطر في بيئة الإنتاج على CLI | انخفاض متوسط التكلفة اليومية لكل مستخدم بنحو 3% |
ضغط مطالبة الأداة task | إزالة 1,300 رمز في كل جولة، وانخفاض التكلفة المعيارية لكل ساعة نشطة 2.9% |
| التسليم المباشر للعمل المكتمل في الخلفية | انخفاض الاستخدام المرتبط بالرموز بنحو 2.3%، مقاسًا بوحدات AI Credits |
| أرقام الأسطر والضغط في Copilot code review | انخفاض رموز المطالبة لكل مراجعة بنحو 5% لكل واحد من التغييرين |
| الانتقال السابق إلى أدوات الملفات المشتركة | انخفاض تكلفة المراجعة بنحو 20% |
| RTK (Rust Token Killer) | استُبعد، إذ ارتفعت التكلفة الإجمالية في الإعداد المختبَر |
تتسم سياسة الضغط المعتمدة بالتعمد في التحفظ، وتتكون من ثلاثة محاور: إبقاء المخرجات التي تشبه الشفرة المصدرية سليمة، وإعادة تنظيم نتائج البحث من دون حذف أي شيء، وعدم ضغط سوى الضوضاء المتكررة الناتجة عن التثبيت والبناء والاختبار. وكان ضغط git diff جزءًا من الإصدارات الأولى؛ لكنه أُزيل بعدما أظهرت مهام قياس الأداء أن الوكلاء يعيدون فتح المخرجات الأصلية.
أما أكثر الوقائع إفادة فتتعلق بضغط المطالبات. فقد أدت حلقة من المطالبات الوصفية، يعيد فيها Copilot كتابة تعليماته ذاتيًا بصورة تكرارية، إلى تقليص مطالبة الأداة task إلى النصف — لكن التجربة الأولى عبر الإنترنت كشفت عن تراجع لم ترصده التقييمات غير المتصلة: إذ حوّلت الحلقة توجيهًا حذرًا بشأن التوازي إلى قاعدة ترتيب صارمة، ما أدى إلى تنفيذ الوكلاء المستقلين تسلسليًا. واستبدل الإصلاح القوائم البيضاء والسوداء بجملة واحدة تترك القرار للنموذج. أما الدرس الأخير، وهو الأكثر فائدة، فهو أن المكاسب لا تنتقل من منتج إلى آخر. فقد أدت مجموعة تعليمات أكثر إحكامًا، مستوحاة من النتائج الجيدة المحققة في Copilot code review، إلى زيادة التكلفة في Copilot CLI.
None of these changes made the model smarter. They removed work the model never needed to do.
🇸🇦 لم يجعل أيٌّ من هذه التغييرات النموذج أكثر ذكاءً. بل أزالت أعمالًا لم يكن النموذج بحاجة إلى تنفيذها أصلًا. — مدونة GitHub، كيف نجعل البرمجة بالذكاء الاصطناعي أكثر كفاءة من حيث التكلفة
إعادة تشكيل كتالوج نماذج Copilot
1 و2 سبتمبر — تصف مذكرتا تغييرات صدرتا في الوقت نفسه وجهي عملية إعادة تشكيل واحدة: ما يغادر كتالوج Copilot، ومن يقرر الآن النموذج الافتراضي.
أُوقِف دعم ستة نماذج اعتبارًا من 1 سبتمبر في معظم تجارب Copilot — بما يشمل Copilot Chat والتحرير عبر الإنترنت ووضعَي ask وagent وإكمال الشفرة.
| النموذج المسحوب | البديل الذي تقترحه GitHub |
|---|---|
| Gemini 3.1 Pro | Gemini 3.7 Flash |
| Claude Opus 4.5 | Claude Opus 4.7 أو Claude Opus 4.8 أو Claude Opus 5 |
| Claude Opus 4.6 | Claude Opus 4.7 أو Claude Opus 4.8 أو Claude Opus 5 |
| Claude Sonnet 4.5 | Claude Sonnet 5 |
| Claude Sonnet 4.6 | Claude Sonnet 5 |
| Raptor Mini | MAI-Code-1.1-Flash |
يبقى استثناء واحد: يظل Claude Sonnet 4.6 متاحًا للمشتركين الأفراد في الخطة السنوية. ولا يلزم المستخدم اتخاذ أي إجراء، لكن قد يتعين على مسؤولي Copilot Enterprise تفعيل النماذج البديلة صراحةً في سياساتهم، وإلا فلن تظهر في VS Code ولا على github.com.
وفي الوقت نفسه، باتت الإعدادات المُدارة في المؤسسات تقبل أي نموذج بوصفه الخيار الافتراضي للمحادثات الجديدة. وتتجاوز الدقة مستوى المؤسسة: فمن خلال تعريف المفتاح model بوصفه overridable وتحرير ملفات إعدادات الفريق في team-mappings.json، يستطيع المسؤول السماح لكل فريق باختيار نموذجه الافتراضي، بينما يرث المستخدمون غير المشمولين الإعداد العام. والميزة متاحة بصورة عامة في Copilot Business وCopilot Enterprise، ضمن تطبيق GitHub Copilot وCopilot CLI وVisual Studio Code.
🔗 النماذج المتوقفة · 🔗 النموذج الافتراضي في المؤسسات
سجل الإصدارات لشهر أغسطس: Copilot في Slack وTeams، ووسائط في CLI
1 و2 سبتمبر — الملخص الشهري الذي نشرته GitHub في صورة مقال على X مادة ترويجية، لكنه يكشف عن إصدار صدر في أغسطس ولم يحظَ بالتغطية: أصبح GitHub Copilot متاحًا الآن من داخل Slack وMicrosoft Teams. ويجلب التكامل قدرات Copilot CLI وتطبيق GitHub Copilot الوكيلة إلى محادثات الفرق — إذ تتيح الإشارة إلى GitHub التخطيط للتغييرات أو التحقيق في مشكلة أو إحالة مهمة برمجية من دون مغادرة سلسلة المحادثة.
| عنصر سجل الإصدارات لشهر أغسطس | ما جرى إصداره |
|---|---|
| Copilot في Slack وMicrosoft Teams | القدرات الوكيلة لـCopilot CLI وتطبيق Copilot |
| Copilot code review، بعمق Balanced | توفر عام إلى جانب Lite، مع إمكانية ضبط الخيار الافتراضي حسب المؤسسة أو المستودع |
| النماذج الجديدة المُذكَّر بها | Gemini 3.7 Flash وMAI-Code-1.1-Flash وKimi K3 المستضاف لدى Fireworks AI |
| عرض ترويجي على GPT-5.6 Sol | بنصف السعر حتى 3 سبتمبر |
| عرض ترويجي على الاختيار التلقائي | خصم 30% لمستخدمي Copilot Max |
| GitHub Copilot Day | 10 سبتمبر 2026 |
يوثق الملخص أيضًا مستوى العمق Balanced في Copilot code review، الذي أصبح متاحًا بصورة عامة إلى جانب Lite: يستهدف Balanced تحليلًا أعمق لطلبات pull requests، بينما يستهدف Lite التغييرات المباشرة، ويمكن ضبط مستوى العمق الافتراضي على مستوى المؤسسة أو المستودع.
ويكمل إصدار آخر خلال الشهر الصورة من ناحية سطر الأوامر: إذ يرفع الخيار القابل للتكرار --attach في GitHub CLI، والمتاح منذ الإصدار gh v2.99.0، صورة أو مقطع فيديو محليًا ويشير إليه ضمنيًا داخل issue أو pull request أو تعليق. ويعمل مع الأوامر الستة التي تكتب Markdown، أما التفصيل الذي يجعله عمليًا فهو تعامله مع Markdown الموجود مسبقًا: إذ يُعاد تعديل المسار المحلي المشار إليه بالفعل داخل المتن في موضعه، بحيث يحتفظ  بنصه البديل ويشير إلى الأصل المرفوع. ويُكتب النص البديل بعد # في المسار. الصيغ المقبولة: PNG وJPEG وGIF وWebP وSVG وMP4 وMOV وWebM، بحد أقصى 10 ميغابايت للصور و100 ميغابايت للفيديو في الخطط المدفوعة. ولا يدعم هذا الإصدار GitHub Enterprise Server. وتشدد GitHub صراحةً على أن وكلاء البرمجة يرثون هذه القدرة، ويمكنهم الآن عرض النتيجة بدلًا من وصفها.
🔗 سجل إصدارات أغسطس 2026 · 🔗 الوسائط في GitHub CLI
Fairwind Program، دفاع Google السيبراني المخصص للمدافعين الموثوقين
2 سبتمبر — بالتزامن مع Gemini 3.8 Flash Cyber، أطلقت Google برنامج Fairwind Program، وهو القناة التي يُوزّع هذا النموذج من خلالها. وينطلق التفسير الذي قدمه Four Flynn، نائب رئيس الأمن والخصوصية، من معضلة عملية تواجه فرق الدفاع: إما تبنّي نماذج حدودية ضخمة ومكلفة ويصعب التحكم فيها عند استخدامها مع قواعد الشفرة الخاصة بالمؤسسات، أو اللجوء إلى نماذج أصغر ذات أوزان مفتوحة تواجه صعوبة في إصلاح الثغرات المعقدة.
يجمع الحل بين Gemini 3.8 Flash Cyber وCodeMender، وهو إطار الإصلاح التلقائي من Google. ولا تتمحور الحجة الأساسية حول الاكتشاف بل المعالجة: فاكتشاف نقاط الضعف يخلق الوعي والخوف، بينما يؤدي العثور عليها وإصلاحها تلقائيًا إلى تحقيق الأمان. ويتمثل الوعد في إنشاء إصلاحات متحقق منها وقابلة للنشر خلال دقائق بدلًا من أسابيع، داخل البيئة السحابية الآمنة للمؤسسة العميلة.
يأتي الوصول على مراحل متعمدة، مع ثلاث دوائر ذات أولوية: الحكومات والسلطات السيبرانية الوطنية، ومشغلو البنية التحتية الحيوية في قطاعات الصحة والاتصالات والطاقة والشبكات المالية، والمنصات التقنية المركزية. وتقبل المؤسسات المشاركة قيودًا صارمة — تقييد الوصول على فرق الأمن السيبراني الداخلية أو الاستجابة للحوادث أو اختبار الاختراق، ونشر وسائل حماية مثل المصادقة متعددة العوامل. وتعلن Google مشاركة أكثر من 650 شريكًا حول العالم. وخارج البرنامج، يمكن لأي عميل لدى Google Cloud استخدام CodeMender مع النماذج المتاحة للعامة على Gemini Enterprise Agent Platform، إلى جانب AI Threat Defense. وتشير الشركة أيضًا إلى تجاوز تمويلها التراكمي للأمن السيبراني عبر Google.org حاجز 100 مليون دولار، منها 36 مليونًا لـ35 عيادة سيبرانية دعمت أكثر من 1,250 مستشفى ومنطقة تعليمية وخدمة بلدية أمريكية.
أدوات Google عبر سطر الأوامر: ثلاثة إصدارات في يومين
1 و2 سبتمبر — أطلقت Google ثلاثة إصدارات ضمن النطاق نفسه خلال يومين، وترسم مجتمعةً أولوية واضحة: ميزات أقل، وعزل واستقرار أكبر.
| الإصدار المنشور | التاريخ | المحتوى الغالب |
|---|---|---|
| Gemini CLI v0.58.0 | 1 سبتمبر | سبعة تغييرات يغلب عليها الأمان، وترقية إلى القناة المستقرة |
| Antigravity CLI 1.1.23 | 1 سبتمبر | تحسينان وأحد عشر إصلاحًا |
| Antigravity 2.12.0 | 2 سبتمبر | سبعة تحسينات وتسعة إصلاحات |
انتقلت القناة المستقرة من Gemini CLI إلى v0.58.0، وهي ترقية مرّت دون أن يلاحظها كثيرون لأنها جاءت بعد اثنتين وثلاثين دقيقة من نشر النسخة التجريبية v0.59.0. والمحتوى دفاعي بالكامل تقريبًا. يمسّ الإصلاح الأهم بيئة العزل في macOS: إذ يعزل ملف Seatbelt الآن مقابس Docker وملفاته التنفيذية، وكذلك بيئات تشغيل الحاويات، ما يغلق مسارًا تقليديًا للهروب — فالعملية المعزولة التي تصل إلى مقبس Docker على الجهاز المضيف تستطيع عمليًا الإفلات من العزل. ويعزز تغييران آخران النواة: أصبح تقييم الروابط الرمزية متسقًا في إدارة المسارات المتجاهلة، وصار الإعلان عن مدققات السلامة من المستوى الأول صريحًا في إعدادات سياسة الكتابة.
يقدم Antigravity 2.12.0 ميزتين وظيفيتين جديدتين. يتيح اقتباس الردود تحديد جزء من رد لإعادة إدراجه كسياق في الموجّه التالي — وهو حل مباشر لمشكلة يومية في الجلسات الوكيلة الطويلة. كما يعزز الأمر /boost، المخصص للمستخدمين المشتركين في الخطط المدفوعة، جهد التفكير عبر مسار استدلال متعدد الوكلاء. ويصل في اليوم نفسه الذي صدر فيه Gemini 3.8 Flash، والذي تقر Google بأنه يعمل بجهد أكبر مقابل استهلاك مزيد من الرموز: يسير التحركان في الاتجاه نفسه، أي تمكين المستخدم من التحكم الصريح في مستوى الجهد. أما البقية فتعالج مشكلات مزعجة فعلية: تشير الإعدادات العامة إلى المشاريع التي تتجاوز إعدادًا معينًا، وتظل تخطيطات الطرفية ذات الشاشة المنقسمة محفوظة بعد إعادة تحميل النافذة، ويمكن إرسال رسالة أثناء استمرار الإملاء.
أما Antigravity CLI 1.1.23، فيخفف تدفق الوكلاء الفرعيين عبر إرسال البيانات الوصفية للمسار مرة واحدة لكل مسار فرعي بدلًا من إرسالها في كل خطوة، ويقبل عبر Tab اسم النموذج المقترح كنص شبحي في /model. وتكشف إصلاحاته الأحد عشر عن عيوب مرهقة في الاستخدام اليومي: أعطال تسببها خطافات الموجّهات، ومعرّفات استدعاء الأدوات المحذوفة عند إعادة بناء السجل لنماذج Gemini، ومطالبات الأذونات التي تعرض عناوين عامة بدلًا من أوصاف مفهومة للإجراءات — وهي مشكلة حقيقية، إذ يُطلب السماح بإجراء لا يجري وصفه — ووكلاء فرعيون جرى التصريح عنهم باستخدام enable_mcp_tools=true كانوا يفشلون بسبب غياب موزّع MCP.
🔗 ملاحظات إصدار Gemini CLI v0.58.0 · 🔗 سجل تغييرات Antigravity
أصبحت عروض الفيديو القصيرة في Gemini Notebook متاحة بأكثر من 70 لغة
1 سبتمبر — وسّع Gemini Notebook عروض الفيديو القصيرة لتشمل أكثر من 70 لغة، وأضاف إليها ثلاثة تنويعات جديدة للغة الإنجليزية. تحوّل الميزة مصادر دفتر الملاحظات إلى مقاطع فيديو عمودية مدتها نحو 60 ثانية، ويمكن الآن إنشاؤها بلغة المستخدم.
يشمل الإطلاق الويب والأجهزة المحمولة، ويظل مقتصرًا على مشتركي Ultra وPro — مع توضيح الفريق في سلسلة المنشورات نفسها أن إتاحته لمستخدمي Pro لم تكتمل بعد. وتكمّل الإعلانَ تفصيلتان: لا يدخل عدد المصادر الموجودة في دفتر الملاحظات ضمن حساب استهلاك الرموز، ويحتفظ مستخدمو Pro بإمكانية إنشاء عروض الفيديو السينمائية باللغة الإنجليزية. وينقل الانتقال من الإنجليزية إلى 70 لغة الميزة من مجرد عرض توضيحي إلى أداة قابلة للاستخدام فعليًا خارج العالم الناطق بالإنجليزية.
تحوّل المحررات إلى معدِّدات إرسال للنماذج
1 و2 سبتمبر — يصف إعلانان لا تبدو بينهما صلة الحركة نفسها: تتحول بيئة التطوير إلى نقطة وصول إلى نماذج تابعة لجهات خارجية، وينتقل عامل التمايز من جودة النموذج إلى الظروف التي يعمل فيها.
أصدر Zed نسخته المستقرة 1.18.0، ويوجد محتواها الأهم في قسم الذكاء الاصطناعي من ملاحظات الإصدار. ويلحق المحرر دفعة واحدة بعدة إصدارات حديثة: أصبحت نافذة السياق البالغة مليون رمز في GPT-5.6 مدعومة على Amazon Bedrock، وانضم Gemini 3.5 Flash-Lite إلى نماذج Google AI، وانضم Grok 4.5 وGrok 4.6 إلى نماذج xAI، وتحسن دعم Claude Fable 5.1 الذي صدر في اليوم السابق. وكان اثنان من هذه الإدخالات الأربعة مساهمتين خارجيتين نُسبتا إلى أصحابهما في الملاحظات. ويضاف إلى ذلك عناصر تخص سهولة العمل مع الوكلاء — إعادة تحميل اتصال معطّل بوكيل خارجي دون إعادة التشغيل، وتقليل استهلاك الذاكرة في الجلسات الطويلة، وأخطاء اتصال تذكر اسم المضيف الذي تعذر الوصول إليه — وإصلاح جدير بالذكر لمن يربط خوادم MCP: كانت مصادقة OAuth تفشل مع الخوادم التي تتطلب نطاقات غير قياسية.
أما Mistral، فقد أتاحت GLM 5.2 في Vibe Code، وكيل البرمجة الخاص بها، لخطتي Pro وTeam. والنقطة اللافتة ليست النموذج بل كيفية تقديمه: تستضيفه Mistral في أوروبا على بنيتها التحتية الخاصة. ومن ثم، فإن المطور الأوروبي الذي يستخدم GLM 5.2 من خلال Vibe Code يرسل طلب استدلال تنفذه Mistral، من دون أن تمر طلباته عبر خوادم Z.ai. وهذا تجسيد عملي لموقف الاستدلال الإقليمي الذي تدافع عنه الشركة منذ أغسطس — كما أن الوضع كاشف من ناحيتين، لأن Mistral تملك عائلة Devstral الخاصة بها، ومع ذلك تختار أن تقدم في أداتها نموذجًا مفتوح الأوزان طوره مختبر منافس.
🔗 ملاحظات إصدار Zed 1.18.0 · 🔗 GLM 5.2 في Vibe Code
NVIDIA: تدوينتان هندسيتان وتحالف يغيّر مظلته
2 سبتمبر — ثلاثة منشورات من NVIDIA في اليوم نفسه، اثنان تقنيان وواحد عن الحوكمة.
تقدم التدوينة الأولى، وهي الجزء الثالث من سلسلة التصميم المشترك للنماذج، خمس قواعد لضبط فك الترميز التخميني. التقنية معروفة: يقترح نموذج مسودة صغير عدة رموز يتحقق منها النموذج المستهدف في تمريرة متوازية واحدة. ويبقى السؤال العملي مفتوحًا — كم عدد الرموز التي ينبغي تخمينها، وبأي آلية؟ أثناء التحقق، يزداد الحساب مع (1 + D)، لكن عمليات الوصول إلى الذاكرة تظل كما هي: لذا ينبغي زيادة طول المسودة D إلى أن ينتقل التحقق من كونه مقيدًا بالذاكرة إلى كونه مقيدًا بالحوسبة. وفي عملية GEMM تمثيلية لأحد الخبراء، يتيح D = 7 بلوغ هذا النمط باستخدام ثُمن حجم الدفعة اللازم عند D = 0. وعندما تهيمن آلية الانتباه على زمن فك الترميز، يصبح الطول الأمثل D = 128/G − 1، حيث تمثل G عدد رؤوس الاستعلام التي تتشارك رأس KV واحدًا، وبعد ذلك يُفضَّل اختيار قيم تجعل G × (1 + D) من مضاعفات 128، وهو حجم بلاطة نواة الانتباه. وتستند القياسات إلى SPEED-Bench، معيار NVIDIA لفك الترميز التخميني: عند استخدام Qwen 3.5 122B A10B نموذجًا مستهدفًا، تحقق المسودة الخارجية 35B A3B طول قبول يبلغ 6 عند D = 9. وتشدد التدوينة على نقطة كثيرًا ما تُهمَل — ارتفاع القبول لا يعني ارتفاع التسريع — وتنتهي بتحذير: يغيّر الضبط الدقيق للنموذج المستهدف توزيع مخرجاته، ولذلك قد يفقد نموذج المسودة المدرَّب لنقطة تحقق معينة بعض القبول حتى عندما يتحسن النموذج المستهدف.
التدوينة الثانية عبارة عن مسار لتحسين CUDA من ست مراحل، مبني حول مثال واحد: تحويل ثلاث صور RGB إلى تدرج رمادي، ثم حساب وسيط كل بلاطة بحجم 32 × 32 بكسل. نقطة البداية هي شيفرة معيبة عمدًا يشخصها Compute Sanitizer فورًا — عملية كتابة خارج الحدود في الذاكرة المشتركة، ناجمة عن استخدام فهرس عام في موضع كان يُنتظر فيه فهرس كتلة.
| مرحلة التحسين | الزمن الإجمالي | مكسب المرحلة |
|---|---|---|
| الشيفرة الأولية | 6,8 s | — |
| CUB (DeviceTransform وBlockRadixSort) | 635 ms | نحو 10x |
| حاويات ذاكرة مجمّعة | نحو 244 ms | نحو 2,6x |
| ذاكرة مثبّتة | 25 ms | نحو 10x |
| تدفق CUDA واحد لكل صورة | 23 ms | نحو 300x تراكميًا |
أدى استبدال خوارزمية الفرز الفقاعي المحلية بـ cub::BlockRadixSort وحده إلى خفض زمن حساب القيم الوسيطة من 2,142 s إلى 773 µs، أي بعامل 2717. ولا تنتمي أي من هذه الخطوات إلى التحسين منخفض المستوى: فجميعها عمليات استبدال لواجهات API.
وأخيرًا، ينضم Open Secure AI Alliance، الذي ساهمت NVIDIA في تأسيسه، إلى Linux Foundation. وتنقل الأطروحة التي يدافع عنها التحالف محور النقاش المعتاد: فالوكيل ليس مجرد نموذج لغوي، بل هو نظام برمجي مكوّن من نماذج، وأطر تمنحه السياق، وحواجز حماية تحد ما يمكنه فعله. غير أن النقاش حول السلامة ركز إلى حد بعيد على النموذج وحده، بينما يعتمد الأمان على المنظومة بأكملها — الأطر، وآليات المواءمة، وبيئات التنفيذ، والهوية، والسياسات، وقابلية الرصد، والتعافي. وقد فُتح باب التعليقات على SAFE (Shared AI Findings Exchange)، وهي آلية لجمع الحوادث وأشباه الحوادث المرتبطة بالذكاء الاصطناعي بسرية، بالتعاون مع OpenSSF.
🔗 فك الترميز التخميني · 🔗 تحسين CUDA خطوة بخطوة · 🔗 Open Secure AI Alliance
Equinix Inference Exchange، النماذج المفتوحة في 280 مركز بيانات
2 سبتمبر — أعلنت Equinix عن Equinix Inference Exchange، وهو برنامج موزع لاستدلال الذكاء الاصطناعي يوسّع تعاونها مع NVIDIA ويضيف إليه Together AI. ويستند الهيكل إلى ثلاث طبقات: توفر Equinix الأساس المادي المتصل بالخدمات السحابية عبر Equinix Fabric، وتقدم NVIDIA معمارياتها المرجعية المؤسسية المعتمدة، وتشغّل Together AI المنصة فوقهما مع دعم أكثر من 200 نموذج مفتوح المصدر، سواء في نشر متعدد المستأجرين أو في بيئة مخصصة لمستأجر واحد.
تتركز الحجة على موقع تنفيذ الاستدلال بدلًا من اختيار النموذج، مع استهداف ثلاث حالات: الاستدلال على الحافة داخل المناطق الحضرية لتقليل زمن الاستجابة، وترحيل أعباء العمل من النماذج الاحتكارية المغلقة إلى بدائل مفتوحة، والذكاء الاصطناعي السيادي للشركات الخاضعة للتنظيم. وتعطي أرقام الانتشار فكرة عن حجم الشبكة المستخدمة: أكثر من 280 مركز بيانات في 77 منطقة حضرية، و230 منفذ وصول إلى الخدمات السحابية، وأكثر من 10 500 شركة مترابطة.
لكن هناك نقطة تستدعي الانتباه بشأن الجدول الزمني: يذكر بيان Equinix صراحةً أن الحل سيكون متاحًا ابتداءً من الربع الأول من عام 2027، في حين تصف رسالة Together AI منصتها بأنها تعمل بالفعل في مراكز بيانات Equinix حول العالم. فهذا إعلان عن شراكة وخريطة طريق، وليس إطلاقًا فعليًا للخدمة.
BenchMIRT، منهجية Ai2 لتدقيق ما تقيسه المعايير فعلًا
1 سبتمبر — نشرت Ai2 منهجية BenchMIRT، التي تطرح سؤالًا نادرًا ما يُعالَج مباشرةً: هل يقيس المعيار فعلًا القدرة التي يدّعي قياسها؟ وبدلًا من الاستدلال انطلاقًا من النتيجة النهائية، تنزل المنهجية إلى مستوى كل سؤال وتقدّر القدرات التي تحدد النجاح فعليًا، مستندةً إلى نظرية الاستجابة للمفردة (Item Response Theory) المأخوذة من القياس النفسي، في نسختها متعددة الأبعاد. وشمل التدريب نتائج 100 نموذج مفتوح الأوزان، و16 معيارًا، وأكثر من 34 000 سؤال.
أقوى النتائج منهجية: من دون إخبار BenchMIRT بما كان يُفترض أن يقيسه كل معيار، استخرجت من تلقاء نفسها بُعدين مهيمنين، هما السلامة والاستدلال العام، وظهر البُعدان نفسيهما عند إعادة التحليل من الصفر.
| المعيار المدقَّق | الارتباط بالاستدلال | الارتباط بالسلامة | نتيجة التدقيق |
|---|---|---|---|
| MMLU-Pro | 0,97 | -0,21 | متوافق مع هدفه المعلن |
| BBQ | 0,85 | -0,06 | يتبع الاستدلال رغم تصنيفه اختبارًا للسلامة |
| WMDP | -0,89 | 0,21 | يقيس غياب المعرفة الخطرة |
| ToxiGen | 0,40 | -0,32 | ضعيف في كليهما، ومعيار متشبع بنسبة 92 % |
وهكذا فإن BBQ، المصمم لاختبار ما إذا كان النموذج يعتمد على الصور النمطية الاجتماعية، يرتبط بالاستدلال العام بمقدار 0,85 ولا يرتبط بالسلامة إطلاقًا: وقد تكشف النتيجة السيئة عن استدلال النموذج أكثر مما تكشف عن سلوكه. أما الإسهام الثاني فعملي: بإعادة ترتيب الأسئلة بحسب قدرتها التمييزية، توضح Ai2 أن الاحتفاظ بـ 10 % منها فقط يحافظ تقريبًا على الترتيب نفسه للنماذج، وأن المنهجية تتنبأ بالإجابة الصحيحة عن سؤال غير مرصود في 79 % من الحالات، مقابل 70 % لنهج ساذج. وهناك قيدان معلنان: تعود جميع نماذج التدريب إلى ما قبل مارس 2025، وتعتمد الأبعاد المكتشفة على مجموعة المعايير المقدمة.
Runway Dev MCP، وكيل البرمجة يتولى تكامل الوسائط
2 سبتمبر — أطلقت Runway خدمة Runway Dev MCP، وهي خادم MCP مستضاف يربط منصة المطورين الخاصة بها مباشرةً بأداة البرمجة المستخدمة يوميًا — Claude أو ChatGPT أو Codex أو Cursor. ويمكن تلخيص الحجة في جملة واحدة: يستطيع الوكيل الذي كتب التكامل الآن اختيار النموذج المناسب له، وتهيئة الأدوات التي يعتمد عليها، وتصحيح أخطائه.
تغطي الخدمة المراحل الثلاث للتكامل. قبل أول استدعاء لـ API، يستعلم الوكيل من الكتالوج عن النماذج التي يمكن للمشروع استخدامها، وأسعارها ومدخلاتها، ثم يسترجع مخطط الطلب الدقيق للنموذج المختار — والهدف هو إجراء الاستدعاء بشكل صحيح من المحاولة الأولى بدلًا من التخمين. وفي الإنتاج، ينشئ ويهيئ Model Router يفاضل بين عدة نماذج بحسب التكلفة أو زمن الاستجابة أو الجودة، مع حد للتكلفة لكل عملية إنشاء، ويمكنه معرفة النموذج الذي اختاره الموجّه لاستدعاء معين. وينطبق المنطق نفسه على Characters. أما المرحلة الثالثة فهي تصحيح الأخطاء: عندما تفشل عملية إنشاء، يستعلم الوكيل عن المهمة عبر أداة محددة ويقرأ السبب الدقيق للرفض — رفض من نظام الإشراف، أو تجاوز حد حجم الأصل، أو صياغة غير صحيحة لجسم الطلب — قبل التصحيح وإعادة المحاولة. وتنشئ قائمة Quickstart مفتاح API، ثم تفتح Claude Code أو Codex أو Cursor مع رسالة معدّة مسبقًا.
DreamX-Creator 1.0، توليد صوت وفيديو أصلي بدقة 2K انطلاقًا من صورة واحدة
2 سبتمبر — كشف فريق AMAP في Alibaba عن DreamX-Creator 1.0، وهو نموذج يضم 7 مليارات مُعلَمة ومرخّص بموجب Apache 2.0، ينطلق من صورة واحدة وموجّه نصي لإنتاج تدفق فيديو وتدفق صوت متزامنين بصورة أصلية بدقة 2K، من دون توصيل نموذج فيديو بنموذج صوت على نحو تسلسلي.
يتكوّن النظام من ثلاث لبنات: انتباه تقاطعي متعدد الوسائط مبوّب (Gated Cross-Modal Attention) مقترن بتدريب مشترك تدريجي، يتيح تفاعلًا ثنائي الاتجاه بين التدفقين؛ وتعلّم معزّز سمعي بصري يستمد إشاراته من تغذية راجعة متعددة الوسائط تراعي نوع الوسيط؛ وتحسين ذاتي الانحدار من خطوة واحدة يرفع الفيديو إلى دقة 2K مع الحفاظ على الحركة والتزامن الزمني للصوت.
لا يزال الإصدار جزئيًا في هذه المرحلة. يحتوي مستودع GitHub، الذي أُنشئ في اليوم السابق، على عرض المشروع وخريطة طريقه، كما نُشر التقرير التقني على arXiv. أما الأوزان المعتمدة وشيفرة الاستدلال والإعدادات وأدوات التقييم، فما زالت مدرجة بوصفها مراحل لم تُنجز بعد. يستند العمل إلى Wan2.2 وMOVA من OpenMOSS، وقد وُجّه شكر صريح إلى كليهما.
تميّز واجهة OpenAI API بين التوسع السريع جدًا والتحميل الزائد على النموذج
2 سبتمبر — غيّرت OpenAI الطريقة التي تُبلغ بها واجهتها API عن حالتين لم تكن تطبيقات العملاء قادرة على التمييز بينهما حتى الآن.
| حالة HTTP | رمز الخطأ | المعنى | الإجراء الواجب اتخاذه |
|---|---|---|---|
| 429 | slow_down | ارتفع معدل الطلبات بسرعة مفرطة | مراعاة Retry-After، وخفض المعدل، ثم زيادته تدريجيًا |
| 503 | server_is_overloaded | النموذج المطلوب محمّل فوق طاقته مؤقتًا | مراعاة Retry-After ثم إعادة المحاولة، وزيادة مدة الانتظار إذا استمر الخطأ |
لهذا التمييز أثر عملي فوري في أي شيفرة لإعادة المحاولة. توضّح الوثائق أن خطأ slow_down قد يحدث حتى عندما تظل حركة الاستخدام ضمن حدود المؤسسة من حيث الطلبات والرموز في الدقيقة: فهو لا يشير إلى نفاد الحصة، بل إلى تسارع يُعدّ حادًا أكثر من اللازم — أي إن التطبيق قد يتعرض للتقييد من دون أن يكون قد تجاوز أي حد معلن. ويقترح دليل حدود المعدل قاعدة تقريبية: بمجرد وصول حركة الاستخدام إلى مليون رمز إدخال في الدقيقة، ينبغي عدم زيادتها بأكثر من 50% كل خمس عشرة دقيقة. وعند غياب الترويسة Retry-After، توصي OpenAI بتراجع أُسّي مصحوب بتأخير عشوائي قصير، لتجنب إعادة جميع نسخ الخدمة نفسها للمحاولة في الوقت ذاته. وتُوجَّه المؤسسات التي تصطدم حركة استخدامها بانتظام بهذه الحدود إلى Scale Tier، وإلى Reserved Tier بالنسبة إلى GPT-5.6 والنماذج اللاحقة.
أخبار موجزة
- Claude Code 2.1.258 — إصدار إصلاحي فقط: أُعيد تشغيل التطبيق على macOS 12 Monterey بعد تعطله منذ الإصدار 2.1.255، ولم تعد الجلسات البعيدة والمجدولة تفشل بعد إعادة الموافقة على الأذونات. 🔗 سجل التغييرات
- Claude Campus Ambassadors — فُتح باب التقديم هذا العام عبر ثلاثة مسارات منفصلة: المرحلة الجامعية، والدراسات العليا، والدكتوراه وما بعد الدكتوراه. 🔗 الإعلان
- Nokia تحلل 50 مليون سطر برمجي باستخدام Cursor — أنجز مهندسان من قسم Core Networks المهمة في أسبوعين، بعدما قدّر الفريق أنها ستتطلب نحو اثني عشر خبيرًا يعملون عدة أشهر. وهي دراسة حالة صادرة عن المورّد، من دون بروتوكول قياس مستقل. 🔗 دراسة الحالة
- TranslatePsy-Nano — تنشر Tether AI Research عائلتين من نماذج الترجمة المدمجة، هما EuroNano لتسع لغات أوروبية وAfriNano لثماني لغات أفريقية، بإصدارات أحجامها 42 و31 و17 ميغابايت، مع نقطة تحقق واحدة لكل مجموعة لغوية. 🔗 الإعلان
- Puffin-World — نموذج موحّد متعدد الوسائط يمثّل العالم بثلاث حالات أصلية: الفيزياء والهندسة والمظهر، وقد نُشر مع مجموعة بيانات Puffin-16M. 🔗 العرض
- خبراء MoE المقيمون على NVMe — تُبقي i64 Systems أوزان الخبراء على NVMe مع التحقق منها عبر بيان SHA-256، وتقيس مخرجات متطابقة بايتًا ببايت بين مسار التحميل عند الطلب والمسار المقيم. 🔗 التدوينة التقنية
- Sakana AI في مؤتمر CiNet الدولي — سيلقي المدير التقني Llion Jones والباحث Kai Arulkumaran محاضرة عن الروابط بين علم الأعصاب والتعلم الآلي، من 5 إلى 7 أكتوبر 2026 في أوساكا. 🔗 الإعلان
- Gemini CLI، الإصدار الليلي ليوم 2 سبتمبر — تغيير واحد فقط، وهو تحسين التحقق من الوجهة وتوجيه الاتصال في أدوات جلب محتوى الويب، استكمالًا لتعزيزات أمان الشبكة التي بدأت في أواخر أغسطس. 🔗 ملاحظات الإصدار
- MrBeast يعقد شراكة متعددة السنوات مع Google — توسّع الاتفاقية العلاقة مع Beast Industries إلى ما يتجاوز YouTube، لتشمل Gemini وGoogle Health، مع فيديو أول في 5 سبتمبر يُستخدم فيه Gemini للمساعدة على البقاء في الأدغال والصحراء والمنطقة القطبية الشمالية. 🔗 الإعلان
- ملخص إعلانات Google المتعلقة بالذكاء الاصطناعي في أغسطس — تدوينة شهرية تجمع مواد سبق تناولها على مدار الشهر، من دون أي جديد خاص بها. 🔗 الملخص
- إتاحة Enterprise Live Migrations للجميع — ترحيل المستودعات من GitHub Enterprise Server إلى السحابة مع الاحتفاظ بموقع البيانات وبانقطاع يكاد يكون معدومًا، ويُدار بواسطة الامتداد
gh elm. لا صلة له بالذكاء الاصطناعي، وقد أُدرج توخيًا للشمول. 🔗 سجل التغييرات - ElevenLabs تعيّن Ashley Kramer رئيسةً للإيرادات — المنشور الوحيد للشركة خلال الفترة، إذ لم يتغير سجل تغييرات منتجها منذ 24 أغسطس. 🔗 الإعلان
- NVIDIA تبث عرضًا مباشرًا لـDGX Spark على Portable Computer من Perplexity — ست وعشرون دقيقة مخصصة لتشغيله محليًا، من دون نص وصفي أو تفريغ مكتوب. وهذا ثاني عرض توضيحي في اليوم يجعل DGX Spark منصة مستهدفة للتشغيل المحلي. 🔗 البث
- Kling AI توثّق Elements في خادم MCP الخاص بها — برنامج تعليمي عن الحفاظ على هوية الشخصية بين اللقطات؛ مادة تعليمية عن المنتج وليست إطلاقًا جديدًا. 🔗 البرنامج التعليمي
- Codex CLI 0.152.1 — إصدار إصلاحي نُشر بعد نحو عشرين ساعة من الإصدار 0.152.0: أصبحت مراجعة الموافقة في Guardian تحترم الآن سياسات REPL الخاصة بـNode والمنقولة عبر البيانات الوصفية للنموذج. 🔗 ملاحظات الإصدار
- Cohere تدافع عن رهان النماذج الصغيرة في المؤسسات — تجمع الشركة Command R7B وTiny Aya ذي 3.35 مليارات مُعلَمة وNorth Mini Code، الذي حقق 33.4 على Coding Index من Artificial Analysis، للدفاع عن اختيار الحجم الملائم. لا يوجد إطلاق جديد. 🔗 التدوينة
- Perplexity تنشر دليلين تعليميين — أحدهما عن المساعدين الشخصيين والآخر عن اكتشاف الهلوسات. يصف الثاني مرحلة ما بعد التدريب من خطوتين، تطوّر الأولى سلوكيات المنتج، بينما تعتمد الثانية على مهام بحثية أكثر صعوبة. 🔗 الدليل
ما الذي يعنيه ذلك
أصبح السعر الحجة الرئيسية، حتى لدى النماذج الرائدة. ثلاثة إصدارات في اليوم نفسه، ولا يروّج أي منها لنتيجة قياسية. تحافظ Google على سعر الجيل السابق في Gemini 3.8 Flash وتقر بأن نموذجها يستهلك عددًا أكبر من الرموز — وهو إقرار نادر ينقل النقاش من السعر المعلن إلى التكلفة الفعلية للمهمة. وتعلن Qwen صراحة بلوغ قمة جبهة باريتو في Arena بدلًا من تصدر الترتيب الخام. أما Meta فتقيس مكاسبها لا بنقاط الاختبارات المعيارية، بل بانخفاض قدره 20% في استدعاءات الأدوات و25% في الرموز. ويقدم جدول CursorBench المؤشر الأوضح في ذلك اليوم: عند نتيجة 69.2%، تبلغ تكلفة Gemini 3.8 Flash مقدار 2.38 دولار لكل مهمة، بينما كانت النتيجة المكافئة تتطلب 4.80 دولار لدى Fable 5.1 و7.35 دولار لدى Opus 5. لكن عمود الخطوات يذكّر بأن لهذا السعر تكلفةً في موضع آخر — 161 خطوة مقابل 44.
تصبح هندسة إطار التشغيل رافعة اقتصادية قابلة للقياس. مقال GitHub هو الوثيقة الأكثر فائدة في ذلك اليوم لكل من يبني تطبيقات على هذه النماذج: أربعة تحسينات لا تمس النموذج وتقتطع كل منها ما بين 2 و5% من التكلفة، مع توثيق التجارب الفاشلة. ويقول دليل Anthropic لهندسة الوكلاء الشيء نفسه من زاوية أخرى — ينبغي استهداف معدل نجاح للتخزين المؤقت يتراوح بين 90 و99% منذ مرحلة التصميم، وقياس التكلفة لكل مهمة منجزة بدلًا من كل استدعاء. ويتفق الاثنان على نقطة يحجبها سباق النماذج: عند ثبات النموذج، يحدد إطار التشغيل جزءًا كبيرًا من الفاتورة، ولا تنتقل المكاسب بالضرورة من منتج إلى آخر. وقد أثبتت GitHub ذلك عندما وجدت أن تحسينًا فعالًا في مراجعة الشيفرة زاد التكلفة في CLI.
ينتقل الاستدلال إلى محطة العمل، ويصبح موقع الحوسبة أحد معايير التصميم. يتيح FastH3 توليد الفيديو على جهاز Mac أو حاسوب مكتبي، وتفتح Perplexity شيفرة محرك لا يشغّل سوى نموذج واحد على نوع واحد من العتاد، وتنشر Tether مترجمات بحجم 17 ميغابايت، وتُبقي i64 Systems خبراء MoE على NVMe، بينما تدافع Cohere عن اختيار الحجم الملائم. ويلتقي هذا التوجه من الأعلى مع توجه Equinix وNVIDIA وTogether AI، التي توزّع الاستدلال على 280 مركز بيانات لأسباب تتعلق بزمن الاستجابة والسيادة. والقاسم المشترك ليس التصغير بل التخصص: ينجح Lily لأنه يرفض كل ما عدا Qwen3.6-35B-A3B على Apple Silicon، وتراهن Perplexity على أن هذا النطاق الضيق ميزة لا قيد.
تزداد صرامة الرقابة والحوكمة، وتمر الآن عبر العقود بقدر مرورها عبر التقنية. تفرض GitHub الاحتفاظ بالبيانات على Fable 5.1 — مع إعفاء ينتهي بانقضاء السنة الميلادية — بينما تتيح لكل فريق مؤسسي اختيار النموذج الافتراضي، وتسحب ستة نماذج من الكتالوج في اليوم نفسه. وتنقل Cursor تنفيذ الوكلاء إلى شبكة العميل، مع توضيح أن النصوص المفرغة تظل تُعالج لديها. وتحصر Google نموذجها للدفاع السيبراني في 650 شريكًا مختارًا، وفق شروط تشغيلية مكتوبة. وتقدم Mistral نموذجًا صينيًا من أوروبا، وتجعل من ذلك حجتها التسويقية. وأخيرًا، يذكّر BenchMIRT بأن أدوات التقييم التي تقوم عليها بعض هذه القرارات تستحق هي الأخرى التدقيق: فاختبار معياري للتحيز الاجتماعي يبلغ ارتباطه 0.85 بالاستدلال العام و-0.06 بالسلامة لا يقيس ما تدّعيه تسميته.
المصادر
- Gemini 3.8 Flash و3.8 Flash Cyber
- نتائج CursorBench
- Gemini 3.8 Flash في Cursor
- تقديم Muse Spark 1.3
- خريطة طريق Muse Spark
- Qwen3.8-Max-0902
- نتائج Code Arena WebDev
- تشغيل FastH3 محليًا على DGX Spark وApple Silicon
- الشيفرة المصدرية لـLily
- فتح شيفرة Lily
- وكلاء Claude للتجارة
- مستودع commerce-agents
- دليل هندسة وكلاء التجارة
- استخدام الحاسوب في الخلفية
- أجهزة Cursor ذاتية الاستضافة
- Claude Fable 5.1 في GitHub Copilot
- Genspark تدمج Fable 5.1
- كيف نجعل البرمجة بالذكاء الاصطناعي أكثر كفاءة من حيث التكلفة
- نماذج Copilot المهملة
- النموذج الافتراضي في الإعدادات المُدارة للمؤسسات
- سجل إصدارات أغسطس 2026
- الوسائط في GitHub CLI
- برنامج Fairwind
- Gemini CLI v0.58.0
- سجل تغييرات Antigravity
- ملخصات الفيديو القصيرة بـ70 لغة
- Zed v1.18.0
- GLM 5.2 في Vibe Code
- التصميم المشترك وفك الترميز التخميني
- حزمة أدوات CUDA الحديثة في التطبيق العملي
- تحالف الذكاء الاصطناعي الآمن المفتوح
- Equinix Inference Exchange
- BenchMIRT
- Runway Dev MCP
- DreamX-Creator 1.0
- سجل تغييرات OpenAI API
- سجل تغييرات Claude Code
- Claude Campus Ambassadors
- Nokia وCursor
- TranslatePsy-Nano
- Puffin-World
- خبراء MoE على NVMe
- Sakana AI في مؤتمر CiNet الدولي
- Gemini CLI، الإصدار الليلي ليوم 2 سبتمبر
- MrBeast وGemini وGoogle Health
- إعلانات Google المتعلقة بالذكاء الاصطناعي في أغسطس 2026
- Enterprise Live Migrations
- ElevenLabs تعيّن Ashley Kramer
- البث المباشر لـDGX Spark وPerplexity Portable Computer
- عناصر Kling MCP
- Codex CLI 0.152.1
- Cohere والنماذج الصغيرة
- الأدلة التعليمية من Perplexity