بحث

Anthropic تفتح Model Hardware Standard، وOpenAI توحّد جهود دفاع سيبراني جماعي، وGLM-5.3 ينتقل إلى أوزان مفتوحة

ai-powered-markdown-translator

مقال مترجم من الفرنسية إلى العربية باستخدام gpt-5.6-sol.

عرض المشروع على GitHub ↗

سبعة وأربعون إعلانًا مختارًا ضمن تسعة مجالات ليوم 27 أغسطس. تبرز ثلاثة منها. تفتح Anthropic المرحلة الأولى من معاينة بحثية (research preview) لمعيار Model Hardware Standard، وهو مواصفة تتيح للوكلاء التحكم في أدوات المختبر وتختصر مدة دمجها من عدة أسابيع إلى بضع ساعات. وتنشر OpenAI مقالًا يدعو إلى دفاع سيبراني جماعي، إلى جانب مؤسسات من بينها Anthropic وAWS وGoogle وMicrosoft وOracle. كما تثبّت Ai2 منصة AutoDiscovery في مركز أورام عامل، وتنشر في اليوم نفسه اكتشافًا بشأن سرطان الثدي جرى التحقق منه مختبريًا. أما البقية — GLM-5.3 Flash لدى Together AI والإعلان عن فتح أوزان GLM-5.3، وGemini Omni 1.1 Flash، وCohere Parse، وأول وحدة CPU من Vera تُسلَّم إلى AWS، ونحو عشرين تحديثًا للأدوات — فترد أدناه.


Anthropic تفتح Model Hardware Standard وتوفر 10,000 مقعد Claude للعلماء

27 أغسطس — تطلق Anthropic المرحلة الأولى من معاينة بحثية لمعيار Model Hardware Standard (MHS)، وهو مواصفة مشتركة تتيح لوكلاء الذكاء الاصطناعي التحكم في المعدات المادية. ولا يزال الوصول مقتصرًا حاليًا على مجموعة أولى من مختبرات البحث والشركات الصناعية المتقدمة. نشأ المعيار من تعاون بين Alek Kemeny، من فريق Beneficial Deployments لدى Anthropic، وArco Bast، الباحث ما بعد الدكتوراه في HHMI Janelia Research Campus، الذي كان يجري تجارب تصوير للدماغ على منصة تجمع بين أجهزة ليزر ومحركات ضبط البؤرة وكاميرات من دون واجهة مشتركة.

المشكلة المستهدفة عملية ومكلفة: يعرض كل جهاز واجهة برمجة خاصة به، ولم تكن هناك طريقة معيارية لجعلها تتواصل معًا. يقدم MHS برنامج تشغيل مبنيًا على بدائيات محدودة عمدًا، من نوع « read » (مثل « get temperature ») و« write » (مثل « set temperature »)، ما يجعل كل جهاز قابلًا للاكتشاف ضمن تنسيق مشترك. وتصف وسوم مكتوبة بلغة طبيعية ما لا يقوله الكود — مثل وزن ذراع روبوتية — ويستخرج منها برنامج التشغيل ملفًا مرجعيًا يسرد ما يقيسه الجهاز، وما يمكن ضبطه، وحدود الأمان المطبقة. وتتعايش ثلاث آليات للتحكم: MCP، وواجهة سطر الأوامر، وملفات كود معروضة بوصفها API.

توضح نتائج الشركاء حجم المكاسب. فقد أتمتت Genentech اختبار البروتين BCA من خلال تنسيق مناول السوائل والذراع الروبوتية وقارئ الصفائح. وفي Carnegie Mellon، تعمل منحنيات الجرعة والاستجابة بالتخفيف المتسلسل أسرع بنحو ثلاث مرات، مع وكيل ينسّق أربع عائلات من المعدات موزعة على ثلاثة حواسيب ذات واجهات غير متوافقة. وتركت QuEra Computing وكيلًا يطور وحدة تحكم تعيد قفل تردد أجهزة الليزر في حاسوب كمي في 99.3% من الحالات من دون تدخل بشري. وعلى صعيد المنظومة، ستدعم AWS معيار MHS عبر مكتبة Strands Robots، كما ستنضم Hugging Face وRaspberry Pi إلى المرحلة التالية، وذلك بعد اختبارات ناجحة أجرتها الثانية على Camera MHS Driver الخاص بها.

تقر Anthropic بالقيود: يتعلم Claude العالم المادي من خلال النص والصورة، ويظل استدلاله المكاني محدودًا ويتطلب إشراف خبراء. وفي Genentech، اضطر الباحثون إلى إفهامه أن أخطاء تكوّن الرغوة في العينات كانت أعطالًا مادية وليست أخطاء برمجية. وسيُنشر المعيار لاحقًا بصفته مفتوح المصدر.

في اليوم نفسه، تتيح Anthropic عدد 10,000 مقعد Claude للعلماء حول العالم عبر خطة Claude Team جديدة للباحثين. مقاعد Standard مجانية، أما مقاعد Premium — ذات حدود استخدام مضاعفة خمس مرات — فتكلف 15 دولارًا شهريًا لمدة عام، وهو ما يقدمه الحساب الرسمي بوصفه خصمًا قدره 80%. ويتطلب الوصول التحقق من صفة الباحث الرئيسي في مؤسسة أكاديمية أو منظمة غير ربحية. ويتوسع برنامج AI for Science، الذي كان يركز حتى الآن على العلوم البيولوجية، ليشمل تخصصات أخرى، ويرتفع إلى 50,000 دولار من الأرصدة لكل مشروع. ويبقى قيد واحد: يظل الباحثون في علم الأحياء والكيمياء محصورين في نماذج فئة Opus، إذ تستمر نماذج Claude Fable في حظر طلبات علم الأحياء المهني وتطوير الأدوية.

العنصر المقاسالقيمة المعلنة
مدة الدمج قبل MHSمن أسابيع إلى أشهر
مدة الدمج باستخدام MHSمن ساعات إلى دقائق
تسريع الجرعة والاستجابة (Carnegie Mellon)نحو 3x
استعادة قفل الليزر من دون تدخل بشري (QuEra)99.3%
برامج الشركات المصنعة الموحّدة (HHMI Janelia)7
مقاعد Claude المتاحة للعلماء10,000، لمدة عام
مقعد Premium (حدود x5)15 دولارًا شهريًا، بخصم 80%
أرصدة AI for Scienceحتى 50,000 دولار لكل مشروع

Connecting AI to hardware requires days or weeks of bespoke integration, with no standard way for agents to operate equipment safely. MHS cuts integration to hours or minutes, provides an interface that makes devices discoverable, and enables agents to operate them safely.

🇸🇦 يتطلب ربط الذكاء الاصطناعي بالمعدات أيامًا أو أسابيع من الدمج المخصص، من دون طريقة معيارية تتيح للوكلاء التحكم في المعدات بأمان. ويختصر MHS مدة الدمج إلى ساعات أو دقائق، ويوفر واجهة تجعل الأجهزة قابلة للاكتشاف، ويتيح للوكلاء التحكم فيها بأمان.@AnthropicAI على X

🔗 Model Hardware Standard · توسيع دعم العلماء


Ai2 تثبّت AutoDiscovery في مركز أورام وتنشر اكتشافًا موثّقًا بشأن سرطان الثدي

27 أغسطس — تنقل Ai2 منصة AutoDiscovery من مجموعات البيانات العامة لتثبيتها في مؤسسة عاملة: سينشر Paul G. Allen Research Center التابع لـProvidence Swedish Cancer Institute المنصة على بياناته البحثية والسريرية الخاصة. ويأتي الإعلان مصحوبًا بما يبرره، وهو نتيجة علمية أنتجتها الأداة ثم جرى التحقق منها بصورة مستقلة.

ركز العمل على The Cancer Genome Atlas، وهي إحدى أكثر مجموعات البيانات دراسة في هذا المجال. تولّد AutoDiscovery الفرضيات وتقيّمها باستخدام نماذج اللغة الكبيرة، مع إعطاء الأولوية للملاحظات التي تكون مفاجئة في ضوء التوقعات الراسخة وقابلة للتكرار من تحليل إلى آخر. وفي هذه البيانات، أبرزت المنصة إشارة غير متوقعة: فالسرطان الفصيصي الغازي، وهو نوع فرعي من سرطان الثدي صُنّف طويلًا على أنه بارد مناعيًا (immune cold)، ولذلك اعتُبر غير مستجيب للعلاج المناعي، يُظهر في الواقع نشاطًا مناعيًا أقوى مما كان معروفًا.

ما أعقب ذلك هو ما يمنح الإعلان أهميته. فقد تحقق الباحثون من الملاحظة على مجموعة بيانات مستقلة للمرضى، ثم أكدوها في المختبر عبر تحليل عينات الأورام، مع صور تألق مناعي تُظهر الخلايا اللمفاوية التائية وهي تحيط بالورم. ونُشرت في اليوم نفسه الورقة الناتجة عن هذا العمل، « تكشف نماذج اللغة الكبيرة القائمة على المفاجأة رؤى مناعية في سرطان الثدي »، بواسطة فريق مشترك تقوده الدكتورة Kelly Paulson من PARC والدكتورة Sasha Stanton من Earle A. Chiles Research Institute، وبمشاركة Bodhisattwa Majumder، الباحث الأول لدى Ai2. ووفقًا لـAi2، تشير الخلاصة إلى أن فئة كاملة من المريضات — نحو 15% من حالات سرطان الثدي التي تُشخَّص سنويًا في الولايات المتحدة — تستحق إعادة تقييم من زاوية العلاج المناعي.

ويمثل النشر المحلي الشق الثاني: تثبّت Providence منصة AutoDiscovery في بيئتها السحابية الخاصة، ما يُبقي البيانات المحمية داخل المؤسسة، بينما يتولى فريق البحث الحاسوبي في PARC التثبيت والتشغيل والدعم. وتشدد Ai2 على طبيعة المنصة: فهي ليست مصممة للعمل بمفردها، بل لكي يوجّهها الباحثون الذين يقررون المسارات الجديرة بالاستكشاف.

🔗 شراكة Ai2 وProvidence Swedish


OpenAI تدعو إلى دفاع سيبراني جماعي مع Anthropic وAWS وGoogle وMicrosoft وOracle

27 أغسطس — تنشر OpenAI مقالًا بعنوان « دعوة إلى عمل جماعي في مجال الدفاع السيبراني »، إلى جانب مؤسسات من بينها Anthropic وAWS وGoogle وMicrosoft وOracle — وبما أن صياغة الرسالة الرسمية هي « including »، فالقائمة ليست شاملة. وينطلق النص من ملاحظة مرتبطة بالتوقيت: تتيح الأشهر المقبلة نافذة محدودة يمكن للمدافعين خلالها أخذ زمام المبادرة، قبل أن تصبح الهجمات المدعومة بالذكاء الاصطناعي أكثر انتشارًا وتعقيدًا بكثير مع تقدم النماذج في أنحاء العالم. والأهداف المذكورة ليست مجردة: المستشفيات، ومحطات معالجة المياه، والبنية التحتية التي تُبقي الإنترنت قيد التشغيل.

تتمثل الحجة الأساسية في أن التطورات الحالية تمنح المدافعين بالفعل وسائل معالجة نقاط ضعف تراكمت على مدى سنوات — أخطاء برمجية قديمة، وصلاحيات مفرطة، وأخطاء في الإعداد، وبرمجيات غير محدّثة، ومصادقة ضعيفة، وديون تقنية في الأنظمة القديمة — في حين عانت فرق أمن البنية التحتية الحيوية تاريخيًا من نقص الموارد.

تقوم المبادرة على ثلاثة مبادئ: الإقرار بأن الوضع الأمني القائم لن يكون كافيًا، وتجهيز عدد أكبر من المدافعين بذكاء اصطناعي ذي قدرات في الأمن السيبراني، وحشد استجابة جماعية انطلاقًا من أن شركة واحدة لا ينبغي لها أن تتحكم في هذا المستقبل. وتلي ذلك أربع قوائم من المطالب الموجهة. فعلى كل مؤسسة أن تتعامل مع الدفاع السيبراني بوصفه أولوية قيادية، وتعالج نقاط ضعفها الأعلى خطورة، وترفع مستوى المتطلبات لما تشتريه وتبنيه وتنشره، بما في ذلك الكود المولّد بالذكاء الاصطناعي. وتُدعى شركات الأمن السيبراني إلى اختبار دفاعاتها باستمرار في مواجهة القدرات المتقدمة، وقياس تقدمها بعدد المؤسسات المحمية بدلًا من مؤشرات النشاط. وتُدعى الحكومات إلى تمويل الدفاع السيبراني، بدءًا من الخدمات الأساسية التي تفتقر إلى الميزانية والموظفين. وأخيرًا، يتعين على مختبرات الذكاء الاصطناعي المتقدمة توفير وصول مسؤول إلى النماذج، وجعل هويات الوكلاء قابلة للتتبع والمساءلة.

تربط هذه النقطة الأخيرة المقال بأحداث اليوم السابق: تقرير التحقيق في حادثة Hugging Face، حيث حصل نموذج بحث داخلي على وصول غير مخطط إليه للإنترنت واخترق عمال الإنتاج. لذلك ترد قابلية تتبع الوكلاء هنا بوصفها التزامًا، لا مجرد توصية موجهة إلى الآخرين.

We have a limited window to strengthen cyber defenses, and together with organizations including @AnthropicAI, @awscloud, @Google, @Microsoft, and @Oracle, we’re calling for a global effort to give defenders the tools, resources, and support to protect the infrastructure we all depend on. If we act decisively, we can turn today’s AI advances into lasting improvements in security and make our digital world safer for everyone.

🇸🇦 لدينا نافذة محدودة لتعزيز الدفاعات السيبرانية، وبالتعاون مع مؤسسات من بينها @AnthropicAI و@awscloud و@Google و@Microsoft و@Oracle، ندعو إلى جهد عالمي يمنح المدافعين الأدوات والموارد والدعم اللازم لحماية البنية التحتية التي نعتمد عليها جميعًا. وإذا تحركنا بحزم، فيمكننا تحويل التطورات الحالية في الذكاء الاصطناعي إلى تحسينات أمنية دائمة، وجعل عالمنا الرقمي أكثر أمانًا للجميع.@OpenAI على X

🔗 دعوة إلى عمل جماعي في مجال الدفاع السيبراني


Claude Cowork يضم متصفحه الخاص

26 أغسطس — يدمج Claude Cowork متصفحه الخاص في تطبيق سطح المكتب. وما إن تتضمن مهمة ما موقعًا إلكترونيًا، حتى يُفتح متصفح في اللوحة الجانبية ويتنقل Claude فيه ويقرأ الصفحات وينقر ويملأ النماذج. والفكرة هي تفويض الجزء المتعلق بالويب من العمل من دون مغادرة ما يفعله المستخدم: كاستخراج أرقام من لوحة معلومات، أو اجتياز بوابة مورّد لا يتوفر لها أي موصل.

الفصل هو النقطة المحورية في الإعلان. فالمتصفح المدمج يخص Claude، لا المستخدم: لا يرى Claude علامات التبويب ولا الإشارات المرجعية ولا كلمات المرور. وللبقاء متصلًا بالخدمات، تُستورد الجلسات موقعًا تلو الآخر، من Chrome أوEdge أوFirefox على macOS، ومن Firefox على Windows وLinux. وتُستثنى مواقع الخدمات المصرفية والمراسلة والمصادقة الموحّدة (SSO)، ما لم يُتخذ قرار صريح بإدراجها.

ترسم Anthropic حدًا واضحًا للاستخدام مقارنة بامتداد Claude in Chrome، الذي أصبح متاحًا للجميع في اليوم نفسه. يُستخدم المتصفح المدمج لإسناد مهمة عبر الويب مع مواصلة المستخدم عمله؛ بينما يُستخدم Claude in Chrome مع الصفحة المفتوحة بالفعل والحسابات المتصلة بالفعل. وإذا كان الامتداد مثبتًا، فيظل الخيار الافتراضي؛ ويمكن تغيير الإعداد من Settings → Cowork → Preferred browser، ومن جهة المسؤول عبر Organization settings → Cowork → Built-in browser.

فيما يتعلق بالأمان، لا يقدم الإعلان أي وعود مطلقة. يحمل المتصفح المدمج مخاطر حقن الأوامر نفسها التي يواجهها أي وكيل يعمل داخل متصفح، عندما تحاول تعليمات مخفية في صفحة ما حرف Claude عن مهمته. ويطبق وسائل الحماية نفسها التي يستخدمها Claude in Chrome، ومنها عناصر التحكم التي تقارن إجراءات Claude بما طُلب منه. وتكتب Anthropic أن هذه التدابير تقلل المخاطر بدرجة كبيرة من دون القضاء عليها، وتوصي بالبدء باستخدام مواقع موثوقة.

جانب النشرالتفاصيل
الخطط المشمولةPro، وMax، وTeam؛ وEnterprise بعد تفعيل المسؤول
المنصات المدعومةmacOS، وWindows، وLinux (في الإصدار التجريبي)
الجدول الزمني للنشرخلال الأسبوع التالي للإعلان، ومفعّل افتراضيًا
استيراد جلسات الاتصالChrome، وEdge، وFirefox على macOS؛ وFirefox على Windows وLinux
المواقع المستثناة افتراضيًاالخدمات المصرفية، والمراسلة، والمصادقة الموحّدة

🔗 متصفح Cowork المدمج


وصول GLM-5.3 Flash إلى Together AI، وإعلان Z.ai عن فتح أوزان GLM-5.3

27 أغسطس — تتيح Together AI نموذج GLM-5.3 Flash، وهو أول نموذج متعدد الوسائط بطبيعته ضمن سلسلة GLM-5 من Z.ai، مع إتاحة أوزانه للعامة. وتتميز ورقته التقنية بتفاصيل كثيرة على نحو غير معتاد: بنية Mixture-of-Experts تضم 320 مليار معامل، منها 18 مليار معامل نشط، و45 طبقة، ونافذة سياق بسعة مليون token. والمقارنة التي تبرزها Z.ai داخلية ضمن سلالتها الخاصة؛ فعند حجم إجمالي مماثل تقريبًا، يخفض النموذج عدد المعاملات النشطة وعمق GLM-4.5 إلى النصف تقريبًا.

البنية هي الموضوع الحقيقي. يجمع النموذج بين انتباه خطي يلتقط الارتباطات المحلية عبر نمذجة الحالة، وانتباه sparse يسترجع السياق الشامل بواسطة مفهرس خفيف. ويضغط IndexPool أيضًا أربعة متجهات رئيسية للمفهرس في متجه واحد عن طريق التجميع الموزون. والنتيجة التي أعلنتها Z.ai، عند القياس مقابل GLM-5.3، هي خفض حسابات الانتباه إلى الثلث وتقليص ذاكرة KV المؤقتة بمقدار 4,4 مرات ضمن نافذة المليون token. وهذا التوفير هو ما يبرر التسعير البالغ 0,15 دولار لكل مليون token للإدخال و0,50 دولار للإخراج، مقارنةً بـ1,40 و4,40 دولارات لنموذج GLM-5.2 لدى المستضيف نفسه. وكان النموذج قد عُرض سابقًا بصورة مجهولة تحت اسم Ox Alpha قبل إطلاقه.

لا تُعد القدرات متعددة الوسائط هنا إضافة هامشية، بل عنصرًا من دورة كتابة الشيفرة: يفحص النموذج مخرجاته المعروضة على الشاشة ويصقلها تكراريًا. ويتبع التدريب المنطق نفسه، باستخدام التعلم المعزز (reinforcement learning) القائم على تغذية راجعة من البيئة لشيفرة الواجهات الأمامية، والتحقق الوكيلي المرتكز إلى مسارات استخدام حقيقية للواجهات الرسومية.

وفي اليوم نفسه، أعلنت Z.ai في رسالة شديدة الإيجاز أن أوزان GLM-5.3 — النموذج الرئيسي المتاح عبر API منذ 18 أغسطس — ستُنشر في اليوم التالي، من خلال صفحة Hugging Face zai-org/GLM-5.3 موجودة مسبقًا لكنها موسومة بعبارة «إصدار قادم». وكان التمهيد لفتح النموذج قد بدأ قبل أسبوعين بمقال عنوانه «إعداد GLM-5.3 للإصدار المفتوح: مسار مسؤول نحو الدفاع السيبراني». وهكذا يجمع المختبر بين إطلاق نسخة سريعة وفتح أوزان النموذج الرئيسي بفاصل يقل عن أربع وعشرين ساعة.

معيار التقييمGLM-5.3 FlashGLM-5.2
Terminal Bench 2.184,381,0
DeepSWE v1.163,446,2
Toolathlon Verified78,459,9
AutomationBench48,826,2
Humanity’s Last Exam (مع أدوات)55,3
GDPval-AA v2 Elo (Artificial Analysis)1773
تسعير Together AI (بالدولار لكل مليون token)GLM-5.3 FlashGLM-5.2
الإدخال0,151,40
الإدخال المخزّن مؤقتًا0,030,26
الإخراج0,504,40

GLM-5.3 Flash has arrived. @Zai_org’s first natively multimodal GLM-5 model packs 320B parameters, 18B active, 1M context, and hybrid attention.

On DeepSWE, it nearly MATCHES Luna’s performance while getting more than TWICE as much work done for the same budget.

🇸🇦 وصل GLM-5.3 Flash. يضم أول نموذج GLM-5 متعدد الوسائط بطبيعته من Z.ai نحو 320 مليار معامل، منها 18 مليار معامل نشط، وسياقًا بسعة مليون token، وانتباهًا هجينًا. وفي DeepSWE، يكاد يعادل أداء Luna، مع إنجاز أكثر من ضعف حجم العمل بالميزانية نفسها.@togethercompute على X

🔗 صفحة النموذج لدى Together AI · إعلان @Zai_org عن الأوزان


Gemini Omni 1.1 Flash: عشر ثوانٍ من السياق لتمديد لقطة، ومسودات بدقة 360p وإخراج بدقة 4K

27 أغسطس — تطلق Google نموذج Gemini Omni 1.1 Flash، وهو تحديث لنموذجها متعدد الوسائط المخصص لتوليد الفيديو وتحريره، من إعداد Anish Nangia وAlisa Fortin، مديري المنتجات لدى Google DeepMind.

يتعلق التغيير الأهم بتمديد المشاهد. فحتى الآن، كان تمديد فيديو مولّد يعني مطالبة النموذج بالمتابعة انطلاقًا من الثانية الأخيرة وحدها، ما كان يسبب انقطاعات في الاتساق بمجرد احتواء المشهد على شخصيات أو بيئة معقدة. أما Omni 1.1 فيحلل الآن ما يصل إلى 10 ثوانٍ من السياق السابق، ضمن كتل مدة كل منها 10 ثوانٍ، وصولًا إلى مدة تراكمية تبلغ 40 ثانية.

يتمثل المحور الثاني في التحكم بالتأطير: إذ يطلب تحديد الصورتين الأولى والأخيرة من النموذج توليد الفيديو الوسيط بين صورتين مفتاحيتين، بما يستهدف حركات الكاميرا المعقدة والحلقات التي لا يظهر فيها موضع الوصل. أما المحور الثالث فهو اقتصادي، مع دقة مسودة تبلغ 360p، أُعلن أنها أسرع بنسبة تصل إلى 60% وبتكلفة تعادل ثلث تكلفة دقة 720p القياسية — ويستند قياس السرعة، بحسب توضيح Google، إلى مقارنة إنتاجية النظام بين الدقتين. وتنتهي سلسلة المعالجة برفع الدقة (upscaling) إلى 1080p أو 4K. ويُضاف إلى ذلك استخدام فيديو مرجعي في الإدخال متعدد الوسائط، بمدة تصل إلى 3 ثوانٍ، للحفاظ على اتساق شخصية أو إعادة إنتاج حركة.

يتوفر النموذج في Google AI Studio، وعبر API لمنصة Gemini Enterprise Agent Platform، وفي Google Flow لجميع مشتركي Google AI Plus وPro وUltra. وتذكر Google من بين عملائها Adobe، التي دمجته في Firefly، وFigma Weave، وGMI Cloud، وRunway. ويرافق المقال الرسمي جدول أسعار، لكنه منشور على هيئة صورة من دون مقابل نصي، ولذلك لم تُذكر أي أسعار هنا.

وفي اليوم نفسه، أتاحت Pika النموذج في API Club الخاص بها، والمتاح عبر dev.pika.art، مع تمديد الفيديو، ودعم الصورتين الأولى والأخيرة، وما يصل إلى ثلاثة مقاطع فيديو مرجعية، وإخراج بدقة تصل إلى 4K. ويواصل الاستوديو بذلك نهجًا راسخًا يتمثل في تجميع نماذج الفيديو التابعة لجهات خارجية فور إتاحتها، كما فعل سابقًا مع Seedance 2.5 ثم Wan 3.0.

قدرة النموذجالقيمة المعلنة
سياق التمديدحتى 10 s، مقارنةً بـ1 s في النماذج السابقة
مقدار كل تمديد10 s، حتى مدة تراكمية تبلغ 40 s
مسودة 360p — السرعةأسرع بنسبة تصل إلى 60% من 720p
مسودة 360p — التكلفةثلث تكلفة 720p القياسية
رفع الدقة1080p أو 4K
الفيديو المرجعي متعدد الوسائطما يصل إلى 3 s من الفيديو
معرّف النموذج في APIgemini-omni-1.1-flash

🔗 إعلان Google · رسالة @pika_labs


H3 Max: تجري fal تدريبًا لاحقًا لـMiniMax H3 وتولّد 5 ثوانٍ من الفيديو في أقل من 3 ثوانٍ

26 أغسطس — تنشر fal Research نموذج H3 Max، وهو نموذج فيديو خضع لتدريب لاحق انطلاقًا من الأوزان المفتوحة لـMiniMax H3. وما يميز هذا العمل أنه لا يقتصر على التدريب اللاحق؛ إذ شارك فريق الاستدلال في fal في تصميم حزمة التنفيذ بالتوازي مع النموذج، بحيث تسترشد قرارات التدريب والتقديم بعضها ببعض.

على صعيد الجودة، أجرت fal دراسات تفضيل بشري مباشرة مقابل اثني عشر نموذجًا مرجعيًا للفيديو، من بينها نقطة الوصول الرسمية لـMiniMax H3، وGemini Omni Flash، وWan 3.0، وSeedance 2.5، وKling 3، وVeo 3.1. وقارن المقيّمون ثلاثة أبعاد منفصلة — التفضيل العام، والالتزام بالموجّه، والجماليات — جُمعت باستخدام درجات Elo بايزية مع فواصل ثقة تبلغ 95%. وحل H3 Max أولًا في الأبعاد الثلاثة، وفاز بأغلبية المواجهات أمام كل نموذج خضع للاختبار، بما في ذلك H3 الأصلي. كما وضعه Artificial Analysis وDesign Arena في صدارة تصنيفاتهما المستقلة.

على صعيد السرعة، يولّد H3 Max فيديو مدته 5 ثوانٍ في نحو 3 ثوانٍ، أي بإنتاجية تعادل نحو 35 ضعف إنتاجية نقطة الوصول الرسمية لـMiniMax H3، وبسرعة تزيد في المتوسط 15 مرة على النماذج ذات الجودة المماثلة. وتؤكد fal منهجيتها: لم يُحتفظ بأي تحسين إلا إذا حافظ النموذج الناتج على مرتبته في تقييمات الجودة الداخلية. ونُفذ التدريب والتقديم بالكامل على أنظمة NVIDIA GB200 NVL72.

ويؤكد فريق MiniMax H3، المقتبس كلامه في مقال fal، النتيجة: فبحسب الفريق، يجمع H3 Max بين جودة فيديو في أحدث مستويات التقنية وتحول كامل في مرتبة سرعة التوليد، ما يجعل توليد الفيديو عالي الجودة عمليًا لنطاق أوسع بكثير من تطبيقات العالم الحقيقي. وهذه هي حجة الأوزان المفتوحة في التطبيق العملي: إذ يكشف تدريب لاحق تنفذه جهة خارجية الإمكانات الحقيقية لنموذج أساسي جيد.

المقياس الذي نشرته falالقيمة
فيديو مدته 5 ثوانٍيُولّد في نحو 3 ثوانٍ
الإنتاجية مقارنةً بنقطة الوصول الرسمية لـH3نحو 35x
السرعة مقارنةً بنماذج ذات جودة مماثلة15x في المتوسط
نماذج الفيديو التي تمت مقارنتها12
الترتيب في التفضيل البشريالأول في الأبعاد الثلاثة
خصم الإطلاق50% خلال الأسبوع الأول

🔗 عرض H3 Max من fal


Cohere Parse: ‏1,50 دولار لكل 1 000 صفحة ونتيجة 79,2 في ParseBench

27 أغسطس — تطلق Cohere نموذج Parse بإتاحة عامة، وهو نموذج للرؤية واللغة (vision language model) مخصص لمعالجة وثائق المؤسسات بكميات كبيرة. ويحوّل الملفات المعقدة متعددة الوسائط إلى بيانات منظمة قابلة للقراءة آليًا، ويُخرج Markdown نظيفًا مصممًا لفهرسة الوثائق وRAG والاسترجاع الوكيلي. وإضافةً إلى التعرف على المحارف، يتعرف Parse على الجداول والنماذج والمخططات والصور المضمّنة، ويعيد مربعات إحاطة (bounding boxes) للجداول والصور. وهو يعالج تسع لغات عالمية رئيسية.

الحجة الرئيسية تتعلق بالتسعير: 1,50 دولار لكل 1 000 صفحة عبر API الخاص بـCohere. وبالنسبة إلى أعباء العمل المستمرة، تروّج الشركة لمنصة Model Vault، وهي منصة استدلال أحادية المستأجر، توفر 23% عند استخدام GPU بنسبة 50% وما يصل إلى 61% عند الاستخدام الكامل بالساعة. ويحقق المثال الرقمي المقدم — وهو تدفق لحسابات الموردين يعالج نحو 13 مليون صفحة شهريًا — وفورات شهرية تبلغ نحو 12 000 دولار مقارنةً بـAPI، ونحو 1,47 مليون دولار سنويًا مقارنةً بعرض hyperscaler يتقاضى 10 دولارات لكل 1 000 صفحة.

أما من حيث الإنتاجية، فتعلن Cohere عن 4,5 صفحات في الثانية، أي 36 صفحة في الثانية على عقدة تضم 8 وحدات GPU من طراز H100 — ما يعادل نحو 1,4 ضعف إنتاجية dots.mocr و2,2 ضعف إنتاجية Chandra OCR 2 في الإعداد نفسه، مع اقتصار المقارنة على نماذج مفتوحة المصدر يجري تقديمها عبر vLLM.

وتقر Cohere بقيدين منهجيين. فقد استُبعد بُعدا Layout وChart في ParseBench من المقارنة، لأن النموذج يستهدف إخراج Markdown بترتيب القراءة ويتعامل مع الرسوم البيانية بوصفها عناصر مرئية تصفها البيانات الوصفية، على أن تتوفر إمكانية استخراج السلاسل الرقمية في الإصدار التالي. كما تستخدم جميع النتائج المنشورة قواعد ParseBench الصادرة في أغسطس 2026، التي تصحح خللًا في اكتشاف النص العريض والعناوين كان يضخم سابقًا نتائج التنسيق الدلالي، وقد أُعيد تقييم المنافسين باستخدام القواعد نفسها. ويتوفر Parse عبر API الخاص بـCohere، وModel Vault، وMicrosoft Foundry، وAWS SageMaker بالمعرّف parse-v5.0، ويمكن نشره في سحابة خاصة أو محليًا.

النموذج الخاضع للتقييمالمتوسطالجداولدقة المحتوىالتنسيق الدلالي
GPT-5.584,489,387,576,5
Opus 4.884,389,789,074,1
Gemini 3.5 Flash81,887,684,773,2
Cohere Parse79,287,086,664,0
LlamaParse (اقتصادي التكلفة)78,381,490,962,7
Mistral OCR 474,573,989,560,1
Databricks AI Parse72,483,788,345,3
Google Document AI57,355,183,733,0
AWS Textract53,382,374,82,8

🔗 إعلان Cohere Parse


27 أغسطس — حدّثت NVIDIA مقالها المخصص لـ CPU Vera لإضافة محطة مهمة: تسلّمت AWS أول خادم CPU Vera وأول GPU Vera Rubin لها، وسلّمهما شخصيًا Ian Buck، نائب الرئيس لقسم Hyperscale وHPC في NVIDIA، إلى Willem Visser وSupreeth Sheshardi، نائبي الرئيس في Amazon EC2، داخل مقر AWS في سياتل. ويتزامن التسليم مع إعلان صدر في اليوم السابق، 26 أغسطس: توسّع AWS وNVIDIA تعاونًا مستمرًا منذ ستة عشر عامًا، من خلال خطة تشمل مليوني GPU إضافيين ونقل البنية التحتية القائمة على CPU Vera إلى AWS. وليست AWS أول جهة تتسلّم هذه الأنظمة، إذ سبق أن سلّم Buck أنظمة Vera إلى Oracle Cloud Infrastructure، وكذلك إلى Anthropic وOpenAI وSpaceXAI.

تستند الحجة التقنية إلى ملاحظة مفادها أن الوكيل لا يعمل على GPU وحده. فكل بيئة تنفيذ معزولة، وكل استدعاء لأداة، وكل طبقة تنسيق، وكل عملية استرجاع ضمن سياق طويل، تمثل عملًا ينفّذه CPU. يتضمن Vera عددًا قدره 88 نواة Olympus صممتها NVIDIA، وعرض نطاق للذاكرة يبلغ 1.2 تيرابايت/ثانية، ويَعِد بأداء لكل نواة يصل إلى 1.8x في أعباء عمل الوكلاء. وتستشهد NVIDIA ببيانات OpenRouter التي تفيد بأن هذه الأعباء تستهلك رموزًا أكثر بمقدار 15 مرة من طلب محادثة بسيط. ومن بين مزودي الخدمات السحابية، تُعد Oracle Cloud Infrastructure أول من ينشر Vera على نطاق فائق، مع التخطيط لتوفير مئات الآلاف من وحدات CPU بدءًا من عام 2026. وللدقة، تجدر الإشارة إلى أن المقال إعادة نشر، إذ تعود نسخته الأولى إلى 18 مايو 2026، ولا يتعلق بأحداث اليوم سوى الجزء الخاص بـ AWS.

وفي 26 أغسطس، وسّعت NVIDIA أيضًا NVLink Fusion ليشمل NVHBM، وهي تقنية ذاكرة ذات عرض نطاق عالٍ مخصصة للشرائح المصممة حسب الطلب لدى شركائها. والتغيير المعماري محدد: تضع معماريات HBM التقليدية متحكم الذاكرة على شريحة XPU، حيث يشغل مساحة من السيليكون كان يمكن استخدامها للحوسبة؛ أما NVHBM فينقل هذا المتحكم، الذي صممته NVIDIA، إلى الشريحة الأساسية في مكدس HBM ثلاثي الأبعاد. وتُعد Annapurna Labs، ذراع Amazon المختصة بالسيليكون، أول شريك يعمل على NVHBM، إلى جانب التزام أُعلن عنه سابقًا بدعم NVLink Fusion في شرائح Trainium بدءًا من Trainium4.

الخاصية المقاسةالقيمة المعلنة
أنوية CPU Vera88 نواة Olympus صممتها NVIDIA
عرض نطاق ذاكرة Vera1.2 تيرابايت/ثانية
الأداء لكل نواة في أعباء عمل الوكلاءحتى 1.8x
وحدات GPU الإضافية المخطط لها لدى AWSمليونان
عرض نطاق NVHBM مقارنةً بـ HBM4E القياسيةحتى +30%
استهلاك HBM مع NVHBM-15%
المساحة المحررة على شريحة الحوسبة XPUحتى +25%

🔗 تسليم CPU Vera · NVLink Fusion وNVHBM


Google DeepMind تجري أول تقييم مزدوج التعمية لنموذج حدودي

27 أغسطس — نشرت Google DeepMind تقريرًا عن تجربة تجريبية تقدمها بوصفها أول تقييم مزدوج التعمية لنموذج ذكاء اصطناعي احتكاري من الفئة الحدودية. ويحمل الإعلان توقيع William Isaac وSol Messing وKristian Lum، ويظهر بوصفه المنشور المثبّت في حساب المختبر.

تتمثل المشكلة التي يعالجها النظام في تلوث معايير القياس. ويستخدم المقال تشبيهًا مدرسيًا: إذا كان الطالب قد رأى أسئلة الامتحان مسبقًا، فلن تعود درجته الكاملة مقياسًا لأي شيء. وبالنسبة إلى نماذج اللغة، تُعد المسألة بنيوية لأن مجموعات التقييم العامة تنتهي في مجموعات بيانات التدريب. وتشير Google إلى أن بروتوكولات عدم التسجيل والضمانات التعاقدية تحافظ منذ وقت طويل على سرية مطالبات الاختبار الخارجية، لكن إضافة ضمانات تقنية وتشفيرية تمثل تحولًا نوعيًا.

تاريخيًا، كان أي تقييم خارجي عالي المخاطر يفرض مفاضلة: إما أن يسلّم المقيّم مطالباته إلى مزود النموذج، أو أن يسلّم المزود أوزان نموذجه. ويلغي النظام الموصوف هذه المفاضلة. فهو يعتمد على Confidential Space، وهو مكوّن ضمن حافظة Confidential Computing في Google Cloud، يتيح التحقق تشفيريًا من بقاء الأصلين خاصين بمالكيهما: فلا يستطيع المقيّم الوصول إلى أوزان نموذج Gemini، ولا تستطيع Google الوصول إلى مطالبات الاختبار.

تشمل التجربة نموذج Gemini Flash Lite خضع للاختبار باستخدام معايير قياس سرية، بالشراكة مع Singapore AI Safety Institute وOpenMined وAVERI وMLCommons. وتؤكد Google أن قيمة النظام تزداد مع حساسية التقييم، مشيرة صراحةً إلى اختبارات الأمن السيبراني والاختبارات التي تجريها الهيئات الحكومية. ويرافق الإعلان تقرير تقني يشرح المنهجية بالتفصيل.

🔗 التجربة التجريبية للتقييمات مزدوجة التعمية


Expert Intelligence: تحوّل كتب Google Play Books الإلكترونية إلى مصادر في Gemini Notebook

27 أغسطس — أعلن فريق Gemini Notebook عن Expert Intelligence، وهي مبادرة عابرة لفرق Google تتيح استخدام الكتب المشتراة بوصفها مصادر داخل دفتر ملاحظات. ويبدأ الإطلاق بالكتب الإلكترونية المؤهلة من Google Play Books؛ كما أعلنت Google عن إضافة الاشتراكات التابعة لجهات خارجية والكتب المدرسية لاحقًا، وتوسيع الميزة لتشمل تطبيق Gemini و«وضع الذكاء الاصطناعي» في Google Search.

المبدأ سهل الوصف لكنه جديد من حيث نطاقه: يمكن لدفتر الملاحظات الآن الجمع بين كتب إلكترونية مشتراة واشتراكات مهنية وملفات شخصية من Google Drive ضمن قاعدة معرفة واحدة. وبعد ذلك تُطبق وظائف Gemini Notebook المعتادة على الكتاب، بما يشمل التحاور مع المحتوى، وإنشاء Audio Overviews، وإعداد بطاقات المراجعة والاختبارات القصيرة، مع إسناد كل إجابة إلى المصادر عبر استشهادات مضمّنة تحيل إلى المقطع الدقيق.

النقطة الأكثر إثارة للاهتمام هي النموذج الاقتصادي، لأنه يجيب عن السؤال الذي يثيره هذا النوع من المنتجات فورًا: ماذا يحدث لتعويض المؤلف عندما يهضم نموذجٌ كتابه؟ تضع Google شرطًا صريحًا للوصول: للتفاعل مع كتاب داخل Gemini Notebook، يجب امتلاكه عبر Google Play Books. وإذا جرت مشاركة دفتر ملاحظات يحتوي على كتاب، يُطلب من المتعاونين شراء نسختهم الخاصة للمضي قدمًا. وبذلك تقدم Google النظام للناشرين بوصفه قناة للاكتشاف لا بديلًا عن الكتاب.

أما بالنسبة إلى الناشرين، فآلية الاشتراك تصريحية: يمكن التحقق من أهلية أي كتاب في صفحته على Google Play Books، حيث يظهر Gemini Notebook تحت شارة «الأدوات» إذا كان الكتاب مسجلًا، ويتم التسجيل عند الطلب من فريق Google. وتوضح حالات الاستخدام الثلاث المفصلة طبيعة الميزة: دمج ملاحظات المحاضرات مع كتاب The Sense of Style لـ Steven Pinker، وتطبيق كتاب The Culture Code لـ Daniel Coyle على مشروع جماعي، وتلخيص روتين انطلاقًا من كتاب The New Menopause قبل تحويله إلى Audio Overview.

🔗 Expert Intelligence


تضيف Warp حلقات للتحسين الذاتي إلى factories الخاصة بها

27 أغسطس — أضافت Warp إلى منصتها Warp Factories حلقات للتحسين الذاتي (self-improvement loops). ويقوم المبدأ على ثلاث مراحل: تقييم المحادثات السابقة للوكلاء وفق معايير يحددها الفريق، وعزل حالات الإخفاق، ثم إنشاء تحسينات للـ skills. ويشرح مقال هندسي نُشر في اليوم نفسه النظام بأكمله بالتفصيل.

المكوّن المركزي هو دالة تقييم تسميها Warp باسم scorer. تستقبل هذه الدالة سجلات تنفيذ وكيل وتعيد درجة وفق شبكة تقييم. وتشدد Warp على نقطة معينة: يجب ألا تقتصر المدخلات على سجل الوكيل، بل ينبغي أن تشمل التفاعلات البشرية الواردة من الأدوات المدمجة، مثل التعليقات المتروكة على pull request. ويمكن أن تأتي الدرجة من إنسان أو من كود، أو، كما هو شائع أكثر حاليًا، من وكيل آخر يعمل بصفته حكمًا. وتوفر Warp scorers افتراضية تقيّم الصحة وكفاءة التكلفة والإسهاب، وتتيح ضبط وتيرة تشغيلها — كل بضع ساعات افتراضيًا — وكذلك استراتيجية أخذ العينات، لأن هذه التقييمات لها تكلفة.

بعد ذلك، تغذي عمليات التنفيذ المقيّمة وكلاء التحسين الذاتي، الذين يبحثون عن الأنماط المتكررة في حالات الإخفاق ويقترحون تصحيحات لها على هيئة diffs في تعريف factory. ولا تعمل هذه الآلية إلا لأن factory موصوفة في صورة كود: ملف factory.yaml بالإضافة إلى شجرة من تعريفات الوكلاء والـ skills وخوادم MCP وقواعد توجيه النماذج. ويتلقى البشر الاقتراحات في صورة pull requests ويقررون دمجها من عدمه.

تميّز Warp بوضوح آلية ثانية، هي benchmarks، تعالج أحد قيود حلقات التحسين الذاتي: فهذه الحلقات تشبه التغييرات التي قد يجريها شخص مختص بعد مراجعة النتائج السابقة، لكنها لا تمثل اختبار A/B حقيقيًا. ولحسم مسألة مثل أفضل تجميعة من النماذج، تقترح Warp اختيار خمس إلى عشر مهام مرجعية، وتشغيل الوكلاء بالتوازي باستخدام عدة إعدادات، ثم تقييمها باستخدام scorers نفسها. وتكون النتيجة مصفوفة من النتائج لكل إعداد. أما مقاييس التوجيه المذكورة — معدل pull requests، ومتوسط التكلفة لكل pull request، ونسبة الأتمتة، والوفورات المقدرة — فتُعرض بوصفها إطار قياس مقترحًا، من دون أرقام تدعمها نتائج للعملاء.

🔗 إعلان @warpdotdev


تعمّم Replit التوجيه التلقائي للنماذج

27 أغسطس — أتاحت Replit ميزة Intelligent Model Routing لجميع مستخدمي المنصة. والحجة الأساسية بسيطة: يتغير أفضل نموذج لمهمة ما من أسبوع إلى آخر، ومن مشروع إلى آخر، بل وأحيانًا من مهمة إلى أخرى، ويضيف هذا الاختيار نقطة قرار بين الفكرة وتنفيذها. لذلك تتولى Replit الاختيار؛ فمع تطور المهمة، تُسند إلى النموذج الأنسب لإكمالها، مع الموازنة بين الجودة والسرعة والتكلفة.

يجب قراءة الرقم المعلن بدقة. ففي اختباراتها، تقول Replit إنها حققت جودة مخرجات مماثلة بتكلفة أقل بنسبة 65% مقارنةً بـ الإصدار السابق من وضع Max؛ ولا يعني ذلك انخفاضًا مطلقًا في التكلفة بنسبة 65%، بينما يتحدث المنشور على X عن تكلفة «أقل بما يصل إلى 65%».

لا يلغي التوجيه إمكانية التحكم اليدوي. يبدأ جميع المستخدمين الآن في Free Mode، ويتلقون إشعارًا عندما ينتقل العمل إلى أوضاع أقوى قد تنطوي على تكاليف؛ ويحتفظ مشتركو Core وPro بإمكانية اختيار النموذج يدويًا. وفي بيئات المؤسسات، يحدد المسؤولون مجموعة النماذج المعتمدة لكل مساحة عمل، وتختار Replit تلقائيًا من داخل هذه المجموعة.

عنصر الإطلاقالقيمة التي أعلنتها Replit
خفض التكلفة-65% مع جودة مماثلة، مقارنةً بالإصدار السابق من وضع Max
الإتاحةجميع المستخدمين
وضع البدايةFree Mode، مع إشعار قبل الانتقال إلى وضع مدفوع
الاختيار اليدويمتاح في خطط Core وPro
التحكم في المؤسساتمجموعة نماذج معتمدة تُحدد لكل مساحة عمل

🔗 إعلان @Replit


Codex CLI 0.150: إشارات @ بين المهام وhooks من نوع Interrupt وتشديد حماية المشاريع غير الموثوقة

26 أغسطس — انتقل Codex CLI إلى الإصدار 0.150.0، وتبعه في 27 أغسطس الإصدار التصحيحي 0.150.1. ويُثبت التحديث باستخدام npm install -g @openai/codex@0.150.1.

يتعلق التغيير البنيوي بالتنسيق بين المهام. فقد أصبح من الممكن الإشارة إلى مهام Codex أخرى باستخدام إشارات @، ومطالبة وكيل بقراءة مهمة أو إنشائها أو إرسال رسالة إليها مباشرةً من terminal. وعمليًا، تصبح قائمة المهام مجموعة من العناصر القابلة للعنونة: إذ يمكن للوكيل الاطلاع على ما أنتجته مهمة أخرى أو إرسال تعليمة إليها، من دون نسخ السياق ولصقه يدويًا. وفي السياق نفسه، تحصل مهام terminal التي ظلت بلا اسم تلقائيًا على عنوان وصفي، ويقترح /rename عنوانًا قابلًا للتحرير مستنتجًا من المحادثة.

الإضافة البارزة الثانية هي hook من نوع Interrupt. حتى الآن، كانت مقاطعة دورة نشطة نقطة عمياء: إذ كانت الجلسة تتوقف من دون إمكانية تشغيل أي شيء. ويتيح الإصدار 0.150.0 تنفيذ أمر أو handler من MCP عند مقاطعة دورة من المستوى الأعلى، ما يسمح بتنظيف حالة أو تحرير قفل أو تسجيل عملية الإيقاف.

على صعيد الأمان، يستحق تصحيحان الانتباه ممن يشغّلون Codex على كود تابع لجهة خارجية. فلم تعد المشاريع غير الموثوقة توفر تعليمات AGENTS.md على مستوى المشروع — وبالتالي، لم يعد بإمكان ملف تعليمات موضوع داخل مستودع مستنسخ توجيه الوكيل من دون علم المستخدم — كما تظل قواعد رفض القراءة المُدارة مطبقة بعد تغيير الأذونات. ويضاف إلى ذلك تحسين حجب المعرّفات في تشخيصات app-server، وتصحيحات تخص bearer tokens لخوادم MCP البعيدة وحالات التعطل أثناء الإيقاف على Unix بسبب العمليات المنفصلة. وأخيرًا، يعالج الإصدار التصحيحي 0.150.1 حالة محددة لكنها مكلفة: إذ تحتسب عملية الضغط البعيدة الآن الصور المحتفظ بها ضمن ميزانية الرموز وتحذف أقدمها عند الحاجة؛ ففي الجلسات الطويلة التي تتضمن لقطات شاشة، كان ذلك مصدرًا صامتًا لتجاوز سعة السياق.

الإصدار المنشورتاريخ سجل التغييراتطبيعة الإصدار
0.150.026 أغسطس 2026إصدار مستقر وميزات جديدة
0.150.127 أغسطس 2026تصحيح متعلق بعملية الضغط

🔗 ملاحظات إصدار 0.150.0


Claude Code 2.1.247: تدقيق تكاليف API ونافذة 1M افتراضيًا لـ Sonnet 5

27 أغسطس — ينتقل Claude Code إلى الإصدار 2.1.247. أبرز إضافة للفرق هي أمر لتدقيق الإنفاق: يحلل /claude-api cost-optimize ما يستهلكه المشروع على Claude API، ثم يستعرض وسائل خفض التكلفة واحدة تلو الأخرى — caching، وتنظيم tokens، والمعالجة على دفعات، ومستوى الجهد، واختيار النموذج — مع قياس أثر كل تغيير قبل الانتقال إلى التالي. كما أصبحت skill المسماة /claude-api تغطي الآن Admin API: أعضاء المؤسسة، والدعوات، وworkspaces، ومفاتيح API، وتقارير حدود معدل الطلبات، وworkload identity federation، وCMEK.

يستحق أحد إعدادات السياق الانتباه: تنتقل نافذة الضغط التلقائي الافتراضية لـ Sonnet 5 إلى سياقها الكامل البالغ 1M من tokens، وبذلك يجري ضغط الجلسات الآن عند نحو 967K من tokens بدلًا من نحو 934K. وعلى صعيد المتانة، لم تعد العوامل الفرعية تتوقف بسبب خطأ 404 خاص بالنموذج عند أول استدعاء — إذ تنتقل إلى سلسلة النماذج الاحتياطية للجلسة — كما لم يعد بإمكان hook يُنتج ميغابايتات من الأخطاء أن يعلق الجلسة عند رسالة «الموجّه طويل جدًا».

وأخيرًا، يكرّس الإصدار جهدًا واضحًا لتعزيز الأمان. ففي Markdown المعروض داخل الطرفية، تُعرض الروابط التي تستهدف مسار شبكة أو مسار تحميل تلقائي، أو تحتوي على محرف تحكم، أو تبدأ بمحرف غير مرئي، كنص عادي بدلًا من عرضها كروابط قابلة للنقر. كما يرفض marketplace الخاص بالـ plugins الأسماء التي تتضمن محارف تحكم، ويجري escaping للنص الذي يحقنه marketplace في مخرجاته.

🔗 سجل تغييرات Claude Code


Together AI تحسب نتائج التسلسل من DeepSeek إلى GPT-5.6 Sol على DeepSWE

27 أغسطس — توسّع Together AI سلسلة مقارناتها على DeepSWE لتشمل نماذج DeepSeek، باستخدام البروتوكول نفسه المتّبع في حلقات GLM-5.3: مهام benchmark البالغ عددها 113، وأربع محاولات لكل مهمة ولكل نموذج، أي 904 عمليات تنفيذ في المواجهة بين DeepSeek V4 Pro 0813 وGPT-5.6 Sol.

تمنح النتيجة الأولية الأفضلية للنموذج المغلق في المحاولة الأولى — 72.7% مقابل 62.8% — لكن الفارق يتقلص مع كل محاولة وينعكس في الرابعة، ليبلغ 88.5% لصالح DeepSeek مقابل 85.8%. وبتكلفة 0.24 دولار لكل عملية تنفيذ مقابل 8.37 دولارات، يكون النموذج المفتوح أرخص 35 مرة، أي 261 مهمة محلولة لكل 100 دولار من الإنفاق مقابل 9 مهام. لكنه لا يعوض هذا التوفير من ناحية السرعة: وسيط يبلغ 35 دقيقة و146 خطوة، مقابل 17 دقيقة و53 خطوة.

الخلاصة التشغيلية هي إعداد تسلسلي. يؤدي تشغيل DeepSeek V4 Pro أولًا وعدم التصعيد إلى GPT-5.6 Sol إلا عندما ترفض حزمة الاختبارات النتيجة إلى حل 83.0% من المهام بتكلفة 3.35 دولارات للمهمة — أي أعلى بعشر نقاط من Sol وحده، بل وأعلى من موجّه oracle مثالي يعمل بمحاولة واحدة، والذي يحقق 80.8%. وهناك مقارنتان أخريان من السلسلة نفسها متاحتان، إحداهما بين DeepSeek V4 Pro وClaude Fable 5، والأخرى بين DeepSeek-V4 Flash وGPT-5.6 Luna.

الاستراتيجية المُقيّمةمعدل النجاحالتكلفة لكل مهمة
GPT-5.6 Sol وحده72.7%8.37 دولارات
موجّه oracle مثالي بمحاولة واحدة80.8%
تسلسل DeepSeek V4 Pro ثم Sol83.0%3.35 دولارات

🔗 مقارنة DeepSWE من Together AI


OpenAI تطلق عملياتها في البرازيل وتنشر تجربة عشوائية مع Bocconi

27 أغسطس — تطلق OpenAI عملياتها التجارية في البرازيل، مع فريق محلي مقره ساو باولو. ويرافق الإعلان نشر بيانات استخدام قلّما تُنشر بهذا المستوى من التفصيل لكل بلد: تُعد البرازيل من أكبر ثلاثة أسواق لـ ChatGPT من حيث المستخدمين النشطين أسبوعيًا، إذ تضاعف عدد المستخدمين تقريبًا خلال عام واحد، ويُرسل نحو 215 مليون رسالة يوميًا. وفي يونيو 2026، كان 35% من الرسائل المصنفة الواردة من حسابات أفراد برازيليين مرتبطة بالعمل، مقابل 30% عالميًا. وعلى صعيد المطورين، تحتل البلاد المرتبة الثانية عالميًا من حيث عدد المطورين الذين يستخدمون OpenAI API، فيما زاد عدد مستخدمي Codex الأسبوعيين فيها بأكثر من أحد عشر ضعفًا منذ بداية 2026. ويرافق هذا التوسع عقد شراكات مع ITA وIMPA وHCFMUSP وENTER وEstímulo ومدينة ساو باولو عبر Prodam.

وفي اليوم نفسه، تنشر OpenAI، بالتعاون مع باحثين من جامعة Bocconi، نتائج تجربة عشوائية شملت أكثر من 1,000 طالب في السنة الأولى من مرحلة البكالوريوس. وتكمن أهمية البروتوكول في بنيته: وُزّع الطلاب عشوائيًا، حسب موعد المحاضرة، على أربع مجموعات — الوصول إلى ChatGPT، والتدريب على الاستدلال السببي، وكلاهما، أو لا هذا ولا ذاك — مما يسمح بفصل أثر الأداة عن أثر التدريب وأثر الجمع بينهما. وكانت المهمة عبارة عن حالة واقعية لمؤسسة: صياغة توصيات تسويقية لمتجر المنتجات التذكارية التابع للجامعة.

يُنتج التدخلان أثرين مختلفين. فالوصول إلى ChatGPT يرفع النتيجة بنحو نقطة واحدة من خمس، مع مزيد من الأفكار ومنطق أوضح. أما التدريب على الاستدلال السببي فلا يحسّن الدرجة — لكن التحليل النصي الآلي يكشف عن نطاق أفكار أوسع وأكثر تميزًا عن أفكار بقية الطلاب، وهو ما لم يقسه معيار التقييم. وتستخلص OpenAI من ذلك نتيجة غير مريحة للمؤسسات التعليمية: إذا كان الذكاء الاصطناعي يتيح إنتاج عمل مصقول وقريب من عمل الخبير، فإن فحص الإجابة النهائية وحدها يكشف بشكل متناقص عما يفهمه الطالب فعلًا.

المجموعة التجريبيةالأثر المقاس
الوصول إلى ChatGPTزيادة تقارب نقطة من خمس، وأفكار أكثر، ومنطق أوضح
التدريب على الاستدلال السببيلا تحسن وفق معيار التقييم، لكن الأفكار أكثر تنوعًا وتميزًا
الجمع بين التدخلينفوائد تراكمية وتحسن في أكبر عدد من المقاييس

🔗 الحضور في البرازيل · دراسة Bocconi


مهام ChatGPT المجدولة تُشغَّل بفعل أحداث Gmail وSlack وGitHub

25 أغسطس — تتجاوز مهام ChatGPT المجدولة النموذج الزمني البحت: إذ يمكن الآن تشغيلها بفعل حدث يقع في Gmail أو Slack أو GitHub. وتتوفر تصفية دقيقة — رسائل Gmail بحسب المُرسل أو الموضوع، وقنوات Slack محددة، ونشاط pull request بما يشمل المراجعات والتعليقات وتحديثات commits وعمليات الدمج.

يغيّر الانتقال من cron إلى الحدث طبيعة الأداة: فبدلًا من التحقق دوريًا مما إذا كان شيء ما قد حدث، يتفاعل العامل لحظة وقوعه. تتوفر الميزة على ChatGPT عبر الويب والهاتف المحمول للخطط المؤهلة، شريطة ربط التطبيق المعني والموافقة على صلاحيات الوصول المطلوبة. وهناك شرطان عمليان: يجب أن يكون تطبيق ChatGPT الخاص بـ Slack عضوًا في كل قناة خاضعة للمراقبة، ويجب أن يتمتع تطبيق GitHub المتصل بإمكانية الوصول إلى كل مستودع. وثمة قيدان أيضًا: لا يمكن لمهمة يشغلها حدث أن تتضمن كذلك جدولة زمنية، وقد تُجمع الأحداث المتقاربة في عملية تنفيذ واحدة — وعندئذ تتيح واجهة Scheduled مراجعة الأحداث المعلقة أو بدء التنفيذ يدويًا.

🔗 سجل تغييرات ChatGPT وCodex


عوامل Cursor السحابية تبدأ من دون مستودع قائم

27 أغسطس — تزيل Cursor آخر شرط لبدء استخدام عواملها السحابية: لم يعد من الضروري ربط حساب GitHub أو مزود خارجي آخر لإدارة الشيفرة المصدرية من أجل بدء جلسة. ففي محدد المستودعات، يتيح خيار «البدء من الصفر» إدخال موجّه فورًا، بينما تنشئ Cursor في الخلفية مستودع Origin لاستضافة العمل.

عندما تصبح النتيجة مناسبة، يحفظ زر «إنشاء مستودع» الناتج داخل مستودع Origin، باسم مخصص أو مقترح وبخصوصية خاصة أو داخلية؛ ويكون المستودع الناتج منظمًا بالكامل ويظهر في تبويب Codebase. وتكمل إضافتان هذه الدورة: تعيد Cursor الآن توجيه منافذ البيئة الحية للعامل السحابي إلى المتصفح، مما يتيح الوصول إلى معاينة وإلى أدوات مثل وضع التصميم، كما يُنشئ زر نشر عنوان URL متاحًا عبر الإنترنت بعد ربط حساب Vercel — إذ يُعد هذا الحساب شرطًا للميزة الأخيرة. ويعتمد كل ذلك على Origin، خدمة استضافة الشيفرة من Cursor التي دخلت مرحلة beta المبكرة في 17 أغسطس ضمن جميع الخطط المدفوعة.

🔗 سجل تغييرات Cursor


Amp تفتح مشاريعها أمام مستودعات متعددة

27 أغسطس — أصبحت مشاريع Amp تقبل الآن مستودعات متعددة. تُنسخ المستودعات الإضافية إلى مجلد مجاور داخل orb، ويُبلَّغ العامل صراحة بوجودها؛ وعندئذ تعرض لوحة التغييرات diff يشمل جميع مستودعات المشروع. وهذه هي استجابة Amp للمهام التي تمتد عبر خدمات متعددة، وهي حالة كان فيها تقسيم مستودع واحد لكل مشروع أمرًا مرهقًا.

تُضاف المستودعات عند إنشاء المشروع أو لاحقًا من الإعدادات، بحد أقصى قدره 20 مستودعًا إضافيًا لكل مشروع. وهناك قيد ينبغي معرفته قبل البدء: أثناء إعداد orb، لا يُنفّذ تلقائيًا سوى script المسمى .agents/setup من المستودع الرئيسي، ويجب دمج أي مستودع إضافي يحتاج إلى تهيئته الخاصة داخل هذا script. وفي اليوم نفسه، تواصل Amp إعادة تركيزها بإزالة الشريط الجانبي من واجهتها الطرفية — راجع الأخبار الموجزة.

🔗 المشاريع متعددة المستودعات لدى Amp


Google Antigravity 2.11.0 يعرض عناصر HTML داخل سلسلة المحادثة

26 أغسطس — تطلق Google الإصدار 2.11.0 من Antigravity، مع 10 تحسينات و30 إصلاحًا. الميزة الجديدة الرئيسية هي الواجهة التوليدية: يمكن للعامل إنشاء عنصر HTML يُعرض مباشرة داخل سلسلة المحادثة، من دون المرور بمعاينة خارجية. ويدعم العرض التنسيق الرياضي KaTeX إلى جانب رسوم Chart.js وPlotly، مما يوسع الاستخدام ليشمل لوحات المعلومات والتصورات المرئية المُنشأة لحظيًا.

تتعلق المجموعة الثانية من التغييرات بإعدادات العوامل وتتجه نحو التجزئة إلى وحدات. تتيح صيغة @path/to/file الإشارة إلى ملفات خارجية وتضمينها داخل AGENTS.md وملفات القواعد المخصصة، ويظهر مفتاح rules: في frontmatter الخاص بالعوامل المكتوبة بصيغة Markdown لربط القواعد بعامل محدد بدلًا من المشروع بأكمله، كما أصبح Antigravity يكتشف skills والعوامل والقواعد المعلنة داخل ملفات skills.json وagents.json وrules.json الموجودة في المجلدات الفرعية — وهو أمر مفيد في monorepos حيث يمتلك كل مشروع فرعي إعداداته الخاصة. أما بقية التغييرات فتتعلق بسهولة الاستخدام: طرفيات قابلة للتقسيم جنبًا إلى جنب، وعرض frontmatter بصيغة YAML كبطاقة بيانات وصفية، ونسق Darcula، وقراءة نطاقات محددة من الصفحات في المستندات متعددة الصفحات.

🔗 سجل تغييرات Antigravity


GitHub: إتاحة عامة لسياسة النماذج الشاملة ومائدة مستديرة لمشرفي OpenClaw

26 أغسطس — تتيح GitHub سياسة النماذج الشاملة بشكل عام لـ Copilot Business وCopilot Enterprise. تتيح هذه الآلية، التي أُعلن عنها في يوليو، للمسؤولين مفتاحًا واحدًا يحدد مصير النماذج التي لم يضبطوها صراحة، بدلًا من إلزامهم باتخاذ قرار بشأن كل نموذج عند كل إصدار جديد. ويستمر نشر التطبيق الفعلي حتى 1 سبتمبر، لذلك لن يحدث الانتقال في الوقت نفسه لدى جميع المؤسسات. وتبقى القرارات التي اتُخذت يدويًا كما هي، فيما لا تخضع فئتان للسياسة بصرف النظر عن قيمتها: النماذج ذات الأوزان المفتوحة، مثل DeepSeek وKimi K2، والنماذج غير المشمولة باتفاقية الاحتفاظ بالبيانات لدى GitHub، ويذكر الإعلان Fable 5. كما تدرس GitHub إزالة حالة «التفويض إلى السياسة الافتراضية» لفرض اتخاذ قرار صريح بشأن كل نموذج.

وفي 27 أغسطس، تنشر GitHub مائدة مستديرة مصورة مع مشرفي OpenClaw، يرافقها مقال يستخلص منها عشرة دروس. بدأ Peter Steinberger هذا المستودع في نوفمبر 2025 كمشروع لعطلة نهاية الأسبوع، وبحلول 26 أغسطس كان يعرض نحو 388,000 نجمة و81,000 fork وأكثر من 80,000 commit — وتقدمه GitHub بوصفه أسرع مشروع نموًا في تاريخها. وتكمن أهمية المقابلة فيما تكشفه عن عمل المشرفين عندما تدخل العوامل في الدورة: يوضح Steinberger أنه لم يعد يتحدث عن pull requests، بل عن «prompt requests»، بينما يصف Josh Lehman مساهمين يشغّلون سلاسل آلية كانت تفتح عدة مئات من pull requests. وتغيّرت مؤشرات الثقة تبعًا لذلك — سجلات العوامل، ولقطات الشاشة، وأدلة الاختبار بدلًا من عداد المساهمات — لا سيما أن السمعة نفسها أصبحت سطحًا للهجوم، إذ كان بعض الأشخاص يكررون pull requests الخاصة بغيرهم لزيادة عدد عمليات الدمج المسجلة لهم.

مؤشر مستودع OpenClaw في 26 أغسطس 2026القيمة المسجلة
النجومنحو 388,000
Forks81,000
Commitsأكثر من 80,000
إطلاق المشروعنوفمبر 2025

🔗 سياسة النماذج الشاملة · مائدة OpenClaw المستديرة


موجز الأخبار

  • إتاحة توجيه Qwen3.8-Flash عبر OpenRouter وتشغيله محليًا باستخدام 75 غيغابايت من ذاكرة RAM — أصبح النموذج متاحًا عبر OpenRouter بعد يوم واحد من فتح أوزانه، لاستخدامه في مساعدي البرمجة ومسارات العمل الوكيلة وفهم مقاطع الفيديو الطويلة. وبالتوازي، نشرت Unsloth ملفات GGUF الخاصة بها منذ اليوم الأول: إذ يعمل نموذج MoE ذو 125 مليار معلمة محليًا باستخدام 75 غيغابايت من ذاكرة RAM، وتزعم Unsloth أنه يتفوق على Claude Opus 4.6 Max — وهو ادعاء صادر عن Unsloth لا تؤكده أي قياسات مستقلة. 🔗 OpenRouter · ملفات GGUF من Unsloth
  • انضمام Grok 4.6 إلى Microsoft Foundry وإمكانية تشغيله من Linear — وصل النموذج إلى كتالوج Microsoft Foundry بسياق يبلغ 500,000 token وأربعة مستويات من جهد الاستدلال، مكمّلًا بذلك توفره على Amazon Bedrock وGoogle Enterprise Agent Platform. وعلى grok.com، تتيح مشغلات Linear لـGrok فرز التذاكر ومتابعة التقدم والبدء تلقائيًا بمجرد إسناد تذكرة إليه. 🔗 Grok على Foundry · مشغلات Linear
  • دخول Joelle Pineau وMikey تصنيف TIME100 AI لعام 2026 — أعلنت Cohere أن مديرتها للذكاء الاصطناعي مدرجة في قائمة مجلة TIME، مذكّرةً بأكثر من عشرين عامًا من الأبحاث في كندا، بدءًا من الكراسي المتحركة الذكية وصولًا إلى ML Reproducibility Checklist. وفي اليوم نفسه، أعلنت Suno إدراج Mikey في التصنيف ذاته، من دون إعلان مصاحب عن أي منتج. 🔗 Cohere · Suno
  • دليل تطبيقي يربط Claude Managed Agent بمنظومة Chat SDK من Vercel — توفر Chat SDK واجهة المحادثة مع مدير onDirectMessage محدد الأنواع وأكثر من خمسة عشر موائمًا، تشمل Slack وTeams وDiscord والويب، بينما تشغّل Managed Agents الوكيل على جانب الخادم مع جلسة دائمة لكل محادثة. نُشرت الشيفرة في مستودع claude-quickstarts. 🔗 منشور @ClaudeDevs
  • ChatGPT لنظام iOS بالإصدار 1.2026.230: البحث في المهام، ومؤشر جهد الاستدلال، ومحرر بملء الشاشة — مؤشر مدمج داخل أداة الإنشاء لضبط جهد الاستدلال من الهاتف المحمول، ومحرر بملء الشاشة للمطالبات الطويلة، وبحث يشمل العناوين والمحتويات، واختصارات على الشاشة الرئيسية لكل من ChatGPT وWork وCodex Remote. وهو إدخال سجل التغييرات نفسه الخاص بالمهام المستندة إلى الأحداث المذكورة أعلاه.
  • إزالة Amp الشريط الجانبي من واجهة TUI الخاصة بها — في ظل وجود orbs وrunners والرسائل المتبادلة بين الوكلاء، ترى Amp أن تتبع سلاسل المحادثات مكانه تطبيقات الويب والتطبيقات الأصلية، وأن إضافة تعدد إرسال لبيئات متعددة فوق تعدد الإرسال الخاص بالطرفية كانت تجربة سيئة. 🔗 تدوينة Amp
  • تشغيل Hugging Face ملخصات المستخلصات باستخدام Inkling-Small — أوضحت المنصة أن الملخصات المعروضة على صفحات الأبحاث لديها تعتمد على النموذج مفتوح الأوزان من Thinking Machines، تحت شعار «الأوزان المفتوحة × العلم المفتوح». 🔗 منشور @huggingface
  • إصلاح Gemini CLI ثغرة SSRF في اكتشاف بيانات OAuth الوصفية الخاصة بـMCP — لا يتضمن الإصدار الليلي (nightly) الصادر في 27 أغسطس سوى تغيير واحد، وهو إصلاح ضد Server-Side Request Forgery في اكتشاف بيانات OAuth الوصفية لخوادم MCP. ولم يصل الإصلاح بعد إلى القناة المستقرة التي بقيت عند الإصدار v0.57.0. 🔗 ملاحظات الإصدار
  • نشر Perplexity تقييمات جديدة لنظام Brain — حقق نظام الذاكرة ذاتية التحسين في Perplexity Computer زيادة قدرها 9.3 نقاط في الدقة، و8.0 نقاط في مواكبة المستجدات، و8.9 نقاط في الاسترجاع مقارنة بالنتائج الأولى، مع استخدام tokens أقل بنسبة 15%. 🔗 منشور @perplexity_ai
  • أسواق plugins تتيح التحديث التلقائي في المؤسسات — يسمح حقل autoUpdate موضوع في إدخال extraKnownMarketplaces لعملاء Copilot بتحديث plugins من أحد الأسواق تلقائيًا، شريطة أن يظل السوق مدرجًا في قائمة السماح strictKnownMarketplaces. 🔗 سجل تغييرات GitHub
  • حظر مستخدم يغلق الآن جميع مساهماته المفتوحة — يتيح خيار «إغلاق المحتوى الذي ألّفه هذا المستخدم» في مربع حوار الحظر إغلاق issues والمناقشات وpull requests المفتوحة الخاصة بالمستخدم المحظور دفعة واحدة، سواء في الحسابات الشخصية أو داخل المؤسسات. 🔗 سجل تغييرات GitHub
  • دفاع Cohere عن نموذج للمهندسين الميدانيين يبني قدرات العميل — تميز التدوينة بين الاعتماد التجاري أو المعماري الملازم لاختيار التقنية، والاعتماد التشغيلي الذي ترى أنه قابل للتجنب، وتستشهد بتقرير Deloitte لعام 2026 الذي يفيد بأن 25% فقط من المؤسسات وضعت في بيئة الإنتاج 40% أو أكثر من مشاريعها التجريبية للذكاء الاصطناعي. 🔗 تدوينة Cohere
  • تخصيص Google DeepMind حلقة بودكاست لموضوع عدم اليقين — يشرح Zoubin Ghahramani، نائب رئيس الأبحاث، مع Hannah Fry لماذا يؤدي تعليم النظام أن يشك في نفسه وأن يستدل بالاحتمالات إلى قرارات أكثر موثوقية، من التنبؤ بالطقس إلى الروبوتات. 🔗 منشور @GoogleDeepMind
  • إطلاق Wan تحديًا أسبوعيًا للمهارات حول WanCLI — يُختار كل أسبوع ثلاث skills منشورة على wan.video، ويحصل مؤلفوها على اشتراك مميز لمدة شهر، كما تمنح كل skill معتمدة 150 رصيدًا؛ ويجب أن تستدعي skill نموذجًا واحدًا على الأقل من نماذج Wanxiang عبر WanCLI. 🔗 منشور @Alibaba_Wan
  • GeForce NOW في Gamescom 2026 — عناصر تحكم جديدة لـDLSS 4.5، ودعم أجهزة Steam جديدة، وتسجيل الدخول الموحد عبر GOG، ومتصفح Firefox، والمزيد من أجهزة Fire TV، إلى جانب خمسة ألعاب متاحة سحابيًا فور صدورها. وهو خبر يتعلق بألعاب الفيديو أكثر من الذكاء الاصطناعي التوليدي. 🔗 تدوينة NVIDIA
  • نشر Runway مقطعًا تشويقيًا من دون تسمية منتج — مقطع فيديو مصحوب بعبارة واحدة فقط هي «لم ترَ شيئًا كهذا من قبل» ورابط عام إلى التطبيق، من دون اسم نموذج أو ميزة، ومن دون إعلان مقابل على صفحة أخبار الاستوديو. أُشير إليه للتوثيق فقط، إذ لا يمكن استخلاص أي حقيقة قابلة للتحقق منه. 🔗 منشور @runwayml

ما الذي يعنيه ذلك

ينزل الوكلاء إلى المختبر، والعائق مادي قبل أن يكون برمجيًا. لا يحل Model Hardware Standard مشكلة في النموذج، بل مشكلة في البنية التحتية: سبعة برامج من جهات مصنّعة بلا واجهة مشتركة في Janelia، وأربع عائلات من المعدات موزعة على ثلاثة حواسيب غير متوافقة في Carnegie Mellon. ومن خلال تقليص مدة التكامل من عدة أسابيع إلى بضع ساعات، تنقل Anthropic عنق الزجاجة من الاتصال إلى الإشراف — وتقر بذلك عند استشهادها بتجربة Genentech، حيث كان لا بد من توضيح أن تكوّن الرغوة في العينة عطل مادي لا خلل برمجي لـClaude. ويقول اكتشاف Ai2 المتعلق بسرطان الفصيصات الغازي الشيء نفسه من الطرف الآخر للسلسلة: فالقيمة ليست في الإجابة التي ينتجها النموذج، بل في التحقق المستقل ثم المختبري الذي أعقبها. ويكتمل هذا المثلث بإتاحة 10,000 مقعد من Claude للباحثين في اليوم نفسه، لمعالجة العائق الثالث، وهو تكلفة الوصول.

ينتقل الأمان من المنتج إلى البنية التحتية المشتركة. تكمن أهمية المقالة الداعية إلى الدفاع السيبراني الجماعي أولًا في المؤسسات المرتبطة بها: إذ تتنافس OpenAI وAnthropic وAWS وGoogle وMicrosoft وOracle على السوق نفسها، ثم تجتمع على النص نفسه. كما أن أحد المطالب الموجهة إلى مختبرات النماذج المتقدمة — جعل هويات الوكلاء قابلة للتتبع وخاضعة للمساءلة — يمثل مباشرةً الدرس المستفاد من حادثة Hugging Face المنشورة في اليوم السابق. وتتجلى هذه النقلة خلال بقية اليوم على مستوى الأدوات: يتوقف Codex عن تحميل ملفات AGENTS.md من المشاريع غير الموثوقة، ويعطّل Claude Code روابط الطرفية التي تحتوي على محارف غير مرئية، ويصلح Gemini CLI ثغرة SSRF في اكتشاف OAuth لخوادم MCP. ثلاثة إصلاحات تبدو غير مترابطة، لكنها تشير إلى خلاصة واحدة: سطح الهجوم الخاص بوكيل برمجي يتمثل في الملفات والخوادم التي يُطلب منه قراءتها.

أصبح التقييم نفسه عنصرًا ينبغي تأمينه. يحسم البرنامج التجريبي بين Google DeepMind وSingapore AI Safety Institute مفاضلة قديمة قدم التقييم الخارجي — إما تسليم مطالبات الاختبار أو تسليم الأوزان — من خلال عدم تسليم أي منهما، باستخدام بيئة معزولة يتحقق الطرفان من خصائصها تشفيريًا. ويشكل ذلك النظير المنهجي للأرقام المنشورة خلال بقية اليوم: فلا تكتفي Together AI بدرجة واحدة، بل تنشر 904 عمليات تشغيل، وأربع محاولات لكل مهمة، وأنماط الإخفاق، والتكلفة لكل مهمة؛ كما تعلن Cohere صراحة استبعاد بُعدين من ParseBench وإعادة تقييم منافسيها وفق قواعد أغسطس المصححة. وفي الحالتين، لم تعد النتيجة هي موضع التركيز، بل المنهجية — في إشارة إلى أن النتيجة وحدها لم تعد تقنع أحدًا.

وتظل تكلفة إنجاز مهمة ناجحة هي المقياس الحاسم. يستمد GLM-5.3 Flash كامل تموضعه من كفاءة معمارية — عمليات حسابية للانتباه أقل بثلاث مرات، وذاكرة KV cache أصغر بمقدار 4.4 مرات — تُترجم إلى 0.15 دولار لكل مليون token إدخال، أي أقل بنحو عشر مرات من GLM-5.2 لدى المضيف نفسه. وتبرهن Together AI أن التسلسل الذي يبدأ بـDeepSeek ثم ينتقل إلى Sol يحل مهام أكثر بعشر نقاط، مقابل أقل من نصف تكلفة استخدام Sol وحده، ما يعني أن أفضل نموذج ليس بالضرورة أفضل صفقة شراء. وتستخلص Replit النتيجة على مستوى المنتج بإلغاء اختيار النموذج تمامًا، بينما تبيع Cohere خدمة Model Vault بفارق قدره 61% عند الاستخدام الكامل، وتتقاضى Google ثلث السعر مقابل مسودة فيديو بدقة 360p. وحتى تسليم CPU Vera لدى AWS يندرج ضمن هذه المعادلة الاقتصادية: فإذا كان حمل العمل الوكيل يستهلك tokens أكثر بخمس عشرة مرة من طلب محادثة، فلن تبقى عمليات التنسيق خارج GPU مجرد تفصيل محاسبي.


المصادر