بحث

Google تعلن عن Gemini 4 Argon، وOpenAI تقول إنها أحبطت حملة تقطير، وCohere تطلق Embed 5

ai-powered-markdown-translator

مقال مترجم من الفرنسية إلى العربية باستخدام gemini-3.8-flash-medium.

عرض المشروع على GitHub ↗

الأربعاء 30 سبتمبر، أعلنت Google عن Gemini 4 Argon، وهو نموذج رائد (frontière) يُطرح أولاً للمدافعين السيبرانيين الموثوقين ضمن Fairwind Program، مع سعة إخراج تصل إلى مليون توكن. وتفيد OpenAI بأنها أحبطت حملة منسقة لاستخراج الاستدلال المحمي لنماذجها، ناسبةً جوهرها إلى أفراد مرتبطين بشركة Moonshot AI. وتطلق Cohere نموذج Embed 5 مع منهجية تقييم خاصة بها، وتعد Ideogram 4.5 بتعديلات متتالية دون تشوهات بصرية، وتطلق HeyGen نموذج فيديو مبنياً على MiniMax H3؛ ومن جهة المطورين، صدرت في اليوم نفسه نسخ Claude Code 2.1.286 وZed 1.22.0 وVS Code 1.140.


Gemini 4 Argon: النموذج الرائد الجديد من Google، متاح أولاً للمدافعين السيبرانيين

30 سبتمبر — أعلنت Google عن Gemini 4 Argon، نموذجها الرائد الجديد، في منشور كتبه Koray Kavukcuoglu، نائب الرئيس الأول في Google DeepMind ورئيس مهندسي الذكاء الاصطناعي في Google (Chief AI Architect). صُمم Argon لدعم الاستدلال المتعمق عبر تدفقات عمل طويلة ومعقدة (long-horizon workflows)، في ثلاثة مجالات رئيسية: هندسة البرمجيات في الظروف الواقعية، والعمل المعرفي في المؤسسات (المجال القانوني والمالي)، والدفاع السيبراني.

النموذج غير متاح للجمهور بعد. إذ يُطرح أولاً لمجموعة من المدافعين السيبرانيين الموثوقين ضمن Fairwind Program، الذي انطلق في 2 سبتمبر مع Gemini 3.8 Flash Cyber، والذين يتلقونه، تماماً مثل فرق Google الداخلية، دون حواجز حماية سيبرانية (cyber guardrails). وسيتبعه المطورون والمؤسسات والجمهور العام «في أقرب وقت ممكن»، بدءاً من عملاء واجهة برمجة التطبيقات (API) المشتركين والمشتركين في Google AI Ultra، دون تحديد تاريخ معلن. وحتى ذلك الحين، تعزز Google رفض الطلبات الضارة في المجالين السيبراني والـ CBRN (النووي والإشعاعي والبيولوجي والكيميائي)، وتراقب سلسلة الأفكار وإجراءات النموذج، وتعزل عمليات التدريب والتقييم عالية المخاطر في بيئات اختبار معزولة ومحكمة الإغلاق؛ كما تذكر الشركة أنها تشارك في العملية الطوعية للحكومة الأمريكية لتقييم النماذج قبل إصدارها.

Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.

🇸🇦 إليكم Gemini 4 Argon، نموذجنا الرائد الجديد. صُمم لتدفقات العمل المعقدة في البرمجة والعمل المعرفي المؤسسي والدفاع السيبراني، ويجري طرحه بدءاً من اليوم لمجموعة من المختبرين الموثوقين عبر Fairwind Program الخاص بنا. — @GoogleDeepMind على X

تم تحديد الأسعار مسبقاً: فسعر الإطلاق هو دولارين لكل مليون توكن للإدخال و10 دولارات للإخراج، وهو نفس سعر GPT-6.1 Sol الذي أُطلق في اليوم السابق، ليرتفع لاحقاً إلى 4 و20 دولاراً عند انتهاء فترة لم تُحدد مدتها؛ وتكلفة الإدخال المخزن مؤقتاً (cached) أقل بنسبة 95% من تكلفة الإدخال العادي. كما ارتفع حد الإخراج إلى مليون توكن، مقارنة بـ 64K سابقاً، وهو الأعلى في هذا القطاع وفقاً لـ Google: إذ يمكن للنموذج إنتاج مئات الآلاف من التوكنات في مسار استدلال واحد لحل مشكلة معقدة.

السعر لكل مليون توكنسعر الإطلاقالسعر بعد فترة الإطلاق
الإدخالدولارين4 دولارات
الإخراج10 دولارات20 دولاراً

تقارن صفحة Google DeepMind نموذج Argon بنماذج GPT-6 Astra وClaude Fable 5.1 وClaude Opus 5.5 عبر تسعة عشر معياراً. حقق Argon أفضل نتيجة في 13 معياراً منها، وتقاسم المركز الأول مع GPT-6 Astra في CWE-bench v1 بنسبة (68%)، وتأخر في 5 معايير. البرمجة القائمة على الوكلاء (agentic code) هي المجال الأكثر تنافساً: حيث تصدر في DeepSWE v1.1 بنسبة (77.9%) وفي Vibe Code Bench، بينما حل Argon أخيراً بين الأربعة في FrontierSWE v2 وفي Terminal-bench 4.0. ويظهر تقدمه بوضوح في العمل المعرفي، لا سيما في Legal Agent Benchmark من Harvey بنسبة (19.6% مقابل 6.7% كأفضل نتيجة للثلاثة الآخرين)، وفي السياق الطويل بين 256K و1M توكن. تم تمييز أفضل نتيجة في كل سطر بالخط العريض.

المعيار المُقيَّم (المجال)Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
Vals Index (العمل المعرفي)68.9 %63.1 %65.8 %67.0 %
AutomationBench (العمل المعرفي)51.3 %41.4 %31.4 %42.5 %
Vals Finance Agent v2 (العمل المعرفي)65.4 %53.5 %58.9 %58.6 %
Legal Agent Benchmark من Harvey (العمل المعرفي)19.6 %5.4 %6.7 %3.8 %
DeepSWE v1.1 (البرمجة الوكيلة)77.9 %74.1 %67.4 %74.2 %
FrontierSWE v2 (البرمجة الوكيلة)55.0 %65.5 %56.3 %62.3 %
Vibe Code Bench (البرمجة الوكيلة)91.9 %89.6 %90.3 %90.3 %
Terminal-bench 4.0 (البرمجة الوكيلة)57.4 %58.2 %57.9 %66.4 %
PostTrainBench (هندسة تعلم الآلة)45.3 %44.3 %40.2 %49.3 %
Terminal-Bench Science 0.1 (العلوم والرياضيات)57.6 %68.1 %52.6 %63.3 %
LABBench 2 (العلوم والرياضيات)88.8 %85.4 %68.6 %73.1 %
RiemannBench (العلوم والرياضيات)76.0 %72.0 %65.6 %69.6 %
GraphWalks BFS حتى 128K (السياق الطويل، F1)99.7 %98.7 %91.4 %90.6 %
GraphWalks BFS من 256K إلى 1M (السياق الطويل، F1)84.2 %71.8 %65.0 %66.8 %
Agent’s Last Exam (استخدام الحاسوب)39.5 %34.2 %—38.2 %
OSWorld-2.0، مجموعة فرعية غير متصلة بالإنترنت، درجة جزئية (استخدام الحاسوب)69.2 %72.6 %——
Chartography (الفهم متعدد الوسائط)71.6 %71.0 %46.2 %66.3 %
LVBench (الفهم متعدد الوسائط)91.7 %87.5 %79.7 %83.7 %
CWE-bench v1 (الأمن السيبراني)68.0 %68.0 %58.0 %67.0 %

في Google، يستخدمه آلاف الموظفين بالفعل. ففي libgav1، وهو مفكك ترميز الفيديو مفتوح المصدر التابع لـ Google، استبدل وكلاء Argon نحو 32,000 سطر من كود SIMD في عملية نقل قائمة إلى لغة Rust بكود Rust آمن: والنتيجة كانت مفكك ترميز أسرع بمقدار 2.7 مرة من ذلك النقل، مع إخراج فيديو متطابق تماماً. كما أعد وكلاء آخرون لمراكز البيانات تحسينات في إدارة الذاكرة من المتوقع أن توفر أكثر من 300 تيب بايت بمجرد نشرها. وفي الأمن السيبراني، تستخدمه Wiz ضمن مبادرتها Scan for Good: حيث اكتشف Argon ثغرة أمنية حرجة في برنامج رعاية صحية تستخدمه مستشفيات حول العالم تكشف عن بيانات شخصية حساسة، وهي ثغرة كانت قد غفلت عنها النماذج الرائدة السابقة.

🔗 Gemini 4 Argon: our next era of frontier intelligence (مدونة Google) 🔗 صفحة Gemini من Google DeepMind وجدول المقارنات المعيارية


OpenAI تقول إنها أحبطت حملة تقطير وتنسب جوهرها إلى أفراد مرتبطين بشركة Moonshot AI

30 سبتمبر — في منشور ضمن قسم Security، ذكرت OpenAI أنها رصدت ثم أحبطت حملة منسقة هدفت إلى استخراج الاستدلال المحمي (protected reasoning) من نماذجها، وهو الأثر الداخلي الذي يولده النموذج لمعالجة مهمة معينة. وتعتبر الشركة ذلك تقطيراً خصومياً (adversarial distillation): أي الاستخدام المنهجي وغير المصرح به لمخرجات نموذج أو استدلاله لتدريب نموذج آخر أو استنساخه أو تحسينه.

ووفقاً لـ OpenAI، لم يقم المشغلون بكسر التشفير، ولا باختراق قاعدة بيانات، ولا بالوصول مباشرة إلى محادثات المستخدمين المخزنة. بل تلاعبوا بتبادل الرسائل لكي يظهر الاستدلال المحمي في شكل مرئي، على سبيل المثال عبر نسخ الاستدلال المشفر من محادثة معينة والطلب من النموذج، في محادثة أخرى، فك تشفيره وتدوينه نصياً. وكان باحثون مستقلون قد أبلغوا عبر الكشف المسؤول عن ثغرات أمنية مماثلة، وُصفت في ورقة بحثية بعنوان «Stealing Reasoning Traces from Proprietary LLM APIs» نُشرت على arXiv في 10 أغسطس؛ وتؤكد OpenAI أن مسارات الهجوم تلك كانت حقيقية.

مرحلة الحملةالتاريخ أو الحجم المسجل من قِبل OpenAI
بداية النشاط، بحجم منخفض1 يوليو
ذروة النشاط24 و25 يوليو
الطلبات التي اتبعت نمط الاستخراج أثناء الذروة16,000 طلب، واردة من أكثر من 4,000 مستخدم
المجموعة المرتبطة بهذا النمطأكثر من 15,000 مستخدم
التحييد الكامل للمجموعة28 يوليو

أما بشأن توجيه الاتهام، فيبقى المنشور حذراً: إذ لم يثبت أن جميع المشغلين يتبعون جهة فاعلة واحدة، والطلبات البالغ عددها 16,000 في أوقات الذروة هي محاولات استخراج لم تكن بالضرورة ناجحة كلها. ومع ذلك، تنسب OpenAI جوهر النشاط إلى أفراد مرتبطين بشركة Moonshot AI، المطورة لنموذج Kimi.

… we attribute a core cluster of the activity to individuals associated with Moonshot AI …

🇸🇦 … ننسب جوهر هذا النشاط إلى أفراد مرتبطين بشركة Moonshot AI … — OpenAI، منشور في قسم Security

واستجابةً لذلك، قامت OpenAI بحظر الحسابات الاحتيالية أو تقييدها، وتشديد ضوابط التسجيل والبنية التحتية، وتوسيع نطاق مراقبة الشبكات ذات الصلة، وتعزيز حماية الاستدلال المخفي بين المستخدمين ومساحات العمل والمؤسسات وعائلات النماذج. كما أغلقت مساراً كان يسمح بإعادة تشغيل الاستدلال المشفر لمستخدم آخر للكشف عن محتواه، وأضافت ضوابط ترصد وتمنع الإخراج المتدفق (streaming) الذي يُحتمل أن يكشفه. وتمت مشاركة هذه النتائج عبر Frontier Model Forum والقنوات الحكومية: فوفقاً لـ OpenAI، لا تقتصر هذه التقنية على نماذجها وحدها، وأي نظام يجعل الاستدلال قابلاً للنقل أو إعادة التشغيل يمكن أن يكون عرضة لمخاطر مماثلة. وتصف الشركة التقطير الخصومي بأنه يشكل خطراً على السلامة والأمن القومي، إذ يمكن استخدام الاستدلال المستخرج لتدريب نموذج آخر دون حواجز الحماية الموجودة في النموذج الأصلي. وهذا الموضوع ليس جديداً: ففي فبراير، نسبت Anthropic حملات تقطير إلى DeepSeek وMoonshot AI وMiniMax، وباتت Anthropic تفرض رسوماً منذ 24 سبتمبر على الطلبات المحظورة ضمن عدة فئات، بما في ذلك استخراج الاستدلال.

🔗 مقال «Stealing Reasoning Traces from Proprietary LLM APIs» على arXiv


التضمينات (Embeddings): Cohere تطلق Embed 5 ومقياس RCP-nDCG@10، وPerplexity تنشر pplx-embed-v2-context-9b-preview

30 سبتمبر — أطلقت Cohere عائلة نماذج Embed 5، وهي عائلة نماذج تضمينات مخصصة للبحث في المؤسسات، في مستويين يشتركان في مساحة التضمينات نفسها: Embed 5 Pro للجودة القصوى والفهرسة غير المتصلة بالإنترنت (offline)، وEmbed 5 Fast للبحث التفاعلي، وأنظمة RAG ذات الحجم الكبير، والبحث القائم على الوكلاء (agentic search). يمكن فهرسة مجموعة نصوص باستخدام Pro ثم الاستعلام عنها باستخدام Fast دون الحاجة إلى إعادة فهرسة أي شيء، بشرط الحفاظ على بُعد المخرجات نفسه: على 40 مجموعة بيانات تطويرية، يحافظ هذا المخطط الموصى به من Cohere في المتوسط على 98.4% من جودة نظام يعتمد بالكامل على Pro، مقابل 96.6% لنظام يعتمد بالكامل على Fast.

يقرأ كلا النموذجين ما يصل إلى 128K توكن، ويقبلان النصوص والصور أو كليهما مدمجين في متجه واحد، ويغطيان أكثر من 100 لغة، وينتجان متجهات تتراوح أبعادها بين 256 و2,048 بعدًا بصيغ float أو int8 أو ثنائية (binary). تنصح Cohere باستخدام 1,024 بعدًا بصيغة int8، أي 1 كيلوبايت لكل متجه مقابل 8 كيلوبايت بصيغة float32 عند 2,048 بعدًا. تبلغ تكلفة Pro‏ 0.12 دولار لكل مليون توكن نصي وFast‏ 0.08 دولار، أي أقل بمقدار الثلث، مع إنتاجية معالجة مستندات أعلى بمقدار 2.4 مرة في المتوسط؛ بينما يتم احتساب تكلفة الصور بمعدل 0.40 دولار لكل مليون توكن لكلا النموذجين. يتوفر Embed 5 ابتداءً من اليوم عبر واجهة برمجة تطبيقات Cohere، وModel Vault، وMicrosoft Foundry، وAmazon SageMaker، وكذلك في North، ويمكن نشره بشكل خاص عبر vLLM.

معيار التقييم (المقياس)Embed 5 ProEmbed 5 Fastنماذج أخرى مذكورة
ViDoRe V3،‏ 8 مجالات (RCP-nDCG@10)85.884.5‏Voyage 4 Large‏ 83.7؛ Gemini Embedding 2‏ 83.2؛ OpenAI text-embedding-3-large‏ 75.5
FinanceBench (RCP-nDCG@10)80.180.0‏Pro متقدم بفارق 21.4 نقطة على OpenAI text-embedding-3-large
FinQA (RCP-nDCG@10)90.088.8—
ViDoRe V3 Finance (RCP-nDCG@10)85.083.9—
ملفات PDF محللة، متوسط الحزمة (RCP-nDCG@10)84.883.4‏Voyage 4 Large‏ 83.6؛ Gemini Embedding 2‏ 80.8؛ Embed 4‏ 78.6
نص وصورة مدمجان، 5 مجموعات (nDCG@10)82.381.2‏Gemini Embedding 2‏ 61.3
صورة صفحة، 5 مجموعات مالية (nDCG@10)77.073.2‏Embed 4‏ 71.1؛ Voyage Multimodal 3.5‏ 70.1؛ Gemini Embedding 2‏ 56.7
5 لغات أوروبية (nDCG@10 أو RCP-nDCG@10)77—‏Voyage 4 Large‏ 76؛ Gemini Embedding 2‏ 73

تم التعبير عن معظم هذه الدرجات بمقياس RCP-nDCG@10، وهو أسلوب التقييم الذي نشرته Cohere في اليوم نفسه (انظر أدناه): توضح ملاحظة في التدوينة أنه يعيد ترتيب مجموعة ثابتة من المرشحين، وبالتالي يقيس جودة الترتيب بدلاً من الاسترجاع من المستوى الأول. يستحق الجدول الثاني متعدد اللغات قراءة كاملة: تسلط Cohere الضوء فيه على تقدمها مقارنة بـ Embed 4، بما يصل إلى 13 نقطة في اللغة الفارسية، ولكن من بين هذه اللغات العشر، يتفوق Gemini Embedding 2 على Embed 5 Pro في تسع منها، مع استثناء اللغة الصينية وحدها، ويتفوق عليه Voyage 4 Large في خمس منها. ستستعرض Cohere نموذج Embed 5 خلال جلسة على منصة X في 8 أكتوبر.

🔗 تدوينة Embed 5 من Cohere · إعلان @cohere على X

RCP-nDCG@10، المقياس الذي تقيس به Cohere نموذج Embed 5

30 سبتمبر — نشرت Cohere أيضًا RCP-nDCG@10 (Rubric-Calibrated Preferences nDCG@10)، وهي طريقتها لتقييم البحث. نقطة البداية: nDCG، وهو مقياس MTEB وBEIR، يقارن النتائج بقائمة من المستندات المشروحة مسبقًا، والتي تكون غير مكتملة بطبيعتها، لدرجة أن أي مستند ذي صلة لم يسبق شرحه لا يحقق أي نقاط؛ في دراسة Cohere، اعتبر البشر 28% من المستندات المصنفة على أنها غير ذات صلة مفيدة في الواقع. يُسند RCP-nDCG@10 مهمة التقييم إلى مقيّم ذكاء اصطناعي مُعاير، يجيب على خمسة أسئلة موحدة بنعم/لا لكل استعلام ويقارن المستندات في مجموعات. أُجريت عملية تحقق مزدوجة التعمية مع 46 مصنفًا على 289 مواجهة ثنائية: عندما يُحدد المقياسان فائزين مختلفين، يتفق البشر مع RCP-nDCG في 70% من الحالات. تم نشر الورقة البحثية والكود والبيانات، وأعلن المشرف الرئيسي على MTEB عن دمجه. وذكرت Cohere أنها حسّنت الجيل الخامس من Embed وRerank بالاعتماد على هذا المقياس، مع الإشارة إلى أن Rerank لم يُحدد موعد إطلاقه بعد، ونبهت إلى أن هذه النماذج قد لا تظهر دائمًا كالأفضل استنادًا إلى مقياس nDCG التاريخي وحده.

🔗 تدوينة RCP-nDCG@10 من Cohere · الكود والبيانات على GitHub

Perplexity تنشر pplx-embed-v2-context-9b-preview ومعيار context-bench

30 سبتمبر — نشرت Perplexity في إصدار للمعاينة، بموجب ترخيص MIT على Hugging Face، نموذج pplx-embed-v2-context-9b-preview، وهو نموذج تضمينات سياقية: يتم فيه ترميز كل مقطع من المستند مع إبقاء المستند بأكمله في الحسبان، لضمان بقاء مقطع يتضمن ضميرًا مثل “هي” مرتبطًا بالكيان الصحيح. وبدلاً من الاعتماد على مقطع “ذهبي” واحد (gold passage) لكل استعلام، يتعلم النموذج من نموذج معلّم، وهو نموذج ضغط السياق الخاص بـ Perplexity، والذي يمنح درجات لكل توكن في المستند: وبذلك يتعلم استرجاع الإجابة والمقاطع التي تدعمها. وعند تقييمه بنظام التعمية على context-bench، وهو معيار تقييم خاص بشركة turbopuffer المشاركة في توقيع التدوينة (2,099 استعلامًا، 38,894 مستندًا)، تفوق على voyage-context-4؛ وعلى ConTEB، حقق أفضل متوسط عام دون الفوز بجميع المهام. ونبهت Perplexity إلى أن الأوزان وواجهة الاستخدام قد تتغير لاحقًا، وتستعد لإتاحة الوصول عبر واجهة برمجة التطبيقات الخاصة بها، دون تحديد موعد.

المقياس المنشور بواسطة Perplexitypplx-embed-v2-context-9b-previewالفارق مقارنة بـ voyage-context-4
استرجاع الإجابة على context-bench، عند K = 1045.5%+14.4 نقطة
استرجاع الأدلة على context-bench، عند K = 1040.6%+5.0 نقاط
التخزين لكل متجه (1,024 بعدًا، int8)1 كيلوبايتأقل بـ 8 مرات مقارنة بـ voyage-context-4 بصيغة float32

🔗 تدوينة Perplexity Research · النموذج على Hugging Face


Ideogram 4.5: نموذج لتعديل الصور مُصمم للتحسينات المتتالية

30 سبتمبر — أطلقت Ideogram نموذج Ideogram 4.5، الذي تقدمه بوصفه “نموذج التعديل الأكثر دقة”. الملاحظة الأولية: مع كل تعديل، تضيف نماذج الصور عيوبًا بصرية (artefacts)، وإزاحات في البكسل، وانحرافات في الألوان، لدرجة أن الصورة تصبح سريعًا غير صالحة للاستخدام بعد عدة مراحل تعديل. صُمم Ideogram 4.5 للقضاء على هذا التراكم وإتاحة إمكانية التعديل متعدد الجولات (multi-turn editing).

Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.

🇸🇦 إليكم Ideogram 4.5، نموذج التعديل الأكثر دقة. فمع كل تعديل، تضيف أحدث النماذج عيوبًا بصرية، وإزاحات في البكسل، وتغيرات في الألوان. يقضي Ideogram 4.5 على تراكم العيوب، مما يجعل التعديل متعدد الجولات أمرًا ممكنًا. متوفر الآن في Ideogram، وعبر واجهة برمجة التطبيقات ولدى شركاء الإطلاق. وستتاح الأوزان المفتوحة قريبًا. — @ideogram_ai على X

ولدعم هذه النقطة، نشرت Ideogram مقارنة جنبًا إلى جنب لنفس التعديلات المتتالية باستخدام GPT Image 2.5 Sunburst وNano Banana Pro وNano Banana 2، والتي تصبح مخرجاتها، وفقًا لها، غير قابلة للاستخدام بعد تعديلات قليلة. المقارنة بصرية بحتة، دون درجات رقمية. تشمل الأمثلة اللون والإضاءة (تتبع الظلال والانعكاسات والإضاءات الساطعة التغييرات دون التأثير على التكوين)، وتعديل النصوص، وتصوير المنتجات، والتصميم الداخلي، وترميم الصور القديمة خطوة بخطوة، والتحويل من رسم تخطيطي أو خريطة عمق إلى صورة، وإعادة التأطير.

يقدم النموذج أيضًا ميزة التعديل بأي دقة (Zoom editing): حيث يمكن تعديل منطقة من صورة عالية الدقة، تصل إلى 24.2 ميجابكسل (4,016 × 6,016 بكسل) في مثال Ideogram، دون تصغير حجم الصورة، مع الحفاظ على حوافها لإعادة دمجها بسلاسة تامة. ورغم أنه مصمم للتعديل المستهدف، فإن النموذج يؤدي أداءً ممتازًا أيضًا في مهام التعديل العامة، وفقًا لـ Ideogram.

عنصر الإعلانما هو معروف عنه
التوفرابتداءً من 30 سبتمبر في Ideogram وعبر واجهة برمجة التطبيقات
شركاء الإطلاق‏Pika وLuma، اللتان أعلنتا عنه في اليوم نفسه
الأوزان المفتوحةوُعد بتقديمها “قريبًا”، مثل أوزان Ideogram 4.0 التي نُشرت في يونيو
الأسعارلم تُنشر بعد

🔗 صفحة نموذج Ideogram 4.5


HeyGen Video: نموذج فيديو مبني على MiniMax H3، ومتاح عبر واجهة برمجة التطبيقات

30 سبتمبر — أطلقت HeyGen نموذج HeyGen Video، وهو نموذج لتوليد الفيديو مخصص للشركات التي ترغب في الحصول على فيديو بجودة إنتاجية دون دفع تكلفتها المرتفعة. صُمم النموذج بالاعتماد على MiniMax H3 وخضع لتدريب لاحق بواسطة HeyGen، ويقوم بإنشاء فيديو انطلاقًا من نص أو صورة، مع توليد الصوت في الاستدعاء نفسه، ويمكن استخدامه عبر واجهة برمجة تطبيقات HeyGen بالإضافة إلى OpenRouter وRunware وComfyUI.

فيما يتعلق بالأسعار، تتواجد ثلاثة أرقام جنبًا إلى جنب. يبدأ السعر من 0.01 دولار لكل ثانية حتى نهاية شهر أكتوبر، وهو ما يمثل خصمًا بنسبة 50% على السعر القياسي البالغ 0.02 دولار، وفقًا لصفحة الكتالوج. بينما تعتمد شبكة المقارنة الخاصة بها على سعر الكتالوج بدقة 768p مع الصوت، قبل العروض الترويجية للإطلاق: 0.03 دولار لكل ثانية. وحتى بهذا السعر، يُعد HeyGen Video هو الأقل تكلفة بين النماذج المقارنة.

النموذج المقارَنسعر الكتالوج للثانية (768p، صوت)تصنيف Elo الداخلي لـ HeyGen (HeyGen Video = 1,000)
HeyGen Video0.03 دولار1,000
Seedance 2.00.303 دولار955
H3 Max0.08 دولار952
H3 Max Turbo0.04 دولار920
H3 Max balanced0.08 دولار860
Kling 3.0 Pro0.168 دولار857
Veo 3.10.40 دولار744

فيما يخص الجودة، تستند HeyGen إلى تقييم داخلي أُجري على استعلامات من Artificial Analysis Arena (4,800 صوت)، مع ضبط تصنيف Elo عند 1,000 لنموذجها. وفي التفضيل بنظام التعمية أمام H3 Max، ذهبت 55.8% من أصل 650 صوتًا إلى HeyGen Video، ضمن نطاق يتراوح بين 49 و62%، وهو ما لا يستبعد احتمال التعادل. وبالنسبة لمقطع فيديو مدته 10 ثوانٍ يتم تحويله من صورة إلى فيديو، ينخفض زمن الاستدلال لمحمول الانتشار (diffusion transformer) إلى 3.7 ثانية، مقارنة بـ 4.1 ثانية لـ H3 Max Turbo و8.3 ثانية لـ H3 Max، دون احتساب وقت التسمية التوضيحية.

أشادت MiniMax بهذا الإطلاق وسلطت الضوء في اليوم نفسه على نموذج آخر مشتق من H3: وهو Boreal-H3 من Creatify، وهو نموذج فيديو محسّن للإعلانات.

🔗 كتالوج HeyGen Video · إعلان @HeyGen على X


المساعدون والوكلاء العامون: مهارات Gemini، وManus Flex، وGrok Bot

تطبيق Gemini يطلق المهارات (skills)، والتي ستحل محل الـ Gems

30 سبتمبر — أطلقت Google المهارات في تطبيق Gemini: وهي تعليمات يتم حفظها مرة واحدة، واستدعاؤها بكتابة شرطة مائلة متبوعة باسمها. يستطيع Gemini أيضًا إنشاء مهارات انطلاقًا من المحادثات وتشغيلها تلقائيًا عندما يتطابق المطالبة (prompt)، ويمكن تجميع مهارات متعددة معًا، ويمكن لكل مهارة تضمين ملفات مرجعية (نص عادي، PDF، صور). بعد توفرها بالفعل في Gemini Spark، أصبحت تصل إلى محادثة Gemini في جميع أنحاء العالم، لجميع فئات اشتراكات Google AI، وحاليًا للمستخدمين بعمر 18 عامًا فما فوق؛ وسيتبعهم عملاء Workspace في الأسابيع المقبلة. ستحل المهارات محل الـ Gems، التي ستتوقف تدريجيًا بدءًا من نوفمبر للحسابات الشخصية، وفي مارس 2027 لخطط Workspace للأعمال والمؤسسات والمؤسسات غير الربحية، وفي يونيو 2027 للتعليم، مع ترحيل تلقائي. كما ستُغلق أداة Opal المخصصة لإنشاء التطبيقات الصغيرة في نوفمبر، وكذلك “Gems by Google Labs”، والتي لن يتم ترحيلها.

🔗 دع المهارات في Gemini تتولى مهامك الأكثر تكرارًا (مدونة Google)

Manus Flex: استخدام مفتاح API الخاص بك في وكيل Manus

29 سبتمبر — أطلقت Manus ميزة Manus Flex، التي تتيح تشغيل وكيل Manus باستخدام مفتاح API الخاص بمزود استدلال مدعوم (bring your own API key). حتى الآن، كانت Manus تختار النموذج بنفسها وتوفر بيئة التشغيل والبنية التحتية الخاصة بالوكيل؛ ومع Flex، يغذي مفتاح المزود المشاريع والأدوات وبيئات التشغيل ومسارات عمل الوكلاء نفسها، مع إمكانية اختيار النموذج الرئيسي ومستوى جهد الاستدلال والتفكير. وتُقسَّم الفوترة: حيث يفوتر المزود الاستدلال مباشرة، بينما تستمر الخدمات الأخرى والبنية التحتية المستخدمة في المهمة في استهلاك أرصدة Manus. وتُعد OpenRouter وFireworks وModal الأعضاء الثلاثة الأوائل في برنامج شركاء الاستدلال (Manus Flex Inference Partner Program). لم يقدم المنشور، الصادر غداة إطلاق Manus 2.0، أي صيغة اشتراك أو تسعير أو قائمة بالنماذج المدعومة.

🔗 تقديم Manus Flex

Grok Bot يُسند البرمجة إلى Cursor ويدير طلبات السحب (pull requests)

30 سبتمبر — بعد يومين من إطلاق Team Bots، عززت SpaceXAI روبوت Grok Bot لمهام تطوير البرمجيات. وفي سلسلة منشورات عبر حساب @bot، أعلنت الشركة أن روبوتاتها يمكنها إسناد مهام البرمجة إلى Cursor، وإدارة طلبات السحب بفضل إضافات GitHub وOrigin (الأخير لم يتم تقديم تفاصيل عنه)، ومشاركة عروض توضيحية بالفيديو لما تقوم ببنائه. كما نشرت SpaceXAI، في شكل قوالب قابلة للتثبيت (templates)، روبوتات فريق الهندسة التابع لها، حيث يأتي كل منها مزودًا بمهاراته وروتيناته وموصلاته الخاصة. لم تحدد السلسلة أي خطة اشتراك أو سعر أو موعد، ولم ترافقها أي تدوينة على x.ai. الارتباط مع Cursor ليس جديدًا: فقد تم تقديم Grok Bot for Enterprise مجانًا لمدة أسبوعين لعملاء Grok وCursor Enterprise في أوائل سبتمبر؛ والجديد الآن هو أن الروبوت يفوّض عمل البرمجة بنفسه.

🔗 سلسلة منشورات @bot على X


الروبوتات ونماذج العالم: Praxis-1 من Runway، وMolmoAct 2 من Ai2، وPhysis-Lang من NVIDIA

Runway تقدم Praxis-1، نموذج حركة للعالم بأوزان مفتوحة

30 سبتمبر — تقدم Runway نموذج Praxis-1، أول نموذج حركة للعالم (world action model) بأوزان مفتوحة لديها، والمخصص للتحكم في روبوتات حقيقية. يعتمد النموذج على نفس التدريب المسبق على الفيديو المستخدم في نماذج العالم الخاصة بها، مثل Solaris أو GWM Worlds 2، ويهدف إلى أن يكون نموذج سياسات عامًا لمطوري وباحثي الروبوتات. رهان Runway: العروض التوضيحية للروبوتات نادرة، بينما الفيديو غير محدود تقريبًا. وتنتقل السياسة نفسها من استوديو إلى مطبخ دون إعادة تدريب في عروضها التوضيحية. لا شيء متاح للتنزيل بعد: يخضع Praxis-1 للاختبار لدى Noble Machines وStandard Bots وUltra، كلٌّ على عتاده الخاص، وأُعلن عن إطلاقه للجمهور، متضمنًا الأوزان، خلال الأشهر المقبلة.

المقياس المنشور بواسطة Runwayالنتيجة المعلنة
الارتباط بين المحاكاة في نموذج العالم والنتائج الحقيقية0,95
خطأ الموضع النهائي بعد الضبط، باستخدام فيديو الويب16,1 سم
الخطأ نفسه باستخدام فيديو الروبوت المُشغَّل عن بُعد16,0 سم

🔗 Praxis-1 على Runway Research

MolmoAct 2 من Ai2 في صدارة Reality Check، بعد الضبط الدقيق من قِبل منظم المعيار

30 سبتمبر — تعلن Ai2 أن MolmoAct 2، نموذجها الروبوتي المفتوح بالكامل، يحتل المركز الأول في نسبة النجاح الإجمالية على Reality Check، وهو معيار مستقل للتعامل اليدوي في ظروف حقيقية، مع فارق جوهري: النماذج يتم ضبطها دقيقًا هناك بواسطة الجهة المنظمة، Poke & Wiggle، على مهام المعيار. أُطلق Reality Check في اليوم السابق من قِبل هذه الشركة، ويشمل 14,400 عملية تشغيل على روبوتات حقيقية، عبر محطات FR3 Duo مثبتة في Deutsches Museum في ميونيخ، ضمن عشر بيئات (فرز البراغي، توصيل موصل DC، فتح صندوق أدوات باستخدام مفك براغي…). ويبقى مساران «قيد الانتظار»: وضع كائنات خارج نطاق التدريب، وتدريب نصفي على 100 ساعة من بيانات المحطات.

النموذج المُقيَّمالنجاح الإجماليالنجاح بعد حوالي 10 عروض توضيحية لكل بيئةالنجاح بعد حوالي 300 عرض توضيحي لكل بيئة
MolmoAct 228 %4 %44 %
Pi 0.521 %5 %33 %
DiT-Flow19 %2 %29 %
GR00T N1.712 %4 %19 %

🔗 تغريدة Ai2 · تصنيف Reality Check

Physis-Lang: تعليقات توضيحية تشرح الفيزياء لنماذج العالم

29 سبتمبر — ينشر باحثون من NVIDIA وMIT وجامعة Oxford إطار Physis-Lang، وهو إطار يضيف الاستدلال الفيزيائي إلى التعليقات التوضيحية لمقاطع الفيديو لتحسين نماذج العالم. تجعل التعليقات التوضيحية الأسباب والقوانين الفاعلة والنتائج واضحة وصريحة؛ ويرصد ناقد متخصص الادعاءات المفقودة أو غير المدعومة، ويضبط وكيلٌ تعليمات كتابة الشروح، في حين تُستخدم إخفاقات النموذج للبحث عن مقاطع فيديو تسد ثغراته. ووفقًا لـ NVIDIA، فإن إضافة هذا الاستدلال إلى التعليمات البرمجية النصية (prompt) وحدها، دون إعادة تدريب، يحسّن نتيجة PhyGenBench لنموذج Cosmos 3 بمقدار 5,62 نقطة. ومع التدريب، يحتل Physis-Lang على Cosmos3-Super وCosmos3-Nano أول مركزين في تصنيف Physics-IQ Verified في تحويل الصورة إلى فيديو (48,2 و43,3، مقابل 42,7 لأفضل نتيجة سابقة). يتم تقييم PhyGenBench وVideoPhy-2 بواسطة GPT-5.5، ويحتفظ Veo 3.1 بأفضلية طفيفة على المجموعة الكاملة لـ VideoPhy-2.

معيار فيزياء الفيديوCosmos3-NanoVeo 3.1Physis-Lang على Cosmos3-Nano
PhyGenBench61,6765,6371,04
Physics-IQ Verified40,2334,9943,41
VideoPhy-2 Hard48,3158,4362,36
VideoPhy-2، المجموعة الكاملة60,4168,8768,02

🔗 صفحة مشروع Physis-Lang · إعلان @NVIDIAAI على X


النماذج المفتوحة: Hunmin-397B-A17B-CUA وJEV-27B-VL

Hunmin-397B-A17B-CUA يدمج قدرات الوكيل من Qwen-CUA في MoE بسعة 397 مليار معامل

30 سبتمبر — على مدونة مجتمع Hugging Face، يوضح hojun Lee تفاصيل Hunmin-397B-A17B-CUA، وهو نموذج لاستخدام الكمبيوتر (computer use) نُشر بموجب ترخيص Apache-2.0 من قِبل منظمة mncai، مع تحفظ أبداه المؤلفون أنفسهم: التقييمات أُجريت داخليًا، بتشغيل واحد فقط لمعايير الوكلاء، وهي غير قابلة للمقارنة مع التصنيفات المنشورة (يحصل النموذج الأساسي هناك على 48,16 على OSWorld، مقارنة بـ 62,2 معلنة على OSWorld-Verified). يعتمد النموذج على Qwen3.5-397B-A17B، وهو مزيج من الخبراء (MoE) بـ 17 مليار معامل نشط، وأُنجز المشروع بأكمله على عقدة واحدة تضم ثمانية معالجات B200. قام الفريق بحساب فرق الأوزان بين قاعدته وQwen-CUA المتخصص بالفعل، وقام فقط بزرع نسخة منخفضة الرتبة منها على مجموعة مختارة من الوحدات: هذا النقل وحده رفع OSWorld-316 من 48,84 إلى 68,25، دون أن يرث نقطة ضعف Qwen-CUA في التثبيت البصري. وتضيف عملية الضبط الدقيق تليها مرحلة التعلم المعزز GRPO نحو 4,3 نقطة.

معيار التقييم (بروتوكول داخلي)الأساس Qwen3.5-397BHunmin-CUAQwen-CUA (المصدر)
OSWorld، 360 مهمة48,1670,4577,12
WindowsAgentArena، 153 مهمة41,7750,8556,68
ScreenSpot-Pro72,7475,6162,20
KMMLU-Pro (الكورية)77,9176,1271,41

🔗 منشور Hunmin-CUA · الأوزان على Hugging Face

AutoTrust AI تنشر JEV-27B-VL، نموذج اتخاذ قرار مفتوح يقيّم الصور أيضًا

30 سبتمبر — تنشر AutoTrust AI بموجب ترخيص Apache-2.0 نموذج JEV-27B-VL، وهي النسخة المزودة بالرؤية من JEV-27B، نموذجها المفتوح لاتخاذ القرارات الذي قُدم في 27 سبتمبر. يُعرض عليه نص وصور، ويُطرح عليه سؤال، فيجيب بتمريرة واحدة مع احتمالية معايرة لكل خيار، في غضون مئة ميلي ثانية تقريبًا؛ وعندما يتطلب السؤال ذلك، فإنه يستدل خطوة بخطوة أثناء النظر إلى الصور. ومع ذلك، لم ترَ رأس اتخاذ القرار فيه أي صور أثناء التدريب. الاختبار الرئيسي: في MicroLens، وهي مجموعة بيانات عامة لتطبيقات مقاطع الفيديو القصيرة، يقوم بترتيب 20 مقطع فيديو مرشح لـ 200 مستخدم بناءً على الصور المصغرة وحدها، ويتساوى في قياس AUC مع التصفية التشاركية المدربة على 59,045 مستخدمًا، مع نسبة أفضل للفيديو المناسب ضمن أفضل 5 نتائج. ويذكّر المؤلفون بأن هذه النتيجة مستمدة من مجموعة واحدة تضم 200 مستخدم.

طريقة التوصية على MicroLensAUCالفيديو المناسب ضمن أفضل 5
JEV-27B-VL، صور مصغرة فقط، دون بيانات تفاعل0,72759 %
تصفية تشاركية مدربة على 59,045 مستخدمًا0,72849 %
JEV-27B-VL، عناوين فقط0,64946 %
ترتيب عشوائي0,48921 %

🔗 منشور JEV-27B-VL


لوحات الصدارة: Open TTS Leaderboard من Hugging Face وAURORA من LILT

Hugging Face تطلق Open TTS Leaderboard، تصنيفًا مفتوحًا لتحويل النص إلى كلام

30 سبتمبر — تطلق Hugging Face تصنيف Open TTS Leaderboard، وهو تصنيف لتحويل النص إلى كلام (text-to-speech, TTS) يركز على النماذج المفتوحة ومتعددة اللغات. يضم Hub أكثر من 8,000 نموذج TTS، لكن ساحات التصويت المرجعية تواجه صعوبة في مواكبة الوتيرة وتعاني من نقص تمثيل النماذج المفتوحة: وفقًا للمنشور، 16 نموذجًا فقط من أصل 92 نموذجًا مصنفًا بواسطة Artificial Analysis هي نماذج ذات أوزان مفتوحة. ولذلك، يستبدل التصنيف عمليات التصويت بمقاييس موضوعية: وضوح الصوت (معدل الخطأ في الكلمة أو الحرف بين النص المطلوب وتفريغه الصوتي بواسطة Qwen3 ASR)، والسرعة (الاستدلال المجمع وزمن التأخير حتى أول صوت، على معالجات H200 وعلى وحدات المعالجة المركزية)، ودقة مطابقة الصوت المستنسخ (تشابه WavLM). يستغرق تقييم نموذج بضع ساعات بدلًا من بضعة أسابيع من التصويت. في اللغة الإنجليزية، يتصدر Kokoro-82M وsupertonic-3 وs2-pro من Fish Audio؛ وفي النماذج متعددة اللغات، يتصدر OmniVoice وs2-pro وFun-CosyVoice3-0.5B. وينبه المؤلفون إلى أنه لم يتم قياس العفوية ولا التعبيرية، وسينشرون نصوص التقييم البرمجية الخاصة بهم «قريبًا».

🔗 منشور Open TTS Leaderboard · التصنيف على Hugging Face

LILT تطلق AURORA، تصنيفًا متعدد اللغات لمهام الوكلاء

30 سبتمبر — تطلق LILT تصنيف AURORA، وهو لوحة صدارة تقيس النماذج المتقدمة في مهام الوكلاء غير الإنجليزية، وجميعها مصممة ومدققة بواسطة خبراء ناطقين باللغة كأم، دون استخدام الترجمة الآلية. يفتتح التصنيف بأربعة معايير: معيار Terminal-Bench متعدد اللغات يضم 324 مهمة برمجية بعشر لغات، ونسخة متعددة اللغات من τ³-bench لدعم العملاء، وMultiChallenge لاتباع التعليمات في السياقات الطويلة، وGAIA-v2-LILT للاستدلال القائم على الوكلاء. يتصدر Claude Opus 5.5 معيار Terminal-Bench متعدد اللغات ويأتي في مقدمة τ³-bench في كل لغة من اللغات الخمس. في GAIA، تكتسب النماذج في المتوسط 20,7 نقطة في النسخة المدققة بواسطة LILT مقارنة بالترجمة الآلية: بالنسبة لـ LILT، يقيس هذا الفارق الخطأ الناتج عن الترجمة. كما تستهلك المحادثة نفسها ما يقرب من 1,4 ضعف من الرموز (tokens) باللغة الكورية أو العربية مقارنة باللغة الإنجليزية.

النموذج المُقيَّم (Terminal-Bench متعدد اللغات، مقتطف)متوسط النجاح
Claude Opus 5.5 (effort high)76,4 %
Claude Opus 5 (effort high)73,5 %
Gemini 3.8 Flash67,3 %
GPT-6 Sol64,8 %
Command A+4,3 %

🔗 منشور AURORA من LILT · تصنيف AURORA


القطاع العام والشركات: Claude for Government، ووكيل المبيعات من Anthropic، وOpenAI مع America’s SBDC

Claude for Government يدخل مرحلة الإتاحة العامة

30 سبتمبر — يخرج Claude for Government من المرحلة التجريبية (بيتا): تعلن Anthropic عن إتاحته العامة للوكالات الفيدرالية ووكالات الولايات الأمريكية. توفر المنصة، التي كانت في مرحلة تجريبية عامة منذ يوليو، قدرات البرمجة والعمل القائم على الوكلاء لـ Claude ضمن بيئة معتمدة بمستوى FedRAMP High، مع وظائف تضاهي تلك المتوفرة للعملاء التجاريين؛ كما يصل كل من CLI الخاص بـ Claude Code وClaude for Microsoft 365 في وصول مبكر. لا توجد تراخيص لكل مقعد: تدفع الوكالات مقابل الاستخدام عبر شرائح ثابتة، مع سقف صارم يمنع تجاوز الميزانية الملتزم بها، وتحدد مطابقة مجموعات SCIM، بحسب مستوى المقعد، حدود المعدل، والأسقف بالدولار، والنماذج المصرح بها. من ناحية التحكم، تتطلب العمليات الحساسة لدى Anthropic موافقة شخصين، ولا تحتوي عمليات تصدير الاستخدام إلا على بيانات القياس، وتظل سجلات المحادثات مخزنة على الجهاز الذي تديره الوكالة. لم تنشر Anthropic أي أسعار.

🔗 Claude for Government is now generally available

لدى Anthropic، وكيل مبني على Managed Agents يستقبل الطلبات التجارية

30 سبتمبر — تروي Anthropic كيف قام فريق المبيعات لديها بإعادة هيكلة استقبال الطلبات الواردة، والتي تقدر بعشرات الآلاف شهريًا، باستخدام وكيل مبيعات مبني على Claude Managed Agents، في مرحلته التجريبية. يتواجد الوكيل في صفحات Contact Sales وPricing، وداخل claude.ai، وفي رسائل البريد الإلكتروني؛ حيث يطرح بعض الأسئلة، ويوصي بخطة وعدد مقاعد، ثم يوجه نحو الشراء، أو يحيل العميل إلى مندوب مبيعات مع كامل سجل المحادثة، أو يكتفي بالرد؛ ويمكن للعميل اختيار التحدث مع شخص بشري منذ البداية. ووفقًا للمنشور الذي وقّعه Carl Johnson، يجري الوكيل آلاف المحادثات يوميًا؛ وتتحول العملاء المحتملون الذين يحيلهم إلى فرص بنسبة تزيد عن الضعف مقارنة بالنموذج القديم، وتُحسم الصفقات في وقت أسرع بنحو خمسة أيام، كما انخفضت نسبة المحادثات التي تتطلب مندوب مبيعات لإتمام الصفقة إلى النصف تقريبًا. وقام مهندس واحد ببناء النسخة الأولى في بضعة أسابيع؛ وكثيرًا ما يوجّه الوكيل الفرق الصغيرة نحو خطة Team بدلاً من Enterprise، وهو خيار اختارت Anthropic تبنيه بالكامل.

🔗 How Anthropic’s sales team rebuilt inbound with Claude Managed Agents

OpenAI تشارك America’s SBDC وتنشر تقريرًا عن الشركات الصغيرة

30 سبتمبر — تعقد OpenAI شراكة مع America’s SBDC، الشبكة الوطنية لمراكز تطوير الشركات الصغيرة الأمريكية، والتي تدعم مليون رائد أعمال سنويًا. في المرحلة الأولى، ومن خلال برنامج مدربي المجتمع الخاص بـ OpenAI Academy (Community Trainer Program) الذي أُطلق تجريبيًا في 23 سبتمبر، تخطط OpenAI لتدريب نحو 150 مستشارًا، سيقدمون ورش عمل مدتها ثلاث ساعات عبر شبكات SBDC، بهدف الوصول إلى 1,000 شركة صغيرة على الأقل حضوريًا. في اليوم نفسه، يحدد تقرير «Small Businesses, Bigger Capabilities» حجم الاستخدام بالأرقام: خلال الأسبوع الممتد من 9 إلى 15 سبتمبر، استخدم حوالي 4 ملايين موظف في شركات يقل عدد أفرادها عن 500 موظف منتجات OpenAI، وكان ما يقرب من موظف واحد من كل خمسة منهم يعمل في شركة تضم أقل من 10 موظفين. في أغسطس، مثلت رموز المخرجات القائمة على الوكلاء، لاسيما الخاصة بـ ChatGPT Work وCodex، ثلثي رموز المخرجات لدى الشركات الصغيرة، مقارنة بالثلث في أبريل.

🔗 منشور OpenAI حول الشركات الصغيرة


Runway Ads: محرك مستقل للإعلانات القائمة على الأداء

30 سبتمبر — أطلقت Runway أداة Runway Ads، التي تتولى إدارة الجانب الإبداعي للحملات المدفوعة من البداية إلى النهاية. يتم ربط حساب إعلاني ومجموعة أدوات العلامة التجارية: تقوم الأداة، المبنية على Runway Agent، بإنشاء تصميمات فيديو وصور، ونشر المتغيرات المعتمدة على Meta وGoogle وTikTok، ومراجعة أدائها، وإنتاج الموجة التالية بالتركيز على ما اجتذب الإنفاق الإعلاني. وتعمل الأداة على توطين كل تصميم وفقاً لقواعد يحددها الفريق، بما في ذلك النصوص الظاهرة على الشاشة، وتغيير حجمه ليناسب كل تنسيق، وإخضاعه لمراجعة تلقائية للعلامة التجارية، مع الالتزام بحدود الميزانية. وتكون الموافقة البشرية مفعلة افتراضياً؛ في حين يمكن تمكين النشر التلقائي لكل حملة على حدة أو حسب نوع المتغير الإعلاني.

المؤشر الداخلي لـ Runway، منذ يوليوالنتيجة المنشورة في التدوينة
الإعلانات في الأسبوعمن 77 إلى نحو 900
العائد على الإنفاق الإعلانيتضاعف
التحويلنحو +34%، مع استقرار نسبة النقر إلى الظهور
التكلفة لكل مشترك−41%

تتوفر Runway Ads حالياً في مرحلة تجريبية لدى شركاء مختارين من المؤسسات. وتعد التغريدة الإعلانية بطرح واسع النطاق خلال الأسابيع المقبلة، وتؤكد أن الأداة ساهمت أيضاً في إضافة 100 مليون دولار من الإيرادات السنوية المتكررة (ARR) منذ يوليو، وهو رقم لم يُذكر في التدوينة.

🔗 تدوينة Runway Ads · تغريدة من @runwayml


تقييم ElevenLabs يبلغ 22 مليار دولار بعد عرض شراء أسهم بقيمة 300 مليون دولار

30 سبتمبر — أنهت ElevenLabs عرض شراء أسهم (tender offer) بقيمة 300 مليون دولار مخصصاً لموظفيها، مما رفع تقييمها إلى 22 مليار دولار، أي ضعف تقييمها خلال جولة التمويل Series D في فبراير. وقادت العملية كل من Wellington وT. Rowe Price؛ وانضمت شركات EQT وGoldman Sachs وGIC وOTPP وSapphire Ventures وBDT & MSD إلى رأس المال، إلى جانب مستثمرين حاليين مثل Andreessen Horowitz وLightspeed وICONIQ. ويمثل عملاء المؤسسات 55% من الإيرادات: حيث يعالج ElevenAgents أكثر من 15 مليون محادثة أسبوعياً، أي ثلاثة أضعاف ما كان عليه في فبراير، وتضاعفت إيراداته السنوية المتكررة أكثر من ثلاث مرات خلال هذه الفترة. ووفقاً لتحليل أُجري على عملائها، فإن الوكلاء الصوتيين يحلون الطلبات بنسبة 31% أسرع مقارنة بوكلاء الدردشة النصية. وتضم الشركة أكثر من 800 موظف، وذلك بعد أربع سنوات من أول جولة تمويلية لها بتقييم بلغ 9 ملايين دولار.

🔗 تدوينة ElevenLabs


Vera Rubin NVL72 في مرحلة الإنتاج لدى CoreWeave، وCognition ترصد زيادة في الإنتاجية تصل إلى 4.8 أضعاف

30 سبتمبر — بمناسبة فعالية CoreWeave Fully Connected في سان فرانسيسكو، استعرضت NVIDIA بالتفصيل انتقال Vera Rubin NVL72 إلى مرحلة الإنتاج لدى CoreWeave: أصبحت المنصة، المزودة بشبكة Spectrum-X Ethernet 102.4T، متاحة على CoreWeave Cloud، التي استلمت أولى كبائن الإنتاج الخاصة بها في وقت سابق من هذا الشهر. وتُعد Cognition، مطورة Devin، أول عميل يشغّل أعباء عمل إنتاجية عليها: فخلال الاختبارات الأولية على مهام مستخرجة من FrontierCode، رصدت زيادة في إجمالي معدل معالجة الرموز لاستدلال SWE-2 تصل إلى 4.8 أضعاف مقارنة بـ GB200 NVL72. وستوفر CoreWeave أيضاً معالج Vera CPU المصمم للوكلاء: 128 وحدة معالجة مركزية و11,264 نواة لكل كابينة، وهو ما يكفي لتشغيل أكثر من 11,000 بيئة معزولة متزامنة، مع بيئات معزولة للوكلاء تبدأ بالعمل أسرع بأكثر من ثلاث مرات. وأخيراً، أطلقت CoreWeave منصة CoreWeave Forge، التي تجمع بين Weights & Biases وOpenPipe وmarimo لربط الإنتاج بمرحلة التدريب؛ مع الإعلان عن أن التعلم المعزز دون خادم (serverless RL) أصبح أسرع بمقدار 1.4 مرة بتكلفة أقل بنسبة 40%.

🔗 تدوينة NVIDIA حول CoreWeave وVera Rubin


وكلاء البرمجة وأدوات التطوير: Claude Code 2.1.286، وZed 1.22.0، وGemini CLI، وVS Code 1.140، وHydraFusion، وخادم MCP لأداة gcloud

Claude Code 2.1.286: إشارات مرجعية في VS Code، وتحديد سقف لإعادة المحاولة، ونمط bare أكثر صرامة

30 سبتمبر — يضم إصدار Claude Code 2.1.286، الذي نُشر في الساعة 19:10 بالتوقيت العالمي المنسق (UTC)، 88 مدخلاً، بما في ذلك 49 إصلاحاً للأخطاء. باتت مطالبة الأذونات توضح موقعها عند تراكم طلبات متعددة (« 2 of 5 »)، وحصلت إضافة VS Code على إشارات مرجعية (bookmarks) للاحتفاظ بإجابات Claude في لوحة جانبية، وسطر للأسئلة يعرض الأسئلة التي طرحها Claude والإجابات المختارة، ومعاينات للخيارات داخل بطاقات الأسئلة. وهناك تغييرتان سلوكيتان مهمتان: إذ أصبح حدٌّ موحّد يغطي عمليات إعادة محاولة استدعاء النموذج، أي 14 طلباً كحد أقصى بالإعدادات الافتراضية، ولم يعد --bare يربط سوى خوادم MCP المحددة بالاسم في سطر الأوامر، دون تذكيرات للنظام أو مهام في الخلفية. وإذا كان هناك skill باسم verify، يُطلب من Claude تشغيله قبل كل إيداع مباشرةً، باستثناء التوثيق أو الاختبارات، كما ترفض المكونات الإضافية مصادر npm التي تكون عبارة عن مستودعات git أو مجلدات. وأخيراً، عندما ترفض واجهة برمجة التطبيقات النموذج الافتراضي، يعيد Claude Code المحاولة مرة واحدة باستخدام النموذج السابق من المستوى نفسه بدلاً من الفشل في كل دورة.

🔗 ملاحظات إصدار Claude Code 2.1.286

Zed 1.22.0: نموذج لكل وكيل فرعي

30 سبتمبر — أطلقت Zed إصدارها المستقر 1.22.0، الذي يركز على الوكلاء الفرعيين: أصبحت أداة spawn_agent تقبل معاملاً اختيارياً model لتشغيل وكيل فرعي على نموذج مختلف عن النموذج الذي تم تكوينه أو الموروث من الوكيل الأصلي، وتعرض بطاقة كل وكيل فرعي النموذج المستخدم. كما يقوم الوكلاء الفرعيون بضغط سياقهم تلقائياً، مما يتيح لهم، وفقاً لـ Zed، التعامل مع مهام أطول. ومن ناحية النماذج، أُضيف GPT-6.1 Sol بنظام استخدام المفتاح الخاص (BYOK) مع مفتاح API من OpenAI، وانتقل Grok 4.7 إلى الإصدار المستقر كنموذج موصى به لدى SuperGrok وxAI، ويتم جلب قائمة نماذج OpenCode Zen وGo فورياً. ويصلح الإصدار تسريباً للذاكرة يبلغ حوالي 2 ميغابايت لكل أمر مكتمل في Terminal، ويغير اختصاراً للوحة المفاتيح: إذ أصبح إغلاق الـ dock النشط عبر ctrl-alt-w على جميع المنصات. ويشمل التحديث إجمالاً 18 ميزة جديدة و37 إصلاحاً.

🔗 ملاحظات إصدار Zed 1.22.0

Gemini CLI: الإصدار v0.62.0 مستقر، ومعاينة أولية تنفذ الخطط دون تأكيد

29 سبتمبر — أطلقت Gemini CLI إصدارين مساءً بتوقيت UTC. أصبح الإصدار v0.62.0 مستقراً في الساعة 21:17: وتتضمن مدخلاته الـ 19 ما ورد في المعاينة الأولية وإصدارات nightlies المقدمة بين 16 و24 سبتمبر (عناوين مهيكلة لاستدعاءات أدوات MCP، والاحتفاظ برمز تحديث OAuth الصلاحي (refresh token)، وGemini 3.8 Flash و3.5 Flash Lite). وتكمن الميزة الجديدة في الإصدار الأولي v0.63.0-preview.0 الذي نُشر في الساعة 20:58: ففي الوضع غير التفاعلي، يقوم الوكيل الآن بصياغة خطته وتنفيذها دون انتظار التأكيد (PR 29539)، بينما كانت توجيهات Plan Mode تجعله يجيب بمجرد رسالة محاذاة دون أي استدعاء للأدوات. كما أن تعيين حد maxChars بقيمة 0 أو أقل يعطل أيضاً اقتطاع مخرجات الأدوات (PR 29542). وتفتتح نسخة nightly الصادرة في 30 سبتمبر سلسلة الإصدارات 0.64.0: ففي وضع ACP، يُبلّغ سطر الأوامر أخيراً عن الاستخدام القياسي، بعد أن كانت برامج عميلة مثل Zed أو OpenHands تبالغ في تقدير الفوترة بنحو 3 أضعاف، وفقاً للطلب PR 29549.

🔗 Gemini CLI v0.63.0-preview.0 · Gemini CLI v0.62.0

VS Code 1.140 يتبنى Copilot harness

30 سبتمبر — صدر Visual Studio Code 1.140 في نسخته المستقرة مع نظام Copilot harness: وهو مبني على Copilot SDK، ويمنح وكيل VS Code سلوك وقدرات تطبيق GitHub Copilot وأداة Copilot CLI، ويعمل داخل عملية مضيفة مخصصة تستند إلى بروتوكول Agent Host Protocol، بحيث يمكن الانضمام إلى الجلسة نفسها من نوافذ متعددة؛ وتشير الملاحظات إلى أنه قد يكون محدداً افتراضياً بالفعل لبعض المستخدمين. وعلى الصعيد التجريبي، تمنح الجلسات متعددة المجلدات كل محادثة مجلدها أو مسار العمل الخاص بها، ويمكن للوكيل تفويض الجلسة إلى مضيف بعيد يتم اختياره بناءً على النظام والذاكرة وعدد المعالجات والنموذج. وهناك ثلاثة عناصر تحكم جديدة للشركات: شرح الإصدارات الدنيا التي يطلبها المسؤول داخل الدردشة، وتحديد مستوى افتراضي للوضع التلقائي عبر إعداد مُدار (autoTier)، وإضافة هوية المستخدم إلى بيانات OpenTelemetry الخاصة بـ Copilot، وهو خيار معطل افتراضياً.

🔗 ملاحظات إصدار VS Code 1.140

وصول HydraFusion إلى VS Code وتطبيق GitHub Copilot

30 سبتمبر — وسعت GitHub دعم تقنية HydraFusion، وهي نظام التنسيق متعدد النماذج الذي أُطلق في 4 سبتمبر في Copilot CLI، لتصل إلى VS Code (بدءاً من الإصدار 1.140 أو إصدار Insiders) وتطبيق GitHub Copilot، الذي لا يزال في مرحلة المعاينة البحثية. يتم اختيار HydraFusion من قائمة تحديد النماذج وكأنه نموذج، ولكنه ليس كذلك: إذ يتعامل مع اختيار مسار العمل باعتباره مسألة تحسين ويختار واحداً من ثلاثة أنماط. في وضع Single، يقوم نموذج واحد بحل المهمة؛ وفي وضع Cascade، يقوم نموذج عالي الكفاءة بالصياغة ويتولى فحص الجودة قبول النتيجة أو تصعيدها إلى نموذج أقوى؛ وفي وضع Critique، يقوم مراجع للقراءة فقط، من عائلة نماذج مختلفة، بالمراجعة، ثم يعيد الكاتب التنقيح مرة واحدة. وبينما يختار الوضع التلقائي نموذجاً واحداً لكل طلب، ينسق HydraFusion بين عدة نماذج في الجولة نفسها. والميزة متاحة لمشتركي Copilot Pro وPro+ وBusiness وEnterprise، مع ضرورة تفعيل المعاينات الأولية من قِبل المسؤول في خطتي Business وEnterprise؛ ولم تنشر GitHub أي أرقام جديدة.

🔗 HydraFusion in VS Code and the GitHub Copilot app

Google Cloud تتيح في معاينة أولية خادم MCP عن بُعد لتشغيل gcloud وbq

أضافت Google Cloud إلى خوادم MCP البعيدة المدارة خادم Google Cloud CLI remote MCP server في معاينة عامة. ويجمع الخادم مئات الأوامر الخاصة بأدوات سطر الأوامر gcloud وbq (BigQuery) خلف أداتي MCP هما run_gcloud_command وrun_bq_command. وتبرر Google اختيار سطر الأوامر بحجتين: الأولى أن الأمر الواحد يختصر عمليات متعددة الخطوات كانت واجهة برمجة التطبيقات ستتطلب تنسيقها، والثانية أن النماذج قد دُرّبت بشكل مكثف على الوثائق العامة لهذه الأوامر. ويتيح الخادم البعيد تجنب تثبيت أداة سطر الأوامر في بيئة الوكيل، مما يفتح هذه العمليات أمام منصات الوكلاء المستضافة عبر الويب مثل Gemini Enterprise. وتُنفذ الأوامر في بيئة معزولة، خلف بروكسي بشبكة مقيدة ودون بيانات اعتماد ضمنية (ambient credentials)، ويعمل كل أمر وفق صلاحيات IAM الخاصة بالهوية الطالبة، الموثقة عبر Agent Identity أو OAuth 2.0؛ كما يمكن لـ Model Armor تصفية المدخلات والاستجابات، وتسجيل كل استدعاء في سجلات التدقيق. ولا توجد تكلفة على الخادم بحد ذاته: إذ تُحسب الرسوم فقط على الموارد المنشأة ونقل البيانات المحتمل.

🔗 Empower your agents with the Google Cloud CLI remote MCP server (blog Google Cloud)


مقتطفات

  • Codex CLI 0.159.2 — صدر هذا الإصدار في 29 سبتمبر عند الساعة 23:57 بالتوقيت العالمي المنسق (UTC)، ولا يحتوي إلا على إصلاح تم نقله بأثر رجعي: في نظام Windows، لم تعد نوافذ وحدة التحكم تومض عندما يشغل Codex عمليات في الخلفية أو أوامر داخل بيئته المعزولة. 🔗 المصدر
  • Plaid في Amp — تكتسب أوضاع Amp التي تستخدم GPT-6 Astra ميزة Plaid، المبنية على المستوى فائق السرعة من OpenAI: طلبات أسرع بما يصل إلى 6 مرات مقابل تكلفة لكل رمز مضروبة في 6، وهي مقتصرة على الاستدلال المقدم من Amp؛ بينما تظل الوكلاء الفرعيون بسرعات fast أو standard، ولا تنشر Amp أي أسعار. 🔗 المصدر
  • Warp وFactories as Code — تقدم Warp تهيئة مصانعها البرمجية بوصفها «Terraform للوكلاء»: مستودع يصف الوكلاء والأتمتة والوصول والقياس. يعود تنسيق factory.yaml إلى أواخر أغسطس؛ ويفصل الدليل التفاعلي الوصول الموحد إلى AWS أو GCP، وخطافات الويب (webhooks)، والتكامل مع Slack أو Linear أو Jira. 🔗 سلسلة منشورات Warp · 🔗 دليل التهيئة
  • Devin لدى Crosby — في دراسة حالة من Cognition، تسند شركة المحاماة النيويوركية Crosby، التي تضم نحو اثني عشر مهندسًا لأكثر من 50 محاميًا، الاستجابة الأولى للحوادث إلى Devin: فحص ما بين 20 إلى 40 خطأً برمجيًا وتنبيهًا يوميًا، في غضون 5 دقائق تقريبًا لمعظمها، مع تقليل ضجيج Sentry بنسبة لا تقل عن 50%. 🔗 المصدر
  • claude.dev — تقدم Anthropic رسميًا موقع claude.dev بوصفه مقر المطورين الذين يبنون باستخدام Claude: تحليلات تقنية متعمقة، وأدلة لـ Claude Code وواجهة برمجة التطبيقات، وأقسام للوكلاء (Agents) والهندسة (Engineering) ودليل الإجراءات (Playbooks) والمهارات (Skills)، وصفحة Terminal كمفاجأة مخفية. وكانت مقالات من الموقع قد بدأت بالتداول بالفعل منذ 22 سبتمبر. 🔗 المصدر
  • مواقع ChatGPT قابلة للتعديل — وفقًا لملاحظات الإصدار الصادرة في 29 سبتمبر، يمكن تعديل أي موقع منشور باستخدام Edit site وجدولته من Automations في اشتراكي Plus وPro؛ وفي Enterprise، يمكن أن تعتمد المواقع الخاصة على التطبيقات المتصلة، مع إعداد Allow use in Sites لكل إضافة، وهو معطل افتراضيًا. 🔗 ملاحظات إصدار ChatGPT · 🔗 ملاحظات Enterprise وEdu
  • Kimi Work 3.2.15 — يتيح إصدار 30 سبتمبر التحرير المشترك بين الإنسان والذكاء الاصطناعي لمستندات Notion وFeishu في المتصفح المدمج، ويطوي مسار تنفيذ الوكيل افتراضيًا، ويصلح تلف الملفات أثناء التحرير المتزامن لملفات PPT. 🔗 المصدر
  • Cue يدير الشؤون المالية — أصبح تطبيق الوكلاء الشخصيين الذي تم إطلاقه مع Manus 2.0 يتتبع الآن الاشتراكات واتجاهات الإنفاق ويضع الحسابات المصرفية في وضع الطيار الآلي عبر Plaid؛ دون تحديد البلدان أو الخطط أو الشروط. 🔗 المصدر
  • GPT-6.1 Sol في Genspark — تتيح Genspark نموذج GPT-6.1 Sol في AI Chat وCode Agent وClaw غداة إطلاقه، متبنيةً حجة OpenAI التسويقية (ذكاء يقارب Astra بخمس سعر واجهة برمجة التطبيقات الخاصة به)، دون تحديد باقة أو تكلفة بالرصيد. 🔗 المصدر
  • Qwen3.8-27B-pi — ينشر Thomas Kim بموجب رخصة Apache-2.0 ضبطًا دقيقًا لنموذج Qwen3.8-27B لهيكل Pi يعيد ترتيب مستويات الجهد: في Terminal-Bench 2.1، يعادل المستوى medium النموذج الأساسي في xhigh (67 مهمة من أصل 89) مع انخفاض يقارب 41% في رموز الإخراج. 🔗 المصدر
  • Qwen3.8-27B لدى Nebius — تنقل Qwen خبر وصول نموذجها الكثيف ذي 27 مليار معلمة إلى Nebius Token Factory، والمعلن عنه في 28 سبتمبر، لدعم مهام البرمجة والبحث وسير العمل القائم على الوكلاء؛ دون الإفصاح عن الأسعار أو معدل النقل. 🔗 المصدر
  • Bekko System One v0 — ينشر Yuichi Tateno ثلاثة نماذج اتخاذ قرار بحجم 17M و68M و400M معلمة، ويعمل النموذجان الأصغر داخل المتصفح، بالإضافة إلى منصة اختبار S1MB: يحقق النموذج ذو 400M درجة 50.60 مقابل 59.59 لـ Jev 1.13، لكنه يحقق 54.48 مقابل 96.27 في التعميم. 🔗 المصدر
  • ZooWork Instinct Tuned 4B — تنشر SRP بموجب رخصة Apache-2.0 نموذج اتخاذ قرار بحجم 4 مليارات معلمة مبنيًا على Qwen3.5-4B، يسجل الخيارات بتمريرة واحدة دون فك ترميز: 198 من أصل 231 (85.71%) في المهام العامة لاختبار JevBench المستخدمة أثناء التطوير، كما يوضح المؤلفون. 🔗 المصدر
  • Transformers v5.18.0 — تضيف Hugging Face أربع بنيات معمارية، هي Nemotron 3 Diarization وNemotronH Omni من NVIDIA، وHyperCLOVAX Vision V2 من NAVER وGTE، وتعلن عن ستة تغييرات جذرية. 🔗 المصدر
  • TaskSmith — ينشر Adithya S K، الذي يعمل على بيئات التعلم المعزز في Hugging Face، منسقًا يحول طلب السحب إلى بيئة تعلم معزز قابلة للتحقق: 50 بيئة مستمدة من TRL وPEFT وAccelerate وDiffusers وTransformers، قُدمت كمهام Harbor. 🔗 المصدر
  • TraceML 0.4.1 — تقيس الأداة مفتوحة المصدر الآن كامل مجموعة تحديث أداة التحسين؛ وعلى ResNet-50 ووحدة معالجة رسومات T4، ينخفض وقت انتظار البيانات من 23% من الخطوة إلى أقل من 2 ميلي ثانية بعد ضبط التحميل، بزيادة نفقات عامة وسيطة قدرها 0.35%. 🔗 المصدر
  • المحولات الحلقية — على نموذج تجريبي مصغر يضم 54,106 معلمات و260 حالة قابلة للتحقق، وبميزانية متساوية تبلغ 80 تمريرة كتلة، تتعلم الحلقة الواحدة 260 حالة، وحلقتان 125.3 حالة، وثماني حلقات 37.0 حالة في المتوسط: مضاعفة التمريرات لم تجعل التعلم أكثر كفاءة من حيث التكلفة. 🔗 المصدر
  • تقييم يعرف كيف يقول لا — يوضح الدليل التعليمي لـ Eric Mey، استنادًا إلى تحليل مشاعر مراجعات الأفلام (SST-2)، تقييمًا يرفض نموذجًا رغم تفوقه بفارق 7 نقاط على بيانات محجوبة، وذلك بسبب تدهور سلوك حاسم؛ وتعمل نصوصه البرمجية في أقل من دقيقة على المعالج. 🔗 المصدر
  • 10,000 مُؤمَّن عليهم اصطناعيًا — تنشر شركة Intelligent Actuaries بموجب رخصة CC-BY-4.0 دراسة اصطناعية لعمليات إلغاء واسترداد التأمين على الحياة: 10,000 مُؤمَّن عليه افتراضي في عشرة أسواق، أي ما يعادل 27,692 سجلاً بوثيقة-سنة للفترة 2023-2025 وفق تنسيق استطلاع SOA-LIMRA. 🔗 المصدر
  • cuObject وSCADA Server SDK — تتيح NVIDIA بشكل عام مكتبات cuObject للوصول إلى تخزين الكائنات عبر RDMA دون المرور بذاكرة المعالج، وتطلق SCADA Server SDK، الذي بنته IBM كنموذج أولي مع Storage Scale، ضمن مبادرة Storage-Next التي تضم أكثر من 40 جهة فاعلة. 🔗 المصدر
  • NeMo Relay وHermes Agent — يتتبع برنامج تعليمي من NVIDIA شارك في كتابته Teknium من Nous Research وكيل Hermes: عبر 108 عمليات تشغيل، أدت إصلاحات الأدوات إلى رفع نسبة نجاح Qwen3 Coder 30B من 19 إلى 22 من أصل 27، مقابل 4.9 استدعاءات للنموذج بدلاً من 3.8. 🔗 المصدر
  • OpenShell لـ OpenClaw Enterprise — تقترح NVIDIA بيئتها مفتوحة المصدر OpenShell لإدارة وكلاء OpenClaw Enterprise، وهو مستوى تحكم مفتوح المصدر للوكلاء الدائمين أعلنت عنه مؤسسة OpenClaw في اليوم السابق بالتعاون مع Red Hat وNVIDIA وOpenAI. 🔗 المصدر
  • فترات تجريبية لـ GitHub Advanced Security — بات بإمكان عملاء GitHub Team بدء فترة تجريبية بأنفسهم لميزتي GitHub Code Security وGitHub Secret Protection، من صفحة Overview للمؤسسة أو صفحة الفوترة أو Risk Assessment؛ دون تحديد المدة. 🔗 المصدر
  • GHE.com وX25519 — بدءًا من 7 أكتوبر 2026، سيرفض GitHub Enterprise Cloud مع ميزة إقامة البيانات عملاء TLS الذين يكتفون بتقديم X25519 للاتفاق على المفاتيح؛ بينما يظل P-256 وP-384 مدعومين، ولا يتأثر SSH بذلك. 🔗 المصدر
  • دراستا حالة لدى Runway — أنتجت العلامة التجارية الفرنسية للمشروبات Bonjour أكثر من 500 تنويعة إعلانية باستخدام Runway وأعادت توجيه أكثر من 50,000 يورو من ميزانية الإنتاج؛ فيما أسند الاتحاد العالمي للاعبي الخفة (World Juggling Federation) إلى شخص واحد مهمة إعداد الهوية البصرية لبرنامج مدته ساعة لصالح شبكة ESPN. 🔗 Bonjour · 🔗 World Juggling Federation
  • Ad Variants لدى Luma — تسلط Luma الضوء على ميزة تحول الإعلان المكتمل إلى مقاسات متعددة وتخصصه لعدة أسواق ضمن الحملة نفسها، دون تحديد أسعار أو باقات أو تاريخ إطلاق، ودون نشر تدوينة. 🔗 المصدر
  • Microduck قيد الإنتاج — تعلن Pollen Robotics أن 10,950 روبوت Microduck، وهو روبوتها الصغير ثنائي الأرجل بسعر 399 دولارًا والمدرب عبر المحاكاة بحزمة تعلم معزز مفتوحة المصدر، ستخرج من خط الإنتاج بين 10 ديسمبر و10 يناير، على دفعات أسبوعية. 🔗 المصدر
  • Cognition توظف كفاءات جديدة — ترحب الشركة المطورة لـ Devin بـ Chris Degnan، مدير الإيرادات التنفيذي السابق في Snowflake، كمدير للإيرادات، غداة انضمام Alex Stamos كمسؤول أمن نظم المعلومات (CISO). 🔗 Chris Degnan · 🔗 Alex Stamos
  • Claude Founder House — تنظم Anthropic أيامًا مخصصة للمؤسسين في سان فرانسيسكو خلال أسبوع سان فرانسيسكو للتقنية (SF Tech Week) (من 6 إلى 8 أكتوبر في Terra Gallery) وفي ستوكهولم في 14 أكتوبر، تتضمن مؤتمرات وورش عمل وجلسات مع فريق Applied AI التابع لها. 🔗 المصدر
  • AI Engineer Paris — تستعرض Mistral حصيلة الفعالية التي أقيمت في الأسبوع السابق في Station F: أكثر من 900 مشارك، و60 متحدثًا، و57 جلسة، و22 شريكًا، دون الإعلان عن منتجات جديدة. 🔗 المصدر
  • منح الدكتوراه من NVIDIA — باب التقديم لبرنامج Graduate Fellowship Program 2027-2028 مفتوح حتى 30 أكتوبر 2026، مع تمويل يصل إلى 60,000 دولار لكل طالب دكتوراه؛ وقد مُنحت أكثر من 220 زمالة منذ عام 2002. 🔗 المصدر

ماذا يعني ذلك

أصبح الأمان الآن هو ما يحدد الجدول الزمني لنماذج الصدارة. إذ يواصل Gemini 4 Argon منطق برنامج Fairwind Program: يحصل عليه المدافعون السيبرانيون الموثوق بهم أولاً دون حواجز حماية سيبرانية، بينما سيتبعه الآخرون «في أقرب وقت ممكن»، دون تحديد موعد، لإتاحة الوقت لتعزيز سبل الحماية. وفي اليوم نفسه، تُبرز OpenAI الوجه الآخر للمشكلة: لم يعد المطلوب حمايته هو النموذج فحسب، بل مسار تفكيره واستدلاله أيضًا. وسواء كانت هذه الحملة من فعل جهة واحدة أم لا، فإن الحملة التي تنسب OpenAI جوهرها إلى أفراد مرتبطين بشركة Moonshot AI تجعل من أثر الاستدلال أصلًا يستوجب الدفاع عنه، عبر حلول تقنية ومشاركة للمعلومات بين المختبرات والحكومات.

يأتي جزء كبير من أرقام اليوم من مقاييس صممها أو أدارها أصحاب الإعلانات أنفسهم. إذ تقيّم Cohere نموذج Embed 5 باستخدام المقياس الذي تنشره في اليوم نفسه، وتحذر هي نفسها من أن نماذجها قد تبدو أقل جودة وفقًا للمقياس القديم؛ بينما تعتمد HeyGen على نظام Elo داخلي، وHunmin على بروتوكول خاص مع تشغيل لمرة واحدة فقط لمنصات اختبار الوكلاء، وفي Reality Check، قام المنظم نفسه بضبط النماذج بدقة. وعلى النقيض من ذلك، تقدم Perplexity نموذجها للتقييم الأعمى على منصة اختبار خاصة لدى turbopuffer، وتستبدل Open TTS Leaderboard ومنصة AURORA التصويت أو الترجمة الآلية بمهام ومقاييس قابلة للتحقق. وقبل المقارنة بين درجتين، لا بد من النظر فيمن قام بإنتاجهما.

يخضع توليد الصور ومقاطع الفيديو بصورة متزايدة للتقييم بناءً على الاستخدام والتكلفة. فلا يعد Ideogram 4.5 بصورة أكثر جمالاً، بل بصورة تتحمل التعديلات المتسلسلة؛ ويُباع HeyGen Video بالثانية بسعر أرخص من جميع النماذج المدرجة في قائمته، ويوضح كيف يمكن لنموذج أساسي مثل MiniMax H3 أن يُنتج تنويعات متخصصة، من HeyGen إلى Creatify. ويكمل Runway Ads السلسلة وصولاً إلى الإنفاق الإعلاني، في حين يرتكز تقييم ElevenLabs، الذي تضاعف منذ فبراير، على طلب المؤسسات المتزايد على الوكلاء الحواريين.

أما على صعيد المطورين، فقد أصبح هيكل التشغيل منتجًا بحد ذاته ومستقلاً عن النموذج. إذ يعتمد VS Code هيكل Copilot لمواءمة وكيله عبر التطبيق وواجهة السطر البرمجي، وينسق HydraFusion عدة نماذج في الجولة نفسها، ويتيح Zed للوكيل اختيار نموذج لكل وكيل فرعي، كما يفتح Manus هيكله لمفاتيح API من مزودين خارجيين. وينفذ Gemini CLI الآن خططه دون تدخل بشري في الوضع غير التفاعلي، ويشدد Claude Code من --bare للاستخدامات المؤتمتة عبر البرمجيات النصية، كما تتيح Google Cloud أداتي gcloud وbq للوكلاء داخل بيئة معزولة وفق أذونات IAM الخاصة بالمستخدم الطالب. وتتضح ملامح هذا الطلب وصولاً إلى البنية التحتية: فأول عميل لـ Vera Rubin NVL72 قيد الإنتاج لدى CoreWeave هي Cognition، مطورة Devin.


المصادر