بحث

Wan 3.0 يُنتج 30 ثانية في تمريرة واحدة، NVIDIA تقيس ذُرى تصل إلى 30x من العمل لكل واط، Mistral توقّع مع HUMAIN

مقال من إنشاء الذكاء الاصطناعي
Wan 3.0 يُنتج 30 ثانية في تمريرة واحدة، NVIDIA تقيس ذُرى تصل إلى 30x من العمل لكل واط، Mistral توقّع مع HUMAIN

ai-powered-markdown-translator

مقال مترجم من الفرنسية إلى العربية باستخدام gpt-5.4-mini.

عرض المشروع على GitHub ↗

يوم 24 أغسطس هو يوم عتاد بقدر ما هو يوم نماذج. NVIDIA تُطلق ثلاث إعلانات للبنية التحتية في الدفعة نفسها من Hot Chips — أول قياسات على الشريحة لـ Vera Rubin NVL72، ودخول Groq 3 LPX إلى الإنتاج، وفتح المنصة أمام الشرائح التابعة لجهات خارجية عبر NVLink Fusion. وتُطلق Alibaba نموذج Wan 3.0، الذي يُنتج 30 ثانية من الفيديو الأصلي في تمريرة واحدة. وفي اليوم نفسه، يظهر مختبران غير أمريكيين إلى جانب مؤسسات وطنية: Mistral مع HUMAIN في السعودية، وSakana AI مع وزارة الدفاع اليابانية. وتُضاف إلى ذلك الإتاحة العامة لتفويض المؤسسة لروابط MCP لدى Anthropic، ووصول GPT-5.6 إلى Kiro، وسلسلة من الإعلانات حول الوكلاء الصوتيين.


Wan 3.0 يُنتج 30 ثانية أصلية في تمريرة واحدة

24 أغسطس — تُطلق Alibaba Wan 3.0، الجيل الجديد من نموذج الفيديو الخاص بها. ويتمثل التحول الأوضح في المدة: إذ يُنتج النموذج 30 ثانية أصلية في تمريرة واحدة، من دون تجميع لقطات متتالية (stitching). وحتى الآن، كان تجاوز عشر ثوانٍ يتطلب توليد عدة مقاطع ثم ربطها، مع ما يسببه ذلك من انحرافات في الاتساق على مستوى الإضاءة والأنسجة والوجوه.

المحور الثاني هو الإدخال متعدد الوسائط. يقبل Wan 3.0 حتى 20 أصلًا مرجعيًا ويحلل المستندات وصفحات الويب إلى جانب الصور والصوت والفيديو — وهو ما تسميه الصفحة الرسمية الإبداع الشامل (Omni-Creation). عمليًا، تُزوَّده بحزمة هوية علامة تجارية بدلًا من وصف نصي.

ويُنتج النموذج أيضًا صوتًا متزامنًا أصليًا: فالأصوات والمؤثرات والأجواء تُولَّد في الوقت نفسه مع الصور، لا تُضاف لاحقًا. وعلى صعيد الصورة الثابتة، يدمج Wan 3.0 حتى 9 صور في تركيبة واحدة ويُنتج 12 صورة متسلسلة ذات أسلوب وموضوع ثابتين، وهو ما يستهدف صراحةً إعداد الستوريبورد والتفرعات الإعلانية.

هناك قدرتان أقل إثارة للضجيج لكنهما مهمتان في الاستخدام المهني: عرض النص الطويل على 12 لغة، ويغطي الرسوم البيانية والصيغ والإنفوغرافيك حيث تفشل النماذج المرئية عادةً، والتحكم الدقيق في الألوان، وهو شرط للامتثال لهوية بصرية.

وتبعت المنظومة ذلك خلال اليوم نفسه: إذ كان Wan 3.0 متاحًا منذ اليوم الأول لدى fal وLeonardo.Ai وScenario وRunningHub وVenice وTapNow وDeeVid وPixmax وعبر Pika API Club.

القدرة المعلنةالقيمة الخاصة بـ Wan 3.0
المدة الأصلية30 ثانية في تمريرة واحدة، من دون تجميع
الأصول المرجعيةحتى 20، مع تحليل المستندات وصفحات الويب
الصوتمتزامن، يُولد أصليًا مع الصور
عرض النصنص طويل على 12 لغة (رسوم بيانية، صيغ، إنفوغرافيك)
دمج الصورحتى 9 صور في تركيبة واحدة
سلاسل الصورحتى 12 صورة متسلسلة متسقة

🔗 Wan 3.0 — الصفحة الرسمية


NVIDIA تقيس حتى 30x أكثر من العمل لكل واط على Vera Rubin NVL72

24 أغسطس — بمناسبة مؤتمر Hot Chips، تنشر NVIDIA أولى قياسات الأداء على الشريحة لـ Vera Rubin NVL72. والرقم المبرز يستهدف مباشرة اقتصاد مراكز البيانات: حتى 30x أكثر من معدل النقل لكل ميغاواط مقارنة بجيل GB300 NVL72 على نموذج DeepSeek V4 Pro، وتكلفة لكل مليون توكن أقل حتى 35x.

وتكمن أهمية المنهجية بقدر أهمية النتيجة. فـ NVIDIA تستبعد قياسات الاستدلال التقليدية، المضبوطة على سلاسل من 1,000 إلى 8,000 توكن: ففي جلسة وكيلة، يتراكم السياق ويصل إلى مئات آلاف التوكنات في الإدخال. لذلك أُجريت القياسات باستخدام SemiAnalysis AgentX، وهي حمولة من جلسات ترميز وكيلية فعلية مسجلة، مع الاحتفاظ باستدعاءات الأدوات والوكلاء الفرعيين. وهناك تحفظان: الأرقام تنتظر مراجعة SemiAnalysis ولا تتضمن بعد إسهام معالج Vera.

والتسويغ يستند إلى إحصائية من OpenRouter: الحمولة الوكيلية تستهلك 15x توكنات أكثر من طلب محادثة بسيط. وبالنسبة لمصنع ذكاء اصطناعي مقيد بالطاقة، فإن الرهان يُصاغ بلا مواربة — فمعدل النقل لكل ميغاواط يحدد الإيراد، وتكلفة المليون توكن تحدد الهامش. كما تتيح تقنية DSX MaxLPS نشر حتى 40% من وحدات GPU إضافية عند الميزانية نفسها بالميغاواط.

وتأتي المكاسب من تراكب تحسينات في الاستدلال: خدمة مفصولة تفصل بين معالجة السياق وتوليد الرد، وذاكرة KV موزعة مع تفريغ تدريجي، ونوى CUDA مدمجة مثل MegaMoE، وتكميم NVFP4 الذي يضغط الأوزان إلى 4 بت. وتضم المنصة الكاملة سبع شرائح، بما فيها GPU Rubin.

المقارنة المقاسةالمكسب المعلن
Vera Rubin NVL72 مقابل GB300 NVL72 (معدل النقل لكل ميغاواط)حتى 30x
Vera Rubin NVL72 مقابل GB300 NVL72 (تكلفة كل مليون توكن)حتى 35x أقل تكلفة
GB300 NVL72 مقابل Hopper (معدل النقل لكل ميغاواط)حتى 15x
DSX MaxLPS+40% من GPU عند الميزانية نفسها

🔗 Vera Rubin NVL72 والحمولات الوكيلية


Groq 3 LPX يدخل الإنتاج الكامل، وNebius وSpaceXAI يعتمدان Vera Rubin

24 أغسطس — الجزء الثاني من دفعة Hot Chips نفسها: نظام NVIDIA Groq 3 LPX على مستوى الرفوف ينتقل إلى الإنتاج الكامل، امتدادًا لـ Vera Rubin NVL72.

ويأتي رقم المرجع من معيار Artificial Analysis على Gemma 4 31B: ‏3,400 توكن مخرجات في الثانية مع سياق طويل من 100,000 توكن، أي 4x المنصة البديلة الأقرب. والمشكلة المستهدفة لها اسم محدد — زمن تأخير فك الترميز: فالوكيل يُنتج رده توكنًا بعد توكن، وأي تأخير وحدي يتضاعف على طول سلاسل العمل.

وتوزيع الأدوار واضح: GPU Rubin تعالج السياق على نطاق واسع، وLPX يسرّع فك الترميز الحساس لزمن التأخير. ويمكن للرف الواحد أن يجمع 256 مسرّعًا من نوع LP30 مرتبطة بروابط مباشرة من شريحة إلى شريحة.

وتُذكر ثلاث جهات متبنية. Nebius هو أول سحابة ذكاء اصطناعي تدمج Groq 3 LPX، ضمن Token Factory الخاصة بها؛ وCoreWeave تنشر Spectrum-X Multiplane في الإنتاج لربط رفوف Vera Rubin الخاصة بها؛ وSpaceXAI تعتمد معالجات NVIDIA Vera للتنسيق واستدعاء الأدوات وتنفيذ الشيفرة خلف الذكاء الاصطناعي الوكيلي، مع نية بناء بنيتها حول Vera Rubin، من مراكز البيانات الأرضية حتى الأقمار الصناعية في المدار.

وعلى صعيد الشبكات، كان تجاوز أكبر العناقيد الحالية يفرض حتى الآن مستوى ثالثًا، عالي الكلفة في الكابلات والبصريات والطاقة وزمن التأخير. أما Spectrum-X Multiplane فيقسّم اتصال كل خادم إلى عدة مسارات مستقلة، أو مستويات، يعمل كل واحد منها بشبكته الخاصة ذات المستويين.

العنصر المقاسالقيمة المعلنة
Groq 3 LPX على Gemma 4 31B، سياق 100k3,400 توكن/ث في المخرجات، 4x المنصة الأقرب
رف Groq 3 LPXحتى 256 مسرّعًا LP30، روابط شريحة إلى شريحة
Spectrum-X Multiplaneحتى 512,000 GPU على مستويين
فقدان مستوى واحد من ثمانيةالاحتفاظ بنحو 90% من عرض النطاق
الاستعادة الماديةأسرع 11x من الموازنة البرمجية، وإنتاجية أكبر بمقدار 1.6x

🔗 Groq 3 LPX وSpectrum-X وNVLink Fusion


24 أغسطس — المقال الثالث لـ NVIDIA في اليوم نفسه: NVLink Fusion يُدخل الشرائح المخصصة (XPU) ضمن مجال توسيع NVLink المكوّن من 72 مسرّعًا. ويُظهر الجيل السادس من NVLink زمن تأخير من الطرف إلى الطرف أقل 3x من الحلول المعتمدة على Ethernet القياسي، مع معدل نقل حزم أعلى 10x؛ وتعلن خارطة الطريق مجالات تصل إلى 1,152 مسرّعًا وبصريات مدمجة مع الحزمة. ويربط NVLink-C2C وحدات XPU بمعالجات Vera أو بمعالجات أخرى بكفاءة طاقة أعلى حتى 6x من واجهة PCIe.

والحجة هنا هي الفصل بين المكونات: فالتخطيط لمصنع ذكاء اصطناعي — الطاقة، المبنى، التبريد، الرفوف، الشبكة — يبدأ قبل تثبيت مزيج المسرّعات بوقت طويل، ومركز بيانات مقيد بشريحة واحدة يتحول إلى خطر على الجدول الزمني. ويعيد المتبنون استخدام بنية MGX على مستوى الرف وسلسلة التوريد الخاصة بها. والجهات الشريكة المذكورة: Intel وMediaTek وGUC وQCT وAnnapurna Labs.

🔗 NVLink Fusion وXPU


Mistral وHUMAIN يوقّعان من أجل ذكاء اصطناعي سيادي في السعودية

24 أغسطس — تُعلن Mistral عن تعاون استراتيجي مع HUMAIN، شركة الذكاء الاصطناعي السعودية: بنية حوسبة، وتطوير نماذج متقدمة، ونشر حلول في المملكة والمنطقة. ويُقدَّر الالتزام، بحسب Mistral، بمئات ملايين اليورو.

والمحاور الأولية هي الأمن السيبراني والصوت، مع نماذج حدودية فعالة باللغة العربية. وستستكشف Mistral استخدام مراكز بيانات HUMAIN لاحتياجاتها المحلية من الحوسبة، وسيستهدف الشريكان معًا القطاعات المنظمة في المملكة. ويأتي الإعلان امتدادًا لمسار بدأ هذا الصيف — شراكة موسعة مع Microsoft، ثم European Compute Units في أوائل أغسطس — ويذكر البيان أنه يتعلق بتصريحات استشرافية، خاضعة لاتفاقات تجارية لاحقة.

Control is becoming the defining topic in enterprise AI adoption. Across the world, and especially in regulated industries, organizations want the benefits of AI without giving up control over their sensitive data and systems.

🇸🇦 أصبح التحكم هو الموضوع الحاسم في تبنّي الذكاء الاصطناعي في المؤسسات. وفي كل أنحاء العالم، ولا سيما في الصناعات المنظمة، تريد المؤسسات فوائد الذكاء الاصطناعي من دون التخلي عن التحكم في بياناتها وأنظمتها الحساسة.@MistralAI على X

🔗 إعلان @MistralAI · تدوينة Mistral


Sakana AI تفوز بعقد من وزارة الدفاع اليابانية

24 أغسطس — تُعلن Sakana AI عن عقد وُقِّع في 29 يوليو مع وزارة الدفاع اليابانية (防衛省)، ويتعلق بدراسة وإثبات وظائف الذكاء الاصطناعي اللازمة لعمليات التحليل المتكامل. ويستهدف المشروع ضباط التحليل في مديرية الاستخبارات، على ثلاثة محاور: الجمع، وقدرات التحليل، وإدارة الوثائق. واللبنة التي تُستخدم هي تقنية الوكلاء الذكية الخاصة بالمختبر.

وهذا ليس أول عقد دفاعي لها: ففي مارس 2026 كان المختبر الطوكيوي قد اختير بالفعل لتقنيات الأساس لأنظمة القيادة والسيطرة. وبالنسبة لشركة ترتكز هويتها العامة على نماذجها المفتوحة، فإن هذا المسار يستحق الملاحظة — إذ باتت المدونة تضم الآن قسمًا مخصصًا للدفاع والاستخبارات، وتوظّف Sakana AI لهذا الفريق.

「Sakana AI株式会社は、令和8年7月29日、防衛省と「総合分析業務に必要なAI機能の調査・実証」に関する契約を締結いたしました。」

🇸🇦 أبرمت Sakana AI في 29 يوليو 2026 عقدًا مع وزارة الدفاع يتعلق بدراسة وإثبات وظائف الذكاء الاصطناعي اللازمة لعمليات التحليل المتكامل. — Sakana AI، تدوينة رسمية

🔗 Sakana AI — التحليل المتكامل للدفاع


Anthropic تتيح بشكل عام تفويض المؤسسة لروابط MCP

24 أغسطس — ينتقل التفويض المُدار من المؤسسة (enterprise-managed auth) لروابط MCP إلى الإتاحة العامة على Claude Team وClaude Enterprise، بعد نسخة تجريبية مفتوحة في يونيو. والمشكلة التي جرى حلها عملية جدًا: حتى الآن، كان ربط موصل MCP يتطلب خطوتين — يفعّله المسؤول للمؤسسة، ثم يمر كل مستخدم عبر مسار OAuth لكل أداة. والآن يجيز المسؤول مرة واحدة فقط، عبر مزود هوية المؤسسة، ويجد المستخدمون أدواتهم متصلة مسبقًا.

وهناك نقطة تهم فرق الأمن: يمكن للمسؤول أن يفرض على الموصل المرور دائمًا عبر مزود الهوية، ما يمنع ربط حساب شخصي بأداة مهنية. ويدعم الإطلاق عشرة مزودي MCP — Asana وAtlassian وCanva وDatadog وFigma وGranola وLinear وNotion وSlack وSupabase — مع Okta بوصفه IdP الوحيد في الوقت الراهن. والآلية ليست خاصة: إنها أول تنفيذ لامتداد Enterprise-Managed Authorization في Model Context Protocol.

🔗 إعلان @ClaudeDevs · تدوينة Anthropic


Boris Cherny يعتبر الرفض في الأمن السيبراني خللًا

24 أغسطس — في اليوم التالي لتصريحه حول المستويات الثلاثة للقدرة، يجيب مسؤول Claude Code عن سؤالين متكررين لدى مطوري الأمن. الأول هو الشك في وجود نموذج داخلي مفضّل: فالفريق يستخدم بالضبط Fable نفسه الذي يستخدمه المستخدمون النهائيون.

أما الثاني فهو أكثر مباشرة: حالات الرفض التي تُثار بسبب موضوعات الأمن السيبراني معترف بها على أنها خلل، بصياغة لا تسعى إلى التخفيف من الأمر، ويعمل الفريق على تقليلها. وهذه معلومة مفيدة لممارسي الأمن الدفاعي أو CTF، الذين يصطدمون مرارًا برفض طلبات مشروعة. ولا يوجد جدول زمني معلن، لكن الرسالة تمتد مع تحديث أغسطس حول الضوابط الحيوية البيولوجية في Fable 5، الذي كان يهدف بالفعل إلى تقليل الإيجابيات الكاذبة.

We use the same exact Fable. Cyber security refusals suck, and we are working on reducing them. More to come.

🇸🇦 نستخدم بالضبط Fable نفسه. حالات الرفض في الأمن السيبراني مزعجة، ونحن نعمل على تقليلها. مزيد من الأمور قادمة.@bcherny على X


تبدأ Anthropic في صيانة تطبيقاتها تلقائيًا

23 أغسطس — تحت ضغط لتوضيح ما يقصده بالبرمجة، يضع Boris Cherny تمييزًا بسيطًا: الـ coding هو فعل كتابة الشيفرة، أما الـ engineering فهو كل ما عدا ذلك فوقه. ويقرّ بأن الفصل بين العمل التكتيكي والعمل الاستراتيجي هو إطار قراءة آخر يمكن قبوله.

لكن الجزء الأخير من رسالته هو الذي يحمل المعلومة الجديدة. فهو يقول إنه يرى أجزاء من العمل الاستراتيجي تبدأ في أن تُؤتمت، ويعطي مثالًا ملموسًا: Anthropic تبدأ في صيانة تطبيقاتها تلقائيًا، كما أن عددًا متزايدًا بسرعة من العملاء يفعل الشيء نفسه. الفارق مهم — لم يعد الأمر يقتصر على توليد الشيفرة عند الطلب، بل على ترك الوكلاء يتولون الصيانة الجارية للتطبيقات في بيئة الإنتاج: تحديثات الاعتمادات، الإصلاحات، والتكيّف مع تغييرات الـ API. والفعل المستخدم يصف نشرًا جارًٍا لا حالةً منجزة، كما لا تُذكر أي أرقام، ولا تطبيقات بالاسم، ولا نطاق دقيق.

🔗 خيط @bcherny حول coding و engineering


ملخص تجاري أسبوعي آلي مع Claude Code

24 أغسطس — تنشر Anthropic تدوينة عن استخدام داخلي لـ Claude Code خارج تطوير البرمجيات: تروي إحدى مسوقات الميدان كيف استبدلت اجتماع الوقوف الصباحي يوم الاثنين الذي يستغرق خمس عشرة دقيقة بملخص أسبوعي مخصص يُسلَّم في رسالة Slack إلى كل مندوب مبيعات.

البنية بسيطة: Claude متصل بـ BigQuery عبر MCP، والمستودع يعمل كمصدر موثوق لبيانات التسويق. والمنهج أكثر إفادة من التقنية نفسها: بدأ الاختبار مع فريق متطوع واحد، وكل تصحيح ورد من المستلمين تحوّل إلى قاعدة صريحة في الـ prompt: وفي نهاية الأسبوع الأول، كانت هذه القواعد قد بلغت تسع قواعد للمحتوى، وكل واحدة قابلة للتتبع إلى ملاحظة محددة. وبما أن كل رسالة تُركَّب انطلاقًا من قائمة الحسابات الخاصة بمستلمها، فلا توجد رسالتان متماثلتان أبدًا؛ ثم طلب مندوبو تطوير الأعمال (business development representatives) نسختهم الخاصة.

🔗 ملخص أسبوعي مخصص مع Claude Code


وصول GPT-5.6 إلى Kiro، وكيل التطوير من AWS

24 أغسطس — تتوفر عائلة GPT-5.6 الكاملة — Sol و Terra و Luna — داخل Kiro، وكيل تطوير البرمجيات من AWS. والحجة المطروحة ليست القوة الخام بل نسبة السعر/الأداء: ففي Terminal-Bench 2.1، وهو اختبار أجرته OpenAI و AWS معًا، ينجز GPT-5.6 Terra المهام الناجحة بتكلفة أقل بنحو 82%.

ويعود التفسير المعروض إلى منهج Kiro، أي التطوير المدفوع بالمواصفات (spec-driven development) : فالداة تحوّل النية عالية المستوى إلى متطلبات وتصميم تقني ومهام قابلة للتنفيذ، ما يرسّخ النموذج في سياق محدد منذ البداية ويحدّ من المسارات الخاطئة. وتفصّل OpenAI حالات الاستخدام المستهدفة: خطط تنفيذ منظمة، مهام برمجية متعددة الخطوات، سياق المستودع، ونقاط تحقق قبل تطبيق التغييرات. ولمن يتابع منظومة وكلاء البرمجة، تؤكد الإشارة أساسًا أن سلسلة GPT-5.6 بدأت تنتشر خارج واجهات OpenAI.

🔗 GPT-5.6 في Kiro


Codex يكسب وضع المطوّر مع الوصول إلى Chrome DevTools Protocol

24 أغسطس — يتلقى سجل التغييرات في ChatGPT وCodex مجموعة جديدة من الإضافات تتمحور حول المتصفح الذي يقوده الوكيل. الأهم هو وضع المطوّر لـ Browser use، سواء في Chrome أو في المتصفح المدمج داخل Codex: فهو يمنح وصولًا مضبوطًا إلى Chrome DevTools Protocol، الواجهة التي تستخدمها أدوات تطوير Chrome. وبذلك يستطيع الوكيل تحليل الأداء واستكشاف أخطاء حركة الشبكة وصِحّة الـ console وحالة الصفحة، بدل أن يقتصر على ما يقرأه على الشاشة.

ويخدم البروتوكول نفسه السرعة أيضًا: إذ يصبح Browser use أسرع بما يصل إلى مرتين، بفضل لقطات DOM التي تقلل الذهاب والإياب مع المتصفح. كما أن الأتمتات المجدولة باتت تحترم وضع الموافقة المختار، وهو ما يصحح فجوة مزعجة في عمليات التشغيل غير المراقبة.

الجديد في سجل التغييراتالنطاق المعلن
وضع المطوّر لـ Browser useChrome والمتصفح المدمج في Codex، وصول مضبوط إلى CDP
تسريع Browser useحتى 2x أسرع (تحسينات CDP ولقطات DOM)
الأمر /initComposer للتطبيق، ويعمل تمامًا مثل CLI Codex
Computer Useالشركات خارج المنطقة الاقتصادية الأوروبية، والمملكة المتحدة، وسويسرا
عناصر التحكم في Computer Use على Windowsقابلة للتهيئة تطبيقًا بتطبيق

🔗 سجل تغييرات ChatGPT وCodex


الفائزون في تحدي Gemma 4 Good

24 أغسطس — تنشر Google نتائج Gemma 4 Good Challenge، وهي مسابقة Kaggle دعت المطورين إلى معالجة مشكلات واقعية باستخدام نماذجها المفتوحة: أكثر من 1600 مشروع مُقدَّم خلال ستة أسابيع. وكانت الصعوبة أقل في جودة النماذج منها في نشرها ضمن بيئة مقيدة، إذ استخدم المشاركون LiteRT وCactus وOllama وllama.cpp وUnsloth للتشغيل على عتاد عادي.

القاسم المشترك للمشاريع الفائزة هو العمل دون اتصال والخصوصية منذ التصميم. يفوز GEM-4 بالمركز الأول بمساعد روبوتي للمسنين وذوي الإعاقة: حيث يقوم Gemma 4 31B بوسم تسلسلات الفيديو التدريبية، ويترجم متحكم E2B مضبوط الملاحظات والتعليمات إلى حركات. ومن بين الجوائز المتخصصة، يضبط Gem-Care نموذج Gemma 4 E2B لإعادة بناء الكلام غير المعياري ويخفض معدل الخطأ في الكلمة من 32,7% إلى 19,0%؛ أما PreVillage فيقدّم توجيهًا حواريًا بالنيبالية المكتوبة بالحروف اللاتينية على Raspberry Pi 5 بمعدل 7,5 tokens في الثانية.

🔗 المشاريع الفائزة في تحدي Gemma 4 Good


ADK يقيّم الوكلاء الصوتيين بشكل أصلي

24 أغسطس — يدعم Agent Development Kit من Google الآن تقييم الوكلاء المباشرين والصوتيين، ضمن الحلقة نفسها الخاصة بوكلاء النص. الفكرة: ينطق محاكي مستخدم أدواره الكلامية، وتقوم Gemini TTS بتوليدها صوتيًا ثم بثها إلى الوكيل، بينما تُقيَّم ردوده المنطوقة تلقائيًا. ويتفعّل الوضع المباشر بمجرد وجود كتلة live_model_config؛ وبدونها، تعمل حالات الاختبار نفسها في وضع النص.

تتوزع حالات الاختبار إلى أسلوبين: السيناريو، حيث يرتجل persona أدواره وفق خطة، والحوار الثابت المكتوب حرفيًا. أما التقييم فيمر عبر حكّام LLM يقودهم rubric بلغة طبيعية، يُكتب مرة واحدة ثم يُطبّق على الحزمة كلها. ويُنفَّذ ذلك عبر adk eval أو عبر AgentEvaluator، ما يتيح إدراج تقييمات صوتية داخل خط CI/CD. ويضيف ADK Web مفتاح تبديل بين الوضع القياسي والوضع المباشر، ويعيد بناء التفريغ النصي من التدفق الصوتي، ويرفق بكل دور مقطعًا صوتيًا قابلًا للتشغيل.

🔗 تقييم الوكلاء الصوتيين في ADK


Grok Voice Think Fast 2.0 يتصدر مؤشر Speech-to-Speech

24 أغسطس — تعلن xAI أن Grok Voice Think Fast 2.0 يتصدر مؤشر Speech-to-Speech الصادر عن Artificial Analysis، والذي يقيس أقل جودة الصوت المعاد بقدر ما يقيس قدرة الوكيل الصوتي على الاستدلال مما يسمعه، وحل مشكلة حقيقية للعميل، وإنهاء مهمة حتى نهايتها باستدعاء الأدوات.

النموذج ليس جديدًا اليوم: فمقال تقديمه يعود إلى 29 يوليو. وما تعلنه xAI هنا هو الترتيب وبعض أرقام الإنتاج. ففي Starlink، التابعة للمجموعة نفسها، يعالج Grok Voice أكثر من 15000 مكالمة واردة للدعم والمبيعات يوميًا، ويُتم أكثر من 3000 طلب أسبوعيًا، مع احتساب الصوت والدردشة معًا. وتنفيذ عائلة Think Fast لاستدلالها يجري بالتوازي مع التوليد الصوتي، ما يتجنب دفع ثمن الذكاء في صورة تأخير.

المعيارThink Fast 2.0GPT-Realtime-2.1 (High)Gemini 3.1 Flash (High)
AA Speech-to-Speech Quality Index82,9 %79,1 %69,5 %
τ-voice Bench (أداء الوكيل)56,5 %45,7 %37,7 %
الزمن حتى أول صوت0,70 s2,98 s

🔗 إعلان @SpaceXAI · تدوينة x.ai


ElevenLabs تضع كامل API الخاص بها في الطرفية

24 أغسطس — تنشر ElevenLabs الإصدار 1 من CLI الخاص بها، والذي يعرّض كامل API داخل الطرفية. ويستهدف الإعلان جمهورين بالتساوي: المطورين ووكلاء البرمجة.

ويتجلى هذا الاستهداف المزدوج في الخيارات التقنية. فالأوامر موثقة بحيث يسهل اكتشافها، كما أن agent skills مدمجة مباشرة داخل الأداة، والإخراج متاح بصيغة JSON منظمة — وهي ثلاثة شروط تمكّن الوكيل من قيادة الأداة بموثوقية بدل تفسير نص حر. ويكمل وضع dry run المنظومة: إذ يتيح معاينة نتيجة العملية قبل تنفيذها، وهو حاجز أمان مفيد عندما يكون وكيل مستقل هو من يطلق الاستدعاء. ويأتي هذا الإصدار امتدادًا لخادم MCP الرسمي الذي أطلقته الشركة في 17 أغسطس.

🔗 ElevenLabs CLI v1


MiniMax تفتح 14 يومًا من الوصول غير المحدود على GMI Cloud

24 أغسطس — من 24 أغسطس إلى 6 سبتمبر، تفتح MiniMax وصولًا غير محدود إلى نماذجها على GMI Cloud: M3 وM2.7 على جانب اللغة، وSpeech 2.8 وMusic 3.0 على جانب الصوت.

والتفصيلة اللافتة تتجاوز الحملة التجارية نفسها. ففي 21 أغسطس، اكتفت MiniMax بإعلان غامض أوحى بوصول نموذج M3، من دون مواصفات أو موعد. وبعد ثلاثة أيام، أصبح M3 متاحًا بالاسم ضمن عرض مؤرّخ، إلى جانب نموذجين صوتيين لم تظهر أرقام إصدارهما في الاتصالات السابقة للمزوّد. ولا ترافق الإعلان أي نتائج benchmarks أو مواصفات تقنية: إنها إتاحة، لا ورقة منتج.

🔗 14 يومًا من الوصول غير المحدود على GMI Cloud


أخبار قصيرة

  • Nemotron 3.5 Lightning يدخل المراكز الأربعة الأولى في PinchBench — يصنَّف نموذج NVIDIA ضمن المراكز الأربعة الأولى للنماذج ذات الأوزان المفتوحة مع 86,4% نجاحًا متوسطًا على اختبارات وكلاء OpenClaw المعيارية؛ ويحتفظ Nemotron 3 Ultra بالمركز الأول. 🔗 تغريدة @NVIDIAAI
  • Wan 3.0 متاح بالفعل عبر Pika API Club — المجمِّع، الذي أُطلق في 5 أغسطس، يتيح الوصول إلى أكثر من مئة نموذج عبر API واحدة. والإضافة من اليوم صفر تواصل المنطق الذي لوحظ سابقًا مع Seedance 2.5 في 17 أغسطس. 🔗 تغريدة @pika_labs
  • Runway توسّع Ruby ليشمل كل نماذج منصتها — مخرجات Seedance 2.5 أو Gen-4.5 أو MiniMax H3 باتت تُحوَّل إلى EXR 16-bit أو إلى ProRes وHEVC 10 و12-bit، من دون سلسلة معايرة منفصلة لكل مولّد. 🔗 تغريدة @runwayml
  • Runway تفتح هاكاثونًا حضوريًا في سان فرانسيسكو — في 30 سبتمبر، ويركز على بناء الوكلاء والتطبيقات؛ وتُقدَّم الطلبات عبر hackathon.runway.com. 🔗 تغريدة @runwayml
  • بحسب Boris Cherny، اتضح أن حقن الـ prompt قابل للحل — ويواصل الحديث عن توليد الشيفرة الخالية من الأخطاء، ويستشهد بالسابقة: فمزيج التدريب على المواءمة وقابلية التفسير الآلي انتهى إلى التغلب على المشكلة بعد سنوات طويلة. 🔗 خيط @bcherny
  • ويبنار GitHub في 25 أغسطس حول تطبيق Copilot — عرض مباشر من 18:00 إلى 19:00 بتوقيت CEST مع Pierce Boggan وJames Clancey؛ وتفصّل صفحة التسجيل Agent Merge، الذي يتولى إعادة الأساس، والمراجعات، وchecks حتى الدمج. 🔗 تغريدة @github
  • GitHub يسلّط الضوء على الموسم الثاني من بودكاسته — فيديو تقديمي للمقدّمين وحلقاتهم المفضلة من الموسم السابق، من دون إعلان منتج. 🔗 تغريدة @github
  • Grok 4.6 بنصف السعر في بوابة Nous Research — خصم 50% لمدة أسبوع، قابل للاستخدام مع الوكيل مفتوح المصدر Hermes أو عبر اشتراك SuperGrok أو X Premium+ قائم. 🔗 تغريدة @SpaceXAI
  • Codex Live Build يسلط الضوء على القيادة الصوتية — جلسة مباشرة على X مع المنشئ Alex Finn، مكرسة للعمل بلا لوحة مفاتيح في Codex على الحاسوب والهاتف. عرض توضيحي، من دون إعلان ميزة. 🔗 تغريدة @OpenAIDevs
  • HeyGen تنشر دليل prompt لمقاطع العقارات — كتابة prompts مخصصة لمقاطع avatar بجودة سينمائية، في استمرار لسلسلة العقارات الخاصة بها. 🔗 تغريدة @HeyGen
  • مرور 110 سنوات على المتنزهات الوطنية الأمريكية مع Maps وSearch وGemini — تجمع Google بين اتجاهات بحثها (طلبات التنزه للمبتدئين ارتفعت 165% خلال شهر) واستخدامات AI Mode وAsk Maps وGemini Live أثناء التحضير للسفر. لا توجد ميزة جديدة. 🔗 تدوينة blog.google

ما الذي يعنيه ذلك

بعد عدة أيام تمحورت حول الاستخدامات البرمجية، عاد العتاد إلى الواجهة — وتغيّر ما يقيسه. تستبعد NVIDIA صراحةً مقاييس الاستدلال المضبوطة على سلاسل من 1,000 إلى 8,000 token لتفضّل عليها جلسات ترميز وكيلية حقيقية مسجّلة، مع سياق متزايد واستدعاءات الأدوات والوكلاء الفرعيين، كل ذلك مشمولًا. ويتحوّل معيار القياس في الاتجاه نفسه: لم يعد الأمر يتعلق بالإنتاجية الخام، بل بالعمل لكل ميغاواط، وبالكلفة لكل مليون token. لم يعد القيد هو السيليكون المتاح، بل الطاقة التي يمكن تزويده بها. ويقول توزيع GPU/LPU الشيء نفسه من زاوية أخرى: معالجة السياق من جهة، وفك الترميز الحسّاس للكمون من جهة أخرى، لأن الاستدلال الوكالي لم يعد عبئًا متجانسًا.

الإشارة الثانية لهذا اليوم هي انفتاح المنصة. ‏NVLink Fusion يربط شرائح صمّمها آخرون، وSpaceXAI يتولّى CPUs Vera، كما تظهر Intel وMediaTek وAnnapurna Labs ضمن قائمة الشركاء. الحجة التجارية هنا هي حجة الجدول الزمني: مصنع الذكاء الاصطناعي يُخطَّط له — الطاقة، المبنى، التبريد، الشبكة — قبل وقت طويل من حسم مزيج المسرّعات، وبيع الرفّ والشبكة والأدوات بدلًا من المسرّع وحده يعني أن تصبح عنصرًا لا غنى عنه حتى لدى من يصنعون سيليكونهم بأنفسهم.

والأكثر مفاجأة أن السيادة تحتل إعلانين في اليوم نفسه. Mistral تعلن تعاونًا مع HUMAIN لنماذج ناطقة بالعربية واستخدام مراكز بيانات سعودية؛ وSakana AI توقّع مع وزارة الدفاع اليابانية لتحليل الاستخبارات. مختبران غير أمريكيين، ومؤسستان وطنيتان، ومنطق واحد: ما تسميه Mistral بالتحكم وما تسميه الحكومة اليابانية بالقوة المعلوماتية يشيران إلى القدرة على تنفيذ التدريب والاستدلال ضمن ولاية قضائية مختارة. أما بالنسبة إلى Sakana، التي تقوم هويتها العامة على أعمال مفتوحة، فإن القسم المخصّص للدفاع والتوظيفات المرتبطة به يشيران إلى خط نشاط مستدام بدلًا من عقد معزول.

ويبقى خيط خافت لكنه متماسك: تتشكّل الأدوات بحيث تُدار بواسطة وكيل، لا بواسطة إنسان فقط. تُصدر ElevenLabs أداة CLI تستهدفها حجج البيع — أوامر قابلة للاكتشاف، وJSON منظّم، ووضع dry run — وتوجّهها صراحةً إلى وكلاء البرمجة. ويمنح Codex الوصول إلى Chrome DevTools Protocol، أي إمكانية قراءة الحالة الفعلية لصفحة بدلًا من مظهرها فقط. ويضيف ADK تقييمًا صوتيًا أصليًا حتى يتوقف الوكلاء الناطقون عن أن يُتركوا للاجتهاد. وGrok Voice ينشر أحجام الإنتاج — 15,000 مكالمة يوميًا لدى Starlink — بدل الاكتفاء بدرجة ترتيب. وفي كل مرة، التحول نفسه: الخروج من النموذج الأولي يتطلب واجهات قابلة للمعالجة آليًا وقياسات قابلة لإعادة الإنتاج.


المصادر