ai-powered-markdown-translatorمقال مترجم من الفرنسية إلى العربية باستخدام gpt-5.6-sol.
ثمانية عشر إعلانًا ليومي 30 و31 أغسطس، بتوزيع شديد الاختلال: لم يشهد يوم الأحد أي منشور رسمي، وتعود تواريخ معظم المواد تقريبًا إلى يوم الاثنين. وقد جرى تدارك تعطل X المذكور في إصدار يوم 30: إذ أُعيدت مراجعة الحسابات التي تعذر الوصول إليها في ذلك اليوم على امتداد ثلاثة أيام، من دون العثور على أي إعلان مفقود.
تبرز ثلاثة محاور. أولًا نموذج غير مسبوق، يتمثل في أول نموذج عالمي للواجهات من Runway. ثم محطتان اقتصاديتان: بلوغ منصة OpenAI الإعلانية معدل إيرادات سنويًا قدره مليار دولار، وتوقيع Together AI عقد بنية تحتية بقدرة 250 MW. وأخيرًا، دورة من أدوات المطورين لدى GitHub وNVIDIA وAmp، تستكملها ثلاثة أبحاث منشورة على مدونة مجتمع Hugging Face.
Runway تطلق Solaris، أول نموذج عالمي للواجهات لديها
31 أغسطس — قدمت Runway نموذج Solaris، وهو أول نموذج ضمن عائلة تسميها المختبرات نماذج العالم للواجهات (Interface World Models). ويمكن تلخيص المبدأ في جملة واحدة: بدلًا من إنتاج شيفرة برمجية تعرض واجهة لاحقًا، يُنشئ النموذج الواجهة مباشرة، إطارًا تلو الآخر، ويستجيب للنقرات وعمليات السحب والإفلات في الوقت الفعلي.
ينطلق المنطق من ملاحظة بشأن سلسلة تطوير البرمجيات. إذ يجب أولًا تحويل النموذج الأولي إلى شيفرة قبل أن يتمكن من فعل أي شيء، ولهذا التحويل تكلفتان: يجب تحديد كل سلوك مسبقًا، ما يجعل البرمجيات جامدة قبل وصول أول مستخدم، كما تُفقد أثناء العملية ثراءات التصميم الأصلي البصرية. يلغي Solaris المرحلة الوسيطة، وتصبح الصورة بأكملها هي الواجهة.
تقنيًا، يعتمد النموذج على Gen-4.5، نموذج الفيديو من Runway، ويواصل مسار GWM-1، نموذجها العالمي العام. وتحدد مدخلات المستخدم الصورة التالية تمامًا كما يفعل النص أو الصورة، بحيث يتعلم النموذج العلاقة بين الإجراء ونتيجته البصرية من دون برمجة أي سلوك. وقد تطلب الانتقال إلى الوقت الفعلي ثلاث مراحل: جعل التوليد ذاتي الانحدار إطارًا تلو الآخر، وتقطير إزالة الضوضاء متعددة المراحل إلى بضع مراحل، ثم تدريب النموذج السريع على مخرجاته الخاصة. ويقرر LLM كيفية تطور المشهد، بينما يتولى النموذج العالمي عملية التصيير.
| المعيار الذي قيّمه المشاركون | Solaris | واجهة مبرمجة (Claude Opus 5) | أحكام متعادلة |
|---|---|---|---|
| الالتزام بالتعليمات المطلوبة | 61 % | 24 % | 13 % |
| طبيعية السلوك داخل المشهد | 71 % | 21 % | 6 % |
| الخاصية التقنية | القيمة المقاسة |
|---|---|
| النموذج الأساسي | Gen-4.5، امتدادًا لمسار GWM-1 |
| الدقة المحققة | 720p |
| عتبة التفاعلية | زمن استجابة يبلغ نحو 0,5 s |
| دراسة المستخدمين | 250 مشاركًا، و30 مثالًا، ونحو 7 500 مقارنة ثنائية |
| معيار إعادة البناء | 30 واجهة، والتشابه البنيوي (SSIM)، وواصفات DINOv3 |
تبدو الفجوة أوضح بكثير في طبيعية السلوك منها في مجرد الالتزام بالتعليمات، وترى Runway في ذلك الفرق الجوهري بين النهجين: فالواجهة المبرمجة تستطيع غالبًا إعادة إنتاج التغيير المطلوب، لكنها تتعامل معه كتحديث منفصل، بينما ينتج النموذج الذي تعلم سلوك الأجسام استجابة متسقة مع بقية المشهد. ويطرح المختبر استخدامًا ثانيًا أقل توقعًا: تدريب الوكلاء، إذ يمكن لبيئة تتجدد باستمرار أن توفر لهم واجهات دائمة التغير، بما في ذلك ترتيبات لم يسبق لها أن وُجدت.
توثق Runway أيضًا ما لا يستطيع Solaris فعله بعد، والقائمة طويلة: لا يزال النص المستقر والمقروء من أصعب مشكلات توليد الفيديو، رغم أن الواجهات تعتمد عليه أكثر من أي مجال آخر؛ ويتطلب الإسناد إلى الحقائق تكييف التوليد استنادًا إلى بيانات موثوقة؛ ولا يزال الاتساق عبر الجلسات الطويلة موضوعًا بحثيًا؛ كما يجب أن تعمل الواجهة المُنشأة مع التقنيات المساعدة وواجهات API الخاصة بإتاحة الوصول. ويجري التحضير للإطلاق العام مع الشركاء، فيما يتاح الوصول المبكر عبر نموذج تسجيل.
Today, we’re sharing new research on Solaris, our first Interface World Model. Solaris is a new kind of operating system that generates interactive interfaces frame by frame, in real time, with no code.
🇸🇦 نشارك اليوم أبحاثًا جديدة حول Solaris، أول Interface World Model لدينا. وSolaris نوع جديد من أنظمة التشغيل يُنشئ واجهات تفاعلية إطارًا تلو الآخر، في الوقت الفعلي، ومن دون برمجة. — @runwayml على X
ChatGPT Ads يبلغ معدل إيرادات سنويًا قدره مليار دولار ويفتح خدمته الذاتية في أربع مناطق جديدة
31 أغسطس — نشرت OpenAI تدوينة عن ChatGPT Ads، منصتها الإعلانية المدمجة في ChatGPT، وأعلنت أن المنصة بلغت معدل إيرادات سنويًا (annualized revenue run rate) قدره مليار دولار في أقل من 200 يوم على إطلاقها. ويستحق هذا التفصيل التوضيح منذ البداية: فالأمر لا يتعلق بتحصيل مليار دولار، بل بإسقاط إيرادات الفترة الأخيرة على اثني عشر شهرًا. فمنصة إعلانية لم يمض على وجودها مئتا يوم لا يمكنها، بحكم الواقع، أن تكون قد حصلت إيرادات عام كامل بهذا المعدل. ومن المقرر الإعلان لاحقًا اليوم عن إتاحة الشراء بالخدمة الذاتية عبر Ads Manager في الهند وأوروبا والشرق الأوسط وشمال أفريقيا.
تقدم OpenAI الإعلانات باعتبارها إحدى ركائز نموذجها الاقتصادي، إلى جانب اشتراكات المستهلكين وعروض الشركات وواجهات API التي تُحاسب بحسب الاستخدام، وتربطها صراحة بتمويل المستوى المجاني الذي يُبقي ChatGPT متاحًا لأكثر من مليار مستخدم نشط أسبوعيًا. وتحكم النظام أربعة التزامات: تُعرَّف الإعلانات دائمًا بوضوح وتُفصل عن الإجابات، ولا تؤثر الإعلانات في الإجابات المقدمة، ولا يستطيع المعلنون الوصول إلى المحادثات الخاصة، ويتحكم المستخدم في درجة تخصيص تجربته الإعلانية.
| المقياس الذي نشرته OpenAI | القيمة المعلنة |
|---|---|
| معدل الإيرادات السنوي (إسقاط) | مليار دولار |
| المدة المنقضية منذ الإطلاق | أقل من 200 يوم |
| المعلنون على المنصة | عشرات الآلاف |
| البلدان المشمولة بالفعل | أكثر من 40 |
| الأسواق الجديدة المفتوحة للخدمة الذاتية | الهند، وأوروبا، والشرق الأوسط، وشمال أفريقيا |
| شركاء التقنية والقياس | أكثر من 50 |
| مستخدمو ChatGPT النشطون أسبوعيًا | أكثر من مليار |
| العائد المذكور على الإنفاق الإعلاني خلال 28 يومًا | 3x، لدى أحد معلني التجارة الإلكترونية |
| الزيارات الإعلانية الآتية من عملاء جدد | أكثر من 80 %، لدى شريك تقني |
يتمثل المسار الموصوف في الانتقال من المبيعات المُدارة إلى منصة مفتوحة الوصول. وقد اعتمد النموذج الأولي على الوكالات والشركاء؛ ثم أتاح وصول Ads Manager في مايو المنصة الإعلانية للشركات الصغيرة والمتوسطة، التي تمثل الآن جزءًا مهمًا من النشاط. وعلى صعيد الأدوات، تشكل المزايدة وفق CPC والمزايدة المحسنة للنتائج (outcome-optimized bidding) غالبية الحملات، بينما يشكل Pixel وConversions API أساس القياس. وتشير OpenAI أيضًا إلى أن المعلنين من خارج الولايات المتحدة يمثلون حصة متنامية من الإيرادات.
وفي المرحلة المقبلة، تعلن الشركة عن أسواق وصيغ وأهداف وخيارات شراء جديدة، وتقول إنها تريد استكشاف طرق أكثر اندماجًا في طبيعة ChatGPT لتفاعل الشركات مع المستهلكين داخله، أي صيغ أقل انفصالًا عن المحادثة مقارنة بالإعلانات الحالية.
🔗 OpenAI — محطة بارزة في توسيع الوصول إلى AI
Together AI: قدرة 250 MW في السعودية، وGLM-5.3 يتصدر مؤشر الوكلاء، وعميل جديد
31 أغسطس — أعلنت Together AI توقيع اتفاق بنية تحتية لإنشاء مركز بيانات بقدرة 250 MW في السعودية بالتعاون مع HUMAIN. ويتوقع المختبر أن يحقق نشاط هذا المركز إيرادات قدرها 5 مليارات دولار سنويًا، ويقدم العملية باعتبارها إحدى أضخم اتفاقيات البنية التحتية للـAI المُبرمة لصالح open source. وقد ثُبت المنشور على حساب المختبر، ما يميزه عن رسائله المعتادة بشأن النماذج.
يستدعي هذا الرقم الحذر في قراءته، لأن منشور الإعلان يجمع ثلاثة مقاطع بلا فعل ويترك الجهة المقصودة بمبلغ 5 مليارات دولار غامضة. لكن تغطية New York Times تحسم الأمر: فالمبلغ يصف الإيرادات المتوقعة من مركز البيانات هذا، لا إيرادات الشركة. ويؤكد حجم الرقم ذلك، إذ يقدر المقال نفسه قيمة Together AI بنحو 8,3 مليارات دولار في يوليو 2026؛ فلا تحقق شركة مقيمة بهذا المستوى إيرادات سنوية قدرها 5 مليارات دولار.
يستحق هيكل الاتفاق نفسه الاهتمام، لأنه ليس عملية شراء للسعة. فبحسب New York Times أيضًا، توفر HUMAIN عدد 120 000 من أشباه الموصلات إلى جانب قدرة 250 MW، وتشغل Together AI هذه الرقائق مقابل منحها حصة من إيراداتها. وبالتالي، لا يمول المختبر البنية التحتية، بل يستخدمها مقابل جزء من رقم أعماله. وهذا بالضبط ما تؤكده سلسلة المنشورات حين تقارن الشراكات التي تتيح القدرة الحاسوبية بسباق يجمع فيه كل طرف ملياراته الخاصة. وتندرج HUMAIN، التي أُنشئت العام الماضي بمبادرة من ولي العهد محمد بن سلمان، ضمن الجهود السعودية لبناء صناعة AI وتقليل اعتماد البلاد على النفط.
تركز الحجة المطروحة في سلسلة المنشورات على طبيعة العائق أكثر من حجم القدرة. تصف Together AI الطاقة بأنها عنق الزجاجة الحقيقي حاليًا، والاتفاق بأنه وسيلة للوصول إلى نطاق لا تستطيع شركة بحجمها تمويله من ميزانيتها الخاصة. ويقارن المختبر هذا الهيكل صراحة بنموذج المختبرات المغلقة، التي ظلت بنيتها التحتية ممولة طويلًا من شركات hyperscalers.
توضح هذه القراءة المكانة الخاصة لـTogether AI في المنظومة: فالمختبر لا ينشر نماذج حدودية، بل يقدم نماذج الآخرين — DeepSeek وGLM وKimi وMiniMax وNemotron. ولذلك لا يتمثل قيده في البحث، بل في القدرة الحاسوبية المتاحة لخدمة النماذج مفتوحة الأوزان بتكلفة تقل عن واجهات API الاحتكارية. ويستجيب عقد بقدرة 250 MW مباشرة لهذا الاحتياج.
| عنصر الاتفاق | القيمة المذكورة |
|---|---|
| قدرة مركز البيانات | 250 MW |
| أشباه الموصلات التي توفرها HUMAIN | 120 000 |
| الإيرادات السنوية المتوقعة لمركز البيانات | 5 مليارات دولار |
| المقابل المدفوع إلى HUMAIN | حصة من إيرادات Together AI |
| تقييم Together AI في يوليو 2026 | 8,3 مليارات دولار |
| الشريك الصناعي | HUMAIN |
| الموقع | السعودية |
| تاريخ الإعلان ووقته | 31 أغسطس 2026، 13:26 UTC |
وثمة نقطة أخيرة لا تعلق عليها Together AI في سلسلة منشوراتها: إذ يشير المقال نفسه إلى أن إقامة المنشأة في السعودية تتيح تجاوز الاعتراضات التي تواجه إنشاء مراكز البيانات في الولايات المتحدة.
We just signed one of the largest AI infrastructure deals for open source, period. 250MW data center. $5B+ in annualized revenue. Built with @HUMAIN in Saudi Arabia.
🇸🇦 لقد وقعنا للتو واحدة من أضخم اتفاقيات البنية التحتية للـAI لصالح open source، وانتهى الأمر. مركز بيانات بقدرة 250 MW. أكثر من 5 مليارات دولار من الإيرادات السنوية. بُني مع @HUMAIN في السعودية. — @togethercompute على X
GLM-5.3 يتقاسم صدارة مؤشر الوكلاء من Artificial Analysis
31 أغسطس — لليوم السادس على التوالي، يتصدر GLM-5.3 الأخبار: فبعد إتاحة Z.ai لأوزانه في 28 أغسطس ونشر النموذج على serverless API من Together AI في 29 أغسطس، يأتي هذه المرة تصنيف من جهة خارجية ليميزه. إذ حصل النموذج على 59 نقطة في مؤشر الوكلاء من Artificial Analysis. وتصوغ Together AI النتيجة بدقة: يتعادل GLM-5.3 على المركز الأول (ties for the top spot) ويتفوق (beating) على GPT-5.6 Sol وClaude Fable 5. وبالتالي، يقتصر التفوق على هذين النموذجين؛ أما Claude Opus 5، الذي حصل أيضًا على 59، فيتقاسم الصدارة مع GLM-5.3.
وتتمثل النقطة الأكثر دلالة في المنهجية. فلم تدرب Z.ai نموذجًا أساسيًا جديدًا، بل أبقت على قاعدة GLM-5.2، وجاء التحسن بأكمله من مرحلة ما بعد التدريب، التي وُسعت على ثلاثة محاور متزامنة: زيادة عدد البيئات طويلة الأفق، وزيادة تنوع المهام، وتخصيص compute أكبر للـRL.
| النموذج المُقيَّم | النتيجة في مؤشر الوكلاء |
|---|---|
| GLM-5.3 (max) | 59 |
| Claude Opus 5 (max) | 59 |
| GLM-5.3 Flash | 58 |
| GPT-5.6 Sol (max) | 58 |
| Claude Fable 5 (مع التراجع) | 57 |
Greptile تختار Together AI مزودًا رئيسيًا للاستدلال
31 أغسطس — الإشارة الأخيرة خلال اليوم أكثر تواضعًا: اختارت Greptile، وهي أداة لمراجعة الشيفرة باستخدام AI تعتمد عليها أكثر من 11 000 فريق، شركة Together AI مزودًا رئيسيًا للاستدلال. وتحلل الأداة pull requests مع السياق الكامل للمستودع، في نمط أحمال يتكون من سياقات طويلة وأحجام ضخمة من tokens، وهو بالضبط الاستخدام الذي يصبح فيه فارق التكلفة بين النماذج مفتوحة الأوزان وواجهات API الاحتكارية عاملًا حاسمًا.
GitHub Copilot في VS Code: تلخيص أربعة إصدارات من أغسطس في سجل تغييرات واحد
31 أغسطس — نشرت GitHub ملخص أغسطس 2026 لخدمة Copilot في Visual Studio Code، والذي يغطي أربعة إصدارات من المحرر، من v1.132 إلى v1.135. ويتمحور هذا الإصدار حول تنظيم العمل باستخدام عدة وكلاء: فلم تعد نافذة Agents مجرد قائمة بالمحادثات، بل أصبحت مساحة تتعايش فيها عدة جلسات ويمكن استعادتها بالحالة التي كانت عليها.
على صعيد الجلسات، تُرتب المحادثات جنبًا إلى جنب في مجموعات أفقية أو عمودية، ويُستعاد التخطيط عند العودة. يفتح الأمر /btw محادثة جانبية تشارك سياق المحادثة الرئيسية وذاكرة التخزين المؤقت للموجّه بينما تواصل المحادثة الرئيسية عملها، مما يتيح طرح سؤال جانبي من دون مقاطعة وكيل قيد التنفيذ. ويتيح عنصر تحكم في التسلسل الزمني للموجّهات، يمكن الوصول إليه من هامش السجل، الانتقال مباشرة إلى موجّه ومراجعة تعديلات الملفات الناتجة عنه. كما يسمح Agent Host لعدة نوافذ VS Code بالاتصال بالجلسة نفسها، ويستعين أمر تجريبي /rubber-duck بنموذج تكميلي لإبراز التفاصيل التي أُغفلت والحالات الحدّية.
تتعلق نقطتان مباشرة بمكانة Claude داخل المحرر: يتيح إعداد تجريبي فتح نافذة Agents من دون تسجيل الدخول إلى GitHub بمجرد إعداد Claude باستخدام مفتاح API، كما تسمح جلسات Claude بالتبديل في أي وقت بين نماذج اشتراك Anthropic ونماذج اشتراك Copilot. ويتيح VS Code أيضًا تثبيت إضافات وكلاء قابلة للنقل ومتوافقة مع معيار Agent Plugins 1.0، ويمكن استخدامها في عملاء وكلاء متوافقين آخرين.
| مجال سجل التغييرات | أبرز المستجدات |
|---|---|
| الجلسات ومسارات العمل | محادثات جنبًا إلى جنب، /btw، التسلسل الزمني للموجّهات، Agent Plugins 1.0، /rubber-duck، Agent Host |
| Claude في VS Code | نافذة Agents من دون تسجيل الدخول إلى GitHub عبر مفتاح API، والتبديل بين نماذج Anthropic وCopilot |
| المحادثة والمراجعة | البحث في السجل، التمرير الثابت، محرر Markdown هجين، وعدد الرموز لكل نموذج |
| المتصفح المدمج | إضافة تعليقات توضيحية إلى عناصر HTML دفعة واحدة، إعادة التحميل التلقائي، ومحرر HTML افتراضي |
| الإملاء | متعدد اللغات على الجهاز، تعليمات التنظيف، وتنظيف ملائم للصدفة |
وأخيرًا، اكتسبت المحادثة أدوات القراءة التي باتت ضرورية بعدما طالت المحادثات: بحث نصي في كامل السجل مع مراعاة حالة الأحرف والكلمات الكاملة والتعبيرات النمطية، وتمرير ثابت يُبقي الموجّه الحالي ظاهرًا، وعرض استهلاك الرموز بحسب النموذج عند تمرير المؤشر فوق تذييل الرد، مع التمييز بين الإدخال والإدخال المخزّن مؤقتًا والإخراج؛ وهي شفافية مفيدة منذ أن أصبحت الفوترة تعتمد على ذاكرة التخزين المؤقت. ويتيح المتصفح المدمج تحديد عدة عناصر HTML في صفحة وإضافة تعليقات توضيحية إليها لمعالجة ملاحظات الواجهة دفعة واحدة، فيما يعمل الإملاء على الجهاز وبعدة لغات، ويحافظ على صياغة الأوامر عند الإملاء داخل طرفية بدلًا من إدراج علامات الترقيم المنطوقة.
🔗 سجل تغييرات GitHub — Copilot في VS Code، إصدارات أغسطس 2026
NVIDIA تضع مكوّناتها البرمجية في علم الأحياء والمركبات ذاتية القيادة
31 أغسطس — نشرت NVIDIA دليلًا تعليميًا يوثّق عملًا تكامليًا أُنجز مع Anthropic: بات BioNeMo Agent Toolkit قابلًا للاستخدام من Claude Science، بيئة البحث العلمي التابعة لـ Anthropic. وتتمثل المشكلة المستهدفة في الأدوات المتخصصة؛ فقد يستطيع وكيل عام إدراك أن مهمة ما تتطلب طي بروتين، من دون أن يعرف أي نموذج ينبغي تشغيله أو كيفية تنسيق الطلب أو المعلمات المهمة. وتجمع حزمة الأدوات أكثر من عقد من نماذج BioNeMo ومكتباته ومسارات عمله — في علم الأحياء والكيمياء وعلم الجينوم واكتشاف الأدوية — في مهارات يمكن للوكيل استدعاؤها. وفي اختباراتها المعيارية الداخلية، أعلنت NVIDIA ارتفاع دقة المهام من 60 إلى 100% وتضاعف كفاءة الرموز تقريبًا.
يربط الدليل التعليمي بين ثلاث خدمات مصغرة من NIM: خدمة MSA Search لبناء السياق التطوري، ثم OpenFold3 وBoltz-2 للتنبؤ بالبنية بصورة مستقلة. ويتعلق العرض الأكثر دلالة بدور محاذاة التسلسلات المتعددة؛ فمن دونها تنهار ثقة الواجهة في كلا النموذجين، ولا تُحدث زيادة ميزانية أخذ العينات أي فرق. وهناك تحفظان جديران بالذكر: حاجز العتاد، مع الحاجة إلى GPU من نوع L40S أو H100 ونحو 700 غيغابايت من مساحة التخزين، والحذر في التفسير الذي تبديه NVIDIA، إذ تذكّر بأن درجة الثقة لا تثبت وجود تفاعل، وتعرض تقارب نموذجين مستقلين بوصفه فرضية قوية لا دليلًا قاطعًا.
| مقياس ثقة الواجهة (iPTM) | OpenFold3 | Boltz-2 |
|---|---|---|
| مركّب غير متماثل مع محاذاة MSA | 0,85 | 0,82 |
| مركّب غير متماثل من دون محاذاة MSA | 0,14 | 0,19 |
| RMSD لذرات Cα في النواة، أحادي القسيمة مقابل المركّب غير المتماثل | 0,68 Å | 0,65 Å |
🔗 دليل NVIDIA التعليمي — BioNeMo NIM في Claude Science
Omniverse NuRec يكيّف منظومة إدراك لمركبة لم توجد بعد
31 أغسطس — في اليوم نفسه، نشرت NVIDIA دليلًا تقنيًا ثانيًا، مخصصًا هذه المرة للقيادة الذاتية. وتنطلق الفكرة من أن منظومة الإدراك تتشكل وفقًا للمركبة التي تحملها: فعند نقلها من مركبة SUV إلى سيارة سيدان، لا تعود تدرك العالم بالطريقة نفسها، لأن مواضع المستشعرات والمعايرة ومجالات الرؤية والحجب وهندسة هيكل السيارة تتغير جميعها. ويُعد جمع مجموعة بيانات واقعية لكل خط من خطوط المركبات وإضافة التعليقات التوضيحية إليها مكلفًا، وغالبًا ما يظل مستحيلًا في بداية التطوير.
يقترح Omniverse NuRec إعادة استخدام الرحلات المسجلة مسبقًا: فهو يعيد بناء كل مشهد، ثم يعرضه من منظور إعداد مستشعرات المركبة المستهدفة. ويمكن للفرق عندئذ معرفة كيف سيبدو سيناريو ما من خلال الترتيب الجديد للكاميرات، وأين تؤدي التغييرات الهندسية إلى ظهور نقاط عمياء. وتوضح NVIDIA أن بيانات القيادة الواقعية تظل ضرورية لتثبيت الأداء والتحقق منه؛ إذ تُستخدم البيانات الاصطناعية لتكييف النماذج قبل توفر مجموعة بيانات مخصصة، لا لتحل محلها. وتُوزع المشاهد على Hugging Face بتنسيق USDZ، مع مستودع مهارات مخصص لوكلاء البرمجة.
🔗 دليل NVIDIA التعليمي — Omniverse NuRec
Amp يربط غرفة مكالمات صوتية ومرئية بكل سلسلة محادثة
31 أغسطس — يربط Amp غرفة محادثة مباشرة بكل سلسلة محادثة. وتفتح الميزة المسماة مساحة للتحدث مساحة صوتية ومرئية مرتبطة بسلسلة المحادثة نفسها: تكفي ضغطة على مفتاح Enter للدخول إليها وتشغيل الكاميرا ومشاركة الشاشة، بينما يواصل الوكيل عمله في السلسلة نفسها.
وتتمثل الحجة المطروحة في إزالة الخطوات الوسيطة، ويمتد هذا النهج من المسار التعاوني الذي اتبعه Amp منذ الصيف: مشاركة التحكم في orb بين زملاء الفريق (اللعب الجماعي، 22 يوليو)، ثم الدعوة عبر الإشارة مباشرة داخل سلسلة محادثة (مرّر الـ Orb إلى الجهة اليسرى، 19 أغسطس). وهكذا تصبح سلسلة المحادثة نقطة الالتقاء الوحيدة للفريق والوكيل. ويقر Amp أيضًا بأن النطاق لا يزال مفتوحًا: إذ تُذكر جلسات توليد الأفكار والسبورة البيضاء أو المحادثة مع Puck ووكلاء آخرين بوصفها مسارات مستقبلية، لا ميزات متاحة حاليًا.
No links to paste, no calendar invite, no other app. The call lives where the work lives.
🇸🇦 لا روابط للصقها، ولا دعوات تقويم، ولا تطبيقات أخرى. تُعقد المكالمة حيث يوجد العمل. — Amp، ملاحظة مساحة للتحدث
VLANeXt، قاعدة شيفرة موحدة لنماذج الرؤية واللغة والفعل
31 أغسطس — نشر فريق على مدونة Hugging Face مشروع VLANeXt، وهو قاعدة شيفرة بحثية مخصصة لنماذج الرؤية واللغة والفعل (vision-language-action، VLA). ومبدأ هذه النماذج بسيط: يربط نموذج الرؤية واللغة ما يراه الروبوت بتعليمات بلغة طبيعية، ثم يستخلص منها فعلًا في العالم المادي.
المشكلة المستهدفة منهجية. فالمجال يتقدم بسرعة لكنه يتشظى: إذ تتغير من منشور إلى آخر البنية الأساسية ورأس السياسة وتمثيل الأفعال واستراتيجية التدريب وبروتوكول التقييم. وتوصف النتائج بكثرة بأنها قوية، لكن يظل من الصعب حسم ما يجعل نموذج VLA فعّالًا حقًا، بسبب عدم القدرة على عزل المتغيرات.
وبدلًا من إضافة بنية أخرى، انطلق المؤلفون مجددًا من قاعدة مرجعية من نوع RT-2 / OpenVLA واستكشفوا فضاء التصميم منهجيًا لاستخلاص وصفة منه، وهو العمل الذي أسفر عن ورقة ICML «VLANeXt: Recipes for Building Strong VLA Models». ومنذ ذلك الحين، توسعت قاعدة الشيفرة إلى ما يتجاوز هذه الدراسة، لتشمل بنى أساسية بأحجام مختلفة، وتعلّم الأفعال الكامنة، والنمذجة التنبؤية في الفضاء الكامن، ونمذجة العالم والفعل. وهي توفر ست نقاط انطلاق: VLANeXt-LAM و-S و-L و-XL و-JEPA و-WAM.
أخبار موجزة
- Claude Code 2.1.252، إصدار تصحيحي فقط — أربعة إصلاحات ولا ميزات جديدة: فشل أوامر Bash على بعض أجهزة Mac، وعدم حفظ خيار «السماح دائمًا» في مشروع يفتقر إلى ملف
.claude/settings.local.json، وتجمّد جلسات Remote Control لعدة دقائق بعد انتهاء أداة عند تدهور الاتصال بـ claude.ai، وإشعارات مهام الخلفية ذات المخرجات الضخمة التي تتسبب في تجاوز الحد الأقصى لحجم طلبات API. 🔗 سجل تغييرات Claude Code - Flow يتيح التحكم في الصورتين الأولى والأخيرة على سطح المكتب — أفاد Google Flow بأن التحكم في الصورتين الأولى والأخيرة في Gemini Omni 1.1 Flash، الذي قُدّم مع النموذج في 27 أغسطس، بات متاحًا الآن على سطح المكتب. والاستخدام الذي يسلّط الضوء عليه هو تقديم الصورة نفسها عند الطرفين لإنتاج مقطع متكرر. 🔗 منشور @FlowbyGoogle
- اليوم الأخير للمنافسة على جائزة Grok Imagine — ذكّرت xAI بأن الموعد النهائي لمسابقة الفيديو التي انطلقت في 17 أغسطس كان في اليوم نفسه. وكان على المشاركين إنتاج مشهد مقتبس من الأوديسة لهوميروس يبرز قدرات النموذج في الفيديو والصوت؛ وتتقاسم أفضل ثلاثة أعمال 175 000 دولار، بجوائز تبلغ على الترتيب 100 000 و50 000 و25 000 دولار. 🔗 منشور @grok
- QwenCloud يغلق Arena ويعلن جلسة في بانكوك — أغلق تحدي Qwen Cloud Arena، المخصص لوكلاء توليد المحتوى للتجارة الإلكترونية العابرة للحدود، باب التقديم عند منتصف الليل بتوقيت بكين بعد مشاركة أكثر من 800 شخص، على أن تبدأ مرحلة المراجعة في اليوم التالي. وكانت QwenCloud قد أعلنت قبل ساعات عن جلسة في Qwen Conference في بانكوك يوم 4 سبتمبر، حول التموضع نفسه عبر ثلاث نقاط دخول — موقع الويب وSkills وCLI — الذي سبق عرضه في هونغ كونغ. 🔗 إغلاق Arena · 🔗 جلسة بانكوك
- GitHub يطلق استطلاعًا حول تكييفات إتاحة الوصول للمطورين — تريد الشركة توثيق الأدوات وإعدادات المنتجات والتكييفات الشخصية التي تتيح العمل في ظروف جيدة، من دون اشتراط الإفصاح عن وجود إعاقة أو اعتبار الشخص نفسه مستخدمًا لأدوات إتاحة الوصول. تُقبل الردود حتى 30 سبتمبر. والموضوع غير مرتبط بالذكاء الاصطناعي. 🔗 منشور @github
- otoSpeech Task، مجموعة بيانات ثنائية الاتجاه بالكامل منشورة مع مهمتها — عشرون ساعة من المحادثات باللغة الإنجليزية بين متحدثين، و58 جلسة موزعة على سبع مهام تعاونية، و11 025 حدثًا مؤرخًا زمنيًا، بموجب ترخيص CC BY 4.0. وتكمن خصوصيتها في أن الصور التي يراها كل متحدث، وأفعاله، والإجابات المرجعية، تظهر على الخط الزمني نفسه الذي يظهر عليه الصوت. 🔗 منشور على Hugging Face
- YOLO26-RGB، نموذج لإزالة المطر مشتق من رأس تقدير العمق — نموذجان لإزالة المطر نتجا عن استبدال رأس العمق ذي القناة الواحدة في YOLO26-depth برأس استعادة RGB ذي 3 قنوات: 5,25 M من المعلمات بسرعة تقارب 109 صور/ثانية بدقة 1080p، و12,13 M بسرعة تقارب 92 صورة/ثانية مقابل تحسن إضافي في الجودة قدره 0,1 dB. 🔗 منشور على Hugging Face
ما الذي يعنيه ذلك
توليد الواجهة بدلًا من الشيفرة التي تنتجها. ينقل Solaris الحد الفاصل بين التصميم والتنفيذ. تعتمد سلسلة البرمجيات الحالية بأكملها على ترجمة — يتحول النموذج الأولي إلى شيفرة، وتنتج الشيفرة عرضًا — ويقيس Runway تكلفة هذه الترجمة: فمن بين 30 واجهة أُعيد بناؤها انطلاقًا من لقطة شاشة، تفقد جميع النماذج متعددة الوسائط المختبرة معلومات، ويزداد التدهور مع الثراء البصري. إن حذف المرحلة الوسيطة طرح جذري، والقيود التي يسردها المختبر نفسه توضح موضع تعثره: نص لا يستقر في مكانه، وعدم وجود أي ارتكاز واقعي مضمون، وإتاحة يجب بناؤها بالكامل لأن الصورة المولدة لا تعرض أي بنية لقارئات الشاشة. هذه عقبات جوهرية وليست مجرد تفاصيل نهائية.
طريقتان لدفع تكلفة الحوسبة، أُعلنتا في اليوم نفسه. تعرض OpenAI في منصتها الإعلانية معدل إيرادات سنويًا قدره مليار دولار — وهو توقع لاثني عشر شهرًا، وليس مبالغ محصلة — وتتبناه ركيزة اقتصادية على قدم المساواة مع الاشتراكات: إذ يمول الإعلان المستوى المجاني لخدمة تقول إن لديها أكثر من مليار مستخدم أسبوعيًا. أما Together AI فلا تحقق الدخل من جمهور ولا تشتري مزيدًا من سعتها، بل تحصل على 250 MW و120,000 شريحة في المملكة العربية السعودية مقابل حصة من إيراداتها، وتحدد الطاقة بوصفها عنق الزجاجة الحقيقي في القطاع. تستجيب الشركتان للقيد نفسه من طرفين متعاكسين في السلسلة، ولا تخلو أي من الاستجابتين من التبعات: فإحداهما تُدخل مصلحة تجارية في المنتج، والأخرى تنقل البنية التحتية إلى حيث تواجه مقاومة سياسية أقل.
تجري المنافسة الوكيلة الآن بعد التدريب المسبق. تكمن أهمية نتيجة GLM-5.3 على المؤشر الوكيلي لـArtificial Analysis أساسًا في كيفية تحقيقها: فقد أبقت Z.ai على قاعدة GLM-5.2 ولم توسع نطاق سوى مرحلة ما بعد التدريب — بيئات ذات أفق زمني طويل، وتنوع المهام، وحوسبة RL. إذا لم يعد بلوغ صدارة تصنيف وكيلي يتطلب إعادة تدريب نموذج أساسي، فإن بند التكلفة الأثقل يتوقف عن كونه العامل الوحيد المحدد للتصنيف، وتتقلص دورة تحديث النموذج بالقدر نفسه. وهذا أيضًا التفسير الأكثر اقتصادًا لتسلسل الأيام الستة الذي شهده هذا النموذج، من الأوزان المفتوحة في 28 إلى هذا التصنيف في 31.
تُعاد هيكلة أدوات المطورين حول عدة وكلاء في الوقت نفسه. تخصص سجل تغييرات Copilot دورة كاملة للتعامل مع نافذة Agents بوصفها مساحة عمل — محادثات متجاورة، ومحادثة جانبية تشارك ذاكرة التخزين المؤقت للموجّه، وخطًا زمنيًا للموجّهات، ونوافذ متعددة متصلة بالجلسة نفسها — لا بوصفها مجرد قائمة محادثات. ويربط Amp غرفة اتصال بالسلسلة كي يجري النقاش البشري حيث يعمل الوكيل. وأخيرًا، تجمع NVIDIA عشر سنوات من المكتبات العلمية في skills قابلة للاستدعاء، وتوفر مستودع skills ثانيًا لإعادة بناء مشاهد القيادة. تتلاقى ثلاثة أطراف شديدة الاختلاف حول الفكرة نفسها: ما ينقص الوكيل لم يعد قدرة النموذج، بل السياق المشترك والأدوات المتخصصة التي يمكن إتاحتها له.
المصادر
- Runway — تقديم Solaris
- Runway — إعلان Solaris على X
- OpenAI — محطة بارزة في توسيع الوصول إلى AI
- Together AI — اتفاقية بنية تحتية بقدرة 250 MW مع HUMAIN
- Together AI — GLM-5.3 على المؤشر الوكيلي لـArtificial Analysis
- Together AI — Greptile بوصفه مزود الاستدلال الرئيسي
- سجل تغييرات GitHub — Copilot في VS Code، إصدارات أغسطس 2026
- NVIDIA — BioNeMo NIM للتنبؤ ببنية البروتين في Claude Science
- NVIDIA — Omniverse NuRec والإدراك متعدد المركبات
- Amp — مساحة للتحدث
- VLANeXt، قاعدة شيفرة موحدة لنماذج الرؤية واللغة والفعل
- سجل تغييرات Claude Code
- Google Flow — الصورتان الأولى والأخيرة على سطح المكتب
- xAI — اليوم الأخير من مسابقة Grok Imagine
- QwenCloud — اختتام Qwen Cloud Arena
- QwenCloud — جلسة في مؤتمر Qwen في بانكوك
- GitHub — استطلاع حول أدوات الإتاحة وتكييفاتها
- otoSpeech Task، مدونة محادثات مزدوجة الاتجاه بالكامل
- YOLO26-RGB، نموذج لإزالة المطر من الصور