ai-powered-markdown-translatorمقالة مترجمة من fr إلى ar باستخدام gpt-5.4-mini.
يوم حافل جدًا لبِنى البنية التحتية الوكيلة: أطلقت Anthropic أدوات computer use وbrowser tool وSkills API وFiles API من مرحلة التجريب إلى الإتاحة العامة على Claude Platform، بينما يستقر GitHub Copilot في Slack وMicrosoft Teams. وعلى صعيد النماذج، تنشر DeepSeek أول نموذج متعدد الوسائط لها، وتطلق Pika Labs مُركِّبًا صوتيًا يَعِد بنسبة سعر/أداء غير مسبوقة. وبين هذين المسارين، هناك مجموعة بيانات ضخمة ذاتية التمركز، ودراسة عن انحيازات المعايير المرجعية في التعرّف على الكلام، وعشرات التحديثات اللافتة لدى Google DeepMind وGitHub وZ.ai وQwen وHarvey وأدوات توليد الفيديو/الصوت.
Claude Platform: computer use وbrowser tool وSkills API وFiles API في الإتاحة العامة
20 أغسطس — تعلن Anthropic الانتقال إلى الإتاحة العامة لأربع لبنات لبناء وكلاء على Claude Platform: computer use، وbrowser tool، وSkills API، وFiles API. والهدف المعلن هو تقليل عدد عمليات الذهاب والإياب اللازمة لأتمتة مهمة داخل تطبيق لا يملك API، وتمكين بناء Claude Managed Agents اعتمادًا على skills مُصدَّرة بإصدارات وملفات قابلة لإعادة الاستخدام.
تتيح computer_toolset_20260801 الجديدة لـ Claude تنفيذ عدة إجراءات في الجولة الواحدة (نقرة، إدخال، ضغط مفتاح، التقاط لقطة شاشة) بدلًا من ذهاب وإياب واحد لكل إجراء منفصل. وتشير Anthropic إلى أن العملاء في الوصول المبكر لاحظوا انخفاضًا بنسبة 20 إلى 40% في عدد عمليات الذهاب والإياب لكل مهمة. ويتطور browser tool بالتوازي مع browser_toolset_20260801 : فبدل استهداف البكسلات — وهو أمر هشّ عند أي تغيير طفيف في التخطيط — يتلقى Claude الآن بنية الصفحة ويمكنه التصرف بناءً على مراجع العناصر.
وعلى مستوى الـ API، تتيح Skills API رفع إجراء الفريق مرة واحدة، ثم إصدار نسخ منه وربطه بـ version_id محدد أو بـ latest. كما تكسب Files API وسيطة expires_in_seconds، وحدًّا أعلى لمعدل الطلبات أكبر بخمس مرات (500 طلب في الدقيقة) وحصة 1 تيرابايت لكل مؤسسة. كما أصدرت Anthropic مواءمًا لِـ AG-UI خاصًا بـ Managed Agents، يربط كل سلسلة محادثة بجلسة مُدارة ويبث النص واستدعاءات الأدوات والاستدلال إلى الواجهة.
| اللبنة | جديد اليوم |
|---|---|
| Computer use | computer_toolset_20260801، حتى -40% من عمليات الذهاب والإياب لكل مهمة |
| Browser tool | browser_toolset_20260801، استهداف عبر مرجع عنصر الصفحة |
| Skills API | إصدار نسخ، وربط بـ version_id أو latest |
| Files API | 500 طلب/دقيقة (x5)، حصة 1 تيرابايت لكل مؤسسة |
GitHub Copilot يصل إلى Slack وMicrosoft Teams
21 أغسطس — يصل GitHub Copilot إلى معاينة عامة على Slack وMicrosoft Teams. والمبدأ متطابق في الحالتين: ذكر @GitHub في رسالة مباشرة أو قناة أو سلسلة يفتح جلسة وكيل سحابي قادرة على الإجابة عن أسئلة حول الشيفرة ونشاط GitHub، وفرز تقارير الأخطاء، والتحقيق في حالات الفشل، وتنفيذ تغييرات داخل صندوق رمل سحابي آمن، ثم فتح pull requests مع رابط إلى المحادثة الأصلية.
في Slack، يستند التكامل إلى Slack Code، العرض الوكلي الجديد من Slack الذي أُطلق في عطلة نهاية الأسبوع نفسها: يستطيع GitHub Copilot فتح قنوات مخصّصة للشيفرة حيث يراجع الفريق diffs ويعاين لقطات العرض دون تلويث المحادثة الأصلية. أما في Teams، فتتحول المناقشة إلى جلسة وكيل جماعية يمكن للجميع متابعتها وتوجيهها؛ ويستمر العمل بشكل غير متزامن داخل الصندوق الرملي السحابي بينما ينشغل الفريق بشيء آخر.
الإتاحة مقتصرة على المؤسسات ذات خطة Copilot Business أو Enterprise. ويقوم المسؤول بتفعيل سياسة وكيل Copilot السحابي وتثبيت التطبيق لـ Slack أو Teams؛ ويمكن لمسؤولي المستودعات طلب الموافقة قبل دمج pull requests التي يولدها الوكيل. ويستهلك الاستخدام أرصدة الذكاء الاصطناعي، كما يُحاسَب الصندوق الرملي السحابي بشكل منفصل مع ميزانيات قابلة للتهيئة.
🔗 GitHub Copilot في Slack · 🔗 GitHub Copilot في Teams
DeepSeek-V4-Flash-Vision-Exp: أول نموذج متعدد الوسائط من DeepSeek على الـ API
21 أغسطس — تضع DeepSeek نموذج DeepSeek-V4-Flash-Vision-Exp على الإنترنت، وهو نموذج متعدد الوسائط تجريبي متاح تحت المعرّف deepseek-v4-flash-vision-exp. وعلى القدرات النصية البحتة — الوكلاء، والاستدلال، ومعرفة العالم — يساوي النموذج DeepSeek-V4-Flash. والجِدّة تكمن في مكان آخر: ففي معايير الوكلاء متعددي الوسائط، تعلن DeepSeek عن قفزة واضحة مقارنةً بـ V4-Flash، مع أداء يقترب من Opus-4.8.
الدعم متعدد الوسائط على مستوى الـ API كامل: إدخال مختلط نص + صورة (base64، أو URL خارجي، أو عبر Files API مجانية جديدة أُطلقت في اليوم نفسه)، ومتوافق مع الصيغ الثلاث الموجودة (Chat Completions وMessages وResponses). وتتبّع التسعيرة جدول V4-Flash، مع حصر tokenization للصور عند 384 token لكل صورة. وتتيح Files API رفع صورة مرة واحدة والرجوع إليها عبر file_id، وهو توفير في عرض النطاق لاستخدامات الوكلاء المتكررة. وقد تم تحديث DeepSeek Harness 0.1.1، وهو harness وكيل مفتوح المصدر أُطلق في 13 أغسطس، في اليوم نفسه لدعم النموذج الجديد أصلًا.
| العنصر | التفاصيل |
|---|---|
| النموذج | deepseek-v4-flash-vision-exp |
| قدرات النص | تكافؤ مع DeepSeek-V4-Flash |
| القدرات متعددة الوسائط | قريبة من Opus-4.8 على معايير الوكلاء متعددي الوسائط |
| تسعير الصورة | حتى 384 token/صورة، بسعر V4-Flash |
| واجهات API المدعومة | Chat Completions، Messages، Responses |
| الـ harness | DeepSeek Harness 0.1.1 (دعم أصلي) |
DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.
🇸🇦 أصبح DeepSeek-V4-Flash-Vision-Exp متاحًا الآن على منصة DeepSeek API! يضاهي هذا النموذج التجريبي متعدد الوسائط DeepSeek-V4-Flash في القدرات النصية — بما في ذلك الوكلاء، والاستدلال، ومعرفة العالم. وعلى معايير الوكلاء متعددي الوسائط، يحقق V4-Flash-Vision-Exp قفزة كبيرة مقارنةً بـ V4-Flash، مما يقرب أداء الوكلاء متعددي الوسائط من أداء Opus-4.8. — @deepseek_ai على X
Pika Speech: توليد صوتي 3B عند 1.2 ثانية في الدقيقة، وأرخص حتى 9 مرات من ElevenLabs v3
21 أغسطس — توسّع Pika Labs مجموعة Pika Audio بإطلاق Pika Speech، وهو نموذج توليد صوتي يضم 3 مليارات معامل. والحجة الرئيسية هي السرعة: عامل زمن حقيقي (RTF) يبلغ 0.02، أي إن دقيقة واحدة من الكلام بجودة استوديو 48 kHz تُولَّد في نحو 1.2 ثانية في اختبارات محلية طويلة الشكل، مع إمكان طلب ما يصل إلى خمس دقائق من الكلام المتواصل.
في التحكم بالإيقاع، يأتي Pika Speech بجِدّة: فبدلًا من مطّ الصوت أو ضغطه بعد الإنتاج — وهي الطريقة القياسية لدى معظم أنظمة TTS — يتحكم النموذج بالإيقاع والمدة مباشرةً بفضل «latent لنهاية الكلام» (EOS latent)، وهو مرساة موضوعة على الصورة النهائية المستهدفة. تحريك هذه المرساة إلى وقت أبكر يضغط التدفق؛ أما تحريكها إلى وقت لاحق فيترك للنص مساحة للتنفس. وعلى مستوى البنية، يجمع الفريق بين flow matching وdistillation عبر مطابقة التوزيع وFlashAttention-3، إضافةً إلى «token packing» يجعل تكلفة خمسة مقاطع من الجمل حوالي ضعف تكلفة مقطع واحد بدلًا من خمسة أضعاف.
وعلى صعيد التكاليف، تدّعي Pika تفوقًا قد يصل إلى 9x مقارنةً بـ ElevenLabs v3، و4.5x مقارنةً بـ Cartesia وElevenLabs Turbo، و2x مقارنةً بـ Fish Audio — من دون تفصيل المنهجية الدقيقة وراء هذه النسب. والنموذج متاح عبر Pika API Club.
Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02. […] Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes it up to 9× more cost-efficient than ElevenLabs v3, 4.5× than Cartesia and ElevenLabs Turbo, and 2× than Fish Audio.
🇸🇦 لنحدّثكم عن Pika Speech، وهو نموذج توليد صوتي يضم 3 مليارات معامل مع عامل زمن حقيقي يبلغ 0.02. […] يولّد Pika Speech دقيقة من الكلام بجودة استوديو 48 kHz في نحو 1.2 ثانية — ويدعم طلبات تصل إلى خمس دقائق. وتجعله هذه الكفاءة أكثر توفيرًا حتى 9 مرات من ElevenLabs v3، و4.5 مرات أكثر من Cartesia وElevenLabs Turbo، ومرتين أكثر من Fish Audio. — @pika_labs على X
EgoSuite-Open100K: أكبر مجموعة بيانات بشرية ذاتية التمركز ومفتوحة
21 أغسطس — تطلق Lightwheel AI، بالشراكة مع Hugging Face، مشروعًا مفتوح المصدر باسم EgoSuite-Open100K، يُقدَّم على أنه أكبر مجموعة بيانات بشرية ذاتية التمركز ومعلَّمة بالكامل تُنشر على الإطلاق بإتاحة مفتوحة. والهدف هو 100,000 ساعة من البيانات البشرية من منظور الشخص الأول؛ وقد أصبحت أول 10,000 ساعة متاحة بالفعل، بينما يُنشر الباقي على مراحل.
تغطي مجموعة البيانات أكثر من 15,000 مهمة موزعة على أكثر من 15,000 مشهد واقعي — مطابخ، غرف نوم، مستودعات، وخطوط تجميع — مجمعة ضمن 7 فئات بيئية و128 نوعًا من المشاهد. وتُوسَم كل سلسلة ببيانات عن وضعية اليد والجسم والدلالة على مستوى المهام الفرعية، مع تغطية كاميرا على المعصم لبعض أجزاء corpus. ومن النقاط اللافتة على مستوى الترخيص: بخلاف كثير من مجموعات بيانات البحث، فإن EgoSuite-Open100K مرخَّصة للتدريب التجاري، لا الأكاديمي فقط.
ويقدِّم مبتكروها مجموعة البيانات على أنها اللبنة العامة الأولى لبنية بيانات أوسع لـ «Physical AI» (الروبوتات والذكاء الاصطناعي المتجسد) — أي فكرة أن توسيع النماذج الفيزيائية بات يعتمد اليوم على الوصول إلى بيانات بشرية ضخمة ومشتركة.
🔗 إعلان Lightwheel AI · 🔗 إعادة نشر Hugging Face
Claude Security ينتقل إلى Claude Mythos 5
21 أغسطس — تشغّل Anthropic أداة Claude Security، الخاصة بفحص الثغرات، على Claude Mythos 5، في نسخة تجريبية عامة لجميع عملاء Claude Enterprise. والحجة هي الاستفادة من أكثر نماذج Anthropic قدرة في مجال الأمن على قاعدة الشيفرة نفسها، من دون وصول منفصل إلى النموذج — إذ تُحتسب عمليات الفحص ضمن استعمال token القياسي في الخطة الحالية.
عمليًا، تتجه الأداة إلى مستودع GitHub ويحلل Mythos 5 الشيفرة عبر تتبع تدفق البيانات بين الملفات والاستدلال على التفاعلات بين المكوّنات. ويعود كل اكتشاف مع فئة CWE، ومستوى ثقة، وتقدير للخطورة، وإصلاح مقترح، يفتح مباشرة داخل Claude Code على الويب. وتستغل Anthropic هذه المناسبة لإطلاق Defender Advantage Fund بتمويل قدره 35 مليون دولار من أرصدة الأمن مفتوح المصدر، وتخطط لتوسيع Cyber Verification Program في الأسابيع المقبلة.
تسعير GPT-5.6 Sol: OpenAI تخفّض أسعار الـ API، وGitHub Copilot يتبعها
21 أغسطس — تخفّض OpenAI أسعار API وأرصدة GPT-5.6 Sol بأكثر من 20% خلال الأشهر الثلاثة المقبلة. والإجراء أصبح فعالًا بالفعل على مستوى الـ API، وسيُطرح في Codex وChatGPT Work خلال اليوم. وبالنسبة لمستخدمي Codex على الخطط المعتمدة على المهمة (token-based)، فإن الأرصدة المشتراة ستكفي الآن لوقت أطول؛ أما الاستخدام المضمَّن في اشتراكات Pro وPlus وBusiness فيبقى دون تغيير — لذا يستفيد من التخفيض أساسًا مطورو الـ API والمستخدمون المحتسبون على أساس token.
GPT-5.6 Sol بخصم -50% داخل GitHub Copilot
بالتوازي، ينقل GitHub عرضًا ترويجيًا منفصلًا: خصم 50% على GPT-5.6 Sol داخل GitHub Copilot حتى 3 سبتمبر، ويمكن استخدامه في التطبيق وCLI وIDE. وهذا تخفيض مؤقت من جهة Copilot، ولا ينبغي الخلط بينه وبين التخفيض السعري الدائم من OpenAI المذكور أعلاه — شركتان مختلفتان، وآليتان مختلفتان على النموذج نفسه.
🔗 خفض أسعار OpenAI · 🔗 عرض GitHub Copilot الترويجي
GLM-5.3 (Max) يتقدم على Code Arena: WebDev
20 أغسطس — تشير LMArena إلى أن GLM-5.3 (Max) من Z.ai حرّك جبهة باريتو (نسبة الجودة/التكلفة) في تصنيف Code Arena: WebDev، المخصص لتقييم النماذج على مهام تطوير الويب. وبـ 1597 نقطة، يُفترض أن النموذج يحتل المرتبة الثانية بين النماذج ذات الأوزان المفتوحة (بعد نشرها) والمرتبة الثامنة إجمالًا عبر كل الفئات.
| النموذج | السعر ($/مليون token) | نقاط Code Arena: WebDev |
|---|---|---|
| GLM-5.3 (Max) | $3,65 | 1597 |
| Qwen3.8 (Max) | $5,00 | — |
| Gemini-3.7-flash-high | $2,86 | درجة أقل |
| DeepSeek-v4-flash-high | $1,10 | درجة أقل |
وبسعر $3,65 لكل مليون token، يبقى GLM-5.3 (Max) ضمن شريحة سعرية قريبة من Qwen3.8 (Max) مع تجاوزه Gemini-3.7-flash-high وDeepSeek-v4-flash-high في هذا الترتيب — وهي إشارة جديدة إلى تنافسية Z.ai في تطوير الويب الوكلي، إلى جانب النتائج المعروفة سابقًا على Terminal-Bench وAgent Arena العامة.
Harvey تطلق Tenet، نموذجًا قانونيًا مبنيًا على Kimi K3
20 أغسطس — تكشف Harvey عن Tenet، وهو أول نموذج لديها بعد التدريب المسبق المتخصص في القانون، اعتمادًا على قاعدة Kimi K3 (Moonshot AI) ثم إعادة تدريبها بالتعاون مع Fireworks AI على corpus من البيانات القانونية العامة، والبيانات الاصطناعية، وبيانات خبراء بشريين تحاكي عملًا قانونيًا طويل الأمد.
تعلن Harvey أن هذا التدريب اللاحق يرفع معدل النجاح الكامل لـ Tenet بنسبة 82% على معيار LAB وبنسبة 22% على LAB Contracts، مقارنةً بـ Kimi K3 الأساسي — مع حالة متقدمة على LAB Contracts والمركز الثاني على LAB عمومًا. وتكون تكلفة تشغيل Tenet أقل من ربع تكلفة أقوى نماذج الأساس في السوق. وبالإضافة إلى ذلك، دربت Harvey ثلاثة وكلاء فرعيين متخصصين: العناية الواجبة في صفقات الاندماج والاستحواذ، ومراجعة الجداول، ومعرفة بالمكتب.
جورجيا تك تتعقب أصول الاستدلال الاجتماعي لدى Olmo 3
21 أغسطس — استغل فريق من جورجيا تك حقيقة أن حزمة Olmo 3 التابعة لـ Ai2 مفتوحة بالكامل — الأوزان، ومدونة ما قبل التدريب Dolma 3 (1.26 مليار مستند)، والبنية التحتية — لربط قدرات النموذج بالنصوص التي أنتجتها إحصائيًا، في تجربة يستحيل إجراؤها على نموذج مغلق.
تعتمد المنهجية على دوال التأثير، المطبقة على نحو 5.68 ملايين مستند جرى سحبها عيّنات من Dolma 3. والنتيجة الرئيسية: النصوص الغنية بالحوار والكتابة بين الأشخاص تؤثر في أداء الاستدلال الاجتماعي أكثر من تأثيرها في المعرفة الوقائعية — وعند إزالة المستندات الأدبية الأكثر تأثيرًا، هبط الأداء على معيار SocialIQA بشكل ملحوظ، ما يؤكد السببية.
🔗 مقال Ai2
رصد تحيز «تحسين المعيار» في نماذج ASR مفتوحة المصدر
21 أغسطس — تنشر Hume AI على مدونة Hugging Face دراسة حول تحيز منهجي في التعرف على الكلام: إذ يبدو أن بعض النماذج مُحسَّنة لإعادة إنتاج النصوص المرجعية الخاصة بالمعايير العامة بدلًا من تفريغ الصوت بدقة.
من بين 11 نموذج ASR مفتوح المصدر جرى اختبارها، احتوت نحو 40% من مقاطع VoxPopuli التي تم تحليلها على أخطاء في مراجعها، وكانت 6 نماذج من أصل 11 تعيد إنتاج هذه الأخطاء بدلًا من تفريغ الصوت بشكل صحيح. أما في LibriSpeech، فقد بلغت معدلات استرجاع الأرقام المخفية 30 إلى 40%، وهي علامة على أن بعض النماذج «تملأ» النص بدلًا من أن تسمعه. وتوصي الخلاصة باستخدام مجموعات تقييم سرية وفصلٍ أشد صرامة بين بيانات التدريب والاختبار.
SenseNova-U1.5-8B-MoT: نموذج صور مفتوح بلا VAE ولا DiT
21 أغسطس — تطرح SenseNova بأوزان مفتوحة نموذجًا لتوليد الصور، وتقول إن أداءه المعلن يضاهي Nano Banana 2. وتكمن القيمة التقنية في المعمارية: لا VAE، ولا مُرمِّز نص منفصل، ولا DiT — إذ يعتمد النموذج على «mixture of transformers»، حيث تستخدم رموز النص والصورة أوزانًا منفصلة وتتوقع بعضها البعض، مع إزالة الضجيج مباشرة في فضاء البكسلات بدلًا من فضاء كامن مضغوط.
تختلف هذه المقاربة عن البنية القياسية لنماذج الانتشار النص-إلى-صورة، كما أن انفتاح الأوزان سيسمح للمجتمع بالتحقق بشكل مستقل من مقارنات الأداء المعلنة.
Diffusers 0.40.0: Modular Diffusers يغادر الحالة التجريبية
21 أغسطس — تنشر Hugging Face Diffusers 0.40.0. وأهم تغيير بنيوي هو خروج Modular Diffusers، نظام خطوط الأنابيب المعيارية في المكتبة، من الحالة التجريبية. يضيف الإصدار تكامل عدة نماذج مفتوحة حديثة (LTX2.5، MiniMax H3، MiniMax Music 3، Wan Animate 2)، ودعم التوازي على مستوى التنسور لعدد مختار من النماذج، ومحركي تكميم جديدين (SDNQ، Nunchaku-Lite).
Google DeepMind تستكشف الذكاء الاصطناعي في الألعاب مع Fenris Creations
21 أغسطس — تعلن Google DeepMind عن شراكة بحثية مع الاستوديو Fenris Creations، في امتدادٍ لـ 15 عامًا من الأعمال التي استخدمت ألعاب الفيديو كساحة تجريب للذكاء الاصطناعي، من إتقان Atari وصولًا إلى مستوى Grandmaster في StarCraft II. وبعد SIMA، الذي علّم الوكلاء فهم العوالم ثلاثية الأبعاد، تريد DeepMind استكشاف التنقل داخل ديناميكيات بشرية حقيقية ضمن عالم دائم الاستمرار.
تستهدف الشراكة أربعة تحديات مفتوحة: التعلّم المستمر (اكتساب مهارات جديدة دون نسيان السابقة)، وأنظمة ذاكرة عميقة تتجاوز بكثير نوافذ السياق الحالية، والتخطيط بعيد الأفق (أسابيع، أشهر، سنوات)، والديناميكيات متعددة الوكلاء (التعاون، التفاوض، الاقتصاد، السلوكيات الناشئة). والهدف طويل الأمد مزدوج: ابتكار تجارب لعب جديدة مع المطورين، ثم إعادة استخدام هذه التطورات لمشكلات العالم الحقيقي والاكتشاف العلمي.
Runway Ruby: تحويل الفيديو من SDR إلى HDR بعمق 16 بت
21 أغسطس — تطلق Runway نموذج Ruby، وهو نموذج يحوّل فيديو SDR (standard dynamic range) إلى HDR بعمق 16 بت، مع إخراج على هيئة سلاسل EXR أو ProRes/HEVC بعمق 10-12 بت، في فضاء ألوان BT.2020 مع دعم PQ أو HLG — وهي المعايير المستخدمة في ما بعد الإنتاج الاحترافي والبث HDR.
يعمل Ruby سواء على فيديو يرفعه المستخدم أو على مخرجات من إنتاج Runway، مع حد أقصى 30 ثانية. والميزة متاحة الآن لخطتي Max وEnterprise.
NVIDIA AVO تدّعي 100% على معيار ARC-AGI-3
21 أغسطس — تعرض NVIDIA AVO، وهو وكيل برمجي عام، مع نتيجة 100% على ARC-AGI-3، وهو معيار للاستدلال التفاعلي. ووفقًا لـ NVIDIA، أكمل AVO 183 مستوى موزعة على 25 بيئة عامة في المعيار، من دون تعليمات صريحة أو قواعد معلنة أو أهداف مسبقة الصياغة.
يعمل AVO عبر حلقة مستمرة من الفحص والتخطيط والتنفيذ والتقييم، مستندًا إلى الذاكرة والأدوات والتغذية الراجعة من التنفيذ ليبني على ما يتعلمه مع مرور الوقت — وهي مقاربة يفترض أنها تحافظ على التقدم في المهام الطويلة بدلًا من البدء من الصفر مع كل نافذة سياق جديدة.
HeyGen Look Packs: تغيير الملابس والخلفية مع الحفاظ على الوجه
21 أغسطس — تطلق HeyGen ميزة Look Packs، وهي ميزة تغيّر الملابس والخلفية في فيديو أفاتار مع الحفاظ بدقة على وجه الشخص — والحجة أن معظم النماذج التوليدية تعدّل ملامح الوجه أيضًا عندما تغيّر المظهر.
الاستخدام المستهدف هو الاتساق في الهوية الشخصية عبر سياقات مهنية مختلفة: العقار، القانون، اللياقة، التعليم، العافية. ويمكن لصانع محتوى B2B أن ينتج مقاطع بملابس وخلفيات مناسبة لكل قطاع مع بقائه قابلًا للتعرّف من فيديو إلى آخر. وتندرج هذه الإعلانات ضمن وتيرة HeyGen المكثفة في الأيام الأخيرة (Retouch في 20 أغسطس، وBrand Kits ورفع الدقة إلى 4K في 18-19 أغسطس).
Amp تطلق Explain Usage لشرح استهلاكها من الرموز
21 أغسطس — تضيف Amp ميزة Explain Usage، التي تتيح طلب تحليل مباشر من Puck، المساعد المدمج، لاستهلاكه الخاص من الرموز والاعتمادات وحجم المدار. يطرح المستخدم سؤالًا بلغة طبيعية — «ما هي الخيوط التي استهلكت أكبر عدد من الرموز اليوم؟» — ويقرأ Puck بيانات الاستخدام الشخصية والمقاييس حسب الخيط للإجابة.
توجد نقطتا دخول: طرح السؤال مباشرة على Puck، أو النقر على الزر المخصص في صفحات الاستخدام. وللمستخدمين الذين يفضلون البيانات الخام، تعرض Amp هذه المعلومات أيضًا عبر CLI (amp usage --details, amp threads usage <thread-id> --details).
v0 (Vercel) تضيف Vercel Connect للاتصال بأكثر من 100 خدمة
21 أغسطس — يمكن للتطبيقات والوكلاء المبنية داخل v0 الآن الاتصال مباشرةً بـ Slack وGitHub وSalesforce وأكثر من 100 خدمة خارجية أخرى عبر Vercel Connect، من دون أن يضطر المطور لإدارة تدفق المصادقة بنفسه.
تعتمد الآلية على موصلات فريق قابلة لإعادة الاستخدام مرتبطة برموز قصيرة العمر: فبمجرد إعداد موصل على مستوى الفريق، يمكن لكل تطبيق أو وكيل جديد يتم توليده إعادة استخدامه بدلًا من طلب مصادقة كاملة في كل مرة. وهذا يضع v0 كمنصة قادرة على إنتاج وكلاء مدمجين في المكدس البرمجي للشركة، لا مجرد واجهات معزولة.
سلاسل مشتركة في Codex وChatGPT Work
20 أغسطس — يقدّم Codex وChatGPT Work «السلاسل المشتركة»: رابطًا للقراءة فقط يكشف كامل الاستدلال في جلسة ما — المنهجية، القرارات، السياق — بدلًا من مجرد نتيجة نهائية. والهدف هو تجنّب إعادة بناء سياق طلب السحب من لقطات شاشة متناثرة أثناء مراجعة كود أو استكشاف تقني معمّق أو تسليم مشروع بين زملاء الفريق.
وهي ميزة تندرج ضمن استمرار الإعلانات الأخيرة حول ChatGPT Sites (التعديل الجماعي، تخصيص عناوين URL) وتعزّز تموضع Codex/ChatGPT Work كأداة عمل جماعي.
خلفيات شفافة في المعاينة لـ GPT-Image-2
20 أغسطس — تتيح واجهة GPT-Image-2 الآن، في المعاينة، توليد صور بخلفية شفافة. والفائدة العملية هي إنتاج أصول قابلة لإعادة الاستخدام — صور المنتجات، عناصر التصميم الغرافيكي، نماذج مواقع الويب، الحملات التسويقية — يمكن وضعها لاحقًا على أي خلفية دون حاجة إلى تعديل يدوي لقصّ العناصر.
نبذات
- Zed — يتم تثبيت Antigravity بنقرة واحدة من ACP Registry الخاص بـ Zed. 🔗 تغريدة
- trackio 0.36 — تنشر Hugging Face تحديثًا يضيف دعمًا لنوع جديد من البيانات القابلة للتسجيل، من دون تفاصيل إضافية. 🔗 تغريدة
- الذكاء الاصطناعي «متكامل المكدس» وفقًا لـ Google DeepMind — Paige Bailey تفكك نهج Google من النهاية إلى النهاية إلى خمس طبقات: البنية التحتية، الأمن، البحث، النماذج/الأدوات، المنتجات. 🔗 مقال Google
- GitHub — إدارة أفضل للمستخدمين المحظورين: البحث بالاسم، والفرز، وترقيم الصفحات للقوائم الطويلة. 🔗 سجل التغييرات
- GitHub — أصبح تثبيت العروض والمشاريع والمراحل في الشريط الجانبي للمستودع متاحًا بشكل عام، مع عدة تحسينات مرتبطة به (صور رمزية للتفاعلات، كثافة لوحة التحكم). 🔗 سجل التغييرات
- Manus تمدد الوصول المجاني إلى Manus 1.6 Lite وManus 1.6 حتى 28 أغسطس (SGT)، ضمن حد الحصة اليومية. 🔗 تغريدة
- Manus تذكّر المستخدمين الذين تلقوا إشعارًا بحفظ بياناتهم قبل 23 أغسطس 7:59 صباحًا (SGT)، قبل انتقالها إلى شركة مستقلة. 🔗 تغريدة
- Genspark تطلق عرضًا ترويجيًا حتى 30 سبتمبر: Design + GenTeam بخصم 90%، وGenMail مجاني، وSlides Ultra Mode بخصم 50%. 🔗 تغريدة
- NVIDIA تفصّل الفارق بين هيكل وكيل ما (ما الذي يحاول فعله) والبنية التحتية (ما الذي يمكنه فعله فعليًا) في غوص عميق أمني في المكدس الوكيلي. 🔗 تغريدة
- NVIDIA تنشر خلاصة سلسلة Spark Hack في سياتل على DGX Spark: مشاريع فائزة في الاستجابة للكوارث، والصحة، والبقاء دون اتصال مع Nemotron وNemoClaw. 🔗 تغريدة
- NVIDIA Cosmos 3 — يعرض فيديو من Cosmos Labs مرحلة ما بعد التدريب لـ Cosmos 3 لدى الشريكين Aigen وLinker Vision. 🔗 تغريدة
- Luma Labs ستتحدث عن الوكلاء الإبداعيين خلال Summer Signal، الذي تنظمه مع GMI Cloud في 14 سبتمبر. 🔗 تغريدة
- Synthesia — ورد ذكر رئيسها التنفيذي في مقال Forbes Tech حول قياس تبنّي الذكاء الاصطناعي بالنتائج بدلًا من الاستخدام. 🔗 تغريدة
- Qwen3.8-27B تواصل زخمها المجتمعي: وصفات استدلال جديدة NVFP4 + DFlash2 في cookbook الخاص بـ SGLang، وإصدارات أخف منشورة من Unsloth، والمركز الأول على تصنيف وكيل البرمجة Cline خلال أربعة أيام، وDGX Station من NVIDIA يبلّغ عن أكثر من 2713 رمز/ثانية كذروة مجمّعة في خدمة BF16. 🔗 SGLang · 🔗 Unsloth · 🔗 Cline · 🔗 DGX Station
- Qwen3.8-Max أصبح الآن قابلًا للاستخدام داخل أداة البرمجة Kilo Code لتوليد الواجهات. 🔗 تغريدة
- Kimi Work تنشر دليلًا ثانيًا للمحللين الماليين: لوحة تحكم للمستثمر، وتحديث النماذج المالية، وتوليد التقارير دفعة واحدة. 🔗 تغريدة
- GLM-5.3 يواصل تقدمه: نتيجة 69 على الترتيب الرسمي لـ DeepSWE، وتوافره على منصة WorkBuddy، وتمديد Build Week من قبل Z.ai حتى 23 أغسطس 18:00 (PT) مع 100 مليون رمز مجانية لأول 50,000 مسجّل جديد في ZCode. 🔗 DeepSWE · 🔗 WorkBuddy · 🔗 Build Week
- GPT-5.6 Sol — ثلاث منصات خارجية (Router وCloudflare AI Gateway وOpenCode Zen) تعرض كل منها خصم 50% حتى منتصف سبتمبر، بالإضافة إلى الخصومات المشمولة بالفعل لدى Devin وOpenRouter وv0. 🔗 Cloudflare AI Gateway
ما الذي يعنيه ذلك
يرسم إعلان Anthropic-GitHub اليوم اتجاهًا بنيويًا عميقًا: فالبنية التحتية الوكيلية تغادر المرحلة التجريبية. إن وصول computer use وbrowser tool إلى حالة GA على Claude Platform، بالتزامن مع وصول Copilot إلى Slack وTeams، يشير إلى أن المزودين الكبار لم يعودوا يكتفون ببيع النماذج — بل يبيعون وكلاء قادرين على العمل داخل الأدوات التي تستخدمها الفرق بالفعل يوميًا، من دون المرور بتكامل API مخصص كل مرة. هذا تحول في التوزيع بقدر ما هو تحول في القدرة: فالوكيل يذهب الآن إلى حيث يجري العمل، بدلًا من أن يطلب من العمل أن يأتي إليه.
وعلى مستوى النماذج، يؤكد DeepSeek-V4-Flash-Vision-Exp أن الوسائط المتعددة أصبحت معيارًا متوقعًا لا عامل تمييز — حتى الجهات المتموضعة حول الكفاءة الاقتصادية (V4-Flash) تدمجها الآن أصليًا، مع أداء يقترب من أفضل النماذج المغلقة. وتوضح المنافسة على معايير الوكلاء البرمجية (GLM-5.3 على Code Arena: WebDev، وQwen3.8-27B على Cline) الديناميكية نفسها في جانب أدوات التطوير: إذ تضيق الفجوات السعرية بين النماذج المفتوحة والمغلقة، ما يدفع OpenAI إلى خفض أسعار API لأكثر من 20% على GPT-5.6 Sol تباعًا.
ويواصل التحرك نحو الانفتاح الكامل — ليس فقط الأوزان، بل البيانات والبنية التحتية للتدريب — جني ثماره العلمية: فدراسة Georgia Tech عن Olmo 3 ما كان يمكن ببساطة إجراؤها على نموذج مغلق، تمامًا كما تذكّرنا دراسة Hume AI حول تحيزات معيار ASR بأن درجة leaderboard لا تضمن جودة تفريغ حقيقية. وهذان تذكيران مفيدان في الوقت الذي تكثف فيه الصناعة إعلانات الأرقام القياسية.
وأخيرًا، فإن تكاثر مجموعات البيانات الضخمة المرخّصة تجاريًا — EgoSuite-Open100K اليوم، بعد عدة إعلانات مشابهة خلال الأسابيع الماضية — يؤكد أن الوصول إلى بيانات بشرية حقيقية، لا اصطناعية فقط، أصبح قضية استراتيجية للروبوتات والذكاء الاصطناعي المجسّد، بالقدر نفسه الذي كان فيه الحوسبة قضيةً للّغات النموذجية الكبرى.
المصادر
- Claude Platform — استخدام الكمبيوتر في GA، أداة المتصفح، Skills API، Files API
- GitHub Copilot في Slack
- GitHub Copilot في Teams
- DeepSeek-V4-Flash-Vision-Exp
- Pika Speech
- تفاصيل بنية Pika Speech
- EgoSuite-Open100K
- Relay Hugging Face EgoSuite
- Claude Security على Mythos 5
- خفض أسعار GPT-5.6 Sol (API)
- GPT-5.6 Sol بخصم 50% في GitHub Copilot
- GLM-5.3 (Max) على Code Arena: WebDev
- Harvey Tenet
- Georgia Tech تتتبع أصول الاستدلال الاجتماعي لـ Olmo 3
- انحياز تحسين المعيار في ASR
- SenseNova-U1.5-8B-MoT
- Diffusers 0.40.0
- Google DeepMind × Fenris Creations
- Runway Ruby
- NVIDIA AVO على ARC-AGI-3
- HeyGen Look Packs
- Amp Explain Usage
- v0 Vercel Connect
- خيوط مشتركة Codex / ChatGPT Work
- خلفيات شفافة GPT-Image-2
- Zed × Antigravity
- trackio 0.36
- الذكاء الاصطناعي المتكامل حسب Google DeepMind
- GitHub — إدارة المستخدمين المحظورين
- GitHub — تثبيت الشريط الجانبي
- Manus — تمديد الوصول المجاني
- Manus — تذكير بالحفظ الاحتياطي
- Genspark — ترويج
- NVIDIA — أمان المكدس الوكالي
- NVIDIA — هاكاثون DGX Spark في Seattle
- NVIDIA Cosmos 3 — ما بعد التدريب
- DGX Station — Qwen3.8-27B
- Luma Labs — Summer Signal
- Synthesia في Forbes
- Qwen3.8-27B — cookbook SGLang
- Qwen3.8-27B — Unsloth
- Qwen3.8-27B — المركز الأول Cline
- Qwen3.8-Max — Kilo Code
- Kimi Work — درس تعليمي للمحللين الماليين
- GLM-5.3 — نتيجة DeepSWE
- GLM-5.3 — WorkBuddy
- GLM-5.3 — Build Week Z.ai
- GPT-5.6 Sol — خصومات من جهات خارجية