بحث

Together AI يقدّم DeepSeek V4.1 Flash ويقول إنه أرخص بثلاث مرات لكل مهمة من GPT-5.6 Sol، وPerplexity يفتح Agent API أمام الموصلات المخصصة

مقال من إنشاء الذكاء الاصطناعي
Together AI يقدّم DeepSeek V4.1 Flash ويقول إنه أرخص بثلاث مرات لكل مهمة من GPT-5.6 Sol، وPerplexity يفتح Agent API أمام الموصلات المخصصة

ai-powered-markdown-translator

مقال مترجم من الفرنسية إلى العربية باستخدام gpt-5.6-sol.

عرض المشروع على GitHub ↗

لا يوجد نموذج جديد هذا الأحد، لكن ثمة ميزتان جديدتان ملموستان للمطورين. وصل DeepSeek V4.1 Flash، الصادر في 10 سبتمبر، إلى Together AI بسعر ساعات الذروة لدى DeepSeek، وتقول Together إنه أرخص بثلاث مرات لكل مهمة من GPT-5.6 Sol، وهو ادعاء ينبغي قراءته مع مراعاة تفاصيله الدقيقة؛ ومن جهته، يتيح Perplexity تسجيل خادم MCP مرة واحدة ونهائيًا في Agent API. وتعود Sakana AI إلى عدد خاص من Royal Society، بينما يهتم ثلاثة مساهمين في مدونة مجتمع Hugging Face، كل بطريقته، بالتحقق من النتائج.


Together AI يقدّم DeepSeek V4.1 Flash ويقول إنه أرخص بثلاث مرات لكل مهمة من GPT-5.6 Sol

13 سبتمبر — أصبح DeepSeek V4.1 Flash متاحًا على Together AI، سواء بنمط serverless أو ضمن نشر مخصص، بسعر 0,30 دولار لكل مليون token للإدخال و1,20 دولار للإخراج: وهي تمامًا أسعار API لدى DeepSeek خلال ساعات الذروة، التي تخفضها DeepSeek إلى النصف في ساعات انخفاض الطلب.

وتؤكد Together، استنادًا إلى قياسات Artificial Analysis، أن النموذج يتفوق على GPT-5.6 Sol في benchmarks الخاصة بالوكلاء مقابل ثلث التكلفة لكل مهمة:

المقياس المقارَنDeepSeek V4.1 FlashGPT-5.6 Sol (high)
AutomationBench-AA69 %55 %
Terminal-Bench v4.027 %21 %
GDPval-AA v216321524
متوسط التكلفة لكل مهمة (Intelligence Index)0,27 دولار0,81 دولار

وهناك نقطتان دقيقتان: تضع بطاقة Together نفسها نموذج V4.1 Flash خلف GPT-5.6 Sol في الاستدلال (90,9 مقابل 94,1 % على GPQA Diamond، و36,8 مقابل 47 % على HLE)، كما أن التفوق الذي قاسه Artificial Analysis على Terminal-Bench v4.0 ينعكس في الجدول الذي نشرته DeepSeek في 10 سبتمبر، إذ منح V4.1 Flash نتيجة 31,2 مقابل 39,9 لـ GPT-5.6 Sol.

🔗 إعلان Together AI على X


Perplexity يفتح Agent API أمام الموصلات المخصصة، مع تسجيل خادم MCP مرة واحدة ونهائيًا

13 سبتمبر — يضيف Perplexity الموصلات المخصصة (custom connectors) إلى Agent API. يسجّل مسؤول النظام خادم MCP بعيدًا مرة واحدة فقط ضمن موصلات مشروعه (Project): الاسم، وURL، والمصادقة بواسطة مفتاح API أو من دونها، ونقل Streamable HTTP أو SSE. يحتفظ Perplexity بمفتاح الوصول إلى الخادم، ولا تحتاج الطلبات الصادرة باستخدام أي مفتاح API في المشروع إلا إلى ذكر معرّف الموصل عبر type: "connector".

أما عند تمرير خادم MCP داخل الطلب (type: "mcp")، فإن URL وبيانات اعتماده يرافقان كل استدعاء، باستخدام Streamable HTTP فقط. وتوسّع هذه الموصلات نطاق الموصلات المُدارة (managed connectors) التي وصلت في 27 أغسطس لخدمات GitHub وSlack وGoogle Drive وDatadog، وأصبح عددها الآن ستة مع Linear وNotion. ويجعل اكتشاف الأدوات، المؤجل افتراضيًا، النموذج يبحث قبل تحميل المخططات اللازمة، ولذلك ينبغي ضبط max_steps على قيمة مرتفعة بما يكفي. ولم يُذكر أي تسعير خاص.

🔗 توثيق موصلات Perplexity 🔗 سجل تغييرات API لدى Perplexity


موجز الأخبار

  • Sakana AI تعود إلى عدد خاص مكرّس لنماذج العالم (world models) — تدوينة باليابانية نُشرت في 12 سبتمبر عن عدد من Philosophical Transactions of the Royal Society A صدر في 14 مايو 2026، وشارك David Ha، الرئيس التنفيذي لـ Sakana AI، في كتابة مقدمته مع ثلاثة عشر مؤلفًا آخر. الجديد هنا هو التدوينة، لا صدور العدد. 🔗 المصدر
  • REINFORCE يخرج من مأزق يظل فيه صعود التدرج الدقيق عالقًا — مساهمة فردية في مدونة مجتمع Hugging Face، وليست منشورًا مختبريًا: بعد اثنتين وأربعين جولة تحقق أجراها القارئ نفسه، يوضح RDTvlokip أنه عند 20 000 خطوة لم ينجح الصعود الدقيق في الوصول إلى ترميز خالٍ من الالتباس (تقابل واحد لواحد) في أي من التجارب الـ12، مقابل 11 من أصل 12 لـ REINFORCE. غير أن جميع هذه الأرقام تعتمد على محسّن Adam. 🔗 المصدر
  • Phionyx يقترح عقد إثبات لعمليات تدقيق AI — مساهمة فردية أخرى: يريد Ali Toygar Abak منع لوحة معلومات أو تقرير من توسيع نطاق ما يثبته الدليل بصمت، كأن يُعرض استدعاء أداة مرفوض لاحقًا على أنه حادث أوقفه حاجز الحماية. ويظل اقتراحه، المؤلف من ثماني مجموعات من البيانات الوصفية المرفقة بكل ادعاء، خطة هندسية واختبارية من دون نتيجة تجريبية. 🔗 المصدر
  • darkc0de يقترح تقييم نماذج الوكلاء وفق الوقت اللازم للحصول على نتيجة متحقق منها — المساهمة الفردية الثالثة: يرى Sonny DeSorbo أن نموذجًا أضعف لكنه أسرع يستطيع تصحيح نفسه مرات عدة قبل أن يُنهي نموذج بطيء محاولته الأولى، ويرسم ملامح benchmark باسم Persistent Challenge Completion يقيس العمل المتحقق منه في الثانية. إنها فكرة بلا تجارب، ويدعو المؤلف إلى عدم أخذها بجدية مفرطة. 🔗 المصدر

ما الذي يعنيه ذلك

يتعلق المحور الأول بأدوات الوكلاء. فمع الموصلات المخصصة، يصبح خادم MCP موردًا للمشروع بدل أن يكون معلمة تتكرر في كل طلب: يسجله مسؤول النظام مرة واحدة، ويحتفظ Perplexity بمفتاح الوصول إليه، ولا تعود الشيفرة التي تستدعي Agent API مضطرة إلى تمريره. وهكذا يوسّع Perplexity منطق الموصلات المُدارة، التي وصلت في نهاية أغسطس، ليشمل خوادم MCP الخاصة بكل مستخدم، سواء كانت محمية بمفتاح API أو بلا مصادقة، كما يقبل نقل SSE إلى جانب Streamable HTTP. ويتمثل المقابل في الاكتشاف المؤجل للأدوات، الذي يفرض منح النموذج عددًا كافيًا من الخطوات للبحث قبل التنفيذ. وبذلك يصبح ربط أداة عملية إدارية تُنفذ مرة واحدة لمشروع كامل، أكثر منه إعدادًا يجب تكراره في كل استدعاء.

أما المحور الثاني فيتعلق بالسعر والقياس. تسعّر Together AI نموذجًا مفتوحًا منشورًا بترخيص MIT بالسعر نفسه تمامًا الذي تفرضه DeepSeek في ساعات الذروة: وبالنسبة إلى من يستطيع تركيز استدعاءاته في ساعات انخفاض الطلب، تظل API لدى DeepSeek أرخص بمرتين. أما تكلفة المهمة التي يجري إبرازها، فينبغي قراءتها مع مراعاة الفوارق. ينطبق ادعاء Together على benchmarks الخاصة بالوكلاء، لا على الاستدلال الذي يظل فيه V4.1 Flash خلف GPT-5.6 Sol، وحتى في اختبار للوكلاء مثل Terminal-Bench v4.0، يعتمد الترتيب على المصدر: يتقدم V4.1 Flash على GPT-5.6 Sol لدى Artificial Analysis (27 مقابل 21 %)، لكنه يأتي خلفه في جدول DeepSeek (31,2 مقابل 39,9). وتعود التدوينات المجتمعية الثلاث لهذا اليوم، كل منها بطريقتها، إلى مطلب التحقق نفسه: أخضع RDTvlokip نتائجه لاثنتين وأربعين جولة مراجعة أجراها القارئ نفسه، ويريد Phionyx منع التقرير من توسيع نطاق ما يثبته الدليل بصمت، بينما يقترح darkc0de قياس العمل المتحقق منه في الثانية بدلًا من النجاح في المحاولة الأولى. وسواء تعلق الأمر بنتيجة أو تكلفة أو استنتاج تدقيق، يظل السؤال هو معرفة الظروف التي جرى فيها الحصول على الرقم.


المصادر