Claude Opus 5.5 أم GPT-6 Astra: أي نموذج يناسب أتمتة أعمالك؟
نماذج الذكاء الاصطناعي7 دقائق قراءة٢٨ سبتمبر ٢٠٢٦

Claude Opus 5.5 أم GPT-6 Astra: أي نموذج يناسب أتمتة أعمالك؟

يتصدر Claude Opus 5.5 الاختبارات المستقلة، وسعر الرمز فيه أقل من GPT-6 Astra بنسبة ٦٠٪. نقارن نماذج سبتمبر ٢٠٢٦ في سير العمل الفعلي للشركات ونوضح أين يناسب كل نموذج.

هل Claude Opus 5.5 أفضل من GPT-6 Astra؟

في الاختبارات المستقلة نعم إجمالاً: سجل Claude Opus 5.5 في مؤشر Artificial Analysis ٥٨ نقطة مقابل ٥٣ لنموذج GPT-6 Astra، وسعره ٤ دولارات للمدخلات و٢٠ دولاراً للمخرجات لكل مليون رمز مقابل ١٠ و٥٠ دولاراً. لكن GPT-6 Astra يتقدم في بعض اختبارات المهام الوكيلة مثل AutomationBench ويستهلك رموزاً أقل في كل مهمة، لذلك يعتمد الاختيار على طبيعة العمل.

01

الإجابة المختصرة: Opus 5.5 يتصدر، والاختيار يبقى حسب المهمة

ثلاثة نماذج متقدمة تغذي سير عمل واحداً: القرار الحقيقي هو أي خطوة تعمل على أي نموذج.

إذا كنت تختار نموذجاً لتشغيل أتمتة أعمالك هذا الربع، فإن Claude Opus 5.5 يحقق أعلى نتيجة عامة في الاختبارات المستقلة، وأصبح سعر الرمز فيه أقل بكثير من GPT-6 Astra. ومع ذلك لا يناسب كل مهمة. المهام القصيرة المتكررة بكميات كبيرة تبقى أنسب لنموذج أرخص، كما يحتفظ GPT-6 Astra بالتقدم في بعض اختبارات المهام الوكيلة.

أطلقت Anthropic الإصدار Opus 5.5 في ٢٢ سبتمبر ٢٠٢٦، بعد ثلاثة أسابيع من إطلاق Google لنموذج Gemini 3.8 Flash، وبعد وقت قصير من إطلاق OpenAI لنموذج GPT-6 Astra. وصول ثلاثة نماذج متقدمة في شهر واحد يحوّل قرار الشراء المعتاد إلى سؤال عملي أمام أي شركة: أي نموذج يجب أن يعمل خلف وكيل خدمة العملاء أو أتمتة نظام إدارة العملاء، وإلى أي حد يجب الارتباط بمزود واحد؟

يقارن هذا المقال بين النماذج الثلاثة في التكلفة ونتائج الاختبارات، ثم يوضح نوع العمل الذي يناسب كل نموذج. كل رقم في المقال مرتبط بمصدره، ونوضح متى يأتي الرقم من الشركة المطورة نفسها ومتى يأتي من جهة اختبار مستقلة.

02

ما الذي أطلقته Anthropic في ٢٢ سبتمبر

يحل Opus 5.5 محل Opus 5 الذي صدر في ٢٤ يوليو. التغيير الذي يهم معظم الميزانيات هو السعر، ويأتي الأداء بعده.

  • السعر: ٤ دولارات لكل مليون رمز مدخل و٢٠ دولاراً لكل مليون رمز مخرج، بعد أن كان ٥ دولارات و٢٥ دولاراً في Opus 5. أما القراءة من الذاكرة المؤقتة للأوامر فأصبح سعرها ٠٫٢٠ دولار لكل مليون رمز بعد أن كان ٠٫٥٠ دولار.
  • نافذة السياق: مليون رمز مع دعم النصوص والصور، بحسب Artificial Analysis.
  • التوفر: عبر واجهة Claude البرمجية وعلى Amazon Web Services وGoogle Cloud وMicrosoft Azure، فتستطيع معظم الشركات شراءه من حساب سحابي تملكه أصلاً.
  • العائلة: تقول Anthropic إن Sonnet 5.5 وHaiku 5.5 سيصدران خلال الأسابيع المقبلة، وهذا مهم لمن يريد فئة أرخص من Claude للخطوات البسيطة.

خصم الذاكرة المؤقتة يسهل تجاهله، مع أنه يؤثر في الفاتورة أكثر من السعر المعلن في كثير من الحالات. الأتمتة التي ترسل التعليمات الطويلة نفسها أو كتالوج المنتجات مع كل طلب تستطيع تخزين هذا الجزء مؤقتاً، فيُحسب معظم الطلب بسعر ٠٫٢٠ دولار لكل مليون رمز بدلاً من ٤ دولارات.

ولتوضيح ذلك بالأرقام: وكيل يرسل حزمة سياسات بحجم ٢٠ ألف رمز مع كل طلب، ويعالج ١٠ آلاف طلب شهرياً، يقرأ ٢٠٠ مليون رمز من هذا الجزء وحده كل شهر. بالسعر العادي للمدخلات تبلغ تكلفته ٨٠٠ دولار شهرياً على Opus 5.5، وتنخفض إلى ٤٠ دولاراً عند قراءته من الذاكرة المؤقتة، مع رسوم صغيرة عند كتابته فيها أول مرة.

وتطبق Anthropic على Opus 5.5 الضوابط التي تطبقها على نماذج Fable الأكبر، فتقيد استخدامه في اكتشاف الثغرات وأبحاث الأسلحة البيولوجية. نادراً ما يمس ذلك سير العمل التجاري، لكن فريق الأمن الذي يقيّمه لاختبارات الاختراق يجب أن يقرأ سياسة الاستخدام أولاً.

03

مقارنة السعر ومجال الاستخدام

بحسب الأسعار المعلنة، يكلف Opus 5.5 أقل من GPT-6 Astra بنسبة ٦٠٪ لكل رمز في المدخلات والمخرجات معاً. أما Gemini 3.8 Flash فيقع في فئة سعرية مختلفة: سعره التعريفي أرخص من Opus 5.5 بنحو خمس مرات، وقد أعلنت Google أن هذا السعر سيتضاعف في ١ يناير ٢٠٢٧. ويظهر الفارق نفسه في سعر الذاكرة المؤقتة، إذ يبلغ ٠٫٢٠ دولار لكل مليون رمز في Opus 5.5 مقابل دولار واحد في GPT-6 Astra.

السعر المعلن نصف الفاتورة فقط. النصف الآخر يحدده عدد الرموز التي يستهلكها النموذج في كل مهمة، وهذا موضوع القسمين التاليين.

يعتمد الجدول التالي على الأسعار المنشورة لدى كل شركة. أما الصف الأخير فيعكس قراءتنا التحريرية لمجال كل نموذج، ولا يستند إلى اختبار.

نماذج سبتمبر ٢٠٢٦ في لمحة
Claude Opus 5.5GPT-6 AstraGemini 3.8 Flash
تاريخ الإطلاق٢٢ سبتمبر ٢٠٢٦سبتمبر ٢٠٢٦٢ سبتمبر ٢٠٢٦
المدخلات لكل مليون رمز٤ دولارات١٠ دولارات٠٫٧٥ دولار حتى ٣١ ديسمبر ٢٠٢٦، ثم ١٫٥٠ دولار
المخرجات لكل مليون رمز٢٠ دولاراً٥٠ دولاراً٣٫٧٥ دولار حتى ٣١ ديسمبر ٢٠٢٦، ثم ٧٫٥٠ دولار
المجال المناسبمهام الوكلاء الطويلة متعددة الخطوات مع الأدوات والمستنداتالفرق التي تعمل على OpenAI أصلاً، والمهام العلمية ومهام سطر الأوامرالمهام القصيرة بكميات كبيرة مثل التوجيه واستخراج البيانات

المصدر: الأسعار المعلنة لكل شركة، سبتمبر ٢٠٢٦

04

الاختبارات: أين يتقدم Opus 5.5 وأين يتأخر

يقارن جدول الإطلاق الذي نشرته Anthropic بين Opus 5.5 ونموذجها Fable 5.1 ونموذج GPT-6 Astra في اختبارات المهام الوكيلة. هذه أرقام أعلنتها الشركة المطورة، فالأسلم التعامل معها على أنها القراءة الأكثر ملاءمة للنموذج.

يتقدم Opus 5.5 في Terminal-Bench 4.0 بنسبة ٦٦٫٤٪ مقابل ٥٧٫٩٪ لنموذج GPT-6 Astra، وفي FrontierCode v1.1 بنسبة ٥٤٫٤٪ مقابل ٥٣٫٣٪. في المقابل يتقدم GPT-6 Astra في AutomationBench بنسبة ٤١٫٤٪ مقابل ٤٠٫٠٪، وفي Terminal-Bench-Science بنسبة ٦٤٫٦٪ مقابل ٥٨٫٧٪. واختبار AutomationBench هو الأقرب إلى ما تفعله أتمتة الأعمال فعلاً، والنموذجان فيه متقاربان جداً.

الاختبارات المستقلة تقلص الفارق الكبير الوحيد. أجرت Artificial Analysis اختبار Terminal-Bench 4.0 بنفسها وسجلت ٥٩٫٦٪ لنموذج Opus 5.5، أي مستوى GPT-6 Astra نفسه، بدل تقدم بنحو ٨٫٥ نقطة. هذا الفرق طبيعي، فالشركات تختبر نماذجها بأدواتها وإعداداتها الخاصة، ولهذا لا ينبغي أن يحسم رقم يوم الإطلاق قرار أي مشروع وحده.

اختبارات المهام الوكيلة كما أعلنتها Anthropic (٪)

المصدر: Anthropic, Introducing Claude Opus 5.5، ٢٢ سبتمبر ٢٠٢٦. أرقام أعلنتها الشركة المطورة.

05

النتائج المستقلة وتكلفة الرموز خلفها

في مؤشر Artificial Analysis Intelligence Index، الذي يجمع عشرة اختبارات تجريها جهة واحدة وفق الشروط نفسها، سجل Opus 5.5 عند أعلى مستوى تفكير ٥٨ نقطة. وجاء GPT-6 Astra وClaude Fable 5.1 عند ٥٣ نقطة، وGPT-5.6 Sol عند ٤٧. ويتصدر Opus 5.5 ستة من الاختبارات العشرة، منها Humanity's Last Exam بنسبة ٦١٫٤٪ وSciCode بنسبة ٦٦٫٩٪، ويتأخر في اختبارات CritPt وAA-LCR وGDP.pdf.

التحفظ هنا في مستوى الجهد. للوصول إلى هذه النتيجة استخدم Opus 5.5 نحو ١١٩ ألف رمز مخرج في المهمة الواحدة، مقابل نحو ٢٧ ألفاً لنموذج GPT-6 Astra. ومع ذلك وجدت Artificial Analysis أن تكلفته لكل مهمة بقيت في مستوى Opus 5، لأن سعر الرمز انخفض. السعر الأقل للرمز لا يعني فاتورة أقل بالضرورة، والنموذج الذي يفكر مدة أطول يجيب أبطأ أيضاً.

في أتمتة تعمل آلاف المرات يومياً، يهم هذان الأمران أكثر من تقدم بخمس نقاط في المؤشر:

  • قِس التكلفة لكل مهمة مكتملة بدل التكلفة لكل رمز، على عينة من عملك الفعلي.
  • حدد مستوى الجهد لكل خطوة. معظم مسارات العمل تجمع خطوة واحدة تحتاج تفكيراً عميقاً مع خطوات كثيرة بسيطة، والخطوة الصعبة وحدها تحتاج أعلى مستوى.
مؤشر Artificial Analysis للذكاء عند أعلى مستوى تفكير

المصدر: Artificial Analysis، ٩ و٢٢ سبتمبر ٢٠٢٦ (اختبار مستقل)

06

أي نموذج لأي نوع من العمل

طبقة التوجيه ترسل الخطوة الصعبة النادرة إلى نموذج متقدم، والخطوات البسيطة الكثيرة إلى نموذج أرخص.
طبقة التوجيه ترسل الخطوة الصعبة النادرة إلى نموذج متقدم، والخطوات البسيطة الكثيرة إلى نموذج أرخص.

معظم الشركات لا تحتاج فائزاً واحداً. تحتاج النموذج المناسب لكل خطوة، وطريقة لتغييره عندما تتحرك الأسعار مرة أخرى كما حدث مراراً هذا الشهر.

مهام الوكلاء الطويلة متعددة الخطوات

وكيل مبيعات أو خدمة عملاء يقرأ سياساتك ويتحقق من الطلب في نظام إدارة العملاء ثم يكتب الرد ويحوّل المحادثة إلى موظف عندما لا يكون متأكداً، هذا هو العمل الذي صُمم Opus 5.5 من أجله. فهو يتصدر اختبارات العمل المعرفي مثل GDPval-AA وAA-Briefcase، وسعر الذاكرة المؤقتة المنخفض يناسب الوكلاء الذين يعيدون استخدام التعليمات الطويلة نفسها.

المهام القصيرة بكميات كبيرة

تصنيف الرسائل الواردة واستخراج الحقول من الفواتير مهام تتكرر آلاف المرات يومياً ونادراً ما تحتاج تفكيراً متقدماً. Gemini 3.8 Flash بسعره التعريفي خيار معقول هنا، مع تذكير في التقويم بتاريخ ١ يناير ٢٠٢٧ عندما يتضاعف سعره.

الفرق التي تعمل على OpenAI أصلاً

إذا كانت بياناتك وأدواتك تعمل عبر OpenAI وسبق أن مرت بمراجعتك الأمنية، فإن GPT-6 Astra نموذج قوي، وقد تتجاوز تكلفة الانتقال فارق الاختبارات. كما أنه يستهلك رموز مخرجات أقل بكثير في كل مهمة، وهذا يسرّع الاستجابة.

العمل بالعربية واللغتين

لا يقيس أي من الاختبارات السابقة اللهجات الخليجية أو الرسائل التي تخلط العربية بالإنجليزية. إذا كان عملاؤك يكتبون بالعربية، فاختبر كل نموذج مرشح على بضع مئات من رسائلك الحقيقية قبل الاختيار.

07

ماذا يعني هذا لأتمتة الأعمال؟

صدور نموذج متقدم جديد كل بضعة أسابيع سبب كافٍ لتصميم أتمتة لا تعتمد على نموذج بعينه. تبني Raanzlr وكلاء الذكاء الاصطناعي وأتمتة سير العمل مع طبقة توجيه بين أنظمتك والنموذج، فتعمل خطوة التفكير الصعبة على Opus 5.5 بينما تعمل الخطوات المتكررة على نموذج أرخص، ويمكن استبدال أي منهما دون إعادة كتابة سير العمل. وقبل التشغيل نختبر النماذج المرشحة على مستنداتك ورسائلك الحقيقية بالعربية والإنجليزية، ثم نربط النتيجة بنظام إدارة العملاء لديك عبر تكاملات برمجية واضحة. ونقدم هذا العمل عن بعد للشركات في الولايات المتحدة والسعودية.

// أسئلة شائعة

كم يكلف Claude Opus 5.5؟
تحدد Anthropic سعر Claude Opus 5.5 بأربعة دولارات لكل مليون رمز مدخل و٢٠ دولاراً لكل مليون رمز مخرج، و٠٫٢٠ دولار لكل مليون رمز عند القراءة من الذاكرة المؤقتة. هذا أقل من Opus 5 بنسبة ٢٠٪ في سعر الرموز. أما التكلفة الفعلية للأتمتة فتعتمد على عدد الرموز في كل مهمة، لذلك قِس التكلفة لكل مهمة مكتملة على عملك أنت.
ما أرخص نموذج للأتمتة بكميات كبيرة؟
بين إصدارات سبتمبر ٢٠٢٦ يملك Gemini 3.8 Flash أقل سعر معلن: ٠٫٧٥ دولار لكل مليون رمز مدخل و٣٫٧٥ دولار لكل مليون رمز مخرج حتى ٣١ ديسمبر ٢٠٢٦، ثم ١٫٥٠ و٧٫٥٠ دولار. يناسب الخطوات القصيرة المتكررة مثل التصنيف واستخراج البيانات، إذ يضيف التفكير المتقدم فيها تكلفة دون أن يرفع الدقة.
هل يجب أن تلتزم الشركة بنموذج ذكاء اصطناعي واحد؟
في الغالب لا. صدرت نماذج متقدمة عدة في سبتمبر ٢٠٢٦ وحده، وتغيرت الأسعار مع كل إصدار. وضع طبقة توجيه بين أنظمتك والنموذج يسمح لك بتشغيل كل خطوة على النموذج المناسب لها، وتغيير المزود لاحقاً دون إعادة بناء سير العمل أو إعادة تدريب فريقك.

// هل تريد تطبيق هذا؟

دعنا نناقش كيف ينطبق هذا على عملك.

يراجع مهندس أول كل استفسار ويرد خلال يوم عمل واحد.

ابدأ محادثة