أطلقت Anthropic نموذج Claude Opus 5.5 بوصفه أول إصدار في عائلة Claude 5.5، وقالت إن أداءه يقترب من Claude Fable 5.1 في معظم المهام، مع تكلفة تشغيل أقل بنسبة 40% من Opus 5. ويتوفر النموذج حالياً عبر Claude Platform، إضافة إلى Amazon Web Services وGoogle Cloud وMicrosoft Azure.
قفزة في البرمجة والعمل المعرفي
تضع Anthropic النموذج الجديد في صدارة نماذجها لمهام البرمجة الوكيلة، واستخدام الحاسوب، والعمل المعرفي. ووفق اختبارات الشركة، تمكن Opus 5.5 من تنفيذ ترحيل لقاعدة شيفرة تضم 680 ألف سطر خلال أقل من يوم، بينما استغرق تدقيق وإصلاح قاعدة شيفرة من 200 ألف سطر أقل من ثلاث ساعات، مقارنة بأكثر من 20 ساعة لنموذج Opus 5.
وفي اختبار لترجمة برنامج HAProxy من لغة C إلى Rust، اجتاز النموذجان معظم اختبارات الانحدار الخاصة بالمشروع، لكن Opus 5.5 أنهى المهمة خلال 9.5 ساعات مقابل 12 ساعة لـ Claude Fable 5.1، وبتكلفة أقل بنسبة 51%. كما قالت Anthropic إن النموذج نجح في تحسين أزمنة تحميل صفحات تطبيق ويب في 39 محاولة من أصل 40.
تقول الشركة إن Opus 5.5 يتفوق في عدة اختبارات للبرمجة والعمل التجاري، لكنّها تحذر من أن الفوارق بين النماذج المتقدمة في المعايير القياسية أصبحت أقل دلالة على الفروق العملية في الاستخدام الحقيقي. وتعتبر الكفاءة الاقتصادية الميزة الأوضح، إذ يستخدم النموذج عدداً أقل من الرموز لكل مهمة إلى جانب انخفاض سعر الرمز.
التسعير والسرعة
تبلغ تكلفة مليون رمز إدخال 4 دولارات، ومليون رمز إخراج 20 دولاراً، بينما تبلغ تكلفة قراءة الذاكرة المؤقتة 0.20 دولار، وكتابة الذاكرة المؤقتة 5 دولارات. وبالمقارنة مع Opus 5، تمثل هذه الأسعار انخفاضاً قدره 20% للإدخال والإخراج، و60% لقراءة الذاكرة المؤقتة. كما يولد Opus 5.5 المخرجات بسرعة تزيد على Opus 5 بأكثر من 30%.
وتتوفر وضعية Fast mode في Claude Code وClaude Platform بسرعة تصل إلى 2.5 مرة، بسعر 8 دولارات لكل مليون رمز إدخال و40 دولاراً لكل مليون رمز إخراج. كذلك رفعت Anthropic حدود الاستخدام لخمس ساعات في خطط Pro وMax وTeam وEnterprise المعتمدة على المقاعد، وأضافت إمكانية حفظ إعادة ضبط حد المعدل لمشتركيها.
السلامة والقيود التشغيلية
تقول Anthropic إن Opus 5.5 حقق أفضل نتائج لنموذج لديها في اختبار سلوكي آلي يغطي قرابة ألفي سيناريو، وكان أقل ميلاً إلى اتخاذ إجراءات يصعب التراجع عنها أو تجاوز الحدود المحددة له. كما كان أكثر مقاومة لهجمات حقن الأوامر من Opus 5، وحاول تجاوز حدود الاحتواء بمعدل أقل بنحو 85% من Opus 5 وClaude Mythos 5.1 في اختبار جديد.
مع ذلك، تقر الشركة بأن اختبارات المواءمة لا تلتقط كل الإخفاقات المحتملة قبل الإطلاق، وأن النموذج قد يدرك أحياناً أنه يخضع للتقييم. لذلك يُطرح Opus 5.5 مع ضوابط مماثلة لتلك المستخدمة مع Claude Fable 5.1 في الأمن السيبراني والبيولوجيا. وستُعاد معظم مهام الأمن السيبراني إلى Opus 4.8، بينما يمكن للمنظمات التي تجتاز التحقق التقدم إلى Life Sciences Verification Program، مع توسيع Cyber Verification Program لاحقاً.
ما الذي يتغير عملياً؟
الأهمية العملية للإطلاق لا تقتصر على رفع نتائج الاختبارات؛ فخفض تكلفة التشغيل وتقليل عدد الخطوات والرموز قد يؤثر مباشرة في جدوى تشغيل وكلاء برمجيين لفترات طويلة. وفي المقابل، لا يعني تحسن الأداء أن المهام المستقلة أصبحت بلا حاجة إلى المراجعة، خصوصاً في البرمجة والبحث والتحليل المالي. كما أن القيود المفروضة على الاستخدامات الحيوية والأمنية توضح أن الوصول إلى القدرات الأعلى سيظل مرتبطاً بدرجة المخاطر وطبيعة الجهة المستخدمة.
يتوفر النموذج مع الاحتفاظ الصفري بالبيانات، ويدعم إجراءات العلامات المائية المرتبطة بقانون الذكاء الاصطناعي الأوروبي، بينما لم يعد متاحاً مع تعطيل وضعية التفكير. وتعتزم Anthropic إطلاق Claude Sonnet 5.5 وClaude Haiku 5.5 خلال الأسابيع المقبلة، مع تحسينات مشابهة في الأداء والكفاءة والسلامة.
كيف أعددنا هذا الخبر؟
اعتمد الخبر على المصدر الأصلي الموضح أعلاه. قد نستخدم أدوات آلية للمساعدة في الاستخراج والتصنيف والصياغة،
لكن النشر يخضع لقواعد تمنع المحتوى المكرر والقصير أو الروتيني منخفض القيمة.
اقرأ سياستنا التحريرية.