نظرًا لأن قدرات وكيل الشحن أصبحت رهانات بين شركات النماذج التأسيسية، تطلق Anthropic كلود سونيت 5، وهو إصدار أكثر قوة ووكيلًا من نموذج المختبر متوسط الحجم.
وقالت Anthropic في منشور بالمدونة: “يمكنها وضع الخطط، واستخدام أدوات مثل المتصفحات والمحطات الطرفية، والتشغيل بشكل مستقل على مستوى كان يتطلب، قبل بضعة أشهر فقط، نماذج أكبر وأكثر تكلفة”.
يعكس هذا الإطار ما قاله OpenAI وGoogle عن إصداراتهما الأخيرة. تم إطلاق GPT-5.6 Sol من OpenAI في المعاينة الأسبوع الماضي، وهو أيضًا النموذج الأكثر وكيلًا للشركة حتى الآن، مما يسمح للمستخدمين بتقسيم العمل عبر الوكلاء الفرعيين لمهام مستقلة أطول. تم طرح برنامج Gemini 3.5 Flash من Google، والذي تم إطلاقه في شهر مايو، باعتباره تحولًا من برنامج الدردشة الآلي للمحادثة إلى أداة وكيلة تخطط وتبني وتكرر العمل الحقيقي بأقل قدر من المدخلات البشرية.
إن عرض Sonnet 5 هو تأكيد على أن القدرة الوكيلة هي التوقع الأساسي الجديد في كل مستوى سعر. لن يكون الفرق الآن هو من يمكنه القيام بعمل الوكلاء بشكل أفضل، ولكن مدى رخص تكلفة القيام بذلك ومدى موثوقيته دون إشراف بشري.
يعد Sonnet 5 بأداء قريب من أداء Opus 4.8، ولكن بتكاليف أقل بكثير. بدءًا من يوم الثلاثاء، سيكون Claude Sonnet 5 هو النموذج الافتراضي للخطط المجانية والخطط الاحترافية، وهو متاح لكل اشتراك.
عند الإطلاق، يبلغ سعر Sonnet 5 2 دولار لكل مليون رمز إدخال و10 دولارات لكل مليون رمز إخراج حتى 31 أغسطس، وبعد ذلك سيقفز السعر إلى 3 دولارات لكل مليون رمز إدخال و10 دولارات لكل مليون رمز إخراج. وهذا يجعل Sonnet 5 أرخص من Opus 4.8، بالإضافة إلى GPT-5.5 وGemini 3.1 Pro من OpenAI. (لا يزال أغلى من Gemini 3.5 Flash.)
يُظهر النموذج الجديد أيضًا تحسينات كبيرة مقارنة بسابقه Sonnet 4.6، الذي تم إصداره في فبراير، فيما يتعلق بالأداء الفاعل مثل التفكير واستخدام الأدوات وترميز البرامج والعمل المعرفي، وفقًا لـ Anthropic.
على سبيل المثال، في أحد المعايير، سجلت Sonnet 5 63.2% في التشفير الوكيل، مقارنة بـ Opus 4.8 التي حصلت على 69.2% وSonnet 4.6 التي حصلت على 58.1%. في معيار العمل المعرفي، تتفوق Sonnet 5 في الواقع بشكل طفيف على Opus 4.8، المعروف بفوزه في حل أصعب المشكلات مثل إصدار الأحكام الدقيقة والبحث العميق.
يقول Anthropic: “لا يزال Opus 4.8 هو النموذج المفضل للحصول على دقة أعلى في هذه المهام، لكن Sonnet 5 يوفر للمطورين خيارات أقل سعرًا وذات جودة أعلى بكثير مما كان متاحًا سابقًا”. “بين Sonnet 5 وOpus 4.8، يمكن للمستخدمين ضبط مستوى الجهد لإيجاد التوازن الصحيح بين التكلفة والأداء.”
وفقًا للمختبرين المذكورين في منشور المدونة، يتفوق Sonnet 5 أيضًا في إنهاء المهام المعقدة حيث كانت إصدارات النماذج السابقة قد توقفت عن العمل و”تتحقق من مخرجاتها الخاصة دون أن يُطلب منها ذلك صراحةً”.
وقال دانييل شيبرد، أحد كبار المهندسين في Zapier، في بيان: “لقد سلمنا Claude Sonnet 5 مهمة مكونة من جزأين – تحديث مستويات حساب Salesforce، وإرسال إعلان الإطلاق إلى جهات اتصال المؤسسة – وانتهى الأمر من البداية إلى النهاية”. “كان ذلك يتوقف في منتصف الطريق. أما بالنسبة للأتمتة اليومية، فهذا أمر لا يحتاج إلى تفكير. “
فيما يتعلق بالسلامة، يُظهر Sonnet 5 أيضًا معدلًا أقل من “السلوكيات غير المرغوب فيها” مثل التعاون مع سوء الاستخدام والخداع مقارنة بسابقه، مما يجعله أكثر أمانًا للاستخدام في السياقات الوكيلة. من الأفضل رفض الطلبات الضارة وتجنب محاولات الاختطاف في هجمات الحقن الفوري. كما أنه يهلوس وينخرط في سلوك متملق بمعدل أقل من Sonet 4.6.
ومع ذلك، فهي ليست على نفس مستوى Opus 4.8 وClaude Mythos Preview عندما يتعلق الأمر بالسلوك المنحرف. “تُظهر التقييمات أيضًا أن لديها قدرة أقل بكثير على أداء مهام الأمن السيبراني الخطيرة مقارنة بنماذج Opus الحالية لدينا”، كما جاء في منشور المدونة.
وقال فابيان هيدين، المؤسس المشارك المحبوب، في بيان إن كلود سونيت 5 “يرفض الطلبات غير الآمنة بشكل نظيف ومتسق”.
وقال هيدين: “في Lovable، نضع أدوات قوية في أيدي الملايين من عمال البناء”. “إن النموذج الذي يعرف متى يقول لا لا يقل أهمية عن النموذج الذي يعرف كيفية البناء.”
عندما تقوم بالشراء من خلال الروابط الموجودة في مقالاتنا، قد نكسب عمولة صغيرة. هذا لا يؤثر على استقلالنا التحريري.
اكتشاف المزيد من في بي دبليو الشامل
اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.
