صدر أنثروبيك كلود السوناتة 5، أحدث طراز من فئة السوناتة. على الرغم من أنه ليس اختراقًا في النماذج الحدودية، إلا أن Sonnet 5 يعمل على ترقية الأداء بشكل هادف مقارنة بالنماذج السابقة لتوفير إمكانات تشفير أقوى وأداء وكيل أفضل واستخدام رمزي أكثر كفاءة.

أكد إعلان أنثروبيك على الأداء الفعال، وتحديدًا قدرة النموذج على تنفيذ عمل متعدد الخطوات بتوجيه بشري أقل مباشرة. تقول Anthropic إن Sonnet 5 يمكنه وضع الخطط، واستخدام أدوات مثل المتصفحات والمحطات الطرفية، والعمل بشكل مستقل على مستوى يتطلب مؤخرًا نماذج أكبر وأكثر تكلفة.

Sonnet 5 أكثر اقتصادا مع الرموز

يُظهر Anthropic أن Sonnet 5 يتحسن أكثر من 4.6 مع خيارات سعر أقل وجودة أعلى. لا يزال Opus 4.8 يتفوق على Sonnet 5 من حيث الدقة، لكن Anthropic تقول إنه يمكن تعديل مستوى الجهد لإيجاد أفضل توازن بين التكلفة والأداء. يوجد أيضًا سعر تمهيدي لـ Sonnet 5 يبلغ 2 دولارًا أمريكيًا/إدخال MTok وإخراج 10 دولارات أمريكية/MTok حتى 31 أغسطس.

سونيت 5 معايير الأداء

يتفوق Sonnet 5 على Sonnet 4.6 وGPT-5.5 وGemini 3.5 Flash عبر عدد من المعايير.

يختبر BrowseComp مدى قدرة وكيل الذكاء الاصطناعي على تحديد موقع المعلومات التي يصعب العثور عليها على الويب.

عشرات BrowseComp:

  • كلود سونيت 5: 84.7 (وكيل واحد)
  • كلود سونيت 4.6: 76.2
  • جي بي تي-5.5: 84.4

يعد Terminal-Bench 2.1 بمثابة اختبار لقدرة نموذج الذكاء الاصطناعي على مهام الترميز في الوحدة الطرفية وواجهة سطر الأوامر (CLI).

نتائج المحطة الطرفية 2.1:

  • كلود السوناتة 5: 80.4
  • كلود سونيت 4.6: 67.0
  • GPT-5.5: 83.4 (Codex CLI)
  • الجوزاء 3.5: فلاش 76.2

يعد SWE-bench Pro معيارًا قياسيًا لهندسة البرمجيات حيث تفوقت Sonnet 5 في أداء LLMs الأخرى المماثلة.

نتائج SWE-bench Pro:

  • كلود السوناتة 5: 63.2
  • كلود سونيت 4.6: 58.1
  • جي بي تي-5.5: 58.6
  • الجوزاء 3.5 فلاش: 55.1

يعد FrontierCode معيارًا للتشفير الوكيل عبر 150 مهمة، وهو معيار تفوق فيه Sonnet 5 بشكل كبير على GPT-5.5.

تشرح بطاقة نظام Claude Sonnet 5 ما يلي:

“تمنح كل مهمة الوكيل مستودعًا مسحوبًا ووصفًا واحدًا للمشكلة؛ ثم يعمل الوكيل بشكل مستقل في بيئة حاوية لإنتاج التصحيح النهائي، دون تدخل بشري ولا معلومات عن المهلة.

يتم تصنيف التصحيحات وفقًا للمعايير الوظيفية المحظورة (اختبارات الوحدة التي تم إجراؤها بشكل أساسي) بالإضافة إلى معايير التقييم المرجحة، بما في ذلك عمليات الفحص المتدرجة للنموذج لتغطية الاختبار المطلوبة وأنماط التنفيذ المحظورة. تم تأليف المهام من قبل القائمين على المستودعات الأساسية وتمت مراجعتها بشكل فردي من قبل باحثي Cognition، مع مجموعة فرعية عشوائية تم حلها يدويًا للتحقق من العدالة.

درجات FrontierCode:

  • كلود سونيت 5: 38.8
  • كلود سونيت 4.6: 15.1
  • جي بي تي-5.5: 25.5

السوناتة 5 هي “الذكاء القريب من التأليف”

لا تدعي أنثروبيك أن Sonnet 5 هو اختراق في النموذج الحدودي، على الرغم من أنها تقول إنه النموذج الأكثر قدرة من فئة Sonnet. توضح بطاقة النظام أنها أقل قدرة من طرازات Opus و Mythos الأكثر قدرة من Anthropic. ومع ذلك فإن الأنثروبيك تدعي أنها “ذكاء قريب من Opus في أسعار Sonnet للبرمجة والوكلاء والعمل المهني اليومي.

اقرأ الإعلان الكامل في Anthropic.

صورة مميزة بواسطة Shutterstock/jackpress


اكتشاف المزيد من قمم التجارية للأعمال

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً