إنتقل إلى المحتوى الرئيسي

قيّم وكيل Claude الخاص بك (التقييمات)

متقدّم

عدّلت موجّهًا وبدا أفضل — لكن هل هو كذلك فعلًا؟ بدون التقييمات (evaluations) فأنت تطير على العمياء: كل تغيير هو رمية عملة، وتكتشف أنه تعطّل من مستخدم غاضب، لا من اختبار. التقييمات تحوّل "الانطباعات" إلى رقم يمكنك الوثوق به والدفاع عنه ومراقبته عبر الزمن. هذا هو الشيء الأكبر الوحيد الذي يفصل الموجّهات الهوائية عن عمل Claude بمستوى الإنتاج.

What you'll learn
  • لماذا "يبدو جيدًا بالنسبة لي" ليس اختبارًا — وما الذي يجب قياسه بدلًا من ذلك
  • ابنِ مجموعة بيانات ذهبية من إخفاقات حقيقية (من الأسفل إلى الأعلى)، لا من إخفاقات متخيَّلة
  • سجِّل بالشيفرة حيثما استطعت، وبنموذج لغوي كقاضٍ حيثما لم تستطع
  • اربط التقييمات بـ CI كي لا يستطيع تغيير في الموجّه أو النموذج أن يتراجع بصمت أبدًا

العقلية: قِس، لا تخمّن

ثلاث قواعد تنقذك:

  • من الأسفل إلى الأعلى يتفوق على من الأعلى إلى الأسفل. اجمع الإخفاقات الفعلية أولًا، ثم صمّم المقياس ليلتقطها. التقييم المبني من تعطّل حقيقي يتنبأ بالتعطّل الحقيقي؛ أما التقييم المخترَع على لوح أبيض فيقيس في الغالب مخيّلتك.
  • رقم يمكنك إعادة تشغيله. التقييم قابل للتكرار: المدخلات نفسها ← درجة قابلة للمقارنة. هذا ما يتيح لك مقارنة النسخة v1 بالنسخة v2 من الموجّه، أو claude-haiku-4-5 بـ claude-sonnet-5، بصدق.
  • رخيص التشغيل، شغّله كثيرًا. إن استغرق من إنسان فترة بعد ظهر، فلن يحدث. أتمتته.

ابنِ مجموعة بيانات ذهبية (من الأسفل إلى الأعلى)

مجموعة بياناتك الذهبية هي قلب كل تقييم — مجموعة منتقاة من المدخلات بتوقّعات معروفة الصحة.

Guided walkthrough1 of 4
  1. ابدأ من مخرجات سيئة فعلية: آثار الإنتاج، وتقارير الأخطاء، وتذاكر الدعم. هذه هي الحالات التي تهم.

التسجيل: الشيفرة أولًا، القاضي ثانيًا

اِلجأ إلى أرخص فحص موثوق أولًا.

  • الفحوص البرمجية (الحتمية) — استخدمها حيثما كان للجواب بنية: مطابقة دقيقة/بالكلمة المفتاحية، "JSON صالح وفق هذا المخطط"، "هل استدعى الأداة الصحيحة بالوسائط الصحيحة"، "أقل من N رمز / أقل من X مللي ثانية". سريعة ومجانية ولا تتقلب أبدًا.
  • نموذج لغوي كقاضٍ — للأبعاد الضبابية (الإفادة، النبرة، الأمانة لمصدر) التي تقاوم الشيفرة. أعطِ القاضي معيار تقييم، لا انطباعًا، وعايره مقابل تصنيفات بشرية قبل أن تثق به.

:::warning للقضاة تحيّزات يميل القضاة من النماذج اللغوية نحو الإجابات الأطول (تحيّز الإسهاب) ونحو أيّ خيار يُعرض أولًا (تحيّز الموضع). الدفاعات: معيار تقييم صارم، مقارنة ثنائية بدل التسجيل المطلق، وتبديل ترتيب الإجابات، وإعادة فحص القاضي مقابل شريحة مصنّفة بشريًا. القاضي طبقة واحدة، لا الاختبار كله. :::

معيار تقييم نموذج لغوي كقاضٍ (للبدء)

You are a strict grader. You are given a QUESTION, a REFERENCE answer, and a MODEL answer.
Score the MODEL answer from 1-5 on (a) faithfulness to the reference and (b) helpfulness.
Output ONLY JSON, nothing else: {"score": <1-5>, "reason": "<one short sentence>"}

QUESTION: {{question}}
REFERENCE: {{reference}}
MODEL: {{model_answer}}

للوكلاء، اختبر المسار أيضًا

يمكن للوكيل أن يصل إلى الجواب النهائي الصحيح بالطريقة الخاطئة — بالدوران، أو استدعاء أداة مدمّرة، أو استنزاف ميزانيتك. لذا قيّم الطريق، لا الوجهة فقط: هل استدعى الأدوات الصحيحة، بترتيب معقول، دون دورات، ضمن الميزانية؟ صحة استدعاء الأدوات وفحوص المسار تلتقط إخفاقات لا يراها تقييم يقتصر على الجواب النهائي أبدًا.

اربطه بـ CI

هنا تؤتي التقييمات ثمارها: اجعل التراجعات مستحيلة الدمج.

Guided walkthrough1 of 3
  1. سجِّل برمجيًا حيثما أمكن؛ وشغّل القاضي على الباقي.
مفردات التقييم
اضغط Enter أو مفتاح المسافة لقلب البطاقة. استخدم مفتاحي السهمين الأيسر والأيمن للتنقل بين البطاقات.تم إظهار المصطلح.
1 / 4

اختبر نفسك

0/3
  1. ما هو الخيار الأول الأكثر موثوقية لتسجيل تقييم؟
  2. من أين ينبغي أن تأتي حالات المجموعة الذهبية في الغالب؟
  3. بالنسبة لـ وكيل، ما الذي ينبغي أن تقيّمه إلى جانب الجواب النهائي؟
Key takeaways
  • لا تقييم = إطلاق على الانطباعات. ابنِ واحدًا قبل أن تثق بموجّه أو وكيل.
  • مجموعة ذهبية من إخفاقات حقيقية؛ نمّها كل أسبوع من تراجعات جديدة.
  • الفحوص المبنية على الشيفرة أولًا؛ نموذج لغوي كقاضٍ (بمعيار تقييم، معاير) للأجزاء الضبابية.
  • بالنسبة للوكلاء، قيّم المسار، لا المخرَج فقط.
  • شغّله في CI وأفشِل البناء عند الهبوط — هكذا تتوقف الجودة عن التراجع.

المصادر وقراءات إضافية

التالي