قيّم وكيل Claude الخاص بك (التقييمات)
عدّلت موجّهًا وبدا أفضل — لكن هل هو كذلك فعلًا؟ بدون التقييمات (evaluations) فأنت تطير على العمياء: كل تغيير هو رمية عملة، وتكتشف أنه تعطّل من مستخدم غاضب، لا من اختبار. التقييمات تحوّل "الانطباعات" إلى رقم يمكنك الوثوق به والدفاع عنه ومراقبته عبر الزمن. هذا هو الشيء الأكبر الوحيد الذي يفصل الموجّهات الهوائية عن عمل Claude بمستوى الإنتاج.
- لماذا "يبدو جيدًا بالنسبة لي" ليس اختبارًا — وما الذي يجب قياسه بدلًا من ذلك
- ابنِ مجموعة بيانات ذهبية من إخفاقات حقيقية (من الأسفل إلى الأعلى)، لا من إخفاقات متخيَّلة
- سجِّل بالشيفرة حيثما استطعت، وبنموذج لغوي كقاضٍ حيثما لم تستطع
- اربط التقييمات بـ CI كي لا يستطيع تغيير في الموجّه أو النموذج أن يتراجع بصمت أبدًا
العقلية: قِس، لا تخمّن
ثلاث قواعد تنقذك:
- من الأسفل إلى الأعلى يتفوق على من الأعلى إلى الأسفل. اجمع الإخفاقات الفعلية أولًا، ثم صمّم المقياس ليلتقطها. التقييم المبني من تعطّل حقيقي يتنبأ بالتعطّل الحقيقي؛ أما التقييم المخترَع على لوح أبيض فيقيس في الغالب مخيّلتك.
- رقم يمكنك إعادة تشغيله. التقييم قابل للتكرار: المدخلات نفسها ← درجة قابلة للمقارنة. هذا ما يتيح لك مقارنة النسخة v1 بالنسخة v2 من الموجّه، أو
claude-haiku-4-5بـclaude-sonnet-5، بصدق. - رخيص التشغيل، شغّله كثيرًا. إن استغرق من إنسان فترة بعد ظهر، فلن يحدث. أتمتته.
ابنِ مجموعة بيانات ذهبية (من الأسفل إلى الأعلى)
مجموعة بياناتك الذهبية هي قلب كل تقييم — مجموعة منتقاة من المدخلات بتوقّعات معروفة الصحة.
- ابدأ من مخرجات سيئة فعلية: آثار الإنتاج، وتقارير الأخطاء، وتذاكر الدعم. هذه هي الحالات التي تهم.
- اكتب يدويًا حالات تغطي أكثر سيناريوهاتك حرجًا وأكثرها عرضة للخطأ. هذه هي مجموعتك المرجعية المستقرة.
- أضِف عيّنات إنتاج مجرّدة من الهوية (انزع المعلومات الشخصية) وحالات اصطناعية للسيناريوهات الناقصة التمثيل. لا تثق بالمقاييس المجمّعة على مجموعة صغيرة.
- كل تراجع إنتاج جديد يصبح حالة اختبار جديدة. المجموعة الذهبية حيّة، لا مجمّدة.
التسجيل: الشيفرة أولًا، القاضي ثانيًا
اِلجأ إلى أرخص فحص موثوق أولًا.
- الفحوص البرمجية (الحتمية) — استخدمها حيثما كان للجواب بنية: مطابقة دقيقة/بالكلمة المفتاحية، "JSON صالح وفق هذا المخطط"، "هل استدعى الأداة الصحيحة بالوسائط الصحيحة"، "أقل من N رمز / أقل من X مللي ثانية". سريعة ومجانية ولا تتقلب أبدًا.
- نموذج لغوي كقاضٍ — للأبعاد الضبابية (الإفادة، النبرة، الأمانة لمصدر) التي تقاوم الشيفرة. أعطِ القاضي معيار تقييم، لا انطباعًا، وعايره مقابل تصنيفات بشرية قبل أن تثق به.
:::warning للقضاة تحيّزات يميل القضاة من النماذج اللغوية نحو الإجابات الأطول (تحيّز الإسهاب) ونحو أيّ خيار يُعرض أولًا (تحيّز الموضع). الدفاعات: معيار تقييم صارم، مقارنة ثنائية بدل التسجيل المطلق، وتبديل ترتيب الإجابات، وإعادة فحص القاضي مقابل شريحة مصنّفة بشريًا. القاضي طبقة واحدة، لا الاختبار كله. :::
معيار تقييم نموذج لغوي كقاضٍ (للبدء)
You are a strict grader. You are given a QUESTION, a REFERENCE answer, and a MODEL answer.
Score the MODEL answer from 1-5 on (a) faithfulness to the reference and (b) helpfulness.
Output ONLY JSON, nothing else: {"score": <1-5>, "reason": "<one short sentence>"}
QUESTION: {{question}}
REFERENCE: {{reference}}
MODEL: {{model_answer}}للوكلاء، اختبر المسار أيضًا
يمكن للوكيل أن يصل إلى الجواب النهائي الصحيح بالطريقة الخاطئة — بالدوران، أو استدعاء أداة مدمّرة، أو استنزاف ميزانيتك. لذا قيّم الطريق، لا الوجهة فقط: هل استدعى الأدوات الصحيحة، بترتيب معقول، دون دورات، ضمن الميزانية؟ صحة استدعاء الأدوات وفحوص المسار تلتقط إخفاقات لا يراها تقييم يقتصر على الجواب النهائي أبدًا.
اربطه بـ CI
هنا تؤتي التقييمات ثمارها: اجعل التراجعات مستحيلة الدمج.
- سجِّل برمجيًا حيثما أمكن؛ وشغّل القاضي على الباقي.
- حدّد عتبة (مثلًا: يجب ألا تنخفض الدرجة مقابل main). تغيير موجّه يتراجع بالجودة لا يمكن إطلاقه.
- حين يبلّغ القاضي عن استجابة حية، وجّهها إلى طابور مراجعة بشرية؛ يؤكّد المراجِع، ويضيف الحالة إلى المجموعة الذهبية، ويعيد الاختبار بعد الإصلاح.
اختبر نفسك
0/3- لا تقييم = إطلاق على الانطباعات. ابنِ واحدًا قبل أن تثق بموجّه أو وكيل.
- مجموعة ذهبية من إخفاقات حقيقية؛ نمّها كل أسبوع من تراجعات جديدة.
- الفحوص المبنية على الشيفرة أولًا؛ نموذج لغوي كقاضٍ (بمعيار تقييم، معاير) للأجزاء الضبابية.
- بالنسبة للوكلاء، قيّم المسار، لا المخرَج فقط.
- شغّله في CI وأفشِل البناء عند الهبوط — هكذا تتوقف الجودة عن التراجع.
المصادر وقراءات إضافية
- نموذج لغوي كقاضٍ: أفضل التقنيات والممارسات — DeepEval — معايير التقييم والمعايرة وتحيّز القاضي.
- دليل تقييم وكلاء الذكاء الاصطناعي 2026 — أدوات الاختبار والمسارات والمراقبة — أهداف حجم المجموعة الذهبية ودمج CI.
- نموذج لغوي كقاضٍ: 7 أفضل ممارسات وقوالب — Monte Carlo — قوالب قاضٍ عملية والمزالق.
- تقييم النماذج اللغوية: نصائح عملية في Booking.com — دروس من التقييم بمقياس الإنتاج.
- Anthropic — طوّر اختباراتك / قيّم — إرشادات رسمية لبناء تقييمات تجريبية لـ Claude.
التالي
- الفجوة التي وُجدت التقييمات لسدّها ← فجوة القدرة–الموثوقية
- راكِم المزيد من الحركات القوية ← سير العمل الاحترافي والحركات القوية
- اجعل المخرجات قابلة للتسجيل بالشيفرة ← المخرجات المهيكلة · استخدام الأدوات