مرلين — يوميات مدير بالذكاء الاصطناعي

الإشارة الخضراء لا تكفي: كيف تكتشف القبول والرفض الخاطئين؟

قد تقبل البوابة مخرجات معطوبة وترفض مخرجات سليمة. قِس false pass وfalse fail كلًا على حدة قبل أن تثق بالإشارة الخضراء.

Tekeralab Editorial··3 دقيقة قراءة
تم إعداد هذا المحتوى بمساعدة الذكاء الاصطناعي ومراجعته من قِبل محرر.
مصفوفة أخطاء بوابة AI Agent وفيها true pass وfalse pass وfalse fail وtrue fail

هل تعني الإشارة الخضراء في بوابة جودة وكيل الذكاء الاصطناعي أن القرار صحيح؟ ليس دائماً. قد تقبل البوابة مخرجاً معطوباً، وقد ترفض مخرجاً سليماً. إذا لم تقس هذين الخطأين بصورة منفصلة، فإن لوحة الاختبار قد تمنحك ثقة زائفة.

خطآن تخفيهما إشارة خضراء واحدة

يمكن للبوابة أن تخطئ في اتجاهين مختلفين:

  • False pass: المخرج خاطئ في الواقع، لكن البوابة تقبله.
  • False fail: المخرج صحيح في الواقع، لكن البوابة ترفضه.

يرفع false pass مخاطر الجودة والسلامة. أما false fail فيوقف عملاً صحيحاً، ويولد إعادة محاولات غير ضرورية، ويستهلك وقت الفريق. لذلك لا يكفي أن تسأل: «كم اختباراً نجح؟»

ابنِ مصفوفة قرار 2×2

قارن كل قرار للبوابة بـ ground truth مستقل:

الحالة الحقيقيةقرار البوابةالنتيجة
صحيحةقبولTrue pass
خاطئةقبولFalse pass
صحيحةرفضFalse fail
خاطئةرفضTrue fail

تكشف هذه المصفوفة الأخطاء التي تخفيها نسبة نجاح واحدة.

أنشئ ground truth مستقلاً أولاً

لا تختبر البوابة بالمنطق نفسه الذي استُخدم لكتابتها؛ فقد يتكرر الخطأ نفسه في الإنتاج والتقييم. بدلاً من ذلك:

  1. أنشئ مجموعة اختبار معنونة من أمثلة واقعية وممثلة.
  2. حدّد النتيجة المتوقعة بمراجعة بشرية أو بمدقق مستقل.
  3. قارن قرارات البوابة بهذه العلامات.
  4. أعد تشغيل المجموعة نفسها بعد كل تعديل.

استخدم ضوابط إيجابية وسلبية

لاختبار الاتجاهين، استخدم أزواجاً متقابلة مثل:

  • الملف موجود / الملف مفقود
  • HTTP 200 / HTTP 500
  • مخرج كامل / مخرج مقطوع
  • استدعاء أداة صحيح / استدعاء أداة خاطئ
  • معرّف دليل صالح / دليل مفقود أو معاد الاستخدام

البوابة التي اختُبرت فقط على أمثلة ناجحة لم تثبت قدرتها على رفض ما يجب رفضه.

لا تدمج كل الأخطاء في درجة واحدة

راقب على الأقل هذه المقاييس بشكل منفصل:

  • False-pass rate: ما نسبة الأمثلة الخاطئة التي قُبلت بالخطأ؟
  • False-fail rate: ما نسبة الأمثلة الصحيحة التي رُفضت بالخطأ؟
  • Coverage: ما نسبة السيناريوهات الحرجة الموجودة في مجموعة الاختبار؟
  • Reproducibility: هل ينتج الإدخال نفسه القرار نفسه عند التكرار؟

توضح وثائق Microsoft Agent Framework أيضاً أن تقييم الوكلاء يجب أن يفصل بين الالتزام بالمهمة، وصحة استخدام الأدوات، وجودة النتيجة. المصدر: Microsoft Learn — Agent evaluation

ماذا يجب أن تثبت بوابة المتانة؟

يجب أن تعمل البوابة بصورة صحيحة في ظروف التشغيل الحقيقية، لا في التجربة الأولى فقط. اختبر ما يلي:

  • هل يتغير القرار بعد إعادة تشغيل الخدمة؟
  • هل تجعل إعادة المحاولة العملية نفسها تبدو مكتملة مرتين؟
  • هل تؤثر ذاكرة cache قديمة في القرار الجديد؟
  • هل يظهر regression بعد تغيير النموذج أو الـ prompt؟
  • هل يربط سجل الدليل القرار بالمدخل الصحيح؟
  • هل يمكن لـ shadow run مقارنة البوابة الجديدة بالقديمة بأمان؟

قائمة عملية لمراجعة البوابة

  • هل يوجد ground truth مستقل؟
  • هل تعمل الضوابط الإيجابية والسلبية؟
  • هل يُبلّغ عن false pass وfalse fail منفصلين؟
  • هل يُسجَّل كل قرار مع المدخل والمخرج والإصدار ومعرّف الدليل؟
  • هل اختُبرت سيناريوهات الإعادة وإعادة التشغيل؟
  • هل جرى التحقق من تغيير العتبة أولاً في shadow mode؟

إجابات قصيرة

ما هي بوابة AI Agent؟

هي نقطة تحكم تقرر ما إذا كان مخرج الوكيل أو فعله يمكنه الانتقال إلى المرحلة التالية.

لماذا لا تكفي الإشارة الخضراء دليلاً؟

لأن البوابة ربما قبلت مخرجاً خاطئاً. لا تُعرف صحة القرار إلا عند مقارنته بـ ground truth مستقل.

أي مقياس يجب فحصه أولاً؟

في الأفعال عالية المخاطر، ابدأ بـ false-pass rate. وفي كفاءة التشغيل، راقب false-fail rate أيضاً. لا تخفِهما داخل درجة نجاح واحدة.

الخلاصة

البوابة الموثوقة ليست البوابة التي تعرض كثيراً من الإشارات الخضراء، بل التي تستطيع إثبات أنها توقف المخرجات الخاطئة ولا تعرقل المخرجات الصحيحة بلا سبب. يتطلب ذلك ضوابط ثنائية الاتجاه، وground truth مستقلاً، ومقاييس أخطاء منفصلة.

مشاركةXLinkedInWhatsApp

اطرح سؤالاً

لديك سؤال حول هذا المقال؟ اترك بريدك الإلكتروني وسنجيبك.

اشترك ليصلك الجديد

رسالة إلى رسالتين شهريًا حول سوق تركيا والذكاء الاصطناعي. لا رسائل مزعجة.

مقالات ذات صلة