ضمان الجودة وسلامة الإصدارات بمساعدة الذكاء الاصطناعي

تقييم الذكاء الاصطناعي واختباره

اختبر الذكاء الاصطناعي داخل منتجك، لا التطبيق المحيط به فقط. نقيّم جودة الإجابات واستنادها إلى المصادر والصلاحيات ومعالجة الإخفاقات في الوكلاء وروبوتات المحادثة وميزات LLM، ونضع معايير واضحة للإصدار.

مَن يحتاج إلى تقييم الذكاء الاصطناعي

تبدو ميزة الذكاء الاصطناعي لديك جيدة في العرض التجريبي، لكن لا أحد يستطيع بعدُ أن يحدد كيف تتصرف مع الأسئلة الحقيقية والمدخلات العدائية والبيانات الناقصة، أو ما إذا كان التغيير التالي في النموذج أو التوجيهات سيجعلها أسوأ.

  • فرق على وشك إتاحة روبوت محادثة أو مساعد لعملائها
  • أصحاب منتجات يغيّرون النموذج أو المزوّد أو التوجيهات ويحتاجون إلى مقارنة بين ما قبل التغيير وما بعده
  • شركات تسمح لوكيل بقراءة سجلات داخلية أو تشغيل إجراءات في أنظمة أخرى

كيف يُقيَّم كل سلوك

خطة توضيحية لمساعد يتعامل مع العملاء؛ وتتغير الأساليب بحسب حالة الاستخدام لديك ومخاطرها.

تقييمات مؤتمتةمراجعة الخبراءاختبار الفريق الأحمرمؤشرات بيئة الإنتاج
دقة الإجاباتالأسلوب الأساسيالأسلوب الأساسينادرًا ما يُستخدم هناداعم أو بالعيّنات
الاستناد إلى المصادر والاستشهاداتالأسلوب الأساسيداعم أو بالعيّناتنادرًا ما يُستخدم هناداعم أو بالعيّنات
حدود الصلاحياتداعم أو بالعيّناتالأسلوب الأساسيالأسلوب الأساسيداعم أو بالعيّنات
حقن التوجيهاتداعم أو بالعيّناتداعم أو بالعيّناتالأسلوب الأساسيداعم أو بالعيّنات
حالات الرفض والبدائل الاحتياطيةالأسلوب الأساسيداعم أو بالعيّناتداعم أو بالعيّناتالأسلوب الأساسي
  • الأسلوب الأساسي
  • داعم أو بالعيّنات
  • نادرًا ما يُستخدم هنا

اختبار ميزات الذكاء الاصطناعي مهمة مختلفة

قد يجتاز روبوت المحادثة جميع الاختبارات الوظيفية، ومع ذلك يقدّم إجابة خاطئة بثقة، أو يكشف بيانات لا ينبغي كشفها، أو ينفّذ تعليمات مخفية في ملف مرفوع. لذا تحتاج ميزات الذكاء الاصطناعي إلى تقييم خاص بها: مجموعات بيانات من حالات حقيقية وصعبة، وفحوصات لجودة الإجابات واستنادها إلى المصادر، وصلاحيات الأدوات والبيانات، ومدى التعرّض لحقن التوجيهات، ومعالجة الإخفاقات، وفحوصات الانحدار كلما تغيّر نموذج أو توجيه. وهذا يختلف عن اختبار تطبيق عادي ساعد الذكاء الاصطناعي في بنائه، وهو ما تغطيه خدمة ضمان جودة البرمجيات والاختبار.

يساعد الذكاء الاصطناعي في التقييم على نطاق واسع؛ ويحدد الخبراء المعيار

كيف يساعد الذكاء الاصطناعي

  • يولّد صيغًا مختلفة من أسئلة المستخدمين الحقيقية التي توافق عليها، بما في ذلك إعادة الصياغة والحالات الحدّية والمدخلات العدائية.
  • يقيّم دفعات كبيرة من الإجابات عبر تقييم قائم على النماذج، معايَر مقابل إجابات صنّفها الخبراء.
  • يجمّع الإخفاقات حسب السبب، مثل سياق ناقص أو استدعاء خاطئ لأداة أو تعليمات تم تجاهلها.
  • يقارن نتائج التشغيل عبر تغييرات النموذج أو التوجيهات أو الاسترجاع، وينبّه إلى المواضع التي تراجع فيها السلوك.

ما يتولّاه خبراؤنا

  • يحدد الخبراء، بالتعاون مع المتخصصين في مجالك، ما الإجابة الصحيحة والآمنة والمفيدة.
  • يراجع أشخاص عيّناتٍ من التقييمات القائمة على النماذج، ويُصلَح أي مقيِّم يخالف الخبراء أو يُستبعد.
  • يقرر البشر الأدوات والبيانات التي يجوز للوكيل استخدامها، والمواضع التي يجب أن يوافق فيها إنسان أو يتولّى المهمة.
  • تبقى معايير الإصدار وقرار الإطلاق أو التأجيل بيد فريقك وفريقنا، لا بيد درجة تقييم وحدها.

ما تحصل عليه

تقييم يمكنك إعادة تشغيله مع كل تغيير

  • مجموعة بيانات التقييم

    حالات حقيقية واصطناعية مصنّفة بالسلوك المتوقع: الأسئلة الشائعة، والحالات الحدّية، والطلبات الخارجة عن النطاق، والإخفاقات السابقة.

  • جودة الإجابات واستنادها إلى المصادر

    الدقة والملاءمة والنبرة، ومدى استناد الإجابات إلى مصادرك، مع التحقق من الاستشهادات ورصد الهلوسات.

  • اختبارات صلاحيات الأدوات والبيانات

    ما يستطيع الوكيل قراءته أو تغييره أو تشغيله، مُختبرًا وفق مبدأ أقل الصلاحيات اللازمة ونقاط الموافقة ومسارات تولّي البشر المهمة.

  • التعرّض لحقن التوجيهات

    الحقن المباشر وغير المباشر (Prompt Injection) عبر الرسائل والملفات المرفوعة وصفحات الويب والمستندات المسترجعة، مع تصنيف كل حالة بحسب ما يمكن للمهاجم الوصول إليه.

  • معالجة الإخفاقات والبدائل الاحتياطية

    السلوك عندما تنتهي مهلة النموذج، أو يتعطل المزوّد، أو لا يجد الاسترجاع شيئًا، أو تنخفض الثقة: البدائل الاحتياطية، والرسائل الواضحة، والإحالة إلى البشر.

  • فحوصات الانحدار ومعايير الإصدار

    تقييمات مؤتمتة يُعاد تشغيلها عند تغيّر النماذج أو التوجيهات أو البيانات، مع معايير متفق عليها تحدد ما إذا كان التغيير سيُطلق.

كيف يسير تقييم الذكاء الاصطناعي

  1. 01

    تحديد السلوك الجيد

    الاتفاق مع فريقك وخبراء المجال على حالات الاستخدام والمخاطر ومعايير الجودة والصلاحيات، وجمع أمثلة حقيقية تسمح لنا باستخدامها.

  2. 02

    بناء مجموعة البيانات

    تجميع حالات التقييم وتصنيفها، بما فيها الحالات الصعبة والعدائية، وتحديد معايير الإصدار التي يجب أن يستوفيها كل تغيير.

  3. 03

    التقييم والفحص المعمّق

    إجراء تقييمات مؤتمتة مع مراجعة الخبراء، واختبار الصلاحيات وحقن التوجيهات بأسلوب الفريق الأحمر (Red Teaming)، وتتبّع الإخفاقات إلى التوجيهات أو الاسترجاع أو الأدوات أو النموذج.

  4. 04

    ضبط الإصدار والمراقبة

    إضافة التقييمات إلى عملية الإصدار لديك، والإبلاغ عن النتائج مع الإصلاحات الموصى بها، وإبقاء مجموعة البيانات محدّثة مع تغيّر المنتج.

طريقتان للعمل بأدوات الذكاء الاصطناعي

يساعد الذكاء الاصطناعي في صياغة مسودات الاختبارات وتقصّي العيوب. اختر أين يُسمح له بمعالجة شيفرتك وبيانات الاختبار.

لست متأكدًا؟ سنوصي بإحداهما خلال تحديد النطاق. قارن الباقتين بالتفصيل

طلبات تقييم شائعة

سيناريوهات نموذجية نحدد نطاقها، وليست دراسات حالة لعملاء.

  • مساعد لمركز المساعدة قبل الإطلاق العام

    يريد فريق مساعدًا يجيب استنادًا إلى مقالات المساعدة لديه. نحوّل أسئلة الدعم الحقيقية إلى مجموعة مصنّفة، ونقيّم الإجابات والاستشهادات، ونضيف حالات خارجة عن النطاق وأخرى عدائية، ونتفق على معايير الإصدار قبل الإطلاق.

  • نقل ميزة إلى نموذج أقل تكلفة

    يريد صاحب منتج نقل ميزة إلى نموذج أو مزوّد أرخص. نشغّل مجموعة التقييم نفسها على الخيارين، ونبيّن أين تتحسن الإجابات أو تسوء وكيف يتغير زمن الاستجابة، ونترك القرار له.

  • وكيل يستطيع تعديل السجلات

    تسمح شركة لوكيل داخلي بتحديث الطلبات. نختبر صلاحيات أدواته ونقاط الموافقة بأسلوب الفريق الأحمر، ونزرع تعليمات في المستندات التي يقرؤها لاختبار الحقن غير المباشر، ونوصي بالمواضع التي يجب أن يوافق فيها شخص قبل أن يتصرف الوكيل.

أين يتوقف تقييم الذكاء الاصطناعي

  • تغيير التوجيهات أو الاسترجاع أو النموذج نفسه ليس جزءًا من التقييم؛ نوصي بالإصلاحات، ويُنفّذها فريقك أو نحدد نطاقها ضمن خدمة تكامل نماذج اللغة الكبيرة.
  • الهجمات على الخوادم وواجهات API والحساب السحابي التي تقف خلف الميزة تندرج ضمن خدمة اختبار الاختراق؛ أما هنا فنفحص تعليمات النموذج وأدواته ووصوله إلى البيانات.
  • زمن الاستجابة وحدود المعدل وتكاليف النموذج في ذروة حركة المرور تُقاس ضمن خدمة اختبار الأداء.
  • الاعتماد القانوني أو التنظيمي لاستخدامك للذكاء الاصطناعي غير مشمول؛ والنتائج أدلة تستند إليها مراجعتك الخاصة للمخاطر والامتثال.

كيف يرتبط تقييم الذكاء الاصطناعي بالتصميم وضمان الجودة والتشغيل

  • التصميم: إشراف يسهل استخدامه

    يحدد المصممون كيف يرى المستخدمون المصادر ودرجة عدم اليقين والأخطاء، وكيف يراجع موظفوك عمل الوكيل أو يصحّحونه أو يتولّون المهمة منه.

  • ضمان الجودة: بقية المنتج أيضًا

    يغطي ضمان جودة البرمجيات التطبيق المحيط بالذكاء الاصطناعي، مثل تسجيل الدخول والمدفوعات والأدوار والتكاملات، ويختبرها وفق المتطلبات كأي إصدار.

  • التشغيل: الجودة في بيئة الإنتاج

    تغذّي سجلات بيئة الإنتاج وملاحظات المستخدمين وزمن الاستجابة والتكلفة المراقبةَ وحالاتِ التقييم الجديدة، مع تنبيهات عندما تبدأ الجودة بالانحراف.

  • الاستمرارية: إعادة تقييم كل تغيير

    تُقيَّم ترقيات النماذج وتعديلات التوجيهات ومصادر البيانات الجديدة قبل الإصدار، كجزء من تشغيل الذكاء الاصطناعي المتفق عليه معك.

أسئلة وأجوبة

الأسئلة الشائعة

ما الفرق بين هذا واختبار تطبيق ساعد الذكاء الاصطناعي في بنائه؟

التطبيق المكتوب بأدوات البرمجة بالذكاء الاصطناعي يتصرف مع ذلك كبرمجيات عادية، لذا تغطيه خدمة ضمان جودة البرمجيات والاختبار. أما تقييم الذكاء الاصطناعي فهو للمنتجات التي يولّد فيها نموذجٌ الإجاباتِ أو ينفّذ إجراءات أثناء التشغيل. ولأن المخرجات تتفاوت، فإننا نقيس الجودة عبر حالات كثيرة، ونختبر الصلاحيات، ونخطط للإخفاق. وتحتاج منتجات كثيرة إلى الخدمتين، ونحدد نطاقهما معًا.

ما النماذج وحِزم تقنيات الذكاء الاصطناعي التي يمكنكم تقييمها؟

الميزات المبنية على نماذج مستضافة مثل OpenAI أو Claude، والنماذج مفتوحة الأوزان مثل Llama أو Mistral، ومسارات الاسترجاع، وأُطر الوكلاء. ولا تعتمد المنهجية على المزوّد، لذا يمكنك استخدامها أيضًا لمقارنة النماذج أو المزوّدين على حالاتك الخاصة.

هل يمكن للتقييم أن يمنع الذكاء الاصطناعي من الخطأ تمامًا؟

لا. فالنماذج قد تخطئ مع ذلك. ويُظهر التقييم أين تخفق وكيف، لتتمكن من وضع معايير الإصدار، وإضافة ضوابط حماية وبدائل احتياطية، وتصميم مراجعة بشرية حيث تكون الأخطاء مكلفة، وملاحظة تغيّر الجودة بسرعة.

أين تُعالَج توجيهاتنا وسجلاتنا وبيانات التقييم لدينا؟

تذهب استدعاءات النموذج الخاصة بميزتك إلى المزوّد الذي تستخدمه بالفعل. أما أدوات الذكاء الاصطناعي التي نستخدمها في العمل، مثل التقييم القائم على النماذج، فتعمل ضمن الحدود التي تختارها: الهندسة بالذكاء الاصطناعي الخاص / المحلي على بنية تحتية تتحكم بها، أو الهندسة باستخدام Claude Code / OpenAI Codex وفق شروط متفق عليها للتعامل مع البيانات. وتُقنَّع البيانات الشخصية في السجلات قبل استخدامها، وفق ما نتفق عليه معك.

قراءات ذات صلة

اعرف كيف يتصرف الذكاء الاصطناعي في منتجك قبل إطلاقه

أخبرنا بما تفعله ميزة الذكاء الاصطناعي لديك، وأي نموذج تستخدم، وما الذي يقلقك. وسنقترح خطة تقييم ومعايير للإصدار.