QA ובקרת שחרורים בסיוע AI

הערכה ובדיקות של AI

בדקו את ה-AI שבתוך המוצר שלכם, לא רק את האפליקציה שסביבו. אנחנו מעריכים איכות תשובות, עיגון במקורות, הרשאות וטיפול בכשלים בסוכנים, בצ'אטבוטים ובפיצ'רים מבוססי LLM, וקובעים קריטריונים ברורים לשחרור.

למי נחוצה הערכת AI

פיצ'ר ה-AI שלכם נראה טוב בהדגמה, אבל אף אחד עדיין לא יכול לומר איך הוא מתנהג מול שאלות אמיתיות, קלטים עוינים ונתונים חסרים, או אם השינוי הבא במודל או בפרומפט יפגע בו.

  • צוותים שעומדים להציב צ'אטבוט או עוזר AI מול לקוחות
  • בעלי מוצר שמחליפים מודל, ספק או פרומפטים וצריכים השוואה של לפני ואחרי
  • חברות שמאפשרות לסוכן לקרוא רשומות פנימיות או להפעיל פעולות במערכות אחרות

איך מעריכים כל התנהגות

תוכנית להמחשה לעוזר שפונה ללקוחות; השיטות משתנות לפי תרחיש השימוש והסיכונים שלכם.

הערכות אוטומטיותסקירת מומחיםבדיקות Red Teamאותות מסביבת הייצור
דיוק התשובותשיטה עיקריתשיטה עיקריתבשימוש נדיר כאןמשלימה או מדגמית
עיגון במקורות וציטוטיםשיטה עיקריתמשלימה או מדגמיתבשימוש נדיר כאןמשלימה או מדגמית
גבולות הרשאהמשלימה או מדגמיתשיטה עיקריתשיטה עיקריתמשלימה או מדגמית
Prompt Injectionמשלימה או מדגמיתמשלימה או מדגמיתשיטה עיקריתמשלימה או מדגמית
סירובים ומנגנונים חלופייםשיטה עיקריתמשלימה או מדגמיתמשלימה או מדגמיתשיטה עיקרית
  • שיטה עיקרית
  • משלימה או מדגמית
  • בשימוש נדיר כאן

בדיקת פיצ'רים של AI היא עבודה אחרת

צ'אטבוט יכול לעבור כל בדיקה פונקציונלית ועדיין לתת תשובה שגויה בביטחון מלא, לחשוף נתונים שאסור לו לחשוף, או לבצע הוראות שהוסתרו בקובץ שהועלה. פיצ'רים של AI צריכים הערכה משלהם: מערכי נתונים של מקרים אמיתיים וקשים, בדיקות של איכות התשובות והעיגון במקורות, הרשאות לכלים ולנתונים, חשיפה ל-Prompt Injection, טיפול בכשלים, ובדיקות רגרסיה בכל פעם שמודל או פרומפט משתנים. זה שונה מבדיקה של אפליקציה רגילה ש-AI עזר לבנות, שאותה מכסה השירות QA ובדיקות תוכנה.

ה-AI עוזר לדרג בהיקף גדול; המומחים קובעים את הרף

איך ה-AI מסייע

  • מייצר וריאציות של שאלות משתמשים אמיתיות שאתם מאשרים, כולל ניסוחים חלופיים, מקרי קצה וקלטים עוינים.
  • מדרג כמויות גדולות של תשובות באמצעות ניקוד מבוסס מודל, שמכויל מול תשובות שמומחים תייגו.
  • מקבץ כשלים לפי סיבה, כמו הקשר חסר, קריאה שגויה לכלי או הוראה שלא קוימה.
  • משווה בין הרצות אחרי שינויים במודל, בפרומפט או באחזור המידע, ומסמן היכן ההתנהגות הידרדרה.

מה באחריות המומחים שלנו

  • המומחים מגדירים מהי תשובה נכונה, בטוחה ומועילה, יחד עם מומחי התחום שלכם.
  • ציונים מבוססי מודל נבדקים מדגמית בידי אנשים, ומדרג שאינו מסכים עם המומחים מתוקן או מוסר משימוש.
  • אנשים מחליטים באילו כלים ונתונים סוכן רשאי להשתמש, והיכן אדם חייב לאשר או לקחת את השליטה.
  • קריטריוני השחרור וההחלטה אם לשחרר נשארים בידי הצוות שלכם ושלנו, ולא בידי ציון בלבד.

מה תקבלו

הערכה שאפשר להריץ מחדש בכל שינוי

  • מערך נתונים להערכה

    מקרים אמיתיים וסינתטיים שמתויגים לפי ההתנהגות הצפויה: שאלות נפוצות, מקרי קצה, בקשות שמחוץ לתחום וכשלים מהעבר.

  • איכות תשובות ועיגון במקורות

    דיוק, רלוונטיות וטון, והאם התשובות נתמכות במקורות שלכם, כשהציטוטים נבדקים והזיות (hallucinations) מסומנות.

  • בדיקות הרשאות לכלים ולנתונים

    מה סוכן יכול לקרוא, לשנות או להפעיל, נבדק מול עקרון ההרשאה המינימלית, נקודות האישור והמסלולים להעברה לטיפול אנושי.

  • חשיפה ל-Prompt Injection

    הזרקה ישירה ועקיפה דרך הודעות, קבצים שהועלו, דפי אינטרנט ומסמכים שאוחזרו, שמדורגת לפי מה שתוקף יכול להשיג.

  • טיפול בכשלים ומנגנונים חלופיים

    ההתנהגות כשהמודל לא מגיב בזמן, כשספק לא זמין, כשהאחזור לא מוצא דבר או כשרמת הביטחון נמוכה: מנגנונים חלופיים, הודעות ברורות והעברה לטיפול אנושי.

  • בדיקות רגרסיה וקריטריוני שחרור

    הערכות אוטומטיות שרצות מחדש כשמודלים, פרומפטים או נתונים משתנים, עם קריטריונים מוסכמים שקובעים אם שינוי יוצא לשחרור.

איך מתנהלת הערכת AI

  1. 01

    הגדרת התנהגות טובה

    סיכום תרחישי השימוש, הסיכונים, קריטריוני האיכות וההרשאות עם הצוות שלכם ועם מומחי התחום, ואיסוף דוגמאות אמיתיות שאתם מתירים לנו להשתמש בהן.

  2. 02

    בניית מערך הנתונים

    איסוף ותיוג של מקרי הערכה, כולל מקרים קשים ועוינים, וקביעת קריטריוני השחרור שכל שינוי צריך לעמוד בהם.

  3. 03

    הערכה ובחינה

    הרצת הערכות אוטומטיות עם סקירת מומחים, בדיקות Red Team של הרשאות ושל Prompt Injection, ואיתור המקור של כשלים בפרומפטים, באחזור, בכלים או במודל.

  4. 04

    תנאי שחרור וניטור

    הוספת ההערכות לתהליך השחרור שלכם, דיווח על התוצאות עם תיקונים מומלצים, ושמירה על עדכניות מערך הנתונים ככל שהמוצר משתנה.

שתי דרכים לעבוד עם כלי AI

ה-AI עוזר לנסח טיוטות לבדיקות ולחקור באגים. בחרו היכן הוא רשאי לעבד את הקוד ואת נתוני הבדיקה שלכם.

לא בטוחים? נמליץ על אחת מהן בשלב הגדרת ההיקף. השוו את החבילות בפירוט

בקשות הערכה אופייניות

תרחישים טיפוסיים שאנחנו מגדירים להם היקף, לא מקרי בוחן של לקוחות.

  • עוזר למרכז העזרה לפני השקה לציבור

    צוות רוצה עוזר שעונה מתוך מאמרי העזרה שלו. אנחנו הופכים שאלות תמיכה אמיתיות לסט מתויג, מדרגים את התשובות ואת ציטוטי המקורות, מוסיפים מקרים שמחוץ לתחום ומקרים עוינים, ומסכמים קריטריוני שחרור לפני ההשקה.

  • העברת פיצ'ר למודל זול יותר

    בעל מוצר רוצה להעביר פיצ'ר למודל או לספק זולים יותר. אנחנו מריצים את אותו סט הערכה על שניהם, מראים היכן התשובות משתפרות או נפגעות ואיך זמני התגובה משתנים, וההחלטה נשארת בידיו.

  • סוכן שיכול לשנות רשומות

    חברה מאפשרת לסוכן פנימי לעדכן הזמנות. אנחנו מבצעים בדיקות Red Team להרשאות הכלים ולנקודות האישור שלו, שותלים הוראות במסמכים שהוא קורא כדי לבדוק הזרקה עקיפה (indirect injection), וממליצים היכן אדם חייב לאשר לפני שהסוכן פועל.

היכן הערכת ה-AI נעצרת

  • שינוי של הפרומפטים, של האחזור או של המודל עצמו אינו חלק מההערכה; אנחנו ממליצים על תיקונים, והצוות שלכם מבצע אותם או שאנחנו מגדירים להם היקף במסגרת שירות אינטגרציית LLM.
  • תקיפות של השרתים, של ממשקי ה-API ושל חשבון הענן שמאחורי הפיצ'ר שייכות לבדיקות חדירה; כאן אנחנו בוחנים את ההוראות של המודל, את הכלים שלו ואת הגישה שלו לנתונים.
  • זמני תגובה, מגבלות קצב ועלויות המודל בשיא התעבורה נמדדים במסגרת שירות בדיקות ביצועים.
  • אישור משפטי או רגולטורי לשימוש שלכם ב-AI אינו כלול; התוצאות משמשות ראיות לסקירת הסיכונים והציות (compliance) שלכם.

איך הערכת ה-AI מתחברת לעיצוב, ל-QA ולתפעול

  • עיצוב: פיקוח שאנשים יכולים להשתמש בו

    המעצבים קובעים איך המשתמשים רואים מקורות, אי-ודאות ושגיאות, ואיך העובדים שלכם סוקרים, מתקנים או לוקחים את השליטה מסוכן.

  • QA: גם שאר המוצר

    QA לתוכנה מכסה את האפליקציה שסביב ה-AI, כמו התחברות, תשלומים, תפקידים ואינטגרציות, שנבדקים מול הדרישות כמו בכל שחרור.

  • תפעול: איכות בסביבת הייצור

    לוגים מסביבת הייצור, משוב משתמשים, זמני תגובה ועלויות מזינים את הניטור ומקרי הערכה חדשים, עם התראות כשהאיכות מתחילה לסטות.

  • באופן שוטף: הערכה מחדש של כל שינוי

    שדרוגי מודלים, עריכות פרומפטים ומקורות נתונים חדשים עוברים הערכה לפני השחרור, כחלק מתפעול AI שמוסכם איתכם.

שאלות ותשובות

שאלות נפוצות

במה זה שונה מבדיקה של אפליקציה ש-AI עזר לבנות?

אפליקציה שנכתבה עם כלי AI לכתיבת קוד עדיין מתנהגת כמו תוכנה רגילה, ולכן השירות QA ובדיקות תוכנה מכסה אותה. הערכת AI מיועדת למוצרים שבהם מודל מייצר תשובות או מבצע פעולות בזמן ריצה. התוצרים משתנים, ולכן אנחנו מודדים איכות על פני מקרים רבים, בודקים הרשאות ומתכננים מראש לכשלים. מוצרים רבים צריכים את שניהם, ואנחנו מגדירים את ההיקף של שניהם יחד.

אילו מודלים וסטאקים של AI אתם יכולים להעריך?

פיצ'רים שבנויים על מודלים מתארחים כמו OpenAI או Claude, מודלים עם משקלים פתוחים (open-weight) כמו Llama או Mistral, פייפליינים של אחזור מידע ופריימוורקים לסוכנים. השיטה לא תלויה בספק, כך שאפשר להשתמש בה גם כדי להשוות בין מודלים או ספקים על המקרים שלכם.

האם הערכה יכולה למנוע מה-AI לטעות אי פעם?

לא. מודלים עדיין יכולים לטעות. ההערכה מראה היכן ואיך הם נכשלים, כדי שתוכלו לקבוע קריטריוני שחרור, להוסיף מנגנוני הגנה (guardrails) ומנגנונים חלופיים, לתכנן סקירה אנושית היכן שטעויות יקרות, ולזהות מהר כשהאיכות משתנה.

איפה מעובדים הפרומפטים, הלוגים ונתוני ההערכה שלנו?

הקריאות למודל של הפיצ'ר עצמו ממשיכות להגיע לספק שאתם כבר משתמשים בו. כלי ה-AI שבהם אנחנו משתמשים בעבודה, כמו דירוג מבוסס מודל, רצים בתוך הגבולות שאתם בוחרים: הנדסת AI פרטית / מקומית על תשתית שבשליטתכם, או הנדסת Claude Code / OpenAI Codex לפי תנאי טיפול בנתונים מוסכמים. מידע אישי בלוגים עובר מיסוך לפני השימוש, כפי שמוסכם איתכם.

לקריאה נוספת

ראו איך ה-AI שלכם מתנהג לפני שאתם משחררים אותו

ספרו לנו מה פיצ'ר ה-AI שלכם עושה, באיזה מודל הוא משתמש ומה מדאיג אתכם. נציע תוכנית הערכה וקריטריוני שחרור.