DevOps ותשתיות AI

תשתית AI פרטית

ארחו את מודלי ה-AI והסוכנים של המוצר שלכם במקום שבו הנתונים בשליטתכם. אנחנו פורסים אותם בתשתית שלכם או בסביבה מבודדת מוסכמת, ואז מעריכים אותם, מתאימים את המשאבים, מאבטחים, מנטרים ומעדכנים.

איפה ה-AI של המוצר שלכם רץ בפועל

פיצ'רים רבים של AI שולחים פרומפטים, מסמכים ותוצרים ל-API של מודל אצל צד שלישי. מוצרים מסוימים צריכים שהעיבוד הזה יתבצע בתוך גבולות שבשליטתם, בגלל מדיניות נתונים, חוזים עם לקוחות או הצורך לקבע גרסאות מודל. אנחנו מארחים מודלים וסוכנים עבור המוצר שלכם בחשבון הענן שלכם, בשרתים שלכם (on-premises) או בסביבה מבודדת מוסכמת, ומתפעלים אותם לאורך זמן. השירות הזה עוסק במוצר המוגמר שלכם. כלי ה-AI שבהם אנחנו משתמשים בזמן בניית התוכנה שלכם הם החלטה נפרדת.

תשתית AI בסיוע AI ובהובלת מומחים

איך ה-AI מסייע

  • ניקוד מודלים מועמדים מול מערך הנתונים להערכה שלכם, בבדיקות אוטומטיות ובבדיקות שמדורגות על ידי מודל, שהמהנדסים מאמתים במדגם.
  • ניסוח טיוטות של תצורת ההרצה (serving), ההרחבה האוטומטית והתשתית, לסקירת המהנדסים.
  • ניתוח בדיקות עומס ונתוני שימוש כדי להציע את היקף משאבי המחשוב, כולל השאלה אם בכלל צריך GPU.
  • סקירת לוגים של מודלים וסוכנים כדי לאתר כשלים, קריאות חריגות לכלים וירידות באיכות התשובות.

מה באחריות המומחים שלנו

  • בחירת המודל, תוך שקילה של איכות התשובות, הרישוי, הגודל ועלות ההרצה מול תרחיש השימוש שלכם.
  • היקף משאבי המחשוב: GPU רק כשעומס העבודה הנמדד מצריך אותם.
  • גבולות הרשת, בקרת הגישה, ומה נרשם בלוגים, נשמר או רשאי לצאת מהסביבה.
  • אישור שחרור לשינויים במודלים, בפרומפטים ובהרשאות הסוכנים, אחרי הערכת רגרסיה.

מה נשאר בתוך הגבולות שלכם

גבולות להמחשה לעוזר מסמכים פנימי; הגבולות בפועל מוסכמים איתכם לפני שמשהו נפרס.

  • בתוך הגבולות שלכם

    • פרומפטים, מסמכים שהועלו ותוצרי המודל
    • משקלי המודל והשרתים שמריצים את ה-Inference
    • אינדקסים לחיפוש ו-Embeddings שנבנו מהקבצים שלכם
    • לוגים ונתוני הערכה, שנשמרים רק כפי שהמדיניות שלכם מתירה
    • קריאות של סוכנים לכלים במערכות פנימיות, כל אחת עם הרשאות בהיקף מוגדר
  • עובר רק באישור

    • גרסאות מודל חדשות, שמוכנסות אחרי בדיקות רישוי והערכה
    • מדדים מצרפיים של שימוש וזמני תגובה לדשבורד חיצוני
    • דוגמאות מושחרות שמשותפות עם ספק תוכנה כדי לפתור תקלה
    • קריאות חלופיות ל-API של מודל חיצוני, אם אתם מתירים אותן
  • נשאר בחוץ

    • ממשקי API של מודלים של צד שלישי והספקים שמפעילים אותם
    • שירותי אנליטיקה או מעקב שגיאות חיצוניים שהיו מתעדים את טקסט הפרומפטים
    • טלמטריה של ספקים מתוכנת ההרצה, שמכובה היכן שאפשר

מה אנחנו מקימים ומתפעלים

אירוח, הערכה ותפעול ל-AI שלכם

  • בחירת מודלים והערכתם

    מודלים עם משקלים פתוחים (open-weight) כמו Llama, Mistral או Qwen, שמושווים על הדוגמאות שלכם מבחינת איכות התשובות, מהירות, רישוי ועלות הרצה.

  • הרצת מודלים והרחבה

    שרתי Inference כמו vLLM מאחורי API פנימי, עם תורי בקשות, עיבוד באצוות (batching) והרחבה אוטומטית שמותאמים לביקוש בפועל.

  • משאבי מחשוב בגודל הנכון

    קיבולת CPU, GPU או משולבת, שגודלה נקבע לפי בדיקות עומס. מודלים קטנים יותר או מקוונטזים (quantized) עושים לעיתים קרובות את העבודה; GPU מתווספים רק כשעומס העבודה מצריך אותם.

  • גבולות גישה ורשת

    רשת פרטית, נקודות קצה עם אימות, גישה מבוססת תפקידים וחיבורים יוצאים מבוקרים, כך שהפרומפטים והתוצרים נשארים בתוך הגבולות המוסכמים.

  • לוגים וניטור

    מעקב אחרי זמני תגובה, שגיאות, תפוקה, ניצול משאבים ואותות לאיכות התשובות, עם רישום לוגים שמתוכנן סביב מה שמותר לשמור.

  • עדכוני מודלים, פרומפטים וסוכנים

    עדכונים משוחררים רק אחרי הערכת רגרסיה, ולצד זה תפעול של סוכנים שנפרסו: הרשאות לכלים, נקודות אישור, לוגים של ריצות והעברה לטיפול אנושי.

למי נחוץ AI באירוח פרטי

ה-AI במוצר שלכם כבר לא יכול לשלוח פרומפטים ומסמכים ל-API של מודל חיצוני, ואף אחד בצוות עוד לא הריץ מודלים בסביבת ייצור.

  • ספקי תוכנה שלקוחותיהם הארגוניים לא מתירים שהנתונים שלהם יגיעו לממשקי API של מודלים חיצוניים
  • צוותים בתחומים מפוקחים שחייבים לשמור מסמכים ולוגים של מודלים על התשתית שלהם
  • צוותים שבונים עוזרים פנימיים על בסיס קבצים חסויים, כמו חוזים או רשומות של משאבי אנוש

בקשות אופייניות ל-AI פרטי

תרחישים טיפוסיים שאנחנו מגדירים להם היקף, לא מקרי בוחן של לקוחות.

  • העברת פיצ'ר עובד מ-API של מודל חיצוני

    כלי לסיכום מסמכים משתמש ב-API מסחרי, וחוזה של לקוח גדול אוסר זאת כעת. היינו בודקים מודלים עם משקלים פתוחים (open-weight) על הקלטים האמיתיים שלו, מארחים בחשבון הענן שלכם מודל שעומד ברף האיכות שלכם, ומבצעים את המעבר מאחורי אותו ממשק פנימי.

  • שרתים בלי חיבור לאינטרנט

    אתר הפריסה לא מאפשר שום תעבורה יוצאת לאינטרנט, ולכן המודלים חייבים לרוץ על שרתים מקומיים. היינו אורזים את המודלים, את תוכנת ההרצה (serving) ואת התלויות להתקנה במצב אופליין, ומסכמים איך כל גרסה חדשה נבדקת לפני שמכניסים אותה פנימה.

  • דיבאגינג בלי לשמור פרומפטים

    המדיניות קובעת שפרומפטים עשויים להכיל מידע אישי ואסור לשמור אותם, ובכל זאת צריך לחקור כשלים. היינו מתעדים כברירת מחדל מטא-דאטה ואותות איכות, ושומרים דוגמאות מושחרות רק כשאתם מאשרים זאת, לתקופה מוגבלת.

מדרישות למודלים שרצים בפועל

  1. 01

    הגדרת הגבולות

    אנחנו מסכמים את תרחישי השימוש, אילו נתונים מותר לעבד, איפה עוברים הגבולות, את העומס הצפוי ואת רף האיכות שמערך הנתונים להערכה יבדוק.

  2. 02

    הערכה והתאמת משאבים

    מודלים מועמדים נבדקים על הדוגמאות שלכם, ואז היקף משאבי המחשוב נקבע לפי בדיקות עומס. אנחנו ממליצים על GPU רק אם התוצאות מראות שהם נחוצים.

  3. 03

    פריסה והקשחה

    ההרצה, בקרת הגישה, כללי הרשת, הלוגים והניטור נפרסים כקוד, ואז עוברים בדיקות עומס וכשל לפני שמגיעה תעבורה אמיתית.

  4. 04

    תפעול ושיפור

    ניטור, סקירות של קיבולת וגישה, ועדכוני מודלים או פרומפטים שמשוחררים רק אחרי שהערכת הרגרסיה עוברת בהצלחה.

שתי דרכים לעבוד עם כלי AI

ה-AI מסייע בקוד התשתית ובאבחון תקלות. בחרו היכן הוא רשאי לעבד את התצורה ואת הלוגים שלכם.

לא בטוחים? נמליץ על אחת מהן בשלב הגדרת ההיקף. השוו את החבילות בפירוט

מה אירוח AI פרטי לא כולל

  • תכנון ובנייה של פיצ'ר ה-AI או של הסוכן עצמו הם חלק מאינטגרציית LLM או מסוכני אוטומציה; השירות הזה מארח, מאבטח ומתפעל את המודלים שמאחוריהם.
  • אימון מודל מותאם אישית הוא חלק משירות מודלי למידת מכונה, וכוונון (fine-tuning) של מודל שפה מוגדר בהיקף של אינטגרציית LLM; אנחנו מארחים ומתפעלים את התוצאה.
  • תפעול שאר האפליקציה שלכם, כמו שרתי ווב, מסדי נתונים ושחרורים רגילים, הוא חלק משירות DevOps ותפעול מנוהלים; השירות הזה מכסה את המודלים ואת הסוכנים.
  • אנחנו בודקים את רישיונות המודלים מול השימוש שאתם מתכננים, אבל האישור המשפטי לרישיונות ולהסכמי הנתונים נשאר בידי היועצים המשפטיים שלכם.

איך הנדסה, QA ותפעול מתחברים

  • הנדסת AI בתוך המוצר שלכם

    מהנדסי ה-AI שלנו מחברים את המודלים המתארחים למוצר שלכם: אחזור מידע (retrieval), קריאות לכלים, תהליכי עבודה של סוכנים והמסכים שבהם אנשים סוקרים, מתקנים או לוקחים את השליטה.

  • הערכה כחלק מה-QA

    צוות ה-QA מתחזק מערכי נתונים להערכה ובדיקות רגרסיה לאיכות התשובות, להרשאות הכלים ולטיפול בכשלים, ומריץ אותם לפני כל שינוי במודל או בפרומפט.

  • עיצוב להתנהגות ה-AI

    המעצבים קובעים איך תוצרי ה-AI מוצגים: מצבי טעינה ומצבים חלופיים (fallback), מקורות, והפקדים שבהם אנשים משתמשים כדי לתקן תוצאה או לעקוף אותה.

  • תפעול אחרי ההשקה

    אירוח מודל שונה מתפעול של אפליקציה רגילה. אנחנו ממשיכים לעקוב אחרי הקיבולת, הגישה, העדכונים וההערכות, עם שעות תמיכה שמוסכמות בתוכנית תמיכה.

שאלות ותשובות

שאלות נפוצות

במה זה שונה מחבילת הנדסת AI פרטית / מקומית?

תשתית AI פרטית היא המקום שבו ה-AI של המוצר המוגמר שלכם רץ: המודלים והסוכנים שהמשתמשים או העובדים שלכם עובדים איתם. הנדסת AI פרטית / מקומית היא חבילת פיתוח: היא שומרת את כלי ה-AI שבהם אנחנו משתמשים בזמן בניית התוכנה שלכם על מודלים שנמצאים בתוך גבולות מוסכמים. החבילה האחרת, הנדסת Claude Code / OpenAI Codex, משתמשת בסוכני קוד מסחריים. אפשר לשלב כל אחת מהחבילות עם השירות הזה.

האם צריך GPU כדי להריץ מודלים פרטיים?

לא תמיד. מודלים קטנים יותר או מקוונטזים יכולים לרוץ על CPU במשימות כמו סיווג, חילוץ מידע או כלים פנימיים בנפח נמוך. מודלים גדולים יותר, קלטים ארוכים ומשתמשים רבים בו-זמנית מצריכים בדרך כלל GPU. אנחנו קובעים את היקף משאבי המחשוב לפי בדיקות עומס על תרחישי השימוש האמיתיים שלכם, וממליצים על התצורה הקטנה ביותר שעומדת בדרישות האיכות והמהירות שלכם.

אילו מודלים אתם יכולים לארח?

מודלי שפה עם משקלים פתוחים (open-weight) כמו Llama, Mistral, Qwen או Gemma, מודלי Embedding ו-Reranking לחיפוש, ומודלים ייעודיים למשימה שהצוות שלכם אימן. אנחנו משווים בין המועמדים על הדוגמאות שלכם ובודקים את הרישיון של כל אחד מהם מול השימוש שאתם מתכננים, לפני שאנחנו ממליצים על אחד מהם.

האם אירוח עצמי זול יותר מ-API של מודל?

לפעמים. בנפח נמוך או לא אחיד, API מתארח בתנאים מתאימים הוא לעיתים קרובות זול ופשוט יותר. אירוח פרטי הגיוני כשהנתונים חייבים להישאר בתוך הגבולות שלכם, כשאתם צריכים שליטה בגרסאות המודלים, או כשנפח יציב הופך קיבולת ייעודית לכדאית כלכלית. אנחנו משווים בין שתי האפשרויות מול השימוש הצפוי שלכם לפני שאתם מתחייבים.

לקריאה נוספת

השאירו את ה-AI של המוצר שלכם בתוך הגבולות שלכם

ספרו לנו מה פיצ'רי ה-AI שלכם עושים ואיפה הנתונים חייבים להישאר. נמליץ על מודלים, אירוח ותוכנית תפעול שמתאימים לכך.