DevOps والبنية التحتية للذكاء الاصطناعي
بنية تحتية خاصة للذكاء الاصطناعي
استضِف نماذج الذكاء الاصطناعي والوكلاء التي يعتمد عليها منتجك في مكان تتحكم فيه بالبيانات. ننشرها على بنيتك التحتية أو في بيئة معزولة متفق عليها، ثم نقيّمها ونحدد حجم مواردها ونؤمّنها ونراقبها ونحدّثها.

أين يعمل الذكاء الاصطناعي في منتجك فعليًا
ترسل كثير من ميزات الذكاء الاصطناعي التوجيهات والمستندات والمخرجات إلى واجهة API لنموذج تابع لجهة خارجية. لكن بعض المنتجات تحتاج إلى أن تجري هذه المعالجة داخل حدود تتحكم بها، بسبب سياسات البيانات أو عقود العملاء أو الحاجة إلى تثبيت إصدارات النماذج. نستضيف النماذج والوكلاء لمنتجك في حسابك السحابي، أو في مقرّك (On-premises)، أو في بيئة معزولة متفق عليها، ونتولّى تشغيلها بشكل مستمر. ويتعلق هذا بمنتجك النهائي؛ أما أدوات الذكاء الاصطناعي التي نستخدمها أثناء بناء برمجياتك فهي قرار منفصل.
بنية تحتية للذكاء الاصطناعي بقيادة الخبراء وبمساعدة الذكاء الاصطناعي
كيف يساعد الذكاء الاصطناعي
- تقييم النماذج المرشحة مقابل مجموعة التقييم الخاصة بك، عبر فحوصات مؤتمتة وأخرى تُقيّمها النماذج، يراجع المهندسون عيّنات منها.
- صياغة مسودات إعدادات تقديم النماذج والتوسّع التلقائي والبنية التحتية لتخضع لمراجعة المهندسين.
- تحليل اختبارات الحمل وبيانات الاستخدام لاقتراح حجم موارد الحوسبة، بما في ذلك ما إذا كانت هناك حاجة إلى وحدات GPU أصلًا.
- مراجعة سجلات النماذج والوكلاء لكشف الإخفاقات واستدعاءات الأدوات غير المعتادة وتراجع جودة الإجابات.
ما يتولّاه خبراؤنا
- اختيار النموذج، بموازنة جودة الإجابات والترخيص والحجم وتكلفة التشغيل مع حالة الاستخدام لديك.
- تحديد حجم موارد الحوسبة: وحدات GPU فقط عندما يتطلبها عبء العمل المقيس.
- حدود الشبكة، وضبط الوصول، وما يُسجَّل أو يُحتفظ به أو يُسمح بخروجه من البيئة.
- اعتماد إصدار التغييرات على النماذج والتوجيهات وصلاحيات الوكلاء، بعد تقييم الانحدار.
ما يبقى داخل حدودك
حدود توضيحية لمساعد مستندات داخلي؛ ويُتفق معك على الحدود الفعلية قبل نشر أي شيء.
داخل حدودك
- التوجيهات والمستندات المرفوعة ومخرجات النماذج
- أوزان النماذج والخوادم التي تُجري الاستدلال
- فهارس البحث والتضمينات (Embeddings) المبنية من ملفاتك
- السجلات وبيانات التقييم، ولا يُحتفظ بها إلا بالقدر الذي تسمح به سياستك
- استدعاءات أدوات الوكلاء للأنظمة الداخلية، لكلٍّ منها صلاحيات محددة النطاق
لا يعبر إلا بموافقة
- إصدارات النماذج الجديدة، تُدخَل بعد فحص التراخيص والتقييم
- مقاييس إجمالية للاستخدام وزمن الاستجابة للوحة معلومات خارجية
- أمثلة بعد حجب البيانات الحساسة منها، تُشارَك مع مورّد برمجيات لحل مشكلة
- استدعاءات احتياطية لواجهة API لنموذج خارجي، إذا سمحت بها
يبقى في الخارج
- واجهات API لنماذج الأطراف الثالثة والمزوّدون الذين يشغّلونها
- خدمات التحليلات أو تتبّع الأخطاء المستضافة التي قد تسجّل نص التوجيهات
- بيانات القياس عن بُعد (Telemetry) التي ترسلها برمجيات تقديم النماذج إلى مورّديها، وتُعطَّل حيثما أمكن
ما نُعدّه ونشغّله
الاستضافة والتقييم والتشغيل للذكاء الاصطناعي في منتجك
اختيار النماذج وتقييمها
مقارنة نماذج مفتوحة الأوزان مثل Llama أو Mistral أو Qwen على أمثلتك الخاصة من حيث جودة الإجابات والسرعة والترخيص وتكلفة التشغيل.
تقديم النماذج والتوسّع
خوادم استدلال مثل vLLM خلف واجهة API داخلية، مع جدولة الطلبات في طوابير، والمعالجة على دفعات، والتوسّع التلقائي بما يتناسب مع الطلب الفعلي.
موارد حوسبة بالحجم المناسب
سعة من CPU أو GPU أو مزيج منهما، يُحدَّد حجمها من اختبارات الحمل. فكثيرًا ما تؤدي النماذج الأصغر أو المضغوطة بالتكميم (Quantized) المهمة؛ ولا تُضاف وحدات GPU إلا عندما يتطلبها عبء العمل.
حدود الوصول والشبكة
شبكات خاصة، ونقاط نهاية تتطلب المصادقة، ووصول قائم على الأدوار، واتصالات صادرة مضبوطة، لتبقى التوجيهات والمخرجات داخل الحدود المتفق عليها.
التسجيل والمراقبة
تتبّع زمن الاستجابة والأخطاء ومعدل المعالجة واستهلاك الموارد ومؤشرات جودة الإجابات، مع تصميم التسجيل وفق ما يُسمح بتخزينه.
تحديثات النماذج والتوجيهات والوكلاء
لا تُطلق التحديثات إلا بعد تقييم الانحدار، إضافةً إلى تشغيل الوكلاء المنشورين: صلاحيات الأدوات، ونقاط الموافقة، وسجلات التشغيل، وتولّي البشر المهمة.
مَن يحتاج إلى ذكاء اصطناعي مستضاف بشكل خاص
لم يعد بإمكان ميزات الذكاء الاصطناعي في منتجك إرسال التوجيهات والمستندات إلى واجهة API لنموذج خارجي، ولم يسبق لأحد في الفريق تشغيل نماذج في بيئة الإنتاج.
- مورّدو برمجيات لا يسمح عملاؤهم من المؤسسات بوصول بياناتهم إلى واجهات API لنماذج خارجية
- فرق في قطاعات خاضعة للتنظيم يجب أن تُبقي المستندات وسجلات النماذج على بنيتها التحتية الخاصة
- فرق تبني مساعدين داخليين يعملون على ملفات سرية، مثل العقود أو سجلات الموارد البشرية
طلبات شائعة للذكاء الاصطناعي الخاص
سيناريوهات نموذجية نحدد نطاقها، وليست دراسات حالة لعملاء.
نقل ميزة عاملة بعيدًا عن واجهة API لنموذج
تستخدم أداة لتلخيص المستندات واجهة API تجارية، وأصبح عقد عميل كبير يمنع ذلك الآن. سنختبر نماذج مفتوحة الأوزان على مدخلاتها الحقيقية، ونستضيف في حسابك السحابي نموذجًا يبلغ مستوى الجودة الذي تشترطه، ثم ننتقل إليه خلف الواجهة الداخلية نفسها.
خوادم بلا اتصال بالإنترنت
لا يسمح موقع النشر بأي اتصال صادر بالإنترنت، لذا يجب أن تعمل النماذج على خوادم محلية. سنحزم النماذج وبرمجيات تقديمها والاعتماديات للتثبيت دون اتصال، ونتفق على كيفية فحص كل إصدار جديد قبل إدخاله.
تصحيح الأخطاء دون تخزين التوجيهات
تنص السياسة على أن التوجيهات قد تحتوي على بيانات شخصية ويجب ألا تُخزَّن، ومع ذلك لا تزال الإخفاقات بحاجة إلى تقصٍّ. سنسجّل البيانات الوصفية ومؤشرات الجودة افتراضيًا، ولا نلتقط عيّنات بعد حجب البيانات الحساسة منها إلا عند موافقتك، ولفترة محدودة.
من المتطلبات إلى نماذج قيد التشغيل
- 01
تحديد الحدود
نتفق على حالات الاستخدام، والبيانات التي يجوز معالجتها، وموقع الحدود، والحمل المتوقع، ومستوى الجودة الذي ستختبره مجموعة التقييم.
- 02
التقييم وتحديد الحجم
تُختبر النماذج المرشحة على أمثلتك، ثم يُحدَّد حجم موارد الحوسبة من اختبارات الحمل. ولا نوصي بوحدات GPU إلا إذا أظهرت النتائج الحاجة إليها.
- 03
النشر والتحصين
تُنشر خدمة تقديم النماذج وضبط الوصول وقواعد الشبكة والتسجيل والمراقبة كشيفرة، ثم تخضع لاختبارات الحمل والأعطال قبل استقبال حركة مرور حقيقية.
- 04
التشغيل والتحسين
المراقبة، ومراجعات السعة والوصول، وتحديثات النماذج أو التوجيهات التي لا تُطلق إلا بعد اجتياز تقييم الانحدار.
طريقتان للعمل بأدوات الذكاء الاصطناعي
يساعد الذكاء الاصطناعي في شيفرة البنية التحتية والتشخيص. اختر أين يُسمح له بمعالجة إعداداتك وسجلاتك.
- الهندسة بالذكاء الاصطناعي الخاص / المحلي
نماذج مستضافة بشكل خاص داخل بنية تحتية تتحكم بها أو في بيئة معزولة متفق عليها.
ناقش هذه الباقة معنا - الهندسة باستخدام Claude Code / OpenAI Codex
استخدام Claude Code و/أو OpenAI Codex بإعدادات سحابية تعتمدها مؤسستك.
ناقش هذه الباقة معنا
لست متأكدًا؟ سنوصي بإحداهما خلال تحديد النطاق. قارن الباقتين بالتفصيل
ما تستثنيه استضافة الذكاء الاصطناعي الخاص
- تصميم ميزة الذكاء الاصطناعي أو الوكيل نفسه وبناؤه من اختصاص خدمة تكامل نماذج اللغة الكبيرة أو وكلاء الأتمتة؛ أما هذه الخدمة فتستضيف النماذج التي تقف خلفه وتؤمّنها وتشغّلها.
- تدريب نموذج مخصص من اختصاص خدمة نماذج التعلم الآلي، ويُحدَّد نطاق الضبط الدقيق لنموذج لغوي ضمن خدمة تكامل نماذج اللغة الكبيرة؛ ونحن نستضيف النتيجة ونشغّلها.
- تشغيل بقية تطبيقك، مثل خوادم الويب وقواعد البيانات والإصدارات العادية، من اختصاص خدمات DevOps والتشغيل المُدارة؛ أما هذه الخدمة فتغطي النماذج والوكلاء.
- نتحقق من تراخيص النماذج مقارنةً بالاستخدام الذي تنويه، لكن الاعتماد القانوني للتراخيص واتفاقيات البيانات يبقى لدى مستشارك القانوني.
كيف تترابط الهندسة وضمان الجودة والتشغيل
هندسة الذكاء الاصطناعي في منتجك
يربط مهندسو الذكاء الاصطناعي لدينا النماذج المستضافة بمنتجك: استرجاع المعلومات، واستدعاءات الأدوات، وسير عمل الوكلاء، والشاشات التي يراجع فيها الأشخاص النتائج أو يصحّحونها أو يتولّون المهمة.
التقييم كجزء من ضمان الجودة
يحتفظ فريق ضمان الجودة بمجموعات بيانات التقييم وفحوصات الانحدار الخاصة بجودة الإجابات وصلاحيات الأدوات ومعالجة الإخفاقات، ويشغّلها قبل كل تغيير في النموذج أو التوجيهات.
تصميم يراعي سلوك الذكاء الاصطناعي
يحدد المصممون طريقة ظهور مخرجات الذكاء الاصطناعي: حالات التحميل والبدائل الاحتياطية، والمصادر، وأدوات التحكم التي يستخدمها الأشخاص لتصحيح نتيجة ما أو تجاوزها.
التشغيل بعد الإطلاق
تختلف استضافة نموذج عن تشغيل تطبيق عادي. لذا نُبقي السعة والوصول والتحديثات والتقييمات قيد المراجعة، مع ساعات دعم يُتفق عليها في خطة دعم.
أسئلة وأجوبة
الأسئلة الشائعة
ما الفرق بين هذه الخدمة وباقة الهندسة بالذكاء الاصطناعي الخاص / المحلي؟
تتعلق خدمة بنية تحتية خاصة للذكاء الاصطناعي بالمكان الذي يعمل فيه الذكاء الاصطناعي في منتجك النهائي: النماذج والوكلاء التي يتعامل معها مستخدموك أو موظفوك. أما الهندسة بالذكاء الاصطناعي الخاص / المحلي فهي باقة تطوير: تُبقي أدوات الذكاء الاصطناعي التي نستخدمها أثناء بناء برمجياتك على نماذج داخل حدود متفق عليها. وتستخدم الباقة الأخرى، الهندسة باستخدام Claude Code / OpenAI Codex، وكلاء برمجة تجاريين. ويمكن الجمع بين هذه الخدمة وأيٍّ من الباقتين.
هل نحتاج إلى وحدات GPU لتشغيل نماذج خاصة؟
ليس دائمًا. يمكن تشغيل النماذج الأصغر أو المضغوطة بالتكميم على وحدات CPU لمهام مثل التصنيف أو استخراج المعلومات أو الأدوات الداخلية منخفضة الاستخدام. أما النماذج الأكبر والمدخلات الطويلة والأعداد الكبيرة من المستخدمين المتزامنين فتحتاج عادةً إلى وحدات GPU. نحدد حجم موارد الحوسبة من اختبارات الحمل على حالات استخدامك الفعلية، ونوصي بأصغر إعداد يلبّي احتياجاتك من حيث الجودة والسرعة.
ما النماذج التي يمكنكم استضافتها؟
نماذج لغوية مفتوحة الأوزان مثل Llama أو Mistral أو Qwen أو Gemma، ونماذج التضمين (Embedding) وإعادة الترتيب (Reranking) للبحث، ونماذج مخصصة لمهام محددة درّبها فريقك. نقارن النماذج المرشحة على أمثلتك الخاصة، ونتحقق من ترخيص كل منها بالنسبة إلى الاستخدام الذي تنويه قبل التوصية بأحدها.
هل الاستضافة الذاتية أرخص من استخدام API لنموذج؟
أحيانًا. فعند حجم استخدام منخفض أو متفاوت، كثيرًا ما تكون واجهة API مستضافة بشروط مناسبة أرخص وأبسط. وتكون الاستضافة الخاصة منطقية عندما يجب أن تبقى البيانات داخل حدودك، أو عندما تحتاج إلى التحكم في إصدارات النماذج، أو عندما يجعل حجم الاستخدام الثابت السعة المخصصة مجدية اقتصاديًا. ونقارن الخيارين وفق استخدامك المتوقع قبل أن تلتزم بأي منهما.
قراءات ذات صلة
- Observability for AI Features in Production
Traces, token budgets, and user-visible fallbacks when the model or the vector store blinks.
- LLM Evals You Can Show a Client
Golden sets, regression dashboards, and how we stop prompt tweaks from silently breaking last month’s wins.
أبقِ الذكاء الاصطناعي في منتجك داخل حدودك
أخبرنا بما تفعله ميزات الذكاء الاصطناعي لديك وأين يجب أن تبقى البيانات. وسنوصي بالنماذج والاستضافة وخطة تشغيل تناسب ذلك.


