DevOps & Cloudinfrastructuur
Private AI-infrastructuur
Host de AI-modellen en agents van uw product waar u de gegevens beheert. We implementeren ze in uw infrastructuur of een afgesproken geïsoleerde omgeving en evalueren, dimensioneren, beveiligen, monitoren en updaten ze vervolgens.

Waar de AI van uw product daadwerkelijk draait
Veel AI-functies sturen prompts, documenten en outputs naar een model-API van derden. Sommige producten hebben die verwerking nodig binnen een grens die zij beheren, vanwege gegevensbeleid, klantcontracten of de noodzaak om modelversies vast te zetten. We hosten modellen en agents voor uw product in uw cloud-account, on-premises of in een afgesproken geïsoleerde omgeving, en beheren ze in de loop van de tijd. Dit gaat over uw afgewerkte product. De AI-tools die we gebruiken bij het bouwen van uw software zijn een aparte beslissing.
AI-ondersteunde AI-infrastructuur onder leiding van experts
Hoe AI ondersteunt
- Kandidaatmodellen scoren tegen uw evaluatieset, met geautomatiseerde en door modellen beoordeelde controles die engineers steekproefsgewijs nakijken.
- Serving-, autoscaling- en infrastructuurconfiguratie opstellen ter beoordeling door een engineer.
- Belastingstests en gebruiksgegevens analyseren om compute-dimensionering voor te stellen, inclusief of GPU's überhaupt nodig zijn.
- Model- en agentlogs reviewen om fouten, ongebruikelijke tool-aanroepen en dalingen in antwoordkwaliteit aan het licht te brengen.
Waar onze experts eigenaar van zijn
- Modelkeuze, waarbij antwoordkwaliteit, licenties, grootte en draaikosten worden afgewogen tegen uw use case.
- Compute-dimensionering: GPU's alleen wanneer de gemeten werklast ze nodig heeft.
- Netwerkgrenzen, toegangscontrole, en wat wordt gelogd, bewaard of de omgeving mag verlaten.
- Releasegoedkeuring voor wijzigingen aan model, prompt en agent-permissies, na regressie-evaluatie.
Wat binnen uw grens blijft
Illustratieve grens voor een interne documentassistent; de echte lijnen worden met u afgesproken voordat er iets wordt geïmplementeerd.
Binnen uw grens
- Prompts, geüploade documenten en modeloutputs
- Modelgewichten en de servers die inference draaien
- Zoekindexen en embeddings opgebouwd uit uw bestanden
- Logs en evaluatiedata, alleen bewaard voor zover uw beleid dat toestaat
- Agent-toolaanroepen naar interne systemen, elk met afgebakende permissies
Overschrijdt alleen met goedkeuring
- Nieuwe modelversies, binnengebracht na licentie- en evaluatiecontroles
- Geaggregeerde gebruiks- en latentiemetrieken voor een extern dashboard
- Geredigeerde voorbeelden gedeeld met een softwareleverancier om een probleem op te lossen
- Fallback-aanroepen naar een externe model-API, als u deze toestaat
Blijft buiten
- Model-API's van derden en de providers die ze draaien
- Gehoste analytics of foutopsporing die prompttekst zou vastleggen
- Leveranciertelemetrie van servingsoftware, uitgeschakeld waar mogelijk
Wat we opzetten en draaien
Hosting, evaluatie en operatie voor uw AI
Modelselectie en -evaluatie
Open-weight-modellen zoals Llama, Mistral of Qwen vergeleken op uw eigen voorbeelden op antwoordkwaliteit, snelheid, licenties en draaikosten.
Serving en schaling
Inference-servers zoals vLLM achter een interne API, met request-queuing, batching en autoscaling gedimensioneerd op echte vraag.
Juist gedimensioneerde compute
CPU-, GPU- of gemengde capaciteit, gedimensioneerd op basis van belastingstests. Kleinere of gekwantiseerde modellen volstaan vaak; GPU's worden alleen toegevoegd wanneer de werklast dat vereist.
Toegangs- en netwerkgrenzen
Privénetwerken, geauthenticeerde endpoints, op rollen gebaseerde toegang en gecontroleerde uitgaande verbindingen, zodat prompts en outputs binnen de afgesproken grens blijven.
Logging en monitoring
Latentie, fouten, doorvoer, resourcegebruik en signalen voor antwoordkwaliteit worden bijgehouden, met logging die is ontworpen rond wat mag worden opgeslagen.
Model-, prompt- en agentupdates
Updates worden pas uitgebracht na regressie-evaluatie, plus operaties voor ingezette agents: toolpermissies, goedkeuringspunten, uitvoeringslogs en menselijke overname.
Wie heeft privé gehoste AI nodig
De AI van uw product mag niet langer prompts en documenten naar een externe model-API sturen, en niemand in het team heeft eerder modellen in productie gedraaid.
- Softwareleveranciers wier enterprise-kopers niet toestaan dat hun data externe model-API's bereikt
- Gereguleerde teams die documenten en modellogs op hun eigen infrastructuur moeten houden
- Teams die interne assistenten bouwen over vertrouwelijke bestanden, zoals contracten of HR-gegevens
Typische privé-AI-verzoeken
Typische scenario's die we afbakenen, geen klantcasestudy's.
Een werkende functie van een model-API afhalen
Een documentsamenvatter gebruikt een commerciële API, en het contract van een grote klant verbiedt dit nu. We zouden open-weight modellen testen op de echte inputs ervan, er een hosten die aan uw kwaliteitslat voldoet in uw cloudaccount en overschakelen achter dezelfde interne interface.
Servers zonder internetverbinding
Een deploymentlocatie staat geen uitgaand internet toe, dus modellen moeten op lokale servers draaien. We zouden modellen, servingsoftware en afhankelijkheden verpakken voor offline-installatie en afspreken hoe elke nieuwe versie wordt gecontroleerd voordat deze wordt binnengebracht.
Debuggen zonder prompts op te slaan
Het beleid stelt dat prompts persoonsgegevens kunnen bevatten en niet mogen worden opgeslagen, maar fouten moeten toch worden onderzocht. We zouden standaard metadata en kwaliteitssignalen loggen, en alleen geredigeerde samples vastleggen wanneer u dat goedkeurt, voor een beperkte periode.
Van vereisten tot draaiende modellen
- 01
Definieer de grens
We spreken use cases af, welke data verwerkt mag worden, waar de grens ligt, de verwachte belasting en de kwaliteitslat die uw evaluatieset zal testen.
- 02
Evalueer en dimensioneer
Kandidaatmodellen worden getest op uw voorbeelden, waarna de rekencapaciteit wordt gedimensioneerd op basis van belastingstests. We raden GPU's alleen aan als de resultaten uitwijzen dat ze nodig zijn.
- 03
Implementeer en verstevig
Serving, toegangscontrole, netwerkregels, logging en monitoring worden als code geïmplementeerd en vervolgens belasting- en foutgetest vóór echt verkeer.
- 04
Beheer en verbeter
Monitoring, capaciteits- en toegangsreviews, en model- of promptupdates die pas worden uitgebracht nadat de regressie-evaluatie slaagt.
Twee manieren om met AI-tools te werken
AI assisteert bij infrastructuurcode en diagnostiek. Kies waar deze uw configuratie en logs mag verwerken.
- Private / lokale AI-ontwikkeling
Privé gehoste modellen binnen infrastructuur die u beheert of een afgesproken geïsoleerde omgeving.
Bespreken bij dit pakket - Ontwikkeling met Claude Code / OpenAI Codex
Claude Code en/of OpenAI Codex met cloudinstellingen die uw organisatie goedkeurt.
Bespreken bij dit pakket
Niet zeker? We bevelen er een aan tijdens de scoping. Vergelijk AI-opleveropties
Wat privé-AI-hosting uitsluit
- Het ontwerpen en bouwen van de AI-functie of agent zelf is LLM Integration of Automation Agents; deze service host, beveiligt en beheert de modellen daarachter.
- Het trainen van een aangepast model is Machine Learning Models, en het fine-tunen van een taalmodel valt onder LLM Integration; wij hosten en beheren het resultaat.
- Het draaien van de rest van uw applicatie, zoals webservers, databases en gewone releases, is Managed DevOps & Operations; deze service dekt de modellen en agents.
- We controleren modellicenties op uw beoogde gebruik, maar de juridische goedkeuring van licenties en data-overeenkomsten blijft bij uw eigen juridisch adviseur.
Hoe engineering, QA en operations samenkomen
AI-engineering in uw product
Onze AI-engineers verbinden gehoste modellen met uw product: retrieval, toolaanroepen, agentworkflows en de schermen waar mensen beoordelen, corrigeren of overnemen.
Evaluatie als QA
QA onderhoudt evaluatiedatasets en regressiecontroles voor antwoordkwaliteit, toolpermissies en foutafhandeling, en voert deze uit vóór elke model- of promptwijziging.
Ontwerp voor AI-gedrag
Designers bepalen hoe AI-output verschijnt: laad- en fallbacktoestanden, bronnen, en de besturingselementen die mensen gebruiken om een resultaat te corrigeren of te overschrijven.
Operaties na lancering
Een model hosten is iets anders dan een gewone app draaien. We houden capaciteit, toegang, updates en evaluaties onder review, met supporturen die in een supportplan zijn afgesproken.
FAQ
Veelgestelde vragen
Hoe verschilt dit van het pakket Private / lokale AI-ontwikkeling?
Private AI Infrastructure is waar de AI van uw afgeronde product draait: de modellen en agents waarmee uw gebruikers of medewerkers werken. Private / lokale AI-ontwikkeling is een ontwikkelpakket: het houdt de AI-tools die we gebruiken tijdens het bouwen van uw software op modellen binnen een afgesproken grens. Het andere pakket, Ontwikkeling met Claude Code / OpenAI Codex, gebruikt commerciële coding-agents. Elk pakket kan met deze service worden gecombineerd.
Hebben we GPU's nodig om privémodellen te draaien?
Niet altijd. Kleinere of gekwantiseerde modellen kunnen op CPU's draaien voor taken zoals classificatie, extractie of interne tools met laag volume. Grotere modellen, lange inputs en veel gelijktijdige gebruikers vereisen doorgaans GPU's. We dimensioneren rekencapaciteit op basis van belastingstests op uw echte use cases en raden de kleinste opzet aan die aan uw kwaliteits- en snelheidseisen voldoet.
Welke modellen kunt u hosten?
Open-weight taalmodellen zoals Llama, Mistral, Qwen of Gemma, embedding- en reranking-modellen voor zoeken, en taakspecifieke modellen die uw team heeft getraind. We vergelijken kandidaten op uw eigen voorbeelden en controleren elke licentie op uw beoogde gebruik voordat we er een aanbevelen.
Is zelf hosten goedkoper dan een model-API?
Soms. Bij laag of ongelijkmatig volume is een gehoste API onder passende voorwaarden vaak goedkoper en eenvoudiger. Privéhosting is zinvol wanneer data binnen uw grens moet blijven, wanneer u controle nodig hebt over modelversies, of wanneer een gestaag volume toegewijde capaciteit rendabel maakt. We vergelijken beide met uw verwachte gebruik voordat u zich vastlegt.
Houd de AI van uw product binnen uw grens
Vertel ons wat uw AI-functies doen en waar data moet blijven. Wij bevelen passende modellen, hosting en een operationeel plan aan.


