DevOps & Cloudinfrastructuur

Private AI-infrastructuur

Host de AI-modellen en agents van uw product waar u de gegevens beheert. We implementeren ze in uw infrastructuur of een afgesproken geïsoleerde omgeving en evalueren, dimensioneren, beveiligen, monitoren en updaten ze vervolgens.

Waar de AI van uw product daadwerkelijk draait

Veel AI-functies sturen prompts, documenten en outputs naar een model-API van derden. Sommige producten hebben die verwerking nodig binnen een grens die zij beheren, vanwege gegevensbeleid, klantcontracten of de noodzaak om modelversies vast te zetten. We hosten modellen en agents voor uw product in uw cloud-account, on-premises of in een afgesproken geïsoleerde omgeving, en beheren ze in de loop van de tijd. Dit gaat over uw afgewerkte product. De AI-tools die we gebruiken bij het bouwen van uw software zijn een aparte beslissing.

AI-ondersteunde AI-infrastructuur onder leiding van experts

Hoe AI ondersteunt

  • Kandidaatmodellen scoren tegen uw evaluatieset, met geautomatiseerde en door modellen beoordeelde controles die engineers steekproefsgewijs nakijken.
  • Serving-, autoscaling- en infrastructuurconfiguratie opstellen ter beoordeling door een engineer.
  • Belastingstests en gebruiksgegevens analyseren om compute-dimensionering voor te stellen, inclusief of GPU's überhaupt nodig zijn.
  • Model- en agentlogs reviewen om fouten, ongebruikelijke tool-aanroepen en dalingen in antwoordkwaliteit aan het licht te brengen.

Waar onze experts eigenaar van zijn

  • Modelkeuze, waarbij antwoordkwaliteit, licenties, grootte en draaikosten worden afgewogen tegen uw use case.
  • Compute-dimensionering: GPU's alleen wanneer de gemeten werklast ze nodig heeft.
  • Netwerkgrenzen, toegangscontrole, en wat wordt gelogd, bewaard of de omgeving mag verlaten.
  • Releasegoedkeuring voor wijzigingen aan model, prompt en agent-permissies, na regressie-evaluatie.

Wat binnen uw grens blijft

Illustratieve grens voor een interne documentassistent; de echte lijnen worden met u afgesproken voordat er iets wordt geïmplementeerd.

  • Binnen uw grens

    • Prompts, geüploade documenten en modeloutputs
    • Modelgewichten en de servers die inference draaien
    • Zoekindexen en embeddings opgebouwd uit uw bestanden
    • Logs en evaluatiedata, alleen bewaard voor zover uw beleid dat toestaat
    • Agent-toolaanroepen naar interne systemen, elk met afgebakende permissies
  • Overschrijdt alleen met goedkeuring

    • Nieuwe modelversies, binnengebracht na licentie- en evaluatiecontroles
    • Geaggregeerde gebruiks- en latentiemetrieken voor een extern dashboard
    • Geredigeerde voorbeelden gedeeld met een softwareleverancier om een probleem op te lossen
    • Fallback-aanroepen naar een externe model-API, als u deze toestaat
  • Blijft buiten

    • Model-API's van derden en de providers die ze draaien
    • Gehoste analytics of foutopsporing die prompttekst zou vastleggen
    • Leveranciertelemetrie van servingsoftware, uitgeschakeld waar mogelijk

Wat we opzetten en draaien

Hosting, evaluatie en operatie voor uw AI

  • Modelselectie en -evaluatie

    Open-weight-modellen zoals Llama, Mistral of Qwen vergeleken op uw eigen voorbeelden op antwoordkwaliteit, snelheid, licenties en draaikosten.

  • Serving en schaling

    Inference-servers zoals vLLM achter een interne API, met request-queuing, batching en autoscaling gedimensioneerd op echte vraag.

  • Juist gedimensioneerde compute

    CPU-, GPU- of gemengde capaciteit, gedimensioneerd op basis van belastingstests. Kleinere of gekwantiseerde modellen volstaan vaak; GPU's worden alleen toegevoegd wanneer de werklast dat vereist.

  • Toegangs- en netwerkgrenzen

    Privénetwerken, geauthenticeerde endpoints, op rollen gebaseerde toegang en gecontroleerde uitgaande verbindingen, zodat prompts en outputs binnen de afgesproken grens blijven.

  • Logging en monitoring

    Latentie, fouten, doorvoer, resourcegebruik en signalen voor antwoordkwaliteit worden bijgehouden, met logging die is ontworpen rond wat mag worden opgeslagen.

  • Model-, prompt- en agentupdates

    Updates worden pas uitgebracht na regressie-evaluatie, plus operaties voor ingezette agents: toolpermissies, goedkeuringspunten, uitvoeringslogs en menselijke overname.

Wie heeft privé gehoste AI nodig

De AI van uw product mag niet langer prompts en documenten naar een externe model-API sturen, en niemand in het team heeft eerder modellen in productie gedraaid.

  • Softwareleveranciers wier enterprise-kopers niet toestaan dat hun data externe model-API's bereikt
  • Gereguleerde teams die documenten en modellogs op hun eigen infrastructuur moeten houden
  • Teams die interne assistenten bouwen over vertrouwelijke bestanden, zoals contracten of HR-gegevens

Typische privé-AI-verzoeken

Typische scenario's die we afbakenen, geen klantcasestudy's.

  • Een werkende functie van een model-API afhalen

    Een documentsamenvatter gebruikt een commerciële API, en het contract van een grote klant verbiedt dit nu. We zouden open-weight modellen testen op de echte inputs ervan, er een hosten die aan uw kwaliteitslat voldoet in uw cloudaccount en overschakelen achter dezelfde interne interface.

  • Servers zonder internetverbinding

    Een deploymentlocatie staat geen uitgaand internet toe, dus modellen moeten op lokale servers draaien. We zouden modellen, servingsoftware en afhankelijkheden verpakken voor offline-installatie en afspreken hoe elke nieuwe versie wordt gecontroleerd voordat deze wordt binnengebracht.

  • Debuggen zonder prompts op te slaan

    Het beleid stelt dat prompts persoonsgegevens kunnen bevatten en niet mogen worden opgeslagen, maar fouten moeten toch worden onderzocht. We zouden standaard metadata en kwaliteitssignalen loggen, en alleen geredigeerde samples vastleggen wanneer u dat goedkeurt, voor een beperkte periode.

Van vereisten tot draaiende modellen

  1. 01

    Definieer de grens

    We spreken use cases af, welke data verwerkt mag worden, waar de grens ligt, de verwachte belasting en de kwaliteitslat die uw evaluatieset zal testen.

  2. 02

    Evalueer en dimensioneer

    Kandidaatmodellen worden getest op uw voorbeelden, waarna de rekencapaciteit wordt gedimensioneerd op basis van belastingstests. We raden GPU's alleen aan als de resultaten uitwijzen dat ze nodig zijn.

  3. 03

    Implementeer en verstevig

    Serving, toegangscontrole, netwerkregels, logging en monitoring worden als code geïmplementeerd en vervolgens belasting- en foutgetest vóór echt verkeer.

  4. 04

    Beheer en verbeter

    Monitoring, capaciteits- en toegangsreviews, en model- of promptupdates die pas worden uitgebracht nadat de regressie-evaluatie slaagt.

Twee manieren om met AI-tools te werken

AI assisteert bij infrastructuurcode en diagnostiek. Kies waar deze uw configuratie en logs mag verwerken.

Niet zeker? We bevelen er een aan tijdens de scoping. Vergelijk AI-opleveropties

Wat privé-AI-hosting uitsluit

  • Het ontwerpen en bouwen van de AI-functie of agent zelf is LLM Integration of Automation Agents; deze service host, beveiligt en beheert de modellen daarachter.
  • Het trainen van een aangepast model is Machine Learning Models, en het fine-tunen van een taalmodel valt onder LLM Integration; wij hosten en beheren het resultaat.
  • Het draaien van de rest van uw applicatie, zoals webservers, databases en gewone releases, is Managed DevOps & Operations; deze service dekt de modellen en agents.
  • We controleren modellicenties op uw beoogde gebruik, maar de juridische goedkeuring van licenties en data-overeenkomsten blijft bij uw eigen juridisch adviseur.

Hoe engineering, QA en operations samenkomen

  • AI-engineering in uw product

    Onze AI-engineers verbinden gehoste modellen met uw product: retrieval, toolaanroepen, agentworkflows en de schermen waar mensen beoordelen, corrigeren of overnemen.

  • Evaluatie als QA

    QA onderhoudt evaluatiedatasets en regressiecontroles voor antwoordkwaliteit, toolpermissies en foutafhandeling, en voert deze uit vóór elke model- of promptwijziging.

  • Ontwerp voor AI-gedrag

    Designers bepalen hoe AI-output verschijnt: laad- en fallbacktoestanden, bronnen, en de besturingselementen die mensen gebruiken om een resultaat te corrigeren of te overschrijven.

  • Operaties na lancering

    Een model hosten is iets anders dan een gewone app draaien. We houden capaciteit, toegang, updates en evaluaties onder review, met supporturen die in een supportplan zijn afgesproken.

FAQ

Veelgestelde vragen

Hoe verschilt dit van het pakket Private / lokale AI-ontwikkeling?

Private AI Infrastructure is waar de AI van uw afgeronde product draait: de modellen en agents waarmee uw gebruikers of medewerkers werken. Private / lokale AI-ontwikkeling is een ontwikkelpakket: het houdt de AI-tools die we gebruiken tijdens het bouwen van uw software op modellen binnen een afgesproken grens. Het andere pakket, Ontwikkeling met Claude Code / OpenAI Codex, gebruikt commerciële coding-agents. Elk pakket kan met deze service worden gecombineerd.

Hebben we GPU's nodig om privémodellen te draaien?

Niet altijd. Kleinere of gekwantiseerde modellen kunnen op CPU's draaien voor taken zoals classificatie, extractie of interne tools met laag volume. Grotere modellen, lange inputs en veel gelijktijdige gebruikers vereisen doorgaans GPU's. We dimensioneren rekencapaciteit op basis van belastingstests op uw echte use cases en raden de kleinste opzet aan die aan uw kwaliteits- en snelheidseisen voldoet.

Welke modellen kunt u hosten?

Open-weight taalmodellen zoals Llama, Mistral, Qwen of Gemma, embedding- en reranking-modellen voor zoeken, en taakspecifieke modellen die uw team heeft getraind. We vergelijken kandidaten op uw eigen voorbeelden en controleren elke licentie op uw beoogde gebruik voordat we er een aanbevelen.

Is zelf hosten goedkoper dan een model-API?

Soms. Bij laag of ongelijkmatig volume is een gehoste API onder passende voorwaarden vaak goedkoper en eenvoudiger. Privéhosting is zinvol wanneer data binnen uw grens moet blijven, wanneer u controle nodig hebt over modelversies, of wanneer een gestaag volume toegewijde capaciteit rendabel maakt. We vergelijken beide met uw verwachte gebruik voordat u zich vastlegt.

Houd de AI van uw product binnen uw grens

Vertel ons wat uw AI-functies doen en waar data moet blijven. Wij bevelen passende modellen, hosting en een operationeel plan aan.