DevOps & Cloud-Infrastruktur
Private KI-Infrastruktur
Hosten Sie die KI-Modelle und Agenten Ihres Produkts dort, wo Sie die Daten kontrollieren. Wir stellen sie in Ihrer Infrastruktur oder in einer vereinbarten isolierten Umgebung bereit und evaluieren, dimensionieren, sichern, überwachen und aktualisieren sie anschließend.

Wo die KI Ihres Produkts tatsächlich läuft
Viele KI-Funktionen senden Prompts, Dokumente und Ausgaben an eine Modell-API eines Drittanbieters. Manche Produkte benötigen diese Verarbeitung innerhalb einer von ihnen kontrollierten Grenze, aufgrund von Datenrichtlinien, Kundenverträgen oder der Notwendigkeit, Modellversionen festzuschreiben. Wir hosten Modelle und Agenten für Ihr Produkt in Ihrem Cloud-Konto, on-premises oder in einer vereinbarten isolierten Umgebung und betreiben sie über die Zeit. Hier geht es um Ihr fertiges Produkt. Die KI-Werkzeuge, die wir beim Erstellen Ihrer Software einsetzen, sind eine separate Entscheidung.
KI-gestützte, expertengeführte KI-Infrastruktur
Wie KI unterstützt
- Bewertung von Kandidatenmodellen gegen Ihr Evaluierungsset, mit automatisierten und modellbenoteten Prüfungen, die Ingenieure stichprobenartig kontrollieren.
- Entwurf von Bereitstellungs-, Autoscaling- und Infrastrukturkonfigurationen zur Prüfung durch Ingenieure.
- Analyse von Lasttests und Nutzungsdaten, um die Rechendimensionierung vorzuschlagen, einschließlich der Frage, ob überhaupt GPUs benötigt werden.
- Durchsicht von Modell- und Agenten-Logs, um Ausfälle, ungewöhnliche Tool-Aufrufe und Einbußen in der Antwortqualität aufzudecken.
Was unsere Experten verantworten
- Modellauswahl, bei der Antwortqualität, Lizenzierung, Größe und Betriebskosten gegen Ihren Anwendungsfall abgewogen werden.
- Rechendimensionierung: GPUs nur dann, wenn die gemessene Arbeitslast sie erfordert.
- Netzwerkgrenzen, Zugriffskontrolle und was geloggt, aufbewahrt oder aus der Umgebung herausgelassen werden darf.
- Freigabe für Modell-, Prompt- und Agenten-Berechtigungsänderungen nach einer Regressionsevaluierung.
Was innerhalb Ihrer Grenze bleibt
Beispielhafte Grenze für einen internen Dokumentenassistenten; die tatsächlichen Linien werden mit Ihnen vereinbart, bevor irgendetwas bereitgestellt wird.
Innerhalb Ihrer Grenze
- Prompts, hochgeladene Dokumente und Modellausgaben
- Modellgewichte und die Server, die die Inferenz ausführen
- Suchindizes und Embeddings, die aus Ihren Dateien erstellt wurden
- Protokolle und Evaluierungsdaten, nur so weit aufbewahrt, wie Ihre Richtlinie es erlaubt
- Agent-Tool-Aufrufe in interne Systeme, jeweils mit eingegrenzten Berechtigungen
Überschreitet die Grenze nur mit Freigabe
- Neue Modellversionen, eingebracht nach Lizenz- und Evaluierungsprüfungen
- Aggregierte Nutzungs- und Latenzmetriken für ein externes Dashboard
- Redigierte Beispiele, die mit einem Softwareanbieter geteilt werden, um ein Problem zu lösen
- Fallback-Aufrufe an eine externe Modell-API, sofern Sie sie zulassen
Bleibt außerhalb
- Modell-APIs von Drittanbietern und die Anbieter, die sie betreiben
- Gehostete Analytik oder Fehler-Tracking, das Prompt-Text aufzeichnen würde
- Anbieter-Telemetrie aus Serving-Software, wo möglich abgeschaltet
Was wir einrichten und betreiben
Hosting, Evaluierung und Betrieb für Ihre KI
Modellauswahl und Evaluierung
Open-Weight-Modelle wie Llama, Mistral oder Qwen, verglichen an Ihren eigenen Beispielen hinsichtlich Antwortqualität, Geschwindigkeit, Lizenzierung und Betriebskosten.
Bereitstellung und Skalierung
Inferenzserver wie vLLM hinter einer internen API, mit Request-Queuing, Batching und Autoscaling, dimensioniert auf die reale Nachfrage.
Passend dimensionierte Rechenleistung
CPU-, GPU- oder gemischte Kapazität, dimensioniert anhand von Lasttests. Kleinere oder quantisierte Modelle erledigen die Aufgabe oft; GPUs werden nur hinzugefügt, wenn die Arbeitslast sie erfordert.
Zugriffs- und Netzwerkgrenzen
Private Vernetzung, authentifizierte Endpunkte, rollenbasierter Zugriff und kontrollierte ausgehende Verbindungen, sodass Prompts und Ausgaben innerhalb der vereinbarten Grenze bleiben.
Protokollierung und Überwachung
Latenz, Fehler, Durchsatz, Ressourcennutzung und Signale zur Antwortqualität werden erfasst, wobei die Protokollierung darauf ausgelegt ist, was gespeichert werden darf.
Modell-, Prompt- und Agent-Updates
Updates werden erst nach einer Regressionsbewertung veröffentlicht, hinzu kommt der Betrieb bereitgestellter Agents: Tool-Berechtigungen, Freigabepunkte, Ausführungsprotokolle und menschliche Übernahme.
Wer privat gehostete KI benötigt
Die KI Ihres Produkts darf keine Prompts und Dokumente mehr an eine externe Modell-API senden, und niemand im Team hat zuvor Modelle in Produktion betrieben.
- Softwareanbieter, deren Enterprise-Kunden nicht zulassen, dass ihre Daten externe Modell-APIs erreichen
- Regulierte Teams, die Dokumente und Modellprotokolle auf ihrer eigenen Infrastruktur halten müssen
- Teams, die interne Assistenten über vertrauliche Dateien wie Verträge oder HR-Unterlagen aufbauen
Typische Anfragen zu privater KI
Typische Szenarien, die wir abgrenzen, keine Kundenfallstudien.
Eine funktionierende Funktion von einer Modell-API wegbewegen
Ein Dokument-Zusammenfasser nutzt eine kommerzielle API, und der Vertrag eines großen Kunden verbietet das nun. Wir würden Open-Weight-Modelle an den realen Eingaben testen, eines, das Ihre Qualitätsschwelle erfüllt, in Ihrem Cloud-Konto hosten und hinter derselben internen Schnittstelle umstellen.
Server ohne Internetverbindung
Ein Einsatzort erlaubt keine ausgehende Internetverbindung, daher müssen Modelle auf lokalen Servern laufen. Wir würden Modelle, Serving-Software und Abhängigkeiten für die Offline-Installation verpacken und vereinbaren, wie jede neue Version geprüft wird, bevor sie eingebracht wird.
Debugging ohne Speicherung von Prompts
Die Richtlinie besagt, dass Prompts personenbezogene Daten enthalten können und nicht gespeichert werden dürfen, doch Fehler müssen dennoch untersucht werden. Wir würden standardmäßig Metadaten und Qualitätssignale protokollieren und nur mit Ihrer Zustimmung redigierte Stichproben für einen begrenzten Zeitraum erfassen.
Von Anforderungen zu laufenden Modellen
- 01
Die Grenze definieren
Wir vereinbaren Anwendungsfälle, welche Daten verarbeitet werden dürfen, wo die Grenze liegt, die erwartete Last und die Qualitätsschwelle, die Ihr Evaluierungsset prüfen wird.
- 02
Evaluieren und dimensionieren
Kandidatenmodelle werden an Ihren Beispielen getestet, dann wird die Rechenleistung anhand von Lasttests dimensioniert. Wir empfehlen GPUs nur, wenn die Ergebnisse zeigen, dass sie nötig sind.
- 03
Bereitstellen und härten
Serving, Zugriffskontrolle, Netzwerkregeln, Protokollierung und Überwachung werden als Code bereitgestellt und dann vor echtem Traffic auf Last und Fehler getestet.
- 04
Betreiben und verbessern
Überwachung, Kapazitäts- und Zugriffsprüfungen sowie Modell- oder Prompt-Updates, die erst veröffentlicht werden, nachdem die Regressionsbewertung bestanden ist.
Zwei Wege, mit KI-Tools zu arbeiten
KI unterstützt bei Infrastrukturcode und Diagnosen. Wählen Sie, wo sie Ihre Konfiguration und Logs verarbeiten darf.
- Private / lokale KI-Entwicklung
Privat gehostete Modelle innerhalb einer von Ihnen kontrollierten Infrastruktur oder einer vereinbarten isolierten Umgebung.
Mit diesem Paket besprechen - Entwicklung mit Claude Code / OpenAI Codex
Claude Code und/oder OpenAI Codex mit Cloud-Einstellungen, die Ihre Organisation genehmigt.
Mit diesem Paket besprechen
Nicht sicher? Wir empfehlen eines während des Scopings. KI-Bereitstellungsoptionen vergleichen
Was privates KI-Hosting ausschließt
- Das Entwerfen und Erstellen der KI-Funktion oder des Agents selbst ist LLM Integration oder Automation Agents; dieser Service hostet, sichert und betreibt die dahinterliegenden Modelle.
- Das Trainieren eines eigenen Modells ist Machine Learning Models, und das Fine-Tuning eines Sprachmodells fällt unter LLM Integration; wir hosten und betreiben das Ergebnis.
- Den Betrieb des Rests Ihrer Anwendung, etwa Webserver, Datenbanken und gewöhnliche Releases, deckt Managed DevOps & Operations ab; dieser Service deckt die Modelle und Agents ab.
- Wir prüfen Modelllizenzen auf Ihre beabsichtigte Nutzung, aber die rechtliche Freigabe von Lizenzen und Datenvereinbarungen bleibt bei Ihrer eigenen Rechtsberatung.
Wie Engineering, QA und Betrieb zusammenhängen
KI-Engineering in Ihrem Produkt
Unsere KI-Ingenieure verbinden gehostete Modelle mit Ihrem Produkt: Retrieval, Tool-Aufrufe, Agent-Workflows und die Bildschirme, auf denen Menschen prüfen, korrigieren oder übernehmen.
Evaluierung als QA
Die QA pflegt Evaluierungsdatensätze und Regressionsprüfungen für Antwortqualität, Tool-Berechtigungen und Fehlerbehandlung und führt sie vor jeder Modell- oder Prompt-Änderung aus.
Design für KI-Verhalten
Designer gestalten, wie KI-Ausgaben erscheinen: Lade- und Fallback-Zustände, Quellen und die Steuerelemente, mit denen Menschen ein Ergebnis korrigieren oder überschreiben.
Betrieb nach dem Launch
Ein Modell zu hosten unterscheidet sich vom Betrieb einer gewöhnlichen App. Wir halten Kapazität, Zugriff, Updates und Evaluierungen unter Beobachtung, mit in einem Supportplan vereinbarten Supportzeiten.
FAQ
Häufig gestellte Fragen
Wie unterscheidet sich das vom Paket Private / lokale KI-Entwicklung?
Private AI Infrastructure ist der Ort, an dem die KI Ihres fertigen Produkts läuft: die Modelle und Agents, mit denen Ihre Nutzer oder Mitarbeiter arbeiten. Private / lokale KI-Entwicklung ist ein Entwicklungspaket: Es hält die KI-Tools, die wir beim Erstellen Ihrer Software verwenden, auf Modellen innerhalb einer vereinbarten Grenze. Das andere Paket, Entwicklung mit Claude Code / OpenAI Codex, verwendet kommerzielle Coding-Agents. Jedes Paket lässt sich mit diesem Service kombinieren.
Brauchen wir GPUs, um private Modelle zu betreiben?
Nicht immer. Kleinere oder quantisierte Modelle können für Aufgaben wie Klassifizierung, Extraktion oder interne Tools mit geringem Volumen auf CPUs laufen. Größere Modelle, lange Eingaben und viele gleichzeitige Nutzer benötigen in der Regel GPUs. Wir dimensionieren die Rechenleistung anhand von Lasttests mit Ihren realen Anwendungsfällen und empfehlen das kleinste Setup, das Ihre Qualitäts- und Geschwindigkeitsanforderungen erfüllt.
Welche Modelle können Sie hosten?
Open-Weight-Sprachmodelle wie Llama, Mistral, Qwen oder Gemma, Embedding- und Reranking-Modelle für die Suche sowie aufgabenspezifische Modelle, die Ihr Team trainiert hat. Wir vergleichen Kandidaten an Ihren eigenen Beispielen und prüfen jede Lizenz auf Ihre beabsichtigte Nutzung, bevor wir eines empfehlen.
Ist Self-Hosting günstiger als eine Modell-API?
Manchmal. Bei geringem oder schwankendem Volumen ist eine gehostete API zu geeigneten Bedingungen oft günstiger und einfacher. Privates Hosting ist sinnvoll, wenn Daten innerhalb Ihrer Grenze bleiben müssen, wenn Sie Kontrolle über Modellversionen benötigen oder wenn ein gleichmäßiges Volumen dedizierte Kapazität wirtschaftlich macht. Wir vergleichen beide gegen Ihre erwartete Nutzung, bevor Sie sich festlegen.
Halten Sie die KI Ihres Produkts innerhalb Ihrer Grenze
Sagen Sie uns, was Ihre KI-Funktionen tun und wo Daten bleiben müssen. Wir empfehlen passende Modelle, Hosting und einen Betriebsplan.


