KI-Agenten & Automatisierung
LLM-Integration
Fügen Sie Ihrem Produkt große Sprachmodelle hinzu – mit Retrieval über Ihre eigenen Daten, Evaluierung anhand echter Fragen, Guardrails, Kostenkontrollen und einem klaren Rückfallverhalten, wenn das Modell unsicher ist.

LLM-Features, gebaut für den Produktivbetrieb
Eine Modell-API aufzurufen ist der einfache Teil. Ihre Antworten innerhalb Ihres Produkts akkurat, sicher und bezahlbar zu machen, ist die eigentliche Arbeit. Wir integrieren Modelle wie die GPT-Modelle von OpenAI, Claude, Gemini, Llama oder Mistral in Ihre Software, von einer einzelnen Funktion bis hin zu Retrieval-Augmented Generation (RAG) über Ihre Wissensdatenbank. Für Produkt- und Engineering-Teams übernehmen wir die Modellauswahl, das Retrieval, Prompts, die Evaluierung, Guardrails und die Kostenkontrolle und gestalten, wie Nutzer Quellen sehen und falsche Antworten melden.
KI-unterstützte, von Experten geleitete LLM-Entwicklung
Wie KI unterstützt
- Coding-Agenten entwerfen Integrationscode, Retrieval-Pipelines und Test-Harnesses, die Ingenieure prüfen.
- KI schlägt Testfragen aus Ihren Dokumenten vor; Ihre Experten genehmigen diejenigen, die Qualität definieren.
- KI vergleicht Ausgaben über verschiedene Kandidatenmodelle und Prompts hinweg und markiert wahrscheinliche Regressionen zur Prüfung.
- KI fasst Produktions-Logs und Nutzerfeedback zusammen, um wiederkehrende Fehlermuster sichtbar zu machen.
Was unsere Experten verantworten
- Modell- und Anbieterauswahl auf Basis von Evaluierungsergebnissen, Kosten und Ihren Datenregeln
- Worauf das Modell zugreifen kann: Datenquellen, Nutzerberechtigungen und Aufbewahrungseinstellungen
- Die Qualitätslatte, die Antworten vor jeder Freigabe erfüllen müssen
- Rückfallverhalten, wenn das Retrieval fehlschlägt, ein Anbieter ausfällt oder das Modell unsicher ist
Wie eine fundierte Antwort erzeugt wird
Beispielhafte retrieval-augmentierte Anfrage; Quellregeln, Prüfungen und Fallback-Formulierungen werden für Ihr Produkt entworfen.
Gestellte Frage
Ein angemeldeter Benutzer stellt eine Frage; seine Identität und Rolle begleiten die Anfrage.
Zulässiger Abruf
Die Suche ordnet Passagen aus Ihren indexierten Quellen nach Relevanz für die Frage.
Checkpoint: Nur Passagen, die dieser Benutzer sehen darf
Prompt mit Quellen
Die Frage, die abgerufenen Passagen und versionierte Anweisungen zu Format und Ablehnungen werden zu einem Prompt kombiniert.
Modellantwort
Das ausgewählte Modell liefert eine strukturierte Antwort, die die Passagen zitiert, auf die es sich gestützt hat.
Fundierungsprüfung
Automatisierte Prüfungen bestätigen, dass jedes Zitat auf eine abgerufene Passage verweist, und kennzeichnen Aussagen, die darüber hinausgehen.
Checkpoint: Nicht belegte Antworten werden zurückgehalten
Antwort oder Fallback
Der Benutzer sieht die Antwort mit Quellenlinks oder eine schlichte Nachricht, dass nichts Zulässiges sie abdeckt.
Wenn etwas fehlschlägt: Wenn der Abruf nichts findet, Prüfungen fehlschlagen oder der Anbieter ausfällt, sagt die Funktion dies, anstatt zu raten, und der Fall wird zur Überprüfung protokolliert.
Wer nach LLM-Features fragt
Sie möchten ein Modell, das aus Ihren eigenen Daten antwortet, aber ein schneller Prototyp behauptet Dinge, die Ihre Dokumente nicht belegen, ignoriert, wer was sehen darf, und hat laufende Kosten, die niemand vorhersagen kann.
- Produktteams, die einer bestehenden SaaS-App Suche, Zusammenfassungen oder Entwurfserstellung hinzufügen
- Organisationen, deren Mitarbeiter Schwierigkeiten haben, in internen Richtlinien und Handbüchern Antworten zu finden
- Engineering-Teams, die zum ersten Mal einen LLM-Prototyp in die Produktion überführen
Was Sie erhalten
Was ein LLM-Feature im Produktivbetrieb braucht
Modellauswahl und Integration
Anbindung an OpenAI, Claude, Gemini oder Open-Weight-Modelle aus Ihrem Backend – mit Rate Limiting, Retries, Anbieter-Fallbacks und Nutzungsverfolgung.
RAG über Ihre Wissensdatenbank
Retrieval aus Ihren Dokumenten und Daten über eine Vektordatenbank, mit Quellenverweisen und Zugriffsregeln, sodass Antworten die Berechtigungen jedes Nutzers respektieren.
Prompts und strukturierte Ausgaben
Versionierte Prompts, Few-Shot-Beispiele und strukturierte Ausgaben, die Ihr Code validieren kann, statt Freitext, den er erraten muss.
Evaluierungs-Suite
Testsätze, erstellt aus Ihren echten Fragen, bewertet auf Genauigkeit, Fundierung in Quellen und Format, und vor jeder Prompt-, Modell- oder Datenänderung erneut durchlaufen.
Guardrails und Fallbacks
Eingabefilterung, Ausgabenmoderation, Abwehr von Prompt-Injection und ein definierter Fallback, wenn das Modell unsicher oder ein Anbieter nicht verfügbar ist.
Fine-Tuning, wo es hilft
Fine-Tuning auf Ihren Daten für Fachsprache, Tonfall oder Formate – eingesetzt, wenn die Evaluierung zeigt, dass Prompting und Retrieval nicht ausreichen.
Umfang, Vorbereitung und Support
Start mit einem definierten Umfang
Definieren Sie eine KI-Funktion innerhalb einer Anwendung: was der Benutzer fragt, welche Belege verfügbar sind und was das System tun muss, wenn die Belege unzureichend sind. Grenzen Sie Abruf, Berechtigungen, Evaluierung und Fallback-Verhalten gemeinsam ab.
Was Sie bereitstellen
Bringen Sie repräsentative Fragen, genehmigte Quelldokumente, Datenzugriffsregeln und die erwartete Nutzung mit. Weisen Sie einen Eigentümer zu, der veraltete Inhalte korrigiert und die Evaluierungskriterien genehmigt. Wir bestätigen Anbieterkonten und Beschränkungen beim Datenumgang vor der Implementierung.
Support nach der Auslieferung
Planen Sie Quellenaktualisierungen, Modell- oder Anbieterwechsel, erneute Evaluierungsläufe und Kostenüberwachung ein. Der Support kann dies im Rahmen eines vereinbarten Plans abdecken; das Hinzufügen einer KI-Funktion erfordert nicht die Wahl KI-gestützter Entwicklungstools.
Außerhalb einer LLM-Integration
- Mehrstufige Arbeit, die Datensätze ändert oder Aktionen in anderen Systemen auslöst, sind Automation Agents; eine LLM-Funktion beantwortet, entwirft oder extrahiert hier innerhalb Ihres Produkts.
- Ein Kundenservice-Assistent auf Ihrer Website oder in WhatsApp, mit Übergabe an Support-Mitarbeiter, wird durch AI Chatbots abgedeckt.
- Wir schreiben oder korrigieren Ihre Quelldokumente nicht: Wenn der Abruf veraltete oder widersprüchliche Inhalte zutage fördert, kennzeichnen wir sie, damit ihre Eigentümer sie korrigieren können.
- Das Ausführen von Modellen mit offenen Gewichten auf Ihren eigenen Servern oder in Ihrem Cloud-Konto wird separat als Private AI Infrastructure abgegrenzt, oft zusammen mit der Integration.
Typische LLM-Anfragen
Typische Szenarien, die wir abgrenzen, keine Kundenfallstudien.
Antworten aus internen Richtliniendokumenten
Mitarbeiter durchsuchen ein gemeinsames Laufwerk und finden oft veraltete Kopien von Richtlinien. Wir würden nur die aktuellen Versionen indexieren, die Zugriffsregeln jedes Teams anwenden, die Passage hinter jeder Antwort zitieren und ablehnen, wenn keine zulässige Quelle die Frage abdeckt.
Zusammenfassungen innerhalb eines mandantenfähigen SaaS-Produkts
Eine SaaS-App möchte eine Schaltfläche, die die jüngsten Aktivitäten eines Kontos zusammenfasst. Wir würden den Abruf nach Mandant und Rolle filtern, bevor der Prompt erstellt wird, und Testfälle hinzufügen, die versuchen, die Daten eines anderen Kunden abzurufen.
Ein Prototyp, der das Modell aus dem Browser aufruft
Ein funktionierender Prototyp sendet Prompts direkt aus dem Browser mit einem gemeinsam genutzten API-Schlüssel. Wir würden die Aufrufe in Ihr Backend verlagern, Limits pro Benutzer, Protokollierung und versionierte Prompts hinzufügen und vor der ersten Veröffentlichung ein Evaluierungsset erstellen.
Wie wir eine LLM-Integration liefern
- 01
Anwendungsfall und Machbarkeit
Wir erproben den Anwendungsfall mit Ihren echten Daten und Fragen, vergleichen Kandidatenmodelle und schätzen die laufenden Kosten, bevor Sie sich auf einen vollständigen Build festlegen.
- 02
Architektur und Datenregeln
Integrationsmuster, Retrieval-Design, Zugriffsregeln, Anbieterbedingungen und Rückfallverhalten werden mit Ihrem Team abgestimmt und dokumentiert.
- 03
Bauen und evaluieren
Ingenieure bauen die Integration und das nutzerseitige Feature, und QA bewertet es anhand des Evaluierungssatzes, bis es die von Ihnen genehmigte Qualitätslatte erfüllt.
- 04
Releasen und überwachen
Ein kontrollierter Rollout mit Monitoring, Kostengrenzen und Feedback-Erfassung, dann fortlaufende Evaluierung, während sich Modelle, Prompts und Daten ändern.
Zwei Wege, mit KI-Tools zu arbeiten
Wählen Sie, wo KI-Coding-Agenten Ihren Code verarbeiten dürfen, während wir bauen. Der Engineering-Standard ist in beiden Fällen derselbe.
- Private / lokale KI-Entwicklung
Privat gehostete Modelle innerhalb einer von Ihnen kontrollierten Infrastruktur oder einer vereinbarten isolierten Umgebung.
Mit diesem Paket besprechen - Entwicklung mit Claude Code / OpenAI Codex
Claude Code und/oder OpenAI Codex mit Cloud-Einstellungen, die Ihre Organisation genehmigt.
Mit diesem Paket besprechen
Nicht sicher? Wir empfehlen eines während des Scopings. KI-Bereitstellungsoptionen vergleichen
Wie Design, QA und Betrieb Ihr LLM-Feature unterstützen
Design für Vertrauen und Korrektur
Designer planen, wie Antworten, Quellen und Unsicherheit erscheinen, wie Nutzer eine falsche Antwort bearbeiten oder melden und wie Ihr Team diese Meldungen prüft – damit das Feature ehrlich über seine Grenzen ist.
QA über den Happy Path hinaus
QA pflegt die Evaluierungssätze, testet Antwortqualität, Datenberechtigungen und die Anfälligkeit für Prompt-Injection und führt Regressionsprüfungen nach Modell-, Prompt- oder Datenänderungen erneut durch.
Betrieb und Kostenkontrolle
DevOps betreibt die Integration mit Logging, Nutzungs- und Kosten-Dashboards, Caching und Modell-Routing sowie Open-Weight-Modellen auf privater Infrastruktur, wo Datenregeln es erfordern.
Modell- und Prompt-Updates
Anbieter ändern und stellen Modelle ein. Wir testen Ersatzmodelle gegen Ihren Evaluierungssatz, bevor wir wechseln, und halten Prompts, Retrieval und Kosten optimiert, während die Nutzung wächst.
FAQ
Häufig gestellte Fragen
Was ist RAG, und brauchen wir es?
Retrieval-Augmented Generation (RAG) ermöglicht es einem Modell, aus Ihren eigenen Dokumenten und Daten zu antworten, nicht nur aus seinem allgemeinen Training. Sie brauchen es, wenn Antworten private, spezialisierte oder sich häufig ändernde Informationen widerspiegeln müssen. Wir fügen Quellenverweise hinzu, damit Antworten überprüft werden können, und Zugriffsregeln, damit Nutzer nur Inhalte abrufen, die sie sehen dürfen.
Sollten wir ein Modell feintunen oder RAG verwenden?
Die meisten Features sollten mit guten Prompts und Retrieval beginnen, weil diese schneller zu ändern und leichter zu auditieren sind. Fine-Tuning hilft, wenn Sie ein konsistentes Format, einen Tonfall oder ein Fachvokabular benötigen, das Prompting nicht halten kann, und ermöglicht manchmal, dass ein kleineres, günstigeres Modell die Aufgabe erledigt. Wir entscheiden anhand von Evaluierungsergebnissen auf Ihren Daten, nicht standardmäßig.
Können wir ein privates oder Open-Source-Modell verwenden?
Ja. Open-Weight-Modelle wie Llama oder Mistral können auf einer von Ihnen kontrollierten Infrastruktur laufen, oder wir können gehostete Anbieter wie OpenAI oder Claude unter vereinbarten Konto- und Datenaufbewahrungseinstellungen nutzen. Unsere eigene Entwicklungsarbeit folgt dem von Ihnen gewählten Paket: Private / lokale KI-Entwicklung oder Entwicklung mit Claude Code / OpenAI Codex.
Was kostet es, ein LLM-Feature zu bauen und zu betreiben?
Die Baukosten hängen vom Umfang ab: Datenquellen, Integrationen, Interface-Arbeit und Evaluierungstiefe. Die laufenden Kosten hängen von der Nutzung und der Modellauswahl ab. Wir schätzen beides während der Machbarkeitsprüfung und steuern dann die laufenden Kosten mit Modell-Routing, Caching, Token-Limits und Nutzungs-Dashboards, die Sie einsehen können.
Verwandte Lektüre
- Reduzierung nicht belegter Antworten in RAG-Anwendungen
Wie Retrieval-Qualität, Dokumentberechtigungen, Belege und Evaluierung nicht belegte Antworten reduzieren können – und wo ein Wissensassistent weiterhin Grenzen braucht.
Bringen Sie ein LLM-Feature in den Produktivbetrieb
Bringen Sie einen Anwendungsfall und Beispieldaten mit. Wir testen die Machbarkeit, vergleichen Modelle und skizzieren die Evaluierung, Guardrails und laufenden Kosten, bevor Sie sich festlegen.


