KI-Hosting für Modelle, die bei Ihnen laufen
- Standort Bayern · DACH-weit
- DSGVO-konform · AVV inklusive
- Antwort in 24h · Angebot nach dem Scoping
Was ist KI-Hosting?
KI-Hosting bedeutet, ein Sprachmodell auf Infrastruktur zu betreiben, die Sie selbst kontrollieren, statt es als Dienst bei einem externen Anbieter zu nutzen. Das Modell läuft auf Ihrer Hardware, in Ihrem Kubernetes-Cluster oder in einem Rechenzentrum in Frankfurt. Dazu gehören ein Zugang für Ihre Anwendungen, Zugriffsrechte, Protokollierung und Überwachung. Eingesetzt werden Open-Weight-Modelle, deren Gewichte frei verfügbar sind und die sich auf Ihre Daten anpassen lassen.
Drei Wege, ein Modell zu betreiben
Welcher passt, hängt an Ihren Vorgaben zum Datenort, an vorhandener Hardware und an der Zahl der Nutzer.
Managed in Frankfurt
Das Modell läuft im Rechenzentrum eines deutschen Anbieters. Wir richten es ein, betreiben es und stehen für Änderungen bereit. Ein Auftragsverarbeitungsvertrag gehört dazu. Der schnellste Weg zu einem eigenen Modell.
On-Premises auf Ihrer Hardware
Server mit GPUs in Ihrem Haus oder Ihrem Rechenzentrum. Wir übernehmen Sizing, Aufbau und Inbetriebnahme. Die Daten verlassen Ihr Netz nicht, das ist die Lösung für strenge Vorgaben.
Im eigenen Kubernetes-Cluster
Wer schon einen Cluster betreibt, bekommt das Modell als weiteren Dienst darin. Wir liefern Deployment, Skalierung und Anbindung an Ihre Anwendungen.
Ein Modell im Betrieb braucht mehr als einen Server
Die Arbeit beginnt nach dem ersten Testlauf. Diese Punkte gehören bei uns zum laufenden Betrieb.
Zugriffsrechte
Rollenbasierte Zugriffe legen fest, wer welches Modell und welche Datenquelle nutzen darf. Die Anmeldung läuft über Ihr bestehendes Identitätssystem.
Protokollierung und Maskierung
Anfragen werden nachvollziehbar protokolliert, personenbezogene Angaben lassen sich maskieren, bevor sie das Modell erreichen.
Monitoring
Auslastung, Antwortzeiten und Fehler im Blick, damit ein Engpass auffällt, bevor Ihre Nutzer ihn bemerken.
Modellwechsel
Neue Modelle erscheinen im Monatsrhythmus. Der Betrieb ist so gebaut, dass sich das Modell tauschen lässt, ohne dass Ihre Anwendungen angepasst werden müssen.
Angepasste Modelle
Auf Wunsch stimmen wir das Modell mit LoRA oder QLoRA auf Ihre Fachsprache ab und betreiben die angepasste Version. Mehr dazu unter Custom AI Models.
Anbindung an Ihre Daten
Ein gehostetes Modell wird nützlich, wenn es Ihre Dokumente kennt. Dafür bauen wir den KI-Data-Hub.
Erst an Ihren Anfragen testen, dann Hardware planen
So entsteht eine Anschaffung, die zur Last passt.
Anfragen sichten
Wir schauen uns an, was das Modell beantworten soll, in welcher Sprache und von wie vielen Personen gleichzeitig.
Modell und Hardware wählen
Wir testen zwei bis drei Kandidaten an Ihren echten Anfragen und rechnen die Hardware dazu, bevor etwas gekauft wird.
Umgebung aufbauen
Frankfurt, Ihre Hardware oder Ihr Kubernetes-Cluster. Dazu Zugriffsrechte, Protokollierung und die Anbindung an Ihre Anwendungen.
Betrieb und Übergabe
Monitoring, Updates und Modellwechsel bei uns, oder Dokumentation und Übergabe an Ihr Team.
Wann Self-Hosting die richtige Wahl ist
Self-Hosting passt, wenn Daten das Haus nicht verlassen sollen, wenn die Last über den Tag gleichmäßig hoch ist oder wenn Sie ein Modell einsetzen, das auf Ihre Fachsprache abgestimmt wurde. Dann rechnet sich eigene Hardware oder ein fester Platz im Rechenzentrum, und Sie sind unabhängig von Preisänderungen und Nutzungsbedingungen eines Anbieters.
Bei gelegentlicher Nutzung und ohne besondere Vorgaben zum Datenort ist der Zugriff über eine API meist einfacher, und wir binden sie in Ihre Systeme ein. Viele Unternehmen kombinieren beides. Wie die Bausteine zusammenspielen, zeigt die Übersicht Individuelle KI-Systeme.
Einen ausführlichen Überblick zu Anbietern, Datenschutz und Auswahl finden Sie im Leitfaden zum KI-Hosting. Wer eine fertige Plattform sucht, findet sie bei BaseGPT.
Antworten zu Modellen, Betrieb und Kosten
Was bedeutet KI-Hosting?
KI-Hosting heißt, dass ein Sprachmodell auf Infrastruktur läuft, die Sie kontrollieren, statt bei einem US-Anbieter als Dienst. Das kann Ihre eigene Hardware sein oder ein Rechenzentrum in Frankfurt. Eingaben, Antworten und Modellgewichte verlassen diese Umgebung nicht. Wir richten den Betrieb ein und übernehmen ihn auf Wunsch dauerhaft.
Welche Modelle lassen sich selbst betreiben?
Open-Weight-Modelle wie Llama 3.3, Mistral, Qwen 2.5 und DeepSeek-V3, von 7 bis 120 Milliarden Parametern. Welches Modell zu Ihnen passt, hängt an der Aufgabe, der Sprache und der Hardware, die zur Verfügung steht. Das klären wir vor dem Aufbau anhand Ihrer echten Anfragen und richten den Betrieb so ein, dass sich das Modell später wechseln lässt.
Wann lohnt sich Self-Hosting gegenüber einer API?
Sobald Daten das Haus nicht verlassen sollen, sobald die Last gleichmäßig hoch ist oder sobald Sie ein eigenes, fein abgestimmtes Modell einsetzen. Für gelegentliche Nutzung und ohne besondere Vorgaben an den Datenort ist eine API meist der einfachere Weg. Beide Wege lassen sich kombinieren: sensible Anfragen laufen auf Ihrem Modell, alles andere über die API.
Was gehört zum Betrieb?
Zugriffsrechte, Protokollierung der Anfragen, das Maskieren personenbezogener Daten, Überwachung von Auslastung und Antwortzeiten sowie Updates und Modellwechsel. Sie bekommen dafür einen festen Ansprechpartner. Wer den Betrieb selbst übernehmen möchte, erhält von uns eine Dokumentation und eine Übergabe.
Kann ich einen KI-Server mieten, statt Hardware zu kaufen?
Ja, das ist die Variante Managed in Frankfurt. Sie mieten Kapazität im Rechenzentrum eines deutschen Anbieters, wir richten das Modell dort ein und betreiben es. Sie schaffen keine GPUs an und stellen keine Server auf. Wenn die Last später steigt oder Vorgaben es verlangen, ziehen wir das Modell auf Ihre eigene Hardware um.
Wo liegen die Daten bei Managed Hosting?
Im Frankfurter Rechenzentrum eines deutschen Anbieters. Daten und Modelle bleiben in der EU, ein Auftragsverarbeitungsvertrag gehört zum Angebot. Bei einem Betrieb auf Ihrer eigenen Hardware liegen sie bei Ihnen im Haus.
Wem gehören Modell und Konfiguration?
Ihnen. Das gilt für angepasste Modellgewichte, den Code der Anbindung und die Konfiguration. Auf Kundendaten wird kein Modell trainiert, das anderen zur Verfügung steht.
Was kostet KI-Hosting?
Die Kosten bestehen aus der Einrichtung und dem laufenden Betrieb samt Hardware oder Rechenzentrum. Die Einrichtung bekommen Sie nach dem Scoping zum Festpreis, wenn Sie das möchten. Für die Hardware gibt es kein Pauschalmaß, sie hängt vom Modell und der Zahl gleichzeitiger Nutzer ab. Nach einem Gespräch über Ihren Bedarf nennen wir Ihnen eine belastbare Größenordnung.
Reicht dafür ein einzelner Server?
Für Modelle im unteren und mittleren Größenbereich und einen Nutzerkreis in der Größe einer Abteilung häufig ja. Große Modelle und viele gleichzeitige Anfragen verlangen mehrere GPUs. Wir rechnen das vor dem Kauf mit Ihnen durch, damit Sie keine Hardware anschaffen, die zu groß oder zu klein ausfällt.
Welches Modell und welche Hardware passen zu Ihnen?
Erzählen Sie uns, was das Modell beantworten soll und wie viele Personen es nutzen. Wir rechnen Ihnen in Ruhe eine Größenordnung vor und besprechen sie gern persönlich.