Aleph Alpha Kolibri: Was das deutsche Open-Weight-Modell kann und wo seine Grenzen liegen
Kolibri ist das neue Open-Weight-Modell von Aleph Alpha. Wofür es sich im Mittelstand eignet, wo es schwächer ist als Qwen und Co. und was der Betrieb im eigenen Rechenzentrum voraussetzt.
Am 3. Oktober 2026 hat Aleph Alpha die Gewichte von Kolibri-1 auf Hugging Face veröffentlicht. Kolibri ist ein Open-Weight-Sprachmodell für Deutsch und Englisch, lizenziert unter Apache 2.0 und damit auch kommerziell nutzbar. Technisch ist es ein Mixture-of-Experts-Modell mit 78,1 Milliarden Parametern, von denen pro Token nur 3,46 Milliarden rechnen. Für Unternehmen, die KI im eigenen Rechenzentrum betreiben wollen oder müssen, ist das seit Langem das erste deutsche Modell, das man ernsthaft gegen Qwen, Mistral oder gpt-oss testen kann.
Dieser Beitrag ordnet ein, wofür Kolibri gut ist, wo es schwächer abschneidet als die Konkurrenz und was der Betrieb voraussetzt. Stand ist der 5. Oktober 2026. Alle Leistungszahlen stammen aus der Modellkarte und dem Blogbeitrag von Aleph Alpha. Unabhängige Messungen gab es zu diesem Zeitpunkt noch nicht, das sollten Sie beim Lesen der Zahlen im Kopf behalten.
Was ist Aleph Alpha Kolibri?
Kolibri ist das erste Modell von Aleph Alpha seit Jahren, das unter einer freien Lizenz erscheint. Der Vorgänger Pharia-1-LLM-7B durfte nur nicht-kommerziell genutzt werden. Kolibri wurde von Grund auf trainiert, es ist also kein Fine-Tune eines Llama- oder Qwen-Modells. Laut Pressemitteilung zielt Aleph Alpha auf öffentliche Verwaltung und Industrie, im Blog wird zusätzlich die Luft- und Raumfahrt genannt. Das Modell verarbeitet ausschließlich Text, Bilder oder Audio versteht es nicht.
Technische Eckdaten auf einen Blick
Merkmal | Kolibri-1 |
|---|---|
Architektur | Mixture of Experts, 50 Layer, 384 Experten (1 geteilter + 6 geroutete pro Token) |
Parameter | 78,1 Mrd. gesamt, 3,46 Mrd. aktiv pro Token |
Kontextfenster | 262.144 Token nativ, validiert bis 1.048.576 Token |
Sprachen | Deutsch und Englisch |
Trainingsdaten | rund 24 Billionen Token, davon über 20 % Deutsch und gut 13 % Code |
Wissensstand | 18. Juni 2026 |
Training | 768 Nvidia B200, 21 Tage, Rechenzentren in Deutschland und Finnland |
Lizenz | Apache 2.0 für Gewichte und Konfiguration |
Speicherbedarf | rund 78 GB in FP8 |
Quelle für alle Werte: Modellkarte Kolibri-1.
Warum Kolibri bei deutschem Text weniger Token braucht
Aleph Alpha hat für Kolibri einen eigenen Tokenizer mit 128.000 Einträgen gebaut. Auf deutschem Webtext kommt er auf 4,90 Byte pro Token. Zum Vergleich nennt Aleph Alpha 4,35 für GPT-5, 4,17 für die Qwen-Familie und 4,03 für den Mistral-Tokenizer. Für denselben deutschen Vertrag oder dieselbe Produktbeschreibung fallen bei Kolibri also rund 11 bis 18 Prozent weniger Token an. Das wirkt sich direkt auf Antwortzeit und darauf aus, wie viel Text in ein Kontextfenster passt.
Wofür Kolibri gut geeignet ist
Kolibri ist am stärksten, wenn es mit Dokumenten arbeitet, die man ihm mitgibt. Aleph Alpha hat das Modell gezielt darauf trainiert, eine Antwort zu verweigern, wenn der mitgelieferte Kontext sie nicht hergibt. Auf dem Benchmark AA-Omniscience liegt die Rate an Antworten ohne Halluzination bei 44,0 Prozent, beim internen Vorgängermodell waren es 14,8 Prozent. Qwen3.6 kommt im selben Vergleich allerdings auf 56,7 Prozent.
RAG auf deutschen Dokumenten: Handbücher, Verträge, Richtlinien und Tickets durchsuchen und mit Quellenbezug beantworten. Eine KI-Wissensdatenbank mit Kolibri profitiert vom sparsamen deutschen Tokenizer und vom großen Kontextfenster. Wie Retrieval-Augmented Generation funktioniert, steht in RAG einfach erklärt.
Lange Dokumente: 262.000 Token entsprechen grob mehreren hundert Seiten. Ausschreibungen, Normen oder technische Dokumentationen passen am Stück hinein.
Rechnen und mehrstufiges Schlussfolgern: AIME 2026 mit 96,0 Punkten auf Englisch und 90,0 auf Deutsch, GPQA Diamond mit 84,3 bzw. 81,3. Der Reasoning-Aufwand lässt sich in vier Stufen (none, low, medium, high) einstellen, um Antwortzeit gegen Gründlichkeit abzuwägen.
Strukturierte Extraktion: Daten aus Lieferantenkatalogen, Rechnungen oder Produktdatenblättern in feste Felder überführen. Für Händler mit Shopware oder Magento heißt das zum Beispiel, Attribute aus deutschsprachigen Herstellerunterlagen automatisch zu befüllen.
Betrieb im eigenen Rechenzentrum: Gewichte unter Apache 2.0, keine Nutzungsgrenzen nach Unternehmensgröße, keine Einschränkung für EU-Firmen wie bei den multimodalen Llama-4-Modellen.
Agenten mit menschlicher Freigabe: Bei Kundenservice-Szenarien wie τ²-airline (76,7) liegt Kolibri vor den anderen MoE-Modellen in Aleph Alphas Vergleich, das dichte Qwen3.8 27B ist aber besser (83,3).
Wo Kolibri an Grenzen stößt
Aleph Alpha veröffentlicht die Schwächen in der eigenen Modellkarte, was man anerkennen sollte. Die deutlichste Zahl steht in der Gesamttabelle: Auf Deutsch erreicht Kolibri 70,8 Punkte, das dichte Qwen3.8 27B 79,9. Wer das insgesamt stärkste offene Modell sucht, findet es hier nicht.
Wissen ohne Quellen: Ohne mitgegebene Dokumente liegt die Trefferquote auf AA-Omniscience bei 14,8 Prozent, im Closed-Book-Test von RGB bei 51,0. Kolibri als allwissenden Chatbot einzusetzen, führt zu vielen Enthaltungen oder Lücken.
Mehrstufiges Tool-Calling: BFCL v3 multi-turn 39,8 gegenüber 54,0 bei Qwen3.5 35B-A3B. Für Agenten, die viele Werkzeuge nacheinander aufrufen, ist das ein Warnsignal. Wer KI-Agenten entwickeln lassen will, sollte diesen Teil gesondert testen.
Coding-Agenten: SWE-Bench Verified 66,4 (Qwen3.6: 73,8), TerminalBench 2.1 27,7 (Qwen3.5: 39,7).
Bilder, Scans, Audio: Kolibri ist ein reines Textmodell. Für gescannte Belege oder Produktfotos braucht es ein zusätzliches Modell oder eine OCR-Stufe davor.
Kleine Hardware: Mit rund 78 GB in FP8 läuft Kolibri nicht auf einer einzelnen Workstation-Grafikkarte. Ein offizielles GGUF-Format für llama.cpp nennt die Modellkarte nicht.
Autonome Entscheidungen: Aleph Alpha selbst schließt unbeaufsichtigten Einsatz in kritischen Umgebungen aus und empfiehlt eine menschliche Prüfung, bevor das Modell Aktionen auslöst. Auch auf mögliche (politische) Verzerrungen weist die Karte hin.
Kolibri im Vergleich mit anderen offenen Modellen
Die Tabelle stellt Kolibri den Modellen gegenüber, die ein Mittelständler im Herbst 2026 realistisch vergleicht. Die Gesamtwerte stammen aus Aleph Alphas eigener Vergleichstabelle (Reasoning-Stufe high, deutsche Benchmarks) und sind deshalb mit Vorsicht zu lesen.
Modell | Parameter (gesamt / aktiv) | Lizenz | Kontext | Gesamtwert DE* | Gehostet bei STACKIT / IONOS |
|---|---|---|---|---|---|
Kolibri-1 (Aleph Alpha) | 78,1 Mrd. / 3,46 Mrd. | Apache 2.0 | 262k, bis 1M | 70,8 | nein / nein |
Qwen3.8 27B (Alibaba) | 27 Mrd. (dicht) | Apache 2.0 | 262k | 79,9 | ja / ja |
gpt-oss-120b (OpenAI) | 117 Mrd. / 5,1 Mrd. | Apache 2.0 | 131k | 70,2 | ja / ja |
Gemma 4 26B-A4B (Google) | 26 Mrd. / 4 Mrd. | Apache 2.0 | bis 256k | 66,3 | nur 31B bei STACKIT |
Mistral Small 4 (Mistral AI) | 119 Mrd. / 6,5 Mrd. | Apache 2.0 | 256k | 61,4 | nein / nein |
Soofi S (deutsches Konsortium) | 31,6 Mrd. / 3,2 Mrd. | beim Release nicht final | bis 256k | nicht verglichen | nein / nein |
* Quelle: Modellkarte Kolibri-1. Hosting-Verfügbarkeit laut STACKIT-Dokumentation und IONOS AI Model Hub, abgerufen am 5. Oktober 2026. Soofi S laut The Decoder.
Kolibri aktiviert pro Token weniger Parameter als gpt-oss-120b und liegt trotzdem knapp davor. Auf dem Leaderboard von Artificial Analysis war das Modell zum Stichtag noch nicht eingetragen. Sobald unabhängige Werte vorliegen, lohnt ein zweiter Blick. Wer US-Modelle wie Claude mit europäischem Hosting kombinieren möchte, findet die Optionen in unserem Beitrag Claude DSGVO-konform nutzen.
Was "souverän" bei Kolibri bedeutet
Aleph Alpha vermarktet Kolibri als souveräne KI aus Deutschland. Das Modell wurde in Europa trainiert, die Gewichte gehören nach dem Download Ihnen, und es gibt keine Nutzungsbeschränkung nach Land oder Unternehmensgröße. Für einen Einkauf oder eine Ausschreibung lohnt es sich trotzdem, vier Punkte zu kennen, auf die auch cloudmagazin hinweist:
Apache 2.0 gilt laut Modellkarte für Gewichte und Konfiguration. Trainingscode, Architekturdetails und Trainingsmethoden bleiben bei Aleph Alpha.
Für den Betrieb ist das Paket
aleph-alpha-inferenceals vLLM-Plugin vorgesehen. Das Paket kommt von Aleph Alpha, Updates hängen damit am Hersteller.Ein Teil der synthetischen Trainingsdaten wurde mit anderen offenen Modellen erzeugt, darunter Gemma, Mistral NeMo und Qwen3. Die Modellkarte legt das offen.
Aleph Alpha hat am 16. September 2026 den Fusionsvertrag mit Cohere unterzeichnet. Das neue Unternehmen firmiert als Cohere mit Sitz in Berlin und Toronto, die Forschung bleibt in Heidelberg. Die Schwarz Gruppe, die bereits über 20 Prozent hält, stellt rund 500 Millionen Euro bereit. Die Freigabe durch die Behörden steht noch aus.
Für den praktischen Betrieb ändert die Fusion wenig: Wer die Gewichte heruntergeladen hat, kann sie unter Apache 2.0 weiter nutzen, unabhängig davon, wie sich das Unternehmen entwickelt. Offen ist, wie lange und in welchem Takt Aleph Alpha bzw. Cohere neue Kolibri-Versionen veröffentlicht.
Kolibri im eigenen Rechenzentrum betreiben
Kolibri kommt ohne fertige Cloud-API. Eine gehostete Variante war zum 5. Oktober 2026 weder bei Aleph Alpha dokumentiert noch bei STACKIT oder IONOS im Modellkatalog. Wer das Modell nutzen will, betreibt es selbst oder lässt es betreiben. Die Modellkarte nennt als Mindestausstattung zwei A100 mit je 80 GB, zwei H100 oder eine einzelne H200, B200 oder B300. Ausgeliefert wird über vLLM mit dem Plugin von Aleph Alpha, ein fertiges Container-Image liegt in der GitHub Container Registry.
Für ein Pilotprojekt reicht meist ein gemieteter GPU-Server in einem deutschen Rechenzentrum. Wie Sie dabei Standort, Auftragsverarbeitung und Zugriffsrechte regeln, beschreibt unser Leitfaden zu DSGVO-konformem KI-Hosting. Wenn Sie den Betrieb abgeben möchten, finden Sie die Varianten unter KI-Hosting in Frankfurt oder on-premises.
DSGVO und EU AI Act
Ein Modell ist für sich weder DSGVO-konform noch nicht konform. Es kommt darauf an, wo es läuft, wer auf Prompts und Logs zugreift und welche Daten hineinfließen. Der Vorteil von Kolibri ist, dass sich alle drei Punkte im eigenen Haus klären lassen. Wie wir das in Projekten aufsetzen, zeigen unsere DSGVO-konformen KI-Lösungen.
Beim AI Act ist Aleph Alpha als Anbieter eines General-Purpose-Modells in der Pflicht und hat den GPAI-Verhaltenskodex der EU unterzeichnet. Unternehmen, die Kolibri in eigene Anwendungen einbauen, sind in der Regel Betreiber und haben eigene Pflichten, etwa bei der Kennzeichnung oder der KI-Kompetenz der Mitarbeitenden. Was seit August 2026 gilt, fasst unser Überblick EU AI Act 2026 zusammen.
RAG oder Fine-Tuning mit Kolibri
Beide Verfahren lösen unterschiedliche Probleme. RAG bringt aktuelles Unternehmenswissen zur Laufzeit ins Modell und ist für Kolibri wegen der Enthaltungs-Trainings der naheliegende Einstieg. Fine-Tuning verändert Verhalten, Tonalität und Ausgabeformat, etwa für einheitliche Produkttexte oder feste JSON-Strukturen. Da die Gewichte offen sind, ist beides möglich. Einen Überblick über Verfahren und Datenbedarf gibt der Beitrag Fine-Tuning von KI-Modellen, die Umsetzung beschreibt die Seite Custom Models und Fine-Tuning.
Für welche Unternehmen sich Kolibri lohnt
Kolibri ist eine gute Wahl, wenn drei Dinge zusammenkommen: Die Daten dürfen das eigene oder ein deutsches Rechenzentrum nicht verlassen, der Großteil der Inhalte ist deutsch, und die Anwendung arbeitet mit mitgelieferten Dokumenten. Das trifft auf viele interne Assistenten in Industrie, Verwaltung, Versicherung und Handel zu.
Wer dagegen gehostet starten möchte, ohne eigene GPUs, oder vor allem Agenten mit vielen Werkzeugaufrufen bauen will, ist heute mit Qwen3.8 27B oder gpt-oss-120b bei STACKIT oder IONOS schneller am Ziel. Ein Modellwechsel ist später meist mit überschaubarem Aufwand möglich, wenn die Anwendung von Anfang an mit austauschbarem Modell geplant wird.
Unser Vorschlag für die Praxis: 50 bis 100 echte Fragen aus Ihrem Alltag sammeln, mit den passenden Dokumenten gegen Kolibri und ein bis zwei Alternativen laufen lassen und die Antworten fachlich bewerten. Das dauert wenige Tage und sagt mehr als jede Benchmark-Tabelle. Wenn Sie dafür eine zweite Meinung möchten, sprechen Sie mit uns in der KI-Beratung oder starten Sie mit einem KI-Strategie-Audit. Weitere Themen rund um Modelle, Agenten und Betrieb finden Sie bei unserer KI-Agentur für den Mittelstand.
Häufig gestellte Fragen
Was ist Aleph Alpha Kolibri?
Kolibri (Kolibri-1) ist ein Open-Weight-Sprachmodell von Aleph Alpha aus Heidelberg, veröffentlicht am 3. Oktober 2026 auf Hugging Face unter der Lizenz Apache 2.0. Es ist ein Mixture-of-Experts-Modell mit 78,1 Milliarden Parametern, von denen pro Token 3,46 Milliarden aktiv sind. Trainiert wurde es von Grund auf für Deutsch und Englisch, mit einem nativen Kontextfenster von 262.144 Token.
Wer steckt hinter Aleph Alpha und was ist aus dem Unternehmen geworden?
Aleph Alpha ist ein KI-Unternehmen aus Heidelberg, CEO ist Ilhan Scheer. Die Schwarz Gruppe hält über 20 Prozent der Anteile. Am 16. September 2026 hat Aleph Alpha den Vertrag zur Fusion mit dem kanadischen Anbieter Cohere unterzeichnet. Das gemeinsame Unternehmen soll als Cohere mit Sitz in Berlin und Toronto firmieren, Heidelberg bleibt Forschungsstandort. Die regulatorische Freigabe stand zum 5. Oktober 2026 noch aus.
Kann man Kolibri selbst hosten?
Ja. Die Gewichte liegen frei auf Hugging Face. In FP8 braucht Kolibri rund 78 GB GPU-Speicher, laut Modellkarte also mindestens zwei A100 mit 80 GB, zwei H100 oder eine H200, B200 oder B300. Betrieben wird das Modell über vLLM zusammen mit dem Paket aleph-alpha-inference. Für Laptops oder Consumer-Grafikkarten ist Kolibri nicht ausgelegt.
Ist Kolibri DSGVO-konform?
Ein Sprachmodell allein ist weder DSGVO-konform noch nicht konform. Für die DSGVO zählen Hosting-Ort, Auftragsverarbeitung, Zugriffsrechte und Datenflüsse. Weil die Gewichte offen sind, lässt sich Kolibri in einem eigenen oder einem EU-Rechenzentrum betreiben, sodass Prompts und Dokumente die eigene Umgebung nicht verlassen. Das schafft eine gute Ausgangslage, ersetzt aber keine Prüfung des konkreten Verarbeitungsszenarios.
Gibt es mit Kolibri eine deutsche KI wie ChatGPT?
Kolibri ist ein deutsches Sprachmodell, aber kein fertiger Chat-Dienst. Es gibt zum Start keine öffentlich dokumentierte API und keine Chat-Oberfläche für Endkunden. Unternehmen betreiben das Modell selbst und binden es in eigene Anwendungen wie interne Assistenten, Wissensdatenbanken oder Dokumentenprüfung ein.
Kolibri, Qwen oder Mistral: Welches Modell passt?
Kolibri passt zu deutschsprachigen RAG-Anwendungen, langen Dokumenten und Szenarien, in denen das Modell bei fehlender Quelle lieber nicht antwortet. In Aleph Alphas eigener Vergleichstabelle liegt das dichte Qwen3.8 27B insgesamt vorn (79,9 zu 70,8 Punkten auf Deutsch) und ist bereits bei STACKIT und IONOS gehostet verfügbar. Mistral Small 4 bietet zusätzlich Bildverarbeitung. Die Wahl hängt am Anwendungsfall und am gewünschten Betriebsmodell.
Wie belastbar sind die Kolibri-Benchmarks?
Alle veröffentlichten Werte stammen aus Aleph Alphas eigenem Evaluations-Setup. Zum 5. Oktober 2026 gab es keine unabhängige Messung, auf Artificial Analysis war Kolibri noch nicht gelistet. Für eine Entscheidung lohnt sich ein eigener Test mit 50 bis 100 echten Fragen aus dem Unternehmen.