Aleph Alphas Kolibri ist ein offenes KI-Modell für Deutsch und Englisch

Aleph Alpha hat mit Kolibri ein Open-Weight-Sprachmodell für Deutsch und Englisch veröffentlicht. Das Unternehmen richtet das Modell an Behörden, Industrieunternehmen, Luftfahrtfirmen, Banken und andere Organisationen, die KI auf eigener Infrastruktur einsetzen wollen.

Kolibri nutzt eine Mixture-of-Experts-Architektur. Das Modell besitzt insgesamt 78,1 Milliarden Parameter. Pro verarbeitetem Token, also einer Texteinheit, werden jedoch nur etwa 3,46 Milliarden Parameter aktiv. Damit soll Kolibri beim Betrieb deutlich weniger Rechenleistung benötigen als ein dichtes Modell vergleichbarer Gesamtgröße.

Ganz klein ist der Ressourcenbedarf dennoch nicht. Alle Modellteile müssen im Grafikspeicher liegen. Aleph Alpha gibt dafür rund 78 GB GPU-Speicher an. In der Praxis kommen damit vor allem Server mit leistungsfähigen Rechenzentrums-GPUs infrage.

Die Modellgewichte und Konfigurationsdateien stehen unter der Apache-2.0-Lizenz auf Hugging Face bereit. Unternehmen können Kolibri damit selbst herunterladen, betreiben, anpassen und weiterentwickeln. Den Trainingscode und die Trainingsverfahren behält Aleph Alpha für sich.

In seinem offiziellen Blogbeitrag bezeichnet Aleph Alpha Kolibri als „souveränes“ Modell. Gemeint sind zwei Aspekte: Entwicklung und Einsatz. Nach Angaben des Unternehmens haben Teams in Deutschland das Modell entwickelt und es auf Infrastruktur in Deutschland und Finnland trainiert. Nutzer sollen die Gewichte zudem im eigenen Rechenzentrum betreiben können, ohne interne Daten an externe KI-Dienste zu übertragen.

Für deutsche Texte und große Dokumentenmengen

Kolibri verarbeitet standardmäßig bis zu 262.144 Tokens Kontext. Aleph Alpha hat das Modell nach eigenen Angaben bis zu einer Million Tokens getestet. Das kann bei langen Verträgen, Gesetzestexten, Handbüchern oder umfangreichen internen Dokumentensammlungen relevant sein.

Ein Schwerpunkt liegt auf der deutschen Sprache. Aleph Alpha entwickelte dafür einen eigenen zweisprachigen Tokenizer. Dieser zerlegt Text in Einheiten, die das Modell verarbeiten kann. Bei deutschen Komposita kann eine gute Zerlegung Kosten senken und mehr Inhalt im selben Kontext vermitteln.

Der KI-Entwickler Tejas Kumar beschreibt in seiner Analyse von Kolibri einen eigenen Test mit dem Grundgesetz. Dabei benötigte Kolibris Tokenizer für den deutschen Gesetzestext deutlich weniger Tokens als OpenAIs o200k-Tokenizer. Bei der englischen Übersetzung lagen beide nahezu gleichauf.

Laut Aleph Alpha bestand der Anteil deutscher Daten beim Vortraining aus 21,3 Prozent. Insgesamt durchlief das Modell knapp 24 Billionen Tokens in mehreren Trainingsphasen. Das Unternehmen will damit ein Modell geschaffen haben, das Deutsch nicht nur als ergänzende Sprache zu einem englisch dominierten Datensatz behandelt.

Nutzer können außerdem zwischen vier Denkstufen wählen: none, low, medium und high. So lässt sich festlegen, ob Kolibri schnell antworten oder mehr Rechenaufwand für komplexe Aufgaben einsetzen soll.

Weniger Raten bei Antworten aus Dokumenten

Besonders betont Aleph Alpha die Fähigkeit zur Enthaltung. Kolibri soll erkennen, wenn die bereitgestellten Dokumente keine ausreichende Grundlage für eine Antwort enthalten. Dafür nutzte das Unternehmen ein Verfahren namens Merlin-Arthur. Dabei lernt das Modell anhand von Beispielen, bei denen entscheidende Belege vorhanden sind oder gezielt entfernt wurden.

Das ist vor allem für Retrieval-Augmented Generation wichtig. Bei diesem Ansatz sucht ein System zuerst Informationen in eigenen Dokumenten und gibt sie dem Modell als Kontext. Ein Modell muss dann nicht nur Antworten formulieren, sondern auch erkennen, wann die Quellen keine Antwort hergeben.

Die veröffentlichten Benchmarkwerte zeigen zugleich Grenzen. Kolibri liegt bei Fragen aus gespeichertem Allgemeinwissen, bei mehrstufiger Tool-Nutzung und bei Coding-Agenten hinter einigen Konkurrenten. Auch bei langen Kontexten fällt das Bild je nach Test unterschiedlich aus. Für den Betrieb ist zudem ein spezielles vLLM-Plugin von Aleph Alpha erforderlich.

Für Organisationen mit sensiblen deutschsprachigen Daten bietet Kolibri damit eine offen verfügbare Option für den lokalen Betrieb. Wie gut das Modell im Alltag funktioniert, müssen unabhängige Tests und konkrete Einsätze mit eigenen Daten zeigen.

Quellen

Bleib auf dem Laufenden

KI für Contentprofis: die neuesten Tools, Tipps und Trends. Alle 14 Tage in deine Inbox:

 

Weitere Infos …

Über den Autor

Mehr zum Thema:

×