Durchsuchbare Dokumentation aufrufen | Zurück zur Dokumentationsübersicht

Navigation: Dokumentationen agorum core > agorum core Module und Plugins > ALBERT | AI Suite


Eigener KI-Server für lokale KI

Die folgenden Abschnitte geben einen Überblick, was beim Betrieb eines eigenen, lokalen KI-Servers für ALBERT | AI zu beachten ist. Die Hinweise richten sich an Administratoren und Entwickler, die Sprachmodelle (LLMs) und weitere KI-Dienste im eigenen Netzwerk betreiben möchten, damit Anfragen und Daten das Unternehmen nicht verlassen.

Hinweis: Lokale KI entwickelt sich sehr schnell. Konkrete Modelle, Hardware und Software verändern sich innerhalb weniger Monate. Diese Dokumentation beschränkt sich deshalb auf die grundlegenden Zusammenhänge. Aktuelle Empfehlungen, Messwerte und Erfahrungen finden Sie in den Blog-Artikeln, die im Abschnitt Aktuelle Blog-Artikel zu lokaler KI aufgelistet sind.

Was bedeutet lokale KI?

Bei lokaler KI laufen die Sprachmodelle auf eigener Hardware im eigenen Netzwerk. Die Anfragen und die verarbeiteten Daten werden ausschließlich auf dieser Hardware verarbeitet. Das ist insbesondere dann wichtig, wenn vertrauliche Dokumente verarbeitet werden oder Vorgaben zum Datenschutz und zur Datenhoheit gelten.

ALBERT | AI ist nicht an ein einzelnes Modell gebunden. Sie können lokale Modelle und Modelle von Cloud-Anbietern parallel einrichten und je nach Aufgabe auswählen, zum Beispiel lokale Modelle für sensible Daten und Cloud-Modelle für besonders anspruchsvolle Aufgaben.

Bausteine eines eigenen KI-Servers

Hardware

Der wichtigste Faktor ist der Grafikspeicher (VRAM) der eingesetzten Grafikkarte oder des KI-Systems. Er bestimmt, welche Modelle in welcher Größe und mit welcher Kontextgröße betrieben werden können und wie viele Anfragen gleichzeitig bearbeitet werden. Planen Sie außerdem ausreichend Speicherplatz für die Modelle, eine stabile Netzwerkanbindung sowie Kühlung und Geräuschentwicklung ein.

Sprachmodelle

Für den lokalen Betrieb eignen sich Open-Weight-Modelle, die Sie herunterladen und auf eigener Hardware betreiben dürfen. Wählen Sie das Modell nach Aufgabe, Sprachqualität, benötigter Kontextgröße und verfügbarem Grafikspeicher. Prüfen Sie außerdem die Lizenzbedingungen des jeweiligen Modells.

Inferenz-Server

Das Modell wird über einen Inferenz-Server bereitgestellt, der eine Schnittstelle für ALBERT | AI anbietet. Verbreitet sind zum Beispiel Ollama, das sich einfach installieren und bedienen lässt, und vLLM, das sich besonders für viele parallele Anfragen eignet. Welcher Server für Ihren Einsatz geeignet ist, hängt von Hardware, Anzahl der Benutzer und Betriebsaufwand ab. Erfahrungen und Vergleiche finden Sie in den Blog-Artikeln.

Kontextgröße, Spracherkennung und Dokumentenerkennung

Lokale KI in ALBERT | AI verwenden

Nachdem der KI-Server im Netzwerk erreichbar ist, richten Sie ihn in ALBERT | AI ein. Beachten Sie dabei, dass der Server aus dem Netzwerk von agorum core erreichbar sein muss, gegebenenfalls sind Ports freizugeben. Das Vorgehen beschreibt KI-Voreinstellungen einrichten.

Aktuelle Blog-Artikel zu lokaler KI

Die folgenden Blog-Artikel auf agorum.com beschreiben aktuelle Erfahrungen, Messwerte und Empfehlungen zum Betrieb lokaler KI: