Management Summary: Das nimmst du aus diesem Webinar mit

  • KI-Kosten entstehen pro Token, nicht pro Lizenz: Parallel laufende Agenten, lange Kontexte, die Modellwahl und unbemerkte Endlosschleifen treiben die Rechnung.
  • Ausreißer sind ein Muster: Bei Amazon, bei Uber und im eigenen Haus wurden die Kosten erst auf der Rechnung sichtbar.
  • Kontrollmodell in 5 Schritten: Transparenz, Zuordnung, Anomalie, Warnung und Entscheidung machen KI-Kosten steuerbar.
  • Kontrolle heißt früh sehen: Statt eines pauschalen Kostendeckels entscheidest du bewusst über den einen Prozess, der aus dem Ruder läuft.
  • Kosten je Geschäftsprozess: Die KI-Nutzungs- und Kostenanalyse in ALBERT | AI zeigt Kosten nach Zeit, Modell, Prozess und User, auf Wunsch pseudonymisiert.
  • Reale Praxiszahl: Ein vollautomatischer Ablauf von der Kundenanfrage per E-Mail bis zum fertigen Angebot kostete in der Live-Demo 1,24 Euro.
  • Zwei Wege zum Sprachmodell: Abrechnung nach Verbrauch über die API oder planbar im Abo über einen externen Coding Agent, in beiden Fällen im Rechtekontext.
  • Kosten immer gegen Nutzen: Wer nur den Tokenpreis optimiert, verliert den Prozess aus dem Blick.

KI-Kosten im Unternehmen lassen sich steuern, sobald du sie einem Geschäftsprozess und einer verantwortlichen Person zuordnest und Abweichungen früh erkennst. Genau darum ging es am 22. September 2026 im vierten Teil der Webinar-Reihe „KI im Mittelstand 2026“. Annkatrin Göpfert, Leitung der agorum® Academy, moderierte. Oliver Schulze, Geschäftsführer der agorum® Software GmbH, zeigte das Kontrollmodell live an einem Demosystem und mit Zahlen aus dem eigenen Produktivbetrieb.

Dieser Artikel fasst die zentralen Erkenntnisse zusammen. Alle Zahlen und Beispiele stammen aus dem Webinar oder sind mit Quelle verlinkt. Den dritten Teil zum richtigen Prompten und zum Weg zum KI-Agenten kannst du jederzeit nachlesen.

Warum laufen KI-Kosten im Unternehmen aus dem Ruder?

KI-Kosten laufen aus dem Ruder, weil ein KI-Agent sich anders verhält als ein Arbeitsplatz mit fester Lizenz. Er verbraucht Tokens, läuft parallel und arbeitet oft eigenständig im Hintergrund weiter. Abgerechnet wird in der Regel je eine Million Tokens, getrennt nach Input- und Output-Tokens. Oliver Schulze nannte vier Gründe, warum die Kosten gerade jetzt steigen.

  1. Parallelität: Arbeiten mehrere Agenten gleichzeitig an einer Aufgabe, summieren sich die Kosten, bevor ein Mensch eingreifen kann.
  2. Lange Kontexte: Werden Anfragen mit langen Gesprächsverläufen wiederholt oder weitergeführt, steigt der Tokenverbrauch je Vorgang deutlich.
  3. Modellwahl: Jedes Modell hat seinen eigenen Preis. Die Wahl des Modells ist damit eine wirtschaftliche Entscheidung und nicht nur eine technische.
  4. Endlosschleifen: Ein technischer Fehler startet einen Prozess unbemerkt immer wieder neu, und die Kosten laufen die ganze Zeit weiter.

Die entscheidende Frage lautet deshalb nicht, ob dein Unternehmen KI nutzt. Sie lautet, ob du heute siehst, welcher User, welches Modell und welcher Geschäftsprozess deine Kosten verursacht, und zwar bevor die Rechnung kommt.

Aus dem Cloud-Bereich kennst du dafür das Prinzip FinOps. FinOps bezeichnet die gemeinsame Steuerung von Cloud-Kosten durch Technik, Finanzen und Fachbereiche. Die FinOps Foundation führt KI inzwischen als eigenes Themenfeld, FinOps for AI. Im Webinar übertrug Oliver Schulze dieses Prinzip auf KI-Tokens und Agentenprozesse.

Welche Fälle zeigen, dass KI-Kosten kein Einzelfall sind?

Die Fälle aus dem Webinar zeigen alle dasselbe Muster. Die Kosten wurden erst sichtbar, als die Rechnung kam.

  • Amazon: Ein Agent sollte Autorendaten mit Produktlisten abgleichen. Ein Fehler im Code ließ ihn immer wieder von vorn beginnen. Das Projekt lag 860 Prozent über dem Budget und fiel erst nach fünf Monaten auf. Tom's Hardware beziffert die Kosten auf 1,8 Millionen US-Dollar.
  • Uber: Eine einzige Programmiersitzung von zwei Stunden kostete 1.200 US-Dollar, und das KI-Budget für 2026 war nach vier Monaten aufgebraucht. Intensive Anwender kamen auf 500 bis 2.000 US-Dollar je Monat, wie TechCrunch berichtet.
  • SAP: Laut Oliver Schulze vergibt SAP inzwischen ein KI-Budget je Rolle, von 100 bis 5.000 Euro im Monat. Kostenkontrolle bei KI ist dort ein eigener Prozess.
  • agorum® selbst: Eine Bildverschlagwortung lief einen ganzen Tag in einer Endlosschleife aus Verarbeiten, Abstürzen und Neustarten. Technisch war das unauffällig, es gab keinen Alarm. Der Tag kostete 1.400 Euro statt der üblichen rund 80 Euro und fiel erst auf der Rechnung des KI-Anbieters auf.

Aus dem eigenen Fall ist die Kostenkontrolle als Erweiterung der ALBERT | AI Suite entstanden. Sie ist die Antwort auf einen eigenen Fehler und keine Idee aus dem Marketing. Inzwischen verursacht die Bildverschlagwortung gar keine Modellkosten mehr, weil sie über die lokale KI läuft.

Geöffneter Sicherungskasten mit einer leuchtenden Warnlampe als Bild für getrennte Kostenkreise bei KI-Kosten im Unternehmen KI-generiert · ALBERT | AI

Wie behältst du KI-Kosten mit 5 Schritten unter Kontrolle?

Mit fünf aufeinander aufbauenden Schritten machst du KI-Kosten steuerbar. Zusammen ergeben sie ein Kontrollmodell, das Oliver Schulze im Webinar vorstellte. Kontrolle heißt dabei nicht stoppen. Kontrolle heißt früh sehen und bewusst entscheiden.

  1. Transparenz: Du siehst die Kosten überhaupt erst einmal, nach Zeit, nach User, nach Modell und nach System.
  2. Zuordnung: Die Kosten hängen an einem konkreten Geschäftsprozess und einer Verantwortung, nicht an einem API-Schlüssel des KI-Anbieters.
  3. Anomalie: Abweichungen vom Durchschnitt der letzten 30 Tage werden früh erkannt.
  4. Warnung: Die verantwortliche Person wird automatisch informiert, zum Beispiel per E-Mail oder per Notiz.
  5. Entscheidung: Du legst fest, was mit dem auffälligen Prozess passiert. Er läuft weiter, das Modell wird gewechselt oder der Prozess wird korrigiert.

Das Prinzip Sicherungskasten

Oliver Schulze verglich das Modell mit einem Sicherungskasten. Darin gibt es mehrere Stromkreise und nicht nur einen Hauptschalter, der alles abschaltet. System, User, Modelle und Prozesse sind jeweils eigene Kreise. Wird einer davon auffällig, leuchtet nur dort eine Warnlampe, und der Rest des Hauses läuft normal weiter.

Die zweite Schutzebene beim Anbieter

Zusätzlich empfahl Oliver Schulze die Schwellenwerte, die KI-Anbieter in der Regel anbieten, etwa eine E-Mail bei 1.000 Euro und eine weitere bei 5.000 Euro im Monat. Diese Grenze greift allerdings für alle Prozesse gleichzeitig. Deshalb bleibt die frühe Entscheidung über den einzelnen Prozess der wichtigere Hebel.

Warum kein automatischer Kostendeckel?

Ein pauschaler Stopp mitten in einem wichtigen Vorgang richtet mehr Schaden an als die Mehrkosten. Oliver Schulze nannte als Beispiel die Freigabe einer termingebundenen Lieferung, die abbricht, nur weil ein anderer Prozess an eine Grenze stößt. Stattdessen werden Transparenz, Anomalie-Erkennung, eine interne Warnung ab einer selbst festgelegten Betragsgrenze, die Eskalation per E-Mail oder Notiz, die Grenzen beim Anbieter und die bewusste Entscheidung kombiniert.

Reicht die Verbrauchsanzeige des KI-Anbieters nicht aus?

Die Konsole des KI-Anbieters zeigt den Verbrauch, in der Regel je API-Schlüssel oder je Modell. Sie zeigt aber nicht, welcher Geschäftsprozess dahintersteckt, wer dafür verantwortlich ist und was am Ende herausgekommen ist. An der Grenze des Anbieters endet der Überblick. Diese Frage kommt laut Oliver Schulze in jedem Gespräch, deshalb beantwortete er sie im Webinar gleich selbst.

Für die Steuerung von KI-Kosten im Unternehmen brauchst du deshalb die Zuordnung dort, wo die Prozesse laufen. Das ist der Unterschied zwischen einer Verbrauchsanzeige und einer Kostenkontrolle.

Zwei Fachkräfte prüfen am Bildschirm ein Balkendiagramm mit einem auffällig hohen Tageswert der KI-Kosten KI-generiert · ALBERT | AI

Was zeigt die KI-Nutzungs- und Kostenanalyse in ALBERT | AI?

Die KI-Nutzungs- und Kostenanalyse zeigt dir, welcher KI-Prozess, welches Modell und welcher User welche Kosten verursacht. agorum® setzt sie selbst produktiv ein und protokolliert seit Januar 2026 sämtliche KI-Prozesse. Darin stecken inzwischen 425.000 einzelne KI-Läufe aus rund 50 agentischen Prozessen, von der Bildverschlagwortung bis zu automatisierten Vertriebsprozessen. Im Webinar lief die Vorführung auf einem Demosystem mit Demodaten.

Kosten nach Zeit, Modell, Prozess und User

Das Dashboard zeigt die Gesamtkosten je Tag, bei größeren Zeiträumen auch je Woche, Monat oder Jahr. Du kannst die Kosten nach KI-Modell aufschlüsseln, etwa Claude Opus, Claude Sonnet oder Haiku. Besonders aufschlussreich ist die Sicht auf das Preset, denn in der Regel hat jeder Geschäftsprozess sein eigenes Preset. In der Demo kam die Bildverschlagwortung im Gesamtzeitraum auf 166 Euro und der Rechnungsprozess auf 199 Euro. Die Kosten lassen sich bis auf einzelne User herunterbrechen. Wer das nicht darf oder nicht möchte, nutzt die Pseudonymisierung, die sich auch nachträglich auf den vorhandenen Bestand anwenden lässt.

Der Anomalie-Check meldet sich von selbst

Damit niemand dauernd auf das Dashboard schauen muss, gibt es den Anomalie-Check. Seine Regel beschreibst du in einem ganz normalen Prompt. Im Beispiel sollte er melden, wenn die Tageskosten mehr als 50 Prozent vom Durchschnitt der letzten 30 Tage abweichen und dabei über 150 Euro liegen. In einem zweiten Prompt legst du fest, wie du informiert wirst, im Webinar per E-Mail und per Notiz an Oliver Schulze. Die Notiz kam live. Die Tageskosten lagen bei 172 Euro und damit rund 67 Prozent über dem Durchschnitt, verursacht vom Preset für die Bildverschlagwortung. Ein Blick in die Liste zeigte 413 Läufe an diesem Tag, in denen immer wieder dieselben Bilder verarbeitet wurden.

Aktivieren statt programmieren

Die Analyse ist Bestandteil der ALBERT | AI Suite. Du aktivierst sie und trägst im Preset die Preise des Modells ein, also die Kosten für Input- und Output-Tokens je eine Million sowie für Cache lesen und Cache schreiben. Ab dann zählt das System automatisch mit, egal ob über einen Chat in ALBERT | AI oder über einen KI-Prozess im Hintergrund. Die LLM-Kosten sind Schätzwerte, weil Anbieter teils gestaffelte Preise haben. Für eine Abrechnung taugen sie nicht, die Tendenz zeigen sie zuverlässig. Getrennt davon siehst du die Kosten der ALBERT | AI Output-Tokens. Veröffentlicht werden sollte die Funktion laut Webinar noch in der Woche des Webinars mit einer Aktualisierung der ALBERT | AI Suite über den Plugin-Manager. Als Mindestvoraussetzung nannte Oliver Schulze agorum core 11.13.

Was kostet ein KI-Agent pro Vorgang?

Ein kompletter agentischer Vorgang kostete in der Live-Demo 1,24 Euro, eine einfache Rechercheanfrage 19 Cent. Oliver Schulze zeigte bewusst zuerst, was du gewinnst, und danach, was es kostet.

Die Rechercheanfrage für 19 Cent

Der KI-Agent sollte in agorum core pro herausfinden, in welchen Angeboten und an welche Firmen Briefumschläge angeboten wurden. Er suchte die Angebote, analysierte die gefundenen Dokumente und listete die Fundstellen mit den passenden Absätzen auf. In der Kostenanalyse stand diese Anfrage samt Titelgenerierung mit 19 Cent.

Von der E-Mail zum Angebot für 1,24 Euro

Im zweiten Beispiel landete die E-Mail eines Kunden im Maileingang, der 20 Original-Tonerkartuschen anfragte. Ab da lief alles automatisch im Hintergrund.

  • Der KI-Agent legte den Kunden an, den es noch nicht gab, und startete einen Vorgang.
  • Er fragte das ERP-System ab und stellte fest, dass nur 18 Stück auf Lager waren.
  • Er erstellte ein Angebot mit dem Preis aus dem ERP und einen E-Mail-Entwurf mit dem Hinweis, dass 18 Stück kurzfristig lieferbar sind und 2 Stück nachgeliefert werden.
  • Über NORA | 360° entstanden Aufgaben für den Vertrieb und für den Einkauf, der die fehlenden Kartuschen nachbestellt.

Die gesamte Kette kostete 1,24 Euro, und in der Kostenanalyse ließ sich jeder einzelne Schritt mit seinen Kosten nachvollziehen.

Rechtekontext und Protokoll als Voraussetzung

An einem Rechnungsbeispiel zeigte Oliver Schulze, warum der Rechtekontext der wichtigste Punkt ist. Der Einkauf sieht Beleg, Bestellung, Vertrag und Preise, ein Werkstudent sieht denselben Vorgang ohne die Preise. Die KI darf nie mehr sehen als die Person, für die sie arbeitet. Am Ende steht die Protokollierung, welches Modell wann aus welcher Quelle für welche Person gearbeitet hat, auch noch Monate später prüfbar. Wie ALBERT | AI im Rechtekontext arbeitet, liest du in einem eigenen Beitrag.

Drei Kollegen bewerten am Besprechungstisch einen Prozessablauf nach Kosten und Nutzen des KI-Einsatzes KI-generiert · ALBERT | AI

Wie rechnest du Kosten und Nutzen von KI gegeneinander?

Zu jeder Kostenperspektive gehört eine Nutzenperspektive. Sonst optimierst du am Ende nur den Tokenpreis und verlierst den Prozess. Oliver Schulze stellte drei Paare gegenüber.

  • Kosten pro Prozesslauf gegen die eingesparte Bearbeitungszeit.
  • Kosten pro Modell gegen Qualität und Nacharbeit. Ein günstiges Modell, dessen Fehler du dreimal so lange korrigierst, ist laut Oliver Schulze geschenkt noch zu teuer.
  • Kosten pro Ergebnis gegen die gesamte Durchlaufzeit.

Welche Zahlen gemessen werden

agorum® misst im Produktivbetrieb von ALBERT | AI 2,5 Stunden Zeitgewinn je Person und Tag, 98 Prozent weniger manuelle Erfassung und Freigaben, die 80 Prozent schneller laufen. Der Break-even liegt bei 8 bis 12 Monaten. Beim Kunden esa Elektroschaltanlagen sind daraus rund 35.000 Euro Personalkosten im Jahr geworden, und die Bearbeitungszeit sank von 5 bis 8 Tagen auf 2 bis 3 Tage.

Was souverän bleiben muss

Die zweite Hälfte des Bildes ist die Souveränität. Dein Wissen bleibt im Unternehmen nutzbar und nachvollziehbar, statt in Chatverläufen öffentlicher Systeme zu verschwinden. Datenflüsse, Berechtigungen und Protokolle bleiben nach DSGVO und GoBD prüfbar. Die Archivierung in agorum core pro prüft jedes Jahr ein unabhängiger Wirtschaftsprüfer nach IDW PS 880. Und die Wahl des Anbieters bleibt frei, denn Multi-LLM heißt, dass du das Modell jederzeit wechselst, ohne Wissen oder Daten zu verlieren und ohne neues Projekt. Die Daten liegen in deiner eigenen Infrastruktur, und das ist bei einer datensouveränen KI-Business-Plattform wie agorum core pro eine Architekturentscheidung und kein Versprechen im Vertrag.

Rack-Server mit leistungsstarker Grafikkarte für den Betrieb eines lokalen KI-Modells im eigenen Serverraum KI-generiert · ALBERT | AI

API oder Abo: Wie bindest du das Sprachmodell wirtschaftlich an?

Es gibt zwei Wege, und beide führen zu ALBERT | AI in agorum core pro. Welcher sich rechnet, hängt davon ab, wie intensiv eine Person mit KI arbeitet.

Weg A: Anbindung per API

ALBERT | AI erreicht über die API ein Cloud-Modell oder ein lokales Modell im eigenen Haus, auch beides parallel. Beim Cloud-Modell zahlst du je Nutzung, also je eine Million Tokens, und siehst den Verbrauch bis auf Modell und Vorgang. Beim lokalen Modell entstehen keine Modellkosten, dafür schaffst du die Hardware einmalig an, und die Daten verlassen dein Haus nicht. Du hast das vollständige Protokoll aller Chats in agorum core pro, die Grundlage für die Kostenzuordnung je Geschäftsprozess und für die Revision.

Weg B: Externer Coding Agent im Monatsabo

Der zweite Weg läuft über einen externen Coding Agent wie Claude Code, Codex oder OpenCode. Das Sprachmodell wird dann über ein Abo zu einem festen Monatspreis mit bestimmten Kontingenten abgerechnet. Bei hoher Nutzung ist das planbarer. Du arbeitest auch hier in agorum core pro, im Rechtekontext, mit deinen Skills, deinem Wissen und deinen Arbeitsprotokollen. Der einzige Unterschied ist, dass das Chatprotokoll selbst bei Weg B nicht vorliegt. Die Kosten der ALBERT | AI Tokens erscheinen weiterhin in der Kostenanalyse.

Welcher Weg für wen?

Weg B lohnt sich laut Oliver Schulze für Power-User, bei denen wirklich viel läuft, etwa in der Softwareentwicklung oder im Marketing. Für die Kollegin, die zweimal am Tag eine Frage stellt, und für Automatismen im Hintergrund ist Weg A der bessere. Seine Empfehlung fällt dreifach aus, je Anwendungsfall nach dem Schutzbedarf der Daten, je User nach der Arbeitsweise und je Aufgabe nach dem Modell mit dem besten Ergebnis. Beide Wege lassen sich parallel nutzen.

Wie agorum® lokale KI betreibt

Auf eine Frage aus dem Publikum beschrieb Oliver Schulze die eigene Hardware. Eine NVIDIA RTX PRO 6000 Blackwell mit 96 GB VRAM betreibt parallel ein Gemma 4 26B Modell, Whisper Large v3 und PaddleOCR. Die Hardware hat agorum® selbst installiert und eingerichtet, mit der Möglichkeit, weitere Grafikkarten nachzurüsten.

Welche 5 Sätze solltest du nach dem Webinar sagen können?

Oliver Schulze gab fünf Sätze mit, an denen du deinen Stand bei den KI-Kosten im Unternehmen prüfst. Zögerst du bei einem davon, ist genau dieser Satz dein Thema für die nächsten Wochen.

  1. Ich kann unsere KI-Kosten einem Geschäftsprozess und einer Verantwortung zuordnen.
  2. Ich sehe Abweichungen in Echtzeit und nicht erst auf der Rechnung.
  3. Ich weiß, welche User, welche Modelle und welche Agenten die größten Kosten verursachen.
  4. Unsere Warnschwellen, die Anbietergrenzen und die Verantwortlichkeiten sind aufeinander abgestimmt.
  5. Für jeden priorisierten KI-Prozess bewerten wir Kosten und Nutzen gemeinsam.

Wer Teil 2 der Webinar-Reihe noch nicht gesehen hat, holt dort die Grundlagen zur Auswahl der richtigen Prozesse nach.

Webinar-Aufzeichnung: KI-Kosten im Unternehmen sichtbar machen und steuern

Webinar-Aufzeichnung KI souverän skalieren mit Oliver Schulze: KI-Kosten im Unternehmen, Daten und Prozesse im Griff KI-generiert · ALBERT | AI

FAQ Häufig gestellte Fragen zu KI-Kosten im Unternehmen

Zwei Geschäftsleute sitzen auf Sitzwürfeln in einem modernen Büro und besprechen sich, während eine dritte Person im Vordergrund zuhört.

Fazit: Dein nächster Schritt: KI-Kosten im Unternehmen von Anfang an planbar machen

Das Webinar hat gezeigt, dass KI-Kosten im Unternehmen steuerbar werden, sobald du sie einem Prozess und einer Verantwortung zuordnest, Abweichungen früh erkennst und bewusst entscheidest. Die Rechnung des KI-Anbieters bestätigt dann nur noch, was du längst gesehen hast.

Drei Wege, jetzt zu starten

  1. Die 5 Sätze prüfen: Gehe die fünf Sätze aus dem Webinar durch und nimm dir den Satz vor, bei dem du zögerst.
  2. Die Aufzeichnung ansehen: Die Live-Demo der KI-Nutzungs- und Kostenanalyse zeigt, wie ein Ausreißer in wenigen Minuten auffällt.
  3. Gespräch vereinbaren: 45 Minuten, kostenfrei und ausdrücklich kein Produkttermin. Gemeinsam schaust du dir an, welche deiner Abläufe sich für KI eignen, welche Datenbasis dafür nötig ist und wie du von Anfang an siehst, was es kostet. Lohnt es sich bei dir noch nicht, sagen wir dir das direkt.

Wer KI heute mit einer klaren Kostenzuordnung einführt, gewinnt Zeit zurück und behält die volle Kontrolle über Daten, Kosten und Ergebnisse.

Bitmi