Um das 30-fache unterscheiden sich je nach KI-Modell die Tokens – und damit die Kosten

https://longjubai.github.io/agent_token_consumption/

Wenn es um die Wirtschaftlichkeit von KI-Agenten geht, kommt es bei den Token-Kosten oftmals zu regelrechten Abrechnungsschocks. In ihrem Paper

Bai et al (2026): How Do Coding Agents Spend Your Money? Analyzing and Predicting Token Consumptions in Agentic Coding Tasks | https://arxiv.org/abs/2604.22750

haben die Forscher genauer untersucht, wie die Coding Agenten das Geld der Nutzer „ausgeben“. Ich möchte an dieser Stelle nur eine der vielen Erkenntnisse aus dem Paper wiedergeben: Es gibt wohl bei dem gleichen Task Unterschiede bis zum 30-fachen bei der Anzahl der Tokens – und damit der Kosten.

„(…) token usage is highly variable and inherently stochastic: runs on the same task can differ by up to 30× in total tokens, and higher token usage does not translate into higher accuracy; instead, accuracy often peaks at intermediate cost and saturates at higher
costs“ (Bai et al. 2026).

Gerade Kleine und Mittlere Unternehmen (KMU) mit ihren doch eher begrenzten Ressourcen sollten hier aufpassen.

Interessanterweise haben die Forscher zu ihrem ausführlichen Paper auch eine Website mit den wichtigsten Erkenntnissen erstellt. Dort ist wiederum ein kleines Spiel integriert, bei dem man anhand einer Problemstellung die voraussichtlich benötigten Token und die damit verbundenen Kosten schätzen kann – spannend.

Wir empfehlen auch aus diesen Gründen eher Local AI – also lokal ausgeführte Open Source KI-Modelle zu nutzen. Das kann zusammen mit einer Microsoft Alternative wie Nextcloud auf einem eigenen Server geschehen, oder als Edge Computing sogar mit Hilfe geeigneter Apps wie Ollama und Langflow, auf dem eigenen Laptop. In unserem Blog finden Se dazu viele Beiträge.

Solche Ansätze können die Innovationsfähigkeit gerade von KMU unterstützen, indem sie ein unternehmensspezifisches KI-System nutzen, bei dem alle generierten Daten beim Unternehmen bleiben – ganz im Sinne einer Digitalen Souveränität.

Wie so etwas für innovative Kleine und Mittlere Unternehmen (KMU) in Europa in Bezug auf Künstliche Intelligenz aussehen kann, stelle ich in zwei Paper auf der MCP-Konferenz 2026, vom 16.-19.09.2026 in Balatonfüred (Ungarn) vor:

Digital Sovereignty and Open-Source AI: The European Way for Innovative SMEs

Open-Source AI for Open User Innovation: Designing a Personal Fabrication Framework

KI-Modelle sind selten das Rendite-Problem

Image by un-perfekt from Pixabay

In der aktuellen Situation um KI-Modelle und KI-Agenten wird häufig argumentiert, dass die Abrechnung in Token ein großes Problem darstellt. Dabei ist es am Anfang oft unklar, welche Kosten bei der Nutzung von KI-Systemen wirklich entstehen. Siehe dazu auch Wirtschaftlichkeit von KI-Agenten: Warum kommt es bei den Token-Kosten oft zu regelrechten Abrechnungsschocks?

Solche technologischen Aspekte überlagern dabei die Kosten, die in der Organisation und bei den Mitarbeitern entstehen. In einem Gesamtsystem Mensch, Organisation und Technologie (MOT-Modell) ist es wichtig, einzelne Elemente sinnvoll auf das eigene Geschäftsmodell und die dazu erforderlichen Geschäftsprozesse abzustimmen.

Gerade Kleine und Mittelständische Unternehmen (KMU) mit ihren begrenzten Ressourcen sollten darauf achten, das gesamte KI-System auf ihre Organisation abzustimmen und nicht immer nur dem nächsten technologischen Hype hinterherzujagen. In einem lesenswerten Artikel stellt M. Kramer ausführlich dar, dass dieser rein Tech-getriebene Ansatz nicht wirtschaftlich ist.

„None of this lessens the technology. Models will keep improving, and that progress matters. But the next wave of AI value will come less from models becoming more capable and more from organisations becoming more capable of using them. Capability sets what is possible. The operating model decides how much of that possibility the business ever sees“ Kramer, M. (2026) Analyst Insights: The AI ROI Problem Is Rarely the Model.

Wie man in einem mittelständischen Unternehmen vorgehen kann, habe ich in dem Blogbeitrag KI-System im Mittelstand: Von der Wissensbilanz lernen grob dargestellt.

Wirtschaftlichkeit von KI-Agenten: Warum kommt es bei den Token-Kosten oft zu regelrechten Abrechnungsschocks?

Bei der Nutzung von Künstlicher Intelligenz kommt es immer stärker darauf an, KI-Agenten sinnvoll und effizient einzusetzen. Dabei geht es oft auch darum zu wissen, welche Token-Kosten bei der Nutzung von KI-Agenten anfallen.

Bei der Abrechnung auf Basis von Tokens geht es um die Menge verarbeiteter Textbausteine (Tokens), die sich Modelle wie GPT-4 oder Gemini gut bezahlen lassen. Dabei kommt es allerdings oftmals zu starken Schwankungen, und zu regelrechten Abrechnungsschocks.

In einer Studie haben Forscher nun untersucht, inwiefern KI-Agenten bei Codierungs-Aufgaben (coding tasks) in der Lage sind, vor Start des Tasks die Kosten für die benötigten Tokens vorherzusagen. Immerhin wäre eine gut abschätzbare, und somit im voraus gut planbare, Anzahl von Tokens für die wirtschaftliche Bewertung von coding tasks von großer Bedeutung. Eine aktuelle Studie belegt allerdings sehr ausführlich, dass KI-Agenten dazu nicht in der Lage sind:

Agents are not capable of predicting their own token costs. This is the fundamental bottleneck for result-based pricing for agents.  You can’t really price the agent well unless you can figure out the cost, but now you only see the token costs after everything is done” (Bai, L. et al. (2026) https://arxiv.org/abs/2604.22750).

Man wird also erst nachdem alles erledigt ist wissen, was alles gekostet hat (in Token-Kosten). In dem genannten Paper sind noch viele weitere Detail zu finden.

Gerade Kleine und Mittlere Unternehmen (KMU), die stark auf ihre Kosten achten müssen, können die Ergebnisse der Studie eine gute Basis für die wirtschaftliche Nutzung von KI-Agenten sein.