Intelligence per Watt: Gelieferte Intelligenz und Ressourcenverbrauch

Saad-Falcon et al. (2025)

Aktuell wird weltweit sehr viel Geld für große Rechenzentren eingesammelt und investiert. Die Story ist, dass große KI-Modelle sehr große Rechenkapazitäten benötigen, um riesige Datenmengen zu bearbeiten und um schnelle Antwortzeiten für immer mehr Nutzer zu liefern. Ganz im Sinne von je größer umso besser. Ob diese Story ein gutes Ende haben wird bleibt abzuwarten. Siehe dazu Künstliche Intelligenz: Enormer Ressourcenverbrauch großer KI-Modelle.

Parallel dazu gibt es eine Entwicklung, die auf dezentrale Systeme setzt und die Rechenleistung von vielen lokalen Hardwarestrukturen nutzen möchte. Solche lokalen KI-Anwendungen (Local AI) werden nachweislich immer beliebter. Das hat mehrere Gründe: (1) Einerseits sind es natürlich auch die immensen Kosten, die gerade Kleine und Mittelständische Unternehmen (KMU) kaum mehr kalkulieren können (Stichwort: Abrechnung in Token), (2) Datensicherheit und Digitale Souveränität, (3) Zukunftsfähigkeit eines eigenen KI-Systems, das auf Open Source AI setzt.

Nun kann man anführen, dass die lokal ausführbaren Open Weight und Open Source KI-Modelle nicht so leistungsfähig sind, im Vergleich zu den proprietären KI-Modellen. Dass dem nicht mehr so ist, zeigt unter anderem der AI Report 2026 der Stanford University. Siehe dazu auch Anteil US amerikanischer KI-Modelle geht weltweit zugunsten von Open Source AI zurück.

Weiterhin gibt es einen Trend, spezialisierte (kleine) KI-Modelle in einem Router je nach Anwendungsfall zu kombinieren. Nicht zuletzt reichen lokale KI-Modelle für Standardanfragen oftmals völlig aus.

Local LMs are capable and improving rapidly: Local LMs can accurately respond to 88.7% of single-turn chat and reasoning queries, with accuracy improving 3.1× from 2023-2025“ (Saad-Falcon et al., 2025).

Ein weiterer interessanter Aspekt ist, dass die Forscher um Saad-Falcon eine neue Messgröße vorschlagen: Intelligence per Watt (IPW). Es geht um den Zusammenhang zwischen „gelieferter Intelligenz“ und den dafür benötigten Ressourcenverbrauch.

intelligence-per-watt—a metric that quantifies how effectively inference systems convert energy into useful computation.

IPW = (mean accuracy across tasks) / (mean power draw during inference)“

Saad-Falcon et al. (2025): Intelligence Per Watt: A Study of Local Intelligence Efficiency

Die angegebene Studie zeigt deutlich den Vorteil auf, lokale KI anzuwenden, wenn es um die Kenngröße Intelligence per Watt geht. Wir sind der Auffassung, dass es in Zukunft mit Open Source AI und LocalAI möglich sein wird, mehr Digitale Souveränität in Europa zu erreichen, und innovativer zu werden.

Auf der MCP 2026 (16.-19.09.2026, Balatonfüred, Ungarn) gehe ich auf diese Zusammenhänge in zwei Paper ein:

Digital Sovereignty and Open-Source AI: The European Way for Innovative SMEs

Open-Source AI for Open User Innovation: Designing a Personal Fabrication Framework

Lokale Nutzung von KI-Modellen mit der LLama.cpp – App

https://llama-cpp.com/

Immer mehr Prívatpersonen, Kleinstunternehmen, Kleine und Mittlere Unternehmen (KMU), Non-Profit Organisationen etc. erkennen die Möglichkeiten, KI-Modelle lokal auf ihrer Hardware zu nutzen. Dazu gibt es verschiedene Open Source Software.

Wie Sie in vielen unserer Beiträge lesen konnten, haben wir uns Ollama App entschiedenen, da wir eine einfache Integration der in Ollama installierten KI-Modelle in Langflow sehen. Langflow wiederum bietet die Möglichkeit, Workflows, oder KI-Agenten mit Drag & Drop zu erstellen.

Eine Alternative zu Ollama ist u.a. LLama.cpp (Abbildung) – beides natürlich Open Source Software und als App auf der lokalen Hardware installierbar.

„You do not need to pay to use Llama.cpp or buy a subscription. It is completely free, open-source, constantly updated and available under the “MIT” license“ (LLama.cpp-Website)

Wie bei allen Vergleichen haben beide Vorteile und Nachteile. Es kommt darauf an, welche Schwerpunkte Sie bei der Nutzung von lokalen KI-Modellen haben. Bei den vielen im Netz zu findenden Vergleichen habe ich manchmal den Eindruck, dass Äpfel mit Birnen verglichen werden, da Ollama und LLama.ccp unterschiedlichen Kategorien angehören.

Testen Sie die Apps einfach einmal aus und schauen Sie, welche besser zu Ihren Anforderungen passt.