Intelligence per Watt: Gelieferte Intelligenz und Ressourcenverbrauch

Saad-Falcon et al. (2025)

Aktuell wird weltweit sehr viel Geld für große Rechenzentren eingesammelt und investiert. Die Story ist, dass große KI-Modelle sehr große Rechenkapazitäten benötigen, um riesige Datenmengen zu bearbeiten und um schnelle Antwortzeiten für immer mehr Nutzer zu liefern. Ganz im Sinne von je größer umso besser. Ob diese Story ein gutes Ende haben wird bleibt abzuwarten. Siehe dazu Künstliche Intelligenz: Enormer Ressourcenverbrauch großer KI-Modelle.

Parallel dazu gibt es eine Entwicklung, die auf dezentrale Systeme setzt und die Rechenleistung von vielen lokalen Hardwarestrukturen nutzen möchte. Solche lokalen KI-Anwendungen (Local AI) werden nachweislich immer beliebter. Das hat mehrere Gründe: (1) Einerseits sind es natürlich auch die immensen Kosten, die gerade Kleine und Mittelständische Unternehmen (KMU) kaum mehr kalkulieren können (Stichwort: Abrechnung in Token), (2) Datensicherheit und Digitale Souveränität, (3) Zukunftsfähigkeit eines eigenen KI-Systems, das auf Open Source AI setzt.

Nun kann man anführen, dass die lokal ausführbaren Open Weight und Open Source KI-Modelle nicht so leistungsfähig sind, im Vergleich zu den proprietären KI-Modellen. Dass dem nicht mehr so ist, zeigt unter anderem der AI Report 2026 der Stanford University. Siehe dazu auch Anteil US amerikanischer KI-Modelle geht weltweit zugunsten von Open Source AI zurück.

Weiterhin gibt es einen Trend, spezialisierte (kleine) KI-Modelle in einem Router je nach Anwendungsfall zu kombinieren. Nicht zuletzt reichen lokale KI-Modelle für Standardanfragen oftmals völlig aus.

Local LMs are capable and improving rapidly: Local LMs can accurately respond to 88.7% of single-turn chat and reasoning queries, with accuracy improving 3.1× from 2023-2025“ (Saad-Falcon et al., 2025).

Ein weiterer interessanter Aspekt ist, dass die Forscher um Saad-Falcon eine neue Messgröße vorschlagen: Intelligence per Watt (IPW). Es geht um den Zusammenhang zwischen „gelieferter Intelligenz“ und den dafür benötigten Ressourcenverbrauch.

intelligence-per-watt—a metric that quantifies how effectively inference systems convert energy into useful computation.

IPW = (mean accuracy across tasks) / (mean power draw during inference)“

Saad-Falcon et al. (2025): Intelligence Per Watt: A Study of Local Intelligence Efficiency

Die angegebene Studie zeigt deutlich den Vorteil auf, lokale KI anzuwenden, wenn es um die Kenngröße Intelligence per Watt geht. Wir sind der Auffassung, dass es in Zukunft mit Open Source AI und LocalAI möglich sein wird, mehr Digitale Souveränität in Europa zu erreichen, und innovativer zu werden.

Auf der MCP 2026 (16.-19.09.2026, Balatonfüred, Ungarn) gehe ich auf diese Zusammenhänge in zwei Paper ein:

Digital Sovereignty and Open-Source AI: The European Way for Innovative SMEs

Open-Source AI for Open User Innovation: Designing a Personal Fabrication Framework

Lokale Nutzung von KI-Modellen mit der LLama.cpp – App

https://llama-cpp.com/

Immer mehr Prívatpersonen, Kleinstunternehmen, Kleine und Mittlere Unternehmen (KMU), Non-Profit Organisationen etc. erkennen die Möglichkeiten, KI-Modelle lokal auf ihrer Hardware zu nutzen. Dazu gibt es verschiedene Open Source Software.

Wie Sie in vielen unserer Beiträge lesen konnten, haben wir uns Ollama App entschiedenen, da wir eine einfache Integration der in Ollama installierten KI-Modelle in Langflow sehen. Langflow wiederum bietet die Möglichkeit, Workflows, oder KI-Agenten mit Drag & Drop zu erstellen.

Eine Alternative zu Ollama ist u.a. LLama.cpp (Abbildung) – beides natürlich Open Source Software und als App auf der lokalen Hardware installierbar.

„You do not need to pay to use Llama.cpp or buy a subscription. It is completely free, open-source, constantly updated and available under the “MIT” license“ (LLama.cpp-Website)

Wie bei allen Vergleichen haben beide Vorteile und Nachteile. Es kommt darauf an, welche Schwerpunkte Sie bei der Nutzung von lokalen KI-Modellen haben. Bei den vielen im Netz zu findenden Vergleichen habe ich manchmal den Eindruck, dass Äpfel mit Birnen verglichen werden, da Ollama und LLama.ccp unterschiedlichen Kategorien angehören.

Testen Sie die Apps einfach einmal aus und schauen Sie, welche besser zu Ihren Anforderungen passt.

Open Source AI: Ministral 3B auf dem eigenen Laptop nutzen

Screenshot von meiner Ollama App, die auf Ministral 3B als Open Source Ki-Modell zugreift

In verschiedenen Blogbeiträgen hatten wir aufgezeigt, wie in der Nextcloud mit Hilfe von Local AI Open Source KI-Modelle von Mistral AI genutzt werden können. Siehe dazu beispielhaft Digitale Souveränität: Wie kann ein KI-Modell aus LocalAI in den Nextcloud Assistenten eingebunden werden?

Dazu ist es allerdings empfehlenswert, für Local AI nicht den Server zu nutzen, auf dem Nextcloud läuft. Ein weiterer Server ist allerdings gerade für Kleine und Mittlerer Unternehmen (KMU) ein Aufwand, den viele scheuen. Wie kann es also kostengünstiger gehen?

In der Zwischenzeit gibt es von Mistral AI in der Model-Familie Mistral 3 auch das Modell Ministral 3B (inkl. Vergleichstabellen), das mit seiner Leistungsfähigkeit sogar das Modell Mistral 7B übertrifft, weil Ministral 3B sehr kompakt ist und gerade für die Nutzung auf normalen Laptops entwickelt wurde (Edge Computing).

Wie kann man Ministral 3B auf seinem eigenen Laptop nutzen?

(1) Um das Modell bequem zu nutzen, bietet sich die App Ollama an, die Sie zunächst auf Ihrem Laptop installieren.

(2) Nun laden Sie Ministral 3B auf Ihren Laptop herunter. Wenn Sie Windows 11 installiert haben geht das wie folgt: Tastenkombination Windows-Taste + R drücken, cmd in das Textfeld eingeben und mit Enter bestätigen. Mit dem Befehl ollama run ministral-3:3b wird das Modell (3GB) heruntergeladen.

(3) Das KI-Modell können Sie anschließend direkt in der Ollama-Oberfläche in einem Rollfeld auswählen. In der Abbildung sehen das rechts unten mit einem roten Rechteck hervorgehoben.

(4) In meinem Fall habe ich Ministral 3B eine komplexe Frage zu Open User Innovation aus der Perspektive von Eric von Hippel gestellt, die zügig und gut beantwortet wurde.

Die Nutzung eines Open Source KI-Modells (Open Weight Models) auf dem eigenen Laptop bietet für Freelancer oder Kleinen Unternehmen die Möglichkeit, leistungsfähige KI-Modelle auf Ihrer eigenen Infrastruktur ohne zusätzliche Kosten zu nutzen.

Gleichzeitig ist Ministral 3B ein Modell, dass auf dem Open Source Gedanken beruht, europäische KI- und Datenschutz- Standards beachtet und somit einen wichtigen Schritt in Richtung der eigenen Digitalen Souveränität aufzeigt.

Auf der MCP 2026 (16.-19.09.2026, Balatonfüred, Ungarn) gehe ich auf diese Zusammenhänge in zwei Paper ein:

Digital Sovereignty and Open-Source AI: The European Way for Innovative SMEs

Open-Source AI for Open User Innovation: Designing a Personal Fabrication Framework