KI-Sprachmodelle können nicht zuverlässig zwischen Überzeugungen einerseits und Wissen sowie Fakten andererseits unterscheiden

Image by SAMUEL GABRIEL from Pixabay

Es ist immer wieder erstaunlich, was wissenschaftliche Studien so ans Tageslicht bringen. Diesmal geht es darum, ob KI-Modelle gut zwischen dem unterscheiden können, was bekannt ist, und dem, was lediglich geglaubt wird. Dazu habe ich folgendes gefunden:

Die untersuchten Sprachmodelle können nicht zuverlässig zwischen Überzeugungen einerseits und Wissen sowie Fakten andererseits unterscheiden.
Quelle: Suzgun, M., Gur, T., Bianchi, F. et al. Language models cannot reliably distinguish belief from knowledge and fact. Nat Mach Intell 7, 1780–1790 (2025). https://doi.org/10.1038/s42256-025-01113-8

Das kann wiederum in sensiblen Bereichen schwerwiegende Auswirkungen haben. Gerade wenn es um gesundheitliche oder auch rechtliche Fragen geht:

„The distinction between knowledge and belief is important in practice. For example, a model used to support a medical diagnosis based on a patient’s mistaken belief, as opposed to an established fact, could reinforce an inaccurate diagnosis and treatment plan. In a legal setting, a model summarizing testimony that cannot tell the difference between what a witness believes and what is known could misrepresent evidence“ (Stanford University, AI Report 2026).

Es ist gut, wenn wir weiterhin positiv kritisch gegenüber Künstlicher Intelligenz bleiben und darauf bestehen, dass KI-Systeme transparent und nachvollziehbar sind. Die aktuellen proprietären KI-Modelle bieten das nicht, und sollten daher – wenn überhaupt – nur mit Vorsicht gerade in kritischen gesellschaftlichen und Unternehmens-Bereichen eingesetzt werden.

In der Zwischenzeit gibt es gute Alternativen. Die erfolgreiche Geschichte von Open Source KI zeigt, dass immer mehr Personen und Organisationen erkennen, dass dieser Weg ein Möglichkeit darstellt, leistungsfähige und dabei gleichzeitig auch transparente KI-Systeme einzusetzen.

Es ist möglich, leistungsfähige KI-Sprachmodelle zu trainieren, die ausschließlich auf gemeinfreien und offenen Texten basieren

In den letzten Jahren gibt es sehr viele Content-Entwickler aus allen möglichen Bereichen, die sich gegen die Übernahme ihrer Inhalte als Trainingsdaten in den bekannten, kommerziellen KI-Modellen wehren.

Dabei kommt es einem so vor, als ob die großen KI-Unternehmen das wohl schon irgendwie „eingepreist“ haben und langwierige Gerichtsverfahren eingehen. Darüber hinaus muss auch die folgende Frage gestellt werden

Ist es möglich ist, leistungsfähige KI-Sprachmodelle zu trainieren, die ausschließlich auf gemeinfrei und offenen Texten basieren?

Die Antwort: Ja, es ist möglich.

In ihrem Paper hat eine Forscher-Gruppe nicht nur ausführlich dargelegt, welche Quellen sie dafür ausgewählt haben, sondern auch gleichzeitig ein entsprechendes Modell entwickelt und auf Hugging Face veröffentlicht:

„We release Common Pile v0.1, an 8TB corpus that—to our knowledge—constitutes the largest dataset built exclusively from openly licensed text. Alongside our dataset, we release Comma v0.1-1T and -2T, two performant 7-billion-parameter LLMs trained on text from the Common Pile, as well as the filtered and rebalanced data mixture we used for training. Our results demonstrate that not only is the Common Pile the strongest dataset for pretraining under an open-license constraint, but also that it produces models comparable to those trained on an equivalent amount of unlicensed data. This positive result holds promise for future of open-license pretraining, especially if the research community invests in collecting larger quantities of openly licensed text data in the future. Ultimately, we believe that the Common Pile v0.1 represents the first step on the path towards a more ethical language model ecosystem, where performance need not come at the cost of creator rights and legal transparency.“ (Kandpahl et al. (2025): The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text).

Natürlich dominieren die proprietären KI-Modelle den Markt, und es fällt den Marktteilnehmer wegen dem in der Zwischenzeit eingetretenen Lock-in schwer, sich an andere KI-Modelle zu gewöhnen (Pfadabhängigkeit). Dennoch überlegen viele Einzelpersonen, Unternehmen, Not for Profit Organisationen oder auch Öffentliche Verwaltungen, ob sie sich nicht von der eingetretenen Abhängigkeit lösen sollten, ja müssen.

Siehe dazu auch Künstliche Intelligenz: Es ist so bequem, unmündig zu sein.