Es ist möglich, leistungsfähige KI-Sprachmodelle zu trainieren, die ausschließlich auf gemeinfreien und offenen Texten basieren

In den letzten Jahren gibt es sehr viele Content-Entwickler aus allen möglichen Bereichen, die sich gegen die Übernahme ihrer Inhalte als Trainingsdaten in den bekannten, kommerziellen KI-Modellen wehren.

Dabei kommt es einem so vor, als ob die großen KI-Unternehmen das wohl schon irgendwie „eingepreist“ haben und langwierige Gerichtsverfahren eingehen. Darüber hinaus muss auch die folgende Frage gestellt werden

Ist es möglich ist, leistungsfähige KI-Sprachmodelle zu trainieren, die ausschließlich auf gemeinfrei und offenen Texten basieren?

Die Antwort: Ja, es ist möglich.

In ihrem Paper hat eine Forscher-Gruppe nicht nur ausführlich dargelegt, welche Quellen sie dafür ausgewählt haben, sondern auch gleichzeitig ein entsprechendes Modell entwickelt und auf Hugging Face veröffentlicht:

„We release Common Pile v0.1, an 8TB corpus that—to our knowledge—constitutes the largest dataset built exclusively from openly licensed text. Alongside our dataset, we release Comma v0.1-1T and -2T, two performant 7-billion-parameter LLMs trained on text from the Common Pile, as well as the filtered and rebalanced data mixture we used for training. Our results demonstrate that not only is the Common Pile the strongest dataset for pretraining under an open-license constraint, but also that it produces models comparable to those trained on an equivalent amount of unlicensed data. This positive result holds promise for future of open-license pretraining, especially if the research community invests in collecting larger quantities of openly licensed text data in the future. Ultimately, we believe that the Common Pile v0.1 represents the first step on the path towards a more ethical language model ecosystem, where performance need not come at the cost of creator rights and legal transparency.“ (Kandpahl et al. (2025): The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text).

Natürlich dominieren die proprietären KI-Modelle den Markt, und es fällt den Marktteilnehmer wegen dem in der Zwischenzeit eingetretenen Lock-in schwer, sich an andere KI-Modelle zu gewöhnen (Pfadabhängigkeit). Dennoch überlegen viele Einzelpersonen, Unternehmen, Not for Profit Organisationen oder auch Öffentliche Verwaltungen, ob sie sich nicht von der eingetretenen Abhängigkeit lösen sollten, ja müssen.

Siehe dazu auch Künstliche Intelligenz: Es ist so bequem, unmündig zu sein.

Künstliche Intelligenz: „Feeding the Machine“

Conceptual technology illustration of artificial intelligence. Abstract futuristic background

In dem Buch Muldoon, J., Graham, M., Cant, C. (2025) Feeding the Machine geht es den Autoren darum, zu hinterfragen, wie die großen KI-Modelle (LLM: Large Language Models) mit ihren riesigen Datenmengen entstehen, und von großen Unternehmen für ihre geschäftlichen Aktivitäten genutzt werden.

„Das ist aus Sicht von Muldoon, Graham und Cant auch das grundsätzliche Problem der KI-Entwicklung: dass sie vor allem von wenigen mächtigen Akteuren in deren Eigeninteresse entwickelt und genutzt werde. Die Kapitalintensität von KI führe dazu, dass sich Machtstrukturen weiter verfestigen, da nur wenige Unternehmen weltweit das Geld, die Hardware und das Knowhow besitzen, um die Entwicklung voranzutreiben. Durch die Arbeit dieser Unternehmen würden auch koloniale Strukturen aufrechterhalten, schreiben sie. Weil sich Arbeitskräfte im globalen Süden gezwungen sähen, für sehr wenig Geld unter schlechten Bedingungen zu arbeiten, während die hohen Gewinne in die Kassen der Konzerne und Investoren fließen“ (Scherer, K. (2025): KI-Erklärwerk und Kapitalismuskritik, Deutschlandfunk, Andruck, 30.06.2025 | PDF).

Es ist daher gut, dass sich in den letzten mehr als 20 Jahren weltweit Alternativen entwickelt haben, die frei verfügbare Daten in frei verfügbaren KI-Modellen zur Verfügung stellen (Open Data and Open Source AI – a perfect match). Je mehr diese genutzt werden, umso weniger Marktmacht haben die großen Tech-Konzerne. Es wundert daher nicht, dass diese an alternativen Entwicklungen wenig interessiert sind, und versuchen eine Art open washing mit ihren Modellen zu betreiben. Siehe dazu auch

Die erfolgreiche Open Source KI Geschichte

Künstliche Intelligenz – It All Starts with Trust

Künstliche Intelligenz lässt die meisten Sprachen und kulturellen Besonderheiten außen vor

Künstliche Intelligenz lässt die meisten Sprachen und kulturellen Besonderheiten außen vor

Image by Sunrise from Pixabay

Die bekannten proprietäten KI-Modelle funktionieren hauptsächlich in Englisch, oder in einer Handvoll anderer Sprachen. Am Beispiel agglutinierender Sprachen wie Ungarisch, Baskisch, etc. kann aufgezeigt werden, dass die üblichen KI-Modelle nicht ausreichen.

Es wundert daher nicht, dass in den letzten Jahren immer mehr KI-Modelle entwickelt wurden, die in europäischen Sprachen trainiert wurden. Beispiele dazu sind Teuken 7B und Open EuroLLM. Darüber hinaus gibt es in Europa auch schon viele KI-Modelle, die in der jeweiligen Landessprache trainiert wurden. Beispiele dazu sind das Ungarisches Modell, das Schwedisches Modell, das Italienische Modell usw.

Dass es in kritischen Bereichen wie dem Gesundheitswesen wichtig ist, bei KI-Modellen den sprachlichen und kulturellen Kontext zu beachten, wurde in einer Veröffentlichung der United Nations (UN) noch einmal beispielhaft hervorgehoben:

„In Tigrinya, spoken by 7 to 9 million people in Eritrea and northern Ethiopia, machine translation has rendered smallpox as syphilis, gonorrhoea as diabetes and “You have been given intravenous antibiotics” as “You have been given intravenous insecticides”. These mistranslations can be life-threatening. A recent review of natural language processing for African languages in healthcare found that, despite advances in multilingual AI tools, major challenges remain. These include cultural and linguistic bias, poor adaptation to medical contexts, limited explainability and translation errors that can affect diagnosis and treatment decisions. The evidence suggests that AI systems are not ready for use in high-stakes settings unless they have been properly adapted, constrained and tested for the relevant linguistic and cultural contexts“ (UN 2026).

Mit Hilfe von Small Language Models (SLM) und der Berücksichtigung sprachlicher und kultureller Besonderheiten einzelner Regionen in Europa können gerade Kleine und Mittlere Unternehmen (KMU) innovative Produkte und Dienstleistungen entwickeln, die einen Mehrwert für die Nutzer bieten.

Auf der MCP 2026 (16.-19.09.2026, Balatonfüred, Ungarn) gehe ich darauf in einem Paper ein:

Digital Sovereignty and Open-Source AI: The European Way for Innovative SMEs

Mein zweites Paper:

Open-Source AI for Open User Innovation: Designing a Personal Fabrication Framework

Smolagents: Turn your idea into an App – mit verschiedenen LLMs und natürlich Open Source

https://smolagents.org/de/

KI-Agenten sind aktuell gefühlt überall. Natürlich bieten die proprietären Modelle wie ChatGPT, Gemini, Grok etc. viele Möglichkeiten an, solche KI-Agenten zu erstellen und zu nutzen. Wie Sie als Leser unseres Blogs wissen, tentieren wir allerdings dazu, Open Source AI zu nutzen, gerade wenn es um eigene, spezielle Expertise, oder unternehmensspezifisches Wissen in Innovationsprozessen geht.

Neben den von uns schon beschriebenen Möglichkeiten von Langflow und Ollama, möchten wir Ihnen eine weitere Alternative vorstellen, eigene KI-Agenten zu nutzen, und dabei unterschiedliche LLMs einzubinden.

Smolagents is a minimalist AI agent framework developed by the Hugging Face team, crafted to enable developers to deploy robust agents with just a few lines of code. Embracing simplicity and efficiency, smolagents empowers large language models (LLMs) to interact seamlessly with the real world“ (Source: https://smolagents.org/de/).

Das Team von Hugging Face bietet hier eine minimalistische Möglichkeit, auf Open Source Basis KI-Agenten zu entwickeln, und der Community in einem Repository zur Verfügung zu stellen (Best Smolagents in Hugging Face).

Es ist interessant zu sehen, wie einfach man seine Idee in einem ersten KI-Agenten umsetzen kann. In dem folgenden Beispiel habe ich versucht, einen persönlichen Innovationsprozess abzubilden. In jedem Prozessschritt wollte ich ein anderes Open Source KI-Modell einsetzen.

Eigener Screenshot

In der Abbildung sind erste Prozessschritte für die Entwicklung von Innovationen zu sehen: Inspire mit Llama 3, Ideate mit Mistral, Prototype mit Phi 3 etc. Die jeweiligen LLM kann ich auswählen und testen. Das ging sehr schnell und war super einfach.

Probieren Sie es doch auch einmal aus!

Innovatives Denken mit Künstlicher Intelligenz unterstützen

Legende
(CEN TS 16555-2014):

1 Sammeln von Informationen
2 Erzeugen von Lösungen
3 Rasches Lernen
4 Bewertung
5 Synthese und Outputs
6 Ergebnisse

Unternehmen setzen für ihren Innovationsprozess Künstliche Intelligenz ein. Auf der individuellen Ebene ist das natürlich auch möglich. Beispielsweise kann Künstliche Intelligenz das eigene innovative Denken unterstützen. Die Abbildung zeigt dazu die insgesamt sechs Schritte – vom Sammeln von Informationen (1) bis zu den Ergebnissen (6).

In jedem einzelnen Schritt sollten Sie überlegen, ob Sie nur ein KI-Modell verwenden wollen, oder ob es nicht besser ist, spezielle KI-Modelle zu nutzen. Siehe dazu auch KI-Modelle: Von „One Size Fits All“ über Variantenvielfalt in die Komplexitätsfalle?

Weiterhin sollten Sie sich überlegen, ob Sie die bekannten proprietären KI-Modelle für ihre innovativen Ideen nutzen wollen. Denken Sie bitte daran, dass diese wenig transparent sind und Sie nicht genau wissen, was mit ihren Ideen passiert. Siehe dazu auch Das Kontinuum zwischen Closed Source AI und Open Source AI.

Unser Vorschlag ist daher, dass Sie zur Unterstützung ihres innovativen Denkens, in jedem Schritt Open Source KI-Modelle nutzen. Dass kann MISTRAL LE CHAT als Alternative zu ChatGPT etc, ein Modell wie Mistral AI für alle Schritte, oder auch ein Konzept mit unterschiedlichen Modellen sein, die Sie auf Huggingface finden können.

Natürlich ist es auch möglich, für die oben genannten Schritte einen, oder mehrere KI-Agenten zu nutzen – natürlich möglichst auch Open Source basiert.

Überlegen Sie abschließend noch, ob Sie alles auf ihrem Laptop, oder auf einem eignen Server laufen lassen können. Damit hätten Sie die Kontrolle über ihre Ideen.

„Erst ignorieren sie dich, dann lachen sie über dich, dann bekämpfen sie dich, dann hast du gewonnen“ Mahatma Gandhi.

Sie können dann immer noch selbst entscheiden, ob Sie Ihre Ergebnisse mit anderen teilen, oder diese sogar Unternehmen anbieten wollen.

Alles im Sinne einer eigenen Digitalen Souveränität.

Künstliche Intelligenz: Open Source Modelle mit der Ollama-App auf dem eigenen Desktop

Eigener Screenshot – (c) Dr. Robert Freund

Ollama ist eine Open Source Software, mit der man kleine und größere Sprachmodelle (Small Language Models und Large Language Models testen kann.

(1) Zunächst natürlich auf Ollama selbst nach einem entsprechenden Login.

(2) Da Ollama Open Source ist, kann es auch auf dem eigenen Server installiert werden. Wie Sie wissen, haben wir das auch schon ausprobiert. Informationen dazu finden Sie in unseren verschiedenen Blogbeiträgen dazu.

(3) Es ist möglich, Ollama auf dem eigenen Desktop zu installieren und geeignete Modelle zu testen. In den Settings ist der Login bei Ollama zu hinterlegen.

Die Abbildung zeigt den Screenshot mit der Startseite auf meinem Desktop. Wie gewohnt kann ein geeigneter Prompt eingegeben werden.

Spannend ist, dass wir bei jedem neuen Chat aus verschiedenen installierten Modellen auswählen können. Bei dem Beispiel haben wir MISTRAL ausgewählt. Über das „+“-Zeichen können sogar Dateien mit hochgeladen werden.

Auch an der Stelle wird wieder deutlich, wie wichtig es ist, Künstliche Intelligenz mit transparenten Open Source Modellen auf der eigenen Infrastruktur zu betreiben. Ganz im Sinne einer Digitalen Souveränität.

Es war anschließend interessant zu sehen, wie schnell die Antwort über Ollama und MISTRAL erstellt wurde. Auch die Qualität der Antwort war gut. Hier der entsprechende Screenshot:

Ergebnis über MISTRAL (c) Dr. Robert reund

Open Source LLM und Proprietäres LLM in einer vereinfachten Gegenüberstellung

Mittelstand Digital Fokus Mensch (2026)

Generative Künstliche Intelligenz (GenKI) ist gerade bei Kleinen und Mittleren Unternehmen (KMU) ein spezielles Thema, da KMU oftmals undermanaged und underfinanced sind. KMU müssen daher beim Einsatz von Künstlicher Intelligenz darauf achten, dass nicht unnötig Ressourcen verschwendet werden. Dazu gehört auch, von Anfang an einen angemessenen Weg zur Nutzung Künstlicher Intelligenz einzuschlagen.

Damit meine ich nicht zu entscheiden, ob man ChatGPT, Gemini, Grok, Anthropic usw. einsetzen möchte, denn diese KI-Modelle (LLM: Large Language Models) sind eher proprietäre LLM, also herstellergebundene KI-Modelle mit Vor- und Nachteilen.

Die Abbildung zeigt dazu eine einfache Gegenüberstellung von Open Source LLM und proprietärer LLM. Es wird deutlich, dass die Einstiegshürden bei Open Source LLM zwar höher sind, doch die Open Source LLM bei Kosten, Datenschutz und Anpassung besser abschneiden. Was noch beobachtet werden muss, ist das jeweilige Leistungsniveau, das sich bei den Open Source LLM in den letzten Jahren stark verbessert hat.

Vor zwei Jahren dominierten proprietäre Modelle den Markt. Inzwischen hat sich viel getan. Beispiele sind Meta LLaMA 3, Mistral & Mixtral, Falcon, Gemma, OpenHermes und Ökosystem-Tools (Plattformen wie HuggingFace).

Kurz gesagt: Open-Source LLMs sind nicht mehr nur Forschungsprojekte, sondern in vielen Szenarien produktionsreif.

Quelle: vgl. Mittelstand Digital Fokus Mensch (2026): Digitale Souveränität als Basis für sichere KI-Anwendungen. EIN KURZLEHRBUCH | PDF

Gerade für Kleine und Mittlere Unternehmen (KMU) ist es an der Zeit, auf Basis von Open Source AI ihre eigene Digitale Souveränität aufzubauen. Mit dem genannte Handbuch können Sie sich ausführlicher darüber informieren und anfangen, entsprechende Kompetenzen aufzubauen.

Racka-4B – ein ungarisches KI-Modell

Image by Hermann Traub from Pixabay

In dem Blogbeitrag Für agglutinierende Sprachen wie Ungarisch, Baskisch, etc. reichen die üblichen KI-Modelle nicht aus wurde deutlich, dass es beispielsweise für die ungarische Sprache gut ist, ein spezielles Modell zu haben. So ein Modell (LLM) liegt nun mit Racka (Regionális Adatokon Célzottan Kialakított Alapmodell) vor.

„We present Racka-4B, a lightweight, continually pretrained large language model designed to bridge the resource gap between Hungarian and high-resource languages such as English and German. (…) The results also showcase that Racka-4B is capable of Hungarian chat with English reasoning even in the absence of explicit Hungarian post-training on these tasks“ (Csibi, Z. et al. (2026): Racka: Efficient Hungarian LLM Adaptation on Academic Infrastructure | PDF).

Das Modell Racka-4B basiert auf Qwen-3 und steht bei Huggingface zur Verfügung. Es ist also transparent und offen – ganz im Gegensatz zu den proprietären KI-Modellen der großen Tech-Konzerne. Diese suggerieren, dass es ausreicht, ein Modell für alles zu haben.

Dieser One Size Fits All – Gedanke ist zwar aus deren Sicht wirtschaftlich interessant, doch trifft dieser Ansatz immer weniger die Bedürfnisse der Menschen. Auch Racka-4B bestätigt eine Entwicklung zu europäischen Sprach-Modellen, die stärker regionale Besonderheiten berücksichtigen. Siehe dazu auch

Die MCP Community of Europe trifft sich in diesem Jahr vom 16.-19.09.2026 auf der MCP 2026 in Balatonfüred, Ungarn. Neueste Entwicklungen zu Mass Customization and Personalization, auch in Zeiten von Künstlicher Intelligenz, werden auf der Konferenz vorgestellt und diskutiert. Die Konferenz findet seit 2004 durchgehend alle 2 Jahre statt – die MCP 2026 ist somit die 12. Konferenz ihrer Art.

Open EuroLLM: Ein Modell Made in Europe – eingebunden in unsere LocalAI

Künstliche Intelligenz: Das polnische Sprachmodell PLLuM

Minerva AI LLM: Das italienischsprachige KI-Modell

Open Source AI: Veröffentlichung der ALIA AI Modelle für ca. 600 Millionen Spanisch sprechender Menschen weltweit

Künstliche Intelligenz und das Herkunftsproblem – provenance problem

Conceptual technology illustration of artificial intelligence. Abstract futuristic background

In meinen Konferenz-Paper der letzten Jahrzehnte habe ich natürlich immer darauf geachtet, die jeweilige Quelle anzugeben. Damit ist aus wissenschaftlicher Sicht gewährleistet, dass deutlich wird, was von einem anderen Autor, und was von mir stammt.

Mit der gleichen Vorgehensweise erstellen wir auch unsere Blogbeiträge. Da wir dafür keinen KI-generierten Content nutzen, kann der Leser darauf vertrauen. Das ist besonders wichtig, da Vertrauen die Basis für die Arbeit mit Künstlicher Intelligenz ist it all starts with trust.

Sollte also jemand Künstliche Intelligenz für seine Blogbeiträge, oder sogar für seine wissenschaftlichen Veröffentlichungen nutzen, steht er vor mehreren Herausforderungen, denn das jeweils verwendete KI-Modell zeigt nicht immer auf, welche Quelle es verwendet hat.

Texte, die originalgetreu von anderen übernommen wurden, werden zwar bei einigen KI-Modellen gekennzeichnet, doch andere Texte sind möglicherweise von der KI selbst zusammengestellt worden. Earp et al. (2025) haben das in einem veröffentlichten Paper als Herkunftsproblem (provenance problem) bezeichnet:

„Suppose the LLM trained on, but does not mention, Smith’s text. And suppose we have never read it or even heard of Smith or her work. So, we don’t cite the paper either. Still, our essay now inherits — via nebulous, machine-mediated means — a distinctive insight that Smith developed but for which she receives no credit“

Source: Earp, B.D., Yuan, H., Koplin, J. et al. LLM use in scholarly writing poses a provenance problem. Nat Mach Intell 7, 1889–1890 (2025). https://doi.org/10.1038/s42256-025-01159-8.

Es handelt sich dabei also nicht um Plagiate, sondern um eine subtilere Art der Verschleierung der Herkunft.

Im wissenschaftlichen Kontext wird das thematisiert, doch wie sieht es mit der privaten Nutzung der allseits eingesetzten KI-Modelle wie ChatGPT, Gemini, Anthropix, Grok etc. aus, die man als Black Box bezeichnen kann?

Da deren Trainingsdaten nicht transparent sind, ist das Herkunftsproblem natürlich auch hier vorhanden, doch die einzelnen Nutzer reflektieren über die Ergebnisse nicht so, wie es Wissenschaftler tun, die auf Qualität achten.

Dadurch werden alle möglichen und unmöglichen KI-Resultate weitergegeben und sind dann wiederum Bestandteil der nächsten Ergebnisse. In dem gesamten System entsteht so eine Unschärfe, die auch zu Manipulationen genutzt werden kann.

Minerva AI LLM: Das italienischsprachige KI-Modell

https://minerva-ai.org/

In dem Blogbeitrag Open Source AI-Models for Europe: Teuken 7B – Training on >50% non English Data hatte ich schon erläutert, wie wichtig es ist, dass sich Organisationen und auch Privatpersonen nicht nur an den bekannten AI-Modellen der Tech-Giganten orientieren.

Die dort oftmals hinterlegten Daten, die natürlich zum überwiegenden Teil in Englisch (oder Chinesisch) vorliegen, spiegeln nicht die vielfältige europäische Kultur mit ihren vielen Nuancen wieder. Kulturelle Bereiche, definieren sich oftmals über die jeweilige Sprache.

Es ist daher nicht verwunderlich, dass es in den jeweiligen europäischen Ländern einen Trend gibt, KI-Modelle zu entwickeln, die die jeweilige sprachlichen Besonderheiten beachten – wie z.B. Minerva AI LLM:

Minerva AI LLM is the first family of Large Language Models pretrained from scratch in Italian developed by Sapienza NLP in collaboration with Future Artificial Intelligence Research (FAIR) and CIN AIECA. The Minerva models are truly-open (data and model) Italian-English LLMs, with approximately half of the pretraining data composed of Italian text. You can chat with Minerva for free directly through the app — it’s easy, fast, and open to everyone.

Es handelt sich also um eine Modell-Familie, die offen für jeden nutzbar ist. Es zeigt sich auch hier wieder, dass Künstliche Intelligenz auf Vertrauen basieren muss, damit sie den gesellschaftlichen und wirtschaftlichen Anforderungen gerecht werden kann. Siehe dazu auch beispielhaft

Künstliche Intelligenz – It All Starts with Trust

Open EuroLLM: Ein Modell Made in Europe

Spanisch: Open Source AI: Veröffentlichung der ALIA AI Modelle für ca. 600 Millionen Spanisch sprechender Menschen weltweit

Schwedisch: GPT SW3