KI-Modelle berücksichtigen nur wenige der weltweit über 7000 Sprachgemeinschaften

Image by Tumisu from Pixabay

Die Übersetzungen der bekannten closed source KI-Modelle sind schon richtig gut und können beispielsweise für Touristen sehr hilfreich sein. Bei unserer Reise nach Taiwan, Japan und Singapur 2025 haben wir das selbst erlebt.

Wenn es allerdings um sensible Bereiche wie Gesundheit, Recht usw. geht, kommt es oftmals auf sprachliche Nuancen an. Diese Texte/Situationen können die gängigen KI-Modelle recht gut, aber nicht immer sehr gut bewältigen. Für agglutinierende Sprachen, wie Ungarisch, Baskisch, etc. reichen die üblichen KI-Modelle beispielsweise nicht aus

So kann es in Regionen der Welt im Gesundheitsbereich zu lebensbedrohlichen Situationen kommen, da der Input und die Ergebnisse der KI-Modelle geographisch und linguistisch sehr unterschiedlich sind. Genau das haben die United Nations (UN) in einer aktuellen Veröffentlichung noch einmal bestätigt.

The inputs and outcomes of artificial intelligence are geographically and linguistically uneven
Most of the world’s languages and cultures remain underserved. More than 7,000 languages are spoken worldwide, yet AI model development and evaluation infrastructure reflects only a small fraction of them“
UN (2026): Preliminary Report of the Independent International Scientific Panel on AI

Es wundert daher nicht, dass es immer mehr Länder und Regionen in der Welt gibt, die ihre eigenen KI-Modelle entwickeln und veröffentlichen – natürlich als Open Source Modelle. Für Europa habe ich in unserem Blog schon auf einige interessante Open Source KI-Modelle hingewiesen: TEUKEN 7B (Alle europäischen Sprachen), EURO LLM (Alle europäischen Sprachen), MINERVA AI LLM (Italienisch), PLLuM (Polnisch), RAKA 4B (Ungarisch), GPT-SW3 (Schwedisch), ALIA (Spanisch), AMALIA (Agente Multimodal Automático de Linguagem com IA).

Ich halte solche Modelle auch für innovative Kleine und Mittlere Unternehmen (KMU) spannend, da sie sich dadurch von dem was alle anderen machen (Ein KI-Modell für alles – One size fits all), unterscheiden können. Dazu habe ich ein Paper für die internationale Konferenz MCP 2026 (16.-19.09.2026, Balatonfüred, Ungarn) geschrieben:

Digital Sovereignty and Open-Source AI: The European Way for Innovative SMEs

Siehe dazu auch:

KI-Modelle: Von „One Size Fits All“ über Variantenvielfalt in die Komplexitätsfalle?

Künstliche Intelligenz im Innovationsprozess von Organisationen

Künstliche Intelligenz: Was ist unter einer Mixture of Experts (MoE) Architektur zu verstehen?

AMALIA: Portugiesisches Open Source KI-Modell

https://amaliallm.pt/

Die bekannten proprietären KI-Modelle lassen oft die kulturellen Besonderheiten außen vor. Am Beispiel von agglutinierender Sprachen wie Ungarisch, Baskisch, etc. kann das deutlich aufgezeigt werden. Es ist daher nur zwingend, dass es in der Zwischenzeit weltweit sehr viele regionale und länderspezifische Open Source KI-Modelle gibt.

Beispielhaft sollen hier nur einige wenige KI-Modelle genannt werden, die sich auf europäische Sprachen konzentrieren: TEUKEN 7B (Alle europaischen Sprachen), EURO LLM (Alle europäischen Sprachen), MINERVA AI LLM (Italienisch), PLLuM (Polnisch), RAKA 4B (Ungarisch), GPT-SW3 (Schwedisch), ALIA (Spanisch).

Nun kommt mit AMALIA (Agente Multimodal Automático de Linguagem com IA) ein weiteres Open Source KI-Modell hinzu, das mit den Besonderheiten der portugiesischen Sprache trainiert wurde, und frei zur Verfügung steht. Auf der Website werden folgende Ziele formuliert:

Förderung der portugiesischen Sprache

Souveränität über die Daten der Bürger

Die kulturelle Repräsentation Portugals bewahren

Förderung von Forschung und Innovation im Bereich der Künstlichen Intelligenz

Lünendonk®-Studie (2026): Digitale Souveränität – Vom Risiko zur Resilienz

https://www.luenendonk.de/produkt/luenendonk-studie-2026-digitale-souveraenitaet-vom-risiko-zur-resilienz/

Es wird immer deutlicher, dass Digitale Souveränität für Europa immer wichtiger wird. Die Lünendonk®-Studie 2026 hat das wieder einmal deutlich gezeigt.

„Digitale Souveränität ist kein abstraktes Leitbild mehr – sie hat sich zu einem zentralen Wettbewerbsfaktor mit klar messbarem Business Impact entwickelt. 2026 steht Europa an einem digitalen Wendepunkt“ (Lünendonk®-Studie 2026).

Die Ergebnisse sind eindeutig: 96% der Befragten erwarten, dass Digitale Souveränität auch bei einer Entspannung der geopolitischen Lage ein zentrales Thema bleibt.

Wenn dem so ist, stehen Unternehmen vor der Frage, wie eine Digitale Souveränität erreicht werden kann. In vielen Beiträgen, und auf dieser Seite habe ich dazu konkrete Schritte aufgezeigt.

Auf der internationalen Konferenz MCP 2026, die vom 16.-19.09.2026 in Balatonfürde, Ungarn stattfindet, werde ich ein Paper zum Thema vorstellen:

Digital Sovereignty and Open-Source AI: The European Way for Innovative SMEs

MCP-Conference 2026: Meine eingereichten Abstracts wurden angenommen

https://mcp-ce.org/

Zur MCP 2026 Conference zu Mass Customization and Personalization findet vom 16.-19.09.2026 in Balatonfüred, Ungarn, statt. Auch zu dieser Konferenz habe ich Abstracts eingereicht, die in der Zwischenzeit bestätigt wurden.

It is our pleasure to inform you that your abstracts entitled:

Open-Source AI for Open User Innovation: Designing a Personalized Framework

Digital Sovereignty and Open-Source AI: A European Path for Innovative SMEs


were positively reviewed by MCP 2026 Scientific Committee and accepted to proceed to the next stage of uploading full paper according to the template.

Nun geht es daran, das Paper bis zum 31. Mai 2026 nach den Konferenzvorgaben fertigzustellen.

Wenn alles klappt, werden ich beide Paper im September auf der Konferenz vorstellen, und mit den Kollegen diskutieren.

Open Data and Open Source AI – a perfect match

Grafik mit Mistral Le Chat generiert

Alle KI-Anwendungen basieren darauf, dass Daten zur Verfügung stehen. Bei den bekannten proprietären Anbietern ist die Herkunft der Daten, und der Umgang mit den Daten oft nicht transparent. Diese KI-Modelle werden daher auch Closed AI Models genannt.

Demgegenüber gibt es die (wirklichen) Open Source KI-Modelle, die sich an der Definition von Open Source AI orientieren, somit transparent sind, wie Mistral AI auch in Europe gehostet werden, und der DSGVO entsprechen.

Solche Modelle können auf viele frei verfügbaren Daten (Open Data) in Europa, Deutschland, ja sogar aus Ihrer Region zurückgreifen. Für Einzelpersonen und für Kleine und Mittlere Unternehmen (KMU) ist das wichtig, um keine rechtlichen Probleme bei der KI-Anwendung zu bekommen.

Ein guter Einstieg ist European Data – Das offizielle Portal für Daten zu Europa.

Dort kann man für jedes Land analysieren, welche Datensätze zur Verfügung stehen. In der folgenden Abbildung ist zu erkennen, dass für Deutschland 855.325 Datensätze (Stand: 05.04.2026) vorliegen..

Quelle: European Data

Auf der Seite können Sie weiter auswählen und so die Datensätze (Open Data) recherchieren, die Sie für Ihre Anwendungen (Innovationen) im Unternehmen oder auch für sich selbst nutzen wollen.

Die Datensätze können dann in KI-Modelle eingebunden werden. Wir schlagen natürlich vor, Open Source KI zu verwenden, beispielsweise Mistral 3 Modellfamilie. Siehe dazu auch meine verschiedenen Blogbeiträge zu Mistral AI.

Open Data and Open Source AI – a perfect match. Ganz im Sinne einer Digitalen Souveränität.

Minerva AI LLM: Das italienischsprachige KI-Modell

https://minerva-ai.org/

In dem Blogbeitrag Open Source AI-Models for Europe: Teuken 7B – Training on >50% non English Data hatte ich schon erläutert, wie wichtig es ist, dass sich Organisationen und auch Privatpersonen nicht nur an den bekannten AI-Modellen der Tech-Giganten orientieren.

Die dort oftmals hinterlegten Daten, die natürlich zum überwiegenden Teil in Englisch (oder Chinesisch) vorliegen, spiegeln nicht die vielfältige europäische Kultur mit ihren vielen Nuancen wieder. Kulturelle Bereiche, definieren sich oftmals über die jeweilige Sprache.

Es ist daher nicht verwunderlich, dass es in den jeweiligen europäischen Ländern einen Trend gibt, KI-Modelle zu entwickeln, die die jeweilige sprachlichen Besonderheiten beachten – wie z.B. Minerva AI LLM:

Minerva AI LLM is the first family of Large Language Models pretrained from scratch in Italian developed by Sapienza NLP in collaboration with Future Artificial Intelligence Research (FAIR) and CIN AIECA. The Minerva models are truly-open (data and model) Italian-English LLMs, with approximately half of the pretraining data composed of Italian text. You can chat with Minerva for free directly through the app — it’s easy, fast, and open to everyone.

Es handelt sich also um eine Modell-Familie, die offen für jeden nutzbar ist. Es zeigt sich auch hier wieder, dass Künstliche Intelligenz auf Vertrauen basieren muss, damit sie den gesellschaftlichen und wirtschaftlichen Anforderungen gerecht werden kann. Siehe dazu auch beispielhaft

Künstliche Intelligenz – It All Starts with Trust

Open EuroLLM: Ein Modell Made in Europe

Spanisch: Open Source AI: Veröffentlichung der ALIA AI Modelle für ca. 600 Millionen Spanisch sprechender Menschen weltweit

Schwedisch: GPT SW3

Mistral Le Chat: Eine europäische Alternative zu ChatGPT

https://chat.mistral.ai/chat

Auf die neue Mistral 3 KI-Modell-Familie hatte ich schon im Dezember 2025 in einem Blogbeitrag hingewiesen. Das französische Start-Up wurde 2023 gegründet: „(…) the company’s mission of democratizing artificial intelligence through open-source, efficient, and innovative AI models, products, and solutions“ (Quelle: Website).

Dieses Demokratisieren von Künstlicher Intelligenz durch Open Source, als europäischer und DSGVO-konformer Ansatz, ist genau der Weg, den ich schon in verschiedenen Beiträgen vertreten habe. Es ist daher interessant, auch den in 2024 veröffentlichten Bot Le Chat im Vergleich beispielsweise zu ChatGPT zu testen.

Die Abbildung weiter oben zeigt die Landingpage für Le Chat mit einem einfachen Feld für die Eingabe eines Prompts. Man kann die Leistungsfähigkeit des Bots testen, ohne sich anmelden zu müssen. Ich habe mich also zunächst nicht angemeldet und einfach einmal eine Frage eingegeben, die mich aktuell beschäftigt: Es geht um die Unterschiede zwischen den Auffassungen von Henry Chesbrough und Eric von Hippel zu Open Innovation.

Ausschnitt aus der Antwort zum eingegebenen Prompt

Die Abbildung zeigt einen Ausschnitt aus der umfangreichen Antwort auf meine Frage, inkl. der generierten Gegenüberstellung der beiden Ansichten auf Open Innovation. Die Antwort kam sehr schnell und war qualitativ gut – auch im Vergleich zu ChatGPT.

Mistral Le Chat ist ein europäisches Produkt, das auch der DSGVO unterliegt und darüber hinaus neben französisch- und englischsprachigen, auch mit deutschsprachigen Daten trainiert wurde. Es ist spannend, sich mit den Mistral-KI-Modellen und mit Le Chat intensiver zu befassen.

Wir haben den kostenpflichtigen ChatGPT-Account in der Zwischenzeit gekündigt, und werden mehr auf Modell-Familien wie Mistral 3 und Mistral Le Chat setzen. Wir sind gespannt, wie sich die Open Source Alternativen in Zukunft weiterentwickeln – ganz im Sinne einer Digitalen Souveränität. Siehe dazu auch

Weitere Open Source AI-Modelle ausprobieren.

Das Kontinuum zwischen Closed Source AI und Open Source AI.

Open Source AI: Warum sollte Künstliche Intelligenz demokratisiert werden?

Open Source AI: Besser für einzelne Personen, Organisationen und demokratische Gesellschaften.

Office.EU: Eine Alternative zu Microsoft 365 und Google Workplace

Website: https://office.eu/

Dass es erforderlich ist, sich als Privatperson, Unternehmen, gemeinnützige Organisation oder staatliche Verwaltung digital unabhängiger von amerikanischen (oder auch chinesischen) Anbietern zu machen, ist so langsam aber sicher allen klar geworden.

Der erste Schritt ist, sich von Microsoft Office 365 oder auch Google Workplace unabhängiger zu machen. Dafür gibt es in der Zwischenzeit viele Möglichkeiten, die beispielsweise auf Nextcloud Hub basieren. Wie Sie als Leser unseres Blogs wissen, haben wir diesen Schritt schon vor vielen Jahren eingeleitet, und Nextcloud auf unseren eigenen Servern installiert. Bitte schauen Sie sich dazu meine Blogbeiträge zu Nextcloud an.

Parallel dazu bieten auch andere Anbieter Nextcloud Hub als Service an – beispielsweise auch ein Unternehmen aus Den Haag, das Office.EU als europäische Plattform anbietet:

„Office EU is a complete cloud-based office suite (like Microsoft 365 or Google Workspace) that is 100% European-owned and runs entirely on European infrastructure. Office EU includes all the essential productivity apps for documents, spreadsheets, presentations, file storage, email, calendars, and video meetings“ (Website).

Der nächste Schritt ist dann, Künstliche Intelligenz in Nextcloud zu integrieren. Wir haben auf unserer Installation gezeigt, dass LocalAI in Nextcloud integriert, und Open Source basierte KI-Modelle eingebunden werden können – wichtige Schritte in Richtung Digitale Souveränität.

Künstliche Intelligenz: Für agglutinierende Sprachen wie Ungarisch, Baskisch, etc. reichen die üblichen KI-Modelle nicht aus

Image by István Asztalos from Pixabay

In früheren Beiträgen hatte ich schon darauf hingewiesen, dass der Großteil der Trainingsdaten der bekannten KI-Modelle aus englischsprachigen (chinesischen) Elementen zusammengesetzt sind. Das Open Source AI-Modell für Europa Teuken 7B hat hier angesetzt, und enthält daher mehr als 50% non englisch data.

Es stellt sich dabei natürlich auch die Frage, warum es so wichtig ist, Trainingsdaten in den jeweiligen (europäischen) Sprachen zu haben. Dazu habe ich eine Erläuterung zur ungarischen, bzw. finnischen Sprache gefunden:

„The current landscape is dominated by models pretrained on vast corpora composed predominantly of English and a few other high-resource languages, creating a significant performance and resource disparity for less-resourced linguistic communities (Zhong et al. 2025). For medium-resource languages such as Hungarian, a Finno-Ugric language characterized by its agglutinative nature and rich morphology, this gap is particularly pronounced. Off-the-shelf multilingual models often exhibit suboptimal performance due to insufficient representation in training data and tokenizers that are ill-suited to language specific morphology. This is particularly the case for open-source models, which visibly struggle with Hungarian grammar“ (Cesibi et al. 2026).

Die hier angesprochenen Agglutinierenden Sprachen (Wikipedia) sind gar nicht so selten. Neben der hier angesprochenen ungarischen Sprache, sind das auch Finnisch, Baskisch, Japanisch, Türkisch usw. Schauen Sie sich dazu bitte die angegebene Wikipedia-Seite an, Sie werden überrascht sein.

Für all diese Sprachen macht es also Sinn, spezifische Trainingsdaten in der jeweiligen Sprache, inkl. der jeweiligen Besonderheiten zu entwickeln. In der Zwischenzeit ist dieser Trend auch deutlich zu beobachten, nicht nur bei den Agglutinierenden Sprachen.

Diese speziellen KI-Modelle können gerade für kultur-, sprachen- und kontextbezogene Innovationen geeignet sein. Siehe dazu auch

Open EuroLLM: Ein Modell Made in Europe – eingebunden in unsere LocalAI

Künstliche Intelligenz: Das polnische Sprachmodell PLLuM

Open Source AI: Veröffentlichung der ALIA AI Modelle für ca. 600 Millionen Spanisch sprechender Menschen weltweit

Künstliche Intelligenz und Werte für das Zusammenleben in der Europäischen Union

Image by Pete Linforth from Pixabay

Werte spielen in der heutigen Zeit eine bedeutende Rolle. Einerseits bei modernen Arbeitsformen, in denen Werte und Prinzipien eine wichtige Hebelwirkung haben, andererseits sind Werte auch Ordner von sozialer Komplexität.

Gerade in einem so großen Raum wie der Europäischen Union ist es wichtig zu wissen, auf welchen Werten das Zusammenleben basiert. Im Amtsblatt der Europäischen Union 2016/C 202/1 über den Vertrag für die Europäische Union findet man im §2 folgenden Text:

Die Werte, auf die sich die Union gründet, sind die Achtung der Menschenwürde, Freiheit, Demokratie, Gleichheit, Rechtsstaatlichkeit und die Wahrung der Menschenrechte einschließlich der Rechte der Personen, die Minderheiten angehören. Diese Werte sind allen Mitgliedstaaten in einer Gesellschaft gemeinsam, die sich durch Pluralismus, Nichtdiskriminierung, Toleranz, Gerechtigkeit, Solidarität und die Gleichheit von Frauen und Männern auszeichnet“ (ebd.).

Manchmal habe ich den Eindruck, dass Regionen in der Europäischen Union gerne eigene Werte durchsetzen möchten, sich regional abschotten, aber dennoch die Vorteile der Europäischen Union nutzen wollen. Diese Vorteile gibt es nicht, ohne die Berücksichtigung der genannten Werte – sogar dann, wenn es um die Nutzung der Künstlichen Intelligenz geht. Siehe dazu auch

Bris, A. (2025): SuperEurope: The Unexpected Hero of the 21st Century 

Weltweite Übersicht zum Umgang mit Künstlicher Intelligenz