Common Crawl: Freie Daten für jeden?
Large Language Models (LLMs) benötigen eine Unmenge an Daten. Bei den Closed Source KI-Modellen von OpenAI, Meta, etc. ist manchmal nicht so klar (Black Box), woher diese ihre Trainingsdaten nehmen. Eine Quelle scheint Common Crawl zu sein. „Common Crawl maintains a free, open repository of web crawl data that can be used by anyone. The Common Crawl corpus …
