Zum Inhalt springen
DatensatzExperte

Common Crawl Web Corpus

An open, petabyte-scale web crawl corpus that serves as a key source of pre-training data for many large language models, available for free.

Überblick

„Common Crawl Web Corpus“ ist eine Ressource vom Typ „Datensatz“, kuratiert von AI Resource Hub, eingeordnet in die Kategorie Datasets und geeignet für Lernende der Stufe Experte. Sie wird von Common Crawl bereitgestellt, wurde zuletzt am 2026-06-12 aktualisiert und hat aktuell eine Gesamtbewertung von 4.6/5 (aus 1,100 Bewertungen). Klicke rechts auf „Ressource besuchen“, um die Originalseite zu öffnen.

Tags

Common CrawlPre-trainingLarge-scaleCorpus