DatensatzExperte
Common Crawl Web Corpus
An open, petabyte-scale web crawl corpus that serves as a key source of pre-training data for many large language models, available for free.
Überblick
„Common Crawl Web Corpus“ ist eine Ressource vom Typ „Datensatz“, kuratiert von AI Resource Hub, eingeordnet in die Kategorie Datasets und geeignet für Lernende der Stufe Experte. Sie wird von Common Crawl bereitgestellt, wurde zuletzt am 2026-06-12 aktualisiert und hat aktuell eine Gesamtbewertung von 4.6/5 (aus 1,100 Bewertungen). Klicke rechts auf „Ressource besuchen“, um die Originalseite zu öffnen.
Tags
Common CrawlPre-trainingLarge-scaleCorpus
Ressource besuchen →
Details
- Autor
- Common Crawl
- Bewertung
- ★ 4.6 (1,100 Bewertungen)
- Zuletzt aktualisiert
- 12. Juni 2026