DatensatzExperte
Gemeinsamer Crawl-Webkorpus
Common Crawl ist ein offenes Web-Crawl-Korpus im Petabyte-Maßstab, das als grundlegende Pre-Training-Datenquelle für viele große Sprachmodelle dient. Das Korpus ist frei herunterladbar und wird umfassend in NLP-Forschung, Data-Mining und großangelegten ML-Experimenten verwendet.
Überblick
„Gemeinsamer Crawl-Webkorpus“ ist eine Ressource vom Typ „Datensatz“, kuratiert von AI Resource Hub, eingeordnet in die Kategorie Datensätze und geeignet für Lernende der Stufe Experte. Sie wird von Common Crawl bereitgestellt, wurde zuletzt am 2026-06-12 aktualisiert und hat eine redaktionelle Wertung von 4.6/5 von unserem Team. Klicke rechts auf „Ressource besuchen“, um die Originalseite zu öffnen.
Tags
Gewöhnlicher KriechgangVorschulungGroßflächigKorpus
Hauptfunktionen
- ▹Petabytes an Web-Crawl-Daten
- ▹Monatliche Momentaufnahmen des Webs
- ▹Die Grundlage vieler LLM-Trainingsdatensätze
Vorteile
- +Riesiges, frei verfügbares Web-Korpus
- +Grundpfeiler für LLMs
- +Kostenlos, riesig und monatlich aktualisiert
Nachteile
- −Erfordert erheblichen Verarbeitungsaufwand
- −Verrauschte Daten, die vor der Nutzung starke Bereinigung erfordern
- −Große Downloads und Verarbeitung brauchen echte Infrastruktur
FAQ
Ressource besuchen →
Details
- Preise
- Kostenloser / offener Datensatz
- Autor
- Common Crawl
- Redaktionswertung
- ★ 4.6 / 5
- Zuletzt aktualisiert
- 12. Juni 2026