Jeu de donnéesAvancé
Common Crawl Web Corpus
An open, petabyte-scale web crawl corpus that serves as a key source of pre-training data for many large language models, available for free.
Aperçu
« Common Crawl Web Corpus » est une ressource de type « Jeu de données » sélectionnée par AI Resource Hub, classée dans la catégorie Datasets et adaptée aux apprenants de niveau Avancé. Elle est fournie par Common Crawl, a été mise à jour pour la dernière fois le 2026-06-12 et affiche une note globale de 4.6/5 (sur 1,100 avis). Cliquez sur « Visiter la ressource » à droite pour ouvrir la page d’origine.
Étiquettes
Common CrawlPre-trainingLarge-scaleCorpus
Visiter la ressource →
Détails
- Auteur
- Common Crawl
- Note
- ★ 4.6 (1,100 avis)
- Dernière mise à jour
- 12 juin 2026