Aller au contenu
Jeu de donnéesAvancé

Common Crawl Web Corpus

An open, petabyte-scale web crawl corpus that serves as a key source of pre-training data for many large language models, available for free.

Aperçu

« Common Crawl Web Corpus » est une ressource de type « Jeu de données » sélectionnée par AI Resource Hub, classée dans la catégorie Datasets et adaptée aux apprenants de niveau Avancé. Elle est fournie par Common Crawl, a été mise à jour pour la dernière fois le 2026-06-12 et affiche une note globale de 4.6/5 (sur 1,100 avis). Cliquez sur « Visiter la ressource » à droite pour ouvrir la page d’origine.

Étiquettes

Common CrawlPre-trainingLarge-scaleCorpus