Corpus de toile de crawl courant
Common Crawl est un corpus ouvert de crawl web à l'échelle du pétaoctet qui sert de source de données fondamentale pour le pré-entraînement de nombreux grands modèles de langage. Le corpus est librement téléchargeable et largement utilisé en recherche NLP, en fouille de données et dans les expériences de ML à grande échelle.
Aperçu
« Corpus de toile de crawl courant » est une ressource de type « Jeu de données » sélectionnée par AI Resource Hub, classée dans la catégorie Jeux de données et adaptée aux apprenants de niveau Avancé. Elle est fournie par Common Crawl, a été mise à jour pour la dernière fois le 2026-06-12 et affiche une note éditoriale de 4.6/5 attribuée par notre équipe. Cliquez sur « Visiter la ressource » à droite pour ouvrir la page d’origine.
Étiquettes
Fonctionnalités clés
- ▹Des pétaoctets de données de crawl web
- ▹Des instantanés mensuels du web
- ▹La base de nombreux corpus d’entraînement de LLM
Avantages
- +Un corpus web massif et librement accessible
- +Fondamental pour les LLM
- +Gratuit, massif et mis à jour chaque mois
Inconvénients
- −Demande un traitement conséquent avant usage
- −Des données bruitées qui exigent un gros nettoyage avant usage
- −Téléchargements et traitement massifs exigent une vraie infrastructure
FAQ
Détails
- Tarifs
- Jeu de données gratuit et ouvert
- Auteur
- Common Crawl
- Note éditoriale
- ★ 4.6 / 5
- Dernière mise à jour
- 12 juin 2026