Aller au contenu
Jeu de donnéesAvancé

Corpus de toile de crawl courant

Common Crawl est un corpus ouvert de crawl web à l'échelle du pétaoctet qui sert de source de données fondamentale pour le pré-entraînement de nombreux grands modèles de langage. Le corpus est librement téléchargeable et largement utilisé en recherche NLP, en fouille de données et dans les expériences de ML à grande échelle.

Aperçu

« Corpus de toile de crawl courant » est une ressource de type « Jeu de données » sélectionnée par AI Resource Hub, classée dans la catégorie Jeux de données et adaptée aux apprenants de niveau Avancé. Elle est fournie par Common Crawl, a été mise à jour pour la dernière fois le 2026-06-12 et affiche une note éditoriale de 4.6/5 attribuée par notre équipe. Cliquez sur « Visiter la ressource » à droite pour ouvrir la page d’origine.

Étiquettes

Rampement communPré-entraînementÀ grande échelleCorpus

Fonctionnalités clés

  • Des pétaoctets de données de crawl web
  • Des instantanés mensuels du web
  • La base de nombreux corpus d’entraînement de LLM

Avantages

  • +Un corpus web massif et librement accessible
  • +Fondamental pour les LLM
  • +Gratuit, massif et mis à jour chaque mois

Inconvénients

  • Demande un traitement conséquent avant usage
  • Des données bruitées qui exigent un gros nettoyage avant usage
  • Téléchargements et traitement massifs exigent une vraie infrastructure

FAQ