Saltar al contenido
Conjunto de datosAvanzado

Common Crawl Web Corpus

An open, petabyte-scale web crawl corpus that serves as a key source of pre-training data for many large language models, available for free.

Descripción general

"Common Crawl Web Corpus" es un recurso de tipo "Conjunto de datos" seleccionado por AI Resource Hub, clasificado en la categoría Datasets y adecuado para estudiantes de nivel Avanzado. Lo proporciona Common Crawl, se actualizó por última vez el 2026-06-12 y tiene una valoración general de 4.6/5 (a partir de 1,100 reseñas). Haz clic en "Visitar recurso" a la derecha para abrir la página original.

Etiquetas

Common CrawlPre-trainingLarge-scaleCorpus