Conjunto de datosAvanzado
Corpus de Rastreo Común
Common Crawl es un corpus abierto de rastreo web a escala de petabytes que sirve como fuente de datos fundamental para el preentrenamiento de muchos modelos de lenguaje grandes. El corpus está disponible para descarga gratuita y se usa ampliamente en investigación NLP, minería de datos y experimentos de ML a gran escala.
Descripción general
"Corpus de Rastreo Común" es un recurso de tipo "Conjunto de datos" seleccionado por AI Resource Hub, clasificado en la categoría Datasets y adecuado para estudiantes de nivel Avanzado. Lo proporciona Common Crawl, se actualizó por última vez el 2026-06-12 y tiene una puntuación editorial de 4.6/5 de nuestro equipo. Haz clic en "Visitar recurso" a la derecha para abrir la página original.
Etiquetas
Arrastre comúnPre-entrenamientoA gran escalaCorpus
Características clave
- ▹Petabytes de datos de rastreo web
- ▹Instantáneas mensuales de la web
- ▹La base de muchos conjuntos de entrenamiento de LLM
Ventajas
- +Un corpus web masivo y de acceso abierto
- +Fundacional para los LLM
- +Gratis, enorme y actualizado mensualmente
Desventajas
- −Exige bastante procesamiento antes de poder usarlo
- −Datos ruidosos que exigen una limpieza intensa antes de usarlos
- −Descargas y procesamiento grandes requieren infraestructura real
Preguntas frecuentes
Visitar recurso →
Detalles
- Precios
- Dataset gratuito y abierto
- Autor
- Common Crawl
- Puntuación editorial
- ★ 4.6 / 5
- Última actualización
- 12 jun 2026