Saltar al contenido
📊

Datasets

High-quality open-source AI training datasets

Conjunto de datosIntermedio
4.7

NUEVOHugging Face Datasets Collection

Explore the vast collection of open-source datasets on Hugging Face, covering high-quality training data across NLP, CV, audio, and more.

DatasetsHugging FaceNLP
Hugging FaceActualizado 2026-06-30
Conjunto de datosPrincipiante
4.8

NUEVOKaggle Datasets Platform

Kaggle offers tens of thousands of public datasets spanning machine learning competitions, real-world business, and research, all available for online analysis and download.

KaggleDatasetsCompetitions
KaggleActualizado 2026-06-18
Conjunto de datosIntermedio
4.7

NUEVOPapers with Code Datasets

A collection of benchmark datasets used in academic papers, linked to their corresponding SOTA models and code implementations—ideal for research and reproduction.

DatasetsPapersBenchmarks
Papers with CodeActualizado 2026-06-20
Conjunto de datosPrincipiante
4.5

NUEVOGoogle Dataset Search

A dataset search engine from Google that lets you find public datasets across sources and quickly locate the data you need for research and training.

GoogleDatasetsSearch
GoogleActualizado 2026-06-22
Conjunto de datosAvanzado
4.6

NUEVOCommon Crawl Web Corpus

An open, petabyte-scale web crawl corpus that serves as a key source of pre-training data for many large language models, available for free.

Common CrawlPre-trainingLarge-scale
Common CrawlActualizado 2026-06-12
Conjunto de datosAvanzado
4.5

NUEVOLAION Open Multimodal Datasets

LAION provides large-scale, open-source image-text pair datasets widely used to train multimodal models such as CLIP and Stable Diffusion.

LAIONMultimodalImage-Text Pairs
LAIONActualizado 2026-06-16
Conjunto de datosPrincipiante
4.4

NUEVOUCI Machine Learning Repository

A classic machine learning dataset repository with hundreds of structured datasets, ideal for hands-on practice and algorithm teaching.

UCIDatasetsMachine Learning
UC IrvineActualizado 2026-06-10
Conjunto de datosAvanzado
4.5

NUEVOThe Stack Source Code Dataset

A large, permissively licensed source-code dataset from BigCode, widely used to pre-train and evaluate code generation models.

The StackCodeDataset
BigCodeActualizado 2026-06-22
Conjunto de datosIntermedio
4.7

NUEVOImageNet

A landmark large-scale image dataset with millions of labeled images across thousands of categories, foundational to modern computer vision.

ImageNetComputer VisionDataset
Stanford Vision LabActualizado 2026-06-14