跳到内容
📊

数据集

高质量的开源 AI 训练数据集

4.7

Hugging Face 数据集大全

Hugging Face 托管的全球最大开源数据集枢纽,覆盖 NLP、计算机视觉、音频和多模态任务。平台汇聚了数十万个社区贡献的数据集,并提供高效的数据流式加载工具。无论你需要文本分类基准、图文配对还是语音转文字语料,这里都是获取高质量训练数据的首选基础设施。

数据集进阶数据集Hugging Face
Hugging Face更新于 2026-06-30
4.8

Kaggle 数据集平台

Kaggle 托管数万个公开数据集,涵盖机器学习竞赛、真实业务问题和学术研究。所有数据集均可通过内置笔记本在线分析,也可直接下载到本地进行实验和模型训练。

数据集入门Kaggle数据集
Kaggle更新于 2026-06-18
4.7

Papers with Code 数据集

Papers with Code 将学术论文中的基准数据集与其对应的 SOTA 模型和开源实现关联起来,方便你比较方法、复现结果,并为研究找到合适的数据集和代码基线。

数据集进阶数据集论文
Papers with Code更新于 2026-06-20
4.5

Google 数据集搜索

Google Dataset Search 是专门的数据集搜索引擎,跨数千个来源索引公开数据集,帮助研究者和开发者快速定位训练、分析或验证所需的特定数据,无论其托管在哪里。

数据集入门Google数据集
Google更新于 2026-06-22
4.6

Common Crawl 网络语料

Common Crawl 是一个开放的 PB 级网页爬取语料库,是众多大语言模型预训练的基础数据来源。该语料库可免费下载,广泛用于 NLP 研究、数据挖掘和大规模机器学习实验。

数据集高级Common Crawl预训练
Common Crawl更新于 2026-06-12
4.5

LAION 开放多模态数据集

LAION(大规模人工智能开放网络)提供海量开源图文对数据集,已被广泛用于训练 CLIP、Stable Diffusion 等多模态模型。这些数据集免费开放,是开源生成式 AI 研究的重要基础设施。

数据集高级LAION多模态
LAION更新于 2026-06-16
4.4

UCI 机器学习数据集库

UCI 机器学习仓库是一个经典的结构化数据集集合,自 1990 年代末维护至今,广泛用于动手实践、算法基准测试和全球高校机器学习课程的基础教学。

数据集入门UCI数据集
UC Irvine更新于 2026-06-10
4.5

The Stack 源代码数据集

The Stack 是 BigCode 项目推出的大规模宽松许可源代码数据集,涵盖数百种编程语言。它广泛用于代码生成模型的预训练与评估,并提供退出机制和去重工具,支持负责任的数据实践。

数据集高级The Stack代码
BigCode更新于 2026-06-22
4.7

ImageNet

ImageNet 是里程碑式的大规模图像数据集,包含数千类别的数百万张标注图像。它通过 ILSVRC 基准竞赛推动了计算机视觉的深度学习革命,至今仍是预训练、迁移学习和图像分类模型评估的基石。

数据集进阶ImageNet计算机视觉
Stanford Vision Lab更新于 2026-06-14