数据集
高质量的开源 AI 训练数据集
Hugging Face 数据集大全
Hugging Face 托管的全球最大开源数据集枢纽,覆盖 NLP、计算机视觉、音频和多模态任务。平台汇聚了数十万个社区贡献的数据集,并提供高效的数据流式加载工具。无论你需要文本分类基准、图文配对还是语音转文字语料,这里都是获取高质量训练数据的首选基础设施。
Kaggle 数据集平台
Kaggle 托管数万个公开数据集,涵盖机器学习竞赛、真实业务问题和学术研究。所有数据集均可通过内置笔记本在线分析,也可直接下载到本地进行实验和模型训练。
Papers with Code 数据集
Papers with Code 将学术论文中的基准数据集与其对应的 SOTA 模型和开源实现关联起来,方便你比较方法、复现结果,并为研究找到合适的数据集和代码基线。
Google 数据集搜索
Google Dataset Search 是专门的数据集搜索引擎,跨数千个来源索引公开数据集,帮助研究者和开发者快速定位训练、分析或验证所需的特定数据,无论其托管在哪里。
Common Crawl 网络语料
Common Crawl 是一个开放的 PB 级网页爬取语料库,是众多大语言模型预训练的基础数据来源。该语料库可免费下载,广泛用于 NLP 研究、数据挖掘和大规模机器学习实验。
LAION 开放多模态数据集
LAION(大规模人工智能开放网络)提供海量开源图文对数据集,已被广泛用于训练 CLIP、Stable Diffusion 等多模态模型。这些数据集免费开放,是开源生成式 AI 研究的重要基础设施。
UCI 机器学习数据集库
UCI 机器学习仓库是一个经典的结构化数据集集合,自 1990 年代末维护至今,广泛用于动手实践、算法基准测试和全球高校机器学习课程的基础教学。
The Stack 源代码数据集
The Stack 是 BigCode 项目推出的大规模宽松许可源代码数据集,涵盖数百种编程语言。它广泛用于代码生成模型的预训练与评估,并提供退出机制和去重工具,支持负责任的数据实践。
ImageNet
ImageNet 是里程碑式的大规模图像数据集,包含数千类别的数百万张标注图像。它通过 ILSVRC 基准竞赛推动了计算机视觉的深度学习革命,至今仍是预训练、迁移学习和图像分类模型评估的基石。