数据集高级
Common Crawl 网络语料
Common Crawl 是一个开放的 PB 级网页爬取语料库,是众多大语言模型预训练的基础数据来源。该语料库可免费下载,广泛用于 NLP 研究、数据挖掘和大规模机器学习实验。
资源概览
《Common Crawl 网络语料》是 AI Resource Hub 收录的一份「数据集」类资源,归属 数据集 分类,适合高级水平的学习者。该资源由 Common Crawl 提供,最近更新于 2026-06-12,本站编辑评分为 4.6/5。点击右侧「访问资源」可前往原始页面。
标签
Common Crawl预训练大规模语料
核心特性
- ▹PB 级的网页爬取数据
- ▹每月的网络快照
- ▹许多 LLM 训练集的基础
优点
- +庞大且开放的网络语料
- +LLM 的基础性资源
- +免费、海量,且每月更新
不足
- −使用前需大量处理
- −数据噪声大,使用前需大量清洗
- −大规模下载与处理需要像样的基础设施
常见问题
访问资源 →
基本信息
- 价格
- 免费 / 开放数据集
- 作者
- Common Crawl
- 编辑评分
- ★ 4.6 / 5
- 最近更新
- 2026年6月12日