データセット上級
Common Crawl Web コーパス
Common Crawl はオープンなペタバイト規模の Web クロールコーパスで、多くの大規模言語モデルの事前学習データ基盤として利用されている。コーパスは自由にダウンロードでき、NLP 研究、データマイニング、大規模 ML 実験に広く使われている。
概要
「Common Crawl Web コーパス」は AI Resource Hub が厳選した「データセット」リソースで、データセット カテゴリに属し、上級レベルの学習者に適しています。Common Crawl が提供し、最終更新日は 2026-06-12、編集部スコアは 4.6/5 です。右側の「リソースへ移動」から元のページを開けます。
タグ
Common Crawl事前学習大規模コーパス
主な機能
- ▹ペタバイト級の Web クロールデータ
- ▹毎月の Web スナップショット
- ▹多くの LLM 学習セットの基盤
メリット
- +庞大でオープンな Web コーパス
- +LLM の基礎的リソース
- +無料・巨大・毎月更新
デメリット
- −利用には大規模な処理が必要
- −ノイズが多く、使用前に大規模なクレンジングが必要
- −大規模なダウンロードと処理には相応のインフラが必要