コンテンツへスキップ
データセット上級

Common Crawl Web コーパス

Common Crawl はオープンなペタバイト規模の Web クロールコーパスで、多くの大規模言語モデルの事前学習データ基盤として利用されている。コーパスは自由にダウンロードでき、NLP 研究、データマイニング、大規模 ML 実験に広く使われている。

概要

「Common Crawl Web コーパス」は AI Resource Hub が厳選した「データセット」リソースで、データセット カテゴリに属し、上級レベルの学習者に適しています。Common Crawl が提供し、最終更新日は 2026-06-12、編集部スコアは 4.6/5 です。右側の「リソースへ移動」から元のページを開けます。

タグ

Common Crawl事前学習大規模コーパス

主な機能

  • ペタバイト級の Web クロールデータ
  • 毎月の Web スナップショット
  • 多くの LLM 学習セットの基盤

メリット

  • +庞大でオープンな Web コーパス
  • +LLM の基礎的リソース
  • +無料・巨大・毎月更新

デメリット

  • 利用には大規模な処理が必要
  • ノイズが多く、使用前に大規模なクレンジングが必要
  • 大規模なダウンロードと処理には相応のインフラが必要

よくある質問