コンテンツへスキップ
📊

データセット

高品質なオープンソースの AI 学習データセット

4.7

Hugging Face データセット集

Hugging Face がホストする世界最大級のオープンソースデータセットハブ。NLP、コンピュータビジョン、音声、マルチモーダルタスクを網羅し、コミュニティが貢献した数十万のデータセットと効率的なストリーミング・ローディングユーティリティを提供。テキスト分類ベンチマーク、画像キャプションペア、音声文字起こしコーパスなど、高品質な学習データを探すならまずここ。

データセット中級データセットHugging Face
Hugging Face更新日 2026-06-30
4.8

Kaggle データセットプラットフォーム

Kaggle は機械学習コンペ、実務の問題、学術研究にまたがる数万の公開データセットをホストする。全データセットは組み込みノートブックでオンライン分析でき、ローカルでの実験やモデル訓練用に直接ダウンロードも可能。

データセット初心者Kaggleデータセット
Kaggle更新日 2026-06-18
4.7

Papers with Code データセット

Papers with Code は学術論文のベンチマークデータセットを、対応する最先端モデルやオープンソース実装にリンクする。手法の比較、結果の再現、研究に適したデータセットとコードベースラインの発見が容易になる。

データセット中級データセット論文
Papers with Code更新日 2026-06-20
4.5

Google データセット検索

Google Dataset Search は数千のソースにまたがる公開データセットをインデックスする専用検索エンジンで、研究者や開発者がホスティング先にかかわらず、訓練・分析・検証に必要な特定データを素早く特定できる。

データセット初心者Googleデータセット
Google更新日 2026-06-22
4.6

Common Crawl Web コーパス

Common Crawl はオープンなペタバイト規模の Web クロールコーパスで、多くの大規模言語モデルの事前学習データ基盤として利用されている。コーパスは自由にダウンロードでき、NLP 研究、データマイニング、大規模 ML 実験に広く使われている。

データセット上級Common Crawl事前学習
Common Crawl更新日 2026-06-12
4.5

LAION オープンマルチモーダルデータセット

LAION(Large-Scale Artificial Intelligence Open Network)は、CLIP や Stable Diffusion などのマルチモーダルモデルの学習に広く利用されてきた大規模なオープンソース画像-テキスト対データセットを提供する。データセットは自由に利用可能で、オープンソース生成 AI 研究の重要インフラとなっている。

データセット上級LAIONマルチモーダル
LAION更新日 2026-06-16
4.4

UCI 機械学習リポジトリ

UCI 機械学習リポジトリは 1990 年代後半から維持されている数百の構造化データセットからなる古典的コレクションで、実践練習、アルゴリズムのベンチマーク、そして世界中の大学における機械学習基礎教育に広く利用されている。

データセット初心者UCIデータセット
UC Irvine更新日 2026-06-10
4.5

The Stack ソースコードデータセット

The Stack は BigCode プロジェクトによる大規模で寛容なライセンスのソースコードデータセットで、数百のプログラミング言語をカバーする。コード生成モデルの事前学習と評価に広く使われ、責任あるデータ実践を支えるオプトアウト機構と重複排除ツールを備える。

データセット上級The Stackコード
BigCode更新日 2026-06-22
4.7

ImageNet

ImageNet は数千カテゴリにわたる数百万のラベル付き画像を備えた画期的な大規模画像データセット。ILSVRC ベンチマーク競技を通じてコンピュータビジョンの深層学習革命を牽引し、今なお事前学習、転移学習、画像分類モデル評価の基盤であり続けている。

データセット中級ImageNetコンピュータビジョン
Stanford Vision Lab更新日 2026-06-14