データセット
高品質なオープンソースの AI 学習データセット
Hugging Face データセット集
Hugging Face がホストする世界最大級のオープンソースデータセットハブ。NLP、コンピュータビジョン、音声、マルチモーダルタスクを網羅し、コミュニティが貢献した数十万のデータセットと効率的なストリーミング・ローディングユーティリティを提供。テキスト分類ベンチマーク、画像キャプションペア、音声文字起こしコーパスなど、高品質な学習データを探すならまずここ。
Kaggle データセットプラットフォーム
Kaggle は機械学習コンペ、実務の問題、学術研究にまたがる数万の公開データセットをホストする。全データセットは組み込みノートブックでオンライン分析でき、ローカルでの実験やモデル訓練用に直接ダウンロードも可能。
Papers with Code データセット
Papers with Code は学術論文のベンチマークデータセットを、対応する最先端モデルやオープンソース実装にリンクする。手法の比較、結果の再現、研究に適したデータセットとコードベースラインの発見が容易になる。
Google データセット検索
Google Dataset Search は数千のソースにまたがる公開データセットをインデックスする専用検索エンジンで、研究者や開発者がホスティング先にかかわらず、訓練・分析・検証に必要な特定データを素早く特定できる。
Common Crawl Web コーパス
Common Crawl はオープンなペタバイト規模の Web クロールコーパスで、多くの大規模言語モデルの事前学習データ基盤として利用されている。コーパスは自由にダウンロードでき、NLP 研究、データマイニング、大規模 ML 実験に広く使われている。
LAION オープンマルチモーダルデータセット
LAION(Large-Scale Artificial Intelligence Open Network)は、CLIP や Stable Diffusion などのマルチモーダルモデルの学習に広く利用されてきた大規模なオープンソース画像-テキスト対データセットを提供する。データセットは自由に利用可能で、オープンソース生成 AI 研究の重要インフラとなっている。
UCI 機械学習リポジトリ
UCI 機械学習リポジトリは 1990 年代後半から維持されている数百の構造化データセットからなる古典的コレクションで、実践練習、アルゴリズムのベンチマーク、そして世界中の大学における機械学習基礎教育に広く利用されている。
The Stack ソースコードデータセット
The Stack は BigCode プロジェクトによる大規模で寛容なライセンスのソースコードデータセットで、数百のプログラミング言語をカバーする。コード生成モデルの事前学習と評価に広く使われ、責任あるデータ実践を支えるオプトアウト機構と重複排除ツールを備える。
ImageNet
ImageNet は数千カテゴリにわたる数百万のラベル付き画像を備えた画期的な大規模画像データセット。ILSVRC ベンチマーク競技を通じてコンピュータビジョンの深層学習革命を牽引し、今なお事前学習、転移学習、画像分類モデル評価の基盤であり続けている。