데이터셋고급
Common Crawl Web Corpus
An open, petabyte-scale web crawl corpus that serves as a key source of pre-training data for many large language models, available for free.
개요
"Common Crawl Web Corpus"은(는) AI Resource Hub가 선별한 "데이터셋" 유형의 리소스로, Datasets 카테고리에 속하며 고급 수준의 학습자에게 적합합니다. Common Crawl이(가) 제공하며 2026-06-12에 마지막으로 업데이트되었고, 현재 전체 평점은 4.6/5(1,100개 리뷰 기준)입니다. 원본 페이지를 열려면 오른쪽의 "리소스 방문"을 클릭하세요.
태그
Common CrawlPre-trainingLarge-scaleCorpus
리소스 방문 →
세부 정보
- 제작자
- Common Crawl
- 평점
- ★ 4.6 (1,100 개 리뷰)
- 최근 업데이트
- 2026년 6월 12일