데이터셋고급
공통 크롤 웹 코퍼스
Common Crawl는 페타바이트 규모의 오픈 웹 크롤링 코퍼스로, 많은 대규모 언어 모델의 사전학습 데이터 기반 소스로 활용됩니다. 이 코퍼스는 무료로 다운로드할 수 있으며 NLP 연구, 데이터 마이닝, 대규모 머신러닝 실험에 널리 사용됩니다.
개요
"공통 크롤 웹 코퍼스"은(는) AI Resource Hub가 선별한 "데이터셋" 유형의 리소스로, 데이터셋 카테고리에 속하며 고급 수준의 학습자에게 적합합니다. Common Crawl이(가) 제공하며 2026-06-12에 마지막으로 업데이트되었고, 편집자 평가는 4.6/5입니다. 원본 페이지를 열려면 오른쪽의 "리소스 방문"을 클릭하세요.
태그
일반 크롤사전 훈련대규모코퍼스
주요 기능
- ▹페타바이트급 웹 크롤링 데이터
- ▹매달 갱신되는 웹 스냅숏
- ▹수많은 LLM 학습 데이터셋의 토대
장점
- +방대하고 자유롭게 쓸 수 있는 웹 코퍼스
- +LLM의 근간이 되는 자원
- +무료에 방대하고 매달 갱신됨
단점
- −활용 전에 상당한 전처리가 필요
- −노이즈가 많아 사용 전 대대적인 클렌징이 필요
- −대규모 다운로드와 처리에는 제대로 된 인프라가 필요
자주 묻는 질문
리소스 방문 →
세부 정보
- 가격
- 무료 공개 데이터셋
- 제작자
- Common Crawl
- 편집자 평가
- ★ 4.6 / 5
- 최근 업데이트
- 2026년 6월 12일