초급읽는 시간 9분·

LLM 입문: 대규모 언어 모델은 어떻게 동작하나

대규모 언어 모델(LLM)은 현대 AI 애플리케이션의 심장이 되었습니다. 이 튜토리얼은 LLM이 실제로 어떻게 동작하는지 최대한 쉽게 설명해, 올바른 직관과 탄탄한 기초를 다질 수 있게 해 줍니다.

작성자AI Resource Hub

대규모 언어 모델이란

대규모 언어 모델은 방대한 텍스트로 학습된 신경망입니다. 본질적으로 하는 일은 단 하나 — 지금까지의 텍스트를 보고 가장 그럴듯한 다음 단어를 예측하는 것입니다.

얼핏 단순해 보이는 이 "다음 단어 예측" 능력이 어마어마한 파라미터와 데이터 규모를 만나면, 대화·번역·코딩·요약 같은 복잡한 능력으로 피어납니다.

토큰: 모델의 눈에 비친 텍스트

모델은 글자를 그대로 처리하지 않고, 먼저 텍스트를 토큰으로 쪼갭니다. 토큰은 단어 하나일 수도, 부분 단어일 수도, 몇 글자에 불과할 수도 있습니다.

영어는 대략 4글자가 토큰 1개, 중국어는 글자 하나가 보통 1~2개 토큰에 해당합니다. API 과금과 컨텍스트 길이 제한은 전부 토큰 단위로 측정됩니다.

모델이 텍스트를 생성하는 방식

입력(프롬프트)이 주어지면 모델은 어휘 내 모든 토큰의 확률을 계산하고, 샘플링 전략에 따라 다음 토큰을 고르고, 입력에 덧붙인 뒤 생성이 끝날 때까지 이 과정을 반복합니다.

temperature 파라미터는 무작위성을 조절합니다. 낮으면 출력이 더 결정적이고 보수적이며, 높으면 창의적이지만 주제에서 벗어나기도 쉬워집니다.

컨텍스트 윈도우

모델이 한 번에 "볼" 수 있는 토큰의 총량을 컨텍스트 윈도우라고 합니다. 이를 넘는 내용은 잘리거나 잊히기 때문에, 긴 대화에는 요약이, 긴 문서에는 청크 분할이 필요합니다.

한계와 환각

LLM은 "자신만만하게 헛소리"를 할 수 있습니다. 이것이 환각 현상입니다. 모델은 사실을 진짜로 "아는" 것이 아니라, 답처럼 보이는 텍스트를 예측할 뿐입니다.

그래서 정확한 정보가 필요한 상황에서는 검색 증강 생성(RAG), 도구 호출, 사람의 검증을 함께 써서 위험을 줄여야 합니다.

LLM은 어떻게 학습되는가

LLM 학습은 여러 단계로 진행됩니다. 첫 번째는 사전 학습입니다. 모델은 공개 인터넷, 책, 코드 저장소, 라이선스 데이터셋에서 수조 토큰을 읽어 들입니다. 이 단계에서 문법, 세상 지식, 추론 패턴을 배우지만, 아직 지시를 잘 따르지 못하고 안전하지 않은 내용을 생성할 수도 있습니다.

그 다음 파인튜닝 단계에서 사람이 고품질 질문-답변 쌍을 작성하고, 모델은 지시를 따르고 해로운 요청을 거부하는 법을 배웁니다. 마지막으로 인간 피드백 기반 강화학습(RLHF)이 모델 행동을 인간 선호도에 맞춥니다. 바로 이 파이프라인 덕분에 원시 사전 학습 모델과 ChatGPT 같은 완성품이 같은 아키텍처를 공유하면서도 완전히 다르게 동작합니다.

실제 활용 사례

LLM은 이제 거의 모든 종류의 소프트웨어에 스며들어 있습니다. 대표적인 활용 사례로는 글쓰기 어시스턴트(이메일 초안, 블로그 글, 광고 카피), 코딩 코파일럿(자동 완성, 코드 리뷰, 테스트 생성), 고객 지원 챗봇, 문서 요약, 비구조화 텍스트에서의 데이터 추출, 번역 등이 있습니다. 교육 분야에서는 개인 과외 교사로, 의료 분야에서는 임상 노트 작성을 돕고, 법률 분야에서는 계약 검토를 가속화합니다.

알맞은 LLM 선택하기

모든 LLM이 모든 작업에 적합한 것은 아닙니다. 선택 시 고려해야 할 사항: (1) 작업 적합성 — 코딩, 창작 글쓰기, 요약 등 특정 사용 사례에 뛰어난가? (2) 컨텍스트 윈도우 — 문서 길이를 처리할 수 있는가? (3) 지연 시간과 비용 — 예상 볼륨에서 API 가격이 예산에 맞는가? (4) 프라이버시 — 자체 호스팅이 가능한가, 클라우드 API로 충분한가? (5) 다국어 지원 — 목표 언어에서 잘 작동하는가? 최종 결정 전에 자체 데이터로 2-3개 후보를 벤치마크하세요. 리더보드는 대략적인 신호를 주지만 실제 워크로드 테스트를 대신할 수는 없습니다.

LLM대형 모델입문기초

관련 튜토리얼