본문으로 건너뛰기

전문가 혼합(MoE)

각 토큰을 소수의 전문 하위 네트워크로 보내 비용 대비 용량을 높이는 아키텍처입니다.

MoE 모델은 수천억 개의 파라미터를 갖더라도 토큰마다 일부만 활성화하므로, 같은 크기의 밀집 모델보다 빠르게 동작합니다. Mixtral을 비롯한 여러 프런티어 모델이 이 설계를 채택했습니다.

관련 리소스