ORBiS Tree

ORBiS TREE DOCUMENT

개념·기술 →

Mixture of Experts (MoE)

입력마다 일부 전문가 모듈만 선택적으로 활성화해 모델 용량과 계산량을 분리하려는 희소 모델 구조.

최근 수정 2026.08.29 06:47 출처 1

개요

Mixture of Experts(MoE)는 하나의 입력에 모든 파라미터를 사용하는 대신 여러 전문가 모듈 중 일부를 선택적으로 활성화하는 구조를 말한다. 이런 희소 활성화는 전체 파라미터 규모를 키우면서도 각 입력에 사용하는 계산량을 제한하려는 목적에 활용된다.[1]

Transformer와 MoE

Switch Transformer 연구는 Transformer 계열 모델에서 라우팅을 단순화해 토큰을 선택된 전문가로 보내는 구조를 제시하고, 희소 모델의 통신 비용과 학습 안정성 문제를 다뤘다.[1]

한계

MoE는 총 파라미터가 많다고 해서 모든 파라미터가 매 입력마다 계산되는 것은 아니다. 대신 전문가 간 부하 균형, 통신 비용, 학습 안정성 같은 별도의 시스템 문제가 생길 수 있다.

SOURCES

출처

  1. 원문 보기 ↗