AI 모델의 '파라미터'란 무엇인가요?
파라미터는 모델이 학습을 통해 조정하는 가중치의 개수로, 모델의 규모를 나타내는 대표 지표입니다. 흔히 '70B(700억 개)'처럼 개수로 표현합니다.
파라미터가 많을수록 더 복잡한 패턴을 담을 수 있는 '용량'이 커진다고 볼 수 있습니다.
파라미터가 많으면 무조건 좋은가요?
꼭 그렇지는 않습니다. 파라미터가 많으면 표현력은 커지지만, 학습·실행에 더 많은 연산과 메모리가 필요하고 비용도 올라갑니다.
학습 데이터의 질, 구조, 정렬(튜닝) 방식에 따라 더 작은 모델이 특정 작업에서 큰 모델을 앞서기도 합니다. 파라미터 수는 여러 지표 중 하나로 보는 것이 맞습니다.
MoE(전문가 혼합)란 무엇인가요?
MoE(Mixture of Experts, 전문가 혼합)는 모델 안에 여러 '전문가' 신경망을 두고, 입력마다 그중 일부만 골라 활성화하는 구조입니다. 전체 파라미터는 많아도 한 번에 쓰는 부분은 일부이므로 연산 비용을 줄일 수 있습니다.
덕분에 '총 파라미터는 크지만 실제 계산은 가벼운' 모델을 만들 수 있어 최근 대형 모델에 널리 쓰입니다.
MoE 모델과 일반(밀집) 모델은 무엇이 다른가요?
일반적인 밀집(dense) 모델은 입력마다 모든 파라미터를 사용합니다. 반면 MoE는 입력에 맞는 전문가만 선택해 쓰므로, 같은 계산량으로 더 큰 총 용량을 갖출 수 있습니다.
대신 어떤 전문가를 고를지 결정하는 '라우팅'이 필요하고 학습·서빙이 더 복잡해지는 특성이 있습니다.