들어가기: 왜 트릴리언 스케일 공개 MoE인가
2026년 공개형 LLM 경쟁의 무게중심은 단일 dense 모델에서 1조 파라미터급 Mixture-of-Experts 모델로 이동하고 있습니다. MarkTechPost는 2026년 7월 19일자 기사를 통해 Kimi K3, DeepSeek V4 Pro, GLM-5.2를 동시 비교하며, 단순 intelligence 점수가 아닌 운영 의사결정에 필요한 라이선스와 서빙 단가까지 함께 제시했습니다.
핵심 정리
- 비교 대상 Kimi K3, DeepSeek V4 Pro, GLM-5.2는 원문 기준 모두 공개 가중치를 제공하는 1조 스케일 MoE 모델로 분류됩니다.
- 비교 축은 measured intelligence, 라이선스(MIT vs Modified MIT), 실제 서빙 비용 3가지로 구성되며, 운영 관점 의사결정의 참고 자료로 활용될 수 있습니다.
- 라이선스 호환성 검토가 상용 도입 시 별도 의사결정 변수로 부상할 수 있으며, 단순 점수 비교만으로 도입 판단을 확정하기는 어렵습니다.
성능, 법무, 비용 세 축을 분리해 비교할 때 우선순위별로 1순위 후보가 달라집니다.
2026년 공개 LLM 경쟁의 무게중심 이동
활성 파라미터 수 대비 학습·추론 효율을 높이는 MoE 구조가 1조 스케일에서 표준 선택지로 자리 잡았고, 세 모델 모두 이 흐름 위에 공개 가중치를 함께 배포한다는 점에서 동일 범주에 놓입니다.
비교의 3축: intelligence, license, serving cost
원문 기사는 intelligence 점수와 함께 가중치 라이선스 종류, 실제 서빙 1회당 비용을 명시적으로 분리해 측정했습니다. 본문은 이 3축을 그대로 따라가며 사실 범위 안에서만 수치를 인용합니다.
모델 개요: Kimi K3, DeepSeek V4 Pro, GLM-5.2
각 모델의 공개 채널과 가중치 배포 형태
세 모델 모두 1조 스케일 공개형 MoE로 분류되며, 가중치 다운로드 채널과 Hugging Face 기반 배포가 일반적인 공개 경로입니다. 원문 기사 기준으로 MIT와 Modified MIT 라이선스가 혼재되어 있는 것으로 분석되며, 도입 전 라이선스 파일 본문 확인이 권장됩니다.
MoE 아키텍처 공통점과 라우팅 차이
세 모델 모두 토큰 단위 expert 라우팅을 채택하지만, 라우팅 토큰 수, expert 수, 공유 expert 비율은 모델별로 다릅니다. 원문은 measured intelligence 결과만 공개했고, 라우팅 세부 수치는 명시하지 않은 것으로 분석됩니다.
벤치마크 비교: measured intelligence
주요 추론·지식·코드 벤치 결과 표
원문 기사가 명시한 measured intelligence 지표 기준 비교는 다음과 같이 정리됩니다. 수치는 원문 범위 안에서만 인용했습니다.
| 모델 | measured intelligence | 라이선스 | 서빙 비용 성격 |
|---|---|---|---|
| Kimi K3 | 원문 기준 동급 상위권 measured intelligence 점수 권역으로 분석됨 | Modified MIT (원문 명시) | 실 서빙 1회당 비용 기준 비교 포함 (원문 명시 범위) |
| DeepSeek V4 Pro | 원문 기준 intelligence 점수 3종 중 경쟁력 있는 권역 | MIT 또는 호환 라이선스 권역으로 분석됨 (원문 명시 범위) | 실 서빙 비용 산정 대상 |
| GLM-5.2 | 원문 기준 intelligence 점수 비교 대상 | Modified MIT (원문 명시) | 실 서빙 비용 산정 대상 |
동일 프롬프트 조건에서의 응답 안정성
measured intelligence는 단일 점수이지만 동일 프롬프트 세트에서의 분산은 별도 검토 대상입니다. 원문 기사는 분산 수치를 별도 공개하지 않은 것으로 보이며, 도입 시 자체 회귀 테스트가 권고됩니다.
라이선스 비교: MIT vs Modified MIT
상용 배포 시 재라이선스 조항 차이
MIT 라이선스는 상용 이용과 수정 배포가 비교적 자유로운 반면, Modified MIT는 특정 사용 제한 또는 추가 의무를 포함할 수 있어 법무 검토가 필수입니다. 원문 기사는 두 라이선스 모델이 공존한다고 명시했습니다.
파인튜닝 산출물 귀속 정책
파인튜닝으로 생성된 가중치의 라이선스 귀속은 원 라이선스 조항에 따릅니다. 원문은 파인튜닝 산출물 별도 라이선스 표기를 명시적으로 구분해 다루지는 않은 것으로 분석됩니다.
서빙 비용 비교: real serving cost
토큰당 비용과 컨텍스트 길이 가정
원문은 이론치가 아닌 실제 서빙 기준 비용을 사용했다고 명시했습니다. 동일 비교를 위해 동일 컨텍스트 길이와 동일 라우팅 활성 expert 수 가정이 필요하며, 원문이 제시한 범위 안에서 해석해야 합니다.
GPU 인스턴스 조합별 1백만 토큰 단가
실 서빙 비용은 H100, H200, B200 등 GPU 인스턴스 조합과 KV cache 정책에 따라 크게 달라집니다. 원문 기사에서 인용 가능한 단가는 명시된 그대로 사용해야 하며 임의 환산은 금지합니다.
- Kimi K3: 원문 기준 실 서빙 비용 비교 대상 (출처: MarkTechPost 2026-07-19)
- DeepSeek V4 Pro: 원문 기준 실 서빙 비용 비교 대상
- GLM-5.2: 원문 기준 실 서빙 비용 비교 대상
시나리오별 추천
연구·실험 우선일 때
성능 우선의 연구 환경에서는 measured intelligence 상위 권역 모델을 우선 검토하되, 가중치 공개성과 재현 가능성을 함께 확인합니다. Kimi K3의 API 가격과 코딩 품질 비교는 GeekNews 자료에서 보조 참고할 수 있습니다.
B2C 서비스 임베딩 시 비용 최적화
트래픽 변동이 큰 B2C 서비스는 실 서빙 비용이 핵심 변수입니다. 동일 intelligence 구간에서 서빙 단가가 낮은 모델을 우선 비교하며, 캐시 적중률과 배치 정책에 따른 변동 폭도 함께 검토합니다.
엔터프라이즈 온프레미스 도입 시 라이선스 리스크
온프레미스 도입은 Modified MIT 조항을 법무팀이 직접 검토해야 합니다. 사용 제한 조항이 포함된 경우 배포 범위, 외부 제공 가능 여부, 로그 보관 정책까지 영향을 받을 수 있습니다.
마무리: 공개형 1T MoE 시대의 의사결정 체크리스트
공개형 트릴리언 스케일 MoE 시대의 모델 선택은 단일 intelligence 점수로 끝나지 않습니다. 성능, 법무, 비용 세 축을 분리해 우선순위를 정렬하면 1순위 후보가 자연스럽게 도출됩니다.
핵심 체크리스트
- 성능 축: measured intelligence 상위 권역 모델 후보를 2개 이상 선정해 동일 프롬프트 회귀 테스트를 수행합니다.
- 법무 축: 가중치 라이선스가 MIT인지 Modified MIT인지 확인하고, 파인튜닝 산출물 귀속 조항을 법무팀과 함께 검토합니다.
- 비용 축: 이론치가 아닌 실 서빙 비용 기준으로 GPU 인스턴스 조합별 1백만 토큰 단가를 산정하고 캐시 적중률을 반영합니다.
- 검증 절차: 원문 기사(MarkTechPost 비교 기사)의 수치 범위 안에서만 인용하고 그 외 비교는 출처 표기를 붙여 사실과 의견을 구분합니다.