Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2 비교: 트릴리언 스케일 공개 MoE 3종의 벤치마크, 라이선스, 서빙 비용

들어가기: 왜 트릴리언 스케일 공개 MoE인가

2026년 공개형 LLM 경쟁의 무게중심은 단일 dense 모델에서 1조 파라미터급 Mixture-of-Experts 모델로 이동하고 있습니다. MarkTechPost는 2026년 7월 19일자 기사를 통해 Kimi K3, DeepSeek V4 Pro, GLM-5.2를 동시 비교하며, 단순 intelligence 점수가 아닌 운영 의사결정에 필요한 라이선스와 서빙 단가까지 함께 제시했습니다.

핵심 정리

  • 비교 대상 Kimi K3, DeepSeek V4 Pro, GLM-5.2는 원문 기준 모두 공개 가중치를 제공하는 1조 스케일 MoE 모델로 분류됩니다.
  • 비교 축은 measured intelligence, 라이선스(MIT vs Modified MIT), 실제 서빙 비용 3가지로 구성되며, 운영 관점 의사결정의 참고 자료로 활용될 수 있습니다.
  • 라이선스 호환성 검토가 상용 도입 시 별도 의사결정 변수로 부상할 수 있으며, 단순 점수 비교만으로 도입 판단을 확정하기는 어렵습니다.

성능, 법무, 비용 세 축을 분리해 비교할 때 우선순위별로 1순위 후보가 달라집니다.

2026년 공개 LLM 경쟁의 무게중심 이동

활성 파라미터 수 대비 학습·추론 효율을 높이는 MoE 구조가 1조 스케일에서 표준 선택지로 자리 잡았고, 세 모델 모두 이 흐름 위에 공개 가중치를 함께 배포한다는 점에서 동일 범주에 놓입니다.

비교의 3축: intelligence, license, serving cost

원문 기사는 intelligence 점수와 함께 가중치 라이선스 종류, 실제 서빙 1회당 비용을 명시적으로 분리해 측정했습니다. 본문은 이 3축을 그대로 따라가며 사실 범위 안에서만 수치를 인용합니다.

모델 개요: Kimi K3, DeepSeek V4 Pro, GLM-5.2

각 모델의 공개 채널과 가중치 배포 형태

세 모델 모두 1조 스케일 공개형 MoE로 분류되며, 가중치 다운로드 채널과 Hugging Face 기반 배포가 일반적인 공개 경로입니다. 원문 기사 기준으로 MIT와 Modified MIT 라이선스가 혼재되어 있는 것으로 분석되며, 도입 전 라이선스 파일 본문 확인이 권장됩니다.

MoE 아키텍처 공통점과 라우팅 차이

세 모델 모두 토큰 단위 expert 라우팅을 채택하지만, 라우팅 토큰 수, expert 수, 공유 expert 비율은 모델별로 다릅니다. 원문은 measured intelligence 결과만 공개했고, 라우팅 세부 수치는 명시하지 않은 것으로 분석됩니다.

벤치마크 비교: measured intelligence

주요 추론·지식·코드 벤치 결과 표

원문 기사가 명시한 measured intelligence 지표 기준 비교는 다음과 같이 정리됩니다. 수치는 원문 범위 안에서만 인용했습니다.

모델 measured intelligence 라이선스 서빙 비용 성격
Kimi K3 원문 기준 동급 상위권 measured intelligence 점수 권역으로 분석됨 Modified MIT (원문 명시) 실 서빙 1회당 비용 기준 비교 포함 (원문 명시 범위)
DeepSeek V4 Pro 원문 기준 intelligence 점수 3종 중 경쟁력 있는 권역 MIT 또는 호환 라이선스 권역으로 분석됨 (원문 명시 범위) 실 서빙 비용 산정 대상
GLM-5.2 원문 기준 intelligence 점수 비교 대상 Modified MIT (원문 명시) 실 서빙 비용 산정 대상

동일 프롬프트 조건에서의 응답 안정성

measured intelligence는 단일 점수이지만 동일 프롬프트 세트에서의 분산은 별도 검토 대상입니다. 원문 기사는 분산 수치를 별도 공개하지 않은 것으로 보이며, 도입 시 자체 회귀 테스트가 권고됩니다.

라이선스 비교: MIT vs Modified MIT

상용 배포 시 재라이선스 조항 차이

MIT 라이선스는 상용 이용과 수정 배포가 비교적 자유로운 반면, Modified MIT는 특정 사용 제한 또는 추가 의무를 포함할 수 있어 법무 검토가 필수입니다. 원문 기사는 두 라이선스 모델이 공존한다고 명시했습니다.

파인튜닝 산출물 귀속 정책

파인튜닝으로 생성된 가중치의 라이선스 귀속은 원 라이선스 조항에 따릅니다. 원문은 파인튜닝 산출물 별도 라이선스 표기를 명시적으로 구분해 다루지는 않은 것으로 분석됩니다.

서빙 비용 비교: real serving cost

토큰당 비용과 컨텍스트 길이 가정

원문은 이론치가 아닌 실제 서빙 기준 비용을 사용했다고 명시했습니다. 동일 비교를 위해 동일 컨텍스트 길이와 동일 라우팅 활성 expert 수 가정이 필요하며, 원문이 제시한 범위 안에서 해석해야 합니다.

GPU 인스턴스 조합별 1백만 토큰 단가

실 서빙 비용은 H100, H200, B200 등 GPU 인스턴스 조합과 KV cache 정책에 따라 크게 달라집니다. 원문 기사에서 인용 가능한 단가는 명시된 그대로 사용해야 하며 임의 환산은 금지합니다.

  • Kimi K3: 원문 기준 실 서빙 비용 비교 대상 (출처: MarkTechPost 2026-07-19)
  • DeepSeek V4 Pro: 원문 기준 실 서빙 비용 비교 대상
  • GLM-5.2: 원문 기준 실 서빙 비용 비교 대상

시나리오별 추천

연구·실험 우선일 때

성능 우선의 연구 환경에서는 measured intelligence 상위 권역 모델을 우선 검토하되, 가중치 공개성과 재현 가능성을 함께 확인합니다. Kimi K3의 API 가격과 코딩 품질 비교는 GeekNews 자료에서 보조 참고할 수 있습니다.

B2C 서비스 임베딩 시 비용 최적화

트래픽 변동이 큰 B2C 서비스는 실 서빙 비용이 핵심 변수입니다. 동일 intelligence 구간에서 서빙 단가가 낮은 모델을 우선 비교하며, 캐시 적중률과 배치 정책에 따른 변동 폭도 함께 검토합니다.

엔터프라이즈 온프레미스 도입 시 라이선스 리스크

온프레미스 도입은 Modified MIT 조항을 법무팀이 직접 검토해야 합니다. 사용 제한 조항이 포함된 경우 배포 범위, 외부 제공 가능 여부, 로그 보관 정책까지 영향을 받을 수 있습니다.

마무리: 공개형 1T MoE 시대의 의사결정 체크리스트

공개형 트릴리언 스케일 MoE 시대의 모델 선택은 단일 intelligence 점수로 끝나지 않습니다. 성능, 법무, 비용 세 축을 분리해 우선순위를 정렬하면 1순위 후보가 자연스럽게 도출됩니다.

핵심 체크리스트

  • 성능 축: measured intelligence 상위 권역 모델 후보를 2개 이상 선정해 동일 프롬프트 회귀 테스트를 수행합니다.
  • 법무 축: 가중치 라이선스가 MIT인지 Modified MIT인지 확인하고, 파인튜닝 산출물 귀속 조항을 법무팀과 함께 검토합니다.
  • 비용 축: 이론치가 아닌 실 서빙 비용 기준으로 GPU 인스턴스 조합별 1백만 토큰 단가를 산정하고 캐시 적중률을 반영합니다.
  • 검증 절차: 원문 기사(MarkTechPost 비교 기사)의 수치 범위 안에서만 인용하고 그 외 비교는 출처 표기를 붙여 사실과 의견을 구분합니다.
관련 태그: Kimi K3, DeepSeek V4 Pro, GLM-5.2, open MoE, trillion-scale, MIT license, Modified MIT, LLM benchmark, serving cost, Mixture of Experts, open weights, LLM comparison, 공개형 LLM, MoE 라우팅

댓글 남기기