Cursor, 결정적 MoE 학습 메가커널 Mixture-of-Kittens(MoK) 오픈소스 공개

핵심 요약

  • MoK는 MoE 학습의 통신과 연산을 단일 결정적 메가커널로 융합해 공개 베이스라인 대비 최대 2.37배 빠른 학습 속도를 제공한다.
  • 필수 하드웨어는 NVIDIA Blackwell 아키텍처의 SM100 또는 SM103 GPU이며 GB300 NVL72 랙 환경을 전제로 하므로 일반 개발자나 소규모 연구실은 즉시 활용하기 어렵다.
  • Cursor는 MoK를 자사 Composer 모델 학습에 적용하고 오픈소스로 공개해, 대규모 GPU 랙 보유 기관의 학습 비용 절감과 재현성 확보에 새로운 기준점을 제시했다.

MoK는 대규모 MoE 학습의 병목을 단일 결정적 커널로 묶어낸 점에서 인프라 최적화의 방향 자체를 전환하는 사례로 평가된다.

2026년 8월 Cursor Research는 자사가 개발한 Mixture-of-Kittens(MoK)를 오픈소스로 공개했다. MoK는 MoE(Mixture-of-Experts, 혼합 전문가) 학습에서 분리되어 있던 통신과 연산을 하나의 결정적 메가커널로 통합한 소프트웨어 스택으로, 공개 시점에서 가장 뜨거운 화두인 Blackwell GB300 NVL72 랙 환경을 전제로 설계된 것이 특징이다. 본 글은 MoK의 기술적 의의와 하드웨어 종속성이 만드는 접근성 장벽, 그리고 오픈소스 공개가 대규모 학습 생태계에 주는 전략적 시사점을 차례로 살펴본다.

MoK의 기술적 배경: 결정적 MoE 메가커널이란

MoE 학습의 통신과 연산 분리 문제

MoE 구조는 입력 토큰을 여러 전문가(Expert) 모듈로 라우팅(routing, 토큰을 어떤 전문가에 보낼지 결정하는 과정)해 처리하기 때문에 일반적인 dense 모델보다 all-to-all 통신과 같은 고비용 데이터 교환이 빈번하게 발생한다. 기존 학습 스택은 이 통신 경로와 연산 커널, 메모리 레이아웃을 별도의 라이브러리 레이어로 다루기 때문에, 같은 조건에서도 실행할 때마다 라우팅 결과와 노드 간 타이밍이 달라지는 비결정적(non-deterministic) 동작이 발생하기 쉽다. 이는 단순한 성능 저하를 넘어, 디버깅 비용 증가와 재현성 붕괴라는 두 가지 문제를 동시에 만든다.

결정적 커널 통합 설계의 핵심 의의

MoK는 이러한 분리를 거꾸로 뒤집는다. 통신 스케줄링과 토큰 디스패치, GEMM(General Matrix Multiplication, 일반 행렬 곱셈) 연산을 하나의 거대한 CUDA 커널 안에서 deterministic seed(난수 초깃값)와 lockstep schedule(동일한 순서로 작업을 강제 동기화하는 방식)로 묶어 처리한다. 그 결과 동일한 입력과 동일 라우팅 테이블이라면, 다른 노드에서도 비트가 동일한 연산 경로를 따르게 된다. 결정성을 학습 루프 차원에서 보장한다는 점에서, 단순한 최적화 라이브러리가 아니라 학습 인프라의 새로운 추상화 계층이라 볼 수 있다.

성능과 하드웨어 요건 분석

GB300 NVL72 랙에서 최대 2.37배 학습 속도 향상

MoK 공개에 함께 첨부된 벤치마크에서는 공개 베이스라인 대비 최대 2.37배 학습 속도 향상이 보고되었으며, 이는 토큰 라우팅 비율이 높은 구성에서 두드러졌다. 특히 토큰 라우팅 비율이 높은 상위 전문가 비중이 큰 구성에서 효과가 두드러졌으며, all-to-all 통신이 GEMM 연산과 효과적으로 겹쳐 처리되는 구간에서 처리량이 가장 크게 증가한 것으로 분석된다. 하단의 표는 공개된 주요 사실들을 요약한 것이다.

구분 주요 내용
공개 주체 Cursor Research
공개 일시 2026-08-04
핵심 명칭 Mixture-of-Kittens (MoK), 결정적 MoE 학습 메가커널
성능 수치 공개 베이스라인 대비 최대 2.37배 학습 속도
필수 하드웨어 NVIDIA GB300 NVL72 랙, Blackwell SM100 또는 SM103 GPU
적용 모델 Cursor의 자사 Composer 모델 학습

Blackwell SM100·SM103 전용 요구와 접근성 장벽

MoK의 결정성과 속도 이점은 Blackwell 세대의 신규 TMA(Tensor Memory Accelerator, 텐서 메모리 가속기) 명령어와 분산 공유 메모리(DSMEM) 같은 하드웨어 기능에 깊이 의존한다. 따라서 SM100 또는 SM103이 아닌 이전 세대 GPU에서는 동일 효과를 보장할 수 없다. 사실상 GB300 NVL72급 랙을 보유한 기관만이 온전히 활용할 수 있는 솔루션이며, 일반 연구실이나 스타트업이 바로 도입하기에는 하드웨어 비용 장벽이 매우 높다는 평가가 나온다.

오픈소스 공개의 전략적 의미

Cursor Composer 모델 학습 적용 사례

MoK는 학술용 프로토타입이 아니라 Cursor의 자사 Composer 모델 학습에 실제로 투입된 운영용 커널이다. 코드 어시스턴트 영역에서 모델 품질이 곧 제품 경쟁력에 직결되는 만큼, 학습 비용 절감과 디버깅 재현성 확보는 직접적인 사업적 가치로 이어진다. 이 같은 적용 사례는 MoK가 단순한 학술 프로토타입이 아닌 프로덕션 단계(production-grade)de(운영 환경 검증 완료) 기술임을 보여주며, 오픈소스 공개의 신뢰도를 높인다.

대규모 GPU 랩 보유 기관의 비용과 재현성 효과

오픈소스 공개가 의미하는 바는 단순히 코드가 무료가 되었다는 데 그치지 않는다. Blackwell NVL72 랙을 보유한 기관은 자사의 학습 스택을 MoK 기반으로 자체 최적화하고, 결정적 재현성을 전제로 한 A/B 실험을 고도화할 수 있다. 특히 1회 학습 실행에 수십억 원의 전력과 GPU 시간이 투입되는 대규모 모델의 경우, 2배 가까운 처리량 향상은 분기 단위 OpEx(운영 비용) 절감으로 직결된다. 다만 이러한 효과는 결국 랙을 보유한 소수 기관에 집중될 가능성이 높아, 인프라 접근성 격차가 심화될 수 있다는 점도 함께 지적된다.

시사점과 전망

MoE 학습 인프라의 오픈소스 경쟁 구도

그동안 MoE 학습 최적화 영역은 Megatron-LM, DeepSpeed-MoE, Tutel 등 대형 프레임워크 내부의 폐쇄적 커널에 머물러 있었다. MoK는 이를 별도의 오픈소스 메가커널로 분리해낸 점에서 의미가 크며, 향후 Blackwell 기반 MoE 학습의 사실상의 표준으로 자리 잡을 가능성이 있는 것으로 분석된다. 동시에 NVIDIA NeMo, MosaicML 등과의 생태계 경쟁이 한층 격화될 것으로 전망된다.

AMD MI300X 기반 단일 노드 학습 사례와의 대비

최근 AMD MI300X를 단일 노드에 탑재해 MoE 학습을 시도하는 사례도 늘고 있다. 이 접근법은 NVL72급 랙 없이도 큰 전문가 수를 운용할 수 있다는 장점이 있으나, 노드 간 대역폭과 결정성 보장 측면에서는 여전히 한계가 있다. 결국 향후 학습 인프라의 다양성은 NVL72급 메가커널 기반의 대규모 학습과 MI300X 같은 단일 노드 대규모 메모리 기반 학습이 양대 축을 이룰 가능성이 높으며, MoK는 전자의 대표 사례로 기록될 것으로 보인다.

참고 자료: MarkTechPost 원문, Hacker News 요약 스레드

정리하면

  • MoK는 MoE 학습의 통신과 연산을 단일 결정적 메가커널로 통합해 공개 베이스라인 대비 최대 2.37배 학습 속도를 제공한다.
  • 필수 하드웨어가 Blackwell SM100/SM103 GPU와 GB300 NVL72 랙으로 한정되어 있어 소규모 연구실의 즉시 활용은 어려운 것으로 보인다.
  • 오픈소스 공개로 대규모 랙 보유 기관은 학습 비용과 재현성 측면에서 새로운 기준점을 확보할 수 있게 되었다.
  • MoK와 AMD MI300X 단일 노드 학습 사례의 대비를 통해 향후 학습 인프라 다양성 구도가 본격화될 것으로 전망된다.
관련 키워드: Mixture-of-Kittens, MoK, Mixture-of-Experts, MoE 메가커널, Cursor Research, Composer, GB300 NVL72, Blackwell SM100, Blackwell SM103, 결정적 학습, 오픈소스 AI, 분산 학습 최적화, AI 인프라, 대규모 학습

댓글 남기기