제01권 · 제10호 데일리 디스패치 2026년 7월 29일

최신 AI 뉴스 모음집

AI · 논문데일리 큐레이션공개 아카이브
AI 뉴스Research
약 8분

문샷 AI, Kimi K3 가중치 공개…기업용 라이선스 조건 동반

2.8조 파라미터의 전문가 혼합 모델이 100만 토큰 컨텍스트와 자체 호스팅용 도구와 함께 공개됐다. 다만 연간 2,000만 달러 이상 매출의 ‘서비스형 모델’ 사업자는 별도 계약이 필요하고, 대규모 서비스에는 화면상 출처 표기가 요구된다.

읽기 모드

한 줄 요약

가중치 공개가 기업 현장에 들어오고, 연구는 온디바이스 비전 가속과 시각 토큰 절약으로 실용 속도를 끌어올린다.

LLM & SOTA Models

문샷 AI: Kimi K3 가중치 공개와 기업용 라이선스 조건

문샷 AI가 Kimi K3의 모델 파일(가중치)을 내려받아 자체 서버에서 돌릴 수 있게 했고, 이제 API(응용 프로그램 인터페이스)만이 유일한 경로는 아니다. 다만 공개에는 기업에 중요한 별도 라이선스가 따른다. ‘서비스형 모델(Model as a Service)’을 운영하면서 연속 12개월 합산 매출이 2,000만 달러를 넘는 경우 별도 계약이 필요하고, 월간 활성 사용자(MAU)가 1억 명을 넘거나 월매출 2,000만 달러를 넘는 상용 제품은 UI에 “Kimi K3”를 명시해야 한다. 사내 전용 내부 활용은 예외다. 1

K3는 전문가 혼합(Mixture of Experts, MoE) 구조의 2.8조 파라미터 모델로, 896개 전문가 풀에서 토큰마다 16개를 골라 활성화해 매 토큰당 1,040억 파라미터가 계산에 참여한다. 100만 토큰 컨텍스트를 지원하며 텍스트·이미지·영상 입력을 기본으로 처리한다. 장문 컨텍스트와 멀티모달 추론을 위해 Kimi Delta Attention, Stable LatentMoE 같은 설계를 제시한다. 2

문샷은 가중치뿐 아니라 주의(attention) 커널, MoE 통신 라이브러리, 배포 컴포넌트 등 운영 도구도 함께 공개했고, vLLM과 SGLang 같은 서빙 생태계 연동도 제공한다. 모델 가중치는 허깅페이스에서 내려받을 수 있으며, API 요금은 입력 100만 토큰당 3달러, 출력 100만 토큰당 15달러다. 3

Tom’s Hardware는 K3가 선도급 폐쇄 모델에 견줄 능력을 보이면서도 실행 비용이 2~3배 낮을 수 있고, 캐시 적중이 높은 코딩 작업에서는 최대 10배 절감까지 가능하다고 전한다. 또한 ‘오픈 웨이트’는 ‘오픈 소스’와 다르며, 상용 조건이 붙을 수 있음을 강조한다. 이 비용 비교는 독립 검증이 아닌 공급사 보고 수치로 이해해야 한다. 4

Open Source & Repos

SGLang: 대형·멀티모달 모델 고성능 서빙 프레임워크

SGLang은 대형 언어 모델(LLM)과 멀티모달 모델을 빠르게 제공하기 위한 고성능 서빙 프레임워크로, 낮은 지연과 높은 처리량이 필요한 개발자·운영자를 겨냥한다. 효율적인 스케줄링·배칭·메모리 사용으로 동일 하드웨어에서 더 많은 요청을 처리하도록 설계됐다. 5

문샷의 Kimi K3 발표는 vLLM과 함께 SGLang 지원을 명시해, 새 라이선스 조건 안에서 K3급 모델을 자체 호스팅하거나 시제품을 만들려는 팀에 실용적 선택지를 제시한다. 1

Research Papers

UltraViT: 온디바이스 비전 인코더를 빠르게

UltraViT는 대형 비전-언어 모델(LVLM)을 휴대폰·엣지 기기에서 더 짧은 지연으로 쓰기 위해 비전 인코더를 실제 기기 지연에 맞춰 다시 설계했다. 피라미드 구조로 서로 다른 공간 연산자를 매크로 블록 수준에서 혼합해 종단 간 지연을 줄인다. 6

훈련은 2단계 생성 사전학습으로 진행된다. 먼저 조밀 증류로 공간 특징을 기르고, 이어 동결된 혼합 용량의 대형 언어 모델(LLM)로부터 직접 생성 감독을 받는다. 저자들은 인코더 중심 효율 기준선들을 크게 앞서며, 온디바이스에서 거의 1.7배 빠른 속도를 보인다고 보고한다. 6

GOTS: 고해상도 VLM 토큰을 똑똑하게 줄이기

GOTS(Greedy Orthogonal Token Selection)는 고해상도 비전-언어 모델(VLM)이 뽑는 방대한 시각 토큰 중 ‘이미 보유한 정보와 직교하는, 새로운 정보’를 담은 토큰을 우선 보존해 언어 모델 단계의 부담을 줄인다. 학습 필요가 없는 쿼리 무관 방식으로, 현재 보유한 부분공간에 직교하는 잔여 에너지가 가장 큰 토큰을 탐욕적으로 선택한다. 7

다섯 개 백본과 열한 개 벤치마크에서 강력한 기준선들보다 평균 성능 보존이 높았고, OCRBench 통제 실험에서는 선택 오버헤드를 감안해도 첫 토큰까지의 시간을 줄였다고 보고한다. 7

WorldDiT: 세계·행동을 함께 예측하는 디퓨전 변환기

WorldDiT는 하나의 디퓨전 트랜스포머로 미래 카메라 프레임의 패치(세계 모델링)를 예측하고 연속적 행동 청크(정책)도 생성해, 거대한 사전학습 VLM에 행동 생성을 의존하지 않는다. 훈련 시 하나의 모델이 행동을 내고 미래 프레임의 정규화된 RGB 패치 타깃도 재구성하도록 학습한다. 8

네 가지 LIBERO 시뮬레이션 스위트에서, 전체 파라미터 수와 평균 성공률의 파레토 경계에 위치했다고 보고하며, 향후 스케일링 연구를 위한 10억 파라미터 미만의 강력한 기준선을 제시한다. 8

ClinFusion: 의료 영상 중심 멀티모달 LLM

ClinFusion은 2D와 3D 의료 영상을 통합하는 합성·계단식 비전 인코더를 갖춘 비전 중심 멀티모달 대형 언어 모델(MLLM)이며, 영상에 근거한 평가 체계(예: MedIF-Bench, 관심 영역(Region of Interest, RoI) 기반 지표)로 임상과 일치하는 검증을 시도한다. 9

저자들은 광범위한 2D/3D 멀티모달 의료 벤치마크에서 새로운 최고 성능을 보고했고, 24개 중 20개에서 공개 의료 MLLM을 앞서며, 16개 중 13개에서는 GPT-5.2와 Gemini-3-Flash 같은 상용 모델도 능가했다고 주장한다. 또한 전문의 블라인드 평가에서 가장 높은 보고서 품질을 얻었다고 밝힌다. 9

왜 중요한가

Kimi K3 같은 오픈 웨이트 공개는 데이터·배포·비용 통제권을 원하는 팀에 힘을 실어준다. 동시에 ‘오픈 웨이트’와 ‘오픈 소스’의 법적 경계가 뚜렷해지고 있어, 정확도와 단가뿐 아니라 라이선스 발동 요건, 출처 표기, 장문 컨텍스트의 실사용 안정성이 조달 판단의 핵심 변수가 되고 있다. 10

이번 주 시도해볼 것

  1. SGLang 빠른 시작: GitHub에서 설치해 예제 모델을 돌리며 고처리량 서빙 흐름을 익힌다. https://github.com/sgl-project/sglang
  2. Kimi K3 라이선스 읽기: 자체 호스팅을 고민하기 전에 VentureBeat 요약으로 핵심 조항을 점검한다. https://venturebeat.com/technology/kimi-k3s-full-weights-are-here-but-theyre-open-with-a-caveat-what-enterprises-should-know

출처 10

도움이 되었나요?

댓글 (0)