제01권 · 제10호 데일리 디스패치 2026년 8월 9일

최신 AI 뉴스 모음집

AI · 논문데일리 큐레이션공개 아카이브
AI 뉴스Research
약 7분

KVAE, 텍스트 조건 생성용 오디오·이미지·비디오 토크나이저 공개

새로운 KVAE 패밀리는 48 kHz 오디오를 50 Hz 잠재(64채널)로 압축하고, 4×16×16·4×8×8 압축의 인과적 비디오 토크나이저, 8× 압축의 이미지 토크나이저를 추가했다. Wan‑2.2, HunyuanVideo‑1.5, FLUX.2, MovieGen, StableAudio, MMAudio의 공개 VAE와 동급 또는 우수하다고 보고하며, 코드와 학습 세부를 공개했다.

읽기 모드

한 줄 요약

멀티모달 기반기술이 진화한다: 새 토크나이저 패밀리, 코드 기반 도구 호출, 비용을 줄이는 에이전트 평가, 2.8조 파라미터 모델을 지원하는 서빙 스택.

Research Papers

KVAE: 오디오·이미지·비디오 토크나이저

KVAE는 오디오·이미지·비디오를 작은 잠재 표현으로 바꿔 생성 모델이 더 효율적으로 학습하고 합성하도록 돕는 ‘번역기’ 묶음이다. KVAE-Audio는 연속형 전대역 48 kHz를 50 Hz 잠재(64채널)로 압축하고, KVAE-3D는 4×16×16과 4×8×8 압축의 인과적 비디오 토크나이저 2종을 제공하며, KVAE-2D는 이미지를 8배로 압축(32채널)한다. 1

잠재 확산 모델링(Latent Diffusion Modeling, LDM)에서는 토크나이저가 원신호의 압축 방식을 결정하기 때문에 학습 속도와 출력 품질을 좌우한다. 논문은 최대 신호 대 잡음비(PSNR), 학습 기반 지각 이미지 유사도(LPIPS), 음성 품질 지각 평가(PESQ) 같은 복원 지표와, 대조적 언어-이미지 사전학습(Contrastive Language–Image Pretraining, CLIP) 점수, 프레셰 거리 등 생성 지표에서 Wan‑2.2, HunyuanVideo‑1.5, FLUX.2, MovieGen, StableAudio, MMAudio의 공개 변분 오토인코더(Variational Autoencoder, VAE) 기준선과 동급 또는 우수하다고 보고하며, 코드와 학습 세부를 공개한다. 1

텍스트 조건 생성 워크플로에서 모달리티별 일관된 토크나이저 패밀리를 갖추면 파이프라인 단순화와 재사용성이 높아진다. 저자는 모델 선택과 설계 선택에 대한 소거 실험을 함께 제공해, 일회성 부품이 아닌 재사용 가능한 구성요소로 자리매김한다. 1

지속 학습: 파라미터 중심에서 시스템 중심으로

이 서베이는 지속 학습이 가중치 미세조정에 그치지 않고, 학습 시점(사전·사후·추론 시), 업데이트 방식(오프정책·온정책·그라디언트 외), 업데이트 위치(내부 파라미터 대 외부 메모리·프로토콜 등)까지 포괄하는 시스템 수준 적응으로 전환되고 있다고 정리한다. ‘언제·어떻게·어디서’라는 삼축 틀로 방법들을 분류한다. 2

보완적으로, 사후 적응을 메커니즘·목표·데이터 요구·지속성·구조 범위·모델 유형의 여섯 차원으로 분류하는 서베이는 미세조정, 검색 증강 생성(Retrieval-Augmented Generation, RAG), 프롬프팅 같은 용어 혼선을 바로잡고 문서화·변경 추적·거버넌스의 중요성을 강조한다. 이는 기초 모델, 대형 언어 모델(LLM), 멀티모달 체계 전반의 적응 층위를 정돈한다. 3

프로그램 코드 기반 도구 호출, 14개 중 11개 모델에서 JSON을 상회

자바스크립트 객체 표기법(JSON) 스키마를 채우는 대신, 프로그래밍 방식 도구 호출(Programmatic Tool Calling, PTC)은 모델이 짧은 파이썬 코드를 작성해 도구를 호출하고, 실행과 결과를 한 번의 에이전트 턴에서 처리한다. 14개 모델을 비교한 결과, PTC는 11개 모델에서 기본 JSON 도구 호출과 동률 또는 우위를 보였고, GPT‑5.6 계열에서는 JSON 기준선 대비 10.6% 향상이 보고됐다. 4

병렬 분기 상황에서도 14개 중 13개 모델에서 동률 또는 우위를 보였고, 문맥 변질 조건에서도 JSON 기준선이 평균 2.3% 하락하는 반면 PTC는 안정적으로 유지됐다. 실무적 이점은 취약한 스키마 조합 대신 코드로 자연스럽게 연쇄와 병렬화를 구성할 수 있다는 점이다. 4

AV-AIVAT: 증거가 충분해지면 멈추는, 인증 가능한 조기 종료 평가

에이전트의 우열을 가리려면 많은 판을 치러야 하는데, AV-AIVAT는 “증거가 충분해지는 즉시 멈추는” 통계적 보증을 더해 비용을 줄인다. 행동 정보 기반 가치 평가 도구(Action-Informed Value Assessment Tool, AIVAT)의 분산 감소와, 연속 모니터링 신뢰 시퀀스(Confidence Sequences, CS)를 결합해, 15개 LLM 에이전트 구성·71,439쌍의 헤즈업 노리밋 홀덤(Heads-Up No-Limit Hold’em, HUNL) 핸드에서 중앙값 54배 분산 감소를 보였다. 5

명목 95% 수준과 ±1 빅 블라인드 정밀도 목표에서, 점근적 신뢰 시퀀스(Asymptotic Confidence Sequences, AsympCS) 기준 원시 결과는 AIVAT 보정 결과보다 중앙값 74배 더 많은 핸드가 필요했다. 경험적-베른슈타인 신뢰 시퀀스(Empirical-Bernstein Confidence Sequences, EB-CS)는 정확한 유한표본 인증을 제공해, 멈추는 그 시점의 판단을 제3자가 재검증할 수 있게 한다. 5

Open Source & Repos

SGLang: 2.8조 파라미터 LatentMoE 모델의 데이‑0 서빙 지원

대형 언어 모델(LLM)과 멀티모달 모델용 고성능 서빙 프레임워크 SGLang이 2.8조 파라미터의 멀티모달 전문가 혼합(Mixture of Experts, MoE) 모델 Kimi K3에 대한 데이‑0 지원을 알렸다. 1M 토큰 컨텍스트 창, 896명의 전문가에서 상위 16 경로 라우팅, 3584차원 잠재 공간, 선형 어텐션 레이어 등의 구성을 밝혀, 매우 큰 장문 컨텍스트 MoE 워크로드를 스케줄링·스트리밍할 수 있음을 시사한다. 6

새 모델을 신속히 도입해야 하는 팀에게 데이‑0 지원은 통합 지연을 줄이고, 가중치나 엔드포인트가 공개되는 즉시 벤치마크·추론 실험을 가능케 한다. 6

왜 중요한가

토크나이저는 기반기술이다. LDM 파이프라인에서 샘플 품질과 학습 효율의 상한을 정하며, 공개 소스와 소거 실험이 동반된 릴리스는 오디오·이미지·비디오 전반에서 품질과 재현성의 기준을 세우는 데 기여한다. 1

에이전트 실무도 현실적으로 변하고 있다. 코드 기반 도구 호출은 측정 가능한 이득(여기서는 10.6%)과 간단한 연쇄 구성을 보여주고, 통계적으로 타당한 조기 종료는 평가 사이클을 줄인다. 동시에 2.8조급 장문 컨텍스트 서빙을 뒷받침하는 인프라가 뒤따른다는 점도 읽힌다. 4

이번 주 시도해볼 것

  1. KVAE 논문 훑어보기: 초록과 그림에서 오디오·비디오·이미지 토크나이저 구성을 확인한다. https://arxiv.org/abs/2608.05798
  2. SGLang 퀵스타트: 저장소 README를 보고 로컬 모델 서빙과 장문 프롬프트 테스트를 해본다. https://github.com/sgl-project/sglang

출처 7

도움이 되었나요?

댓글 (0)