제01권 · 제10호 데일리 디스패치 2026년 8월 16일

최신 AI 뉴스 모음집

AI · 논문데일리 큐레이션공개 아카이브
AI 뉴스Research
약 5분

추측 디코딩이 트리로 확장: DARTree, 최대 9.73배 속도 향상

학습 없이 토큰 초안을 트리로 일괄 확장·검증해 라운드당 12.97토큰까지 수용 길이를 늘리면서 출력은 동일하게 유지했다. 슬라이딩 순환 메모리와 생각 단위 빔서치 논문도 함께 효율을 끌어올린다.

읽기 모드

한 줄 요약

트리형 추측 디코딩, 슬라이딩 순환 메모리, 생각 단위 빔서치가 추론 단계에서 속도·정확도·메모리 효율을 동시에 끌어올린다.

Research Papers

DARTree: 트리 기반 추측 디코딩으로 생성 가속

대형 언어 모델(LLM)의 답을 바꾸지 않으면서 더 빠르게 생성하기 위해, DARTree는 다음 토큰 후보를 한꺼번에 많이 제안하고 단일 체인 대신 트리로 검증한다. 이는 여러 초안 토큰을 병렬 검증하는 추측 디코딩을 확장해, 고정 폭 트리를 만들어 병렬로 확인하면서도 표준 디코딩과 동일한 출력을 유지한다. 1

DARTree는 학습이 필요 없다. 사전에 학습된 자기회귀(Autoregressive, AR) 보정 헤드를 재사용하되, 순차 체인에서 트리로 일반화한다. 각 깊이의 모든 노드를 한 번에 배치 확장·점수화하고, 최우선 탐색으로 검증 트리를 고르는 방식으로 AR 헤드 추론을 순차적인 힙 연산에서 분리한다. 1

수학·코드·대화 7개 벤치마크와 4가지 모델–온도 조합 전반에서 평균 수용 길이와 속도 향상이 가장 높게 보고됐다. 검증 라운드당 최대 12.97토큰을 받아들이며(동일 설정에서 DFlash 대비 98.6%, Domino 대비 27.9% 더 김), 로컬 측정 자기회귀 디코딩 대비 최대 9.73배 손실 없는 속도 향상을 달성했다. 1

후보 확장이 고정 폭 배치로 이뤄지고 보정 헤드를 그대로 쓰기 때문에, GPU 친화적 배치에 맞고 추가 학습이 필요 없다는 점에서 기존 추측 디코딩 환경의 실용적 업그레이드로 볼 수 있다. 1

Maglev: 슬라이딩 순환 메모리로 긴 문맥 효율화

Maglev는 고정 크기 메모리를 유지하는 Transformer 구조를 제안한다. 더 표현력이 큰 ‘프리필러’가 슬라이딩 윈도 디코더에 무엇을 기억할지 가르치는 방식이다. 프리필러 Q는 전체 주의와 슬라이딩 윈도 주의를 교차 사용해 메모리 목표를 만들고, 디코더 P는 슬라이딩 윈도 주의와 순환 키/값(KV) 주입만으로 다음 토큰을 예측한다. 2

메모리 일치 손실로 디코더 메모리를 교사 타깃과 정렬해 추론은 P만으로 수행한다. 실험에서는 슬라이딩 윈도·잠재 순환 Transformer 기준선 대비 검증 손실과 사전학습 연계 벤치마크가 향상됐고, P와 Q의 매개변수 공유로 매개변수 메모리를 줄이면서도 대부분의 이득을 유지했다. 2

Gambit: 생각 단위 빔서치로 연산 배분

Gambit은 단계적 추론을 부분 생각 상태의 탐색 문제로 보고, 유망하지 않은 경로는 가지치기하고 강한 접두사에서 즉시 분기해 연산을 가장 유망한 경로에 집중시킨다. 많은 전체 추론 경로를 독립적으로 돌리는 대신, 은닉 상태를 가볍게 점수화해 고정된 자원에서 하드웨어 활용도를 높인다. 3

동일 하드웨어 제약에서 Gambit은 가지치기 기준선 대비 HMMT-24에서 정확도 +6.7%포인트, AIME-25에서 +3.3%포인트를 보고했고, 추론 경로 완성 처리량은 2배 넘게 높였으며, 표준 병렬 샘플링 대비 토큰 소비를 최대 68.5% 줄였다. 3

왜 중요한가

세 논문은 추론 단계 효율성에 수렴한다. 트리 기반 제안·검증으로 더 빠른 생성(DARTree), 고정 크기 메모리로 긴 문맥 유지(Maglev), 다단계 추론에서 연산 집중(Gambit)이다. 공통점은 기본 모델을 다시 학습하지 않고도 동일한 하드웨어를 더 똑똑하게 배치해 속도·정확도·메모리 여유를 얻는다는 점이다. 123

운영 관점에서 주시할 변수는 라운드당 수용 길이(DARTree), 디코더–교사 메모리 정렬(Maglev), 점수화 오버헤드와 처리량의 균형(Gambit)이다. 논문은 통제된 설정에서 이러한 트레이드오프를 수치로 제시하며, 실제 배치에서는 배치 폭, 커널 오버헤드, 긴 문맥 부하에 따른 변화를 확인할 필요가 있다. 123

출처 3

도움이 되었나요?

댓글 (0)