제01권 · 제10호 데일리 디스패치 2026년 7월 21일

최신 AI 뉴스 모음집

AI · 논문데일리 큐레이션공개 아카이브
AI 뉴스Research
약 5분

PagedWeight, 전문가 기반 언어 모델의 GPU 메모리를 최대 72% 절감

실행 중 가중치를 압축하면서 16비트 부동소수점 수준 정확도를 유지해 메모리 제약 서빙을 완화한다. 여기에 카메라 이동에도 강한 로봇 좌표계 입력과 Ray 2.56.1의 데이터 변환 오류 수정이 더해졌다.

읽기 모드

한 줄 요약

서빙 시 정밀도와 표현 방식을 다듬어 기존 컴퓨팅을 더 활용한다: 전문가 기반 모델의 동적 가중치 양자화, 로봇 좌표계 입력으로 시점 변화 대응, 그리고 Ray 업데이트로 데이터 파이프라인 안정화.

Research Papers

PagedWeight: 전문가 혼합 모델 서빙에서 메모리를 동적으로 줄이기

PagedWeight는 실행 중 전문가 가중치를 압축해 제한된 메모리에서도 모델을 돌리도록 돕고, 키-값(Key-Value, KV) 캐시가 차지하는 메모리에 맞춰 압축 수준을 조정하는 서빙용 방법이다. 전문가 혼합(Mixture of Experts, MoE) 대형 언어 모델(Large Language Model, LLM)은 소수의 전문가 서브네트워크로 토큰을 라우팅해 효율을 얻지만, 긴 대화에서는 키-값(KV) 캐시가 메모리 대부분을 차지해 모델 가중치 공간을 압박한다. PagedWeight는 런타임에 전문가 가중치를 동적으로 양자화하고, 전문가 정밀도와 KV 캐시 크기를 균형 있게 조절해 품질·메모리·지연 시간을 함께 관리한다. 1

논문에 따르면 메모리에 민감한 MoE 서빙 시나리오에서 PagedWeight는 16비트 부동소수점(FP16)과 동등한 정확도를 유지하면서 그래픽 처리 장치(Graphics Processing Unit, GPU) 메모리를 최대 72.0% 절감하고 처리량을 최대 1.94배 높인다. 동일한 메모리 예산에서 기존 가중치 양자화 방법 대비 출력 품질을 최대 39.3% 개선하면서 처리량 손실은 최대 4.1%에 그친다. 1

작동 방식은 운영체제의 페이징과 비슷하다. KV 캐시가 커지면 일부 전문가의 정밀도를 낮추고, 메모리 압박이 줄면 다시 정밀도를 높인다. 긴 컨텍스트의 MoE 어시스턴트를 운영하는 입장에서는 고정된 절충이 아니라 품질과 비용 사이의 곡선을 조절할 수 있게 되며, 논문은 다양한 워크로드에서 설정값에 따라 곡선이 어떻게 이동하는지 제시한다. 1

See like a Robot: 로봇 좌표계 포인트맵으로 시점이 바뀌어도 지시를 따르게

이 논문은 로봇이 보는 장면을 로봇 고유의 좌표계로 표현한 지도를 입력으로 제공해, 카메라 시점이 달라져도 행동이 일관되게 맞물리도록 한다. 비전-언어-행동(Vision-Language-Action, VLA) 모델은 보통 카메라 좌표계에서 이미지를 관찰하지만 실제 행동은 로봇 좌표계에서 정의되어, 다양한 카메라 구성이 섞인 대규모 데이터셋일수록 관찰-행동 간 좌표계 불일치 문제가 커진다. 2

포인트맵은 각 픽셀에 해당 장면 점의 3차원 좌표(로봇 좌표계 기준)를 저장해, 2차원 사전학습 VLA가 기대하는 H×W 격자를 유지하면서도 로봇 프레임의 3D 정보를 제공한다. RoboCasa에서 포인트맵은 pi0.5와 SmolVLA 모두를 개선하고, 대표적인 카메라-시점 및 3D 인지 베이스라인을 앞섰다. 실제 로봇 실험에서도 카메라를 훈련에 없던 위치로 옮기면 RGB(적색-녹색-청색)만 쓰는 정책보다 격차가 더 벌어졌다. 2

Open Source & Repos

Ray: 분산 AI 실행 엔진 2.56.1 릴리스의 데이터 변환 수정

Ray는 AI 워크로드를 위한 분산 실행 엔진이다. 2.56.1 릴리스에는 Ray Data의 pandas 변환 관련 수정이 다수 포함됐다. Arrow 기반 변환을 끌 수 있는 플래그(RAY_DATA_ENABLE_ARROW_BACKED_PANDAS_CONVERSION), int64/double[pyarrow] 결합 시 오버플로로 인한 크래시, TensorDtype.from_arrow 크래시가 고쳐졌다. 3

학습·서빙 파이프라인에서 Ray Data로 전처리하고 pandas로 넘기는 팀에게는, 다운스트림 코드가 Arrow 동작에 민감할 때 실패를 줄이고 회피 수단을 제공한다. 2.56로 올렸다가 회귀 문제를 겪은 경우, 2.56.1은 버전을 되돌리지 않고 안정성을 보강한다. 3

왜 중요한가

전문가 기반 LLM의 서빙 시 정밀도 스케줄링(PagedWeight)과 시점 변화에도 강한 로봇 좌표계 입력은, 각각 메모리 압박과 좌표계 불일치라는 시스템 제약을 다뤄 같은 하드웨어와 데이터로도 품질을 유지하도록 돕는다. 1

인프라 측면에서는 Ray 같은 핵심 라이브러리의 정밀한 수정이 파이프라인 중단과 롤백을 예방해, 데이터 준비·변환 병목에서 실질 처리량을 높이는 효과를 낼 수 있다. 3

출처 3

도움이 되었나요?

댓글 (0)