메타, 300억 매개변수 로컬 에이전트 모델 공개 — Apache 2.0
메타의 Muse Glimmer는 도구 호출·자기 점검까지 수행하는 로컬 에이전트를 위해 공개 가중치를 제공하며, 4비트 양자화와 추론 가속으로 24–32GB GPU 한 장에 맞춘다. 엔비디아는 로컬 실행 방법을 공개했고, 장문 비디오 설명 평가와 장문 검색 비용 절감을 다룬 논문도 나왔다.
한 줄 요약
메타가 300억 매개변수 공개 가중치 모델로 로컬 에이전트를 현실화했고, 엔비디아가 로컬 실행 경로를 제시했으며, 장문 비디오 설명 평가와 장문 검색 효율을 다룬 논문이 실무 지표와 비용 절감을 보탠다.
LLM & SOTA Models
Meta Muse Glimmer: Apache 2.0으로 공개된 로컬 에이전트 모델
메타는 고급형 그래픽 처리 장치(GPU) 한 장으로 맥이나 PC에서 실행할 수 있는 300억 매개변수 모델 Muse Glimmer를 공개했다. 이 모델은 계획 수립, 도구 호출, 결과 점검, 실패 복구까지 수행하는 에이전트 작업에 맞춰 설계됐고, 관대한 Apache 2.0 라이선스로 가중치를 공개했다. 전용 인지 인코더로 텍스트와 이미지를 섞어 입력받고, 널리 쓰이는 에이전트 스캐폴드와 호환되도록 만들어졌다. 1
소비자용 하드웨어에 맞추기 위해 약 4비트 양자화 빌드를 제공해 언어 모델을 20GB 미만 비디오 메모리(VRAM)로 줄였고, 그 안에 키-값(KV) 캐시, 인지 인코더, DFlash 추론 기법의 ‘드래프터’를 더해 24GB 또는 32GB 구성에 맞춘다. 메타는 RTX 5090에서 3.1배(초당 74.9→233.4 토큰), Apple M5 Max에서 1.8배(26.6→50.2), M4 Max에서 1.5배(23.7→37.8) 속도 향상을 보고했으며, 출력 품질은 표준 디코딩과 동일하다고 밝혔다. 2
Glimmer는 에이전트 루프에 맞춰 훈련되었고 더 큰 Muse Spark에서 로그잇 증류로 지식을 이전받은 뒤, 장문·에이전트 중심 데이터로 중간 학습을 거치고 지도 미세조정과 강화 신호를 혼합해 후속 학습을 마쳤다. 한편 메타는 Muse Spark 1.1을 새로운 응용프로그램 인터페이스(API)를 통해 외부 개발자에게 제공하며, 고도화 AI 스케일링 프레임워크 기준에서 완화책 적용 후 ‘중간 이하’ 위험으로 운영된다고 평가했다. 3
주목할 점: 실제 처리량과 도구 체인의 완성도다. 엔비디아 기술 문서는 로컬 배포 경로를 제시하고 Blackwell Ultra에서 GPU당 2만 토큰/초 이상의 처리량을 언급했으며, 커뮤니티는 소프트웨어 지원이 확장되는 가운데 체감 성능의 트레이드오프를 점검 중이다. 4
NVIDIA: Muse Glimmer로 로컬 에이전트 워크플로 실행
엔비디아는 GeForce RTX 5090, DGX Station, Jetson 등 자사 플랫폼 전반에서 Muse Glimmer를 완전 로컬로 실행하는 방법을 제시했다. 데이터가 장치를 벗어나지 않는 ‘프라이버시 중심’ 접근과 장문(120K+ 토큰) 처리, 장시간 멀티스텝 에이전트에 필요한 신뢰성과 처리량을 강조한다. 4
배포 경로는 다양하다. 오픈소스 서빙용 SGLang·vLLM, 한 번에 띄우는 NIM 컨테이너, 그리고 NeMo 도구로 지도 미세조정(SFT)과 저랭크 적응(LoRA)을 지원한다. Blackwell Ultra에서 GPU당 2만 토큰/초 이상 처리량을 제시하며, 규제 준수가 필요한 온프렘 에이전트 파이프라인에 적합하다고 설명한다. 4
Research Papers
CLIP-CC-Bench: 문단 길이 비디오 설명 평가 세트
이 논문은 90초 안팎의 긴 클립에 대해 문장 하나가 아니라 문단 단위 설명을 제대로 쓰는지 평가하는 CLIP-CC-Bench를 소개한다. 데이터는 영화 5시간 분량에서 추출한 클립으로 구성되며, 각 클립에는 전문가 작성 문단 참조가 붙는다. 5
단일 모델 편향을 줄이기 위해 대형 언어 모델(LLM) 기반 임베딩 모델 5개를 앙상블로 쓰고, 거친 의미 매칭과 세밀한 의미 매칭을 함께 적용해 점수를 낸다. 최첨단 17개 모델을 평가하고 표준화된 스크립트와 집계 도구를 공개했으며, 평가자 간 합치도와 부트스트랩 안정성으로 내부 신뢰도를 보고한다. 5
CoinRAG: 조각 단위 KV 재사용으로 장문 RAG 효율 향상
CoinRAG는 장문 검색 증강 생성(RAG)에서 문서 ‘덩어리’ 전체 대신 질의와 관련된 세밀한 ‘정보 조각’ 단위로 키-값(KV) 캐시를 재사용해 불필요한 프리필을 줄이고 핵심 정보만 남긴다. 두 단계 검색으로 관련 조각을 고른 뒤, 잘라낸 KV 표현을 비용 적게 조합한다. 6
LongBench 다단계 질의응답에서 CoinRAG는 빠른 프리필 지연 예산 내에서 새로운 파레토 전선을 만들었고, 정답 품질(F1) 평균 5.3% 상대 향상을 보였다. 같은 지연에서 더 높은 정확도, 혹은 같은 정확도에서 더 낮은 비용을 가능하게 해 커지는 컨텍스트 창에서 특히 유용하다. 6
커뮤니티 반응
Hacker News (955↑) — 간결하고 토큰 효율적인 응답 장점과, 처리량·미스율 같은 실성능과 소프트웨어 성숙도 이슈가 교차했다. 7
"제 경험으로는 dflash를 끈 상태에서 초당 23–24 토큰(t/s)이 나오는데, 켜면 약 9 t/s로 곤두박질치고 미스율이 50%를 넘습니다. 모델 페이지/카드에 적힌 동일한 장치를 사용 중입니다. 소프트웨어가 따라잡을 때까지 기다려야 할지도 모릅니다." — Hacker News 7
"하루 정도 써보니 glimmer는 왓치맨의 로샤크를 떠올리게 합니다. 불필요한 말이 없고 행동 지향적이며 간결합니다. 토큰 관점에서는 훌륭하고, 더 장황한 모델들에 비교해도 제 역할을 잘 하는 것 같습니다. 낭비가 없어서 초당 유효 토큰 처리량이 훨씬 높다고 느낍니다." — Hacker News 7
왜 중요한가
로컬 우선 에이전트 워크플로가 데모를 넘어 실제 실행 단계로 이동하고 있다. 공개 가중치, 관대한 라이선스, 구체적 배포 레시피가 결합해 민감한 데이터와 도구 사용 작업에서 노출과 토큰 단가 부담을 함께 줄인다. 1
동시에 장문 비디오 설명 평가(CLIP-CC-Bench)와 장문 검색 최적화(CoinRAG) 같은 기법은 현업 개발자에게 더 명확한 지표와 더 낮은 비용을 제공한다. 긴 문서를 읽고 시간에 걸쳐 추론해야 하는 로컬 에이전트에 특히 잘 맞는 조합이다. 6
댓글 (0)