엔비디아, 에이전트 실행 가속 위한 Nemotron 3.5 Lightning·NeMo Switchyard 공개
총 300억(활성 30억) 매개변수 모델이 최대 4배 빠른 출력과 PinchBench 1만 건 30% 단축을 보고했고, 라우팅 라이브러리는 내부 테스트에서 비용을 거의 3분의 1로 낮췄다.
한 줄 요약
에이전트형 AI가 단일 모델에서 모델 조합으로 이동한다: 엔비디아는 전문 모델+라우터를 내놓았고, 시각 에이전트 연구는 선택적 보기로 지연·오류를 줄였으며, 핵심 레포는 도구를 보강했다.
LLM & SOTA Models
엔비디아 Nemotron 3.5 Lightning·NeMo Switchyard: 에이전트 실행 가속
엔비디아는 AI 에이전트의 반복 작업을 전담하는 소형 전문 모델과, 워크플로 단계별로 가장 알맞은 모델을 자동으로 고르는 라우팅 라이브러리를 공개했다. 두 구성요소는 더 빠르고 저렴한 에이전트 실행을 겨냥하며, 로컬 PC부터 데이터센터까지 폭넓게 배치할 수 있고 모델 가중치와 라우터는 주요 허브·GitHub에서 이용 가능하다. 1
Nemotron 3.5 Lightning은 총 300억 매개변수(활성 30억)를 가진 하이브리드 전문가 혼합(MoE) 모델로, Mamba‑2·MoE·어텐션 레이어를 교차 배치했다. 최대 100만 토큰 컨텍스트를 지원하며, 한 번에 여러 토큰을 예측하는 다중 토큰 예측(MTP)을 내장해 생성 속도를 높인다. 모델 카드는 20조 토큰 이상으로 개발됐음을 밝히고 재현 가능한 벤치마크 레시피를 제공한다. 2
성능 지표는 처리량과 완료 시간 단축에 맞춰져 있다. 유사 크기 모델 대비 최대 4배 출력 속도를 보고했고, PinchBench 작업 1만 건을 Qwen3.6 35B와 유사 정확도에서 30% 더 빠르게 완료하며 PinchBench 정확도 86%를 기록했다고 전한다. 이러한 수치는 대형 계획자 아래에서 실행을 담당하는 “모델 조합” 아키텍처의 작업마로서 Lightning의 위치를 보여준다. 3
NeMo Switchyard는 각 단계 프롬프트를 품질·지연·비용 우선순위에 맞춰 가장 적합한 모델로 보내는 오픈 소스 라우터다. 엔비디아는 Opus 4.8 단독 대비 비용을 거의 3분의 1로 낮추면서 정면급 정확도를 유지한 내부 테스트를 제시했고, 파트너 사례로는 LangChain이 145개 멀티턴 Deep Agents 과제에서 프런티어 호출 비율을 7%로 제한해 비용을 74% 절감(정확도 약 6포인트 하락)했고, Ramp가 SWE‑Bench에서 프런티어 성능에 근접하면서 비용 58%·런타임 33%를 줄였다고 밝혔다. 1
Open Source & Repos
PyTorch: 파이썬 텐서·동적 신경망 프레임워크
PyTorch는 텐서 연산과 동적 신경망을 제공하는 파이썬 패키지로, 강력한 그래픽 처리 장치(GPU) 가속을 지원한다. NumPy, SciPy, Cython과 자연스럽게 연동해 확장할 수 있다. 4
프로젝트의 기준 저장소는 진입점 역할을 하며, 지속적 통합(CI) 대시보드(hud.pytorch.org)를 통해 현재 트렁크 상태를 공개한다. 도입이나 기여를 검토한다면 README와 CI 보드를 먼저 확인해 지원 환경과 건강 상태를 맞춰보는 것이 유용하다. 4
Code-Graph-RAG: 모노레포용 코드 지식 그래프 RAG
Code‑Graph‑RAG는 지식 그래프와 검색 증강 생성(Retrieval‑Augmented Generation, RAG)을 결합해 다언어 대규모 코드베이스에서 질의·이해·수정을 돕는다. 모노레포에서 교차 파일 단서가 필요한 엔지니어를 겨냥한 도구다. 5
2026-08-10 릴리스 v0.0.589는 structural_search/structural_replace 도구의 심볼릭 링크 추적 취약점(임의 파일 읽기/쓰기)을 수정했다. 신뢰할 수 없는 저장소에 이 도구를 실행하는 사용자는 즉시 업그레이드할 것이 강력히 권고된다. 5
Research Papers
적응형 시각 에이전트: 장문서·의료 영상에서 지연·오류 감소
InSight‑doc은 해상도를 자원으로 보고, 긴 문서를 저해상도로 훑은 뒤 필요한 영역만 선택적으로 고해상도로 확대한다. 외부 검색기를 쓰지 않고, 영역별 확대 경로가 포함된 감독 미세조정(SFT) 1만 7,900건과 강화 학습(RL) 1만 9,200건으로 훈련됐다. 그 결과 문서 시각 질의응답(VQA)에서 기준선 대비 4.3~16.4포인트 향상하고, 긴 문서에서는 환각을 40% 이상 줄이며 추론 지연을 41~68% 낮췄다. 코드·데이터·모델이 공개됐다. 6
MIRA는 의료 영상 진단을 위해 도구 사용(확대, 그라운딩, 포인팅, 회전, 계측, 웹 검색)의 필요성을 스스로 판단하고, 얻은 증거가 가설을 지지하는지 반성적으로 검증하는 프레임워크다. 도구 강화 몬테카를로 트리 탐색(Monte Carlo Tree Search, MCTS)으로 감독 미세조정 경로를 만들고, 온라인 "반성 원칙" 진화를 결합한 강화 학습으로 의사결정을 더 개선했다. 9개 의료 시각 추론 벤치마크 평균 64.73점을 기록해 Qwen3‑VL‑8B 백본 대비 7.44포인트 상승했고, 유용한 도구 사용 판단은 56.2%→73.8%로 늘고 유해한 판단은 8.9%→1.6%로 줄었다. 7
두 논문은 공통적으로 지각과 도구 호출을 추론 시간의 예산으로 다루면 비용과 오류를 줄일 수 있음을 보여준다. 필요한 곳만 “확대해서 보고” 도구 결과를 검증하면, 정확도를 유지하면서 더 빠르고 신뢰도 높은 결정을 낼 수 있다. 6
커뮤니티 반응
Hacker News (255↑) — 속도 향상은 체감되지만 워크플로 변화를 만들 수준인지, 그리고 Spark/NVFP4 통합 지원이 불명확하다는 지적이 나온다. 8
"공유해줘서 고마워요. 네, 제 경험도 비슷했어요(2배 또는 3배는 확실히 빨라지긴 했지만), 하지만 초당 45건이라는 기준에서는 워크플로를 바꿀 정도로 획기적이진 않아요. 특히 비동기 작업(제가 로컬 3090으로 사람 개입 없이 계속 돌려놓고 싶은 목적)에선 더 그렇습니다. MTP 결과는 어땠나요? MTP는 "무손실" 아닌가요? 도메인별로 여러 쿼리어들을 평균냈을 때 결과는 여전히 유의미해야 할 것 같아요." — Hacker News 8
"여러 모델 카드에서 Spark 호환성을 주장하는 걸 봤지만, 증거나 지침 없이 그런 경우가 많았어요. NVFP4 모델과 대충 작동하는 vLLM의 패치된 이미지들이 있긴 한데, NVIDIA의 공식 지원을 본 적이 없습니다. 왠지 우선순위가 아닌 것 같아요." — Hacker News 8
왜 중요한가
실무 에이전트는 점점 모델 조합으로 운영된다. 어려운 추론은 프런티어 모델이, 대량 실행은 전문 모델이 맡고, 라우터가 품질·지연·비용을 조율한다. 엔비디아의 공개는 이 패턴을 정식화하고, 시각 에이전트 연구는 같은 “예산화된 지각” 원리를 통해 환각을 줄이고 결정을 앞당길 수 있음을 보여준다. 이는 프로토타입을 신뢰할 수 있는 비용 의식형 워크플로로 전환하려는 팀에 유용한 설계 청사진이다. 1
이번 주 시도해볼 것
- Nemotron 3.5 Lightning 체험: build.nvidia.com이나 OpenRouter 무료 엔드포인트에서 팀의 대표 에이전트 작업으로 속도·품질을 직접 비교한다.
- 코드 어시스턴트 보안 강화: Code‑Graph‑RAG를 v0.0.589로 업데이트해 심볼릭 링크 취약점을 패치한 뒤, 신뢰할 수 없는 저장소에 적용한다.
댓글 (0)