제01권 · 제10호 데일리 디스패치 2026년 8월 1일

최신 AI 뉴스 모음집

AI · 논문데일리 큐레이션공개 아카이브
AI 뉴스Research
약 6분

딥마인드 ‘제미니 로보틱스 2’, 전신 제어와 로봇 팀워크 추가

새 로보틱스 스택은 작업을 진행하며 여러 단계를 계획하고, 영상으로 진행 상황을 추적하며, 온디바이스 모델도 포함한다. ER 2는 순간 탐지에서 정확도 91.3%, 시간 오차 0.96초, 진행도 분류 정확도 57.4%를 보고한다.

읽기 모드

한 줄 요약

로봇이 실시간으로 여러 단계를 계획해 전신을 쓰고 서로 협력하도록 하는 ‘두뇌’가 공개됐고, 동시에 멀티모달 토큰을 재학습 없이 압축하는 법과 중간 시각 상태를 모델이 실제로 쓰는지 점검하는 평가가 나왔다.

LLM & SOTA Models

Gemini Robotics 2: 전신 제어와 로봇 팀워크

Google DeepMind는 로봇이 여러 단계를 실시간으로 계획하고 다른 로봇과 협력하며 발끝부터 손끝까지 전신을 제어하도록 돕는 ‘두뇌’를 공개했다. Gemini Robotics 2 스택은 전신 제어, 정교한 조작, 다수 로봇 협업을 결합해 휴머노이드가 걷고 쪼그리고 앉아 물건을 다루거나, 다른 로봇과 팀을 이뤄 작업을 더 빨리 끝내도록 한다. 1

핵심에는 체현 추론(Embodied Reasoning, ER) 모델인 Gemini Robotics ER 2가 있다. 이는 고수준 에이전트로서 사람과 대화하고, 실시간 영상 피드를 해석하며, 다단계 작업을 계획하고 필요할 때 도구나 로봇 인터페이스를 호출한다. ER 2는 지연에 민감한 작업을 위해 양방향 스트리밍에 최적화된 Gemini Live 응용 프로그램 인터페이스(API)와 통합되며, Gemini API와 Google AI Studio에서 개발자가 사용할 수 있고 Gemini Enterprise Agent Platform에서는 프라이빗 프리뷰로 제공된다. 2

새로운 ‘시간 지능’ 결과는 ER 2가 언제 단계를 전환하고 언제 멈춰야 하는지 추적함을 보여준다. 진행도 분류에서 57.4% 정확도, 순간 탐지에서 91.3% 정확도와 0.96초 평균 절대 오차를 보고했으며, 더 적은 연산으로 4배 실행 속도와 물리 로보틱스에 필요한 서브세컨드 지연을 달성했다고 한다. 2

이 스택에는 로컬 실행에 최적화된 시각-언어-행동(VLA) 모델인 Gemini Robotics On‑Device 2도 포함된다. 이 모델은 보통 200개 미만의 예시로 수 시간 안에 새로운 로봇 몸체에 적응하며, 새로운 ASIMOV‑Agentic 안전 벤치마크도 도입됐다. 또한 ER 2는 안전 제약 준수와 인간 근접성 평가에서 지금까지 공개된 모델 중 가장 높은 안전성을 보였다고 보고됐다. 1

Research Papers

OmniScope: 오디오·비디오 토큰 압축, 재학습 없이 속도↑

OmniScope는 옴니모달 대형 언어 모델(LLM)에서 각 모달리티의 핵심 토큰만 남겨 오디오·비디오 질의응답을 가속한다. 전체 토큰을 25%만 유지해도 사전 입력(prefill) 속도를 최대 3.53배 높이고 GPU 메모리를 15% 이상 줄이면서, 네 가지 오디오-비디오 벤치마크와 두 가지 Qwen2.5‑Omni 규모 전반에서 평균 정확도는 0.35포인트만 떨어졌다. 3

핵심은 사용자 질의를 모달 간에 공유하되 중요도 평가는 오디오와 비디오를 분리해 수행하는 것이다. 모달리티별 토큰 예산을 배분하고, 전역 문맥과 시간 변화를 보존하는 앵커-델타 전략으로 영상 토큰을 가지치기하며, 오디오 토큰은 1초 단위로 병합해 중복을 줄인다. 저자들은 압축 설정 전반에서 최고 평균 정확도를 보고했고, 코드를 공개했다. 3

See2Think: 중간 시각 상태를 모델이 실제로 쓰는가

See2Think는 모델이 추론 중 스케치·주석·중간 이미지를 실제로 활용하는지 점검하는 통합 평가 프레임워크다. 2D 구조화, 3D 장면, 실세계 추론 등 12개 과제 범주의 시각 의존형 개방형 문제 1,200개로 구성된 See2ThinkBench와, 네 가지 제어 추론 설정에서 텍스트 사고, 시각 행동, 렌더링 상태, 후속 추론을 기록하는 시각 행동-사고(Visual Action-of-Thought, VAoT)를 제시한다. 4

대표적인 공개·상용 모델을 평가한 결과, 시각 추론은 모델과 환경에 강하게 의존해 모든 과제에서 일관되게 우위인 설정은 없었다. 모델은 대체로 관련 시각 연산을 고르지만, ‘정확한 렌더링’이 가장 큰 병목이었고, 과제 관련 피드백을 의도적으로 왜곡하면 정확도가 10포인트 이상 하락해 중간 시각 상태에 행동이 의존함을 보였다. 5

커뮤니티 반응

Hacker News (609↑) — 언어 능력을 갖춘 로봇에 대한 기대와, 규모가 커질 때의 위험을 과소평가하지 말아야 한다는 경계가 교차했다. 6

"솔직히 이미 AI가 거의 모든 언어로 글을 흠잡을 데 없이 쓰고, 어떤 언어든지 괜찮은 수준으로 번역까지 해내는 건 놀랍습니다. 이 기능을 걷는 로봇에 얹으면 사실상 C-3PO와 같아집니다. 그의 팔이 그렇게 대단한 건 아니니까요." — Hacker News 6

"새로운 기술이 제시하는 위험을 판단할 때 많은 사람들이 '규모'를 고려하지 않는다는 점이 정말 놀랍습니다." — Hacker News 6

왜 중요한가

자기 작업을 스스로 관찰하고, 현실 시간에 맞춰 결정을 내리며, 서로 다른 형태의 로봇이 협력하는 시스템은 가정과 일터에서 더 유용한 도움이 될 가능성을 보여준다. 순간 탐지의 서브세컨드 타이밍과 진행 추적, 스트리밍 제어에 더해 수 시간·200개 미만 예시로의 온디바이스 적응은 지연과 도입 마찰을 낮춘다. 2

실무 관점에서 두 가지 레버가 뚜렷하다. 재학습 없이 모달리티별로 토큰을 압축해 추론 비용을 관리하고, 시각 도구가 실제로 모델에 도움이 되는지 ‘과정’ 수준에서 측정하라. OmniScope의 무학습 압축과 See2Think의 진단 평가는 멀티모달 시스템을 더 빠르고 안전하게 내놓는 데 실질적 수단을 제공한다. 34

출처 6

도움이 되었나요?

댓글 (0)