제01권 · 제10호 데일리 디스패치 2026년 8월 10일

최신 AI 뉴스 모음집

AI · 논문데일리 큐레이션공개 아카이브
AI 뉴스Research
약 8분

몇 번의 낙서로 3D 물체 선택 — 재학습 없이

희소 시점과 낙서만으로 가우시안 스플래팅 장면에서 전체 객체를 고르는 학습 불필요 그래프 방식이 나왔다. 함께 보면 좋은 소식: 모델이 언제 컨텍스트를 믿어야 하는지 가르치는 법, 비디오 모델이 단순 카운트를 놓치는 구간, 에이전트·온디바이스 속도를 위한 두 가지 도구.

읽기 모드

한 줄 요약

가우시안 스플래팅에서 학습 없이 낙서만으로 3D 객체를 고르는 방법이 나왔고, 대형 언어 모델(LLM)의 ‘선별적 신뢰’와 비디오 카운팅 실패 지점을 밝히는 연구가 더해졌으며, 에이전트와 온디바이스 추론을 돕는 개발 도구도 공개됐다.

Research Papers

GaussianSelector: 낙서 기반 3D 객체 선택을 재학습 없이 구현

이 연구는 재학습이나 무거운 다중 시점 분할 파이프라인 없이, 몇 번의 낙서만으로 복원된 장면에서 전체 3D 객체를 선택하게 한다. 3D 가우시안 스플래팅(3DGS) 장면을 그대로 다루며, 적은 시점과 최소한의 사용자 입력을 전제로 설계됐다. 1

방법은 촘촘한 가우시안을 기하적으로 응집된 “슈퍼포인트”로 공략하고, appearance·공간 단서를 사용해 연속성 가중 그래프를 만든다. 여기에 사용자가 그린 희소 낙서를 가시성 인지 전송률(투과) 커버리지로 3D에 끌어올린 뒤, 그래프 컷 에너지 최소화로 선택을 전역적으로 풀어낸다. 여러 시점에서의 교정 입력을 자연스럽게 지원하며, 다중 시점 2D 방식과 경쟁적인 품질을 보이면서도 상호작용 시점 수와 연산 부담을 줄였다고 보고한다. 1

왜 중요한가: 많은 3D 선택 기법은 객체별 라벨을 임베딩하도록 재학습하거나, 다수 시점의 2D 마스크를 조밀하게 결합한다. 실무 예시는 스마트폰 사진 84장을 촬영해 구조-모션(Structure-from-Motion) 도구 COLMAP과 3D 가우시안 스플래팅으로 복원하고, You Only Look Once(YOLO) 검출과 Segment Anything Model 2(SAM2) 마스크를 3D로 역투영한다—T4 그래픽 처리 장치(GPU)에서 7,000회 학습(약 13분)으로 약 14.8만 개 가우시안이 생성된다. 이는 다중 시점·2D 기반 선택의 비용을 보여주며, 학습 없이 3D 본연의 표현에서 증거를 전파하는 접근이 실무 배치에 매력적인 이유를 설명한다. 2

SCOPE: 믿어야 할 컨텍스트를 가르치는 선별 신뢰 학습

대형 언어 모델(LLM)은 외부 메모·도구·문서에 답변을 의존할수록, 하나의 오정보만으로도 정답이 뒤집힌다. 이 논문은 견고성을 ‘선별적 신뢰’로 재정의하고, 각 문항을 깨끗함·오정보·정답 컨텍스트·무관 컨텍스트 네 조건으로 구성한 사람 주석 벤치마크 MIST와, 오정보가 정답을 얼마나 자주 뒤집는지 세는 쌍대 지표 SC2W를 제안한다. 3

제안 기법 SCOPE는 깨끗함-정답/오정보-오답 쌍을 발굴해, 네 조건에서 균형을 맞춘 선호 쌍 전체에 대해 표준 직접 선호도 최적화(DPO)를 학습한다. 널리 쓰이는 공개 모델에서 SC2W를 크게 낮추면서, 추가 컨텍스트가 깨끗하거나 정확하거나 무관할 때의 정확도는 유지한다고 보고하며, 평가의 초점을 ‘저항’이 아닌 ‘선별적 신뢰’에 두자고 주장한다. 3

Low Frequency Trap: 단순 이벤트도 놓치는 비디오 언어 모델

이 연구는 벽 충돌, 눈 깜박임, 상태 전이 같은 단순 이벤트 카운팅을 비디오 보조자가 제대로 수행하는지 점검한다. 이벤트 개수와 빈도를 통제한 2,190개 합성 비디오를 만들고, 각 비디오에 실행 가능한 이벤트 트레이스를 포함해 타임스탬프 단위로 정밀 평가한다. 이를 통해 능력 표면을 그리고 시간 추론이 실패하는 위치를 정확히 짚는다. 4

결과는 분명하다. 신뢰도 80% 임계에서 Gemini 3.6 Flash는 0.5·1.0 Hz에서 최대 12회까지 지속적 상태 전이는 안정적으로 센 반면, 순간적 깜박임 이벤트에 대해서는 신뢰 가능한 양의 카운트 구간이 없다. 고빈도·고카운트 구간에서는 최종 카운트의 0.2%만 정답이며, 실제 이벤트의 18.1%만 회수했다. 프레임 샘플링을 늘리면 Bounce Ball 최종 정확도는 19.6%→29.3%로 오르지만, 보고된 시퀀스가 정답과 일치한 비율은 3.7%에 그친다. 4

저자들은 실제 비디오 평가에서도 유사한 패턴을 보고하며, 단일 최종 정답이 아니라 트레이스 기반 진단으로 평가를 전환해야 한다고 주장한다. 프레임을 늘리는 개선은 실제 이벤트 복구 없이 점수만 부풀릴 수 있기 때문이다. 4

Open Source & Repos

OpenAI Agents SDK(Python): 멀티 에이전트 워크플로 프레임워크

이 파이썬 소프트웨어 개발 키트(SDK)는 지시문·도구·가드레일·핸드오프를 갖춘 AI 에이전트를 만들고, 서로 작업을 넘기며 장시간 작업을 수행하도록 돕는다. 공급사에 구애받지 않으며 OpenAI Responses·Chat Completions 응용 프로그래밍 인터페이스(API)와 100개가 넘는 대형 언어 모델(LLM)을 지원한다. 샌드박스 에이전트와 실시간 에이전트도 제공한다. 5

2026-08-05의 v0.19.4 릴리스는 완료된 도구 가드레일 결과 보존, 잘못된 도구 인자 오류 마스킹, 비스트림 세션 저장 지연 등 여러 수정을 담았다. 5

OpenAI 개발자 커뮤니티에서는 OpenAI·Vercel 등이 참여한 “Agents Plugins” 논의가 이어지고 있어, 에이전트 오케스트레이션에 대한 관심이 높음을 보여준다. 6

Rapid-MLX: 애플 실리콘용 초고속 로컬 AI 엔진

Rapid‑MLX는 M 시리즈 맥에서 구동되는 로컬 AI 엔진이다. Ollama 대비 최대 4.2배 빠른 처리와 캐시된 첫 토큰까지의 시간(TTFT) 0.08초를 내세우며, “100% 도구 호출”, 17개 도구 파서, 프롬프트 캐시, 추론 분리, 클라우드 라우팅을 제공하고 OpenAI/Anthropic API와의 드롭인 호환을 표방한다. 7

프로젝트는 M1~M4 등 모든 애플 실리콘에서 동작하고 데스크톱 앱도 제공한다. v0.12.7 릴리스는 엔진과 데스크톱 앱의 버전 관리를 CI에서 일원화했다. 기존 API 클라이언트를 온디바이스로 옮기려는 팀에 “드롭인 OpenAI 대체” 지향점은 마이그레이션 부담을 낮출 수 있다. 7

왜 중요한가

3DGS 장면에서 낙서만으로 전체 객체를 고르는 기능은, 다중 시점 2D 분할 대비 시점 커버리지와 연산 부담을 줄여 AR/VR 콘텐츠 제작과 인간 참여형 3D 편집·자산 추출을 한층 실무적으로 만든다. 1

한편 SCOPE와 Low Frequency Trap은 컨텍스트 인식적 견고성과 트레이스 기반 평가로의 전환을 촉진한다. 동시에 Agents SDK와 Rapid‑MLX 같은 도구는 도입 마찰을 낮추어, 온디바이스 에이전트를 포함한 배치 선택지를 넓히고 신뢰성의 기준선을 더 분명히 한다. 3

이번 주 시도해볼 것

  1. OpenAI Agents SDK(Python)로 두 개의 에이전트가 작업을 넘기는 예제를 만들어보자: 저장소 문서의 “Agents”와 “Sandbox agents” 안내를 따른다. 5
  2. Rapid‑MLX로 로컬 모델 실행: Homebrew 또는 pip로 설치하고 프롬프트 캐시를 켠 뒤 도구 호출을 테스트한다. 7

출처 7

도움이 되었나요?

댓글 (0)