AI 에이전트 팀, 스스로 조직을 학습해 정확도와 확장성 향상
네 편의 논문은 에이전트가 팀 구조를 스스로 고르고, 중앙 오케스트레이터 없이 협력하며, 자기 코드까지 개선할 수 있음을 보여준다. 결과로는 단일 에이전트 48.8% 대비 66.7% 정확도와 1,024명 작업자에서 55.06% 테스트 통과율이 포함된다.
한 줄 요약
에이전트 팀이 스스로 조직을 학습하고, 숨은 추론을 드러내며, 샘플링과 시뮬레이터‑현실 격차의 비용을 낮추는 기법이 동시에 제시됐다.
Research Papers
Self-Organizing Agent Teams: 함께 추론을 배우다
고정된 절차 대신 팀 규칙을 학습해 “누가 무엇을, 언제 말하고, 어떻게 합칠지”를 스스로 정하는 대형 언어 모델(LLM) 팀을 떠올리면 된다. 한 연구는 Self-Organizing Agent Teams(SAT)를 소개하며, 역할·대화 단계·참여·정보 흐름에 대한 재사용 가능한 전략을 학습해 어떤 한 구성원도 혼자 풀지 못한 문제를 팀이 함께 푸는 “협업 계산”을 구현한다고 보고했다. 1
수학·물리 5개 벤치마크에서 자기조직화 팀의 평균 정확도는 66.7%로, 최강 단일 모델 48.8%, 동일 계산 예산의 그 모델 추론 58.7%, 독립 답안을 완벽 라우팅한 59.0%를 모두 앞섰다. AIME 2026에서는 완벽 라우터 대비 13.4포인트 높았다. 8개 벤치마크를 보면 정답을 알아보는 난이도(조직심리학의 ‘입증 가능성’)와 팀의 이득이 강하게 함께 움직였다(스피어만 ρ=0.90, p=0.005). 1
보완적으로, MAGIC은 혼합 세분도 조직을 조립하는 방식을 학습한다. 강화 학습(RL)에 조밀 보상(shaping)을 더해 역할마다 단일 에이전트 또는 재사용 그룹을 선택하면서 그래프를 구축한다. 진단 실험에서 혼합 구성이 고정 구성보다 우수했다(예: MMLU-Pro에서는 GAA가 양 끝점 대비 +4.5포인트, TAT-QA에서는 AAG가 +2.5포인트)며, 전부 그룹인 그래프보다 토큰 사용도 적었다. 보상 성형은 학습 신호를 강화해 MMLU-Pro에서 중간 단계의 유의미한 이득 비율을 32.81%→83.13%로 끌어올렸다. 2
확장성 측면에서 Agensh는 중앙 오케스트레이터를 없애고, 공유 작업공간·메시지·공유 컨텍스트만으로 최대 1,024명 작업자가 동시·비동기 협업하도록 설계했다. ProgramBench 최난도 과제에서 1→128명 확장은 최종 테스트 통과율을 19.31%→28.78%(상대 약 49%)로 높였고, pandoc 과제에서는 1→1,024명에서 33.89%→55.06%로 올라갔다. 팀 규모와 조정 비용 간 최적점, 과제군별 이득 차이에 주목할 필요가 있다. 3
도구 호출로 드러난 숨은 생각의 사슬(CoT)
폐쇄형 모델은 중간 추론을 숨기지만, 간단한 애플리케이션 프로그래밍 인터페이스(API) 도구만 등록해도 본래의 “생각 모드” 없이 중간 추론을 외부화할 수 있음이 확인됐다. 사용자 정의 도구를 강제 호출하는 절차로 생각의 사슬(CoT)을 추출하면, 공개 모델에서는 원래 CoT와 성능이 유사하고, 수학·과학·코드 과제에서 무추론 기준선보다 크게 앞섰다. 이어 GPT-6 Astra 등 프런티어 모델에도 확장해 비교를 수행했다. 4
분석 결과, 모델마다 추론을 얼마나 외부화하고 어떻게 조직하는지가 체계적으로 달랐다. Astra는 토큰을 아껴 더 곧은 경로를 일찍 선택하고, 기초 단계를 내부에서 해결한 뒤 핵심만 드러내는 경향을 보였다. 제공자가 노출을 제한해도 도구 채널처럼 다른 경로로 추론이 새어 나올 수 있으며, 간결한 추론은 강한 수신 모델에서는 잘 이전되지만 약한 모델에서는 활용도가 떨어졌다. 4
FLEET: 높은 엔트로피 지점을 기억해 샘플링 3배 가속
많은 시스템이 온도 샘플링을 여러 번 반복해 품질을 올리지만, 과거 생성을 기억하지 못해 유사 답변만 늘어나는 비효율이 생긴다. FLEET은 세대별로 엔트로피가 높은 상태를 따라 희소 궤적을 만들고, 이로부터 토큰별 효용을 추정해 로짓을 조정한다. 그 결과 반복 샘플링과 동일 정확도를 3배 빠르게 달성하고, LiveCodeBench에서는 동일 예산에서 Pass@32가 59.9%→66.2%로 향상됐다. 5
이 방법은 탐욕적 디코딩에서 결정적이며, 한 번의 보정 패스만으로 핵심 하이퍼파라미터를 정한다. 기존 LLM 파이프라인에 최소 변경으로 끼워 넣기 쉬운 점이 실용적이다. 재순위화·검증과 결합해 고정 비용에서 신뢰도를 얼마나 더 높일지 주목할 만하다. 5
Uranus 등: 시뮬레이터와 모션 생성기로 시뮬레이터‑현실 격차 축소
Uranus는 관절 궤적 조건의 자기회귀 확산 모델을 중심으로 하는 데이터 기반 로봇 시뮬레이터다. 고정 길이 없이 스트리밍 전개를 생성하고, 최적화 후 초당 프레임(FPS) 24를 달성했으며, 다양한 로봇과 카메라 설정에서 동기화된 다중 뷰 생성을 제공한다. 코드와 가중치가 공개됐다. 6
Whole-Body UMI(범용 조작 인터페이스, UMI)는 전신 협응 생성을 모캡으로 학습한 실시간 모션 생성기로 분리해, 확산 정책과 전신 제어기(WBC)와 결합한다. G1 휴머노이드에서 서랍 닫기 90%, 선반 피킹·적재 80%, 공 던지기 30%, 보행 결합 피킹·적재 40%의 성공률로 네 가지 과제를 실시간으로 수행했다. 7
PhyVisGen은 물리·시각적 충실도를 함께 높였다. 증분형 잠재 접촉(IPC)으로 소프트 그리퍼 상호작용을 전체 궤적에 걸쳐 정밀하게 모사하고, 실시간 경로 추적으로 실제 장면의 외관을 보존한다. 시뮬레이터에서만 생성한 데이터로 학습한 정책이 실물 로봇 5개 과제에서 65–95% 성공률을 보였으며, 실물 시연이나 파인튜닝은 사용하지 않았다. 8
왜 중요한가
조직 그 자체가 에이전트의 능력으로 부상하고 있다. 팀이 언제·어떻게 협업할지를 학습해 최강 단일 모델을 넘어서는 정확도를 내고, 혼합 세분도 그래프와 오케스트레이터 없는 대규모 협업은 팀 구조·팀 규모라는 새로운 손잡이를 제공한다. 정해진 예산에서 정확도와 지연 시간을 함께 조절할 수 있다는 의미다. 1
자기개선형 연구 에이전트는 또 다른 손잡이다. 한 시스템은 8일 동안 7번의 코드 수준 개선을 스스로 찾아냈고, 보상 해킹 비율을 55%에서 32%로 낮추면서 외부 보류 벤치마크 4개에서 성숙한 프로덕션 기준선을 따라잡거나 앞섰다. 일부 AI 연구·개발 공정을 에이전트 스스로 더 싸고 신뢰성 있게 만들 수 있음을 시사한다. 9
이번 주 시도해볼 것
- Agensh 프로젝트 페이지: 설계와 작업 기록을 살펴본다 — https://aka.ms/Agensh
- Uranus 시뮬레이터: 모델과 데모 개요를 확인한다 — https://arxiv.org/abs/2609.24815
댓글 (0)