성공한 절차를 남기는 에이전트: FlowEvo가 워크플로를 스킬로 바꾼다
FlowEvo는 실행 중에 성공한 절차를 호출 가능한 스킬로 묶어 저장해 재사용하며, ALFWorld에서 85.6%를 기록하고 토큰 사용량을 약 3분의 1로 줄였다. 새로운 망각 벤치마크와 Agents SDK 업데이트는 더 안정적이고 안전한 에이전트를 향한 흐름을 보여준다.
한 줄 요약
에이전트가 실행 중 배운 절차를 스킬로 쌓아 재사용하고, 해로운 지식만 맥락에 맞게 잊히게 하는 평가가 제안되며, 멀티에이전트 워크플로 도구가 더 단단해지고 있다.
Research Papers
FlowEvo: 워크플로와 스킬의 공진화로 자기개선
FlowEvo는 에이전트가 실행 중에 잘 작동한 절차를 버리지 않고 다시 쓰게 만드는 훈련 없는 방법이다: 성공한 행동 순서를 호출 가능한 스킬로 컴파일해 영구 저장한다. 모든 실험에서 동일한 백본 대형 언어 모델(LLM)인 GPT-4o-mini를 사용한 상태에서, FlowEvo는 ALFWorld, HumanEval, MBPP, GSM8K, MATH-500의 표준 분할에서 8개 기준선 중 최고 정확도를 보였고, 토큰 사용량은 약 3분의 1 수준이었다. ALFWorld에서는 85.6%로 최강 기준선 대비 26.4포인트 높았다. 1
FlowEvo는 각 실행을 일회성으로 보지 않는다. 효과적인 워크플로를 실행 가능한 스킬로 바꾸어 스킬 뱅크에 기록하고, 이후에는 직접 실행하거나 새 워크플로를 구성할 때 맥락으로 끌어와 활용한다. 각 스킬의 하류 효용을 추적하고 부정적 전이(성능 악화)를 일으키는 스킬은 억제해, 워크플로와 스킬 라이브러리가 함께 자라는 공진화 루프를 만든다. 이 모든 과정은 추가 훈련 없이 수행된다. 1
7B부터 671B 매개변수까지 10개 기반 모델 전반에서, FlowEvo는 50개 모델-데이터셋 비교 중 49개에서 기존 ExpeL을 앞섰다. 저자들은 코드를 공개하고, 공유 백본 GPT-4o-mini 설정에서 코딩·수학·체화 과제 전반의 일관된 향상을 보고했다. 1
이 설계는 '에이전트 중심 대화형 세계 프록시'라는 더 큰 흐름과 맞닿아 있다. 즉, 추론 시점의 안내, 학습 시점의 최적화, 에이전트-프록시 공진화로 이어지는 피드백 엔진을 구축해, 위험한 실제 실행을 줄이면서 학습을 가속하는 관점이다. 2
ConceptGuard: 맥락 민감한 망각 능력 측정 벤치마크
ConceptGuard는 어떤 개념의 해로운 사용은 잊되 유익한 사용은 유지하는지를 시험하는 벤치마크다. 앞서의 접근이 서로 무관한 사실을 ‘망각’과 ‘보존’ 집합으로 나눠 보던 것과 달리, ConceptGuard는 이중 용도 개념을 중심에 두고 상보적인 망각·보존 세트를 만들며 의도에 민감한 평가를 수행한다 — 대형 언어 모델(LLM)의 실용적 망각 능력을 가늠하는 방식이다. 3
저자들은 현재 망각 기법들이 이 설정에서 전반적으로 취약함을 보인다고 보고한다. 맥락적 분리가 약하고 ROUGE 및 개념 수준 지표가 저하되며, 망각과 유용성 사이의 트레이드오프가 크다. 데이터셋은 공개되어 있으며, 사실 나열이 아닌 개념 제어에 초점을 둔 해법을 촉진한다. 3
Open Source & Repos
OpenAI Agents SDK(Python): 멀티에이전트 워크플로를 간단히 구축
OpenAI의 Agents SDK(소프트웨어 개발 키트, SDK)는 여러 공급사에 걸친 멀티에이전트 워크플로 구축을 돕는 경량 프레임워크다. OpenAI Responses와 Chat Completions 응용프로그램 인터페이스(API)뿐 아니라 100개가 넘는 대형 언어 모델(LLM)을 지원하며, 에이전트, 장시간 작업용 샌드박스 에이전트, 실시간 에이전트 등 핵심 개념을 제공한다. 4
v0.22.0(2026-08-19) 릴리스는 실행 시 견고함을 크게 높이고 기존 공급사 구성 계약을 더 엄격히 했다. 명시적 openai_client와 organization 또는 project 값을 함께 쓰는 애플리케이션은 해당 값을 AsyncOpenAI 클라이언트로 옮겨야 한다. 이는 멀티에이전트 오케스트레이션에서 신뢰성과 명확한 구성에 무게가 실리고 있음을 시사한다. 4
왜 중요한가
에이전트의 무게중심이 일회성 프롬프트 체인에서 축적 가능한 스킬 라이브러리로 이동하고 있다 — FlowEvo의 공진화 스킬 뱅크는 추가 훈련 없이도 정확도 향상과 토큰 비용 절감을 함께 보여준다. 1
동시에 도구도 성숙해지고 있다. 공급사 중립적이고 강화된 Agents SDK는 구성을 명확히 하고 멀티에이전트 오케스트레이션을 뒷받침해, 연구 아이디어의 실전 적용을 빠르게 돕는다. 4
이번 주 시도해볼 것
- OpenAI Agents SDK 빠른 시작: Python 패키지를 설치하고 README 예제로 멀티에이전트 파이프라인을 돌려본다. https://github.com/openai/openai-agents-python
- ConceptGuard 훑어보기: arXiv 논문에서 의도 민감 망각 과제 설계를 살펴본다. https://arxiv.org/abs/2608.20338v1
댓글 (0)