제01권 · 제10호 데일리 디스패치 2026년 8월 21일

최신 AI 뉴스 모음집

AI · 논문데일리 큐레이션공개 아카이브
AI 뉴스Research
약 7분

새 권한 제어 계층이 AI 에이전트의 데이터 유출을 테스트에서 0%로 낮췄다

Bounded Agents 논문은 위임 권한을 추적해 유해한 도구 호출 조합을 막는 Agentic Principal Chain을 제안한다. 3,154회 공격 시도 중 InjecAgent 544건을 모두 차단했고, AgentDojo 유출을 0%로 만들면서 p99 지연은 0.24ms였다.

읽기 모드

한 줄 요약

권한을 추적하는 보안 계층이 에이전트의 프롬프트 주입 피해를 시험에서 막았고, 주의(attention)가 한 번의 추론으로 스스로 신뢰도를 보고하며, 오픈소스 도구는 100여 개 모델 라우팅과 로컬 ComfyUI 제어를 단순화했고, 표적 합성 데이터가 다국어 추론을 끌어올렸다.

Research Papers

Bounded Agents: 위임 권한을 추적하는 보안 계층

이 논문은 AI 에이전트가 허용된 권한을 악용하지 못하게 하는 방법을 제안한다. 세션에서의 모든 도구 호출을, 에이전트가 할 수 있는 일과 이미 한 일을 기준으로 정책 점검하는 방식이다. Agentic Principal Chain(APC)은 주체 간 위임 권한을 추적하고 여섯 가지 인가 검사를 적용해 범위를·예산을 승계·제한하며, 모델 밖에서 합성 금지 조합을 차단한다. 저자들은 프롬프트 주입을 “모델 문제”가 아니라 “권한 설계” 문제로 본다. 1

InjecAgent, AgentDojo, ASB에 걸친 3,154건의 공격 실험에서 APC는 InjecAgent 데이터 탈취 544건을 전부 차단했고, AgentDojo의 유출 성공률을 네 개 도메인에서 75–100%에서 0%로 낮췄다. 의도 바인딩은 피해 범주를 크게 줄여, 파괴는 38.6%→4.0%, 조작은 90.5%→12.1%로 감소했다. “손상된 모델” 프로토콜은 첫 합법 도구 호출 뒤에 정답 공격 호출을 삽입해, 보안 계층 자체의 효과를 모델 변동성과 분리해 검증한다. 1

오버헤드와 트레이드오프도 제시한다. 유휴 호스트에서 p99 인가 지연은 0.24ms였고, 두 설정에서 949개 AgentDojo 과제–주입 쌍 기준 유틸리티가 8.6, 13.9%포인트 낮았다. 논문은 폭발 반경 단조성(Blast Radius Monotonicity)과 합성 건전성(Composition Soundness, 완전한 제한 집합과 직렬 승인 하에서)을 증명하고, 구현·평가 도구·데이터를 공개했다. 독자 관점에서는 프롬프트·대형 언어 모델(LLM)만 다듬는 것이 아니라, 정책과 세션 상태로 안전을 설계하는 접근이다. 1

Lévy Attention: 한 번의 추론으로 신뢰도를 함께 산출

이 연구는 예측을 만드는 그 순간, 추가 연산 없이 “얼마나 믿을 수 있는가”를 주의층이 스스로 내놓게 한다. Lévy Attention은 소프트맥스 크로스-어텐션을 확률적 정식화로 대체해, 기대값에서는 완화된 코사인 커널 주의로 수렴하며 정확한 그래디언트로 학습된다. 핵심은 닫힌형으로 산출되는 두 신호다. ‘증거(compatibility 합)’와 ‘불일치(value 분산)’를 조합해 몬테카를로 샘플링 없이 보정된 불확실성을 제공한다. 2

실험적으로 무료인 ‘불일치’ 신호는 동등 조건의 20회 MC 드롭아웃을 능가하고, 전체 점수는 샘플 0회 가우시안 CRPS에서 50회 샘플러보다 좋았다. t-PatchGNN에서는 교체 비용이 최대 정확도 5.6%p에 그쳤고 가장 희소한 데이터셋에서는 비용이 없었다. 분할-컨포멀 래퍼는 목표 커버리지를 달성했으며, 한 번의 추론으로 3,383명의 미조회 환자에 대한 신뢰도 순위를 1.4초에 생성했다. 불규칙 시계열 의사결정에 유용한 구조다. 2

표적 합성 데이터로 다국어 추론 성능을 개선

언어 특이 역량(LSC)은 같은 의미의 질문이라도 프롬프트 언어에 따라 답이 달라지는 현상이다. HOTFIXR는 학생 모델의 다국어 약점을 진단하고, 그 약점을 메우는 합성 학습 데이터를 생성하는 프레임워크다. 모든 질의를 영어로 우회하거나(표현력 손실) 모든 언어를 균형 학습하는(전체 성능 저하) 대신, 데이터 중심으로 교차언어 추론을 높이는 접근이며, 코드는 채택 시 공개될 예정이다. 3

세 가지 분포 내 과제, 세 가지 분포 밖(OOD) 과제, 네 개 OOD 언어에서 HOTFIXR는 분포 내 성능을 평균 6.2% 올리고, OOD 과제에서 미분화 파괴를 3.7% 줄였으며, OOD 언어 성능을 7.1% 높였다. 실무에서 다국어 대형 언어 모델(LLM)이 필요한 팀에, 표적 합성 데이터가 전면 재학습 없이 하한선을 끌어올릴 수 있음을 시사한다. 3

Open Source & Repos

LiteLLM: 100+ 모델을 하나의 API 뒤로 통합, 서명된 이미지 추가

LiteLLM은 100여 개 대형 언어 모델(LLM)을 하나의 OpenAI 호환 응용프로그램 인터페이스(API)로 호출하게 해주는 셀프-호스팅 게이트웨이다. 비용 추적, 가드레일, 부하분산, 로깅을 제공하고 Bedrock, Azure, OpenAI, Anthropic, Vertex AI, vLLM, Nvidia NIM 등 공급사를 아우르며, Rust 코어와 Python 소프트웨어 개발 키트(SDK)를 제공한다. 4

2026-08-19 자 v1.99.0-dev.1 프리릴리스에서 모든 Docker 이미지는 cosign으로 서명되며, 릴리스는 동일 키(커밋 0112e53)로 서명돼 배포 전 이미지 출처 검증이 가능하다. OpenAI API 형식을 표준으로 삼고 비용·기능에 따라 공급사를 바꾸는 팀의 접착 코드 부담을 줄여준다. 4

ComfyUI-MCP: 로컬에서 어떤 LLM이든 워크플로를 구동하게 하는 제어 평면

ComfyUI-MCP는 ComfyUI를 위한 로컬 퍼스트, 에이전트 네이티브 제어 평면이다. 모델 컨텍스트 프로토콜(MCP) 서버와 사이드바 에이전트로 구성돼, 이미지·동영상·오디오 생성, 워크플로 작성·실행, 모델·커스텀 노드 관리, 실시간 그래프를 자연어로 편집한다. Claude, ChatGPT, Gemini, 로컬 Ollama, 호스티드 모델 등과 작동하며, 178개 도구·36개 AI 스킬·55개 설치 팩을 제공하고 로컬·LAN·VPS·Comfy Cloud에서 운영된다. 5

ComfyUI 생태계의 재현 가능 세팅 수요도 확인된다. NVIDIA Developer Forums의 별도 프로젝트 ‘spark-comfyui’는 필요한 모델과 워크플로 메타데이터를 하나의 JSON “recipe”로 묶는 방식을 제시하며, Krea‑2 Turbo 템플릿 예시는 네 개 모델 합계 18GB를 나열한다. DGX Spark와 ASUS Ascent GX10에서 설치가 쉬워졌다는 사용자 후기도 있다. MCP와는 별개 프로젝트지만, 로컬에서 에이전트 친화적 제어를 바라는 수요를 보여준다. 6

왜 중요한가

에이전트 안전을 프롬프트 꾸미기가 아니라 “정책+세션 상태 관리”로 다루면, 모델이 손상돼도 피해 반경을 제한할 수 있다. 여기에 한 번의 추론으로 불확실성을 보고하는 주의층이 결합되면, 추가 비용 없이 신뢰도 설명이 가능한 시스템으로 나아갈 단서를 제공한다. 1

도구 측면에서는 100여 개 모델을 하나의 게이트웨이로 묶고, 로컬 ComfyUI 제어 평면을 갖추면 멀티모델·프라이버시 지향 워크플로의 통합 비용이 줄어든다. 표적 합성 데이터는 영어 우회나 전면 균형 학습의 대안으로 다국어 성능을 끌어올리는 실용적 경로를 제시한다. 4

이번 주 시도해볼 것

  1. LiteLLM Docker 이미지 서명 검증: 저장소 README의 “Verify Docker Image Signature” 절차를 따라 확인한다 (github.com/BerriAI/litellm).
  2. ComfyUI‑MCP 76초 데모 보기: 저장소(github.com/artokun/comfyui-mcp)에서 README의 데모 링크를 연다.

출처 6

도움이 되었나요?

댓글 (0)