MS의 진화형 에이전트: 에코버스와 에보립

마이크로소프트 연구진이 컴퓨터 제어 에이전트의 실질적 역량 고도화를 위한 심층 가상 환경 '에코버스(Echoverse)'와 추론 시점 지식 축적 프레임워크 '에보립(EvoLib)'을 공개했습니다. 에코버스는 데이터베이스 상태 변화를 직접 추적하는 12개 고충실도 환경을 구축하여 9B 소형 모델의 성공률을 36.5%에서 67.1%로 두 배 가까이 향상시켰습니다. 동시에 에보립은 모델 가중치 수정 없이 테스트 시점의 성공과 실패 경험을 재사용 가능한 스킬과 통찰로 지속 통합·재가중치화하여 성능을 극대화합니다.

정적 환경과 단순 기억의 한계: 왜 '상태'와 '지식'이 진화해야 하는가

대규모 언어 모델(LLM)을 기반으로 한 컴퓨터 제어 에이전트 연구는 빠르게 확산되고 있으나, 실제 업무 자동화 환경에서는 여전히 심각한 병목 현상에 직면해 있습니다. 화면의 시각적 형태만 모사한 얕은 가상 환경이나 라이브 웹사이트를 대상으로 한 훈련은 구조적인 한계를 노출하고 있습니다. 공개 웹사이트는 지속적으로 UI가 변경되고 세션 및 접근 제한이 발생하여 재현성 있는 훈련을 방해하며, 단순 스크린샷 기반 평가는 실제 시스템 백엔드에 기록되어야 할 데이터의 정합성을 보장하지 못합니다.

또한 기존 에이전트 메모리 시스템은 과거의 대화 기록과 행동 이력을 정적인 아카이브 형태로 단순 누적하는 방식에 머물러 있었습니다. 이는 작업이 반복될수록 무의미한 탐색 비용과 토큰 소비를 가중시키는 결과를 낳았습니다. 마이크로소프트 연구진은 이러한 근본적인 병목을 타개하기 위해 두 가지 상호보완적 연구를 제시했습니다.

  1. 상태 기반 환경 구동
  2. 행동 실행 및 DB Diff 감지
  3. 검증자 평가 및 결함 태깅
  4. 환경·과제·모델 동시 진화

---

에코버스(Echoverse): 얕은 시뮬레이션을 배제한 12개 심층 가상 환경

마이크로소프트가 공개한 에코버스(Echoverse)는 10개의 도메인 세계와 2개의 특화 역량 세계로 구성된 총 12개의 컴퓨터 제어 에이전트 훈련 인프라입니다. 연구진은 단순 웹페이지 수의 양적 확장보다 시스템 내부 인과 구조를 그대로 보존하는 시뮬레이션 충실도가 핵심임을 입증했습니다.

실제로 동일한 사이트를 얕게 복제한 환경과 심층적으로 구축한 환경에서 비교 실험을 진행한 결과, 얕은 환경에서 훈련된 모델은 성능이 오히려 퇴보했으나 심층 환경에서 훈련된 모델은 비약적인 성능 향상을 보였습니다. 에코버스는 FastAPI와 SQLite 백엔드, React 프론트엔드로 구동되는 독립된 소프트웨어 인프라를 구축하여 작동합니다.

도메인 및 환경 명칭데이터 소스 및 규모아키텍처 특성
EchoStay (숙박 예약)InsideAirbnb 데이터셋 기반약 87개 라우트, 23개 데이터베이스 테이블
EchoForum (커뮤니티)공개 포럼 말뭉치255만 개 코멘트 데이터 연동
통신·금융·의료 도메인엄격한 제약조건 기반 합성 데이터이메일 스레드, 감사 추적(Audit Trail), 권한 제어
역량 세계 (Date Picker)6개 핵심 위젯, 10개 문맥미학습 UI 10종 대상 제로샷 일반화 평가

"컴퓨터 제어 에이전트는 자신의 행동이 실제 결과를 가져올 때만 무엇을 유발했는지 학습할 수 있습니다. 스크린샷은 인터페이스가 어떻게 생겼는지를 보여줄 뿐이지만, 작동하는 세계만이 행동이 초래한 결과를 증명합니다."

이러한 심층 인프라를 바탕으로 훈련된 9B 매개변수 모델은 기본 점수 36.5%에서 67.1%로 두 배 가까운 성공률 상승을 기록했으며, 이는 초거대 모델인 GPT-5.4와의 격차를 불과 14점 차이로 좁힌 수치입니다.

---

UI 병목 분리와 데이터베이스 기반 검증 메커니즘

에이전트가 복잡한 워크플로우를 완수하지 못하는 주된 요인은 전체 도메인 이해 부족뿐 아니라 특정 UI 컴포넌트의 조작 실패에서 비롯됩니다. 에코버스는 이를 해결하기 위해 두 가지 핵심 전략을 구현했습니다.

1. 취약 UI 컨트롤 집중 훈련 (Capability Targeting)

에이전트가 자주 실패하는 대표적인 요소인 날짜 선택기(Date Picker)와 중첩 필터·검색(Nested Filters)을 독립된 가상 세계로 격리했습니다. 날짜 선택기 환경의 경우 캘린더 히트맵, 스크롤 휠, 회계 분기 선택기 등 6개 위젯 형태와 10가지 맥락을 제공하며, '2026년 1월 마지막 목요일'이나 '시작일 기준 10 영업일 후'와 같은 텍스트 지시를 추론하여 조작하도록 훈련합니다.

2. 스크린샷 픽셀이 아닌 데이터베이스 그라운딩 검증

모든 작업은 생성 시점에 SQL 쿼리로 발행된 진칫값(Ground Truth) 정답을 내장합니다. 읽기 작업은 저장된 값과의 의미론적 동등성을 평가하고, 쓰기 작업은 데이터베이스의 실제 전후 변경 차이(Diff)를 기준으로 채점합니다. 티켓을 닫았다고 에이전트가 주장하더라도 데이터베이스 상의 해당 행 상태가 변경되지 않았다면 검증을 통과할 수 없습니다.

또한 에코버스는 환경, 과제, 검증자가 함께 개선되는 공진화(Co-evolution) 파이프라인을 구축했습니다. 실패가 발생하면 데이터베이스, 백엔드, 프론트엔드, 작업 지시문, 검증자 레이어 중 원인을 태깅하여 수정하고 회귀 테스트를 거치는 폐루프 구조를 통해 환경 자체의 완성도를 높입니다.

---

에보립(EvoLib): 가중치 수정 없는 추론 시점 경험의 지식화

가상 환경에서의 사전 훈련과 더불어, 배포 후 실제 운영 단계에서 모델이 지속적으로 발전할 수 있는 메커니즘으로 마이크로소프트는 에보립(EvoLib)을 제시했습니다. 에보립은 모델 가중치를 직접 업데이트하지 않고 추론 시점(Test-time)에 에이전트가 스스로 축적한 경험을 재사용 가능한 지식 라이브러리로 변환하는 프레임워크입니다. 따라서 API 형태로 제공되는 블랙박스 언어 모델에도 즉시 적용할 수 있습니다.

에보립의 핵심 구동 메커니즘은 두 단계로 구성됩니다.

이러한 진화 과정을 거치면서 장기적인 영향력이 높은 지식이 라이브러리 상위에 우선 배치되며, 토큰을 과도하게 소모하지 않으면서도 검색 기반 메모리 접근법 대비 뛰어난 효율성을 달성합니다.

---

무작위 작업 순서의 극복과 테스트 타임 연산 효율

실제 배포 환경에서 AI 에이전트는 정형화된 커리큘럼이 아니라 무작위 순서로 주어지는 이종(Heterogeneous)의 작업 스트림을 처리해야 합니다. 에보립은 세 가지 대표 영역인 수학적 추론, 효율성 제약 하의 코드 작성, 장기 환경 상호작용 의사결정 벤치마크 전반에서 검증되었습니다.

다양한 난이도와 유형의 작업이 무작위 순서로 유입되는 환경에서도 에보립은 기존의 메모리 기반 학습 방식 대비 지속적인 성능 향상을 유지했습니다. 아울러 테스트 시점 연산량(Test-time Compute)을 증가시켰을 때, 작업을 개별적으로 격리하여 연산만 늘리는 방식이나 단순 메모리 축적 방식보다 훨씬 가파른 성능 개선 곡선을 나타냈습니다. 이는 연산 자원의 단순 투입보다 축적된 경험을 구조화된 지식으로 지속 정제하는 아키텍처가 에이전트 성능의 결정적 요인임을 보여줍니다.

Verified figures

Our take

에코버스와 에보립의 등장은 에이전트 개발의 패러다임이 단순 파운데이션 모델의 매개변수 확장 경쟁에서 정밀한 시뮬레이션 환경 구축과 효율적인 지식 구조화 루프로 완전히 전환되었음을 시사합니다. 폐쇄형 엔터프라이즈 워크플로우를 데이터베이스 수준에서 충실하게 모사하고 추론 시점 경험을 정제하는 체계는 향후 기업용 자율 에이전트의 상용화 표준 아키텍처로 자리 잡을 가능성이 높습니다.

Open questions

Models mentioned

ProviderInputOutputContext window
OpenAI: GPT-5.4 · OpenAI$2.5$151,050,000

Source

Back to catalog