MS가 제시한 차세대 AI 에이전트: 고충실도 환경과 진화형 지식 라이브러리

마이크로소프트 연구진이 컴퓨터 활용 에이전트(Computer-Use Agents)의 한계를 돌파하기 위한 두 가지 핵심 연구 '에코버스(Echoverse)'와 '에보립(EvoLib)'을 공개했습니다. 에코버스는 실제 데이터베이스와 연동된 12개 고충실도 합성 환경을 통해 9B 모델의 UI 조작 성능을 36.5%에서 67.1%로 대폭 끌어올렸습니다. 에보립은 모델 가중치 업데이트 없이 추론 시점에 경험을 축적·정제·재가중치화하여 재사용 가능한 지식으로 진화시키는 테스트 타임 학습 프레임워크를 입증했습니다.

단순 확장의 한계를 넘어: 고충실도 환경과 진화형 지식

대규모 언어 모델(LLM) 기반 자율 에이전트 연구가 직면한 가장 큰 장벽은 '실제 환경과의 상호작용 충실도'와 '경험을 통한 지식 축적 능력의 부재'였습니다. 화면 캡처 이미지에만 의존하는 단순 에이전트는 상태 변화(Stateful consequences)를 파악하지 못하며, 과거 대화나 실행 로그를 단순 저장하는 기존 메모리 방식은 작업이 복잡해질수록 토큰 낭비와 검색 비효율을 초래합니다.

마이크로소프트 리서치(Microsoft Research)는 이러한 병목을 해결하기 위해 훈련 환경의 충실도를 극대화한 에코버스(Echoverse)와 모델 가중치 수정 없이 추론 단계에서 지식을 진화시키는 에보립(EvoLib)을 연이어 발표했습니다. 두 연구는 정적 벤치마크와 단순 메모리 아카이빙을 탈피하여, 에이전트가 조작하는 '환경'과 에이전트가 축적하는 '지식' 자체를 상호 진화시키는 새로운 패러다임을 제시합니다.

---

Echoverse: 데이터베이스 기반의 고충실도 합성 환경

실제 운영 중인 이메일, 금융, 클라우드 콘솔, 전자의무기록(EMR) 시스템 등은 보안, 권한, 상태 보존 문제로 인해 에이전트의 실시간 훈련 환경으로 직접 사용할 수 없습니다. 또한 개방형 웹사이트는 주기적인 UI 리디자인과 트래픽 차단으로 인해 수천 번 반복해야 하는 강화학습 및 파인튜닝 환경으로 부적합합니다. 에코버스는 이러한 문제를 해결하기 위해 백엔드 데이터베이스와 비즈니스 로직을 완벽히 통제할 수 있는 12개의 심층 합성 환경을 구축했습니다.

  1. 시나리오 명세 작성
  2. FastAPI/React 앱 자동 생성
  3. 실제 브라우저 태스크 해결 검증
  4. SQL diff 기반 상태 채점 및 데이터셋 구축

에코버스가 기존 시뮬레이터와 차별화되는 다섯 가지 핵심 기준은 다음과 같습니다.

"화면 캡처는 인터페이스의 겉모습만 보여줄 뿐이지만, 작동하는 환경만이 행동이 초래한 결과를 보여줍니다. 배울 가치가 있는 결과는 상태를 가지며, 대부분 로그인 뒤편에 존재합니다."

에코버스는 여행 예약 서비스인 'EchoStay'(InsideAirbnb 데이터 기반, 87개 라우트 및 23개 테이블), 255만 개 댓글 코퍼스를 내장한 'EchoForum'을 비롯해 커뮤니케이션, 클라우드 개발(EchoForge), 금융(EchoBank), 의료 기록(EchoCare) 등 10개 도메인 환경과 2개 역량 집중 환경으로 구성됩니다.

환경 구분환경 명칭 / 대상주요 데이터 및 구조적 특징검증 방식
도메인 환경EchoStay87개 라우트, 23개 테이블, InsideAirbnb 기반예약 상태 및 결제 DB 트랜잭션 검증
도메인 환경EchoForum2.55M 공개 포럼 댓글 코퍼스 기반스레드 생성, 권한 및 댓글 상태 diff
도메인 환경EchoMail / EchoCare이메일 스레드, 진료 기록 및 감사 추적(Audit trail)작성/전송/라벨링 DB 전후 상태 검증
역량 환경Datepicker World6개 핵심 위젯, 10개 컨텍스트, 10개 미학습 위젯다변량 캘린더 조작 및 날짜 쿼리 해결

---

UI 취약점 타깃팅과 상호 진화 루프의 효과

에이전트가 복잡한 예약 사이트에서 실패하는 원인은 전체 워크플로를 몰라서가 아니라, 날짜 선택기(Date picker)나 중첩 필터(Nested filter) 같은 단일 UI 컨트롤의 조작 실패 때문인 경우가 많습니다. 에코버스는 이를 격리 훈련하기 위해 '역량 환경(Capability worlds)'을 별도로 설계하여 다양한 레이아웃과 휠 스크롤, 히트맵 캘린더 형태의 날짜 선택기를 집중적으로 학습시켰습니다.

기본 9B 모델36.5
Echoverse 학습 9B 모델67.1
GPT-5.481.1

12개 환경 전체에서 지도 미세조정(SFT)과 강화학습(RL)을 거친 9B 크기의 소형 모델은 기본 점수 36.5%에서 67.1%로 성능이 2배 가까이 향상되었으며, 최상위 상용 모델인 GPT-5.4와의 격차를 14점 차이로 좁혔습니다. 연구진은 환경을 얕게(Shallow) 구현할 경우 오히려 모델 성능이 퇴보하며, 환경의 충실도를 높이고 태스크 난이도를 점진적으로 올리는 '상호 진화(Co-evolution)' 루프를 돌릴 때만 모델의 성능과 일반화 역량이 지속적으로 상승함을 확인했습니다.

---

EvoLib: 추론 시점의 자기주도적 지식 진화

훈련 단계의 환경 구축 못지않게 중요한 과제는 배포 후 추론(Inference) 단계에서 에이전트가 스스로 발전할 수 있는가입니다. 기존의 메모리 에이전트 시스템은 과거 대화 기록이나 행동 궤적을 벡터 DB에 쌓아두고 검색(RAG)하는 정적 아카이브 구조를 취했습니다. 이는 데이터가 누적될수록 노이즈가 증가하고, 새로운 작업에 적합한 전략을 추출하기 어렵다는 구조적 한계가 있었습니다.

마이크로소프트의 에보립(EvoLib)은 외부 라벨이나 모델 가중치 업데이트 없이, 모델이 자체적인 문제 해결 시도(성공 및 실패)로부터 재사용 가능한 기술(Skills)과 통찰(Reflective insights)을 추출하는 '진화형 지식 라이브러리'를 구현했습니다.

---

무작위 태스크 환경에서의 견고성과 연산 효율성

에보립은 수학적 추론, 효율성 제약 하의 코드 작성, 장기 환경 탐색 및 의사결정 등 이종 벤치마크 전반에서 기존 검색 기반 메모리 접근법 대비 적은 토큰 사용량으로 지속적인 성능 우위를 증명했습니다.

특히 실제 배포 환경에서는 사용자의 요청이 일정한 순서(Curriculum) 없이 무작위로 유입됩니다. 연구진이 이종 작업들의 입력 순서를 무작위로 섞어 테스트한 결과, 에보립은 작업 순서의 변화와 무관하게 안정적인 성능 향상 곡선을 유지했습니다. 이는 블랙박스 LLM API 환경에서도 모델을 재학습시키지 않고 추론 연산량(Test-time compute)을 유의미한 성능 향상으로 전환할 수 있음을 의미합니다.

---

컴퓨터 활용 에이전트 설계의 구조적 전환

에코버스와 에보립이 제시하는 결과는 엔터프라이즈 AI 에이전트 개발의 중심축이 '단순 프롬프트 엔지니어링 및 모델 크기 확장'에서 '고충실도 환경 엔지니어링 및 추론 시점 지식 라이브러리 관리'로 이동하고 있음을 보여줍니다. 백엔드 상태가 검증되는 안전한 합성 환경에서 사전 훈련을 수행하고, 배포 후에는 에보립과 같은 진화형 지식 구조를 통해 실시간 경험을 정제된 자산으로 전환하는 2단계 에이전트 아키텍처가 현실적인 대안으로 부상하고 있습니다.

Verified figures

Our take

단순한 파라미터 스케일링과 정적 RAG 기반 메모리는 복잡한 업무를 대행하는 컴퓨터 활용 에이전트의 근본적인 해결책이 될 수 없습니다. 마이크로소프트의 이번 연구들은 백엔드 상태와 완벽히 결합된 시뮬레이션 환경(Echoverse)과 배포 후 모델 업데이트 없이도 경험을 자산화하는 테스트 타임 구조(EvoLib)가 실제 산업 현장 에이전트 구축의 실질적 표준이 될 것임을 시사합니다.

Open questions

Models mentioned

ProviderInputOutputContext window
OpenAI: GPT-5.4 · OpenAI$2.5$151,050,000

Source

Back to catalog