진화형 환경과 지식 라이브러리로 여는 자율 에이전트

마이크로소프트 연구소가 컴퓨터 제어 에이전트 학습을 위한 심층 시뮬레이션 환경 'Echoverse'와 추론 시점 자가 진화 라이브러리 'EvoLib'을 공개했습니다. Echoverse는 실제 데이터베이스 상태를 변경하는 심층 가상 환경과 정밀 검증 루프를 통해 9B 소형 모델의 성공률을 36.5%에서 67.1%로 두 배 가까이 끌어올렸습니다. EvoLib은 모델 가중치 수정 없이도 추론 과정의 성공과 실패 경험을 재사용 가능한 지식으로 정제·강화하여 무작위 작업 순서에서도 일관된 성능 향상을 입증했습니다.

정적 데이터셋과 단순 기억의 한계: 에이전트 학습의 전환점

거대언어모델(LLM) 기반 자율 에이전트가 소프트웨어와 웹 인터페이스를 직접 조작하는 '컴퓨터 유즈(Computer-Use)' 분야에서 근본적인 한계가 드러나고 있습니다. 기존의 웹 환경이나 단순 스크린샷 기반 학습은 실제 서비스의 복잡한 권한 체계, 사용자 간 공유 상태, 다단계 워크플로를 온전히 반영하지 못합니다. 또한 배포 이후 에이전트가 경험한 대화나 조작 이력을 단순 텍스트 로그로 누적하는 기존 메모리 방식은 검색 노이즈를 키우고 일반화된 지식으로 발전하지 못하는 문제를 겪어왔습니다.

마이크로소프트 연구진은 이러한 병목을 해결하기 위해 훈련 시점의 환경 충실도를 극대화하는 Echoverse와, 배포 후 추론 시점에 모델 가중치 업데이트 없이 경험을 지식으로 축적·진화시키는 EvoLib 프레임워크를 공개했습니다. 두 연구는 단순히 데이터의 양을 늘리거나 모델 크기를 키우는 방식을 넘어, 에이전트가 활동하는 '환경의 인과적 깊이'와 경험을 '일반화된 기술로 증류하는 메커니즘'이 자율 에이전트 성능의 핵심 동인임을 증명하고 있습니다.

---

Echoverse: 스크린샷 너머 DB 상태를 추적하는 심층 가상 세계

공개된 실서비스 웹사이트는 잦은 UI 개편, 데이터 변경, 트래픽 차단 등으로 인해 동일한 조건에서 수천 번의 롤아웃을 반복해야 하는 강화학습(RL) 환경에 적합하지 않습니다. 반면 겉모습만 복제한 얕은(Shallow) 합성 환경은 에이전트의 성능을 오히려 저하시키는 부작용을 낳습니다.

마이크로소프트는 시스템 상태가 완전히 제어되고 안전하게 초기화 가능한 12개의 심층 훈련 환경(10개의 도메인 세계, 2개의 기능 집중 세계)을 구축했습니다. Echoverse 환경은 FastAPI와 SQLite 백엔드, React 프론트엔드로 구현되어 픽셀 렌더링이 아닌 실제 데이터베이스의 상태 변화를 통해 에이전트의 행동을 검증합니다.

  1. 시나리오 명세 및 제약 컴파일
  2. 실행 환경 생성(React+FastAPI)
  3. 실제 UI 기반 Task 검증
  4. DB 상태 기반 Grounded 채점

Echoverse가 규정한 심층 환경의 5가지 핵심 기준은 다음과 같습니다.

실제로 여행 예약 도메인인 EchoStay는 InsideAirbnb 공개 데이터를 기반으로 약 87개 라우트와 23개 테이블에 걸쳐 상태가 연동되며, 커뮤니티 도메인인 EchoForum은 255만 개의 댓글 코퍼스를 기반으로 밀도 높은 상호작용 환경을 제공합니다.

도메인/환경명기반 데이터 및 구조적 규모상태 검증 방식
EchoStayInsideAirbnb 기반, 87개 라우트 / 23개 테이블결제 및 예약 완료에 따른 DB Row 생성
EchoForum2.55M 공개 포럼 댓글 코퍼스권한별 스레드 생성, 댓글 트리 DB 갱신
Datepicker 세계6개 코어 위젯, 10개 학습 컨텍스트, 10개 미보유 컨텍스트캘린더 히트맵/스크롤휠 입력 결과 매핑

---

단일 UI 취약점 공략과 9B 모델의 67.1% 도약

에이전트가 실패하는 원인을 분석하면 도메인 지식 부족뿐만 아니라 날짜 선택기(Date Picker)나 중첩 필터와 같은 특정 UI 컨트롤의 조작 실패에 기인하는 경우가 많습니다. Echoverse는 이를 해결하기 위해 하나의 제어 요소를 수많은 레이아웃과 제약 조건으로 변형한 '기능 집중 세계(Capability Worlds)'를 설계했습니다.

예를 들어 날짜 선택기 환경은 캘린더 히트맵, 스크롤 휠, 회계 분기 선택기 등 6개 핵심 위젯을 10개 컨텍스트로 훈련시키고, 10개의 완전히 새로운 미확인(Held-out) 위젯으로 평가합니다. 이를 통해 '2026년 1월의 마지막 목요일'이나 '시작일로부터 영업일 기준 10일 뒤'와 같은 복잡한 추론 작업을 UI 조작으로 연결하도록 훈련시킵니다.

9B Base Model36.5
9B Echoverse Trained67.1
GPT-5.4 Reference81.1

이 12개 세계에서 GPT-5.4의 성공 궤적을 기반으로 지도미세조정(SFT)을 거치고 데이터베이스 검증기를 보상 함수로 활용한 강화학습(RL)을 적용한 결과, 9B 소형 모델의 작업 성공률은 기본 36.5%에서 67.1%로 두 배 가까이 향상되었습니다. 이는 대형 프론티어 모델인 GPT-5.4의 성능과 불과 14%p 격차입니다.

"고충실도 시뮬레이션은 필수적입니다. 동일한 사이트의 얕은 빌드로 학습한 모델은 성능이 후퇴했으나, 심층 빌드로 학습한 모델은 비약적으로 향상되었습니다."

---

EvoLib: 가중치 업데이트 없는 추론 시점의 '진화형 지식 라이브러리'

훈련 시점의 환경 혁신과 더불어, 배포 후 에이전트가 실시간으로 적응하는 메커니즘으로 제안된 것이 EvoLib입니다. EvoLib은 모델의 파라미터를 변경하지 않고도 추론(Inference/Test-time) 과정에서 발생하는 성공과 실패 경험을 지속적으로 재사용 가능한 지식으로 변환합니다.

EvoLib의 핵심 작동 원리는 두 가지 진화 메커니즘으로 요약됩니다.

수학적 추론, 효율성 제약 조건 하의 코딩, 장기 상호작용 의사결정 등 다양한 벤치마크 평가에서 EvoLib은 기존의 단순 검색 기반 메모리 접근법 대비 훨씬 적은 토큰 소모량으로 우수한 성능을 기록했습니다. 특히 현실 세계의 비정형 요청처럼 작업 순서가 무작위로 섞여 들어오는(Random Task Order) 조건에서도 성능 저하 없이 안정적인 지식 축적 성능을 입증했습니다.

---

실무적 파급 효과: 자율 에이전트 시스템 아키텍처의 재편

Echoverse와 EvoLib의 등장은 AI 에이전트 개발 및 배포 파이프라인에 중대한 시사점을 제공합니다.

Chiffres vérifiés

Notre avis

단순히 환경 수를 늘리거나 대화 이력을 길게 쌓는 방식은 자율 에이전트의 실질적 지능 향상에 기여하지 못함이 명확해졌습니다. 데이터베이스 상태를 직접 검증하는 폐쇄형 고충실도 시뮬레이션(Echoverse)과 추론 시점의 자기반성적 지식 정제(EvoLib)의 결합이야말로 엔터프라이즈 환경에서 작동하는 현실적 에이전트 구축의 표준 청사진이 될 것입니다.

Questions ouvertes

Modèles mentionnés

FournisseurEntréeSortieFenêtre de contexte
OpenAI: GPT-5.4 · OpenAI$2.5$151,050,000

Source

Retour au catalogue