MS가 제시한 자율 AI 에이전트의 진화

마이크로소프트 연구진이 컴퓨터 제어 및 추론형 AI 에이전트의 한계를 돌파하기 위한 두 가지 핵심 기술인 Echoverse와 EvoLib을 공개했습니다. Echoverse는 데이터베이스 기반의 12개 고충실도 합성 환경을 통해 9B 소형 모델의 성능을 36.5%에서 67.1%까지 끌어올렸습니다. EvoLib은 모델 파라미터 업데이트 없이 추론 시점의 성공과 실패 경험을 재사용 가능한 라이브러리로 진화시키는 테스트 타임 러닝 체계를 확립했습니다. 두 연구는 단순한 데이터 증강이나 단순 메모리 축적을 넘어 환경과 지식의 지속적 상호 진화가 자율 에이전트의 핵심 동력임을 증명하고 있습니다.

AI 에이전트 훈련의 병목: 피상적 환경과 단순 메모리의 한계

최근 AI 에이전트 연구는 웹 브라우저나 운영체제를 조작해 복잡한 업무를 자동화하는 컴퓨터 제어(Computer-use) 역량에 집중되고 있습니다. 그러나 실서비스 환경인 이메일, 금융, 헬스케어, 클라우드 콘솔 등은 대부분 로그인과 엄격한 권한 구조 뒤에 위치해 있어 실제 서비스에서 모델을 직접 훈련하기 어렵습니다. 실서비스에 직접 에이전트를 실행할 경우 실제 계정에 데이터가 영구 기록되며, 실패 시 상태를 즉각 초기화할 수 없고, 화면 뒤의 실제 데이터베이스 상태를 확인할 수 없기 때문입니다.

또한 공개된 오픈 웹사이트를 활용한 훈련 역시 빈번한 UI 개편, 데이터 갱신, 접속 차단 및 쓰로틀링 문제로 인해 동일한 작업을 수천 번 반복해야 하는 강화학습 및 파인튜닝 환경으로 적합하지 않습니다. 반면 기존의 단순 복제형(Shallow) 합성 환경은 겉모습만 흉내 내어 권한 관리, 다중 사용자 간 상태 동기화, 이력 추적 등의 인과적 구조를 결여하고 있어 모델 성능을 오히려 퇴보시키는 원인이 되었습니다.

추론 단계에서도 유사한 한계가 드러납니다. 기존 에이전트의 메모리 시스템은 과거 대화 내용이나 행동 궤적을 정적으로 저장하고 단순히 검색해 참조하는 방식에 머물렀습니다. 이는 경험이 쌓일수록 검색 공간만 방대해지고 정작 새로운 과업에 필요한 일반화된 규칙을 도출하지 못하는 구조적 결함을 안고 있었습니다.

마이크로소프트 연구진은 이러한 병목을 타개하기 위해 두 가지 새로운 접근법을 제시했습니다.

---

Echoverse: 데이터베이스 기반의 고충실도 시뮬레이션

마이크로소프트가 공개한 Echoverse는 단순 화면 픽셀 비교가 아닌 백엔드 데이터베이스 상태의 실제 변경을 기준으로 에이전트의 성공 여부를 검증하는 환경 파이프라인입니다.

  1. 시나리오 명세 작성
  2. FastAPI·SQLite·React 앱 생성
  3. UI 기반 과업 완결성 자동 검증
  4. 데이터베이스 기반 정답 검증기 부착
  5. 모델 궤적 수집 및 강화학습

Echoverse는 다음과 같은 5가지 핵심 기준을 충족하도록 설계되었습니다. 1. 행동 충실도(Behavioral fidelity): 제품 로직에 따른 컨트롤 동작, 권한 분기, 오류 처리 재현 2. 상태 일관성(Coherent state): 발송된 메시지가 수신자 화면에 반영되고, 취소된 일정이 양측 캘린더에서 동시에 삭제되는 인과성 보장 3. 워크플로 깊이(Workflow depth): 초기 선택이 후속 작업에 제약을 거는 다단계 상호작용 구조 4. 권위 있는 검증(Authoritative verification): 스크린샷 판독이 아닌 SQL 쿼리를 통한 데이터베이스 Before/After 비교 검증 5. 도메인 가치(Domain value): 금융, 의료, 이슈 관리 등 실질적 업무 가치가 높은 폐쇄형 시스템 재현

"A screenshot can show what an interface looks like, but only a working world shows what an action caused. The consequences worth learning from are stateful, and most of them sit behind a login."

Echoverse는 10개의 심층 도메인 월드와 2개의 역량 집중 월드로 구성되어 총 12개 환경을 지원합니다. EchoStay는 InsideAirbnb 데이터를 시딩하여 약 87개 라우트와 23개 테이블을 갖추었으며, EchoForum은 255만 건의 실제 포럼 댓글 코퍼스를 기반으로 구축되었습니다.

도메인 월드와 역량 집중 월드의 구성

구분환경 명칭 및 대상특징 및 구성 데이터
도메인 월드EchoStay, EchoMail, EchoForge, EchoCare, EchoBank 등 (10종)InsideAirbnb, 2.55M 포럼 댓글 및 엄격한 제약 기반 합성 데이터
역량 집중 월드날짜 선택기(Date Picker), 중첩 필터·검색 (2종)6개 코어 위젯, 10개 컨텍스트 및 10개 미학습 홀드아웃 환경

에이전트가 특정 도메인 전체가 아니라 날짜 선택기나 다중 계층 필터 같은 공통 UI 조작에서 반복 실패한다는 점에 착안해, 캘린더 히트맵, 스크롤 휠, 회계 분기 선택기 등 다양한 형태의 위젯을 집중 훈련하는 역량 집중 월드를 별도로 분리했습니다.

---

환경과 모델의 공진화 및 성능 도약

Echoverse의 핵심은 환경 구축과 모델 훈련을 분리하지 않고 하나의 루프로 묶는 공진화(Co-evolution) 구조에 있습니다. 모델이 과업 수행 중 실패하면 오류가 발생한 계층(데이터베이스, 백엔드, 프론트엔드, 과업 텍스트, 검증기)을 분류해 자동 수정 도구로 환경을 보수합니다. 더 견고해진 환경은 더 난도 높은 과업을 수용하고, 모델은 더 정밀한 피드백을 통해 성장합니다.

Base 9B Model36.5
Echoverse Trained 9B67.1
GPT-5.481.1

12개 환경 전체에서 훈련된 9B 파라미터 모델은 기본 점수 36.5%에서 67.1%로 두 배 가까이 성능이 상승하며 기준 모델인 GPT-5.4(추정치 81.1% 수준)와의 격차를 14%p 이내로 좁혔습니다. 반면 얕은 복제 환경에서 훈련한 모델은 오히려 성능이 저하되어 시뮬레이션의 충실도가 에이전트 학습에 필수적임이 증명되었습니다.

검증 방식 또한 읽기(Read)는 의미적 동등성 검사($288과 $287.62 일치 판정), 쓰기(Write)는 실제 테이블 행의 플립 여부(Status 변경 등)를 기준으로 채점하여 환각이나 편법 통과를 차단했습니다.

---

EvoLib: 경험을 일반화된 지식 라이브러리로 진화시키는 프레임워크

시뮬레이터가 훈련 단계의 환경을 혁신했다면, EvoLib은 배포 후 추론 단계(Test-Time)에서 모델이 스스로 학습할 수 있도록 돕는 프레임워크입니다. 모델 파라미터 가중치를 직접 업데이트할 수 없는 블랙박스 API 환경에서도 작동합니다.

인간이 모든 과거 기억을 통째로 보관하는 대신 유용한 전략과 피해야 할 실수를 추출해 일반화하듯, EvoLib은 과거 시도에서 지식 단위(재사용 가능한 스킬, 반성적 인사이트)를 추출합니다.

EvoLib은 수학적 추론, 효율성 제약 조건 기반 코드 작성, 장기 의사결정 환경 상호작용 등 세 가지 벤치마크에서 기존 검색 기반 메모리 접근법 대비 더 적은 토큰 사용량으로 지속적인 성능 향상을 입증했습니다. 특히 무작위 순서로 다양한 과업이 주어지는 환경에서도 일관된 성능 개선을 유지하여, 실제 서비스의 비정형 사용자 요청 스트림에 효과적으로 대응할 수 있음을 보였습니다.

---

통합 분석: 에이전트 인텔리전스의 차세대 패러다임

Echoverse와 EvoLib은 마이크로소프트 연구진이 지향하는 차세대 에이전트 인프라의 양대 축을 이룹니다.

이러한 구조적 진화는 고가의 대형 파라미터 모델에만 의존하던 기존 에이전트 구축 방식을 소형 특화 모델의 정밀 훈련 및 테스트 타임 지식 축적 방식으로 분산시킬 수 있는 기술적 토대를 제공합니다.

確認された数値

編集部の見解

에이전트의 신뢰성을 결정짓는 요소가 '모델의 크기'에서 '환경 시뮬레이션의 깊이'와 '경험을 지식화하는 메커니즘'으로 이동하고 있습니다. 향후 엔터프라이즈 AI 시장에서는 실제 내부 ERP나 CRM을 얼마나 충실하게 디지털 트윈으로 복제하여 에이전트를 사전 검증할 수 있는지가 핵심 경쟁력이 될 것입니다.

未確認の点

記事で言及されたモデル

プロバイダー入力出力コンテキスト長
OpenAI: GPT-5.4 · OpenAI$2.5$151,050,000

出典

カタログへ