MS가 제시한 자율 AI 에이전트의 차세대 진화 공식

마이크로소프트 연구진이 컴퓨터 조작 에이전트 훈련을 위한 고충실도 시뮬레이션 환경 'Echoverse'와 추론 시점 지식 축적 프레임워크 'EvoLib'을 동시 공개했습니다. Echoverse는 데이터베이스 레벨의 상태 일관성을 유지하는 12개 가상 세계를 구축하여 9B 소형 모델의 성능을 36.5%에서 67.1%까지 끌어올렸습니다. EvoLib은 모델 파라미터 업데이트 없이도 과거의 성공과 실패 경험을 재사용 가능한 기술 및 통찰 라이브러리로 진화시켜 블랙박스 LLM의 성능을 향상시킵니다.

정적 벤치마크의 한계와 에이전트 진화의 새 패러다임

거대언어모델(LLM) 기반의 컴퓨터 활용 에이전트(Computer-use Agent)가 실제 업무 환경에 안착하지 못하는 근본적인 이유는 단순한 화면 인식(스크린샷 판독)과 실제 작업 수행 간의 격차 때문입니다. 이메일, 금융 결제, 클라우드 콘솔 등 기업의 핵심 업무는 폐쇄적이고 상태 의존적인(stateful) 시스템 안에서 작동합니다. 이러한 실환경을 직접 에이전트 훈련에 활용하는 것은 계정 훼손 위험, 리셋 불가능성, API 차단 및 UI 변경 등으로 인해 사실상 불가능합니다.

마이크로소프트 연구팀은 이러한 병목을 해결하기 위해 훈련 환경 자체를 고충실도(High-fidelity)로 구축하는 Echoverse와, 훈련을 마친 배포 환경에서 모델 가중치를 수정하지 않고 지식을 축적·진화시키는 EvoLib 프레임워크를 공개했습니다.

  1. Echoverse 합성 환경 생성
  2. DB 단위 정밀 검증 및 SFT/RL 훈련
  3. EvoLib 기반 배포
  4. 추론 중 지식 통합 및 진화

---

Echoverse: 얕은 복제를 넘어선 12개 심층 가상 환경

Echoverse는 단순히 화면만을 모방한 웹페이지가 아니라 FastAPI와 SQLite 기반의 백엔드와 React 프론트엔드로 실제 작동하는 12개의 합성 환경을 구축했습니다. 10개의 심층 도메인 월드와 2개의 인터랙션 집중(Capability) 월드로 구성됩니다.

"컴퓨터 활용 에이전트는 자신의 행동이 실제 결과를 낳는 환경에서만 학습할 수 있습니다. 스크린샷은 인터페이스 모양을 보여줄 뿐이지만, 실제로 작동하는 세계만이 행동이 초래한 결과를 보여줍니다."

Echoverse가 규정한 고충실도 시뮬레이션의 핵심 속성은 다음과 같습니다.

도메인/환경 구분기반 데이터셋 및 규모핵심 아키텍처 특성
EchoStay (숙박)InsideAirbnb 데이터셋 기반87개 라우트, 23개 DB 테이블 연동
EchoForum (커뮤니티)공개 포럼 말뭉치 255만 개 코멘트실제 사용자 인터랙션 및 댓글 스레드 재현
EchoCare / EchoBank자체 정밀 시딩 파이프라인규제 감사 로그(Audit Trail) 및 권한 계층 모사
날짜 선택기 (Capability)6개 코어 위젯, 10개 컨텍스트분기/주말/비즈니스데이 연산 등 추론형 UI 조작
9B 베이스 모델36.5
Echoverse 훈련 9B 모델67.1
GPT-5.4(기준선)81.1

12개 환경 전체에서 훈련된 9B 파라미터 모델은 기본 점수 36.5%에서 67.1%로 성능이 대폭 상승하여 GPT-5.4 기준선(81.1% 추정)과 14%p 이내로 격차를 좁혔습니다. 반면 얕게 복제된 겉핥기식 환경에서 훈련한 모델은 오히려 성능이 퇴보하는 현상이 확인되었습니다.

---

EvoLib: 모델 업데이트 없는 테스트 시점 지식 진화 메커니즘

훈련을 마친 에이전트가 현장에 배포된 후에도 모든 작업을 정적으로 수행할 수는 없습니다. 기존 메모리 시스템은 대화나 액션 로그를 단순 아카이빙하는 데 그쳐, 컨텍스트가 길어질수록 검색 효율이 떨어지고 불필요한 토큰 소비가 발생했습니다.

EvoLib은 추가적인 정답 레이블이나 인간 피드백 없이, 추론 시점(Inference-time)에 에이전트가 직접 겪은 성공과 실패 경험을 동적으로 진화하는 지식 라이브러리로 변환합니다. API 형태로 제공되는 블랙박스 모델에도 즉각 적용할 수 있는 것이 특징입니다.

---

시뮬레이터와 지식 진화 프레임워크가 제시하는 산업적 함의

Echoverse와 EvoLib의 등장은 AI 에이전트 엔지니어링의 패러다임 전환을 명확히 보여줍니다. 파라미터 확장 경쟁에만 의존하던 기존 방식에서 벗어나, 에이전트가 활동할 샌드박스의 논리적 깊이(Depth)를 확보하고, 배포 후 테스트 시점 연산(Test-time Compute)을 효율적인 구조적 지식으로 전환하는 아키텍처가 실질적인 엔터프라이즈 자동화를 이끄는 열쇠로 부상하고 있습니다.

확인된 수치

우리 관점

단순히 환경의 가짓수를 늘리는 양적 팽창보다 단일 환경이라도 실제 백엔드 트랜잭션을 완벽히 모사하는 질적 깊이가 에이전트 역량의 핵심임이 입증되었습니다. 또한 배포 후 파라미터 동결 상태에서도 지식을 진화시키는 테스트 시점 학습 아키텍처는 엔터프라이즈 환경에서 보안과 비용 효율을 동시에 잡는 표준 배포 방식으로 자리 잡을 전망입니다.

아직 확인되지 않은 것

기사에 언급된 모델

프로바이더입력출력컨텍스트 윈도우
OpenAI: GPT-5.4 · OpenAI$2.5$151,050,000

출처

카탈로그로