MS의 AI 에이전트 진화: 시뮬레이션 환경과 지식 정제

마이크로소프트 연구진이 컴퓨터 제어 에이전트의 성능 한계를 돌파하기 위한 양대 핵심 기술인 'Echoverse'와 'EvoLib'을 공개했습니다. Echoverse는 데이터베이스 기반의 고충실도 합성 환경을 구축해 9B 매개변수 소형 모델의 작업 성공률을 36.5%에서 67.1%로 대폭 끌어올렸습니다. 한편 EvoLib은 모델 파라미터 업데이트 없이 추론 시점에서 과거의 시행착오를 재사용 가능한 지식으로 진화시키는 자기지도 학습 라이브러리를 제안했습니다.

정적 벤치마크의 한계와 상호작용 기반 학습의 대두

대규모 언어 모델(LLM) 기반의 에이전트 연구가 단순한 텍스트 질의응답을 넘어 실제 사용자 환경에서 소프트웨어를 직접 조작하는 컴퓨터 제어 에이전트(Computer-Use Agents)로 빠르게 확장되고 있습니다. 그러나 현실의 웹 브라우저나 엔터프라이즈 환경은 끊임없이 변화하며, 계정 로그인, 데이터베이스 트랜잭션, 감사 로그와 같은 복잡한 내부 상태를 포함합니다. 공개된 라이브 웹사이트를 직접 크롤링하거나 스크린샷 픽셀 정보에만 의존하는 기존 훈련 방식은 재현성이 떨어지고 실제 시스템 상태 변화를 정확히 검증하지 못한다는 구조적 한계를 안고 있었습니다.

마이크로소프트 연구진은 이러한 병목을 해결하기 위해 두 가지 상호보완적 연구를 발표했습니다. 실제 소프트웨어의 내부 인과 구조를 그대로 복제한 고충실도 합성 환경 프레임워크인 Echoverse와, 블랙박스 API 환경에서도 추론 시점의 경험을 축적·일반화하는 EvoLib입니다. 두 기술은 에이전트가 작동하는 '환경의 깊이'와 에이전트가 경험을 축적하는 '지식 진화 메커니즘'을 각각 혁신하며 차세대 자율 에이전트의 훈련 패러다임을 재정의하고 있습니다.

---

Echoverse: 데이터베이스 기반의 고충실도 가상 환경

에이전트가 행동의 결과를 온전히 학습하려면 클릭이나 입력이 실제 시스템의 상태를 변경하는 인과적 피드백이 필수적입니다. 이메일 전송, 은행 송금, 전자 건강 기록(EHR) 관리와 같은 핵심 업무는 모두 닫힌 시스템(Closed System) 내부에서 수행되므로 실제 라이브 시스템을 학습용으로 직접 타격할 수 없습니다.

Echoverse는 이러한 문제를 해결하기 위해 백엔드와 데이터베이스를 직접 제어하는 12개의 가상 훈련 월드를 구축했습니다. 시스템은 단순 목업이 아니라 FastAPI와 SQLite 기반의 백엔드 및 React 프론트엔드로 실제 구동되는 애플리케이션 형태를 갖춥니다.

  1. 시드 시나리오 기반 앱 명세 생성
  2. FastAPI·SQLite·React 앱 빌드
  3. 브라우저 기반 실동작 검증
  4. SQL 상태 기반 정밀 채점
  5. GPT-5.4 궤적 수집 및 SFT/RL

Echoverse의 핵심은 화면의 픽셀이 아니라 실제 데이터베이스 레코드의 변화를 기준으로 정답 여부를 판정하는 그라운디드 검증기(Grounded Verifier)에 있습니다. 이를 통해 상태의 일관성과 워크플로의 깊이를 보장합니다.

이러한 환경에서 훈련된 9B 매개변수 모델은 기본 점수 36.5%에서 67.1%로 성능이 수직 상승하며 최상위 모델인 GPT-5.4와의 격차를 14포인트 이내로 좁혔습니다.

모델 및 구성성공률(Score)비고
9B 기본 베이스라인36.5%훈련 전 기본 상태
9B + Echoverse 전체 훈련67.1%12개 월드 SFT/RL 적용 후
GPT-5.4 기준선81.1% 추정9B 최종 성능과 14.0%p 격차

---

단일 인터랙션 집중 훈련과 환경-모델 공진화

Echoverse 연구진은 에이전트의 실패 원인이 특정 도메인 지식의 부재뿐만 아니라 날짜 선택기(Date Picker)나 중첩 필터(Nested Filter)와 같은 공통 UI 컴포넌트의 조작 실패에서 자주 발생한다는 점을 규명했습니다.

"에이전트는 종종 날짜 선택기와 중첩 필터처럼 동일한 고난도 UI 요소에서 반복적으로 실패합니다. 이러한 컨트롤을 다양한 형태로 집중 훈련(Drilling)시키면 훈련에서 전혀 본 적 없는 새로운 도메인에서도 이를 능숙하게 다루는 법을 배웁니다."

연구진은 10개의 심층 도메인 월드 외에 2개의 역량 타깃 월드(Capability Worlds)를 별도로 구성했습니다. 날짜 선택기 월드의 경우 단일 컨트롤을 10개 콘텍스트에 걸쳐 6개의 핵심 위젯 형태로 렌더링하고, 10개의 완전히 새로운 미확인 형태(히트맵, 스크롤 휠, 회계 분기 선택기 등)를 평가용으로 분리하여 에이전트가 형태 변화에 굴하지 않고 일반화된 제어 능력을 갖추도록 유도했습니다.

또한 모델 훈련과 환경 구축을 단절하지 않고, 에이전트가 실패한 지점에서 환경과 검증기를 더 정교하게 보강하고 다시 훈련시키는 공진화(Co-evolution) 루프를 적용했습니다. 강화학습(RL) 단계에서는 데이터베이스 변경 사실에 기반한 보상을 부여하여 단순 모방(Imitation)을 넘어 더 적은 스텝 수로 목표를 완수하도록 효율성을 극대화했습니다. 마이크로소프트는 연구 생태계 지원을 위해 이 중 4개 월드의 코드, 데이터, 검증기를 오픈소스로 공개했습니다.

---

EvoLib: 모델 업데이트 없는 추론 시점 지식 진화

Echoverse가 강력한 사전 훈련 및 강화학습 환경을 제공한다면, EvoLib은 배포 이후 추론(Inference) 단계에서 에이전트가 지속적으로 똑똑해질 수 있는 메커니즘을 제공합니다. 기존 에이전트 메모리 시스템은 과거의 대화나 행동 이력을 단순히 벡터 데이터베이스에 정적으로 쌓아두는 방식에 머물러 있어, 데이터가 누적될수록 노이즈가 증가하고 토큰 비용이 급증하는 구조적 문제를 안고 있었습니다.

EvoLib은 과거의 시도 중 성공적인 해결책에서는 재사용 가능한 스킬(Reusable Skills)을, 실패 사례에서는 성찰적 통찰(Reflective Insights)을 추출하여 지속적으로 진화하는 지식 라이브러리로 변환합니다. 이 프레임워크는 모델 가중치를 수정하지 않기 때문에 상용 API로 배포된 블랙박스 LLM에도 즉시 적용할 수 있습니다.

핵심 아키텍처: 통합과 가중치 부여

---

벤치마크 결과 및 실제 적용 가능성

EvoLib은 수학적 추론 문제, 효율성 제약 하의 코드 작성, 장기적인 환경 탐색 및 의사결정 등 이질적인 3가지 벤치마크에서 기존의 검색 기반 메모리 접근법과 추상화 메모리 기법을 일관되게 능가했습니다. 특히 계산 자원(Compute)을 늘릴수록 지식 진화 메커니즘을 통한 성능 향상 속도가 일반 단독 추론 스케일링 방식보다 훨씬 가파르게 나타났습니다.

또한 실제 환경에서는 사용자의 다양한 요청이 비정형 순서로 인입된다는 점에 착안하여 무작위 태스크 순서에 대한 강건성(Robustness to Random Task Order)을 검증했습니다. EvoLib은 서로 다른 유형의 작업이 임의의 순서로 교차 배치되는 환경에서도 성능 저하 없이 지속적으로 지식을 축적하고 성능을 개선하는 안정성을 입증했습니다.

결과적으로 Echoverse가 증명한 '고충실도 데이터베이스 기반 훈련'과 EvoLib이 제시한 '추론 시점의 동적 지식 정제'는 고성능 AI 에이전트를 구축하기 위한 전 주기적 인프라의 핵심 축으로 자리잡고 있습니다.

Verified figures

Our take

에이전트의 한계를 돌파하는 핵심 열쇠가 모델 파라미터의 단순 증대에서 '고충실도 환경 시뮬레이션'과 '추론 단계의 지식 정제'로 이동하고 있음을 명확히 보여줍니다. 특히 엔터프라이즈 환경에서 폐쇄망 데이터베이스 연동과 API 기반 블랙박스 모델 운용이 필수적인 기업들에게 매우 실질적인 기술적 표준을 제시한 것으로 평가됩니다.

Open questions

Models mentioned

ProviderInputOutputContext window
OpenAI: GPT-5.4 · OpenAI$2.5$151,050,000

Source

Back to catalog