정적 벤치마크의 종말: MS가 제시한 자가진화 에이전트 패러다임

마이크로소프트 연구진이 컴퓨터 제어 에이전트의 훈련과 추론 패러다임을 근본적으로 혁신하는 두 건의 핵심 연구(Echoverse 및 EvoLib)를 공개했습니다. Echoverse는 데이터베이스 기반의 깊이 있는 12개 가상 환경을 통해 9B 소형 모델의 성능을 36.5%에서 67.1%까지 끌어올렸으며, EvoLib은 가중치 업데이트 없이 추론 단계에서 경험을 재사용 가능한 지식 라이브러리로 진화시키는 프레임워크를 입증했습니다. 두 연구는 단순한 메모리 축적이나 얕은 스크린샷 기반 학습을 넘어, 상태적 인과관계와 자가진화 지식 체계가 차세대 에이전트의 핵심임을 보여줍니다.

스크린샷을 넘어 상태(State)로: 정적 벤치마크의 한계

지금까지 컴퓨터를 조작하는 대규모 언어 모델(Computer-Use Agent)의 훈련은 실제 운영 환경의 복잡성을 담아내지 못했습니다. 공개 웹사이트는 페이지 디자인이 수시로 변경되거나 데이터가 갱신되고 트래픽 차단이 발생하는 등 통제하기 어려운 변수가 많아, 수천 번 반복되어야 하는 강화학습(RL) 및 지도학습(SFT)의 신뢰성을 훼손시킵니다. 또한 얕은 UI 복제 환경은 권한 관리, 다자간 동기화, 트랜잭션 기록과 같은 폐쇄형 엔터프라이즈 시스템의 핵심 속성을 배제하여 모델 성능의 퇴행을 유발했습니다.

"컴퓨터 조작 에이전트는 자신의 행동이 실제 결과를 낳는 환경에서만 학습할 수 있습니다. 스크린샷은 인터페이스의 겉모습을 보여줄 뿐이지만, 작동하는 실제 세계만이 행동이 초래한 결과를 드러냅니다."

마이크로소프트는 이러한 병목을 타개하기 위해 환경 구축과 모델 학습을 단일 루프로 통합한 Echoverse 프레임워크와 모델 가중치 변경 없이 추론 중 경험을 지식으로 증류하는 EvoLib을 연이어 발표했습니다.

---

Echoverse: 고충실도 도메인과 특화 제어 환경의 결합

Echoverse는 환경의 단순 수량 확대보다 환경의 깊이(Depth)와 역량 타깃팅(Capability targeting)에 집중했습니다. 총 12개의 학습용 가상 세계는 10개의 심층 도메인 월드와 2개의 특정 UI 제어 집중 월드로 구성됩니다.

  1. 시나리오 명세 작성
  2. FastAPI/React 앱 생성
  3. DB 기반 상태 검증
  4. GPT-5.4 궤적 추출
  5. RL/SFT 학습

1. 10대 심층 도메인 월드

2. 특정 인터랙션 집중 월드(Capability Worlds)

3. 데이터베이스 기반 검증자(Verifier)

구분훈련 환경 구성검증 방식주요 특징
Echoverse 도메인 월드10개 엔터프라이즈 도메인SQL 쿼리 & DB Diff다중 화면/사용자 간 상태 동기화 및 감사 로그 유지
Echoverse 역량 월드날짜 선택기, 중첩 필터 등실제 UI 인터랙션 통과6개 위젯 변형 및 비학습 UI 일반화 평가
일반 웹 벤치마크공개 웹 스크래핑/얕은 복제본스크린샷 시각적 판독데이터 변동성 취약, 권한/트랜잭션 부재
기본 9B 모델36.5
Echoverse 9B 모델67.1
GPT-5.481.1

12개 가상 세계 전체에서 훈련된 9B 소형 파라미터 모델은 기본 점수 36.5%에서 67.1%로 두 배 가까이 향상되었으며, 거대 모델인 GPT-5.4(81.1%)와의 격차를 14%p 이내로 좁히는 성과를 보였습니다.

---

EvoLib: 추론 단계의 자가진화 지식 라이브러리

기존 AI 에이전트의 메모리 구조는 과거의 대화, 추론 궤적, 행동 기록을 그대로 아카이빙하는 RAG 방식에 의존했습니다. 이는 데이터가 누적될수록 문맥 윈도우를 낭비하고 관련 없는 노이즈를 주입하는 한계가 있었습니다. 마이크로소프트의 EvoLib은 가중치 갱신 없이 추론(Inference/Test-time) 과정에서 경험을 재사용 가능한 지식으로 승화시키는 라이브러리 진화 프레임워크입니다.

지식의 구조화와 가중치 최적화

``` [원시 경험 발생] ➔ [성공 스킬 / 실패 성찰 추출] ➔ [기존 유사 지식과 병합(Consolidation)] ➔ [장기 기여도 기반 재가중치화(Reweighting)] ```

무작위 작업 순서(Task Order)에 대한 강건성

수학적 추론, 효율 제약 코딩, 장기 탐색 의사결정 등 이종 작업이 불규칙한 순서로 유입되는 환경에서도 EvoLib은 기존 메모리 검색 기법 대비 안정적인 성능 향상을 유지했습니다. 이는 사전 설계된 커리큘럼 없이도 무작위 사용자 요청 스트림을 실시간 처리하며 성능을 개선할 수 있음을 의미합니다.

---

훈련과 추론의 연결: 자가진화 에이전트 아키텍처의 완성

Echoverse와 EvoLib은 별개의 연구가 아니라 에이전트 라이프사이클의 양축을 구성합니다.

결과적으로 고충실도 시뮬레이션 환경을 통한 파운데이션 역량 확보와, 추론 시점의 동적 지식 정제 메커니즘이 결합됨으로써 폐쇄형 엔터프라이즈 시스템을 자율적으로 통제하는 에이전트 구축의 실질적 경로가 마련되었습니다.

Belegte Zahlen

Unsere Einschätzung

에이전트 경쟁력의 핵심이 대규모 파라미터 확장이나 단순 텍스트 프롬프트 엔지니어링에서 '환경 충실도'와 '추론 시점 지식 증류'로 완전히 전환되고 있습니다. 특히 소형 모델(9B)이 고품질 합성 환경 학습만으로 대형 모델 턱밑까지 추격했다는 점은 엔터프라이즈 온프레미스 AI 구축에 있어 중요한 분기점이 될 것입니다.

Offene Fragen

Erwähnte Modelle

AnbieterEingabeAusgabeKontextfenster
OpenAI: GPT-5.4 · OpenAI$2.5$151,050,000

Quelle

Zurück zum Katalog