스크린샷을 넘어 상태(State)로: 정적 벤치마크의 한계
지금까지 컴퓨터를 조작하는 대규모 언어 모델(Computer-Use Agent)의 훈련은 실제 운영 환경의 복잡성을 담아내지 못했습니다. 공개 웹사이트는 페이지 디자인이 수시로 변경되거나 데이터가 갱신되고 트래픽 차단이 발생하는 등 통제하기 어려운 변수가 많아, 수천 번 반복되어야 하는 강화학습(RL) 및 지도학습(SFT)의 신뢰성을 훼손시킵니다. 또한 얕은 UI 복제 환경은 권한 관리, 다자간 동기화, 트랜잭션 기록과 같은 폐쇄형 엔터프라이즈 시스템의 핵심 속성을 배제하여 모델 성능의 퇴행을 유발했습니다.
"컴퓨터 조작 에이전트는 자신의 행동이 실제 결과를 낳는 환경에서만 학습할 수 있습니다. 스크린샷은 인터페이스의 겉모습을 보여줄 뿐이지만, 작동하는 실제 세계만이 행동이 초래한 결과를 드러냅니다."
마이크로소프트는 이러한 병목을 타개하기 위해 환경 구축과 모델 학습을 단일 루프로 통합한 Echoverse 프레임워크와 모델 가중치 변경 없이 추론 중 경험을 지식으로 증류하는 EvoLib을 연이어 발표했습니다.
---
Echoverse: 고충실도 도메인과 특화 제어 환경의 결합
Echoverse는 환경의 단순 수량 확대보다 환경의 깊이(Depth)와 역량 타깃팅(Capability targeting)에 집중했습니다. 총 12개의 학습용 가상 세계는 10개의 심층 도메인 월드와 2개의 특정 UI 제어 집중 월드로 구성됩니다.
- 시나리오 명세 작성
- FastAPI/React 앱 생성
- DB 기반 상태 검증
- GPT-5.4 궤적 추출
- RL/SFT 학습
1. 10대 심층 도메인 월드
- 통신, 기술 업무, 규제 기록(의료/금융), 커뮤니티, 미디어, 여행 등 실제 엔터프라이즈 워크플로우를 모사합니다.
- `EchoStay`는 InsideAirbnb의 실제 데이터를 시딩하여 약 87개 라우트와 23개 테이블에 걸쳐 검색부터 결제까지 일관된 상태 변화를 유지합니다.
- `EchoForum`은 255만 개의 실제 포럼 댓글 코퍼스를 기반으로 구축되었습니다.
- 이메일(`EchoMail`), 금융(`EchoBank`), 의료(`EchoCare`) 등 비공개 시스템은 엄격한 제약조건 하에 짙은 상호 연관성을 지닌 합성 데이터로 채워집니다.
2. 특정 인터랙션 집중 월드(Capability Worlds)
- 에이전트가 공통적으로 실패하는 날짜 선택기(Date Picker) 및 중첩 필터(Nested Filters)를 분리하여 집중 훈련합니다.
- 캘린더 히트맵, 스크롤 휠, 회계 분기 선택기 등 6개 핵심 위젯을 10개 컨텍스트로 변형 생성하며, 훈련 시 보지 못한 10개의 홀드아웃 UI를 통해 일반화 성능을 검증합니다.
3. 데이터베이스 기반 검증자(Verifier)
- 스크린샷 픽셀을 판독하는 대신, SQLite 데이터베이스의 SQL 쿼리와 상태 차이(Diff)로 에이전트의 성공 여부를 직접 채점합니다.
- 읽기 작업은 의미론적 일치($288과 $287.62 일치 허용)를 검증하며, 쓰기 작업은 DB 행(Row)의 실제 변경 여부만을 인정합니다.
| 구분 | 훈련 환경 구성 | 검증 방식 | 주요 특징 |
|---|---|---|---|
| Echoverse 도메인 월드 | 10개 엔터프라이즈 도메인 | SQL 쿼리 & DB Diff | 다중 화면/사용자 간 상태 동기화 및 감사 로그 유지 |
| Echoverse 역량 월드 | 날짜 선택기, 중첩 필터 등 | 실제 UI 인터랙션 통과 | 6개 위젯 변형 및 비학습 UI 일반화 평가 |
| 일반 웹 벤치마크 | 공개 웹 스크래핑/얕은 복제본 | 스크린샷 시각적 판독 | 데이터 변동성 취약, 권한/트랜잭션 부재 |
| 기본 9B 모델 | 36.5 |
| Echoverse 9B 모델 | 67.1 |
| GPT-5.4 | 81.1 |
12개 가상 세계 전체에서 훈련된 9B 소형 파라미터 모델은 기본 점수 36.5%에서 67.1%로 두 배 가까이 향상되었으며, 거대 모델인 GPT-5.4(81.1%)와의 격차를 14%p 이내로 좁히는 성과를 보였습니다.
---
EvoLib: 추론 단계의 자가진화 지식 라이브러리
기존 AI 에이전트의 메모리 구조는 과거의 대화, 추론 궤적, 행동 기록을 그대로 아카이빙하는 RAG 방식에 의존했습니다. 이는 데이터가 누적될수록 문맥 윈도우를 낭비하고 관련 없는 노이즈를 주입하는 한계가 있었습니다. 마이크로소프트의 EvoLib은 가중치 갱신 없이 추론(Inference/Test-time) 과정에서 경험을 재사용 가능한 지식으로 승화시키는 라이브러리 진화 프레임워크입니다.
지식의 구조화와 가중치 최적화
- 통합(Consolidation): 새로운 경험이 발생하면 라이브러리 내 유사 지식을 검색하여 개별 사례를 초월하는 일반적 규칙으로 병합합니다.
- 가중치 부여(Weighting): 지식 단위의 중요도는 현재 작업의 즉각적 기여도뿐 아니라, 향후 새로운 유용 지식을 생성하는 데 기여한 장기적 영향력을 기준으로 지속 갱신됩니다.
``` [원시 경험 발생] ➔ [성공 스킬 / 실패 성찰 추출] ➔ [기존 유사 지식과 병합(Consolidation)] ➔ [장기 기여도 기반 재가중치화(Reweighting)] ```
무작위 작업 순서(Task Order)에 대한 강건성
수학적 추론, 효율 제약 코딩, 장기 탐색 의사결정 등 이종 작업이 불규칙한 순서로 유입되는 환경에서도 EvoLib은 기존 메모리 검색 기법 대비 안정적인 성능 향상을 유지했습니다. 이는 사전 설계된 커리큘럼 없이도 무작위 사용자 요청 스트림을 실시간 처리하며 성능을 개선할 수 있음을 의미합니다.
---
훈련과 추론의 연결: 자가진화 에이전트 아키텍처의 완성
Echoverse와 EvoLib은 별개의 연구가 아니라 에이전트 라이프사이클의 양축을 구성합니다.
- 훈련 단계(Echoverse): 환경, 작업, 검증자가 모델과 함께 공진화(Co-evolution)하여, DB 레벨의 실제 상태 변화를 유발하는 고품질 궤적을 SFT 및 강화학습 보상으로 제공합니다.
- 배포 및 추론 단계(EvoLib): 블랙박스 API 모델이라도 배포 후 수집되는 런타임 인터랙션을 지식 라이브러리로 승화시켜, 토큰 효율성을 극대화하며 지속적으로 성능을 고도화합니다.
결과적으로 고충실도 시뮬레이션 환경을 통한 파운데이션 역량 확보와, 추론 시점의 동적 지식 정제 메커니즘이 결합됨으로써 폐쇄형 엔터프라이즈 시스템을 자율적으로 통제하는 에이전트 구축의 실질적 경로가 마련되었습니다.