정적 환경 탈피한 AI 에이전트 자가 진화 기술

마이크로소프트 연구진이 고충실도 환경 구축 프레임워크인 'Echoverse'와 추론 시점 지식 진화 프레임워크인 'EvoLib'을 공개했습니다. Echoverse는 데이터베이스 상태 기반 검증을 통해 9B 소형 모델의 컴퓨터 제어 성능을 36.5%에서 67.1%로 대폭 끌어올렸습니다. EvoLib은 모델 가중치 수정 없이 에이전트가 경험을 재사용 가능한 지식으로 통합·재가중치화하여 지속 학습하도록 지원합니다.

정적 데이터셋과 단순 메모리의 한계를 넘어서는 에이전트 기술

거대언어모델(LLM) 기반의 컴퓨터 제어 에이전트(Computer-use Agent)가 실제 업무에 투입되기 위해서는 단순한 화면 캡처 인식이나 고정된 벤치마크 평가를 넘어서야 합니다. 기존의 에이전트 훈련 방식은 오픈 웹의 불안정성, 권한 및 계정 제약, 그리고 얕은 복제(Shallow Clone) 환경으로 인해 상태 변화가 수반되는 복잡한 업무를 제대로 학습시키지 못했습니다. 동시에 에이전트의 메모리 구조 역시 과거의 대화나 작업 이력을 단순히 누적 저장하는 아카이브 수준에 머물러 있어, 축적된 경험을 새로운 문제 해결에 재사용 가능한 지식으로 진화시키는 데 한계가 있었습니다.

마이크로소프트 연구진은 이러한 병목을 해결하기 위해 두 가지 핵심 프레임워크를 제시했습니다. 첫째는 실제 백엔드 데이터베이스와 비즈니스 로직을 온전히 복원하여 모델과 환경을 함께 진화시키는 Echoverse이며, 둘째는 모델 파라미터 업데이트 없이 추론 시점(Test-time)에서 실패와 성공의 경험을 지식 라이브러리로 승화시키는 EvoLib입니다.

---

Echoverse: 고충실도 합성 환경과 상호작용 역량 타겟팅

에이전트가 컴퓨터 상에서 수행하는 가치 있는 업무는 대부분 이메일, 메신저, 뱅킹, 클라우드 콘솔 등 로그인이 필요한 폐쇄형 시스템 내부에 존재합니다. 이러한 시스템의 실제 계정에서 에이전트를 직접 훈련하는 것은 데이터 파괴 위험과 롤백의 부재 때문에 불가능합니다. 또한 공개된 웹사이트는 UI 개편과 데이터 변동으로 인해 수천 번의 반복 학습 과정에서 환경 일관성을 유지할 수 없습니다.

Echoverse는 이러한 문제를 해결하기 위해 백엔드 데이터베이스를 완전히 통제할 수 있는 고충실도(High-fidelity) 합성 월드를 구축했습니다. Echoverse 파이프라인의 전체 구축 및 정제 흐름은 다음과 같은 단계로 진행됩니다.

  1. 시드 시나리오 명세 확장
  2. React·FastAPI·SQLite 빌드
  3. 실제 브라우저 해결 가능성 검증
  4. SQL 상태 기반 그라운디드 태스크 추출
  5. GPT-5.4 궤적 수집 및 모델 파인튜닝

Echoverse는 총 12개의 훈련 월드를 구축했습니다. 이 중 10개는 실제 워크플로 깊이를 보존하는 심층 도메인 월드이며, 2개는 에이전트가 공통적으로 취약한 단일 인터페이스 컨트롤을 집중 훈련하는 역량 월드(Capability World)입니다.

도메인 깊이와 역량 집중의 결합

실험 결과, 12개 월드 전체에서 훈련된 9B 파라미터 모델은 기본 점수 36.5%에서 67.1%로 성능이 2배 가까이 상승하며 상위 모델인 GPT-5.4 기준선과의 격차를 14점 이내로 좁혔습니다.

9B 베이스라인36.5
Echoverse 9B67.1

연구진은 동일한 사이트를 얕게 구축한 환경(Shallow Build)에서 학습한 모델은 오히려 성능이 퇴보했으나, 내부 상태가 보존된 심층 구축 환경(Deep Build)에서만 명확한 성능 개선이 나타났음을 입증했습니다.

---

픽셀 매칭을 배제한 데이터베이스 그라운디드 검증

Echoverse의 핵심 특징은 에이전트의 성공 여부를 화면 스크린샷 판독이 아닌 실제 백엔드 데이터베이스 상태 변화(State Diff)로 검증한다는 점입니다.

"작업을 학습할 가치가 있는 결과는 상태를 갖습니다. 스크린샷은 인터페이스의 겉모습을 보여줄 뿐이지만, 작동하는 환경만이 행동이 초래한 결과를 증명합니다."

모든 태스크는 생성 시점에 SQL 쿼리로 추출된 정답 키를 보유하며 세 가지 방식으로 채점됩니다.

평가 유형채점 방식판정 기준 예시
Read저장된 데이터와의 시맨틱 동등성 검증$287.62 조회 시 $288 입력 인정
Write실제 데이터베이스 행(Row) 수정 여부 확인티켓 닫힘 플래그 변경 미발생 시 실패
Read-Write읽기와 쓰기 중 더 낮은 점수로 판정데이터 조회 및 업데이트 동시 달성 필수

실제 도메인 데이터의 밀도를 높이기 위해 EchoStay 환경은 InsideAirbnb 데이터를 기반으로 약 87개 라우트와 23개 데이터베이스 테이블을 연동하여 구축되었으며, 커뮤니티 도메인인 EchoForum은 255만 건의 포럼 댓글 코퍼스를 시드 데이터로 활용했습니다. 이러한 심층 환경에서 grounded verifier를 보상 신호로 활용한 강화학습(RL)을 적용한 결과, 에이전트가 목표를 달성하는 데 필요한 단계 수가 유의미하게 단축되었습니다.

---

EvoLib: 가중치 수정 없는 추론 시점 지식 진화

시뮬레이션 환경에서의 사전 학습과 더불어, 실제 배포된 런타임 환경에서 에이전트가 스스로 발전하는 메커니즘으로 EvoLib이 제안되었습니다. 기존 에이전트의 메모리 방식은 과거의 실행 기록을 그대로 저장한 뒤 유사도를 기반으로 검색하는 정적 아카이브 방식이었습니다. 반면 EvoLib은 모델 가중치를 수정하지 않고도 추론 과정(Inference)에서 과거의 성공과 실패 경험을 동적으로 정제합니다.

EvoLib의 핵심 동작 메커니즘은 두 가지 축으로 구성됩니다.

EvoLib은 수학적 추론 문제 해결, 효율성 제약 하의 코드 작성, 장기 계획 기반의 환경 탐색 및 의사결정 태스크 전반에서 기존 검색 기반 메모리 접근법 대비 적은 토큰 사용량으로 우수한 성능을 기록했습니다.

특히 실세계 환경의 불확실성을 반영한 무작위 태스크 순서(Random Task Order) 평가에서도, EvoLib은 작업 유입 순서의 변동과 상관없이 안정적인 지식 축적 및 성능 향상을 유지했습니다. 이는 고정된 커리큘럼 없이 이종의 사용자 요청이 뒤섞여 유입되는 실제 프로덕션 환경에서도 에이전트가 지속 학습할 수 있음을 보여줍니다.

---

고충실도 환경과 진화형 메모리가 가져올 산업적 파급효과

Echoverse와 EvoLib은 차세대 에이전트 시스템을 구축하려는 엔지니어링 및 비즈니스 현장에 명확한 방향성을 제시합니다.

첫째, 에이전트 훈련 데이터의 병목은 환경의 개수가 아니라 상태의 충실도(Fidelity)에 있습니다. UI 겉모습만 흉내 낸 수백 개의 모의 사이트보다, 실제 데이터베이스 제약과 감사 이력이 살아 있는 단 몇 개의 고충실도 환경이 모델의 일반화 성능을 결정짓습니다.

둘째, 블랙박스 API 기반의 상용 LLM 환경에서도 지속 학습 체계를 구축할 수 있습니다. EvoLib의 구조는 고비용의 파인튜닝 인프라를 매번 가동하지 않고도, 인퍼런스 단에서 토큰 소비 효율을 최적화하며 에이전트의 문제 해결 능력을 자가 진화시키는 현실적인 대안을 제시합니다.

확인된 수치

우리 관점

AI 에이전트 경쟁의 무게중심이 거대 파운데이션 모델 자체에서 고충실도 시뮬레이션 환경과 런타임 지식 진화 레이어로 이동하고 있습니다. 데이터베이스 레벨의 결정론적 검증과 무가중치 지속 학습 메커니즘을 결합하는 아키텍처가 엔터프라이즈 에이전트 상용화의 핵심 표준이 될 것으로 전망합니다.

아직 확인되지 않은 것

기사에 언급된 모델

프로바이더입력출력컨텍스트 윈도우
OpenAI: GPT-5.4 · OpenAI$2.5$151,050,000

출처

카탈로그로