오픈 에이전트 AI의 도약: 인프라 분리와 경량화 모델 혁신

마이크로소프트가 오픈소스 에이전트 프레임워크인 'Orchard'를 공개하며 쿠버네티스 기반의 독립 런타임 환경과 실제 배포 하네스(Harness) 직접 학습 기술을 선보였습니다. 약 30억~40억 파라미터 수준의 소형 오픈 가중치 모델로도 10배 이상 큰 프론티어 독점 모델에 필적하는 73.0%의 SWE-bench Verified 성능 및 68.4%의 웹 브라우징 성공률을 달성했습니다. 이는 오픈 데이터 감소와 규제 논쟁 속에서도 중국계 오픈 모델(Qwen, MiniMax 등)을 활용한 지식 증류와 오픈 인프라 표준화가 기업 맞춤형 에이전트 생태계를 급속히 확장하고 있음을 시사합니다.

폐쇄형 독점 구조를 흔드는 오픈 에이전트 AI의 패러다임 전환

인공지능 생태계가 정적인 질의응답을 넘어 복잡한 다단계 환경에서 스스로 계획하고 도구를 활용하는 자율형 에이전트(Autonomous Agent) 로 빠르게 진화하고 있습니다. 그러나 지금까지 최고 수준의 에이전트를 구축하기 위해서는 독점적인 샌드박스 환경, 폐쇄형 학습 파이프라인, 비공개 데이터셋 등 막대한 독점 인프라가 필수적이었습니다. 이로 인해 대다수 연구자와 실무자는 프론티어 모델의 에이전트 워크플로를 재현하거나 확장하는 데 심각한 병목을 겪어왔습니다.

이러한 진입 장벽을 무너뜨리기 위해 마이크로소프트 연구진은 확장 가능하고 비용 효율적인 오픈소스 에이전트 프레임워크인 Orchard를 공개했습니다. Orchard는 학습 및 평가 인프라를 모델 자체로부터 분리하여 재사용 가능한 서비스 형태로 구축하는 새로운 접근법을 제시합니다.

동시에 글로벌 AI 생태계에서는 독점 모델과 오픈 가중치 모델 간의 구조적 역학 관계가 재편되고 있습니다. 오픈 데이터의 급격한 축소와 규제 논의 속에서도, Qwen이나 MiniMax와 같은 고성능 오픈 모델을 지식 증류(Distillation)의 원천으로 삼고 개방형 런타임 인프라를 결합하여 독점 폐쇄형 모델의 성능을 바짝 추격하는 흐름이 뚜렷해지고 있습니다.

---

Orchard 아키텍처: 쿠버네티스 런타임과 실기 하네스의 직접 결합

기존 오픈 트레이닝 프레임워크의 치명적인 한계는 단순화된 가상 환경에서 학습된 모델이 실제 복잡한 배포 환경에 적용될 때 겪는 불일치(Mismatch)였습니다. 오늘날 고도화된 에이전트는 단독 모델로 동작하지 않고, 다중 턴 추론과 도구 호출을 관리하는 상태 기반 하네스(Stateful Harness) 환경에서 작동하기 때문입니다.

Orchard는 이러한 간극을 극복하기 위해 Orchard Env라는 경량 쿠버네티스(Kubernetes) 기반 샌드박스 계층을 도입했습니다.

  1. 쿠버네티스 기반 격리 샌드박스 생성
  2. 경량 프록시 통한 모델 호출 기록
  3. 실제 하네스(Codex/OpenClaw) 내 엔드투엔드 롤아웃
  4. 경험 궤적 기반 가치 모델 학습

Orchard Env는 수천 개의 격리된 컨테이너 환경을 병렬로 생성, 관리, 회수할 수 있는 독립형 서비스로 구동됩니다. 이를 통해 소프트웨어 엔지니어링, 웹 브라우징, 일정·이메일 관리 등 다양한 작업 환경을 동일한 인프라에서 지원합니다.

---

3B~4B 파라미터의 약진: 도메인별 특화 에이전트 벤치마크

Orchard 프레임워크를 기반으로 공개된 도메인별 학습 레시피는 대규모 독점 모델에 의존하지 않고도 최고 수준의 성능을 낼 수 있음을 입증했습니다. 연구진은 소프트웨어 엔지니어링(Orchard-SWE), 웹 탐색(Orchard-GUI), 일상 업무 보조(Orchard-Claw)의 세 영역에서 경량 오픈 모델의 역량을 시연했습니다.

소프트웨어 엔지니어링 에이전트 (Orchard-SWE)

소프트웨어 엔지니어링은 다단계 코드베이스 추론과 실시간 오류 복구가 요구되는 고난도 분야입니다. Orchard-SWE는 오픈 가중치 모델인 MiniMax-M2.5와 Qwen3.5-397B로부터 107,000건의 에이전트 상호작용을 증류하여 신용 할당 지도 미세조정(Credit-Assignment SFT)을 수행했습니다.

이후 희소한 피드백을 극복하기 위해 균형 적응형 롤아웃(Balanced Adaptive Rollout)과 조밀 보상(Dense Reward) 기법—교사 모델의 단계별 점수 부여(On-policy Distillation) 및 프로세스 보상 모델(PRM)—을 결합했습니다. 마지막으로 과거 20회 실험의 궤적으로 학습된 4B 파라미터 크기의 가치 모델(Value Model) 로 후보군을 재순위화(Reranking)했습니다.

베이스라인61.4
균형 적응형 롤아웃69.1
조밀 보상 기법 적용69.7
가치 모델 재순위화73.0

단 약 30억 파라미터(3B active parameters) 규모의 모델로 SWE-bench Verified에서 73.0% 를 달성하며, 10배 이상 거대한 독점 프론티어 시스템의 성능에 근접했습니다.

멀티모달 웹 탐색 및 개인 비서 에이전트 성과

Orchard-GUI와 Orchard-Claw 역시 적은 양의 데이터와 효율적인 하네스 연동을 통해 높은 벤치마크 성공률을 기록했습니다.

모델 / 벤치마크모델 크기학습 데이터 규모주요 벤치마크 결과
Orchard-SWE약 3B (Active)107,000 상호작용 증류SWE-bench Verified: 73.0% (Reranking 기준)
Orchard-GUI4B (VLM)400개 증류 시연 + 2,200개 과제WebVoyager: 74.1%, Online-Mind2Web: 67.0%, DeepShop: 64.0% (평균 68.4%)
Orchard-Claw소형 오픈 가중치200개 합성 태스크Claw-Eval (ZeroClaw 연동 시): 73.9% (3회 시도 기준)

Orchard-GUI는 불과 400개의 증류된 시연 데이터와 2,200개의 개방형 과제만으로 4B VLM을 학습시켜 기존 오픈소스 웹 에이전트 중 최상위권의 성과를 보였습니다. 또한 Orchard-Claw는 Codex 하네스 내에서 직접 학습을 거치면서 미학습 모델의 성공률 18.6% 에서 학습 후 51.5% 로 신뢰도가 대폭 향상되었습니다.

---

오픈 모델 생태계의 지형 변화와 데이터 인프라의 과제

이러한 기술적 진보는 오픈소스 AI 생태계 전반의 흐름과 직결되어 있습니다. Nathan Lambert와 Kevin Xu 등이 지적하듯, 현재 글로벌 오픈 모델 생태계는 중국계 랩(Kimi K3, GLM 시리즈, Qwen 등)의 강력한 오픈 가중치 출시와 더불어 기업 맞춤형 에이전트 워크플로를 구축하는 핵심 수단으로 자리잡고 있습니다.

"오픈 모델은 기존 경제의 광범위한 영역에 보완재 역할을 수행하며 독점 폐쇄형 모델과 차별화된 가치를 창출하고 있습니다."

그러나 연구 생태계가 직면한 구조적 문제도 상존합니다. Shayne Longpre 등이 지적한 'AI 데이터 커먼즈의 급격한 감소(The Rapid Decline of the AI Data Commons)' 현상처럼 고품질 공개 데이터의 수집이 갈수록 어려워지고 있습니다. 이에 따라 대형 교사 모델로부터의 상호작용 증류, 합성 데이터 생성, 프로세스 보상 모델을 통한 자체 피드백 강화 등 데이터 효율적 학습 파이프라인의 중요성이 한층 부각되고 있습니다.

---

산업적 함의: 인프라 개방이 주도할 에이전트 도입 가속화

Orchard가 제시한 인프라 분리 모델과 경량 에이전트 훈련 방법론은 엔터프라이즈 AI 시장에 명확한 방향성을 제시합니다.

첫째, 인프라 비용의 획기적 절감입니다. 대규모 폐쇄형 상용 샌드박스에 종속되지 않고 쿠버네티스 환경 위에서 자체 에이전트를 대규모로 롤아웃하고 검증할 수 있는 표준 경로가 열렸습니다.

둘째, 경량 특화 에이전트의 실효성 입증입니다. 거대 언어 모델을 호출하는 데 드는 막대한 추론 비용과 지연 시간 대신, 3B~4B 파라미터 수준의 온디바이스 및 온프레미스 경량 모델로도 정교한 도구 사용과 복잡한 업무 처리가 가능해졌습니다.

셋째, 지속적 학습 자산의 구축입니다. 에이전트의 실패와 성공 경험을 버리지 않고 가치 모델로 축적하여 모델 세대가 바뀌더라도 이전 세대의 지식을 계승하는 누적 학습(Cumulative Agent Learning)이 현실화되고 있습니다.

Verified figures

Our take

Orchard의 등장은 에이전트 AI의 경쟁 축이 단순 '모델 크기'에서 '실행 환경(Environment)과 피드백 파이프라인의 효율성'으로 완전히 전환되었음을 보여줍니다. 특히 3B~4B급 경량 모델이 증류와 가치 모델 재순위화만으로 10배 이상 거대한 모델에 필적하는 성능을 낸 것은, 향후 엔터프라이즈 시장에서 온프레미스 맞춤형 에이전트 도입을 가속화하는 결정적 계기가 될 것입니다.

Open questions

Models mentioned

ProviderInputOutputContext window
MoonshotAI: Kimi K3 · Moonshot AI$0.72$141,048,576

Source

Back to catalog