Agent Lightning v1.0 경량 RL 프레임워크

Microsoft Research Asia는 Agent Lightning v1.0이라는 약 3,500줄의 경량 에이전트 강화학습 프레임워크를 공개했습니다. 이 프레임워크는 실제 에이전트 하네스를 그대로 활용하여 훈련 중 재구현이 필요 없으며, Kubernetes 네이티브 지원을 통해 추가 비용 없이 확장할 수 있습니다. Qwen3.5-9B 기반 실험에서 SWE-bench Verified Pass@1이 41.8%에서 56.4%로 14.6퍼센트 포인트 향상되었습니다.

개요

Microsoft Research Asia는 Agent Lightning v1.0이라는 경량형 에이전트 강화학습 프레임워크를 오픈소스로 공개했습니다. 이 프레임워크는 약 3,500줄의 코드로 완전한 에이전트 RL 제어 평면을 제공하며, 실제 에이전트 하네스를 그대로 활용하여 재구현 비용을 줄입니다.

Harnessed Agentic RL 개념

기존 에이전트 RL은 훈련 프레임워크 내에 에이전트 루프를 다시 구현해야 했습니다. 이로 인해 훈련 중 에이전트와 배포 시 에이전트가 다를 수 있습니다. Harnessed Agentic RL은 배포에 사용되는 동일한 하네스를 훈련 과정에 직접 참여시킵니다. 이렇게 하면 환경과의 상호작용 루프가 하네스에 남아 있고, 훈련 프레임워크는 LLM 요청·응답 쌍만을 관찰할 수 있습니다.

"whichever agent harness is used in deployment is the harness that takes part directly in reinforcement learning during training"

이 접근법은 네 가지 핵심 과제를 제기합니다: 재토큰화 및 샘플 병합, 이점 계산, 손실 정규화, 훈련 백엔드 스케줄링.

Agent Lightning v1.0 아키텍처

Agent Lightning v1.0은 세 가지 핵심 구성 요소로 이루어집니다.

전체 코드 규모는 약 3,500줄이며, 이는 이해·수정·확장이 용이한 수준입니다.

실험 결과 및 성능 향상

Qwen3.5-9B 기반 코딩 에이전트 파이프라인을 사용하여 SWE-bench Verified에서 Pass@1을 측정했습니다.

항목값
훈련 샘플 수約 6,000 개
기존 Pass@141.8%
Agent Lightning Pass@156.4%
절대 향상14.6 퍼센트 포인트

이 결과는 약 6,000개의 훈련 샘플만으로도 성능이 크게 향상됨을 보여줍니다.

  1. 데이터 수집
  2. 합성 라벨링
  3. 정책 학습
  4. 실제 배포

실제 활용 시사점

결론

Agent Lightning v1.0은 Harnessed Agentic RL 패러다임을 경량かつ실용적인 형태로 구현하여, 에이전트 기반 시스템의 훈련 효율성을 높입니다. 오픈소스 공개로 인해 연구자와 개발자는 해당 프레임워크를 바로 활용하여 자체 에이전트 파이프라인에 적용할 수 있습니다.

Chiffres vérifiés

Notre avis

Agent Lightning v1.0은 경량 설계와 실제 하네스 통합이라는 두 가지 강점을 통해 에이전트 RL의 실용적 장벽을 크게 낮췄습니다. 오픈소스 공개로 인해 연구 커뮤니티는 빠르게 실험하고 확장할 수 있으며, 기업은 기존 인프라에 최소한의 변경으로 RL 기반 에이전트 훈련을 도입할 수 있습니다. 다만, 실제 하네스의 다양성에 따른 성능 편차는 추가 검증이 필요할 것으로 보입니다.

Questions ouvertes

Modèles mentionnés

FournisseurEntréeSortieFenêtre de contexte
Qwen: Qwen3.5-9B · Alibaba Qwen$0.1$0.15262,144

Source

Retour au catalogue