개요
Microsoft Research Asia는 Agent Lightning v1.0이라는 경량형 에이전트 강화학습 프레임워크를 오픈소스로 공개했습니다. 이 프레임워크는 약 3,500줄의 코드로 완전한 에이전트 RL 제어 평면을 제공하며, 실제 에이전트 하네스를 그대로 활용하여 재구현 비용을 줄입니다.
Harnessed Agentic RL 개념
기존 에이전트 RL은 훈련 프레임워크 내에 에이전트 루프를 다시 구현해야 했습니다. 이로 인해 훈련 중 에이전트와 배포 시 에이전트가 다를 수 있습니다. Harnessed Agentic RL은 배포에 사용되는 동일한 하네스를 훈련 과정에 직접 참여시킵니다. 이렇게 하면 환경과의 상호작용 루프가 하네스에 남아 있고, 훈련 프레임워크는 LLM 요청·응답 쌍만을 관찰할 수 있습니다.
"whichever agent harness is used in deployment is the harness that takes part directly in reinforcement learning during training"
이 접근법은 네 가지 핵심 과제를 제기합니다: 재토큰화 및 샘플 병합, 이점 계산, 손실 정규화, 훈련 백엔드 스케줄링.
Agent Lightning v1.0 아키텍처
Agent Lightning v1.0은 세 가지 핵심 구성 요소로 이루어집니다.
- API Gateway: OpenAI 호환 LLM 프록시 역할을 하며, 롤아웃, 모델, 이벤트를 저장하고 프롬프트·응답·로그 확률을 기록합니다.
- Rollout Controller: 에이전트 실행을 로컬 프로세스 또는 표준 Kubernetes 작업으로 시작·관리하며, 트레이너로부터 실행을 분리합니다.
- Customized Trainer: verl을 기반으로 롤아웃을 생성하고, 완료를 기다리며, 샘플을 수집하고 샘플 어댑터를 통해 최종 훈련 샘플을 조립합니다.
전체 코드 규모는 약 3,500줄이며, 이는 이해·수정·확장이 용이한 수준입니다.
실험 결과 및 성능 향상
Qwen3.5-9B 기반 코딩 에이전트 파이프라인을 사용하여 SWE-bench Verified에서 Pass@1을 측정했습니다.
| 항목 | 값 |
|---|---|
| 훈련 샘플 수 | 約 6,000 개 |
| 기존 Pass@1 | 41.8% |
| Agent Lightning Pass@1 | 56.4% |
| 절대 향상 | 14.6 퍼센트 포인트 |
이 결과는 약 6,000개의 훈련 샘플만으로도 성능이 크게 향상됨을 보여줍니다.
- 데이터 수집
- 합성 라벨링
- 정책 학습
- 실제 배포
실제 활용 시사점
- 에이전트 하네스를 그대로 사용함으로써 훈련과 배포 간 불일치를 제거합니다.
- Kubernetes 네이티브 지원을 통해 자체 관리 클러스터, 클라우드 Kubernetes, 로컬 인프라에서 추가 비용 없이 확장할 수 있습니다.
- 경량 코드베이스는 연구 커스텀 및 산업 적용에 빠른 프로토타이핑을 가능하게 합니다.
결론
Agent Lightning v1.0은 Harnessed Agentic RL 패러다임을 경량かつ실용적인 형태로 구현하여, 에이전트 기반 시스템의 훈련 효율성을 높입니다. 오픈소스 공개로 인해 연구자와 개발자는 해당 프레임워크를 바로 활용하여 자체 에이전트 파이프라인에 적용할 수 있습니다.