서론
최근 기업들은 에이전트가 자사의 특정 환경에서 잘 작동하도록 요구하고 있습니다. 그러나 기존의 모델은 특정 환경에서의 작업을 수행하는 데 어려움을 겪을 수 있습니다. ServiceNow의 CoreAI 팀은 이러한 문제를 해결하기 위해 AutoSynthData라는 시스템을 개발하였습니다. 이 시스템은 에이전트의 능력 부족을 훈련 데이터로 전환하여, 에이전트가 다양한 상황에서 더 나은 성능을 발휘할 수 있도록 돕습니다.
AutoSynthData의 작동 원리
AutoSynthData는 에이전트의 실패와 더 강력한 모델의 성공을 분석하여, 에이전트가 다음에 배워야 할 내용을 결정합니다. 이 과정은 다음과 같은 단계로 이루어집니다: 1. 환경 평가: 에이전트가 작동하는 환경을 정의하고, 유용한 훈련 작업을 결정합니다. 2. 작업 생성: 에이전트의 현재 능력 부족을 기반으로 새로운 작업을 생성합니다. 3. 검증: 생성된 작업이 실제 환경에서 실행 가능한지 확인합니다.
이러한 과정은 에이전트가 해결해야 할 과제를 명확히 하고, 훈련 과정에서의 효과를 극대화합니다.
유용한 작업의 특성
AutoSynthData에서 생성된 작업은 다음 세 가지 속성을 가져야 합니다:
- 실현 가능성: 현재 환경에서 사용자 요청을 충족할 수 있는 경로가 존재해야 합니다.
- 현실성: 사용자 요청은 실제 사용자가 요청할 법한 내용이어야 합니다.
- 난이도: 작업은 현재 에이전트의 약점을 드러내야 하며, 이미 해결된 작업은 새로운 훈련 신호를 제공하지 않습니다.
이러한 특성은 훈련 중 에이전트가 효과적으로 학습할 수 있도록 돕습니다.
훈련 데이터 생성 과정
AutoSynthData는 두 가지 주요 단계를 통해 훈련 데이터를 생성합니다: 1. 핵심 샘플 생성: 에이전트의 능력 사양을 기반으로 핵심 훈련 샘플을 생성합니다. 2. 변형 샘플 확장: 승인된 샘플을 바탕으로 새로운 변형 샘플을 생성합니다.
이 과정은 에이전트가 다양한 상황에서 학습할 수 있도록 돕고, 훈련 데이터의 품질을 높입니다.
품질 관리
AutoSynthData는 생성된 작업의 품질을 두 가지 수준에서 검토합니다:
- 샘플 수준 검증: 각 후보 작업이 훈련 데이터셋에 포함되기 전에 검증을 통과해야 합니다.
- 배치 수준 검토: 전체 데이터셋의 다양성과 유용성을 보장하기 위해 배치 수준에서 검토합니다.
이러한 품질 관리 절차는 훈련 데이터의 신뢰성을 높이고, 에이전트의 학습 효과를 극대화합니다.
결론
AutoSynthData는 기업 환경에서 에이전트의 성능을 향상시키기 위한 혁신적인 접근 방식을 제공합니다. 이 시스템은 에이전트의 능력 부족을 분석하고, 이를 기반으로 새로운 훈련 데이터를 생성하여, 에이전트가 다양한 상황에서 더 나은 성과를 낼 수 있도록 돕습니다. 이러한 접근은 기업들이 AI 에이전트를 효과적으로 활용할 수 있는 길을 열어줍니다.