AI2 GPU 시간 예산 스케줄링 혁신

AI2는 우선순위 기반 스케줄러의 문제를 해결하기 위해 GPU 시간 예산과 계층적 공정 분배를 도입했습니다. 이로써 자원 경쟁을 예산 논의로 전환하고 스쿼팅 및 우선순위 인플레이션을 줄였습니다. 새로운 시스템은 프로젝트별 보장된 GPU 시간 비율을 제공하며 전체 클러스터 가용률을 유지하려는 목적으로 설계되었습니다.

AI2 인프라 팀의 GPU 클러스터 운영 현황

AI2의 AI 인프라 팀은 수천 개의 NVIDIA H100, B200, B300 GPU로 구성된 클러스터를 운영합니다. 이러한 클러스터는 88에서 1024 GPU 규모로 변하며, 대규모 분산 학습 워크로드를 대상으로 합니다. 약 150명의 내부 연구원이 LLM 및 VLM 학습, 로봇 강화학습 시뮬레이션, 과학적 에이전트용 pós트레이닝 등 다양한 AI 분야에서 이 자원을 사용합니다.

\"우리는 GPU 시간 배분 논의를 케이스별 운영 작업에서 투명한 행정 예산 과정으로 전환했습니다.\"

항목값
순간순간 요청 GPU 수가용 GPU의 2~3배
클러스터 규모 범위88~1024 GPU

기존 우선순위 기반 스케줄러의 문제점

과거 AI2는 우선순위 기반 스케줄러를 사용했으며, 워크로드는 선점 가능 여부를 선택할 수 있었습니다. 각 팀은 선점에서 보호받는 동시 GPU 사용량에 상한을 두었고, 선점 가능한 워크로드는 유휴 GPU에서 이 상한을 초과할 수 있었습니다. 이와 같은 운영 방식은 여러 병리 현상을 일으켰습니다. 예를 들어, 사용자는 무작업(no-op) 워크로드를 클러스터에 주차해 두고 필요 시 연결하는 GPU 스쿼팅 현상이 나타났습니다. 이는 디버깅 워크로드를 충분히 낮은 지연으로 실행할 수 없어서 발생했습니다. 또한, 우선순위 인플레이션이 생겨 결국 예약된 워크로드의 100%가 최고 우선순위(HIGH)를 사용하게 되었고, 낮은 우선순위 워크로드는 자원을 전혀 할당받지 못했습니다. 선점 가능성을 선택적으로 허용함에 따라 현장 엔지니어는 티켓 응답 시간의 대부분을 알려진 유지보수 문제가 있는 호스트에서 실행 중인 비선점 워크로드의 정지 협상에 소비했습니다.

비극의 공유 자원: 트래지디 오브 더 커먼스

이러한 현상은 공유 자원의 비극을 보여주는 전형적인 사례입니다. 제한된 GPU 시간을 개인이 최대화하려 시도하면서 전체 시스템의 효율은 저하되고 자원은 남용되었습니다. 자원 배분 연구 분야는 알고리즘 개발, 경제학, 시스템 관리를 결합하며, 2011년 Ghodsi 등이 발표한 Dominant Resource Fairness 논문에서는 사용자가 이용률을 높이기 위해 무한 루프를 코드에 삽입하는 사례가 언급되었습니다. AI2 역시 유사한 동기를 관찰했으며, 이는 사용자가 자신의 작업 가치를 숨기거나 자원을 점유하려는 유인 때문이라고 설명되었습니다.

GPU 시간 예산 및 계층적 공정 분배 도입

AI2는 소유 인센티브를 유지하면서도 전체 가용률을 높이기 위해 새로운 접근법을 채택했습니다. 팀에 GPU를 할당하는 대신, 관리자는 연구 프로젝트와 연구자에게 GPU 시간 예산을 비례적으로 배분할 수 있는 계층적 체계를 만들었습니다. 이 방식에서는 모든 GPU 시간 요청이 예산으로 뒷받침되어야만 선점에서 보호받으며, 예산이 없는 요청은 선점 대상にな릅니다. 예전에는 최고 우선순위가 비용을 발생시키지 않아 무제한 사용이 가능했으나, 이제는 어떤 방법으로도 GPU 시간을 확보하려면 해당 팀의 예산에서 차감되므로 시스템을 속이는 행위가 더 비용이 많이 들게 됩니다.

새로운 스케줄링 시스템의 작동 원리

  1. 계층적 공정 분배
  2. 시간 슬라이싱 계약
  3. 작업 우선순위 결정

위 흐름도에서 보는 바와 같이, 관리자는 먼저 프로젝트별로 GPU 시간 예산을 정합니다. 이어서 계층적 공정 분할 알고리즘이 이 예산을 클러스터 내의 GPU에 공정하게 배분하고, 시간 슬라이싱 계약을 통해 각 워크로드가 할당된 시간_slice를 얻게 됩니다. 스케줄러는 도착하는 워크로드의 예산 소모량을 기준으로 우선순위를 결정하여, 예산을 소모하지 않은 워크로드는 선점됩니다.

AI2는 이 제도를 통해 프로젝트 A1이 총 클러스터 용량의 35%를 보장받는다고 설명했습니다. 이 비율은 다른 프로젝트가 큐에 얼마나 많이 대기하든 변하지 않으며, 괄호 안에 표시된 값은 해당 리프 프로젝트에 할당된 총 클러스터 용량을 나타냅니다.

기대 효과 및 향후 과제

새로운 스케줄링 모델은 GPU 시간 확보를 위한 경쟁을 예산 논의로 전환함으로써 무의미한 스쿼팅을 줄이고, 선점 가능 워크로드의 활용도를 높일 수 있습니다. 동시에 연구 리더는 투자 결정처럼 사전에 어떤 연구에 어느 정도의 GPU 시간을 할당할지 전략적으로 결정할 수 있게 되었습니다. AI2는 현재 이 예산 검토 절차를 지속적으로 반복하고 있으며, 핵심 요구 사항들을 계속 검토 중이라고 밝혔습니다.

확인된 수치

우리 관점

이 접근법은 자원 배분의 투명성을 높이고 운영 효율을 개선할 수 있는 실용적인 모델로 보입니다. 다만 예산 산정 과정의 정확성과 주기적인 조정이 성공의 관건이 될 것입니다.

아직 확인되지 않은 것

출처

카탈로그로