Nemotron으로 IOI·IMO 금메달 달성 비결

NVIDIA 연구팀은 Nemotron 3 기반 모델을 감독 학습과 강화 학습으로 미세 조정하여 IOI 2026과 IMO 2026에서 금메달 수준 성능을 달성했습니다. Nano와 Ultra 두 규모의 모델에 특화된 데이터와 생성-검증-개선 추론 루프를 결합했으며, 모든 훈련 자료와 체크포인트는 Hugging Face에 공개되었습니다.

서론

국제올림피아드인 정보학(IOI)과 수학(IMO)은 서로 다른 능력을 요구하지만, 두 대회에서 금메달을 동시에 받는 것은 범용 모델의 적응력을 보여주는 중요한 지표입니다. 본 보고서는 NVIDIA가 공개한 허깅페이스 블로그 글을 바탕으로, Nemotron 3 계열 모델을 어떻게 전문화했는지 사실 위주로 정리합니다.

IOI 금메달 달성을 위한 전문화 과정

경쟁 프로그래밍을 위한 데이터 구축 단계에서 연구팀은 22,000개의 문제를 선별하고, 이에 대한 합성 추론 트레이스를 생성했습니다. 이를 바탕으로 두 가지 전문화 모델을 만들었습니다.

두 모델은 서로 다른 후훈련 전략을 적용했습니다. Nano 모델은 감독 학습(SFT)과 강화 학습(RL)을 순차적으로 적용했으며, Ultra 모델은 SFT 한 에포크만으로도 Nano의 전체 후훈련 성능을 넘어섰습니다.

모델총 파라미터활성 파라미터
Nemotron-3-Nano-CC30B3B
Nemotron-3-Ultra-CC550B55B

IOI 2025 기준 점수 변화는 다음과 같습니다.

IOI 2026 실제 경기에서 Ultra-CC 기반 시스템은 535.4 / 600 점수를 기록했습니다. 이 점수는 인간이 참가한 동일한 시간, 인터넷 접근, 제출 제한 하에서 이루어진 비공식 벤치마크였습니다.

Nano 사전학습 전130
Nano SFT 후280
Nano RL 후291
Nano GenCorrect468
Ultra-CC IOI 2026535.4

IMO 금메달 달성을 위한 증명 생성 파이프라인

수학 올림피아드 측에서는 자연언어 증명을 생성하고 검증하는 데 초점을 맞췄습니다. 연구팀은 Nemotron 3 Ultra를 기반으로 두 가지 전문화 체크포인트를 훈련했습니다.

두 체크포인트는 각각 강점이 다르므로 최종 시스템에서는 SFT 체크포인트(첫 탐색 라운드 강점)와 RL 체크포인트(전체 단일 체크포인트 최고 성능)를 함께 사용했습니다.

추론 과정은 다음과 같은 흐름을 따릅니다.

  1. 평가
  2. 개선
  3. 후보 선택

최종 시스템은 자연언어만으로 작동하며, 외부 형식 증명기나 인터넷 접근 없이 42점 만점에 30점을 획득했습니다. 이는 6문제 중 4문제에 만점을 주고, 공식 금메달 임계값을 초과한 결과입니다.

"The SFT checkpoint was strongest in the first search round, while the RL checkpoint achieved the best overall single-checkpoint result."

전문화 레시피의 네 가지 요소

IOI와 IMO 프로젝트 전반에 걸쳐 반복적으로 나타난 전문화 레시피는 다음과 같습니다. 1. 강력한 Nemotron 베이스 모델로 시작 2. 도메인별 문제와 고품질 reasoning traces 선별 3. 표준 후훈련 방법(SFT, 유용할 경우 RL) 적용 4. 전문화 모델과 생성-평가-개선 추론 루프 결합

이 레시피는 새로운 foundation 모델을 매 과제마다 구축할 필요 없이, 기존 모델을 특정 도메인에 적응시키는 재사용 가능한 흐름을 제공합니다.

테스트 타임 컴퓨팅과 모델·데이터·추론 루프의 공동 설계

메달은 미세 조정 alone 또는 brute‑force sampling alone 으로 얻어지지 않았습니다. 연구팀은 다음과 같이 강조했습니다. "The medals were not produced by fine-tuning alone, and they were not produced by brute-force sampling alone. They came from co-designing the model, the data, and the inference loop."

즉, 특화된 모델이 제공하는 높은 품질의 후보와 비평가가 테스트 타임 컴퓨팅을 통해 반복적으로 개선될 때 최고 성능이 도출됩니다.

오픈소스 공개 및 커뮤니티 활용

모든 결과물은 허깅페이스에 공개되었습니다.

이러한 오픈소스는 연구 개발자가 바로 재현하고 확장할 수 있도록 설계되었습니다.

시사점

IOI와 IMO에서의 금메달 수준 달성은 단순한 모델 크기 확장이 아니라, 데이터 품질, 후훈련 방법, 테스트 타임 추론 전략을 통합적으로 설계했을 때 가능한 성과임을 보여줍니다. 공개된 체크포인트와 벤치마크는 도메인 특화 언어 모델 개발에 재현 가능한 기준을 제공합니다.

確認された数値

編集部の見解

이번 연구는 모델 크기만이 아니라 데이터 품질과 추론 루프 설계가 전문화 성능에 결정적임을 보여줍니다. 공개된 체크포인트와 벤치마크는 도메인 특화 LLM 개발에 재현 가능한 기준을 제공합니다. 향후 다른 과학·기술 올림피아드 분야에도 동일한 레시피를 적용할 수 있을 것으로 기대됩니다.

未確認の点

出典

カタログへ