추론 노력의 제어: RLVR 기반 추론 모델과 온디맨드 스위칭
OpenAI의 o1과 DeepSeek-R1의 등장은 대형 언어 모델(LLM)이 문제를 단계적으로 사고하는 추론 모델의 대중화를 이끌었습니다. 최근 공개된 GPT-5.6 제품군은 3가지 크기로 제공되며 각각 5~6단계의 추론 노력(reasoning-effort) 설정을 지원합니다. 이는 사후 학습(post-training) 및 추론 시점의 연산 자원 배분이 현대 프런티어 모델의 핵심 표준으로 정착했음을 보여줍니다.
- 검증 가능 도메인(수학·코드) 수집
- RLVR 기반 보상 최적화
- Thinking Mode Fusion
- 추론 노력 토글 적용
추론 모델의 핵심 훈련 기법인 검증 가능한 보상을 통한 강화학습(RLVR)은 중간 추론 경로(reasoning trace) 자체를 직접 감독하지 않고, 최종 정답의 참·거짓 여부만으로 모델이 중간 단계의 설명 작성, 역추적, 자가 수정(Aha moment)을 스스로 학습하도록 유도합니다.
- 형식 토큰의 역할: `<think>` 및 `</think>` 태그는 모델에게 추론 능력을 부여하는 본질적 요소가 아니라, 사용자 인터페이스와 훈련 파이프라인에서 사고 과정을 분리하고 숨기기 위한 규칙 기반 서식 보상($R_{format}$)의 결과물입니다.
- 하이브리드 토글 메커니즘: Qwen3 등 최신 모델은 `enable_thinking=False` 설정을 통해 빈 사고 영역을 강제로 주입함으로써 추론 모드를 비활성화하며, SFT 단계의 'Thinking Mode Fusion'과 후속 범용 RL을 통해 온디맨드 추론 제어를 구현합니다.
- 추론 노력과 자원 상관관계: gpt-oss 및 상용 모델의 분석에 따르면, 시스템 프롬프트를 통해 지정되는 추론 강도는 생성 토큰 수의 직접적인 증가 및 문제 해결 정확도 향상과 밀접하게 연동됩니다.
롱컨텍스트 비용 절감을 위한 개방형 가중치 아키텍처 혁신
추론 모델과 에이전트 워크플로가 장기 토큰을 지속적으로 유지함에 따라 키-값(KV) 캐시 크기와 메모리 대역폭이 주된 병목으로 부상했습니다. 최근 공개된 Gemma 4를 비롯한 차세대 개방형 모델들은 구조적 설계를 통해 이러한 연산 부담을 완화하고 있습니다.
| 모델 및 기법 | 파라미터 구성 / 계층 구조 | KV 캐시 절감 효과 및 메커니즘 |
|---|---|---|
| Gemma 4 E2B | 유효 2.3B (임베딩 포함 5.1B) / 35개 레이어 | 15개 층만 KV 계산, 20개 층 재사용 (128K 문맥 기준 약 2.7GB 절감) |
| Gemma 4 E4B | 유효 4.5B (임베딩 포함 8.0B) / 42개 레이어 | 24개 층만 KV 계산, 18개 층 재사용 (128K 문맥 기준 약 6.0GB 절감) |
| 계층별 임베딩 (PLE) | 입력 토큰별 전용 슬라이스 벡터 투영 | 트랜스포머 블록 확장 없이 임베딩 룩업으로 표현 용량 증대 |
Gemma 4의 E2B 및 E4B 모델은 교차 계층 어텐션(Cross-Layer Attention)을 적용하여, 후속 레이어가 동일한 어텐션 유형(슬라이딩 윈도우 또는 풀 어텐션)의 직전 레이어 KV 텐서를 재사용합니다. 이를 통해 모델 용량 손실을 최소화하면서 128K의 긴 문맥 처리 시 bfloat16 정밀도 기준 수 기가바이트의 메모리를 절약합니다.
다중 모달 공간 추론의 구조적 한계: MindTopo 벤치마크
기존 비전-언어 모델(VLM) 평가는 거리, 방향, 크기와 같은 유클리드 공간 특성에 편중되어 있었습니다. 마이크로소프트와 노스웨스턴 대학교 연구진은 피아제의 인지 발달 분류를 기반으로 AI의 3D 위상학적(Topological) 직관을 측정하는 벤치마크 'MindTopo'를 도입했습니다.
MindTopo는 5가지 핵심 범주를 다룹니다:
- 연속성(Continuity): 경로 또는 객체가 끊어지지 않고 이어져 있는지 여부
- 분리(Separation): 인접한 요소들이 단일 구조인지 별개의 부분인지 판별
- 순서(Order): 경로 또는 변형 과정에 따른 요소들의 정렬 순서 추적
- 폐쇄(Enclosure): 경계가 내부와 외부를 명확히 구분하는지 확인
- 매듭(Knots): 밧줄이 시각적으로 엉킨 것인지 실제 결속된 매듭인지 구별
실험 결과 독점 모델과 개방형 가중치 모델 모두 정적 이미지에서의 인식 태스크보다 시뮬레이션 환경 내 행동 계획(Planning) 태스크에서 훨씬 낮은 성능을 보였습니다. 모델들은 단일 장면의 위상 관계는 식별할 수 있으나, 여러 조작 단계에 걸쳐 물리적 제약 조건을 유지하거나 상태 변화를 일관되게 추적하지 못하는 구조적 실패를 드러냈습니다.
의료 전문 VLM의 진화: CARE-X와 도구 결합 측정
범용 VLM이 지닌 불확실성과 임상적 한계를 극복하기 위해 마이크로소프트 연구진은 흉부 X선 판독 연구용 모델인 'CARE-X'를 설계했습니다. 이 모델은 SigLIP2-so400M 비전 인코더와 Phi-4-mini-instruct(3.8B) 언어 백본을 경량 어댑터로 결합하고 보조 분류 및 비주얼 그라운딩 헤드를 통합했습니다.
"표준 교차 엔트로피 손실은 임상적 결과와 무관하게 모든 토큰 오류를 균일하게 처리합니다. 심장비대증 등 일부 징후는 시각적 근사가 아닌 정밀한 정량 측정이 필요합니다."
CARE-X는 DAPO(Direct Alignment for Multitask Preference Optimization) 강화학습을 도입하여 방사선 보고서 작성, 진단 정확도, 공간 위치 파악에 대한 다중 태스크 보상을 최적화했습니다. 그 결과 해부학적 그라운딩에서 mAP가 +28.2%p 향상되었으며, ReXVQA 벤치마크에서 94%의 전체 정확도를 달성하여 리더보드 1위를 기록했습니다.
또한 연구진은 Qwen3-VL-4B-Instruct 모델을 확정적 측정 도구와 연동하여 심장-흉곽 비율 등을 직접 계산하는 멀티턴 추론 루프를 검증했습니다. 인도 나라야나 헬스(Narayana Health)의 CT 확진 122개 증례 코호트 평가에서, 도구 결합 방식은 94.26%의 재현율(Recall)을 기록하며 시각적 인식 전용 베이스라인 대비 +10.65%p의 향상을 입증했습니다.
글로벌 AI 거버넌스와 산업계의 복합 갈등
AI 기술의 구조적 고도화와 병행하여 사회적 도입과 법적 규제 환경은 급격한 변화를 겪고 있습니다.
- 공교육 내 생성형 AI 규제: 뉴욕시는 학생을 대상으로 하는 생성형 AI 소프트웨어를 대상으로 1년간 모의 유예 조치(모라토리엄)를 시행하여 초·중학생 60만 명에 대한 도입을 제한했습니다.
- 반독점 분할 위기 모면: 미국 법원은 구글의 광고 기술 사업 분할 요구를 기각하며 플랫폼 해체 대신 경쟁사 처우 개선 및 정보 공유 의무 부과 조치를 내렸습니다.
- AI 훈련 저작권 분쟁: 트럼프 행정부 법무부는 뉴욕타임스와의 소송에서 OpenAI의 저작물 학습이 공정 이용(Fair Use)에 해당하며, 국가 안보가 미국의 기술적 우위에 달려 있다는 입장을 표명했습니다.
- 반도체 공급망 안보: 대만은 자국 반도체 산업 인력 탈취 및 불법 운영과 연계된 166건의 비인가 네트워크 사례를 적발했습니다.
- 자율주행 상용화: 우버는 영국 스타트업 웨이브(Wayve)의 기술을 활용하여 안전 요원이 탑승하는 영국 최초의 상업용 로보택시 서비스를 론칭했습니다.