생성 모델의 새로운 과제: 정밀 제어와 추론 효율성
텍스트 기반 생성 AI는 고화질 결과물을 합성하는 단계를 넘어 사용자의 세부 지시를 정확히 반영하고, 프로덕션 환경의 엄격한 지연 시간(Latency) 기준을 충족해야 하는 전환점에 도달했습니다. 텍스트-이미지 변환 모델은 복잡한 프롬프트 입력 시 속성이 누락되거나 왜곡되는 정렬 문제를 겪어왔으며, 이를 수정하기 위한 기존 미세조정 방식은 모델의 기본 시각 품질을 저하시키는 한계를 보였습니다.
동시에 대규모 언어 모델(LLM)을 활용한 다각도 검색 쿼리 확장(Query Fan-out) 작업에서는 토큰 단위 오토리그레시브(Autoregressive) 생성에 따른 과도한 연산 비용과 응답 지연이 상용화의 병목으로 지적되었습니다. 또한 정지 이미지를 시간 축으로 확장하는 비디오 생성 분야에서는 다차원 시공간 일관성(Temporal Consistency) 유지가 핵심 기술적 과제로 부상했습니다. 최근 연구들은 디퓨전(Diffusion) 아키텍처를 기반으로 이러한 문제들을 해결하는 구체적인 프레임워크를 제시하고 있습니다.
---
디퓨전 컨트롤러: 폐쇄형 모델을 위한 조향 제어 기술
구글 리서치(Google Research)의 치웨이 쉬(Chih-wei Hsu)와 문경 류(Moonkyung Ryu) 소프트웨어 엔지니어 연구팀은 디퓨전 생성 궤적을 정밀하게 제어하는 경량 네트워크인 디퓨전 컨트롤러(Diffusion Controller)를 발표했습니다.
"우리는 프롬프트 정렬을 대폭 개선하기 위해 이미지 생성을 정밀하게 제어하는 경량 '스티어링 댐퍼(Steering Damper)' 네트워크인 Diffusion Controller를 도입합니다. 이는 베이스라인 안정성을 깨뜨리지 않고 접근이 제한된 폐쇄형 모델에도 매끄럽게 부착되어 이미지 품질을 향상시킵니다."
기존의 프롬프트 제어 방식은 추론 시점의 분류기 없는 디퓨전 가이던스(CFG)나 파라미터 효율적 튜닝(LoRA), 강화학습 기반 미세조정 등으로 분절되어 있었습니다. 디퓨전 컨트롤러는 노이즈 제거(Denoising) 전 과정을 연속 제어 문제로 재정의하여 단일 수학 프레임워크로 통합했습니다.
- 랜덤 노이즈 초기화
- 동결된 베이스 모델 추론
- 역방향 평균값 추출
- 스티어링 댐퍼 보정 주입
- 정렬 및 품질 보정 출력
스티어링 댐퍼 메커니즘과 미세조정 기법
디퓨전 컨트롤러는 사전 학습된 거대 모델의 가중치를 완전히 동결(Frozen)한 채 보조 네트워크를 연결하는 '스티어링 댐퍼' 구조를 채택했습니다. 모델 코어를 직접 수정하지 않고 노이즈 제거 궤적에서 생성 방향을 미세 교정하는 방식입니다. 이를 위해 두 가지 보상 최적화 방법론이 도입되었습니다.
- PPO 기반 정책 그래디언트(Policy Gradient): 안정적인 점진적 조정을 유도하며, 급격한 모델 행동 변화를 방지하는 클리핑 규칙(Clipping rule)을 내장했습니다.
- 보상 가중 손실(Reward-Weighted Loss, RWL): 고품질 결과를 생성하는 경로에 직접 가중치를 부여하여 목표 정렬을 달성합니다.
연구팀은 Stable Diffusion v1.4 백본을 기준으로 지도 미세조정(SFT), RWL, PPO 환경에서 성능을 평가했습니다. 인간 선호도 표준 지표인 HPS-v2(Human Preference Score v2) 측정 결과, 내부 가중치를 완전히 미세조정한 화이트박스 설정(Diffusion Controller-J/S)에서는 베이스 모델 대비 90%의 승률(Win rate)을 기록했습니다. 내부 접근이 제한된 그레이박스(Gray-box) 환경에서도 LoRA 대비 적은 레이어를 제어하면서 더 높은 HPS-v2 승률을 달성했습니다.
---
Retrieve-for-Train: 53.9M 확산 모델로 오토리그레시브 지연 해소
검색 및 추천 시스템에서는 단일 품목 반환을 넘어 보완성과 다양성을 갖춘 결과 세트(Slate)를 제공하는 것이 필수적입니다. 그러나 제로샷 LLM에 검색 쿼리 분해(Fan-out)를 맡길 경우 유사 동의어만 반복하는 '패러프레이징 붕괴(Paraphrastic collapse)' 현상이 발생하며, 생각 토큰(CoT) 생성으로 인해 응답 지연이 급증합니다.
구글 리서치의 펑청 장(Pengcheng Jiang)과 주디스 유에 리(Judith Yue Li) 연구팀은 ICML 2026 논문을 통해 오프라인 강화학습과 경량 디퓨전 모델을 결합한 Retrieve-for-Train 프레임워크를 공개했습니다.
| 비교 항목 | 기존 제로샷 LLM / CoT 방식 | Retrieve-for-Train (RL 컴파일 디퓨전) |
|---|---|---|
| 추론 아키텍처 | 토큰 단위 오토리그레시브 생성 | 53.9M 임베딩 공간 디퓨전 병렬 샘플링 |
| 지연 시간 (대규모 배치) | 컨텍스트 증가 시 최대 ~50초 확장 | 서브세컨드(Sub-second) ~ 수 초 유지 |
| 추론 속도 개선 | 기준선 (1.0x) | 12~20배 가속 달성 |
| 최적화 지표 | 포인트 단위 개별 유사도 평가 | Vendi Score 기반 복합 세트 보상 |
복합 보상 체계와 Soft-GRPO
Retrieve-for-Train은 4B 오픈소스 언어 모델(Gemma3-4B, Qwen3-4B)에 프롬프트당 정확히 10개의 서브 쿼리를 생성하도록 지시하고, 이를 소프트 PPO 정규화가 적용된 그룹 상대 정책 최적화(Soft-GRPO)로 훈련합니다. 이때 세 가지 상충하는 기둥으로 구성된 복합 보상이 적용됩니다.
- 접지성(Groundedness): 데이터베이스 매니폴드와의 거리를 페널티로 부과하여 실제 존재하는 항목 매핑 보장
- 다양성(Diversity): 서브 쿼리 세트 전체에 대한 Vendi Score를 측정하여 의미적 폭 확장
- 정렬성(Alignment): 원본 프롬프트와의 의미적 연결을 유지하여 드리프트 방지
연구진은 학습된 언어 모델을 통해 쿼리-타깃 세트 쌍을 오프라인으로 합성한 후, 53.9M 파라미터 규모의 디퓨전 모델에 증류했습니다. 이 디퓨전 모델은 연속 임베딩 공간에서 전체 타깃 임베딩 세트를 단일 패스로 추출하여 텍스트 추론 토큰 없이 기존 대비 12~20배의 추론 가속을 실현했습니다.
---
비디오 디퓨전: 3D U-Net, DiT 및 계층적 증류
릴리안 웡(Lilian Weng)의 분석에 따르면, 비디오 생성 디퓨전 모델은 2D 이미지의 공간 정보에 시간 축(Temporal consistency)을 통합하는 방향으로 발전했습니다. 프레임 간 연속성을 확보하고 계산 복잡도를 제어하기 위해 다양한 아키텍처 접근법이 개발되었습니다.
백본 아키텍처 및 파라미터화
- VDM (Video Diffusion Models): 2D U-Net을 4D 텐서(프레임×높이×너비×채널)를 처리하는 공간-시간 분해 3D U-Net으로 확장했습니다. 공간 연산(1x3x3 합성곱 및 공간 어텐션)과 시간 어텐션 블록을 교차 배치하여 시간적 일관성을 학습합니다.
- v-파라미터화($\mathbf{v}$-parameterization): 비디오 생성 중 발생하는 색상 왜곡(Color shift)을 방지하기 위해 $\mathbf{v} = \alpha_t \boldsymbol{\epsilon} - \sigma_t \mathbf{x}$ 형태의 속도 예측 기법을 적용했습니다.
- DiT (Diffusion Transformer): 최근 OpenAI Sora 모델 등에서 채택된 방식으로, 비디오 및 이미지 잠재 코드를 시공간 패치(Spacetime patches) 단위의 시퀀스 토큰으로 변환해 트랜스포머 레이어로 처리합니다.
모델 확장 및 적응 전략
비디오 모델의 막대한 연산 비용을 최적화하기 위해 사전 학습된 2D 이미지 모델을 재활용하거나 계층적 캐스케이드 구조를 활용합니다.
- Imagen Video: 동결된 T5 텍스트 인코더, 베이스 비디오 디퓨전 모델, 3개의 시간 초해상도(TSR) 및 3개의 공간 초해상도(SSR) 모델을 포함해 총 7개의 디퓨전 모델 캐스케이드로 구성되어 1280x768 해상도(24 fps)를 생성합니다. 점진적 증류(Progressive distillation)를 통해 7개 모델 전부를 모델당 8 샘플링 스텝으로 압축했습니다.
- Make-A-Video: 텍스트-이미지 사전 학습 모델에 의사 3D(Pseudo-3D) 합성곱 및 어텐션 레이어를 삽입하여 레이블이 없는 비디오 데이터로 시간 축 레이어만 미세조정합니다.
- Tune-A-Video: 원샷 튜닝(One-shot tuning)을 위해 공간-시간 어텐션(ST-Attention) 블록을 적용하여 단일 영상 기반의 객체 수정 및 스타일 변환을 구현합니다.
---
디퓨전 아키텍처 확장의 산업적 함의
디퓨전 모델은 단순 픽셀 생성 엔진에서 벗어나 다차원 제어 및 연속 공간 최적화 도구로 재정의되고 있습니다.
첫째, 디퓨전 컨트롤러가 입증한 비침습적 보조 네트워크 구조는 기업이 내부 가중치를 수정할 수 없는 서드파티 상용 모델이나 거대 폐쇄형 모델을 도입할 때 최소한의 파라미터 추가만으로 자사 맞춤형 제어 레이어를 구축할 수 있음을 보여줍니다.
둘째, Retrieve-for-Train의 디퓨전 증류 방식은 높은 토큰 비용과 지연 시간을 유발하던 다단계 LLM 추론을 경량 임베딩 확산 모델로 대체할 수 있는 경로를 제시했습니다. 이는 수억 건의 질의를 실시간 처리해야 하는 엔터프라이즈 검색 및 전자상거래 추천 인프라의 TCO 절감에 직접 기여합니다.
셋째, 비디오 영역에서 확립된 시공간 분해 레이어와 다단계 증류 파이프라인은 고비용 생성 작업을 모바일 기기나 엣지 인프라로 점진적으로 전이할 수 있는 기술적 토대를 형성하고 있습니다.