제어와 검색으로 확장되는 디퓨전 아키텍처

디퓨전 모델은 단순 2D 이미지 합성을 넘어 복잡한 생성 궤적 제어, 대규모 검색 시스템의 추론 병목 해소, 시공간 확장을 통한 비디오 생성으로 진화하고 있습니다. 구글 리서치는 베이스 모델의 가중치를 고정한 채 정밀 제어를 달성하는 '디퓨전 컨트롤러'와 생성형 검색의 지연 시간을 12~20배 단축한 '리트리브 포 트레인(Retrieve-for-Train)'을 공개했습니다. 비디오 생성 영역에서는 3D U-Net 및 DiT 아키텍처와 증류 기법을 결합하여 고품질 프레임 일관성을 확보하는 파이프라인이 정립되고 있습니다.

생성 모델의 새로운 과제: 정밀 제어와 추론 효율성

텍스트 기반 생성 AI는 고화질 결과물을 합성하는 단계를 넘어 사용자의 세부 지시를 정확히 반영하고, 프로덕션 환경의 엄격한 지연 시간(Latency) 기준을 충족해야 하는 전환점에 도달했습니다. 텍스트-이미지 변환 모델은 복잡한 프롬프트 입력 시 속성이 누락되거나 왜곡되는 정렬 문제를 겪어왔으며, 이를 수정하기 위한 기존 미세조정 방식은 모델의 기본 시각 품질을 저하시키는 한계를 보였습니다.

동시에 대규모 언어 모델(LLM)을 활용한 다각도 검색 쿼리 확장(Query Fan-out) 작업에서는 토큰 단위 오토리그레시브(Autoregressive) 생성에 따른 과도한 연산 비용과 응답 지연이 상용화의 병목으로 지적되었습니다. 또한 정지 이미지를 시간 축으로 확장하는 비디오 생성 분야에서는 다차원 시공간 일관성(Temporal Consistency) 유지가 핵심 기술적 과제로 부상했습니다. 최근 연구들은 디퓨전(Diffusion) 아키텍처를 기반으로 이러한 문제들을 해결하는 구체적인 프레임워크를 제시하고 있습니다.

---

디퓨전 컨트롤러: 폐쇄형 모델을 위한 조향 제어 기술

구글 리서치(Google Research)의 치웨이 쉬(Chih-wei Hsu)와 문경 류(Moonkyung Ryu) 소프트웨어 엔지니어 연구팀은 디퓨전 생성 궤적을 정밀하게 제어하는 경량 네트워크인 디퓨전 컨트롤러(Diffusion Controller)를 발표했습니다.

"우리는 프롬프트 정렬을 대폭 개선하기 위해 이미지 생성을 정밀하게 제어하는 경량 '스티어링 댐퍼(Steering Damper)' 네트워크인 Diffusion Controller를 도입합니다. 이는 베이스라인 안정성을 깨뜨리지 않고 접근이 제한된 폐쇄형 모델에도 매끄럽게 부착되어 이미지 품질을 향상시킵니다."

기존의 프롬프트 제어 방식은 추론 시점의 분류기 없는 디퓨전 가이던스(CFG)나 파라미터 효율적 튜닝(LoRA), 강화학습 기반 미세조정 등으로 분절되어 있었습니다. 디퓨전 컨트롤러는 노이즈 제거(Denoising) 전 과정을 연속 제어 문제로 재정의하여 단일 수학 프레임워크로 통합했습니다.

  1. 랜덤 노이즈 초기화
  2. 동결된 베이스 모델 추론
  3. 역방향 평균값 추출
  4. 스티어링 댐퍼 보정 주입
  5. 정렬 및 품질 보정 출력

스티어링 댐퍼 메커니즘과 미세조정 기법

디퓨전 컨트롤러는 사전 학습된 거대 모델의 가중치를 완전히 동결(Frozen)한 채 보조 네트워크를 연결하는 '스티어링 댐퍼' 구조를 채택했습니다. 모델 코어를 직접 수정하지 않고 노이즈 제거 궤적에서 생성 방향을 미세 교정하는 방식입니다. 이를 위해 두 가지 보상 최적화 방법론이 도입되었습니다.

연구팀은 Stable Diffusion v1.4 백본을 기준으로 지도 미세조정(SFT), RWL, PPO 환경에서 성능을 평가했습니다. 인간 선호도 표준 지표인 HPS-v2(Human Preference Score v2) 측정 결과, 내부 가중치를 완전히 미세조정한 화이트박스 설정(Diffusion Controller-J/S)에서는 베이스 모델 대비 90%의 승률(Win rate)을 기록했습니다. 내부 접근이 제한된 그레이박스(Gray-box) 환경에서도 LoRA 대비 적은 레이어를 제어하면서 더 높은 HPS-v2 승률을 달성했습니다.

---

Retrieve-for-Train: 53.9M 확산 모델로 오토리그레시브 지연 해소

검색 및 추천 시스템에서는 단일 품목 반환을 넘어 보완성과 다양성을 갖춘 결과 세트(Slate)를 제공하는 것이 필수적입니다. 그러나 제로샷 LLM에 검색 쿼리 분해(Fan-out)를 맡길 경우 유사 동의어만 반복하는 '패러프레이징 붕괴(Paraphrastic collapse)' 현상이 발생하며, 생각 토큰(CoT) 생성으로 인해 응답 지연이 급증합니다.

구글 리서치의 펑청 장(Pengcheng Jiang)과 주디스 유에 리(Judith Yue Li) 연구팀은 ICML 2026 논문을 통해 오프라인 강화학습과 경량 디퓨전 모델을 결합한 Retrieve-for-Train 프레임워크를 공개했습니다.

비교 항목기존 제로샷 LLM / CoT 방식Retrieve-for-Train (RL 컴파일 디퓨전)
추론 아키텍처토큰 단위 오토리그레시브 생성53.9M 임베딩 공간 디퓨전 병렬 샘플링
지연 시간 (대규모 배치)컨텍스트 증가 시 최대 ~50초 확장서브세컨드(Sub-second) ~ 수 초 유지
추론 속도 개선기준선 (1.0x)12~20배 가속 달성
최적화 지표포인트 단위 개별 유사도 평가Vendi Score 기반 복합 세트 보상

복합 보상 체계와 Soft-GRPO

Retrieve-for-Train은 4B 오픈소스 언어 모델(Gemma3-4B, Qwen3-4B)에 프롬프트당 정확히 10개의 서브 쿼리를 생성하도록 지시하고, 이를 소프트 PPO 정규화가 적용된 그룹 상대 정책 최적화(Soft-GRPO)로 훈련합니다. 이때 세 가지 상충하는 기둥으로 구성된 복합 보상이 적용됩니다.

연구진은 학습된 언어 모델을 통해 쿼리-타깃 세트 쌍을 오프라인으로 합성한 후, 53.9M 파라미터 규모의 디퓨전 모델에 증류했습니다. 이 디퓨전 모델은 연속 임베딩 공간에서 전체 타깃 임베딩 세트를 단일 패스로 추출하여 텍스트 추론 토큰 없이 기존 대비 12~20배의 추론 가속을 실현했습니다.

---

비디오 디퓨전: 3D U-Net, DiT 및 계층적 증류

릴리안 웡(Lilian Weng)의 분석에 따르면, 비디오 생성 디퓨전 모델은 2D 이미지의 공간 정보에 시간 축(Temporal consistency)을 통합하는 방향으로 발전했습니다. 프레임 간 연속성을 확보하고 계산 복잡도를 제어하기 위해 다양한 아키텍처 접근법이 개발되었습니다.

백본 아키텍처 및 파라미터화

모델 확장 및 적응 전략

비디오 모델의 막대한 연산 비용을 최적화하기 위해 사전 학습된 2D 이미지 모델을 재활용하거나 계층적 캐스케이드 구조를 활용합니다.

---

디퓨전 아키텍처 확장의 산업적 함의

디퓨전 모델은 단순 픽셀 생성 엔진에서 벗어나 다차원 제어 및 연속 공간 최적화 도구로 재정의되고 있습니다.

첫째, 디퓨전 컨트롤러가 입증한 비침습적 보조 네트워크 구조는 기업이 내부 가중치를 수정할 수 없는 서드파티 상용 모델이나 거대 폐쇄형 모델을 도입할 때 최소한의 파라미터 추가만으로 자사 맞춤형 제어 레이어를 구축할 수 있음을 보여줍니다.

둘째, Retrieve-for-Train의 디퓨전 증류 방식은 높은 토큰 비용과 지연 시간을 유발하던 다단계 LLM 추론을 경량 임베딩 확산 모델로 대체할 수 있는 경로를 제시했습니다. 이는 수억 건의 질의를 실시간 처리해야 하는 엔터프라이즈 검색 및 전자상거래 추천 인프라의 TCO 절감에 직접 기여합니다.

셋째, 비디오 영역에서 확립된 시공간 분해 레이어와 다단계 증류 파이프라인은 고비용 생성 작업을 모바일 기기나 엣지 인프라로 점진적으로 전이할 수 있는 기술적 토대를 형성하고 있습니다.

確認された数値

編集部の見解

디퓨전 기술은 고품질 시각 미디어 생성을 넘어 연속 잠재 공간의 다차원 제어 및 병렬 샘플링 엔진으로 확장되고 있습니다. 특히 오토리그레시브 LLM의 고질적 문제인 추론 지연과 비용 병목을 디퓨전 모델 증류로 해소하는 시도는 향후 검색 및 추천 아키텍처의 표준을 바꿀 잠재력을 지닙니다. 기업들은 단일 거대 모델 의존에서 벗어나 동결된 백본과 특화된 경량 디퓨전 제어 레이어를 결합하는 모듈형 아키텍처 도입을 적극 검토해야 합니다.

未確認の点

出典

カタログへ