엣지 멀티모달 d1 의사결정 모델 출시 분석

Hugging Face에서 d1-3B와 d1-omni-600M 두 가지 오픈 의사결정 모델이 공개되었습니다. d1-3B는 3B 파라미터로 텍스트·이미지 입력을 처리하며 Decision Index 0.2.1에서 48.57점을 기록해 4B·9B 모델 및 Decider 35B-A3B를 앞섭니다. Jetson AGX Thor에서 단일 질문 16 ms의 초저지연을 보여주며, sette 개 공개 데이터셋에서 평균 82.9점을 달성했습니다. 이 모델은 단일 forward pass로 결정을 내려 에너지 효율이 높고 엣지 디바이스에서의 실시간 멀티모달 응용에 적합합니다.

Liquid Decision Models 소개

오늘 우리는 d1 의사결정 모델 가족의 두 가지 오픈 모델을 공개합니다: d1-3B와 d1-omni-600M (실험적). d1-3B는 3B 파라미터 규모로 텍스트와 이미지를 동시에 입력으로 받아들입니다. d1-omni-600M은 600M 파라미터로 텍스트+이미지 또는 텍스트+오디오 조합을 처리합니다. Decision Index 0.2.1에서 d1-3B는 48.57점을 기록하며, 모든 4B·9B 모델과 Decider 35B-A3B(47.11)를 앞섭니다.

아키텍처 및 훈련 방식

d1-3B는 Liquid Foundation Models(LFM)의 최신 버전인 LFM2.5-VL-3B(디코더 전용 VLM)에서 파생되었습니다. d1-omni-600M은 LFM2.5-Encoder-350M(양방향 인코더)에 비전과 오디오 인코더를 추가하여 세 가지 모달리티를 지원합니다. 두 모델은 토큰을 생성하는 생성 모델과 달리 단일 forward pass로 결정을 출력합니다.

모델파라미터지원 모달리티
d1-3B3B텍스트 + 이미지
d1-omni-600M600M텍스트+이미지 또는 텍스트+오디오

벤치마크 결과

우리는 sette 개 공개 데이터셋(독해, 독성 탐지, 의도 분류, 의료 QA, 교차 언어 이해)에서 평균 성능을 측정했습니다. d1-3B는 평균 82.9점을 얻어 표에서 가장 높은 점수를 기록했으며, Decider 4B를 초과했습니다. d1-omni-600M은 평균 78.4점을 얻어 Decider 2B(77.1)를 앞섰으며, 파라미터 수는 불과 1/4에 불과합니다.

d1-3B는 표에서 가장 높은 점수를 기록하며, Decider 4B를 앞섭니다.

d1-3B82.9
d1-omni-600M78.4
Decider 4B80.0
Decider 2B77.1

엣지 및 GPU에서의 지연 시간

NVIDIA와의 협력으로 GeForce RTX 4090, Jetson AGX Thor, Jetson AGX Orin 64GB, Jetson Orin Nano에서 d1-3B를 평가했습니다.

장치단일 질문 (ms)세 질문 (ms)
Jetson AGX Thor1620
Jetson AGX Orin26–
Jetson Orin Nano50–
GPU (RTX 4090)<10–

활용 가이드 및 배포

필수 라이브러리는 transformers>=5.14입니다. 모델을 로드할 때는 trust_remote_code=True 옵션을 반드시 주어야 합니다. 예시 코드 (d1-3B): ```python from transformers import AutoModelForSequenceClassification model = AutoModelForSequenceClassification.from_pretrained("liquidai/d1-3B", trust_remote_code=True) ``` 두 모델은 오픈 웨이트로 Hugging Face에서 바로 다운로드 가능하며, 데모는 System One Arcade Hugging Face Space에서 체험할 수 있습니다.

  1. 데이터 수집
  2. 전처리
  3. 모델 추론
  4. 결정 출력
  5. 액션 실행

So What? – 개발자·기업·산업에 미치는 의미

개발자는 sub‑50ms latency를 보장하는 경량 의사결정 모델을 통해 실시간 멀티모달 애플리케이션을 쉽게 구현할 수 있습니다. 기업은 Jetson 계열 엣지 디바이스에 d1-3B를 탑재하여 영상·오디오 기반 자동화 시스템의 응답 시간을 획기적으로 줄일 수 있으며, 이는 운영 비용 절감과 사용자 경험 향상으로 직결됩니다. 산업 전반에서는 의사결정 모델이 생성 모델과 달리 단일 forward pass로 작동함에 따라 에너지 효율이 높아져, 배터리 구동 엣지 노드에서의 지속 가능한 AI 배포가 가능해집니다.

確認された数値

編集部の見解

d1 시리즈는 경량화와 멀티모달 입력을 동시에 달성한 최초의 오픈 의사결정 모델로 보입니다. 특히 단일 forward pass 구조가 지연과 에너지 소모를 크게 줄여 엣지 컴퓨팅 분야에 즉각적인 적용 가능성을 보여줍니다.

未確認の点

出典

カタログへ