Liquid Decision Models 소개
오늘 우리는 d1 의사결정 모델 가족의 두 가지 오픈 모델을 공개합니다: d1-3B와 d1-omni-600M (실험적). d1-3B는 3B 파라미터 규모로 텍스트와 이미지를 동시에 입력으로 받아들입니다. d1-omni-600M은 600M 파라미터로 텍스트+이미지 또는 텍스트+오디오 조합을 처리합니다. Decision Index 0.2.1에서 d1-3B는 48.57점을 기록하며, 모든 4B·9B 모델과 Decider 35B-A3B(47.11)를 앞섭니다.
아키텍처 및 훈련 방식
d1-3B는 Liquid Foundation Models(LFM)의 최신 버전인 LFM2.5-VL-3B(디코더 전용 VLM)에서 파생되었습니다. d1-omni-600M은 LFM2.5-Encoder-350M(양방향 인코더)에 비전과 오디오 인코더를 추가하여 세 가지 모달리티를 지원합니다. 두 모델은 토큰을 생성하는 생성 모델과 달리 단일 forward pass로 결정을 출력합니다.
| 모델 | 파라미터 | 지원 모달리티 |
|---|---|---|
| d1-3B | 3B | 텍스트 + 이미지 |
| d1-omni-600M | 600M | 텍스트+이미지 또는 텍스트+오디오 |
벤치마크 결과
우리는 sette 개 공개 데이터셋(독해, 독성 탐지, 의도 분류, 의료 QA, 교차 언어 이해)에서 평균 성능을 측정했습니다. d1-3B는 평균 82.9점을 얻어 표에서 가장 높은 점수를 기록했으며, Decider 4B를 초과했습니다. d1-omni-600M은 평균 78.4점을 얻어 Decider 2B(77.1)를 앞섰으며, 파라미터 수는 불과 1/4에 불과합니다.
d1-3B는 표에서 가장 높은 점수를 기록하며, Decider 4B를 앞섭니다.
| d1-3B | 82.9 |
| d1-omni-600M | 78.4 |
| Decider 4B | 80.0 |
| Decider 2B | 77.1 |
엣지 및 GPU에서의 지연 시간
NVIDIA와의 협력으로 GeForce RTX 4090, Jetson AGX Thor, Jetson AGX Orin 64GB, Jetson Orin Nano에서 d1-3B를 평가했습니다.
- Jetson AGX Thor: 단일 질문 16 ms, 세 질문 20 ms (1.3배).
- Jetson AGX Orin: 단일 질문 26 ms.
- Jetson Orin Nano: 단일 질문 50 ms.
- GPU(GeForce RTX 4090 등): 질문 응답 <10 ms, 384px 이미지 처리 <18 ms.
| 장치 | 단일 질문 (ms) | 세 질문 (ms) |
|---|---|---|
| Jetson AGX Thor | 16 | 20 |
| Jetson AGX Orin | 26 | – |
| Jetson Orin Nano | 50 | – |
| GPU (RTX 4090) | <10 | – |
활용 가이드 및 배포
필수 라이브러리는 transformers>=5.14입니다. 모델을 로드할 때는 trust_remote_code=True 옵션을 반드시 주어야 합니다. 예시 코드 (d1-3B): ```python from transformers import AutoModelForSequenceClassification model = AutoModelForSequenceClassification.from_pretrained("liquidai/d1-3B", trust_remote_code=True) ``` 두 모델은 오픈 웨이트로 Hugging Face에서 바로 다운로드 가능하며, 데모는 System One Arcade Hugging Face Space에서 체험할 수 있습니다.
- 데이터 수집
- 전처리
- 모델 추론
- 결정 출력
- 액션 실행
So What? – 개발자·기업·산업에 미치는 의미
개발자는 sub‑50ms latency를 보장하는 경량 의사결정 모델을 통해 실시간 멀티모달 애플리케이션을 쉽게 구현할 수 있습니다. 기업은 Jetson 계열 엣지 디바이스에 d1-3B를 탑재하여 영상·오디오 기반 자동화 시스템의 응답 시간을 획기적으로 줄일 수 있으며, 이는 운영 비용 절감과 사용자 경험 향상으로 직결됩니다. 산업 전반에서는 의사결정 모델이 생성 모델과 달리 단일 forward pass로 작동함에 따라 에너지 효율이 높아져, 배터리 구동 엣지 노드에서의 지속 가능한 AI 배포가 가능해집니다.