개요
저자는 Hugging Face Hub에서 제공하는 Qwen-Image 2.1의 공식 프롬프트 리라이터가 9B 규모이며 약 20 GB 메모리를 필요하고 수천 토큰을 생각한 뒤 한 문단을 생성한다는 점을 확인했습니다. 이에 따라 동일 기능을 갖지만 훨씬 더 작은 모델을 원했고, Hub에서 찾을 수 있는 것은 오직 압축된 9B 복사본뿐이었습니다. 따라서 ML Intern에게 원하는 모델을 설명했고, 다음 날 0.8B 버전이 CPU에서 실행되는 모델을 얻을 수 있었습니다. 이 모델은 유효 출력을 99.7% 반환하며 교사 모델의 토큰 사용량의 약 1/4만을 사용했습니다.
ML Intern 워크플로우
ML Intern은 매 작업마다 다음과 같은 흐름을 따릅니다.
- 작업 계획
- 예산 요청
- 소규모 테스트
- 훈련·평가·배포
작업 시작 시 zero dollar budget으로 시작하며, 사용자는 먼저 원하는 결과를 설명하고 예산 상한을 명시해야 합니다. Intern은 소규모 테스트를 실행해 결과를 검증한 후, 사용자의 승인을 받아 전체 훈련을 진행하고最終的に Hugging Face 하드웨어에서 모델을 공개합니다. 이 과정에서 예산 초과를 방지하기 위해 프롬프트에 "Cap total spend at USD 12 and ask me before exceeding it"과 같은 지시문을 포함할 수 있습니다.
구축한 모델 사례 1: 시트러스 질병 진단 VLM
- 목표: 일반 비전 모델이 노란 시트러스 잎을 묘사할 수는 있지만, 진드기 문제인지 마그네슘 결핍인지 구분하고 그에 따른 생물·비생물적 치료법을 제시하는 것은 어렵습니다.
- 데이터셋: Project-AgML 조직이 Hub에 호스팅한 세 출처를 병합하여 3,017장의 주석이 달린 이미지를 구축했습니다. 이 이미지는 21가지 distinct 해충, 질병, 영양 결핍 및 치료 접근법을 포괄합니다.
- 모델: Qwen3.5-2B를 기반으로 파인튜닝했습니다.
- 검증: 훈련 전 베이스 모델의 제로샷 점수를 동일한 지표로 측정하여 향상을 확인했습니다.
- 결과: 335장의 테스트 사진에서 베이스 모델은 올바른 문제를 14.9%의 정확도로 예측했습니다. 한 A10G에서 두 에포크 훈련 후 파인튜닝 모델은 52.8%의 정확도를 달성했습니다.
- 컴퓨트 비용: 약 USD 1.90.
"Also report the base model's zero-shot score on the same metric before training so we can see the gain."
사례 2: 허기 캐릭터 LoRA
- 목표: Hugging Face 브랜드 자산의 평면 스타일로 그린 허기(Huggy)를 이미지 생성 모델에 추가하기.
- 데이터셋: Chunte/huggy_for_training에서 84장의 캡션이 있는 도면.
- 베이스 모델: FLUX.2 klein base 4B.
- 훈련 과정: 100 스텝마다 체크포인트를 저장하고 동일한 프롬프트 세트를 반복하여 시각적 변화를 관찰했습니다.
- 결과: 스텝 200에서 허기가 모델에 완전히 반영되기 시작했으며, 스텝 500 이후부터 허기 스타일이 무관한 프롬프트에도 스며들기 시작했습니다.
- 컴퓨트 비용: 약 USD 7.60.
사례 3: 카메라 각도 LoRA
- 목표: Qwen-Image 2.1에 특정 각도(예: 왼쪽 45도)에서 객체를 재현하는 기능 추가.
- 데이터 구축: ML Intern이 Google Scanned Objects에서 1,030개의 가구 객체를 24각도로 스캔하여 24,722개의 투명 이미지를 생성했습니다. 이후 461개의 객체를 훈련용으로, 40개를 홀드아웃으로 선정하고, 23개의 카메라 명령에 걸쳐 1,844개의 before‑after 쌍을 균등하게 분배했습니다.
- 훈련: 한 A100에서 약 90분 동안 2,000 스텝을 실행했으며, 컴퓨트 비용은 약 USD 3.75였습니다.
- 전체 프로젝트 시간: 반일 정도이며, 실패한 작업 재제출을 포함해 총 48개의 잡이 실행되었습니다.
- 총 컴퓨트 비용: 약 USD 16 (이전 단계들의 비용을 합산).
"Also report the base model's zero-shot score on the same metric before training so we can see the gain."
사례 4: 드로우‑인 LoRA
- 목표: 사진에 마젠타 스크러블을 추가하고 해당 위치에 원하는 객체를 삽입하면서 원래 조명과 구성을 유지.
- 데이터 구축 과정: Open Images에서 실제 사진을 선택하고 LaMa 인페인팅 모델로 한 객체를 제거한 뒤, 제거된 위치에 마젠타 스크러블을 그립니다. 원본 사진은 타깃으로 사용됩니다.
- 훈련 쌍: 6,042개의 훈련 쌍과 160개의 테스트 쌍을 생성했으며, 테스트 쌍의 40개는 훈련에 사용되지 않은 23개 객체 클래스에서 나왔습니다.
- 검증: 훈련 전 베이스 모델과 Viggle turbo LoRA를 각각 단독으로 평가하고, 배치 단위 편집이 동일한 이미지를 생성하는지 확인하여 평가 비용을 절감했습니다.
- 훈련: 한 A100에서 1시간 38분 동안 2,000 스텝을 실행했으며, 컴퓨트 비용은 약 USD 4.00이었습니다.
- 체크포인트 비교: 48개 테스트 쌍에서 저장된 체크포인트를 비교한 결과 스텝 500이 최적이라고 판단했습니다.
- 성능: Viggle turbo LoRA와 함께 6 스텝에서 사용할 때, 객체가 그려진 위치에서 67.5%의 탐지 정확도를 보였으며, 추론 시간은 객체당 약 4.7초였습니다.
비용 및 효율 분석
다음 표는 각 모델의 컴퓨트 비용을 비교합니다.
| 모델 | 컴퓨트 비용 (USD) |
|---|---|
| 시트러스 질병 VLM | 1.90 |
| 허기 캐릭터 LoRA | 7.60 |
| 카메라 각도 LoRA | 3.75 |
| 드로우‑인 LoRA | 4.00 |
| 전체 프로젝트 합계 | 16.00 |
다음 차트는 동일한 단위(USD)로 비용을 시각화합니다.
| Citrus | 1.90 |
| Huggy | 7.60 |
| Viewpoint | 3.75 |
| Doodle | 4.0 |
So What? — 개발자·기업·산업에 미치는 구체적 의미
개발자는 ML Intern에게 명확한 검증 사실과 예산 상한을 포함한 프롬프트를 작성하면 비용 초과 없이 원하는 경량 모델을 얻을 수 있습니다. 기업은 이러한 경량 모델을 CPU 또는 저사양 GPU에서 실행함으로써 하드웨어 투자와 운영 비용을 크게 줄일 수 있으며, 특히 임베디드 또는 엣지 환경에서의 AI 서비스 배포가 용이해집니다. 산업 전반에 걸쳐 모델 맞춤화의 장벽이 낮아지면, 도메인 특화 데이터셋을 활용한 빠른 프로토타입 제작이 가능해져 제품 출시 주기를 단축시킬 수 있습니다.