6주 만에 3개 모델 투입: 구글의 '플래시 퍼스트' 가속화
구글이 인공지능 배포 전략의 중심축을 경량화 및 고성능 추론 모델인 '플래시(Flash)' 라인업으로 전환하고 있습니다. 2026년 초 이후 대형 플래그십인 Pro 모델 공개가 지연되는 가운데, 구글은 불과 6주 만에 세 번째 플래시 계열 모델인 Gemini 3.8 Flash를 시장에 전격 투입했습니다.
기존의 거대 언어 모델이 높은 API 단가와 컴퓨팅 비용으로 기업 도입의 장벽을 마주한 상황에서, 구글은 가격 대비 성능을 극대화한 실무용 '워크호스(Workhorse)' 모델을 빠르게 연달아 내놓으며 개발자 점유율 방어에 나서고 있습니다.
API 가격 정책 또한 공격적입니다. 구글은 연말까지 프로모션 도입 가격을 적용하여 기존 3.7 Flash와 동일한 가격대를 유지합니다.
| 모델명 | 입력 토큰 ($/1M) | 출력 토큰 ($/1M) | 주요 특화 영역 |
|---|---|---|---|
| Gemini 3.8 Flash (할인가) | 0.75 | 3.75 | 범용 에이전트, 소프트웨어 엔지니어링, 복합 추론 |
| Gemini 3.8 Flash (정규가) | 1.50 | 7.50 | 범용 에이전트, 소프트웨어 엔지니어링, 복합 추론 |
| Gemini 3.8 Flash Cyber | 비공개(Fairwind 제공) | 비공개(Fairwind 제공) | 취약점 탐지, 자동 패치, 침투 테스트 분석 |
| Gemini 3.7 Flash | 0.75 | 3.75 | 컴퓨팅 효율성 중심 워크로드, 비디오 이해 |
업계에서는 타 AI 연구소들의 API 단가 인하에 대응하고, 기업용 AI 도입의 TCO 부담을 낮추기 위한 선제적 조치로 평가하고 있습니다.
---
Gemini 3.8 Flash와 Flash Cyber: 코딩과 보안 방어의 에이전트화
Gemini 3.8 Flash는 소프트웨어 엔지니어링 벤치마크인 DeepSWE v1.1에서 대형 프론티어 모델들을 제치고 상위권에 올랐으며, 다학제 추론 벤치마크인 HLE-Verified에서 54.9%의 점수를 기록했습니다. 금융 분석 에이전트 지표(Vals Finance Agent V2)와 법률 분석 지표(Harvey's Legal Agent Benchmark)에서도 성능 향상을 입증했습니다.
이러한 성능 향상은 모델이 복잡한 작업에서 추가 추론 단계를 수행하고 도구를 반복 호출하도록 설계된 데서 기인합니다. 반면, 컴퓨터 화면 제어 능력을 평가하는 OSWorld-2.0 벤치마크에서는 전작 대비 개선되었으나 여전히 시장 선도 모델(Claude Opus)에는 미치지 못하는 한계를 보였습니다.
구글은 범용 모델과 함께 사이버 보안 방어 전용 모델인 Gemini 3.8 Flash Cyber를 공개하고, 이를 승인된 기관에 제공하는 Fairwind Program을 가동했습니다. 이 모델은 공격용 도구(Exploitation) 대신 취약점 수정(Patching)에 개발 역량을 집중했습니다.
- 20개 프로그래밍 언어 지원: C/C++ 중심의 기존 평가(CyberGym)를 넘어 자체 20개 언어 벤치마크에서 70% 이상의 탐지 성공률을 달성했습니다.
- 패치 정확도 향상: CWE-Bench에서 패치 성공률(pass@1 47.2%)을 기록하며 기존 프론티어 모델(47.8%)에 근접하는 파레토 효율을 증명했습니다.
- 사내 및 고객사 실증 검증: 크롬 보안팀에서 대형 모델 대비 2.6배 더 높은 패치 정확도를 확인했으며, 클라우드 연구팀은 통상 수개월이 걸리는 중대 취약점을 2시간 미만에 식별했습니다. 클라우드 보안 기업 Wiz의 침투 테스트 벤치마크에서는 비용을 2.3~5.2배 절감하면서 재현율(Recall)을 7.5~9.7% 끌어올렸습니다.
---
비디오 제작의 제어력 강화: Gemini Omni 1.1 Flash
단순 텍스트 및 코딩 추론에 그치지 않고 생성 미디어 파이프라인 역시 플래시 아키텍처로 고도화되었습니다. 구글이 출시한 Gemini Omni 1.1 Flash는 제어 가능한(Controllable) 영상 제작 환경을 지원합니다.
- 이전 10초 맥락 분석
- 시작·종료 키프레임 보간
- 360p 초고속 프리뷰 검증
- 최종 4K 업스케일 렌더링
Omni 1.1 Flash가 제공하는 핵심 영상 제작 제어 기능은 다음과 같습니다.
- 장면 확장(Scene Extension): 이전 모델이 직전 1초만 참조하던 것과 달리, 최대 10초의 선행 맥락을 분석하여 10초 단위로 최대 40초까지 일관된 스토리를 이어 생성합니다.
- 키프레임 보간(First & Last Frame): 사용자가 첫 장면과 마지막 장면을 지정하면 프레임 간의 자연스러운 카메라 이동 궤적(Whip-pan, Dolly-zoom 등)을 생성합니다.
- 경량 프리뷰 모드: 720p 표준 대비 비용을 3분의 1로 줄이고 생성 속도를 최대 60% 단축시키는 360p 초안 모드를 지원합니다.
- 멀티모달 레퍼런스 및 4K 업스케일링: 최대 3초 분량의 비디오 레퍼런스를 참조하여 캐릭터와 스타일 연속성을 유지하며 최종 4K 해상도로 업스케일링할 수 있습니다.
Figma Weave, Adobe Firefly, Runway, GMI Cloud 등 주요 미디어 제작 툴들이 이미 해당 API를 프로덕션 워크플로에 연동했습니다.
"Omni Flash의 핵심은 정밀성입니다. 세부 묘사가 엄격한 기준을 통과하므로 교육 및 설명용 콘텐츠 제작에서 과거에는 불가능했던 AI 영상 도입이 가능해졌습니다." — 루이자 궈(Louisa Guo), GMI Cloud 마케팅 부사장
---
고정 프레임에서 에이전트 동적 탐색으로: 비디오 이해 패러다임의 전환
영상 분석 영역에서는 에이전트 기반 비디오 이해(Agentic Video Understanding) 기능이 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite에 적용되었습니다.
기존의 정적(Static) 처리 방식은 영상 전체를 초당 1프레임(1 FPS)과 같은 고정 비율로 균등하게 인입하여 대용량 토큰 비용이 발생하거나 중요 순간을 놓치는 한계가 있었습니다. 반면 에이전트 비디오 이해는 질문에 맞춰 영상·음성·자막을 동적으로 스캔하고 세부 구간만을 집중적으로 탐색합니다.
| 토큰 소모량 절감률 | 88 |
| 분석 비용 절감률 | 66 |
| 분석 정확도 향상률 | 7 |
이 기술을 통해 얻을 수 있는 대표적인 성능 개선은 다음과 같습니다.
- 초 단위 미만 순간 검색(Sub-second Retrieval): 1 FPS에서 누락되던 찰나의 장면 전환이나 편집 컷을 정밀하게 포착합니다.
- 이상 징후 탐지(Anomaly Detection): 의심 구간을 감지하면 해당 시간대만 동적으로 FPS를 높여 고속 동작이나 미세 결함을 판독합니다.
- 동작 및 객체 카운팅: 빠른 연속 동작을 프레임 레이트를 전환해가며 재검토하여 계측 정확도를 높입니다.
- 장시간 영상 탐색: 수십 분에서 수 시간 분량의 비디오에서 토큰 폭증 없이 복잡한 세부 질의를 수행합니다.
개발자는 Google AI Studio 및 Gemini Enterprise Agent Platform에서 API 호출 시 옵션을 `agentic`으로 설정하는 것만으로 추가 요금 없이 표준 토큰 요율로 이 기능을 활용할 수 있습니다. 이 기능은 Gemini 앱과 향후 유튜브의 'Ask YouTube' 기능에도 순차 적용될 예정입니다.
---
산업 및 개발 생태계에 미치는 시사점
구글의 최신 릴리스들은 대형 파라미터 경쟁에서 '도메인 특화 에이전트 루프'와 '컴퓨팅 비용 효율성'으로 AI 경쟁의 초점이 이동했음을 보여줍니다.
1. 인프라 비용 최적화: 88% 토큰 절감 비디오 분석 및 $0.75/$3.75 수준의 3.8 Flash 가격 책정은 멀티모달 서비스 운영사의 마진 구조를 개선할 수 있는 기술적 토대를 제공합니다. 2. 보안 생태계의 비대칭성 완화: 대규모 코드베이스 취약점 탐지 시간이 수개월에서 2시간으로 단축됨에 따라 데브옵스(DevOps) 파이프라인 내 실시간 자동 패치 도입이 가속화될 전망입니다. 3. 창작 툴체인의 재편: 생성(Omni 1.1)과 분석(Agentic Video)이 플래시 모델 수준에서 결합되면서 고화질 영상 편집과 다국어 비디오 검색 파이프라인의 구축 장벽이 대폭 낮아졌습니다.