플래시 라인업의 진화: 자율 코딩과 특화 보안 모델의 분화
구글 딥마인드가 제미나이 3.7 플래시 공개 이후 불과 3주 만에 차세대 모델인 제미나이 3.8 플래시(Gemini 3.8 Flash)와 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)를 공식 발표했습니다. 이번 릴리스는 6주 사이 세 번째로 이뤄진 플래시 계열 모델 배포로, 추론 능력과 코딩 능력을 대폭 강화하면서도 기존 가격 정책을 그대로 유지했습니다.
| 모델명 | 입력 가격 (1M 토큰당) | 출력 가격 (1M 토큰당) | 핵심 특화 영역 |
|---|---|---|---|
| Gemini 3.8 Flash | $0.75 | $3.75 | 장기 소프트웨어 엔지니어링, 자율 도구 호출, 다단계 전문 추론 |
| Gemini 3.8 Flash Cyber | Fairwind 프로그램 제한 제공 | Fairwind 프로그램 제한 제공 | 자율 취약점 탐지, 자동 패치(CWE-Bench), 방어 보안 |
3.8 플래시는 복잡한 태스크에서 더 많은 연산 단계와 반복적 도구 호출을 수행하는 방식으로 동작합니다. 학술 및 전문 도메인 벤치마크인 HLE-Verified에서 54.9%를 기록했으며, 장기 엔지니어링 벤치마크(DeepSWE v1.1), 금융 벤치마크(Vals Finance Agent V2), 법률 벤치마크(Harvey's Legal Agent Benchmark)에서 대형 프론티어 모델에 근접하거나 이를 능가하는 결과를 보였습니다.
함께 공개된 3.8 플래시 사이버는 공격(Exploitation)보다는 방어(Defensive fixing)에 초점을 맞춘 모델입니다. 구글 내부 20개 프로그래밍 언어 취약점 벤치마크에서 70% 이상의 성공률을 기록했습니다. 또한 소프트웨어 패치 벤치마크인 CWE-Bench에서는 47.2%의 pass@1을 달성하며 선도적 프론티어 모델(47.8%) 수준의 성능을 입증했습니다.
"크롬 보안팀은 3.8 플래시 사이버를 통해 훨씬 거대한 상용 모델 대비 2.6배 많은 정확한 취약점 패치를 생성해 냈습니다. 구글 클라우드 취약점 연구팀은 일반적으로 수개월이 걸리던 핵심 취약점을 2시간 이내에 발견했습니다."
이 사이버 모델은 CBRN 및 사이버 공격 악용 방지 안전장치가 조정되어 있어, 신뢰할 수 있는 공공기관 및 핵심 인프라 운영사를 위한 '페어윈드 프로그램(Fairwind Program)'을 통해 선별 배포됩니다.
음성 인터랙션의 패러다임 전환: 생각하며 말하는 동시 추론
음성 대화 인터페이스는 대기 시간 단축을 넘어 백그라운드 작업 병렬화 단계로 전환되었습니다. 구글은 제미나이 3.8 라이브(Gemini 3.8 Live)와 제미나이 3.8 라이브 익스텐디드 씽킹(Gemini 3.8 Live Extended Thinking)을 출시했습니다.
- 실시간 음성 및 영상 입력 수신
- 97개 언어 자동 감지 및 시각 문맥 파악
- 백그라운드 비동기 도구/API 호출 실행
- 진행 상황 라이브 발화로 전달하며 대화 지속
이 모델들의 핵심 아키텍처적 차이는 사용자와의 음성 대화를 끊지 않은 채 비동기 함수 호출과 다단계 추론을 백그라운드에서 동시에 수행한다는 점입니다.
- 자연스러운 진행 알림: 복잡한 작업 처리 시 "확인해 보겠습니다" 같은 언어적 단서를 즉각 제공한 뒤 백그라운드 진행 상황을 실시간으로 설명합니다.
- 다국어 및 시각 접지: 대화 도중 97개 언어를 자동으로 감지해 즉시 전환하며, 카메라를 통한 실시간 시각적 문맥을 결합해 답변합니다.
- 벤치마크 성과: 3.8 라이브 익스텐디드 씽킹은 Artificial Analysis의 Speech to Speech Quality Index에서 82.6점으로 전체 1위를 차지했으며, 에이전틱 작업 완수 지표인 τ-Voice에서 68.6%, Sierra τ-Voice-banking에서 35.1%, Big Bench Audio에서 97.7%를 기록했습니다.
- 생성물 투명성 보장: 출력되는 모든 합성 오디오에는 위변조 탐지를 위한 신스ID(SynthID) 비가시성 워터마크가 자동 삽입됩니다.
생성 비디오의 정밀 제어: 옴니 1.1 플래시의 스튜디오급 기능
영상 생성 영역에서는 단순한 텍스트-비디오 생성을 넘어 실무 편집 파이프라인에서 요구하는 제어 기능이 대거 추가된 제미나이 옴니 1.1 플래시(Gemini Omni 1.1 Flash)가 공개되었습니다.
- 장면 확장(Scene Extension): 이전 1초만 참조하던 방식에서 벗어나 최대 10초 분량의 이전 맥락을 분석하여 시각적 연속성을 유지합니다. 10초 단위로 연장하여 최대 누적 40초 분량의 영상을 생성할 수 있습니다.
- 시작 및 종료 키프레임 보간: 첫 프레임과 마지막 프레임을 지정하면 모델이 그 사이의 연속적인 카메라 이동(오빗, 돌리 줌, 휩팬 등)을 자동으로 생성합니다.
- 360p 고속 프로토타이핑: 720p 표준 해상도 대비 렌더링 속도가 최대 60% 빠르고 비용은 3분의 1 수준인 360p 드래프트 모드를 지원합니다.
- 4K 업스케일링 및 비디오 레퍼런스: 최종 결과물을 최대 4K 고해상도로 렌더링할 수 있으며, 프롬프트 입력 시 최대 3초 분량의 참조 영상을 반영해 캐릭터의 일관성을 유지할 수 있습니다.
이 모델은 현재 아도비 파이어플라이(Adobe Firefly), 피그마 위브(Figma Weave), 런웨이(Runway), GMI 클라우드 등 주요 창작 소프트웨어 플랫폼에 통합되고 있습니다.
연산 효율화의 정점: 에이전틱 비디오 이해 기술
기존 영상 분석 모델은 초당 고정된 프레임(기본 1 FPS)을 일괄 입력받는 정적(Static) 방식을 사용했기 때문에, 장시간 영상 분석 시 막대한 토큰 비용이 발생하고 미세한 순간을 놓치는 한계가 있었습니다. 구글은 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트에 적용 가능한 에이전틱 비디오 이해(Agentic Video Understanding) 기능을 공개했습니다.
| 토큰 소모량 감소율(%) | 88 |
| 비용 절감율(%) | 66 |
| 분석 정확도 향상율(%) | 7 |
이 기술은 모델 내부의 에이전틱 루프가 영상 전체를 한 번에 읽지 않고, 텍스트 자막·오디오·프레임을 동적으로 탐색하여 필요한 구간만 목표 지향적으로 로드합니다.
- 서브세컨드(초 미만) 탐색: 1 FPS 고정 샘플링에서 누락되던 1초 미만의 상태 변화나 컷 편집 지점을 정확히 식별합니다.
- 동적 FPS 리샘플링: 빠른 동작이나 이상 징후가 의심되는 구간만 순간적으로 높은 FPS로 다시 확인하여 카운팅 및 이상 탐지의 정확도를 높입니다.
- 장시간 영상 질의응답: 수 시간 분량의 강의나 녹화 영상에서 불필요한 토큰 소비 없이 특정 사실을 검색해 냅니다.
이 기능은 API 설정에서 'agentic' 모드를 활성화하는 것만으로 추가 요금 없이 표준 토큰 가격 체계에서 즉시 사용할 수 있으며, 향후 유튜브의 'Ask YouTube' 질의응답 기능에도 적용될 예정입니다.