구글 제미나이 3.8 전면 공개: 에이전틱 추론과 멀티모달의 실무화

구글 딥마인드가 제미나이 3.8 플래시 및 플래시 사이버를 필두로 실시간 음성 대화 모델인 라이브 2종, 영상 생성 제어력을 높인 옴니 1.1 플래시, 에이전틱 비디오 이해 기능을 동시 발표했습니다. 3.8 플래시는 3.7 플래시와 동일한 가격(입력 $0.75, 출력 $3.75/1M 토큰)으로 소프트웨어 엔지니어링 및 자율 에이전트 성능을 대폭 끌어올렸으며, 사이버 보안 특화 모델은 방어자 프로그램으로 제공됩니다. 음성 모델은 대화 중단 없이 백그라운드 작업을 병행 처리하고, 영상 처리 파이프라인은 동적 스캔을 통해 토큰 소모량을 최대 88% 절감했습니다.

플래시 라인업의 진화: 자율 코딩과 특화 보안 모델의 분화

구글 딥마인드가 제미나이 3.7 플래시 공개 이후 불과 3주 만에 차세대 모델인 제미나이 3.8 플래시(Gemini 3.8 Flash)와 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)를 공식 발표했습니다. 이번 릴리스는 6주 사이 세 번째로 이뤄진 플래시 계열 모델 배포로, 추론 능력과 코딩 능력을 대폭 강화하면서도 기존 가격 정책을 그대로 유지했습니다.

모델명입력 가격 (1M 토큰당)출력 가격 (1M 토큰당)핵심 특화 영역
Gemini 3.8 Flash$0.75$3.75장기 소프트웨어 엔지니어링, 자율 도구 호출, 다단계 전문 추론
Gemini 3.8 Flash CyberFairwind 프로그램 제한 제공Fairwind 프로그램 제한 제공자율 취약점 탐지, 자동 패치(CWE-Bench), 방어 보안

3.8 플래시는 복잡한 태스크에서 더 많은 연산 단계와 반복적 도구 호출을 수행하는 방식으로 동작합니다. 학술 및 전문 도메인 벤치마크인 HLE-Verified에서 54.9%를 기록했으며, 장기 엔지니어링 벤치마크(DeepSWE v1.1), 금융 벤치마크(Vals Finance Agent V2), 법률 벤치마크(Harvey's Legal Agent Benchmark)에서 대형 프론티어 모델에 근접하거나 이를 능가하는 결과를 보였습니다.

함께 공개된 3.8 플래시 사이버는 공격(Exploitation)보다는 방어(Defensive fixing)에 초점을 맞춘 모델입니다. 구글 내부 20개 프로그래밍 언어 취약점 벤치마크에서 70% 이상의 성공률을 기록했습니다. 또한 소프트웨어 패치 벤치마크인 CWE-Bench에서는 47.2%의 pass@1을 달성하며 선도적 프론티어 모델(47.8%) 수준의 성능을 입증했습니다.

"크롬 보안팀은 3.8 플래시 사이버를 통해 훨씬 거대한 상용 모델 대비 2.6배 많은 정확한 취약점 패치를 생성해 냈습니다. 구글 클라우드 취약점 연구팀은 일반적으로 수개월이 걸리던 핵심 취약점을 2시간 이내에 발견했습니다."

이 사이버 모델은 CBRN 및 사이버 공격 악용 방지 안전장치가 조정되어 있어, 신뢰할 수 있는 공공기관 및 핵심 인프라 운영사를 위한 '페어윈드 프로그램(Fairwind Program)'을 통해 선별 배포됩니다.

음성 인터랙션의 패러다임 전환: 생각하며 말하는 동시 추론

음성 대화 인터페이스는 대기 시간 단축을 넘어 백그라운드 작업 병렬화 단계로 전환되었습니다. 구글은 제미나이 3.8 라이브(Gemini 3.8 Live)와 제미나이 3.8 라이브 익스텐디드 씽킹(Gemini 3.8 Live Extended Thinking)을 출시했습니다.

  1. 실시간 음성 및 영상 입력 수신
  2. 97개 언어 자동 감지 및 시각 문맥 파악
  3. 백그라운드 비동기 도구/API 호출 실행
  4. 진행 상황 라이브 발화로 전달하며 대화 지속

이 모델들의 핵심 아키텍처적 차이는 사용자와의 음성 대화를 끊지 않은 채 비동기 함수 호출과 다단계 추론을 백그라운드에서 동시에 수행한다는 점입니다.

생성 비디오의 정밀 제어: 옴니 1.1 플래시의 스튜디오급 기능

영상 생성 영역에서는 단순한 텍스트-비디오 생성을 넘어 실무 편집 파이프라인에서 요구하는 제어 기능이 대거 추가된 제미나이 옴니 1.1 플래시(Gemini Omni 1.1 Flash)가 공개되었습니다.

이 모델은 현재 아도비 파이어플라이(Adobe Firefly), 피그마 위브(Figma Weave), 런웨이(Runway), GMI 클라우드 등 주요 창작 소프트웨어 플랫폼에 통합되고 있습니다.

연산 효율화의 정점: 에이전틱 비디오 이해 기술

기존 영상 분석 모델은 초당 고정된 프레임(기본 1 FPS)을 일괄 입력받는 정적(Static) 방식을 사용했기 때문에, 장시간 영상 분석 시 막대한 토큰 비용이 발생하고 미세한 순간을 놓치는 한계가 있었습니다. 구글은 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트에 적용 가능한 에이전틱 비디오 이해(Agentic Video Understanding) 기능을 공개했습니다.

토큰 소모량 감소율(%)88
비용 절감율(%)66
분석 정확도 향상율(%)7

이 기술은 모델 내부의 에이전틱 루프가 영상 전체를 한 번에 읽지 않고, 텍스트 자막·오디오·프레임을 동적으로 탐색하여 필요한 구간만 목표 지향적으로 로드합니다.

이 기능은 API 설정에서 'agentic' 모드를 활성화하는 것만으로 추가 요금 없이 표준 토큰 가격 체계에서 즉시 사용할 수 있으며, 향후 유튜브의 'Ask YouTube' 질의응답 기능에도 적용될 예정입니다.

確認された数値

編集部の見解

구글은 모델 자체의 크기를 무작정 키우는 경쟁에서 벗어나, 에이전틱 루프와 백그라운드 병렬 추론을 통해 중소형 플래시 모델의 실무 효용성을 극대화하는 전략을 택했습니다. 특히 개발 비용 절감(토큰 소모 88% 감소, 360p 프리뷰)과 방어 보안·영상 제어 등 실제 프로덕션 도입 장벽을 낮추는 실용적 인프라 고도화에 집중하고 있습니다. 이는 엔터프라이즈 AI 시장에서 비용 대비 성능(Pareto Frontier) 중심의 주도권 확보를 가속화할 것으로 평가됩니다.

未確認の点

記事で言及されたモデル

プロバイダー入力出力コンテキスト長
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

出典

カタログへ