구글 제미나이 3.8과 옴니 대규모 확장, 에이전트 인텔리전스

구글 딥마인드가 제미나이 3.8 플래시와 3.8 플래시 사이버를 전격 공개하며 코딩, 멀티스텝 추론, 사이버 보안 방어 역량을 대폭 강화했습니다. 동시에 양방향 음성 대화가 가능한 제미나이 3.8 라이브 시리즈와 영상 제어 기능을 확장한 옴니 1.1 플래시, 에이전틱 비디오 이해 기능을 잇달아 발표했습니다. 고정 프레임 분석 방식에서 벗어나 능동적 에이전트 루프와 확장 추론을 적용함으로써 토큰 소모를 대폭 줄이고 실시간성을 높였습니다. 이로써 텍스트, 음성, 영상 전반에 걸쳐 효율성과 성능을 동시에 잡는 멀티모달 에이전트 생태계가 구축되었습니다.

제미나이 3.8 플래시 제품군 출시: 코딩과 사이버 보안에 특화

구글 딥마인드가 제미나이 3.8 플래시(Gemini 3.8 Flash)와 사이버 보안 전용 모델인 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)를 공개했습니다. 3.7 플래시 출시 3주 만에 단행된 이번 업데이트는 에이전트 워크플로우와 장기 소프트웨어 엔지니어링 역량 강화에 초점을 맞췄습니다.

제미나이 3.8 플래시는 복잡한 태스크에서 추가적인 추론 단계를 수행하고 도구를 반복적으로 호출하는 설계 방식을 채택했습니다. 벤치마크 지표를 살펴보면 HLE-Verified에서 54.9%를 기록하며 다단계 추론 성능을 입증했습니다.

함께 공개된 제미나이 3.8 플래시 사이버는 공격적 악용보다 취약점 탐지와 자동 패치 등 방어 역량에 우선순위를 둔 모델입니다. 20개 프로그래밍 언어를 포괄하는 내부 벤치마크에서 취약점 탐지 성공률 70% 이상을 달성했으며, 외부 벤치마크인 CWE-Bench pass@1에서 47.2%를 기록해 프론티어 모델 수준의 패치 능력을 증명했습니다. 구글은 이 모델을 페어윈드 프로그램(Fairwind Program)을 통해 검증된 방어 조직과 인프라 운영자에게 선별 제공합니다.

모델명주요 특화 영역가격 (입력 / 출력, 1M 토큰 기준)주요 성과 지표
Gemini 3.8 Flash소프트웨어 엔지니어링, 에이전트 다단계 추론$0.75 / $3.75HLE-Verified 54.9% 달성
Gemini 3.8 Flash Cyber자율 취약점 탐지 및 자동 패치전용 프로그램(Fairwind) 제공CWE-Bench pass@1 47.2%, 20개 언어 탐지율 70%+

실제 프로덕션 환경에서도 성능이 검증되었습니다. 크롬 보안팀은 대형 상용 모델 대비 2.6배 더 많은 정확한 취약점 패치를 생성했다고 밝혔으며, 위즈(Wiz)는 침투 테스트 벤치마크에서 2.3~5.2배 낮은 비용으로 +7.5~9.7% 높은 재현율(Recall)을 기록했습니다. 구글 클라우드 보안 연구팀 역시 수개월이 걸리던 핵심 기초 취약점을 2시간 미만에 찾아내는 성과를 거두었습니다.

음성 대화의 지연 없는 진화: 제미나이 3.8 라이브와 확장 추론

구글은 실시간 양방향 음성 대화를 위해 제미나이 3.8 라이브(Gemini 3.8 Live)와 제미나이 3.8 라이브 익스텐디드 씽킹(Gemini 3.8 Live Extended Thinking)을 출시했습니다. 두 모델 모두 97개 언어를 실시간으로 자동 감지하여 전환할 수 있으며, 사용자의 말을 끊지 않고 백그라운드에서 API 호출과 도구를 실행합니다.

제미나이 3.8 라이브 익스텐디드 씽킹은 말하는 도중 동시에 심층 추론을 수행하는 '동시 추론·발화' 아키텍처를 적용했습니다. 백그라운드 작업 중에는 '확인해 보겠습니다'와 같은 언어적 단서를 자연스럽게 제공하고 실시간 진행 상황을 음성으로 설명합니다.

Speech to Speech Quality Index82.6
Big Bench Audio97.7
tau-Voice Task Completion68.6
tau-Voice-banking35.1

벤치마크 측면에서 Artificial Analysis의 음성 품질 지표인 Speech to Speech Quality Index에서 82.6점으로 전체 1위를 차지했습니다. 또한 Big Bench Audio에서 97.7%, 에이전트 과업 완수 벤치마크인 τ-Voice에서 68.6%, 금융 영역인 τ-Voice-banking에서 35.1%를 기록했습니다.

개발자는 웹소켓 엔드포인트(`wss://generativelanguage.googleapis.com/ws/.../BidiGenerateContent`)를 통해 별도의 복잡한 미디어 라이브러리 없이 네이티브 Web Audio API로 실시간 양방향 오디오를 구현할 수 있습니다. 생성된 모든 오디오에는 변조 방지를 위한 신스ID(SynthID) 비가시적 워터마크가 적용됩니다.

제너레이티브 비디오 제어력의 확장: 제미나이 옴니 1.1 플래시

비디오 생성 영역에서는 개발자 제어 기능을 대폭 강화한 제미나이 옴니 1.1 플래시(Gemini Omni 1.1 Flash)가 공개되었습니다. 과거 모델이 직전 1초 분량의 컨텍스트만 참조했던 것과 달리, 옴니 1.1은 최대 10초의 이전 맥락을 분석하여 장면을 연장할 수 있습니다.

"Figma Weave에서 제미나이 옴니 플래시는 가장 강력한 비디오 모델 중 하나입니다. 연장 기능과 풍부한 참조 자료, 4K 해상도를 통해 단순 비디오 생성을 넘어 진정한 연출이 가능해졌습니다." — 이타이 시프(Itay Schiff), Figma Weave 크리에이티브 디렉터

이 기능은 어도비 파이어플라이(Adobe Firefly), 런웨이(Runway), GMI 클라우드 등 주요 창작 툴에 연동되어 프로덕션 환경에 즉시 투입되었습니다.

에이전틱 비디오 이해: 토큰 소모 88% 감축과 동적 스캔

기존 비디오 분석 AI는 고정된 초당 프레임 수(기본 1 FPS)로 전체 영상을 일괄 처리하는 '정적 분석' 방식을 사용했습니다. 이는 장시간 영상 분석 시 막대한 토큰 비용을 유발하고 미세한 순간을 놓치는 한계가 있었습니다.

새롭게 도입된 에이전틱 비디오 이해(Agentic Video Understanding)는 모델이 에이전트 루프 안에서 내부 도구를 활용해 필요한 영상 구간을 동적으로 탐색합니다.

  1. 사용자 질의 입력
  2. 목표 구간 동적 식별
  3. FPS 재샘플링 및 멀티모달 도구 호출
  4. 정밀 분석 및 결과 반환

이 기술은 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트에 적용되었습니다. 표준 비디오 분석 벤치마크에서 기존 정적 처리 대비 다음과 같은 성능 개선을 달성했습니다.

초 단위 미만의 정밀 순간 검색(Sub-second moment retrieval), 다시간 분량의 영상 내 '바늘 찾기(Needle-in-a-haystack)' 질의, 이상 징후 탐지를 위한 국소 프레임 재샘플링 등에서 개발자가 직접 프레임 파싱 파이프라인을 구축하지 않고도 API 설정에서 `agentic` 옵션을 활성화하는 것만으로 동일한 최적화를 구현할 수 있습니다.

確認された数値

編集部の見解

구글은 멀티모달 모델의 파라미터 경쟁에서 벗어나 능동적으로 도구를 호출하는 에이전트 루프와 지연 없는 인터랙션 환경을 선점하는 전략으로 전환했습니다. 특히 비디오와 음성 전반에 에이전틱 접근법을 도입해 비용을 낮추고 제어력을 높인 점은 대규모 상용 서비스 확산의 실질적 분기점이 될 것입니다.

未確認の点

記事で言及されたモデル

プロバイダー入力出力コンテキスト長
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

出典

カタログへ