구글 제미나이 3.8·옴니 확장: 에이전틱 멀티모달의 전면화

구글 딥마인드가 제미나이 3.8 플래시, 3.8 라이브, 제미나이 옴니 1.1 플래시, 에이전틱 비디오 이해 기능을 연이어 공개했습니다. 새로운 모델들은 소프트웨어 엔지니어링 및 사이버 보안 방어 능력 강화와 함께 실시간 병렬 음성 대화, 고정밀 비디오 제어 기능을 제공합니다. 특히 능동적 비디오 탐색 기법을 통해 토큰 소비량을 최대 88% 줄이고 영상 분석 정확도를 7% 개선했습니다.

제미나이 제품군의 신규 라인업 확장과 가격 구조

구글 딥마인드가 6주 만에 세 번째 플래시 모델 릴리스를 단행하며 제미나이 3.8(Gemini 3.8) 제품군과 멀티모달 제작·이해 도구를 발표했습니다. 이번 업데이트는 경량 추론 모델부터 사이버 보안 특화 방어 모델, 실시간 음성 대화 에이전트, 비디오 생성 및 능동 분석까지 인공지능 워크플로 전반을 포괄합니다.

제미나이 3.8 플래시는 3.7 플래시의 가격 정책을 유지하면서 소프트웨어 엔지니어링 및 에이전트 다단계 추론 성능을 향상시켰습니다.

모델입력 토큰 비용 (백만 토큰당)출력 토큰 비용 (백만 토큰당)
Gemini 3.8 Flash$0.75$3.75
Gemini 3.7 Flash$0.75$3.75

소프트웨어 엔지니어링과 전문 영역 추론의 진화

제미나이 3.8 플래시는 긴 작업 주기를 요구하는 엔지니어링 벤치마크인 DeepSWE v1.1에서 대형 프론티어 모델들을 능가하는 성능을 기록했습니다. 모델의 복잡한 다단계 추론 성능을 평가하는 HLE-Verified 벤치마크에서는 54.9%를 기록했습니다. 금융 분석을 평가하는 Vals Finance Agent V2와 법률 벤치마크인 Harvey's Legal Agent Benchmark에서도 기존 모델 대비 우수한 성과를 입증했습니다.

구글은 이러한 성과의 배경으로 복잡한 작업에서 도구를 반복 호출하고 추가 추론 단계를 수행하도록 설계된 노력 수준(Effort Level) 제어 방식을 제시했습니다. 개발자는 연산 자원 제약에 따라 노력 수준을 낮추거나 3.7 플래시를 선택하여 토큰 오버헤드를 제어할 수 있습니다.

사이버 방어 전용 모델: 제미나이 3.8 플래시 사이버

구글은 취약점 탐지와 자동 패치에 특화된 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)를 공개하고 이를 공인된 방어자에게 제공하는 페어윈드 프로그램(Fairwind Program)을 시작했습니다. 이 모델은 공격용 익스플로잇 생성보다 방어 역량인 패치 생성에 집중하여 학습되었습니다.

이 모델은 화학·생물·방사능·핵(CBRN) 위험 및 사이버 공격 악용 방지를 위한 프론티어 세이프티 프레임워크를 준수하며, Gray Swan 측정 기준 프롬프트 주입 공격 방어력을 개선했습니다.

실시간 병렬 사고 기반 대화: 제미나이 3.8 라이브

음성 대화 영역에서는 제미나이 3.8 라이브(Gemini 3.8 Live)와 제미나이 3.8 라이브 익스텐디드 싱킹(Gemini 3.8 Live Extended Thinking)이 추가되었습니다. 이 모델들은 사용자와 대화하는 도중 백그라운드에서 병렬로 도구를 실행하고 추론할 수 있는 능력을 갖췄습니다.

Speech to Speech Quality Index82.6
τ-Voice68.6
τ-Voice-banking35.1
Big Bench Audio97.7

제미나이 3.8 라이브는 대화 중간에 97개 지원 언어를 자동으로 감지해 전환하며, 지연 시간을 최소화하기 위해 '확인해 보겠습니다'와 같은 초기 언어 단서를 발화하면서 백그라운드 다단계 작업을 설명합니다. 생성된 모든 오디오 출력에는 비가시적 워터마크 기술인 신스ID(SynthID)가 적용됩니다.

영상 제어와 능동적 비디오 탐색 체계

영상 제작 및 분석 분야에서는 정밀 제어 기능과 연산 효율화 기술이 적용되었습니다. 제미나이 옴니 1.1 플래시(Gemini Omni 1.1 Flash)는 개발자가 시작 및 종료 프레임을 지정하여 연속적인 카메라 모션과 전환 효과를 생성할 수 있도록 지원합니다. 이전 최대 1초만 참조하던 장면 연장 기능은 이전 10초의 컨텍스트를 참조하도록 개선되어 최대 40초까지 일관성을 유지하며 확장할 수 있습니다. 또한 360p 해상도 초안 렌더링을 도입하여 720p 대비 생성 속도를 최대 60% 가속하고 비용을 3분의 1 수준으로 줄였습니다.

  1. 목표 설정
  2. 자체 도구 호출
  3. 구간별 가변 FPS 스캔
  4. 필요 모달리티 능동 추출
  5. 최종 결과 도출

기존의 초당 1프레임(1 FPS) 고정 수집 방식에서 탈피한 에이전틱 비디오 이해(Agentic Video Understanding) 기능은 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트에 적용되었습니다. 모델이 내부 에이전트 루프를 통해 필요한 영상 구간만 능동적으로 로드하여 분석합니다.

"제미나이 모델에 에이전틱 비디오 이해를 활성화하면 분석 비용을 최대 66% 줄이고, 토큰 소비량을 최대 88% 절감하는 동시에 정확도를 최대 7% 향상시킬 수 있습니다."

이 기능은 API 설정에서 처리 방식을 'agentic'으로 지정해 사용할 수 있으며, 향후 유튜브의 'Ask YouTube' 질의응답 기능과 제미나이 앱에 순차적으로 통합될 예정입니다.

Chiffres vérifiés

Notre avis

구글은 모델 자체의 매개변수를 무작정 키우기보다 도구 호출 루프와 에이전틱 최적화를 통해 실질적인 연산 비용과 지연 시간을 낮추는 방향으로 전환하고 있습니다. 특히 음성과 비디오 분석 전반에 걸쳐 백그라운드 실행 및 능동적 샘플링을 결합함으로써 실제 프로덕션 환경에서의 경제성을 확보하려는 움직임이 뚜렷합니다.

Questions ouvertes

Modèles mentionnés

FournisseurEntréeSortieFenêtre de contexte
Google: Gemini 3.7 Flash · Google$0.75$3.751,048,576
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

Source

Retour au catalogue