구글 제미나이 3.8 및 멀티모달 에이전트 생태계 총공세

구글 딥마인드가 제미나이 3.8 플래시와 보안 특화 모델 3.8 플래시 사이버를 포함한 차세대 AI 라인업을 공개했습니다. 실시간 음성 대화 모델인 제미나이 3.8 라이브와 확장 추론 모델, 제어력을 대폭 강화한 비디오 생성 모델 옴니 1.1 플래시도 함께 출시되었습니다. 영상 분석 토큰 소비를 최대 88% 절감하는 에이전틱 비디오 기능까지 더해져 멀티모달 전반의 비용 효율성과 실무 통제력이 비약적으로 향상되었습니다.

제미나이 3.8 플래시: 추론과 코딩 역량의 전면적 확장

구글 딥마인드가 3.7 플래시 출시 3주 만에 차세대 주력 모델인 Gemini 3.8 Flash와 사이버 보안 특화 모델 Gemini 3.8 Flash Cyber를 공식 발표했습니다. 제미나이 3.8 플래시는 3.7 플래시와 동일한 가격 정책인 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75로 제공됩니다.

이 모델은 장기 소프트웨어 엔지니어링 벤치마크인 DeepSWE v1.1에서 대형 프론티어 모델들을 능가하는 자율 엔지니어링 역량을 보였으며, STEM·인문학·전문 분야를 아우르는 HLE-Verified 벤치마크에서 54.9%의 점수를 획득했습니다. 금융 분석(Vals Finance Agent V2)과 법률 분석(Harvey's Legal Agent Benchmark) 같은 정량적 전문 지식 영역에서도 이전 모델을 크게 앞섰습니다.

복잡한 작업을 수행할 때 추가 추론 단계를 실행하고 외부 도구를 반복 호출하는 방식으로 높은 성능을 발휘합니다. 컴퓨팅 자원이 제한된 환경에서는 개발자가 추론 노력 수준(effort levels)을 낮추거나 3.7 플래시를 유지하는 선택이 가능합니다. 이 외에도 Google Antigravity 환경에서 3D 캐슬 탈출 게임, 지도와 로케이션 기능을 갖춘 DOS 버전 구글 맵스, 미국 지질조사국(USGS) 데이터 기반 실시간 3D 지형도를 단일 프롬프트로 생성하는 개발 시연이 공개되었습니다.

모델 구분입력 토큰 ($/1M)출력 토큰 ($/1M)주요 특화 영역
Gemini 3.8 Flash$0.75$3.75장기 코딩, 자율 에이전트, 전문 다단계 추론
Gemini 3.8 Flash CyberFairwind 프로그램 제공Fairwind 프로그램 제공취약점 자율 탐지, 자동 패치 배포, 방어 보안

사이버 보안 특화 방어망: 3.8 플래시 사이버와 Fairwind 프로그램

함께 공개된 Gemini 3.8 Flash Cyber는 공격용 익스플로잇보다 방어적 패치 구축에 집중 투자된 보안 특화 모델입니다. 신뢰할 수 있는 정부 당국과 핵심 인프라 운영자, 소프트웨어 관리자에게는 Fairwind Program을 통해 우선 제공됩니다.

  1. 취약점 정밀 탐색
  2. 코드베이스 영향도 분석
  3. 자동 패치 코드 생성
  4. 안전성 검증 및 배포

음성 인터랙션의 진화: 제미나이 3.8 라이브와 확장 추론

구글은 실시간 음성 상호작용을 위한 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 공개했습니다. 이 모델들은 발화를 끊지 않고도 실시간 시각 정보 파악과 백그라운드 도구 실행을 동시에 처리합니다.

Gemini 3.8 Live Extended Thinking82.6
τ-Voice Task Completion68.6
Big Bench Audio Reasoning97.7

3.8 라이브 확장 추론 모델은 인공지능 분석 플랫폼 Artificial Analysis의 Speech to Speech Quality Index에서 82.6점으로 종합 1위를 차지했습니다. τ-Voice 68.6%, Sierra의 τ-Voice-banking 벤치마크 35.1%, Big Bench Audio 97.7%를 기록했습니다.

대화 도중 97개 지원 언어를 자동으로 감지해 전환하며, 비동기 API 호출 및 다단계 예약 업무를 중단 없이 처리합니다. 지연 시간을 줄이기 위해 "확인해 보겠습니다"와 같은 언어적 단서를 즉각 제공하면서 배경 작업을 동시에 수행합니다. 생성된 모든 오디오에는 AI 생성물 식별을 위한 SynthID 워터마크가 기본 적용됩니다.

외부 개발자 분석에 따르면, 제미나이 라이브 모델은 WebSocket 엔드포인트(`wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent`)를 통해 연결되며, 브라우저 표준 Web Audio API의 AudioContext를 사용해 별도 라이브러리 없이 양방향 음성 스트리밍과 사용자 인터럽트를 제어할 수 있습니다.

정밀 제어 영상 제작: 옴니 1.1 플래시

비디오 생성 영역에서는 개발자의 정교한 연출을 지원하는 Gemini Omni 1.1 Flash가 도입되었습니다. 단순 프롬프트 생성을 넘어 기존 영상의 시각적 맥락을 유지하면서 타임라인을 제어하는 기능들이 대거 탑재되었습니다.

"Gemini Omni Flash를 통해 확장, 풍부한 참조 자료, 4K 해상도를 활용함으로써 크리에이티브 팀은 단순 영상 생성을 넘어 진정한 영상 연출(directing) 단계로 나아갈 수 있습니다." — 이타이 시프(Itay Schiff), 피그마 위브(Figma Weave) 크리에이티브 디렉터

에이전틱 비디오 이해: 토큰 88% 절감과 파레토 프론티어

영상 분석 영역에는 Agentic Video Understanding 기술이 적용되었습니다. 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시 라이트 모델에 도입된 이 기능은 고정 프레임(초당 1프레임)으로 전체를 처리하던 정적 방식에서 벗어나, 에이전트 루프를 통해 필요한 구간만 동적으로 탐색합니다.

표준 비디오 분석 벤치마크에서 이 기능을 활성화했을 때 토큰 소비량은 최대 88% 감소했고, 분석 비용은 최대 66% 절감되었으며, 정확도는 최대 7% 향상되었습니다. 초당 프레임 수를 동적으로 조절하여 서브세컨드(1초 미만) 단위 순간 포착, 이상 징후 탐지, 미세 동작 카운팅을 수행합니다. 구글은 이 기능을 구글 AI 스튜디오 API에 추가 요금 없이 배포했으며, 수개월 내 유튜브의 'Ask YouTube' 질의응답 기능에도 적용할 예정입니다.

Belegte Zahlen

Unsere Einschätzung

구글은 단일 모델의 크기 경쟁에서 벗어나 에이전틱 루프와 결합된 플래시급 모델군을 촘촘히 배치하는 구조적 효율화에 집중하고 있습니다. 특히 비디오 이해와 실시간 음성, 사이버 보안까지 세분화된 모델을 동일 API 생태계로 묶음으로써 엔터프라이즈 도입 장벽을 크게 낮췄습니다. 향후 멀티모달 AI 시장은 최고 성능 벤치마크 자체보다 추론 비용 통제력과 실무 파이프라인 제어권 중심으로 재편될 것입니다.

Offene Fragen

Erwähnte Modelle

AnbieterEingabeAusgabeKontextfenster
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

Quelle

Zurück zum Katalog