단일 세대에서 에이전틱 생태계로: 구글 멀티모달의 구조적 전환
구글 딥마인드가 제미나이 3.7 플래시 출시 3주 만에 신규 모델군을 대거 발표하며 에이전틱 인공지능(Agentic AI) 생태계 확장에 나섰습니다. 이번 릴리스의 핵심은 단순히 모델의 파라미터 크기나 벤치마크 점수를 높이는 데 그치지 않고, 시스템이 스스로 도구를 호출하고 맥락을 탐색하는 에이전틱 루프(Agentic Loop)를 인프라 전반에 내재화했다는 점입니다.
새롭게 공개된 모델군은 고성능 코딩 및 전문 추론을 담당하는 제미나이 3.8 플래시(Gemini 3.8 Flash)와 방어 전용 보안 모델인 3.8 플래시 사이버(Flash Cyber), 음성 상호작용과 배경 연산을 동시 처리하는 제미나이 3.8 라이브(Live) 제품군, 정밀 영상 편집을 지원하는 제미나이 옴니 1.1 플래시(Gemini Omni 1.1 Flash), 그리고 동적 비디오 탐색 기술인 에이전틱 비디오 이해(Agentic Video Understanding)로 구성됩니다.
- 사용자 목표 입력
- 에이전틱 내부 루프(동적 샘플링·도구 호출)
- 병렬 배경 추론 및 검증
- 최종 결과물 출력 및 실시간 상호작용
---
제미나이 3.8 플래시 & 사이버: 긴 호흡의 소프트웨어 엔지니어링과 방어 보안
제미나이 3.8 플래시는 3.7 플래시와 동일한 가격(입력 100만 토큰당 $0.75, 출력 100만 토큰당 $3.75)을 유지하면서도 복합 엔지니어링 성능을 비약적으로 개선했습니다.
심층 추론 및 도메인 벤치마크
- DeepSWE v1.1: 엔드투엔드로 복잡한 소프트웨어 엔지니어링 과제를 자율 해결하는 벤치마크에서 대형 프론티어 모델들을 능가했습니다.
- HLE-Verified: 과학·기술·공학·수학(STEM), 인문학 및 전문 지식을 아우르는 다단계 추론 검증에서 54.9%를 기록했습니다.
- 전문 분야: 금융 분석을 평가하는 Vals Finance Agent V2와 법률 벤치마크인 Harvey's Legal Agent Benchmark에서 3.7 플래시 대비 높은 성과를 달성했습니다.
이러한 성능 향상은 모델이 복잡한 작업에 더 많은 추론 단계와 도구 호출을 수행하도록 설계된 결과입니다. 연산 효율성이 핵심 제약 조건인 워크로드를 위해 개발자는 노력 수준(Effort Level)을 낮추거나 기존 3.7 플래시를 병행하여 선택할 수 있습니다.
사이버 보안 특화: 3.8 플래시 사이버
방어자 전용 프로그램인 페어윈드 프로그램(Fairwind Program)을 통해 제공되는 3.8 플래시 사이버는 취약점 악용(Exploit)보다 취약점 수정(Patching)에 초점을 맞춰 훈련되었습니다.
- 다국어 취약점 탐지: 20개 프로그래밍 언어를 망라하는 구글 내부 벤치마크에서 70% 이상의 탐지 성공률을 기록했습니다.
- CWE-Bench 패치 성능: 1회 시도 성공률(pass@1) 기준 47.2%를 기록하며 최고 수준 프론티어 모델(47.8%)에 근접한 파레토 프론티어를 형성했습니다.
- 구글 내부 실증: 크롬 보안팀(Chrome Security) 테스트 결과 기존 대형 상용 모델 대비 2.6배 많은 정상 패치를 생성했으며, 클라우드 취약점 연구팀은 연구에 수개월이 소요되던 중대 기반 취약점을 2시간 미만에 찾아냈습니다.
---
제미나이 3.8 라이브: 음성 대화와 배경 추론의 완전 병렬화
기존 음성 AI는 사용자의 발화를 듣고 답변을 생성하는 동안 다른 연산을 수행하지 못하는 순차적 한계가 있었습니다. 제미나이 3.8 라이브 및 3.8 라이브 익스텐디드 싱킹(Extended Thinking)은 다중 모달 병렬 추론을 구현하여 대화가 끊기지 않는 환경을 제공합니다.
음성 및 에이전트 벤치마크
| 벤치마크 / 지표 | 달성 수치 | 비고 |
|---|---|---|
| Speech to Speech Quality Index | 82.6 | Artificial Analysis 종합 1위 |
| τ-Voice | 68.6% | 에이전틱 작업 완료 1위 |
| Sierra τ-Voice-banking | 35.1% | 뱅킹 도메인 에이전트 1위 |
| Big Bench Audio | 97.7% | 음성 기반 복합 추론 |
| 지원 언어 수 | 97개 | 실시간 다국어 감지 및 전환 |
제미나이 3.8 라이브 익스텐디드 싱킹은 복잡한 다단계 작업을 처리할 때 "확인해 보겠습니다"와 같은 자연스러운 구두 신호를 먼저 전달한 뒤, 백그라운드 API 호출 및 도구 실행 과정을 실시간으로 음성 중계합니다. 또한 생성된 모든 오디오 출력물에는 위변조 방지를 위해 비가청 워터마크 기술인 신스ID(SynthID)가 직조 방식으로 삽입됩니다.
---
옴니 1.1 플래시 & 에이전틱 비디오: 시각 미디어 생성 및 분석의 정밀 제어
영상 생성과 비디오 분석 영역에서도 단순 일괄 처리 방식에서 벗어나 개발자가 직접 세부 요소를 제어하고 탐색할 수 있는 아키텍처가 도입되었습니다.
제미나이 옴니 1.1 플래시 (생성 제어 고도화)
- 씬 확장(Scene Extension): 이전 1초만 참조하던 방식에서 벗어나 최대 10초의 사전 컨텍스트를 분석하며, 10초 단위로 최대 40초까지 일관성을 유지하며 장면을 연장합니다.
- 키프레임 보간: 시작 프레임과 종료 프레임을 지정하여 두 장면 사이를 매끄러운 카메라 무빙(패닝, 줌, 궤도 회전)으로 생성합니다.
- 360p 고속 프로토타이핑: 720p 대비 최대 60% 빠른 속도와 3분의 1 비용으로 저해상도 초안을 렌더링한 후, 최종 결과물을 4K로 업스케일링할 수 있습니다.
- 비디오 레퍼런스: 최대 3초 분량의 참조 영상을 입력하여 캐릭터 외형과 모션을 유지할 수 있습니다.
"제미나이 옴니 플래시는 피그마 위브(Figma Weave)에서 사용할 수 있는 가장 강력한 비디오 모델 중 하나입니다. 확장 기능, 풍부한 참조 자료, 4K 해상도를 통해 크리에이티브 팀은 단순 영상 생성을 넘어 진정한 '디렉팅' 단계로 나아가게 되었습니다." — 이타이 쉬프(Itay Schiff), Figma Weave 크리에이티브 디렉터
에이전틱 비디오 이해 (분석 효율 극대화)
영상 전체를 초당 1프레임(1 FPS)으로 무차별 디코딩하던 정적 처리와 달리, 모델이 에이전틱 루프를 통해 프레임, 오디오, 트랜스크립트 중 필요한 부분만을 능동적으로 선택·확대 검색합니다.
| 토큰 소비 절감 | 88 |
| 분석 비용 절감 | 66 |
| 분석 정확도 향상 | 7 |
이 기능은 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트에 적용되며, 추가 기능 수수료 없이 표준 토큰 요금만으로 제공됩니다. 이를 통해 1초 미만의 순간 포착(Sub-second moment retrieval), 장시간 영상 대상의 바늘 찾기(Needle-in-a-haystack) 검색, 이상 감지 작업의 토큰 낭비를 획기적으로 줄였습니다.