구글 제미나이 제품군의 에이전틱 전환과 실무 아키텍처 분석

구글 딥마인드가 제미나이 3.8 플래시, 3.8 플래시 사이버, 제미나이 3.5 트랜스크라이브를 연달아 공개하고 비디오 이해 기능에 에이전틱 루프를 도입했습니다. 고정 프레임 처리 대신 동적 스캔을 도입해 비디오 토큰 비용을 최대 88% 절감했으며, 사이버 보안 및 멀티모달 실시간 음성 인터랙션까지 작업 효율성을 끌어올렸습니다. 한편 오픈웨이트 모델 아키텍처 분석에서는 공개된 설정 파일과 구현 코드를 직접 검증하는 실무적 접근법이 강조되고 있습니다.

정적 분석의 한계를 넘는 에이전틱 비디오 파이프라인

기존의 멀티모달 비디오 분석은 정해진 초당 프레임 수(기본 1 FPS)로 영상을 일괄 입력받는 정적(Static) 처리 방식에 의존해 왔습니다. 이러한 구조에서는 긴 영상일수록 엄청난 토큰 비용이 발생하거나 주요 장면이 누락되는 딜레마가 발생했습니다. 구글 딥마인드가 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트에 적용한 에이전틱 비디오 이해(Agentic video understanding) 기능은 모델이 내부 도구를 사용해 능동적으로 비디오 구간을 탐색하는 구조로 전환되었습니다.

  1. 질의 분석
  2. 자체 도구로 대상 시점 검색
  3. 필요 구간 동적 FPS 샘플링
  4. 결과 도출

이러한 에이전틱 루프를 통해 모델은 영상 프레임, 오디오, 텍스트 전사를 교차 점검하며 필요한 신호만 가져옵니다. 표준 비디오 분석 벤치마크 기준 토큰 소비량 최대 88% 감소, 분석 비용 최대 66% 절감, 정확도 최대 7% 향상을 달성했습니다.

주요 기능별 세부 구현 역량은 다음과 같습니다:

이 기능은 구글 AI 스튜디오 및 제미나이 엔터프라이즈 에이전트 플랫폼에서 API 설정을 `agentic`으로 지정하여 사용할 수 있으며, 별도의 추가 수수료 없이 표준 토큰 요금이 적용됩니다.

---

제미나이 3.8 플래시: 긴 호흡의 엔지니어링과 자율 사이버 방어

구글은 3.7 플래시 발표 이후 6주 만에 3번째 플래시 모델군인 제미나이 3.8 플래시(Gemini 3.8 Flash)와 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)를 공개했습니다. 3.8 플래시는 복잡한 소프트웨어 공학과 다단계 추론을 수행하는 작업용 모델로 설계되었습니다.

모델입력 비용 ($/1M 토큰)출력 비용 ($/1M 토큰)주요 지표 및 성능
Gemini 3.8 Flash0.753.75HLE-Verified 54.9%, DeepSWE v1.1 우수
Gemini 3.8 Flash Cyber0.753.75CWE-Bench pass@1 47.2%, 내부 취약점 탐지 70%+

3.8 플래시는 복잡한 작업에서 추가적인 추론 단계와 반복적인 도구 호출을 수행하도록 설계되었습니다. 전문 영역 평가 벤치마크인 HLE-Verified에서 54.9%를 기록했습니다.

함께 공개된 제미나이 3.8 플래시 사이버는 페어윈드 프로그램(Fairwind Program)을 통해 인가된 방어자에게 제공되는 보안 특화 모델입니다. C/C++ 중심의 사이버지엠(CyberGym) 벤치마크뿐 아니라 20개 프로그래밍 언어에 걸친 구글 내부 벤치마크에서 70% 이상의 취약점 탐지 성공률을 보였습니다. 취약점 패치 벤치마크인 CWE-Bench에서는 47.2%의 pass@1을 기록하여 최상위 프론티어 모델(47.8%)에 근접하는 성과를 냈습니다.

실제 운영 환경에서의 검증 결과는 다음과 같습니다:

---

음성 지능화: 제미나이 3.5 트랜스크라이브의 실시간 문맥 처리

텍스트와 비디오에 이어 음성 입력 계층에서는 제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)가 도입되었습니다. 기존 음성 인식 모델이 소음 환경이나 말실수(Disfluency) 보정에 취약했던 점을 보완하여 원시 오디오를 문맥에 맞게 정제된 텍스트로 즉시 변환합니다.

"3.5 트랜스크라이브는 단순한 전사를 넘어 말실수를 자율 수정하고 필러 단어를 제거하며, 함수 호출을 통해 다른 제미나이 모델에 작업을 위임할 수 있도록 지원합니다."

아티피셜 애널리시스(Artificial Analysis) 측정 기준, 3.5 트랜스크라이브는 비스트리밍 단어 오류율(WER) 2.6%, 스트리밍 WER 4.0%를 기록했습니다. 다국어 벤치마크인 FLEURS에서는 스트리밍 5.50%, 비스트리밍 5.04%의 WER을 나타냈으며, 기존 칩 3(Chirp 3) 대비 최종 전사 도달 시간이 70% 단축되었습니다.

현재 `gemini-3.5-transcribe-live`(Live API)와 `gemini-3.5-transcribe`(Interactions API) 두 가지 형태로 제공되며, 85개 이상의 언어 지원과 함께 최대 3인까지의 화자 분리(Speaker attribution) 기능을 지원합니다.

---

오픈웨이트 LLM 아키텍처를 검증하는 실무적 워크플로

상용 API 모델들이 에이전틱 기능과 특화 파이프라인으로 확장되는 가운데, 오픈웨이트(Open-weight) 모델 진영에서는 아키텍처 구조를 정확히 파악하기 위한 엔지니어링 접근법이 주목받고 있습니다. 세바스찬 라슈카(Sebastian Raschka)는 최근 기술 백서의 세부 정보가 줄어드는 추세에서 아키텍처를 확인하는 실무 워크플로를 정리했습니다.

상용 독점 모델(ChatGPT, Claude, Gemini 등)과 달리 오픈웨이트 모델은 공유된 가중치와 레퍼런스 코드를 통해 내부 동작 메커니즘을 투명하게 검증할 수 있다는 차이점이 있습니다.

Verified figures

Our take

구글은 멀티모달 전반에 걸쳐 '무거운 단일 호출'에서 '가벼운 모델의 에이전틱 도구 연동'으로 아키텍처 패러다임을 전환하고 있습니다. 비디오와 음성, 보안 분석까지 저비용 플래시 모델에 자율 실행 루프를 결합함으로써 엔터프라이즈 도입의 최대 장벽이었던 토큰 비용과 추론 지연 시간을 동시에 공략하고 있습니다.

Open questions

Models mentioned

ProviderInputOutputContext window
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

Source

Back to catalog