구글 제미나이의 전방위 에이전틱 진화와 모델 아키텍처 분석

구글 딥마인드가 비디오를 능동적으로 탐색해 토큰을 최대 88% 절감하는 에이전틱 비디오 기술과 추론 성능을 강화한 Gemini 3.8 Flash 및 사이버 보안 특화 모델 3.8 Flash Cyber를 발표했습니다. 동시에 실시간 음성 인식을 고도화한 Gemini 3.5 Transcribe를 공개하여 멀티모달 에이전트 전반의 효율성과 전문성을 대폭 끌어올렸습니다. 이러한 독점 모델들의 고속 확장 속에서 오픈 가중치 모델의 실제 구현 코드를 분석하여 아키텍처를 검증하는 엔지니어링 워크플로우의 중요성 역시 부각되고 있습니다.

정적 프레임 분석을 넘어선 능동적 비디오 파이프라인의 등장

기존의 멀티모달 비디오 분석은 영상 전체를 초당 정해진 프레임(기본 1 FPS)으로 일괄 입력받는 정적(Static) 방식에 의존했습니다. 이로 인해 긴 영상일수록 천문학적인 토큰 비용이 발생하거나, 반대로 주요 세부 장면을 놓치는 트레이드오프가 발생했습니다. 구글 딥마인드가 새롭게 공개한 에이전틱 비디오 이해(Agentic video understanding) 기능은 모델이 능동적으로 영상 내부의 시각 프레임, 오디오, 텍스트 자막을 목표 지향적으로 검색하고 분석할 수 있도록 전환했습니다.

  1. 사용자 질의 접수
  2. 오디오·자막·프레임 능동 탐색
  3. 필요 구간 가변 FPS 정밀 재스캔
  4. 최종 분석 결과 도출

이 방식은 모델 내부의 추론 엔진과 네이티브 비디오 도구를 결합하여 필요한 시점만을 가변적인 프레임 레이트로 재스캔합니다. 이를 통해 표준 비디오 분석 벤치마크 전반에서 토큰 소모량을 대폭 줄이면서도 인식 정확도를 향상시켰습니다.

이 기능은 서브초(Sub-second) 단위의 시점 탐색, 고속 움직임에 대한 가변 FPS 이상 탐지, 반복 동작 및 객체 카운팅을 가능하게 하며, 향후 유튜브의 'Ask YouTube' 기능과 Gemini 앱 전반에 확대 적용될 예정입니다.

Gemini 3.8 Flash 출시와 보안 특화 모델 Cyber의 분화

구글 딥마인드는 Gemini 3.7 Flash 출시 불과 3주 만에 차세대 주력 모델인 Gemini 3.8 Flash와 보안 방어 특화 모델인 Gemini 3.8 Flash Cyber를 연이어 공개했습니다. 3.8 Flash는 3.7 버전과 동일한 가격 정책(입력 100만 토큰당 $0.75, 출력 100만 토큰당 $3.75)을 유지하면서 소프트웨어 엔지니어링, 에이전트 워크플로우, 복합 추론 역량을 대폭 강화했습니다.

모델명입력 비용 ($/1M)출력 비용 ($/1M)주요 특화 영역
Gemini 3.8 Flash0.753.75장기 소프트웨어 엔지니어링, 금융·법률 에이전트, STEM 추론
Gemini 3.8 Flash Cyber비공개(프로그램 한정)비공개(프로그램 한정)자율 취약점 탐지, 자동 패치 생성, 방어적 침투 테스트

Gemini 3.8 Flash는 복합 추론 벤치마크인 HLE-Verified에서 54.9%를 기록했으며, 복잡한 엔지니어링 문제를 해결하는 DeepSWE v1.1 및 금융(Vals Finance Agent V2), 법률(Harvey Legal Agent Benchmark) 분야에서 기존 프론티어 모델들을 상회하는 성능을 보였습니다.

함께 공개된 Gemini 3.8 Flash Cyber는 보안 방어자를 지원하기 위해 설계된 특화 모델입니다. 20개 이상의 프로그래밍 언어 코드베이스를 대상으로 한 내부 취약점 탐지 벤치마크에서 70% 이상의 성공률을 기록했으며, 외부 패칭 벤치마크인 CWE-Bench에서 선도 프론티어 모델(47.8%)에 근접한 47.2%의 pass@1 성능을 달성했습니다.

"Chrome 보안 팀의 검증 결과, 3.8 Flash Cyber는 훨씬 더 거대한 상용 모델들에 비해 Chrome 취약점에 대해 2.6배 더 많은 올바른 패치를 생성했습니다."

해당 모델은 구글 내부 클라우드 취약점 연구팀에서 수개월이 소요되던 치명적 기초 취약점을 2시간 미만에 탐지하는 성과를 냈으며, 현재 'Fairwind Program'을 통해 검증된 보안 방어자 및 정부 기관에 제한적으로 제공되고 있습니다.

실시간 음성 에이전트를 위한 Gemini 3.5 Transcribe의 정밀성

멀티모달 파이프라인의 음성 계층을 강화하기 위해 Gemini 3.5 Transcribe가 도입되었습니다. 기존의 음성 인식(STT) 모델들이 배경 소음, 전문 용어, 말더듬 현상 처리에 한계를 보였던 반면, 3.5 Transcribe는 원시 오디오를 직접 문맥에 맞게 정제된 텍스트로 변환합니다.

3.5 Transcribe는 실시간 양방향 처리를 지원하는 `Live API`와 사전 녹음 파일 처리를 위한 `Interactions API`로 분리 제공됩니다. 단순 전사를 넘어 자체 수정 발화('화요일에 만나요, 아니 수요일이요')를 자동으로 정제하며, macOS용 Gemini 앱과 안드로이드 Gboard의 Rambler 기능, 그리고 Google Antigravity 개발 환경 전반에 통합되어 화면 컨텍스트와 결합된 음성 코딩을 지원합니다.

독점 모델의 가속과 오픈 가중치 아키텍처 분석의 과제

구글의 급진적인 에이전틱 모델 확장은 AI 기술의 지평을 넓히고 있으나, 세부 아키텍처가 완전히 비공개된 독점(Proprietary) 모델이라는 특성을 지닙니다. AI 연구자이자 교육자인 세바스찬 라슈카(Sebastian Raschka)는 최근 산업계 연구소들이 공개하는 테크니컬 리포트의 기술적 상세 내용이 과거에 비해 크게 줄어들고 있는 현실을 지적했습니다.

라슈카는 오픈 가중치(Open-weight) 모델의 아키텍처를 명확히 이해하기 위한 워크플로우로 Hugging Face Model Hub에 등록된 `config.json` 설정 파일과 Python `transformers` 라이브러리의 참조 구현 코드를 직접 검증하는 수동 분석 방식을 제시했습니다.

"동작하는 코드는 거짓말을 하지 않습니다(Working code doesn't lie)."

라슈카는 ChatGPT, Claude, Gemini와 같은 독점 모델에는 이러한 코드 수준의 내부 검증이 불가능하지만, 공개 가중치 모델을 학습하고 구현할 때는 자동화 도구에만 의존하지 않고 직접 레퍼런스 코드를 뜯어보는 과정이 모델의 실제 텐서 흐름과 메커니즘을 파악하는 데 필수적이라고 강조했습니다.

멀티모달 도구 호출 기반 시스템으로의 패러다임 전환

이번 구글 딥마인드의 릴리즈와 오픈소스 진영의 분석 흐름은 AI 엔지니어링의 패러다임이 단일 LLM 프롬프팅에서 도구 호출 기반의 에이전틱 시스템으로 완전히 이동했음을 증명합니다. 비디오에서는 능동적 프레임 탐색 도구가 토큰 비용을 88% 절감시켰고, 코딩과 사이버 보안에서는 반복적인 에이전틱 루프가 취약점 탐지율을 70% 이상으로 끌어올렸으며, 음성에서는 화면 맥락과 결합된 함수 호출이 워크플로우를 자동화하고 있습니다.

결과적으로 향후 AI 인프라 구축의 핵심은 단순히 거대한 파운데이션 모델을 단독으로 호출하는 것이 아니라, 도구를 능동적으로 제어하는 소형·고효율 작업 모델(Flash 계열)을 에이전틱 파이프라인으로 엮어 비용과 성능의 파레토 프론티어를 달성하는 데 있습니다.

Verified figures

Our take

구글 딥마인드의 연이은 출시는 거대 단일 모델의 단순 스케일업 경쟁이 끝나고 고효율 모델과 도구 호출을 결합한 에이전틱 시스템 아키텍처로 표준이 전환되었음을 보여줍니다. 특히 비디오와 음성 전반에서 불필요한 입력을 최소화하고 목표 지향적으로 샘플링하는 기술은 엔터프라이즈 AI 파이프라인의 실질적 ROI를 결정짓는 기준이 될 것입니다. 앞으로는 독점 모델의 도구 생태계를 잘 엮어내는 오케스트레이션 역량과 오픈 가중치 모델의 내부 구조를 직접 검증해 내재화하는 기술력이 엔지니어링 조직의 양대 축이 될 것으로 전망합니다.

Open questions

Models mentioned

ProviderInputOutputContext window
Google: Gemini 3.7 Flash · Google$0.75$3.751,048,576
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

Source

Back to catalog