정적 분석에서 동적 탐색으로: 에이전틱 비디오 이해의 도입
기존의 멀티모달 비디오 분석은 기본 1초당 1프레임(1 FPS)과 같이 고정된 비율로 전체 영상을 일괄 입력받는 정적(Static) 처리 방식에 의존해 왔습니다. 이러한 구조는 10분 이상의 강의나 수 시간 분량의 긴 영상에서 막대한 토큰 비용을 발생시키거나, 반대로 프레임 누락으로 인해 1초 미만의 순간적인 장면 전환을 포착하지 못하는 한계를 보였습니다.
구글 딥마인드가 제미나이 3.7 플래시(Gemini 3.7 Flash), 3.6 플래시, 3.5 플래시-라이트 모델에 적용한 에이전틱 비디오 이해(Agentic Video Understanding) 기능은 모델이 자체적인 추론 루프를 통해 비디오를 능동적으로 탐색하도록 전환했습니다. 모델은 사용자의 질의에 맞춰 내부 비디오 도구를 호출하며 시각 프레임, 오디오 트랙, 자막(스크립트) 중 필요한 양식과 구간만을 선별적으로 확인합니다.
- 사용자 질의 입력
- 목표 지향적 양식 선별(시각/오디오/자막)
- 동적 FPS 리샘플링 및 구간 탐색
- 최소 토큰 기반 최종 추론
이러한 에이전틱 방식의 비디오 처리는 표준 비디오 분석 벤치마크 전반에서 토큰 소모량을 최대 88% 줄이고, 분석 비용을 최대 66% 절감하는 동시에 정확도를 최대 7% 향상시켰습니다. 특히 롱폼 비디오 벤치마크인 LongVideoBench에서 두드러진 효율을 기록했으며, 제미나이 3.7 플래시는 정확도 대비 비용 파레토 프런티어(Pareto frontier)에 도달했습니다.
주요 지원 및 활용 기능은 다음과 같습니다:
- 밀리초 단위 순간 검색(Sub-second moment retrieval): 1 FPS 환경에서 놓치기 쉬운 미세한 장면 전환 및 컷 경계를 정밀하게 포착합니다.
- 장기 영상 내 단서 탐색(Long-form needle-in-a-haystack search): 수 시간 분량의 영상에서 수백만 개의 토큰을 소모하지 않고 정답을 추출합니다.
- 이상 징후 탐지(Anomaly detection): 특정 구간의 프레임 레이트(FPS)를 동적으로 높여 빠른 움직임과 시각적 결함을 검사합니다.
- 행동 및 객체 계수(Counting action & object): 반복되는 물리적 움직임과 객체의 시간별 이동을 추적합니다.
해당 기능은 구글 AI 스튜디오(Google AI Studio)와 제미나이 엔터프라이즈 에이전트 플랫폼의 API 설정에서 'agentic' 옵션을 활성화하여 즉시 사용할 수 있으며, 별도의 추가 기능 수수료 없이 표준 API 토큰 가격으로 제공됩니다. 구글은 향후 제미나이 앱 및 유튜브의 'Ask YouTube' 질의응답 기능에도 이를 순차 적용할 계획입니다.
작업 강도를 높인 추론형 모델: 제미나이 3.8 플래시 제품군
구글 딥마인드는 제미나이 3.7 플래시 출시 3주 만에 후속 모델인 제미나이 3.8 플래시(Gemini 3.8 Flash)와 사이버 보안 특화 모델인 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)를 공개했습니다. 이는 6주 동안 세 차례에 걸친 플래시 라인업 릴리즈입니다.
제미나이 3.8 플래시는 3.7 플래시와 동일한 가격 구조인 입력 백만 토큰당 0.75달러, 출력 백만 토큰당 3.75달러로 책정되었습니다. 모델의 구조적 특징은 고난도 작업에서 더 많은 추론 단계와 반복적 도구 호출을 수행하도록 설계되었다는 점입니다. STEM, 인문학, 전문직 평가를 포괄하는 HLE-Verified 벤치마크에서 54.9%를 기록했으며, 장기 소프트웨어 엔지니어링 벤치마크인 DeepSWE v1.1과 금융(Vals Finance Agent V2), 법률(Harvey Legal Agent) 벤치마크에서도 기존 프론티어 모델 수준의 성능을 나타냈습니다.
| 모델명 | 입력 단가 ($/1M 토큰) | 출력 단가 ($/1M 토큰) | 주요 목표 영역 |
|---|---|---|---|
| Gemini 3.8 Flash | 0.75 | 3.75 | 장기 소프트웨어 엔지니어링, 복합 추론, 에이전트 워크플로 |
| Gemini 3.8 Flash Cyber | 비공개 (Fairwind) | 비공개 (Fairwind) | 자율 취약점 탐지, 자동 보안 패치 생성, 침투 테스트 |
동시에 발표된 제미나이 3.8 플래시 사이버는 방어자 우위 원칙에 따라 취약점 탐지 및 수정(Patching)에 초점을 맞춰 개발되었습니다. Collinear가 주관하는 보안 패치 벤치마크인 CWE-Bench에서 47.2%의 pass@1을 기록해 선행 프론티어 모델의 47.8%에 근접하는 파레토 프런티어를 달성했습니다.
실제 프로덕션 환경 및 파트너사 테스트 결과는 다음과 같습니다:
- 구글 크롬 보안팀: 크롬 내부 취약점에 대해 대형 상용 모델 대비 2.6배 많은 정확한 패치를 생성했습니다.
- Wiz 침투 테스트: 내부 벤치마크에서 타 프론티어 모델 대비 비용을 2.3~5.2배 절감하면서 재현율(Recall)을 7.5~9.7%p 높였습니다.
- 구글 클라우드 취약점 연구팀: 수개월의 연구가 소요되던 중대 기반 취약점을 2시간 이내에 탐색했습니다.
- 다국어 코드베이스 분석: 20개 프로그래밍 언어로 구성된 내부 벤치마크에서 70% 이상의 취약점 발견 성공률을 기록했습니다.
제미나이 3.8 플래시 사이버는 화학·생물·방사능·핵(CBRN) 및 공격적 악용을 방지하기 위한 프론티어 안전 프레임워크(Frontier Safety Framework)를 적용받으며, 신뢰할 수 있는 공공기관 및 핵심 인프라 관리자에게 페어윈드 프로그램(Fairwind Program)을 통해 선별 제공됩니다.
음성에서 정제와 실행까지 일원화한 제미나이 3.5 트랜스크라이브
음성 인식 영역에서는 음성 신호를 텍스트로 단순 변환하는 수준을 넘어, 모델 자체의 지능으로 대화 맥락을 다듬고 외부 도구를 제어하는 제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)가 출시되었습니다.
제미나이 3.5 트랜스크라이브는 구글의 기존 음성 인식 모델인 Chirp 3 대비 최종 텍스트 확정까지 소요되는 지연 시간을 70% 단축시켰습니다. 인공지능 평가 기관 Artificial Analysis 측정 기준, 단어 오류율(WER, Word Error Rate)은 실시간 스트리밍 모드에서 4.0%, 비스트리밍(녹음 파일) 모드에서 2.6%를 기록했습니다. 다국어 벤치마크인 FLEURS 평가에서는 스트리밍 5.50%, 비스트리밍 5.04%의 WER을 나타냈습니다.
| 3.5 Transcribe 비스트리밍 | 2.6 |
| 3.5 Transcribe 스트리밍 | 4.0 |
| FLEURS 비스트리밍 | 5.04 |
| FLEURS 스트리밍 | 5.50 |
이 모델의 핵심 차별점은 단순 음향 처리가 아닌 지능형 텍스트 정제 기능입니다:
- 발화 오류 및 간투어 자동 보정(Smart transcription): '화요일에 만나요, 아니 수요일로'와 같은 실시간 말실수 자가 수정과 '음(um)', '아(ah)'와 같은 불필요한 추임새를 실시간으로 제거하고 문맥에 맞게 서식을 자동 정리합니다.
- 함수 호출 연계(Function calling): 음성 지시를 인식한 뒤 macOS 제미나이 앱 등의 환경에서 다른 제미나이 모델을 호출하여 이미지 생성이나 로컬 파일 요약 등의 작업을 백그라운드에서 직접 실행합니다.
- 다중 화자 분리 및 타임스탬프: 사전 녹음된 오디오에서 최대 3인(3인 이상은 실험 단계)까지 화자를 식별하고 단어 단위 타임스탬프를 부여합니다.
- 언어 및 어휘 적응: 85개 이상의 언어를 자동 감지하며, 주문 ID나 우편번호와 같은 영숫자 조합 및 사용자 정의 전문 어휘(Custom vocabulary)를 정확히 반영합니다.
모델은 실시간 양방향 처리를 위한 `gemini-3.5-transcribe-live`와 녹음 파일 및 회의록 처리를 위한 `gemini-3.5-transcribe`의 두 가지 독립 API 엔드포인트로 제공됩니다.
오픈웨이트 LLM 아키텍처 분석의 접근법과 한계
빅테크 기업들이 독점(Proprietary) 멀티모달 모델의 기능과 엔드포인트를 급격히 고도화하는 한편, AI 엔지니어링 생태계에서는 모델 내부 아키텍처를 정확히 규명하려는 연구 분석 방법론이 지속적으로 논의되고 있습니다. 머신러닝 연구자 세바스찬 라슈카(Sebastian Raschka)는 최근 기술 보고서의 상세 수준이 낮아지는 추세에 대응하여 오픈웨이트 모델의 아키텍처를 검증하는 체계적 작업 방식을 제시했습니다.
"공식 기술 보고서부터 시작하지만, 요즘은 업계 연구소에서 나오는 대부분의 오픈웨이트 모델 기술 보고서조차 과거에 비해 세부 정보가 부족한 경우가 많습니다. 모델 가중치가 Hugging Face Hub에 공유되고 파이썬 transformers 라이브러리에서 지원된다면, 설정 파일과 레퍼런스 구현 코드를 직접 검사해 아키텍처 세부 정보를 얻을 수 있습니다. 작동하는 코드는 거짓말을 하지 않습니다."
라슈카가 제시한 워크플로는 기술 보고서에만 의존하지 않고 실제 Hugging Face에 배포된 `config.json`과 모델 파이썬 구현 코드를 수동으로 대조해 텐서 차원, 어텐션 헤드 수, 레이어 구조, 활성화 함수를 직접 확인하고 도식화하는 과정입니다. 다만 그는 이 방식이 모델 가중치와 세부 구조가 비공개된 제미나이, 챗GPT, 클로드와 같은 상용 독점 API 모델에는 직접 적용될 수 없으며, 오픈웨이트 환경에서 모델의 실제 작동 구조를 학습하기 위한 수동 분석 접근법임을 명시했습니다.
멀티모달 에이전트 아키텍처가 시사하는 기술적 함의
최근 공개된 제미나이 제품군의 기술적 공통점은 모델을 단일 입출력 생성기가 아닌 '도구를 호출하고 반복 실행하는 시스템'으로 전면 재구성했다는 점입니다.
첫째, 미디어 처리의 패러다임이 수동적 데이터 인출에서 에이전틱 리샘플링으로 이동했습니다. 비디오 전체를 동일한 빈도로 인코딩하는 대신 모델이 텍스트 자막을 먼저 확인한 뒤 특정 시간대만 고해상도로 재확인하는 루프를 도입함으로써, 긴 영상의 처리 비용을 3분의 1 수준으로 줄였습니다.
둘째, 범용 파운데이션 모델 위에 보안과 음성 등 도메인별 실행 도구를 직접 결합한 특화 모델이 양산되고 있습니다. 제미나이 3.8 플래시 사이버는 방어 자동화 도구를 에이전틱 루프로 제어해 대규모 코드베이스의 패치를 수행하며, 3.5 트랜스크라이브는 음성 입력을 즉각적인 도구 호출(Function Call)로 변환합니다. 이는 개발자가 직접 구축해야 했던 복잡한 오케스트레이션 파이프라인이 점차 파운데이션 모델의 기본 내장 기능으로 흡수되고 있음을 나타냅니다.