정적 분석의 한계를 넘는 에이전틱 비디오 파이프라인
기존의 멀티모달 비디오 분석은 정해진 초당 프레임 수(기본 1 FPS)로 영상을 일괄 입력받는 정적(Static) 처리 방식에 의존해 왔습니다. 이러한 구조에서는 긴 영상일수록 엄청난 토큰 비용이 발생하거나 주요 장면이 누락되는 딜레마가 발생했습니다. 구글 딥마인드가 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트에 적용한 에이전틱 비디오 이해(Agentic video understanding) 기능은 모델이 내부 도구를 사용해 능동적으로 비디오 구간을 탐색하는 구조로 전환되었습니다.
- 질의 분석
- 자체 도구로 대상 시점 검색
- 필요 구간 동적 FPS 샘플링
- 결과 도출
이러한 에이전틱 루프를 통해 모델은 영상 프레임, 오디오, 텍스트 전사를 교차 점검하며 필요한 신호만 가져옵니다. 표준 비디오 분석 벤치마크 기준 토큰 소비량 최대 88% 감소, 분석 비용 최대 66% 절감, 정확도 최대 7% 향상을 달성했습니다.
주요 기능별 세부 구현 역량은 다음과 같습니다:
- 밀리초 단위 순간 포착(Sub-second moment retrieval): 1 FPS 환경에서 놓치기 쉬운 급격한 상태 변화와 컷 편집 지점을 정확히 식별합니다.
- 장기 영상 고난도 검색(Needle-in-a-haystack): 수 시간 분량의 영상에서 수백만 토큰을 소모하지 않고 정밀한 답변을 검색합니다.
- 이상 징후 감지 및 객체 계수: 빠른 움직임이나 이상 현상이 포착된 시간 구간만 선택적으로 높은 FPS로 재샘플링하여 분석합니다.
이 기능은 구글 AI 스튜디오 및 제미나이 엔터프라이즈 에이전트 플랫폼에서 API 설정을 `agentic`으로 지정하여 사용할 수 있으며, 별도의 추가 수수료 없이 표준 토큰 요금이 적용됩니다.
---
제미나이 3.8 플래시: 긴 호흡의 엔지니어링과 자율 사이버 방어
구글은 3.7 플래시 발표 이후 6주 만에 3번째 플래시 모델군인 제미나이 3.8 플래시(Gemini 3.8 Flash)와 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)를 공개했습니다. 3.8 플래시는 복잡한 소프트웨어 공학과 다단계 추론을 수행하는 작업용 모델로 설계되었습니다.
| 모델 | 입력 비용 ($/1M 토큰) | 출력 비용 ($/1M 토큰) | 주요 지표 및 성능 |
|---|---|---|---|
| Gemini 3.8 Flash | 0.75 | 3.75 | HLE-Verified 54.9%, DeepSWE v1.1 우수 |
| Gemini 3.8 Flash Cyber | 0.75 | 3.75 | CWE-Bench pass@1 47.2%, 내부 취약점 탐지 70%+ |
3.8 플래시는 복잡한 작업에서 추가적인 추론 단계와 반복적인 도구 호출을 수행하도록 설계되었습니다. 전문 영역 평가 벤치마크인 HLE-Verified에서 54.9%를 기록했습니다.
함께 공개된 제미나이 3.8 플래시 사이버는 페어윈드 프로그램(Fairwind Program)을 통해 인가된 방어자에게 제공되는 보안 특화 모델입니다. C/C++ 중심의 사이버지엠(CyberGym) 벤치마크뿐 아니라 20개 프로그래밍 언어에 걸친 구글 내부 벤치마크에서 70% 이상의 취약점 탐지 성공률을 보였습니다. 취약점 패치 벤치마크인 CWE-Bench에서는 47.2%의 pass@1을 기록하여 최상위 프론티어 모델(47.8%)에 근접하는 성과를 냈습니다.
실제 운영 환경에서의 검증 결과는 다음과 같습니다:
- 크롬 보안팀: 대형 상용 모델 대비 2.6배 더 많은 정확한 취약점 패치 생성
- Wiz 모의해킹 벤치마크: 프론티어 모델 대비 2.3~5.2배 낮은 비용으로 7.5~9.7% 높은 재현율(Recall) 달성
- 구글 클라우드 보안 연구팀: 수개월이 소요되던 중대 기초 취약점을 2시간 이내에 식별
---
음성 지능화: 제미나이 3.5 트랜스크라이브의 실시간 문맥 처리
텍스트와 비디오에 이어 음성 입력 계층에서는 제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)가 도입되었습니다. 기존 음성 인식 모델이 소음 환경이나 말실수(Disfluency) 보정에 취약했던 점을 보완하여 원시 오디오를 문맥에 맞게 정제된 텍스트로 즉시 변환합니다.
"3.5 트랜스크라이브는 단순한 전사를 넘어 말실수를 자율 수정하고 필러 단어를 제거하며, 함수 호출을 통해 다른 제미나이 모델에 작업을 위임할 수 있도록 지원합니다."
아티피셜 애널리시스(Artificial Analysis) 측정 기준, 3.5 트랜스크라이브는 비스트리밍 단어 오류율(WER) 2.6%, 스트리밍 WER 4.0%를 기록했습니다. 다국어 벤치마크인 FLEURS에서는 스트리밍 5.50%, 비스트리밍 5.04%의 WER을 나타냈으며, 기존 칩 3(Chirp 3) 대비 최종 전사 도달 시간이 70% 단축되었습니다.
현재 `gemini-3.5-transcribe-live`(Live API)와 `gemini-3.5-transcribe`(Interactions API) 두 가지 형태로 제공되며, 85개 이상의 언어 지원과 함께 최대 3인까지의 화자 분리(Speaker attribution) 기능을 지원합니다.
---
오픈웨이트 LLM 아키텍처를 검증하는 실무적 워크플로
상용 API 모델들이 에이전틱 기능과 특화 파이프라인으로 확장되는 가운데, 오픈웨이트(Open-weight) 모델 진영에서는 아키텍처 구조를 정확히 파악하기 위한 엔지니어링 접근법이 주목받고 있습니다. 세바스찬 라슈카(Sebastian Raschka)는 최근 기술 백서의 세부 정보가 줄어드는 추세에서 아키텍처를 확인하는 실무 워크플로를 정리했습니다.
- 기술 보고서 검토: 공식 공개 문서를 통해 기본 제원과 변경 사항을 1차적으로 확인합니다.
- 저장소 구성 파일 검사: 허깅페이스 모델 허브에 공유된 `config.json` 등 메타데이터 파일을 확인합니다.
- 참조 구현체 코드 분석: 파이썬 `transformers` 라이브러리에 등록된 실제 작동 코드를 디버깅하여 텐서 차원, 어텐션 변형, 레이어 연결 구조를 역추적합니다.
상용 독점 모델(ChatGPT, Claude, Gemini 등)과 달리 오픈웨이트 모델은 공유된 가중치와 레퍼런스 코드를 통해 내부 동작 메커니즘을 투명하게 검증할 수 있다는 차이점이 있습니다.