에이전틱 멀티모달과 전용 모델의 결합: 제미나이 생태계 진화

구글 딥마인드가 비디오 이해, 코딩·사이버보안, 지능형 음성 전반에 걸쳐 에이전틱 루프를 결합한 신규 제미나이 라인업을 공개했습니다. 제미나이 3.7·3.6·3.5 플래시 계열에 적용된 에이전틱 비디오 기능은 정적 프레임 분석을 탈피해 토큰 소모를 최대 88% 절감하고 정확도를 7% 개선했습니다. 함께 공개된 제미나이 3.8 플래시와 3.8 플래시 사이버는 복잡한 소프트웨어 엔지니어링과 자율 취약점 패치 영역에서 프론티어급 성능을 달성했으며, 제미나이 3.5 트랜스크라이브는 음성 자체에서 군더더기를 정제하고 함수 호출을 직접 수행합니다.

정적 분석에서 동적 탐색으로: 에이전틱 비디오 이해의 도입

기존의 멀티모달 비디오 분석은 기본 1초당 1프레임(1 FPS)과 같이 고정된 비율로 전체 영상을 일괄 입력받는 정적(Static) 처리 방식에 의존해 왔습니다. 이러한 구조는 10분 이상의 강의나 수 시간 분량의 긴 영상에서 막대한 토큰 비용을 발생시키거나, 반대로 프레임 누락으로 인해 1초 미만의 순간적인 장면 전환을 포착하지 못하는 한계를 보였습니다.

구글 딥마인드가 제미나이 3.7 플래시(Gemini 3.7 Flash), 3.6 플래시, 3.5 플래시-라이트 모델에 적용한 에이전틱 비디오 이해(Agentic Video Understanding) 기능은 모델이 자체적인 추론 루프를 통해 비디오를 능동적으로 탐색하도록 전환했습니다. 모델은 사용자의 질의에 맞춰 내부 비디오 도구를 호출하며 시각 프레임, 오디오 트랙, 자막(스크립트) 중 필요한 양식과 구간만을 선별적으로 확인합니다.

  1. 사용자 질의 입력
  2. 목표 지향적 양식 선별(시각/오디오/자막)
  3. 동적 FPS 리샘플링 및 구간 탐색
  4. 최소 토큰 기반 최종 추론

이러한 에이전틱 방식의 비디오 처리는 표준 비디오 분석 벤치마크 전반에서 토큰 소모량을 최대 88% 줄이고, 분석 비용을 최대 66% 절감하는 동시에 정확도를 최대 7% 향상시켰습니다. 특히 롱폼 비디오 벤치마크인 LongVideoBench에서 두드러진 효율을 기록했으며, 제미나이 3.7 플래시는 정확도 대비 비용 파레토 프런티어(Pareto frontier)에 도달했습니다.

주요 지원 및 활용 기능은 다음과 같습니다:

해당 기능은 구글 AI 스튜디오(Google AI Studio)와 제미나이 엔터프라이즈 에이전트 플랫폼의 API 설정에서 'agentic' 옵션을 활성화하여 즉시 사용할 수 있으며, 별도의 추가 기능 수수료 없이 표준 API 토큰 가격으로 제공됩니다. 구글은 향후 제미나이 앱 및 유튜브의 'Ask YouTube' 질의응답 기능에도 이를 순차 적용할 계획입니다.

작업 강도를 높인 추론형 모델: 제미나이 3.8 플래시 제품군

구글 딥마인드는 제미나이 3.7 플래시 출시 3주 만에 후속 모델인 제미나이 3.8 플래시(Gemini 3.8 Flash)와 사이버 보안 특화 모델인 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)를 공개했습니다. 이는 6주 동안 세 차례에 걸친 플래시 라인업 릴리즈입니다.

제미나이 3.8 플래시는 3.7 플래시와 동일한 가격 구조인 입력 백만 토큰당 0.75달러, 출력 백만 토큰당 3.75달러로 책정되었습니다. 모델의 구조적 특징은 고난도 작업에서 더 많은 추론 단계와 반복적 도구 호출을 수행하도록 설계되었다는 점입니다. STEM, 인문학, 전문직 평가를 포괄하는 HLE-Verified 벤치마크에서 54.9%를 기록했으며, 장기 소프트웨어 엔지니어링 벤치마크인 DeepSWE v1.1과 금융(Vals Finance Agent V2), 법률(Harvey Legal Agent) 벤치마크에서도 기존 프론티어 모델 수준의 성능을 나타냈습니다.

모델명입력 단가 ($/1M 토큰)출력 단가 ($/1M 토큰)주요 목표 영역
Gemini 3.8 Flash0.753.75장기 소프트웨어 엔지니어링, 복합 추론, 에이전트 워크플로
Gemini 3.8 Flash Cyber비공개 (Fairwind)비공개 (Fairwind)자율 취약점 탐지, 자동 보안 패치 생성, 침투 테스트

동시에 발표된 제미나이 3.8 플래시 사이버는 방어자 우위 원칙에 따라 취약점 탐지 및 수정(Patching)에 초점을 맞춰 개발되었습니다. Collinear가 주관하는 보안 패치 벤치마크인 CWE-Bench에서 47.2%의 pass@1을 기록해 선행 프론티어 모델의 47.8%에 근접하는 파레토 프런티어를 달성했습니다.

실제 프로덕션 환경 및 파트너사 테스트 결과는 다음과 같습니다:

제미나이 3.8 플래시 사이버는 화학·생물·방사능·핵(CBRN) 및 공격적 악용을 방지하기 위한 프론티어 안전 프레임워크(Frontier Safety Framework)를 적용받으며, 신뢰할 수 있는 공공기관 및 핵심 인프라 관리자에게 페어윈드 프로그램(Fairwind Program)을 통해 선별 제공됩니다.

음성에서 정제와 실행까지 일원화한 제미나이 3.5 트랜스크라이브

음성 인식 영역에서는 음성 신호를 텍스트로 단순 변환하는 수준을 넘어, 모델 자체의 지능으로 대화 맥락을 다듬고 외부 도구를 제어하는 제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)가 출시되었습니다.

제미나이 3.5 트랜스크라이브는 구글의 기존 음성 인식 모델인 Chirp 3 대비 최종 텍스트 확정까지 소요되는 지연 시간을 70% 단축시켰습니다. 인공지능 평가 기관 Artificial Analysis 측정 기준, 단어 오류율(WER, Word Error Rate)은 실시간 스트리밍 모드에서 4.0%, 비스트리밍(녹음 파일) 모드에서 2.6%를 기록했습니다. 다국어 벤치마크인 FLEURS 평가에서는 스트리밍 5.50%, 비스트리밍 5.04%의 WER을 나타냈습니다.

3.5 Transcribe 비스트리밍2.6
3.5 Transcribe 스트리밍4.0
FLEURS 비스트리밍5.04
FLEURS 스트리밍5.50

이 모델의 핵심 차별점은 단순 음향 처리가 아닌 지능형 텍스트 정제 기능입니다:

모델은 실시간 양방향 처리를 위한 `gemini-3.5-transcribe-live`와 녹음 파일 및 회의록 처리를 위한 `gemini-3.5-transcribe`의 두 가지 독립 API 엔드포인트로 제공됩니다.

오픈웨이트 LLM 아키텍처 분석의 접근법과 한계

빅테크 기업들이 독점(Proprietary) 멀티모달 모델의 기능과 엔드포인트를 급격히 고도화하는 한편, AI 엔지니어링 생태계에서는 모델 내부 아키텍처를 정확히 규명하려는 연구 분석 방법론이 지속적으로 논의되고 있습니다. 머신러닝 연구자 세바스찬 라슈카(Sebastian Raschka)는 최근 기술 보고서의 상세 수준이 낮아지는 추세에 대응하여 오픈웨이트 모델의 아키텍처를 검증하는 체계적 작업 방식을 제시했습니다.

"공식 기술 보고서부터 시작하지만, 요즘은 업계 연구소에서 나오는 대부분의 오픈웨이트 모델 기술 보고서조차 과거에 비해 세부 정보가 부족한 경우가 많습니다. 모델 가중치가 Hugging Face Hub에 공유되고 파이썬 transformers 라이브러리에서 지원된다면, 설정 파일과 레퍼런스 구현 코드를 직접 검사해 아키텍처 세부 정보를 얻을 수 있습니다. 작동하는 코드는 거짓말을 하지 않습니다."

라슈카가 제시한 워크플로는 기술 보고서에만 의존하지 않고 실제 Hugging Face에 배포된 `config.json`과 모델 파이썬 구현 코드를 수동으로 대조해 텐서 차원, 어텐션 헤드 수, 레이어 구조, 활성화 함수를 직접 확인하고 도식화하는 과정입니다. 다만 그는 이 방식이 모델 가중치와 세부 구조가 비공개된 제미나이, 챗GPT, 클로드와 같은 상용 독점 API 모델에는 직접 적용될 수 없으며, 오픈웨이트 환경에서 모델의 실제 작동 구조를 학습하기 위한 수동 분석 접근법임을 명시했습니다.

멀티모달 에이전트 아키텍처가 시사하는 기술적 함의

최근 공개된 제미나이 제품군의 기술적 공통점은 모델을 단일 입출력 생성기가 아닌 '도구를 호출하고 반복 실행하는 시스템'으로 전면 재구성했다는 점입니다.

첫째, 미디어 처리의 패러다임이 수동적 데이터 인출에서 에이전틱 리샘플링으로 이동했습니다. 비디오 전체를 동일한 빈도로 인코딩하는 대신 모델이 텍스트 자막을 먼저 확인한 뒤 특정 시간대만 고해상도로 재확인하는 루프를 도입함으로써, 긴 영상의 처리 비용을 3분의 1 수준으로 줄였습니다.

둘째, 범용 파운데이션 모델 위에 보안과 음성 등 도메인별 실행 도구를 직접 결합한 특화 모델이 양산되고 있습니다. 제미나이 3.8 플래시 사이버는 방어 자동화 도구를 에이전틱 루프로 제어해 대규모 코드베이스의 패치를 수행하며, 3.5 트랜스크라이브는 음성 입력을 즉각적인 도구 호출(Function Call)로 변환합니다. 이는 개발자가 직접 구축해야 했던 복잡한 오케스트레이션 파이프라인이 점차 파운데이션 모델의 기본 내장 기능으로 흡수되고 있음을 나타냅니다.

已核实数据

我们的观点

구글이 모델 크기 경쟁에서 벗어나 '도구를 제어하는 에이전틱 루프'를 플래시 계열 경량 모델에 직접 결합하여 운영 효율을 극대화하는 전략으로 완전히 전환했습니다. 비디오 동적 탐색과 STT 자체 함수 호출은 기존 서드파티 미들웨어 프레임워크가 수행하던 역할을 모델 계층으로 흡수하고 있습니다. 결과적으로 엔터프라이즈 AI 파이프라인은 복잡한 오케스트레이션 코드 작성보다 도메인 특화 도구를 모델에 어떻게 바인딩하느냐가 핵심 경쟁력이 될 것입니다.

尚未确认

文中提及的模型

供应商输入输出上下文窗口
Google: Gemini 3.7 Flash · Google$0.75$3.751,048,576
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

来源

返回目录