구글 제미나이 멀티모달 에이전트와 LLM 분석 생태계

구글 딥마인드가 장기 소프트웨어 엔지니어링 및 사이버 보안에 특화된 Gemini 3.8 Flash와 3.8 Flash Cyber를 공개했습니다. 동시에 고정 프레임 분석의 비효율을 해결한 에이전틱 비디오 기능과 음성 인식 모델 Gemini 3.5 Transcribe를 선보였습니다. 오픈 가중치 모델 아키텍처를 분석하는 개발자 워크플로우와 결합되어, AI 생태계는 고성능 전용 모델과 능동적 에이전트 루프 중심으로 빠르게 재편되고 있습니다.

자율 추론과 특화 보안으로 진화한 Gemini 3.8 라인업

구글 딥마인드가 Gemini 3.7 Flash 출시 3주 만에 신규 모델인 Gemini 3.8 Flash와 보안 특화 버전인 Gemini 3.8 Flash Cyber를 공개했습니다. 이는 6주 동안 이뤄진 3번째 Flash 모델 배포입니다.

Gemini 3.8 Flash는 3.7 Flash와 동일한 가격 구조인 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75로 출시되었습니다. 이 모델은 장기 소프트웨어 엔지니어링 능력을 평가하는 DeepSWE v1.1 벤치마크 및 다단계 전문 분야 추론 벤치마크인 HLE-Verified에서 54.9%를 기록했습니다. 복잡한 작업 수행 시 스스로 추가적인 추론 단계를 거치고 반복적인 도구 호출(Tool Calling)을 수행하는 에이전틱 루프를 실행하도록 설계되었습니다.

모델명입력 비용 ($/1M)출력 비용 ($/1M)주요 특화 분야
Gemini 3.8 Flash$0.75$3.75장기 코딩, 자율 에이전트, 전문 분석
Gemini 3.8 Flash CyberFairwind 프로그램 제공Fairwind 프로그램 제공자율 취약점 탐지, 자동 패치 생성

함께 공개된 Gemini 3.8 Flash Cyber는 신뢰할 수 있는 방어자 그룹을 위한 Fairwind 프로그램을 통해 제공됩니다. 20개 이상의 프로그래밍 언어로 구성된 구글 내부 취약점 벤치마크에서 70% 초과의 탐지 성공률을 기록했으며, CWE-Bench 패치 평가에서는 pass@1 기준 47.2%를 달성했습니다. 크롬 보안팀 테스트에 따르면 기존 대형 상용 모델 대비 2.6배 더 많은 정확한 패치를 생성했으며, 클라우드 취약점 연구팀은 수개월이 소요되던 중대 취약점을 2시간 미만에 식별했습니다.

능동적 탐색으로 비용과 토큰을 절감하는 에이전틱 비디오

기존 비디오 분석 방식은 초당 프레임 수(기본 1 FPS)를 고정하여 전체 영상을 정적으로 주입하는 형태였습니다. 구글은 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite를 대상으로 동적 영상 분석 기능인 에이전틱 비디오(Agentic Video) 이해 기능을 도입했습니다.

  1. 영상 입력
  2. 목표 기반 탐색 전략 수립
  3. 동적 FPS/오디오/스크립트 선별 호출
  4. 필요 구간 정밀 분석

이 기술은 모델이 목표에 따라 비디오 프레임, 오디오, 텍스트 스크립트 중 필요한 모달리티와 특정 구간만을 능동적으로 선택해 분석합니다. 이를 통해 다음과 같은 효율성 개선을 달성했습니다.

해당 기능은 10분 이상의 튜토리얼부터 90분 이상의 강의 및 다중 시간 녹화 영상 분석 시 고비용 문제를 해소합니다. 세부적으로는 1초 미만의 순간 포착(Sub-second moment retrieval), 장기 영상 내 특정 정보 검색(Needle-in-a-haystack), 동적 FPS를 활용한 이상 탐지 및 빠른 객체 계수 작업에 활용됩니다. 이 기능은 Google AI Studio 및 Gemini Enterprise Agent Platform에서 API 설정을 `agentic`으로 활성화하여 추가 기능 요금 없이 표준 토큰 요금으로 사용할 수 있습니다.

실시간 상호작용을 위한 Gemini 3.5 Transcribe의 음성 처리

구글은 기존 음성 인식 모델인 Chirp 3을 개선한 Gemini 3.5 Transcribe를 함께 출시했습니다. 잡음 환경, 전문 용어 처리, 비유창성(Filler words 및 말실수 교정) 문제를 해결하는 데 중점을 둔 음성-텍스트 변환 모델입니다.

Artificial Analysis 측정 결과, 이 모델은 스트리밍 환경에서 4.0%, 비스트리밍 환경에서 2.6%의 단어 오류율(WER)을 기록했습니다. 다국어 평가 벤치마크인 FLEURS 기준으로는 스트리밍 5.50%, 비스트리밍 5.04%의 WER을 나타냈으며, 최종 전사 도달 시간은 이전 대비 70% 단축되었습니다.

"Gemini 3.5 Transcribe는 원시 오디오를 정확하고 정제된 텍스트로 직접 변환하며, 자체 교정과 불필요한 추임새 제거를 원활하게 처리합니다."

Gemini 3.5 Transcribe는 85개 이상의 언어를 지원하며, 녹음된 오디오에서 최대 3인(3인 이상은 실험적 지원)의 화자 분리 및 단어 수준 타임스탬프 기능을 제공합니다. 또한 Gemini macOS 앱에서는 음성 입력을 바탕으로 다른 Gemini 모델에 파일 요약이나 이미지 생성 등의 작업을 위임하는 함수 호출(Function calling) 인터페이스를 지원합니다.

오픈 가중치 LLM 구조 파악을 위한 엔지니어링 워크플로우

제미나이와 같은 독점 모델의 도구 연동과 기능 확장이 가속화되는 한편, 오픈 가중치(Open-weight) 모델 진영에서는 아키텍처를 직접 분석하고 검증하는 방법론이 강조되고 있습니다.

머신러닝 연구자 세바스찬 라슈카(Sebastian Raschka)는 최근 산업계 연구소들이 공개하는 기술 보고서(Technical Report)의 세부 아키텍처 설명이 줄어들고 있는 점을 지적했습니다. 이에 따라 Hugging Face Model Hub에 공개된 가중치와 파이썬 `transformers` 라이브러리의 참조 구현체(Reference Implementation) 및 설정 파일(Config file)을 직접 교차 검증하는 수동 워크플로우의 중요성을 강조했습니다. 독점 모델의 에이전틱 API를 도입하는 것과 별개로, 기본 아키텍처의 세부 설계를 파악하기 위해서는 실제 실행 코드 기반의 분석이 필수적입니다.

Cifras verificadas

Nuestra opinión

구글이 모델 크기 경쟁에서 벗어나 에이전트 루프 기반의 효율성과 도메인 특화 성능(사이버 보안, 지능형 전사, 동적 영상 탐색)에 집중하고 있습니다. 특히 영상 처리에서 정적 주입을 탈피하고 능동적 도구 호출을 표준화한 것은 멀티모달 추론 비용을 획기적으로 낮추는 전환점이 될 것입니다.

Preguntas abiertas

Modelos mencionados

ProveedorEntradaSalidaVentana de contexto
Google: Gemini 3.7 Flash · Google$0.75$3.751,048,576
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

Fuente

Volver al catálogo