에이전틱 멀티모달과 전용 모델로 진화하는 AI 생태계

구글 딥마인드가 비디오와 음성, 보안 등 핵심 영역 전반에 걸쳐 자율적인 도구 호출과 동적 스캔 기능을 탑재한 에이전틱 모델들을 대거 공개했습니다. 에이전틱 비디오 이해는 토큰 사용량을 최대 88% 절감하며, Gemini 3.8 Flash 및 Cyber 모델은 심층 추론과 소프트웨어 엔지니어링, 능동적 보안 패치에서 높은 효율성을 입증했습니다. 동시에 오픈웨이트 모델의 내부 구조 파악을 위한 실증적 코드 분석 워크플로우의 중요성도 함께 강조되고 있습니다.

정적 데이터 파이프라인에서 에이전틱 루프로의 멀티모달 패러다임 전환

지금까지 멀티모달 비디오 처리 방식은 초당 1프레임(1 FPS)과 같은 고정된 프레임 레이트로 전체 영상을 일괄 입력하는 정적 방식이 주를 이루었습니다. 이러한 방식은 긴 영상에서 불필요한 토큰 낭비를 유발하거나, 프레임 사이에 발생하는 순간적인 상태 변화를 놓치는 한계를 보였습니다. 구글 딥마인드가 공개한 에이전틱 비디오 이해(Agentic Video Understanding) 기능은 이러한 문제를 해결하기 위해 모델이 목표 지향적으로 영상을 탐색하도록 설계되었습니다.

  1. 영상 수신
  2. 도구 기반 시각·음성·자막 동적 스캔
  3. 관심 구간 목표 지향 고해상도 재스캔
  4. 최종 분석 결과 도출

이 접근법은 Gemini 모델의 핵심 추론 능력과 비디오 도구를 결합하여, 필요한 프레임과 오디오, 트랜스크립트만을 선택적으로 불러옵니다. 그 결과 표준 벤치마크 기준 비디오 분석 비용은 최대 66% 절감되었고, 토큰 소비량은 최대 88% 감소하면서도 정확도는 최대 7% 향상되었습니다.

"기존의 정적 처리와 달리, 에이전틱 비디오 이해는 Gemini가 무엇을, 어떤 속도로, 어떤 모달리티를 통해 볼 것인지 능동적이고 목표 지향적인 역할을 수행하게 만듭니다."

이 기능은 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite 모델에 적용되며, Google AI Studio 및 Gemini Enterprise Agent Platform에서 API 설정을 'agentic'으로 지정하여 바로 활용할 수 있습니다. 특히 10분 이상의 튜토리얼부터 90분 강의, 수 시간 분량의 영상 분석(Long-form needle-in-a-haystack)에서 고비용 문제와 세부 정보 누락을 동시에 해결합니다.

심층 추론과 특화 보안 엔지니어링: Gemini 3.8 Flash 및 3.8 Flash Cyber

구글은 3.7 Flash 출시 3주 만에 신규 모델인 Gemini 3.8 Flash와 사이버 보안 전용 모델인 Gemini 3.8 Flash Cyber를 발표했습니다. 이는 6주 동안 세 번째로 이루어진 Flash 라인업 출시입니다. Gemini 3.8 Flash는 백만 토큰당 입력 $0.75, 출력 $3.75라는 3.7 Flash와 동일한 가격대를 유지하면서, 복잡한 다단계 추론과 소프트웨어 엔지니어링 성능을 크게 끌어올렸습니다.

모델핵심 타깃 및 벤치마크 성능토큰 가격 (입력 / 출력, 1M 기준)접근 방식
Gemini 3.8 FlashDeepSWE v1.1 우수, HLE-Verified 54.9% 달성$0.75 / $3.75Google AI Studio, Gemini API, Enterprise
Gemini 3.8 Flash CyberCWE-Bench pass@1 47.2%, 20개 언어 취약점 발견 70% 초과전용 프로그램 기준 제공Fairwind Program (검증된 방어자)

Gemini 3.8 Flash의 성능 향상은 모델이 복잡한 작업에서 추가적인 추론 단계를 실행하고 반복적으로 도구를 호출하는 고강도 연산(diligence) 설계를 채택했기 때문입니다. 이로 인해 높은 노력 수준(effort levels)에서는 더 많은 토큰을 소모할 수 있으나, 단일 프롬프트 기반 자율 코딩 및 전문 금융·법률 에이전트 벤치마크(Vals Finance Agent V2, Harvey's Legal Agent)에서 프론티어급 성능을 기록했습니다.

함께 공개된 Gemini 3.8 Flash Cyber는 방어자에게 공격자보다 우위를 제공하기 위해 취약점 탐지 및 자동 패치 기능에 집중했습니다. Collinear의 패치 벤치마크 CWE-Bench에서 pass@1 47.2%를 달성하여 선도적 프론티어 모델(47.8%)에 근접한 결과를 냈습니다. 구글 크롬 보안 팀 테스트에서는 기존 대형 상용 모델 대비 2.6배 더 많은 정확한 취약점 패치를 생성했으며, Wiz의 내부 침투 테스트 벤치마크에서는 2.3~5.2배 낮은 비용으로 7.5~9.7% 더 높은 재현율(recall)을 보였습니다.

음성 인식을 넘어 실행으로 확장되는 Gemini 3.5 Transcribe

음성 인터페이스 분야에서는 실시간 스트리밍과 녹음 처리를 지원하는 Gemini 3.5 Transcribe가 발표되었습니다. 기존 음성 인식 모델(STT)이 겪던 배경 소음, 전문 용어 처리, 말실수 교정의 한계를 극복하고 원시 오디오를 즉시 서식화된 텍스트로 변환합니다.

Non-Streaming 평균 WER2.6
Streaming 평균 WER4.0
FLEURS Non-Streaming5.04
FLEURS Streaming5.50

Artificial Analysis 측정 결과, 비스트리밍 환경에서 2.6%, 스트리밍 환경에서 4.0%의 단어 오류율(WER)을 기록했습니다. 이전 세대 모델인 Chirp 3 대비 최종 전사 완료까지 걸리는 시간(Latency)은 70% 단축되었으며, FLEURS 다국어 벤치마크에서도 스트리밍 5.50%, 비스트리밍 5.04%의 성능을 입증했습니다.

주요 기능 및 통합 영역은 다음과 같습니다:

오픈웨이트 분석 워크플로우와 블랙박스 프론티어 모델의 현실

이러한 클라우드 프론티어 모델의 급격한 기능 고도화 속에서, 머신러닝 연구자이자 교육자인 세바스티안 라슈카(Sebastian Raschka)는 최신 LLM 아키텍처를 정확히 이해하기 위한 실증적 접근법을 공유했습니다.

최근 산업계 연구소에서 공개하는 오픈웨이트 모델의 기술 보고서(Technical Report)는 과거에 비해 세부 아키텍처 정보가 축소되는 경향이 있습니다. 이에 따라 라슈카는 허깅페이스(Hugging Face) 모델 허브에 공개된 가중치 설정 파일(`config.json`)과 파이썬 `transformers` 라이브러리의 참조 구현 코드를 직접 검증하는 수동 분석 워크플로우를 제시했습니다.

"기술 보고서의 설명이 줄어들더라도, 허깅페이스 허브의 설정 파일과 실제 동작하는 코드는 거짓말을 하지 않습니다."

하지만 이러한 코드 기반 아키텍처 역분석 기법은 가중치가 공개된 오픈웨이트 모델에 국한됩니다. Gemini 3.8이나 Claude, ChatGPT와 같은 상용 프론티어 모델은 상세한 내부 구조가 공개되지 않은 독점적(Proprietary) 시스템으로 제공되므로, 개발자는 내부 아키텍처 대신 API 파라미터(예: 에이전틱 모드 설정, 노력 수준 조절)와 도구 통합 인터페이스에 초점을 맞춰 엔지니어링을 진행해야 합니다.

통합적 시사점: 개발 및 비즈니스 워크플로우의 변화

이번 발표들은 AI 모델의 활용 방식이 '단순 텍스트/미디어 생성'에서 '스마트 도구 호출 기반의 에이전틱 작업 수행'으로 완전히 전환되었음을 보여줍니다.

첫째, 비디오 및 음성 파이프라인에서 입력 토큰 최적화가 모델 내부의 자율 제어로 넘어갔습니다. 비디오 프레임을 개발자가 사전에 수동으로 샘플링할 필요 없이 에이전틱 모드를 통해 API 수준에서 비용을 66% 줄일 수 있게 되었습니다. 둘째, 범용 모델 하나로 모든 것을 해결하기보다, Gemini 3.8 Flash Cyber와 같이 엄격히 정렬된 특수 목적 모델을 선별적으로 도입하는 멀티 모델 파이프라인 구성이 필수가 되었습니다. 셋째, 모델이 자율적으로 사고 단계를 늘리는 고강도 추론 방식이 도입됨에 따라, 개발자는 응답 지연 시간과 비용, 정확도 간의 상충 관계(Trade-off)를 모니터링하고 제어하는 전략적 설계 역량을 갖추어야 합니다.

Belegte Zahlen

Unsere Einschätzung

단순 프롬프트 입력 중심의 LLM 활용은 끝나고, 모델이 스스로 필요한 구간을 탐색하고 도구를 호출하는 에이전틱 시스템이 표준으로 자리잡고 있습니다. 특히 독점 모델의 내부 구조는 블랙박스화되는 반면 API 인터페이스의 자율성은 극대화되고 있어, 기업은 아키텍처 구현보다 오케스트레이션과 TCO 최적화에 집중해야 합니다.

Offene Fragen

Erwähnte Modelle

AnbieterEingabeAusgabeKontextfenster
Google: Gemini 3.7 Flash · Google$0.75$3.751,048,576
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

Quelle

Zurück zum Katalog