동적 에이전트와 도메인 특화 모델의 결합

구글 딥마인드가 비디오 처리 토큰을 최대 88% 절감하는 에이전틱 비디오 이해 기술과 함께 소프트웨어 엔지니어링 및 보안에 특화된 Gemini 3.8 Flash 라인업, 실시간 음성 모델 Gemini 3.5 Transcribe를 일제히 공개했습니다. 이와 동시에 오픈소스 생태계에서는 모델 아키텍처를 역설계하여 실질적 구현 원리를 파악하려는 엔지니어링 워크플로우가 정립되고 있습니다. AI 시스템은 이제 단순 텍스트 생성을 넘어 영상·음성·사이버 보안 전 영역에서 능동적인 도구 호출과 세부 탐색을 자율적으로 수행하는 실행형 에이전트 구조로 전면 전환되고 있습니다.

정적 분석에서 자율적 탐색으로: 에이전틱 비디오 이해의 등장

기존의 멀티모달 모델은 동영상을 처리할 때 고정된 초당 프레임 수(FPS, 기본 1 FPS)로 전체 영상을 순차 입력받는 정적(Static) 방식을 사용했습니다. 이 방식은 90분 이상의 강의나 수 시간 분량의 녹화본과 같은 장기 영상(Long-form video)을 처리할 때 치명적인 단점을 노출했습니다. 중요한 세부 정보를 유지하기 위해 막대한 토큰 비용을 지불하거나, 비용을 낮추기 위해 프레임 간격을 넓혀 핵심 장면을 놓치는 양자택일의 구조였습니다.

구글 딥마인드가 공개한 에이전틱 비디오 이해(Agentic Video Understanding) 기능은 모델이 능동적으로 비디오 도구를 호출하여 시각 프레임, 오디오, 텍스트 전사 데이터를 동적으로 탐색하고 검사하는 구조로 전환했습니다.

  1. 비디오 입력 수신
  2. 전사·오디오·프레임 동적 스캔
  3. 의심/핵심 구간 식별
  4. 고해상도·고FPS 리샘플링
  5. 최종 질의 응답 도출

이 기술은 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite 모델에 적용되었으며, Google AI Studio 및 Gemini Enterprise Agent Platform에서 API 설정을 'agentic'으로 지정하여 즉시 사용할 수 있습니다. 개발자가 수동으로 구축하던 비디오 샘플링 루프를 모델 내부 에이전트 루프로 대체함으로써 다음과 같은 정량적 성과를 달성했습니다.

이 기능은 서브세컨드(Sub-second) 순간 검색, 다중 시간대 이상 탐지(Anomaly detection), 고속 반복 동작 및 객체 카운팅 등의 고난도 태스크에 최적화되었습니다.

---

도메인 전문성과 자율 추론을 장착한 Gemini 3.8 시리즈

비디오 처리의 효율화와 더불어, 구글은 장기 추론과 전문 영역 작업을 자율적으로 완수하는 Gemini 3.8 Flash 및 Gemini 3.8 Flash Cyber를 출시했습니다. Gemini 3.7 Flash 공개 3주 만에 등장한 이번 모델은 6주 만에 출시된 세 번째 Flash 계열입니다.

Gemini 3.8 Flash는 백만 토큰당 입력 $0.75, 출력 $3.75라는 기존 3.7 Flash와 동일한 가격 구조를 유지하면서도 코딩과 다단계 추론 성능을 대폭 끌어올렸습니다. 특히 소프트웨어 엔지니어링 벤치마크인 DeepSWE v1.1에서 대형 프론티어 모델들을 능가하는 자율 문제 해결력을 기록했으며, 과학·인문·전문 지식을 아우르는 HLE-Verified 벤치마크에서 54.9%의 점수를 획득했습니다.

모델명입력 가격 ($/1M)출력 가격 ($/1M)핵심 특화 영역주요 벤치마크 지표
Gemini 3.8 Flash$0.75$3.75소프트웨어 엔지니어링, 복합 추론HLE-Verified 54.9%, DeepSWE v1.1 우수
Gemini 3.8 Flash Cyber비공개 (신뢰 방어자 대상)비공개취약점 탐지 및 자동 패치CWE-Bench pass@1 47.2%, 20개 언어 탐지율 >70%

"3.8 Flash의 성능 향상은 핵심 설계 선택에서 비롯됩니다. 이 모델은 더 열심히 일합니다(3.8 Flash works harder). 복잡한 작업에서 추가 추론 단계를 실행하고 도구를 반복 호출하는 끈기(diligence)를 발휘합니다."

Gemini 3.8 Flash Cyber는 공격용 익스플로잇 개발이 아닌 취약점 수정 및 방어 역량에 우선순위를 둔 보안 특화 모델입니다. 20개 이상의 프로그래밍 언어로 구성된 내부 코드베이스 벤치마크에서 70% 이상의 취약점 탐지 성공률을 기록했습니다. Collinear가 주관하는 CWE-Bench 패치 평가에서는 선도 프론티어 모델(47.8%)에 근접한 47.2%의 pass@1을 기록했습니다.

실제 프로덕션 적용 결과에서도 Chrome 보안팀 테스트에서 기존 상용 대형 모델 대비 2.6배 많은 정상 보안 패치를 생성했으며, Wiz의 내부 침투 테스트에서 타 프론티어 모델 대비 비용은 2.3~5.2배 낮추면서 재현율(Recall)을 7.5~9.7% 향상시켰습니다. 구글 클라우드 취약점 연구팀은 수개월이 소요되던 중대 기반 취약점을 2시간 이내에 발견하는 성과를 거두었습니다.

---

음성 인터페이스의 지능화: Gemini 3.5 Transcribe의 다중 모달 통합

에이전틱 시스템의 입력단에서는 오디오를 단순 텍스트로 바꾸는 것을 넘어 화자의 의도와 문맥을 파악해 정제하는 Gemini 3.5 Transcribe가 추가되었습니다. 이 모델은 잡음 제거 및 말실수 교정(Disfluency cleanup)을 자체 처리하며, 백그라운드에서 다른 Gemini 모델을 함수 호출(Function calling)로 연계합니다.

인공지능 벤치마크 기관 Artificial Analysis 측정 결과, Gemini 3.5 Transcribe는 스트리밍 모드에서 4.0%, 비스트리밍 모드에서 2.6%의 평균 단어 오류율(WER)을 기록했습니다. 이전 세대 음성 모델인 Chirp 3 대비 최종 전사까지 걸리는 시간(Time to final transcription)을 70% 단축시켰습니다.

Gemini 3.5 Transcribe5.50
Chirp 37.20

Gemini 3.5 Transcribe는 두 가지 개별 API 엔드포인트로 배포됩니다.

85개 이상의 언어 및 방언을 자동 감지하며, 우편번호나 주문 번호 같은 영숫자 개체와 도메인 특화 용어집(Custom vocabulary)을 정확히 인식하도록 설계되었습니다.

---

모델의 블랙박스를 해체하는 엔지니어링 워크플로우

상용 API 모델들이 자율 도구 호출과 에이전트 루프로 블랙박스화되는 동안, 오픈 가중치(Open-weight) 모델 생태계에서는 모델 아키텍처의 실제 작동 원리를 규명하려는 엔지니어링 분석 방법론이 주목받고 있습니다. AI 연구자 세바스찬 라슈카(Sebastian Raschka)는 최근 산업계 연구소가 공개하는 기술 보고서(Technical Report)의 세부 정보가 과거보다 축소되는 경향에 대응하는 아키텍처 분석 절차를 정리했습니다.

라슈카는 독점적 API 모델(ChatGPT, Claude, Gemini 등)과 달리 가중치가 공개된 모델의 경우 기술 문서의 모호함을 코드 레벨에서 직접 검증해야 한다고 강조합니다. Hugging Face Model Hub에 업로드된 `config.json` 설정 파일과 트랜스포머 라이브러리의 참조 구현체(Reference implementation) 소스코드를 직접 대조 검증하는 수작업(Manual) 워크플로우입니다.

기술 보고서의 서술에만 의존하지 않고 실제 실행 가능한 소스코드를 단계별로 역추적하여 레이어 구조, 어텐션 헤드 수, 활성화 함수, 정규화 방식을 도출하는 이 과정은 새로운 오픈 모델을 자체 인프라에 최적화하여 배포하려는 엔지니어들에게 필수적인 리버스 엔지니어링 기초로 평가받고 있습니다.

---

통합 분석: 에이전틱 루프 중심의 AI 인프라 재편

이번에 공개된 기술들은 AI 시스템의 패러다임이 단일 LLM 중심의 단순 텍스트 프롬프팅에서 '특화 도구와 연계된 다중 에이전트 루프'로 완전히 전환되었음을 보여줍니다.

Gemini 3.8 Flash가 고정밀 코딩 및 추론에서 더 많은 반복 단계(Iterative reasoning)를 스스로 밟고, Gemini 3.8 Flash Cyber가 20개 프로그래밍 언어를 넘나들며 능동적으로 취약점을 격리·패치하는 구조는 모델의 역할이 단순 생성이 아닌 '자율적 문제 해결사'로 진화했음을 의미합니다. 비디오와 오디오 영역 역시 모델이 필요한 순간에만 데이터를 샘플링하거나 함수 호출을 트리거하는 에이전틱 컨트롤러로 작동하고 있습니다.

결과적으로 향후 AI 시스템 구축의 핵심 경쟁력은 대형 단일 모델의 파라미터 크기보다, 비디오·음성·보안 등 각 모달리티에서 동적 도구를 효율적으로 오케스트레이션하여 토큰 낭비를 최소화하고 단위 작업 완수율을 극대화하는 에이전트 아키텍처 설계 역량에 집중될 것입니다.

已核实数据

我们的观点

빅테크 기업들이 모델의 기본 추론 성능 경쟁을 넘어 멀티모달 처리 효율과 도메인 특화 에이전트 루프의 완성도를 상용화의 핵심 무기로 삼기 시작했습니다. 향후 엔터프라이즈 AI 시장의 판도는 파라미터 규모 중심의 경쟁에서 벗어나 작업 완수율당 컴퓨팅 비용을 극적으로 낮추는 에이전틱 오케스트레이션 능력에 의해 결정될 것입니다.

尚未确认

文中提及的模型

供应商输入输出上下文窗口
Google: Gemini 3.7 Flash · Google$0.75$3.751,048,576
Google: Gemini 3.8 Flash · Google$0.75$3.751,048,576

来源

返回目录