음성 AI 단가 파괴와 플래시 멀티모달 전쟁의 서막

빅테크 간 실시간 음성 인식(STT) 시장의 단가 인하 경쟁이 본격화되며 마이크로소프트와 메타가 파격적인 가격대의 신규 전사 모델을 선보였습니다. 마이크로소프트의 MAI-Transcribe-2는 시간당 0.10달러, 메타의 Muse Voice Transcribe는 화자 분리를 포함해 시간당 0.18달러에 공급됩니다. 동시에 구글 딥마인드는 Gemini 3.8 Flash 및 사이버 보안 특화 모델, Gemini Omni 1.1 Flash를 공개하며 초저지연 경량 멀티모달 생태계 확장에 나섰습니다.

빅테크 음성 AI 가격 파괴: 시간당 10센트 시대 진입\n\n엔터프라이즈 AI 시장의 핵심 접점인 음성 인식(Speech-to-Text) 인프라에서 급격한 단가 하락이 진행되고 있습니다. 마이크로소프트 AI는 기존 대비 72% 인하된 시간당 0.10달러(약 130원) 수준의 MAI-Transcribe-2를 발표했습니다. 불과 5개월 전 자사 전사 모델 가격이 시간당 0.36달러였던 점을 감안하면 이례적인 파격 인하입니다. 10만 시간 규모의 콜센터 오디오를 처리하는 엔터프라이즈 기업 기준 연간 전사 비용을 3만 6천 달러에서 1만 달러 수준으로 대폭 절감할 수 있게 되었습니다.\n\n메타 역시 Superintelligence Labs를 통해 실시간 스트리밍 전사와 엔드포인트 감지, 20인 이상 화자 분리(Diarization)를 지원하는 Muse Voice Transcribe를 시간당 0.18달러에 출시했습니다. 단순 전사를 넘어 다자간 회의 환경을 겨냥한 실시간 파이프라인 가격을 급격히 낮추며 오픈AI Whisper 중심 시장을 강력히 위협하고 있습니다.\n\n## 구글 딥마인드의 대응: Flash 라인업과 인텔리전트 전사\n\n구글 딥마인드는 Gemini 3.5 Transcribe를 통해 단순 변환을 넘어 지능형 맥락 분석이 결합된 전사 솔루션을 강화했습니다. 이와 더불어 Gemini 3.8 Flash와 보안 도메인 특화 모델인 Gemini 3.8 Flash Cyber, 세밀한 제어력을 제공하는 Gemini Omni 1.1 Flash를 연속 배치했습니다. 이는 경량 고속 추론 모델(Flash) 영역에서 비용 효율과 특화 보안성, 정밀한 멀티모달 인터페이스 제어력을 앞세워 빅테크 경쟁 구도에서 주도권을 방어하려는 전략적 포석입니다.\n\n## So What? 산업과 인프라에 미치는 파급 효과\n\n1. 음성 데이터 인프라의 TCO 급감: 대규모 음성 데이터를 수집·가공하는 컨택센터, 미디어, 핀테크 산업에서 오디오 파이프라인 구축 비용이 과거 대비 최대 80% 이상 절감됩니다.\n2. 실시간 온프레미스/클라우드 하이브리드 가속화: 초저지연 Flash 모델과 실시간 STT 파이프라인의 결합으로 실시간 AI 에이전트(Voice Agent) 구축 진입장벽이 완전히 허물어지고 있습니다.\n3. 도메인 특화 경량화 경쟁 격화: 범용 대형 모델(LLM) 경쟁에서 실시간 멀티모달 제어 및 사이버 보안 특화 경량 모델(Flash Cyber 등)로 전선이 이동하고 있습니다.

来源

返回目录