텍스트 번역을 넘어선 '원시 오디오 지능'으로의 전환
기존 음성 인식 시스템은 오디오를 텍스트로 변환(STT)하고, 텍스트를 처리한 뒤 다시 음성으로 합성(TTS)하는 경직된 다단계 파이프라인 구조를 고수해 왔습니다. 이러한 방식은 기능적으로는 동작하지만 억양, 호흡, 말의 빠르기, 감정선, 그리고 문맥과 같은 인간 소통의 본질적인 요소를 손실시켰습니다.
- 다단계 파이프라인 (Audio→Text→Audio)
- 엔드투엔드 원시 오디오 처리
- 감정·어조·코드스위칭 동시 파악
구글은 텍스트 전사 중심 모델에서 탈피하여 오디오 자체를 직접 입력받아 소리와 화자의 의도를 동시에 이해하는 네이티브 오디오 인텔리전스로 모델 아키텍처를 전면 전환했습니다. Gemini 3.5 Live Translate는 70개 언어와 2,000개 이상의 언어 쌍에 걸쳐 실시간 구화 번역을 제공하며, 스팽글리시(Spanglish)나 힌글리시(Hinglish)처럼 문장 중간에 여러 언어가 혼용되는 코드 스위칭(Code-switching)과 감정적 신호를 자연스럽게 처리합니다.
함께 도입된 Gemini 3.5 Transcribe는 소음이 심한 환경이나 복잡한 전문 용어가 포함된 음성을 정제된 서식의 텍스트로 변환합니다. 이는 안드로이드 Gboard의 'Rambler' 기능에 적용되어 추임새 제거, 문법 및 구두점 자동 교정, 음성 명령 기반 재작성 및 언어 간 전환을 지원합니다.
"기술은 인간의 표현 스펙트럼을 좁히는 것이 아니라 확장해야 합니다. 언어 기술의 궁극적인 목표는 단순한 규모 확장이 아니라 문맥을 파악하고 문화를 존중하는 깊이와 풍부함에 있습니다."
---
1,000개 언어 이니셔티브와 글로벌 저자원 언어 데이터 수집
현재 구글의 기술 및 제품은 300개 이상의 언어에서 일상적 상호작용을 지원하며, 이는 전 세계 인구의 86%에 해당하는 70억 명 이상을 포괄합니다. 구글 번역은 2006년 출시 초기 소수 언어로 시작해 현재 250개 이상의 언어를 지원하는 수준으로 확장되었습니다.
구글은 여기서 더 나아가 세계에서 가장 많이 사용되는 1,000개 언어를 지원하기 위한 1,000 Languages Initiative를 가동하고 있습니다. 이를 구체화하기 위해 1,200만 시간의 오디오 데이터로 훈련된 Universal Speech Model(USM)을 투입하여 교차 언어 전이 학습(Cross-lingual transfer learning)을 적용하고 있습니다. 이를 통해 데이터가 풍부한 주요 언어에서 학습된 패턴을 데이터가 부족한 저자원 언어로 전이시켜 음성 인식 품질을 개선합니다.
| 오픈 데이터 프로젝트 | 주요 파트너십 | 데이터 규모 및 커버리지 | 핵심 특징 |
|---|---|---|---|
| WAXAL | Makerere University, Digital Umuganda | 26개국 이상, 27개 서아프리카 언어 (1억 명 이상 사용) | 성조 변화 및 대화 리듬 보존 |
| Project Vaani | 인도과학원(IISc), Bhashini | 109개 언어, 15만 5천 명 이상 화자, 3만 시간 이상 음성 | 언어 기준이 아닌 지역 앵커링 방식 수집 |
| Amplify Initiative | 브라질 UFMG, 인도 IIT Kharagpur 등 20개 대학 | 4개 대륙, 1,600명 이상 현지 전문가, 15,000개 멀티모달 데이터 | 지역 고유의 문화적 뉘앙스 캡처 |
오픈소스 생태계 조성을 위해 구글은 7,000개 이상의 구화, 문자, 수어를 매핑하는 세계 최대 오픈소스 언어 데이터 리포지토리 'LinguaMeta'를 시각화한 대화형 도구 Language Explorer를 함께 공개했습니다.
---
엣지 인프라와 피처폰 환경을 겨냥한 AI 포용성 기술
전 세계적으로 30억 명 이상이 여전히 안정적인 인터넷 연결을 확보하지 못하고 있습니다. 이에 대응하여 구글은 제미나이 아키텍처를 기반으로 경량화된 55개 언어 지원 오픈 번역 모델군인 TranslateGemma를 개발했습니다. 이 모델은 온디바이스에서 독립적으로 구동되어 클라우드나 인터넷 연결 없이도 높은 번역 성능을 보장합니다.
또한 고성능 연산 하드웨어가 없는 저개발 지역의 피처폰 사용자 수억 명을 연결하기 위해 Viamo와 파트너십을 체결했습니다. 양사는 대화형 음성 응답(IVR) 기반의 'Ask Viamo Anything(AVA)' 서비스를 구축했습니다. 르완다에서 진행된 시범 사업을 통해 피처폰 사용자가 음성 인터페이스로 제미나이에 질문하고 답변을 받은 횟수는 이미 200만 건을 넘어섰습니다.
접근성 개선을 위한 인터페이스 혁신도 이어졌습니다.
- Sign Language-to-Text (SL2T): 50개 이상의 수어를 학습한 모델로, Pixel 11의 Gboard 및 Live Transcribe 기능에 탑재되어 미국 수어(ASL)를 텍스트로 변환하는 기능을 지원합니다.
- 지역 고유 발음 보정: 뉴질랜드 마오리 언어 전문가와 협업하여 현지 지명의 고유 발음을 텍스트-음성 변환(TTS) 모델에 직접 통합함으로써 문화적 정체성을 반영했습니다.
---
위성 및 AI 기반 실시간 자연재해 예측 인프라
AI의 사회적 영향력 확장은 언어 영역을 넘어 물리적 재난 예측으로 확대되고 있습니다. Google Research와 Google DeepMind는 위성 데이터와 AI 모델을 결합한 환경 예측 시스템을 구축했습니다.
- 산불 조기 감지: 인공위성 데이터와 AI 비전 모델을 결합하여 전 세계를 20분 주기로 스캔하며, 차량 한 대 크기의 초기 산불까지 실시간으로 식별합니다.
- 홍수 예측: 'Flood Hub' 및 'Groundsource' 기술을 통해 수문학적 데이터를 모델링하여 글로벌 침수 위험을 사전에 경고합니다.
- 열대성 저기압(사이클론) 경로 예측: DeepMind의 기상 예측 신경망을 활용해 기존 기상 모델보다 더 빠른 시점에 경보를 발령할 수 있도록 지원합니다.
---
AI & Economy ATLAS: 직무별 글로벌 도입 격차와 생산성 병목
구글은 실시간 글로벌 AI 도입 지표를 측정하는 대화형 공개 플랫폼인 AI & Economy ATLAS v1.0을 발표하고, 직업군별 및 국가별 도입 패턴을 분석한 데이터를 공개했습니다.
| 분석 축 | 세부 지표 및 국가별 현황 | 통계적 특이점 |
|---|---|---|
| 인도 크리에이티브 산업 | 예술, 디자인, 미디어 직군의 업무용 AI 사용 비중: 19% | 글로벌 평균 대비 1.6배 높은 수준 |
| 미국 기술 직군 | 컴퓨터 및 수학 관련 직군의 업무용 AI 사용 비중: 30% | 기타 국가 평균 점유율의 2배 수준 |
| 물리적 작업 진단 | 실시간 장비 진단 및 문제 해결: 브라질 및 독일 7%, 일본 4% | 브라질·독일은 글로벌 평균 대비 1.4배 |
| 소득 수준 대비 도입률 | 1인당 GDP 예측치보다 높은 도입률을 기록한 국가 | 브라질, UAE가 대표적 예외 국가로 분류 |
Google, Google DeepMind, MIT FutureTech가 공동으로 수행한 연구(미국 및 영국 과학자 600명 이상 설문 조사와 2,600개 특화 AI 모델 분석)에 따르면, 과학자들은 타 직군 대비 높은 AI 도입률을 보이며 조사 대상의 절반 가까이가 매일 AI를 활용하고 있는 것으로 나타났습니다.
연구에 참여한 과학자들은 AI를 통해 주당 약 7시간 미만(just below seven hours)의 시간을 절감했다고 보고했습니다. 범용 대규모 언어 모델(LLM)은 전반적인 가설 수립 및 텍스트 작업에 폭넓게 쓰이는 반면, 특화 AI 모델은 보건·생명과학의 데이터 예측, 분자 구조 생성, 시뮬레이션 등에 집중적으로 활용되고 있습니다.
그러나 생산성 향상이 즉각적인 과학적 발견의 증가로 이어지지는 않았습니다. AI가 생성한 가설과 결과물을 검증하는 데 상당한 시간이 소요되고 있으며, 물리적 실험실 실험 및 임상 검증 단계에서 처리 능력을 초과하는 가설 백로그(Hypothesis Backlog) 병목 현상이 발생하고 있습니다.
---
최고 수준 경제학자 영입을 통한 거시경제 연구 체계 구축
구글은 기술 확산에 따른 노동 시장 재편과 생산성 변화를 실증 분석하기 위해 'AI & Economy' 연구 프로그램을 확대 개편했습니다. 2025년 노벨 경제학상 수상자인 필립 아기옹(Philippe Aghion) INSEAD 및 콜레주 드 프랑스 교수가 학술 자문역으로 합류하여 혁신 주도 성장 및 창조적 파괴 이론을 기반으로 거시경제적 AI 경로를 모델링합니다.
토론토 대학교 로트먼 경영대학원의 아제이 아그라왈(Ajay Agrawal) 교수가 방문 연구원으로 합류하여 데이비드 오터(David Autor) MIT 경제학과 교수와 공동 연구를 진행합니다. 또한 맥킨지 글로벌 연구소(MGI) 출신의 아누 마드가브카(Anu Madgavkar)와 유펜 와튼스쿨의 대니얼 락(Daniel Rock) 교수가 프로그램 디렉터로 임명되어 프론티어 모델 텔레메트리 데이터와 계량경제학을 결합한 기업 생산성 및 노동 시장 재편 실증 연구를 이끌게 됩니다.