텍스트에서 네이티브 오디오로: 언어 AI 패러다임의 전환
구글은 기존 음성 인식 파이프라인의 구조적 한계를 극복하고 모델이 음성과 의도를 직접 처리하는 네이티브 오디오 인텔리전스 체계로 전환했습니다. 기존 음성 파이프라인은 '음성 인식(STT) → 텍스트 처리 → 음성 합성(TTS)'의 다단계 방식을 취했으나, 이 과정에서 발화자의 억양, 호흡, 감정, 문맥 정보가 소실되는 문제가 존재했습니다.
- 원시 오디오 입력
- Gemini 네이티브 오디오 인텔리전스
- 톤·감정·코드 스위칭 분석
- 실시간 맥락화 번역/변환
이러한 구조적 혁신을 바탕으로 구글은 다음과 같은 구체적 기술을 공개하고 서비스에 적용했습니다.
- Gemini 3.5 Live Translate: 70개 언어 및 2,000개 이상의 언어 쌍(Language pairs)에 걸쳐 실시간 대화 번역을 지원하며, 한 문장 안에서 여러 언어를 섞어 쓰는 코드 스위칭(Code-switching)과 감정적 신호를 자연스럽게 포착합니다.
- Gemini 3.5 Transcribe: 소음이 심한 환경이나 전문 용어가 포함된 음성을 정제된 텍스트로 변환하는 음성-텍스트 변환 모델입니다.
- Rambler 기능: 안드로이드 Gboard에 탑재되어 음성 입력 시 불필요한 추임새를 제거하고 문법과 문장 부호를 자동 보정합니다.
- TranslateGemma: 온디바이스(On-device) 구동을 목표로 제미나이를 기반으로 개발된 경량 오픈 번역 모델군으로, 55개 언어로 학습되어 인터넷 연결 없이도 고품질 번역을 수행합니다.
| 모델 / 솔루션 명칭 | 주요 특징 및 지원 범위 | 구동 환경 |
|---|---|---|
| Gemini 3.5 Live Translate | 70개 언어, 2,000+ 언어 쌍 지원, 코드 스위칭 및 감정 인식 | 클라우드 기반 |
| Gemini 3.5 Transcribe | 소음 환경 정밀 전사, Gboard Rambler 기능 탑재 | 클라우드/OS 연동 |
| TranslateGemma | 55개 언어 학습 완료, 오프라인 독립 구동 지원 | 온디바이스 (경량) |
| Universal Speech Model (USM) | 1,200만 시간 오디오 학습, 전이 학습 적용 | 기반 연구 모델 |
"기술은 인간의 표현 스펙트럼을 좁히는 것이 아니라 확장해야 합니다. 규모를 넘어 맥락을 이해하고 문화를 존중하는 시스템을 구축하는 것이 궁극적인 목표입니다."
1,000개 언어 이니셔티브와 글로벌 오픈 데이터 파트너십
구글은 전 세계에서 가장 많이 사용되는 1,000개 언어를 AI로 지원하기 위한 '1,000 Languages Initiative'를 가속화하고 있습니다. 웹상에 데이터가 풍부한 지배적 언어와 달리 자원이 부족한 언어(Low-resource languages)의 격차를 해소하기 위해 1,200만 시간 분량의 오디오로 사전 학습된 Universal Speech Model(USM)과 교차 언어 전이 학습(Cross-lingual transfer learning) 기술을 결합했습니다.
또한 디지털 데이터가 부족한 지역의 언어를 학습시키기 위해 현지 학술 기관 및 커뮤니티와 협력하는 오픈 데이터 구축 프로젝트를 추진 중입니다.
- WAXAL: 마케레레 대학교(Makerere University), 디지털 우무간다(Digital Umuganda)와 협력하여 사하라 이남 아프리카 26개국 이상, 1억 명 이상이 사용하는 27개 언어의 대규모 음성 데이터셋을 구축했습니다.
- Project Vaani: 인도과학원(IISc), 바시니(Bhashini)와 협력하여 언어 중심이 아닌 지역 기반 접근 방식을 채택, 15만 5,000명 이상의 화자로부터 109개 언어에 걸친 3만 시간 이상의 음성 데이터를 수집했습니다.
- Amplify Initiative: 4개 대륙 20개 대학 및 1,600명 이상의 현지 전문가와 협력하여 지역적 뉘앙스를 반영하는 1만 5,000개의 멀티모달 데이터 포인트를 확보했습니다.
- Language Explorer: 7,000개 이상의 음성, 문자, 수어를 지속적으로 매핑하는 오픈소스 언어 데이터 리포지토리 'LinguaMeta'를 시각화한 인터랙티브 도구입니다.
저사양 환경과 접근성을 위한 물리적 장벽 해소
안정적인 인터넷 접속이 불가능한 30억 명 이상의 사용자 및 저사양 피처폰 사용자를 위한 기술 배포 전략도 구체화되었습니다.
- 피처폰 음성 비서 'AVA' 지원: 비아모(Viamo)와 협력하여 Gemini 기반 대화형 음성 응답(IVR) 서비스 'Ask Viamo Anything'을 피처폰 환경에 배포했습니다. 르완다 파일럿을 통해 200만 건 이상의 질의에 답변을 제공했습니다.
- Sign Language-to-Text (SL2T): 50개 이상의 수어를 기반으로 학습된 수어-텍스트 변환 기술로, Pixel 11의 Gboard 및 Live Transcribe 기능에 미국 수어(ASL)를 영어로 변환하는 받아쓰기 형태로 최초 도입되어 전 세계 7,000만 수어 사용자의 접근성을 개선합니다.
- 문화적 발음 보정: 뉴질랜드 마오리족 언어 전문가와 협력하여 Google 지도 내 지명 발음을 교정하는 등 텍스트-음성 변환 모델에 문화적 고유성을 직접 반영했습니다.
AI & Economy 연구팀 확장: 거시경제학적 파급효과 정밀 측정
구글은 AI가 노동 시장, 생산성, 기술 확산에 미치는 영향을 데이터 기반으로 분석하기 위해 'AI & Economy ATLAS v1.0'을 론칭한 데 이어 세계적 경제학자들을 대거 영입하여 연구 조직을 확대했습니다.
- 필립 아기옹 (Philippe Aghion): 2025년 노벨 경제학상 수상자이자 INSEAD 및 콜레주 드 프랑스 교수로, 혁신 주도 성장 및 창조적 파괴 이론을 바탕으로 AI의 장기 거시경제 경로 모델링에 참여합니다.
- 아제이 아그라왈 (Ajay Agrawal): 토론토 대학교 로트만 경영대학 교수이자 펠로우로 참여하여 AI와 과학적 발견의 경제학, 로보틱스 분야 연구를 담당합니다.
- 아누 마드가브카 (Anu Madgavkar): 전 맥킨지 글로벌 연구소(MGI) 파트너 출신으로, 생성형 AI가 노동력에 미치는 영향과 소상공인 생태계 및 글로벌 AI 확산 실증 연구를 총괄합니다.
- 대니얼 록 (Daniel Rock): 유펜 와튼스쿨 교수 출신으로, 프론티어 모델 원격 측정(Telemetry) 데이터와 계량경제학을 결합하여 기업 생산성과 노동 구조 조정을 분석합니다.
이 팀은 구글 딥마인드의 AGI 경제학 디렉터 알렉스 이마스(Alex Imas), 수석 이코노미스트 사무국의 잔나 이센코(Zanna Iscenko)와 함께 `ai.google/economy` 플랫폼을 기반으로 실시간 데이터와 연구 보고서를 지속 발표할 예정입니다.
과학적 발견과 자연재해 예측 시스템의 실전 배치
구글 리서치 및 구글 딥마인드는 AI 모델을 이론 연구 단계에서 벗어나 인명 구조 및 재해 완화 도구로 전환하고 있습니다.
- 산불 조기 감지: 위성 영상과 AI를 결합하여 20분 주기로 전 세계를 스캔하고, 차량 1대 크기(Car-sized)의 소규모 산불 발화를 초기 단계에서 식별하는 시스템을 개발 중입니다.
- 열대성 저기압 및 기상 예측: 딥마인드의 기상 예측 모델을 통해 사이클론의 이동 경로와 강도를 조기에 경보할 수 있는 시스템을 구축했습니다.
- 홍수 예측 플랫폼: Flood Hub 및 Groundsource 기술을 결합하여 강 수위와 홍수 위험을 조기에 예측하고 취약 지역 사회에 실시간 정보를 제공하고 있습니다.
인간 중심 스토리텔링: Future Vision XPRIZE 결과
기술의 정서적·사회적 가치를 조명하기 위해 XPRIZE 및 Range Media Partners와 공동 추진한 'Future Vision XPRIZE' 글로벌 영상 공모전 결과가 발표되었습니다. 전 세계 2,500개 이상의 출품작 중 독립 영화 제작자 제프 신세사이즈드(Jeff Synthesized)의 작품 The Gifted가 최종 대상 수상작으로 선정되었습니다.
이 작품은 11세 소년이 세상을 떠난 어머니의 목소리와 본질을 코드로 재현하고, 이것이 마을 전체를 돌보는 네트워크로 확장되는 이야기를 담고 있습니다. 수상자에게는 상금 10만 달러와 함께 장편 영화 제작비 250만 달러가 지원되며, 구글의 '100 ZEROS' 이니셔티브를 통해 정식 장편 영화로 상용화될 예정입니다.