요약:
Google은 오늘 네이티브 엔드투엔드 음성 상호작용 분야의 최신 혁신을 공식 발표하여 어려운 작업에 맞게 맞춤화된 차세대 실시간 음성 대형 모델 Gemini 3.8 Live 및 Gemini 3.8 Live Extended Thinking을 출시했습니다.

이 두 모델은 Google의 기본 오디오-오디오 기술 시스템에서 큰 도약을 나타냅니다. 실시간 대화 지연과 자연스러움을 새로운 차원으로 끌어올릴 뿐만 아니라 최초로 지연 시간이 짧은 음성 스트림에서 깊은 다단계 추론 기능을 달성하여 복잡한 전문 시나리오에서 음성 AI의 애플리케이션 패러다임을 완전히 바꿉니다.

이전의 주류 음성 상호작용 아키텍처에서 AI 시스템은 일반적으로 '빠른 응답의 얕은 대화'와 '장기적이고 깊은 사고' 사이에서 절충안을 찾아야 했습니다. 어려운 문제에 직면하면 사용자는 오랜 시간 동안 조용히 기다려야 하는 경우가 많습니다. Google이 출시한 Gemini 3.8 Live는 초고속 대화와 일일 스트리밍 상호 작용 경험을 최적화하는 데 중점을 둡니다. 보다 민감한 억양 변동, 자연스러운 중단 및 상황 이해 기능을 통해 매우 부드럽고 인간 수준의 실시간 음성 통신을 사용자에게 제공할 수 있습니다. 이를 기반으로 출시된 Gemini 3.8 Live Extended Thinking은 매우 복잡한 비즈니스 흐름을 위해 근본적으로 업그레이드되었습니다. 이 모델은 AI가 백그라운드에서 "말하는 대로 생각"(말하는 대로 생각)할 수 있는 기능을 제공하므로 시스템이 어려운 문제에 직면했을 때 대화 리듬을 갑자기 중단할 필요 없이 실시간 일관된 대화를 유지하면서 백그라운드에서 복잡한 다단계 논리 분해, 코드 디버깅 또는 기술 진단을 동시에 수행할 수 있습니다.

실용적인 적용 측면에서 차세대 Live 시리즈 모델은 음성 비서의 서비스 범위를 크게 확장할 것입니다. 일상적인 자연스러운 대화 외에도 Gemini 3.8 Live 및 확장 추론 버전은 실시간 단계 문제 해결, 복잡한 수학적 파생, 실시간 외국어 동시 학습, 다중 작업 스트리밍 명령 실행 등 지적 요구가 높은 시나리오에서 이전 버전보다 훨씬 더 나은 성능을 보여 여러 다중 모드 및 음성 추론 업계 벤치마크에서 1위를 차지했습니다.
Google은 개발자와 기업 사용자를 위해 앞으로 Gemini API와 Google AI Studio를 통해 관련 모델 기능을 공식적으로 공개할 것이라고 발표했습니다. 개발자는 지연 시간이 매우 짧은 이 기본 오디오 API 인터페이스를 직접 호출하여 지능형 하드웨어, 고객 서비스, 실시간 프로그래밍 지원 및 협업 사무실과 같은 제품 형태의 고차 추론 기능을 갖춘 차세대 전이중 음성 에이전트 서비스를 신속하게 구축할 수 있습니다.
댓글