Google, AI에게 실시간 영상 얼굴을 제공하는 Gemini 3.8 Live Live Avatar 디지털 인간 상호 작용 기능 출시

📅 2026-09-25

요약:

Google은 Gemini Enterprise 엔터프라이즈 플랫폼에 '라이브 아바타'(실시간 디지털 휴먼) 기능을 공식 출시했다고 발표했습니다. 이 기술은 Google의 최신 Gemini 3.8 Live 대형 모델 아키텍처와 긴밀하게 통합되어 있습니다. 독창적인 제로에 가까운 지연과 매우 부드러운 음성 대화를 기반으로 실시간에 가까운 생성 비디오 생성 기능을 최초로 도입하여 대화형 인공 지능이 "동시에 듣고, 보고, 말할 수 있는" 역동적인 시각적 이미지를 가질 수 있도록 합니다.

공식 소개에 따르면 Gemini 3.8 Live Live Avatar는 기업 고객을 위해 보다 직관적이고 몰입도가 높은 가상 서비스 도우미를 만들도록 설계되었습니다. 오디오 스트림을 기본 비디오 생성 모델과 정확하게 동기화함으로써 시스템은 고정밀 립싱크, 자연스러운 표정 변화 및 원활한 언어 간 대화 변환을 달성할 수 있습니다. 현재 디지털 휴먼 시스템은 기본적으로 최대 97개 언어를 지원하며, 대화 중에 언어를 전환할 때 영상 왜곡이나 얼굴 드리프트가 발생하지 않습니다.

이 플랫폼은 시각적 혁신 외에도 강력한 비동기 도구 호출 기능도 갖추고 있습니다. 디지털 휴먼은 사용자와 자연스럽고 일관된 대화를 유지하면서 백그라운드에서 다양한 외부 API 및 엔터프라이즈 데이터 인터페이스를 자동으로 호출하여 호텔 체크인 등록, 보험 청구서 작성 등 복잡한 다단계 비즈니스를 처리할 수 있습니다. 이는 과거 AI가 백그라운드 작업을 처리할 때 발생했던 "충돌" 또는 오랜 침묵의 대기 현상과 완전히 작별합니다. 동시에 디지털 휴먼은 단말 장치의 카메라 및 화면 공유 기능과 결합하여 사용자가 표시하는 물리적 객체 또는 소프트웨어 인터페이스에 대한 실시간 시각적 이해 및 대화형 안내를 제공할 수도 있습니다.

보안 및 규정 준수 측면에서 Google은 인공 지능 딥페이크 및 신원 도용의 위험을 방지하기 위해 Live Avatar에 대한 여러 보안 방어선을 설정했습니다. 기본적으로 시스템은 공식 검토를 통해 사전 설정된 디지털 인간 이미지 라이브러리만 기업 사용자에게 공개하는 반면, 독점 브랜드 이미지 또는 특정 얼굴을 사용자 정의할 수 있는 권한은 엄격한 화이트리스트 검토 메커니즘에 따라 배치됩니다. 또한 시스템에서 생성된 모든 실시간 음성 및 동적 비디오 스트림에는 눈에 보이지 않고 조작할 수 없는 SynthID 디지털 워터마크가 내장되어 AI 생성 콘텐츠의 투명성과 추적성을 보장합니다.

현재 Gemini 3.8 Live 및 Live Avatar 기능은 미국 및 유럽 데이터 센터 서비스 노드를 통해 기업 수준 구독 고객에게 공식적으로 개방되었으며 개발자 API 액세스 지원도 동시에 제공됩니다. 업계 분석가들은 생성 비디오 기술을 기본 음성 모델에 직접 통합하면 기존 비디오 렌더링 제품군으로 인해 발생하는 높은 대기 시간을 제거할 뿐만 아니라 AI 가상 고객 서비스와 지능형 대화형 터미널이 "실제 사람 및 실시간 시각적 대화"의 새로운 시대로 진입하고 있음을 나타냅니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음