Google은 음성-텍스트 정확도를 더욱 향상시키기 위해 Gemini 3.5 Transcribe를 출시합니다.

📅 2026-08-27

요약:

Google은 최근 Gemini 시리즈의 최신 음성-텍스트 모델인 Gemini 3.5 Transcribe를 출시했으며, 이를 시리즈에서 가장 정확한 음성 인식 모델이라고 부릅니다. 이 모델은 개발자, 기업 및 일반 사용자에게 개방되어 있으며 시끄러운 환경, 복잡한 전문 용어 및 자연스러운 음성 표현에서의 음역 기능을 향상시키는 데 중점을 둡니다.

보고서에 따르면 Gemini 3.5 Transcribe는 전문 분야에서 배경 소음과 복잡한 어휘를 더 잘 처리할 수 있습니다. 구글은 새 모델이 macOS 플랫폼의 Gemini 앱과 Android 플랫폼의 Gboard 키보드의 Rambler 기능의 성능을 향상시켰다고 밝혔습니다. 개발자는 이 모델을 사용하여 음성 에이전트, 실시간 자막 도구, 통화 후 분석 프로세스와 같은 애플리케이션을 구축할 수 있습니다.

Google은 Gemini 3.5 Transcribe가 사용자의 자연스러운 말하기 패턴을 캡처하여 의미적 의도를 보다 정확하게 이해하고 맞춤 어휘를 식별하며 사용자가 음성을 통해 작업을 완료할 수 있도록 설계되었다고 밝혔습니다.

기능 수준에서 새 모델은 자동 자체 수정, "um" 및 "ah"와 같은 음성 필러 단어 삭제, 출력 텍스트 자동 서식 지정 등 다양한 최적화 기능을 추가합니다. 동시에 파일 분석 및 이미지 생성과 같은 보다 복잡한 작업을 다른 Gemini 모델에 위임하여 보다 완전한 다중 모델 협업 경험을 형성할 수도 있습니다.

정확도 측면에서 구글은 Gemini 3.5 Transcribe의 평균 단어 오류율이 스트리밍 음성 인식 시나리오에서 4.0%, 비스트리밍 시나리오에서는 2.6%까지 감소할 수 있다고 지적했습니다. 이 모델은 시끄러운 환경에서 더 나은 전사 성능을 발휘하며 주문 번호, 우편번호 등 문자와 숫자로 구성된 주요 정보를 보다 정확하게 식별할 수 있습니다.

언어 지원 측면에서 Gemini 3.5 Transcribe는 현재 85개 언어를 다루며 지역 억양과 다양한 방언을 지원합니다. 사전 녹음된 오디오의 경우 최대 3명의 화자에 대해 타임스탬프 음성 속성 인식을 수행할 수 있습니다. 또한 이 모델은 사용자 정의 어휘에 적응하여 전문 용어, 특수 철자 및 업계 이름을 식별할 수 있습니다.

Gemini 3.5 Transcribe는 현재 Google AI Studio 및 Google Antigravity의 Gemini API를 통해 공개 미리보기로 제공됩니다. 일반 사용자는 Android 및 macOS 플랫폼에서 관련 기능을 경험할 수 있습니다. 구글은 또한 이를 크롬 브라우저에 도입할 계획이다. 크롬 브라우저에서는 사용자가 웹페이지의 입력 상자에 음성을 통해 직접 텍스트를 입력할 수 있다.

최근 Google은 Gemini 제품 라인의 발전을 계속 가속화해 왔습니다. 회사는 이전에 점점 더 치열해지는 AI 모델의 가격 경쟁에 동참하기 위해 Gemini 3.7 Flash를 출시했습니다. Android용 Chrome의 Gemini도 미국의 모든 사용자에게 공개되었으며 Gemini Assistant도 Waymo의 차세대 자율주행 택시에 합류했습니다.

관련 태그

관련 글

댓글

0/500
验证码
댓글 없음