요약:
Microsoft는 실시간 음성 상호 작용을 위한 세 가지 새로운 모델, 즉 음성-텍스트 모델 MAI-Transcribe-2-Streaming과 텍스트-음성 모델 MAI-Voice-2.1 및 MAI-Voice-2.1-Flash를 출시했습니다. 마이크로소프트는 개발자들이 이를 결합하여 듣는 동안 처리하고 자연스러운 말로 즉시 응답할 수 있는 음성 비서 및 대화 에이전트를 구축할 수 있기를 바라고 있습니다.

MAI-Transcribe-2-Streaming은 녹음 파일만 처리할 수 있는 이전 MAI-Transcribe-2와 다릅니다. 연속적인 입력 오디오 스트림을 수신하고 화자가 말하기를 마치기 전에 준비된 텍스트 생성을 시작할 수 있습니다. 더 많은 맥락이 나오면 계속 수정될 예정이며, 최종적으로 안정적인 결과를 제출하게 됩니다. 마이크로소프트는 해당 모델이 60개 언어를 지원하며 지속적으로 자동으로 언어를 인식할 수 있다고 밝혔다. 첫 번째 인식 배치는 오디오 수신 후 100밀리초가 조금 넘는 시간 후에 나타나는 것으로 가정되며 음성 상담원, 고객 서비스, 회의 및 강의실 자막, 음성 입력과 같은 시나리오에 적합합니다. 받아쓰기 및 자막에 대한 Microsoft의 내부 테스트에 따르면 텍스트가 가장 가까운 경쟁업체보다 약 2배 빠른 속도로 나타나는 것으로 나타났습니다. 이는 회사 자체 리뷰를 기반으로 한 비교입니다.
Artificial Analysis의 스트리밍 전사 벤치마크는 최종 및 단계적 텍스트 정확도에서 모델의 순위를 1위로 매겼습니다. 공개된 테스트 결과 최종 전사된 단어 오류율은 약 2.5%였으며, 음성 끝이 감지된 후 약 0.13초 후에 최종 텍스트가 제공되는 것으로 나타났습니다. 목록에는 당시 38개 모델을 비교하고 약 8시간 동안 오디오를 테스트했으며 AA-AgentTalk, VoxPopuli, Earnings22의 세 가지 유형의 말뭉치가 포함되어 각각 종합 가중치의 50%, 25%, 25%를 차지했습니다. 단어 오류율은 낮을수록 좋습니다. 이 결과는 이 벤치마크 세트에서 모델의 성능을 보여주며 모든 언어, 잡음이 많은 환경 및 실제 응용 프로그램에서 동일한 정확도를 달성할 수 있다는 것을 의미하지는 않습니다.
MAI-Transcribe-2-Streaming은 현재 오디오 시간당 0.54달러에 판매되고 있으며 이 혜택은 2026년 말까지 지속됩니다. 이에 비해 스트리밍되지 않는 MAI-Transcribe-2는 이전에 시간당 $0.10로 광고되었습니다. 실시간 버전은 지속적인 상호작용에 더 적합한 반면, 배치 버전은 오디오 전사 녹음에 더 적합합니다. 두 제품의 가격은 단순히 동일한 사용방법에서의 직접적인 비교라고 볼 수는 없습니다.
새로운 음성 합성 모델 MAI-Voice-2.1은 23개 언어와 26개 지역 변형을 지원하여 동일한 합성 음성이 화자의 정체성을 유지하고 해당 언어의 현지 악센트를 채택하면서 다른 언어 간에 전환할 수 있도록 합니다. 가격은 1백만 자당 22달러입니다. 낮은 대기 시간과 대규모 요청을 위한 MAI-Voice-2.1-Flash는 동일한 언어를 지원합니다. 마이크로소프트는 약 150밀리초의 종단 간 지연으로 45초의 오디오를 생성할 수 있다고 밝혔습니다. 동급 모델에 비해 모델 추론 속도가 55% 향상되고 가격은 약 60% 저렴해졌습니다. 가격은 1백만 자당 15달러입니다. 후자의 속도 및 가격 이점은 Microsoft에서 발표한 비교 항목 중 하나입니다.
두 음성 모델 모두 언어 간 실시간 음성 복제를 지원하지만 승인되고 동의된 참조 음성을 사용해야 합니다. Microsoft 문서에는 5~60초의 참조 오디오 권장 사항 및 남용 방지 기능과 함께 제한된 액세스 기능이 나열되어 있습니다. MAI-Voice-2.1은 긴 콘텐츠, 나레이션 및 오디오북에 적합한 반면, Flash는 음성 에이전트, 도우미 및 고객 서비스와 같은 실시간 시나리오에 더 적합합니다.
세 가지 모델 모두 Microsoft Foundry, MAI Playground 및 Vercel을 통해 사용할 수 있습니다. 두 음성 모델도 OpenRouter에 연결되어 있으며 Azure Voice Live를 통해 호출할 수 있습니다. LiveKit 지원은 나중에 출시될 예정입니다. Microsoft Azure 문서에서는 현재 이러한 모델을 공개 미리 보기로 표시하여 서비스 수준 계약이 없으며 프로덕션 워크로드에서 직접 사용하는 것이 권장되지 않음을 명시하고 있습니다.
자세히 알아보기:
https://microsoft.ai/news/our-first-streaming-transcription-model/
댓글