요약:
Microsoft는 Foundry 플랫폼의 실시간 음성 기능을 더욱 강화하여 개발자에게 음성 입력 및 음성 출력을 직접 수행할 수 있는 기본 음성 에이전트를 제공함으로써 기업이 Google Gemini Live와 유사한 실시간 대화형 AI 경험을 더 쉽게 구축할 수 있도록 합니다.

Microsoft 업데이트의 핵심 변경 사항은 Foundry Agent Service가 기본 실시간 음성 기능을 지원하기 시작했다는 것입니다. 먼저 음성을 텍스트로 변환한 다음 처리를 위해 텍스트 모델에 전달하고 마지막으로 텍스트를 다시 음성으로 변환하는 기존 AI 에이전트의 프로세스와 달리 기본 음성 아키텍처는 실시간 음성 모델이 사용자의 음성 입력을 처리하고 음성 응답을 생성하도록 직접 허용하여 중간 링크와 그에 따른 지연을 줄일 수 있습니다.
이는 사용자에게 있어 AI 에이전트가 보다 자연스럽게 지속적인 대화에 참여할 수 있음을 의미합니다. 사용자는 음성 합성을 시작하기 전에 음성 인식이 완료되거나 모델이 완전한 텍스트 답변을 생성할 때까지 기다릴 필요가 없습니다. 이 시스템은 사람 간의 실시간 의사소통 방법에 더 가까워질 수 있으며, 중단 및 판단 방향 전환과 같은 음성 상호 작용의 주요 측면을 처리할 수 있습니다.
Microsoft의 기능은 Voice Live API를 기반으로 합니다. 이 인터페이스는 음성 인식, 생성 AI, 텍스트 음성 변환, 회전 감지, 중단 처리 등의 기능을 통합 실시간 음성 인터페이스로 통합하므로 개발자는 여러 음성 구성 요소를 별도로 구축하지 않고도 AI 에이전트에 실시간 음성 상호 작용 기능을 추가할 수 있습니다.
Foundry Agent Service를 사용하여 AI 에이전트를 구축한 기업의 경우 이는 원래의 텍스트 기반 에이전트가 음성 상호 작용 기능을 추가로 확보하는 동시에 원래의 도구 호출, 지식 기반, 메모리, 콘텐츠 보안 보호, 기업 수준의 데이터 및 서비스 통합 기능을 계속 사용할 수 있음을 의미합니다.
마이크로소프트는 특히 음성 에이전트가 단순히 '답변을 읽을' 수 있는 챗봇이 아니라 실시간 음성 통신 중에 도구를 호출하고 작업을 수행할 수 있다는 점을 강조한다. 예를 들어, 기업은 이 기술을 사용하여 사용자가 전화를 통해 AI 에이전트와 직접 통신할 수 있는 고객 서비스 시스템을 구축할 수 있습니다. 또한, 배리어프리 서비스, 음성 우선 애플리케이션, 자연스러운 음성 상호 작용이 필요한 다양한 기업 내부 시스템에도 사용할 수 있습니다.
기술 아키텍처 측면에서 Foundry는 현재 두 가지 주요 음성 에이전트 경로를 지원합니다. 하나는 사용자 음성을 텍스트로 변환한 다음 이를 추론을 위해 텍스트 모델에 제공하고 마지막으로 생성된 텍스트를 음성으로 변환하는 전통적인 음성 파이프라인입니다. 다른 하나는 이번에 주목한 네이티브 Speech-to-Speech인데, 바로 Speech-to-Speech Architecture입니다. 실시간 음성 모델은 음성 입력을 직접 처리하고 음성 출력을 생성합니다.
네이티브 음성 아키텍처의 가장 큰 장점은 자연스러운 대화의 톤, 일시정지, 의사소통 리듬을 더 잘 유지하면서 대기 시간을 줄이는 것입니다. 지속적인 의사소통이 필요한 시나리오의 경우, 이 방법은 기존의 "음성 인식 → 텍스트 모델 → 음성 합성"의 다단계 솔루션보다 실제 실시간 대화에 더 가깝습니다.
또한 Microsoft는 Voice Live API의 실시간 상호 작용 기능을 지속적으로 개선하고 있습니다. 최근 업데이트에는 새로운 기본 실시간 음성 유형이 추가되었으며 에코 제거, 지능형 종료 감지 및 병렬 도구 호출과 같은 기능이 더욱 향상되었습니다. 에코 제거는 맞춤형 하드웨어나 비표준 오디오 링크에서 실행되는 음성 에이전트에 특히 적합합니다. 클라이언트가 실제로 재생한 소리를 시스템이 참조할 수 있게 함으로써 AI가 자신의 음성을 들은 후 오인식하는 문제를 줄일 수 있다.
마이크로소프트는 음성 자체 외에도 파운드리의 엔터프라이즈급 AI 에이전트 개발 및 운영 플랫폼으로서의 입지도 강화하고 있다. Foundry Agent Service는 지능형 에이전트의 수명주기 관리를 담당하고 엔터프라이즈 수준의 보안, 권한 제어, 네트워크 격리, 운영 추적 및 평가 기능을 제공할 수 있습니다. 이러한 방식으로 기업은 AI 에이전트의 운영, 모니터링 및 음성 커뮤니케이션을 위해 인프라를 처음부터 구축할 필요가 없습니다.
마이크로소프트의 움직임은 구글이 최근 몇 년간 지속적으로 강화해 온 제미니 라이브(Gemini Live)를 겨냥한 것도 분명하다. Gemini Live는 Google이 소비자에게 실시간 음성 AI 기능을 보여주는 중요한 제품이 된 반면, Microsoft는 유사한 실시간 음성 기능을 기업 개발자에게 직접 제공하여 기업이 자체 데이터, 도구 및 비즈니스 프로세스를 기반으로 독점적인 음성 인텔리전스를 구축할 수 있도록 강조합니다.
따라서 둘의 위치는 정확히 동일하지 않습니다. Gemini Live는 주로 일반 사용자에게 직접 사용할 수 있는 AI 음성 경험을 제공하는 반면, Microsoft Foundry는 기업 및 개발자를 대상으로 합니다. 기업이 실시간 음성 기능을 고객 서비스, 전화 시스템, 내부 비즈니스 및 기타 전문 애플리케이션에 내장할 수 있도록 하는 데 중점을 두고 있습니다.
마이크로소프트는 최근 몇 년간 단순한 챗봇에서 자율적으로 작업을 수행할 수 있는 시스템까지 AI 에이전트 개발을 추진해 왔다. 이 시스템에 음성 기능이 추가되면서 사용자와 상담원 간의 상호 작용은 키보드 입력에서 보다 자연스러운 실시간 대화로 점차 확장되었습니다. 상담원은 질문에 답변할 수 있을 뿐만 아니라 도구를 호출하고, 기업 데이터에 액세스하고, 대화 중에 특정 작업을 완료할 수도 있습니다.
현재 Microsoft는 Foundry Agent Service, Voice Live 및 관리형 에이전트와 같은 기능을 동일한 엔터프라이즈 AI 플랫폼에 점진적으로 통합하고 있습니다. 이러한 기술이 성숙해짐에 따라 기업이 실시간 음성 고객 서비스, 전화 상담원, 음성 사무 도우미 및 기타 AI 서비스를 구축하기 위해 자체적으로 개발하고 유지 관리해야 하는 인프라는 더욱 줄어들 것입니다.
이는 또한 AI 음성 비서 경쟁이 단순히 '채팅 가능 여부' 모델 비교에서 누가 지연 시간이 짧은 음성 상호 작용, 보다 완전한 도구 호출 기능, 보다 안정적인 엔터프라이즈 수준 인프라, 보다 편리한 개발 환경을 제공할 수 있는지 비교하는 것으로 전환하고 있음을 의미합니다. Microsoft가 기본 실시간 음성 에이전트를 Foundry에 추가한 것은 엔터프라이즈 AI 시장에서 음성 에이전트 레이아웃을 더욱 확장하는 중요한 단계입니다.
댓글