요약:
OpenAI는 최근 ChatGPT 음성 기능에 사용되는 GPT-Live-1이 개발자들에게 공식적으로 공개될 것이라고 발표했습니다. 이제 개발자는 API를 통해 이 음성 모델을 자체 애플리케이션 및 비즈니스 프로세스에 통합하여 실시간으로 사용자의 말을 듣고 동시에 응답할 수 있는 전이중 음성 도우미를 구축할 수 있습니다. 본 모델의 음성 프론트엔드 가격은 분당 0.05달러이며, 복잡한 추론을 위해 백그라운드로 사용되는 모델은 해당 모델 가격에 따라 별도로 과금해야 합니다.

GPT-Live-1은 OpenAI가 올해 출시한 차세대 실시간 음성 모델입니다. 가장 큰 특징은 전이중 아키텍처입니다. 기존 음성 AI는 일반적으로 음성 인식, 언어 모델 추론, 음성 합성의 3단계를 순차적으로 완료해야 합니다. 사용자가 말하기를 마친 후에만 시스템이 처리를 시작하고 답변을 생성할 수 있습니다. 반면 GPT-Live-1은 사용자의 말을 들으면서 음성 출력을 생성할 수 있으므로 중단, 일시 중지, 에코 및 빠른 앞뒤 대화를 보다 자연스럽게 처리할 수 있습니다.
즉, 사용자는 AI가 말하기를 완전히 끝내고 계속 말하기를 기다릴 필요가 없습니다. 사용자가 마음을 바꾸거나 정보를 추가하거나 직접 방해하는 경우 GPT-Live-1은 진행 중인 대화에 따라 시간에 맞춰 동작을 조정할 수 있습니다. 모델은 또한 언제 계속 말해야 하는지, 언제 일시 중지해야 하는지, 언제 계속 들어야 하는지, 언제 도구를 사용해야 하는지 알려줄 수 있습니다.
OpenAI는 이 아키텍처가 음성 상호작용의 지연을 획기적으로 줄이고, 기존 '음성 인식 + 대규모 언어 모델 + 음성 합성' 파이프라인에서 실제 대화에서 발생하기 쉬운 연결 문제를 해결할 수 있다고 밝혔습니다. GPT-Live-1 자체가 입력 및 출력 오디오를 모두 처리하므로 개발자는 더 이상 여러 독립 모델 간의 복잡한 전환을 조정할 필요가 없습니다.
OpenAI가 발표한 테스트에서 Full Duplex Bench 테스트에서 GPT-Live-1의 성능은 특히 방향 전환 지연 및 대화형 동작 측면에서 GPT-Realtime-2.1보다 30% 더 높았습니다. 중간 추론 강도에서 GPT-6 Astra와 결합했을 때 GPT-Live-1은 Tau3 테스트에서도 1위를 차지했습니다. Tau3는 주로 음성 에이전트가 엔드투엔드 작업을 완료하는 능력을 평가하는 데 사용됩니다.
GPT-Live-1의 또 다른 중요한 특징은 모든 복잡한 추론 작업을 책임지지 않는다는 것입니다. OpenAI는 실시간 듣기, 말하기 및 상호 작용을 담당하는 음성 모델과 심층 추론을 담당하는 배경 모델을 분리합니다. 사용자가 검색, 복잡한 분석 또는 긴 작업이 필요한 질문을 하면 GPT-Live-1은 사용자와의 자연스러운 음성 커뮤니케이션을 계속 유지하면서 이러한 작업을 백그라운드 모델에 넘길 수 있습니다.
따라서 개발자는 특정 비즈니스 요구 사항에 따라 백엔드 모델을 자유롭게 선택할 수 있습니다. 예를 들어, 예약 및 주문 업데이트와 같은 다수의 간단한 작업의 경우 더 빠르고 저렴한 모델을 사용할 수 있습니다. 복잡한 고객 문제의 경우 더 강력한 추론 모델을 통해 처리할 수 있습니다. 이 아키텍처를 통해 개발자는 응답성, 추론 기능 및 사용 비용 간의 균형을 찾을 수 있습니다.
OpenAI는 이러한 분리된 설계를 통해 GPT-Live-1이 사용자가 오랜 시간 동안 조용히 기다리게 하는 대신 백그라운드에서 작업을 수행하는 동안 사용자와 계속 통신할 수 있다고 밝혔습니다. 모델은 백그라운드에서 더 복잡한 작업을 완료하는 동안 자연스러운 대화를 이어갔다가 작업이 완료되면 결과를 현재 대화로 다시 가져올 수 있습니다.
실용적인 응용 프로그램이 이미 등장하기 시작했습니다. OpenAI가 시연한 초기 사례에는 Yelp Host 및 Hatch와 같은 음성 서비스와 언어 학습 플랫폼 Speak가 포함됩니다. 초기 평가에서 발견된 이전 턴 기반 음성 시스템과 비교하여 GPT-Live-1은 언어 학습자에게 더 많은 생각할 시간을 제공하여 사용자에 대한 시스템 사전 중단 횟수를 거의 80% 줄입니다.
기업의 경우 이 기능은 고객 서비스, 전화 고객 서비스, 예약 및 지속적인 음성 상호 작용이 필요한 기타 시나리오에 특히 적합합니다. GPT-Live-1은 기본적으로 전화 시나리오를 지원하므로 개발자는 이를 사용하여 레스토랑 예약, 고객 지원 및 실시간 통신이 필요한 기타 비즈니스와 같은 전화 통화에 응답하고 처리할 수 있는 전이중 음성 에이전트를 구축할 수 있습니다.
GPT-Live-1은 또한 기본 자동 음성 인식 텍스트와 모델 응답 텍스트를 제공하고 영숫자 조합에 대한 이해를 높이는 동시에 키워드 바이어스 기능을 지원합니다. 전통적인 의미의 턴 기반 모델은 아니지만 여전히 기본적으로 턴 감지를 지원합니다. 따라서 개발자가 사용자가 말하기를 끝내는 시점과 시스템이 응답을 시작하는 시점을 명확하게 제어해야 하는 경우에도 명확한 대화 전환을 중심으로 애플리케이션을 설계할 수 있습니다.
GPT-Live-1은 시끄러운 배경 환경이 있는 장면에도 최적화되었습니다. 이 모델은 사용자 음성, 배경 소음 및 침묵을 더 잘 구분할 수 있습니다. 주변 환경의 소리 때문에 대화를 자주 방해하지 않으며, 사용자가 잠깐 생각하고 있을 때에도 지속적으로 상기시켜 주지 않습니다. 이 기능은 실제 환경의 전화 통화, 고객 서비스 및 모바일 음성 지원에 특히 중요합니다.
OpenAI는 GPT-Live-1에서 사용할 수 있는 사운드 선택도 확장했습니다. 이전에 사용 가능한 실시간 음성 수가 상대적으로 제한되어 있었던 것에 비해 새 버전에서는 더욱 다양한 음성을 제공하고 더욱 풍부한 범위의 악센트, 방언 및 언어를 포괄합니다. OpenAI는 앞으로 몇 달 안에 사용 가능한 음성과 언어를 계속 추가할 것이라고 밝혔습니다.
모델 배포 측면에서 개발자는 모든 작업을 GPT-Live-1에 넘길 필요가 없습니다. OpenAI는 이를 실시간 음성 상호 작용을 담당하는 프런트 엔드로 사용하여 백그라운드 모델 및 에이전트 프레임워크를 통해 보다 복잡한 작업을 수행하기를 희망합니다. 또한 이 접근 방식을 통해 개발자는 다양한 작업의 실제 요구 사항에 따라 다양한 모델을 결합할 수 있습니다.
예를 들어 개발자는 GPT-Live-1이 사용자 음성 요청 수신, 자연스러운 대화 유지, 방해 처리를 담당하도록 한 다음 복잡한 추론이 필요한 질문을 백그라운드 모델에 넘길 수 있습니다. 백그라운드 모델이 작업을 완료한 후 GPT-Live-1은 결과를 자연스러운 음성 답변으로 변환합니다. 이 메커니즘은 외부 도구를 호출해야 하는 애플리케이션에도 적용됩니다.
OpenAI는 또한 GPT-Live-1을 Codex와 같은 도구와 결합하는 방법을 시연했습니다. 개발자는 사용자가 제안한 작업을 음성 모델이 수신하도록 한 다음 관련 컨텍스트를 Codex와 같은 백그라운드 도구로 전송하여 처리한 다음 처리 결과를 GPT-Live-1로 반환할 수 있으며 GPT-Live-1은 음성을 통해 사용자와 계속 통신합니다.
가격 측면에서 GPT-Live-1은 이제 OpenAI API를 통해 공식적으로 제공되며 음성 프런트 엔드 요금은 분당 0.05달러입니다. 이는 실시간 음성 계층의 비용일 뿐이라는 점에 유의하는 것이 중요합니다. 개발자가 GPT-Live-1에 백그라운드 추론 모델을 장착하는 경우 백그라운드 모델 호출 비용은 해당 모델 가격에 따라 별도로 계산되어야 합니다.
음성통화를 많이 필요로 하는 비즈니스 애플리케이션의 경우 실제 비용이 분당 0.05달러가 아니라 음성 연결 시간과 백그라운드 모델의 추론 소비로 구성된다는 뜻이다. 그러나 개발자는 다양한 백엔드 모델을 선택하여 작업의 복잡성에 따라 전체 비용을 제어할 수 있습니다.
GPT-Live-1의 공개는 OpenAI가 ChatGPT 음성 모드의 핵심 기술을 소비자 제품에서 개발자 생태계로 더욱 확장한다는 의미이기도 합니다. 이전에는 GPT-Live-1이 주로 ChatGPT의 음성 상호작용 기능으로 존재했습니다. 이제 개발자는 유사한 기술을 직접 사용하여 자신만의 음성 애플리케이션과 에이전트를 구축할 수 있습니다.
기술적인 관점에서 OpenAI는 GPT-Live-1이 'AI가 말할 수 있도록 지원' 문제를 해결할 뿐만 아니라 AI가 지속적이고 실시간이며 중단 가능한 자연스러운 대화에 진정으로 참여할 수 있기를 바라고 있습니다. OpenAI는 듣기, 말하기, 실시간 상호 작용 및 심층 추론을 분리하여 낮은 음성 대기 시간, 보다 자연스러운 대화 경험 및 강력한 백그라운드 작업 처리 기능을 동시에 달성하려고 시도합니다.
음성 에이전트가 단순한 음성 질의응답에서 전화 고객 서비스, 예약, 언어 교육, 비즈니스 처리, 자동으로 도구를 호출하여 작업을 완료하는 기능 등 복잡한 작업으로 점차 전환함에 따라 실시간 음성 모델의 중요성도 높아지고 있습니다. GPT-Live-1의 개방형 API는 이제 개발자가 ChatGPT에서 사용하는 현재 세대의 실시간 음성 기술을 자신의 제품에 직접 내장할 수 있음을 의미하며, 분당 US$0.05의 음성 레이어 가격을 통해 이 기능을 공식적으로 상용 애플리케이션 단계에 진입할 수 있습니다.
댓글