요약:
OpenAI는 ChatGPT 모바일 애플리케이션에 음성 기반 지능형 에이전트 기능을 추가하기 시작했다고 발표했습니다. 앞으로 사용자는 음성을 통해 ChatGPT와 채팅할 수 있을 뿐만 아니라 음성을 사용하여 보다 복잡한 실무 작업을 수행하도록 직접 명령할 수도 있습니다. 예를 들어 사용자는 ChatGPT에 문서 작성, 이메일 초안 작성, Slack 메시지 요약 또는 완료하는 데 여러 단계가 필요한 일련의 작업 수행을 요청할 수 있습니다.

이 업데이트의 핵심은 ChatGPT가 데스크톱에 점진적으로 추가한 Agentic Work 기능을 휴대폰에도 가져오는 것입니다. Plus 및 Pro 사용자의 경우 이제 휴대폰의 작업 탭을 사용하여 문서를 작성하고, 이메일 초안을 작성하고, Slack 메시지를 요약할 수 있습니다. 또한 웹 사이트 만들기, 프레젠테이션 만들기, 클라우드 브라우저 사용, 금융 관련 작업 처리 등 보다 복잡한 작업 흐름을 수행할 수도 있습니다.
Free 및 Go 사용자를 위해 OpenAI는 플러그인 및 연결된 애플리케이션 사용에 중점을 둡니다. 즉, 다양한 구독 수준의 사용자는 ChatGPT를 외부 도구 및 애플리케이션과 함께 사용할 수 있지만 사용 가능한 특정 기능 범위는 다릅니다.
이 업데이트는 ChatGPT 음성 모드 자체의 작동 방식도 변경합니다. OpenAI는 이제 음성 대화가 더 풍부한 텍스트 출력을 제공할 수 있으며 사용자는 ChatGPT와 통신할 때 동시에 더 완전한 텍스트 정보를 볼 수 있다고 말했습니다. 또한 사용자는 현재 대화를 종료하고 다시 시작할 필요 없이 텍스트 모드와 음성 모드 간에 더 쉽게 전환할 수 있습니다.
여러 기기에 걸쳐 지속적인 작업을 수행하는 것도 이번 업데이트의 중요한 부분입니다. 사용자는 휴대폰을 사용하여 ChatGPT에 외출 시 음성으로 작업 처리를 시작한 다음 컴퓨터로 돌아와 작업을 계속 보고 완료하도록 지시할 수 있습니다. 즉, 휴대폰은 주로 지침을 내리고 언제든지 작업을 시작하는 역할을 담당하는 반면 데스크톱은 더 복잡한 작업 흐름을 계속 처리할 수 있습니다.
이러한 변화는 OpenAI가 최근 몇 년간 음성 상호 작용에 지속적으로 투자한 것과 관련이 있습니다. 올해 7월 OpenAI는 자연스러운 대화, 중단 처리, 지속적인 의사소통 기능 향상에 초점을 맞춘 새로운 GPT-Live 음성 모델을 출시했습니다. 이후 OpenAI는 이 음성 기능을 데스크톱 애플리케이션에 도입하여 사용자가 음성을 통해 ChatGPT Work에서 지능형 에이전트를 제어하거나 Codex에서 소프트웨어 개발 작업을 완료할 수 있도록 했습니다.
이전 데스크톱 버전에서는 이미 사용자가 음성을 통해 복잡한 다단계 명령을 실행할 수 있었습니다. 예를 들어 개발자는 ChatGPT에 직접 지시하여 새 코드 스레드를 생성하고, 끌어오기 요청을 제출하고, 각 작업을 단계별로 거치지 않고도 프로그램 취약점의 근본 원인을 찾을 수 있습니다. 이번 모바일 업데이트는 기본적으로 이 아이디어를 따르지만 음성 제어 및 지능형 에이전트 기능을 휴대폰으로 더욱 확장합니다.
OpenAI는 음성이 사람들이 AI와 상호작용하여 복잡한 작업을 완료하는 중요한 방법이 되고 있다고 믿습니다. 사용자는 멈춰서 텍스트를 입력하는 대신, 걷거나 출퇴근하는 등의 작업 중에 음성을 통해 해야 할 일을 AI에게 직접 지시한 다음, 지능형 에이전트가 이를 백그라운드에서 계속 실행하도록 할 수 있습니다.
이러한 추세는 OpenAI의 이전 음성 기술 포지셔닝과도 일치합니다. 회사는 모델 기능이 지속적으로 향상됨에 따라 음성이 결국 주요 컴퓨터 상호 작용 방법이 될 것이며 사용자는 AI에게 자연어를 통해 점점 더 복잡하고 오래 지속되는 작업을 완료하도록 계속 명령할 수 있기를 희망한다고 밝혔습니다.
OpenAI는 올해 7월 GPT-Live를 출시하면서 이러한 개발 방향을 보여주기도 했습니다. 새로운 음성 모델은 사용자 중단을 보다 자연스럽게 처리할 수 있을 뿐만 아니라 지속적인 음성 통신 중에 검색, 추론 및 에이전트 작업을 위한 고급 텍스트 모델을 호출할 수도 있습니다. 이런 식으로 음성 모드는 더 이상 '말하기'를 담당하는 인터페이스가 아니라 점차 전체 AI 작업 시스템을 제어하는 입구가 되었습니다.
이 모바일 업데이트는 또한 OpenAI가 ChatGPT 모바일 애플리케이션의 위치를 점진적으로 변경하고 있음을 의미합니다. 과거에는 ChatGPT의 모바일 버전이 주로 질문과 답변, 검색, 글쓰기, 음성 채팅 등의 작업을 담당했습니다. 이제 사용자는 휴대폰에서 직접 전체 워크플로를 시작할 수 있으며 AI가 연결된 애플리케이션 및 도구에서 실제 작업을 완료하도록 할 수 있습니다.
동시에 OpenAI의 접근 방식은 경쟁업체가 취하고 있는 방향과도 경쟁합니다. Anthropic은 또한 최근 Claude의 모바일 및 데스크톱 협업 기능을 강화하고 Cowork와 Claude의 채팅 인터페이스를 더욱 통합하여 사용자가 모바일 장치에서 작업을 시작한 다음 데스크톱으로 전송하여 계속 처리할 수 있도록 했습니다. 그러나 두 회사는 여전히 제품 구조에서 서로 다른 선택을 하고 있습니다. OpenAI는 여전히 일반 채팅 인터페이스와 업무 공간을 분리합니다.
OpenAI의 현재 제품 로드맵에 따르면 음성, 지능형 에이전트, 교차 기기 작업이 점차 통합되고 있습니다. 미래에는 사용자가 반드시 특정 애플리케이션을 열고 특정 버튼을 찾은 다음 소프트웨어를 단계별로 작동할 필요가 없습니다. 대신 목표를 직접 명시할 수 있으며 ChatGPT는 작업 이해, 도구 호출 및 여러 단계 실행을 담당합니다.
이번 모바일 업데이트는 음성 채팅 기능을 추가할 뿐만 아니라 휴대전화의 ChatGPT가 '음성 명령 작업' 기능을 시작할 수 있도록 허용합니다. OpenAI가 GPT-Live 및 Work와 같은 제품을 지속적으로 개선함에 따라 ChatGPT의 음성 모드는 단순한 대화 도구에서 사용자를 AI 에이전트, 외부 애플리케이션 및 실제 디지털 워크플로와 연결하는 포털로 점차 변화하고 있습니다.
댓글