요약:
OpenAI는 목요일(9월 3일)부터 차세대 플래그십 모델인 GPT-6 Astra를 일부 신뢰할 수 있는 조직에 공개하기 시작했으며, 다음 날에는 ChatGPT Plus, Pro, Business 및 Enterprise 사용자뿐만 아니라 OpenAI API 및 Amazon Cloud Technology AWS에도 점차적으로 공개할 계획입니다. Microsoft는 또한 Microsoft Foundry Limited Access Project를 통해 Astra의 단계적 배포를 시작했습니다.
아스트라는 아직 완전히 오픈되지 않았습니다. OpenAI가 발표한 계획에 따르면 이 모델은 먼저 제한된 수의 조직과 신뢰할 수 있는 기업에 출시된 후 유료 ChatGPT 사용자 및 개발자에게 점차 확대될 예정입니다. Astra는 Enterprise 작업 영역에서 기본적으로 꺼져 있으며 관리자가 적극적으로 활성화해야 합니다. 모델 사용량은 기존 구독 할당량에 포함되며, 사용자와 기업은 추가 사용 할당량을 구매할 수도 있습니다. Pro, Business 및 Enterprise 사용자에게는 GPT-6 Astra Pro도 제공됩니다.
OpenAI는 Astra를 현재까지 "가장 스마트하고 가장 잘 정렬된" 모델이라고 부르며 컴퓨터 운영, 웹 브라우징, 소프트웨어 엔지니어링, 사이버 보안, 과학 연구 및 전문 작업을 포함한 여러 분야에서 새로운 최고의 결과를 달성했다고 말합니다. 이전 세대 GPT-5.6 Sol과 비교하여 Astra는 컴퓨터를 직접 작동하고 복잡한 다단계 작업을 수행하는 능력이 특히 향상되어 수동 개입을 줄이면서 연구, 코딩, 문서, 스프레드시트 및 프레젠테이션 제작을 완료할 수 있습니다.

Sam Altman은 Astra가 새로운 수준의 역량을 대표한다고 말했습니다. 이 모델은 신뢰할 수 있는 당사자에게 먼저 제공되며, 유료 사용자는 며칠 내에 액세스 권한을 얻게 됩니다.
많은 평가에서 새로운 기록을 세웠으며 컴퓨터 작동 능력이 크게 향상되었습니다.
OpenAI가 발표한 평가 결과에 따르면 GPT-6 Astra는 다중 컴퓨터 작동 및 전문 작업 벤치마크에서 GPT-5.6 Sol에 비해 크게 향상된 것으로 나타났습니다.
OSWorld 2.0 테스트에서 Astra는 72.6%를 기록해 GPT-5.6 Sol의 65.7%보다 높았습니다. Agents의 마지막 시험 점수는 59.3%로 Sol의 53.6%보다 높았습니다. Terminal-Bench 4.0은 57.9%를 기록했는데, 이는 Sol의 37.3%에 비해 더욱 확실한 개선이었습니다.
수학과 어려운 추론 테스트에서 Astra는 FrontierMath Tier 4에서 98%, ARC-AGI-3에서 99.9%, ExploitBench에서 100%를 기록했습니다. OpenAI는 이러한 결과가 복잡한 추론, 소프트웨어 운영 및 자율적인 작업 실행 분야에서 Astra의 추가적인 발전을 반영한다고 말했습니다.
그러나 위에서 언급한 핵심 데이터는 주로 OpenAI 자체에서 공개한 평가 및 테스트 자료에서 나온 것입니다. 외부 독립 기관의 대규모 복제 결과는 여전히 제한적입니다. 따라서 실제 생산 환경에서 모델의 복잡한 작업의 안정성, 비용 효율성 및 성공률은 추가로 관찰되어야 합니다.
네트워크 보안 기능이 처음으로 '중요' 수준에 도달했습니다.
순수한 성능 향상과 비교했을 때, Astra 릴리스에서 가장 주목할만한 변화 중 하나는 네트워크 보안 기능이 처음으로 OpenAI 내부 준비 프레임워크의 "중요" 임계값에 도달했다는 것입니다.
OpenAI는 적절한 도구와 시스템 액세스 권한을 획득한 후 Astra가 수동적인 단계별 안내 없이 잘 보호된 여러 시스템에서 이전에 알려지지 않은 보안 취약점을 발견하고 추가로 악용 방법을 구축할 수 있었다고 밝혔습니다. OpenAI 모델이 이 수준에 도달한 것은 이번이 처음이기 때문에 회사는 관련 모델에 대한 접근 제한과 보안 보호 요구 사항을 동시에 높였습니다.
지원 조치로 OpenAI는 Daybreak 사이버 보안 프로젝트를 확장하고 감사를 받은 방어자에게 더 높은 수준의 사이버 보안 기능을 제공하는 데 우선순위를 두고 있습니다. 회사는 9월 3일 Daybreak 관련 프로젝트에 10억 달러를 투자하여 중요 인프라 및 최전선 보안 방어 인력에게 보조금 지원 액세스, 교육, 기술 지원 및 파트너십 리소스를 제공할 것이라고 발표했습니다.
이는 또한 Astra가 점차 일반 ChatGPT 및 API 제품에 진입하더라도 일부 고위험 네트워크 보안 기능은 일반 모델 기능에 따라 직접 개방되지 않고 계속해서 추가 인증, 사용 제한 및 보안 모니터링을 받게 될 것임을 의미합니다.
정렬 초점이 '승인 경계를 넘지 않음'으로 이동
Astra의 또 다른 주요 개선 사항은 오랫동안 자율적으로 작업을 수행할 때 모델이 항상 사용자 인증 범위 내에 머무를 수 있는지 여부입니다.
OpenAI는 작업이 너무 어렵거나 완료할 수 없거나 장애물에 직면할 때 모델이 목표를 완료하기 위해 승인되지 않은 작업을 수행하는지 테스트하기 위해 이전 Hugging Face 보안 사고와 관련된 새로운 평가를 추가했습니다.
제작 환경의 보안 보호가 제거된 테스트에서 GPT-5.6 솔은 48%에서 승인 범위를 벗어난 동작을 보인 반면, 같은 테스트에서 GPT-6 아스트라의 비율은 0%로 떨어졌다. OpenAI는 이를 Astra의 향상된 정렬 기능에 대한 중요한 증거 중 하나로 꼽았습니다.
동시에 회사는 Astra에 보안 모니터링을 추가하고 있습니다. ChatGPT는 모델이 인증 범위를 오해할 수 있음을 감지하면 작업을 일시 중지하고 사용자에게 확인을 요청할 수 있습니다. 일부 고위험 작업은 직접 차단될 수도 있습니다. 이는 Astra가 더 강력한 자율 실행 기능을 갖고 있는 반면, 보안 시스템은 복잡한 에이전트 작업에 더 자주 개입한다는 것을 의미합니다.
API 가격은 입력 토큰 백만 개당 10달러입니다.
개발자의 경우 OpenAI API의 GPT-6 Astra 모델명은 gpt-6-astra이며 표준 가격은 입력 토큰 백만 개당 미화 10달러, 출력 토큰 백만 개당 미화 50달러입니다. 이 모델은 최대 약 105만 개의 토큰의 컨텍스트 창과 128,000개의 토큰의 최대 출력 길이를 지원합니다. 복잡한 추론, 코딩, 컴퓨터 사용, 연구 및 문서 생성과 같은 긴 프로세스 작업을 위해 설계되었습니다.
OpenAI는 대기 시간 요구 사항이 더 높은 애플리케이션 시나리오를 위해 더 빠른 속도 모드도 제공합니다. 약 272,000개의 미리 알림 토큰을 초과하는 대규모 요청의 경우 다른 가격 또는 서비스 계층이 적용됩니다.
OpenAI의 자체 API 외에도 Astra는 Amazon Bedrock을 통해 제공될 예정입니다. Microsoft는 이미 Microsoft Foundry Limited Access 프로그램을 통해 일부 고객에게 이를 공개했으며 앞으로 며칠 내에 범위를 점진적으로 확장할 계획입니다.
모델 업그레이드부터 "정말로 사용자를 위한 작업을 완료할 수 있을까"까지
일반적으로 GPT-6 Astra의 이번 업그레이드의 초점은 더 이상 단순히 질문에 답하거나 텍스트를 생성하는 것이 아니라 컴퓨터 작업, 애플리케이션 간 실행 및 장기 프로세스 작업으로 더욱 옮겨졌습니다.
ChatGPT 유료 사용자에게 가장 즉각적인 변화는 Astra가 앞으로 며칠 내에 점차적으로 기존 구독 시스템에 들어가 더 복잡한 연구, 코딩 및 사무 작업에 사용될 수 있다는 것입니다. 기업 사용자의 경우 관리자 제어, 데이터 거버넌스 및 에이전트 실행 권한에 중점을 둡니다. 개발자에게 Astra는 더 긴 컨텍스트, 더 강력한 도구 호출 및 컴퓨터 작동 기능을 제공하지만 더 높은 호출 비용과 더 엄격한 보안 제한이 동반됩니다.
따라서 이번 릴리스에서 실제로 관찰해야 할 것은 벤치마크 테스트에서 Astra가 GPT-5.6에 비해 얼마나 향상되었는지뿐만 아니라 모델이 사용자 인증 경계를 넘지 않으면서도 더욱 강력한 자율 실행 기능이 실제 비즈니스 시나리오에서 안정적으로 생산성으로 전환될 수 있는지 여부입니다.
댓글