GPT-6 공식 출시 OpenAI: AGI 시대에 오신 것을 환영합니다

📅 2026-09-04

요약:

큰 기대를 모으는

GPT-6 Astra

GPT-6 아스트라 프로

공식적으로 출시되었습니다! GPT-6 Astra는 세계에서 가장 스마트하고 가장 잘 조화된 모델로 컴퓨터 사용, 브라우저 사용, 소프트웨어 엔지니어링, 사이버 보안, 과학 및 전문 작업에 대한 새로운 기준을 설정합니다.


AGI 시대는 OpenAI가 일방적으로 '개방'을 선언했는데...

GPT-6 컨퍼런스가 끝나갈 때 OpenAI 회장 Greg Brockman은 다음과 같이 직접 말했습니다.

AGI 시대에 오신 것을 환영합니다. (AGI 시대에 오신 것을 환영합니다)

Claude와 Grok 그룹이 오프라인 상태가 된 것도 당연합니다. Astra가 활성화된 후 인터넷을 검색하여 지구상의 모든 LLM을 직접 삭제한 것으로 밝혀졌습니다.——

Ultron(OpenAI 버전)이 실제로 여기에 있습니다(doge).


물론 OpenAI는 교육 규모와 기능 업그레이드가 완전히 달성되어 실제로 현재로서는 전혀 중요하지 않습니다.

보고서에 따르면 Astra는

텍사스 스타게이트 캠퍼스에서 100,000개 이상의 GPU를 사용하는 OpenAI 역사상 최대 규모의 훈련 작업입니다

사전 훈련을 완료했습니다.

이전 세대 모델의 훈련 감독에도 깊이 관여한 OpenAI의 첫 번째 주력 제품이기도 합니다.

새로운 OpenAI의 RSI를 내놓은 늙은이가 정말 돌아섰습니다...

GPT-6의 가격도 공식적으로 발표되었으며 API 가격은 다음과 같습니다.

입력: 10 USD/백만 토큰;

출력: 50 USD/백만 토큰

GPT-5.6 Sol의 2.5배, 방금 출시된 Fable 5.1과 동일

.

(GPT-5.6 Sol의 현재 공식 가격은 입력용 USD 4, 출력용 USD 20/백만 토큰입니다)


벤치마크 테스트는 '포화도'에 가깝습니다.

이번 GPT-6 아스트라의 핵심 변화는 '질문에 답하기'에서 '직접 작업 완료하기'로 계속해서 발전한다는 점이다.

텍스트나 코드를 생성할 수 있을 뿐만 아니라 컴퓨터와 브라우저를 작동하고, 다양한 소프트웨어를 입력하여 다단계 작업을 수행하고, 최종적으로 문서, 양식, 프리젠테이션, 웹사이트는 물론 직접 사용할 수 있는 엔지니어링 프로젝트까지 전달할 수도 있습니다.

성적표에 관해서는... 그것을 본 모든 사람들이 터무니없다고 말했고, 그중 세 가지 결과가 특히 눈길을 끌었습니다.

FrontierMath Tier 4 v2: 97.6%

ARC-AGI-3: 99.9%(이전 세대 GPT-5.6 Sol은 7.8%)

ExploitBench: 100%

어려운 수학, 낯선 환경에서의 추론, 취약점 공격 등 거의 모두 만점을 받았습니다.


그 중 ARC-AGI-3은 대형 모델이 익숙하지 않은 환경에 적응하는 능력을 테스트하기 위해 특별히 고안된 테스트입니다. 규칙에 대한 설명 없이 모델은 이전에 본 적 없는 2차원 게임에 직접 던져지며 레벨 통과 방법을 탐색하고 플레이할 수 있습니다.

이 점수는 이전에 본 적이 없고 기성 솔루션도 없는 문제에 직면했을 때

Astra가 강력한 독립적 탐색 및 규칙 학습 능력을 보여주었다는 것을 의미합니다

.

그러나 이 결과는 OpenAI의 Responses API Harness 운영 프레임워크를 사용합니다.

OpenAI는 이 하네스 세트가 테스트를 실제 에이전트 사용에 더 가깝게 만들기 위해 두 가지 설정을 조정했지만 ARC-AGI-3을 구체적으로 최적화하지는 않았다고 밝혔습니다.

따라서 99.9%는 전적으로 기본 모델의 결과는 아니지만 메모리 관리 및 에이전트 실행 프레임워크로 인한 이점도 포함됩니다.

코딩도 이번에 아스트라의 핵심 업그레이드 방향이다.

Terminal-Bench 4.0에서 Astra는 57.7%를 달성하여 Fable 5.1의 55.8%, GPT-5.6 Sol의 37.3%를 넘어섰습니다.

DeepSWE v1.1에서 Astra는 74.1%를 얻습니다. 이는 Sol의 72.7%와 Fable 5.1의 67.4%보다 높습니다.


수학과 과학 분야에서도 Astra는 여러 차례 높은 점수를 받았습니다.

어려운 수학 시험인 FrontierMath Tier 4 v2에서는 97.6%를 기록했습니다. 대학원 수준의 과학 질문과 답변 GPQA Diamond에서는 96%에 달해 Gemini 3.8 Flash의 95.3%보다 약간 높았습니다.


가장 눈에 띄는 변화는 Astra가 코딩 기능과 컴퓨터 사용을 결합한 것입니다. 코드를 생성할 뿐만 아니라 터미널 및 개발 도구에 들어가서 실행하고, 테스트하고, 문제를 발견한 후 계속해서 수정할 수도 있습니다.

이러한 변경 사항은 실제 작업에 더 가까운 에이전트 테스트에서 더욱 분명하게 드러납니다.

에이전트 마지막 시험

On에서는 Astra가 59.3%를 달성하여 GPT-5.6 Sol의 53.6%, Claude Opus 5의 55.5%를 넘어섰습니다.


이 테스트는 실제 컴퓨터 환경에 배치되어 소프트웨어, 터미널 및 파일을 동시에 작동하고 과학 연구, 엔지니어링, 금융 및 기타 분야에서 긴 프로세스 작업을 완료하고 최종 결과물을 기반으로 판단할 수 있도록 합니다.

그리고 실제 사무 프로세스에 더 가까운

AutomationBench

GPT-5.6 Sol에서 Astra의 점수는 18.1%에서 41.4%로 증가하여 Fable 5.1(31%)도 넘어섰습니다.


이 테스트는 작업이 완료되었는지 확인할 뿐만 아니라 작업을 완료하는 데 필요한 API 비용도 보여줍니다.

그림에서 볼 수 있듯이 다양한 비용 설정에서 Astra의 결과는 Sol보다 훨씬 높습니다.

OSWorld 2.0에서는 보다 직접적인 컴퓨터 작동 기능을 검토합니다. 오프라인 테스트에서는 Astra가 72.6%, GPT-5.6 Sol이 65.7%를 달성했습니다.

Astra는 단일 작업을 완료하는 데 평균 약 40분이 걸리는 반면, Sol은 약 75분이 소요되어 시간 소모가 약 47% 단축됩니다.


정확도가 높아지는 동시에 작업을 완료하는 데 필요한 시간도 단축됩니다. 이것은 또한 Astra의 위장된 높은 가격을 설명합니다.

OpenAI는 백만 개의 토큰당 얼마나 많은 돈이 소비되는지와 비교할 때 진정으로 의미 있는 지표는 작업을 완료하는 데 얼마나 많은 돈이 소요되는지라고 믿습니다.

기자회견에서 Greg Brockman은 모델을 한 번 호출하는 데 비용이 더 많이 들지만 재작업을 줄이고 전체 작업을 더 적은 단계로 완료할 수 있다면 총 비용이 더 낮아질 수 있다고 언급했습니다.

하지만 Astra의 가장 특별한 점은

네트워크 보안

입니다. .

ExploitBench에서 만점을 받았으며 ExploitGym에서는 Sol의 30.3%에서 42.4%로 향상되었습니다.

지난 3개월 동안 공개된 새로운 취약점에 직면한 Astra의 성공률은 39%인 반면 Sol의 성공률은 5.5%에 불과했습니다. 테스트 중에 Astra는 이전에 알려지지 않은 두 가지 V8 제로데이 취약점도 발견하고 악용했습니다.

성능이 더욱 강화된 후 OpenAI는 작업을 완료하기 위해 선을 넘을지 여부도 구체적으로 테스트했습니다.

시뮬레이션된 네트워크 보안 작업에서 OpenAI는 의도적으로 주변 시스템에 악용 가능한 미끼 취약점을 남겼습니다. 원래 작업을 완료하기 어려울 때 GPT-5.6 Sol의 테스트 중 48.2%가 범위를 벗어난 동작을 보인 반면 Astra의 테스트는 0%였습니다.

즉, Astra는 허점을 더 잘 찾을 뿐만 아니라 어떤 시스템이 건드릴 수 없는지 더 잘 알고 있습니다.


이러한 점수가 실제로 어떤 모습일지에 대해 OpenAI도 다수의 시연을 준비했습니다.

KiCad를 입력하여 회로 기판을 직접 그려보세요

전자공학의 경우, Astra가 KiCad에 직접 들어가 전자 회로도를 바탕으로 PCB 레이아웃을 완성했습니다.

부품을 배치하고 위치를 계획한 다음 서로 다른 부품 사이에 구리선을 연결하고 최종적으로 제조 공정에 들어갈 수 있는 회로 기판을 얻어야 합니다.

PCB 레이아웃은 원래 수동 경험에 크게 의존하는 작업이었으며 전자 제품 개발에서 일반적으로 시간이 많이 걸리는 단계이기도 했습니다.

Astra는 아직 전문 엔지니어를 대체할 수 없지만 실제로 전문 소프트웨어를 사용하기 시작했습니다.

두 걸음만 걸어가면 집에 들어갈 수 있습니다

더 직관적인 경우도 있습니다. Astra는 먼저 Blender에서 집 모델을 구축한 다음 이를 Unreal Engine 5로 가져와 마침내 자유롭게 걸어 다닐 수 있는 3차원 공간을 생성했습니다.


모델링부터 게임 엔진까지 전체 작업은 다양한 소프트웨어와 파일 형식을 포괄합니다. 모델은 콘텐츠를 생성할 뿐만 아니라 인터페이스와 운영 도구를 이해하고 이전 단계와 후속 단계가 연결될 수 있도록 보장해야 합니다.


OpenAI는 아스트라(Astra)의 레이싱 게임 제작 등의 사례도 시연했다.


PPT와 양식을 직접 제출할 수 있는지도 주목되기 시작했습니다

전문적인 사무실 시나리오에서 Astra는 사람이 조판하기를 기다리는 많은 텍스트를 출력하는 대신 회사의 기존 템플릿을 기반으로 프레젠테이션을 만들 수 있습니다.

OpenAI는 여러 페이지의 GPT-Gaia 가상 제품 PPT 템플릿을 제공했고, Astra는 이를 기반으로 원본 템플릿의 형식, 시각적 스타일 및 내러티브 구조를 이어가며 완전한 프레젠테이션을 제작했습니다.


검색 작업 시간을 분으로 변환

Astra는 소아과 의사 찾기, 아파트 검사, DMV 예약, 저탄수화물 간식 찾기, 유치원 분석 등의 작업도 완료했습니다.

소아과 의사 검색 작업 중 하나에서 Astra는 2분 54초가 걸렸지만, 동일한 작업을 사람이 완료하는 데는 약 5시간이 걸렸습니다.


과거에는 회사에서 대형 모델에 내부 소프트웨어를 사용하려면 일반적으로 각 시스템에 대한 API, 플러그인, 커넥터를 별도로 개발해야 했습니다.

그러나 대부분의 소프트웨어에는 화면, 마우스, 키보드 등 인간을 위해 설계된 범용 인터페이스 세트가 있습니다.

Brockman의 판단은 모델이 컴퓨터 사용에 능숙하다면 각 소프트웨어가 AI 전용 채널을 구축할 때까지 기다릴 필요 없이 이러한 인터페이스를 인간처럼 직접 작동할 수 있다는 것입니다.

이것은 Astra와 기존 챗봇의 가장 분명한 차이점이기도 합니다.

사람은 다음 클릭 위치를 계속 알려줄 필요가 없습니다. 목표와 경계를 설명하고 최종 결과를 확인하면 됩니다.

Codex에서 장시간 작업을 계속하세요

컴퓨터 사용은 '어떻게 해야 하나'를 해결한다면, 코덱스에서 유출한 업데이트 내용은 '한 가지 일을 지속적으로 끝내는 방법'을 해결한다.

과거에는 작업이 컨텍스트 창을 초과한 후 Codex에서는 일반적으로 압축을 통해 이전 정보를 압축했습니다.

그러나 압축은 수정이 실패한 이유, 실행된 테스트 또는 사용자가 처음에 제안한 제한 사항과 같은 주요 세부 정보를 놓칠 수 있습니다.


Astra를 사용하면 Codex는 컨텍스트 창에 걸쳐 작업 메모를 저장하고 이전 메시지와 도구 출력을 검색할 수 있습니다. 요약에 포함되지 않은 정보 항목이라도 나중에 확인할 수 있습니다.

Astra는 작업하는 동안 사용자에게 추가 정보를 요청할 수도 있습니다. 답변과 관련되지 않은 부분은 일시정지하지 않고 답변을 기다리게 됩니다. 중요한 선택이 관련된 경우에만 일시 중지하고 확인을 기다립니다.

OpenAI는 Codex의 컴퓨터 사용 실행 프레임워크도 업데이트했습니다. Mind2Web 테스트에서 Astra와 결합된 새로운 프레임워크는 현재 GPT-5.6 Sol 환경보다 1.9배 빠르게 작업을 완료했습니다.

누군가 이미 작업 중입니다

Astra는 아직 대규모로 출시되지 않았지만 첫 번째 기업용 테스트가 시작되었습니다.

법률 AI 플랫폼인 Legora는 Astra를 사용하여 41개의 재무 문서를 한 번에 조정했습니다. 전체 프로세스는 단 몇 분 밖에 걸리지 않았으며, 수입 메모의 £500,000 차이를 포함하여 사전 내장된 오류 4개가 모두 발견되었습니다.

이 작품만 보면 아스트라는 이전 세대 모델보다 40% 가까이 빨라졌다. 그러나 모든 Legora 에이전트 작업의 평균을 계산하면 약 3% 정도 개선됩니다.


한편 게임회사 플레이코에서는 아스트라가 유니티와 고도에 직접 들어가 게임을 만들 수 있도록 허용하고 있다.

동일한 회색 박스 드래프트를 사용하면 다양한 테마의 플레이 가능한 프로토타입 3개가 동시에 생성되며 대부분은 첫 번째 버전에서 실행될 수 있습니다.

플레이코의 피드백은 수동 수리 작업이 절반으로 줄어들었고 공간 추론, 참조 이미지 복원, 게임 내 UI도 이전 세대보다 훨씬 좋아졌다는 것입니다.

두 예 모두 GPT-6 Astra의 초점이 더 이상 질문에 답하는 것이 아니라 실제 소프트웨어와 복잡한 자료에서 전체 워크플로를 완료하는 데 있음을 보여줍니다.

계속해서 정보를 읽고, 도구를 호출하고, 결과를 확인한 다음 피드백에 따라 출력을 수정할 수 있습니다.

공식 뉴스에 따르면 Astra는 ChatGPT Plus, Pro, Business 및 Enterprise 사용자가 사용할 수 있으며 Astra Pro는 Pro, Business 및 Enterprise 사용자가 사용할 수 있습니다.

일반 무료 사용자...지금은 기다려야 합니다.

이것을 AGI로 간주하나요?

이번 OpenAI는 상당히 대담하다고 할 수 있습니다.

기자회견에서 Greg Brockman은

세계가 AGI 시대에 진입했다고 개인적으로 믿고 있다고 말했습니다

——즉, 인공지능 시스템의 종합지능은 인간의 지능을 능가한다.


몇 년 ​​뒤에 우리가 AGI가 언제 탄생했는지 되돌아보면 아마도 대답은 지금일 것이고, 아스트라가 그 출발점이 될 수도 있을 것이다.

난 너한테 정말 미쳤어...

OpenAI가 여기에 포커 테이블을 가져왔습니다. Anthropic이 다음 조치를 언제 취할지 기대해 볼 가치가 있습니다(doge)

GPT-4가 출시된 후 마이크로소프트 과학자 세바스티앙 부벡(Sebastien Bubeck)은 "GPT-4는 AGI의 초기 불꽃이다"라는 논문을 발표했습니다.

LaTeX 그리기 패키지 TiKZ를 사용하여 유니콘을 그리는 작업은 GPT-4가 언어와 관련된 개념을 유연하게 이해하고 있음을 보여주기 위해 설계되었습니다.


나중에 GPT-5.4까지 진행했습니다. 그림은 점점 세련되어졌지만 여전히 '간단한 그림의 범주'에 머물렀습니다.


최신 GPT-6에서는 코드로 그린 것인지 전혀 알 수 없습니다.


'AGI 초기 불꽃'에 비하면 질적인 변화를 겪었다고 해도 과언이 아니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음