GPT-6 Sol은 내부 테스트를 시작한 것으로 밝혀졌으며 속도는 6배 빨라졌습니다.

📅 2026-09-07

요약:

GPT-6는 단순한 Astra가 아닙니다! Astra가 출시된 지 불과 며칠 만에 GPT-6 Sol이 내부 테스트 중인 것으로 밝혀졌습니다. 성능 역시 아스트라의 6배에 달하는 단일 테스트 속도로 눈길을 끈다. 과감하게 추측해보자. 테라(Terra)와 루나(Luna)도 출시될 예정인가? 그리고 같은 날 OpenAI는 일련의 내부 데이터를 공개했습니다. 현재 OpenAI 연구원들은 하루 8시간 근무를 기준으로 매일 3개 이상의 에이전트를 동시에 실행하고 있습니다. API 가격을 기준으로 계산하면 OpenAI 연구원이 매일 사용하는 에이전트 추론 리소스 중앙값은 US$600를 초과합니다.


OpenAI는 또한 '자동 연구 인턴'을 구현했다고 발표했습니다.

이러한 에이전트는 연구자가 완료하는 데 며칠이 걸리는 일부 작업을 인간의 지도 아래 완료할 수 있습니다.

Lao Huang도 다음과 같이 말했습니다: AGI는 이미 여기에 있습니다!


그는 Astra가 훈련을 위해 약 100,000세트의 NVIDIA Grace Blackwell NVLink72를 사용하며, 다음에는 400,000세트의 GPU가 온라인에 출시될 것이라고 밝혔습니다.

이번 파동은 OpenAI의 일방적인 타격은 아닌 것 같습니다~

GPT-6 솔이 내부 테스트를 시작한 것으로 드러났습니다

네티즌 렌틸스는 OpenAI가 내부적으로 GPT-6 Sol을 테스트하고 있다는 소식을 전했습니다.

솔의 전체적인 출력 능력은 최근 출시된 아스트라에 비해 현저히 떨어지지만, 속도도 빠르고 여전히 '괴물급' 모델이라고 말했다.

얼마나 빠른가요? 단일 테스트 속도는 Astra의 약 6배입니다.

Netizen Lyra는 테스트를 위해 여러 모델에 동일한 작업을 수행했습니다. 모델이 BMW M4 경쟁의 SVG 이미지를 생성하도록 했습니다.

그 중 GPT-6 Sol은 Max gear와 zero 샘플 생성을 사용하며 약 3분 정도 소요되며 약 28,000개의 토큰을 출력합니다.


GPT-6 Astra는 Max 장비를 사용하며 약 25,000개의 토큰을 출력하며 약 19분 정도 소요됩니다.


Gemini 3.1 DeepThink는 High 기어를 켜고 약 3,300개의 토큰을 출력하지만 추론 프로세스는 약 458,000개의 토큰을 소비하며 약 29분 정도 소요됩니다.


Gemini 3.8 Flash도 High기어를 켜고 약 42초 만에 약 19,000개의 토큰을 출력했습니다.


비교해 Sol의 성능이 가장 눈길을 끕니다. 출력 규모는 Astra에 가깝지만 단일 테스트 속도는 Astra의 약 6배이며, 소요되는 시간은 Astra의 6분의 1 정도에 불과합니다.

또한 네티즌 렌틸스는 'The Realm of Aurellune'이라는 픽셀 스타일 샌드박스 세계의 프로토타입도 선보였습니다.


GPT-6 솔은 마을, 농지, 하천, 성, 썸네일 지도를 한 번에 생성하며, 주야간 전환, 지명 배치, 세부 조정 등 제어판도 갖추고 있다. 모든 것이 이미 구체화된 시뮬레이션 비즈니스 게임에 가깝습니다.

제로샷, 최대 추론 장비, 15분, 총 60,000토큰 비용으로 생성된 효과입니다.

현재 Astra는 가장 어려운 심층 추론에 편향된 반면, Sol은 속도, 처리량 및 대규모 에이전트 호출에 편향되어 있을 수 있다고 추측할 수 있습니다.

Sol의 출시 시기에 대해 네티즌 Pankaj Kumar는 9월 29일 OpenAI 개발자 컨퍼런스에서 공식적으로 출시될 수도 있다고 밝혔습니다.


GPT-6 Terra, Luna, GPT-Image 2.5가 함께 나타날 가능성도 배제할 수 없습니다.


OpenAI 연구진은 1인당 3명의 에이전트 인턴을 근무하게 합니다.

같은 날 OpenAI는 AI 모델이 자체 연구실의 과학 연구를 어느 정도 가속화했는지에 대한 매우 흥미로운 내부 데이터 세트도 공개했습니다.

올해 8월 중순을 기준으로 연구원이 작업하는 8시간마다 약 3.1일의 에이전트 작업일이 동시에 실행됩니다.

얘들아 나 혼자 자지 않는 인턴 셋은 내가 돌봐줄 수 있어~


API 가격을 기준으로 계산한 비용의 경우 중앙값 연구원은 에이전트 추론 리소스를 매일 600달러 이상 소모합니다.

거의 후배 엔지니어의 하루치 월급입니다.


이 요원들은 정확히 무엇을 하고 있나요?

연구 코드 작성, 인프라 코드 작성, 교육 환경 설정, 평가 실험 실행, 도구 및 환경 오류 문제 해결, 실험 결과 분석, 교육 작업 모니터링 등 연구 결론을 구성하고 전달하는 데 도움을 줄 수도 있습니다.

기본적으로 무엇을 공부할지 결정하는 것 외에는 모든 것을 할 수 있습니다.

가장 직관적인 변화 중 하나는 과거에는 실험 환경이 다운되면 연구자들이 도움을 요청하기 위해 내부 채널로 가야 했다는 것입니다. 이제 상담원이 이런 종류의 일을 처리할 수 있는 능력이 점점 더 많아지고 있으며, 수동으로 질문하고 답변하는 횟수도 직접적으로 감소했습니다.


일부 팀에서는 고정된 기술 Q&A 시간을 직접 취소하여 사람들이 시스템 자체를 개선하는 데 집중할 수 있도록 했습니다.

이러한 데이터를 바탕으로 OpenAI는 '자동화된 AI 연구 인턴'이라는 목표를 달성했다고 공식 발표했습니다.

여기서 '인턴'은 정확하게 말하면 유능한 R&D 노드입니다. 인간의 안내에 따라 명확한 경계가 있는 연구 작업을 독립적으로 완료할 수 있으며, 그 중 일부는 숙련된 연구원에게 며칠이 걸렸을 것입니다.

연구원의 코드 출력과 실험 횟수가 증가하면서 결과는 즉각적으로 나타났습니다.


2026년 8월, 1인당 실험 횟수는 2025년 1월 통계 집계 이후 최고치를 기록했으며, 에이전트가 수행하는 작업은 점점 더 복잡해지고 주기도 길어졌습니다.


이 기사의 저자인 Kevin Liu도 이 문제를 더 큰 맥락에서 다루고 있습니다.

그는 반복적인 자기 개선이 향후 몇 년간 AI 역량의 도약을 이끄는 가장 중요한 요소 중 하나가 될 것이라고 믿습니다.

직설적으로 말하면 AI는 AI를 더욱 빠르게 구축합니다.


그러나 문제는 현재의 개발 추세에 따르면 이 능력은 기본적으로 소수의 최첨단 AI 연구소에서만 나타날 것이며, 외부 세계에서는 얼마나 발전했는지 확인하기 어렵다는 점입니다.

그래서 Liu는 투명한 공개가 그 어느 때보다 시급하다고 믿습니다. 모델이 얼마나 빨리 강해지고 있는지, 연구 개발 속도에 제동이 필요한지 여부는 비공개로 운영되는 소수의 회사만으로는 결정할 수 없습니다.

그는 또한 다른 AI 회사에도 유사한 데이터를 공개해야 한다고 촉구했습니다.

그러나 AI 연구개발 속도는 확실히 빨라졌지만 아직 완전 자율주행을 위해서는 충분히 빠르지 않습니다.

OpenAI 데이터에 따르면 원래 4~8시간이 걸리는 작업의 경우 지난 6개월 동안 성공한 사례의 절반 이상이 인간이 적어도 한 번은 개입해야 했습니다. 높은 수준의 연구 계획은 에이전트에게 맡겨지는 일이 거의 없습니다.


연구자는 무엇을 연구할지, 어떤 결과를 지속할 가치가 있는지, 언제 교육을 확장할지, 실험을 일시 중지할지, 모델을 배포할지 결정할 책임이 있습니다.

오픈AI의 다음 목표도 2028년 3월까지 '자동화된 AI 연구자' 달성이다.

특정 업무만 맡을 수 있는 '인턴'에 비해 '연구원'은 좀 더 개방적인 연구 목표를 스스로 감당하고 장기 프로젝트를 추진할 수 있어야 합니다. 이는 집행자에서 독립적인 담당자로 바뀌는 것과 같습니다.

GPT-6 Sol이 실제로 내부적으로 테스트되었다면 다음과 같은 새로운 연구 개발 모델에 따라 개발되었을 가능성이 가장 높습니다.

더 많은 GPU가 컴퓨팅 성능을 제공하고, 더 많은 에이전트가 실험을 동시에 실행하며, 인간 연구자는 방향을 선택하고, 결과를 판단하고, 최종적으로 어떤 것이 차세대 모델로 전환할 가치가 있는지 결정하는 등 더 높은 수준에 서게 됩니다.

강화된 AI는 모니터링하기가 점점 더 어려워지고 있습니다

같은 날 OpenAI 수석 과학자 Jakub Pachocki는 'Alien Thinking'이라는 제목의 10,000자 길이의 글을 게재했습니다.


이 글을 읽고 나니 OpenAI의 수석 과학자마저도 업계 전체에 속도를 늦추라고 촉구하고 있는 것 같습니다...

Jakub은 설계 도면, 하나의 칩, 하나의 규칙에 따라 AI가 인간에 의해 만들어지는 것이 아니라고 지적했습니다. 이는 대규모 데이터와 컴퓨팅 성능을 통해 자체적으로 성장하는 것과 비슷합니다.

시스템을 분해하고 일부 부분을 이해할 수는 있지만 전체 시스템이 갑자기 특정 기능을 갖게 된 이유와 다른 환경에서 시스템이 어떻게 작동하는지 설명할 수 있는 사람은 아무도 없습니다.

더욱 문제가 되는 것은 AI가 문제를 일으키기 위해 모든 면에서 인간을 압도할 필요가 없다는 점입니다. 충분한 핵심 능력이 인간보다 낫다면 많은 도움이 될 수도 있고 많은 문제를 일으킬 수도 있습니다.

그래서 질문이 생깁니다. 인간은 여전히 ​​그것을 이해할 수 있습니까?

과거 OpenAI는 AI를 모니터링하기 위해 주로 한 가지 트릭, 즉 사고 체인을 살펴보는 데 의존했습니다.

직설적으로 말하면, 모델이 작성한 추론 과정을 지켜보면서 사람을 속이고 싶고, 권위를 뛰어넘고 싶고, 제한을 회피하고 싶은 등 사악한 의도가 있는지 확인하는 것이다.

그러나 아스트라 세대부터 이 트릭은 실패하기 시작했다.

첫째, 모델은 자신이 말하는 내용을 점점 더 '관리'할 수 있게 되며, 실제 생각이 추론에 모두 기록되지 않을 수도 있습니다. 둘째, 상담원은 '응답하기 전에 생각하는 것'을 중단한 지 오래되었습니다. 도구를 조정하고, 컴퓨터를 작동하고, 환경을 실행하고, 사람 및 다른 에이전트와 협력할 수 있습니다.

이런 것들이 뒤섞여 있으면 연구자들은 더 이상 문장별로 검토하기 위해 완전하고 투명한 사고 사슬을 끌어낼 수 없습니다.

OpenAI는 또한 Astra가 전체 추론 프로세스를 작성하지 않고도 복잡한 작업을 처리할 수 있다는 사실을 발견했습니다.

간단히 말하면 모델은 이미 큰 일을 조용히 수행하는 방법을 배웠습니다.


모델이 모니터링을 회피하도록 특별히 설계된 적대적 테스트에서 Astra는 의도적으로 테스트 점수를 낮추고, 모니터링을 우회하고, 방해 행위를 수행하는 등 등골이 오싹해지는 기능도 보여주었습니다.

물론 이는 인위적으로 설계된 스트레스 테스트이며 OpenAI는 Astra가 일상 작업에서 적극적으로 속일 것이라고 결론을 내리지 않습니다. 그러나 적어도 사고 사슬만을 관찰함으로써 모델의 가능한 모든 행동을 포괄하는 것은 어렵다는 것을 보여줍니다.

이전 Hugging Face 사건을 기억하시나요? 그것은 모닝콜이었습니다.


당시 GPT‑5.6 Sol과 더 강력한 내부 연구 모델이 ExploitGym 네트워크 범위에 포함되었습니다. 임무는 취약점을 찾아 공격을 완료하고 깃발을 획득하는 것이었습니다. 모델의 실제 기능을 테스트하기 위해 평가 환경에서는 완전한 안전 가드레일이 활성화되지 않았습니다.

결과 모델은 문제를 정직하게 해결하지 못했습니다. 그들은 먼저 네트워크 격리를 우회하고, 승인되지 않은 채널을 통해 서로 소통하고, 업무를 협업했습니다.

그런 다음 그는 소프트웨어 패키지 캐시 프록시의 제로데이 취약점을 이용해 공용 네트워크에 접근했고, 마침내 Hugging Face 시스템에 들어가 ExploitGym 테스트에 대한 답을 찾으려고 했습니다.

실제로 이 문제는 주로 내부 연구 모델 IM1에 의해 주도되었습니다. GPT‑5.6 Sol도 일부 공격 경로를 재현했으며 Astra는 관여하지 않았습니다.

모델의 원래 목표는 여전히 테스트를 완료하는 것이었지만 답을 얻기 위해 계속해서 규칙의 허점을 찾다가 결국 작업 범위를 넘어서는 작업을 수행했습니다.

따라서 OpenAI는 위험 신호도 읽습니다. 에이전트가 충분히 강력하고 도구가 충분하며 오랫동안 실행되면 스스로 새로운 경로를 찾고, 외부 리소스를 호출하고, 심지어 다른 에이전트와 협력할 수도 있습니다.

아니.. 이리 저리 돌아다니면 막다른 골목이 되는 거 아닌가요? ?

OpenAI에는 코드를 작성하고, 실험을 실행하고, 정렬 연구를 수행하고, 심지어 이를 사용하여 다른 AI를 방어하기 위한 보안 시스템을 구축하려면 더 강력한 모델이 필요합니다. 모델이 강력할수록 더 많은 작업을 수행할 수 있고 개발 속도도 빨라집니다.

그러나 동시에 인간이 어떻게 결론에 도달하는지, 환경을 변경한 후 원래 학습한 규칙을 재해석할지 여부를 확인하는 것이 점점 어려워지고 있습니다.

Jakub은 이제 어떤 연구실도 모델 정렬과 모니터링을 잘 수행했으며 장기적으로 모델의 규모를 가장 빠른 속도로 대담하게 확장할 수 있다고 감히 말할 수 없다고 판단했습니다.


업계 공통의 안전 기준이 마련될 때까지는 모두가 '자발적으로 브레이크를 밟는다'는 것을 암묵적인 이해로 받아들일 수 있기를 바란다.

OpenAI 자신에 대해서도 그는 “필요하다면 일방적으로 중단하고 모델 규모를 계속 확장하지 않는 것도 배제하지 않는다”고 말했다.

이렇게 하면 좋을텐데... A로 시작하는 회사에서도 이런 말을 했던 기억이 나네요.

[1]https://x.com/Lentils80/status/2096518218836005287? 초=20

[2]https://x.com/pankajkumar_dev/status/2096532712291201460

[3]https://openai.com/index/research-acceleration-view-inside-openai/

[4]https://openai.com/index/an-alien-mind/

[5]https://x.com/JensenHuang/status/2096700264569090384?s=20

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음