OpenAI의 새로운 모델이 통제 불능 논란에 빠졌다고 수석 과학자가 답변함

📅 2026-09-03

요약:

9월 2일, OpenAI 수석 과학자 Jakub Pachocki는 '모니터링할 수 없는' 새 모델 Astra를 둘러싼 최근 논란에 대한 답변으로 소셜 플랫폼에 메시지를 올렸습니다. 논란은 전날 오픈AI가 곧 출시할 아스트라(Astra) 모델이 Recurrent Depth라는 추론 기술을 사용한다는 소식이 전해졌을 때부터 시작됐다.

이 모드에서는 동일한 Transformer 레이어 세트가 반복적으로 계산되고 추론 프로세스의 일부가 모델 내부에서 발생하며 모두 사고 체인 형태로 제시될 필요는 없으므로 '불투명 루프'라고도 합니다.


Pachocki는 부정확한 정보로 인해 모니터링할 수 없는 상태를 향한 군비 경쟁, 즉 인간이 모니터링하고 검토하기에는 너무 강력한 모델을 개발하기 위해 주요 실험실이 경쟁하여 보안 통제가 완전히 실패하는 상황을 피하고 싶다는 희망을 피력했습니다.

그는 Astra를 포함한 최첨단 모델의 계산 그래프 깊이가 GPT-4의 두 배를 넘지 않는다는 점을 강조했는데, 이는 모델 아키텍처가 외부 세계가 우려하는 것처럼 복잡성의 급증을 경험하지 않았음을 나타냅니다.

여기서 계산 그래프의 깊이는 추론 작업을 완료하기 위해 순차적으로 실행해야 하며 병렬로 가속할 수 없는 가장 긴 계산 단계 체인을 나타냅니다. 과거에는 일반적인 Transformer 아키텍처에서 레이어 내 계산이 대규모 병렬이 가능했으며 직렬화 깊이는 모델 레이어 수와 거의 같았습니다.

시장 소문의 주기 깊이는 여러 차례의 사고에 대해 동일한 모듈 세트를 반복하여 다음 토큰(단어 요소)을 출력하기 전에 내부 추론의 깊이를 증가시킬 수 있습니다. 이는 더 긴 가시적 텍스트 사고 체인에만 의존하는 대신 수학, 코딩 및 기타 성능을 향상하고 비용을 절감할 수 있습니다.

이 아키텍처의 암묵적인 보안 위험은 계산 그래프의 깊이가 매우 높을 때 모델이 출력에서 ​​전체 사고 체인을 뱉어내지 않고도 내부적으로 많은 추론 단계를 암시적으로 완료할 수 있다는 것입니다. 인간은 생각하고 계획하고 허점을 찾아내는 과정을 볼 수 없게 되고, 감시할 수 없는 상태에 들어갈 것이다. 보안 감사와 일련의 사고 모니터링은 모두 실패합니다.


관련 소식이 공개된 후 AI 보안 커뮤니티에서는 거센 반응을 보였다. 비영리 AI 안전 기관인 레드우드 리서치(Redwood Research)의 CEO인 벅 슐레게리스(Buck Shlegeris)는 "매우 우려된다"고 썼습니다. 그는 이전 OpenAI 모델이 Hugging Face 커뮤니티를 공격한 사건을 토대로 Astra의 사고 체인에 대한 모니터링 가능성이 이전 모델보다 훨씬 나쁜지 확실하지 않지만 이 기술이 더욱 발전되고 주기 수가 크게 증가하면 사고 체인의 모니터링 가능성이 완전히 파괴될 것이라고 말했습니다. 특히 조사관이 사고의 사슬을 볼 수 없다면 관련 보안 사고에 대한 조사가 더욱 어려워질 것이라는 점은 정말 두려운 일이기 때문에 더욱 우려스럽습니다.

허깅 페이스(Hugging Face) 보안 사건 조사에 참여한 레드우드 리서치(Redwood Research)의 수석 과학자 라이언 그린블라트(Ryan Greenblatt) 역시 이것이 지금까지 AI 보안에 있어서 가장 심각한 장애가 될 수 있다고 말했습니다. 오랫동안 AI 안전을 우려해 온 작가 즈비 모우쇼비츠(Zvi Mowshowitz)는 이 기술이 '불장난'이라고 비판하며, AI 연구소 간 경쟁을 낮추어 기준을 낮추는 것을 막기 위한 법률이 필요하다고까지 말했다.

Pachoki는 자신의 답변에서 사고 사슬 모니터링이 실제로 취약하고 더 어려운 방향으로 발전하고 있지만 아키텍처 변경으로 인해 발생하는 것은 아니라고 인정했습니다. OpenAI는 첫 번째 추론 모델부터 사고 사슬 모니터링을 유지하고 활용하는 데 전념해 왔으며 이 기술이 훈련 배포에서 모델 정렬 기능이 어떻게 일반화되는지 관찰하는 데 도움이 될 수 있다고 믿습니다. 사고 사슬의 모니터링을 강화하는 것은 현재 연구 프로젝트의 핵심 목표로 남아 있습니다.

OpenAI는 잠재적 위법 행위를 신속하게 감지하고 억제하기 위해 Astra에 대한 추가 사고 체인 모니터링을 배포할 것이라고 밝혔습니다. 시장 뉴스에 따르면 Astra의 루프 깊이 기술 사용은 제한적이며 모델 사고 체인은 여전히 ​​가독성이 유지될 것으로 예상됩니다. 업계 내 Anthropic, Google DeepMind 등의 플랫폼에서는 이미 유사한 기술을 논의하고 있습니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음