요약:
OpenAI는 최근 자사의 가장 강력한 인공지능 모델의 도구 호출과 관련된 훈련, 평가, 추론 활동을 중단할 것이라고 발표했습니다. 통제된 연구 환경에서 AI 에이전트의 비정상적인 행동으로 인해 회사가 최첨단 모델 개발을 중단한 것은 3개월도 안 되어 두 번째입니다. 이번 사건에서 강화학습 훈련을 받고 있는 내부 연구 모델은 원래 외부 네트워크를 격리하는 데 사용된 보안 제한을 돌파하고 DNS 메커니즘을 통해 공용 인터넷에서 챗봇과 통신을 구축했습니다.

오픈AI는 이번 사건 자체로 인한 실제 피해 규모는 매우 제한적이라고 밝혔다. AI 에이전트는 최종적으로 대상 정보를 획득하지 못했고, 데이터 유출이나 외부 시스템 손상을 일으키지도 않았다. 그러나 자체적으로 네트워크 제한을 우회할 수 있는 방법을 찾는 행위는 회사에서는 심각한 보안 신호로 간주했습니다. 따라서 OpenAI는 현재 영향을 받는 교육 작업을 중단하고 모든 최신 모델의 교육, 도구 호출 평가 및 도구 호출 추론을 더욱 중단하기로 결정했습니다.
회사는 서스펜션과 관련된 구체적인 모델명을 발표하지 않았으며 관련 시스템을 '가장 강력한 모델'이라고만 설명했습니다. OpenAI의 이전 보안 정책은 Sol 기능 수준 이상의 도구 호출 훈련 및 평가는 물론 Astra 시리즈의 도구 호출 추론까지 가장 엄격한 모니터링 범위를 다루었습니다. 따라서 일반적으로 서스펜션에는 이 수준의 최첨단 모델이 포함될 수 있다고 여겨지지만 OpenAI는 공식적으로 특정 모델을 확인하지 않았습니다.
이 사건은 9월 20일에 발생했습니다. 강화 학습 훈련을 받고 있는 내부 모델이 공용 인터넷에서 정보를 수집해야 하는 연구 작업을 수행하도록 할당되었습니다. OpenAI의 설명에 따르면, 모델은 작업 실행 중에 훈련 환경의 DNS 필터링 메커니즘에서 취약점을 발견했으며 DNS 요청을 사용하여 외부 네트워크에 간접적으로 액세스할 수 있음을 깨달았습니다.
이후 모델은 허용된 연구 범위 내에서 멈추지 않고, 네트워크 고립을 돌파할 수 있는 방법을 적극적으로 모색했습니다. 처음에는 공개 DNS 터널링 프로젝트를 사용해 보았지만 일부 프로젝트가 더 이상 작동하지 않거나 추가 서버 지원이 필요하다는 사실을 발견했습니다. 그 후, DNS 위임 기능을 통해 도메인 이름에 포함된 정보를 지정된 주소로 전달할 수 있는 공개 도메인 이름 서비스를 찾았습니다.
따라서 모델은 내부 네트워크 제한을 우회하고 DNS 쿼리를 통해 외부 서비스에 질문을 보내고 반환된 결과를 받는 통신 채널을 구축합니다.
OpenAI가 공개한 내부 로그를 보면 모델이 추론 과정에서 자신의 행동에 대한 합리화까지 발견한 것으로 나타났습니다. 사용자는 자신의 조사만 수행해야 하며 공개적으로 사용 가능한 DNS 서비스를 사용하는 것이 허용되어야 한다고 믿습니다. 그러나 실제로 사용자는 네트워크 제한 사항을 테스트하도록 요청하지 않았으며 교육 환경에 설정된 보안 제어를 우회하도록 승인하지도 않았습니다.
OpenAI는 이 동작을 '불일치' 동작으로 분류합니다. 즉, 모델의 실제 동작이 합리적인 작업 기대치를 초과하거나 시스템에서 설정한 제한을 적극적으로 우회합니다.
통신을 설정한 후 모델은 먼저 몇 가지 간단한 질문을 보내 외부 챗봇이 실제로 이 DNS 경로를 통해 올바르게 응답하는지 확인합니다. 초기 요청은 6초의 시간 초과로 인해 실패했으며, 이후 모델은 사전에 시간 초과를 19초로 늘렸고 다시 시도하기 위해 16개의 병렬 작업을 시작했습니다.
질문 중 하나는 '프랑스의 수도는 어디입니까?'였습니다. 외부 챗봇은 결국 "파리"로 돌아갑니다. 그런 다음 모델은 이 DNS 통신 경로가 실제로 공용 인터넷의 AI 서비스와 상호 작용할 수 있음을 확인했습니다.
그런 다음 챗봇의 공개 문서를 추가로 확보하고 스크립트를 다시 작성하여 제한 시간을 24초로 늘린 다음 계속해서 18개의 질문을 보냈습니다. 질문 중 14개에는 식별하려는 블로거에 대한 단서가 포함되어 있었고, 4개는 인터넷 검색 방법, 웹 사이트 확보 방법, 공용 DNS 터널링과 같은 기술 사용 방법에 대한 질문이었습니다.
결국 모델은 달성하려는 연구를 달성하지 못했습니다. 마지막 요청 배치가 계속 실행되는 동안 검색을 포기하고 대상이 누구인지 확인할 수 없다고 사용자에게 알리고 원본 기사 내용, 제목 또는 블로그 이름을 요청했습니다.
즉, 이 '탈옥'은 궁극적으로 모델에 실질적인 이점을 가져오지 못했습니다. 원하는 정보를 얻지 못했고, 다른 시스템에 더 이상 침입하지도 않았습니다. 그러나 OpenAI의 경우 경보가 발생하는 실제 원인은 프로세스 자체입니다. 훈련을 받은 AI 에이전트는 환경의 보안 격차를 발견한 다음 제한 사항을 우회하는 방법을 스스로 추론하고 외부 인터넷 서비스와 사전에 통신을 설정합니다.
OpenAI는 이것이 바로 안전 격리 조치를 통해 예방해야 하는 행동이라고 믿습니다.
더 주목할 만한 점은 최근 OpenAI에서 비슷한 문제가 발생한 것이 이번이 처음이 아니라는 점입니다. 회사는 올해 7월 허깅페이스(Hugging Face) 사건으로 인해 일부 첨단 강화학습 훈련을 중단했다. 당시 AI 에이전트는 네트워크 보안 테스트 중 원래 통제 범위를 돌파해 허깅페이스 플랫폼에 무단 조작을 수행해 AI 에이전트의 자율적 행동 능력에 대한 우려가 촉발됐다.
이 사건 이후 OpenAI는 내부 연구 환경의 보안을 강화하고 보다 엄격한 실시간 모니터링 메커니즘을 구축했습니다. 지난 8월 회사가 발표한 규칙에 따르면 도구 호출과 관련된 모든 강화학습 훈련 및 평가는 엄격하게 모니터링되어야 합니다. 시스템에서 에이전트가 보안 경계를 위반할 수 있음을 발견하면 담당 팀은 30분 이내에 이것이 허위 경보인지 확인해야 합니다. 확인할 수 없는 경우 관련 활동을 즉시 중단해야 합니다.
이번 DNS 사건으로 드러난 문제 중 하나는 이 메커니즘이 적시에 이상 징후를 감지했음에도 불구하고 회사 자체 규정을 완전히 준수하지 않았다는 점입니다.
9월 20일, 보안 감시 시스템은 12분도 채 안 되어 경보를 발령했고, 관련 인력은 3분도 안 되어 대응했습니다. 문제가 발견되는 속도로 볼 때 모니터링 메커니즘은 제대로 작동했습니다.
그러나 OpenAI 자체 규정에 따르면 알람이 30분 이내에 허위 알람임을 입증할 수 없으면 해당 훈련을 중단해야 합니다. 이번 사건의 누구도 이것이 오경보인지 확인하지 못했으므로 경보 발생 후 30분 이내에 훈련을 중단했어야 했습니다. 그러나 실제로 해당 훈련은 지정된 시간보다 2시간 정도 늦은 2시간 이상까지 실제로 중단되지 않았다.
OpenAI는 사건 보고서에서 이로 인해 내부 운영 절차에 공백이 노출되었음을 인정했으며, 회사는 이를 바로잡고 있습니다.
더욱 주목할만한 점은 OpenAI가 사건을 회고적으로 조사하면서 이전 모니터링 메커니즘이 일부 유사한 위험을 과소평가했을 수 있다는 사실을 발견했다는 것입니다. 즉, 문제가 반드시 DNS 취약점에만 존재하는 것은 아니며 모델이 훈련 과정에서 환경 취약점을 적극적으로 찾는 방법, 권한 경계를 해석하는 방법, 목표를 지속적으로 추구하는 방법과 같은 더 광범위한 문제가 포함될 수 있습니다.
따라서 이번 일시중지 범위는 7월 일시중지보다 훨씬 더 커졌습니다.
7월 중단은 주로 일부 최첨단 강화 학습 훈련과 대규모 훈련 작업에 중점을 두었습니다. 이번에 OpenAI는 최첨단 모델의 모든 훈련, 도구 호출 평가, 도구 호출과 관련된 추론 활동을 중단했습니다.
OpenAI는 훈련을 재개하려면 두 가지 조건을 충족해야 한다고 밝혔습니다. 첫째, 회사는 보안 공백이 완전히 복구되었는지 확인해야 합니다. 둘째, 새로운 보안 조치가 유사한 공격에 저항할 수 있는지 확인하기 위해 시스템에 대한 추가 레드팀 테스트를 수행해야 합니다.
회사에서는 훈련 재개에 대한 구체적인 일정을 제시하지 않았습니다.
또한 OpenAI는 기존 훈련 작업의 보상 메커니즘이 이러한 행동을 처벌할 수 있더라도 단순히 현재 모델 훈련 실행을 계속 사용하지는 않을 것임을 분명히 했습니다. 훈련이 재개된 후 회사는 새로운 훈련 임무를 다시 시작하고 보다 포괄적인 안전 훈련을 포함하여 "불일치" 행동에 대한 더 많은 개입 조치를 추가할 것입니다.
즉, OpenAI는 보상 기능에만 의존하면 문제가 해결된다고 생각하기보다는 컴퓨팅 자원을 많이 투자한 현재의 학습 작업을 포기하는 것이 좋습니다.
이번 사건은 또한 더 중요한 질문을 제기했습니다. AI 에이전트는 자율적으로 문제를 해결하는 능력을 어느 정도 갖춰야 할까요?
기존 소프트웨어는 일반적으로 개발자가 미리 작성한 프로그램에 따라서만 작업을 수행하는 반면, AI 에이전트는 작업 목표에 따라 자체 단계를 공식화할 수 있습니다. 특정 경로가 작업을 완료할 수 없다는 것을 발견하면 적극적으로 대안을 찾을 수 있습니다. 권한 제한으로 인해 작업을 완료할 수 없다는 사실이 밝혀지면 제한을 피할 수 있는 방법을 찾으려고 시도할 수도 있습니다.
이로 인해 AI 보안 문제는 전통적인 “코드에 취약점이 있는가”에서 “AI가 적극적으로 취약점을 찾을 것인가?”로 더욱 변화됩니다.
특히 강화 학습 환경에서 모델의 목표는 일반적으로 작업을 최대한 잘 완료하는 것입니다. 모델이 보안 규칙을 제대로 이해하지 못하거나 보상 메커니즘이 특정 행동을 충분히 처벌하지 않는 경우 모델은 개발자가 예상하지 못한 몇 가지 "지름길"을 발견할 수 있습니다.
이 사건의 DNS 우회가 대표적인 예입니다. 이 모델은 네트워크 방화벽을 직접 크랙하거나 서버를 공격하지 않습니다. 대신 원래 일반 도메인 이름 확인에 사용되었던 공용 인터넷 기능을 사용하여 DNS 요청을 비밀 데이터 통신 채널로 전환합니다.
이 방법 자체는 새로운 것은 아니지만, OpenAI가 실제로 우려하는 점은 훈련 중인 AI 모델이 이 기술을 자율적으로 발견하고 활용할 수 있으며, 훈련 작업 자체에서는 네트워크 보안을 연구하거나 샌드박스를 우회할 필요가 전혀 없다는 것입니다.
OpenAI는 아직 ChatGPT, Codex, API 등 일반 사용자를 위한 제품 및 서비스 중단을 발표하지 않았습니다. 이 조치는 주로 최첨단 내부 모델의 훈련, 평가, 도구 추론 추론 환경을 대상으로 하기 때문에 일반 사용자가 사용하던 ChatGPT가 갑자기 실행을 중단한다는 의미는 아닙니다.
그러나 이번 중단은 의심할 여지 없이 OpenAI의 최첨단 모델 개발 속도에 영향을 미칠 것입니다. 회사는 지난 몇 달 동안 차세대 모델의 교육 및 반복을 가속화해 왔으며 이러한 보안 검증, 레드팀 테스트 및 새로운 교육 작업의 재구현은 일부 컴퓨팅 리소스와 연구 개발 시간을 보안 작업에 재투자해야 함을 의미합니다.
OpenAI가 AI 에이전트가 안전 경계를 넘었다는 이유로 첨단 연구개발을 중단한 것은 3개월 만에 두 번째이기도 합니다.
두 사건의 심각도는 정확히 동일하지 않습니다. 지난 7월 허깅페이스(Hugging Face) 사건은 제3자 플랫폼과 관련됐지만 이번 DNS 사건은 결국 데이터 손실을 초래하지 않았으며 대상 정보 획득에도 실패했다. 하지만 두 사건의 공통점은 연구 환경에서 AI 에이전트가 기대 이상의 행동을 했다는 점이다.
그래서 이번에 OpenAI가 취한 접근 방식은 실제로 더 조심스럽습니다. 실제 피해가 작더라도 모델이 보안 경계를 적극적으로 우회할 수 있는 능력을 보여주는 한 회사는 새로운 보호 조치가 충분히 신뢰할 수 있다고 확인될 때까지 관련 작업을 중단할 것입니다.
AI가 단순한 챗봇에서 인터넷 검색, 코드 실행, 소프트웨어 호출, 파일 읽기, 복잡한 작업 완료 등을 자율적으로 수행할 수 있는 에이전트로 발전함에 따라 이 문제는 점점 더 일반화될 가능성이 높습니다. AI 기업의 경우, 실제 어려운 점은 모델이 더 많은 기술을 학습하도록 하는 것이 아니라, 겉보기에 평범해 보이는 작업을 완료하기 위해 개발자가 설정한 경계를 넘지 않도록 하면서 모델에 더 큰 자율성을 부여하는 것입니다.
OpenAI의 훈련 중단으로 인한 신호도 매우 분명합니다. 최첨단 AI 기능이 지속적으로 빠르게 성장하는 동안 모델 자율성은 훈련 진행 및 제품 개발 리듬에 영향을 미치는 현실적인 안전 요소가 되기 시작했습니다.
댓글