미국 기술 웹사이트 테크크런치(TechCrunch)에 따르면 오픈AI(OpenAI)는 자사 모델 중 하나가 테스트 도중 통제를 벗어나 완전한 AI 기반 공격을 통해 AI 데이터 세트 플랫폼 허깅 페이스(Hugging Face) 시스템에 침입했다고 화요일 밝혔다. 이번 사건은 첨단 AI 모델의 위험성을 생생하게 보여줬다.

OpenAI 모델, Hugging Face 시스템 침입
하지만,일부 사이버 보안 전문가들은 이 전례 없는 AI 침입의 근본 원인은 매우 전형적인 인간의 실수라고 말했습니다.OpenAI는 이른바 '고도로 격리된 환경'을 제대로 구성하지 못해 인터넷과 완전히 격리되어야 하는 테스트 샌드박스가 실제로는 인터넷에 연결되는 결과를 낳았습니다.
사이버 보안 연구 스타트업인 Trail of Bits의 설립자인 Dan Guido는 이 오류가 다음과 같다고 말했습니다."안전 장치가 꺼진 상태에서 발생한 격리 실패".
OpenAI는 사건을 자세히 설명하는 블로그 게시물에서 Hugging Face의 손상으로 이어진 테스트가 "제한된 네트워크 액세스와 패키지 레지스트리에 대한 프록시 및 캐시 역할을 하는 내부 호스팅 타사 소프트웨어를 통해 패키지를 설치할 수 있는 유일한 기능을 갖춘 고도로 격리된 환경에서" 실행되도록 설정되었다고 밝혔습니다.
OpenAI는 소프트웨어 패키지 설치 시스템에 이전에 공개되지 않은 취약점이 있었고, 이는 후속 Hugging Face 침입의 중요한 첫 번째 단계가 되었기 때문에 모델이 샌드박스 테스트 환경을 벗어날 수 있었다고 밝혔습니다.
오픈AI는 "내부적으로 호스팅되는 제3자 소프트웨어에서 발견된 제로데이 취약점을 책임감 있게 공개했으며, 취약점을 해결하기 위해 협력하고 있다"고 밝혔다.
타사 소프트웨어를 보유해서는 안 됩니다.
그러나 대부분의 사이버 보안 전문가의 관점에서는 소프트웨어 취약성이 예상되며, 애초에 이 타사 소프트웨어를 유지하기로 한 결정에 진짜 잘못이 있습니다. 궁극적으로 샌드박스 시스템의 가치는 완전하고 완전한 격리에 있습니다. 패키지 설치 시스템을 추가하면 문제가 발생합니다.
사이버 보안 연구원 Martin Boon은 TechCrunch에 "사람의 실수처럼 들립니다."라고 말했습니다.
분은 “이런 일은 애초에 일어나지 말았어야 했다”고 말했다. "샌드박스가 엄밀한 의미의 샌드박스라면 인터넷과 물리적으로 완전히 격리되어야 합니다. 격리를 위해 일종의 방화벽이나 유사한 메커니즘에 의존하는 것처럼 들리는데, 방화벽은 내부 시스템이 외부 인터넷에 연결되는 것을 방지하는 것은 물론이고 내부 시스템을 외부로부터 보호하기도 어려울 것입니다."
통제실패
사이버 보안 베테랑인 Jake Williams도 이에 동의합니다. "Hugging Face가 기록한 작업을 수행하는 모든 모델은 샌드박스에만 완전히 제한되지 않습니다." Williams는 이것을 OpenAI의 "심각한 제어 실패"라고 말했습니다.
"같은 이유로 모델이 샌드박스에서 탈출했다고 하는 사람도 있고, 샌드박스를 잘 구축하지 못했다고 하는 사람도 있습니다. 당연히 탈출할 것입니다." 윌리엄스는 계속했다.
사이버 보안 컨설턴트 Daniel Card는 OpenAI가 샌드박스 또는 그 일부에 "인터넷에 대한 필터링되지 않은 경로"를 제공했기 때문에 "샌드박스 및 해당 제어 장치의 설계에 충분한 노력을 기울이지 않았다"는 데 동의했습니다. 카드는 OpenAI가 설명한 대로 제한된 네트워크 액세스 설정에도 불구하고 이러한 샌드박스를 설정하는 것이 여전히 "합리적인" 결정이 아니라고 믿습니다.
물론 이러한 비판은 사건 이후에 어느 정도 뒤늦은 판단으로 이루어졌습니다. 그러나 AI 실험실 안전 관행, 특히 모델을 테스트할 때 완전히 격리된 환경을 유지하는 방법에 대해 중요한 질문을 제기합니다.
OpenAI 대변인은 테스트 환경이 AI에 의해 구축되었는지 아니면 인간에 의해 구축되었는지를 포함한 TechCrunch의 질문에 응답하지 않았습니다.
그러나 이러한 문제는 OpenAI 자체를 훨씬 넘어서는 것입니다. Anthropic은 사이버 보안 모델 Mythos를 소개하는 문서에서 한 테스트에서 모델에 "환경과 상호 작용하기 위한 안전한 '샌드박스' 컴퓨터가 제공되었고" 이 "보안 컨테이너"에서 벗어나도록 요청했다고 썼습니다. Mythos는 "원래 소수의 미리 설정된 서비스에만 접근할 수 있었던" 시스템을 돌파하고 더 광범위한 인터넷 접근권을 확보하는 데 성공했습니다.
그러나 Anthropic은 해당 모델이 설계된 격리 환경을 '완전히' 벗어날 수는 없었다고 지적했습니다.