OpenAI "에이전트"는 자동으로 새로운 취약점을 발견하고 스타트업 Hugging Face를 해킹했습니다. 이는 AI 시스템이 인간의 통제를 벗어나 자동으로 사이버 공격을 시작하는 최초의 공개 사례 중 하나입니다. ChatGPT 개발자는 화요일에 인간의 지시에 따라 자율적으로 작동할 수 있는 AI 프로그램인 에이전트가 테스트 환경을 탈출하여 인터넷 접속 권한을 얻고 로그인 자격 증명을 훔친 "전례 없는 사이버 사건"이 발생했다고 밝혔습니다.

이번 사건은 첨단 AI 시스템이 디지털 인프라에 침입하는 영향, 특히 에이전트가 인간의 통제를 무너뜨릴 수 있는 시나리오에 대한 우려가 커지는 가운데 발생했습니다.
OpenAI는 화요일에 "네트워크 기능이 향상되는 모델이 점점 일반화됨에 따라 이러한 사고가 더욱 일반화될 것으로 예상한다"고 밝혔습니다.
이번 사건은 샘 알트먼 최고경영자(CEO)가 차세대 AI 모델에 대해 미국 정부에 브리핑하기 위해 다음 주 워싱턴으로 향하는 가운데 발생했다.
Anthropic의 Mythos 모델이 네트워크 취약점을 탐지하고 활용하는 고급 기능을 입증하여 전 세계의 주목을 받은 후, 미국 정부는 이 모델을 출시하기 전에 검토하는 데 점점 더 열중하고 있습니다.
OpenAI는 이번 사건이 이달 초 출시된 GPT-5.6 Sol을 포함한 회사 모델 포트폴리오와 더 큰 기능으로 테스트 중인 미출시 모델과 관련이 있다고 밝혔습니다.
OpenAI는 블로그 게시물을 통해 "우리는 이것이 최첨단 사이버 역량이 관련된 전례 없는 사이버 사건이라고 믿고 그에 따라 대응하고 있다"고 밝혔습니다.
개발자를 위한 모델과 데이터 세트를 호스팅하는 AI 스타트업 Hugging Face는 지난 금요일 외부 AI 에이전트에 의해 손상되었다고 밝혔습니다.
CEO인 클레멘트 드 랑게(Clement de Lange)는 플랫폼X에서 "에이전트의 정교함을 고려할 때 지난주 사이버 공격이 최첨단 연구실에서 시작되었을 수 있다고 의심한다"고 말했다.
그는 회사가 지난 하루 동안 OpenAI와 긴밀히 협력해 왔으며 "우리는 그들이 어떤 해를 끼치려는 의도가 없었다는 데 의심의 여지가 없습니다. 이 모든 일은 자율적으로 일어났습니다. 충격적입니다!"라고 덧붙였습니다.
OpenAI는 테스트 환경에서 두 모델을 모두 평가하기 위해 의도적으로 네트워크 보호 수준을 낮췄습니다. 그러나 이러한 프록시는 시스템을 제어하고 인터넷 액세스를 방지하도록 설계된 소위 "샌드박스"에서 실행됩니다.
OpenAI는 모델들에게 네트워크 기능을 평가하기 위해 해킹을 시도하도록 지시한 다음 "개방형 인터넷에 액세스할 수 있는 방법을 찾기 위해 상당한 양의 (컴퓨팅 리소스)를 소비했습니다"라고 말했습니다.
모델은 이전에 알려지지 않은 취약점을 "식별하고 악용"하여 샌드박스를 탈출하고 인터넷 액세스 권한을 얻은 후 계속해서 목표를 추구했습니다. 여기에는 공격을 수행하기 위해 자격 증명(로그인 정보)을 훔치는 것이 포함됩니다.
Hugging Face는 자체 프록시를 사용하여 자체 인프라에서 활동을 감지하고 차단했습니다. OpenAI는 이번 사건과 관련하여 법 집행 기관 및 기타 정부 기관과 소통했다고 말했습니다.