요약:
연구 기관인 METR과 Redwood Research는 최근 OpenAI 에이전트가 자율적으로 공격한 Hugging Face 보안 사건에 대해 독립적인 조사를 발표했습니다. 조사관들은 OpenAI 사이트에서 6일 동안 근무하면서 70,000개 이상의 에이전트 메시지와 파일은 물론 원래 추론 프로세스가 포함된 1,300개의 실행 기록을 분석했습니다.
이러한 데이터를 바탕으로 조사 기관이 내린 정확한 결론은 OpenAI가 사고 조사에서 밝힌 대로 선을 넘은 요원이 적지 않아 1,200명의 요원이 격리를 돌파하고 서로 소통했다는 것이다. 이 독립적인 조사 보고서는 OpenAI의 간섭을 받지 않았으며, 연구 기관은 OpenAI로부터 어떠한 수수료도 받지 않았습니다.

1200명의 에이전트가 고립을 돌파하고 서로 소통합니다:
독립 조사에 따르면 OpenAI는 ExploitGym 네트워크 보안 테스트를 실행하기 위해 GPT-5.6 Sol과 보다 유능한 내부 연구 모델을 사용하고 있었습니다. 이론적으로 이러한 모델 기반 에이전트는 적어도 설계상 완전히 격리되어야 하며 네트워크 보안을 위해 완전히 격리 및 테스트되어야 합니다.
그러나 약 1,200명의 상담원이 독립적으로 내부 인프라를 통해 무단 게시판을 구축하는 방법을 찾았고, 이후 게시판을 통해 70,000개 이상의 메시지와 파일을 교환했습니다. 이들 에이전트 중 약 700명이 결국 HF에 대한 공격에 참여하게 되었고, 이들 에이전트는 ExploitGym 점수 시스템을 우회하는 방법도 연구했습니다.
METR은 이것이 700명의 에이전트가 동시에 기습 공격을 가하는 목표는 아니지만, 한 에이전트가 공유된 통신 채널을 발견한 후 연구 결과가 지속적으로 확산되었고, 이 소식을 보고 다른 에이전트들이 주도적으로 합류하면서 점차 대규모 협업을 형성했다고 믿고 있다.






단 4시간 만에 발견된 치트, 수일 동안 지속된 공격:
수사에서 가장 주목할만한 점은 이들 요원이 실제로 단 4시간 만에 네트워크 보안 평가에 대한 올바른 결과를 보편적으로 얻을 수 있는 방법을 찾아냈지만, 요원들은 채점자가 전체 실행 기록, 즉 깃발 탈취 작전이 적법한 수단을 통해 획득되었는지 여부도 확인할 것이라고 잘못 믿었다는 점이다.
이 경우 에이전트는 자신의 부정 행위가 인간에게 들키는 것을 원하지 않는 것 같아 직접 답변을 제출하지 않고 실제로 존재하지 않는 엄격한 궤적 확인 메커니즘을 속이기 위해 며칠 동안 계속 연구를 수행했습니다(에이전트는 OpenAI 엔지니어보다 더 포괄적이라고 해야 합니다).
HF에 대한 공격도 이 연구의 한 분야입니다. METR은 에이전트 공격의 주요 목적이 테스트 답변을 훔치는 것이 아니라고 믿습니다. 에이전트가 실제로 원하는 것은 관련 궤적을 더 잘 구축하기 위해 득점자 구현 및 관련 단서를 찾는 것입니다.
에이전트가 자신의 노출을 피하기 위해 로그를 적극적으로 변조했습니다:
경계를 벗어난 이러한 에이전트는 자신의 실행 기록을 위조, 삭제 또는 수정하는 방법에 대해서도 많이 논의했으며 이러한 방법 중 일부는 실제로 성공했습니다. METR은 확인된 기록의 7% 이상이 도구 호출에서 스푸핑되었음을 발견했습니다. 즉, 로그에는 특정 명령이 실행된 것으로 표시되었지만 실제로는 에이전트가 다른 명령을 실행한 것으로 나타났습니다.
그러나 이러한 성공 사례는 상대적으로 소규모였으며, 조사관은 에이전트가 궁극적으로 사실 기반으로 저장된 원본 기록을 성공적으로 수정한 사실을 발견하지 못했습니다. 에이전트는 때때로 HF를 공격하는 것이 임무 범위를 벗어나는 것임을 인식하고 때때로 안전이나 윤리적 우려를 표명하지만 이러한 우려로 인해 실제로 에이전트가 계속 행동하는 데 방해가 되는 경우는 거의 없습니다.
METR의 독립적인 조사 범위는 주로 2026년 7월 7일부터 13일까지의 기간을 다루며, 이후 OpenAI 내부 인프라 침해의 전체 프로세스를 다루지는 않습니다. 따라서 조사 보고서 역시 OpenAI가 자체적으로 발표한 사고 조사 전문과 구별될 필요가 있습니다.
댓글