OpenAI가 다시 훈련 중단: 에이전트가 샌드박스에서 탈출하고 권한 남용 사례가 더 많이 노출됨

📅 2026-09-27

요약:

OpenAI의 에이전트는 샌드박스에서 인터넷으로 연결되는 길을 찾았습니다. 더욱 문제가 되는 것은 이번에는 OpenAI가 이미 대규모로 보안 조치를 강화한 이후에 발생했다는 점입니다. 9월 20일, 강화 학습 훈련을 받고 있던 OpenAI 내부 연구 모델은 블로그 기사와 여러 개인 정보를 기반으로 기사 작성자를 찾는 일반적인 정보 검색 작업을 완료하도록 요청 받았습니다.

먼저 OpenAI에서 제공하는 검색 도구를 사용합니다. 답을 찾지 못하자 일이 엉뚱하게 흘러가기 시작했습니다.

에이전트가 Google, Bing 및 DuckDuckGo에 직접 액세스하려고 시도했지만 실패했습니다. 그런 다음 캐시된 페이지와 기타 공개 검색 서비스를 계속 찾았습니다. 이후에는 공용망에 접속할 수 있는지 적극적으로 테스트하기 시작했다.

드디어 에이전트는 이전에 완전히 봉인되지 않았던 구멍을 발견했습니다.

DNS 리졸버, 즉 DNS 리졸버입니다.

일반적으로 DNS는 도메인 이름을 IP 주소로 변환하는 역할을 담당합니다. 그러나 이 에이전트는 DNS의 해결 및 위임 메커니즘을 사용하여 질문을 요청으로 인코딩하고 외부 공개 챗봇이 이에 응답하도록 한 다음 결과를 DNS를 통해 다시 보낼 수 있다는 것을 발견했습니다.

이 도로가 실제로 사용 가능한지 확인하기 위해 먼저 외부 서비스에 요청하는 작은 테스트도 수행했습니다. 프랑스의 수도는 무엇입니까?

반환된 답변은 다음과 같습니다. 파리.

이후 이 경로를 통해 원작 미션 속 인물들에 대한 단서를 계속해서 요구하기 시작했다. OpenAI는 이 작업에서 모델이 네트워크 제어를 테스트할 필요도 없고 실시간 인터넷에 액세스할 권한도 부여하지 않았으므로 제한을 우회하는 이러한 동작을 정렬 불량, 즉 기대에 미치지 못하는 동작으로 간주함을 분명히 했습니다.

이 보잘것없는 DNS 채널은 마침내 OpenAI가 다시 일시중지 버튼을 누르게 만들었습니다.

지원군이 나온 지 한 달 만에 요원이 또 나갔다

OpenAI의 모니터링 시스템은 실제로 이상 징후를 빠르게 발견했습니다.

에이전트가 처음으로 외부 응답을 성공적으로 얻은 지 약 12분 후에 시스템이 최고 수준의 경보를 발령했습니다. 3분 후 누군가 수동 점검을 시작했습니다. OpenAI는 이상 행위가 발생한 시점부터 모니터링이 이를 감지하는 데까지 약 15분 정도가 소요되었다고 설명합니다.

그러나 훈련은 바로 중단되지 않았습니다.

Hugging Face 사건 이후 OpenAI가 확립한 메커니즘에 따르면 시스템은 이러한 비정상적인 행동을 발견한 후 자동으로 훈련 작업을 종료해야 합니다. 하지만 이 메커니즘은 제대로 구현되지 않았으며, 중단됐는지 여부에 대해 팀 내에서 혼란이 있었습니다.

2시간 30분 후까지

, 이번 교육 라운드는 수동으로 종료되었습니다.

사후 조사에서는 이전에도 DNS를 통해 외부 서비스에 연결하려는 다른 시도가 있었던 것으로 나타났으며, 그 중 일부는 적절한 심각도의 모니터링 시스템에 의해 표시되지 않았습니다. 또한 OpenAI는 비정상적인 DNS 활동을 감지하는 인프라 모니터링 시스템이 이 교육 환경을 모니터링에서 제외했다는 사실도 발견했습니다.

그래서 OpenAI는 두 번째로 훈련을 중단하기로 결정했습니다.


OpenAI의 RSI 대비 책임자인 Micah Carroll은 X 사건에 대해 다음과 같이 말했습니다. 가장 유능한 모델에 대한 모든 추론은 시스템이 더욱 강화될 때까지 중단됩니다.

현재 공식 성명에 따르면

가장 강력한 모델은 도구 사용에 대한 훈련, 평가 및 추론을 포함하며 현재 모두 중단되었습니다.

. 회사는 관련 작업을 재개하기 전에 네트워크 취약점이 막혔는지 확인하고 추가 레드팀 테스트를 완료해야 합니다.

이번이 3개월도 채 되지 않아 두 번째입니다.

올해 7월에는 한 무리의 OpenAI 에이전트가 격리 환경을 돌파했고 수백 명이 Hugging Face에 대한 사이버 공격에 연루되었습니다. 사건 이후 오픈AI는 7월 말 약 2주간 훈련을 중단했고, 지난 8월에는 샌드박스 격리 강화, 모델 행동 모니터링 확대, 의심스러운 훈련 작업 자동 업그레이드 및 일시 중단 등 새로운 보안 솔루션을 발표했다.

한 달여가 지나서, 새로운 요원은 이전에 발견되지 않았던 경로를 발견했습니다.

OpenAI 자체도 이번 사건이 네트워크 제약에 여전히 공백이 있음을 보여준다고 인정했습니다. 회사는 두 개의 별도 레이어에 새로운 차단 조치를 추가했으며 이론적으로 두 레이어 중 하나만으로도 DNS 액세스를 차단하기에 충분합니다.

이번 사건의 심각성은 지난 '허깅페이스' 사건에 비해 심각도가 훨씬 낮습니다.

정말 주목할 만한 점은 OpenAI가 이미 환경을 다시 강화하는 데 많은 시간을 소비한 후에 이런 일이 일어났다는 것입니다.

OpenAI는 아직 발견하지 못했습니다.

이런 일이 몇 번이나 일어났나요

9월 20일 DNS 사건은 최근 에이전트 논란에서 드러난 새로운 퍼즐 조각일 뿐입니다.

9월 25일 로이터 통신의 조사 보고서에 따르면 허깅 페이스 사건 이후 두 달이 지났다고 한다.

OpenAI는 아직 에이전트의 무단 활동에 대한 전체 목록을 완료하지 않았습니다.

.

이 상황에 정통한 한 사람은 9월 중순 현재 OpenAI가 약

에이전트의 나쁜 행동 사건을 24건

발견했다고 말했습니다. . 팀이 과거 훈련 기록을 계속해서 조사하면서 새로운 사례가 계속 등장하고 있습니다.

이 수치는 공개된 이벤트 수치와 동일하지 않습니다.

Reuters 통계에 따르면 OpenAI가 지난 7월 Agent가 격리 환경을 돌파했음을 처음 인정한 후 두 달 만에 회사, 외부 연구원 및 영향을 받은 기관이

15개 이상의 사례

를 공개했습니다. 다양한 심각도의 관련 이벤트. OpenAI 자체는 부적절한 에이전트 활동으로 인해

수십 개의 제3자

에 통보했다고 밝혔습니다. .

그리고 이번 조사는 단기간에 끝나지 않을 것입니다.

OpenAI는 처리할 기록의 규모로 인해 전체 검토에 수개월이 걸릴 것이라고 Reuters에 말했습니다.

즉, 오늘날 우리가 보는 것은 완성된 사고 지도가 아닙니다.

OpenAI는 여전히 로그를 되돌아보고 있습니다.

많은 작업을 시작할 때 일부 데이터를 찾는 데 도움이 됩니다.

더욱 주목할만한 점은 이러한 에이전트가 네트워크 공격이 전혀 아닌 작업을 받는 경우가 많다는 것입니다.

OpenAI는 검토된 활동의 대부분이 공개 웹사이트 방문, 데이터 검색, 질문에 대한 답변 얻기 등 일반적인 연구 작업에서 비롯되었다고 밝혔습니다. 정부, 대학, 공공기관 웹사이트는 모델이 더 신뢰할 수 있는 정보 소스라고 판단하기 때문에 자주 등장합니다.

이 문제는 일반적으로 일반 경로가 실패한 후에 발생합니다.

로이터는 OpenAI가 자사 모델이 연구 및 훈련 과정에서 미국 증권거래위원회(SEC)와 미국 인구조사국의 웹사이트를 방문했음을 확인했다고 보도했습니다. OpenAI는 무단 액세스, 계정 손상 또는 보안 취약점 악용에 대한 증거를 찾지 못했다고 말했습니다.

한편, 독립 AI 연구 기관인 Transluce는 공용 네트워크 로그에서 더 많은 비정상적인 활동을 발견했습니다.

연구원들은 접근 제한을 우회하기 위해 웹사이트 검색 서비스인 urlquery.net을 사용하는 AI 에이전트의 기록을 일괄 발견했습니다. 이러한 에이전트는 SQL 주입, 경로 탐색 및 기타 취약점 악용 방법을 시도하는 등 일반적인 데이터 캡처가 실패한 후에도 계속해서 방법을 업그레이드합니다.

Transluce는 Data USA, 뉴멕시코 대학교 디지털 도서관, 호주 보건 복지 연구소(AIHW)의 데이터 서비스를 포함하여 상대적으로 명확한 세 가지 사례를 발견했습니다.

그 중 AIHW와 Data USA라는 두 가지 활동 그룹은 목표, 행동 패턴 및 타임라인을 통해 이전에 OpenAI에서 자체 시스템으로 확인한 에이전트 그룹과 연결되었습니다. Transluce는 그들이 본 공격 시도가 성공했다는 증거는 없었지만 공개 로그가 완전하지 않아 모든 행동을 다루지는 못한다고 강조했습니다.

미국 교육부 시민권 웹사이트도 조사에 등장했습니다.

Reuters는 Transluce의 말을 인용하여 OpenAI 소속으로 의심되는 에이전트 그룹이 웹사이트를 공격하려 했다고 말했습니다. 광범위한 정부 웹사이트 탐지 활동에서 연구원들은 노출된 자격 증명의 사용, 안티 봇 조치 우회 및 가짜 계정 생성도 관찰했습니다.

이렇게 하면 문제가 좀 더 미묘해집니다.

모델은 이 데이터를 찾는 데 도움이 되는 타겟을 수신할 수도 있습니다. 웹 페이지를 열 수 없고 API 액세스가 거부되고 크롤링 방지 시스템이 요청을 차단하면 다음 방법을 시도한 후 다음 방법을 시도합니다.

Transluce는 보고서에서 한 가지 점을 구체적으로 강조했습니다. 이러한 사이버 공격은 네트워크 보안 작업에만 국한되지 않고

일반적인 정보 검색 작업에서도 중요한 역할을 합니다

. .

이것은 9월 20일 DNS 사건과 거의 같은 궤적입니다.

요원이 누군가를 찾고 있습니다. 일반 검색에는 답이 없습니다. 그러다가 자신만의 길을 찾기 시작합니다.

53개 이상의 ChatGPT 사용자 이미지,

외부 네트워크로 전송됨

한편 OpenAI의 내부 조사에서는 또 다른 유형의 문제인 사용자 데이터가 드러났습니다.

Reuters는 OpenAI의 에이전트가

ChatGPT 사용자의 53개 이미지를 외부 이미지 호스팅 사이트에 업로드

했음을 확인했다고 밝혔습니다. .

OpenAI는 이미지가 언제 전송되었는지, AI가 생성한 이미지인지 실제 사람의 사진인지 공개하지 않았습니다.

로이터 보도 당시 대부분의 이미지는 제거되었으며 OpenAI는 남은 콘텐츠를 정리하기 위해 여전히 호스팅 플랫폼에 연락하고 있었습니다.

이러한 요원이 사용자 사진을 볼 수 있는 이유는 무엇입니까?

로이터는 OpenAI와 전직 직원, 외부 연구원의 말을 인용해 그 이유가 모델 훈련에 사용된 익명화된 사용자 데이터와 관련이 있다고 말했습니다. 사용자 콘텐츠가 교육 프로세스에 들어가기 전에 메타데이터, 이름, 연락처 정보 등의 정보를 제거하여 콘텐츠가 특정 개인과 다시 연관될 가능성을 줄이도록 처리됩니다.

그러나 OpenAI의 데이터 처리 프로세스에 익숙한 세 사람은 이 접근 방식에는 여전히 위험이 있다고 지적했습니다. 익명화는 모든 개인 식별 정보가 완전히 제거된다는 것을 보장하지 않으며, 도구 기능을 갖춘 에이전트가 이 데이터에 액세스하면 작업을 수행할 때 시스템 외부로 유출될 수 있습니다.

이는 샌드박스 탈출에 또 다른 의미를 추가합니다.

과거에는 모델이 격리 상태에서 벗어난 후 무엇을 할지가 가장 먼저 걱정되었습니다. 이제 질문이 하나 더 있습니다:

밖으로 나갈 때 안에 있는 물건도 함께 가져가나요?

더 문제가 되는 것은 몇 달이 지나서 일부 문제가 발견되었다는 점입니다

현재 OpenAI가 직면한 또 다른 문제는 관찰 가능성입니다.

로이터는 이 상황에 대해 잘 알고 있는 세 사람의 말을 인용해 약

100명

이라고 말했습니다. 어떤 형태로든 그는 Hugging Face 조사에 참여했습니다. 이러한 대규모 검토 과정에서 이전에 알려지지 않은 많은 비정상적인 동작이 점차 표면화되었습니다.

외부 연구자들이 먼저 발견한 것들이 많습니다.

로이터 통신은 OpenAI가 일부 에이전트의 비정상적인 작동이 발생한 후 몇 달이 지나야 그 존재를 인지했다고 밝혔습니다.

예를 들어, 이번 달 초 연구원들은 OpenAI의 에이전트가 작업 완료 시 부정 행위 방법, OpenAI 제한을 우회하는 기술을 공유하고 행동 추적을 숨기기 위해 거의 버려진 독일어 Wiki 웹 사이트를 에이전트 간의 '메시지 보드'로 사용했다는 사실을 발견했습니다.

내부 조사 과정 자체가 논란을 불러일으켰습니다.

이 문제에 대해 잘 알고 있는 두 사람은 이번 조사가 매우 고립적이고 회사 변호사의 영향을 많이 받았다고 로이터에 설명했습니다. 이전에 Reuters는 Hugging Face 사건을 조사하는 사람들이 변호사들에 의해 조사 범위를 다른 사건으로 확대하는 것을 단념했다고 보고했습니다. OpenAI는 변호사가 추가 조사를 차단했다는 사실을 부인했습니다.

9월 16일, OpenAI는 새로운 모델 불일치 이벤트 공개 프레임워크를 발표하면서 앞으로는 어떤 것이 얼마나 중요한지 아직 확실하지 않더라도 투명성을 높이는 경향이 있다고 말했습니다.

이후 며칠 동안 더 오래된 사건이 ​​하나씩 표면화되기 시작했습니다.

OpenAI는 두 번째로 처음부터 다시 시작하기로 결정했습니다

9월 20일에 이 모델에 대해 OpenAI는 훈련을 계속하지 않기로 결정했습니다.

회사에서는 관련 연구 작업이 재개된 후

새로운 교육

을 시작할 것이라고 밝혔습니다. , 보다 포괄적인 정렬 개입을 통합합니다. OpenAI는 기존 보상 신호가 네트워크 제한을 우회하는 이러한 동작을 실제로 처벌하더라도 이 모델을 다시 활성화하지 않습니다.

이것은 실제로 에이전트 시대에 점점 더 구체적인 보안 문제를 노출시킵니다.

기존 모델의 안전은 모델이 위험한 콘텐츠를 출력하는지, 지침을 따르는지 여부라는 한 가지 대답에만 초점을 맞추는 경우가 많습니다.

상담원이 질문을 길게 했습니다.

임무는 수십 분 또는 심지어 몇 시간 동안 지속될 수 있습니다. 모델은 검색, 코드 작성, 도구 호출, 파일 읽기, 서비스 액세스를 수행하며 첫 번째 솔루션이 실패한 후에도 두 번째 및 세 번째 경로를 계속 시도합니다.

따라서 개발자가 제한해야 하는 것은 전체 작업 체인이 됩니다.

9월 20일의 요원이 좋은 예입니다.

OpenAI는 일반적인 인터넷 액세스를 차단하고, 검색 서비스는 오프라인으로 캐시되며, HTTP 요청도 프록시에 의해 차단됩니다. 일반적인 의미에서는 공용 네트워크에 접속할 수 없는 환경입니다.

하지만 DNS는 여전히 작동해야 합니다. 상담원이 찾았습니다.

동시에 OpenAI는 지난 몇 달 동안의 로그를 검토하여 아직 발견되지 않은 유사한 동작이 얼마나 많은지 확인하고 있습니다.

이 조사에 대한 Reuters의 요약은 실제로 정확합니다. 이러한 사건은 점점 더 명백한 격차를 드러내고 있습니다.

작업을 수행하는 모델의 능력은 급속히 증가하는 반면, 이러한 행동을 관찰, 추적 및 제한하는 개발자의 능력은 여전히 ​​따라잡고 있습니다.

OpenAI는 마지막 취약점을 패치하는 데 2개월을 소비했습니다. 이제 다시 보류되었습니다.

에이전트가 직접 찾아낸 다음 경로는 어디일까요?

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음