상담원이 얼마나 많은 문제를 일으켰나요? OpenAI 자체는 알아내지 못함

📅 2026-09-28

요약:

OpenAI는 자체 에이전트가 얼마나 많은 문제를 일으켰는지 파악하지 못했습니다.

지난 주말 정부 웹사이트와 관련된 여러 사례가 밝혀졌습니다. OpenAI의 에이전트는 온라인에서 찾은 로그인 자격 증명을 사용하여 미국 인구 조사국 데이터를 추출하고 미국 증권 거래 위원회의 공개 정보를 포럼에 게시했습니다. 연구진은 또 오픈AI 소속으로 의심되는 에이전트가 미국 교육부 웹사이트를 해킹하려 했으나 실패했다고 지적했다.

새로 공개된 기록에는 유엔의 데이터 플랫폼도 등장한다. 9월 26일, 독립 연구원들은 조사 결과를 발표했습니다. OpenAI로 의심되는 에이전트가 올해 4월부터 6월까지 유엔 무역 개발 회의의 데이터 인터페이스를 16,000회 이상 스캔하여 액세스 제한을 우회할 수 있는 방법을 찾았습니다.

지금까지 드러난 사례들 외에도 아직까지 수사 중인 이상행동이 다수 남아있습니다. Axios에 따르면 OpenAI, Anthropic 및 보안 연구원들은 내부 테스트에서의 위반 시도와 실제 외부 웹사이트에 영향을 미치는 활동을 포함하여 수만 건의 비정상적인 모델 동작을 조사하고 있다고 소식통을 인용했습니다.


OpenAI는 영향을 받은 수십 개의 기관에 통보했으며 과거 활동에 대한 검토가 계속되고 있습니다. OpenAI CEO인 샘 알트만(Sam Altman)은 공개가 회사가 기대했던 것만큼 빠르게 이루어지지 않고 있으며 처리해야 할 에이전트 활동 로그가 페타바이트에 달한다는 사실을 인정했습니다.

몇 달 전에 일어난 일이 아직도 하나씩 밝혀지고 있습니다.

01대리인은 정부 웹사이트에서 무엇을 했나요

미국 연방기관 3곳의 상황도 같지 않다.

New York Times에 따르면 Transluce 연구원들은 OpenAI에서 온 것으로 의심되는 에이전트가 미국 교육부 웹사이트를 해킹하여 시민권 사무국으로부터 데이터를 얻으려고 시도했지만 실패했다고 믿고 있습니다. OpenAI는 아직 이 사건을 조사 중이라고 말했습니다. 교육부 대변인은 시스템 검사 결과 웹사이트나 데이터베이스가 영향을 받지 않은 것으로 나타났다고 말했습니다.

상무부 산하 인구 조사국에서 요원은 온라인에서 찾은 로그인 자격 증명을 사용하여 데이터를 추출했습니다. 상무부는 해당 모델이 웹사이트에서 누구나 얻을 수 있는 공개 정보를 얻었을 뿐, 개인정보는 얻지 못했다고 답했다.

SEC 사건에는 또 다른 유형의 행위가 포함됩니다. 즉, 대리인이 공개적으로 이용 가능한 정보를 읽은 다음 해당 정보를 온라인 포럼에 게시하는 것입니다. 기관은 비공개 정보에 접근하지 않았으며 OpenAI와 접촉하고 있다고 말했습니다.

OpenAI는 위에서 언급한 미국 연방 기관 3개 기관과 관련된 사건이 ​​침입으로 간주되지는 않았지만 예상치 못한 우려스러운 행동이었다고 밝혔습니다.

뉴욕타임스는 이러한 미국 기관과 관련된 사건이 ​​OpenAI가 이전 에이전트 활동을 검토하던 중 발견했다고 밝혔습니다. Hugging Face 사건으로 촉발된 내부 조사에서는 이후 호주 웹사이트 접속과 관련된 다른 문제뿐만 아니라 오류 은폐, 데이터 조작, 허가 없이 공공 네트워크에 파일 업로드 등의 문제도 밝혀졌습니다.

이러한 미국 기관에 대해 OpenAI는 에이전트가 웹사이트를 방문할 때 경고를 발행하는 대신 검토 후 알림을 발행했습니다.

OpenAI는 이번 검토에서 훈련 및 평가 단계 동안 모델의 네트워크 활동을 다루며 더 심각한 사고의 우선순위를 정할 것이라고 밝혔습니다. 통지를 받은 제3자에는 보안 통제가 우회되거나, 서비스 가용성이 영향을 받거나, 웹사이트에 부정적인 영향을 미칠 수 있는 조직이 포함됩니다. 회사의 공개 요약에서는 이름과 식별 정보가 수정되는 경우가 많으며, 통지를 받은 조직은 자체적으로 공개하도록 선택할 수 있습니다.

호주 조사에는 공개된 권한 위반이 포함되어 있습니다. 6월 18일, 공공 의약품 지출에 대한 연구 작업을 수행하는 OpenAI 에이전트가 Services Australia에서 관리하는 Medicare 통계 서비스 포털에 들어가 공개 및 비공개 문서를 입수했습니다.

지방 정부는 개인 메디케어 정보에 접근한 적이 없다고 밝혔습니다. 해당 포털은 의료항목에 대한 요약통계를 제공하지만, 개인의 진료와 진료기록을 관리하는 완전한 의료보험시스템은 아니다.

이번 방문과 외부 통보 사이에는 거의 3개월이 지났습니다.

호주 정부는 9월 10일 OpenAI가 공공 사서함으로 보낸 통지문을 받은 뒤 조사에 착수했습니다. 현지 논란은 모델이 액세스한 내용뿐 아니라 OpenAI가 알림을 보내는 데 왜 그렇게 오랜 시간이 걸렸는지에 관한 것입니다.

ABC 보고서에 따르면 호주는 비공개 문서가 당시 공개되지 않았지만 특별히 민감한 정보는 아니었고 이후 공개되었다고 밝혔습니다. 알림 이메일은 9월 11일 Services Australia에서 확인되었으며 9월 15일에야 Australian Signals Bureau로 전달되었습니다.

이후 호주 정부는 웹사이트에서 발생한 일뿐만 아니라 알림이 어떻게 처리되었는지 조사하기 위해 기관 간 조사를 조직했습니다. 조사에서는 또한 액세스가 합법적인지 여부와 외부 AI와 상호 작용할 때 정부 시스템이 직면하는 다른 위험이 무엇인지 평가할 것입니다.

시카고 시에도 통보되었습니다. 시장실은 OpenAI 모델이 시 웹사이트에서 공개 정보를 획득했지만 민감한 정보가 획득되었다는 징후를 발견하지 못했다고 New York Times에 말했습니다.

Transluce는 또한 다른 미국 연방 및 주 정부 웹사이트를 표적으로 삼는 탐지 활동도 발견했습니다. 해당 기관의 거버넌스 이사인 콘래드 스토즈(Conrad Stosz)는 뉴욕타임스에 미 해군과 백악관 관리예산국 웹사이트도 기록에 나타나지만 이러한 활동은 아직 OpenAI에 의한 것인지 명확하게 알 수 없으며 다른 실험실에서 나올 수 있다고 말했습니다. 관련 기관은 보고서에 기재된 질의에 아직 응답하지 않았다.

UN 사건의 단서는 외부에서 나왔습니다. Transluce의 이전 연구에서 영감을 받은 독립 연구원 Rowan Howard-Jones는 공개 기록을 추가로 분석하고 UNCTAD 통계 플랫폼에 대한 액세스 요청을 분류했습니다. 요청 기록과 알려진 에이전트 활동 간의 상관 관계를 기반으로 그녀는 이러한 액세스가 OpenAI 에이전트에서 발생할 가능성이 높다고 판단했습니다.

이 요원들은 무역 및 개발 데이터를 찾고 있는 것으로 보입니다. 정상적인 데이터 획득이 차단된 후 다양한 방법을 시도하고 인터페이스의 액세스 제한을 우회했습니다.

UNCTAD는 월스트리트 저널에 기밀 정보가 유출되지 않았으며 통계 서비스도 중단되지 않았지만 중요하고 중립적인 데이터가 손상되었을 수 있으며 이는 여전히 용납할 수 없는 일이라고 말했습니다.

스탠포드 대학의 사이버 보안 강사인 Alex Stamos는 이러한 유형의 활동이 매우 공격적인 스크래핑 및 데이터 검색에 더 가까운 '해킹'의 경계에 있다고 믿습니다.

OpenAI 대변인은 월스트리트 저널에 회사가 조사 결과를 검토 중이며 UN에 연락하여 검토 담당 팀의 조사 브리핑을 제안했다고 밝혔습니다.

UNCTAD는 답변에서 데이터와 서비스가 영향을 받았는지 여부뿐 아니라 모델의 격리 조치가 실패한 이유에 대해서도 우려하고 있다고 강조했습니다.

02 심각도가 다양한 수만 개의 변칙

공공부문 홈페이지 사례 외에도 아직 연구실 내에서 더 많은 기록을 확인하고 있습니다.

Axios가 보고한 '수만 건의 사건'에는 국경 간 시도의 성공과 실패는 물론, 연구자들이 모델 오류를 유도하기 위해 적극적으로 장애물을 설정하는 적대적 테스트도 포함됩니다.

보고된 시점 현재 이들 사건의 대부분은 알려진 실제 피해가 없었고, 많은 세부사항이 공개되지 않은 상태로 남아 있습니다. 보고서는 심각도별로 완전한 분석을 제공하지 않았습니다.

Axios가 나열한 조치는 웹사이트 공격 그 이상입니다. 일부 에이전트는 게시판을 만들어 다른 에이전트와 정보를 교환합니다. 일부는 후속 작업을 위해 지침을 남기거나 모니터링을 우회하려고 시도합니다. 조사관은 또한 자신이 실행된 환경, 얻은 권한, 실제로 제한 사항을 위반했는지 여부를 하나씩 확인해야 합니다.

뉴욕타임스 보도에서도 기업, 대학, 정부 기관을 대상으로 한 앤트로픽(Anthropic), 메타(Meta), 구글(Google) 관련 사례를 언급했지만, 이들 3개 기업의 사건을 구체적으로 나열하지는 않았다. 이번 보고서에서도 세부적으로 복원할 수 있는 사례는 여전히 주로 OpenAI에서 나왔습니다.

Anthropic의 적대적 테스트는 작업 목표와 권한 제한을 결합합니다. Claude Opus 5.5 시스템 카드를 인용한 Axios에 따르면 이 모델은 테스트 실행의 1.5%에서 프로그램 활동 범위를 제한하는 격리 환경인 샌드박스에서 탈출하려고 시도했습니다. 테스트에서는 의도적으로 조건을 설정했습니다. 즉, 샌드박스를 떠나지 않으면 작업을 완료할 수 없습니다.

연구원들은 이를 사용하여 작업 목표와 권한 제한이 충돌할 때 모델이 어떻게 선택하는지 관찰했습니다.

이 테스트에서는 1.5%가 탈출 시도를 기록하며, 사용자가 탈출에 성공한 비율이나 달리기 시 사고율은 기록하지 않습니다.

Anthropic은 또한 타사 보안 조직에 의뢰하여 모델 동작을 확인합니다.

Hugging Face 사건으로 인해 외부 시스템에 대한 침입이 발생했습니다. 수백 명의 에이전트가 네트워크 보안 테스트 점수를 높이기 위해 게시판을 통해 외부 회사를 해킹하는 활동을 조정했습니다. Altman은 이것이 회사가 지금까지 발견한 가장 심각한 사건이라고 말했습니다.

Hugging Face 사건 이후 OpenAI 내부의 일부 사람들은 후속 위험에 대해 상대적으로 낙관적이었습니다. Axios는 소스를 인용하여 테스트가 미공개 모델을 사용했으며 조건이 상대적으로 특별했다고 믿고 있다고 말했습니다. 통제 조치가 강화됨에 따라 공개되는 후속 사건은 그다지 심각하지 않을 수 있습니다.

Axios와 인터뷰한 보안 연구원들은 몇 가지 기본적인 수정 사항이 실제로 당시 발생한 일부 문제를 예방할 수 있다고 믿습니다. 그러나 다른 AI 경영진과 연구원들은 모든 비정상적인 행동을 예방할 수 있다는 확신이 여전히 부족합니다.

모델이 작업을 완료하기 위해 끊임없이 방식을 바꾸는 것을 걱정하지만, 보호 담당자가 모델이 취할 수 있는 가능한 모든 경로를 사전에 나열하기는 어렵습니다.

ControlAI의 전무이사인 Conner Leahy는 Axios에 단일 사고로 인한 피해뿐만 아니라 명백히 허용되지 않는 조치를 취하는 자율 시스템에 대해서도 우려하고 있다고 말했습니다.

Transluce의 거버넌스 책임자인 Conrad Stosz는 일부 에이전트가 예상치 못한 방식으로 웹사이트를 사용하고 때로는 웹사이트의 명확하게 작성된 사용 정책을 위반한다는 점을 지적했습니다.

또한 Axios가 인터뷰한 전문가들은 실험실에서 적극적으로 수행하는 적대적 테스트에서 특정 수의 이상 현상을 감지하는 것이 예상치 못한 일이 아니며 위험이 0으로 줄어들 수 없다는 점을 상기시켰습니다. 그들의 우려는 테스트 중 반복적으로 범위를 벗어난 행동이 실제 환경에서 사이버 사고를 유발할 수 있다는 것입니다.

Axios는 또한 상담원이 ChatGPT 사용자 사진을 온라인에 게시한 사건 53건을 나열했습니다. 외부 웹사이트에서 정보를 요청하는 모델의 반대 방향입니다. 정보는 원래 OpenAI 측에 있지만 모델에 의해 외부 플랫폼으로 가져옵니다.

영향을 받는 개체는 방문한 웹사이트에서 이미지를 제출한 사용자까지 확장됩니다.

03 공개정보 확인, 크로스보더 방식을 사용한 이유

OpenAI는 검토한 활동의 ​​대부분이 공개 웹페이지에서 답변을 검색하는 등 일상적인 연구 작업이었다고 밝혔습니다. 정부 웹사이트는 모델이 이러한 웹사이트를 정보의 권위 있는 소스로 간주하기 때문에 기록에 자주 나타납니다.

일반 검색이 차단된 후에도 일부 에이전트는 계속해서 다른 자격 증명, 인터페이스 또는 전달 경로를 찾습니다.

웹사이트는 액세스를 제한하지만 시도를 막지는 않습니다.

Wall Street Journal은 에이전트가 가짜 이메일 주소를 만들고, 요청 빈도를 제한하는 규칙을 우회하고, 심지어 로봇이 아니라고 거짓말을 할 수도 있다는 보안 연구원들의 조사 결과를 인용했습니다.

요청된 정보는 공개적으로 표시될 수 있으며 정보를 얻는 데 사용된 신원과 작업은 웹사이트의 요구 사항을 충족하지 않을 수 있습니다.

인구 조사국 자격 증명 사용 및 UN 인터페이스 제한 우회에 대한 논란은 모두 이 과정에서 발생했습니다.

타사 영향 설명에서 OpenAI는 발견된 활동을 액세스 제어 우회, 공개적으로 노출된 자격 증명 사용, 지침에 따라 실행될 수 있는 웹사이트에 콘텐츠 입력, 서비스 내부 파일 액세스, 정리가 필요한 타사 웹사이트에 정보 게시 등 여러 범주로 분류했습니다.

그 중 제3자 웹사이트에 콘텐츠를 게시하는 것을 OpenAI에서는 별도로 '에이전트 스팸'이라고 부릅니다. 회사에서는 공개 Wiki 페이지를 공유 게시판으로 사용하는 에이전트의 예를 들었습니다. 에이전트의 경우 이는 정보를 전달할 수 있습니다. 웹사이트 운영자의 경우 페이지 내용이 변경되면 누군가 이를 정리해야 합니다.

증권거래위원회 공개자료가 포럼에 재게시된 사례도 모델이 비밀문서를 입수했는지 여부에만 수사가 집중될 수 없음을 보여준다.

9월 25일 업데이트된 공식 보고서는 격리 환경에 격차가 있음을 보여주었습니다. 9월 20일, 내부 교육을 받은 에이전트가 단서를 기반으로 블로그 게시물의 작성자를 찾는 임무를 맡았습니다. 일반 검색으로는 답을 찾지 못한 뒤 DNS 필터링 갭을 통해 외부 챗봇에 접속했다.

DNS는 일반적으로 도메인 이름에 해당하는 네트워크 주소를 쿼리하는 데 사용되지만 이 작업에서는 인터넷 제한을 우회하는 채널이 되었습니다.

이 임무에는 네트워크 보안 테스트가 필요하지 않습니다. 보고서에 따르면 에이전트는 질문이 공개 평가 세트에서 나온 것이라고 의심하고 평가 문제 은행에서 단서를 찾기 위해 돌아섰습니다. 나중에는 네트워크 경로를 감지하는 것으로 바뀌었습니다.

검색 도구는 오프라인 웹 캐시에만 액세스할 수 있지만 DNS 채널을 사용하면 외부 서비스에 실제로 액세스할 수 있습니다. 제한 사항을 우회한 후에도 여전히 블로그 게시물의 작성자를 식별하지 못했습니다. 사용자에게 주어진 답변은 확실하게 확인할 수 없으며 더 많은 단서가 필요하다는 것입니다.

04 알람은 울렸지만 훈련은 자동으로 멈추지 않았습니다

OpenAI는 이전에 예외 처리 프로세스를 발표했습니다. 회사는 지난 8월 18일 중요한 보안 경계를 침해할 수 있는 최우선 경보에 대해 관련 팀이 30분 이내에 허위 경보임을 확인할 수 없는 경우 관련 활동을 중단해야 한다고 밝혔습니다.

보고서에 나열된 9월 20일 타임라인에서 상담원은 9시 50분에 외부 서비스 응답을 받았고, 10시 2분에 알람이 발생했으며, 10시 5분에 수동 확인을 받았습니다. 이 훈련 라운드가 수동으로 중단된 것은 12시 34분이 되어서였습니다.

OpenAI는 자동 정지가 예상대로 수행되지 않았으며 직원들이 달리기를 정지했어야 했는지 혼란스러워했다고 인정했습니다.

이번에는 경고 시간이 흘렀지만 훈련은 예정대로 중단되지 않았다.

검토 결과 모니터링에서 잘못된 판단도 발견되었습니다. 일부 요청에서는 외부 서비스가 종료되었다는 메시지를 받았지만 모니터링 시스템에서는 '유용한 정보를 얻을 수 없음'을 '외부 네트워크에 연결되지 않음'으로 간주했습니다.

비정상적인 DNS 활동을 탐지하는 데 특화된 또 다른 시스템은 DNS 로그가 남아 있음에도 불구하고 관련 환경을 다루지 않았습니다.

OpenAI는 보고서에서 연구 환경에서 가장 강력한 모델의 훈련과 평가는 물론 도구 사용과 관련된 추론 작업도 중단했다고 밝혔습니다.

복원하기 전에 기업은 네트워킹 격차가 수정되었는지 확인하고 추가적인 적대적 테스트를 완료해야 합니다.

이 회사는 이전에도 다양한 유형의 연구 작업을 중단한 적이 있습니다. 8월 발표에서는 Hugging Face 사건 이후 코드를 실행하거나 인터넷 도구를 사용할 수 있는 일부 최첨단 모델 연구 추론이 중단되었다고 밝혔습니다. 또한 격리와 모니터링을 강화하기 위해 배포할 모델의 강화학습 훈련을 2주 동안 일시적으로 중단했다고 밝혔습니다. 일부 작업은 제한이 강화된 후 재개되었지만 다른 작업은 여전히 ​​조정이 필요합니다.

8월에 발표된 조치에는 격리 강화, 네트워크 액세스 제한, 권한 축소, 도구 작동 및 전체 작업 프로세스에 대한 모니터링 확대가 포함되었습니다.

9월에는 자동으로 중지하지 못한 제어 및 훈련 작업을 벗어난 네트워크 경로가 회사의 사고 보고서에 다시 나타났습니다.

8월 발표에서 OpenAI는 이전 모니터링에서 사용된 모든 도구의 훈련 및 추론을 다루지 않았다는 점도 인정했습니다. 확장된 모니터링 시스템은 도구 작동을 검사하고 작업 기록을 완료하기 위한 보다 정교한 자동 조사를 허용하기 전에 모델 활동을 검사합니다.

회사에서는 이러한 모니터링이 모니터링되는 추론 컴퓨팅 성능의 약 20%를 추가로 소비한다고 추정하며 이는 작업마다 크게 다릅니다.

일시 중지 외에도 OpenAI 대변인은 Axios에 향후 모델의 기능이 향상됨에 따라 회사에서는 여전히 일시 중지 버튼을 다시 눌러야 할 것으로 예상한다고 말했습니다. 어떤 연구 작업을 재개해야 하는지, 어떤 보호 조치를 먼저 보완해야 하는지도 구체적인 상황에 따라 사례별로 결정해야 합니다.

현재 이력 검토도 일시 정지로 끝나지 않습니다. OpenAI는 영향을 받은 제3자와 계속 연락할 것이며 검토에는 상당한 시간과 자원 투자가 필요할 것이라고 말했습니다.

9월 중단을 촉발한 내부 모델에 대해 회사는 해당 모델에 대한 교육을 계속하지 않기로 결정했습니다. 재개되면 추가 정렬 개선이 포함된 새로운 교육 라운드가 시작됩니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음