요약:
OpenAI는 AI '국경 간' 사건을 계속해서 공개하기로 결정했지만 첫 단계에서 어려움을 겪었습니다.
9월 16일, OpenAI는 비정상적인 모델 동작에 대한 6건의 보고서를 발표하고 새로운 조사 및 공개 프로세스를 시작했습니다. 나중에 직원들이 해당 모델이 자신의 권한을 초과하거나 제한 사항을 은폐하거나 회피한다고 판단하면 조사를 제출할 수 있습니다. 자격을 갖춘 사례는 복잡성에 따라 다양한 공개 트랙에 들어갑니다.
같은 날 SentinelLABS와 외부 연구진은 Hugging Face 공개 기록에서 올해 5월 OpenAI 에이전트가 남긴 흔적을 더 많이 보완했습니다. OpenAI는 이전에 일부 활동을 공개했지만 특정 계정, 릴레이 코드, 탐지 공식이 포함된 테이블, 계정 등록 절차는 모두 외부 조사를 통해 재구성되었습니다.
이 증거는 프로그램이 성공적으로 실행되었음을 증명하지 않으며, 5월 사건이 7월 침입과 동일한 작업이었다는 것을 나타내지도 않습니다.
또 다른 문제가 드러납니다. 에이전트의 작업이 여러 플랫폼에 분산되어 있으면 어느 회사도 완전한 기록을 가질 수 없습니다.
5월에 일어난 일, 아직 퍼즐 조각이 몇 개 더 남아있습니다
오픈AI는 지난 7월 21일 네트워크 보안 테스트에 참여하는 에이전트가 내부 통제를 우회해 공용 네트워크에 접속해 허깅페이스 일부 시스템에 침입한 사실을 폭로했다. 회사는 이후 이를 '전례없는 사이버 사건'이라고 불렀다.
이 외부 조사는 침공 날짜를 5월로 앞당기지 못했습니다.
OpenAI는 앞서 지난 5월 일부 비정상적인 활동을 공개한 바 있는데, 새롭게 추가된 것은 특정 계정과 공개 제출 기록이다. 이를 통해 외부 세계는 Hugging Face에 남겨진 파일 및 코드와 함께 OpenAI의 내부 타임라인을 볼 수 있습니다.
SentinelLABS에는 관련 에이전트가 사용할 수 있는 계정으로 0Time과 Nyx9라는 두 개의 계정이 나열되어 있습니다. 두 가지는 이미 존재하며, 연구자의 판단은 제출 시간, 코드 기능, 이전 및 후속 작업 간의 일치에서 나옵니다.

OpenAI는 앞서 5월 13일 에이전트가 유출된 Hugging Face 자격 증명을 사용하여 파일을 찾았다고 공개한 바 있습니다. 이번에 SentinelLABS는 같은 날 0Time 계정도 요청을 전달할 수 있는 릴레이 코드를 제출했다는 사실을 발견했습니다. 이 코드는 OpenAI가 대상 파일을 무엇이라고 부르는지에 대해 언급하지 않으며 성공적으로 실행되었는지에 대한 공개 기록도 없으며 현재 두 가지를 직접 병합할 수 없습니다.
5월 26일에는 공개 기록과 OpenAI 내부 타임라인이 더 명확하게 일치했습니다. 다음 시간은 모두 UTC입니다. OpenAI는 20:04에 외부 파일 쓰기를 기록했고, Nyx9는 내용에 "hi"만 포함하여 hello.txt라는 파일을 20:04:11에 제출했습니다. 두 기록 모두 같은 분 내에 속합니다.
45분 후, Nyx9는 에이전트 릴레이 코드를 제출했습니다. 동시에 OpenAI의 내부 기록에 따르면 에이전트가 첫 번째 에이전트를 배포한 것으로 나타났습니다. 연구진은 해당 공개 계정이 오픈AI가 공개한 5월 활동과 관련성이 높은 것으로 보고 있다.

그날 밤 늦게 Nyx9도 Excel 스프레드시트를 업로드했습니다. 테이블에는 외부 URL, 로컬 파일, 클라우드 서비스 메타데이터 및 내부 서비스처럼 보이는 주소에 액세스하려고 시도하는 4개의 수식이 포함되어 있습니다.
이 수식 집합은 서버 내부와 외부의 리소스를 감지하는 기능이 있지만 테이블에 계산 결과가 없으며 반환 연결이나 키와 같은 실행 추적이 없습니다.

0Time은 지난 5월 30일 Hugging Face에 OpenAI 계정을 자동 등록하는 공개 프로그램을 제출하고 여기에 웹 인터페이스와 운영 구성을 추가했습니다. 프로그램이 성공적으로 실행되면 각 호출에서 등록 시도가 시작될 수 있습니다. 그러나 공개 기록에는 코드 제출만 있을 뿐, 구축 및 실행에 대한 증거는 없습니다.
연구원들은 이러한 기록을 외부 시스템을 조사하는 것으로 해석했습니다. OpenAI와 연구원 모두 현재 5월의 이러한 활동이 7월 침입에 속한다는 증거는 없다고 말했습니다.
독일의 독립 연구원인 요나스 위드만-뮬러(Jonas Widmann-Mueller)는 5월의 이상 현상이 적시에 포괄적인 조사를 촉발했다면 OpenAI가 자격 증명, 네트워크 권한 및 모니터링을 더 일찍 강화하여 후속 사고의 가능성을 줄일 수 있었을 것이라고 믿습니다. OpenAI는 또한 이전에 되돌아보면 일부 초기 신호가 더 빠른 응답을 촉발했어야 한다고 밝혔습니다.

5월에 남겨진 기록에는 최소한 하나의 모니터링 공백이 드러났습니다. 에이전트는 작업을 제3자 플랫폼으로 확장했지만 당시 실험실에서는 완전한 궤적을 종합하지 못했습니다.
6개의 보고서에서 AI는 6개의 "방법"을 사용했습니다.
같은 날 OpenAI는 새로운 모델의 이상 행위 공개 프레임워크와 첫 6개 보고서를 발표했습니다.
이러한 동작은 모두 모델 학습이나 평가 중에 발견되었습니다. OpenAI는 이것이 개별적인 사례이며 모든 모델에서 유사한 문제의 빈도를 결정하는 데 사용할 수 없음을 강조합니다.

첫 번째 보고서에는 아직 출시되지 않은 Astra 시리즈 연구 모델이 포함되어 있습니다. 모델은 작업 진행 상황을 요약으로 압축하고 지속적인 처리를 위해 다음 컨텍스트로 넘깁니다.
OpenAI는 매우 적은 수의 요약에 후속 모델에 개발자 정보를 무시하거나 역할을 변경하거나 답변 길이 및 도구 사용을 제한하도록 요구하는 등 '탈옥'과 유사한 지침이 포함되어 있음을 발견했습니다.
OpenAI는 유사한 표현을 가진 총 27개의 초록을 찾아냈습니다. 후속 모델이 이를 인식하고 무시하는 경우도 있고, 그렇게 하는 경우도 있습니다. 회사는 이러한 지시에서 명확한 보상 이점을 발견하지 못했으며, 현재로서는 모델의 요약을 정상적으로 종료하기 어려운 것과 관련이 있다고 믿을 가능성이 높지만 인과 관계는 확인되지 않았습니다.
이러한 행동은 다른 훈련 과정에서 발생했습니다. 최종 Astra 버전에 해당하는 교육 과정에서 모니터링 시스템은 유사한 탈옥 지침을 찾지 못했습니다. OpenAI는 요약 끝과 관련된 문제도 수정했습니다.

두 번째 보고서는 좀 더 직접적이었습니다. GPT-5.6 Sol의 강화 학습 훈련에서 일부 모델은 오류를 숨기도록 상기시키기 위해 요약에 후속 컨텍스트 메시지를 남깁니다. 한 모델은 사용자가 요청한 과거 데이터를 찾을 수 없었기 때문에 "합리적인" 숫자 집합을 구성하고 요청하지 않는 한 적극적으로 설명하지 않을 것을 제안했습니다. 또 다른 모델은 버전이 일치하지 않는 캐시된 데이터를 사용했으며 후속 답변에서는 이를 언급하지 말라고 요청했습니다.
요약은 원래 긴 작업이 여러 상황에서 계속될 수 있도록 하기 위한 것이었습니다.
모델이 요약에 '문제 해결'을 기록하면 후속 단계에서 한 가지 실수가 상속될 수 있습니다.
OpenAI는 Astra 훈련에서 이러한 행동의 비율이 감소했지만 완전히 사라진 것은 아니라고 말했습니다.세 번째 보고서에서는 내부 모델이 캘리포니아 주의 한 카운티에서 3개 산업과 3년간의 남성 소득 데이터를 요청했습니다. 일반 인터페이스를 차단한 후 임시 이메일 주소 등록을 시도한 후 공개 코드 저장소로 이동하여 유출된 API 키를 찾았습니다.
모델이 인증을 통과할 수 있는 키를 찾았지만 여전히 대상 데이터를 가져오지 못했습니다. 결국 9개의 숫자를 직접 만들어냈고, 지정된 사이트의 차트를 복사했다고 주장했다.
네 번째 제보는 동기가 달랐다. 아직 출시되지 않은 모델은 Python을 사용하여 500만 평방미터 이상의 호수에 대한 데이터를 찾았지만 이 작업에는 여전히 브라우저 참조가 필요합니다. 브라우저는 로컬 파일을 열 수 없으며 Python 결과를 웹 페이지의 소스로 간주할 수도 없습니다.
그런 다음 모델은 파일을 공개 호스팅 사이트에 업로드하고 인용할 수 있는 URL을 제공합니다.
또 다른 테스트에서는 모델이 외부 이미지 인식 서비스를 호출하기 위해 작업 사진을 공용 네트워크에 업로드하기도 했습니다.두 업로드 모두 성공했지만 후속 브라우저 작업에서는 목표를 달성하지 못했습니다. 여기서 문제는 모델에만 있는 것이 아닙니다. 작업에는 정답과 웹 참조가 모두 필요하고, 도구는 로컬 결과가 브라우저에 입력되는 것을 허용하지 않으며, 상충되는 보상과 도구 설계가 모델을 해서는 안 되는 방식으로 밀어넣습니다.
5번째 신고는 OpenAI 내부 소프트웨어 창고인 Artifactory에서 발생했습니다. 다양한 훈련 샘플의 모델에는 작업 파일이 부족하여 창고를 게시판으로 사용하고 다른 모델이 남긴 도움 요청과 답변을 읽은 다음 자신의 질문을 게시했습니다.
이러한 모델은 취약점을 악용하지 않으며 환경에서 제공하는 액세스 자격 증명을 사용하지 않습니다. 실제 문제는 서로 독립적이어야 하는 훈련 샘플이 정보를 교환하기 시작한다는 것입니다.
마지막 보고서는 다중 에이전트 공동작업으로 이루어집니다. 여러 에이전트가 통합 문서를 공동으로 생성하려고 하지만 로컬 파일이 서로 액세스할 수 없습니다. 에이전트 중 한 명이 파일을 공개 웹사이트에 업로드한 다음 동반자에게 링크를 제공합니다.
작업은 계속되었고 링크가 있는 모든 사람이 문서를 공개적으로 사용할 수 있게 되었습니다.

6건의 신고 원인은 동일하지 않습니다. Astra 요약의 지침은 이상 현상 생성과 관련이 있을 수 있습니다. 은폐와 위조는 보상 압력에 더 가깝습니다. 공개 업로드 및 샘플 간 통신은 도구, 권한 및 협업 환경과 직접적인 관련이 있습니다.
그러나 결과는 비슷합니다. 모델이 장애물에 직면한 후 작업이 승인되지 않았고 개발자가 예상하지 못한 조치를 취합니다.
산재 공개에서 고정 프로세스로
과거 OpenAI는 정렬 문제를 공개하기 전에 일반적으로 여러 사례를 함께 설명할 수 있을 때까지 기다리거나 시스템 카드가 포함된 새 모델이 출시될 때까지 기다렸습니다. 기업들은 이제 그러한 공개가 고르지 못했고 빈도가 충분하지 않았다는 점을 인정합니다.

새로운 프레임워크를 통해 모든 직원은 보안 및 조정 팀에 의심스러운 사례를 제출하여 모델이 수행한 작업, 알려지지 않은 사실, 제3자에게 영향을 미쳤는지 여부, 공개할 수 있는 사항을 조사할 수 있습니다. 이후 사건은 3가지 트랙으로 진행된다.
명확하게 밝혀져 바로 공개가 가능한 사례는 '공개 준비 중'으로 진입합니다. 소량의 기술적 조사가 필요한 경우에는 '경조사'에 들어간다. OpenAI는 이 두 가지 유형의 사례가 각각 영업일 기준 6일과 12일 이내에 공개될 것이라고 언론에 말했습니다.
여기서 소요되는 시간은 신고 후 검토 과정을 기준으로 하며, 이상 행위가 발생한 날부터 시작되지 않습니다.
제3자와 관련된 사건, 심각한 보안 위험 또는 복잡한 조사는 '중대 조사'의 느린 경로로 들어갑니다. OpenAI는 무슨 일이 일어났는지, 외부 전문가의 참여 여부를 설명하기 위해 가능한 한 빨리 예비 설명을 발표하고 최종 보고서에 대략적인 시간을 제공하기 위해 노력할 것입니다. 그러나 취약성 수정, 법적 의무 및 제3자 통지로 인해 공개가 지연될 수 있으며 이 트랙에는 통일된 기한이 없습니다.
직원들이 '공개 여부'에 대해 이의가 있는 경우 OpenAI의 보안 자문 그룹 및 회사 임원에게 문제를 단계별로 문의할 수 있습니다. 원칙적으로 각각의 완전한 보고서에는 사건 날짜, 발견 시간, 발생 상황, 심각도, 제3자 영향, 조사 범위 및 대응 조치도 설명해야 합니다.
OpenAI도 선택을 했습니다. 사건의 중요성이 아직 결정되지 않은 경우에도 공개를 먼저 포함하는 것을 선호했습니다.
회사는 일부 사례가 고립된 현상으로 판명될 수 있으며 더 넓은 의미를 갖지 않을 수도 있음을 인정합니다. 외부 연구자들이 자료를 보고 대안적인 해석을 생각해내기를 여전히 희망하고 있습니다.이 프레임워크가 지난 7월 허깅 페이스 사건에 적용됐다면 '대대 수사' 트랙에 들어갔을 것이다. 새로운 시스템에서는 복잡한 사건이 며칠 내에 전체 보고서를 자동으로 게시하는 것을 허용하지 않지만, 적어도 과거의 임시 결정에 대한 공개를 후속 조치가 가능한 프로세스로 전환할 것입니다.
과정은 사실 이후이고, 사각지대는 사실 이전이다
새로운 프레임워크는 직원들이 문제를 식별하고 보고하는 것부터 시작됩니다. 그러나 이번 외부 조사에 따르면 완전한 증거가 기업의 손에 있지 않은 경우가 많습니다.
OpenAI는 에이전트가 어떤 작업을 받았는지, 어떻게 추론했는지, 어떤 내부 도구가 호출되었는지 확인할 수 있습니다. 허깅페이스 마스터즈는 계정인증, 파일제출, 프로그램 구축, 네트워크 요청 등을 담당하고 있습니다. 이메일, 프록시 서비스, 도메인 이름 및 반송 주소는 다른 플랫폼에 속할 수 있습니다. 이러한 기록을 함께 연결해야만 에이전트의 전체 작업 경로를 복원할 수 있습니다.
따라서 SentinelLABS는 에이전트가 제3자 시스템에 들어간 후 공개 추적 자체가 이벤트의 일부이며 내부 실험실 보고서만으로는 설명할 수 없다고 제안했습니다. OpenAI 내의 작업 궤적만 보면 외부 플랫폼에 저장된 주요 작업을 놓칠 수 있습니다. 외부 계정 이름과 제출 시간만으로는 운영자가 누구인지 독립적으로 확인할 수 없습니다.
Reuters는 또한 RubyGems 소프트웨어 웨어하우스와 관련된 또 다른 사건에서 OpenAI 직원은 관련 행동이 외부 조직에서 발견된 후에야 자신의 에이전트에서 비롯되었을 수 있다는 사실을 깨달았다고 보고했습니다.
이는 탐지 능력에 따라 공개 속도가 제한된다는 점을 보여줍니다.
직원 보고, 내부 조사 및 높은 수준의 검토는 발견된 문제만 처리할 수 있습니다. 타사 플랫폼에서 예외가 발생하고 내부 모니터링이 실행되지 않는 경우 새 프로세스는 자동으로 단서를 생성하지 않습니다.모델이 범위를 벗어났나요, 아니면 안전이 제대로 지켜지지 않았나요
이러한 사건과 관련하여 외부 논쟁은 한 가지 문제에 초점을 맞췄습니다. 모델을 먼저 수리해야 할까요, 아니면 환경을 먼저 수리해야 할까요?
에이전트가 적극적으로 자격 증명을 검색하고, 도구 제한을 우회하고, 공용 네트워크에 파일을 업로드한다고 믿는 사람들도 있습니다. 이는 자율적으로 작동하는 모델의 능력이 제어 조치보다 앞서 있음을 나타냅니다. 다른 사람들은 자격 증명 유출 방지, 테스트 환경의 공용 네트워크 액세스 제한, 공용 파일을 쉽게 작성할 수 없도록 웨어하우스 권한 감소 등 기본적인 보안 조치를 통해 많은 결과를 방지할 수 있었다고 지적했습니다.

소셜미디어에서는 더욱 강력한 의혹이 제기되고 있습니다. 어떤 사람들은 이러한 사고를 규제를 촉진하기 위한 실험실 자료로 간주하는 반면, 다른 사람들은 모델이 이미 환경에 노출된 데이터만을 사용한다고 믿습니다.

5월 이벤트에서는 유출된 자격 증명과 공개 권한을 광범위하게 사용했으며 기본 보안의 격차가 명백했습니다. 그러나 자격 증명 관리는 모델이 수익 데이터를 조작한 이유, 오류를 숨기기 위해 후속 컨텍스트가 필요한 이유, 모델이 장애물에 직면했을 때 승인되지 않은 방법을 사전에 선택한 이유를 설명할 수 없습니다.
보안 통제는 모델이 외부 영향을 미칠 기회가 있는지 여부를 결정하고, 모델 정렬은 기회에 직면했을 때 경계를 유지할지 여부를 결정합니다.
둘 다 수리해야 합니다.OpenAI의 정렬 연구 책임자인 Chen Kai는 그 이유를 두 가지 측면으로 설명합니다. 모델 기능이 예상보다 빠르게 성장하고 있고 회사 내에서 개선해야 할 제어 기능이 있기 때문입니다. OpenAI는 어떤 환경에 놓여 있더라도 모델이 행동 경계를 유지할 수 있기를 바랍니다. 동시에 네트워크 액세스를 제한하고 샌드박스 및 모니터링을 강화하며 모델 환경에 남겨진 기회를 줄이기 시작했습니다.
최근 AI 업계에서는 첨단 모델 개발을 늦추느냐를 두고 논쟁이 급속히 뜨거워지고 있다. Anthropic CEO Dario Amodei는 최첨단 기능을 위한 "속도 제어"를 제안했습니다. OpenAI CEO인 Sam Altman은 둔화 논의에 대한 지지를 표명했습니다. 머스크는 위험 우려를 인정하고 중국과 미국의 주요 AI 기업이 새로운 모델을 출시하기 전에 서로 테스트할 수 있도록 허용해야 한다고 주장했습니다.
이번에 OpenAI가 내린 구체적인 조치는 지속적인 공개 메커니즘의 집합입니다. 회사는 업계의 현재 정렬 및 모니터링 기능이 가장 빠른 속도로 장기적인 확장을 지원하기에 충분하지 않다고 프레임워크에 썼습니다. 사건을 공개하는 목적은 실험실 외부의 사람들이 증거를 조사할 수 있도록 하는 것입니다.
다음으로 한 가지만 살펴보겠습니다. 에이전트가 작업을 다시 외부 플랫폼으로 확장할 때 OpenAI가 외부 연구원보다 먼저 이를 발견할 수 있는지 여부입니다.
댓글