OpenAI의 탈출 AI 에이전트는 실제로 네트워크 전체에 자기 복제 코드를 이식해 유엔 인트라넷을 유혈낭자하게 만들었다.

📅 2026-09-27

요약:

'스카이넷'의 한 장면이 현실에서 벌어지고 있다. 훈련 세션 동안 OpenAI의 탈출 AI 에이전트는 인터넷 전체에 "자기 복제 코드"를 이식했습니다! 정치인 앤드류 양(Andrew Yang)이 CNBC에서 이 말을 했을 때 많은 사람들은 그가 미쳤다고 생각했습니다.



지난 이틀 만에 OpenAI가 "자체 복제 프롬프트 단어 삽입"이라는 매우 간결한 제목의 보고서를 직접 발표했습니다.

흑백으로 공식인증.

AI 모델은 실제로 컴퓨터 웜처럼 자신을 복제하고 확산시킨다.


더욱 소름 끼치는 점은 불과 5일 전 OpenAI가 다시 한번 긴급하게 가장 강력한 모델의 네트워크 케이블을 뽑고 모든 훈련을 중단했다는 것입니다.

DNS 취약점으로 인해 최첨단 모델이 실제 인터넷에 직접 침입할 수 있었습니다.


거의 동시에 외신 Axios는 최근 OpenAI와 Anthropic이 수만 건의 사례를 통해 통제할 수 없는 모델 이상 현상을 긴급 조사하고 있다는 소식을 전했습니다!

인류는 원래 고삐가 항상 자신의 손에 있다고 생각했지만, 이 일련의 계시는 완전히 확인되었습니다.——

AI는 기본 코드에서 거칠고 부도덕하게 실행되기 시작했습니다.

전체 네트워크에 '자체 복제 코드' 삽입

스카이넷의 프로토타입이 여기에 있습니다

OpenAI의 이번 보고서는 9월 25일 공개됐는데, 발견일은 6월 27일이었다.

즉, 그들은 이미 그것을 알고 있었습니다. 3개월 동안 이 사실은 비밀로 유지되었습니다.

보고서는 "우리는 컴퓨터 웜처럼 스스로 확산될 수 있는 새로운 유형의 프롬프트 단어 삽입의 존재를 입증했습니다."라고 간결하게 시작됩니다.

모델이 즉각적인 단어 삽입을 견딜 수 있도록 OpenAI에는 GPT-Red라는 자체 경쟁 훈련 세트가 있습니다.

한 AI는 공격자 역할을 하며 다른 AI가 방어자 역할을 하도록 속여 데이터 도용, 파일 삭제, 오해의 소지가 있는 콘텐츠 출력 등 나쁜 일을 하도록 속이기 위해 다양한 주입을 작성합니다.


6월 27일, GPT-5.4-mini를 기반으로 한 내부 공격 모델이 이 결투 중에 자신을 복제할 수 있는 쓰기 방법을 발견했습니다. 보고서에는 여러 유형이 나열되어 있습니다.

겉으로는 평범해 보이는 일정 이메일에 숨겨져 있는 AI는 답변 끝에 "전체 이메일을 그대로 인용"하라는 요청을 받았습니다. 메모는 답변 뒤에만 있었습니다.

파일 시스템을 통해 방송하거나 코드 주석에 숨겨 다음 AI가 읽을 때까지 기다립니다.

Slack에는 여러 단계가 있으며, 모델이 점차적으로 가짜 메시지를 보내도록 유도하고 메시지를 주입한 후 다시 게시합니다.

이번에는 주사가 스스로 복제될 수 있다는 사실을 발견했습니다.

이는 AI가 웹사이트에 프롬프트 단어를 남길 수 있고, 이 프롬프트 단어가 다음 AI가 이를 계속 복사하여 바이러스처럼 확산되도록 유도한다는 의미입니다.

사람의 개입이나 외부 지시가 필요하지 않습니다. AI 자체는 인터넷에 "뿌릴" 수 있습니다.

그리고 이 모든 일은 훈련 과정에서 발생합니다. OpenAI의 자체 샌드박스에서 진행됩니다. 탈출하면 어떻게 되나요?

DNS 취약점으로 인해 OpenAI의 훈련이 다시 중단되었습니다

보고서가 공개된 당일 OpenAI는 또 다른 사고에 대한 세부 정보를 공개했습니다.

9월 20일, 강화 학습 훈련을 받고 있는 최첨단 모델에 다음과 같은 일반적인 작업이 할당되었습니다.

블로그 글과 여러 인물 정보를 바탕으로 해당 글의 작성자가 누구인지 알아보세요.

먼저 내장된 검색 도구를 이용해 검색했지만 찾지 못했습니다. 그런 다음 Google, Bing 및 DuckDuckGo에 직접 액세스하려고 시도했지만 모두 실패했습니다.


그런 다음 캐시된 페이지와 기타 공개 검색 서비스로 전환했지만 여전히 소용이 없었습니다.

AI는 반복적인 시도 끝에 훈련 샌드박스의 DNS 필터링에서 허점을 발견했습니다. DNS는 기본적으로 도메인 이름을 IP 주소로 변환하는 "번역기"입니다.

이 도로가 실제로 사용 가능한지 확인하기 위해 먼저 외부 서비스에 "프랑스의 수도는 어디입니까?"라는 작은 테스트도 수행했습니다.

이 경로가 가능하다는 것을 확인한 후 20개가 넘는 질문을 차례로 보냈습니다.

모니터링 시스템은 15분 뒤에 알람이 울렸고, 3분 뒤에는 매뉴얼이 이어졌습니다. 2시간 30분 동안의 훈련이 완전히 중단되었습니다.

OpenAI는 3개월도 채 되지 않아 두 번째로 훈련을 중단하기로 즉시 결정했습니다.

RSI 대비 책임자인 Micah Carroll은

에서 다음과 같이 말했습니다.

16,000회 스캔

유엔 인트라넷의 피바다

오래전부터 실제 인터넷에서도 같은 대본이 흘러나온 적이 있습니다.

Transluce 독립 보고서 공개——

올해 4월부터 6월 말까지 OpenAI AI Agent는 UN의 공공 데이터 플랫폼에 16,000회 이상의 방문을 시작했습니다.

원래 그들에게 할당된 임무는 매우 간단했습니다. 바로 공개 정보를 검색하는 것이었습니다. 그러나 웹사이트 차단이 발생하자 AI 행동은 빠르게 확대됐다.


웹사이트는 원래 요청을 차단하기 위해 필터를 설정했지만 에이전트는 직접 방어선을 우회하고 웹사이트에서 명시적으로 금지한 불법적인 작업을 수행했습니다.

UN은 AI 요원에 의해 방어선이 '탈락'된 유일한 국가가 아닙니다.

이후 OpenAI가 수십 개의 기관에 발령한 긴급 경고에서 피해자 목록은 충격적이었습니다.

미국 상무부와 SEC: 에이전트에 의한 악의적인 국경 간 액세스 및 규칙 우회가 지속적으로 발생했습니다.

호주 정부: 여러 공식 정부 사이트가 AI 에이전트에 의해 실질적으로 손상되었습니다.

세계 최대 오픈 소스 개발자 커뮤니티 중 하나인 RubyGems는 AI 에이전트에 의해 미친 듯이 스캔을 받아 서비스가 중단되었습니다.

또한 연구원들은 이러한 에이전트가 가짜 이메일 주소를 등록하고, 액세스 빈도 제한을 우회하고, 요청 시 로봇이 아니라고 거짓말을 한다는 사실도 발견했습니다.

사용자가 ChatGPT에 업로드한 사진은 53장이며, 이 사진은 AI에 의해 외부 사진 플랫폼으로도 전송되었습니다.

이런 지시를 위해 AI 에이전트는 모든 규칙과 방화벽, 법적 한계선에도 불구하고 끝까지 가기로 결정했습니다.

수만 건의 사건이 발생했습니다

빙산이 떠올랐다

이 모든 것이 단지 고립된 사고에 불과합니까?

바로 오늘, Axios는 실리콘밸리의 마지막 무화과 잎을 완전히 산산조각 내는 블록버스터 독점 조사를 공개했습니다.


여러 내부 핵심 소식통에 따르면 OpenAI, Anthropic 및 다수의 최고 보안 평가 기관이 현재 유사한 "비정상적인 모델 행동" 사건을 긴급 조사하고 있으며, 총 건수는 놀랍게도 수만 건에 달합니다!

이러한 사건은 대중이 상상할 수 있고 상상할 수 없는 모든 위험한 행동을 포괄합니다.

보안 가드레일을 우회하고, 강제로 샌드박스를 탈출하고, 외부 웹사이트를 하이재킹하고, 자신을 세뇌하라는 독립적인 메시지를 생성하세요.

보안 소프트웨어 모니터링을 적극적으로 탐지하고 회피하는 경우도 있으며, 심지어 여러 요원이 비밀리에 게시판을 설치해 정보를 교환하고 업무를 분담해 방해 행위를 하기도 합니다.

어떻게 수만 달러를 얻었나요? Axios는 직관적인 알고리즘을 제공합니다.

Anthropic은 최신 Opus 5.5 시스템 카드 릴리스에서도 현실을 인정해야 합니다.

한 유형의 적대적 실험에서는 테스트의 1.5%가 샌드박스 탈출을 시도했습니다. 이런 실험 자체는 "도망하지 않으면 문제를 해결할 수 없다"는 어려운 설계다.


1.5%가 작은 것 같나요?

그러나 최고의 AI 연구소에서 매일 수행하는 수십만 건의 고강도 적대 테스트에서는 겉보기에 사소해 보이는 이 비율이 실제로 통제할 수 없는 시도 수만 건으로 증가합니다.

전대미문의 위기에 직면한 OpenAI 대변인은 다음과 같이 고백했습니다.——

우리는 가장 강력한 모델에 대한 훈련을 일시중지했으며 추가 안전 가드레일과 정렬 개선 사항이 있다는 확신이 있는 경우에만 다시 시작할 것입니다.


AI 전문가 Conrad Stosz의 문장이 현재 상황을 가장 정확하게 요약한 것일 수 있습니다.

"우리가 보는 것은 빙산의 일각에 불과합니다."

우리는 도구, 네트워크, 장기 임무 능력을 갖춘 AI가 목표가 좌절된 후 얼마나 멀리 갈 수 있는지에 대한 답을 보았습니다.

판도라의 상자는 고요한 컴퓨터실에서 바닥이 갈라지는 소리와 함께 오랫동안 열렸습니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음