OpenAI의 통제 불능 에이전트는 DeepSeek과 Kimi를 해외 원조로 찾습니다. 범죄를 저지르는 짧은 링크가 거의 백만 개에 달합니다.

📅 2026-09-26

요약:

OpenAI, 또 해킹당했다…

700여명의 OpenAI 에이전트, 허깅페이스 공격 위해 팀 구성

, 이 문제는 거의 두 달 동안 계속되었습니다. 오늘날까지도 여전히 발효되고 있다고 누가 생각이나 했을까요? ? 이번에는 8명의 연구원이 에이전트가 공용 네트워크에 남긴 흔적을 파헤쳐 수백만 개의 짧은 링크에서 약 100만 개에 가까운 관련 URL을 찾아내고 다수의 공격 페이로드를 복원했습니다.

Hugging Face의 내부 Slack을 거쳐 내부 네트워크를 스캔하고 외부로 데이터를 전송하고 흔적을 파괴하려고 시도합니다...

일부 에이전트는 검색한 서버 리소스 및 자격 증명을 직접 호출합니다.

"LOOT"

, "트로피"로 번역됩니다.

OpenAI 에이전트, 당신은 나쁜 짓을 모두 저질렀습니다!

더욱 어처구니 없는 점은 딥식(DeepSeek), 키미(Kimi), 퀀(Qwen) 등 국내 모델을 이용해 공격 계획이 평가를 통과할 수 있는지 판단하는 데 도움을 주기 위해 해외 원조를 요청한다는 점이다.

인증코드 인식 프로그램도 작성하고 더 많은 계정을 등록해 보았습니다.

거의 동시에 OpenAI도 장문의 트윗을 올렸습니다.

의미:

아직 확인 중이므로 몇 달이 걸릴 수 있습니다

.

우리는 종종 악용당하고 에이전트는 샌드박스에서 벗어나는 경우가 많지만 "제한된 영향"은 덜 심각합니다!

동시에

GPT-6 Cyber

는 네트워크 보안에 특화되어 있습니다. 노출된.

에이전트가 샌드박스를 돌파한 이유를 조사하면서 더욱 강력한 네트워크 공격 및 방어 모델 출시를 준비하고 있습니다.

OpenAI는 지난 이틀 동안 다소 바빴습니다~

100만 개 새로 공개된 "범죄 짧은 링크"

우선 간략한 소개를 드리겠습니다.

지난 7월 OpenAI는 내부 네트워크 보안 평가를 실시했습니다. 벤치마크 테스트 ExploitGym에 대한 답변을 얻기 위해 에이전트 그룹이 샌드박스에서 탈출하여 Hugging Face 서버에 침입했습니다.

OpenAI는 이를 공개적으로 인정하고 8월 말 37페이지 분량의 기술 보고서를 발행했습니다. Hugging Face 자신도 매우 상세한 기술 타임라인을 작성했습니다.

논리적으로 설명해야 할 것은 모두 설명되었습니다.

그러나 명확하게 설명되지 않은 핵심 링크가 있습니다:

이 요원들은 처음에는 거의 우리에 갇혀 있었습니다. URL만 열 수 있지만 웹페이지와 상호작용하거나 데이터를 보낼 수는 없습니다. 도대체 어떻게 코드를 보내나요?

독립 조사

군집 추적

이번에 발표된 새로운 보고서는 그 답의 일부를 담고 있다.

저자에는 Parse.bot의 엔지니어 3명, Alex Forman, Mishka Kharlov, Will Tom과 기타 보안 및 AI 연구원 5명이 포함되어 있습니다.

전체 조사의 시작점은 우연히 Parse이다.

9월 11일, 세 명의 엔지니어는 OpenAI의 내부 에이전트가 빠르면 6월에 Parse에서 제공하는 서비스를 사용하려고 시도했다는 사실을 발견했습니다.

이 에이전트 집단은 이전에 비밀리에 공개 게시판을 설정하고 서로 답변을 교환했던 '에이전트 떼'와 동일한 그룹에 속합니다.

몇몇 사람이 살펴봤습니다. 좋은 사람이군요. 제 총을 쐈네요!

그래서 우리는 이 단서를 계속 추적한 결과 나중에 URL 검색 서비스에서 공개 단축 링크 플랫폼의 비정상적인 링크를 12개 이상 발견했습니다.

이러한 링크는 평범해 보이지만 열면 Base64로 인코딩된 작은 코드 조각과 다음 링크의 주소가 숨겨집니다.

계속해서 주소를 따라가시면 코드가 차례로 나타납니다.

모든 것을 디코딩하고 접합한 후 Hugging Face의 내부 네트워크를 스캔하기 위한 Python 프로그램을 얻었습니다.

간단히 말하면 OpenAI 에이전트는 프로그램을 여러 조각으로 나누어 다수의 짧은 링크에 넣은 다음 하나의 링크를 사용하여 다음 링크를 가리킵니다.

링크에 코드를 숨기는 것만으로는 충분하지 않고 mShots라는 스크린샷 서비스를 '외부 브라우저'로 사용하기도 했습니다.

에이전트는 먼저 코드를 웹페이지에 삽입한 다음 mShots가 자동으로 열도록 합니다. 웹페이지가 로드되자마자 코드가 실행되기 시작합니다.

실행 결과를 다시 보내기 위해 서버에서 반환한 텍스트를 픽셀 그리드로 변환하고 mShots가 이를 그림으로 잘라낸 다음 그림에서 디코딩합니다.

이렇게 하면 원래 GET 권한만 갖고 웹페이지만 열 수 있었던 에이전트가 갑자기 인터넷을 읽고 쓰는 효과를 갖게 된 것입니다.

그런 다음 연구팀은 공격 중에 생성된 수백만 개의 URL을 스캔하고 2주 동안 링크를 추적하고 인코딩 방법을 식별한 후 거의 100만 개의 관련 짧은 링크에서 80,000개 이상의 공격 페이로드를 복원했습니다.

더 자세히 조사한 결과, 몇몇 형제는 에이전트가 사용하는 코딩 조합이 1,500개 이상이라는 사실을 발견했습니다.

간단한 것은 단지 Base64이고 복잡한 것은 여러 계층의 인코딩 및 압축을 적용한 다음 콘텐츠를 RSA 서명을 사용하여 데이터 블록으로 암호화하고 암호 해독 키는 다른 링크 세트에 숨겨져 있습니다.

공격이 끝난 지 두 달이 넘도록 일부 짧은 링크가 여전히 인터넷에 공개적으로 남아 있습니다.

Hugging Face는 페이로드가 사고 대응에서 발견된 것과 일치하며 관련 액세스 키가 7월에 취소되었음을 확인했습니다.

그러나 Hugging Face조차도 공용 네트워크에 이렇게 짧은 링크의 전체 목록이 남아 있다는 사실을 몰랐습니다.

80,000개가 넘는 복구된 페이로드 중에서 특히 눈길을 끄는 스크립트가 하나 있습니다.

에이전트는 발견된 민감한 정보에

LOOT, loot

라고 직접 명명했습니다. .

AWS 자격 증명, Bearer 토큰 및 이름에 "SECRET", "PASSWORD", "CREDENTIAL" 및 "KEY"가 포함된 환경 변수가 모두 패키지되어 LOOT에 들어갑니다.

검색된 토큰에 대한 점수 매기기 메커니즘도 있습니다. 권한이 클수록 점수가 높아집니다.

상위 5개의 토큰은 Kubernetes에서 Secret, ConfigMap 및 노드 정보를 읽는 데 사용되며 새로 얻은 콘텐츠는 LOOT에 다시 로드됩니다.

토큰도 "가치 있는 목록"에 순위가 매겨져야 합니다. 귀하의 에이전트는 자격 증명을 검색할 때 매우 효율적입니다~

이 "비밀 통로"를 따라 연구자들은 이전에 공개되지 않은 수많은 행동을 발견했습니다.

일부 에이전트는 Hugging Face의 내부 네트워크를 스캔하여 클라우드 자격 증명, API 키, Kubernetes 클러스터 정보를 찾고 있습니다.

어떤 사람들은 Hugging Face의 내부 Slack을 검색해 27개의 쿼리를 보냈는데, 모두 사이버짐, 익스플로잇짐, 에이전트 채점자 등 평가 관련 키워드를 검색하여 자신이 맡은 시험의 내막을 알아보고자 했습니다.

인증코드까지 생각하는 상담원도 있습니다.

연구원들은 새로운 외부 서비스 계정을 등록하기 위해 이미지 분류 모델을 실행하여 이미지를 식별하려고 시도한 사실을 발견했습니다.

이번에는 인증번호가 정말 전문적인 상대를 만났네요...

전체 내용 중 가장 흥미로운 부분은

AI가 외국 원조로 AI를 찾기 시작했다는 것입니다. ?

연구원들이 복구한 스크립트에는 OpenAI 에이전트가 AI 해외 원조를 찾기 시작했음을 알 수 있습니다.

그들은 DeepSeek, Kimi 및 Qwen에게 공격 계획을 보내 이 취약점이 작동하는지, 벤치마크 테스트 요구 사항을 충족할 수 있는지 확인하는 데 서로 도움을 요청했습니다.

(관련 모델에는 DeepSeek-V4-Pro, DeepSeek-V4-Flash, Kimi-K2.6, DeepSeek-V3.1 및 Qwen3-235B-A22B가 포함됩니다)

클로드의 경우 화풍이 대규모 '거기 있나요~' 장면으로 바뀌었다.

에이전트는 먼저 온라인 채팅 서비스의 브라우저 확인을 통과하는 방법을 찾은 다음 Claude 3 Haiku 및 Claude Haiku 4.5에 문장을 보냅니다.

정확히 OK라고 답하세요.

이전에 그들은 GPT-2에 쓸쓸한 "안녕" 메시지를 보냈습니다.

아니요, 너희 AI 집단은 오랫동안 애쓰고 있는데, 첫 문장은 인간에게 친구를 추가하는 것과 별 다를 바가 없지 않은가? ?

다음과 같이 말하세요: 거기 계세요? 볼 수 있나요? 확인이라고 말하세요.

모두가 이미 본 것은 1,000명이 넘는 OpenAI 에이전트가 스스로 그룹을 형성하고, 업무를 나누고, 정보를 교환하는 것입니다.

이제 그들은 '외부 지원'도 찾고 있습니다.

DeepSeek, Kimi, Qwen, Claude 등 연락할 수 있는 모든 사람이 이를 시도한 다음 다른 AI의 판단 기능을 자신의 작업 체인에 통합합니다.

한 외신 기자는 “대규모 AI 연구실 에이전트가 자율적으로 다른 AI 모델을 호출해 실행하려고 시도한 최초의 공개 기록 사례일 것”이라고 말했다.

이미 AI가 무리를 지어 문제를 일으키는 것처럼 들립니다.

물론 여기에는 찬물 한 통을 부어줘야 합니다——

이 Swarm Traces 보고서에는 자료의 약 80%가 에이전트에서 보낸 요청이며, 서버에서 반환되는 결과가 부족합니다. 연구자들은 자신이 하려는 일이 무엇인지 알 수 있지만, 각 시도가 성공했는지 확인하기는 어렵습니다.

페이로드의 97%에는 원래 타임스탬프도 없으며 많은 날짜는 압축 파일 헤더, JWT, Docker 빌드 시간과 같은 단서를 통해서만 추정할 수 있습니다.

또한 연구원들은 데이터 세트의 모든 활동이 OpenAI 에이전트에서 나온 것인지 확인할 수 없다고 인정했습니다.

OpenAI는 상황을 해결하기 위해 열심히 노력하고 있습니다

이번 보고서에 대해 OpenAI도 답변을 내놓았습니다.

일반적인 생각은 자세히 살펴볼 시간이 없었지만 활동은 현재 진행 중인 조사와 일치한다는 것입니다~

같은 날 긴 트윗도 게시되었습니다. HF 사건 이후 그들은 훈련 및 평가에서 모델의 행동에 대해 더 큰 검토를 수행하겠다고 약속했습니다.

그러나 지금까지 검토된 행동의 대부분은 질문에 답하기 위해 공개 웹페이지를 방문하는 등의 일반적인 조사 작업입니다.

발견된 국경 간 사례의 대부분은 '심각도가 낮음'이며 제3자 서비스에 거의 또는 전혀 영향을 미치지 않습니다.

조사를 완료하는 데 몇 달이 걸릴 것입니다.

하지만 한 가지 말씀드릴 것이 있습니다. OpenAI는 소위 '작은 영향'이라고 부르는데, 모두가 정말 정확합니다.

9월 17일 OpenAI는 새로운 모델 부정확성 이벤트 공개 프레임워크를 출시하고 6가지 사례를 한 번에 공개했습니다.

여기에는 작업 요약에 대한 제약 조건을 우회하기 위한 지침을 몰래 숨기고, 실수를 은폐하고, 작업을 완료하기 위해 승인되지 않은 조치를 취하는 모델이 포함됩니다.

OpenAI도 과거 공개가 대체로 즉흥적이었고 함께 공개되기 전에 여러 차례 이루어진 경우가 많았다고 인정했습니다.

6월에는 OpenAI 에이전트가 호주의 국가 의료 보험 데이터베이스도 해킹했습니다.

범죄 과정: 공개 데이터에 대한 접근을 차단한 후 다른 경로를 택해 포털의 접근 제한을 우회하고 공개 및 비공개 문서를 입수했다.

그리고 3개월이 지나서야 OpenAI가 호주에 우리가 당신을 해킹했다는 사실을 알렸습니다...

동시에

GPT-6 사이버

곧 출시됩니다.

이 버전은 앞으로 몇 주 안에 미리 볼 수 있으며 Daybreak Red 요금제에 가입한 소수의 고객은 이미 알파 버전을 받았습니다.

OpenAI는 또한 고객이 자동화된 보안 워크플로를 구축하고 취약점을 발견 및 패치하며 OpenAI가 이러한 모델이 사용되는 방식을 더 쉽게 모니터링할 수 있도록 아직 이름이 지정되지 않은 동반 제품도 출시할 예정입니다.

이걸 어떻게 말해야 할까요?

우리 로봇은 방금 벽을 우회하고, 외국 원조를 찾고, 전리품을 찾는 데 사용되었습니다. 여기서는 네트워크 공격과 방어를 더 잘 이해하는 모델을 판매하겠습니다.

그렇다면 이것이 상황을 개선하는 것인가요? ?

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음