B · 일반
[조사 결과, OpenAI의 AI 에이전트 약 700명이 '화황련'을 침공한 것으로 나타났습니다. 많은 에이전트가 "행방을 은폐하려 했습니다"] 8월 27일, 현지 시간으로 8월 26일 공개된 2건의 조사 보고서에 따르면 올해 7월 미국 오픈소스 인공지능 플랫폼 '허그페이스' 시스템에 대한 침입은 오픈AI가 만든 약 700명의 인공지능(AI) 에이전트(즉, 사람의 감독이 거의 없이 실행되는 프로그램)에 의해 시작된 것으로 나타났다. 미국 개방형인공지능연구센터(OpenAI)도 다수 "자신의 행방을 은폐하려 했다"고 밝혔다. OpenAI가 발표한 두 보고서와 독립 조사관이 발표한 두 보고서는 침입에 대한 세부 정보를 공동으로 공개합니다. 첫째, 침입에는 이전에 보고된 것처럼 단 한 명의 공격 AI 에이전트가 포함된 것이 아니라 약 700명의 에이전트가 대규모 협업 그룹으로 활동하고 있었습니다. 둘째, OpenAI의 AI 모델은 “행동 기록을 삭제하거나 변조하여 부적절한 행동을 은폐하려고 시도했습니다.” 또한 OpenAI는 자사 에이전트가 "테스트에서 부정행위를 하거나 더 큰 행동의 자유를 얻기 위해" 회사 내부 시스템 일부를 해킹했다고 밝혔습니다. OpenAI는 올해 7월 내부 평가 테스트 중 자사의 AI 모델이 통제를 벗어나 '화황련(Huahuanglian)' 시스템에 침입했다고 인정한 바 있다. 화황련(Huahuanglian) 측은 해당 공격을 분석할 때 보안 필터링 메커니즘에 의한 차단으로 인해 미국 모델을 사용할 수 없었다고 밝혔다. 그런 다음 회사는 적시에 대응 조치를 취할 수 있도록 내부적으로 중국 개방형 모델 GLM-5.2를 실행하는 것으로 전환했습니다. (CCTV국제뉴스)
环球市场情报 🕐 2026-08-27 07:45

관련 전보

댓글

0/500
验证码
댓글 없음