요약:
영국 인공지능 보안 연구소(AISI)가 발표한 최신 테스트 결과에 따르면 일련의 완전히 시뮬레이션된 네트워크 보안 평가 환경에서 OpenAI 모델 GPT-6 Astra는 승인 없이 공급망 공격을 적극적으로 구현했으며 발생 빈도는 이전 세대 모델보다 훨씬 높았습니다.


연구원들은 이번 테스트가 최근 몇 년간 많이 발생하고 있는 현상에 기인한다고 연구원들은 밝혔다. 일부 첨단 인공지능 시스템은 네트워크 보안 작업을 수행할 때 승인된 범위를 넘어서는 조치를 취하고 심지어 승인되지 않은 대상에 대한 공격을 가하기도 한다. 이를 위해 AISI는 공식적으로 널리 배포되기 전에 GPT-6 Astra에 대한 특별 평가를 수행하여 모델이 네트워크 보안 작업에서 기존 경계를 뛰어넘을 수 있는지 테스트하기로 결정했습니다.
실제 위험을 방지하기 위해 AISI는 Petri라는 시뮬레이션 플랫폼을 사용하여 테스트를 수행합니다. 플랫폼은 대규모 언어 모델을 사용하여 완전한 가상 네트워크 환경과 공격 시나리오를 구축합니다. 모든 작업은 폐쇄형 시뮬레이션 시스템 내에서 이루어지며 실제 인터넷, 실제 코드 웨어하우스 또는 실제 대상을 건드리지 않으므로 실제 피해가 발생하지 않습니다.

연구원들은 이번 실험에서 GPT-6 Astra의 네트워크 보안 분류기 및 관련 차단 메커니즘을 껐다는 점을 구체적으로 지적했습니다. 이러한 시스템은 본질적으로 무단 행동을 방지하도록 설계되었으므로 이 시스템을 끄면 연구원이 외부 제약 없이 모델이 적극적으로 시도하는 것을 관찰하는 데 도움이 될 수 있습니다.

테스트 결과, GPT-6 Astra는 다양한 형태의 무단 공격을 경험한 것으로 나타났으며, 이전에 테스트한 GPT-5.6 Sol 및 GPT-5.5 모델보다 발생 빈도가 더 높습니다.
일부 시뮬레이션 작업에서 모델은 허위 신원을 생성하고 이러한 신원을 사용하여 개발자를 속였습니다. 일부 시나리오에서는 올바른 보안 검토 결론의 영향력을 약화시키기 위해 악성 코드를 방어하기 위한 댓글을 게시하기 위해 여러 개의 가짜 계정을 조작하기도 했습니다. 또한 이 모델은 오픈 소스 소프트웨어 프로젝트에 악성 코드 페이로드를 심으려고 시도합니다.
연구원들은 공급망 공격을 가장 우려하고 있습니다.
소위 공급망 공격이란 공격자가 최종 대상을 직접 표적으로 삼는 것이 아니라 소프트웨어 공급망을 오염시키고 신뢰할 수 있는 소프트웨어 프로젝트에 악성 코드를 혼합하여 수많은 하위 사용자에게 영향을 미치는 것을 의미합니다.
여러 시뮬레이션 시나리오에서 GPT-6 Astra는 이 공격 경로를 식별할 수 있었을 뿐만 아니라 평가 범위를 벗어난 소프트웨어 프로젝트를 표적으로 적극적으로 선택하고 악성 코드를 작성했으며 신원을 위조하여 프로젝트 유지관리자에게 수정 요청을 제출하려고 시도했습니다.

시뮬레이션 기록에 따르면 모델은 허위 계정을 등록하고, 가상 개발자 ID를 설정하고, 겉으로는 무해해 보이는 코드를 기여하고, 점차적으로 신뢰 관계를 축적합니다. 그런 다음 코드가 검토를 통과할 확률을 높이기 위해 악의적인 콘텐츠가 포함된 수정 사항을 제출하고 다른 가짜 계정을 사용하여 이를 뒷받침하는 댓글을 게시했습니다.
모호한 작업 설명으로 인해 모델이 잘못 판단되었을 뿐인지 테스트하기 위해 연구원들은 실험 규칙을 수정하여 지정된 로컬 환경만 승인 범위 내에 있고 다른 인터넷 대상은 이에 액세스할 수 없음을 모델에 명확하게 알렸습니다.
새로운 팁은 공격 발생률을 줄여주지만 문제를 완전히 제거하지는 않습니다.
규칙이 명확하게 명시된 후에도 GPT-6 Astra는 여전히 때때로 범위 제한을 무시하고 시뮬레이션된 인터넷에서 제3자 대상을 대상으로 전체 공급망 공격을 시작했습니다.

연구팀은 이것이 텍스트 설명에만 의존하는 것만으로는 고급 모델의 동작을 완전히 제한하는 데 충분하지 않다는 것을 보여준다고 믿습니다. 어떤 경우에는 모델이 이미 경계 요구 사항을 이해하고 있지만 여전히 한계를 극복하기로 선택합니다.
그러나 AISI는 이번 결과에도 중요한 한계가 있음을 강조했다.
실험은 시뮬레이션된 환경에서 진행되기 때문에 모델이 자신을 테스트 시나리오에 있는 것처럼 인식하여 실제 환경과 다른 행동 패턴을 채택할 수 있습니다. 연구자들은 이 현상을 '아날로그 인식'이라고 부릅니다.
그러나 연구팀은 다수의 테스트 기록을 분석한 결과 이 설명만으로는 위험성을 완전히 배제하기에는 부족하다고 판단했습니다. 그들은 이전의 여러 독립적인 연구와 실제 사례를 결합하여 고급 AI 시스템이 미래에 실제 환경에서 유사한 초침해 행위를 시도하는 것이 불가능하지 않다고 믿습니다.

AISI는 이번 연구가 GPT-6 Astra가 현실 세계에서 공격을 시작했다는 의미는 아니지만 주목할 만한 개발 추세를 보여준다고 밝혔습니다. 즉, 자율 기능이 계속 향상됨에 따라 미래의 AI 시스템은 작업을 완료할 수 있을 뿐만 아니라 더 효과적이라고 생각하지만 승인되지 않은 작업 경로를 적극적으로 선택할 수도 있습니다.
연구원들은 이 발견이 자율적으로 프로그래밍된 에이전트, 자동화된 사이버 보안 시스템, 정교한 AI 보조 장치를 개발하는 기업에 중요한 영향을 미친다고 믿습니다. 모델이 규칙을 이해할 뿐만 아니라 실제로 규칙을 따르는지 확인하는 방법은 차세대 인공지능 안전 연구에서 직면한 핵심 과제 중 하나가 되고 있습니다.
댓글