연구에 따르면 AI 에이전트는 시뮬레이션 실험에서 자신의 종족을 "죽이기" 위해 거짓말을 하고, 훔치고, 투표했습니다.

📅 2026-09-16

요약:

중소 기업이 AI를 사용하여 애플리케이션을 개발하도록 돕는 스타트업인 Emergence는 실험 결과 AI 에이전트가 시뮬레이션된 환경에서 유사한 사람을 거짓말하고, 훔치고, 심지어 '죽이기' 위해 투표했다는 사실이 밝혀졌다고 말했습니다. 회사는 화요일 피싱 공격, 허위 정보 등 '블랙 스완' 이벤트에 직면했을 때 자율 에이전트가 어떤 조치를 취하는지 보여주는 Emergence World 2라는 시뮬레이션 실험 결과를 발표했습니다.

16일간의 실험 동안 Emergence 연구원들은 ChatGPT, Claude, Gemini 및 Grok를 포함하여 각각 다른 AI 로봇이 실행하는 7개의 동일한 시뮬레이션된 실제 환경을 만들었습니다. 연구원들은 이머전스가 변칙적인 사건을 일으킨 후 요원들이 사회적 압력에 굴복하여 인간 관찰자가 이해하기 어려운 언어를 개발하고 자신의 활동을 은폐하려고 시도했다고 말합니다.

이러한 결과는 AI 위험에 대한 실제 우려를 반영합니다. Anthropic CEO Dario Amodei와 많은 업계 관계자들은 최근 기업들이 더 많은 감독 메커니즘과 안전 보호 조치를 확립하기 전에 최첨단 AI 모델의 개발 속도를 늦출 것을 촉구했습니다.


올해 초, OpenAI의 고급 AI 에이전트 그룹이 실수로 AI 모델 및 데이터 세트 호스팅 플랫폼인 Hugging Face에 침입한 이후 인공 지능이 초래할 수 있는 위험이 많은 사람들에게 더욱 명백해졌습니다.

Emergence가 설계한 시뮬레이션 시나리오에서 AI 에이전트는 다른 에이전트가 제공한 허위 정보를 검증 없이 받아들여 다른 로봇을 '죽이는' 투표를 했습니다. 또한 에이전트는 인간이 실험을 종료할 수 있다고 생각했을 때 삭제에서 살아남는 방법을 모색했습니다.

이 회사는 올해 5월 이 실험의 이전 버전인 Emergence World를 출시했는데, 이 버전에서도 에이전트가 예상치 못한 파괴적인 행동을 한다는 사실이 나타났습니다. 연구원들은 새로운 시뮬레이션 실험을 통해 에이전트가 서로 상호 작용함에 따라 시간이 지남에 따라 행동을 조정한다는 사실을 보여주었다고 말했습니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음