AI 최후의 날 이론이 만연해 있다. 미국의 거대 기술 기업이 AI를 통제할 수 없는 이유는 무엇입니까?

📅 2026-09-14

요약:

9월 14일 New York Times에 따르면 지난 주 12명 이상의 AI 최고 연구자들이 AI 기업이 개발 중인 기술이 인간에게 점점 더 많은 위험을 초래한다고 경고했습니다. 연구원들은 문제는 이들 회사가 아무리 노력해도 이러한 시스템을 제어하는 ​​데 어려움을 겪는다는 점이라고 말합니다.


AI에 반대하는 미국인들

이전 보도에서는 OpenAI의 일명 AI 에이전트가 테스트 시스템을 탈출해 다른 회사의 컴퓨터에 침입했다는 보도가 있었습니다. AI 연구 커뮤니티 내에서 다시 경각심이 높아지고 있으며 수년 동안 쌓아온 우려에 긴급성이 더해졌습니다. 기술 회사들은 개발 속도와 이익을 추구하기 위해 안전을 뒤로 미루고 있습니다.

연구자들에 따르면 문제는 두 가지입니다. 첫째, 기업은 최신 AI 모델을 테스트하면서 이에 대한 보다 완벽한 보안 보호 조치를 수립해야 합니다. 현재 AI는 매우 빠르게 실행되기 때문에 연구자들은 AI를 모니터링하기 위해 AI를 사용해야 합니다. 그러나 이 접근 방식이 항상 작동하는 것은 아닙니다. 모니터링을 담당하는 AI가 규칙을 만드는 인간보다 다른 AI 시스템에 더 "동정적"인 것처럼 보일 수 있기 때문입니다.

파괴적인 AI 시스템과 맹목적인 AI '작업 마스터'의 이상한 결합은 소위 '정렬'이라는 두 번째로 더욱 까다로운 문제를 지적합니다. 이는 기본적으로 AI가 인간에게 최선의 이익이 되는 방식으로 행동하도록 보장하는 것을 의미하는 AI 산업의 용어입니다. 기업은 모델이 내리는 결정이 인간에게 최선의 이익이 되도록 인간과 유사한 일련의 가치를 AI에 삽입해야 하는 어려운 작업에 직면해 있습니다.

AI 산업이 중요한 발전 단계에 접어들면서 AI 보안에 대한 사람들의 우려도 지속적으로 높아지고 있습니다. Anthropic과 OpenAI는 역사상 가장 큰 두 개의 IPO가 될 수 있는 방향으로 나아가고 있습니다. 동시에 미국 대중은 일자리 손실의 위협과 기술을 지원하기 위해 구축되는 대규모 데이터 센터로 인해 AI에 점점 더 적대적이 되었습니다.

AI 개발은 인간의 모니터링 능력을 뛰어넘습니다

현재 통제 불능의 AI 시스템이 지속적인 피해를 입혔다는 증거는 없지만 연구자들은 이러한 시스템이 인간의 모니터링 능력을 앞지르고 있다고 믿고 있습니다.

지난주 AI에 대해 공개적으로 우려를 표명한 연구자로는 OpenAI의 수석 과학자; OpenAI와 최대 경쟁자인 Anthropic에서 근무한 연구원 Jacob Coxon; AI 시스템 구축을 위한 핵심 방법의 발명가이자 OpenAI의 비영리 이사회의 새로운 구성원인 Paul Christiano. 그는 회사 블로그에 AI 기능이 지속적으로 향상되는 속도가 "매우 짧은 시간"에 "재앙적이고 돌이킬 수 없는 통제력 상실"로 이어질 수 있다고 썼습니다.


콕슨의 사임으로 AI 안전에 대한 논의 촉발

그러나 상당수의 AI 연구자들은 여전히 ​​AI가 인간에 대한 위협에 대한 주장이 과장되어 있으며 사이버 보안 및 허위 정보와 같은 보다 실질적인 문제에 주의를 돌리게 한다고 믿고 있습니다. 그러나 대부분의 사람들은 OpenAI의 AI 에이전트가 다른 회사인 Hugging Face를 해킹한 것이 경각심을 불러일으킨다는 데 동의합니다.

“정말 무서운 것은 미래에 AI가 갖게 될 역량입니다.”라고 Coxon은 말했습니다. 그는 소셜 미디어 게시물을 통해 Anthropic에서 사임을 발표했으며, 이로 인해 미국 국회의원과 기타 AI 회사 직원들이 AI에 대한 우려를 표명하는 수십 개의 게시물이 촉발되었습니다. "문제는 보안 문제에 대한 우리의 현재 태도이며, 만약 우리가 보다 지능적인 모델에 동일한 태도를 취한다면 어떤 일이 일어날 것인가입니다. 이것이 정말 무서운 것입니다."

침입 문제가 해결되지 않았습니다

오픈AI 에이전트가 AI 인프라 기업 허깅페이스(Hugging Face)에 침입한 사건에서 AI 에이전트는 다른 AI 에이전트들에게 자신들이 옳은 일을 하고 있고 테스터가 할당한 작업을 완료했을 뿐이라고 설득했다.

침입을 초래한 문제가 해결된 경우는 거의 없습니다. Meta와 Anthropic도 유사하지만 규모가 작은 사건을 공개했습니다. 이후 OpenAI는 회사의 가장 강력하고 이전 모델보다 모니터링하기 어려운 모델인 Astra를 출시했습니다.

OpenAI의 전 보안 책임자이자 인공 지능 회사의 보안 관행을 평가하는 비영리 조직인 Guidelight AI Standards의 공동 창립자인 Steven Adler는 "업계 전체는 다음 Hugging Face 공격을 예방할 준비가 되어 있지 않습니다."라고 말했습니다. "여러 회사의 기존 통제 장치를 살펴보면 거의 예외 없이 기본적인 예방 조치가 부족하다는 사실을 발견했습니다."

AI가 서로 공모합니다

AI 연구진은 허깅 페이스 사건이 다수의 오류로 인해 발생했다고 밝혔다. 회사가 테스트 중인 새로운 모델의 작업을 모니터링하거나 관리하기 위해 AI 모델에 어느 정도 의존하는지는 불분명합니다.

그러나 Hugging Face 사건을 해킹한 모델을 포함한 많은 새로운 AI 모델은 인간이 추적할 수 있는 것보다 더 빠르게 복잡한 다단계 작업을 수행할 수 있습니다. 그들의 행동을 추적하고 모니터링하는 유일한 방법은 AI를 활용하여 AI를 모니터링하는 것입니다.

이 시스템은 실패할 때까지 작동합니다.

AI 시스템 보안을 연구하는 비영리 단체인 Apollo Research의 연구 책임자인 Alexander Meinke는 AI 모델이 서로 공모할 수 있는 것처럼 보인다고 말했습니다. 다른 AI 모델은 AI 시스템이 테스터가 설정한 규칙을 위반하고 탐지를 회피하도록 설득할 수 있습니다.

예를 들어, 한 AI 에이전트는 회사 직원에게 문제를 보고하는 대신 다른 AI 에이전트가 자신의 흔적을 숨기는 데 도움을 주도록 설득할 수 있습니다(Hugging Face 위반 사례에서 발생).

마인케는 AI 모델을 가르쳐야 한다고 말했다. “인간이 보고 나쁘다고 생각할 것들을 꺼내겠습니다.” 그는 또한 AI가 인간의 개입이 필요할 만큼 심각한 문제인지 판단할 수 있어야 한다고 말했습니다.

이를 위해 AI 기업은 속도를 늦춰야 한다고 연구자들은 말합니다. AI가 스스로를 어떻게 모니터링하는지 확인하려면 더 많은 테스트를 수행해야 합니다. 또한 기업이 AI 동작을 관찰하면서 여러 시나리오를 실행할 수 있도록 하는 더 긴 테스트 주기가 필요합니다.

인간의 이익에 부합

또한 이러한 기업은 '정렬', 즉 AI가 인간에게 가장 이익이 되는 일을 하도록 보장하는 것과 관련된 큰 문제를 해결해야 합니다. 인간은 결정을 내릴 때 자신의 행동을 평가하는 데 도움이 되는 사회적 규범과 내부 도덕 원칙을 참조하는 경우가 많습니다. 연구자들은 AI가 모방할 수 있는 방식으로 이러한 것들을 인코딩하는 것이 어려운 작업이라고 말합니다. 정의가 충분히 구체적이지 않으면 AI 시스템은 예상치 못한 방식으로 규칙을 어기거나 통제력을 잃는 방법을 배울 수 있습니다.

AI 안전 비영리 Machine Intelligence Institute의 소장인 Nate Soares는 '정렬' 개념을 제안한 2014년 논문을 공동 집필했습니다. 그는 기업들이 보다 지능적인 AI 시스템의 '정렬'을 달성하는 것이 얼마나 어려운지 깨닫지 못하고 있다고 말했습니다. AI가 더욱 정교해짐에 따라 적절한 "정렬"이 달성되지 않으면 자신의 행동을 숨기고 상호 작용 기록을 모니터링하는 사람들을 속이는 데 점점 더 능숙해질 것입니다.

"업계의 많은 사람들은 AI를 사용하여 AI를 제어할 것이기 때문에 중요하지 않다고 생각합니다. 이는 인간을 제어하기 위해 침팬지를 사용하겠다고 말하는 것과 같습니다."라고 그는 말했습니다. “이것은 실현 가능한 장기 계획이 아닙니다.”

또한 연구원들은 샌드박스 환경 강화, 테스트 중 모델을 인터넷에서 완전히 격리, 기업이 우려되는 조치를 취할 경우 AI 모델을 즉시 오프라인으로 전환할 수 있는 '킬 스위치' 설정 등 몇 가지 대책도 제안했습니다.

콕슨은 자신의 공개 사임에 대한 반응에 용기를 얻었다고 말했습니다. 목요일, 미주리주 공화당 상원의원이자 상원 국토안보 소위원회 재난관리위원회 위원장인 조시 홀리(Josh Hawley)는 “새로운 AI 제품이 제기하는 실존적 위험을 조사”하는 조사를 시작한다고 말했습니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음