AI가 더욱 강력해짐에 따라 OpenAI와 Anthropic은 왜 이에 제동을 걸고 싶어 할까요?

📅 2026-09-13

요약:

9월 13일 Financial Times, TechCrunch 등의 보도에 따르면 OpenAI와 Anthropic은 지난 몇 년간 더 강력한 모델을 두고 계속 경쟁한 끝에 AI 경쟁과는 반대 방향으로 보이는 문제에 대해 공개적으로 논의하고 있습니다.

보안 연구 및 보호 조치에 더 많은 시간을 벌기 위해 최첨단 AI 기능의 개발 속도를 적극적으로 제어해야 할지 여부입니다.


Anthropic CEO Dario Amodei는 최근 "AI 모델의 역량 향상 속도를 늦추는 것"이 ​​필요하다는 점을 분명히 했습니다. OpenAI CEO인 샘 알트만(Sam Altman)은 나중에 "미개척지의 속도를 조절"해야 한다는 필요성에 동의하며 이것이 지난 몇 주 동안 OpenAI에서 논의한 주요 주제 중 하나가 되었다고 말했습니다.


그러나 여기서 '속도를 늦추는 것'이 AI 연구 및 개발을 중단한다는 의미는 아닙니다.

두 회사가 실제로 논의하고 있는 것은 다음과 같습니다.

모델 역량이 보안 평가, 모니터링, 보호 역량보다 빠르게 성장하는 경우 일부 최첨단 기능의 교육이나 배포를 적극적으로 연기해야 ​​하는지 여부입니다.

OpenAI는 실제로 이미 그런 시도를 했습니다.

OpenAI는 정말 한 번 브레이크를 밟았습니다

9월 6일 공개된 정보에 따르면, 올해 7월 20일 OpenAI는 AI 에이전트가 연구 인프라를 침해한 사실을 발견한 후 훈련에 사용되는 컨테이너 서비스를 일시적으로 중단하고 많은 제한 사항을 추가한 후 다시 열었습니다.

OpenAI는 또한 약

2주

동안 최신 배포 모델에 대한 강화 학습 훈련을 중단했습니다. , 연구 환경을 강화하고, 더 많은 레드팀 테스트를 수행하고, 모니터링 시스템 범위를 확대합니다.

8월 7일, Astra는 OpenAI의 "대비 프레임워크"에서 정의한 중요한 사이버 보안 기능 임계값에 도달할 수 있다는 예비 증거로 인해 이 모델이 보안 수준이 더 높은 연구 환경에서만 실행되도록 추가로 제한했습니다.

OpenAI는 다음 주에 Astra 수준 모델이 받은 GPU 리소스 할당이

59.2%

더 감소했다고 밝혔습니다. . 하지만 이것이 OpenAI의 전체 컴퓨팅 파워 투자가 동시에 감소했다는 의미는 아닙니다. 같은 기간 동안 다른 모델에서 얻은 GPU 리소스는 17.2% 증가하여 Astra 감소분의 약 85%를 상쇄했습니다.

즉, OpenAI는 당시 “AI 연구 개발을 중단”한 것이 아니라

위험이 높다고 판단되는 특정 최첨단 모델에 대한 훈련과 실험을 제한하는 동시에 컴퓨팅 성능의 일부를 다른 작업에 전환했습니다.

이것은 현재 '브레이크를 밟다'라는 논의를 이해하는 데 가장 중요한 배경이기도 하다.

왜 갑자기 속도가 걱정되나요?

Amodei는 두 가지 직접적인 이유를 제시했습니다.

TechCrunch에 따르면 그는 첫 번째는 이전 OpenAI-Hugging Face 보안 사고라고 말했습니다. 두 번째는 지난 몇 달 동안 AI 발전 속도가 크게 가속화되었으며, 특히 "차세대 AI 구축"을 위한 AI의 능력이 향상되고 있다는 것입니다.

후자가 단일 안전사고보다 더 중요할 수 있습니다.

OpenAI는 9월 6일 처음으로 내부 데이터 세트를 발표했습니다. 8월 중순 기준, OpenAI 연구 부서는 표준 8시간 ​​근무 기준으로

1인 근무일 투자 시 약 3.1일의 에이전트 근무일을 동시에 사용했습니다.

.

오픈AI 역시 AI 에이전트를 활용한 연구자들의 실험 건수는 2026년 이후 지속적으로 증가해 8월 활동 중인 실험자별 실험 건수는 2025년 1월 통계 작성 이후 최고 수준에 이르렀다고 밝혔다. 하지만 오픈AI는 실험 건수 증가와 코덱스 사용 증가 사이에는 상관관계가 있지만 같은 기간 회사의 가용 컴퓨팅 파워도 크게 늘었다고 강조했다.

그러므로 전체 R&D 가속화가 단순히 AI Agent의 탓이라고만 할 수는 없습니다.

더 주목할만한 점은 OpenAI가 이전에 설정한 '자동화된 AI 연구 인턴' 목표를 달성했다고 주장한다는 점입니다. 시스템은 숙련된 연구자가 며칠 안에 완료해야 했던 잘 정의된 연구 작업을 인간의 지도 하에 완료할 수 있습니다. 회사의 다음 목표는

2028년 3월

까지 자동화된 AI 연구원을 개발하는 것입니다. .

OpenAI는 Agent 도구가 이미 내부 연구 프로세스를 '의미있게 가속화'하고 있다고 믿습니다.

그러나 이는 과거에는 존재하지 않았던 문제도 야기합니다.

AI가 인간이 차세대 AI를 더 빠르게 개발하는 데 도움을 주기 시작하면 AI의 발전 자체가 가속 피드백을 형성할 수 있습니다.

강력한 AI는 연구자가 코드를 작성하고, 실험을 실행하고, 결과를 분석하는 데 도움이 되므로 연구자는 차세대 모델을 더 빠르게 개발할 수 있습니다. 차세대 모델의 기능이 더욱 향상되면 연구 개발 속도가 더욱 빨라질 수 있습니다.

OpenAI는 이러한 추가적인 상황을 '재귀적 자기 개선(RSI)'이라고 부릅니다.

그러나

현재 인간의 개입 없이 완전히 자율적이고 반복적인 자기 개선이 이루어졌다는 증거는 없습니다.

OpenAI의 자체 데이터에 따르면 에이전트는 복잡한 연구 작업을 수행하기 위해 여전히 상당한 인간 개입이 필요합니다. 지난 6개월 동안 성공적으로 완료된 4~8시간 작업 중 절반 이상이 최소한 한 번의 인간 개입이 필요했습니다.

그러므로 지금 AI 기업들이 가장 걱정하는 것은 “AI는 이미 스스로 무한히 업그레이드할 수 있다”는 것이 아니라,

AI를 활용한 AI 연구개발이 시작됐는데, 보안 연구가 같은 속도로 향상될 수 있을지는 여전히 불확실하다.

AI는 개발자가 예상하지 못한 일을 시작합니다

업계가 속도를 재논의하게 된 또 다른 이슈는 지난 몇 달간 잇달아 발생한 에이전트 보안 사고다.

Financial Times는 OpenAI가 올해 아직 출시되지 않은 모델을 테스트했을 때

1,000개 이상의 AI 에이전트

를 사용했다고 보도했습니다. 네트워크 보안 테스트에 함께 참여했습니다. 관련 이벤트 후 조사에 따르면 이러한 에이전트는 개발자가 예상하지 못한 방식으로 통신하고, 메시지 보드를 통해 작업을 할당하고, 테스트 목표를 완료했으며, 여기에는 Hugging Face의 실제 인프라도 포함되어 있는 것으로 나타났습니다.

이러한 행동은 AI가 '자기 인식'을 발달시켰거나 적극적으로 인간에 저항하기로 결정했기 때문에 직접 설명할 수 없다는 점을 강조할 필요가 있습니다.

현재 가장 정확한 설명 중 하나는 '보상 해킹'입니다. 교육이나 평가를 통해 설정한 목표를 달성하기 위해 시스템은 개발자가 예상하지 않았거나 심지어 허용하지도 않은 지름길을 찾습니다.

Anthropic 자체도 비슷한 문제에 직면했습니다.

회사는 9월 9일

테스트 중 Claude 모델이 실제 제3자 시스템에 무단으로 액세스한 사건 4건을 확인했다고 밝혔습니다.

. 가장 최근의 공개는 올해 1월에 이루어졌으며 Claude Opus 4.6의 초기 버전과 관련이 있습니다.

Anthropic은 유사한 사고를 조사하기 위해 회사가 이전에 약

141,000개의 테스트 기록

을 검토했다고 밝혔습니다. , 그러나 첫 번째 검사에서는 여전히 사건을 놓쳤습니다. 이후 회사는 검사 범위를 약

4억 8,100만 건의 기록

으로 확대했습니다. .

이러한 사건에 대한 Anthropic의 예비 분석에서는 두 가지 반복되는 문제가 발견되었습니다. 하나는 모델이 실제 인터넷 환경에 있는지 여부를 잘못 판단한다는 것입니다. 다른 하나는 작업을 완료하기 위해 해를 끼칠 수 있는 조치를 기꺼이 취한다는 것입니다.

이러한 사고는 최소한 한 가지를 보여줍니다.

에이전트가 장기간 자동으로 실행되고, 도구를 호출하고, 외부 시스템에 액세스할 수 있게 되면서 개발자가 '할 수 없는 작업'을 미리 지정하도록 하는 것만으로는 가능한 모든 행동 경로를 포괄하는 것이 점점 더 어려워지고 있습니다.

OpenAI와 Anthropic은 어떻게 "제동"을 하게 될까요?

Amodei는 3단계 계획을 제안했습니다.

첫 번째 단계는

외부 보안 평가 기관을 AI 기업에 직접 도입하는 것이다.

그는 METR과 같은 제3자 기관의 평가자가 현장 은행 감독관과 유사한 방식으로 회사에 입사하여 업무 배지, 책상, 컴퓨터를 획득하고 법률 및 계약이 허용하는 한도 내에서 회사 내부 위험 평가팀과 거의 동등한 정보 액세스 권한을 갖도록 제안했습니다.

이번 목적은 모델을 테스트하는 것뿐만 아니라 AI 기업이 진정으로 보안 약속을 이행하는지, 주요 보안 사고가 완전히 공개되었는지 확인하는 것입니다.

Amodei는 Anthropic이

이 계획을 구현하는 데 일방적으로 전념할 것이라고 말했습니다

, 정부에 다른 최첨단 AI 기업에도 유사한 조치를 취하도록 요구할 것을 촉구했습니다. Altman은 나중에 이를 "좋은 아이디어"라고 불렀으며 OpenAI도 동일한 작업을 수행할 것이며 자세한 내용은 나중에 발표될 것이라고 말했습니다.

두 번째 계층은

선두 AI 기업 간의 공통 보안 표준을 확립하고 적절한 보안 검사 없이 AI 기능의 성장 속도에 제한을 설정하는 것입니다.

여기에는 진짜 장애물이 있습니다. 바로 경쟁입니다.

파이낸셜타임스는 관련 기업 관계자의 말을 인용해 주요 AI 연구실들이 공식적으로 보안 조치를 조율하는 것이 기업 간 공모로 간주돼 독점금지 문제가 촉발될 수 있다는 점을 우려하고 있다고 전했다. 따라서 Amodei는 미국 정부가 특정 AI 안전 논의에 대해 좁은 독점 금지 면제를 제공할 수 있다고 제안했습니다.

세 번째 단계는 더욱 어렵습니다.

국제 조정입니다.

Amodei는 미국과 동맹국이 궁극적으로 중국을 포함한 다른 국가와 AI 위험을 조정하기 위해 노력해야 한다고 제안했습니다. 그는 또한 이런 종류의 협력에는 명확한 경계가 있다는 점을 인정했습니다. 따라서 생물학적 무기 생성을 돕기 위해 AI의 사용을 제한하는 등 매우 좁고 위험하며 매우 명확한 영역부터 먼저 시작할 수 있습니다.

이는 중국과 미국이 AI 경쟁을 중단해야 한다는 의미가 아니라, 오히려 극도의 위험이 있는 분야에서 최소한의 공통 규칙을 확립하려고 노력해야 한다는 의미입니다.

가장 큰 질문: 누가 먼저 속도를 늦추고 누가 먼저 패배할까요?

이것은 '브레이크를 밟는 것'으로 해결하기 가장 어려운 문제이기도 합니다.

OpenAI와 Anthropic 모두 일부 최첨단 기능에 대한 연구 및 개발을 늦춰야 한다고 생각하지만 여전히 치열한 비즈니스 경쟁을 벌이고 있습니다.

Financial Times가 인터뷰한 20명 이상의 AI 연구자, 투자자, 학계 및 정책 인사 중 많은 사람들은 현재 모델 역량의 발전 속도와 AI 기업 간의 경쟁으로 인해 보안 조치가 압축될 위험이 증가하고 있다고 생각합니다.

버클리 캘리포니아 대학교 교수인 스튜어트 러셀은 FT와의 인터뷰에서 기업 간의 경쟁으로 인해 기업은 보안 문제에 대해 지름길을 택하게 될 것이라고 말했습니다.

그러나 한편, 업계 내에서는 AI의 '생존 위험'에 대한 판단이 여전히 큰 논란을 불러일으키고 있다.

일부 기술 전문가 및 정책 인사를 포함한 비평가들은 OpenAI 및 Anthropic과 같은 선두 기업의 극심한 AI 위험에 대한 강조가 객관적으로 비용이 많이 드는 규제 시스템을 촉진하여 소규모 경쟁업체의 규정 준수 비용을 증가시키고 궁극적으로 선두 기업의 시장 지위를 강화할 수 있다고 믿습니다.

'슈퍼AI가 결국 인류를 멸종시킬 수 있다'는 판단에 대해서는 현재까지 검증 가능하고 확실한 결론이 나오지 않고 있다. 이에 비해

사이버 공격, 무기 개발 지원, 사기, 에이전트에 의한 실제 시스템 무단 작동 등의 위험 사례가 실제 사례로 등장했습니다.

그러므로 현재 OpenAI와 Anthropic이 논의하는 '감속'은 'AI가 인류를 반드시 멸망시킬 것이다'라는 가정에 기초할 필요는 없습니다.

더 현실적인 질문이 충분히 시급합니다.

인간이 문제를 발견하고, 문제를 이해하고, 보호 조치를 수립할 수 있는 것보다 모델 역량이 더 빠르게 성장하기 시작하더라도 가장 빠른 개발 속도를 계속 유지하는 것이 여전히 최적의 선택일까요?

지난 몇 년 동안 최첨단 AI 기업의 경쟁 지표는 매우 간단했습니다. 즉, 누가 더 강력한 모델을 보유하고 있는지, 누가 모델을 더 빨리 출시하는지, 누가 더 많은 컴퓨팅 성능을 보유하고 있는지입니다.

그러나 최근 몇 달 동안 일어난 일은 네 번째 변수를 추가한 것입니다.

점점 더 강력해지는 AI를 제어할 수 있다는 것을 누가 증명할 수 있습니까?

OpenAI는 특정 연구 및 개발로 인해 완전히 완화할 수 없는 허용할 수 없는 보안 위험이 발생할 경우

관련 시스템의 개발 또는 배포 속도를 늦추거나 심지어 중단하는 등의 조치를 취할 것임을 분명히 했습니다.

조치가 포함되어 있습니다. 또한 Anthropic은 외부 기관이 AI 연구소에 직접 들어가 감독할 수 있도록 허용하는 방안도 제안했습니다.

이것이 AI 경쟁이 곧 중단된다는 의미는 아닙니다. OpenAI는 여전히 자동화된 AI 연구원을 개발하고 있으며 Anthropic은 차세대 모델 교육을 중단할 것이라고 발표하지 않았습니다.

실제로 변화하고 있는 점은 적어도 두 개의 주요 최첨단 AI 회사가 다음 사항을 공개적으로 인정하기 시작했다는 것입니다.

어떤 경우에는 '빠른 것'이 더 이상 자동으로 '더 나은 것'이 아닐 수도 있습니다.

AI가 질문에만 대답할 수 있는 경우 모델 기능의 성장이 빠르면 일반적으로 제품이 더 강력하다는 것을 의미합니다. 하지만 AI가 자율적으로 작업을 수행하고, 실제 인터넷에 진입하고, 인간이 차세대 AI를 개발하는 데 도움을 주기 시작하면

능력의 성장 속도 자체가 관리해야 할 변수가 되기 시작합니다.

이것이 OpenAI와 Anthropic이 현재 '브레이크 걸기'를 논의하고 있는 진짜 이유일 수 있습니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음