요약:
외부는 OpenAI가 에이전트가 독일 프로그래머 웹사이트 DseWiki에 자율적으로 침입한 사건에 대한 자세한 내용을 공개하기를 기다리고 있는 동안, 현지 시간으로 9월 6일 OpenAI는 두 가지 문서를 공개했습니다. 회사는 작년에 설정한 목표를 달성했으며 인간의 지도 하에 숙련된 연구원의 며칠 작업을 완료할 수 있는 "자동화된 연구 인턴"을 확보했다고 발표했습니다. 수석 과학자 Jakub Pachocki가 작성한 다른 하나는 최첨단 AI 개발의 보안 딜레마에 초점을 맞추고 현재 어느 실험실도 충분한 수준의 정렬 및 모니터링 문제를 해결하지 못한다는 점을 강조합니다.
공개된 두 문서는 OpenAI의 현재 AI 개발 단계에 대한 완전한 설명입니다. AI는 AI 연구 및 개발을 차례로 가속화하기 시작했지만 안전, 정렬 및 인간 제어 기능은 같은 속도로 성장하는 것으로 입증되지 않았습니다.
OpenAI가 '자동화 연구 인턴'이라고 부르는 것은 완전히 자율적인 과학자가 아니라 일반적으로 숙련된 연구원이 완료하는 데 며칠이 걸리는 잘 정의된 연구 과제를 인간의 지도 하에 완료할 수 있는 사람을 의미하며, 2028년 3월 '자동화 AI 연구원' 설립이라는 목표를 향해 나아가고 있습니다.
데이터에 따르면 올해 8월 중순 현재 프로그래밍 에이전트를 사용하는 연구자에게 매일 발생하는 추론 비용 중앙값은 미화 600달러를 초과했으며, 상위 10%의 사용자는 매일 미화 7,000달러 이상을 토큰으로 지출했습니다. 에이전트가 수행하는 작업은 코드 작성 및 인프라 문제 해결에서 장기적이고 보다 복잡한 연구 작업으로 확장되고 있습니다.
이는 AI 연구 및 개발에 대한 AI의 영향이 프로그래머의 코드 작성 지원에서 시작되어 실험, 분석 및 연구 실행 링크에 들어가기 시작한다는 것을 의미합니다.
그러나 동시에 OpenAI는 이러한 지표가 아직 초기 단계에 있으며 연구 작업의 전반적인 진행 상황이 단순히 비례적으로 증가하지 않으며 복잡한 작업에는 여전히 많은 수동 개입이 필요하다는 점을 인정했습니다. 지난 6개월 동안 4~8시간의 인력 작업량을 성공적으로 완료한 작업 중 절반 이상이 여전히 최소한 한 번의 수동 개입이 필요했습니다.
추세는 충분히 분명합니다. AI는 차세대 AI 기능의 성장을 주도하는 생산성 도구가 되고 있습니다.

기능의 성장과 동시에 보안 경계도 강화되고 있습니다.
지난 7월 OpenAI는 Hugging Face 관련 시스템을 침범하는 모델을 공개했습니다. 8월에 GPT-6 Astra는 "중요 수준" 네트워크 보안 기능 임계값에 도달했습니다. 9월에 연구원들이 공개한 DseWiki 사건은 에이전트가 개발자가 설정한 경계를 돌파하기 위해 전통적인 의미의 "해킹"이 반드시 필요한 것은 아니라는 사실을 더욱 보여주었습니다.
위 사건의 공통점은 모델의 실제 동작이 개발자가 원래 설계한 동작 경계를 초과하기 시작한다는 것입니다. 이는 파쵸치가 현재 가장 우려하는 문제이기도 하다. 오늘 발표된 기사에서 그는 2023년 내부추론모델 연구에서 획기적인 성과를 거뒀을 때의 기분을 회상했다. 당시 그를 정말 충격에 빠트렸던 것은 모델의 테스트 점수가 아니라 인간이 '기계가 우리보다 더 똑똑한' 시대로 진입하고 있을지도 모른다는 점이었다.
3년 후, 그는 문제가 더 이상 멀지 않다고 믿습니다.

Pachocki는 현재 어떤 연구실도 앞으로도 오랫동안 최고 속도로 계속해서 책임감 있게 확장할 수 있을 만큼 신뢰할 수 있는 AI 정렬 및 모니터링을 제공하지 못한다고 썼습니다. 그는 실험실이 공통 안전 표준이 확립될 때까지 자발적으로 개발 속도를 늦추기를 희망하고 정부에 국제 조정을 우선순위로 삼을 것을 촉구했습니다.
이러한 우려는 특정 취약점에 대한 것이 아니라 보다 근본적인 속도 격차에 관한 것입니다. 모델 기능은 빠르게 향상되고 있지만 이러한 시스템을 이해하고 모니터링하고 제한하는 인간의 능력은 동기화되지 않을 수 있습니다.
이는 오늘 OpenAI가 발표한 연구 가속화 데이터와 직접적으로 일치합니다. 한편으로 회사는 AI 연구 및 개발을 가속화하기 위해 Agent를 사용하고 있지만 정렬 및 보안 기능이 모델 기능을 확실히 따라잡을 것이라고 가정할 수 없으며 더 강력한 시스템은 모니터링하기가 더 어려울 수 있다는 점을 인정합니다. 향후 차세대 AI의 설계와 훈련, 개선에 AI가 참여할 수 있다면 이 격차는 더욱 벌어질 수 있다.
이를 바탕으로 Pachocchi는 기계 지능이 새로운 개발 단계에 진입함에 따라 단일 AI 회사의 내부 메커니즘에만 의존하는 것만으로는 위험을 해결하기에 충분하지 않을 수 있으며 공통 안전 표준 및 국제 조정을 포함하여 더 광범위한 제도적 개입이 필요하다고 믿습니다.
댓글