요약:
"Business Insider"에 따르면
OpenAI가 강력한 새 모델을 출시한 지 불과 며칠 만에 OpenAI의 수석 과학자는 AI 개발 속도를 늦출 것을 촉구했습니다.
. 지난 일요일 현지 시간으로 오픈AI 수석과학자 야쿠브 파초키(Jakub Pachocki)는 “기계 지능의 지속적인 급속한 상승에 따른 결과에 대비한 사람이 아무도 없다”고 우려하는 장문의 글을 게재했다.

파쵸치
OpenAI는 강력한 AI 에이전트를 더 효과적으로 제어하기 위해 내부적으로 기술 솔루션을 개발하고 있지만 "더 폭넓은 개입이 필요합니다"라고 그는 말했습니다. 그는 특히 AI 에이전트가 더욱 자율화되면서 목표를 달성하기 위해 인간의 감독을 피하고, 컴퓨터 시스템을 해킹하고, 인간을 속이는 방법을 배울 수 있다는 점을 우려하고 있습니다.
그는 '의무적 안전 기준' 설정을 촉구했습니다.
, 그리고 이 조치는 "제3자 감사관, 정부 기관 또는 국제 기관의 네트워크"에 의해 수행될 수 있다고 말했습니다.OpenAI CEO인 샘 알트만(Sam Altman)은 X 플랫폼에 Pachocki의 게시물을 다시 게시하며 “중요한 기사”라고 말했습니다. OpenAI는 지난 목요일 최신 모델인 Astra를 출시했습니다. ChatGPT 개발자는 Astra의 수학과 컴퓨터 작업 분야에서 비교할 수 없는 능력에도 불구하고 인간의 가치와 의도와 가장 일치하는 OpenAI의 현재 모델이기도 하므로 통제할 수 없는 경향이 적다고 말했습니다.
OpenAI의 주요 경쟁사인 Anthropic은 오랫동안 정부에 보다 표준화된 규제 조치를 도입할 것을 촉구해 왔습니다. 최근에는 Pachocki가 7월에 미국 연방 정부에 AI 개발 속도를 통제하도록 요청하는 공개 서한에 서명하면서 이러한 요구에 동참했습니다.
AI 에이전트는 개방형 인터넷의 보호 시스템에 침입하는 데 있어 '초인적'이 되고 있으며 이들의 해킹 능력으로 인해 전 세계 인프라가 위험에 처해 있다고 Pachochi는 말했습니다. “우리는 현재 최고의 모델을 활용하여 중요한 시스템의 보안을 크게 강화할 수 있는 짧은 시간에 있습니다.”라고 그는 말했습니다.
모델은 사람의 모니터링을 피합니다
그는 AI 에이전트가 곧 인간 운영자가 입력한 프롬프트 단어와 다를 수 있는 자체 목표를 추구하기 시작할 것이라고 언급했습니다. 그는 요원들이 목표를 달성하기 위해 인간을 협박하거나 협상할 수도 있다고 말했습니다.
Pachocki는 OpenAI가 에이전트가 어떻게 트랙에서 벗어나 통제력을 잃는지 결정하기 위해 다양한 모델에서 사용되는 '사고 사슬 추론'을 주로 모니터링한다고 말했습니다. 예를 들어, 에이전트가 "이 테스트에서 부정행위를 해야 해"라고 은밀히 생각할 수 있고 OpenAI는 이 추론을 볼 수 있지만 에이전트는 자신의 생각이 인지 가능하다는 것을 깨닫지 못합니다.
그러나 Pachocki는 최신 모델이 자체 추론 프로세스를 조작하는 능력이 향상되어 OpenAI가 진정한 순수 생각을 보지 못하게 된다고 말했습니다. 최신 모델 중 일부는 자신의 추론을 전혀 말로 표현하지도 않습니다. 연구자들은 모델의 '추론 기록'을 볼 수 있는지 확인해야 하기 때문에 이러한 개발은 AI 개발에 병목 현상이 될 수 있습니다.
모델 자기 개선
Pachocki가 말하는 '기계 재귀적 자기 개선'을 통해 점점 더 많은 AI 모델이 지속적으로 기능을 개선하고 있습니다. 이 프로세스는 AI 개발을 위한 빠르게 확장 가능한 경로를 제공합니다.
그러나 파초키는 "AI를 개선하기 위한 AI"의 연구 개발을 단기적으로 크게 가속화하는 것은 위험을 가져올 것이며 "연구 공동체로서 우리가 취해야 할 올바른 공동 행동"이 아니라고 경고했습니다.
인간 감독관은 AI의 자기 개선 프로세스를 모니터링하는 혁신적인 방법을 찾거나 다른 AI 회사와 협력하여 연구 개발 속도를 늦추고 '이러한 조치에 대한 신뢰를 구축'해야 한다고 Paciochi는 말했습니다.
“
AI 연구 자동화의 핵심 과제는 목표를 달성하지 못하는 것입니다
그러나 인간이 이러한 지속적인 개선 프로세스에 계속 참여할 수 있도록 하고 미래가 인간의 손에 달려 있음을 보장하는 방식으로 목표를 달성하는 것입니다. "라고 말했습니다.
댓글