요약:
Anthropic CEO Dario Amodei는 보안 및 정렬 연구를 위한 시간을 벌기 위해 최첨단 모델 기능의 개선 속도 제어를 옹호하는 3단계 인공 지능 보안 프레임워크를 제안했습니다. Anthropic은 보안 조치를 확인하고, 사고를 보고하고, 모델 교육 프로세스를 평가하기 위해 제3자 평가자가 회사에 장기간 액세스할 수 있도록 허용하는 최초의 회사입니다.

Anthropic은 상설 외부 평가팀을 도입할 예정입니다
Amodei는 "The Speed of Frontier Progress Must be Controlled"라는 제목의 기사에서 첨단 인공지능 기업이 일반 직원에 가까운 지속적인 내부 접근을 제공하는 독립적인 제3자 평가팀을 제공해야 한다고 제안했습니다. 평가자는 기업이 안전 약속을 준수하는지 확인하고, 사고를 조사 및 보고하며, 모델 및 교육 프로세스에 대한 정렬 평가를 수행합니다.
Anthropic은 이 조치를 일방적으로 시행하기로 약속했으며 외부 평가자에게 사무실 공간, 액세스 배지, 회사 장비, 내부 위험 평가팀에 대략적으로 동등한 작업 공간 및 도구 액세스 권한을 제공할 계획입니다. 법적 제한, 고객 개인 정보 보호 또는 영업 비밀과 관련된 콘텐츠에는 예외가 적용될 수 있습니다.
외부 평가자는 위험, 사고, 회사 안전 관행에 관한 주요 조사 결과를 독립적으로 발표할 권한을 갖습니다. Anthropic은 보안, 법적 특권 및 제3자 기밀 유지와 관련된 정보를 제한적으로 편집할 수 있지만 결론이 회사에 불리하다는 이유만으로 공개를 막을 수는 없습니다. 평가자는 삭제가 자신의 판단에 영향을 미쳤는지 여부를 공개적으로 밝힐 수도 있습니다.
3단계 프레임워크에는 업계와 정부의 참여가 필요합니다
독립적인 평가자를 참여시키는 것 외에도 Amodei가 제안한 조치의 두 번째 단계에서는 민주주의 국가의 최첨단 인공 지능 회사가 공통 안전 표준 개발을 조정하고 모델 기능에 대한 무제한 경쟁을 제한하도록 요구합니다.
일부 기업 간 조정은 독점금지법으로 제한될 수 있으므로 정부는 제도적 지원을 제공해야 합니다. Amodei는 충분한 수의 기업이 외부 감독을 수락한 후에는 업계가 모델 역량과 교육 프로세스를 기반으로 검증 가능한 감속 계획을 개발할 수 있는 위치에 있게 될 것이라고 주장했습니다.
세 번째 단계에는 국제적 조정이 포함됩니다. 아모데이는 민주주의 국가들이 생물무기 개발을 위한 인공지능(AI) 사용 금지 등 공동 관심 분야부터 시작해서 권위주의 국가를 포함한 다른 정부들과 공동 안보 규칙을 논의할 것을 제안했다.
모델 기능은 위험 제어보다 빠르게 향상될 수 있습니다
아모데이는 최근 차세대 모델 개발에 참여할 수 있는 인공지능 모델의 능력이 향상되면서 기술 반복 속도가 빨라질 수 있다고 말했습니다. 모델 역량이 지속적으로 빠르게 향상된다면 관련 시스템을 이해하고 평가하고 제어하는 인간의 능력이 이를 따라가지 못할 수도 있습니다.
그는 모델 해석 가능성, 보안 평가, 정렬 연구 및 운영 사양과 같은 영역에서 향후 1~2년 내에 상당한 진전이 이루어질 수 있다고 추정합니다. 기능 발전 속도를 적절하게 제어하면 업계가 인공 지능 연구 및 개발을 완전히 중단하지 않고도 이러한 조치를 위한 시간을 벌 수 있습니다.
OpenAI CEO인 Sam Altman은 나중에 독립 평가자의 도입을 지지했으며 OpenAI도 유사한 방식을 채택할 것이라고 말했습니다. Elon Musk는 또한 모델 개발 속도를 늦추라는 Amodei의 요청에 공개적으로 동의했습니다.
댓글