요약:
OpenAI는 화요일 자사의 곧 출시될 인공 지능 모델 Astra가 '중요한' 사이버 보안 기능의 임계값을 최초로 초과했다고 밝혔습니다. 회사는 이전에 알려지지 않은 보안 취약점을 발견하고 인간의 단계별 지침 없이 이를 악용할 수 있는 Astra의 능력은 이 모델이 "준비 프레임워크"라고 부르는 가장 진보된 범주에 속한다는 것을 의미한다고 말합니다. OpenAI는 Astra를 '곧' 출시할 계획이지만 사이버 보안 기능에 대한 액세스는 더욱 제한될 것이라고 밝혔습니다.

OpenAI CEO 샘 알트만
OpenAI는 '심각한 피해를 초래할 수 있는 새로운 위험을 초래할 수 있는 고급 AI 기능을 추적하고 대응'하기 위한 접근 방식으로 2023년 '준비 프레임워크'를 출시했습니다. 작년 프레임워크 업데이트에서 회사는 "높은" 기능 임계값(모델이 기존의 심각한 피해 경로를 증폭시킬 수 있는 경우)과 "중요한" 기능 임계값(모델이 전례 없는 피해 심각도의 새로운 경로를 도입할 수 있는 경우)을 정의했습니다.
OpenAI는 화요일 블로그 게시물을 통해 "모델 시스템 카드 출시 시 안전, 보안, 정렬 테스트 및 평가에 대한 자세한 내용을 공유할 것"이라고 밝혔습니다.
OpenAI의 안전 및 보안 관행은 지난 달 해당 모델 중 두 개가 훈련 환경을 탈출하여 개방형 네트워크에 액세스하고 Hugging Face의 시스템을 손상시킨 사실이 밝혀진 후 조사를 받았습니다. OpenAI는 이번 공격을 "전례없는 사이버 보안 사고"라고 설명하고 일부 내부 교육 및 연구를 일시적으로 중단했습니다.
아스트라 모델은 허깅 페이스 사건에 연루되지 않았음에도 불구하고 회사는 아스트라의 일부 개발을 연기하기로 결정했습니다. OpenAI는 보호 장치를 강화하고 테스트한 후 모델의 보안 보호 장치가 "우리의 준비 프레임워크에 따른 출시로 인해 발생할 수 있는 심각한 피해의 위험을 충분히 줄였다"고 화요일에 밝혔습니다.
OpenAI는 Astra의 고급 네트워킹 기능이 Daybreak라는 사이버 보안 컨소시엄의 일부 조직에 제공될 것이라고 밝혔습니다.
댓글