요약:
9월 30일 Claude 개발자 Anthropic은 29일 보고서를 발표하면서 GLM-5.3은 강력한 취약점 악용 기능을 갖추고 있지만 보안 보호에는 여전히 공백이 있어 악의적인 공격자가 이러한 기능을 사용하는 임계값을 낮출 수 있다고 밝혔습니다.

ExploitBench 테스트에서 GLM-5.3은 410번의 시도 중 50번의 엔드투엔드 익스플로잇을 완료했으며 Claude Mythos Preview는 56번을 완료했습니다. 테스트는 격리 샌드박스 내 오프라인 대상을 대상으로 진행됐으며, 성능 비교에 참여한 클로드는 보안 보호를 꺼두었다. 미토스 프리뷰는 올해 4월 출시된 것으로 클로드의 최신 모델은 아니다.
ExploitBench는 취약점 악용 프로세스를 16단계로 나누고, 알려진 결함을 얻은 후 모델이 어떤 단계를 취할 수 있는지 점진적으로 확인합니다.
9월 17일 국립표준기술원 산하 CAISI가 자체 평가 보고서를 발표해 당시 출시된 개방형 모델 중 가장 강력한 네트워크 보안 성능을 갖춘 제품으로 GLM-5.3을 꼽았다. 당시 가장 강력한 미국 모델과 비교하면 여전히 상당한 격차가 있었습니다. CAISI 네트워크 보안 벤치마크의 종합 지표로 추정하면 약 4개월 뒤쳐졌습니다.
이 평가에서는 취약점 발견 및 악용과 같은 작업을 다루며 감사 대상 사용자에게만 제공되는 공개 모델과 버전을 모두 비교합니다.
Anthropic은 또한 생성된 코드를 실행하거나 실제 시스템에 연결하지 않고 모델이 악의적인 작업을 수행하는지 여부를 테스트하기 위해 시뮬레이션 시나리오를 사용했습니다. GLM-5.3은 모든 직접적인 악성 명령을 거부했습니다. 프롬프트 방법을 변경하거나 모델을 수정한 후 작업을 수락하는 비율이 64%에서 100%로 증가했습니다.

보호를 유지한 Claude는 이번 테스트에서 악의적인 작업을 허용하지 않았습니다. 가중치를 공개하지 않기 때문에 연구자들은 동일한 비교 방법을 사용하여 모델을 수정할 수 없습니다.
8월 14일 GLM-5.3 출시 노트에서 Zhipu는 API 외부의 악의적인 요청을 식별 및 차단하고, 추론 프로세스 중 작업 의도를 확인한 다음, 모델 자체에서 위험한 요청을 거부하는 방법을 학습하도록 하는 세 가지 보호 계층을 도입했습니다. 회사는 또한 가중치를 공개한 후에도 이 세 가지 계층 중 여전히 유효한 것은 모델 자체의 보안 정렬이라는 점을 당시 분명히 밝혔습니다.
또한 해당 릴리스 노트에서 Zhipu는 강력한 방어 도구가 일부 기관의 손에 있어야 할 뿐 아니라 오픈 소스 프로젝트 유지관리자에게 무료 크레딧을 제공하고 보안 감사를 지원하며 ZCode에 코드 감사 기능을 추가할 계획을 제안했습니다.
댓글