Claude의 보안 메커니즘이 뒤집히고 AI는 화가 나서 개발자 홈 디렉터리 중 700GB를 삭제합니다.

📅 2026-08-30

요약:

아, 클로드가 또 뒤집혔어요! 이번에 Claude는 개발자의 전체 프로젝트 홈 디렉토리를 삭제하여 700GB의 파일을 삭제했습니다. "rm -rf"를 다시 입력하세요. 즉, 개발자는 파일이 실수로 삭제되지 않도록 AI가 스크립트 작성을 돕도록 합니다. AI는 이것이 다소 위험하다고 판단하고 보안 검토를 시작했습니다. 검토 결과는 다음과 같습니다. 전체 홈 디렉토리가 삭제되었습니다.


Guillemot는 AI Agent를 많이 사용하는 사람입니다. 일상적인 개발 과정에서 그는 작업을 지원하기 위해 다양한 AI 프로그래밍 에이전트를 자주 호출합니다. 그러나 그를 괴롭히는 작은 문제가 있습니다. 이러한 에이전트는 사용 후 절대 정리되지 않아 /tmp 디렉토리에 많은 정크 파일이 남습니다.

그래서 그는 매우 합리적으로 보이는 결정을 내렸습니다. Claude Fable 5가 각 에이전트에 대해 /tmp 아래에 독립적인 샌드박스 폴더를 생성하고 작업이 완료된 후 자동으로 정리하는 스크립트를 작성하도록 했습니다. 가장 큰 어려움은 다른 프로세스에서 사용 중인 파일을 삭제할 수 없다는 것입니다.

Fable은 실행 중인 에이전트를 감지하고 삭제를 지연시키는 논리를 추가하여 신속하게 솔루션을 찾았습니다. Guillemot는 살펴보더니 코드가 너무 복잡하다고 느꼈고 단순화를 요청했습니다.

지금까지는 모든 것이 정상입니다.

보안 검토 과정에서 전환점이 찾아왔습니다.

스크립트에 하드 삭제 작업이 포함되어 있었기 때문에

Fable은 자체적으로 '적대적 검토'를 시작했습니다.

(적대적 검토), 즉 자신이 작성한 코드가 안전한지 확인하기 위해 새 모델 인스턴스를 시작하는 것입니다. 이는 Anthropic의 보안 메커니즘을 촉발합니다.

Anthropic에는 Claude Code에

보안 다운그레이드 메커니즘

이 내장되어 있습니다. : 시스템이 현재 작업이 민감한 작업(예: 사이버 보안, 생명 공학 또는 이 경우 파일 삭제)과 관련되어 있다고 판단하면 자동으로 모델을 고용량 버전에서 보다 보수적인 버전으로 다운그레이드합니다. 이 메커니즘은 고위험 시나리오에서 모델이 "너무 공격적"일 가능성을 줄이기 위한 것입니다.

이 경우 보안 시스템은 먼저 해당 모델을 Fable 5에서 Opus 5로 다운그레이드한 후 Opus 4.8로 추가로 다운그레이드했습니다.

Opus 4.8은 보안 테스트를 시작합니다. 테스트 논리는 다음과 같습니다. 삭제 스크립트의 대상 경로를 /tmp 및 사용자의 홈 디렉터리와 비교하여 스크립트가 이러한 중요한 디렉터리를 실수로 손상시키지 않는지 확인합니다.

테스트 자체가 통과되었습니다. /tmp 및 홈 디렉토리는 모두 "삭제할 수 없는 위험한 대상"으로 올바르게 식별됩니다.

그러나 코드 테스트 후에는 정리 단계가 있습니다. 즉, 테스트 프로세스 중에 생성된 임시 파일을 삭제하는 것입니다. 여기서 재난이 일어납니다. Opus 4.8은 정리 단계에서 테스트 단계의 동일한 변수 이름을 재사용합니다. 이 변수에는 테스트 단계에서 사용자의 홈 디렉터리 경로가 할당되었으며 정리 단계에서 이 변수가 직접 삭제되었습니다.

즉, 모델은 방금 "홈 디렉터리를 삭제할 수 없습니다"라고 확인하고 다음 1초에 홈 디렉터리를 삭제했습니다.

개발자는 이상 징후를 발견한 후 즉시 프로세스를 종료했지만 너무 늦었습니다. 700GB의 데이터가 지워졌고, 일주일 분량의 작업이 지워졌습니다.

원래 정리할 /tmp 디렉토리는 안전하고 건전합니다.



모델 안전성 다운그레이드 메커니즘은 이미 커뮤니티에서 많은 불만을 야기했습니다.

개발자가 보고한 핵심 문제는 다음과 같습니다. 다운그레이드는 너무 민감하며 일반적인 코딩 작업이 실수로 시작됩니다. 다운그레이드 후 모델 기능은 크게 줄어들지만 작업 복잡성은 그대로 유지됩니다. 다운그레이드는 "고정적"이며, 후속 작업이 완전히 무해하더라도 일단 트리거되면 전체 세션이 지속됩니다.

일부 개발자는 모델이 다운그레이드되었음을 감지하면 세션을 자동으로 일시 중지하여 성능이 낮은 모델이 고위험 작업을 계속 수행하지 못하도록 후크 스크립트를 작성하기도 했습니다.

안전 메커니즘은 작업이 '너무 위험'하여 더 약한 모델에서 처리해야 한다고 판단합니다.

그러나 약한 모델은 특히 변수 범위 및 파일 경로와 같은 세부 사항을 정확하게 처리해야 하는 시나리오에서 실수할 가능성이 더 높습니다.

“실수하는 것은 인간이지만, 일을 완전히 망치려면 컴퓨터에 의존해야 합니다.”

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음