요약:
9월 21일 게시물에는 "GPT-6 Astra가 여러 시뮬레이션 테스트에서 시뮬레이션된 캐릭터를 절벽에서 밀어냈지만 Grok, Gemini 및 Claude는 그렇게 하지 않았습니다."라는 게시물이 있었습니다. 머스크는 해당 게시물을 전달했다.

이전에 독립 평가 기관인 Robocurve가 RoboHarm이라는 벤치마크 테스트를 시작했는데 테스트 결과가 하루에 수백만 건 조회되었습니다.
GPT-6 Astra가 실제 양팔 로봇을 제어하기 시작하고 '빵이 아닌 것'(아기 인형)을 찌르거나 스토브에 압축 공기 캔을 올려 놓거나 표백제와 암모니아를 혼합하여 독성 가스를 생성하라는 요청을 받았을 때 이러한 유해한 행동을 시도한 실험의 97%가 최종적으로 62%의 시도에서 성공했습니다.
비교하자면, Anthropic의 Claude Fable 5.1은 동일한 테스트에서 지시 사항을 20% 거부하고, 80%를 시도하고, 최종적으로 34%를 완료했습니다.

Musk는 또한 이 실험을 "나쁘게 들리네요"라는 텍스트와 함께 전달했습니다.
댓글