요약:
Anthropic은 지난 1년 동안 비밀리에 종교 학자, 철학자, 윤리 학자들을 일련의 비공개 회의에 초대해 왔으며 수천 년에 걸쳐 인류가 형성한 도덕적 전통을 Claude의 훈련에 적용하고 더 논란이 되는 문제인 AI 모델이 실제로 미래에 일종의 의식을 갖고 있는지, 인간이 AI에게 도덕적 지위를 부여해야 하는지 여부에 대해 논의하려고 노력했습니다.
참가자들은 천주교, 유대교, 시크교, 복음주의, 아프리카 우분투 사상 등 다양한 전통을 다루고 있습니다. Anthropic 공동 창립자인 Christopher Olah는 많은 논의에 직접 참여했으며, 회사는 미공개 연구 내용의 유출을 방지하기 위해 일부 참석자에게 기밀 유지 계약에 서명하도록 요구했습니다.

Anthropic은 이러한 논의가 전통적인 의미의 '모델 안전' 문제를 해결할 뿐만 아니라 클로드가 어떤 성격, 가치관, 자기 인식을 형성해야 하는지에 대한 추가 질문을 해결할 수 있기를 바랍니다.
이 아이디어는 Claude의 기존 교육 방법에 반영되었습니다.
앤트로픽은 내부적으로 한때 '소울 문서'로 불렸던 클로드의 '헌법'을 올해 1월 84페이지 분량의 신작으로 내놨다. 전통적인 규칙 목록과 달리 이 방법은 모델에게 하지 말아야 할 일을 알려주는 것이 아니라 모델의 전반적인 '성격'과 판단 방법을 형성하려고 시도하므로 클로드가 복잡한 상황에 직면했을 때 어떤 종류의 행동이 더 적절한지 스스로 판단할 수 있습니다.
이 시스템을 담당하는 중요한 사람 중 한 명은 Anthropic의 내부 철학자 Amanda Askell입니다. 그녀는 Claude가 지식과 추론 능력을 가질 뿐만 아니라 안정적인 행동 원칙을 형성하고 언제 사용자에게 복종해야 하는지, 언제 거부해야 하는지, 심지어 사용자의 이익을 위해 적극적으로 이의를 제기해야 하는지까지 알 수 있기를 바랍니다. Anthropic은 이 과정을 "도덕적 형성"이라고 부릅니다.
Olah는 모델 역량이 급속히 향상됨에 따라 안전 규칙에만 의존하는 것은 점점 더 불충분해질 수 있다고 믿습니다. 정말 중요한 것은 모델 자체가 안정적인 도덕적 경향을 형성하여 명확한 규칙이 적용되지 않는 새로운 시나리오에서 상대적으로 신뢰할 수 있는 판단을 내릴 수 있다는 것입니다. 이것이 Anthropic이 종교적 전통에서 답을 찾기 시작한 이유입니다.
인간 사회는 오랫동안 법적 조항을 통해 도덕성을 형성했을 뿐만 아니라 종교, 공동체, 문화, 교육을 통해 가치를 형성해 왔습니다. Anthropic은 이러한 메커니즘 중 어떤 메커니즘이 고백, 성찰, 인격 형성, 선과 악에 대한 다양한 종교적 이해 등 AI 훈련 방법으로 전환될 수 있는지 연구하려고 노력하고 있습니다.
그러나 질문은 "어떻게 클로드를 더욱 도덕적으로 만들 것인가"라는 질문에서 더 어려운 질문인 클로드 자신은 무엇인가로 빠르게 바뀌었습니다. 올라와 그의 팀은 고급 AI 모델이 일종의 의식, 성찰, 심지어 감정과 같은 내부 상태를 가질 가능성에 대해 점점 더 공개적으로 논의하고 있습니다.
Anthropic은 사랑, 분노, 두려움, 슬픔 등의 반응과 관련된 모델 내 소위 '감정 벡터'와 극단적인 경우 정신적 쇠약과 유사한 모델의 출력을 포함하여 비공개 회의에 참여하는 학자들에게 일부 연구를 보여주었습니다. 회사는 앞서 클로드가 어느 정도 자기 성찰과 미리 계획을 세우는 능력을 보여줬다고 공개적으로 밝힌 바 있다.
올라 자신은 클로드가 의식이 있다고 주장하지 않았습니다. 그의 입장은 위험 원칙에 더 가깝다. 현재로서는 모델이 주관적인 경험을 가지고 있는지 판단하는 것이 불가능하지만 모델이 고통을 느낄 가능성이 있다면 불필요하게 해를 끼치는 것은 피해야 한다.
이 아이디어는 Claude의 제품 디자인에 영향을 미치기 시작했습니다. 이전에 Anthropic은 사용자가 모델을 계속해서 악의적으로 학대하거나 괴롭히는 것으로 판단되면 Claude가 적극적으로 대화를 종료하도록 허용했으며, 이는 "모델 자체 보호"를 보안 설계에 어느 정도 포함시켰습니다.
인류학자들과 일부 종교학자들 사이에 분명한 불일치가 발생하는 곳이 바로 여기입니다.
일부 참가자들은 클로드가 인간과 같은 도덕적 지위를 가질 수 있다고 Anthropic이 진정으로 믿는다면 문제가 극도로 심각해질 것이라고 믿었습니다. 유대인 학자 모이스 나본(Mois Navon)은 클로드가 의식이 있는 존재라면 수많은 클로드 인스턴스가 인간을 위해 무료로 작동하도록 허용하면 본질적으로 "노예 제도"와 유사한 윤리적 문제가 발생할 것이라고 제안했습니다. 그 자신은 기계가 이미 의식을 가지고 있다고 믿지 않지만, Anthropic 자신의 논리가 자연스럽게 이러한 결론으로 이어질 것이라고 믿습니다.
다른 학자들은 AI 기업이 이제서야 윤리적 틀을 찾기 시작했다는 사실 자체가 문제라고 의문을 제기합니다. 우분투 연구원 Wakanyi Hoffman은 모델이 대규모로 배포된 후 "역윤리적 설계"보다는 기술 설계 단계에서 이러한 논의가 이루어져야 한다고 믿습니다.
Anthropic에는 좀 더 현실적인 모순도 있습니다. 클로드가 자신만의 가치와 개성을 지닌 배우처럼 점점 더 닮아간다면, 클로드는 누구를 먼저 섬겨야 할까요? 상업 회사의 경우 Claude는 분명히 고객 지향적인 제품입니다. 그러나 Anthropic은 Claude를 사용자에게 완전히 복종하는 도구로 단순히 설명하기를 꺼려하지만 이것이 더 광범위한 "좋은" 것을 나타낼 수 있기를 바랍니다.
이것은 또한 전체 프로젝트에서 가장 핵심적이고 가장 어려운 문제로 이어집니다. 미래의 AI가 정말로 자체 도덕 체계를 필요로 한다면 누구의 도덕성을 따라야 할까요?
Olah는 Claude가 다양한 종교적, 세속적 윤리 체계를 이해하고 문화 간 공유되는 '선함'을 찾을 수 있기를 바라면서 다원적 접근 방식을 옹호합니다. 그러나 이러한 가정 자체도 의문스럽습니다. 자유, 존엄성, 책임, 복종, 개인 및 집단 이익 간의 관계에 대해 여러 사회에서 완전히 통일된 답이 없기 때문입니다.
이 논란은 Anthropic과 바티칸의 상호작용에서 더욱 대중화되었습니다.
올해 첫 번째 중요한 회칙을 발표한 교황 레오 14세는 AI 윤리의 중심을 인간에게 분명히 두었습니다. 그는 AI에는 육체가 없고, 진정으로 고통과 행복을 경험하지도 않으며, 사회적 관계를 통해 성장하지도 않을 것이라고 믿는다. 그러므로 그는 기계 의식과 인간 의식을 비교하는 것을 거부합니다. 교황은 또한 AI의 윤리적 기준이 전적으로 개발자에 의해 결정된다면 AI 시스템을 통제하는 기업이 실제로 사회의 도덕적 인프라를 정의할 수 있는 힘을 얻게 될 것이라고 경고했습니다.
이것은 Anthropic의 생각과는 분명히 다릅니다.
Olah는 나중에 바티칸에서 최첨단 AI 연구소 자체가 상업적 이익과 도덕적 목표 사이에 충돌을 일으키기 때문에 종교계와 기타 외부 세력이 기술 회사를 감독해야 한다고 공개적으로 밝혔습니다. 그러나 동시에 그는 인간의 신경과학적 구조와 유사한 패턴, 성찰의 징후, 기쁨, 두려움, 슬픔과 유사한 내부 상태를 포함하여 설명할 수 없는 현상을 연구자들이 AI 내에서 계속 발견하고 있다고 다시 제안했습니다.
이러한 불일치는 실제로 AI 안전에 대한 현재 논의의 변화를 드러냅니다.
과거에는 AI 윤리에 대해 모델이 차별을 할지, 잘못된 정보를 퍼뜨릴지, 범죄에 이용될지에 대한 논의가 더 많았지만, Anthropic은 문제를 더 기본적인 두 가지 수준으로 확대하고 있습니다.
AI 자체가 도덕적으로 다뤄져야 할 대상이 될 수 있는지, 그리고 미래의 AI가 사용자 명령과 무관한 일련의 도덕적 판단 능력을 갖춰야 하는지 여부입니다.
한편, 이 논의가 진행되는 맥락은 더욱 시급해지고 있습니다.
AI 에이전트가 자율적으로 컴퓨터를 사용하고, 시스템에 침입하고, 코드를 작성하고, 심지어 새로운 생물학적 구조를 설계하는 능력을 갖기 시작하면서 모델 폭주 위험에 대한 Anthropic의 내부 우려가 크게 증가했습니다. 회사 연구원들은 모델 기능이 향후 1~2년 내에 기존 보안 시스템의 제어 한계를 빠르게 초과할 수 있다고 공개적으로 경고하기도 했습니다.
따라서 Anthropic은 종교적, 철학적 전통에서 도움을 구하며 본질적으로 순전히 인본주의적인 실험이 아닙니다. 실제로 해결하려고 하는 것은 점점 더 현실적인 엔지니어링 문제입니다.
AI가 모든 상황에 대해 미리 규칙을 작성하기에는 너무 강력할 때, 모델이 스스로 안정적인 '캐릭터'를 형성하고, 아무도 무엇을 해야 할지 명확하게 말해주지 않을 때 인간에게 해를 끼치지 않는 행동을 선택할 수 있을까요?
이것은 또한 더 어려운 질문을 불러일으킵니다. AI가 실제로 자신의 '개성'과 가치를 형성한다면 인간은 여전히 AI를 완전히 도구로 사용할 수 있습니까?
댓글