AlphaGo 핵심 작성자: 10년이 지난 지금도 LLM은 그 체스 게임에서 "신의 움직임"의 본질을 배우지 못했습니다.

📅 2026-10-05

요약:

2016년 3월, 포시즌스 호텔 서울. 인간-기계 대결 2차전 중반, 알파고가 5번째 줄에 흑점을 떨어뜨렸다. 현장 해설은 할 말을 잃었고, 프로 체스 선수들의 상식에 따르면 이 동작은 거의 자유투에 가깝기 때문에 프로그램에 버그가 있다고 의심하는 사람들도 있었습니다.


다음 이야기는 모두가 알고 있습니다. 알파고는 해당 게임에서 승리했을 뿐만 아니라, 이세돌을 총점 4:1로 이겼다. 이세돌은 경기 후 자주 인용되는 말을 남겼다. “원래 알파고는 확률 계산에 의한 기계인 줄 알았는데, 그 손을 보고 생각이 바뀌었어요. 알파고는 창의적이겠군요.”

그게 유명한 동작 37입니다.

10년 후, AlphaGo를 만든 사람이 일어나 이렇게 말했습니다. 오늘날의 AI에는 체스 게임에 필요한 기능이 없습니다.


이렇게 말한 사람은 AlphaGo의 핵심 저자 중 한 명이며 오랫동안 기계 학습 연구에 종사해 온 Thore Graepel입니다. 최근에 그는 흥미로운 결정을 내렸습니다. Google DeepMind를 떠나 자신이 더 중요하다고 생각하는 일, 즉 기계에 실제 추론 기능을 갖춘 사업을 시작하기로 한 것입니다.


그 가슴 아픈 요점은 그가 최근 MIT Technology Review에 게재한 기사에서 나왔습니다. 기사 제목은 "속지 마세요 - LLM은 추론할 수 없습니다."라는 제목으로 매우 간단합니다. 이 기사를 읽은 후 Turing Award 수상자 Yann LeCun은 "진정한 추론에는 검색이 포함되어야 하는데 LLM에는 이러한 능력이 없습니다"라고 강조하며 감사를 표했습니다.


Thore Graepel이 왜 그런 말을 했나요? 이 글에 쓰여진 내용을 살펴보겠습니다.

37번 동작은 '번쩍이는 영감'이 아니었습니다.

추론의 산물이다

많은 사람들이 37번째 수를 '기계 직관의 신화적인 순간'이라고 묘사합니다. 번갯불 속에서 AI는 인간 체스의 천년 역사를 뛰어넘는 뛰어난 수를 보았습니다. Graepel은 이것이 AlphaGo에 대한 가장 큰 오해라고 말했습니다.


이를 이해하려면 먼저 알파고의 내부 구조를 분해해야 합니다. 이는 두 가지 시스템으로 구성됩니다. 하나는 "이 상황에서 마스터가 어떻게 플레이할지" 예측하기 위해 대규모 인간 체스 기록을 학습하는 정책 네트워크입니다. 이는 직관적인 부분입니다. 다른 하나는 특정 체스 동작이 "인간이 플레이한 것처럼 보이는지" 여부에 상관하지 않고 각 후보 위치가 이끄는 미래를 추론하기 위해 수천 개의 가지를 포함하는 게임 트리를 명시적으로 구축하는 검색 메커니즘입니다.

핵심은 전략 네트워크의 관점에서 볼 때 37번째 수는 눈에 띄지 않는다는 것입니다. 전문 인간 체스 선수가 이 수를 사용할 확률은 약 10,000분의 1에 불과합니다. 직감만 들으면 이 손은 전혀 선택되지 않을 것입니다. 이 '믿을 수 없는' 움직임이 더 나은 결말로 이어진다는 사실을 치밀한 계산 끝에 찾아낸 것이 탐색 메커니즘이었다.

Graepel은 Kahneman의 유명한 프레임워크를 빌려 이를 설명합니다. 인간의 사고는 두 가지 모드로 나뉩니다. 시스템 1은 빠르고 직관적이며 수월합니다. 시스템 2는 느리고 단계별이며 신중하게 무게를 측정합니다. AlphaGo는 기계에서 이 두 모드의 드문 조합입니다. 신경망은 "이 움직임에는 기회가 있습니다"와 "이 상황은 승리할 것입니다"라는 직관을 제공하고 검색 메커니즘은 향후 공격 및 방어 변경에서 이러한 직관을 테스트하는 역할을 담당합니다. 절반이 없으면 작동하지 않습니다. 직관만으로는 37번째 수를 만들 수 없습니다. 폭력적인 검색만으로는 바둑의 천문학적 가능성을 걸러낼 수 없습니다.

여기에는 종종 간과되는 또 다른 비교가 있습니다. Deep Blue는 초당 2억 개의 체스 위치를 평가하고 6~8단계 앞을 내다보기 위해 인간이 하드 코딩한 규칙에 의존하여 1997년에 Kasparov를 물리쳤습니다. Go의 복잡성은 완전히 다른 수준에 있습니다. 수십 라운드를 거친 후의 기세와 필드의 성장과 하락에 따라 작품의 가치가 달라집니다. 모든 변화 중 아주 작은 부분만 계산하더라도 슈퍼컴퓨터는 수십억 년에 걸쳐 이를 계산해야 합니다. 그러므로 알파고는 '한 눈에 상황을 명확하게 보는' 법을 배워야 하고, 인간이 생각지도 못한 수를 만들어 내는 법도 배워야 한다. 컴퓨팅 파워를 무너뜨린다고 해서 승리할 수는 없습니다. 이는 매우 중요합니다.

대규모 언어 모델:

극단 1까지 훈련된 시스템

오늘의 AI를 살펴보겠습니다.

대규모 언어 모델의 작동 원리는 다음 토큰을 계속해서 예측하는 것입니다. 이것은 본질적으로 작동 중인 시스템 1입니다. 인간이 쓴 거의 모든 분야에서 빠르고 연관적이며 놀라운 패턴 완성이 가능하지만 "답변하기 전에 생각하기" 부분이 없습니다.

ChatGPT가 탄생한 지 얼마 지나지 않아 업계에서는 유창한 언어만으로는 실질적인 유용성을 지원할 수 없다는 사실을 깨달았습니다. 모두가 해결 계획에 익숙합니다. 모델이 답변을 서두르지 않도록 하고, 먼저 중간 단계를 생성하고, 문제를 분리하고, 중간 결과, 즉 사고의 사슬을 가져옵니다.

사고 사슬의 개선은 특히 수학과 코딩 분야에서 실제로 이루어지고 있습니다. 그러나 Graepel은 흥분으로 인해 쉽게 모호해지는 사실을 지적했습니다. 이러한 중간 추론 단계는 여전히 "다음 토큰 예측"과 동일한 프로세스이며, 최종 답을 제공하기 전에 조금 더 반복할 뿐입니다. AlphaGo의 검색처럼 진정으로 독립적인 추론 메커니즘을 도입하지 않습니다. 직관은 확장되지만 신중함으로 바뀌지는 않습니다.

그는 챗봇이 수행하는 작업이 '과학자들이 인정하는 종류의 추론'에 미치지 못하는 이유를 설명하기 위해 세 가지 단점을 추가로 나열했습니다.

첫째, 모델에는 명확하고 지속적으로 업데이트되며 검사 가능한 인지 상태가 없습니다. 현재 어떤 가설을 고려하고 있는지, 다양한 설명에 얼마나 신뢰를 두고 있는지, 어떤 증거에 무게를 두고 있는지, 어떤 질문에 답하지 않은 채 남아 있는지. 이런 것들은 새로운 정보가 들어오면 체계적으로 수정해야 하는데, 모델 내에 그런 '공개 원장'이 없습니다.

둘째, 모델은 '알아야 할 것'과 '지식을 사용하는 방법'을 분리하지 않습니다. 지식과 추론은 신경망의 가중치에 밀접하게 얽혀 있으며, 독립적이고 명시적으로 표현된 신념 체계는 없습니다.

세 번째, 가장 미묘함: 생각의 사슬은 사려 깊은 숙고처럼 보이지만 연구에 따르면 모델이 사실 이후에 이를 만들어내는 경우가 많습니다. 답은 한 길을 걸어가면 얻을 수 있지만, 보고된 것은 다른 길이다. "합리적으로 들리는 이야기"와 "실제로 일어난 추론"은 서로 다른 것입니다.

논리가 참인지 거짓인지

그게 그렇게 중요한가요?

그냥 잡담하고 떠들고 있는 것이라면 그 추론이 참인지 거짓인지는 중요하지 않을 수도 있습니다. 그러나 의학, 공학, 과학 연구 등 우리가 정말로 관심을 갖는 고위험 분야에서는 시스템이 도달하는 대상이 시스템에 도달하는 방식만큼 중요합니다. 진단이나 치료의 오류와 같이 문제가 발생할 경우 오류가 어디에 있는지 정확히 찾아낼 수 있어야 합니다. 즉, 추론 과정에 문제가 있는 것인지, 유효하지 않은 증거를 받아들이는 것인지, 아니면 잘못된 가정을 하는 것인지 등을 정확히 찾아낼 수 있어야 합니다. 사실 이후에만 이야기를 꾸며낼 수 있는 시스템은 그러한 시나리오에서 신뢰할 수 없거나 책임을 질 수 없습니다.

이것이 바로 Graepel이 DeepMind를 떠난 이유입니다. 그는 새로운 기계 추론 경로가 필요하다고 믿으며, 그 영감은 10년 전 알파고에서 나왔습니다.

AlphaGo는 현재 상황에 대한 모든 지식을 언제든지 게임 트리로 기록합니다. 트리에는 고려한 모든 변화, 가능한 모든 미래, 모든 움직임과 모든 상황이 신경망의 판단으로 표시됩니다. 추론이 진행됨에 따라 지속적으로 트리를 업데이트하고, 최종적으로 트리의 정보를 기반으로 이동을 결정합니다.

Graepel은 일반적인 추론 시스템에서도 마찬가지라고 믿습니다. 즉, 확인된 것, 의심스러운 것, 배제된 것, 아직 열려 있는 질문을 명확하게 표현하는 인지 상태를 유지하는 것입니다. 그리고 "추론"은 이러한 인지 상태를 바꾸는 일련의 "행동"입니다. 즉, 결론 도출, 문제 해체, 그리고 가장 중요한 것은 다음에 물어볼 질문, 수행할 계산, 실행할 실험을 결정하는 것입니다.

물론 오픈 월드 추론은 체스를 두는 것보다 훨씬 어렵습니다. 바둑판의 상태는 완전히 표시되며 규칙은 고정되어 있습니다. 현실 세계에서는 현재 상황이 부분적으로만 알려져 있고, 사용할 수 있는 작업이 많고 복잡하며, 작업의 결과가 무작위로 가득 차 있거나 전혀 알려지지 않은 경우도 있습니다.

그러나 좋은 소식은 수년에 걸친 LLM 및 기타 신경 모델의 발전이 이에 대한 부분을 제공했다는 것입니다. LLM은 알려진 정보와 사용 가능한 리소스를 기반으로 문제를 해결하는 경로를 제안할 수 있습니다. API 및 코드를 통해 도구와 상호 작용할 수 있습니다. 결론이 기존 증거에 의해 뒷받침되는지 여부를 평가하는 데 도움이 될 수 있습니다. 가장 중요한 것은 "이 단계에서 얼마나 많은 불확실성이 해결되었는지"를 기준으로 각 추론 동작을 평가하고 증거가 뒷받침될 때만 신념을 업데이트하는 독립적인 "심판"이 시스템에 있어야 한다는 것입니다. 규칙이 확립되면 시스템은 인증된 지식을 축적하고 과거 추론 경험을 통해 학습하며 자체 추론 전략을 개선할 수 있습니다.

Graepel은 이 그림을 스테로이드에 대한 과학적 방법이라는 생생하게 표현했습니다. 목표는 단 하나, 철저한 조사를 견딜 수 있는 지식을 생산하는 것입니다.

대규모 시스템 1,

시스템 2는 자동으로 커지지 않습니다

기사 끝부분에서 그는 자신의 태도를 분명히 밝혔습니다. 시스템 1을 더 크게 만든다고 해서 신뢰할 수 있는 기계 지능을 얻을 수는 없습니다. 규모는 직관을 날카롭게 해주지만 신중함은 그렇지 않습니다.

37번째 행이 중요한 이유는 기계가 위치를 방어하고 가능한 미래를 저울질한 다음 자체의 '직감'조차 거부했을 행을 선택했기 때문입니다.

인류사회에는 신약개발, 신소재, 기후, 의학진단 분야에서 이러한 '신의 손'이 더욱 필요하다. 그곳의 체스판은 바둑처럼 보이지 않았고, 우리에게 규칙을 건네주는 사람도 없었습니다. 그러한 통찰은 진정으로 추론하는 시스템에서만 나올 수 있습니다. 즉, 사실 이후에 만들어낸 설득력 있는 이야기가 아니라 일련의 감사 가능한 증거, 추론 및 신념 수정에서 도출된 결론입니다.

10년 전 알파고는 37번째 손을 사용해 기계가 인간의 직관을 뛰어넘을 수 있다는 사실을 세상에 알렸습니다.

10년 후, 제작자 중 한 명이 우리에게 다음과 같이 상기시켜 줍니다. 매끄러운 언어에 속지 마십시오. 이러한 진정한 도약은 지금까지 LLM에서 다시는 일어나지 않았습니다.

LLM이 추론할 수 없다고 하셨는데요,

견딜 수 있나요?

이 의견 기사가 게재된 후 X에 대해 상당한 논란이 일어났습니다.

가장 신랄한 질문은 토론토 대학의 David Duvenaud 교수(신경 ODE에 관한 NeurIPS 최고의 논문의 저자 중 한 명)에게서 나왔습니다. 그는 다음과 같이 언급했습니다. LLM에 대한 Graepel의 세 가지 혐의(확인 가능한 인지 상태 없음, 지식과 추론의 분리 없음, 사실 이후 설명 조작)는 인간에게도 동일하게 유효합니다. "이 기준에 따르면 나는 추론을 잘한다고 볼 수 있을까?"


Graepel은 다음과 같이 답변했습니다. 혼자서는 추론을 잘 할 수 없습니다. 종이와 펜을 주면 훨씬 더 좋을 것입니다. 그리고 과학적인 방법을 엄격하게 따르라는 요청을 받으면 당신은 훌륭한 추론자로 간주될 것입니다. 비결은 결코 의식의 흐름을 따르지 않고 과정을 구조화하는 것입니다. 그렇지 않으면 누구도 인지적 편견에서 벗어날 수 없습니다.


Duvenaud는 다음 문장의 의미를 즉시 파악했습니다. "LLM에 유사한 도구를 제공하는 한 귀하의 정의에 따라 실제 추론을 달성할 수 있는 것처럼 들립니다. 이것이 귀하가 의도한 것이 아닌가요?"


그래펠의 '종이와 연필 향상론'은 다른 네티즌들의 의구심을 불러일으키기도 했다. 네티즌 KingBroken은 종이와 펜은 본질적으로 작업 기억을 위한 플러그인이라고 지적했습니다. 동시에 더 많은 데이터에 대해 추론할 수 있지만 "무에서" 추론 능력의 존재를 바꾸지는 않습니다. 그러나 여기에는 추가적인 이점이 있습니다. 쓰여진 단어와 숫자는 인간의 "인지 상태"에 대한 확인 가능한 증거가 됩니다.


곧이어 네티즌 다니엘 그랜트는 좀 더 날카로운 질문을 던졌습니다. 이에 따르면 인간 추론 방법은 '기존 모델 + 플러그인 시스템'과 동일하므로 둘보다 더 강력한 내부 추론 능력을 갖춘 모델을 구축하는 것입니까? 아니면 약간의 뉘앙스를 놓치고 있는 걸까요?


Graepel은 아직 이러한 문의에 응답하지 않았습니다.

이런 논의가 불필요하다고 생각하는 목소리도 있었습니다. 네티즌 visimo-dino는 "아직도 이런 기사를 쓰는 사람들이 있다는 게 믿겨지지 않는다"고 직설적으로 말했습니다. LLM은 이미 너무 많은 일에서 좋은 성과를 거두었고, "추론할 수 없다"는 말은 우스꽝스럽거나 관련성이 없으며 유사한 기사가 수백 개가 게재되었습니다.


Graepel은 이에 대해 자세히 설명하지 않고 세 가지 질문만 던졌습니다. 검증할 수 없는 영역에서 신뢰할 수 있습니까? 그것은 강력하고 새로운 과학 이론을 만들어냈는가? 감히 그것이 당신의 의학적 치료를 좌우하도록 놔두시겠습니까? 상대방은 "아직은 아니다"라고 솔직하게 인정했지만, LLM 아키텍처 자체보다는 기존 강화학습 방식을 비난했다. 즉, 시간이 지나면 해결될 것이라는 의미다. 이것이 아마도 두 그룹의 실제 차이점일 것입니다. 한쪽은 부족한 것이 시간이라고 생각하고, 다른 쪽은 부족한 것이 구조라고 생각합니다.


또 다른 댓글에서는 많은 사람들이 어떻게 생각하는지 물었습니다. DeepMind가 이 연구를 지원하지 않는 이유는 무엇입니까? Graepel의 대답은 간단합니다. 최첨단 실험실은 확장에 투자하고 있으며 감사 가능한 추론은 확장만으로는 나올 수 없습니다. 다른 아키텍처가 필요합니다. "때로는 대규모 조직 내에서 급진적인 새로운 아이디어를 구현하기가 더 어렵습니다." 질문자 로버트 스페리(Robert Sperry)의 실망감은 뚜렷했습니다. 그는 모든 실험실 중에서 DeepMind가 Transformer 너머의 답을 찾기 위해 가장 열심히 노력할 것이라고 기대했습니다.


어떤 사람들은 좀 더 근본적인 부분을 지적하기도 했습니다. 캐서린 무어 평론가는 “언어 자체가 잘못된 도구이며, 그것으로는 확실한 추론을 할 수 없다”는 단 한 문장만 남겼다. Graepel은 이보다 급진적인 입장을 진지하게 받아들이고 공개적인 질문을 제기했습니다. 추론에는 일종의 지식 표현이 필요합니다. 자연어가 너무 모호하다면, 형식적 언어를 사용해 현실 세계를 추론할 수 있을까요? 그러한 언어는 어떤 모습일까요? . 그는 대답을 하지 않았지만, 이는 아마도 어떤 사람들이 사업을 시작할 때 대답할 질문일 것입니다.


관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음