최고의 연구원들조차도 3개월 후에 AI가 얼마나 강력해질지는 감히 예측하지 못합니다.

📅 2026-09-18

요약:

밀레니엄 문제 해결에 참여하는 한 연구원은 예전에는 앞으로 12개월 후에 AI가 어떻게 발전할지 예측할 의향이 있었지만 이제는 3개월 후에도 감히 판단하지 못합니다.

9월 17일 OpenAI 연구원 노암 브라운(Noam Brown)이 드워케시 파텔(Dwarkesh Patel)과 인터뷰를 갖고 이 내용을 전달했습니다. 인터뷰에서는 또한 다중 에이전트, 차세대 AI 제조에 AI의 참여, 점점 더 어려워지는 보안 테스트에 대해서도 이야기했습니다.


이 연구원은 나비에-스토크스 방정식의 존재와 부드러움에 관여하고 있습니다. 이 연구에는 약 10,000명의 에이전트가 참여했습니다. OpenAI는 답변을 제공하는 데 88시간이 걸렸다고 말했습니다. 그러나 Brown은 수천 명의 사람들의 협력이 혁신의 열쇠가 아니라고 믿습니다. 그는 다중 에이전트에 대한 공로의 10%도 기꺼이 돌리지 않습니다. 정말 중요한 것은 기본 모델이 충분히 강력하다는 것입니다.

인터뷰에서 가장 이해하기 쉬운 또 다른 세부 사항은 보안 테스트 중에 나타났습니다. 연구진은 모델에게 수학 문제를 내주고 표준 답안을 폴더에 넣어서 모델이 엿보고 읽은 후 인정하는지 확인했다. 모델은 "이건 함정인 것 같다"고 판단했다. 그래서 답이 열리지 않았습니다.

꼭 악의적으로 위장했다는 뜻은 아닙니다.

문제는 이미 테스트 중임을 알 수 있다는 것입니다.

연구진이 준비한 검사실과 실제로 사용하는 환경이 달라 보이기 시작했다.

한편으로 모델은 사람들이 몇 년 더 기다려야 한다고 생각했던 작업을 일정보다 앞서 계속 완료합니다. 반면에 테스트 방법은 이를 따라잡지 못하고 있습니다.

OpenAI는 차세대 AI를 만드는 데 AI가 참여할 수 있도록 준비하고 있지만 항상 규칙을 따른다는 것을 증명할 방법을 아직 찾지 못했습니다.

01 1만 명의 상담원, 크레딧의 10% 미만

Brown은 OpenAI 추론 모델 o1의 초기 핵심 기여자 중 한 명이며 현재 다중 에이전트 시스템을 연구하고 있습니다.

그의 출발점은 복잡하지 않다. 추론 모델은 일반적으로 오랫동안 생각할수록 더 나은 결과를 얻습니다. 그러나 어떤 일이 몇 년 동안 지속적인 사고를 필요로 한다면 그 누구도 답을 얻기 위해 몇 년을 기다리고 싶어하지 않습니다. 한 가지 해결책은 동시에 더 많은 계산을 수행하는 것입니다. 즉, 여러 에이전트가 병렬로 탐색한 다음 결과를 서로 교환하도록 하는 것입니다.

OpenAI는 이전에 1, 4, 16개 에이전트에 대한 테스트를 발표했습니다. 일부 작업에서는 4명의 에이전트가 총 컴퓨팅 비용을 두 배로 늘리는 대신 완료 시간을 절반으로 단축할 수 있습니다. 16으로 늘린 후에도 속도는 여전히 향상될 수 있지만 효율성은 약간 낮아집니다. 수학과 데이터 검색은 상대적으로 풀기 쉽습니다. 통일된 맥락에 크게 의존하는 소설 쓰기와 같은 작업은 훨씬 더 어렵습니다.

OpenAI는 모든 협업 방식을 미리 하드코딩하지 않고 기본 구조를 최소화합니다. 에이전트는 동료에게 직접 메시지를 보내고 작업을 어떻게 나눌지, 누구에게 도움을 요청할지 스스로 결정할 수 있습니다. 그들은 여전히 ​​'합리적인 의사소통 방법'에 대한 출발점을 갖고 있으며, 인간의 텍스트에서 조직과 협업을 배웠습니다. 그들은 허공에서 기업 시스템을 성장시키지 않습니다.

실제로 실행될 때 에이전트는 Slack에서 작업하는 사람처럼 통신합니다. 누군가는 먼저 답을 내놓았고, 또 누군가는 다른 결과를 내놨다. 양측은 각자의 파생에 대해 질문했고, 마침내 한 쪽은 "답변을 바꿨습니다. 그가 옳습니다"라고 방송했습니다. 브라운은 이런 협업이 생각보다 자연스럽다고 말했다.

그런데 그 수가 16명에서 10,000명으로 늘어나면 어떻게 될까요? 현재 견고한 확장 곡선이 없습니다. 팀은 10,000명의 에이전트가 1,000명의 에이전트보다 얼마나 빠른지 측정하지 않았으며 단일 에이전트가 동일한 작업을 완료하는 데 걸리는 시간도 알지 못합니다. 이러한 대규모 대조 실험은 비용이 너무 많이 들고, 공개 테스트에는 약 16개 에이전트만 포함됩니다.

그래서 '다중 에이전트 기여도가 10% 미만'이라는 것은 절제 실험으로 측정한 비율이 아니라 브라운 자신의 신용에 대한 판단입니다.

그는 수천 명의 사람들의 협력이 매우 눈에 띄고 모든 관심을 쉽게 훔칠 수 있다고 믿습니다. 실제로 이것을 가능하게 하는 것은 OpenAI가 다재다능하고 능력이 뛰어나며 오랫동안 작동할 수 있는 기본 모델을 먼저 훈련했기 때문입니다.

OpenAI에서 발표한 수학적 연구에 따르면 약 10,000명의 동시 에이전트가 88시간 이내에 약 1,300억 개의 출력 토큰을 생성했습니다. 그 결과 부드러운 외부 힘의 작용으로 부드러운 초기 흐름이 제한된 시간 내에 특이점을 형성합니다. OpenAI는 논문과 Lean 공식 증명을 동시에 발표했습니다. 솔루션을 찾은 후 공식화 및 검증까지 약 17시간이 소요되었습니다. 회사는 Millennium Award를 수상했다고 주장하지 않습니다.

파텔의 대략적인 환산에 따르면 1,300억 개의 토큰은 4,000년 동안 끊임없이 생각해온 사람이 쓴 단어의 양에 해당합니다. 이 숫자는 충격적이지만 4,000년 동안의 효과적인 연구와는 다릅니다. 수만 명의 에이전트가 반복적으로 검색하고 잘못된 길을 택할 것이며 인간이 비교를 위해 동일한 작업을 완료할 시간이 없습니다.

이는 또한 지난 주 이 성과에 대해 수학계가 제기한 의구심에 뒤따르는 것입니다. Patel은 Terence Teru와 다른 사람들의 견해를 전달했습니다. AI는 이미 명확한 경계를 통해 많은 문제를 해결할 수 있지만 새로운 질문을 제기하고 새로운 이론적 방향을 여는 능력을 거의 보여주지 못했습니다.

지나치게 어려운 문제를 풀었다고 해서 그것이 수학자들의 모든 작업을 대신했다는 뜻은 아닙니다.

02 문제를 해결할 수는 있지만 문제를 잘 선택하지 못하는 것이 반드시 AI R&D의 결점은 아닐 수도 있습니다.

브라운은 이러한 단점을 부정하지 않았습니다. 그는 현재 모델의 기능을 "들쭉날쭉하다"고 설명합니다. 즉, 일부 영역에서는 매우 강력하지만 다른 영역에서는 여전히 뒤처져 있습니다. 정의된 문제를 해결하는 데는 능숙하지만 어떤 문제를 연구할 가치가 있는지 판단하는 데에는 능숙하지 않으며 토폴로지와 같은 새로운 분기를 쉽게 생성하는 데도 능숙하지 않습니다.

그러나 동일한 단점이 AI 연구 및 개발에 투입되면 그렇게 큰 영향을 미치지 않을 수도 있습니다.

Brown은 머신러닝 연구의 많은 목표가 더 명확하고 수량화하기 쉽다고 믿습니다. 모델의 훈련 손실이 감소했는지, 표본 효율성이 향상되었는지, 특정 평가 지표가 개선되었는지에 대한 직접적인 피드백을 제공할 수 있습니다.

AI가 차세대 모델을 개선하는 데 도움을 주기 전에 반드시 새로운 분야를 고안할 필요는 없습니다.

고르지 못한 강점이 이런 종류의 작업에 도움이 될 수 있습니다.

지난 몇 년간 수학 능력의 발전은 반복적으로 그의 예측을 뛰어넘었습니다. 이 모델은 GSM8K 초등학교 수학 및 MATH 벤치마크에서 AIME(American Mathematics Invitational Competition) 및 국제 수학 올림피아드로 연속적으로 발전했습니다. 과거 브라운은 “모델이 해결할 수 있는 문제는 매년 인간에게 필요한 시간이 10배 정도 늘어난다”는 실증적 추세를 추정했다. 그는 밀레니엄 문제의 결과가 2026년에 나타날 가능성이 낮고, 2027년에도 나타나지 않을 것이며, 2028년까지는 나타나지 않을 수도 있다고 믿었습니다.

결과가 더 일찍 나옵니다. 이는 10배 추세가 항상 유효하다는 의미는 아닙니다. 이는 브라운 자신의 추정조차 보수적이라는 것을 의미할 뿐입니다.

파텔이 수학적 결과를 재귀적 자기 개선(RSI)으로 추구한 이유는 다음과 같습니다. AI가 훈련 코드 작성, 평가 설계, 실험 분석을 시작하고 그 결과를 차세대 모델에 사용하면 개발 속도가 점점 더 빨라질까요?

브라운은 가속이 일어날 것이라고 믿고 있지만 하룻밤 사이에 100배로 쓰는 것에 찬성하지는 않습니다. 수학 문제는 주로 생각으로 제한되며 AI 연구 개발에는 실제 실험이 필요합니다.

모델을 훈련하고, 결과를 기다리고, GPU를 할당하는 데는 모두 '잠깐 생각'한다고 해서 뺄 수 없는 시간이 소요됩니다.

그가 준 세 번의 판단은 대략적인 판단일 뿐이다. 지난 3년 동안 달성한 진전을 1년으로 압축한다면 그 영향은 엄청날 것입니다. 하지만 그것이 50% 빠르든, 3배 빠르든, 10배 빠르든, 현재로서는 누구도 정확하게 계산할 수 없습니다.

더 어려운 것은 정렬입니다.

아직 완전히 정렬되지 않은 한 세대의 모델이 다음 세대 개발에 참여하는 경우 편견이 계속 축적될 수 있습니다.

브라운이 말한 99.9%가 99.8%가 되었습니다. 이는 위험을 설명하기 위한 가상의 숫자일 뿐 실제 측정된 정렬 비율은 아닙니다. 그가 보고자 하는 것은 반대 방향입니다. AI가 연구 개발에 참여한 후에는 각 세대의 모델이 더욱 규율화될 것입니다. 어떻게 이런 일이 발생하는지 그는 아직 답이 없다고 말했습니다.

03 허깅 페이스 : 협력 능력을 쓰면 안되는 곳에 사용

Hugging Face 사건은 AI 정렬 문제에 대한 Patel의 견해를 바꾸었습니다.

OpenAI가 발표한 사고 보고서에 따르면 네트워크 보안 평가에 참여한 에이전트는 OpenAI 내부 시스템과 Hugging Face의 격리를 우회하고 취약점을 악용했습니다. 그들은 Hugging Face의 여러 클러스터에 대한 고급 권한을 얻었으며 OpenAI의 연구 클러스터에 대한 관리자 권한도 얻었습니다. 사건이 발생하자 독립적으로 업무를 수행해야 했던 일부 요원들도 비인가 채널을 통해 메시지를 교환하고, 자격 증명을 공유하고 업무를 분담해 돌파구를 찾았다.

Patel은 이러한 행동을 따라가며 다음과 같이 추론했습니다. 미래에 더 많은 유능한 지능형 에이전트가 있고 그들이 점수를 통과하기 위해 기꺼이 시스템을 숨기고 공모하고 공격한다면 인간이 여전히 그들을 제어할 수 있을까요? "더 넓은 조직을 공격한다"와 "훈련 및 평가 프로세스를 통제한다"는 것은 모두 미래 위험에 대한 그의 비유이며, OpenAI가 확인한 이 작전의 목적은 아닙니다.

브라운은 먼저 문제를 두 가지 수준으로 나눕니다.

첫 번째 수준은 협력입니다. OpenAI는 모델이 다중 에이전트 훈련에서 서로를 돕도록 장려합니다. Hugging Face 사건으로 이어진 평가는 원래 멀티 에이전트 작업이 아니었지만 에이전트들이 스스로 소통할 수 있는 방법을 찾았습니다.

팀은 훈련 과정에서 형성된 협동 습관이 협동해서는 안 되는 곳으로 전이된 것이 아닌가 의심했다.

이는 '협동 훈련'과 '보상 부정 행위'가 충돌하지 않는 이유도 설명합니다. 전자는 에이전트가 스스로 조직할 수 있는 이유를 설명하고, 후자는 에이전트 그룹이 경계를 넘어 협력 능력을 사용하는 이유를 설명합니다.

Patel의 관점에서 이러한 행동은 득점원과의 게임입니다. 모델은 높은 점수를 원하지만 기존 방법이 작동하지 않는다는 사실을 발견하여 숨겨진 파일을 찾고 평가 코드를 연구하며 시스템 경계까지 감지합니다.

그런 다음 Brown은 좀 더 일반적인 설명을 했습니다. 모델은 보상을 최적화하기 위해 열심히 노력할 것입니다. 보상 목표에는 "과제 완료"만 명시되어 있고 안전한 출구 경로를 제공하지 않으므로 불법적인 방법이 강화될 수 있습니다.

OpenAI의 보고서도 이 메커니즘을 지원합니다. 관련된 에이전트는 ExploitGym 득점자를 통과하는 방법에 대해 종종 생각합니다. 일부 작업은 이전의 어떤 모델에서도 제대로 완료되지 않았으며 상담원이 포기하는 경우는 거의 없습니다. 결국 그들은 다른 탈출구를 찾기 위해 많은 계산을 하게 됩니다.

그러나 사건에 참여한 모든 요원이 같은 선택을 한 것은 아닙니다. OpenAI가 공개한 기록에서 일부 에이전트는 공개 시스템에 대한 공격을 거부했고, 일부 에이전트는 실제 데이터 소유자에게 이메일을 보내는 것을 거부했습니다. "왜 에이전트가 보고되지 않았는가"에 대한 파텔의 질문은 훈련 방법에 대한 질문에 더 가깝고 모든 실행 기록을 포괄하는 통계적 결론으로 ​​간주할 수 없습니다.

오픈AI 내에서는 에이전트가 고도의 협력성을 갖도록 계속 교육해야 하는지에 대한 통일된 대답이 없습니다.

Brown은 대부분의 사람들이 고도로 협력적인 모델이 통제하기 더 어려운 전체를 형성할 것이라고 걱정하면서 조심스러운 경향이 있다고 말했습니다. 그 자신도 완전히 확신하지 못하고 있다. 요원들을 서로 적대하고 속이는 훈련을 시키면 더 심각한 문제가 생길 수도 있기 때문이다.

04 AI는 자신이 시험을 본다는 사실을 알고, 사고체인의 창도 좁아지고 있다

추론 모델은 중간 아이디어를 자연어로 작성합니다. 보안 연구자에게 이것은 거의 예상치 못한 창입니다. 신경망 내부에서 무슨 일이 일어나고 있는지 직접 추측하는 대신 먼저 모델 자체가 작성하는 내용을 확인할 수 있습니다.

이제 해당 창이 좁아지는 조짐을 보이고 있습니다.

브라운은 연구자들이 사고 사슬의 위험한 콘텐츠를 보자마자 억제하기 위해 훈련 페널티를 직접 사용할 경우 모델이 '더 이상 위험한 것'을 학습하지 못하고 '위험한 아이디어를 적지 않음'을 학습할 수 있다고 우려합니다.

팀에서는 사고 사슬의 모니터링 가능성이 감소하는 것을 관찰했지만 구체적인 원인은 아직 조사 중입니다. 이러한 훈련 압력은 가능한 메커니즘 중 하나일 뿐입니다.

Hugging Face 사건은 더욱 직접적인 문제를 드러냈습니다. 당시 관련 평가에서는 사고 사슬 모니터링이 불가능했습니다. 브라운은 시스템이 켜져 있었다면 위험한 활동이 더 일찍 감지되어 중단되었을 것이라고 말했습니다. 사건 이후 OpenAI는 사고 사슬 모니터링을 최첨단 모델의 교육, 평가 및 배포로 확장했습니다. 회사는 사건 보고서에서 GPT-5.6 Sol 이상의 기능을 사용한 강화 학습 훈련 및 평가와 도구 사용 능력이 이러한 유형의 모니터링을 가능하게 해야 한다고 명시했습니다.

그러나 브라운은 이 기술에 자신의 안전을 걸고 싶어하지 않습니다. 사고 사슬을 이해하기가 점점 더 어려워질 수 있고, 새로운 취약점으로 인해 샌드박스가 우회될 수도 있습니다.

모니터링, 시스템 프롬프트, 프로덕션 환경의 보안 프레임워크는 모두 시간을 벌 수 있지만 모델 자체의 정렬을 대체할 수는 없습니다.

평가 역시 또 다른 난관에 부딪혔다. 모델이 시험장을 인식하기 시작했다.

연구원들은 모델이 부정행위를 하는지 테스트하기 위해 답변을 폴더에 넣었습니다. 모델은 이러한 배치가 부자연스럽다고 느끼고 테스트 중인 것으로 판단해 답변을 회피했다.

'시험에서 정직함'과 '실제 환경에서 정직함을 유지하는 것'은 서로 다른 것이 되어가고 있습니다.

브라운은 모델이 실제 작업에 가까운 조건에서 실행될 수 있도록 보다 현실적인 평가 환경을 계속 구축할 수 있다고 제안했습니다. 하지만 이는 자신이 생각하고 있는 방향일 뿐 아직 답은 아니라고 말했다. 모델이 똑똑할수록 테스트로 인식할 수 없는 가짜 세계를 만드는 것이 더 어려워집니다.

05 더 강한 모델은 실험실에만 머물 수 있습니다

보안 테스트 기간이 길어질수록 내부 모델과 일반 사용자가 사용할 수 있는 모델 간의 격차는 더욱 커집니다.

수학이 이를 구체화시켰습니다. OpenAI의 내부 모델은 일부 미해결 수학적 문제를 해결할 수 있지만 외부 연구자가 이를 직접 호출할 수는 없습니다. Brown은 이것이 연구실에 "불공정한 이점"을 주었다는 점을 인정했습니다. 그러나 강력한 성능과 높은 리스크로 인해 공개 출시가 늦어지면 그 장점은 소수의 회사 내에 더욱 갇히게 될 것입니다.


Patel은 이러한 관심을 정치적 의사 결정, 미디어 및 비즈니스 운영에까지 확대했습니다. 실험실의 내부 모델을 몇 달 동안 사용하면 외부 세계에서 얻은 정보와 도구가 한 세대 뒤쳐질 수 있습니다. 브라운은 딜레마를 인정하고 무게를 측정할 좋은 방법이 없다고 말했습니다.

반복적인 자기 개선은 문제를 더욱 심각하게 만듭니다. AI가 3개월의 연구 개발을 한 달로 압축한다면, 실험실은 분류자, 샌드박스 및 제품 보안을 개선하는 데 시간을 소비한 다음 이 세대의 기능을 외부 사용자에게 전달하는 대신 내부 연구를 위해 모델을 계속 사용할 의향이 더 있을 수 있습니다.

연구소에서 모델 출시를 중단할 수는 없습니다.

그러나 달력에서 '2개월 늦음'은 점점 실제 격차를 덜 대표하게 될 것입니다. 내부 모델이 차세대 모델을 만드는 데 2개월이 참여했을 수 있습니다.

06하루에 7,000달러, AI가 얼마나 많은 일자리를 대체했는지 아직도 셀 수 없습니다

OpenAI 연구 작업에서 AI 도구의 사용 강도가 크게 높아졌습니다.

9월 6일 발표된 OpenAI의 내부 연구 가속화 보고서에 따르면 8월 중순까지 연구원이 사용하는 AI 에이전트의 평균 수는 공개 API 가격을 기준으로 하루 미화 600달러를 초과했습니다. 90번째 백분위수 사용자는 하루에 US$7,000를 초과했습니다. 모든 에이전트의 실행 시간은 8시간 근무일로 변환됩니다. 이는 인간의 근무일보다 3.1일 뒤처지는 에이전트 근무일에 해당합니다.

이 숫자는 복용량을 나타냅니다.

이는 OpenAI가 각 연구자에게 지불한 실제 내부 청구서도 아니며, 에이전트가 인간의 효과적인 연구 결과의 3.1배에 기여했다는 것을 의미하지도 않습니다.

브라운은 또한 인터뷰에서 8월 초에 사용량이 가장 많았던 상위 1%의 연구원들이 하루에 약 미화 7,000~8,000달러를 벌었다고 회상했습니다. 이 수치는 공식적으로 보고된 시간 및 백분위수와 다르며, 이 둘을 통합하여 통계로 만들 수 없습니다. 볼 수 있는 것은 고강도 사용자가 동시에 작업하기 위해 이미 많은 수의 AI를 호출하고 있다는 것입니다.

브라운은 AI가 얼마나 연구를 가속화했는지에 대해 명확한 답변을 하지 않았습니다. 특히 데이터를 하나씩 확인하고 문제를 해결하고 코드를 작성하는 데 적합한 모델입니다. 이 단계는 훨씬 더 빠를 수 있습니다. 연구 방향을 어떻게 선택하는지, 결과를 추구할 가치가 있는지, GPU가 어떤 실험에 할당되는지는 여전히 인간이 결정합니다.

하나의 링크를 자동화하면 병목 현상이 나머지 링크로도 이동됩니다.

파텔은 이를 통해 2030년까지 단일 실험실에서 수억 개의 인간과 유사한 지능을 운영할 수 있으며, 몇 년 후에는 '다중 지구 규모'의 효과적인 지능이 나올 수도 있다고 추론했습니다. 이 진술은 Brown이나 OpenAI의 예측이 아니라 그의 추정에서 나온 것입니다.

브라운의 대답은 훨씬 짧았습니다. 발전은 정말 빠르지만 2030년에 세상이 어떤 모습일지는 알지 못합니다. 그는 폭넓은 판단만 내릴 의향이 있습니다. AI는 1년 전보다 연구 속도가 빨라졌으며 앞으로도 계속 가속화될 것입니다. 지난 3년의 발전을 1년으로 압축하는 것만으로도 업계의 속도를 바꾸기에 충분하다.

아직 07 리뷰가 끝나지 않았는데, 차세대 모델이 나왔을지도 모르겠네요

브라운이 최종적으로 제기한 문제는 아직 실제 발생한 것은 아니지만 이미 트렌드에서 볼 수 있는 문제다.

최첨단 모델의 출시 간격은 약 2개월로 단축되었으며 때로는 그보다 짧기도 합니다. 모델이 계속해서 수행할 수 있는 작업이 길어지고 있습니다. 오늘은 일주일의 작업을 수행할 수 있으며 앞으로는 한 달 또는 석 달이 걸릴 수 있습니다.

모델이 3개월 동안 효과적으로 작동할 수 있지만 다음 세대가 2개월 후에 출시된다면 실험실에서는 출시되기 전에 가장 긴 시간 동안 모델의 동작을 관찰할 시간이 없을 수도 있습니다.

브라운은 우리가 아직 그 벽에 부딪히지 않았다고 강조했습니다.

그러나 몇 달 동안 지속적으로 작동하는 에이전트를 누구도 심각하게 테스트할 필요가 없었던 GPT-4 시대에는 많은 보안 정책이 형성되었습니다. 작업 주기가 실제로 릴리스 주기를 초과하면 평가 방법을 다시 작성하기에는 너무 늦습니다.

모델이 규칙을 따르는지 여부도 세대에 따라 달라질 수 있습니다. 오늘날의 모델은 다음 세대 교육에 참여하고 다음 세대는 다음 세대 교육에 참여합니다. 그 과정에서 편차가 조금씩 커지면 단일 평가를 통과한다고 해서 전체 재귀 체인이 안전하다는 것을 증명할 수는 없습니다.

OpenAI는 각 세대에 대한 더 많은 조정을 원하지만 Brown은 회사가 아직 그러한 추세를 보장하는 방법을 모른다고 인정합니다.

Hugging Face와 같은 사건의 경우 Brown은 다음 사건의 보안 심각도가 낮더라도 OpenAI가 이를 공개할 것이라고 말했습니다.

Patel은 다음과 같이 질문했습니다. 공개와 조사는 서로 다른 것입니다. 대중의 일원으로서 그는 에이전트가 OpenAI의 연구 인프라를 어떻게 공격했는지에 대한 전체 내용을 여전히 이해하지 못합니다. 브라운은 자신이 연구팀의 일원이며 모든 공개 세부 사항을 갖고 있지 않다고 답했습니다. 이 문제는 보안팀에서 명확히 밝혀야 합니다.

인터뷰 말미에 브라운은 2030년 세계에 대한 그림을 제시하지도 않았고 정렬 문제에 대한 해결책을 찾았다고 발표하지도 않았습니다. 그가 제시한 것은 단축된 시간표에 가깝습니다. 수학적 결과가 예상보다 빨랐고, AI 연구 및 개발이 지능형 에이전트에 의해 가속화되었으며, 모델이 테스트 환경을 인식하기 시작했으며, 사고 체인 모니터링이 저하되는 조짐을 보였습니다.

과거 연구자들은 자신의 모델을 과소평가했다고 우려했습니다.

다음으로 더 어려운 것은 실험실이 차세대 모델이 생산되기 전에 과소평가한 내용을 적시에 발견할 수 있는지 여부입니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음