요약:
지난 몇 달 동안 OpenAI와 Anthropic이 차례로 주력 모델을 추진했지만 Google은 유난히 조용해 보였습니다. 플래시는 거의 3주에 한 번씩 업데이트되며 3.6, 3.7, 3.8은 계속해서 발전하고 있지만, 최고 성능 한계를 나타내는 Pro의 경우 아무런 움직임이 없습니다. 이 이틀 전까지 대형 모델 블라인드 테스트 아레나 아레나에는 gemini-3.8-flash라는 이름의 모델이 갑자기 등장했습니다.

개발자는 시작하자마자 뭔가 잘못되었다는 것을 알아차렸습니다. 실제 Gemini 3.8 플래시가 출시되었습니다. 어느 정도 수준이어야 하는지는 누구나 알고 있습니다. 하지만 이번 "3.8 Flash"를 통해 코드 작성, SVG 작성, Agent 실행 성능이 확실히 한 단계 향상되었습니다.


몇 차례의 실제 테스트를 거친 후 추측이 빠르게 퍼졌습니다.
이 모델은 라벨 뒤에 숨겨진 Google의 차세대 플래그십인 Gemini 4 Pro가 될 가능성이 높습니다.
곧이어 더욱 과장된 벤치마크 비교 사진이 입소문을 타기 시작했습니다. 코딩, 에이전트, 추론, 여러 점수로 GPT-6 Astra 및 Claude Fable이 아래에 순위를 매겼습니다.

불과 며칠 전, 가장 중요한 AI 회사 중 몇몇은 이제 속도를 늦춰야 할 시점인지 공개적으로 논의했습니다. 이제 감속의 소리는 아직 땅에 닿지 않았고, 새로운 경쟁이 시작되었습니다.
Gemini 4 Pro의 "신 수준의 모델"로 의심되는 이 뒤에는 더 위험한 키워드가 있습니다.
RSI.

Gemini 4 Pro 유출 의심
9월 2일 Google은 Gemini 3.8 Flash를 공식 출시했습니다. 관계자에 따르면 이는 소프트웨어 엔지니어링, 에이전트 작업 및 복잡한 다단계 추론을 크게 개선한 Gemini 3 시리즈의 최신 세대 Flash입니다. 3.7플래시에서 3.8플래시로 바뀌는데 불과 3주가 지났습니다.
그래서 같은 이름의 gemini-3.8-flash가 Arena에 등장했을 때 개발자들은 이상 현상을 빠르게 알아차렸습니다.
실제 3.8 Flash는 이미 출시되어 있으며 누구나 참조할 수 있습니다. 그리고 이 모델은 확실히 더 강해 보이는데, 이는 Pro 모델에서만 볼 수 있는 강점임이 분명합니다.

SVG, 웹페이지, 3D 장면을 중심으로 전파를 촉발한 첫 번째 실제 테스트 배치입니다.
개발자 Harshith는 그에게 SVG를 사용하여 옆으로 향한 집고양이를 그려달라고 부탁했고, 그 결과를 GPT-6 Astra Max와 Gemini 3.8 Flash 공식 버전과 합쳤습니다. Arena의 이 버전은 개요, 비율 및 세부 사항의 완성도 측면에서 공식 3.8 Flash와 눈에 띄는 차이가 있습니다.

왼쪽부터: "4 Pro", Astra, 3.8 Flash
X 네티즌 @thtbee_는 Gemini 4 Pro로 의심되는 모델을 여러 각도에서 지속적으로 테스트했습니다.
Voxel 스타일의 탑인 이 모델은 8분 동안 실행되었으며 전체 대화형 3D 장면 세트를 직접 생성했습니다.


Airbus H145 헬리콥터에서 매우 상세한 완전한 3D 디스플레이 페이지를 구축하는 데 약 10분 밖에 걸리지 않았습니다. 하지만 이 네티즌은 페이지 하단의 UI 요소가 "조금 나빠 보인다"고 말했다.


웹 디자인 측면에서는 모델이 흑백 테마 웹사이트를 만드는 데 약 14분 정도 걸렸는데, 전체적으로 매우 깔끔하고 완성도가 높았습니다. 과거 제미니가 자주 불만을 제기했던 디자인 취향 문제가 이번에 드디어 해결된 것 같습니다.


또 다른 네티즌 @Mr_Salio가 Gemini 4 Pro로 의심되는 모델을 직접 사용하여 게임을 만들었습니다. 완성된 그래픽은 충분히 매끄럽고, 월드 생성과 게임 디자인도 매우 완성도가 높습니다.


더 중요한 단서는 개발자 Qwinah에게서 나왔습니다.
그는 Gemini 4 Pro의 백엔드로 '고스트 라우팅'에 성공했다고 주장하고 내부 터미널 정보로 의심되는 스크린샷을 게시했습니다.
그에 따르면 G4P-ARGON과 VIA_3.8_FLASH가 이 모델의 내부 로고에 직접적으로 등장한다고 합니다. 최대 출력은 256K에 달하고 컨텍스트 창은 1천만 개 토큰을 초과하며 교차 세션 영구 메모리, API 없는 네트워킹, 백엔드 자동 컴파일 및 스크립트 실행, 물리적 로봇 제어 기능까지 갖추고 있습니다.

이 정보가 사실이라면 이는 분명히 더 이상 일반적인 플래시 업그레이드가 아닙니다.
동시에 Gemini 4 Pro 벤치마크 비교표도 커뮤니티에 퍼지기 시작했습니다.

사진 속 데이터에 따르면 Gemini 4 Pro는 DeepSWE v1.1 소프트웨어 엔지니어링 테스트에서 88.7%, 터미널 에이전트에 대한 Terminal-Bench 2.1 테스트에서 95.3%, 전문가 수준 지식 추론 테스트 HLE-Verified에서 72.1%, 컴퓨터 운영 에이전트 테스트 OSWorld 2.0에서 86.8%를 기록했습니다.
더 과장된 점은 실제 지식 작업을 측정하는 GDPval-AA v2에서는 2064 Elo로 기록되어 2000선을 직접 돌파한다는 것입니다.
이 데이터가 사실이라면 Gemini 4 Pro는 간단히 "Fable을 치고 Astra를 걷어차는" 최첨단 모델의 정상에 단번에 우뚝 설 수 있습니다.
그러나 과장될수록 더욱 주의가 필요합니다.
이 벤치마크 테이블이 Qwinah가 '파고'한 것으로 의심되는 백엔드 스크린샷과 완전히 일치하지 않는다는 점은 주목할 가치가 있습니다. 벤치마크 테이블에서 비교 항목으로 사용된 아스트라의 점수가 공식 데이터와 일치하지 않습니다. 두 자료 모두 Google, Arena 또는 관련 벤치마크에서 공식적으로 보증하지 않으며 여전히 커뮤니티에서 유포되는 정보일 뿐입니다.
확인할 수 있는 유일한 모델은 gemini-3.8-flash라는 이름의 모델인데, 이는 Gemini 3.8 Flash의 성능과 전혀 일치하지 않습니다.
그러나 모든 사람들이 빠르게 Gemini 4 Pro를 꼽는 또 다른 매우 중요한 이유가 있습니다. Google의 Pro 모델이 너무 오랫동안 비어 있었습니다.
Gemini 3.5 Pro는 아직 공식적으로 출시되지 않았으며 Gemini 4는 이미 훈련에 들어가는 것으로 확인되었습니다. 지난 몇 달 동안 Flash는 세대를 거쳐 발전해 왔으며 Pro 라인에는 실제로 기능의 상한선을 나타내는 새로운 모델이 없었습니다.
이제 명백히 비정상적인 능력을 지닌 '3.8 플래시'가 갑자기 아레나에 등장했다.
결과적으로 추측은 자연스럽게 점점 더 합리적이 되고 있습니다. Google은 실제 대규모 업그레이드를 3.5 Pro로 그대로 두지 않고 Gemini 4 Pro로 직접 이동할 의도가 있을 수 있습니다.

Gemini 4 Pro의 뒷모습
더 큰 키워드는 RSI입니다
Gemini 4 Pro가 여전히 커뮤니티 루머에 불과하다면, 더욱 주목할 점은
Google이 모델 개발에 AI 참여 속도를 대폭 가속화하고 있다는 것입니다.
이번 Gemini 4 Pro 루머에는 RSI라는 키워드가 반복적으로 언급되었습니다.


RSI는 Recursive Self-Improvement의 약어로, 반복적인 자기 개선을 의미합니다. 간단히 말해서, AI가 더 강한 AI를 만드는 데 참여하기 시작하고, 더 강한 AI가 차세대 모델 개발을 더욱 가속화합니다.
이 주기가 실행되면 가속되는 것은 모델 능력 자체만이 아닙니다.
모델 진화 속도도 모델 자체에 의해 가속화되기 시작할 것입니다.
올해 8월 Reuters는 Google 공동 창업자인 Sergey Brin이 최근 몇 달 동안 Gemini의 속도를 높이도록 추진해 왔으며 반복적인 자기 개선을 핵심 방향 중 하나로 꼽았다고 밝혔습니다.
Google은 이 폐쇄 루프를 달성했다고 공개적으로 발표하지는 않았지만, 모델 평가, 개선 방향 찾기, 실험 실행, 결과를 모델 개발 프로세스에 다시 피드백하는 등 원래 연구자의 몫이었던 점점 더 많은 작업을 에이전트에 넘겨주고 있습니다.
Gemini 3.8 Flash가 9월 2일 출시되었을 때 Google은 공식 설명에서 장기 실행 에이전트 루프가 "기본 모델을 재귀적으로 평가하고 개선"하고 있다고 언급했습니다.

Google DeepMind 연구원 Yao Shunyu(Tencent의 Yao Shunyu 아님)는 암스트롱이 달에 착륙했을 때 3.8 Flash 출시 후 이 업데이트를 설명하기 위해 했던 말을 사용했습니다.
"모델에게는 작은 발걸음이지만 RSI에게는 거대한 발걸음입니다."

최근 Google에서는 새 논문 제목에 'RSI'도 포함했습니다.
9월 14일, Google, GDM 및 기타 팀은 탐색 전략의 지속적인 개선을 통해 에이전트가 반복적인 자기 개선을 달성할 수 있는 방법을 구체적으로 연구하는 Dream-RSI를 출시했습니다. 알고리즘 엔지니어링, 수학적 최적화 및 GPU 커널 작업에서 이 방법은 더 높은 탐색 효율성과 더 낮은 탐색 비용을 보여줍니다.
Gemini 4 Pro에 대한 소문이 RSI와 빠르게 연결되는 것은 바로 이 때문입니다.
커뮤니티 내 추측은 '제미니 4 프로는 매우 강력하다'에 그치지 않고, 구글이 내부적으로 RSI를 어느 정도 달성했는지 묻는다.
분명히 Google만이 RSI의 길을 걷는 유일한 회사는 아닙니다.
미국 시간으로 9월 17일, Anthropic은 내부 AI R&D 자동화 데이터 세트를 공개했습니다.
인류학 관계자들은 이러한 지표를 공개한 이유는 최첨단 실험실의 AI 연구개발이 AI 자체에 의해 얼마나 완성되기 시작했는지 외부 세계가 알아야 한다고 믿기 때문이라고 밝혔습니다.

데이터에 따르면 올해 8월 현재 Claude는 인류 AI 연구 및 개발 작업의 26%를 주도할 수 있었습니다. 즉, 인간은 높은 수준의 목표를 제시하고 감독하기만 하면 되며 Claude는 기본적으로 작업을 처음부터 끝까지 완료할 수 있습니다. 올해 2월과 3월에는 이 비율이 1%에도 미치지 못했다.
동시에 Anthropic 내 AI R&D 업무의 90% 이상이 적어도 AI 협업 단계에 진입했습니다.
중국에서는 Zhipu의 창립자이자 수석 과학자인 Tang Jie도 최근 다음과 같이 말했습니다. "우리는 아직 재귀적인 자기 개선에 도달하기에는 멀지만 모델 최적화 시스템, 시스템 서비스 모델이라는 가장 작은 주기가 나타났습니다."

X에 대한 Tang Jie의 긴 글, 시작 부분만 잘림
Zhipu가 공개한 엔지니어링 사례에서는 GLM-5.3으로 구동되는 인프라 에이전트가 GLM-5.3-Flash 추론 인프라의 설계, 디버깅 및 최적화에 참여했습니다. 이 시스템은 10만 개 이상의 국내 AI 칩 클러스터에서 실행됩니다. 첫 번째 실행부터 모든 프로덕션 트래픽을 인계받기까지 단 2주가 걸렸으며, 엔드투엔드 처리량이 초기 수준의 3.2배로 증가했습니다.

'천천히'하면 결국 경고만 남습니다
불과 며칠 전, Amodei는 최첨단 AI 기업들에게 '속도 저하'에 동참할 것을 촉구했습니다.
그가 주의해야 할 첫 번째 조건은 RSI였습니다.
모델의 발전 자체는 물론 좋은 것이지만, 문제는 AI가 차세대 AI 제작에 참여하기 시작하면 모델의 발전 속도는 점점 빨라질 수 있지만, 인간이 이를 이해하고 평가하고 제어하는 속도는 동시에 가속되지 않을 수도 있다는 점이다.
그래서 Amodei는 기능이 특정 임계값을 초과하기 전에 제3자 평가, 공통 안전 표준 및 감속 메커니즘을 미리 확립해야 한다고 반복해서 강조해 왔습니다.
RSI가 실제로 긍정적인 피드백을 형성하면 모델이 제동의 '안전 거리'를 넘었을 수 있기 때문입니다.
위험 측면에서 몇몇 최첨단 연구실은 실제로 합의에 도달했습니다.
Altman은 "최첨단 AI 개발 속도를 늦추는 것"에 공개적으로 동의했으며 OpenAI도 유사한 직원 권리를 가진 독립적인 리뷰어를 도입할 것이라고 약속했습니다. 머스크는 "다리오가 옳다"고 말했다. 허사비스도 이것이 올바른 방향이지만 어떻게 할지는 계속 논의가 필요하다고 말했다.
그러나 이니셔티브에서는 혼자서 속도를 늦추는 것은 의미가 없다고 언급하기도 했습니다. AI 연구 및 개발이 AI에 의해 계속 가속화된다면, 미래에 진정으로 효과적인 둔화 또는 중단을 위해서는 독립적인 평가자의 도입, 최첨단 실험실이 능력 임계값 및 안전 조치를 공동으로 설정하고 필요할 경우 연구 개발 속도를 늦추도록 조정하는 것과 같은 일련의 공통 규칙의 확립이 필요합니다.
그러나 지금까지는 다양한 경쟁상의 이유로 공통 규칙이 확립되지 않았습니다.
이미 '조심해야 한다'는 것은 누구나 함께 말할 수 있지만, '구체적으로 어떻게 속도를 늦춰야 하는지, 누가 먼저 속도를 줄여야 하는지, 다른 나라들은 속도를 줄여야 하는지'에 대해서는 합의가 금새 사라져 버립니다.
실험실 간에는 가장 직접적인 모델 경쟁이 있으며, 국가 간에는 AI 경쟁이 더 큽니다. 어떤 국가라도 혼자서 속도를 늦추면 상대방에게 선두 창구를 포기할 위험이 있습니다. 어느 나라라도 단독으로 제한을 가하면 상대방이 계속 가속화하는 것을 걱정하게 될 것입니다.
따라서 몇몇 최첨단 AI 연구소에서는 말과 행동이 다소 일관성 없이 행동합니다.
구글 측에서는 위에서 언급한 Gemini 4 Pro가 아레나에서 익명으로 테스트된 것으로 의심되는 제품이 있습니다.
인류 측면에서는 최근 Opus 5.2의 회색조 흔적도 커뮤니티에 나타나기 시작했습니다. 일부 Claude Code 사용자는 실행 상태 및 요청 라우팅 정보를 통해 새로운 clude-opus-5-2 모델 로고를 보고 일부 요청이 차세대 Opus로 그레이스케일링되었음을 의심했다고 합니다.

OpenAI의 경우 배경 모델 목록에서 gpt-6-sol이라는 모델명을 봤다는 분들도 계시고, 새로운 모델로 그레이스케일링을 한 것 아닌가 의심하시는 분들도 계셨습니다. 널리 유포된 뉴스에 따르면, GPT 6 Sol은 다음주에 출시될 수도 있고, 미국 시간으로 9월 29일 Dev Day에 출시될 수도… 간단히 말해서 멀지 않습니다.

최첨단 AI 연구소 3곳의 다음 모델이 커뮤니티에서 테스트된 흔적을 보이기 시작했습니다.
지금까지 이번 '감속 이니셔티브'의 가장 확실한 결과는 어떤 회사의 속도가 실제로 느려졌다는 것이 아니라 가장 중요한 AI 회사가 사전에 위험에 대해 공개적으로 이야기했다는 것입니다.
모델 속도가 느려지지 않습니다.
그러나 적어도 어느 날 무슨 일이 일어나면 그들은 이렇게 말할 수 있습니다. 우리는 그들에게 경고했습니다.
댓글