요약:
말도 안되는 일이군요. 단 이틀 만에 4개의 새로운 모델이 등장했습니다! 앞발에서는 Lao Ma의 xAI가 방금 Grok 4.7 발행을 마쳤습니다. 그 직후 OpenAI가 갑자기 GPT-6 Sol과 Luna를 버리면서 가격이 반토막이 났습니다. 같은 날 Anthropic은 이전 세대보다 40% 저렴한 Claude Opus 5.5도 출시했습니다. 9월 22일, 애니메이션 사진이 X에서 입소문을 타며 거의 백만 건에 가까운 조회수를 기록했습니다.

2023년에는 대형 모델이 73일마다 업데이트되며, 2026년에는 18일마다 업데이트됩니다.
ChatGPT가 출시된 이후 OpenAI와 Anthropic은 42개의 블록버스터 모델(그날 출시된 GPT-6 Sol 및 Luna를 포함하여 44개)을 폭격했습니다.
몇 시간 후 Stability AI 창립자인 Emad Mostaque는 사진을 리트윗하고 예언을 추가했습니다.
"알렉스가 말했듯이 이대로라면 내년 초에는 하루에 한 번이 될 것입니다."

두 거인, '반월 업데이트' 출시
사실 "18일마다 업데이트" 횟수는 OpenAI와 Anthropic만 포함하기 때문에 상당히 보수적입니다.
올해 초부터 9월 22일까지 Anthropic은 8개의 플래그십 모델을, OpenAI는 6개의 플래그십 모델을 출시했습니다. 14개 모델은 265일에 걸쳐 확산되었으며, 모델당 평균 19일이 소요되었습니다.
같은 기간 국내 10대 대형 모델 제조사는 최소 28개 이상의 플래그십 모델을 추가로 출시했는데, 이는 평균 9일에 1개 이상이다.
함께 런칭한 적도 있었습니다. 춘절 전 주에 4개 회사가 차례로 새로운 플래그십 제품을 출시했습니다. 4월 20일부터 24일까지 5일간 4개 업체가 교대로 추가로 진행됐다.
양측을 합치면 평균 6일 이상 만에 새로운 플래그십이 등장하는데, 이는 에마드가 언급한 '1일 1'과 크게 다르지 않다.

앤트로픽의 속도 증가는 육안으로 확인할 수 있습니다.
상반기에는 모델 출시까지 평균 46일이 걸렸고, 하반기에는 26일이 걸렸다. Opus 4.8은 5월 28일, Opus 5는 7월 24일, Opus 5.5는 9월 22일입니다.
OpenAI는 '궁극적인 움직임을 억제한 후 빼앗는' 경로를 택합니다.
GPT-6 Astra는 9월 3일에 전체 네트워크를 폭파했고, 불과 19일 후에 Sol과 Luna도 그 뒤를 따랐습니다.
다음 주에 DevDay 컨퍼런스가 있을 예정입니다. 알트만은 오픈AI가 기자회견을 준비하면서 “공개할 것이 너무 많다”고 외친 것은 기억상 처음이라고 한탄했다.

왜 출판이 점점 더 밀도화되고 있나요? Anthropic은 보고서에서 답을 제시했습니다. AI는 이미 차세대 AI를 만드는 데 도움을 주고 있습니다.
올해 2월 클로드는 AI R&D 업무의 1% 미만을 독립적으로 이끌 수 있었습니다. 이후 거의 매달 개선돼 5월 12%, 7월 22%, 8월 26%에 이르렀다.

오픈AI에서는 8월 중순 기준 AI 에이전트가 투자한 근무일수가 인간 연구원의 3.1배(1일 8시간 기준)이다.
Anthropic에서는 모델 제작 작업의 4분의 1이 Claude 자신에게 넘겨졌습니다. 다음 모델은 속속 등장할 예정이다.
줄이 이미 문 앞에 도착했습니다. Anthropic의 Mike Krieger는 Sonnet 5.5와 Haiku 5.5가 앞으로 몇 주 안에 출시될 것이라고 밝혔습니다.

Google의 Gemini 4는 이르면 7월부터 '현재까지 가장 야심찬 사전 훈련'을 시작했으며, 외부 세계에서는 일반적으로 연말쯤 공개될 것으로 예상하고 있습니다. 적어도 두 개의 국내 회사가 공식적으로 차세대 플래그십을 발표했지만 출시일은 단 하나뿐입니다.
힘들게 얻은 "형이상학"
2개월 후 즉시 폐기됩니다
대형 모델이 더 빠르게 실행될수록 다운스트림에서 코드를 작성하는 사람들은 더욱 당혹스러워집니다.
7월 말에 몇 차례 밤을 새운 후 방금 애플리케이션을 Opus 5로 옮겼습니다. 모든 매개변수가 실크처럼 원활하게 조정되었습니다. 두 달 후 Opus 5.5가 나왔고 인터페이스를 행복하게 변경했습니다. 클릭하면 일부 요청이 직접 오류를 보고했습니다.
최근 두 회사의 공식 프롬프트 워드 가이드를 살펴보면 동일한 사실을 전달하고 있음을 알 수 있습니다. 이전 세대 모델에 대해 귀하가 작성한 많은 조상 메시지가 폐지가 되었습니다.
먼저 할 일은 뺄셈을 하는 것입니다.
OpenAI는 Astra 가이드에서 과거에 너무 자세했던 프로세스 지침이 이제는 방해가 될 것이라고 분명히 명시하고 있습니다. "코드를 변경하기 전에 문서를 꼼꼼히 읽어보세요", "테스트 실행을 기억하세요" 등의 단어는 모두 삭제될 수 있습니다.

Anthropic의 가이드도 이를 의미합니다.
과거에는 프롬프트 단어에 "완료 후 확인"이라는 문장을 추가해야 하는 경우가 많았지만 Opus 5에서는 이미 자체적으로 확인할 수 있습니다. 이 문장을 삭제하지 않으면 오버체크가 됩니다.
Opus 5.5에서는 채팅 장면에서 "답변하기 전에 신중하게 생각하세요"라는 PUA 문구를 삭제하는 것이 좋습니다. 삭제 후 답변이 빨라지고 품질도 크게 떨어지지 않습니다.
모든 세대는 새로운 성격을 갖고 있기 때문에 오래된 것을 삭제한 후에는 새로운 것을 추가해야 합니다.
Opus 5.5는 항상 여러 라운드의 대화 중에 이미 답변된 질문에 대해 생각하는 것을 좋아하는데, 이는 컴퓨팅 성능을 낭비하는 것입니다. "답변된 내용은 과거입니다."라는 공식 패치가 나왔습니다.

매개변수와 기본값도 조용히 바뀌고 있습니다.
Opus 5.5에서 사고 모드를 끄면 오류 400이 직접 보고됩니다. 노력 매개변수를 작성하지 않으면 기본 장비가 높음에서 중간으로 줄어들고 그에 따라 비용과 효과가 섞입니다.
이와 관련하여 공식적인 제안은 노력 테스트를 다시 실행하고 Opus 5의 이전 설정을 직접 전송하지 않는 것입니다.
한 세트의 프롬프트 단어와 일련의 매개변수가 결합되어 각 세대는 피부의 껍질을 벗겨내야 합니다. 조정이 이루어지지 않은 경우 청구서가 크게 달라질 수 있습니다.
Anthropic의 Lance Martin은 비디오에서 Opus 4.8용으로 작성된 기존 프롬프트의 비용이 작업 주문당 2.45센트이고 이를 Opus 5.5로 직접 대체하는 데 2.02센트가 든다는 점을 시연했습니다. 공식 툴로 다시 워싱한 결과 정확도는 92.0%로 늘었고, 비용은 1.83센트로 줄었다.

이에 더해 모델 자체의 수명도 단축됩니다.
OpenAI는 올해 40개 이상의 모델과 기능을 포함한 9개의 지원 중단 발표를 발표했습니다.
그 중 4월 23일에 막 공개된 GPT-5.5는 10월 14일에 ChatGPT와 Codex에서 제거되고 반년도 채 안 남았습니다.
OpenAI의 자체 Evals 평가 플랫폼도 11월 말에 종료됩니다.

목록을 브러싱하시겠습니까? 반년 만에 새로운 시험 문제가 풀렸습니다
사람들이 따라잡지 못해도 상관없지만, 이제는 '시험지'만으로는 부족합니다.
올해 3월에는 AI에 특화돼 문제를 외우지 않고 IQ를 테스트하는 ARC-AGI-3가 출시됐다. 당시 1위를 차지했던 제미니 3.1 프로(Gemini 3.1 Pro)는 0.37%에 불과한 반면 휴먼은 100%를 얻었다.
9월 3일 GPT-6 아스트라가 시험장에 입성해 표준 테스트에서 62.7%를 기록했고, 특정 프레임워크를 사용해 99.9%를 직접 달성했다. 96%의 레벨에서 인간보다 더 적은 단계를 밟았습니다.

반년 만에 새로운 시험 문제 세트가 세분화되었으며 ARC 관계자는 차세대 평가를 어떻게 제작할지 고민하기 시작했습니다.
코딩 목록(Next.js)에서는 Sol, Opus 5.5, Fable 5.1이 모두 97%를 기록해 공동 1위를 차지했습니다. 저작 목록에서는 Opus 5.5 Fault가 307점 차로 2위를 차지했습니다.
이 점수는 목록 역사상 가장 큰 단일 점프입니다. 그 블로거는 그것을 읽은 후 그것이 터무니없다고 말했고, 자신의 벤치마크에 버그가 있다고 거의 생각할 뻔했습니다!

새로운 모델이 나올 때마다 개발자들은 시지프스처럼 테스트 과정을 처음부터 다시 시작해야 합니다.
지금의 속도로 보면, 내년에 정말로 '1일 1업데이트' 수준에 도달하게 된다면 오늘 조정한 프롬프트 단어와 에이전트 링크는 일주일을 넘기지 못할 수도 있습니다.
처음으로 모델 교체 속도가 인간의 적응 속도를 완전히 넘어섰습니다.
오늘날 가장 느린 주자는 실제로 AI를 사용하는 주자들입니다.
댓글