이 문제에 정통한 두 사람에 따르면 구글은 제미니 대형 모델의 기본 아키텍처를 칩 하드웨어에 직접적으로 굳힐 수 있는 새로운 서버 칩을 개발하고 있어 사용자에게 AI 서비스를 제공하는 운영 효율성을 크게 향상시키고 있다. 내부적으로 코드명 Frozen v2인 이 칩은 Google의 현재 심각한 AI 컴퓨팅 성능 부족 문제를 해결하기 위해 설계되었습니다. 컴퓨팅 성능 격차로 인해 내부 리소스 충돌이 발생했으며 Google Cloud가 많은 외부 고객의 협력 주문을 거부하기도 했습니다.

이 문제에 정통한 소식통에 따르면 R&D팀은 칩이 공식 출시된 후 단위 전력 소비당 처리할 수 있는 토큰 수가 구글이 기존에 자체 개발한 최신 세대 AI 칩의 6~10배에 달해 에너지 효율의 질적 도약을 이룰 것으로 계산했다고 전했다.
코드명 "Frozen"의 유래는 대형 모델의 컴퓨팅 로직 일부를 실리콘 하드웨어에 영구적으로 에칭한다는 핵심 설계 아이디어에서 비롯되었습니다. 엔지니어들은 여전히 칩의 핵심 기능 모듈과 각 구성 요소가 어떻게 함께 작동할지 마무리하는 중입니다. 이 문제에 정통한 사람들은 구글이 이르면 2028년에 칩을 배포할 계획이라고 말했습니다.
Project Frozen은 Google의 기존 텐서 프로세서(TPU)를 대체하는 것이 아니라 이를 보완하는 새로운 자체 개발 칩 제품 라인을 만드는 것을 목표로 합니다. 현재 가장 널리 사용되는 AI 칩인 NVIDIA GPU와 Google TPU는 다양한 대형 모델에 적용할 수 있는 범용 칩입니다. 그러나 범용 칩이 어떤 모델을 실행하든 시간이 많이 걸리는 수많은 논리적 판단을 실시간으로 수행해야 합니다. Frozen v2에는 Gemini 시리즈 모델에 맞게 조정되는 기본 컴퓨팅 로직이 내장되어 있어 칩 컴퓨팅 단계와 데이터 전송량을 크게 줄일 수 있습니다.
이 문제에 정통한 관계자 중 한 명은 이 특수 칩이 사용자 질문에 더 빠르게 응답할 수 있으며 Google의 새로운 AI 응용 시나리오 출시를 지원할 것으로 예상된다고 말했습니다. 그러나 이 칩은 또한 Google이 현재 Gemini 대형 모델의 기본 아키텍처를 계속 사용할 것이라고 확신하고 있음을 의미합니다. Gemini 모델의 후속 반복에서만 칩이 칩에서 정상적으로 실행되도록 설계된 것과 동일한 인프라를 채택합니다.
이 문제에 정통한 사람들은 Google이 내장 모델 가중치 업데이트를 포함하여 칩을 반복적으로 최적화할 수 있다고 덧붙였습니다(가중치는 모델이 질문에 대답하는 방법을 결정하는 핵심 매개변수 구성입니다).
구글의 공식 대변인은 "회사 팀은 사용자와 기업 고객을 위한 최고의 성능과 에너지 효율성을 달성하기 위해 노력하면서 다양한 혁신적인 기술을 계속 개발하고 테스트하고 있다"고 답했습니다.
대변인은 "모든 R&D 프로젝트가 대량 생산에 투입되는 것은 아니지만 이러한 종류의 종합적인 기술 탐색은 우리의 풀스택 자체 연구 기술 경로의 핵심 부분입니다."라고 덧붙였습니다.
추론 칩이 업계의 초점이 된 이유
Samba Nova, d-Matrix 등의 스타트업과 OpenAI, Microsoft 등 거대 기술 기업은 AI 추론 칩(대형 모델에 외부 서비스를 제공하는 데 특별히 사용되는 컴퓨팅 하드웨어)을 개발하고 있습니다. 각 회사의 목표는 NVIDIA GPU를 능가하는 추론 에너지 효율성을 달성하고 컴퓨팅 성능 부족을 완화하며 운영 비용을 줄이는 것입니다. 엔비디아 자체도 지난해 12월 추론 칩 제조사인 그로크(Groq)의 기술 라이선스를 획득하기 위해 200억 달러를 지출했다.
업계의 다양한 플레이어의 기술 경로는 Google의 Frozen 솔루션과 다르지만 Frozen v2의 디자인 아이디어는 캐나다 칩 스타트업 Taalas의 아이디어와 매우 유사합니다. Taalas는 또한 특정 대형 모델의 로직을 칩에 하드 코딩하는 것을 선택했습니다. Taalas는 Quiet Capital 및 Fidelity Investments를 포함한 투자자들과 함께 2억 달러 이상의 자금 조달을 완료했습니다.
Frozen v2의 개발 반복은 원래 Frozen 솔루션에서 비롯되었습니다. 1세대 솔루션은 Google DeepMind의 수석 과학자인 Jeff Dean이 주도하며 전체 모델 가중치를 칩에 직접 에칭할 계획입니다. 그러나 이 솔루션에는 분명한 단점이 있습니다. 칩은 단일 버전의 Gemini에만 적용할 수 있고 하드웨어 수명 주기가 극도로 짧기 때문에 수년 동안 보류되었습니다.
이 문제에 정통한 또 다른 소식통에 따르면 Google은 하드웨어 유연성과 운영 에너지 효율성의 균형을 맞추기 위해 Frozen v2 칩에 얼마나 많은 모델 정보가 굳어졌는지 여전히 고려하고 있다고 밝혔습니다.
Google의 자체 개발 칩 배포는 지금까지 보상을 받았습니다. 올해 Google은 8세대 TPU를 출시하고 이를 클라우드 고객에게 직접 홍보하여 Nvidia의 독점 시장 점유율에 직접적인 영향을 미쳤습니다. Google은 TPU 컴퓨팅 성능을 Meta와 임대하는 동시에 Nvidia의 핵심 클라우드 공급업체 고객에게 TPU를 공급하기 위해 수십억 달러 규모의 계약을 체결했습니다.
Nvidia GPU에 전적으로 의존하지 않고 자체 개발한 AI 칩은 Google이 Gemini 모델의 운영 비용을 줄이는 데 도움이 되었습니다. Google은 TPU를 설계할 때 Gemini에 맞게 조정했지만 TPU에 내장된 모델 정보는 Frozen 시리즈 칩의 정보보다 훨씬 적습니다.
Google은 현재 Frozen v2를 대량 생산할 계획이 없으며 생산 능력은 TPU보다 훨씬 낮습니다. 이 문제에 정통한 소식통은 이 칩의 대량 생산 규모가 제한되어 있어 구글이 외부 설계 및 파운드리 파트너 도입을 연기할 수 있다고 말했습니다. 동시에 Google은 이 세대의 제품을 기술 테스트 플랫폼으로 간주합니다. 대형 모델의 기본 아키텍처가 안정화된 후, 보다 특화된 칩 개발을 위한 엔지니어링 경험을 축적할 것입니다.