Nvidia는 "Rubin CPX" AI 가속기 프로젝트를 다시 시작하고 168GB HBM4 메모리로 전환한 것으로 알려졌습니다.

📅 2026-09-01

요약:

공급망 분석가 Ming-Chi Kuo에 따르면 NVIDIA가 이전에 보류했던 'Rubin CPX' AI 가속기 프로젝트가 이제 다시 시작되었으며 메모리 아키텍처가 재설계되었습니다. 이 제품은 당초 128GB GDDR7 비디오 메모리를 탑재할 예정이었으나 현재는 168GB HBM4 고대역폭 메모리를 탑재하게 됐다.

Nvidia는 작년 말 주로 대규모 에이전트 인공지능 워크로드를 위한 Rubin GPU 제품군 기반의 전용 가속기를 개발할 계획이라고 발표했습니다. 프로젝트가 발표된 후 일시적으로 보류된 것으로 알려졌는데, 엔비디아는 재기획을 완료한 것으로 보입니다. Rubin CPX는 독립 랙에 배포되며, 각 랙은 64~256개의 독립 CPX GPU로 구성될 수 있습니다.

디코딩 작업을 담당하는 기존 Rubin GPU와 달리 CPX GPU는 대규모 언어 모델 추론 프로세스의 '사전 채우기' 단계에 주로 사용되며 입력 컨텍스트 및 KV 캐시 처리를 담당합니다. NVIDIA는 사전 채우기 작업을 담당하는 CPX GPU와 디코딩을 담당하는 일반 Rubin GPU를 통해 사전 채우기 및 디코딩 작업을 분리하여 전반적인 추론 효율성을 향상시키려고 노력하고 있습니다.

8개의 CPX GPU가 장착된 랙 트레이는 최대 1.34TB의 긴 컨텍스트 사전 채우기 데이터 및 관련 KV 캐시를 처리할 수 있으며 모두 HBM4 메모리에 의존합니다. HBM4는 더 높은 메모리 대역폭을 제공하여 긴 컨텍스트 데이터의 처리 속도를 높이는 데 도움이 됩니다. 이전 설계에는 통합 HBM4가 필요하지 않았기 때문에 Nvidia도 칩 패키징을 재설계해야 하며 TSMC의 CoWoS-S 또는 CoWoS-L 고급 패키징 기술을 사용할 것으로 예상됩니다.

컴퓨팅 성능 측면에서 Rubin CPX는 모놀리식 칩 설계를 채택하고 30기가플롭스의 NVFP4 컴퓨팅 성능, 즉 30PFLOPS를 제공할 수 있습니다. 또한 이 칩은 4개의 NVENC 비디오 인코딩 엔진과 4개의 NVDEC 비디오 디코딩 엔진을 통합하여 외부 프로세서에 의존하지 않고도 보다 효율적인 멀티미디어 관련 작업을 완료할 수 있습니다.

대규모 언어 모델의 매개변수 규모가 수조 수준에 가까워짐에 따라 사전 채우기 작업과 디코딩 작업을 다른 랙에 넘겨주면 토큰 생성 및 전달 속도가 크게 향상될 것으로 예상됩니다. Nvidia는 또한 디코딩 랙에서 CPX GPU와 일반 Rubin GPU의 비율을 1:1로 유지할 것을 권장합니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음