Intel은 256코어 Xeon 7의 세부 정보를 공개합니다: Diamond Rapids가 2027년으로 연기되어 HPC 고급 시장을 겨냥합니다.

📅 2026-08-26

요약:

인텔은 최근 Hot Chips 컨퍼런스에서 차세대 Xeon 7 서버 프로세서 플랫폼 Diamond Rapids(코드명 DMR)에 대한 자세한 기술 세부 사항을 발표했습니다. 이 플랫폼은 원래 2026년에 출시될 예정이었고 최대 구성은 192개 코어, 16개 메모리 채널이지만 2027년으로 연기된 것으로 확인되었습니다. 동시에 Intel은 자사 플래그십 모델의 코어 수를 256개 성능 코어로 더욱 늘려 최대 256개 코어를 탑재한 AMD의 6세대 EPYC Venice 시리즈를 직접 벤치마킹했습니다.

Diamond Rapids는 더 넓은 서버 시장을 겨냥한 이전 제품과 달리 고성능 컴퓨팅에 중점을 둘 것입니다. 이 플랫폼은 업계에서 흔히 동시 멀티스레딩(SMT)으로 지칭되는 하이퍼스레딩 기술을 완전히 없애고, 하이코어 시장을 위한 하이엔드 AP 버전만 제공한다. 당초 계획된 8채널 Diamond Rapids-SP 제품은 취소되었습니다. 따라서 DMR은 AMD 제품 라인의 모든 수준을 다루지는 않지만 최고의 HPC 시장을 놓고 경쟁하는 데 중점을 둘 것입니다.

인텔의 후속 Coral Rapids 제품은 하이퍼스레딩 기술을 다시 도입하고 차세대 SP 시리즈 프로세서를 선보일 것으로 예상됩니다. 그러나 아키텍처 복잡성 측면에서 Diamond Rapids는 여전히 현재까지 Intel의 가장 정교한 Xeon 프로세서 중 하나입니다. 어느 정도 디자인 아이디어는 AMD가 2019년 EPYC Rome과 함께 도입한 모듈식 칩렛 경로를 연상시킵니다. 컴퓨팅, I/O 및 메모리 기능을 분할한 다음 다양한 제품 요구 사항에 따라 유연하게 결합합니다. 인텔은 여러 세대의 제품을 탐색한 끝에 마침내 자신에게 더 적합한 멀티 코어 통합 방식을 찾은 것으로 보입니다.

단일 Diamond Rapids 프로세서는 최대 22개의 코어로 구성될 수 있으며 컴퓨팅 성능, 캐시 용량 및 메모리 구성의 필요에 따라 늘리거나 줄일 수 있습니다. 이러한 코어는 주로 Intel 18A-P 프로세스를 사용하여 제조된 최대 16개의 컴퓨팅 코어, Intel 3-T 프로세스를 사용하여 제조된 4개의 컴퓨팅 빌딩 블록 기본 코어, 시스템의 다양한 부분을 연결하는 Intel 3 프로세스 기반의 확장 가능한 패브릭 허브 코어 2개의 세 가지 범주로 나뉩니다.

이중 18A-P는 인텔의 18A 공정을 개선한 버전으로 2나노급 공정 기술에 속한다. Intel은 동일한 성능에서 이 프로세스를 통해 전력 소비를 18%까지 줄일 수 있다고 주장합니다. 동일한 전력 소비로 최대 9%의 성능 향상을 가져올 수 있습니다. 프로세스 향상 외에도 Diamond Rapids는 새로운 성능 코어 마이크로아키텍처도 채택하므로 실제 성능은 코어 IPC 개선에 의해 영향을 받습니다.

각 컴퓨팅 코어는 최대 16개의 코어와 해당 L2 캐시를 통합합니다. 이러한 컴퓨팅 코어 중 최대 4개는 Foveros 3D 다이렉트 하이브리드 본딩 기술을 사용하여 컴퓨팅 빌딩 블록 기본 코어 위에 쌓이게 됩니다. 기본 칩은 L3 캐시를 통합합니다. 각 컴퓨팅 빌딩 블록은 320MB의 L3 캐시를 제공하며, 최상위 Diamond Rapids 모델은 최대 1.28GB의 총 L3 캐시 용량을 갖습니다.

인텔은 컴퓨팅 모듈을 I/O 및 메모리 모듈과 연결하기 위해 EMIB 내장형 멀티 코어 상호 연결 브리지를 사용하지 않습니다. 대신 실리콘 브리지 대신 유기 패키징 기판을 통해 데이터를 전송하는 UCIe-S 스타일에 가까운 패키징 상호 연결 솔루션을 채택했습니다. 인텔은 이 새로운 다이 아키텍처를 "팬아웃 상호 연결 아키텍처"라고 부릅니다.

두 개의 확장 가능한 패브릭 허브 칩이 메모리 컨트롤러와 I/O 인터페이스를 통합합니다. 이들의 설계 개념은 AMD의 최신 EPYC 서버 프로세서 세대에 있는 I/O 다이와 유사합니다. 이러한 다이를 복제함으로써 인텔은 메모리 채널과 상호 연결 기능을 확장할 수 있습니다. 2개의 패브릭 허브는 총 16개의 DDR5 메모리 채널을 제공할 수 있습니다. 표준 DDR5 메모리 속도는 최대 8000MT/s에 도달할 수 있으며, MRDIMM을 사용할 경우 12800MT/s에 도달할 수 있습니다.

확장된 연결 측면에서 Diamond Rapids는 온보드 네트워크, USB 또는 베이스보드 관리 컨트롤러와 같은 보조 I/O 장치에 사용할 수 있는 8개의 PCIe 4.0 레인 외에도 최대 128개의 PCIe 6.0, CXL 3 또는 UPI 3 레인을 지원합니다.

이 디자인은 메모리 액세스 방법에 대한 Intel의 조정도 반영합니다. 이전 Granite Rapids-AP는 기본적으로 3개의 NUMA(Non-Uniform Memory Access) 노드로 표시되었지만 Xeon 7 Diamond Rapids는 UMA(Unified Memory Access) 아키텍처를 제공하려고 합니다. 새로운 패키징 상호 연결 방법으로 인해 컴퓨팅 빌딩 블록은 두 개의 패브릭 허브와 직접 통신할 수 있으므로 추가 점프를 통해 다른 I/O 모듈에 액세스하는 문제를 피할 수 있습니다. 인텔은 이 디자인이 UMA 실현에 도움이 될 뿐만 아니라 고급 패키징 비용도 제어할 수 있다고 믿습니다.

그러나 DMR 플랫폼에는 아직 발표되지 않은 주요 매개 변수가 많이 있습니다. Intel은 코어의 최대 주파수를 명시하지 않았으며 Granite Rapids에 비해 새로운 성능 코어의 IPC 개선도 공개하지 않았습니다. 캐시 수준에 대한 구체적인 세부 사항도 제한되어 있으며, L3 캐시 용량이 상당할 것이라는 점만 확인할 수 있습니다.

명령어 세트 측면에서 Diamond Rapids는 업데이트된 AMX 매트릭스 확장 명령어를 지원하고 FP8 지원을 추가하여 머신러닝 작업을 실행할 때 CPU 효율성을 향상시킵니다. 또한 이 프로세서는 AVX 10.2를 완벽하게 지원하는 최초의 제품 중 하나가 될 것입니다. AVX 10.2는 Intel의 초기 AVX-512 구현의 일부 제한 사항을 개선하는 것을 목표로 하며 고성능 컴퓨팅 및 슈퍼컴퓨팅 애플리케이션에 매우 중요합니다.

UMA가 기본 구성이 될 것으로 예상되지만, NUMA 지원은 많은 수의 코어를 더 작은 리소스 도메인으로 분할해야 하는 HPC 워크로드에 여전히 중요합니다. Intel은 아직 DMR이 NUMA 파티셔닝을 구현하는 방법을 자세히 설명하지 않았지만 아키텍처 관점에서 프로세서는 이론적으로 2개, 4개 또는 그 이상의 하위 NUMA 클러스터로 나눌 수 있습니다. 이 기능을 열지 여부는 주로 BIOS 설정에 따라 달라질 수 있습니다.

제품 계층화도 해결되지 않은 또 다른 문제입니다. 현재 인텔이 256코어와 192코어 버전을 출시할 것으로 알려져 있지만, 코어 수가 어느 정도 줄어들지는 불분명하다. 이론적으로 Intel은 단 하나의 컴퓨팅 빌딩 블록과 16코어 컴퓨팅 코어만 포함하는 버전으로 제품을 맞춤화할 수 있습니다. 그러나 보다 현실적인 판단은 Diamond Rapids의 최소 구성이 64코어에서 128코어 사이에 있을 수 있다는 것입니다.

공개된 사양에 따르면 Diamond Rapids는 최근 몇 년 동안 Intel의 가장 경쟁력 있는 고급형 Xeon 세대가 될 것으로 예상됩니다. AMD의 Venice EPYC와 Intel의 DMR은 모두 최대 256개의 코어, 16개의 메모리 채널, 1GB 이상의 L3 캐시 및 유사한 상호 연결 기능을 제공합니다. 양측 주력 제품의 열 설계 소비전력도 600W 안팎으로 예상된다.

인텔의 명백한 단점은 하이퍼스레딩 기술이 없다는 점입니다. 스레드 수에 크게 의존하는 일부 워크로드에서 AMD는 두 당사자의 핵심 성능이 유사하더라도 SMT를 통해 여전히 두 자리 수의 성능 이점을 얻을 수 있습니다. 그러나 HPC 세계에서는 하이퍼스레딩이 항상 이점을 가져오는 것은 아닙니다. 예를 들어, 글로벌 슈퍼컴퓨터의 순위를 매기는 데 사용되는 HPL 벤치마크는 일반적으로 하이퍼스레딩의 이점을 얻지 못합니다. Arm은 이전에 동기화된 멀티스레딩이 일부 시나리오에서는 득보다 실이 더 클 수 있다고 언급한 바 있습니다.

또한 Diamond Rapids는 AI 생성을 호스팅하는 Python 코드 실행 환경이나 C 및 Rust 코드를 컴파일하고 실행하기 위한 격리 컨테이너와 같은 대기 시간이 짧은 AI 에이전트 샌드박스 프로세서로 Intel에 의해 포지셔닝될 가능성을 제공합니다. 그러나 그럼에도 불구하고 특히 Nvidia가 자체 개발한 Vera CPU를 AI 시스템에 선호되는 호스트 측 프로세서로 홍보하는 맥락에서 DMR이 Intel의 대량 제품이 되지 않을 가능성이 높습니다.

궁극적으로 Diamond Rapids의 시장 성과는 여전히 가격과 가격 대비 가치에 달려 있습니다. AMD가 EPYC Rome을 출시했을 때 단일 코어 성능에서는 Intel을 압도할 수는 없지만 더 많은 코어 수, 더 풍부한 I/O 및 더 뛰어난 메모리 확장 기능으로 더 매력적인 단가 가치를 제공했습니다. Intel이 더 저렴한 가격으로 더 많은 코어를 제공할 수 있다면 AMD가 더 나은 절대 성능을 제공하더라도 Xeon 7은 특정 고객에게 여전히 경쟁력이 있을 수 있습니다.

관련 태그

관련 글

댓글

0/500
验证码
댓글 없음