Microsoft는 오늘 미국 조지아주 애틀랜타에 새로운 Fairwater Azure AI 데이터 센터를 구축할 것이라고 발표했습니다. 이 새로운 위치는 위스콘신의 기존 Fairwater 데이터 센터와 기존 Azure AI 슈퍼컴퓨터를 연결하여 다양한 AI 워크로드를 실행할 수 있는 글로벌 초대형 AI 데이터 센터를 구축할 것입니다.

마이크로소프트는 OpenAI 등 인공지능의 훈련 요구를 충족시키는 풍부한 경험을 축적해 왔으며 그에 따라 AI 데이터센터 설계 컨셉을 완전히 재구성했다고 밝혔다. 이 새로운 AI 데이터 센터는 단일 레이어 플랫 네트워크 아키텍처를 채택하고 수십만 개의 NVIDIA GB200 및 GB300 시리즈 GPU의 컴퓨팅 성능을 통합하여 초대형 AI 컴퓨팅 요구 사항을 충족할 수 있습니다.

Microsoft는 이전 데이터 센터와 비교하여 차세대 데이터 센터의 주요 혁신을 강조했습니다.

  • 매우 높은 GPU 밀도: 맞춤형 랙을 사용하여 NVIDIA Blackwell/GB 시리즈 GPU를 고밀도로 배포함으로써 지연 시간을 효과적으로 줄이고 GPU 간 통신 효율성을 향상시킵니다.

  • 폐쇄 루프 액체 냉각: 밀봉된 냉각 시스템은 거의 증발 없이 동일한 배치의 수자원을 6년 이상 재활용할 수 있어 고밀도 컴퓨팅 성능의 지속 가능한 작동을 보장합니다.

  • 초대형 전원 공급 장치: 각 랙 그룹은 140kW, 각 행은 약 1.36MW에 이릅니다. 전통적인 전력 병목 현상 없이 차세대 가속기의 높은 에너지 소비에 쉽게 대처할 수 있습니다.

  • 평탄한 고대역폭 네트워크: 이중 레이어 이더넷 아키텍처, 단일 GPU 연결 속도는 800Gbps에 도달할 수 있으며 SONiC 기반 네트워크 설계는 비용과 복잡성을 줄이고 단일 공급업체에 대한 의존도를 줄입니다.

  • 애플리케이션 인식 네트워크 최적화: 실시간 패킷 클리핑, 패킷 스프레이 및 고급 로드 밸런싱 기술은 매우 큰 GPU 클러스터의 효율적인 활용을 보장합니다.

  • 글로벌 규모의 AI 광역 네트워크: 애틀랜타, 위스콘신 등 여러 사이트가 지연 시간이 짧은 전용 광 백본을 통해 연결되어 지역 간 통합 '슈퍼컴퓨터'를 형성합니다.

  • 탄력적인 그리드 최적화 전원 공급 장치: 강력한 로컬 유틸리티 그리드를 최대한 활용하여 고가용성을 달성하고 에너지 저장 버퍼를 통해 작업 부하 전력 변동에 대응합니다.

  • 모든 AI 워크로드와 호환: 사전 훈련, 미세 조정, 강화 학습, 추론 및 합성 데이터 생성이 동일한 인프라에서 효율적으로 작동할 수 있습니다.

Microsoft는 통합 다중 지역 슈퍼컴퓨팅 플랫폼을 구축함으로써 향후 몇 년간 기하급수적으로 증가하는 AI 워크로드를 충족할 계획을 적극적으로 제시하고 있습니다.