클러스터 네트워크 정보
클러스터 네트워크는 가상 사설 클라우드(VPC) 내에서 여러 컴퓨팅 시스템 또는 노드를 연결하는 소프트웨어 정의 네트워크입니다. 이러한 시스템 간의 통신을 개선하여 빠른 데이터 전송과 낮은 지연 시간을 제공합니다. 이 서비스는 고성능 컴퓨팅(HPC), 대규모 데이터 처리, 인공지능(AI) 모델 훈련과 같은 까다로운 작업에 이상적입니다. 클러스터 네트워크는 고성능 기준을 충족하도록 구축되어 시스템 간 효율적이고 고속의 통신에 의존하는 환경에 적합합니다.
각 클러스터 네트워크에는 연결 가능한 구성 요소 유형을 정의하는 관련 클러스터 네트워크 프로필이 있습니다. 클러스터 네트워크 내에는 인스턴스, 인터페이스, 서브넷과 같은 기본 네트워킹 추상화 세트가 포함되어 있어 고성능 워크로드를 구성하는 데 필요한 유연성과 제어 기능을 제공합니다.
키 기능에는 다음이 포함됩니다.
- 고성능 컴퓨팅
- 인공지능 훈련이나 복잡한 시뮬레이션과 같이 높은 대역폭과 낮은 지연 시간이 중요한 까다로운 애플리케이션에 적합합니다.
직접 데이터 전송 : 고급 네트워킹 기술을 지원하며, 여기에는 CPU 개입 없이 서로 다른 노드의 메모리 간 직접 데이터 전송을 가능하게 하여 성능을 더욱 향상시키는 원격 직접 메모리 액세스(RDMA)가 포함됩니다.
- 격리 및 최적화
- 컴퓨팅 리소스 그룹을 위한 높은 대역폭과 짧은 지연 시간의 네트워킹을 제공합니다. 클러스터 네트워크는 외부로 라우팅되지 않는 별도의 IPv4 주소 공간에 격리됩니다.
- 유연성 및 제어
- 기존 VPC 네트워크에 대한 보조 네트워크 역할을 수행합니다. 클러스터 네트워크 연결은 VPC 네트워크와 별도로 유지되어, VPC 네트워크와 병행하여 고속 RDMA 네트워크의 통합을 지원합니다.
IBM Cloud® 다음 클러스터 네트워크 프로파일을 지원합니다
IBM Cloud 의 클러스터 네트워크 제공 항목
NVIDIA 호퍼 1
Hopper 1 클러스터 네트워크 프로파일은 고성능 IBM Cloud 클러스터로, NVIDIA H100 및 H200 GPU로 구동되며 NVLink 및 400Gbps RoCE v2 네트워킹으로 연결됩니다. Hopper 1은 클라우드 배포에 최적화되어 있으며, 높은 메모리 대역폭과 저지연 GPU 통신을 통해 대규모 AI 훈련 및 추론을 위해 설계되었습니다.
클러스터 네트워크 시작하기
클러스터 네트워크는 네트워크로 연결된 시스템 그룹 내에서 데이터 전송의 효율성과 속도를 향상시켜 고성능 컴퓨팅 작업을 위한 필수 구성 요소입니다.
다음 일반적인 단계에 따라 AI 학습을 위한 간단한 클러스터 네트워크를 생성하세요:
-
만들려는 인스턴스 수에 해당 인스턴스 프로필에 정의된 리소스를 곱하여 클러스터에 필요한 총 리소스를 결정합니다.
-
클러스터에 필요한 계산된 총 리소스를 기본 할당량과 비교하여 할당량 증가가 필요한지 확인합니다.
-
클러스터 네트워크 생성 시 아직 생성하지 않았다면 클러스터 네트워크 서브넷을 생성하십시오.
-
다음 방법 중 하나를 사용하여 가상 서버 인스턴스를 생성하십시오:
-
인스턴스 템플릿을 만든 다음 인스턴스를 만듭니다. 반드시 해야 합니다:
- 필요한 인스턴스 프로필을 선택하십시오. Hopper 1의 경우 사용 가능한 인스턴스 프로필은 와
gx3d-160x1792x8h100입니다gx3d-160x1792x8h200 - 클러스터링을 사용 설정합니다.
- 클러스터 서브넷에 해당하는 첨부 파일을 추가하십시오.
- 필요한 인스턴스 프로필을 선택하십시오. Hopper 1의 경우 사용 가능한 인스턴스 프로필은 와
인스턴스 템플릿을 만들 때 이를 사용하여 단일 가상 서버 인스턴스 또는 인스턴스 그룹의 일부로 여러 인스턴스를 동시에 프로비저닝할 수 있습니다.
클러스터 네트워크 사용 사례
선택한 인스턴스 프로필과 일치하는 사용 사례를 검토하여 클러스터 네트워크 배포에 적합한 구성 및 보안 조치를 안내받으십시오.
사용 사례 1: Hopper 1 클러스터 네트워크에서 RDMA를 사용하기 위해 H100/H200 인스턴스 간 네트워킹
다음 다이어그램은 호퍼 1 클러스터 네트워크에 리눅스 커널 2.6.17( H100/H200 ) 인스턴스를 연결하여 호퍼 1 클러스터 네트워크( IBM Cloud )에서 RDMA를 활성화하는 방법을 보여줍니다.
먼저, 그림과 같이 클러스터 네트워크 서브넷 으로 구성된 클러스터 네트워크 가 설정되어 있는지 확인하십시오. 그런 다음, H100 또는 H200 인스턴스를 클러스터 네트워크와 VPC 네트워크 모두에 연결하십시오. VPC 네트워크는 클라우드 리소스를 연결하고 외부 라우팅을 제공할 수 있습니다. 클러스터 네트워크는 인스턴스 내에 인터페이스를 추가하여 노드 간 직접 연결을 가능하게 합니다.
사용 사례 2: 나머지 IBM Cloud 에코시스템으로부터 클러스터 네트워크 보호
클러스터 네트워크는 VPC 네트워크와 별도의 네트워크 도메인 내에서 작동합니다. 이러한 격리는 보안 그룹, 네트워크 ACL 또는 라우팅 테이블과 같은 액세스 제어 없이도 보안을 제공합니다. 클러스터 네트워크 내의 통신은 클러스터 네트워크에 직접 연결된 장치들 사이에서만 발생합니다.
클러스터 네트워크에 연결된 리소스는 최소한 하나의 VPC 네트워크에도 연결되어야 합니다. VPC 네트워크는 플로팅 IP 주소, 공용 게이트웨이, 전송 게이트웨이 등 모든 표준 VPC 리소스를 지원합니다. 클러스터 네트워크의 리소스에 연결된 가상 네트워크 인터페이스(VNI)에 대한 보안 정책을 검토할 것을 권장합니다.
클러스터 네트워크에 대한 최소한의 접근을 유지하려면:
-
클러스터 네트워크에 연결된 인스턴스만으로 접근을 제한하십시오.
-
각 인스턴스의 VNI에 대해 클러스터 네트워크에 대한 접근 권한을 부여하는 엄격한 보안 그룹을 구성하십시오.
인바운드 TCP 요청을 주의 깊게 보호하고 아웃바운드 TCP 요청을 보호하는 것을 고려하세요. 자세한 내용은 리소스에 대한 보안 그룹 설정하기를 참조하세요.
-
클러스터 네트워크 지원 인스턴스에 연결된 서브넷에 적절한 네트워크 ACL이 적용되었는지 확인하십시오.
-
클러스터 네트워크 권한에 대한 IAM 정책을 구성합니다.