slurm1 SageMaker HyperPod가 AI 학습 클러스터 배치를 바꾸는 이유 AI Market SignalAWS가 7월 17일 SageMaker HyperPod에 파티션별 topology 설정을 넣으면서, AI 학습 클러스터 운영 질문이 한 단계 바뀌었습니다. 이제 같은 Slurm 클러스터 안에서도 UltraServer 쪽은 block topology, 다른 GPU 인스턴스 쪽은 tree topology를 따로 쓸 수 있습니다. 검색창에 SageMaker HyperPod가 찍히는 이유도 여기 있어요. GPU를 몇 장 더 사느냐보다, 이미 있는 GPU를 어떤 연결 구조로 묶어 배치하느냐가 더 비싼 질문이 되기 시작했기 때문입니다. AWS What's New직접 영향을 받는 쪽은 대형 모델 학습이나 파인튜닝을 돌리는 플랫폼팀, Slurm 기반 학습 클러스터를 맡은 ML 인프라 팀, .. 2026. 7. 19. 이전 1 다음