AI 클러스터란 무엇인가? 수천 개의 GPU가 하나처럼 움직이는 구조
예전에는 테라라는 MMORPG를 꽤 오래 했습니다.
제가 키웠던 캐릭터는 창기사였습니다. 파티에서는 탱커 역할을 맡았고, 던전이나 레이드에 들어가면 가장 먼저 보스에게 붙어 어그로를 잡는 것이 제 역할이었습니다.
하지만 장비가 아무리 좋은 탱커라도 혼자서는 보스를 잡을 수 없었습니다.
딜러들은 보스의 패턴이 어려워지기 전에 충분한 피해를 넣어야 했고, 정령사와 사제는 파티원의 체력을 회복시키면서 버프를 유지해야 했습니다. 탱커가 보스의 방향을 제대로 잡지 못하면 딜러가 공격하기 어려웠고, 힐러의 회복이 한 박자만 늦어도 파티 전체가 무너졌습니다.
결국 중요한 것은 캐릭터 한 명의 전투력이 아니었습니다.
각자의 역할을 맡은 파티원들이 얼마나 유기적으로 움직이느냐가 공략 성공을 결정했습니다.
AI 클러스터도 비슷합니다.
많은 사람이 AI 성능을 NVIDIA GPU 한 장의 성능으로 생각하지만, ChatGPT 같은 거대한 AI 모델은 GPU 한 장으로 학습하거나 서비스할 수 없습니다. 수천 개에서 수만 개의 GPU가 역할을 나누고, 계산 결과를 끊임없이 주고받으며 하나의 거대한 컴퓨터처럼 움직여야 합니다.
오늘은 AI 데이터센터의 핵심인 AI 클러스터가 무엇인지, 여러 GPU를 왜 하나로 연결해야 하는지, 그리고 네트워크·전력·냉각까지 왜 함께 설계해야 하는지 정리해보겠습니다.
1. AI 클러스터란 무엇인가
AI 클러스터는 여러 대의 GPU 서버를 초고속 네트워크로 연결해 하나의 거대한 연산 시스템처럼 사용하는 구조입니다.
단순히 GPU가 들어간 서버를 많이 모아놓았다고 AI 클러스터가 되는 것은 아닙니다.
GPU와 서버 사이의 연결 속도, 작업을 분배하는 소프트웨어, 데이터를 공급하는 스토리지, 전력과 냉각까지 하나의 시스템으로 맞물려야 합니다.
일반 데이터센터에서는 각각의 서버가 웹사이트, 데이터베이스, 이메일, 기업 업무 시스템처럼 비교적 독립적인 일을 처리합니다. 서버 한 대가 잠시 느려져도 전체 데이터센터가 동시에 멈추는 경우는 많지 않습니다.
AI 클러스터는 다릅니다.
거대한 AI 모델을 여러 GPU에 나눠 올린 뒤 동시에 계산하기 때문에 특정 GPU나 네트워크 구간이 늦어지면 다른 GPU도 결과를 기다려야 합니다.
테라 파티에서 딜러 한 명이 계속 죽거나 힐러의 회복이 늦으면 전체 공략 속도가 떨어졌던 것처럼, AI 클러스터에서도 가장 느린 장비가 전체 성능을 끌어내릴 수 있습니다.
AI 클러스터는 GPU의 개수보다 수많은 GPU가 얼마나 정확하게 동기화되는지가 더 중요한 시스템입니다.
2. AI는 왜 GPU를 여러 개 연결해야 할까
가장 큰 이유는 AI 모델이 GPU 한 장에 담기에는 너무 커졌기 때문입니다.
대규모 언어 모델은 수천억 개 이상의 매개변수를 사용합니다. 모델의 가중치뿐 아니라 학습 과정에서 만들어지는 중간 데이터와 오차값까지 메모리에 올려야 합니다.
GPU 한 장에 탑재된 HBM 용량과 연산 성능에는 물리적인 한계가 있습니다. 따라서 모델과 데이터를 여러 GPU에 나눠 처리해야 합니다.
이 과정에는 여러 가지 병렬화 방식이 사용됩니다.
텐서 병렬화는 하나의 거대한 행렬 연산을 여러 GPU가 나눠 처리하는 방식입니다. 같은 신경망 층을 동시에 계산하기 때문에 GPU 사이의 통신 속도가 매우 중요합니다.
파이프라인 병렬화는 모델의 층을 여러 구간으로 나누고 각 GPU나 서버가 순서대로 담당하는 방식입니다. 앞 단계의 계산 결과가 다음 단계로 빠르게 넘어가야 합니다.
데이터 병렬화는 같은 모델을 여러 GPU에 복제한 뒤 서로 다른 학습 데이터를 나눠 처리하는 방식입니다. 계산이 끝나면 각 GPU의 결과를 다시 모아 가중치를 동기화합니다.
최근 많이 사용되는 MoE 모델에서는 전문가 병렬화도 중요합니다. 입력된 토큰에 따라 필요한 전문가 모듈이 달라지면서 GPU 사이의 데이터 이동이 훨씬 복잡해집니다.
결국 AI 모델이 커질수록 연산량만 늘어나는 것이 아닙니다.
GPU 사이에서 오가는 데이터도 함께 폭증합니다.
따라서 AI 클러스터의 성능은 GPU 사양만으로 결정되지 않습니다. GPU를 연결하는 네트워크와 작업을 분배하는 소프트웨어가 함께 발전해야 합니다.
3. AI 클러스터는 어떻게 구성될까
AI 클러스터는 작은 단위부터 단계적으로 확장됩니다.
가장 작은 단위는 GPU와 HBM입니다. GPU가 연산을 담당하고, HBM은 연산에 필요한 데이터를 빠르게 공급합니다.
여러 개의 GPU와 CPU, 네트워크 카드, 로컬 SSD를 하나의 섀시에 넣으면 GPU 서버가 됩니다. 일반적으로 고성능 AI 서버에는 여러 개의 GPU가 밀집 배치됩니다.
여러 GPU 서버와 네트워크 스위치, 전력 분배 장치, 냉각 매니폴드를 하나의 프레임에 넣으면 랙이 됩니다.
여러 랙을 초고속 네트워크로 연결하면 비로소 AI 클러스터가 됩니다.
여기에 대규모 병렬 스토리지와 작업 스케줄링 소프트웨어, 전력·냉각 인프라를 통합하면 하나의 AI 팩토리로 확장됩니다.
구조를 간단히 정리하면 다음과 같습니다.
GPU·HBM → GPU 서버 → 랙 → AI 클러스터 → AI 팩토리
이 구조에서 GPU 서버는 파티원 한 명과 비슷합니다. 랙은 역할별 파티를 묶어놓은 공격대 단위이고, AI 클러스터는 여러 공격대가 하나의 목표를 향해 동시에 움직이는 전체 레이드에 가깝습니다.
각 장비가 제 역할을 하더라도 서로 연결되지 않으면 전체 성능은 나오지 않습니다.
4. 스케일업과 스케일아웃의 차이
AI 클러스터의 연결 구조는 크게 스케일업과 스케일아웃으로 나뉩니다.
스케일업은 한 서버나 가까운 랙 안에 있는 GPU들을 매우 빠르게 연결하는 방식입니다.
NVIDIA의 NVLink와 NVSwitch가 대표적입니다. Blackwell 세대의 NVLink 5는 GPU당 양방향 1.8TB/s 수준의 대역폭을 제공하며, 여러 GPU가 하나의 거대한 공유 메모리 공간처럼 움직일 수 있도록 돕습니다.
스케일업은 지연시간이 매우 짧아야 합니다. GPU들이 같은 계산을 나눠 처리하기 때문에 데이터가 조금만 늦게 도착해도 다른 GPU가 기다리게 됩니다.
스케일아웃은 여러 서버와 여러 랙을 더 넓게 연결하는 방식입니다.
이 영역에서는 InfiniBand와 고성능 Ethernet이 경쟁합니다. CPU를 거치지 않고 네트워크 카드가 GPU나 서버 메모리에 직접 접근하는 RDMA 기술을 사용해 지연시간을 줄입니다.
쉽게 말하면 스케일업은 같은 파티 안의 호흡이고, 스케일아웃은 여러 파티가 함께 움직이는 공격대 운영에 가깝습니다.
AI 클러스터는 스케일업과 스케일아웃이 함께 작동해야 완성됩니다.
5. Leaf-Spine 네트워크가 필요한 이유
AI 클러스터에서는 특정 서버로 트래픽이 몰리면 안 됩니다.
그래서 서버와 스위치를 연결할 때 주로 Leaf-Spine 구조를 사용합니다.
GPU 서버는 먼저 Leaf 스위치에 연결됩니다. 모든 Leaf 스위치는 다시 상단의 모든 Spine 스위치와 연결됩니다.
이 구조에서는 한 서버에서 다른 서버로 데이터가 이동할 때 대부분 다음과 같은 고정 경로를 거칩니다.
GPU 서버 → Leaf 스위치 → Spine 스위치 → Leaf 스위치 → GPU 서버
경로가 단순하고 일정하기 때문에 지연시간을 예측하기 쉽고, 여러 경로로 트래픽을 나눌 수도 있습니다.
일반 데이터센터의 계층형 네트워크는 상위 구간으로 트래픽이 몰리면서 병목이 생기기 쉽습니다. 반면 Leaf-Spine 구조는 서버 사이의 내부 통신이 많은 AI 클러스터에 맞춰 설계됩니다.
GPU 수천 개가 같은 시점에 데이터를 주고받는 환경에서는 단순히 최대 속도가 높은 것만으로 부족합니다.
어떤 서버끼리 통신하더라도 비슷한 속도와 지연시간을 유지하는 것이 더 중요합니다.
6. InfiniBand와 Ethernet은 왜 경쟁할까
AI 클러스터의 스케일아웃 네트워크에서는 InfiniBand와 Ethernet이 경쟁하고 있습니다.
InfiniBand는 원래 고성능컴퓨팅을 위해 설계됐습니다. 패킷 손실을 줄이고 지연시간을 안정적으로 관리하는 데 강점이 있어 초기 대규모 AI 클러스터에서 많이 사용됐습니다.
하지만 NVIDIA 중심의 폐쇄적인 생태계와 높은 구축 비용은 하이퍼스케일러 입장에서 부담입니다.
Ethernet은 기존 데이터센터에서 오래 사용돼 관리가 익숙하고, 여러 회사의 장비를 조합할 수 있다는 장점이 있습니다. 과거에는 패킷 손실과 혼잡 제어 때문에 AI 학습용 네트워크로 부족하다는 평가를 받았습니다.
최근에는 상황이 달라지고 있습니다.
NVIDIA Spectrum-X, Broadcom의 고성능 스위치 ASIC, RoCE 기반 무손실 제어 기술이 발전하면서 Ethernet도 AI 백엔드 네트워크에서 빠르게 비중을 높이고 있습니다.
Dell’Oro Group은 AI 전용 백엔드 네트워크가 성장하면서 800Gbps 포트가 확산되고, 이후 1.6Tbps와 3.2Tbps로 이동할 것으로 전망합니다.
결국 경쟁의 핵심은 단순 속도가 아닙니다.
비용, 개방성, 안정성, 실제 GPU 활용률을 얼마나 높일 수 있느냐가 승부를 가릅니다.
7. 실제 AI 클러스터는 얼마나 클까
실제 하이퍼스케일러가 구축하는 AI 클러스터 규모는 이미 수십만 개의 가속기로 확대되고 있습니다.
xAI는 멤피스에 Colossus 클러스터를 구축했습니다. xAI가 공개한 초기 Colossus는 10만 개의 NVIDIA H100 GPU를 빠르게 연결한 것으로 알려졌고, 이후 H200과 Blackwell 세대로 확장하는 방향을 추진하고 있습니다.
Google은 자체 TPU와 Jupiter 네트워크를 결합한 AI Hypercomputer 구조를 운영합니다. NVIDIA GPU에 전적으로 의존하기보다 자체 가속기와 광학 스위칭 네트워크를 함께 설계하는 방식입니다.
Oracle은 OCI Supercluster를 통해 최대 수만 개 이상의 NVIDIA GPU를 고성능 RoCE 네트워크로 연결하는 구조를 제공합니다.
CoreWeave는 범용 클라우드보다 AI 연산에 집중한 네오클라우드 기업입니다. 최신 NVIDIA 랙 시스템과 InfiniBand 네트워크, 고밀도 액체냉각 시설을 결합해 AI 클러스터를 빠르게 공급하는 전략을 사용합니다.
이 사례들의 공통점은 GPU 개수만 늘리지 않는다는 것입니다.
네트워크, 전력, 냉각, 스토리지까지 동시에 확장합니다.
AI 클러스터 증설은 GPU 구매가 아니라 하나의 거대한 시스템을 새로 건설하는 작업입니다.
8. AI 클러스터의 가장 큰 병목
첫 번째 병목은 전력입니다.
수십만 개의 GPU를 연결한 클러스터는 수백MW에서 GW 단위의 전력을 요구할 수 있습니다. 하지만 전력망 연결 허가와 변전 인프라 구축에는 수년이 걸립니다.
두 번째 병목은 냉각입니다.
NVIDIA GB200 NVL72 같은 고밀도 시스템은 랙당 120kW를 넘는 전력을 사용합니다. 기존 공랭식 데이터센터에 그대로 설치하기 어렵고, 콜드 플레이트와 CDU, 매니폴드가 포함된 액체냉각 구조가 필요합니다.
세 번째 병목은 가장 느린 장비입니다.
AI 학습은 여러 GPU가 결과를 동시에 맞춰야 합니다. 특정 GPU가 발열로 성능이 낮아지거나 네트워크 지연이 발생하면 나머지 GPU도 기다립니다. 이런 장비를 Straggler, 즉 낙오자라고 부릅니다.
게임에서도 파티원 한 명이 계속 패턴을 놓치면 전체 공략이 늦어지는 것처럼, AI 클러스터에서도 가장 느린 노드가 전체 GPU 활용률을 떨어뜨릴 수 있습니다.
그래서 AI 클러스터 운영에서는 GPU 수보다 실제 가동률과 동기화 효율이 중요합니다.
9. 투자자는 GPU 다음을 봐야 합니다
AI 클러스터를 이해하면 투자 대상도 넓어집니다.
GPU에서는 NVIDIA와 AMD가 중요합니다. 하지만 GPU 수가 늘어날수록 네트워크 스위치와 광통신 부품의 필요량도 함께 증가합니다.
Broadcom과 Marvell은 고성능 Ethernet 스위치 ASIC과 광통신 반도체에서 중요한 위치를 차지합니다. Arista Networks는 하이퍼스케일 데이터센터용 Ethernet 스위치 장비에서 강점을 갖고 있습니다.
액체냉각이 확대되면 Vertiv와 Schneider Electric 같은 전력·냉각 인프라 기업도 중요해집니다.
Dell’Oro Group은 글로벌 데이터센터 물리 인프라 시장이 2029년 631억 달러 규모에 이를 것으로 전망했고, 직접 액체냉각 시장은 2024년 약 11억 달러에서 2029년 58억 달러 규모로 확대될 수 있다고 봤습니다.
Synergy Research Group은 하이퍼스케일러가 차지하는 글로벌 데이터센터 용량 비중이 2025년 말 48%에서 2031년 67%까지 커질 수 있다고 전망합니다.
AI 클러스터가 커질수록 GPU만 성장하는 것이 아닙니다.
네트워크, 광통신, 전력, 냉각, 데이터센터 부지까지 전체 인프라의 가치가 함께 올라갑니다.
10. 결론: 가장 강한 GPU보다 완성된 파티가 중요합니다
테라에서 창기사를 키울 때 제가 해야 할 일은 보스의 어그로를 잡고 파티원이 안정적으로 공격할 수 있는 환경을 만드는 것이었습니다.
탱커 혼자 강하다고 공략에 성공하는 것은 아니었습니다.
딜러가 충분한 피해를 넣고, 정령사와 사제가 체력과 버프를 관리하며, 모든 파티원이 같은 패턴에 맞춰 움직여야 보스를 잡을 수 있었습니다.
AI 클러스터도 같습니다.
GPU가 아무리 빨라도 HBM이 데이터를 공급하지 못하면 기다려야 합니다. 네트워크가 느리면 다른 GPU의 계산 결과를 기다립니다. 전력이 흔들리면 시스템이 멈추고, 냉각이 부족하면 GPU 성능이 낮아집니다.
AI 클러스터는 가장 강한 GPU를 모아놓은 시설이 아니라, 수천 개의 GPU와 서버, 네트워크, 전력, 냉각이 하나의 파티처럼 움직이는 거대한 가상 슈퍼컴퓨터입니다.
AI 시대의 경쟁은 GPU 한 장의 성능을 넘어섰습니다.
이제는 누가 더 많은 GPU를 확보하느냐보다, 그 GPU를 얼마나 효율적으로 연결하고 실제 연산에 활용하느냐가 중요합니다.
다음 글에서는 이런 AI 클러스터와 랙을 실제로 수용하는 AI 데이터센터를 구축하는 데 얼마나 많은 비용이 필요한지 정리해보겠습니다.
[AI 데이터센터 관련글 보기]
[이전글] : AI 데이터센터 구조 완전 정리, 서버·GPU·전력·냉각은 어떻게 연결될까?
https://www.hanvelog.com/2026/07/ai-data-center-architecture.html
#AI클러스터 #GPU클러스터 #AI데이터센터 #AI인프라 #NVIDIA #GPU서버 #NVLink #InfiniBand #Ethernet #SpectrumX #AI네트워크 #액체냉각 #데이터센터전력 #하이퍼스케일 #AI팩토리
댓글
댓글 쓰기