UALink는 NVLink를 대체할 수 있을까? AI 인터커넥트 경쟁의 시작
저는 최근 집을 이사하면서 인터넷 회선을 바꿨습니다.
이전 집에서는 100Mbps 광랜을 사용했는데, 새집으로 오면서 500Mbps 상품으로 바꿨습니다. 당연히 인터넷이 훨씬 빨라질 것이라고 생각했습니다.
실제로 데스크톱에 랜선을 직접 연결해서 속도를 측정해보면 500Mbps에 가까운 속도가 나왔습니다. 그런데 이상하게도 휴대폰으로 유튜브 4K 영상을 보면 가끔 끊기고, 다운로드 속도도 생각보다 나오지 않았습니다.
처음에는 통신사 회선 문제라고 생각했습니다.
그런데 원인은 인터넷 회선이 아니었습니다.
공유기가 너무 오래된 모델이라 최신 Wi-Fi 속도를 제대로 받쳐주지 못하고 있었습니다.
인터넷 회선은 빨라졌지만, 그 속도를 집 안에 뿌려주는 장비가 병목이 된 것입니다. 이후 신형 공유기로 바꾸고 나서야 휴대폰에서도 속도가 제대로 나오기 시작했습니다.
AI 데이터센터도 비슷합니다.
GPU 성능은 계속 올라가고 있습니다. HBM도 더 빨라지고 있습니다. 하지만 GPU 여러 개를 서로 빠르게 연결하지 못하면 전체 시스템 성능은 크게 떨어질 수밖에 없습니다.
AI 시대에는 GPU 하나의 성능만큼이나 GPU와 GPU를 연결하는 기술이 중요해졌습니다.
그 중심에 NVIDIA의 NVLink가 있습니다. 그리고 이 독점 구조에 맞서 AMD, Intel, Meta, Microsoft, Google, AWS 등이 힘을 합쳐 만든 개방형 표준이 UALink입니다.
오늘은 UALink가 왜 등장했는지, NVLink와 무엇이 다른지, 그리고 정말 NVIDIA의 독점적 인터커넥트 생태계를 흔들 수 있을지 정리해보겠습니다.
1. AI 서버에서 연결이 중요한 이유
AI 서버는 GPU 한 개의 성능보다 여러 GPU를 얼마나 효율적으로 연결하느냐가 더 중요해지고 있습니다.
대규모 AI 모델을 학습하거나 추론할 때는 여러 개의 GPU가 하나의 거대한 시스템처럼 움직여야 합니다. 모델의 일부는 한 GPU에 있고, 다른 일부는 다른 GPU에 있습니다. 계산 중간 결과도 계속 주고받아야 합니다.
이때 GPU 사이의 연결이 느리면 어떤 일이 생길까요?
한 GPU는 계산을 끝냈는데, 다른 GPU에서 데이터가 아직 오지 않으면 기다려야 합니다. 결국 비싼 GPU가 놀게 됩니다.
데이터센터에서 가장 비싼 장비가 GPU인데, 연결이 느려 GPU가 대기한다면 전체 투자 효율은 크게 떨어집니다.
Spheron은 700억 개 매개변수를 가진 모델을 8개의 가속기로 분산 학습할 때 BF16 기준으로 매 단계 약 245GB의 데이터가 가속기 사이를 오가야 한다고 설명했습니다.
이 정도 데이터가 반복적으로 움직이면 연결 속도는 단순 부품 스펙이 아닙니다.
AI 데이터센터의 연결 구조는 크게 두 단계로 나뉩니다.
첫째는 랙 내부 또는 단일 서버 노드 안에서 GPU끼리 연결하는 스케일업입니다.
둘째는 여러 랙과 여러 데이터센터 노드를 연결하는 스케일아웃입니다.
Ethernet과 InfiniBand가 스케일아웃에서 중요하다면, NVLink와 UALink는 스케일업 영역에서 중요한 기술입니다.
이번 글의 핵심은 바로 이 스케일업 연결입니다.
2. NVLink는 NVIDIA 생태계의 핵심 무기입니다
NVIDIA가 AI GPU 시장에서 강한 이유는 GPU 성능만이 아닙니다.
CUDA, HBM, CoWoS, NVSwitch, NVLink가 하나의 시스템으로 묶여 있기 때문입니다. 이 중 NVLink는 NVIDIA GPU 여러 개를 하나의 거대한 AI 가속기처럼 동작하게 만드는 전용 인터커넥트 기술입니다.
단순히 데이터를 주고받는 선이 아닙니다. GPU끼리 메모리를 빠르게 공유하고, 학습 과정에서 발생하는 막대한 데이터를 매우 낮은 지연시간으로 교환할 수 있도록 설계된 기술입니다.
기존 PCIe만으로는 AI GPU 간 통신을 감당하기 어렵습니다. PCIe Gen5 x16의 양방향 대역폭은 128GB/s 수준입니다. 반면 NVIDIA의 NVLink는 세대가 올라갈수록 대역폭을 크게 끌어올렸습니다.
Spheron은 NVIDIA H100/H200에 적용된 NVLink 4.0이 가속기당 900GB/s 대역폭을 제공한다고 설명했습니다. Blackwell 세대의 NVLink 5.0은 가속기당 1.8TB/s까지 올라갑니다. Barrack.ai는 Rubin 세대의 NVLink 6.0이 가속기당 3.6TB/s 수준으로 다시 두 배 확대될 것으로 봤습니다.
NVSwitch도 중요합니다.
NVSwitch는 여러 GPU를 하나의 초고속 스위치로 연결해주는 전용 허브 역할을 합니다. GPU가 많아질수록 단순한 점대점 연결만으로는 한계가 생기기 때문에, NVSwitch가 GPU 사이의 데이터를 효율적으로 나눠주고 묶어주는 역할을 합니다.
GIGABYTE는 Vera Rubin NVL72 랙 시스템에서 단일 랙 패브릭 대역폭이 260TB/s 수준에 도달한다고 제시했습니다. 수십 개 GPU가 사실상 하나의 거대한 GPU처럼 동작하는 수준입니다.
500Mbps 인터넷도 오래된 공유기를 쓰면 제 성능이 나오지 않는 것처럼, AI GPU도 연결 기술이 받쳐주지 못하면 연산 성능을 제대로 활용할 수 없습니다.
3. UALink는 왜 등장했나
UALink는 Ultra Accelerator Link의 약자입니다.
핵심은 간단합니다.
NVIDIA의 독점 인터커넥트에 의존하지 않고, 여러 회사의 AI 가속기를 함께 연결하기 위한 개방형 스케일업 표준입니다.
UALink도 목적은 NVLink와 비슷합니다. 여러 개의 AI 가속기를 하나의 거대한 시스템처럼 연결하는 것입니다. 다만 NVIDIA GPU 중심으로 움직이는 NVLink와 달리, UALink는 AMD GPU, Intel 가속기, 커스텀 ASIC 등 서로 다른 가속기도 연결할 수 있는 개방형 표준을 목표로 합니다.
하이퍼스케일러 입장에서는 NVIDIA 시스템이 강력하다는 것을 모르는 게 아닙니다. 문제는 비용과 선택권입니다. NVIDIA GPU, NVLink, NVSwitch, CUDA까지 한 번에 묶이면 성능은 좋지만 고객사는 NVIDIA 생태계 안에 깊게 묶입니다.
EEWorld는 NVIDIA가 FY2025 기준 매출총이익률 75.5%, 순이익률 57%를 기록했다고 설명했습니다. 이 높은 수익성은 NVIDIA의 강력한 시장 지배력을 보여주는 동시에, 고객사 입장에서는 비용 부담이 크다는 뜻이기도 합니다.
그래서 Microsoft, Google, Meta, AWS 같은 하이퍼스케일러들은 자체 ASIC을 키우고 있습니다. 하지만 자체 칩을 만들어도 문제가 남습니다. 이 칩들을 랙 안에서 빠르게 연결할 표준이 필요합니다.
Design & Reuse는 UALink Consortium이 2024년 10월 공식 법인으로 출범했고, AMD, Intel, Meta, Google, Microsoft, AWS, Cisco, HPE, Astera Labs 등이 이사회 멤버로 참여했다고 전했습니다. 이후 Apple, Alibaba Cloud, Synopsys 등이 합류하며 회원사가 75개 이상, 이후 115개 이상으로 확대됐습니다.
UALink 1.0의 목표는 단일 컴퓨팅 포드 안에서 최대 1,024개의 가속기를 초저지연으로 연결하는 것입니다.
즉 UALink는 단순한 기술 프로젝트가 아닙니다.
NVIDIA 중심 AI 인프라 독점을 견제하려는 빅테크와 반도체 기업들의 공동 대응입니다.
4. UALink는 NVLink와 무엇이 다른가
NVLink는 NVIDIA가 만든 독점 기술입니다. NVIDIA GPU, NVSwitch, CUDA 소프트웨어와 함께 움직입니다. 성능과 완성도는 뛰어나지만, 생태계가 닫혀 있습니다.
반면 UALink는 개방형 표준을 목표로 합니다. AMD GPU, Intel 가속기, 커스텀 ASIC, 다양한 서버 업체가 함께 사용할 수 있는 구조를 지향합니다.
UALink Consortium은 UALink 1.0이 물리 계층, 데이터 링크 계층, 트랜잭션 계층, 프로토콜 계층으로 나뉜 구조라고 설명합니다. 기존 Ethernet 물리 계층 자산을 활용할 수 있도록 설계된 점도 특징입니다.
쉽게 말하면 UALink는 GPU와 가속기들이 서로의 메모리 공간에 더 빠르고 일관성 있게 접근할 수 있도록 만든 통신 규칙입니다. 일반 네트워크처럼 멀리 떨어진 장비를 연결하는 목적이 아니라, 랙이나 포드 안에서 가까운 가속기끼리 최대한 짧은 지연시간으로 데이터를 주고받게 만드는 것이 핵심입니다.
SemiEngineering은 UALink가 일반 Ethernet보다 훨씬 가벼운 전송 구조를 지향한다고 설명했습니다. 일반 Ethernet은 IP/UDP 헤더 등 부가 구조가 붙지만, UALink는 가속기 간 짧은 거리 통신에 맞춰 오버헤드를 줄입니다.
Tom's Hardware는 UALink가 실제 워크로드에서 약 95% 수준의 프로토콜 대역폭 효율을 목표로 한다고 설명했습니다. UALink Consortium 백서는 왕복 지연시간 목표를 1마이크로초 미만으로 제시했습니다.
사양만 놓고 보면 UALink도 강력합니다.
UALink 1.0은 가속기당 800GB/s 대역폭을 목표로 합니다. NVIDIA Blackwell의 NVLink 5.0은 가속기당 1.8TB/s, Rubin의 NVLink 6.0은 3.6TB/s 수준으로 거론됩니다.
절대 성능에서는 NVLink가 앞서 있습니다.
하지만 UALink의 강점은 다른 곳에 있습니다.
UALink는 성능의 최고점보다 생태계의 개방성과 비용 절감, 그리고 이종 가속기 연결을 목표로 합니다.
정리하면 이렇습니다.
NVLink는 NVIDIA 전용 고성능 고속도로입니다. UALink는 여러 회사가 함께 쓸 수 있는 개방형 고속도로를 만들려는 시도입니다.
5. Broadcom 이탈이 보여주는 복잡한 전선
UALink 진영이 하나의 깔끔한 반NVIDIA 연합처럼 보일 수 있지만, 실제로는 내부 이해관계가 복잡합니다.
가장 상징적인 사건이 Broadcom의 이사회 이탈입니다.
TrendForce는 Broadcom이 2025년 하반기 UALink Consortium 이사회에서 사임했다고 전했습니다. Broadcom은 UALink 대신 OCP 내부의 ESUN, 즉 Ethernet for Scale-Up Networking 진영에 힘을 싣고 있습니다.
이유는 분명합니다.
Broadcom은 Ethernet 스위치 시장의 강자입니다. 완전히 새로운 비Ethernet 규격보다, 기존 Ethernet 생태계를 고성능 AI 스케일업 영역으로 확장하는 쪽이 자사에 유리합니다.
쉽게 말하면 Broadcom은 완전히 새로운 인터커넥트를 만드는 것보다 기존 Ethernet을 AI 서버용으로 발전시키는 전략을 선택한 것입니다.
이 장면은 중요합니다.
AI 스케일업 인터커넥트 경쟁은 단순히 NVLink 대 UALink가 아닙니다.
실제로는 세 갈래입니다.
첫째, NVIDIA의 독점 고성능 NVLink.
둘째, AMD와 Intel, 하이퍼스케일러 중심의 UALink.
셋째, Broadcom이 주도하려는 Ethernet 기반 ESUN/SUE입니다.
AI 인터커넥트 전쟁은 개방형 대 독점의 싸움이면서, 동시에 어떤 개방형 표준이 살아남을 것인가의 싸움이기도 합니다.
6. AMD Helios는 첫 번째 시험대입니다
UALink가 실제 시장에서 의미를 가지려면 말이 아니라 제품이 나와야 합니다.
그 첫 번째 시험대가 AMD의 Helios입니다.
MLQ.ai는 AMD가 CDNA 5 기반 Instinct MI455X 72개를 단일 랙으로 묶은 Helios 시스템을 공개했다고 설명했습니다. Helios는 가속기당 432GB HBM4를 탑재하고, 랙 전체로는 약 31TB의 고속 메모리 풀을 구성하는 구조입니다.
HPE는 Helios가 Broadcom과 HPE Juniper의 Ethernet 기술을 활용한 UALink-over-Ethernet, 즉 UALoE 패브릭을 사용한다고 밝혔습니다. 이는 완전한 전용 UALink 스위치 칩이 성숙하기 전까지 Ethernet 기반 기술을 활용해 과도기적으로 스케일업 연결을 구현하는 방식입니다.
MLQ.ai는 AMD Helios가 2026년 하반기 초기 검증 모델 생산에 들어가고, 2027년 2분기부터 글로벌 하이퍼스케일러 데이터센터에 본격 공급될 예정이라고 설명했습니다.
쉽게 말하면 Helios는 AMD가 NVIDIA DGX와 정면 승부를 걸기 위해 준비한 첫 번째 랙 단위 AI 시스템입니다.
UALink가 NVIDIA를 위협하려면 AMD Helios 같은 실제 랙 시스템에서 성능과 안정성을 증명해야 합니다.
스펙만으로는 부족합니다.
하이퍼스케일러가 원하는 것은 발표용 표준이 아니라 실제 데이터센터에서 안정적으로 돌아가는 장비입니다.
7. NVIDIA 독점은 쉽게 무너지지 않는다
UALink가 등장했다고 해서 NVIDIA의 독점이 바로 무너진다고 보기는 어렵습니다.
NVIDIA의 강점은 NVLink 하나가 아닙니다.
NVIDIA는 GPU, HBM 패키징, NVLink, NVSwitch, Spectrum-X, CUDA, NCCL까지 하나의 스택으로 묶습니다. 고객 입장에서 비싸지만, 빠르게 구축하고 안정적으로 운영할 수 있다는 장점이 큽니다.
Barrack.ai는 Rubin 세대 NVLink 6.0이 가속기당 3.6TB/s 대역폭을 목표로 한다고 설명했습니다. NVIDIA는 여기서 멈추지 않고 Spectrum-X Ethernet Photonics, BlueField-4 DPU, NVLink Fusion까지 확장하고 있습니다.
Techstrong.ai는 NVIDIA의 NVLink Fusion이 외부 CPU와 맞춤형 반도체까지 NVLink 생태계에 연결할 수 있도록 문을 일부 열었다고 설명했습니다. TrendForce는 NVIDIA가 OCP와 ESUN에도 참여하고 있다고 전했습니다.
즉 NVIDIA는 폐쇄형 생태계를 유지하면서도, 필요할 때는 일부 개방형 흐름에 발을 걸치고 있습니다.
이 전략은 매우 현실적입니다.
하이엔드 학습 시장은 NVLink와 CUDA로 지키고, 범용 인프라와 하위 시장에서는 개방형 표준과도 협력하는 방식입니다.
NVIDIA 독점은 흔들릴 수는 있지만, 단기간에 무너질 가능성은 낮습니다.
8. 투자자는 어디를 봐야 할까
투자 관점에서 UALink 글의 핵심은 단순히 “NVIDIA가 위험하다”가 아닙니다.
더 중요한 질문은 이것입니다.
AI 인터커넥트 표준 전쟁에서 누가 돈을 버는가?
첫째는 여전히 NVIDIA입니다.
NVIDIA는 하이엔드 AI 학습 시장에서 가장 강한 생태계를 갖고 있습니다. 주요 기업별 지표에서 NVIDIA는 하이엔드 AI 가속기 시장 점유율 80% 이상을 유지하는 기업으로 제시됩니다.
둘째는 AMD입니다.
AMD는 UALink를 실제 랙 시스템에 적용할 가장 중요한 하드웨어 플레이어입니다. Helios가 2027년 실제 하이퍼스케일러 데이터센터에 들어가 성능을 입증하면, AMD는 NVIDIA 대안으로서 더 강한 평가를 받을 수 있습니다.
셋째는 Broadcom입니다.
Broadcom은 UALink 이사회에서는 빠졌지만, ESUN/SUE를 통해 Ethernet 기반 스케일업 시장을 노리고 있습니다. BigGo의 금융 데이터는 Broadcom의 Q2 AI 반도체 매출이 108억 달러, 전년 대비 143% 증가했다고 제시했습니다.
넷째는 Marvell과 Astera Labs입니다.
Marvell은 XConn을 5억4천만 달러에 인수하며 고속 인터커넥트 IP를 강화하고 있습니다. Astera Labs IR은 분기 매출이 전년 동기 대비 93% 성장했다고 제시했습니다. 두 기업 모두 AI 서버 내부 연결이 복잡해질수록 주목받을 수 있는 연결 인프라 기업입니다.
투자자는 NVLink와 UALink를 단순 기술 경쟁으로 보면 안 됩니다.
이 경쟁은 GPU 시장, ASIC 시장, Ethernet 스위치 시장, 광통신, 리타이머, 랙 서버 시장까지 이어지는 AI 인프라 밸류체인 재편입니다.
9. 결론
집 인터넷을 500Mbps로 바꿨는데도 휴대폰 속도가 느렸던 이유는 회선이 아니라 공유기였습니다.
AI 데이터센터도 마찬가지입니다.
GPU가 아무리 빨라도, HBM이 아무리 좋아도, GPU와 GPU를 연결하는 인터커넥트가 느리면 전체 시스템은 제 성능을 내지 못합니다.
NVIDIA는 이 문제를 오래전부터 이해했고, NVLink와 NVSwitch를 통해 AI 서버 내부 연결을 장악했습니다. Spheron은 Blackwell 세대 NVLink 5.0이 가속기당 1.8TB/s 대역폭을 제공한다고 설명했고, Barrack.ai는 Rubin 세대 NVLink 6.0이 3.6TB/s까지 확대될 것으로 봤습니다.
UALink는 이 독점 구조에 도전하는 개방형 표준입니다.
UALink Consortium은 1.0 규격에서 최대 1,024개 가속기 연결과 1마이크로초 미만 지연시간을 목표로 제시했습니다. 하지만 실제 상용 시장에서는 AMD Helios, Broadcom의 ESUN/SUE, NVIDIA의 NVLink Fusion이 함께 경쟁하게 될 가능성이 큽니다.
그래서 결론은 단순하지 않습니다.
UALink가 NVLink를 당장 대체할 가능성은 높지 않습니다.
최고 성능의 대규모 학습 클러스터는 당분간 NVIDIA NVLink 생태계가 강할 것입니다. 반면 하이퍼스케일러의 자체 ASIC, AMD 기반 랙 시스템, 비용 효율이 중요한 추론 인프라에서는 UALink와 Ethernet 기반 스케일업 기술이 점점 더 중요한 선택지가 될 수 있습니다.
투자자 입장에서는 NVIDIA만 볼 것이 아니라 연결 생태계 전체를 봐야 합니다.
AI 반도체 경쟁이 GPU 성능 경쟁이었다면, 앞으로는 GPU를 연결하는 생태계 경쟁으로 무게중심이 이동할 가능성이 큽니다.
AI 인프라의 다음 경쟁은 GPU를 얼마나 빠르고 효율적으로 연결하느냐에서 시작되고 있습니다.
AI 반도체 관련 글 이어보기
[이전글 보기] : HBM4는 왜 중요한가? Rubin 시대 AI 메모리 경쟁의 시작
https://www.hanvelog.com/2026/06/why-hbm4-matters.html
[다음글 보기] : 광반도체(CPO)란 무엇인가? AI 데이터센터가 빛으로 연결되는 이유
https://www.hanvelog.com/2026/06/what-is-cpo-ai-data-center-silicon-photonics.html
#UALink #NVLink #NVIDIA #AMD #Broadcom #AI반도체 #AI인프라 #데이터센터 #인터커넥트 #반도체투자
댓글
댓글 쓰기