AMD Claims EPYC "Venice" Beats NVIDIA Vera by 2.24x in New White Paper.
AMD, EPYC ‘Venice’가 NVIDIA Vera보다 2.24배 빠르다고 주장
AMD는 백서에서 256코어 EPYC 9996 ‘Venice’가 NVIDIA의 88코어 Vera보다 SPECrate 2026 정수 성능이 2.24배 높다고 밝혔습니다. 다만 스레드 수와 컴파일러 버전이 달라 직접 비교하기 어렵고, 독립적인 실측 결과가 나오기 전까지는 AMD 측 추정치로 봐야 합니다.
- 주제
AI 요약
AMD가 6세대 EPYC 9006 ‘Venice’ 서버 CPU 백서를 공개하고 NVIDIA Vera와의 성능을 비교했습니다. 공개된 수치는 AMD와 NVIDIA의 자료를 바탕으로 한 추정치입니다. 공식 SPEC 결과가 나오지 않은 만큼 실제 성능으로 확정해서 받아들이기는 어렵습니다.
AMD가 공개한 성능 주장
AMD는 256코어 EPYC 9996이 88코어 Vera 시스템보다 SPECrate 2026 Integer에서 플랫폼 전체 성능이 2.24배 높다고 주장합니다. 96코어 고클럭 Venice 제품은 코어당 성능에서 Vera보다 1.2배 빠르다고 제시했습니다. 이 96코어 제품은 EPYC 9996에서 일부 코어를 끈 구성입니다.
Intel Xeon 6980P와 비교한 서버 측 Java, OpenSSL, MongoDB, Redis, NGINX, 트랜잭션 처리 테스트에서는 2.4~3.7배 성능 향상을, GROMACS 같은 HPC 테스트에서는 최대 3.13배 향상을 주장했습니다.
비교 수치의 한계
Vera 성능 수치는 NVIDIA 자체 백서에서 가져왔습니다. AMD 테스트에는 GCC 16.1을, NVIDIA 테스트에는 GCC 15.2를 사용했습니다. Tom’s Hardware는 서로 다른 컴파일러 버전으로 측정한 점이 바람직한 비교 방식은 아니라고 지적했습니다. 또 2.24배 수치는 스레드 512개인 AMD의 최상위 제품과 스레드 176개인 Vera를 비교한 결과라 같은 조건의 대결이 아닙니다.
AMD는 Venice가 양산 중이며, 주요 OEM 플랫폼 출시를 준비하고 클라우드 업체들도 연내 배치를 시작한다고 밝혔습니다. 두 제품을 같은 환경에서 테스트한 독립 리뷰가 나와야 성능 차이를 가늠할 수 있습니다.
Reddit 반응
- @u/EloquentPinguin — Phoronix 같은 곳이나 다른 제3자가 그 시스템을 직접 테스트할 때까지 기다리겠습니다. AMD가 성능 전망을 많이 이야기했지만, 일단 결과를 더 지켜보죠.
- @u/HLumin — 타당한 말입니다.
- @u/Seanspeed — AMD가 Zen 6를 ‘출시’했다고 발표하고 제품을 곧 출하한다고 말했지만, 아키텍처 자체에 관해서는 여전히 거의 설명하지 않았습니다. 보통 이 시점에는 지금보다 훨씬 많은 정보를 공개했는데, 이상하다고 봅니다. 여기서 AMD가 주장하는 것은 256코어 Zen 6c 9996이 88코어 Vera보다 총 성능이 2.24배 높다는 내용입니다. 풀 구성 Zen 6인 96코어 제품은 단일 코어 성능이 1.2배라고 했습니다.
- @u/Geddagod — 경쟁 제품을 포함한 SPECint rate 2026 비교는 흥미롭습니다. AMD는 Zen 6 발표 자료에는 넣었던 ARM AGI CPU를 백서에서는 뺀 것 같습니다. Graviton 5 CPU가 AMD 자료에서 약하게 나온 점도 놀랍습니다. 192개의 Neoverse V3 코어가 192개의 Zen 5C 코어에 50% 넘게 뒤진다면, 클럭이나 전력이 크게 제한된 게 아닐까 싶습니다. Venice가 Vera보다 코어당 20% 빠르다는 주장도 큰 차이지만, 아키텍처와 공정 중 어느 쪽에서 얼마나 기여했는지도 궁금합니다.
- @u/Sopel97 — Neoverse는 SIMD 작업에서 정말 약합니다. Stockfish 테스트를 보세요. SIMD가 적은 거의 같은 작업인 asmfish와 비교하면 경쟁 제품보다 2~3배 차이가 납니다. Apple Silicon에서도 비슷한 문제가 있습니다.
- @u/Geddagod — SIMD 구성이 약한 ARM 코어도 SPECint 2026과 2017 단일 코어 테스트에서는 꽤 잘 나옵니다. 그래서 예상과 AMD 주장 사이의 차이를 SIMD만으로 설명하기는 어렵다고 봅니다.
- @u/iBoMbY — 이 결과는 전통적인 작업 위주입니다. AI 관련 작업에서는 다른 결과가 나올 수 있습니다. 주장은 대체로 맞을 수도 있지만 실제 상황에서는 그다지 중요하지 않을 수 있습니다. 마케팅이라고 부르는 이유입니다.
- @u/From-UoM — NVIDIA의 실제 하드웨어 강점은 CPU나 GPU가 아니라 NVLink와 확장형 이더넷·InfiniBand입니다. Vera CPU는 NVLink C2C로 Rubin GPU 하나 또는 다른 Vera와 1,800GB/s로 연결됩니다. EPYC Venice는 PCIe 표준을 사용합니다. Helios 시스템에서는 CPU와 GPU 사이 연결이 각각 256GB/s에 그칩니다. 이 부분에서 Vera Rubin 시스템이 앞설 겁니다.
- @u/Psyclist80 — AMD는 CPU와 GPU 연결에 PCIe 6.0을 사용하므로 링크 속도는 256GB/s입니다. Helios는 NVIDIA보다 GPU 간 연결 속도를 우선해 3.6TB/s를 제공하며, NVIDIA의 1.8TB/s보다 두 배 빠릅니다. 두 시스템 토폴로지의 차이를 설명한 좋은 글도 있습니다.
- @u/From-UoM — 정정해줘서 감사합니다. PCIe 6.0이라는 점을 잊었습니다. 그래도 NVLink C2C보다 느리고 지연 시간도 깁니다. AMD는 Helios GPU 간 연결에 정식 UALink가 아니라 이더넷 프로토콜을 얹은 UALoE를 사용합니다. 정정하자면 Vera CPU는 1.8TB/s NVLink C2C, Rubin은 3.6TB/s NVLink 6, MI445X는 3.6TB/s UALoE를 사용합니다.
- @u/egnegn1 — 추론과 학습 대부분이 GPU에서 진행된다면 CPU와 GPU 간 연결은 그다지 중요하지 않습니다. NVLink는 GPU끼리 통신할 때 중요합니다.
- @u/From-UoM — 에이전트형 작업에서는 CPU와 GPU 간 빠른 통신이 큰 이점입니다. 주요 기업들이 NVLink Fusion을 선택하는 이유가 있습니다.
- @u/egnegn1 — 에이전트형 작업에서 CPU와 GPU 사이에 대역폭이 많이 필요한 경우가 어디 있나요? 추론 중 옮기는 데이터에 비하면 프롬프트 데이터는 PCIe로도 충분히 빠르게 보낼 수 있습니다. 생성 결과도 마찬가지입니다.
- @u/From-UoM — 시스템 RAM에 KV 캐시를 많이 저장하는 경우에는 그렇지 않습니다.
- @u/egnegn1 — 활성 세션의 KV 캐시는 VRAM에 있고, 이후 단계적으로 낮은 계층으로 옮겨져 마지막에는 콜드 스토리지에 들어갑니다. GB 단위 KV 캐시도 일반 PCIe로 비동기 로드하면 1초가 채 걸리지 않습니다. GPU가 KV 캐시에 직접 접근하게 하는 건 연산 자원을 낭비합니다.
- @u/From-UoM — 사용자 한 명만 고려하고 있습니다. 예를 들어 GB200 NVL72 랙 하나가 동시에 만 명 넘는 사용자를 처리할 수 있습니다. 수요가 쌓이면 CPU와 GPU 간 연결 속도가 얼마나 중요해지는지 알 수 있습니다.
원문: TechPowerUp / 번역·요약: Trawling