MLPerf 벤치마크 완벽 가이드: AI 하드웨어 ‘진짜 성능’ 확인하는 법 (최신 v4.0 결과 분석 포함)

MLPerf 벤치마크 완벽 가이드: AI 하드웨어 ‘진짜 성능’ 확인하는 법 (최신 v4.0 결과 분석 포함)

모든 AI 칩 제조사가 ‘가장 빠르다’고 주장합니다. 그렇다면 객관적인 승자는 누구일까요? 업계 유일의 표준, MLPerf가 그 답을 제공합니다. AI 및 머신러닝 하드웨어의 성능을 평가하는 것은 꽤 복잡한 작업이죠. 제조사가 제시하는 ‘홍보용’ 수치만으로는 전체 그림을 파악하기 어렵습니다.

이 글은 단순히 정보를 나열하는 대신, AI 인프라 벤치마킹에 대한 심층적인 분석을 바탕으로 MLPerf가 무엇인지, 왜 업계 표준으로 자리 잡았는지를 명확히 설명합니다. 단순한 정의를 넘어, 최신 MLPerf v4.0 벤치마크 데이터를 통해 Nvidia, Intel, Google 등 주요 기업들의 주력 칩 성능을 ‘학습’과 ‘추론’이라는 두 가지 핵심 시나리오별로 심층 비교 분석합니다.

이 글의 목표는 여러분이 복잡한 벤치마크 데이터를 스스로 해석하는 ‘안목’을 갖추게 하고, 이를 바탕으로 자신의 AI 워크로드에 가장 적합한 하드웨어를 정보에 입각해 선택할 수 있도록 실질적인 가이드를 제공하는 것입니다.

MLPerf란 무엇인가? AI 업계의 ‘수능 시험’

MLPerf의 탄생 배경과 MLCommons의 역할

2018년 이전만 해도 AI 하드웨어 시장은 ‘사과와 오렌지’를 비교하는 것과 같았습니다. 각 제조사가 자사의 하드웨어에 유리하도록 설계된 자체 벤치마크 결과를 발표했기 때문이죠. 이는 특정 모델, 특정 데이터셋에만 고도로 최적화되어 있어, 고객 입장에서 객관적인 성능 비교가 사실상 불가능했습니다.

이러한 혼란을 잠재우기 위해 MLCommons라는 비영리 컨소시엄이 등장했습니다.

  • 핵심 사실: MLCommons는 Google, Intel, Nvidia, Microsoft, AMD, Arm, Meta, Baidu 등 120개 이상의 학계 및 업계 주요 회원사로 구성된 독립적인 단체입니다.
  • 핵심 목표: 공정하고, 재현 가능하며(reproducible), 실제 사용 사례를 반영하는 머신러닝(ML) 시스템 성능 벤치마크 표준을 확립하는 것입니다. MLPerf는 바로 이 MLCommons가 주관하는 핵심 벤치마크 프로젝트입니다.

왜 MLPerf가 유일한 ‘표준’으로 인정받는가?

MLPerf가 이렇게 빠르게, 그리고 유일한 업계 표준으로 자리 잡은 데에는 몇 가지 분명한 이유가 있습니다.

  • 신뢰성 (E-E-A-T): 모든 벤치마크 결과는 동료 검토(Peer-reviewed)를 거칩니다. 특히 ‘폐쇄 부문(Closed Division)’에서는 모든 참가자가 동일한 모델과 동일한 규칙을 따라야 하므로, 결과의 공정성과 신뢰성이 매우 높습니다.
  • 포괄성 (Comprehensiveness): MLPerf는 단 하나의 테스트가 아닙니다. 실제 산업 현장에서 가장 많이 사용되는 다양한 AI 워크로드를 폭넓게 포괄합니다.
    • 주요 워크로드 예시:
    • 이미지 분류 (ResNet-50)
    • 객체 탐지 (RetinaNet)
    • 자연어 처리 (BERT)
    • 추천 시스템 (DLRM)
    • 대규모 언어 모델 (GPT-3 175B, Llama 2 70B)
    • 생성 AI (Stable Diffusion XL)
  • 다양한 벤치마크 스위트: 사용 사례에 따라 벤치마크가 잘 세분화되어 있습니다.
    • MLPerf Training: AI 모델 ‘학습’ 속도 측정
    • MLPerf Inference: AI 모델 ‘추론'(서비스) 속도 측정
    • MLPerf HPC: 과학 계산 및 AI 융합 워크로드 측정
    • MLPerf Mobile: 모바일 기기(스마트폰 등) 성능 측정
    • MLPerf Tiny: 초저전력 마이크로컨트롤러(MCU) 성능 측정

반드시 구분해야 할 두 가지 게임: MLPerf Training vs. Inference

AI 하드웨어를 평가할 때, ‘학습(Training)’과 ‘추론(Inference)’을 구분하는 것은 가장 기본적이면서도 가장 중요합니다. AI 벤치마크 역시 이 두 가지 시나리오를 명확히 나누어 평가합니다.

MLPerf Training: 모델을 ‘만드는’ 속도 측정

  • 핵심 지표: Time-to-Train (TTT). 즉, 특정 대규모 데이터셋을 사용해 사전에 정의된 목표 정확도(예: BERT 모델 99% 정확도)에 도달하는 데 걸리는 총 시간을 측정합니다. 쉽게 말해 ‘모델 하나를 완성하는 데 걸리는 시간’이죠.
  • 중요성: 이는 대규모 언어 모델(LLM)을 처음부터 개발하거나, 기존 모델을 새로운 데이터로 정기적으로 재학습시켜야 하는 기업 및 연구소에게는 절대적으로 중요한 지표입니다.
  • 최신 트렌드 (v4.0): 최신 MLPerf Training v4.0에서는 Llama 2 70B, GPT-3 175B, Stable Diffusion XL 같은 최신 생성 AI 모델의 학습 시간을 얼마나 단축시킬 수 있는지가 핵심 경쟁 포인트가 되었습니다.

MLPerf Inference: 모델을 ‘사용하는’ 속도 측정

  • 핵심 지표: Throughput (처리량, 예: 초당 처리 가능한 샘플/쿼리 수) 및 Latency (지연 시간, 예: 단일 요청에 대한 응답 시간, 밀리초(ms))입니다.
  • 시나리오 구분: MLPerf 추론은 실제 서비스 환경을 반영하기 위해 세 가지 주요 시나리오로 나뉩니다.
    • Server: 다수의 사용자가 동시에 요청을 보내는 환경 (예: AI 챗봇 서비스). ‘초당 쿼리 수(QPS)’가 중요하죠.
    • Offline: 가능한 최대의 처리량으로 대규모 데이터를 한 번에 처리하는 환경 (예: 저장된 이미지 일괄 분석). ‘초당 샘플 수(Samples/sec)’가 중요합니다.
    • SingleStream: 단일 요청이 들어왔을 때 얼마나 빨리 응답하는지를 측정. 실시간 번역 서비스처럼 ‘응답 속도(Latency)’가 절대적으로 중요합니다.
  • 중요성: AI 챗봇의 응답 속도, 실시간 이미지 분석, 개인화된 추천 서비스 등 실제 사용자에게 제공되는 AI 서비스의 품질(QoS) 및 운영 비용과 직결됩니다.
[표: MLPerf Training vs. Inference 핵심 비교]
평가 항목 MLPerf Training (학습) MLPerf Inference (추론)
핵심 목표 모델을 얼마나 ‘빠르게’ 만드는가 모델을 얼마나 ‘효율적으로’ 사용하는가
주요 지표 Time-to-Train (TTT, 목표 정확도 도달 시간) Throughput (초당 처리량), Latency (응답 시간)
주요 워크로드 GPT-3, Llama 2, Stable Diffusion 모델 개발 실시간 챗봇, 이미지 검색, 추천 시스템
중요한 사용자 AI 연구자, 모델 개발팀, 데이터 사이언티스트 AI 서비스 운영자, DevOps/MLOps팀

최신 MLPerf v4.0 결과 심층 분석: 거인들의 전쟁

2024년 6월에 발표된 최신 MLPerf v4.0 벤치마크 결과는, 특히 생성 AI 분야에서 하드웨어 거인들이 얼마나 치열하게 경쟁하고 있는지를 여실히 보여줍니다.

Training (학습) 벤치마크: Nvidia의 아성, 그리고 도전자들

모델 학습, 특히 LLM 같은 거대 모델 학습 분야는 여전히 대규모 클러스터 컴퓨팅의 영역입니다.

  • Nvidia (H100 & H200): Nvidia H100 GPU는 MLPerf v4.0의 거의 모든 학습 벤치마크에서 개별 칩 및 클러스터 규모 모두에서 강력한 리더십을 유지하고 있습니다. 특히 10,752개의 H100 GPU를 사용한 클러스터(Eos)는 GPT-3 175B 모델 학습에서 압도적인 성능을 보였는데, 이는 하드웨어뿐 아니라 성숙한 CUDA 소프트웨어 스택의 힘을 증명하는 결과죠.
  • Google (TPU v5p): Google은 자사의 JAX 프레임워크에 최적화된 TPU v5p 칩을 대규모(수천 개)로 연결하여 강력한 확장성을 과시했습니다. Llama 2 70B와 같은 LLM 학습에서 TPU 클러스터는 Nvidia와 어깨를 나란히 하는 최고 수준의 성능을 입증했습니다.
  • Intel (Gaudi 3): 이번 v4.0 벤치마크는 Intel Gaudi 3 가속기의 공식 데뷔 무대였습니다. Intel은 8,192개의 Gaudi 3 클러스터를 통해 Llama 2 70B 모델 학습 결과를 제출하며, 이전 세대 대비 괄목할 만한 성능 향상을 보여주었습니다. Intel은 특히 ‘가격 대비 성능’을 강조하며 Nvidia의 대안으로서의 입지를 강화하고 있습니다.
[표: MLPerf Training v4.0 주요 결과 (8-Accelerator, Stable Diffusion v2.5)]
모델 Nvidia H100 (8-GPU, SXM) Intel Gaudi 2 (8-GPU) Google TPU v5p
Stable Diffusion v2.5 (TTT) ~2.18 분 ~7.99 분 N/A (대규모 클러스터 제출)
Llama 2 70B (TTT) N/A (대규모 클러스터 제출) N/A (대규모 클러스터 제출) N/A (대규모 클러스터 제출)

* 참고: 표에서 볼 수 있듯, Llama 2 같은 최신 LLM의 v4.0 학습 벤치마크는 8-GPU 서버 단위가 아닌, 수백, 수천 개의 칩을 묶은 ‘클러스터’ 단위의 경쟁이 주를 이뤘습니다. 소규모 서버 비교가 제한적으로만 가능한 이유죠. 이는 현재 LLM 학습 시장이 완전히 ‘규모의 경쟁’으로 이동했음을 시사합니다.

Inference (추론) 벤치마크: 전성비와 응답 속도의 격전지

추론 시장은 학습보다 훨씬 더 세분화되어 있으며, 다양한 칩들이 특정 영역에서 강점을 보입니다.

  • Nvidia (H100, H200, L40S): H100과 H200 (차세대 HBM3e 메모리 탑재)은 Llama 2 70B 모델의 ‘Server’ 시나리오(높은 처리량)에서 가장 강력한 성능을 보여주었습니다. 반면, L40S나 L4 같은 칩들은 ‘SingleStream’ (낮은 지연 시간)이나 비용 효율적인 추론 서비스에 강점이 있죠.
  • Intel (Gaudi 3 & 5세대 Xeon): Intel Gaudi 3는 Llama 2 70B 추론 성능에서 Nvidia H100과 대등하거나 일부 시나리오에서 앞서는 인상적인 결과를 발표하며 강력한 경쟁자로 떠올랐습니다. 또한, 5세대 Intel Xeon CPU (Emerald Rapids)는 CPU만으로도 BERT나 ResNet-50 같은 경량 모델의 추론 작업을 효율적으로 처리할 수 있음을 증명하며, 전용 가속기가 필요 없는 워크로드를 위한 경제적인 대안을 제시합니다.
  • Qualcomm (Cloud AI 100): 퀄컴의 Cloud AI 100 시리즈는 데이터센터 추론 전용 칩으로, 특히 ‘전력 당 성능(Perf/Watt)’에서 지속적으로 두각을 나타내고 있습니다. ResNet-50(이미지 분류) 및 BERT(자연어 처리) 벤치마크에서 높은 전력 효율성을 보여주며, 전력 소모와 운영 비용에 민감한 데이터센터에 매력적인 선택지가 됩니다.

MLPerf 결과를 ‘현명하게’ 해석하는 3가지 실전 팁

MLPerf 벤치마크 결과표는 솔직히 말해 꽤 복잡합니다. 이 숫자들을 현명하게 해석하기 위한 세 가지 실전 팁을 알려드립니다.

팁 1: ‘Closed’ Division vs. ‘Open’ Division

MLPerf 결과는 ‘Closed’와 ‘Open’ 두 부문으로 나뉩니다.

  • Closed (폐쇄 부문): 이 부문이 바로 우리가 원하는 ‘사과 대 사과’의 공정한 비교입니다. 모든 제출자는 MLCommons가 제공하는 동일한 참조 모델, 동일한 전처리 방식을 사용해야 합니다. 하드웨어와 소프트웨어 스택의 순수한 성능을 비교하려면 이 부문의 결과를 봐야 합니다. (이 글의 모든 분석은 Closed 부문 기준입니다.)
  • Open (개방 부문): 이 부문은 ‘혁신’을 위한 공간입니다. 참가자는 모델 아키텍처를 변경하거나(예: 모델 경량화, 양자화 적용) 창의적인 최적화 기술을 적용할 수 있습니다. “최고 성능”을 보여줄 순 있지만, 공정한 하드웨어 비교 지표라고 보긴 어렵습니다.

팁 2: ‘성능’이 ‘처리량’인지 ‘응답 속도’인지 확인하라

‘성능이 좋다’는 말은 아주 모호한 표현입니다. 워크로드에 따라 필요한 ‘성능’이 완전히 다르기 때문이죠.

  • 처리량 (Throughput): 만약 하룻밤 동안 수백만 장의 이미지를 일괄 처리(Batch)해야 한다면, ‘Offline’ 또는 ‘Server’ 시나리오의 ‘초당 샘플 수’가 가장 중요합니다. 응답 속도가 조금 느려도 전체 처리량이 높은 칩이 더 유리합니다.
  • 응답 속도 (Latency): 반대로 실시간 AI 챗봇을 운영한다면, 사용자의 질문에 즉각 답해야 합니다. 이때는 ‘SingleStream’ 시나리오의 ‘99.9 백분위수 지연 시간(99.9% Latency)’이 절대적으로 중요합니다. 처리량이 아무리 높아도 단일 요청의 응답이 느리다면 서비스 품질은 낮아질 수밖에 없습니다.

팁 3: 숫자에 숨겨진 ‘소프트웨어 스택’을 보라 (CUDA vs. Opex)

MLPerf 결과는 하드웨어 칩(실리콘)만의 성능이 아닙니다. 그 칩을 구동하는 소프트웨어 스택(컴파일러, 라이브러리, 드라이버)의 성능이 합쳐진 결과물입니다.

  • 핵심 사실: Nvidia의 지속적인 우위는 H100, H200 같은 칩 자체의 성능뿐만 아니라, 지난 10여 년간 구축해 온 CUDA 생태계와 cuDNN, TensorRT 같은 고도로 최적화된 라이브러리의 힘이 정말 큽니다. 이는 개발자가 비교적 적은 엔지니어링 비용(Opex, 운영 비용)으로도 높은 성능을 빠르게 달성할 수 있음을 의미하죠.
  • 비교: Intel은 Gaudi를 위한 SynapseAI 소프트웨어 스택과 OpenVINO 툴킷을, Google은 TPU를 위한 JAX와 XLA 컴파일러를 밀고 있습니다. 이러한 대안 칩을 선택하는 것은, 초기 도입 비용(Capex)은 낮출 수 있으나 기존 CUDA 기반 코드를 마이그레이션하고 새로운 스택에 최적화하기 위한 추가적인 엔지니어링 리소스와 시간을 함께 고려해야 함을 뜻합니다.

귀사의 AI 워크로드에 완벽한 칩을 선택하는 기준

MLPerf 벤치마크는 AI 하드웨어 선택에 있어 ‘완벽한 정답’이 아닌, 가장 신뢰할 수 있는 ‘공정한 참고서’입니다.

핵심 요약:

  1. AI 성능은 모델을 ‘만드는’ Training (Time-to-Train)과 모델을 ‘사용하는’ Inference (Throughput/Latency)로 명확히 구분해야 합니다.
  2. 최신 MLPerf v4.0 결과는 생성 AI 분야에서 Nvidia가 여전히 강력한 리더십을 보이고 있으나, Intel (Gaudi 3)Google (TPU v5p)이 대규모 학습 및 추론 분야에서 매우 강력한 경쟁자로 부상했음을 명확히 보여줍니다.

AI 서버 GPU 선택을 위한 최종 조언:

단순히 벤치마크 순위에서 ‘1위 칩’을 선택하는 것은 위험합니다. 성공적인 AI 인프라 도입을 위해서는 다음 3단계를 적용해 보시길 권장합니다.

  1. 워크로드 정의: 귀사의 핵심 AI 작업이 ‘LLM 대규모 학습’인지, ‘실시간 추천 서비스’인지, 아니면 ‘이미지 일괄 분석’인지 명확히 정의해야 합니다.
  2. 벤치마크 매핑: 그 작업을 MLPerf의 가장 유사한 벤치마크(예: Training-Llama 2, Inference-Server-BERT, Inference-SingleStream-ResNet50)에 매핑하여 관련 결과를 비교하세요.
  3. TCO 및 생태계 고려: 마지막으로 칩의 초기 구매 비용(Capex)뿐만 아니라, 전력 소모, 그리고 가장 중요한 소프트웨어 호환성(CUDA vs. 기타)과 엔지니어링 운영 비용(Opex)을 포함한 총소유비용(TCO)종합적으로 평가하여 최종 결정을 내려야 합니다.