사전예약을 준비하는 분들을 위한 총정리

220.41.***.***
13

아침부터 제가 사용하는 패턴하고 앞으로 할일 그리고 3년 뒤까지 메모리 가격이 안 내릴거라는 예상을 바탕으로 아래와 같이 성능 표를 뽑아봤습니다.

결론 : 싸네요.

결론 2 : pro 구독 끊자.

결론 3 : 집에다가는 맥미니 산다고…

M5 Ultra 256GB vs RTX 5090 + RTX PRO 6000 — 로컬 AI 기준

항목

Mac Studio M5 Ultra 256GB

RTX 5090 + RTX PRO 6000 PC

CPU

최대 36코어

Ryzen 9950X3D 16C/32T

GPU

최대 80코어 GPU + 코어별 Neural Accelerator

21,760 + 24,064 CUDA Core

AI 연산

Apple: M3 Ultra 대비 최대 4.3배

3,352 + 4,000 = 이론상 7,352 AI TOPS*

메모리

256GB Unified Memory

32GB + 96GB = 128GB VRAM

메모리 구조

하나의 통합 메모리 풀

두 GPU의 VRAM이 분리됨

메모리 대역폭

1.2TB/s

각 GPU 1.792TB/s

GPU간 통신

칩 내부 UltraFusion

PCIe를 통한 GPU간 통신

CUDA

X

O

전력/소음

매우 유리

5090 + PRO 6000만으로 약 1.2kW급

국내 가격

M5 Ultra 시작가 949만원 + 256GB 옵션

3,600~4,400만원

최대 모델 크기

200~400B급 Q4도 가능

실질적으로 96GB 단일 GPU / 128GB 분산 한계

* NVIDIA의 AI TOPS를 단순 합산한 이론값이며, 두 GPU가 하나의 GPU처럼 7,352 TOPS를 내는 것은 아님.

LLM 추론 성능 예상

모델 / 조건

M5 Ultra 256GB 예상

RTX PRO 6000 중심 PC

70B Dense Q4

20~25 tok/s

30~45 tok/s

GPT-OSS 120B MXFP4

100~120 tok/s

160~190 tok/s

Qwen3.5 397B-A17B Q4

55~60 tok/s

메모리 부족

Qwen 397B Q4 / 64K context

38~42 tok/s

메모리 부족

Qwen 397B Q4 / 128K context

28~32 tok/s

메모리 부족

M5 Ultra 수치는 아직 정식 출시 전이므로 M3 Ultra 256GB의 실제 MLX/oMLX 벤치마크와
M5 Ultra의 1.2TB/s 메모리 대역폭, 80코어 GPU, Neural Accelerator 성능 향상을 기준으로 추정한 값.

참고로 M3 Ultra 256GB에서도 Qwen3.5 397B-A17B Q4가 실제 구동되며:

  • 1K context: 약 40 tok/s

  • 32K: 약 32 tok/s

  • 64K: 약 27 tok/s

  • 128K: 약 20 tok/s

까지 실측됨.

M5 Ultra는 M3 Ultra 대비 메모리 대역폭이 약 1.47배(819GB/s → 1.2TB/s) 증가했고,
Apple 발표 기준 LLM prompt processing은 최대 약 4배, AI compute는 최대 약 4.3배 향상됨.

결론

RTX 5090 + RTX PRO 6000

장점

  • 120B 이하 모델의 절대 속도는 확실히 빠름

  • CUDA / vLLM / SGLang / TensorRT 생태계

  • 학습, LoRA, 이미지 생성, 병렬 서빙에 강함

  • RTX 5090과 PRO 6000에 서로 다른 모델을 올리면 매우 강력함

단점

  • 두 GPU를 합쳐도 VRAM은 하나의 128GB 풀이 아님

  • 200~400B급 모델부터 메모리가 가장 큰 병목

  • 가격 약 4천만원

  • 소비전력과 발열이 매우 큼

M5 Ultra 256GB

장점

  • 256GB를 GPU가 사실상 하나의 메모리 풀로 사용

  • Qwen 397B급 모델까지 한 머신에서 구동 가능

  • 1.2TB/s 메모리 대역폭

  • GPU Neural Accelerator 추가로 이전 Ultra보다 AI 연산 크게 향상

  • 가격/전력/소음 대비 대형 LLM 구동능력이 매우 좋음

단점

  • 같은 모델이 NVIDIA VRAM 안에 들어간다면 NVIDIA가 더 빠름

  • CUDA/SGLang을 그대로 사용할 수 없음

  • MLX/llama.cpp 등 Apple Silicon용 런타임 필요

한 줄 결론

70~120B 모델을 최고 속도로 돌리는 것이 목적이면 NVIDIA.

200~400B급 대형 모델, 긴 Context, 로컬 AI Agent가 목적이면 M5 Ultra 256GB가 훨씬 합리적.

결국

NVIDIA = 연산 성능과 속도를 사는 것

M5 Ultra = 거대한 고속 메모리 풀을 사는 것

로컬 LLM에서는 모델이 커질수록 후자의 가치가 급격히 커짐.

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.78 0.01

2026.08.27 KEB 하나은행 고시회차 353회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!