Dari pagi hari pola yang saya gunakan, hal yang akan dilakukan dan berdasarkan ekspektasi bahwa harga memori tidak akan turun dalam 3 tahun ke depan, saya telah membuat tabel performa berikut ini.
Kesimpulan : Murah.
Kesimpulan 2 : Hentikan langganan pro.
Kesimpulan 3 : Beli Mac mini untuk rumah…
M5 Ultra 256GB vs RTX 5090 + RTX PRO 6000 — Berdasarkan AI Lokal
Item | Mac Studio M5 Ultra 256GB | PC RTX 5090 + RTX PRO 6000 |
|---|
CPU | Maksimal 36 inti | Ryzen 9950X3D 16C/32T |
GPU | Maksimal 80 inti GPU + Neural Accelerator per inti | 21,760 + 24,064 CUDA Core |
Operasi AI | Apple: M3 Ultra maksimal 4.3 kali lebih cepat | 3,352 + 4,000 = Secara teoritis 7,352 AI TOPS* |
Memori | 256GB Unified Memory | 32GB + 96GB = 128GB VRAM |
Struktur Memori | Satu kolam memori terpadu | VRAM dua GPU terpisah |
Bandwidth Memori | 1.2TB/s | Setiap GPU 1.792TB/s |
Komunikasi antar GPU | UltraFusion dalam chip | Komunikasi antar GPU melalui PCIe |
CUDA | X | O |
Daya/Kebisingan | Sangat menguntungkan | Hanya 5090 + PRO 6000 sekitar 1.2kW |
Harga Dalam Negeri | M5 Ultra harga awal 949 juta won + opsi 256GB | Sekitar 3,600~4,400 juta won |
Ukuran Model Maksimum | 200~400B Q4 juga memungkinkan | Secara realistis 96GB GPU tunggal / 128GB terdistribusi batasnya |
* Nilai teoritis yang dihitung dengan menjumlahkan AI TOPS dari NVIDIA, dan dua GPU tidak akan menghasilkan 7,352 TOPS seperti satu GPU.
Perkiraan Performa Inferensi LLM
Model / Kondisi | M5 Ultra 256GB Perkiraan | RTX PRO 6000 PC Pusat |
|---|
70B Dense Q4 | Sekitar 20~25 tok/s | Sekitar 30~45 tok/s |
GPT-OSS 120B MXFP4 | Sekitar 100~120 tok/s | Sekitar 160~190 tok/s |
Qwen3.5 397B-A17B Q4 | Sekitar 55~60 tok/s | Kurang Memori |
Qwen 397B Q4 / 64K konteks | Sekitar 38~42 tok/s | Kurang Memori |
Qwen 397B Q4 / 128K konteks | Sekitar 28~32 tok/s | Kurang Memori |
Angka M5 Ultra masih diperkirakan sebelum peluncuran resmi, berdasarkan benchmark MLX/oMLX M3 Ultra 256GB dan
bandwidth memori 1.2TB/s M5 Ultra, peningkatan kinerja GPU 80-core dan Neural Accelerator.
Sebagai referensi, pada M3 Ultra 256GB, Qwen3.5 397B-A17B Q4 dapat dijalankan:
diukur.
M5 Ultra memiliki bandwidth memori yang meningkat sekitar 1.47 kali (819GB/s → 1.2TB/s) dibandingkan M3 Ultra,
dan menurut pengumuman Apple, pemrosesan prompt LLM maksimal sekitar 4 kali lebih cepat, dan komputasi AI maksimal sekitar 4.3 kali lebih cepat.
Kesimpulan
RTX 5090 + RTX PRO 6000
Keuntungan
Kecepatan model di bawah 120B pasti lebih cepat.
Ekosistem CUDA / vLLM / SGLang / TensorRT
Kuasa dalam pembelajaran, LoRA, pembuatan gambar, dan penyajian paralel.
Menggunakan model yang berbeda pada RTX 5090 dan PRO 6000 sangat kuat.
Kerugian
Meskipun dua GPU digabungkan, VRAM tidak menjadi satu pool 128GB.
Model 200~400B ke atas, memori menjadi hambatan terbesar.
Harga sekitar 40 juta rupiah.
Konsumsi daya dan panas sangat besar.
M5 Ultra 256GB
Keuntungan
256GB digunakan sebagai satu pool memori oleh GPU.
Model Qwen 397B dapat dijalankan pada satu mesin.
Bandwidth memori 1.2TB/s.
GPU Neural Accelerator tambahan meningkatkan operasi AI dibandingkan Ultra sebelumnya.
Rasio harga/daya/kebisingan terhadap kemampuan menjalankan LLM besar sangat baik.
Kerugian
Model yang sama akan lebih cepat di NVIDIA VRAM
CUDA/SGLang tidak dapat digunakan sebagaimana adanya
Diperlukan runtime untuk Apple Silicon seperti MLX/llama.cpp
Kesimpulan Singkat
Jika tujuannya adalah menjalankan model 70~120B dengan kecepatan tertinggi, maka NVIDIA adalah pilihannya.
Untuk model besar 200~400B, konteks yang panjang, dan AI Agent lokal, M5 Ultra 256GB jauh lebih masuk akal.
Pada akhirnya
NVIDIA = Anda membayar untuk performa komputasi dan kecepatan
M5 Ultra = Anda membayar untuk kumpulan memori cepat yang besar
Dalam LLM lokal, nilai yang terakhir menjadi semakin penting seiring dengan bertambahnya ukuran model.