
Awalnya dengan 1 spark, hasilnya sekitar 24~26, dan saat digunakan secara nyata, hasilnya sekitar 16~20.
Lalu

Dengan 2 spark, hasilnya hampir dua kali lipat.
Namun saat digunakan secara nyata, hasilnya sekitar 25~33 token, jadi ada perbedaan dengan hasil benchmark.
Hari ini saya mencoba pengaturan dengan sglang.

Ada perbedaan antara vLLM dan sglang.
Sepertinya sekarang sglang memiliki selisih sekitar 10~20%.
Namun, saat digunakan secara nyata, sepertinya DeepSpeed lebih cepat. Perbedaannya lebih besar daripada jumlah token.