
model: deepseek-v4-flash-0731
[batch] p1 answer ... 422 tok in 30 s (14.0 tok/s), 0 answer chars, 4436 reasoning chars, <= 15.8 h left
[batch] p1 answer ... 846 tok in 60 s (14.1 tok/s), 0 answer chars, 9732 reasoning chars, <= 15.8 h left
[batch] p1 answer ... 1273 tok in 2 min (14.1 tok/s), 0 answer chars, 14807 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 1692 tok in 2 min (14.1 tok/s), 0 answer chars, 19498 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 2119 tok in 3 min (14.1 tok/s), 0 answer chars, 24208 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 2540 tok in 3 min (14.1 tok/s), 0 answer chars, 29422 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 2961 tok in 4 min (14.1 tok/s), 0 answer chars, 34814 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 3381 tok in 4 min (14.1 tok/s), 0 answer chars, 40060 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 3801 tok in 5 min (14.1 tok/s), 0 answer chars, 45535 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 4223 tok in 5 min (14.1 tok/s), 0 answer chars, 50300 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 4641 tok in 6 min (14.0 tok/s), 0 answer chars, 54854 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 5061 tok in 6 min (14.0 tok/s), 0 answer chars, 59818 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 5479 tok in 7 min (14.0 tok/s), 0 answer chars, 65113 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 5895 tok in 7 min (14.0 tok/s), 0 answer chars, 70328 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 6312 tok in 8 min (14.0 tok/s), 0 answer chars, 75546 reasoning chars, <= 15.7 h left
[batch] p1 answer ... 6734 tok in 8 min (14.0 tok/s), 0 answer chars, 80835 reasoning chars, <= 15.7 h left
Penyetelan saya mulai kemarin dan hari ini sudah cukup rampung, lalu saya menjalankannya
dan hasilnya sekitar 14 tok/s
Di sini saya menerapkan persis metode yang dianalisis Fable lalu menerima jawabannya,
dan karena dalam pengujian saya tetap memperoleh jawaban pada tingkat yang bisa diterima, saya cukup terkejut.
Dibanding model di bawah 100B jawabannya tergolong jauh lebih akurat sehingga sejak kemarin saya agak terkejut,
dan saya merasa konteks 1M serta jumlah parameter memang untuk sementara sangat perkasa.
Setelah menjalankan dua unit DGX SPARK saya sedikit menyesal tidak membeli Mac Studio berkapasitas 512G,
tetapi memperluas perangkat keras lebih jauh dari sini nilai ekonomisnya terlalu rendah..
Saya berharap seiring waktu akan dirilis model open weight yang lebih pintar.