Model Qwen3.8-Flash-Next diuji pada Strix Halo 128GB.

58.183.***.***
23
  • Mesin yang digunakan : llama.cpp cabang pr27742

  • Model yang digunakan : Qwen3.8-Flash-Next-UD-IQ4_XS

  • Sistem yang digunakan : Strix Halo (Beelink GTR9 PRO 128GB)

  • Sistem operasi yang digunakan : Arch Linux, Vulkan VRAM 96GB dialokasikan

  • Referensi : Lihat tautan

Setelah beberapa kali mencoba dengan pengaturan yang berbeda,

Sepertinya panjang konteks 128k adalah yang paling optimal.

Ketika di set sekitar 64k, kecepatan respons yang mendekati layanan komersial benar-benar muncul.

Jika di set sekitar 256k, menjalankan server dan menggunakannya akan membuat sistem bekerja keras dengan menguras sumber daya CPU dan memori sistem. Tentu saja, kecepatan juga akan melambat seiring dengan peningkatan panjang konteks.

Namun, bahkan dalam kasus ini, sepertinya cukup sabar untuk membuatnya berjalan dengan baik.

Hasil benchmark menunjukkan bahwa Qwen3.8 Flash Next memang melampaui Deepseek 4 flash, tetapi kecepatannya masih jauh lebih baik, jadi kemajuannya sungguh luar biasa.

Sangat menyenangkan bahwa kita sekarang dapat memperoleh hasil dengan kualitas yang setara dengan model publik dengan menggunakan model lokal yang memiliki kecepatan yang layak.

Saya sebenarnya lebih suka model open-source daripada model China, dan saya sangat berharap model seperti ini akan muncul di platform seperti OpenAssistant. OpenAssistant fokus pada pengembangan model tingkat lanjut, dan perusahaan yang terlibat tampaknya tidak terlalu bersemangat untuk berkontribusi pada open-weight karena alasan komersial. Sayang sekali.

▶ Sumber asli: https://www.reddit.com/r/StrixHalo/comments/1vz5yb3/qwen38flashnext_125ba6b_running_on_strix_halo/?solution=957fe3a6a547c072957fe3a6a547c072&js_challenge=1&token=7afd7253fec22262ff1c52b1703fe9ec7dbcc5482b6045fe1f50de322cb8d1eb&jsc_orig_r=

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.77 -0.01

2026.08.28 KEB 하나은행 고시회차 315회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!