DGX Spark + Qwen27B 60tps! sglang+Dflash2 memang luar biasa!

61.252.***.***
31

60tps dari Reddit

https://www.reddit.com/r/LocalLLM/comments/1vvtquz/dgx_spark_qwen_38_27b_nvfp4_at_60toks_generation/

Versi yang saya gunakan adalah ini

https://forums.developer.nvidia.com/t/qwen3-8-27b-nvfp4-on-single-dual-dgx-spark-sglang-dflash2-fully-openai-compatible/380732

Beban Kerja (Aliran Tunggal)

1x Spark

2x Spark (TP=2)

Generasi Kode

52~61 token/detik

87 token/detik

Prosa/Esai

26 token/detik

41 token/detik

Percakapan Pemikiran

34~49 token/detik

49 token/detik

Pemikiran tentang Kode, ("tidak ada")

52 token/detik

sekitar 80 token/detik

TTFT, Prompt Pendek

sekitar 0.16 detik

Serupa

TTFT, Pengulangan Awalan 16K

0.44 detik

0.74 detik

Jendela Konteks

262,144

262,144

Saya menggunakan pengaturan yang agak konservatif (untuk quant, untuk embedding, menggunakan model 8B bersama, dll) dan pengukuran aktual saya mendapatkan 36~46 tps

Flash 2+ Slang benar-benar .. sangat cepat. Perkembangan teknologi memang luar biasa.

Tip hari ini : Qwen38 memiliki bug compact

  • Dalam DeepSeek Harness, ketika mengompresi sesi 150K token dengan Qwen3.8 27B, dilaporkan masalah yang hampir sama di mana auto compact tidak selesai.

    • Penyebab: Kompresor mewarisi pengaturan reasoning dari percakapan asli dan menghabiskan anggaran output selama proses.

    • Solusi: Hanya permintaan ringkasan dengan reasoningEffort: off

    • Menghapus reasoning lama, menghapus gambar, meringkas hasil alat yang besar.

    • Dengan cara ini, sesi kompresi 128K·150K·256K dilaporkan telah distabilkan.
      Kasus kompresi DeepSeek Harness Qwen3.8

  • Dalam Qwen Code, juga dilaporkan masalah di mana permintaan bantuan seperti judul, ringkasan, dan recap mewarisi pengaturan model utama dan menyebabkan pemikiran yang tidak perlu. Solusi yang diajukan adalah "setiap permintaan bantuan harus memiliki model sendiri, pengaturan listening, dan pengaturan extra body".
    Masalah pewarisan pengaturan permintaan sampingan Qwen Code

  • Dalam isu Qwen Code lainnya, ditemukan bahwa struktur permintaan OpenAI umum tidak menyertakan enable_thinking khusus untuk Qwen, sehingga pengaturan OFF tidak dikirim ke server. Dengan kata lain, hanya menampilkan OFF di UI tidak cukup dan adapter penyedia harus secara eksplisit memasukkannya ke dalam badan permintaan.
    Kerusakan pengiriman enable_thinking Qwen Code

Hal berikut telah ditambahkan ke Vector Build untuk menyelesaikan masalah tersebut:

{

"chat_template_kwargs": {

"enable_thinking": false,

"preserve_thinking": false

}

}

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.86 =0.00

2026.08.23 KEB 하나은행 고시회차 1420회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!