最高第 2 名 已下榜
llama.cpp支持DFlash加速
llama.cpp作者建议使用Qwen3.8-27B+MTP的用户升级到DFlash提速,需要最新llama.cpp v0.6.0。
要点
- @ggerganov 表示使用 Qwen3.8-27B + MTP 的用户应升级到 DFlash 以获得额外速度,命令为 `llama serve -hf ggml-org/Qwen3.8-27B-GGUF --spec-type draft-dflash --spec-draft-n-max 7`。
- 该推文称需要最新的 llama.cpp v0.6.0。
- 一条回复称从 draft-mtp 换成 draft-dflash 后性能除以 2。
- 另一条回复问为什么不直接用 strata。
要点和反应摘要由 AI 依据本页推文整理,请以原推为准。 我们怎么用 AI
原推
If you are using Qwen3.8-27B + MTP, make sure to upgrade to DFlash for extra speed:
llama serve -hf ggml-org/Qwen3.8-27B-GGUF --spec-type draft-dflash --spec-draft-n-max 7
Requires the latest llama.cpp v0.6.0引用 @ggerganov: simple:
llama serve -hf ggml-org/Qwen3.8-27B-GGUF --spec-type draft-mtp
讨论 0
注册 登录 后参与讨论
还没有人讨论,来说第一句。