NoFOMO
搜索 中EN 登录 注册

最高第 2 名 已下榜

llama.cpp支持DFlash加速

llama.cpp作者建议使用Qwen3.8-27B+MTP的用户升级到DFlash提速,需要最新llama.cpp v0.6.0。

名次变化

要点

  • @ggerganov 表示使用 Qwen3.8-27B + MTP 的用户应升级到 DFlash 以获得额外速度,命令为 `llama serve -hf ggml-org/Qwen3.8-27B-GGUF --spec-type draft-dflash --spec-draft-n-max 7`。
  • 该推文称需要最新的 llama.cpp v0.6.0。
  • 一条回复称从 draft-mtp 换成 draft-dflash 后性能除以 2。
  • 另一条回复问为什么不直接用 strata。

要点和反应摘要由 AI 依据本页推文整理,请以原推为准。 我们怎么用 AI

原推

Georgi Gerganov @ggerganov 7.3万 粉丝

If you are using Qwen3.8-27B + MTP, make sure to upgrade to DFlash for extra speed: llama serve -hf ggml-org/Qwen3.8-27B-GGUF --spec-type draft-dflash --spec-draft-n-max 7 Requires the latest llama.cpp v0.6.0引用 @ggerganov: simple: llama serve -hf ggml-org/Qwen3.8-27B-GGUF --spec-type draft-mtp
758点赞 54转发 30回复 3.6万浏览

在 X 上查看 收藏

X 上的热门回复

登录后查看 X 上的 2 条热门回复

来自 @pa_schembri, @badguyty 等,已过滤广告,附中英文翻译。

免费注册 已有账号?登录

讨论 0

还没有人讨论,来说第一句。

推荐信源

觉得我们漏了哪个一手信源,或者该关注什么话题?告诉我们。审核通过后,所有人的榜单都会覆盖到它。

@用户名,或者主页链接