部署 Qwen3.8-27B 模型的朋友,死循环问题可以升级了。 https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates llama.cpp 的配置参数里指定模板文件:
--jinja --chat-template-file /model/Qwen3.8-27B/chat_template.jinja --reasoning-format deepseek
部署 Qwen3.8-27B 模型的朋友,死循环问题可以升级了。 https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates llama.cpp 的配置参数里指定模板文件:
--jinja --chat-template-file /model/Qwen3.8-27B/chat_template.jinja --reasoning-format deepseek
1
liangyuan1985 16 days ago
Qwen3.6-27B 就用了
|
2
jinsongzhaocn OP @liangyuan1985 几天前更新了一些 think 部分的内容,不知道替换后效果如何?
|
3
tgfbeta 11 days ago
上 flash next 吧,q3 跑了超 24hr 还没崩坏呢
|
4
jinsongzhaocn OP @tgfbeta 只有一片 4090 24GB ,64GB 内存. flash next 16tok/s 太慢了,就算升级到 192GB 内存,只可能到 30-40tok/s, 而且 flash next 对 agent 来说反而降了,编程评分在我的机器上测试,比 27b 低了 10%。 我用的是 flash next Q4_M_XL, KV q8 。
|
5
tgfbeta 2 days ago
@jinsongzhaocn 24GB 是差点,96GB 应该够了,比如两张 4090 48G 。vllm 的并发可能更好一点,至少在 DGX spark 上是的,同时跑两路生成就能接近翻倍。
|