jinsongzhaocn
V2EX  ›  Local LLM

部署 Qwen3.8-27B 模型死循环问题最新升级

  •  
  •   jinsongzhaocn · 17 days ago · 1144 views

    部署 Qwen3.8-27B 模型的朋友,死循环问题可以升级了。 https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates llama.cpp 的配置参数里指定模板文件:

    --jinja --chat-template-file /model/Qwen3.8-27B/chat_template.jinja --reasoning-format deepseek

    5 replies  •  2026-09-22 12:21:19 +08:00
    liangyuan1985
        1
    liangyuan1985  
       16 days ago
    Qwen3.6-27B 就用了
    jinsongzhaocn
        2
    jinsongzhaocn  
    OP
       16 days ago
    @liangyuan1985 几天前更新了一些 think 部分的内容,不知道替换后效果如何?
    tgfbeta
        3
    tgfbeta  
       11 days ago
    上 flash next 吧,q3 跑了超 24hr 还没崩坏呢
    jinsongzhaocn
        4
    jinsongzhaocn  
    OP
       10 days ago
    @tgfbeta 只有一片 4090 24GB ,64GB 内存. flash next 16tok/s 太慢了,就算升级到 192GB 内存,只可能到 30-40tok/s, 而且 flash next 对 agent 来说反而降了,编程评分在我的机器上测试,比 27b 低了 10%。 我用的是 flash next Q4_M_XL, KV q8 。
    tgfbeta
        5
    tgfbeta  
       2 days ago
    @jinsongzhaocn 24GB 是差点,96GB 应该够了,比如两张 4090 48G 。vllm 的并发可能更好一点,至少在 DGX spark 上是的,同时跑两路生成就能接近翻倍。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   1001 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 28ms · UTC 18:20 · PVG 02:20 · LAX 11:20 · JFK 14:20
    ♥ Do have faith in what you're doing.