V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  wwhc  ›  全部回复第 1 页 / 共 29 页
回复总数  580
1  2  3  4  5  6  7  8  9  10 ... 29  
@clemente 我建议你实际部署以体验真实的情况
@clemente DeppSeek 开源的是 167GB 的版本,仓库里标明了大小
DeepSeek-V4-Flash-0731
167 GB
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/tree/main
@clemente DeepSeek 开源的是 4B 版本,也就 167GB 左右,你可到 huggingface 计算具体大小
两块 RTX PRO 6000 ,配置 llama.cpp 用于提供推理服务,满血 v4 flash 也就 160GB 左右。就算是单 RTX 5090 ,也够个人用,输出也可以达到 10-20t/s
等 llama.cpp 合并 Deepseek v4 的补丁到主线吧
6 月 6 日
回复了 plko345 创建的主题 Windows windows 终将成为最好的 Linux
微软的前途在于把 Windows 变成 Linux 的发行版之一
6 月 1 日
回复了 SilenceLL 创建的主题 硬件 站里没人看老黄的新电脑吗
如果不提供对 Linux 的良好支持 这个体系在 AI 领域并不具备竞争性
RX9070 对标 Nvidia Titan V 的 AI 推理性能
llama.cpp 的优化参数也很多,绝对性能目前可能仍不及 vllm 强,但可用性、易用性、可调性及部署能力都远强于 vllm
7900xtx 在 llama.cpp 下支持良好,推理时的预填充速度可能只比 4060ti 稍强,但 token 生成速度与 3090ti 相差不大
除非你是在为大公司或企业开发 AI 推理系统,建议使用 llama.cpp ,这是目前最好的 AI 推理框架
重度运行本地大模型的 Mac 要选用 M? Ultra ,即使是 M1 Ultra ,也强于任何世代的 Max 型号
@Jiajin
@junwind
不依赖别的工具,本地部署的 Qwen3.6 27B/35B 也能达到 GLM 的水准当使用“帮我生成一个天气查询 H5 应用”这个提示词
楼主的测试有偏差,本地部署的 Qwen3.6 27B/35B 使用楼主的提示词都能生成达到楼主图中 GLM 的水准的代码渲染,本地部署的 gpt-oss 120B 倒真是惨不忍睹,生成的的代码渲染出的页面没法看
差一点就能赶上 Qwen3.5 了
Qwen3.5 是适于本地部署的开源模型中最强的,Google 昨天新发布的开源 Gemma 4 模型也仅仅是追上 Qwen3.5 而已
Token 自由的感觉蛮不错
经验是用一到两块高性能大显存卡如 3090/4090/5090 ,再加上若干便宜的中低端卡(8-16GB 显存),把所有层都放进显存(能容纳的上下文越多越好,256k 大概需要 60GB 显存以上),尽可能多的把专家权重放到显存,一般能实现 10-20t/s 或以上的速度,建议使用 llama.cpp 而不是 vllm ,以便于快速迭代及灵活的硬件搭配
1  2  3  4  5  6  7  8  9  10 ... 29  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3114 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 26ms · UTC 13:41 · PVG 21:41 · LAX 06:41 · JFK 09:41
♥ Do have faith in what you're doing.