V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  rechardwong0522  ›  全部回复第 2 页 / 共 9 页
回复总数  163
1  2  3  4  5  6  7  8  9  
id 120
谢谢老板
FRE-93e5b055
老板发大财!
id:467
谢谢老板,恭喜发财!
最新版本,还是不行呢。

PS E:\kaiwu-windows-amd64> .\kaiwu.exe run .\Qwen3-30B-A3B-UD-Q3_K_XL.gguf

██╗ ██╗ █████╗ ██╗██╗ ██╗██╗ ██╗
██║ ██╔╝██╔══██╗██║██║ ██║██║ ██║
█████╔╝ ███████║██║██║ █╗ ██║██║ ██║
██╔═██╗ ██╔══██║██║██║███╗██║██║ ██║
██║ ██╗██║ ██║██║╚███╔███╔╝╚██████╔╝
╚═╝ ╚═╝╚═╝ ╚═╝╚═╝ ╚══╝╚══╝ ╚═════╝
本地大模型部署器 vv0.2.3 · llama.cpp b8864
by llmbbs.ai · 本地 AI 技术社区

[1/6] Probing hardware...
GPU: NVIDIA GeForce GTX 1070 Ti (SM61, 8192 MB VRAM, 256 GB/s)
RAM: 31 GB UNKNOWN
OS: windows amd64

[2/6] Selecting configuration...
Model: Qwen3-30B-A3B (moe, 29B total / 2B active)
Quant: Q3_K_M (12.9 GB)
Mode: moe_offload (experts on CPU)

[3/6] Checking files...
Using bundled iso3 binary: llama-server-cuda.exe
Binary: llama-server-cuda.exe [cached]
Model: Qwen3-30B-A3B-UD-Q3_K_XL.gguf [cached]

[4/6] Preflight check...
iso3 不可用( MinSM61 或非 turboquant binary ),回退到 q8_0/q4_0
✓ VRAM sufficient

[5/6] Warmup benchmark...
Probe 1: ctx=32K ... OOM
Probe 2: ctx=16K ... OOM
Probe 3: ctx=8K ... OOM
⚠️ Warmup failed: all ctx probes failed (tried down to 4K)
Using default parameters

[6/6] Starting server...
Waiting for llama-server to be ready (port 11434)...
⚠️ 显存不足,降低上下文至 4K 重试...
Waiting for llama-server to be ready (port 11434)...
Error: failed to start llama-server: 连续 2 次启动失败,即使最小上下文(4K)也无法运行

NVIDIA GeForce GTX 1070 Ti: 8192 MB VRAM
模型 Qwen3-30B-A3B: ~13189 MB
KV cache (4K, q4_0): ~96 MB
预估总需: ~14309 MB

差额: 6117 MB

建议:
1. 选择更小的量化 (Q4_K_M 或 Q2_K)
2. 选择更小的模型

Usage:
kaiwu run <model> [flags]

Flags:
--bench Run benchmark after starting
--ctx-size int 手动指定上下文大小( 0=自动)
--fast Skip warmup, use cached profile
-h, --help help for run
--host string 监听地址(默认 127.0.0.1 ,用 0.0.0.0 开放局域网) (default "127.0.0.1")
--llama-server string 使用自定义 llama-server 二进制(完整路径)
--reset 清除缓存,重新 warmup 探测最优参数
4 月 23 日
回复了 drooloo 创建的主题 职场话题 公司的 AI 客服被真人干掉了
个人认为 AI 客服其实不需要用到大模型这样的算力,垂直领域语料有限,再怎么微调也难以给出准确答案,特别是多轮对话场景就更难了。另外,大模型带来的幻觉会严重消耗用户的信任度。就像很多人说的,接电话的第一句就是转人工,目前也没有看到比较好的落地方案。
@sddyzm 好的,谢谢
感谢老哥开源。对于 Swift 初学者来说,PasteMemo 的架构和难度适合用来学习吗?
Y3UJ55YR5Y 试试,谢谢
1 月 29 日
回复了 yuhuanxi 创建的主题 分享创造 历时 10 个月,我开发了个记录 APP
@yuhuanxi 真棒,花了很多心血啊。自己用的话,期待作者开源的一天
2025 年 12 月 21 日
回复了 rechardwong0522 创建的主题 问与答 兄弟们,求推荐安卓主力机
@Tachyonc 今天去试了下三星,确实跟国内品牌风格不一样,而且还挺贵的。
2025 年 12 月 21 日
回复了 rechardwong0522 创建的主题 问与答 兄弟们,求推荐安卓主力机
@Tiande 那确实,我不是刚性需求 root 。据说 13 也很不错,但有点顾虑它老了一代
2025 年 12 月 12 日
回复了 labchy 创建的主题 生活 不惑之年的惑 求各位大佬帮小弟解一下
首先,孩子都这样了,你必须干预。你老婆现在把重心完全放孩子身上,孩子会感受到很大的压力,你要想办法解决这个问题。最好的办法是让她去真正上班。
其次,别听网友瞎说,你们还不到离婚的地步,没有原则性问题。你老婆要的是你认可她的情绪价值,你这种干预她教育孩子的做法,在她看来就是否定她当前重要甚至唯一的价值,事情就这么变严重的。本质是家里经济完全依赖你,她没有安全感,这是长期以来全职女性的共同点。
最后,你也别想太多,吵架很正常,关键是要学会缓和氛围。你们来这里寻求网友建议的做法很好,这样你们俩就有了可以缓和的“台阶”。夫妻生活中矛盾是必定有的,特别是有了孩子后,解决矛盾的一个好办法就是互相给“台阶”,并能够及时接住对方给的“台阶”。
2025 年 12 月 10 日
回复了 Apokalypsis 创建的主题 Apple 关于 apple 售后两个坏消息
@lscho 你这样的数据党在这里不受欢迎哈哈哈
@forisra 私家车很大程度是为了装 x?你是不是还是毛头小伙?
2025 年 12 月 7 日
回复了 JackFire 创建的主题 生活 已婚人士请进,你们结婚女方陪嫁是什么?
@tuobatian 什么时代了还传宗接代
2025 年 11 月 30 日
回复了 cmos 创建的主题 分享发现 国产内存涨价了快 4 倍
@catazshadow 看了你主页的留言,看来大家都不待见你啊,打扰啦,告辞。
2025 年 11 月 30 日
回复了 cmos 创建的主题 分享发现 国产内存涨价了快 4 倍
@catazshadow 哈哈哈,我有说西方世界没有市场经济吗?开始给人扣帽子了,我因为有看你这种人,文革来了标准的红卫兵
2025 年 11 月 26 日
回复了 cmos 创建的主题 分享发现 国产内存涨价了快 4 倍
@catazshadow 笑死,还无视市场规律,你要说的是西方长期疾呼的“市场经济”?国产价格打下来,你真以为是政府在打?企业自己自由竞争被你说是无视市场规律,请问是不是要符合你的定义,才叫市场规律?
1  2  3  4  5  6  7  8  9  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2979 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 37ms · UTC 13:15 · PVG 21:15 · LAX 06:15 · JFK 09:15
♥ Do have faith in what you're doing.