foryou2023
V2EX  ›  问与答

如果 2 - 3 万人民币设备,部署本地 dsv4flash , token 基本够用,你是会选择本地部署还是接云 api?

  •  
  •   foryou2023 · 1 day ago · 3531 views

    The current q2 results use ds4-bench with the standard Promessi sposi input, 2048-token context steps, and 128 greedy generation tokens at every frontier. Each prefill number is for the next 2048-token chunk. The complete sweeps are in m5_max.csv and gb10.csv.

    Machine Backend Context Prefill Generation
    MacBook Pro M5 Max, 128 GB Metal 2048 790.18 t/s 39.35 t/s
    MacBook Pro M5 Max, 128 GB Metal 16384 572.53 t/s 36.14 t/s
    MacBook Pro M5 Max, 128 GB Metal 32768 557.04 t/s 34.36 t/s
    MacBook Pro M5 Max, 128 GB Metal 65536 398.50 t/s 27.64 t/s
    DGX Spark GB10, 128 GB CUDA 2048 825.76 t/s 18.05 t/s
    DGX Spark GB10, 128 GB CUDA 16384 872.44 t/s 15.10 t/s
    DGX Spark GB10, 128 GB CUDA 32768 855.94 t/s 14.43 t/s
    DGX Spark GB10, 128 GB CUDA 65536 822.98 t/s 13.84 t/s

    Older measurements for machines and model variants not rerun in this pass are kept for reference. They used the earlier CLI prompt procedure and are not directly comparable with the table above.

    Machine Quant Prompt Prefill Generation
    MacBook Pro M3 Max, 128 GB q2 short 58.52 t/s 26.68 t/s
    MacBook Pro M3 Max, 128 GB q2 11709 tokens 250.11 t/s 21.47 t/s
    Mac Studio M3 Ultra, 512 GB q2 short 84.43 t/s 36.86 t/s
    Mac Studio M3 Ultra, 512 GB q2 11709 tokens 468.03 t/s 27.39 t/s
    Mac Studio M3 Ultra, 512 GB q4 short 78.95 t/s 35.50 t/s
    Mac Studio M3 Ultra, 512 GB q4 12018 tokens 448.82 t/s 26.62 t/s
    Mac Studio M3 Ultra, 512 GB PRO q2 32768 tokens 138.82 t/s 9.56 t/s

    以上是看 https://github.com/antirez/ds4 这个仓库的数据。

    最近 dsv4 涨价太猛了,所以尝试找找本地部署的方案,找到这个方案,由于手里也没有设备同时也不太懂这个 速度的问题,也无法测试具体的实践效果如何,不知道有相关设备的朋友,能不能帮忙看看或者测试一下。

    目前看了咸鱼 M3 MAX 128G 的大概 2.5 万左右,感觉按照 dsv4 flash 的价格的话可以接受本地部署了。M5 MAX 苹果官网看了一下要 5 万多,暂时没有这么多预算。

    Supplement 1  ·  1 day ago
    看了大家的大部分人的回复,本地部署暂时不考虑,只能继续上云 api 了。
    31 replies    2026-08-25 09:18:41 +08:00
    donaldturinglee
        1
    donaldturinglee  
       1 day ago via iPhone
    2.5 万部署的能用在工作吗?生产环境还是直接上 API 吧
    cvooc
        2
    cvooc  
       1 day ago
    现在迭代这么快, 本地部署 每秒几十 token 只能个人同一时间跑单任务用, 除非极度缺乏安全感,
    真不如 api 跑批量来的爽.
    FakerLeung
        3
    FakerLeung  
       1 day ago
    我看双 DGX 好像能干到 4 人同时 50t/s ?还是 FP8 的精度?
    xing7673
        4
    xing7673  
       1 day ago
    你这又是 q2 又是几十 k 的上下文,部署起来也基本没啥用
    darksword21
        5
    darksword21  
       1 day ago
    没有意义,发这种 bench 的人也是闲的
    crocoBaby
        6
    crocoBaby  
       1 day ago
    很多人早算过这笔帐,肯定是云 api 划算的
    op351
        7
    op351  
       1 day ago
    现阶段肯定是直接买云服务商的算力
    云服务商都还在算力设备采购难,到货周期长,回本周期长的阶段,就不用想本地部署省钱这码事了
    现在本地部署的好处就一个 安全合规
    不存在本地部署吊打云服务商的算力和质量还能省钱的
    ff521
        8
    ff521  
       1 day ago
    hx170 这个破解的显卡有人玩过吗
    rming
        9
    rming  
       1 day ago
    如非必要 勿增实体
    xylitolLin
        10
    xylitolLin  
       1 day ago
    如果 2~3 万能部署到官方 api 的能力(能打个 8 折也可以)。官方也不至于涨价这么多吧
    longaiwp
        11
    longaiwp  
       1 day ago
    这还用算吗?就现在这个硬件成本,买 API 必然更划算。
    imdoge
        12
    imdoge  
       1 day ago
    不是满血版,还 40token/s ,一个人用都嫌慢还不是满血
    zisen
        13
    zisen  
       1 day ago
    如果考虑硬件涨价的背景,可以买来玩玩,记得在暴跌之前出手就行
    sillydaddy
        14
    sillydaddy  
       1 day ago
    DeepSeek 自部署可以 1 年左右就回本,但要跑满负载,单纯编程肯定跑不满。
    而且,考虑到各大厂的订阅套餐非常便宜,一般比 API 价格便宜 10x~20x 倍,订阅够用的话肯定订阅划算:
    https://v2ex.com/t/1235609#r_17991716
    Retas
        15
    Retas  
       1 day ago
    本地部署难崩的是算力只有下限,多个 Agent 就拉闸了。 用 API 跑上百个 Agent 并发洒洒水的事
    gpt5
        16
    gpt5  
       1 day ago
    本地部署有其应用场景 但绝不是来当主力代码 agent
    RandomJoke
        17
    RandomJoke  
       1 day ago
    你要达到 API 的推理效果,基本上硬件得投入百万级别。。。,还不算维护成本
    kuhung
        18
    kuhung  
       1 day ago
    除非极度重视隐私,不然写代码自己搞一套没有性价比。
    keppelfei
        19
    keppelfei  
       1 day ago
    就目前市场看,2~3w 想部署一个 dsv4f,想常用感觉很困难
    geese1028
        20
    geese1028  
       1 day ago
    我个人会选择订阅,不会考虑本地部署。3 万我可以把 super grok heavy 和 5x 的 GPT 订阅一整年了。1 年时间我觉得我的需求应该都能干完了。


    我个人并不在意大厂获取我的个人数据用于训练(我不用中转站)。如果我的数据对于训练下一代模型能有帮助,我将感到非常荣幸。
    iv8d
        21
    iv8d  
       1 day ago via Android
    有设备必须本地,要求并发后并且能开 max ,除此之外还是上 api 吧
    refear99
        22
    refear99  
       1 day ago
    M3 MAX 128G ,应该只能跑个 qwen 3.8 27b 吧? 还不是 8bit 的
    mingtdlb
        23
    mingtdlb  
       1 day ago
    量化的跟原生精度的比,能力差点吧
    HENQIGUAI
        24
    HENQIGUAI  
       1 day ago
    这个价格的设备怕是不行吧
    foryou2023
        25
    foryou2023  
    OP
       1 day ago
    @HENQIGUAI 看到有人说部署这个,满足正常使用,所以来求证一下,速率就是上面测试的结果。
    @refear99 跑的就是我说的这个。
    ooppstef
        26
    ooppstef  
       1 day ago
    如果自己部署划算,那云怎么赚钱呢。。。商业模式就不成立啊。
    foryou2023
        27
    foryou2023  
    OP
       1 day ago
    @ooppstef 不知道,我也在想这个问题,如果未来 2 万块钱就能部署本地的大模型日常够用的话,我肯定不会订阅了。这样想的话,大模型公司一定是赚企业的钱。
    wwhc
        28
    wwhc  
       1 day ago
    Deepseek v4 flash 能用的起点是两块 RTX PRO 6000
    Maxwe11
        29
    Maxwe11  
       1 day ago
    这个就像自己种菜和从农业工厂订菜,平摊成本决定了一定是工业化生产的平均成本更低,本地部署的,除非是有特别法律法规、隐私需求或其他官方不支持导致的无法使用因素,否则一定是 API 的成本更低(再补个漏洞:就是大模型这个也不能存在少数垄断,必须保持当下这种有开源有竞争的市场,否则垄断收割的镰刀更锋利)
    bunai
        30
    bunai  
       19h 7m ago
    买 api
    foryou2023
        31
    foryou2023  
    OP
       18h 18m ago
    @wwhc 目前看到的确实只有这个方案稍微便宜一点了,而且还是满血的。
    @Maxwe11 我看好些人的订阅一个月花销都快上千了。如果硬件成本降到 2 万达到 80% 或者 90% 的效果,肯定更多选择本地,因为电脑本身就要买的,如果能用一个无限制的本地大模型的话,那就更有理由选择本地了。
    @bunai 目前来看个人日常使用确实 api 稍微划算一点。如果一个月 ai 花销 2-3k 的话,那么搞本地部署就可以考虑一下了。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   978 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 74ms · UTC 19:37 · PVG 03:37 · LAX 12:37 · JFK 15:37
    ♥ Do have faith in what you're doing.