foryou2023
V2EX  ›  问与答

使用 deepseek,外接视觉模型有什么好的便宜的方案推荐

  •  
  •   foryou2023 · Aug 7 · 1524 views
    This topic created in 47 days ago, the information mentioned may be changed or developed.

    deepseek 不是多模态,在实际的使用中写 UI 确实差点意思,感觉好麻烦,特别是调 UI 的时候,感觉不好沟通。

    目前实践制作 UI 的流程是让 deepseek 绘制 ascii UI 布局,确定布局之后,就整理提示词使用 gemini 的

    stitch 制作原型图,原型图确定了再回到 deepseek 里面制作界面。

    实际的过程中就会遇到一些小问题,比如网站 一下 UI 细节或者按钮的大小不一致,deepseek 无法看到,文字

    描述的话,deepseek 没有办法一次性搞定。

    所以想求一个比较好的使用方案能解决 deepseek 做 UI 视觉上面碰到的问题。

    6 replies    2026-08-07 17:06:20 +08:00
    smy14520
        1
    smy14520  
       Aug 7   ❤️ 1
    claude code 中使用 智谱的视觉 mcp 多模模型可以自己选一个也可以用 智谱自己的 4.6v
    foryou2023
        2
    foryou2023  
    OP
       Aug 7
    @smy14520 感谢,我去试试
    yinyu
        3
    yinyu  
       Aug 7
    我自己做了个 OCR 的脚本其实就是调用视觉模型,我可以分享下经验,我试过百炼的 qwen3.6-flash 但是不够 flash ,中大的一张图就得花十秒左右。我让 codex 写脚本测试了 groq/cerabras/google 提供的视觉模型,最终发现同样的图,最快并且准确的最高(因为我是识别理财平台的持仓之类的一些信息,准确度很重要)的是
    ~/.hammerspoon master* ❯ cat remote_ocr.lua|grep gemini
    M.model = "gemini-3.5-flash-lite"
    ~/.hammerspoon master* ❯


    如果你对数字不敏感,其实 groq 和 cerebras 的视觉模型能够更快,描述一个布局什么的,小意思。

    但是其实。你也可以让 Agent 通过 MCP 直接链接浏览器,这样就可以更具体的知道真实效果。
    l84
        4
    l84  
       Aug 7
    sensenova
    CykaBlyat
        5
    CykaBlyat  
       Aug 7
    我是调用了火山的豆包识图
    foryou2023
        6
    foryou2023  
    OP
       Aug 7
    @yinyu
    @l84
    @CykaBlyat 感谢回复
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   3036 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 31ms · UTC 12:17 · PVG 20:17 · LAX 05:17 · JFK 08:17
    ♥ Do have faith in what you're doing.