比如 codex ,一个 5.6 就好几个版本,推理强度还搞好几个梯度。 Claude 的话模型少一点,一般就 opus 系列开 medium ,不知道是否有更精细化的用法。 大家都是怎么分配这些模型和任务呢,最常用哪种。
比如 codex ,一个 5.6 就好几个版本,推理强度还搞好几个梯度。 Claude 的话模型少一点,一般就 opus 系列开 medium ,不知道是否有更精细化的用法。 大家都是怎么分配这些模型和任务呢,最常用哪种。
1
passive 1h 47m ago via Android
本地 deepseek v4 flash 默认 thinking 一把嗦。Depseek 搞不定的,换个模型或者加强 thinking 也只是赌概率,还不如手工介入或者引导 agent plan 出正确的计划更有效率。
|
2
zemin 25 mins ago
|
3
canyue7897 19 mins ago
如果对成本不是很敏感的话,就选最贵的那个最高档次的模型。如果说对成本特别敏感的话,那就只能选择大家认为合适的。但是大家认为合适的可能不太适合你的工作流,这个需要自己一个一个测试。
|
4
maolon 7 mins ago
这个没有定论的,都是看你的任务来决定,
方法论基本就是:时间,成本,质量这三个条件来权衡, 时间是平均完成一个任务所需的时间而不是 tps , 成本也是平均完成一个任务所需的成本,比如你的 plan 的 quota 消耗或者直接就是 api 的价格, 质量就是能不能满足你对项目的需求。 一般对于普通编程任务来说,推理强度是有一个上限的,旗舰模型( sol,opus,fable )最高的那一档思考强度一般是给科研用的,如果编程使用就会出现很明显的慢,过度思考,以及比次一档贵一倍的价格。但是次旗舰模型以及国产最好的模型一般都可以使用最高一档强度。 最后你可以参考 deepswe,或者 aa 的帕累托前沿来选择模型和强度,我一般参考 deepswe 多一些 |