前两天,
相比于

但在发布涨价公告的2个多小时之后,

一边涨价一边开源,甚至有人说,DSH这个价格,都不如去用Codex了。但为什么V4-Pro明明已经不再最便宜,这17万人还在追?难道DSH真有什么独到之处?
01 DSH+V4-Pro,真的不如Codex划算吗?
首先要明确,DSH是免费开源的Agent运行程序,V4-Pro是按API(开发者付费调用模型的接口)收费的模型;而Codex则把Agent工具、GPT模型和订阅额度装在一起。目前还没有一套完全对齐的「DSH+V4-Pro」和「Codex+某一档GPT-5.6」完成同一项任务的总成本、和效果对比,但我们可以先看看逐项的对比。
而OpenAI在上个月末统一对GPT 5.6价格调整,降低了Luna和Terra的价格。按照每百万Token的标准API价格,Luna三项单价都低于V4-Pro;但V4-Pro即使处于高峰,仍比Terra和Sol便宜。

在单次不超过27.2万个输入token的标准计费下,Luna的缓存输入、未缓存输入和输出三项单价都低于V4-Pro。无论缓存命中率是10%还是90%,只要两边消耗的输入和输出Token相同,Luna都会更便宜。但同样地,V4-Pro即使在高峰,三项仍低于Terra和Sol。
以70%缓存命中、输出等于输入的10%为例,每100万输入token加10万输出,Luna约1.31元,V4-Pro闲时约2.78元、高峰约5.55元,Terra要13.1元,Sol约32.74元。如果三者一次就能完成同一件事,Luna这一档确实赢了。
Codex还被放进了ChatGPT订阅。已经购买Plus或Business的用户,只要没有超过额度,使用Codex几乎不会产生新账单。但Plus并非无限使用,轻度新用户如果专门花20美元购买订阅,未必比V4-Pro按量付费更省。

假设模型每读入10个token,输出1个token,缓存命中率从0到99%浮动,V4-Pro一个月的API账单要达到20美元,大约需要输入闲时2330万至8830万token,或高峰1170万至4420万token。轻度用户一个月用不到这个量,按量付费反而更省。
对比完价格我们对比一下跑分。这里来看一下两项工作能力测试的对比数据,其中Terminal-Bench测试AI能否通过命令行安装软件、修改文件并解决故障,DeepSWE测试AI能否在真实代码仓库里定位问题并完成修改。

在命令行任务上,V4-Pro比Luna高3.2分、比Terra高0.5分,只落后Sol 0.9分;但更接近代码仓库修改,它又分别落后Luna、Terra和Sol 4.5分、6.9分、10分。V4-Pro在命令行任务上没有全面掉队,但长周期改代码确实是GPT-5.6更占上风。
所以,V4-Pro的性价比真的不如Codex吗?
这个结论只对两类人基本成立。对于追求最低API单价的人,luna的价格确实要低于V4-Pro,能力则不好说;另一类则是已经购买ChatGPT订阅的人,如果你的额度用不完,那肯定是需要按量计费的V4-Pro要增加额外支出。
02 DSH不一定便宜,但是有独特的魔力
把Agent想成一台会吃饭的机器人。当我们想要Agent完成一个吃饭的任务时,skill就是告诉模型(大脑)怎样使用餐具的操作说明,MCP则是餐具柜上面统一使用的标签和取用规则,它会告诉harness:我这里有筷子勺子、能用来吃饭喝汤,你可以告诉我你要吃的是什么,来取对应的工具。
而harness收到这些消息之后,会告诉大脑。当大脑决定了使用勺子之后,还是由harness取出勺子然后开始吃饭。

在不同的harness下,即使是相同的模型做同一个任务,成功率和成本也可能发生变化。一项测试固定使用V4-Flash,Pi(一个更精简的开源harness)完成20个任务,Codex完成16个,Pi每次成功的估算成本约为后者三分之一;另一项测试固定使用GPT-5.5,Pi和Codex成功率接近,Pi成本仍然更低。
但两项测试都没有DSH参加,没办法证明DSH和Codex谁赢了。
DSH都可以通过更换能选择不同档次的模型、批量调用工具、压缩长对话,也能使用子Agent。两边都可能因为减少重复操作而省钱,也可能因为任务拆得太细、重试太多而增加消耗。
DSH的区别在于,它允许用户接入OpenAI、Anthropic、本地模型和自建服务,还把工具调用、会话存储和执行流程开放给开发者修改。用户可以根据自己的需求调整这些环节,但这只能说明DSH提供了更大的控制范围。

那DSH凭啥能在github上获得这么多星?
最主要的,是DSH连「harness怎样指挥模型干活」都允许开发者修改。
多数Agent包括codex都允许用户增加说明和餐具,但DSH连机器人的内部结构也开放了。
DSH把把这些核心环节放进同一套插件体系,开发者可以方便地替换模型,改变任务怎样记录、工具怎样调用,甚至重写整套吃饭程序。原来的流程可能是「看一眼、吃一口、再判断」,修改后可以先看完所有饭菜,再安排顺序,或者让多个Agent分别处理。

DSH还提供了一个需要主动开启的「创造模式」。机器人可以检查已有零件,临时写出一套新的动作程序,失败后换回旧版本,用完再删除。它没有改变模型的核心参数,谈不上自我进化,但确实给了开发者更大的改装空间。这也是有人把它叫作「Agent 2.0」的原因。
如果再用一个不太适合但很简单的比喻来说,codex就像苹果,而DSH就像安卓。喜欢折腾的人会觉得DSH自由,想直接干活的人,多半还是Codex省心。
03 免费开源,最后卖的还是token吗
很多人说,DSH开源就是运营商交费赠机,手机免费,但是钱变成了话费(token消耗)交给了运营商。

但其实,DSH是
2025年初,
卖Token真的是一门好生意吗?
根据

2025年2月27日中午到28日中午,V3和R1服务处理了6080亿输入token与1680亿输出token,输入中3420亿命中缓存。官方按H800(英伟达的计算卡)租用价估出单日成本为87,072美元;如果把网页、App和API的所有token都当成R1付费流量,理论日收入会到562,027美元,按成本计算的利润率是545%。
所以即使

DSH并不强制使用
这些功能不仅可能减少调用次数和文字用量,也可能直接把钱「送」给其他公司。
开放权重本身也是

这种做法既方便其他平台支持
至于「免费收集轨迹训练V4」,这真的没什么依据。DSH默认把会话记录放在本地,自动上传默认关闭。当然,用户可以主动反馈上传对应数据。
所以,「开源Harness能帮

