没有预告,没有倒计时,甚至连更新日志都没来得及写好。
8 月 13 日凌晨,
从 4 月 24 日预览版上线算起,整整 111 天。
这期间
所有人都在问同一个问题:Pro 的正式版到底什么时候来?
答案是一个周三的深夜。
01
架构没变,能力暴涨
先说硬参数。V4 Pro 正式版的模型架构和预览版完全一致——1.6T 总参数、49B 激活参数的 MoE 结构,支持 1M 上下文、384K 最大输出。变的是后训练,而且变化大到像换了个模型。
最夸张的数字来自 Agent 相关评测。DeepSWE(
这些测试项有一个共同特点——它们都涉及长链路的代码修改、环境操作和工具调用。恰好是预览版最容易翻车的地方。

从 V4 Flash 正式版的更新日志可以推断,这轮升级的核心就是面向代码 Agent 场景的大规模后训练。Flash 版已经用同样的方法把 Agent 能力做到了「基准测试远超 V4-Pro-Preview」的程度,Pro 版只是补上了同一课。
另一个重要变化是多模态。预览版是纯文本模型,正式版首次原生支持图像推理。DeepThink 引擎现在可以在同一个思考流程中分析图片、解读截图、处理混合文档。
这对于需要「看图干活」的 Agent 场景来说,是从无到有的突破。
价格方面,每百万 token 输入 3 元、输出 6 元,和预览版持平。
虽然 8 月 6 日
02
天花板和脾气
跑分好看只是门票,真正有意义的是拿真实任务去试。
极客公园用 V4 Pro 正式版跑了三个不同方向的测试,试图回答一个问题——这个模型在「一次性生成完整可运行代码」这件事上,到底到什么水平了?

第一个任务是 Boids 群体涌现模拟。要求在 Canvas 上实现 200 个三角形 boid 的群体行为,带分离/对齐/凝聚三个可调参数、彩色轨迹、点击生成捕食者、glassmorphism 风格控制面板。这是一个涉及物理模拟、实时渲染和 UI 设计的综合任务。
V4 Pro 用了大约 170 秒,生成了 761 行完整 HTML。打开浏览器,200 个彩色三角形在黑色背景上游动、聚散、避障,拖动滑块可以实时改变群体行为模式。效果流畅,代码一次运行通过。

第二个任务故意模糊——用中文告诉它「我想要一个好看的番茄钟工作面板」,只给了「能计时、能记录、有白噪音、中文界面、要有质感」这几个方向,其余让模型自行决定。
V4 Pro 交回来 1223 行代码,除了基础的 25/5 分钟计时功能,它自己加了任务标签、专注统计图表、快捷键支持、甚至用 Web Audio API 从零合成了几种白噪音。
对模糊需求的「产品化补全」能力,确实比预览版有明显进步。

第三个任务是寻路算法可视化,要求实现 BFS、DFS、A* 三种算法的逐步动画、可交互的网格画墙、迷宫自动生成。这个任务的代码量最大,也是翻车最多的地方——但翻车的方式本身就很有意思。
开着默认的 thinking 模式,V4 Pro 用了 16384 个 token 的输出配额,其中 13394 个花在了「思考」上。留给实际代码的不到 3000 个 token,直接截断,HTML 写到一半就断了。
关掉 thinking 模式重跑,54 秒就输出了完整的 715 行代码,寻路动画、迷宫生成、暗色主题一应俱全。
这不是一个 bug,而是 V4 Pro 正式版的一个真实特征——thinking 模式在复杂代码生成场景下,推理 token 可能占到输出的 80% 以上,反而挤压了实际内容的空间。
对于需要大段代码输出的任务,开发者可能需要主动关闭 thinking,或者大幅提高 max_tokens 来兜底。
03
大鲸鱼的位置
经过 API 实测之后,坦率地说,V4 Pro 0813 不是一张「全面碾压」的成绩单。
HLE 不使用工具时 42.7 分,落后 Claude Opus 4.8 的 49.8 和 Fable 5 的 53.3。NL2Repo 以 61.5 落后 Opus 4.8 的 69.7。有
纯知识推理和最复杂的软件工程任务,V4 Pro 还没有坐上头把交椅。
但
每百万 token 输入 3 元的价格,大约是 Fable 5 的十分之一、
在 Agent 能力从「几乎不可用」暴涨到,「能和头部闭源模型正面对打」之后,这条定律的杀伤力比预览版时期大了一个量级。
更值得关注的是藏在 V4 Flash 正式版更新日志里的一行小字——评测使用了「
如果说过去大家的竞争还停留在「谁的模型更聪明」这个维度,那 Harness 的出现意味着竞争正式进入下一阶段——不是比谁的大脑更好,而是比谁能把大脑、手脚和工具箱组装成一个真正能替人干活的系统。
V4 Pro 正式版补齐了大脑这一环。接下来,就看那个「即将发布」还要等多久了。

