腾讯混元Hy4 preview首发实测:姚顺雨的“新作业”能打多少分?
来源:凤凰网 3 小时前

撰文 | 骁 云

编辑 | 郝 鑫

8月28日下午,没有发布会,没有预热海报,腾讯混元新一代大模型Hy4 preview悄无声息地上线了。官方定位很直接——“为生产力而生”。

我们第一时间上手,在WorkBuddy中做了一系列实测。把结论放在最前面:Hy4 preview不完美,价格不是最能打的,也出现了长思考延迟、preview版本天生不稳定性等问题。

但在我们在测试了,长文档处理、代码生成、数据分析、游戏原型、科研阅读等功能过程中,它都呈现出经得起检验的实战表现。

腾讯没有选择做一个“全能但平庸”的通用模型,而是押注“生产力”这个垂直场景,这条路走得还算扎实。

Hy4 preview还只是早期版本,如果正式版能补齐多模态、优化稳定性并保持价格竞争力,它有望成为2026年下半年开源大模型领域最能干活的选项之一。

模型不在大,能干活就行。Hy4 preview正在用实测结果证明,它不是来凑热闹的。

一、参数与价格:账面数据漂亮,实测能不能打?

先看账面参数。770B总参数、49B激活参数(MoE架构)、1M上下文窗口。放在 2026年8月的大模型市场,这个配置算不上“惊为天人”,但绝对够看。尤其是上下文从Hy3的200K直接拉到1M,翻了5倍。

定价方面,输入6元/百万tokens,输出18元/百万tokens,缓存命中只要0.3元/百万 tokens。价格比DeepSeek V4 Pro贵,但比Kimi K3和Claude Opus 5便宜,处在中游位置。

账面数据终究是数字。1M上下文到底有没有注水?我们直接“暴力填塞”做了一轮实测。

下载《三体》三部曲完整PDF文件,再加上一份某科技公司2025年年报 PDF,约93万token的超长输入,一次性扔给Hy4 preview。

提问很刁钻:“罗辑在哪些章节提到过‘黑暗森林’?请列出至少5处具体段落,并对比年报中‘投资策略’部分是否有类似‘谨慎观察’的表述。”

结果有点意外。总生成时间约九分钟,这比我想象中快,原本以为这种量级要等二十分钟以上。更意外的是回答质量:它准确罗列了8处“黑暗森林”相关段落,而且精确到章节。

同时指出年报中没有“黑暗森林”这个词,而年报确实有与“谨慎观察”相近的措辞,逻辑上做了类比但没硬扯关系。最后还补了一句:“年报更接近章北海式的‘前进’,而非罗辑式的‘藏好’”。

总体来说1M上下文没有虚标,跨文档联合检索能力在线,缓存策略有效。不足的是,在实时交互场景下,生成时间仍有优化空间。

二、代码能力:从28分到64分,一次“暴力”跃迁

代码能力是Hy4 preview升级的重点,没有之一。官方数据显示:Terminal Bench 2.1拿下85.4分,追平Claude Opus 5;DeepSWE 从Hy3的28.0分直接翻倍到64.3分;163名腾讯内部专家盲测,均分 2.99/4.00,压过GLM 5.3(2.92)和Kimi K3(2.94)。

数据好看,但我们更关心一件事:实际写出来的代码能不能用?

实测任务:生成一个带交互的待办事项App

提示词很具体:“用HTML+CSS+JavaScript生成一个完整的待办事项应用,支持添加、删除、标记完成;数据保存在localStorage中;Material Design风格;有深色模式切换;代码要完整可运行。”

Hy4 preview返回了三个文件(整合在一个 HTML 中),总计约650行代码。双击打开,添加待办、点击复选框标记、删除按钮移除条目、刷新页面数据、右上角一键切换深色模式,所有功能均跑得通。

有两个细节让我印象很深。第一是深色模式的配色方案,该方案不是简单的黑底白字反转,而是用了#1a1a2e、#16213e、#0f3460 这套灰蓝过渡,视觉舒适度很高,明显不是模板套用。第二是代码注释,每个函数都有中文说明和变量命名规范,这对后续维护很友好。

当然也有小问题。删除按钮没有二次确认,误触就直接删了;移动端适配略粗糙,在手机屏幕上按钮间距偏小。整体水平大约相当于一个中级前端工程师30-40分钟的工作量。

从Hy3到Hy4 preview,代码生成能力的提升不是渐进式的,是肉眼可见的“跃迁”。尤其是处理“完整可运行”这类复杂约束时,Hy3经常丢三落四,要么忘了localStorage,要么深色模式只改了一半,Hy4 preview基本一次性给全。

三、办公与数据分析:一分半干完人工两小时的工作

办公场景是Hy4 preview 定位的“生产力”核心。我们直接上真实工作流,不搞花架子。

实测任务:销售数据分析并生成HTML报告

提供一份模拟的2026年Q2销售数据CSV(2800 行,字段:日期、地区、产品类别、销售额、订单量),同时上传一份2026年Q1的PDF版季度总结报告。任务有三条:分析Q2各地区的销售趋势;找出增长最快的产品类别;与Q1对比,生成带图表的HTML报告。

Hy4 preview的处理流程很清晰:先用Python在WorkBuddy沙盒中读取CSV,按地区汇总季度销售额、计算环比增长率。然后从 PDF 中提取Q2的关键数据:七地区4到6月全部正增长,618红利全域共享。季内斜率最陡的是西北(+50.5%),最平缓的是华东(+32.8%)。最后生成一份完整的HTML报告,内嵌Chart.js绘制了柱状图和折线图。

报告质量在及格线以上。结论部分明确写道:“Q2华东地区销售额环比增长23.4%,主要驱动力来自智能家居品类,相比Q1该品类增长提速明显。”图表配色专业、数据标注清晰,不是那种“丢一堆数字让你自己看”的半成品。

整个任务从上传文件到产出报告,总耗时约1分13秒。

抛开人工核验在不考虑异常值分析的因素下,但单论“数据清洗→汇总→可视化→报告生成”这个链条,Hy4 preview的效率优势是碾压级的。

Hy4 preview跨文档能力也比预期强。它能把CSV里的数字和PDF里的文字描述准确对应起来做对比,而不是各说各话。缺点是报告没有对异常值的深入分析,属于“能做初稿,但别指望直接交付”的水平。

四、游戏开发:一句话生成可玩原型,480行代码直接跑

官方宣称 Hy4 preview 支持通过MCP接入Unreal与团结引擎,以纯对话从零生成可玩Demo。我们手边没有Unreal环境,于是换了个更轻量的方式测试,让它在网页端生成HTML5小游戏,看看“一句话出原型”的极限在哪里。

实测任务:生成3D射击游戏

提示词:“用HTML和Three.js生成一个3D第一人称射击游戏。鼠标控制视角旋转,WASD控制移动,左键射击。场景中有随机移动的红色敌人,击中得10分,敌人碰到玩家扣一条命。共3条命,显示在屏幕左上角。所有代码在一个HTML中。”

Hy4 preview生成了约480行代码,打开后在浏览器中直接运行。鼠标拖拽视角顺滑无卡顿,WASD移动响应灵敏。射击命中判定用了Three.js的Raycaster,点击左键时从相机中心发射射线,击中敌人后敌人分数加8,同时新敌人在随机位置重生。敌人的移动逻辑是“随机游走+轻微趋向玩家”,这个混合行为比纯随机更有挑战性,且代码中通过权重系数控制两种行为的比例,说明模型理解的是“行为设计”而非“背固定逻辑”。

当然,上面测试效果离商业游戏还差得很远。尽管没有关卡设,没有复杂粒子特效,没有多角色支持,但作为一个原型验证工具,效果已经足够。

Hy4 preview的价值不在于帮你做完整个游戏,而在于让非专业开发者(或者独立游戏开发者)能在5分钟内验证一个玩法创意是否“好玩”。如果原型阶段都觉得没意思,那就不用往下做了。这种快速试错的能力,才是游戏开发场景下大模型最实在的用处。

五、科研能力:百年难题推进2%?我们实测了论文阅读和公式推导

Hy4 preview最令人意外的宣传点是:配合Hyra模型,在三维Blaschke–Lebesgue几何难题上将体积下界从0.380799推进至 0.41104,距离Meissner四面体猜想最终证明只剩约2%的差距。同时在分子动力学模拟中,对32,512原子体系实现了2.0倍提速。

这些我们无法复现,但可以测试它在日常科研辅助上的真实表现。

实测任务:阅读arXiv论文并解释创新点

选取一篇2026年8月刚发表的“图神经网络分子性质预测”论文。

将PDF全文输入(约4万token),直接提问:“这篇论文的核心创新是什么?与之前的GNN方法如MPNN相比改进在哪?实验用了哪些数据集?结果如何?”

Hy4 preview 在五分钟内给出了清晰回答:核心创新是“首个面向‘科研诚信’的LLM基准”;三维解耦评测中,Q1为不端行为分类、Q2为伦理行动推理、Q3是基于JSON研究工件的决策;总分范围60.9–72.8,均值68.7,模型间仅差11.9分,说明各家族的对齐方式收敛到了同一批失败模式。关键是它自动引用了论文中的表中的数据,而不是编造数字。我们后面用人工核对了一遍,准确无误。

追加一个数学题:∫₀^∞ e^(-x²) cos(2x) dx,要求推导过程。Hy4 preview给出了完整的复变函数法推导,步骤清晰,最终结果√π/2 * e^(-1),完全正确。

还提供了结论总结以及相对应的图表。

整体来说,虽然离“证明百年猜想”还有十万八千里,但作为科研助手,处理日常论文摘要、公式推导、文献对比已经足够实用。尤其是不需要额外训练就能直接理解arXiv PDF的格式,省去了手动复制粘贴的麻烦。

六、不足与争议:实测中遇到的“翻车”时刻

夸了这么多,说点实在的不足,都是实测中亲眼见到的。

第一,“过度思考”问题。 让它分析快速排序在特定数据分布下的时间复杂度变体,它反复“思考”了约半个小时,中间输出3次“让我再确认一下”的中间状态,最终答案正确但等待体验很差。在需要快速交互的场景下,这种“自我验证”倾向会打断思路。

第二,稳定性有待加强。在Workbuddy并发调用多个任务,有两次返回超时,一次次生成中断(只输出了前半段代码)。作为生产力工具,这种不稳定在关键生产环境可能会造成事故。

简体中文 English