在办公Agent这条赛道上,阿里、腾讯、百度已经短兵相接,现在字节终于是坐不住了。
根据报道,字节把TRAE、扣子(Coze)团队整体并入
其实这次调整是有迹可循的。
往前倒一个月,7月30日,飞书产品团队刚和
只不过字节这一次,迈的步子更大。
可话又说回来了,
原因有很多方面,在产品上,现在的
另一方面,早在6月份,Seed 2.1的官方博客中就曾透露称Seed for Seed是开发团队的发展方向。
而在现阶段,也只有把
1
打开
在用户看来,
可就算提为一级入口,也绕不开另一个更根本的问题,
这个App里同时塞着对话、PPT生成、视频生成、图片设计、数据分析……功能密度高到离谱。一个办公用户想干件正经事,得先在一整个万能工具箱里翻找螺丝刀。
办公用户要的是专注的工作流,不是一个什么都装的杂货铺。
竞争对手早就看明白了这一点。
腾讯的
阿里的
2026年被业内叫“办公Agent元年”,三大厂在入口上已经短兵相接。当对手都亮出了独立的武器,字节就不能把主力装备塞在聊天App里。
7月30日飞书并入
原飞书的“Aily智能伙伴”,也已经被
以前
8月17日,手机远程控制电脑上线,手机远程调文件,文件分散在公司、家里两台电脑也没关系,可以分别调取再合并。
8月18日,Windows虚拟桌面跟上,AI在一个隔离的虚拟桌面里跑任务,你自己的电脑该怎么用怎么用,互不干扰,本地模式数据留在本机,云电脑模式持久在线,就算电脑关机,任务照样跑。
8月20日,侧边工作台上线,对话页右侧多出一排多标签,能打开本地文件、飞书文档、在线网页、代码,AI对话与实操同屏进行,文档里生成的内容直接回写,省去复制粘贴,官方表述叫“实时同步留存”。
8月21日,技能商店、连接器、工作伙伴三件套一口气上齐,平台已上架超过200个技能和连接器,还能把常用的工作步骤、交付标准、参考模板沉淀成自定义技能,反复复用。
一周之内,几乎一天一更新。
这也就是开头所提到的,这一周的高频上线,与其说是产品迭代,不如说是战前总动员。
钥匙已经配齐了。门,马上要开。
2
6月23日,火山引擎2026夏季 FORCE 原动力大会,
官方给它的定位是“面向真实生产力场景的全新智能体”。最关键的转变在于评估标准,从2.1开始,不再盯着以前常见的静态基准,转而瞄准了“在实际工作流中的表现”。
火山引擎总裁谭待表示,只有当模型能力跨越“质变点”,才能真正满足生产场景需求。
回到能力本身,先看能打分的。Agent方向,在衡量真实工作任务经济价值的GDPval 上,Seed 2.1 Pro 拿到87.9分,作为对比,GPT-5.5是84.9,Claude Opus 4.7是82.7;在考察MCP工具调用的MCP-Atlas上拿到83.8,同样高过这两家。
在移动端,手机GUI任务的MobileWorld上拿到了73.1,是参评模型最高分;Agents‘ Last Exam上,完整通过率19.5%、综合得分41.9%,高于Claude Opus 4.7的40.5%,但低于GPT-5.5的47.9%;OSWorld 上拿到了0.788,在llm-stats收录的20个模型里排第一,还通过强化学习把完成任务的平均步数砍掉了 16%。
编程方向,Terminal Bench 2.1得71.0,接近Claude Opus 4.7的71.7;SciCode科学代码59.8,超过了GPT-5.5的58.4;NL2Repo-Bench仓库级代码生成47.0,也高过了GPT-5.5的45.1
在多模态理解方面,复杂文档理解CharXiv-RQ 86.4、MMMU-Pro 82.7、视频理解VideoMME 89.2。
但问题来了,这些能力如果全都埋在一个功能爆棚的聊天App里,对于模型来说其实是一种伤害。
在Agent的技术栈里,有一个概念叫做意图(Intent),它和我们大众认知里的意图差不多是一回事,是整条执行链的锚点。
用户说一句话,模型的第一件事不是急着回复,而是判定意图“你到底想让我干什么”。只有判定了意图,再把它拆成子任务、选定工具、一步步执行,最后校验和交付。整个Agent能够运行,本身就都是围绕意图来的。
意图错了,后面每一步都白做;意图模糊,模型就得反复猜测,把算力浪费在“猜你要干嘛”上,而每次任务的算力都是有限的。
一个输入框背后,又是对话,又是视频、图片、打电话、云盘、浏览器。
模型拿到一句“帮我把这个做成PPT”,得先在一大堆意图里做排除,是生成?是编辑?还是聊天聊到 PPT?
每一次猜测,都要烧掉本该留给“干活”的推理预算。功能越臃肿,意图越难判定,模型把越多精力花在“猜”上,那么留给“做”的算力就会越少。
更麻烦的是,聊天不保存意图。
传统聊天是一问一答,每轮独立、上下文随窗口滚动,模型不需要为同一件事持续负责。可办公是长程任务,比如写一份报告,那就要查资料、读文档、改图表、反复迭代,意图必须贯穿始终,每一步都要记得“我为什么在这里”。
这靠的是任务状态持久化,是把整个流程兜在一个独立的执行环境里。而聊天App天生“答完就算”,意图活不过一个回合。
再往底层看,是对齐方向的问题。模型往哪个方向长,取决于它在什么场景里被评测、被训练。
天天在聊天App里答问题,它就往“会聊天”长。只有当评测标准变成了“活干没干成?”、“干得好不好?”,它才会往“能干活的Agent”长,这也是为什么6月Seed 2.1放出来的基准都是些办公Agent相关的。
所以拆分是技术层面的必然,产品外壳先替模型把意图锁死,用户进的是“工作模式”,意图从一开始就是“干活”,模型不用再猜,独立的执行环境再负责把意图一路扛到任务结束。评测和训练,也终于能对着真实工作流发力。
而这一切的终极方向,是Seed 2.1官方博客的那句:Seed for Seed。
核心逻辑就一句话,让Seed模型以Agent的身份参与到Seed模型自己的研发流程里,即自进化。
传统大模型研发是“人发现问题→人写代码→人跑实验→人调参数”,整个周期非常长。Seed for Seed是让模型自己参与诊断、数据合成、框架优化和实验验证,很多环节可以并行自动化跑,缩短研发周期。
Seed for Seed的研发流程本身就是一个极致复杂的办公Agent场景,这和用户用
换句话说,字节在内部最高难度的知识工作场景里已经启动了大模型版的“
办公Agent不是从零做的产品,它是Seed for Seed技术能力向下兼容的出口。
反过来,办公Agent积累的海量真实用户任务数据和反馈,又可以作为Seed for Seed的训练和验证素材。
这就形成了一个双向循环,内部研发场景往上探,外部办公场景往下收,两边共用同一套Agent底座。
3
所有产品和技术层面的动作,最后都要落到人上。
8月的年中全员会上,梁汝波把字节的业务战略原则概括成11个字:“高度优先,粗主干,优化长期。”
这是字节年内第二次开全员会,一年一次的惯例被打破了。核心业务只留三个:AI、信息平台、交易服务。
“粗主干”的意思是把枝枝蔓蔓都砍掉,资源往一个口子里灌。抖音是现有的主干,而
TRAE和扣子并入
站在这场整合中心的,是赵祺。
TRAE和扣子并入后,产品和运营团队统一向赵祺汇报,不到一年,赵祺从
TRAE本身做的是AI编程IDE,扣子做的是低代码Agent平台,各自在Agent方向上进行探索。
调整后,就从“技术探索”型的部门转成了“产品落地”型的部门。这正是“粗主干”的组织含义,减少中间层,让资源直接灌到一个口子。
TRAE被拆成了两半,TRAE Work通用办公部分融进
扣子的智能体平台能力被
然而这也是把双刃剑。
TRAE和扣子挂在工程架构部的时候,本质是双轨实验。各跑一条线,考核的是技术指标、开发者生态和技术影响力,相互之间没太大交集。
现在统一划到产品负责人旗下,说明实验结论已经有了。字节不再需要两支技术团队各自证明方向,而是要把所有能力灌进一个产品里,跟
技术理想让位于产品KPI,一部分人可能不适应;但反过来,打磨了两年的能力终于有了规模化触达用户的通道,不用再在内部赛马里内耗。

