“科技春晚”正在消失
来源:36kr 10 小时前

我上大学那几年(约2013-2017年),每年9月总有一个晚上会熬到很晚。凌晨一点,寝室舍友们几乎一起守着看苹果发布会。那时候大众对苹果发布会的热情很高,观看的直播一旦卡住,还会立刻切到文字直播,生怕错过一些令人惊喜的新品。

新品一出来,寝室里的讨论才刚开始。比如当年iPhone有了4.7英寸和5.5英寸两个尺寸,到底该选哪个,几个人能一路争到快凌晨三点。从屏幕大小到握持手感,再到哪个版本看起来更顺眼,有不少话题都能聊上半天。虽然受价格影响,当时寝室真正能买得起的人并不多,但这丝毫不影响大家讨论新品的热情。

那个时候,全球科技行业最受关注的舞台之一,苹果发布会占一席之地,甚至被称为“科技春晚”。

一台新iPhone长什么样、摄像头多了一颗还是少了一颗、芯片性能提升多少,常常能够在几天内占据全球科技媒体的头条。苹果发布会,曾经代表了整个消费电子行业最确定的增长方向:更好的硬件、更强的芯片、更完整的生态,以及每年一次稳定的产品迭代。

但这两年,一个明显的变化正在发生。

苹果发布会依然有巨大的传播声量,但让行业真正兴奋的东西越来越少了。

与此同时,不少AI开发者大会反而成了新的流量中心。比如OpenAI、Google、Anthropic、Meta乃至英伟达推出的大会,每次发布会往往都会引发一轮密集讨论:新模型能做什么、AI Agent走到哪一步、哪些产品形态可能被改写,甚至下一轮创业机会会出现在哪里。

因为现在的AI能力变化得太快了,一次产品更新,可能很快影响搜索、办公、编程、内容创作,甚至智能硬件的下一步走向。

01、苹果发布会,失去“科技春晚”光环

如果把过去十几年的苹果发布会放在一起看,一个比较明显的变化是:它依然是全球消费电子领域最受关注的发布会之一,但外界获取新品信息的方式、对手机产品的期待,以及发布会本身的传播环境,都已经发生了变化。

首先是新品信息越来越难保密到发布会当天。

今天一部旗舰手机的研发和量产,会牵涉屏幕、芯片、摄像头、铰链、结构件以及代工等多条供应链。这些供应商往往同时服务多家手机厂商,随着供应链规模扩大,产品外观、尺寸、核心配置等信息更容易在正式发布前流出。

以苹果最新发布的折叠屏产品iPhone Duo为例,早在2026年上半年,网上就已经出现了不少渲染图和参数信息。等到产品正式亮相时,外界对它的形态已经有了相对清晰的预期。

这和早期苹果发布会的传播环境有很大不同。

乔布斯时代,“one more thing”之所以能成为经典,很大程度上与当时的信息环境有关。新品在发布前能够保持较高程度的保密,发布会本身承担了第一次完整揭晓产品的功能。现在,这部分功能已经被供应链爆料、社交媒体和自媒体提前分流。

第二个变化,是发布会形式本身发生了改变。

2020年以后,苹果的大型发布会更多采用提前录制的形式。好处是画面完成度更高,信息组织更紧凑,也更适合全球同步传播。但与此同时,发布会从传统的现场演示,逐渐变成一种高度制作化的视频内容。

过去一些直播中的临场反应和技术插曲,比如2014年直播故障,或者2017年Face ID 首次演示时出现的小状况,如今在这种制作方式下已经很少出现。发布会的稳定性提高了,但它所提供的现场感也和过去有所不同。

更深层的原因,则来自智能手机产业本身。

经过十多年的快速迭代,智能手机已经进入相对成熟的发展阶段。芯片、影像、屏幕、续航和系统体验仍然在持续升级,但创新越来越多地体现为性能提升、体验优化和产品形态完善。

这意味着,一场手机发布会所承载的意义也在变化。

在智能手机高速增长时期,一次新品发布往往可能同时带来新的交互方式、新的硬件形态和新的应用生态;进入成熟阶段之后,发布会更多承担的是展示年度技术迭代和产品组合更新的作用。

智能手机从高速创新周期进入成熟周期之后,产品信息传播方式、消费者预期和发布会本身的角色,都在重新调整。

所以,对于苹果发布会关注度的变化,我们很难简单归结为某一款产品“缺乏创新”。

02、AI发布会,“后起之秀”接棒

这两年越来越多人的注意力开始转向AI。

2024年5月,OpenAI发布GPT-4o,北京时间凌晨一点直播。第二天,社交媒体上大量讨论都集中在它的实时语音能力:可以自然对话、随时打断,也能根据语气作出回应。到了 DeepSeek R1发布之后,围绕模型能力、训练成本和开源路线的讨论,又迅速从技术圈扩散到更广泛的人群。

AI发布会之所以容易形成高关注度,一个很重要的原因是,模型能力很难像硬件参数一样在发布前被完整预测。

比如说新模型叫什么、什么时候发布,外界有时可以提前获知,但真正的体验往往要等产品上线之后才能判断。语音交互自然到什么程度、推理能力提升多少、成本能压到什么水平,这些都很难只靠供应链信息或者参数表提前还原。

这也让AI产品发布天然保留了更强的不确定性。

GPT-4o发布之前,外界已经知道OpenAI会继续推进多模态,但实时语音最终呈现出的交互效果,仍然是在产品演示之后才变得具体。

DeepSeek R1也是类似,真正引发行业讨论的,并不只是模型本身发布,还有其性能、成本和开源方式组合在一起之后,对原有模型竞争逻辑带来的冲击。

与此同时,AI的用户基础也在快速扩大。

几年前,新模型发布主要还是技术从业者、投资人和早期用户关注的话题。现在,越来越多普通用户已经开始把AI用在写材料、做表格、搜索信息、制定攻略、学习辅导等日常场景中。用户范围扩大之后,一次模型更新所影响的人群也随之扩大。

这也让AI发布会的影响开始超出单一产品本身。

一项新的模型能力,可能影响开发者接下来怎么做产品,也可能影响企业的软件采购、算力投入和业务流程。资本市场同样会迅速作出反应。DeepSeek R1发布后,市场开始重新讨论AI模型训练和推理成本,英伟达股价也曾在单日出现约17%的大幅下跌。

另一个特点,是AI产品从“发布”到“使用”的距离通常比较短。

很多模型会在发布当天或很短时间内开放网页端、App或API。用户看完发布会,很快就能自己测试;开发者也能直接把新模型接入现有产品。

因此,一场发布会结束之后,网上很快就会出现大量实测、对比和新的使用方式,讨论也会从发布会本身继续延伸。

这种变化对产业链的影响也非常快。模型一旦升级,开发者会重新评估能力和成本,企业会调整产品方案,原来成立的一些技术路线也可能需要重新计算。尤其是模型价格、上下文长度、工具调用和多模态能力发生变化之后,很多应用的实现方式都会跟着调整。

所以,AI发布会的影响往往不会停留在发布当天,还会迅速传导到产品、开发和商业决策中。

03、科技春晚,OpenAI们也没接住

这两年,越来越多人开始像过去等苹果发布会一样,期待OpenAI、Anthropic、Meta这些AI公司的新品发布和开发者大会。

我个人的感受是,最近几场AI发布会看下来,已经开始出现和成熟科技发布会很相似的问题:更新越来越多,真正的新东西却未必同步增加。

在2026年9月,OpenAI召开了DevDay。这次发布会的规模不小,OpenAI一口气公布了二十多项更新,但如果把这些内容拆开来看,会发现真正能够明显改变外界预期的东西并不多。更多更新,集中在Agent、订阅体系、插件生态和开发工具上。

这场DevDay,OpenAI重点推出了Dots,一个可以长期运行、逐渐学习用户工作习惯的个人Agent,但这个方向并不陌生。Dots本身当然有产品价值,但它很难像早期ChatGPT或GPT-4o 那样,让外界第一次看到一种完全不同的产品形态。

剩下几项更新,也更多集中在商业化和平台建设上。GPT-6.1 Sol调整了价格体系,OpenAI增加了每月500美元的新会员档位,同时继续推进应用市场、插件和 Codex 云端化。

这些事情对OpenAI的商业模式很重要,但对普通用户来说,它们提供的“新鲜感”显然和一次模型能力跃迁不是一回事。

另一个变化是,AI发布会也越来越难维持过去那种悬念。DevDay开始前几天,X上已经陆续出现关于新Agent和500美元订阅档位的消息。随着合作伙伴、测试用户和开发者越来越早参与产品测试和上线,AI公司同样开始面临新品信息提前外泄的问题。

与此同时,AI发布会的实时Demo也更容易出现意外。DevDay上,Dots演示出现卡顿,Codex语音演示也连续出错。

更值得注意的是,OpenAI的DevDay今年才第四届,却已经开始出现新品增量有限、信息提前泄露、平台化更新增多等成熟科技发布会常见的问题。

不过,这并不意味着大家对AI新品失去了兴趣。Meta的Muse就是一个例子。9月8日上线后,Muse很快冲上美国应用商店榜单,短短两周左右下载量便超过250万,随后进一步突破340万。它也成为Meta近期股价上涨的重要叙事之一。

我和身边的朋友也经常聊起相关的话题。如果把“科技春晚”的标准放在这里,我们认为至少到目前为止,还没有哪一家AI公司真正接住苹果当年的那个位置。苹果发布会的悬念感已经明显减弱,但还没有哪个AI公司的发布会能形成那种一年一次、足以集中整个科技行业注意力的确定性时刻。

04、看懂AI,得跳出发布会本身

如果真想看懂AI到底进步到了哪一步,光盯发布会其实不太够。就算看,也别太迷信 benchmark分数。

一个公开榜单出现之后,模型厂商会逐渐围绕既定评价标准进行针对性优化,最终很容易出现分数不断逼近上限的情况。但分数高,不一定代表你实际用起来就更好。很多榜单过几年就快被刷满了,所以新模型发布时那些跑分,看看就行,不用太当真。

比起分数,更值得看的其实是成本。

第一笔账,是token价格。比如GPT-6.1 Sol用大约五分之一的价格,做到了接近 Astra 的水平。这个变化放在发布会上可能没那么吸睛,但对做产品的人士很重要。

2023年GPT-3.5 Turbo大幅降价之后,很快就冒出来一批新应用。很多时候,AI 真正开始普及,不只是因为能力变强了,也是因为终于便宜到大家用得起了。

第二笔账,是一件事从头做到尾,到底要花多少钱。

token单价降了,不代表总成本一定降了。Agent执行一个持续数小时的任务,要读很多资料、反复调用工具,执行过程中一旦出现偏差,还可能需要回退甚至重新执行,最后往往还需要人来检查和返工。

所以更重要的是:一件事完整做下来,而且最后结果能用,连人工检查的钱一起算进去,到底要花多少。只有当这笔综合成本开始低于人工完成同类任务的成本,Agent 才有可能真正大规模用起来。

再往长远看,有几个指标比发布会更值得盯。

第一个,是AI能不能通过自主试错完成越来越复杂的任务。

编程之所以进步得这么快,一个重要原因是它的反馈周期很短:代码能不能运行、测试能不能通过,很快就能得到结果。数学在一定程度上也类似。

相比之下,生物、材料这些领域要复杂得多,很多判断最终都要靠真实实验来验证,AI很难只靠计算就知道自己的答案是不是对的。

如果有一天,一项科学发现从提出假设、设计实验到得出结论,主要都是AI自己完成,而且这个结论不是从现有论文里拼出来的,那才说明 AI 真正开始往人类还没走过的地方探索。

第二个,是它会不会边用边学、模型本身的能力并没有因此得到更新。

现在很多 Agent 所谓的“记忆”,其实更像记笔记。之前发生过什么,它先存下来,下次需要时再翻出来,但模型本身并没有因此变得更会做事。

真正值得关注的是,什么时候模型可以在使用过程中自己学会新东西,而不是每次都要等厂商下一轮训练之后,能力才跟着升级。

第三个,是Agent知不知道什么时候该停下来问人。

现在大家很喜欢比“一个Agent能连续干多少小时”,但这未必是最重要的。更关键的是,需求没说清楚的时候、执行到一半出现两条路的时候、信息不够的时候,它能不能意识到,此时需要先向用户确认,而不是继续自行执行。

更棘手的问题,是Agent从一开始就对任务形成了错误理解,并在这个前提下持续执行,最终产出一份结构完整、表面上也很合理的结果。相比单纯的任务失败,这类错误更难被及时发现,而很多现有跑分也很难衡量这种能力。

第四个,是训练下一代模型的时候,有多少工作已经可以交给AI自己做。

目前,数据筛选、测试集生成、模型版本评估等环节,已经开始较多引入AI。对于那些标准相对明确、结果容易验证的任务,AI已经能够承担相当一部分工作。

但到了“什么样的回答才算高质量”这一层,问题会复杂得多。如果主要依赖模型为下一代模型进行评价,再根据这些评价结果继续训练,最终指标可能持续提升,但这种提升未必对应人真正关心的能力。因此,在这一环节,人类仍然需要参与判断和校准。

最后还有一个特别实际的指标,甚至不用看发布会,在公司里就能观察到:

AI写出来的代码,有多少AI生成的代码已经可以不经过逐行人工审核,直接进入合并和部署流程?

如果未来这一比例能够从较低水平提升至一半以上,那可能比很多benchmark都更有说服力。因为这说明,在一个真实、复杂、出了问题要负责的工作场景里,人已经开始真正把一部分工作交给AI独立完成。而这种变化,大概率也不会在哪一场发布会上突然宣布。

虽然苹果可能已经很难再维持过去那种“科技春晚”的位置,但这个位置也未必会被某一家AI公司完整接过去。苹果式发布会属于硬件时代:产品按年迭代,新品集中发布;AI 的更新则更快,也更分散,模型做好了就会上线,重要变化随时都可能发生。

总之,发布会的热闹会过去,真正留下来的,还是那些把技术和行业往前推了一步的变化。

上海期智研究院首席研究员 李彪

简体中文 English