AI播客的三种毛病:脑补、删论据、漏读
来源:36kr 3 小时前

各个信息流平台都在推音频化, AI工具也扑在 “ 一键生成播客 ” 这个形式上。但这个 “ 一键生成 ” ,结果可能并不那么好。 

做深度文章,靠的是实打实的数据、鲜明的立场,还有前后能串起来的逻辑。如果AI播客化连这些底子都保不住,那一键按下去,播客里放的就不是你的文章了。

为了验证这个,我从我们以往的文章里节选了两段素材,交给扣子去重构内容并录制播客。

第一段内容是不到六百字的财务分析,我叫它A段,硬数字密集,测的是AI对精确信息的保真度。

另一段三百多字,我叫它B段,立场极端、隐喻密集,测的是AI敢不敢保留尖锐判断。

如果这两关都过不了,那“一键生成”就是伪命题。

为了匹配不同的风格,我们选择了严肃对谈、娱乐相声、学术装逼 作为测试方向先拿 A段摸底,看同一批硬数字在三种风格下分别会怎么处理。 

B段只跑严肃和相声,深挖看看极端立场在严肃对谈里能不能保留,在娱乐相声里会不会被稀释成段子。学术风没跑B段,因为B段术语少,测不出学术风特有的漏词问题。

我们整体进行了多次测试,第一天A段相声模式的音频声线全乱,第二天B段相声声线几乎全女声还自动压缩,两天都翻车。第三天我用同样指令再跑一次,看这个风格到底能不能用。

对比的基准是微信文章阅读本身的“听全文”。“听全文”提供的是零改写,像新闻联播,没有情绪。这种"不出错但也不出彩"的状态,就是我们每天面对的现状。拿扣子做播客,本来是想打破这种平庸,结果发现事情没那么简单。

第一天:A段三种风格

我先测严肃对谈。新建对话,输入指令,扣子一次性吐出脚本和音频,五分钟搞定。脚本从五百七十字扩到近一千八,十九个硬数字全在。

我核对原文发现问题。“根本不在一个量级上”变成“差距已经拉开到四倍以上”。“增速掉到了10.42%”变成“几乎腰斩式下滑”。更隐蔽的是,AI在一段尖锐判断后自己加了一句:“最后说一句,我不是说WPS会死,基本盘还在。”素材里没有这句话,它自己补的缓冲。

音频里数字发音准确,问题全在脚本层。这一次,扣子把模糊判断改成了并无出处的精确数字,还给尖锐结论补了一层缓冲。

我换娱乐相声指令。和严肃版不同,这次扣子先出脚本,确认后再出音频。

脚本把不少精确数字给抹平了,小数点后面的尾数被砍掉,15.78%干脆没出现。八个数字被模糊化,一个直接丢了。

但比数字更严重的是声线。脚本写了AB两个角色,A是女声,B是男声。结果音频里B的台词几乎全是女声在念,A的台词也混进了男声。声线全乱了,我根本没法往下听,只能对着脚本一个字一个字核对。双人播客变成单口乱炖。

AI写的梗(“月薪对比马斯克”“小卖部对沃尔玛”)也偏安全牌,没有真正的脱口秀节奏。我要求的交锋没执行,结果变成A主导、B捧哏的吐槽大会。

我换学术装逼指令。同样先出脚本,确认后再出音频。脚本把“写文档、拉表格”升级成“Document Authoring、Spreadsheet Manipulation”,术语密度拉满,十九个数字全保留,甚至带小数点。

但音频生成后,我逐句核对发现漏词。脚本里“Formatting”这个词,音频里直接没了。“数据飞轮转起来,Model Iteration加速”这句也漏了半截。术语一多,就开始漏词漏句。

听感上就是一堆中英文混杂往外蹦,确实装逼,但不知道是真专业还是假专业。你听到的只是碎片,完整句子早没了。

第二天:B段两种风格

第一天A段相声声线完全混乱。第二天测B段时,我在指令里加了约束:“A男声B女声,严格分配,不准混用”。

我先测B段严肃版。素材换成“.md正在杀死.wps”。

“杀死”这个词保留了。但AI在前面加了缓冲垫:“这话听着狠,但事实就是……”关键词没删,但先垫了一层软垫。

交锋质量比A段好,十二轮硬碰硬,B全程为.wps辩护,没倒戈。声线也对了,A是男声B是女声,没串台。

回头看:严肃风信息保真度最高,数字和立场都保留了,但AI会在旁边偷偷加料。

我换相声指令测B段。脚本先生成,有三页纸。然后扣子提示“脚本太长,精简一下”,自动压缩后才生成音频。

压缩掉了什么?“中国十亿打工人,九个半在用WPS”,这段内容没了。“以前你花两百块买WPS会员,买的是排版能力。现在AI三秒给你排好,这两百块还值吗?”这段也没了。

结局也从互不相让,变成“赢家是.ai”。完全变成和稀泥了。

更麻烦的是,这个决定AI在后台就做了,根本没问你。

声线方面,还是同样的问题。几乎全是女声,只有一句“好好好,我换个说法……”是男声。完全听不出是两个人在对话。

第三天:B段相声复测

前两天相声都翻车,第三天我用一模一样的指令再跑一次B段相声。这次脚本七百五十字,扣子没有被提示“太长”,确认后生成音频。声线分配正确,A男B女,没有串台。内容完整,没有被压缩。

这次终于像回事了,分得清两个人在说话,有相声味,但也没那么好笑。

三次相声两次翻车。第一天A段没加约束,声线全乱;第二天B段加了约束,仍然几乎全女声;第三天加了约束,才正常。这个风格本身就不稳定,第三次跑通,反而像抽卡抽中了。

注:学术装逼风格仅测试A段,B段未覆盖。

总结

把这些放在一起看,严肃风保真度最高,但AI在旁边偷偷加料,模糊就脑补,尖锐变温和。相声风问题最杂,数字被抹平,论据被压缩,声线分配三次里两次翻车。学术风是术语一多就漏词漏句。

这次测试只测了扣子,但我看到的改稿倾向反复出现。它把“不在一个量级”翻译成具体倍数,给“杀死”前面加“这话听着狠”,脚本太长时直接压缩掉三分之一。这三种操作,在这次六档音频里没缺席过。

而深度内容恰恰需要"精确、尖锐、有立场"。

那怎么办?

如果非要用AI做播客,几条基于实测的建议:

第一,脚本和音频分步走。先锁死脚本,人工逐句核对后再生成音频,绝不“一键”。

第二,长文最好分段生成。至少能降低脚本被自动压缩的风险。

第三,单声线朗读加人工校对是目前保真度最高的方案。牺牲表现力换完整度。

还有两个方向这次没测,但值得下一轮验证:指令里多写“禁止项”能不能减少脑补;关键数字写成文字(“五十九点二九亿")能不能避免被四舍五入。

在这六次测试里,生成播客都不只是朗读。严肃版在制造伪精确,相声版丢了数字和论据,学术版漏词漏句。

所以这还是一种权衡,选择风格之前,先弄清你到底想保留哪部分的内容。

简体中文 English