谷歌新研究:AI「做梦」实现自我进化,探索策略优化新路径
1 小时前

谷歌研究人员提出Dream-RSI方法,该方法通过让AI在历史探索记录中“做梦”来优化策略。具体而言,Dream-RSI将历史数据转化为模拟环境,并构建“发现树”来模拟新策略的执行,从而降低计算成本并提升探索效率。其运作分为三个阶段:首先,基于真实探索生成发现树;其次,利用大语言模型生成并筛选新策略;最后,将优化后的策略投入真实环境以扩大模拟范围。实验结果显示,与固定策略等基线方法相比,Dream-RSI在调用次数、耗时和性能上均展现出显著优势,尽管在部分任务中略逊于其他方法。此外,研究还发现显式输入历史“经验教训”反而会导致性能下降。目前,相关论文、项目页面和代码库已公开。

简体中文 English