当前,AI Agent已能够接入真实的量子硬件操作场景。然而,仅依赖单次正确结果并不足以确保其可靠运行,因为幻觉可能导致严重的物理损失。为解决这一问题,相关团队提出了验证自治概念,并构建了配备真实物理动态反馈的虚拟量子实验室Quantum-Harbor,同时开发了覆盖多维度量子工程任务的QIQCBench评测集。该评测集采用全新的证据绑定评分机制,用于核查AI结论的证据支撑性、资源使用的合理性以及结果的物理鲁棒性。团队对17个主流顶尖AI Agent进行了压力测试,结果显示不同模型间存在巨大差异。多数模型在资源约束和未知物理场景推断等方面暴露出不可靠问题,仅有头部模型展现出自主量子工程的可行性。目前,虚拟实验环境与评测套件已对外开放,并同步启动了相关挑战赛,旨在推动AI在精密科学领域的自主能力进一步提升。