量子计算的Vibe Coding时刻:AI重新定义量子编程

“过去,这类实验通常需要一支高度专业化的量子计算团队才能完成。而现在,有了这个智能体,我一个人坐在家里的沙发上就能完成。”
法国量子计算公司Pasqal联合创始人Christophe Jurczak和他的同事将AI智能体接入Pasqal的量子软件栈和云端量子计算机。研究人员只需输入一句自然语言指令,智能体就能自主完成从阅读论文、提取实验方案,到生成脉冲序列、仿真验证,再到提交真实量子处理器执行的完整流程。
《自然》杂志将其称为量子计算的“Vibe Coding”时刻:AI正在让原本需要深厚专业知识和复杂编程的量子实验,变成通过自然语言即可完成的操作。这项研究题为《Lowering the implementation barrier of neutral-atom quantum computing with agentic workflows》(arXiv:2607.25834)。
一、硬件不再是瓶颈,难的是把论文变成真机实验
论文开篇点出了行业的真实困境:量子处理器已经不再稀缺。中性原子量子计算机通过云端和超算中心对外开放,比特数天然可延伸至百到千量级。然而,从一篇发表的论文或专利,到真正在量子处理器(QPU)上跑起来的实验,中间横亘着一条漫长的工程链:从文献中提取协议、翻译成设备级控制、做仿真验证、对接云端执行基础设施、再解读带噪声的数据。每一步单独看都不难,但整条链要求研究者同时精通量子物理、软件工程、数值仿真、云计算和硬件表征。结果是:大量物理上可行的方案,仅仅因为“实现成本”高于“提出想法的成本”而被搁置。
作者认为,这本质上是一个跨领域的协调问题——恰恰是大语言模型智能体(LLM agent)擅长解决的那类问题。
二、系统是怎么搭的:六个技能模块,仿真必须先过关
这套系统构建在Pasqal现有软件栈之上:开源脉冲设计库Pulser、矩阵乘积态仿真器emu-mps和Pasqal Cloud SDK。整个工作流被拆成六个模块化的“技能”:从论文/专利中提取实验规格(paper_to_spec)、把规格编译成脉冲序列(spec_to_sequence)、无噪声与含噪声仿真验证(validate_emu、noise_emulate)、提交云端硬件执行(qpu_submit)、以及结果分析(harvest_and_analyze)。底层使用的是Anthropic的Claude Code,模型为Opus 4.8和Fable 5。
设计上有两个关键点值得注意。其一,所有技能共享一份机器可读的实验规格文件(experiment_spec.json),它是研究者与智能体之间唯一的接口——人可以审查、修改、批准,任何改动都会自动传导到下游所有环节。其二,任何协议必须先过仿真这一关:先做无噪声仿真得到参考预测,再用从云端实时拉取的设备噪声参数做含噪声仿真,两者对比后由研究者决定是否提交真机。
实验在两台云端QPU上完成:位于加拿大舍布鲁克的FC1和位于沙特阿拉伯的SA1。
图1:用于将量子协议转化为硬件实验的AI辅助工作流
三、三个案例:复现经典实验、首次实现理论方案、落地专利算法
案例A:复现七年前的里程碑实验。任务是复现2019年Keesling等人关于Kibble-Zurek机制的经典工作。研究者故意让智能体尝试硬件上做不到的ℤ3相,测试它能否识别限制。智能体给出了准确判断:ℤ3、ℤ4相在FC1上不可实现,但ℤ2相完全可行。转向ℤ2后,在研究者建议下改用环形原子阵列消除边缘效应,分别在FC1上制备56原子环、在SA1上制备96原子环。最终测量的密度关联函数与2019年的原始数据在统计误差内完全吻合(拟合关联长度分别为3.9、4.2、4.2个格点)。更惊人的是效率:不到1小时、仅3条人类提示,任务就在QPU上跑起来了。
图2:最终测量的密度关联函数与2019年的原始数据在统计误差内完全吻合
案例B:从理论论文到首次硬件实现。任务基于Guo等人关于三角晶格里德堡阵列阻挫磁性相的理论研究,此前无人给出硬件实现方案。智能体给出了漂亮的可行性裁决:1/3填充相可行、1/2填充相勉强可行、2/3填充相因失谐上限(|δ|/2π ≤ 10 MHz)不可行。但它也暴露了关键缺陷:在四个候选观测量中,它选择了最容易计算的“平均磁化强度”,而不是真正能认证该物相的交错磁化强度。由于整条流水线跑得很顺畅、数据看起来很合理,这个错误只有领域专家才能发现。案例A只需3条人类消息,这个案例却经历了43轮交互才达到物理上正确的实现。

图3:Pasqal QPU实测数据(蓝/橙色点)虽然受限于硬件噪声而低于理想QMC曲线,但与带噪声的仿真包络线(蓝色阴影)完美吻合,证明智能体成功在真实QPU上捕捉到了相变趋势
案例C:把专利变成多轮算法流水线。输入源是一篇Pasqal专利——用“投影-驱逐”算法估计图的色数。智能体自主设计了相当复杂的工程方案:用开放批处理(open batch)一次编译、多轮提交,以束搜索(宽度3、每轮200次采样)维护候选着色,再加经典修复步骤。在75个随机单位圆图实例(原子数15到80)上,N=20时QPU给出精确色数,最大偏差不超过2。但这个案例也贡献了最典型的失败:面对异常高的约束违反率,智能体自信地诊断为“里德堡阻塞泄漏”这一物理原因——真实原因却是原子坐标与比特串排序不匹配的低级标注bug。一个貌似合理、实则错误的物理故事,再次只有靠专家审查原始数据才被识破。

图4:智能体在Pasqal QPU上求解图着色问题(最高80原子)的表现:其实测色数与经典最优算法极其接近,平均色数差距仅为0.84且最大差距不超过2
四、扫描633篇论文:近一半今天就能上机实现
论文的第四部分把同样的智能体方法用到了文献本身。研究者用第二套轻量工作流扫描arXiv,最终获得633篇里德堡阵列理论论文,其中526篇可被自动分类。结果令人意外:258篇(49%)在现有Pasqal QPU上即可实现,其中225篇协议足够完整、可直接翻译执行。其余论文则精确指明了缺失的硬件能力——最需要的是XY型相互作用(141篇)和单格点寻址(87篇),两者合计约占不可实现论文的85%。这等于为未来硬件升级提供了一份“需求驱动”的路线图。

表1:在智能体成功阅读并分类的526篇里德堡原子阵列理论论文中,有49.0%(258篇)在当下的中性原子QPU上可直接运行或微调后运行
五、这套工作流改变了什么:工程活交给AI,物理判断留给人
作者总结道:操作性瓶颈已经发生转移。智能体极其擅长协调软件工具、导航设备接口、在QPU上生成实验;它的局限出现在选择有物理意义的观测量、识别微妙的科学假设、判断实验信号是否真正支持某个物理论断上。如果说有什么变化,那就是研究者的角色比以往更具决定性——假设的提出、批判性评估和对数据的科学解读,依然是不可让渡的人类工作;只不过如今,周边的工程杂务不再来争夺他们的注意力了。
论文还展望了一个实际的好处:当科学协议被翻译成结构化、可执行的规格,论文就可以从静态的文字描述,变成可被反复验证、迁移到新设备的“可执行实验档案”,为科学可复现性提供一条新路径。
按照作者的说法,最终最具变革性的量子应用,将来自更广泛的科学社区——那些不造量子计算机、却能带着新问题和独特数据走进来的人。这套工作流正在为他们降低门槛。

