量子计算一直被认为是 AI 最难攻克的“硬核”应用场景之一:设备昂贵、环境极端、操作复杂,而且每一步实验都依赖研究者的实时判断。但 OpenAI 最近发布的一则案例显示,GPT-5.6 Sol 配合 Codex,已经开始在 MIT 的量子实验室里“自主打工”了。

事件概述:当 AI Agent 走进量子实验室

OpenAI 于 2026 年 9 月 8 日发布了一篇案例研究,主角是 MIT 工程量子系统小组(EQuS)的研究生 Beatriz Yankelevich。她将 GPT-5.6 Sol 与 Codex 结合,直接接入实验室的协调软件,尝试让 AI 自主完成量子比特(qubit)的测量与校准流程。

结果颇具启发性:在信号清晰的标准流程中,GPT-5.6 Sol 能够独立完成一整套校准测量——从识别量子比特的跃迁频率,到校准控制与读取脉冲,再到测定量子信息的保留时间。这让 Yankelevich 可以将大量时间从“盯实验”转向“设计实验”和“分析数据”。

这一案例的核心看点不在于 AI 做了多复杂的科学发现,而在于它展示了 AI Agent 在真实物理实验闭环中的可行性:控制硬件、读取数据、分析结果、决定下一步——这是 AI 从“对话助手”走向“科研协作者”的重要一步。

关键技术点:为什么量子比特校准适合 AI Agent?

量子比特与“人工原子”

超导量子比特常被称为“人工原子”,因为它们和真实原子一样,只能占据特定的能级。研究者通过微波脉冲将量子比特在不同能级之间切换,并探测其量子态。返回的信号经过数字化和分析后,能揭示每个量子比特的关键参数:

  • 谐振频率:实现精确控制的必要条件;
  • 量子信息保留时间:决定量子比特能在多长时间内保持相干;
  • 计算所需的各种脉冲参数:进一步执行量子逻辑操作的基础。

这些测量工作本质上高度重复、且由软件全流程控制,天然适合自动化。

相互依赖的测量流程

校准量子比特并非一次性操作,而是一连串相互依赖的测量:每次测量的结果都会直接影响下一步的参数选择。而且,量子比特的属性可能会漂移,意外的物理行为会导致结果不一致。有经验的研究者能识别这些变化并动态调整策略。这种“软件控制 + 重复测量 + 自适应决策”的组合,恰好是 AI Agent 擅长处理的问题范式。

Codex 的实验工作流

Yankelevich 的具体做法是:

  1. 向 Codex 提供测量技能包,说明如何运行和评估每类实验;
  2. 让 GPT-5.6 Sol 基于芯片设计目标,自主选择测量参数;
  3. Codex 操作实验硬件,采集数据;
  4. AI 分析结果后自行决定:是“细化当前测量”还是“保存结果并进入下一步”。

在信号清晰的情况下,Codex 几乎不需要人工干预,就能跑完一整条标准测量序列。

亮点与局限:一个诚实的科研自动化案例

OpenAI 的案例研究中也如实指出了当前模型的能力边界:

GPT-5.6 Sol 在实验信号微弱或噪声较大时表现不佳——它需要更长时间才能找到合适的测量参数,有时还需要经验丰富的研究者介入。这说明当前 AI Agent 能处理定义清晰的实验流程,但解释模糊的物理结果仍然是一个挑战。

这个“诚实陈述”非常值得肯定,也是我认为这篇案例中最有信息量的一句话。它清楚地划出了当前 AI 在科研自动化中的适用边界:流程自动化是可行的,科学判断仍需人类兜底。

对 AI Agent 与数据科学落地的意义:从“工具”到“操作员”

1. Agent 的“技能系统”是关键

Yankelevich 并不是简单地让 GPT-5.6 Sol“自由发挥”,而是为它构建了一套结构化的“技能”系统——告诉它每类实验怎么跑、怎么评估。这与目前 AI Agent 领域的“工具调用(Tool Calling)”和“技能库(Skill Library)”方向完全一致。

对于数据科学团队来说,这个思路可以平移借鉴:如果一个 Agent 要自动完成数据清洗、特征工程和模型调参,同样需要为它预设一套标准的操作协议和评估准则。

2. “夜间无人值守”模式带来的效率革命

Yankelevich 在案例中表示:

“我可以让 Agent 在夜间或我在洁净室工作时连续运行数小时的测量实验。我可以从手机上查看它们的进度,并在需要修复或探索新方向时进行引导。”

这实际上是把人类从“实时监控”中解放出来,转向“异步管理”。对于日常需要跑大量实验的数据科学团队来说,这种“人在环路之外(human-off-the-loop)”的运作模式极具参考价值——前提是 Agent 不会在异常情况下造成不可逆的破坏。

3. 理论、实验、芯片设计的多 Agent 协同

另一个值得关注的细节是,Yankelevich 已经搭建了覆盖测量、理论和芯片设计的 Agent 基础设施,并且可以让多个 Agent 同时解决不同问题。她本人则专注于更高级的工作——解释结果、设计实验、规划 Agent 的下一步任务,以及阅读和写作。

这意味着 AI Agent 之后,科研人员的角色正在变化:从“亲手做实验的人”变为“设计实验并协调多个 AI 助手的人”。这和“提示工程(Prompt Engineering)”之后的下一代人机协作模式——Agent 编排(Agent Orchestration)——是完全一致的。

我的技术点评:AI 科研自动化的“里程碑”还是“试金石”?

作为一个长期关注 AI 工程化落地的从业者,我认为这个案例的意义可以拆成两个层面来看。

在技术层面,这是一个相当扎实的工程示范。 量子比特的校准涉及硬件控制、信号采集、实时分析和条件决策等多个环节。GPT-5.6 Sol 能端到端地跑通流程,说明大模型配合结构化工具,已经足以胜任真实世界中一部分严谨的实验操作。这比在基准测试上刷分“更具含金量”,因为它面对的是真实物理世界的噪声和不确定性。

在科研范式层面,这是一个值得参考的“人机分工”样本。 案例中最核心的信息是:AI 负责“执行”,人类负责“判断”。Yankelevich 不追求让 AI 完全替代研究者,而是让 AI 接管那些耗时但定义清晰的工作,把人类认知资源集中在最需要的创新环节。这比很多“全自动科研”的宏大叙事更加务实——也可能更接近 AI 在科学发现中的真实落地路径。

不过,我也必须指出其中的“幸存者偏差”风险。 这个案例使用的是 EQuS 小组的标准测试芯片,工作流本身已经相对成熟。案例原文也明确表示,AI 在弱信号和噪声场景下表现不佳。因此,这篇文章展示的并不是通用科研 AI 的诞生,而是特定场景下的一项高级自动化工程。大规模、全自动、可迁移的 AI 科研系统,目前尚未出现。原文数据显示,这种标准芯片的特征化原本可能需要研究者数天时间,EQuS 目前已经常态化使用 Agent 处理日常测量工作——仅就单位时间产出而言,提升是明确的。

另外需要说明的是,关于实验中量子比特的具体相干时间数值和其他硬件参数,原文未作披露。

这个案例让我想到一个更深远的问题:当实验操作本身变得廉价和自动化之后,什么才是科研人员的核心价值? Yankelevich 的实践给出了一个可能的答案:提出正确的问题、设计有意义的实验、以及对模糊结果的科学直觉。如果说 AI 正在把科研从“手工作坊”推向“工业化”,那么人类的角色正在从“执行者”变成“决策者”——这个过程未必轻松,但值得期待。

原文链接:How GPT-5.6 Sol helps run quantum computing experiments