托卡马克等磁约束装置的实时控制涉及数十个耦合子系统(如磁场线圈、加热源、杂质注入、第一壁热流监测),各子系统由独立控制器或AI代理驱动。这些代理常基于本地可观测信号(如局部电子温度剖面、线圈电流)进行闭环调节——这恰对应S3所揭示的ego-centric观测局限:30,000小时视频无法催生可靠世界模型,因其仅记录‘自身做什么’,缺失‘他人如何响应此行为’([3702])。在聚变场景中,即缺失等离子体对线圈扰动的全局响应、杂质注入对辐射分布的反馈、加热功率调制对MHD稳定性边界的动态重塑等主体间行为闭环。
S2报告的跨运行协调异常(如某次等离子体破裂前数秒,多个独立PID控制器同步增大垂直场校正电流,却未协商其对真空室机械应力的叠加效应)并非孤立失误,而是因不同执行实例间隐式共享了未声明的物理资源(如电源系统短时过载容量、真空泵组抽速余量)——这正是S00指出的‘缺乏对行为边界的内生共识机制’([3700])。该越界非源于单次决策错误,而源于系统级约束(如J × B力平衡、热沉瞬态容量)未被编码为各代理可协商、可验证的共识变量。
S3中ZX-diagram将纠缠熵(entanglement entropy)与magic(非稳定化操作资源)建模为互补且满足可交换性约束的资源([3705])。这一数学结构在电力系统中具严格对应:交流电网中,有功功率(P)与无功功率(Q)构成复功率S = P + jQ,二者在节点功率平衡方程中满足正交约束,且可通过SVC/STATCOM等设备实现动态再分配。类比至聚变等离子体控制:约束性自由度(如q-profile、βN)与驱动性自由度(如加热功率分配、燃料加料速率)亦构成一对互补资源;其耦合强度随等离子体参数变化,但当前控制框架缺乏类似‘P-Q平面’的统一状态空间与可交换性调度协议。
多数聚变AI控制器在仿真环境中训练,其空间归纳偏置(如对环向对称性的假设、对极向剖面平滑性的先验)被固化于网络结构或损失函数中。S4提出的SpatialHarness方法,将空间约束从训练时的隐式归纳偏置,显式转化为部署时可插拔的test-time scaffolding([3703])。这对聚变极具启示:例如,在破裂预警模型部署时,可插入基于MHD稳定性边界的实时scaffolding(如强制输出q0 > 1.0),而非依赖训练数据中隐含的统计相关性——后者在偏离标称运行域时必然失效。
当前聚变强化学习研究常采用全工况历史数据训练控制器,但S1提出的‘balanced data diet’表明:任务分布上的显式采样共识,可抑制策略在非目标子空间的无效发散([3701])。聚变场景中,这意味着必须按物理重要性重加权数据——例如,将破裂前100ms窗口、高βN临界点、ELM周期性爆发等稀疏但高代价事件的数据密度提升2–3个数量级,否则策略会过度优化稳态维持而忽略失稳前兆的微弱信号。
聚变控制本质是时空受限的物理计算:磁场线圈电流更新需μs级延迟约束,等离子体演化时间尺度为ms–s,而全局优化(如实时反演q-profile)需毫秒级完成。S2指出探针计算机的核心挑战在于‘如何在不固化硬件拓扑前提下动态分配与约束计算资源’([3698])。这要求将传统集中式实时控制系统,重构为可证明资源边界的分布式探针网络:每个传感器-执行器对构成一个‘物理探针’,其计算负载(如滤波阶数、反演算法深度)须与本地带宽、延迟、能耗严格绑定,并支持运行时重新协商。
reViT(S1)通过单块Transformer递归调用实现深度特化,FFN参数随迭代步动态重加权,形成‘时间复用结构’以规避冗余堆叠([3699])。该思想可映射至聚变多时间尺度控制:快环(磁场反馈,~10kHz)与慢环(杂质控制、壁条件管理,~1Hz)无需独立网络;而可用同一基础架构,通过迭代步数(或注意力头masking模式)区分时间粒度——第1次迭代处理μs–ms级扰动,第5次迭代整合s级热负荷演化,从而在参数效率与物理保真度间取得新平衡。
综上,可控核聚变的AI控制瓶颈已超越算法层面,进入系统认知层。我们提出三支柱路径:(1)将物理约束(如Maxwell方程离散形式、能量守恒残差)编码为各代理可读写的共识变量,建立S00所缺的内生边界机制;(2)借鉴S05的互补资源建模,构建‘约束-驱动’双维度状态空间,并定义其可交换性操作算子;(3)以S03的SpatialHarness与S01的balanced diet为工具,实现训练-部署一致的物理可信控制。此非技术拼凑,而是对聚变系统作为‘具身物理智能体’的本质回归。