事件概述

arXiv 上出现了一篇题为《Pistis Technical Report》的技术报告(arXiv:2609.28554,cs.AI,交叉 cs.CV),提交时间为 2026 年 9 月 23 日,由 Heyun Chen、Xiaohan Lan、Jiaxi Li、Zhilin Lu、Qi She、Weiwen Xu、Fei Yu、Yujie Zhong、Jinghuan Chen、Zijian Feng、Siyu Jiao、Yiheng Lin、Xinhao Wang、Sihan Yang、Jieyu You、Changbin Zhang、Hengyu Zhang、Xudong Zhang、Yunqing Zhao、Shuai Zheng 等 20 位作者共同完成。

论文提出了 Pistis 模型家族,包含两个参数规模的多模态大语言模型:

  • 27B 版本,基于 Qwen3.6 构建;
  • 9B 版本,基于 Qwen3.5 构建。

两个规模都通过一套“通用且可扩展”的后训练框架开发。该框架先以大规模多模态监督微调(SFT)建立基础能力,再在其上引入作者提出的新后训练范式 IDRL(Interleaved Distillation and Reinforcement Learning,交错蒸馏与强化学习)。

在每个规模上,该框架都会产出两个专用变体:

  • Pistis-Thinking:面向深度多模态推理;
  • Pistis-Agentic:额外引入 agentic trajectory(智能体轨迹)数据,支持长时程规划、迭代推理与工具调用,在多模态搜索场景中表现尤为突出。

论文声称两个规模均优于各自对应的基座模型。此外,作者还提出 Pistis-Auto-Harnessing(PAH),一种系统级方法,通过迭代优化自动改进智能体的推理外壳(inference harness),实验表明它能在不更新模型参数、也不增加交互预算的前提下提升模型表现。

需要说明的是:本文基于 arXiv 摘要页面信息撰写,论文正文中的具体基准分数、训练数据规模、消融实验细节和参数配置,原文未说明(当前可见内容仅为摘要与元数据)。

关键技术点

1. 两阶段后训练:从 SFT 到 IDRL

框架的第一阶段是常规但关键的一步——大规模多模态监督微调,目的是把基座模型的多模态理解与生成能力“垫厚”,为后续强化学习提供稳定起点。第二阶段才是论文的核心贡献 IDRL。

2. IDRL:把蒸馏和强化学习放进同一个训练循环

这是全文最值得关注的设计。传统做法有两种:

  • 各自独立优化:先蒸馏,再 RL,或者反过来;
  • 静态联合损失:把蒸馏损失和 RL 损失按固定权重拼成一个目标函数一起优化。

IDRL 走的是第三条路:在同一个训练循环内交替执行 on-policy 蒸馏和强化学习,让两个目标轮流主导优化过程,而不是同时压在一个静态损失里。

作者给出的动机和收益包括:

  • 更有效的知识迁移:交替优化避免了蒸馏信号和 RL 奖励信号互相拉扯;
  • 更高的优化稳定性:静态联合损失容易出现梯度冲突和权重敏感问题,交替机制缓解了这一点;
  • 更精确的信用分配(credit assignment):对长时程 agentic 轨迹尤为关键——这类轨迹动辄几十上百步,把最终成败归因到具体某一步本身就很难,交替式训练比静态联合损失更容易做到这一点。

论文还强调,IDRL 在提升性能的同时缓解了常见的能力权衡(capability trade-offs)——即后训练中常见的“推理能力涨了,指令遵循或通用能力掉了”这类此消彼长。

3. 双变体分化:Thinking 与 Agentic

同一套后训练框架产出两个方向:

变体 定位 关键数据
Pistis-Thinking 深度多模态推理 以 SFT + IDRL 为主
Pistis-Agentic 长时程规划、迭代推理、工具调用 额外加入 agentic trajectory 数据

Pistis-Agentic 在多模态搜索上表现突出,这符合直觉:搜索任务天然要求多轮工具调用、跨模态信息整合和自我修正。

4. PAH:不改参数、不加预算的系统级优化

Pistis-Auto-Harnessing 是另一个值得注意的方向。它不去动模型权重,而是自动迭代优化智能体的 inference harness——也就是包裹在模型外面的那层推理脚手架(提示组织、工具调度、状态管理等,具体实现原文未说明)。

它的价值主张非常明确:在不更新模型参数、也不增加交互预算的情况下提升性能。这意味着收益来自系统层工程而非算力堆叠。至于“交互预算”具体如何定义、harness 的搜索空间有多大、迭代多少轮收敛,摘要中均原文未说明。

对数据科学 / AI Agent 落地的意义

后训练范式的“配方”正在成为核心竞争力

Pistis 的两个基座分别是 Qwen3.6 和 Qwen3.5——都是公开可得的基座。论文反复强调的是“通用且可扩展的后训练框架”,而不是基座本身的架构创新。这传递了一个明确信号:在基座能力趋同的当下,后训练配方的差异正在成为模型能力差异的主要来源。对做垂直领域模型的团队来说,这比“再预训练一个基座”现实得多。

长时程 Agent 的信用分配问题终于被正面处理

做 Agent 落地的工程师应该都有体感:一个 50 步的任务最后失败了,到底是第 7 步检索错了,还是第 32 步工具参数填错了?静态联合损失很难回答这个问题。IDRL 明确把“更精确的信用分配 for long-horizon agentic trajectories”作为卖点,说明这个问题在工业级 Agent 训练中已经足够痛。如果这套交替机制可复现,它对做多轮工具调用 Agent 的团队是有直接参考价值的。

PAH 提示了一条更便宜的优化路径

很多团队现在陷入“想提升 Agent 表现 → 就得微调模型 → 就得准备数据和算力”的单一思维。PAH 提出的是一个正交方向:harness 本身也是可优化的对象,而且优化它的边际成本远低于重新训练模型。这对预算有限、但业务迭代频繁的团队尤其有吸引力。当然,前提是 PAH 的自动化程度足够高,而不是换一种方式人工调 prompt。

多模态 + Agent 的组合仍是稀缺能力

Pistis-Agentic 强调“多模态搜索”,这是一个目前开源生态里仍然相对薄弱的方向——大量 Agent 框架的主链路还是文本,图片和截图更多是“附件”而非“一等公民”。如果 Pistis 在这条线上确实有显著优势,它对电商比价、文档检索、GUI 操作这类场景会有直接价值。但论文摘要没有给出具体的基准对比数据,实际水平原文未说明。

我的技术点评

第一,IDRL 的“交替”而非“联合”是个聪明的工程折中。 静态联合损失的问题在于权重是超参、梯度是耦合的,蒸馏要模仿 teacher 分布,RL 要最大化奖励,两者在优化方向上并不总是一致,硬拼在一起容易互相拖累。交替执行等于给两个目标各自留出了独立的优化窗口,虽然在理论收敛性上更难分析(论文摘要没有给出收敛性证明,原文未说明),但工程上更可控。这种“先不追求最优解,先追求可调可控”的思路,在工业界往往比理论优雅更重要。

第二,同一框架产出 Thinking 和 Agentic 两个变体,是产品化思路而非学术思路。 学术论文通常倾向于一个通用模型打天下,而这里明确按用途分化。这暗示这项工作背后有明确的落地需求驱动——推理场景和 Agent 场景对模型的要求本就不同(前者要长链思考质量,后者要工具调用格式准确、状态跟踪稳定),用同一份权重硬扛两类需求往往两头不讨好。

第三,PAH 是我最感兴趣但也最存疑的部分。 “不更新模型参数、不增加交互预算就能提升性能”,这句话信息量很大但细节很少。如果 harness 优化指的是自动搜索 prompt 模板、工具描述格式、上下文压缩策略这类东西,那它本质上是 AutoML 在 Agent 系统层的应用,价值确实很高;但这类方法的收益通常高度依赖任务分布,泛化性需要看实验设计。摘要里没有说 PAH 是在哪些任务上验证的、提升幅度多大、是否跨任务可迁移——这些都原文未说明,需要通过全文验证。

第四,需要保持一定的信息审慎。 这是一份 technical report,且当前可见的只有摘要。所有“更强”“更优”“缓解了权衡”的表述都来自作者自述,没有第三方复现。特别是 27B 和 9B 两个规模“均优于对应基座模型”这句话,基座本身就是 Qwen3.6 / Qwen3.5,属于同源对比,说明的是后训练有效性,而不是绝对能力的领先。跨模型对比数据摘要中未提供。

第五,对 Agent 工程师的实际建议。 不妨关注两点落地启发:一是训练长时程 Agent 时,考虑把蒸馏和 RL 分阶段交替而非联合优化;二是别把优化注意力全放在模型权重上,推理外壳(harness)本身就是一个值得投入工程资源优化的对象。后者成本更低、迭代更快,往往是性价比更高的选择。

原文链接

论文标题:Pistis Technical Report
作者:Heyun Chen 等 20 人
提交时间:2026 年 9 月 23 日(arXiv v1)
学科分类:cs.AI(主)、cs.CV