Pistis 技术报告:27B/9B 多模态模型、IDRL 后训练范式与自动推理框架优化
事件概述arXiv 上出现了一篇题为《Pistis Technical Report》的技术报告(arXiv:2609.28554,cs.AI,交叉 cs.CV),提交时间为 2026 年 9 月 23 日,由 Heyun Chen、Xiaohan Lan、Jiaxi Li、Zhilin Lu、Qi She、Weiwen Xu、Fei Yu、Yujie Zhong、Jinghuan Chen、Zijian Feng、Siyu Jiao、Yiheng Lin、Xinhao Wang、Sihan Yang、Jieyu You、Changbin Zhang、Hengyu Zhang、Xudong Zhang、Yunqing Zhao、Shuai Zheng 等 20 位作者共同完成。 论文提出了 Pistis 模型家族,包含两个参数规模的多模态大语言模型: 27B 版本,基于 Qwen3.6 构建; 9B 版本,基于 Qwen3.5 构建。 两个规模都通过一套“通用且可扩展”的后训练框架开发。该框架先以大规模多模态监督微调(SFT)建立基础能力,再在其上引入作者提出的新后训练范式 ...
AGIMUD:为交互式多智能体模拟构建社会-情感人工智能
事件概述arXiv 上新发布一篇由 David Berga 撰写的论文《Building Socio-Affective Artificial Intelligence for Interactive Multi-Agent Simulations》(arXiv:2609.26927,cs.AI),提交时间为 2026 年 9 月 22 日。论文篇幅为 37 页、27 张图、42 张表,交叉列表涵盖 cs.CY(计算机与社会)、cs.GT(博弈论)、cs.HC(人机交互)与 cs.MA(多智能体系统),ACM 分类包含 I.2.11、I.2.7、H.5.1、J.4、C.2.4、F.2.0、G.2.2。 作者的目标是给出一套设计原则与软件架构,用于在模拟的动态世界中实现人类与多个智能体之间的交互。论文试图把当前通用人工智能(AI/AGI)的发展阶段,与基于 Transformer 的对话式智能体的普及、以及持续增长的计算能力连接起来。在此基础上,作者提出并实现了一个名为 AGIMUD 的软件系统,代码已在 GitHub 上公开(https://github.com/dbe...
当工具调用"假装成功":一篇关于 Agent 工具交互静默失败的审计研究
事件/论文概述arXiv 上最近上线了一篇题为 《Silent Failures in Agent-Tool Interaction: An Audit of ToolUniverse》 的论文(arXiv:2609.26836,cs.AI / cs.SE,2026 年 9 月 21 日提交),作者为 Shreya Gopalan、Devansh Singh 和 Sundaraparipurnan Narayanan。 论文关注的是一个在工程实践中非常容易被忽略的问题:Agent 与工具之间的”静默失败”(silent failure)。按照作者的定义,静默失败指的是这样一类情形——Agent 发起了一次工具调用,调用看起来是成功的,但通过 API 或 wrapper 返回的信息/功能其实是不完整或缺失的,而且系统没有任何通知或提示告诉用户或 Agent 这部分信息缺失了。换句话说,调用方根本不知道自己拿到的是残缺结果。 已有的研究和 benchmark 大多聚焦在 Agent 系统的”任务成功率”和”任务完成度”上,而针对 Agent 与工具交互本...
Harness as a Language:极简 Agent 框架 JAZ 用单一 invoke 原语挑战记忆与自我改进系统
事件概述arXiv 上出现了一篇新论文《Harness as a Language: A Minimalist Agent Framework With Maximal Expressivity》(arXiv:2609.26891,cs.AI),提交于 2026 年 9 月 22 日,共 25 页、3 张图。作者为 Zhening Li、Joshua Liu、Mateja Vukelic、Nicole Shen、Supriya Lall、Amitayush Thakur、Alex Zhang、Omar Khattab、Jonathan Light、Armando Solar-Lezama。 论文的出发点是一个常见现象:现代语言模型 Agent 都围绕 “agent loop” 构建——LLM 置身于一个暴露若干工具的环境,通过反复调用工具并观察输出,自主控制整个工作流。但论文指出,某些工作流当前仍然需要在 agent loop 之外做额外工程,典型如记忆系统(memory systems)和自我改进系统(self-improving systems)。 作者为此构建了一个 LLM...
目标要不要一个"旋钮"?MODPO 可操控多元对齐中的目标冲突预测与权衡覆盖
一、事件概述arXiv 上一项题为 《Which Objectives Need a Dial? Predicting Objective Conflict and Covering Trade-offs in Steerable Pluralistic Alignment》 的新预印本(arXiv:2609.26929,cs.AI,同时交叉 cs.CL 与 cs.CY),作者为 David Tsoi 与 Esra Dönmez,于 2026 年 9 月 22 日 18:22:52 UTC 提交,属 Preprint。 论文的出发点是:人的价值观本就多样且经常彼此冲突,因此不存在一个”万能对齐”模型能让所有人满意。 多元对齐(Pluralistic Alignment)因此要求模型具备可操控性(steerable),能够以不同方式平衡相互竞争的目标。作者以 MODPO(Multi-Objective Direct Preference Optimization,多目标直接偏好优化) 为方法基座——它通过一个**目标权重(objective weight)**在一条权衡连续谱上滑动...
OpenAI Academy 两周年:250 场活动、400 万人参与,下一步是把“教练”规模化
事件概述OpenAI 在 2026 年 9 月 23 日发布文章,回顾 OpenAI Academy 上线两周年的进展,并公布下一阶段的扩展计划。 按照原文披露的数据: OpenAI Academy 于 2024 年 9 月启动,至今满两年; 期间举办了 250 多场活动; 累计有 超过 400 万人接触过 Academy 的内容; 参与群体包括教育工作者、小企业主、开发者、非营利组织负责人和社区成员。 原文明确说明,Academy 的初衷是“让 AI 的好处被更广泛地分享”,因此需要让普通人具备在日常工作和生活中使用 AI 的技能与信心。培训覆盖的场景从教学、经营小生意一直延伸到软件开发。 下一阶段的核心动作是:推出一个新的 培训师项目(trainer program),让个人和组织具备在本地社区讲授 Academy 内容的能力。原文称该项目建立在既有合作伙伴网络之上,目标是让培训与持续支持“更靠近人们生活和工作的地点”。 需要注意的是,原文并未说明该项目的具体预算、覆盖国家范围、课程是否收费,以及是否有中文等多语言支持。 关键技术点严格来说,这是一篇生态与培训体系公告,而...
Harvey 借助 GPT-6 Astra 把法律上下文转化为更强的文书草稿
事件概述OpenAI News 于 2026 年 9 月 23 日发布了一则创业公司案例,介绍法律 AI 公司 Harvey 与 GPT-6 Astra 的结合。 根据原文,Harvey 帮助律师事务所和企业内部法务团队在复杂法律工作流中安全部署 AI,覆盖从诉讼到并购等场景。其客户使用 Harvey 将大量信息转化为复杂的法律文档。接入 GPT-6 Astra 后,Harvey 能够在起草过程中引入更多上下文,并生成结构更完整的输出。 Harvey 联合创始人兼总裁 Gabe Pereyra 在原文中的表述是: “We can give more context to the model and produce better and better structured outputs.” 原文同时标注了该案例的基本信息:公司规模为 Startup,地区为北美,行业为 Technology,所用产品为 API。 关键技术点原文披露的技术信息相对克制,可归纳为以下几点: 1. 多源法律上下文的注入 Harvey 使用 GPT-6 Astra 帮助律师对构成某个案件/事...
invideo 用 GPT-6 Astra 把调色效率提升 3 倍:一份 Agent 视频编辑的落地样本
事件概述2026 年 9 月 23 日,OpenAI 官网发布了一篇客户案例,介绍视频编辑平台 invideo 如何借助 GPT-6 Astra 改进其调色(color grading)与色彩校正(color correction)流程。 按照原文描述,invideo 的定位是「agentic video editor」——由 AI Agent 承担视频剪辑中的规划与执行工作,同时把控制权保留在人类剪辑师手中。案例中给出的公司画像为:规模属于 Startup,区域为亚太及大洋洲(Asia-Pacific & Oceania),行业为媒体、娱乐与体育,使用的产品为 API。 原文披露的两项核心结果: 50:一天之内创建的自定义特效数量; 3x:调色与色彩校正任务成功率的提升幅度。 这两项数据一升一降,指向的是同一件事:Agent 不只是「能生成」,而是开始能在长流程、多步骤的专业工作流里稳定地把事做完。 关键技术点1. 复杂剪辑的规划与帧级定位invideo 的 Agent 需要把剪辑师的意图翻译成一串操作步骤,选择正确的工具、执行操作,并验证结果。原文引用 invid...
Sam Altman 在联合国安理会发言:AI 安全、人类控制与国际合作
事件概述2026 年 9 月 23 日,OpenAI CEO Sam Altman 在联合国安理会就人工智能发表讲话。根据 OpenAI News 发布的讲话记录,Altman 讨论了 AI 扩大机会的潜力、让强大系统保持人类控制的重要性,以及在国际层面开展 AI 安全合作的必要性。 讲话的核心判断是:AI 可能走向两种未来——更像一场创造力与发现的新文艺复兴,或更像一场充满动荡与失序的新工业革命。Altman 表示,当前模型快速进展让时间线显得更加压缩,好处更具体,但风险和代价也更紧迫。他同时提到,自己大体同意 Bengio 教授的观点,但把风险归纳为两种,而非三种。原文未说明 Bengio 所提三种风险的具体内容。 关键技术点1. 递归自我改进带来的加速风险 Altman 特别提到,当 AI 系统能够改进自身以及未来版本时,即所谓的“递归自我改进”(recursive self-improvement),建设 AI 的过程会变得更加自动化,AI 进展可能迅速加速。他认为这一时刻需要“极度谨慎”。 2. 两种必须避免的失败路径 第一,人类可能失去对未来的控制。风险在于 AI 进...
OpenAI 为 GPT-6 升级提示词缓存:更高命中率、诊断工具与显式缓存断点
事件概述OpenAI 于 2026 年 9 月 22 日发布产品更新,宣布随 GPT-6 系列一同推出改进后的提示词缓存(prompt caching)系统。官方给出的核心变化有三类: 一是默认缓存命中率提升,对在 30 分钟窗口内被复用的「合格共享前缀」给予缓存折扣;二是新增可观测与诊断能力,包括 Prompt Caching Dashboard 和提示词缓存诊断工具;三是提供更细粒度的控制手段,例如显式缓存断点、在不破坏缓存的前提下调整推理强度、以及缓存预热。 OpenAI 在文中给出的背景是:GPT-6 被用于支撑「持久化 Agent」,这些 Agent 需要在复杂任务上连续工作数小时,例如重构代码库、产出经过充分调研的文档和演示稿。这类应用会发出一连串相互叠加的 API 请求,往往反复携带相同的指令、工具定义和历史上下文。缓存这部分共享上下文即可复用计算,从而降低响应时间。原文提到,缓存输入 token 的折扣最高可达 90%。 关键技术点1. 默认更高的命中率与 30 分钟复用窗口原文表示,GPT-6 系列随附的新缓存系统「默认提供更高的缓存命中率」,并对在 30 分钟...
