构建者指南:GPT-5.6 如何重塑 AI Agent 的成本与性能
事件概述2026 年 8 月 13 日,OpenAI 发布了《The builder’s guide to GPT-5.6》一文,系统介绍了 GPT-5.6 模型家族如何以更低成本实现前沿级 Agent 性能,并分享了多家初创公司在生产环境中的实测经验。文章重点展示了三件事:更优的默认体验、更聪明的模型选择策略,以及 Responses API 新增的三项架构级能力——保留推理、原生多智能体编排和程序化工具调用。 原文链接:The builder’s guide to GPT-5.6 关键技术点1. 更强的开箱即用性能与更低推理成本GPT-5.6 延续了“用更少 token 完成更长任务”的路线。官方给出的关键数据点包括: 在 Agent 基准测试 Agents’ Last Exam 上,GPT-5.6 Sol(低推理强度)的表现超过了 GPT-5.5(高推理强度),且使用相同的 harness。 初创公司 Hex 的 AI Research Lead 表示,将 GPT-5.6 放入现有 harness 后,低推理强度即得到最佳结果,模型能识别数据缺失并避免追逐无效线索。 Br...
预览 Ultrafast 模式:GPT-5.6 Sol 速度提升最多 14 倍
事件概述OpenAI 于 2026 年 8 月 13 日发布了一篇产品预览公告,介绍了名为 Ultrafast 的新服务层级。该模式首先面向 OpenAI API 客户开放,用于运行 GPT-5.6 Sol 模型,处理速度相比 Standard 模式最高可提升 14 倍。Ultrafast 由 Cerebras 提供底层支撑,输出速度可达 每秒 750 个 token。 这次更新的核心卖点很明确:当速度不再需要牺牲模型智能时,前沿模型就能进入那些对时间极度敏感的业务场景。原文指出,以往要获得实时速度,往往只能选择更小或更专用的模型,而 Ultrafast 代表着“每秒完成更多有用工作”的方向。 原文链接:Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed 关键技术点 模型与模式:GPT-5.6 Sol 在 Ultrafast 模式下运行,支持最高 14 倍的加速(相比 Standard 处理)。 输出吞吐:每秒最多生成 750 个输出 token,面向需要极低延迟的交互式应用。 底层硬件:由 Cerebras...
OpenAI 任命 Dali Rajic 为首席营收官:从安全合规到商业扩张的信号
OpenAI 任命 Dali Rajic 为首席营收官:从安全合规到商业扩张的信号事件概述2026 年 8 月 13 日,OpenAI 官方宣布任命 Dali Rajic 为首席营收官(Chief Revenue Officer, CRO),全面领导 OpenAI 的全球营收组织。这一任命发生在企业级 AI 部署加速的关键节点,标志着 OpenAI 从技术领先向商业化规模化的深度转型。 原 CRO Denise Dresser 将离开 OpenAI,但会经历一段过渡期,期间继续与业务团队合作支持客户。OpenAI 对 Dresser 在构建团队、强化大客户关系方面的工作给予了高度评价,称她为公司“奠定了商业基础”。 关键技术点虽然这是一条高管变动消息,但从技术商业化的角度,有几个关键信息值得关注: 营收操作系统(Revenue Operating System):这是 OpenAI 官方表达中的一个核心概念。新 CRO 的核心任务是“构建营收操作系统,以便为下一阶段扩展”。这意味着 OpenAI 不再单纯依赖技术突破的自然增长,而是要建立一套可重复、可规模化的企业销售方法论,类...
Distribird:用多 Agent 流水线自动化贝叶斯模型校准的先验分布设计
Distribird:用多 Agent 流水线自动化贝叶斯模型校准的先验分布设计事件/论文概述在基于过程的科学模型(如气候、生态、生物医学等领域中的机理模型)中,贝叶斯校准是连接模型参数与观测数据的关键步骤。然而,一个长期存在的痛点在于:为每个模型参数设定先验分布时,研究者几乎总是退回到均匀先验(uniform prior)。原因很简单——从海量科学文献中挖掘并构建信息丰富的先验,既耗时又需要同时具备领域知识与统计专业技能。 针对这一问题,来自匈牙利的研究团队(Patrik P. Süli、György Eigner、Roland Hollós)在 arXiv 上发布了一篇题为 “Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration” 的论文,提出了一款名为 Distribird 的智能体网络应用。 Distribird 的核心目标是自动化“从文献到先验分布”的全流程:给定参数名称、物理描述和领域上下文,它通过多 Agent 流水线完成文献检索、数...
Dynamic Governance of Multi-LLM Agent Systems for Collaborative Conversational Outcomes
多 LLM 智能体系统的动态治理:当目标函数缺失,我们如何避免对话崩溃? 当两个结构上目标对立的 LLM 智能体在多轮交互中相遇,缺少共享目标函数会产生什么?答案是:不是竞争,而是崩溃。近日,一篇来自 arXiv 的论文尝试用控制理论中的“治理层”来解决这一困境。 事件/论文概述这篇题为 《Dynamic Governance of Multi-LLM Agent Systems for Collaborative Conversational Outcomes》 的论文,主要探讨了一个非常现实且棘手的问题:当多个 LLM 智能体各自持有相互冲突的目标进行对话时,系统会发生什么? 论文指出了一个反直觉的现象:当两个大语言模型智能体(一个代表网站方,旨在引导访客预约顾问;另一个代表访客,带着心理上的抗拒机制)进行多轮交互时,如果没有一个共享的目标函数来协调,对话并不会产生富有张力的“竞争”,而是会迅速“崩溃”。 这种崩溃的具体表现是:访客智能体过早地屈从(capitulates),网站智能体则停止变换其说服策略,最终对话在没有达成任何一方初始目标的情况下草草结束。 针对...
从辅助到执行:企业如何让 AI 真正“干活”
从辅助到执行:企业如何让 AI 真正“干活”OpenAI 于 2026 年 8 月 12 日发布两份研究报告,揭示企业采用 agentic AI 的最新趋势。报告指出,企业 AI 正在从“辅助”走向“执行”,但不同企业的转型速度差异显著——前沿企业(每月 AI 使用量前 10%)与典型企业之间的差距正在拉大。 事件/报告概述OpenAI 同步发布了两份互补的研究: 《Enterprise Signals》:基于 OpenAI 企业客户的实际使用数据,分析 agentic AI 在企业中的落地情况,重点观察前沿企业的差异行为。 《How Organizations Use AI: Evidence from ChatGPT》(工作论文):从 ChatGPT 的数百万条对话数据出发,研究 AI 采用如何随企业、岗位和资历层级扩散。 两份报告共同指向一个务实的企业行动议程:将 Agent 与企业上下文、工具连接,完成有价值的工作;建立清晰的权限、审查与治理机制;帮助员工把有效的个人工作流转化为团队共享的工作方式。 五个关键技术发现报告提炼出五个关于企业如何让 AI 投入工...
闭环 LLM 共驾系统:当 AI 成为数字农业的自主实验官
事件概述arXiv 于 2026 年 7 月收录了一篇由 Serge Kernbach 提交的预印本论文《Closed-Loop LLM Co-Pilots for Digital Agriculture》(闭环 LLM 共驾系统:面向数字农业)。该研究展示了大型语言模型(LLM)如何从单纯的数据分析工具,进化为能够自主驱动物理实验、控制植物生长环境的 AI 系统。论文构建了一套由 49 通道植物传感器网络驱动的闭环框架,覆盖多光谱、电化学和介电三类传感模态,并在垂直农场与单株植物两种实验环境中完成了验证。 这项工作的核心不是“用 LLM 解读数据”,而是让 LLM 直接介入实验决策——基于实时生物物理数据去调控硬件执行器,从而优化微气候、执行表型协议、甚至人为诱导受控胁迫。用论文的话说,这是“一种直接的 AI-生物学接口”。 关键技术点1. 从人在回路到自主闭环传统基于 LLM 的科学辅助工具通常停留在“人类分析数据 → 人类执行实验”的层面。本论文则将 LLM 置于控制环路的核心: 输入侧:49 通道 phytosensor 网络持续采集多光谱、电化学、介电等生物物理信号。...
SPOTting the Future:面向深度强化学习的前瞻性可解释框架
事件概述深度强化学习(DRL)在复杂环境中的决策能力日益强大,但其“黑盒”属性始终困扰着研究者和工程实践者——当智能体做出一个决策时,我们很难回答“为什么”以及“接下来会发生什么”。近日,来自以色列的两位研究者 Tamar Gozlan 与 Claudia V. Goldman 在 arXiv 上发布了一篇新论文,提出了名为 SPOT(Sampling Policy Observation Tree) 的模型无关、基于采样的 DRL 策略解释框架,试图为这一难题提供一种全新的解决思路。 论文于 2026 年 7 月 28 日提交,并收录于 arXiv 的 cs.AI 与 cs.LG 分类中。作者团队选择在 SUMO-RL 交通信号控制这一真实场景中进行案例研究,展示了 SPOT 在策略偏好检查、未来轨迹对比以及下游行为揭示等方面的解释能力。 关键技术点SPOT 框架的核心思想可以概括为“用树状结构做前瞻性解释”。具体而言,SPOT 在给定策略模型和环境模拟器访问权限的前提下,通过以下步骤构建一个有限时域的可解释树: 动作采样:在当前状态上对策略输出的动作分布进行采样,获取若干候...
MIDAS:面向不完整多模态情感分析的互信息解耦与不确定性感知融合框架
MIDAS:面向不完整多模态情感分析的互信息解耦与不确定性感知融合框架事件/论文概述在实际的多模态情感分析任务中,模型通常假设训练和推理阶段能够获取完整的多模态输入。然而,真实世界的数据采集场景往往面临传感器故障、网络丢包、数据对齐错误等问题,导致音频、文本或视觉模态出现缺失或损坏。这种“不完整多模态”场景对现有方法构成了显著挑战。 针对这一问题,来自中科院自动化研究所等机构的研究团队在 arXiv 上发布了一篇题为 “MIDAS: Mutual Information Disentanglement with Uncertainty-Aware Fusion for Incomplete Multimodal Sentiment Analysis” 的论文,提出了一种统一的框架 MIDAS。该论文已被 IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) 接收,于 2026 年 8 月 6 日提交至 arXiv。 论文的核心观点是:现有的不完整多模态处理方法主要依赖数据填补(imp...
RingCentral 如何从工程到运维构建 AI 原生工作流
RingCentral 如何从工程到运维构建 AI 原生工作流 原文来源:OpenAI News发布时间:2026-08-12 概述RingCentral,这家在商业通信领域深耕近三十年的全球性企业,年收入超过 26 亿美元,拥有数千名全球员工。如今,该公司正通过拥抱 AI 原生的方式来延伸其创新传统。通过让每位员工都有机会使用 ChatGPT Work 和 Codex 进行实验,RingCentral 确保公司中的任何人都能构建变革性的产品和基础设施,无论其是否具备工程经验。 RingCentral 总裁兼首席运营官 Kira Makagon 表示: 当你把真正的 AI 工具交到每个人手中,整个公司就变成了一个产品组织。我们的每一款产品——包括但不限于 Agentic Voice AI 产品组合中的 AIR、AVA、ACE——都因压缩了从想法到功能上线的距离而变得更加出色,这正是 AI 原生开发赋予我们的能力。 关键技术点1. AI-Native Challenge:全员参与的 AI 开发实验为了在全球化工程组织中鼓励 AI 熟练度,RingCentral 的 CEO 办...
