OpenAI 在欧洲推进负责任 AI:从 EU AI Act 到内容溯源的技术路径
事件概述2026 年 7 月 31 日,OpenAI 官方发布文章《Advancing responsible AI across Europe》,系统阐述了其在欧洲地区围绕安全性(Safety)、安保(Security)、透明度(Transparency)和内容溯源(Provenance)方面的实践。这篇文章发布的时间点正值欧盟《人工智能法案》(EU AI Act)进入下一实施阶段,OpenAI 借此契机梳理了其治理框架与欧盟监管体系的对接情况,并明确表态将继续随技术演进动态调整合规策略。 文章核心信息可以概括为三点:第一,OpenAI 已参与并签署了欧盟的两项行为准则——通用人工智能(GPAI)行为准则与 AI 生成内容透明度行为准则;第二,其安全治理高度依赖内部框架与外部协作的双轮驱动;第三,面向 AI 生成内容,采用 C2PA 内容凭证与 SynthID 水印相结合的溯源路线。 关键技术点1. 安全与治理:两套框架的叠加OpenAI 在文章中重点提及了两套内部治理框架: Preparedness Framework(准备度框架):自 2023 年启用、2025 年更新,...
Building Abundant Intelligence:OpenAI 的全栈 AI 宏大叙事
Building Abundant Intelligence:OpenAI 的全栈 AI 宏大叙事 当智能的成本下降,更多工作就变得值得去做;当模型更强,这些工作就能创造更多价值。 2026 年 7 月 31 日,OpenAI 官方发布文章 Building abundant intelligence,系统阐述了其“全栈方法”(full-stack approach)——通过协调基础设施、模型、平台与产品,让先进 AI 变得更强大、更便宜、更有用。这不是一篇简单的产品公告,而是一份关于 AI 经济循环、算力效率与落地路径的深度产业宣言。 事件概述:从“规模”到“丰裕”OpenAI 在文章开篇就明确了一个核心观点: AI 基础设施的价值不在于它有多大,而在于它让什么成为可能:让更强的智能以更低的成本,惠及更多人。 这种“丰裕”既是使命(让 AGI 惠及全人类),也是商业引擎。文章引用了一系列近期动作来说明这一循环: 价格大幅下调:GPT‑5.6 Luna 降价 80%(现每百万输入 tokens $0.20,输出 $1.20);GPT‑5.6 Terra 降价 20%($2...
Univé构建AI就绪劳动力:领导力、治理与员工创新的协同实践
Univé构建AI就绪劳动力:领导力、治理与员工创新的协同实践事件概述荷兰合作保险公司Univé近日通过OpenAI官方博客分享了其利用ChatGPT Enterprise构建“AI就绪劳动力”(AI-ready workforce)的完整实践。作为服务数百万会员的荷兰最大合作保险机构之一,Univé业务覆盖保险、抵押贷款、金融服务与风险预防。面对AI重塑知识工作的趋势,Univé没有将AI视为一次单纯的技术部署,而是将其定位为一场组织级转型,目标是让每位员工都能安全、负责任且高效地使用AI。 该案例的亮点在于:97%的ChatGPT Enterprise许可证被激活,85%的持证用户每周活跃,员工平均每人每周提交40次提示,并创建了约1,500个自定义GPT。在宠物保险理赔场景中,原本需要数小时准备的理赔材料,现在几分钟内即可完成决策前的所有准备工作。 关键技术点1. 领导力先行,而非IT驱动Univé没有把AI项目扔给IT部门,而是让整个管理团队参与专门的AI领导力研讨会。这些会议不聚焦产品演示,而是挑战管理者重新思考“工作本身将如何变化”,以及管理者在变革中应扮演的角色。由...
探秘推理性能之源:RL 与 SFT 微调模型在数学问题求解中的表征质量对比
事件概述近年来,基于强化学习(Reinforcement Learning, RL)训练的大规模推理模型,在数学推理任务上持续展现出超越传统监督微调(Supervised Fine-Tuning, SFT)模型的性能。然而,这种优势背后的机制性原因——即模型内部究竟发生了什么变化——一直是未解之谜。 针对这一问题,来自伊利诺伊大学厄巴纳-香槟分校(UIUC)、Garage Plus 等机构的研究者提交了一篇题为 Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models 的论文。该论文被 AAAI 2026 第二届 XAI4Science 研讨会接收,从内部表征的角度切入,尝试揭示 RL 模型推理能力更强的本质原因。 论文于 2026 年 7 月 28 日提交至 arXiv,来源为 cs.AI 板块。 关键技术点该研究通过两条相互印证的分析路径,对 RL 与 SFT 模型...
Advancing the price-performance frontier with GPT-5.6
事件概述OpenAI 于 2026 年 7 月 30 日宣布,旗下 GPT-5.6 系列模型迎来重大价格调整与性能升级。其中,最快且最经济的模型 Luna 价格下降 80%,日常平衡型模型 Terra 价格下降 20%,而旗舰模型 Sol 在 API 中推出 Fast mode,处理速度提升最高 2.5 倍(价格翻倍)。这一系列更新是 OpenAI 将自身系统效率提升成果直接让利给客户的体现,旨在使先进智能更加可负担,推动企业级大规模 AI 部署。 关键技术点 三个模型定位明确 Luna:最快、最便宜,适合高吞吐、多步骤工作流,工具调用和上下文管理能力出色。 Terra:性价比均衡,适合日常办公场景,如 Notion 个人助手中的问答和带延迟要求的任务。 Sol:最强推理模型,仅在 API 中提供,可搭配 Fast mode 获取极致速度。 降价幅度与计费调整 Luna:API 定价为 $2 / 百万输入 tokens(原文明确提及),输出价格原文未说明。 Luna 降价 80%,Terra 降价 20%,并反映在 Codex 和 ChatG...
GrocLM: Grocery Category Recommendation in E-Commerce with Large Language Models
事件概述随着线上杂货购物的快速增长,传统商品级别的推荐系统面临可扩展性和准确性的双重挑战。近期,arXiv 上发布了一篇题为 GrocLM: Grocery Category Recommendation in E-Commerce with Large Language Models 的论文,提出了一种针对杂货类目推荐的微调语言模型 GROCLM。该工作由 Yuan Zhong、Chuanwei Ruan 等研究人员完成,旨在通过类别级别的推荐来更结构化地捕捉用户的周期性购买行为和多样化意图。实验在真实生产环境和公开基准上均取得了显著提升,其中在线补货任务中每次展示的购物车添加量相对提升了 7.5%。 关键技术点 两阶段 LoRA 训练策略:GROCLM 采用低秩适应(LoRA)方法,分两个阶段对语言模型进行微调。与传统的基于 prompt 的条件生成不同,该方法将周期性购买模式直接编码进模型参数中,从而更有效地利用“复购”信号。 基于 Trie 的约束解码机制:为了确保模型输出始终落在预定义的合法类别空间内,论文引入了一种 trie 结构进行约束解码。这使得推荐结果在业务上...
CaRE:为掩码扩散语言模型引入计算感知重掩码评估协议
事件/论文概述掩码扩散语言模型(MDLMs)正快速发展,甚至已能与自回归语言模型竞争。然而,评估标准却明显滞后:七篇近期关于重掩码(remasking)策略的论文在不同设置下进行评估——标称步数、评价指标、采样温度各异,且未对这些因素进行联合控制,导致策略排名无法直接比较,报告的性能提升究竟是算法进步还是评估错觉,也悬而未决。 在此背景下,Yash Shah、Abhijit Chakraborty 与 Vivek Gupta 提出了 CaRE(Compute-aware Remasking Evaluation),一个计算感知的评估框架。该框架通过标准化实际函数评估次数(NFE)、强制多指标报告、显式控制随机性,对 MDLM 重掩码策略进行审计。论文已在 arXiv 发布(链接见文末)。 关键技术点 标准化计算成本:不再依赖“标称步数”这种易被操纵的度量,而是统一采用实际函数评估次数(NFE),使不同策略在等计算量下可比。 多维指标报告:要求同时报告多个指标(如 MAUVE、perplexity 等),避免单一指标带来的偏差。 显式控制随机性:将采样温度(stochas...
Kernel Forge:基于LLM的CUDA Kernel自动生成与优化Agent框架
Kernel Forge:基于LLM的CUDA Kernel自动生成与优化Agent框架事件/论文概述2026年7月30日,arXiv上发布了一篇题为《Kernel Forge: An Agent Harness for LLM-based Generation and Optimization of CUDA Kernels》的新论文。该论文由Joshua Brodsky、Dhravid Kumar等七位作者共同完成,提出了一个名为Kernel Forge的开源端到端Agent框架,用于基于大型语言模型(LLM)自动生成和优化CUDA内核。 传统上,优化GPU计算内核(如矩阵乘法、卷积、归一化等)是降低深度学习模型推理延迟和成本的最直接手段,但需要专家手工编写底层GPU代码,人力成本极高。虽然已有一些基于LLM的Agent系统能够生成和优化内核,但现有工具多存在局限:评估时使用随机生成张量和孤立内核、输出需手动整合的独立CUDA代码、主要面向LLM PyTorch模型、以及缺乏对结果的检查和调试支持。 Kernel Forge旨在解决上述问题,它接受任何未经修改的Py...
Crystalis: 渐进成核与语义退火——LLM驱动的协调多视图可视化生成
论文/产品概述大型语言模型已经能够生成独立的图表,但协调多视图可视化(Coordinated Multi-View Visualizations, CMVs)——即多个视图之间共享数据流并支持跨视图交互的复杂仪表盘——仍然是LLM难以跨越的障碍。问题根源在于:数据变换、视觉编码与交互协调之间存在着紧密的字段级耦合,一个组件的错误会无声地使其他组件失效。来自香港科技大学等机构的研究团队在论文《Crystalis: Progressive Nucleation and Semantic Annealing for Coordinated Multi-View Visualization Generation》中提出了一个新框架,旨在回答一个基础性问题:LLM能否可靠地生成结构正确的CMV,以及什么样的抽象能使这成为可能? Crystalis以查询中心建模为核心,将CMV分解为在依赖图上的结构化查询。该依赖图涵盖三种组件类型(Data、Visualization、Interaction)和三个抽象层次(需求层、规格层、可执行对象层)。在此基础上,两个互补机制协同工作:渐进成核...
两项 API 设置让 ARC-AGI-3 分数翻三倍——OpenAI 深度解析
事件概述2026 年 7 月 29 日,OpenAI 发布了一篇博客,揭示了一项令人意外的发现:在 ARC-AGI-3 基准测试中,通过调整两个 API 设置,GPT-5.6 Sol 的得分从 13.3% 跃升至 38.3%,提升了近 3 倍,同时输出 token 数量减少了 6 倍。这一结果并非模型本身能力的提升,而是源于对评估工具链(harness)中两个关键配置的优化——保留推理(retained reasoning) 和 启用上下文压缩(compaction)。 ARC-AGI-3 是一个衡量 AI 代理学习与推理能力的 2D 解谜游戏基准。此前,GPT-5.6 Sol 在数学难题、复杂游戏(如宝可梦火红、尖塔奇兵)中表现出色,但在 ARC-AGI-3 上仅得 7.8%(公开集)。经过调查,OpenAI 发现问题出在评估工具链本身,而非模型。 关键技术点 官方工具链的缺陷 丢弃推理链:每次执行操作后,模型内部的私有推理内容(思考过程)被清空,导致模型每次不得不从头理解游戏状态,无法利用之前的推理积累。 滚动截断:当对话历史超过 175,000 字符时,最旧的消息...
