量化记忆到泛化的转变:Grokking 的缩放定律与相结构
事件/论文概述arXiv 上新发布一篇论文《Quantifying the Memorization-to-Generalization Transition: Scaling Laws and Phase Structure in Grokking》,作者为 Anish Kataria,提交时间为 2026 年 9 月 9 日,主分类为 cs.AI,同时涉及 cs.LG。 论文关注的是神经网络中的 grokking 现象:模型在训练中先记住训练数据,经过一段延迟后才突然转向泛化。此前研究更多从理论上解释“为什么”会发生这种转变,而这篇论文试图定量回答“何时”发生——即在超参数空间中,记忆到泛化的边界具有怎样的结构。 作者在两层隐藏层 MLP 上,使用模算术任务,扫描了 384 组配置,并拟合出泛化开始时间的幂律缩放关系: [T_{\mathrm{grok}} \propto H^{-0.27}, D^{-2.04}, \eta^{-0.50}, \lambda^{-0.64}] 拟合结果为 (R^2 = 0.732),加入交互项后提升到 (0.821)。其中...
Probabilistic Focal Search:用“下界推进”加速有界次优搜索
一、论文概述2026 年 9 月 6 日提交至 arXiv 的论文《Probabilistic Focal Search: Accelerating Bounded-Suboptimal Search via Lower-Bound Advancement》,提出了一种名为 Probabilistic Focal Search(PFS,概率化焦点搜索) 的新搜索调度机制,用于改进有界次优搜索(bounded-suboptimal search)的效率。 论文作者为 Minh Vu Duc、Trung Le Huu、Hà Minh Hoàng、Trung Thanh Nguyen、Phuong Khanh Nguyen、Huynh Thi Thanh Binh,属于 cs.AI 分类,arXiv 编号 2609.10584。 问题的出发点很明确: 有界次优搜索的目标是找到一个不超过最优解 $w$ 倍的解,同时降低搜索开销; Focal Search(FS) 是在 FOCAL 集合(满足阈值 $w f_{\min}$ 的边界节点)内做启发式引导的经典做法; 但 FS 的策略是确定性...
LoRA 秩的取舍:扩散模型微调中的秩-成本权衡研究解读
事件 / 论文概述arXiv 上新出现一篇被 CSCE 2026 接收的论文《Understanding LoRA Rank Trade-offs in Diffusion Model Fine-Tuning》,作者为 Iman Khazrak、Narges Nejad、Mostafa M. Rezaee、Robert C. Green II,论文于 2026 年 9 月 9 日提交(arXiv:2609.10656v1),共 13 页、5 张图、3 张表,归属 cs.AI 与 cs.LG。 这篇工作关注一个在实际工程中天天遇到、但公开系统性实验并不多的问题:在做扩散模型微调时,LoRA 的秩(rank)到底该选多大? 作者的核心判断是,选 rank 本质上是在「生成质量」和「计算成本」之间做权衡,而不是越大越好。 为此,作者设计了一组受控实验: 数据集:CIFAR-10; 主干网络:DDPM U-Net; 测试的 LoRA 秩:{2, 4, 8, 16, 32}; 优化设置保持固定,并使用可复现的本地文件夹 pytorch-fid 协议来评测; 报告指标:FID、可...
Cognition 借助 GPT‑6 Astra 让 Devin 自测代码:AI Agent 开始"自证清白
事件概述OpenAI 于 2026 年 9 月 11 日发布了一篇客户案例,介绍 Cognition 如何将 GPT‑6 Astra 用于其自主软件工程师产品 Devin。 Cognition 是 Devin 背后的公司,其客户覆盖大型银行到技术型初创企业。随着 Cognition 自身工程团队产出的代码量增长,代码审查(code review)成为瓶颈。Cognition 看中的是 GPT‑6 Astra「测试自己的产物并展示结果」的能力,希望借此让代码审查流程更高效。 Cognition 联合创始人 Walden Yan 在文中表示: “Astra 改进的一个重要部分,是它测试并证明自己的工作确实按预期运行的能力。” 值得注意的是,这并非一个实验性试点。Cognition 正在把 GPT‑6 Astra 推广到全线产品,包括 Devin 这个核心云端 Agent,以及其 CLI 和桌面端产品。 关键技术点根据原文,GPT‑6 Astra 在 Devin 中体现出的能力主要集中在「测试并展示证据」这一环节: 1. 端到端的自测与证据输出 原文给出的具体例子是:Devin 使...
OpenAI 如何把 Habitat 从 Python 库扩展为支撑 10 亿用户的在线存储平台
事件概述OpenAI 工程团队发布技术博客《Rapidly scaling online storage to serve over 1 billion ChatGPT users》,首次系统披露其在线存储平台 Habitat 的演进路径。文章作者为 Jon Lee、Chaomin Yu 和 Ben Ries(均属 OpenAI Members of Technical Staff),是”如何扩展在线存储”两篇系列文章中的第一篇。 Habitat 的定位是”在线存储平台”(online storage platform):OpenAI 的每一个产品——包括 ChatGPT、API、Codex 以及各类内部服务——在用户登录、读取 Codex 设置、发起新对话等动作时,都需要经历多次独立的数据查询。Habitat 的作用是让产品团队无需关心底层数据库管理,就能快速、可靠地存取数据。 根据文中给出的数据,Habitat 目前的规模为: 7000 万次以上/秒的请求处理量 支撑每周超过 10 亿人使用的产品 覆盖近 40 个地理区域 管理超过 500 PB 的数据 需要指...
自适应纠缠博弈模块:AGI 架构中被忽视的一块拼图?
论文概述2026 年 9 月 7 日提交至 arXiv 的一篇 cs.AI 论文《Adaptive Entangled Game Modules in Artificial General Intelligence》,作者为 Haochen Li、Xinshuai Guo、Jingdong Ouyang、Wei Zhang、Leilei Shi(共 5 人),论文标注为 22 页、13 张图、3 张表,跨 cs.AI、physics.soc-ph、q-bio.NC、q-fin.GN、quant-ph 多个分类。 论文的核心主张可以拆成三层: 建模层:提出一个”概率波”框架,用于刻画相互作用的自适应智能体(adaptive agents)的集体行为,并通过一个被称为”广义行为智能(GBI, Generalized Behavioral Intelligence)非局域概率波方程”的工具,推导出可检验的本征模式(eigenmodes)。 实证层:用中国股票市场的日内数据做验证。结果显示,自适应纠缠博弈模式能解释 82%–94%(整体 89%)的观测决策模式;与之相对,基于独立理性智...
OpenDiscoveryTrace:用过程轨迹评测 AI 科学家工作流
一、概述arXiv 上出现了一篇题为 《OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist Workflows》 的论文(arXiv:2609.09203,cs.AI,2026 年 9 月 5 日提交),作者为 Aayam Bansal 与 Keertan Balaji。该工作获得 ICML 2026 Workshop on AI for Science(”AI Scientists: Tools, Co-authors, or Founders?”)的 Best Dataset Award。 论文的出发点很直接:现有面向”自主 AI 科学家”的基准测试基本只评估最终产物——生成的代码、假设或论文——而把得到这些产物的推理过程丢弃了。这导致三个问题无法回答:科研方法论无法被审计、失败模式无法被诊断、系统性推理与”运气好猜对了”无法区分。 为此,作者发布了 OpenDiscoveryTrace:一个包含 558 条完整 AI 科研智能体轨迹的公开数据集,目标不是记录模型”产出什么”,而是记录模型”如何推理”。...
OpenAI 推出 ChatGPT Work 中的 Data agent,让人人都能利用数据
事件概述OpenAI 于 2026 年 9 月 10 日发布 ChatGPT Work 中的新 Data agent。该产品旨在帮助更多员工自行回答业务问题,连接公司数据,调查数据变化,并构建可分享的交互式仪表板,而无需编写查询或学习新的分析工具。用户可以直接在对话中指导和优化分析过程。 关键技术点 多源数据连接:Data agent 可连接已批准的数据源,包括 Amazon Redshift、Datadog、Google BigQuery、ClickHouse、Databricks、MongoDB、Snowflake 等,还能将 Google Drive 和 SharePoint 中的文件与文档纳入分析。 业务上下文理解:它利用组织的业务术语、指标定义、自定义计算和数据关系来解释数据。这些上下文来自语义层和可信来源,例如 Databricks Genie Ontology、dbt、GitHub、Snowflake Horizon 以及 BI 仪表板。 权限与治理:企业管理员选择可用的数据连接以及哪些角色可以使用。查询会强制执行所连接账户的现有权限,包括表、行和列级别的限制。 分...
OpenAI 发布 ChatGPT for Financial Services:内置金融数据 + GPT-6 Astra,剑指投行与股票研究
一、事件概述OpenAI 于 2026 年 9 月 10 日发布 ChatGPT for Financial Services。按照官方描述,这是一款「量身定制的 ChatGPT Work 体验」,把内置的金融数据与 GPT‑6 Astra 的推理能力结合起来,用于帮助团队完成研究、财务建模和定制化客户材料。 这款产品的需求定义来自 OpenAI 与 Morgan Stanley 和 Evercore 的设计合作(design partnership)。官方称,通过这种合作,OpenAI 定位了其在金融机构最棘手问题上的切入位置,并确定了能够帮助「每一位银行家日常工作」的解决方案。 产品首发的落地方向是投资银行(investment banking)与股票研究(equity research)。OpenAI 表示,与合作伙伴的早期工作表明,可靠的数据访问与高质量交付物(artifact)的生成,是这些团队最大的两个痛点;后续与合作伙伴的工作将持续影响模型后训练、产品改进,以及向其他金融服务类别的扩张。 需要说明的是,原文未说明该产品的定价方式、具体上线地区与完整可用时间表。 二、...
超越对与错:评估大语言模型中的二阶社会推理
一、事件概述arXiv 上出现了一篇题为 《Beyond Right and Wrong: Evaluating Second-order Social Reasoning in Large Language Models》 的新论文(arXiv:2609.05437v1,公告类型为 new,提交时间为 2026 年 7 月 17 日)。 作者包括 Sunny Rai、Jinyi Kuang、Reyhan Jamalova、Annie Lou、Cristina Bicchieri、Niyati Malhotra、Victor Hugo Orozco-Olvera、Ana Maria Munoz-Boudet、Lyle H Ungar、Sharath C Guntuku,研究方向横跨人工智能与计算与社会(论文同时归类于 cs.AI 与 cs.CY)。 论文提出了一个核心区分: 一阶社会规范(first-order social norms):什么是社会可接受或不可接受的,比如“不要偷窃”。以往 AI 对齐工作主要集中在这一层。 二阶社会预期(second-order expect...
