Yunkai's Blog Lab

Yunkai's Blog Lab

现有系统泛化评测漏掉了什么?一篇以推理为中心的分析
Created2026-09-18|技术动态
事件概述arXiv 上新出现一篇预印本(arXiv:2609.19212,cs.AI,2026 年 9 月 16 日提交,标注为 Preprint, Under review),作者为 Chengwen Qi、Deheng Ye、Yatao Bian,标题为《What Do Current Systematic Generalization Tasks Miss? A Reasoning-Centered Analysis》。 论文的出发点是一个长期存在的评测困境:系统泛化(systematic generalization)——即通过重新组合已知的原子元素来解决全新问题——被认为是人类智能的核心组成部分,但在受控条件下很难被严格研究。为了让实验可行,既有研究普遍采用了几种简化设定: 近似线性的动作组合(approximately linear action composition); 基于产出率(productivity-based)的测试; 动作显式(action-explicit)的目标。 论文认为,这些简化虽然让系统泛化更易于研究,但也遗漏了这项能力的若干本质侧面。为...
我们期待 LLM 做什么?LLM Benchmark 设计版图的全景测绘
Created2026-09-18|技术动态
一、事件概述2026 年 9 月 15 日,独立研究者 Chao Wang 在 arXiv 提交了一篇题为《What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks》的论文(arXiv:2609.19182,cs.AI / cs.CL),试图回答一个比”哪个模型排第一”更底层的问题:评测本身在怎么变。 论文的出发点很直接:Benchmark 是衡量和传达大语言模型进展的核心工具,但排行榜只告诉你模型的相对位次,几乎不告诉你”评测需求”自身发生了什么变化。作者换了一个观察角度——不断增多的各类 Benchmark,本身就是一份关于”研究者期待 LLM 做什么、以及把什么算作成功”的公开记录。 为此,作者系统性地测绘了 2022 年 1 月至 2026 年 8 月期间 arXiv 上引入或更新评测资源的 14,767 篇论文,考察目标系统与领域、评测材料与条件、打分机制三个维度的演变。论文共 15 页、5 张图、7 张表,原始页面给出了数据与代码链接(具体地址原文未说明)。 二、关键技术点2.1 方法...
Cooley 用 ChatGPT 加速 IPO:一家顶级律所的 Agentic 落地样本
Created2026-09-17|技术动态
事件概述OpenAI 官网发布了一篇客户案例,介绍国际律所 Cooley 如何借助 ChatGPT Work 构建自研 AI 产品 GO Public,把智能能力引入 IPO(首次公开募股)流程。 先看 Cooley 的体量:原文提到,2025 年该律所在全球参与顾问了 180 笔交易,交易总额超过 515 亿美元;它在美国发行人侧 IPO 市场已连续十年位居前列,过去 20 多年里参与顾问的风险投资支持型 IPO 数量超过任何其他律所。对这样一家以资本市场业务见长的律所来说,IPO 流程的效率变化具备一定的行业指示意义。 Cooley 首席创新官 David Wang 描述了痛点:”对我们律师来说,工作总是非常繁忙。当有一个 IPO 时,成千上万件事需要持续不断地完成。” GO Public 的定位是:基于 ChatGPT Work 打造的专有 AI 产品,其 agentic harness(智能体执行框架)负责分析信息,由律师进行审查与验证,最终把工作流汇聚成一个为 IPO 定制的起点材料。 关键技术点1. 以 Agentic Harness 约束工作流,而非放任自动化 原文...
让 AI 辅助论断可被独立质疑:Publication Authority 与可证伪发布记录协议
Created2026-09-17|技术动态
事件概述arXiv 上新发布一篇预印本论文《Making AI-Assisted Claims Independently Challengeable: Publication Authority and a Protocol for Falsifiable Publication Records》(arXiv:2609.17631,cs.AI),作者为 Torsten Olivi Tiltack、Yifei Dong、Kun Yu、Xu Wang、Wei Liu、Jianlong Zhou、Ren Ping Liu、Fang Chen,通讯作者为 Yifei Dong。主文 24 页、4 张图,补充材料 13 页,属于未经同行评审的预印本。 论文的出发点是一个相当具体的失效模式:当证据、分析过程、人类授权、呈现方式与更正历史分别指向不同状态时,AI 辅助生成的论断仍然可能”看起来”具有权威性。作者认为,溯源(provenance)、证明(attestation)和透明性(transparency)能暴露历史,但它们本身并不能规定本文所考察的那一次”发布转换”(publicati...
EvolveTrade:把系统提示当作可演化策略,让 LLM 交易 Agent 自我改进
Created2026-09-17|技术动态
一、这篇论文在做什么arXiv 上新挂出的论文 《EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents》(arXiv:2609.17632,2026 年 9 月 15 日提交,cs.AI 主分类并交叉 cs.CL),作者为 Sehee Kim、Yumin Choi、Minki Kang、Sung Ju Hwang。 论文要解决的问题很具体:LLM 交易 Agent 能够把行情数据、新闻和可执行的分析代码结合起来,但它们的行为通常由部署前手写死的工具调用策略决定。这套静态策略限定了 Agent 如何收集证据、何时调用工具、怎样验证信号、以及在变化的市场环境(market regime)下如何管理风险——一旦市场环境切换,它无法自适应。 EvolveTrade 的思路是:把工具型交易 Agent 的 system prompt 视为一个”文本参数化策略”(text-parameterized policy)。每隔一个更新间隔(update interval),由一个 ...
一种颜色预处理改进 DSATUR:SSLD 用 SDP 引导图着色启发式
Created2026-09-17|技术动态
论文概述arXiv 新收录论文《One Color Preprocessing Improves DSATUR》(arXiv:2609.17633,cs.AI),作者为 Adam Nouira 和 Lucas Isenmann,提交时间为 2026 年 9 月 15 日。 论文关注图着色问题(Graph Coloring Problem, GCP)。GCP 是 NP-hard 问题,而 DSATUR 是求解 GCP 最快的启发式算法之一;不过,DSATUR 生成的着色方案通常比当前最先进的着色算法使用更多颜色。作者提出 SSLD(Semidefinite Spectral Learning with DSATUR),核心思路是在让 DSATUR 完成剩余图着色之前,先预处理出第一个较好的颜色类,再用 DSATUR 完成其余部分的着色。 这个第一个颜色类来自半正定规划(SDP),其形式类似于用于计算 Lovász theta 数的 SDP。作者表示,据其所知,SSLD 是第一种通过固定颜色类预处理来改进 DSATUR 的方法。 在评估方面,论文将 SSLD 与 DSATUR 以及一...
物理约束数字孪生守卫城市人流传感器:用共形校准检测隐蔽虚假数据注入
Created2026-09-17|技术动态
一、论文概述城市行人计数系统如今已经不只是交通统计工具:它的输出会进入经济指标、城市规划决策和安全运营流程。但建立在这些计数之上的数字孪生,普遍默认输入数据流就是”真值”(ground truth)。这篇论文要研究的,正是当这个假设不成立时会发生什么。 论文标题为 Physics-Constrained Digital Twins for Sensor Integrity in Urban Pedestrian Flow: Detecting Stealthy False Data Injection with Conformal Guarantees,作者为 Oscar Mogollon Gutierrez、Fatemeh Ghasemi、Mohammadhossein Homaei、Andres Caro、Mar Avila,提交于 2026 年 9 月 15 日,属于 arXiv cs.AI 与 cs.CR 交叉方向,全文 16 页、4 张图、8 张表。 论文的核心贡献可以概括为四点: 首次为城市尺度行人感知形式化定义了”隐蔽虚假数据注入”(stealthy false ...
OpenAI 发布模型失准报告框架,并公布六份意外行为实例
Created2026-09-16|技术动态
事件概述OpenAI 发布了一套用于跟踪、调查和披露模型失准(model misalignment)的新框架,同时公布了六份关于过去六个月内观察到的意外或令人担忧的模型行为的报告。该消息发布于 2026 年 9 月 16 日,归入 OpenAI 的 Research / Safety 板块。 OpenAI 在文中说明,此前虽然也公开过关于失准的发现,但由于缺乏系统化的报告方式,披露往往是临时性的、频率低于理想水平:团队经常要等到能把若干实例汇总成一份报告,或者把它们塞进新发布模型的 system card 里。新框架的目标是在观察到失准行为后尽快发布报告,即便此时尚未完全解释或缓解该行为。 OpenAI 给出的背景判断是:随着 AI 系统更先进、部署更广泛,需要就对齐研究的进展建立更广泛、信息更充分的共识。原文明确表示,OpenAI 不认为 AI 行业已将对齐与监控解决到足以支撑继续以最高速度负责任扩展的程度。关于未来数月和数年 AI 开发应如何推进的决策,需要建立在构建前沿模型的公司之外的人也能自行审视的证据之上。 框架还强调了透明的优先性:OpenAI 表示即便某个...
OpenAI 联合 AARP 旗下 OATS 走进 10 座城市:为 1000 名老年人开设线下 ChatGPT 工作坊
Created2026-09-16|技术动态
事件概述OpenAI Academy 宣布与 AARP(美国退休人员协会)旗下的 Older Adults Technology Services(OATS)合作,举办 Older Adults AI Skills Jam:一场面向老年人的免费线下学习活动,目标是帮助他们自信、安全地使用 ChatGPT。 据官方摘要,本次活动计划覆盖美国 10 座城市的 1,000 名老年人。这是 OpenAI 与 OATS 多年合作计划的一部分,通过 OATS 的旗舰项目 Senior Planet 落地,长期目标是帮助老年人建立实用的 AI 技能,并提升在线安全意识。 原文列出了 10 个合作社区: Senior Planet,科罗拉多州丹佛 Senior Planet,佛罗里达州迈阿密 Senior Planet,得克萨斯州圣安东尼奥 Senior Planet,马里兰州蒙哥马利县 Senior Planet,纽约州皇后区 The Mirowitz Center,密苏里州圣路易斯 Senior Community Services,明尼苏达州双城 Nashville Public Lib...
OpenAI 用 AI 重塑广告:Sponsored Agents、营销工具与 HubSpot/Shopify 集成
Created2026-09-16|技术动态
OpenAI 于 2026 年 9 月 16 日发布了一系列面向 ChatGPT Ads 的新 AI 体验,核心方向是让广告对用户更有用、对企业更容易投放。此次更新包括测试 Sponsored Agents、在 ChatGPT Work 中通过提示词创建广告、增强 Ads Manager 的 AI 创意工具,以及将 ChatGPT Ads 集成到 HubSpot 和 Shopify。 事件概述根据 OpenAI News 的说明,这些更新是构建“以 AI 为中心的广告平台”的下一步。它们同时覆盖广告的两端:用户如何在 AI 原生环境中与企业互动,以及企业如何用 AI 创建和管理广告。 具体发布内容包括: 测试 Sponsored Agents:用户点击 ChatGPT 中的广告后,可以与企业赞助的 agent 开始对话。 在 ChatGPT Work 中通过少量提示词
1…456…37
avatar
Yunkai Huang
嗨,这里是云开~
Articles
362
Tags
748
Categories
5
Follow Me
Announcement
This is my Blog
Recent Posts
月面晨昏线悖论:日落后月亮为什么还“朝上”?以及作者顺手测出的 LLM 推理短板2026-09-27
重新拾起木工:从狗门到露台花坛的两次动手实践2026-09-27
当 Google 开始安慰你:AI Overview 误读搜索意图引发的产品反思2026-09-27
当写代码比注册公司还快:为什么开发者该提前准备一个 LLC2026-09-27
DeepSeek 开源 DSec 沙箱基础设施论文:单集群日跑 300 万沙箱,支撑 Agentic RL 训练2026-09-26
Categories
  • [技术动态]11
  • 技术动态348
  • 技术探索1
    • 随笔1
  • 随笔1
Tags
强化学习 Adversarial Defense 广告技术 PostgreSQL AI Overview Enterprise Dual-Use 大模型成本 数字农业 预注册实验 几何光学 知识图谱 Football 安全 Infrastructure Devin 实时地图 工作流自动化 Place Recognition Edge Computing 金融问答 递归自我改进 EEG 天文 Cost-Aware 自主实验 Go Battery 计算机历史 Medical AI Explainable AI 视觉错觉 Model Distillation Security 启发式搜索 Cyber Security 效率优化 专利撰写 GPT-6 老年科技
Archives
  • September 2026 112
  • August 2026 134
  • July 2026 113
  • February 2026 3
Website Info
Article Count :
362
Unique Visitors :
Page Views :
Last Update :
© 2025 - 2026 By Yunkai HuangFramework Hexo 8.1.1|Theme Butterfly 5.5.4