Yunkai's Blog Lab

Yunkai's Blog Lab

OpenAI 发布 ChatGPT Admin Console 分析能力:把 AI 使用量、任务洞察与业务成果串起来
Created2026-09-16|[技术动态]
事件/产品概述OpenAI 于 2026 年 9 月 16 日发布文章《How to connect AI usage to business value》,介绍 ChatGPT Admin Console 中的 Analytics 能力。该能力的核心目标,是帮助管理员和业务负责人回答三个问题:团队在哪些地方使用 AI、这些使用带来了什么工作成果、以及下一步应该把投入放在哪里。 根据原文,ChatGPT Admin Console 中的 Analytics 把 使用量与成本数据、任务洞察、成果指标 整合在一起,覆盖 ChatGPT Work 和 Codex 两条产品线。原文强调,单纯看使用量和支出只能讲一部分故事,管理员还需要看到“人们用 AI 做什么”以及“AI 帮他们完成了什么”。 文章的结构基本围绕管理员的工作流展开:先看使用量与支出,再看团队用 AI 做什么工作,然后识别培训和支撑需求,接着追踪 Codex 对工程成果的贡献,最后用 Admin 插件和 API 把分析接入业务决策。 关键技术点1. Usage 视图:使用量与支出的统一视图Usage 视图汇总了 ...
OpenAI 经济研究:跨职业任务正融入日常工作流,AI 正在改变工作分工
Created2026-09-16|技术动态
事件概述OpenAI 于 2026 年 9 月 16 日发布新一期经济研究(OpenAI Economic Research),题为《How workers are unlocking new ways of working》。这份报告是 “Work at the Frontier” 系列的最新一篇,延续了首篇报告提出的 “task crossover”(任务跨界) 概念——即工作者使用 AI 去完成历史上归属于另一职业的活动。 首篇报告记录了这一现象的存在,而本次研究追问的是:这些跨职业行为之后会怎样?它们是“尝鲜一次”就结束,还是会沉淀成稳定的工作流? 研究结论是:一部分跨职业 AI 使用具有明显的复现性。工作者会反复回到本职边界之外的任务上,这些活动在其被观测到的 AI 使用中占比随时间上升。报告提出的判断是:如果这些活动最终变成常规职责,岗位名称可能不变,但岗位内部的工作内容组合会变宽。 关键技术点数据规模与范围 研究分析了 2026 年 4 月至 7 月期间超过 150 万条与工作相关的 ChatGPT 消息。其中一组核心样本是 约 6,200 名在 4 月到 7 月被...
Converge Then Diversify:把多目标贝叶斯优化的收敛与多样性拆成两个阶段
Created2026-09-15|技术动态
事件概述arXiv 上出现一篇新论文 《Converge Then Diversify: Decoupling Convergence and Diversity in Multi-Objective Bayesian Optimisation》(arXiv:2609.13396,cs.AI,交叉 stat.ML),作者为 Chao Jiang、Yueling Huang、Miqing Li,于 2026 年 9 月 11 日提交,全文 26 页、4 张图。 论文针对的是多目标贝叶斯优化(MOBO)中的一个老问题:MOBO 的目标是用尽量少的样本,去近似昂贵的黑箱多目标函数的 Pareto 前沿。一个高质量的近似解集需要同时满足两点——收敛性(解尽可能靠近真实 Pareto 前沿)和多样性(解尽可能铺满整条前沿)。 现有 MOBO 方法的常规做法是“同时兼顾”:一边把搜索推向 Pareto 前沿,一边维持一组非支配解的分散度,希望解集能逐步逼近整条前沿。论文指出,这种策略在搜索预算充足时是有效的,但要同时把收敛和多样性都处理好,本身就需要相当精心的设计;而在预算非常紧张的情况下,...
面向自适应物理 AI:LLM Agent 能否胜任长时程物理任务管理?
Created2026-09-15|技术动态
事件概述arXiv 上出现了一篇题为 Toward Self-Adaptive Physical AI: Can LLM Agents Manage Long-Horizon Physical Tasks? 的新论文(arXiv:2609.13436,cs.AI 分类,提交于 2026 年 9 月 11 日),作者为 Varun Kaushik、Yayun Tan、Xiaofan Yu 三人。论文共 13 页、5 张图、3 张表。 论文关心的问题很直接:LLM Agent 能否在零样本(zero-shot)条件下,自主管理需要长期持续运行的物理任务,并在环境变化时无需人工干预地完成自我适应? 作者指出,现有路线存在两个短板:要么依赖大量数据与反复重训练,要么主要停留在虚拟世界中的 Agent 研究。而物理任务的性质决定了 Agent 必须持续观测环境、执行具有实际后果的动作,并且在环境漂移时依然保持有效。围绕这一目标,论文构建了一个多 Agent 框架,并以农业任务作为评测场景,与强化学习(RL)Agent 在不同天气模式下进行对比。 核心结论是两点: 在相同天气模式下,零样本...
广义智能体迭代 GAI:用一个形式化框架统一迭代策略改进与递归自我改进
Created2026-09-15|技术动态
事件/论文概述arXiv 上出现了一篇新论文《Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement》(arXiv:2609.13406v1),作者为 Hongyao Tang、Yi Ma、Pengyi Li、Yifu Yuan,提交时间为 2026 年 9 月 11 日,归类在 cs.AI,同时交叉列出 cs.LG。 论文的出发点是一个概念上的困惑:当我们谈论**递归自我改进(Recursive Self-Improvement, RSI)**时,谈的究竟是一种现象、一种机制,还是一个前景?作者指出,在通向自主且持续演化的智能这一方向上,RSI 正在很多尺度上被主张和宣称,但目前并不存在一个能够形式化描述这些新兴实例的统一框架。 与之相对,经典强化学习领域中的迭代策略改进已经由**广义策略迭代(Generalized Policy Iteration, GPI)**刻画。GPI 适用面广、理论性质清...
Vibe Patenting:当 LLM 裁判遇上专利撰写 Agent,评测信号到底靠不靠谱?
Created2026-09-15|技术动态
一、事件概述arXiv 上出现了一篇题为 《Vibe Patenting: Evaluating LLM Judges for Professional Patent-Drafting Agents》 的新论文(arXiv:2609.13422,v1,2026 年 9 月 11 日提交,cs.AI 主分类,交叉 cs.LG 与 cs.MA)。 论文作者为 Toshiaki Koike-Akino、Vlad Blaykhman、Ye Wang、Jing Liu、Gene V. Vinokur 共五人。全文 29 页、18 张图,规模不小。 论文要解决的问题相当直接:LLM-as-a-Judge 已经被广泛用于评估和改进 AI 生成的输出,但在专利撰写这类复杂的专业工作中,这种裁判的可靠性仍然是未知数。 为此作者构建了 Vibe Patenting —— 一个面向 AI Agent 评测的、端到端的专利撰写测试床(testbed)。在这个测试床里,一个被独立调用的 LLM 裁判对生成的专利草稿进行评估,并给出结构化反馈,用于后续的迭代修订。作者在多个发明(inventions)和多种...
ZGCM-1:7B 全开放基础模型,用「内部思考 + 外部工具」对标百倍参数前沿模型
Created2026-09-15|技术动态
概述arXiv 上新出现一篇论文 《ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search》(arXiv:2609.13356,cs.AI,2026 年 9 月 11 日提交),作者包括 Jiyan He 等共 22 人。 论文提出 ZGCM-1:一个完全开源的 7B dense(稠密)基础模型,从零开始训练,主打「极端的数据效率、系统效率与算法效率」。它建立在这样一个核心前提上: 紧凑模型无法靠被动记忆开放网络(passively memorize the open web)取胜,但可以通过把有意识的内部思考(deliberate internal thinking)与主动的外部工具使用(active external tool use)耦合起来,突破参数量带来的能力上限。 为了在 256K 上下文下支撑这一范式,作者给出了一套端到端、高效率的开放训练配方,并配套开源了从预训练、中训练到后训练各阶段的模型权重、中间 checkpoint、训练代码、分阶...
不是对互联网上瘾,而是对信息上瘾:一篇 Hacker News 热帖的技术侧思考
Created2026-09-14|技术动态
事件概述2026 年 9 月 14 日,Hacker News 首页出现了一篇题为《I’m not addicted to the internet or my smartphone. I’m addicted to information》的文章,链接指向作者个人站点 explorator.dev 的博客页面《Addiction》(文章本身标注日期为 2026 年 9 月 7 日)。该帖在 HN 上获得 64 分、41 条评论,属于典型的中等热度讨论帖。 原文不是论文,也不是产品发布,而是一篇个人自述式的随笔,核心观点可以概括为一句话:作者的”上瘾对象”既不是互联网,也不是智能手机,而是”信息”本身,尤其是”优质信息”。 作者回顾了自己的行为轨迹:最早以为是沉迷网络论坛,随后是 Facebook、Reddit、Hacker News、9GAG、Instagram;智能手机和移动互联网体验变好之后,使用时间进一步增加,从”坐在电脑前拖延”扩散到任何时间、任何地点——“一秒钟的无聊就会触发一次小小的查看动作”。原文还引用了”口袋里的饼干(cookie in your pocket)...
Show HN:用 Behringer FCB1010 MIDI 踏板在 macOS 上做宏命令(fcbnerd)
Created2026-09-14|技术动态
事件概述Hacker News 首页出现了一个名为 fcbnerd 的开源项目(Show HN),作者是 JamesRyanATX。项目的定位一句话就能说清: 把 MIDI 脚控制器当成 Mac 的“第二块键盘”。 具体来说,fcbnerd 是一个 macOS 命令行工具。它连接到 CoreMIDI 输入源,监听脚踏开关和表情踏板发出的消息,然后做两件事之一: 匹配到用户预先配置的绑定(binding)时,执行一条 shell 命令; 或者把每一条 MIDI 消息按行输出为一个 JSON 对象,交给别的程序去决定“这一脚是什么意思”。 项目虽然是为 Behringer FCB1010 这个 MIDI 踏板写的,但作者明确说明它本身不含任何 FCB1010 专属逻辑,任何 CoreMIDI 输入源都可以用。 原文给出的数据:Hacker News 上 28 points、2 条评论;GitHub 仓库 9 个 commit、9 个 star、0 个 fork(截至原文抓取时)。许可证内容原文未说明。 关键技术点1. 为什么是命令行工具,而不是一个 App这是整个项目最有意思...
dbt Charts 开源:为 Chat 而生的声明式图表语言
Created2026-09-14|技术动态
事件概述dbt 团队(原文作者为 Dave Fowler,发布于 2026 年 9 月 14 日)宣布开源 dbt Charts,将其定位为一种用于仪表盘的声明式语言。核心理念是:既然越来越多前端与用户正在变成聊天式 Agent,那么图表就应该从 BI 工具的 UI 里搬出来,放到代码里去。 同时,团队还上线了托管平台 dbtCharts.com 的公测版本,承接图表语言之外剩下的那部分 BI 能力。 原文的论证起点是一个很现实的痛点:用 Agent 做分析报告确实快,一个下午就能”聊”出一份报表,但默认产物是一堆 HTML、CSS、JavaScript、若干图表库,再加上一个 React 或 Streamlit 应用。要把一个结果回溯到数据源,得跨好几种语言和文件去追,人工审计慢,而且 Agent 每次改动都要为此付出时间和 token 成本。 另一条路线——在 UI 优先的 BI 工具上外挂 Copilot——虽然把 AI 约束在受治理的轨道上,但轨道很窄:Agent 只能做 UI 暴露出来的那些事。dbt Charts 想提供的是第三种选择。 关键技术点SQL 管”看什么”...
1…567…37
avatar
Yunkai Huang
嗨,这里是云开~
Articles
362
Tags
748
Categories
5
Follow Me
Announcement
This is my Blog
Recent Posts
月面晨昏线悖论:日落后月亮为什么还“朝上”?以及作者顺手测出的 LLM 推理短板2026-09-27
重新拾起木工:从狗门到露台花坛的两次动手实践2026-09-27
当 Google 开始安慰你:AI Overview 误读搜索意图引发的产品反思2026-09-27
当写代码比注册公司还快:为什么开发者该提前准备一个 LLC2026-09-27
DeepSeek 开源 DSec 沙箱基础设施论文:单集群日跑 300 万沙箱,支撑 Agentic RL 训练2026-09-26
Categories
  • [技术动态]11
  • 技术动态348
  • 技术探索1
    • 随笔1
  • 随笔1
Tags
强化学习 Adversarial Defense 广告技术 PostgreSQL AI Overview Enterprise Dual-Use 大模型成本 数字农业 预注册实验 几何光学 知识图谱 Football 安全 Infrastructure Devin 实时地图 工作流自动化 Place Recognition Edge Computing 金融问答 递归自我改进 EEG 天文 Cost-Aware 自主实验 Go Battery 计算机历史 Medical AI Explainable AI 视觉错觉 Model Distillation Security 启发式搜索 Cyber Security 效率优化 专利撰写 GPT-6 老年科技
Archives
  • September 2026 112
  • August 2026 134
  • July 2026 113
  • February 2026 3
Website Info
Article Count :
362
Unique Visitors :
Page Views :
Last Update :
© 2025 - 2026 By Yunkai HuangFramework Hexo 8.1.1|Theme Butterfly 5.5.4