Yunkai's Blog Lab

Yunkai's Blog Lab

如何在智能体时代管理 AI 投资
Created2026-07-14|技术动态
事件概述2026年7月14日,OpenAI 在其官方博客发布文章《How to manage AI investments in the agentic era》,面向企业管理者提出了五步系统性框架,帮助团队在从 chat 模式走向更长时间运行的 agent 工作流时,有效衡量 AI 的“每美元有用工作量”、控制成本,并投资于创造最大价值的场景。文章特别指出,从 GPT‑4 到 GPT‑5.4,每百万 token 价格已下降 97%,而最新的 GPT‑5.6 在编码工作流中实现 54% 的 output token 节省和 57% 的时间减少,但 token 价格本身并不能说明 AI 是否真正创造了价值。 关键技术点 提升使用与支出的可见性管理者需要清晰了解谁在使用 AI、使用哪种产品/模型、消耗多少容量、支撑何种工作。OpenAI 在 Admin Console 中更新了使用分析和支出控制功能,支持按工作空间、团队/用户、产品/模型分层洞察,帮助区分浪费、实验和有潜力的业务关键流程。 按结果 ROI 评估模型效率最低 token 价格不等于最低总...
Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking
Created2026-07-14|技术动态
论文概述近日,一篇来自 arXiv 的新论文(arXiv:2607.09665)系统性地揭示了 LLM 基准测试中长期被忽视的一个问题:提示包装器(Prompt Wrapper)的微小格式差异,如何足以改变模型打分、甚至翻转排行榜结论。作者 Deep Pankajbhai Mehta 在论文中提出并验证了两种互补指标:格式敏感度指数(FSI)——衡量因包装器选择引起的准确率波动范围,以及解析性敏感度指数(PSI)——衡量答案可解析性的相应波动范围。该研究基于 140,000 次 OpenRouter 生成实验,覆盖 7 个 QA 任务、5 类包装器家族以及 4 个参数规模从 7B 到 72B 的指令微调模型,实验规模和数据量均较为充分。 关键技术点 FSI 与 PSI 的定义FSI 是同一任务、同一模型下由不同格式包装器引发的准确率最大值与最小值之差;PSI 则对应答案解析成功率的类似范围。两者分别从“性能”和“可解析性”两个维度刻画同一提示在不同格式化层包装下的稳定性。 Token 控制协议为了排除输入长度等因素的干扰,实验在不同包装器下严格控制 token 数量(通过填充或...
从ML预测到知情诊断辅助:基于Toulmin论证模型的解释性框架
Created2026-07-14|技术动态
事件/论文概述2026年5月,来自罗马尼亚的Anca Marginean和Adrian Groza在arXiv上提交了一篇论文《From ML Predictions to Informed Diagnostic Assistance Using the Toulmin Model of Argumentation》。该论文提出了一种新的框架,将机器学习(ML)模型对眼底图像的诊断结果,通过Toulmin论证模型分解为多个结构化组件,从而为临床专家提供可解释、可质疑的诊断辅助。论文代码和实验基于公开数据集(原文未明确说明数据集名称),核心思想是不再盲目信任ML模型的最终结论,而是通过论证链条引导人类专家进行批判性评估。 关键技术点论文的核心是引入Toulmin论证模型(由英国哲学家斯·图尔敏提出)来解构ML模型的诊断输出。该模型包含6个组件: Claim(主张):ML模型(如视网膜疾病分类器)生成的诊断结论。 Grounds(依据):从图像中提取的生物标志物特征,由专门的生物标志物提取模型完成。 Warrant(正当理由):连接依据与主张的推理逻辑,由具备医学知识的A...
数据科学团队如何借助 ChatGPT Work 提升分析效率
Created2026-07-14|技术动态
事件/论文/产品概述2026 年 7 月 14 日,OpenAI 在其官方博客发布了关于 ChatGPT Work 的新用例指南,重点展示了数据科学团队如何利用该工具将分散的工作输入(如仪表盘、原始数据、指标定义、实验笔记及业务上下文)快速转化为可交付的分析资产。该产品的前身是 Codex 应用,现已在 chatgpt.com 及 ChatGPT 桌面客户端中以 ChatGPT Work 的形式提供。OpenAI 还同步推出了按需网络研讨会和相关教程,帮助团队快速上手。 关键技术点 输入多样性:ChatGPT Work 支持从仪表盘、指标定义、数据导出、实验笔记和业务上下文等多种来源提取信息。 输出结构化:工具会自动组装分析资产的第一版草稿,包含图表、数据局限性说明、原始来源链接以及审阅问题,使团队能快速验证和分享。 工作流集成:用户不再需要手动拼接多个工具的输出,而是通过自然语言对话将零散数据转化为统一的分析报告、根本原因简报、影响读数、KPI 备忘录和仪表盘规格说明。 落地模式:OpenAI 提供了具体的“用例包”(use cases),指导数据科学团队直...
销售团队如何使用 ChatGPT Work:从上下文到工作草稿的 AI 加速
Created2026-07-14|技术动态
事件/论文/产品概述2026年7月14日,OpenAI 在官方 Academy 中发布了一篇题为“How sales teams use ChatGPT Work”的指南,详细介绍了销售团队如何利用 ChatGPT Work 将分散在 CRM、通话记录、邮件、Slack、演示文稿等工具中的客户上下文和交易信号,快速转化为可用的工作草稿。这些草稿包括:管道简报(pipeline briefs)、会议准备包(meeting prep packets)、预测风险审查(forecast reviews)、客户战略方案(account plans)以及停滞交易诊断(stalled-deal diagnoses)。销售人员和经理仍然负责关系策略和最终判断,AI 帮助团队更快获得初版工作文档。 关键技术点 上下文聚合:ChatGPT Work 能够跨 CRM 字段、通话笔记、邮件线程、Slack 讨论、演示文稿、客户文档及交易信号,将分散的信息整合成结构化内容。 工作流自动化:针对销售常见任务(如客户会议准备、交易风险审查、跟进任务完成、客户记录更新等),提供预定义的模板和...
A Formalization of the Mean-Field Derivation of the Vlasov Equation: AI-Assisted Lean Formalization as a Strategy Game
Created2026-07-13|技术动态
事件概述2026年7月9日,arXiv 上发布了一篇由 Joseph K. Miller 撰写的论文,标题为《A Formalization of the Mean-Field Derivation of the Vlasov Equation: AI-Assisted Lean Formalization as a Strategy Game》。该工作首次将 Vlasov 方程的均值场推导完整形式化到 Lean 4 证明助手中,并创新性地将这一过程设计为一种“形式化游戏”:人类数学家担任指挥,AI 系统负责执行,目标将 LaTeX 格式的数学论文转化为通过机器检验的 Lean 代码。 关键技术点 形式化游戏框架论文将形式化过程视为一场游戏:玩家(人类数学家+AI)的任务是将 LaTeX 文档转化为 Lean 代码。游戏胜出的条件包括:代码通过编译、不含 sorry(未完成证明标记),且所有目标定理只依赖 Lean 的基础公理。 人类与AI的分工人类的角色是指导而非编写证明:负责定义范围、分解任务、识别现有库(Mathlib)中的缺口;AI 系统则自主执行具体的证明步骤。这种分...
ARCANA:面向ARC-AGI-2推理的反思式多智能体程序合成框架
Created2026-07-13|技术动态
事件/论文概述ARC-AGI(Abstraction and Reasoning Corpus)系列任务长期以来被视为衡量AI系统抽象推理能力的“罗马竞技场”。2026年7月,一篇题为《ARCANA: A Reflective Multi-Agent Program Synthesis Framework for ARC-AGI-2 Reasoning》的论文(arXiv:2607.09059)提出了一个名为ARCANA的多智能体协作框架,专门针对ARC-AGI-2任务在严格的测试时间和硬件约束下进行求解。 ARCANA的核心思想是将每个任务分解为迭代式感知、假设生成、符号执行和反思精炼四个阶段,并交由多个专业智能体协作完成。这些智能体通过一个共享的可微分黑板(differentiable blackboard)进行通信,并由一个学习得到的元控制器(meta controller)调度。整体设计结合了结构化程序搜索与自适应多轮修正,旨在提升抽象转换任务上的推理效率和解的质量。 关键技术点 多智能体分解与协作:ARCANA将推理过程解耦为四个专用智能体: 感知接地智能体...
Interval Certifications for Multilayered Perceptrons via Lattice Traversal
Created2026-07-13|技术动态
事件概述2026年7月,一篇题为《Interval Certifications for Multilayered Perceptrons via Lattice Traversal》的论文在 arXiv 上发布,作者来自希腊和卢森堡的研究机构。该论文针对 AI 安全中的核心问题——对抗鲁棒性(adversarial robustness),提出了一个严谨的理论框架。作者将对抗鲁棒性归约为格遍历问题,并首次引入**完全认证(complete certification)的概念,与传统的声音认证(sound certification)**形成互补。论文还开发了基于格遍历算子的迭代求精与验证算法,并在对称区间上给出了对数复杂度算法,最后通过新系统 ParallelepipedoNN 进行了实验验证。 关键技术点 问题归约:将 MLP 分类器的对抗鲁棒性认证问题转化为格遍历问题。格中的每个元素对应一个包含输入点 x 的轴对齐超矩形(区间)。 两类认证: 声音认证(Sound Certification):区间 I 满足 x ∈ I,且 x 在 I 内任意扰动均不改变 MLP 的预测—...
CogniConsole:将推理时控制外化为形式化抽象,实现可靠的 LLM 交互
Created2026-07-13|技术动态
事件概述大语言模型(LLM)系统的可靠性通常被归因于模型本身的能力。然而,一篇发表于 arXiv(编号 2607.08774)的最新论文对此提出了挑战。该论文由 Vanessa Figueiredo 和 Wilter Franceschi 共同撰写,提出了 CogniConsole——一种将推理时控制(inference-time control)外化为结构化接口的架构。作者通过大规模实验证明,在固定模型架构下,增加结构化的脚手架(scaffolding)可以系统性地降低输出方差和失败率,从而揭示出许多所谓的“失败模式”实际上源于控制层面的欠指定,而非模型能力不足。 论文来源:cs.AI updates on arXiv.org发布时间:2026-07-13 04:00:00原文链接:https://arxiv.org/abs/2607.08774 关键技术点 推理时控制(Inference-Time Control):作者将推理时控制定义为“任务框架和上下文选择”的计算层。它独立于模型参数,决定了 LLM 在推理时如何被调用、上下文如何组织、任务如何分解。 CogniCons...
L-MAD: 多智能体辩论结构在法律推理中的系统评估
Created2026-07-13|技术动态
事件概述多智能体辩论(MAD)框架在通用推理任务中展现出巨大潜力,但在高度结构化、知识密集的法律领域,其有效性仍缺乏系统研究。2026年7月,来自越南的研究团队(Tan-Minh Nguyen等)在arXiv上发布了名为L-MAD的论文,首次对多种辩论结构和聚合方法在法律文本蕴含(Legal Textual Entailment)任务中的表现进行了全面评估。该论文荣获ICML 2026 AI4Law Workshop杰出论文奖,引起了AI与法律交叉领域的高度关注。 关键技术点 L-MAD框架:为多个智能体分配不同的专家角色(如律师、法官、法学家等),模拟真实法律辩论场景,并通过不同结构(如轮次辩论、并行投票等)与聚合策略整合输出结果。 性能提升:相比强大的单智能体基线,L-MAD在Legal Textual Entailment任务上最高提升8%。 规模与轮次的权衡: 增加智能体数量:减少结果不一致性,提升准确率。 增加讨论轮次:导致有害的“过度讨论漂移”(over-deliberation drift),即智能体相互强化错误,反而降低性能。 安全边际:论文提出了部署协作式多...
1…333435…37
avatar
Yunkai Huang
嗨,这里是云开~
Articles
362
Tags
748
Categories
5
Follow Me
Announcement
This is my Blog
Recent Posts
月面晨昏线悖论:日落后月亮为什么还“朝上”?以及作者顺手测出的 LLM 推理短板2026-09-27
重新拾起木工:从狗门到露台花坛的两次动手实践2026-09-27
当 Google 开始安慰你:AI Overview 误读搜索意图引发的产品反思2026-09-27
当写代码比注册公司还快:为什么开发者该提前准备一个 LLC2026-09-27
DeepSeek 开源 DSec 沙箱基础设施论文:单集群日跑 300 万沙箱,支撑 Agentic RL 训练2026-09-26
Categories
  • [技术动态]11
  • 技术动态348
  • 技术探索1
    • 随笔1
  • 随笔1
Tags
强化学习 Adversarial Defense 广告技术 PostgreSQL AI Overview Enterprise Dual-Use 大模型成本 数字农业 预注册实验 几何光学 知识图谱 Football 安全 Infrastructure Devin 实时地图 工作流自动化 Place Recognition Edge Computing 金融问答 递归自我改进 EEG 天文 Cost-Aware 自主实验 Go Battery 计算机历史 Medical AI Explainable AI 视觉错觉 Model Distillation Security 启发式搜索 Cyber Security 效率优化 专利撰写 GPT-6 老年科技
Archives
  • September 2026 112
  • August 2026 134
  • July 2026 113
  • February 2026 3
Website Info
Article Count :
362
Unique Visitors :
Page Views :
Last Update :
© 2025 - 2026 By Yunkai HuangFramework Hexo 8.1.1|Theme Butterfly 5.5.4