Yunkai's Blog Lab

Yunkai's Blog Lab

A Formalization of the Mean-Field Derivation of the Vlasov Equation: AI-Assisted Lean Formalization as a Strategy Game
Created2026-07-13|技术动态
事件概述2026年7月9日,arXiv 上发布了一篇由 Joseph K. Miller 撰写的论文,标题为《A Formalization of the Mean-Field Derivation of the Vlasov Equation: AI-Assisted Lean Formalization as a Strategy Game》。该工作首次将 Vlasov 方程的均值场推导完整形式化到 Lean 4 证明助手中,并创新性地将这一过程设计为一种“形式化游戏”:人类数学家担任指挥,AI 系统负责执行,目标将 LaTeX 格式的数学论文转化为通过机器检验的 Lean 代码。 关键技术点 形式化游戏框架论文将形式化过程视为一场游戏:玩家(人类数学家+AI)的任务是将 LaTeX 文档转化为 Lean 代码。游戏胜出的条件包括:代码通过编译、不含 sorry(未完成证明标记),且所有目标定理只依赖 Lean 的基础公理。 人类与AI的分工人类的角色是指导而非编写证明:负责定义范围、分解任务、识别现有库(Mathlib)中的缺口;AI 系统则自主执行具体的证明步骤。这种分...
GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning
Created2026-07-13|技术动态
事件/论文概述2026年7月,arXiv 上发布了一篇题为《GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning》的论文,作者为 Maureese Williams 和 Dymitr Nowicki。该论文提出了一种名为 GATS(Graph-Augmented Tree Search)的新型规划框架,旨在解决现有 LLM Agent 规划方法(如 LATS、ReAct)在推理时严重依赖 LLM 推理、计算成本高昂且行为随机的问题。GATS 通过结合基于 UCB1 的系统化树搜索与分层世界模型,在规划阶段完全消除 LLM 调用,同时取得了优异的规划性能。 关键技术点GATS 的核心创新在于其三层世界模型与图增强树搜索的结合: 三层世界模型(Layered World Model): L1(精确符号动作匹配):对于已知环境中的确定性动作,直接通过符号匹配预测结果,无需任何模型调用。 L2(执行日志统计):基于历史执行日志学习动作的成功概率和转移分...
ARCANA:面向ARC-AGI-2推理的反思式多智能体程序合成框架
Created2026-07-13|技术动态
事件/论文概述ARC-AGI(Abstraction and Reasoning Corpus)系列任务长期以来被视为衡量AI系统抽象推理能力的“罗马竞技场”。2026年7月,一篇题为《ARCANA: A Reflective Multi-Agent Program Synthesis Framework for ARC-AGI-2 Reasoning》的论文(arXiv:2607.09059)提出了一个名为ARCANA的多智能体协作框架,专门针对ARC-AGI-2任务在严格的测试时间和硬件约束下进行求解。 ARCANA的核心思想是将每个任务分解为迭代式感知、假设生成、符号执行和反思精炼四个阶段,并交由多个专业智能体协作完成。这些智能体通过一个共享的可微分黑板(differentiable blackboard)进行通信,并由一个学习得到的元控制器(meta controller)调度。整体设计结合了结构化程序搜索与自适应多轮修正,旨在提升抽象转换任务上的推理效率和解的质量。 关键技术点 多智能体分解与协作:ARCANA将推理过程解耦为四个专用智能体: 感知接地智能体...
CogniConsole:将推理时控制外化为形式化抽象,实现可靠的 LLM 交互
Created2026-07-13|技术动态
事件概述大语言模型(LLM)系统的可靠性通常被归因于模型本身的能力。然而,一篇发表于 arXiv(编号 2607.08774)的最新论文对此提出了挑战。该论文由 Vanessa Figueiredo 和 Wilter Franceschi 共同撰写,提出了 CogniConsole——一种将推理时控制(inference-time control)外化为结构化接口的架构。作者通过大规模实验证明,在固定模型架构下,增加结构化的脚手架(scaffolding)可以系统性地降低输出方差和失败率,从而揭示出许多所谓的“失败模式”实际上源于控制层面的欠指定,而非模型能力不足。 论文来源:cs.AI updates on arXiv.org发布时间:2026-07-13 04:00:00原文链接:https://arxiv.org/abs/2607.08774 关键技术点 推理时控制(Inference-Time Control):作者将推理时控制定义为“任务框架和上下文选择”的计算层。它独立于模型参数,决定了 LLM 在推理时如何被调用、上下文如何组织、任务如何分解。 CogniCons...
Interval Certifications for Multilayered Perceptrons via Lattice Traversal
Created2026-07-13|技术动态
事件概述2026年7月,一篇题为《Interval Certifications for Multilayered Perceptrons via Lattice Traversal》的论文在 arXiv 上发布,作者来自希腊和卢森堡的研究机构。该论文针对 AI 安全中的核心问题——对抗鲁棒性(adversarial robustness),提出了一个严谨的理论框架。作者将对抗鲁棒性归约为格遍历问题,并首次引入**完全认证(complete certification)的概念,与传统的声音认证(sound certification)**形成互补。论文还开发了基于格遍历算子的迭代求精与验证算法,并在对称区间上给出了对数复杂度算法,最后通过新系统 ParallelepipedoNN 进行了实验验证。 关键技术点 问题归约:将 MLP 分类器的对抗鲁棒性认证问题转化为格遍历问题。格中的每个元素对应一个包含输入点 x 的轴对齐超矩形(区间)。 两类认证: 声音认证(Sound Certification):区间 I 满足 x ∈ I,且 x 在 I 内任意扰动均不改变 MLP 的预测—...
L-MAD: 多智能体辩论结构在法律推理中的系统评估
Created2026-07-13|技术动态
事件概述多智能体辩论(MAD)框架在通用推理任务中展现出巨大潜力,但在高度结构化、知识密集的法律领域,其有效性仍缺乏系统研究。2026年7月,来自越南的研究团队(Tan-Minh Nguyen等)在arXiv上发布了名为L-MAD的论文,首次对多种辩论结构和聚合方法在法律文本蕴含(Legal Textual Entailment)任务中的表现进行了全面评估。该论文荣获ICML 2026 AI4Law Workshop杰出论文奖,引起了AI与法律交叉领域的高度关注。 关键技术点 L-MAD框架:为多个智能体分配不同的专家角色(如律师、法官、法学家等),模拟真实法律辩论场景,并通过不同结构(如轮次辩论、并行投票等)与聚合策略整合输出结果。 性能提升:相比强大的单智能体基线,L-MAD在Legal Textual Entailment任务上最高提升8%。 规模与轮次的权衡: 增加智能体数量:减少结果不一致性,提升准确率。 增加讨论轮次:导致有害的“过度讨论漂移”(over-deliberation drift),即智能体相互强化错误,反而降低性能。 安全边际:论文提出了部署协作式多...
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
Created2026-07-13|技术动态
论文概述当前 AI Agent 能够自主完成短而定义明确的任务,但现有终端基准大多聚焦于几分钟内可完成、仅以最终结果评判的简单问题。这种设置忽略了中间进展和部分解决方案,导致稀疏的 reward 信号,无法完整反映 Agent 的能力。来自多家机构的研究者(共同作者包括 Zongxia Li、Zhongzhi Li、Yucheng Shi 等 13 人)提出了 Long-Horizon-Terminal-Bench,一个包含 46 个长时任务的终端基准,覆盖实验复现、软件工程、多模态分析、交互游戏和科学计算等 9 个类别。 每个任务采用 Terminal-Bench 风格的设置(参考解决方案或仿真引擎),并进一步分解为细粒度的分级子任务。这种设计实现了密集的中间奖励和部分得分,不仅能评估 Agent 是否达成最终目标,还能衡量它在开放式工作流中的进展程度。任务通常需要数百个回合、几分钟到几小时的执行时间,考验的是长时规划、长上下文管理和迭代调试能力,而非一次性的问题求解。 研究团队评估了 15 个前沿模型,发现 Agent 平均每个任务消耗 990 万 token,约 231 个...
MedRealMM:真实世界多模态中文在线医疗咨询评测基准
Created2026-07-13|技术动态
事件概述大型语言模型(LLM)在在线医疗咨询场景中的应用日益广泛,但现有的评测基准与真实临床实践之间存在严重脱节:许多基准依赖合成对话或者患者模拟器,忽略了患者上传的医学图像,或者使用多项选择、词汇重叠等指标评估开放式回答,难以反映真实的临床质量。针对这一缺口,研究团队提出了 MedRealMM——一个基于中国全国性互联网医院脱敏医患对话构建的大规模多模态在线医疗咨询基准。数据集包含 5,620 个真实多模态案例,覆盖 64 个临床科室,已在 Hugging Face 上公开。 关键技术点 多模态临床挑战点(MCCP)提取框架MedRealMM 并非简单地将整段对话作为评测数据,而是从真实的咨询轨迹中识别出临床决策压力最大的时刻(即“挑战点”),并将每个时刻转换为标准化的“下一步回复生成任务”,同时保留该时刻之前完整的文本‑图像上下文。 医‑患真实对话与多模态输入数据来源于真实的在线问诊记录(经脱敏处理),患者可以上传图片(如皮肤照片、化验单等),医生在回答时需结合图片与文字信息。这填补了以往基准中“无图像”或“图像与病情无关”的空白。 案例特定评分 rubric每个实例都由...
Neuro-Agentic Control:用 LLM 智能体控制安全控制器的深度学习框架
Created2026-07-13|技术动态
事件/论文概述2026 年 7 月 10 日,一篇题为《Neuro-Agentic Control: A Deep Learning-based LLM-Powered Agentic AI Framework for Controlling Security Controls》的论文提交至 arXiv。该论文由 Saroj Gopali、Bipin Chhetri、Deepika Giri、Sima Siami-Namini 和 Akbar Siami Namin 共同撰写。研究指出,针对操作技术(OT)的网络攻击日益导致高昂的停机时间和物理损坏,传统基于规则的监控在工业物联网环境中已显不足。虽然大型语言模型(LLM)具备强大的语义推理能力,可用于辅助决策,但其幻觉特性在闭环控制中带来不可接受的安全隐患。为此,本文提出了一种神经-智能体控制框架(Neuro-Agentic Control Framework),通过将基于 LLM 的规划器(如 Gemini 2.5 Flash-Lite)与预训练的时间序列基础模型(TimesFM)耦合,实现基于物理规律的自主防御。该框...
德国电信如何用AI重塑电信业:从客服到网络的AI原生转型
Created2026-07-10|技术动态
事件概述2026年7月10日,OpenAI官方发布文章,介绍了全球最大电信运营商之一德国电信(Deutsche Telekom)如何将AI融入核心运营,并设定了成为全球首批“AI原生电信公司”的雄心。该公司服务超过3亿客户,员工超20万人,目前已有超过5万名月活用户使用ChatGPT Enterprise和API工具,AI工具使用率自2026年初增长了546%。这一转型由首席产品与数字官Jonathan Abrahamson主导,强调“不是给现有工作加AI,而是重新设计工作本身”。 关键技术点 员工赋能与自上而下结合:初期通过部署ChatGPT Enterprise鼓励实验,员工迅速接受,形成需求自下而上扩散。 客户服务流程重设计:利用AI处理大量客户交互,减少转接和等待时间,目标是在某些场景下超越传统人工客服。 网络运营实时优化:与多家合作伙伴共同使用AI动态调整移动网络资源,应对早晚高峰、大型活动等流量变化。 语音通信的未来:将AI直接嵌入通话过程,包括实时翻译、智能呼叫助手、通话后摘要等,无需客户安装新应用。使用多种模型(原文未指定具体模型)实现这些功能。 运营模式重设计:...
1…891011
avatar
Yunkai Huang
嗨,这里是云开~
Articles
107
Tags
312
Categories
5
Follow Me
Announcement
This is my Blog
Recent Posts
两项 API 设置让 ARC-AGI-3 分数翻三倍——OpenAI 深度解析2026-07-29
OpenAI 面向学术研究者推出 ChatGPT,加速科学发现2026-07-29
Beyond Memory: LLM Agent 的异构协作知识工作模板2026-07-29
模型无需明确后果也能“伪装对齐”?最新研究揭示AI安全新挑战2026-07-29
GPT-5.6:前沿智能与前沿效率的融合2026-07-29
Categories
  • [技术动态]2
  • 技术动态102
  • 技术探索1
    • 随笔1
  • 随笔1
Tags
Place Recognition UAV Knowledge Management Red-Teaming OpenAI Codex Software Quality Narrative Generation MLP ROI Quantum Computing Time-Series 反思 Deep Learning Social Epistemology Graph Neural Network 形式化验证 Cancer Genomics 媒体技术 经济研究 模拟器 Optimization Robustness 隐私保护 Claude Code Football Teens 大语言模型 Multi-Agent Systems ChatGPT PostgreSQL 扩散模型 Drug Discovery Safety Business Leadership Adversarial Resilience Rust 农业韧性 Debate Interpretability
Archives
  • July 2026 104
  • February 2026 3
Website Info
Article Count :
107
Unique Visitors :
Page Views :
Last Update :
© 2025 - 2026 By Yunkai HuangFramework Hexo 8.1.1|Theme Butterfly 5.5.4