Yunkai's Blog Lab

Yunkai's Blog Lab

GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning
Created2026-07-13|技术动态
事件/论文概述2026年7月,arXiv 上发布了一篇题为《GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning》的论文,作者为 Maureese Williams 和 Dymitr Nowicki。该论文提出了一种名为 GATS(Graph-Augmented Tree Search)的新型规划框架,旨在解决现有 LLM Agent 规划方法(如 LATS、ReAct)在推理时严重依赖 LLM 推理、计算成本高昂且行为随机的问题。GATS 通过结合基于 UCB1 的系统化树搜索与分层世界模型,在规划阶段完全消除 LLM 调用,同时取得了优异的规划性能。 关键技术点GATS 的核心创新在于其三层世界模型与图增强树搜索的结合: 三层世界模型(Layered World Model): L1(精确符号动作匹配):对于已知环境中的确定性动作,直接通过符号匹配预测结果,无需任何模型调用。 L2(执行日志统计):基于历史执行日志学习动作的成功概率和转移分...
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
Created2026-07-13|技术动态
论文概述当前 AI Agent 能够自主完成短而定义明确的任务,但现有终端基准大多聚焦于几分钟内可完成、仅以最终结果评判的简单问题。这种设置忽略了中间进展和部分解决方案,导致稀疏的 reward 信号,无法完整反映 Agent 的能力。来自多家机构的研究者(共同作者包括 Zongxia Li、Zhongzhi Li、Yucheng Shi 等 13 人)提出了 Long-Horizon-Terminal-Bench,一个包含 46 个长时任务的终端基准,覆盖实验复现、软件工程、多模态分析、交互游戏和科学计算等 9 个类别。 每个任务采用 Terminal-Bench 风格的设置(参考解决方案或仿真引擎),并进一步分解为细粒度的分级子任务。这种设计实现了密集的中间奖励和部分得分,不仅能评估 Agent 是否达成最终目标,还能衡量它在开放式工作流中的进展程度。任务通常需要数百个回合、几分钟到几小时的执行时间,考验的是长时规划、长上下文管理和迭代调试能力,而非一次性的问题求解。 研究团队评估了 15 个前沿模型,发现 Agent 平均每个任务消耗 990 万 token,约 231 个...
Neuro-Agentic Control:用 LLM 智能体控制安全控制器的深度学习框架
Created2026-07-13|技术动态
事件/论文概述2026 年 7 月 10 日,一篇题为《Neuro-Agentic Control: A Deep Learning-based LLM-Powered Agentic AI Framework for Controlling Security Controls》的论文提交至 arXiv。该论文由 Saroj Gopali、Bipin Chhetri、Deepika Giri、Sima Siami-Namini 和 Akbar Siami Namin 共同撰写。研究指出,针对操作技术(OT)的网络攻击日益导致高昂的停机时间和物理损坏,传统基于规则的监控在工业物联网环境中已显不足。虽然大型语言模型(LLM)具备强大的语义推理能力,可用于辅助决策,但其幻觉特性在闭环控制中带来不可接受的安全隐患。为此,本文提出了一种神经-智能体控制框架(Neuro-Agentic Control Framework),通过将基于 LLM 的规划器(如 Gemini 2.5 Flash-Lite)与预训练的时间序列基础模型(TimesFM)耦合,实现基于物理规律的自主防御。该框...
MedRealMM:真实世界多模态中文在线医疗咨询评测基准
Created2026-07-13|技术动态
事件概述大型语言模型(LLM)在在线医疗咨询场景中的应用日益广泛,但现有的评测基准与真实临床实践之间存在严重脱节:许多基准依赖合成对话或者患者模拟器,忽略了患者上传的医学图像,或者使用多项选择、词汇重叠等指标评估开放式回答,难以反映真实的临床质量。针对这一缺口,研究团队提出了 MedRealMM——一个基于中国全国性互联网医院脱敏医患对话构建的大规模多模态在线医疗咨询基准。数据集包含 5,620 个真实多模态案例,覆盖 64 个临床科室,已在 Hugging Face 上公开。 关键技术点 多模态临床挑战点(MCCP)提取框架MedRealMM 并非简单地将整段对话作为评测数据,而是从真实的咨询轨迹中识别出临床决策压力最大的时刻(即“挑战点”),并将每个时刻转换为标准化的“下一步回复生成任务”,同时保留该时刻之前完整的文本‑图像上下文。 医‑患真实对话与多模态输入数据来源于真实的在线问诊记录(经脱敏处理),患者可以上传图片(如皮肤照片、化验单等),医生在回答时需结合图片与文字信息。这填补了以往基准中“无图像”或“图像与病情无关”的空白。 案例特定评分 rubric每个实例都由...
德国电信如何用AI重塑电信业:从客服到网络的AI原生转型
Created2026-07-10|技术动态
事件概述2026年7月10日,OpenAI官方发布文章,介绍了全球最大电信运营商之一德国电信(Deutsche Telekom)如何将AI融入核心运营,并设定了成为全球首批“AI原生电信公司”的雄心。该公司服务超过3亿客户,员工超20万人,目前已有超过5万名月活用户使用ChatGPT Enterprise和API工具,AI工具使用率自2026年初增长了546%。这一转型由首席产品与数字官Jonathan Abrahamson主导,强调“不是给现有工作加AI,而是重新设计工作本身”。 关键技术点 员工赋能与自上而下结合:初期通过部署ChatGPT Enterprise鼓励实验,员工迅速接受,形成需求自下而上扩散。 客户服务流程重设计:利用AI处理大量客户交互,减少转接和等待时间,目标是在某些场景下超越传统人工客服。 网络运营实时优化:与多家合作伙伴共同使用AI动态调整移动网络资源,应对早晚高峰、大型活动等流量变化。 语音通信的未来:将AI直接嵌入通话过程,包括实时翻译、智能呼叫助手、通话后摘要等,无需客户安装新应用。使用多种模型(原文未指定具体模型)实现这些功能。 运营模式重设计:...
对抗性社会认识论:人类与大型语言模型集群的新视角
Created2026-07-10|技术动态
事件/论文概述2026年7月8日,Mihnea C. Moldoveanu与Joel A.C. Baum在arXiv上提交了一篇题为《Adversarial Social Epistemology for Assemblies of Humans and Large Language Models》的论文。该论文针对人类与大型语言模型(LLM)密集交互的沟通景观,提出了一套“对抗性社会认识论”(Adversarial Social Epistemology, ASE)框架。研究指出,在这种景观中,公开的断言往往被证言链、推理、制度认证和隐性信任所支撑,而智能体(包括人类和LLM)有能力通过扭曲、修饰、省略、捏造或策略性模糊信息来获取私人、声誉、修辞或物质利益。论文认为,现有描述(如信息茧房、回音室或虚假信息扩散)不足以捕捉这些现象,需要新的概念工具来解释通信智能体如何利用本应使断言可信的承诺和授权(commitments and entitlements)来颠覆信任。 关键技术点 Scaffolded Assertions(支架式断言):公共断言并非孤立形成,而是依赖多...
对齐临床需求与AI能力:关于大语言模型医学推理的综述
Created2026-07-10|技术动态
事件/论文概述2026年7月10日,arXiv上发布了一篇题为《Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning》的综述论文。该论文由Qi Peng等13位作者共同完成,已被Machine Intelligence Research接收。论文系统总结了近年来大语言模型(LLM)在医学推理领域的研究进展,提出了一种连接临床实践与计算方法的双重视角框架,并引入了一个跨越五个医学推理层级的基准数据集,对18个前沿模型进行了评测。 关键技术点 临床能力五级方案:遵循Miller金字塔模型,将临床推理能力从低到高分为五个层次——知识回忆、信息解释、决策制定、动态病例管理(原文未详细说明第五级具体名称,但摘要提到“dynamic case management”)。该方案旨在匹配医生从基础记忆到复杂临床任务的不同阶段。 计算推理模式映射:将演绎推理、归纳推理和溯因推理三种逻辑模式,分别对应到常见的医学目标与任务。例如,诊断过程可能依赖溯因推理来从症状推断病因,而治...
AI集成模型评估农业韧性:当经济模型遇见生物物理模拟
Created2026-07-10|技术动态
事件/论文概述2026年7月,arXiv上发布了一篇题为《AI-integrated models for assessing agricultural resilience》的研究论文。该论文由Joshua R. Waite等11位来自多学科的作者合作完成,提出了一种AI驱动的工具,用于评估农业供应链在面对生物物理与经济系统联动冲击时的韧性。传统上,农业供应链分析往往局限于单一学科视角,而该工作首次在工具层面将全球贸易分析项目(GTAP)经济模型与农业生产系统模拟器(APSIM)生物物理模型相集成,并通过自然语言查询接口,使政策制定者和市场参与者能够快速评估跨领域冲击的影响。 关键技术点 模型集成架构:核心创新在于将宏观尺度的经济模型(GTAP)与微观尺度的作物生长/生物物理模型(APSIM)统一到一个分析框架中。GTAP通常用于模拟全球贸易政策变化对经济流的影响,APSIM则精细化模拟土壤、气候、作物生理等过程对产量的影响。两者的耦合使得用户可以从“极端天气→作物减产→贸易流动变化→价格波动”的完整链条上评估冲击。 AI作为自然语言接口:论文明确提到工具...
Context Graphs for Proactive Enterprise Agents
Created2026-07-10|技术动态
事件/论文/产品概述2026年7月10日,arXiv 上发布了一篇题为 《Context Graphs for Proactive Enterprise Agents》 的论文,作者为 Avinash Kumar。该论文直指当前企业级 AI 代理(Agent)的深层局限:尽管 RAG 和 Agent 框架已大幅提升企业 AI 能力,但所有系统本质上仍是被动的——它们必须等待人类发起查询才能执行任务。作者认为,真正的企业生产力提升需要 主动式代理:能够在员工尚未提问之前就将相关的、可操作的信息推送到他们面前。为此,论文提出了 Context Graph(上下文图) 这一核心架构,并围绕它设计了完整的端到端系统,利用 NetworkX 和 Anthropic Claude API 进行了实际实现与评估。 关键技术点 Context Graph(上下文图):一个实时的关系型数据结构,建模企业中的实体(如合同、事故、销售线索)、它们之间的关联以及随时间变化的状态转移。这是整个系统的数据底座。 Delta Detection Engine(增量检测引擎):持续监控 Co...
CSTutorBench:评估小语言模型在积木式编程中的辅导能力
Created2026-07-08|技术动态
论文/产品概述arXiv 于 2026 年 7 月 6 日提交的论文《CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming》关注小语言模型(SLM)在 K-12 教育场景中作为 AI 导师的应用。随着大语言模型(LLM)在隐私、成本和 proprietary 模型依赖方面的顾虑日益凸显,SLM 成为有吸引力的替代方案。然而,针对特定教育场景(如积木式编程)的模型选择缺乏系统评估工具。为此,作者提出了 CSTutorBench——一个专门用于评估语言模型在 VEX VR 积木式机器人环境中作为计算机科学导师能力的基准。 关键技术点 基准构成:包含 17 个场景化问题,评分基于一个融合了成熟教学与反馈研究的教育学评分表。 评估流程:采用“人在回路中 + LLM 作为评委”的流水线,确保评估的可靠性。 初步发现:在 11 个模型(参数量 4B-120B)上的实验表明: 模型在词汇、语气等表层标准上表现良好。 但在深层教学行为上明显不足,尤其是避免泄露答案、处...
1…34353637
avatar
Yunkai Huang
嗨,这里是云开~
Articles
362
Tags
748
Categories
5
Follow Me
Announcement
This is my Blog
Recent Posts
月面晨昏线悖论:日落后月亮为什么还“朝上”?以及作者顺手测出的 LLM 推理短板2026-09-27
重新拾起木工:从狗门到露台花坛的两次动手实践2026-09-27
当 Google 开始安慰你:AI Overview 误读搜索意图引发的产品反思2026-09-27
当写代码比注册公司还快:为什么开发者该提前准备一个 LLC2026-09-27
DeepSeek 开源 DSec 沙箱基础设施论文:单集群日跑 300 万沙箱,支撑 Agentic RL 训练2026-09-26
Categories
  • [技术动态]11
  • 技术动态348
  • 技术探索1
    • 随笔1
  • 随笔1
Tags
强化学习 Adversarial Defense 广告技术 PostgreSQL AI Overview Enterprise Dual-Use 大模型成本 数字农业 预注册实验 几何光学 知识图谱 Football 安全 Infrastructure Devin 实时地图 工作流自动化 Place Recognition Edge Computing 金融问答 递归自我改进 EEG 天文 Cost-Aware 自主实验 Go Battery 计算机历史 Medical AI Explainable AI 视觉错觉 Model Distillation Security 启发式搜索 Cyber Security 效率优化 专利撰写 GPT-6 老年科技
Archives
  • September 2026 112
  • August 2026 134
  • July 2026 113
  • February 2026 3
Website Info
Article Count :
362
Unique Visitors :
Page Views :
Last Update :
© 2025 - 2026 By Yunkai HuangFramework Hexo 8.1.1|Theme Butterfly 5.5.4