Yunkai's Blog Lab

Yunkai's Blog Lab

人类与AI协作构建贝叶斯网络:一种虚拟调查方法
Created2026-07-19|技术动态
事件概述2026年7月13日,来自印度管理学院柯泽科德分校的研究人员 Kumar Rahul 和 Shovan Chowdhury 在 arXiv 上提交了一篇题为《Human AI Construction of Bayesian Networks for Operational Decision Support – A Virtual Survey Approach》的论文(arXiv:2607.14141)。该论文提出了一种结合大型语言模型(LLM)与多智能体系统构建贝叶斯信念网络(BBN)的新方法论,旨在弥合专家判断与数据驱动学习之间的鸿沟,为不确定条件下的运营决策支持提供新路径。 关键技术点 核心挑战:传统构建贝叶斯网络面临结构定义和参数估计的两大难题,研究者通常只能在“依赖专家经验”与“依赖大规模数据集”之间二选一。 创新方法:论文提出使用一组具有特定角色和上下文的AI智能体(即“虚拟调查”)来替代真实专家,让这些智能体基于LLM生成概率估计值,从而模拟专家调查过程。 噪声处理:采用“截尾均值(trimmed-mean)规则”去除智能体响应中的极端值,提升估计的稳健性...
Capability from Access Structure, Not Scale: Lower Bounds and Pre-Registered Tests for Hybrid Sequence Models
Created2026-07-18|技术动态
事件/论文概述近日,arXiv 上发布了一篇题为《Capability from Access Structure, Not Scale: Lower Bounds and Pre-Registered Tests for Hybrid Sequence Models》的论文(arXiv:2607.14144)。该研究由 Wenhui Chen、Jianlin Chen、Ziyao Lin 和 Chi Man Vong 共同完成,对当前深度学习领域中流行的“表征收敛假设”(Platonic Representation Hypothesis, PRH)提出了续篇与边界——能力收敛假设(Capability Convergence Hypothesis, CCH)。 CCH 的核心论断是:在固定的单 token 推理预算下,表征的收敛并不等价于能力的收敛。模型的能力反而收敛于一个特定的架构类别——访问完备混合模型(access-complete hybrid):即同时拥有一个压缩的 O(1) 状态通道和一个可扩展的逐字索引通道。作者在一项见证任务(Newton’s-app...
DialogueVPR: 对话式视觉地点识别——从静态检索到交互推理的范式转变
Created2026-07-18|技术动态
事件/论文概述2026年7月,arXiv上发布了一篇被CVPR 2026接收的论文 DialogueVPR: Towards Conversational Visual Place Recognition(对话式视觉地点识别)。该研究由Yukun Song等多位作者共同完成,提出了一种全新的对话式地点识别范式,将传统的静态、一次性图像检索任务转变为交互式、对话驱动的推理过程。论文还发布了首个大规模对话式地点识别基准 DlgQuest-Cities,并开源了代码与模型。 关键技术点 范式转变:从静态检索到推理检索现有语言引导的地理定位方法通常采用“一次查询、一次匹配”的方式,无法处理真实世界中自然语言描述的模糊性和不完整性。DialogueVPR将定位任务建模为系统与用户之间的多轮对话,通过主动提问逐步消解歧义,最终确定位置。 统一推理框架框架耦合了两个核心组件: 跨模态多级检索器(Cross-modal Multi-level Retriever):负责根据当前对话历史与视觉特征进行多粒度匹配。 智能提问器 DQ-pilot:根据当前检索状态生成最优问题,引导用户提...
ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability
Created2026-07-18|技术动态
事件/论文/产品概述近日,arXiv上发布了一篇题为《ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability》的论文(arXiv:2607.14145)。该研究由Weiting Liu、Jieyi Bi、Wanqi Zhou、Jianfeng Feng、Yining Ma、Ai Han、Wenlian Lu等作者共同完成,专注于解决工具增强型大语言模型(LLM)Agent在工具集扩展时的核心障碍。论文提出了一个名为ToolAnchor的框架,通过注入反事实锚点上下文(counterfactual anchor contexts)来打破Agent的行为惯性,使其能够有效适应新工具,而无需从头重新训练。 关键技术点 行为惯性(Behavioral Inertia):论文指出,当Agent被提供新的工具时,往往会顽固地沿用旧工具和已有的推理模式,难以利用新工具的优势。这种惯性是工具集扩展问题的根本障碍。 反事实锚点上下文:在关键决策点注入反事实上下文(即如果...
Interpretable Language Model for Closed-Loop Type 1 Diabetes Control
Created2026-07-18|技术动态
事件概述2026年7月18日,arXiv上发布了一篇题为《Interpretable Language Model for Closed-Loop Type 1 Diabetes Control》的论文(arXiv:2607.14126),该文已被2026年IEEE第22届自动化科学与工程国际会议(IEEE CASE 2026)接收。论文提出了一种名为LLM-T1D的新方法,旨在解决1型糖尿病(T1D)闭环胰岛素泵控制中强化学习(RL)系统“黑箱”特性导致的信任问题,通过将RL的精确控制能力与大语言模型(LLM)的人类可理解推理能力相结合,构建更透明、更可靠的胰岛素泵控制器。 关键技术点 双重模型架构:首先训练一个专家级RL系统作为“教师”,然后通过知识蒸馏将其策略和决策知识迁移到两个微调后的8B参数LLM上——LLaMA 3.1 8B和Qwen3 8B。这两个LLM作为“学生”模型,不仅能复现RL的控制策略,还能用自然语言解释每一步行动的理由。 可解释性优先:LLM控制器的核心优势在于输出人类可读的决策说明,比如“因为当前血糖偏高且上升趋势明显,增加基础胰岛素输注速率”。这种...
A scorecard for the AI age
Created2026-07-17|技术动态
AI 时代的记分卡:用“有用智能每美元”衡量投资回报事件概述2026 年 7 月 17 日,OpenAI CFO Sarah Friar 在官方博客发表文章《A scorecard for the AI age》,提出一套面向 CFO 及企业领导者的 AI 投资回报衡量框架。核心观点是:传统软件的成功指标(席位、活跃用户、续约率)已不适用于 AI 时代,企业需要一种更强大的度量——完成的工作量(work accomplished)。文章名为“AI 时代的记分卡”,旨在通过四个维度回答一个基本经济问题:AI 完成的工作价值是否增长快于其成本? 关键技术点该框架的核心是 “Useful Intelligence per Dollar”(每美元有用智能),具体分解为四个度量问题: 1. 完成了多少有用工作? 定义:从具体工作流出发,明确“完成”的标准。例如客服团队是“客户问题已解决”,工程团队是“代码变更通过测试”,法务团队是“合同准确及时审查”。 核心思想:token 只有在转化为人们可用的工作时才创造价值。随着模型能力提升(长上下文、多步推理、工具调用),可以承担更复杂的任务。 实...
HG-RAG: 面向结构化知识图谱的层次引导检索增强生成
Created2026-07-17|技术动态
1. 事件/论文概述近日,arXiv 上公开了一篇题为 HG-RAG: Hierarchy-Guided Retrieval-Augmented Generation for Structured Knowledge Graphs 的论文,作者为 Pranav Yadav。该论文针对现有 RAG(检索增强生成)系统在处理结构化知识时的局限性,提出了一种基于层次知识图谱的图遍历检索框架。实验表明,HG-RAG 在层次、关系和多跳推理任务上显著优于传统的扁平文档检索基线,同时有效降低了幻觉率,并保持了局部事实的连贯性。 2. 关键技术点HG-RAG 的核心创新在于其检索管道设计: 命名实体锚定:首先从用户查询中解析出一个命名实体作为锚点。 多层次图遍历扩展: 向上(父节点):锚定节点后,向上追溯其父级类别或概念节点,获取更上层的上下文。 横向(关系邻居):通过关系边扩展到同层级的邻居节点,捕获关联信息。 向下(子节点):当查询需要更细节的信息时,向下遍历子节点以补充局部细节。 这种结构化的上下文构建方式,使得 LLM 能够同时获得全局层次、局部关系及细节信息,从而更好...
用于搜救任务自主无人机集群的三层智能学习架构
Created2026-07-17|技术动态
论文/产品概述arXiv 近日新上线了一篇题为 《Intelligent Three Level Learning Architecture for Autonomous UAV Swarms in Search and Rescue》 的论文(arXiv:2607.14093),作者 Oleksii Bychkov(原文未说明作者单位)。该论文提出了一种新颖的三层分层学习架构,专门用于执行搜救任务的自主无人机集群。 与现有方法在每个层级使用单一学习范式的做法不同,该架构集成了三种性质不同的学习机制,分别对应生物学的反射、技能和推理层次: 个体适应层(反射):利用 Hebbian 神经可塑性实现单架无人机的快速环境适应。 战术协调层(技能):采用基于图神经网络(GNN)和行为树的多智能体强化学习(MARL)进行编队协同。 战略决策层(推理):通过模型无关元学习(MAML)结合 BDI(信念-愿望-意图)推理和数字孪生进行高层决策。 作者通过 22 个架构契约 形式化了系统组件(BDI、行为树、GNN、MARL、神经可塑性、元学习),这些契约共同提供了 6 类形式化保...
IMEX:基于交互的模型解释方法
Created2026-07-17|技术动态
事件/论文概述2026年4月,arXiv 上发布了一篇题为《IMEX Interaction-Based Model Explanation》的论文,作者 Emiliano Massi 提出了一种新的可解释预测建模方法——IMEX(Interaction-Based Model Explanation)。该方法致力于解决黑盒模型预测缺乏透明性的问题,不仅能够识别对预测贡献最大的变量,还能发现变量之间的高阶交互作用,从而构建预测的“可解释性地图”。 关键技术点 核心问题:在关键领域(如医疗、金融)中,仅靠预测精度不足以验证模型可靠性,必须理解决策背后的原因。 IMEX 框架:基于两个互补指标: 静态相关功率(PCS):量化单个特征对预测的贡献。 交互相关功率(PCI):捕捉特征之间的非加性效应(即交互作用)。 高阶交互:IMEX 不限制交互分析的阶数,可以考查任意多个特征(大于二)的联合影响。 实验验证:本文通过三个已知结构的合成数据集,将 PCS 组件与已有的 INVASE 方法进行对比,结果显示 IMEX 在输入特征与目标之间存在非线性、条件性和多重共线性关系时,...
RegNetAgents:跨网络调控驱动因子识别的多智能体框架
Created2026-07-17|技术动态
事件概述2026年7月17日,arXiv 上发布了一篇题为《RegNetAgents: A Multi-Agent Framework for Cross-Network Regulatory Driver Identification in Cancer Genomics》的论文。作者 Jose A. Bird 提出了一个名为 RegNetAgents 的多智能体框架,专门用于在异构基因调控网络中进行结构化的、查询驱动的调控候选因子识别。该框架整合了 TCGA 来源的肿瘤网络和 GREmLN 项目的大规模单细胞调控网络,能够对批量肿瘤和单细胞衍生的 ARACNe 网络进行统一分析。 关键技术点RegNetAgents 的核心是一个基于 LangGraph 的有向无环图(DAG)工作流,通过统一的 Python API 和 Model Context Protocol(MCP)客户端对外提供服务。该框架不对基因调控网络进行推断,而是作为预计算调控网络的下游分析层运行。 对于一个给定的焦点基因,该框架的执行流程包括: 双网络分类:同时在 TCGA 网络和 GREmLN 单细胞网络...
1…678…12
avatar
Yunkai Huang
嗨,这里是云开~
Articles
112
Tags
322
Categories
5
Follow Me
Announcement
This is my Blog
Recent Posts
Advancing the price-performance frontier with GPT-5.62026-07-30
CaRE:为掩码扩散语言模型引入计算感知重掩码评估协议2026-07-30
Crystalis: 渐进成核与语义退火——LLM驱动的协调多视图可视化生成2026-07-30
GrocLM: Grocery Category Recommendation in E-Commerce with Large Language Models2026-07-30
Kernel Forge:基于LLM的CUDA Kernel自动生成与优化Agent框架2026-07-30
Categories
  • [技术动态]2
  • 技术动态107
  • 技术探索1
    • 随笔1
  • 随笔1
Tags
Swift Stochastic Sampling 技术会议 Zstandard AI治理 Market Making 多模态 GTAP 预注册实验 政策 Tactile Sensing Continual Learning 参数化设计 Block-Based Programming Data Provenance Teens Model Distillation D语言 Forth Healthcare Foundation Models 信息论 Clinical Trials Uncertainty Estimation 存储引擎 数据隐私 制造 上下文压缩 Argumentation Adversarial Robustness Edge AI 基础设施 Browser Extension DeFi 软件工程 Butterfly PostgreSQL 数据科学 经济模型 CAD
Archives
  • July 2026 109
  • February 2026 3
Website Info
Article Count :
112
Unique Visitors :
Page Views :
Last Update :
© 2025 - 2026 By Yunkai HuangFramework Hexo 8.1.1|Theme Butterfly 5.5.4