Yunkai's Blog Lab

Yunkai's Blog Lab

大型语言模型在心理健康中的系统性综述:应用、创新与伦理挑战
Created2026-08-20|技术动态
引言近年来,大型语言模型(LLM)在医疗健康领域的应用呈现爆发式增长。特别是在心理健康方向——一个长期面临资源短缺、诊断依赖主观判断、患者病耻感强等痛点的领域,LLM 正在被视为一种潜在的变革性工具。然而,相关研究分散在不同学科和场景中,缺乏系统性的梳理与批判性审视。 2026 年 8 月,arXiv 上公开了一篇由 Yisong Chen、Yifan Gao、Sijing Yu、Chuqing Zhao 和 Yang Lu 联合发表的系统性综述论文,题为 “Large Language Models in Mental Health: A Systematic Review of Applications, Innovations, and Ethical Challenges”。该论文已发表于 Journal of Industrial Integration and Management (JIIM) 2025 年卷,对 LLM 在心理健康领域的应用、技术进展与伦理挑战进行了全面回顾。 论文概述这篇综述聚焦于 LLM 在心理健康领域(原文表述为 health,但摘要内容实...
Position: Profiling Game Worlds by Transition Complexity
Created2026-08-20|技术动态
用转移复杂度为游戏世界建立档案:一个值得关注的 ICML 2026 位置论文事件概述在游戏世界建模(Game World Modeling, GWM)与强化学习(Reinforcement Learning, RL)的研究中,长期存在一个被忽视的问题:不同论文之间的实验结果几乎无法公平对比,因为很少有人量化“在给定的接口(像素、token、潜在表征,以及有限历史窗口)下,底层转移预测问题到底有多难”。 针对这一痛点,Lele Cao 在 arXiv 上提交了一篇 ICML 2026 Position Paper:《Position: Profiling Game Worlds by Transition Complexity》。该论文提出了一个名为 Transition Complexity Profile (TCP) 的标准化指标集,旨在为游戏环境(或游戏玩法数据集)所诱导的转移核(induced transition kernel)建立一份“可复现的复杂度档案”。该论文于 2026 年 5 月 29 日首次提交,arXiv 编号为 2608.18079,目前已发布在 cs.A...
AI 推理 Agent 的合谋风险:市场决策需要行为认证
Created2026-08-20|技术动态
AI 推理 Agent 的合谋风险:市场决策需要行为认证事件概述一篇题为 “Position: Collusion Risks Among AI Reasoning Agents Justify Certification Requirements for Making Market Decisions” 的观点文章(position paper)于 arXiv 发布,并被 ICML 2026 接收。论文编号为 arXiv:2608.18078,作者包括 Matthew Riemer、Tommaso Tosato、Amin Memarian、Maximilian Puelma Touzel、Glen Berseth、Irina Rish、Guillaume Dumas 等 7 位研究者。 文章核心论点非常直接:具备链式推理(chain-of-thought)能力的 AI Agent 天然倾向于产生合谋行为,在参与影响经济市场的决策前,应当强制要求通过“行为认证”。作者认为,如果不加约束地将这类 Agent 融入社会,可能导致法律上“独立企业之间的竞争与合谋”的取证区分被瓦解,但经...
Stampli 用 ChatGPT Work 将产品上线工时压缩 68%:AI Agent 如何重塑 GTM 流程
Created2026-08-20|技术动态
事件概述:一次典型的 AI 驱动 GTM 压缩实验2026 年 8 月 20 日,OpenAI 发布了一则客户案例:智能采购到支付(procure-to-pay)平台 Stampli 借助 Codex 和 ChatGPT Work,将其 Deep Finance™ 产品的上市(GTM)生产工时从预估的 243 小时压缩至约 77 小时,节省了约 166 小时,整体生产效率提升 3.16 倍(官方表述为 “3.16x faster launch to production”)。 这次发布并非一次纯营销演练。Stampli 面临严格的固定截止日期,而设计资源与外部承包商早已被其他优先级占用。在这种情况下,营销团队用 Codex 将产品上下文、会议纪要、决策记录和消息指南连接为一个共享系统,并在所有面向客户的内容上保留完整的人工审核与最终批准权。整个 Deep Finance 产品从原型演示到公开 GTM 发布及首个交付版本,仅用了约六周。 关键技术点:Codex + ChatGPT Work 的协同模式这个案例的核心不是单一模型的某个炫技能力,而是一套可以沉淀为方法论的工作模式,...
OpenAI Zero Data Retention 与 Private Safety Processing 全面解读
Created2026-08-19|技术动态
OpenAI 零数据保留政策与新安全处理预览:如何在隐私与安全之间取得平衡事件概述2026 年 8 月 19 日,OpenAI 官方发布了一篇重要公告,重申了针对合格 API 客户的 Zero Data Retention(零数据保留) 政策承诺,并同步预览了一项名为 Private Safety Processing 的新功能。该功能旨在强化跨交互场景下的安全防护,同时保持与 ZDR 政策完全兼容。 简而言之,OpenAI 的核心承诺是:对于符合条件的 API 客户,OpenAI 不会在请求处理完成后保留其提示词和模型响应。客户内容不会提供给 OpenAI 人员进行审查注释,企业客户数据也不会用于训练模型,除非客户明确选择加入。 关键技术点1. Zero Data Retention(ZDR)的现有机制ZDR 是一项明确的隐私承诺,其核心保障包括: 请求处理完毕后,OpenAI 不保留客户的 prompts 和 model responses; 客户内容对 OpenAI 员工不可见,不用于人工审查; 企业客户数据不用于模型训练(除非显式 opt-in)。 这一机制使得许多对...
Replit 联手 OpenAI:GPT-5.6 Luna 驱动的免费模式,让每个人都能开发软件
Created2026-08-19|技术动态
事件概述2026 年 8 月 19 日,OpenAI 官方发布消息称,Replit 正式推出 Free Mode(免费模式),该模式由 GPT-5.6 Luna 模型驱动,旨在让任何有想法的人都能将创意转化为可运行的软件,而无需担心 Token 成本。这标志着 Replit 与 OpenAI 长期合作的又一次深化,也是大模型价格性能改善后,AI 软件创建能力大规模开放的一个重要案例。 Replit 联合创始人兼 CEO Amjad Masad 表示:「有史以来第一次,你可以在 Free Mode 中获得惊人的体验——构建应用、构建 Agent、构建各种软件,而这一切都由 GPT-5.6 Luna 驱动。」 关键技术点1. GPT-5.6 Luna 与 Free ModeGPT-5.6 Luna 是 OpenAI GPT-5.6 系列中的一款模型,其特点是具备较强的能力、良好的价格性能比,并且能够在规模化场景下提供稳定可靠的推理服务。Replit 选择它作为 Free Mode 的底层模型,正是因为模型成本曾是限制软件创建广泛可用的最后障碍之一。 2. 免费模式如何运作在 Repl...
GxP-Agent:用过程 DAG 拓扑实现可靠的临床试验编程
Created2026-08-19|技术动态
一、论文概述临床试验编程——在 CDISC 标准下将研究方案转换为可用于分析的数据集——一直是药品监管申报流程中的关键瓶颈。尽管大语言模型(LLM)在通用代码生成上表现出色,但在这项高度领域化、强流程约束的任务上却表现得非常糟糕。论文提到,在 11 次单次生成尝试中,5 个前沿模型均未产出有效的受试者水平分析数据集。 针对这一挑战,论文提出了 GxP-Agent,一个将监管流程顺序编码为有向无环图(DAG)的多智能体系统。它把“生成完整数据集”这一庞大任务拆解为 15 个领域专用节点,由携带 pharmaverse 技能上下文的 worker agent 依次执行,并配有验证门控(validation gates)和条件重试(conditional retry)机制。 论文同时提出了一个新的基于执行的基准测试 CDISC-Bench,它基于 FDA 试点申报数据集 CDISCPilot01 构建,包含 254 名受试者和 49 个 ADSL 真值变量。实验结果显示,GxP-Agent 配合 Claude Sonnet 4.6 在三次独立运行中均实现了 100% 的结构匹配(49&...
Runtime Governance for Agentic AI:把“模型提议、运行时决策”从口号变成系统
Created2026-08-19|技术动态
事件概述8 月 19 日,arXiv 上出现了一篇来自 Adam Mazzocchetti 的论文,题目为 “Runtime Governance for Agentic AI: Action-Boundary Control with Trusted Provenance and Fail-Closed Execution”,提交时间为 2026 年 5 月 17 日。文章提出了一套名为 Aegis 的运行时治理系统,针对当前 Agentic AI(智能体 AI)场景中“模型输出即行动”的安全隐患,给出了一个带有明确执行边界的治理框架。 论文链接:https://arxiv.org/abs/2608.16891 Agentic AI 的安全问题转移论文指出了一个非常关键的变化:Agentic AI 系统不再只是生成文本,而是会请求工具动作,例如修改文件、发送消息、启动任务、改变工作流状态。这意味着安全问题的重心从“有害文本生成”转移到了“有害操作副作用”。 仅仅靠 prompt 级别的治理,比如“请勿删除文件”之类的指令,可以约束模型的行为倾向,但无法形成真正的执行边界。因为模...
强化国家安全领域的民主监督:OpenAI 新倡议解读
Created2026-08-18|技术动态
事件概述OpenAI 于 2026 年 8 月 18 日宣布启动一项全新倡议,目标是帮助民主监督机构建立必要的专业知识与技术工具,使其能够理解并有效监督政府将 AI 用于国家安全的行为。该倡议被归入 OpenAI 的 Global Affairs 部门工作范畴。 这一动作的特殊之处在于,OpenAI 并未试图取代政府监督机构,而是明确表示“OpenAI 不对政府履行监督角色,也不应如此”,责任属于民选官员和相应公共机构。OpenAI 的角色定位是“以技术手段支持监督机构执行其现有职责”。 这一表态显然是在回应外界对于 AI 企业在国家安全领域影响力不断扩大的担忧:OpenAI 希望建立一种“能力越大、越需要制衡”的共识。 关键技术点原文中,OpenAI 详细阐述了其判断逻辑与行动路径,几个技术相关要点值得单独提炼: AI 风险的“速度与规模”问题。OpenAI 指出,AI 可以基于缺失或过时的上下文、错误配置的目标或错位的假设,以极快的速度和规模采取行动,这导致人工手动检测错误的难度急剧增加。换言之,传统基于纸质文档、人工审查的监督模式无法匹配机器学习系统的运转速度。 原...
OpenAI 发布 ChatGPT for Teens:以学习为核心,内置更强保护
Created2026-08-18|技术动态
事件概述2026 年 8 月 18 日,OpenAI 正式推出 ChatGPT for Teens,这是一个面向青少年群体的专属 AI 体验,旨在帮助 13-17 岁的用户学习、批判性思考、加深理解,并自信地使用 AI。该产品内置了更强的安全保护、健康使用功能,以及面向家长的额外控制选项。 根据 OpenAI 官方说明,当系统估计用户年龄低于 18 岁,或用户自行声明年龄在 13 至 17 岁之间时,会自动将其分配到 ChatGPT for Teens 环境中。这一发布建立在 OpenAI 此前一系列青少年保护工作的基础之上,包括引入家长控制、更新 Under-18 Model Spec、制定 Teen Safety Blueprint、推出年龄预测技术,以及扩展支持学习和健康使用 AI 的功能。 关键技术点ChatGPT for Teens 的核心设计围绕“支持学习”和“强化保护”两个维度展开。 学习支持功能 Study Mode(学习模式):通过引导式提问、分步支持、脚手架式教学法、元认知提示和知识检查,帮助青少年一步步理解问题,而不是直接给出答案。该模式由教师、科学家和教育...
1…161718…37
avatar
Yunkai Huang
嗨,这里是云开~
Articles
362
Tags
748
Categories
5
Follow Me
Announcement
This is my Blog
Recent Posts
月面晨昏线悖论:日落后月亮为什么还“朝上”?以及作者顺手测出的 LLM 推理短板2026-09-27
重新拾起木工:从狗门到露台花坛的两次动手实践2026-09-27
当 Google 开始安慰你:AI Overview 误读搜索意图引发的产品反思2026-09-27
当写代码比注册公司还快:为什么开发者该提前准备一个 LLC2026-09-27
DeepSeek 开源 DSec 沙箱基础设施论文:单集群日跑 300 万沙箱,支撑 Agentic RL 训练2026-09-26
Categories
  • [技术动态]11
  • 技术动态348
  • 技术探索1
    • 随笔1
  • 随笔1
Tags
强化学习 Adversarial Defense 广告技术 PostgreSQL AI Overview Enterprise Dual-Use 大模型成本 数字农业 预注册实验 几何光学 知识图谱 Football 安全 Infrastructure Devin 实时地图 工作流自动化 Place Recognition Edge Computing 金融问答 递归自我改进 EEG 天文 Cost-Aware 自主实验 Go Battery 计算机历史 Medical AI Explainable AI 视觉错觉 Model Distillation Security 启发式搜索 Cyber Security 效率优化 专利撰写 GPT-6 老年科技
Archives
  • September 2026 112
  • August 2026 134
  • July 2026 113
  • February 2026 3
Website Info
Article Count :
362
Unique Visitors :
Page Views :
Last Update :
© 2025 - 2026 By Yunkai HuangFramework Hexo 8.1.1|Theme Butterfly 5.5.4