Clinical Failure Rates over the Decades: Yikes
事件概述近日,一篇发表于《科学》杂志博客的文章《Clinical Failure Rates over the Decades: Yikes》引发了广泛关注(原链接见文末)。文章回顾了过去几十年间临床试验的失败率变化趋势,并用“Yikes”一词表达了令人震惊的现状。尽管原文未给出具体失败率数字或阶段性图表,但其标题直接揭示了一个令人担忧的事实:尽管药物研发投入不断增加,临床阶段的失败率并未显著下降,甚至在某些适应症领域有所恶化。该文章在 Hacker News 上获得超过 10 个积分和 6 条讨论,折射出科技与医疗交叉领域从业者的高度关切。 关键技术点由于原文尚未披露详细的技术分析,以下关键点基于行业背景与作者推断,而非原文直接内容(原文未说明具体技术细节): 历史趋势:临床失败率在近几十年中整体保持高位,尤其在新靶点、罕见病和肿瘤学领域,II 期和 III 期试验失败率尤为突出。 主要失败原因:常见原因包括缺乏有效性(约 50%-60%)、安全性问题(约 30%)以及商业策略调整。原文可能涉及这些因素的长期变化。 可重复性危机:基础研究与临床转化的脱节被认为是失败率居高不下...
当AI读懂最高法院:六十年判决中的“策略性让步”量化研究
事件概述近年来美国最高法院的判决愈发尖锐,大法官们公开指责对方改写法规、无视先例、以政策偏好替代法律。但在这些公开冲突背后,马萨诸塞大学阿默斯特分校的政治科学家通过分析1946年至2011年间最高法院近9000份分歧判决,发现大法官在撰写异议或协同意见书时,常常会承认多数意见的某些论点。这种“让步”并非简单的同僚礼貌,而是一种策略性的说服行为,旨在维持影响力并保存未来的合作空间。相关研究发表于 American Politics Research。 关键技术点研究团队提出并量化了一个全新指标——“安抚度”(appeasement),即大法官在最终不同意多数意见结论的同时,对其中某些方面表示同意的程度。 训练数据:基于1946-2011年最高法院所有出现分歧的判决意见书(约9000份)。 模型方法:使用法律领域的人工智能模型(具体模型名称原文未说明)进行文本分析。该模型需要能够识别“同意”与“不同意”交织的细微语言模式。 测量对象:不再是传统的情感极性(正面/负面),而是语言随时间变化的策略性调整。例如,某大法官在不同年份判决中用词从强硬转向温和,或从全面否定变为部分承...
AI对就业的真实影响:区分炒作与现实
事件概述斯坦福经济政策研究所(SIEPR)发布了一份政策简报,标题为《What is really happening to jobs? Separating AI hype from reality》。该简报系统梳理了当前关于AI对劳动力市场影响的实证研究,试图平衡媒体和AI领袖(如Anthropic CEO Dario Amodei)所宣称的“AI就业末日”论调。简报基于多项学术研究与数据,给出了五个“典型事实”(stylized facts),核心结论是:AI对总体就业的冲击目前很小,但确实对部分群体(如应届毕业生)造成压力,且生产力影响总体积极。 关键技术点1. 总体就业影响有限 目前AI并未导致明显的失业潮。最易受AI冲击的行业失业率上升幅度(0.77个百分点)甚至略低于最不易受冲击的行业(0.85个百分点),说明整体劳动力市场在软化和AI无直接关联。 高AI暴露岗位的就业趋势保持稳定,代码密集型岗位的就业增长只是放缓而非下降。 采用企业AI的公司实际上在两年后就业增长10%(主要由高AI投入企业驱动)。 2. 应届毕业生市场可能受AI影响 2026年初新毕业生失业率...
Kimi K3 在浏览器中构建了 Windows XP 模拟器
事件概述2026年7月25日,一个名为 Kimi K3 的项目在 Hacker News 上引起关注——它成功在浏览器中运行了一个完整的 Windows XP 怀旧模拟器。该模拟器通过浏览器访问 https://windows-xp.kimi.site/ 即可体验,界面高度还原了 2005 年版 Windows XP 的开始菜单、桌面、任务栏以及“注销”、“关闭计算机”等经典交互。当前版本标注为“v11 · 07-15”,并提供了“Administrator”用户快捷登录选项,整体营造出“怀念 2005 年的互联网”的怀旧氛围。 来源:Hacker News Front Page(Points: 35, Comments: 18) 关键技术点原文未详细说明 Kimi K3 的技术实现细节,但基于行业常识,此类浏览器内模拟操作系统通常依赖以下技术: WebAssembly / Emscripten:将 C/C++ 编写的 x86 模拟器(如 QEMU、Bochs)编译为 WebAssembly,在浏览器中以接近原生的速度执行指令。 V86.js 或类似库:一个...
GM支持钠离子电池用于美国电网储能
事件概述2026年7月,通用汽车(General Motors)宣布大力支持美国初创公司 Peak Energy 的钠离子电池技术,用于电网储能。此前,美国多家钠离子电池初创企业(如 Natron Energy、Bedrock Materials)因资金耗尽而倒闭,中国宁德时代(CATL)则凭借一笔60 GWh的巨额订单主导了该领域。Peak Energy 计划在加州萨克拉门托附近建设一座投资7100万美元、年产4 GWh的钠离子电池工厂,并与GM合作推进规模化部署。这一动向标志着美国在钠离子电池赛道上的新一轮冲刺,也反映了汽车巨头向储能领域延伸的战略意图。 关键技术点 钠离子 vs. 磷酸铁锂(LFP):Peak Energy的钠离子电池无法在单体能量密度上与LFP竞争,但通过被动冷却系统降低全生命周期成本。其GS1.1储能系统可运行20年、约20,000次循环后仍保持80%容量,而LFP的基准是8,000次循环后保持70%容量。 温度耐受优势:钠离子电池可在约两倍于LFP最佳工作温度(约25°C)的环境下安全运行,从而无需复杂的液冷系统或风扇、泵等运动部件。被动冷却方案特别适...
AINTMA:面向自主测试管理的智能体AI架构,集成生成式智能、安全云通信与自适应质量分析
事件/论文概述2026年7月,arXiv上发布了一篇题为《AINTMA: Agentic AI Architecture for Autonomous Test Management with Generative Intelligence, Secure Cloud Communication and Adaptive Quality Analytics》的论文。该论文由Vinil Pasupuleti、Shyalendar Reddy Allala等五位作者共同完成,提出了AINTMA(Agentic Intelligent Test Management Architecture)——一个多智能体AI系统,旨在将传统测试管理转变为自主质量智能生态。AINTMA部署了六个专用AI智能体(测试发现、风险评估、强化学习优先级排序、执行编排、生成式质量智能和云安全监控),通过安全的通信框架在云原生微服务基础设施上协调运作。经12个异构软件项目、18个月的评估,AINTMA在测试优先级排序准确率、测试周期缩短、缺陷逃逸率等方面均取得了显著效果。 关键技术点 六种专用AI智能...
Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts
事件概述arXiv 近期发布了一项来自 ETH Zurich 团队的研究(第一作者 Melanie Rieff),首次系统性地评估了大型语言模型(LLM)水印技术在医学文本场景中的影响。该论文指出,尽管水印技术被广泛视为保障模型输出可追溯性的关键手段,但绝大部分现有评测基于通用基准,忽略了医学等高风险领域——在这些领域中,微小的 token 级扰动就可能导致严重的语义变化。研究团队在 11 个 LLM 和 7 个视觉语言模型(VLM)上,对 5 种主流水印方案进行了跨单模态和多模态临床推理任务的严格基准测试。 关键技术点 全面的模型与水印方案覆盖:实验包含 11 个纯文本 LLM 和 7 个 VLM,覆盖了从 GPT 系列到开源模型(原文未具体列出模型名称)。水印方案涉及 5 种常见方法(原文未列举具体方案名称)。 人类专家验证的审计管线:为了弥补现有自动评估指标的不足,作者构建了一条经过人类专家验证的流水线,系统审计三个维度: 医学推理质量(reasoning quality) 术语精确性(terminological precision) 诱发的幻觉(hallucinat...
ClickGuard:用信息度量和大型语言模型检测并破解点击诱饵新闻
论文/产品概述近日,arXiv 上发布了一篇题为《ClickGuard: Detecting and Spoiling Clickbait News with Informativeness Measures and Large Language Models》的论文。该论文提出了一款 AI 驱动的浏览器扩展,旨在帮助用户识别并避开互联网上的误导性点击诱饵文章。ClickGuard 不仅能够检测点击诱饵,还能在用户访问前后提供警告,并在打开文章后给出一个百分比评分,指示其为点击诱饵的可能性。此外,该扩展还能生成一句至两句的“剧透”摘要,直接揭示文章的核心内容,从而消除点击诱饵的吸引力。 关键技术点ClickGuard 采用了一种混合机器学习架构,核心关键技术包括: 混合特征工程:结合了基于 transformer 的嵌入(embedding)与语言学动机特征,并引入了一个自定义的“baitness”分数。语言学特征可能涵盖标题长度、感叹号数量、第一人称代词、情感极性等传统指标。 模型选型与优化:论文评估了从传统向量化方法到大型语言模型(LLM)嵌入等多种 NLP 技术...
随机采样是认知浅层:LLM 中温度变化与模型多样性之间的维度差距
事件概述一篇来自 arXiv 的论文《Stochastic Sampling is Epistemically Shallow: The Dimensionality Gap Between Temperature Variation and Model Diversity in LLMs》(作者 Izhar Ali,被 EIML@ICML 2026 收录)系统性地比较了两种常见的大语言模型(LLM)不确定性利用方式:同一模型多次随机采样(温度 τ=1)与多个不同模型各采样一次(τ=0)。核心发现是:单模型内通过温度随机性产生的回答变化,几乎不包含跨问题的结构信息;而一个多样化的模型集成则能真正揭示模型的知识边界。 关键技术点 对比设置:在同一组问题上,作者将同一个模型以 τ=1 运行 100 次,与一个由 24 个不同 LLM 组成的集成(每个 τ=0)进行对比。 信号检测方法:采用 Marchenko–Pastur 随机矩阵检验,从采样噪声中分离真实信号维度。 关键结果: 在五个模型家族和三个基准(MMLU、HellaSwag、GSM8...
JAXBench:自主TPU内核优化的基准测试
事件/论文概述2026年7月,来自Google等机构的研究团队发布了 JAXBench —— 首个专门为Google Cloud TPU设计的自主内核优化基准测试集。该论文(arXiv:2607.20466)旨在填补TPU领域缺乏统一、可复现的自动优化评估平台的空白。与此前GPU领域已有KernelBench等基准不同,TPU因其独特架构和专属编程语言Pallas,长期缺乏类似的“爬坡目标”。JAXBench包含50个JAX工作负载,覆盖生产级算子和翻译后的KernelBench算子,并提供了手调Pallas内核作为专家上限基线,为AI驱动的内核优化提供了标准化的测试场。 关键技术点 基准构成: 从MaxText库(涵盖Llama-3.1、DeepSeek-V3、Mixtral、Mamba-2、AlphaFold2等架构)中提取17个生产ML算子。 从KernelBench翻译33个算子,验证正确性并调整问题规模以实现TPU v6e MXU的高利用率。 其中8个生产算子配套了来自Tokamax库的手调Pallas内核,经块大小调优后作为专家上限基线(几何平均加速比2....
