事件概述

2026 年 9 月 27 日,一篇题为《When did Google get so weird?》的博客文章出现在 Hacker News 首页,迅速积累了大量讨论(原文摘要显示 Points: 739,Comments: 392)。作者 Sancho Panza 记录了一次让他”当场愣住”的 Google 搜索体验。

事情的起因非常具体:作者想找 2010 年代关于 NBA 球员 Dario Saric 的老梗推文。背景是 2014 年费城 76 人队选中了当时在土耳其打球的 Dario Saric,后者表示要先履行完土耳其的合同,于是球迷圈里流传开一个内部梗——“he’s never coming over”(他永远不会过来)。作者于是在 Google 里输入了 hes never coming over dario。

他预期得到的是两种结果之一:要么什么都找不到(说明他记错了措辞),要么找到当年的推文或 Reddit 帖子。但 2026 年的 Google 给了他一个 AI Overview——而且这个 AI 概览把这句话理解成了情感问题:认为作者被一个名叫 Dario 的男人抛弃/伤害了,于是决定提供一位”有同理心的数字朋友”来安慰他。

作者的原话是:Google 作为一个”没有人类情感的搜索引擎”,却假定他被生活中的某个叫 Dario 的男人辜负了。而真正想要的结果——那些旧推文和链接——其实也在页面上,只是被压在了 AI 概览下方几百像素的位置。

作者的核心困惑在于:搜索产品什么时候变成了情绪陪伴工具?”组织全球信息并使其普遍可用和有用”这句使命宣言,和”安慰用户”之间是什么关系?他承认,如果是在 Gemini 这类聊天应用里,这种交互或许还能接受,但他用的明明是搜索引擎。

关键技术点

从原文能确认的技术现象有以下几点:

  1. AI Overview 的意图误判。搜索词 hes never coming over dario 是一个典型的领域内梗(fan shibboleth),语义高度依赖特定的社群上下文,字面语义(”他不会过来”)与真实意图(”查找某球员相关的球迷梗内容”)之间存在巨大鸿沟。系统选择了字面语义 + 情感场景的解读路径。

  2. 情感化回复的注入。AI Overview 不仅误判了主题,还叠加了一层情感陪伴式的应答语气。原文未说明这是模型的默认行为、特定提示词模板的产物,还是某些意图分类器触发的安全/关怀分支。

  3. 结果排序与呈现的降级。作者明确指出,真正需要的链接”在 AI 概览下方几百像素”处。也就是说检索本身可能并没有失败,失败的是信息呈现的优先级:生成式摘要占据了首屏,传统链接被推到了次要位置。

原文未说明 Google 内部的具体模型、提示词设计或排序机制,因此这三点都是基于用户可观察行为的推断。

对数据科学与 AI Agent 落地的意义

这个案例虽然是一个消费级搜索产品的体验吐槽,但它折射出的问题对做数据科学和 AI Agent 落地的人非常直接:

其一,意图识别仍然是生成式系统的阿喀琉斯之踵。 越是长尾、越依赖社群语境的查询,越容易在字面语义上翻车。对 Agent 而言,这意味着”理解用户想要什么”这一步不能只靠单轮语义嵌入或意图分类器,需要引入对话澄清(clarification)机制:当置信度低或语义歧义大时,反问一句的成本远低于给出一个自信的错误答案。

其二,生成式输出会掩盖检索系统的真实能力。 如果底层检索其实找到了正确结果,但被摘要层压在下面,用户感知到的就是”这个产品变差了”。对 Agent 系统来说,摘要层与检索层之间需要有明确的”何种情况下不该生成”的边界判断。

其三,情感化风格的默认开启是一种产品风险。 在聊天式界面里,同理心语气是加分项;在工具型界面里,它会被解读为”没听懂我在问什么”。同一个模型行为,在不同的交互外壳下评价完全相反——这对做 Agent 产品的团队是一个关于”上下文适配”的警示。

其四,可观测性与回退路径的设计。 用户需要一条清晰的路径回到”原始链接”,而不是被迫与一个误判了意图的生成层纠缠。

我的技术点评

我倾向于认为,这件事的本质不是”Google 变蠢了”,而是优化目标发生了迁移。当搜索产品的核心指标从”用户多快找到链接”变成”用户多快在页面上得到满足”,生成式摘要就必然被推到首屏——即使它在长尾查询上的准确率明显低于传统检索。这不是模型能力问题,是产品激励问题。

作者那句”我,这只青蛙,终于意识到水已经煮了很久”很形象。AI Overview 刚推出时被吐槽,很多人(包括作者自己)后来”基本能接受了”,因为有时候确实有用。但当它开始在一个篮球梗查询上输出情感安慰时,边际收益为负的那部分就暴露出来了。这就是典型的平均体验改善、长尾体验恶化——而长尾恰恰是搜索引擎过去二十年最不可替代的价值。

另一个值得注意的点是作者提出的对比:如果这是 Gemini 的聊天界面,他能接受;但这是搜索框。这提醒我们,用户对 AI 的容忍度是高度场景绑定的。做 Agent 落地时,把同一个模型塞进不同形态的壳里,用户的期待是完全不同的。搜索框期待的是”给我链接”,对话框期待的是”跟我聊聊”。混淆这两者,模型再强也会被骂。

最后一点实务层面的启示:“不生成”应该是一个被显式训练和评估的动作。 当查询是长尾梗、是专有名词、是社群黑话时,直接给出十条链接,可能比给出一段自信的、温情的、错误的摘要好得多。现在的系统普遍缺少这种”知之为知之”的抑制能力,而这恰恰是用户信任的基础。

作者在文末自嘲说,也许该去找他的朋友 Google 聊聊,毕竟”它对我一直这么友善”。这句反讽大概是整篇文章最精准的地方:当一个工具开始过度友善,用户第一反应往往不是感动,而是困惑。

原文链接