事件概述

OpenAI 于 2026 年 9 月 16 日发布新一期经济研究(OpenAI Economic Research),题为《How workers are unlocking new ways of working》。这份报告是 “Work at the Frontier” 系列的最新一篇,延续了首篇报告提出的 “task crossover”(任务跨界) 概念——即工作者使用 AI 去完成历史上归属于另一职业的活动。

首篇报告记录了这一现象的存在,而本次研究追问的是:这些跨职业行为之后会怎样?它们是“尝鲜一次”就结束,还是会沉淀成稳定的工作流?

研究结论是:一部分跨职业 AI 使用具有明显的复现性。工作者会反复回到本职边界之外的任务上,这些活动在其被观测到的 AI 使用中占比随时间上升。报告提出的判断是:如果这些活动最终变成常规职责,岗位名称可能不变,但岗位内部的工作内容组合会变宽。

关键技术点

数据规模与范围

研究分析了 2026 年 4 月至 7 月期间超过 150 万条与工作相关的 ChatGPT 消息。其中一组核心样本是 约 6,200 名在 4 月到 7 月被持续观测到的工作者。

核心发现一:跨职业任务占比在四个月内近乎翻倍

在持续观测的工作者中,此前使用过的跨职业任务占“职业特定 AI 活动”的比例,从 4 月的 13.1% 上升到 7 月的 25.9%。报告认为这一趋势与“工作者把部分跨职业辅助纳入持续工作流”这一解释相符,而不只是一次性试验。

核心发现二:复现率显著高于对照组

在匹配的一个月跟进观测样本中:

  • 上个月使用过某项跨职业任务的工作者,本月再次回到该任务的概率为 23.6%;
  • 而上个月未观测到使用该任务的、条件可比的工作者,使用同一任务的概率为 8.4%。

报告指出,本职内任务与通用任务也呈现类似的差距。

核心发现三:不同任务的“留存率”差异极大

跨职业任务的下月平均复现率为 18.5%,但分布极不均匀:

跨职业任务类型 下月复现率
与客户讨论商品或服务 54%
广告或推广文案撰写 44%
制作营销材料 37%
平均(跨职业任务) 18.5%
解释财务信息 约 15%

报告对这一差异给出两种可能解释:一是 AI 天然更容易嵌入高频、周期性的工作流;二是也可能反映职场规范、谨慎程度,以及对出错后果的感知差异。

核心发现四:跨职业任务的提示词写法不同

工作者在向 AI 提出本职之外的任务时,提示行为出现系统性差异:

  • 平均提示更短;
  • 更少要求解释、操作指引、特定回答格式或建议;
  • 更可能主动提供示例或背景信息;
  • 更可能要求 AI 做检查或核实。

报告对此的一种解读是:工作者在用 AI “借用专业知识”,而不是让 AI 从头教自己一个全新领域——他们带着问题与上下文(文档、示例、同事提供的信息)来,请 AI 把另一个领域的知识应用上去。

数据与隐私处理

报告脚注说明:职业信息来自用户在 ChatGPT Business 引导流程中提供的角色或部门信息;消息来自这些用户会话的一个样本;排除了禁用训练的数据以及无法有效分类的消息;数据经聚合并匿名化处理,研究人员不阅读任何单条用户消息。脚注同时提示,随着工作者在某个月内尝试新任务,可被认定为“复现”的任务基数本身会增加。

对数据科学或 AI Agent 落地的意义

从工程与产品视角看,这份研究提供了几个可以直接映射到落地决策的信号:

1. 任务边界比岗位边界更值得建模。 报告的核心叙事是“岗位名称不变、任务组合变宽”。对于做企业内 AI 平台或 Agent 编排的团队,这意味着能力单元的粒度应该是任务而不是职位。按职位配置权限和工具,很可能一开始就和真实使用模式错位。

2. “借用专业知识”模式的提示特征,直接指向 Agent 的上下文设计。 跨职业任务的提示更短、更依赖外部投喂的示例与背景、更强调校验。这三点恰好对应 Agent 产品最需要做扎实的部分:上下文注入(把文档/示例自动带进 prompt)、少轮次的专业能力封装、以及输出校验环节。如果用户已经在用自然方式表达这些需求,产品化时把它显式化就是明确的收益点。

3. 复现率是比使用率更有价值的指标。 23.6% 对 8.4% 的对照组差距,说明“用过一次”和“进入工作流”是两种完全不同的状态。企业评估内部 AI 工具时,若只看活跃用量,很容易把一次性实验误判为生产力提升。报告给出的这套“次月回访 + 匹配对照”的思路,可以直接借鉴为内部工具的落地评估框架。

4. 任务类型的复现率差异,可作为自动化优先级的输入。 客户沟通、推广文案、营销物料这类复现率在 37%–54% 的任务,是更稳定的自动化与 Agent 候选场景;而报告未说明这些任务在准确性要求和合规约束上的分布,实际排期时仍需自行评估风险等级。

需要提醒的是,这是一项观察性研究,报告本身并未给出因果性结论,也没有说明所采用的具体分类模型、任务标签体系或统计推断方法,这些细节原文未说明。

我的技术点评

这份报告最值得关注的,其实不是那组百分比,而是它选择的问题层级。

过去两年关于“AI 是否取代工作”的讨论,大量集中在岗位层面——某个职位会不会消失。而这份研究把镜头下移到了任务层面,并且用一个非常朴素但有效的方法论回答了关键问题:用户会不会回来? 从“首次使用”到“次月复现”,中间隔着的是真实价值验证。报告用匹配对照把自然回落和真实留存区分开来,这个设计比单看使用量曲线要扎实得多。

提示词行为的那组发现,我认为是全文信息密度最高的部分。跨职业任务的提示更短、更少要解释、更多给上下文、更多要校验——这四件事合在一起,描绘的不是“学习型用户”,而是“带着答案来验证的专家型用户”。用户并不想通过 AI 转行,他们只是想在当前问题上借一点别的领域的杠杆。这对产品设计的含义很直接:与其做一个“教你做 X”的教学式助手,不如做一个“你把料给我,我给你专业输出”的执行式助手。

当然,这份报告的边界也要看清楚。样本来自 ChatGPT Business 用户,本身是企业场景中相对高投入度的人群;职业标签依赖用户自行填写,粒度未知;四个月的窗口对于判断“工作流固化”来说仍偏短。报告最后说会继续追踪这些变化,我认为更有价值的下一问题是:这些跨职业任务最终是由个人固化下来,还是会被组织沉淀成标准流程? 前者是个人能力扩展,后者才是分工结构的真正变化。

原文链接