Polimill 构建日本下一代公共 AI 基础设施:QommonsAI 与 OpenAI 的实践
事件概述
2026 年 8 月 31 日,OpenAI 官方发布了与日本初创公司 Polimill 的合作案例。Polimill 利用 OpenAI 的 GPT 模型和 Codex 开发了名为 QommonsAI 的生成式 AI 平台,目前已被日本约 1050 个地方政府和约 55 万名公务员采用。Polimill 的目标是让 QommonsAI 超越普通生产力工具,演进成为支撑日本市政工作的“下一代公共操作系统”(Public OS)。
Polimill 最初的项目是 Surfvote——一个让市民交换政治与社会观点的平台。在与地方政府合作过程中,他们发现公共部门团队被日常事务消耗了大量精力,几乎没有时间将市民声音反映到政策中。为了扩大公民参与,Polimill 决定先让政府工作本身变得更高效。2024 年 10 月,QommonsAI 正式发布,提供面向议会答辩、公共服务、社会福利、法律检索等领域的专用 AI 能力。
关键技术点
跨市政知识库的构建
政府引入生成式 AI 的最大障碍之一,是数据的碎片化。每个地方政府都有各自的工作流程和文档格式,历史记录分散在不同系统中。例如,准备议会答辩往往需要人工翻阅多年的会议记录,确保答复与上级政策一致。如果底层数据没有组织好,再强大的 AI 模型也无法产生真正可用的洞察。
Polimill 收集并标准化了日本全国各地的议会会议记录,再使用 AI 添加元数据,构建了一套跨市政、跨时间的高精度检索基础。随后,他们将这一结构扩展到福利、法律和其他行政领域,最终让分散的行政信息通过统一接口变为日常工作可用的知识。
政府级安全与可用性的平衡
QommonsAI 以 OpenAI 的 GPT 模型为核心。在公共部门,信息管理和审计合规至关重要。QommonsAI 内置了运营控制功能,管理员可以审查功能使用历史,并根据组织政策限制可用的模型。
Polimill 的 CAIO 若林正浩(Masahiro Wakabayashi)指出,采用 GPT 模型的一个重要原因是其广泛的认知度和易用性。ChatGPT 的普及意味着公务员在 rollout 之后更容易接受新工具——即使他们不熟悉技术术语或其他模型名称,只要知道系统基于广泛使用的 ChatGPT 技术,就能降低初始使用门槛。根据 Polimill 的说法,在 QommonsAI 的日常通用对话功能中,GPT 模型是用户最常选择的选项。
Codex 加速开发流程
OpenAI 技术同样改变了 Polimill 的软件开发方式。他们在从需求定义、与现有 GitHub 代码一致性检查、实现到测试的整个流程中采用了 Codex。工程师可以专注于审查 AI 生成的方案并做高层次决策,而 AI 则更自主地承担实现工作。
借助 AI 编码速度和后台持续工作能力,开发速度提升至此前的 3-5 倍。若林正浩表示,构建原型、向市政团队展示、收集反馈的验证循环显著加速。OpenAI 还提供了全程实践支持,包括分享全球领先案例的最佳实践、提供针对 Polimill 的定制信息,以及帮助设计开发流程本身——明确哪些步骤应由 AI 处理、哪些环节需要人工审查并承担责任。
对数据科学和 AI Agent 落地的意义
这个案例展示了生成式 AI 在公共部门落地的两个关键路径:
第一,数据治理先于模型能力。QommonsAI 的成功不在于使用了多强大的模型,而在于把分散的行政数据(如议会记录、福利文档、法律文本)转化成结构化的、跨组织的可检索知识库。对数据科学家而言,这再次印证了一个核心经验:AI 应用的上限往往由数据基础设施决定,而非模型本身的参数量。
第二,AI Agent 的真实现实场景。Polimill 计划在 2026 年秋季全面推出 Qommons ONE,这是一个允许外部公司为地方政府提供应用的商店。其核心是一个“超级代理”(super agent),能够整合多个专业 AI 系统和第三方应用。用户只需陈述目标,系统就会自动调用所需 AI 或应用,产出从研究到演示文稿的完整交付物。这正是 AI Agent 从演示走向生产力的典型场景——从工具调用到多系统编排,再到公共部门复杂流程的自动化。
更有价值的是 Polimill 对“隐性知识”(tacit knowledge)的探索。在验证中,经验较少的员工利用 AI 和累积的行政信息起草政策提案,其质量接近资深官员的水平。但资深官员的提案仍然获得最高评价。Polimill 分析认为,差异来自隐性知识——例如政策提案落地所需的实际程序、居民可能存在的顾虑,这些都没有写入操作手册。他们计划记录资深官员如何指导 AI 进行研究、如何修改输出,从而把此前从未文档化的判断转化为组织知识。这种“用 AI 放大专家能力,而不是替代专家”的思路,对任何希望将 AI Agent 引入专业领域的团队都有借鉴意义。
我的技术点评
Polimill 案例中,最值得关注的一点是他们对开发流程的重构。Codex 并不是简单地把 AI 当作补全工具,而是让 AI 深入参与到需求定义、代码一致性检查、实现和测试全流程,工程师则转向更高层的方案审核与决策。这种“AI 负责执行,人负责判断”的协作模式,与当前“AI Agent 自主完成多步任务”的趋势相吻合,也符合智能体落地时“人在环上”(human-on-the-loop)的最佳实践。
另一值得注意的是 Polimill 对“知识转移”的定位。他们不把 AI 视作效率提升器,而是视作组织记忆的载体。资深官员与 AI 的交互痕迹(如何提问、如何修改输出)可以被记录和复用,这等于把个人经验外化为组织资产。这种思路对政府、法律、医疗等高度依赖经验判断的领域尤其具有启发性——AI Agent 的价值不仅在于完成现有任务,更在于让专家在完成任务的过程中沉淀方法论。
当然,原文未说明 QommonsAI 的技术架构细节(如具体用了哪些 GPT 模型版本、向量数据库方案、部署方式),也未提及模型调优或推理成本的具体数据。这些信息可能需要查阅 Polimill 的官方文档或后续技术博客才能获得。
