Yunkai's Blog Lab

Yunkai's Blog Lab

韩国称 AI Agent 疑似被用于入侵本国银行:一个值得警惕的信号
Created2026-10-06|技术动态
事件概述据路透社(Reuters)报道,韩国方面表示,AI Agent(人工智能智能体)疑似已被用于对该国银行系统的网络攻击。该消息经由 Hacker News 首页收录,讨论区共有 28 点、4 条评论,属于热度不高但信息量需要谨慎对待的一类条目。 需要先明确一点:这篇报道的原文信息非常有限。我们目前能够确认的只有以下几点: 事件主题是韩国银行遭到网络攻击; 韩国方面(报道标题与 URL 中出现 “Lee”)公开表示 AI 疑似被用于这些攻击; 报道来源为路透社,链接指向 2026-10-06 发布的一篇稿件。 以下关键细节原文未说明,因此不应做任何推断: 具体的攻击发生时间、持续周期,以及是否已完成处置; 被攻击的是哪几家银行、哪类系统(核心账务、支付网关、风控还是内部办公网); 攻击是否成功、是否造成资金损失或客户数据泄露; 所称的 “AI” 具体指哪一类模型或工具,是通用大模型、专门的攻击型 Agent,还是仅仅被用作辅助脚本生成; 攻击者身份,以及是否存在国家背景; 韩方结论的证据基础——是取证日志、模型指纹,还是行为模式推断。 在缺乏这些信息的情况下,把它当成...
Atlassian 与 OpenAI 扩大合作:让企业知识从「被检索」走向「被执行」
Created2026-10-06|技术动态
事件概述OpenAI 于 2026 年 10 月 6 日发布消息,宣布与 Atlassian 扩大合作:将 GPT-6 系列的前沿模型接入 Atlassian 平台,用于支撑帮助团队「规划、构建、交付工作」的 AI 体验。双方称,这次合作是 2023 年既有协作的延续与升级。 按公告描述,OpenAI 的前沿模型将驱动 Atlassian 平台及 Rovo 上的各类 Agent。Rovo 是 Atlassian 的 AI 产品,其核心是把 OpenAI 的智能能力与 Atlassian 的 Teamwork Graph 结合——后者被描述为一个「企业上下文层」,连接人员、项目、文档与决策,让 AI 获得对公司运作方式的深度理解。 公告同时提到,Atlassian 自身也在扩大对 Codex 与 ChatGPT Enterprise 的采用:超过 3000 名 Atlassian 开发者已在终端、IDE 和代码审查流程中使用 Codex。借助由 Teamwork Graph 驱动的 Atlassian 插件,Codex 用户可以访问相关工作项和技术文档,以支持编写、测试与交付软件。...
Jump Trading 如何用 ChatGPT 扩展量化研究:GPT‑6 Astra 与长周期 Agent 工作流
Created2026-10-06|技术动态
事件概述OpenAI News 发布了一篇客户案例,介绍量化交易公司 Jump Trading 如何使用 ChatGPT 扩展量化研究。原文提到,Jump Trading 使用 GPT‑6 Astra 来处理更长、更模糊的研究问题。 按照 Jump Trading 的 LLM R&D 负责人 Lucas Baker 的说法,量化交易公司的核心工作是构建预测模型:使用市场数据、新闻和事件,以及一系列另类数据源,对资产价格做出尽可能好的预测。由于市场复杂、噪声大且随时间变化,几乎不可能精确预判会发生什么。但 Baker 表示,在规模化条件下,只要预测得比抛硬币略好,就足以形成成功的策略。 Baker 负责 agentic research and development,工作重点是构建 agents、harnesses 和基础设施,让量化研究员能够在更大广度和深度上探索想法。原文称,加入 GPT‑6 Astra 后,可以交给 agent 的工作流在规模和复杂度上显著扩展,从日常编码到高级量化研究,再到验证新假设。 关键技术点1. 长周期任务的自主性与 Agent 协同原文引用...
OpenAI 公开前沿模型数学新成果:Lean 形式化证明与推理细节同步开源
Created2026-10-06|技术动态
OpenAI 公开前沿模型数学新成果:Lean 形式化证明与推理细节同步开源一、事件概述OpenAI 于 2026 年 10 月 6 日发布研究公告,公开了一批由**内部前沿模型(internal frontier model)**生成的数学新成果,涵盖多个开放问题。与以往只公布结论不同,这次发布把论文、证明形式化和研究过程数据一并放到了 GitHub 仓库中。 在发布方式上,OpenAI 表示正在与普林斯顿高等研究院(IAS)的数学与人工智能独立咨询组(Advisory Group on Mathematics and Artificial Intelligence) 进行磋商,并参考其公开建议,来制定结果披露的最佳实践。本次发布采用 GitHub 仓库形式,并配套了论文修订与引用协议。OpenAI 同时说明,仍在探索其他符合该委员会指南的社区托管方案;至于具体何时切换到社区托管,原文未说明。 二、关键技术点1. Lean 形式化证明 仓库中包含了大量证明的 Lean 形式化版本。Lean 是一门允许数学证明被计算机检查的编程语言,这意味着这些证明的正确性可以由机器验证,而不只...
OpenAI 携手 Ironclad:用合同工作流训练 AI Agent 的计算机使用能力
Created2026-10-06|技术动态
事件概述OpenAI 于 2026 年 10 月 6 日发布博文,介绍其与 AI 合同领域厂商 Ironclad 的研究合作。合作的核心目标很明确:把复杂的专业工作流(这里具体指合同与法务运营流程)转化为可训练、可评测的研究任务,从而推进 AI Agent 在计算机上执行专业工作的能力。 背景是 OpenAI 此前发布 GPT‑6 Astra 时,已经展示了模型在准备文档、测试网站等计算机使用场景上的进展。下一步的目标是让 Agent 能更高效地操作专业软件、解决复杂业务问题——包括理解企业业务规则、执行多步工作流,并验证自己的产出是否满足最初的需求。为此,OpenAI 选择直接与少数最懂这类工作流的软件公司合作,把高价值的困难任务变成模型的研究问题。Ironclad 是第一个合作伙伴。 关键结果:GPT‑6 Astra 是首个在 Ironclad 任务上训练的前沿模型。在 OpenAI 的研究评测中,它的平均得分比 GPT‑5.6 Sol 高 32%,而每次尝试的估计耗时低 48%。 关键技术点1. 任务来自真实业务流程,而非合成玩具题 博文用一个采购软件的例子说明任务的复杂度...
OpenAI 面向欧盟文本溯源规则的方案:textGrain 水印、检测器开放与 API 可选开启
Created2026-10-05|技术动态
事件概述OpenAI 发布文章《Our approach to EU text provenance rules》,说明其在欧盟《人工智能法案》(EU AI Act)要求下对文本水印与内容溯源的阶段性落地方案。 原文给出的核心事实是:EU AI Act 要求生成式 AI 提供方以机器可读的方式让生成文本可被识别。OpenAI 认为文本水印与检测仍属于早期技术,存在明显局限,因此采取分阶段推进的方式,并强调要清楚说明「水印能说明什么、不能说明什么」。 具体动作包括三项: API 客户可选开启:即日起,全球 API 客户可以针对部分模型选择开启文本水印;原文明确说明,在 API 中文本水印默认关闭。 欧盟 ChatGPT 与 Codex 默认加水印:在未来几周内,OpenAI 将为欧盟地区符合条件的 ChatGPT 和 Codex 文本输出添加不可见水印。 检测器仅向研究者开放申请:文本水印检测器的访问初期只限获批的研究人员和专家组织,用于帮助评估和改进该技术。 同时原文强调,这套安排只适用于文本溯源。图像与音频的验证工具(openai.com/verify 网页工具与 Cont...
OpenAI 为 ChatGPT 推出视觉广告格式:AI 原生广告的测量与品牌安全拼图
Created2026-10-05|技术动态
事件概述OpenAI 在官方博客发布《Building advertising for the way people use AI》,宣布三件事: 在 ChatGPT 中推出一种新的视觉广告格式(visual ad format); 扩展测量工具与合作伙伴生态,帮助广告主理解 ChatGPT 广告的业务影响; 推进**品牌适宜性(brand suitability)**的评估方式与合作伙伴试点。 文中给出的一个关键背景数据是:ChatGPT 每周触达 12 亿人,OpenAI 称其为全球最大的 AI 原生消费平台。官方对广告的定位是:广告让 AI 的好处覆盖更多人,使其能够服务比单纯订阅更大的市场,同时给企业提供一种在用户”探索想法、做决策、发现产品与服务”时触达他们的新方式。 需要说明的是,原文并未给出该视觉广告格式的定价模型、完整投放时间表或后续覆盖范围的细节。 关键技术点1. 视觉广告格式先落在图像生成场景新格式的呈现方式是图片,用来展示”产品灵感、产品使用方式,或产品带来的体验”,帮助用户理解一个品牌、判断产品的差异化并决定是否购买。 落地路径上,OpenAI 的表述...
快速模型与缓慢证据:LLM Agent 框架中 System-1 决策模型的配对评估与自审
Created2026-10-05|技术动态
事件概述arXiv 上出现了一篇题为《Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses》的论文(arXiv:2610.02267,作者 Jiawei Li,2026 年 10 月 1 日提交,11 页、7 张图)。 论文讨论的是 Agent harness(智能体执行框架)中大量存在的一类”小而具体”的决策:调用哪个模型、使用哪个工具、检索到的文本是否相关、输入是否携带提示注入。针对这些问题,”System-1 决策模型”试图用一次前向传播直接输出类别概率,从而替代一次完整的 LLM 调用,以节省成本和延迟。 论文的核心不是单纯宣称”小模型够用”,而是给出一份配对评估加自我审计的报告:作者把两个 System-1 模型——开放权重模型 Laya 与托管模型 Jev——放在 11 个 Agent 决策点上做对比,并对自己的评估流水线做了复盘,暴露出若干会显著扭曲部署结论的分析错误。需要说明的是,原文未...
MintFlow:用最小轨迹干预实现受约束的流匹配采样
Created2026-10-05|技术动态
事件概述arXiv 上新出现一篇 cs.AI 方向的工作 《MintFlow: Minimal Trajectory Intervention for Constrained Flow Matching》(arXiv:2610.02260,v1,提交于 2026 年 9 月 30 日)。 作者为 Yesom Park、Kelvin Kan、Qifan Chen、Thomas Flynn、Hayden Schaeffer、Xihaier Luo(arXiv 页面标题下共列出 6 位作者)。 论文要解决的问题很具体:流匹配(Flow Matching)模型在生成建模上表现优异,但很多下游应用要求生成的样本满足预设约束,例如观测测量值、物理定律等。已有约束采样器普遍面临一个两难:强制执行约束,往往会让样本大幅偏离预训练数据分布。 MintFlow 的定位是免训练(training-free)的约束采样框架,把约束执行表述为对预训练流轨迹的一次最小干预(minimal intervention)。它寻找对中间流状态的最小扰动,使得该状态在预训练流场下的后续演化能够满足目标约束。由于只扰动...
AI Risk Observatory:用 LLM 批量解析 9821 份年报,揭示 AI 风险披露的真实水平
Created2026-10-05|技术动态
事件概述arXiv 上出现了一篇题为《The AI Risk Observatory: What Can We Learn from AI Disclosures in Annual Reports About Societal Resilience?》的论文(arXiv:2610.02281,cs.AI),作者为 Bart Jaworski,2026 年 10 月 1 日提交。 论文的核心问题是:年报这种传统、强制、公开的企业文本,经过 LLM 规模化处理后,能否提供关于”企业如何披露其 AI 应对”的有效信号? 作者认为社会韧性研究(societal resilience research)依赖于可用、可行动的数据,而年报恰好是一个被长期低估的数据源。 研究规模并不小:作者对 9,821 份年报(来自 1,362 家英国上市公司,时间跨度 2020–2025 年,并包含 2026 年的部分数据)运行了一条可复现的两阶段分类流水线。论文共 22 页(9 页正文加附录)、12 张图、7 张表,并公开了代码与数据(dataset-v1.1,具体链接原文以 “this https U...
12…41
avatar
Yunkai Huang
嗨,这里是云开~
Articles
404
Tags
815
Categories
5
Follow Me
Announcement
This is my Blog
Recent Posts
韩国称 AI Agent 疑似被用于入侵本国银行:一个值得警惕的信号2026-10-06
Atlassian 与 OpenAI 扩大合作:让企业知识从「被检索」走向「被执行」2026-10-06
Jump Trading 如何用 ChatGPT 扩展量化研究:GPT‑6 Astra 与长周期 Agent 工作流2026-10-06
OpenAI 公开前沿模型数学新成果:Lean 形式化证明与推理细节同步开源2026-10-06
OpenAI 携手 Ironclad:用合同工作流训练 AI Agent 的计算机使用能力2026-10-06
Categories
  • [技术动态]13
  • 技术动态388
  • 技术探索1
    • 随笔1
  • 随笔1
Tags
Skill 生态 Data Science 记忆评估 可解释性 时间序列预测 推理 合成数据 TCO 本命年 Code Golf Bioinformatics 概率波模型 翻译层 代码审查 Clickbait Detection MCP VACUUM Diffusion Models Nginx 学术写作 经济模型 AGI 有界次优搜索 Financial Simulation Workload Characterization Adversarial Resilience Privacy Place Recognition 可解释AI Legal Reasoning Cancer Genomics Lean Liquid Network 内存 Google TMLR 通用计算 反思 AI教育 多模态学习
Archives
  • October 2026 28
  • September 2026 126
  • August 2026 134
  • July 2026 113
  • February 2026 3
Website Info
Article Count :
404
Unique Visitors :
Page Views :
Last Update :
© 2025 - 2026 By Yunkai HuangFramework Hexo 8.1.1|Theme Butterfly 5.5.4