Yunkai's Blog Lab

Yunkai's Blog Lab

Expert-validated STEM QA:专家验证的高质量 STEM 问答数据集
Created2026-09-01|技术动态
事件概述随着 AI 技术在数学、医学、材料科学等领域持续帮助科学家取得突破,评估数据集的更新速度与质量面临着前所未有的挑战。2026 年 6 月,由 Kihwan Han 等 7 位研究者提交至 arXiv 的论文 Expert-validated STEM QA(编号 2608.28591)提出了一套全新的高质量、专家验证的 STEM 问答数据集。该数据集涵盖物理、化学、生物学和数学四个学科,共包含 398 个问题,由 241 位领域专家共同创建,并已经部分开源。 论文核心发现:前沿 AI 模型在该数据集上的准确率低于 25%,显示出明显的性能“天花板”;同时,使用该数据集的私有扩展版本(N=2,000)对开源模型进行后训练,使模型在 HLE-verified 数据集的 STEM 子集上相对性能提升了 15%(p=0.045),证明了该数据在模型训练上的潜在价值。 关键技术点1. 现有 STEM 数据集的四大缺陷研究人员指出,当前主流 STEM 评估数据集普遍存在以下问题: 性能饱和:模型在既有数据集上已接近满分,导致评估“失去区分度”,无法为模型改进提供...
DS-Lighting:让数据科学 Agent 的 Harness 设计显式化
Created2026-09-01|技术动态
事件概述arXiv 于 2026 年 9 月更新了一篇来自香港科技大学(HKUST)研究团队的论文《DS-Lighting: Making Agent Harnesses Explicit for Data-Science Automation》。该论文由 Fan Liu 和 Hao Liu 共同撰写,于 2026 年 6 月 1 日提交至 cs.AI 领域。 论文指出,大型语言模型(LLM)Agent 在自动化数据科学工作流方面展现出巨大潜力,但其端到端性能高度依赖于 Agent Harness(即“管控框架”或“支架”)的设计——这个框架负责表示任务、管理执行状态、约束输出产物,并提供评估反馈。然而,现有数据科学 Agent 往往将这一 Harness 隐式化处理,导致异构任务下的结果难以复现、难以比较、难以归因。 针对这一问题,团队提出了 DS-Lighting,一个统一 Harness 工具包,将 Harness 设计显式化,以提升数据科学自动化的可复现性、可比性和可靠性。目前代码已开源,仓库地址为:https://github.com/usail-hkust/dslig...
Carmack 质疑 Scratch:视觉编程真能通向成功的编程生涯吗?
Created2026-08-31|技术动态
Carmack 质疑 Scratch:视觉编程真能通向成功的编程生涯吗?事件概述2026 年 8 月 31 日,id Software 联合创始人、VR 技术先驱 John Carmack 在 X 上提出了一个引发讨论的问题: 我仍然看到 Scratch 这种“可视化编程”环境被定位为儿童进入编程世界的一条入门路径,但与游戏模组(game modding)不同,我从未听说过哪个“成功故事”把早期的 Scratch 经历视为自己成就一番事业的关键。有人有例子吗? 这条推文被 Hacker News 首页收录,目前获得 18 分、5 条评论。Carmack 的质疑点很直接:同样是面向初学者的编程入口,游戏模组孕育了大量后来的开发者,而 Scratch 似乎并没有被任何资深工程师当作职业起点的关键因素。 关键讨论点Carmack 的疑问:Scratch vs. 游戏模组Carmack 的对比对象很有意思:游戏模组。在 Doom、Quake 时代,大量年轻人通过修改游戏配置文件、编写脚本、制作关卡,逐步理解了引擎逻辑和底层系统,并最终走上专业开发道路。Carmack 本人就是这一路径...
拖延症研究造假?一篇经典论文背后的数据疑云
Created2026-08-31|技术动态
事件概述一篇即将发表在 Psychological Science 上的重复性研究,未能复现 Ariely 和 Wertenbroch(2002)那篇极具影响力的拖延症论文中的 Study 2。这篇原始研究声称:当任务各自设有外部设定的截止日期时,人们的表现优于自己设定截止日期或统一在最后一天截止的情况。该论文被经济学和心理学课程广泛引用,谷歌学术引用量超过 2100 次。 但更严重的问题在于:Data Colada 的博主在分析原始数据后,得出结论——这篇论文的 Study 1 和 Study 2 数据均被篡改过。目前作者已联系 Psychological Science 要求撤稿,撤稿流程仍在进行中。 原始研究回顾Ariely 与 Wertenbroch 的 Study 2 设计如下: 60 名参与者随机分入三组,每组 20 人; 任务是对三份各 10 页、含 100 个语法/拼写错误的文档进行校对; 条件 1:均匀截止日期(第 7、14、21 天各交一份); 条件 2:自己设定截止日期(21 天内任意安排); 条件 3:最后一天截止(第 21 天统一提交)。 ...
Darling:在 Linux 上运行 macOS 软件的开源翻译层
Created2026-08-31|技术动态
Darling:让 macOS 软件在 Linux 上原生运行Darling 是一个正在快速发展的开源翻译层项目,它让 Linux 用户能够直接运行 macOS 软件,其定位与 Wine 在 Linux 上运行 Windows 软件类似,但面向的是 Apple 生态。该项目于 2026 年 8 月 31 日出现在 Hacker News 首页并引发技术社区讨论(83 分,19 条评论)。 事件/项目概述Darling(名字取自 Darwin 与 Linux 的组合)是一个 macOS 翻译层,它允许 Linux 系统直接运行 macOS 软件,且无需硬件模拟器。项目以 GPL v3 许可开源,代码托管于 GitHub,核心目标是实现完整的 Darwin 环境——包括 Mach、dyld、launchd 等关键组件。 根据官网信息,Darling 具备以下核心特性: 快速:直接运行 macOS 软件,不依赖硬件模拟 免费开源:基于 GPL v3 协议,在 GitHub 上公开开发 高兼容性:实现了完整的 Darwin 运行环境 易用:大多数安装配置由 Darling 自...
Polimill 构建日本下一代公共 AI 基础设施:QommonsAI 与 OpenAI 的实践
Created2026-08-31|技术动态
事件概述2026 年 8 月 31 日,OpenAI 官方发布了与日本初创公司 Polimill 的合作案例。Polimill 利用 OpenAI 的 GPT 模型和 Codex 开发了名为 QommonsAI 的生成式 AI 平台,目前已被日本约 1050 个地方政府和约 55 万名公务员采用。Polimill 的目标是让 QommonsAI 超越普通生产力工具,演进成为支撑日本市政工作的“下一代公共操作系统”(Public OS)。 Polimill 最初的项目是 Surfvote——一个让市民交换政治与社会观点的平台。在与地方政府合作过程中,他们发现公共部门团队被日常事务消耗了大量精力,几乎没有时间将市民声音反映到政策中。为了扩大公民参与,Polimill 决定先让政府工作本身变得更高效。2024 年 10 月,QommonsAI 正式发布,提供面向议会答辩、公共服务、社会福利、法律检索等领域的专用 AI 能力。 关键技术点跨市政知识库的构建政府引入生成式 AI 的最大障碍之一,是数据的碎片化。每个地方政府都有各自的工作流程和文档格式,历史记录分散在不同系统中。例如,准备议...
ChatGPT Ads 年化收入突破 10 亿美元:OpenAI 的广告商业化与 AI 普惠路径
Created2026-08-31|技术动态
事件概述2026 年 8 月 31 日,OpenAI 官方宣布,其广告产品 ChatGPT Ads 在上线不到 200 天内,年化收入运行率(Annualized Revenue Run Rate)已达到 10 亿美元。目前该平台已服务数万名广告主,并进一步向印度、欧洲、中东和北非地区开放自助式广告购买服务。 在此之前,ChatGPT Ads 已覆盖超过 40 个国家,并建立了由 50 多个技术与测量合作伙伴构成的生态体系。OpenAI 在公告中也确认,该产品已从早期的定向邀约试点,演进为一个面向各类规模企业的自助式广告平台。 关键技术与产品进展根据 OpenAI 官方发布的信息,ChatGPT Ads 在这一阶段的产品演进主要体现在以下几个维度: 投放能力升级:CPC(按点击付费)和效果优化出价(outcome-optimized bidding)已成为当前广告主使用的主要投放方式,占大多数广告系列。 测量与优化基础设施:Pixel 和 Conversions API 已成为广告效果测量与优化的基础组件,帮助广告主追踪转化并优化投放策略。 定向能力扩展:产品已支持产品目录(p...
“I just chose words carefully”:在等宽字体中用手工排版实现完美右对齐
Created2026-08-30|技术动态
事件概述Hacker News 上出现了一篇题为 “I just chose words carefully” 的简短文章,来自网站 unsung.aresluna.org。文章作者以“Unsung”为署名,分享了一个来自上世纪末的奇特排版案例:一位名叫 rs1n 的作者,在 1990 年代末撰写《Super Metroid》游戏攻略时,没有使用任何排版工具,仅靠手工挑选单词,就让全文每一行的右边缘都精确对齐,且全程没有出现双空格。 这篇文章在 Hacker News 上获得了 189 分和 43 条评论(原文未说明更多细节),引发了人们对等宽字体排版、文本编辑与“手工极致”的讨论。 关键技术点1. 等宽字体中的对齐困境在等宽字体(Monospace)中,每个字符宽度相同。常规左对齐没有问题;右对齐也可以通过手工计算空格数量实现,但居中对齐就变得困难,因为没有“半空格”来微调两侧间距。更棘手的是两端对齐(Full Justification):等宽字体下,不同长度的单词会导致空格被拉伸得极不均匀,产生令人不适的“河流”般的空白间隙。 2. 连字符(Hyphenation)并不优雅...
Continuous Diffusion Language Models:连续扩散语言模型的回归?
Created2026-08-30|技术动态
事件概述近日,Hacker News 首页推荐了 Sander Dieleman 的博客文章《Continuous diffusion language models》。该文回顾了连续扩散语言模型(Continuous Diffusion Language Models)近年来的发展轨迹,并指出这一研究方向在经历了一段沉寂后,似乎正在重新回到研究者的视野。文章发表于 2026 年 8 月 24 日,讨论的是一股“近期连续扩散语言模型研究的密集涌现”现象。 作者 Sander Dieleman 是 DeepMind 的研究科学家,曾参与 Imagen、Veo、Nano Banana 等图像/视频生成模型的研发。他在文中对连续扩散方法的历史、技术细节和当前复兴的原因给出了个人视角的分析,并欢迎不同意见在评论区讨论。 关键技术点自回归范式的统治地位与挑战现代语言模型大多采用自回归(autoregressive)方式生成序列:每次预测一个 token,基于之前的 token 进行条件生成。这种分解方式天然支持并行训练(通过 teacher forcing),但生成过程本身是串行...
太空中的磁芯:1980年Spacelab电脑的核心内存模块
Created2026-08-30|技术动态
太空中的磁芯:1980年Spacelab电脑的核心内存模块事件概述Spacelab是一个可重复使用的实验室,搭载于航天飞机的货舱内,为宇航员和科学实验提供空间。作为欧洲项目,Spacelab没有采用航天飞机主电脑的IBM AP-101系统,而是使用了一台法国制造的迷你电脑——Mitra 125 MS。这台电脑拥有128KB内存,但它不是硅基半导体内存,而是采用磁芯内存(core memory),每个比特存储在一个微小的铁氧体磁环中。 近日,有技术爱好者拆解并详细分析了这台电脑的磁芯内存模块,并撰文介绍其内部结构。本文基于该文章进行整理。 关键技术点磁芯内存的基本原理磁芯内存利用微型环形磁芯的磁化方向来存储二进制数据:顺时针或逆时针磁化分别表示0或1。一根导线穿过磁芯,通电后产生的磁场即可改变磁芯的磁化状态。 关键在于“重合电流寻址”(coincident current addressing)。磁芯排列成网格,通过水平和垂直导线交叉选择目标磁芯。每根导线仅施加翻转磁芯所需电流的一半,只有交叉点的两个电流叠加后才能达到翻转阈值。由于磁芯材料的磁滞特性,小的电流不会改变磁芯状态,从而...
1…111213…37
avatar
Yunkai Huang
嗨,这里是云开~
Articles
362
Tags
748
Categories
5
Follow Me
Announcement
This is my Blog
Recent Posts
月面晨昏线悖论:日落后月亮为什么还“朝上”?以及作者顺手测出的 LLM 推理短板2026-09-27
重新拾起木工:从狗门到露台花坛的两次动手实践2026-09-27
当 Google 开始安慰你:AI Overview 误读搜索意图引发的产品反思2026-09-27
当写代码比注册公司还快:为什么开发者该提前准备一个 LLC2026-09-27
DeepSeek 开源 DSec 沙箱基础设施论文:单集群日跑 300 万沙箱,支撑 Agentic RL 训练2026-09-26
Categories
  • [技术动态]11
  • 技术动态348
  • 技术探索1
    • 随笔1
  • 随笔1
Tags
强化学习 Adversarial Defense 广告技术 PostgreSQL AI Overview Enterprise Dual-Use 大模型成本 数字农业 预注册实验 几何光学 知识图谱 Football 安全 Infrastructure Devin 实时地图 工作流自动化 Place Recognition Edge Computing 金融问答 递归自我改进 EEG 天文 Cost-Aware 自主实验 Go Battery 计算机历史 Medical AI Explainable AI 视觉错觉 Model Distillation Security 启发式搜索 Cyber Security 效率优化 专利撰写 GPT-6 老年科技
Archives
  • September 2026 112
  • August 2026 134
  • July 2026 113
  • February 2026 3
Website Info
Article Count :
362
Unique Visitors :
Page Views :
Last Update :
© 2025 - 2026 By Yunkai HuangFramework Hexo 8.1.1|Theme Butterfly 5.5.4