Yunkai's Blog Lab

Yunkai's Blog Lab

Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX
Created2026-07-23|技术动态
事件/论文概述随着AI推理场景中敏感数据输入与专有模型资产的保护需求日益增长,机密计算正成为实际部署的必要条件。然而,在GPU加速的大语言模型服务中启用机密执行模式会带来多少性能代价,一直是一个工作负载依赖且具有重要操作意义的问题。近期,arXiv上发表了一篇题为《Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX》的论文,通过系统的基准测试,量化了在Intel TDX机密实例内单张NVIDIA H100 80GB GPU上,标准非机密执行与机密计算模式之间的性能差异。该研究选取了Mistral-7B v0.1和Qwen3-30B-A3B两个代表性语言模型,测量了首Token时间(TTFT)、端到端请求延迟、每请求Token生成吞吐、全局Token吞吐以及闭环请求吞吐量等关键指标,并在递增并发度下进行了实验。 关键技术点 实验环境:单张NVIDIA H100 80GB GPU,搭载在Intel TDX(Trusted Domain Extensions)机密实例中。Intel TD...
FineServe:细粒度全局LLM服务负载数据集与特征分析
Created2026-07-23|技术动态
事件概述2026年4月,来自学术界的研究团队在arXiv上提交了题为《FineServe: A Fine-Grained Dataset and Characterization of Global LLM Serving Workloads》的论文。该论文发布了一个在真实全球商业市场中收集的多模型LLM服务负载数据集——FineServe,旨在弥补现有研究依赖代理轨迹或粗粒度特征描述、无法捕捉现代多模型LLM平台异构性的不足。论文还基于FineServe开发了一个工作负载生成器,用于为多模型服务平台基准测试提供定制化的细粒度、模型感知的负载混合。 关键技术点 真实多模型负载采集:FineServe从全球商业化在线服务中采集了跨越多种异构模型和任务的真实世界LLM服务负载数据,覆盖不同模型架构、规模和任务意图。 细粒度特征分析:通过分析到达动态和token行为,揭示了不同模型架构、规模和任务意图之间根本不同的波动模式。例如,多种模型组合会呈现各异的高峰/低谷区间,远超单一模式负载的简单叠加。 负载生成器:构建了FineServe工作负载生成器,能够将细粒度的模型感知负载...
Hybrid LSTM-Graph Neural Framework for Robust Financial Fraud Detection and Adversarial Resilience
Created2026-07-23|技术动态
事件概述2026年7月,arXiv上发布了一篇题为《Hybrid LSTM-Graph Neural Framework for Robust Financial Fraud Detection and Adversarial Resilience》的论文。该论文由Mariam Zakaria Moussa Ali独立完成,提出了一套名为FraudShield AI的混合框架,旨在解决金融反欺诈领域中的极端数据不平衡(欺诈率仅0.13%)和不断进化的对抗性规避策略(如“smurfing”和“layering”)等核心难题。论文的实验基于PaySim数据集,展示了该框架在精确率、召回率和F1分数上对传统基线模型(Logistic Regression、XGBoost)的显著优势。 关键技术点 混合架构设计:将长短期记忆网络(LSTM)与手工设计的图拓扑特征(Graph Topological Features)相结合,同时捕获交易的时间序列模式与交易主体间的结构化关系上下文。 网络中心特征工程:作者显式设计了多种图特征,包括PageRank中心度、入度动态(In-Degree d...
OpenEvoShield:面向开放世界多智能体系统攻击的双重非平稳持续防御
Created2026-07-23|技术动态
事件概述2026年7月23日,arXiv 上发布了一篇题为 OpenEvoShield: Dual Non-Stationary Continual Defense for Open-World Multi-Agent System Attacks 的研究论文(arXiv:2607.19351)。该论文由 Litian Zhang、Chaozhuo Li 等六位作者完成,针对基于大语言模型的多智能体系统(LLM-MAS)在安全关键应用中的防御短板,提出了一种名为 OpenEvoShield 的协同演化持续防御框架。 关键技术点论文揭示了现有防御方法面临的核心挑战:攻击策略会随防御更新而动态演化,同时正常智能体的行为也会因系统扩展发生漂移(即“双重非平稳性”)。传统静态防御将部署视为封闭世界问题,一旦分布偏移超出训练覆盖范围,性能迅速下降。 OpenEvoShield 框架由四个核心模块组成: M1(非对称速率控制器):从双重漂移信号中解耦出“攻击侧快学习率”和“正常侧慢学习率”,分别适应攻击演化与正常行为漂移。 M2(正常边界更新器):以慢速率维护一个动态的行为边界,用于区分正...
Launching Health in ChatGPT
Created2026-07-23|技术动态
事件概述2026 年 7 月 23 日,OpenAI 宣布推出 Health in ChatGPT,面向美国年满 18 岁的 ChatGPT 用户(包括 Free、Go、Plus、Pro 计划),允许用户安全连接 Apple Health 和受支持的医疗记录,从而获得更个性化的健康洞察。该功能已开始在 Web 和 iOS 端逐步推送,尚未在 Codex 中提供。 OpenAI 表示,每周已有超过 3 亿人向 ChatGPT 提出健康相关问题,但上下文往往分散在患者门户、医疗记录、App 和可穿戴设备中。Health 功能旨在整合这些分散信息,帮助用户理解化验结果、准备就诊、解读医生说明、建立更健康的生活习惯。目前仅支持美国用户。 关键技术点 模型专门优化:OpenAI 与数百名医生合作开发了现实健康场景和详细评估标准(HealthBench Professional)。GPT‑5.5 Instant 面向免费用户,在健康评估中表现与当时前沿的 Thinking 模型相当。GPT‑5.6 Sol 面向付费用户,在复杂推理、清晰沟通和判断力上进一步提升,能解释就诊记录、跟踪化验变化、...
与 Effingham County 社区共建 AI 基础设施:OpenAI 的 Project Camellia 数据中心承诺
Created2026-07-22|技术动态
事件概述2026 年 7 月 22 日,OpenAI 正式公布了 Project Camellia —— 一个位于美国乔治亚州 Effingham County 的长期数据中心项目。该项目由 OpenAI 设计和开发,计划从 Georgia Power 采购 3.2 吉瓦 电力,分阶段在 2028 年至 2032 年之间 交付。OpenAI 表示,该数据中心将完全由私人资金资助,旨在支撑 AI 训练和推理的算力需求,同时为当地社区带来经济与教育机会。 关键技术点Project Camellia 的核心承诺体现在四个方面,每一方面都包含了可量化的技术和运营保障措施: 居民电费不因项目上涨OpenAI 将承担项目所需的全部基础设施和电力服务成本。根据乔治亚州公共服务委员会的规定,这些成本不得转嫁给现有用户。同时,数据中心设计为在用电高峰期间主动降低自身功耗,优先保障居民供电,从而支持电网的可靠性。 用水量最小化项目采用 闭环水系统(类似汽车散热器原理),水在其中循环使用,而非连续抽取和排放。用水主要用于厕所、厨房、卫生等日常办公场景,与同等员工数量的办公楼相当,不会从当地社区分流...
新闻机构如何用AI推进其关键使命
Created2026-07-22|技术动态
事件概述2026年7月22日,OpenAI在其官方博客发布文章,总结了与多家新闻机构合作使用AI的实践经验。文章指出,从美联社、POLITICO到《费城问询报》、阿克塞尔·施普林格、世界报等全球知名媒体,都在利用OpenAI技术增强报道能力、扩大受众覆盖、优化业务运营,同时始终将人置于新闻工作的核心。 关键技术点文章列举了多个具体应用案例,涉及以下关键技术方向: 增强报道与验证:美联社利用AI扫描夜间新闻和播客、辅助图像视频验证(上传追踪、地理定位、时间定位),并将最高法院文件转化为结构化数据,帮助记者更快锁定故事。 公共记录与数据分析:POLITICO用AI分析大量公共文档;Axios构建了“FOIA Refiner GPT”帮助记者撰写高效的公开记录请求。 会议转录与摘要:《费城问询报》开发了Scribe工具,利用OpenAI技术将市政会议记录转化为分类摘要,并根据记者编辑制定的“新闻价值框架”排序。 翻译与多语言出版:世界报(Le Monde)将精细翻译风格指南整合进ChatGPT模型,加速英文版的发布流程。PRISA Media也使用AI进行文章翻译和内容向量化。...
前沿AI赋能国家科学:OpenAI与美国国家实验室的新一代科研合作
Created2026-07-22|技术动态
事件/论文/产品概述2026年7月22日,OpenAI发布了一篇重要公告,详细阐述了其致力于推动“国家科学新时代”的承诺与行动计划。该计划的核心是与美国能源部(DOE)及其下属17个国家实验室、大学和研究人员深度合作,利用前沿人工智能(Frontier AI)加速科学发现,将AI从一种工具提升为国家战略科研基础设施。作为能源部Genesis Mission的一部分,OpenAI提供了包括资金支持、模型访问、API信用额度以及专门的生物安全评估工具(GPT-Rosalind)在内的一系列具体资源,旨在压缩科研周期,提升美国整体创新生产力。 关键技术点 多层次的资金与资源支持: Codex访问:提供400万美元的Codex访问额度,供大约2000名Genesis研究人员(来自国家实验室和大学)使用,提升日常工作中的编码和推理能力。 API支持:投入300万美元API信用额度,用于支撑两项面向重大科学挑战的大规模科研活动(campaign)。 资源加倍计划:研究人员每花费250万美元API费用,即可获得最高1000万美元的额外API使用额度。 专门的生物科学能力...
Introducing OpenAI Presence
Created2026-07-22|技术动态
事件概述2026 年 7 月 22 日,OpenAI 正式发布 OpenAI Presence——一个面向企业级的 AI 代理平台,旨在帮助组织在客户服务和内部工作流中部署可信的语音与聊天代理。该产品已在 OpenAI 自身客服渠道(1-888-GPT‑0090)中经过实战验证:上线数周内达到人工客服质量基准,75% 的入线问题无需人工介入即可解决,并且通过 Codex 驱动的改进循环在 10 天内将人工转接率降低了 15 个百分点。 关键技术点Presence 的核心设计围绕“在生产环境中可靠地执行高价值任务”展开,关键技术组件包括: 策略与标准操作流程(SOP):企业可为每个代理设置明确的行动边界、审批规则和升级条件。 护栏与防护(Guardrails):当交互超出预定义范围时,护栏可主动干预,防止代理越权或产生错误行为。 模拟与评估工具(Simulations & Graders):上线前可对代理进行大规模测试,模拟常见请求、边缘案例和高风险场景,并自动评估是否达成正确结果、是否遵循策略、是否正确使用工具、是否在需要时升级。 Codex 驱动的持续改进:生产环境中...
NTT DATA 集团借助 Codex 将事故分析缩短至 30 分钟
Created2026-07-22|技术动态
事件概述2026 年 7 月 22 日,OpenAI 官方发布案例:日本 IT 服务巨头 NTT DATA 集团通过全员部署 ChatGPT Enterprise 和 OpenAI Codex,实现了事故分析从 5 名工程师耗时 3 天缩短到 30 分钟的突破性效率提升。目前已有约 9,000 名员工(含技术和非技术角色)活跃使用 Codex。 关键技术点 分层推进策略:先全员普及 ChatGPT Enterprise(满意度超 96%,超 95% 员工报告生产力提升),建立 AI 协作习惯,再引入 Codex 完成明确定义的任务。 Codex 的 Agent 能力:不仅仅是编码辅助,Codex 能独立调查、执行、测试和修订指令。案例中,Codex 自动化了复杂系统的事故分析全流程。 Client Zero 方法:NTT DATA 将自身作为首个客户,鼓励内部员工在实际工作中测试 AI 应用,从而发现 Codex 在非工程场景的潜力。 安全与治理:OpenAI 卓越中心(CoE)制定安全指南,明确数据使用范围、系统连接规则、沙箱模式、自动化程度及人工审核节点,确保企业级扩展。 非...
1…345…11
avatar
Yunkai Huang
嗨,这里是云开~
Articles
107
Tags
312
Categories
5
Follow Me
Announcement
This is my Blog
Recent Posts
两项 API 设置让 ARC-AGI-3 分数翻三倍——OpenAI 深度解析2026-07-29
OpenAI 面向学术研究者推出 ChatGPT,加速科学发现2026-07-29
Beyond Memory: LLM Agent 的异构协作知识工作模板2026-07-29
模型无需明确后果也能“伪装对齐”?最新研究揭示AI安全新挑战2026-07-29
GPT-5.6:前沿智能与前沿效率的融合2026-07-29
Categories
  • [技术动态]2
  • 技术动态102
  • 技术探索1
    • 随笔1
  • 随笔1
Tags
Place Recognition UAV Knowledge Management Red-Teaming OpenAI Codex Software Quality Narrative Generation MLP ROI Quantum Computing Time-Series 反思 Deep Learning Social Epistemology Graph Neural Network 形式化验证 Cancer Genomics 媒体技术 经济研究 模拟器 Optimization Robustness 隐私保护 Claude Code Football Teens 大语言模型 Multi-Agent Systems ChatGPT PostgreSQL 扩散模型 Drug Discovery Safety Business Leadership Adversarial Resilience Rust 农业韧性 Debate Interpretability
Archives
  • July 2026 104
  • February 2026 3
Website Info
Article Count :
107
Unique Visitors :
Page Views :
Last Update :
© 2025 - 2026 By Yunkai HuangFramework Hexo 8.1.1|Theme Butterfly 5.5.4