TAPR:任务感知提示重写器如何提升 LLM 性能
论文概述大型语言模型(LLM)的实际效果高度依赖提示词(Prompt)的质量,而如何写出“恰到好处”的提示词,往往让非专家用户感到困扰。针对这一痛点,来自 Oliver Savolainen、Emanuele Bastianelli 和 Hosein Azarbonyad 的研究团队在 arXiv 上发布了一篇新论文,提出 TAPR(Task-Aware Prompt Rewriter,任务感知提示重写器)。 TAPR 是一个专门用来“重写提示词”的模型:它接收用户原始输入,将其转化为面向具体任务、更易被 LLM 理解与执行的优化提示词,从而直接提升下游任务表现。论文发表于 arXiv:2607.28657,提交时间为 2026 年 7 月 17 日,目前代码已在 GitHub 开源。 关键技术点 提示重写模型:TAPR 本身是一个经过微调的生成模型,基础模型为 Phi-4-mini-instruct。它不直接回答问题,而是把精力放在生成“更好的问题/指令”上。 强化学习训练:训练过程使用 GRPO(Group Relative Policy Optimization)...
本体引导与去重感知:从异构文档到知识图谱的生产级提取层
事件概述大语言模型(LLM)从非结构化文档中抽取实体和关系时,表面上流畅,实则存在严重的一致性问题:类型词汇在不同文档间割裂、同一人物以多种姓名变体出现、关系重复抽取,以及同名不同人的实体被静默合并。这些问题在知识图谱构建中尤其致命——知识图谱的价值恰恰依赖于准确、一致、可信的实体与关系。 近期,一篇题为 An Ontology-Guided, Deduplication-Aware Extraction Layer for Knowledge Graph Construction from Heterogeneous Documents 的论文(arXiv:2607.28662)提出了一套生产级提取层系统,将实时文档流转换为与正式本体对齐的、经过验证的知识图谱。该系统由 Vaibhav Dangaich、Kevin Lewis 和 Kundeshwar Pundalik 共同完成,于 2026 年 7 月 22 日提交至 arXiv 的 cs.AI 分类。 关键技术点1. 系统架构与文档处理链路系统从 Kafka 消费文档元数据,并通过针对 PDF、电子表格、Office 文档...
GenCDSR:混合分词与串并行解码,重塑跨域序列推荐
事件/论文概述跨域序列推荐(Cross-Domain Sequential Recommendation, CDSR)一直是推荐系统领域的重要研究方向,其核心目标是在多个业务域之间建模用户动态的兴趣迁移与行为序列模式。传统 CDSR 方法通常依赖复杂的特征工程或专门的序列模型,而随着生成式推荐(Generative Recommendation, GR)范式的兴起,业界开始尝试将推荐任务视为一个自回归生成问题:先从物品语义中学习语义标识符(Semantic Identifiers, SIDs),再通过序列生成的方式来预测用户下一个可能交互的物品。 然而,现有生成式推荐方法在实际落地中普遍面临两大痛点: 分词阶段忽略跨域协同相关性:现有方法在构建 token 时,往往只关注物品本身的语义信息,没有充分利用跨域用户行为中隐含的协同过滤信号,导致生成的 SID 难以刻画跨域共性。 解码阶段推理效率低下:为了追求生成质量,常见解码策略(如 beam search)计算开销巨大,严重制约了生成式推荐在实时推荐场景中的部署。 针对上述问题,来自澳大利亚莫纳什大学、中国科学技术大...
OpenAI 推出 ChatGPT Work 与 Codex 教育插件:让教学与学习进入 Agent 时代
OpenAI 推出 ChatGPT Work 与 Codex 教育插件:让教学与学习进入 Agent 时代 原文链接:New ways to learn and teach with ChatGPT Work and Codex | OpenAI News,2026-08-04 事件概述2026 年 8 月 4 日,OpenAI 发布了一篇题为《New ways to learn and teach with ChatGPT Work and Codex》的官方公告,宣布推出三个专门为 K-12 教师、大学教育者和大学生设计的新教育插件(plugins)。这些插件基于 ChatGPT Work 和 Codex 构建,旨在帮助教育场景中的用户利用 Agentic AI 能力,在课程材料与个人上下文中完成学习、教学、研究和创作任务。 据原文介绍,这些插件可通过 ChatGPT Edu 以及 ChatGPT for Teachers 学区部署渠道获得。OpenAI 强调,其教育工作遵循的核心原则是:AI 应支持学习,而不是走捷径;最好的学习体验应始终由教育者和学生掌控。 关键技术点1...
如何用六个月构建响应式语音 AI 的实时系统
如何用六个月构建响应式语音 AI 的实时系统事件/产品概述OpenAI 于 2026 年 8 月发布了第三代语音系统 GPT-Live,旨在实现与 AI 的连续语音交互。与传统的回合制语音系统不同,GPT-Live 采用“无轮次”语音模型和低延迟架构,让对话更即时、更自然。该系统的核心能力包括:全双工语音模型(可同时听和说),以及在需要深度推理或工具调用时无缝切换至 GPT-5.5 等前沿模型,而不会打断对话流。OpenAI 工程师 Justin Uberti 和 Zahan Malkani 在官方博客中详细介绍了这套系统从架构设计到工程落地的全过程,开发周期仅为六个月。 关键技术点1. 从回合制转向流式处理传统语音 AI 架构继承自文本 LLM 的回合制模式,每一轮对话被看作一个离散的音频块。级联系统中,语音识别(STT)、大语言模型(LLM)和语音合成(TTS)依次串行执行,不仅延迟高,还会丢失语调、节奏等副语言信息。后来的语音到语音(speech-to-speech)模型虽然直接处理音频,但仍然依赖“回合检测器”(turn detector)来决定何时开始推理,本...
LLM Framework for Discovering Major Mathematical Conjectures: AI 寻找下一个黎曼猜想
事件概述2026 年 8 月,一篇来自 arXiv 的论文提出了一个基于大语言模型(LLM)的框架,用于系统性地发现重大数学猜想,目标直指“下一个黎曼猜想”。该论文由 Alizer Wong、Zixin Zeng 等八位作者共同完成,于 2026 年 4 月 19 日提交,归类于计算机科学的人工智能子领域(cs.AI)。 论文指出,当前重大数学猜想的提出仍然高度依赖专家直觉,缺少一种统一的方法来系统生成和验证具有实质数学潜力的猜想。为此,作者设计了一个三阶段流水线,将自然语言表述的候选猜想逐步转化为经过形式化验证的数学命题,并在 20 个候选猜想上进行了实验验证。 关键技术点该框架的核心是一个三阶段流水线: 区域搜索(Region Search):从显式的局部证据模块出发,在数学空间中搜索可能存在有价值猜想的具体区域。这一阶段不直接生成完整猜想,而是利用局部证据缩小搜索范围,为后续生成提供候选“区域”。 反思性验证(Reflective Validation):对搜索到的候选猜想进行多维度评估,包括: 基础性(Foundationality):该猜想是否扎根于数学的基础结构...
OpenClaw 与 Ollama 的 Agentic AI 架构:迈向完全自主与可扩展的 AI Agent 系统
论文概述2026 年 8 月,arXiv 上发布了一篇题为 OpenClaw and Ollama in Agentic AI: Toward Fully Autonomous and Scalable AI Agent Systems 的论文(arXiv:2607.28629),作者是 Konstantinos I. Roumeliotis 与 Ranjan Sapkota。论文指出,当前 AI 领域正经历从“反应式大语言模型(LLM)”向“持久化、可执行操作的系统”的快速转型,但业界对 Agentic AI 的架构理解仍然不足,尤其是在推理(Inference)、编排(Orchestration)与执行(Execution)三层如何分离与协作的问题上,缺乏统一的设计与评估框架。 针对这一空白,论文提出了一套完整的分层式 Agentic AI 架构,并以 OpenClaw + Ollama 组合作为全栈式系统进行实证分析:其中 Ollama 承担 LLM 推理层,OpenClaw 负责 Agent 运行时编排,将推理、工具调用与动作执行整合起来。原型验证结果显示,持久记忆、工具...
ThinkReset:面向有界上下文长时推理的可学习中间接口构建
论文概述大型语言模型的长链思维(Long Chain-of-Thought)推理在复杂问题上表现出色,但随之而来的是冗余累积、上下文溢出和错误锚定等问题。来自 arXiv 的最新论文《ThinkReset: Learnable Intermediate Interface Construction for Bounded-Context Long-Horizon Reasoning》提出了一种新的视角:在有界上下文窗口的约束下,真正的瓶颈既不是轨迹压缩,也不是测试时的计算控制,而是缺少一种可复用的中间接口(Reusable Intermediate Interface),来替代已被丢弃的历史信息并支撑后续求解。 该论文由 Fei Ding、Yongkang Zhang、Runhao Liu、Yuhao Liao、Zijian Zeng 共同撰写,于 2026 年 5 月 26 日提交至 arXiv,归属于 cs.AI、cs.CL 和 cs.LG 方向。论文提出了一种名为 ThinkReset 的文本空间实现方法,通过**接口写回(interface writeback)与重置(r...
用 AI 评审 AI 科学家:首个自主科研生成系统的多模型自动化评测基准
事件/论文概述2026 年 8 月,一篇来自 arXiv 的论文《Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems Using Automated Multi-Model Review》引起了 AI 科研社区的广泛关注。 该论文由 Vaibhava Lakshmi Ravideshik 和 Mayank Kejriwal 撰写,针对当前 AI Scientist 系统(能够自主进行科学研究的 AI 系统)缺乏统一质量评估标准的问题,提出了一套基于前沿大语言模型的自动化同行评审协议,并首次建立了可量化的基准评测框架。 研究团队选取了四个主流的 AI Scientist 框架——Sakana AI(v1 和 v2)、CycleResearcher 和 Data-to-Paper,在由商业自主 AI 科学家公司 FARS 发布的 15 个研究提案上分别运行,最终生成 60 篇论文,并与 15 篇 FARS 基准论文一起接受评审。三位独立的 ...
Shitty:一个名字随意但速度惊人的终端模拟器
事件概述Hacker News 上出现了一个名为 “Shitty” 的开源终端模拟器项目,标题是 “Show HN: Shitty – fast terminal. Memory-unsafe and faster than yours”,直译为“快速终端。内存不安全且比你快”。作者在 GitHub 上将其描述为“一个名字很蠢的严肃终端模拟器”。该项目主打低延迟、快速启动和可预测的资源使用,并且声称在吞吐量性能上超过了 Alacritty、Kitty 和 Ghostty 等知名终端。 尽管名字带有自嘲意味,仓库代码结构完整,包含大量测试(*_ut.cpp)、模糊测试(main_fuzz.cpp)以及持续集成配置,显然是一个认真开发的项目。发布时在 HN 上获得了 12 个点赞、0 条评论(原文未说明更多社区反馈)。 关键技术点Shitty 的核心设计理念是:将终端状态保存在 CPU 上,使用原生计算后端进行渲染。具体来说: 渲染后端:Linux 使用 Vulkan,macOS 使用 Metal,均通过 GPU 进行单元格渲染,而不是依赖传统的 CPU 绘制。 终端状态管理:将终...
