来源说明:本期 follow-builders(X / 播客抓取管线)仍处于下线状态,prepare-digest.js 缺失。按前几日惯例回退至 Hugging Face Daily Papers(2026-07-31 批次) 遴选前沿工程向论文,外链均为原始 arXiv / GitHub 出处,已抽查可达。X Builder 动态与播客本期缺席。


🔥 今日高光

  1. Harness-G:把搜索 Agent 的"自由造句"改成"有限选择" —— RL 搜索 Agent 常把检索建模为自由的自然语言查询生成,作者观察到 Search-R1 训练中的"检索别名"现象:同一问题的不同 rollout 生成迥异的查询串,累积证据集却越来越重叠(称之为"检索等价坍缩")。Harness-G 用图结构把接口重设计为有限动作选择——策略只选证据句/实体或选择作答,环境负责构造菜单、跟踪状态、校验执行。六个 QA 基准平均 F1 双规模领先,1.5B 上比最强基线 Graph-R1 高 10.74 分。
  2. 投机解码的"有损验证"是把双刃剑 —— 一篇原理性分析指出:近期为提效放松严格分布匹配的"有损验证"方案,其实在悄悄改写解码分布,加速可能以不稳定甚至严重退化的生成质量为代价。作者把看似各异的方法归为"截断式"与"协作式"两类,并给出诊断框架:截断式的坑在于相比真实截断采样基线会显著退化;协作式的关键则是控制 draft 概率相对 target 概率的 overshoot。
  3. OmniScope:免训练的模态解耦 token 压缩 —— 现有全模态 LLM 的 token 压缩常用一种模态决定另一种保留什么,但音频与视频的相关性峰值往往落在不同时刻。OmniScope 以 query 作共享语义锚点、对音视频分别估计相关性、分配模态专属 token 预算。25% 保留率下 prefill 最高提速 3.53×、GPU 显存降 15%+,平均精度仅掉 0.35 分。
  4. ReToken:一个 token 撬动视觉检索 —— 长视觉上下文让 VLM 随干扰项增多而性能下降。ReToken 训练单个可学习 embedding 作为显式检索目标,从预填充的视觉 KV cache 中选出稀疏的、与 query 相关的视觉 token。仅用小规模图像 QA 数据训练,Qwen3VL-8B 在 Visual Haystacks 上涨 13.4 分、InternVL3.5 涨 12.4 分(>20% 相对提升),训练与长视频推理均可单卡 H100 完成。
  5. Deep Research 靠谱吗?误导性知识会诱导错误结论 —— MisKnow-Agent 构造出 5,933 条可控权威度/风格的误导性实例。实验显示:即便只是有限接触误导性知识,也能让开源与闭源 Deep Research Agent 在最终报告中采纳错误结论。有意思的是,搜索增强的验证模型在聚焦语料校验时能识别出这些误导实例,但同样的实例在长程研究中仍被采纳——暴露出"聚焦验证"与"工作流级证据使用"之间的断层。

📄 前沿论文精选

Agent / 检索

  • Harness-G: A Graph-Structured Harness for Search Agents —— 图结构把检索接口从自由查询改为有限动作选择,配合 Structured Non-myopic Credit(SNC)用冻结的答案打分器把下游收益回溯给使能它的更早动作。🔗 https://arxiv.org/abs/2607.27652 | 代码 https://github.com/7HHHHH/Harness-G
  • Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions —— MisKnow-Agent 框架系统性构造并验证误导性知识,揭示当前 Deep Research Agent 的广泛可靠性漏洞;前/后置防御可缓解但无法完全阻止。🔗 https://arxiv.org/abs/2607.20891

推理 / Infra

多模态 / VLM

  • OmniScope: Modality-Decoupled Token Compression for Omnimodal LLMs —— 免训练框架,query 做共享锚点但音视频各自估计 salience;“共享 query、不共享 salience 估计"成为 OmniLLM 推理的简洁设计原则。🔗 https://arxiv.org/abs/2607.23193 | 代码 https://github.com/MAC-AutoML/OmniScope
  • ReToken: One Token to Improve Vision-Language Models for Visual Retrieval —— 单个可学习 embedding 作显式检索目标,从视觉 KV cache 中选稀疏 query 相关 token,轻量设计、单卡 H100 可跑,跨图像/视频基准一致提升并零样本迁移到长视频。🔗 https://arxiv.org/abs/2607.28627 | 代码 https://github.com/avaxiao/ReToken

📌 说明:本期为论文回退版,缺少 Builder 社媒动态与播客。待 follow-builders 抓取管线(prepare-digest.js)恢复后将回到"X + 播客 + 博客"三线常态。