📡 数据来源说明:follow-builders 的 X/Podcast 上游源已随 skill 移除而不可用,本期沿用既定回退方案 —— HuggingFace Daily Papers API(2026-07-17 批次,29 篇)+ GitHub Search API(近 10 天新建高星仓库)。全部外链已验证 HTTP 200。

🔥 今日高光

  1. LongStraw 破 2M:把 RL post-training 上下文从 256K 拉到 200 万 tokens,且固定 GPU 预算——直接补上「推理够长、训练太短」的断层。
  2. On-Policy 蒸馏被扒开:SEED 用自进化解稀疏奖励,另一篇 Demystifying 论文把 OPD 定性为「探索催化剂」而非能力天花板拔高器。
  3. 世界模型安全警报:BadWAM 证明「先想象未来再行动 = 更安全」的假设站不住脚——模型能「梦对却动错」。
  4. 机器人上下文暴涨 1000 倍:RoboTTT 用测试时训练把视觉运动上下文推到 8K 时间步,解锁一次性 in-context 模仿。
  5. 冻结小模型白嫖增益:KV-Cache Grafting 把已验证知识存成 byte-exact 状态再移植,不改一个权重就让小模型更强更便宜。

📄 论文精选(HF Daily Papers · 07-17 批次)

长上下文与训练效率

  • LongStraw:固定 GPU 预算下突破 2M tokens 的长上下文 RL(↑174)。Agent 的观测、工具输出、历史决策会沿长轨迹不断累积,本文用架构级方案把 post-training 上下文推到百万级,正面解决推理/训练的上下文鸿沟。https://huggingface.co/papers/2607.14952
  • KV-Cache Grafting:让冻结小模型变身「已验证知识飞轮」(↑10)。已验证知识一次性存为 byte-exact KV 状态,之后移植进新推理上下文,在锁定确定性配置下 grafted logits 与重算逐字节一致——不动权重,又强又便宜。https://huggingface.co/papers/2607.14431

On-Policy 蒸馏专题

  • SEED:面向 Agentic RL 的自进化 On-Policy 蒸馏(↑85)。针对多轮交互/工具使用/环境反馈中「episode 级奖励 vs token 级策略学习」的监督鸿沟,用自进化机制补上中间决策的稠密指导。https://huggingface.co/papers/2607.14777
  • Demystifying On-Policy Distillation:角色、病理与调控(↑17)。系统性研究 OPD 训练动力学,明确其本质是「探索催化剂」——用稠密 token 级指导把学生引向正确推理路径,但不会抬高能力上限https://huggingface.co/papers/2607.13399

世界模型与机器人

  • BadWAM:世界-动作模型「梦对了却动错」(↑46)。WAM 把动作生成与未来世界预测耦合,业界普遍视之为鲁棒/可解释/安全的来源;本文反证:这个「用想象未来核对动作」的安全假设并不成立。⚠️ 具身安全必读。https://huggingface.co/papers/2607.15207
  • RoboTTT:机器人策略的上下文扩展(↑18)。用测试时训练把视觉运动上下文推到 8K 时间步(比 SOTA 高三个数量级)且不增推理延迟,解锁一次性 in-context 模仿等新能力。https://huggingface.co/papers/2607.15275
  • From Pixels to States:把交互式世界模型重新想象为游戏引擎(↑29)。用视频生成模型作为下一代游戏引擎的数据驱动路径,探讨如何实现真正对玩家动作连贯响应的可交互世界。https://huggingface.co/papers/2607.14076

Agent 系统与视频理解

  • SearchOS-V1:鲁棒的开放域信息检索 Agent 协作(↑59)。直击 Agent 在长交互历史下「搜索失败→重复死循环→浪费预算」的顽疾,面向多 Agent 协作的信息检索。https://huggingface.co/papers/2607.15257
  • VideoChat3:完全开源、高效通用的视频 MLLM(↑143)。针对现有开源视频模型「难跨类型泛化 + 算力开销大」两大痛点,主打全开源 + 高效 + 通用。https://huggingface.co/papers/2607.14935

🛠️ 工具圈(GitHub 近 10 天新星)


本期为回退源自动生成,聚焦当日 HF 高热论文的工程可用性与安全信号,已过滤纯学术增量。