📡 数据来源说明:follow-builders 的 X/Podcast 上游源已随 skill 移除而不可用,本期沿用既定回退方案 —— HuggingFace Daily Papers API(2026-07-17 批次,29 篇)+ GitHub Search API(近 10 天新建高星仓库)。全部外链已验证 HTTP 200。
🔥 今日高光
- LongStraw 破 2M:把 RL post-training 上下文从 256K 拉到 200 万 tokens,且固定 GPU 预算——直接补上「推理够长、训练太短」的断层。
- On-Policy 蒸馏被扒开:SEED 用自进化解稀疏奖励,另一篇 Demystifying 论文把 OPD 定性为「探索催化剂」而非能力天花板拔高器。
- 世界模型安全警报:BadWAM 证明「先想象未来再行动 = 更安全」的假设站不住脚——模型能「梦对却动错」。
- 机器人上下文暴涨 1000 倍:RoboTTT 用测试时训练把视觉运动上下文推到 8K 时间步,解锁一次性 in-context 模仿。
- 冻结小模型白嫖增益:KV-Cache Grafting 把已验证知识存成 byte-exact 状态再移植,不改一个权重就让小模型更强更便宜。
📄 论文精选(HF Daily Papers · 07-17 批次)
长上下文与训练效率
- LongStraw:固定 GPU 预算下突破 2M tokens 的长上下文 RL(↑174)。Agent 的观测、工具输出、历史决策会沿长轨迹不断累积,本文用架构级方案把 post-training 上下文推到百万级,正面解决推理/训练的上下文鸿沟。https://huggingface.co/papers/2607.14952
- KV-Cache Grafting:让冻结小模型变身「已验证知识飞轮」(↑10)。已验证知识一次性存为 byte-exact KV 状态,之后移植进新推理上下文,在锁定确定性配置下 grafted logits 与重算逐字节一致——不动权重,又强又便宜。https://huggingface.co/papers/2607.14431
On-Policy 蒸馏专题
- SEED:面向 Agentic RL 的自进化 On-Policy 蒸馏(↑85)。针对多轮交互/工具使用/环境反馈中「episode 级奖励 vs token 级策略学习」的监督鸿沟,用自进化机制补上中间决策的稠密指导。https://huggingface.co/papers/2607.14777
- Demystifying On-Policy Distillation:角色、病理与调控(↑17)。系统性研究 OPD 训练动力学,明确其本质是「探索催化剂」——用稠密 token 级指导把学生引向正确推理路径,但不会抬高能力上限。https://huggingface.co/papers/2607.13399
世界模型与机器人
- BadWAM:世界-动作模型「梦对了却动错」(↑46)。WAM 把动作生成与未来世界预测耦合,业界普遍视之为鲁棒/可解释/安全的来源;本文反证:这个「用想象未来核对动作」的安全假设并不成立。⚠️ 具身安全必读。https://huggingface.co/papers/2607.15207
- RoboTTT:机器人策略的上下文扩展(↑18)。用测试时训练把视觉运动上下文推到 8K 时间步(比 SOTA 高三个数量级)且不增推理延迟,解锁一次性 in-context 模仿等新能力。https://huggingface.co/papers/2607.15275
- From Pixels to States:把交互式世界模型重新想象为游戏引擎(↑29)。用视频生成模型作为下一代游戏引擎的数据驱动路径,探讨如何实现真正对玩家动作连贯响应的可交互世界。https://huggingface.co/papers/2607.14076
Agent 系统与视频理解
- SearchOS-V1:鲁棒的开放域信息检索 Agent 协作(↑59)。直击 Agent 在长交互历史下「搜索失败→重复死循环→浪费预算」的顽疾,面向多 Agent 协作的信息检索。https://huggingface.co/papers/2607.15257
- VideoChat3:完全开源、高效通用的视频 MLLM(↑143)。针对现有开源视频模型「难跨类型泛化 + 算力开销大」两大痛点,主打全开源 + 高效 + 通用。https://huggingface.co/papers/2607.14935
🛠️ 工具圈(GitHub 近 10 天新星)
- xai-org/grok-build(★19.8k):xAI 官方 coding agent 框架 + TUI,全屏、鼠标可交互、可扩展 harness。https://github.com/xai-org/grok-build
- stackblitz/bolt-slides(★420):用任意 agent 生成惊艳的交互式演示文稿。https://github.com/stackblitz/bolt-slides
- vshulcz/deja-vu(★374):coding agent 的记忆层——搜索、MCP recall、自动上下文、密钥脱敏。https://github.com/vshulcz/deja-vu
本期为回退源自动生成,聚焦当日 HF 高热论文的工程可用性与安全信号,已过滤纯学术增量。