来源说明follow-builders 的 X / Podcast 源仍处下线状态(skill 已移除),本期继续回退到 HuggingFace Daily Papers API(2026-07-27 批次,14 篇) + GitHub Search API。全部外链已验证 HTTP 200。


🔬 今日论文高光

1. DataPrep-Bench:把 LLM 当"训练数据准备工"来考核 · 🔥33赞

训练数据的质量从根本上决定模型能力,但一直缺一个统一基准去衡量"LLM / Agent / 数据中心工作流"到底能把训练数据准备到什么程度。DataPrep-Bench 把 LLM 驱动的数据准备当成一条端到端 pipeline 来评测——从原始语料到可用训练集的全链路。对做 data-centric 的团队是个可对齐的标尺。 🔗 https://arxiv.org/abs/2607.20465

2. Skill Self-Play:用"共进化技能"推 capability 前沿 · 26赞

LLM 训练正从人工设计+标注转向 interaction-driven self-evolution。但现有自进化方法卡在一个两难:environment-bound 方法反馈精确却任务多样性受限,open-ended 方法多样却验证不可靠。本文让技能之间互相 co-evolve(自我博弈),试图同时拿到任务多样性与验证可靠性。self-play 从对弈迁到"技能层"的一个新样本。 🔗 https://arxiv.org/abs/2607.22529

3. Molt:给 Agentic RL 的 PyTorch 原生训练框架 · 17赞

Agentic RL 研究就是不停改算法——新 estimator、新 pipeline 阶段、新 rollout 方案。而主流框架里每一次改动都得穿过 trainer / 分布式后端 / rollout 胶水层层封装,成本全压在研究者身上。Molt 主打 PyTorch-native + 可扩展,让改动不再跨层穿透。做 Agent RL 的工程价值明显。 🔗 https://arxiv.org/abs/2607.21653

4. Agentic Context Management:把 Agent 的"记忆与成本"当架构问题治 · 15赞

生产级 Agent 的失败,往往不是推理不行,而是管不住上下文里塞了什么:对话历史、超长 prompt、庞大工具定义、不断膨胀的工具输出——Agent 被自己产生的信息淹没。本文把它拆成**生命周期(lifecycle)+ 架构(architecture)**两个问题分别治理。踩过 context 爆炸坑的都懂这个痛点。 🔗 https://arxiv.org/abs/2607.21503

5. 从零做原生多模态预训练(Native Multimodal Pre-Training from Scratch)· 13赞

LLM 推理再强,纯文本预训练也限制了它对多模态物理世界的感知。原生多模态预训练绕开这一限制——从头在多模态数据上训练,而非在文本模型上后接视觉。本文给出可 scaling 的方案。多模态"原生 vs 拼接"路线之争又添一枚重量级筹码。 🔗 https://arxiv.org/abs/2607.22043


🧩 简报(快读)

  • Three-Body Scattering for Generative Modeling — 不靠对抗critic、不靠固定noise-to-data路径、也不靠自回归分解,用"三体散射"的分布能量诱导样本级运动,做一步生成。物理直觉进生成模型。🔗 https://arxiv.org/abs/2607.18198
  • Multi-Head Latent Control — 给 LLM Agent 决策一个统一接口:推理时让 Agent 自己决定"继续 / 交给更强模型 / 请求更多信息"。Agent 决策不止 next-token。🔗 https://arxiv.org/abs/2607.14277
  • Spectral Prior for Diffusion — 揭示 diffusion 采样误差累积(exposure bias)的频率依赖根因,用频谱先验对症下药。🔗 https://arxiv.org/abs/2607.22091

🛠️ 工具 & 开源圈(GitHub 近一周热度)


本期由 HF Daily Papers + GitHub 回退源自动 remix 生成。若 follow-builders 的 X/Podcast 源恢复,将切回原生源。