⚠️ 本期说明:follow-builders 的 X / Podcast 源在本次抓取窗口仍不可用(脚本未部署),故本期继续回退到 HuggingFace Daily Papers API + GitHub Search API 作为可验证来源。所有条目均来自结构化接口,链接已抽查 HTTP 200,不补写无法核实的内容。专业术语保留英文,每条附原文链接。

🔥 今日高光

  1. VLA 微调后还「懂常识」吗?—— 用动作作答的评测协议:Act2Answer 把 VLM 知识 benchmark 改造成「用一个物体摆放动作来选答案」的桌面 episode,得到动作接地的成功率,剥离低层控制的干扰,直指 VLA 微调后「知识流失 vs 泛化差」的混淆问题。
  2. 机器人技能可以「自己发现并沉淀」:ASPIRE 以 code-as-policy 范式自主编写/修复机器人控制程序,在开放式闭环里做失败诊断与修复,把经验滚成可跨任务/仿真/真机复用的技能库——与「Skills 成为 agent 操作层」的趋势在具身侧汇合。
  3. 扩散式投机解码开始「按样本自适应」:BlockPilot 指出固定 block size 的假设是次优的——最优块大小因输入而异且存在局部结构,转而做实例自适应策略学习,在无损加速前提下把扩散 speculative decoding 再往前推。
  4. 流式视频生成的「服务经济学」被单列:TurboServe 面向「用户与长会话逐块生成视频」这一新型负载,攻克会话时长异构与用户需求时序异构两大调度难题,是首个把 streaming video generation 当作正经 serving workload 来做的系统。
  5. GitHub 侧「agent 撞进现实」:自主红队 meta-harness T3MP3ST(1.2k⭐)、去中心化 GPU 算力网络客户端 Talos(655⭐)、以及本地推理知识库 local-llm 与省钱技能 token-diet 同时上榜——安全、算力、成本三条现实约束被 agent 生态正面接管。

数据概览:HF Daily Papers 精选 8 篇(2026-07-01 / 07-02 批次,去重后取未收录条目)· GitHub 新增热门仓库 6+3 组 · X builders 0(源不可用)· podcasts 0(源不可用)。

说明:HuggingFace 07-04 / 07-05 两个批次在抓取时尚未发布(周末停更),故本期从 07-01 / 07-02 批次中挑选此前日报未收录的高票论文,避免与 07-05 日报重复。


📄 论文速递

来源:HuggingFace Daily Papers(2026-07-01 / 07-02 批次),按社区 upvotes 排序、并剔除已在近两期日报出现过的条目。

BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding(73 up)

投机解码用轻量 draft 模型并行产出候选 token、再由目标模型验证以实现无损加速;扩散式方案更靠 block-level diffusion 一次前向出多 token 达到 SOTA。本文指出「固定块大小 + 全局统一策略」是次优的——最优块大小逐样本变化且呈现清晰局部结构,遂提出实例自适应的策略学习来动态决定解码策略。

🔗 原文:https://huggingface.co/papers/2606.31315

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models(69 up)

具身 VLA 通常由强 VLM 在机器人数据上微调而来,但微调后到底保留了多少常识与事实知识并不清楚。作者提出 Act2Answer:把 VLM 知识 benchmark 改造成「一次物体摆放动作选答案」的短 episode,得到动作接地的成功率,减少低层控制混淆,专门量化 VLA 的知识保真度。

🔗 原文:https://huggingface.co/papers/2606.19297

ASPIRE: Agentic Skills Discovery for Robotics(18 up)

传统机器人编程要同时处理多模态感知、接触动力学与各种执行失败。ASPIRE 用 code-as-policy 范式自主编写并迭代精炼机器人控制程序,在开放式闭环里靠细粒度多模态 trace 做失败诊断与修复合成,并把经验沉淀成跨任务/仿真/真机/形态可复用的技能库

🔗 原文:https://huggingface.co/papers/2607.00272

TurboServe: Serving Streaming Video Generation Efficiently and Economically(28 up)

流式视频生成是一种新兴 serving 负载:用户与长会话交互、视频逐块渐进产出。它既不同于离线视频生成、也不同于典型 LLM serving——必须跨活跃/空闲期保存会话状态、反复调度、并在紧延迟目标下交付每一块。TurboServe 直面「会话时长异构」与「用户需求时序异构」两大挑战,是首个面向该负载的服务系统。

🔗 原文:https://huggingface.co/papers/2606.19271

Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views(49 up)

「场景是通过其中的物体被理解的,而非组成它们的图元。」本文提出前馈框架,直接从无位姿多视图图像把场景分解为实例结构化的 3D token 组:每组用一个 instance token 抓实体身份、配 anchor token 编码局部几何与外观,解码为一组 3D Gaussians——让重建/分割/操作都从物体级单元自然导出。

🔗 原文:https://huggingface.co/papers/2606.29513

Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning(22 up)

MLLM 常被「语言空间瓶颈」所限,把复杂视觉推理压进离散 token 而丢失感知细节。连续潜空间推理是有希望的替代,但存在严重的 train-inference 失配:训练期后验能利用「答案依赖的捷径」。本文提出非对称互变分学习来缓解先验模仿一个测试期不可得信息的后验所导致的性能崩塌。

🔗 原文:https://huggingface.co/papers/2607.00461

CausalMix: Data Mixture as Causal Inference for Language Model Training(17 up)

数据混合权重直接决定 LLM 性能,但现有 proxy-model 方法假设数据分布静态,一旦数据池变化就要从头重训、难以随规模无缝扩展。CausalMix 把混合优化建模为因果推断:以数据池统计特征为协变量、以领域混合为处理(treatment),基于 512 次 Qwen2.5-0.5B 运行拟合因果模型,从而在数据池漂移时仍可迁移。

🔗 原文:https://huggingface.co/papers/2607.01104

AutoTrainess: Teaching Language Models to Improve Language Models Autonomously(14 up)

自主 post-training 不只是写代码:agent 需反复规划迭代、构造对齐 benchmark 的数据、跑稳定训练、评估 checkpoint、并跨数小时保存实验态。AutoTrainess 把这些操作暴露为一套 agent-computer 接口仓库(规划/数据准备/训练/评估/日志),而非把 agent 丢进原始 CLI 里凭欠约束的动作空间摸索——让「模型训模型」更可控。

🔗 原文:https://huggingface.co/papers/2606.31551


🛠️ 新工具 / 项目

来源:GitHub Search API(created > 2026-06-27,按 stars 排序),已剔除明显 SEO 刷量与代币关联仓库,且不与 07-05 日报重复。

elder-plinius/T3MP3ST ⭐1.2k · TypeScript

自主红队平台:一个多 agent 攻击性安全 meta-harness。把「offensive-security」流程交给多智能体编排——AI 安全攻防进入「agent vs agent」的自动化阶段,是本日 star 最高的新仓。

🔗 https://github.com/elder-plinius/T3MP3ST

jmerelnyc/Talos ⭐655 · Python

去中心化 GPU 算力网络的 worker 客户端:绑定 Talos 账户、通过 WebSocket 承接开放模型的推理任务、上报在线时长换取收益。把闲置显卡接入分布式推理市场的一种实现。

🔗 https://github.com/jmerelnyc/Talos

fancydirty/mediary-scout ⭐955 · TypeScript

agent 驱动的云盘媒体库:对接 115 / 夸克 / 光鸭网盘,让 agent 帮你整理和检索云端媒体资源——把「网盘刮削 + 智能整理」做成 agent 工作流。

🔗 https://github.com/fancydirty/mediary-scout

jamesob/local-llm ⭐863 · Shell

「关于本地跑 LLM 我所知道的一切」——一份实战向本地推理知识库,从硬件选型到量化与部署,适合想脱离 API 依赖的开发者。(star 较昨日继续攀升)

🔗 https://github.com/jamesob/local-llm

Kulaxyz/token-diet ⭐564 · Shell

常驻的省 token 技能:面向 Claude Code / Codex / Cursor / Windsurf / Cline 等 coding agent,号称平均降低 ~31% 账单且不损正确性——与「skills 作为 agent 操作层」的工程化趋势同频。

🔗 https://github.com/Kulaxyz/token-diet

uzairansaruzi/hermex ⭐601 · Swift

给你的 Hermes agent 配一个原生 iPhone App——把个人 agent 搬上手机端的一次尝试,呼应移动端 agent 客户端的持续热度。

🔗 https://github.com/uzairansaruzi/hermex


🇨🇳 中文圈

QwenLM/Qwen-RobotNav ⭐64 · QwenLM/Qwen-RobotManip ⭐57

阿里 Qwen 团队官方连发两个机器人仓:RobotNav(导航)与 RobotManip(操作),与今日 VLA / 机器人技能发现(ASPIRE、Act2Answer)的论文主线正面呼应——中文团队在具身智能方向的官方开源提速。

🔗 https://github.com/QwenLM/Qwen-RobotNav · https://github.com/QwenLM/Qwen-RobotManip

SuperJJ007/CSSwitch ⭐250 · Rust

一键把 Claude 一族接入国产/自有 API:DeepSeek / 通义千问 / 智谱 GLM / Kimi / MiniMax / 小米 MiMo / 硅基流动 / OpenRouter 及任意 OpenAI·Anthropic 兼容端点。降低国内用户接入门槛,昨日以来 star 继续增长。

🔗 https://github.com/SuperJJ007/CSSwitch


本期为可验证来源回退版:follow-builders X/Podcast 源不可用,内容取自 HuggingFace Daily Papers API 与 GitHub Search API 的结构化数据,全部链接已抽查 HTTP 200。观点归原作者所有。