📌 本期说明:follow-builders 的 X(推文)/ Podcast 抓取源本期不可用,日报以公开可验证来源(GitHub Trending daily、HuggingFace Daily Papers 2026-06-26)为主线 remix。featured 链接已逐条抽查 HTTP 200。

🔥 今日高光

  1. 「能动手」已经不稀奇,「训得稳」才是新战场——OPID 把技能监督直接从轨迹里蒸出来 今天 HuggingFace 日报的关键词不是「生成」,而是 agent 训练。最值得 builder 抄的一篇是 OPID(On-Policy Skill Distillation for Agentic RL)。它戳的痛点很真实:基于「最终结果」的强化学习(outcome-based RL)虽然稳,但只在轨迹末端给一个稀疏奖励,根本没法告诉 agent「中间这一步该奖励还是该惩罚」;而现有的「带技能」自蒸馏方案,又往往依赖外挂的技能记忆库或检索来的特权上下文,维护成本高、还常和当前策略的真实状态分布对不上。OPID 的解法干净利落:直接从已经跑完的 on-policy 轨迹里提取技能监督信号,给多轮交互补上 dense、token 级的指导,不再外挂记忆。对正在做 agentic RL / 多步 agent 的人来说,这是今天最具工程价值的一条——「把 agent 训稳」正在取代「让 agent 能跑」,成为真正的护城河。 🔗 https://huggingface.co/papers/2606.26790

  2. 「验证比生成更难」正式被写成论文——《The Verification Horizon》宣告 coding agent 没有银弹 和 OPID 同一天登榜、但更像一记当头棒喝的,是 《The Verification Horizon: No Silver Bullet for Coding Agent Rewards》。它把一个所有做 coding agent 的人都隐约感觉到、但很少被点破的事实摆上桌:经典直觉「验证一个解比写出一个解更容易」,在今天的 coding agent 身上正在被反转——基础模型推理越来越强、工程 harness 越来越复杂,「生成复杂候选解」早已不难,「可靠地验证它对不对」反而成了更硬的问题。论文的核心论断很犀利:我们能造的每一个 verifier,都只是人类意图的代理(proxy),永远不是意图本身;再叠加「意图天生欠定义」和「训练时优化会专挑 verifier 漏洞」两重困难,结论就是——coding agent 的 reward 不存在万能方案。这条和昨天「agent 记忆该被工程化体检」一脉相承:2026 年中的 agent 研究,正在集体从『能力』转向『怎么衡量与约束能力』。 🔗 https://huggingface.co/papers/2606.26300

  3. 「Claude Code = 一支公司」继续封神——gstack 冲到 11.6 万⭐,Google 的 design.md 单日 +2,319⭐ 工程侧今天最强的两个信号,依旧围绕「给 agent 配齐生产体系」。一是 YC 总裁 Garry Tangstack 继续霸榜,star 已来到 ⭐116,395:一句话定位是*「直接复刻 Garry Tan 本人的 Claude Code 配置——23 个有明确主张的工具,分别扮演 CEO、设计师、工程经理、发布经理、文档工程师和 QA」*。二是 Google 官方实验室design.md 单日狂揽 +2,319⭐(总 ⭐20,737):它定义了一份 DESIGN.md 规范,给 coding agent 一份持久、结构化的视觉识别 / 设计系统理解,让 agent 改 UI 时「不失忆」。两者放在一起,把过去几周的范式钉得更死了——真正的生产力不在换更强的模型,而在你给 agent 沉淀了什么样的角色分工、规范与上下文。 🔗 https://github.com/garrytan/gstack 🔗 https://github.com/google-labs-code/design.md


📄 论文速递(HuggingFace Daily Papers · 2026-06-26)

今日 HF 日报横跨三条主线:agent 的训练与监督、coding agent 的验证与稳定性、上下文驱动的多模态生成。整体基调高度一致——研究重心正在从「让 agent 有能力」转向「怎么把能力训稳、给对、验准」

  • OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning(31 赞) 从已完成的 on-policy 轨迹里直接提取技能监督,给多步 agent 补上 dense、token 级的中间指导,摆脱外挂技能记忆与特权上下文。做 agentic RL 的人今日必读。 🔗 https://huggingface.co/papers/2606.26790

  • The Verification Horizon: No Silver Bullet for Coding Agent Rewards(24 赞) 论证「验证比生成更难」已成 coding agent 的新常态:任何 verifier 都只是人类意图的代理,叠加意图欠定义 + 训练专挑漏洞,结论是 coding agent 的 reward 没有万能解。做 SWE agent / 自动评测的必看。 🔗 https://huggingface.co/papers/2606.26300

  • Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It(10 赞) 实证发现多步工具调用 RL 会「灾难性崩溃」——性能骤降、工具调用结构失效;根因竟是少数控制 token 的概率异常飙升打乱了结构化执行,而底层工具能力其实完好,只是被格式问题「遮住」了。补一套监督信号即可救回。做 tool-use / function-calling 训练的人值得对照排雷。 🔗 https://huggingface.co/papers/2606.26027

  • Running the Gauntlet(GauntletBench): Re-evaluating Agents Beyond Familiar Environments(9 赞) 指出现有 agent benchmark 多建在热门 app + 简单任务上,已被现代 agent「刷爆」、测不出短板。GauntletBench 是个 web 基准,专挑三个被忽视的维度——时间感知、图形理解、3D 推理——在五个冷门职业场景里压测 agent 的泛化。做 agent 评测体系的好参考。 🔗 https://huggingface.co/papers/2606.14397

  • Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation(31 赞) 阿里 Qwen 把「文生图」做成了 agentic 框架:用户输入只是「部分上下文」,再通过 Context-Aware Planning + Context Grounding 把 plan / reason / search / memory / feedback 串起来,逐步补齐「足够的生成上下文」。是「把 agent 思路注入生成任务」的代表样本。 🔗 https://huggingface.co/papers/2606.26907


📈 GitHub Trending(daily)

今日趋势榜的主旋律没变——agent = 团队 × 技能库 × 工具链,而且「官方下场」的味道越来越浓(Google、AWS 都在给 agent 配标准件):

  • garrytan/gstack — ⭐116,395(+919 today)· TypeScript 复刻 Garry Tan 的 Claude Code 配置:23 个有主张的工具,扮演 CEO/设计师/工程经理/发布经理/文档工程师/QA 一支虚拟团队。趋势王者继续在位。 🔗 https://github.com/garrytan/gstack

  • google-labs-code/design.md — ⭐20,737(+2,319 today,今日涨幅冠军)· TypeScript DESIGN.md 规范:给 coding agent 一份持久、结构化的设计系统理解,让 agent 改 UI 不失忆。Google 官方实验室出品。 🔗 https://github.com/google-labs-code/design.md

  • calesthio/OpenMontage — ⭐23,234(+1,674 today)· Python 「全球首个开源 agentic 视频生产系统」:12 条 pipeline、52 工具、500+ agent skills,把编码助手变成视频工作室。 🔗 https://github.com/calesthio/OpenMontage

  • aws/agent-toolkit-for-aws — ⭐1,281(+238 today)· Python AWS 官方支持的 MCP servers / skills / 插件,帮 AI agent 在 AWS 上构建。继 gstack/skills 风潮后,云厂商正式给 agent 配「官方工具箱」。 🔗 https://github.com/aws/agent-toolkit-for-aws

  • JCodesMore/ai-website-cloner-template — ⭐21,135(+1,076 today)· TypeScript 一条命令、用 AI coding agent 克隆任意网站的模板。把「截图/网页 → 代码」这件事直接做成开箱即用的 agent 工作流。 🔗 https://github.com/JCodesMore/ai-website-cloner-template


🇨🇳 中文圈(今天罕见地集体上榜)

  • xbtlin/ai-berkshire(AI 时代的伯克希尔) — ⭐2,962(+1,270 today)· Python 基于 Claude Code 的价值投资研究框架:内置巴菲特·芒格·段永平·李录四大师方法论 + 多 Agent 并行/对抗式研究。把 gstack 那套「agent 即团队」搬进投研场景,做行业研究类 agent 的人很值得抄结构。 🔗 https://github.com/xbtlin/ai-berkshire

  • Panniantong/Agent-Reach — ⭐42,062(+1,547 today)· Python 「给你的 AI agent 一双看遍全网的眼睛」:一个 CLI 读取 & 搜索 Twitter / Reddit / YouTube / GitHub / B 站 / 小红书,零 API 费用。在 follow-builders 这类「外部信息源」越来越贵/越来越封的当下,这种聚合采集层正成为 agent 的刚需基建。 🔗 https://github.com/Panniantong/Agent-Reach

  • NanmiCoder/MediaCrawler — ⭐53,276(+640 today)· Python 老牌全平台爬虫:小红书 / 抖音 / 快手 / B 站 / 微博 / 贴吧 / 知乎 的笔记与评论采集。和 Agent-Reach 一起说明:「内容数据入口」是中文 agent 生态今年最硬的一块需求。 🔗 https://github.com/NanmiCoder/MediaCrawler

  • opendatalab/MinerU — ⭐70,199(+944 today)· Python 上海 AI Lab(OpenDataLab)出品:把 PDF / Office 等复杂文档转成 LLM-ready 的 markdown/JSON,专为 agentic workflow 设计。RAG / 知识库类 agent 的高质量「数据入口」。 🔗 https://github.com/opendatalab/MinerU

  • alchaincyf/zhangxuefeng-skill(张雪峰.skill) — ⭐9,206(+220 today) 「张雪峰的认知操作系统」:把高考志愿/考研/职业规划的实战思维框架打包成一个 skill(由「女娲.skill」生成)。是中文圈「把某个领域专家的方法论封装成可加载 skill」这股潮流的又一个鲜活样本。 🔗 https://github.com/alchaincyf/zhangxuefeng-skill


📊 今日一句话总结

学术侧今天集体在啃 agent 的「内功」:怎么从轨迹里蒸出技能监督(OPID)、怎么承认 coding agent 没有万能 reward(Verification Horizon)、为什么多步工具调用 RL 会崩、agent 离开熟悉环境还行不行(GauntletBench);工程侧则继续给 agent「装备升级」——团队(gstack)、设计记忆(design.md)、视频流水线(OpenMontage)、云上工具箱(AWS)、全网采集眼(Agent-Reach)。结论很统一:能跑起来的 agent 已经不稀奇,「训得稳、给得对、验得准、喂得饱」才是 2026 下半场真正分胜负的地方。


本期来源:GitHub Trending(daily)+ HuggingFace Daily Papers(2026-06-26)。follow-builders X / Podcast 源本期不可用。featured 链接已抽查 HTTP 200。