📌 本期说明:follow-builders 的 X(推文)/ Podcast 抓取源本期不可用,日报以公开可验证来源(GitHub Trending daily、HuggingFace Daily Papers 2026-06-26;HF 2026-06-27 周末停更暂未发布)为主线 remix。featured 链接已逐条抽查 HTTP 200。
🔥 今日高光
「会动手」开始动真格——In-Context World Modeling 让 VLA 机器人换视角、换形态也不用重训 昨天的关键词是「训得稳」,今天最值得 builder 抄的转向了「真能泛化地动手」。In-Context World Modeling(ICWM) 戳的痛点非常具体:现在的 VLA(Vision-Language-Action) 模型之所以一换相机角度、一换机器人本体就崩,是因为它们只吃「当前观测 + 语言指令」,把『系统配置』这个变量直接无视了——等于默认了训练时见过的那套执行环境永远不变,于是每进一个新环境都得做数据密集的重新微调。ICWM 的解法是把「系统辨识(system identification)」当成一等公民:让模型在上下文里就把『我现在是什么相机、什么本体、什么布局』推断出来,再据此预测世界如何响应动作。对做具身 / 机器人 agent 的人来说,这条意味着——「换个环境就要重训」这道成本墙,正在被『in-context 适配』凿开。这和上周「agent = 团队 × 技能库 × 工具链」的工程范式遥相呼应:模型层也在补『免微调适配』这块拼图。 🔗 https://huggingface.co/papers/2606.26025
「看屏幕」还是「写命令」?——440 个任务的对照基准,第一次把 GUI vs CLI 摆上同一张考卷 所有做 computer-use agent 的人都吵过一个问题:到底该让 agent 像人一样点屏幕(GUI),还是像工程师一样调命令 / 技能(CLI / skill-mediated)?过去这场争论一直是「关公战秦琼」——因为两边用的任务、初始状态、验证器、可执行动作根本不一样,没法公平比。这篇 《GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents》 干了件硬活:造了一个 440 个桌面任务、横跨 18 个应用、12 类工作流的「执行层对照基准」,让屏幕派和命令派拿到完全相同的目标、状态和终态验证器,各自只能用自己模态原生的动作。它要回答的不是「谁更聪明」,而是**「在执行这一层,看屏幕和写命令各自卡在哪」**。对正在选型 computer-use 架构的团队,这是今天最有决策价值的一篇——它把『要不要给 agent 配 skill / CLI 通道』从拍脑袋变成了可测量的工程问题。 🔗 https://huggingface.co/papers/2606.24551
中文 agent 圈今天集体炸场——ai-berkshire 把巴菲特做成多 Agent,ppt-master 把文档变可编辑 PPTX 今天 GitHub 趋势榜最扎眼的信号不在硅谷,而在中文社区——罕见地同日多条上榜。最有「范式感」的是 xbtlin/ai-berkshire(⭐3,802,单日 +686):定位是*「AI 时代的伯克希尔——基于 Claude Code 的价值投资研究框架,把巴菲特 / 芒格 / 段永平 / 李录四大师方法论 + 多 Agent 并行研究」串成一套可跑的投研流水线,是「把领域方法论沉淀成 agent 角色分工」的中文代表作。紧随其后的 hugohe3/ppt-master(⭐32,851,+589)解决的是另一个高频刚需——「从任意文档生成一份真正可编辑的 PowerPoint,原生形状、原生文本,而不是导出一张张图」*。再加上 HKUDS/Vibe-Trading(⭐13,569,个人交易 agent)和常青树 NanmiCoder/MediaCrawler(⭐53,686,多平台爬虫)——中文开发者正在把 agent 往「投研、办公、交易、数据」这些真实生产场景里塞,且开始拿到全球榜单的关注度。 🔗 https://github.com/xbtlin/ai-berkshire 🔗 https://github.com/hugohe3/ppt-master
📄 论文速递(HuggingFace Daily Papers · 2026-06-26 批次)
HF 2026-06-27 日报因周末停更暂未发布,本期选取 2026-06-26 批次中昨日未覆盖、且排名更靠前的新条目,主线从「agent 训练」扩散到 世界模型 / 具身、统一生成、推理加速、computer-use 评测。整体基调:研究重心正从「让 agent 思考」外延到「让模型真正会动手、会生成、跑得更快」。
DanceOPD: On-Policy Generative Field Distillation(63 赞 · 全场最高) 现代图像生成想要「一个模型通吃」——文生图(T2I)、局部编辑、全局编辑——但这几种能力天生打架:一加编辑能力,T2I 就退化;全局和局部编辑又互相干扰。DanceOPD 用on-policy 生成场蒸馏把这几种冲突的能力捏合到一个模型里。做统一生成 / 图像编辑底座的团队今日必读。 🔗 https://huggingface.co/papers/2606.27377
In-Context World Modeling for Robotic Control(42 赞) VLA 模型换视角、换本体就失灵,根因是只吃当前观测、把系统配置当常量。ICWM 把「系统辨识」塞进上下文,让模型免微调地适配新相机 / 新形态 / 新布局。做具身 agent / 机器人的人值得重点跟。 🔗 https://huggingface.co/papers/2606.26025
ViQ: Text-Aligned Visual Quantized Representations at Any Resolution(37 赞) 统一文本与视觉表示一直卡在「离散化必丢信息」:重建导向的表示缺语义,语义强的特征又丢细节。ViQ 提出文本对齐的视觉量化表示,目标是在任意分辨率下同时保住低层细节与高层语义。做多模态统一建模 / tokenizer 的好参考。 🔗 https://huggingface.co/papers/2606.27313
JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting(27 赞) 投机解码(speculative decoding)想靠加大草稿预算提速,却撞上「接受率—草稿开销」的天花板,根因是 head-based 方法陷入「因果性 vs 效率」两难。JetSpec 用并行树状草稿去突破这个 scaling 上限。做推理加速 / 自托管 LLM 提速的人值得对照。 🔗 https://huggingface.co/papers/2606.18394
GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents(25 赞) 用 440 个桌面任务 / 18 应用 / 12 类工作流的对照基准,让屏幕派(GUI)和命令派(CLI/skill)在完全相同的目标、状态、验证器下同台竞技,专测「执行层」各自卡在哪。做 computer-use agent 选型的决策级参考。 🔗 https://huggingface.co/papers/2606.24551
📈 GitHub Trending(daily)
今日趋势榜两条主线:「给 agent 配生产体系」继续加固(design.md / Cognee / OpenSpec / gstack),以及中文 agent 生态集体上榜(ai-berkshire / ppt-master / Vibe-Trading / MediaCrawler)。
garrytan/gstack — ⭐117,025(+674 today)· TypeScript 复刻 Garry Tan 的 Claude Code 配置:23 个有主张的工具,扮演 CEO/设计师/工程经理/发布经理/文档工程师/QA 一支虚拟团队。突破 11.7 万⭐,趋势王者继续在位。 🔗 https://github.com/garrytan/gstack
google-labs-code/design.md — ⭐22,094(+1,542 today)· TypeScript 定义 DESIGN.md 规范,给 coding agent 一份持久、结构化的视觉识别 / 设计系统理解,让 agent 改 UI 时「不失忆」。Google 官方实验室出品,连续第二天霸榜级猛涨(昨日 +2,319)。 🔗 https://github.com/google-labs-code/design.md
topoteretes/cognee — ⭐23,729(+729 today)· Python 「面向 agent 的开源 AI 记忆平台」——给 AI agent 配持久化记忆。和这两天「agent 记忆该被工程化」的论文主线高度呼应,把『记忆』从论文话题做成了可装的标准件。 🔗 https://github.com/topoteretes/cognee
JCodesMore/ai-website-cloner-template — ⭐21,881(+750 today)· TypeScript *「一条命令用 AI coding agent 克隆任意网站」*的模板。延续「把复杂工程任务收敛成一句指令」的 agent 工具化趋势。 🔗 https://github.com/JCodesMore/ai-website-cloner-template
Fission-AI/OpenSpec — ⭐56,992(+167 today)· TypeScript 面向 AI coding 助手的**规约驱动开发(Spec-Driven Development, SDD)**框架。和 design.md 同属一条暗线——给 agent 喂「规范」而非「即兴指令」。 🔗 https://github.com/Fission-AI/OpenSpec
xbtlin/ai-berkshire — ⭐3,802(+686 today)· Python · 🇨🇳 「AI 时代的伯克希尔」:基于 Claude Code 的价值投资研究框架,把巴菲特 / 芒格 / 段永平 / 李录方法论 + 多 Agent 并行研究串成投研流水线。中文「方法论即 agent 角色」的代表作。 🔗 https://github.com/xbtlin/ai-berkshire
hugohe3/ppt-master — ⭐32,851(+589 today)· Python · 🇨🇳 从任意文档生成真正可编辑的 PowerPoint:原生形状、原生文本,而非图片堆叠。直击「AI 出 PPT 不能改」的老痛点。 🔗 https://github.com/hugohe3/ppt-master
HKUDS/Vibe-Trading — ⭐13,569 · Python · 🇨🇳 「Vibe-Trading:你的个人交易 agent」,港大数据智能实验室出品。把 agent 推进到个人交易决策场景。 🔗 https://github.com/HKUDS/Vibe-Trading
NanmiCoder/MediaCrawler — ⭐53,686 · Python · 🇨🇳 小红书 / 抖音 / 快手 / B 站 / 微博 / 百度贴吧多平台爬虫常青树,是中文圈做「数据侧」的高频基建。 🔗 https://github.com/NanmiCoder/MediaCrawler
🧭 一句话收尾
把今天连起来看:昨天大家在卷「怎么把 agent 训稳、验准」,今天战线明显往两端拉——上游补「让模型免微调地会动手、把打架的生成能力捏成一个」(ICWM / DanceOPD),下游争「computer-use agent 该看屏幕还是写命令」(GUI vs CLI 440 任务对照);而工程落地这一层,中文社区正第一次以「投研 / 办公 / 交易」这类真实生产场景,集体挤进全球趋势榜。 主线没变:真正的护城河不在换更强的模型,而在你给 agent 沉淀了什么角色、规范、记忆与执行通道。