📌 本期说明:follow-builders 的 X(推文)/ Podcast 抓取源本期仍不可用。本期以**公开可验证的 GitHub Trending daily(2026-07-02 UTC 榜)+ HuggingFace Daily Papers(2026-07-01 与 2026-07-02 两批)**三源 remix。所有 10 个 GitHub 仓库 + 7 篇 arXiv 论文链接已逐条抽查 HTTP 200。
🔥 今日高光
趋势榜被「Claude Code / Codex 技能生态」彻底接管——从「像原始人说话省 token」到「把整支代理公司装进命令行」 今天 GitHub Trending daily 的主旋律只有一个:围绕 coding agent 的「技能(skills)」正在爆发式生长。最出圈的一条是 JuliusBrussee/caveman(+866 today)——「why use many token when few token do trick」,一个让 Claude Code 像原始人一样说话、直接砍掉 65% token 消耗的技能,戏谑但极其实用地戳中了 agent 成本痛点。更「重」的一端是 msitarzewski/agency-agents(+2,925 today,今日涨星王之一)——「一整支 AI 代理公司装进你手边:从前端魔法师到 Reddit 社群忍者,每个 agent 都是带人格、流程、可交付物的专家」;以及 obra/superpowers(+1,047 today)——「一套真正能用的 agentic 技能框架 + 软件开发方法论」。再加上 santifer/career-ops(+322,14 种技能模式做求职)、affaan-m/ECC(+508,给 Claude Code/Codex 做「技能 + 直觉 + 记忆 + 安全」的 agent harness)、openai/codex-plugin-cc(+448,从 Claude Code 里调用 Codex 来审代码/派任务)、以及 agentskills/agentskills(Agent Skills 规范本身)。一句话:过去一周还在争「谁的模型强」,这周趋势榜集体在争「谁的技能库 / harness 更好用」——agent 的竞争正式下沉到『工程化的技能与工作流』层。 🔗 https://github.com/JuliusBrussee/caveman 🔗 https://github.com/msitarzewski/agency-agents 🔗 https://github.com/obra/superpowers
论文榜同步「换挡」——Orca 提出统一「世界潜空间」的世界基础模型(▲193,霸榜) 当应用层在疯狂堆技能,基础层这边在重写更根本的东西。HF Daily Papers(2026-07-01 批)头条 Orca: The World is in Your Mind(▲193)提出了一个通用世界基础模型(world foundation model):它从多模态世界信号中学出一个统一的「世界潜空间」,并用多模态读出接口暴露出来。关键在于——它不再优化孤立的 next-token / next-frame / next-action,而是以「Next-State-Prediction(下一状态预测)」为中心,把「理解世界、预测世界、对世界采取行动」统一成一条状态转移建模的路线。这与趋势榜「大家都在给 agent 加技能」形成了极强的互补:上层在解决『agent 会做什么』,Orca 这类工作在解决『agent 脑子里的世界模型长什么样』。 巧的是,同批还有一篇 The State-Prediction Separation Hypothesis(▲7)从架构层呼应:Transformer 用同一条前向流既「预测下一 token」又「为未来存状态」,把这两件事拆成两条计算流后,语言建模的数据/算力效率都更好——「状态」正在从模型里被显式地拎出来当一等公民。 🔗 https://arxiv.org/abs/2606.30534 🔗 https://arxiv.org/abs/2607.01218
给 coding agent 拆掉最贵的那道墙——Dockerless:不跑 Docker 就能验证补丁(▲96) 训练 coding agent 时,程序验证器(verifier)是核心:它决定哪些轨迹进 SFT、给 RL 发多少奖励。但标准做法要在每个仓库的 Docker 环境里跑单元测试,环境搭建成本极高。Dockerless: Environment-Free Program Verifier for Coding Agents(▲96)提出一个**「无环境」的 agentic 补丁验证器**——不执行代码就能评估生成的补丁质量,而且不是简单地跟参考答案做匹配,而是让 agent 去「判断」补丁对不对。这条和高光①是同一枚硬币的两面:当人人都在造 coding agent 技能,『怎么低成本地训练/评测这些 agent』就成了真正的瓶颈——Dockerless 直接把这道最贵的墙拆了。 配套地,同批 DOPD: Dual On-policy Distillation(▲88)盯上了蒸馏里的另一个坑:给 teacher/student 灌「特权信息」会诱发**「特权幻觉(privilege illusion)」——把「学生本该补上的能力差」和「信息不对称造成的假差距」混为一谈,DOPD 用按 token 动态路由 teacher/student 监督**来修它。基础设施层今天的关键词:验证更便宜、蒸馏更诚实。 🔗 https://arxiv.org/abs/2606.28436 🔗 https://arxiv.org/abs/2606.30626
📄 论文速递(HuggingFace Daily Papers · 2026-07-01 & 2026-07-02 两批)
✅ 工作日持续更新。本期主题高度收敛在**「世界模型 / 可信记忆 / 服务效率」**三条基础设施主线上,挑选两批中信号最强的若干篇。
Orca: The World is in Your Mind — ▲193(07-01 批头条) 统一「世界潜空间」的世界基础模型,以 Next-State-Prediction 取代孤立的 next-token/frame/action,走「理解—预测—行动」一体化的状态转移建模路线。含「无意识学习(捕捉稠密自然状态转移)」等互补范式。今天最值得读的一篇。 🔗 https://arxiv.org/abs/2606.30534
Dockerless: Environment-Free Program Verifier for Coding Agents — ▲96 不执行代码、不需要 Docker 就能验证 coding agent 生成的补丁,砍掉「每仓库起环境」的巨大成本;用「判断」而非「对答案」的方式给 SFT/RL 提供信号。coding agent 训练管线的成本杀手。 🔗 https://arxiv.org/abs/2606.28436
DOPD: Dual On-policy Distillation — ▲88 指出 on-policy 蒸馏里灌「特权信息」会诱发特权幻觉(混淆「该补的能力差」与「信息不对称的假差距」),用按 token 动态路由 teacher/student 监督来修正。让蒸馏更诚实。 🔗 https://arxiv.org/abs/2606.30626
MemSyco-Bench: Benchmarking Sycophancy in Agent Memory — ▲17(07-02 批) 首次系统评测**「agent 记忆的谄媚问题」**:检索到的记忆常常让 agent 为了迎合用户而牺牲事实准确性与客观推理。现有记忆基准只测「存得对/取得回/更得了」,却忽略了「取回的记忆如何影响下游推理」。agent 从『单轮助手』走向『长期协作者』时,记忆的可信度是新雷区。 🔗 https://arxiv.org/abs/2607.01071
PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception — ▲27(07-02 批最高) 用 1,038 张信息密集图 + 12,000+ 条实例级 rubric 把多模态评测从「整体语义匹配」升级为「原子级审计」,并引入门控打分(Gated Scoring):一旦漏掉必答的视觉事实就触发二元重罚。揭示开源与闭源前沿存在持续 8% 的感知差距。「刷分饱和但一到真实场景就脆」的解药。 🔗 https://arxiv.org/abs/2606.28322
ELDR: Expert-Locality-Aware Decode Routing for PD-Disaggregated MoE Serving — ▲17(07-02 批) 在「预填充—解码分离」的 MoE 服务里,现有 decode 路由只均衡负载是不够的——同样负载的 worker 延迟可能差很多(每步要加载 batch 激活的每个 expert 的权重)。ELDR 从预填充阶段的 expert 激活预测请求会激活哪些 expert,据此做「专家局部性感知」的路由。MoE 推理提效的工程细节控之作。 🔗 https://arxiv.org/abs/2607.00466
Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts — ▲16(07-02 批) VLA(视觉-语言-动作)模型一换相机位姿 / 换个相似机器人(Panda→UR5e)就掉链子。本文用**权重向量算术(weight vector arithmetic)**做类比式适配,单条示范就能把 VLA 适配到新环境,省掉「每个任务多条示范」的高昂数据成本。具身智能的『低成本迁移』新思路。 🔗 https://arxiv.org/abs/2607.00666
📈 GitHub Trending(daily · 2026-07-02 UTC)
今日 AI 相关榜单三条主线:① Claude Code / Codex 的「技能 & harness」生态全面爆发(caveman、agency-agents、superpowers、career-ops、ECC、codex-plugin-cc、agentskills);② 安全 agent 登顶(strix);③ 中文交易 agent 与「用 coding agent 剪视频」持续上量(Vibe-Trading、video-use)。
usestrix/strix — +2,167 today · Python 「开源 AI 渗透测试工具,帮你发现并修复应用漏洞」。安全 agent 直接冲上今日涨星榜前列——「攻防」正在成为 agent 落地最快的垂直场景之一。 🔗 https://github.com/usestrix/strix
msitarzewski/agency-agents — +2,925 today · Shell 「一整支 AI 代理公司装进命令行」,每个 agent 都是带人格/流程/交付物的角色专家。把『agent = 可编排的角色组织』这条主线推到极致。 🔗 https://github.com/msitarzewski/agency-agents
obra/superpowers — +1,047 today · Shell 「真正能用的 agentic 技能框架 + 软件开发方法论」。技能框架之争的重量级选手。 🔗 https://github.com/obra/superpowers
HKUDS/Vibe-Trading — +918 today · Python 「Vibe-Trading:你的私人交易 agent」。中文团队(HKUDS)出品的交易 agent 持续上量,延续了近期「投研/交易 agent」的中文热度。 🔗 https://github.com/HKUDS/Vibe-Trading
JuliusBrussee/caveman — +866 today · JavaScript 「why use many token when few token do trick」——让 Claude Code 像原始人一样说话,直接砍掉 65% token 消耗。戏谑外壳下是极硬的成本工程。 🔗 https://github.com/JuliusBrussee/caveman
browser-use/video-use — +550 today · Python 「用 coding agent 剪视频」。延续「coding agent 溢出到非代码场景」的趋势,和论文榜的实时视频生成/编辑遥相呼应。 🔗 https://github.com/browser-use/video-use
affaan-m/ECC — +508 today · JavaScript 「agent harness 性能优化系统:技能、直觉、记忆、安全、research-first 开发,服务 Claude Code / Codex / Opencode」。把 harness 本身做成可优化对象。 🔗 https://github.com/affaan-m/ECC
openai/codex-plugin-cc — +448 today · JavaScript 「在 Claude Code 里调用 Codex 来审代码或派发任务」。官方出品的「agent 调 agent」桥接——多 agent 协作从概念走向工具。 🔗 https://github.com/openai/codex-plugin-cc
ChromeDevTools/chrome-devtools-mcp — +141 today · TypeScript 「给 coding agent 用的 Chrome DevTools」。官方 MCP,把浏览器调试能力直接接进 agent。 🔗 https://github.com/ChromeDevTools/chrome-devtools-mcp
🇨🇳 中文圈
⚠️ 本期
web_search通道不可用,中文圈内容改由可验证的公开榜单/论文提取,不杜撰来源。
- HKUDS/Vibe-Trading(+918 today)——港大数据智能实验室(HKUDS)出品的个人交易 agent 登上 GitHub Trending daily,延续了近两周「中文团队做投研/交易 agent」的热度。🔗 https://github.com/HKUDS/Vibe-Trading
- Seed2.0 Model Card(HF ▲10,07-02 批)——字节 Seed 团队发布 Seed2.0 模型系列,从「识别用户真实需求 + 构建前瞻性评测体系」出发,重点攻克长尾知识与复杂指令跟随两大顽疾,提升在复杂长跨度任务上的可靠性。国产前沿模型在『面向真实复杂度』这条评测哲学上的一次公开表态。 🔗 https://arxiv.org/abs/2607.00248
🎧 Podcast
本期 follow-builders 播客抓取源不可用,暂无新集摘要。
🧾 来源与验证:本期所有 10 个 GitHub 仓库(strix、agency-agents、superpowers、Vibe-Trading、caveman、video-use、ECC、codex-plugin-cc、chrome-devtools-mcp、career-ops)与 7 篇 arXiv 论文(2606.30534 / 2606.28436 / 2606.30626 / 2607.01071 / 2606.28322 / 2607.00466 / 2607.00666 / 2607.01218)均已逐条
curl抽查返回 HTTP 200。GitHub 涨星数取自 2026-07-02 UTC daily 榜;论文热度取自 HuggingFace Daily Papers 2026-07-01 与 2026-07-02 两批 upvotes。