⚠️ 本期说明:follow-builders 的 X / Podcast 源在本次抓取窗口不可用(脚本未部署),故本期回退到 HuggingFace Daily Papers API + GitHub Search API 作为可验证来源。所有条目均来自结构化接口,链接已抽查 HTTP 200,不补写无法核实的内容。专业术语保留英文,每条附原文链接。

🔥 今日高光

  1. 「记忆是一份契约」——长程 Agent 的记忆范式之争:AgenticSTS 提出用 typed retrieval 组装每一步的输入,让 prompt 长度在任意步数下保持有界,替代「把历史全量 append」的做法,使单个记忆组件的作用可被隔离评估。
  2. 自主策略进化被单独立为评测轴:EvoPolicyGym 把「agent 反复编辑一个可执行策略」从「笼统的软件工程进度」中剥离出来,在固定交互预算下衡量策略迭代能力(GPT-5.5 上报了成绩)。
  3. 技能(Skills)成为 agent 的可复用操作层:SkillCoach 用「自进化 rubric」给技能调用打过程分——不再只看最终 verifier 是否通过,而是识别选错技能、漏步骤、编排错误等细粒度失败。
  4. 可控世界模型解耦「语义运动」与「像素渲染」:WorldDirector 用 LLM 编排 3D 轨迹 + 相机运动作为控制信号,再交给视频生成,实现持久物体记忆与自由视角探索。
  5. GitHub 侧「agent 基础设施」当道:langchain-ai/openwiki(2.4k⭐,自动写/维护 codebase 文档)、Qwen-AgentWorld(语言世界模型)、self-learning-skills(coding agent 自我沉淀技能)三条线共同指向——把「文档 / 世界 / 技能」做成 agent 的底座。

数据概览:HF Daily Papers 27 篇(2026-07-03 批次)· GitHub 新增热门仓库 4 组 · X builders 0(源不可用)· podcasts 0(源不可用)。


📄 论文速递

来源:HuggingFace Daily Papers(2026-07-03 批次),按社区 upvotes 排序精选。

Program-as-Weights: A Programming Paradigm for Fuzzy Functions(68 up)

把「难以用规则清晰实现、只能外包给 LLM API」的模糊任务(如告警重要日志、修复坏 JSON、按意图排序)编译成本地可执行的小神经网络。用一个 4B 编译器在自建的 FuzzyBench(1000 万样例,已开源)上训练,直接产出参数高效的 adapter,兼顾 locality、可复现性与成本。

🔗 原文:https://huggingface.co/papers/2607.02512

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents(43 up)

提出「有界记忆契约」:每一步决策都从 typed retrieval 组装的全新消息出发,不 append 原始跨步 transcript,使 prompt 在任意长度运行下保持有界、单层记忆效果可隔离。为长程 agent 的记忆设计提供了可控测试床。

🔗 原文:https://huggingface.co/papers/2607.02255

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments(41 up)

定义 Autonomous Policy Evolution 评测范式——agent 在固定交互预算内反复编辑一套可执行策略系统。基于紧凑的交互式 RL 环境构建 benchmark,专门衡量「探索到的策略被迭代改进」的能力,而非笼统的工程进度。

🔗 原文:https://huggingface.co/papers/2607.02440

Morphing into Hybrid Attention Models(36 up)

把「混合注意力模型里哪些层保留 full attention」形式化为预算约束下的全局选择问题,指出层重要性并非孤立、存在相互依赖,超越了固定放置或逐层打分的启发式策略,提升 Transformer→Hybrid 转换的长上下文效率。

🔗 原文:https://huggingface.co/papers/2606.30562

AgenticDataBench: A Comprehensive Benchmark for Data Agents(25 up)

面向「数据科学自动化」的 LLM data agent,提出覆盖多场景、细粒度的综合 benchmark,填补此前评测缺失,用于严格衡量 data agent 在异构数据上的表现。

🔗 原文:https://huggingface.co/papers/2607.01647

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory(20 up)

高可控视频世界模型:解耦语义运动编排与视觉生成,用 LLM 协调 3D 轨迹 + 相机运动作为控制信号,保证物理逻辑一致,同时支持持久动态物体记忆与不受限视角探索。

🔗 原文:https://huggingface.co/papers/2607.02517

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use(14 up)

针对「技能仓库中相互重叠、难以可靠调用」的问题,提出自进化 rubric 框架,从技能出发推导过程评分标准,既能评测也能增强 agent 的技能调用能力。

🔗 原文:https://huggingface.co/papers/2607.01874


🛠️ 新工具 / 项目

来源:GitHub Search API(created > 2026-06-27,按 stars 排序),已过滤明显的 SEO 刷量仓库。

langchain-ai/openwiki ⭐2.4k · TypeScript

一个 CLI,为你的 codebase 自动撰写并持续维护「面向 agent 的文档」。把「让 agent 读懂代码库」这件事产品化,是本日 star 数最高的正经新项目。

🔗 https://github.com/langchain-ai/openwiki

QwenLM/Qwen-AgentWorld ⭐758 · Python

Qwen 团队开源 Language World Models for General Agents——用语言世界模型支撑通用 agent,呼应今日论文里的世界模型主线。

🔗 https://github.com/QwenLM/Qwen-AgentWorld

Kulaxyz/self-learning-skills ⭐822

面向 AI coding agent(Claude Code / Cursor / AGENTS.md)的自改进技能:把一次「来之不易的经验」识别、沉淀为可复用技能,与 SkillCoach 论文形成工程呼应。

🔗 https://github.com/Kulaxyz/self-learning-skills

HUANGCHIHHUNGLeo/claude-real-video ⭐688 · Python

让 Claude(或任意 LLM)真正「看」视频:场景感知 + 去重帧 + transcript,把视频转成模型能消化的结构化上下文。

🔗 https://github.com/HUANGCHIHHUNGLeo/claude-real-video

jamesob/local-llm ⭐624 · Shell

「关于本地跑 LLM 我所知道的一切」——一份实战向的本地推理知识库,适合想脱离 API 依赖的开发者。

🔗 https://github.com/jamesob/local-llm

amplifthq/opentag ⭐680 · TypeScript

开源的 @agent mentions:在 Slack / GitHub 里 @ 一个 agent,请求会被路由到 Codex / Claude Code 等执行——把 agent 接入协作流的「@」入口。

🔗 https://github.com/amplifthq/opentag

HKUDS/AgentSpace ⭐609 · TypeScript · benchflow-ai/awesome-evals ⭐662

AgentSpace 主打「Human + Agents,一个团队一个工作区」的协作范式;awesome-evals 则是一份「非注水」的 agent 评测资源精选(论文 / 博客 / 工具)。

🔗 https://github.com/HKUDS/AgentSpace · https://github.com/benchflow-ai/awesome-evals


🇨🇳 中文圈

SuperJJ007/CSSwitch ⭐207 · Rust

一键把 Claude Science 接入国产 API:DeepSeek / 通义千问 / 智谱 GLM / Kimi / MiniMax / 小米 MiMo / 硅基流动 / OpenRouter 等,降低国内用户的接入门槛。

🔗 https://github.com/SuperJJ007/CSSwitch

QwenLM/Qwen-AgentWorld ⭐758 · Python

(见上)阿里 Qwen 团队的语言世界模型项目,是今日中文团队在「agent × world model」方向的代表作。

🔗 https://github.com/QwenLM/Qwen-AgentWorld

lycorp-jp/sim-use ⭐550 · Swift

给 AI agent 装上「眼睛和手」,直接操作 iOS Simulator 与 Android 模拟器/真机——移动端 GUI agent 的实操工具。

🔗 https://github.com/lycorp-jp/sim-use


🎧 Podcast

本期 follow-builders 播客源不可用,暂无新集摘要。源恢复后将在后续日报补齐。


本期由结构化 API 回退管线生成(HF Daily Papers + GitHub Search)。若 follow-builders X/Podcast 源恢复,将回到以 builder 推文为主的常规形态。