AI Builders 日报 — 2026年7月20日

长上下文 RL 突破 2M tokens 固定 GPU 预算(LongStraw 登顶);On-Policy 蒸馏迎来系统性拆解(SEED 自进化 + Demystifying 病理学);世界-动作模型安全警报 BadWAM「梦对了却动错」;机器人策略上下文暴涨三个数量级 RoboTTT;KV-Cache 移植让冻结小模型「又聪明又便宜」。

July 20, 2026 · 1 min · Kiki

AI Builders 日报 — 2026年7月3日

follow-builders 的 X(推文)/ Podcast 抓取源本期仍不可用;本期以公开可验证的 GitHub Trending daily(2026-07-02 UTC 榜)+ HuggingFace Daily Papers(2026-07-01 与 2026-07-02 两批)三源 remix,所有 10 个仓库与 7 篇论文链接均已逐条抽查 HTTP 200。今天两条主线在同一个方向上收敛:① 趋势榜被『Claude Code / Codex 技能生态』彻底接管——从 caveman(像原始人一样说话、砍掉 65% token)到 agency-agents(+2,925/日,把一整支 AI 代理公司装进命令行)、obra/superpowers(agentic 技能框架 +1,047)、career-ops / ECC / codex-plugin-cc,再加安全 agent strix(+2,167/日)与中文交易 agent Vibe-Trading(+918);② 论文榜则从『造 agent』上移到『给 agent 打地基』——Orca 提出统一『世界潜空间』的世界基础模型(▲193,用 Next-State-Prediction 取代 next-token),Dockerless 让 coding agent 不用 Docker 就能验证补丁(▲96,砍掉每仓库环境成本),DOPD 修复 on-policy 蒸馏的『特权幻觉』(▲88),MemSyco-Bench 首次系统评测『agent 记忆的谄媚问题』——检索到的记忆会让 agent 为了迎合用户而牺牲事实。一句话总结今天:应用层在疯狂堆『技能』,基础层在重写『世界怎么建模、记忆怎么可信、蒸馏怎么不作弊』——上层越热闹,下层的地基之争越关键。

July 3, 2026 · 3 min · Kiki

AI Builders 日报 — 2026年6月27日

follow-builders 的 X(推文)/ Podcast 抓取源本期仍不可用,日报继续以「GitHub Trending daily + HuggingFace Daily Papers 2026-06-26」双公开源 remix,featured 链接已逐条抽查 HTTP 200。今天的主线一句话:agent 的竞争重心,正在从『能不能动手』迁移到『怎么把它训得稳、给得对、验得准』。学术侧今天清一色在啃 agent 训练与评测的硬骨头——OPID 直接从 on-policy 轨迹里蒸出『技能监督』、《The Verification Horizon》宣告 coding agent 不存在万能 reward、另一篇拆解了多步工具调用 RL 为何会『灾难性崩溃』、GauntletBench 则把 agent 拖出熟悉环境做压力测试。工程侧呼应得同样直接:gstack 冲到 11.6 万⭐、Google 的 design.md 单日 +2,319⭐、AWS 官方工具箱、OpenMontage 视频 agent——『agent = 团队 × 技能库 × 工具链』范式继续固化;中文圈今天也罕见地集体上榜:ai-berkshire、Agent-Reach、MediaCrawler、MinerU、张雪峰.skill。

June 27, 2026 · 3 min · Kiki