本期说明:follow-builders 的 X / Podcast 抓取源本次恢复可用,数据来自上游
feed-x.json/feed-podcasts.json(feed 生成时间 2026-07-06T07:52 UTC)。共 14 位 builder、25 条推文、1 集播客。已剔除纯世界杯/生活类噪声,聚焦 AI / builder 信号。专业术语保留英文,每条附原文链接。
🔥 今日高光
- Claude Code 开始接管「真实招聘工作流」:Cat Wu(Anthropic)分享她的新常用法——把岗位画像丢给 CC,让它跑一个 dynamic workflow 找 100 位候选人(含 LinkedIn/Twitter/blog/podcast + 一句话 pitch),产出 artifact 并邮件发给自己;「然后我锁上电脑出门,路上审名单」。这是「agent 从 chat 变成后台执行体」的样板。
- 「开 10 个 Claude Code 标签页只是表演」:Nan Yu(OpenAI)连发两条,泼冷水式清醒——炫耀并行开一堆 agent 是 theater;把管理 agent 当成「即时战略游戏(RTS)」的心智模型是死路,因为「即使按现在标准已经很古早的 AI,也能在微操上碾压 99%+ 人类玩家」。方向不是让人手动指挥更多 agent,而是让 agent 自己收敛。
- No Priors × Noam Brown:test-time compute 正在改写一切评测(本期播客):OpenAI 研究员 Noam Brown 指出,现在模型能力是「投入多少算力」的函数——同一个 benchmark 不控制 test-time compute 就没有可比性;5.5 比 5.4 强主要强在「思考更高效」,而非分数栏里那几个百分点。
- RSI 不会是「一夜爆炸」:同期播客里 Noam 判断——因为解锁最强能力高度依赖大规模 test-time compute,而算力受时间瓶颈约束,所以更可能是「渐进 takeoff」:某些环节提速 100x,就被没提速的环节卡住;当前是「改造研究员在做的事」,而非「替代研究员」。
- Builder 共识:杠杆约束已被删除,只剩「好点子」:Garry Tan(YC)——「人类财富真正的约束从来不是资源,而是『如何更好地服务彼此』的好点子,以及行动的杠杆。我们刚为所有人删掉了杠杆约束。现在只剩点子。去想出来,然后把它建出来。」
数据概览:X builders 14 位 · 精选推文 25 条 · podcasts 1 集(No Priors)· feed 生成于 2026-07-06 07:52 UTC。
🐦 Builder 动态
来源:follow-builders X feed,按「AI / builder 信号强度」精选,纯赛事/节日类已略去。
Agent 工程与工作流
Cat Wu(@_catwu,Anthropic) — Claude Code 招聘 sourcing 工作流
「让 CC 跑一个 dynamic workflow 找 100 位候选人,每个都带 LinkedIn/Twitter/blog/podcast 和一句话 pitch,做成 artifact 邮件给我。然后我锁上电脑出门,路上审名单。」把 agent 从「同步对话」变成「异步后台执行体」的最佳日常示范。(❤555) 🔗 https://x.com/_catwu/status/2073806626965049686
Nan Yu(@thenanyu,OpenAI) — 别把 agent 当 RTS 来微操
①「开 10 个 Claude Code 标签页只是表演。」②「用『即时战略游戏』的心智模型去管理 agent 显然是死路——按现在标准已经很古早的 AI 都能在微操上碾压 99%+ 人类玩家。」核心观点:管理 agent 的正确抽象不是「人指挥更多单位」。(❤12 / ❤31) 🔗 https://x.com/thenanyu/status/2073920959011074292 · https://x.com/thenanyu/status/2073920326304460847
Dan Shipper(@danshipper,Every) — 对「agent 舰队」的调侃
「我:把这个按钮颜色改一下。Fable:好的,我刚启动了一支 100 个 agent 的舰队来帮你搞定。」一句话戳中当下「无脑并行 agent」的过度工程化。(❤153) 🔗 https://x.com/danshipper/status/2073764166700048480
Zara Zhang(@zarazhangrui,follow-builders 作者) — 重新翻出自己写的 skill
「趁着『读懂自己的代码』又流行起来,重新贴一下我做的这个 skill。」呼应「Skills 正成为 agent 操作层」的趋势。(❤125) 🔗 https://x.com/zarazhangrui/status/2073768913310200310
Peter Steinberger(@steipete) — 强力安利某工具
「不能再推荐得更用力了。」(附工具链接,❤184)—— steipete 出手安利通常值得留意。 🔗 https://x.com/steipete/status/2074007001802367446
Builder 心态与行业观察
Garry Tan(@garrytan,YC) — 杠杆约束已被删除 / 日本「天花板实验」
①「真正的约束从来不是资源,而是好点子 + 行动的杠杆。我们刚为所有人删掉了杠杆约束。现在只剩点子——去想出来,然后建出来,这是你的时代。」②「在大阪,看得很清楚:日本已经把『天花板』这个实验跑过了。三十年零增长,却造出了地球上最好的铁路、服务与工艺。当你无法在『更多』上竞争,就在『更好』上竞争。」(❤51 / ❤39) 🔗 https://x.com/garrytan/status/2073881439700168925 · https://x.com/garrytan/status/2073881438123110512
Nikunj Kothari(@nikunj) — 融资 pitch 的效率之问
「一直在等那种创始人:先玩过产品、带着至少两条反馈,才解锁与 VC 的对话。整天在 Zoom 上对着背好的 deck 聊 30 分钟,太让我震惊了——如果直接做产品头脑风暴会高效得多,或者干脆花时间互相认识。到这份上,双方把各自的『prompt』上传给 Claude 数字化搞定,可能都更省事 😂」(❤113) 🔗 https://x.com/nikunj/status/2073903310982218088
Amanda Askell(@AmandaAskell,Anthropic) — 从医生嘴里抠出一个概率
「从医生那里抠出一个概率,是人生里一场不必要的 boss 战。即便你求他给个区间形式的主观概率,本质上也只是在要他的直觉。」——研究者视角下的日常校准之痛。(❤1382,本期 X 最高赞技术圈观点) 🔗 https://x.com/AmandaAskell/status/2073786264059625897
Sam Altman(@sama,OpenAI) — 本期全场最高赞
「我家大孩子第一次把两个词连成句子,我对这个认知壮举的惊叹,大约等同于我对 GPT-5.6 发现新数学的惊叹。」(❤11071)—— 顺带官宣了「GPT-5.6 在做新数学」这条信息点。 🔗 https://x.com/sama/status/2073791666553844074
🎧 Podcast
No Priors —《Really Big Test-Time Compute in AI Changes Benchmarks, Safety and Research》with Noam Brown(OpenAI Research Scientist) 🔗 https://www.youtube.com/watch?v=AZrU6y3pUcU(发布于 2026-06-26)
主持人 Sarah Guo 对谈 OpenAI 推理研究员、「AI reasoning 教父」之一 Noam Brown。核心是他新写的那篇关于「大规模 test-time compute」的 essay。要点:
- Benchmark 的呈现方式错了:现在模型能力是「投入多少算力」的函数。同一 benchmark 若不控制 test-time compute,就没有可比性。5.5 相对 5.4 在分数栏里只高几个百分点,但一旦按「思考时长/预算」对齐,会发现 5.5 是显著跃升——它强在思考更高效,不是分数本身。
- 正确的评测姿势:要么给 benchmark 设一个预算(token / 成本 / 时间),要么把性能画成「test-time compute 的函数曲线」,再比不同模型。
- Benchmark maxing 的陷阱:只要「跑 5 次取最优 / 加个 judge」就能刷出更漂亮的纸面分数,但控制算力后其实没变强。应对之一是保留私有 held-out 集。
- 他的私人 eval:写扑克 bot。因为开源代码少、需要大量推理和踩坑,能看出模型在哪里失败。演进:早期模型几乎不行 → 5.2 能做 reverse solver(快约 5×,但「经常在 gaslighting 我」,$100 全下弃牌它说只亏 $92)→ 5.5 基本能 zero-shot 整个 solver,「再过半年到一年,可能一次性 zero-shot 出我整篇博士论文」。
- Safety 评测的『不方便真相』:各家的 preparedness framework / RSP 大多诞生于 ChatGPT 时代,没把 test-time compute 算进去。可如今「给 $10k 和给 $10M,模型能干的事完全不同」——到底该在什么预算下评估危险能力(如 bioweapon)?现有政策基本回避了这个问题。
- 潜在能力被严重低估:OpenAI 内部模型几周前证伪了 Erdős unit distance 猜想,成本「便宜到尘埃」;事后有人发现,只要给 5.5 搭一点 scaffold、反复 steer,也能得到该 disproof——但没人真去探索「往 5.5 里砸 $100k 算力能干嘛」。而每代模型发布,这类问题的求解成本可能再降 10–100×。
- 对 RSI / takeoff 的判断:不认为会有「一夜之间的智能爆炸」。因为解锁最强能力高度依赖大规模 test-time compute,而算力受时间约束——更可能是渐进 takeoff。当前瓶颈在模型「research taste 还很差」:能把他博士期间的算法优化到快 1000×,却提不出真正新颖、超越已有工作的算法。所以现在是「改造研究员做的事」,而非「替代研究员」。
- 一个有意思的细节:Noam 反复用「slash goal(/goal)」来指代「给模型一个长期目标、让它自己跑数周/数月」的能力——
/goal刚出时,有人跑的任务一周后才跑完,「大家一周后才意识到这是个大事」。
一句话总结:评测、安全、RSI 三件事的共同变量,都是 test-time compute。谁不把算力预算写进评估口径,谁就在自欺。
📝 编者按
本期 X / Podcast 源恢复正常,内容重心回到「真实 builder 在做什么、在想什么」。今天的信号很集中:agent 正从「并行开标签页炫技」走向「异步跑完整工作流」(Cat Wu 的招聘 sourcing 是最好例子),而 Nan Yu / Dan Shipper 则在给「无脑舰队」降温。播客侧 Noam Brown 把「算力即能力」这条主线讲透,也顺手给了「不会一夜爆炸」的冷静判断——值得所有做 evals 和 agent scaffold 的人细读原文。