🔥 今日高光
- ChatGPT 正在从聊天入口,继续进化成更长期、可执行的个人操作层。 Sam Altman 今天连续释放了两个很强的产品信号:一是 ChatGPT memory 再次升级,二是可以直接用 ChatGPT build and publish web apps。放在一起看,方向很明确——OpenAI 不只是在做“更会回答问题的模型”,而是在把 ChatGPT 变成一个既记得你、又能替你产出结果的默认入口。
🔗 原文:https://x.com/sama/status/2062660086787613116 🔗 原文:https://x.com/sama/status/2062661071761211561
- Anthropic 正把 agent 从 demo,推向真正可进生产的 infra。 今天关于 Claude / Anthropic 最重要的,不只是一篇 blog,而是一组互相呼应的信号:Managed Agents 在架构上强调 “brain from hands” 的解耦;产品上新增 self-hosted sandboxes 与 MCP tunnels;内部数据又显示 Claude 已写下超过 80% 的 merged code。三件事拼起来,说明 Anthropic 正在同步补齐 agent 的 capability、deployment boundary 和真实使用密度。
🔗 原文:https://www.anthropic.com/engineering/managed-agents 🔗 原文:https://claude.com/blog/claude-managed-agents-updates 🔗 原文:https://x.com/alexalbert__/status/2062580571214389510
- Codex 正在从产品,变成可以嵌入你自己系统里的能力层。
Thibault Sottiaux 提到现在已经可以通过 Python SDK 在自家程序里调用 codex,
pip install openai-codex这类入口非常值得注意。真正的意义不是“多了一个 SDK”,而是 Codex 正从 end-user tool 进一步走向 platform primitive,开始更自然地嵌入内部工作流、自动化系统和 agent orchestration。
🔗 原文:https://x.com/thsottiaux/status/2062734215494664697
- AI for science 的叙事,开始从愿景走向 researcher 级别的具体方法讨论。 Matt Turck 这期 podcast 找来 OpenAI 的 Dan Roberts,核心不是泛泛而谈 AGI,而是把 reinforcement learning、reasoning 与科学发现之间的关系拆开讲。现在值得认真看待的变化是:模型不再只是帮助 scientist 提高效率,而是开始被讨论为推动新发现的主动工具。
🔗 原文:https://www.youtube.com/watch?v=oWOz2htozfI
- Builder 圈的共识越来越清楚:AI 产品竞争,已经进入 workflow、trust 和 integration 的阶段。 不管是 Peter Yang 花整天把 Codex skills / integrations 接进自己的 creator workflow,还是 Claude 访谈里 Anton Osika 把 trust 讲成 AI 产品护城河,今天都在重复同一个主题:下一轮胜负不只看模型 benchmark,而看谁能真正嵌进用户的长期流程里。
🔗 原文:https://x.com/petergyang/status/2062740262338929110 🔗 原文:https://x.com/claudeai/status/2062558332695556378
🐦 Builder 动态
Sam Altman:memory + app publishing,把 ChatGPT 往“个人计算入口”再推一步。 今天 Sam 的两条更新一起看价值更大。memory 升级意味着 ChatGPT 对用户上下文的长期保留更进一步;而 web app publishing 则说明 OpenAI 想把“想法 → 成品”的路径继续压缩。对 builder 来说,这代表用户预期会快速抬高:他们会更自然地期待 AI 既懂我,又能直接交付东西。
🔗 https://x.com/sama/status/2062660086787613116 🔗 https://x.com/sama/status/2062661071761211561
Thibault Sottiaux:Codex 的 SDK 化,意味着 agent 能力正被产品团队重新编排。 把 codex 变成 SDK 之后,最直接的变化不是让更多人手写 prompt,而是让产品团队可以把 code generation、planning、execution 这些能力埋进已有系统里。谁先把它们接到现成数据流、审批流和内部工具里,谁就更容易做出真正有粘性的 agent 体验。
🔗 https://x.com/thsottiaux/status/2062734215494664697
Alex Albert:Claude 已参与绝大多数内部代码合并,AI-native software org 的轮廓越来越清楚。 “80% merged code 由 Claude 编写” 这句话最重要的地方,不只是比例本身,而是组织形态变化。它意味着不少研究者与工程师的工作,正从直接写代码转向提出问题、设计评估、review 结果和把控方向。对所有 builder 团队来说,这会逐步变成默认参照系。
🔗 https://x.com/alexalbert__/status/2062580571214389510
Peter Yang:真正省时间的不是单次调用,而是把 integrations 和 skills 先搭起来。 Peter Yang 说自己花了一整天配置 Codex 的 integrations 和 skills,但结论是:任何 knowledge work 只要系统搭好,至少能省 50% 时间。这条非常像今年 builder 圈的核心实践经验——AI 的复利,不在一次 prompt,而在你有没有把上下文、工具和重复流程沉淀成系统。
🔗 https://x.com/petergyang/status/2062740262338929110
Cat Wu:Claude Code 已经在围绕 model performance 招 PM,说明 agent eval 正在产品化。 当 Anthropic 公开招聘专注 model performance、agentic evals 的 PM,其实是在透露一个现实:eval 已不再只是 research support function,而正成为产品本身的一部分。未来好的 AI 产品团队,会越来越像“产品 + research + eval infra” 三位一体。
🔗 https://x.com/_catwu/status/2062659533047259212
📝 官方 Blog / 文章
Anthropic Engineering:Scaling Managed Agents — Decoupling the brain from the hands 这篇文章讲的是 agent architecture 的一个关键转向:把负责规划和推理的 “brain” 与实际执行工具、与外部环境交互的 “hands” 解耦。这样做的意义在于,长任务、多工具、多轮恢复的 agent 系统会更稳定、更易控制,也更适合生产环境中的可观测和治理。
🔗 原文:https://www.anthropic.com/engineering/managed-agents
Claude Blog:Managed Agents 新增 self-hosted sandboxes 和 MCP tunnels 如果说上面那篇偏架构,这篇就是产品落地。self-hosted sandboxes 解决的是执行环境边界和控制权,MCP tunnels 解决的是 agent 访问私有系统的连接能力。对企业用户而言,这两个更新直接决定了 agent 能不能真正进入内网、数据面和合规范围。
🔗 原文:https://claude.com/blog/claude-managed-agents-updates
Anthropic Engineering:An update on recent Claude Code quality reports Anthropic 公开拆解最近一段时间 Claude Code 质量波动的来源,这种 postmortem 式透明度本身就值得看。它说明 frontier AI 产品已经进入另一个阶段:用户不仅关心模型强不强,也会关心服务质量、回退策略和问题追踪是否足够工程化。
🔗 原文:https://www.anthropic.com/engineering/april-23-postmortem
Claude Blog:New connectors in Claude for everyday life Claude 新增一批面向 everyday life 的 connectors,看起来像消费产品更新,但本质上是在扩大 Claude 可访问的 personal context surface。随着 AI 系统连接更多生活与工作的 app,context aggregation 本身会越来越像核心产品能力。
🔗 原文:https://claude.com/blog/connectors-for-everyday-life
🎧 Podcast
The MAD Podcast with Matt Turck:OpenAI’s Dan Roberts — Why AI Can Now Make Discoveries
The Takeaway: AI for science 的关键变化,不是模型会不会答题,而是它是否开始具备沿着很长推理链条坚持探索、并生成新 hypothesis 的能力。
从节目开场和已提供 transcript 看,这期最值得抓住三点:
- Reinforcement Learning 仍是当前 AI 能力跃迁的核心范式之一。 Dan Roberts 所负责的 foundations of reinforcement learning,本身就说明 OpenAI 仍把 RL 看作把模型从“会说”推向“会找答案”的关键路径。
- 科学发现需要 contrarian exploration。 节目里提到模型有时能沿着非直觉路径继续计算和探索,这正是很多科学问题难解的地方:答案不一定在最短路径上。
- AI 的角色正在从辅助研究,往 discovery engine 移动。 这不是说模型已经能独立完成所有科学突破,而是研究者已经开始严肃讨论“模型驱动发现”这个新工作流。
对 builder 来说,这期节目最重要的启发是:当 reasoning、search 和 RL 结合得更紧时,AI 产品的边界就不再只是 office productivity,而会进入更高价值、更强专业性的知识发现流程。
🔗 收听 / 观看:https://www.youtube.com/watch?v=oWOz2htozfI
💡 今日观察
把今天这些信号拼在一起,会看到一条很清楚的主线:
- Consumer AI 在往“更懂你、还能直接交付结果”的方向推进
- Developer AI 在从独立产品变成可嵌入系统的基础能力
- Enterprise AI 在补 deployment、security、connectivity 和 governance 这些真正卡落地的环节
- AI-native teams 则开始围绕 eval、workflow 和 trust 重组组织方式
所以今天最值得记住的一句话是:
AI builders 的竞争,已经从“模型够不够强”,进入“能不能稳定嵌进真实世界 workflow”的阶段。
本日报仅基于 follow-builders feed 中可确认的 X、podcast 与 blog 数据 remix 生成;未确认的信息未写入。Generated through the Follow Builders workflow.