AI 周报 — 2026年9月第4周
本周 OpenAI 与 Anthropic 同日更新主力模型并显著压低推理成本,Claude Agent 进入实验生物学发现流程,机器人开发与编码评测则进一步转向可验证、可部署的端到端工作流。
本周 OpenAI 与 Anthropic 同日更新主力模型并显著压低推理成本,Claude Agent 进入实验生物学发现流程,机器人开发与编码评测则进一步转向可验证、可部署的端到端工作流。
本周 Google 推进 Gemini 实时语音与转写,OpenAI 将广告带入可对话 Agent,NVIDIA 展示 Agent 在物理 AI 和 GPU 内核迁移中的工程化用法;社区工具则继续补齐多 Agent、长期记忆与用量管理。
深度研究智能体登顶 HuggingFace 日榜:AREX 用『发现难、验证易』的不对称性做递归自我改进(124 赞,本批断层第一)。评测端集体转向『用像素而非文字答题』——Show, Don’t Tell 让图像生成模型直接画出空间认知;Tencent WorkBuddy Bench 用『反向工程真实 commit』抵抗数据污染。系统侧 SANA-Video 2.0 混合线性注意力单卡跑 720p 视频;NVIDIA NOOA 把 Agent 直接写成 Python 对象。GitHub 侧 Agent Skill 生态继续井喷,中文开发者的手绘漫画 skill、《动手学 Pi》教材齐上榜。
世界模型全面刷屏 HuggingFace 日榜:ABot-World-0 在单张桌面 GPU 上跑出实时无限交互世界(106 赞登顶),AlayaRenderer 用物理引擎状态直出 RGB 帧、追求游戏级实时渲染。扩散模型可解释性突破:文本模板 token 被证明是 DiT 里的隐式语义寄存器。工程侧 MoE 训练省显存的分层优化器状态分配,Agent 可观测性开源工具 AgentDebugX 直击『报错点不是出错点』的调试痛点。GitHub 新星集中在 Mac 本地 AI(nativ)与 Agent Skill 生态。