统计周期:2026 年 9 月 19 日—9 月 25 日(北京时间)

🔥 本周热点

  1. 前沿模型竞争从“最高分”转向成本—能力曲线 — OpenAI 发布 GPT-6 Sol 与 Luna,称两者 API 单价较 GPT-5.6 对应型号降低 50%;Anthropic 同日推出 Claude Opus 5.5,称典型工作负载成本较 Opus 5 低 40%。两家公司都把长任务、编码与缓存成本放到核心位置,显示规模化 Agent 的单位任务成本正成为关键指标。OpenAI · Anthropic

  2. AI Agent 开始参与可由湿实验验证的科学发现 — Anthropic 组建生命科学研究组和实验室,并披露 Claude Agent 从 20 多万条逆转录酶序列中筛选候选,发现与重复 DNA 阵列相关的新酶系统 ART;研究人员随后进行了实验分析。其功能仍未确定,成果目前以预印本形式公开,不应等同于已完成同行评议的生物学结论。Anthropic

  3. 长会话 Agent 的“缓存工程”成为独立优化层 — OpenAI 为 GPT-6 推出缓存监控、未命中诊断、显式断点和预热能力,并允许在不破坏既有缓存的情况下调整推理强度或可用工具。官方称缓存输入最高可获 90% 折扣;这使 prompt 结构与工具定义稳定性直接影响 Agent 延迟和成本。OpenAI

  4. 机器人开发栈开始为人类与 Agent 共同使用而设计 — NVIDIA 发布 Isaac ROS 5.0,加入可复用的 setup、manipulation、FoundationStereo 微调及 pick-and-place skills,并提供 agent-ready 文档;同时扩展 ROS Lyrical、Ubuntu 24.04 和 Jetson 平台支持。NVIDIA

  5. 编码 Agent 的评测走出单元测试,进入真实服务路径 — SWE-Serve 从 SGLang 合并记录构造 53 个推理工程任务,其中 19 个启动真实服务。NVIDIA 报告称,在这些任务上去掉 live-serving 检查后,同一批 patch 的通过率从 45.9% 升至 69.4%,说明“本地测试通过”与“实际可服务”仍有明显鸿沟(厂商/项目方评测)。NVIDIA 技术文章 · GitHub

🛠️ 新工具 / 产品发布

  • GPT-6 Prompt Caching Dashboard — 展示应用中缓存与未缓存 token 的占比及变化趋势,便于定位长会话和持续 Agent 的成本回退。OpenAI
  • Prompt caching diagnostics — 对比请求与近期响应,指出模型、工具、设置或输入变化导致的 cache miss,并估算受影响 token 数量。OpenAI
  • SWE-Serve — 开源编码 Agent benchmark,包含 53 个源自 SGLang 已合并 PR 的生产推理工程任务,并用真实模型服务、回归与部分性能门槛验证 patch。GitHub
  • Isaac ROS 5.0 Agent Skills — 面向机器人环境设置、操作、双目模型微调和抓放流程的可复用技能,让 Agent 能沿标准化文档完成 ROS 开发任务。NVIDIA
  • ENZO — 自托管 AI 工作区,提供 Agent、skills,以及 Gmail、Calendar 等工具集成;采用 BYOK,可连接 Groq、OpenRouter、NVIDIA、Hugging Face 与 Google AI。GitHub
  • Relay — 面向 Agent 的自托管 LLM 网关,以统一 API 接入 100 多家模型提供方,并提供智能路由、队列优先调度、速率控制、护栏、成本跟踪和实时可观测性。GitHub
  • AI·rete·RAG — 将确定性的 Rete 规则引擎与 RAG 结合:规则负责决策,检索生成层负责用自然语言解释理由,适合需要可追溯业务判断的场景。项目主页
  • BioNeMo Mixtral Native Transformer Engine Recipe — 展示 GroupedLinear、MXFP8 与融合 GroupedMLP 在生物基础模型 MoE 训练中的用法,并公开配置与 benchmark 代码。GitHub · NVIDIA

📊 模型更新

  • GPT-6 Sol / Luna — OpenAI 将二者定位为 GPT-6 Astra 之下、面向更高吞吐和更低成本的型号。输入/输出价格分别为 Sol 每百万 token 2/10 美元、Luna 0.10/0.50 美元。文中的 AutomationBench、DeepSWE、OSWorld 与内部事实性数据均为厂商声明或厂商引用结果,仍需独立评测交叉验证。OpenAI
  • Claude Opus 5.5 — Anthropic 称其多数任务达到 Claude Fable 5.1 水平,输出速度较 Opus 5 快 30% 以上,输入/输出价格为每百万 token 4/20 美元;Terminal-Bench、FrontierCode 等领先结果属于厂商声明,部分测试由外部 benchmark 方运行。Anthropic
  • Gemini 3.8 Live with Live Avatar — Google DeepMind 将实时多模态交互扩展到 Live Avatar;同月模型列表还新增 Gemini 3.8 Flash、3.8 Flash Cyber 与 3.8 文本转语音,显示 Gemini 继续细分实时、语音与网络安全用途。Google DeepMind · Google
  • NV-Reason-CT — NVIDIA 发布面向 3D CT 的开放研究 VLM,以 3D ViT 搭配 Qwen3.5-4B,支持结构化报告和多轮追问;它不是获批临床产品。其 CT-RATE Macro-F1 0.614、Macro-AUROC 0.871 为厂商声明。NVIDIA

💡 值得关注的趋势

  • 模型价格战已进入“每项任务成本”阶段:token 单价仍重要,但缓存命中率、推理强度、完成任务所需 token 与重试次数,正在共同决定真实成本。OpenAI:模型 · Anthropic
  • Agent 基础设施正在分层:模型之下出现缓存诊断、网关路由、节流、护栏和成本观测;应用团队会越来越少直接把单一模型 API 当作完整运行时。OpenAI · Relay
  • “可验证闭环”成为高价值 Agent 的共同结构:生物研究由实验确认候选,编码任务由 live-serving 检查 patch,机器人流程由仿真和真实硬件验证;可靠性来自外部证据,而不是模型自评。Anthropic · SWE-Serve · Isaac ROS 5.0
  • 领域模型继续深入三维与科学数据:从完整 CT 体数据到海量 DNA 序列,模型输入正超越常规文本和二维图片;相应的专业验证、安全边界和专家复核也必须同步增强。NV-Reason-CT · Anthropic

本期从候选源包中筛选 16 条相关线索,并以厂商官方页面、项目官网和源码仓库进行核验。厂商提供的 benchmark、性能、成本节省及安全评测结论均已明确标注为“厂商声明”或注明来源属性。