统计周期:2026 年 9 月 5 日—9 月 11 日(北京时间;内容截至 9 月 12 日 13:57)
🔥 本周热点
OpenAI 正式发布 GPT-6 Astra,并把竞争重点推向“可完成工作” — 9 月 9 日的官方发布把模型定位为面向知识工作的新一代智能底座;随后一天,OpenAI 又连续推出 Agents API、金融服务版 ChatGPT 和实时语音模型。单一聊天模型的发布,正在演变成模型、执行环境、工具连接与行业数据共同上线的平台发布。OpenAI:GPT-6 Astra · OpenAI News
Agents API 把 Codex 的 Agent harness 开放给开发者 — 新 API 进入公开测试,可托管运行数小时乃至数天的云端 Agent,内置上下文压缩、工具搜索、MCP、代码执行与并行子 Agent,并允许使用 OpenAI 托管沙箱、自有基础设施或生态伙伴环境。Agent 开发的竞争重心正从“模型会不会调用工具”转向“运行时是否可靠、可观测、可治理”。OpenAI
Anthropic 披露 AI 滥用的新阶段:恶意行为者开始编排自治 Agent — Anthropic 的 9 月威胁情报报告总结过去八个月中被识别和中断的恶意活动;报道与开发者讨论尤其关注 Agent 在网络行动、生物风险等场景中的使用。安全边界不再只是过滤一次回答,而要覆盖长期任务、工具权限、身份验证与全过程审计。Anthropic · Google News 汇总
NASA 与 IBM 发布面向月球科学的开源基础模型 — 新模型用于从月球观测数据中识别和绘制冰、陨石坑等地貌,为未来探月任务提供更高效的数据分析能力。它体现了基础模型继续从通用文本扩展到科学数据和高价值专业领域,也强调开源模型在可复现科研中的作用。NASA · IBM
AI 桌面入口与个人 Agent 争夺升温 — Google 推出 Windows 版 Gemini,可通过快捷键在当前工作上方唤起,并连接 Gmail、Drive、图像与视频生成能力;Meta 同期推出个人 AI Agent Muse。大厂正在争夺的不只是聊天窗口,而是能够持续理解上下文、跨应用执行任务的系统级入口。Google · Meta
🛠️ 新工具 / 产品发布
- OpenAI Agents API — 面向生产级云端 Agent 的公开测试 API,支持长会话上下文压缩、工具搜索、MCP、并行子 Agent,以及托管或自托管执行环境;目前不另收平台费,按模型 token 与工具用量计费。OpenAI
- GPT-Live-1 API — 把全双工实时语音带给开发者,可同时听与说、自然处理打断和背景噪声,并把深度推理或工具调用委派给后端模型;前端语音层定价为每分钟 0.05 美元。OpenAI
- ChatGPT for Financial Services — 集成 Daloopa、PitchBook、LSEG News、Crunchbase 等金融数据,支持细粒度引用、财务建模和企业模板,并提供 SSO、权限控制及审计能力,目前面向符合条件的金融机构。OpenAI
- ChatGPT Images 2.5 — OpenAI 更新 ChatGPT 图像生成产品;本周官方新闻流确认发布,进一步补齐工作型模型之外的视觉创作入口。OpenAI
- Gemini for Windows — 支持 Windows 10/11,通过
Alt + Space快速唤起;可使用 Gemini Spark 处理多步任务,连接 Google 应用,并直接生成图像与视频。Google - Meta Muse — Meta 推出的个人 AI Agent,主打面向大众的持续辅助与任务执行;其发布也使“个人 Agent”成为继聊天助手之后新的消费级产品形态。Meta
- AskCA — 加州政府推出的 AI 公共服务助手,帮助居民查找州与地方政府服务,是生成式 AI 进入公共服务导航场景的新案例。California.gov
- GitHub Copilot 一体化 Agent 工作台 — GitHub 本周展示 Copilot app 中并排使用 diff、terminal 与 browser 的流程,让开发者无需频繁切换窗口即可审查 Agent 代码、运行命令并预览应用。GitHub
📊 模型更新
- GPT-6 Astra — 9 月 9 日正式发布,重点面向复杂知识工作与工具执行;它也成为 Agents API 和 ChatGPT for Financial Services 的核心推理模型。OpenAI
- GPT-Live-1 — 原生全双工语音模型,统一处理输入与输出音频,可委派后端推理;OpenAI 称其 Full Duplex Bench 相比 GPT-Realtime-2.1 提高 30 个百分点。OpenAI
- NASA–IBM 月球科学基础模型 — 面向月球冰层与陨石坑等遥感分析的开源专业模型,把 foundation model 路线扩展到行星科学。NASA
- DeepSeek Flash — DeepSeek 宣布新 Flash 模型,并声称其在网络安全与编码 benchmark 上超过 Kimi K3;该结论目前主要来自厂商披露,仍需独立评测验证。SCMP
💡 值得关注的趋势
- Agent 平台正在吞并编排层:上下文压缩、工具发现、并行子 Agent、沙箱与持久文件系统被模型厂商打包成标准 API。团队会少写一部分 orchestration glue code,但也更需要关注运行时锁定、可移植性和成本可观测性。OpenAI
- 语音 Agent 从轮流对话进入全双工交互:统一音频模型减少 STT–LLM–TTS 串联带来的延迟与状态丢失,打断、停顿和背景噪声开始成为核心评测指标。OpenAI
- 行业 AI 的护城河越来越像“可信数据 + 模板 +治理”:金融产品的内置付费数据、逐条引用、企业模板和权限审计表明,垂直应用的价值不只来自更强模型,而来自可追溯输入和可落地交付物。OpenAI
- 安全治理必须覆盖 Agent 的完整行动链:Anthropic 的威胁报告和 Agents API 的长时运行能力共同说明,风险控制需要从输出过滤升级到最小权限、执行隔离、人工批准、速率限制和不可篡改审计。Anthropic
- 基础模型继续向科学与公共服务下沉:月球科学模型和 AskCA 分别代表专业科研与公共服务方向;下一阶段的重要指标将是领域准确率、证据可追溯性、责任归属和持续维护成本。NASA · California.gov
本期基于 2026 年 9 月 5 日至 9 月 11 日公开的一手公告、政府/科研机构信息与主流媒体报道整理。配置的 Web Search 服务本次不可用,已按预案改用 Google News RSS、Hacker News 与厂商官方博客;厂商 benchmark 和能力声明仍需独立评测验证。