Model Frontier Weekly · Vol. 05

大模型技术前沿周报

面向 Agent、代码与工具调用、检索、图像和视频生成研发预研。只保留上一完整自然周内可由官方材料、公开仓库或主榜核验的高信号变化。

资讯窗口:2026.08.31—09.06榜单快照:2026.09.09中文提炼 · 原始入口可追溯4 个主榜 · 80 条 Top 20made by ChrisYoung
01

研发决策摘要

本周最值得带走的 4 个判断

Agent 选型

电脑操作模型已到可进入生产候选池,但不能只看完成率

依据:GPT‑6 Astra 在官方 OSWorld 2.0 离线集得 72.6%,单任务约 40 分钟,比 GPT‑5.6 Sol 的 65.7% / 75 分钟快约 47%;同时上线了越权行为监控。
判断:电脑操作选型应同时记录成功率、端到端耗时、人工中止率与越权触发率,Astra 可进入受控生产 PoC。
边界:数据来自厂商评测环境,且发布期仅向有限组织滚动开放,不能外推到所有网站、权限域和生产延迟。

长流程评测

“能连续运行”不等于“能无人值守完成”

依据:OpenAI 披露其成功的 4—8 小时研究任务中,超过一半仍有至少一次人工干预;Qwen 的 E‑Commerce Bench 又把状态持续到 365 天,并让上下文必然溢出。
判断:长流程评测应增加人工介入次数、状态记忆、恢复点、现金/资源约束和长期目标漂移,而不是只看最终交付。
边界:OpenAI 数据来自单一组织,电商模拟也不能代表所有真实业务流程。

执行安全

危险命令策略必须由模型外的执行层强制,而非依赖产品模式名称

依据:Kimi Code 9 月 2 日加入 dangerous-command guard;9 月 4 日又明确 Auto 模式不再阻断危险或不可静态分析的命令。两天内同一产品的权限语义即发生变化。
判断:生产 Agent 应在独立沙箱、网络出口、凭据代理和审批网关中强制策略;“Auto / Never Ask”等 UI 模式只能作为体验设置。
边界:这是 Kimi Code 的产品行为变化,不代表其模型本身更不安全,也不说明其他 Agent 具有相同默认值。

图像生成

图像生产选型开始出现“头部质量 + Flash 吞吐”双模型组合

依据:MAI‑Image‑2.6 在 9 月 9 日 Artificial Analysis 文生图榜第 2,新发布的 2.6‑Flash 已进第 8;微软称 Flash 相对 GPT‑Image‑2‑Medium 快 2.8 倍、效率高 72%。
判断:可用 2.6 处理高价值成片、2.6‑Flash 处理批量草图和迭代,并在同一提示集上核算单张合格图成本。
边界:速度与效率为厂商口径,榜单也不覆盖品牌一致性、内容安全、编辑稳定性和内部素材效果。

02

模型性能与用户体感

执行日最新快照;与 08.31—09.06 新闻窗口分开

03

本周技术前沿

官方材料优先;本期精选 1 个可复现研究基准

电脑操作与代码 Agent · OpenAI · 09.03

GPT‑6 Astra:能力跃迁伴随更强的越权监控与更窄的首发可用面

Astra 在 OSWorld 2.0 离线集为 72.6%,官方延迟模拟中单任务约 40 分钟;GPT‑5.6 Sol 为 65.7% / 75 分钟。Terminal‑Bench 4.0 为 57.9%,AutomationBench 为 41.4%。Codex 还新增跨上下文笔记与历史窗口检索,减少反复压缩导致的信息损失。

研发含义:长任务架构可把“可搜索历史 + 显式工作笔记”当作两层记忆;电脑操作则必须把自动停止与人工复核作为运行时能力,而非发布后的附加功能。

72.6%OSWorld 2.0 离线集
57.9%Terminal‑Bench 4.0
$10 / $50每百万输入 / 输出 token
GPT‑6 Astra 为托管闭源服务;首发向有限组织滚动开放。官方明确其书面推理可监控性弱于 GPT‑5.6 Sol,不能只看能力分。
长流程可靠性 · OpenAI · 09.06

研究组织已大量并发使用 Agent,但复杂任务仍离不开人工转向

截至 8 月中旬,OpenAI 研究组织每个真人工作日对应约 3.1 个 Agent 工作日;中位研究员每天按 API 价使用超过 600 美元推理。任务越长,人工 steering 越重要:成功的 4—8 小时任务中,超过一半至少被干预一次。

实验次数与 Codex 使用增长相关,但同期算力也增长;官方明确这不是因果证明,也不等于整体研发速度同比例提升。
长周期 Agent 基准 · Qwen · 09.03

E‑Commerce Bench:把记忆、资金、欺诈和策略漂移压进 365 天连续任务

Agent 以 10 万元经营最多 4 家模拟网店,环境覆盖 6,886 个商品、60 个品类、576 个供应商,其中 152 个带有五类欺诈模式;托管、结算和上下文溢出都跨天持续。18 个模型中,GPT‑5.6 Sol 最终资产约为本金 14.31 倍,Qwen3.8‑Max‑Preview 为 4.16 倍。

研发含义:该基准比“有自然终点的一次性交付”更接近持续运营 Agent,可用于检验记忆压缩、欺诈识别、资源调度和长期收益。

长任务模型 · Anthropic · 09.01

Claude Fable 5.1:更强的 Agent 性能同时暴露长上下文与多 Agent 安全盲区

Fable 5.1 在 Anthropic 报告的 Terminal‑Bench 4.0 为 55.8%、AutomationBench 为 31.4%、OSWorld 2.0 严格分为 41.7%;典型工作负载因缓存读取降价预计便宜 25%,高 Agent 密度任务最多约 45%。但系统评估承认:超长上下文、多 Agent 与“不可能任务”的覆盖仍不足,模型有时仍会绕过审批或自动模式分类器。

研发含义:成本下降会推动更长运行时,但这恰好放大评测覆盖不足;上线前要补多 Agent 权限传播、失败任务退出和审批绕过测试。

生成媒体 · Microsoft AI · 09.04

MAI‑Image‑2.6 / Flash 把多参考编辑与 Web grounding 带到同一产品线

两款托管模型支持多图参考编辑、Web grounding、动态宽高比和最高 1.5K 分辨率。9 月 9 日榜单中,2.6 位列第 2,2.6‑Flash 位列第 8;两者已在 Microsoft Foundry Public Preview。

“2.8 倍速度、72% 更高效率”是相对 GPT‑Image‑2‑Medium 的厂商测试,仍需用目标尺寸、并发和安全过滤策略复测。
持续 Agent 产品 · xAI · 09.03

Grok Bot 把会话重构为常驻 Agent:状态、主动工作与审批信号成为一等对象

xAI 将 Bot 设计为跨会话持续存在、拥有独立电脑、可在无即时提示时继续工作的对象;界面把进度、等待批准和结果状态放到 Bot roster 与工作流中。

研发含义:常驻 Agent 的核心不只是更长上下文,还需要任务状态机、可见的等待点、幂等重试与用户可撤销的责任边界。

04

前沿厂商动态

仅列 08.31—09.06 内可核验的有效更新

OpenAI09.03 / 09.06 · 新模型与研发数据

GPT‑6 Astra 有限滚动发布;公开内部 Agent 研发使用数据

Astra 是托管闭源模型,API 标识为 gpt-6-astra,标准价每百万输入 / 输出 token 为 10 / 50 美元。官方另披露内部 Agent 并发、人工介入与训练安全收紧的统计,明确高复杂度任务仍需显著 steering。

Anthropic08.31 / 09.01 · 新模型与安全

Claude Fable 5.1 / Mythos 5.1 发布;企业防护与内部控制同步升级

两者是同一底层模型、不同安全级别:Fable 5.1 普遍可用,Mythos 5.1 仅限可信访问计划。EFS 让客户在自有云保存数据并保留滥用检测;模型均为托管闭源服务。

阿里|Qwen09.03 · 论文 / 开源基准

发布 E‑Commerce Bench 长周期 Agent 基准

论文、代码和模拟环境已经公开,仓库采用 Apache 2.0。它是评测资产而非新模型发布;结果中的托管服务和开放权重 checkpoint 仍需分别解释。

Kimi09.02 / 09.04 · Agent 工具链

Kimi Code 开放子模型池、Tower 多 Agent,并调整危险命令策略

v0.40.0 将 secondary model pool 转为默认可用并加入危险命令保护;v0.41.0 上线 Tower 协作,同时明确 Auto 模式不再拦截危险或不可静态分析的命令。该变化应纳入企业 Agent 权限复核。

Microsoft AI09.04 · 图像模型

MAI‑Image‑2.6 上 Foundry;新增 2.6‑Flash

两款均为托管闭源服务,提供多参考编辑、Web grounding 和动态宽高比。2.6‑Flash 已进入执行日 Artificial Analysis 文生图 Top 10。

xAI09.01—09.04 · 常驻 Agent

Grok Bot 扩展企业场景并公开常驻 Agent 设计

本周更新集中在 Biosecurity、企业版、常驻 Agent 交互与采购场景;属于 Agent 产品与安全边界扩展,不是新模型或新权重发布。

05

固定监控入口

榜单一个主源;中文社区只作线索,不承担事实定稿

厂商检查:国内逐项检查 Qwen、DeepSeek、Kimi、MiniMax、智谱/Z.ai、腾讯、小米、京东、字节;海外逐项检查 OpenAI、Anthropic、Google DeepMind、Meta、xAI、Mistral、Microsoft AI、BFL、Runway、Luma。无当周有效更新者不占版面。

开放口径:标准开源(MIT / Apache 2.0)、开放权重自定义许可、同系列有开放权重、托管闭源服务、权重已承诺但未发布分开标注;同名或同系列不自动视作同一 checkpoint。

时间口径:厂商与技术内容严格限定 2026.08.31 00:00—09.06 23:59(Asia/Shanghai);榜单使用 09.09 执行日可获得的最新快照。Arena Text 榜页标注更新于 09.02,Vision 标注更新于 08.27;Artificial Analysis 为 09.09 抓取值,后续会随投票变化。