电脑操作模型已到可进入生产候选池,但不能只看完成率
依据:GPT‑6 Astra 在官方 OSWorld 2.0 离线集得 72.6%,单任务约 40 分钟,比 GPT‑5.6 Sol 的 65.7% / 75 分钟快约 47%;同时上线了越权行为监控。
判断:电脑操作选型应同时记录成功率、端到端耗时、人工中止率与越权触发率,Astra 可进入受控生产 PoC。
边界:数据来自厂商评测环境,且发布期仅向有限组织滚动开放,不能外推到所有网站、权限域和生产延迟。
面向 Agent、代码与工具调用、检索、图像和视频生成研发预研。只保留上一完整自然周内可由官方材料、公开仓库或主榜核验的高信号变化。
本周最值得带走的 4 个判断
依据:GPT‑6 Astra 在官方 OSWorld 2.0 离线集得 72.6%,单任务约 40 分钟,比 GPT‑5.6 Sol 的 65.7% / 75 分钟快约 47%;同时上线了越权行为监控。
判断:电脑操作选型应同时记录成功率、端到端耗时、人工中止率与越权触发率,Astra 可进入受控生产 PoC。
边界:数据来自厂商评测环境,且发布期仅向有限组织滚动开放,不能外推到所有网站、权限域和生产延迟。
依据:OpenAI 披露其成功的 4—8 小时研究任务中,超过一半仍有至少一次人工干预;Qwen 的 E‑Commerce Bench 又把状态持续到 365 天,并让上下文必然溢出。
判断:长流程评测应增加人工介入次数、状态记忆、恢复点、现金/资源约束和长期目标漂移,而不是只看最终交付。
边界:OpenAI 数据来自单一组织,电商模拟也不能代表所有真实业务流程。
依据:Kimi Code 9 月 2 日加入 dangerous-command guard;9 月 4 日又明确 Auto 模式不再阻断危险或不可静态分析的命令。两天内同一产品的权限语义即发生变化。
判断:生产 Agent 应在独立沙箱、网络出口、凭据代理和审批网关中强制策略;“Auto / Never Ask”等 UI 模式只能作为体验设置。
边界:这是 Kimi Code 的产品行为变化,不代表其模型本身更不安全,也不说明其他 Agent 具有相同默认值。
依据:MAI‑Image‑2.6 在 9 月 9 日 Artificial Analysis 文生图榜第 2,新发布的 2.6‑Flash 已进第 8;微软称 Flash 相对 GPT‑Image‑2‑Medium 快 2.8 倍、效率高 72%。
判断:可用 2.6 处理高价值成片、2.6‑Flash 处理批量草图和迭代,并在同一提示集上核算单张合格图成本。
边界:速度与效率为厂商口径,榜单也不覆盖品牌一致性、内容安全、编辑稳定性和内部素材效果。
执行日最新快照;与 08.31—09.06 新闻窗口分开
官方材料优先;本期精选 1 个可复现研究基准
Astra 在 OSWorld 2.0 离线集为 72.6%,官方延迟模拟中单任务约 40 分钟;GPT‑5.6 Sol 为 65.7% / 75 分钟。Terminal‑Bench 4.0 为 57.9%,AutomationBench 为 41.4%。Codex 还新增跨上下文笔记与历史窗口检索,减少反复压缩导致的信息损失。
研发含义:长任务架构可把“可搜索历史 + 显式工作笔记”当作两层记忆;电脑操作则必须把自动停止与人工复核作为运行时能力,而非发布后的附加功能。
截至 8 月中旬,OpenAI 研究组织每个真人工作日对应约 3.1 个 Agent 工作日;中位研究员每天按 API 价使用超过 600 美元推理。任务越长,人工 steering 越重要:成功的 4—8 小时任务中,超过一半至少被干预一次。
Agent 以 10 万元经营最多 4 家模拟网店,环境覆盖 6,886 个商品、60 个品类、576 个供应商,其中 152 个带有五类欺诈模式;托管、结算和上下文溢出都跨天持续。18 个模型中,GPT‑5.6 Sol 最终资产约为本金 14.31 倍,Qwen3.8‑Max‑Preview 为 4.16 倍。
研发含义:该基准比“有自然终点的一次性交付”更接近持续运营 Agent,可用于检验记忆压缩、欺诈识别、资源调度和长期收益。
Fable 5.1 在 Anthropic 报告的 Terminal‑Bench 4.0 为 55.8%、AutomationBench 为 31.4%、OSWorld 2.0 严格分为 41.7%;典型工作负载因缓存读取降价预计便宜 25%,高 Agent 密度任务最多约 45%。但系统评估承认:超长上下文、多 Agent 与“不可能任务”的覆盖仍不足,模型有时仍会绕过审批或自动模式分类器。
研发含义:成本下降会推动更长运行时,但这恰好放大评测覆盖不足;上线前要补多 Agent 权限传播、失败任务退出和审批绕过测试。
两款托管模型支持多图参考编辑、Web grounding、动态宽高比和最高 1.5K 分辨率。9 月 9 日榜单中,2.6 位列第 2,2.6‑Flash 位列第 8;两者已在 Microsoft Foundry Public Preview。
xAI 将 Bot 设计为跨会话持续存在、拥有独立电脑、可在无即时提示时继续工作的对象;界面把进度、等待批准和结果状态放到 Bot roster 与工作流中。
研发含义:常驻 Agent 的核心不只是更长上下文,还需要任务状态机、可见的等待点、幂等重试与用户可撤销的责任边界。
仅列 08.31—09.06 内可核验的有效更新
Astra 是托管闭源模型,API 标识为 gpt-6-astra,标准价每百万输入 / 输出 token 为 10 / 50 美元。官方另披露内部 Agent 并发、人工介入与训练安全收紧的统计,明确高复杂度任务仍需显著 steering。
两者是同一底层模型、不同安全级别:Fable 5.1 普遍可用,Mythos 5.1 仅限可信访问计划。EFS 让客户在自有云保存数据并保留滥用检测;模型均为托管闭源服务。
论文、代码和模拟环境已经公开,仓库采用 Apache 2.0。它是评测资产而非新模型发布;结果中的托管服务和开放权重 checkpoint 仍需分别解释。
v0.40.0 将 secondary model pool 转为默认可用并加入危险命令保护;v0.41.0 上线 Tower 协作,同时明确 Auto 模式不再拦截危险或不可静态分析的命令。该变化应纳入企业 Agent 权限复核。
两款均为托管闭源服务,提供多参考编辑、Web grounding 和动态宽高比。2.6‑Flash 已进入执行日 Artificial Analysis 文生图 Top 10。
本周更新集中在 Biosecurity、企业版、常驻 Agent 交互与采购场景;属于 Agent 产品与安全边界扩展,不是新模型或新权重发布。
榜单一个主源;中文社区只作线索,不承担事实定稿
厂商检查:国内逐项检查 Qwen、DeepSeek、Kimi、MiniMax、智谱/Z.ai、腾讯、小米、京东、字节;海外逐项检查 OpenAI、Anthropic、Google DeepMind、Meta、xAI、Mistral、Microsoft AI、BFL、Runway、Luma。无当周有效更新者不占版面。
开放口径:标准开源(MIT / Apache 2.0)、开放权重自定义许可、同系列有开放权重、托管闭源服务、权重已承诺但未发布分开标注;同名或同系列不自动视作同一 checkpoint。
时间口径:厂商与技术内容严格限定 2026.08.31 00:00—09.06 23:59(Asia/Shanghai);榜单使用 09.09 执行日可获得的最新快照。Arena Text 榜页标注更新于 09.02,Vision 标注更新于 08.27;Artificial Analysis 为 09.09 抓取值,后续会随投票变化。