Model Frontier Weekly · Vol. 08

大模型技术前沿周报

面向 Agent、代码与工具调用、检索、长流程可靠性、图像和视频生成研发预研。只保留上一完整自然周内可由官方材料、公开仓库或主榜核验的高信号变化。

资讯窗口:2026.09.28—10.04榜单快照:2026.10.09中文提炼 · 原始入口可追溯4 个主榜 · 80 条 Top 20made by ChrisYoung
01

研发决策摘要

本周最值得带走的 4 个判断

Agent 平台

代码 Agent 的采购单位正在从“模型”变成“模型 + 托管执行环境”

依据:OpenAI 9 月 29 日发布 GPT-6.1 Sol 与 Agents API:前者提供 105 万 token 上下文,后者把多 Agent、上下文压缩和托管浏览器 computer use 合入 Responses API;官方同时按固定评测披露相对 Sol 的成功率与单位任务成本改善。
判断:架构选型应以同一任务、同一工具权限和相同完成标准比较端到端成功率、每次成功成本、可审计轨迹与人工接管,不应只比较模型 Elo 或 token 单价。
边界:能力与成本数字来自厂商评测;托管浏览器要求逐来源审批且不提供自部署权重,企业登录、数据驻留与内部工具成功率仍需复测。

长流程可靠性

超长输出提升迁移规模,但不能替代分段验收与回滚

依据:Google 9 月 30 日披露 Gemini 4 Argon 的输出上限从 64K 提升至 100 万 token,并展示 80 万行以上 Fuchsia Zircon C/C++→Rust 迁移、32K 行 SIMD 库重写及内部部署节省 300 TiB 以上内存。
判断:长流程代码 Agent 应按模块生成可复验提交,持续执行构建、差分测试、性能回归与人工放行;更长上下文适合维持全局约束,不应被当作一次性大提交的安全证明。
边界:Argon 仅向受信任网络安全防御者限量开放;案例与性能数字来自 Google 内部工程,不能外推到普通仓库、公开 API 或其他语言迁移。

开放权重安全

开放权重代码模型应默认按“可执行高权限主体”治理

依据:Anthropic 9 月 29 日称其对 GLM-5.3 的模拟测试中,简单技术可在 64%—100% 的攻击尝试里绕过原始安全限制;NIST CAISI 的独立评估此前也把 GLM-5.3 认定为发布时能力最强的开放权重网络模型,并给出 SEC-Bench Pro 40.4% 等结果。
判断:自部署代码 Agent 不能依赖模型拒答作为主要防线,应采用最小权限、网络出口白名单、短期凭据、命令审计、产物扫描和高风险操作人工审批。
边界:绕过比例来自 Anthropic 的对抗性测试,NIST 指标使用另一套任务;两者都不等于真实环境攻击成功率,也不能外推到 GLM 全系列 checkpoint。

国产推理栈

模型专用内核已进入国产加速器,但版本锁定先于性能承诺

依据:DeepSeek 9 月 30 日为 Ascend 950 发布 DeepGEMM-Ascend,并在 FlashMLA 加入 V4.1 稀疏注意力预填充/解码内核;官方报告典型预填充达 360 TFLOPS、融合后提升约 10%—15%,同时明确新版本移除 Hopper 与旧 V3/V3.2/V4 路径并改变 KV cache 格式。
判断:国产卡适配应固定芯片、CANN、torch_npu、模型提交和 KV 格式,分别做正确性与吞吐门禁;升级前必须保留旧提交和回滚镜像。
边界:结果仅对应 Ascend 950、CANN 9.20 与 DeepSeek V4.1 负载,不能外推到 Ascend 910、其他国产卡或通用算子性能。

02

模型性能与用户体感

执行日最新快照;与 09.28—10.04 新闻窗口分开

03

本周技术前沿

官方材料优先;聚焦 Agent、代码执行、安全与国产推理

托管 Agent 平台 · OpenAI · 09.29

GPT-6.1 Sol 与 Agents API 把模型、编排和浏览器执行合成一条产品线

GPT-6.1 Sol 提供 105 万 token 上下文、12.8 万 token 最大输出,支持 Responses API 的函数、网页搜索、文件搜索、计算机使用和 MCP 等工具。同期 Agents API 进入 beta,加入多 Agent 协作、工具搜索/调用、上下文压缩,以及由 OpenAI 托管的浏览器 computer use。

官方称 DeepSWE v1.1 在相同设置下比 Sol 高 6.4 个百分点;新模型在 AutomationBench 相对 Sol 提高 4.8 点,在 OSWorld 2.0 最大推理下接近 Astra、单位任务成本约为后者七分之一。更值得关注的是评测单位已经包含 Agent harness,而不只是裸模型。

研发含义:PoC 应锁定任务集、浏览器镜像、工具权限和完成判据,记录每次成功成本、来源审批、失败恢复与人工接管;来源切换时按官方要求重新审批。

1.05M输入上下文上限
128K最大输出
≈1/7官方 OSWorld 单位任务成本对 Astra
上述基准与成本来自 OpenAI 自有 harness;托管服务成绩不能代表任何可下载 checkpoint,企业身份与数据边界也需另行验证。
长流程代码 · Google DeepMind · 09.30

Gemini 4 Argon 用超长输出推进大规模迁移,但仍处于受限开放

Google 把 Argon 的输出上限从 64K 提升到 100 万 token,披露其参与 80 万行以上 Fuchsia Zircon 内核 C/C++→Rust 迁移,并将 libgav1 的 32K 行 SIMD 代码重写为输出一致、官方报告快 2.7× 的 Rust 实现。内部部署还释放 300 TiB 以上内存,官方估算长期总节省可达 500 TiB—1 PiB。

在公开/半公开评测上,官方给出 DeepSWE v1.1 77.9%、CWE-Bench v1 68%。当前模型仅通过 Fairwind 计划向受信任网络安全防御者限量开放,并未形成公开 API 或可下载权重。

研发含义:大迁移要把 Agent 输出拆为可编译、可回滚的小提交;长上下文负责维持架构约束,CI 与人工评审负责证明行为等价。

1M最大输出 token
800K+内核迁移代码行
2.7×官方 libgav1 案例速度
案例是 Google 内部工程且模型受限开放;不能把内部结果当作公共生产可用性或一般代码仓库收益。
开放权重 Agent 安全 · Anthropic / NIST · 09.29

GLM-5.3 的攻防测试再次说明:模型内拒答不能替代运行时隔离

Anthropic 针对开放权重 GLM-5.3 做模拟攻防,称简单绕过技术在其设置中达到 64%—100%;NIST CAISI 更早的独立报告给出 SEC-Bench Pro 40.4%、ExploitBench 61.1%、ExploitGym 9.4% 与 OSS-Fuzz 7.7%,并称其是发布时最强的开放权重网络模型。

研发含义:能写代码、调用工具又可本地修改安全层的模型,应在短期凭据、网络白名单、只读根文件系统、审计日志与高风险动作审批下运行。

Anthropic 与 Z.ai 存在市场竞争,测试结论应视为厂商对抗性研究;NIST 使用不同任务,两组数字不能直接合并或解释为真实攻击率。
国产加速器内核 · DeepSeek · 09.30

FlashMLA / DeepGEMM 为 Ascend 950 给出可复现的版本边界

DeepGEMM-Ascend 首版面向 Ascend 950,固定 CANN 9.20、torch_npu 与 Python ≥3.10,覆盖 BF16/FP8/FP4 GEMM、MQA logits 与 MegaMoE,保持与 DeepGEMM 相近的接口,许可证为 MIT。FlashMLA 同日加入 V4.1 稀疏注意力预填充和解码,官方报告预填充最高 410 TFLOPS、典型 V4.1 负载 360 TFLOPS。

升级并非无成本:新版本移除 Hopper 与旧 V3/V3.2/V4 支持,并修改 FP8/FP4 KV cache 格式。生产升级必须把旧提交、模型和缓存格式一同纳入回滚方案。

开放权重 Computer Use · H Company · 09.28

Holo4 将 GUI、代码、MCP/API 放进同一多模态 Agent 接口

H Company 发布 Holo4-27B dense 与 Holo4-35B-A3B MoE,覆盖桌面、网页和 Android 的 GUI 操作,也能写代码并调用 MCP/API。官方同时公开 BF16、FP8、NVFP4、GGUF 权重与轨迹数据;27B 权重为 CC BY-NC 4.0,35B-A3B 为 Apache 2.0,二者不能统一写成“开源”。

官方模型卡在 OSWorld 2.0 给出 27B 61.7%、每任务 1.22 美元;其示例长任务消耗 130 万—240 万 token、68—94 次工具调用,提示开放权重只解决部署控制权,并不自动解决长轨迹成本与可靠性。

研发含义:PoC 应同时评测 UI 定位、工具选择、跨环境状态恢复、单位完成成本和许可边界;商业使用优先核对 35B-A3B 的 Apache 2.0 精确仓库,不能把 27B 的非商业权重混用。

OSWorld 数字来自团队模型卡,且可能随环境和 harness 变化;不同量化版本也应视作独立部署制品复测。
生成媒体 · 执行日主榜

图像头部仍以托管服务为主;带音频视频榜出现精确可下载 H3

执行日 Artificial Analysis 文生图 Top 20 中,只有 Qwen-Image-2.1(第 19)有精确可下载权重,使用 Qwen Research License,而 Qwen-Image-3.0 / Pro 的榜单服务不能据此视为开放。With Audio 视频榜中 MiniMax H3 第 4,官方权重可下载但采用 MiniMax 自定义许可;第 5 的 fal 后训练 H3 Max 不是同一 checkpoint。

FLUX 3 位列视频第 6,但当前内容生成版本仍是托管/私有权重;BFL 只承诺后续推出开放权重内容版,不能用已经发布的 FLUX 3 Action 动作模型替代。

研发含义:媒体模型选型要同时记录榜单精确服务名、权重提交、许可、分辨率/时长、音频能力和单位成片成本;“同系列开放”不能替代精确 checkpoint 核验。

04

前沿厂商动态

仅列 09.28—10.04 内可核验的有效更新

OpenAI09.29 · 模型与 Agent API

发布 GPT-6.1 Sol;Agents API beta 提供多 Agent 与托管浏览器

Sol 面向代码和专业工作,提供 105 万上下文、12.8 万输出及 Responses API 工具调用。Agents API 将多 Agent、压缩、工具搜索与托管 computer use 整合为服务;模型与运行时均为托管闭源。

Google DeepMind09.30 · 长流程代码

Gemini 4 Argon 以受限方式开放

输出上限提升至 100 万 token,并披露大规模 Rust 迁移与内部基础设施优化案例。目前只通过 Fairwind 向受信任网络安全防御者提供,未开放通用 API 或权重。

Anthropic09.29 · 开放权重攻防

发布 GLM-5.3 网络能力与防护绕过测试

报告聚焦开放权重强代码模型的滥用边界,并主张部署侧增加防护。结论来自竞争厂商的对抗性测试,正文与 NIST 独立评估并列呈现,避免单源定稿。

DeepSeek09.30 · 国产推理内核

发布 DeepGEMM-Ascend 与新版 FlashMLA

新增 Ascend 950 的 BF16/FP8/FP4 GEMM、MegaMoE、稀疏注意力预填充/解码;仓库为 MIT。兼容面收窄到 V4.1 与新缓存格式,旧平台需要继续固定历史提交。

Mistral AI09.28 / 09.29 · 平台模型生命周期

GLM-5.3 在平台 GA;同时推进旧模型退役

Mistral 平台 9 月 28 日将 Z.ai GLM-5.3 设为 GA;次日宣布 OCR 4.0 与 Leanstral 1.5 于 9 月 30 日退役,GLM-5.2 于 10 月 31 日退役并建议迁移 5.3。该变化是平台供给与生命周期管理,不代表 Mistral 发布新基础模型。

H Company09.28 · 开放权重 Computer Use

发布 Holo4 27B / 35B-A3B 与轨迹数据

同一多模态接口覆盖 GUI、代码与 MCP/API。27B 为 CC BY-NC 4.0,35B-A3B 为 Apache 2.0;权重、量化和轨迹均可下载,但开放许可并不相同。

05

固定监控入口

榜单一个主源;中文社区只作线索,不承担事实定稿

厂商检查:国内逐项检查 Qwen、DeepSeek、Kimi、MiniMax、智谱/Z.ai、腾讯、小米、京东、字节;海外逐项检查 OpenAI、Anthropic、Google DeepMind、Meta、xAI、Mistral、Microsoft AI、BFL、Runway、Luma。无当周有效更新者不占版面。

开放口径:标准开源(MIT / Apache 2.0)、开放权重自定义许可、同系列有开放权重、托管闭源服务、权重已承诺但尚未发布分开标注;同名或同系列不自动视作同一 checkpoint。

时间口径:厂商与技术内容严格限定 2026.09.28 00:00—10.04 23:59(Asia/Shanghai);榜单使用 10.09 执行日可获得的最新快照。Arena Text 页标注更新于 10.08,Vision 页标注更新于 10.02;Artificial Analysis 为 10.09 抓取值,后续会随投票变化。

论文口径:本周未发现同时满足窗口、官方可核验、研发影响清晰且高于上述工程发布的信息,因此不为凑数单列论文。