Model Frontier Weekly · Vol. 07

大模型技术前沿周报

面向 Agent、代码与工具调用、检索、长流程、图像和视频生成研发预研。只保留上一完整自然周内可由官方材料、公开仓库或主榜核验的高信号变化。

资讯窗口:2026.09.14—09.20榜单快照:2026.09.21中文提炼 · 原始入口可追溯4 个主榜 · 80 条 Top 20made by ChrisYoung
01

研发决策摘要

本周最值得带走的 4 个判断

系统工程 Agent

代码 Agent 已进入内核与算子优化,但验收必须按模式分层

依据:Anthropic 9 月 17 日发布 36 个生物建模优化套件,报告平均约 4× 加速、相同输出约 1.6×;Z.ai 同日称 GLM-5.3 驱动的 Infra Agent 在十万卡级国产加速器集群把端到端吞吐提高 3×。
判断:Agent 可用于算子、编译与推理栈优化,但必须把 exact / fast / big 模式、数值等价、硬件拓扑、依赖摘要和人工放行写入验收,而不是只看吞吐。
边界:Anthropic 结果集中在生物模型与 NVIDIA 栈;Z.ai 为厂商自报的特定国产集群,均不能外推为通用加速倍数。

长流程 Agent

把持久记忆与运行预算、权限审批拆成两个控制面

依据:xAI 9 月 16 日让 Grok Build Memory 只保存稳定约定、决策和项目事实,并提供可浏览 Markdown;Qwen Code 9 月 17 日新增 50 万 token 上限、最大轮次/时长、精确工作流版本审批与受限 bwrap 沙箱。
判断:长期 Agent 的记忆应可审阅、可覆盖且排除秘密与临时任务态;预算、权限、跨会话通信和可写目录则由独立运行时硬约束,避免“记住了”被误当成“获准了”。
边界:这是两个产品的工程实现,不是互操作标准;Qwen 跨会话消息默认开启,仍需按组织数据边界复核。

语音 Agent

连续对话流与后台工具任务应解耦,不能串行阻塞

依据:Google 9 月 15 日发布 Gemini 3.8 Live / Extended Thinking,支持 97 种语言中途切换,并可在继续对话时后台执行工具与 API;Extended Thinking 在其披露的 Speech-to-Speech Quality Index 得分 82.6。
判断:语音 Agent 控制面应把实时音频、异步工具作业、取消/超时和结果回注分离,优先保障打断、澄清和回退,而不是让一次长工具调用冻结会话。
边界:模型是托管闭源服务,指标含厂商或外部基准,不覆盖中文业务噪声、成本、端到端延迟和内部工具成功率。

生成媒体

图像头部仍靠托管 API;带音频视频已有可下载权重路径

依据:执行日 Artificial Analysis 文生图 Top 20 全为托管闭源服务;With Audio 视频榜中,MiniMax H3 第 4(开放权重、自定义许可),MAGI-2 Preview 第 6(Apache 2.0 权重与推理代码,518 GB、推荐 8×Hopper)。
判断:追求图像头部偏好分应先按托管 API 评估;视频若需要数据驻留与可控部署,可把 H3 / MAGI-2 纳入自部署 PoC,并把许可证、显存拓扑和单位成片成本列为一等指标。
边界:偏好榜不覆盖编辑稳定性、延迟、成本与品牌一致性;MAGI-2 的第 6 名服务条目与仓库版本仍需用相同提交和推理配置复测。

02

模型性能与用户体感

执行日最新快照;与 09.14—09.20 新闻窗口分开

03

本周技术前沿

官方材料优先;聚焦 Agent 控制面、系统优化与实时语音

系统工程 Agent · Anthropic / Z.ai · 09.17

Agent 从应用代码走向 CUDA 内核、算子融合与十万卡推理栈

Anthropic 与 FutureHouse 在不到四周内优化 30 多个开放生物模型,发布 36 个即插即用套件;FlashPairformer 的三角注意力报告 2.7—2.9× 加速、三角乘法 1.7—3.2×。仓库把优化分为 off、exact、fast、big,并明确原始代码 Apache 2.0、上游组件沿用各自许可且仓库不承诺维护。

Z.ai 则披露 GLM-5.3 驱动的 Infra Agent 参与 W8A8、INT8/FP8/BF16 KV cache、张量并行、ReplaySSM、分层切分与 EPD 解耦,称从适配到生产少于两周、吞吐 3×,并在六天处理 62 万亿 token。

研发含义:系统 Agent 的评测单位应是“提交 + 镜像 + 硬件拓扑 + 精度模式 + 数值/任务回归”,高吞吐只有在输出一致性与回滚路径成立时才有意义。

36 套可下载优化套件
≈4×Anthropic 报告平均加速
Z.ai 报告端到端吞吐
两组数字来自不同任务、硬件和验证口径,不应横向比较;Z.ai 的集群数据为厂商自报。
实时语音 Agent · Google DeepMind · 09.15

Gemini 3.8 Live 把后台工具调用并入不中断的多语对话流

Gemini 3.8 Live 面向低延迟规模化,Extended Thinking 面向复杂多步推理;两者可在 97 种语言间中途切换,结合视觉定位,并在继续交谈时后台执行工具/API。官方披露 Extended Thinking 的 Speech-to-Speech Quality Index 为 82.6、τ-Voice 为 68.6%,Live 在 Speech Agent Arena 排第 2。

研发含义:实时语音链路应把音频流、工具作业队列、状态机和结果回注解耦;界面必须允许用户打断、纠正和取消后台动作,并对“仍在执行”提供可感知状态。

97 种支持中途切换的语言
82.6官方披露质量指数
后台工具/API 不阻塞对话
服务为闭源托管 API;基准不等同于含网络、ASR/TTS、业务 API 和环境噪声的真实端到端成功率。
长流程控制 · Qwen Code · 09.17

把 token、轮次、时长、工作流版本和文件写权限变成运行时硬边界

Qwen Code v0.23.3—0.24.0 新增 50 万 token 上限、goalMaxTurnsgoalMaxActiveMinutes 与最后一次收尾机会;子 Agent 和验收检查计入预算。审批绑定精确工作流版本,bwrap 沙箱只允许写工作区、临时目录和指定缓存。

同一会话还可委托 Claude Code、Codex 或外部 ACP Agent,并默认开启跨会话消息。这提高了编排能力,也把信息流边界从单一会话扩展到多执行体。

可审阅记忆 · xAI · 09.16

Memory 只沉淀稳定事实,不把完整会话、秘密与任务状态混入长期层

Grok Build Memory 将约定、决策和项目事实写成 Markdown topic,分项目与全局范围,可由 /memory 浏览、由 /dream 整理;当前会话可以覆盖旧记忆。官方明确排除任务状态、暂定结论、秘密以及仓库或文档中已经存在的内容。

研发含义:可见、可编辑、可覆盖的稀疏记忆比原始对话倾倒更适合作为长期状态;秘密与即时任务态应保留在权限系统和任务运行时。

Grok Build 源码为 Apache 2.0,但该记忆设计尚无公开的跨项目污染率、召回率或长期一致性评测。
生成媒体 · 执行日主榜

图像 Top 20 继续闭源;带音频视频开放模型进入前六

执行日 Artificial Analysis 文生图 Top 20 没有可下载权重条目。With Audio 视频榜则有 MiniMax H3 第 4 与 MAGI-2 Preview 第 6:H3 使用 MiniMax H3 Community License;MAGI-2 的 114B MoE 每 token 激活 6B,权重约 518 GB、Apache 2.0,参考推理要求 8 张 NVIDIA Hopper,当前固定生成 10 秒片段。

研发含义:媒体 PoC 不能只看 Elo:托管图像模型重点测多轮编辑与单位请求成本;自部署视频模型重点测许可、显存/互联、固定时长约束、音画同步和单位成片成本。

04

前沿厂商动态

仅列 09.14—09.20 内可核验的有效更新

Qwen09.17 / 09.18 · Agent 运行时与同传

Qwen Code 加入多 Agent 委托与硬预算;LiveTranslate 覆盖 60 种语言

Qwen Code v0.23.3—0.24.0 将外部 ACP Agent、跨会话消息、目标预算与版本化审批合入运行时,仓库为 Apache 2.0。Qwen3.8-LiveTranslate 支持说话人区分、双语屏幕和长上下文消歧,官方称 LAAL 从 2.8 秒降至 2.3 秒;未见该精确翻译服务权重开放。

Z.ai|智谱09.17 · 推理基础设施

披露 GLM-5.3 Infra Agent 与十万卡国产加速器生产栈

文章报告 W8A8、混合精度 KV cache、张量并行、ReplaySSM、分层切分和 EPD 解耦,称两周内上线、端到端吞吐 3×。这是特定生产栈的厂商数据,需在目标硬件复测。

Google DeepMind09.15 · 实时语音 Agent

Gemini 3.8 Live / Extended Thinking 上线

两档分别面向低延迟规模化和高复杂度多步任务,支持 97 种语言切换、视觉定位与后台工具调用;均为托管闭源服务。

Anthropic09.17 · 科学模型性能工程

发布 36 个生物模型优化套件与复现仓库

官方报告 30 多个开放模型平均约 4× 加速,并明确 exact / fast / big 的精度取舍。原始代码 Apache 2.0,上游许可证分别保留,仓库按“原样”发布且不承诺维护。

xAI09.16 / 09.18 · Agent 记忆与语音转写

Grok Build Memory 上线;Transcribe 2.0 覆盖 19 种语言

Memory 以可浏览 Markdown 保存稳定知识并排除秘密和任务态。Transcribe 2.0 是托管语音转写服务,官方称同价下相对 1.0 准确率提升 2×;该数据需在内部语料复测。

Runway09.17 · 视频 API

API 新增独立帧率增强端点

enhance_frame_rate 支持最高 120 fps 和常见广播帧率,输入最长 300 秒,按每 2 秒 1 credit 计费。它是后处理能力更新,不是新视频生成模型。

Mistral AI09.16 · 端侧浏览器合作

与 Mozilla 合作将 Mistral 接入 Firefox Smart Window Beta

首批覆盖法国与北美,后续扩区。该更新说明浏览器原生 Agent 入口继续扩张,但未发布新模型、权重或可独立复现的能力评测。

05

固定监控入口

榜单一个主源;中文社区只作线索,不承担事实定稿

厂商检查:国内逐项检查 Qwen、DeepSeek、Kimi、MiniMax、智谱/Z.ai、腾讯、小米、京东、字节;海外逐项检查 OpenAI、Anthropic、Google DeepMind、Meta、xAI、Mistral、Microsoft AI、BFL、Runway、Luma。无当周有效更新者不占版面。

开放口径:标准开源(MIT / Apache 2.0)、开放权重自定义许可、同系列有开放权重、托管闭源服务、权重已承诺但未发布分开标注;同名或同系列不自动视作同一 checkpoint。

时间口径:厂商与技术内容严格限定 2026.09.14 00:00—09.20 23:59(Asia/Shanghai);榜单使用 09.21 执行日可获得的最新快照。Arena Text / Vision 榜页均标注更新于 09.13;Artificial Analysis 为 09.21 抓取值,后续会随投票变化。