系统工程 Agent · Anthropic / Z.ai · 09.17Agent 从应用代码走向 CUDA 内核、算子融合与十万卡推理栈
Anthropic 与 FutureHouse 在不到四周内优化 30 多个开放生物模型,发布 36 个即插即用套件;FlashPairformer 的三角注意力报告 2.7—2.9× 加速、三角乘法 1.7—3.2×。仓库把优化分为 off、exact、fast、big,并明确原始代码 Apache 2.0、上游组件沿用各自许可且仓库不承诺维护。
Z.ai 则披露 GLM-5.3 驱动的 Infra Agent 参与 W8A8、INT8/FP8/BF16 KV cache、张量并行、ReplaySSM、分层切分与 EPD 解耦,称从适配到生产少于两周、吞吐 3×,并在六天处理 62 万亿 token。
研发含义:系统 Agent 的评测单位应是“提交 + 镜像 + 硬件拓扑 + 精度模式 + 数值/任务回归”,高吞吐只有在输出一致性与回滚路径成立时才有意义。
36 套可下载优化套件
≈4×Anthropic 报告平均加速
3×Z.ai 报告端到端吞吐
两组数字来自不同任务、硬件和验证口径,不应横向比较;Z.ai 的集群数据为厂商自报。
实时语音 Agent · Google DeepMind · 09.15Gemini 3.8 Live 把后台工具调用并入不中断的多语对话流
Gemini 3.8 Live 面向低延迟规模化,Extended Thinking 面向复杂多步推理;两者可在 97 种语言间中途切换,结合视觉定位,并在继续交谈时后台执行工具/API。官方披露 Extended Thinking 的 Speech-to-Speech Quality Index 为 82.6、τ-Voice 为 68.6%,Live 在 Speech Agent Arena 排第 2。
研发含义:实时语音链路应把音频流、工具作业队列、状态机和结果回注解耦;界面必须允许用户打断、纠正和取消后台动作,并对“仍在执行”提供可感知状态。
97 种支持中途切换的语言
82.6官方披露质量指数
后台工具/API 不阻塞对话
服务为闭源托管 API;基准不等同于含网络、ASR/TTS、业务 API 和环境噪声的真实端到端成功率。
长流程控制 · Qwen Code · 09.17把 token、轮次、时长、工作流版本和文件写权限变成运行时硬边界
Qwen Code v0.23.3—0.24.0 新增 50 万 token 上限、goalMaxTurns、goalMaxActiveMinutes 与最后一次收尾机会;子 Agent 和验收检查计入预算。审批绑定精确工作流版本,bwrap 沙箱只允许写工作区、临时目录和指定缓存。
同一会话还可委托 Claude Code、Codex 或外部 ACP Agent,并默认开启跨会话消息。这提高了编排能力,也把信息流边界从单一会话扩展到多执行体。
可审阅记忆 · xAI · 09.16Memory 只沉淀稳定事实,不把完整会话、秘密与任务状态混入长期层
Grok Build Memory 将约定、决策和项目事实写成 Markdown topic,分项目与全局范围,可由 /memory 浏览、由 /dream 整理;当前会话可以覆盖旧记忆。官方明确排除任务状态、暂定结论、秘密以及仓库或文档中已经存在的内容。
研发含义:可见、可编辑、可覆盖的稀疏记忆比原始对话倾倒更适合作为长期状态;秘密与即时任务态应保留在权限系统和任务运行时。
Grok Build 源码为 Apache 2.0,但该记忆设计尚无公开的跨项目污染率、召回率或长期一致性评测。
生成媒体 · 执行日主榜图像 Top 20 继续闭源;带音频视频开放模型进入前六
执行日 Artificial Analysis 文生图 Top 20 没有可下载权重条目。With Audio 视频榜则有 MiniMax H3 第 4 与 MAGI-2 Preview 第 6:H3 使用 MiniMax H3 Community License;MAGI-2 的 114B MoE 每 token 激活 6B,权重约 518 GB、Apache 2.0,参考推理要求 8 张 NVIDIA Hopper,当前固定生成 10 秒片段。
研发含义:媒体 PoC 不能只看 Elo:托管图像模型重点测多轮编辑与单位请求成本;自部署视频模型重点测许可、显存/互联、固定时长约束、音画同步和单位成片成本。