托管 Agent 平台 · OpenAI · 09.29GPT-6.1 Sol 与 Agents API 把模型、编排和浏览器执行合成一条产品线
GPT-6.1 Sol 提供 105 万 token 上下文、12.8 万 token 最大输出,支持 Responses API 的函数、网页搜索、文件搜索、计算机使用和 MCP 等工具。同期 Agents API 进入 beta,加入多 Agent 协作、工具搜索/调用、上下文压缩,以及由 OpenAI 托管的浏览器 computer use。
官方称 DeepSWE v1.1 在相同设置下比 Sol 高 6.4 个百分点;新模型在 AutomationBench 相对 Sol 提高 4.8 点,在 OSWorld 2.0 最大推理下接近 Astra、单位任务成本约为后者七分之一。更值得关注的是评测单位已经包含 Agent harness,而不只是裸模型。
研发含义:PoC 应锁定任务集、浏览器镜像、工具权限和完成判据,记录每次成功成本、来源审批、失败恢复与人工接管;来源切换时按官方要求重新审批。
1.05M输入上下文上限
128K最大输出
≈1/7官方 OSWorld 单位任务成本对 Astra
上述基准与成本来自 OpenAI 自有 harness;托管服务成绩不能代表任何可下载 checkpoint,企业身份与数据边界也需另行验证。
长流程代码 · Google DeepMind · 09.30Gemini 4 Argon 用超长输出推进大规模迁移,但仍处于受限开放
Google 把 Argon 的输出上限从 64K 提升到 100 万 token,披露其参与 80 万行以上 Fuchsia Zircon 内核 C/C++→Rust 迁移,并将 libgav1 的 32K 行 SIMD 代码重写为输出一致、官方报告快 2.7× 的 Rust 实现。内部部署还释放 300 TiB 以上内存,官方估算长期总节省可达 500 TiB—1 PiB。
在公开/半公开评测上,官方给出 DeepSWE v1.1 77.9%、CWE-Bench v1 68%。当前模型仅通过 Fairwind 计划向受信任网络安全防御者限量开放,并未形成公开 API 或可下载权重。
研发含义:大迁移要把 Agent 输出拆为可编译、可回滚的小提交;长上下文负责维持架构约束,CI 与人工评审负责证明行为等价。
1M最大输出 token
800K+内核迁移代码行
2.7×官方 libgav1 案例速度
案例是 Google 内部工程且模型受限开放;不能把内部结果当作公共生产可用性或一般代码仓库收益。
开放权重 Agent 安全 · Anthropic / NIST · 09.29GLM-5.3 的攻防测试再次说明:模型内拒答不能替代运行时隔离
Anthropic 针对开放权重 GLM-5.3 做模拟攻防,称简单绕过技术在其设置中达到 64%—100%;NIST CAISI 更早的独立报告给出 SEC-Bench Pro 40.4%、ExploitBench 61.1%、ExploitGym 9.4% 与 OSS-Fuzz 7.7%,并称其是发布时最强的开放权重网络模型。
研发含义:能写代码、调用工具又可本地修改安全层的模型,应在短期凭据、网络白名单、只读根文件系统、审计日志与高风险动作审批下运行。
Anthropic 与 Z.ai 存在市场竞争,测试结论应视为厂商对抗性研究;NIST 使用不同任务,两组数字不能直接合并或解释为真实攻击率。
国产加速器内核 · DeepSeek · 09.30FlashMLA / DeepGEMM 为 Ascend 950 给出可复现的版本边界
DeepGEMM-Ascend 首版面向 Ascend 950,固定 CANN 9.20、torch_npu 与 Python ≥3.10,覆盖 BF16/FP8/FP4 GEMM、MQA logits 与 MegaMoE,保持与 DeepGEMM 相近的接口,许可证为 MIT。FlashMLA 同日加入 V4.1 稀疏注意力预填充和解码,官方报告预填充最高 410 TFLOPS、典型 V4.1 负载 360 TFLOPS。
升级并非无成本:新版本移除 Hopper 与旧 V3/V3.2/V4 支持,并修改 FP8/FP4 KV cache 格式。生产升级必须把旧提交、模型和缓存格式一同纳入回滚方案。
开放权重 Computer Use · H Company · 09.28Holo4 将 GUI、代码、MCP/API 放进同一多模态 Agent 接口
H Company 发布 Holo4-27B dense 与 Holo4-35B-A3B MoE,覆盖桌面、网页和 Android 的 GUI 操作,也能写代码并调用 MCP/API。官方同时公开 BF16、FP8、NVFP4、GGUF 权重与轨迹数据;27B 权重为 CC BY-NC 4.0,35B-A3B 为 Apache 2.0,二者不能统一写成“开源”。
官方模型卡在 OSWorld 2.0 给出 27B 61.7%、每任务 1.22 美元;其示例长任务消耗 130 万—240 万 token、68—94 次工具调用,提示开放权重只解决部署控制权,并不自动解决长轨迹成本与可靠性。
研发含义:PoC 应同时评测 UI 定位、工具选择、跨环境状态恢复、单位完成成本和许可边界;商业使用优先核对 35B-A3B 的 Apache 2.0 精确仓库,不能把 27B 的非商业权重混用。
OSWorld 数字来自团队模型卡,且可能随环境和 harness 变化;不同量化版本也应视作独立部署制品复测。
生成媒体 · 执行日主榜图像头部仍以托管服务为主;带音频视频榜出现精确可下载 H3
执行日 Artificial Analysis 文生图 Top 20 中,只有 Qwen-Image-2.1(第 19)有精确可下载权重,使用 Qwen Research License,而 Qwen-Image-3.0 / Pro 的榜单服务不能据此视为开放。With Audio 视频榜中 MiniMax H3 第 4,官方权重可下载但采用 MiniMax 自定义许可;第 5 的 fal 后训练 H3 Max 不是同一 checkpoint。
FLUX 3 位列视频第 6,但当前内容生成版本仍是托管/私有权重;BFL 只承诺后续推出开放权重内容版,不能用已经发布的 FLUX 3 Action 动作模型替代。
研发含义:媒体模型选型要同时记录榜单精确服务名、权重提交、许可、分辨率/时长、音频能力和单位成片成本;“同系列开放”不能替代精确 checkpoint 核验。