Z.ai 发布 GLM-5.3-Flash:Ox Alpha 匿名预览正式命名,320B-A18B MIT 开源
Z.ai 8 月 26 日正式发布 GLM-5.3-Flash,即此前在 OpenRouter 以 Ox Alpha 匿名预览的模型。320B 总参数 / 18B 激活参数 MoE 架构,1M token 上下文,原生多模态(文本/图像/视频),MIT 许可。API 定价 $0.15/$0.50 每百万 token。在 DeepSWE 和 AutomationBench 较 GLM-5.2 大幅提升,GDPVal-AA v2 领先 Opus 4.8 和 GPT-5.6 Terra。
Z.ai 发布 GLM-5.3-Flash
2026 年 8 月 26 日,Z.ai 正式发布 GLM-5.3-Flash,即此前在 OpenRouter 以 stealth/ox-alpha 匿名预览的模型。Bloomberg 同日报道确认 Zhipu(智谱)为背后公司。
关键事实
| 项目 | 详情 |
|---|---|
| 架构 | 320B 总参数 / 18B 激活参数(MoE) |
| 上下文 | 1M token,原生多模态 |
| 许可 | MIT |
| API 定价 | $0.15/M 输入,$0.50/M 输出,$0.03/M 缓存 |
| 权重 | Hugging Face 开放 |
| 匿名预览 | 8 月 20 日上线 OpenRouter,8 月 26 日正式命名 |
基准测试
| 基准 | GLM-5.3-Flash | GLM-5.2 | Opus 4.8 | GPT-5.6 Terra |
|---|---|---|---|---|
| DeepSWE | 63.4 | 46.2 | 69.7 | 69.6 |
| AutomationBench | 48.8 | 26.2 | 46.2 | 45.8 |
| GDPVal-AA v2 | 1773 | 1504 | 1582 | 1571 |
| Terminal Bench 2.1 | 51.7 | - | 53.2 | - |
技术亮点
- 原生视觉能力:可观察界面、渲染结果和交互反馈,形成代码-浏览器-GUI 闭环
- 高效混合架构:线性 + 稀疏注意力,大幅降低计算和 KV-cache 需求
- 中国芯片服务:声称整个匿名预览期间完全在中国 AI 芯片上运行
影响分析
| 维度 | 影响 |
|---|---|
| 开源生态 | MIT 许可的前沿 MoE 模型,商业可用 |
| 编码 Agent | DeepSWE 和 AutomationBench 显著提升 |
| 推理成本 | Flash 级定价,适合高吞吐场景 |
| 中国芯片 | 声称完全在中国 AI 芯片上服务 |
风险边界与后续观察
- 独立评测:社区需验证官方基准的可复现性
- 中国芯片:推理性能和成本是否可在中国芯片上持续
- 竞争格局:与 Qwen3.8-27B、Muse Glimmer 30B 的同级对比
AI Master 解读
核心事件
Z.ai 将匿名预览 Ox Alpha 正式命名为 GLM-5.3-Flash 并开源。
行业影响
为什么重要: 这是"stealth release"策略的完整闭环——8 月 20 日匿名上线 OpenRouter 收集反馈,6 天后正式命名发布。320B-A18B 的 MoE 架构在效率上远超传统密集模型,18B 激活参数意味着消费级硬件可运行。MIT 许可使其成为商业友好度最高的前沿开源模型之一。
影响分析:
| 维度 | 影响 |
|---|---|
| 开源生态 | MIT 许可的前沿 MoE 模型,商业可用 |
| 编码 Agent | DeepSWE 和 AutomationBench 显著提升 |
| 推理成本 | $0.15/M 输入,Flash 级定价 |
| 中国芯片 | 声称完全在中国 AI 芯片上服务 |
AI Master 建议
评估 GLM-5.3-Flash 在编码和 Agent 场景的实际表现;关注中国芯片推理的可行性验证;对比 Qwen3.8-27B 和 Muse Glimmer 30B 的同级竞争。
