TL;DR GLM-5.3-Flash 是智谱 AI 于 2026 年 8 月 26 日发布的 GLM-5 系列首个原生多模态模型。
它总参数 320B、激活参数 18B,在 AA 综合智能指数中取得 57 分,与 Claude Opus 4.8 持平,API 定价仅为 Opus 4.8 的 1/40。
该模型面向全球开源,并已接入 ZCode、AutoClaw 与智谱清言等平台。
GLM-5.3-Flash 是智谱 AI 推出的新一代原生多模态大模型。
模型代号为 320B-A18B,总参数量 320B,每次前向传播激活 18B 参数。
它采用稀疏注意力与线性注意力混合架构,并通过流形约束超连接提升 Scaling 效率。
与 GLM-5.2 相比,GLM-5.3-Flash 在多项 benchmark 和实际使用中全面超越,但定价仅为前者的 1/10。
By the Numbers
- 总参数量:320B
- 激活参数:18B
- AA 综合智能指数:57 分
- 与 Claude Opus 4.8 对比:AA 得分持平
- Z.ai Code Bench 编程表现:与 Claude Opus 4.8 相当
- 定价相对 GLM-5.3:1/10
- 限时折扣相对 GLM-5.3:1/20
- 定价相对 Claude Opus 4.8:1/40
- 预训练语料:30T Token 多模态数据
- 注意力计算量相对 GLM-5.3 降低:3.01 倍
- KV 缓存相对 GLM-5.3 降低:4.44 倍
- 国产芯片端到端性能提升:3 倍
- Blender 自主搭建场景:约 400 平方米
- GLM Coding Plan 体验卡:每天 10,000 张
架构与效率
GLM-5.3-Flash 首次将稀疏注意力与线性注意力结合用于开源前沿模型。
线性注意力通过递归机制捕获局部依赖,稀疏注意力借助轻量索引器召回全局上下文。
IndexPool 把索引器 4 个缓存向量加权池化为 1 个,进一步降低 1M 上下文下的时延与内存。
流形约束超连接把残差连接约束在更低维流形上,提升模型 Scaling 能力。
在相同任务下,注意力计算量与 KV 缓存分别降至 GLM-5.3 的 1/3.01 与 1/4.44。
总参数量与 GLM-4.5 相当,但激活参数从 32B 降到 18B,层数从 92 层降到 45 层,几乎减半。
结合 30T Token 多模态预训练语料,模型以更少的计算资源实现了更强的性能。
Ox-Alpha 匿名测试
正式发布前,智谱以匿名模型 Ox-Alpha 在 OpenCode 与 OpenRouter 平台进行大规模测试。
该模型在中文社区被称作「牛来」。
测试期间,Ox-Alpha 迅速成为当周最受欢迎的模型,创下双平台调用量新高。
这些请求流量全部由国产芯片集群提供算力支持。
原生多模态能力
GLM-5.3-Flash 把视觉编码原生集成到模型中,可直接处理图像并指导代码生成。
在前端开发、游戏开发、3D 仿真等任务中,模型能观察界面渲染效果并迭代改进。
官方展示了一个 Blender 场景生成案例,模型在无外部素材条件下自主运行约 16 小时,搭建了一套约 400 平方米的专业主厨自宅与测试厨房。
在 ZCode 中,Browser Use Agent 与 Computer Use Agent 让模型能够在代码、浏览器与图形界面之间协同工作,并观察验证自身输出。
专业工作场景
针对 PPTX、PDF、DOCX 与 XLSX 等 Office 与文档类任务,GLM-5.3-Flash 新增了视觉理解能力。
它可以检查并优化自身输出,将结果与视觉上下文及预期结果对比,从而实现更有效的自我验证。
在金融领域,模型覆盖从来源研究、报告生成到建模分析的完整流程,并提供可追溯的参考依据。
在法律领域,它可以审查合同中的费用、账户与责任条款,并按律师惯例批注留痕。
国产芯片推理
智谱基于 SGLang 构建了专用推理引擎,并采用 Encode-Prefill-Decode 分离式架构。
该方案将多模态编码、prompt 预填充与逐 token 解码拆分为独立工作池。
通过节点内张量并行、ReplaySSM、W8A8 量化与混合缓存等技术,国产芯片集群上的端到端性能提升了 3 倍。
官方表示,这证明国产芯片可以高效支撑前沿模型的大规模推理。
接入方式
GLM-5.3-Flash 已通过 BigModel 开放平台与 Z.ai 开放 API。
终端用户可在 Z.ai 网页端与智谱清言 App 直接体验。
开发者可在 ZCode 中使用该模型完成从图像到可运行工程的生成。
AutoClaw 办公场景也已接入。
GLM Coding Plan 每天限量发放 10,000 张体验卡。
对比定位
| 维度 | GLM-5.3-Flash | Claude Opus 4.8 |
|---|---|---|
| 总参数 | 320B | 未披露 |
| 激活参数 | 18B | 未披露 |
| AA 综合智能指数 | 57 分 | 57 分 |
| 编程能力 | Z.ai Code Bench 与 Opus 4.8 相当 | 基线 |
| API 定价 | Opus 4.8 的 1/40 | 基线 |
| 开源情况 | 全球开源 | 闭源 |
上表仅列出官方披露的关键指标对比,具体数值以智谱官方页面为准。
常见问题
问 GLM-5.3-Flash 是什么
它是智谱 AI 发布的 GLM-5 系列首个原生多模态大模型,总参数 320B,激活参数 18B。
问 性能处于什么水平
在 Artificial Analysis Intelligence Index 中取得 57 分,与 Claude Opus 4.8 持平。
在智谱自研的 Z.ai Code Bench 体感评估中,其编程表现也与 Opus 4.8 相当。
问 API 价格如何
正式定价为 GLM-5.3 的 1/10,限时折扣为 1/20,约为 Claude Opus 4.8 的 1/40。
具体调用价格以 BigModel 开放平台与 Z.ai 页面为准。
问 是否开源
是,GLM-5.3-Flash 已面向全球开源,权重可在 HuggingFace 获取。
问 国产芯片支持到什么程度
智谱在国产芯片集群上实现了端到端性能提升 3 倍,并达到与主流英伟达 GPU 相当的硬件效率。
测试期间的 Ox-Alpha 流量全部由国产芯片提供算力。
问 可以在哪些平台体验
可通过 Z.ai、智谱清言 App、ZCode、AutoClaw 与 BigModel 开放平台使用。
GLM Coding Plan 每天提供 10,000 张体验卡。
来源说明
信息来自智谱官方微信公众号《GLM-5.3-Flash:前沿智能进入普惠时代》、Z.ai 博客以及 BigModel 开放平台文档。