智谱 GLM-5.3-Flash 开源 320B-A18B 多模态模型对标 Claude Opus 4.8

智谱 GLM-5.3-Flash 开源 320B-A18B 多模态模型对标 Claude Opus 4.8

  • 全站源码免费
  • 日/微信/10次解锁
  • 日/IP/100次解锁

TL;DR GLM-5.3-Flash 是智谱 AI 于 2026 年 8 月 26 日发布的 GLM-5 系列首个原生多模态模型。

它总参数 320B、激活参数 18B,在 AA 综合智能指数中取得 57 分,与 Claude Opus 4.8 持平,API 定价仅为 Opus 4.8 的 1/40。

该模型面向全球开源,并已接入 ZCode、AutoClaw 与智谱清言等平台。

智谱 GLM-5.3-Flash 开源 320B-A18B 多模态模型对标 Claude Opus 4.8

GLM-5.3-Flash 是智谱 AI 推出的新一代原生多模态大模型。

模型代号为 320B-A18B,总参数量 320B,每次前向传播激活 18B 参数。

它采用稀疏注意力与线性注意力混合架构,并通过流形约束超连接提升 Scaling 效率。

与 GLM-5.2 相比,GLM-5.3-Flash 在多项 benchmark 和实际使用中全面超越,但定价仅为前者的 1/10。

By the Numbers

  • 总参数量:320B
  • 激活参数:18B
  • AA 综合智能指数:57 分
  • 与 Claude Opus 4.8 对比:AA 得分持平
  • Z.ai Code Bench 编程表现:与 Claude Opus 4.8 相当
  • 定价相对 GLM-5.3:1/10
  • 限时折扣相对 GLM-5.3:1/20
  • 定价相对 Claude Opus 4.8:1/40
  • 预训练语料:30T Token 多模态数据
  • 注意力计算量相对 GLM-5.3 降低:3.01 倍
  • KV 缓存相对 GLM-5.3 降低:4.44 倍
  • 国产芯片端到端性能提升:3 倍
  • Blender 自主搭建场景:约 400 平方米
  • GLM Coding Plan 体验卡:每天 10,000 张

架构与效率

GLM-5.3-Flash 首次将稀疏注意力与线性注意力结合用于开源前沿模型。

线性注意力通过递归机制捕获局部依赖,稀疏注意力借助轻量索引器召回全局上下文。

IndexPool 把索引器 4 个缓存向量加权池化为 1 个,进一步降低 1M 上下文下的时延与内存。

流形约束超连接把残差连接约束在更低维流形上,提升模型 Scaling 能力。

在相同任务下,注意力计算量与 KV 缓存分别降至 GLM-5.3 的 1/3.01 与 1/4.44。

总参数量与 GLM-4.5 相当,但激活参数从 32B 降到 18B,层数从 92 层降到 45 层,几乎减半。

结合 30T Token 多模态预训练语料,模型以更少的计算资源实现了更强的性能。

Ox-Alpha 匿名测试

正式发布前,智谱以匿名模型 Ox-Alpha 在 OpenCode 与 OpenRouter 平台进行大规模测试。

该模型在中文社区被称作「牛来」。

测试期间,Ox-Alpha 迅速成为当周最受欢迎的模型,创下双平台调用量新高。

这些请求流量全部由国产芯片集群提供算力支持。

原生多模态能力

GLM-5.3-Flash 把视觉编码原生集成到模型中,可直接处理图像并指导代码生成。

在前端开发、游戏开发、3D 仿真等任务中,模型能观察界面渲染效果并迭代改进。

官方展示了一个 Blender 场景生成案例,模型在无外部素材条件下自主运行约 16 小时,搭建了一套约 400 平方米的专业主厨自宅与测试厨房。

在 ZCode 中,Browser Use Agent 与 Computer Use Agent 让模型能够在代码、浏览器与图形界面之间协同工作,并观察验证自身输出。

专业工作场景

针对 PPTX、PDF、DOCX 与 XLSX 等 Office 与文档类任务,GLM-5.3-Flash 新增了视觉理解能力。

它可以检查并优化自身输出,将结果与视觉上下文及预期结果对比,从而实现更有效的自我验证。

在金融领域,模型覆盖从来源研究、报告生成到建模分析的完整流程,并提供可追溯的参考依据。

在法律领域,它可以审查合同中的费用、账户与责任条款,并按律师惯例批注留痕。

国产芯片推理

智谱基于 SGLang 构建了专用推理引擎,并采用 Encode-Prefill-Decode 分离式架构。

该方案将多模态编码、prompt 预填充与逐 token 解码拆分为独立工作池。

通过节点内张量并行、ReplaySSM、W8A8 量化与混合缓存等技术,国产芯片集群上的端到端性能提升了 3 倍。

官方表示,这证明国产芯片可以高效支撑前沿模型的大规模推理。

接入方式

GLM-5.3-Flash 已通过 BigModel 开放平台与 Z.ai 开放 API。

终端用户可在 Z.ai 网页端与智谱清言 App 直接体验。

开发者可在 ZCode 中使用该模型完成从图像到可运行工程的生成。

AutoClaw 办公场景也已接入。

GLM Coding Plan 每天限量发放 10,000 张体验卡。

对比定位

维度 GLM-5.3-Flash Claude Opus 4.8
总参数 320B 未披露
激活参数 18B 未披露
AA 综合智能指数 57 分 57 分
编程能力 Z.ai Code Bench 与 Opus 4.8 相当 基线
API 定价 Opus 4.8 的 1/40 基线
开源情况 全球开源 闭源

上表仅列出官方披露的关键指标对比,具体数值以智谱官方页面为准。

常见问题

GLM-5.3-Flash 是什么

它是智谱 AI 发布的 GLM-5 系列首个原生多模态大模型,总参数 320B,激活参数 18B。

性能处于什么水平

在 Artificial Analysis Intelligence Index 中取得 57 分,与 Claude Opus 4.8 持平。

在智谱自研的 Z.ai Code Bench 体感评估中,其编程表现也与 Opus 4.8 相当。

API 价格如何

正式定价为 GLM-5.3 的 1/10,限时折扣为 1/20,约为 Claude Opus 4.8 的 1/40。

具体调用价格以 BigModel 开放平台与 Z.ai 页面为准。

是否开源

是,GLM-5.3-Flash 已面向全球开源,权重可在 HuggingFace 获取。

国产芯片支持到什么程度

智谱在国产芯片集群上实现了端到端性能提升 3 倍,并达到与主流英伟达 GPU 相当的硬件效率。

测试期间的 Ox-Alpha 流量全部由国产芯片提供算力。

可以在哪些平台体验

可通过 Z.ai、智谱清言 App、ZCode、AutoClaw 与 BigModel 开放平台使用。

GLM Coding Plan 每天提供 10,000 张体验卡。

来源说明

信息来自智谱官方微信公众号《GLM-5.3-Flash:前沿智能进入普惠时代》、Z.ai 博客以及 BigModel 开放平台文档。

最后更新 2026-08-27

本文章资源https://www.aosen.cc/mianfei15348.html来源于互联网,如存在侵权,请联系我们立马删除!
0
显示验证码