360智脑开放平台

让企业用 AI,像用水电一样简单

更多链接
模型广场控制台API Keys用量查询文档
360智脑开放平台. 保留所有权利|隐私政策|服务条款
360智脑开放平台
360智脑开放平台
  • 模型广场
  • 官方文档
  • Playground
G

z-ai/glm-5.3-flash

在线对话
智谱

发布时间

2026/8/27

模型系列

GLM

输入模态

输出模态

输入价格

¥0.4 / 1M tokens

输出价格

¥1.4 / 1M tokens

缓存写入价格

¥0.5 / 1M tokens

缓存读取价格

¥0.115 / 1M tokens

上下文窗口

1,000,000

最大输出长度

128,000

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,以极致低成本架构实现超越 GLM-5.2 的更强智能: GLM-5.3-Flash 总参数量 320B、激活参数量 18B,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。在保持精准长上下文能力的同时,显著降低计算与服务成本。相比 GLM-5.3,其注意力计算量和 KV 缓存大小分别降低 3.01 倍和 4.44 倍。 视觉能力被原生融入 Coding 循环,使模型能够主动观察界面、渲染结果与交互反馈,并据此持续测试和改进。无论是前端开发、游戏构建、Blender 3D 场景,还是 BUA、CUA 驱动的真实环境操作,模型都能在代码、浏览器和图形界面之间协同完成任务。 GLM-5.3-Flash 进一步拓展至 Office、金融研究和专业文档等工作场景。它能够自主拆解复杂目标、调用合适工具、检查并优化输出,完成从研究分析、模型构建到 PPTX、PDF、DOCX、XLSX 成品交付的完整工作流。

z-ai/glm-5.3-flash的供应商

智脑 API 根据调度策略向最合适的供应商发起请求,并自动回退至可用性最高的供应商。

排序
智
智谱
国内

首字延迟

6.40s

吞吐量

26.75tps

可用性

35.00%

供应商模型名

bigmodel/z-ai/glm-5.3-flash

支持的参数

temperaturetop_ptop_k

近期可用性

9月2日 11 AM35.04%
8月30日 5 PM: 100.00%8月30日 5 PM: 100.00%8月30日 6 PM: 100.00%8月30日 6 PM: 100.00%8月30日 7 PM: 100.00%8月30日 7 PM: 100.00%8月30日 8 PM: 99.58%8月30日 8 PM: 96.95%8月30日 9 PM: 96.87%8月30日 9 PM: 97.78%8月30日 10 PM: 96.22%8月30日 10 PM: 98.68%8月30日 11 PM: 97.18%8月30日 11 PM: 95.29%8月31日 8 AM: 97.49%8月31日 9 AM: 99.93%8月31日 9 AM: 92.03%8月31日 10 AM: 66.21%8月31日 10 AM: 61.72%8月31日 11 AM: 62.01%8月31日 11 AM: 100.00%8月31日 12 PM: 90.48%8月31日 12 PM: 97.85%8月31日 1 PM: 99.82%8月31日 1 PM: 100.00%8月31日 2 PM: 100.00%8月31日 2 PM: 100.00%8月31日 3 PM: 83.33%8月31日 3 PM: 81.82%8月31日 4 PM: 76.09%8月31日 4 PM: 66.75%8月31日 5 PM: 77.08%8月31日 5 PM: 100.00%8月31日 6 PM: 100.00%8月31日 6 PM: 98.78%8月31日 7 PM: 100.00%8月31日 7 PM: 98.79%8月31日 8 PM: 99.50%8月31日 8 PM: 99.85%8月31日 9 PM: 99.88%8月31日 10 PM: 93.89%8月31日 10 PM: 99.81%8月31日 11 PM: 100.00%9月1日 8 AM: 100.00%9月1日 9 AM: 100.00%9月1日 9 AM: 100.00%9月1日 10 AM: 100.00%9月1日 10 AM: 63.71%9月1日 11 AM: 100.00%9月1日 11 AM: 76.78%9月1日 12 PM: 100.00%9月1日 12 PM: 99.73%9月1日 2 PM: 100.00%9月1日 3 PM: 64.46%9月1日 3 PM: 53.02%9月1日 4 PM: 59.68%9月1日 4 PM: 71.73%9月1日 5 PM: 55.61%9月1日 5 PM: 72.84%9月1日 6 PM: 100.00%9月1日 6 PM: 100.00%9月1日 7 PM: 96.40%9月1日 10 PM: 97.00%9月1日 10 PM: 99.58%9月1日 11 PM: 94.88%9月1日 11 PM: 96.15%9月2日 8 AM: 93.94%9月2日 9 AM: 59.96%9月2日 9 AM: 42.03%9月2日 10 AM: 34.75%9月2日 10 AM: 30.22%9月2日 11 AM: 35.04%

推理

可切换推理

支持的响应格式

OpenAI Chat CompletionsOpenAI ResponsesAnthropic Messages

上下文长度

1,000,000

最大输出

128,000

输入价格

¥0.4 / 1M tokens

输出价格

¥1.4 / 1M tokens

缓存写入

¥0.5 / 1M tokens

缓存读取

¥0.115 / 1M tokens

腾
腾讯混元
国内

首字延迟

暂无数据

吞吐量

暂无数据

可用性

暂无数据

供应商模型名

tencent/z-ai/glm-5.3-flash

支持的参数

temperaturetop_ptop_k

近期可用性

8月30日 11 AM暂无数据
暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据暂无数据

推理

可切换推理

支持的响应格式

OpenAI Chat CompletionsOpenAI ResponsesAnthropic Messages

上下文长度

1,000,000

最大输出

128,000

输入价格

¥0.4 / 1M tokens

输出价格

¥1.4 / 1M tokens

缓存写入

¥0.5 / 1M tokens

缓存读取

¥0.115 / 1M tokens

z-ai/glm-5.3-flash的性能

在智脑 API 上对比不同供应商的表现

吞吐量

25.14 tok/s

首字延迟

3.16 s

z-ai/glm-5.3-flash的可用性

z-ai/glm-5.3-flash的各供应商可用性

z-ai/glm-5.3-flash示例代码与 API

获取 API Key

智脑 API 为您统一各供应商的请求与响应格式

查看完整文档
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.360.cn/v1",
  apiKey: process.env.ZHINAO_API_KEY,
});

const response = await client.chat.completions.create({
  model: "z-ai/glm-5.3-flash",
  messages: [
    { role: "user", content: "Hello, how are you?" }
  ],
  temperature: 0.7,
  max_tokens: 1000,
});

console.log(response.choices[0].message.content);