模型

共 14 款在线模型;标价为官方牌价,单位人民币/百万 tokens。

14 / 14 款
GLM 5.3 Flash主推
quark/glm-5.3-flash

GLM 5 系列首个原生多模态模型,以更低成本提供超越 GLM 5.2 的编程、视觉理解与长程 Agent 能力。

输入
¥0.8/百万 tokens
输出
¥2.8/百万 tokens
上下文1M
最大输出128K
输入
输出
GLM 5.3主推
quark/glm-5.3

智谱最新旗舰模型,复杂软件工程与 Agent 任务能力全面进阶,编程表现达开源 SOTA。

输入
¥8/百万 tokens
输出
¥28/百万 tokens
上下文1M
最大输出128K
输入
输出
GLM 5.3 Fast主推
quark/glm-5.3-fast

GLM 5.3 的低延迟版本,模型能力与上下文规格一致,适用于对生成速度敏感的编程与 Agent 任务。

输入
¥12/百万 tokens
输出
¥42/百万 tokens
上下文1M
最大输出128K
输入
输出
DeepSeek V4 Pro主推
quark/deepseek-v4-pro

DeepSeek V4 的深度推理版本,面向数学、代码与科研分析等高难度推理场景。

输入
¥4.5/百万 tokens
输出
¥13.5/百万 tokens
上下文1M
最大输出384K
输入
输出
DeepSeek V4 Flash主推
quark/deepseek-v4-flash

已切换至 deepseek-v4-flash-0731 版,DeepSWE 54.4。高吞吐、低延迟,适用于高并发在线服务与批量处理。

输入
¥1.5/百万 tokens
输出
¥4.5/百万 tokens
上下文1M
最大输出384K
输入
输出
Kimi K3主推
quark/kimi-k3

Kimi 旗舰模型,支持百万上下文、视觉理解与长程编程,适合复杂知识工作和 Agent 任务。

输入
¥20/百万 tokens
输出
¥100/百万 tokens
上下文1M
最大输出1M
输入
输出
Kimi K3 Fast主推
quark/kimi-k3-fast

Kimi K3 的满速持续输出版本,模型能力一致,持续生成更快,单价为基础档的 1.5 倍。

输入
¥30/百万 tokens
输出
¥150/百万 tokens
上下文1M
最大输出1M
输入
输出
Kimi K2.7 Code主推
quark/kimi-k2.7-code

Kimi K2.7 的代码特化版本,面向大型仓库理解与跨文件编辑,支持图片输入。

输入
¥6.5/百万 tokens
输出
¥27/百万 tokens
上下文256K
最大输出32K
输入
输出
GLM 5.2
quark/glm-5.2

智谱 GLM 系列旗舰模型,具备完整推理能力,适用于复杂任务规划与长文档分析。

输入
¥8/百万 tokens
输出
¥28/百万 tokens
上下文1M
最大输出128K
输入
输出
GLM 5.2 Fast
quark/glm-5.2-fast

GLM 5.2 的低延迟版本,模型能力一致,优化首字响应时间,单价为基础档的 1.5 倍。

输入
¥12/百万 tokens
输出
¥42/百万 tokens
上下文1M
最大输出128K
输入
输出
GLM 5.1
quark/glm-5.1

GLM 上一代旗舰模型,表现稳定,适用于对版本一致性有要求的存量业务。

输入
¥8/百万 tokens
输出
¥28/百万 tokens
上下文200K
最大输出128K
输入
输出
GLM 5
quark/glm-5

GLM 5 目录项,与网关计费 public model 对齐,供存量路由与用量统计使用。

输入
¥6/百万 tokens
输出
¥22/百万 tokens
上下文200K
最大输出128K
输入
输出
Kimi K2.5
quark/kimi-k2.5

Kimi K2.5 目录项,与网关计费 public model 对齐。

输入
¥4/百万 tokens
输出
¥21/百万 tokens
上下文256K
最大输出32K
输入
输出
Kimi K2.6
quark/kimi-k2.6

Kimi 通用模型,支持文本与图片混合输入,适用于长文档与界面截图内容理解。

输入
¥6.5/百万 tokens
输出
¥27/百万 tokens
上下文256K
最大输出32K
输入
输出