模型
共 14 款在线模型;标价为官方牌价,单位人民币/百万 tokens。
GLM 5.3 Flash主推
quark/glm-5.3-flashGLM 5 系列首个原生多模态模型,以更低成本提供超越 GLM 5.2 的编程、视觉理解与长程 Agent 能力。
输入
¥0.8/百万 tokens
输出
¥2.8/百万 tokens
上下文1M
最大输出128K
输入
输出
GLM 5.3主推
quark/glm-5.3智谱最新旗舰模型,复杂软件工程与 Agent 任务能力全面进阶,编程表现达开源 SOTA。
输入
¥8/百万 tokens
输出
¥28/百万 tokens
上下文1M
最大输出128K
输入
输出
GLM 5.3 Fast主推
quark/glm-5.3-fastGLM 5.3 的低延迟版本,模型能力与上下文规格一致,适用于对生成速度敏感的编程与 Agent 任务。
输入
¥12/百万 tokens
输出
¥42/百万 tokens
上下文1M
最大输出128K
输入
输出
DeepSeek V4 Pro主推
quark/deepseek-v4-proDeepSeek V4 的深度推理版本,面向数学、代码与科研分析等高难度推理场景。
输入
¥4.5/百万 tokens
输出
¥13.5/百万 tokens
上下文1M
最大输出384K
输入
输出
DeepSeek V4 Flash主推
quark/deepseek-v4-flash已切换至 deepseek-v4-flash-0731 版,DeepSWE 54.4。高吞吐、低延迟,适用于高并发在线服务与批量处理。
输入
¥1.5/百万 tokens
输出
¥4.5/百万 tokens
上下文1M
最大输出384K
输入
输出
Kimi K3主推
quark/kimi-k3Kimi 旗舰模型,支持百万上下文、视觉理解与长程编程,适合复杂知识工作和 Agent 任务。
输入
¥20/百万 tokens
输出
¥100/百万 tokens
上下文1M
最大输出1M
输入
输出
Kimi K3 Fast主推
quark/kimi-k3-fastKimi K3 的满速持续输出版本,模型能力一致,持续生成更快,单价为基础档的 1.5 倍。
输入
¥30/百万 tokens
输出
¥150/百万 tokens
上下文1M
最大输出1M
输入
输出
Kimi K2.7 Code主推
quark/kimi-k2.7-codeKimi K2.7 的代码特化版本,面向大型仓库理解与跨文件编辑,支持图片输入。
输入
¥6.5/百万 tokens
输出
¥27/百万 tokens
上下文256K
最大输出32K
输入
输出
GLM 5.2
quark/glm-5.2智谱 GLM 系列旗舰模型,具备完整推理能力,适用于复杂任务规划与长文档分析。
输入
¥8/百万 tokens
输出
¥28/百万 tokens
上下文1M
最大输出128K
输入
输出
GLM 5.2 Fast
quark/glm-5.2-fastGLM 5.2 的低延迟版本,模型能力一致,优化首字响应时间,单价为基础档的 1.5 倍。
输入
¥12/百万 tokens
输出
¥42/百万 tokens
上下文1M
最大输出128K
输入
输出
GLM 5.1
quark/glm-5.1GLM 上一代旗舰模型,表现稳定,适用于对版本一致性有要求的存量业务。
输入
¥8/百万 tokens
输出
¥28/百万 tokens
上下文200K
最大输出128K
输入
输出
GLM 5
quark/glm-5GLM 5 目录项,与网关计费 public model 对齐,供存量路由与用量统计使用。
输入
¥6/百万 tokens
输出
¥22/百万 tokens
上下文200K
最大输出128K
输入
输出
Kimi K2.5
quark/kimi-k2.5Kimi K2.5 目录项,与网关计费 public model 对齐。
输入
¥4/百万 tokens
输出
¥21/百万 tokens
上下文256K
最大输出32K
输入
输出
Kimi K2.6
quark/kimi-k2.6Kimi 通用模型,支持文本与图片混合输入,适用于长文档与界面截图内容理解。
输入
¥6.5/百万 tokens
输出
¥27/百万 tokens
上下文256K
最大输出32K
输入
输出