大模型价格列表

1594 字
8 分钟
大模型价格列表

汇总了一些国内外大语言模型(LLM)的 API 定价信息。仅供参考。

国内大模型#

更新时间:2026-08-26 (单位统一为元/1M Tokens)

百度 (Baidu)#

数据来源:百度智能云千帆大模型平台(原价单位:元/千 Tokens)

模型名称输入价格 (元/1M Tokens)输出价格 (元/1M Tokens)说明
ERNIE 5.14 (≤32k)
6 (>32k)
18 (≤32k)
22 (>32k)
ERNIE 5.0
(Thinking-Preview/Latest/Exp)
6 (≤32k)
10 (>32k)
24 (≤32k)
40 (>32k)
ERNIE 4.5 Turbo0.83.2缓存命中: 0.2
批量: 0.32 / 1.28
ERNIE 4.5 Turbo VL
(视觉)
39缓存命中: 0.75

联网搜索:0.004 元/次

阿里云 (Aliyun)#

数据来源:阿里云百炼模型价格 | 上下文缓存说明

模型名称输入价格 (元/1M Tokens)输出价格 (元/1M Tokens)说明
Qwen 3.8 Max
(qwen3.8-max)
1236Batch 半价,上下文缓存有折扣
Qwen 3.7 Max
(qwen3.7-max)
1236当前限时 5 折
Qwen 3.6 Max Preview
(qwen3.6-max-preview)
9 (≤128K)
15 (≤256K)
54 (≤128K)
90 (≤256K)
Batch 调用半价
Qwen 3.7 Plus
(qwen3.7-plus)
2 (≤256K)
6 (≤1M)
8 (≤256K)
24 (≤1M)
当前限时 8 折
Qwen 3.7 Flash
(qwen3.7-flash)
0.2 (≤1M)
0.6 (≤32K)
0.8 (≤1M)
2.4 (≤32K)

上下文缓存说明: 阿里云支持显式缓存和隐式缓存两种模式,互斥,单次请求只能应用其中一种。

  • 显式缓存:需在 messages 中添加 cache_control 标记启用。创建缓存按输入标准价 125% 计费,命中按 10% 计费,有效期 5 分钟(命中刷新)。
  • 隐式缓存:自动模式,无需配置。系统基于前缀匹配自动缓存,创建不额外收费,命中按 20% 计费,有效期由系统管理。

智谱AI (ZhipuAI)#

数据来源:智谱AI开放平台

文本模型

模型名称输入价格 (元/1M Tokens)输出价格 (元/1M Tokens)说明
GLM-5.3828缓存命中: 2
面向复杂软件工程与长程 Agent 任务
GLM-5.2828缓存命中: 2
GLM-5.16 (≤32k)
8 (>32k)
24 (≤32k)
28 (>32k)
缓存命中: 1.3 / 2
GLM-5-Turbo5 (≤32k)
7 (>32k)
22 (≤32k)
26 (>32k)
缓存命中: 1.2 / 1.8
GLM-54 (≤32k)
6 (>32k)
18 (≤32k)
22 (>32k)
缓存命中: 1 / 1.5
GLM-4.72 (≤32k, 短输出)
3 (≤32k, 长输出)
4 (>32k)
8 (≤32k, 短输出)
14 (≤32k, 长输出)
16 (>32k)
短输出: <0.2k
长输出: ≥0.2k
缓存命中: 0.4/0.6/0.8

视觉模型

模型名称输入价格 (元/1M Tokens)输出价格 (元/1M Tokens)说明
GLM-5V-Turbo5 (≤32k)
7 (>32k)
22 (≤32k)
26 (>32k)
缓存命中: 1.2 / 1.8
GLM-4.6V1 (≤32k)
2 (≤128k)
3 (≤32k)
6 (≤128k)
缓存命中: 0.2 / 0.4
GLM-4.6V-Flash免费免费缓存命中: 免费

缓存存储限时免费。

DeepSeek#

数据来源:DeepSeek API Docs 2026-08 起实行分时段计价:高峰时段为北京时间周一至周五 9:00-12:00、14:00-18:00(其余为空闲时段),空闲时段价格为高峰时段的一半。

模型名称输入价格 (元/1M Tokens)输出价格 (元/1M Tokens)说明
DeepSeek-V4-Flash
(deepseek-v4-flash)
空闲: 1.5
高峰: 3.0
空闲: 4.5
高峰: 9.0
缓存命中: 0.05 / 0.10
上下文 1M,最大输出 384K
DeepSeek-V4-Pro
(deepseek-v4-pro)
空闲: 4.5
高峰: 9.0
空闲: 13.5
高峰: 27.0
缓存命中: 0.15 / 0.30
上下文 1M,最大输出 384K
DeepSeek-V4-Flash-Vision
(deepseek-v4-flash-vision-exp)
空闲: 1.5
高峰: 3.0
空闲: 4.5
高峰: 9.0
视觉模型,图片按 token 计费
缓存命中: 0.05 / 0.10

并发限制:Flash 2500、Pro 500。

火山引擎 (Volcengine)#

数据来源:火山方舟大模型服务平台

模型名称输入价格 (元/1M Tokens)输出价格 (元/1M Tokens)说明
doubao-seed-2.1-pro630输入缓存命中: 1.2
缓存存储: 0.017元/1M/小时
doubao-seed-2.1-turbo315输入缓存命中: 0.6
缓存存储: 0.017元/1M/小时
doubao-seed-2.0-pro3.2 (≤32k)
4.8 (32k-128k]
9.6 (128k-256k]
16 (≤32k)
24 (32k-128k]
48 (128k-256k]
输入缓存命中: 0.64/0.96/1.92
缓存存储: 0.017元/1M/小时
doubao-seed-2.0-lite0.6 (≤32k)
0.9 (32k-128k]
1.8 (128k-256k]
3.6 (≤32k)
5.4 (32k-128k]
10.8 (128k-256k]
输入缓存命中: 0.12/0.18/0.36
缓存存储: 0.017元/1M/小时

分段计费说明: 部分模型按输入长度(及输出长度)划分价格区间。例如,请求输入 200k tokens、输出 14k tokens,满足输入长度 (128, 256] 条件,则输入按对应区间单价计费。 DeepSeek-V4 调价: 火山引擎的 deepseek-v4-pro / v4-flash 将于 2026-08-28 起调价,调整后 pro 为 9 / 27 元(缓存命中 0.3),flash 为 3 / 9 元(缓存命中 0.1)。

MiniMax#

数据来源:MiniMax 开放平台

模型名称输入价格 (元/1M Tokens)输出价格 (元/1M Tokens)说明
MiniMax-M34.2 (≤512k)
8.4 (>512k)
16.8 (≤512k)
33.6 (>512k)
永久五折: 2.1 / 4.2 与 8.4 / 16.8
缓存读取: 0.84 / 1.68
MiniMax-M2.72.18.4输入缓存命中: 0.42
缓存写入: 2.625
MiniMax-M2.7-highspeed4.216.8输入缓存命中: 0.42
缓存写入: 2.625

月之暗面 (Moonshot AI)#

数据来源:Moonshot AI 开放平台

模型名称输入价格 (元/1M Tokens)输出价格 (元/1M Tokens)说明
kimi-k320100旗舰模型,1M 上下文
缓存命中: 2
支持推理强度调节 (low/high/max)
kimi-k2.7-code6.5027.00编程模型,256K 上下文
缓存命中: 1.30
kimi-k2.7-code-highspeed13.0054.00高速版,输出约 180-260 Tokens/s
缓存命中: 2.60
kimi-k2.66.5027.00通用模型,256K 上下文
缓存命中: 1.10
kimi-k2.5421多模态模型,256K 上下文
缓存命中: 0.70
moonshot-v1-8k210

国外大模型#

更新时间:2026-08-26 (单位统一为美元/1M Tokens)

OpenAI#

数据来源:OpenAI Pricing (Standard) Short context ≤ 272k tokens,Long context > 272k tokens。无 Long 价格表示仅支持 Short context。 另有 Batch / Flex(半价)与 Fast mode(2 倍价)三档模式。

模型名称输入 ($)缓存输入 ($)输出 ($)长上下文输入 ($)长上下文缓存 ($)长上下文输出 ($)
gpt-5.6-sol4.000.4020.008.000.8030.00
gpt-5.6-terra2.000.2012.004.000.4018.00
gpt-5.6-luna0.200.021.200.400.041.80
gpt-5.55.000.5030.0010.001.0045.00
gpt-5.5-pro30.00180.0060.00270.00
gpt-5.4-mini0.750.0754.50
gpt-5.3-codex1.750.17514.00

Anthropic (Claude)#

数据来源:Claude Pricing

模型名称基础输入 ($/1M)5m 缓存写入 ($/1M)1h 缓存写入 ($/1M)缓存读取 ($/1M)输出 ($/1M)
Claude Fable 510.0012.5020.001.0050.00
Claude Mythos 5
(限量供应)
10.0012.5020.001.0050.00
Claude Opus 55.006.2510.000.5025.00
Claude Sonnet 52.002.504.000.2010.00
Claude Sonnet 4.63.003.756.000.3015.00
Claude Haiku 4.51.001.252.000.105.00

提示缓存说明: 提示缓存通过重用之前处理过的提示部分来降低成本和延迟。

  • 自动缓存:在请求顶层添加 cache_control 字段,系统自动管理缓存断点。
  • 显式缓存断点:将 cache_control 放在单个内容块上,精细控制缓存内容。

缓存写入令牌在内容首次存储时收费;缓存读取在后续请求检索缓存内容时收费。

版本说明: Claude Sonnet 5 较 4.x(3/3/15)降价约 33%。Opus 4.5/4.6/4.7 与 Sonnet 4.5 价格保持不变,Opus 4.1/4、Sonnet 4、Haiku 3.5 已停用(Bedrock/Google Cloud 除外)。

Google (Gemini)#

数据来源:Gemini API Pricing 以下为”标准”档价格,另有 Batch / Flex(半价)与优先级(约 1.8 倍)档位。

模型名称输入价格 ($/1M Tokens)输出价格 ($/1M Tokens)说明
Gemini 3.6 Flash
(gemini-3.6-flash)
1.507.50输入缓存命中: 0.15
缓存存储: 1.00/1M/小时
Gemini 3.5 Flash
(gemini-3.5-flash)
1.509.00输入缓存命中: 0.15
缓存存储: 1.00/1M/小时
Gemini 3.5 Flash-Lite
(gemini-3.5-flash-lite)
0.302.50
Gemini 3.1 Flash-Lite
(gemini-3.1-flash-lite)
0.25 (文本/图片/视频)
0.50 (音频)
1.50
Gemini 2.5 Pro
(gemini-2.5-pro)
1.25 (≤200k)
2.50 (>200k)
10.00 (≤200k)
15.00 (>200k)
输入缓存命中: 0.125 / 0.25
缓存存储: 4.50/1M/小时
Gemini 2.5 Flash
(gemini-2.5-flash)
0.30 (文本/图片/视频)
1.00 (音频)
2.50输入缓存命中: 0.03 (文本/图片/视频) / 0.10 (音频)
缓存存储: 1.00/1M/小时

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

大模型价格列表
https://xtower.site/posts/llm-cost/
作者
Xtower
发布于
2026-02-08
许可协议
CC BY-NC-SA 4.0
Profile Image of the Author
Xtower
Hello, I'm Xtower.
公告
「如何?为你描绘的这个世界?」
音乐
封面

音乐

暂未播放

0:00 0:00
暂无歌词
分类
标签
站点统计
文章
3
分类
2
标签
2
总字数
4,014
运行时长
0
最后活动
0 天前

文章目录