模型经济学
一个 Token 到底要多少钱
上线功能前,如何实际阅读输入、输出、缓存和按次生成价格。
llm api pricing方案比较US编辑简报更新 2026-08-26

你将学会
- Budget input and output tokens separately.
- Long context and tool schemas can dominate input spend.
- Use live account-group pricing for the final production estimate.
开始前需要
- Basic HTTP and API knowledge
Leave with a concrete implementation checklist and a testable starting point.
先看结论
- 输入与输出 Token 必须分开预算。
- 长上下文、检索文档和工具 schema 可能成为主要成本。
- 最终预算必须以账户实时分组价格为准。
两种计费形态
文本模型通常按 Token 计费:输入侧覆盖你发送的提示词和上下文,输出侧覆盖模型生成的文本。图像和视频模型通常按生成次数计费,而不是按 Token。
比较产品时必须区分这两种形态。聊天请求要同时估算输入和输出,视频请求则从生成次数乘以单次价格开始。
输入不是全部成本
系统提示词、检索文档、对话历史和工具 schema 都会增加输入 Token。模型被要求进行推理或生成结构化内容时,输出长度也可能明显增加。
重复上下文可能有单独的缓存价格。缓存命中率高的工作负载,最终最优模型不一定是表面输入价最低的模型。
一个简单的预算公式
按 Token 计费的请求可以估算为(输入 Token × 输入单价)+(输出 Token × 输出单价),再乘以请求次数;如果价格表提供缓存价,再单独估算缓存读取。
EasyAI 价格页展示默认分组参考价。账户分组和实时可用模型可能不同,生产预算应以控制台快照为准。
如何选择
| 比较维度 | 方案 A | 方案 B |
|---|---|---|
| Best when | You need predictable behavior and easy auditing | You need adaptive optimization and have reliable telemetry |
| Main risk | May leave performance on the table | Can become difficult to explain or debug |
实施步骤
- 1
使用真实业务提示词测量 Token,不要用玩具示例。
- 2
分别估算输入、输出和缓存命中量。
- 3
乘以月请求量并加入波动余量。
- 4
上线前再次核对控制台实时价格。
可复制示例
ts
const monthlyCost =
(inputTokens / 1_000_000) * inputUsdPerMillion +
(outputTokens / 1_000_000) * outputUsdPerMillion +
(cachedTokens / 1_000_000) * cacheUsdPerMillion;常见问题
页面价格适用于所有账户吗?
不一定。营销站展示默认分组参考价,账户实际分组和已启用模型才是最终依据。
推理模型应该怎样估算?
使用生产或 staging 轨迹估算输出 Token,推理和结构化输出通常比短对话更长。
资料来源
- EasyAI documentation来源核查 2026-08-27