一、倍率只回答了一个问题
页面上的公开倍率通常表示某个分组相对基础价格的计费系数。例如当前公开页面统一展示 0.1 倍率,它可以帮助你快速判断是否值得进一步测试,但不能直接等同于每个模型、每种 token 类型的固定单价。
正确的比较方式:先看倍率,再用自己的请求算一遍。
不要用“倍率更低”直接推导“总成本一定更低”,也不要把单次测试结果写成长期节省比例。
二、把五个变量放到同一张表
| 变量 | 为什么影响结果 | 怎么核对 |
|---|---|---|
| 模型 | 不同模型的基础价格与能力不同 | 看控制台实时模型列表 |
| 输入 / 输出 | 输出 token 较多时,单看输入价格会失真 | 用真实 prompt 与输出长度测试 |
| 缓存 | 重复上下文可能走不同计费口径 | 查看公开说明和调用记录 |
| 可用性 | 请求失败、重试和切换会增加真实消耗 | 记录成功率、错误码和重试次数 |
| 余额与扣费 | 充值金额不等于一次请求的成本 | 对照请求日志、用量和余额变化 |
三、用自己的工作负载做核对
选一组不会暴露隐私的代表性请求,保持 prompt、模型和输出上限一致。在两个候选入口各跑一轮,记录下面的最小字段:
cost-check.csv
date,model,input_tokens,output_tokens,status,balance_before,balance_after
2026-08-03,gpt-5.6-luna,REDACTED,REDACTED,200,REDACTED,REDACTED- 同一模型、同一请求条件,避免拿不同任务比较。
- 至少记录一次成功请求和一次错误情况。
- 只记录脱敏的统计字段,不把 prompt、Key 或用户数据上传给第三方。
- 以账号页面的实际记录为准,不以营销页的估算数字代替。
四、用结果决定是否接入
如果请求成功、日志清楚、扣费可解释,而且成本符合你的真实工作负载,再考虑保留备用路由或进入批采沟通。若只是倍率好看,但模型不可用或扣费无法核对,就不要放量。
对下游站主来说,最有价值的不是找到一个看起来最低的数字,而是找到一个能在你的常用模型和真实请求上重复验收的入口。