推理算力 · 推理成本 · token 成本 · 端侧推理 · AI 芯片成本
推理算力成本怎么算:API、自建 GPU 与买断式芯片的三年账
燔石半导体技术团队 · 发布

推理算力成本有三种口径:API 按每百万 token 计价,是持续支出;自建 GPU 按卡时租金或折旧摊到每百万 token,通常在个位数人民币;端侧专用芯片一次买断,此后每次推理的边际成本趋近于零。日均 1000 万 token 的负载下,三年 API 账单与一颗一两千元的芯片相差可达三个数量级。
三种口径
API 调用:按输入与输出 token 分别计价。2026 年公开价格,海外旗舰模型折算后在每百万 token 50 到 130 元人民币,国内模型在 0.5 到 16 元之间。它的特点是零前期投入、无限弹性,但支出随用量线性增长,永远不会结束。
自建云 GPU:按卡时租金或采购折旧计算。以 H100 中位租金摊到吞吐上,综合推理成本大约每百万 token 5 元。它比旗舰 API 便宜一个数量级,但需要运维、有利用率风险,而且对端侧设备来说并不适用:数据还是要上云。
端侧专用芯片:一次性买断,价格通常在几百到几千元一颗。买断后每次推理只消耗电,边际成本趋近于零。它的约束是模型规模由芯片决定,前期要做设备集成。
一个可以复算的例子
假设一台设备日均处理 1000 万 token。按每百万 token 126 元的旗舰 API 计价,一天 1260 元,三年约 138 万元。按每百万 token 5 元的自建 GPU 估算,三年约 5.5 万元。按一颗 1500 元买断的端侧芯片,三年就是 1500 元,加上电费。
回本周期的算法很简单:芯片价格除以每月 API 支出。上面的例子里,每月 API 支出约 3.8 万元,芯片第一个月就回本。把日均用量降到 10 万 token,每月 API 支出约 380 元,回本也在四个月以内。
燔石网站的成本测算器就是按这个口径做的,可以自己拖动日均用量和芯片价格看结果。
账单之外的三个变量
延迟:API 有网络往返,端侧没有。对语音交互和实时控制,这是体验差异,不是成本差异。
数据:API 要求数据上云,端侧不需要。对专网和涉密场景,这决定了方案能不能用。
模型:API 随时可以换最新模型,MaskROM 芯片的模型是固化的。如果业务依赖模型能力的持续提升,要选近存计算或 SRAM 存内计算路线,或者接受「设备侧跑稳定模型、复杂任务再上云」的混合架构。
什么时候该换成端侧
三个信号:月度 API 账单已经超过一颗芯片的价格;设备数量大到运维一个云端推理集群不划算;或者业务上根本不允许数据离开设备。满足任何一条,就值得把端侧方案放进评估。



