端侧推理芯片 · 边缘AI芯片 · AI硬件芯片 · 端侧大模型 · NPU
端侧推理芯片怎么选:从模型、功耗到更新方式的七个问题
燔石半导体技术团队 · 发布

选端侧推理芯片,先回答七个问题:跑什么模型、多大参数量、多久更新一次、功耗预算多少、需要多快的解码速度、数据能否离开设备、量产规模多大。这七个答案基本上就决定了应该选 GPU / NPU 通用方案,还是存算一体或近存计算的专用 ASIC。
1. 跑什么模型,多大参数量
这是第一个也是最硬的约束。语言模型看参数量与上下文长度,视觉模型看输入分辨率与帧率。0.5B 到 1B 的语言模型可以用单瓦级功耗跑在 MaskROM 存算一体芯片上;7B 到 35B 需要近存计算配合几十瓦整机;实时视觉分割看的是每秒处理多少像素,而不是 TOPS。
不要被 TOPS 数字带偏。通用 NPU 标称的 TOPS 是峰值乘加能力,大模型解码阶段是带宽受限的,实际利用率常常只有个位数百分比。真正该问的是:这颗芯片每秒能读多少次全部权重。
2. 模型多久更新一次
这个问题决定了能不能用 MaskROM。产品定义清晰、模型经过充分验证、一年内不会换,MaskROM 把权重铸进硅片,功耗和成本都是最低的。模型还在每季度迭代,就要选 SRAM 存内计算或近存计算,让权重可以上电加载或驻留外存。
一个实用的做法是分阶段:先用 FPGA 评估板和推理 IP 把模型跑起来,等模型定型再决定是否走 MaskROM 流片。
3. 功耗预算
随身设备通常只有 1 到 3 W 的整机预算,车载和机器人本体有 10 到 70 W,行业边缘节点可以到百瓦。功耗预算直接筛掉了大半方案:GPU 模组动辄 15 W 起步,还没算散热。
存算一体的功耗优势来自权重不搬运。这一点在解码阶段尤其明显,因为解码是纯带宽受限的。
4. 需要多快
语音交互要求首字延迟在几百毫秒以内,解码速度超过人的阅读速度(大约 10 到 20 token/s)就够用;批量处理或多路并发则希望吞吐越高越好,几千到上万 token/s 才能摊薄成本。视觉任务看帧率:产线缺陷检测要跟上产线节拍,无人机巡检要跟上飞行速度。
5. 数据能不能离开设备
专网、涉密终端、医疗与工业现场往往从制度上就不允许数据上云。这时端侧推理不是「性价比」问题,而是「能不能做」的问题。全程本地推理意味着设备可以完全离线运行,这是架构层面的保证。
6. 量产规模
几千台的项目,用通用模组加软件优化最省事;几十万台的产品,专用 ASIC 的单颗成本和功耗优势会把整机 BOM 拉开一个量级。MaskROM 路线尤其如此:掩膜是一次性投入,量越大越划算。
7. 谁来做软件
通用方案要自己做模型转换、量化、算子适配;专用 ASIC 通常由芯片方提供模型映射。问清楚:目标模型是不是原生支持,量化方案是什么,评估板能不能拿到,工程样机多久能到。
一张清单
把七个答案填进去,路线就出来了:模型 ≤ 1B、一年不变、功耗 ≤ 3 W、量产大,选 MaskROM 存算一体;模型迭代快、需要现场换模型,选 SRAM 存内计算;模型 ≥ 7B、有几十瓦预算,选近存计算;模型还没定型,先用 FPGA 评估板和 IP 授权把它跑起来。



