
把推理内核授权进你的硅片。
四类自研推理内核覆盖多模态融合、混合注意力、稀疏专家和线性注意力,并支持 FPGA 原型验证。



混合注意力推理 IP
FS-Attention原生支持混合注意力新结构(Hybrid Attention)的高端大语言模型。
适配 Qwen3 / 3.5(0.6B 至 9B)与 SmolLM2



从 IP 授权到流片
01
确认路线
目标模型、性能与功耗目标、更新频率、接口需求。第一个问题永远是:模型多久变一次。
02
FPGA 评估
在评估板上部署推理内核,跑通模型,测量精度与吞吐,形成第一台工程样机。
03
系统导入
围绕评估结果做接口、系统软件与现场验证,把样机变成产品原型。
04
ASIC 交付
模型冻结后,采用量产 ASIC,或把 IP 集成进客户自己的芯片流片。
延伸阅读
端侧推理芯片怎么选:从模型、功耗到更新方式的七个问题为设备选端侧推理芯片时,真正决定成败的不是峰值算力,而是模型是否放得下、功耗是否撑得住、模型能不能更新。本文给出七个必须先回答的问题和一张选型清单。
大模型 FPGA 原型验证:从推理 IP 授权到流片的路径在流片之前用 FPGA 把大模型推理内核跑起来,能提前验证模型映射、接口与系统链路。本文说明推理 IP 授权的内容、FPGA 评估板在项目中的位置,以及从评估到 ASIC 的典型节奏。
内存墙:为什么端侧大模型跑不动,以及怎么绕过去大模型推理在解码阶段是带宽受限的:每生成一个 token 都要读一遍全部权重。端侧设备的带宽与功耗预算撑不起这种搬运,这就是内存墙。本文用数字说明这堵墙有多高,以及存算一体与近存计算如何绕过它。
咨询 IP 授权与评估板
告诉我们目标器件、模型与接口,我们回复 IP 支持范围与评估计划。
