← 返回主页 EN

RESEARCH REPORT · NPU × KXP · DATA AS OF 2026-09-20

让计算靠近数据,
从端侧到数据中心

超低功耗多模态感知 NPU · Kuiloong × KXP(KV Extension Processor)

同一套近存计算哲学的两端:端侧 Kuiloong 以 mW 级功耗做多模态语义门控——视觉确认、语音唤醒、事件流触发,决定是否唤醒主系统;数据中心 KXP 把 Decode Attention 搬到 KV 所在的 DDR 旁边,GPU 只保留权重密集计算,让长上下文推理的容量与带宽不再绑死在昂贵 HBM 上。

证据分级:团队自测 > 行业公开 > 第三方转述 > 整理推演 [标注] · KXP 为拟研发产品,本页不构成投资或采购建议

SCROLL

Fig. 0 · 每一颗芯片,都是更大算力版图上的一格 —— scale, all the way up

§0 · 核心发现

一个哲学,两个尺度

「让计算靠近数据」在端侧是功耗门控问题,在数据中心是内存墙问题——两者共享同一套近存计算底座。

端侧 Kuiloong 以 mW 级功耗决定「要不要唤醒主系统」:原始数据不外流,NPU 只输出标签、置信度与状态,确认后再唤醒主系统。数据中心 KXP 把 Decode Attention 搬到 KV 所在的 DDR 旁边,让每 Token 跨链路流量从 ≈10 GiB 降到 ≈2–3 MiB。让计算靠近数据——这是两端共同的底座逻辑。

以低功耗语义门控降低系统无效唤醒,以 KV 近存计算释放长上下文推理的容量与带宽。

ACELab · 深轶科技,团队介绍 STRATEGIC TAKEAWAY2026-09

Context端侧「always-on」的电费与数据中心 HBM 的容量墙,本质是同一个问题:数据搬移比计算更贵。Why it matters把计算搬到数据旁边,两端都绕开搬移税。

§1 · 感知 NPU

Kuiloong:卡位在粗触发与重推理之间

传感器粗触发、NPU 语义确认、主系统按需接管——多级功耗门控让「always-on」不再等于「always-on 的电费」。

Kuiloong 定位为多模态语义门控协处理器:视觉确认、语音唤醒、事件流触发,以低功耗语义确认是否值得唤醒主系统。架构上是 RISC-V 控制 + 多维计算 + 共享近存:标量单元、1D 向量核与 2D 矩阵/卷积阵列统一访问共享近存,减少 DMA 与数据复制——单一软件栈,无双栈同步,ONNX 可表示即可映射。

150
GOPS/mm² 面积效率(GF 40nm)
mW 级
平均功耗 · 支持睡眠 / 待机
INT8/4
剪枝量化 · 端到端编译部署
5–10×
主系统唤醒下降目标(共创期)

产业验证边界。 Kuiloong NPU IP 目前处于头部智能家居厂家控制芯片的集成验证阶段,并与芯翼科技共同申请上海市科委重点研发项目、围绕 RISC-V 智能物联网 SoC 联合攻关——「客户导入」不等同于已量产,这是本页对该进展的统一口径。

§2 · KV 扩展处理器

KXP:把 Decode Attention 搬到 KV 数据旁边

大模型 Decode 的瓶颈已从算力转移到内存——KXP 是位于 GPU 与大容量 DDR 之间,专门负责上下文存储、管理与 Decode Attention 近存计算的处理器。

长上下文的压力来自一个简单的增长规律:KV Cache 随并发数与上下文长度线性膨胀。70B 类 GQA 模型、BF16 口径下,单请求 1M 上下文即需约 312 GiB KV——超过任何单张 GPU 的 HBM 容量。而权重、KV 与工作区竞争的正是同一块不可拆分的 HBM:用户真正缺少的是容量与带宽,却被迫按整卡采购,多余算力沉淀为成本。

只做存储卸载(KV 放 DDR、逐 Token 搬回 GPU)只是把容量瓶颈换成链路带宽瓶颈:32K 上下文每 Token 约需搬运 10 GiB 历史 KV,50 Token/s 对应 500 GiB/s 持续流量,GPU 在等待中空转。KXP 的出路是让计算靠近数据:在 KV 所在的 DDR 旁边完成 Attention,只把结果送回 GPU。

KV 语义内存:与通用 CXL 内存控制器的分界线

即使暂不执行 Attention,KXP 也能先解决 KV 的容量、碎片、迁移与隔离问题:分页与地址转换、Block 分配回收、HBM/DDR/SSD 三级冷热分层、Prefix Cache 共享、分支管理与去重、请求级地址空间与多租户配额。它理解层、Head、Token 和请求——这是通用内存做不到的共享与隔离。

定位声明。 KXP 为拟研发产品:第一代只卸载 Decode Attention 核心(十三项任务中的七项,全部在上下文数据面),模型权重面六项保持在 GPU 侧不变。核心指标是有效 DDR 带宽、每瓦 KV 扫描能力与低延迟任务提交——TOPS 在这里并非关键指标。竞品格局为公开资料整理 [推演标注]。