§0 · 核心发现
一个哲学,两个尺度
「让计算靠近数据」在端侧是功耗门控问题,在数据中心是内存墙问题——两者共享同一套近存计算底座。
端侧 Kuiloong 以 mW 级功耗决定「要不要唤醒主系统」:原始数据不外流,NPU 只输出标签、置信度与状态,确认后再唤醒主系统。数据中心 KXP 把 Decode Attention 搬到 KV 所在的 DDR 旁边,让每 Token 跨链路流量从 ≈10 GiB 降到 ≈2–3 MiB。让计算靠近数据——这是两端共同的底座逻辑。
以低功耗语义门控降低系统无效唤醒,以 KV 近存计算释放长上下文推理的容量与带宽。
— ACELab · 深轶科技,团队介绍 STRATEGIC TAKEAWAY2026-09
Context端侧「always-on」的电费与数据中心 HBM 的容量墙,本质是同一个问题:数据搬移比计算更贵。Why it matters把计算搬到数据旁边,两端都绕开搬移税。
§1 · 感知 NPU
Kuiloong:卡位在粗触发与重推理之间
传感器粗触发、NPU 语义确认、主系统按需接管——多级功耗门控让「always-on」不再等于「always-on 的电费」。
Kuiloong 定位为多模态语义门控协处理器:视觉确认、语音唤醒、事件流触发,以低功耗语义确认是否值得唤醒主系统。架构上是 RISC-V 控制 + 多维计算 + 共享近存:标量单元、1D 向量核与 2D 矩阵/卷积阵列统一访问共享近存,减少 DMA 与数据复制——单一软件栈,无双栈同步,ONNX 可表示即可映射。
产业验证边界。 Kuiloong NPU IP 目前处于头部智能家居厂家控制芯片的集成验证阶段,并与芯翼科技共同申请上海市科委重点研发项目、围绕 RISC-V 智能物联网 SoC 联合攻关——「客户导入」不等同于已量产,这是本页对该进展的统一口径。
§2 · KV 扩展处理器
KXP:把 Decode Attention 搬到 KV 数据旁边
大模型 Decode 的瓶颈已从算力转移到内存——KXP 是位于 GPU 与大容量 DDR 之间,专门负责上下文存储、管理与 Decode Attention 近存计算的处理器。
长上下文的压力来自一个简单的增长规律:KV Cache 随并发数与上下文长度线性膨胀。70B 类 GQA 模型、BF16 口径下,单请求 1M 上下文即需约 312 GiB KV——超过任何单张 GPU 的 HBM 容量。而权重、KV 与工作区竞争的正是同一块不可拆分的 HBM:用户真正缺少的是容量与带宽,却被迫按整卡采购,多余算力沉淀为成本。
只做存储卸载(KV 放 DDR、逐 Token 搬回 GPU)只是把容量瓶颈换成链路带宽瓶颈:32K 上下文每 Token 约需搬运 10 GiB 历史 KV,50 Token/s 对应 500 GiB/s 持续流量,GPU 在等待中空转。KXP 的出路是让计算靠近数据:在 KV 所在的 DDR 旁边完成 Attention,只把结果送回 GPU。
KV 语义内存:与通用 CXL 内存控制器的分界线
即使暂不执行 Attention,KXP 也能先解决 KV 的容量、碎片、迁移与隔离问题:分页与地址转换、Block 分配回收、HBM/DDR/SSD 三级冷热分层、Prefix Cache 共享、分支管理与去重、请求级地址空间与多租户配额。它理解层、Head、Token 和请求——这是通用内存做不到的共享与隔离。
定位声明。 KXP 为拟研发产品:第一代只卸载 Decode Attention 核心(十三项任务中的七项,全部在上下文数据面),模型权重面六项保持在 GPU 侧不变。核心指标是有效 DDR 带宽、每瓦 KV 扫描能力与低延迟任务提交——TOPS 在这里并非关键指标。竞品格局为公开资料整理 [推演标注]。