推理系统 13:Ascend NPU 与 vLLM Ascend 的实际软件栈
以 Atlas A3/Ascend 910C 为具体平台,区分 AI Core、Cube/Vector/Scalar、片上存储与 CANN、TorchNPU、vLLM 插件的责任。
以 Atlas A3/Ascend 910C 为具体平台,区分 AI Core、Cube/Vector/Scalar、片上存储与 CANN、TorchNPU、vLLM 插件的责任。
以 2026 年公开的 Vera Rubin 平台为最新坐标,以资料完整的 Blackwell Ultra B300 为定量案例,解释 SM、Tensor Core、HBM 与互连。
沿算子分发、图捕获与编译、内核选择、启动、线程组织和内存层次,解释模型公式到 GPU/NPU 执行的距离。
区分逻辑块、物理块、块表与注意力内核,解释分页分配、写时复制、前缀匹配、回收和尾块浪费。
用固定 Token 预算解释运行与等待请求、分块 Prefill、Decode 交错、抢占及吞吐和延迟之间的关系。
固定 vLLM v0.10.2,追踪 API、处理器、引擎核心、调度器、执行器、输出处理器与流式响应的责任边界。
从仿射量化、分组尺度和误差出发,区分权重、激活与 KV Cache 量化,并讨论内核支持与真实收益。
分别核算权重、KV Cache、激活、临时工作区、运行时与碎片,建立单卡和多卡容量预算。
从矩阵形状、依赖关系与算术强度解释 Prefill 和 Decode 的性能差异,以及为什么批量和上下文会改变瓶颈。
推导输出投影、稳定 Softmax、温度、top-k、top-p、随机采样与停止条件,解释概率如何成为下一个 Token。