推理系统实验台
所有结果均为公式计算或离散事件模拟,不是硬件跑分。修改条件,观察哪一项先成为约束。
Logits 怎样成为下一个 Token
固定玩具 logits;按 logit/T 后做稳定 softmax,先 top-k 再 top-p,最后重新归一化。T→0 的贪心路径应作为单独规则处理。
模型、KV Cache 与并发能否装下
权重采用参数量×位宽;KV 使用 Qwen3-8B 结构并按上下文线性缩放;“其他”取设备容量 10% 作为教学预留。量化尺度、对齐、碎片、工作区与多卡分片未完全计入。
统一 Token 预算与分页缓存
三个固定请求:A 剩余 Prefill 20、B 剩余 Decode 6、C 剩余 Prefill 9。模拟器采用简化轮转分配,用来观察预算、分块与尾块浪费;它不声称逐行复刻任一 vLLM 版本的调度策略。
算力很高,为什么仍会等内存
Roofline 上界=min(计算峰值, 带宽×算术强度)。这是必要条件下的上界,不含利用率、通信、内核启动、同步与数据布局代价;滑块不对应某款具体产品。
多卡通信与服务指标
一组请求延迟样本(ms)
Ring AllReduce 通信量近似 2(P−1)/P×消息大小,再除以用户给定的有效带宽并加固定延迟;这是通信模型,不是 NCCL 性能预测。百分位使用线性插值并显示样本数。