MoE 3 SambaNova SN50 RDU @ Hot Chips 2026 — 以数据流架构榨干「模型带宽利用率」 2026/08/28 MoE Expert Execution in Disaggregated LLM Serving with a High-Bandwidth ReRAM Near-Memory Architecture — 用高带宽 ReRAM 近内存架构执行分解式 LLM 服务中的 MoE 专家 2026/08/19 From GPT-2 to Kimi K3, Explained — 从 GPT-2 到 Kimi K3:注意力架构演进全解(中文翻译 + 模块化解读) 2026/07/29