人工智能 29
- Recurrent Looped Transformer 图解:让状态跨 Token 继续思考
- 推理系统番外篇:从 22 步矩阵计算到一条连续方程
- 推理系统 15:用真实测量解释延迟、吞吐与成本
- 推理系统 14:从单卡到多卡,以及 MoE 专家并行
- 推理系统 13:Ascend NPU 与 vLLM Ascend 的实际软件栈
- 推理系统 12:从 CUDA SM 到 NVIDIA Rubin 与 Blackwell Ultra
- 推理系统 11:张量公式怎样变成设备程序
- 推理系统 10:PagedAttention 与前缀缓存的真实边界
- 推理系统 09:连续批处理与统一 Token 调度
- 推理系统 08:一条请求怎样进入 vLLM V1
- 推理系统 07:量化改变了什么,又没有改变什么
- 推理系统 06:模型推理的内存究竟用在哪里
- 推理系统 05:Prefill 与 Decode 为什么是两种工作负载
- 推理系统 04:从 logits 到下一个 Token
- 推理系统 03:逐项算清一个真实 Qwen3 Transformer 层
- 推理系统 02:从 Unicode、聊天模板到 Token 与嵌入张量
- 推理系统 01:一条请求如何抵达硬件,又变成回答
- 从文本到芯片:大模型推理交互技术系列
- 智谱 2026 年中期业绩说明会:管理层发言与问答全文翻译
- 从第一性原理理解 Diffusion & Flow Matching(SDE、ODE 大一统视角)— 中文解读
- 华为廖恒谈超级AI计算硬件(全文转载 + 中文结构化解读)
- Meta MTIA 300 内部框图详解(日文逐译)
- String Theory Finally Testable with Power of AI — AI 让弦理论首次变得可检验
- What Capable Agents Must Know: Selection Theorems for Robust Decision-Making under Uncertainty — 高性能 agent 必须知道什么:不确定性下稳健决策的选择定理
- Applying Mixture of Experts in LLM Architectures — 在 LLM 中应用混合专家(MoE)
- MoE Expert Execution in Disaggregated LLM Serving with a High-Bandwidth ReRAM Near-Memory Architecture — 用高带宽 ReRAM 近内存架构执行分解式 LLM 服务中的 MoE 专家
- Models Are Getting Dumber on Purpose — 模型正被刻意「变笨」
- Machine Learning: A First Course for Engineers and Scientists — 机器学习(工程师与科学家入门)
- CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation — CUDA Agent:用大规模智能体强化学习生成高性能 CUDA 内核