工程实践知乎 - 手抓饼熊
这篇文章基于 GTC 2026 关于 CUTLASS Python 的演讲,系统分析了如何在 Blackwell GPU 上围绕 GEMM 逐步逼近 Tensor Core 峰值性能。文章从基础 GEMM 的分块、TMA 传输、TMEM/RMEM/SMEM 流水线讲起,进一步比较了 2CTA、Warp Specialization、TMA Store、Persistent Kernel、Preferred/Fallback Cluster、Dynamic Scheduler 和 PDL 等优化手段在不同矩阵规模与瓶颈条件下的收益与边界。全文不仅给出性能数据,还强调了不同规模下瓶颈会从 DRAM 延迟、epilogue 开销转向 L2 命中率和调度效率,适合作为 Blackwell 上高性能 GEMM 编程的系统性参考。
推荐收录,因为它不是单纯介绍 CUTLASS Python,而是把 Blackwell 架构特性、内存层次、调度机制和性能结果串成了一条完整的优化路径。对做 GPU kernel、推理加速或高性能矩阵计算的读者来说,这些关于瓶颈切换、流水线隐藏和 cluster 调度的结论具有很强的可迁移性。
技术文章知乎 - 手抓饼熊
这篇文章系统梳理了 NVIDIA Tensor Core 的编程模型与优化方法,覆盖 Warp Level、Warpgroup Level 到 Blackwell 第五代 Tensor Core 的演进,并把 Nsight Systems/Nsight Compute 的分析方法、TMA 流水线、CuTe/CUTLASS 编程框架串成一条完整优化路径。文章不仅解释了 MMA、tiling、寄存器/共享内存/TMEM 的数据流关系,还通过具体矩阵尺寸、SASS 形态和 profiling 指标说明如何判断瓶颈与选择合适的实现策略。适用边界主要在 NVIDIA CUDA GPU 生态,且部分 Blackwell/GTC 2026 相关特性具有较强版本依赖。
推荐收录,因为文章把 Tensor Core 的硬件代际、编程接口和性能分析工具放在同一框架下讲清楚,兼具原理、方法和实战排查路径。对于做 CUDA 算子优化、GPU 性能分析或 AI 基础设施开发的读者,它提供了可迁移的心智模型与调优抓手。
科研议题知乎 - 手抓饼熊
这篇文章围绕“用 EAGLE-3 加速 RL 训练中的 rollout”展开,核心是在强化学习训练阶段引入推测采样/草稿模型,把原本昂贵的轨迹展开与策略前向计算做协同优化。作者解释了在线草稿自适应的必要性:策略参数在训练中不断更新,部署侧和草稿模型都必须及时跟随当前策略,否则会出现分布不一致导致的加速失效。文章还描述了与 vLLM、MegatronLM 的整体协作方式,以及通过缓存隐藏状态和对数概率、并用梯度分离避免干扰策略梯度的实现思路。
推荐收录,因为它不仅转述论文结论,还抓住了 RL rollout 加速的关键瓶颈、系统协同方式和训练时一致性问题,具有明确的可迁移价值。对于做大模型训练、RLHF/GRPO 优化或推测解码系统设计的读者,这类方法能直接启发性能优化与训练架构改造。