技术文章 Ken Shirriff 2026/09/26
文章围绕 Intel 8087 浮点协处理器的 FPTAN 正切指令,作者通过开盖显微成像、微码 ROM 逆向和数值分析,解释其如何把 CORDIC 与 Padé 有理逼近结合起来。CORDIC 用 arctan(2^-n) 特角序列与移位加减实现旋转,但 16 步仅约 16 位精度;8087 先用 CORDIC 伪除法确定 16 个旋转决策位,再把剩余小角度交给 3x/(3-x^2) 有理逼近,最后通过伪乘法逆序应用旋转得到 X、Y。文中还给出微码级实现、隐式定点指数缩放、移位寄存器、SQUARE 子程序及 0.95 输入的分步示例,并讨论参数范围、精度异常和性能占比。结论是这种混合算法以较少硬件兼顾速度与 64 位精度,而 Pentium 后转向多项式是因为快速乘法器已普及。其边界在于历史硬件逆向,并非现代浮点库实现指南。
推荐收录。文章以开盖显微照片、微码 ROM 反汇编和逐步数值表为直接证据,完整还原 FPTAN 的 CORDIC 伪除法、有理逼近与伪乘法流程,技术细节可验证且远超一般科普。适合计算机体系结构、浮点运算、逆向工程与数值算法读者,可迁移价值在于混合算法设计、隐式定点指数管理和微码性能分析。
技术文章 PlanetScale Blog 2026/09/25
文章讨论云端 Postgres 选择 x86-64 还是 aarch64 的实际影响。作者从超线程与 vCPU 定义切入:x86 常把超线程线程计为 vCPU,而 Graviton、Axion 等 ARM 芯片每 vCPU 对应完整物理核,因此 ARM 适合高并发小查询,x86 凭借更高单核频率适合少量 CPU 密集型大查询。文章还比较向量宽度,指出 x86 的 AVX2/AVX-512 比 Graviton 的 128 位向量更有利于 TIN 索引和 pgvector 的部分计算。随后说明 Postgres 文件不可跨架构直接复制,并用 pg_trgm 的 char 符号性差异解释复制风险,切换需逻辑复制到新集群。最后建议普通负载默认 ARM,CPU 重型负载重点测试 x86,迁移前做同数据同并发基准并衡量成本。
推荐收录:文章把架构选择落到 vCPU 语义、单核/多核取舍、向量指令宽度和 Postgres 物理复制限制上,并给出 PlanetScale 生产约束与迁移路径,证据具体而非泛泛而谈。适合数据库/基础设施工程师在选型、性能调优或跨架构迁移前阅读,可迁移到其他依赖底层架构的数据库与搜索负载。风险是部分结论来自厂商视角,读者仍需自行用同数据同并发基准验证。
技术文章 Go Blog 2026/09/24
文章介绍 Go 1.26/1.27 的实验性 SIMD 支持:archsimd 提供架构相关 API,新的 simd 包则提供平台和向量长度无关的可移植接口。面对各架构在向量长度、掩码和指令集合上的差异,simd 只暴露操作交集,并用 archsimd 指令或标量代码补齐缺失操作,同时支持 ToArch/FromArch 回退到平台专用实现。文中列出 Load/Store、算术、比较、掩码、转换、移位和 reshape 等 API,并以 OnesCount 为例展示 amd64、NEON、wasm 和纯模拟的跨平台实现,说明编译器会按 SIMD 宽度特化并消除类型分支。GODEBUG=simd=0/128/256/512 可强制模拟或指定向量宽度,便于测试不同硬件能力。当前 API 仍属实验性,ReduceSum 等操作尚未提供,方法集合因跨平台约束而较保守,SVE 等支持仍在规划中。
推荐收录。文章来自 Go 官方博客,给出完整 API 表、跨平台实现示例、GODEBUG 测试开关及编译器特化细节,证据充分,不是概念介绍。适合 Go 语言、编译器、性能优化和底层系统开发者阅读,可迁移到可移植 SIMD API 设计、跨架构模拟与性能验证。风险是 API 仍为实验性,部分操作缺失且 GODEBUG 行为可能随版本变化。
技术文章 Daniel Lemire 2026/09/21
文章讨论现代超标量处理器能否在一个周期内执行多个 taken branch。作者用一个包含 if 的 Go 循环做微基准:从字节数组中读取元素,与阈值比较,若大于阈值则写入 last 指针;在始终不命中、但产生两个邻近 taken branch 且不执行存储的场景下测量。结果显示,Apple M4 Max 与 Granite Rapids 平均不到 2 个周期即可完成两个 taken branch,说明某些条件下确实可超过每周期一个 taken branch;AMD Zen 4 表现较差,Zen 5 明显改善。作者附上 benchmark/experiments/ifloop 下的可复现代码,但结论受特定循环、编译器代码生成和微架构影响,不宜直接外推为通用规则。
推荐收录:作者提供了可复现的 Go 微基准、明确的分支场景和多款处理器的对比数据,直接检验了“每周期最多一个 taken branch”这一常见说法。对关注 CPU 微架构、性能优化和底层代码生成的读者有参考价值,可迁移为结合具体处理器与编译器实测、避免把简化模型当硬约束。局限是结论依赖特定循环和硬件,不能无条件外推。
技术文章 Daniel Lemire 2026/09/19
文章以苹果基础款芯片 M2 到 M5(并延伸讨论刚发布的 M6)为例,分析三年间单核性能提升约 52%、多核提升约 83% 的来源。作者借助 Geekbench 6 分数、核心频率、晶体管数量、核心配置、解码宽度和内存带宽等公开数据逐项拆解。结论是苹果与 AMD 不同:约 30% 的 P 核频率提升(3.5→4.6 GHz)解释了单核增长的大部分,而 E 核从 4 增至 6、解码宽度从 8 提升到 10、内存带宽从 100 提升到 154 GB/s 共同支撑了多核与带宽敏感负载。文中还指出苹果 SIMD 仍为四个 128-bit 单元,弱于 Zen 5,但 M4/M5 新增 512-bit SME 矩阵单元。分析基于公开规格与 Geekbench 数据,缺乏自建微基准验证,属于趋势性归因。
推荐收录。文章给出了一套可复用的性能提升归因框架,把代际差异分解为频率、核心数、解码宽度(IPC)、内存带宽与 SIMD 宽度等因素,而非停留在跑分对比,对关注 CPU 微架构演进与性能分析的工程师、研究者有长期参考价值。需注意其数据主要来自 Geekbench 与厂商公开规格,未做自建微基准,结论应视为趋势性解读。
工程实践 Daniel Lemire 2026/09/18
文章介绍 Daniel Lemire 团队将 ARM SVE2 的 match 指令用于 simdjson 的 JSON 结构字符分类阶段。NEON 版本通过查表和比较指令在每 16 字节中识别逗号、冒号、括号等结构字符;SVE2 的 match 可用一个谓词寄存器输出匹配掩码,并借 NEON-SVE bridge 与现有 NEON 代码衔接。作者在 Graviton 4/5 上对 22 个标准 JSON 文件做基准,结果显示索引阶段吞吐提升约 3%–9%,整体解析提升约 1%–4%,结构化程度高的文件收益更大,纯数字文件可能略有回退。当前代码需要 SVE2,且默认构建仍走 NEON,尚未做到运行时指令集选择,Apple 处理器和旧 Graviton 也无法使用。
推荐收录:文章不是概念展望,而是基于 simdjson 真实 PR 和 22 个 JSON 语料的可复现基准,给出了 NEON 与 SVE2 match 的指令级实现、收益区间及失效场景。适合高性能解析、ARM SIMD/体系结构和 C++ 库优化读者,可迁移到其他需要字节分类和掩码聚合的场景;但需注意收益有限且依赖 SVE2 与构建配置,不能直接套用到 Apple 或旧 Graviton。
技术文章 Daniel Lemire 2026/09/18
文章以 AMD Ryzen 7 5800X3D(Zen 3)、7800X3D(Zen 4)、9800X3D(Zen 5)三款同为 8 核且带 3D V-Cache 的桌面处理器为对象,用 Geekbench 6 数据说明两年内单核性能提升约 47%、多核约 58%。作者指出主频仅从 4.5GHz 升到 5.2GHz(约 15%),晶体管则增加约 50%,因此增益主要来自核心变宽:调度宽度 6→8、整数 ALU 4→6、重排序缓冲 256→448、L1 数据缓存 32KB→48KB、每核 L2 由 512KB 翻倍到 1MB,Zen 5 的 SIMD 单元与加载/存储通路也从 256 位全面翻倍到 512 位。结论是“CPU 停滞”并不成立,性能提升源于核心宽度与数据通路扩展而非频率;其边界在于只依赖 Geekbench 一项合成基准,缺少功耗、能效和真实负载验证,Zen 6 桌面核也未展开。
推荐收录,因为文章用可核对的跑分、频率、晶体管数和微架构参数(调度宽度、ROB、缓存容量、SIMD 位宽)把“额外晶体管如何转化为性能”讲清楚,而非停留在简单跑分对比。适合关注 CPU 微架构、性能优化与硬件选型的读者,可作为理解近年 x86 核心变宽与 AVX-512 式扩展趋势的参考;主要风险是数据仅来自单一合成基准,缺少能效与真实工作负载维度。
技术文章 知乎 - 鹅厂架构师 2026/09/17
文章用制衣厂比喻系统讲解 CPU、GPU、TPU、NPU 的定位与差异:CPU 像裁缝老师傅,擅长复杂串行逻辑与调度;GPU 像工人大军,以大规模并行见长,并成为 AI 训练推理的通用算力底座;TPU 像提花织机,以脉动阵列专攻矩阵乘法,能效高但换算子或新架构时灵活性差;NPU 则是终端侧低功耗 AI 推理芯片。文中结合苹果 M 系列、英伟达 Blackwell、谷歌 TPU v7、A18 Pro 等产品与算力指标,对比设计目标、核心数量、灵活性、能效比和典型位置。最后从任务性质、晶体管预算、功耗约束和市场需求四条线解释为何造不出全能芯片,并指出真实系统依赖异构协同。其边界是大众科普,缺少论文引用和微架构细节,部分前瞻数字需按发布时间复核。
推荐收录:文章用统一类比串起四类处理器的架构取舍,并给出具体产品、算力指标和 GPU 与 TPU 在灵活性与能效上的边界对比,不是简单名词解释。适合希望建立芯片全景认知的工程师、学生和技术管理者,其中“通用性换灵活性、专用性换能效”的判断可迁移到系统设计与技术选型。主要风险是科普定位且无参考文献,部分 2026 年数据需后续核实,不宜作为底层微架构实现的唯一依据。
工程实践 Oxide Public RFDs
本文是 Oxide 关于虚拟机热迁移单调时间处理的公开 RFD,核心是 x86 TSC。文章说明 guest 要求 TSC 单调、恒频且启动归零,而跨主机迁移使 bhyve 传统偏移算法失效。作者结合 AMD SVM 与 Intel VMX 的 TSC 缩放/偏移机制,推导 guest TSC、offset 与频率倍率公式,并用四个场景演算。随后分析定点表示导致的溢出与精度限制,提出最大倍率上限,并讨论向下倍率漂移和 NTP 误差边界。最后列出误差建模、机架频率差异、跨迁移墙钟同步等开放问题,部分内核实现仍处原型阶段。
推荐收录:这是一份面向真实热迁移需求的系统设计 RFD,直接给出 TSC offset/倍率公式、AMD/Intel 定点表示、溢出边界和倍率取舍,证据充分而非泛泛介绍。适合虚拟化、hypervisor、OS 时间子系统与云基础设施工程师阅读,可迁移到跨主机迁移的时间一致性与数值边界验证;不足是墙钟同步、误差建模和内核接口仍留作开放问题。
工程实践 Oxide Public RFDs
Oxide 的 RFD 284 描述主机操作系统镜像如何由 Pico Host Boot Loader(phbl)加载并启动。phbl 从复位向量开始,将引导核从 16 位实模式推进到 64 位长模式,初始化 UART,解压 CPIO 归档中的 phase1 镜像,提取 illumos 内核 ELF 并载入 RAM,最后调用其入口点。文档规定了虚拟内存映射保证(最大页优先、UART 非缓存、RAM writeback)、内核入口时的硬件与页表状态,以及最小化系统状态修改的设计目标。安全上假设服务处理器已用根信任验证镜像,phbl 不做运行时校验,存在 TOCTOU 风险;当前归档被编译进 phbl 镜像,内核路径硬编码,为待解问题。
推荐收录,因为本文给出了真实系统中引导加载器与内核之间的完整接口契约:从 CPU 模式切换、页表粒度保证到入口时的寄存器与内存状态,均有明确约束和设计取舍。对操作系统、固件和低层系统开发者来说,这些边界条件与安全假设(如依赖 SP 校验镜像导致的 TOCTOU)具有直接参考价值,可迁移到其他平台的设计与调试中。
工程实践 Oxide Public RFDs
RFD 0020 定义 Oxide 的 Host Bootstrap Software(HBS)目标:只覆盖主机处理器从复位后到移交宿主 OS 前的软件。其核心职责是加载 HOS 镜像、扩展信任并移交控制权。文档限定只能从预置 M.2 NVMe 或 SP UART 启动,拒绝任意介质和交互式启动,失败需经 SP 上报。实现上依赖 AMD PSP 初始化 DRAM 后唤醒 x86 核心,安全策略点类似 UEFI SEC,并强调功能尽量下沉到 HOS、用声明式描述替代常驻固件。目标包括开源可重分发、快速启动、有限 G/S 状态且不追求 PC 兼容;部分内容已被 RFD 241/215/216 取代。
推荐收录,因为它不是泛泛的固件介绍,而是给出 HBS 的职责边界、启动链、信任扩展、启动介质限制和非目标,可直接用于理解现代服务器从 PSP 到 HOS 的启动设计。对做操作系统、固件/引导、系统安全和基础设施架构的读者有较高迁移价值,尤其是功能下沉 HOS、声明式描述和最小化常驻固件的原则。需注意文档绑定 Oxide/AMD 平台且部分细节已被后续 RFD 取代,使用时应交叉核对。
技术文章 Daniel Lemire 2026/09/15
文章用 C++ 微基准测试 IEEE 次正规浮点数在不同处理器上的性能代价,覆盖乘法、数组相加、除法和依赖乘法链,并对比正常、全部次正规及 1% 次正规输入。实验在 GCC 15/clang 17 的 O3 -march=native 下运行,覆盖 Intel Granite Rapids、Emerald Rapids、AMD Zen 5、AWS Graviton 5 和 Apple M4 Max。结果显示 Intel 上次正规乘法约慢 45–50 倍,除法约慢 18 倍,依赖链每步从约 1 ns 增至 30 ns 以上,乘法延迟从 4 周期升至 128 周期;加减法不受影响,正常输入产生次正规输出同样慢。AMD 乘加基本全速,依赖链约慢三分之一,除法约慢一倍;Arm 几乎无惩罚。作者认为最新 AMD/ARM 上可较少担心次正规性能,但 Intel 仍是显著问题;结论来自微基准,实际负载仍需验证。
推荐收录:文章给出跨 Intel、AMD、Arm 五款处理器的可复现微基准与源码,量化了次正规浮点在 Intel 上乘法约慢 45–50 倍、除法约慢 18 倍等关键数据。对做数值计算、HPC、机器学习或游戏引擎的读者,可用于判断何时规避次正规数;但结果属微基准,迁移到真实负载前需结合向量化和数据分布验证。
技术文章 Ken Shirriff 2026/09/12
文章深入解析 Intel 8087 浮点协处理器 FSCALE 指令的微码实现。作者结合芯片裸片显微图像与 Opcode Collective 反汇编出的 1648 条微指令,说明 FSCALE 虽只是按 2 的幂缩放浮点数,却需要 140 多条微指令和三级子程序处理零、空栈、NaN、无穷、非规格化数等边界情况。核心流程包括把标度参数转为整数、用 0x403e 计算右移位数、更新指数,并调用子程序处理上下溢、生成 denorm 和按精度舍入。文章还解释 guard/round/sticky 舍入位、指数转换器及未公开的 CC1 条件码副作用。结论是 8087 以复杂微码换取数值正确性,但部分行为仍属设计取舍或未完全解释。
推荐收录。文章提供完整的 FSCALE 微码清单、芯片功能块定位和子程序控制流分析,证据密度高,展示了从浮点转整数、特殊值处理到 denorm 与舍入的完整硬件实现路径。对 CPU 架构、微码、浮点数值和逆向工程读者有长期参考价值;但它假设读者具备一定体系结构与浮点格式基础,部分微码命名和未文档行为仍需后续验证。
技术文章 Ken Shirriff 2026/08/30
本文详细分析了1980年Spacelab航天飞机实验室所用Mitra 125 MS计算机的磁芯内存模块。文章先阐述磁芯存储基本原理,包括磁滞、重合电流寻址、感应/禁止线、二极管矩阵等,并回顾其发展历史。随后重点拆解该机的四层磁芯板,说明其采用2½D架构,通过每位独立X驱动省去禁止线,实现128 KB容量。作者以大量微距照片追踪各类信号线的实际布线,并分析防噪的交叉设计。最后指出磁芯因非易失和抗辐射而在航天领域沿用至1980年代,终被半导体存储取代。文章兼具原理讲解、系统逆向分析与历史脉络,极具参考价值。
文章来自资深逆向工程专家Ken Shirriff,基于对实物模块的详细拆解,提供了大量原始照片和具体布线的技术分析,证据充分。适合计算机体系结构、存储技术、航天计算及硬件逆向工程爱好者和研究者阅读。其可迁移价值在于理解磁芯存储的工程取舍和2½D架构的设计思路,同时为现代存储系统提供历史参照。
工程实践 Meta Engineering 2026/08/24
文章介绍 Meta 自研训练与推理加速器 MTIA 300,它针对推荐排序模型训练中的通信瓶颈,将网络接口直接集成进芯片封装,通过两个包含 6 个 800 Gbps RDMA NIC 的 chiplet 提供 1.2 TB/s 总带宽,避免 PCIe 和 CPU 中介开销。芯片加入 16 个独立消息引擎和近存计算单元,以超过 2.8 TB/s 归约吞吐实现线速 AllReduce/ReduceScatter,与计算网格隔离,并行运行 GEMM 时计算吞吐损失小于 0.5%。通信库 HCCL 与硬件协同设计,采用编译通信模型,将集合通信编译为依赖子图后由消息引擎自主执行,无需主机参与,并支持拓扑感知算法和 PyTorch 接口集成。在生产环境中,1500 亿参数推荐模型跨 40 个加速器训练时,通信时间比等效 GPU 集群快 3.9 倍。文章也讨论了架构对未来推理工作负载的适应性,并指出当前设计主要面向推荐模型。
本文是 Meta 工程团队对其训练芯片的深度技术解析,公开了芯片架构、NIC 集成、通信卸载引擎及 HCCL 编译模型的具体设计和性能数据,直接给出与 GPU 的量化对比(0.5% 干扰、3.9 倍加速)。适合 AI 基础设施、分布式训练、芯片设计与高性能网络方向的工程师和研究者阅读。其通信一体化和软硬件协同设计思路可迁移到其他 AI 加速系统,但性能数据来自厂商自测,需保持一定批判性。
技术文章 LWN.net 2026/08/13
Christopher Domas 发布了一份概念验证,展示如何利用 AMD 内存控制器的 bank swizzle 模式绕过内存保护,实现任意数据读写,包括 CPU 微码定义和平台安全处理器内存。文章指出,该行为在 AMD 官方手册中已有文档记录,但通过该模式访问任意内存并重写固件而不导致主机崩溃,似乎属于设计之外的非预期副作用。利用该技术需要内核级权限,因此对大多数软件并非直接威胁,但攻击者未来可能将其用于恶意目的。文章梳理了技术原理、触发条件和安全影响,并强调硬件文档与安全边界之间的潜在冲突。对于关注系统安全、内核防护和硬件设计风险的读者,这是一份重要的技术资料。
推荐收录,因为它揭示了硬件功能与安全预期之间的真实冲突,并给出了可复现的概念验证和官方文档依据,具备长期技术参考价值。适合系统安全研究者、内核开发者和硬件平台工程师阅读,有助于在设计加固和威胁建模时考虑类似侧效应。
工程实践 Ken Shirriff 2026/07/31
文章对IBM 604(1948)电子计算穿孔机中的TR-3触发(触发器)模块进行了逆向工程和实际演示。作者从真空管三极管的工作原理讲起,详细剖析了反相器电路和交叉耦合反相器构成的触发器,解释了电平移位和脉冲输入的实现,并展示了模块如何通过两个稳定状态存储一位信息。文中还结合历史脉络,说明该触发器如何用于十进制计数器(BCD编码)并为早期计算机的状态机提供基础。文章边界在于它聚焦于历史硬件,其高电压设计和模拟敏感性与现代数字电路有较大差异。
本文通过实际逆向工程和上电演示,阐释了真空管触发器的电路原理与历史意义,为理解早期计算机设计提供了第一手资料。适合对计算机历史、电子学基础或反向工程感兴趣的读者,其中的电平移位、交叉耦合和稳定条件分析可迁移到对时序电路基本原理的教学中。
技术文章 Daniel Lemire 2026/07/25
文章通过 pointer chase 基准测试,系统测量了 Intel、AMD 和 Graviton 处理器的内存级并行度(MLP)演化。核心方法是构建 1 GiB 的随机循环数组,同时运行多条独立的指针追逐路径(lanes),通过观测吞吐量饱和点确定单核可维持的最大并发内存请求数。结果显示,AMD Zen 5(Turin)达到 58 条并发缓存行请求和 24.5 GiB/s/s 随机访问带宽,约为 Intel Granite Rapids 的两倍;Intel 十年间从 10 增长至 30,主要提升在最近两代;Graviton 5 延迟显著改善,但 MLP 停滞在 19。测试在 AWS 云实例上进行,数据与脚本公开。该研究为理解处理器内存子系统的实际能力提供了可重复的实验框架和跨代对比。
推荐收录。文章不是泛泛的性能宣传,而是给出了可复现的指针追逐实验设计、完整的跨平台数据及演化趋势分析,直接揭示了 MLP 这一隐藏关键参数对软件性能的实质影响。对从事性能调优、系统选型或体系结构研究的读者极具参考价值,其测量方法和结论可迁移至各类内存敏感型工作负载的优化中。
技术文章 Mitchell Hashimoto 2026/07/22
文章倡导所有开发者了解 SIMD(单指令多数据流)并破除其过于复杂的迷思。作者以 Zig 语言为例,展示了一套通用的五步模式来将标量循环向量化:广播常量、按向量宽度迭代、执行向量操作、归约向量结果、处理标量尾部。通过终端模拟器 Ghostty 中查找控制字符的真实案例,详细解释了每步的实现细节和寄存器位运算。文章还讨论了编译器自动向量化的局限性,强调手动编写 SIMD 可以在可预测的情况下获得显著性能提升,同时指出该方法主要适用于大量连续数据的处理场景,对于复杂算法则需更高技巧。整体内容清晰、可迁移,降低了 SIMD 的入门门槛。
本文以易懂的案例和通用模板系统讲解了 SIMD 的基本模式,适合希望提升循环密集型代码性能的软件开发者。其提出的五步法具有高度的可迁移性,能帮助读者跨语言理解向量化思维,避免过度依赖容易失效的编译器自动向量化。对于日常优化中处理扫描、比较、计数等任务的工程师,本文是一份低门槛、高回报的入门参考。
技术文章 NVIDIA Technical Blog 2026/07/10
本文深入探讨了CUDA中的内核融合技术,旨在缓解GPU计算与内存带宽之间的瓶颈。文章从GPU内存带宽不足以完全利用计算能力这一常见问题出发,详细解释了内核融合如何通过合并多个CUDA内核来减少内存传输和内核启动开销。文中介绍了多种实现融合的方法,包括手工编写融合内核、利用CUDA图动态融合以及通过编译指示自动融合等,并对比了各自的适用场景和潜在局限。文章还指出,内核融合虽然能够提升性能,但可能增加寄存器使用量和代码复杂度,需在具体情况下权衡。整体而言,该文为GPU性能优化提供了系统性的实践指导,特别适用于受内存带宽或启动延迟限制的计算密集型应用。
本文来自NVIDIA官方技术博客,从问题背景、优化原理到多种实现方式进行了系统阐述,并提供了可操作的代码示例和权衡分析。对于从事GPU编程、性能优化或HPC领域的开发者,文中关于减少内存瓶颈和启动开销的策略具有直接指导意义,可迁移至其他受类似约束的计算架构中。因此,该文具备长期参考价值,适合收录为技术深文。
工程实践 知乎 - 手抓饼熊 2026/06/23
这篇文章基于 GTC 2026 关于 CUTLASS Python 的演讲,系统分析了如何在 Blackwell GPU 上围绕 GEMM 逐步逼近 Tensor Core 峰值性能。文章从基础 GEMM 的分块、TMA 传输、TMEM/RMEM/SMEM 流水线讲起,进一步比较了 2CTA、Warp Specialization、TMA Store、Persistent Kernel、Preferred/Fallback Cluster、Dynamic Scheduler 和 PDL 等优化手段在不同矩阵规模与瓶颈条件下的收益与边界。全文不仅给出性能数据,还强调了不同规模下瓶颈会从 DRAM 延迟、epilogue 开销转向 L2 命中率和调度效率,适合作为 Blackwell 上高性能 GEMM 编程的系统性参考。
推荐收录,因为它不是单纯介绍 CUTLASS Python,而是把 Blackwell 架构特性、内存层次、调度机制和性能结果串成了一条完整的优化路径。对做 GPU kernel、推理加速或高性能矩阵计算的读者来说,这些关于瓶颈切换、流水线隐藏和 cluster 调度的结论具有很强的可迁移性。
技术文章 知乎 - 手抓饼熊 2026/06/20
这篇文章系统梳理了 NVIDIA Tensor Core 的编程模型与优化方法,覆盖 Warp Level、Warpgroup Level 到 Blackwell 第五代 Tensor Core 的演进,并把 Nsight Systems/Nsight Compute 的分析方法、TMA 流水线、CuTe/CUTLASS 编程框架串成一条完整优化路径。文章不仅解释了 MMA、tiling、寄存器/共享内存/TMEM 的数据流关系,还通过具体矩阵尺寸、SASS 形态和 profiling 指标说明如何判断瓶颈与选择合适的实现策略。适用边界主要在 NVIDIA CUDA GPU 生态,且部分 Blackwell/GTC 2026 相关特性具有较强版本依赖。
推荐收录,因为文章把 Tensor Core 的硬件代际、编程接口和性能分析工具放在同一框架下讲清楚,兼具原理、方法和实战排查路径。对于做 CUDA 算子优化、GPU 性能分析或 AI 基础设施开发的读者,它提供了可迁移的心智模型与调优抓手。
工程实践 Amazon Science 2026/06/10
这篇文章介绍了 AWS Graviton5 的整体设计升级,包括从 96 核提升到 192 核、采用 3nm 工艺、支持 DDR5-8800 与 PCIe Gen6,以及更大的 L3 缓存和改进后的芯粒互联。作者进一步解释了这些变化如何通过更好的分支预测、缓存层级、NUMA 划分和芯粒内互联来提升真实负载表现,尤其是数据库、Web 应用和机器学习推理等场景。文章还补充了 Nitro Isolation Engine 的正式验证隔离机制,强调了硬件设计与云安全之间的结合。
推荐收录,因为它不仅是产品发布,更提供了 CPU、缓存、芯粒互联、NUMA 和云安全隔离的具体设计思路,适合关注云基础设施和处理器演进的读者。尽管带有厂商宣传色彩,但其中关于真实工作负载优化与形式化验证安全性的论述具有较强的迁移价值。
工程实践 Stanford Hazy Research 2025/11/11
这篇文章深入分析了 AMD MI355X/CDNA4 GPU 上 AI kernel 的性能来源,并提出 HipKittens 作为面向 AMD 的编程原语集合。作者先从硬件结构入手,对比了 AMD 与 NVIDIA 在寄存器文件、SRAM、矩阵指令、chiplet/L2/LLC 组织以及编译器支持上的差异,说明许多在 NVIDIA 上有效的做法在 AMD 上会失效。文章重点解释了为什么 wave specialization 在 AMD 上表现不佳:没有寄存器重分配、AGPR/VGPR 约束更强、以及细粒度同步和内存指令行为更复杂。为此,作者提出 8-wave ping-pong 和 4-wave interleave 两种调度模式,并结合 chiplet-aware 的 grid 排布来提升缓存复用。实验表明,这些策略在 GEMM 和 attention 等工作负载上能达到接近或优于现有 AMD 基线的性能,但其方法强依赖 CDNA3/4 细节、HIPCC 行为和底层指令布局知识,移植到其他平台仍需重新验证。
收录依据很明确:文章不仅给出 AMD GPU 的硬件差异分析,还提供了寄存器调度、bank conflict、chiplet cache 复用和基准测试的完整证据链。适合做 GPU kernel、编译器和 AI 基础设施的长期参考,但读者需要接受其强 AMD/CDNA 绑定和大量底层实现细节。
科研议题 Stanford Hazy Research 2025/03/24
这篇文章是 Stanford Hazy Research 对 BASED 发表一年后的回顾,核心在于重新总结高效语言模型的设计原则与影响扩散路径。作者认为,推理时真正的关键权衡不是“是否使用 Transformer”,而是上下文回忆能力与 state size 之间的关系;BASED 通过“短程精确混合 + 大状态线性注意力”的组合,把这一帕累托前沿向外推进。文章进一步强调了 MQAR、EVAPORATE 等回忆评测任务如何成为衡量高效模型的重要基准,并回顾了该路线如何影响 Mamba-v2、RWKV-v5/v6、MetaLA、MiniMax、Liger attention 等后续架构。实现层面,作者强调从硬件出发设计内核,利用 H100 的 WGMMA/TMA 以及二阶 Taylor 近似的软最大核,在保持高质量的同时提升吞吐,并指出 k=2 在质量与性能间较平衡。文章也给出局限:高效模型仍存在“没有免费午餐”,且结论依赖具体工作负载与硬件平台,迁移时需要重新评估边界。
收录依据明确:文中不仅复盘了 BASED 的设计逻辑,还给出了可复用的评测基准、硬件优化手段和后续模型扩散证据。适合做高效 LLM、线性注意力和 GPU 内核设计的研究参考;但内容带有项目回顾色彩,部分效果宣称仍需结合原论文与独立复现交叉验证。
工程实践 Stanford Hazy Research 2025/03/15
文章介绍了 ThunderKittens 针对 NVIDIA Blackwell/B200 架构的新一代 GEMM 与 Attention kernel 实现,并解释其为什么能接近或超过 cuBLAS、FA3 的性能。作者把重点放在“数据流”而非传统 CUDA 控制流上,围绕 5 代 tensor cores、tensor memory 和 CTA pairs 设计更深的流水线,通过 producer/consumer warpgroup 协作、persistent kernel、跨迭代预取 K/V、以及把输出累积器逐级写回共享内存和 HBM,尽量消除 pipeline bubble。文章还指出 B200 的 tensor core 更大,微基准上更像 128×128 systolic,因此只有当 M、N 维度足够大时才能充分吃满算力,小尺寸 GEMM 会按比例降速。它同时展示了如何把 Hopper 上的 kernel 结构迁移到 Blackwell,并说明 tensor memory 如何缓解 backward pass 的中间状态压力。整体结论是:Blackwell 的性能优化核心是提高并行数据供给深度,而 TK 的 tile 抽象恰好适配这一点,但收益依赖于特定硬件与形状假设。
推荐收录,因为文章直接给出了 Blackwell 上 GEMM/Attention kernel 的实现思路、硬件特性利用方式和明确的性能对比结果,而不是泛泛介绍新卡参数。适合做 GPU kernel、AI 加速和高性能计算的长期参考,尤其对需要把 Hopper 代码迁移到 Blackwell 的读者有可迁移的流水线设计价值;但其结论强依赖 B200 的 128×128 计算单元和特定 tile 形状。
工程实践 Stanford Hazy Research 2024/11/27
这篇文章介绍 ThunderKittens 为 fp8 新增算子与 GEMM kernel 的实现思路,目标是在保持统一编程接口的同时支持量化数据类型。作者重点解释了 fp8 与 fp16/bf16/fp32 在寄存器布局上的差异,以及为何需要额外的线程间 shuffle 来完成数据重排,而不是简单复用原有 tile 逻辑。文章进一步分析了 ldmatrix/stmatrix 与 WGMMA 在 H100 上的使用方式,说明 fp8 在共享内存到寄存器加载时仍受 16 位指令接口限制,只能通过“先按 16 位加载再拆成两个 fp8”的方式绕过。为了降低 bank conflict,作者讨论了 32/64/128-byte swizzling 的适用条件,并把 fp8 tile 宽度下限提高到 32,以匹配更大的 core matrix 和更好的硬件利用率。整体结论是:fp8 kernel 可以复用 bf16 的整体结构,但必须围绕数据布局、bank conflict 和硬件指令约束做针对性改造,且效果高度依赖 NVIDIA H100 这类支持 WGMMA 的平台。
文中直接给出了 fp8 kernel 的布局、shuffle、swizzle 和 bank conflict 处理细节,并用 H100/WGMMA 约束解释了为何要这样设计。适合做 GPU 算子、AI 基础设施和高性能 CUDA 编程的参考,但结论明显依赖特定硬件代际。