HPC

8 篇内容

技术文章Ken Shirriff

Reverse-engineering the vintage Intel 8087's tangent algorithm: more than CORDIC

文章围绕 Intel 8087 浮点协处理器的 FPTAN 正切指令,作者通过开盖显微成像、微码 ROM 逆向和数值分析,解释其如何把 CORDIC 与 Padé 有理逼近结合起来。CORDIC 用 arctan(2^-n) 特角序列与移位加减实现旋转,但 16 步仅约 16 位精度;8087 先用 CORDIC 伪除法确定 16 个旋转决策位,再把剩余小角度交给 3x/(3-x^2) 有理逼近,最后通过伪乘法逆序应用旋转得到 X、Y。文中还给出微码级实现、隐式定点指数缩放、移位寄存器、SQUARE 子程序及 0.95 输入的分步示例,并讨论参数范围、精度异常和性能占比。结论是这种混合算法以较少硬件兼顾速度与 64 位精度,而 Pentium 后转向多项式是因为快速乘法器已普及。其边界在于历史硬件逆向,并非现代浮点库实现指南。

推荐收录。文章以开盖显微照片、微码 ROM 反汇编和逐步数值表为直接证据,完整还原 FPTAN 的 CORDIC 伪除法、有理逼近与伪乘法流程,技术细节可验证且远超一般科普。适合计算机体系结构、浮点运算、逆向工程与数值算法读者,可迁移价值在于混合算法设计、隐式定点指数管理和微码性能分析。

工程实践NVIDIA Technical Blog

Topology-Aware Workload Scheduling with NVIDIA Topograph

本文由 NVIDIA 工程师撰写,介绍开源工具 Topograph 如何为 AI 工厂/GPU 集群提供拓扑感知的工作负载调度。核心问题是:分布式训练与推理需要通信局部性,若调度器不掌握当前的 GPU 与网络互连关系,工作负载会被打散到远端拓扑域,导致跨链路竞争、吞吐下降与成本上升。Topograph 通过 provider(从云 API 或本地 InfiniBand/Spectrum-X/MNNVL 发现拓扑)与 engine(输出 K8s 节点标签、NFD 资源、Slurm topology.conf 或 Slinky ConfigMap)两层抽象,把异构环境归一化为统一模型,并由 API Server、Node Observer、Node Data Broker 等组件在集群变化时自动重算。文章给出 Helm/native 包部署、节点标签校验、亲和性配置,以及与 KAI Scheduler、Kueue、Slurm、Slinky 集成的完整示例。主要边界是:它反映的是上报而非预期拓扑,部分能力依赖特定 provider、版本或 alpha 特性开关,且文中未给出量化性能收益。

推荐收录,因为它用可验证的仓库、Helm chart 和 API 端点具体展示了 GPU 集群拓扑感知调度的架构权衡与落地步骤,而非泛泛宣传。适合负责 AI 基础设施、GPU 调度、Kubernetes/Slurm 集群运维的工程师参考,其 provider/engine 抽象、标签层级与自动刷新机制可迁移到其他异构算力调度场景。风险在于其性能收益未量化,且部分特性依赖 alpha 开关与特定版本。

技术文章Daniel Lemire

Subnormal floating-point numbers are expensive… on Intel processors

文章用 C++ 微基准测试 IEEE 次正规浮点数在不同处理器上的性能代价,覆盖乘法、数组相加、除法和依赖乘法链,并对比正常、全部次正规及 1% 次正规输入。实验在 GCC 15/clang 17 的 O3 -march=native 下运行,覆盖 Intel Granite Rapids、Emerald Rapids、AMD Zen 5、AWS Graviton 5 和 Apple M4 Max。结果显示 Intel 上次正规乘法约慢 45–50 倍,除法约慢 18 倍,依赖链每步从约 1 ns 增至 30 ns 以上,乘法延迟从 4 周期升至 128 周期;加减法不受影响,正常输入产生次正规输出同样慢。AMD 乘加基本全速,依赖链约慢三分之一,除法约慢一倍;Arm 几乎无惩罚。作者认为最新 AMD/ARM 上可较少担心次正规性能,但 Intel 仍是显著问题;结论来自微基准,实际负载仍需验证。

推荐收录:文章给出跨 Intel、AMD、Arm 五款处理器的可复现微基准与源码,量化了次正规浮点在 Intel 上乘法约慢 45–50 倍、除法约慢 18 倍等关键数据。对做数值计算、HPC、机器学习或游戏引擎的读者,可用于判断何时规避次正规数;但结果属微基准,迁移到真实负载前需结合向量化和数据分布验证。

科研议题Microsoft Research Blog

Broadening access to Skala creates a faster path to predictive DFT

文章介绍微软研究院推出的 Skala 1.1,一种基于深度学习训练的 DFT 交换关联泛函。相比上一版本,训练数据量扩大 2.5 倍,在 GMTKN55 基准上加权平均误差达到 2.8 kcal/mol,以 meta-GGA 计算成本超越全局杂化泛函,并改善了电子密度、偶极矩和分子几何结构预测。Skala 已集成到 CP2K,并正在接入 Psi4、FHI-aims、ORCA 和 VASP 等主流电子结构软件。文中展示了 CP2K 与 PySCF 实现之间的数值一致性验证,误差在 0.1 kcal/mol 以内,同时给出 CPU/GPU 性能对比,并推出持续更新的性能基准报告。整体体现了连续改进的模型迭代思路,但作为项目进展公告,未深入展开模型架构与训练细节。

推荐收录,因为文章提供了明确的基准数值、跨软件集成验证和性能对比,展示了深度学习 DFT 从研究原型走向工程可用的路径。对计算化学、材料科学和 AI for Science 的读者有参考价值,尤其有助于了解 Skala 的集成方式和验证方法。需要注意这是项目公告,适合作为发展脉络的长期记录,而非方法论详述。

技术文章NVIDIA Technical Blog

NVIDIA NVLink: The Scale-Up Network for AI Factories

文章系统介绍了NVIDIA NVLink技术在AI工厂中的横向扩展网络角色,从第一代到第五代的演进,重点解析了第五代NVLink提供的1.8 TB/s总带宽、NVSwitch实现的GPU全互联拓扑,以及NVLink-C2C实现Grace CPU与Blackwell GPU间内存一致性的片间互连。作者结合DGX和HGX系统实例,展示了NVLink如何支撑万亿参数模型训练和实时推理,并概览了未来NVLink 6和7的性能指标。文章主要基于NVIDIA官方视角,对NVLink技术的原理、性能和系统架构提供了深入描述,但内容局限于NVIDIA生态系统,未涉及替代方案或成本权衡。

推荐收录,因为文章详细解释了NVLink的协议设计、拓扑演进和性能数据,并提供了具体的系统集成案例,对于需要理解大规模AI训练基础设施的工程师和架构师具有明确参考价值。尽管带有官方宣传色彩,但其技术深度仍可帮助读者掌握GPU互连对系统设计和可扩展性的影响,适合作为硬件架构和AI系统工程的学习材料。

技术文章NVIDIA Technical Blog

Kernel Fusion in NVIDIA CUDA: Optimizing Memory Traffic and Launch Overhead

本文深入探讨了CUDA中的内核融合技术,旨在缓解GPU计算与内存带宽之间的瓶颈。文章从GPU内存带宽不足以完全利用计算能力这一常见问题出发,详细解释了内核融合如何通过合并多个CUDA内核来减少内存传输和内核启动开销。文中介绍了多种实现融合的方法,包括手工编写融合内核、利用CUDA图动态融合以及通过编译指示自动融合等,并对比了各自的适用场景和潜在局限。文章还指出,内核融合虽然能够提升性能,但可能增加寄存器使用量和代码复杂度,需在具体情况下权衡。整体而言,该文为GPU性能优化提供了系统性的实践指导,特别适用于受内存带宽或启动延迟限制的计算密集型应用。

本文来自NVIDIA官方技术博客,从问题背景、优化原理到多种实现方式进行了系统阐述,并提供了可操作的代码示例和权衡分析。对于从事GPU编程、性能优化或HPC领域的开发者,文中关于减少内存瓶颈和启动开销的策略具有直接指导意义,可迁移至其他受类似约束的计算架构中。因此,该文具备长期参考价值,适合收录为技术深文。

工程实践NVIDIA Technical Blog

Unlock Exascale Performance on NVIDIA GB200 NVL72 with Slurm Topology-Aware Job Scheduling

文章围绕 NVIDIA GB200 NVL72 这类高密度 GPU 机架如何通过 Slurm 的拓扑感知调度来提升作业性能,核心关注点是“任务如何放置”而不仅是“硬件有多快”。它强调在共享集群里,调度器需要理解节点、机架和互联拓扑,才能更好地把大模型训练或推理作业映射到合适的资源上,从而更接近整机架的性能上限。文章的适用边界主要在于面向 AI/HPC 集群管理与 Slurm 调度实践,尤其是对 NVIDIA 这类高带宽、强拓扑约束平台的资源编排问题。

推荐收录,因为它讨论的是大规模 GPU 集群中非常典型且长期存在的问题:如何通过拓扑感知调度减少性能损失、提升资源利用率。对做 AI 基础设施、HPC 集群管理和高性能作业编排的读者来说,这类经验具有较强的可迁移价值。

工程实践NVIDIA Technical Blog

Running AI Workloads on Rack-Scale Supercomputers: From Hardware to Topology-Aware Scheduling

文章围绕 NVIDIA GB200/GB300 NVL72 这类 rack-scale 超级计算机,说明其以 Blackwell 架构、18 个紧耦合计算托盘、GPU fabric 和高带宽网络组成统一系统。作者强调,AI 任务在这种硬件上运行时,关键不只是“把机器装进机柜”,而是要理解通信拓扑并据此做作业放置与调度。文章从硬件层次、网络/互联特性讲到 topology-aware scheduling,重点讨论如何减少跨托盘通信、匹配计算与通信密集型负载,并提升整体吞吐和资源利用。结论是,软硬件协同设计能明显改善大模型训练与推理的扩展性,但方案强依赖特定 rack-scale 平台,不宜直接照搬到普通集群。

有明确的硬件细节与调度方法,不是单纯产品介绍:文章直接讨论 rack-scale 互联结构、负载拓扑感知放置和性能收益。适合 AI 基础设施、HPC 平台和集群调度读者参考,但迁移时要注意它主要针对 NVIDIA NVL72 这类特定架构。