技术文章 Ken Shirriff 2026/09/26
文章围绕 Intel 8087 浮点协处理器的 FPTAN 正切指令,作者通过开盖显微成像、微码 ROM 逆向和数值分析,解释其如何把 CORDIC 与 Padé 有理逼近结合起来。CORDIC 用 arctan(2^-n) 特角序列与移位加减实现旋转,但 16 步仅约 16 位精度;8087 先用 CORDIC 伪除法确定 16 个旋转决策位,再把剩余小角度交给 3x/(3-x^2) 有理逼近,最后通过伪乘法逆序应用旋转得到 X、Y。文中还给出微码级实现、隐式定点指数缩放、移位寄存器、SQUARE 子程序及 0.95 输入的分步示例,并讨论参数范围、精度异常和性能占比。结论是这种混合算法以较少硬件兼顾速度与 64 位精度,而 Pentium 后转向多项式是因为快速乘法器已普及。其边界在于历史硬件逆向,并非现代浮点库实现指南。
推荐收录。文章以开盖显微照片、微码 ROM 反汇编和逐步数值表为直接证据,完整还原 FPTAN 的 CORDIC 伪除法、有理逼近与伪乘法流程,技术细节可验证且远超一般科普。适合计算机体系结构、浮点运算、逆向工程与数值算法读者,可迁移价值在于混合算法设计、隐式定点指数管理和微码性能分析。
技术文章 Fzakaria Blog 2026/09/21
文章围绕 Nix 动态 derivations,用 applicative 与 monadic 类比说明传统构建图必须预先可知,而动态 derivations 把 bind 从求值器下移到调度器,使构建中可继续生成新 .drv。作者以掷骰子为例:step 掷 d6,非 6 则生成 passthrough 并递归 depth+1,6 则终止并输出深度,涉及 builtins.outputOf、content-addressed derivation 与 recursive-nix。约 900 次实验得到链长均值 6.18、中位数 4、最长 46,与几何分布吻合。文章指出当前 --dry-run 等工具无法内省动态图,并讨论 Mario 模拟、状态空间搜索和爬虫等超出 lang2nix 的用法,同时留下图深度与规模边界未知的问题。
推荐收录:文章不是泛泛介绍 Nix 新特性,而是用类型系统和调度层差异解释动态 derivations 的根本变化,并给出可运行示例、实验数据和可迁移的搜索/爬虫等场景。适合构建系统、开发者工具和编程语言实现方向的读者,能帮助理解增量/动态依赖图的代价与当前工具链局限;主要风险是动态 derivations 仍属实验特性,文中 --dry-run 不可用等结论需结合版本验证。
技术文章 知乎 - 鹅厂架构师 2026/09/17
文章用制衣厂比喻系统讲解 CPU、GPU、TPU、NPU 的定位与差异:CPU 像裁缝老师傅,擅长复杂串行逻辑与调度;GPU 像工人大军,以大规模并行见长,并成为 AI 训练推理的通用算力底座;TPU 像提花织机,以脉动阵列专攻矩阵乘法,能效高但换算子或新架构时灵活性差;NPU 则是终端侧低功耗 AI 推理芯片。文中结合苹果 M 系列、英伟达 Blackwell、谷歌 TPU v7、A18 Pro 等产品与算力指标,对比设计目标、核心数量、灵活性、能效比和典型位置。最后从任务性质、晶体管预算、功耗约束和市场需求四条线解释为何造不出全能芯片,并指出真实系统依赖异构协同。其边界是大众科普,缺少论文引用和微架构细节,部分前瞻数字需按发布时间复核。
推荐收录:文章用统一类比串起四类处理器的架构取舍,并给出具体产品、算力指标和 GPU 与 TPU 在灵活性与能效上的边界对比,不是简单名词解释。适合希望建立芯片全景认知的工程师、学生和技术管理者,其中“通用性换灵活性、专用性换能效”的判断可迁移到系统设计与技术选型。主要风险是科普定位且无参考文献,部分 2026 年数据需后续核实,不宜作为底层微架构实现的唯一依据。
工程实践 Null Program 2026/09/17
文章介绍作者为 1995 年的 16 位 Windows 4X 游戏 Stars! 构建 Stars!VM:它内嵌 80286 模拟器和 Win16 到 Win32 桥,使老游戏以原生 Win32 程序运行,并保留现代文件选择器与 4K 缩放。模拟器直接调用宿主 x87 硬件处理 80 位浮点,并用差分模糊测试随机指令与 JIT 结果对比来验证正确性;桥接层负责映射句柄、转换结构布局和处理 DOS 中断。作者还通过 MCP 暴露 UI DOM 与客户机内存,让 AI 代理注入事件甚至完整试玩一局。性能上,基于指令 trace 反向工程热点例程并改写为新 80286 指令,使回合生成约提速 2 倍,同时缓冲 I/O、原生实现 WaveMix.dll、压缩资源,并注入序列号和固定硬件签名绕过拷贝保护。方案依赖 x86/x86-64 与 SSE2,且不实现软件 x87,适用边界较明确。
推荐收录。文章给出一个真实且完整的遗留系统复活案例:从 80286 仿真、Win16/Win32 桥接、差分模糊验证,到 trace 驱动热点优化和 MCP 代理接口,都有具体约束、取舍与验证证据。适合对模拟器、系统编程、逆向工程和遗留软件迁移感兴趣的读者,其中的差分测试、指令级补丁和 I/O 缓冲思路可迁移到其他兼容层或运行时项目。
技术文章 Oxide Public RFDs
本文是 Oxide 的 RFD 552,讨论硬件/软件接口透明性应成为系统厂商选择硬件的前提。作者先将接口分为 ISA、数据接口与控制接口,并区分 HAL、实现负载等非接口概念,继而提出五级透明性框架:公开文档、私下无约束文档、开源 HAL、逆向工程、有约束的私下文档(最不可取)。文章逐条反驳厂商常见反对理由(被复制、支持负担、安全风险、第三方协议),并揭示文档不完整、代码有 bug、暴露错误、他人写软件等未明说的恐惧。结论是透明性近乎零成本,能催生编译器、OS、调试器等生态,而封闭会阻碍跨层创新;Intel 与 Linux 的共生被作为论据。其边界是公司立场文件而非量化研究,但提供了可复用的接口透明性评估框架。
推荐收录。文章给出可操作的接口分类和五级透明性模型,并用 Renesas 电源控制器、AMD openSIL、LPC55S69 逆向、Lattice iCE-40 等实例支撑,不是泛泛呼吁开源。适合硬件/软件协同设计、基础设施、SoC 选型与开源战略相关读者,可用于制定供应商接口文档要求和评估封闭接口的长期成本;但需注意其立场源于 Oxide 的全面开源目标,未必适用于所有商业约束。
工程实践 Oxide Public RFDs
该 RFD 分析 Flex BMR491 IBC 在 R1C 及更早版本中的设计缺陷:输入欠压保护误触发会使 12V 输出瞬时跌到约 8V。作者反推 Flex 的缓解方案和 PMBus 寄存器数学,发现其 MAX_DUTY 常量存在字节序错误,按 LINEAR11 重新推导出 95% 占空比对应 0xeaf8。结合 Oxide 各机型热插拔阈值,文章判断 Gimlet/Sidecar 实际不会降到 35V,只有 Cosmo 需要启用 VOUT 欠压保护。最终决定仅对 R1C 关闭 VIN 欠压、不持久化配置,并在 A2 状态由 Service Processor 写入,以规避竞态和 STORE_USER_ALL 风险;局限是 R1D 修复尚未验证。
推荐收录:这是一份真实硬件/固件工程决策记录,包含设计缺陷机理、厂商缓解方案、PMBus 寄存器反推、错误常量验证和多机型约束取舍,证据链完整。适合固件、硬件系统、电源与可靠性工程师阅读;其“批判性重算供应商配置、按修订版本灰度启用、避免持久化写风险”的方法可迁移到类似嵌入式/基础设施维护场景。
工程实践 Oxide Public RFDs
RFD 363 描述 Oxide 的 Minibar:一种面向 SP3/SP5 计算 sled 的制造测试器。它插入 sled 背板,提供类机架接口,将背板 PCIe x4 引出到 x16 槽,把 SGMII 管理网口转为 BASE-T,并内置 Ignition 控制器。目标是在编程站一次完成编程、测试和锁定,验证 Ignition、PCIe Gen3 x4、管理链路及 200G/100G KR4 环回链路,并通过 PCIe 网卡加载主机 OS。架构复用 Sidecar 的 VSC7448 交换、Ignition 控制器和 RoT/SP,分为生产型与 Minibar Lite,并讨论机械/电气安全和基于 RoT 测量启动的缓解。其边界是高度绑定 Oxide 专用 sled 与背板,部分安全细节未定型,但测试夹具、环回验证和复用既有平台的取舍对硬件/基础设施工程有迁移价值。
推荐收录。该 RFD 不是产品宣传,而是给出完整的制造测试器需求、五项测试能力、Sidecar 复用、PCIe 引出、管理网口转换、KR4 环回、两种机械形态、安全与威胁模型等工程细节。适合服务器硬件、数据中心基础设施、制造测试和固件/平台工程师阅读,可迁移其测试夹具设计、复用既有平台、环回验证与安全缓解思路;主要限制是高度依赖 Oxide 专用 sled/背板,部分安全设计仍未定型。
工程实践 Oxide Public RFDs
RFD 316 定义了 Oxide 主机系统软件(HSS)与 Service Processor(SP)之间异步串行链路的通信协议。协议以主机单向发起请求、SP 仅回复为核心,SP 通过 GPIO 电平中断通知事件,并采用 hubpack 小端编码、固定头部(magic/version/sequence/command)、Fletcher-16 校验和最大 4123 字节消息。帧层使用 COBS 与 0x0 分隔符,单次仅允许一个未完成请求,并通过状态寄存器、额外帧终止符和重传处理 SP 重启、帧损坏与死锁。文档还列出 HSS→SP 与 SP→HSS 命令表、状态/启动选项寄存器以及安全边界。其限制是 UART 无双向认证、可被物理中间人攻击,且部分长耗时操作与 RoT 请求语义仍待确定。
推荐收录:该 RFD 不是概念介绍,而是给出了可实现的串行 RPC 协议细节,包括消息布局、命令枚举、COBS 组帧、校验、重传和失步恢复,并明确无认证等安全不足。适合嵌入式/固件、系统软件和硬件-软件接口设计者参考,其单请求串行、状态寄存器驱动和重同步策略可迁移到类似带外管理通道。
工程实践 Oxide Public RFDs
Oxide 的 RFD 284 描述主机操作系统镜像如何由 Pico Host Boot Loader(phbl)加载并启动。phbl 从复位向量开始,将引导核从 16 位实模式推进到 64 位长模式,初始化 UART,解压 CPIO 归档中的 phase1 镜像,提取 illumos 内核 ELF 并载入 RAM,最后调用其入口点。文档规定了虚拟内存映射保证(最大页优先、UART 非缓存、RAM writeback)、内核入口时的硬件与页表状态,以及最小化系统状态修改的设计目标。安全上假设服务处理器已用根信任验证镜像,phbl 不做运行时校验,存在 TOCTOU 风险;当前归档被编译进 phbl 镜像,内核路径硬编码,为待解问题。
推荐收录,因为本文给出了真实系统中引导加载器与内核之间的完整接口契约:从 CPU 模式切换、页表粒度保证到入口时的寄存器与内存状态,均有明确约束和设计取舍。对操作系统、固件和低层系统开发者来说,这些边界条件与安全假设(如依赖 SP 校验镜像导致的 TOCTOU)具有直接参考价值,可迁移到其他平台的设计与调试中。
工程实践 Oxide Public RFDs
本文是 Oxide 的 RFD 241,提出主机启动策略 Holistic Boot:将几乎全部启动逻辑放入单一 illumos 主机 OS 镜像,不向独立生产内核交接,也不依赖可逆固件状态。设计确定由主机 OS 完成硬件初始化,内核驻留并保持控制;采用 phase-1 SPI NOR 与 phase-2 SSD、双 BSU A/B 绑定升级,由 loader stub 加载内核,host OS 经 SP 获取变量信息并负责 phase-2 度量/策略,SP 负责 stage-0/phase-1 度量与恢复。文章对比 Tiny/Giant/Helios 方案,引用 LinuxBoot 多阶段状态传递事故,分析 LZMA 压缩、MP0、ELF 压缩等空间约束,并讨论可验证启动、安全边界与开放问题。其结论依赖 Gimlet 及类似 sled 硬件、illumos/SP 生态,压缩与 loader 实现仍待原型验证。
推荐收录:它给出真实系统启动架构的完整决策记录,包含硬件约束、存储布局、固件行为和 LinuxBoot 反例,能帮助读者理解从 firmware 到 OS 的状态交接风险。适合做操作系统、固件/启动、服务器基础设施和可验证启动的工程师研读;其中 BSU 绑定、度量边界和单阶段启动取舍可迁移到类似平台设计,但部分方案未落地,需结合开放问题阅读。
工程实践 Oxide Public RFDs
这份 RFD 定义 Oxide 服务器机箱管理的职责分配架构,重点划分主机处理器与服务处理器(SP)之间的数据和控制路径。作者提出单一事实源、单一执行点、库存与健康监测合一、复杂行为自托管及 Sidecar/Gimlet/PSC 对等等原则,并据此分配热环路、DIMM SPD、电源控制、FRU 库存与错误/性能遥测。热与电源安全控制归 SP,带内设备库存和主机侧遥测归主机;DIMM SPD 比较多种方案后倾向在 EVT1 验证 SP 代理。文档还覆盖安全考量与开放问题,并声明除 DIMM SPD 等未决项外,分配结论对当前及后续产品具有规范性。
推荐收录:该文档不是泛泛介绍,而是给出可执行的机箱管理职责矩阵、原则和 DFD,包含热环路、DIMM SPD、电源与遥测等真实取舍。适合服务器硬件、固件、带外管理和系统架构读者,其“单事实源/单执行点/对等分配”方法可迁移到类似平台。需注意 DIMM SPD 最终方案仍待 EVT1 验证,部分安全与开放问题尚未闭合。
工程实践 Oxide Public RFDs
RFD 0020 定义 Oxide 的 Host Bootstrap Software(HBS)目标:只覆盖主机处理器从复位后到移交宿主 OS 前的软件。其核心职责是加载 HOS 镜像、扩展信任并移交控制权。文档限定只能从预置 M.2 NVMe 或 SP UART 启动,拒绝任意介质和交互式启动,失败需经 SP 上报。实现上依赖 AMD PSP 初始化 DRAM 后唤醒 x86 核心,安全策略点类似 UEFI SEC,并强调功能尽量下沉到 HOS、用声明式描述替代常驻固件。目标包括开源可重分发、快速启动、有限 G/S 状态且不追求 PC 兼容;部分内容已被 RFD 241/215/216 取代。
推荐收录,因为它不是泛泛的固件介绍,而是给出 HBS 的职责边界、启动链、信任扩展、启动介质限制和非目标,可直接用于理解现代服务器从 PSP 到 HOS 的启动设计。对做操作系统、固件/引导、系统安全和基础设施架构的读者有较高迁移价值,尤其是功能下沉 HOS、声明式描述和最小化常驻固件的原则。需注意文档绑定 Oxide/AMD 平台且部分细节已被后续 RFD 取代,使用时应交叉核对。
技术文章 Ken Shirriff 2026/09/12
文章深入解析 Intel 8087 浮点协处理器 FSCALE 指令的微码实现。作者结合芯片裸片显微图像与 Opcode Collective 反汇编出的 1648 条微指令,说明 FSCALE 虽只是按 2 的幂缩放浮点数,却需要 140 多条微指令和三级子程序处理零、空栈、NaN、无穷、非规格化数等边界情况。核心流程包括把标度参数转为整数、用 0x403e 计算右移位数、更新指数,并调用子程序处理上下溢、生成 denorm 和按精度舍入。文章还解释 guard/round/sticky 舍入位、指数转换器及未公开的 CC1 条件码副作用。结论是 8087 以复杂微码换取数值正确性,但部分行为仍属设计取舍或未完全解释。
推荐收录。文章提供完整的 FSCALE 微码清单、芯片功能块定位和子程序控制流分析,证据密度高,展示了从浮点转整数、特殊值处理到 denorm 与舍入的完整硬件实现路径。对 CPU 架构、微码、浮点数值和逆向工程读者有长期参考价值;但它假设读者具备一定体系结构与浮点格式基础,部分微码命名和未文档行为仍需后续验证。
技术文章 Daniel Lemire 2026/09/09
文章以 C11 线程与 stdatomic.h 引入原子变量与内存序。它先解释数据竞争与编译器/硬件重排的原因,再区分 relaxed、acquire 与 release 语义,指出 release 与 acquire 分别配合“我完事”和“确认别人都完事”。通过引用计数写时复制数组的例子,展示 naive 代码会造成泄漏或双释放,并给出用 atomic_fetch_sub 与 acquire fence 的完整实现。最后谈到 threads.h 在不同平台的可用性,以及 x86/ARM 上 acquire-release 的成本差异。目标是让读者理解原子操作与内存序的实用边界。
推荐收录。文章以可运行的示例逐步揭示 C 并发中易被忽视的内存序细节,而不仅是罗列语法;其引用计数释放的完整纠错过程对编写共享资源和锁无关代码很有价值。适合需要深入理解 C 内存模型、或在使用引用计数的系统库中避免数据竞争的读者,也可作为后续探讨 acquire/release 语义的入门材料。
技术文章 LWN.net 2026/09/03
文章聚焦 Linux 内存在分层内存(tiered memory)方面近期的实现动态。分层内存系统包含性能不同的多种内存,如高速 HBM 或慢速 CXL 内存,内存分配的位置会显著影响工作负载性能。虽然这类改进研究已持续多年且近期节奏略有放缓,但仍有多项工作进行中。文章梳理了相关补丁与设计取舍,并指出这些方案正在被追问分层设计本身是否合理。内容面向内核内存管理子系统的开发者和关注新硬件内存架构的系统研究者。
文章来自 LWN.net,内容以 Linux 内核社区的具体补丁和设计讨论为基础,而不是产品宣传或新闻转述。它梳理了分层内存近期工作,并展现了关于分层设计合理性的开放问题,适合 Linux 内核开发者、系统软件工程师和关注 CXL 等新内存架构的读者。文中对方案取舍和演进脉络的归纳,可以作为理解内存子系统趋势的长期参考。
技术文章 matklad 2026/09/02
文章从回复一封关于“内存安全最难题”的邮件切入,讨论 use-after-free 与类型混淆的本质区别。作者用订单匹配引擎的 bug 说明:在没有对象池时,逻辑错误会变成物理类型混淆,可被利用为任意代码执行;引入类型隔离的对象池后,逻辑错误仍可能发生,但不再产生类型混淆。随后介绍两个来自 TigerStyle 的务实技巧:静态分配,即启动时确定最大容量并拒绝超额请求,避免运行期 OOM 导致灾难性故障;恒定工作量,即用“保留订单”填满固定数组,让每个订单只是状态流转,并通过全量遍历保证延迟平稳、便于编译器优化。文章还指出内联枚举是上述方案的破坏点,若始终堆分配枚举变体则可恢复。最后强调这些技巧有适用边界,不是万能解药。
推荐收录。文章以具体 bug 出发,把内存安全从类型混淆问题拆解为可工程化的设计约束,提出类型隔离分配、静态分配和恒定工作量等可迁移模式。适合系统程序员、语言设计者和高并发后端工程师参考;其对灰色失败和向量化性能的讨论体现了边界与取舍,风险在于这些模式并非适用所有场景。
工程实践 Cloudflare Blog 2026/08/27
文章讲述Cloudflare如何通过五项存储布局优化,将1.1.1.1 DNS缓存每条目的内存占用降低56%,在超过2500亿条缓存条目规模上节省约100TB内存。核心方法包括用Box替代Vec消除容量字段和堆预留空间、用区间偏移替代多个列表、对与查询域名相同的记录省略owner字段、将大枚举变体装箱以避免对齐填充浪费,以及将记录以原始字节加长度前缀连续存储。文章用自定义分配器基准测算了内存和性能,并在生产环境逐步验证,最终插入吞吐提升43%、查询延迟下降19%。边界在于这些优化依赖特定访问模式和数据分布,如大多数记录owner与查询域名一致、NAPTR等大类型罕见,且需要权衡解析成本和随机访问能力。
推荐收录。文章展示了从内存布局分析、基准验证到生产逐步灰度落地的完整优化流程,所有结论都有数据支撑,并明确说明取舍和适用边界。适合从事高并发缓存、DNS服务、存储密集型系统或Rust性能优化的工程师,'按数据分布定制数据结构'的思路可迁移到其他大规模系统。
技术文章 LWN.net 2026/08/27
本文深入剖析了 Shrikanth Hegde 提出的 steal governor 补丁系列,该机制旨在缓解虚拟化环境下多个虚拟 CPU 争抢少量物理 CPU 导致的性能下降问题。文章首先说明了虚拟化提高 CPU 利用率的前提与冲突:可分配 vCPU 数量增多但实际物理 CPU 时间有限,重度负载会引发竞争和显著性能损失。随后介绍了 steal governor 的核心思路:通过监控 steal time(被虚拟机管理程序偷走的时间)来感知物理 CPU 的争用程度,当争用较高时,虚拟机会主动减少活跃 vCPU 数量,从而降低调度竞争并改善整体性能。文章还讨论了该机制的设计权衡,包括何时触发调整、如何避免过度收缩、以及不同类型工作负载下的适用边界。该内容对理解虚拟化 CPU 调度、资源治理和内核补丁设计具有参考价值。
推荐收录,因为它详细展示了一个内核级资源治理补丁的问题定义、设计思路和权衡,属于 Linux 虚拟化领域的深度技术文章。适合内核开发者、虚拟化平台工程师和关注系统性能的读者,可帮助理解 steal time 的工程应用及动态资源调整的实践方法。
工程实践 Fzakaria Blog 2026/08/23
文章提出用 SQLite 数据库文件替代 ELF 作为 Linux 可执行格式,作者在 NixOS 上实现了名为 SELF 的原型。核心做法是把程序头、加载段、符号表等建模成 SQL 表,利用 SQLite 的 application_id 和 binfmt_misc 让数据库文件可直接执行,并编写 self-exec 解释器完成加载、重定位和跳转。文中还展示两种动态链接方案:通过 glibc rtld-audit 用 SQL 查询替换库查找,以及完全用 SQL 实现 dynamic linker;并把整个 userland 的 723 个可执行文件及其依赖打包进一个 611.9 MiB 的数据库。基准显示单文件体积约为 ELF 的两倍,启动有约 5ms 固定开销且缺页共享受限,但通过 closure 去重后整体体积反而略小于源 ELF。文章明确承认这是原型,兼容性和性能仍是适用边界。
推荐收录。文章不是概念空想,而是给出可运行的 SELF 原型、SQL schema、加载器和完整基准,并用一个 723 可执行文件的 userland 数据库验证了可扩展性。对操作系统、二进制格式、动态链接和数据库方向的工程师与研究者,它能启发将“格式”重新理解为可查询数据模型,且作者对体积、延迟和缺页共享的量化边界值得迁移。
技术文章 Alex Chan 2026/08/20
作者在项目中需要合并多个 .tar.gz 文件,起初尝试用 cat 直接拼接字节却失败,于是深入剖析 tar 和 gzip 的格式原理。文章指出 tar 源于磁带存储,采用顺序读取、追加写入和固定块大小,文件尾部有全零 EOF 标记,读者遇到它就会停止,因此直接拼接 tar 会导致第二个归档被忽略。gzip 是受专利法影响而设计的流式压缩器,由多个成员首尾相连组成,没有 EOF 标记,所以可以安全地用 cat 拼接。但当 gzip 与 tar 结合时,解压流中 tar 的 EOF 标记依然会让 tar 提前停止。最终作者用 Python tarfile 模块解包每个归档再重新写入,生成带单一 EOF 标记的新归档,并给出了 r:gz / w:gz 的完整代码。文章还讨论了文件大小需预先声明、重复文件名覆盖行为、EOF 后内容被忽略等边界,适合需要深入理解文件格式或处理归档合并的读者。
推荐收录。文章从一个常见却易被误解的实际问题切入,清晰揭示了 tar 与 gzip 在数据组织方式上的本质差异,帮助读者建立长期可用的格式心智模型。对从事数据管道、文件工具开发或需要处理归档格式的工程师,文中的原理解释和 Python 解决方案都可直接迁移。
科研议题 Cloudflare Blog 2026/08/19
本文是 Cloudflare 对其 Workers 平台远程 Spectre 攻击风险的重新评估,并发布了共同署名的研究论文。文章回顾了 2021 年基于动态进程隔离(DyPrIs)的防御措施,随后利用 2024 年至 2025 年初的新技术,在生产环境中构建了更新的攻击原型。攻击通过组合 V8 类型混淆瞬态指令、PLRU 缓存替换策略的信号放大、远程 WebSocket 定时器以及 Durable Objects 维持长期执行上下文,绕过了原有 DyPrIs 的检测,实现了 12 bit/s、准确率 99% 的跨隔离区内存泄漏。文章还详细说明了攻击受限于生产噪声、需要校准和统计分类,并指出 DyPrIs 因按调用结束后隔离和 iTLB 归一化而被规避。防御方面,Cloudflare 部署了 V8 Sandbox、基于 MPK 的进程内隔离、并改进了 DyPrIs 对长生命周期 I/O 密集型执行的检测。作者强调当前攻击已被缓解,且在三年内未发现实际利用迹象。
推荐收录:这是一篇罕见的生产环境实证安全研究,作者完整展示了从攻击原语搭建、噪声规避到防御改进的闭环,而非单纯理论推演。对研究 CPU 侧信道、云平台隔离或运行时安全的读者,文章中的攻击工程化方法和防御边界分析具有很高的迁移价值,还能帮助安全工程师理解 Spectre 类漏洞在真实多租户环境中的可利用性和缓解局限性。
工程实践 Phil Eaton - databases
文章介绍在amd64/Linux上使用ptrace拦截并修改系统调用,用Zig实现故障注入器,通过fork子进程、PTRACE_TRACEME和PTRACE_SYSCALL在系统调用入口与出口暂停。作者实现sys_write钩子:入口处把rdx写入长度截断2字节模拟短写;出口处将rax改为-EIO,从而绕过Go、Python、C内置write对EAGAIN的重试。文中还展示了用PTRACE_GETREGS/SETREGS操作寄存器,以及用PTRACE_PEEKDATA读取子进程内存打印写入内容。最终成功触发短写,并讨论方案局限:仅覆盖amd64/Linux、存在性能开销,未来可结合seccomp过滤优化。
推荐收录,因为文章用可运行的Zig代码完整演示了ptrace拦截系统调用的入口与出口、寄存器修改和内存读取,并通过真实调试发现Go/Python/C内置write对EAGAIN的重试行为,最终用返回EIO成功触发短写故障。适合从事Linux系统调试、故障注入和可靠性测试的工程师,方法可迁移到其他系统调用和语言,但需注意其仅覆盖amd64/Linux且ptrace存在性能开销。
技术文章 Phil Eaton - databases
文章记录作者在探索 Postgres 查询执行钩子时的学习过程,目标是从 QueryDesc 计划对象重建原始 SQL 字符串。作者搭建了带共享库的调试环境,通过 ExecutorRun_hook 拦截查询,并逐步解释 Plan 节点、范围表、OpExpr、Const、Var 等关键结构。文中给出完整 C 扩展代码,示范如何查找关系名、操作符名和列名。最终实现对简单 SELECT 的 SQL 重建,验证了 a > 1、a + 1 和常数比较等场景。该方法仅覆盖顺序扫描、整型常量与基础 Vars,尚未处理连接、聚合、子查询和别名等复杂计划,且依赖特定版本 Postgres 内部 API。
推荐收录,因为这是一篇可复现的数据库内核级工程笔记,而非泛泛介绍:作者提供了完整 hook 代码、构建方式,并逐步验证从计划树重建 SQL 的能力。适合数据库内核、Postgres 扩展开发者以及对查询计划内部表示感兴趣的后端工程师。其可迁移价值在于展示如何遍历计划节点、解析表达式并访问系统目录,但注意依赖特定版本内部 API,升级时可能变化。
技术文章 LWN.net 2026/08/11
本文介绍了KVM社区正在开发的KVM planes功能,旨在为Linux虚拟化系统提供统一的安全域隔离抽象层。随着CPU厂商推出AMD SEV、Intel TDX等多种硬件安全方案,应用开发者面临碎片化困境,KVM planes尝试将虚拟机资源(如CPU、内存)划分为不同planes,利用底层硬件特性但向用户态暴露一致接口。文章讨论了设计目标、关键机制(如嵌套虚拟化支持)以及当前开发进展,指出项目处于早期阶段,需处理多架构兼容与性能权衡,对上游集成尚有大量工作。
该文章深入解析了KVM planes的设计动机与技术要点,来自权威Linux内核技术新闻源LWN,具有长期参考价值。适合关注虚拟化安全、内核抽象层开发的工程师和研究者,其中对异构硬件安全方案统一接口的探索思路可迁移至其他同类系统设计。
技术文章 MaskRay 2026/08/09
文章深入解析LLVM分支概率信息(BranchProbabilityInfo)在没有PGO(Profile-Guided Optimization)资料时的静态估计机制。作者首先梳理了LLVM估算分支概率的多级回退流程,重点剖析了calcEstimatedHeuristics算法,该算法利用不可达、noreturn、cold等区块的种子权重,通过支配树和后支配树反向传播,并结合循环结构对出口边进行缩放,从而为多后继终结指令分配概率。文中给出了独立的C++实现,并详细讨论了权重标度、边分类、循环嵌套森林的作用,以及不可归约循环对概率计算的影响。此外,还指出了与LLVM源码bit-per-bit匹配所需注意的实现细节,如种子顺序和工作列表顺序。该方法展示了静态分析中如何仅凭控制流图和循环结构生成合理分支猜测,对理解编译器优化有重要参考价值。
本文为编译器开发者、程序分析研究人员或对底层代码优化感兴趣的人员提供了LLVM分支概率静态估计的深入技术剖析,不仅解释了算法原理、设计取舍和工程考量,还附带可复现代码和对比案例。其详细程度足以帮助读者迁移到其他编译系统或静态分析工具的开发中,适合作为长期技术参考资料收录。
工程实践 Ken Shirriff 2026/07/31
文章对IBM 604(1948)电子计算穿孔机中的TR-3触发(触发器)模块进行了逆向工程和实际演示。作者从真空管三极管的工作原理讲起,详细剖析了反相器电路和交叉耦合反相器构成的触发器,解释了电平移位和脉冲输入的实现,并展示了模块如何通过两个稳定状态存储一位信息。文中还结合历史脉络,说明该触发器如何用于十进制计数器(BCD编码)并为早期计算机的状态机提供基础。文章边界在于它聚焦于历史硬件,其高电压设计和模拟敏感性与现代数字电路有较大差异。
本文通过实际逆向工程和上电演示,阐释了真空管触发器的电路原理与历史意义,为理解早期计算机设计提供了第一手资料。适合对计算机历史、电子学基础或反向工程感兴趣的读者,其中的电平移位、交叉耦合和稳定条件分析可迁移到对时序电路基本原理的教学中。
技术文章 LWN.net 2026/07/27
文章介绍了hazard pointers作为内核RCU机制的替代方案,用于实现无锁数据更新。作者从原理层面比较了两者的内存开销、延迟和回收确定性,指出hazard pointers在低内存占用和及时回收方面的优势。文章还结合内核社区正在评估的实现,讨论了并发内存排序、安全语义以及实际部署中的工程权衡。内容适合理解内核无锁、垃圾回收机制和并发数据结构的读者,但未深入特定硬件架构或极端性能测试。
文章从原理、优缺点和工程可行性多角度剖析了hazard pointers在内核中的应用,具备深度的技术比较和清晰的适用边界说明。对于系统开发者、内核工程师或关注高性能并发的读者,本文可作为理解无锁同步替代方案的优质参考,迁移价值高。
技术文章 Fzakaria Blog 2026/07/27
文章深入分析 x86-64 大代码模型(-mcmodel=large)在处理线程局部存储(TLS)时的根本性缺陷。作者通过构造超过 2 GiB 的 .bss 和 .text 示例,对比普通数据访问与 TLS 访问的编译器重定位类型,指出尽管大代码模型为普通数据生成了 64 位重定位,但 TLS 访问序列仍使用 32 位立即数(如 R_X86_64_TPOFF32),导致二进制文件超出 2 GiB 时链接失败。进一步剖析 GCC 与 LLVM 生成的指令序列,揭示问题并非编译器实现缺陷,而是 x86-64 psABI 从未定义大代码模型下的 TLS 访问模式,使得 64 位 TLS 偏移无法编码到指令中。文章提供了可复用的 Python 脚本用于生成巨型目标文件,验证了现象的通用性,并指出该限制对有大量线程局部变量的静态链接可执行文件尤为严重。
本文并非泛泛而谈,而是通过可复现的构造实验和汇编级分析,定位到 x86-64 ABI 规范的一项具体缺失,揭示了大型二进制工程中的一个隐蔽陷阱。其直接证据清晰、方法可迁移,适合从事工具链、系统软件或性能敏感大型应用开发的读者参考。文章还提供了生成测试用例的脚本,有助于读者在自己的环境中验证和延伸研究,具备长期的参考价值。
工程实践 Datadog Engineering 2026/07/22
本文介绍了JDK 25中JFR新增的CPU时间采样事件,旨在解决传统Java profiler因依赖JVM内部未公开接口而导致的CPU分析偏差。作者详细阐述了由Datadog、SAP、Amazon等公司和OpenJDK社区共同推动的设计背景,解释了新事件如何基于操作系统线程调度数据实现无偏采样,避免基于栈采样或线程跟踪的常见误差。文章还讨论了该事件的实现原理、性能开销、使用方式以及与现有JFR事件的集成,并说明了其适用于Linux等支持OS级线程调度的平台。该工作为Java应用性能分析提供了更可靠的CPU数据基础,但对JDK版本和操作系统有要求。
本文深入剖析了JDK 25 JFR CPU时间采样事件的工程背景和实现细节,是由多家企业合作解决真实性能分析问题的案例,具有明确的长期技术参考价值。适合Java性能工程师、JVM研究者和可观测性平台开发者阅读。文中展示的偏差分析方法和跨社区协作经验可迁移至其他性能工具的设计与改进,帮助读者理解无偏CPU profiling的难点和解决方案。
技术文章 MaskRay 2026/07/12
文章聚焦于编译器和程序分析中的不可约循环(irreducible loops)问题,首先回顾了支配树和自然循环在可约控制流图上的局限性,指出在优化后的机器码及反编译输出中常见的多入口循环无法被基于支配关系的方法识别。随后详细介绍了韦韬等人在SAS 2007提出的单趟DFS算法,该算法无需支配树或UNION-FIND,通过将遍历中遇到的每条边分为五种情况,并结合“头部链”合并机制,在一次深度优先搜索中同时完成循环识别与头部标记。文章提供了完整的C++实现,并借助不可约核心图和嵌套结构示例验证了算法输出Havlak最细化循环嵌套森林,同时展示了可约情况下与自然循环的一致性。该算法的时间复杂度为O(N+k*E),其中k为衡量非结构化程度的系数,在实际代码中接近线性。文章也指出了算法对DFS顺序的依赖以及不可约循环头的不唯一性。
推荐收录,本文不是简单的算法复述,而是从理论缺陷出发,逐步引出单趟DFS解决方案,并配有清晰图示、完整代码和可运行示例。它对编译器工程、程序分析和反编译领域的读者具有直接的参考意义,能够帮助他们理解如何处理非结构化控制流,并将这套轻量级循环识别方法迁移到自己的静态分析工具中。
技术文章 LWN.net 2026/07/07
文章围绕 Linux 内核里两项彼此关联的改进展开:一是 Puranjay Mohan 关于提升 RCU 性能的工作,二是 Harry Yoo 和 Alexei Starovoitov 提出的 kmalloc_nolock(),后者允许在任意内核上下文中进行无锁分配。作者先解释 kmalloc_nolock() 如何借助 RCU 保证并发安全,再回到 RCU 本身的开销来源,说明这些优化为什么能缓解热点路径上的锁竞争。文章强调,这类改动主要服务于高并发、上下文受限的内核路径,并不意味着所有分配都可以无条件去锁。它提供了从 API 设计到同步语义的完整背景,但结论高度依赖 Linux 内核的实现细节。
收录理由很明确:文章直接讨论了 RCU 性能优化与 kmalloc_nolock() 无锁分配这两个内核机制,并交代它们之间的同步关系和性能动机。适合内核、存储、BPF 和系统性能工程读者,尤其是需要理解高并发路径上锁竞争与内存分配约束的场景;可迁移价值在于同步语义和 API 设计的权衡方法。
技术文章 Ken Shirriff 2026/06/28
这篇文章以作者实物拆解的两块 Space Shuttle I/O Processor 电路页为线索,系统梳理了航天飞机计算机的 I/O 架构。作者先说明 IOP 并非普通外设,而是连接 CPU 与 24 条数据总线的独立可编程处理器,采用 25 个虚拟处理器的 barrel processor 设计,由 BCE 和 MSC 两套完全不同的指令集分工完成网络搬运与调度。随后文章重点分析了 MIA 网络接口页的模拟前端、变压器隔离、Manchester 编码/解码、串并转换与校验逻辑,以及 PROM 页如何用熔丝 ROM 存放 72 位微指令并驱动物理处理器。文中还比较了 IBM 4 Pi 标准页与 IOP 专用页的尺寸、连接器、散热和封装密度差异,解释了为何航天级板卡会大量使用 hybrid module、flat-pack 与高可靠器件。文章结论指出,后来 AP-101S 将 CPU 与 IOP 合并以提升性能并减重,但原始 IOP 的架构与物理实现仍是理解早期航天计算机的重要样本;部分芯片编号和某些旁证板卡归属仍带有推断成分。
收录依据很明确:文章基于实物电路板、部件编号和官方文档,完整解释了航天飞机 IOP 的架构、总线协议、微码与板级实现,不是泛泛的历史回顾。适合做硬件逆向、古典计算机体系结构和高可靠系统设计的参考,尤其能迁移到“从板级结构反推系统工作方式”的分析方法。
技术文章 LWN.net 2026/06/24
这篇文章是对 OSPM 2026 第二天会议内容的整理报道,聚焦 Linux 内核中的电源管理与调度议题。涉及的主题包括设备频率调节、基于时间片时长进行 CPU 选择、多簇 Arm 系统的调度域设计、LAVD 调度器等,反映了内核社区在性能、能耗和调度策略上的最新讨论方向。文章价值主要在于把多个分散的会场议题串联起来,帮助读者把握当前 Linux 内核相关子系统的演进脉络与权衡点。
推荐收录,因为它围绕 Linux 内核电源管理和调度这一长期重要主题,汇总了多个具体技术议题,适合系统方向读者跟踪社区讨论和设计取舍。虽然它是会议报道而非深入教程,但对理解内核调度与能耗优化的演进方向仍有较强参考价值。
工程实践 Cloudflare Blog 2026/06/22
这篇文章复盘了 Cloudflare 在 Images binding 迁移后遇到的一起间歇性响应截断问题,最终定位到 Rust HTTP 库 hyper 的 HTTP/1 连接状态机里:flush 还没完成就被当作已完成,随后触发过早 shutdown,导致大响应在 socket 背压下被截断。作者通过复现工单、分层排除、分布式 tracing 和 strace 观察系统调用,最终用一个可控的“满缓冲 socket”测试稳定复现并修复了这个 race condition。文章特别说明了该问题只在特定时序、大响应、真实生产并发和读取方稍慢时出现,curl 等快速读取场景很难触发,因此很适合作为连接层故障排查与异步 I/O 正确性案例参考。
推荐收录,因为它不是简单的 bug 通报,而是完整展示了从现象、复现、分层排除到根因确认与最小修复的工程分析链路。文章对理解异步 flush/shutdown 顺序、socket 背压、以及为什么应用层观测可能看不到底层丢包问题,很有迁移价值。
技术文章 LWN.net 2026/06/22
这篇文章围绕 Python 的 free-threaded 版本展开,系统回顾了移除 GIL 的动机、相关历史、当前实现状态以及它对 Python 运行时和生态的影响。文章不仅解释了为什么要推进无 GIL,还讨论了这一变化在并行执行、兼容性、扩展模块支持和后续演进上的现实边界,因此适合作为理解 CPython 运行时演化的重要参考。
推荐收录,因为它提供了对 Python 核心运行时演进的结构化梳理,而不是停留在“去掉 GIL”这一结论层面。对于关注解释器实现、并发模型、C 扩展兼容性和语言未来方向的读者,这篇内容有较强的长期参考价值。
技术文章 Xe Iaso 2026/06/12
这篇文章解释了为什么大模型 API 里的 cached input tokens 通常比未命中的输入 tokens 便宜,核心原因是服务方可以复用前缀计算结果,避免对相同上下文重复做推理。作者用聊天消息不断累积的调用方式说明了 KV cache / prefix cache 的工作思路,并把它和延迟、算力成本以及用户侧费用直接联系起来。文章也给出一个实用建议:尽量保持推理设置和前置消息稳定,以提高缓存命中率、降低成本并改善响应速度。
推荐收录,因为它用通俗但正确的方式解释了大模型服务定价背后的系统原因,帮助读者把“缓存更便宜”从现象理解到机制层面。内容对做 AI 应用、推理优化或成本控制的人都很有参考价值,且经验可以迁移到其他依赖前缀复用的系统设计中。
工程实践 Microsoft Research Blog 2026/05/13
这篇文章系统介绍了 mimalloc 现代内存分配器的设计目标与实现取舍,包括线程本地 heap、按页组织的固定大小块、三层 free list、跨线程释放的原子 CAS 路径,以及通过 page stealing 在可扩展性和内存共享之间取得平衡。作者还给出了小对象分配/释放的快路径、跨线程同步开销为何可控,以及在大规模并发服务和超大内存工作负载中的基准表现,说明它既能支撑高吞吐也能保持较低碎片与可接受的提交内存比例。
推荐收录,因为它不是泛泛介绍 malloc,而是把并发分配器的关键设计点、数据结构、快慢路径和性能边界讲得很清楚,适合长期作为系统性能与内存管理参考。文章对“低争用、高局部性、可迁移到真实服务”的工程取舍有很强的迁移价值,尤其适合做系统编程、运行时和基础设施方向的读者学习。
工程实践 Amazon Science 2026/04/17
文章介绍 AWS 如何用 Isabelle/HOL 对 Nitro Isolation Engine(NIE)做形式化验证,证明其在云隔离与客户数据保护上的正确性和安全保证。作者解释选择 Isabelle/HOL 的原因:它在表达力、自动化、证明可读性和可扩展性之间更平衡,且支持可控的中间目标、定制解析器、locale、sledgehammer、反例搜索和代码生成。为验证 NIE,他们在 Isabelle/HOL 上实现了 separation logic,将 Graviton-5 架构规范、Rust hypercall 代码及安全性质组织成约 25 万行证明。文章还说明该证明可在普通笔记本上约半小时运行,显示工具能处理大规模目标。同时作者也强调,高阶逻辑无法完全自动化,实际部署仍需测试覆盖未形式化部分与前提假设,因而其价值主要在高风险系统的关键路径验证。
推荐收录,因为它给出了选择 Isabelle/HOL 的直接工程证据:不是抽象地谈形式化验证,而是落到云 hypervisor、25 万行证明和实际运行性能。适合做云安全、系统软件和证明辅助器选型参考,但也要注意它依赖严格规格与大量人工交互式证明。
工程实践 Go Blog 2025/10/29
文章介绍 Go 1.25 中实验性垃圾收集器 Green Tea 的设计与落地。作者先回顾 Go 现有的标记-清扫 GC,指出其主要成本集中在标记阶段,而且大量时间浪费在指针追踪带来的随机内存访问和 CPU 缓存失配上。Green Tea 的核心改动是“按页而不是按对象”组织工作队列:在页级别积累待扫描对象,用 seen/scanned 位图在页内区分已发现和已扫描的对象,从而把零散遍历变成更连续的内存扫描。文章进一步说明它如何借助 AVX-512 和 VGF2P8AFFINEQB 等指令做位图扩展与筛选,把多个步骤压缩到寄存器内完成。实测显示,多数负载可减少约 10% 的 GC CPU 时间,部分负载可达 40%,但结构很不规则、每页常只出现单个待扫对象的场景收益会变小甚至可能回退,因此仍是一个依赖工作负载形态的优化。
推荐收录,因为文章给出了 Go 运行时 GC 的具体瓶颈、页级扫描的新算法、位图与向量化实现细节,以及在生产环境中的量化收益,证据充分且可迁移性强。适合关注运行时、性能优化、缓存友好数据布局和指令级加速的读者;同时也提醒读者该方案对负载形态敏感,实验性开关阶段仍需做基准验证。
工程实践 fasterthanli.me 2025/09/15
文章以“自己实现一个频谱图”为目标,先说明频谱图如何把声音波形分解为不同频率,再把结果映射成随时间滚动的可视化图像。作者并没有只停留在概念层面,而是结合自己的 Rust 应用,讲解了项目由哪些 crate 组成、音频线程与图形线程如何协作,以及数据如何从采集、分析到绘制流转。文中重点不只是“怎么画出来”,还包括实时处理时的组织方式、线程分工和界面刷新策略,体现出一个可运行工具的整体结构。它更偏向具体实现与工程组装,而不是纯理论推导,因此对理解音频可视化管线很有帮助。边界在于文章主题集中在作者这套实现上,读者若要迁移到其他语言或更专业的 DSP 场景,还需要补充信号处理基础。
文中直接给出了频率提取、Rust crate 组合、音频/图形线程协作和绘制流程,证据明确,不是泛泛展示效果。适合做音频可视化、实时图形或 Rust 工程实现的参考,但迁移到更严肃的 DSP 场景时仍需补足信号处理细节。
科研议题 Stanford Hazy Research 2025/05/27
本文聚焦低延迟、batch size=1 的 Llama-1B 推理优化,指出 vLLM 和 SGLang 在 H100 上因大量小 kernel、launch/teardown 开销、以及严格的 kernel 顺序同步而只能利用约一半 GPU 带宽。作者提出把整层前向传播融合为一个“megakernel”,并用 GPU 端解释器统一调度各类指令。为解决资源竞争与依赖同步,他们设计了共享内存分页机制和基于计数器的显式同步,把权重加载、激活读写和计算更紧密地流水化。实验显示,H100 上前向传播可达到约 78% 内存带宽利用率,较基线提速 1.5x 至 2.5x;B200 上单次前向可压到 680 微秒以内。文章同时说明该方法主要适用于内存带宽主导、且追求极低延迟的场景,仍受激活加载、原子操作和同步开销限制。
文中给出了可验证的性能数据、明确的瓶颈分析和完整的实现取舍,不是泛泛而谈的加速口号。适合做 LLM 推理、GPU runtime 和系统优化的参考,但其收益主要局限于 batch=1 的低延迟内存受限场景。
技术文章 PlanetScale Blog 2024/04/24
这篇文章系统解释了 MySQL InnoDB 中的自适应哈希索引(AHI)是如何在 B-tree 索引之上再加一层内存加速的。作者先回顾了 B-tree、InnoDB buffer pool 和普通哈希查找的差异,说明 InnoDB 虽然不支持磁盘上的 HASH 索引,但会在运行时为高频访问的索引值或前缀构建 AHI 条目,把键映射到 buffer pool 中的数据位置。文章还说明 AHI 会根据访问模式和 buffer pool 命中情况自动增减,适合重复查同一批热点值的场景,不适合缓存很小或数据访问很分散的负载。通过 3.9 亿行表上的基准测试,作者展示了开启 AHI 后约 16% 到 20% 的 QPS 提升,并用 InnoDB 状态输出验证了哈希搜索确实被使用。结论强调:AHI 不是通用银弹,但在高并发、热点明显且索引较深的系统中,哪怕单次收益不大,也可能显著影响整体延迟和服务器容量。文章的边界也很清楚:收益高度依赖工作负载、buffer pool 大小和重复访问模式。
推荐收录,因为文章不仅解释了 AHI 的工作机制,还给出了 buffer pool、哈希命中统计和真实基准测试结果,能帮助读者判断它为什么快、何时有效。适合做 MySQL/InnoDB 性能优化、热点查询分析和存储引擎原理参考;但收益强依赖访问模式,不能把文中的提升直接外推到所有业务。