Embedded Systems

9 篇内容

工程实践NVIDIA Technical Blog

TensorRT Edge-LLM Completes the MLPerf Edge Agentic Benchmark 6.4x Faster on Jetson AGX Thor

NVIDIA 技术博客介绍其在 MLPerf Inference v6.1 Edge Agentic 基准上的提交:TensorRT Edge-LLM 在单台 Jetson AGX Thor 上运行 Qwen3.6-27B,输出吞吐 52.33 tokens/s、首 token 时延 247ms,用 24 分 36 秒完成 1007 轮多轮工具调用负载,比 llama.cpp 参考实现快 6.4 倍,BFCL v4 准确率 87.94%。文章先说明评测口径:性能阶段回放软件工程 agent 轨迹、上下文增长至约 23.5K token,准确率阶段使用单轮 BFCL 提示。随后详解三项优化机制:NVFP4 量化权重与激活、FP8 KV cache 以缓解 DRAM 带宽瓶颈;跨轮 KV cache 与循环状态复用使约 96% 的 prompt token 命中热缓存,13.6M token 中仅预填 0.5M;树状多 token 预测(8 步、top-2、16 节点验证树)在函数调用场景再提升约 40% 解码性能。文中给出开源分支、量化检查点与复现命令,但结论限于单一硬件与模型配置,且属厂商自评。

推荐收录。文章不止给出 6.4 倍加速的跑分,还公开了 MLPerf Edge Agentic 性能与 BFCL 准确率的双阶段评测口径,并解释 NVFP4/FP8 量化、跨轮 KV cache 与循环状态复用、树状 MTP 三项优化的机制与量化收益(约 96% 热缓存命中、约 40% 解码提升),附可复现分支、检查点与运行命令。适合做边缘 LLM 推理、量化与投机解码的工程师;需注意其为 NVIDIA 自评,硬件与模型配置单一,收益不可直接外推。

工程实践Oxide Public RFDs

RFD 0630: BMR491 Glitch Mitigation Plan

该 RFD 分析 Flex BMR491 IBC 在 R1C 及更早版本中的设计缺陷:输入欠压保护误触发会使 12V 输出瞬时跌到约 8V。作者反推 Flex 的缓解方案和 PMBus 寄存器数学,发现其 MAX_DUTY 常量存在字节序错误,按 LINEAR11 重新推导出 95% 占空比对应 0xeaf8。结合 Oxide 各机型热插拔阈值,文章判断 Gimlet/Sidecar 实际不会降到 35V,只有 Cosmo 需要启用 VOUT 欠压保护。最终决定仅对 R1C 关闭 VIN 欠压、不持久化配置,并在 A2 状态由 Service Processor 写入,以规避竞态和 STORE_USER_ALL 风险;局限是 R1D 修复尚未验证。

推荐收录:这是一份真实硬件/固件工程决策记录,包含设计缺陷机理、厂商缓解方案、PMBus 寄存器反推、错误常量验证和多机型约束取舍,证据链完整。适合固件、硬件系统、电源与可靠性工程师阅读;其“批判性重算供应商配置、按修订版本灰度启用、避免持久化写风险”的方法可迁移到类似嵌入式/基础设施维护场景。

工程实践Oxide Public RFDs

RFD 0291: illumos GPIO Framework

该 RFD 提出 illumos 的 GPIO 框架设计,目标是为内核和用户态提供统一管理与消费方式。文章梳理 GPIO 在 Gimlet 上的用途,并对比多种 SoC 与 GPIO 扩展器属性,论证抽象必须保留设备特定性。方案包括内核 GPIO 框架与 provider API、控制器字符设备、gpioadm 工具,以及把受约束 GPIO 定义为 DPIO,通过 /dev/gpio/:name 提供 open/read/write/poll 语义。文章还讨论 I/O muxing、策略、中断与持久化难题,并列出内核框架、AMD Milan provider、仿真驱动和用户态命令等首批交付物。边界是不支持高速 bit-banging,muxing、中断与持久化仍属探索阶段。

推荐收录:这是 Oxide 公开的工程 RFD,直接给出内核 GPIO 框架、provider API、DPIO 与 gpioadm 的设计,并逐项比较 AMD Milan、Intel C620、ST H753 等控制器差异,证据密度高。适合操作系统、驱动开发、平台固件/硬件抽象相关读者,可迁移其属性建模、DPIO 约束和 I/O muxing 数据表方法;主要风险是部分设计仍为探索阶段,不能当作最终 API 规范。

工程实践Oxide Public RFDs

RFD 0316: HSS/SP communication protocol

RFD 316 定义了 Oxide 主机系统软件(HSS)与 Service Processor(SP)之间异步串行链路的通信协议。协议以主机单向发起请求、SP 仅回复为核心,SP 通过 GPIO 电平中断通知事件,并采用 hubpack 小端编码、固定头部(magic/version/sequence/command)、Fletcher-16 校验和最大 4123 字节消息。帧层使用 COBS 与 0x0 分隔符,单次仅允许一个未完成请求,并通过状态寄存器、额外帧终止符和重传处理 SP 重启、帧损坏与死锁。文档还列出 HSS→SP 与 SP→HSS 命令表、状态/启动选项寄存器以及安全边界。其限制是 UART 无双向认证、可被物理中间人攻击,且部分长耗时操作与 RoT 请求语义仍待确定。

推荐收录:该 RFD 不是概念介绍,而是给出了可实现的串行 RPC 协议细节,包括消息布局、命令枚举、COBS 组帧、校验、重传和失步恢复,并明确无认证等安全不足。适合嵌入式/固件、系统软件和硬件-软件接口设计者参考,其单请求串行、状态寄存器驱动和重同步策略可迁移到类似带外管理通道。

工程实践Oxide Public RFDs

RFD 0250: Management Network Topology and Proprioception

Oxide RFD 250 讨论管理网络拓扑与“本体感知”:控制平面 MGS 如何发现 SP、推断机架位置,并让 SP 获知自身位置。文章先确立 L2 网络、SP 间隔离、每交换机隔离、VSC7448/Tofino 端口一一对应等原则,再提出用 VLAN 标签实现隔离:MGS 到 VSC7448 按目标端口打标签,KSZ8463 到 SP 用 0x301/0x302。随后说明 MAC 从 FRU EEPROM 分配、以 EUI-64 生成 IPv6、用多播和 NDP 发现地址,并通过向确定端口发探测消息判断 Sidecar A/B 位置。文章还列出备选方案、开放问题和安全考量,指出恶意 Sidecar 可重配 VSC7448 等边界。

推荐收录:这是一份公开的机架管理网络设计文档,给出了 VLAN 隔离、地址发现、位置推断和安全威胁模型的完整取舍,并包含备选方案与开放问题。适合做数据中心网络、带外管理、嵌入式 SP 通信或 L2 隔离设计的读者参考,其中“用拓扑约束替代额外硬件或协议”的思路可迁移到类似系统。

工程实践Oxide Public RFDs

RFD 0088: Chassis Management Responsibility Allocation

这份 RFD 定义 Oxide 服务器机箱管理的职责分配架构,重点划分主机处理器与服务处理器(SP)之间的数据和控制路径。作者提出单一事实源、单一执行点、库存与健康监测合一、复杂行为自托管及 Sidecar/Gimlet/PSC 对等等原则,并据此分配热环路、DIMM SPD、电源控制、FRU 库存与错误/性能遥测。热与电源安全控制归 SP,带内设备库存和主机侧遥测归主机;DIMM SPD 比较多种方案后倾向在 EVT1 验证 SP 代理。文档还覆盖安全考量与开放问题,并声明除 DIMM SPD 等未决项外,分配结论对当前及后续产品具有规范性。

推荐收录:该文档不是泛泛介绍,而是给出可执行的机箱管理职责矩阵、原则和 DFD,包含热环路、DIMM SPD、电源与遥测等真实取舍。适合服务器硬件、固件、带外管理和系统架构读者,其“单事实源/单执行点/对等分配”方法可迁移到类似平台。需注意 DIMM SPD 最终方案仍待 EVT1 验证,部分安全与开放问题尚未闭合。

工程实践ClickHouse Engineering

Instrumenting my espresso machine with OpenTelemetry

文章以搭载 ESP32 开源控制器 GaggiMate 的 Gaggia 咖啡机为对象,把每次萃取当作分布式系统请求,用 OpenTelemetry 埋点并经 ClickStack 把遥测送入 ClickHouse 存储分析。关键工程点包括:裁剪上游 OTLP protobuf 为保留字段号的单文件子集以适配微控制器内存;把导出任务绑定第二个核心、用快照式加锁与队列满即丢弃,保证网络 I/O 不阻塞 50ms 萃取控制环;在设备端以恒定内存计算阻力变异系数等派生指标,并用 protobuf 拼接生成高分辨率曲线。文中还记录了跨线程 String 竞态与 TLS 栈溢出两个崩溃修复、基于 OCB 构建带 MQTT receiver 的定制 collector,以及只读 LLM Agent 经 MCP 查询闭环给出调整建议。结论强调 OTLP 是通用契约、埋点不得危及被观测系统、列式存储化解高基数问题;局限是整体仍属爱好级玩具问题,研磨度等关键上下文依赖人工录入。

推荐收录:文章把 OTLP protobuf 裁剪、ESP32 双核实时任务隔离、快照加锁与 drop-don't-block、设备端流式统计、protobuf 拼接、基于 OCB 的定制 MQTT collector 讲得具体且附字段号与代码,并用最坏情况测试验证编码器边界。适合可观测性、嵌入式/物联网遥测管道与列式存储方向的工程师,其中'埋点不得阻塞被观测系统''列式存储化解高基数'等经验可迁移到生产系统;局限是部分结论绑定 ClickStack/ClickHouse 生态。

工程实践Meta Engineering

How Meta Engineered Ultra-Narrow Batteries for AI Glasses

这篇文章围绕 Meta 为 AI 眼镜定制超窄钢壳电池的工程实践,解释了为什么传统软包电池难以适配眼镜镜腿这种极窄空间,以及他们如何通过改变电芯形态、极片结构和制造公差来提升可用体积与峰值供电能力。文中还讨论了双电池系统的同步、交叉充电风险、不同代际产品的容量提升与系统级续航优化,展示了硬件、固件和结构设计协同迭代的思路。

推荐收录,因为它不是单纯的产品宣传,而是给出了在极端尺寸约束下重做电池形态、降低内阻、处理双电池协同的具体工程思路。对可穿戴设备、嵌入式硬件和低功耗系统设计读者都有较强迁移价值。

技术文章NVIDIA Technical Blog

Maximizing Memory Efficiency to Run Bigger Models on NVIDIA Jetson

文章围绕 NVIDIA Jetson 这类边缘设备的内存瓶颈,讨论如何让更大的开源生成式模型在受限硬件上稳定运行。作者指出,随着多十亿参数模型从数据中心下沉到物理世界中的 AI 代理和机器人场景,显存/内存效率已成为部署成败的关键。全文重点不在训练新模型,而在推理部署侧通过压缩占用、减少运行时冗余和优化内存分配来扩大可运行模型规模。它强调必须在模型大小、吞吐、延迟和平台资源之间做权衡,适合 Jetson 与边缘 AI 场景参考。其边界也很明确:这些方法主要缓解内存压力,不能替代算力不足或模型本身结构不适配的问题。

推荐收录,因为标题和导语直接指向 Jetson 边缘部署中的内存效率优化,覆盖了多十亿参数模型落地这一长期问题。适合做边缘 AI、机器人和嵌入式推理选型参考,但方案强依赖 Jetson 平台,迁移到其他硬件时需要重新评估资源与性能权衡。