Theory

36 篇内容

工程实践Amazon Science

A decade of mathematical certainty: Reflections on the Automated Reasoning Group

文章回顾了 AWS 自动推理组十年间将数学逻辑、形式验证和程序分析从研究原型推向生产服务的历程。核心方法包括使用 SMT 求解器、证明助手(如 Lean)和规范证明,对 VPC 网络、IAM 策略、TLS 握手、Nitro 隔离引擎及授权引擎等关键系统给出数学保证。文中列举了 Tiros/Zelkova、Reachability Analyzer、IAM Access Analyzer 和 Amazon Bedrock Guardrails 等落地成果,并指出自动推理不仅提升安全与可靠性,还通过精确规范帮助团队简化系统设计。作者进一步认为,该技术正被用于验证 AI 生成代码和约束智能体行为,为可证明安全的 AI 系统提供基础。文章主要作为 Amazon 内部视角的成就回顾,未深入介绍具体算法、失败案例或量化局限。

本文作为工业界形式化方法落地的一手回顾,提供了多个真实生产案例(如 IAM Access Analyzer、Reachability Analyzer、Bedrock Guardrails)和可迁移的洞察:精确规范能简化设计,自动推理可用于验证 AI 输出。适合关注形式验证、云安全、AI 安全的读者了解从研究到工程化的路径。主要风险是 Amazon 自我视角、缺乏技术细节和失败分析,需结合其他深度材料使用。

技术文章Max Bernstein

A quick look at zero-knowledge proofs

文章以图三着色为例,从 Goldreich 等原论文的 Protocol 4 出发,用 Python 代码展示零知识证明的交互式流程。作者实现颜色置换、Nonce 加盐哈希锁定、随机边挑战和校验,解析单轮协议逻辑。然后讨论多轮重复的概率保障,并简要介绍如何将协议推广到数独和其他 NP 完全问题。文中还提供客户端/服务器端的交互式演示,指出该方法在实际大数分解等场景中因图规模过大而存在实践限制。整体面向计算理论和密码学爱好者,强调可运行代码与学术论文的对应关系。

推荐收录,因为文章将经典零知识证明协议从论文转化为可运行代码,完整保留原协议中的置换、Nonce 和哈希锁定等关键设计,并提供概率分析和交互式演示。适合对密码学、计算复杂性或交互式证明感兴趣的学生和工程师,可作为理解 ZKP 原理和实现 NP 完全问题零知识证明的入门参考。文中对归约方法的讨论也提示了该技术的实际边界与迁移思路。

科研议题知乎 - 苏剑林

解构Scaling Law:优化、架构、数据的三重奏

文章提出一种统一视角来理解深度学习中的Scaling Law,将模型训练损失分解为数据误差、优化误差和架构误差三层,并对每层关键变量(学习率、批大小、训练步数、参数量、宽度深度、数据量、多轮训练等)假设幂律形式,利用异幂不等式推导最优参数配比和缩放关系。推导结果与Kaplan、Chinchilla、Step Law、Microsoft Law等经典工作进行对照验证,部分指数理论值与实验值接近。文章还探讨了MoE和Memory等稀疏架构对Scaling Law的影响,以及数据端Multi-Epoch的最优轮数。最后讨论了幂律假设的合理性,指出幂律源于长尾性质和无标度性,而系数变化比指数变化更符合工程改进的物理类比。分析框架具有启发性,但数据侧分析仍较模糊,且幂律假设的适用范围需要在实际训练中验证。

本文对Scaling Law进行了系统性重构,将优化、架构和数据的影响纳入统一数学框架,推导过程清晰且与多个经典结论互洽,为理解深度学习扩展规律提供了新颖的整合视角。适合关注模型训练理论、资源分配和架构设计的深度学习研究者和工程师阅读,其推导方法和分解思路可直接迁移至其他规模定律分析任务。

科研议题知乎 - 苏剑林

让炼丹更科学一些(七):步长调度与权重平均

本文从凸优化理论出发,通过推广恒等式和放缩变换,推导出模型权重平均与学习率衰减之间的定量联系。作者首先指出常数学习率加等权平均的理论收敛速度可达到线性衰减的终点效果,但实践不佳;进而分析任意加权平均的收敛界,得到平均权重相当于学习率乘以衰减因子的结论,揭示了指数滑动平均(EMA)优于等权平均的原因。文中还结合 Schedule-Free 等近期工作,讨论了学习率调度无法完全被权重平均取代的深层原因,指出最优学习率仍依赖于总步数,导致相关方法仍无法彻底摆脱 warmup 和调度。该分析基于凸函数假设,实际非凸训练中结论可能偏移,但其理论框架为优化器设计提供了启发。

本文以严格的凸优化推导,系统揭示了权重平均与学习率衰减的数学等价条件,并解释了 EMA 奏效、等权平均失败的本质,对理解深度学习优化中的实用技巧有理论指导意义。适合从事优化器研究、模型训练或希望深入训练 dynamics 的读者,其推导方法可迁移至其他训练策略的分析中。理论假设与现实的差距已被作者明确指出,但仍不失为有价值的长期参考。

科研议题ACM Queue Articles

Titan Transients and LLM Scalability

本文提出基于通用可扩展性定律(USL)的大语言模型(LLM)计算动力学模型,用以解释OpenAI在训练LLM时观察到的计算高效前沿(CEF)。USL在标记化的神经网络景观中定义了双稳态极小值,其中更深的极小值决定了LLM实例可达到的最低损失。作者指出,规模更大的LLM具备与CEF幂律斜率对齐的更深的全局最小值,这表明CEF是更大规模模型捕获跨语料相关性的自然结果。文章为LLM可扩展性提供了理论框架,但模型依赖于对神经网络景观和标记化的假设,可能未涵盖所有实证因素。

该文章从通用可扩展性定律出发,为LLM训练中的计算高效前沿提供了新颖的理论解释,对理解缩放法则具有长期参考价值。适合关注LLM可扩展性、深度学习理论和性能建模的研究者与工程师阅读。其跨领域迁移价值在于将经典可扩展性理论与现代AI模型相结合,但需注意模型的理论假设可能与实际训练细节存在差距。

科研议题Stanford Hazy Research

🧠 MLPs are Hebbian Memories: A Simple Recipe for Fact-Storing Transformers

本文提出将Transformer中的MLP层视为Hebbian记忆的全新视角,据此设计了一种无需梯度下降的闭式MLP构建方法,用于高效存储事实(键值对)。该构建通过在高斯随机投影后的特征空间中计算外积和,使MLP以信息论最优的Θ(F log F)参数量存储F条事实。理论分析证明了该构建在独立MLP及Transformer Block中面对attention噪声时的容量保障,并可实现无需重训练的事实编辑。研究为理解LLM中的知识存储机制、可解释性及模型编辑提供了坚实的理论基础,主要局限在于目前侧重于理论构建与仿真验证,尚未在大型预训练模型上充分验证。

文章以简洁的数学框架揭示了MLP与Hebbian记忆的等价性,并给出了可证明的信息论最优存储构造,直接回应了LLM事实存储效率这一重要研究问题。适合关注模型解释性、知识编辑或高效微调的研究者与工程师,其构建思路可能启发新的无训练记忆增强或参数高效适配方法。

技术文章Eli Bendersky

Dot product: Component vs. Geometric definition

文章从文本解析和向量表示出发,详细阐述了向量点积的两种定义(分量定义和几何定义)为何等价。作者提供了两种证明:一是利用余弦定理的几何证明,从矢量差出发推导分量与几何形式的一致性;二是从几何定义出发,通过标准正交基和向量投影,推导出分量求和形式。附录中还补充了内积空间的基本性质、对称性、线性性和正定性,以及范数的概念。整篇文章结构清晰,证明步骤完整,适合作为理解点积数学本质的参考资料,但边界限于欧几里得空间中的标准点积。

推荐收录,因为文章提供了对点积两种定义的严格等价证明,内容深入且逻辑严密,具有长期参考价值。适合需要巩固线性代数基础的计算机科学学生、研究人员或工程师,可迁移到图形学、机器学习等领域中的向量运算理解。文章不是浅层介绍,而是对核心数学概念的透彻解析。

科研议题知乎 - 苏剑林

MoE环游记:9、门控归一化之争

文章围绕 MoE 中 Router/Gate 的“门控是否需要归一化”展开,比较了 Softmax、Sigmoid、ReLU 以及 Re-Norm 等不同做法,并指出当前工业实践中这些变体效果往往接近,因此更需要从理论上寻找统一解释。作者先从“让 Router 选择期望损失最小的 Expert”出发,构造目标分布与预测分布,并用 KL 散度把离散路由问题转化为可优化目标。进一步推导表明,这一过程可对应到 REINFORCE、STE,以及用专家权重改写后得到的前后一致训练形式,从而说明 Router 作为 Gate 时应当归一化,但不必 Re-Norm。文章也讨论了采样与 Top-k 的权衡,强调随机性、稳定性和负载均衡之间的取舍。其边界在于概率框架对 Top-2 等形式不够自然,因此它更像对主流 MoE 路由的一种统一解释,而非对所有变体的最终定论。

推荐收录,因为文章直接以 MoE Router/Gate 的训练机理为对象,给出了 KL、REINFORCE、STE 到归一化策略的统一推导,而不是停留在经验结论。适合研究 MoE、稀疏路由和大模型训练的人阅读;其可迁移价值在于帮助读者判断离散决策如何获得梯度,但对 Top-2 等变体的解释仍有边界。

技术文章Random Oracle

Constructing quine loops with QCC

文章延续 QCC(Quining C Compiler)的话题,讨论如何把“单文件 C 程序变成 quine”的能力扩展到多程序循环。作者先构造一个基础链路:C 程序生成 Python 程序,Python 再打印出 C 源码,并说明关键前提是把任意字符串稳定转成可执行的目标语言程序,尤其要处理引号、换行和 Unicode 等转义问题。随后文章展示如何把链路继续扩展到 Rust,并指出理论上可继续叠加更多语言,但会受到行长与转义开销的限制。进一步地,作者把目标从“只会打印源码的程序”推广到保留原有业务功能的程序对,通过预处理宏或运行时文本切片从合并源码中裁出 A/B 两个版本,使它们既能执行原功能,也能按条件输出对方源码。文章最后总结这种构造可推广到多个程序,形成任意两两可达的完整图,但也坦承预处理方案会带来大量死代码,运行时裁剪会更干净。

推荐收录,因为文章给出了从单个 quine 到多程序 quine loop 的明确构造路径,包含字符串转目标语言程序、源码拼接、条件编译和可扩展性限制等直接证据。适合关注编程语言、自指程序、源到源转换和编译技术的读者,且其中关于宏裁剪与运行时裁剪的权衡具有可迁移价值。

科研议题知乎 - 苏剑林

流形上的最速下降:6. Muon + 双旋转

文章围绕矩阵参数优化中的奇异值失控问题,提出了 Muon 的双旋转变体 MuonR。作者借鉴 Pion 的思路,先用“瞬时重参”把任意矩阵写成两个正交矩阵的乘积,再把更新转化为正交流形上的最速下降,从而只更新左右奇异向量并保持奇异值分布不变。文中给出了可解析的更新公式,并说明实际训练中可直接用动量替代梯度。作者还分析了它与普通 Muon、Pion 的差异、计算量约翻倍的代价,以及从常规 Muon 中途切换到 MuonR 的做法。其主要边界在于初始奇异值需事先设定,适合需要维持矩阵谱性质和训练稳定性的场景。

文章直接给出 MuonR 的推导、更新规则和与 Pion 的对比,属于可复用的优化器研究笔记而非泛泛讨论。适合做深度学习优化、矩阵约束训练和谱性质控制的参考,但需注意它对初始奇异值设定和额外计算量有明确要求。

技术文章知乎 - 苏剑林

为什么官方版Muon比MuP版多出一个max(1, ⋅)?

文章围绕 Muon 优化器官方版相较 MuP 版多出的 max(1,·) 截断项,解释它在特征增量尺度控制中的来源。作者从谱条件缩放、特征层更新幅度以及输入分布的各向同性/各向异性变化出发,分析了训练早期与中后期对缩放因子的不同需求,并给出了两种版本各自更合理的适用阶段。全文的核心结论是:官方版的截断更贴合早期各向同性假设,而 MuP 版在训练中后期可能更符合特征分布逐渐各向异性的现实。

推荐收录,因为文章不是简单介绍优化器名词,而是从特征更新机制和分布假设出发,解释了一个看似细小但会影响训练行为的实现差异。它对理解深度学习优化器、MuP 缩放和训练阶段性策略都有可迁移价值,适合关注模型训练稳定性与尺度设计的读者。

技术文章知乎 - 苏剑林

矩阵参数的奇异值熵越高越好吗?

文章围绕“矩阵参数的奇异值熵是否越高越好”展开,把这个经验问题转化为一个可计算的数学命题:在给定奇异值熵约束时,哪一类奇异值分布对应更大的“自由度/表达能力”。作者先回顾奇异值熵、有效秩与Rényi熵的关系,再通过“在单纯形上均匀采样”的几何视角、指数分布重参数化以及中心极限定理/平均场近似,推导出熵密度的峰值并不在最大熵处,而是在比最大熵略低的某个位置附近。文章最后指出,这个结论更重要的意义是提供一种分析框架:对模型参数施加奇异值熵约束时,不应简单追求越高越好,且结论依赖于大维度、近似均匀采样等假设边界。

推荐收录,因为文章不是停留在“奇异值熵更高更好”的直觉判断,而是把它形式化成可分析问题,并给出带有数学推导的参考答案。它对做模型训练、参数约束和表示能力分析的读者都有迁移价值,尤其适合作为理解“熵指标并非单调越大越优”的方法论参考。

技术文章Max Bernstein

Checking assembly with Z3

这篇文章记录了作者如何用 Z3 验证一段 JIT 生成的分支less 汇编条件,目标是证明 `FIXNUM_MIN / -1` 这一溢出特殊情况的判定与原始 C 逻辑等价。文章不仅说明了 Ruby fixnum 在二进制补码下的边界行为,还展示了如何把等价性证明转成“寻找反例”的 SMT 问题,并通过故意改错常量来验证脚本确实能抓到反例。

推荐收录,因为它把一个很具体的编译/JIT 边界 bug,抽象成了可复用的形式化验证流程,适合做低层代码正确性检查的参考。对做编译器、JIT、运行时或底层位运算逻辑的读者来说,这种“用 Z3 证明等价性”的方法具有很强的迁移价值。

技术文章Eli Bendersky

Notes on Fourier series

这篇笔记系统梳理了傅里叶级数的基本构造:如何通过正交性推导三角傅里叶系数,函数满足何种条件时可以讨论级数收敛,以及偶/奇函数、区间有限但非周期函数的周期延拓如何简化计算。文章还进一步给出了相位形式与复指数形式的等价表达,并用 Hilbert 空间中的内积与投影解释傅里叶展开为何本质上是一次“基底分解”。 正文以一个三角波为例完整演算系数,展示了从定义、推导到实例的闭环,并明确指出该理论与傅里叶变换之间的边界。整体更偏数学基础讲解,但对信号处理、图形学、数值分析以及理解频域表示的读者具有长期参考价值。

推荐收录,因为文章不仅介绍傅里叶级数的公式,还把“系数为什么是投影”这一核心机制讲清楚,并用 Hilbert 空间视角建立了更稳固的理解框架。它对需要理解频域、正交基和函数展开的技术读者具有可迁移价值,尤其适合作为基础理论参考。

技术文章知乎 - 苏剑林

如何更科学地估计矩阵的谱范数?

文章围绕矩阵谱范数的估计问题,系统比较了幂迭代、Krylov 子空间加速、Schatten 范数上界以及多阶矩改进等思路。作者不仅解释了各方法的数学依据、复杂度和数值稳定性,还给出了 JAX 实现示例,并明确指出不同方案在“近似监控”和“严格上界”两类场景下的适用边界。文章还联系了深度学习中的 Lipschitz 约束、谱归一化和 Muon 优化器,说明谱范数估计在训练稳定性中的实际意义。

推荐收录,因为它把谱范数估计这一基础数学问题,和深度学习中的训练稳定性、约束优化等实践场景清晰地连接起来,具有较强的长期参考价值。文章兼顾公式推导、算法改进、复杂度分析和数值稳定性,适合希望把理论工具落到工程实现中的读者。

科研议题OpenAI Research

An OpenAI model has disproved a central conjecture in discrete geometry

这篇文章介绍了一个由 OpenAI 内部模型自主找到的数学证明:它推翻了平面单位距离问题中长期被相信的“近似线性上界”猜想,给出了在无穷多个 n 上达到 n^{1+δ} 级别单位距离对数的构造。文章不仅说明了结论本身,还强调证明中意外引入了代数数论、类域塔和 Golod–Shafarevich 理论等工具,并讨论了这一结果对 AI 参与数学研究、跨学科发现与人机协作的意义与边界。

推荐收录,因为它记录的不只是一个数学结果,还包括 AI 模型在开放式研究问题上产生原创构造的代表性案例,对理解“模型能否参与前沿科研”有长期参考价值。对于关注 AI 推理能力、数学自动发现和跨学科研究的人,这篇文章提供了值得持续回看的问题背景、结论和影响判断。

科研议题知乎 - 苏剑林

MuP之上:4. 坚守参数的稳定性

这篇文章延续 MuP 系列,聚焦“参数稳定性”在训练全过程中的维持问题,而不仅是初始化阶段的约束。作者从最小改动原则出发,系统提出了 Post Clip 和 Pre Decay 两类一般框架,并将其具体化到向量 RMS 范数、矩阵谱范数、Embedding/LM Head 的行列范数以及 RMSNorm 的 gamma 参数等场景。文章的核心结论是:与其用普通权重衰减粗暴限制参数,不如使用与目标范数匹配的裁剪/衰减算子,在保证理论有界性的同时尽量减少对训练动力学的干预。

推荐收录,因为它不是简单介绍“怎么做裁剪”,而是从稳定性目标、最小改动、约束形式到具体范数计算,给出了一套可迁移的理论框架。对于研究深度学习优化、MuP、谱范数控制和大模型训练稳定性的读者,这篇文章能提供长期有效的方法论与推导思路。

科研议题Amazon Science

How mechanism design theory helps optimize Amazon-vendor collaboration

这篇文章介绍了 Amazon 如何用机制设计理论优化与供应商的协作,核心是将 VCG 机制与分布式协同优化协议 CPP 结合,在信息不对称的前提下寻找对双方整体成本更优的供给计划。文章不仅解释了静态场景下如何通过迭代式 best response 近似实现“真报即最优”的性质,还进一步扩展到滚动时间窗的动态机制,并用成本-收益转移(CBT)来刻画参与各方的激励与补偿关系。文中还提出了适用于低维决策空间的 menu-of-contracts 替代方案,并讨论了缺货、双向承诺和不确定性下的设计边界。

推荐收录,因为它把机制设计、分布式优化和供应链协同三个领域连接起来,给出了从理论到系统实现的完整路径,而不是停留在概念介绍。对研究机制设计、协同优化、AI/运筹系统工程的人都具有较强的迁移价值,尤其适合理解“激励相容如何落到大规模系统里”。

工程实践Amazon Science

Isabelle/HOL: The proof assistant behind the Nitro Isolation Engine

文章介绍 AWS 如何用 Isabelle/HOL 对 Nitro Isolation Engine(NIE)做形式化验证,证明其在云隔离与客户数据保护上的正确性和安全保证。作者解释选择 Isabelle/HOL 的原因:它在表达力、自动化、证明可读性和可扩展性之间更平衡,且支持可控的中间目标、定制解析器、locale、sledgehammer、反例搜索和代码生成。为验证 NIE,他们在 Isabelle/HOL 上实现了 separation logic,将 Graviton-5 架构规范、Rust hypercall 代码及安全性质组织成约 25 万行证明。文章还说明该证明可在普通笔记本上约半小时运行,显示工具能处理大规模目标。同时作者也强调,高阶逻辑无法完全自动化,实际部署仍需测试覆盖未形式化部分与前提假设,因而其价值主要在高风险系统的关键路径验证。

推荐收录,因为它给出了选择 Isabelle/HOL 的直接工程证据:不是抽象地谈形式化验证,而是落到云 hypervisor、25 万行证明和实际运行性能。适合做云安全、系统软件和证明辅助器选型参考,但也要注意它依赖严格规格与大量人工交互式证明。

技术文章Go Blog

Type Construction and Cycle Detection

文章深入解释了 Go 1.26 中类型检查器的“类型构造”和循环检测改进。作者先用简单的别名、切片、指针示例说明类型构造是一个深度优先的过程:只有依赖类型都完成后,当前类型才能变成 complete。随后文章引入递归类型,说明当类型构造返回 incomplete 类型时,许多依赖底层类型的检查必须延后到全部类型完成之后。接着作者用数组长度依赖 `unsafe.Sizeof` 的例子展示了“incomplete value” 与 downstream/upstream 运算符的区分,说明一旦值表达式会迫使对不完整类型做解构,就必须立即报 cycle error。最后文章概述了新的实现方式:在各类上游表达式处统一检查 completeness,阻止不完整值继续传播,并借此修复了旧算法中一些边缘崩溃问题,提升了编译器稳定性。

文章直接给出 Go 1.26 类型检查器的内部机制、错误边界和实现策略,不是泛泛而谈语言特性,而是可复用的编译器设计案例。适合编译器、语言实现和静态分析读者参考,尤其有助于理解递归类型、延迟检查与循环错误检测的通用思路。

技术文章matklad

Consensus Board Game

这篇文章用“委员会投票/棋盘”隐喻解释共识算法的核心数学结构,目标是帮助读者直观理解 Paxos 一类协议为何能在成员缺席时仍达成一致。作者先从简单多数投票讲起,说明为什么平票和领导者缺席会让决策卡住,再引入轮换领导者与“只允许批准”的规则来恢复可完成性。随后把单次投票扩展为半无限二维棋盘:每一列独立推进、每列都可能形成多数,但全局必须保证任意两个已完成多数列的结果一致。文章进一步说明,参与者需要基于左侧已知状态和“未来可能性”来选值,并通过让某个多数先承诺不在左侧投票,排除冲突结果。它的价值在于把安全性、活性与多数承诺的逻辑关系讲得非常直观,但作者也明确说明这里只覆盖抽象数学层面,未展开真实分布式系统中的消息时序、通信延迟和工程实现细节。

文章直接用棋盘图像重构共识协议的安全性与多数承诺逻辑,适合一直觉得 Paxos 难懂的读者。它的迁移价值在于帮助建立抽象模型,但不覆盖工程实现细节,适合作为入门和复习材料。

科研议题BAIR Blog

Information-Driven Design of Imaging Systems

这篇文章提出一种面向成像系统的“信息驱动设计”框架:不再只看重建图像是否好看,而是直接用互信息衡量测量本身能区分对象的能力。作者将互信息写成 H(Y)-H(Y|X),利用已知的噪声物理模型直接计算噪声项,再用概率模型学习测量分布,从而估计系统信息量。论文在彩色摄影、射电天文、无透镜成像和显微成像四个场景中验证了该指标能稳定预测下游解码器性能。进一步提出 IDEAL,只优化编码器参数而不训练解码器,结果在信息量和重建质量上接近端到端方法,同时显著降低显存和训练复杂度。但该方法依赖较明确的编码—噪声建模,且信息估计带有模型上界性质,建模误差只会高估信息。

文章给出了可直接复用的研究方法:如何把互信息拆解为可估计项,并用它替代重建网络来评价和优化成像系统。对计算成像、传感器设计和多模态感知研究者尤其有价值,但其适用前提是噪声模型明确、编码过程可建模。

科研议题Stanford Hazy Research

What Does Information Theory Say About Designing Agentic Systems?

这篇文章从信息论视角分析 agentic 系统中的“压缩器—预测器”结构:大模型作为编排器,小模型先从长上下文中提炼信息,再由上层模型综合生成结果。作者指出,当前系统评估往往只看端到端指标,难以区分是压缩阶段丢信息,还是预测阶段没用好信息,因此引入互信息来衡量压缩质量与信息密度。基于五类长上下文任务的实验,文章发现:增强压缩器通常比继续放大预测器更有效,且在固定预算下更适合把算力投向可本地运行的小模型。实验还显示,不同模型家族对压缩质量的影响大于单纯参数规模,互信息与下游准确率、困惑度存在较强相关。作者进一步在 DeepResearch 场景验证了该思路,在仅为前沿模型 28% 成本下达到 102% 的性能,但也承认互信息估计在实践中仍然困难,且结论主要适用于压缩—预测式多模型工作流。

文章给出了明确实验、可量化指标和跨任务验证,不是泛泛讨论 agent,而是提出了可迁移的设计原则:优先增强压缩器、关注信息密度、用互信息评估通信质量。适合做多模型工作流、Deep Research 或端侧/云端混合架构设计的参考,但需注意互信息估计本身仍有实践难点。

科研议题Stanford Hazy Research

Our In-House Recipe for Juicy, Fact-Stuffed MLPs

这篇博客从“生成式”视角研究 Transformer 中 MLP 层如何存储事实:不再只对已训练模型做探测,而是直接构造一个能够实现 key-value 映射的门控 MLP,并给出正确性与参数规模的理论保证。作者先提出 encoder gadget:在固定门控矩阵后,把求输出的问题化为线性系统,从而以接近最优的参数量把有限输入映射到任意标量。随后引入 value embeddings 的可解码性指标 ρ,利用“margin-optimal outputs + 随机 JL 投影”把输出维度压缩到 Θ(ρ^-2 log|V|),使整体 fact-storage cost 达到 Θ(ρ^-2|K|log|V|)。当值向量较均匀、ρ=Ω(1) 时,这一规模接近信息论下界,并显著优于先前构造;实验也显示其参数效率接近梯度下降训练的 MLP,且明显好于 NTK 基线。局限在于结论依赖 generic keys、ρ>0 以及随机投影高概率保证,主要覆盖可分性较好的嵌入情形。

推荐收录,因为文章明确给出了可证明的事实存储构造、参数下界对齐和可解码性 ρ 的核心理论证据,不是泛泛讨论 MLP 记忆现象。适合研究 Transformer 内部机制、表示几何和模型压缩的读者;其“先构造、再压缩、再验证”的思路也具有可迁移价值,但对嵌入可分性与随机性假设较强。

科研议题Stanford Hazy Research

Stuffing MLPs Full of Facts 🧠: A Generative Approach to Factual Recall

这篇文章讨论 Transformer 中 MLP 层如何存储与检索事实,作者没有沿用“事后分析已训练模型”的路线,而是采用生成式方法,直接构造可证明正确的事实存储 MLP。核心思路是把单隐层 MLP 分解为编码器和解码器:编码器把 key 压缩成约为 log F 维代码,解码器再恢复到 value 空间,从而在参数量上达到接近信息论下界的 Θ(F log F) 级别。文章进一步提出“可解码性”指标来刻画输出嵌入几何对容量的限制,并发现其对梯度训练和构造型 MLP 的事实存储能力都有很强预测性。作者还给出让 Transformer 可靠调用这类 MLP 的若干结构改动,并展示了在合成事实回忆任务上超过 99% 的召回率。最后,文章证明可通过整体替换 MLP 块实现模块化事实编辑,但同时指出容量与可用性之间存在权衡,且目前结果主要建立在受控合成设置中。

收录价值明确,因为文章不仅解释了 LLM 事实记忆的机制假设,还给出可证明的构造、下界匹配的容量分析和可复现实验。适合关注大模型机理、表示几何、可编辑记忆与合成验证的研究者阅读,但需注意其结论主要来自受控任务,向真实预训练模型迁移仍有边界。

科研议题BAIR Blog

What exactly does word2vec learn?

这篇文章讨论 word2vec 到底学到了什么,并给出一个可预测的理论解释。作者证明,在若干现实且实用的条件下,训练问题可近似化为无权最小二乘的矩阵分解,梯度流的终态可闭式求解,最终表示等价于对一个由共现概率与边际概率构造的矩阵做 PCA。文章进一步指出,word2vec 在小初始化下会按“离散、顺序”的步骤逐个学习新的正交概念,每一步都对应嵌入矩阵秩的提升。其推导依赖四个近似:原点附近四次展开、特定超参数约束、小初值和极小步长;但不对数据分布作假设,因此能直接由语料统计预测所学特征。作者还用类比题准确率和抽象线性概念的演化实验,说明该理论与真实训练过程吻合良好,但结论仍主要适用于小初始化、近似线性化的分析场景。

文中直接给出 word2vec 的闭式理论、PCA 等价关系和逐步学习动态,属于可复核的研究型解读而非泛泛科普。适合关注表示学习、语言模型理论和论文分析的读者,但需注意其结论依赖若干近似条件,不应直接外推到所有训练设置。

科研议题Stanford Hazy Research

BWLer 🎳 (Part 2): Navigating a Precision-Conditioning Tradeoff for PINNs

文章围绕 PINN 在高精度求解 PDE 时常见的精度瓶颈,提出 BWLer(Barycentric Weight Layer)作为一种以重心拉格朗日插值为核心的高精度替代层。作者将函数表示与导数计算解耦:一种模式让 MLP 只预测插值节点值,再由 BWLer 统一完成全局插值与谱导数;另一种模式则直接把节点值作为可学习参数,形成显式 BWLer。实验表明,前者在三个基准 PDE 上可把误差降低 10 到 1800 倍,后者甚至能把相对误差推到 10^-12 量级,接近机器精度。文章进一步指出,精度提升与条件数恶化之间存在显式权衡:节点越多越精细,但导数矩阵越病态,优化越困难。作者也明确了边界条件:对不连续解、复杂几何或需要快速训练的场景,BWLer 目前仍可能比标准 MLP-PINN 更慢、更依赖二阶优化。

收录证据很明确:文章给出可复现的方法设计、三组基准 PDE 结果、误差与条件数的权衡分析,以及对不连续/复杂域的局限说明。适合做科学机器学习、PINN 和数值方法结合方向的长期参考,尤其对关注高精度训练与优化病态性的读者有可迁移价值。

科研议题Stanford Hazy Research

Efficient language models as arithmetic circuits

这篇文章围绕“高效语言模型为什么在关联回忆(associative recall)上落后于 Transformer”展开,用 MQAR 这一合成任务把能力差异具体化。作者先从 gated convolution、linear attention 和 selective state space 等架构的实证误差分析出发,指出大部分质量差距集中在需要从上下文中精确检索旧信息的回忆能力上。随后,文章把这些模型统一表述为算术电路/多项式计算,提出 BaseConv 作为抽象代理,并证明它能在多项式参数和近似多项式层数内模拟低深度算术电路。进一步结果表明:在高压缩表示下,BaseConv 无法用常数层精确解决 MQAR,需依赖序列长度增长的深度下界;而在 recurrent 记忆受限设置下,也可借助 index 问题给出 Ω(N) 级状态下界。文章最后用实验验证这些理论趋势,但结论主要适用于回忆型任务与特定编码假设,不直接等同于整体困惑度或通用生成能力。

收录理由充分:正文同时给出了任务定义、统一建模框架、上界/下界证明思路和实验验证,不是泛泛讨论高效模型。适合研究 LM 架构、长上下文记忆与理论计算复杂度的读者参考;但结论对编码方式和 MQAR 这类回忆任务依赖较强,外推到通用语言建模时需谨慎。

科研议题Stanford Hazy Research

Zoology (Blogpost 1): Measuring and Improving Recall in Efficient Language Models

这篇文章围绕高效语言模型的“召回能力”展开,比较了 Hyena、H3、RWKV 等门控卷积架构与 Transformer 在真实语言建模中的差距。作者在 17 个从 70M 到 1.4B 参数规模的模型上做统一训练与评测,发现总体困惑度差距中有超过 82% 来自需要联想式回忆的 token 子集,而不是一般语料位置。为解释这一现象,文章提出 MQAR 这类合成任务,证明门控卷积要随着序列长度增加模型维度才可维持召回能力,而注意力则不需要这种扩展。理论部分用多项式/电路复杂度视角说明了这一尺度差异,并给出可通过输入依赖的选择式稀疏注意力缩小差距的方向。文章的边界也很明确:结论主要针对特定高效架构与召回类能力,且合成任务虽能解释现象,但仍是对真实语言分布的近似。

文章直接给出多模型实证、AR 切片分析和 MQAR 理论解释,证据链完整,不是泛泛而谈的架构点评。适合做高效语言模型、注意力替代方案和长序列召回问题的长期参考,也能迁移到新架构评测与合成基准设计中。

科研议题Stanford Hazy Research

Hyena Hierarchy: Towards Larger Convolutional Language Models

这篇文章介绍了 Stanford Hazy Research 提出的 Hyena 层,用长卷积与逐元素门控替代标准注意力,以在保持语言建模质量的同时把时间复杂度从二次降到次二次。作者先从注意力的“数据控制”特性出发,指出早期无注意力替代方案在困惑度和 in-context learning 上存在明显差距,因此设计了一组合成字符串任务来寻找结构缺口,并据此迭代滤波器参数化和输入投影。实验显示,Hyena 在较短序列上可与 FlashAttention 竞争,在长上下文下显著更快,并在 The Pile、PG-19、SuperGLUE 等任务上缩小了与 Transformer 的差距。文章还给出在视觉任务中的初步结果,表明这种基于信号处理的设计可能具有跨模态迁移性。其边界也很明确:当前优势主要体现在长序列和特定参数规模,且仍依赖精心设计的合成基准与参数化选择,离全面替代注意力还有距离。

推荐收录,因为文章直接给出了 Hyena 的核心机制、合成任务驱动的设计方法,以及与 FlashAttention、Transformer 的速度和困惑度对比证据。适合关注长上下文建模、注意力替代结构和高效序列模型的研究者参考;同时也提示了其对参数化与任务选择较敏感的风险。

科研议题Stanford Hazy Research

Simplifying S4

这篇文章以“简化 S4”为目标,从经典线性时不变系统和状态空间方程出发,逐步把连续时间 ODE 转写为积分形式,再用离散采样和矩形求积导出可实现的卷积/递推计算。作者强调 S4 的核心并不神秘,而是把电路与控制理论中的老问题重新用于深度学习:既要稳定,又要高效,还要具备足够表达能力。文中重点解释了为何应让特征值位于左半平面、为何可用复共轭对把矩阵近似为对角形式,以及如何把隐藏状态消去,只预计算长度相关的 kernel 来提升批量训练效率。最后还讨论了初始化如何覆盖多尺度记忆,并补充了零阶保持下的更精确离散化。整体上这是面向 S4/S4D 的机制拆解与实现导向说明,但对更一般非对角 SSM 和严格数值分析仍较简化。

收录依据很明确:文章给出了 S4 从连续系统到离散卷积、从稳定性约束到高效实现的完整推导,而不是泛泛介绍模型。适合研究序列建模、长程依赖或状态空间模型的读者参考;需要注意其结论建立在教程式简化假设上。

科研议题Stanford Hazy Research

Structured State Spaces: A Brief Survey of Related Models

这篇文章是 Stanford Hazy Research 对连续时间序列建模相关路线的综述,重点比较了递归、卷积和连续时间/微分方程三类范式。作者分别从归纳偏置、训练并行性、在线推理成本、上下文长度和对不规则采样数据的适应能力等维度,解释了各自的优势与短板。文章进一步梳理了这些范式之间的联系,包括 RNN 与连续时间系统的对应、卷积与线性递归的等价展开,以及 CT 模型与离散输入处理的若干代表工作。它也指出,长程记忆仍是核心瓶颈,尤其在真实长序列场景中,许多方法在 1000 到数千步后就面临稳定性和效率限制。整体上,这是一篇为后续 S4 模型铺垫背景、帮助读者建立方法谱系与边界认识的综述,但不提供新的实验结果或系统实现细节。

文章直接给出了递归、卷积与连续时间模型的对比、联系和局限,是理解 S4 及长序列建模脉络的可靠背景材料。适合研究连续时间序列、状态空间模型或序列模型的读者,用于建立方法地图和判断各路线适用边界。

科研议题Stanford Hazy Research

Structured State Spaces: Combining Continuous-Time, Recurrent, and Convolutional Models

这篇文章系统介绍了结构化状态空间模型(SSM)如何把连续时间、递归计算和卷积三种序列表达统一起来。作者从线性常微分方程出发,给出连续时间形式,并通过离散化得到递推公式,再将递推展开为卷积核,说明三种表示在数学上是等价的。文章重点解释了 S4 采用的双线性变换离散化、步长 Δ 的作用,以及为什么它既能支持并行训练,也能在生成时切换为递归模式。文中还讨论了连续时间建模对采样率变化、缺失数据和不规则时间序列的优势,以及在文本等非连续数据上的局限。最后,作者比较了 SSM 与 RNN、CNN 的关系,并指出其高效实现仍受状态维度和工程优化约束。

推荐收录:正文明确给出了 SSM 的连续/递归/卷积三种等价表示、双线性离散化公式及其适用边界,属于可长期参考的研究解读。适合做序列建模、控制启发式深度学习和 S4 相关工作的入门与复习资料,但读者需注意它主要分析线性 SSM,离实际高效实现还有工程与结构化矩阵等前提。

科研议题Stanford Hazy Research

HiPPO: Recurrent Memory with Optimal Polynomial Projections

这篇文章提出 HiPPO 框架,用连续时间的在线函数逼近来形式化“如何为序列维护记忆”这一问题。作者先定义衡量过去信息的重要性,再用正交多项式投影把历史压缩为固定维度系数,并推导出可闭式计算的线性微分方程与离散递推。基于这一框架,HiPPO 可自然嵌入 RNN,并解释 LSTM、GRU、LMU 等模型与门控/低阶近似之间的关系。实验上,它在百万步在线重建和 Permuted MNIST 上表现突出,HiPPO-LegS 还给出梯度衰减更慢、对时间尺度变化更鲁棒的理论性质。其边界在于结论依赖特定测度与多项式基,且部分效率与泛化优势仍需在更广泛任务上验证。

收录价值明确:文章不仅解释了长序列记忆问题的数学化定义,还给出可计算的 ODE/递推形式,并把 LSTM、GRU、LMU 放进同一理论框架。适合研究序列建模、记忆机制和时序模型的读者,尤其能迁移到状态空间模型、长程依赖与时间尺度鲁棒性分析中。

科研议题Stanford Hazy Research

Ivy: Instrumental Variable Synthesis for Causal Inference

这篇文章围绕因果推断中的工具变量(IV)问题,讨论在真实数据里难以找到“完美 IV”时,如何从一组不完美、甚至彼此相关且部分无效的候选变量中合成更高质量的 IV。作者提出 Ivy 框架,将目标 IV 视为潜在变量,先借助图模型与鲁棒主成分分析学习候选 IV 的依赖结构和有效性,再基于已识别的有效 IV 估计潜变量并生成新的合成 IV,最后将其输入 Wald 等现有 IV 估计器完成因果效应估计。文章给出理论分析,讨论了可成功合成的条件、样本复杂度以及无效 IV 或遗漏依赖带来的模型失配。实验部分在孟德尔随机化场景下使用 UK Biobank 的 HDL、CRP 和维生素 D 等例子,显示 Ivy 在消除伪相关上通常比简单的加权/无权 allele score 更稳健,但也明确指出当所有候选 IV 都无效时方法仍会失效。

文中直接给出了 Ivy 的建模假设、两阶段合成流程、理论边界和真实数据验证,不是泛泛科普,而是可复用的研究方法总结。适合做因果推断、孟德尔随机化或弱监督/潜变量结构学习的读者参考,但也要注意它依赖“存在有效 IV 子集”等前提。

科研议题Stanford Hazy Research

Automating the Art of Data Augmentation

这篇文章回顾了数据增强的理论研究,重点解释“增强为何有效”而不只是“怎么做”。作者先介绍 Dao 等人关于核方法的分析:把数据增强建模为带随机变换的马尔可夫链后,增强等价于对变换后的特征映射做平均,从而提升不变性,并在二阶近似下带来类似方差正则化的效果。随后文章总结 Wu 等人在过参数线性回归中的结果,区分标签不变变换、mixup 以及多种变换组合,说明它们可能补充新信息、缩小预测波动,或产生正负不一的复合效应。基于这些理论,作者提出按不确定性进行随机采样的增强策略,在 CIFAR 和 ImageNet 上优于 RandAugment,并接近 Adversarial AutoAugment,同时训练成本更低。文章的边界也很明确:理论主要建立在简化模型上,对复杂视觉任务中的具体变换效果仍不能完全泛化。

收录价值在于它不只讲经验技巧,而是给出数据增强的理论解释、简化模型下的机制分析,以及由理论反推实践策略的完整链条。适合做机器学习研究、自动增强方法设计和理论入门参考;需要注意的是结论主要来自核方法与过参数线性模型,迁移到复杂深网时仍需实验验证。