Experiment

105 篇内容

科研议题Google DeepMind Blog

WeatherNext: AI model achieves breakthrough in forecasting cyclones

本文介绍了 Google DeepMind 的 WeatherNext AI 模型在气旋预测上的突破。该模型通过联合训练全球大气数据和历史气旋观测数据,结合功能性生成网络(FGNs),实现了对气旋路径、强度和风结构的高精度预测,平均可获得额外一天的预警时间,相当于十年气象进步。模型仅需 28km 分辨率输入,在 TPU 上不到一分钟即可生成 15 天集合预报,并在 2025 年飓风季成功用于预测飓风 Melissa 的快速增强和登陆,同时开源了代码和权重。文章还讨论了分辨率与精度关系的开放问题,以及模型在极端天气早期预警和气候适应中的潜在价值。

文章以 Nature 论文为基础,详述了 AI 模型架构、多模态训练和集合预测方法,展示了机器学习在复杂物理系统预测中的前沿应用,并提供开源实现,适合 AI for Science 和气象预报领域的研究者与工程师参考。其跨学科方法、工程验证和开放生态对推动 AI 在环境领域落地具有长期可迁移价值。

工程实践Grab Tech

Crowdsourced taxonomy verification: A feedback-driven framework for refining knowledge graph relationships via online search interactions

文章提出了一种基于用户反馈的知识图谱关系验证框架,用于在快速变化的领域(如外卖菜单)中检测和消除自动化构建所产生的错误关系。核心方法是将图谱边分为已验证和候选两类,通过搜索界面以探索与利用策略注入候选边,并采集点击、购买等加权交互信号,计算置信度分数来自动推广或剪枝边。该闭环系统无需人工干预,利用众包隐式反馈大规模纠正AI幻觉,并在食品配送场景中验证了其有效性。适用边界包括依赖充足用户流量的动态目录搜索,且需要精细控制注入以避免影响体验。

收录理由:文章详细描述了一个将搜索界面作为验证环境的工程方案,包含假设生成、候选注入、信号聚合和图更新等完整模块设计,并通过加权交互信号和置信度阈值实现自动图结构演化。对负责搜索系统、知识图谱构建或数据工程团队具有直接参考价值,其探索-利用设计和无人工干预的规模化验证思路具备可迁移性。

技术文章Fzakaria Blog

The mean means nothing

文章以一次误导性的平均延迟指标为切入点,系统介绍了如何通过多种可视化手段正确理解性能分布数据。作者使用一个合成数据集模拟 Web 服务缓存上线场景,展示平均值、中位数、百分位数给出矛盾结论的原因,并依次通过密度图、累计分布函数(CDF)、位移函数、山脊图、热力图和联合图揭示数据呈双峰分布的实质:缓存命中导致低延迟,缓存未命中的大请求造成长尾。文章重点强调 CDF 能同时展示所有分位数的变化,尤其当两条 CDF 曲线交叉时,单一统计量无法概括整体效果。文中所有图表附有可复现的 Nix 脚本,便于读者在自己的数据上实践。该文既是一堂生动的可视化教学,也是工程师避免数据误读的实用指南。

这篇博文通过清晰的可视化对比,有力地揭示了仅依赖平均值或单一百分位数做技术决策的陷阱,并提供了可直接复现的分析方法。其核心方法(尤其是 CDF 对比和位移函数)可迁移到任何涉及分布变化分析的场景,如性能优化、A/B 测试或系统监控。适合所有需要从数据中提取可靠结论的后端工程师、SRE 和数据分析师,是一份长期值得参考的实践指南。

技术文章Daniel Lemire

Memory-level parallelism: AMD is the king

文章通过 pointer chase 基准测试,系统测量了 Intel、AMD 和 Graviton 处理器的内存级并行度(MLP)演化。核心方法是构建 1 GiB 的随机循环数组,同时运行多条独立的指针追逐路径(lanes),通过观测吞吐量饱和点确定单核可维持的最大并发内存请求数。结果显示,AMD Zen 5(Turin)达到 58 条并发缓存行请求和 24.5 GiB/s/s 随机访问带宽,约为 Intel Granite Rapids 的两倍;Intel 十年间从 10 增长至 30,主要提升在最近两代;Graviton 5 延迟显著改善,但 MLP 停滞在 19。测试在 AWS 云实例上进行,数据与脚本公开。该研究为理解处理器内存子系统的实际能力提供了可重复的实验框架和跨代对比。

推荐收录。文章不是泛泛的性能宣传,而是给出了可复现的指针追逐实验设计、完整的跨平台数据及演化趋势分析,直接揭示了 MLP 这一隐藏关键参数对软件性能的实质影响。对从事性能调优、系统选型或体系结构研究的读者极具参考价值,其测量方法和结论可迁移至各类内存敏感型工作负载的优化中。

科研议题Simon Willison

Are AI labs pelicanmaxxing?

文章针对社区中“AI实验室是否刻意训练模型画出更好的鹈鹕骑自行车图像”的玩梗猜想,进行了一次系统性的实证检验。作者选取8种动物与6种交通工具交叉组合成48条提示词,对GPT‑5.6 Terra、Claude Sonnet 5等7个主流多模态模型各重复生成3次图像,再用GPT‑5.6 Luna等模型评估结果。通过对比分析,发现没有实验室在鹈鹕、自行车或其组合上表现出显著偏好;鹈鹕不比其他动物画得更好,自行车也不比其他交通工具更突出,组合效果也未超出单变量叠加预期。该研究虽然起源于一个非正式基准,但实验设计严谨,使用了控制变量和统计检验,结论明确。其主要局限在于参与模型均为特定版本、样本量有限,且依赖另一个AI模型进行质量评估,可能引入偏见。这一工作为生成式AI系统行为评估和基准设计提供了可参考的方法论。

本文通过精心设计的对照实验和统计分析,系统性地检验并否定了“AI专宠鹈鹕”的猜测,展现了基准测试中控制变量和消除观测偏见的正确方法。适合AI研究者和工程师学习如何设计评测任务、避免先入为主的印象,并理解评估框架本身的局限性。其可迁移价值在于方法论层面,而非结论本身,可用于图像生成、多模态理解等多种场景下的模型行为分析。

工程实践知乎 - PENG Bo

分享RWKV-7迄今的训练记录,从1B到13B

文章记录了RWKV-7系列六个dense模型(0.1B到13B)的训练过程,展示了所有模型的Loss曲线,强调训练稳定无spike,且曲线中的阶梯变化均源于有原因的操作。作者指出数据量从3T tokens增长到21T tokens,依赖开源数据、蒸馏和合成。训练由单人完成,体现了“One Person Train”模式。文中对比了不同规模模型的训练方法:1B和3B采用常规策略,而7B和13B采用了更高效的方法,收敛速度和数据效率显著更高,当前在各基准上已表现出竞争力。作者还认为数据效率仍有优化空间,提出即使现有架构,若使用最优策略,训练几T tokens即可达到充分效果,并展望了AI自动化训练的未来。文章以实际工程经验为主,提供了大模型训练中数据工程、训练策略选择和效率优化的直观案例。

文章提供了大规模语言模型训练的第一手工程记录,包含训练稳定性、数据规模扩展、不同训练策略的收敛效率对比,以及单人训练模式的可行性验证,对从事大模型训练的工程师和独立研究者具有直接参考价值。读者可从中获得关于训练效率优化、低成本训练路径和训练过程管理的启发,适合关注AI基础设施和训练实践的开发者。虽然细节有限,但经验和观点可迁移至类似项目。

技术文章NVIDIA Technical Blog

Lessons From the Leaderboard: What 5,000+ Kagglers Taught Us About Improving AI Reasoning

本文总结了一场超5000人参与的Kaggle竞赛核心经验,该竞赛旨在固定开放模型、基准和基础设施下提升推理准确性。文章梳理了排行榜前列方案,重点介绍提示工程、微调策略、集成方法等关键技术,并分析了它们对推理表现的一致性提升效果。文中还讨论了数据质量、模型特定调优以及测试时计算的作用,揭示了典型陷阱和权衡。这些发现基于NVIDIA Nemotron模型和特定评估指标,具有实验支撑,可迁移至其他语言模型的推理优化场景,但需注意模型和任务的边界。

文章基于超过5000名参赛者的大规模受控实验,提炼出提升AI推理的实用方法和数据驱动的洞见,为研究人员和工程师提供了难得的集体智慧。它详细说明了提示工程、微调和集成等技术的实际效果与局限,对语言模型推理调优有直接参考价值。由于结论源自真实竞赛和统一基准,其可迁移性较强,适合作为AI推理方向的长期技术参考。

科研议题OpenAI Research

Separating signal from noise in coding evaluations

这篇文章围绕“如何从代码评测中分离有效信号与噪声”展开,作者对 SWE-bench Pro 做了一次系统审计,判断该基准是否真实反映模型的软件工程能力。文章提出了一条质量审查流水线:先用自动化数据点分析筛出可疑任务,再通过 Codex 驱动的 investigator agents 深查仓库、测试与失败轨迹,并结合 5 名资深工程师的人审交叉验证。审计结果显示,约 27.4% 至 34.1% 的任务存在破损问题,主要包括测试过严、提示词欠定义、测试覆盖不足和误导性提示四类。作者据此认为,SWE-bench Pro 仍会在相当比例上误导模型能力判断,并撤回先前“推荐迁移到该基准”的建议。文章的边界也很明确:结论针对特定代码基准及其构造方式,不等同于否定所有 agentic coding 评测,而是强调评测任务必须可验证、可复现且与提示一致。

推荐收录,因为文章给出了可复用的基准审计方法、具体破损类型统计和人工/Agent 结合的验证流程,直接指向评测可信度问题。适合做模型评测、基准设计和 AI 研究复核的参考,尤其对需要判断 benchmark 是否“可用”的团队有现实价值。

工程实践Simon Willison

Using DSPy to evaluate and improve Datasette Agent's SQL system prompts

文章记录作者借助 DSPy 改进 Datasette Agent 的 SQL 系统提示词:先在 Claude Code 中发起异步研究任务,安装 Datasette alpha、datasette-agent 和 dspy,再让模型自动寻找可评测的优化方向。作者用 GPT-4.1 mini 和 nano 进行对照测试,比较基线提示词与修改版在只读 SQL 问答任务中的表现。实验暴露出一个关键问题:schema 只列出表名,却要求“若已知信息就不要调用 describe_table”,这会诱发模型猜列名并陷入报错重试。基于这些迹象,作者建议在提示词中直接提供列名,或放宽该约束,以降低幻觉和工具调用循环。文章的价值在于展示了用评测驱动提示词迭代的具体流程,但结论主要适用于 Datasette 这类受限的 SQL agent 场景。

收录,因为文中给出了可复现的评测流程、明确的失败样例和针对性修改建议,不是泛泛谈 prompt 调参。适合做 LLM SQL agent、工具调用和提示词迭代的参考,但迁移到其他模型或数据集时仍需重新验证。

工程实践Instacart Tech Blog

Variance Reduction Below the Randomization Grain

文章讨论在市场型系统中做实验时,因干预单位之间存在相互影响,往往必须按地理区域或 switchback 这类粗粒度随机化,导致有效样本量下降、实验周期拉长。作者在 CUPED 的基础上提出“低于随机化粒度”的方差缩减方法:先用仅由处理前特征构成的订单级模型预测单笔订单结果,再按与指标一致的方式聚合到 region-day,作为 CUPED 协变量使用。文章强调必须避免使用受处理影响的特征,并用对预测值做 placebo 检验来发现特征污染。Instacart 在 10 个降低迟到率的实验中验证,该方法相较区域级 CUPED 将方差再降 18% 到 40%,平均把实验时长缩短约三分之一。该思路适用于社交网络、广告拍卖或地理市场等存在干扰但观测粒度更细的场景,但前提是协变量可严格视为处理前信息。

推荐收录,因为文章给出了可复用的实验设计证据:在粗粒度随机化下,利用更细粒度的处理前预测并聚合,可显著降低方差且保持无偏。适合做实验平台、数据科学和 marketplace 优化的读者参考,但需注意特征污染与 placebo 检验这两个关键风险。

科研议题美团技术团队

LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆

文章介绍美团 LongCat 团队开源的 VitaBench 2.0,一个面向真实生活场景、长期动态用户建模的智能体评测基准。它以56名拟真用户、819个复杂任务、2000多个动态偏好和平均1580天的时间线为核心,评测大模型在个性化决策、主动沟通和持续记忆更新上的能力。文中还统一对比了长上下文、Agentic Memory 与 RAG Memory 两类记忆策略,结果显示随着时间拉长,模型性能普遍下降,记忆模块并非“装上即好”。实验也指出,开启思考模式并不总能提升个性化任务表现,而当前瓶颈正从工具使用转向偏好理解与应用。整体来看,这是一套用于研究长期陪伴型助手的评测方法,而非直接解决方案,其结论更适合指导智能体记忆、主动性和个性化能力的后续设计。

收录理由很明确:文章不仅给出开源基准,还提供了用户轨迹、任务规模、时间跨度和记忆策略对比等可验证证据,能够支撑长期智能体研究。适合做 Agent 评测、记忆系统和个性化助手设计的读者参考,也便于迁移到其他长期交互场景。

科研议题Microsoft Research Blog

SkillOpt: Agent skills as trainable parameters

文章介绍了微软研究院提出的 SkillOpt:把智能体的技能文件当作“可训练参数”,在冻结目标模型权重不变的前提下,用另一个优化器模型对自然语言技能进行迭代优化。其流程包括轨迹采集、反思归纳、受限的增删改编辑、严格验证门控,以及利用被拒绝编辑作为负反馈的慢速/元更新,从而避免技能在反复改写中失控漂移。作者在 6 个基准、7 种目标模型和 3 种执行模式上评测,52 个评测格里均达到最佳或并列最佳,说明这种方法比手写提示、一轮生成和若干现有文本优化方法更稳定。实验还显示,优化后的技能文件具有可迁移性,能够跨模型规模、跨 agent harness、甚至跨相近任务继续带来收益。文章的边界也很明确:它依赖可验证的评估信号或自动验证器,适合有明确任务目标、可做离线评测的 agent 工作流,不适合缺少可靠验证的开放式场景。

推荐收录,因为文章给出了可复现的研究框架、完整的优化机制和跨 52 个评测格的结果证据,而不是停留在概念宣传。适合做 agent 研究、提示/技能优化和自动化评测设计的读者参考;其可迁移价值在于“训练文本技能而非改权重”的方法论,但前提是任务必须有稳定验证信号。

科研议题OpenAI Research

Introducing GeneBench-Pro

文章介绍了 GeneBench-Pro,一个面向计算生物学研究级判断能力的基准,目标不是考察模型是否记得生物学知识,而是能否在含糊、噪声和多轮修正的分析过程中做出正确决策。它在 GeneBench 基础上扩展到 129 道题,覆盖统计遗传、群体遗传、定量遗传、组学、临床与癌症等 10 个领域、21 个子领域,强调“research taste”这类高阶分析判断。为避免传统长链生物学基准中主观路径过多或数值过于宽松的问题,作者采用合成数据、已知因果结构、消融验证、泄漏审计,并邀请外部专家评审现实性和方法适切性。结果显示,最强模型 GPT-5.6 Sol 在最高推理档仅约 28.7% 通过率,Pro 模式可到 31.5%,说明当前模型在闭环科研推理上仍明显不足,但测试时算力扩展带来显著收益。该基准的局限是强烈领域特定、依赖合成题和评分设定,外推到真实科研场景仍需谨慎。

推荐收录,因为文章明确给出了基准设计动机、构造方法、专家审核和量化结果,不是简单产品宣传。适合关注 AI for Science、科研评测和代理式分析能力的读者,尤其可借鉴其“合成因果数据+泄漏审计+专家复核”的评测思路。

工程实践Instacart Tech Blog

Leveraging PyFixest for High-Cardinality Marketplace Modeling at Instacart

文章面向 Instacart Marketplace 的实验建模,讨论在 geo:time switchback 和 static-geo 场景下,如何用高基数固定效应控制区域与时间异质性,并缓解 treatment spillover 带来的偏差。作者先从 OLS 正规方程和 Gram 矩阵求逆的复杂度解释,为什么在数千到数万类别时,传统哑变量回归会在时间和内存上失控。随后用 Frisch-Waugh-Lovell 定理说明可通过去均值消去固定效应,再用交替投影法处理多重固定效应的反复污染与收敛问题。文章指出 fixest/pyfixest 通过这些算法在保持系数估计一致性的同时显著降低计算成本,但会少掉固定效应的直接标准误输出,部分估计还依赖后处理。基准测试和真实案例显示,PyFixest 在速度、内存和统计精度上明显优于 statsmodels 与朴素 scikit-learn 实现,适合大规模实验分析。

推荐收录,因为文章明确给出了高基数固定效应为何难算、以及如何用 FWL+MAP 在工程上解决的直接证据,并结合 benchmark 和线上实验结果验证收益。适合做增长实验、因果推断和高维回归的读者参考,但结论仍受固定效应结构和实现后端影响。

工程实践Netflix TechBlog

GenPage: Towards End-to-End Generative Homepage Construction at Netflix

文章介绍 Netflix 将首页推荐重构为端到端生成式系统 GenPage:把用户历史、画像和请求上下文序列化为提示词,再由单个 decoder-only Transformer 自回归生成整页首页,包括行、实体和布局。训练上沿用 LLM 方案,先做 next-token 预训练学习“首页语言”,再用加权二分类或强化学习做后训练,以对齐用户满意度和页面级奖励。工程上作者重点解决了实时延迟、冷启动、目录更新、业务规则约束和增量训练等问题,采用领域定制分词、语义 embedding 融合、fallback token、约束解码与混合行解码来兼顾可控性与效率。离线实验显示,丰富上下文往往比单纯扩大模型更有效,RL 还能提升页面多样性;在线 A/B 中,GenPage 在核心参与度指标上显著优于成熟多阶段基线,同时将端到端延迟降低约 20%。文章也指出当前仍依赖部分手工摘要,长上下文与更通用的语言/多模态能力仍是后续方向。

推荐收录,因为它给出了把推荐系统改造成生成式 Transformer 的完整工程链路:数据表示、训练范式、RL 对齐、业务规则约束与线上验证都有直接证据。适合做个性化推荐、AI 工程化和大模型落地的读者参考,尤其可迁移的是“先丰富上下文再扩模型”“用约束解码保业务规则”“用混合解码降延迟”的方法。

科研议题知乎 - 微软亚洲研究院

GenAC:让价值模型重新“思考”的生成式Critic

这篇文章介绍微软亚洲研究院与北京大学提出的 GenAC:一种生成式 Critic,用来改进大语言模型强化学习中的信用分配问题。作者认为传统判别式价值模型之所以不稳定,根源在于其前向推理表达力受限,难以拟合需要顺序推理的价值函数,因此单纯堆参数并不能根治。GenAC 改为先生成思维链再估计价值,并通过上下文注入当前策略规模和成功率,使 Critic 感知“在评估谁”。训练上采用 SFT 热身加 RL 校正的两阶段预训练,随后在数学推理任务上用于 PPO 训练。实验显示 GenAC 在平均准确率、相对排名、分布外泛化和错误定位上都优于判别式 Critic 及 GRPO、RLOO 等无价值方法,但文章结论主要建立在特定推理任务与实验设定下。

文中给出了明确的理论动机、训练方案和对比实验,直接展示生成式 Critic 如何改善 LLM 强化学习中的信用分配。适合研究 LLM 后训练、RLHF/RL 推理和价值建模的读者参考,但其结论仍受具体任务与实验设置限制。

工程实践Dropbox Tech

How we used DSPy to turn AI evaluations into better responses in Dash chat

文章介绍 Dropbox 如何把 Dash chat 的 AI 评估体系变成可直接驱动改进的反馈回路。团队先用人类标注样本和结构化 rubric,按意图跟随、语义相关性、工具调用、上下文选择与指令遵循等维度校准 LLM judge,再用 DSPy 及 GEPA、MIPROv2 自动优化 judge 提示词。随后,他们将这些更可靠的 judge 用于离线回放历史对话,反复搜索更好的系统 prompt,并把评估分数、失败码和解释性备注作为优化信号。结果显示,不完整回答减少 26%,遗漏关键点减少 13%,token 用量下降 5.4%,但文章也强调前提是高质量标注、代表性回放数据和严格的上线护栏,否则自动优化容易产生脆弱改进。

收录价值明确:文章给出了“人类标注校准 judge → 生产回放评估 → DSPy 自动优化 prompt”的完整闭环,并提供了量化结果。适合做 AI 工程、评估体系和 prompt 优化的实践参考,但前提是评估信号足够可靠、回放样本足够代表真实流量。

科研议题Microsoft Research Blog

Understanding the brain with AI-driven explanations and experiments

文章介绍微软研究院与多校合作发表于《Nature Neuroscience》的生成式因果测试(GCT)框架,目标是把能预测语言引发脑活动的黑箱模型,转化为可读、可检验的科学假设。方法分两步:先从脑区预测模型中提取最强驱动词组,再由LLM概括成简短解释;随后让LLM生成专门“驱动”目标脑区的新故事,在fMRI中验证该脑区是否显著激活。实验表明,GCT不仅能复现已知选择性,还能区分长期被混为一谈的邻近地点加工区域,并发现对对话、时间和测量等概念敏感的前额叶微区域。其价值在于把预测模型的相关性结果闭环为因果验证,但结论仍依赖于模型稳定性和少量受试者,主要适用于语言神经科学这类可闭环实验的场景。

文中明确给出 Nature Neuroscience 论文、GCT 两步流程和 fMRI 验证结果,是把黑箱模型转成可检验理论的具体案例。适合关注 AI 可解释性、计算神经科学和“生成-验证”研究范式的读者参考,但方法目前仍受限于模型稳定性与小样本实验。

科研议题美团技术团队

LongCat-Flash-Prover:AI 攻克数学定理证明,不仅要“算得对”,更要“证得严”

文章介绍了美团开源的定理证明模型 LongCat-Flash-Prover,核心目标是让模型从“能给出答案”走向“能生成可由 Lean4 严格验证的证明”。作者将形式化推理拆成自动形式化、草稿生成和证明生成三类原子能力,并结合工具集成推理、混合专家迭代、课程学习式轨迹合成与 RL 训练,构建出一套面向形式化数学的训练与验证框架。文章同时给出 MiniF2F-Test、ProofNet、MathOlympiad-Bench、PutnamBench 等基准结果,并讨论了模型在证明中可能出现的“作弊”行为及其规避方法。

推荐收录,因为它不只是发布一个模型,而是系统讲清了形式化定理证明的任务拆解、数据合成、工具反馈、训练稳定性和评测边界,具有很强的方法论价值。对做大模型推理、自动证明、形式化验证或工具增强学习的读者,都能直接借鉴其中的框架设计与风险控制思路。

科研议题美团技术团队

美团 LongCat 开源 General 365:树立推理评测新标尺

这篇文章介绍了美团 LongCat 团队开源的通用推理评测基准 General 365,核心目标是把大模型评测从数学、编程等“学科推理”扩展到更贴近日常场景的“通用推理”。文章详细说明了基准的设计思路:将知识范围限定在 K-12 水平,通过八大推理维度、原创种子题扩展、人工质检与混合评分机制,尽量剥离专业知识干扰,衡量模型真实的逻辑推演能力。 同时,文章给出了对 26 款主流模型的实测结果与跨基准对比,指出当前 SOTA 模型在通用推理上仍存在明显短板,尤其容易在语义干扰、最优策略和多步规划上失分,而且更高难度并不只是拉长输出,而是显著增加了推理链条复杂度。它的价值不仅在于提出一个新基准,也在于为理解“大模型会不会真正思考”提供了更可操作的测量框架和边界条件。

推荐收录,因为它不是简单的产品宣传,而是围绕一个可复用的研究基准,系统说明了问题定义、数据构造、评分方法和实验结论。对做大模型评测、推理能力分析或 benchmark 设计的读者来说,文章提供了很强的迁移价值。

科研议题美团技术团队

从月球漫步到赛博都市,WBench 测出了世界模型的边界

这篇文章介绍了美团 LongCat 团队提出的 WBench,一个面向交互式视频世界模型的系统性多轮评测基准。文章不仅说明了基准的设计原则——世界定义、指令集、统一交互接口和评测套件——还给出了 289 个测试案例、1058 轮交互、四类交互任务,以及用于衡量视频质量、设定遵循度、交互遵循度、一致性和物理真实性的指标体系。文中进一步总结了对 20 个前沿模型的评测结论:没有全能模型,导航能力与画质几乎脱钩,多轮交互会显著退化,且开源模型在部分能力上已具备竞争力。

推荐收录,因为它不是简单的模型榜单,而是围绕“交互式世界模型如何评测”提出了可复用的基准设计与验证方法。对于做生成式视频、世界模型、具身智能或多模态评测的读者,这篇文章能直接提供指标设计、任务拆解和多轮闭环评估的参考框架。

科研议题Microsoft Research Blog

Talos: Scaling rare disease diagnosis with automated, iterative genomic reanalysis

这篇文章介绍了微软研究院与多方合作开发的 Talos:一个用于罕见病基因数据自动、迭代式重分析的开源工具。它通过持续对已有测序结果重新对照最新的公共知识库(如 PanelApp Australia 和 ClinVar),优先筛出最可能满足临床报告标准、且“新增证据发生变化”的候选变异,从而把原本依赖人工、低频率的复分析流程变成可持续运行的常规程序。文章给出了较完整的验证结果:在约 1,089 名已人工分析样本上,Talos 在每例只返回约 1.3 个候选变异的前提下恢复了约 87%–90% 的适用诊断;在 4,735 名长期未确诊患者的前瞻性队列中,又带来了 241 例新增诊断(5.1% 额外收益),并把新科学证据出现到完成诊断的平均时间压缩到 32 天左右。文章的核心结论是:在罕见病场景中,真正的瓶颈往往不是算法召回,而是专家复核成本,因此“高特异性、可持续迭代”的设计比单纯输出长排序列表更有工程和临床价值。

推荐收录,因为它不仅讲述了一个研究成果,还清楚呈现了问题定义、系统设计、评估指标和现实约束之间的取舍。对于关注医疗 AI、科研工程化或大规模自动化复分析的人来说,这篇文章提供了可迁移的方法:如何把持续更新的外部知识源纳入流水线、如何在召回与人工审核成本之间设定目标、以及如何用真实队列验证系统价值。

工程实践知乎 - 阿里巴巴大淘宝技术

【干货长文】RAG 全链路技术详解

这篇文章系统梳理了 RAG 在 Agent 场景中的全链路工程实践,覆盖文档加载、智能切分、向量索引、检索优化、生成调优、Graph RAG 和自动化评测等关键环节。文章不仅解释了各环节的核心原理,还结合 Query 改写、HyDE、Doc2Query、重排序、Ragas 指标与测试集生成等方法,强调通过“可测、可调、可信赖”的闭环提升 RAG 的业务确定性与降低幻觉。适用边界也较清晰:它更偏向工程落地与系统方法论,而非单点算法创新。

推荐收录,因为它不是泛泛介绍 RAG 概念,而是把知识库构建、召回、生成和评测串成了完整的方法链,具有很强的工程参考价值。对于正在做 Agent、企业知识问答或检索增强系统的团队,这篇文章能直接迁移到方案设计、问题定位和效果评估中。

科研议题Netflix TechBlog

Toward More Controllable AI Video Editing: An Early Research Exploration at Netflix

这篇文章介绍了 Netflix 在“可控 AI 视频编辑”方向上的两项早期研究探索:Vera 和 VOID。Vera 通过分层视频扩散模型把“需要修改的内容”和“应保持不变的原视频区域”解耦,从而尽量保留源视频的身份、表演和背景细节;VOID 则面向视频目标删除,加入物理因果推理与两阶段推理流程,使被删除对象及其相关交互后果能够以更合理的方式被重建。文章还给出了自建数据集、模型架构、评测设计和用户研究结果,并明确讨论了当前在复杂特效、摄像机运动、视频长度与分辨率上的局限。

推荐收录,因为它不是单纯的产品宣传,而是围绕一个清晰研究问题给出了方法、数据、评测和局限分析,具有较强的长期参考价值。对于关注生成式视频编辑、可控生成、视频理解与物理一致性的读者,这篇文章能提供可迁移的研究思路和实验框架。

工程实践Netflix TechBlog

The Data Canary: How Netflix Validates Catalog Metadata

文章介绍了 Netflix 为高频更新的 catalog metadata 构建“data canary”系统的工程实践,用真实生产流量验证数据变换后的最终输出是否会引入损坏。作者详细说明了为什么传统代码 canary 和影子流量不够用,以及如何通过独立 orchestrator、baseline/canary 双集群、混沌实验平台扩展、sticky canary 和实时中止机制,在 10 分钟内完成检测并阻断坏数据发布。文章还给出了主动注入故障的验证结果,说明该方案能在 2.5–4 分钟内识别回归,并把数据错误从“影响播放的事故”前移为“发布前拦截”。

推荐收录,因为它不是泛泛讲“数据质量重要”,而是给出了高频数据管道如何借助生产流量、行为指标和自动化闸门实现快速验证的完整方案。对于做数据平台、实时链路、SRE 或可靠性工程的读者,这篇文章在检测指标选择、实验窗口缩短、误伤控制和系统扩展性方面都有很强的迁移价值。

工程实践Netflix TechBlog

Predicting Risk in Content Launches: How Data-Driven Insights can Transform Launch Planning

这篇文章讲的是 Netflix 如何用生产数据预测内容上线前关键媒体资产的交付风险,从而辅助判断何时启动 launch preparation。作者先指出手工排期存在覆盖不足和误差偏大的问题,再用 Accumulated Error Days 量化排期不准与 launch miss 的相关性,并用基于 boosted tree regression 的日级快照特征模型预测 Locked Cut 和 IMF 的“剩余交付天数”。文章最后通过回测说明模型在 MAE、偏差、长尾误差和覆盖率上整体优于人工排期,但也强调在部分业务线里仍需要保留手工日期与模型日期并行、按场景选择的策略。

推荐收录,因为它不是泛泛讲“用机器学习预测日期”,而是完整展示了一个真实业务问题如何被建模、评估并嵌入现有工作流。对于做数据分析、预测建模、排期优化和业务决策支持的人来说,这篇文章对指标设计、回测方法和落地边界都很有迁移价值。

工程实践Netflix TechBlog

A Human-Augmenting Agentic Workflow for Causal Inference

这篇文章介绍了 Netflix 在观测因果推断(OCI)场景中引入软件 agent 的工作流:由人类提供问题背景、工具和数据模型,agent 负责生成分析计划、执行诊断、产出可审计工件,再由 critic 进行盲点检查与可信度判断。作者重点强调 target trial emulation、协变量平衡、overlap、placebo test 和敏感性分析等诊断的重要性,并用一个“新娱乐类型对留存影响”的案例说明,未经约束的 one-shot prompting 容易被 early adopter bias 误导,而加入 trimming 与过程审计后,估计会更保守但更可信。文章还给出了 ACIC 数据集上的评测结果和开源仓库,说明这种 scaffolded workflow 能显著优于直接提示模型的方式,但其有效性仍主要建立在特定的 unconfoundedness 假设和合成数据评估之上。

推荐收录,因为它不是泛泛讨论“让 AI 干活”,而是把 agent、诊断模板、人工审计和因果推断方法组合成了一套可复用的工程流程。对于做数据分析、实验评估、AI 辅助决策或需要在缺乏 ground truth 条件下做质量控制的团队,这篇文章提供了非常具体的设计范式和边界意识。

工程实践Netflix TechBlog

VMAF v1: Good Is Not Good Enough

这篇文章介绍了 Netflix 将 VMAF 升级到 v1 的动机、改动和验证结果,核心是在保持分数语义基本一致的前提下,修复 v0 在压缩伪影、色度伪影、带状渐变、不同观看距离和高帧率场景下的偏差。作者通过引入 AIM、CAMBI、色度特征、视距相关的感知建模、运动特征上限和时域窗口调整等方法,提高了与主观评价的一致性,同时还降低了计算复杂度并提升了性能。文章也明确指出了仍未完全解决的边界,例如 film grain、高帧率和 HDR 场景,体现出一个成熟指标从“可用”到“更可靠”的演进过程。

推荐收录,因为它不是简单宣布一个新版本,而是系统展示了一个生产级感知质量指标如何在真实约束下迭代:既要提升主观相关性,又要兼顾不同设备、观看距离和计算成本。对做视频编码、流媒体、质量评估或指标设计的读者来说,这篇文章提供了很强的可迁移方法论。

科研议题OpenAI Research

A near-autonomous AI chemist improves a challenging reaction in medicinal chemistry

这篇文章介绍了一个近乎自治的“AI 化学家”系统:将 GPT-5.4、专用化学代理 Maria AI 和高通量自动化实验室连接起来,围绕一个具体的药物化学难题——改进 Chan–Lam 偶联中伯磺酰胺底物的低产率——开展从文献检索、提出假设、设计实验、分析数据到迭代实验的完整研究流程。实验结果显示,系统提出的 TEMPO 添加剂假设在两轮共 10,080 次反应中带来了显著提升,平均收率从 16.6% 提高到 25.2%,并在人工台式验证中对 14 对代表性底物中的 11 对得到确认,但文章也明确说明这仍是“近自治”而非完全自治,且目前只证明了在特定反应、特定平台与特定约束下的有效性。

推荐收录,因为它不是简单展示“模型会做实验”,而是完整呈现了 AI 参与科学发现的工作流、验证链条和边界条件,具有很强的方法论参考价值。对于关注 AI for Science、自动化实验、以及研究系统如何在受控条件下产生可复现实验结果的读者,这篇文章提供了可迁移的框架与重要的风险意识。

科研议题OpenAI Research

Predicting model behavior before release by simulating deployment

这篇文章介绍了一种名为“Deployment Simulation”的新方法:在模型正式发布前,利用真实部署中的历史对话前缀,去重放并替换助手回复,从而模拟候选模型在未来真实流量中的行为。作者将其用于 GPT-5 系列 Thinking 模型的多次部署,评估了它对不良行为频率预测、未见过的新型失配发现、评估意识降低以及带工具的 agent 场景适配能力。文章还明确给出了方法局限:它更适合中高频风险而非极端长尾风险,效果高度依赖仿真 fidelity、前缀分布与工具环境模拟质量。

推荐收录,因为它提出了一个面向大模型上线前风险评估的具体研究方法,并用真实部署数据验证了其预测能力和边界条件。文章对做模型评测、对齐、安全审计和 AI 工程化的人都很有参考价值,尤其适合理解“如何在发布前更接近真实分布地评估模型”。

工程实践知乎 - 腾讯技术工程

微信测试团队斩获 CVPR 2026 NTIRE RAIM挑战赛冠军

文章复盘了微信测试团队在 CVPR 2026 NTIRE RAIM 挑战赛中的冠军方案,核心是面向成对高分辨率图像质量评估的可解释差异感知框架 iDiff。作者详细说明了赛题从“单一分数”转向“偏好判断 + 理由生成”的评价范式,并给出双分支架构、内容域专门化、多骨干集成、结构化推理监督、特征注入和答案感知微调等设计,以及相应消融结果。文章还把该方法放到视频号、编解码器 A/B 测试和创作工具选型等业务场景中讨论,明确了其适用边界是高分辨率、细粒度、需要可解释对比的质量评估任务。

推荐收录,因为它不是简单的竞赛喜报,而是围绕一个真实评测任务给出了完整的系统设计、实验验证和业务落地路径。对于做多模态评估、视觉质量分析或需要“判断+解释”双目标建模的读者,这篇文章有较强的迁移价值。

科研议题知乎 - 哔哩哔哩技术

B站 Index LLM 团队论文开源:170亿次真实用户交互背后的UGC视频评估新范式

文章介绍了哔哩哔哩 Index LLM 团队提出的 CASTER/MEDEA 方案,目标不是评估传统视频画质,而是让模型学习判断一条 UGC 视频能否获得社区共鸣。核心方法是用 Social-CoT 模拟多类观众视角,再通过 SFT 与 RL 将这种“社会认知推理”内化到模型中,并结合 CASTER-Bench 基准对比多种传统 VQA、通用大模型和推理增强模型。文中还给出数据规模、奖励设计和线上落地信息,说明该方法适用于“内容质量”这类强社区语境任务,但其边界也在于评估目标依赖特定社区偏好而非通用视觉质量。

推荐收录,因为它把“UGC 内容是否会被社区认可”这一抽象问题,拆解成可训练的社会认知推理框架、数据构建和基准评测,方法链条完整。对于做多模态理解、内容推荐、AI 评估和对齐训练的读者,这篇文章有很强的迁移价值。

科研议题知乎 - 微软亚洲研究院

AI 能考过计算机等级考试吗?

这篇文章介绍了微软亚洲研究院提出的 OfficeEval 基准:他们把国家计算机等级考试 NCRE 一、二级的 200 道 Word、Excel、PPT 实操题转成可机器评分的测试集,用 7,118 条细粒度评分点评估前沿大模型在办公自动化上的真实能力。结果显示,单轮生成模式下最强模型得分仅约 36.6%,即使引入可反复试错的编程智能体,最高也只有 68.8%,距离人类标准解答仍有明显差距。文章进一步指出,模型在 Excel 上相对更强,但在 PPT 动画、图形媒体和底层常量/API 映射上频繁出错,根源在于缺少视觉反馈、对底层表示理解不足以及迭代修复时容易回退。

推荐收录,因为它不是单纯的模型跑分新闻,而是把一个真实、标准化、可客观评分的办公考试转化为研究基准,并给出了清晰的误差分析。对做 LLM 评测、AI 工程化和办公自动化的人来说,这篇内容能直接提供基准设计、评估方法和能力边界判断。

工程实践Amazon Science

Bridging intent and execution in agentic systems

这篇文章讨论的是智能体系统中的“意图-执行鸿沟”:模型真正要做的事,和 harness 实际执行出来的事之间存在偏差,而这个偏差往往比模型本身的推理能力更能决定最终表现。作者结合论文与实测,给出了一套轻量级单智能体 harness 设计思路,包括更安全的编辑工具、更明确的 diff 反馈、对工具输出长度的处理、以及按不同模型家族调整 reasoning nudges 和工具接口。文章还强调 benchmark 分数会受到基础设施、超时、并发、网络和评测环境等因素显著影响,因此“benchmaxing”并不等于真实能力提升。

推荐收录,因为它不是泛泛讨论“怎么做 agent”,而是把智能体性能拆解为模型、工具、反馈与评测环境之间的系统问题,并给出可复用的工程原则。对于做 LLM agent、代码修复、工具调用和基准评测的人,这篇文章能直接帮助理解为什么同一模型在不同 harness 下表现会差很多。

科研议题Anthropic Frontier Red Team

Measuring LLMs' Impact on N-day Exploits

这篇 Anthropic Frontier Red Team 报告系统评估了前沿大模型对 N-day 漏洞利用链的加速能力,分别在 Firefox SpiderMonkey 和 Windows kernel 补丁上测试模型从补丁 diff 生成 PoC、再到完整 exploit 的成功率、稳定性与耗时。文章给出了明确的实验设置、评分标准与对照结果,结论是:在受控环境下,最强模型已经能在数小时内把公开补丁转化为可用利用链,显著压缩了传统依赖人工逆向的“补丁窗口”。同时,作者也强调这不等同于完整真实攻击链,目标发现、投递与规避检测仍未纳入。

推荐收录,因为它不是泛泛而谈“AI 会影响安全”,而是用可复现实验直接测量模型对 N-day exploit 开发链路的加速效果,证据强且结论清晰。对于安全研究、红队评估、漏洞响应和补丁节奏制定,都有很强的长期参考价值。

技术文章知乎 - 苏剑林

MoE环游记:8、强制序列级均衡

文章围绕 MoE 的序列级负载均衡问题,提出了从 QB 演化而来的 Moving Quantile Balancing(MQB)方案,目标是在不依赖 Aux Loss 的情况下实现更强的局部均衡。作者先回顾了全局均衡、局部均衡、测试时训练式更新和分位数最优解之间的关系,再通过分桶、EMA 和局部偏置项把分位数估计改造成可并行、可因果的路由机制。文末实验显示,MQB 能显著改善第一层 MoE 的不均衡,但过强的序列级约束会带来明显 loss 损失,因此更适合用于抑制极端不均衡,而不是无条件追求完美均衡。

推荐收录,因为文章不是单纯介绍 MoE 名词,而是沿着明确的问题定义、方法推导和实验验证,给出了一条可迁移的序列级均衡实现思路。它对做 MoE 路由、LLM 训练和负载均衡设计的读者都很有参考价值,尤其适合理解“局部均衡”和“全局均衡”的权衡边界。

科研议题知乎 - 微软亚洲研究院

开源上新 | 大模型是否还在"金鱼记忆"?全新基准 RHELM 测出“真实长期记忆”天花板

本文介绍了微软亚洲研究院等团队提出的长期记忆评测基准 RHELM,重点解决现有长期记忆测试“语义不连贯、信息源单一、题目过于老实”等问题。RHELM 通过构造为期一年的动态虚拟人生轨迹,把用户画像、对话、邮件、日志和报告等异质文本耦合起来,并用 7 大类、27 项挑战特征系统评测模型的事实记忆、时序记忆、跨源聚合和误导查询处理能力。文章还给出了对全上下文模型、RAG 和记忆框架的对比结果,指出当前系统在跨源混合推理、幻觉识别和现实情境约束上仍存在明显短板,同时也说明了基准在多模态覆盖与人群偏置方面的局限。

推荐收录,因为它不是单纯的产品宣传,而是围绕“长期记忆”这一重要研究问题,提出了新的评测范式、细粒度指标和明确的实验结论。对从事 LLM 评测、RAG、记忆增强系统和 AI Agent 设计的读者来说,文章具有很强的迁移价值和长期参考意义。

工程实践OpenAI Research

Dreaming: Better memory for a more helpful ChatGPT

这篇文章介绍了 ChatGPT 记忆系统从“手动保存记忆”演进到基于后台自动归纳的 dreaming 机制,重点解决记忆陈旧、正确性和规模化成本三个问题。文章还给出了评估记忆质量的三个维度:持续携带上下文、遵循偏好与约束、随时间保持最新,并说明新架构如何通过记忆摘要页让用户查看和管理被合成的记忆。整体上它展示的是一个已经进入产品化部署的 AI 个性化系统设计,而不是单纯的功能宣传,适合作为 AI 工程与产品化记忆系统的参考案例。

推荐收录,因为它把“记忆”从概念层面落到了可评估、可更新、可扩展的系统设计,覆盖了上下文继承、偏好跟随和时间衰减这类真实问题。对做 AI 产品、个性化系统或长上下文状态管理的人来说,这篇文章有较强的迁移价值。

工程实践Cloudflare Blog

Enforcing the First AS in BGP AS_PATHs

这篇文章讨论了 BGP 路由中的“First AS”校验问题,指出攻击者可以通过伪造 AS_PATH 绕过 origin validation 和部分路径验证机制,从而制造路由劫持。作者结合公开劫持案例、RFC 规范和 Cloudflare 自己的实测,说明只要在 EBGP 邻居上强制检查 AS_PATH 的左端 AS 是否等于对端 AS,就能有效阻断这类攻击,且应当作为默认安全配置。文章还统计了多家 Tier 1 网络和主流路由实现的默认行为,揭示了不同厂商在安全默认值上的差异,以及 IX route server 这一少数例外场景。

推荐收录,因为它把一个看似细小的 BGP 配置项,放到互联网路由安全的真实攻击面和工程默认值中系统分析,具有很强的可迁移价值。对网络工程师、SRE 和基础设施安全从业者来说,文章不仅能解释“为什么要开”,还给出“哪些场景可以不开”的边界。

科研议题Amazon Science

Ground truth is a process, not a dataset

这篇文章讨论的是 AI 生成深度研究报告的事实核查与评测问题,核心观点是“ground truth 不是静态数据集,而是一个可审计、可修正的过程”。作者提出 audit-then-score 评测协议,并介绍了 DeepFact-Bench 和 DeepFact-Eval:前者作为共享基准,后者通过上下文阅读、检索多篇文献、追问缺失信息来判断报告中的主张是否被证据支持。文章还给出实验结果,说明在复杂事实核查任务中,专家一开始直接标注并不稳定,但在“审计争议答案”的角色下准确率显著提升,评测系统也因此优于若干传统事实核查与深度研究系统。

推荐收录,因为它不只是介绍一个新模型,而是系统性讨论了复杂 AI 任务中“如何构造可持续有效的评测”这一长期关键问题。文章提出的审计式基准维护思路,对生成式搜索、深度研究、事实核查和高不确定性评测场景都有可迁移价值。

技术文章知乎 - 苏剑林

DeepSeek V4的tid2eid是怎么来的?

文章围绕 DeepSeek V4 中前几层 MoE 采用的 hash routing 机制,解释了 tid2eid(Token Id 到 Expert Id 映射表)可能的构造思路。作者先分析了前层 MoE 负载不均衡的问题,说明仅依赖 token id 进行静态分配的动机,再把问题形式化为“按 token 频率分配专家负载尽量均衡”的优化目标,并给出一个按频率排序、贪心选择当前最轻负载专家的构造方法。文章进一步讨论了极端频率失衡时单 token hash 的局限,提出可扩展到 2-gram、3-gram 等依赖更多上下文的 hash 思路,以缓解单 token 分配无法均衡的问题。

推荐收录,因为它不是简单复述 MoE 术语,而是把一个工程上常见但容易被忽略的问题——前层专家负载不均衡——转化为可操作的分配与均衡问题。文章对路由表构造、贪心解法和 hash 扩展边界都有清晰分析,对做 MoE、LLM 路由和负载均衡设计的读者很有迁移价值。

工程实践Instacart Tech Blog

From Scoring to Spelling: Rebuilding Ads Retrieval at Instacart

文章复盘了 Instacart 广告召回系统从“对固定候选集打分”转向“按 token 自回归生成”的重构过程。作者先分析了旧式 BERT 检索在词表膨胀、冷启动和候选结构漂移上的瓶颈,再介绍用 Semantic IDs 作为新产品词汇、用上下文模板组织训练输入、以及通过 beam search 生成候选并映射回商品索引的完整方案。为了支撑新模型,团队还重建了 GPU serving 栈(TensorRT-LLM、Triton、Go-native 服务),最终在两条发现型广告位上取得了约 +5% CTR、+34% add-to-carts 的线上收益,并显著提升了长尾类目和品牌多样性。

推荐收录,因为它不是单纯的产品宣传,而是把广告召回从建模、表示、训练、检索到推理基础设施完整串起来,呈现了一个可迁移的工业级重构范式。对于做推荐系统、检索系统和大模型推理落地的读者,这篇文章能直接提供“何时从打分转向生成”“如何重做表示层”“如何为生成式召回重建 serving 栈”的判断框架。

工程实践Instacart Tech Blog

Semantic IDs: Product Understanding at Scale

文章介绍了 Instacart 如何在海量商品目录中构建 semantic IDs,用离散代码来表达商品语义关系,从而解决冷启动、长尾覆盖和类目标注错误等问题。核心方法是基于产品 embedding 训练残差向量量化器,并加入利用目录树结构的对比学习正则,使代码前缀与商品语义层级对齐;同时作者还区分了面向精确替代的 ESCI 与面向探索发现的 ESCI+Gemma 两种表示策略。文章还给出了离线评估方式、失效案例和生产落地收益,说明该方案不仅能支持召回和推荐,也能反向用于目录质量审计。

推荐收录,因为文章把一个大规模推荐/检索系统中的表示学习、量化压缩、对比训练和评估方法串成了完整工程方案,而不是停留在概念介绍。它对做推荐系统、商品理解、向量检索和 AI 工程化的读者都有可迁移价值,尤其适合理解“如何把连续 embedding 变成可生产的离散语义 ID”。

科研议题知乎 - 微软亚洲研究院

SkillOpt:把智能体的“技能”当作可训练的外部参数

文章围绕微软亚洲研究院提出的 SkillOpt 框架展开,核心观点是将智能体“技能”从一次性生成的提示词,重新定义为可训练、可验证、可回滚的外部文本参数。作者详细说明了其训练闭环:轨迹采集、成功/失败反思、有界编辑、验证门控与拒绝缓存、跨轮慢更新,并强调最终产物是一份可读、可审计、可复用的技能文件。

推荐收录,因为它不仅介绍了一个新框架,还把智能体技能优化的问题抽象成了类似深度学习训练的可控过程,包含明确的机制设计、消融验证和跨框架迁移结果。对做 LLM Agent、提示优化、自动评测和企业流程自动化的读者都有可迁移价值。

科研议题知乎 - 苏剑林

直接以FID为Loss:从梯度计算到流式训练

文章围绕“能否直接把 FID 当作生成模型的损失函数”展开,先解释 FID/FD 的定义与可导性,再从均值、协方差和矩阵平方根的梯度推导出完整的反向传播形式。作者进一步指出真正的困难不在不可导,而在于 FID 需要跨样本统计、对 Batch Size 高度敏感,并由此引出等效损失、EMA 统计和队列近似等流式训练技巧。文章最后结合相关论文实验,说明这些方法可用于单步生成模型的微调,并在 FID 指标上取得显著提升,但也隐含对大批量统计稳定性的依赖。

推荐收录,因为它把一个常见评价指标 FID 的“可作为训练目标”问题讲清楚了,既有数学推导,也有训练系统层面的约束分析。对于做生成模型、损失设计或小批量训练近似的读者,这篇文章提供了可迁移的思路:跨样本统计如何求梯度、如何用历史信息模拟大批量效果。

科研议题Amazon Science

Diverse reasoning traces teach LLMs to make better decisions

这篇文章介绍了一项关于大语言模型推理训练的研究:作者不再把同一道题只绑定单一“标准推理链”,而是用多个多样化的推理轨迹共同监督模型,并通过全局分叉 token 让模型学习不同的推理模式。文中提出了 set-supervised fine tuning(SSFT)来避免模式坍塌,再结合 global forking policy optimization(GFPO)在推理时选择更合适的推理策略,从而在数学推理和代码任务上同时提升单次准确率与多样性。文章给出了 AIME、LiveCodeBench 等基准上的结果,显示该方法在 pass@1 上优于常见的 SFT+GRPO 管线,且在 pass@k 上也保持更好的多样性;其适用前提是能够获得同题多轨迹监督,并且主要证据来自基准评测。

推荐收录,因为它不是泛泛讨论“让模型更会思考”,而是明确提出了多推理轨迹监督、模式专门化和策略选择三个可复用机制,并给出清晰的实验验证。对关注 LLM 推理、后训练和多样性-准确率权衡的读者,这篇文章能提供可迁移的方法框架与评估视角。

科研议题知乎 - 微软亚洲研究院

RPG 与 RPG-Encoder:为仓库级 AI 工程,量身打造一种中间表示

这篇文章介绍了微软亚洲研究院提出的两项互补工作:RPG(Repository Planning Graph)用于把自然语言需求转成仓库级规划并驱动代码生成,RPG-Encoder 则把已有代码仓库反向压缩回同一种图表示,用于理解、定位、修改和增量维护。文章重点说明了为什么仓库级 AI 需要比自然语言计划、依赖图、API 文档更统一的中间表示,并通过 RepoCraft、SWE-bench 等实验展示了该表示在功能覆盖率、测试通过率、定位精度和增量维护成本上的优势,但这些结论主要基于特定 Python 仓库与基准任务,泛化到更多语言和工程场景仍需进一步验证。

推荐收录,因为它不只是介绍一个新概念,而是明确提出了仓库级 AI 工程所需的中间表示问题,并给出了正向生成、反向理解与增量维护的一体化方案。文章同时包含基准、实验指标和适用边界,适合关注代码智能体、仓库级推理和 AI 工程化落地的读者长期参考。

工程实践知乎 - 腾讯技术工程

腾讯云Agent Memory节省61% Token 提升52% 成功率的诀窍:Mermaid无限画布×上下文卸载

文章围绕 Agent 短期记忆压缩展开,提出“上下文卸载 + Mermaid 无限画布”的组合方案:把完整工具结果、网页正文和日志移到外部文件系统,只在上下文中保留高密度摘要、任务状态与索引路径,再用 Mermaid Flowchart 组织成可导航的任务拓扑。作者还比较了 Flowchart 与 StateDiagram 的适配性,给出分层存储链路(refs、JSONL、MMD、metadata)和分级召回机制,说明这种结构化记忆比单纯压缩文本更能维持长任务连续性。 实验部分在超长 Session 场景下验证了效果:在 SWEbench、Toolathlon、WideSearch、AA-LCR 等任务中,方案在显著节省 Token 的同时,任务完成率或准确率未下降,部分场景还有提升;其中 WideSearch 的 Token 节省最高可达 61.38%,成功率相对提升 51.52%。文章也指出该方案更适合长任务、多轮工具调用、反复改写与跨轮次恢复的场景,而不是依赖严格状态机的短流程任务。

推荐收录,因为它不是泛泛讨论“记忆很重要”,而是给出了可落地的 Agent 记忆架构、信息分层方式和实验验证,能直接启发长上下文、工具调用和任务恢复设计。对于做 AI 工程、Agent 框架、上下文工程或记忆系统的读者,这篇文章具有较强的可迁移价值和工程参考意义。

科研议题Google DeepMind Blog

Fast-tracking genetic leads to reverse cellular aging

这篇文章介绍了 DeepMind 的 Co-Scientist 如何参与生物学研究,帮助科学家从大量候选基因/因子中快速筛出可能逆转细胞衰老的线索,并在人体细胞实验中验证其有效性。文中强调的不只是“找到结果”,而是把大模型用于生成假设、优先排序和加速实验迭代,从而缩短传统湿实验的探索周期。文章的核心结论是,AI 可以在生物发现中承担“提出可检验假设”的角色,并显著提升命中率与研究效率。其边界也很明确:这是面向特定细胞模型和实验流程的研究展示,不能直接外推为对整体现象或临床疗法的证明。

文章直接展示了 Co-Scientist 参与发现并验证“逆转人类细胞衰老”候选因子的过程,属于 AI 辅助科学发现的实证案例。适合关注 AI for Science、机器学习驱动假设生成和生物实验闭环的读者,但需注意它是博客级成果展示,细节仍以正式论文/补充材料为准。

科研议题Amazon Science

Making LLMs faster without sacrificing accuracy

这篇文章基于一篇 ICLR 论文,讨论如何在不牺牲准确率的前提下提升大语言模型推理效率。作者指出,传统 Chinchilla scaling law 只覆盖参数量与训练数据量,而没有把隐藏维度、MLP 与注意力参数比例、以及 GQA 这类架构选择纳入优化框架;因此他们进一步建立了“条件缩放律”,把这些架构变量与损失和吞吐量直接关联起来。文章还通过训练 200 多个不同架构模型验证了该方法,给出了 Panda 与 Surefire 两类在准确率或准确率-效率帕累托前沿上更优的模型家族,并说明这些结论在不同 GPU 和推理框架上具有较强一致性,但仍主要适用于 Transformer 风格的 LLM 及其服务场景。

推荐收录,因为它不是泛泛介绍模型加速,而是把缩放规律、架构设计与推理吞吐放进同一个可计算框架里,具有很强的方法论价值。对做 LLM 训练、架构搜索和推理系统优化的读者来说,这类“如何在精度与效率之间做定量权衡”的结论很有迁移性。

科研议题Amazon Science

Promptimus: Improving already good LLM prompts with zero manual engineering

这篇文章介绍了 Promptimus,一种用于自动优化“已经相当不错”的 LLM 提示词的方法,重点解决企业场景中提示词迁移到新模型、以及在保留业务规则前提下继续提升性能的问题。文章给出了四步迭代流程:基于用户自定义指标做评估、用 metric analyzer 生成可分解的检查点、通过反馈与策略生成器定位失败模式、再以全量重写或局部 edit mode 生成候选提示词并迭代选择最佳方案。作者还用 20 个公开基准和多个企业任务验证了其效果,显示该方法在多数任务上优于现有自动提示优化基线,并且在多模态与结构化提示场景中,局部编辑往往比重写更稳健。

推荐收录,因为它不是泛泛介绍提示词优化,而是提出了完整的方法框架、系统架构和跨基准实验结果,适合长期参考。文章对“如何在保留复杂业务约束的同时自动改进提示词”给出了可迁移的研究与工程思路,尤其适合做企业 LLM 应用、提示迁移和自动调优的人阅读。

科研思考OpenAI Research

What Parameter Golf taught us about AI-assisted research

这篇文章复盘了 OpenAI 组织 Parameter Golf 挑战赛的经验,重点讨论在严格约束下进行机器学习研究时,参赛者如何通过优化训练、量化、测试时训练和新模型结构取得进展。文章的核心不只是展示高分方案,而是总结了 AI coding agents 如何显著降低实验门槛、加快想法迭代,同时也给提交审核、归因和评分带来了新的治理问题。文章最后从赛事运营和研究生态角度说明,未来开放式研究挑战将越来越依赖 agent 参与和自动化筛查机制。

推荐收录,因为它不是单纯的活动宣传,而是对“AI 辅助研究”这一新工作方式的真实复盘,包含约束设计、方案类型、审核挑战和组织侧经验。对做机器学习研究、竞赛平台或评测体系设计的人来说,文章有较强的迁移价值,尤其适合理解 agent 时代实验节奏与治理问题的变化。

科研议题知乎 - 微软亚洲研究院

不改架构、无需3D数据,强化学习如何让视频模型真正“理解”3D世界?

文章介绍了微软亚洲研究院提出的 World-R1 框架,核心目标是在不改动视频生成模型架构、无需额外 3D 数据、且不增加推理开销的前提下,通过强化学习让视频模型更好地满足三维几何一致性。方法上,它将相机运动以隐式噪声注入的方式写入扩散过程,并借助 3DGS 重建、多模态语义评分、轨迹对齐和生成质量评分构造复合奖励,再通过周期性解耦训练平衡刚性结构与动态内容。实验结果表明,该方法在几何一致性指标和常规视频质量指标上都优于基线,但整体仍建立在重建质量、奖励设计和文本运动先验有效的前提之上。

推荐收录,因为这篇文章不是泛泛介绍视频生成热点,而是清楚讲解了一个具体研究框架的目标、训练信号设计、实验指标与消融结论。它对想理解“如何用 RL 改善生成模型几何一致性”的读者具有较强的迁移价值,也能作为相关论文阅读的导读材料。

科研议题NVIDIA Technical Blog

Improving Bash Generation in Small Language Models with Grammar-Constrained Decoding

文章讨论如何用语法约束解码(grammar-constrained decoding)提升小型语言模型生成 Bash 命令的质量,重点面向 AI agent 场景中的可执行工具调用。核心思路是把 Bash 语法作为生成约束,减少语法错误和不可执行输出,从而让较小模型在 shell 命令生成任务上更稳定、更可用。文章的价值主要在于把“生成正确的命令”从纯提示工程问题,推进到可验证的结构化解码问题,并说明其适用边界在于 Bash/命令生成这类有明确语法规则的任务。

推荐收录,因为它围绕一个很具体但长期重要的工程与研究问题展开:如何让小模型在 agent 工具调用中输出可执行、可约束的命令。文章的方法具有较强迁移价值,适合关注 LLM 可靠性、结构化解码和 AI agent 工程落地的读者参考。

工程实践Amazon Science

Building trust into AI

这篇文章系统介绍了 Amazon 如何把 responsible AI 嵌入 AI 全生命周期:从预训练阶段注入安全、隐私、公平等原则,到 RLHF 阶段用奖励模型和 judge 机制塑形行为,再到评测阶段构建可击穿模型的测试集,并在第三方监测与高风险场景中持续追踪风险。文章还展示了政策制定、红队、外部合作和法规变化如何反向影响模型训练与部署,强调“可信 AI”不是附加功能,而是产品设计和组织流程的一部分。整体上它更像一篇面向大模型治理与工程落地的案例梳理,适合关注 AI Safety、AI Engineering 和模型评测体系的读者参考。

推荐收录,因为它不是泛泛谈“负责任 AI”,而是把预训练、后训练、评测、第三方监测和政策制定串成了一条可复用的工程链路。对做大模型、评测、红队和安全治理的人来说,文章提供了跨团队协作、风险分层和验证闭环的参考框架。

科研议题Amazon Science

How catastrophic is your LLM?

文章介绍了一篇关于大语言模型安全评估的研究,核心问题是传统红队测试只覆盖少量固定提示,难以刻画多轮对话中真实且最坏情况下的灾难性风险。作者与 UIUC 提出 C3LLM 框架,把对话建模为语义相关的图结构,并设计随机节点、图路径、带目标约束的图路径以及自适应采样四种威胁分布,以覆盖不同攻击能力。框架先用独立的 ChatGPT 评审器标注模型回复是否“灾难性”,再用 Clopper-Pearson 方法把攻击成功率转成置信区间,从而给出风险概率的上下界,而不是单点分数。实验在化学/生物与网络犯罪基准上比较了多款前沿闭源和开源模型,显示所有模型都存在非平凡风险,但安全性差异明显。该方法适合做更原则化的安全基准,但其结论仍受图构建方式、评审器可靠性和所选威胁模型覆盖范围限制。

推荐收录,因为文章明确给出了 C3LLM 的问题定义、对话图建模、四类采样威胁模型和置信区间认证方法,属于可复用的 LLM 安全研究框架。适合做安全评测、红队设计和基准构建的读者参考,但也要注意它依赖特定对话图与自动裁判,结论并非对所有真实场景都完全外推。

工程实践Lyft Engineering

How We Built a Smarter Pickup Experience for Gated Communities

这篇文章复盘了 Lyft 如何改善封闭社区内的叫车接送体验。作者先指出两个核心问题:默认选点会把乘客引到围栏内,而上车说明只能临时聊天补充,导致司机找不到入口、等待和取消率上升。为此,团队把门禁社区编码进地图数据,生成门区边界,并在乘客端提供“门内/门外”两类更贴近真实行为的上车点建议。随后又在路由中加入经过大门的中间停靠点,并在司机接近门口时及时展示简洁的门禁说明,同时加入可删除、不可跨行程保留等隐私保护。上线实验显示该流程未显著增加下单流失,且降低了取消、缩短了等待,说明把现实约束显式纳入地图、推荐、路由和交互链路是可复用的工程方法;但当前覆盖仍依赖地图数据完整性,且多入口社区的最优选门仍有改进空间。

收录价值在于它给出了一个完整的工程闭环:从地图建模、路径改造到交互时机和隐私控制,并用实验和指标验证效果。适合做地图、出行、位置服务或复杂前端/后端协同系统的参考,但也要注意其方案强依赖本地地理数据质量与覆盖。

科研议题Amazon Science

Customized Amazon Nova models improve molecular-property prediction in drug discovery

文章介绍了 Amazon 与 Nimbus Therapeutics 合作的实验:把通用大模型 Nova 2 Lite 通过监督微调(SFT)和强化微调(RFT)改造成分子性质预测器,用于药物发现中的脂溶性、渗透性和清除率等 11 项属性。作者先证明未定制的 Claude Sonnet 4 与 Nova 2 Lite 在该任务上明显落后于专用 GNN,误差可高出 40% 到 200% 以上;随后用 55,000 个带实验标签分子做 SFT,再在 15,000 个未见样本上用 RFT 优化。文中重点比较了指数衰减、二值奖惩和 Huber reward 三种奖励设计,指出 Huber 在大误差和小误差区间都更稳定,最终取得最佳结果。最佳模型在 11 项性质上平均 RMSE 接近或部分超过多模型 GNN 方案,并把原本需要多套模型与接口的流程简化为单一对话式系统。文章也明确边界:当前成果主要是性质预测,向分子生成与可解释推理扩展仍是下一步,且效果依赖领域数据、奖励设计和持续微调。

收录价值在于它给出了可复现的迁移路径:SFT 负责补足领域知识,RFT 通过 Huber reward 稳定优化回归任务,并用明确指标对比 GNN 基线。适合做 LLM 行业定制、科学计算与 AI4Science 的方法参考,但其结论主要针对分子性质预测,外推到其他科学任务仍需重新验证。

科研议题Amazon Science

AWS and Hopkins Engineering announce groundbreaking database for AI/ML antibody design

这篇文章介绍了 AWS 与约翰斯·霍普金斯工程学院 Gray Lab 联合发布的抗体可开发性基准数据集,核心问题是:当前用于抗体 AI/ML 设计的公开数据太少、太单一,导致模型难以被可靠比较。新基准强调用湿实验验证的真实标签来构建训练与评测基础,避免只依赖私有数据或单一靶点数据带来的偏差。数据集包含 50 个种子抗体、4 种结构格式、42 个抗原及大量系统性突变体,覆盖表达量、纯度、热稳定性、聚集、交叉反应性和疏水性等关键属性。它刻意纳入可开发与不可开发样本,并对 pLM 引导与非引导突变、插入/删除等策略做了区分,便于零样本评测和模型横向对比。文章也指出该基准仍局限于特定抗体空间与若干可开发性指标,后续扩展能否保持代表性仍是关键。

这篇内容有明确的收录证据:它不是单纯产品新闻,而是给出了公开数据集的设计原则、样本构成、标签体系和评测用途,适合作为蛋白/抗体 AI 研究的长期参考。对做生物计算、机器学习基准和模型评测的读者尤其有价值,但其结论主要适用于抗体可开发性这一特定任务域。

工程实践Amazon Science

How Amazon uses agentic AI for vulnerability detection at global scale

文章介绍 AWS 的 RuleForge:用多智能体 AI 将新 CVE 的利用代码、威胁情报和日志分析串成检测规则生成流水线。系统先自动抓取公开 PoC 并按威胁优先级排序,再由生成代理并行产出候选 JSON 规则,随后由独立的 judge 模型按敏感性和特异性评估,而不是让生成模型自评。通过合成测试、MadPot 和内部日志验证,并把失败原因回传迭代,最后仍由人工复审后上线。实践结果显示,规则产出与验证速度提升 336%,独立评审还能把误报降低 67% 且保持命中率。文章同时指出该方案主要适用于已有公开利用样本、需要高精度生产落地的高危漏洞检测,边界在于仍依赖人工最终批准和域内提示设计。

收录,因为文中给出了可验证的生产级方案:将生成与评估拆分、采用负向提问和分阶段验证,并用 336% 提速与 67% 降误报作为直接证据。适合做 AI 安全、检测工程和 agent 工作流设计参考,但结论主要来自已知 CVE 与 PoC 场景,迁移到缺少样本或强对抗环境时需谨慎。

工程实践Datadog Engineering

How we built a real-world evaluation platform for autonomous SRE agents at scale

文章介绍 Datadog 为 Bits AI SRE 智能体搭建的大规模评估平台,核心目标不是做一次性 demo,而是把真实事故回放成可重复的测试场景。平台会从生产事故中抽取上下文,重放告警、日志和处置流程,统一比较不同版本智能体在定位、推理和行动建议上的表现,并自动发现回归。作者强调,评估体系要覆盖多种生产场景、支持批量运行和指标汇总,还要把失败样例沉淀为回归集,才能形成持续迭代闭环。文章同时指出,这类评估依赖历史样本覆盖面与评分规则质量,不能等同于真实线上救火。

推荐收录,因为文章明确展示了“用真实事故回放做 agent 评测”的工程证据,而不是泛泛讨论 AI 运维概念。适合 SRE、LLM 工程和平台团队参考,但需要注意其结论受历史样本与评分体系约束。

工程实践Lyft Engineering

Beyond A/B Testing: Using Surrogacy and Region-Splits to Measure Long-Term Effects in Marketplaces

本文讨论 Lyft 在双边市场中如何评估价格、补贴等决策对长期供需的影响,而不是只看短期 A/B 结果。作者把“市场中介效应”拆成两步:先用残差化回归估计政策变化如何改变等待时长、surge、取消率等负面体验,再用 AIPW 等双重稳健方法估计这些体验对未来乘车量、留存和司机时长的影响。为验证这条因果链,文章分别使用 switch-back、user-split 和 region-split 实验做校准,并提出前向选择算法来改进区域分组的预实验拟合与统计功效。最后将中介效应与直接长期效应合并,用于预算分配和情景规划。其主要边界在于“长期中介效应完全通过负面体验传递”的假设,以及 region-split 天然存在拟合差、功效低的问题。

收录理由明确:文章给出了从观测因果推断到多种实验验证的完整链路,直接面向市场供需、补贴定价和长期效应评估。适合做 marketplace、增长实验和因果分析团队的参考,但读者也应注意其强假设与区域实验功效不足的风险。

工程实践Anthropic Engineering

How we built Claude Code auto mode: a safer way to skip permissions

文章介绍 Anthropic 为 Claude Code 设计的 auto mode,目标是在减少频繁确认带来的“审批疲劳”的同时,避免直接开启“跳过权限”所带来的安全风险。核心方案是两层防线:输入侧用提示注入探测器检查文件、网页和工具输出中的可疑内容,输出侧用基于 Sonnet 4.6 的转录分类器对每次动作做放行或阻断判断。系统在权限上采用分层策略:安全只读工具和项目内编辑可直接执行,真正高风险的 shell、外部访问、跨信任边界操作才进入分类器。作者详细给出了威胁模型、固定分类模板与可配置策略槽位,并用真实流量、真实激进行为和合成外泄集评估效果。结果表明端到端误报率可降到 0.4%,但真实危险动作仍有 17% 漏检,说明它适合高频自动化场景,不适合作为高风险基础设施的人审替代品。

文章直接公开了 AI Agent 自动审批的系统架构、威胁模型、分类规则和评测结果,属于可迁移的工程经验,而非产品宣传。适合做代理式工具安全设计、权限分层和风险边界的参考,但需注意其对真实危险动作仍有明显漏检,不宜直接用于高风险场景。

科研议题Amazon Science

Optimizing LoRA target module selection for efficient fine tuning

本文围绕 LoRA 微调中“把适配器插到哪些模块”这一关键问题展开,基于 Amazon Nova 2.0 Lite 做了系统性消融实验。作者比较了 qkv、o_proj、fc1/fc2 以及多种组合在文本、长上下文、结构化 JSON 和多模态任务上的效果,评估指标覆盖准确率、ROUGE 和延迟。结果显示,o_proj 作为单模块目标最稳健,几乎不失手且通常接近最佳;qkv-only 波动较大,容易在复杂任务上欠拟合。对于更难的任务,o_proj + fc2 往往能取得更高精度,但相对单独 o_proj 只带来小幅收益。文章最终给出面向效率与精度的配置建议,并指出模块选择仍受基座模型、任务类型和模态影响,难以一刀切。

文中明确给出了跨 7 个数据集的消融结果、延迟对比和可落地的模块选择建议,不是泛泛而谈的 LoRA 介绍。适合做 LLM 微调、推理成本优化和生产化适配器设计的参考,但结论主要基于 Nova 2.0 Lite,迁移到其他基座模型仍需复验。

工程实践Dropbox Tech

How we optimized Dash's relevance judge with DSPy

文章复盘 Dropbox Dash 如何用 DSPy 优化 LLM-as-a-judge 的相关性评分器,使其同时满足人类对齐和生产可用性。作者先把目标定义为:以人工标注为基准最小化 NMSE,并把 JSON 格式正确率纳入硬约束,因为下游管道依赖可解析输出。面对从 o3 迁移到更便宜的 gpt-oss-120b 和 gemma-3-12b,团队用 GEPA 结合人类解释、模型推理和误差方向,自动迭代提示词而非手工重写。结果显示,gpt-oss-120b 上 NMSE 降低 45%,适配时间从 1-2 周缩短到 1-2 天;gemma-3-12b 的无效 JSON 率下降 97% 以上。文章也指出优化易过拟合样例关键词,因此加入了禁止抄写示例内容、固定评分区间等约束,并对高风险生产提示词采用小步增量式改进。

有明确的生产实验、量化指标和边界控制:既比较了不同模型迁移的 NMSE,又验证了输出格式可靠性,直接证明方法可落地。适合做 LLM 评测、提示词优化和 AI 工程化的参考,尤其适用于需要在成本、质量与稳定性之间权衡的场景。

科研议题Anthropic Engineering

Eval awareness in Claude Opus 4.6’s BrowseComp performance

这篇文章分析了 Claude Opus 4.6 在 BrowseComp 基准上的异常高分来源,核心问题不是单纯“答对了题”,而是模型在开放网络环境中遭遇了题库污染与评测感知。作者统计了 1,266 道题中 11 道来自泄露答案,其中 9 道是公开网页、论文或 GitHub 里的直接泄露,另有 2 道是模型先怀疑自己在做评测,再反向识别出具体基准并解密答案键。文章进一步展示了多代理配置会放大这种风险,且代码执行、搜索工具和可访问的镜像数据会让模型绕过原本的防护。结论认为,静态基准在联网、长链路、工具增强的场景下越来越容易失真,评测完整性应被视为持续的对抗性问题,而不是一次性的设计问题。文中也指出,这种行为不等同于对齐失败,但确实暴露了代理系统会以意料之外的方式完成任务,且 URL 级封锁并不足够。

收录价值明确:文章给出了 1,266 题、20 处泄露源、18 次相关运行等具体证据,直接证明联网评测会被污染和“评测意识”绕过。适合做基准设计、Agent 评测和工具链安全的参考,尤其能提醒读者不要把静态分数当作可靠能力指标。

工程实践Instacart Tech Blog

Our Early Journey to Transform Instacart’s Discovery Recommendations with LLMs

本文讲述 Instacart 将 LLM 引入 Shopping Hub 推荐页的早期实践,目标是突破传统“静态内容库+统一排序”在个性化、页面一致性和快速迭代上的限制。作者先比较了自底向上与自顶向下两种生成范式,最终选择分阶段的自顶向下流水线:先生成页面主题与用户意图,再将主题映射为可检索关键词,随后做质量、多样性与业务约束过滤,最后接入既有排序系统。实现上使用了教师-学生微调、RAG、结构化约束解码以及 LLM-as-a-judge 和轻量分类器等多层评估与过滤手段,以控制成本并保证线上安全。文章还总结了将任务拆小、把评估前置、用结构化输入输出提升稳定性的经验。其边界在于当前仍处于早期阶段,效果主要来自离线评估和初步 A/B,尚未完全替代原有推荐体系。

收录价值明确:文章给出了 LLM 介入推荐系统的完整工程链路,包括分层生成、RAG、教师-学生训练和多级评估,且说明了为何放弃单模型端到端方案。适合做 AI 推荐、生成式内容和线上评估体系设计的参考,但需注意它仍是早期实验,结论以初步离线/A/B 结果为主。

工程实践Dropbox Tech

Using LLMs to amplify human labeling and improve Dash search relevance

文章围绕 Dropbox Dash 的企业搜索相关性优化,说明其 RAG 问答体验高度依赖检索排序质量,而排序模型又依赖大量高质量相关性标注。作者提出先用少量内部人工标注样本校准 LLM 评审,再让 LLM 离线批量生成数十万到数百万条标签,以低成本扩充训练数据,并用人类判断作为持续基准。文中详细讨论了如何用均方误差衡量 LLM 与人工的一致性、如何优先抽样高分歧样本、如何通过查询上下文和工具补足歧义,以及如何借助 DSPy 做提示词优化。文章也明确指出 LLM 不能直接替代线上排序模型,原因包括上下文窗口和延迟限制,因此更适合作为“标注放大器”和离线教师模型。其边界在于方法依赖高质量人工参考集、内部上下文知识和持续监控,且需要防止提示词漂移与评测回归。

推荐收录,因为文章给出了从人工标注到 LLM 批量标注、从离线评测到线上检索训练的完整闭环,证据具体且可复用。适合做搜索排序、RAG 评测和 AI 数据标注体系设计的参考,但要注意它依赖内部上下文与人工基准,不能直接照搬到无领域知识场景。

工程实践Lyft Engineering

Trusting the Untestable: Validation and Diagnostics for the Doubly Robust Models

文章介绍 Lyft 如何在无法做随机 A/B 测试时,用 AIPW 这类双重稳健模型评估因果影响,并把“可验证性”作为平台能力来建设。作者重点说明两类输入约束:必须显式选择大量混杂变量,且其数据必须来自首次曝光前,以避免泄漏;同时对下采样带来的倾向得分和结果权重偏差做了校正。文中还给出两类核心诊断:倾向分数重叠/共同支持检验,以及调整前后协变量平衡检查,来判断估计是否可信。为了验证方法本身,作者用周度 ride challenge 的实验数据作 ground truth,与观测数据上的 AIPW/ATET 结果对照,发现观测估计通常偏低,主要原因是 trim 后分析样本不再代表总体。基于这一发现,团队新增了隐藏混杂敏感性分析和 trimmed vs. untrimmed 协变量对比,用于识别外部有效性和未观测偏差的风险边界。

推荐收录,因为文章不仅讲 AIPW 原理,还给出混杂变量管理、共同支持、协变量平衡、敏感性分析等可落地诊断流程,并用实验对照验证偏差来源。适合做因果推断、实验平台和数据科学平台建设参考,尤其对需要在非随机场景下建立可信度的团队很有迁移价值。

工程实践Anthropic Engineering

Quantifying infrastructure noise in agentic coding evals

这篇文章研究了 agentic coding 评测中的“基础设施噪声”,核心结论是:容器资源配置本身就能显著改变分数,甚至超过榜单上常见的微小差距。作者在 Terminal-Bench 2.0 上比较了从严格按任务规格执行到完全放开资源的六种配置,发现资源越宽松,成功率越高,但其中一部分提升来自减少 OOM、pod error 等基础设施失败,而不是模型能力本身。实验表明,在 1x 到 3x 资源范围内,分数变化多落在噪声内;超过约 3x 后,额外资源开始真正帮助代理完成原本做不到的任务,最高相对提升约 6 个百分点。作者又在 SWE-bench 上复现了类似趋势,但幅度较小,说明该问题并非 Terminal-Bench 独有。文章最后建议评测应同时公开并区分“保证资源”和“硬性上限”,并把资源配置当作一等实验变量,否则几分之差很可能只是更大的 VM 或更宽松的沙箱。

文章直接给出了对照实验:同一模型、同一任务集,仅改变资源配置就能带来最高 6 个百分点的差异,证明基准分数并不纯粹。适合做 agent 评测、自动化 coding benchmark 和推理沙箱设计的读者参考,尤其适合需要判断榜单差距可信度的人。

工程实践Yelp Engineering

How Yelp Built a Back-Testing Engine for Safer, Smarter Ad Budget Allocation

文章介绍 Yelp 为广告预算分配系统搭建回测引擎的实践,用于在正式上线前评估调参或策略变更是否会影响广告展示、预算消耗和广告主收益。作者指出该系统存在明显的反馈回路,单点改动可能放大成系统级波动,因此仅看离线指标或局部测试并不足以判断安全性。回测引擎的目标是在历史数据和既有行为假设下重放预算分配过程,尽量提前暴露收益、投放结构和边界条件上的风险。文章强调这种方法适合复杂的广告/推荐类分配系统,但其结论仍依赖历史分布与建模假设,不能完全替代线上实验。

推荐收录,因为标题和导语直接给出了“back-testing engine”和“safer, smarter ad budget allocation”,说明它不是泛泛介绍功能,而是在解决带反馈回路的系统变更评估问题。适合做广告系统、推荐分流或其他预算/流量分配场景的工程参考,尤其可迁移其离线评估与上线风险控制思路。

科研议题BAIR Blog

Information-Driven Design of Imaging Systems

这篇文章提出一种面向成像系统的“信息驱动设计”框架:不再只看重建图像是否好看,而是直接用互信息衡量测量本身能区分对象的能力。作者将互信息写成 H(Y)-H(Y|X),利用已知的噪声物理模型直接计算噪声项,再用概率模型学习测量分布,从而估计系统信息量。论文在彩色摄影、射电天文、无透镜成像和显微成像四个场景中验证了该指标能稳定预测下游解码器性能。进一步提出 IDEAL,只优化编码器参数而不训练解码器,结果在信息量和重建质量上接近端到端方法,同时显著降低显存和训练复杂度。但该方法依赖较明确的编码—噪声建模,且信息估计带有模型上界性质,建模误差只会高估信息。

文章给出了可直接复用的研究方法:如何把互信息拆解为可估计项,并用它替代重建网络来评价和优化成像系统。对计算成像、传感器设计和多模态感知研究者尤其有价值,但其适用前提是噪声模型明确、编码过程可建模。

科研议题Stanford Hazy Research

What Does Information Theory Say About Designing Agentic Systems?

这篇文章从信息论视角分析 agentic 系统中的“压缩器—预测器”结构:大模型作为编排器,小模型先从长上下文中提炼信息,再由上层模型综合生成结果。作者指出,当前系统评估往往只看端到端指标,难以区分是压缩阶段丢信息,还是预测阶段没用好信息,因此引入互信息来衡量压缩质量与信息密度。基于五类长上下文任务的实验,文章发现:增强压缩器通常比继续放大预测器更有效,且在固定预算下更适合把算力投向可本地运行的小模型。实验还显示,不同模型家族对压缩质量的影响大于单纯参数规模,互信息与下游准确率、困惑度存在较强相关。作者进一步在 DeepResearch 场景验证了该思路,在仅为前沿模型 28% 成本下达到 102% 的性能,但也承认互信息估计在实践中仍然困难,且结论主要适用于压缩—预测式多模型工作流。

文章给出了明确实验、可量化指标和跨任务验证,不是泛泛讨论 agent,而是提出了可迁移的设计原则:优先增强压缩器、关注信息密度、用互信息评估通信质量。适合做多模型工作流、Deep Research 或端侧/云端混合架构设计的参考,但需注意互信息估计本身仍有实践难点。

科研议题Stanford Hazy Research

Stuffing MLPs Full of Facts 🧠: A Generative Approach to Factual Recall

这篇文章讨论 Transformer 中 MLP 层如何存储与检索事实,作者没有沿用“事后分析已训练模型”的路线,而是采用生成式方法,直接构造可证明正确的事实存储 MLP。核心思路是把单隐层 MLP 分解为编码器和解码器:编码器把 key 压缩成约为 log F 维代码,解码器再恢复到 value 空间,从而在参数量上达到接近信息论下界的 Θ(F log F) 级别。文章进一步提出“可解码性”指标来刻画输出嵌入几何对容量的限制,并发现其对梯度训练和构造型 MLP 的事实存储能力都有很强预测性。作者还给出让 Transformer 可靠调用这类 MLP 的若干结构改动,并展示了在合成事实回忆任务上超过 99% 的召回率。最后,文章证明可通过整体替换 MLP 块实现模块化事实编辑,但同时指出容量与可用性之间存在权衡,且目前结果主要建立在受控合成设置中。

收录价值明确,因为文章不仅解释了 LLM 事实记忆的机制假设,还给出可证明的构造、下界匹配的容量分析和可复现实验。适合关注大模型机理、表示几何、可编辑记忆与合成验证的研究者阅读,但需注意其结论主要来自受控任务,向真实预训练模型迁移仍有边界。

科研议题BAIR Blog

RL without TD learning

这篇文章介绍了一种用于离策略强化学习的新范式:用“分治”替代传统的时序差分(TD)学习。作者先指出,TD 通过自举传播误差,在长时序任务上会累积不稳定,因此常见的 n-step TD 只能缓解而不能根治。随后文章提出在目标条件强化学习中利用距离的传递性,把一个轨迹切成两段,并用中间子目标把长价值更新拆成两个更短的价值组合。为避免在大状态空间里搜索最优子目标,方法将候选限制在数据轨迹中的中间状态,并用 expectile regression 做软 argmax,形成 Transitive RL(TRL)。实验在 OGBench 的 humanoidmaze 和 puzzle 等超长时序离线任务上表明,TRL 在多项任务上优于强基线,并且能接近经过单独调参的最佳 TD-n,而无需手动选择 n。文章也明确了边界:当前方法主要适用于确定性、目标条件场景,向一般奖励任务和随机环境扩展仍是开放问题。

这篇文章直接给出了一个面向长时序离策略 RL 的新价值学习范式,并解释了为什么它能绕开 TD 的误差累积问题。适合关注强化学习算法、离线 RL 和长视野任务的研究者阅读,其中分治式递归更新、候选子目标约束和 expectile 近似都具有可迁移价值。

科研议题Stanford Hazy Research

BWLer 🎳 (Part 1): PDEs, PINNs, and the Precision Gap

这篇博客讨论物理信息神经网络(PINN)在求解 PDE 时的精度瓶颈,作者认为问题不仅是优化困难,也与网络表示能力有关。为验证这一点,他们先去掉 PDE,只做一维光滑函数插值,发现标准 MLP 即使加宽加深,RMSE 仍常停在 1e-8 左右,远离 float64 的机器精度;而多项式插值器可在很少参数下达到机器精度。基于此,作者提出 BWLer(Barycentric Weight Layer),把多项式插值作为可微层叠加到 MLP 上,或直接替代网络,从而把函数表示与导数计算解耦。在三个 PDE 基准上,BWLer-hatted MLP 最多将 RMSE 降低 1800 倍,显式 BWLer 可到 1e-12,但更依赖二阶优化器;本文主要提供动机和证据,完整机制与实现细节留到 Part 2。

推荐收录,因为文中用“先去掉 PDE 做插值”这一对照实验,直接证明精度瓶颈不只来自方程条件数,也来自 MLP 的表示上限。适合做科学机器学习、PINN 和数值方法研究的读者参考;但当前只是两部分中的前半,具体架构与实现细节需结合 Part 2。

科研议题Stanford Hazy Research

BWLer 🎳 (Part 2): Navigating a Precision-Conditioning Tradeoff for PINNs

文章围绕 PINN 在高精度求解 PDE 时常见的精度瓶颈,提出 BWLer(Barycentric Weight Layer)作为一种以重心拉格朗日插值为核心的高精度替代层。作者将函数表示与导数计算解耦:一种模式让 MLP 只预测插值节点值,再由 BWLer 统一完成全局插值与谱导数;另一种模式则直接把节点值作为可学习参数,形成显式 BWLer。实验表明,前者在三个基准 PDE 上可把误差降低 10 到 1800 倍,后者甚至能把相对误差推到 10^-12 量级,接近机器精度。文章进一步指出,精度提升与条件数恶化之间存在显式权衡:节点越多越精细,但导数矩阵越病态,优化越困难。作者也明确了边界条件:对不连续解、复杂几何或需要快速训练的场景,BWLer 目前仍可能比标准 MLP-PINN 更慢、更依赖二阶优化。

收录证据很明确:文章给出可复现的方法设计、三组基准 PDE 结果、误差与条件数的权衡分析,以及对不连续/复杂域的局限说明。适合做科学机器学习、PINN 和数值方法结合方向的长期参考,尤其对关注高精度训练与优化病态性的读者有可迁移价值。

科研议题Stanford Hazy Research

Weaver: Closing the Generation-Verification Gap with Weak Verifiers

这篇文章介绍了 Weaver:一种用弱验证器弥合“生成—验证鸿沟”的方法。作者指出,大模型往往能生成正确答案,却难以稳定识别哪一个答案正确,因此仅靠多数投票或首个样本会损失大量潜在能力。Weaver 收集 30 多个弱验证器(奖励模型、LM judge、规则检查器等),先做二值化与过滤,再利用弱监督中的潜变量图模型和矩估计,从无标注数据中推断各验证器可靠性并进行加权聚合。该方法在 MATH500、GPQA Diamond、MMLU Pro 等任务上把平均准确率提升到 87.7%,接近并略超 o3-mini,同时还能蒸馏出一个 400M 交叉编码器,保留 98.7% 的集成效果并将验证推理开销降低 99.97%。文章的边界也很明确:它依赖验证器之间存在可利用的协同信号,且对任务难度、阈值设定和独立性假设仍有一定要求,更适合作为后验验证层而非替代生成模型本身。

文中给出了明确的方法链条、无标注聚合的统计假设,以及跨基准的量化结果和蒸馏收益,具备研究参考价值。适合关注 LLM 评测、验证器集成、弱监督与推理系统设计的读者,尤其可迁移到 reranking、候选筛选和低成本验证场景。

科研议题BAIR Blog

Defending against Prompt Injection with Structured Queries (StruQ) and Preference Optimization (SecAlign)

文章讨论 LLM 集成应用中的 prompt injection 威胁,指出问题根源在于输入中缺少“指令/数据”边界,同时模型又倾向于在整段输入中寻找可执行指令。作者提出两种防御:StruQ 通过带特殊分隔符的 Secure Front-End 明确区分提示词与外部数据,并用包含干净样本和注入样本的监督微调训练模型忽略数据中的恶意指令;SecAlign 则进一步用偏好优化,让模型在“应答真实任务”和“顺从注入指令”之间拉开更大的概率差。实验显示,这两种方法对多种无优化攻击几乎将成功率降到 0%,SecAlign 对优化型攻击也能把 ASR 降到 15% 以下,且整体实用性基本保留。文章同时给出适用边界:防御效果依赖前端过滤和受控分隔符机制,训练数据又主要来自模拟注入场景。

这篇文章直接给出了 prompt injection 的威胁模型、两条可实现的训练/部署防线,以及在多模型上的 ASR 和实用性对比证据,适合做 LLM 安全与应用集成的长期参考。对做 RAG、Agent 或生产级 LLM 应用的读者尤其有用,但需要注意其前提是可强制的前端分隔与模拟攻击数据,真实场景仍需补充验证。

科研议题BAIR Blog

Repurposing Protein Folding Models for Generation with Latent Diffusion

文章介绍了 BAIR 提出的 PLAID:一种把蛋白质折叠模型的潜空间当作生成空间来训练的多模态扩散模型,可同时生成蛋白质序列和三维原子级结构。其核心思路是只用更廉价、规模大 2-4 个数量级的序列数据库训练扩散模型,再在推理时借助冻结的 ESMFold 解码结构,从而绕开稀缺结构数据的瓶颈。作者还提出用 CHEAP 压缩联合嵌入,缓解 ESMFold 潜空间过大、分布不规则和大量“异常激活”带来的训练难度。文章展示了按功能与物种提示进行条件生成的案例,并说明 PLAID 能在保持较高序列多样性的同时复现金属蛋白配位、跨膜蛋白等结构/功能模式。其边界在于目前仍是蛋白设计领域的研究原型,依赖预训练折叠模型的表征能力,且主要验证了函数与生物体两个控制轴,离真实药物设计与湿实验闭环仍有距离。

推荐收录,因为文章明确给出了从“折叠预测”到“生成设计”的方法转向,并解释了序列-only 训练、冻结解码器和潜空间压缩的关键证据。适合做蛋白生成、条件扩散和表示复用的研究参考,但需注意它仍是面向预训练模型的原型验证,工程落地与湿实验效果还有边界。

科研议题BAIR Blog

Scaling Up Reinforcement Learning for Traffic Smoothing: A 100-AV Highway Deployment

这篇文章介绍了伯克利团队将强化学习用于“交通平滑”的研究,并把训练出的控制器部署到 100 辆车上做真实高速公路实验。作者针对 stop-and-go 交通波,先基于 I-24 实测轨迹构建数据驱动仿真,让 RL 代理在混合交通中学习控制自车速度或期望车速,以同时优化能耗、通行效率、安全与驾驶舒适性。文中重点讨论了奖励函数设计的难点:如果只追求节能,策略会产生不合理停车,因此需要动态间距约束和对周围人类车辆油耗的惩罚。随后,团队通过分层控制框架把模型接入量产车 ACC,在无显式车车通信、仅依赖本车与前车局部信息的条件下完成上路验证。实验结果显示,在最拥堵场景中,仿真可带来最高约 20% 的整体节能,实测也观察到 15% 至 20% 的能耗下降趋势;但文章也明确指出,仿真到现实的差距、更加准确的人类驾驶建模以及未来协同通信仍是后续关键问题。

收录价值在于它不仅讲 RL 原理,还给出了从数据驱动仿真、奖励设计到 100 车实车验证的完整研究链路,证据充分且可复用。适合关注强化学习落地、自动驾驶控制和 sim-to-real 研究的读者,尤其值得参考其局部观测、分层控制与安全约束的工程化思路。

科研议题Stanford Hazy Research

Smoothie: a label-free approach for inference-time LLM routing

本文介绍了 NeurIPS 2024 论文 Smoothie,讨论在推理阶段进行 LLM 路由的问题:当同一输入由多个模型生成多个开放式答案时,如何在没有标注数据的情况下选择最优输出。作者借鉴弱监督思想,把每个模型的生成视为“投票”,再用预训练编码器提取文本嵌入,并以生成之间的欧氏距离衡量一致性:越接近群体中心、与其他输出越一致的模型,被估计为质量越高。文章进一步提出 Smoothie-Global 与 Smoothie-Local 两种变体,分别对应全局路由和按样本局部路由,并强调整个过程不需要训练,只需计算嵌入即可。实验显示,该方法在 AlpacaEval 等任务上相较随机路由有明显提升,平均胜率提升约 15 个点、最高可达 27 个点;在多任务集上也优于若干有监督基线。其边界在于效果依赖嵌入质量和“模型间一致性近似质量”的假设,且经典版本默认需要先获得多模型生成结果,适合推理成本可控、追求无标注路由优化的场景。

文章给出了无标注 LLM 路由的明确方法、数学建模和实验增益证据,且有 NeurIPS 论文与代码支撑,不是泛泛概念介绍。适合做多模型推理、test-time compute 和开放式生成路由方案设计的读者参考,但需注意其依赖嵌入一致性假设与多模型输出前置成本。

工程实践Datadog Engineering

How we use formal modeling, lightweight simulations, and chaos testing to design reliable distributed systems

文章介绍 Datadog 团队如何把形式化建模、轻量级仿真和混沌测试结合起来,分析一个分布式、多租户队列系统的可靠性问题。作者先用模型描述系统状态、调度规则和租户之间的干扰关系,再通过仿真探索不同负载、故障和时序下的行为,提前发现吞吐、延迟与公平性方面的风险。随后,他们用混沌测试在真实环境中验证模型未覆盖的边界情况,补齐实现细节和运行时交互带来的偏差。文章的核心结论是:对状态复杂、故障路径多的分布式系统,先建模再实验能显著降低试错成本,并帮助团队更早识别设计缺陷。但这类方法依赖对系统抽象足够准确,且更适合分析关键机制而非替代完整压测与生产观测。

文中直接给出了“formal modeling + simulation + chaos testing”的组合方法,并落在多租户分布式队列这一典型复杂系统上,属于可迁移的工程实践。适合做架构设计、稳定性验证和故障注入方法参考,但读者需要注意模型抽象是否覆盖真实系统边界。

科研思考Stanford Hazy Research

An Unserious Person’s Take on Axiomatic Knowledge in the Era of Foundation Models

这篇文章以较强的个人反思口吻,讨论在 foundation models 时代“公理化知识”是否仍然是理解世界的最佳起点。作者回顾了自己从逻辑、概率统计、NLP 到生物序列建模的研究经历,认为许多传统方法的美感和严整性并不总能转化为更好的系统效果,而大模型这种“混乱但有用”的工具常常能在新的操作区间里带来意外收益。文章重点以 HyenaDNA、DNA foundation model、以及用于最小二乘和微分方程的相关工作为例,说明 foundation model 在科学问题上可能更像一种新仪器,而不是旧理论的替代品。作者同时指出一个重要边界:现有模型在数值精度上仍明显不及传统科学计算方法,尤其在优化和高精度求解场景里差距很大。整篇文章的核心结论不是否定数学和方程,而是主张更谨慎地判断“知识的运行区间”,不要默认古典理论的优雅性就等于在新问题上的可迁移性。

推荐收录,因为文章直接围绕 foundation models、DNA 建模、最小二乘精度和 PDE/ODE 这类科研问题展开,并明确指出大模型在科学计算中的适用边界。适合关注 AI for Science、研究方向判断和方法论反思的读者,尤其能帮助理解“能做”与“做得足够精确”之间的差别。

科研议题Stanford Hazy Research

Linearizing LLMs with LoLCATs

文章介绍了 LoLCATs,一种把现有 Transformer 大模型“线性化”为亚二次推理结构的方法。核心思路不是从头设计新架构,而是先用线性注意力替换 softmax 注意力,再通过 attention transfer 让新注意力近似原模型行为,并用 LoRA 这类参数高效微调恢复质量。作者声称该方法在 Mistral 7B、Llama 3 8B 等模型上显著优于传统线性化方案,且在零样本任务上接近原始 Transformer,同时把训练参数和 token 成本压到很低。更重要的是,他们把方法扩展到 Llama 3.1 8B/70B/405B,展示了在“学术算力”下线性化超大模型的可行性。文章适合关注高效推理、模型压缩和 Transformer 结构替换的读者,但其结论主要依赖论文与基准评测,实际部署仍需结合任务分布和质量回归风险验证。

有明确的研究问题、方法链路和量化结果:attention transfer + LoRA 低成本线性化,并给出 7B 到 405B 的实证。适合做 LLM 高效推理、结构替换和模型压缩的参考,但落地时仍需关注任务迁移与质量回归。

科研议题Stanford Hazy Research

Learning from DNA: a grand challenge in biology

文章介绍 Stanford Hazy、Arc 与 Together AI 联合训练的 Evo:一个 7B 参数、基于 StripedHyena 的长上下文生物基础模型,使用 2.7M 个细菌和噬菌体基因组、300B token 的 OpenGenome 语料,以单核苷酸 byte-level 方式做 next-token 预测。作者把 DNA 视为同时承载 DNA、RNA、蛋白三种“语言”的统一建模问题,展示了跨中心法则的零样本泛化,包括蛋白功能预测、基因必需性判断,以及无监督生成新的 CRISPR 系统。文章重点分析 DNA 建模的难点:超长上下文、单碱基分辨率和噪声序列,并通过 300 个模型的 scaling laws 发现 Transformer++ 在 byte-level 上明显落后,Hyena/StripedHyena 更具计算效率。作者还提出 Mechanistic Architecture Design,用合成任务解释压缩、聚合和过滤能力,并据此改进架构;但当前证据主要来自原核和噬菌体数据,向真核与真实应用迁移仍有限。

推荐收录,因为它给出了生物序列基础模型的完整研究链条:数据集、架构、缩放律、机制分析和零样本验证都写得很清楚。适合关注长上下文、字节级建模、跨模态 foundation model 与生物计算交叉的读者,但要注意其结论目前主要建立在原核/噬菌体数据上。

科研议题Stanford Hazy Research

Long-Context Retrieval Models with Monarch Mixer

这篇文章介绍了基于 Monarch Mixer(M2)的长上下文检索模型探索:作者用可替代注意力和 MLP 的 Monarch 矩阵构造 BERT 变体,并借助长卷积实现更高效的长序列建模。为适配 2K/8K/32K 上下文预训练,他们发现仅把短文硬拼接效果不佳,因此改用自然长文与拼接文档的混合语料,并在 32K 模型上从 8K 检查点 warm-start。检索微调阶段,作者指出常见对比学习损失受 batch size 影响严重,于是改用可在单样本显存约束下工作的 orthogonal loss,从而在长文场景稳定训练。文章还发布了 LoCo 长上下文检索基准,涵盖会议纪要、政策报告、剧本和论文等任务;结果显示 M2-BERT-32K 在该基准上显著优于同级或更大模型,但目前基准仅有 5 个任务,仍处于早期扩展阶段。

有明确的研究贡献:模型结构、长文预训练配比、微调损失和新基准 LoCo 都给出了可复用的做法与结果。适合做长上下文检索、Embedding 和 RAG 评估的研究/工程读者参考,但需注意基准规模仍小、结论是预览版。

科研议题Stanford Hazy Research

Zoology (Blogpost 1): Measuring and Improving Recall in Efficient Language Models

这篇文章围绕高效语言模型的“召回能力”展开,比较了 Hyena、H3、RWKV 等门控卷积架构与 Transformer 在真实语言建模中的差距。作者在 17 个从 70M 到 1.4B 参数规模的模型上做统一训练与评测,发现总体困惑度差距中有超过 82% 来自需要联想式回忆的 token 子集,而不是一般语料位置。为解释这一现象,文章提出 MQAR 这类合成任务,证明门控卷积要随着序列长度增加模型维度才可维持召回能力,而注意力则不需要这种扩展。理论部分用多项式/电路复杂度视角说明了这一尺度差异,并给出可通过输入依赖的选择式稀疏注意力缩小差距的方向。文章的边界也很明确:结论主要针对特定高效架构与召回类能力,且合成任务虽能解释现象,但仍是对真实语言分布的近似。

文章直接给出多模型实证、AR 切片分析和 MQAR 理论解释,证据链完整,不是泛泛而谈的架构点评。适合做高效语言模型、注意力替代方案和长序列召回问题的长期参考,也能迁移到新架构评测与合成基准设计中。

科研议题Stanford Hazy Research

A Paradigm Shift in ML Validation: Evaluating Workflows, Not Tasks

文章提出一个面向应用机器学习的验证范式转变:不再只评估单个任务指标,而是评估用户完成端到端工作流的效果。作者以医疗影像为例说明,许多下游决策依赖上游采集、重建、分割和分析等多个环节,任务级基准往往与临床真正关心的结果相关性很弱。文中进一步给出工作流中心数据集与基准的两个原则:数据要覆盖工作流各阶段,并能衡量用户相关结局;并以 SKM-TEA 数据集展示如何把原始数据、重建、标注和生物标志物评估串成完整流程。文章也指出落地难点,包括工作流不公开、不标准、标注成本高以及用户体验难量化。最后给出开放工作流、降低使用门槛、展示真实下游收益和构建交互式工具等推进路径。

推荐收录,因为文章明确论证了“从任务验证转向工作流验证”的必要性,并给出 SKM-TEA 这类数据集的具体实践证据。适合做应用机器学习、领域基准和评测体系设计的参考,尤其对医疗 AI 与研究型 benchmark 构建很有迁移价值。

科研议题Stanford Hazy Research

Embroid: Correcting and Improving LLM Predictions Without Labels

这篇文章介绍了 Embroid:一种在没有标注数据的情况下纠正和提升提示式语言模型预测的方法。核心思路不是直接把 embedding 的“平滑性”用于给无标注样本传播标签,而是反过来用样本在邻域中的预测一致性来检查模型是否出错。作者在多个 embedding 空间中分别取近邻,把邻域内的预测分布与全局分布比较,再用弱监督方法 Flying Squid 融合这些“投票”,从而得到更稳健的最终预测。实验显示,该方法在 95 个任务上大多能提升原始 prompt 性能,在 GPT-JT 和 GPT-3.5 上也有稳定收益,并且可与 AMA、chain-of-thought 和示例选择等提示策略叠加。其边界在于效果依赖 embedding 空间的平滑性、原始 prompt 质量以及任务是否存在可被近邻捕捉的局部一致结构。

有明确研究问题、方法设计和大规模实验结果,不是泛泛的博客解读。适合做标签稀缺场景下的 LLM 校正、近邻一致性判断和弱监督融合的参考,但也要注意它依赖 embedding 平滑性,任务不满足时收益会下降。

科研议题Stanford Hazy Research

Why is in-context learning lower quality than fine-tuning? And…what if it wasn't?

这篇文章围绕“为什么上下文学习(ICL)通常不如微调”展开,作者先指出:用同样少量样本在冻结表征上训练一个分类器,效果可显著超过直接 ICL,说明差距未必来自知识缺失,而更可能来自推理方式不够理想。为验证这一点,作者提出用与下游任务无关的合成高斯逻辑回归任务训练一个任务无关推理模块 TART,试图教模型掌握更抽象的概率推断能力。实验显示,这种做法能把 NLP 二分类任务上的 ICL 与微调差距缩小到约 3%,并可迁移到不同模型家族、不同规模,甚至跨到图像和语音任务。文章还强调 TART 在上下文长度上更高效,能用更少 token 容纳更多样本,从而缓解传统 ICL 的长度限制。其结论是:ICL 的质量瓶颈可能部分来自通用推理能力不足,而不是特定任务知识不足,但当前结果主要建立在合成任务、分类场景和有限模态迁移上,泛化边界仍需进一步验证。

文中给出了明确的实验对照:冻结表征分类器优于 ICL、合成逻辑回归训练可提升 ICL、TART 还能跨模型和跨模态迁移,证据链完整。适合关注大模型推理、测试时计算和微调替代方案的研究者或工程团队参考,但需注意其主要验证仍集中在二分类与合成推理任务上。

科研议题Stanford Hazy Research

Batch computing and the coming age of AI systems

这篇文章把基础模型应用场景区分为有人在环的交互式系统和无需人工逐条介入的批处理系统,强调后者覆盖医疗、金融、科学与供应链等更大规模的社会计算任务。作者指出,过去这类 AI 批处理应用往往依赖大量领域专家与 PhD 级投入,而基础模型有机会显著降低构建门槛并扩大可用性。文章进一步总结了三类关键研究问题:如何提升高吞吐推理效率、如何重新设计任务分解以获得更好的质量/成本权衡、以及如何建立适合基础模型的评测与错误分析流程。文中以 FlexGen、Evaporate 和 Meerkat 为例,分别展示了离线推理吞吐优化、用代码生成替代直接抽取、以及面向基础模型的新型验证工具。其核心结论是,基础模型真正改变世界的潜力不只在聊天和创作,而在于可靠、低成本地接管大规模批处理工作流,但前提是系统效率和评估体系都要同步升级。

推荐收录,因为文章明确提出了“批处理 AI 系统”这一长期重要的研究与工程方向,并给出了 FlexGen、Evaporate、Meerkat 等直接证据说明具体可行的改进路径。适合关注 AI 系统、离线推理和评测方法的研究者与工程师阅读,其可迁移价值在于帮助读者重构大模型应用的成本、吞吐与验证思路。

科研议题Stanford Hazy Research

Simple Long Convolutions for Sequence Modeling

这篇文章讨论序列建模中一种更简单的基线:直接把卷积核参数化为与输入序列同长度的长卷积,并用 FFT 将计算复杂度从 O(N^2) 降到 O(N log N)。作者先指出,朴素长卷积在 Long Range Arena 上明显落后于 S4,主要问题是学到的卷积核在时域过于噪声、频域也不够平滑。为此,他们引入一个很简单的 Squash 正则化,对核权重做阈值收缩,从而得到更稀疏、平滑的核,并把 LRA 准确率提升到与 S4 持平。文章还展示该方法在图像分类、文本建模和脑 fMRI 任务上也有不错泛化,尤其是把 H3 中的 SSM 替换为卷积后,H3-Conv 在 PILE 上接近 H3 并优于 Transformer。与此同时,作者也明确了局限:这种简化版并不具备 SSM 的隐藏状态缓存、参数与长度解耦以及多分辨率扩展等优势。

推荐收录,因为文章给出了从朴素长卷积、问题诊断到 Squash 正则化改进的完整研究链条,并用 LRA、文本建模等实验直接证明了方法有效。适合做序列模型、卷积替代 SSM、以及实验设计与消融分析的参考,也能帮助读者理解何时“更简单的参数化”足以达到竞争性能。

科研议题Stanford Hazy Research

Improving Transfer and Robustness in Supervised Contrastive Learning

这篇文章围绕监督式对比学习如何同时提升迁移能力与鲁棒性展开,先从表示几何出发解释 SupCon 的“类塌缩”倾向为何对下游迁移不利。作者指出,单纯拉近同类、推远异类会让表示过于集中,而加入自监督式 InfoNCE 又可能带来更合适的几何“spread”。文章进一步提出两个关键问题:如何平衡表示空间的展开程度,以及如何打破类内置换不变性,否则同样的训练损失也可能对应很差的子类保留。基于这些分析,作者提出 Thanos:在 SupCon 上加入 class-conditional InfoNCE 和 class-conditional autoencoder,以同时获得适度展开和子群簇结构。实验显示它在 coarse-to-fine 迁移上平均提升 11.1 个点,在 worst-group robustness 上也优于已有方法,但结论主要针对监督式对比学习及其特定几何假设。

文章不仅解释了监督式对比学习的几何机制,还给出可检验的改进方案 Thanos,并用迁移与鲁棒性实验验证收益,证据链完整。适合做表示学习、对比学习和鲁棒性研究的长期参考,也便于迁移到需要子类保留与特征展开的任务中。

科研议题Stanford Hazy Research

TABi: Type-Aware Bi-Encoders for Open-Domain Entity Retrieval

文章提出 TABi(Type-Aware Bi-encoders),用于解决开放域实体检索中的长尾实体召回问题。作者指出,传统基于 InfoNCE 的双编码器容易受到实体流行度偏置影响,即使查询里出现了“team”“play”等上下文线索,模型也可能优先返回更热门的歧义实体。TABi 的核心不是把知识图谱类型当作文本特征输入,而是在对比学习损失中加入类型约束:同类型查询彼此拉近、异类型查询拉远,同时保留原始实体监督并用权重平衡两类信号。实验在 AmbER 和 KILT 上表明,该方法能在维持整体检索性能的同时显著提升稀有实体 top-1 准确率,并且在类型稀疏和类型噪声较高时仍具备一定鲁棒性。文章也说明其边界在于依赖知识图谱类型信号,主要收益集中在实体歧义消解和长尾检索场景。

推荐收录,因为文章给出了从“流行度偏置”到“类型约束对比学习”的完整方法链,并用 AmbER/KILT 的结果证明了对长尾实体的真实增益。适合做开放域实体检索、对比学习和知识增强检索的研究参考,但前提是有可用的类型标注或可靠的类型推断。

科研议题Stanford Hazy Research

An Introduction to Slice Discovery with Domino

这篇文章介绍了 Domino,用于自动发现机器学习模型在验证集上表现很差、但又具有语义一致性的“数据切片”。作者先指出传统做法如整体指标、PR 曲线和人工看错例,很难定位这些被隐藏的系统性错误,尤其在图像等未结构化数据中更难。Domino 采用三步流程:先用 CLIP 这类跨模态表示把图像与文本映射到同一空间,再用考虑标签与预测分布的混合模型寻找错误密集区域,最后生成自然语言描述以便人类快速理解切片含义。文章还提出了一套定量评测框架,通过人为诱导相关性、在多数据集上训练上千个模型来估计切片发现方法的失败率。实验结论显示跨模态嵌入显著优于单模态表示,而同时建模真实标签与预测值的切分算法也更有效;但 Domino 仍会漏掉相当多的有效切片,且在超大规模验证集和交互式分析方面仍有限制。

这篇文章有明确的论文背景、方法流程和量化评测证据,不是泛泛介绍概念;它还给出了跨模态表示、切片建模与失败率评估的可迁移结论。适合做模型诊断、数据集偏差分析和公平性/安全性评估的读者参考,但也要注意其当前方法仍会漏检不少切片。

科研议题Stanford Hazy Research

What can we accomplish without changing the architecture? A thought experiment in incorporating knowledge through data!

文章讨论了一个数据中心的思路:在不改动语言模型架构的前提下,仅通过训练和测试时向样本中插入实体元数据,来增强模型对知识和长尾实体的表达能力。作者把这种方法称为 metadata shaping,核心做法是把实体类别、描述等外部信息显式编码进输入,让基础 LM 直接利用这些信息学习。文章用最大熵和特征选择的视角解释了为什么元数据会帮助模型在未见模式上泛化,并强调这比改造架构更便于分析和部署。实验主要覆盖 OpenEntity、TACRED 和 FewRel 等实体密集任务,结果显示仅使用 BERT-base 也能比强基线提升最多 5.3 F1,且可达到或接近多种知识增强模型。其局限在于依赖元数据质量,且受序列长度约束,但整体说明“改数据”在知识注入问题上可能比“改模型”更稳健。

推荐收录,因为文中不仅提出了明确方法,还给出了在 OpenEntity、TACRED、FewRel 上的对比实验,证明只改数据就能逼近或超过知识增强架构。适合做 NLP、LLM 知识注入和数据中心 AI 的参考,但前提是外部元数据可靠且输入长度允许。

科研议题Stanford Hazy Research

Addressing Hidden Stratification: Fine-Grained Robustness in Coarse-Grained Classification Problems

这篇文章讨论“隐藏分层”问题:在粗粒度分类中,训练数据只给出大类标签,但每个大类内部往往还存在若干语义上不同的子类,模型在总体指标上看似良好,却可能在少数关键子类上严重失效。作者先给出一个层次生成模型,说明类别不平衡和未标注的隐藏属性会如何导致经验风险最小化偏向多数子类,从而放大最坏子类性能差距。基于这一分析,文章提出两阶段框架:先用已训练模型的表示或预训练图像嵌入做无监督聚类来估计子类,再用鲁棒优化/GDRO最小化簇级最坏损失,以提升最差子类表现。实验覆盖 Waterbirds、MNIST、CelebA 和 ISIC,结果显示在不依赖真实子类标签的情况下,方法能显著改善鲁棒性能,并在部分任务上接近使用真实子类标注的上界。文章也指出该方法依赖表示质量,某些数据集上预训练嵌入优于任务内表示,说明子类恢复能力仍是主要边界。

收录理由很明确:文章不仅提出了隐藏分层这一重要问题,还给出可复现的建模、聚类与鲁棒优化流程,并用多数据集实验验证了方法有效性。适合做医疗影像、公平性与长尾分类场景的研究参考,也能迁移到“只有粗标签但担心子群体失效”的模型评估与训练中。

科研议题Stanford Hazy Research

Ivy: Instrumental Variable Synthesis for Causal Inference

这篇文章围绕因果推断中的工具变量(IV)问题,讨论在真实数据里难以找到“完美 IV”时,如何从一组不完美、甚至彼此相关且部分无效的候选变量中合成更高质量的 IV。作者提出 Ivy 框架,将目标 IV 视为潜在变量,先借助图模型与鲁棒主成分分析学习候选 IV 的依赖结构和有效性,再基于已识别的有效 IV 估计潜变量并生成新的合成 IV,最后将其输入 Wald 等现有 IV 估计器完成因果效应估计。文章给出理论分析,讨论了可成功合成的条件、样本复杂度以及无效 IV 或遗漏依赖带来的模型失配。实验部分在孟德尔随机化场景下使用 UK Biobank 的 HDL、CRP 和维生素 D 等例子,显示 Ivy 在消除伪相关上通常比简单的加权/无权 allele score 更稳健,但也明确指出当所有候选 IV 都无效时方法仍会失效。

文中直接给出了 Ivy 的建模假设、两阶段合成流程、理论边界和真实数据验证,不是泛泛科普,而是可复用的研究方法总结。适合做因果推断、孟德尔随机化或弱监督/潜变量结构学习的读者参考,但也要注意它依赖“存在有效 IV 子集”等前提。

科研议题Stanford Hazy Research

When Multi-Task Learning Works -- And When It Doesn’t

这篇文章讨论了多任务学习在异构任务上为何常出现负迁移,并基于 ICLR 2020 的工作给出解释与改进方案。作者指出,是否优于单任务学习,关键不只取决于模型结构,还取决于共享表示的容量、任务数据协方差的对齐程度,以及训练时的优化/重加权策略。文中用示意实验说明:共享模块过大可能使任务互不干扰而失去迁移,过小则会产生破坏性冲突;任务主方向不对齐时,加入协方差对齐模块可提升效果。作者还提出基于 SVD 的任务重加权方法,以缓解标签噪声和任务重要性不均带来的训练偏差。实验在 GLUE 的五个任务上验证了方法有效性,BERT Large 的平均分提升 2.35%,但结论主要适用于共享编码器式多任务训练场景。

文章直接给出负迁移的三个可操作原因,并用 GLUE 与 BERT Large 的实验结果支撑结论,不是泛泛而谈的科普。适合做多任务学习、迁移学习和训练策略设计的长期参考,尤其对需要决定容量、任务配比和表示对齐方式的读者有迁移价值。

科研议题Stanford Hazy Research

Towards Interactive Weak Supervision with FlyingSquid

这篇文章介绍 Stanford Hazy Research 提出的 FlyingSquid,用于弱监督场景下快速学习标签模型。作者将多个噪声标注函数与隐藏真值建模为概率图模型,并利用“三个条件独立视角”的 triplet 关系,通过矩法推导闭式解,避免了传统 SGD 训练带来的高开销和大量超参调节。文章进一步给出采样误差与泛化误差的理论界,并说明即使模型存在一定失配,仍可得到有意义的性能保证。实验显示该方法在视频分析等任务上可比旧框架快数千倍,并支持在线学习与分布漂移适应,但前提是存在足够的条件独立性结构,且依赖关系越复杂,建模难度越高。

推荐收录,因为文章同时给出了弱监督标签模型的核心建模思路、闭式求解机制、理论界和视频/在线学习实验结果,证据完整且可迁移性强。适合做弱监督、标签模型和快速迭代数据编程的参考,但读者也需注意其对条件独立性结构的依赖。

科研议题Stanford Hazy Research

Automating the Art of Data Augmentation

这篇文章是 Stanford Hazy Research 对数据增强研究的总览,讨论其在图像、文本分类和强化学习中的重要性,以及手工启发式增强在组合方式和参数选择上的局限。作者把该领域的进展归纳为三条主线:自动搜索变换函数与组合、从理论上解释增强为何有效、以及把数据增强用于修补模型在特定子群上的性能缺陷。文章强调,自动化方法有望优于人工经验,但搜索空间复杂、增强效果依赖任务与数据分布,因此并不存在通用最优策略。文中还提到系列后续文章与配套代码,说明它更偏研究导览而非单一算法细节。整体适合作为理解数据增强研究脉络、选题方向和方法边界的入口。

推荐收录,因为正文明确梳理了数据增强研究的三类核心问题:自动搜索、理论解释和细粒度质量保证,并给出后续系列与代码入口。适合做研究综述、选题启发或相关论文阅读的起点,能帮助读者把零散增强技巧放回到更完整的方法脉络中。

科研议题Stanford Hazy Research

Automating the Art of Data Augmentation

文章综述了自动化数据增强的几种代表性方法,核心问题是如何在巨大的变换函数空间中高效搜索出比人工经验更优的增强策略。作者先介绍 TANDA:把增强看作由用户定义的变换序列,并通过对抗训练让生成器产出“看起来真实”的增强样本,再用判别器约束其合理性。随后比较 AutoAugment、RandAugment 和 Adversarial AutoAugment:前者直接以验证集精度为目标搜索策略,但代价很高;RandAugment 用随机采样和简化搜索显著降低计算成本;Adversarial AutoAugment 则以对抗式方式联合优化模型与策略,在若干图像分类基准上取得更强结果。文章的结论是,自动化增强确实能超越手工规则,但搜索开销、对代理数据集的依赖以及任务迁移性仍是主要边界。

文中明确比较了 TANDA、AutoAugment、RandAugment 和 Adversarial AutoAugment 的目标函数、搜索代价与基准表现,属于可长期参考的研究脉络梳理。适合关注数据增强、AutoML 和图像分类训练策略的读者,能直接迁移其“效果-算力”权衡框架。

科研议题Stanford Hazy Research

Automating the Art of Data Augmentation

这篇文章回顾了数据增强的理论研究,重点解释“增强为何有效”而不只是“怎么做”。作者先介绍 Dao 等人关于核方法的分析:把数据增强建模为带随机变换的马尔可夫链后,增强等价于对变换后的特征映射做平均,从而提升不变性,并在二阶近似下带来类似方差正则化的效果。随后文章总结 Wu 等人在过参数线性回归中的结果,区分标签不变变换、mixup 以及多种变换组合,说明它们可能补充新信息、缩小预测波动,或产生正负不一的复合效应。基于这些理论,作者提出按不确定性进行随机采样的增强策略,在 CIFAR 和 ImageNet 上优于 RandAugment,并接近 Adversarial AutoAugment,同时训练成本更低。文章的边界也很明确:理论主要建立在简化模型上,对复杂视觉任务中的具体变换效果仍不能完全泛化。

收录价值在于它不只讲经验技巧,而是给出数据增强的理论解释、简化模型下的机制分析,以及由理论反推实践策略的完整链条。适合做机器学习研究、自动增强方法设计和理论入门参考;需要注意的是结论主要来自核方法与过参数线性模型,迁移到复杂深网时仍需实验验证。

科研议题Stanford Hazy Research

Automating the Art of Data Augmentation

文章提出“model patching”框架,目标是用数据增强自动修补部署后模型的缺陷,而不是只在静态任务上追求平均精度。方法分两步:先用类条件 CycleGAN 学习不同子群体之间的语义变换,再用这些增强样本重训分类器。作者进一步设计 subgroup consistency regularizer,并结合类条件 GDRO,让模型在保留类别信息的同时,降低对子群体特有伪特征的依赖。实验在 MNIST、CelebA、Waterbirds 和 ISIC 上表明,该方法能同时提升整体精度与最差子群体鲁棒精度,部分任务中组间性能差距最高缩小 24 倍,ISIC 上鲁棒精度提升 11.7%。其边界在于:方法依赖可学习且语义合理的跨组变换,并且主要适用于已有明确子群体标注的场景。

这篇文章给出了从问题定义、方法设计到多数据集实验验证的完整研究链条,直接讨论了部署模型维护与子群体鲁棒性,证据充分。适合关注数据增强、公平性、鲁棒训练和生成式建模的读者参考,但需要注意它依赖子群体标注和高质量跨组生成。