工程实践 Grab Tech 2026/08/12
文章介绍 Grab 内部构建的 AI 评估框架 Grab Bench,用于在 Grab 业务形态的生产任务上评估模型能力。作者首先指出公开榜单无法捕捉“看似合理实则错误”的失败模式,如 SQL 指标漂移、工具参数错误、证据引用过度和只通过表面测试的代码补丁。框架通过 YAML 配置、任务插件和行级记录,将 SQL 生成、工具调用、多模态判断、乘客画像推理和编码代理等任务纳入统一评估。设计上强调使用合成或脱敏数据保护生产隐私,采用确定性评分器与 LLM 评判结合,并设置反捷径基线、隐藏测试和认证集防止过拟合。文章最后总结失败分类比总分更重要,并指出合成评估不能直接证明生产收益,需结合线上证据。
推荐收录,因为文章展示了真实工程团队如何构建内部 AI 评估系统,从问题定义、任务契约设计、评分策略到数据安全和可复现性均有具体实现和边界讨论。对需要建立模型上线前评估、避免“看似正确”的失败模式或设计 eval harness 的工程师和团队具有直接参考价值,尤其是确定性评分、反作弊基线和失败分类的思路可迁移到多种 AI 产品场景。
工程实践 Salesforce Engineering 2026/07/21
本文详细记录了Salesforce内部AI系统BugWiser的构建过程,旨在将客户缺陷分类和根因分析从超过300人天的手动流程缩短至一周以内。团队面临的核心挑战不是单纯应用AI,而是将多年工程判断编码为一套可信的自动化分类框架。解决方案融合了自定义机器学习模型(用于确定性分类、置信度评分与可解释性)和大语言模型(用于综合上下文和生成摘要),并设计了基于置信度的自动接受与人工反馈闭环,使约90%的预测无需修改。文章还探讨了模型选择、训练、部署及工程文化转变的具体权衡,强调‘信任设计’是该系统的支柱。其边界在于依赖Salesforce内部历史缺陷数据,并需要持续的工程师反馈来保持模型与专家认知对齐。
本文是一个高质量的工程案例,展示了在大型组织内如何通过AI工程化手段解决真实的质量与效率问题。它对面临类似‘专家依赖型’人工流程的团队具有直接参考价值,尤其在如何组合专用模型与通用LLM、如何通过置信度与反馈循环构建工程师信任、以及如何衡量生产力提升等方面提供了可迁移的设计模式。适合负责工程效能、质量保障或AI系统落地的工程师和管理者阅读。
工程实践 Yelp Engineering 2026/07/14
本文介绍了Yelp为统一机器学习模型训练而构建的Training Orchestrator系统。面对多团队使用各自Spark训练脚本、配置分散、代码重复和维护成本高的问题,Yelp核心ML团队在已有特征存储、统一训练库、MLflow等工具的基础上,设计了一套标准化的训练编排层。该平台提供了统一的作业调度、工作流执行和监控机制,将模型训练任务抽象为可复现的流水线,并与Spark和MLflow无缝集成。文章还讨论了系统架构的权衡、对团队效率的提升以及适用范围(主要服务于基于Spark的训练场景)。
推荐收录,因为该文不是泛泛的MLOps概念介绍,而是基于Yelp真实工程需求,详细展示了从分散脚本到统一训练平台的架构演进。文中对训练编排、与现有ML基础设施集成的设计权衡,以及规模化运营的考量,对正在构建或优化内部ML平台的数据与工程团队具有直接参考价值。其可迁移经验包括如何通过平台化手段降低维护成本、提升模型训练的一致性,但需注意其方案强绑定Spark生态。
工程实践 NVIDIA Technical Blog 2026/06/09
文章围绕模型量化后的部署流程,说明如何将 FP8 checkpoint 转换为 NVIDIA TensorRT inference engine,并把“模型优化”与“生产推理”连接起来。核心价值在于展示量化模型进入推理引擎后的落地路径,以及这种做法在吞吐、延迟和 GPU 利用率上的收益。文章的适用边界主要在 NVIDIA GPU 与 TensorRT 生态,以及已具备 FP8 量化能力的模型和工作流。
推荐收录,因为它提供了从量化 checkpoint 到高性能推理引擎的完整工程思路,适合关注模型部署、推理加速和 GPU 资源利用的读者参考。虽然带有明显的 NVIDIA 生态属性,但其中关于量化、引擎生成和性能收益验证的思路具有较强迁移价值。
工程实践 Dropbox Tech 2026/03/17
文章复盘 Dropbox Dash 如何用 DSPy 优化 LLM-as-a-judge 的相关性评分器,使其同时满足人类对齐和生产可用性。作者先把目标定义为:以人工标注为基准最小化 NMSE,并把 JSON 格式正确率纳入硬约束,因为下游管道依赖可解析输出。面对从 o3 迁移到更便宜的 gpt-oss-120b 和 gemma-3-12b,团队用 GEPA 结合人类解释、模型推理和误差方向,自动迭代提示词而非手工重写。结果显示,gpt-oss-120b 上 NMSE 降低 45%,适配时间从 1-2 周缩短到 1-2 天;gemma-3-12b 的无效 JSON 率下降 97% 以上。文章也指出优化易过拟合样例关键词,因此加入了禁止抄写示例内容、固定评分区间等约束,并对高风险生产提示词采用小步增量式改进。
有明确的生产实验、量化指标和边界控制:既比较了不同模型迁移的 NMSE,又验证了输出格式可靠性,直接证明方法可落地。适合做 LLM 评测、提示词优化和 AI 工程化的参考,尤其适用于需要在成本、质量与稳定性之间权衡的场景。
工程实践 Instacart Tech Blog 2026/02/26
本文讲述 Instacart 将 LLM 引入 Shopping Hub 推荐页的早期实践,目标是突破传统“静态内容库+统一排序”在个性化、页面一致性和快速迭代上的限制。作者先比较了自底向上与自顶向下两种生成范式,最终选择分阶段的自顶向下流水线:先生成页面主题与用户意图,再将主题映射为可检索关键词,随后做质量、多样性与业务约束过滤,最后接入既有排序系统。实现上使用了教师-学生微调、RAG、结构化约束解码以及 LLM-as-a-judge 和轻量分类器等多层评估与过滤手段,以控制成本并保证线上安全。文章还总结了将任务拆小、把评估前置、用结构化输入输出提升稳定性的经验。其边界在于当前仍处于早期阶段,效果主要来自离线评估和初步 A/B,尚未完全替代原有推荐体系。
收录价值明确:文章给出了 LLM 介入推荐系统的完整工程链路,包括分层生成、RAG、教师-学生训练和多级评估,且说明了为何放弃单模型端到端方案。适合做 AI 推荐、生成式内容和线上评估体系设计的参考,但需注意它仍是早期实验,结论以初步离线/A/B 结果为主。
工程实践 Instacart Tech Blog 2026/02/17
这篇文章介绍了 Instacart 为 Caper 智能购物车搭建的 Capsight 闭环系统,目标是把门店端产生的多模态数据快速转化为模型迭代能力。作者先指出三类痛点:端侧可观测性不足、真实门店数据覆盖不够、数据清洗标注训练链路过慢,因此设计了 Collect→Manage→Label→Train→Deploy 的数据飞轮。系统由 Collector、Depot、Learner 三部分组成:端侧用触发式采集和硬件编码避免性能回退,云端做数据处理检索与 VLM 预标注,训练侧用 Ray 自动化分布式训练和评测。文章给出量化结果:标注成本预计降低 70% 以上,训练阶段从一周缩短到两天,端到端迭代从约一个月压缩到一周,模型准确率在数周内提升超过 5%。它的适用边界也很明确,主要依赖高价值事件触发、稳定的门店网络与较强的多模态数据基础,后续还需要继续优化触发敏感度、传输成本和跨模态扩展能力。
文中直接给出了端侧采集、云端管理、AI 预标注和分布式训练的完整闭环,还附带了标注成本、训练周期和准确率提升的量化结果,属于可复用的 AI 工程化案例。适合做端云协同、MLOps 和多模态数据管线设计参考,但其触发采集与零售门店场景强绑定,迁移时需重新评估数据价值、带宽和误触发成本。
技术文章 Anthropic Engineering 2026/01/08
本文系统拆解了 AI agents 的评测方法,先给出 task、trial、grader、transcript、outcome 和 harness 等核心定义,说明评测对象不仅是模型,还包括代理脚手架与运行环境。文章重点比较了代码、模型和人工三类 grader,以及能力评测和回归评测的不同目标,并按 coding、conversational、research、computer use 等 agent 类型分别讨论可用的判分方式。作者强调多轮 agent 评测天然存在非确定性,因此应结合 pass@k 与 pass^k 来理解成功率和一致性。文章还给出从零搭建 eval 的实践路线:从真实失败中收集 20-50 个任务、写清晰无歧义的题目、设计平衡样本、构建稳定环境、检查 transcript、防止刷分和饱和。最后指出,长期有效的 eval 需要与生产监控、A/B 测试、用户反馈和人工复核结合使用,才能持续支撑 agent 演进。
推荐收录,因为文章不仅解释了 agent eval 的概念,还给出了可直接落地的任务设计、grader 选择、非确定性度量和长期维护方法。适合正在做 AI agent、LLM 应用或自动化评测的平台/产品团队参考,但需要注意模型判分仍需人工校准,且评测套件要随产品变化持续维护。
工程实践 Lyft Engineering 2026/01/06
这篇文章系统复盘了 Lyft Feature Store 的架构、演进和优化实践,重点解释了如何用统一的特征平台支撑大规模 ML 训练与在线推理。文章把系统拆成批处理、在线服务和流式三条路径:批特征由 Spark SQL+JSON 配置生成 Airflow DAG,在线侧以 DynamoDB 为持久存储、ValKey 作写穿缓存,并为 embedding 引入 OpenSearch。作者进一步说明了特征治理机制,包括版本、血缘、元数据、数据质量检查、Amundsen 可发现性,以及 Kyte 本地开发和 SDK 提升迭代效率。平台演进部分展示了从 Flyte 迁移到 Astronomer、收缩少数边缘能力、增加 staging、数据契约和实时特征抽象的取舍。性能优化则聚焦于缓存现代化、payload 精简、pod 规格调整、重试/超时策略和 TTL 管理,最终把读路径 P95 降低约三分之一。文章的边界在于大量方案高度依赖 Lyft 内部工具链与 AWS 生态,但整体方法论具有较强可迁移性。
文章给出了特征平台从架构、治理到性能优化的完整工程证据,不是泛泛介绍概念,而是包含具体存储选型、缓存策略、DAG 生成和迁移取舍。适合数据平台、ML 平台和基础设施团队参考,尤其可迁移的是“统一接口+分层存储+可观测治理+围绕 P95 做瘦身”的方法。
工程实践 Lyft Engineering 2025/11/18
文章复盘了 LyftLearn 机器学习平台从全量 Kubernetes 离线架构,演进为“离线用 SageMaker、在线继续用 Kubernetes”的混合平台过程。作者先说明原架构虽然在统一基础设施、启动速度和资源定制上表现良好,但随着千级模型和日均数千任务增长,K8s 编排、状态一致性、集群容量管理和故障排查带来了明显的特征税。迁移的核心原则是替换执行引擎而不改用户 ML 代码,因此团队构建了兼容层,补齐凭证注入、环境变量、指标、超参数、镜像和 Spark 网络等差异。文中还介绍了用 EventBridge/SQS 取代后台 watcher、用 SOCI 和 warm pool 缩短冷启动、以及在 SageMaker Studio 与 EKS 间打通 Spark 双向通信的具体做法。最终结论是:对离线计算,托管服务能显著降低运维复杂度和总拥有成本;对在线服务,已有 K8s 方案在延迟和控制力上仍更合适,平台演进应按工作负载分别选择方案。
推荐收录,因为文章给出了从 K8s 迁移到 SageMaker 的完整工程证据:原始复杂度、兼容层设计、冷热启动优化、网络打通和分阶段迁移策略都写得很具体。适合做 ML 平台、基础设施和架构权衡的参考,尤其对需要在“自建 vs 托管”之间做决策的团队有直接迁移价值。
工程实践 Instacart Tech Blog 2025/11/13
文章复盘了 Instacart 用 LLM 重构 Query Understanding 的全过程,目标是提升购物搜索中长尾、口语化和歧义查询的意图识别能力。作者先指出传统方案依赖噪声标签、多个独立模型和碎片化流水线,难以同时兼顾召回、精度与维护成本。新方案以 LLM 为核心,分三层推进:用 RAG 和提示工程注入类目、转化等业务上下文,用后处理 guardrails 约束幻觉和类目偏差,再对关键场景做 LoRA 微调,把领域知识固化到小模型里。文章分别展示了类目分类、query rewrite 和 SRL 三个任务的改造方式,尤其强调“teacher 生成离线高质量数据 + student 承担实时长尾推理”的混合架构。最终他们在 8B 模型上达到接近大模型的 F1,并通过缓存、H100、adapter merge、量化取舍和 autoscaling 把延迟压到约 300ms,证明该路线既能提升搜索质量,也能控制成本,但前提是业务上下文足够丰富且可被持续治理。
收录依据很明确:文章不仅讲了 LLM 替代传统 QU 的思路,还给出了 RAG、guardrails、微调、缓存与延迟优化的完整落地链路,以及精度/召回/成本的结果。适合做搜索、推荐或垂直场景 LLM 工程的参考,尤其对需要处理长尾查询和实时推理约束的团队有直接迁移价值。
科研议题 Stanford Hazy Research 2023/04/20
这篇文章讨论 ChatGPT 时代的 AI 竞争重心如何从“模型”转向“数据”,核心判断是通用基础模型会逐步标准化,而真正稀缺的资产将变成企业与用户交互过程中沉淀的数字痕迹。作者认为,随着开源模型和可复用训练配方普及,训练同等级模型的门槛下降,下一阶段的壁垒不在更大参数量,而在如何选择、清洗、验证并低成本利用私有数据。文章进一步提出“GPT-You”和“EnterpriseGPTs”的趋势,预测 copilots 会渗透邮件、设计、数据管道、财务等流程,并推动“先验证、再构建”的软件交付方式。结尾强调,幻觉、缺失数据和结构化数据高精度建模仍是难点,因此数据质量、验证工具和数据炼制能力会重新变得关键。整体判断具有较强方向性,但明显带有趋势推演和观点表达色彩,部分结论仍依赖作者对行业演化的乐观预期。
文章直接围绕基础模型开源化、企业数据资产价值和数据炼制工具展开,给出了可验证的行业判断,而不是泛泛谈论大模型热点。适合关注 AI 平台、MLOps、企业智能化和数据战略的读者参考,但需要注意其结论偏趋势研判,更多是方向启发而非实证研究。
科研议题 Stanford Hazy Research 2020/10/13
文章讨论了机器学习系统正在从单纯提升模型效果,转向重塑应用构建方式这一趋势。作者以编译器、数据库和操作系统的发展为类比,指出现有 ML 工具虽然极大提升了建模和部署效率,但在监控、生命周期管理、跨角色协作、端到端数据流调试等方面仍明显不足。文章进一步提出,下一代 ML Systems 需要把训练、数据生产、模型管理和部署运维视为一个整体来设计,而不仅是若干独立工具的拼接。文中还举出 Google、YouTube、Apple、Uber 等工业实践,说明这一方向已有初步落地,但整体仍处于早期探索阶段,更多是研究议程而非成熟方案。
收录价值在于它清晰提出了 ML Systems 作为独立方向的核心问题:工具链成熟后,瓶颈转向生命周期、数据管道和协作治理。适合做研究选题、课程引入或系统设计的背景材料;但它偏宏观综述,缺少具体算法与实验细节,不能当作实现指南。
科研思考 Stanford Hazy Research 2020/02/28
文章回顾了 Snorkel 团队围绕 data programming 与 weak supervision 的四年实践,核心判断是:深度学习模型本身正在商品化,真正的瓶颈正从“建模”转向“如何组织训练数据和监督信号”。作者总结了该方法在工业界和医疗等场景的传播,也强调它让领域专家能够更直接地参与机器学习系统构建。随后文章进一步指出,数据标注只是模型生产的一环,数据增强、观测式监督、模型验证、隐藏分层和嵌入表示等问题仍缺少系统方法。整体上,它是一篇面向数据中心机器学习与弱监督方向的阶段性反思,兼具实践总结和研究议题提出的价值。
推荐收录,因为文章直接基于 Snorkel 的落地经验,总结了弱监督从概念到应用的证据,并明确提出了后续值得研究的几个问题。适合关注数据中心机器学习、模型上线维护和研究选题的读者,但它更偏方向性反思而非完整方法论文。