Architecture

177 篇内容

技术文章Phil Eaton - databases

Let's build a distributed Postgres proof of concept

本文通过约600行Go代码构建了一个分布式Postgres概念验证,解释了CockroachDB背后的核心组件:Postgres线协议、SQL解析、Raft共识和存储层。作者使用pgproto3、pg_query_go、Hashicorp Raft和bbolt,实现了CREATE TABLE、INSERT通过Raft复制到各节点,SELECT在任意节点本地执行。文章演示了多节点启动、通过HTTP手动加入集群、故障切换和重启后数据一致性。同时指出方案仅支持少量SQL、快照被禁用、日志重放效率低、JSON存储不高效,并且只实现了复制而非分片或跨分片事务。这个教程展示了如何将成熟库组合成可运行的分布式系统骨架,适合理解分布式数据库基础结构。

推荐收录,因为文章以可运行代码完整演示了分布式Postgres的核心机制:用Raft复制写操作、本地执行读操作,并明确说明了简化与局限。适合想理解CockroachDB等NewSQL系统底层组成或动手实现分布式数据库原型的读者。其将成熟库组合为可扩展骨架的思路、无快照设计取舍和故障切换验证过程具有可迁移价值,但需注意SQL支持和性能远非生产级。

技术文章Phil Eaton - databases

How do databases execute expressions?

文章调查了 Cockroach、ClickHouse、DuckDB、PostgreSQL、SQLite、MySQL/MariaDB、MongoDB、TiDB 等系统如何执行查询表达式。作者通过阅读核心源码并以控制流函数为判断依据,区分了树遍历解释器、栈/寄存器虚拟机和 JIT 编译三类实现。结论显示多数数据库仍采用树遍历解释器,PostgreSQL 与 SQLite 使用虚拟机,MongoDB SBE 为栈式虚拟机,部分系统支持 JIT;ClickHouse、DuckDB、TiDB、Cockroach 还采用向量化执行。文章认为向量化和 JIT 更契合列存分析负载,事务系统迁移到编译器架构的收益未必显著;局限是结论来自源码阅读,可能存在误判且缺少性能基准。

本文通过大量数据库源码调查,给出了表达式执行模型的一手判断,具有长期技术索引价值。适合数据库内核开发者、查询引擎研究者以及想理解解释器与虚拟机差异的读者。其源码判断方法可直接迁移到其他系统,但需注意结论为静态阅读而非基准验证。

工程实践LinkedIn Engineering - Architecture

Rebuilding messaging: How we designed our new system

文章复盘LinkedIn消息系统从邮件式单体架构到全新架构的设计阶段。旧系统最初使用单一Oracle数据库和分片复制,消息量五年增长四倍后,产品向聊天体验演进但代码复杂度剧增,导致开发效率下降。作者提出产品与工程需求,特别强调迁移自定义业务逻辑需要近60个转换器,并决定将数据持久化拆分到多个服务以独立扩展,同时接受分布式事务代价。团队通过高层架构文档、设定设计原则和赋权技术负责人并行推进,制定正确性优先、构建正确、再求快等原则。文章还总结了迁移策略、异步处理、团队结构和项目组织方面的经验教训,但未深入具体实现细节。

推荐收录:这是LinkedIn真实消息系统重构的工程案例,包含从单体到分片再到新架构的演进、明确需求和设计原则,以及迁移与团队组织的教训。适合架构师、后端工程师和技术负责人参考大型系统重新设计、跨团队协作和数据迁移的可迁移方法。

工程实践LinkedIn Engineering - Architecture

Rebuilding messaging: How we bootstrapped our platform

文章复盘 LinkedIn 重建消息平台时的存量数据迁移过程。旧系统单体且数据非规范化,共享内容与个人元数据冗余存储;新系统改为规范化微服务,将共享消息与个人元数据分离。迁移采用三阶段方案:先双写实时复制新写入,再通过确定性 UUID v5 生成新旧 ID 映射,最后对 17 年快照做 Hadoop ETL、变换和批量上传。文章重点介绍了阴影验证机制、基于 If-Unmodified-Since 避免覆盖在线更新,以及表索引数量影响上传吞吐等经验。整体展示了大规模在线数据迁移中可迁移的架构权衡与实施细节。

推荐收录:文章提供了 LinkedIn 超大规模消息系统数据迁移的完整工程案例,包含三阶段方案、双写一致性、离线变换与阴影验证等具体实践。对负责数据库迁移、分布式一致性和后端架构的读者具有直接参考价值,尤其展示了复杂在线系统零停机迁移的可操作方法。

工程实践LinkedIn Engineering - Architecture

How LinkedIn Is Using Embeddings to Up Its Match Game for Job ...

文章来自 LinkedIn Engineering,系统介绍了利用嵌入检索(EBR)技术提升求职匹配的工程实践。作者首先解释了嵌入和 EBR 的基本概念,及其在搜索和推荐系统中的早期检索阶段作用。随后详细描述了 LinkedIn 为此构建的基础设施组件:支持复合多任务学习的模型训练框架、名为 Feature Cloud 的离线和流式嵌入生成平台、增强的托管搜索系统(包含自动嵌入版本管理和 IVFPQ 等近似最近邻算法),以及基于 Ray Serve 的 Model Cloud 推理图编排。在 Job Search 应用中,团队采用两塔模型和 softmax 损失训练请求与职位嵌入,并通过 Zelda 框架进行 IVFPQ 索引和在线近似搜索。上线后观测到申请数、点击率和成功会话等参与度指标显著提升,同时简化了原有文本检索并降低了 p95 延迟。文章重点在工程架构和实际落地经验,边界是未深入模型理论细节,更多展示系统设计和版本管理方案。

推荐收录,因为这是一篇来自一线大厂的完整工程案例,详细展示了在规模化搜索场景中引入 EBR 的架构设计、模型训练、版本管理和在线服务方案,并给出了明确的业务收益。对搜索引擎、推荐系统、机器学习平台和基础设施团队具有直接参考价值,尤其是嵌入版本一致性管理、流式嵌入生成和复合模型推理编排等实践可以迁移到类似系统中。

工程实践LinkedIn Engineering - Architecture

From Lambda to Lambda-less: Lessons learned

文章记录了 LinkedIn 的 “谁看过你的个人资料” 功能从 Lambda 架构迁移到 Lambda-less 架构的工程实践。原架构以近线 Kafka 处理为速度层、Hadoop MapReduce 为批处理层、Pinot 为服务层,但双管道导致业务逻辑重复、维护成本高和 bug 风险增加。迁移后,团队采用 Samza 作业统一处理 ProfileViewEvent 和 NavigationEvent,移除与流处理重叠的离线逻辑,仅保留一个离线作业将实时数据复制到离线表以优化查询性能和数据保留。文章重点讨论了流式处理中的消息可重处理性与去重策略,包括分场景修复错误、Kafka offset 回退,以及在服务层和通知层去重。最终,该迁移使开发速度翻倍、维护开销减半,并改善了用户体验,为面临类似架构冗余的团队提供了可参考的经验。

推荐收录,因为这是一篇真实的架构演进案例,详细展示了 Lambda 架构的实际痛点、简化决策过程以及流式处理中非幂等问题的应对方法。文中对 Samza、Pinot 的选型理由和去重策略有具体描述,对从事数据管道设计、流/批处理和分布式系统演进的后端工程师极具参考价值。需要注意的是,方案的选择与业务实时性要求紧密相关,直接照搬需评估自身场景。

工程实践LinkedIn Engineering - Architecture

How we reduced latency and cost-to-serve by merging two systems

本文介绍 LinkedIn 将身份服务中的 midtier 和 data service 两层合并为一个服务的实践。原架构中 data service 仅提供数据验证和 Espresso 存储访问,业务逻辑薄弱但维护成本高,且增加网络跳数。团队在保持对外 API 不变的前提下,先将 data service 的 REST API 作为本地库嵌入 midtier,随后通过 T-REX 框架逐步灰度、下线旧服务并清理技术债。性能测试使用 Dark Canary 复制生产流量对比,结果显示 p50、p90、p99 延迟分别降低 14%、6.9%、9.6%,内存分配率下降 28.6%。最终下线整个 data service 集群,节省超过 12000 核和 13000GB 内存。文章强调这是针对特定场景的权衡,并非所有微服务都应合并。

推荐收录,因为文章提供了完整的工程案例:从问题动机、架构决策、灰度实施到性能验证,数据详实。直接证据包括 p50/p90/p99 延迟改善、内存分配下降和资源节省。适合关注微服务粒度、性能优化和成本控制的架构师与后端工程师。可迁移价值在于展示了当数据服务逻辑薄弱时合并服务的考量方法,以及利用灰度发布和流量镜像降低高风险变更的实践。

工程实践LinkedIn Engineering - Architecture

Costwiz: Saving cost for LinkedIn enterprise on Azure

LinkedIn 工程团队开发 Costwiz 以控制 Azure 云成本。系统摄取 Azure Advisor 的优化建议,通过状态机管理工单生命周期,并利用可插拔框架和工作流实现自动化。数据平台基于 ETL 架构,采用 Azure Data Factory、Databricks 和多种存储,支持资源所有权识别与清理沙箱资源。关键设计包括逐级升级机制、所有权识别模块和基于 TTL 的沙箱清理。实践表明,约 36% 的建议资源被回收,沙箱订阅成本占比从 45% 降至 5%。文章还指出,真正的挑战在于推动工程师采取行动而非仅生成建议,并总结了权限识别和数据水印等方案取舍。

推荐收录。文章详细还原了 LinkedIn 在 Azure 上构建 Costwiz 的全过程,包括工作流状态机、可插拔框架、数据平台、资源所有权识别和升级机制,并给出了成本节省的具体数据(沙箱成本从 45% 降至 5%)。其适用于云基础设施团队、SRE 和成本管理人员,其中关于责任落实、自动化清理和渐进式升级的设计具有跨云平台的可迁移价值。

工程实践LinkedIn Engineering - Architecture

Rebuilding messaging: How we built for extensibility

文章是 LinkedIn 工程师对重建消息平台时如何设计可扩展性的复盘。作者首先明确了要解决的问题:保护收件箱质量、成员隐私以及将业务逻辑从平台剥离。文章核心方法是引入插件框架,在消息和会话的生命周期中定义 pre/post 回调(如 conversationPreCreate、messagePreCreate),插件通过注册这些回调并附加自身元数据来实现定制逻辑,平台只负责存储和投递,不解析插件元数据。文中还介绍了插件失败隔离、延迟要求、安全审查和分阶段发布等稳定性措施。作者通过一个邀请功能的例子展示了插件如何快速迭代,并分享了元数据契约设计的一次教训:从允许删除改为只允许增改,以简化插件开发并降低平台风险。文章结论强调可扩展性设计需要前期分析用例、明确原则,并建议用简单和复杂两个试点来验证系统。

推荐收录,因为文章提供了一套可复用的平台扩展性设计方法:插件框架、生命周期回调、元数据隔离和失败隔离,并包含真实的契约设计教训。适合从事平台工程、消息系统或微服务架构设计的工程师参考,文中的原则和权衡可直接迁移到类似需要第三方扩展的系统设计中。

工程实践LinkedIn Engineering - Architecture

Unifying Messaging Experiences across LinkedIn

本文介绍LinkedIn如何通过内部Messenger SDK统一旗舰、Recruiter、Sales Navigator等多个应用的消息体验。文章回顾了后端消息平台的建立,指出前端开发因缺少共享UI和数据层而困难。作者详细说明了SDK架构:API库(messenger-api)提供GraphQL抽象、错误检查和回调接口定制;客户端库(messenger-data)采用事件驱动数据层,包含Store、Mailbox API、Reactive Adapter、Realtime Manager和API连接层,实现本地数据同步和响应式更新。文中以InCareers为例,展示SDK节省40+开发周、代码量降至1/8的收益。最后总结迁移成果并规划可复用UI组件。文章主要呈现LinkedIn内部平台化实践,未深入底层实现或失败教训,但提供了可借鉴的架构思路。

推荐收录,因为文章不是泛泛介绍,而是给出了完整的SDK架构设计、数据同步机制、回调扩展点以及真实项目收益数据。适合架构师、跨平台开发者和平台工程团队参考,其‘薄层应用+平台库’的模式可迁移到多应用共享核心能力的场景,对大型组织统一前端能力和提升开发效率有长期借鉴价值。

工程实践LinkedIn Engineering - Architecture

Navigating the transition: adopting Azure Linux as LinkedIn’s ...

本文复盘了 LinkedIn 将服务器、虚拟机和容器从 CentOS 7 迁移到 Azure Linux 的完整历程,包括动机、规划、实施、挑战和效果。迁移核心动因是 CentOS 7 生命周期结束和业务对现代安全、性能及 AI 功能的需求,同时考虑了成本、合规和供应商支持。实施过程涵盖基础设施准备、容器镜像构建、开发者 VM 改造、配置管理适配和自动化迁移,重点解决了 XFS 文件系统调优、硬件驱动签名和开发者远程环境等难题。迁移后引导时间从1小时缩短至10-30分钟,安全性、部署速度和系统可靠性显著提升,文章还讨论了监控体系升级和反馈闭环。该案例适用于大型企业基础设施现代化场景,文中经验和方法具有可迁移性。

本文提供了大型互联网公司操作系统迁移的第一手工程实践,详细描述了从需求评估、试点到全量迁移的完整路径,包含具体技术挑战和解决方案(如容器镜像兼容、驱动签名、开发者环境),对于负责基础设施升级、云计算平台迁移或 DevOps 实践的工程师极具参考价值。适合企业架构师、SRE、系统管理员和云平台团队借鉴其迁移策略和自动化方法。

工程实践LinkedIn Engineering - Architecture

Journey of next generation control plane for data systems

文章介绍LinkedIn数据基础设施控制平面Nuage的演进,从1.0单体自服务、2.0去中心化SDK到3.0以Nuage Resource Manager为中心的架构。3.0将横向控制平面能力与资源提供方业务逻辑解耦,通过API与数据模型契约、RBAC、搜索缓存、审计、异步工作流等实现统一治理。文中详述客户端交互、请求路由、数据治理与MCE联动、监控告警以及横向服务。并给出性能提升(如Espresso读P90从10秒降至3秒以下)、安全改善和MySQL接入成本降低70%等量化结果。适用边界是LinkedIn内部多平台环境,偏重架构与运营模式,未涉及具体代码实现。

推荐收录,因为文章不是概念介绍,而是完整呈现从单体到去中心化再到集中式资源管理器的工程演进,包含明确的架构约束、安全与性能权衡,以及70%接入成本降低、P90延迟改善等可验证数据。适合平台工程、数据基础设施和SRE团队参考,其资源提供者契约、RBAC、审计与异步工作流设计可迁移到类似控制平面系统,主要风险是LinkedIn内部细节较多,需结合自身规模判断。

工程实践LinkedIn Engineering - Scalability

How LIquid Connects Everything So Our Members Can Do Anything

本文介绍 LinkedIn 自研图数据库 LIquid 如何支撑其经济图谱(2700 亿条边、200 万 QPS)的实时访问。文章以 People You May Know 功能为例,说明从遗留系统 GAIA 迁移到 LIquid 的架构:用声明式 Datalog 查询做图遍历,再由 Venice 和 Pinot 提供特征与排序。迁移后 QPS 从 120 提升到 18000,延迟降到平均 50ms 以下,CPU 降低 3 倍以上,并支持更细粒度、可解释的推荐和快速 A/B 实验。作者也指出当前同质化架构在数据规模扩大时的低效问题,以及未来分层存储与工作负载优化的方向。

文章以真实生产系统为例,提供了从离线批量到实时图查询的完整迁移路径和可量化性能结果,证据具体、架构清晰。适合关注大规模图数据库、实时推荐或高并发基础设施的工程师借鉴,其关于声明式查询、索引优化和成本控制的方法具有跨团队可迁移价值。

工程实践LinkedIn Engineering - Scalability

Introducing Northguard and Xinfra: scalable log storage at Lin...

文章介绍 LinkedIn 为替代 Kafka 而自研的可扩展日志存储系统 Northguard,以及其上的虚拟化发布订阅层 Xinfra。Northguard 通过分段、范围、主题的数据模型,基于 Raft 的动态分片元数据状态机(DS-RSM)和 SWIM 去中心化成员协议实现高可扩展性与可运维性。核心设计是以段为复制单元的日志条带化,自然均衡负载、避免资源倾斜,并论证范围模型相比固定分区能减少流处理中的 shuffle。评测对比显示 Northguard 在元数据可扩展性、集群数量、负载均衡、自愈、一致性和持久性上均优于 Kafka,且通过 Xinfra 虚拟化和双写实现了透明迁移。文章主要面向大规模日志存储和分布式系统工程,技术细节以高层设计为主,缺少底层实现参数和故障恢复的深入展开。

本文来自 LinkedIn 真实生产环境,规模达 32T 记录/天、17PB/天,详细展示了从 Kafka 迁移到自研系统的完整工程决策与权衡,包括数据模型、复制单元选择、元数据分片和虚拟化迁移。适合分布式存储、基础设施和架构师参考,尤其关注日志存储、自动负载均衡和大规模系统演进。其可迁移价值在于以细粒度分段替代整日志复制来改善可运维性和可用性的思路,但读者需注意文章未公开具体实现代码和完整故障处理细节。

工程实践LinkedIn Engineering - Architecture

Open Sourcing iris-message-processor

文章介绍了 LinkedIn 开源的新组件 iris-message-processor,用于替换原有 Iris 事件管理系统中单 leader 的 Python 子进程 iris-sender。旧架构串行处理消息、依赖 Galera 强一致数据库作为消息队列,在高负载下出现延迟激增和复制死锁。新服务用 Go 编写,采用分布式 bucket 动态分配,节点可水平扩展,数据库不再充当队列。压测显示高负载下性能提升约 86 倍,6000 条突发消息处理时间从近 30 分钟降至 10 秒内,节点失效后 30 秒内自动重平衡。该组件已生产运行一年无中断,并与现有 Iris-api 保持兼容,支持渐进式切换。

推荐收录,因为文章提供了从单点瓶颈到分布式架构的完整演进案例,包含明确的问题定位、设计取舍、压测数据和生产验证。对负责高吞吐消息处理、事件驱动系统或 on-call 基础设施的工程师有直接参考价值,特别是水平扩展、去数据库队列和渐进式上线策略可迁移到类似场景。

工程实践LinkedIn Engineering - Scalability

Accelerating LinkedIn’s My Network tab by reducing latency and...

文章复盘了LinkedIn My Network页面加载缓慢和内容跳动的问题,旧架构中移动端与Web端并行请求多个API,独立渲染不同推荐区块,导致首屏等待近两秒并出现UI闪烁。作者团队将多端点统一为单一API并引入分页,把无限滚动的PYMK拆成多个小cohort,预构建后放入缓存,后续按页获取;同时采用渲染模型,由API定义通用banner和内容容器,减少客户端业务逻辑。优化后P90延迟下降43%,成本节省七位数,Web端LCP和FID显著改善,会员参与度提升。文章未深入讨论缓存一致性、失败处理和更复杂个性化场景,但提供了可工程迁移的架构权衡。

推荐收录,因为文章给出了完整的性能优化工程案例:从多端点并行到统一API、分页和预构建缓存,再通过渲染模型简化客户端,并用量化指标验证收益。适合后端、前端及系统设计工程师参考,其中缓存设计、API收敛和渲染模型解耦的思路可直接迁移到类似推荐流或内容聚合页面的优化中。

工程实践LinkedIn Engineering - Scalability

FishDB: a generic retrieval engine for scaling LinkedIn’s feed

文章介绍了 LinkedIn 用 Rust 构建的通用检索引擎 FishDB,替换了运行近十年的 Java 系统 FollowFeed。文章首先分析了旧系统的局限:Java 对象内存开销大、GC 导致高尾延迟、数据模型僵化且业务逻辑耦合,限制了推荐系统的扩展和迭代。随后解释了选择 Rust 的原因,并通过对比实验展示 Rust 在内存效率上的显著优势。FishDB 采用 scatter-gather 架构和 lambda 架构,提供了灵活的命令式查询语言和多种索引结构,包括倒排索引、前向索引、引用索引和基于 RocksDB 的属性存储,以支持图状数据模型和高效过滤排序。迁移采用分层渐进方式,通过 JNI 桥接保持 API 不变,实现了零中断切换,最终取得 2 倍效率、减少 50% 硬件、p99 延迟 40ms 的成果,并将实验周期从数周缩短到数天。文章也指出当前查询语言仍为命令式,未来计划引入声明式语言和向量搜索。

本文是一份高度完整的工程案例,从问题诊断、技术选型、系统架构、索引设计到灰度迁移提供了详实细节和量化结果,展示了如何用内存安全的高性能语言重构大规模检索基础设施。适合负责推荐系统、搜索引擎、分布式存储或性能优化的工程师阅读,可迁移的经验包括内存数据结构设计、Rust 在服务端的应用模式、分层迁移策略以及如何平衡灵活性与性能。

工程实践LinkedIn Engineering - Scalability

Engineering LinkedIn's job ingestion system at scale

本文复盘了LinkedIn职位摄取系统的设计,该系统每日处理数百万职位、超20TB原始数据。文章先梳理异构源、传输协议、安全、数据新鲜度等挑战,再介绍模块化事件驱动流水线和Job Intake、Job Processing Pipeline两大阶段。重点阐述Job Pull的orchestrator与专用Mining Node分离、抽取逻辑配置化、AI辅助Sitemap创建,以及基于START/JOB/END状态机的Mining Task和优先级队列。处理层通过静态/动态Job Field Processor和pre/mid/post三层实现清洗、增强与校验,并通过multiplexing生成衍生职位。文章以配置驱动扩展、上游背压和让用户掌控平台为关键经验,但偏高层架构,未深入具体实现与性能数据。

收录的直接证据在于文章展示了从异构数据摄取到标准化处理再到发布的全链路架构,包括orchestrator/worker分离、配置驱动抽取、优先级队列和动态处理器等可迁移设计。适合分布式系统、数据平台或集成工程师借鉴,尤其对需要快速接入多源数据、控制上游负载和将定制能力下放给非工程团队的系统有启发。风险是偏高层描述,缺少细粒度实现和量化验证,但整体技术深度满足长期参考要求。

工程实践LinkedIn Engineering - Scalability

Modernizing the LDAP and Kerberos infrastructure that secures ...

文章详细介绍了LinkedIn为保障Hadoop集群安全而对其LDAP/Kerberos基础设施进行的现代化改造。旧架构存在单点故障、手工运维繁琐、缺乏测试环境等问题,团队构建了全新的多主复制集群,通过四主节点星型复制、三hub冗余、HAProxy负载均衡和自动故障转移消除了单点故障,并将部署、证书刷新等操作集成到标准部署栈中实现自动化。迁移过程采用先读后写、跨集群复制同步、延迟监控和1分钟TTL的DNS切换,实现了零事故切换和可回滚。文章还说明了GSS-API与负载均衡结合的DNS约束,以及避免双写的一致性考量,适用于大规模分布式系统认证基础设施的演进参考。

推荐收录,因为文章提供了完整的大规模LDAP/Kerberos基础设施迁移案例,包含真实的单点故障痛点、多主复制架构设计、自动化运维改造和零停机迁移方法,证据具体且可迁移。适合负责安全认证、分布式系统高可用或基础设施现代化的工程师参考,特别是面对类似目录服务、Kerberos或负载均衡部署的团队。

工程实践SelectDB 技术分享

秒级弹性、最高降本 70%:SelectDB Serverless 如何重塑云数仓资源效率 阿里云 SelectDB Serverless 可实现资源按需供给与按使用量计费,在负载高峰时补齐资源,...

文章讨论云数仓资源管理中长期存在的矛盾:业务负载波动大,固定规格资源常按峰值锁定,导致平均利用率低;传统存算分离架构弹性慢,扩容伴随缓存预热和数据重分布,容易引发查询延迟抖动。作者提出 SelectDB Serverless 的解决方案,通过计算、缓存、存储三层独立解耦,支持秒级原地纵向伸缩,单集群最高16倍弹性区间,并采用“扩快缩慢”策略——CPU 5秒均值或内存瞬时利用率超过60%触发扩容,CPU与内存同时低于30%且持续1分钟才渐进缩容,同时引入AI辅助决策。文章还给出选型参考:峰谷特征明显、可释放计算资源超过28%时Serverless才具成本优势;纵向弹性有16倍边界,极端场景需横向伸缩约3分钟。内容主要基于产品设计与机制说明,缺少独立用户验证数据。

推荐收录,因为它不只是产品宣传,而是提供了具体的弹性架构设计:三层资源解耦、扩缩容触发阈值、原地纵向伸缩机制和选型成本阈值,对云数仓、Serverless 或弹性架构设计的读者有直接参考价值。可迁移的是“扩快缩慢”的弹性策略和计算/缓存/存储解耦思路;需注意其厂商视角,部分性能数据未经独立验证。

技术文章SelectDB 技术分享

Apache Doris 4.1 Spill to Disk:避免运行内存密集型查询发生 OOM Apache Doris 4.1 的 Spill to Disk 是一套深度融合了内存预留、智能调度、压力感知的现代化...

文章系统解析了 Apache Doris 4.1 的 Spill to Disk 机制,用于避免哈希关联、聚合、排序等内存密集型查询触发 OOM。核心增强包括核心算子全覆盖、递归重分区应对数据倾斜,以及基于内存压力感知的主动落盘触发。文章详细说明了由控制层、算子层、基础设施层和内存管理层组成的统一架构,以及预留、暂停、落盘、恢复四阶段流程。针对 Hash Join、Aggregation、Sort 分别给出了化整为零、临时状态落盘和外部归并排序的具体实现策略。基准测试显示,在单 BE 16GB 内存下运行 TPC-DS 10TB 查询,复杂查询全部完成且内存被控制在 8GB 以内,部分场景落盘数据量超过 1000GB,验证了以磁盘 I/O 换取内存空间的可行性。当前 Intersect/Except 算子暂不支持直接 Spill,需要通过等价 Join 改写。

推荐收录,因为文章不仅介绍功能,还深入解释了内存压力感知、算子级落盘策略和统一架构设计,并给出了可验证的基准测试数据。对从事数据库内核开发、性能调优或超大规模分析查询的读者具有直接参考价值,其“预留-暂停-落盘-恢复”的资源控制方法和外部归并排序等思路也可迁移到其他内存受限的查询引擎中。

工程实践TiDB 社区博客 - 实践案例

稳住大考阅卷高并发!学科网数据库架构的平滑演进与实践

文章复盘学科网阅卷系统从 MySQL 迁移到 TiDB 的实践,背景是业务具有峰谷特征、单机 MySQL 主备集群出现容量与性能瓶颈,同时研发资源有限无法改造代码。作者详细说明选型 TiDB 的关键理由:高度兼容 MySQL 实现零代码迁移、在线 DDL 不阻塞业务、弹性扩缩容适配流量波动、Raft 多副本保证数据强一致。迁移采用分批策略,优先将大表和主从延迟严重的表迁入,收益包括缓解并发压力、消除切换数据不一致风险、节省磁盘空间并避免分库分表改造。文中还总结了扩容规划、小表热点处理、低峰版本升级和索引优化等运维经验。该方案尤其适合教育行业等需要兼容 MySQL 且短时高并发的场景,但需注意跨 AZ 缩容的数据分布和热点小表的处理。

推荐收录,因为文章提供了真实业务约束下的数据库选型、迁移和运维全过程,包含零代码改造、在线 DDL、强一致、扩容规划、小表热点等具体细节,不是泛泛的技术宣传。适合数据库架构师、SRE 以及教育行业技术负责人参考,其“先兼容迁移、争取时间”的平滑演进思路可迁移到其他受限于 MySQL 单机瓶颈且短期无法大改代码的团队。

工程实践JuiceFS 工程技术

GPFS vs. Alluxio vs. JuiceFS: Architecture and Use Cases Compared

本文系统比较了GPFS、Alluxio和JuiceFS三种存储系统在AI工作负载下的架构与适用场景。作者首先梳理了自动驾驶、LLM训练、多模态、计算平台、量化金融和AI代理等场景的I/O特征与存储挑战。随后深入分析GPFS的元节点和分布式令牌锁机制,说明其强一致性与高性能依赖稳定网络和硬件,运维复杂;JuiceFS采用元数据与数据分离架构,结合对象存储实现弹性和成本优势。性能测试显示GPFS在高并发随机读写和顺序写方面领先,JuiceFS在低深度随机读和写回缓存下有竞争力。对Alluxio与JuiceFS的比较则突出透明缓存层与完整文件系统的定位差异。文章来自JuiceFS官方,存在厂商视角,但提供了具体测试数据和架构权衡,适合存储选型参考。

推荐收录,因为文章详细对比三种主流AI存储系统,包含具体性能测试数据和架构机制解析,而非单纯产品宣传。适合从事AI基础设施、存储选型、分布式系统设计的工程师和架构师参考。可迁移价值在于提供了评估存储系统的维度:I/O模式、一致性、缓存策略、成本与运维;主要风险是厂商立场可能对自家产品有所偏重,阅读时需结合独立评估。

工程实践知乎 - SmartCode 得物技术

得物知识问答:复合检索 Agent 的系统设计实践

文章系统介绍得物知识问答产品的复合检索 Agent 设计实践。作者基于 AgentScope 2.0 HarnessAgent,利用 ReAct 循环、Middleware 和并行工具调用,构建多源并行检索流程,融合企业知识库与个人飞书文档、消息、妙记数据,并通过权限注入实现数据隔离。检索质量上,采用查询扩展生成自然语言变体,并设计 FastPass、Reranker、LLM Grading 三阶段过滤 Pipeline,解决向量相似不等于语义相关的问题。系统还支持图片多模态输入、自动模型切换,以及多实例 SSE 断点续传和模型容灾,提升生产可靠性。文章最后总结六个创新点,并展望精细化检索策略和个人知识助手方向;当前方案依赖企业内部知识管理平台和飞书生态,长期记忆能力尚未启用。

推荐收录,因为文章并非泛泛介绍 RAG 套壳,而是给出了基于 AgentScope 的自主决策检索系统完整工程方案,包含多源并行检索、三阶段质量过滤、多模态输入和生产级 SSE 断点续传等关键设计,并附有代码片段和评测结果。对正在构建企业知识问答、Agent 检索或 RAG 工程化系统的读者,文中关于关注点分离、权限隔离和断点续传架构取舍的做法可迁移,但需注意其对 AgentScope 和飞书生态的依赖。

技术文章TiDB 社区博客 - 技术解读

AI Agent 的"大脑记忆":为什么向量+关系+全文检索必须一体化

文章系统讨论 AI Agent 的记忆体系,借鉴认知科学将记忆分为短期、语义和情景三层,并补充全文检索记忆需求。作者批评用 Redis、MySQL、向量库和 Elasticsearch 拼接的方案存在数据一致性、混合查询困难和运维复杂等痛点,提出应在同一数据库内核中原生融合关系、向量和全文检索能力。文章以 TiDB 8.5 为例,展示通过 VECTOR 列、向量索引和全文索引在单条 SQL 中组合结构化过滤、语义检索和关键词匹配的实现方式,并说明平凯云服务的 Serverless 弹性、HTAP 能力和全球部署优势。文章适合关注 Agent 记忆系统、RAG 或数据库选型的开发者,但需注意其官方博客的产品宣传色彩和方案边界。

推荐收录。文章不仅解释了 Agent 记忆的分类和需求,还具体分析了多系统拼接架构的工程痛点,并给出使用 TiDB 原生融合关系、向量和全文检索的 SQL 示例,证据具体、有可操作价值。适合构建有状态 AI Agent、RAG 应用或需要混合检索能力的开发者参考,可迁移架构思路,但需注意其中隐含的厂商推广和 TiDB 特定实现约束。

技术文章LWN.net

[$] KVM planes head for takeoff

本文介绍了KVM社区正在开发的KVM planes功能,旨在为Linux虚拟化系统提供统一的安全域隔离抽象层。随着CPU厂商推出AMD SEV、Intel TDX等多种硬件安全方案,应用开发者面临碎片化困境,KVM planes尝试将虚拟机资源(如CPU、内存)划分为不同planes,利用底层硬件特性但向用户态暴露一致接口。文章讨论了设计目标、关键机制(如嵌套虚拟化支持)以及当前开发进展,指出项目处于早期阶段,需处理多架构兼容与性能权衡,对上游集成尚有大量工作。

该文章深入解析了KVM planes的设计动机与技术要点,来自权威Linux内核技术新闻源LWN,具有长期参考价值。适合关注虚拟化安全、内核抽象层开发的工程师和研究者,其中对异构硬件安全方案统一接口的探索思路可迁移至其他同类系统设计。

工程实践知乎 - 携程技术

Demo 跑通了,上线就翻车?Java Agent 生产的那些坑,我们帮你填了

文章针对Java生态中Agent开发从Demo到生产的断层问题,提出了Spring-Ai-Trip中间层作为Harness,叠加在Spring AI之上,提供渐进式短期记忆压缩、大结果Spill溢出保护、认知层可观测性、工具动态热插拔、并行工具调用等运行时能力。设计遵循叠加而非替代、读写分离、信息渐进降级、默认安全等原则,并通过端到端支付排障案例串联各机制。文中对比了Spring AI、Spring AI Alibaba、AgentScope Java等方案的取舍,给出适用于分布式服务端的记忆管理与运维方案,适合已有Java后端基础设施、需要将Agent稳定落地的团队参考。边界在于强依赖携程内部组件(如QConfig)的适配,但核心架构思路可迁移。

推荐收录。文章不是简单的技巧罗列,而是从Java团队实际生产痛点出发,提出系统化的Agent运行时解决方案,包含可落地的渐进压缩、溢出保护、可观测性等机制,并给出了具体的架构权衡与验证案例。适合从事Agent工程化、后端架构以及将大模型融入现有系统的开发者阅读,其中的设计哲学(如信息不丢弃只降级、读写分离)具有跨框架的参考价值。

技术文章Greptime 技术

Engineering•2026-08-11Observability Is Converging. Humans Aren't the Only Ones Querying It AnymorePutting metrics, logs, and traces into one columnar...

文章回顾了可观测性从指标、日志、追踪三支柱独立演进到统一列式存储的历史,并指出到2026年多个厂商已在存储与体验层实现统一。作者分析了两种工程选择:以 ClickHouse 等通用 OLAP 引擎为底座,或以 Grafana LGTM 为代表在控制层统一而存储分离;同时指出这些系统最初都默认人类用户线性查询。文章重点讨论智能体成为第一等消费者后,变化不仅停留在 MCP 和自然语言接口,还涉及并发查询、数据布局、语义层位置与数据发现等数据库架构问题。作者认为统一存储解决了人类时代的数据碎片化,但语义统一与机器高效消费仍待收敛,并留下后续讨论空间。文章属于行业观察与架构判断,而非具体实现验证。

推荐收录,因为它不是产品营销,而是对可观测性统一化与智能体使用场景的深入综述:既梳理了 Bourgon、Sigelman、OpenTelemetry 到 Observability 2.0 的演进脉络,也结合 2026 年多厂商动态提出数据库层尚未解决的关键问题。对从事可观测性平台、列存数据库或 AI 工程化的读者,本文提供了判断统一深度、智能体查询负载和语义层归属的分析框架,具有可迁移的架构参考价值。需注意作者来自 Greptime,可能存在厂商视角,但论证有据且克制。

工程实践GitHub Engineering

Using the GitHub Copilot SDK for Java

本文介绍 GitHub Copilot SDK for Java,一个不绑定特定框架且支持自带密钥(BYOK)的 Java AI 客户端库。作者以 Jakarta EE 11 房地产线索管理 Agent 为例,详细展示注解式(@CopilotTool)与 Lambda 式工具定义、系统消息定制、Agent 循环(sendAndWait)及事件流处理。重点说明如何通过 Jakarta Concurrency 的 ManagedThreadFactory 创建虚拟线程执行器,确保工具回调携带容器上下文,从而无缝集成 CDI、JPA 和 WebSocket。文章还涵盖生产级关注点,如工具集访问控制与权限策略,但强调当前为预览版,注解 API 需实验性编译标志,且示例中简化了权限校验。整体为 Java 服务端 AI 工程化提供了可复用的集成模式与架构取舍。

推荐收录。本文不是浅层的产品介绍,而是深入展示了 GitHub Copilot SDK 在真实企业 Java 应用中的集成细节,包括工具定义、上下文传播、并发模型与实时事件推送,具有明确的工程参考价值。其模式与约束(如虚拟线程执行器、工具集控制)可直接迁移到其他 Java 服务端 AI 集成场景,尤其适合追求框架中立和供应商中立的开发者。

技术文章知乎 - 苏剑林

简单谈谈K3的MoE和Attention

文章由苏剑林撰写,深入解析了K3模型在MoE和Attention上的设计思路与取舍。在MoE部分,作者提出Stable LatentMoE,通过SiTU‑GLU激活和关键位置的RMS Norm解决LatentMoE的稳定性问题,并引入QB分位数平衡策略,以低通信的分bin方法实现大规模专家负载均衡。在Attention部分,作者论证了在训练成本、KV Cache大小和Decoding计算量的多约束下,MLA仍是对效果与效率平衡良好的选择,结合KDA后更是可以移除RoPE,形成NoPE方案。文章还对比了DSV4的Attention设计,指出其本质是对MLA思想的极致推广而非抛弃。全文以效果、效率与稳定性的协调为主线,提供了多项有实验支撑的架构决策参考。

本文为知名研究者苏剑林对K3模型架构的深度解读,详细阐释了MoE稳定化、负载均衡和Attention选型等关键设计,并给出了明确的动机、实验依据和边界分析。适合大模型架构师、研究人员以及对大规模训练优化感兴趣的工程师,其关于训练稳定性、计算‑存储权衡和混合架构设计的方法论具有很强的可迁移价值。

工程实践知乎 - 腾讯技术工程

10万+Skill 背后:腾讯SkillHub如何帮用户找到真正好用的那20%

文章深度复盘了腾讯SkillHub平台在治理10万+AI Skills时的实践,重点解决高质量Skill发现与分发难题。作者提出TRACE质量评测体系,从可信任度、可靠性、适用性、规范性和有效性五个维度进行静态分析,并构建了并行评测流水线、内存级加载和可追踪任务系统以支撑大规模评估。随后通过云端隔离运行环境验证Skill真实执行效果,并沉淀可展示的效果案例。在分发侧,平台结合评测分数与用户行为设计推荐、飙升、下载等多维榜单,建立受控分类标签体系以降低用户筛选成本。最后,文章展示了面向Agent的find skill策略,让AI能自动理解任务意图并匹配Skill,完成从人到机器的能力索引闭环。整套体系以“信任与分发基础设施”为核心,平衡消费者、创作者与平台利益,但仍在持续迭代,依赖特定Agent生态。

推荐收录,因为它不是泛泛介绍,而是完整复盘了从质量评测、运行验证到分发治理的真实工程链条,包含并行架构、隔离环境、榜单设计等可迁移方法。对从事AI平台、内容治理或Agent系统设计的读者来说,文中TRACE框架、运行环境构建和Agent可用的find skill策略可直接启发类似系统建设,但需注意其生态依赖性。

工程实践TiDB 社区博客 - 实践案例

15秒切换、零数据丢失!永康卫健委用平凯数据库(TiDB企业版)物理复制筑牢全民健康平台"生命线"

文章记录了永康市卫健委全民健康平台为解决业务高峰负载过高与容灾需求,采用平凯数据库物理复制能力进行架构改造的实践。改造将主集群专注核心事务,备集群承担报表查询等读操作和容灾角色,实现读写分离。上线后故障切换低于15秒且数据零丢失,系统负载下降,运维操作秒级完成。文章解释了物理复制基于日志实时同步所有数据库对象,支持最大保护、最大可用、最大性能三种模式,并与 TiCDC 逻辑复制对比,指出物理复制适合集群级容灾和读写分离,逻辑复制适合异构同步与数据管道。实际指标依赖网络拓扑和负载,且相关能力仍在演进。

推荐收录,因为文章提供了真实医疗场景下的数据库高可用与读写分离改造案例,包含明确的问题定义、技术选型依据、实施效果和方案对比。适合关注核心系统容灾、分布式数据库选型或架构优化的读者。可迁移价值在于展示了物理复制在强一致需求下的应用边界,但需注意厂商案例可能带有一定推广成分。

工程实践知乎 - 孔某人

中型探索任务的MultiAgent架构设计漫谈(1)

文章分享了作者在构建Multi-Agent系统进行中型数学探索任务时的架构设计经验,重点涵盖Token成本优化、可并发度瓶颈分析与Worker拆分、系统迭代的持续需求与独立升级Agent设计、详细的角色划分(Merger、TaskCreater、TaskWorker、TaskReviewer、SystemUpdater、UserInterface、Reporter、Critic)、高层视角隔离以及全局状态与消息通讯的工程实现。文中还讨论了基于GitHub Issue的方案受限于性能和非结构化问题,进而转向专用全局状态Server,并介绍了Controller模型内部Master-Worker架构以隔离上下文。作者指出整个方案仍较复杂,需较长时间试运行和打磨,但提供了丰富的工程决策依据和迁移价值。

推荐收录,因为文章从真实工程探索出发,系统性地分析了Multi-Agent系统设计中的成本控制、并发瓶颈、角色分工、系统迭代和全局状态管理等关键问题,给出了具体可迁移的架构思路和教训,适合对Agent系统设计、AI工程化及复杂系统迭代有深入需求的读者参考。

工程实践Netflix TechBlog

How and Why Netflix Built a Real-Time Distributed Graph: Part 3 — Querying the graph with gRPC…

本文详细介绍了Netflix实时分布式图(RDG)的查询服务层设计,阐述如何在高吞吐、低延迟要求下高效查询包含数十亿节点和边的图。文章首先分析了浅宽与深窄两类查询场景的挑战,随后说明广度优先遍历、异步优先架构、选择性缓存等关键设计决策及其取舍。接着以具体查询为例,逐步展示请求解析、存储读取、层次化遍历、并行执行、智能过滤和缓存等环节的实现与优化。最后给出系统性能指标(P50/P99延迟、缓存命中率)和经验总结,强调前沿思维、尽早过滤、有界并行和缓存策略等通用原则。其方法适用于高并发、IO密集型的分布式图查询系统,但一致性模型为最终一致,且依赖特定内部存储。

本文是Netflix技术博客的深度工程案例,展示了在真实约束下构建高性能图查询层的完整思考过程,包含具体的设计权衡、量化效果和可迁移原则。适合分布式系统工程师、架构师以及需要处理图数据查询的开发者参考。文中的广度优先遍历策略、异步执行模型和智能缓存方法可直接应用于类似的大规模在线服务场景,有效降低延迟和资源消耗。

工程实践知乎 - 携程技术

200G内存尖峰、数十万Pod迁移:携程Karmada规模化治理实录

文章系统回顾了携程从Kubefed到Karmada的多集群治理演进,重点围绕架构选择、生产落地和规模化优化展开。核心方法是在联邦层保留低频全局能力(资源分发、策略表达、跨集群迁移),将高频局部能力(实时扩缩容、流量切换)留在成员集群,并通过权重驱动的状态机实现数十万Pod的平滑跨集群迁移。文中详细分析了Karmada控制面在几十万级资源规模下遇到的高频状态同步、启动延迟和200G内存尖峰等问题,以及通过折叠Work、降低更新频率、分批对账、watch list等优化手段。适用边界是交易型业务的Kubernetes多集群场景,强调联邦控制面不应成为运行时强依赖。

本文是来自携程生产一线的深度工程案例,不仅解释了为什么从Kubefed切换到Karmada,更给出了清晰的架构原则、迁移机制和规模化治理细节。文中200G内存尖峰、每秒数百次Work更新导致409冲突等具体数据有很强说服力,优化思路可直接指导类似场景。适合云原生平台团队、SRE和架构师参考,可迁移的职责边界划分和控制面优化方法在多集群治理领域有长期参考价值。

工程实践Cloudflare Blog

Introducing Radar Researcher: An AI tool for exploring Internet data in plain language

本文介绍了 Cloudflare Radar 新推出的 AI 工具 Radar Researcher,它允许用户用自然语言查询全局互联网数据,自动生成交互式图表并给出解释。文章详细说明了构建动机(降低非技术用户门槛、加速记者和工程师的数据获取)、系统架构(基于 Cloudflare Workers 和 Durable Objects,使用 Workers AI 运行开源模型并实现多模型回退,通过 MCP 服务器和 Code Mode 让 Agent 动态发现并调用 Radar API),以及关键技术决策(用轻量图表规约替代让模型直接生成数字,保证数据精确性和可视化一致性)。此外,还介绍了 WebMCP 支持,使网站成为 Agent 友好型。该工具目前处于 Beta 阶段,适用于网络流量分析、中断调查等场景,但依赖 LLM 的推理准确性且仅限 Radar 数据集。

推荐收录。本文提供了将 LLM 与数据 API 集成的一种可参考架构:通过 MCP 动态发现接口、用规约化图表渲染避免模型篡改数据、以及多模型回退保障可用性。这些设计模式对构建 AI 辅助数据分析工具的工程师有直接迁移价值,也展示了如何为网站添加 Agent 兼容能力。

工程实践知乎 - 腾讯技术工程

从胡言乱语到精准改代码:我是如何让 AI 读懂老项目的

文章以一个小程序教育平台的重构实践为例,系统阐述了如何通过AI上下文工程将历史债务沉重的项目转变为AI可维护的项目。核心路径包括:从AGENTS.md构建静态上下文索引,移除不再运行的死代码做减法,简化过度设计的架构(如将OT协同降级为HTTP同步),制定页面布局、组件与交互规范约束边界,搭建单测、E2E及视觉回归自动化测试流水线并嵌入MR检查,最终将债务治理融入日常迭代。文章详细记录了每一步中AI角色的变化与引导方法,展示了从AI频繁误判到能主导方案落地的过程,并指出关键在于持续沉淀可复用的上下文知识而非一次性建设。

本文提供了将AI嵌入遗留系统重构的完整案例,覆盖上下文建设、架构简化、规范制定和自动化质量门禁等环节,实操性强。文中拆解的步骤与AI引导策略可直接迁移至其他需要历史债务治理的工程场景,适合希望提升团队工程效能与AI融合度的开发者及技术管理者参考。

技术文章知乎 - 鹅厂架构师

能 1 小时用 AI 做出产品了,能 1 小时让 500 人用上吗?

文章系统探讨了AI大幅降低产品开发门槛后,如何高效将产品分发给用户。作者回顾了App Store和抖音的历史,指出每次创作平权后稀缺性从“创造”转向“发现”,而AI时代的分发将不会是传统的应用商店。通过分析OpenAI两次失败的尝试和当前的技术探索,文章提出未来分发平台将形成“部署即服务”“任务即调用”“内容即发现”的三层结构,每一层都在收各自的“过路费”。文章还指出,监管正从管模型转向管分发,对平台加码,而分发本质是信任问题,最可能从已积累信任的内容社区演化出分发能力。结论为:下一个分发平台不会叫应用商店,但会收取以信任和治理为代价的过路费。

推荐收录,因为文章以历史规律和实际案例(OpenAI的失败)为基础,对AI分发这一新兴议题提供了结构化和有借鉴意义的分析。文中提出的三层结构和对信任机制的强调,能为从事AI产品开发、平台设计和投资决策的读者提供长期参考,其分析框架可迁移到类似技术变革期的分发策略思考。

工程实践Cloudflare Blog

Introducing Kitesurf: The agent-first browser that runs in V8 isolates on Cloudflare Workers

Cloudflare推出Kitesurf,专为AI代理设计的轻量浏览器,运行于Cloudflare Workers的V8隔离环境中。文章阐述了为何需要新浏览器:传统Chromium对代理而言资源开销大,而代理更关注令牌数、上下文窗口和成本。团队采用Rust编译为WebAssembly、借助Web Platform Tests驱动开发、强调组件隔离与无状态设计。整体架构分为Engine处理CDP/HTTP、PageScript利用动态Worker解析HTML/CSS/JS、PageRenderer光栅化生成截图。性能上比Chromium节省3-7倍内存和CPU,但渲染速度慢1.7倍。当前兼容性有限,不支持视频和WebGL,适合一次性截图、PDF生成等简单任务。项目仅12周,开源在即。

推荐收录,因为文章并非产品发布,而是深入的技术工程案例,详尽阐述了为AI代理构建轻量浏览器的设计决策、架构实现和性能权衡。适合从事浏览器、AI代理或边缘计算基础设施的工程师阅读,其中的隔离、无状态设计与WPT测试驱动开发方法可迁移到类似复杂系统的构建中。但需注意项目尚处早期,兼容性有限。

技术文章Cloudflare Blog

Building an open Agentic Internet: readable, discoverable, callable, and payable

文章提出“代理互联网”愿景,将AI代理视为网站的新型访问者,围绕可读、可发现、可调用、可支付四个特性构建开放基础设施。作者分析了传统网络对代理的不适应性,如重复抓取、广告模型失效,并阐述了Cloudflare提供的技术组件:Markdown for Agents和Kitesurf浏览器实现高效读取,AI搜索和AEO优化发现,WebMCP和Code Mode支持直接调用页面功能,x402协议和钱包机制处理支付。文章强调身份认证(Web Bot Auth、PACT)和开放标准的重要性,旨在让域名所有者自主选择对代理的接纳与付费规则,避免互联网封闭。内容偏重架构设计理念,未涉及具体实现细节,但为开发者和架构师理解代理时代的网络基础设施提供了方向性参考。

该文章勾勒了AI代理与互联网融合的底层架构蓝图,提出的“可读、可发现、可调用、可支付”框架切中当前代理生态的关键需求,对构建开放、互操作的Web服务具有长远参考意义。适合关注Web基础设施、AI工程化和分布式系统的开发者与架构师了解前沿趋势和设计模式,虽然缺乏代码级细节,但其概念模型可迁移至实际系统设计中。

工程实践知乎 - 千问云

AI Native 下的混沌工程:Agent 军团如何重新定义系统韧性验证

本文分享了在专有云IaaS场景下,将混沌工程从依赖专家的一次性专项演练升级为AI Native平台能力的完整实践。核心设计采用九种Agent分层的多智能体架构,通过共享黑板实现Agent间解耦,并由三道递进式安全闸门保障注入安全;同时引入经验反馈回路与AI飞轮回路,使用例知识和编排策略持续自进化。平台实现了全链路AI驱动的韧性验证:从注入、观测、诊断到报告和工单闭环,人仅需触发与确认。实战数据显示单次验证闭环从数天压缩至40余分钟,人力投入从专职SRE降至0.1人,并已发现多条产品稳定性缺陷。该方案适用于需要高频、自动化可靠性验证的复杂基础设施场景,但对组织协作和产品Agent接入有一定要求。

本文提供了端到端的AI驱动混沌工程平台建设案例,详细阐述了多Agent架构、安全控制、进化回路和标准接入机制,而非泛泛的概念介绍。其分层解耦、黑板通信、双进化回路等设计具有较高的可迁移价值,适合SRE、平台工程师和架构师参考,用于建设或改进系统韧性验证体系。

工程实践知乎 - SmartCode 得物技术

实战从零开始构建一个Coding Agent:Violin |得物技术

文章以从零构建Coding Agent 'Violin' 为主线,系统剖析了Agent的架构设计、核心循环、模型适配、工具系统、会话管理、上下文压缩、资源加载、事件通信和插件扩展等关键组件。作者借鉴Pi的三层分离思想,用Zig实现高性能引擎、Python搭建交互客户端,通过TCP+JSON Lines协议解耦前后端,并详细讨论了Agent Loop'问模型-执行工具'的底层原理及其在各种功能中的扩展方式。文章同时指出了该玩具项目当前的不足(如工具定义未序列化、插件无权限隔离),但强调其核心价值在于验证'理解一个coding agent就能理解所有agent'这一判断。整体展现了深度工程实现、语言选型权衡和可迁移的设计模式,为AI工程化实践提供了扎实的参考。

推荐收录,因为文章不是泛泛介绍AI agent概念,而是深入到代码级实现,包括Zig/Python语言分工、TCP通信协议设计、EventBus事件驱动和Lua插件系统等工程细节,完整呈现了从架构到落地的过程。对正在设计或实现自定义AI agent的工程师、以及对Agent内部机制有深度兴趣的读者来说,文中的分层解耦思想、循环控制模式和资源管理方法具有直接的可迁移价值。

工程实践Xe Iaso

SigV4 authentication is surprisingly complicated

文章以 Tigris 对象存储实现 AWS SigV4 鉴权协议的过程为线索,详细拆解了签名机制表面简单实则复杂的本质。核心方法包括请求规范化、基于 HMAC-SHA256 的四层密钥派生链,以及利用 X-Amz-Date 和时钟偏差窗口抵御重放攻击。重点介绍了 TAG 本地加速网关如何通过派生签名密钥的代理机制,在不持有完整客户秘钥的情况下完成鉴权,从而避免每次请求都回源云服务。文章还讨论了 SigV4a 不对称加密方案与时钟同步、TLS 依赖性等边界条件,揭示了协议设计中被忽视的中间值作用域和工程权衡。

本文不是简单的协议教程,而是基于真实工程案例的深度技术挖掘。它从规范文档到代码实现,再到生产级缓存网关的密钥代理设计,完整展示了面对对称密钥鉴权时的复杂性思考和折中方案。适合从事 API 设计、安全鉴权、云存储或本地加速网关开发的后端工程师与系统设计者,文中关于派生密钥作用域限制和协议弹性的设计思想可直接迁移到类似分布式鉴权场景。

工程实践Meta Engineering

From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking

本文介绍了 Meta 广告排序系统在大规模序列学习上的两项架构创新:多阶段序列模型将计算密集的离线用户建模与对延迟敏感的在线排序解耦,通过异步处理长用户历史并缓存嵌入,在不线性增加服务资源的前提下提升模型容量;密集 tokenization 和目标感知多头注意力让模型直接从数据中学习稀疏特征与行为序列的交互,取代手动特征工程。该设计带来了可预测的 LLM 式扩展规律,即性能随计算量呈对数线性增长,并总结出模型形状平衡、多阶段可调性、序列组成多样性和语义特征表征四个扩展杠杆。文章给出了在 Instagram 和 Facebook 上的转化率与点击率提升数据,并指出该架构已作为 GEM 模型的核心组件,可泛化至各类广告排序任务。

推荐收录,因为文章不仅公开了关键技术细节(离线/在线解耦、密集 tokenization、目标感知注意力),还系统论证了在广告推荐领域建立起可预测扩展规律的方法与实验证据。对于推荐系统、广告架构及大规模模型服务的工程师和研究者,文中分离建模阶段以平衡复杂度与延迟的思路具有很强的可迁移性,而扩展规律的识别路径可为探索其他大规模机器学习系统提供参考。

工程实践Salesforce Engineering

How Salesforce Eliminated Single-Region Risk and Reduced Downtime Blast Radius at 4B Metrics/Min

Salesforce内部可观测平台Argus需处理每分钟40亿指标,原单区域架构导致全局可用性风险及高昂的数据传输成本。团队采用地理本地化策略,将指标就近处理和存储,避免全量复制,并通过联盟查询层与Elasticsearch元数据映射实现智能路由,仅查询数据所在区域,减少跨区域开销。同时引入HTTP 206部分响应和UI提示来处理部分地域不可用,保障用户体验。文章还介绍了通配符查询的元数据缓存优化,以及持续容量规划和架构审查来维持隔离边界。该方案已在五个生产区域中的四个上线,显著降低爆炸半径,但跨区域延迟和流量成本仍为后续关注点。

这篇工程案例详实记录了如何将单区域可观测平台迁移到多地理架构,解决全局不可用风险并控制成本,包含查询联邦、部分失败处理和元数据缓存等关键设计,为构建高可靠、大规模可观测系统的团队提供了可复用的架构思路和实践参考。

技术文章Cloudflare Blog

The Agent Access Model

本文提出一种面向AI Agent的访问控制模型AAM,旨在将BeyondCorp的零信任思想从人类用户扩展到软件代理。文章分析了Agent的四个特性(凭证与任务寿命不匹配、机器速度、提示不可靠、多跳组合权限)导致现有控制失效,并围绕“不信任任务运行,针对任务及其累积状态授权每个动作”这一核心规则,阐述了AAM的五个原则:短期绑定凭证、在工具层和网络层实施策略、例外的人工审批、基于证据的授权审查、单向收紧能力的信任棘轮。文章给出了包括身份代理、任务范围访问引擎、中介层、信任棘轮、授权审查循环和活动日志的参考架构,并通过数据防泄露示例展示其工作方式,最后讨论了多人访问控制的开放难题。模型强调执行约束而非模型自身,适用于有数据库、API等系统记录访问需求的Agent部署场景。

文章系统性提出了适用于AI Agent的访问控制模型,填补了现有零信任架构在软件代理场景的空白。其原理清晰、架构具体、边界明确,对安全架构师、平台工程和AI工程团队具有直接指导和可迁移价值。尤其适合正在部署Agent的企业参考,帮助设计最小权限、防泄露和可审计的控制面。

工程实践Cloudflare Blog

WriteGuard: fine-grained controls for MCP Servers

文章介绍了 Cloudflare 为应对 AI 智能体写操作失控风险而构建的 WriteGuard 系统。WriteGuard 作为 MCP 服务器与下游应用之间的共享策略、归因和审计层,通过工具配置将操作分为 READ_ONLY、CONTAINED_WRITE、CRITICAL 三个风险等级,支持按工具启用/禁用、注入智能体身份标签并生成异步审计事件,无需修改 MCP 服务器代码。结合 Cloudflare Access 的人类身份模型,WriteGuard 允许智能体沿用用户权限,同时为写操作添加可追溯的智能体上下文,实现集中化的控制与可视性。文章以 GitLab 工具为例说明了不同风险等级的处理流程,并指出该设计可跨多个 MCP 服务器统一复用。当前方案基于 Cloudflare 内部基础设施,并通过私有测试版向外部提供,其风险模型和归因格式仍有待不同组织验证。

推荐收录,因为文章详细介绍了在真实 AI 代理工程中解决写操作失控问题的架构方案,包括工具风险分级、归因注入和集中审计等可迁移实践。对于正在构建 Agent 系统或 MCP 服务的工程师和架构师,文中的设计权衡和分层控制思路可直接参考,帮助在扩展 Agent 写能力的同时保持可见性和安全性。

工程实践Cloudflare Blog

Cloudflare OS: an open platform for agents, apps, and work

Cloudflare 推出开源平台 Cloudflare OS,用于构建企业内部的智能代理、应用和工作流。平台核心由三部分构成:代理工作区、安全治理框架和个人可定制应用。代理工作区集成公司上下文与技能,在隔离运行时中编写并执行代码;安全框架通过 Gatekeepers 和资源观察日志实现细粒度的资源访问控制与机密数据防泄漏;应用以 Dynamic Worker 和 Durable Object Facet 运行,使用 Cap’n Web RPC 通信。文章分享了从内部版本获得的经验,包括协作场景下的授权挑战和架构重建,并说明了模型路由、成本控制以及与 MCP 服务器的集成方式。适用边界在于整个平台深度绑定 Cloudflare 基础设施,直接迁移到其他环境需要额外工程。

文章不是空洞的产品发布,而是详细阐述了面向代理的平台安全设计如何解决凭证扩散、跨资源信息泄露等真实工程问题。提出的 Gatekeeper 模式、观测日志与策略联动、基于能力的访问控制,对于构建企业级 AI 代理系统的架构师和安全工程师具有直接参考价值,其思想可迁移到其他云平台或自建系统。

工程实践Trail of Bits Blog

A few notes on AWS Nitro Enclaves: KMS integration

文章系统分析了AWS Nitro Enclaves与KMS集成时的安全威胁与防护策略。作者从被动攻击和主动攻击两个维度出发,详细梳理了数据交换攻击、CMK替换、重放攻击等具体场景,并给出了包含加密上下文、密钥承诺、CMK硬编码、TLS通道等在内的防护检查清单。此外,文章还讨论了KMS策略配置的常见错误、PCR绑定方法、端到端验证的挑战以及操作层面的风险(如密钥轮换、区域性故障、计费问题)。文末指出AWS官方SDK存在漏洞,并建议替代方案。整体内容根植于真实工程约束,但部分防护依赖于AWS内部实现细节,不完全适用于非AWS环境。

推荐收录,因为文章不是浅层介绍,而是对Nitro Enclaves与KMS结合时的攻击面进行了系统性威胁分类,并提供了可落地的安全检查清单。内容来自专业安全公司,具有较高的工程参考价值,适合从事云安全、机密计算或基础设施安全的工程师阅读。其威胁建模方法和防护清单设计思路可迁移到其他TEE或云服务安全评估中。

技术文章知乎 - 携程技术

AI专栏 | 上下文越多,Agent 越笨?开源框架 Flow2Spec 给出另一种答案

本文介绍开源框架 Flow2Spec,针对 AI Agent 在大型项目中上下文膨胀、遗忘规则的问题,提出将项目知识构建为可路由、可依赖、可验证的知识图谱。核心设计包括基于 manifest-routing.json 的路由协议、渐进式匹配-展开-验证-执行读取模型、主题间显式依赖声明、意图识别自动分流,以及与开发闭环深度集成的知识同步、补充和提交前检查机制。框架通过 f2s-kb-sync、f2s-kb-distill 等命令让知识在需求澄清、方案设计、代码实现、修复和提交过程中持续沉淀,并支持多 Agent 校验、变更追踪和路由升级。文章强调知识库不是一次性文档,而是随代码演进的生命体。适用场景为中大型长期项目,不适合极小型或一次性脚本。

推荐收录,因为文章不局限于工具说明,而是系统阐述了 AI Agent 上下文管理的工程化思路:从被动记忆转向主动路由与知识反哺。它提供了清晰的知识库接口协议、渐进式读取流程、依赖处理与验证闭环设计,对需要在大型项目中落地 Agent 工程的读者具有直接参考价值。适合关注 AI 编程工具、Agent 架构和开发者效率的工程师,其路由和反哺机制可迁移至类似上下文管理方案。

工程实践知乎 - 腾讯技术工程

腾讯Omega:下一代“AI BI”的答案?

文章深度复盘了腾讯 Omega AI BI 系统从理念到落地的完整过程。针对传统 BI 操作门槛高、ChatBI 仅能完成单次查询的局限,Omega 将 AI 重建为分析工作的协作体:由 LLM 规划指标、组织页面并生成 HTML,同时通过 QueryRegistry 数据契约和 DTBridge 运行时解耦数据查询与界面,实现页面与真实数据的持续联动。文章详细阐述了指标证据链构建、语义模型接入、筛选器依赖图、多层安全防护、运行时契约(有界、可取消、可观测、可自纠)等关键设计,并分享了模型幻觉、慢查询误杀、成本权衡等真实事故与应对。结论强调 AI 生成页面仅是第一层,系统化地保证页面第二天仍可用、分析可延续、Agent 出错可体面恢复才是产品化的核心,适用于拥有数据底座且具备一定治理水平的企业场景。

本文是一份高质量的工程复盘,不是泛泛的产品介绍,而是细致拆解了 AI BI 系统从原型到可生产产品的核心矛盾与解决方案。对负责 AI 产品化、数据工程、系统架构或安全设计的读者有极强的可迁移价值,尤其在如何用确定性系统约束 AI、如何保证数据查询与界面长期可靠联动方面提供了可复用的模式。

工程实践知乎 - 鹅厂架构师

从0到1搭建 AI Agent 可操作的团队知识管理体系

文章记录了腾讯云团队从0到1搭建AI Agent可操作的团队知识管理体系的完整工程实践。团队借鉴外部知识沉淀思路,结合自身小型团队和通用AI工具的特点,设计了一套四层知识库(L0团队约定、L1通用技术、L2业务专属、L3项目索引)、四种知识条目类型(guideline/pitfall/pattern/decision)和三级成熟度(draft/verified/proven)的体系,并通过Git仓库实现版本管理。实施过程覆盖了冷启动时的人工高质量提炼、AI Skill的渐进式开发(检索/沉淀/更新)、项目仓库的轻量注册以及Rule触发提醒。文章详细阐述了为何选择独立知识仓库、动态目录扫描、用户确认式沉淀等核心决策,并展示了任务执行中知识自动注入和事后沉淀的闭环效果。当前工作适用于小型团队和通用AI编码工具场景,大规模团队或自研编排引擎的场景有待验证,治理机制中的衰减、孤儿检测等尚在规划。

推荐收录,因为文章不是简单的工具介绍或理念宣传,而是从真实痛点出发,给出了可落地的知识管理体系设计,包含架构分层、成熟度模型、索引机制和具体的工程实现路径。文中对设计决策的取舍理由(如人工冷启动 vs 自动化管道、轻量Rule+Skill vs 重型状态机)的说明,为类似规模的工程团队提供了直接可迁移的经验。适合AI工程化、开发者体验和团队知识管理方向的读者参考,但需注意其适用边界在于小型团队和通用AI工具,治理机制部分仍有待完善。

工程实践知乎 - 千问云

理解归 AI,正确归引擎:从一句话到一条实时数据链路(0代码搭建实时任务)

本文以直播业务为背景,介绍了一套 AI 辅助、指标驱动的实时数据端到端开发系统。系统将业务需求抽象为“维度 + 指标”,通过依赖回溯自动构建 Flink SQL 任务拓扑,并支持增量 Hook 调整。文章详细展示了从自然语言需求到可发布任务的全流程,包括需求澄清、DSL 生成、SQL 生成、增量演进与任务发布。系统架构上,LLM 负责理解用户意图并生成结构化 DSL,确定性引擎保证 SQL 正确性,前端提供人工确认节点,三者通过 DSL 契约松耦合协同。文中还总结了指标驱动范式、理解与正确性分离、Hook 安全接入等可迁移方法论,以及实时资产沉淀路径。案例中开发周期从天级缩短至分钟级,但系统仍依赖人工校验,增量调整目前仅支持不改变拓扑的局部修改。

推荐收录,因为本文不是浅层工具介绍,而是围绕一个真实工程问题,系统化地展示了从架构设计、核心机制到方法论的完整实践。对从事实时数据开发、Flink 任务构建或探索 AI 辅助软件工程的读者来说,文中提出的指标驱动回溯、理解与正确性分离、Hook 协议等方案,可直接迁移到类似平台或工具的建设中,具有长期参考价值。

工程实践知乎 - 千问云

从 Prompt 到 Harness:企业级 Agent 工程的完整演进之路

本文系统复盘了企业级 AI Agent 平台从 Prompt 工程、Context 工程到 Harness 工程的完整技术演进路径。作者从大模型的上下文窗口稀缺、注意力稀释、数据搬运谬误和无状态缺陷四大先天约束出发,阐述了为何需要工程化基础设施。文章重点介绍了四层上下文防线(工具结果压缩、语义压缩、对话压缩、数据总线)与三层记忆(State、Working Memory、Transcript)的组合设计,以及基于 PERO 编排、断点续传、知识体系、自进化引擎和 Capability Runtime 的 Agent 运行时架构。最终提出五层 Agent OS 架构和双 Agent 平台方案,强调从防御到赋能的设计哲学转变。内容覆盖了真实工程约束、架构权衡与失败教训,适合关注大规模 Agent 系统工程化的团队参考,但对具体实现细节的验证边界和性能量化指标披露有限。

推荐收录,因为这篇长文提供了从第一性原理出发的工程演进实录,非单纯概念介绍。文中关于上下文管理分层防御、有状态执行引擎、跨 Agent 协调及知识体系的设计决策,直接源于生产环境踩坑,可迁移性强。适合后端架构师、AI 平台工程师及技术管理者系统理解 Agent 运行时治理方案,尤其对面临长链路推理质量退化和上下文膨胀的团队具有高参考价值。

工程实践Elastic Security Labs

Agents vs. agents: how we triage HackerOne reports for $2 each, 85% as well as a human

本文详细介绍了Elastic Security Labs如何构建一套AI驱动的漏洞报告分类系统,以应对因LLM生成报告激增而导致的Bug Bounty人力瓶颈。系统采用两阶段架构:分析阶段运行在临时VM上,通过八步流水线和对抗性审查对报告进行有效性、可利用性、CVSS评分等评估;复现阶段仅在必要时启动,在沙盒环境中自动化验证漏洞。系统基于3300+历史报告迭代校准,与人工分类一致率达85%,单次分类成本约2美元。文章还深入讨论了对抗性审查、针对Elastic产品的特定分类规则、完整的安全威胁模型与纵深防御设计,以及从工程实践中获得的经验教训,如报告框架偏见、数据校准关键性和复现的决策价值。

推荐收录,因为它提供了一个从问题定义、架构设计、校准迭代到生产部署的完整工程案例,包含详尽的技术细节、安全防御策略和可复现的实验数据。适合安全工程师、漏洞管理负责人和AI工程化团队参考,其多阶段分析流程、对抗性审查机制和沙盒复现的隔离架构可在其他自动化分类或安全评审场景中迁移复用。

技术文章知乎 - 孔某人

谈一个AgentOS早期征兆,谈Agentic Job Runtime

文章从Agent执行长程任务时状态管理困难的问题出发,提出了Agentic Job Runtime的概念。作者指出,当任务涉及大量共享资源、优先级调度和动态规划时,单一Agent通过文档更新状态容易丢失信息,因此需要引入队列、数据库表等传统数据结构,并采用多Agent主从架构(类似蜂群或主从式并发)来管理状态和流水线执行。该Runtime类似现代编程语言运行时,需支持状态持久化、恢复、回滚、不同LLM配置,以及可视化和权限控制。文章最后辨析了与Agent OS的区别,认为它不是对底层资源的封装管理,而是面向单个Job的执行环境,可能是Agent OS最早落地的方向。整体提供了一种务实的系统设计思路,适合大规模Agent工程场景。

文章不是空泛的概念讨论,而是给出了具体的技术方案和工程架构,对解决Agent复杂状态管理和任务协调有实际指导价值。适合AI工程师、Agent框架开发者和对多Agent系统感兴趣的研究者,其设计思想可迁移到需要长程、多任务并发的Agent系统中。

工程实践Netflix TechBlog

Modeling Device Capabilities for Analytics

Netflix 面临设备多样性带来的功能支持挑战,为此构建了设备能力数据模型。核心方法包括使用累计表高效存储每台设备的最新能力状态(如屏幕分辨率、视频编解码器支持等),以及构建直方图记录 28 天内活跃设备数并按能力维度分布,用于分析功能覆盖率(如仅 20% 设备支持 UHD)。基于这些数据集,团队开发了分析产品,为 4K、空间音频、云游戏等特性在特定设备上的启用提供数据驱动决策,以平衡性能与可靠性。该模型适用于大规模流媒体服务下的设备洞察,但未深入底层存储或查询优化细节。

本文展示了 Netflix 从设备数据建模到聚合分析的完整工程实践,提供了可复用的数据结构设计和分布分析方法,对需要处理异构设备、评估功能渗透或进行数据驱动决策的工程师有直接参考价值,适合数据分析、平台工程或流媒体团队迁移应用。

工程实践Cloudflare Blog

An API for MoQ: provision your own isolated relays

文章详细介绍了Cloudflare为MoQ(Media over QUIC)协议提供的全局中继供给API,该API允许开发者为应用创建隔离的中继范围并管理发布/订阅凭证。作者首先回顾了MoQ作为IETF草案协议的基本原理:一种基于QUIC的发布/订阅系统,中继无需解析媒体内容即可实现大规模低延迟分发。随后,文章重点说明了新API如何解决此前开放预览中缺乏认证和访问控制的难题,通过创建隔离的“中继”资源和限定操作(发布、订阅或两者)的“令牌”,实现细粒度权限管理。技术上,中继并非独立虚拟机或容器,而是现有全球Anycast网络上的隔离作用域,因此可实现秒级部署和弹性伸缩。此外,文章还介绍了对draft-16协议新增的PUBLISH和SUBSCRIBE_NAMESPACE特性的支持,以及推动跨CDN统一供给模型的开放标准化努力。该API目前处于免费Beta阶段,适用于需要低延迟、高隔离性的实时媒体应用。

文章深入阐述了在全球CDN网络上构建MoQ中继服务的工程实践,覆盖了架构取舍(如Anycast与隔离作用域)、访问控制模型(令牌粒度和生命周期管理)及协议演进。对需要设计或使用低延迟媒体分发、实时通信或CDN服务的工程师和架构师具有直接参考价值。文中关于如何以轻量配置替代独立服务器实现多租户隔离的思路,也可迁移到其他大规模基础设施服务的设计中。

工程实践Netflix TechBlog

GenRec: Towards LLM-Native Recommendation at Netflix

文章介绍了 Netflix 的 GenRec,一个基于内部基础 LLM 并经过后训练的推荐排序模型。它将用户历史、物品元数据和上下文通过“上下文工程”转化为自然语言提示,添加目录感知的评分头,并采用奖励加权的多目标损失(排序、语言建模、与长期满意度对齐)进行训练。在离线评估和大规模在线 A/B 测试中,GenRec 在仅使用少量 Phase-2 标注数据和输入信号的情况下,超越了成熟的生产级排序器,并在短期和长期指标上取得统计显著提升。该工作展示了从特征工程到上下文工程、从定制架构到共享基础骨架的范式转变,以及通过预填充推理和上下文压缩控制服务成本的方法。文章还讨论了数据与模型缩放规律、各训练阶段的贡献以及上下文长度优化,为大规模个性化推荐系统提供了可迁移的设计思路和工程权衡。

强烈推荐收录,因为本文提供了真实生产环境中将 LLM 应用于推荐排序的端到端工程案例,覆盖架构设计、训练策略、成本优化和实验验证,并揭示了从特征工程到上下文工程的范式转变。适合推荐系统工程师、ML 架构师和关注 LLM 工程化的读者,文中关于数据效率、缩放定律和上下文压缩的实践经验具有高迁移价值。

工程实践Blender Developers Blog

Geometry Nodes Physics

本文介绍了Blender 5.2 LTS中基于几何节点(Geometry Nodes)的新头发与布料动力学系统。核心实现采用声明式XPBD仿真框架,通过内置XPBD求解器节点处理多种约束类型,并提供Cloth Dynamics和Hair Dynamics两种易用资产。系统允许通过效应器(Effector)扩展行为,包括碰撞体、自定义力和自定义效应器,并支持标签过滤机制。文章还回顾了当前状态、实验性限制,并展望了未来支持刚体、软体和流体的多求解器统一框架,以及模态节点工具在交互式编辑中的应用。新系统目前仍为实验性,设计可能调整,且缺少现成的力场资产,需要用户自定义。

推荐收录,因为文章详细解析了Blender新一代基于节点的物理模拟架构,从整体框架到XPBD求解器、效应器扩展和求解器统一设计,展示了图形学工程实践中系统设计与可扩展性的权衡。对计算机图形学工程师、动画工具开发者及关注实时模拟的读者,本文提供了可迁移的架构思路和实现细节,尤其适合理解如何将物理仿真集成到节点式工作流中。

工程实践Cloudflare Blog

Dogfooding at scale: migrating cdnjs to Cloudflare’s Developer Platform

文章详细记录了 cdnjs 从旧架构(GCP Cloud Functions + GitHub 仓库 + Workers KV)迁移到 Cloudflare 全栈开发者平台(Workers、Workflows、R2、KV、Queues、Containers 等)的过程。旧架构痛点包括无共享追踪、双活存储、对象事件粘合流水线、26 个分片函数和臃肿的 GitHub 仓库;新架构以 R2 为文件单一真实源,KV 存元数据,Workers Cache 提供分层缓存,Workflows 编排流水线,并通过 Queues 和 Durable Object 实现异步阻塞。迁移中遇到字节级一致性和子请求限制等挑战,最终通过原样复制而非重新压缩解决了 SRI 哈希问题,并倒逼平台提升子请求上限至 1000 万、Workflow 步数上限至 10000 步。文章展示了该架构的弹性、可扩展性,并为未来支持 ES 模块等现代功能奠定基础,但 SRI 校验修复等遗留工作仍待完成。

这是一篇稀缺的大规模 CDN 服务迁移工程实录,直面真实约束与架构取舍,并记录了平台为适配需求而改进的共演过程。对基础设施工程师、平台架构师和 SRE 极具参考价值,可迁移经验包括可观测性设计、存储一致性保障、无服务器工作流编排及平台限制突破策略;文中的坦诚复盘(包括迁移失败回滚)使内容更可信。

工程实践Grab Tech

Crowdsourced taxonomy verification: A feedback-driven framework for refining knowledge graph relationships via online search interactions

文章提出了一种基于用户反馈的知识图谱关系验证框架,用于在快速变化的领域(如外卖菜单)中检测和消除自动化构建所产生的错误关系。核心方法是将图谱边分为已验证和候选两类,通过搜索界面以探索与利用策略注入候选边,并采集点击、购买等加权交互信号,计算置信度分数来自动推广或剪枝边。该闭环系统无需人工干预,利用众包隐式反馈大规模纠正AI幻觉,并在食品配送场景中验证了其有效性。适用边界包括依赖充足用户流量的动态目录搜索,且需要精细控制注入以避免影响体验。

收录理由:文章详细描述了一个将搜索界面作为验证环境的工程方案,包含假设生成、候选注入、信号聚合和图更新等完整模块设计,并通过加权交互信号和置信度阈值实现自动图结构演化。对负责搜索系统、知识图谱构建或数据工程团队具有直接参考价值,其探索-利用设计和无人工干预的规模化验证思路具备可迁移性。

技术文章Kubernetes Blog

How the controller-runtime Cache Actually Works, and Why Your Controller Does Not Crash the API Server

本文深入剖析了 controller-runtime 缓存的内部机制,解释了为何控制器不会压垮 API 服务器。核心原理是:r.Get 和 r.List 并非直接查询 API 服务器,而是读取由 Reflector 通过 list+watch 构建、存储于 Indexer 的本地内存副本;写操作则直接发往 API 服务器,并通过 watch 异步反馈到缓存。文章详细拆解了 DeltaFIFO 的有序分组与去重、workqueue 的 key 级合并、索引器如何提供类 SQL 的快速查询、选择性缓存及 Transform 等内存优化策略,并列举了读后写期待、共享对象突变、resync 误解等常见误区。全文基于 client-go 原语,提供了从启动阶段到生产调优的完整心智模型,适用于已经编写 Go 控制器但希望深入理解其行为以避免生产意外的工程师。

推荐收录。文章深入揭示了 controller-runtime 缓存的底层模型和常见误区,为 Kubernetes 控制器开发者提供了可迁移的内部视角和防错指南。内容覆盖了从原理、设计取舍到实战优化的完整链路,长期计算参考价值显著,尤其适合需要在高负载集群下保障控制器稳定性和性能的工程团队。

工程实践知乎 - SmartCode 得物技术

推荐系统体验的数字化突破:得物自动化评测平台的技术实践|AICon 文章整理

文章系统介绍了得物推荐评测平台的完整技术方案,针对推荐系统中新颖性、相关性等主观体验指标难以量化、反馈周期长和审计成本高等工程痛点,构建了基于大模型的全自动评测流水线。平台通过可视化提示词工程、多模型动态配置与人机协同校验机制实现评测标准一体化管理,保证评测一致性在 92% 以上;工程层面采用 CAS 无锁分布式调度、三阶段断点续传和动态并发控制,支撑单周百万级评测任务,并通过按需触发、模型分级和采样精控将成本降低 91%。文章还展望了向多维度体验评测和全天候 Agent 自动巡检的演进方向,提供了从业务问题到工程落地的完整实践参考。

作为工业级推荐评测平台的工程实录,文章将业务痛点、系统架构、工程技巧和成本优化有机串联,尤其在分布式调度、大模型评测流水线和人机协作校验方面给出了可复用的实现细节。适合推荐系统工程师、AI 基础设施团队和关注自动化评测的建设者,可迁移用于类似主观指标量化、高吞吐低成本的评测系统设计。

工程实践知乎 - 千问云

数据研发Multi-Agent架构的Harness工程实践

本文从数据研发场景出发,指出Agent从“能跑”到“可信”的工程差距,提出Harness工程理念——LLM负责理解和创意,Harness负责约束和验证。作者回顾了AI工程从Prompt Engineering到Context Engineering再到Harness Engineering的范式演进,并基于Orchestrator+Specialist的Multi-Agent架构,详细拆解出身份层、执行层、进化层三大分层及Identity、Orchestration、Context、Gate、Recovery、Evolution六大支柱。每个支柱均给出了具体落地方法,如三层约束金字塔、Spec文件驱动、四级修改流程、状态机故障分级恢复等。最后讨论Harness可能成为AI时代DevOps标准或过渡性概念,并强调当前工程积累的价值。文章未深入特定行业合规要求,侧重通用数据平台场景。

本文不是空谈Agent概念,而是基于一线工程实践提炼出可复用的Harness设计框架,覆盖身份定义、流程编排、上下文管理、质量门禁、状态恢复与经验演进,逻辑完整且落地性强。适合AI工程化、Agent开发及系统设计方向的技术人员,文中的多层约束体系、Spec驱动协作和故障分级恢复等模式可直接迁移到其他生产级Agent系统。

工程实践Salesforce Engineering

Building Reliable Production AI with Durable Workflows

文章以 Salesforce Agentforce Grid 为案例,深入剖析从 AI 原型转向生产系统时面临的分布式执行挑战。作者指出,生产 AI 的核心问题不是模型行为,而是如何让智能在长时运行、部分失败、部署重启、重试和输入变化中保持可靠。文章提出通过持久工作流将执行状态与工作线程生命周期解耦,并围绕可恢复的工作单元划分、执行状态持久化、重试边界对齐恢复边界、分层进度可见性等设计决策展开讨论。内部测试显示,迁移到 Temporal 后,高负载下失败率从约 90% 降至 0%,P95 完成时间缩短约 60%,验证了该架构的有效性。文章适用于涉及大规模批量推理、多步 Agent 或工具调用的 AI 工程场景,但数据来自内部环境,外部应用需独立验证。

推荐收录,因为文章基于真实生产系统,完整呈现了从问题识别到架构演进的工程决策过程,提供了可迁移的工作单元划分、状态持久化与重试设计原则。适合从事 AI 工程化、大规模分布式推理和可靠工作流编排的工程师与架构师阅读,能直接帮助读者在类似系统中避免“重跑全部任务”的陷阱,提升整体可靠性。

工程实践Elastic Security Labs

Inside Elastic InfoSec's agentic SOC: When to inline your agent's skills for a 5× cost reduction

文章对比了安全运营中心(SOC)中两种智能体架构:专业化多智能体工作流与单智能体配合按需加载技能。基于Elastic自身生产环境36822次真实对话,实测Windows终端告警调查成本,专业工作流约0.69美元,单智能体约3.42美元,差距达5倍以上。通过匹配实验揭示,内联方法论的专业智能体仅需4次LLM调用,而技能委托智能体需12次,其中57-60%为无产出的推理调用,导致累计成本飙升。文章进一步提供决策框架:批量自动化调查应选择专业工作流以控制成本并保证可重复性,分析师主导的交互式调查则适合单智能体方案,并强调使用消费API测量自身环境后再做决策。结论适用于使用Elastic平台,但测量方法和架构权衡具有普遍参考价值。

本文基于Elastic生产环境的大量实证数据,提供了明确、可复现的架构对比分析,直接指导安全运营团队如何构建经济高效的智能体工作流。适用于正在或计划采用AI Agent进行安全自动化的工程团队,其测量方法和架构取舍原则对非Elastic平台同样有借鉴价值。

技术文章PlanetScale Blog

Postgres backups under the hood

文章深入解析 PostgreSQL 的三种备份方式:逻辑备份(pg_dump)、文件系统备份和连续归档。首先介绍 pg_dump 如何利用 MVCC 获取一致性快照,并指出其在特大库上可能因长期持有快照导致事务回卷而触发只读模式的风险。接着说明文件系统备份虽然速度快,但需要停机或原子快照支持,且无法实现时间点恢复。重点阐述了连续归档的原理:通过持续归档 WAL,结合 full_page_writes 在线备份文件系统后,利用 WAL 中的完整页镜像修复备份过程中可能出现的“涂抹”数据,从而得到一致且可恢复的备份。文章还解释了基于此机制的时间点恢复过程,以及 PlanetScale 如何通过每 12 小时自动备份与控制 WAL 重放窗口来保持恢复速度。最后简要提及大规模备份的挑战,为介绍分布式 PostgreSQL 与分片备份埋下伏笔。

本文不只是罗列备份命令,而是清晰解释了 pg_dump 的事务回卷风险、WAL 与 full_page_writes 如何解决在线备份的一致性难题,以及时间点恢复的内部逻辑。这些内容对数据库管理员、后端工程师和运维人员有直接参考价值,能帮助理解备份策略的真实约束和取舍,迁移至其他数据库系统时也有启发。

工程实践Salesforce Engineering

How AI Rebuilt Salesforce’s Decades-Old Localization Pipeline

本文是Salesforce工程团队关于用LLM重建本地化管道的实践总结。面对产品量激增35%而预算与发布时间窗口固定的矛盾,团队从尝试单一LLM提示翻译失败中认识到,企业本地化不仅要翻译文本,还需处理客户自定义对象、多产品术语和34种语言的语法与品牌规则。最终的方案是构建一个AI编排管道,将提示工程与上下文工程结合,为每个翻译任务注入产品、品牌、语法等结构化上下文,并通过多阶段AI编辑与验证(最多85个专门提示阶段)来保证质量。该管道将本地化成本降低50-90%,大幅加速交付,同时建立了可持续的工程基础。文章还讨论了未来面对的模型演化与发布工程挑战。

文章完整展示了一个将AI深度集成到遗留企业系统的工程案例,从问题分析、架构设计、验证策略到反馈循环,提供了可迁移的上下文工程与多阶段验证模式。对于负责国际化、AI工程化或大型系统现代化的工程师和架构师,其思路与权衡具有直接参考价值。需要注意的是,方案高度依赖高质量的结构化上下文资产,且需应对基础模型持续演进带来的维护挑战。

技术文章LWN.net

[$] An operations structure for swap devices

文章介绍了在2026年LSFMM+BPF峰会上提出的为Linux内核交换子系统创建操作结构的构想。交换子系统在演进过程中缺乏统一的抽象层来接口底层存储,导致接口复杂且难以维护。作者分析了当前交换设备接口的实现方式和局限性,讨论了创建一个专门的操作结构(ops structure)以简化设计和完善抽象的可能性,并指出最终实现途径可能与最初设想有所不同。文章展示了内核社区在成熟子系统中引入现代化架构重构的思考过程和设计权衡,对理解内核演进和软件设计具有长期参考价值,但未涉及具体实现细节和最终补丁。

本文深入剖析了Linux内核交换层接口的架构缺陷和重构动机,提供了从历史演进中识别设计债务并规划重构的典型案例。适合内核开发者、系统软件工程师和软件架构师学习如何在成熟系统中引入抽象层,具有可迁移的软件设计价值,技术内容具体、边界清晰,符合长期精选库的收录标准。

工程实践Blender Developers Blog

Remote Asset Libraries

文章详细介绍了 Blender 5.2 LTS 引入的远程资产库系统,它允许 Blender 从远程服务器发现并下载资产,同时保持完整的离线使用能力。系统采用静态 HTTP 服务器和 JSON 列表文件的设计,无需动态后端,降低了部署和维护成本;资产必须自包含在单个 .blend 文件中,且不支持外部依赖。作者还讨论了版本兼容性处理、未来对多文件资产与授权钩子的改进方向,以及该方案适用于小团队和个体的边界。全文展示了从需求到架构取舍、实现细节和局限性的完整工程思路。

该文来自 Blender 官方开发者博客,系统阐述了远程资产库的架构设计、限制与未来规划,不是简单的功能介绍。其“离线优先、无动态服务器”的设计哲学对开源图形工具的资源管理有很高参考价值,适合 Blender 用户、工具开发者以及关注资产管线工程化的读者,可以迁移到类似的静态资源分发场景中。

工程实践Dropbox Tech

How our universal content processing platform Riviera evolved for AI and beyond

文章回顾了 Dropbox 内部内容处理平台 Riviera 近十年的演进历程。平台最初为解决多文件格式预览需求而设计,关键思路是将每项任务拆解为可复用的转换片段(如 PowerPoint→PDF→图像),从而避免为每个产品单独构建管道。架构上采用中心调度器与插件化后端 worker 分离的模式,中心负责请求验证、缓存与编排,worker 按转换类型独立扩展,现已支持 300+ 文件格式与 100 多种转换能力,每秒处理数十万请求。随着产品线扩展,Riviera 被搜索、视频审阅、电子签名及 AI 产品 Dash 等团队复用,为 AI 模型统一提供文档提取与格式转换。文章最后说明了平台向外部开发者开放 API 和 MCP 工具的策略,体现了“一次构建、多方受益”的平台工程价值。文章侧重于架构决策与规模效益,未深入具体实现细节或失败案例。

推荐收录。文章提供了真实的大型内容处理平台从单点服务到多产品基座的演进案例,清晰展示了复用、分离关注点和插件化架构如何支撑规模增长与业务扩展。适合平台工程、基础设施设计以及需为 AI 准备非结构化数据的工程师参考,其架构思维和平台化策略具有直接迁移价值。不足之处在于缺少性能瓶颈、失败处理或维护成本的讨论,但整体工程经验仍具有长期参考意义。

技术文章ACM Queue Articles

Beyond Zero: Enterprise Security for the AI Era

文章提出了面向AI时代的“Beyond Zero”安全范式,以应对自主AI代理兴起和数据访问加速对应用为中心零信任模型的冲击。其架构将信任边界从应用级缩小至每个操作,在机器速度下对人和代理进行每资源访问决策,并将静态授权保证与动态AI推理相结合,构建每秒调解数千决策的自防御企业。文章还概述了谷歌对该访问模型的愿景,并呼吁行业协作与标准制定。该范式目前仍处于架构构想阶段,缺乏大规模落地的实证细节,且依赖跨厂商共识,实际推广尚有不确定性。

推荐收录,因为文章出自ACM Queue,针对零信任在AI代理与数据访问高速化下的局限性,提出了逻辑清晰的Beyond Zero架构,将静态授权与动态AI推理结合,具有长期参考价值。适合安全架构师、AI工程化团队和前沿安全研究者阅读,其中的安全边界收缩和实时决策理念可迁移至其他高自动化系统的安全设计。

工程实践知乎 - 腾讯技术工程

AI代码生成率94%:我们用一个 Skill 跑通需求开发全流程

文章系统介绍了企业微信团队如何通过构建一个名为Skill的AI工作流,在移动端需求开发中实现94%的代码生成率。核心方法是将需求开发拆解为设计稿筛选、需求拆解、代码定位、实现、编译验证、模拟器验证、沉淀和提交八个严格顺序的语义化阶段,并围绕四条公理设计:以五步定位法缩小搜索范围、把数据采集和精确操作交给脚本而LLM只负责判断、通过可机器校验的红线机制前置拦截风险、利用TECH_SPEC.md和知识库实现跨会话知识传承。关键技术包括构建三级金字塔代码知识库、需求语义翻译的规则化、编译与模拟器自动验证等。文章强调工程化规范对AI提效的决定性作用,沉淀的产物不仅对AI有用,也便于人类开发者接力。适用边界在于需要团队先期投入构建知识库和规范,且实例基于iOS移动端,但方法论可迁移至其他工程领域。

本文提供了将AI辅助开发从零散问答升级为工程化主导的完整实践,详细阐述了流水线设计、代码知识库构建、需求翻译、自动验证等关键环节的具体实现和取舍,而非空泛理念。适合关注AI工程化、开发者工具效能提升的团队和技术管理者参考,其将开发流程显式建模、用脚本与红线约束AI行为、通过知识库实现人机协作的方法具有很强的可迁移价值,但需评估自身项目上下文和投入成本。

工程实践知乎 - 鹅厂架构师

AI Native Is All You Need

文章通过美团小团、Figma Config 2026 和米哈游 LPM 三个案例,重新审视 AI Native 的产品形态。作者指出,小团以 LUI 接管传统 GUI 交互链路的效率提升并非绝对,某些浏览和比较过程本身就是产品价值;Figma 则保留 Canvas 并借助 AI 将代码、动画和生成能力引入同一创作空间,说明 AI 不应简单取代原有界面;LPM 从实时反应而非视频生成出发,重新定义虚拟角色的互动方式,让 AI 成为游戏世界运行的基础。文章最终提出 AI Native 的核心不在于加入 AI 功能,而在于追问过去基于旧技术限制的产品结构是否仍然必要,以及 AI 带来了哪些新可能。分析主要从产品设计角度展开,较少涉及具体技术实现,适合思考产品架构和交互范式的读者。

文章以清晰的案例分析展示了 AI Native 的多种产品设计路径,从 LUI 接管交互到保留 Canvas 再到从 AI 能力反向定义产品,为从事 AI 相关产品、架构或人机交互设计的读者提供了可迁移的思考框架。虽然缺乏技术实现细节,但它对产品结构、用户需求和历史妥协的反思具有长期参考价值,可帮助避免盲目跟风“AI 化”。

工程实践Marc Brooker

Aurora DSQL: Scalable, Multi-Region OLTP

Marc Brooker在这篇博客中介绍了Aurora DSQL论文,重点阐述了系统的整体目标:构建一个简化应用构建与运维、无需关心规模与可靠性的关系型数据库。文中强调了架构解耦的设计思想,将查询处理、事务、复制和控制面拆分为独立服务,并总结了来自Aurora与DynamoDB等系统的运营教训,如避免大缓存、提供强一致可扩展读、将昂贵操作下推到存储层。作者还讨论了乐观并发控制(OCC)在避免客户端阻塞和减少尾延迟方面的优势,以及多区域场景下的快速读写能力。博客最后指出,硬件与数据中心设计的进步使得强一致性成为更优选择,并提供了论文链接供进一步阅读。

作为Aurora DSQL系统的核心设计者之一,作者以第一视角提炼了论文的关键设计决策与运营经验,浓缩了现代分布式OLTP数据库的核心理念。文章对解耦架构、一致性选择、多区域扩展等问题的论述既权威又简明,适合分布式系统工程师、架构师及关注数据库技术演进的研究者快速获取全局认知,其总结的教训可迁移至其他大规模系统设计。

工程实践知乎 - 网易易盾

多模态内容安全怎么做?文本图片音频视频联合检测方案

文章系统介绍了多模态内容安全检测的必要性与工程方案。面对攻击者通过图文组合、音频隐藏、视频帧嵌入等方式实施的跨模态攻击,单一模态审核已出现明显盲区。作者提出包含全模态接入解析、单模态深度优化、多模态融合推理和流式实时检测的四层能力体系,覆盖文本、图片、音频、视频、文档和直播流。方案分析了时间对齐、语义对齐和计算效率等关键挑战,并给出分级调度降成本、动态调整关键帧间隔等工程实践。文章也客观指出了不同模态成熟度差异、准确率受模态组合影响等边界,为多模态安全系统选型与落地提供了可迁移的参考。

推荐收录,因为它不局限于单一模态的调优,而是完整展示了从攻击手法演进到多模态联合检测的工程化思考,包括架构设计、流式实时处理和成本优化等真实工程约束。适合关注内容安全、反欺诈、实时审核系统的工程师与架构师,文中分级调度、流式滑动窗口、分模态评估等思路可直接迁移至类似大规模多模态系统。

工程实践知乎 - NGINX洪志道

10 | 好的软件设计,是 AI 编程的天花板

作者基于NGINX嵌入Lua开发了一个Web Runtime(nginx-lua-web),并借助AI辅助完成完整实现、自动化测试和性能对比。文章核心论点是:软件原有设计的质量决定了AI编程所能达到的天花板。项目难点在于端到端异步流式处理,涉及读、写、超时、背压等交织的复杂性,NGINX清晰的事件驱动架构、内存池、cleanup机制和模块边界为AI提供了可推理的上下文,使AI能够有效生成符合规范的C代码,并维持约7/10的代码质量和连贯设计。性能测试表明,增加Lua层后未付出失控代价。作者总结,AI加速了理解系统的过程,但理解本身才是对抗复杂性的基本能力,好的设计是AI放大的基础。文章以单个C扩展项目为案例,结论可能受限于特定技术栈,但提供了关于AI与系统设计关系的可迁移洞见。

推荐收录,因为文章结合真实工程案例和AI辅助开发经验,具体展示了软件设计如何制约AI生成代码的质量与系统复杂度管理。适合关注AI工程化、系统架构和扩展设计的读者,其分析方法、性能验证手段和设计原则可迁移至其他类似异步高并发系统的开发中。

工程实践知乎 - SmartCode 得物技术

从"机械应答"到"服务伙伴":得物高可控智能客服的 Agent 工程实践|AICon 演讲整理

文章分享得物智能客服从传统流水线向高可控 Agent 架构的演进实践。针对意图理解差、多轮协商弱和人工成本高等痛点,团队依次尝试了 Single‑Agent、基于 AutoGen 的 Multi‑Agent(总控/出话/评估/润色)以及跨场景 Harness 架构,实现动态调度和跨会话记忆。为降低长尾 case 的 Prompt 优化成本,构建了 PE 自动化流水线与 DPO 数据飞轮;并引入 GRPO 强化学习训练,让 Agent 学会在工具调用与自推理间正确决策。此外,通过模型蒸馏对齐优秀客服话术、表情和情感温度,并设计半双工消息流控制以匹配客服场景的特殊性。该实践覆盖架构设计、数据工程、模型训练和系统控制,适合真实客服系统的工程化落地参考。

文章系统梳理了从单 Agent 到 Harness 架构的完整演进路径,给出了 PE 自动化、RL 决策训练和情感对齐等具体工程方案,数据翔实、方法可迁移,对智能客服、对话式 AI 及 AI 工程化团队具有直接参考价值。

工程实践Meta Engineering

Exploring Hierarchical Interest Representation For Meta Ads Deep Funnel Optimization

本文介绍了 Meta 广告漏斗深度优化中的层级兴趣表征系统,旨在通过统一嵌入连接用户、广告主与产品。系统基于大规模异构交互图,融合多模态世界知识(由 LLM 处理)以缓解稀疏信号问题,并采用 Transformer 架构实施层级编码:引入图结构偏差的注意力机制(使用 FlexAttention 实现内存高效计算)、自监督跨视图蒸馏(结合 Sinkhorn-Knopp 均衡)与交互预测联合训练。最终输出通用嵌入和“意义包”离散令牌,可服务于检索、排序等下游任务。文章详细阐述了图构建、在线基础设施、因果性保证与规模化训练流水线,提供了工业级推荐系统在复杂图学习上的工程实践,但方法高度依赖 Meta 内部平台与数据规模,迁移时需考虑领域适配。

推荐收录。本文来自 Meta 工程博客,系统披露了用于大规模广告推荐的上游层级兴趣表征系统,完整覆盖从图构建、多模态知识融合、Transformer 层级编码到在线推理的工程细节,并公开了 FlexAttention、跨视图蒸馏等具体设计决策与缩放经验。适合推荐系统、图学习及大规模 ML 基础设施方向的研究者和工程师参考,可迁移至处理稀疏信号、层级表征与工业级图应用的场景。需注意部分架构深度绑定 Meta 生态,但核心思想与权衡思路具备通用价值。

工程实践知乎 - 千问云

给野马套上缰绳:Agent Harness 工程实践 ——从范式理论到钉钉AI招聘的真实落地

本文系统阐述Agent Harness Engineering理念,从Mitchell Hashimoto的定义出发,结合LangChain、Anthropic等团队实践,提出上下文越少越好、专才优于通才、状态落盘、约束可执行四条反直觉铁律,并总结双阶段架构、工具签名即文档、Sub-Agent隔离等六大工程模式。作者通过钉钉悟空AI招聘Agent的真实案例,详细展示从全能Agent失败到2 Agent+N Skill架构的改造过程,包括分拆职责、Workspace状态管理、Linter硬护栏等,给出显著的效果提升和血泪经验。文章强调Harness是AI时代软件工程的重新发明,对从事Agent系统设计的开发者有直接参考价值,但部分数据仅限内部场景,需结合具体业务验证。

本文从理论到实践均十分深入,既有LangChain、Anthropic等行业标杆的Harness选择分析,又有钉钉AI招聘Agent从失败到成功的完整复盘,展示了真实工程约束下的架构取舍和可执行护栏设计。适合正在构建或优化Agent系统的工程师、架构师及AI工程团队阅读。文中提炼的铁律和模式,如专才Agent拆分、Workspace状态管理、硬护栏落实,具有很强的可迁移性,能直接指导生产实践,因此推荐收录。

技术文章PlanetScale Blog

Making 768 servers look like 1

文章从数据库扩展瓶颈出发,解释了单节点和只读副本在写入吞吐、数据容量和备份速度上的局限,进而说明为何分片是超越数TB数据的必需方案。以存储1PB数据、跨越256个分片共768台服务器的场景为例,文章重点阐述代理层如何通过查询解析、路由规划和连接池,将众多分片对外表现为单一数据库。文中介绍了基于哈希的分片策略、JSON拓扑配置,并给出从应用经网络负载均衡到代理再到分片的完整数据流。文章主要提供架构层面的概览与工具选择(Neki for Postgres、Vitess for MySQL),而非深入实现细节,适合正在规划数据库扩展的工程师建立整体认知。

该文以清晰的架构图和具体规模为例,系统梳理了数据库分片的核心挑战与代理层设计,对理解分片系统的整体运作有实际参考价值。适合需要应对数据量增长的研发、DBA和基础设施工程师,可迁移的分层架构与路由思想能直接指导技术选型和方案设计。

工程实践Instacart Tech Blog

Blueberry: Force Multiplier For The On-Call Engineer

本文深入介绍了Instacart开发的Blueberry系统,一个面向值班工程师的Slack原生推理框架。核心目标是缩短从告警触发到获得首条可执行洞察(TTFI)以及验证推断(TTTT)的时间。系统架构以持久化作业队列实现诊断过程可靠性,通过三层模型上下文协议(MCP)表面组合共享与团队专属工具,并支持并行子代理进行证据采集。在实际运行中,Blueberry在2026年4月处理超2.5万次诊断,TTFI和TTTT中位数约3分钟,成功率达99.9%。文章通过多个案例展示了系统如何快速定位根因、通过多轮对话排除不相关变更、利用历史模式识别外部中断,以及并行处理大规模告警风暴。其关键贡献在于将隐性运维知识外化为可复用基础设施,提升团队协作和排障效率,同时指出安全行动闭环仍在测试中。

本文是一个高质量工程案例,完整记录了生产级AI运维系统的设计决策、架构权衡和量化成效,尤其适合从事SRE、DevOps或AI工程化的团队参考。文中展示的持久化推理、分层工具集成和证据驱动排障模式具有明确的可迁移价值,对希望构建类似协作式值班助手的组织有直接启发,但需注意其强依赖Slack生态和内部工具链。

工程实践Slack Engineering

Shipyard: How We Built Slack’s Next-Generation EC2 Platform

本文介绍了Slack构建下一代EC2平台Shipyard的工程实践。面对传统Chef管理长期运行实例导致的配置漂移和部署风险,团队转向以不可变性为核心的设计,通过分层黄金镜像slack-zero、服务特定AMI、烘焙与配置分离、基于指标的渐进式部署和自动化安全控制,将基础设施视为可部署制品。平台支持多架构和多操作系统,提供快速实例供应、实时库存系统Peekaboo和Reaper生命周期管理,确保集群始终运行在新鲜状态。文章还讨论了测试框架Ship Quick、紧急修复路径、秘密管理的半不可变妥协以及未来对长生命周期实例的支持计划,为大规模云基础设施现代化提供了可迁移的架构模式和运维经验。

推荐收录。本文详细记录了Slack从可变基础设施向不可变EC2平台演进的完整工程过程,包含分层镜像设计、自动化部署体系、生命周期治理和测试方法等具体实现细节与权衡,为云平台团队提供了高价值的参考案例。适合基础设施工程师、SRE及平台开发者了解如何在高负载生产环境中安全地推动现代化改造,其中的分层构建、渐进式部署和强制刷新等模式可直接迁移至类似系统。

工程实践Netflix TechBlog

Building Service Topology at Scale: Architecture, Challenges, and Lessons Learned

本文详细介绍了Netflix构建实时服务拓扑系统的完整工程历程,涵盖架构设计、生产环境挑战与持续优化。系统采用流式优先的三阶段分布式聚合流水线,结合反向压力、动态一致性哈希和时间窗口聚合器,实现了对网络流日志、IPC指标的高吞吐处理与历史拓扑查询。文章重点分析了Kafka消费滞后、热点节点、内存与GC压力、响应式流复杂性等关键问题,并通过重分布、使用可变数据结构替代不可变对象、更换通信协议等务实手段解决。作者强调,在超大规模下测量驱动迭代优化比遵循教条更重要,同时也指出了响应式流心智模型的高成本。该案例为构建大规模分布式数据流水线提供了可迁移的架构模式与性能调优经验,但部分技术选型需结合自身场景评估。

本文收录理由在于它提供了从0到1构建大规模服务拓扑系统的完整工程案例,而非浅层介绍。作者坦诚分享了架构权衡、失败教训和优化方法论,对分布式系统、流处理和可观测性领域的工程师有直接参考价值。可迁移的核心经验包括多阶段重分布解决数据倾斜、背压实现优雅降级以及性能优化时的务实取舍,但采用时需结合自身规模与技术栈做适配。

工程实践美团技术团队

正式开源!美团 LongCat-2.0 同步开放国产卡推理代码

本文介绍美团万亿参数大模型 LongCat-2.0 在国产算力集群上的推理优化与开源实践。面对国产芯片显存、带宽和互联受限的挑战,团队从模型架构(LongCat 稀疏注意力、ScMoE 核心级并行、N-gram Embedding)、芯片适配(Super Kernel、Weight Prefetch、KV-cache 传输)和部署策略(PD 分离、EP 负载均衡、多推理特性适配)三个层面进行深度协同优化,实现了百万级上下文的高效推理。此外,模型通过多教师在线蒸馏和 MOPD 架构融合了 Agent、推理与交互能力。文章指出,该方案已在真实 Agentic Coding 任务中稳定运行,验证了国产芯片承载复杂大模型的可行性,并通过开源提供可复现的技术路径。

推荐收录,因为本文详细展示了在显存与带宽受限的国产硬件上部署万亿参数大模型的完整工程方案,包括模型、芯片适配和部署多个层面的协同优化,有明确的技术细节、架构取舍和验证结果。对于从事大模型推理优化、国产算力适配或大规模分布式服务的工程师,文中的稀疏注意力、ScMoE 算子融合、PD 分离部署和 EP 负载均衡等实践具有直接的迁移价值,也体现了在约束条件下进行系统设计的工程思维。

工程实践知乎 - 鹅厂架构师

从智能体开发到日常构建:Harness Engineering思维的跨界思考

文章系统阐述了Harness Engineering(驭缰工程)这一AI时代工程范式,提出“智能体=模型+驭缰系统”核心公式,并拆解了执行运行时、上下文管理、能力层、治理层、可观测性五层生产级架构。作者深入解读了六条源自实战的方法论,包括先磨设计规格文档、优先补齐关键规则、将高频动作下沉为Skill、按认知负载拆分多Agent等,强调了渐进式复杂度管理和约束先行的构建哲学。结合OpenAI、Stripe等案例验证了约束系统对AI应用成功的关键作用,并将该方法论跨界迁移至个人小程序、团队网页协作、Demo原型等日常开发场景,展示了其作为通用构建哲学的潜力。文章以方法论和思维启发为主,对工程实践中的边界设计与增长节奏给出了可操作建议,但缺少底层技术实现细节,更适合中高级开发者或技术管理者作为架构决策参考。

本文不是浮于表面的AI工具介绍,而是从Harness Engineering这一前沿概念出发,提炼出可跨领域迁移的构建哲学。它既有Mitchell Hashimoto等人的原始洞见作为依据,又通过OpenAI、Stripe等业界案例提供了实证支撑,更难得的是将抽象方法论落地到小程序、网页等日常开发中,展示了清晰的迁移路径。适合正在构建复杂系统或希望提升工程思维的技术负责人和开发者阅读,文中‘约束即赋能’、‘按认知负载拆分’等思想能有效指导实际项目中的架构边界与增长节奏控制。

工程实践Cloudflare Blog

Improving Smart Tiered Cache for Public Cloud Regions

文章详细说明了 Cloudflare Smart Tiered Cache 在公共云 anycast 源站上遇到的挑战:anycast IP 导致延迟探测无法锁定唯一最优上层数据中心,可能产生跨洲回源和缓存效率下降。解决方案是引入云区域提示,用户指定源站所在云区域后,系统利用各云厂商的 IP 范围文件和持续延迟探测为每个区域赋予主上层和备用上层,并在探测数据不足时回退到地理近似。文章介绍了 anycast 检测原理、区域到上层映射的投票机制,以及通过控制台、API 和 Terraform 进行配置的方式。该功能目前支持 AWS、GCP、Azure 和 Oracle Cloud,旨在提升缓存命中率、降低延迟,但需手动提供提示且仅适用于已支持的云提供商,边界清晰。

推荐收录,因为文章不是简单的功能通告,而是深入剖析了 Smart Tiered Cache 在 anycast 公共云环境中的局限、解决方案的技术细节和配置方法。适合负责 CDN、边缘网络、缓存策略或基础设施性能优化的工程师参考,其中的问题分析框架和自动化映射思路可迁移到类似分布式系统的网络拓扑优化场景。

工程实践知乎 - 鹅厂架构师

OpenClaw:把权限交给概率推理引擎,安全边界该如何重构?

本文由腾讯工程师撰写,深入分析开源自主AI代理框架OpenClaw的安全风险与防御策略。文章从OpenClaw的系统架构(网关、智能体循环、Lane Queue、内存管理)出发,揭示其将系统权限交给概率推理引擎所带来的新型安全边界挑战,随后详细剖析了提示注入、身份劫持、供应链攻击(ClawHub)等真实威胁的成因与攻击手法,并结合ClawJacked等具体漏洞案例说明。在此基础上,提出了一套涵盖基础设施隔离(云主机/VM/Docker强化)、访问控制(令牌认证、网络绑定)、行为治理(命令白名单、文件访问限制)、供应链审计及主动监控的纵深防御体系。结论强调,AI代理将传统确定性代码安全转变为概率性意图安全,防御重心需从防止非法访问扩展到治理合法行为,并建议采用最小特权与物理隔离原则。分析聚焦于OpenClaw生态,但安全原则可迁移至其他自主代理系统。

推荐收录,因为文章不是浅层介绍,而是从架构原理出发,结合具体漏洞案例(如ClawJacked、供应链投毒)进行系统性安全剖析,并给出了可落地、分层的防御方案。对从事AI工程化、安全架构和自主代理开发的读者具有直接参考价值,其提出的‘意图安全’理念和纵深防御策略可移植到类似系统的安全设计中。

工程实践知乎 - SmartCode 得物技术

得物 OceanBase 落地实践

文章详细记录了得物将 OceanBase 作为多模数据库引入的完整工程实践。面对 MySQL 在 TP/AP 混合负载下性能瓶颈、存储成本高和运维复杂等问题,DBA 团队从选型对比、性能压测、复杂 SQL 优化到业务迁移全流程展开验证。通过计划缓存、分区裁剪、列存索引、并行执行和 Hint 干预等五步优化,将两类聚合查询的执行时间分别从 1.3s 和 3.9s 降至 0.01s 和 0.02s,并获得与 DuckDB、StarRocks 对比的详细性能数据。在真实业务迁移中,SQL 平均耗时下降 88.3%,存储压缩率超过 80%,总体降本 43%,并消除了异构数据同步和手动分流风险。文章同时总结了迁移中遇到的实时物化视图与 DDL 冲突、SQL 语法兼容等具体问题及应对方案,并规划了运维体系转型和团队能力建设路径。该实践适用于有 TP/AP 混合负载、追求成本与可用性平衡的场景,但需注意新功能边界和版本限制。

推荐收录。文章不是泛泛的产品介绍,而是提供了从选型对比、性能压测到生产迁移的完整技术链条,包含具体的 SQL 优化思路、量化收益(近 200 倍提升、43% 降本)和踩坑记录,对考虑 OceanBase 落地或从 MySQL 迁移到分布式数据库的架构师、DBA 有直接可复用的参考价值。文中的五步优化法、物化视图使用约束和运维体系转型经验均具备可迁移性,风险提示也较为坦诚。

工程实践Salesforce Engineering

Building Enterprise AI Agents That Are Both Autonomous and Reliable

文章围绕 Salesforce 在 Agentforce 中构建企业 AI Agent 的实践,提出“guided determinism”作为核心架构:用确定性的编排层约束 LLM 的概率性输出,让代理在身份验证、退款授权、升级路由等高风险流程中保持可审计、可恢复和可验证。作者用退款代理误把“very valid and very verified email”当作证据的例子说明,单靠 prompt engineering 无法提供企业所需的规则保证,因此需要把工作流建模为 Agent Graph,由节点、边、硬校验门和运行时状态共同控制执行路径。文中进一步说明用专门子代理拆分路由、验证、冲突消解和事务处理,并在路由环节采用 8B 到 32B 的小型微调模型以降低延迟和成本。最后,文章强调通过合成测试、LLM 评审、深度 trace 和行为指标持续验证运行时可靠性。其边界在于这套方法主要适用于有明确流程与高可靠要求的企业任务,对开放式创意对话并不追求完全确定性。

文中给出了从提示词到运行时编排的完整架构迁移证据,包括 Agent Graph、子代理拆分、小模型路由和可观测性体系,属于可复用的企业 AI 工程经验。适合做 AI 平台、工作流自动化和高风险交易代理设计的参考,但需注意其结论带有明显产品实现视角。

工程实践Cloudflare Blog

Your Worker can now have its own cache in front of it

这篇文章介绍了 Cloudflare Workers Cache:一种位于 Worker 前面的分层缓存,开启后可直接命中缓存而不执行 Worker,从而减少延迟并避免 CPU 计费。作者说明它完全由 HTTP 语义驱动,主要通过 Cache-Control、stale-while-revalidate、Vary、Cache-Tag 和程序化 purge 来控制缓存行为,而不是依赖 zone 级规则。文章进一步强调这是“Worker 自己的缓存”而非站点缓存,缓存会跟随 Worker、preview、workers.dev 和多租户场景,并支持按 ctx.props 构造多租户安全的 cache key。对于复杂应用,它还能插在多个 entrypoint 之间,让认证、归一化、重度计算和数据层分别决定是否缓存,组合出“近用户 + 近数据”的执行路径。文末也指出一些边界:认证请求需避免自动 bypass、需要控制 Vary 维度膨胀,且部分与 Smart Placement 的协同和响应体大小限制仍在演进中。

收录理由很明确:文章给出了可直接落地的缓存架构、HTTP 控制面设计、按入口点组合缓存的方式,以及多租户安全与失效策略的具体实现。适合做边缘计算、SSR 性能优化、平台架构和缓存设计的长期参考,尤其对使用 Workers、服务绑定或多入口应用的工程师有迁移价值。

工程实践Grab Tech

Migrating Counter Service storage: Design choices and learnings

文章复盘了 Grab 将 Counter Service 从宽表数据库迁移到 Aerospike 的全过程,核心不是简单换存储,而是先重构读写分层,再按访问模式重新设计数据模型。读路径上,作者把存储访问从业务逻辑中抽出,采用带枚举分发的 facade,并通过 shadow read、split traffic 和配置切换实现无停机、可回滚迁移。写路径上,团队尝试了按桶存行、Secondary Index 和 BatchGet,最终选择“单 counter 单记录 + 有序 map”的结构,用原子 MapIncrement 和显式清理旧桶来降低索引和磁盘占用。文中还记录了 Rust 客户端不成熟、DNS 解析和 NVMe 索引实验带来的问题与回退原因。最终系统在读延迟、成本和存储 footprint 上都有明显收益,但这些收益主要来自 schema 与架构重构,而非数据库替换本身。

推荐收录,因为文章给出了迁移前后的存储分层、影子流量、逐步切流、数据建模和回退验证等完整证据,而不是泛泛谈“换数据库”。适合做存储迁移、在线系统无停机改造和性能/成本权衡的参考,尤其对需要处理高 QPS 计数服务的工程师有直接迁移价值。

工程实践Elastic Security Labs

Inside Elastic InfoSec's agentic SOC: cutting alert triage from 30 minutes to under 3

这篇文章复盘了 Elastic 内部 InfoSec 团队如何把告警分流做成“agentic SOC”流水线:先用确定性的 ES|QL 查询处理可直接判定的误报,再由窄职责的初筛 Agent 处理其余告警,最后交给按域划分的专项 Agent 和 Final Review Agent 汇总结论。文章给出了完整的编排思路:检测规则触发 Workflow,按告警类型做富集,复用同一份上下文写入 Kibana Case,避免多个 Agent 重复查询同一数据。作者强调在自动化场景下,确定性查询比 LLM 更快、更便宜、可审计,而专用提示词和小工具集比通用大 Agent 更稳定。文中还说明了模型推理的数据保留要求、零信任/高敏环境可自建模型,以及该方案主要适用于 Elastic 原生栈和高告警量 SOC。它的价值在于把“哪些检查该写成查询、哪些判断交给 Agent、如何把证据链写回案例”讲得很具体,但可迁移性会受平台能力和数据接入范围限制。

收录依据很明确:文章不仅描述了 30 分钟人工分流降到 3 分钟以内的结果,还给出了 ES|QL 先行、专项 Agent 分工、Final Review 统一裁决的完整实现路径。适合做 SOC 自动化、AI 编排和安全运营设计参考,但迁移时需注意它强依赖 Elastic 原生组件与特定数据源。

工程实践知乎 - NGINX洪志道

06|从哪个功能开始:最小、核心的流式处理

文章围绕一个 NGINX Lua Web runtime 的开发顺序选择展开,核心结论是应先实现 Stream,而不是先做 Headers、Request 或 Response。作者认为 body 才是请求、响应与 fetch 的共同底座,只有先把流式数据模型立住,后续 API 才不会停留在表层封装。文章进一步分析了流式处理的复杂性:它同时涉及客户端、上游和 Lua 自身创建的流,还要处理生产端、消费端、异步等待、状态保存以及 NGINX 事件与 Lua coroutine 的协同。作者指出,Headers 虽然更容易实现、也更适合快速出成果,但对系统最核心的异步与数据流问题牵引不足。本文的价值在于用最小可验证功能暴露架构关键点,帮助读者理解如何用功能排序来对抗复杂性。

推荐收录,因为文章明确给出了“先做 Stream、后做 Headers”的工程证据,并解释了 body 作为 runtime 底座为何决定整体架构形态。适合做 Web runtime、异步 I/O 和系统设计的项目规划参考,但它更偏方法论与阶段选择,尚未给出完整实现细节。

工具笔记知乎 - 鹅厂架构师

Loop Engineering 实践指南:在 CodeBuddy 中构建自主循环系统

文章提出 Loop Engineering 这一面向 AI 编程的“外层循环”设计:不再让人类在每一步介入,而是把目标、验证标准、状态管理和恢复机制外置,由 AI 在受控规则下持续推进任务。作者将 ReAct 视为单任务内的 inner loop,而 Loop Engineering 负责跨任务编排,强调 Discover-Plan-Execute-Verify-Iterate 闭环、对抗验证、断点续跑和多 Agent 并行。全文结合 CodeBuddy 的 /goal、/loop、Automations、Team、Skills、MCP、Rules、Memory 等机制,说明如何把抽象范式落到实际工具链。文中给出迁移、CI 监控、评审协作、知识固化和状态持久化等案例,并提示目标必须可度量、评估器要独立、循环要设置上限。其边界在于高度依赖工具支持,且不能替代人工审查,适合 AI 编程平台设计与智能体工作流实践参考。

收录的直接证据是文章不仅解释了 Loop Engineering 与 ReAct 的层次差异,还给出 /goal、/loop、Team、Skills、MCP、Memory 的具体落地方式和条件写法。适合 AI 编程工具、agent 编排和开发效率优化读者参考;但内容带明显 CodeBuddy 产品色彩,迁移时需注意工具绑定。

工程实践知乎 - SmartCode 得物技术

从狂野代码到按目标生产:得物推荐 AI Harness 的工程化实践|AICon 演讲整理

文章梳理得物推荐团队自研 AI Harness 的工程化实践,核心目标不是让 AI 只会写代码,而是把需求、开发、评测和复盘纳入 PDCA 闭环,让 AI 在复杂推荐系统中按目标生产。作者将流程拆成 Plan/Do/Check/Act 的七阶段护栏:用结构化 Contract 约束需求,用零等待环境支撑执行,用 AI 评测平台做 7x24 体验检查,并把 Bad Case 回流为可复用经验。文中还提出 L1/L2/L3 知识治理与 Highway+ATV 混合 Agent 架构,用确定性代码覆盖高频路径、用受控探索处理长尾问题。文章给出了补充注释后准确率提升、token 消耗下降等结果,但整体更偏体系框架与方法论,具体实现细节仍留待后续篇章展开。

文章直接展示了将 LLM/Agent 纳入推荐系统生产链路的完整工程框架,并给出 Contract、7x24 评测和混合 Agent 的落地证据。适合做 AI 工程化、推荐系统和研发流程治理的参考,尤其对想把生成式 AI 变成稳定生产能力的团队有迁移价值。

工程实践知乎 - 千问云

如何搭建一个端到端业务需求专家 Agent

文章提出一种面向业务需求交付的端到端 Agent 方案,核心观点是代码生成已不是瓶颈,真正昂贵的是需求澄清、方案确认、实现协同、验收取证和结项沉淀之间的串联成本。作者将系统拆成上下文输入、业务专家编排、工具执行和反馈学习四层,并用需求进入、澄清、方案、TDD 实现、CR 协同、独立环境验收、发布观察、结项蒸馏串成闭环。文中强调把 requirements、plan、progress、评论、日志等过程材料留在项目记忆中,再在结项时筛出稳定知识回流长期 wiki,避免噪声污染。实现上依赖 CLI、沙箱、CR 评论、git hook 等工程化硬门禁,而不是单靠 prompt 约束。文章也明确了边界:首次接入成本、度量体系不足,以及未来从单 Agent 走向多 Agent 协作仍待验证。

推荐收录,因为文章给出了可落地的端到端 Agent 研发闭环,而不是停留在单次写代码演示:上下文管理、质量门禁、评论留痕和结项蒸馏都有具体工程设计。适合做 AI 工程化、研发提效和 Agent 工作流设计的参考,但读者也需注意其依赖较强的平台集成与组织流程前提。

工程实践Salesforce Engineering

Inside Unified Planner: The AI Brain Behind Agentforce

文章介绍 Salesforce 为 Agentforce 构建的 Unified Planner:一个统一的 AI 执行与推理运行时,用来同时支撑语音、文本、聊天以及 MuleSoft 等场景。作者解释了旧体系中 Agent Graph 与 Voice Planner 各自演进导致的能力割裂、重复实现和运维不一致,并通过将平台级职责与客户业务流程解耦来完成统一。性能上,团队把原先串行的提示注入检测、检索、校验、上下文收集等步骤改为可并行执行,并允许多工具调用并发,从而把部分响应延迟从约 20 秒降到 2.3 秒。文章还讨论了模型选择、迁移生产代理的安全验证、特性分阶段放量,以及面向视频等未来多模态交互时在表示、推理和扩展性上的新挑战。整体更偏真实平台重构与 AI 运行时设计经验,适合关注低延迟 AI 系统、统一架构和生产迁移的读者。

收录理由明确:文中给出了统一运行时、并行化执行和生产迁移验证的具体做法,并量化说明了延迟从 20 秒降到 2.3 秒。适合做 AI 平台、Agent 运行时和多模态系统设计的参考,尤其对需要在低延迟、可扩展与一致性之间做取舍的工程团队有直接迁移价值。

工程实践Netflix TechBlog

GenPage: Towards End-to-End Generative Homepage Construction at Netflix

文章介绍 Netflix 将首页推荐重构为端到端生成式系统 GenPage:把用户历史、画像和请求上下文序列化为提示词,再由单个 decoder-only Transformer 自回归生成整页首页,包括行、实体和布局。训练上沿用 LLM 方案,先做 next-token 预训练学习“首页语言”,再用加权二分类或强化学习做后训练,以对齐用户满意度和页面级奖励。工程上作者重点解决了实时延迟、冷启动、目录更新、业务规则约束和增量训练等问题,采用领域定制分词、语义 embedding 融合、fallback token、约束解码与混合行解码来兼顾可控性与效率。离线实验显示,丰富上下文往往比单纯扩大模型更有效,RL 还能提升页面多样性;在线 A/B 中,GenPage 在核心参与度指标上显著优于成熟多阶段基线,同时将端到端延迟降低约 20%。文章也指出当前仍依赖部分手工摘要,长上下文与更通用的语言/多模态能力仍是后续方向。

推荐收录,因为它给出了把推荐系统改造成生成式 Transformer 的完整工程链路:数据表示、训练范式、RL 对齐、业务规则约束与线上验证都有直接证据。适合做个性化推荐、AI 工程化和大模型落地的读者参考,尤其可迁移的是“先丰富上下文再扩模型”“用约束解码保业务规则”“用混合解码降延迟”的方法。

工程实践知乎 - 腾讯技术工程

开启Harness Engineering探索之旅:从AI 写得快到干得稳

文章围绕“Harness Engineering”展开,指出 AI Coding 的瓶颈已从提示词和上下文转向模型外部的运行框架:如何让 Agent 稳定工作、可验证、可回溯。作者结合腾讯团队实践,提出 Agent = Model + Harness,并把研发链路拆成 P1 需求、P2 设计、P3 实现、P4 测试、P5 部署、P6 归档六个阶段,配合协议层、纪律层和可监测性机制,强制产出结构化文档、评估分数、日志与知识沉淀。文中还描述了线上运营轨道、长期知识库、失败自愈、日志检索和成本度量等配套设计,强调“确定性过程脚本化、不确定性过程门禁化”。作者同时坦承该体系仍有局限:老项目初始化成本高、下游反馈未完全打通、知识库治理与测试可信度仍在演进中。整体适合参考其工程方法,而非直接照搬其内部协议与工具栈。

推荐收录,因为文章给出了可落地的 AI 工程化框架、P1-P6 研发管线门禁、监测与自愈闭环等直接证据,不是泛泛而谈。适合做 Agent 工作流、研发提效和可靠性设计参考,但其细节强依赖内部工具与流程,迁移时需重建契约和观测体系。

技术文章Ken Shirriff

Examining circuit boards from the Space Shuttle's I/O Processor

这篇文章以作者实物拆解的两块 Space Shuttle I/O Processor 电路页为线索,系统梳理了航天飞机计算机的 I/O 架构。作者先说明 IOP 并非普通外设,而是连接 CPU 与 24 条数据总线的独立可编程处理器,采用 25 个虚拟处理器的 barrel processor 设计,由 BCE 和 MSC 两套完全不同的指令集分工完成网络搬运与调度。随后文章重点分析了 MIA 网络接口页的模拟前端、变压器隔离、Manchester 编码/解码、串并转换与校验逻辑,以及 PROM 页如何用熔丝 ROM 存放 72 位微指令并驱动物理处理器。文中还比较了 IBM 4 Pi 标准页与 IOP 专用页的尺寸、连接器、散热和封装密度差异,解释了为何航天级板卡会大量使用 hybrid module、flat-pack 与高可靠器件。文章结论指出,后来 AP-101S 将 CPU 与 IOP 合并以提升性能并减重,但原始 IOP 的架构与物理实现仍是理解早期航天计算机的重要样本;部分芯片编号和某些旁证板卡归属仍带有推断成分。

收录依据很明确:文章基于实物电路板、部件编号和官方文档,完整解释了航天飞机 IOP 的架构、总线协议、微码与板级实现,不是泛泛的历史回顾。适合做硬件逆向、古典计算机体系结构和高可靠系统设计的参考,尤其能迁移到“从板级结构反推系统工作方式”的分析方法。

技术文章知乎 - 孔某人

Agent应用层的自动自我改进 是一种海市蜃楼

文章讨论的是 Agent 应用层而非模型层的“自动自我改进”,作者认为它更像一种理想口号,而不是已经成熟的技术方案。文中把可自优化的部分拆成 Memory、SOP/workflow 和 Harness,并指出它们都受总上下文长度、模型难以抽取可泛化规则等约束。随着运行案例增多,这些记忆和流程会越写越厚,却未必更高效,反而可能迅速消耗上下文预算。作者认为在固定场景、充足历史数据和专家持续评估下,确实能做出人机混合的增益,但很难低成本泛化为全自动方案。文章还提醒,当前围绕 Long-Horizon、Harness、Loop Engineering 等概念的传播,容易把有限能力包装成“万灵药”。

收录,因为文章直接指出了应用层自我改进的关键边界:上下文容量、泛化抽象能力和持续评估成本,都是 Memory/SOP/Harness 难以自动增长的硬约束。适合做 Agent 产品和 AI 工程的预期管理,但它主要是经验性判断,缺少量化实验支撑。

工程实践Meta Engineering

Privacy-Aware Infrastructure in the AI-Native Era: An Asset Classification Case Study

文章以 Meta 的隐私感知基础设施为案例,讨论在 AI 原生产品中如何做资产分类,核心目标是先准确识别数据“是什么”,再谈保留、访问、共享和匿名化等控制。作者指出仅靠字段名会产生误判,因此系统先汇聚代码解析、血缘、归属、语义注释和使用模式,形成 evidence brief,再让模型处理歧义与冷启动。生产路径采用“确定性规则优先、LLM 兜底”的两段式架构:大部分请求由版本化规则在毫秒级完成,少量新颖或模糊资产才进入模型推理。文章强调评估必须与优化解耦,参考标签不能由模型自举生成,并通过校准、kappa、宏 F1、对抗遮蔽和独立人工复核来防止自我验证。最后,系统把稳定模式蒸馏成可审计、可回放的确定性规则,并用灰度、黑名单和内容寻址发布保证规则升级不会悄然降低保护强度;其边界是依赖高质量上下文、明确政策口径和持续人工治理。

收录理由直接且充分:文章给出了隐私资产分类的完整工程链路,包括上下文聚合、LLM 兜底、规则蒸馏、独立评估与可回放发布,而不是泛泛谈 AI+隐私。适合做隐私治理、AI 基础设施和高风险分类系统的设计参考,但前提是有清晰 taxonomy、人工标注和严格的版本控制。

工程实践知乎 - SmartCode 得物技术

从表单到 Agent:得物社区活动搭建的 AI 实践之路

文章复盘了得物社区活动搭建从“AI 帮填表单”演进到“两阶段 Agent + 聚合工作台”的完整过程。第一版只做字段预填,虽然缩短操作时间,但仍需运营在多个系统间手工校验,且存在黑盒等待、不可逆、无持久化等问题。第二版改为以 LangGraph 编排的 Workflow 为主,通过 interrupt/resume、能力注册表和组件模块协议,把运营角色从流程执行者变成流程监督者。第三版进一步把“从想法到策划文档”前移为只读 Skill,把写操作、构建和审核留给受控流程,并用最小权限、渐进式披露和草稿同步降低风险。文章的边界也很清楚:它偏架构与取舍总结,很多细节是面向特定业务场景的工程妥协。

文章给出了从表单辅助到流程驱动 Agent 的真实演进链路,直接包含 LangGraph、interrupt/resume、模块协议和最小权限等可复用设计。适合做企业级 AI 工作流、运营工具和人机协作架构的参考,但需注意其结论强依赖高正确率、强约束业务场景。

工程实践Kubernetes Blog

Spotlight on WG Device Management

这篇文章聚焦 Kubernetes Device Management Working Group 的成立背景、职责边界和当前重点,核心是在 AI、边缘计算、通信等硬件密集型场景下,如何让 Kubernetes 更好地管理 GPU、TPU、NIC 等专用设备。文章系统解释了 Dynamic Resource Allocation(DRA)的四阶段模型——资源建模、资源请求、调度与执行,并说明 DRA 相比传统 Device Plugin API 的关键改进:从“只能申请几个设备”升级为可表达设备类型、容量、拓扑、共享和切分等更细粒度约束。文章还讨论了跨 SIG 协作、共享/可消耗容量、拓扑感知、多节点调度以及 NP-hard 的优化难题,并给出了 DRA 未来在健康监控、可观测性和更复杂硬件建模上的演进方向。

推荐收录,因为它不是单纯的产品动态,而是把 Kubernetes 在硬件管理上的核心抽象、演进路径和设计权衡讲得很清楚,适合作为理解云原生调度与设备编排的长期参考。对于做平台工程、调度系统、AI 基础设施或 Kubernetes 扩展开发的读者,这篇文章能直接提供可迁移的 API 设计和跨团队协作方法。

科研议题美团技术团队

美团发布原生多模态 LongCat-Next:当视觉和语音成为AI的母语

文章介绍了美团开源的原生多模态模型 LongCat-Next,核心思路是把图像、语音和文本统一离散化为同源 Token,并用单一自回归框架进行下一 Token 预测,从而同时覆盖理解与生成。文中重点拆解了 DiNA 原生离散自回归架构、dNaViT 视觉分词器以及面向语义完备表示的编码策略,并用多项基准结果说明这种统一范式在 OCR、图像理解/生成、音频交互、工具调用和代码任务上具有竞争力,但整体结论仍依赖其训练设定与 benchmark 比较方式。

推荐收录,因为它不是简单的产品发布,而是完整讨论了原生多模态离散建模的架构选择、表示学习思路和实验结果,对理解多模态大模型的统一化路线有长期参考价值。对于关注多模态、离散表示和 LLM 架构演进的读者,这篇文章能提供可迁移的设计视角,但其中的性能结论仍应结合复现与数据集细节审慎解读。

工程实践美团技术团队

用Agent评测思路管理AI Coding —— 31万行代码AI重构的实践

本文复盘了一个在大规模 AI Coding 场景下,对 31 万行复杂业务系统进行渐进式重构的工程实践。作者提出用“Agent 评测”的思路管理 AI 编码:先通过团队共识完成“人人对齐”,再把规范固化为 AI Rule、Skill、Pre-PR 和多层审查机制,实现“人机对齐”,并在不停止业务交付的前提下,逐步消化技术债、重建分层架构和业务模型。文章还讨论了 AI 如何改变经验的价值边界,以及如何用 AI 辅助测试、Code Review 和跨模型互审来缓解 AI 提效后带来的下游瓶颈;其适用前提是团队已具备明确的工程治理意识和一致的架构标准。

推荐收录,因为这不是泛泛而谈的 AI 编程感想,而是把 AI Coding 纳入工程治理体系的一套可复用方法论,包含规范、评审、测试和重构的闭环设计。对正在经历 AI 产能上升、代码规模膨胀和技术债加速累积的团队尤其有参考价值。

工程实践知乎 - 阿里巴巴大淘宝技术

【干货长文】RAG 全链路技术详解

这篇文章系统梳理了 RAG 在 Agent 场景中的全链路工程实践,覆盖文档加载、智能切分、向量索引、检索优化、生成调优、Graph RAG 和自动化评测等关键环节。文章不仅解释了各环节的核心原理,还结合 Query 改写、HyDE、Doc2Query、重排序、Ragas 指标与测试集生成等方法,强调通过“可测、可调、可信赖”的闭环提升 RAG 的业务确定性与降低幻觉。适用边界也较清晰:它更偏向工程落地与系统方法论,而非单点算法创新。

推荐收录,因为它不是泛泛介绍 RAG 概念,而是把知识库构建、召回、生成和评测串成了完整的方法链,具有很强的工程参考价值。对于正在做 Agent、企业知识问答或检索增强系统的团队,这篇文章能直接迁移到方案设计、问题定位和效果评估中。

工程实践知乎 - 千问云

知识库分层编排:从 RAG 到 Agent-native Knowledge Context Layer

文章围绕工程知识库在检索、组织和同步上的结构性瓶颈展开,系统比较了 Naive RAG、LLM Wiki、Graphify 和 GraphRAG 四种范式,并指出单纯向量检索容易出现“每次从零推导”“无法连点成线”“粒度混乱”等问题。作者进一步提出“金字塔”式知识库方案:按原则、架构、规范、实现、经验五层组织知识,用图谱关系和角色感知路由来提升上下文选择质量,并给出增量同步、审计机制和一组小规模评测结果。

推荐收录,因为这篇文章不是泛泛谈 RAG,而是围绕工程知识库的结构化组织、检索路由、同步更新和评测方法给出了一套可落地的设计框架。它对正在构建 AI 知识库、内部文档问答或 Agent-native context layer 的读者具有较强的迁移价值。

工程实践Xe Iaso

I taught a bucket to speak git

这篇文章讲的是作者如何把一个对象存储 bucket 改造成能直接承载 Git 仓库的后端,并基于 go-git 与 billy 这些抽象实现了一个纯 Go 的 git server。正文不只是展示“能跑”,还系统复盘了 rename 原语、packfile 写入与读取、stat/list 级联、clone 过程中的随机读放大,以及用本地缓存缓解对象存储高延迟等关键问题,并明确指出哪些地方只是实验性权衡、并不适合直接用于生产。

推荐收录,因为它把“把 Git 放到对象存储上”这个看似奇技淫巧的问题,拆解成了可验证的系统设计与性能问题,具有很强的迁移价值。读者可以从中学习如何用抽象层适配存储语义、如何识别网络存储与本地文件系统的性能鸿沟,以及如何用指标驱动优化。

工程实践Netflix TechBlog

How Netflix Simplified Batch Compute with Kueue

这篇文章介绍了 Netflix 如何把自研的批处理计算系统 CMB 迁移到 Kubernetes 生态中的 Kueue,以替换原有的排队、调度和容量管理逻辑。作者不仅解释了迁移动机,还详细说明了租户层级、保留容量与共享容量的语义、Cohort/ClusterQueue/LocalQueue 的映射关系,以及如何在不改变用户 API 的前提下完成透明迁移。文章最后总结了高 QPS 配置、先迁最复杂客户、以及引入公平共享和抢占机制等经验,并说明这些改造已在生产中支撑数百万批任务运行。

推荐收录,因为它展示的是一次真实的大规模批处理平台重构,而不是单纯介绍一个开源工具。文章对多租户容量管理、调度语义迁移、灰度与回滚、以及生产吞吐保障都有具体做法,具备很强的可迁移参考价值。

工程实践Meta Engineering

Adopting AV1 for Real-Time Communication (RTC) at Scale

这篇文章系统复盘了 Meta 在实时通信场景大规模引入 AV1 的全过程,覆盖编码器/解码器选择、移动端功耗与内存约束、二进制体积控制、Android 设备准入、以及基于编码/解码延迟的动态码率与码流切换策略。作者进一步讲解了面向 RTC 的关键质量优化,包括更精确的 CBR rate control、VBV delay 评估、Temporal Layer、自适应 FEC 和 Long-Term Reference 等抗丢包机制,并说明这些设计如何在低带宽、弱网络和低端设备上兼顾清晰度、时延与稳定性。文章最后给出当前覆盖进展与后续扩展到群聊、硬件 AV1 的边界和方向。

推荐收录,因为它不是泛泛介绍 AV1 优势,而是完整呈现了一个大规模 RTC 系统从选型、落地到持续优化的工程路径,尤其适合关注端侧性能、网络适应和多约束权衡的读者。文章对 device eligibility、rate control、error resilience 的处理方式具有较强迁移价值,能为音视频、移动端和实时通信系统提供可复用的方法论。

技术文章知乎 - 王云鹤

再谈Harness:模型不归一,谁定义模型?

文章围绕“Harness”在 Agent 系统中的位置展开,强调它不是面向用户体验的应用层,而是负责模型路由、工具调用、上下文压缩和失败恢复的控制层。作者进一步提出“模型不归一”是结构性现实,因此 Harness 需要像操作系统一样适配不同模型的能力、成本和时延差异,并通过运行轨迹积累数据,反过来催生更适合 Harness 场景的专用模型。文章的核心结论是:Harness 与模型不是替代关系,而是共生演化关系,且 Harness 本身可能成为 Agent 时代的重要竞争壁垒。

推荐收录,因为它抓住了 Agent 工程里一个很有长期价值的抽象:控制层 Harness 与基座模型的分工、耦合和共演化关系。文章虽然是观点型表达,但提出了可迁移的系统设计判断,适合关注 Agent 架构、模型路由和多模型编排的读者参考。

工程实践Netflix TechBlog

The Data Canary: How Netflix Validates Catalog Metadata

文章介绍了 Netflix 为高频更新的 catalog metadata 构建“data canary”系统的工程实践,用真实生产流量验证数据变换后的最终输出是否会引入损坏。作者详细说明了为什么传统代码 canary 和影子流量不够用,以及如何通过独立 orchestrator、baseline/canary 双集群、混沌实验平台扩展、sticky canary 和实时中止机制,在 10 分钟内完成检测并阻断坏数据发布。文章还给出了主动注入故障的验证结果,说明该方案能在 2.5–4 分钟内识别回归,并把数据错误从“影响播放的事故”前移为“发布前拦截”。

推荐收录,因为它不是泛泛讲“数据质量重要”,而是给出了高频数据管道如何借助生产流量、行为指标和自动化闸门实现快速验证的完整方案。对于做数据平台、实时链路、SRE 或可靠性工程的读者,这篇文章在检测指标选择、实验窗口缩短、误伤控制和系统扩展性方面都有很强的迁移价值。

工程实践Netflix TechBlog

Data Projects: Managing Data Assets at Netflix Scale

这篇文章介绍了 Netflix 如何在超大规模数据平台中用“Data Projects”重构数据资产管理:把表、工作流、密钥等相关资产聚合到项目这一更高层级,并用项目级的合成、可持续身份替代绑定个人的权限与执行身份。文章重点解释了它如何缓解组织调整导致的权限维护灾难、如何避免工作流因人员流动而失效,以及“gravity”机制如何让新资产自动归属到项目中,从而降低后续治理成本。结论是,在拥有海量表和成千上万批处理任务的环境里,管理单元必须从“单个资产/单个人”上移到“项目”,并可进一步扩展到成本、健康度和审计等平台能力。

推荐收录,因为它不是单纯的产品介绍,而是基于 Netflix 真实规模约束提出的数据平台治理架构:权限、身份、工作流和资产归属如何统一建模,思路具有很强的迁移价值。对做数据平台、权限系统、工作流编排或企业内部平台建设的读者而言,这篇文章能直接启发“管理边界应该放在哪一层”的设计判断。

工程实践Netflix TechBlog

The Evolution of Cassandra Data Movement at Netflix

这篇文章复盘了 Netflix 将 Cassandra 数据搬迁从旧的 Casspactor 架构演进到新的分层数据移动引擎的过程,核心目标是提升可靠性、可扩展性和成本效率。文章重点解释了新方案如何直接从 S3 中的备份元数据读取单一事实来源、在 Spark DataFrame 层处理数据、通过 Connector Factory 支持多种数据抽象,以及如何解决大分区、元数据脆弱、间接表膨胀和时间回溯等问题。文中还系统总结了迁移方法论:通过 shadow 验证、可观测性建设和 Decider pattern 实现对线上用户零影响切换,适合作为大型数据平台重构与平滑迁移的参考案例。

推荐收录,因为它不是简单的系统替换公告,而是完整展示了一个高风险数据平台迁移如何从架构、验证、观测和回滚机制四个层面设计。对做数据基础设施、平台工程和大规模迁移的读者来说,文中的分层架构、单一事实来源、shadow 对比和安全切换方法都具有很强的可迁移价值。

工程实践Netflix TechBlog

Thinking Fast & Slow for a Personalized Notification System

这篇文章介绍了 Netflix 在个性化通知系统上的一次架构重构:将原本耦合的单一发送决策拆分为“慢策略”和“快策略”两层。慢层负责按周尺度为用户制定消息频率和渠道节奏等长期计划,快层负责在实时机会到来时选择具体发送内容,从而同时兼顾短期点击与长期疲劳、退订风险。文章还解释了效用函数如何把正向参与信号、负反馈信号和统一消息成本结合起来,以及如何通过 feature store 在两层之间异步传递策略状态。

推荐收录,因为它不仅讲“怎么建模”,更讲清了推荐/通知系统中长期目标与短期决策冲突的工程化解法,具有很强的可迁移性。对于做推荐系统、消息触达、AI 产品决策或策略分层架构的读者,这篇文章能直接提供可复用的设计思路和权衡框架。

工程实践Netflix TechBlog

From Silos to Service Topology: Why Netflix Built a Real-Time Service Map

文章介绍了 Netflix 为什么要构建一个实时 Service Topology,并说明它如何解决分布式系统中“依赖关系不清、影响范围难估、故障来源难定位”的问题。作者将网络流量、应用层 IPC 指标和分布式 tracing 三种来源分别建成独立拓扑,再通过统一查询和富上下文展示为工程师提供可实时更新的服务依赖地图。文中还概述了从 Kafka 多区域接入、分布式聚合、eBPF 流量解析,到图存储和 gRPC API 的整体架构,以及它在故障排查、变更评估、blast radius 计算和历史回溯中的用途与边界。

推荐收录,因为它不是单纯介绍一个可视化工具,而是系统性展示了在超大规模微服务环境下如何把多种观测信号组织成可操作的依赖拓扑。对做分布式系统、可观测性平台、SRE 或基础设施的读者来说,这篇文章能直接迁移到依赖建模、故障定位和变更风险评估等场景。

工程实践Cloudflare Blog

Build your own vulnerability harness

这篇文章系统讲解了 Cloudflare 如何把“单次的安全审计技能”演化成面向整个代码仓库群的漏洞发现与验证流水线,核心思想是把模型当作可替换部件,而把持久化状态、调度、去重、交叉验证和人工复核做成稳定的基础设施。文章详细拆解了 Recon、Hunt、Validate、Dedup、Trace、Judgment、Fixing 等阶段,强调通过数据库持久化、独立验证模型、跨仓库依赖追踪、PoC 强约束和人类签核来压低误报并提升可扩展性,同时明确指出这种体系更适合大规模、长期运行的安全研究场景,而不是依赖单个提示词或单个模型会话。

推荐收录,因为它不是泛泛谈“用 AI 找漏洞”,而是给出了一套可以迁移的工程架构:如何把不稳定的模型能力包进可恢复、可去重、可验证、可审计的流水线中。对做安全自动化、LLM 编排、复杂任务代理系统和大规模人工复核流程的读者,都有很强的参考价值。

技术文章知乎 - 孔某人

主流Agent Harness实现对比——SubAgent与MultiAgent

这篇文章系统对比了主流 Agent Harness 中 SubAgent、Agent as Tool 与 Multi-Agent 的实现差异,重点分析了 Claude Code、Codex、OpenAI Agents SDK 和 OpenCode 在上下文继承、Fork、Coordinator、Teammate/Swarm、Handoff 等机制上的设计取舍。作者结合逆向分析、版本差异和实际使用体验,指出当前主流实现更偏向 SubAgent/Agent-as-Tool,而不是传统对等 Multi-Agent;其核心价值在于既能解决长上下文任务,又能引入旁观者视角与并行子任务能力,但相关结论受版本与灰度状态影响,边界条件需要注意。

推荐收录,因为它不是泛泛而谈“多智能体很强”,而是把不同产品的 Agent 编排机制拆开比较,能帮助读者理解 Agent Harness 的真实工程权衡。对做 AI 工程、开发 CLI/IDE 代理、或设计多阶段任务编排系统的人,都有较强的迁移价值。

工程实践Cloudflare Blog

Defend against frontier cyber models: Cloudflare's architecture as customer zero

这篇文章讨论了面对“前沿网络攻击模型”时,安全重点不应只放在补丁速度上,而要转向漏洞周边的架构设计与爆炸半径控制。作者以 Cloudflare 自身作为 customer zero,给出了一套分层防御方案:用基于机器学习的 WAF 攻击评分、正向安全模型的 API Shield、Bot Management、Zero Trust Network Access、IdP Federation、MCP Server Portal 和 AI Gateway 把验证、身份、访问、代理与审计前置到应用之前。文章还强调通过边界与内网红队持续验证这些层是否真的能限制攻击者可见范围、可达路径和可修改面,而不是依赖单点检测或单次修复。

推荐收录,因为它不是单纯介绍产品,而是把新型 AI 攻击能力、检测机制和防御架构放在同一套威胁模型里讨论,给出了可迁移的安全设计原则。即使读者不使用 Cloudflare 产品,也能直接借鉴其中的分层防御、正向安全模型、身份前置和持续验证思路。

技术文章知乎 - 鹅厂架构师

Kubernetes(k8s)快速入门(中篇)

这篇文章以一个微服务 Demo 为主线,系统讲解了 Kubernetes 的一组核心入门实践:使用 Minikube 搭建本地集群、用 Namespace 隔离环境、用 Kustomize 管理多环境配置、通过 Sidecar 与 initContainer 同步配置、设置 requests/limits、配置 Startup/Readiness/Liveness Probe,以及通过 Service 暴露集群内外访问。文章的重点不在抽象理论,而在一套可跟做的部署流程和 YAML 组织方式,适合用来建立对 K8s 基本对象与常见运维模式的整体认知。其适用边界也比较明确:这是偏入门和示范性质的实操教程,适合作为上手参考,但不是生产级最佳实践的完整指南。

推荐收录,因为它把 Kubernetes 的多个核心概念放进了同一个可运行 Demo 中,能帮助读者把 Namespace、Kustomize、探针、资源限制和 Service 这些碎片知识串成完整链路。对刚接触容器编排、想理解“如何把应用真正部署到 K8s 上”的读者尤其有参考价值。

工程实践知乎 - 腾讯技术工程

横向拆解Claude Code、Codex等六大Agent上下文压缩策略后,我们做了第 7 个

文章横向拆解了 Claude Code、Codex CLI、OpenCode、Cline、Cursor、Amp、MemGPT/Letta 等多种 Agent 上下文压缩方案,归纳出分层渐进、真实 token 计量、保护近端信息、增量摘要和稳定缓存前缀等共识。随后作者结合 MUR AI 这一云端多用户 Agent 的实际约束,落地了四级水位线(Snip/Prune/Summarize)方案,并补充了日志落盘、工具差异化、跨轮 ReplacementCache 和多租户隔离等工程设计。文章的核心结论是:上下文压缩不是一次性清理,而是持续维护模型注意力与缓存稳定性的系统能力,且在云端场景需要额外处理审计、重启一致性与权限边界。

推荐收录,因为它不是单纯介绍某个产品功能,而是把主流 Agent 压缩策略、失败模式和工程落地方案放在同一框架下比较,适合长期参考。尤其对做云端 Agent、长上下文管理、缓存优化和多租户系统的团队,这篇文章提供了可直接迁移的设计原则与踩坑经验。

工程实践知乎 - 孔某人

主流Agent Harness实现对比——Memory篇

这篇文章系统对比了主流 Agent Harness 的 Memory 实现,重点分析 Claude Code、Codex/OpenAI Agents SDK、OpenClaw 等方案在记忆写入、召回、整合与淘汰上的设计差异。作者不仅贴出并解读关键 prompt 和实现细节,还讨论了文本记忆与向量 RAG 的取舍、同步写入与离线整合的延迟成本,以及“记什么、不记什么”的质量边界。文章结论偏向 Claude Code 的方案更均衡、Codex 更像事后挖掘式记忆、OpenClaw 的实现相对华而不实,但整体仍提供了可迁移的 Agent 记忆架构分析框架。

推荐收录,因为它不是泛泛介绍“Agent 有记忆”这一概念,而是深入比较了多个真实产品的记忆系统如何落地、如何权衡延迟与质量、以及为什么当前主流方案普遍避开传统 RAG。对于做 Agent、LLM 工具链或 AI 编程助手的人,这些分析具有很强的可迁移价值。

工程实践知乎 - 千问云

首个 Java Harness Framework 来了|AgentScope 把 OpenClaw 带到企业分布式场景

文章围绕 AgentScope Java 1.1.0 的 Harness Framework 发布,系统说明了如何把 OpenClaw/Hermes 这类“工作区驱动、带记忆、可执行工具”的 Agent 理念,推进到企业级分布式场景。核心内容集中在 Workspace 作为唯一事实来源、AbstractFilesystem 作为可插拔存储/执行抽象、内置上下文压缩与分层记忆、以及子 Agent 编排和沙箱隔离等工程能力,并分别讨论了个人助手、数据型 Agent 和在线业务 Agent 的适用形态与边界。

推荐收录,因为它不只是产品发布,而是较完整地总结了 Agent 工程化从本地个人助手走向企业分布式服务时必须面对的状态管理、隔离、安全和编排问题。对正在设计 Agent 框架、评估工作区/文件系统抽象、或思考多租户与沙箱执行的读者,有直接的可迁移参考价值。

工程实践知乎 - 腾讯技术工程

OpenClaw 与 Hermes:源码里的 AI Agent 架构课(一)

这篇文章基于 OpenClaw 与 Hermes 的源码,系统拆解了 AI Agent 平台在 Gateway 微内核、Channel 契约、Session 路由、Auth Profile、Compaction、Subagent、Sandbox 和记忆系统上的核心设计。作者不是停留在功能介绍,而是把“为什么这样设计”讲清楚:例如多协议接入如何做成插件契约、上下文与凭据如何分级降级、以及如何在单体与多 Agent、CLI/ACP/MCP/HTTP 多种暴露面之间做双向互联。全文还用实际插件开发经历串联源码细节,明确指出这些不完美背后的工程取舍与适用边界。

推荐收录,因为它提供的是一套可迁移的 Agent 系统架构分析,而不是单纯的产品演示或经验碎片。文中对协议分层、路由隔离、容错降级、安全审批和记忆管理的拆解,能够直接帮助读者理解和复用生产级 AI Agent 的设计方法。

工程实践Amazon Science

How flat is replacing fat in AWS data center networks

文章介绍了 AWS 在数据中心网络中用“准随机”平面网络替代传统 fat-tree 的方案,核心包括拓扑设计 RNG、路由算法 Spraypoint,以及用于落地布线的被动光学组件 ShuffleBox。作者不仅解释了为什么随机平面拓扑在理论上更优,还给出了可计算的性能模型、530 个 CPU 年规模的仿真实证,以及在真实生产环境中的部署结果。文章最后总结了该方案在路由器数量、吞吐量和能耗上的收益,同时说明其适用前提是需要配合专门的物理布线与路由机制。

推荐收录,因为它把网络拓扑理论、路由算法设计、物理布线约束和生产验证完整串联起来,属于典型的高质量工程研究案例。对做数据中心网络、系统架构和高性能基础设施的读者来说,这篇文章提供了可迁移的设计思路:如何把“理论最优”转化为“可部署、可验证、可规模化”的方案。

技术文章知乎 - 鹅厂架构师

AI软件工程范式革命的思考

这篇文章试图从工程史与控制论角度重新定义“AI软件工程”:作者认为过去五十年的软件工程主要是在管理人的不确定性,并未真正实现工程化;大模型首次让“能源换高阶认知”成为可能,因此软件开发有机会从“人为中心 + AI 辅助”转向“AI 为中心 + 人工辅助”。文章进一步提出,真正可靠的 AI 软件产线必须依赖确定性裁判(如编译、测试、监控、契约验证)形成闭环,并通过分治结构、分工协调总线、场景驱动的隐性知识蒸馏来让 AI 从局部写代码工具升级为可被组织化运营的认知产线。适用边界上,文章更多是范式推演和组织设计蓝图,强于方向判断与框架抽象,弱于实证数据与可验证案例。

推荐收录,因为它不是单纯的工具使用经验,而是从工程机制、验证闭环和组织形态三个层面讨论 AI 如何重构软件生产,具有较强的迁移价值。虽然部分论断偏宏观和前瞻,但对关注 AI 代码生成、工程自动化和研发组织变革的读者,能提供一套可继续讨论和拆解的框架。

工程实践知乎 - SmartCode 得物技术

HorizonVault 技术深潜:如何在 HDD 上做出 100GB/s+ 级大吞吐分布式存储|得物技术

文章深度解析了得物自研分布式存储引擎 HorizonVault 的设计,目标是在通用 HDD 上支撑 Kafka 远程存储、冷热数据下沉等场景,并实现 100GB/s+ 级别的集群吞吐。作者围绕 Broker、Meta、Store、Network、HA 等模块,说明了如何通过顺序追加、小索引定位、磁盘状态治理、线程隔离、网络背压和 follower 主动追赶,把 HDD 的随机 I/O 短板限制在系统可控范围内。文章的核心结论是:高吞吐并不只靠单盘性能,而是依赖资源调度、路由打散和副本同步等机制的组合;但这种方案主要适用于大对象、顺序写占主导的远端存储场景。

推荐收录,因为它不是泛泛介绍“做了一个存储系统”,而是完整讲清了面向 HDD 的高吞吐分布式存储如何在架构、路由、索引、复制和背压上协同工作。对做存储、Kafka Tiered Storage、分布式系统和性能治理的读者来说,这篇文章提供了可直接迁移的设计思路和边界判断。

工程实践知乎 - 哔哩哔哩技术

我们如何用 A2UI + Vue,让大模型长出“可交互界面”

文章分享了哔哩哔哩商业广告业务中,将大模型从“输出文本”升级为“生成可交互界面”的完整工程实践。作者基于 Google A2UI 协议,自研了 Vue 渲染器与 Agent 工具链,并重点说明了 Runtime Schema 动态装配、双重校验、SSE 双通道输出、消息幂等处理、DataModel 绑定和 Wrapper 组件体系等关键设计。 文章不仅讲清了为何模板填充式方案不够用,也交代了在多业务场景下如何通过协议标准化、白名单控制和状态机约束来提升生成式 UI 的安全性与可维护性。结论上,它适合已经在做 AI 应用落地、前后端协同和组件化渲染的团队参考,但作者也明确说明当前方案仍属于混合模式,复杂组件尚不能完全交给模型自主生成。

推荐收录,因为它不是泛泛介绍“AI 生成界面”的概念,而是给出了从协议选型、后端校验到前端渲染的完整落地链路,具有很强的工程参考价值。对于正在建设 AI 助手、低代码交互或生成式 UI 平台的团队,这篇文章的协议约束、状态管理和容错设计都可直接迁移。

工程实践知乎 - 鹅厂架构师

QQ音乐Harness Engineering实践

文章系统介绍了腾讯音乐在大仓多服务场景中落地 Harness Engineering 的实践,核心目标是把 AI 编程从“对话式生成”升级为“可控、可审计、可复用”的工程流程。作者提出用上下文工程、流程门禁、服务矩阵、三层知识体系、Skill/Agent/Command 三件套和 Self-Refinement 机制,把需求、设计、开发、验证和经验沉淀串成一条可追溯的链路,从而降低 AI 生成代码在生产环境中的漂移和返工。文章也明确给出适用边界:它不是替代 IDE 或通用 AI 编程工具,而是位于执行层之上的治理层,尤其适合跨服务、跨仓库、强契约约束的企业研发场景。

推荐收录,因为它不是泛泛谈“AI 提效”,而是把 AI 协作中的真实工程矛盾拆成了可落地的治理方案,包含流程、知识、契约和审计等多个层面。对正在探索 AI 编程工程化、Monorepo 微服务协作和团队级 AI 治理的读者,这篇文章有很强的迁移价值。

工程实践知乎 - TencentDB腾讯云数据库

腾讯云Agent Memory节省61% Token提升52%成功率的诀窍:Mermaid无限画布×上下文卸载

文章围绕 Agent 长任务中的短期记忆压缩问题,提出“上下文卸载 + Mermaid 无限画布”的组合方案:将完整工具结果、网页正文和日志等原始信息卸载到外部文件系统,同时用 Mermaid Flowchart 维护任务结构、状态与索引,使上下文只保留高密度摘要和可恢复入口。作者还系统比较了 Flowchart 与 StateDiagram、上下文卸载与画布的分工边界,以及从 raw 原文到 JSONL、MMD、metadata 的分层折叠/恢复路径。文章给出多组长 Session 实验结果,在 SWEbench、Toolathlon、WideSearch、AA-LCR 等场景中实现了最高 61.38% 的 Token 节省,并在部分任务上提升通过率/准确率,说明该方案更适合长任务、多工具调用和反复迭代的 Agent 场景,但对摘要质量与外部索引设计仍有依赖。

推荐收录,因为它不是泛泛介绍“省 Token”的产品稿,而是把 Agent 记忆管理拆成了可复用的工程机制:信息卸载、结构化画布、分层恢复与实验验证。对于做 LLM Agent、工具链、长上下文管理或记忆系统设计的读者,这篇文章能直接迁移其分层存储和任务状态外化思路。

工程实践知乎 - 孔某人

面向天级任务的通用场景Agent框架 Deputy(已开源)

本文介绍了一个面向1小时到2天级无人值守长任务的通用 Agent 框架 Deputy,重点服务非 Coding 白领办公场景,而不是专门优化编程任务。作者围绕“按需生成 harness”“Master-Worker + Reviewer/Watcher 审计”“基于文件系统的任务级 Memory”“允许 Worker 使用更便宜模型”等设计给出一整套架构取舍,并解释了为何不采用单 Agent、对等 Multi-Agent 或完全依赖现成 Agent 内核的方案。文章同时明确指出当前 0.1.0 版本仍需要打磨,且开源代码只是高层 spec 的编译结果,适合作为长任务 Agent 架构的参考实现而非直接生产落地模板。

推荐收录,因为它不是泛泛介绍“Agent 很强”的产品稿,而是围绕长任务执行、审计纠偏、记忆机制和 harness 生成给出了可复用的架构判断。对关注 LLM 工程化、任务编排和长时 автономous delivery 的读者来说,文章能提供较强的迁移价值与设计边界感。

技术文章知乎 - 腾讯技术工程

AI Infra源码入门:大模型是如何高效推理的

这篇文章以 vLLM 源码阅读为主线,系统拆解了大模型推理的完整数据流:从 tokenization、embedding、Transformer block、Attention、FFN 到 LM head 和 sampling,并用 Llama 3 的张量维度变化把“模型怎么算”和“代码怎么跑”对应起来。文章重点解释了 continuous batching、PagedAttention、FlashAttention、KV Cache 组织、prefill/decode 差异、抢占与调度策略等 AI Infra 核心机制,同时穿插了算力密度、访存带宽、kernel fusion、在线 softmax 等工程取舍与性能边界。整体上它不是泛泛讲 Transformer,而是从源码和运行时视角揭示大模型高效推理的关键实现路径,适合作为 AI 推理系统入门与复盘参考。

推荐收录,因为文章把大模型推理的核心机制、张量形状和工程优化串成了一条完整链路,既能帮助读者理解原理,也能帮助读者读懂 vLLM 这类推理系统的实现。它对做 AI Infra、GPU 推理优化、模型服务和系统架构的人都有较强迁移价值。

工程实践知乎 - SmartCode 得物技术

Claude Code Harness 工程:数仓侧落地方案|得物技术

文章围绕得物在离线数仓场景下落地 Claude Code Harness 的工程实践展开,系统分析了 AI Coding 在长上下文、规范执行和复杂需求开发中的三类痛点:上下文压缩导致“失忆”、规范依赖记忆而不稳定、以及大规模血缘/自测数据撑爆 context。作者提出用 CLAUDE.md 做持久化上下文、用 hooks 做确定性规范拦截、用 subagent 做高 token 操作隔离,并进一步给出适配数仓研发 8 个步骤的工作流和配置样例,形成一套可执行的 Harness 架构。文章的结论是:把语义理解留给 LLM,把规范检查、危险操作拦截和上下文隔离交给宿主框架,才能显著提升数仓 AI 开发的可靠性和一致性。

推荐收录,因为它不是停留在“AI 提效”的口号层面,而是把 Claude Code 的宿主框架、hooks、subagent 和持久化文件组合成了可落地的工程方案。对使用 agentic coding 工具、需要处理复杂上下文和强规范流程的团队,这篇文章有很强的可迁移参考价值。

技术文章知乎 - 腾讯技术工程

从0开发大模型的17种Agent架构演进详细拆解

这篇文章围绕“17种 Agent 架构演进”展开,不是简单罗列概念,而是用统一的分析框架拆解每一代架构新增了什么状态、路由逻辑和验证机制,以及它为何能比上一代解决更多问题。作者结合 agno 的 Workflow、Router、Loop、Parallel、Team 等抽象,将 Reflection、Tool Use、ReAct、Planning、PEV、多 Agent、Blackboard、Ensemble、Memory、Graph Memory、Tree-of-Thoughts、Mental Loop、Dry-Run、Metacognitive、Self-Improvement、Cellular Automata 等模式逐一落成代码,并系统说明了各自的失败模式与升级边界。文章的核心结论是:Agent 架构的本质不是 prompt 技巧,而是控制流设计;可靠系统必须显式建模状态、路由、终止条件和评估器。

推荐收录,因为它把 Agent 架构从“概念清单”提升到了“控制流与状态机”的层面,能直接指导真实系统的设计与排错。文章不仅有方法论总结,还给出可迁移的分层判断标准,适合做 Agent 工程入门到进阶的长期参考。

工程实践知乎 - 鹅厂架构师

Elasticsearch 实战 | 客户的 ES 2.4 集群跑了 10 年没动,这次我们把它搬上腾讯云了

这篇文章复盘了一个真实的 Elasticsearch 迁移项目:将客户长期运行的 ES 2.4、Solr 5.3.1 以及相关业务索引,迁移到腾讯云 ES 7.14.2,并覆盖了全量/增量同步、灰度切流和回滚双写等完整链路。作者重点讲解了跨 5 个大版本迁移中遇到的关键问题与处理方式,包括多 type 合并到单 type、字段类型一旦落地不可修改、_id 元数据与 source 字段冲突、ngram 分词导致索引膨胀、默认模板影响全文检索,以及按月拆索引配合 index sorting 提升范围查询性能等。

推荐收录,因为它不是泛泛而谈的迁移宣讲,而是把真实生产环境里最容易踩坑的 ES 迁移、建模和性能优化问题逐一拆开,给出了可复用的定位思路和配置方案。对做搜索系统迁移、索引设计、同步链路和线上切流的工程师来说,这篇文章具有很强的迁移价值和实战参考意义。

工程实践知乎 - 鹅厂架构师

给 AI Agent 装上长期记忆:MemOS 本地部署

这篇文章围绕 MemOS 的本地部署与接入实践,系统讲解了如何给 AI Agent 增加长期记忆能力,并把它放到 Harness Engineering 的六层框架中理解。作者不仅说明了记忆与检索的区别、MemOS 的 Memory Cube、图+向量混合存储、MemReader 抽取、反馈修正等核心机制,还给出 Windows 本地环境下的 Ollama、Neo4j、Qdrant、环境变量配置、启动脚本和 MCP 接入方案。文章的结论是:对于需要跨会话记忆、团队共享经验、长期运行与可治理记忆的 Agent 场景,MemOS 比普通 RAG 更接近“记忆系统”而不是“知识检索”。

推荐收录,因为它不是简单的工具安装记录,而是把 AI 记忆系统放进 Agent 架构与长期上下文治理框架中,提供了可复用的工程思路。对正在做本地 Agent、团队知识沉淀或上下文管理的读者,这篇文章既有落地配置,也有关于记忆治理、过滤、权限隔离和工作流约束的实战经验。

工程实践Microsoft Research Blog

mimalloc: A new, high-performance, scalable memory allocator for the modern era

这篇文章系统介绍了 mimalloc 现代内存分配器的设计目标与实现取舍,包括线程本地 heap、按页组织的固定大小块、三层 free list、跨线程释放的原子 CAS 路径,以及通过 page stealing 在可扩展性和内存共享之间取得平衡。作者还给出了小对象分配/释放的快路径、跨线程同步开销为何可控,以及在大规模并发服务和超大内存工作负载中的基准表现,说明它既能支撑高吞吐也能保持较低碎片与可接受的提交内存比例。

推荐收录,因为它不是泛泛介绍 malloc,而是把并发分配器的关键设计点、数据结构、快慢路径和性能边界讲得很清楚,适合长期作为系统性能与内存管理参考。文章对“低争用、高局部性、可迁移到真实服务”的工程取舍有很强的迁移价值,尤其适合做系统编程、运行时和基础设施方向的读者学习。

工程实践知乎 - 千问云

从玩具到生产力:用真实项目讲透 AI Agent 的 Harness Engineering

文章围绕 AI Agent 在企业工程环境中的落地,提出“Harness Engineering”这一控制面概念,核心是用外部状态、能力边界、沙盒验证、checkpoint 和回写机制,把大模型这种非确定性引擎纳入可交付的工程体系。作者结合 Aegis 内部项目的真实推进过程,详细说明了从目标收敛、Spec/Handoff 持久化、Capability 路由,到测试前置、日志反咬、审批门禁等一整套落地方法。文章的结论是:模型能力本身已足够参与交付,但只有先建立 Harness,Agent 才能从“高级玩具”变成可持续协作的研发协作者,同时工程师的角色也会从亲手写代码转向目标定义、节奏控制和结果验收。

推荐收录,因为文章不是泛泛谈 Prompt,而是从真实项目出发,系统拆解了 AI Agent 进入生产环境时必须面对的状态管理、执行边界、验证闭环和故障恢复问题。它对想把大模型真正接入研发流程、并思考人机分工变化的工程师具有很强的可迁移价值。

工程实践知乎 - 携程技术

9亿数据归因分析跑进15秒:携程智能归因系统如何用 Ray+DuckDB 破解算力危机?

这篇文章复盘了携程智能归因系统在9亿+数据规模下的性能重构:原先依赖 ClickHouse 的集中式重计算导致查询超过40秒并影响集群稳定性,随后通过将数据提前导出为 Parquet、放到 S3/Ceph 中,并用 Ray 负责任务调度、DuckDB 负责单节点高性能执行,把归因分析压到15秒以内。文章不仅解释了 Ray + DuckDB 的分工、任务拆分、分区剪枝、Actor 共享本地磁盘等实现细节,还展示了在 K8s/KubeRay 上的弹性伸缩、可观测性和 CI/CD 集成方式,适合大规模分析计算与资源隔离场景参考。

推荐收录,因为它不是单纯的技术宣传,而是一个有明确前后对比、瓶颈定位和架构取舍的真实工程案例。对于做大规模分析、工作负载隔离、分布式任务拆分和嵌入式分析引擎选型的团队,这篇文章具有较强的可迁移参考价值。

工程实践知乎 - 千问云

深入源码:Hermes Agent 如何实现 "Self-Improving"

这篇文章通过源码拆解 Hermes Agent 的“Self-Improving”机制,重点分析了 Memory、Skill、Nudge Engine 三个子系统如何协同形成“记忆—沉淀—触发复盘”的闭环。文章不仅解释了字符上限、冻结快照、后台审查、skill patch 与安全扫描等实现细节,还讨论了这些设计背后的缓存、成本、安全与可维护性权衡,以及开源版与团队版产品化形态的差异。整体上,它不是泛泛介绍 AI Agent 概念,而是围绕真实代码与运行路径总结可迁移的工程设计经验。

推荐收录,因为文章把“Agent 如何从一次次任务中持续变强”拆成了可验证的工程机制,并用源码细节说明了每个设计决策的代价与收益。对于关注 AI Agent 架构、可持续记忆、技能沉淀和安全边界的读者,这篇文章具有较强的可迁移参考价值。

工程实践知乎 - 孔某人

Multi Agent终于不是噱头了么,展望下一代Agent架构设计(2)

这篇文章延续上一部分,讨论下一代 Agent 架构为什么不能只依赖单一 harness 自动生成,而需要引入更复杂的“智能 harness”或多角色协作设计。作者从长任务场景出发,系统列出当前 LLM/Agent 的一组关键问题,包括上下文窗口不足、任务中后期懒惰、奖励目标偏移、单上下文复盘失效、元认知不足以及长期任务能力薄弱,并进一步指出这些问题在 multi-agent 场景里还会叠加协作可靠性和协作规划问题。

推荐收录,因为文章不是泛泛谈“多智能体更强”,而是基于作者的原型实践,明确拆解了当前 Agent 系统的失效模式和需要补强的架构环节。对做 AI 工程、Agent 框架或长任务自动化产品的人来说,文中的问题清单、角色分工思路和边界判断都有较强迁移价值。

工程实践知乎 - 千问云

Claude Code 源码拆解:从启动到多 Agent 扩展层

这篇文章以 Claude Code 源码为依据,系统拆解了一个成熟 Agent 产品从启动、REPL 控制面、Query Loop、Tool Runtime、权限系统、Task/多 Agent 到 MCP/Skills/Plugins 扩展层的完整运行链路。作者的核心论点是:Agent 系统真正的复杂度不在模型本身,而在于把边界、连续运行、行动协议、风险控制、并发执行和平台扩展分别放到合适的 runtime 层中,从而避免主循环被各种特判拖垮。文章最后总结出一套可迁移的方法论:先定执行边界,再把上下文治理、工具副作用、权限与任务生命周期制度化,适合做 AI Agent、研发工具链和平台架构设计的人参考。

推荐收录,因为它不是泛泛而谈 Claude Code 功能,而是从源码和系统视角提炼出可复用的 Agent 架构方法,特别适合做 AI 工程、开发者工具和平台化产品的读者。文章对启动链路、控制面、工具协议、权限和多 Agent 生命周期的拆解很具体,能直接迁移到类似系统的设计与复盘中。

工具笔记知乎 - 鹅厂架构师

AI 能记住全世界,凭什么不能记住你自己?| AI 时代如何搭建「个人知识库」

文章讨论 AI 时代个人知识管理的变化,核心观点是:知识不再主要靠手工整理,而是在与 AI 的高质量对话、项目协作和动手实践中自然产生,因此需要一层属于个人的“编译层”来统一沉淀、关联和检索。作者详细介绍了自己搭建的 KnowledgeVault 方案,包括 raw/compiled/explored 三层目录、Compile/Explore/Lint/Export 四种使用模式,以及“只记录不判断”“Profile 只传 context 不传 constraint”“防止 LLM 把多源信息编顺”等关键设计取舍。文章最终强调,这套方法不依赖 Claude 生态本身,适用于任何能够持续沉淀结构化产出、并支持跨文件/跨项目操作的 AI 工作流。

推荐收录,因为它不是泛泛谈“如何做笔记”,而是给出了一个可落地的个人 AI 知识系统架构,并明确解释了分层、编译、校验和检索之间的边界。对于深度使用 AI 的开发者、架构师和知识工作者,这篇文章提供了可迁移的工作流设计思路,以及防止知识漂移和叙事锁定的具体方法。

工程实践知乎 - 携程技术

告别“黑盒评审”:我们让LLM为数据仓库模型打了分,效率提升70%+

文章围绕数据仓库模型评审效率低、标准难统一的问题,提出用LLM结合元数据、血缘、需求文档和DQC信息构建可量化的模型评价体系。作者把评审拆成合理度、规范度、重复度、准确度四个维度,并通过MCP+Cursor+内部知识库的工作流实现人机协同评审,据称将新建表评审效率提升了70%+。文章的核心价值在于把“黑盒式人工评审”转化为可复用的规则框架和工具链,适合数据平台、数仓治理和AI工程化场景参考。

推荐收录,因为它不是单纯宣传LLM,而是把数仓评审拆解为可执行的特征提取、规则定义和人机协同流程,具有明确的工程方法论价值。对于数据平台、数仓治理和内部开发效率优化,这套“知识库 + 规则引擎 + LLM”的思路可迁移性很强。

技术文章知乎 - 歪门正道

一图速览DeepSeek V4 Attention结构

这篇文章用结构图梳理了 DeepSeek V4 的注意力机制,重点拆解了 Heavily Compressed Attention(HCA)和 Compressed Sparse Attention(CSA)两种形态。作者说明了压缩 KV 的生成方式、APE 在压缩块内的作用、压缩后再施加位置编码的原因,以及 window KV 与 compress KV、indexer 与 sparse attn 之间的关系,还指出了共享 KV MQA 与 MLA 在计算路径上的区别。文章最后补充了实现来源主要参考 HuggingFace 版本,并提醒开源推理框架可能做了额外优化,适合在理解模型结构时把握“论文/实现/推理框架”之间的边界。

推荐收录,因为它不是泛泛介绍注意力概念,而是把 DeepSeek V4 的具体结构拆成可读的计算流程,帮助读者建立对压缩注意力、稀疏注意力和位置编码配合方式的直观理解。对于研究模型架构、阅读开源实现或分析推理优化的人,这类“结构图 + 细节解释 + 边界说明”的内容具有较强的迁移价值。

工程实践Yelp Engineering

How Yelp Keeps Server-Driven UI Consistent Across Four Platforms

文章接着前文介绍 Yelp 的 server-driven UI 框架 CHAOS,重点讲它如何与跨平台设计系统 Cookbook 以及自动生成的桥接库 Konbini 协同工作。作者先说明 Yelp 与 Yelp for Business 在 Web、iOS、Android 上存在多套界面变体,导致视觉与交互一致性难以维护。随后描述如何把设计系统组件抽象成可复用的 SDUI 组件,并通过桥接层把同一套定义映射到不同平台渲染实现。文章也讨论了自动生成桥接代码在减少重复劳动、降低差异漂移方面的作用。它更适合已有多端应用和设计系统的团队参考,但前提是组件边界清晰、平台能力差异可被抽象,否则一致性和灵活性仍会冲突。

推荐收录,因为正文直接围绕 CHAOS、Cookbook 和 Konbini 的集成展开,讨论了如何在 Web、iOS、Android 多端保持界面一致,并用自动生成桥接层降低实现分叉。适合做多端产品、设计系统或 SDUI 落地的团队参考;可迁移价值在于组件抽象、跨平台映射和减少重复代码,但也依赖平台差异可被稳定封装。

工程实践Anthropic Engineering

Scaling Managed Agents: Decoupling the brain from the hands

本文介绍 Anthropic 为 Managed Agents 设计的“元 harness”架构,核心是把 Claude 的“脑”(模型与调度逻辑)、“手”(沙箱和工具)以及“会话”(持久事件日志)解耦。作者先回顾了早期把所有组件放进单容器的方案,说明这种耦合会把容器变成难以替换的“宠物”,带来故障难排查、用户数据与调试冲突、以及 VPC/外部系统接入困难等问题。随后文章给出新的接口设计:harness 通过 execute/provision/wake/getSession/emitEvent 等稳定边界与沙箱和会话交互,使容器、harness、会话都能独立失败、重启或替换。安全上,凭据被移出沙箱,Git 与 MCP/OAuth 通过受控初始化或代理访问,避免提示注入直接接触 token。作者还指出这种解耦显著降低了 TTFT,p50 约下降 60%,p95 超过 90%,但前提是系统愿意承担更复杂的编排与多环境 reasoning 负担。

推荐收录,因为文章给出了面向长时运行 agent 的完整接口分层、故障隔离和凭据边界设计,并用 TTFT 数据验证了架构收益。适合做 AI 平台、Agent 基础设施和安全设计的参考,尤其能迁移到需要多沙箱、多工具、可恢复会话的工程场景。

工程实践Lyft Engineering

Predicting Rider Conversion in Sparse Data Environments with Bayesian Trees

这篇文章介绍 Lyft 用于预测乘客下单转化率的一种 Bayesian Trees 建模框架,目标是在高基数、极度稀疏的上下文中仍能做出稳定预测。作者先指出常规 GBDT 在细粒度分桶后会因样本过少而过拟合,而深度模型虽可能缓解稀疏性,却不适合需要实时响应的线上场景。其核心做法是把会话按地域、时间、供需等层级拆成树状节点,每个子节点复用与父节点相同的参数化模型,并通过以父节点参数为中心的 L2 正则实现 Gaussian prior 形式的 Bayesian smoothing。这样,叶子节点样本很少时会更多依赖上层先验,样本积累后再逐步向局部数据靠拢。文章还强调用简单模型并施加单调约束来保证“历史转化率越高、当前预测越高”等业务一致性。该方案的边界在于依赖合理的层级划分与正则强度设定,且更适合可解释、低延迟、强稀疏分布的线上预测任务。

文章给出了从稀疏数据过拟合、实时推断约束到 Bayesian smoothing 训练方式的完整工程解法,直接说明了为何要用层级先验和单调约束。适合做推荐/转化率预测、广告或 marketplace 线上建模的读者参考,尤其适用于高基数特征和低延迟服务场景。

科研议题Amazon Science

How agentic AI helps heal the systems we can’t replace

本文讨论一种面向遗留系统的 agentic AI 思路:不去重建银行、航司、政府审批等难以停机的旧系统,而是让智能体在高保真模拟环境中学习这些系统真实的延迟、错误状态、强顺序约束和隐藏依赖。Amazon AGI Lab 将这类环境做成 RL gym 和 synthetic web environment,让 agent 不只学会“成功流程”,还要学会在失败、回退、重试和部分提交等场景中恢复操作。文章提出,足够成熟的 agent 可以把不稳定的 UI 语义抽象成稳定的“合成 API”,充当跨系统的接口层,逐步吸收现代化迁移期的脆弱性。它强调这不是简单的流程自动化,而是为无法替换的关键基础设施提供一种渐进式升级路径。文章的边界在于主要是理念与研究方向阐述,缺少公开实验指标和可复现细节,但对理解 agent、RL 训练环境与企业遗留系统改造的结合很有参考价值。

推荐收录,因为文章明确给出了 Amazon AGI Lab 在遗留系统模拟环境中训练 agent 的方法,并提出“agent 作为通用接口层”的架构判断。适合关注 agent、企业自动化和系统现代化的读者;可迁移价值在于如何用高保真仿真覆盖失败模式与历史包袱,但它更偏概念阐述,缺少公开基准与实验细节。

工程实践Instacart Tech Blog

Migrating to Jetpack Compose

文章复盘了 Instacart Caper 智能购物车 Android 应用从 Fragments/XML 迁移到 Jetpack Compose 的全过程。作者将迁移拆成四阶段:先用隐式 Fragment host 承接 Compose 页面,再把导航图迁到 Kotlin DSL 与类型安全路由,随后把存量 Fragment 逐步改造成纯 Compose,最后切换到 Compose Navigation。文中最有价值的部分是 AI 辅助重构方法:通过 Git 历史提供上下文、实时纠错、持续更新迁移指南,并把 17 步流程固化为 AI skill。作者给出了 5–7 倍提速、节省约 300–350 工时的结果,但也强调在高风险硬件场景中必须保留截图对比、测试和人工验证。整体结论是:AI 适合重复性强、边界清晰的大规模现代化改造,但前提是先定义好架构目标、约定和检查点。

收录价值明确:文章不仅描述了 Compose 迁移路径,还给出可复用的 AI 辅助重构工作流、检查点和度量结果,属于可迁移的工程经验。适合做 Android 现代化、存量代码重构和 AI 提效实践的参考,但读者需要注意其前提是明确的迁移规范与严格的人为验证。

工程实践Dropbox Tech

Engineering VP Josh Clemm on how we use knowledge graphs, MCP, and DSPy in Dash

这篇文章是 Dropbox Dash 工程副总裁对其检索与智能问答架构的一次系统性拆解,重点讲了如何把多源工作内容接入“context engine”。作者先说明连接器、内容标准化、OCR/多模态理解、嵌入与知识关系建模,再进入 BM25 词法索引与向量库的混合检索,并通过多轮排序实现个性化和权限控制。文章还比较了 federated retrieval 与 index-based retrieval 的取舍,解释了为什么在 Dropbox 规模下更偏向预索引、离线富化和跨应用知识图谱,而不是纯实时拉取。随后作者讨论了 MCP 在上下文窗口、工具定义和延迟上的问题,以及通过“super tool”、子代理和本地存储工具结果来控成本。最后用 LLM as a judge、RAG as a judge 和 DSPy 展示了如何通过评测和提示优化持续提升检索相关性,但也明确指出这些方案高度依赖工程投入、数据新鲜度治理和复杂的离线/在线评估体系。

推荐收录,因为文中给出了 Dropbox Dash 的真实架构取舍:索引式检索、知识图谱 bundle、MCP 工具收敛、LLM 评测和 DSPy 优化都不是概念性描述,而是带有明确约束与结论的工程实践。适合正在做 RAG、企业搜索或 agent 平台的读者参考,但需要注意其方案建立在大规模数据接入和长期基础设施投入之上,不能直接照搬。

工程实践Lyft Engineering

LyftLearn Evolution: Rethinking ML Platform Architecture

文章复盘了 LyftLearn 机器学习平台从全量 Kubernetes 离线架构,演进为“离线用 SageMaker、在线继续用 Kubernetes”的混合平台过程。作者先说明原架构虽然在统一基础设施、启动速度和资源定制上表现良好,但随着千级模型和日均数千任务增长,K8s 编排、状态一致性、集群容量管理和故障排查带来了明显的特征税。迁移的核心原则是替换执行引擎而不改用户 ML 代码,因此团队构建了兼容层,补齐凭证注入、环境变量、指标、超参数、镜像和 Spark 网络等差异。文中还介绍了用 EventBridge/SQS 取代后台 watcher、用 SOCI 和 warm pool 缩短冷启动、以及在 SageMaker Studio 与 EKS 间打通 Spark 双向通信的具体做法。最终结论是:对离线计算,托管服务能显著降低运维复杂度和总拥有成本;对在线服务,已有 K8s 方案在延迟和控制力上仍更合适,平台演进应按工作负载分别选择方案。

推荐收录,因为文章给出了从 K8s 迁移到 SageMaker 的完整工程证据:原始复杂度、兼容层设计、冷热启动优化、网络打通和分阶段迁移策略都写得很具体。适合做 ML 平台、基础设施和架构权衡的参考,尤其对需要在“自建 vs 托管”之间做决策的团队有直接迁移价值。

工程实践Stanford Hazy Research

HipKittens: Fast and Furious AMD Kernels

文章围绕 AMD GPU 上的高性能 AI kernel 设计,介绍了 HipKittens 这一套面向 HIP 的 C++ 嵌入式原语。作者先分析现有 AMD 软件栈的问题:AITER、PyTorch、Triton、TileLang 和 CK 在若干 attention/GEMM 场景下难以稳定逼近峰值,部分还受限于寄存器分配、bank conflict、chiplet swizzle 等硬件细节。随后提出核心判断:tile 抽象可以跨架构复用,但真正决定性能的内存访问、调度和后端实现必须按 AMD/ NVIDIA 分开定制。基于这一思路,HipKittens 用约 500 行代码实现 attention 前向、不到 100 行热循环实现 GEMM,并在多项基准上超过现有基线。文章同时指出 wave specialization 在 CDNA3/4 上并不总有效,说明可移植的高层接口并不等于可移植的底层优化。

文中直接给出可验证的性能结果:HipKittens 的 attention 和 GEMM kernel 在 AMD MI355X 上超过多种基线,且代码规模很小,说明其方法不只是概念展示。适合做 GPU kernel、AI 编译器和多硬件适配的参考,尤其能帮助读者理解“统一接口、分离后端实现”的可迁移设计。

工程实践Anthropic Engineering

Code execution with MCP: Building more efficient agents

文章讨论如何用代码执行环境来更高效地连接 MCP 服务器,核心动机是解决大规模工具接入后的上下文膨胀与中间结果反复进模型的问题。作者指出,直接把所有工具定义和返回值都放进上下文,会在连接上千工具时显著增加 token、延迟和出错率;改为让模型写代码操作 MCP,则可按需读取工具定义,并在执行环境中先过滤、聚合和转换数据。文中进一步给出文件系统式工具发现、search_tools、循环与条件控制、结果脱敏、状态持久化和技能复用等做法,说明这种模式能把很多原本依赖模型逐步编排的逻辑交给程序处理。文章也明确提醒,代码执行并非零成本,需要安全沙箱、资源限制和监控,否则会引入新的运维与安全复杂度。整体结论是:在工具很多、数据很大或任务流程复杂时,code execution 能显著降低上下文成本并提升代理可组合性,但只适合具备较强执行隔离能力的系统。

文章直接给出了从“工具调用”转向“代码执行”的可操作方案,并用 token 成本、延迟和隐私脱敏等具体例子说明收益与边界,适合做 Agent/MCP 系统设计参考。对做 AI 工程、平台能力或工具编排的读者尤其有价值,但落地前必须评估沙箱、监控和安全治理成本。

工程实践Blender Developers Blog

Geometry Nodes Workshop: September 2025

这篇 Blender 开发者博客总结了 2025 年 9 月 Geometry Nodes 工作坊的设计讨论,重点回顾了 Blender 5.0 前后的节点系统演进。文章覆盖了 closures、bundles、列表、体积网格、UV Tangent 等已落地或实验中的能力,并说明了哪些改进已进入主线、哪些仍在设计中。核心议题集中在几类长期架构问题:如何用 bundle 表达物理世界并驱动求解器、如何把复杂结果从几何修改器输出到其他对象、以及如何改进节点编辑器在缩放和默认输入下的可读性与可组合性。文中还讨论了 XPBD 毛发/物理解算、BVH 与 SDF 碰撞取舍、默认输入可复用方案、以及面向多对象和模态节点工具的执行模型。整体上它更像一次开放式工程设计复盘,信息密度高,但不少方案仍处于原型或未定稿阶段,适合关注 Blender 节点架构与图形工具链演进的读者参考。

收录依据明确:文章直接给出 Geometry Nodes 的设计取舍、实现路径和 5.0 版本进展,而不是功能宣传。适合图形工具、DCC 插件和节点式系统设计读者,尤其可借鉴 bundle、求解器接口和节点编辑器交互的架构思路。

工程实践Blender Developers Blog

Volume Grids in Geometry Nodes

这篇文章介绍了 Blender 5.0 在 Geometry Nodes 中引入 volume grids 的设计与实现,使体数据不再只是与几何体互转的中间格式,而可以被直接编辑、采样和组合。作者解释了 grid 作为带数据类型的体素容器如何依托 OpenVDB 存储,并通过变换、背景值、active 状态和 tile 分层来兼顾稀疏性与性能。文中还说明了 fields 与 grids 的边界:field 是可在任意位置求值的函数,grid 是离散数据容器,二者通过 Field to Grid、Sample Grid 等节点互相转换。基于这一机制,Blender 5.0 可以支持 SDF 建模、布尔运算、平滑、advect、curl/gradient 等体积操作。文章也坦承这一设计经历了多年迭代,早期按命名属性访问 grid 的方案因复杂而被放弃,最终改为 grid socket,以换取更清晰的模型和更好的可扩展性。

收录价值明确:文章直接给出了体积网格的数据结构、字段求值边界、OpenVDB 稀疏存储和节点设计的具体证据,而不是只做功能宣传。适合图形学、DCC 工具和体积建模读者参考,其关于接口重设计与长期迭代取舍的经验也有较强可迁移性。

工程实践Stanford Hazy Research

One Kernel for All Your GPUs

这篇文章系统讲解了如何在 NVIDIA 多 GPU 平台上手写高性能通信核,重点面向 NVLink/NVSwitch 互联的单机多卡场景。作者先解释了跨进程共享 GPU 内存的三种路径:UVA、CUDA IPC 和手动 VMM,并说明为何生产环境更需要后两者以及它们的初始化开销与边界。随后文章分析了 NVSwitch 的广播/归约加速机制,以及 copy engine、TMA 和寄存器指令三种通信方式在带宽、并发和可融合性上的差异,给出在 B200 上的实测利用率。最后,作者把这些机制封装进 ThunderKittens 的 PGL 和 TKParallelTensor,展示了不到 100 行代码实现 all-reduce、all-gather、reduce-scatter 和 all-to-all,并在 8 卡 B200 上相对 NCCL 取得最高 2.6x 提升。文章的适用边界也很明确:它主要针对单机 NVLink/NVSwitch 域内的细粒度通信优化,且依赖 VMM、固定粒度显存和较强的 CUDA/编程模型理解,不直接覆盖跨节点通信。

收录价值很高,因为文章不仅给出性能结果,还把多 GPU 通信从内存映射、NVSwitch 机制到 kernel 设计完整串起来,直接提供了可复用的实现路径。适合做分布式训练、MoE、序列并行和自定义 collective 的工程参考;但读者需要接受其局限于单机 NVLink/NVSwitch 域,且实现门槛较高。

工程实践Datadog Engineering

Scaling down to speed up: How we improved efficiency of live process metrics by 100x

文章复盘 Datadog 为 Processes 和 Containers 视图重构实时数据管线的过程,目标是在保留在线进程指标可用性的同时显著降低采集与传输成本。作者先说明原方案在流量规模、处理链路和基础设施占用上的瓶颈,再介绍新的架构拆分与数据处理方式,最终把流量压缩 100 倍、基础设施消耗降低 98%。文中强调的不是单点优化,而是围绕实时性、可见性和成本之间的取舍重新设计系统边界。它对可观测性平台、高基数指标处理和流式管线重构都有迁移价值。需要注意的是,方案效果依赖 Datadog 的数据形态与产品场景,未必可直接照搬。

推荐收录,因为正文直接给出了“流量减少 100x、基础设施减少 98%”的量化结果,并明确讨论了实时指标管线的架构重构与系统取舍。适合做可观测性平台、流式处理和高基数指标设计的工程参考,尤其适合需要在实时性与成本之间权衡的团队。

技术文章Blender Developers Blog

Bundles and Closures

这篇文章介绍了 Blender 5.0 为 Geometry Nodes 引入的两类新 socket:Bundles 和 Closures。Bundles 用于把多个值、几何体、字段、对象等打包成一个连接,作用类似程序里的结构体,便于把复杂状态作为整体在节点组中传递。Closures 则允许把一段可注入的自定义逻辑作为参数传入节点组,例如把树木散布策略外置为可替换的分布函数,从而让高层节点工具获得更强的可组合性与声明式表达能力。文章同时说明了 pass-through、值捕获、名称同步、socket inspection 等机制,以及当前调试和多处求值带来的局限。最后还展望了这些能力向输入组件、物理模拟、着色器和合成器扩展的可能性,但也强调部分功能仍在实验中,且 inline 方案存在迭代次数等约束。

推荐收录,因为文章明确讲清了 Bundles/Closures 的设计动机、工作机制和已知限制,并给出了可扩展到物理、着色和合成器的路线。适合关注图形系统、节点式编程和声明式工具设计的读者参考,其价值在于抽象出可迁移的接口组合与可定制计算模型。

工程实践Blender Developers Blog

Geometry Nodes Workshop: July 2025

这篇文章是 Blender 在 2025 年 7 月 Geometry Nodes Workshop 的设计纪要,概述了近 8 个月来的进展与后续路线。重点包括:Hair Dynamics 采用“先做出垂直切片、再补齐工作流”的阶段性目标;Lists 以最小实验特性落地;Closures 让 color ramp 和 curve mapping 以“函数”形式进入节点组;以及节点组界面布局、菜单路径、骨骼信息节点等配套能力。文章还讨论了通用 Viewer、Custom Viewer 与 Debug View 的统一思路,以及让更高级的节点特性在 shading/compositing 中复用的可能方案。整体内容偏设计取舍而非成品功能说明,很多部分仍在 PR 或实验阶段,适合关注 Blender 节点系统演进、可视化编程 UI 和图形工具架构的人参考。

收录理由很明确:文章来自 Blender 官方开发博客,直接呈现了 Geometry Nodes 的真实设计讨论、阶段性里程碑和未决架构取舍,而不是功能宣传。它适合图形工具、节点系统和开源工程读者参考,尤其能借鉴“先验证垂直切片”“用 closure 抽象 UI 组件”“统一 viewer 与 debug 视图”等可迁移方法。

工具笔记Anthropic Engineering

Desktop Extensions: One-click MCP server installation for Claude Desktop

文章介绍 Claude Desktop Extensions(MCPB)这一新的本地 MCP 服务器打包与安装格式,核心目标是把原先依赖 Node/Python、手动改配置和处理依赖冲突的安装流程,简化为下载 .mcpb 后在 Claude Desktop 中一键安装。作者说明了 MCPB 以 zip 形式封装 server、manifest、依赖和图标,manifest 负责描述元数据、运行时、工具/提示词、平台差异和用户配置,并支持模板变量与敏感信息存入系统密钥链。文章还给出 mcpb init/pack 的实践路径,以及跨平台、自动更新、目录浏览、企业预装/黑名单/MDM 等能力。它的价值在于为本地 AI 工具分发提供了可复用的规范,但当前版本仍是 0.1,具体字段和 Claude Desktop 实现预计会继续演进。

建议收录:正文明确给出了 .mcpb 打包格式、manifest 结构、模板变量、用户配置和企业管控等关键机制,不只是产品发布。适合做 MCP 服务器开发、桌面 AI 工具分发和安全安装设计的参考,但需注意规范仍处于 0.1 版本,后续可能演进。

工程实践Datadog Engineering

Breaking up a monolith: How we’re unwinding a shared database at scale

这篇文章讲 Datadog 如何在大规模生产环境中拆解一个共享数据库,核心目标是把原本耦合的业务边界重新切开,同时尽量不影响线上稳定性。作者强调先定义清晰的所有权边界,再通过分阶段迁移、风险隔离和回滚预案降低改造成本,而不是一次性“硬拆”。文中还介绍了用于自动化迁移、校验一致性和减少人工操作的配套工具,以保证解耦过程可重复、可持续。它的重点不在数据库原理本身,而在多团队共用核心存储时如何平衡组织边界、迁移风险和工程效率。其适用前提是已有足够的监控、测试和发布控制能力,若系统变更链路薄弱,收益会被迁移复杂度抵消。

文章直接围绕“shared database at scale”的拆分实践展开,给出了边界划分、风险控制和自动化工具这三类可迁移做法,明显属于可长期参考的工程案例。适合正在做服务解耦、数据库分片/迁移或多团队协作治理的读者,但需要注意其前提是具备较成熟的发布与验证体系。

工程实践Anthropic Engineering

How we built our multi-agent research system

文章复盘 Anthropic 将 Claude Research 从原型做成可上线的多智能体研究系统。系统采用 lead agent + 多个 subagent 的 orchestrator-worker 架构:主代理先规划研究路径,再并行派发子代理做广搜,最后由 CitationAgent 回收证据并生成带引用的答案。作者总结了多智能体提示词的关键原则,包括先广后窄、按任务复杂度分配代理数量和工具调用、明确分工边界、选择合适工具,并让模型自我修复提示词和工具描述。评估上,他们用小样本快速迭代、LLM-as-judge 和人工测试结合,关注事实准确性、引用准确性、覆盖度和工具效率。工程上则强调长链路状态持久化、错误恢复、全链路 tracing、渐进式部署和异步并行的权衡;但此架构代价高,尤其适合高价值、强并行的研究任务,不太适合上下文强耦合的编码场景。

收录价值高,因为文章把多智能体系统从架构、提示词、评估到线上可靠性完整串联,并明确给出失败模式、分工原则和部署策略等直接证据。适合做 AI 工程、Agent 系统和生产化研究助手的参考,但需注意 token 成本高、并非所有任务都适用。

工程实践PlanetScale Blog

Increase IOPS and throughput with sharding

文章围绕数据库在云上扩容时最容易被忽视的 IOPS 和吞吐量成本展开,先解释 AWS EBS 中 IOPS 的计量方式、顺序/随机读写对有效带宽的影响,以及 gp3、io1、io2 的配额与价格差异。随后作者用 RDS、Aurora 和 PlanetScale 的月费对比,说明当单体数据库从中等规模增长到 8 倍需求时,单机方案往往要付出显著更高的 I/O Premium。文章的核心观点是:对 I/O 密集型数据库,分片可以把计算、存储和 I/O 压力拆散到多个 primary 上,从而继续使用更便宜的存储层。文中还指出分片带来的额外收益包括故障隔离、备份更快和长期线性扩展,但没有给出实际压测结果,因此结论更偏成本与架构层面的比较,而非纯性能评测。

文中直接用 EBS 的 IOPS/吞吐限制和三种数据库方案的月费对比,证明了单体扩容会迅速推高 I/O 成本,而分片能把需求摊平到多个 shard 上。适合做数据库容量规划、云成本评估和分片选型的读者;但价格结论依赖区域、流量形态和分片键设计,落地时需要按自身 workload 复算。

技术文章PlanetScale Blog

Sharding strategies: directory-based, range-based, and hash-based

这篇文章系统介绍了数据库分片的三种常见策略:directory/lookup-based、range-based 和 hash-based,并用示例说明它们如何根据 shard key 将数据分散到不同分片。作者分别分析了每种方法的优缺点:目录式分片便于按业务规则精确路由,但依赖额外的查表步骤,且容易因数据倾斜或热点访问造成单分片压力;范围分片实现直观,但如果范围划分不合理,很容易出现分布不均,需要通过 reshard 调整;哈希分片通常能获得更均匀的数据分布,代价是要做哈希计算,并且仍需谨慎选择高基数且符合访问模式的 shard key。文章还强调,分片方案不是点击按钮即可完成,真正落地时要结合数据分布、访问模式和后续扩容计划一起考虑。PlanetScale 的倾向是把 hash-based 作为默认选择,因为它通常最均衡、复杂度也更低,但这并不意味着它适合所有场景。

文章直接给出了三类分片策略的机制、优缺点和适用边界,属于数据库扩展的基础参考,而不是单纯的产品介绍。适合正在设计 MySQL/分库分表方案、评估 shard key 或做容量规划的读者阅读。

工程实践PlanetScale Blog

Introducing global replica credentials

文章介绍了 PlanetScale 新增的 global replica credentials:用户只需一套复制库密码,即可在全球范围内自动路由到最近的只读副本,并在同一区域内对多个 replica 做负载均衡。作者说明了其默认拓扑是一个 primary 加多个跨可用区 replica,而新凭据可以在新增或删除只读区域时自动更新路由,无需修改应用代码或重新连接。文中进一步拆解了 PlanetScale Global Network 的工作方式:在边缘层终止 MySQL 与 TLS、进行连接池化,并通过低延迟 DNS 选择就近入口。实现上把 Credential、Route 和 Endpoint 分离,Route 由 etcd 监听并按实时延迟排序,从而把下一跳决策稳定地落到最优副本。该方案的价值主要体现在跨地域读扩展和连接管理简化上,但也明显依赖 PlanetScale 自身的全局网络与内部路由体系,通用性受平台约束。

文中给出了凭据、路由、端点三层拆分,以及边缘终止 MySQL/TLS、按延迟排序副本的具体实现证据,不是简单的产品宣传。适合做数据库代理、跨地域读扩展和连接层设计的参考,但迁移时要注意它强依赖 PlanetScale 的全局网络基础设施。

科研议题Stanford Hazy Research

Learning from DNA: a grand challenge in biology

文章介绍 Stanford Hazy、Arc 与 Together AI 联合训练的 Evo:一个 7B 参数、基于 StripedHyena 的长上下文生物基础模型,使用 2.7M 个细菌和噬菌体基因组、300B token 的 OpenGenome 语料,以单核苷酸 byte-level 方式做 next-token 预测。作者把 DNA 视为同时承载 DNA、RNA、蛋白三种“语言”的统一建模问题,展示了跨中心法则的零样本泛化,包括蛋白功能预测、基因必需性判断,以及无监督生成新的 CRISPR 系统。文章重点分析 DNA 建模的难点:超长上下文、单碱基分辨率和噪声序列,并通过 300 个模型的 scaling laws 发现 Transformer++ 在 byte-level 上明显落后,Hyena/StripedHyena 更具计算效率。作者还提出 Mechanistic Architecture Design,用合成任务解释压缩、聚合和过滤能力,并据此改进架构;但当前证据主要来自原核和噬菌体数据,向真核与真实应用迁移仍有限。

推荐收录,因为它给出了生物序列基础模型的完整研究链条:数据集、架构、缩放律、机制分析和零样本验证都写得很清楚。适合关注长上下文、字节级建模、跨模态 foundation model 与生物计算交叉的读者,但要注意其结论目前主要建立在原核/噬菌体数据上。

工程实践PlanetScale Blog

PlanetScale branching vs. Amazon Aurora blue/green deployments

文章以 Amazon Aurora 的 blue/green deployment 与 PlanetScale 的 branching 为主线,对比两种“复制环境后再切换”的数据库变更方式。它先解释 Aurora 如何通过克隆集群、binlog 同步和 switchover 完成维护,再说明 PlanetScale 基于 Vitess 的分支本质是独立集群,借助 deploy request、ghost table 和滚动升级来实施 schema 变更与版本升级。文中进一步比较了成本、回滚、数据一致性和停机时间:Aurora 切换会断连且无法直接 fail back,双环境并行成本较高;PlanetScale 则强调在线迁移、Schema revert 和更强的隔离性,但依赖 safe migrations 与 Vitess 能力。整体结论是,两者虽然表面相似,但目标不同,Aurora 更偏维护窗口控制,PlanetScale 更偏持续在线变更。需要注意的是,这是一篇厂商视角的对比文,缺少独立 benchmark 和第三方验证。

文中直接给出 binlog replication、ghost table、rolling upgrades、Schema revert 等机制差异,信息足以支撑数据库变更方案选型。适合做平台工程、数据库运维和迁移设计的参考,但需意识到它带有明显厂商立场,结论应结合独立验证。

科研议题Stanford Hazy Research

Zoology (Blogpost 0): Overview

文章概述了 Stanford Hazy Research 对高效大模型架构的系列工作:先比较 Transformer 优化路线与一批子二次方替代架构(如 Hyena、H3、RWKV、Mamba 等),再分析这些模型在总体困惑度接近的同时,为何在关联回忆(AR)任务上明显落后。作者指出,AR 解释了大部分困惑度差距,而且它与 in-context learning 等能力相关,因此只看 next-token perplexity 会低估架构差异。进一步实验表明,门控卷积类模型完成 AR 往往需要更多维度,暴露出表达效率问题。基于这些观察,作者提出新的 Based 架构,目标是在保持子二次方复杂度的同时弥补 AR 缺口。该文更像系列总览与问题框架,具体实现和完整实验需结合后续两篇及报告阅读。

收录依据很明确:文章基于一组基准实验比较多类高效 LLM 架构,并给出“关联回忆”这一关键差异来源及其与能力迁移的联系。适合研究者、做模型选型的工程师以及关注长序列/高吞吐推理的读者,用来理解为何不能只看困惑度,以及子二次方架构的主要风险在哪里。

科研议题Stanford Hazy Research

Monarch Mixer: Revisiting BERT, Without Attention or MLPs

这篇文章介绍了 Monarch Mixer(M2-BERT)这一新架构,目标是在不使用标准 Transformer 注意力和全连接 MLP 的情况下,仍保持 BERT 级别的效果。作者用 Monarch 矩阵统一替代序列混合与维度混合:前者借鉴 H3/Hyena 的卷积式长程建模,后者用块对角结构替换 MLP,从而把序列长度和模型宽度两侧都做到次二次复杂度。实验部分在 C4 上以 128 长度预训练,80M 与 110M 两个版本在 GLUE 上分别达到 79.9 和 80.9,接近或超过标准 BERT-base,同时在 A100 上长序列吞吐也明显优于 HuggingFace BERT 和 FlashAttention 版本。但文章也明确指出,这仍是早期结果,训练配方、门控设计和长序列能力都还有较大探索空间,结论更适合作为架构方向与初步证据,而非最终定论。

文中不仅提出了用 Monarch 矩阵替代注意力和 MLP 的具体机制,还给出了 GLUE 指标、参数量和吞吐量的对比证据,属于可长期参考的架构研究材料。适合关注高效模型、长序列建模和 Transformer 替代方案的研究者与工程师,但需注意它仍处早期,长序列与训练配方尚未完全验证。

科研议题Stanford Hazy Research

The Safari of Deep Signal Processing: Hyena and Beyond

这篇文章系统梳理了面向超长序列的模型设计思路,以 Hyena 为核心,说明如何用可学习的非线性序列处理器替代 Transformer 的二次复杂度注意力。作者先回顾 dense attention、linear attention、AFT 和 RWKV,指出这些方法分别在全局记忆、精度或参数化上存在局限。随后给出 Hyena 的分解:用短卷积提取局部变化,用长卷积或状态空间式归纳实现长程记忆,再通过门控完成信息混合,并强调这些模块可由快速线性算子实现近线性复杂度。文章还讨论了训练与推理效率、FFT 在现代硬件上的瓶颈、Monarch 矩阵等结构化替代方案,以及在关联检索和 100 万长度 DNA 预训练中的初步结果。整体结论是:Hyena 及其“safari”家族在超长上下文上有潜力,但性能、硬件映射和投影压缩仍存在明显权衡,属于仍在快速演化的研究方向。

推荐收录,因为文章不仅介绍了 Hyena,还把长序列建模拆解为投影、归约、归一化和门控四个可复用部件,并给出与 Attention、RWKV、S4 等方法的明确对比。适合研究长上下文、序列建模和高效推理的读者参考,但需注意它仍是研究博客,部分结论和实现取舍属于探索阶段。

科研议题Stanford Hazy Research

From Deep to Long Learning?

这篇博客系统梳理了“把序列建得更长”这一研究方向,核心论点是:Transformer 的注意力在长度上是二次复杂度,若要支持长上下文、多模态和长代码等场景,就需要近线性时间的序列模型。文章按时间线回顾了 Long Range Arena、S4、H3 到 Hyena 的演进:S4 通过结构化状态空间模型把长程依赖建模成本降到 O(N log N);H3 通过门控与少量注意力层补齐语言建模性能;Hyena 进一步用隐式参数化卷积和更多门控替代最后的注意力层,尝试实现全程近线性扩展。作者还讨论了 FFT 在现代硬件上的效率瓶颈,以及将其改写为矩阵乘法、甚至学习变换矩阵的思路,以更贴合 GPU 计算单元。文中给出若干小型与中型实验,显示 Hyena 在 Pile 子集上的困惑度可接近或达到 Transformer 基线,但整体结论仍主要建立在初步实验与特定任务上,是否能稳定迁移到更大规模语言模型仍需后续验证。

收录理由很直接:文章明确给出了从 Transformer 到 SSM、H3、Hyena 的技术演进、复杂度分析和实验结果,不是泛泛而谈长上下文愿景。适合做长序列建模、模型结构替代和计算效率权衡的长期参考,但读者也应注意它是研究博客,结论主要来自初步实验而非完整论文定论。

科研思考Stanford Hazy Research

Is AI Rare or Everywhere?

文章围绕“AI 是稀缺还是无处不在”展开,讨论 foundation models 是否真的依赖一套极其脆弱的配方。作者认为当前模型的可复现性比预想更强:不同团队在足够时间尺度上性能差距会收敛,开源实现也能迅速复制并改进,这让“复制危机”并不明显。接着文章追问 transformer 是否真是唯一关键路径,并以 Hyena 这类无注意力架构为例,说明语言建模可能存在多条可行路线,而且还能借助信号处理等既有理论。作者进一步推演了这种判断对新架构设计、样本效率、测试时计算、模型安全与开放生态的影响。整体是面向研究方向的反思性随笔,强调问题值得深入,但不少结论仍是启发式判断而非严格实验结论。

文章直接讨论 foundation models 的可复现性、transformer 是否必要,以及 Hyena 这类替代架构的意义,属于明确的研究反思而非泛泛评论。适合做研究选题启发、架构比较和生态判断,但其中不少推断仍偏设想,读者应把它当作问题框架而非定论。

工程实践Josh W Comeau

How I Built My Blog

这篇文章系统拆解了作者个人博客的技术实现,重点不是展示页面效果,而是解释背后的前端架构与内容组织方式。文章提到他用 Next.js 的 API routes 实现访问量和点赞计数,用 MDX 在文章中嵌入交互与定制化能力,并进一步说明了代码库的组织方式与维护思路。整体上,它把一个内容型网站如何兼顾静态发布、局部交互和开发体验讲得较完整,适合做个人站点或内容产品的实现参考。它的边界也很清楚:主要针对博客这类中小型 Web 项目,方法高度依赖 Next.js/MDX 生态,未必适用于复杂后端系统。

文章给出了可验证的实现细节:Next.js API routes、MDX 互动内容和代码库组织,而不是泛泛讲博客理念,具备直接参考价值。适合前端工程师、个人站点作者或内容型产品开发者阅读;可迁移的价值在于内容站如何在静态性、交互性和维护成本之间做取舍,但技术栈较框架化。