工程实践知乎 - SmartCode 得物技术
文章系统复盘得物交易搜索团队一年内从判别式检索走向生成式召回的工程实践。作者先以LLM增强文本索引,覆盖视觉理解、社区语料、I2I推理、详情页OCR与线上行为锚点,再用四塔多模态向量融合视觉、文本与行为信号。随后引入HLLM进行用户、商品、Query语义解耦,以HSTU把行为序列Token化并验证搜索场景的Scaling Law,并通过语义ID实现语义索引召回与自回归候选生成。最后提出召粗一体化架构,试图用统一生成模型替代部分级联链路。文章给出离线与线上收益趋势,但关键指标披露有限,且SID量化损失、实时增量更新、MFU约17%等仍是待解问题。
推荐收录:文章给出了从LLM索引增强、多模态表征、HLLM/HSTU到语义ID与召粗一体的完整落地路径,并讨论Scaling Law、MFU、SID增量更新等真实约束,工程证据密度高。适合搜索/推荐算法与工程团队参考,可迁移到生成式召回、语义ID和端到端排序系统设计;不足是关键线上指标披露有限,部分模块细节需结合后续文章验证。
技术文章PlanetScale Blog
文章系统讲解全文搜索倒排索引的内部结构,并落到 Postgres 场景说明工程实现。核心组件包括词项字典、postings list、位置数据与词频统计;postings 通常有序存储,并用差值编码、位图压缩减少空间,以支持并集/交集、短语和跨度查询。查询侧还讨论 tokenizer、停用词、词干化带来的精度取舍,以及 BM25 打分和 top-k 通过块级统计跳过 postings 的优化。更新删除依赖不可变 segment、tombstone 和后台 merge,但合并带来大量 I/O 与临时空间,删除则造成空间放大和过滤开销。最后分析 Postgres 集成约束,包括 ctid 映射、WAL、VACUUM、可见性映射、查询规划器与 CustomScan。文章偏概念性综述,TIN 的性能数据和实现细节需阅读另一篇深潜。
推荐收录:文章完整解释倒排索引的词项字典、postings 压缩、BM25、segment 合并与 Postgres 集成约束,技术证据密度高。适合数据库、搜索和后端工程师建立系统认知,也可迁移到 Lucene、Elasticsearch 类系统的选型与调优。主要局限是概念综述,TIN 的具体性能数据需参考另一篇深潜。
技术文章TiDB 社区博客 - 技术解读
文章系统介绍 TiDB 的向量搜索能力与 AI 集成实践:先说明向量搜索与 Embedding 的基本原理,再讲解 TiDB 原生 VECTOR 数据类型、向量写入方式、VEC_COSINE_DISTANCE/VEC_L2_DISTANCE 等距离函数,以及 HNSW 向量索引的参数含义。随后给出构建 RAG 知识库问答的完整架构与 Python 代码,演示与 OpenAI Embedding、LangChain、LlamaIndex 的集成思路,并讨论索引构建时机、HNSW_EF_SEARCH 调参和向量维度取舍等性能优化要点。核心结论是 TiDB 可在同一条 SQL 中结合向量检索与结构化过滤,避免维护两套系统。不足在于部分代码为占位或有误(如框架集成示例将查询向量写成空数组),且向量索引依赖 TiFlash,社区版暂不支持 SQL 建索引,整体偏入门教程。
收录理由是文章把 TiDB 原生 VECTOR 类型、HNSW 索引与“向量+结构化条件”混合搜索放在同一 SQL 中讲解,并配有 RAG 知识库与 LangChain/LlamaIndex 集成示例,对希望在现有关系库上落地向量检索的开发者有可迁移价值。需注意部分示例代码为占位或含错误、索引依赖 TiFlash,读者应结合官方文档验证后再用于生产环境。
工程实践PlanetScale Blog
PlanetScale 发布并 GA 全文搜索扩展 TIN,目标是在事务、复制与并发更新下支持布尔/短语/模糊/正则查询、COUNT(*) 和 BM25 top-k。其核心设计是直接用 Postgres ctid 作为 posting 标识,省去顺序 docid 到 ctid 的映射;再用页面级与偏移级位图压缩 48 位 ctid,并借助 AVX2/AVX-512 向量化交并和 POPCNT 计数。TIN 通过堆检查、可见性映射和 liveness bitmap 保证 MVCC 与 VACUUM 正确性,分段合并时因 ctid 不变可复用位图、降低写放大。基准在 85GB Stack Exchange 语料、8 vCPU/32GB 容器中对比 ParadeDB、pg_textsearch 与 GIN,TIN 吞吐至少高 8 倍。但这是厂商自测且查询轨迹合成,跨工作负载的独立验证和运维边界仍需观察。
推荐收录:文章虽为产品发布,但给出了 TIN 以 ctid 为文档标识、位图压缩与向量化执行、MVCC/VACUUM 集成的完整设计解释,并用可复现的容器配置和对比基准量化性能。适合数据库内核、搜索索引和性能工程读者,其“复用存储引擎原生标识以减少映射和合并开销”的思路可迁移到其他索引系统;风险是厂商自测、合成查询,需结合独立验证。
工程实践Yelp Engineering
Yelp 工程团队介绍如何在自研 Lucene 搜索引擘 Nrtsearch 中通过 Inference Plugin 嵌入 ML 排序,替代独立推理服务。此前两阶段流程需从特征存储拉取大量候选特征并跨网络传输,候选和特征规模增大后出现延迟与序列化瓶颈。新方案将特征抽取与模型推理下沉到搜索层,在副本节点 JVM 内加载 MLflow/MLeap 模型并由内置 TensorFlow 模型服务器逐文档打分,支持 Function Score、rescore、多模型聚合、自定义 Java scorer 或内置通用 scorer。文章还覆盖设计目标、测试、金丝雀/滚动部署、Prometheus 监控和未来 GPU 推理计划。整体是高层架构复盘,未给出量化收益和资源隔离等边界讨论。
推荐收录:文章给出了从痛点、架构、插件机制到测试、部署、监控的完整闭环,直接证据是其中将特征抽取与推理共置于 Nrtsearch 副本节点,消除网络传输和序列化开销,并用 Prometheus 监控模型退化。适合搜索/广告/推荐排序基础设施与 ML 平台工程师阅读,可迁移到检索系统内嵌模型推理、自定义 scorer 扩展及模型灰度发布。主要不足是缺少延迟、吞吐和相关性收益的量化数据,资源隔离与故障边界也着墨较少。
工程实践Salesforce Engineering
文章复盘Salesforce企业级RAG应用:标准文本基准准确率超90%,但在复杂企业文档上仅约46%。作者主张从错误答案反向排查解析、分块、富化、嵌入、检索与生成链路,并一次只改一个阶段来定位失败。改进包括按页复杂度路由的智能解析、保留语义边界的结构化分块、元数据与问题表示富化、SFR Embedding v3扩展上下文、动态元数据预过滤及GraphRAG多跳检索。分阶段基准从65.1%升至84.4%和86.8%,整体企业文档准确率超过90%;JIT索引把30分钟以上等待降至7-10分钟。局限是内容来自厂商博客,GraphRAG尚未正式可用,基准与产品能力难以独立复现。
推荐收录:文章给出了可操作的RAG准确率诊断路径,并用分阶段基准展示65.1%→84.4%→86.8%及46%→90%+的归因式改进,而非泛泛讨论提示词或换模型。它适合正在构建企业知识库、文档问答和检索系统的工程团队,智能解析、语义分块、元数据预过滤与单变量评估方法可直接迁移。需注意其来源为厂商工程博客且GraphRAG尚未正式可用,部分产品指标需结合自有语料验证。
工程实践SelectDB 技术分享
文章围绕“Agentic AI 需要持续可行动的数据闭环”这一目标,指出传统 BI 只回答因果、RAG 只返回相关文档,而 Agent 还需要结合订单、库存、设备状态等实时业务事实进行关联分析和决策,并能够写回行动结果。为此,文章提出 Paimon 2.0 与 Apache Doris 的分工共治方案:Paimon 2.0 通过 BLOB、VECTOR、VARIANT、Data Evolution、Global Row ID 和 Global Index 支持多模态数据的持续演进与索引;Doris 通过 Paimon Catalog 保持快照读取语义,将 Vector Index 作为查询计划中的候选生成阶段,在 MPP 引擎中完成过滤、Join、聚合与全局 Top-K,并支持标准 SQL 的 INSERT、UPDATE、DELETE、MERGE 等写回操作,从而形成“感知—检索—分析—行动—反馈”闭环。文章还以工业故障诊断场景为例,介绍了快手在 Paimon 湖表上做千万到亿级向量检索的生产实践:召回率 96.0%~99.6%,在远端 Alluxio 缓存下与 Doris 内表对比的查询耗时为后者的 1.07~4.18 倍。文末给出了建目录、查询和写回的简单 SQL 示例。需要说明的是,部分能力仍属发版预告,性能数据依赖缓存配置,读者需结合实际版本和场景验证。
推荐收录。文章不是简单的产品宣传,而是具体展示了如何用 Paimon 2.0 的开放数据格式与 Doris 的 SQL 执行能力构建 Agent 可用的实时上下文,包括向量索引下推、候选裁剪、快照一致读取和 SQL 写回等关键设计,并给出了快手亿级向量检索的召回率与性能对比数据,证据相对直接。适合正在规划 Agent 数据平台、实时湖仓或多模检索架构的数据工程师和架构师参考;其“避免复制第二份数据进独立向量库”的架构思路具有可迁移价值,但能力成熟度和性能需要结合具体版本、缓存和硬件条件验证。
工程实践ClickHouse Engineering
文章介绍 Google 开源的 MCP Toolbox for Databases 如何与 ClickHouse 集成,把智能体输入的自然语言在服务端转换为向量并做语义检索。核心机制是在 YAML 中声明 Gemini 嵌入模型,并用 embeddedBy / valueFromParam 让工具参数自动嵌入文本,再以 []float32 绑定 SQL 占位符,配合 Array(Float32)、cosineDistance 和 HNSW 索引返回排序结果。作者以 57 篇跨五个主题的文档实测,验证效果并量化嵌入列压缩率低、小数据量下 HNSW 索引收益有限等开销。生产注意事项包括离线批量嵌入、为搜索设置距离阈值、参数由驱动转义而非服务端绑定,以及仅支持 Gemini、taskType 硬编码为 SEMANTIC_SIMILARITY、REST 接口需显式开启等限制。
推荐收录,因为它提供了可复现的端到端配置、57 篇文档实测、查询日志与压缩/索引开销分析,而不只是产品介绍。适合 AI 工程、数据库和 Agent 开发者理解 MCP 工具层如何把 ClickHouse 文本表变成语义搜索工具。主要风险是内容绑定 Toolbox 1.9.0、Gemini 唯一嵌入供应商且检索任务类型不可调。
技术文章TiDB 社区博客 - 技术解读
文章系统讲解向量检索的技术背景:从 Embedding 将对象映射为高维空间中的点入手,说明余弦、内积等相似度度量,并指出全量暴搜 KNN 的成本是 O(N·D),难以扩展到亿级数据。随后引入 ANN 与召回率指标,提出在近似索引中以可控精度损失换取数量级提速。作者分别剖析了 IVF 聚类倒排索引、HNSW 分层图索引和 SPFresh 动态分区索引的原理、查询流程、漏扫原因与核心参数,并从内存占用、更新能力、适用场景做横向对比,强调工程选型需结合数据规模和写入频率。文章逻辑清晰但属背景铺垫,真实工程实现和性能验证留待下篇。
文章不是简单罗列概念,而是用数据库工程师熟悉的“分治/近似”思想拆解向量索引的算法差异,对 IVF、HNSW、SPFresh 的召回率、内存开销和控制参数都有具体分析,能直接帮助读者在选型或阅读架构文档时理解 trade-off。适合后端工程师、数据库研发和需要落地 RAG/向量检索的团队。需留意作者最终落脚于 TiDB 的 SPFresh,属于厂商技术博客,阅读时应结合其他来源交叉验证。
工程实践美团技术团队
文章复盘美团搜索3.0在服务零售排序中应用LLM语义表征的三期实践。一期通过特殊Token与注意力掩码生成Query和POI的64维向量,以余弦相似度分桶注入精排,验证可行并显著改善长尾体验。二期构建Query-POI-Deal五元组,结合LoRA微调、MRL-E降维及InfoNCE与Triplet联合对比损失,系统性提升表征质量。三期将表征迁移至下挂精排,解决覆盖率缺口后,用PEPNet门控注入并叠加全域交叉统计特征,进一步提升订单。作者沉淀了难负样本质量决定上限、Embedding Prompt宜精简、迁移需先验证覆盖率等经验,并指出负例质量提升与Semantic ID量化等后续方向。作者也说明结论源于美团特定场景,普适性有待验证。
本文是真实业务三期迭代的完整复盘,包含问题定义、多方案对比、离线在线指标和工程细节(如覆盖率修复、存储优化),对搜索排序、LLM表征应用和推荐系统工程师有直接参考价值。可迁移经验包括难负样本构造、MRL-E多尺度降维、PEPNet门控注入等,同时也指出了阶段局限性。适合作为长期技术参考。
技术文章Phil Eaton - databases
文章从零构建一个基于 Go 和 Pebble 的简易文档数据库,支持通过 HTTP 插入、按 ID 获取和搜索 JSON 文档,代码控制在 500 行以内。作者实现了一个简化版 Lucene 查询语言,包括带引号字段名/值、嵌套路径、相等和范围比较以及隐式 AND。为了加速等值查询,系统在独立索引库中存储“路径=值”到文档 ID 列表的映射,并在搜索时对多个等值条件取交集;基准测试显示 year=1918 的查询从约 1 秒降至 0.03 秒。文章明确指出现有实现不支持范围索引、全文搜索和数组字段,且索引存储采用逗号分隔的 ID 字符串,适合作为理解文档数据库基本原理的教学项目而非生产系统。
推荐收录:文章提供了可运行的 Go 实现,完整覆盖查询解析、路径求值、基于 Pebble 的存储和等值索引构建,并给出了索引前后的性能对比,具有清晰的动手教学价值。适合后端工程师、数据库初学者或希望理解 Lucene 风格查询和倒排索引简化模型的读者。可迁移价值在于展示如何用少量代码实现可扩展的键值查询与索引设计,同时明确标出范围查询、数组和全文搜索等未覆盖边界,避免误导。
工程实践LinkedIn Engineering - Architecture
文章来自 LinkedIn Engineering,系统介绍了利用嵌入检索(EBR)技术提升求职匹配的工程实践。作者首先解释了嵌入和 EBR 的基本概念,及其在搜索和推荐系统中的早期检索阶段作用。随后详细描述了 LinkedIn 为此构建的基础设施组件:支持复合多任务学习的模型训练框架、名为 Feature Cloud 的离线和流式嵌入生成平台、增强的托管搜索系统(包含自动嵌入版本管理和 IVFPQ 等近似最近邻算法),以及基于 Ray Serve 的 Model Cloud 推理图编排。在 Job Search 应用中,团队采用两塔模型和 softmax 损失训练请求与职位嵌入,并通过 Zelda 框架进行 IVFPQ 索引和在线近似搜索。上线后观测到申请数、点击率和成功会话等参与度指标显著提升,同时简化了原有文本检索并降低了 p95 延迟。文章重点在工程架构和实际落地经验,边界是未深入模型理论细节,更多展示系统设计和版本管理方案。
推荐收录,因为这是一篇来自一线大厂的完整工程案例,详细展示了在规模化搜索场景中引入 EBR 的架构设计、模型训练、版本管理和在线服务方案,并给出了明确的业务收益。对搜索引擎、推荐系统、机器学习平台和基础设施团队具有直接参考价值,尤其是嵌入版本一致性管理、流式嵌入生成和复合模型推理编排等实践可以迁移到类似系统中。
工程实践LinkedIn Engineering - Scalability
文章介绍了 LinkedIn 用 Rust 构建的通用检索引擎 FishDB,替换了运行近十年的 Java 系统 FollowFeed。文章首先分析了旧系统的局限:Java 对象内存开销大、GC 导致高尾延迟、数据模型僵化且业务逻辑耦合,限制了推荐系统的扩展和迭代。随后解释了选择 Rust 的原因,并通过对比实验展示 Rust 在内存效率上的显著优势。FishDB 采用 scatter-gather 架构和 lambda 架构,提供了灵活的命令式查询语言和多种索引结构,包括倒排索引、前向索引、引用索引和基于 RocksDB 的属性存储,以支持图状数据模型和高效过滤排序。迁移采用分层渐进方式,通过 JNI 桥接保持 API 不变,实现了零中断切换,最终取得 2 倍效率、减少 50% 硬件、p99 延迟 40ms 的成果,并将实验周期从数周缩短到数天。文章也指出当前查询语言仍为命令式,未来计划引入声明式语言和向量搜索。
本文是一份高度完整的工程案例,从问题诊断、技术选型、系统架构、索引设计到灰度迁移提供了详实细节和量化结果,展示了如何用内存安全的高性能语言重构大规模检索基础设施。适合负责推荐系统、搜索引擎、分布式存储或性能优化的工程师阅读,可迁移的经验包括内存数据结构设计、Rust 在服务端的应用模式、分层迁移策略以及如何平衡灵活性与性能。
工程实践LinkedIn Engineering - Scalability
文章介绍了LinkedIn Hiring Assistant中基于语义搜索的AI代理检索与排序系统MUSE。面对自然语言招聘查询与十亿级会员画像的匹配问题,团队构建了LLM-as-a-judge驱动的教师模型,生成海量资格匹配标签,训练双塔Transformer嵌入模型,并采用Matryoshka嵌入同时服务检索与排序。生产系统采用Lambda架构,结合批量重建与CDC增量推理,通过IVFPQ索引和优化管道实现亚秒级检索。离线回放与在线A/B测试表明,MUSE提升了候选相关性和招聘者参与度,但近似检索与后过滤的损失叠加仍是后续优化方向。
本文详细披露了LinkedIn大规模语义搜索系统的设计与实现,覆盖教师监督、双塔嵌入、十亿级向量检索和在线评估等关键环节,技术细节丰富且可验证。适合搜索推荐、AI基础设施和MLOps方向的工程师参考,其Matryoshka嵌入分层服务、CDC增量更新和IVFPQ优化等实践可直接迁移到类似规模系统。
工程实践SelectDB 技术分享
文章针对大模型应用中专用向量库成本高、混合查询难的问题,深入剖析 Apache Doris 4.1 原生向量检索的工程设计。作者先比较专用向量数据库、关系型数据库扩展和分析型数据库原生支持三条路径,论证原生集成路线的优势。随后详细阐述 IVF 索引降低内存、IVF_ON_DISK 冷热分层、SQ/PQ 量化压缩以及 ANN Index Only Scan 优化查询性能的具体实现和 DDL 示例。文章还演示了结构化过滤联合查询与基于 RRF 的多路召回融合在 SQL 中的落地方式,并给出 VectorDBBench 基准数据。测试表明该方案在 100 万 768 维向量上取得 900 QPS、97% 召回率,构建速度最快,形成成本与性能的均衡。不过文中基准硬件规格不一,实际部署需根据工作负载进行验证。
推荐收录,因为文章不是简单的功能罗列,而是系统拆解了 Doris 4.1 向量检索的工程实现,包括 IVF 降本、磁盘索引、量化压缩、Index Only Scan 等关键设计,并提供了混合检索的 SQL 实现和基准数据。适合数据库内核、AI 基础设施和 RAG 系统开发者参考,其存储分层、覆盖索引和融合排序思路可迁移到其他 OLAP 或向量检索场景。需注意部分内容来自厂商,基准配置存在差异,应结合自身负载验证。
技术文章SelectDB 技术分享
文章分析了 AI Agent 生产环境中可观测性负载的新特点:文本主体大且无结构、关键字段高度动态、trace 有序嵌套、看板需与持续写入并存。作者指出传统搜索、OLAP、文档库难以单独胜任,需要统一混合负载数据系统。AgentLogsBench 用单表 1 亿行 observation 数据评测六种引擎,覆盖 trace 回放、短语搜索、动态 JSON 过滤和实时聚合。结果显示 Apache Doris 综合 slowdown 1.28 领先,hot/cold 均第一,但在长文本 cold phrase search 上仍落后 Elasticsearch。文章解释了 Doris 领先原因包括倒排索引、VARIANT 子列、按 trace_id 分布与排序键、分区裁剪和缓存机制。该文可作为选型或理解混合负载数据系统的参考,但数据来自合成 benchmark,结果需结合实际验证。
推荐收录,因为文章不是空泛宣传,而是给出了 Agent 可观测性基准的具体设计、完整查询负载和跨系统实测数据,并逐项解释 Doris 架构优化如何影响性能。适合从事可观测性、OLAP 或 AI 平台基础设施的读者,用于理解混合负载系统选型与优化。可迁移价值在于把文本搜索、动态 JSON、trace 回放和实时聚合放在同一存储上权衡;主要风险是来自 SelectDB 官方且数据为合成,需结合其他评测交叉验证。
技术文章TiDB 社区博客 - 技术解读
文章系统讨论 AI Agent 的记忆体系,借鉴认知科学将记忆分为短期、语义和情景三层,并补充全文检索记忆需求。作者批评用 Redis、MySQL、向量库和 Elasticsearch 拼接的方案存在数据一致性、混合查询困难和运维复杂等痛点,提出应在同一数据库内核中原生融合关系、向量和全文检索能力。文章以 TiDB 8.5 为例,展示通过 VECTOR 列、向量索引和全文索引在单条 SQL 中组合结构化过滤、语义检索和关键词匹配的实现方式,并说明平凯云服务的 Serverless 弹性、HTAP 能力和全球部署优势。文章适合关注 Agent 记忆系统、RAG 或数据库选型的开发者,但需注意其官方博客的产品宣传色彩和方案边界。
推荐收录。文章不仅解释了 Agent 记忆的分类和需求,还具体分析了多系统拼接架构的工程痛点,并给出使用 TiDB 原生融合关系、向量和全文检索的 SQL 示例,证据具体、有可操作价值。适合构建有状态 AI Agent、RAG 应用或需要混合检索能力的开发者参考,可迁移架构思路,但需注意其中隐含的厂商推广和 TiDB 特定实现约束。
工程实践GitHub Engineering
文章介绍了 GitHub 代码搜索引擎中实现高速 Unicode 大小写折叠(case‑folding)的技术方案。核心优化是在 ASCII 路径中去除提前退出分支,采用无分支循环配合自动向量化,使纯 ASCII 折叠速度超过 45 GiB/s。对于 Unicode,设计了一种仅 1776 字节的紧凑查找表,结合页位图、区间编码与字节级差值运算,避免码点解码而直接在字节空间完成折叠,将非 ASCII 路径开销降到最低。该方案在常见输入上显著超越其他实现,且已开源为 Rust crate casefold。文章还详细讨论了分支消除、向量化、内存带宽等权衡,以及该方法依赖小端字节序和合法 UTF‑8 的边界条件。
推荐收录,因为文章深入剖析了大规模文本处理中的极致性能优化方法,从分支消除、向量化到创新的字节空间 Unicode 折叠,展示了完整的工程决策过程和量化对比。对于从事搜索、编译、系统编程或性能优化的读者,文中的无分支循环设计、紧凑查找表结构和“一次扫描检测+转换”等技巧具有直接的可迁移价值,是真实的工程案例而非泛泛调参记录。
工程实践Crunchy Data Blog
文章系统探讨了在PostgreSQL和pgvector中实现混合搜索(向量相似度加标量过滤)的工程模式。首先阐述了pgvector迭代索引扫描如何平衡召回与性能,然后分析了向量优先和标量优先两条路径各自的适用场景与局限。作者进一步提供了三种实用工作区:为低基数过滤构建部分HNSW索引;通过过采样再过滤应对高基数或临时过滤器;以及利用缓存加速重复查询。文中给出了过采样的估算公式、查询计划诊断方法以及各方案的决策指南,并强调了每种模式在召回率、性能和维护成本之间的权衡。
推荐收录,因为本文是针对Postgres+pgvector混合搜索问题的实战指南,从问题根源到四种解决方案给出了完整的权衡分析、代码示例和调优公式,远超简单教程。适合正在构建带标量过滤的向量搜索系统的工程师,文中部分索引、过采样和缓存等模式可直接应用于生产环境,决策树和EXPLAIN诊断方法具有跨场景的可迁移价值。
工程实践Grab Tech
文章提出了一种基于用户反馈的知识图谱关系验证框架,用于在快速变化的领域(如外卖菜单)中检测和消除自动化构建所产生的错误关系。核心方法是将图谱边分为已验证和候选两类,通过搜索界面以探索与利用策略注入候选边,并采集点击、购买等加权交互信号,计算置信度分数来自动推广或剪枝边。该闭环系统无需人工干预,利用众包隐式反馈大规模纠正AI幻觉,并在食品配送场景中验证了其有效性。适用边界包括依赖充足用户流量的动态目录搜索,且需要精细控制注入以避免影响体验。
收录理由:文章详细描述了一个将搜索界面作为验证环境的工程方案,包含假设生成、候选注入、信号聚合和图更新等完整模块设计,并通过加权交互信号和置信度阈值实现自动图结构演化。对负责搜索系统、知识图谱构建或数据工程团队具有直接参考价值,其探索-利用设计和无人工干预的规模化验证思路具备可迁移性。
科研议题美团技术团队
文章介绍了美团LongCat团队提出的搜索智能体评测基准LoHoSearch,旨在解决人工出题基准如BrowseComp易饱和、难度上限受限的问题。LoHoSearch基于覆盖762万实体的维基百科知识图谱自动生成题目,通过控制搜索空间(候选实体数量)和结构复杂度(约束交叉与环形依赖)系统性地提升难度,最终构建出544道经人工核验的题目。实验显示,当前最强模型GPT-5.5准确率仅34.74%,远低于在BrowseComp上的表现;重复采样和上下文管理策略的增益在长程搜索中显著收窄,揭示了信息丢失等新挑战。该基准不仅为搜索智能体提供了更具区分度的评测标尺,也为上下文管理研究提供了困难试验场,但其静态英文维基百科来源可能限制了对多语言或动态知识的覆盖。
本文系统展示了基于知识图谱构建高难度搜索基准的自动化方法,直接回应了现有评测基准饱和的困境,证据扎实,实验分析深入。适合从事搜索智能体、大模型评测及上下文管理的研究者与工程师阅读,其中双重难度控制机制和上下文策略失效的发现,为设计更鲁棒的搜索系统和研究长程推理提供了可迁移的洞见。
科研议题知乎 - 微软亚洲研究院
文章提出RE-TRAC框架,通过递归轨迹压缩让深度搜索智能体跨轮次传递经验,将独立的探索转化为渐进式学习过程。核心是在每轮探索结束时生成包含答案、证据库和待探索方向的结构化状态,并作为下一轮输入,从而减少冗余搜索并逐步收敛搜索空间。实验在BrowseComp、GAIA等五个基准上进行,4B和30B模型均取得领先成绩,分别超越大部分同尺寸和更大模型;RE-TRAC还可作为无需训练的测试时扩展方法应用于前沿模型,显著提升准确率并降低资源消耗。方法通过实体树构建合成训练数据进行SFT,证明了小模型搭配该框架即可实现强大搜索能力,为资源受限场景提供高效路径。
推荐收录,因为该文深入介绍了一项已被ICML 2026接收的高质量研究,不仅提出了可有效解决深度搜索中经验复用难题的新框架,还提供了详尽的实验结果和可复现的训练方案。对从事AI Agent、搜索增强和模型部署优化的研究者和工程师具有明确的参考价值,其跨轮次轨迹压缩的思路可迁移至其他需要长程规划的任务。
技术文章知乎 - SmartCode 得物技术
文章系统梳理了RAG(检索增强生成)的核心检索技术链路,从LLM的局限性引出RAG的必要性,依次阐述了文档切分策略(Chunking)、文本向量化(Embedding)的原理与对比学习训练方式、向量相似度度量(以余弦相似度为主)、以及近似最近邻搜索算法HNSW的分层图设计与贪心搜索机制。在此基础上,完整介绍了查询改写、元数据过滤、多路召回(ANN+BM25)、RRF排名融合与Cross-Encoder重排序(Rerank)的协同工作流程,并强调了混合检索与各环节工程取舍的重要性。全文提供了具体的参数选择、算法复杂度和实践建议,适合构建高质量RAG系统的开发者参考。边界:未涉及具体模型微调与超大规模部署,但覆盖了核心概念与实用策略。
本文深入浅出地讲解了RAG检索系统的核心原理与工程考量,从Embedding到HNSW再到混合检索,每一环节均有理论解释和实际示例,避免空泛介绍。适合AI工程师、后端开发者以及希望优化检索效果的技术人员。文中关于Chunking策略、HNSW参数调优、多路召回融合等可迁移经验具有较高的实践指导价值,因此推荐收录。
工程实践知乎 - 鹅厂架构师
这篇文章复盘了一个真实的 Elasticsearch 迁移项目:将客户长期运行的 ES 2.4、Solr 5.3.1 以及相关业务索引,迁移到腾讯云 ES 7.14.2,并覆盖了全量/增量同步、灰度切流和回滚双写等完整链路。作者重点讲解了跨 5 个大版本迁移中遇到的关键问题与处理方式,包括多 type 合并到单 type、字段类型一旦落地不可修改、_id 元数据与 source 字段冲突、ngram 分词导致索引膨胀、默认模板影响全文检索,以及按月拆索引配合 index sorting 提升范围查询性能等。
推荐收录,因为它不是泛泛而谈的迁移宣讲,而是把真实生产环境里最容易踩坑的 ES 迁移、建模和性能优化问题逐一拆开,给出了可复用的定位思路和配置方案。对做搜索系统迁移、索引设计、同步链路和线上切流的工程师来说,这篇文章具有很强的迁移价值和实战参考意义。
工程实践Dropbox Tech
文章围绕 Dropbox Dash 的企业搜索相关性优化,说明其 RAG 问答体验高度依赖检索排序质量,而排序模型又依赖大量高质量相关性标注。作者提出先用少量内部人工标注样本校准 LLM 评审,再让 LLM 离线批量生成数十万到数百万条标签,以低成本扩充训练数据,并用人类判断作为持续基准。文中详细讨论了如何用均方误差衡量 LLM 与人工的一致性、如何优先抽样高分歧样本、如何通过查询上下文和工具补足歧义,以及如何借助 DSPy 做提示词优化。文章也明确指出 LLM 不能直接替代线上排序模型,原因包括上下文窗口和延迟限制,因此更适合作为“标注放大器”和离线教师模型。其边界在于方法依赖高质量人工参考集、内部上下文知识和持续监控,且需要防止提示词漂移与评测回归。
推荐收录,因为文章给出了从人工标注到 LLM 批量标注、从离线评测到线上检索训练的完整闭环,证据具体且可复用。适合做搜索排序、RAG 评测和 AI 数据标注体系设计的参考,但要注意它依赖内部上下文与人工基准,不能直接照搬到无领域知识场景。
工程实践Instacart Tech Blog
文章介绍了 Instacart 如何把线下周刊传单自动转成可点击、可下单的商品页面。作者先指出人工标注每张 flyer 需要 3–4 小时,且在多零售商接入后无法扩展,因此设计了两阶段流水线:第一阶段用 SAM 结合自定义去噪、文本框剔除、WBF 合并、轮廓检测集成和规则/模型过滤,完成商品框分割;第二阶段用 PaddleOCR、LLM 与搜索 ANN,将图像框转成查询并在商品库中排序匹配。实践结果显示,系统能在 30 分钟内完成审核,分割目标框召回达到 75–90%,商品首位命中召回约 95%。文章也说明该方案对版式复杂度很敏感,简单 flyer 可用 VLM 直接处理,但复杂促销页仍需要大量后处理与业务规则。
有明确的工程证据:从 3–4 小时人工流程降到 30 分钟,且给出了 75–90% 分割与 95% 商品匹配等指标。适合做多模态检索、文档/版面理解和 AI 流水线设计参考,尤其能迁移到“视觉识别 + OCR + 搜索排序”的生产系统。
工程实践Dropbox Tech
这篇文章是 Dropbox Dash 工程副总裁对其检索与智能问答架构的一次系统性拆解,重点讲了如何把多源工作内容接入“context engine”。作者先说明连接器、内容标准化、OCR/多模态理解、嵌入与知识关系建模,再进入 BM25 词法索引与向量库的混合检索,并通过多轮排序实现个性化和权限控制。文章还比较了 federated retrieval 与 index-based retrieval 的取舍,解释了为什么在 Dropbox 规模下更偏向预索引、离线富化和跨应用知识图谱,而不是纯实时拉取。随后作者讨论了 MCP 在上下文窗口、工具定义和延迟上的问题,以及通过“super tool”、子代理和本地存储工具结果来控成本。最后用 LLM as a judge、RAG as a judge 和 DSPy 展示了如何通过评测和提示优化持续提升检索相关性,但也明确指出这些方案高度依赖工程投入、数据新鲜度治理和复杂的离线/在线评估体系。
推荐收录,因为文中给出了 Dropbox Dash 的真实架构取舍:索引式检索、知识图谱 bundle、MCP 工具收敛、LLM 评测和 DSPy 优化都不是概念性描述,而是带有明确约束与结论的工程实践。适合正在做 RAG、企业搜索或 agent 平台的读者参考,但需要注意其方案建立在大规模数据接入和长期基础设施投入之上,不能直接照搬。
工程实践Instacart Tech Blog
文章复盘了 Instacart 用 LLM 重构 Query Understanding 的全过程,目标是提升购物搜索中长尾、口语化和歧义查询的意图识别能力。作者先指出传统方案依赖噪声标签、多个独立模型和碎片化流水线,难以同时兼顾召回、精度与维护成本。新方案以 LLM 为核心,分三层推进:用 RAG 和提示工程注入类目、转化等业务上下文,用后处理 guardrails 约束幻觉和类目偏差,再对关键场景做 LoRA 微调,把领域知识固化到小模型里。文章分别展示了类目分类、query rewrite 和 SRL 三个任务的改造方式,尤其强调“teacher 生成离线高质量数据 + student 承担实时长尾推理”的混合架构。最终他们在 8B 模型上达到接近大模型的 F1,并通过缓存、H100、adapter merge、量化取舍和 autoscaling 把延迟压到约 300ms,证明该路线既能提升搜索质量,也能控制成本,但前提是业务上下文足够丰富且可被持续治理。
收录依据很明确:文章不仅讲了 LLM 替代传统 QU 的思路,还给出了 RAG、guardrails、微调、缓存与延迟优化的完整落地链路,以及精度/召回/成本的结果。适合做搜索、推荐或垂直场景 LLM 工程的参考,尤其对需要处理长尾查询和实时推理约束的团队有直接迁移价值。