知乎 - SmartCode 得物技术

24 篇内容

工程实践知乎 - SmartCode 得物技术

别再只卷向量检索了,得物交易搜索如何用“生成式”实现召回范式跃迁?

文章系统复盘得物交易搜索团队一年内从判别式检索走向生成式召回的工程实践。作者先以LLM增强文本索引,覆盖视觉理解、社区语料、I2I推理、详情页OCR与线上行为锚点,再用四塔多模态向量融合视觉、文本与行为信号。随后引入HLLM进行用户、商品、Query语义解耦,以HSTU把行为序列Token化并验证搜索场景的Scaling Law,并通过语义ID实现语义索引召回与自回归候选生成。最后提出召粗一体化架构,试图用统一生成模型替代部分级联链路。文章给出离线与线上收益趋势,但关键指标披露有限,且SID量化损失、实时增量更新、MFU约17%等仍是待解问题。

推荐收录:文章给出了从LLM索引增强、多模态表征、HLLM/HSTU到语义ID与召粗一体的完整落地路径,并讨论Scaling Law、MFU、SID增量更新等真实约束,工程证据密度高。适合搜索/推荐算法与工程团队参考,可迁移到生成式召回、语义ID和端到端排序系统设计;不足是关键线上指标披露有限,部分模块细节需结合后续文章验证。

工程实践知乎 - SmartCode 得物技术

指标平台:从语义底座到智能消费的实践路径|得物技术

文章复盘得物内部指标字典从 0 到 1 的落地实践,核心是把业务隐性口径转化为结构化、唯一可信的语义资产。业务侧逆向梳理存量报表并用“沉淀—观察—转正”机制收编隐性指标,数仓侧通过血缘核查与分批改造把散射依赖收敛到域内精品宽表,产品侧用 YAML 解析、维度管理和多技术来源物理映射把上架流程工程化,并在提报环节以语义相似度检测拦截口径二义性。作者给出 Text2SQL 与 AI Coding 两条消费主线的验证证据:系统测评 SQL 准确率从 85%+ 提升到 95%+,且与条件拼接修复、时间解析固化等治理动作一一对应,OneData 建设全流程提效 40%+。文末提出以消费热度反哺治理优先级、元数据下沉到消费方式等闭环方向,但结论高度依赖得物自身组织与数据规模,跨公司可迁移性仍需验证。

推荐收录:文章提供了从语义底座建设、二义性拦截到 Text2SQL/AI Coding 消费验证的完整工程链路,并用 85%+→95%+ 的准确率趋势和 40%+/70%+ 的提效数据作为直接证据,而非泛泛方法论。适合负责数据平台、指标治理、Text2SQL/RAG 语义层或 AI 辅助研发的工程师与架构师参考,其中“消费驱动治理”“多技术来源统一交付”“血缘核查先行”等做法可直接迁移;但需注意结论基于得物自身组织与数据规模,跨团队落地要重新评估边界。

工程实践知乎 - SmartCode 得物技术

企业级 MultiAgent 落地:Plan 模式与主子 Agent 协作|得物技术

文章介绍得物基于 AgentScope Java 的企业级 MultiAgent 平台,聚焦复杂任务如何规划、拆解并由主子 Agent 协作执行。平台采用 Plan-and-Execute,把计划操作注册成工具,注入 Hint 软约束,持久化计划状态并支持断点幂等恢复,同时通过 SSE 推送 CHAT/PROCESSING/ERROR 事件。主子 Agent 以声明式配置拆分职责、工具和权限,支持同步、异步、并行调用与协作式中断;A2A 协议借助 Agent Card、JSON-RPC 和 contextId 实现跨服务会话协作。企业级保障涵盖 ORM 多租户隔离、统一认证、调用树追踪、工具超时重试和 ReAct 迭代上限。方案适合大型企业 Agent 平台落地,但依赖 AgentScope Java 与自研基础设施,且隐去了具体组织信息。

推荐收录:文章给出了 Plan 全生命周期、主子 Agent 声明式配置、A2A 跨服务调用和 SSE 可观测性的具体机制,并明确多租户隔离、断点恢复、中断传播等生产约束。适合设计企业级 Agent 平台、MultiAgent 编排或 AI 基础设施的工程师与架构师参考,计划持久化、异步任务管理和调用树追踪可迁移到类似系统。风险是方案与 AgentScope Java 及得物自研基础设施耦合,且隐去组织环境细节,落地需重新评估。

工程实践知乎 - SmartCode 得物技术

得物小摊 AI Native 演进实录:用 Harness 构建可控 AI 交付

本文以得物小摊创新业务为背景,讲述作者在单人全栈交付中引入 AI 并行开发后,如何构建一套名为 Delivery Harness 的可控交付体系。作者先以拼团页面进度数字的语义分叉为例,说明 AI 可能将一次错误猜测高速扩散到接口、页面和测试中,因此需要把工程判断固化为 Version Contract、Execution Boundary、Evidence Gate、Repair Loop 四个组件:用版本合同锁定事实、用 worktree 和仓库规则限制改动半径、用统一验收报告控制状态跃迁、用 Repair Case 让真实反馈纳入默认规则。文章复盘了一次多 SKU 订单跨用户端、管理端、Node 与 Go 服务的履约改造,说明如何将“订单是履约原子单位”转成跨运行时不变量。最后指出仍有本地与 CI 检查不一致、版本合同未接入流水线等环节待完善,并强调 AI Native 交付的上限不是生成速度,而是质量秩序由系统托底。

推荐收录。文章没有停留在“用 AI 写代码”的表面,而是针对 AI 并行开发带来的语义分叉、越界改动和证据缺失问题,给出了一套可落地的工程方法:Version Contract 锁事实、worktree 隔离边界、Evidence Gate 卡状态、Repair Loop 沉淀反馈,并用真实的多 SKU 跨运行时改造验证了这套链路。适合正在个人或小团队中实践 AI 编程、需要控制交付质量的工程师阅读。其中把业务不变量翻译成跨运行时检查、让 AI 生成与评估分离的思路,对其他 AI 辅助研发场景具有直接可迁移价值。

工程实践知乎 - SmartCode 得物技术

企业级 MultiAgent 的记忆系统:短期上下文与四层记忆架构实现|得物技术

文章复盘企业级 MultiAgent 平台的记忆系统,解决短期上下文、跨会话复用和上下文关联三类问题。系统用四层记忆模型(Working/Session/User/Agent)区分生命周期,短期历史基于 MySQL+Redis,长期记忆经评测选型 MemOS,并提供 MySQL/Mem0 兼容路由。请求时并行加载会话和长期记忆,按 token 预算对 user_profile 与 agent_{agentId} 内容截断;会话结束后异步处理新增消息,经 LLM 判断抽取记忆、本地去重、冲突解决,以先写后删写入 MemOS。文中给出关键代码与参数,如 Redis 淘汰、token 分配、MMR 去重。同时指出外部服务故障缺乏补偿机制,可靠性属于尽力而为,仍需补充延迟/失败率观测。

此为真实企业级工程案例,涵盖完整记忆链路和丰富实现细节,包括并发加载、token 预算分配、异步筛选去重、冲突处理和先写后删策略,证据充分。适合构建 Agent 记忆、上下文管理或 MultiAgent 基础设施的工程师参考,多数设计可直接迁移,但要注意其与 MemOS 外部服务绑定较深,可靠性多为尽力而为,需结合自身可用性要求调整。

工程实践知乎 - SmartCode 得物技术

EP-Harness:从个人 AI Coding 到团队级 Agent 工作流|得物技术

EP-Harness是得物基于开源项目Multica二次开发的团队级Agent工作系统。文章首先指出本地AI Coding在团队化后面临Prompt无审查、经验难沉淀、过程不透明和研发链路未闭环等缺口,进而提出把Agent当作协作成员进行管理的平台化思路。架构上由server、daemon和本地AI编程CLI协作,任务进入Issue体系,并通过Backend.Execute统一各种Agent Runtime的执行契约。文章还归纳了AI Coding从工具使用走向工程系统的四层变化,提出Context Engineering和Loop Engineering作为关键设计理念。落地效果包括多Agent协作闭环、决策追溯,以及自动化修复100+异常日志、治理后日志量降为个位数的实践成果。

推荐收录。本文通过得物实际落地案例,具体展示了从个人AI工具演进到团队级Agent平台的问题定义、架构分层和闭环设计,是稀缺的AI Coding工程化一手实践。对正在构建团队级Agent系统或规划AI研发流程的读者,文中关于任务可追踪、规则可审查、经验可复用的设计思路与量化治理效果,都有直接迁移价值。但文章偏平台概念和结果概述,缺少内部实现细节,读者应结合具体场景验证。

工程实践知乎 - SmartCode 得物技术

得物知识问答:复合检索 Agent 的系统设计实践

文章系统介绍得物知识问答产品的复合检索 Agent 设计实践。作者基于 AgentScope 2.0 HarnessAgent,利用 ReAct 循环、Middleware 和并行工具调用,构建多源并行检索流程,融合企业知识库与个人飞书文档、消息、妙记数据,并通过权限注入实现数据隔离。检索质量上,采用查询扩展生成自然语言变体,并设计 FastPass、Reranker、LLM Grading 三阶段过滤 Pipeline,解决向量相似不等于语义相关的问题。系统还支持图片多模态输入、自动模型切换,以及多实例 SSE 断点续传和模型容灾,提升生产可靠性。文章最后总结六个创新点,并展望精细化检索策略和个人知识助手方向;当前方案依赖企业内部知识管理平台和飞书生态,长期记忆能力尚未启用。

推荐收录,因为文章并非泛泛介绍 RAG 套壳,而是给出了基于 AgentScope 的自主决策检索系统完整工程方案,包含多源并行检索、三阶段质量过滤、多模态输入和生产级 SSE 断点续传等关键设计,并附有代码片段和评测结果。对正在构建企业知识问答、Agent 检索或 RAG 工程化系统的读者,文中关于关注点分离、权限隔离和断点续传架构取舍的做法可迁移,但需注意其对 AgentScope 和飞书生态的依赖。

工程实践知乎 - SmartCode 得物技术

实战从零开始构建一个Coding Agent:Violin |得物技术

文章以从零构建Coding Agent 'Violin' 为主线,系统剖析了Agent的架构设计、核心循环、模型适配、工具系统、会话管理、上下文压缩、资源加载、事件通信和插件扩展等关键组件。作者借鉴Pi的三层分离思想,用Zig实现高性能引擎、Python搭建交互客户端,通过TCP+JSON Lines协议解耦前后端,并详细讨论了Agent Loop'问模型-执行工具'的底层原理及其在各种功能中的扩展方式。文章同时指出了该玩具项目当前的不足(如工具定义未序列化、插件无权限隔离),但强调其核心价值在于验证'理解一个coding agent就能理解所有agent'这一判断。整体展现了深度工程实现、语言选型权衡和可迁移的设计模式,为AI工程化实践提供了扎实的参考。

推荐收录,因为文章不是泛泛介绍AI agent概念,而是深入到代码级实现,包括Zig/Python语言分工、TCP通信协议设计、EventBus事件驱动和Lua插件系统等工程细节,完整呈现了从架构到落地的过程。对正在设计或实现自定义AI agent的工程师、以及对Agent内部机制有深度兴趣的读者来说,文中的分层解耦思想、循环控制模式和资源管理方法具有直接的可迁移价值。

工程实践知乎 - SmartCode 得物技术

AI Native 交易核心系统的研发范式|得物技术

文章分享了得物技术团队在订单系统完成稳定性改造后,面对AI编码带来的代码量激增与质量挑战,如何重构研发流水线以适配AI Native范式。核心思路是将传统流程升级为五道标准化关口:需求澄清阶段通过BDD场景与知识库对齐,锁定业务验收标准;技术方案阶段以五段式模块拆解将设计决策前置,并拉取历史约束规约;编码执行阶段引入TDD的RED-GREEN循环,保证代码可测试、可追溯;门禁卡控阶段由多个审查Agent并行审核,确保阶段产物合规;全流程埋点监控则量化研发过程,驱动持续改进。文章以出海礼品卡需求为例贯穿全文,展示了从需求到代码的完整证据链,为交易核心系统在AI辅助下的稳定性治理提供了可落地的工程实践。

本文系统性地记录了AI编码引入核心系统后的稳定性治理实践,将BDD、TDD、知识库校验与门禁流水线相结合,形成从需求到验证的闭环。其五道关口设计、增量代码体检和全链路埋点等方法,对面临AI辅助开发挑战的高可靠性系统团队具有直接参考价值,可迁移到类似交易、金融等核心链路的研发流程优化中。

工程实践知乎 - SmartCode 得物技术

推荐系统体验的数字化突破:得物自动化评测平台的技术实践|AICon 文章整理

文章系统介绍了得物推荐评测平台的完整技术方案,针对推荐系统中新颖性、相关性等主观体验指标难以量化、反馈周期长和审计成本高等工程痛点,构建了基于大模型的全自动评测流水线。平台通过可视化提示词工程、多模型动态配置与人机协同校验机制实现评测标准一体化管理,保证评测一致性在 92% 以上;工程层面采用 CAS 无锁分布式调度、三阶段断点续传和动态并发控制,支撑单周百万级评测任务,并通过按需触发、模型分级和采样精控将成本降低 91%。文章还展望了向多维度体验评测和全天候 Agent 自动巡检的演进方向,提供了从业务问题到工程落地的完整实践参考。

作为工业级推荐评测平台的工程实录,文章将业务痛点、系统架构、工程技巧和成本优化有机串联,尤其在分布式调度、大模型评测流水线和人机协作校验方面给出了可复用的实现细节。适合推荐系统工程师、AI 基础设施团队和关注自动化评测的建设者,可迁移用于类似主观指标量化、高吞吐低成本的评测系统设计。

技术文章知乎 - SmartCode 得物技术

RAG 核心概念与原理:Chunking、Embedding、相似度、HNSW 与多路召回|得物技术

文章系统梳理了RAG(检索增强生成)的核心检索技术链路,从LLM的局限性引出RAG的必要性,依次阐述了文档切分策略(Chunking)、文本向量化(Embedding)的原理与对比学习训练方式、向量相似度度量(以余弦相似度为主)、以及近似最近邻搜索算法HNSW的分层图设计与贪心搜索机制。在此基础上,完整介绍了查询改写、元数据过滤、多路召回(ANN+BM25)、RRF排名融合与Cross-Encoder重排序(Rerank)的协同工作流程,并强调了混合检索与各环节工程取舍的重要性。全文提供了具体的参数选择、算法复杂度和实践建议,适合构建高质量RAG系统的开发者参考。边界:未涉及具体模型微调与超大规模部署,但覆盖了核心概念与实用策略。

本文深入浅出地讲解了RAG检索系统的核心原理与工程考量,从Embedding到HNSW再到混合检索,每一环节均有理论解释和实际示例,避免空泛介绍。适合AI工程师、后端开发者以及希望优化检索效果的技术人员。文中关于Chunking策略、HNSW参数调优、多路召回融合等可迁移经验具有较高的实践指导价值,因此推荐收录。

工程实践知乎 - SmartCode 得物技术

从"机械应答"到"服务伙伴":得物高可控智能客服的 Agent 工程实践|AICon 演讲整理

文章分享得物智能客服从传统流水线向高可控 Agent 架构的演进实践。针对意图理解差、多轮协商弱和人工成本高等痛点,团队依次尝试了 Single‑Agent、基于 AutoGen 的 Multi‑Agent(总控/出话/评估/润色)以及跨场景 Harness 架构,实现动态调度和跨会话记忆。为降低长尾 case 的 Prompt 优化成本,构建了 PE 自动化流水线与 DPO 数据飞轮;并引入 GRPO 强化学习训练,让 Agent 学会在工具调用与自推理间正确决策。此外,通过模型蒸馏对齐优秀客服话术、表情和情感温度,并设计半双工消息流控制以匹配客服场景的特殊性。该实践覆盖架构设计、数据工程、模型训练和系统控制,适合真实客服系统的工程化落地参考。

文章系统梳理了从单 Agent 到 Harness 架构的完整演进路径,给出了 PE 自动化、RL 决策训练和情感对齐等具体工程方案,数据翔实、方法可迁移,对智能客服、对话式 AI 及 AI 工程化团队具有直接参考价值。

工程实践知乎 - SmartCode 得物技术

得物推荐系统诊断 Agent:从 “调接口” 到 “会思考”|AICon 演讲整理

本文详细介绍了得物推荐系统诊断Agent“推查查”的设计与工程实践。针对推荐系统异常排查中人工依赖高、经验难沉淀的痛点,设计了一种混合智能体架构:Highway模式通过预编排的Story标准化流水线快速处理80%常见问题,ATV模式基于ReAct循环自主推理解决20%长尾复杂问题,中间由智能调度器无缝切换。技术实现上,通过插件化Skill工具集、Story编排、ReAct约束机制以及结合OpenViking与Graphify的知识库,保障了诊断的确定性与可扩展性。进化层从排查记录中自动提炼通用方法并生成新Story,实现系统自进化。实战案例验证了方案的有效性,也指出了知识检索触发策略等现有局限。

展示了一个推荐系统智能诊断系统的完整工程落地过程,包含架构设计、关键技术实现和进化机制,对于从事推荐系统、AI工程化或系统可靠性的工程师具有可迁移的参考价值。文章细节丰富,从问题定义到方案权衡再到验证,体现了工程实践的深度,值得收录。

工程实践知乎 - SmartCode 得物技术

得物 OceanBase 落地实践

文章详细记录了得物将 OceanBase 作为多模数据库引入的完整工程实践。面对 MySQL 在 TP/AP 混合负载下性能瓶颈、存储成本高和运维复杂等问题,DBA 团队从选型对比、性能压测、复杂 SQL 优化到业务迁移全流程展开验证。通过计划缓存、分区裁剪、列存索引、并行执行和 Hint 干预等五步优化,将两类聚合查询的执行时间分别从 1.3s 和 3.9s 降至 0.01s 和 0.02s,并获得与 DuckDB、StarRocks 对比的详细性能数据。在真实业务迁移中,SQL 平均耗时下降 88.3%,存储压缩率超过 80%,总体降本 43%,并消除了异构数据同步和手动分流风险。文章同时总结了迁移中遇到的实时物化视图与 DDL 冲突、SQL 语法兼容等具体问题及应对方案,并规划了运维体系转型和团队能力建设路径。该实践适用于有 TP/AP 混合负载、追求成本与可用性平衡的场景,但需注意新功能边界和版本限制。

推荐收录。文章不是泛泛的产品介绍,而是提供了从选型对比、性能压测到生产迁移的完整技术链条,包含具体的 SQL 优化思路、量化收益(近 200 倍提升、43% 降本)和踩坑记录,对考虑 OceanBase 落地或从 MySQL 迁移到分布式数据库的架构师、DBA 有直接可复用的参考价值。文中的五步优化法、物化视图使用约束和运维体系转型经验均具备可迁移性,风险提示也较为坦诚。

工程实践知乎 - SmartCode 得物技术

AI UITester:AI Native 的 UI 自动化测试新范式|得物技术

文章介绍得物团队的 AI UITester:一种面向移动端 UI 自动化测试的 AI Native 方案,目标是解决传统脚本用例迁移、调试和三端维护成本高的问题。作者给出了从用例平台 JSON 到可执行脚本的自动化 Pipeline,包括树结构展平、去重、LLM 增强、版本归档等阶段,并强调通过 Wiki 知识注入提升步骤生成准确性。执行层采用 VLM 驱动的“截图-理解-执行”闭环,配合失败分类器、置信度阈值和自愈机制,实现业务失败的自动诊断与修复。文章还对比了 Appium/XCUITest 等元素定位方案与 AI 辅助方案,指出 AI Native 的核心变化是从“维护定位器”转向“理解界面与流程”。其边界也很明确:Wiki 质量会直接影响诊断效果,复杂流程变更仍需要人工确认。

推荐收录,因为文章给出了可落地的 UI 自动化架构:用例转化 Pipeline、VLM 执行闭环、失败分类、自愈和置信度控制都有明确设计细节。适合做移动测试、AI 工程化和自动化平台建设的参考,但也要注意它对知识库质量和阈值校准依赖较强,复杂场景仍需人工兜底。

工程实践知乎 - SmartCode 得物技术

从狂野代码到按目标生产:得物推荐 AI Harness 的工程化实践|AICon 演讲整理

文章梳理得物推荐团队自研 AI Harness 的工程化实践,核心目标不是让 AI 只会写代码,而是把需求、开发、评测和复盘纳入 PDCA 闭环,让 AI 在复杂推荐系统中按目标生产。作者将流程拆成 Plan/Do/Check/Act 的七阶段护栏:用结构化 Contract 约束需求,用零等待环境支撑执行,用 AI 评测平台做 7x24 体验检查,并把 Bad Case 回流为可复用经验。文中还提出 L1/L2/L3 知识治理与 Highway+ATV 混合 Agent 架构,用确定性代码覆盖高频路径、用受控探索处理长尾问题。文章给出了补充注释后准确率提升、token 消耗下降等结果,但整体更偏体系框架与方法论,具体实现细节仍留待后续篇章展开。

文章直接展示了将 LLM/Agent 纳入推荐系统生产链路的完整工程框架,并给出 Contract、7x24 评测和混合 Agent 的落地证据。适合做 AI 工程化、推荐系统和研发流程治理的参考,尤其对想把生成式 AI 变成稳定生产能力的团队有迁移价值。

工程实践知乎 - SmartCode 得物技术

从表单到 Agent:得物社区活动搭建的 AI 实践之路

文章复盘了得物社区活动搭建从“AI 帮填表单”演进到“两阶段 Agent + 聚合工作台”的完整过程。第一版只做字段预填,虽然缩短操作时间,但仍需运营在多个系统间手工校验,且存在黑盒等待、不可逆、无持久化等问题。第二版改为以 LangGraph 编排的 Workflow 为主,通过 interrupt/resume、能力注册表和组件模块协议,把运营角色从流程执行者变成流程监督者。第三版进一步把“从想法到策划文档”前移为只读 Skill,把写操作、构建和审核留给受控流程,并用最小权限、渐进式披露和草稿同步降低风险。文章的边界也很清楚:它偏架构与取舍总结,很多细节是面向特定业务场景的工程妥协。

文章给出了从表单辅助到流程驱动 Agent 的真实演进链路,直接包含 LangGraph、interrupt/resume、模块协议和最小权限等可复用设计。适合做企业级 AI 工作流、运营工具和人机协作架构的参考,但需注意其结论强依赖高正确率、强约束业务场景。

工程实践知乎 - SmartCode 得物技术

从埋点需求到规则资产:Hermes Agent 重构得物数仓工作流

文章讲述得物技术如何把埋点与指标需求承接流程重构为一条由 Hermes Agent 驱动的可回放工作流,重点解决需求信息分散、历史口径难追溯、变更风险难暴露和生产确认成本高等问题。作者不是让 Agent 直接给最终结论,而是把流程拆成工作区、看板、规则资产、结构化工具接口、系统预演和人工确认点,让 AI 负责判断前的工程化准备,人负责业务语义、口径裁决和生产放行。文章最后还明确提出要用准备时间、交付周期、评审通过率和返工原因等指标验证这套机制的实际收益与边界。

推荐收录,因为它不是泛泛讨论“Agent 能做什么”,而是给出了数据承接场景里可落地的流程重构方案,以及对应的治理边界和确认机制。对于做数仓、数据治理、AI 工程化或内部工作流自动化的读者,这篇文章对“如何把经验沉淀成规则资产、如何把风险前置到流程中”有较强迁移价值。

工程实践知乎 - SmartCode 得物技术

让 Claude Code 拥有自我进化和记忆系统|得物技术

文章介绍了一个为 Claude Code 增加“长期记忆”和“自我进化”能力的工程系统,核心由行为观测、模式提炼和记忆注入三层组成。作者通过 Hook 机制稳定采集工具调用日志,再用统计规则与模型语义分析提炼 Instinct,并结合本地 Embedding 和向量检索把项目记忆在新会话中自动注入,从而让助手跨会话保持上下文、逐步修正行为。文章还给出了数据分片、置信度衰减、去重聚合、隐私边界和效果量化等设计,说明这套方案适合需要频繁与 AI 编程助手协作的个人或团队,但更适合作为定制化工程实践而非通用产品方案。

推荐收录,因为它不是泛泛讨论“AI 记忆”的概念,而是给出了可落地的 Claude Code 工程实现:从 Hook 采集、规则提炼、向量召回到上下文注入,链路完整且有真实运行数据。对想要改造 AI 编程助手、构建个性化工作流或理解 agent 记忆系统边界的读者,都有较强的迁移价值。

工程实践知乎 - SmartCode 得物技术

用 LLM Agent 重构告警排查流程|得物技术

这篇文章介绍了得物如何用 LLM Agent 重构告警排查流程,把原本需要在日志、APM、链路追踪等多个平台间手动切换的排障工作,改造成“告警接入—指纹匹配—Agent 排查—验收—报告—知识沉淀”的自动化闭环。文中重点展开了 ReAct Agent 的工具设计、动态策略组装、工具超时隔离、幻觉控制与多轮验收机制,并通过一次生产告警案例展示了系统如何把中位排查耗时从约 20 分钟降到 4.4 分钟。文章的价值不仅在于 Agent 落地思路,还在于它明确说明了适用边界:AI 负责机械化检索与归纳,人工负责最终判断与处置。

推荐收录,因为它不是泛泛而谈“用 AI 提效”,而是给出了告警排查场景下可复用的工程架构、工具编排方式和质量保障机制。对于正在做 AIOps、告警治理、运维自动化或 Agent 落地的团队,这篇文章能直接提供实现思路和踩坑经验。

工程实践知乎 - SmartCode 得物技术

HorizonVault 技术深潜:如何在 HDD 上做出 100GB/s+ 级大吞吐分布式存储|得物技术

文章深度解析了得物自研分布式存储引擎 HorizonVault 的设计,目标是在通用 HDD 上支撑 Kafka 远程存储、冷热数据下沉等场景,并实现 100GB/s+ 级别的集群吞吐。作者围绕 Broker、Meta、Store、Network、HA 等模块,说明了如何通过顺序追加、小索引定位、磁盘状态治理、线程隔离、网络背压和 follower 主动追赶,把 HDD 的随机 I/O 短板限制在系统可控范围内。文章的核心结论是:高吞吐并不只靠单盘性能,而是依赖资源调度、路由打散和副本同步等机制的组合;但这种方案主要适用于大对象、顺序写占主导的远端存储场景。

推荐收录,因为它不是泛泛介绍“做了一个存储系统”,而是完整讲清了面向 HDD 的高吞吐分布式存储如何在架构、路由、索引、复制和背压上协同工作。对做存储、Kafka Tiered Storage、分布式系统和性能治理的读者来说,这篇文章提供了可直接迁移的设计思路和边界判断。

工程实践知乎 - SmartCode 得物技术

Claude Code Harness 工程:数仓侧落地方案|得物技术

文章围绕得物在离线数仓场景下落地 Claude Code Harness 的工程实践展开,系统分析了 AI Coding 在长上下文、规范执行和复杂需求开发中的三类痛点:上下文压缩导致“失忆”、规范依赖记忆而不稳定、以及大规模血缘/自测数据撑爆 context。作者提出用 CLAUDE.md 做持久化上下文、用 hooks 做确定性规范拦截、用 subagent 做高 token 操作隔离,并进一步给出适配数仓研发 8 个步骤的工作流和配置样例,形成一套可执行的 Harness 架构。文章的结论是:把语义理解留给 LLM,把规范检查、危险操作拦截和上下文隔离交给宿主框架,才能显著提升数仓 AI 开发的可靠性和一致性。

推荐收录,因为它不是停留在“AI 提效”的口号层面,而是把 Claude Code 的宿主框架、hooks、subagent 和持久化文件组合成了可落地的工程方案。对使用 agentic coding 工具、需要处理复杂上下文和强规范流程的团队,这篇文章有很强的可迁移参考价值。

工程实践知乎 - SmartCode 得物技术

BP Claw 破解 AI 编码输入难题 ——FlinkSpec 需求智能化实践|得物技术

文章介绍了得物在实时数仓场景下构建的 BP Claw:一个位于 FlinkSpec 上游的“AI 数据 BP”中间层,用来把产品经理提交的非标 PRD 自动转成 AI Coding 可消费的标准化需求文档。作者重点讲了它如何通过知识库语义召回、需求转化、PRD 质量评分、自动拉群和多 Skill 编排,把“需求口径不清”这个源头问题前置解决,从而降低后续 FlinkSQL 生成、评审和验收阶段的返工。

推荐收录,因为它不是泛泛讲“用 AI 提效”,而是围绕真实的实时数仓开发链路,给出了从需求输入、语义对齐到生成与校验的完整工程方案。文章对 PRD 规范化、幻觉控制、分段生成、质量评分和工作流融合的处理方式具有较强的可迁移价值,适合做 AI 工程化落地参考。

工具笔记知乎 - SmartCode 得物技术

基于 Harness + SDD + 多仓管理模式的 AI 全栈开发实践|得物技术

文章总结了一套面向全栈开发的 AI 协作方法:用 Harness 思维给 AI 提供现有实现作为约束,结合 SDD 将前后端需求拆成可对齐的设计文档,再借助 Cursor/Claude Code 的多 Agent 能力并行生成代码。作者还详细说明了多仓工作区、代码索引、Mock 验证、后端编译校验和分阶段联调的流程,并提醒要警惕 AI 在模仿参考实现时自动带入隐性逻辑。文中结论是:当上下文、约束和验证链路足够完整时,AI 全栈开发的采纳率和交付效率会显著提升,但前提是接口契约、字段映射和隐性行为必须被主动审查。

推荐收录,因为它不是泛泛介绍 AI 编程工具,而是给出了一套能落地的全栈工作流:如何约束生成、如何组织上下文、如何拆分 SDD、如何并行开发与验证。对正在使用 Cursor、Claude Code 或类似工具做全栈协作的工程团队,这篇文章具有很强的可迁移性和实操参考价值。