科研议题 知乎 - 胡津铭 2026/09/22
本文由论文作者介绍其参与的一篇 SIGMOD 2027 工作,提出名为 Calico 的基于数组的 buffer pool 设计。作者先分析现有方案:LeanStore 的翻译设计不支持图等数据结构,vmcache 依赖 mmap 而在数据库中带来诸多不便。Calico 的核心思路是跳过 hashmap 直接用数组实现 buffer pool,利用其轻量、局部性好和支持组预取的优势,并通过多级翻译(前缀加后缀)与路径缓存解决 page id 稀疏问题,可类比为用户态的 page table 实现。作者将 Calico 集成进 PostgreSQL,在线性扫描、join 和向量检索场景下分别获得 50% 至 200% 和 4-6 倍性能提升,向量检索甚至超过 faiss。文章为作者视角的概览,未展开全部实验细节与局限。
推荐收录。文章出自论文作者本人,清楚交代了 Calico 的问题动机(LeanStore 局限与 mmap 弊端)、关键设计(数组 buffer pool、多级翻译、路径缓存)以及集成 PostgreSQL 后的量化收益,并说明了向量检索等适用场景。对从事数据库存储引擎、向量检索系统或性能优化的读者,可迁移其“简单结构加精细细节设计”的思路;主要不足是缺少实验边界与失败情形的深入讨论。
科研议题 知乎 - 胡津铭 2026/09/19
本文解读 VLDB 2026 荣誉提名论文《How to Write to SSDs》,介绍 TUM Viktor Leis 团队提出的软硬件协同设计(hardware-software codesign)思想。文章指出,B+ 树数据库沿用机械硬盘时代找到数据页后原地更新(in-place write)的方案,在 SSD 上会因硬件层面的 out-of-place write 特性产生严重写放大,拖慢写入效率。团队据此设计面向 SSD 的 B+ 树 out-of-place write,并配合压缩、页打包、按死亡时间分组、对齐数据库与 SSD 垃圾回收粒度等优化,核心论点是数据库比操作系统和硬件更了解工作负载,因而拥有更多信息优化系统。该方案用于 LeanStore 后,在 YCSB 和 TPC-C 上写放大降低约 7 倍、吞吐量约翻倍。文章偏重思想梳理、未展开技术细节,读者需回看论文原文。
推荐收录:文章把一篇 VLDB 论文的核心问题、协同设计思路和量化结果(写放大约 7 倍、吞吐翻倍)讲清楚,并点明“数据库比 OS/硬件更懂工作负载”这一可迁移原则。适合做数据库存储引擎、SSD 写路径或硬件协同优化方向的读者快速建立线索,不足之处是省略了技术细节,需结合原文阅读。
科研议题 知乎 - 胡津铭 2026/09/18
本文解读清华张焕晨团队与CMU的Andy老师合作、获SIGMOD 2026 Honorable Mentions的论文《F3: The Open-Source Data File Format for the Future》。作者指出Parquet/ORC等十多年前设计的格式正因硬件与需求演进(存储网络提速、ML场景需存向量/图像/文本、宽表取少列)而逐渐过时,但每引入新编码都要全面升级格式库,跨语言跨平台兼容性使扩展难以落地。F3的核心思路是把解码器以wasm形式内嵌进文件:库程序若有原生解码器就用原生,否则加载文件内wasm执行,wasm体积仅数KB级别、性能约为原生的70%~90%。F3还解耦Row Group、编码最小单元与物理IO单元的绑定,并用FlatBuffers序列化列级元数据以降低宽表取少列的反序列化开销。文章明确指出随文件分发程序带来安全风险,论文把中心化验证留作未来工作,并补充了更早的同类工作AnyBlox(VLDB 2025最佳论文)。
推荐收录。文章准确提炼了F3要解决的格式扩展兼容性痛点、内嵌wasm解码器的机制与性能取舍,并客观指出安全验证缺口,还延伸到AnyBlox、Lance、Bullion等同类工作,形成可追踪的学术脉络。适合关注数据库存储格式、数据湖与ML数据基础设施的读者,用来理解文件格式演进方向及“解码器随文件分发”这一可迁移设计思路;不足是未深入实验数据与安全方案的可行性论证。
工程实践 知乎 - 胡津铭 2026/05/08
这篇文章介绍了一个面向 AI Agent 和 RAG 场景的嵌入式向量数据库 Caliby,核心卖点是把文本、向量、元数据统一放进同一套进程内引擎,并通过 HNSW、DiskANN、IVF+PQ 三类索引覆盖不同规模与延迟需求。文章还说明了它在磁盘持久化、SIMD 加速、Python 绑定、批量并发检索上的设计思路,并给出与 pgvector、FAISS 的性能对比,强调“pip install 即可用”的本地化部署体验。需要注意的是,正文更偏项目发布与产品介绍,性能数字和结论主要来自作者展示,适合作为选型与架构参考,但不宜当作严谨基准报告直接引用。
推荐收录,因为它不是单纯的产品宣传,而是把“AI Agent 需要什么样的数据引擎”这个问题具体化到了嵌入式、持久化、索引选择和文本/向量统一管理等工程决策上。对做向量检索、RAG、Agent 记忆系统或本地优先工具的读者,这些设计取舍和场景划分具有可迁移价值。