Research Method

16 篇内容

科研思考Daniel Lemire

A thesis isn’t enough for a PhD

文章讨论在 AI 能生成看似合格学位论文的背景下,博士学位评定不应再以论文文本为核心依据。作者先回顾传统博士流程:修课、资格考试、撰写与答辩论文,并指出答辩常流于形式,论文本身几乎决定是否通过。随后他引用哈佛方面的建议,认为学位论文已不再是评估学生数学素养与独立研究能力的可靠代理,应改为由多位教师进行定期、多面向的线下评估,且必须严格、形成书面记录并可用于未来求职。结论是 AI 使基于文本的评审失效,博士培养与考核制度必须相应调整。不足在于篇幅较短,论证主要依赖引用与个人观察,未给出具体评估设计或实证数据。

推荐收录,因为它给出了明确且可验证的论据:引用哈佛关于“学位论文不再是可靠评估工具”的建议,并指出答辩形式化这一真实失效模式。适合研究生、导师和科研管理者阅读,可迁移价值在于为 AI 时代科研评价制度的调整提供判断依据。主要风险是篇幅短、缺少可落地的评估方案与实证支撑。

科研议题知乎 - Naiyan Wang

In-context feedback learning is all you need

文章以 GPT-6 Astra 控制机械臂的实验为引,提出具身智能中与 feed-forward 先验同等重要的 Feedback Learning,即模型在同一次任务中利用失败反馈调整后续行为。作者从系统辨识、误差修正和 Few-shot 示教三类用法展开:通过试探运动估计工具或本体参数,在插装等任务中根据失败观测修正偏移,并把示范作为起点结合在线交互继续适应。文中引用笔尖标定、Agent as Policy 约 9 mm 偏移、RoboDojo 约 129 mm 扰动、RoboICL 叠塔分数从 0.04 到 0.82 等证据,说明失败反馈可转化为纠正依据;但重试后能否反超专用模型仍需同任务、同交互预算的成功率曲线验证。结论强调应研究数据、表示和训练目标如何让模型利用自身反馈持续适应,而非只保留成功轨迹或仅归因于更强 3D 理解。当前局限是证据多来自案例观察和项目视频,系统性对照评测不足。

推荐收录。文章不是罗列机器人实验,而是把系统辨识、失败修正和示范学习串成“上下文反馈学习”的研究议程,并给出论文出处与量化证据。适合做 VLA/机器人学习、Agent 研究或评测设计的读者,可迁移到数据构造、训练目标和交互预算评测;主要风险是结论仍偏案例观察,尚缺统一对照实验支撑。

科研思考Daniel Lemire

AI is breaking the academic sorting machine

作者 Daniel Lemire 提出,具备 agentic 能力的 AI 很快能让非顶尖数学家、甚至优秀高中生生成相当于数学博士论文的成果,从而击穿学术界以论文为筛选信号的“人才分类机器”。他认为自 1970 年代同行评审普及以来,研究被封闭成孤岛社群,学术产出的实际功能变成分配教职(博士获得终身轨职位概率约 10% 且持续下降),而非服务真实需求。他援引自己 2024 年发表于 CACM 的文章,主张评价重心应从“发表论文”转向解决问题的实际影响,并预测“论文作为最终产出”的地位会逐步削弱。文章的边界也很明显:以论断和预言为主,缺少数据支撑,也主要针对数学等学科,并未给出替代评估体系的可操作设计。

推荐收录:作者以自身 CACM 2024 文章和同行评审的历史演变为依据,论证 AI 正在瓦解以论文数量与同行评审为核心的人才筛选机制,并主张用问题解决和实际影响替代发表计数。对关心科研评价改革、读研与学术职业路径选择、以及 AI 时代研究方向判断的读者有明确参考价值。主要风险是文章以预言和立场表达为主,缺乏数据与替代方案细节,读者需自行补充证据。

工程实践Overreacted

How I Vibed a Proof of Conway’s Conjecture

文章记录 Dan Abramov 以非数学专家身份,借助 Claude、ChatGPT/Codex 多智能体实验室和 Lean 形式化,尝试证明 Conway 关于 omnific integers 的 refinement conjecture。核心方法包括把参考文献转成 TeX、设置 PM、数学、红队、Lean 等角色,用 Lean 审计并隔离稳定与探索性代码,并在发现产出不可靠时整体推倒重来。过程中模型常产生幻觉术语、循环论证和虚假进展,只有少量结果通过 Lean 与数学家反馈得到确认;最终目标定理被 Lean 内核检查,但尚未经数学家独立验证,证明可读性与简化仍有限。作者还总结了 token 消耗约 400 亿、成本可达数万美元,以及命名、术语纪律、分离搜索与证明等教训。结论是仅靠 AI 可走很远,但需要人类项目管理式监督、严格形式化纪律和真实数学家反馈,并非一键解决。

推荐收录:文章不是简单晒结果,而是完整呈现多智能体加 Lean 形式化做数学证明的工程流程,包括角色分工、审计、推倒重来、术语治理和 token 成本等一手证据。适合 AI 工程、Agent 编排和形式化方法实践者阅读;其风险是证明尚未被数学家独立验证,且高度依赖模型与人工监督,不能直接视为通用可复制方案。

科研议题Trail of Bits Blog

1Password's AI patching benchmark is misleading

Trail of Bits 质疑 1Password 的 AI 补丁基准,认为其“仅 26% 干净修复”的标题误导:样本刻意选复杂漏洞,22% 试验要求应用错误补丁,36% 禁止编译或测试,且模型推理档位不一致。作者重析其公开数据,在允许运行代码且无错误指令的试验中,3,067 个补丁有 2,634 个(86%)阻止了给定 exploit,但阻止 exploit 不等于完整修复。文章还给出咨询中 2,265 个漏洞首次修复失败率 12.5%,Patch the Planet 的 186 个 PR 合并率 67.7%,并追踪后续提交发现功能、构建和性能回归,但无可利用安全漏洞。最后提出基准应衡量代表性样本、工作条件、可验证正确性、结果变化和人机协作贡献,并发布 post-patch-validation 与 review-walkthrough 技能。局限是人机直接对比仍需相同任务条件,部分首次失败记录可能被低估。

推荐收录,因为文章用可复核证据指出 1Password 基准在样本选择、提示词、工具权限和评分一致性上的具体缺陷,并以 3,067 个补丁重析、2,265 个真实漏洞首次修复及 186 个开源 PR 审阅记录做对照。适合安全工程、AI 评测与研究读者,可迁移到补丁验证、基准设计和 Agent 回归审查;需注意其涉及厂商争议,应结合原始数据独立判断。

科研思考知乎 - 孔某人

新质数学生产力 下的数学研究意义与评价

文章以“新质数学生产力”指代AI4Math与数学能力较强的LLM所带来的、包含技术与群体行为在内的综合能力跃迁,并类比为数字计算机让大规模数值计算成为可能。作者判断,正确证明的供给正在爆发,数学研究将从“证明稀缺”转向“证明过剩”,社会评价标准随之从结果价值转向方法价值,即是否提出可迁移的新工具或成体系的结果。作者进一步论证数学研究并非脱离社会价值,只是价值兑现链条过长,新生产力使数学更快接入近期社会价值链条,人类数学共同体则向更高抽象层转移。文中也明确边界:该判断依赖AI尚不擅长构造新工具与新思路,这一阶段能持续多久尚无定论,且提前暴露问题可能被大算力抢先发表。

推荐收录。文章给出一个可迁移的研究评价框架:当AI把结果供给推向过剩,评价重心从“解决了什么”转向“方法与体系是否可迁移”,对计算机科研选题和成果判断同样适用。作者还标注了判断成立的边界,如AI不擅长造新工具、算力抢先发表风险、持续时间不确定,适合关注AI4Math与科研评价的读者;不足在于全文属思辨性论述,缺少数据与案例支撑。

工程实践Spotify Engineering

Why Spotify Is Not Using Bayesian A/B Testing

Spotify 解释其未在实验平台加入贝叶斯 A/B 测试的原因,并基于论文指出贝叶斯与频率派推断比争论中更接近。文章强调贝叶斯 A/B 测试是一组由停止规则、先验和似然构成的配置:默认平坦先验加后验阈值在窥探下不控制假阳性,且与频率派数值等价;Bayes factor stopping 可控制假阳性,良好校准的经验贝叶斯先验能收缩效应并控制 FDR,但依赖大规模、同质且无偏的历史语料。作者据此拆解窥探、多指标、赢家诅咒与决策理论等说法,强调目标与配置须分开。Spotify 认为双模式会增加规划、监控、解释和信任成本,现有频率派工具已满足目标,故暂不引入。该判断适用于实验成熟、指标一致且有统计维护能力的组织,否则先验错配可能损害估计与决策。

推荐收录。文章给出可核验的统计论据与 Spotify 的真实取舍:平坦先验与频率派等价、Bayes factor stopping 的假阳性控制条件、经验贝叶斯先验的 FDR 控制前提,而非泛泛比较。适合实验平台、数据科学、增长与产品决策团队,用于评估是否引入双推断模式;风险是统计细节密集,非统计读者可能忽略配置前提。

科研议题知乎 - 微软亚洲研究院

顶会评审数据,藏着科研灵感的配方

该文介绍了微软亚洲研究院等机构开发的研究构思辅助系统 ResearchStudio-Idea。它利用 2021–2025 年 ICLR/ICML/NeurIPS 的 1947 篇论文及公开评审结果,为每篇论文提取与领域无关的策略签名,通过聚类归纳出 31 个子模式和 15 种可复用的构思模式,并制成包含适用场景、成功条件与失败模式的操作卡片。系统将整个流程组织为文献检索、瓶颈诊断、模式引导生成、撞车审查和想法卡片渲染五个阶段,帮助研究者完成从模糊方向到可验证想法的“科研第一公里”。评测发现,语料接地和审计流程能显著提升想法质量,而裸模型容易产出“看似新颖但内容空洞”的提案;同时揭示了拒稿与录用论文策略同源、模式选择与录取率无强关联等现象。文章也指出系统依赖 2021–2025 年三大 ML 会议数据,跨领域推广和跨时间泛化存在边界。

推荐收录,因为它将顶会评审数据转化为可操作的构思模式,完整呈现了从数据清洗、策略签名、聚类到端到端评估的方法论,属于“关于研究的研究”。适合从事 AI 科研、论文选题或关注科研工具设计的读者,其“新颖但空洞”失败模式和多阶段审计设计可直接迁移到其他研究辅助系统。主要风险是数据限于 2021–2025 年三大 ML 会议,跨领域结论需谨慎。

科研议题Spotify Engineering

When Can LLMs Replace Humans in A/B Tests?

文章探讨 LLM 能否替代真实用户参与 A/B 测试,并用生物统计中的替代终点理论形式化所需假设。作者基于 Upworthy 头条数据集与 gpt-4o-mini 做实证,发现原始 LLM 预测会系统性低估处理效应,仅恢复约 39% 的人类效应;线性 OLS 校准未通过证伪检验,随机森林和梯度提升树等灵活方法才在抽样误差内接近人类结果,多次采样取平均可缓解随机性偏差。LLM 输出要成为有效替代,必须满足替代性与可比性两个假设,但越新、越偏离历史实验的处理,假设越不可验证,而替代收益最大的场景恰恰风险最高。结论是 LLM 可辅助筛选想法或作为方差缩减协变量,不能替代用户实验,校准仍需真实用户数据,模型更新也会破坏校准函数的时效性。

推荐收录:文章把 LLM 代替人类 A/B 测试的可行性转化为可检验的统计识别问题,给出替代性与可比性两个假设,并用 Upworthy 数据集验证原始预测的偏差和不同校准方法的差异。适合数据科学家、实验平台工程师和产品决策者阅读,可迁移到任何用代理指标做因果推断的场景;尤其提醒不要因为预测快而放弃真实用户实验。

个人心得Phil Eaton - databases

A paper reading club at work; databases and distributed systems research

文章记录了作者在公司内发起数据库与分布式系统论文阅读俱乐部的亲身经历。他为了避免过频或过疏,将讨论频率定为每两周一次,并选择异步邮件作为主要交流方式,理由是邮件更适合全球团队、更慢、不易错过且易于管理。作者先在通用频道小范围征集兴趣,一天内获得6人响应,随后扩展到29人,覆盖产品、支持、开发等多个角色。他还回顾了大学研究实习期间参加论文阅读会的经历,希望在工作环境中重现这种学术氛围。文章定位为他人提供一份可复制的蓝图,重点在于组织流程而非技术深度,适合希望建立团队学习机制或培养论文阅读习惯的读者。

推荐收录,因为它提供了在公司发起论文阅读俱乐部的具体操作步骤和背后考量,特别是异步邮件讨论和两周一次频率的选择理由。文章适合技术团队管理者、学习小组组织者或希望建立稳定论文阅读习惯的个人,其可迁移价值在于低成本的启动方法、跨时区协作策略以及从个人兴趣扩散为团队活动的路径。需要注意的是文章偏重组织经验,技术深度有限,更适合作为实践参考而非论文内容解读。

科研思考Stanford Hazy Research

Retire the Abstractions

文章深入探讨了AI代理(agents)对传统软件抽象层的冲击。作者以自身经历对比:去年编写megakernel需要构建C++抽象层来管理复杂度,今年借助代理可直接从模糊提示生成目标优化代码,消解了对抽象层的依赖。由此提出CUDA DSL等抽象层正走向退休的观点,认为当智能执行器能填补意图中的缺口时,精密但脆弱的代码库可能不再是唯一的知识载体。同时指出抽象层不仅是认知卸载工具,也是共享接口和测试复用的基础,消除后会带来验证挑战。文章最终强调,虽然抽象可能过时,但领域知识、不变量和测试等核心思想将保留,知识传递的方式则从代码转向提示和神谕。全文适用于对AI辅助编程、编译器设计和软件演化感兴趣的读者,但结论基于作者深厚的领域经验,对初学者和不明确神谕的领域可能不直接适用。

收录理由:文章提出了一个前沿且深刻的工程哲学命题,将AI代理与编译器抽象、代码库价值等经典概念结合,提供了可迁移的思考框架。适合关注AI如何影响系统软件开发、编程语言设计和工程实践的读者,对重新评估抽象层和代码资产具有启发性。

个人心得Simon Willison

Kimi K3, and what we can still learn from the pelican benchmark

文章介绍了Moonshot AI发布的Kimi K3模型,其2.8万亿参数、定价策略及基准测试表现。作者通过经典的“鹈鹕骑自行车”SVG生成提示,实际测试了该模型的推理token消耗、成本和视觉描述能力,并以此为例反思了这一个人基准的演变、有效性和局限性。他指出,该测试无法评估当前模型关键的智能体工具调用能力,但作为强制尝试模型的入口仍能揭示推理模式、隐式系统提示和成本特征。全文以具体实验和幽默笔调,为读者提供了评估大模型时关注隐性成本和轻量探针方法的启发。

文章通过一个简单可控的案例,诚实展示了基准测试的局限与实用价值,尤其适合对模型评估、推理成本和应用边界感兴趣的开发者。其“轻量探针”思路和关注隐性成本的方法可迁移到日常模型选型与实验中,帮助形成更务实的评估习惯。

科研议题NVIDIA Technical Blog

How to Evaluate General-Purpose Robot Policies for Real-World Deployment

文章聚焦机器人基础模型在真实世界部署中的评估难题,指出当前评估基准往往脱离实际环境,无法可靠衡量通用策略的性能。作者系统梳理了评估面临的挑战,包括任务多样性、环境动态性、安全约束和策略鲁棒性等维度,并提出一种结合仿真与真实测试的评估框架。该框架强调基准设计需贴近真实部署场景,并融入可重复性和可迁移性考量。文章还讨论了评估指标的选择和不同评估方法的适用边界,为机器人策略从实验室走向实用化提供了方法论参考。

推荐收录,因为它直面机器人策略评估这一核心瓶颈,不是简单罗列基准,而是从真实部署需求出发,剖析现有方法的局限并提炼系统性评估思路。对从事机器人学习、AI系统评估和自动驾驶等领域的工程与研究读者,文中的挑战分解与框架设计可直接启发实验设计,并能迁移到其他具身智能系统的可靠性验证中。

工程实践Instacart Tech Blog

Variance Reduction Below the Randomization Grain

文章讨论在市场型系统中做实验时,因干预单位之间存在相互影响,往往必须按地理区域或 switchback 这类粗粒度随机化,导致有效样本量下降、实验周期拉长。作者在 CUPED 的基础上提出“低于随机化粒度”的方差缩减方法:先用仅由处理前特征构成的订单级模型预测单笔订单结果,再按与指标一致的方式聚合到 region-day,作为 CUPED 协变量使用。文章强调必须避免使用受处理影响的特征,并用对预测值做 placebo 检验来发现特征污染。Instacart 在 10 个降低迟到率的实验中验证,该方法相较区域级 CUPED 将方差再降 18% 到 40%,平均把实验时长缩短约三分之一。该思路适用于社交网络、广告拍卖或地理市场等存在干扰但观测粒度更细的场景,但前提是协变量可严格视为处理前信息。

推荐收录,因为文章给出了可复用的实验设计证据:在粗粒度随机化下,利用更细粒度的处理前预测并聚合,可显著降低方差且保持无偏。适合做实验平台、数据科学和 marketplace 优化的读者参考,但需注意特征污染与 placebo 检验这两个关键风险。

工程实践Netflix TechBlog

A Human-Augmenting Agentic Workflow for Causal Inference

这篇文章介绍了 Netflix 在观测因果推断(OCI)场景中引入软件 agent 的工作流:由人类提供问题背景、工具和数据模型,agent 负责生成分析计划、执行诊断、产出可审计工件,再由 critic 进行盲点检查与可信度判断。作者重点强调 target trial emulation、协变量平衡、overlap、placebo test 和敏感性分析等诊断的重要性,并用一个“新娱乐类型对留存影响”的案例说明,未经约束的 one-shot prompting 容易被 early adopter bias 误导,而加入 trimming 与过程审计后,估计会更保守但更可信。文章还给出了 ACIC 数据集上的评测结果和开源仓库,说明这种 scaffolded workflow 能显著优于直接提示模型的方式,但其有效性仍主要建立在特定的 unconfoundedness 假设和合成数据评估之上。

推荐收录,因为它不是泛泛讨论“让 AI 干活”,而是把 agent、诊断模板、人工审计和因果推断方法组合成了一套可复用的工程流程。对于做数据分析、实验评估、AI 辅助决策或需要在缺乏 ground truth 条件下做质量控制的团队,这篇文章提供了非常具体的设计范式和边界意识。

工程实践Lyft Engineering

Trusting the Untestable: Validation and Diagnostics for the Doubly Robust Models

文章介绍 Lyft 如何在无法做随机 A/B 测试时,用 AIPW 这类双重稳健模型评估因果影响,并把“可验证性”作为平台能力来建设。作者重点说明两类输入约束:必须显式选择大量混杂变量,且其数据必须来自首次曝光前,以避免泄漏;同时对下采样带来的倾向得分和结果权重偏差做了校正。文中还给出两类核心诊断:倾向分数重叠/共同支持检验,以及调整前后协变量平衡检查,来判断估计是否可信。为了验证方法本身,作者用周度 ride challenge 的实验数据作 ground truth,与观测数据上的 AIPW/ATET 结果对照,发现观测估计通常偏低,主要原因是 trim 后分析样本不再代表总体。基于这一发现,团队新增了隐藏混杂敏感性分析和 trimmed vs. untrimmed 协变量对比,用于识别外部有效性和未观测偏差的风险边界。

推荐收录,因为文章不仅讲 AIPW 原理,还给出混杂变量管理、共同支持、协变量平衡、敏感性分析等可落地诊断流程,并用实验对照验证偏差来源。适合做因果推断、实验平台和数据科学平台建设参考,尤其对需要在非随机场景下建立可信度的团队很有迁移价值。