文章讨论在 AI 能生成看似合格学位论文的背景下,博士学位评定不应再以论文文本为核心依据。作者先回顾传统博士流程:修课、资格考试、撰写与答辩论文,并指出答辩常流于形式,论文本身几乎决定是否通过。随后他引用哈佛方面的建议,认为学位论文已不再是评估学生数学素养与独立研究能力的可靠代理,应改为由多位教师进行定期、多面向的线下评估,且必须严格、形成书面记录并可用于未来求职。结论是 AI 使基于文本的评审失效,博士培养与考核制度必须相应调整。不足在于篇幅较短,论证主要依赖引用与个人观察,未给出具体评估设计或实证数据。
推荐收录,因为它给出了明确且可验证的论据:引用哈佛关于“学位论文不再是可靠评估工具”的建议,并指出答辩形式化这一真实失效模式。适合研究生、导师和科研管理者阅读,可迁移价值在于为 AI 时代科研评价制度的调整提供判断依据。主要风险是篇幅短、缺少可落地的评估方案与实证支撑。
作者 Daniel Lemire 提出,具备 agentic 能力的 AI 很快能让非顶尖数学家、甚至优秀高中生生成相当于数学博士论文的成果,从而击穿学术界以论文为筛选信号的“人才分类机器”。他认为自 1970 年代同行评审普及以来,研究被封闭成孤岛社群,学术产出的实际功能变成分配教职(博士获得终身轨职位概率约 10% 且持续下降),而非服务真实需求。他援引自己 2024 年发表于 CACM 的文章,主张评价重心应从“发表论文”转向解决问题的实际影响,并预测“论文作为最终产出”的地位会逐步削弱。文章的边界也很明显:以论断和预言为主,缺少数据支撑,也主要针对数学等学科,并未给出替代评估体系的可操作设计。
推荐收录:作者以自身 CACM 2024 文章和同行评审的历史演变为依据,论证 AI 正在瓦解以论文数量与同行评审为核心的人才筛选机制,并主张用问题解决和实际影响替代发表计数。对关心科研评价改革、读研与学术职业路径选择、以及 AI 时代研究方向判断的读者有明确参考价值。主要风险是文章以预言和立场表达为主,缺乏数据与替代方案细节,读者需自行补充证据。
文章从数学家对 OpenAI 的公开信切入,讨论 AI 在数学证明与软件开发中的作用。作者以 1976 年四色定理的计算机证明、自己博士期间使用符号代数软件的经历,以及 Doron Zeilberger 2009 年的预言为线索,说明计算机辅助研究早已引发争议。公开信担心 AI 损害概念理解、署名和学术训练,但作者认为这忽略了学生可能以不同方式研究数学,也低估了加速进展对社会贡献的提升。核心结论是:数学证明和代码编写都将越来越多地借助 AI,坚持纸笔的研究者更像艺术家,其他人需要学会与 AI 协作。文章是观点性评论,未提供实证数据或技术方案。
推荐收录,因为它以四色定理、Zeilberger 预言和数学家公开信为线索,清晰呈现 AI 介入数学证明与代码编写后围绕署名、概念理解和科研训练的冲突。适合关注 AI for Science、科研评价和开发者角色变化的读者,可作为讨论人机协作与学术贡献的参考。主要风险是文章属于短篇观点评论,缺少实证数据和技术细节,不适合当作可复现的方法或工程方案。
这篇文章以较强的个人反思口吻,讨论在 foundation models 时代“公理化知识”是否仍然是理解世界的最佳起点。作者回顾了自己从逻辑、概率统计、NLP 到生物序列建模的研究经历,认为许多传统方法的美感和严整性并不总能转化为更好的系统效果,而大模型这种“混乱但有用”的工具常常能在新的操作区间里带来意外收益。文章重点以 HyenaDNA、DNA foundation model、以及用于最小二乘和微分方程的相关工作为例,说明 foundation model 在科学问题上可能更像一种新仪器,而不是旧理论的替代品。作者同时指出一个重要边界:现有模型在数值精度上仍明显不及传统科学计算方法,尤其在优化和高精度求解场景里差距很大。整篇文章的核心结论不是否定数学和方程,而是主张更谨慎地判断“知识的运行区间”,不要默认古典理论的优雅性就等于在新问题上的可迁移性。
推荐收录,因为文章直接围绕 foundation models、DNA 建模、最小二乘精度和 PDE/ODE 这类科研问题展开,并明确指出大模型在科学计算中的适用边界。适合关注 AI for Science、研究方向判断和方法论反思的读者,尤其能帮助理解“能做”与“做得足够精确”之间的差别。
这篇文章从斯坦福 Hazy Research 团队的视角,回顾 foundation models 如何改变他们的研究重心,尤其是围绕数据与系统的工作方式。作者将相关工作分成两类:一类是理解和改进基础模型本身,如 FlashAttention、S4、长序列建模和跨地域的去中心化训练;另一类是把 foundation models 作为数据工具,用于弱监督、数据探索、数据清洗与集成,以及隐私敏感场景中的新型学习方式。文章的核心判断是,FM 不只是更大的模型,而是在重新定义“如何编程数据”和“如何做研究”。不过它更像研究进展综述与方向宣言,缺少统一实验框架和系统性比较,适合把握研究趋势,不适合作为单点结论依据。
文章直接给出了 FlashAttention、S4、弱监督和数据清洗等具体研究线索,说明 foundation models 正在同时重塑模型、系统与数据工作流。适合做研究选题、方向梳理和跨领域方法迁移的读者,但需注意它是团队视角的阶段性总结,证据更偏方向性而非严格综述。