OpenAI Research

12 篇内容

工程实践OpenAI Research

How enabling two settings tripled our scores on the ARC-AGI-3 benchmark

OpenAI 发现在 ARC-AGI-3 智能体基准测试中,GPT-5.6 Sol 的低分并非模型能力不足,而是官方通用工具默认丢弃推理消息并使用滚动截断,导致模型在每一步都需重新推理且丢失历史。通过启用两次 API 设置——保留推理(retained reasoning)和压缩(compaction),GPT-5.6 Sol 的得分从 13.3% 提升至 38.3%,同时输出 token 量减少 6 倍。文章详细对比了两种工具下模型的行为差异,指出保留推理使模型能记住之前的思考,不再重复解析游戏;压缩则避免上下文窗口被截断,让长期学习更可靠。文章强调基准测试不仅衡量模型,也衡量工具设计和 API 选择,建议开发者采用与生产环境一致的设置来评估模型。这一案例适用于基于 API 的智能体开发与基准评估,但未讨论其他模型或非 OpenAI 环境下的泛化性。

推荐收录,因为文章通过真实的工程实验揭示了基准测试中常被忽视的工具配置如何严重影响模型表现,为 AI 工程师和基准设计者提供了可复用的排查思路。文中保留推理、使用生产级 API 设置等建议直接来自生产级产品(ChatGPT、Codex),具有很强的实践指导意义。适合从事智能体开发、模型评估或 API 集成的读者参考,其核心教训——上下文管理策略必须与模型训练时的设计一致——可迁移至各类模型交互场景。

科研议题OpenAI Research

Separating signal from noise in coding evaluations

这篇文章围绕“如何从代码评测中分离有效信号与噪声”展开,作者对 SWE-bench Pro 做了一次系统审计,判断该基准是否真实反映模型的软件工程能力。文章提出了一条质量审查流水线:先用自动化数据点分析筛出可疑任务,再通过 Codex 驱动的 investigator agents 深查仓库、测试与失败轨迹,并结合 5 名资深工程师的人审交叉验证。审计结果显示,约 27.4% 至 34.1% 的任务存在破损问题,主要包括测试过严、提示词欠定义、测试覆盖不足和误导性提示四类。作者据此认为,SWE-bench Pro 仍会在相当比例上误导模型能力判断,并撤回先前“推荐迁移到该基准”的建议。文章的边界也很明确:结论针对特定代码基准及其构造方式,不等同于否定所有 agentic coding 评测,而是强调评测任务必须可验证、可复现且与提示一致。

推荐收录,因为文章给出了可复用的基准审计方法、具体破损类型统计和人工/Agent 结合的验证流程,直接指向评测可信度问题。适合做模型评测、基准设计和 AI 研究复核的参考,尤其对需要判断 benchmark 是否“可用”的团队有现实价值。

科研议题OpenAI Research

Introducing GeneBench-Pro

文章介绍了 GeneBench-Pro,一个面向计算生物学研究级判断能力的基准,目标不是考察模型是否记得生物学知识,而是能否在含糊、噪声和多轮修正的分析过程中做出正确决策。它在 GeneBench 基础上扩展到 129 道题,覆盖统计遗传、群体遗传、定量遗传、组学、临床与癌症等 10 个领域、21 个子领域,强调“research taste”这类高阶分析判断。为避免传统长链生物学基准中主观路径过多或数值过于宽松的问题,作者采用合成数据、已知因果结构、消融验证、泄漏审计,并邀请外部专家评审现实性和方法适切性。结果显示,最强模型 GPT-5.6 Sol 在最高推理档仅约 28.7% 通过率,Pro 模式可到 31.5%,说明当前模型在闭环科研推理上仍明显不足,但测试时算力扩展带来显著收益。该基准的局限是强烈领域特定、依赖合成题和评分设定,外推到真实科研场景仍需谨慎。

推荐收录,因为文章明确给出了基准设计动机、构造方法、专家审核和量化结果,不是简单产品宣传。适合关注 AI for Science、科研评测和代理式分析能力的读者,尤其可借鉴其“合成因果数据+泄漏审计+专家复核”的评测思路。

科研议题OpenAI Research

A near-autonomous AI chemist improves a challenging reaction in medicinal chemistry

这篇文章介绍了一个近乎自治的“AI 化学家”系统:将 GPT-5.4、专用化学代理 Maria AI 和高通量自动化实验室连接起来,围绕一个具体的药物化学难题——改进 Chan–Lam 偶联中伯磺酰胺底物的低产率——开展从文献检索、提出假设、设计实验、分析数据到迭代实验的完整研究流程。实验结果显示,系统提出的 TEMPO 添加剂假设在两轮共 10,080 次反应中带来了显著提升,平均收率从 16.6% 提高到 25.2%,并在人工台式验证中对 14 对代表性底物中的 11 对得到确认,但文章也明确说明这仍是“近自治”而非完全自治,且目前只证明了在特定反应、特定平台与特定约束下的有效性。

推荐收录,因为它不是简单展示“模型会做实验”,而是完整呈现了 AI 参与科学发现的工作流、验证链条和边界条件,具有很强的方法论参考价值。对于关注 AI for Science、自动化实验、以及研究系统如何在受控条件下产生可复现实验结果的读者,这篇文章提供了可迁移的框架与重要的风险意识。

科研议题OpenAI Research

Introducing LifeSciBench

这篇文章介绍了 LifeSciBench,一个面向生命科学研究任务的基准,用来评估 agentic AI 是否能处理真实科研中的证据整合、分析、实验设计、验证、转化判断和科学沟通等工作。文章重点说明了基准的构建方法:由 173 位具备博士背景和产业经验的专家出题,覆盖 750 个任务、1,062 个附件和 19,020 条评分准则,并通过细粒度 rubric 评估模型在科学正确性、论证质量、边界条件和实用性上的表现。结论上,当前前沿模型在科学综合、沟通和转化类任务上已有进展,但在依赖复杂附件、精确构造输出、设计优化和操作约束强的任务上仍明显不足,且作者强调该基准只能衡量任务级能力,不能直接等同于真实研发产出。

推荐收录,因为它不是简单的产品宣传,而是对一个面向真实科研工作负载的评测基准进行系统设计、验证和结果分析,长期上可作为理解“AI 是否真的能做科学工作”的参考框架。对于关注 AI for Science、评测方法和研究型 agent 能力边界的读者,这篇文章提供了可迁移的基准构建思路、任务建模方式和局限判断。

科研议题OpenAI Research

Predicting model behavior before release by simulating deployment

这篇文章介绍了一种名为“Deployment Simulation”的新方法:在模型正式发布前,利用真实部署中的历史对话前缀,去重放并替换助手回复,从而模拟候选模型在未来真实流量中的行为。作者将其用于 GPT-5 系列 Thinking 模型的多次部署,评估了它对不良行为频率预测、未见过的新型失配发现、评估意识降低以及带工具的 agent 场景适配能力。文章还明确给出了方法局限:它更适合中高频风险而非极端长尾风险,效果高度依赖仿真 fidelity、前缀分布与工具环境模拟质量。

推荐收录,因为它提出了一个面向大模型上线前风险评估的具体研究方法,并用真实部署数据验证了其预测能力和边界条件。文章对做模型评测、对齐、安全审计和 AI 工程化的人都很有参考价值,尤其适合理解“如何在发布前更接近真实分布地评估模型”。

工程实践OpenAI Research

Dreaming: Better memory for a more helpful ChatGPT

这篇文章介绍了 ChatGPT 记忆系统从“手动保存记忆”演进到基于后台自动归纳的 dreaming 机制,重点解决记忆陈旧、正确性和规模化成本三个问题。文章还给出了评估记忆质量的三个维度:持续携带上下文、遵循偏好与约束、随时间保持最新,并说明新架构如何通过记忆摘要页让用户查看和管理被合成的记忆。整体上它展示的是一个已经进入产品化部署的 AI 个性化系统设计,而不是单纯的功能宣传,适合作为 AI 工程与产品化记忆系统的参考案例。

推荐收录,因为它把“记忆”从概念层面落到了可评估、可更新、可扩展的系统设计,覆盖了上下文继承、偏好跟随和时间衰减这类真实问题。对做 AI 产品、个性化系统或长上下文状态管理的人来说,这篇文章有较强的迁移价值。

科研议题OpenAI Research

An OpenAI model has disproved a central conjecture in discrete geometry

这篇文章介绍了一个由 OpenAI 内部模型自主找到的数学证明:它推翻了平面单位距离问题中长期被相信的“近似线性上界”猜想,给出了在无穷多个 n 上达到 n^{1+δ} 级别单位距离对数的构造。文章不仅说明了结论本身,还强调证明中意外引入了代数数论、类域塔和 Golod–Shafarevich 理论等工具,并讨论了这一结果对 AI 参与数学研究、跨学科发现与人机协作的意义与边界。

推荐收录,因为它记录的不只是一个数学结果,还包括 AI 模型在开放式研究问题上产生原创构造的代表性案例,对理解“模型能否参与前沿科研”有长期参考价值。对于关注 AI 推理能力、数学自动发现和跨学科研究的人,这篇文章提供了值得持续回看的问题背景、结论和影响判断。

科研思考OpenAI Research

What Parameter Golf taught us about AI-assisted research

这篇文章复盘了 OpenAI 组织 Parameter Golf 挑战赛的经验,重点讨论在严格约束下进行机器学习研究时,参赛者如何通过优化训练、量化、测试时训练和新模型结构取得进展。文章的核心不只是展示高分方案,而是总结了 AI coding agents 如何显著降低实验门槛、加快想法迭代,同时也给提交审核、归因和评分带来了新的治理问题。文章最后从赛事运营和研究生态角度说明,未来开放式研究挑战将越来越依赖 agent 参与和自动化筛查机制。

推荐收录,因为它不是单纯的活动宣传,而是对“AI 辅助研究”这一新工作方式的真实复盘,包含约束设计、方案类型、审核挑战和组织侧经验。对做机器学习研究、竞赛平台或评测体系设计的人来说,文章有较强的迁移价值,尤其适合理解 agent 时代实验节奏与治理问题的变化。

科研议题OpenAI Research

Introducing OpenAI Privacy Filter

文章介绍了 OpenAI 开源的 Privacy Filter,一款用于识别并脱敏文本中 PII 的小模型。作者将预训练自回归模型改造成双向 token 分类器,并结合受限 Viterbi 做 span 解码,使其能够在单次前向中处理长文本,最长支持 128k 上下文。模型采用自建隐私标签体系,覆盖私人姓名、地址、邮箱、电话、网址、日期、账号和 secret,并通过公开数据、合成数据与模型辅助标注共同训练。评测显示它在 PII-Masking-300k 上取得很高的精确率和召回率,且少量域内微调即可显著提升效果。文中同时明确了边界:它不是合规认证或匿名化的替代品,在多语言、短上下文和高敏场景仍需要人工复核与域内验证。

推荐收录,因为它不仅发布模型,还完整说明了隐私标签体系、架构改造、训练数据构成、评测结果与局限,能直接用于文本脱敏和安全流水线设计。适合做隐私过滤、日志处理、数据预处理与安全工程参考,但跨语言和高风险场景仍需进一步验证。

技术文章OpenAI Research

Inside our approach to the Model Spec

本文系统解释了 OpenAI 公开版 Model Spec 的设计思路:它不是简单的“让模型更有用”的口号,而是一份可阅读、可讨论、可评估的模型行为规范。文章重点介绍了三层结构:高层目标与公开承诺、用于处理冲突指令的 Chain of Command、以及帮助模型在灰区稳定决策的判别准则和示例。作者强调,规范既要约束模型遵循更高优先级的安全边界,也要保留用户和开发者在默认行为上的可控性,并区分硬规则与可覆盖的默认项。文章还说明了 Spec 如何在训练、评测和治理中发挥“公共基准”作用,以及为什么它会随着能力、产品和公众反馈持续迭代。其局限是很多内容属于目标状态与治理框架,而非底层实现细节或实证研究,适合关注模型对齐、AI 安全和行为规范设计的人参考。

文中直接给出了 Model Spec 的结构、指令层级、硬规则与默认项划分,以及配套评测与更新机制,属于少见的公开治理框架说明。适合做 AI 安全、对齐、产品政策和模型评测设计的参考,但需注意它更多反映 OpenAI 的方法论与目标,而非可直接复用的底层训练实现。

科研议题OpenAI Research

Improving instruction hierarchy in frontier LLMs

这篇文章讨论大模型的指令层级训练,即让模型稳定遵循 System > developer > user > tool 的优先级,从而在冲突指令、恶意请求和工具输出注入中做出正确取舍。作者指出,直接用强化学习训练这一能力并不简单,因为复杂任务会混淆指令理解与层级判断、LLM 评审不够可靠,还容易诱发“过度拒答”等捷径。为此他们设计了 IH-Challenge 数据集,强调任务应尽量简单、可用 Python 程序自动判分,并避免存在能在所有任务上刷高奖励的投机策略。训练出的 GPT-5 Mini-R 在多项基准上优于基线,包括层级冲突、prompt injection 和安全可控性测试,同时没有明显能力回退或整体可用性下降。文章的边界也很明确:结果主要建立在受控任务和基准评测上,仍需在更复杂的真实部署场景中持续验证。

文中直接给出 IH-Challenge 设计原则、训练方法和多组对比结果,证明指令层级训练能同时提升安全可控性与 prompt injection 抗性。适合做 LLM 安全、对齐和代理式系统设计的参考,但需注意它主要是厂商研究与基准验证,真实场景泛化仍有边界。