Microsoft Research Blog

20 篇内容

科研议题Microsoft Research Blog

MindTopo reveals VLMs’ spatial reasoning abilities

文章介绍MindTopo基准,用于评估多模态大模型的拓扑推理能力,将任务分为连续性、分离、顺序、封闭性和绳结五类,并区分静态推理与交互规划两个认知层次。所有场景由可控模拟器生成,提供精确真值和难度调节,以分离视觉复杂度与结构维持能力两类失败。研究发现当前模型在静态识别上明显强于交互规划,且均低于人类;规划错误多发生在理解之后,表现为多步丢失结构或违反物理约束。图像或视频生成辅助并不可靠,无法在动作序列中保持拓扑关系。作者认为机器人等交互系统需要显式拓扑状态或拓扑保持的世界模型,该基准定位为受控诊断工具。

推荐收录,因为文章提出了一个清晰定义的拓扑推理基准,并用控制仿真区分感知失败与规划失败,对评估多模态模型的深层空间能力有直接价值。适合关注视觉语言模型、机器人规划与AI评测的研究者,其五类任务划分和失败模式分析可迁移到交互式智能体的诊断与改进。

科研议题Microsoft Research Blog

Introducing CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement

文章介绍CARE-X,一个统一胸部X光视觉语言模型,通过辅助监督(分类和定位头)与DAPO强化学习,同时支持自由文本报告生成和校准的结构化预测。辅助头在训练中共享语言主干,既能提供可调阈值的分类置信度,又能通过共享表示提升生成性能;DAPO进一步使生成式空间定位能力逼近专用检测头。模型在多个报告生成基准和ReXVQA问答上取得领先,并在印度真实医院数据(罕见ICU病变和CT确认的扩张症)上验证了泛化性。此外,文章还展示了一个独立的工具增强推理实验,将Qwen3-VL与确定性测量工具结合,在测量依赖的诊断上大幅超越纯感知基线。研究限于回顾性数据,未经监管审批,不适用于临床诊断,且召回率分析尚未覆盖全精度评估,但这些结果表明判别与生成目标的联合训练以及定量工具集成是提升临床AI实用性的可行方向。

该研究提供了将判别辅助监督与生成式VLM相结合的详细技术方案,并通过DAPO强化学习实现了临床对齐优化,是跨模态医学AI领域的扎实工作。适合从事医疗AI、多模态学习或RLHF工程师阅读,其辅助头共训练、可调置信度输出和工具增强测量的设计范式可迁移到其他需要结构化预测的生成式系统。主要风险在于模型仅为研究原型,临床验证尚不充分,可作为方法参考而非直接产品使用。

科研议题Microsoft Research Blog

Orchard: An open framework for scalable agentic AI

微软研究院推出 Orchard,一个面向可扩展智能体 AI 研究的开源框架。其核心是 Orchard Env,一个基于 Kubernetes 的轻量级环境服务,可为不同任务域(软件工程、网页导航、个人助理)的训练和评估提供可复用的隔离组件。文章重点介绍了三个领域特定的训练方案:Orchard‑SWE 采用信用分配监督微调和强化学习(含平衡自适应展开、密集奖励信号和价值模型重排序),仅用约 3B 活跃参数在 SWE‑bench Verified 上达到 69.7%(重排序后 73%),接近 10 倍以上规模的闭源系统;Orchard‑GUI 用少量监督数据训练 4B 视觉语言模型,在 WebVoyager 等基准上平均 68.4%;Orchard‑Claw 在 200 个合成任务下训练个人助理,并在真实部署 harness(如 Codex、OpenClaw)中显著提升成功率。Orchard 的创新在于将环境层作为独立可复用服务,支持在真实 harness 内端到端训练,弥合训练与部署间的差距。项目同时开放训练数据和评估方法,旨在降低智能体 AI 研究的门槛并促进社区协作。

推荐收录,因为本文提供了可复现、可迁移的开放智能体研究框架,详细阐述了环境设计、训练配方和严格评估,结果有力且透明。对于从事 AI Agent、强化学习或工程基础设施的研究者和工程师而言,文章中的环境抽象、密集奖励设计、harness 内训练等思路可直接借鉴,有助于降低构建和训练自主智能体的门槛。

科研议题Microsoft Research Blog

Echoverse: Deep, evolving environments for computer-use agents

Echoverse 是微软研究院提出的构建深度、可演化的合成训练环境框架,用于训练计算机使用代理。文章指出,关键不是环境数量,而是行为深度、能力靶向和环境的协同演化。通过构建十个深度领域世界和两个能力世界,验证器直接基于数据库状态而非屏幕截图,提供了可复现的训练和评估信号。实验表明,深度世界比浅层世界更有利于迁移;针对性训练能提升特定交互技能并泛化至未见界面;环境、任务和验证器的共进化能持续改善模型表现;在合成数据上训练的 9B 模型性能接近 GPT‑5.4,强化学习进一步超过模仿学习。文章还讨论了方法的适用边界,强调合成环境稳定性与技术深度的权衡,并公开了部分代码和数据。

该文系统阐述了构建高保真合成环境的方法,从环境生成、任务构造到验证器设计均有可操作的工程细节,并附有扎实的消融实验和迁移验证。适合从事 AI 代理、强化学习、人机交互的研究者和工程师阅读,其数据库‑grounded 验证与共进化思路可迁移至其他需要模拟训练的领域。主要风险是合成环境与真实世界的差异,但文章已通过迁移实验展示有效性。

科研议题Microsoft Research Blog

EvoLib: Turning experience into evolving knowledge

文章介绍了微软研究院提出的EvoLib框架,旨在让大语言模型在推理时从自身经验中学习,无需外部标签或模型更新。核心方法将原始经验转化为可复用的技能和反思性见解,并通过知识合并与动态权重机制持续演化知识库:合并相似知识以提升通用性,依据长期贡献调整权重。实验覆盖数学推理、代码生成和交互式环境探索等任务,结果显示EvoLib性能优于检索增强记忆方法,且能更高效地将测试时计算转化为性能提升,并对任务顺序随机性具有鲁棒性。该方法适用于黑盒模型和API部署场景,但当前验证主要限于特定任务类型,大规模下的演化效率和跨领域泛化仍待探索。

推荐收录,因文章基于正式研究论文,系统阐述了EvoLib的设计机制、实验验证和鲁棒性分析,展示了如何从经验中提取可演化知识,为AI智能体的持续学习提供了新思路。适合从事AI智能体、大模型推理优化及持续学习研究的读者,其知识合并与动态权重方法可迁移至其他需要经验积累的工程场景。

工程实践Microsoft Research Blog

Verifying Rust cryptography in SymCrypt, from standards to code

本文介绍了微软在SymCrypt密码库中结合Rust、Lean、Aeneas和AI代理实现生产级密码算法的形式验证。方法首先将NIST标准等规范直接翻译为可执行、可审计的Lean规格,并针对ML-KEM的NTT等示例展示结构对应与数学性质证明;接着通过Aeneas将Rust实现自动转化为纯函数式Lean模型,并证明其精化规格。方案支持多架构(x86-64、aarch64)和SIMD intrinsics,通过条件编译和动态派发保留性能,同时将证明结果通过仪表板反馈给开发者,融入持续开发流程。AI代理用于辅助生成规格和证明,并由Lean内核独立检查,显著降低验证的人力成本。文章以SHA-3和ML-KEM的完整证明为案例,展示了在不牺牲性能与可维护性的前提下获得高可信保证的可行性,但当前工作仍限于部分算法,且依赖特定工具链。

该文系统性地呈现了将形式验证落地到生产级密码库的工程方法,从标准建模、代码转换、多架构支持到开发者反馈和AI自动化,提供了可复用的验证流水线。对于从事密码工程、系统安全或形式化方法的读者,文中展示的规格贴近标准、代码不做修改、验证结果持续同步等原则具有直接参考价值;其工具组合和代理辅助思路也为同类项目提供了可迁移的实践范式。

科研议题Microsoft Research Blog

Aurora 1.5: Extending open foundation models for weather and Earth-system applications

文章介绍了微软发布的Aurora 1.5地球系统基础模型,它在原有Aurora模型上进行了重大扩展,新增22个天气变量(如云量、太阳辐射等),将时间分辨率提升至小时级,并引入概率集合预报功能。模型通过多阶段微调实现,在ECMWF数据上针对概率预报质量进行了优化,集合预报在88.9%的评估目标上优于ECMWF动态集合。文章展示了Aurora 1.5在热带气旋路径预测等高风险场景中的性能,并讨论了其在能源、农业等行业的应用前景,以及通过开源和Azure服务连接研究到运营的路径。该模型作为开源基础模型,旨在补充而非替代物理模型,为天气和气候应用提供灵活基础。

推荐收录,因为文章不仅介绍了Aurora 1.5的技术扩展(多变量、小时级、集合预报)和具体微调方法,还提供了与现有顶级集合预报系统的对比评估和实际案例,展示了从研究到产品化的路径。对从事地球系统建模、气候AI或跨学科基础模型研究的读者具有可迁移的方法论参考价值。

科研议题Microsoft Research Blog

Flint: A visualization language for the AI era

这篇文章介绍了微软研究院提出的 Flint,一种面向 AI 时代的可视化中间语言。它把数据的语义类型与图表类型、通道映射分开表示,由编译器自动推导时间解析、坐标轴、色带、布局和标注等低层细节,从而把原本脆弱且冗长的图表规格压缩为可编辑的简洁规范。文章强调 Flint 适合 LLM/Agent 生成图表,因为模型更容易推断字段语义,而不是直接生成完整的 Vega-Lite 级配置。作者还给出与 DirectVL 的对比实验,在 Tidy Tuesdays 数据上 Flint 的 LLM-judge 分数更高,并说明它已被用于 Data Formulator,同时提供了 MCP 服务器以支持聊天或 IDE 中的创建、校验和渲染。其边界在于当前主要是面向图表生成的系统设计与博客级评估,结论更适合视为可迁移的工程/研究方向,而非最终定论。

文章给出了 Flint 的核心机制:用语义类型和编译器替代手写低层图表参数,并附有与 DirectVL 的对比结果,具备明确的研究与工程证据。适合做 AI 辅助可视化、Agent 工具链和声明式语言设计的参考,但需注意目前主要是博客级总结,实验范围与评估指标仍有限。

科研议题Microsoft Research Blog

SkillOpt: Agent skills as trainable parameters

文章介绍了微软研究院提出的 SkillOpt:把智能体的技能文件当作“可训练参数”,在冻结目标模型权重不变的前提下,用另一个优化器模型对自然语言技能进行迭代优化。其流程包括轨迹采集、反思归纳、受限的增删改编辑、严格验证门控,以及利用被拒绝编辑作为负反馈的慢速/元更新,从而避免技能在反复改写中失控漂移。作者在 6 个基准、7 种目标模型和 3 种执行模式上评测,52 个评测格里均达到最佳或并列最佳,说明这种方法比手写提示、一轮生成和若干现有文本优化方法更稳定。实验还显示,优化后的技能文件具有可迁移性,能够跨模型规模、跨 agent harness、甚至跨相近任务继续带来收益。文章的边界也很明确:它依赖可验证的评估信号或自动验证器,适合有明确任务目标、可做离线评测的 agent 工作流,不适合缺少可靠验证的开放式场景。

推荐收录,因为文章给出了可复现的研究框架、完整的优化机制和跨 52 个评测格的结果证据,而不是停留在概念宣传。适合做 agent 研究、提示/技能优化和自动化评测设计的读者参考;其可迁移价值在于“训练文本技能而非改权重”的方法论,但前提是任务必须有稳定验证信号。

科研议题Microsoft Research Blog

Memora: A Harmonic Memory Representation Balancing Abstraction and Specificity

文章介绍了微软研究院提出的 Memora,一种面向长程 AI agent 的记忆框架,核心目标是同时保留细节与可检索性。作者指出,现有方案要么把对话切成碎片化事实,要么压缩成过度粗糙的摘要,都会在“抽象性”和“具体性”之间丢失一端。Memora 通过将“存什么”和“怎么取”解耦:用 primary abstraction 作为检索锚点、用 memory value 保存丰富内容,再借助 cue anchors 提供多路径召回,并配合 policy-guided retriever 做迭代式检索与多跳推理。在 LoCoMo 和 LongMemEval 上,它分别取得 86.3% 和 87.4% 的 LLM-judge 准确率,并相对全上下文推理最多减少 98% token 消耗。文章适合作为理解长时记忆、agent 记忆架构和检索策略设计的研究案例,但结论主要来自长对话基准,真实业务中的稳定性、更新策略和跨域泛化仍需进一步验证。

推荐收录,因为文章明确给出了可复用的记忆架构:将内容存储与检索机制解耦、用 primary abstraction 与 cue anchors 组织记忆,并用迭代式策略检索支持多跳召回。它对长上下文 agent、记忆系统和检索式 AI 工程都有直接参考价值,但读者也应注意其效果主要建立在长对话基准上。

科研议题Microsoft Research Blog

Understanding the brain with AI-driven explanations and experiments

文章介绍微软研究院与多校合作发表于《Nature Neuroscience》的生成式因果测试(GCT)框架,目标是把能预测语言引发脑活动的黑箱模型,转化为可读、可检验的科学假设。方法分两步:先从脑区预测模型中提取最强驱动词组,再由LLM概括成简短解释;随后让LLM生成专门“驱动”目标脑区的新故事,在fMRI中验证该脑区是否显著激活。实验表明,GCT不仅能复现已知选择性,还能区分长期被混为一谈的邻近地点加工区域,并发现对对话、时间和测量等概念敏感的前额叶微区域。其价值在于把预测模型的相关性结果闭环为因果验证,但结论仍依赖于模型稳定性和少量受试者,主要适用于语言神经科学这类可闭环实验的场景。

文中明确给出 Nature Neuroscience 论文、GCT 两步流程和 fMRI 验证结果,是把黑箱模型转成可检验理论的具体案例。适合关注 AI 可解释性、计算神经科学和“生成-验证”研究范式的读者参考,但方法目前仍受限于模型稳定性与小样本实验。

科研议题Microsoft Research Blog

Talos: Scaling rare disease diagnosis with automated, iterative genomic reanalysis

这篇文章介绍了微软研究院与多方合作开发的 Talos:一个用于罕见病基因数据自动、迭代式重分析的开源工具。它通过持续对已有测序结果重新对照最新的公共知识库(如 PanelApp Australia 和 ClinVar),优先筛出最可能满足临床报告标准、且“新增证据发生变化”的候选变异,从而把原本依赖人工、低频率的复分析流程变成可持续运行的常规程序。文章给出了较完整的验证结果:在约 1,089 名已人工分析样本上,Talos 在每例只返回约 1.3 个候选变异的前提下恢复了约 87%–90% 的适用诊断;在 4,735 名长期未确诊患者的前瞻性队列中,又带来了 241 例新增诊断(5.1% 额外收益),并把新科学证据出现到完成诊断的平均时间压缩到 32 天左右。文章的核心结论是:在罕见病场景中,真正的瓶颈往往不是算法召回,而是专家复核成本,因此“高特异性、可持续迭代”的设计比单纯输出长排序列表更有工程和临床价值。

推荐收录,因为它不仅讲述了一个研究成果,还清楚呈现了问题定义、系统设计、评估指标和现实约束之间的取舍。对于关注医疗 AI、科研工程化或大规模自动化复分析的人来说,这篇文章提供了可迁移的方法:如何把持续更新的外部知识源纳入流水线、如何在召回与人工审核成本之间设定目标、以及如何用真实队列验证系统价值。

科研议题Microsoft Research Blog

Ire identifies another LOTUSLITE specimen

这篇文章介绍了 Microsoft Research 的 Project Ire 如何在没有人工提示、没有上下文元数据的情况下,对一个 Windows DLL 恶意样本进行静态逆向分析,并给出“malicious”判定。作者将 Ire 的函数级行为报告与 Acronis 对 LOTUSLITE 家族的分析进行对照,说明该代理能够通过安装逻辑、C2 协议、持久化方式和混淆痕迹识别出同一恶意家族,即使样本不包含现成 IOC。文章同时强调了 LLM 驱动分析的风险:表面字符串可能误导判断,因此需要把可审计的行为证据与谨慎的归因区分开来。

推荐收录,因为它展示了一个具有研究意义的安全分析范式:用 LLM 代理结合反编译工具进行无人工交互的恶意软件分类,并用实际样本验证其效果。对于研究自动化逆向、恶意代码分析、以及 LLM 在安全场景中的可靠性边界的读者,这篇文章有明确的参考价值。

科研议题Microsoft Research Blog

Extending Human Intelligence Through AI

这篇文章从现象学和认知结构出发,提出现代 AI 不是在复制人类智能,而是在扩展已经存在于人类语言和认知中的结构,因此能解释大模型为何既强大又脆弱。文章进一步把幻觉、组合推理失效、多模态鲁棒性不足等问题,解释为这种“基于语言结构的扩展”所带来的边界,并将 AI 安全重心从“模型是否像自主智能体”转向系统级治理、护栏与责任分配。

推荐收录,因为它提供了一个能长期复用的 AI 解释框架,把能力边界、幻觉现象和安全治理放在同一条逻辑线上讨论,而不是停留在泛泛的观点表态。对研究 AI 安全、评估大模型能力边界或设计可信 AI 系统的读者,这篇文章有助于建立更稳健的判断视角。

工程实践Microsoft Research Blog

MagenticLite, MagenticBrain, Fara1.5: An agentic experience optimized for small models

这篇微软研究博客介绍了一个面向小模型的 agentic 系统组合:MagenticLite 作为跨浏览器和本地文件系统的应用层,MagenticBrain 负责规划、代码生成与任务委派,Fara1.5 则承担浏览器 computer-use 任务。文章重点不在单一模型能力,而在“模型、数据、工具调用格式、执行 harness、交互界面和沙箱环境”协同设计,强调小模型要想完成真实任务,关键在于分层编排、上下文管理和明确的人类审批点。作者还给出了针对网页表单、登录、长任务和文件整理等场景的评价思路,说明标准 benchmark 之外还需要场景化评测来推动迭代,但整体仍是研究发布性质,适合参考其系统设计方法而非直接当作稳定产品方案。

推荐收录,因为它不是简单的模型发布稿,而是把 agent 系统的关键问题拆成了可迁移的工程要素:任务分解、delegation、上下文裁剪、critical point、沙箱隔离和场景化评测。对于做 LLM agent、computer-use、工具调用编排和安全护栏设计的读者,这篇文章能提供一套完整的系统视角。

科研议题Microsoft Research Blog

Vega: Zero-knowledge proofs for digital identity in the age of AI

文章介绍了微软研究院提出的 Vega:一种面向数字身份验证的零知识证明系统,目标是在不暴露政府签发凭证本身的前提下,仅证明“年满 21 岁”“具备某职业资格”等事实。作者不仅解释了该系统如何把 Spartan、Nova、HyperNova、NeutronNova 等构件组合起来,还给出了面向真实凭证格式的设计选择,例如用 lookup 避免完整解析器、用 fold-and-reuse 降低重复证明成本、用设备绑定防止凭证泄露后的滥用。文章还报告了在普通客户端设备上生成约 92ms、证明体积约 108KB、无需 trusted setup 的性能结果,并讨论了其在移动身份、AI agent 代办和链上身份桥接中的适用场景与边界。

推荐收录,因为它不是泛泛介绍零知识证明概念,而是围绕一个现实身份验证问题给出了完整的研究型方案、系统构造和性能评估。对于关注隐私计算、数字身份、密码协议工程化以及 AI 时代可信交互的人,这篇文章具有明确的长期参考价值。

科研议题Microsoft Research Blog

Further Notes on Our Recent Research on AI Delegation and Long-Horizon Reliability

这篇文章围绕微软研究院关于“AI 委派任务”和长周期可靠性的研究做进一步说明,重点解释论文并不是在否定 AI 在真实工作中的价值,而是在构造一个用于压力测试的长链路委派基准。作者详细说明了评测方法、语义保持的度量方式、实验中观察到的累积退化现象,以及这些结果的适用边界和方法学限制。文章的核心结论是:当前强模型在短基准上表现优异,并不自动意味着它们能在多轮、低人工介入的委派工作流中稳定保持文档或结构化工件的语义完整性。

推荐收录,因为它把一个看似“模型失误”的现象放回到严谨的研究框架中,明确区分了压力测试、真实部署和生产级工作流之间的差异。对做 AI 评测、智能体系统、工作流编排和企业落地的人来说,这篇文章提供了可迁移的评测视角与边界意识。

工程实践Microsoft Research Blog

mimalloc: A new, high-performance, scalable memory allocator for the modern era

这篇文章系统介绍了 mimalloc 现代内存分配器的设计目标与实现取舍,包括线程本地 heap、按页组织的固定大小块、三层 free list、跨线程释放的原子 CAS 路径,以及通过 page stealing 在可扩展性和内存共享之间取得平衡。作者还给出了小对象分配/释放的快路径、跨线程同步开销为何可控,以及在大规模并发服务和超大内存工作负载中的基准表现,说明它既能支撑高吞吐也能保持较低碎片与可接受的提交内存比例。

推荐收录,因为它不是泛泛介绍 malloc,而是把并发分配器的关键设计点、数据结构、快慢路径和性能边界讲得很清楚,适合长期作为系统性能与内存管理参考。文章对“低争用、高局部性、可迁移到真实服务”的工程取舍有很强的迁移价值,尤其适合做系统编程、运行时和基础设施方向的读者学习。

科研议题Microsoft Research Blog

GridSFM: A new, small foundation model for the electric grid

这篇文章介绍了 Microsoft Research 发布的 GridSFM,一个用于电网 AC 最优潮流(AC-OPF)的轻量级基础模型,重点解决传统数值求解器在大规模电网中计算耗时过长的问题。文章详细说明了模型的图结构表示、solver supervision 与物理约束联合训练方式、跨 150+ 拓扑和约 50 万场景的训练设置,以及在成本误差、可行性筛查、warm-start 加速和跨网泛化上的实验结果与边界。

推荐收录,因为它不是单纯的产品宣传,而是包含了明确的问题定义、模型设计、训练数据规模、对比基线和失败边界的研究型内容。对关注机器学习用于组合优化、基础模型迁移和工业级仿真加速的读者,这篇文章具有较强的长期参考价值。

科研议题Microsoft Research Blog

Advancing AI for materials with MatterSim: experimental synthesis, faster simulation, and multi-task models

这篇文章介绍了 Microsoft Research 在材料科学 AI 方向的 MatterSim 最新进展,核心包括:利用 MatterSim-v1 预测并实验合成了高导热候选材料 tetragonal TaP;通过推理加速和与 LAMMPS 集成,将模拟效率提升到更适合大规模筛选与现有工作流的水平;并发布了支持多任务推断的 MatterSim-MT,用于超越单一势能面描述的复杂材料现象建模。文章还通过声子谱、铁电翻转和电化学氧化还原三个案例说明,多任务模型能够联合预测能量、力、应力、磁矩、Born 有效电荷和介电矩阵,从而支持更接近真实材料设计流程的科学推理与实验验证。适用边界上,它主要面向材料模拟、AI for Science 和多物理场建模场景,不是通用机器学习教程。

推荐收录,因为它不仅汇报模型发布,还包含了实验验证、性能优化和多任务建模三条相互关联的研究线索,体现了 AI for Science 从预测到验证再到工作流集成的完整链条。对研究材料建模、科学机器学习和多任务基础模型的读者来说,这篇文章能提供可迁移的方法框架、评估思路和落地边界。