知乎 - 微软亚洲研究院

20 篇内容

科研议题知乎 - 微软亚洲研究院

Flint:为AI时代打造的可视化语言

本文提出面向AI时代的可视化中间语言Flint,由微软研究院与中国人民大学联合研发。其核心思想是将图表意图表达与实现细节分离:用户定义数据语义类型(如价格、百分比)和图表类型,编译器自动推导坐标轴、配色、布局等专业设计决策,从而生成Vega-Lite、ECharts等多端代码。文中介绍了Flint的五项关键能力,包括语义指导设计、自适应布局、多端适配以及对智能体工作流的原生支持,并展示了与直接生成底层代码方案的对比实验,结果表明Flint可提高AI Agent生成图表的可靠性和质量。Flint已集成到Data Formulator工具,并开源了flint-chart库和MCP服务器,为构建智能可视化系统提供了新思路。其主要依赖语义类型的预定义和编译器规则,在极复杂或非标准图表场景中可能需要扩展。

本文系统呈现了Flint的设计动机、架构、关键能力和实验验证,内容完整且有可复现的开源实现,不是简单新闻稿,具备长期技术参考价值。适合从事可视化工具、人机协同、AI辅助开发的研究者和工程师阅读,可迁移的核心思想是意图与实现分离的中间语言模式,尤其在生成式AI引入高可靠设计决策的场景中具有启发意义。

科研议题知乎 - 微软亚洲研究院

RE-TRAC框架:让AI智能体"记住"失败经验

文章提出RE-TRAC框架,通过递归轨迹压缩让深度搜索智能体跨轮次传递经验,将独立的探索转化为渐进式学习过程。核心是在每轮探索结束时生成包含答案、证据库和待探索方向的结构化状态,并作为下一轮输入,从而减少冗余搜索并逐步收敛搜索空间。实验在BrowseComp、GAIA等五个基准上进行,4B和30B模型均取得领先成绩,分别超越大部分同尺寸和更大模型;RE-TRAC还可作为无需训练的测试时扩展方法应用于前沿模型,显著提升准确率并降低资源消耗。方法通过实体树构建合成训练数据进行SFT,证明了小模型搭配该框架即可实现强大搜索能力,为资源受限场景提供高效路径。

推荐收录,因为该文深入介绍了一项已被ICML 2026接收的高质量研究,不仅提出了可有效解决深度搜索中经验复用难题的新框架,还提供了详尽的实验结果和可复现的训练方案。对从事AI Agent、搜索增强和模型部署优化的研究者和工程师具有明确的参考价值,其跨轮次轨迹压缩的思路可迁移至其他需要长程规划的任务。

科研议题知乎 - 微软亚洲研究院

OSDI上新 | 探索分布式系统公平性与操作系统性能优化新路径

本文介绍了微软亚洲研究院在OSDI 2025入选的两篇论文。第一篇针对区块链共识协议的排序公平性问题,借鉴机会平等理念,定义了ε-排序平等和Δ-排序线性化两个可量化属性,并设计秘密随机预言机与Bercow协议,通过调整随机噪声强度在公平性和时效性之间取得可控平衡,实验表明能显著降低地理偏差和抵御三明治攻击。第二篇针对操作系统内核中编译期常量导致性能潜力未释放的问题,提出Xkernel,支持在运行内核中动态修改固定性能决策,其核心的Scoped Indirect Execution (SIE) 机制通过二进制差分和符号执行推导常量表达式,实现安全、有作用域、毫秒级生效的参数替换,性能调优可提升数倍,并具备让AI agent安全操作内核参数的潜力。两篇工作从不同层面展示了系统设计的创新,为分布式公平性和内核可调性提供了理论与工程参考。

文章对OSDI顶级会议的两篇系统领域论文进行了深度解读,覆盖问题动机、方法创新和实验验证,为分布式系统公平性和操作系统内核动态调优提供了清晰的理论框架和工程路径。对从事区块链、分布式系统、操作系统性能优化的研发人员和研究者具有直接的参考价值,文中提出的机会平等排序机制和SIE内核调优方法具备可迁移的设计思路,是计算机系统方向高质量的长期参考内容。

科研议题知乎 - 微软亚洲研究院

SlideSparse:拓展结构化稀疏边界

文章提出 SlideSparse,首次在 NVIDIA GPU 上使 6:8、4:6 等温和结构化稀疏模式利用稀疏张量核加速,填补了长期技术空白。核心方法是通过滑动窗口将不满足 2:4 约束的权重块分解为多个重叠的 2:4 子块,以适度数据膨胀换取硬件加速,理论加速比约 1.33 倍。权重变换离线完成,输入侧重排融合进推理 kernel,系统集成于 vLLM。实验在多种 GPU、精度和模型上验证,Prefill 阶段接近理论上限,Decode 阶段也有一定提升,证明了通用性与实用性。该工作将稀疏优化从极端二选一扩展为灵活配置,使稀疏成为与量化并列的推理优化维度。

SlideSparse 解决了温和稀疏无法硬件加速的长期痛点,通过滑动窗口分解实现计算套利,有扎实的理论分析和充分的工程验证。文章适合关注大模型推理优化、稀疏压缩或系统部署的读者,其思想可迁移至其他稀疏模式或硬件后端,具有较高的长期参考价值,推荐收录。

科研议题知乎 - 微软亚洲研究院

ICML 上新 | 五项视觉研究,让模型更持久、更轻量、更统一、更聚焦

本文是微软亚洲研究院在 ICML 上五项视觉研究的精选介绍,涵盖世界模型、轻量化扩散编解码、视觉高效压缩、跨模态统一建模与长视频时序推理等前沿方向。PERSIST 框架通过三维环境帧显式建模空间记忆,实现数千帧长程交互式生成;CoD‑Lite 利用卷积扩散与蒸馏,在 A100 上达到 1080p 实时解码;隐式视觉表征将视频压缩为单个 LoRA 向量,支持极低码率重建;LatentLM 以因果 Transformer 统一离散与连续模态,在文生图与语音合成中表现出可扩展性;ViTL 用两阶段焦点采样解决长视频问答的算力分配瓶颈,结合强化学习优化定位与答案。每项研究均附有论文链接,适合作为前沿方向概览。但文章属于简报性质,缺少深入的技术拆解与局限性讨论,详细实现需阅读原论文。

文章汇集了微软亚洲研究院五项 ICML 视觉前沿研究,每项均给出明确的问题、方法与关键结果,并有论文链接支撑,适合视觉与机器学习研究者快速把握最新研究方向。内容虽为简报,但提供了可迁移的新思路,如持久的空间记忆、轻量化生成与统一多模态框架,对工程落地与学术探索均有启发。不足之处在于解读较浅,需结合原文获取完整细节,但作为研究动态的索引仍具有长期参考价值。

科研议题知乎 - 微软亚洲研究院

大模型会“扮演人”,但真的懂人吗?一套新框架,给 AI 的“人味”做体检

本文介绍了一套由微软亚洲研究院提出的面向大模型类人行为的计算评测框架,旨在从理性、一致性和多样性三个维度评估AI模拟人类开放行为的程度。该框架不依赖人工考题,而是利用真实世界的购买、问答和出行轨迹数据,先将用户历史行为编码为用户画像,再由大模型生成后续行为,最后通过嵌入空间比对可区分性、可预测性、序列一致性和群体多样性。实验覆盖14个主流模型,结果显示模型规模越大表现越好,但最优模型在三个场景下仍与真实行为存在约10‑17%的综合差距,且普遍存在群体行为分布坍缩现象。本文表明,从“像人说话”到“像人持续行动”再到“像一群不同的人共同生活”,大模型仍有显著瓶颈,为后续类人模拟研究提供了量化参考和明确的能力边界。

推荐收录,因为这篇文章不仅介绍了被ICML 2026接收的原创评测框架,还通过多场景、多模型实验揭示了当前大模型在模拟人类行为时的一致性与多样性缺陷。它适合从事社会仿真、智能NPC和个性化助手的研究者与工程师理解现有能力的边界,其提出的理性‑一致性‑多样性评测维度可以直接用于同类系统的可靠性评估。

科研议题知乎 - 微软亚洲研究院

大模型预训练中的"又稳又快":SSO 如何统一训练稳定性与训练效率?

文章介绍了微软亚洲研究院提出的Spectral Sphere Optimizer(SSO),一种基于μP理论的新优化器。它将训练稳定性与最速下降目标统一到同一框架中,通过谱球约束保证权重和更新量满足μP条件,并在切空间内计算更新以实现Loss最快下降。文章详细推导了最优更新的数学解,引入拉格朗日乘子和二分搜索求解,并结合谱球回缩、幂迭代缓存等工程实践降低计算开销。实验表明,SSO在不同规模模型上均优于AdamW和Muon,且无需权重衰减,训练过程更稳定。文章同时讨论了当前方法的边界,如需要数值迭代、对c参数的控制仍需进一步研究。

这是一篇兼具理论深度和工程细节的论文解读,清晰阐述了SSO优化器如何从μP理论出发统一训练稳定性与效率。适合从事大模型训练优化、优化器设计的研究者和工程师阅读。文中推导和工程技巧(如切空间更新、谱球回缩)具有较强的可迁移性,有助于提升对训练动力学的理解,并可直接指导实验改进。

科研议题知乎 - 微软亚洲研究院

破解AI幻觉黑盒:大模型如何判断自己说的是真是假?

文章解读了微软亚洲研究院在ACL 2026发表的关于大模型幻觉内在机制的研究。作者通过实验发现,模型在判断生成答案真伪时存在两条独立的信息通路:提问对照模式依赖问题与答案的关键词核对,自我校验模式则基于答案自身的连贯性和自洽性。研究进一步提出混合多检测器(MoP)和注意力权重调节器(PR)两种检测方法,利用模型内部表示动态加权或调整注意力流,在不依赖外部知识库的情况下显著提升了幻觉检测的精度与泛化性。该工作不仅深化了对模型“元认知”信号的认知,也为构建可信AI提供了轻量高效的工程路径,但其方法仍基于当前模型架构,在更多实际高风险场景中的鲁棒性待进一步验证。

本文具有长期参考价值,因为它系统性地揭示了大模型内部真假判断的双通路机制,并给出了可落地的检测方案,论文已被顶级会议接收。适合关注模型可解释性、幻觉治理和AI安全的研究者与工程师,可迁移的核心思想是将模型内部分析与检测工具设计实现机制对齐,有利于启发同类问题的诊断和优化。

科研议题知乎 - 微软亚洲研究院

大模型时代,数据不仅要选得好,还要排得好

本文解读了 ACL 2026 论文《Demystifying Data Organization for Enhanced LLM Training》,系统探讨大模型训练中数据顺序对模型能力的影响。作者将问题拆解为数据评分、数据选择与数据组织,并复用已有样本分数,提出边界锐化、循环调度、课程连续性、局部多样性四条可迁移法则。在此基础上设计了 STR 和 SAW 两种排序策略,在预训练(FineWeb-Edu)和 SFT(数学推理、代码生成)任务上,相比随机排序取得一致的准确率提升和更低的测试损失。文章还讨论了方法的适用前提:依赖于可靠的样本分数,不改变数据内容和模型规模,仅优化训练顺序。研究为大模型数据效率优化提供了新的维度,强调数据‘何时出现’与‘如何出现’的重要性。

推荐收录,因为文章将数据组织从零星经验提炼为系统化的四条法则,并给出可复用的 STR 和 SAW 排序策略,实验覆盖多规模模型和多种任务,证据充分。适合从事大模型训练、数据效率方向的研究者和工程师,其指南可直接迁移到现有数据筛选流程中,且代码开源,可操作性强。

科研议题知乎 - 微软亚洲研究院

AI Next 播客 | 对话周礼栋:当系统开始“思考”,AI如何走向自主进化

这篇文章是微软亚洲研究院《AI Next》播客的文字整理,核心讨论“AI 与系统如何协同进化”,以及未来“系统智能”应如何定义与落地。周礼栋从聚合通信调度、OptiFlow 自动优化等例子出发,说明传统依赖人工调参的系统方法已难以跟上 AI 规模化和动态化的发展节奏。文章进一步提出,系统智能不是简单用 AI 辅助开发,而是让 AI 负责开放空间中的探索、生成与方案搜索,让系统负责抽象、约束、验证、执行与反馈,形成可闭环、自适应、可演化的基础设施。文中还强调可信基石的重要性,主张以最小可信计算基、形式化验证、隔离、审计和回滚机制约束 AI 的不确定性,并以 Verus 等工具为例说明可验证代码与 AI 生成代码结合的可能。最后,文章讨论了模型与硬件解耦、开放多元计算生态,以及培养同时理解 AI 与系统的交叉型人才等问题。整体上它偏研究方向与方法论梳理,案例具有启发性,但更像观点访谈而非完整实验论文,适合将其视作趋势判断和系统设计思路参考。

文中直接给出 OptiFlow、最小可信计算基、Verus 等具体例子,说明“AI+系统”从理念到机制的可行路径,不是泛泛而谈。适合做系统研究、AI 基础设施和可信计算方向的趋势参考,但需注意它是访谈式观点整理,实验细节与量化评估不如论文完整。

科研议题知乎 - 微软亚洲研究院

GenAC:让价值模型重新“思考”的生成式Critic

这篇文章介绍微软亚洲研究院与北京大学提出的 GenAC:一种生成式 Critic,用来改进大语言模型强化学习中的信用分配问题。作者认为传统判别式价值模型之所以不稳定,根源在于其前向推理表达力受限,难以拟合需要顺序推理的价值函数,因此单纯堆参数并不能根治。GenAC 改为先生成思维链再估计价值,并通过上下文注入当前策略规模和成功率,使 Critic 感知“在评估谁”。训练上采用 SFT 热身加 RL 校正的两阶段预训练,随后在数学推理任务上用于 PPO 训练。实验显示 GenAC 在平均准确率、相对排名、分布外泛化和错误定位上都优于判别式 Critic 及 GRPO、RLOO 等无价值方法,但文章结论主要建立在特定推理任务与实验设定下。

文中给出了明确的理论动机、训练方案和对比实验,直接展示生成式 Critic 如何改善 LLM 强化学习中的信用分配。适合研究 LLM 后训练、RLHF/RL 推理和价值建模的读者参考,但其结论仍受具体任务与实验设置限制。

科研议题知乎 - 微软亚洲研究院

RenalCLIP:从“通用”转向“专病”,让医疗 AI 更懂肾癌诊疗

这篇文章介绍了微软亚洲研究院与多家医院合作发表的专病多模态基础模型 RenalCLIP,核心目标是让模型从“通用医疗表征”转向“肾癌专病理解”。文章说明了模型的两阶段预训练方法:先从放射学报告中学习肿瘤位置、大小、强化模式等结构化属性,再通过视觉-语言对比学习将 CT 影像与临床语义对齐,以支持良恶性判断、侵袭性评估、R.E.N.A.L. 评分和生存预测等任务。

推荐收录,因为它不是泛泛的产品宣传,而是围绕一篇真实发表的研究论文,清楚展示了专病基础模型的建模思路、训练范式和多中心评估结果。对关注医疗 AI、视觉-语言模型和小样本/零样本迁移的读者都有参考价值,也能帮助理解“从通用到专病”的研究趋势。

科研议题知乎 - 微软亚洲研究院

AI 能考过计算机等级考试吗?

这篇文章介绍了微软亚洲研究院提出的 OfficeEval 基准:他们把国家计算机等级考试 NCRE 一、二级的 200 道 Word、Excel、PPT 实操题转成可机器评分的测试集,用 7,118 条细粒度评分点评估前沿大模型在办公自动化上的真实能力。结果显示,单轮生成模式下最强模型得分仅约 36.6%,即使引入可反复试错的编程智能体,最高也只有 68.8%,距离人类标准解答仍有明显差距。文章进一步指出,模型在 Excel 上相对更强,但在 PPT 动画、图形媒体和底层常量/API 映射上频繁出错,根源在于缺少视觉反馈、对底层表示理解不足以及迭代修复时容易回退。

推荐收录,因为它不是单纯的模型跑分新闻,而是把一个真实、标准化、可客观评分的办公考试转化为研究基准,并给出了清晰的误差分析。对做 LLM 评测、AI 工程化和办公自动化的人来说,这篇内容能直接提供基准设计、评估方法和能力边界判断。

科研议题知乎 - 微软亚洲研究院

开源上新 | 大模型是否还在"金鱼记忆"?全新基准 RHELM 测出“真实长期记忆”天花板

本文介绍了微软亚洲研究院等团队提出的长期记忆评测基准 RHELM,重点解决现有长期记忆测试“语义不连贯、信息源单一、题目过于老实”等问题。RHELM 通过构造为期一年的动态虚拟人生轨迹,把用户画像、对话、邮件、日志和报告等异质文本耦合起来,并用 7 大类、27 项挑战特征系统评测模型的事实记忆、时序记忆、跨源聚合和误导查询处理能力。文章还给出了对全上下文模型、RAG 和记忆框架的对比结果,指出当前系统在跨源混合推理、幻觉识别和现实情境约束上仍存在明显短板,同时也说明了基准在多模态覆盖与人群偏置方面的局限。

推荐收录,因为它不是单纯的产品宣传,而是围绕“长期记忆”这一重要研究问题,提出了新的评测范式、细粒度指标和明确的实验结论。对从事 LLM 评测、RAG、记忆增强系统和 AI Agent 设计的读者来说,文章具有很强的迁移价值和长期参考意义。

科研议题知乎 - 微软亚洲研究院

SkillOpt:把智能体的“技能”当作可训练的外部参数

文章围绕微软亚洲研究院提出的 SkillOpt 框架展开,核心观点是将智能体“技能”从一次性生成的提示词,重新定义为可训练、可验证、可回滚的外部文本参数。作者详细说明了其训练闭环:轨迹采集、成功/失败反思、有界编辑、验证门控与拒绝缓存、跨轮慢更新,并强调最终产物是一份可读、可审计、可复用的技能文件。

推荐收录,因为它不仅介绍了一个新框架,还把智能体技能优化的问题抽象成了类似深度学习训练的可控过程,包含明确的机制设计、消融验证和跨框架迁移结果。对做 LLM Agent、提示优化、自动评测和企业流程自动化的读者都有可迁移价值。

科研议题知乎 - 微软亚洲研究院

CVPR 上新 | 从生成式压缩到3D空间智能,七项前沿突破洞悉计算机视觉未来方向

这篇文章汇总了微软亚洲研究院在 CVPR 2026 入选的七项计算机视觉研究,覆盖生成式图像/视频压缩、3D 空间理解、原生 3D 生成、扩散模型加速以及实时说话人像视频生成等方向。各部分分别介绍了对应方法的核心设计,例如面向压缩的扩散基础模型、1D 视频潜表示、分层 3D 认知数据构建、稀疏结构化 3D 潜空间、区域自适应采样与语义优先扩散,并给出了在压缩率、加速比、SOTA 指标上的实验结果。整体来看,它更像一篇前沿研究综述式的项目导读,适合用来把握当前视觉生成与空间智能的主要技术路线及其适用边界。

推荐收录,因为文章虽然来自机构科研宣传,但内容并非纯新闻转述,而是对多篇前沿论文的机制、数据构建和实验结论做了较完整的梳理。对关注计算机视觉、生成模型和 3D 空间智能的读者来说,它能快速建立研究地图,并提炼出可迁移的设计范式。

科研议题知乎 - 微软亚洲研究院

AI医疗影像盲猜不靠谱?两大医疗智能体框架让AI学会“找证据”、“多科会诊”

文章围绕医疗影像中的可解释诊断与多智能体协作两类核心问题,介绍了微软亚洲研究院提出的两个研究框架:CARE 与 MMedAgent-RL。CARE 通过“识别实体—分割定位 ROI—基于证据推理”的流程,把 VLM 的黑盒判断拆解为可审查的循证链条;MMedAgent-RL 则模拟分诊医生、专科医生和主治医生的多学科会诊机制,并用课程学习结合强化学习优化专家权重分配与纠偏能力。文章的结论是:医疗 AI 若要走向可信应用,不能只追求答案准确率,还需要在证据可追溯、协作决策和与临床逻辑对齐方面建立新的方法范式。

推荐收录,因为它不是单纯的产品宣传,而是围绕医疗多模态推理中的可解释性与协作机制,梳理了两个具体研究框架及其方法思路。对关注 VLM、医疗 AI、智能体系统和可信推理的读者来说,文章提供了可迁移的设计范式:证据驱动、分工协作、课程学习与纠偏机制。

科研议题知乎 - 微软亚洲研究院

RPG 与 RPG-Encoder:为仓库级 AI 工程,量身打造一种中间表示

这篇文章介绍了微软亚洲研究院提出的两项互补工作:RPG(Repository Planning Graph)用于把自然语言需求转成仓库级规划并驱动代码生成,RPG-Encoder 则把已有代码仓库反向压缩回同一种图表示,用于理解、定位、修改和增量维护。文章重点说明了为什么仓库级 AI 需要比自然语言计划、依赖图、API 文档更统一的中间表示,并通过 RepoCraft、SWE-bench 等实验展示了该表示在功能覆盖率、测试通过率、定位精度和增量维护成本上的优势,但这些结论主要基于特定 Python 仓库与基准任务,泛化到更多语言和工程场景仍需进一步验证。

推荐收录,因为它不只是介绍一个新概念,而是明确提出了仓库级 AI 工程所需的中间表示问题,并给出了正向生成、反向理解与增量维护的一体化方案。文章同时包含基准、实验指标和适用边界,适合关注代码智能体、仓库级推理和 AI 工程化落地的读者长期参考。

科研议题知乎 - 微软亚洲研究院

AVGen-Bench:面向下一代文生音视频模型的系统化评测框架

文章介绍了微软亚洲研究院提出的 AVGen-Bench,一个面向文本生成音视频(T2AV)的任务驱动、分层评测基准。它不再只看“生成结果好不好看/好不好听”,而是从单模态质量、音画一致性到细粒度语义可控性三个层面,系统评估模型在广告、创作者内容和世界模拟等真实场景中的能力边界。文章还说明了其 prompt 构建方式和混合式评测方法:结合专家模型、OCR 与多模态大模型,尽量把传统 benchmark 难以覆盖的文本渲染、口型同步、物理一致性和角色一致性等问题量化出来。

推荐收录,因为它不仅是在介绍一个新基准,更是在讨论下一代多模态生成模型该如何被“诊断式”评测,具有明确的方法论价值。对于做生成模型、评测体系或多模态应用落地的读者,这篇文章能直接提供可迁移的 benchmark 设计思路和能力分层框架。

科研议题知乎 - 微软亚洲研究院

不改架构、无需3D数据,强化学习如何让视频模型真正“理解”3D世界?

文章介绍了微软亚洲研究院提出的 World-R1 框架,核心目标是在不改动视频生成模型架构、无需额外 3D 数据、且不增加推理开销的前提下,通过强化学习让视频模型更好地满足三维几何一致性。方法上,它将相机运动以隐式噪声注入的方式写入扩散过程,并借助 3DGS 重建、多模态语义评分、轨迹对齐和生成质量评分构造复合奖励,再通过周期性解耦训练平衡刚性结构与动态内容。实验结果表明,该方法在几何一致性指标和常规视频质量指标上都优于基线,但整体仍建立在重建质量、奖励设计和文本运动先验有效的前提之上。

推荐收录,因为这篇文章不是泛泛介绍视频生成热点,而是清楚讲解了一个具体研究框架的目标、训练信号设计、实验指标与消融结论。它对想理解“如何用 RL 改善生成模型几何一致性”的读者具有较强的迁移价值,也能作为相关论文阅读的导读材料。