BlockGen: Flexible Blockwise Sequence Modeling with Hybrid Samplers
BlockGen: 灵活的分块序列建模与混合采样器
机构 * EPFL Lausanne, Switzerland(瑞士洛桑联邦理工学院) ; Microsoft AI(微软人工智能)
AI总结 提出BlockGen框架,通过分块序列建模和AR-informed预测-校正采样,比较均匀态扩散与掩码扩散在分块生成中的性能。
大厂专区
BlockGen: 灵活的分块序列建模与混合采样器
机构 * EPFL Lausanne, Switzerland(瑞士洛桑联邦理工学院) ; Microsoft AI(微软人工智能)
AI总结 提出BlockGen框架,通过分块序列建模和AR-informed预测-校正采样,比较均匀态扩散与掩码扩散在分块生成中的性能。
残差解码器适配器:用于自回归文本渲染的身份保持分词器适配
机构 * Central South University(中南大学) ; University of Oxford(牛津大学) ; Microsoft Research(微软研究院)
AI总结 提出残差解码器适配器(RDA),通过引入配对码本和平行分支学习像素空间残差,在不重新训练分词器和自回归模型的情况下显著提升文本渲染性能。
Comments CVPR 2026 poster
Token 预测器不是规划器:构建物理基础的因果推理器
机构 * Tsinghua University(清华大学) ; Microsoft Research Asia(微软亚洲研究院) ; MBZUAI
AI总结 针对具身视觉-语言规划中模型依赖语言统计先验而非因果推理的问题,提出 Causal-Plan-Bench 基准和 Causal-Plan-1M 数据集,并训练 Causal Planner 模型,实现从 token 预测到物理因果推理的转变。
Comments 77 pages, appendices included. Code: https://github.com/THUSI-Lab/Causal-Reasoner
基于参考引导深度压缩VAE的流式说话人肖像视频实时生成
机构 * Microsoft Research(微软研究院) ; Microsoft AI(微软人工智能)
AI总结 提出一种结合因果视频VAE和自回归潜在去噪模型的流式说话人肖像视频生成框架,通过参考图像引导实现实时高质量生成。
Comments CVPR 2026 (Highlight) Camera ready
用于检索增强推理的差分隐私数据存储生成
机构 * Department of Computer and Systems Engineering, Alexandria University(计算机与系统工程系,亚历山大大学) ; Microsoft(微软)
AI总结 提出基于哈希的概率生成框架,利用局部敏感哈希和差分隐私噪声实现数据存储的隐私保护,在ε=5时准确率仅下降2.6%,并将成员推断攻击准确率降至53.60%。
Comments Accepted at the 28th International Conference on Pattern Recognition (ICPR-2026)
大规模针尖:LLM辅助的Windows漏洞研究目标选择
机构 * Microsoft(微软) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出Symbolicate-Enrich-Sample流水线,通过符号恢复、结构特征提取和低成本语言模型排序,从Windows系统数千万函数中筛选出约2.2万个候选目标,解决漏洞研究中目标选择瓶颈问题。
Comments 9 pages, 3 figures, 2 tables
TukaBench: 一个基于文化的非洲语言越狱基准
机构 * Mila - Quebec AI Institute(魁北克人工智能研究院) ; McGill University(麦吉尔大学) ; Microsoft AI for Good Research Lab(微软人工智能造福人类研究实验室) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
AI总结 针对大型语言模型在非洲低资源语言上的安全评估缺失,提出TUKABENCH基准,通过四种设置(直接翻译、文化适应翻译、人工策划提示、代码切换提示)评估语言、文化背景和提示规避性对模型安全的影响,发现非洲语言提示降低拒绝率,并引入Deflection指标和人工验证以解决模型理解失败和评判可靠性问题。
Comments Under review
低秩矩阵的Hadamard积的黎曼优化
机构 * Centre for Machine Intelligence and Data Science, Indian Institute of Technology Bombay, India(机器智能与数据科学中心,印度班加罗尔理工学院,印度) ; Microsoft India(微软印度)
AI总结 针对低秩矩阵Hadamard积因子的耦合缩放对称性,提出一种基于黎曼商流形的块对角度量,并开发了线性复杂度的梯度下降算法。
迈向交互式视频世界建模:前沿、挑战、基准与未来趋势
机构 * Department of Engineering, University of Cambridge, U.K.(剑桥大学工程系) ; Peking University(北京大学) ; University of Twente(埃因霍温理工大学) ; Mechanical Systems Control Laboratory, University of California, Berkeley, USA(加州大学伯克利分校机械系统控制实验室) ; ETH Zurich(苏黎世联邦理工学院) ; Microsoft(微软公司) ; University of Oxford(牛津大学)
AI总结 本文系统综述了交互式世界建模的研究趋势、技术挑战、评估基准,并提出了未来方向,重点在于动作条件可控性、长程交互与记忆以及实时响应性。
Comments Under review. The GitHub repository is publicly available at: https://github.com/liujiuming123/Awesome-Interactive-World-Model
修正而非冻结:面向自修正掩码扩散语言模型的采样器匹配训练
机构 * University of California, Riverside(加州大学河滨分校) ; Microsoft(微软)
AI总结 针对掩码扩散语言模型在去噪过程中未利用可见标记修正能力的问题,提出无需额外模块的采样器D3IM和轻量级后训练方法SCOPE,显著提升数学和代码生成性能。
Comments 8 pages, 2 figures, 10 tables
DSL-LLaDA: 将连续去噪扩展到8B掩码扩散语言模型
机构 * University of California, Riverside(加州大学河滨分校) ; Georgia Institute of Technology(佐治亚理工学院) ; Microsoft(微软)
AI总结 通过离散随机定位(DSL)将预训练掩码扩散语言模型(LLaDA-8B-Instruct)轻量适配为支持连续嵌入空间去噪,在低步数下实现高质量摘要生成并避免长度-质量权衡。
Comments 8 pages, 4 figures, 28 tables
对齐的辩证法:利用不安全知识实现动态安全路由
机构 * Chandar Research Lab(Chandar研究实验室) ; Mila – Quebec AI Institute(魁北克AI研究所) ; Université de Montréal(蒙特利尔大学) ; Microsoft Research(微软研究院) ; Polytechnique Montréal(蒙特利尔理工学院) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
AI总结 提出SafeMoE框架,通过混合专家模型将不安全知识隔离到领域特定的低秩适配器中,并训练轻量级门控网络动态路由这些专家,在保持安全性的同时生成信息丰富的响应。
基于广义瑞利商优化的基础模型保留适配
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Microsoft(微软) ; Microsoft AI(微软人工智能) ; Meta
AI总结 提出FoLoRA框架,通过广义瑞利商优化更新方向,在微调中平衡下游任务性能与预训练能力保留。
SPARROW项目与保护技术的未来
机构 * Microsoft AI for Good Lab(微软AI for Good实验室) ; Universidad de los Andes(andes大学) ; University of Maryland(马里兰大学)
AI总结 提出SPARROW开源平台,通过集成太阳能、边缘AI和卫星通信,实现偏远地区连续自主的生物多样性监测,并在多国部署验证其鲁棒性和可扩展性。
从人类视频到机器人操作:基于人类中心数据的可扩展视觉-语言-动作学习综述
机构 * Tsinghua University(清华大学) ; HKUST(香港科技大学) ; Xi’an Jiaotong University(西安交通大学) ; Fudan University(复旦大学) ; Microsoft Research Asia(微软亚洲研究院) ; Peking University(北京大学) ; Microsoft Zurich Project(微软苏黎世实验室)
AI总结 本文综述了如何将丰富的人类视频转化为视觉-语言-动作(VLA)模型的有效知识,分类了四种方法(潜在动作表示、预测世界模型、显式2D监督、显式3D重建),并指出了结构化非结构化视频、跨具身和视角的动作映射、以及评估协议设计三大挑战。
Comments Accepted to IJCAI 2026 Survey Track. Project page: https://aaronfengzy.github.io/HumanCentricToVLA-Survey/
超越静态对话:对现实、异构和演化长期记忆的基准测试
机构 * Center for Applied Statistics, Renmin University of China(中国人民大学应用统计中心) ; School of Statistics, Renmin University of China(中国人民大学统计学院) ; Microsoft(微软公司)
AI总结 针对现有大语言模型记忆基准中对话缺乏长期语义一致性、人物静态化以及忽视异构数据流的问题,提出RHELM基准,通过用户画像和LOOP模块生成具有动态时间演化和长期连贯性的现实对话,并整合异构外部源,评估模型在多源聚合和现实上下文推理方面的能力。
FrontierOR:基准测试大语言模型在大规模优化中高效算法设计的能力
机构 * Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联盟研究技术) ; Massachusetts Institute of Technology(麻省理工学院) ; Northeastern University(东北大学) ; Uber ; Shanghai Jiaotong University(上海交通大学) ; Boston University(波士顿大学) ; Emory University(埃默里大学) ; Northwestern University(西北大学) ; National University of Singapore(国立新加坡大学) ; Microsoft(微软) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Singapore Management University(新加坡管理学院)
AI总结 提出FrontierOR基准,系统评估大语言模型在现实大规模优化问题中设计可扩展算法(而非仅生成求解器代码)的能力,发现最强模型仅在31%案例中优于Gurobi。
一种具有代理控制的高效流式视频理解框架
机构 * Shanghai Jiao Tong University(上海交通大学) ; Eastern Institute of Technology, Ningbo, China(宁波工程技术学院) ; Microsoft Research Asia(微软亚洲研究院)
AI总结 提出R3-Streaming框架,通过级联控制(记忆压缩、响应判断、计算路由)和年龄感知遗忘策略及目标平衡强化学习(TB-GRPO),在严格延迟预算下实现流式视频理解,性能达到SOTA并减少95-96%视觉令牌使用。
超球面流语言建模
机构 * EPFL(苏黎世联邦理工学院) ; Microsoft AI(微软人工智能)
AI总结 提出一种在超球面潜空间中进行连续流语言建模的方法 S-FLM,通过旋转向量和交叉熵学习速度场,避免独热向量开销,在大型词汇推理任务上显著提升性能,缩小了与掩码扩散模型的差距。
基于同伴成功与失败的多轨迹在线策略蒸馏
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软) ; Purdue University(普渡大学)
AI总结 提出多轨迹在线策略蒸馏(MOPD),利用学生模型的本地轨迹组构造更丰富的教师信号,通过同伴成功与失败条件化提升蒸馏效果。
Comments 23 pages
群体分布鲁棒优化神经元的鲁棒学习
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Microsoft Research, Cambridge(微软研究院,剑桥)
AI总结 针对任意标签噪声和群体级分布偏移,提出一种计算高效的原对偶算法,学习一个单神经元,使其在最小化最坏情况群体加权损失时达到常数因子竞争比。