arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-08-27 至 2026-08-27 共收录 10
2608.25977 2026-08-27 cs.CL 新提交

When Personality Meets Quantization: A Layer-wise MBTI Analysis of Quantized LLMs

当人格遇见量化:量化大语言模型的分层MBTI分析

Yao Fu, Lijia Huang, Xiaomin Li, Runchao Li, Yu Yin, Kenneth A. Loparo

机构 * Case Western Reserve University(凯斯西储大学) Northeastern University(东北大学) Microsoft Research(微软研究院)

AI总结 本研究对跨多种精度(含4位、2位方法)的开源LLM进行分层MBTI分析,揭示LLM人格是依赖层的涌现决策过程,量化、解码会影响其人格,为量化LLM行为可靠性提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25881 2026-08-27 cs.CL 新提交

Loss-Based Active Learning for Neural Abstractive Summarization

基于损失的神经抽象摘要生成主动学习

Michail Ioannou, Tatiana Passali, George Michalopoulos, Grigorios Tsoumakas

机构 * School of Informatics(信息学院) Aristotle University of Thessaloniki(亚里士多德塞萨洛尼基大学) Microsoft(微软公司)

AI总结 针对神经抽象摘要生成标注数据获取成本高的问题,提出LOBSTER主动学习框架,在三个数据集和两个模型上验证其性能优于或相当SOTA,且查询选择速度最高提升665倍

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25756 2026-08-27 cs.LG cs.AI 新提交

TailSFT: Filtered Fine-Tuning Improves Post-Training Performance

TailSFT:过滤式微调提升后训练性能

Sadhika Malladi, Samy Jelassi, Dylan Foster, Jordan T. Ash, Akshay Krishnamurthy

机构 * University of California San Diego(加州大学圣迭戈分校) Microsoft Research NYC(微软研究院纽约分部)

AI总结 本文提出TailSFT过滤式微调算法,可提升模型后强化学习性能,在OLMo-3 7B上数学与代码评估pass@16最高提17%,后续GRPO的pass@1最高提4%,还引入轻量诊断方法识别适用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25729 2026-08-27 cs.CV 新提交

LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding

LongVU-TTT:用于长视频理解中视觉重采样的因果测试时训练方法

Mahmoud Ahmed, Sameh Abdulah, Olatunji Ruwase, Sam Ade Jacobs, Mathis Bode, Mohamed Elhoseiny

机构 * KAUST(阿卜杜拉国王科技大学) Snowflake(雪花公司) Microsoft Inc.(微软公司) Jülich Supercomputing Centre, Forschungszentrum Jülich(于利希研究中心于利希超级计算中心)

AI总结 LongVU-TTT在视觉编码器与LLM间插入带因果快速权重更新的卷积TTT重采样器,通过混合选择器保留帧证据,在五个视频理解基准测试中性能具竞争力,较多种基线方法有明显提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25168 2026-08-27 cs.CV cs.MM 新提交

See More, Detect Less? Taming Information Leakage in Multi-View Anomaly Detection

看得更多,检测得更少?抑制多视图异常检测中的信息泄漏

Shang-Fu Chen, Kuan-Chuan Peng, Jhih-Ciang Wu, Wen-Huang Cheng, Kai-Lung Hua

机构 * National Taiwan University(台湾大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室) National Taiwan Normal University(台湾师范大学) VinUniversity Microsoft Taiwan Corporation(微软台湾公司) National Taiwan University of Science and Technology(台湾科技大学)

AI总结 该研究针对多视图异常检测中的跨视图信息泄漏问题,提出GLAD框架,结合视觉基础模型特征与MMA、OGA模块,在Real-IAD等数据集上优于现有最优方法,证实信息限制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23831 2026-08-27 cs.RO cs.LG 版本更新

Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency

等待时学习行动:考虑推理延迟的通用机器人策略的强化学习微调

Brian Zhu, Momen Khalil, E Harrison, Emanuele Poggi, Philipp Schmitt, Bernd Kast, Philine Meister, Pranav Atreya, Qiyang Li, Finn Ferchau, Cesar Colmenero, Yash Shahapurkar, Gokul Narayanan, Melih Erdogan, Kai Wurm, Georg von Wichert, Oier Mees, Eugen Solowjow, Andrew Wagenmaker, Sergey Levine

机构 * Siemens(西门子) UC Berkeley(加州大学伯克利分校) Microsoft(微软) ETH Zurich(苏黎世联邦理工学院)

AI总结 本研究针对通用机器人策略因推理延迟破坏马尔可夫假设导致标准RL失效的问题,提出ARLI框架,通过状态增强等设计实现延迟下的RL微调,在模拟及真实任务中表现优异。

Comments 25 pages, 12 figures, project website: https://async-rl-intermediate-information.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19583 2026-08-27 cs.CV cs.AI 版本更新

VGI-Bench: Probing Visual Intelligence in Video Generation Models

VGI-BENCH:探究视频生成模型的视觉智能

Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Massachusetts Institute of Technology(麻省理工学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所) Microsoft Research(微软研究院) Etude AI

AI总结 本研究推出VGI-bench基准,含27项任务810个实例,评估视频生成模型视觉推理能力,发现最强模型Seedance~2.0仅达51.0%,将推动下一代视频生成模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-08-27 cs.AI 版本更新

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2026, pp. 25374-25391

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15987 2026-08-27 cs.LG cs.AI 版本更新

AlgoTrace: Algorithmic Primitives and Compositional Geometry of Reasoning in Language Models

语言模型中推理的算法原语与组合几何

Samuel Lippl, Thomas McGee, Kimberly Lopez, Ziwen Pan, Pierce Zhang, Salma Ziadi, Oliver Eberle, Ida Momennejad

机构 * Microsoft Research NYC(微软研究院纽约分部) Center for Theoretical Neuroscience(理论神经科学中心) Department of Psychology(心理学系) University of California Los Angeles(加州大学洛杉矶分校) Institute for Pure and Applied Mathematics(纯粹与应用数学研究所) Emory University(埃默里大学) Rice University(里士满大学) Mount Holyoke College(马里兰霍克学院) Technische Universität Berlin(柏林技术大学) BIFOLD-Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

AI总结 研究通过分析语言模型中的算法原语,揭示其推理过程的组合几何结构,并展示原语在跨任务和跨模型中的可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13579 2026-08-27 cs.LG cs.AI 版本更新

Learning to summarize user information for personalized reinforcement learning from human feedback

学习总结用户信息以实现基于人类反馈的个性化强化学习

Hyunji Nam, Yanming Wan, Mickel Liu, Peter Ahnn, Jianxun Lian, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) DoorDash Microsoft Research Asia(微软亚洲研究院)

AI总结 PLUS通过学习用户信息摘要实现个性化强化学习,提升奖励模型准确性并实现零样本个性化。

Comments ICLR 2026; 10 pages for main text

详情

展开后加载摘要…

URL PDF HTML 收藏