arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-09-01 至 2026-09-01 共收录 13
2608.23172 2026-09-01 cs.CL cs.CV 版本更新

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

CaRGo-T:因果推理思维图提升多模态幽默理解能力

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

机构 * Microsoft Research India(微软研究院印度分部) LinkedIn(领英公司) Nutanix(Nutanix公司) Indian Institute of Science(印度科学学院) Apple(苹果公司) Fujitsu Research India(富士通印度研究院) Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)

AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19741 2026-09-01 cs.CL cs.DB 版本更新

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

单次成功并非可靠:Thinkingbox——面向有状态业务工作流智能体的沙箱与基准测试集

Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy

机构 * University of Pittsburgh(匹兹堡大学) Northwestern University(西北大学) University of California Irvine(加州大学欧文分校) Microsoft(微软公司)

AI总结 研究人员推出面向有状态业务工作流智能体的沙箱Thinkingbox及基准测试集Thinkingbox-bench,发现现有智能体在该基准上可靠完成任务的表现远逊于单次成功表现,凸显了端到端任务可靠评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17790 2026-09-01 cs.CV cs.AI 版本更新

ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video

ReViV:从单目自我中心视频中重建4D中的观看者和视图

Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院) Delft University of Technology(代尔夫特理工大学) Microsoft(微软)

AI总结 研究旨在从单目自我中心视频重建4D中的观看者和视图,提出ReViV框架,将任务建模为学习多模态信号联合概率分布,由掩码生成自我中心变压器驱动,在多基准测试中展现出高精度和效率,还保持了竞争力强的自我中心深度估计,且代码模型开源。

Comments Accepted to ECCV 2026. The first two authors contributed equally, and their author order is interchangeable

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05922 2026-09-01 cs.AI cs.CL cs.LG 版本更新

Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference

回顾性工具优化:通过轨迹回滚上的自我偏好改进LLM智能体

Wenbo Pan, Shujie Liu, Chin-Yew Lin, Jingying Zeng, Xianfeng Tang, Xiangyang Zhou, Yan Lu, Xiaohua Jia

机构 * City University of Hong Kong(香港城市大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 提出一种自监督方法RHO,利用历史轨迹回滚和自偏好选择优化智能体工具集,无需真实标签,在SWE-Bench Pro上通过单轮优化将通过率从59%提升至78%。

Comments Accepted to EMNLP 2026 (Findings). Code: this https URL (https://github.com/wbopan/retro-harness); Project website: this https URL (https://paper-rho.wenbo.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01216 2026-09-01 cs.LG math.OC 版本更新

Riemannian Optimization for Hadamard Products of Low-Rank Matrices

低秩矩阵的Hadamard积的黎曼优化

Pratik Jawanpuria, Ankish Chandresh, Bamdev Mishra

机构 * Centre for Machine Intelligence and Data Science, Indian Institute of Technology Bombay, India(机器智能与数据科学中心,印度班加罗尔理工学院,印度) Microsoft India(微软印度)

AI总结 针对低秩矩阵Hadamard积因子的耦合缩放对称性,提出一种基于黎曼商流形的块对角度量,并开发了线性复杂度的梯度下降算法。

Comments Added second-order discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31349 2026-09-01 cs.CL cs.AI cs.CV cs.MM 版本更新

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

FBHM:用于仇恨模因检测的功能性基准测试与视觉语言模型引导

Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)卡拉格浦尔) Microsoft(微软)

AI总结 针对现有基准无法因果评估视觉语言模型漏洞的问题,提出基于25种修辞功能和10个目标社区构建的FBHM基准,并采用可学习引导向量(LSV)在极低数据量下提升模型性能约30个Macro-F1点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26872 2026-09-01 cs.LG cs.AI cs.CL 版本更新

When the Strongest Teacher Is Not the Best Teacher: Student-Centric Answer Selection

最强的教师并不总是最好的教师:以学生为中心的答案选择

Zhengyu Hu, Zheyuan Xiao, Linxin Song, Fengqing Jiang, Yuetai Li, Zhihan Xiong, Yue Liu, Junhao Lin, Yao Su, Lijie Hu, Kaize Ding, Teng Xiao, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Southern California(南加州大学) Independent Researcher(独立研究者) National University of Singapore(新加坡国立大学) Microsoft(微软) Google(谷歌) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Northwestern University(西北大学) Allen Institute for AI (AI2)(人工智能研究院(AI2))

AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29018 2026-09-01 cs.AI cs.CL 版本更新

Adopt $\neq$ Adapt: Longitudinal Analyses of LLM Conversations in the Wild

采用 ≠ 适应:野外LLM对话的纵向分析

Rebecca M. M. Hicke, Kiran Tomlinson

机构 * Cornell University(康奈尔大学) Microsoft Research(微软研究院)

AI总结 通过分析约12,000名Microsoft Bing Copilot用户的对话轨迹及WildChat-4.8M数据,发现用户行为高度固化,活跃用户更倾向复杂专业任务,且WildChat数据集偏向高熟练度“超级用户”,表明现有用户行为难以改变并揭示用户异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13318 2026-09-01 cs.AI cs.CL 版本更新

WebXSkill: Skill Learning for Autonomous Web Agents

WebXSkill:自主网页代理的技能学习

Zhaoyang Wang, Qianhui Wu, Xuchao Zhang, Chaoyun Zhang, Wenlin Yao, Fazle Elahi Faisal, Baolin Peng, Si Qin, Suman Nath, Qingwei Lin, Chetan Bansal, Dongmei Zhang, Saravan Rajmohan, Jianfeng Gao, Huaxiu Yao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft(微软)

AI总结 WebXSkill通过可执行技能框架解决自主网页代理在长周期任务中的执行与适应问题,提升任务成功率。

Comments Accepted to Findings of EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03471 2026-09-01 cs.CL cs.AI 版本更新

EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning

EpiQAL:大型语言模型在流行病学问答与推理中的基准测试

Mingyang Wei, Dehai Min, Zewen Liu, Yuzhang Xie, Guanchen Wu, Ziyang Zhang, Carl Yang, Max S. Y. Lau, Qi He, Lu Cheng, Wei Jin

机构 * Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Microsoft(微软公司)

AI总结 提出EpiQAL基准,通过三个子集(事实回忆、多步推理、不完整信息下结论重建)评估LLM在流行病学推理中的表现,发现当前模型在多步推理上表现有限。

Comments Accepted to EMNLP 2026 Main Conference. 35 pages, 5 figures, 31 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17690 2026-09-01 cs.GR cs.AI cs.CV cs.LG cs.MM 版本更新

DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation

DesignAsCode:在图形设计生成中弥合结构可编辑性与视觉保真度

Ziyuan Liu, Shizhao Sun, Danqing Huang, Yingdong Shi, Meisheng Zhang, Ji Li, Jingsong Yu, Jiang Bian

机构 * School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国) Microsoft(微软公司) ShanghaiTech University, Shanghai, China(上海交通大学,上海,中国)

AI总结 DesignAsCode 通过 HTML/CSS 程序化合成方法,实现了图形设计生成中结构可编辑性与视觉保真度的平衡,提升了设计质量和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02475 2026-09-01 cs.AI 版本更新

AgentRx: Diagnosing AI Agent Failures from Execution Trajectories

AgentRx: 从执行轨迹诊断AI代理故障

Shraddha Barke, Arnav Goyal, Alind Khare, Avaljot Singh, Suman Nath, Chetan Bansal

机构 * Microsoft Research(微软研究院) Microsoft(微软)

AI总结 AgentRx通过自动化诊断框架,从执行轨迹中定位AI代理的关键故障步骤,并提升跨领域的故障归因能力。

Comments Accepted to EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06953 2026-09-01 cs.CL cs.LG 版本更新

X-Coder: Advancing Competitive Programming with Synthetic Tasks, Solutions, and Tests

X-Coder:通过完全合成任务、解决方案和测试推进竞争性编程

Jie Wu, Haoling Li, Xin Zhang, Jiani Guo, Jane Luo, Xuewei Yang, Steven Liu, Yangyu Huang, Ruihang Chu, Scarlett Li, Yujiu Yang

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院) Wuhan University(武汉大学)

AI总结 X-Coder通过完全合成数据提升竞争性编程模型性能,采用领域特定进化和双验证策略,在LiveCodeBench上取得显著成果。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏