arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-08-25 至 2026-08-25 共收录 9
2608.23172 2026-08-25 cs.CL cs.CV 新提交

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

CaRGo-T:因果推理思维图提升多模态幽默理解能力

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

机构 * Microsoft Research India(微软研究院印度分部) LinkedIn(领英公司) Nutanix(Nutanix公司) Indian Institute of Science(印度科学学院) Apple(苹果公司) Fujitsu Research India(富士通印度研究院) Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)

AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23041 2026-08-25 cs.AI cs.CL cs.LG cs.MA cs.SE 新提交

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces

AutoSaddler:基于智能体执行轨迹的持久化更新的自动工具优化

Sungho Park, Wonjoong Kim, Rongyuan Tan, Jue Zhang, Wook-Shin Han, Pengfei Gao, Chanyoung Park, Yongqiang Yao, Rao Fu, Elsie Nallipogu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * KAIST(韩国科学技术院) Southern University of Science and Technology(南方科技大学) Microsoft(微软) POSTECH(浦项科技大学)

AI总结 AutoSaddler是基于智能体执行轨迹的自动工具优化框架,通过离线学习结合故障诊断等技术,在多个基准上提升智能体性能9.0-10.0个百分点,为构建更可靠的智能体系统提供了新方向。

Comments 44 pages, 15 figures. Project website and code: https://aka.ms/AutoSaddler-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21606 2026-08-25 cs.CL 新提交

Can LLMs Truly Forget? Revealing Unlearning Gaps Through Adversarial Evaluation

大语言模型(LLMs)真的能遗忘吗?通过对抗性评估揭示遗忘差距

Ayush Gupta, Hima Varshini Surisetty, Sreevidya Bollineni, Varad Ingale, Tuhina Tripathi, Abhishek Lalwani, Somya Chatterjee, Sadid Hasan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Microsoft Corporation(微软公司)

AI总结 本研究针对TOFU数据集和Llama-3.2-3B-Instruct模型,引入ASR指标评估遗忘方法,发现标准指标表现优异的遗忘方法仍存在高对抗恢复风险,提出需补充对抗性压力测试作为遗忘评估的必要部分。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21412 2026-08-25 cs.AI cs.DC cs.NI 新提交

The Abstention Protocol: RCA for Clos Fabrics

弃权协议:面向Clos Fabric的根本原因分析(RCA)

Madhava Gaikwad, Deepak Pandey

机构 * Microsoft(微软公司)

AI总结 针对大型数据中心网络RCA的挑战,提出带PAM风格弃权代数的CoreSec系统,结合拓扑感知配置实现稳定可解释的RCA,无需重新调优,可用于超大规模云网络。

Comments Presented at Usenix OSDI 2026. 17 pages, 5 figures, 4 tables

Journal ref 20th USENIX Symposium on Operating Systems Design and Implementation (OSDI 26), Seattle, WA, July 2026, pp. 405-421

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19583 2026-08-25 cs.CV cs.AI 版本更新

VGI-Bench: Probing Visual Intelligence in Video Generation Models

VGI-BENCH:探究视频生成模型的视觉智能

Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Massachusetts Institute of Technology(麻省理工学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所) Microsoft Research(微软研究院) Etude AI

AI总结 本研究推出VGI-bench基准,含27项任务810个实例,评估视频生成模型视觉推理能力,发现最强模型Seedance~2.0仅达51.0%,将推动下一代视频生成模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22342 2026-08-25 cs.CL 版本更新

How Does Research Evolve? Tracing Cross-Domain Trajectories in NLP, ML, and CV Through Claim-Grounded Typed Citations

研究如何演化?基于主张的类型化引文追踪 NLP、ML 和 CV 中的跨领域轨迹

Abdul Muntakim, Md Abdullah Al Hafiz Khan, Sadid Hasan, Yong Pei

机构 * Kennesaw State University(肯尼索州立大学) Microsoft(微软)

AI总结 提出 SciTraj 语料库,通过构建类型化引文图(6种关系、32k论文、573k边)追踪 NLP/ML/CV 领域的研究演化,支持跨领域轨迹分析和链接预测基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01063 2026-08-25 cs.AI 版本更新

MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention

MindClaw: 用于精确干预的闭环具身心理状态推理

Ruoxuan Zhang, Qiaoqiao Wan, Zhengguang Wang, Chenghao Yu, Hongxia Xie, Wen-Huang Cheng, Jianlong Fu

机构 * Jilin University(吉林大学) Microsoft Asia(微软亚洲) National Taiwan University(国立台湾大学)

AI总结 提出MindClaw框架,通过闭环具身心理状态推理实现精确干预,结合多源输入、信念记忆、认知触发技能和动作生成,在动态环境中优化干预时机。

Comments Extended version of the CVPR 2026 paper *MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents*. This work is in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10488 2026-08-25 cs.CL cs.AI 版本更新

DeepRefine: Agentic Knowledge Refinement via Reinforcement Learning

DeepRefine: 通过强化学习进行代理编译知识的精炼

Haoyu Huang, Jiaxin Bai, Shujie Liu, Yang Wei, Huihao Jing, Hong Ting Tsang, Yisen Gao, Zhongwei Xie, Yufei Li, Yangqiu Song

机构 * HKUST(香港科技大学) HKBU(香港大学) Microsoft Research Asia Hong Kong(微软亚洲研究院(香港))

AI总结 DeepRefine是一种基于LLM的推理模型,通过用户查询提升预构建知识库的质量,以适应下游任务。该模型通过多轮交互和归纳诊断定位缺陷并进行针对性精炼,采用Gain-Beyond-Draft奖励机制进行强化学习训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13433 2026-08-25 cs.RO cs.AI

Spatially Grounded Long-Horizon Task Planning in the Wild

在真实环境中进行具有长时域的任务规划

Sehun Jung, HyunJee Song, Dong-Hee Kim, Reuben Tan, Jianfeng Gao, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) Microsoft Research(微软研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出了一种基于空间的规划任务,引入了GroundedPlanBench基准,评估机器人在真实环境中的长时域动作规划能力,并通过V2GP框架提升空间接地规划性能。

Comments 9 pages, 7 figures

Journal ref 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏