arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Microsoft(微软)

2026-06-01 至 2026-06-01 共收录 9
2605.31349 2026-06-01 cs.CL cs.AI cs.CV cs.MM

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

FBHM:用于仇恨模因检测的功能性基准测试与视觉语言模型引导

Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)卡拉格浦尔) Microsoft(微软)

AI总结 针对现有基准无法因果评估视觉语言模型漏洞的问题,提出基于25种修辞功能和10个目标社区构建的FBHM基准,并采用可学习引导向量(LSV)在极低数据量下提升模型性能约30个Macro-F1点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31175 2026-06-01 cs.CL

Towards Efficient LLMs Annealing with Principled Sample Selection

迈向基于原则性样本选择的高效LLM退火

Yuanjian Xu, Jianing Hao, Wanbo Zhang, Zhong Li, Guang Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文通过损失景观的谱几何特性,将退火阶段的数据选择建模为有约束优化问题,提出DiReCT框架,利用Hessian谱对梯度施加方向约束,实现高效样本选择,显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31164 2026-06-01 cs.CL cs.AI

D$^3$: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training

D$^3$: 面向LLM训练的动态有向图约束数据调度

Yuanjian Xu, Jianing Hao, Guang Zhang, Zhong Li

机构 * Microsoft Research(微软研究院)

AI总结 提出D$^3$框架,通过动态有向图建模训练单元间的有向影响关系,并求解约束优化问题以确定训练顺序,从而提升LLM预训练和后训练阶段的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31063 2026-06-01 stat.ML cs.LG physics.chem-ph physics.comp-ph

Free energy Estimation on Any State Space

任意状态空间上的自由能估计

Jiajun He, Zijing Ou, Francisco Vargas, Yingzhen Li, José Miguel Hernández-Lobato, Carles Domingo-Enrich, Yuanqi Du

机构 * University of Cambridge(剑桥大学) Imperial College London(伦敦帝国理工学院) Xaira Therapeutics(Xaira制药) Microsoft Research New England(微软研究院新英格兰分部)

AI总结 提出一种基于广义神经传输学习的框架,将自由能估计推广到任意状态空间,并揭示时间反演与Doob h-变换的群论结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30893 2026-06-01 cs.CV

Foundation VAEs for 3D CT Reconstruction, Augmentation, and Generation

用于3D CT重建、增强和生成的基础VAE

Qi Chen, Shuhan Ding, Yu Gu, Nan Liu, Jiang Bian, Alan Yuille, Zongwei Zhou, Jingjing Fu

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Duke-NUS Medical School(duke-nus 医学院) Microsoft Research(微软研究院)

AI总结 本文发现,在自然图像上预训练的基础VAE可直接用于CT重建、增强和生成,无需训练或微调,通过冻结编解码器实现解剖结构保留和噪声抑制,并在分割和生成任务上取得显著提升。

Comments ICML 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30792 2026-06-01 eess.AS cs.AI

OpenSTBench: Beyond Semantic Evaluation for Speech Translation

OpenSTBench:超越语义评估的语音翻译

Yanjie An, Yuxiang Zhao, Yichi Zhang, Qixi Zheng, Yujie Tu, Keqi Deng, Kai Yu, Xie Chen

机构 * MoE Key Lab of Artificial Intelligence(摩埃人工智能关键实验室) Jiangsu Key Lab of Language Computing(江苏语言计算重点实验室) X-LANCE Lab(X-LANCE实验室) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) Microsoft(微软) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 提出OpenSTBench统一多维评估框架,联合评估语音翻译系统的翻译质量、语音质量、时间一致性等,揭示系统间跨维度差异。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30685 2026-06-01 cs.CY cs.AI cs.CL cs.HC

How Early Adopters Used Generative AI Worldwide: Variation by Country Income and Language

早期采用者如何在全球范围内使用生成式AI:按国家收入和语言的差异

Madeleine I. G. Daepp, Isaac Slaughter

机构 * Microsoft AI Economy Institute(微软人工智能经济研究所)

AI总结 基于大规模匿名化AI聊天机器人交互数据,实证分析了不同国家早期采用者在使用生成式AI上的差异,发现教育用途在低收入国家更普遍,休闲用途与收入正相关,且英语交互在非英语主导国家中过度代表,表明语言性能改进可能影响数字鸿沟或跨越式发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07457 2026-06-01 cs.SE cs.AI cs.CL

Pull Requests as a Training Signal for Repo-Level Code Editing

拉取请求作为仓库级代码编辑的训练信号

Qinglin Zhu, Tianyu Chen, Shuai Lu, Lei Ji, Runcong Zhao, Murong Ma, Xiangxiang Dai, Yulan He, Lin Gui, Peng cheng, Yeyun Gong

机构 * King's College London, UK(伦敦国王学院) Chinese University of Hong Kong, HK(香港中文大学) National University of Singapore, SG(新加坡国立大学) Microsoft Research Asia, CN(微软亚洲研究院) The Alan Turing Institute, UK(艾伦·图灵研究所)

AI总结 提出Clean-PR方法,利用真实GitHub拉取请求作为训练信号,通过重建和验证转换为搜索/替换编辑块,结合无代理对齐的监督微调,在SWE-bench上显著提升仓库级代码编辑性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20853 2026-06-01 eess.AS cs.CL cs.SD

Beyond Hearing: Learning Task-Agnostic ExG Representations from Earphones via Physiology-Informed Tokenization

超越听觉:通过生理学启发的标记化从耳机学习任务无关的ExG表示

Hyungjun Yoon, Seungjoo Lee, Yu Yvonne Wu, Xiaomeng Chen, Taiting Lu, Freddy Yifei Liu, Taeckyung Lee, Hyeongheon Cha, Haochen Zhao, Gaoteng Zhao, Dongyao Chen, Cecilia Mascolo, Sung-Ju Lee, Lili Qiu

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) UCLA(加州大学洛杉矶分校) Northwest University(北华大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

AI总结 提出一种基于耳机的生理学启发的多频带标记化方法(PiMT),通过无干扰的日常ExG数据采集和重建任务学习鲁棒表示,实现跨多种任务(包括五种人类感官)的通用ExG监测。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏