arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-07-08 至 2026-07-08 共收录 5
2607.06196 2026-07-08 cs.CL cs.CY 新提交

Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability

Pluralis v0.1:迈向用于人工智能风险与可靠性的多元文化、多模态、多语言基准测试

Alicia Parrish, Rajat Shinde, Sanket Badhe, Xinyi Bai, Sree Bhargavi Balija, Hua-Rong Chu, Emilio Ferrara, Armstrong Foundjem, Rajat Ghosh, Aakash Gupta, Xuanli He, Ong Chen Hui, Minji Jung, Madhangi Karimanal, Faiza Khan Khattak, Boryoung Kim, Eugenia Kim, Liliya Lavitas, Seok Min Lim, Victor Lu, Jim Moirangthem, Dhivya Nagasubramanian, Deepak Pandita, Sita Rajagopal, Geetha Raju, Evgeniia Razumovskaia, Aravind Reddy, Federico Ricciuti, Nobin Sarwar, Sungpil Shin, Sunayana Sitaram, Snehal Thorat, Tharindu Cyril Weerasooriya, Jasmijn Bastings, Joachim Baumann, Kongtao Chen, Murali Emani, Mariya Hendriksen, Jiho Jin, Jun Seong Kim, Younghoon Ko, Alicja Kwasniewska, Minjae Lee, Tom Wei-cyuan Lin Kashyap Ramanandula Manjusha, Junho Myung, Junyeong Park, Roma Patel, Shyam Ratan, Sudarsun Santhiappan, Priyanka Suresh, Tuesday, Ksheeraj Sai Vepuri Laura Amortegui-Ordonez, Claire Dennis, Minsuk Kahng, Chris Knotz, Alice Oh, Balaraman Ravindran, Soojung Ryu William Bartholomew, Hiwot Tesfaye, Lora Aroyo

机构 * Google DeepMind(谷歌DeepMind) University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校) Google(谷歌) University of Missouri Columbia(密苏里大学哥伦比亚分校) Chunghwa Telecom Laboratories(春木电信实验室) University of Southern California(南加州大学) Polytechnique Montreal(蒙特利尔理工学院) Nutanix ThinkEvolve Labs(ThinkEvolve实验室) UCL(伦敦大学学院) Infocomm Media Development Authority(信息通信媒体发展局) Monark Health(Monark健康) Seoul National University(首尔国立大学) Microsoft(微软) Centre for Responsible AI (CeRAI), Wadhwani School of Data Science and AI (WSAI), Indian Institute of Technology Madras(负责任人工智能中心(CeRAI)、瓦达威人工智能学校(WSAI)、印度理工学院马德拉斯分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Microsoft Research India(微软印度研究院) Stanford University(斯坦福大学) Argonne National Laboratory(阿贡国家实验室) University of Oxford(牛津大学) KAIST(韩国科学技术院) Yonsei University(延世大学) Amazon(亚马逊) UIUC(伊利诺伊大学香槟分校) Rochester Institute of Technology(罗切斯特理工学院) Xenoscube Inc.(Xenoscube公司) Korea AI Safety Institute (K-AISI)(韩国人工智能安全研究所(K-AISI)) MLCommons CommonGround Artifex Labs(Artifex实验室)

AI总结 研究针对现有AI安全评估框架忽视文化差异问题,构建多语言多模态数据集Pluralis v0.1,从文化优先视角引入新评估范式,提出Judge - Pluralis集成,揭示特定地区失败模式,为多语言多元文化评估提供基础和创新起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05531 2026-07-08 cs.LG cs.CV 新提交

$\mathbfλ$-VAE: Variance Equalization for Posterior Collapse

λ-VAE:后验坍缩的方差均衡

Girum Demisse

机构 * Microsoft African Development Center(微软非洲开发中心)

AI总结 研究变分自编码器后验坍缩问题,确定梯度不平衡和信息差距两个原因。提出λ-VAE,通过修改重参数化步骤解决问题,实现方差均衡。经标准基准验证,能减少坍缩维度、提升信息容量和重建质量。

Comments 21 total pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05645 2026-07-08 cs.LG physics.ao-ph 新提交

Domain-Adaptive Climate Downscaling Under Temporal Distribution Shift

时间分布变化下的域自适应气候降尺度

Shuochen Wang, Nishant Yadav, Auroop R. Ganguly

机构 * Northeastern University(东北大学) Microsoft(微软公司) The Institute for Experiential AI, Northeastern University(东北大学体验式人工智能研究所)

AI总结 研究针对美国大陆日温度降尺度的时间分布变化问题,提出时间域自适应降尺度框架,结合历史数据监督HR重建与域对齐,实验表明该模型优于其他方法,能提升HR气候预测稳健性,尤其在特定区域和条件下效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03261 2026-07-08 cs.CV 新提交

OmniLayout: A Schematic-Coupled Multimodal Benchmark for Constraint-Aware Geometric Reasoning in PCB Layout

OmniLayout:用于印刷电路板布局中约束感知几何推理的原理图耦合多模态基准测试

Taiting Lu, Kaiyuan Lin, Mingjia Wang, Haolin Ye, Runze Liu, Yuxin Tian, Vahe Melkonyan, Haoyu Wang, Muchuan Wang, Chufan Hong, Yifan Yang, Sung-Liang Chen, Yi-Chao Chen, Yicheng Jin, Mahanth Gowda

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research(微软研究院) Binghamton University(宾汉姆顿大学)

AI总结 介绍OmniLayout基准测试,用于评估大语言模型在印刷电路板布局放置推理。含1681个工业级原理图耦合PCB布局及四项任务,揭示当前大语言模型在PCB布局放置上有诸多局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13757 2026-07-08 cs.CR cs.AI 新提交

SEVRA-BENCH: Social Engineering of Vulnerabilities in Review Agents

SEVRA-BENCH:审查智能体中的社会工程漏洞

Rui Melo, Riccardo Fogliato, Sean Zhou, Pratiksha Thaker, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能) Amazon AWS(亚马逊AWS) Databricks

AI总结 提出SEVRA-BENCH基准,通过社会工程攻击框架评估LLM代码审查智能体拒绝恶意PR的能力,发现闭源与开源模型间存在显著安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏