SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models
SocialOmni: 全模态模型中音视频社交互动性的基准测试
Tianyu Xie, Jinfa Huang, Yuexiao Ma, Rongfang Luo, Yan Yang, Wang Chen, Yuhui Zeng, Yixuan Zou, Qingchuan Ma, Zhiqiang Lu, Ruize Fang, Xiawu Zheng, Jiebo Luo, Rongrong Ji
机构
*
Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室)
;
Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究所)
;
School of Informatics, Xiamen University(厦门大学信息学院)
;
Sichuan Agricultural University(四川农业大学)
;
Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Chongqing University(重庆大学)
;
The University of Tokyo(东京大学)
;
Beihang University(北航)
;
Northwestern Polytechnical University(西北工业大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
CausalRAG2: Hierarchical Causal Knowledge Graph Design for RAG
CausalRAG2: 面向RAG的分层因果知识图谱设计
Nengbo Wang, Tuo Liang, Vikash Singh, Chaoda Song, Van Yang, Yu Yin, Jing Ma, Jagdip Singh, Vipin Chaudhary
机构
*
Department of Computer and Data Sciences, Case Western Reserve University, Cleveland, OH, USA(计算机与数据科学系,凯斯西储大学,克利夫兰,OH,USA)
;
Design and Innovation Department, Case Western Reserve University, Cleveland, OH, USA(设计与创新部门,凯斯西储大学,克利夫兰,OH,USA)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA)
;
Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA)
;
West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA)
;
Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
Comments14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068
DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation
DoGMaTiQ:面向报告评估的问答片段自动生成
Bryan Li, William Walden, Yu Hou, Gabrielle Kaili-May Liu, Dawn Lawrie, James Mayfield, Eugene Yang, Chris Callison-Burch, Laura Dietz
机构
*
Google Inc.(谷歌公司)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of Maryland(马里兰大学)
;
Yale University(耶鲁大学)
;
University of Pennsylvania(宾夕法尼亚大学)
;
University of New Hampshire(新罕布什尔大学)
Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design
Design-MLLM:一种用于可验证且美观的室内设计的强化对齐框架
Yuxuan Yang, Xiaotong Mao, Jingyao Wang
机构
*
National Jiangsu University of Finance(江苏财经大学)
;
University of Lorraine(洛林大学)
;
Institute of Electronics and Information Technology, Chinese Academy of Sciences(中国科学院电子信息技术研究所)
;
Tsinghua University(清华大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.LG
ScaleWoB: Guiding GUI Agents with Coding Agents via Large-Scale Environmental Synthesis
SimuWoB: 模拟真实世界移动应用以实现快速且保真的GUI智能体基准测试
Guohong Liu, Jialei Ye, Pengzhi Gao, Wei Liu, Jian Luan, Yunxin Liu, Yuanchun Li
机构
*
Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus团队)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech
Omnilingual SONAR:跨语言与跨模态句子嵌入,连接大规模多语言文本与语音
Omnilingual SONAR Team, João Maria Janeiro, Pere-Lluís Huguet Cabot, Ioannis Tsiamas, Yen Meng, Vivek Iyer, Guillem Ramírez, Loic Barrault, Belen Alastruey, Xiang "Tony" Cao, Yu-An Chung, Marta R. Costa-Jussa, David Dale, Kevin Heffernan, Jaehyeong Jo, Artyom Kozhevnikov, Alexandre Mourachko, Christophe Ropers, Holger Schwenk, Paul-Ambroise Duquenne
机构
*
The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))
;
School of Data Science, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院、人工智能学院、香港中文大学(深圳))
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
FORTIS: Benchmarking Over-Privilege in Agent Skills
FORTIS:评估代理技能中的过度特权
Shawn Li, Chenxiao Yu, Han Wang, Wei Yang, Ryan Rossi, Franck Dernoncourt, Xiyang Hu, Philip Yu, Chaowei Xiao, Huan Zhang, Yue Zhao
机构
*
University of Southern California(南加州大学)
;
University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Adobe Research(Adobe研究)
;
Arizona State University(亚利桑那州立大学)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
;
Johns Hopkins University(约翰霍普金斯大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
OmniMouse: Scaling properties of multi-modal, multi-task Brain Models on 150B Neural Tokens
OmniMouse: 基于1500亿神经令牌的多模态多任务脑模型的可扩展性
Konstantin F. Willeke, Polina Turishcheva, Alex Gilbert, Goirik Chakrabarty, Hasan A. Bedel, Paul G. Fahey, Yongrong Qiu, Marissa A. Weis, Michaela Vystrčilová, Taliah Muhammad, Lydia Ntanavara, Rachel E. Froebe, Kayla Ponder, Zheng Huan Tan, Emin Orhan, Erick Cobos, Sophia Sanborn, Katrin Franke, Fabian H. Sinz, Alexander S. Ecker, Andreas S. Tolias
机构
*
Department of Ophthalmology, Byers Eye Institute, Stanford University(斯坦福大学眼科学系、比尔斯眼科研究所)
;
Stanford Bio-X, Stanford University(斯坦福大学生物交叉学科)
;
Wu Tsai Neurosciences Institute, Stanford University(斯坦福大学吴泰教授神经科学研究所)
;
Institute of Computer Science and Campus Institute Data Science, University Göttingen(哥廷根大学计算机科学研究所和校园数据科学研究所)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
CommentsWe have further refined the benchmark construction and experimental presentation to improve clarity and consistency. The revised version includes updated task design, food-resource data, and evaluation details to better align the benchmark with the intended food resource referral setting. These changes provide a more precise presentation of the experimental findings