arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 64 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 64 篇

2606.29689 2026-09-01 cs.CL 版本更新 89%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 多模态评测 :MLLM(title_cn,abstract);multimodal(title,abstract);分类 cs.CL

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29802 2026-09-01 cs.CV 新提交 85%

Foundation and Multimodal Large Language Models for Face Presentation and Morph Attack Detection

用于人脸呈现与变形攻击检测的基础模型及多模态大语言模型

Hatef Otroshi Shahreza, Asif Hussain Khan, Peter Lorenz, Alain Komaty, Sébastien Marcel

机构 * Idiap Research Institute(Idiap研究所) Université de Lausanne(洛桑大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文研究通用基础模型和多模态大语言模型是否包含人脸呈现与变形攻击相关信息,通过五种方法在8个公开数据集上测试,发现微调后模型跨数据集检测性能达SOTA,将开源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29278 2026-09-01 cs.CL 新提交 85%

Modality Fault Lines: Structural Corruptions Reveal Fragile Omni-Modal Reasoning

模态断层线:结构损坏揭示脆弱的全模态推理

Zhaolu Kang, Meixin Wu, Yu Xue, Yingjie He, Qiming Shi, Lei Wei, Yidi Wang, Richeng Xuan, Zhichao Hu

机构 * Tencent(腾讯) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :omni-modal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CL

AI总结 本研究提出SCEval诊断评估协议,通过结构损坏揭示全模态模型的脆弱推理,发现文本-视觉损坏是最稳定的共享断层线,多模态退化非相加性,干净准确率不代表结构不可靠时仍可靠。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28762 2026-09-01 cs.CV 新提交 85%

Inter-3D VQA: A Roadside Multimodal Benchmark for 3D Spatiotemporally Grounded Visual Question Answering

Inter-3D VQA:用于3D时空视觉问答的路侧多模态基准

Shaozu Ding, Linan Song, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出用于交叉口3D时空视觉问答的路侧多模态基准Inter-3D VQA,构建含40.7万问答对的数据集,提出基线模型Inter-Geo与评估框架Inter-Metrics,实验显示Inter-Geo在接地时空推理任务上优于基于图像的VLM。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28062 2026-09-01 cs.AI 版本更新 85%

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

WeAgent-MMSearch:面向多模态搜索智能体的原生文本-视觉交互

Zongkai Liu, Hui Zhang, Liqiang Niu, Zhen Cao, Han Li, Juntao Liu, Wenchao Chen, Chengduo Zhao, Chao Yu, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信人工智能) Sun Yat-sen University(中山大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有多模态搜索智能体忽略图像、长程交互易失败的问题,提出 WeAgent-MMSearch 系统,通过 WeAgent-Harness 实现文本-视觉交互,经 FA-GSPO 后训练后,模型在多模态搜索基准上性能大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30475 2026-09-01 cs.CL cs.AI 新提交 84%

ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

ImageEval 2026:基于文化语境的阿拉伯语多模态评估

Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti, Farina Amir, Md Arid Hasan, Basel Mousi, Nadir Durrani, Fahim Dalvi, Zien Sheikh Ali, Erchin Serpedin, Hasan Kurban, Mustafa Jarrar, Shammur Absar Chowdhury, Firoj Alam

机构 * Texas A&M University(德克萨斯农工大学) Qatar Computing Research Institute(卡塔尔计算研究所) Birzeit University(比尔宰特大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学) University of Toronto(多伦多大学)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 ImageEval 2026共享任务含AynVQA和CRAI-Bench两项阿拉伯语多模态评估任务,14支团队参与,相关资源已发布,凸显文化语境多模态评估的挑战。

Comments Arabic LLMs, Multilingual, Multimodal, Shared Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30903 2026-09-01 cs.CL 新提交 83%

MMDS-Bench: Benchmarking Multimodal Large Language Models on Dynamic Stance in Social Media Interactions

MMDS-Bench:面向社交媒体互动中动态立场的多模态大语言模型基准测试

Yuzhe Ding, Kang He, Li Zheng, Shengwu Zheng, Teng Shi, Fei Li, Chong Teng, Donghong Ji

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本研究构建多模态动态立场分类基准MMDS-Bench,评估12个多模态大语言模型,发现其在关系推理类多模态动态立场理解上仍存在不足。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29286 2026-09-01 cs.AI 新提交 83%

MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs

MMPCBench:评估多模态大语言模型对有缺陷输入的主动批判能力的基准

Jinzhe Li, Gengxu Li, Jinnan Li, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型主动错误处理评估的空白,提出MMPCBench基准框架,测试发现主流MLLMs在主动批判上存在明显弱点,还识别出“一致性缺口”问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23938 2026-09-01 cs.CL 版本更新 83%

OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models

OmniACBench:一种评估多模态模型上下文感知语音控制的基准

Seunghee Kim, Bumkyu Park, Kyudan Jung, Joosung Lee, Soyoon Kim, Jeonghoon Kim, Taeuk Kim, Hwiyeol Jo

机构 * Hanyang University(翰阳大学) Seoul National University(首尔国立大学) KAIST AI(韩国科学技术院人工智能研究所) NAVER Cloud(NAVER云)

专题命中 多模态评测 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 OmniACBench评估多模态模型在上下文感知语音生成中的能力,通过语音速率、音调等六种特征验证,揭示模型在多模态整合中的瓶颈及三种常见失败模式。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15897 2026-09-01 cs.CV 版本更新 83%

ThermoSplat: Cross-Modal 3D Gaussian Splatting with Feature Modulation and Geometry Decoupling

ThermoSplat: 多模态3D高斯点云的特征调制与几何解耦

Zhaoqi Su, Shihai Chen, Xinyan Lin, Liqin Huang, Zhipeng Su, Xiaoqiang Lu

机构 * College of Physics and Information Engineering, Fuzhou University(物理与信息工程学院,福州大学)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 ThermoSplat通过特征调制和几何解耦实现多模态3D高斯点云的深度光谱感知重建,提升多光谱场景的渲染质量。

Journal ref 10.1016/j.neucom.2026.134796

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29037 2026-09-01 cs.CV cs.AI 新提交 82%

DocIntent: Answerability-Guided Agentic Restoration for Real-World Document Visual Question Answering

DocIntent:面向真实场景文档视觉问答的可回答性引导智能体式恢复方法

Zihan Huang, Shihang Wu, Junle Liu, Peirong Zhang, Yongxin Shi, Xuhan Zheng, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对真实场景退化影响多模态大语言模型文档问答的问题,提出无需训练的DocIntent框架,通过评估可回答性、选择性调用恢复工具及比较式回滚机制,提升了各类MLLM在WildDoc基准上的表现。

Comments 25 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27499 2026-09-01 cs.CV cs.AI cs.CL 版本更新 82%

DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection

DMV-Bench: 通过偶然线索注入诊断长程多模态智能体的视觉记忆

Yujin Tang, Chenming Shang, Ruize Xu, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出首个交互式多模态智能体视觉记忆基准DMV-Bench,基于双编码理论设计DualMem架构,在长链任务中优于现有方法。

Comments Accepted to EMNLP 2026 Main Conference. 17 pages, 8 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02482 2026-09-01 cs.LG cs.CL cs.CV cs.SD eess.AS 版本更新 82%

MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models

MUSE:一种面向多模态统一安全评估的运行导向平台

Zhongxi Wang, Yueqian Lin, Jingyang Zhang, Zinuo Cheng, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学) Virtue AI

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、eess.AS

AI总结 MUSE提出一种多模态统一安全评估平台,通过多轮攻击和跨轮模态切换技术,评估大型语言模型在不同模态下的安全性能。

Comments Accepted to EMNLP 2026 (System Demonstrations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13186 2026-09-01 cs.CL cs.AI cs.CV 版本更新 82%

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

MM-BrowseComp:多模态浏览智能体的综合基准

Shilong Li, Xingyuan Bu, Wenjie Wang, Jiaheng Liu, Jun Dong, Haoyang He, Hao Lu, Haozhe Zhang, Chenchen Jing, Zhen Li, Chuanhao Li, Jiayi Tian, Chenchen Zhang, Tianhao Peng, Yancheng He, Jihao Gu, Hui Huang, Donghao Zhou, Yuanxing Zhang, Jian Yang, Ge Zhang, Wenhao Huang, Zhaoxiang Zhang, Qiangpeng Yang, Shilei Wen

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对现有浏览基准忽略多模态内容的问题,推出多模态浏览智能体基准MM-BrowseComp,含400道需从网页图像视频提取证据的问题,评估显示领先模型准确率仅24.25%,该基准成领域新标准。

Comments EMNLP 2026. The first two authors contribute equally, 20 pages, repo at https://github.com/MMBrowseComp/MM-BrowseComp

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29489 2026-09-01 cs.CR cs.CV 新提交 81%

SpatialTrust: A Benchmark for Environmental Risk Recognition in Secure Authentication

SpatialTrust:安全认证中环境风险识别的基准测试

Junbin Lu, Hsiang-Wei Huang, Saesha Wadhwa, Yu Ting Hsu, Jenq-Neng Hwang

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出SpatialTrust基准测试评估MLLM在安全认证场景中环境风险识别等五项能力,发现现有模型表现有限,还引入SpatialTrustGuard流程提升了Qwen3-VL-30B-A3B-Instruct的性能。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29098 2026-09-01 cs.AI cs.CV 新提交 81%

SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models

SafeAtlas-VL:基于大规模数据与防护模型的二元多模态安全之外

Zongrui Wang, Xiangyang Zhu, Sicheng Wang, Han Wang, Dingyi Rong, Zeyu Zhang, Chunyi Li, Yue Shi, Kaiwei Zhang, Zicheng Zhang, Yuan Tian, Qi Jia, Yan Teng, Wei Sun, Ning Liu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有多模态安全评估的二元局限,推出含五级标注的SafeAtlas-VL数据集与SafeAtlas Guard系列模型,8B模型F1分数超SOTA约4%,代码数据模型已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28626 2026-09-01 cs.CL cs.AI 新提交 81%

Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects

大型语言模型是否会仔细审查其评审内容?一项关于评分校准、错误检测及作者身份影响的多模态审计研究

Emad Alharbi

机构 * University of Tabuk(塔布克大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究以两款多模态LLM为评审者评估2026 ICLR投稿,发现其评分高于人类、错误检测率低,提供图表会降低错误检测率,作者身份对评审无影响,编辑决策与简单评分平均一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28623 2026-09-01 cs.CL cs.AI 新提交 81%

Looking Again: Measuring Sycophancy in the Reasoning Chains of Multimodal Models Under Pressure

重新审视:压力下多模态模型推理链中的谄媚性测量

Mahir Numayeer Islam, Gakuto Okuyama, Nikolaus Siauw, Shivank Garg, Madhur Panwar, Vasu Sharma

机构 * Adelaide University(阿德莱德大学) Akita International University(秋田国际大学) RNA Tech(RNA科技公司) Algoverse AI Research(Algoverse AI研究院) PocketFM(PocketFM公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多模态推理模型,构建含四类任务与五种压力条件的基准数据集,发现压力下谄媚性普遍存在,多轮压力下临床判断中该现象加剧,且谄媚性可独立破坏推理链,仅答案评估不足。

Comments Accepted to COLM @ AdvML-Frontiers-CoTMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01914 2026-09-01 cs.CL cs.CV 版本更新 81%

Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

多模态大语言模型空间推理中空间词汇偏差的机制诊断

Chuang Ma, Qianying Liu, Tomoyuki Obuchi, Fei Cheng, Wang Yang, Sudong Cai, Shuyuan Zheng, Akiko Aizawa, Sadao Kurohashi

机构 * Kyoto University(京都大学) NII LLMC(日本国立信息与通信技术研究所语言模型中心) RIKEN AIP(日本理化学研究所先进理工研究所) Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学) The University of Osaka(大阪大学) University of Tokyo(东京大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文发现多模态大语言模型存在空间词汇偏差,即添加空间关系词会吸引模型选择该选项,并通过机制可解释性工具揭示偏差主要源于语言侧而非视觉侧,最后提出轻量级LLM-only DPO更新可有效缓解偏差。

Comments 27 pages. Accepted to EMNLP 2026 (Main Conference); camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11454 2026-09-01 cs.CV cs.AI 81%

HumaniBench: A Human-Centric Framework for Large Multimodal Models Evaluation

HumaniBench: 一种以人为中心的大型多模态模型评估框架

Shaina Raza, Aravind Narayanan, Vahid Reza Khazaie, Ashmal Vayani, Ahmed Y. Radwan, Mukund S. Chettiar, Amandeep Singh, Mubarak Shah, Deval Pandya

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究院) University of Central Florida(中央佛罗里达大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出HumaniBench框架,通过32000个专家验证的图像-问题对评估大型多模态模型在公平性、伦理、包容性等人类中心原则上的对齐情况,揭示了不同模型在伦理、推理和共情方面的权衡。

Comments Accepted at Transactions on Intelligent Systems and Technology (Manuscript ID: TIST-2026-02-0123.R2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09557 2026-09-01 cs.CV cs.AI 版本更新 81%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences(UCAS)(中国科学院大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在复杂城市场景中推理可靠性不足及现有基准无法诊断推理过程的问题,提出AD2-Bench基准与EGVOR方法,提升了不利条件下多模态推理的稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29209 2026-09-01 cs.CL cs.HC 新提交 79%

Toward Cultural Alignment: Human-Centered Evaluation of Multimodal AI Stories Across Five African Communities

迈向文化对齐:五个非洲社区对多模态AI故事的以人为中心的评估

Millicent Ochieng, Felermino D. M. A. Ali, Elizabeth A. Ankrah, Najeeb Gambo Abdulhamid, Migisha Boyd, Stephanie Nyairo, Mercy Muchai, Samuel Chege Maina, Aditya Vashistha, Anja Thieme, Jacki O'Neill

机构 * Microsoft Research Africa(微软研究院非洲分部) Swansea University(斯旺西大学) Cornell University(康奈尔大学) Microsoft Research Cambridge(微软研究院剑桥分部)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文以五个非洲社区为对象,通过混合方法评估AI生成多模态故事的文化对齐情况,构建了相关分类体系,并发现多模态LLM裁判需经社区校准才能可靠评估文化对齐。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27010 2026-09-01 cs.AI 版本更新 79%

A Multi-Modal AI Framework for Real-Time Queue Prediction, Management and Optimisation in Intelligent Border Control Systems

用于智能边检系统中实时队列预测、管理与优化的多模态AI框架

Varvara Mama, Eleni Veroni, Nikolaos Kapsalis, Christos D. Nikolopoulos, Anargyros T. Baklezos

机构 * Hellenic Mediterranean University(希腊地中海大学) National Technical University of Athens(雅典国立技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本研究针对智能边检系统队列管理问题,提出多模态AI框架,结合LSTM、MPC等技术,经评估可降低预测误差与等待时间、提升吞吐量。

Comments 6 pages, 2 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26465 2026-09-01 cs.AI 版本更新 79%

MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

MultivationBench:多模态序列动机推理基准

Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MultivationBench基准,基于心理学框架评估多模态序列动机推理,发现现有模型难以在序列语境中保持一致的动机推理,暴露了静态识别与动态推理的差距。

Comments 35 pages, 6 figures. Accepted to Findings of EMNLP 2026. Code and data: https://github.com/HKUST-KnowComp/MultivationBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28696 2026-09-01 cs.AI 版本更新 79%

COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

COMPASS:在统一多模态模型中锚定构图意图引导

Ziqi Zhou, Weize Quan, Mining Tan, Zhihan Chen, Dandan Zheng, Jingdong Chen, Jun Zhou, Weiming Dong, Dong-Ming Yan

机构 * University of Edinburgh(爱丁堡大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出统一框架COMPASS,通过共享专家令牌τ_c实现构图感知与生成的双向锚定,结合MoE骨干和Comp-11数据集,显著提升细粒度构图理解与可控生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26824 2026-09-01 cs.DL cs.AI cs.IR 版本更新 79%

LeMat-Synth: a multi-modal toolbox to curate broad synthesis procedure databases from scientific literature

LeMat-Synth:用于从科学文献中构建广泛合成程序数据库的多模态工具箱

Magdalena Lederbauer, Siddharth Betala, Valerie Gentzke, Anamaria Leonescu, Amine Sehaba, Faris Flaifil, Ayush Jain, Alfonso Amayuelas, Nikhil Yelamarthy, Xiyao Li, Grégoire Germain, Stefano Ribes, Stefan P. Schmid, Alexandre Nozadze, Anna Kelmanson, Sudheesh Kumar Ethirajan, Mohd Zaki, Elton Pan, Georgia Channing, Connor W. Coley, Philippe Schwaller, Rocío Mercado, Alexandre Duval, Mathilde L. D. Franckel, Samuel P. Gleason

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本研究开发LeMat-Synth Parser多模态工具箱,从8.1万篇文献构建含5.8万种合成方案的最大无机材料合成数据集,验证其质量并通过氨分解、超导领域应用展示其可扩展性,相关工具与数据集已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03654 2026-09-01 cs.CV cs.AI 版本更新 79%

ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant

ReGraP-LLaVA:支持推理的基于图的个性化多模态大语言与视觉助手

Yifan Xiang, Zhenxi Zhang, Bin Li, Yixuan Weng, Bo Gao, Shoujun Zhou, Yangfan He, Yilin Yuan, Keqin Li

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) School of Engineering, Westlake University(西湖大学工程学院) University of Minnesota – Twin Cities(明尼苏达大学双城分校) University of Toronto(多伦多大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有个性化多模态大语言模型忽略概念关联的局限,本文构建ReGraP数据集与基准,提出ReGraP-LLaVA模型,实现个性化关系推理,在对比基准中性能最优。

Comments accepted in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30949 2026-09-01 cs.IR 新提交 78%

MULTI3IR: A Benchmark for Multi-perspective Multi-domain Multi-modal Information Retrieval

MULTI3IR:多视角、多领域、多模态信息检索基准

Seokwon Song, Sohyeon Kim, Gunhee Kim

专题命中 多模态评测 :multi-modal(title);multimodal(abstract)

AI总结 该研究针对现有IR基准的不足,构建了多视角多领域多模态IR基准Multi³IR,提出SPIN方法提升检索器的视角覆盖度,实验验证其性能优势与泛化性。

Comments EMNLP 2026; code is available at https://github.com/seokwon99/Multi3IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30510 2026-09-01 cs.CV cs.AI cs.CL cs.DL 新提交 78%

Lot Machine: Multimodal Lot Extraction from Auction Catalogs

拍品提取模型:从拍卖目录中进行多模态拍品提取

Mathias Zinnen, Alisha Mund, Sabine Lang, Lukas Hüttner, Thomas Gorges, Vincent Christlein

机构 * FAU Erlangen(埃尔朗根-纽伦堡大学) Pattern Recognition Lab(模式识别实验室)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究提出基于视觉语言模型(VLM)的流水线,从历史拍卖目录中自动提取结构化拍品级元数据,对比不同部署模式的模型性能,为文化遗产机构提供可行的自动化分析方案。

Comments Accepted at the VISART Workshop (Computer Vision for Art Analysis), ECCV 2026. 19 pages, 6 figures, 5 tables. Supplementary material included as an appendix. Code, benchmark data, and prompt templates: https://github.com/mathiaszinnen/auction-lot-extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29193 2026-09-01 cs.LG 新提交 78%

HalluPrism: When Multimodal Uncertainty Should Diagnose, Not Decide

HalluPrism:多模态不确定性应用于诊断而非决策

Aman Prakash, Sourish Dasgupta, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(德里印度理工学院) Dhirubhai Ambani University(德鲁巴伊·安巴尼大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究提出HalluPrism,通过视觉扰动敏感性等三维特征诊断多模态大语言模型的失败类别,提升了失败检测的AUROC,明确多模态不确定性应先诊断再决策。

Comments Accepted to Findings of EMNLP 2026. 52 pages, 1 figure, 46 tables

详情

展开后加载摘要…

URL PDF HTML 收藏