arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9176 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9176 篇

2506.17667 2026-02-12 cs.AI 79%

PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level

PhysUniBench: 一个面向本科生层面的多模态物理推理基准测试

Lintao Wang, Encheng Su, Jiaqi Liu, Pengze Li, Jiabei Xiao, Wenlong Zhang, Xinnan Dai, Xi Chen, Yuan Meng, Lei Bai, Wanli Ouyang, Shixiang Tang, Aoran Wang, Xinzhu Ma

机构 * The University of Sydney(悉尼大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Michigan State University(密歇根州立大学) Tsinghua University(清华大学) Beihang University(北航大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 PhysUniBench是一个面向本科生层面的多模态物理推理基准测试,旨在评估和提升多模态大语言模型在物理问题上的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11362 2026-02-11 cs.LG cs.CV 79%

PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits

PersonaX: 多模态数据集与LLM推断行为特征

Loka Li, Wong Yu Kang, Minghao Fu, Guangyi Chen, Zhenhao Chen, Gongxu Luo, Yuewen Sun, Salman Khan, Peter Spirtes, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) University of California San Diego(加州大学圣地亚哥分校) Australian National University(澳大利亚国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 PersonaX通过多模态数据集结合LLM推断行为特征,推动多模态特征分析与因果推理发展。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08367 2026-02-10 cs.CL 79%

WorldTravel: A Realistic Multimodal Travel-Planning Benchmark with Tightly Coupled Constraints

WorldTravel: 一个具有紧密耦合约束的现实多模态旅行规划基准

Zexuan Wang, Chenghao Yang, Yingqi Que, Zhenzhu Yang, Huaqing Yuan, Yiwen Wang, Zhengxuan Jiang, Shengjie Fang, Zhenhe Wu, Zhaohui Wang, Zhixin Yao, Jiashuo Liu, Jincheng Ren, Yuzhen Li, Yang Yang, Jiaheng Liu, Jian Yang, Zaiyuan Wang, Ge Zhang, Zhoufutu Wen, Wenhao Huang

机构 * ByteDance Seed(字节跳动种子)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CL

AI总结 WorldTravel提出一个现实多模态旅行规划基准,揭示了智能体在紧密耦合约束下的感知-行动差距和规划时间阈值问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00765 2026-02-10 cs.AI 79%

HouseTS: A Large-Scale, Multimodal Spatiotemporal U.S. Housing Dataset and Benchmark

HouseTS:一个大规模、多模态的美国住房时空数据集和基准

Shengkun Wang, Yanshen Sun, Fanglan Chen, Linhan Wang, Naren Ramakrishnan, Chang-Tien Lu, Yinlin Chen

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 HouseTS是一个大规模多模态美国住房时空数据集,用于提供长期房价预测的基准,涵盖超过6000个邮政编码的月度数据,并支持多种模型的评估与可解释性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10734 2026-02-10 cs.CV 79%

OmniHD-Scenes: A Next-Generation Multimodal Dataset for Autonomous Driving

OmniHD-Scenes:面向自动驾驶的下一代多模态数据集

Lianqing Zheng, Long Yang, Qunshu Lin, Wenjin Ai, Minghao Liu, Shouyi Lu, Jianan Liu, Hongze Ren, Jingyue Mo, Xiaokai Bai, Jie Bai, Zhixiong Ma, Xichan Zhu

机构 * School of Automotive Studies, Tongji University(同济大学汽车学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) AI Foundation(2077AI基金会) Momoni AI College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Information and Electrical Engineering, Hangzhou City University(杭州城市学院信息与电气工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 OmniHD-Scenes提出了一种大规模多模态数据集,结合多种传感器数据,用于提升自动驾驶的3D检测和语义预测性能。

Comments Accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08112 2026-02-10 cs.CV cs.LG 79%

MMLSv2: A Multimodal Dataset for Martian Landslide Detection in Remote Sensing Imagery

MMLSv2:一种用于火星滑坡检测的多模态数据集

Sidike Paheding, Abel Reyes-Angulo, Leo Thomas Ramos, Angel D. Sappa, Rajaneesh A., Hiral P. B., Sajin Kumar K. S., Thomas Oommen

机构 * Fairfield University(费尔菲尔德大学) Michigan Technological University(密歇根技术大学) Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) ESPOL Polytechnic University(ESPOL多科大学) University of Kerala(喀拉拉大学) University of Mississippi(密西西比大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MMLSv2是一个用于火星滑坡检测的多模态数据集,包含七种波段的图像,用于评估模型在不同地理区域的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07978 2026-02-10 cs.CL 79%

Cross-Linguistic Persona-Driven Data Synthesis for Robust Multimodal Cognitive Decline Detection

跨语言人格驱动的数据合成用于鲁棒多模态认知衰退检测

Rui Feng, Zhiyao Luo, Liuyu Wu, Wei Wang, Yuting Song, Yong Liu, Kok Pin Ng, Jianqing Li, Xingyao Wang

机构 * Engineering Research Center of Intelligent Theranostics Technology and Instruments, Ministry of Education, School of Biomedical Engineering and Informatics, Nanjing Medical University(智能诊疗技术与仪器工程研究中心、教育部、生物医学工程与信息学院、南京医科大学) Institute of Biomedical Engineering, University of Oxford(生物医学工程研究所、牛津大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所、科技研究局(A*STAR)) Department of Neurology, National Neuroscience Institute, Singapore, 308433, Singapore(神经病学部、新加坡国家神经科学研究所) Duke-NUS Medical School, Singapore, 169857, Singapore(新加坡国立大学医学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 SynCog通过跨语言人格驱动数据合成与推理链微调,提升多模态模型在认知衰退检测中的诊断性能和跨语言泛化能力。

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06743 2026-02-09 cs.CV 79%

Clinical-Prior Guided Multi-Modal Learning with Latent Attention Pooling for Gait-Based Scoliosis Screening

具有潜在注意力池的临床先验引导多模态学习用于基于步态的脊柱侧弯筛查

Dong Chen, Zizhuang Wei, Jialei Xu, Xinyang Sun, Zonglin He, Meiru An, Huili Peng, Yong Hu, Kenneth MC Cheung

机构 * Orthopaedic Centre, The University of Hong Kong - Shenzhen Hospital, Shenzhen, China(香港大学深圳医院骨科中心) Translational Medicine Centre, The University of Hong Kong - Shenzhen Hospital, China(香港大学深圳医院转化医学中心) Department of Orthopaedics and Traumatology, Li Ka Shing Faculty of Medicine, The University of Hong Kong, Hong Kong, China(香港大学李嘉成医学院骨科及创伤外科学院) Huawei, China(华为)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于步态的脊柱侧弯筛查方法,通过多模态学习和潜在注意力池化机制,结合临床先验知识,实现了可解释的特征表示和高精度的筛查性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06158 2026-02-09 cs.CV 79%

MGP-KAD: Multimodal Geometric Priors and Kolmogorov-Arnold Decoder for Single-View 3D Reconstruction in Complex Scenes

MGP-KAD:多模态几何先验与科莫戈罗夫-阿诺德解码器用于复杂场景中的单视图3D重建

Luoxi Zhang, Chun Xie, Itaru Kitahara

机构 * Doctoral Program in Empowerment Informatics, University of Tsukuba, Japan(赋能信息学博士项目,茨ukuba大学,日本) Center for Computational Science, Tsukuba, Ibaraki, Japan(计算科学中心,茨ukuba,Ibaraki,日本)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MGP-KAD通过整合多模态特征与几何先验,结合科莫戈罗夫-阿诺德网络解码器,提升复杂场景中单视图3D重建的精度与细节保持能力。

Comments 6 pages. Published in IEEE International Conference on Image Processing (ICIP) 2025

Journal ref Proc. IEEE International Conference on Image Processing (ICIP), 2025, pp. 1564-1569

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19755 2026-02-06 cs.AI 79%

Can MLLMs generate human-like feedback in grading multimodal short answers?

大型语言模型能否在评估多模态简答时生成类人反馈?

Pritam Sil, Pushpak Bhattacharyya, Pawan Goyal, Ganesh Ramakrishnan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究了多模态简答评分与反馈问题,通过生成数据集评估了四种多模态大语言模型,展示了其在正确性预测和图像相关性评估中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04290 2026-02-05 cs.CL 79%

Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision

引导验证器:通过动态过程监督实现协作多模态推理

Lingzhuang Sun, Ruitong Liu, Yuxia Zhu, Xiaohan Xu, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出引导验证器框架,通过动态过程监督实现多模态推理的协作优化,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03130 2026-02-04 cs.CV cs.CE 79%

FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation

FinMTM:面向金融推理和智能体评估的多轮多模态基准

Chenxi Zhang, Ziliang Gan, Liyun Zhu, Youwei Pang, Qing Zhang, Rongjunchen Zhang

机构 * HiThink Research(HiThink研究机构) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Shanghai Institute of Technology(上海理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01816 2026-02-03 cs.CV 79%

Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies

看见即相信?多模态大语言模型在视觉错觉和异常上的基准测试

Wenjin Hou, Wei Liu, Han Hu, Xiaoxiao Sun, Serena Yeung-Levy, Hehe Fan

机构 * Zhejiang University(浙江大学) Tencent Hunyuan Team(腾讯文言团队) Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出VIA-Bench基准测试,评估多模态大语言模型在视觉错觉和异常上的性能,揭示其在复杂视觉任务中的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01109 2026-02-03 cs.AI 79%

Transforming Vehicle Diagnostics: A Multimodal Approach to Error Patterns Prediction

将车辆诊断转型:一种多模态方法用于错误模式预测

Hugo Math, Rainer Lienhart

机构 * Augsburg University(艾尔福特大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出BiCarFormer,通过整合DTC序列和环境条件,实现车辆错误模式的多模态预测,提升诊断准确性与鲁棒性。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00060 2026-02-03 cs.CY cs.AI cs.LG 79%

A longitudinal geospatial multimodal dataset of post-discharge frailty, physiology, mobility, and neighborhoods

出院后老年人 frailty、生理、运动能力和社区的纵向地理多模态数据集

Ali Abedi, Charlene H. Chu, Shehroz S. Khan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 GEOFRAIL 数据集通过多模态传感和数据分析技术,持续监测出院后老年人的 frailty、生理、运动能力和社区环境,为恢复轨迹研究提供纵向地理数据支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22746 2026-02-02 cs.ET cs.AI 79%

UrbanMoE: A Sparse Multi-Modal Mixture-of-Experts Framework for Multi-Task Urban Region Profiling

UrbanMoE: 一种用于多任务城市区域刻画的稀疏多模态专家混合框架

Pingping Liu, Jiamiao Liu, Zijian Zhang, Hao Miao, Qi Jiang, Qingliang Li, Qiuzhan Zhou, Irwin King

机构 * Jilin University(吉林大学) The Hong Kong Polytechnic University(香港理工大学) Changchun Normal University(长春师范大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 UrbanMoE提出了一种稀疏多模态专家混合框架,用于解决多任务城市区域刻画问题,通过多模态特征动态路由实现高效预测,提升了城市分析的性能和可重复性。

Comments 12 pages, 6 figures, 5tables, Proceedings of the ACM Web Conference 2026 (WWW '26), April 13--17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15260 2026-01-30 cs.CV 79%

DrivIng: A Large-Scale Multimodal Driving Dataset with Full Digital Twin Integration

DrivIng: 一个具有完整数字孪生集成的大规模多模态驾驶数据集

Dominik Rößle, Xujun Xie, Adithya Mohan, Venkatesh Thirugnana Sambandham, Daniel Cremers, Torsten Schön

机构 * Department of Computer Science and AImotion Bavaria, Technische Hochschule Ingolstadt(计算机科学系和AImotion巴伐利亚,因斯布鲁克大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 DrivIng是一个具有完整数字孪生集成的大规模多模态驾驶数据集,提供高精度定位和多传感器数据,用于自动驾驶感知算法的评估和仿真到现实测试。

Comments Copyright 2026 IEEE. This is the accepted manuscript (postprint), not the final published version. For code and dataset, see https://github.com/cvims/DrivIng

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25851 2026-01-30 cs.CV 79%

MuSLR: Multimodal Symbolic Logical Reasoning

MuSLR:多模态符号逻辑推理

Jundong Xu, Hao Fei, Yuhui Zhang, Liangming Pan, Qijun Huang, Qian Liu, Preslav Nakov, Min-Yen Kan, William Yang Wang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) Peking University(北京大学) UniMelb(墨尔本大学) University of Auckland(奥克兰大学) MBZUAI(穆斯林人工智能研究所) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MuSLR提出了一种多模态符号逻辑推理基准,通过形式逻辑规则提升VLMs的推理能力,显著提升链式推理性能及复杂逻辑处理效果。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17536 2026-01-29 cs.CL 79%

Multimodal Conversation Structure Understanding

多模态对话结构理解

Kent K. Chang, Mackenzie Hanh Cramer, Anna Ho, Ti Ti Nguyen, Yilin Yuan, David Bamman

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模态对话结构理解任务及TV-MMPC数据集,揭示对话角色匿名化对模型性能的影响,并分析对话中性别角色的参与差异。

Comments accepted to EACL 2026 main conference; 22 pages, 9 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20196 2026-01-29 cs.CV 79%

Automated Marine Biofouling Assessment: Benchmarking Computer Vision and Multimodal LLMs on the Level of Fouling Scale

自动化海洋生物污损评估:基于生物污损等级的计算机视觉与多模态LLM对比分析

Brayden Hamilton, Tim Cashmore, Peter Driscoll, Trevor Gee, Henry Williams

机构 * Centre for Automation and Robotic Engineering Science(自动化与机器人工程科学中心) The University of Auckland(奥克兰大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文通过对比计算机视觉与多模态LLM在生物污损等级评估中的表现,提出混合方法以实现可扩展且可解释的自动化评估。

Comments Australasian Conference on Robotics and Automation, ACRA2025 13 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19898 2026-01-28 cs.CV 79%

DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding

DuwatBench: 通过阿拉伯书法基准桥接语言与视觉遗产以实现多模态理解

Shubham Patle, Sara Ghaboura, Hania Tariq, Mohammad Usman Khan, Omkar Thawakar, Rao Muhammad Anwer, Salman Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) NUCES(努赛斯大学) NUST(努斯特大学) Australian National University(澳大利亚国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 DuwatBench通过阿拉伯书法基准推动多模态研究,揭示多模态模型在处理书法变体和艺术扭曲时的局限性。

Comments Accepted to EACL-2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19557 2026-01-28 cs.CV cs.RO 79%

The S3LI Vulcano Dataset: A Dataset for Multi-Modal SLAM in Unstructured Planetary Environments

S3LI Vulcano数据集:用于无结构行星环境多模态SLAM的数据集

Riccardo Giubilato, Marcus Gerhard Müller, Marco Sewtz, Laura Alejandra Encinar Gonzalez, John Folkesson, Rudolph Triebel

机构 * German Aerospace Center (DLR) Institute of Robotics and Mechatronics(德国航空航天中心(DLR)机器人与机电研究所) KTH Royal Institute of Technology(皇家理工学院) Deptartment of Intelligent Systems(智能系统部门)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 S3LI Vulcano数据集为无结构行星环境中的多模态SLAM和场景识别算法提供多模态数据及开源工具支持。

Comments Accepted submission to the 2026 IEEE Aerospace Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19193 2026-01-28 cs.AI 79%

CoReTab: Improving Multimodal Table Understanding with Code-driven Reasoning

CoReTab:通过代码驱动推理提升多模态表格理解

Van-Quang Nguyen, Takayuki Okatani

机构 * RIKEN AIP(日本理化学研究所AIP) GSIS, Tohoku University/RIKEN AIP(东京东京大学GSIS/日本理化学研究所AIP)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 CoReTab通过代码驱动推理框架,提升多模态表格理解的准确性和可解释性,实现显著的性能提升。

Comments accepted to EACL'26 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17644 2026-01-28 cs.CR cs.AI 79%

A Systemic Evaluation of Multimodal RAG Privacy

多模态RAG隐私的系统评估

Ali Al-Lawati, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文系统评估了多模态RAG隐私风险,揭示了推理过程中可能泄露私有信息的问题,并呼吁开发隐私保护机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03660 2026-01-28 cs.CV 79%

MGPC: Multimodal Network for Generalizable Point Cloud Completion With Modality Dropout and Progressive Decoding

MGPC:多模态网络用于通用点云补全与模态丢弃和渐进解码

Jiangyuan Liu, Yuhao Zhao, Hongxuan Ma, Zhe Liu, Jian Wang, Wei Zou

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所 multimodal 人工智能系统国家重点实验室) Chemical Defense Institute, Academy of Military Sciences(军事科学院化学防御研究院) Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所 复杂系统认知与决策智能重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MGPC通过多模态融合和渐进生成提升点云补全的泛化能力,构建大规模基准并验证其在现实场景中的有效性。

Comments Code and dataset are available at https://github.com/L-J-Yuan/MGPC

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03785 2026-01-28 cs.LG cs.AI 79%

SoilNet: A Multimodal Multitask Model for Hierarchical Classification of Soil Horizons

SoilNet:一种用于土壤剖面层次分类的多模态多任务模型

Vipin Singh, Teodor Chiaburu, Einar Eberhardt, Stefan Broda, Joey Prüssing, Frank Haußer, Felix Bießmann

机构 * Einstein Center Digital Future(数字未来爱因斯坦中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 SoilNet通过多模态多任务模型解决土壤层次分类问题,结合图像数据和地理时间元数据,利用图结构表示实现复杂层次结构的准确分类。

Comments 29 pages, 9 figures, 7 tables

Journal ref Geoderma, Volume 466, 2026, 117684

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07559 2026-01-28 cs.LG cs.AI 79%

Zer0-Jack: A Memory-efficient Gradient-based Jailbreaking Method for Black-box Multi-modal Large Language Models

Zer0-Jack: 一种内存高效的基于梯度的对抗方法用于黑盒多模态大语言模型

Tiejin Chen, Kaishen Wang, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of Maryland(马里兰大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 Zer0-Jack通过零阶优化实现高效黑盒对抗,显著降低内存使用并提升攻击成功率。

Comments Accepted to EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18493 2026-01-27 cs.CV 79%

DisasterInsight: A Multimodal Benchmark for Function-Aware and Grounded Disaster Assessment

DisasterInsight: 一种多模态基准,用于功能感知和基于事实的灾害评估

Sara Tehrani, Yonghao Xu, Leif Haglund, Amanda Berg, Michael Felsberg

机构 * Computer Vision Laboratory, Linköping University, Sweden(林奈大学计算机视觉实验室) Vantor, Linköping, Sweden(林奈瑞典)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 DisasterInsight提出一种多模态基准,用于评估视觉-语言模型在灾害分析任务中的性能,通过DI-Chat模型在损害识别和报告生成方面取得显著提升。

Comments Under review at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18346 2026-01-27 cs.CV 79%

Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception

Q-Bench-Portrait:多模态大语言模型在肖像图像质量感知上的基准测试

Sijing Wu, Yunhao Li, Zicheng Zhang, Qi Jia, Xinyue Li, Huiyu Duan, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 Q-Bench-Portrait首次提出用于评估多模态大语言模型在肖像图像质量感知上的能力,包含2765个三元组,涵盖多种图像来源和质量维度,评估20个模型后发现其表现有限,与人类判断存在差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17571 2026-01-27 eess.SP cs.CV cs.LG 79%

ME-WARD: A multimodal ergonomic analysis tool for musculoskeletal risk assessment from inertial and video data in working plac

ME-WARD:一种多模态人体工学分析工具,用于从惯性与视频数据中评估肌肉骨骼风险

Javier González-Alonso, Paula Martín-Tapia, David González-Ortega, Míriam Antón-Rodríguez, Francisco Javier Díaz-Pernas, Mario Martínez-Zarzuela

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ME-WARD是一种多模态工具,利用惯性和视频数据评估人体工学风险,通过整合多种运动捕捉技术提供可靠且经济的解决方案。

Comments 19 pages

Journal ref Expert Systems With Applications 278 (2025) 127212

详情

展开后加载摘要…

URL PDF HTML 收藏