arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-22 至 2025-12-22 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 12 篇

2512.17450 2025-12-22 cs.CV cs.LG 79%

MULTIAQUA: A multimodal maritime dataset and robust training strategies for multimodal semantic segmentation

MULTIAQUA:一种多模态海洋数据集和多模态语义分割的鲁棒训练策略

Jon Muhovič, Janez Perš

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MULTIAQUA数据集和多模态语义分割的鲁棒训练策略,旨在通过多模态数据提升恶劣能见度下的场景解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15528 2025-12-22 cs.CV 70%

EmoCaliber: Advancing Reliable Visual Emotion Comprehension via Confidence Verbalization and Calibration

EmoCaliber: 通过置信度 verbalization 和校准推进可靠的视觉情绪理解

Daiqing Wu, Dongbao Yang, Can Ma, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息研究所) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 EmoCaliber通过置信度 verbalization 和校准提升视觉情绪理解的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07313 2025-12-22 cs.CV 70%

DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding

DocR1: 证据页面引导的GRPO用于多页文档理解

Junyu Xiong, Yonghui Wang, Weichao Zhao, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 DocR1通过证据页面引导的GRPO框架,提升多页文档理解能力,实现高质量模型训练与多任务性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17319 2025-12-22 cs.CV cs.AI cs.MM 67%

A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs

超高分辨率遥感多模态大语言模型基准

Yunkai Dang, Meiyi Zhu, Donghao Wang, Yizhuo Zhang, Jiacheng Yang, Qi Fan, Yuekun Yang, Wenbin Li, Feng Miao, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(人工智能科学与技术学院,南京大学) School of Physics, Nanjing University(物理学院,南京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出RSHR-Bench,一个超高分辨率遥感多模态大语言模型基准,通过高分辨率图像和多样化任务评估视觉理解与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17532 2025-12-22 cs.CV cs.AI 62%

Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding

Robust-R1: 为鲁棒视觉理解的退化感知推理

Jiaqi Tang, Jianmin Chen, Wei Wei, Xiaogang Xu, Runtao Liu, Xiangyu Wu, Qipeng Xie, Jiafei Wu, Lei Zhang, Qifeng Chen

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Robust-R1通过结构化推理链显式建模视觉退化,提升多模态大语言模型在现实世界退化下的鲁棒性与抗干扰能力。

Comments Accepted by AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16969 2025-12-22 cs.AI cs.CL cs.LG 62%

Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows

通过科学家对齐的工作流探测大语言模型的科学通用智能

Wanghan Xu, Yuhao Zhou, Yifan Zhou, Qinglong Cao, Shuo Li, Jia Bu, Bo Liu, Yixin Chen, Xuming He, Xiangyu Zhao, Xiang Zhuang, Fengxiang Wang, Zhiwang Zhou, Qiantai Feng, Wenxuan Huang, Jiaqi Wei, Hao Wu, Yuejin Yang, Guangshuai Wang, Sheng Xu, Ziyan Huang, Xinyao Liu, Jiyao Liu, Cheng Tang, Wei Li, Ying Chen, Junzhi Ning, Pengfei Jiang, Chenglong Ma, Ye Du, Changkai Ji, Huihui Xu, Ming Hu, Jiangbin Zheng, Xin Chen, Yucheng Wu, Feifei Jiang, Xi Chen, Xiangru Tang, Yuchen Fu, Yingzhou Lu, Yuanyuan Zhang, Lihao Sun, Chengbo Li, Jinzhe Ma, Wanhao Liu, Yating Liu, Kuo-Cheng Wu, Shengdu Chai, Yizhou Wang, Ouwen Zhangjin, Chen Tang, Shufei Zhang, Wenbo Cao, Junjie Ren, Taoyong Cui, Zhouheng Yao, Juntao Deng, Yijie Sun, Feng Liu, Wangxu Wei, Jingyi Xu, Zhangrui Li, Junchao Gong, Zijie Guo, Zhiyu Yao, Zaoyu Chen, Tianhao Peng, Fangchen Yu, Bo Zhang, Dongzhan Zhou, Shixiang Tang, Jiaheng Liu, Fenghua Ling, Yan Lu, Yuchen Ren, Ben Fei, Zhen Zhao, Xinyu Gu, Rui Su, Xiao-Ming Wu, Weikang Si, Yang Liu, Hao Chen, Xiangchao Yan, Xue Yang, Junchi Yan, Jiamin Wu, Qihao Zheng, Chenhui Li, Zhiqiang Gao, Hao Kong, Junjun He, Mao Su, Tianfan Fu, Peng Ye, Chunfeng Song, Nanqing Dong, Yuqiang Li, Huazhu Fu, Siqi Sun, Lijing Cheng, Jintai Lin, Wanli Ouyang, Bowen Zhou, Wenlong Zhang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于实用探究模型的科学通用智能定义,通过四个科学家对齐任务构建SGI-Bench,揭示大语言模型在科学推理中的不足,并引入测试时强化学习提升创新性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12218 2025-12-22 cs.CV cs.CL cs.LG 62%

Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking

目的地之前:视觉忠实性在慢思考中的重要性

Rheeya Uppaal, Phu Mon Htut, Min Bai, Nikolaos Pappas, Zheng Qi, Sandesh Swamy

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AWS AI Labs(AWS人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出视觉忠实性评估方法,通过检测并修正不忠实的感知步骤提升多模态推理的可靠性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16295 2025-12-22 cs.CV 57%

Edge-Native Digitization of Handwritten Marksheets: A Hybrid Heuristic-Deep Learning Framework

边缘端手写标记表的数字化:一种混合启发式-深度学习框架

Md. Irtiza Hossain, Junaid Ahmed Sifat, Abir Chowdhury

机构 * Department of Computer Science and Engineering, Brac University(计算机科学与工程系,布拉克大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种混合启发式与深度学习框架,用于高效处理手写标记表的数字化,通过轻量级YOLOv8模型实现高准确率与实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10501 2025-12-22 cs.AI cs.LG 57%

PASS: Probabilistic Agentic Supernet Sampling for Interpretable and Adaptive Chest X-Ray Reasoning

基于概率代理超网采样的可解释和自适应胸片推理系统

Yushi Feng, Junye Du, Yingying Hong, Qifan Wang, Lequan Yu

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 PASS通过概率代理超网采样实现可解释、自适应和多模态的胸片推理,提升医疗AI的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17259 2025-12-22 cs.MA cs.AI cs.LG 57%

Verifiability-First Agents: Provable Observability and Lightweight Audit Agents for Controlling Autonomous LLM Systems

可验证性优先代理:可证明的可观测性和轻量级审计代理用于控制自主大语言模型系统

Abhivansh Gupta

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种以可验证性为核心的代理架构,通过加密和符号方法实现运行时认证,嵌入轻量级审计代理并采用挑战-响应协议,以提高自主大语言模型系统的可控性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17196 2025-12-22 cs.AI 57%

UmniBench: Unified Understand and Generation Model Oriented Omni-dimensional Benchmark

UmniBench: 通用理解与生成模型面向全维度的基准

Kai Liu, Leyang Chen, Wenbo Li, Zhikai Chen, Zhixin Wang, Renjing Pei, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 UmniBench 是一个面向统一多模态模型的全维度评估基准,能够综合评估理解、生成和编辑能力,覆盖13个主要领域和200多个概念,用于全面评估和改进统一模型性能。

Comments Project Page: https://umnibench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17389 2025-12-22 cs.IR 50%

The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability

大语言模型在推荐系统中的心理世界:关联性、个性化与知识性基准测试

Guangneng Hu

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出LRWorld基准,评估大语言模型在推荐系统中的关联性、个性化和知识性能力,发现其在浅层相似性任务上表现良好,但在深度个性化嵌入和多模态推理方面仍有不足。

Comments 21 pages, 13 figures, 27 tables, submission to KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏