arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-19 至 2025-12-19 共收录 51 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 12 篇

2511.12142 2025-12-19 cs.CV 79%

MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering

MAVIS:多模态来源归因的长形式视觉问答基准

Seokwon Song, Minsu Park, Gunhee Kim

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MAVIS基准旨在评估多模态来源归因系统,通过多模态文档检索和长形式答案生成,揭示多模态设置下信息量、 groundedness 和流畅性之间的权衡与改进方向。

Comments AAAI 2026; code is available at https://github.com/seokwon99/MAVIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16103 2025-12-19 cs.LG cs.AI 74%

AIMM: An AI-Driven Multimodal Framework for Detecting Social-Media-Influenced Stock Market Manipulation

AIMM:一种基于人工智能的多模态框架,用于检测受社交媒体影响的股市操纵

Sandeep Neela

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 AIMM通过融合社交媒体和市场数据,提出了一种人工智能驱动的多模态框架,用于检测社交媒体影响的股市操纵,并展示了其在GME事件中的早期预警能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16921 2025-12-19 cs.CV cs.AI 73%

Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification

关键差异:用于能力缺口发现与纠正的模型审计

Qihao Liu, Chengzhi Mao, Yaojie Liu, Alan Yuille, Wen-Sheng Chu

机构 * Google(谷歌) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 AuditDM通过主动发现和纠正多模态大语言模型的失败模式,提升模型性能和诊断能力。

Comments project page: https://auditdm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22737 2025-12-19 cs.CV cs.AI 62%

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

CompareBench: 一个用于评估视觉比较推理能力的视觉-语言模型基准

Jie Cai, Kangning Yang, Lan Fu, Jiaming Ding, Jinlong Li, Huiming Sun, Daitao Xing, Jinglin Shen, Zibo Meng

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CompareBench是一个用于评估视觉-语言模型中视觉比较推理能力的基准,揭示了当前模型在时间排序、空间关系和基本计数上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17466 2025-12-19 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 62%

Optimizing Grasping in Legged Robots: A Deep Learning Approach to Loco-Manipulation

为四足机器人优化抓取:一种深度学习的移动-操作方法

Dilermando Almeida, Guilherme Lazzarini, Juliano Negri, Thiago H. Segreto, Ricardo V. Godoy, Marcelo Becker

机构 * College of Mechanical Engineering, Federal University of Uberlândia(联邦大学伯南迪亚学院机械工程学院) Department of Mechanical Engineering, University of São Paulo(圣保罗大学机械工程系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种深度学习方法,通过模拟训练提升四足机器人抓取精度和适应性,实现自主导航与精准抓取。

Journal ref 2025 Latin American Robotics Symposium (LARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16784 2025-12-19 cs.CV 57%

R3ST: A Synthetic 3D Dataset With Realistic Trajectories

R3ST:一个具有真实轨迹的合成3D数据集

Simone Teglia, Claudia Melis Tonti, Francesco Pro, Leonardo Russo, Andrea Alfarano, Leonardo Pentassuglia, Irene Amerini

机构 * Sapienza University of Rome(萨皮恩扎罗马大学) INSAIT EURECOM

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 R3ST数据集通过生成真实轨迹和3D环境,提供准确的多模态标注,提升道路车辆轨迹预测研究

Journal ref Computer Analysis of Images and Patterns. CAIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16698 2025-12-19 cs.AI cs.CG 57%

Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning

多智能体表现更优吗?评估用于图示引导几何问题解决与推理的智能体框架

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Mohammad Nehad Alam, Proma Hossain Progga, Swakkhar Shatabda

机构 * BRAC University(布拉克大学) United International University(国际联合大学) Center for Computational & Data Sciences(计算与数据科学中心) Independent University, Bangladesh(孟加拉国独立大学) Spectrum Software & Consulting Ltd(Spectrum软件与咨询有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文评估了多智能体框架在图示引导几何问题解决中的表现,发现其对开源模型有明显提升,但对闭源模型效果有限,且并非普遍最优。

Comments Accepted to the ARR October 2025 cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16501 2025-12-19 cs.CV 57%

VenusBench-GD: A Comprehensive Multi-Platform GUI Benchmark for Diverse Grounding Tasks

VenusBench-GD: 一个全面的多平台GUI基准测试用于多样化的接地任务

Beitong Zhou, Zhexiao Huang, Yuan Guo, Zhangxuan Gu, Tianyu Xia, Zichen Luo, Fei Tang, Dehan Kong, Yanyi Shang, Suling Ou, Zhenlin Guo, Changhua Meng, Shuheng Shen

机构 * Venus Team, AntGroup(蚂蚁集团 Venus 团队)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 VenusBench-GD提出一个跨平台的GUI接地基准测试,通过分层任务分类和高质量数据构建,评估模型在基本和高级任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15705 2025-12-19 cs.CV 57%

GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization

GeoVista: 基于网络增强的代理视觉推理用于地理定位

Yikun Wang, Zuyan Liu, Ziyi Wang, Han Hu, Pengfei Liu, Yongming Rao

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文元) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 GeoVista通过整合图像缩放和网络搜索工具,提升地理定位任务的代理模型性能,实现优于开源模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14362 2025-12-19 cs.CV 57%

HydroChronos: Forecasting Decades of Surface Water Change

HydroChronos:预测数十年地表水变化

Daniele Rege Cambrin, Eleonora Poeta, Eliana Pastor, Isaac Corley, Tania Cerquitelli, Elena Baralis, Paolo Garza

机构 * Politecnico di Torino(托斯研究院) Wherobots(Wherobots公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 HydroChronos通过引入大规模多模态时空数据集和AquaClimaTempo UNet模型,显著提升了地表水动态预测的准确性与解释性。

Comments Accepted to SIGSPATIAL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15949 2025-12-19 cs.CV 57%

The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs

感知观测站:多模态大语言模型的鲁棒性与基础性表征

Tejas Anvekar, Fenil Bardoliya, Pavan K. Turaga, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 感知观测站通过系统性扰动和真实数据集,评估多模态大语言模型在视觉基础性和关系结构上的鲁棒性,揭示其在扰动下的表现,为模型分析提供系统基础。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 2 篇

2511.07392 2025-12-19 cs.CL cs.AI 81%

Voice-Interactive Surgical Agent for Multimodal Patient Data Control

多模态患者数据控制的语音交互手术代理

Hyeryun Park, Byung Mo Gu, Jun Hee Lee, Byeong Hyeon Choi, Sekeun Kim, Hyun Koo Kim, Kyungsang Kim

机构 * Image Guided Precision Cancer Surgery Institute, College of Medicine, Korea University(影像引导精准癌症手术研究所,韩国大学医学院) Department of Radiology, Massachusetts General Hospital(放射科,麻省总医院) Department of Thoracic and Cardiovascular Surgery, Korea University Guro Hospital, College of Medicine, Korea University(胸外科和心血管外科,韩国大学Guro医院,韩国大学医学院) Department of Biomedical Sciences, College of Medicine, Korea University(生物医学科学系,韩国大学医学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于大型语言模型的语音交互手术代理,用于多模态患者数据的高效控制与处理,通过分层多代理框架提升手术流程中的数据操作效率与鲁棒性。

Comments 14 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04460 2025-12-19 cs.CV 57%

V-Thinker: Interactive Thinking with Images

V-Thinker: 图像交互式思考

Runqi Qiao, Qiuna Tan, Minghan Yang, Guanting Dong, Peiqing Yang, Shiqiang Lang, Enhui Wan, Xiaowan Wang, Yida Xu, Lan Yang, Chong Sun, Chen Li, Jing Lyu, Honggang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) WeChat Vision, Tencent Inc.(腾讯公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 V-Thinker通过端到端强化学习实现图像交互式思考,提升多模态模型的视觉推理能力。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 5 篇

2512.15885 2025-12-19 cs.CV cs.AI cs.CL cs.MM 85%

Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models

超越文字:面向多模态大语言模型的自监督视觉学习

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Pier Luigi Dovesi, Shaghayegh Roohi, Mark Granroth-Wilding, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) AMD Silo AI

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 JARVIS通过自监督视觉学习提升多模态大语言模型的视觉推理能力,无需依赖语言监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20322 2025-12-19 cs.CV 85%

HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models

HyperET: 在超几何空间中为多模态大语言模型实现高效训练

Zelin Peng, Zhengqin Xu, Qingyang Liu, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, SJTU(摩埃人工智能重点实验室、人工智能学院、计算机科学学院、上海交通大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 HyperET通过在双曲空间中动态调整半径,实现多模态大语言模型的高效训练,提升跨模态对齐性能。

Comments Accepted by NeurIPS2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05037 2025-12-19 cs.LG 78%

ModalSurv: Investigating opportunities and limitations of multimodal deep survival learning in prostate and bladder cancer

ModalSurv: 探索多模态深度生存学习在前列腺和膀胱癌中的机会与局限

Noorul Wahab, Ethar Alzaid, Jiaqi Lv, Fayyaz Minhas, Adam Shephard, Shan E Ahmed Raza

机构 * TIA Centre, Department of Computer Science, University of Warwick, UK(沃里克大学计算机科学系TIA中心,英国)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 ModalSurv通过多模态数据整合提升生存预测,但在外部测试中临床特征表现更优,揭示了多模态对齐的挑战和泛化能力的限制。

Comments 4 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18267 2025-12-19 cs.LG cs.AI 57%

ARD-LoRA: Dynamic Rank Allocation for Parameter-Efficient Fine-Tuning of Foundation Models with Heterogeneous Adaptation Needs

ARD-LoRA:动态秩分配用于具有异质适应需求的基础模型参数高效微调

Haseeb Ullah Khan Shinwari, Muhammad Usama

机构 * Newton AI Lab(牛顿人工智能实验室) School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 ARD-LoRA通过动态秩分配提升基础模型微调效率,实现参数高效且适应性更强的模型调整。

Journal ref IEEE Transactions on Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06189 2025-12-19 cs.RO cs.HC 50%

Accessible and Pedagogically-Grounded Explainability for Human-Robot Interaction: A Framework Based on UDL and Symbolic Interfaces

可及且以教学为导向的机器人可解释性:基于UDL和符号接口的框架

Francisco J. Rodríguez Lera, Raquel Fernández Hernández, Sonia Lopez González, Miguel Angel González-Santamarta, Francisco Jesús Rodríguez Sedano, Camino Fernandez Llamas

机构 * Grupo de Robótica , EIIIA Campus de Vegazana, Universidad de León(机器人组,EIIIA校区,莱昂大学) C.E.E. Ntra. Sra. Del Sagrado Corazón(圣心宗女会)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出基于UDL和符号接口的框架,旨在通过多模态解释板提升人机交互中不同需求用户的可解释性与教学导向性。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 3 篇

2512.16345 2025-12-19 eess.SY cs.SY 78%

Contraction Analysis of Filippov Solutions in Multi-Modal Piecewise Smooth Systems

多模态分段光滑系统中Filippov解的收缩分析

Zonglin Liu, Kyra Borchhardt, Olaf Stursberg

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本文提出多模态分段光滑系统中Filippov解的收缩分析条件,并通过数值实验验证了理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16584 2025-12-19 cs.CV 70%

Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs

Sketch-in-Latents: 在潜在空间中实现多模态统一推理

Jintao Tong, Jiaqi Gu, Yujing Lou, Lubin Fan, Yixiong Zou, Yue Wu, Jieping Ye, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 其他多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 SkiLa通过在潜在空间中实现多模态统一推理,扩展MLLMs的自回归能力,生成连续视觉嵌入,提升视觉任务性能和多模态泛化能力。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01227 2025-12-19 astro-ph.EP cs.LG 50%

Reconstructing Atmospheric Parameters of Exoplanets Using Deep Learning

利用深度学习重建系外行星的大气参数

Flavio Giobergia, Alkis Koudounas, Elena Baralis

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种基于深度学习的多目标概率回归方法,用于高效提取系外行星的大气参数,克服计算限制并提升分析效率。

Comments 5 pages + references

详情

展开后加载摘要…

URL PDF HTML 收藏