arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-05 至 2025-12-05 共收录 43 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 5 篇

2512.04513 2025-12-05 cs.AI 85%

BiTAgent: A Task-Aware Modular Framework for Bidirectional Coupling between Multimodal Large Language Models and World Models

BiTAgent: 一种面向任务的模块化框架,用于多模态大语言模型与世界模型之间的双向耦合

Yu-Wei Zhan, Xin Wang, Pengzhe Mao, Tongtong Feng, Ren Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学) Shandong University(山东大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.AI

AI总结 BiTAgent通过双向耦合多模态大语言模型与世界模型,实现任务感知的动态联合学习,提升多任务和跨环境的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05111 2025-12-05 cs.CV 79%

ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

ARM-Thinker: 通过智能工具使用和视觉推理强化多模态生成奖励模型

Shengyuan Ding, Xinyu Fang, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiangyu Zhao, Haodong Duan, Xiaoyi Dong, Jianze Liang, Bin Wang, Conghui He, Dahua Lin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 ARM-Thinker通过智能工具使用和视觉推理提升多模态奖励模型的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12679 2025-12-05 cs.CV 79%

TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents

TongUI: 通过多模态网络教程构建大规模GUI代理

Bofei Zhang, Zirui Shang, Zhi Gao, Wang Zhang, Rui Xie, Xiaojian Ma, Tao Yuan, Xinxiao Wu, Song-Chun Zhu, Qing Li

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 TongUI通过多模态网络教程构建大规模GUI代理,利用GUI-Net数据集提升定位和导航性能,优于基线代理10%。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04308 2025-12-05 cs.RO 78%

ResponsibleRobotBench: Benchmarking Responsible Robot Manipulation using Multi-modal Large Language Models

ResponsibleRobotBench: 使用多模态大语言模型评估负责任的机器人操控

Lei Zhang, Ju Dong, Kaixin Bai, Minheng Ni, Zoltan-Csaba Marton, Zhaopeng Chen, Jianwei Zhang

机构 * University of Hamburg(汉堡大学) Agile Robots SE(敏捷机器人公司) Technical University of Munich(慕尼黑技术大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态Agent :multi-modal(title);multimodal(abstract)

AI总结 ResponsibleRobotBench通过多模态大语言模型评估机器人操控的责任性,涵盖23个多阶段任务,强调安全性、泛化能力和物理可靠性。

Comments https://sites.google.com/view/responsible-robotbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04785 2025-12-05 cs.AI cs.CR 57%

ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications

ASTRIDE:面向智能体AI应用的安全威胁建模平台

Eranga Bandara, Amin Hass, Ross Gore, Sachin Shetty, Ravi Mukkamala, Safdar H. Bouk, Xueping Liang, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(老奥布里恩大学) Accenture Technology Labs(埃森哲技术实验室) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 ASTRIDE是首个专为AI智能体应用设计的自动化威胁建模平台,通过扩展STRIDE框架并结合微调的视觉语言模型与推理LLM,实现基于图的威胁建模自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 6 篇

2409.18541 2025-12-05 cs.AI 85%

Align$^2$LLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curation

Align$^2$LLaVA: 多模态指令编纂的级联人类与大语言模型偏好对齐

Hongzhe Huang, Jiang Liu, Zhewen Yu, Li Cai, Dian Jiao, Wenqiao Zhang, Siliang Tang, Juncheng Li, Hao Jiang, Haoyuan Li, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba(阿里巴巴)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 Align$^2$LLaVA通过级联人类与LLM偏好对齐方法,有效压缩多模态指令数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04425 2025-12-05 cs.CV cs.AI 81%

Explainable Parkinsons Disease Gait Recognition Using Multimodal RGB-D Fusion and Large Language Models

可解释的帕金森病步态识别:基于多模态RGB-D融合与大语言模型

Manar Alnaasan, Md Selim Sarowar, Sungho Kim

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于多模态RGB-D融合与大语言模型的帕金森病步态识别框架,通过增强时空表示和语言解释提高识别准确性和临床可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04943 2025-12-05 cs.CV 79%

Towards Adaptive Fusion of Multimodal Deep Networks for Human Action Recognition

面向人类动作识别的多模态深度网络自适应融合

Novanto Yudistira

机构 * Departemen Teknik Informatika, Fakultas Ilmu Komputer, Universitas Brawijaya(计算机科学系,信息学院,布拉格亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于多模态深度网络的自适应融合方法,通过门控机制提升人类动作识别的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16848 2025-12-05 cs.CV 79%

A re-calibration method for object detection with multi-modal alignment bias in autonomous driving

面向自动驾驶的多模态对齐偏差校准方法

Zhihang Song, Dingyi Yao, Ruibo Ming, Lihui Peng, Danya Yao, Yi Zhang

机构 * Department of Automation Tsinghua University Beijing(自动化系清华大学北京)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种重新校准模型,通过语义分割和定制损失函数提升自动驾驶中多模态检测的鲁棒性和性能,应对校准偏差带来的影响。

Comments Accepted for publication in IST 2025. Official IEEE Xplore entry will be available once published

Journal ref 2025 IEEE International Conference on Imaging Systems and Techniques (IST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09560 2025-12-05 cs.CV cs.RO 70%

WeatherPrompt: Multi-modality Representation Learning for All-Weather Drone Visual Geo-Localization

WeatherPrompt: 多模态表示学习用于全天候无人机视觉地理定位

Jiahao Wen, Hang Yu, Zhedong Zheng

机构 * School of Computer Engineering and Science, Shanghai University, China(上海大学计算机工程与科学学院) Faculty of Science and Technology and Institute of Collaborative Innovation, University of Macau, China(澳门大学科技学院和协同创新研究院)

专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 WeatherPrompt通过多模态学习提升无人机在恶劣天气下的视觉地理定位性能,采用无训练天气推理和动态门控机制实现天气不变表示,提升天气鲁棒性和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23075 2025-12-05 cs.CV cs.AI 62%

SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models

SpaceMind: 基于摄像头引导的模态融合用于视觉-语言模型中的空间推理

Ruosen Zhao, Zhikang Zhang, Jialei Xu, Jiahao Chang, Dong Chen, Lingyun Li, Weijian Sun, Zizhuang Wei

机构 * Huawei(华为) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SpaceMind通过摄像头引导的模态融合方法,提升视觉-语言模型在空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 2 篇

2512.04187 2025-12-05 cs.CV cs.AI 62%

OnSight Pathology: A real-time platform-agnostic computational pathology companion for histopathology

OnSight病理科:一种实时、平台无关的计算病理科辅助工具,用于组织病理学

Jinzhen Hu, Kevin Faust, Parsa Babaei Zadeh, Adrienn Bourkas, Shane Eaton, Andrew Young, Anzar Alvi, Dimitrios George Oreopoulos, Ameesha Paliwal, Assem Saleh Alrumeh, Evelyn Rose Kamski-Hennekam, Phedias Diamandis

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 OnSight病理科是一种实时、平台无关的计算病理科工具,通过本地运行的AI模型提供实时诊断支持,适用于多种病理学流程和场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05071 2025-12-05 eess.SY cs.SY 50%

The Evolving Landscape of Interactive Surface Sensing Technologies

交互式表面传感技术的演变图景

David Wang, Wilson Chen, Tianju Wang, Jiale Zhang

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文综述了交互式表面传感技术的发展历程,分析了不同传感模态的优劣,探讨了未来智能交互环境的潜力与挑战。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏