arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-29 至 2025-12-29 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2507.18033 2025-12-29 cs.RO cs.AI 83%

OpenNav: Open-World Navigation with Multimodal Large Language Models

OpenNav: 基于多模态大语言模型的开放世界导航

Mingfeng Yuan, Letian Wang, Steven L. Waslander

机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究 institute) University of Toronto Robotics Institute(多伦多大学机器人研究所)

专题命中 图文多模态 :multimodal(title);multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 OpenNav利用多模态大语言模型实现开放世界导航,通过生成价值图增强机器人空间理解,并在真实场景中验证其鲁棒性。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21583 2025-12-29 cs.AI 83%

A Medical Multimodal Diagnostic Framework Integrating Vision-Language Models and Logic Tree Reasoning

一种整合视觉-语言模型和逻辑树推理的医学多模态诊断框架

Zelin Zang, Wenyi Gu, Siqi Ma, Dan Yang, Yue Shen, Zhu Zhang, Guohui Fan, Wing-Kuen Ling, Fuji Yang

机构 * Tsientang Institute of Advanced Study (TIAS)(钱塘先进研究所) Westlake University(西湖大学) Ant Group(蚂蚁集团) China-Japan Friendship Hospital(中日友好医院)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出一种整合视觉-语言模型与逻辑树推理的医学诊断框架,旨在提升多模态医学AI的可信度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21529 2025-12-29 cs.CV cs.AI 73%

Hierarchy-Aware Fine-Tuning of Vision-Language Models

层级感知的视觉-语言模型微调

Jiayu Li, Rajesh Gangireddy, Samet Akcay, Wei Cheng, Juhua Hu

机构 * University of Washington(华盛顿大学) Intel(英特尔)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种高效的层级感知微调框架,通过结合树路径KL散度和层级兄弟平滑交叉熵,提升视觉-语言模型在结构化分类任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06259 2025-12-29 cs.CV cs.AI 73%

SIFThinker: Spatially-Aware Image Focus for Visual Reasoning

SIFThinker: 基于空间的图像聚焦用于视觉推理

Zhangquan Chen, Ruihui Zhao, Chuwei Luo, Mingze Sun, Xinlei Yu, Yangyang Kang, Ruqi Huang

机构 * ByteDance(字节跳动)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 SIFThinker通过结合深度增强的边界框和自然语言,提升视觉推理中的空间理解和细粒度感知能力。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21871 2025-12-29 cs.CL cs.AI cs.CR cs.CY 62%

Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?

弥合版权鸿沟:大型视觉-语言模型是否能识别并尊重受版权保护的内容?

Naen Xu, Jinghuai Zhang, Changjiang Li, Hengyu An, Chunyi Zhou, Jun Wang, Boyu Xu, Yuyuan Li, Tianyu Du, Shouling Ji

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型视觉-语言模型在处理受版权保护内容时的合规性问题,提出了一种新的工具增强防御框架以降低侵权风险。

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV 57%

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21450 2025-12-29 cs.LG 50%

RLLaVA: An RL-central Framework for Language and Vision Assistants

RLLaVA: 一种面向语言和视觉助手的强化学习中心框架

Lei Zhao, Zihao Ma, Boyu Lin, Yuhe Liu, Wenjun Wu, Lei Huang

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(信息与电子技术学院,人工智能研究院,北京航空航天大学,北京,中国) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(杭州国际创新研究院,北京航空航天大学,杭州,中国)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 RLLaVA 提出了一种强化学习中心框架,通过解耦算法逻辑与模型架构,实现高效训练和多任务扩展,提升视觉-语言模型性能。

Comments The code is available at https://github.com/TinyLoopX/RLLaVA

详情

展开后加载摘要…

URL PDF HTML 收藏