arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-26 至 2025-09-26 共收录 57 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 9 篇

2509.21107 2025-09-26 cs.RO cs.AI cs.CV cs.LG 81%

Cross-Modal Instructions for Robot Motion Generation

William Barron, Xiaoxiang Dong, Matthew Johnson-Roberson, Weiming Zhi

机构 * College of Connected Computing, Vanderbilt University(连接计算学院,范德比尔特大学) Robotics Institute, Carnegie Mellon University(机器人研究所,卡内基梅隆大学) School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21245 2025-09-26 cs.CV cs.AI 73%

Hunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D Assets

Team Hunyuan3D, :, Bowen Zhang, Chunchao Guo, Haolin Liu, Hongyu Yan, Huiwen Shi, Jingwei Huang, Junlin Yu, Kunhong Li, Linus, Penghao Wang, Qingxiang Lin, Sicong Liu, Xianghui Yang, Yixuan Tang, Yunfei Zhao, Zeqiang Lai, Zhihao Liang, Zibo Zhao

机构 * Tencent(腾讯)

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Technical Report; 3D Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16663 2025-09-26 cs.CL cs.AI 62%

Turning Internal Gap into Self-Improvement: Promoting the Generation-Understanding Unification in MLLMs

Yujin Han, Hao Chen, Andi Han, Zhiheng Wang, Xinyu Liu, Yingya Zhang, Shiwei Zhang, Difan Zou

专题命中 多模态生成 :MLLM(abstract);分类 cs.CL、cs.AI

Comments 31 pages, 16 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18907 2025-09-26 cs.AI cs.CV cs.RO 62%

EC-Diffuser: Multi-Object Manipulation via Entity-Centric Behavior Generation

Carl Qi, Dan Haramati, Tal Daniel, Aviv Tamar, Amy Zhang

机构 * UT Austin(得克萨斯大学) Technion, Israel Institute of Technology(技术学院,以色列技术学院) Brown University(布朗大学) Meta AI

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17094 2025-09-26 cond-mat.mtrl-sci cs.AI cs.LG 57%

DiffSyn: A Generative Diffusion Approach to Materials Synthesis Planning

Elton Pan, Soonhyoung Kwon, Sulin Liu, Mingrou Xie, Alexander J. Hoffman, Yifei Duan, Thorben Prein, Killian Sheriff, Yuriy Roman-Leshkov, Manuel Moliner, Rafael Gomez-Bombarelli, Elsa Olivetti

机构 * Instituto de Tecnología Química, Universitat Politècnica de València-Consejo Superior de Investigaciones Científicas(化学技术研究所,瓦伦西亚理工大学-西班牙高等科学研究理事会)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21129 2025-09-26 cs.LG cs.CR 50%

EvoMail: Self-Evolving Cognitive Agents for Adaptive Spam and Phishing Email Defense

Wei Huang, De-Tian Chu, Lin-Yuan Bai, Wei Kang, Hai-Tao Zhang, Bo Li, Zhi-Mo Han, Jing Ge, Hai-Feng Lin

机构 * People’s Liberation Army 77606 Unit(中国人民解放军77606单位) Field Engineering College, Army Engineering University of PLA(陆军工程大学工程学院) College Of Software, ZhengZhou University of Light Industry(郑州轻工业大学软件学院)

专题命中 多模态生成 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21022 2025-09-26 cs.LG 50%

Actor-Critic without Actor

Donghyeon Ki, Hee-Jun Ahn, Kyungyoon Kim, Byung-Jun Lee

机构 * Korea University(韩国大学) Gauss Labs Inc.(Gauss实验室)

专题命中 多模态生成 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 10 篇

2509.21050 2025-09-26 cs.LG cs.AI 83%

GeoRef: Referring Expressions in Geometry via Task Formulation, Synthetic Supervision, and Reinforced MLLM-based Solutions

Bing Liu, Wenqiang Yv, Xuzheng Yang, Shichang Wang, Junzhuo Liu, Peng Wang, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) Tongji University(同济大学)

专题命中 多模态评测 :MLLM(title);multimodal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20858 2025-09-26 cs.GR cs.CV cs.MM 81%

ArchGPT: Understanding the World's Architectures with Large Multimodal Models

Yuze Wang, Luo Yang, Junyi Wang, Yue Qi

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北京航空航天大学) School of Computer Science and Technology(计算机科学与技术学院) Shandong University(山东大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00213 2025-09-26 cs.CV cs.AI 81%

Multimodal Deep Learning for Phyllodes Tumor Classification from Ultrasound and Clinical Data

Farhan Fuad Abir, Abigail Elliott Daly, Kyle Anderman, Tolga Ozmen, Laura J. Brattain

机构 * Department of Electrical and Computer Engineering, University of Central Florida(电子与计算机工程系,中央佛罗里达大学) Massachusetts General Hospital, Department of Surgery, Section of Breast Surgery(麻省总医院,外科部,乳腺外科) Department of Medicine, University of Central Florida College of Medicine(医学系,中央佛罗里达大学医学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments IEEE-EMBS International Conference on Body Sensor Networks (IEEE-EMBS BSN 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19096 2025-09-26 cs.CV cs.SE 79%

Investigating Traffic Accident Detection Using Multimodal Large Language Models

Ilhan Skender, Kailin Tong, Selim Solmaz, Daniel Watzenig

机构 * Embedded Systems Group (Dept.-E)(嵌入式系统组) Virtual Vehicle Research GmbH(虚拟车辆研究公司) Control Systems Group (Dept.-E)(控制系统组) Institute of Visual Computing(视觉计算研究所) Graz University of Technology(格拉茨技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted for presentation at the 2025 IEEE International Automated Vehicle Validation Conference (IAVVC 2025). Final version to appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18157 2025-09-26 cs.CY cs.LG 78%

Learning Progression-Guided AI Evaluation of Scientific Models To Support Diverse Multi-Modal Understanding in NGSS Classroom

Leonora Kaldaras, Tingting Li, Prudence Djagba, Kevin Haudek, Joseph Krajcik

专题命中 多模态评测 :multi-modal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19993 2025-09-26 cs.CL cs.AI cs.HC 76%

MathBuddy: A Multimodal System for Affective Math Tutoring

Debanjana Kar, Leopold Böss, Dacia Braca, Sebastian Maximilian Dennerlein, Nina Christine Hubig, Philipp Wintersberger, Yufang Hou

机构 * IT:U Interdisciplinary Transformation University Austria(奥地利 interdisciplinary Transformation 大学) IBM Research India(印度 IBM 研究院)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 (Demo Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21291 2025-09-26 cs.AI cs.CV 62%

VC-Agent: An Interactive Agent for Customized Video Dataset Collection

Yidan Zhang, Mutian Xu, Yiming Hao, Kun Zhou, Jiahao Chang, Xiaoqiang Liu, Pengfei Wan, Hongbo Fu, Xiaoguang Han

机构 * SSE, The Chinese University of Hong Kong, Shenzhen(深圳中文大学香港科技大学 SSE) The Hong Kong University of Science(香港科学大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Project page: https://allenyidan.github.io/vcagent_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20920 2025-09-26 cs.CV 57%

RIS-LAD: A Benchmark and Model for Referring Low-Altitude Drone Image Segmentation

Kai Ye, YingShi Luan, Zhudi Chen, Guangyue Meng, Pingyang Dai, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(教育部多媒体可信感知与高效计算重点实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01733 2025-09-26 cs.CL 57%

ASCIIEval: Benchmarking Models' Visual Perception in Text Strings via ASCII Art

Qi Jia, Xiang Yue, Shanshan Huang, Ziheng Qin, Yizhu Liu, Bill Yuchen Lin, Yang You, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) Carnegie Mellon University(卡内基梅隆大学) Guangzhou University(广州大学) Meituan(美团) University of Washington(华盛顿大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20486 2025-09-26 cs.RO 50%

Boosting LiDAR-Based Localization with Semantic Insight: Camera Projection versus Direct LiDAR Segmentation

Sven Ochs, Philip Schörner, Marc René Zofka, J. Marius Zöllner

机构 * Department of Technical Cognitive Systems, FZI Research Center for Information Technology(技术认知系统部门,信息技术研究所以暨创新中心) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄大学)

专题命中 多模态评测 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 5 篇

2505.10547 2025-09-26 cs.RO cs.AI 79%

Real-Time Out-of-Distribution Failure Prevention via Multi-Modal Reasoning

Milan Ganai, Rohan Sinha, Christopher Agia, Daniel Morton, Luigi Di Lillo, Marco Pavone

机构 * Stanford University(斯坦福大学) Swiss Re(瑞士再保险集团) NVIDIA Research(NVIDIA研究)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

Comments Conference on Robot Learning (CoRL) 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20499 2025-09-26 cs.RO cs.AI 70%

Boosting Zero-Shot VLN via Abstract Obstacle Map-Based Waypoint Prediction with TopoGraph-and-VisitInfo-Aware Prompting

Boqi Li, Siyuan Li, Weiyi Wang, Anran Li, Zhong Cao, Henry X. Liu

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12026 2025-09-26 cs.CV 70%

3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering

Rongtao Xu, Han Gao, Mingming Yu, Dong An, Shunpeng Chen, Changwei Wang, Li Guo, Xiaodan Liang, Shibiao Xu

专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21072 2025-09-26 cs.AI 57%

Recon-Act: A Self-Evolving Multi-Agent Browser-Use System via Web Reconnaissance, Tool Generation, and Task Execution

Kaiwen He, Zhiwei Wang, Chenyi Zhuang, Jinjie Gu

机构 * AWorld Team, Inclusion AI(Inclusion AI)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20841 2025-09-26 cs.RO cs.AI cs.LG 57%

ImaginationPolicy: Towards Generalizable, Precise and Reliable End-to-End Policy for Robotic Manipulation

Dekun Lu, Wei Gao, Kui Jia

机构 * Dekun Lu ∗ , Wei Gao ∗ and Kui Jia ∗(作者)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

Comments First two authors contribute equally. Project page: https://sites.google.com/view/imaginationpolicy

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 3 篇

2509.21268 2025-09-26 cs.CV 79%

MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources

Sicong Leng, Jing Wang, Jiaxi Li, Hao Zhang, Zhiqiang Hu, Boqiang Zhang, Yuming Jiang, Hang Zhang, Xin Li, Lidong Bing, Deli Zhao, Wei Lu, Yu Rong, Aixin Sun, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20840 2025-09-26 cs.LG 78%

Shaping Initial State Prevents Modality Competition in Multi-modal Fusion: A Two-stage Scheduling Framework via Fast Partial Information Decomposition

Jiaqi Tang, Yinsong Xu, Yang Liu, Qingchao Chen

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学人民医院医学技术研究所) National Institute of Health Data Science(国家健康数据科学研究院) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20751 2025-09-26 cs.CV cs.AI cs.CL 67%

Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models

Zoe Wanying He, Sean Trott, Meenakshi Khosla

机构 * Department of Cognitive Science University of California, San Diego(认知科学系,加州大学圣地亚哥分校)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted at EMNLP 2025 (camera-ready)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他多模态 2 篇

2509.20780 2025-09-26 cs.SE 50%

Exploring Engagement in Hybrid Meetings

Daniela Grassi, Fabio Calefato, Darja Smite, Nicole Novielli, Filippo Lanubile

专题命中 其他多模态 :multimodal(abstract)

Journal ref In Proc. of 19th ACM/IEEE International Symposium on Empirical Software Engineering and Measurement (ESEM'25), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10614 2025-09-26 cs.RO 50%

Omni-Roach: A legged robot capable of traversing multiple types of large obstacles and self-righting

Jonathan Mi, Yaqing Wang, Chen Li

专题命中 其他多模态 :multi-modal(abstract)

Journal ref IEEE International Conference on Robotics and Automation (ICRA), 235-242 (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏