arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-21 至 2025-10-21 共收录 94 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 5 篇

2504.20322 2025-10-21 cs.CV cs.LG 57%

Fine-Grained Classification: Connecting Metadata via Cross-Contrastive Pre-Training

Sumit Mamtani, Yash Thesia

机构 * New York University(纽约大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments 5 pages, 4 figures. Accepted at IEEE ISCMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16803 2025-10-21 cs.IR 50%

An Efficient Framework for Whole-Page Reranking via Single-Modal Supervision

Zishuai Zhang, Sihao Yu, Wenyi Xie, Ying Nie, Junfeng Wang, Zhiming Zheng, Dawei Yin, Hainan Zhang

专题命中 跨模态检索 :cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 9 篇

2507.22827 2025-10-21 cs.CV 83%

ScreenCoder: Advancing Visual-to-Code Generation for Front-End Automation via Modular Multimodal Agents

Yilei Jiang, Yaozhi Zheng, Yuxuan Wan, Jiaming Han, Qunzhong Wang, Michael R. Lyu, Xiangyu Yue

机构 * CUHK(香港中文大学) MMLab(多模态实验室) ARISE Lab(ARISE实验室)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments ScreenCoder-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15872 2025-10-21 cs.AR cs.AI cs.LG 83%

Multimodal Chip Physical Design Engineer Assistant

Yun-Da Tsai, Chang-Yu Chao, Liang-Yeh Shen, Tsung-Han Lin, Haoyu Yang, Mark Ho, Yi-Chen Lu, Wen-Hao Liu, Shou-De Lin, Haoxing Ren

机构 * National Taiwan University(国立台湾大学) NVIDIA Research(NVIDIA研究)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17002 2025-10-21 cs.LG 82%

EEschematic: Multimodal-LLM Based AI Agent for Schematic Generation of Analog Circuit

Chang Liu, Danial Chitnis

机构 * School of Engineering The University of Edinburgh Edinburgh, UK(工程学院 苏格兰爱丁堡大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16990 2025-10-21 cs.LG 82%

Graph4MM: Weaving Multimodal Learning with Structural Information

Xuying Ning, Dongqi Fu, Tianxin Wei, Wujiang Xu, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta AI Rutgers University(罗格斯大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09121 2025-10-21 cs.CV cs.AI 81%

MSDM: Generating Task-Specific Pathology Images with a Multimodal Conditioned Diffusion Model for Cell and Nuclei Segmentation

Dominik Winter, Mai Bui, Monica Azqueta Gavaldon, Nicolas Triltsch, Marco Rosati, Nicolas Brieu

机构 * AstraZeneca Computational Pathology GmbH(阿斯利康计算病理学 GmbH)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17157 2025-10-21 cs.CV cs.AI 73%

GACO-CAD: Geometry-Augmented and Conciseness-Optimized CAD Model Generation from Single Image

Yinghui Wang, Xinyu Zhang, Peng Du

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16844 2025-10-21 cs.CL cs.AI cs.CE 62%

FinSight: Towards Real-World Financial Deep Research

Jiajie Jin, Yuyao Zhang, Yimeng Xu, Hongjin Qian, Yutao Zhu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) BAAI(北京人工智能研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15914 2025-10-21 cs.AR cs.AI cs.PL 57%

VeriGRAG: Enhancing LLM-Based Verilog Code Generation with Structure-Aware Soft Prompts

Jiayu Zhao, Song Chen

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14111 2025-10-21 cs.LG 50%

From AI for Science to Agentic Science: A Survey on Autonomous Scientific Discovery

Jiaqi Wei, Yuejin Yang, Xiang Zhang, Yuhan Chen, Xiang Zhuang, Zhangyang Gao, Dongzhan Zhou, Guangshuai Wang, Zhiqiang Gao, Juntai Cao, Zijie Qiu, Ming Hu, Chenglong Ma, Shixiang Tang, Junjun He, Chunfeng Song, Xuming He, Qiang Zhang, Chenyu You, Shuangjia Zheng, Ning Ding, Wanli Ouyang, Nanqing Dong, Yu Cheng, Siqi Sun, Lei Bai, Bowen Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Fudan University(复旦大学) University of British Columbia(不列颠哥伦比亚大学) Tongji University(同济大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiaotong University(上海交通大学) Stony Brook University(石溪大学) Lingang Laboratory(临港实验室) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 17 篇

2503.06073 2025-10-21 cs.CL cs.AI cs.CV 87%

GEM: Empowering MLLM for Grounded ECG Understanding with Time Series and Images

Xiang Lan, Feng Wu, Kai He, Qinghao Zhao, Shenda Hong, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Peking University People’s Hospital(北京大学人民医院) Peking University(北京大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments NeurIPS 2025 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02104 2025-10-21 eess.IV cs.CV 83%

REACT-KD: Region-Aware Cross-modal Topological Knowledge Distillation for Interpretable Medical Image Classification

Hongzhao Chen, Hexiao Ding, Yufeng Jiang, Jing Lan, Ka Chun Li, Gerald W. Y. Cheng, Nga-Chun Ng, Yao Pu, Jing Cai, Liang-ting Lin, Jung Sun Yoo

机构 * Department of Health Technology and Informatics, Hong Kong Polytechnic University(健康科技与信息技术系,香港理工大学) Department of Nuclear Medicine and PET, Hong Kong Sanatorium and Hospital(核医学与PET部门,香港疗养院及医院)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18601 2025-10-21 cs.CL cs.AI 81%

Flex-Judge: Text-Only Reasoning Unleashes Zero-Shot Multimodal Evaluators

Jongwoo Ko, Sungnyun Kim, Sungwoo Cho, Se-Young Yun

机构 * Microsoft(微软公司) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17455 2025-10-21 cs.CL cs.AI 81%

Towards Evaluating Proactive Risk Awareness of Multimodal Language Models

Youliang Yuan, Wenxiang Jiao, Yuejin Xie, Chihao Shen, Menghan Tian, Wenxuan Wang, Jen-tse Huang, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Xiaohongshu Inc.(小红书公司) Renmin University of China(中国人民大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025 (Track on Datasets and Benchmarks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17274 2025-10-21 cs.CV 79%

Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models

Katie Luo, Jingwei Ji, Tong He, Runsheng Xu, Yichen Xie, Dragomir Anguelov, Mingxing Tan

机构 * Computer and Information Sciences Department, Cornell University(康奈尔大学计算机与信息科学系) Waymo LLC(Waymo公司) UC Berkeley(伯克利大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments In proceedings of IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16536 2025-10-21 q-bio.QM cs.AI cs.LG 79%

Few-Label Multimodal Modeling of SNP Variants and ECG Phenotypes Using Large Language Models for Cardiovascular Risk Stratification

Niranjana Arun Menon, Yulong Li, Iqra Farooq, Sara Ahmed, Muhammad Awais, Imran Razzak

机构 * University of New South Wales, Australia(新南威尔士大学,澳大利亚) University of Surrey, United Kingdom(萨里大学,英国) Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16258 2025-10-21 cs.CV 79%

Embody 3D: A Large-scale Multimodal Motion and Behavior Dataset

Claire McLean, Makenzie Meendering, Tristan Swartz, Orri Gabbay, Alexandra Olsen, Rachel Jacobs, Nicholas Rosen, Philippe de Bree, Tony Garcia, Gadsden Merrill, Jake Sandakly, Julia Buffalini, Neham Jain, Steven Krenn, Moneish Kumar, Dejan Markovic, Evonne Ng, Fabian Prada, Andrew Saba, Siwei Zhang, Vasu Agrawal, Tim Godisart, Alexander Richard, Michael Zollhoefer

机构 * Codec Avatars Lab, Meta(Meta 编码化身实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03839 2025-10-21 cs.IR cs.CL 79%

Adaptive Data-Resilient Multi-Modal Hierarchical Multi-Label Book Genre Identification

Utsav Kumar Nareti, Soumi Chattopadhyay, Prolay Mallick, Suraj Kumar, Chandranath Adak, Ayush Vikas Daga, Adarsh Wase, Arjab Roy

机构 * Dept. of CSE, IIT Patna, India(计算机科学与工程系,印度帕纳布理工大学) Dept. of CSE, IIT Indore, India(计算机科学与工程系,印度英迪亚理工大学) SVNIT, India(萨瓦尼特理工学院,印度) IIT Indore and IIM Indore, India(英迪亚理工大学和印度管理学院,印度) Dept. of HSS, IIIT Guwahati, India(人文社会科学系,印度古瓦哈提理工学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08814 2025-10-21 cs.CY cs.CL 79%

A social context-aware graph-based multimodal attentive learning framework for disaster content classification during emergencies: a benchmark dataset and method

Shahid Shafi Dar, Mohammad Zia Ur Rehman, Karan Bais, Mohammed Abdul Haseeb, Nagendra Kumara

机构 * Indian Institute of Technology Indore(印度理工学院Indore分校) Institute of Engineering(工程院) Indian Institute of Information Technology Dharwad(印度信息技术学院Dharwad分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

Journal ref journal={Expert Systems with Applications},pages={125337},year={2024},publisher={Elsevier}

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13882 2025-10-21 cs.HC 78%

Toward Multimodal Privacy in XR: Design and Evaluation of Composite Privatization Methods for Gaze and Body Tracking Data

Azim Ibragimov, Ethan Wilson, Kevin R. B. Butler, Eakta Jain

专题命中 多模态评测 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17332 2025-10-21 cs.CV 70%

iDETEX: Empowering MLLMs for Intelligent DETailed EXplainable IQA

Zhaoran Zhao, Xinli Yue, Jianhui Sun, Yuhao Xie, Tao Shao, Liangchao Yao, Fan Xia, Yuetang Deng

机构 * Tencent, WeChat(腾讯,微信)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to ICCV 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16134 2025-10-21 cs.CV cs.AI cs.HC cs.LG cs.RO 62%

Aria Gen 2 Pilot Dataset

Chen Kong, James Fort, Aria Kang, Jonathan Wittmer, Simon Green, Tianwei Shen, Yipu Zhao, Cheng Peng, Gustavo Solaira, Andrew Berkovich, Nikhil Raina, Vijay Baiyya, Evgeniy Oleinik, Eric Huang, Fan Zhang, Julian Straub, Mark Schwesinger, Luis Pesqueira, Xiaqing Pan, Jakob Julian Engel, Carl Ren, Mingfei Yan, Richard Newcombe

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16057 2025-10-21 cs.CL cs.AI 62%

Fusion-Augmented Large Language Models: Boosting Diagnostic Trustworthiness via Model Consensus

Md Kamrul Siam, Md Jobair Hossain Faruk, Jerry Q. Cheng, Huanying Gu

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 7 pages (Accepted to IEEE BHI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25748 2025-10-21 cs.CV cs.AI 62%

Dolphin v1.0 Technical Report

Taohan Weng, Kaibing Hu, Henan Liu, Siya Liu, Xiaoyang Liu, Zhenyu Liu, Jiren Ren, Boyan Wang, Boyang Wang, Yiyu Wang, Yalun Wu, Chaoran Yan, Kaiwen Yan, Jinze Yu, Chi Zhang, Duo Zhang, Haoyun Zheng, Xiaoqing Guo, Jacques Souquet, Hongcheng Guo, Anjie Le

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17163 2025-10-21 cs.SE cs.AI 57%

TREAT: A Code LLMs Trustworthiness / Reliability Evaluation and Testing Framework

Shuzheng Gao, Eric John Li, Man Ho Lam, Jingyu Xiao, Yuxuan Wan, Chaozheng Wang, Ng Man Tik, Michael R. Lyu

机构 * ARISE Lab, Department of Computer Science and Engineering(ARISE实验室,计算机科学与工程系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15208 2025-10-21 cs.CV 57%

CARDIUM: Congenital Anomaly Recognition with Diagnostic Images and Unified Medical records

Daniela Vega, Hannah V. Ceballos, Javier S. Vera, Santiago Rodriguez, Alejandra Perez, Angela Castillo, Maria Escobar, Dario Londoño, Luis A. Sarmiento, Camila I. Castro, Nadiezhda Rodriguez, Juan C. Briceño, Pablo Arbeláez

机构 * Universidad de los Andes(andes大学) Fundación Santa Fe de Bogotá(圣费博多哥基金会)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments Accepted to CVAMD Workshop, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13638 2025-10-21 cs.CV 57%

Challenges, Advances, and Evaluation Metrics in Medical Image Enhancement: A Systematic Literature Review

Chun Wai Chin, Haniza Yazid, Hoi Leong Lee

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态Agent 7 篇

2510.16774 2025-10-21 cs.LG cs.AI 80%

Learning to play: A Multimodal Agent for 3D Game-Play

Yuguang Yue, Irakli Salia, Samuel Hunt, Christopher Green, Wenzhe Shi, Jonathan J Hunt

机构 * Player2

专题命中 多模态Agent :multimodal(title);multi-modal(abstract,comments);分类 cs.AI

Comments International Conference on Computer Vision Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21148 2025-10-21 cs.CL cs.AI 73%

A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers

Ming Hu, Chenglong Ma, Wei Li, Wanghan Xu, Jiamin Wu, Jucheng Hu, Tianbin Li, Guohang Zhuang, Jiaqi Liu, Yingzhou Lu, Ying Chen, Chaoyang Zhang, Cheng Tan, Jie Ying, Guocheng Wu, Shujian Gao, Pengcheng Chen, Jiashi Lin, Haitao Wu, Lulu Chen, Fengxiang Wang, Yuanyuan Zhang, Xiangyu Zhao, Feilong Tang, Encheng Su, Junzhi Ning, Xinyao Liu, Ye Du, Changkai Ji, Pengfei Jiang, Cheng Tang, Ziyan Huang, Jiyao Liu, Jiaqi Wei, Yuejin Yang, Xiang Zhang, Guangshuai Wang, Yue Yang, Huihui Xu, Ziyang Chen, Yizhou Wang, Chen Tang, Jianyu Wu, Yuchen Ren, Siyuan Yan, Zhonghua Wang, Zhongxing Xu, Shiyan Su, Shangquan Sun, Runkai Zhao, Zhisheng Zhang, Dingkang Yang, Jinjie Wei, Jiaqi Wang, Jiahao Xu, Jiangtao Yan, Wenhao Tang, Hongze Zhu, Yu Liu, Fudi Wang, Yiqing Shen, Yuanfeng Ji, Yanzhou Su, Tong Xie, Hongming Shan, Chun-Mei Feng, Zhi Hou, Diping Song, Lihao Liu, Yanyan Huang, Lequan Yu, Bin Fu, Shujun Wang, Xiaomeng Li, Xiaowei Hu, Yun Gu, Ben Fei, Benyou Wang, Yuewen Cao, Minjie Shen, Jie Xu, Haodong Duan, Fang Yan, Hongxia Hao, Jielan Li, Jiajun Du, Yanbo Wang, Imran Razzak, Zhongying Deng, Chi Zhang, Lijun Wu, Conghui He, Zhaohui Lu, Jinhai Huang, Wenqi Shao, Yihao Liu, Siqi Luo, Yi Xin, Xiaohong Liu, Fenghua Ling, Yuqiang Li, Aoran Wang, Siqi Sun, Qihao Zheng, Nanqing Dong, Tianfan Fu, Dongzhan Zhou, Yan Lu, Wenlong Zhang, Jin Ye, Jianfei Cai, Yirong Chen, Wanli Ouyang, Yu Qiao, Zongyuan Ge, Shixiang Tang, Junjun He, Chunfeng Song, Lei Bai, Bowen Zhou

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏