arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-04 至 2025-12-04 共收录 53 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 13 篇

2512.03073 2025-12-04 cs.CY cs.AI 57%

Economies of Open Intelligence: Tracing Power & Participation in the Model Ecosystem

开源智能的经济效应:追踪模型生态系统中的权力与参与

Shayne Longpre, Christopher Akiki, Campbell Lund, Atharva Kulkarni, Emily Chen, Irene Solaiman, Avijit Ghosh, Yacine Jernite, Lucie-Aimée Kaffee

机构 * MIT Data Provenance Initiative(MIT数据溯源计划) Data Provenance Initiative(数据溯源计划) ScaDS.AI Leipzig(ScaDS.AI莱比锡) University of Edinburgh(爱丁堡大学) University of Southern California(南加州大学) UNC at Chapel Hill(北卡罗来纳大学教堂山分校) Hugging Face

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究分析了开放模型经济中权力和参与的变化,揭示了开发者中介者的作用及市场权力的重新分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02457 2025-12-04 cs.CV 57%

Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation

听觉有助于视觉吗?研究音频视频联合去噪用于视频生成

Jianzong Wu, Hao Lian, Dachao Hao, Ye Tian, Qingyu Shi, Biaolong Chen, Hao Jiang, Yunhai Tong

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出通过音频视频联合去噪提升视频生成质量,验证了跨模态训练对构建更物理基础的世界模型的潜力。

Comments Project page at https://jianzongwu.github.io/projects/does-hearing-help-seeing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03874 2025-12-04 cs.RO cs.LG 50%

OmniDexVLG: Learning Dexterous Grasp Generation from Vision Language Model-Guided Grasp Semantics, Taxonomy and Functional Affordance

OmniDexVLG: 从视觉语言模型引导的抓取语义、分类法和功能可及性中学习灵巧抓取生成

Lei Zhang, Diwen Zheng, Kaixin Bai, Zhenshan Bing, Zoltan-Csaba Marton, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * University of Hamburg(汉堡大学) Agile Robots SE(敏捷机器人公司) Technical University of Munich(慕尼黑技术大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 OmniDexVLG通过多模态语义推理和统一视觉语言模型,实现从自然语言指令中生成多样且语义连贯的灵巧抓取。

Comments Project Website: https://sites.google.com/view/omnidexvlg, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 10 篇

2512.03064 2025-12-04 cs.SI 89%

Demographic Inference from Social Media Data with Multimodal Foundation Models: Strategies, Evaluation, and Benchmarking

从社交媒体数据中推断人口特征:多模态基础模型的策略、评估与基准测试

Hao Yang, Angela Yao, Eric Chang, Hexiang Wang

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract)

AI总结 本研究利用GPT-5多模态基础模型,从社交媒体资料中推断年龄、性别和种族,展示了其在提高人口特征推断准确性、公平性和可扩展性方面的潜力。

Comments 21 pages, 10 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03464 2025-12-04 cs.LG 88%

Multi-Modal Opinion Integration for Financial Sentiment Analysis using Cross-Modal Attention

多模态意见整合用于金融情绪分析的跨模态注意力

Yujing Liu, Chen Yang

机构 * College of Computing Georgia Institute of Technology Atlanta, USA(计算学院 佐治亚理工学院 美国亚特兰大) College of Engineering University of Pennsylvania Philadelphia, USA(工程学院 宾夕法尼亚大学 美国费城)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(title);multimodal(abstract)

AI总结 本文提出了一种多模态注意力机制,用于整合金融意见的时效和流行度模态,以提高金融情绪分析的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18980 2025-12-04 cs.CL cs.AI cs.CV 82%

IW-Bench: Evaluating Large Multimodal Models for Converting Image-to-Web

IW-Bench: 评估大规模多模态模型的图像到网页转换能力

Hongcheng Guo, Wei Zhang, Junhao Chen, Yaonan Gu, Jian Yang, Junjia Du, Shaosheng Cao, Binyuan Hui, Tianyu Liu, Jianxin Ma, Chang Zhou, Zhoujun Li

机构 * Beihang University(北京航空航天大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 IW-Bench提出了一种新的基准,用于评估大规模多模态模型在图像到网页转换中的性能,通过元素准确率和布局准确率以及五跳提示方法来提升评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03369 2025-12-04 cs.CV cs.AI 81%

FireSentry: A Multi-Modal Spatio-temporal Benchmark Dataset for Fine-Grained Wildfire Spread Forecasting

FireSentry: 一种多模态时空基准数据集用于细粒度野火蔓延预测

Nan Zhou, Huandong Wang, Jiahao Li, Han Li, Yali Song, Qiuhua Wang, Yong Li, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) College of Soil and Water Conservation, Southwest Forestry University(西南林业大学水土保持学院) College of Civil Engineering, Southwest Forestry University(西南林业大学土木工程学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 FireSentry提出了一种多模态野火数据集和FiReDiff双模态范式,用于细粒度野火预测和动态灾害模拟,显著提升了视频和火斑掩膜的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03000 2025-12-04 cs.CV 79%

DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling

DynamicVerse: 一种具有物理意识的多模态框架用于4D世界建模

Kairun Wen, Yuzhi Huang, Runyu Chen, Hui Zheng, Yunlong Lin, Panwang Pan, Chenxin Li, Wenyan Cong, Jian Zhang, Junbin Lu, Chenguo Lin, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Yue Huang, Xinghao Ding, Rakesh Ranjan, Zhiwen Fan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 DynamicVerse提出了一种多模态框架,通过整合大规模视觉、几何和多模态模型,实现动态现实世界视频的4D世界建模,提升了对物理尺度测量的全局准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07850 2025-12-04 cs.AI 79%

GAMA: A Neural Neighborhood Search Method with Graph-aware Multi-modal Attention for Vehicle Routing Problem

GAMA:一种具有图感知多模态注意力的神经邻域搜索方法用于车辆路径问题

Xiangling Chen, Yi Mei, Mengjie Zhang

机构 * Centre for Data Science and Artificial Intelligence(数据科学与人工智能中心) School of Engineering and Computer Science(工程与计算机科学学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 GAMA通过图感知多模态注意力机制和门控融合设计,提升车辆路径问题的神经邻域搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19582 2025-12-04 cs.CV 70%

Guard Me If You Know Me: Protecting Specific Face-Identity from Deepfakes

Kaiqing Lin, Zhiyuan Yan, Ke-Yue Zhang, Li Hao, Yue Zhou, Yuzhen Lin, Weixiang Li, Taiping Yao, Shouhong Ding, Bin Li

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU-AFS Joint Innovation Center for AI Technology(深圳大学-腾讯优图联合创新中心) Shenzhen University(深圳大学) School of Electronic and Computer Engineering(电子与计算机工程学院) Peking Univerisity(北京大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03746 2025-12-04 cs.CV cs.CL 62%

Thinking with Programming Vision: Towards a Unified View for Thinking with Images

通过编程视觉思考:迈向图像思考的统一视角

Zirun Guo, Minjie Hong, Feng Zhang, Kai Jia, Tao Jin

机构 * Zhejiang University(浙江大学) ByteDance BandAI(字节跳动BandAI)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 CodeVision提出一种灵活的代码作为工具框架,通过两阶段训练提升模型对图像变化和多工具推理的鲁棒性,实验显示显著提升性能并促进新兴能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03838 2025-12-04 cs.CL 57%

Training and Evaluation of Guideline-Based Medical Reasoning in LLMs

在LLM中训练和评估基于指南的医学推理

Michael Staniek, Artem Sokolov, Stefan Riezler

机构 * Computational Linguistics &(计算语言学) IWR, Heidelberg University(海德堡大学IWR部门) Google DeepMind, Berlin, Germany(谷歌DeepMind,柏林,德国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文通过训练LLM遵循医学共识指南,提升其推理和预测的正确性与价值正确性,改进未来临床变量的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09997 2025-12-04 cs.CV 57%

GT23D-Bench: A Comprehensive General Text-to-3D Generation Benchmark

GT23D-Bench:一个全面的通用文本到3D生成基准

Xiao Cai, Sitong Su, Jingkuan Song, Pengpeng Zeng, Ji Zhang, Qinhong Du, Mengqi Li, Heng Tao Shen, Lianli Gao

机构 * University of Electronic Science and Technology of China(电子科技大学) Tongji University(同济大学) Southwest Jiaotong University(西南交通大学)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV

AI总结 GT23D-Bench通过构建高质量数据集和全面评估体系,解决通用文本到3D生成中的数据与评估难题,推动研究进展。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 2 篇

2511.20085 2025-12-04 cs.AI cs.MA 79%

VICoT-Agent: A Vision-Interleaved Chain-of-Thought Framework for Interpretable Multimodal Reasoning and Scalable Remote Sensing Analysis

VICoT-Agent:一种用于可解释多模态推理和可扩展遥感分析的视觉交织思维链框架

Chujie Wang, Zhiyuan Luo, Ruiqi Liu, Can Ran, Shenghua Fan, Xi Chen, Chu He

机构 * Wuhan University(武汉大学) University of Toronto(多伦多大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 VICoT-Agent通过视觉交织思维链框架实现多模态推理和遥感分析,采用堆栈结构和模块化工具集提升推理效率,并通过推理堆栈蒸馏方法降低模型复杂度,显著提升推理透明度和执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03630 2025-12-04 cs.RO 71%

Multimodal Control of Manipulators: Coupling Kinematics and Vision for Self-Driving Laboratory Operations

多模态操作臂控制:结合运动学与视觉的自我驱动实验室操作

Shifa Sulaiman, Amarnath H, Simon Bogh, Naresh Marturi

机构 * 1 Department of Electronics Systems, Aalborg University, Denmark 3 Extreme Robotics Laboratory, School of Metallurgy \& Materials, University of Birmingham, Birmingham, United Kingdom

专题命中 多模态Agent :multimodal(title)

AI总结 本文提出三种基于雅可比方法的运动规划方案,结合RRT*算法和螺旋理论,用于优化冗余机械臂与耦合手指夹具的轨迹规划与逆解计算,以提升实验室自动化操作的效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 5 篇

2502.00530 2025-12-04 cs.LG cs.AI cs.SI 79%

Generic Multimodal Spatially Graph Network for Spatially Embedded Network Representation Learning

通用多模态空间图网络用于空间嵌入网络表示学习

Xudong Fan, Jürgen Hackl

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出通用多模态空间图卷积网络,通过多模态特征提升空间嵌入网络的表示准确性,实验显示在电力网络中边存在预测任务的准确率提高37.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03404 2025-12-04 cs.CV 79%

MOS: Mitigating Optical-SAR Modality Gap for Cross-Modal Ship Re-Identification

MOS:缓解光学-合成孔径雷达模态差距以实现跨模态舰船重识别

Yujian Zhao, Hankun Liu, Guanglin Niu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 MOS通过模态一致表示学习和跨模态数据生成与融合,有效缓解光学与SAR图像间的模态差距,提升舰船跨模态重识别的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01513 2025-12-04 cs.CR cs.CV 79%

SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism

SafePTR: 通过剪枝-恢复机制实现多模态大语言模型的令牌级 Jailbreak 防御

Beitao Chen, Xinyu Lyu, Lianli Gao, Jingkuan Song, Heng Tao Shen

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳研究院) Southwestern University of Finance and Economics(西南财经大学) Engineering Research Center of Intelligent Finance, Ministry of Education(教育部智能金融工程研究中心) Tongji University(同济大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 SafePTR 提出一种无需训练的多模态大语言模型防御机制,通过剪枝有害令牌并恢复良性特征,有效提升安全性并保持效率。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04005 2025-12-04 cs.CV cs.LG cs.RO 70%

LargeAD: Large-Scale Cross-Sensor Data Pretraining for Autonomous Driving

LargeAD: 大规模跨传感器数据预训练用于自动驾驶

Lingdong Kong, Xiang Xu, Youquan Liu, Jun Cen, Runnan Chen, Wenwei Zhang, Liang Pan, Kai Chen, Ziwei Liu

机构 * WorldBench Team(WorldBench团队)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 LargeAD通过跨传感器数据预训练提升自动驾驶中的三维场景理解,结合多模态对比学习和时间一致性,实现更鲁棒的感知性能。

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03747 2025-12-04 cs.CV 57%

LoRA Patching: Exposing the Fragility of Proactive Defenses against Deepfakes

LoRA Patching: 暴露对抗深度伪造的主动防御的脆弱性

Zuomin Qu, Yimao Guo, Qianyue Hu, Wei Lu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Electric Power Research Institute, China Southern Power Grid Company Ltd.(中国南方电网有限责任公司电力科学研究院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 LoRA Patching通过注入LoRA修补块绕过深度伪造防御,并引入MMFA损失提升对抗性输出特征对齐,揭示现有防御的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他多模态 3 篇

2512.03494 2025-12-04 cs.CL cs.LG 57%

A Preliminary Study on the Promises and Challenges of Native Top-$k$ Sparse Attention

关于原生Top-k稀疏注意力的潜力与挑战的初步研究

Di Xiu, Hongyin Tang, Bolin Rong, Lizhi Yan, Jingang Wang, Yifan Lu, Xunliang Cai

机构 * Meituan, Beijing, China(美团,北京,中国)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

AI总结 本研究探讨了原生Top-k稀疏注意力机制在解码和训练中的有效性,通过实验验证其在提升模型性能方面的潜力,并从熵的角度解释了其在下游任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03233 2025-12-04 cs.CV 57%

Object Counting with GPT-4o and GPT-5: A Comparative Study

基于GPT-4o和GPT-5的对象计数:比较研究

Richard Füzesséry, Kaziwa Saleh, Sándor Szénási, Zoltán Vámossy

机构 * Software Engineering Institute, Obuda University, Budapest, Hungary(奥布达大学软件工程研究所) Doctoral School of Applied Informatics(应用信息科学博士学院) Applied Mathematics, Obuda University, Budapest, Hungary(应用数学,奥布达大学) John von Neumann Faculty of Informatics, Obuda University, Budapest, Hungary(约翰·冯·诺伊曼信息学院,奥布达大学) Faculty of Economics(经济学院)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文比较了GPT-4o和GPT-5在零样本对象计数任务中的性能,展示了其在FSC-147和CARPK数据集上的表现。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12089 2025-12-04 quant-ph 50%

On the Convergence of Markov Chain Distribution within Quantum Walk Circuit Subspace

马尔可夫链分布在量子行走电路子空间中的收敛性

Aingeru Ramos, Jose A. Pascual, Javier Navaridas, Ivan Coluzza

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出基于离散量子行走算法的新电路设计,用于在目标分布上进行MCMC采样,并通过优化提高收敛速度和算法可扩展性。

Comments 23 pages, 7 figures (4 of them composed by 6, 3, 3 and 2 subfigures respectively)

详情

展开后加载摘要…

URL PDF HTML 收藏