arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-15 至 2025-12-15 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2512.11464 2025-12-15 cs.CV cs.AI cs.LG 81%

Exploring MLLM-Diffusion Information Transfer with MetaCanvas

探索MLLM-扩散信息传输与MetaCanvas

Han Lin, Xichen Pan, Ziqi Huang, Ji Hou, Jialiang Wang, Weifeng Chen, Zecheng He, Felix Juefei-Xu, Junzhe Sun, Zhipeng Fan, Ali Thabet, Mohit Bansal, Chu Wang

机构 * Meta Superintelligence Labs(Meta 超智能实验室) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MetaCanvas通过使MLLMs在潜在空间中推理和规划,提升多模态生成的精确度和结构化控制。

Comments Project page: https://metacanvas.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04359 2025-12-15 eess.SP 78%

Efficient Domain Generalization in Wireless Networks with Scarce Multi-Modal Data

在稀缺多模态数据下实现无线网络高效领域泛化

Minsu Kim, Walid Saad, Doru Calin

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出了一种两阶段学习框架,通过基于物理的损失函数和协作域适应方法,在稀缺多模态数据下提升无线网络的领域泛化性能。

Comments Submitted to IEEE TWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10041 2025-12-15 cs.CV cs.AI 62%

MetaVoxel: Joint Diffusion Modeling of Imaging and Clinical Metadata

MetaVoxel:联合图像与临床元数据的扩散建模

Yihao Liu, Chenyu Gao, Lianrui Zuo, Michael E. Kim, Brian D. Boyd, Lisa L. Barnes, Walter A. Kukull, Lori L. Beason-Held, Susan M. Resnick, Timothy J. Hohman, Warren D. Taylor, Bennett A. Landman

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MetaVoxel通过联合扩散建模统一图像与临床元数据,实现图像生成、年龄估计和性别预测,性能媲美传统任务特定模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24379 2025-12-15 cs.CV cs.AI 62%

Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation

Any2Caption:任何条件到字幕以实现可控视频生成

Shengqiong Wu, Weicai Ye, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。

Comments Project Page: https://sqwu.top/Any2Cap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11719 2025-12-15 cs.CV 57%

Referring Change Detection in Remote Sensing Imagery

遥感图像中的指称变化检测

Yilmaz Korkmaz, Jay N. Paranjape, Celso M. de Melo, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) DEVCOM U.S. Army Research Laboratory(美国陆军研究实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出指称变化检测方法,通过自然语言提示实现遥感图像中特定类别的变化检测,并引入两阶段框架提升数据生成效率。

Comments 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14040 2025-12-15 cs.LG cs.AI cs.RO 57%

WARPD: World model Assisted Reactive Policy Diffusion

WARPD:世界模型辅助的反应策略扩散

Shashank Hegde, Satyajeet Das, Gautam Salhotra, Gaurav S. Sukhatme

机构 * University of Southern California(南加州大学) Google(谷歌) Intrinsic LLC(Intrinsic 公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 WARPD通过直接生成闭环策略,提高了机器人任务中长动作时间跨度和鲁棒性的性能,同时显著降低了推理成本。

Comments Outstanding Paper Award at the Embodied World Models for Decision Making Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10991 2025-12-15 cs.LG cs.AI physics.chem-ph q-bio.QM 57%

MolSculpt: Sculpting 3D Molecular Geometries from Chemical Syntax

MolSculpt:从化学语法雕刻3D分子几何

Zhanpeng Chen, Weihao Gao, Shunyu Wang, Yanan Zhu, Hong Meng, Yuexian Zou

机构 * AI for Science (AI4S)-Preferred Program, Peking University Shenzhen Graduate School, China(人工智能科学(AI4S)优选计划,北京大学深圳研究生院,中国) Faculty of Materials Science, Shenzhen MSU-BIT University, Shenzhen, China(材料科学学院,深圳MSU-BIT大学,中国)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 MolSculpt通过整合1D化学知识与3D生成过程,实现了从化学语法到精确3D分子几何的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏