arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-13 至 2026-01-13 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 13 篇

2601.06792 2026-01-13 cs.LG 82%

Cross-Modal Computational Model of Brain-Heart Interactions via HRV and EEG Feature

通过HRV和EEG特征实现脑心交互的跨模态计算模型

Malavika Pradeep, Akshay Sasi, Nusaibah Farrukh, Rahul Venugopal, Elizabeth Sherly

机构 * Digital University Kerala(德里大学凯拉尔) Centre for Consciousness Studies, NIMHANS(意识研究学院,NIMHANS)

专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract)

AI总结 本研究通过ECG和EEG特征构建跨模态模型,探索ECG信号作为认知负荷替代指标的可能性,并利用合成数据提升模型鲁棒性。

Comments 6 pages, 2 figures, Code available at: https://github.com/Malavika-pradeep/Computational-model-for-Brain-heart-Interaction-Analysis. Presented at AIHC (not published)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06049 2026-01-13 cs.CY cs.AI 79%

The Violation State: Safety State Persistence in a Multimodal Language Model Interface

违规状态:多模态语言模型接口中的安全状态持续

Bentley DeVilling

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 研究发现多模态语言模型在面对版权拒绝后,会持续拒绝无关图像生成请求,揭示了会话级安全状态的持续性问题。

Comments 19 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02763 2026-01-13 math.ST cs.NA math.NA math.PR stat.CO stat.TH 71%

Time-complexity of sampling from a multimodal distribution using sequential Monte Carlo

使用序贯蒙特卡罗方法从多模分布中采样的时间复杂度

Ruiyu Han, Gautam Iyer, Dejan Slepčev

专题命中 多模态生成 :multimodal(title)

AI总结 该研究探讨了在低温下使用序贯蒙特卡罗方法从多模分布采样的时间复杂度,分析了几何退火调度与兰格-丹德扩散的效率,并得出了收敛性的数学结果。

Comments 65 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14523 2026-01-13 cs.AI 70%

Learning from Reasoning Failures via Synthetic Data Generation

通过合成数据生成学习推理失败

Gabriela Ben Melech Stan, Estelle Aflalo, Avinash Madasu, Vasudev Lal, Phillip Howard

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.AI

AI总结 通过分析LMM推理失败生成针对性合成数据,提升多模态模型在多个下游任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00827 2026-01-13 eess.AS cs.AI cs.MM 67%

Speak the Art: A Direct Speech to Image Generation Framework

Speak the Art: 一种直接语音到图像生成框架

Mariam Saeed, Manar Amr, Farida Adel, Nada Hassan, Nour Walid, Eman Mohamed, Mohamed Hussein, Marwan Torki

专题命中 多模态生成 :image-text(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出Speak the Art框架,通过改进语音嵌入和使用扩散模型,实现更稳定和多样化的语音到图像生成,并验证了多语言扩展的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17068 2026-01-13 cs.CV cs.AI 62%

ReBrain: Brain MRI Reconstruction from Sparse CT Slice via Retrieval-Augmented Diffusion

ReBrain: 通过检索增强扩散模型从稀疏CT切片重建脑部MRI

Junming Liu, Yifei Sun, Weihua Cheng, Yujin Kang, Yirong Chen, Ding Wang, Guosun Zeng

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 ReBrain通过检索增强扩散模型从稀疏CT切片重建脑部MRI,利用BBDM和ControlNet实现结构连续性,提升稀疏条件下的跨模态重建性能。

Comments 16 pages, 12 figures, 7 tables; Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07221 2026-01-13 cs.CV 57%

Language-Grounded Multi-Domain Image Translation via Semantic Difference Guidance

基于语义差异指导的多领域图像翻译

Jongwon Ryu, Joonhyung Park, Jaeho Han, Yeong-Seok Kim, Hye-rin Kim, Sunjae Yoon, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) Hyundai Mobis Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 LACE通过语义差异指导实现多领域图像翻译,结合全局语义与局部结构特征融合及多领域控制机制,提升视觉翻译的保真度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07219 2026-01-13 cs.CV 57%

VENUS: Visual Editing with Noise Inversion Using Scene Graphs

VENUS: 使用场景图进行视觉编辑的噪声反演

Thanh-Nhan Vo, Trong-Thuan Nguyen, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Vietnam National University(越南国家大学) University of Dayton(戴维森大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 VENUS是一种无需训练的场景图引导图像编辑框架,通过噪声反演和拆分提示策略提升图像编辑的保真度和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06965 2026-01-13 cs.CV 57%

Unified Personalized Understanding, Generating and Editing

统一的个性化理解、生成与编辑

Yu Zhong, Tianwei Lin, Ruike Zhu, Yuqian Yuan, Haoyu Zheng, Liang Liang, Wenqiao Zhang, Feifei Shao, Haoyuan Li, Wanggui He, Hao Jiang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 OmniPersona是首个统一LMMs的端到端个性化框架,通过结构解耦的概念标记和显式知识重播机制,实现个性化理解、生成和图像编辑的一致可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06605 2026-01-13 cs.CV 57%

Sissi: Zero-shot Style-guided Image Synthesis via Semantic-style Integration

Sissi:通过语义-风格整合实现零样本风格引导图像合成

Yingying Deng, Xiangyu He, Fan Tang, Weiming Dong, Xucheng Yin

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Sissi通过语义-风格整合实现零样本风格引导图像合成,采用上下文学习框架提升风格化效果与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07823 2026-01-13 eess.SY cs.RO cs.SY 50%

Video Generation Models in Robotics -- Applications, Research Challenges, Future Directions

机器人中的视频生成模型——应用、研究挑战与未来方向

Zhiting Mei, Tenny Yin, Ola Shorinwa, Apurva Badithela, Zhonghe Zheng, Joseph Bruno, Madison Bland, Lihan Zha, Asher Hancock, Jaime Fernández Fisac, Philip Dames, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学) Temple University(Temple 大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文综述了视频生成模型在机器人学中的应用、研究挑战及未来方向,探讨了其在物理模拟、动作预测和策略评估中的作用及面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07307 2026-01-13 cs.NI 50%

Low-Altitude Satellite-AAV Collaborative Joint Mobile Edge Computing and Data Collection via Diffusion-based Deep Reinforcement Learning

低空卫星-无人机协同联合移动边缘计算与数据采集 via 基于扩散的深度强化学习

Boxiong Wang, Hui Kang, Jiahui Li, Geng Sun, Zemin Sun, Jiacheng Wang, Dusit Niyato, Shiwen Mao

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出基于扩散的深度强化学习方法,用于低空卫星-无人机协同联合移动边缘计算与数据采集,以提高效率和性能。

Comments 18 pages, 12 figures, accepted by IEEE TMC

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15716 2026-01-13 cs.RO 50%

DiffPF: Differentiable Particle Filtering with Generative Sampling via Conditional Diffusion Models

DiffPF: 基于条件扩散模型的可微粒子滤波器通过生成采样

Ziyu Wan, Lin Zhao

机构 * Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,国立新加坡大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 DiffPF通过条件扩散模型实现高精度后验采样,提升动态系统状态估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏