arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-14 至 2026-01-14 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2510.23301 2026-01-14 cs.CV 86%

MDReID: Modality-Decoupled Learning for Any-to-Any Multi-Modal Object Re-Identification

MDReID: 任意到任意多模态对象重识别的模态解耦学习

Yingying Feng, Jie Li, Jie Hu, Yukang Zhang, Lei Tan, Jiayi Ji

机构 * Northeastern University(东北大学) Xiamen University(厦门大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :any-to-any(title,abstract);multi-modal(title);分类 cs.CV

AI总结 MDReID通过模态解耦学习和模态感知度量学习,实现了任意到任意多模态对象重识别的鲁棒性和可扩展性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00568 2026-01-14 cs.CV cs.AI cs.LG 81%

Generating crossmodal gene expression from cancer histopathology improves multimodal AI predictions

从癌症组织病理学生成跨模态基因表达以提高多模态AI预测

Samiran Dey, Christopher R. S. Banerji, Partha Basuchowdhuri, Sanjoy K. Saha, Deepak Parashar, Tapabrata Chakraborti

机构 * School of Mathematical & Computational Sciences, Indian Association for the Cultivation of Science(数学与计算科学学院,印度科学培养协会) The Alan Turing Institute(艾伦·图灵研究所) Comprehensive Cancer Center, King’s College London(国王学院综合癌症中心) Department of Computer Science and Engineering, Jadavpur University(计算机科学与工程系,贾瓦德pur大学) MRC Biostatistics Unit, University of Cambridge(剑桥大学医学研究委员会生物统计学单位) Department of Biostatistics, Bioinformatics and Biomathematics, Georgetown University(生物统计学、生物信息学与生物数学系,杰斐逊大学) UCL Cancer Institute, Dept of Medical Physics & Biomedical Engineering, University College London(伦敦大学学院癌症研究所,医学物理与生物医学工程系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 PathGen通过生成跨模态基因表达提升癌症分级和生存风险预测的多模态AI性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08179 2026-01-14 cs.CV cs.AI cs.GR cs.LG cs.MM 67%

Instruction-Driven 3D Facial Expression Generation and Transition

基于指令的3D面部表情生成与转换

Anh H. Vo, Tae-Seok Kim, Hulin Jin, Soo-Mi Choi, Yong-Guk Kim

机构 * Department of Computer Engineering, Sejong University(忠南大学计算机工程系) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出基于指令的3D面部表情生成与转换框架,通过IFED模块和I2FET方法实现面部表情的生成与平滑过渡,实验表明其在多个数据集上优于现有方法。

Journal ref IEEE Transactions on Multimedia, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08120 2026-01-14 cs.CV cs.AI cs.LG cs.MM 67%

UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model

UniF$^2$ace: 一个统一的细粒度人脸理解和生成模型

Junzhe Li, Sifan Zhou, Liya Guo, Xuerui Qiu, Linrui Xu, Delin Qu, Tingting Long, Chun Fan, Ming Li, Hehe Fan, Jun Liu, Shuicheng Yan

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Central South University(中南大学) Fudan University(复旦大学) Guangming Lab(光明实验室) Zhejiang University(浙江大学) Lancaster University(兰卡斯特大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 UniF$^2$ace是一个专门针对细粒度人脸理解和生成的统一多模态模型,通过双离散扩散损失和多级分组专家混合架构,提升高质量面部细节生成和细粒度属性处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08623 2026-01-14 cs.CV cs.AI cs.CR cs.LG 62%

SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models

SafeRedir: 基于提示嵌入重定向的图像生成模型鲁棒去学习

Renyang Liu, Kangjie Chen, Han Qiu, Jie Zhang, Kwok-Yan Lam, Tianwei Zhang, See-Kiong Ng

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) CFAR and IHPC, A*STAR(CFAR和IHPC,A*STAR)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 SafeRedir通过提示嵌入重定向实现图像生成模型的鲁棒去学习,无需修改模型即可有效消除不安全内容并提升对抗性攻击抵抗力。

Comments Code at https://github.com/ryliu68/SafeRedir

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08388 2026-01-14 cs.AI 57%

Creativity in AI as Emergence from Domain-Limited Generative Models

人工智能中的创造力作为领域受限生成模型的涌现

Corina Chutaux

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08095 2026-01-14 cs.CV 57%

From Prompts to Deployment: Auto-Curated Domain-Specific Dataset Generation via Diffusion Models

从提示到部署:通过扩散模型实现自动定制的领域特定数据集生成

Dongsik Yoon, Jongeun Kim

机构 * HDC LABS(HDC实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出通过扩散模型生成领域特定合成数据集的方法,解决预训练模型与现实部署间的分布偏移问题,通过三阶段框架高效构建高质量可部署数据集。

Comments To appear in the Workshop on Synthetic & Adversarial ForEnsics (SAFE), WACV 2026 (oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏