arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-30 至 2025-12-30 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 11 篇

2512.11239 2025-12-30 cs.CV 88%

Cross-modal Prompting for Balanced Incomplete Multi-modal Emotion Recognition

跨模态提示用于平衡不完整多模态情绪识别

Wen-Jue He, Xiaofeng Zhu, Zheng Zhang

专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态提示方法,通过增强模态特定特征和动态加权提升多模态情绪识别的准确性和鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23576 2025-12-30 cs.CV 79%

LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation

LiveTalk: 通过改进的在线策略蒸馏实现实时多模态交互视频扩散

Ethan Chern, Zhulin Hu, Bohao Tang, Jiadi Su, Steffi Chern, Zhijie Deng, Pengfei Liu

机构 * SII SJTU GAIR

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出LiveTalk系统,通过改进的在线策略蒸馏实现实时多模态交互视频生成,显著提升效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23568 2025-12-30 cs.CV 70%

ThinkGen: Generalized Thinking for Visual Generation

ThinkGen: 用于视觉生成的通用思考

Siyu Jiao, Yiheng Lin, Yujie Zhong, Qi She, Wei Zhou, Xiaohan Lan, Zilong Huang, Fei Yu, Yingchen Yu, Yunqing Zhao, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Bytedance Home(字节跳动)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 ThinkGen通过结合预训练的大语言模型和扩散变换器,提出了一种基于思考的视觉生成框架,实现了在多种生成任务中的高效推理和高质量图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23185 2025-12-30 eess.IV cs.AI cs.CV 62%

EIR: Enhanced Image Representations for Medical Report Generation

EIR: 增强的医学报告生成图像表示

Qiang Sun, Zongcheng Ji, Yinlong Xiao, Peng Chang, Jun Yu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 EIR通过跨模态Transformer融合元数据与图像表示,结合医学领域预训练模型,有效解决信息不对称和领域差距问题,提升胸部X光报告生成的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22288 2025-12-30 cs.LG cs.AI cs.CV 62%

Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model

Co-GRPO:针对掩码扩散模型的协同优化组相对策略优化

Renping Zhou, Zanlin Ni, Tianyi Chen, Zeyu Liu, Yang Yue, Yulin Wang, Yuxuan Wang, Jingshu Liu, Gao Huang

机构 * Leap Lab, Tsinghua University(清华大学 leap 实验室) Anyverse Dynamics

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Co-GRPO通过协同优化模型和调度参数提升掩码扩散模型的生成质量。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22237 2025-12-30 cs.CV cs.AI 62%

Meta-information Guided Cross-domain Synergistic Diffusion Model for Low-dose PET Reconstruction

元信息引导的跨领域协同扩散模型用于低剂量PET重建

Mengxiao Geng, Ran Hong, Xiaoling Xu, Bingxuan Li, Qiegen Liu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出元信息引导的跨领域协同扩散模型,通过整合跨模态先验知识提升低剂量PET重建质量与生理细节保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15560 2025-12-30 cs.CV 57%

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型

Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence, UCAS(清华大学人工智能学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05621 2025-12-30 cs.CV 57%

A Preliminary Study on GPT-Image Generation Model for Image Restoration

基于GPT图像生成模型的图像修复初步研究

Hao Yang, Yan Yang, Ruikun Zhang, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Australian National University(澳大利亚国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本研究探讨GPT图像生成模型在图像修复中的应用,发现其在感知上表现良好但缺乏像素级结构保真度,并展示其作为视觉先验提升修复质量的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22392 2025-12-30 cs.CV 57%

iOSPointMapper: RealTime Pedestrian and Accessibility Mapping with Mobile AI

iOSPointMapper: 基于移动AI的实时行人及可达性制图

Himanshu Naidu, Yuxiang Zhang, Sachin Mehta, Anat Caspi

机构 * University of Washington(华盛顿大学) Paul G. Allen School of Computer Science and Engineering(保罗·G·艾伦计算机科学与工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 iOSPointMapper通过移动AI实现实时人行道制图,结合语义分割、LiDAR和GPS数据,提供隐私保护的数据收集与多模式交通数据整合,提升行人基础设施的可达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22279 2025-12-30 cs.LG cs.CE physics.app-ph 50%

Hierarchical Stacking Optimization Using Dirichlet's Process (SoDip): Towards Accelerated Design for Graft Polymerization

基于Dirichlet过程的分层堆叠优化(SoDip):迈向聚合法的加速设计

Amgad Ahmed Ali Ibrahim, Hein Htet, Ryoji Asahi

专题命中 多模态生成 :multimodal(abstract)

AI总结 基于Dirichlet过程的分层堆叠优化框架通过整合Transformer、TabNet、XGBoost和贝叶斯优化,提升聚合法的可重复性和设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06153 2025-12-30 q-bio.NC math.AT stat.ME 50%

Topologically Invariant Permutation Test

拓扑不变排列检验

Sixtus Dakurah

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一种拓扑不变排列检验,用于检测功能脑网络的拓扑不等价性,通过2-瓦瑟斯坦距离和热核扩展实现拓扑结构的稳健比较。

Comments 24 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏