arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-12 至 2025-12-12 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2512.10750 2025-12-12 cs.CV 83%

LDP: Parameter-Efficient Fine-Tuning of Multimodal LLM for Medical Report Generation

LDP:多模态大语言模型在医疗报告生成中的参数高效微调

Tianyu Zhou, Junyi Tang, Zehui Li, Dahong Qian, Suncheng Xiang

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 LDP通过多模态大语言模型和参数高效微调技术,提升结肠镜息肉诊断报告的准确性和效率,显著降低训练成本并获得专家评分。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10894 2025-12-12 cs.CV 79%

DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance

DuetSVG:基于内部视觉引导的统一多模态SVG生成

Peiying Zhang, Nanxuan Zhao, Matthew Fisher, Yiran Xu, Jing Liao, Difan Liu

机构 * City University of Hong Kong(香港城市大学) Adobe Research(Adobe研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 DuetSVG通过端到端生成图像和SVG标记,结合内部视觉引导提升SVG生成质量,实现视觉忠实与语义一致的统一多模态生成。

Comments Project page: https://intchous.github.io/DuetSVG-site

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15365 2025-12-12 eess.SY cs.LG cs.MA cs.SY 78%

TranSimHub:A Unified Air-Ground Simulation Platform for Multi-Modal Perception and Decision-Making

TranSimHub:一个多模态感知与决策的空地协同仿真平台

Maonan Wang, Yirong Chen, Yuxin Cai, Aoyu Pang, Yuejiao Xie, Zian Ma, Chengcheng Xu, Kemou Jiang, Ding Wang, Laurent Roullet, Chung Shue Chen, Zhiyong Cui, Yuheng Kan, Michael Lepech, Man-On Pun

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Laboratory(上海人工智能实验室) Stanford University(斯坦福大学) Nanyang Technological University(南洋理工大学) SenseTime Group Ltd(商汤科技有限公司) Beihang University(北京航空航天大学) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 TranSimHub是一个用于空地协同智能的统一仿真平台,支持多模态感知与决策研究,提供同步渲染和可控场景编辑功能。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10376 2025-12-12 cs.CV 70%

RaLiFlow: Scene Flow Estimation with 4D Radar and LiDAR Point Clouds

RaLiFlow: 基于4D雷达和激光雷达点云的场景流估计

Jingyun Fu, Zhiyu Xiang, Na Zhao

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 RaLiFlow是首个联合4D雷达和激光雷达的场景流学习框架,通过动态感知双向跨模态融合模块和精心设计的损失函数实现高效的雷达-激光雷达融合。

Comments Accepted by AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05991 2025-12-12 cs.CV 70%

EmoDiffTalk:Emotion-aware Diffusion for Editable 3D Gaussian Talking Head

EmoDiffTalk:面向可编辑3D高斯说话头的情绪感知扩散

Chang Liu, Tianjiao Jing, Chengcheng Ma, Xuanqi Zhou, Zhengxuan Lian, Qin Jin, Hongliang Yuan, Shi-Sheng Huang

机构 * Beijing Normal University(北京师范大学) Renmin University of China(中国人民大学) Tencent AI Lab(腾讯AI实验室)

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 EmoDiffTalk通过情绪感知高斯扩散实现细粒度面部动画与多模态情绪编辑,提升3D说话头的情绪表达精度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10949 2025-12-12 cs.CV cs.AI cs.CL 67%

Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation

我们是否准备好在文本到3D生成中使用强化学习?一项渐进性的调查

Yiwen Tang, Zoey Guo, Kaixin Zhu, Ray Zhang, Qizhi Chen, Dongzhi Jiang, Junli Liu, Bohan Zeng, Haoming Song, Delin Qu, Tianyi Bai, Dan Xu, Wentao Zhang, Bin Zhao

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文首次系统研究了强化学习在文本到3D生成中的应用,提出Hi-GRPO范式和AR3D-R1模型,探讨奖励设计、算法优化及3D生成基准。

Comments Code is released at https://github.com/Ivan-Tang-3D/3DGen-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07730 2025-12-12 cs.CV cs.AI 62%

SAVE: Sparse Autoencoder-Driven Visual Information Enhancement for Mitigating Object Hallucination

SAVE:基于稀疏自编码器的视觉信息增强用于缓解物体幻觉

Sangha Park, Seungryong Yoo, Jisoo Mok, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Daegu Gyeongbuk Institute of Science and Technology(大邱庆州科学技术院) IPAI, AIIS, ASRI, INMC, and ISRC, Seoul National University(IPAI、AIIS、ASRI、INMC 和 ISRC,首尔国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SAVE通过引导模型沿稀疏自编码器潜在特征减少物体幻觉,提升视觉理解能力。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10352 2025-12-12 cs.CV 57%

Topology-Agnostic Animal Motion Generation from Text Prompt

基于文本提示的拓扑无关动物运动生成

Keyi Chen, Mingze Sun, Zhenyu Liu, Zhangquan Chen, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OmniZoo数据集和通用自回归框架,实现基于文本提示的任意拓扑动物运动生成及跨物种风格迁移。

Comments 10 pages, 7 figures.Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏