arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-23 至 2025-12-23 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 12 篇

2505.18947 2025-12-23 cs.CV 83%

OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model

OpenHOI: 基于多模态大语言模型的开放世界手-物体交互合成

Zhenhao Zhang, Ye Shi, Lingxiao Yang, Suting Ni, Qi Ye, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 OpenHOI通过多模态大语言模型实现开放世界手-物体交互合成,能生成长周期操控序列并处理复杂语言指令。

Comments Accepted by NeurIPS 2025 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01298 2025-12-23 cs.CV cs.AI 81%

Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models

通过统一生成模型中的多模态推理链提升图像生成

Yi Wang, Mushui Liu, Wanggui He, Hanyang Yuan, Longxiang Zhang, Ziwei Huang, Guanghao Zhang, Wenkai Fang, Haoze Jiang, Shengxuming Zhang, Dong She, Jinlong Liu, Weilong Dai, Mingli Song, Hao Jiang, Jie Song

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过引入多模态推理链提升统一生成模型的复杂图像生成能力,提出FoXperts架构和MCoT方法,实现更高效的多模态生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19609 2025-12-23 cs.CV cs.AI 62%

MapTrace: Scalable Data Generation for Route Tracing on Maps

MapTrace: 用于地图路线追踪的可扩展数据生成

Artemis Panagopoulou, Aveek Purohit, Achin Kulshrestha, Soroosh Yazdani, Mohit Goyal

机构 * Google XR(谷歌XR) University of Pennsylvania(宾夕法尼亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MapTrace通过合成数据生成提升地图路线追踪性能,微调模型使成功率提升6.4个百分点,减少路径追踪误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18623 2025-12-23 cs.CL cs.AI 62%

LLM-CAS: Dynamic Neuron Perturbation for Real-Time Hallucination Correction

LLM-CAS: 动态神经元扰动用于实时幻觉修正

Jensen Zhang, Ningyuan Liu, Yijia Fan, Zihao Huang, Qinglin Zeng, Kaitong Cai, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) Snap Inc(Snap公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 LLM-CAS通过动态神经元扰动实现实时幻觉修正,提升大型语言模型的事实准确性。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19686 2025-12-23 cs.CV 57%

Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models

视觉感知的CoT:在统一模型中实现高保真的视觉一致性

Zixuan Ye, Quande Liu, Cong Wei, Yuanxing Zhang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出视觉感知的CoT方法,通过自适应视觉规划和迭代视觉修正提升统一模型的多模态生成能力,实现更高的视觉一致性。

Comments Project Page: https://zixuan-ye.github.io/VACoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19680 2025-12-23 cs.CV 57%

VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation

VA-$π$: 变分策略对齐用于像素感知自回归生成

Xinyao Liao, Qiyuan He, Kai Xu, Xiaoye Qu, Yicong Li, Wei Wei, Angela Yao

机构 * Huazhong University of Science & Technology(华中科技大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 VA-$π$通过变分优化和像素空间目标提升自回归生成的质量和多样性。

Comments 21 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19479 2025-12-23 cs.CV 57%

Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation

情绪导演:在情绪导向图像生成中弥合情感捷径

Guoli Jia, Junyao Hu, Xinwei Long, Kai Tian, Kaiyan Zhang, KaiKai Zhao, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) China Unicom(中国联合通信) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 Emotion-Director通过跨模态协作框架,结合MC-Diffusion和MC-Agent,提升情绪导向图像生成的准确性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19271 2025-12-23 cs.CV 57%

3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory

3SGen: 一种统一的主体、风格和结构驱动的图像生成方法,具有自适应任务特定记忆

Xinyang Song, Libin Wang, Weining Wang, Zhiwei Li, Jianxin Sun, Dandan Zheng, Jingdong Chen, Qi Li, Zhenan Sun

机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) CASIA AntGroup(蚂蚁集团)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 3SGen通过统一的框架实现主体、风格和结构驱动的图像生成,采用自适应任务特定记忆模块提升生成质量和跨任务迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18814 2025-12-23 cs.CV 57%

EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer

EchoMotion: 通过双模态扩散变换器实现统一的人体视频与运动生成

Yuxiao Yang, Hualian Sheng, Sijia Cai, Jing Lin, Jiahao Wang, Bing Deng, Junzhe Lu, Haoqian Wang, Jieping Ye

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Nanyang Technology University(南阳技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 EchoMotion通过双模态扩散变换器统一生成人体视频与运动,提升复杂人类动作视频的连贯性与合理性。

Comments 26 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18635 2025-12-23 cs.CV 57%

Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers

Uni-Neur2Img:通过扩散变换器实现神经信号引导的图像生成、编辑和风格化

Xiyue Bai, Ronghao Yu, Jia Xiu, Pengfei Zhou, Jie Xia, Peng Ji

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Uni-Neur2Img通过扩散变换器实现神经信号引导的图像生成、编辑和风格化,提供统一且高效的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18007 2025-12-23 cs.RO cs.CV 57%

Robotic VLA Benefits from Joint Learning with Motion Image Diffusion

机器人VLA通过与运动图像扩散的联合学习获益

Yu Fang, Kanchana Ranasinghe, Le Xue, Honglu Zhou, Juntao Tan, Ran Xu, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Daniel Szafir, Mingyu Ding, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出通过联合学习与运动图像扩散提升机器人VLA模型的运动推理能力,实验表明在多个基准测试中显著提升了性能。

Comments Website: https://vla-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04798 2025-12-23 cs.LG 50%

TabRep: Training Tabular Diffusion Models with a Simple and Effective Continuous Representation

TabRep: 通过简单有效的连续表示训练表格扩散模型

Jacob Si, Zijing Ou, Mike Qu, Zhengrui Xiang, Yingzhen Li

机构 * Imperial College London(伦敦帝国学院) Columbia University(哥伦比亚大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 TabRep通过统一连续表示训练表格扩散模型,实现高效生成高质量表格数据并保持隐私。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏