arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-21 至 2025-11-21 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2510.22946 2025-11-21 cs.CV 83%

LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation

LightFusion: 一种轻量级、双融合框架用于统一多模态理解和生成

Zeyu Wang, Zilong Chen, Chenhui Gou, Feng Li, Chaorui Deng, Deyao Zhu, Kunchang Li, Weihao Yu, Haoqin Tu, Haoqi Fan, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) Tsinghua University(清华大学) Monash University(墨尔本大学) ByteDance Seed Project(字节跳动种子项目)

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 LightFusion通过双融合机制实现轻量级多模态理解和生成,仅用350亿个标记训练即在多个基准测试中取得优异成绩。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17534 2025-11-21 cs.CV cs.CL cs.MM 82%

Co-Reinforcement Learning for Unified Multimodal Understanding and Generation

协同强化学习用于统一多模态理解和生成

Jingjing Jiang, Chongjie Si, Jun Luo, Hanwang Zhang, Chao Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出CoRL框架,通过协同强化学习提升多模态大语言模型在生成与理解任务上的性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08987 2025-11-21 cs.AI 79%

Towards Efficient Multimodal Unified Reasoning Model via Model Merging

通过模型合并实现高效的多模态统一推理模型

Qixiang Yin, Huanjin Yao, Jianghao Chen, Jiaxing Huang, Zhicheng Zhao, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部交互技术与体验系统重点实验室) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 Tiny-R1V通过两阶段优化和模型合并方法,实现高效多模态推理,提升轻量模型在多种任务中的性能。

Comments Technical report, Code will be available at https://github.com/buptyqx/Tiny-R1V

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16671 2025-11-21 cs.CV cs.AI cs.CL 67%

Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation

生成中思考:在视觉生成过程中穿插文本推理

Ziyu Guo, Renrui Zhang, Hongyu Li, Manyuan Zhang, Xinyan Chen, Sifan Wang, Yan Feng, Peng Pei, Pheng-Ann Heng

机构 * CUHK(香港中文大学) IMIXR MMLab Meituan Project(美团项目)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出TwiG框架,通过在视觉生成过程中穿插文本推理,提升生成内容的上下文感知和语义丰富性。

Comments Project Page: https://think-while-gen.github.io Code: https://github.com/ZiyuGuo99/Thinking-while-Generating

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23584 2025-11-21 cs.CV 57%

VividFace: High-Quality and Efficient One-Step Diffusion For Video Face Enhancement

VividFace: 高质量和高效的一步扩散用于视频面部增强

Shulian Zhang, Yong Guo, Long Peng, Ziyang Wang, Ye Chen, Wenbo Li, Xiao Zhang, Yulun Zhang, Jian Chen

机构 * South China University of Technology(华南理工大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 VividFace通过单步扩散框架和联合训练策略,高效提升视频面部增强的高质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14023 2025-11-21 cs.CL 57%

Synthetic Data Generation Using Large Language Models: Advances in Text and Code

利用大语言模型生成合成数据:文本与代码领域的进展

Mihai Nadas, Laura Diosan, Andreea Tomescu

机构 * Faculty of Mathematics and Computer Science, Babeş-Bolyai University(巴贝什-博耶亚大学数学与计算机科学系) KlusAI Research Lab(KlusAI研究实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL

AI总结 本文探讨了利用大语言模型生成合成数据在文本和代码领域的新进展,分析了其在低资源任务和代码应用中的潜力及挑战。

Comments 24 pages, 6 tables, 1 figure, 64 references

Journal ref IEEE Access 13, 134615-134633 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15550 2025-11-21 cs.RO 50%

UltraDP: Generalizable Carotid Ultrasound Scanning with Force-Aware Diffusion Policy

UltraDP: 通用的颈动脉超声扫描与力感知扩散策略

Ruoqu Chen, Xiangjie Yan, Kangchen Lv, Gao Huang, Zheng Li, Xiang Li

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Department of Surgery, Chow Yuk Ho Technology Centre for Innovative Medicine, Li Ka Shing Institute of Health Science and Multi-scale Medical Robotics Center, The Chinese University of Hong Kong, Hong Kong(外科系,创新医学技术中心,利文斯科健康科学研究所及多尺度医学机器人中心,香港中文大学,香港)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 UltraDP通过力感知扩散策略实现通用颈动脉超声扫描,利用多感官输入和混合控制器提高扫描成功率至95%。

详情

展开后加载摘要…

URL PDF HTML 收藏