arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-19 至 2025-08-19 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 9 篇

2508.12854 2025-08-19 cs.AI cs.CL cs.CV cs.HC cs.MM 83%

E3RG: Building Explicit Emotion-driven Empathetic Response Generation System with Multimodal Large Language Model

Ronghao Lin, Shuai Shen, Weipeng Hu, Qiaolin He, Aolin Xiong, Li Huang, Haifeng Hu, Yap-peng Tan

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Desay SV Automotive Co., Ltd(德赛西威汽车有限公司) Pazhou Laboratory(琶洲实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted at ACM MM 2025 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12399 2025-08-19 cs.CV 79%

Federated Cross-Modal Style-Aware Prompt Generation

Suraj Prasad, Navyansh Mahla, Sunny Gupta, Amit Sethi

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10118 2025-08-19 cs.LG cs.CV 79%

From Intent to Execution: Multimodal Chain-of-Thought Reinforcement Learning for Precise CAD Code Generation

Ke Niu, Haiyang Yu, Zhuofan Chen, Mengyang Zhao, Teng Fu, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学) ByteDance Inc(字节跳动公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12512 2025-08-19 cs.CV 57%

LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models

Krishna Teja Chitty-Venkata, Murali Emani, Venkatram Vishwanath

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Accepted by ICIP 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12396 2025-08-19 cs.CV 57%

DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language Models

Xiaochuan Lin, Xiangyong Chen, Xuan Li, Yichen Su

机构 * Henan Polytechnic University(河南理工大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12361 2025-08-19 cs.LG cs.AI math.ST stat.TH 57%

Navigating the Exploration-Exploitation Tradeoff in Inference-Time Scaling of Diffusion Models

Xun Su, Jianming Huang, Yang Yusen, Zhongxi Fang, Hiroyuki Kasai

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09693 2025-08-19 cs.CV 57%

ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments

Jiali Chen, Yujie Jia, Zihan Wu, Jinyu Yang, Jianpeng Chen, Xusen Hei, Jiayuan Xie, Yi Cai, Qing Li

机构 * South China University of Technology(南方科技大学) The Hong Kong Polytechnic University(香港理工大学) Key Laboratory of Big Data and Intelligent Robot Ministry of Education(教育部大数据与智能机器人重点实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12701 2025-08-19 eess.SY cs.SY 50%

Deadline-Aware Bandwidth Allocation for Semantic Generative Communication with Diffusion Models

Jinhyuk Choi, Jihong Park, Seungeun Oh, Seong-Lyun Kim

专题命中 多模态生成 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12629 2025-08-19 cs.LG q-bio.BM 50%

FlowMol3: Flow Matching for 3D De Novo Small-Molecule Generation

Ian Dunn, David R. Koes

机构 * Department of Computational and Systems Biology, University of Pittsburgh(计算与系统生物学系,匹兹堡大学)

专题命中 多模态生成 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏