arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-13 至 2025-10-13 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 6 篇

2509.21787 2025-10-13 cs.CV cs.CL 81%

DeHate: A Stable Diffusion-based Multimodal Approach to Mitigate Hate Speech in Images

Dwip Dalal, Gautam Vashishtha, Anku Rani, Aishwarya Reganti, Parth Patwa, Mohd Sarique, Chandan Gupta, Keshav Nath, Viswanatha Reddy, Vinija Jain, Aman Chadha, Amitava Das, Amit Sheth, Asif Ekbal

机构 * MIT Media Lab, USA(麻省理工学院媒体实验室) Stanford University, USA(斯坦福大学) Amazon GenAI, USA(亚马逊生成人工智能) University of South Carolina, USA(南卡罗来纳大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Defactify 3 workshop at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24840 2025-10-13 cs.LG cs.CE 78%

Cell2Text: Multimodal LLM for Generating Single-Cell Descriptions from RNA-Seq Data

Oussama Kharouiche, Aris Markogiannakis, Xiao Fei, Michail Chatzianastasis, Michalis Vazirgiannis

机构 * École Polytechnique, IP Paris(巴黎理工学院,IP巴黎)

专题命中 多模态生成 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09254 2025-10-13 cs.RO cs.AI 57%

Obstacle Avoidance using Dynamic Movement Primitives and Reinforcement Learning

Dominik Urbaniak, Alejandro Agostini, Pol Ramon, Jan Rosell, Raúl Suárez, Michael Suppa

机构 * Institute of Industrial and Control Engineering, Universitat Politècnica de Catalunya(工业与控制工程研究所,巴塞罗那理工大学) Department of Computer Science, University of Innsbruck(计算机科学系,因斯布鲁克大学) Roboception GmbH(Roboception公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08625 2025-10-13 cs.CV 57%

Adjusting Initial Noise to Mitigate Memorization in Text-to-Image Diffusion Models

Hyeonggeun Han, Sehwan Kim, Hyungjun Joo, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University(首尔国立大学) CSE, Konkuk University(计算机科学与工程系,konkuk大学) Hodoo AI Labs(Hodoo AI实验室)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09134 2025-10-13 cs.SE cs.ET 50%

A Semantic Framework for Patient Digital Twins in Chronic Care

Amal Elgammal, Bernd J. Krämer, Michael P. Papazoglou, Mira Raheem

专题命中 多模态生成 :multimodal(abstract)

Comments This manuscript is currently under review at Software and Systems Modeling (SoSyM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08912 2025-10-13 cs.HC 50%

Beyond Words: Infusing Conversational Agents with Human-like Typing Behaviors

Jijie Zhou, Yuhan Hu

专题命中 多模态生成 :multimodal(abstract)

Comments Author's version of a paper published at CUI '24 (ACM Conversational User Interfaces 2024)

Journal ref CUI '24: Proceedings of the ACM Conversational User Interfaces 2024, July 8-10, 2024, Luxembourg, Luxembourg. ACM, New York, NY, USA, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏