arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-03 至 2025-09-03 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 3 篇

2509.00723 2025-09-03 cs.AI cs.MM 84%

OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination

Junzhe Chen, Tianshu Zhang, Shiyu Huang, Yuwei Niu, Chao Sun, Rongzhou Zhang, Guanyu Zhou, Lijie Wen, Xuming Hu

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) OpenRL Chongqing University(重庆大学)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03084 2025-09-03 cs.LG cs.AI 79%

Adversarial Attacks in Multimodal Systems: A Practitioner's Survey

Shashank Kapoor, Sanjay Surendranath Girija, Lakshit Arora, Dipen Pradhan, Ankit Shetgaonkar, Aman Raj

机构 * Google(谷歌)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

Comments Accepted in IEEE COMPSAC 2025

Journal ref 2025 IEEE 49th Annual Computers, Software, and Applications Conference (COMPSAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01246 2025-09-03 cs.HC cs.RO 50%

An AI-Based Shopping Assistant System to Support the Visually Impaired

Larissa R. de S. Shibata, Ankit A. Ravankar, Jose Victorio Salazar Luces, Yasuhisa Hirata

机构 * Department of Robotics, Tohoku University(机器人系,东京东京大学)

专题命中 音频语音多模态 :multimodal(abstract)

Comments 7 pages, Accepted for 2025 SICE-FES conference (IEEE)

详情

展开后加载摘要…

URL PDF HTML 收藏