arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-03 至 2025-10-03 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 2 篇

2503.17551 2025-10-03 cs.MM cs.AI cs.CV cs.SD eess.AS 77%

Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion

Yu Sun, Yin Li, Ruixiao Sun, Chunhui Liu, Fangming Zhou, Ze Jin, Linjie Wang, Xiang Shen, Zhuolin Hao, Hongyu Xiong

机构 * ByteDance Inc.(字节跳动公司)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01681 2025-10-03 cs.CV cs.AI 62%

Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning

Xuchen Li, Xuzhao Li, Jiahui Gao, Renjie Pi, Shiyu Hu, Wentao Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) ZGCA(北京智感科技有限公司) HKU(香港大学) HKUST(香港科技大学) NTU(国立台湾大学) PKU(北京大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏