arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-19 至 2025-09-19 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 5 篇

2502.17651 2025-09-19 cs.CV cs.AI cs.CL 75%

METAL: A Multi-Agent Framework for Chart Generation with Test-Time Scaling

Bingxuan Li, Yiwei Wang, Jiuxiang Gu, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Merced(加州大学默塞德分校) Adobe Research(Adobe研究)

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ACL2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14638 2025-09-19 cs.CV 57%

MultiEdit: Advancing Instruction-based Image Editing on Diverse and Challenging Tasks

Mingsong Li, Lin Liu, Hongjun Wang, Haoxing Chen, Xijun Gu, Shizhan Liu, Dong Gong, Junbo Zhao, Zhenzhong Lan, Jianguo Li

机构 * University of New South Wales(新南威尔士大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14303 2025-09-19 cs.RO cs.AI 57%

FlowDrive: Energy Flow Field for End-to-End Autonomous Driving

Hao Jiang, Zhipeng Zhang, Yu Gao, Zhigang Sun, Yiru Wang, Yuwen Heng, Shuo Wang, Jinhao Chai, Zhuo Chen, Hao Zhao, Hao Sun, Xi Zhang, Anqing Jiang, Chuan Hu

机构 * Shanghai Jiao Tong University(上海交通大学) Bosch Corporate Research, Shanghai, China(博世股份有限公司上海研究院) AIR, Tsinghua University(清华大学人工智能研究院) Shanghai University, Shanghai, China(上海大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11277 2025-09-19 cs.CV cs.LG 57%

Probing the Representational Power of Sparse Autoencoders in Vision Models

Matthew Lyle Olson, Musashi Hinck, Neale Ratzlaff, Changbai Li, Phillip Howard, Vasudev Lal, Shao-Yen Tseng

机构 * Oracle Intel Labs(英特尔实验室) Oregon State University(俄勒冈州立大学) Thoughtworks

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

Comments ICCV 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14711 2025-09-19 eess.SP 50%

LLM4MG: Adapting Large Language Model for Multipath Generation via Synesthesia of Machines

Ziwei Huang, Shiliang Lu, Lu Bai, Xuesong Cai, Xiang Cheng

专题命中 多模态生成 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏