arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-04 至 2025-08-04 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 3 篇

2508.00669 2025-08-04 cs.CL cs.AI cs.CV cs.LG 67%

Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications

Wenxuan Wang, Zizhan Ma, Meidan Ding, Shiyi Zheng, Shengyuan Liu, Jie Liu, Jiaming Ji, Wenting Chen, Xiang Li, Linlin Shen, Yixuan Yuan

机构 * Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen University(深圳大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08451 2025-08-04 cs.CV 57%

GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices

Quanfeng Lu, Wenqi Shao, Zitao Liu, Lingxiao Du, Fanqing Meng, Boxuan Li, Botong Chen, Siyuan Huang, Kaipeng Zhang, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

Comments 22 pages, 14 figures, ICCV 2025, a cross-app GUI navigation dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23454 2025-08-04 cs.HC cs.CY cs.ET cs.GR q-bio.NC 50%

Breaking the mould of Social Mixed Reality - State-of-the-Art and Glossary

Marta Bieńkiewicz, Julia Ayache, Panayiotis Charalambous, Cristina Becchio, Marco Corragio, Bertram Taetz, Francesco De Lellis, Antonio Grotta, Anna Server, Daniel Rammer, Richard Kulpa, Franck Multon, Azucena Garcia-Palacios, Jessica Sutherland, Kathleen Bryson, Stéphane Donikian, Didier Stricker, Benoît Bardy

专题命中 多模态Agent :multi-modal(abstract)

Comments pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏