anyECG-chat: A Generalist ECG-MLLM for Flexible ECG Input and Multi-Task Understanding
专题命中 视觉问答 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI
Comments AAAI 2026
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI
Comments AAAI 2026
机构 * Faculty Of Information Technology, VNU University of Engineering and Technology(信息科技学院,越南工程与技术大学) ; IT-BT Convergence Technology Division, Vietnam-Korea Institute of Science and Technology(IT-BT融合技术部,越南-韩国科学技术院) ; TADI Global Lab, TADI Global Company Limited(TADI全球实验室,TADI全球公司) ; Faculty of Finance, Banking Academy of Vietnam(金融学院,越南银行学院)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
Comments 7 pages, 3 figures, 3 tables, FAIR 2025 conference
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments 11 pages
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments 8 pages, 11 tables and figures
机构 * State Key Lab. LIESMARS, Wuhan University(武汉大学遥感信息与地学实验室国家重点实验室)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025 Track on Datasets and Benchmarks
机构 * Kalinga Institute of Industrial Technology (KIIT)(喀里亚理工学院) ; Indian Institute of Technology (IIT), Bhubaneswar(印度理工学院(班加罗尔))
专题命中 视觉推理 :vision-language model(title,abstract)
Comments Accepted to IJCNLP-AACL Findings 2025
机构 * Örebro University(奥雷布罗大学) ; Meta
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Accepted at ICCV 2023
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist 大学) ; National University of Singapore(新加坡国立大学) ; Beijing Normal University(北京师范大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI
Comments 28 pages, 14 figures, 19 tables
机构 * Johns Hopkins Whiting School of Engineering(约翰霍普金斯大学惠廷工程学院) ; DEVCOM Army Research Laboratory(国防部陆军研究实验室)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
专题命中 视觉推理 :multimodal large language model(abstract)
Journal ref C. Li, Q. Yan, M. Kim, Z. Li, Y. Xu and L. -F. Yu, "Crafting Dynamic Virtual Activities with Advanced Multimodal Models," 2025 IEEE International Symposium on Mixed and Augmented Reality (ISMAR), pp. 120-130
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; School of Data Science, Lingnan University(岭南大学数据科学学院) ; School of Science and Technology, Hong Kong Metropolitan University(香港理工大学科技学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI
机构 * School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) ; Key Laboratory of Sustainable Tourism Smart Assessment Technology, Ministry of Culture and Tourism, Sun Yat-sen University(文化旅游可持续评估技术重点实验室,中华人民共和国文化和旅游部,中山大学) ; Beijing Normal University(北京师范大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract)
Comments CCKS 2025 Shared Task Paper
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments 16 pages, 9 figures, AAAI 2026
机构 * Artificial Intelligence Research Institute (AIRI)(人工智能研究 institute (AIRI))
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
Comments 13 pages, 3 figures
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
Comments Accepted by AAAI-26
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 视觉定位与Grounding :grounding(abstract)
Comments EMNLP 2025 Main
机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可感知智能系统重点实验室,浙江大学) ; Alibaba Group(阿里巴巴集团) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and DataSecurity(杭州高新技术区(滨江)区块链与数据安全研究院)
专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments Accepted at EMNLP 2025
机构 * Holcombe Department of Electrical and Computer Engineering(霍尔科姆电气与计算机工程系) ; Clemson University(克莱姆森大学)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
机构 * School of Computer Science and Engineering, and the MOE Engineering Research Center of Advanced Computer Application Technology, Beihang University(计算机科学与工程学院,以及教育部先进计算机应用技术工程研究中心,北京航空航天大学) ; School of Computer Science and Engineering, the School of Economics and Management, and the MIIT Key Laboratory of Data Intelligence and Management, Beihang University(计算机科学与工程学院,经济管理学院,以及工信部数据智能与管理重点实验室,北京航空航天大学) ; Gaoling School of Artificial Intelligence, Renmin University of China(中关村人工智能学院,中国人民大学) ; DiDi Global Inc.(滴滴出行公司)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Paper accepted to AAAI 2026
机构 * ByteDance Seed(字节跳动种子) ; NTU(国立科技大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
机构 * University of Auckland(奥克兰大学) ; China Scholarship Council(中国留学基金委)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments 9 pages, published to AAAI 2026
机构 * CMU(卡内基梅隆大学) ; The University of Tokyo(东京大学) ; The University of Toronto(多伦多大学)
专题命中 幻觉与鲁棒性 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * Kyungpook National University(庆尚国立大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
Comments 7 pages
机构 * The School of Electrical and Information Engineering, Tianjin University, China(天津大学电气与信息工程学院) ; Tiandy Technologies Co., Ltd, Tianjin, China(天津天盾科技有限公司)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
机构 * Tianyu Guo, Shanwei Zhao, Shiai Zhu, Chenguang Ma(作者)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
机构 * University of Geneva(日内瓦大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI
Comments Machine Learning and the Physical Sciences Workshop, NeurIPS 2025
专题命中 VLM训练与架构 :multimodal large language model(title,abstract)
Comments 12 pages, 5 figures
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments 16 pages, 6 figures, 15 tables