Breakdance Video classification in the age of Generative AI
机构 * Eluvio AI Labs(Eluvio AI实验室)
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 11 pages
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Eluvio AI Labs(Eluvio AI实验室)
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 11 pages
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Boston University(波士顿大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.LG
Comments In Proceedings of the 2nd ACM Workshop in AI-powered Question and Answering Systems (AIQAM '25), October 27-28, 2025, Dublin, Ireland. ACM, New York, NY, USA, 8 pages. https://doi.org/10.1145/3746274.3760393
机构 * CV:HCI, KIT(KIT计算机视觉与人机交互中心) ; Hunan University(湖南大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Zhejiang University(浙江大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track. Data and Code: https://github.com/KediYing/mmWalk
机构 * University of Rochester(罗切斯特大学) ; University of Central Florida(中央佛罗里达大学)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
Comments 5 pages
机构 * Department of Computer Science, Purdue University, USA(计算机科学系,普渡大学)
专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.LG
Comments Published at NeurIPS 2025, 27 pages
机构 * Zhejiang University(浙江大学)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) ; State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(处理器国家重点实验室,中国科学院计算技术研究所) ; Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Intelligent Software Research Center, Institute of Software, Chinese Academy of Sciences(软件智能研究中心,中国科学院软件研究所)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI
Journal ref Neurocomputing, Volume 659, 2026, 131217
机构 * Domyn
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
机构 * Harvard University(哈佛大学) ; University of Michigan(密歇根大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉推理 :VLM(abstract)
机构 * Yonsei University(延世大学) ; LG Electronics(LG电子)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
Comments Comments: 28 pages, including appendix. 5 figures. Full version of the NeurIPS 2025 paper
机构 * Roboflow ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments The first two authors contributed equally. This work has been accepted to the Neural Information Processing Systems (NeurIPS) 2025 Datasets & Benchmark Track. Project Page: https://rf100-vl.org/
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract);分类 cs.CV
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Beijing Normal University(北京师范大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 25 pages, 9 figures, 17 tables
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; ShanghaiTech University(上海理工大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 4101-4113
机构 * School of Software, Shandong University(山东大学软件学院) ; Shenzhen Loop Area Institute(深圳河套学院) ; School of Computing and Artificial Intelligence, Shandong University of Finance and Economics(山东财经大学计算机与人工智能学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG
Comments Accepted by NeurIPS 2025
机构 * Department of Computer Science, University of Missouri–Kansas City (UMKC)(密苏里大学哥伦比亚分校计算机科学系) ; Department of Computer Science, California State University, Fullerton(加州州立大学富尔顿分校计算机科学系)
专题命中 视觉定位与Grounding :grounding(abstract)
Comments 8 pages, 7 figures, 7 tables
机构 * Renmin University of China(中国人民大学) ; Tongyi Lab, Alibaba Group(阿里云实验室)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV、cs.AI
机构 * University of Washington(华盛顿大学) ; DEVCOM ARL
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
机构 * Knight Foundation School of Computing and Information Sciences (KFSCIS)(骑士基金会计算与信息科学学院) ; Florida International University(佛罗里达国际大学) ; Sustainability, Optimization, and Learning for InterDependent networks laboratory (solid lab)(可持续性、优化与互依赖网络学习实验室)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
机构 * University of Bristol, UK(英国布里斯托大学) ; University of Exeter, UK(英国埃克塞特大学) ; South China Normal University, China(华南师范大学) ; The University of Aberdeen, UK(英国阿伯丁大学) ; Technical University of Munich, Germany(慕尼黑技术大学) ; Eindhoven University of Technology, NL(埃因霍温理工大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
Comments Accepted to NeruIPS 2025 D&B Track
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)
机构 * PRé Sustainability B.V.(PRé可持续性公司) ; Amazon(亚马逊)
专题命中 幻觉与鲁棒性 :grounding(abstract)
机构 * MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(人工智能MoE实验室,上海交通大学) ; Ant Group(蚂蚁集团) ; Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究所,东部技术研究所,宁波)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
机构 * Peking University(北京大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; BNRist, Tsinghua University(清华大学北京研究院)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by Neurips 2025
机构 * University of Zurich(苏黎世大学) ; NVIDIA ; Imperial College London(伦敦帝国理工学院) ; FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * Courant Institute of Mathematical Sciences, New York University(纽约大学数学科学学院) ; Tandon School of Engineering, New York University(纽约大学工程学院) ; Cerebras Systems Inc.(Cerebras Systems公司) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract)
机构 * University of Rochester(罗切斯特大学) ; Adobe Research(Adobe研究)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV