VideoConviction: A Multimodal Benchmark for Human Conviction and Stock Market Recommendations
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Stanford University(斯坦福大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Stanford University(斯坦福大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * Beijing Institute of Technology(北京理工大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Chinese Academy of Sciences(中国科学院) ; Air Force Hospital of Southern Theater Command of PLA(中国人民解放军南部战区空军医院) ; Shenzhen Traditional Chinese Medicine Hospital(深圳中医药医院)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
Comments 19 pages, 8 figures, 7 tables
机构 * University of Chinese Academy of Sciences Multimedia Department, Xiaomi Inc Chinese Academy of Sciences, Institute of Automation Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * Lanzhou University(兰州大学) ; National University of Singapore(新加坡国立大学) ; Sun Yat-sen University(中山大学) ; Jinan University(济南大学) ; South China University of Technology(华南理工大学) ; Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University,Beijing, China(信息科学交叉研究所,清华大学,北京,中国) ; Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院,上海,中国)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to ICML2025
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
机构 * University of Maryland, College Park(马里兰大学College Park分校) ; KAUST(卡尔斯兰大学) ; MBZUAI(马克斯·普朗克人工智能研究所) ; University of Toronto(多伦多大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
Comments Audio-visual learning, Audio-Visual RAG, Multi-Video Linkage
机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Fudan University(复旦大学) ; vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学) ; Texas A&M University(德克萨斯A&M大学) ; Northwestern University(西北大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Project page: https://mikewangwzhl.github.io/VDLM/
Journal ref TMLR 2025
机构 * University of Maryland College Park(马里兰大学学院市分校) ; Microsoft(微软) ; University of Michigan(密歇根大学) ; Cardiff University(卡迪夫大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments V4, fixes to title and formatting
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments This work was submitted without the consent of all co-authors. We request withdrawal until all parties agree
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Under Review
机构 * School of Automation(自动化学院) ; Beijing Institute of Technology(北京理工大学)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI
Comments 16 pages, 11 figures
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.LG
Comments Project Webpage: https://modomodo-rl.github.io/
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * School of Computer Science and Engineering(计算机科学与工程学院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Tencent Hunyuan Team(腾讯文言团队)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * Peking University(北京大学) ; Baidu Inc.(百度公司)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments 16 pages, 4 figures, 5 Tables
机构 * Shanghai Jiao Tong University(上海交通大学) ; SII ; Fudan University(复旦大学) ; Generative AI Research Lab (GAIR)(生成式人工智能研究实验室)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
机构 * National University of Singapore(新加坡国立大学) ; Sea AI Lab(Sea AI实验室)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI
机构 * Fudan University(复旦大学) ; MMLab, The Chinese University of Hong Kong(中大香港人工智能实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学) ; Nanjing University(南京大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * OPPO AI Center(OPPO人工智能中心)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments ACL2025 Findings
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,教育部,厦门大学) ; Microsoft(微软)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
Comments Code is available at: https://github.com/microsoft/DKI_LLM/tree/main/RePrompt
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI lab(上海人工智能实验室)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments 19 pages, 8 figures