arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2506.01676 2025-06-03 cs.AI 57%

K12Vista: Exploring the Boundaries of MLLMs in K-12 Education

Chong Li, Chenglin Zhu, Tao Zhang, Mingan Lin, Zenan Zhou, Jian Xie

机构 * Baichuan Inc(百川公司) Peking University(北京大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00855 2025-06-03 cs.AI 57%

MedBookVQA: A Systematic and Comprehensive Medical Benchmark Derived from Open-Access Book

Sau Lai Yip, Sunan He, Yuxiang Nie, Shu Pui Chan, Yilin Ye, Sum Ying Lam, Hao Chen

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Chemical and Biological Engineering, The Hong Kong University of Science and Technology(化学与生物工程系,香港科学与技术大学) Division of Life Science, The Hong Kong University of Science and Technology(生命科学系,香港科学与技术大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments For data and code, see: https://huggingface.co/datasets/slyipae1/MedBookVQA and https://github.com/slyipae1/MedBookVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07089 2025-06-03 cs.CV cs.CL 57%

OmniCaptioner: One Captioner to Rule Them All

Yiting Lu, Jiakang Yuan, Zhen Li, Shitian Zhao, Qi Qin, Xinyue Li, Le Zhuo, Licheng Wen, Dongyang Liu, Yuewen Cao, Xiangchao Yan, Xin Li, Tianshuo Peng, Shufei Zhang, Botian Shi, Tao Chen, Zhibo Chen, Lei Bai, Peng Gao, Bo Zhang

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments More visualizations on Homepage: https://alpha-innovator.github.io/OmniCaptioner-project-page and Official code: https://github.com/Alpha-Innovator/OmniCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18147 2025-06-03 cs.CV 57%

PHT-CAD: Efficient CAD Parametric Primitive Analysis with Progressive Hierarchical Tuning

Ke Niu, Yuwen Chen, Haiyang Yu, Zhuofan Chen, Xianghui Que, Bin Li, Xiangyang Xue

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17451 2025-06-03 cs.CV cs.CL 57%

VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models

Lei Li, Yuancheng Wei, Zhihui Xie, Xuqing Yang, Yifan Song, Peiyi Wang, Chenxin An, Tianyu Liu, Sujian Li, Bill Yuchen Lin, Lingpeng Kong, Qi Liu

机构 * HKU(香港大学) SCUT(华南理工大学) SJTU(上海交通大学) PKU(北京大学) Allen AI(AllenAI)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments CVPR 2025 Camera Ready Version. Project page: https://vl-rewardbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23922 2025-06-02 cs.CV cs.CL 57%

ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding

David Ma, Huaqing Yuan, Xingjian Wang, Qianbo Zang, Tianci Liu, Xinyang He, Yanbin Wei, Jiawei Guo, Ni Jiahui, Zhenzhu Yang, Meng Cao, Shanghaoran Quan, Yizhi Li, Wangchunshu Zhou, Jiaheng Liu, Wenhao Huang, Ge Zhang, Shiwen Ni, Xiaojie Jin

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23727 2025-05-30 cs.CV cs.MM 57%

PixelThink: Towards Efficient Chain-of-Pixel Reasoning

Song Wang, Gongfan Fang, Lingdong Kong, Xiangtai Li, Jianyun Xu, Sheng Yang, Qiang Li, Jianke Zhu, Xinchao Wang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) AD Lab, CaiNiao Inc., Alibaba Group(阿里集团 Cainiao 事业部实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Project Page: https://PixelThink.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23130 2025-05-30 cs.CV 57%

PhotoArtAgent: Intelligent Photo Retouching with Language Model-Based Artist Agents

Haoyu Chen, Keda Tao, Yizao Wang, Xinlei Wang, Lei Zhu, Jinjin Gu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xidian University(西安电子科技大学) Sun Yat-sen University(中山大学) The University of Sydney(悉尼大学) INSAIT, Sofia University(INSAIT,索菲亚大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03708 2025-05-30 cs.CL cs.AI stat.ML 57%

Toward universal steering and monitoring of AI models

Daniel Beaglehole, Adityanarayanan Radhakrishnan, Enric Boix-Adserà, Mikhail Belkin

机构 * Computer Science and Engineering(计算机科学与工程) Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所) UC San Diego(圣地亚哥大学) Harvard SEAS(哈佛大学工程与应用科学学院) MIT Mathematics(MIT数学系) Halıcıoğlu Data Science Institute(Halıcıoğlu数据科学研究所) Harvard CMSA(哈佛大学计算机科学与应用数学系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20971 2025-05-28 cs.CL cs.AI 57%

Reason-Align-Respond: Aligning LLM Reasoning with Knowledge Graphs for KGQA

Xiangqing Shen, Fanfan Wang, Rui Xia

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology, China(计算机科学与工程学院,南京理工大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20777 2025-05-28 cs.CV 57%

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Zhehan Kan, Yanlin Liu, Kun Yin, Xinghua Jiang, Xin Li, Haoyu Cao, Yinsong Liu, Deqiang Jiang, Xing Sun, Qingmin Liao, Wenming Yang

机构 * Tencent YouTu Lab(腾讯YouTu实验室)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20672 2025-05-28 cs.AI 57%

GIFARC: Synthetic Dataset for Leveraging Human-Intuitive Analogies to Elevate AI Reasoning

Woochang Sim, Hyunseok Ryu, Kyungmin Choi, Sungwon Han, Sundong Kim

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20256 2025-05-27 cs.CV 57%

Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration

Hao Zhong, Muzhi Zhu, Zongze Du, Zheng Huang, Canyu Zhao, Mingyu Liu, Wen Wang, Hao Chen, Chunhua Shen

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

Comments Project page: https://aim-uofa.github.io/OmniR1

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15435 2025-05-27 cs.CV 57%

What Makes a Scene ? Scene Graph-based Evaluation and Feedback for Controllable Generation

Zuyao Chen, Jinlin Wu, Zhen Lei, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Institute of Automation, CAS(中国科学院自动化研究所)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19702 2025-05-27 cs.CV 57%

Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning

Minheng Ni, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Kevin Lin, Wangmeng Zuo, Lijuan Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft(微软公司)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19696 2025-05-27 cs.CV cs.MM eess.IV 57%

Modeling Beyond MOS: Quality Assessment Models Must Integrate Context, Reasoning, and Multimodality

Mohamed Amine Kerkouri, Marouane Tliba, Aladine Chetouani, Nour Aburaed, Alessandro Bruno

机构 * R&D Lab F-Initiatives(F-Initiatives研发实验室) Université d’Orleans(奥尔良大学) Université Sorbonne Paris Nord(巴黎-索邦大学) University of Dubai(迪拜大学) IULM University(IULM大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06397 2025-05-27 cs.CV 57%

PromptHMR: Promptable Human Mesh Recovery

Yufu Wang, Yu Sun, Priyanka Patel, Kostas Daniilidis, Michael J. Black, Muhammed Kocabas

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments CVPR 2025. Project website: https://yufu-wang.github.io/phmr-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00063 2025-05-23 cs.CL cs.CV 57%

GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling

Siqi Li, Yufan Shen, Xiangnan Chen, Jiayi Chen, Hengwei Ju, Haodong Duan, Song Mao, Hongbin Zhou, Bo Zhang, Bin Fu, Pinlong Cai, Licheng Wen, Botian Shi, Yong Liu, Xinyu Cai, Yu Qiao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) School of Science and Engineering, The Chinese University of Hong Kong(香港中文大学科学与工程学院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12617 2025-05-23 cs.CV cs.CY cs.SI 57%

Can GPT-4 Models Detect Misleading Visualizations?

Jason Alexander, Priyal Nanda, Kai-Cheng Yang, Ali Sarvghad

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Network Science Institute, Northeastern University(东北大学网络科学研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments 5 pages, 2 figures; accepted by IEEE VIS 2024 (https://ieeevis.org/year/2024/program/paper_v-short-1177.html)

Journal ref 2024 IEEE Visualization and Visual Analytics (VIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01805 2025-05-22 cs.CV 57%

SpaceR: Reinforcing MLLMs in Video Spatial Reasoning

Kun Ouyang, Yuanxin Liu, Haoning Wu, Yi Liu, Hao Zhou, Jie Zhou, Fandong Meng, Xu Sun

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) Nanyang Technological University(南洋理工大学) WeChat AI, Tencent Inc., China(微信AI,腾讯公司,中国)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12368 2025-05-21 cs.CV cs.CL 57%

InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model

Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Ziyu Liu, Shengyuan Ding, Shenxi Wu, Yubo Ma, Haodong Duan, Wenwei Zhang, Kai Chen, Dahua Lin, Jiaqi Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11083 2025-05-21 cs.CV cs.CL 57%

Customizing Visual-Language Foundation Models for Multi-modal Anomaly Detection and Reasoning

Xiaohao Xu, Yunkang Cao, Huaxin Zhang, Nong Sang, Xiaonan Huang

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

Comments Best Student Paper Award at IEEE International Conference on Computer Supported Cooperative Work in Design, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12782 2025-05-20 cs.GR cs.CV cs.IR cs.IT math.IT 57%

AdaToken-3D: Dynamic Spatial Gating for Efficient 3D Large Multimodal-Models Reasoning

Kai Zhang, Xingyu Chen, Xiaofeng Zhang

机构 * Kai Zhang 1(某机构) Xingyu Chen 3(某机构) Xiaofeng Zhang 2(某机构)

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12766 2025-05-20 cs.CV 57%

Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?

Haibin He, Maoyuan Ye, Jing Zhang, Xiantao Cai, Juhua Liu, Bo Du, Dacheng Tao

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, and Institute of Artificial Intelligence, Wuhan University, China(计算机学院、多媒体软件国家工程研究中心及人工智能研究所、武汉大学) College of Computing & Data Science at Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12237 2025-05-20 cs.CV 57%

From Shots to Stories: LLM-Assisted Video Editing with Unified Language Representations

Yuzhi Li, Haojun Xu, Feng Tian

机构 * Shanghai University(上海大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11049 2025-05-19 cs.AI cs.CR 57%

GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning

Yue Liu, Shengfang Zhai, Mingzhe Du, Yulin Chen, Tri Cao, Hongcheng Gao, Cheng Wang, Xinfeng Li, Kun Wang, Junfeng Fang, Jiaheng Zhang, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10875 2025-05-19 cs.CV 57%

A Light and Smart Wearable Platform with Multimodal Foundation Model for Enhanced Spatial Reasoning in People with Blindness and Low Vision

Alexey Magay, Dhurba Tripathi, Yu Hao, Yi Fang

机构 * Embodied AI and Robotics (AIR) Lab New York University Abu Dhabi(embodied AI 和机器人(AIR)实验室 新 York 大学阿布扎赫德)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments Project website and code: https://dktpt44.github.io/LV-GPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08807 2025-05-15 cs.CR cs.AI 57%

Security of Internet of Agents: Attacks and Countermeasures

Yuntao Wang, Yanghe Pan, Shaolong Guo, Zhou Su

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University(网络安全与工程学院,西安交通大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments 11 pages, 5 figures, 3 tables, submitted to IEEE OJCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21696 2025-05-15 cs.CL cs.CV 57%

Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks

Wenqi Zhang, Mengna Wang, Gangao Liu, Xu Huixin, Yiwei Jiang, Yongliang Shen, Guiyang Hou, Zhe Zheng, Hang Zhang, Xin Li, Weiming Lu, Peng Li, Yueting Zhuang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) DAMO Academy, Alibaba Group(阿里巴巴集团大模型学院) Nanjing Institute of Software Technology(南京软件技术研究所) Nanjing University of Posts and Telecommunications(南京邮电大学) Hohai University(河海大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments Code: https://github.com/zwq2018/embodied_reasoner Dataset: https://huggingface.co/datasets/zwq2018/embodied_reasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14356 2025-05-13 cs.CV cs.CL cs.CY cs.HC 57%

Semantic and Expressive Variation in Image Captions Across Languages

Andre Ye, Sebastin Santy, Jena D. Hwang, Amy X. Zhang, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏