PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
Weijie Zhou, Xuantang Xiong, Yi Peng, Manli Tao, Chaoyang Zhao, Honghui Dong, Ming Tang, Jinqiao Wang
机构
*
Beijing Jiaotong University(北京交通大学)
;
Tencent Robotics X & Futian Laboratory, Shenzhen(腾讯机器人X及福田实验室,深圳)
;
Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,中国科学院自动化研究所)
;
ObjectEye Inc(ObjectEye公司)
专题命中
视觉推理
:visual reasoning(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments39th Conference on Neural Information Processing Systemss (NeurIPS 2025)
Visual Reasoning and Multi-Agent Approach in Multimodal Large Language Models (MLLMs): Solving TSP and mTSP Combinatorial Challenges
Mohammed Elhenawy, Ahmad Abutahoun, Taqwa I. Alhadidi, Ahmed Jaber, Huthaifa I. Ashqar, Shadi Jaradat, Ahmed Abdelhay, Sebastien Glaser, Andry Rakotonirainy
专题命中
视觉推理
:visual reasoning(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
Reinforcing Dual-Path Reasoning in Spatial Vision Language Models
空间视觉语言模型中的双路径推理强化
Yatai Ji, An-Chieh Cheng, Yang Fu, Yukang Chen, Han Zhang, Zhaojing Yang, Wei Huang, Ka Chun Cheung, Song Han, Vidya Nariyambut Murali, Pavlo Molchanov, Jan Kautz, Simon See, Hongxu Yin, Ping Luo, Sifei Liu
机构
*
The University of Hong Kong(香港大学)
;
NVIDIA(英伟达)
;
University of California, San Diego(加州大学圣迭戈分校)
专题命中
视觉推理
:VLM(summary_cn,abstract);vision language model(title);grounding(abstract);分类 cs.CV、cs.AI
CommentsAccepted for publication at the IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). 6 pages, 3 figures, 1 table
SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
SpatialAct:探测VLM智能体在3D场景中的空间推理到行动能力
Tianhui Liu, Jie Feng, Zhiheng Zheng, Shengyuan Wang, Yiming Guo, Yanxin Xi, Hangyu Fan, Yong Li, Pan Hui
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
Zhongguancun Academy(中关村学院)
;
Tsinghua University(清华大学)
;
Helsinki University(赫尔辛基大学)
Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models
Circle-RoPE: 用于大视觉-语言模型的锥形解耦旋转位置嵌入
Chengcheng Wang, Jianyuan Guo, Hongguang Li, Yuchuan Tian, Ying Nie, Chang Xu, Kai Han
机构
*
Huawei Noah's Ark Lab.(华为诺亚实验室)
;
City University of Hong Kong.(香港城市大学)
;
University of Sydney.(悉尼大学)
;
State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学人工智能国家重点实验室,智能科学与技术学院)
机构
*
Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
CITIC Securities(中信证券)
;
School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
机构
*
School of Software Technology, Zhejiang University(浙江大学软件学院)
;
Hong Kong Polytechnic University(香港理工大学)
;
The University of Southern Queensland(南昆士兰大学)
专题命中
视觉推理
:MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV
MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku
基于最大可满足性的反馈在数独中引导视觉语言模型
Pedro Orvalho, Guillem Alenyà, Felip Manyà
机构
*
Artificial Intelligence Research Institute (IIIA), Consejo Superior de Investigaciones Científicas (CSIC)(人工智能研究所(IIIA),西班牙科学研究高级理事会(CSIC))
;
Institut de Robòtica i Informàtica Industrial (IRI-CSIC-UPC)(工业机器人与信息学研究所(IRI-CSIC-UPC))
机构
*
Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心)
;
Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院)
;
School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院)
;
School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)
专题命中
视觉推理
:visual reasoning(title,abstract);MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract)
Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models
潜在噪声掩码:减少多模态大语言模型中的视觉冗余
Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li
机构
*
School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学)
;
Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院、中国电信(TeleAI))
;
Fudan University(复旦大学)
;
The University of Hong Kong(香港大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);visual reasoning(abstract);grounding(abstract)
SurgXBench: Explainable Vision-Language Model Benchmark for Surgery
SurgXBench: 可解释的视觉-语言模型手术基准
Jiajun Cheng, Xianwu Zhao, Sainan Liu, Xiaofan Yu, Ravi Prakash, Patrick J. Codd, Jonathan Elliott Katz, Shan Lin
机构
*
Arizona State University(亚利桑那州立大学)
;
Intel Labs(英特尔实验室)
;
Duke University(杜克大学)
;
University of Miami(迈阿密大学)
;
University of California, Merced(加州大学默塞德分校)