机构
*
School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)
;
National Engineering Research Center of Electric Vehicles, Beijing Institute of Technology(北京理工大学电动车辆国家工程研究中心)
;
School of Mechanical Engineering, Southeast University(东南大学机械工程学院)
机构
*
Hunan University, Changsha, China(湖南大学)
;
Wuhan University of Technology, Wuhan, China(武汉理工大学)
;
Huazhong University of Science and Technology, Wuhan, China(华中科技大学)
专题命中
视觉推理
:VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.AI
Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning
不要愚弄我两次:通过经验驱动推理在野外适应逆境
Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer
机构
*
Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院工程设计系,马德拉斯)
;
Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning
打破似曾相识:通过视觉语言推理对视觉场所识别进行独立审计
Sania Waheed, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan
机构
*
School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院)
;
School of Electrical Engineering and Computer Science, Queensland University of Technology(昆士兰科技大学电气工程与计算机科学学院)
;
School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院)
Towards Temporal Compositional Reasoning in Long-Form Sports Videos
长期体育视频中的时间组成推理方法
Siyu Cao, Lu Zhang, Ruizhe Zeng, Zhi-yong Liu
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
专题命中
视觉推理
:grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
MMIR-TCM: Memory-Integrated Multimodal Inference and Retrieval for TCM Clinical Decision Support
MMIR-TCM:面向中医临床决策支持的记忆集成多模态推理与检索
Lihui Luo, Joongwon Chae, Ziyan Chen, Yang Liu, Siyi Cheng, Weihan Gao, Zelin Zeng, Xiaoming Yin, Samaneh Beheshti Kashi, Dongmei Yu, Lian Zhang, Jing Sui, Zeming Liang, Jiansong Ji, Peter E. Lobie, Peiwu Qin
机构
*
Institute of Biopharmaceutics and Health Engineering, Tsinghua Shenzhen International Graduate School(清华深圳国际研究生院生物医药与健康工程研究院)
;
Chinese Medicine Guangdong Laboratory(广东省中医药实验室)
;
Beijing Normal University(北京师范大学)
;
First Hospital of Hebei Medical University(河北医科大学第一医院)
;
Lishui Hospital of Zhejiang University(浙江大学丽水医院)
;
XiaoMing TCM Hospital(小明中医医院)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking
PixelEyes: 解耦感知与推理以实现精准视觉证据查找
Dengxian Gong, Yuanzheng Wu, Haobo Yuan, Zhengdong Hu, Tao Zhang, Yikang Zhou, Shihao Chen, Quanzhu Niu, Kai Wang, Jason Li, Haochen Wang, Lu Qi, Shunping Ji, Ming-Hsuan Yang
机构
*
School of Electrical Engineering, Korea University(韩国大学电气工程学院)
;
Department of Hospital Pathology, The Catholic University of Korea College of Medicine(韩国天主教大学医学院医院病理学系)
Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution
自进化智能体图像恢复:通过深思熟虑的规划与直觉执行
Shuang Cui, Fan Ji, Guanglong Sun, Yufei Guo, Xiongxin Tang, Jiangmeng Li, Fanjiang Xu
机构
*
Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
School of Life Sciences, Tsinghua University(清华大学生命科学学院)
;
Intelligent Science & Technology Academy of CASIC(中国科学院 CASIC 智能科学与技术学院)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs
OmniSpace: 自动驾驶多模态大语言模型的高效几何感知
Hao Vo, Phu Loc Nguyen, Khoa Vo, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le
机构
*
University of Arkansas(阿肯色大学)
;
Google Research, Google(谷歌研究院)
;
University of Liverpool(利物浦大学)
;
Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所)
专题命中
视觉推理
:MLLM(summary_cn);multimodal large language model(abstract);分类 cs.CV
机构
*
Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院)
;
Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室)