arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-11 至 2025-12-11 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 10 篇

2512.09349 2025-12-11 cs.RO 82%

COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning

COVLM-RL:基于VLM引导强化学习的自动驾驶中关键对象导向推理

Lin Li, Yuxin Cai, Jianwu Fang, Jianru Xue, Chen Lv

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究院)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract)

AI总结 COVLM-RL通过结合关键对象导向推理与VLM引导强化学习,提升了自动驾驶系统的泛化能力和训练效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09555 2025-12-11 cs.CV 80%

Building Reasonable Inference for Vision-Language Models in Blind Image Quality Assessment

构建合理的视觉-语言模型推理以实现盲图像质量评估

Yuan Li, Zitang Sun, Yen-ju Chen, Shin'ya Nishida

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究生院)

专题命中 视觉推理 :vision-language model(title,journal_ref);VLM(abstract);分类 cs.CV

AI总结 本文提出一种两阶段调优方法,通过分离视觉感知与质量推断,提升视觉-语言模型在盲图像质量评估中的推理稳定性与可靠性。

Comments Accepted to the ICONIP (International Conference on Neural Information Processing), 2025

Journal ref Building Reasonable Inference for Vision-Language Models in Blind Image Quality Assessment. In: Taniguchi, T., et al. Neural Information Processing. ICONIP 2025. Lecture Notes in Computer Science, vol 16310. Springer, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08580 2025-12-11 cs.RO cs.AI 77%

Mind to Hand: Purposeful Robotic Control via Embodied Reasoning

Mind to Hand: 通过具身推理实现目的性机器人控制

Peijun Tang, Shangjin Xie, Binyan Sun, Baifu Huang, Kuncheng Luo, Haotian Yang, Weiqi Jin, Jianan Wang

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 Lumo-1通过具身推理实现目的性机器人控制,结合视觉语言动作模型提升机器人推理与动作协调能力。

Comments 49 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09251 2025-12-11 cs.CV cs.AI 76%

GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model

GLACIA:基于多模态大语言模型的冰湖分割实例感知位置推理

Lalit Maurya, Saurabh Kaushik, Beth Tellman

机构 * Portsmouth AI and Data Science Centre (PAIDS), School of Computing, University of Portsmouth(普森大学计算学院) Center for Sustainability and the Global Environment (SAGE), University of Wisconsin–Madison(威斯康星大学麦迪逊分校可持续性与全球环境中心)

专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV、cs.AI

AI总结 GLACIA通过多模态大语言模型实现冰湖分割的实例感知位置推理,提升分割精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09616 2025-12-11 cs.CV cs.AI cs.CL cs.LG 75%

Rethinking Chain-of-Thought Reasoning for Videos

重新思考视频中的链式推理

Yiwu Zhong, Zi-Yuan Hu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02022 2025-12-11 cs.CV 70%

Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs

你看见我:一个多维基准用于评估多模态大语言模型的视觉感知

Aditya Kanade, Tanuja Ganu

机构 * Microsoft Research India(微软印度研究院)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 该研究提出‘你看见我’基准,评估多模态大语言模型的视觉感知能力,发现其在复杂任务中表现远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09396 2025-12-11 cs.MA cs.AI 57%

GAIR: GUI Automation via Information-Joint Reasoning and Group Reflection

GAIR:通过信息联合推理和群体反思实现GUI自动化

Zishu Wei, Qixiang Ma, Xavier Hu, Yuhang Liu, Hui Zang, Yudong Zhao, Tao Wang, Shengyu Zhang, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 视觉推理 :MLLM(abstract);分类 cs.AI

AI总结 GAIR是一种基于MLLM的GUI自动化代理框架,通过信息联合推理和群体反思整合异质模型能力,提升GUI自动化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20427 2025-12-11 cs.CV 57%

Seedream 4.0: Toward Next-generation Multimodal Image Generation

Seedream 4.0:迈向下一代多模态图像生成

Team Seedream, :, Yunpeng Chen, Yu Gao, Lixue Gong, Meng Guo, Qiushan Guo, Zhiyao Guo, Xiaoxia Hou, Weilin Huang, Yixuan Huang, Xiaowen Jian, Huafeng Kuang, Zhichao Lai, Fanshi Li, Liang Li, Xiaochen Lian, Chao Liao, Liyang Liu, Wei Liu, Yanzuo Lu, Zhengxiong Luo, Tongtong Ou, Guang Shi, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Rui Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Wenxu Wu, Yonghui Wu, Xin Xia, Xuefeng Xiao, Shuang Xu, Xin Yan, Ceyuan Yang, Jianchao Yang, Zhonghua Zhai, Chenlin Zhang, Heng Zhang, Qi Zhang, Xinyu Zhang, Yuwei Zhang, Shijia Zhao, Wenliang Zhao, Wenjia Zhu

机构 * ByteDance(字节跳动)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 Seedream 4.0通过高效多模态框架实现文本到图像生成、图像编辑和多图像组合,展示卓越的多模态能力与高效推理性能。

Comments Seedream 4.0/4.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17097 2025-12-11 cs.CV cs.CL 57%

Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning

让LVLMs聚焦:基于上下文的注意力调节以提升多模态上下文学习

Yanshu Li, Jianjiang Yang, Ziteng Yang, Bozheng Li, Ligong Han, Hongyang He, Zhengtao Yao, Yingjie Victor Chen, Songlin Fei, Dongfang Liu, Ruixiang Tang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CAMA,一种无需训练的注意力调节方法,通过动态调整注意力logits提升多模态上下文学习性能。

Comments 14 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09310 2025-12-11 cs.RO 50%

Scene-agnostic Hierarchical Bimanual Task Planning via Visual Affordance Reasoning

场景无关的双臂任务规划 via 视觉可及性推理

Kwang Bin Lee, Jiho Kang, Sung-Hee Lee

机构 * Graduate School of Culture Technology, Korea Advanced Institute of Science and Technology (KAIST)(文化科技研究生院,韩国科学技术院)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出了一种场景无关的双臂任务规划框架,通过视觉可及性推理实现双臂操作的高效规划与执行。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏