arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26289 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4507 篇

2604.23072 2026-04-28 cs.AI 57%

Analytica: Soft Propositional Reasoning for Robust and Scalable LLM-Driven Analysis

分析:用于稳健和可扩展的LLM驱动分析的软命题推理

Junyan Cheng, Kyle Richardson, Peter Chin

机构 * Dartmouth College(达特茅斯学院) Allen Institute for AI(人工智能研究院)

专题命中 视觉推理 :grounding(abstract_cn);分类 cs.AI

AI总结 本文提出Analytica,一种基于软命题推理的新型代理架构,通过并行分治框架减少误差,提升LLM在金融、科学等领域的预测准确性与稳定性。

Comments ICLR 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14306 2026-04-27 cs.CL cs.AI 57%

EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation

欧洲医学问答研究协议:一个多语言、多模态的医学考试数据集用于语言模型评估

Francesco Andrea Causio, Vittorio De Vita, Olivia Riccomi, Michele Ferramola, Federico Felizzi, Alessandro Tosi, Antonio Cristiano, Lorenzo De Mori, Chiara Battipaglia, Melissa Sawaya, Luigi De Angelis, Marcello Di Pumpo, Alessandra Piscitelli, Pietro Eric Risuleo, Alessia Longo, Giulia Vojvodic, Mariapia Vassalli, Bianca Destro Castaniti, Nicolò Scarsi, Manuel Del Medico

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

AI总结 本文提出欧洲医学问答数据集,旨在通过多语言多模态数据评估语言模型性能,评估跨语言迁移和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21461 2026-04-24 cs.CV cs.HC 57%

Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

多模态大语言模型理解指认吗?在自我中心视觉中的基准测试与增强指认推理

Chentao Li, Zirui Gao, Mingze Gao, Yinglian Ren, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Academy of Art & Design, Tsinghua University(清华大学艺术与设计学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出EgoPoint-Bench基准测试,用于评估和提升自我中心视角下的多模态指认推理能力,通过11k高质量样本展示细调合成数据能显著提升性能和现实迁移能力。

Comments 20 pages, 14 figures. Committed to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21160 2026-04-24 cs.CV 57%

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

通过几何奖励信用分配强化点-视觉-语言模型的3D理解

Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han

机构 * Northwestern Polytechnical University(西北工业大学) Southern University of Science and Technology(南方科技大学) The University of Sheffield(谢菲尔德大学) Hengqin Laboratory(横琴实验室) Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出几何奖励信用分配框架,通过分离整体监督信号并定向反馈,提升点-视觉-语言模型的3D结构对齐能力,同时引入重投影一致性项约束物理可行性,从而提升3D KPA和重投影一致性评分。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20486 2026-04-23 cs.CV 57%

ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards

ProMMSearchAgent:一种通过过程导向奖励训练的通用多模态搜索代理

Wentao Yan, Shengqin Wang, Huichi Zhou, Yihang Chen, Kun Shao, Yuan Xie, Zhizhong Zhang

机构 * East China Normal University(东中国师范大学) Shanghai Innovation Institute(上海创新研究院) Huawei Noah's Ark Lab(华为诺亚实验室) Independent Researcher(独立研究者) University College London(伦敦大学学院)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出ProMMSearchAgent,通过过程导向奖励解决多模态代理在知识密集型视觉推理中的训练难题,实现零样本迁移至Google搜索API。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20749 2026-04-23 cs.AI 57%

Where and What: Reasoning Dynamic and Implicit Preferences in Situated Conversational Recommendation

何处与何物:在情境对话推荐中推理动态和隐性偏好

Dongding Lin, Jian Wang, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出SiPeR框架,通过场景转换估计和贝叶斯逆推推理,提升情境对话推荐的准确性和响应质量。

Comments Accpeted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20696 2026-04-23 cs.CV 57%

R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs

R-CoV:区域感知的验证链用于减轻LVLMs中的物体幻觉

Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr, Federico Tombari, Bernt Schiele

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) VIA Research Center(VIA研究中心) Google(谷歌)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 R-CoV通过区域感知的验证链方法,减轻LVLMs中的物体幻觉问题,采用六步流程,无需额外训练即可集成至多种LVLMs,实验表明有效缓解幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20570 2026-04-23 cs.CV 57%

Exploring Spatial Intelligence from a Generative Perspective

从生成视角探索空间智能

Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li, Kaijun Wang, Jintao Rong, Yang Liu, Hao Chen, Tao Lin, Chunhua Shen

机构 * Zhejiang University(浙江大学) State Key Laboratory of CAD & CG(计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学) Zhejiang University of Technology(浙江工业大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出GSI-Bench,首个评估生成空间智能的基准,通过空间 grounded 图像编辑量化空间合规性与编辑保真度,实验表明生成训练可提升空间推理能力。

Comments Accepted by CVPR 2026. Project page: https://aim-uofa.github.io/GSI-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14785 2026-04-23 cs.AI 57%

MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror

MirrorBench: 通过引入镜像评估多模态大语言模型中的自中心智能

Shengyu Guo, Tongrui Ye, Jianbo Zhang, Zicheng Zhang, Chunyi Li, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 MirrorBench通过引入镜像测试,系统评估多模态大语言模型的自中心智能,揭示其在基础视觉感知到高级自我表征方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19034 2026-04-22 cs.CV 57%

Explore Like Humans: Autonomous Exploration with Online SG-Memo Construction for Embodied Agents

像人类一样探索:面向具身智能体的在线SG-Memo构建自主探索

Xu Chen, Shichao Xie, Zhining Gu, Lu Jia, Minghua Luo, Fei Liu, Zedong Chu, Yanfen Shen, Xiaolong Wu, Mu Xu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ABot-Explorer框架,通过在线RGB-only过程统一记忆构建与探索,利用VLMs提取语义导航 affordances,生成结构化SG-Memo以提升探索效率和环境覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18957 2026-04-22 cs.CV 57%

Bridging Foundation Models and ASTM Metallurgical Standards for Automated Grain Size Estimation from Microscopy Images

弥合基础模型与ASTM冶金标准以实现显微图像中的晶粒尺寸自动估计

Abdul Mueez, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种结合Cellpose-SAM和ASTM E112 Jeffries平面模块的自动化管道,用于显微图像中的密集实例分割和晶粒尺寸估计,通过拓扑感知梯度追踪和适应性提示生成,实现高精度的冶金评估。

Comments Accepted at the 11th IEEE Workshop on Computer Vision for Multimodal Microscopy Image Analysis (CVMI), CVPR Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18715 2026-04-22 cs.CL cs.AI 57%

Characterizing AlphaEarth Embedding Geometry for Agentic Environmental Reasoning

表征AlphaEarth嵌入几何用于代理环境推理

Mashrekur Rahman, Samuel J. Barrett, Christina Last

机构 * Dartmouth Libraries(达特茅斯图书馆) Dartmouth College(达特茅斯学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文研究AlphaEarth嵌入几何结构,开发代理系统用于环境推理,发现其非欧几里得特性及检索优于线性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18484 2026-04-21 cs.CV cs.MM cs.RO 57%

XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型

Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang

机构 * Tsinghua University(清华大学) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) National University of Singapore(新加坡国立大学) McGill University(麦吉尔大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17584 2026-04-21 cs.AI 57%

DIRCR: Dual-Inference Rule-Contrastive Reasoning for Solving RAVENs

DIRCR:双推理规则对比推理用于解决RAVENs

Jiachen Zhang, Chengtai Li, Jianfeng Ren, Linlin Shen, Zheng Lu, Ruibin Bai

机构 * School of Computer Science, University of Nottingham Ningbo China, China(诺丁汉大学宁波校区计算机科学学院) Nottingham Ningbo China Beacons of Excellence Research and Innovation Institute, China(诺丁汉宁波中国卓越研究与创新研究所) School of Artificial Intelligence, Shenzhen University, China(深圳大学人工智能学院)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

AI总结 本文提出DIRCR模型,通过双推理推理模块和规则对比学习模块,解决RAVENs中全局与局部关系整合不足的问题,提升推理鲁棒性和泛化能力。

Comments Accepted By ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17503 2026-04-21 cs.AI cs.MA 57%

SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topology

SkillGraph: 基于多模态图拓扑的自进化多智能体协作

Zheng Nie, Ruolin Shen, Xinlei Yu, Bo Yin, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore, Singapore(新加坡国立大学) Technical University of Munich, Munich, Germany(慕尼黑技术大学) Zhejiang University, China(浙江大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 SkillGraph通过联合进化智能体能力与通信拓扑,解决视觉多智能体系统中固定拓扑和静态推理能力的问题,提升协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17385 2026-04-21 cs.CV 57%

SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning

SpatialImaginer: 向空间推理的自适应视觉想象迈进

Yian Li, Yang Jiao, Bin Zhu, Tianwen Qian, Shaoxiang Chen, Jingjing Chen, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学 computing 与信息学院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) MiniMax Institute of Trustworthy Embodied Al, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出SpatialImaginer框架,通过结合文本推理与视觉想象,解决多模态大语言模型在空间推理中的鲁棒性问题,实验显示其在复杂空间任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17295 2026-04-21 cs.AI 57%

LLaTiSA: Towards Difficulty-Stratified Time Series Reasoning from Visual Perception to Semantics

LLaTiSA:从视觉感知到语义的难度分层时间序列推理

Yueyang Ding, HaoPeng Zhang, Rui Dai, Yi Wang, Tianyu Zong, Kaikui Liu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) Amap(高德)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出LLaTiSA,通过四层分类体系提升时间序列推理能力,结合可视化模式与精确校准的数值表格增强视觉语言模型的时序感知,实现跨多样任务和现实场景的鲁棒泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17278 2026-04-21 cs.CV 57%

PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction

PestVL-Net: 通过细粒度视觉-语言交互实现多模态害虫学习

Xueheng Li, Tao Hu, Ke Cao, Runsheng Qi, Huixin Zhang, Rui Li, Jie Zhang, Chengjun Xie

机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学) Zhongke Hefei Institute of Technology Innovation Engineering(中科合肥技术创新工程研究院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出PestVL-Net框架,结合视觉与语言模型,解决细粒度害虫识别难题,通过RWKV架构和多模态大语言模型实现高效害虫学习。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02073 2026-04-21 cs.CV 57%

PLUME: Latent Reasoning Based Universal Multimodal Embedding

PLUME:基于潜在推理的通用多模态嵌入

Chenwei He, Xiangzhao Hao, Tianyu Yang, Yuxiang Ma, Yuheng Jia, Lingxiang Wu, Chaoyang Zhao, Haiyun Guo, Jinqiao Wang

机构 * Southeast University(东南大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 PLUME通过引入潜在推理框架改进通用多模态嵌入,用连续潜在状态的自回归滚动替代显式推理链,减少推理开销并提升效率,优于传统显式推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26278 2026-04-21 cs.CV cs.CL 57%

ProfVLM: A lightweight video-language model for multi-view proficiency estimation

ProfVLM:一种轻量级视频-语言模型用于多视角技能评估

Edoardo Bianchi, Jacopo Staiano, Antonio Liotta

机构 * Free University of Bozen-Bolzano(博洛尼亚-博兹纳自由大学) University of Trento(特伦托大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ProfVLM,一种轻量级视频-语言模型,通过生成式视觉-语言建模实现多视角技能评估,兼具生成自然语言反馈与定量评分,参数更少且训练更快。

Journal ref Computer Vision and Image Understanding, Volume 268, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02506 2026-04-21 cs.IR cs.AI 57%

R3A: Reinforced Reasoning for Relevance Assessment for RAG in User-Generated Content Platforms

R3A:强化推理用于用户生成内容平台中的RAG相关性评估

Xiaowei Yuan, Lei Jin, Haoxin Zhang, Ziyang Huang, Yan Gao, Yi Wu, Yao Hu, Jun Zhao, Kang Liu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统认知与决策智能重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xiaohongshu Inc.(小红书公司)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 R3A通过意图推理和证据定位解决UGC平台中相关性评估的挑战,提升模型在稀疏反馈和非对称相关性中的表现。

Comments Accepted by ACL Industry 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02930 2026-04-21 cs.CV 57%

TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos

TemporalVLM:长视频中的时间推理视频大语言模型

Fawad Javed Fateh, Umer Ahmed, Hamza Khan, M. Zeeshan Zia, Quoc-Huy Tran

机构 * Retrocausal, Inc.(Retrocausal公司)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 本文提出TemporalVLM,一种用于长视频时间推理和细粒度理解的视频大语言模型,通过时间感知编码和BiLSTM模块实现全局特征聚合,并引入IndustryASM数据集进行评估。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16858 2026-04-21 cs.CV 57%

Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement

Q-DeepSight:利用图像激励思考用于图像质量评估与细化

Xudong Li, Jiaxi Tan, Ziyin Zhou, Yan Zhong, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 本文提出Q-DeepSight框架,通过多模态链式思考与工具增强证据获取,提升图像质量评估与细化的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09536 2026-04-21 cs.AI 57%

Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning

Omni-R1:迈向多模态推理的统一生成范式

Dongjie Cheng, Yongqi Li, Zhixin Ma, Hongru Cai, Yupeng Hu, Wenjie Wang, Liqiang Nie, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡国立大学) Shandong University(山东大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出Omni-R1,通过生成中间图像统一多模态推理技能,解决单一任务特定推理模式限制的问题,并引入Omni-R1-Zero无需多模态标注实现文本仅推理数据的逐步可视化。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11140 2026-04-21 cs.CL cs.AI 57%

Follow the Path: Reasoning over Knowledge Graph Paths to Improve Large Language Model Factuality

跟随路径:通过知识图谱路径推理提升大语言模型事实性

Mike Zhang, Johannes Bjerva, Russa Biswas

机构 * University of Copenhagen(哥本哈根大学) Aalborg University(奥尔堡大学) Pioneer Centre for Artificial Intelligence(先锋人工智能中心)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出fs1方法,通过收集大推理模型的推理轨迹并将其锚定在知识图谱路径上,提升大语言模型的事实性,在六个复杂开放领域问答基准测试中表现优异。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16549 2026-04-21 cs.CV 57%

MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems

MathFlow: 提升多模态大语言模型在视觉数学问题中的感知流

Shuhang Chen, Hangjie Yuan, Yunqiu Xu, Pengwei Liu, Tao Feng, Jun Cen, Zeying Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Intelligent Learning(智能学习) Tsinghua University(清华大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MathFlow框架,通过分离感知与推理阶段,提升多模态大语言模型在视觉数学问题中的表现,实验表明其在不同推理模型中均有效。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16024 2026-04-20 cs.MA cs.CV 57%

AstroVLM: Expert Multi-agent Collaborative Reasoning for Astronomical Imaging Quality Diagnosis

AstroVLM:专家多智能体协作推理用于天体成像质量诊断

Yaohui Han, Tianshuo Wang, Zixi Zhao, Zhengchun Zhu, Shuo Ren, Yiru Wang, Rongliang Fu, Tinghuan Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

AI总结 本文提出AstroVLM,通过多智能体协作推理解决复杂天体成像质量诊断问题,实验表明其在实际任务中优于所有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13091 2026-04-20 cs.CV 57%

Reasoning over Video: Evaluating How MLLMs Extract, Integrate, and Reconstruct Spatiotemporal Evidence

视频推理:评估大语言模型如何提取、整合和重构时空证据

Seunghwan Bang, Hwanjun Song

机构 * UNIST(全南大学) KAIST(韩国科学技术院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文评估大语言模型在视频中的时空推理能力,提出VAEX-BENCH基准,通过合成数据测试抽象推理任务,揭示模型在抽象任务中的局限性。

Comments Project page: https://disl-lab.github.io/VAEX-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10446 2026-04-20 cs.RO cs.AI 57%

VeriGraph: Scene Graphs for Execution Verifiable Robot Planning

VeriGraph:用于可验证机器人规划的场景图

Daniel Ekpo, Mara Levy, Saksham Suri, Chuong Huynh, Archana Swaminathan, Abhinav Shrivastava

机构 * University of Maryland, College Park, MD USA(马里兰大学学院公园分校)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 VeriGraph通过整合视觉语言模型和场景图,提升机器人任务规划的可行性验证与修正,显著提高任务完成率。

Comments Accepted to ICRA 2026. Project website: https://verigraph-agent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11600 2026-04-17 cs.CV 57%

Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language

几何解析:一种统一形式语言用于平面和立体几何的图表解析

Peijie Wang, Ming-Liang Zhang, Jun Cao, Chao Deng, Dekang Ran, Hongda Sun, Pi Bu, Xuan Zhang, Yingyao Wang, Jun Song, Bo Zheng, Fei Yin, Cheng-Lin Liu

机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种统一形式语言,结合平面和立体几何,构建了GDP-29K数据集,通过监督微调与可验证奖励的强化学习提升几何解析性能,提升MLLMs的几何推理能力。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏