arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26172 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4484 篇

2604.13540 2026-04-16 cs.CV cs.AI 62%

Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding

统一多模态模型的免费午餐:通过内在理解的反思校正增强生成

Yibo Jiang, Tao Wu, Rui Jiang, Yehao Lu, Chaoxiang Cai, Zequn Qin, Xi Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computer Science(计算机科学学院)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UniRect-CoT框架,通过反思校正提升统一多模态模型的生成能力,利用内部知识校正中间结果,增强生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13448 2026-04-16 cs.CV cs.AI 62%

A Study of Failure Modes in Two-Stage Human-Object Interaction Detection

两阶段人-物交互检测中故障模式的研究

Lemeng Wang, Qinqian Lei, Vidhi Bakshi, Daniel Yi, Yifan Liu, Jiacheng Hou, Asher Seng Hao, Zheda Mai, Wei-Lun Chao, Robby T. Tan, Bo Wang

机构 * The Ohio State University(俄亥俄州立大学) National University of Singapore(新加坡国立大学) Boston University(波士顿大学) Independent Researcher(独立研究者) University of Mississippi(密西西比大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文研究两阶段人-物交互检测模型的故障模式,通过分解检测任务为多个可解释视角,分析模型行为以识别不同失败模式,揭示高基准性能不等于 robust 视觉推理的结论。

Comments Accepted to SAUAFG Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13029 2026-04-15 cs.CV cs.AI 62%

Visual Preference Optimization with Rubric Rewards

基于评分标准的视觉偏好优化

Ya-Qi Yu, Fangyu Hong, Xiangyang Qu, Hao Wang, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出rDPO框架,通过实例特定的评分标准提升多模态任务中的偏好优化效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12896 2026-04-15 cs.CV cs.LG 62%

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

不要显示像素,显示提示:通过感知程序解锁语言模型中的视觉工具推理

Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

机构 * Huawei Technologies, Canada(华为技术(加拿大)) University of Alberta, Canada(阿尔伯塔大学(加拿大))

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

AI总结 本文提出感知程序(P²),通过将视觉工具输出转换为结构化摘要,提升语言模型的视觉推理能力,在六个任务中均取得显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00181 2026-04-15 cs.CV cs.AI 62%

CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning

CamReasoner:通过结构化空间推理强化相机运动理解

Hang Wu, Yujun Cai, Zehao Li, Haonan Ge, Bowen Sun, Junsong Yuan, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) University of Queensland(昆士兰大学) Ant Group(蚂蚁集团) University of Chinese Academy of Sciences(中国科学院大学) University at Buffalo, State University of New York(纽约州立大学布法罗分校)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 CamReasoner通过结构化推理框架提升相机运动理解,采用O-T-A范式和大规模推理轨迹集,首次利用强化学习实现逻辑对齐,提升分类和VQA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12512 2026-04-15 cs.CV cs.AI 62%

NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1)

NTIRE 2026 第三次恢复任何图像模型(RAIM)挑战:专业图像质量评估(Track 1)

Guanyi Qin, Jie Liang, Bingbing Zhang, Lishen Qu, Ya-nan Guan, Hui Zeng, Lei Zhang, Radu Timofte, Jianhui Sun, Xinli Yue, Tao Shao, Huan Hou, Wenjie Liao, Shuhao Han, Jieyu Yuan, Chunle Guo, Chongyi Li, Zewen Chen, Yunze Liu, Jian Guo, Juan Wang, Yun Zeng, Bing Li, Weiming Hu, Hesong Li, Dehua Liu, Xinjie Zhang, Qiang Li, Li Yan, Wei Dong, Qingsen Yan, Xingcan Li, Shenglong Zhou, Manjiang Yin, Yinxiang Zhang, Hongbo Wang, Jikai Xu, Zhaohui Fan, Dandan Zhu, Wei Sun, Weixia Zhang, Kun Zhu, Nana Zhang, Kaiwei Zhang, Qianqian Zhang, Zhihan Zhang, William Gordon, Linwei Wu, Jiachen Tu, Guoyi Xu, Yaoxin Jiang, Cici Liu, Yaokun Shi

机构 * NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1)(NTIRE 2026 第三次恢复任何图像模型(RAIM)挑战:专业图像质量评估(Track 1))

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出NTIRE 2026挑战赛,聚焦专业图像质量评估,通过多模态大语言模型提升图像评估的准确性与解释性,吸引200多团队参与,推动专业IQA领域的发展。

Comments NTIRE Challenge Report. Accepted by CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09907 2026-04-14 cs.CV cs.AI cs.CL 62%

From UAV Imagery to Agronomic Reasoning: A Multimodal LLM Benchmark for Plant Phenotyping

从无人机图像到农学推理:一种多模态大语言模型基准用于植物表型分析

Yu Wu, Guangzeng Han, Ibra Niang Niang, Francia Ravelombola, Maiara Oliveira, Jason Davis, Dong Chen, Feng Lin, Xiaolei Huang

机构 * University of Memphis(孟菲斯大学) University of Missouri(密苏里大学) University of Arkansas Division of Agriculture(阿肯色大学农业分部) Mississippi State University(密西西比州立大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PlantXpert基准,用于大豆和棉花表型分析,评估多模态模型在农业领域的表现,发现任务特定微调显著提升准确率,但模型扩展和跨物种泛化仍面临挑战。

Comments In review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27817 2026-04-13 cs.CV cs.AI cs.CR 62%

Towards Context-Aware Image Anonymization with Multi-Agent Reasoning

面向多智能体推理的上下文感知图像匿名化

Robert Aufschläger, Jakob Folz, Gautam Savaliya, Manjitha D Vidanalage, Michael Heigl, Martin Schramm

机构 * Deggendorf Institute of Technology(代根多夫应用技术大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CAIAMAR框架,通过多智能体推理和扩散匿名化技术,实现上下文感知的PII分割,减少重识别风险并提升图像质量。

Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22832 2026-04-13 cs.CV cs.AI 62%

Listener-Rewarded Thinking in VLMs for Image Preferences

图像偏好中的VLMs思考奖励

Alexander Gambashidze, Li Pengyi, Matvey Skripkin, Andrey Galichin, Anton Gusarov, Konstantin Sobolev, Andrey Kuznetsov, Ivan Oseledets

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种增强GRPO框架,通过引入独立的监听器模型来校准推理过程,提升图像偏好任务中的准确性和泛化能力。

Comments part of a different work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08541 2026-04-10 cs.CV cs.AI cs.CL 62%

Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts

视觉而无思维:多模态混合专家中的路由干扰

Haolei Xu, Haiwen Hong, Hongxing Li, Rui Zhou, Yang Zhang, Longtao Huang, Hui Xue, Yongliang Shen, Weiming Lu, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 研究揭示多模态混合专家模型在视觉输入时路由机制无法有效激活任务相关专家,导致推理失败,提出路由干扰假说并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08540 2026-04-10 cs.CV cs.AI cs.CL 62%

AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

AVGen-Bench: 一项面向多粒度评估的文本到音频视频生成任务驱动基准

Ziwei Zhou, Zeyuan Lai, Rui Wang, Yifan Yang, Zhen Xing, Yuqing Yang, Qi Dai, Lili Qiu, Chong Luo

机构 * Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 AVGen-Bench通过11个真实场景的高质量提示,结合轻量专家模型与多模态大语言模型,实现对文本到音频视频生成的多粒度评估,揭示了音频视觉美学与语义可靠性之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03302 2026-04-07 cs.CV cs.AI 62%

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

超越静态视觉:场景动态场解锁多模态大语言模型中的直观物理理解

Nanxi Li, Xiang Wang, Yuanjie Chen, Haode Zhang, Hong Li, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨多模态大语言模型在物理理解上的不足,提出Scene Dynamic Field方法提升对连续物体动态的理解能力,实现20.7%的改进并展现良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00721 2026-04-07 cs.CV cs.LG 62%

Common Inpainted Objects In-N-Out of Context

常见补全物体在上下文中的内-外场景

Tianze Yang, Tyson Jordan, Ruitong Sun, Ninghao Liu, Jin Sun

机构 * University of Georgia(佐治亚大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.LG

AI总结 COinCO数据集通过扩散补全技术生成97722张包含上下文一致和不一致场景的图像,用于研究上下文学习,支持细粒度上下文推理、基于上下文的物体预测和增强的假检测。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08548 2026-04-07 cs.RO cs.AI cs.LG 62%

From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation

从感知到行动:弥合推理与决策以实现机器人操作

Yifu Yuan, Haiqin Cui, Yibin Chen, Zibin Dong, Fei Ni, Longxin Kou, Jinyi Liu, Pengyi Li, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FSD模型,通过空间关系推理生成中间表示,提升机器人操作的泛化能力,在8个基准测试中表现优异,且在零样本任务中实现显著性能提升。

Comments Published as a conference paper at ICLR 2026. Our project homepage: https://embodied-fsd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02296 2026-04-03 cs.CV cs.AI 62%

VOID: Video Object and Interaction Deletion

VOID:视频对象和交互删除

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

机构 * Netflix

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VOID通过物理合理填充解决复杂场景下的视频对象删除问题,结合视觉语言模型和视频扩散模型,提升场景动态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16082 2026-04-03 q-bio.QM cs.AI cs.LG 62%

BIOGEN: Evidence-Grounded Multi-Agent Reasoning Framework for Transcriptomic Interpretation in Antimicrobial Resistance

BIOGEN:基于证据的多智能体推理框架用于抗菌药物耐药性中的转录组解释

Elias Hossain, Mehrdad Shoeibi, Ivan Garibay, Niloofar Yousefi

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 BIOGEN通过结合生物信息检索、结构化推理和多批评验证,生成可追溯的转录组模块解释,其在抗菌药物耐药性研究中表现出强生物学基础和零幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01754 2026-04-03 cs.CL cs.AI cs.LG 62%

LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches

LiveMathematicianBench: 一个用于数学家级推理的实时基准

Linyang He, Qiyao Yu, Hanze Dong, Baohao Liao, Xinxing Xu, Micah Goldblum, Jiang Bian, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学) Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LiveMathematicianBench,一个基于近期arXiv论文的动态多选基准,用于评估大语言模型的数学推理能力,通过证明草图指导的干扰项生成机制,提升对真实理解的检测。

Comments Project page: https://livemathematicianbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21458 2026-04-01 cs.AI cs.CL cs.CV 62%

MindCube: Spatial Mental Modeling from Limited Views

MindCube:从有限视角构建空间心理模型

Qineng Wang, Baiqiao Yin, Pingyue Zhang, Jianshu Zhang, Kangrui Wang, Zihan Wang, Jieyu Zhang, Keshigeyan Chandrasegaran, Han Liu, Ranjay Krishna, Saining Xie, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过MindCube基准测试,探讨视觉语言模型能否从有限视角构建空间心理模型,提出'map-then-reason'方法提升模型性能,实现从37.8%到61.3%的准确率提升。

Comments The latest version includes an expanded discussion of scaffolding, along with updated data statistics and experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26737 2026-03-31 cs.CV cs.AI 62%

Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning

超越静态视觉标记:结构化的顺序视觉推理

Guangfu Guo, Xiaoqian Lu, Yue Feng, Mingming Sun

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结构化顺序视觉推理方法,通过构建视觉重要性图谱并按判别顺序进行推理,提升多模态模型的视觉认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26639 2026-03-30 cs.CV cs.AI 62%

Make Geometry Matter for Spatial Reasoning

让几何在空间推理中发挥作用

Shihua Zhang, Qiuhong Shen, Shizun Wang, Tianbo Pan, Xinchao Wang

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GeoSR框架,通过几何解封掩码和几何引导融合,提升视觉语言模型的空间推理能力,实验证明其在静态和动态场景中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26348 2026-03-30 cs.CV cs.AI 62%

Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification

反思以获取信息:通过信息增益驱动的验证提升多模态推理

Shuai Lv, Chang Liu, Feng Tang, Yujie Yuan, Aojun Zhou, Kui Zhang, Xi Yang, Yangqiu Song

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部) The Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VRE框架,通过信息增益驱动的自我进化训练,提升多模态大语言模型的推理准确性和感知可靠性,减少幻觉,尤其在长链任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25091 2026-03-27 cs.CV cs.AI 62%

Pixelis: Reasoning in Pixels, from Seeing to Acting

Pixelis:在像素中推理,从看见到行动

Yunpeng Zhou

机构 * University of Reading(雷丁大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 Pixelis通过在像素空间中直接操作图像和视频,结合执行操作和学习后果,提升视觉智能的通用性和物理基础,实现基于行动的多模态感知。

Comments 28pages, 16figures, 18tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24558 2026-03-26 cs.CV cs.AI 62%

LensWalk: Agentic Video Understanding by Planning How You See in Videos

LensWalk: 通过规划如何在视频中观看实现代理视频理解

Keliang Li, Yansong Li, Hongze Shen, Mengdi Liu, Hong Chang, Shiguang Shan

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peng Cheng Laboratory(鹏城实验室) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 LensWalk通过建立紧密的推理-计划-观察循环,使大语言模型能够主动控制视觉观察,提升视频理解的准确性和鲁棒性。

Comments To be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21289 2026-03-25 cs.CV cs.AI 62%

When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning

当模型自我评判:多模态推理的无监督自进化

Zhengxian Wu, Kai Shi, Chuanrui Zhang, Zirui Liao, Jun Yang, Ni Yang, Qiuying Peng, Luyuan Zhang, Hangrui Xu, Tianhuang Su, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Hefei University of Technology(合肥工业大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种无监督自进化框架,通过自一致性信号和动态调节机制,在无需人工标注或外部奖励模型的情况下提升多模态推理性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13719 2026-03-25 cs.CV cs.AI cs.IR 62%

Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search

基于音频视觉实体凝聚力与代理搜索的层次化长视频理解

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HAVEN框架,通过整合音频视觉实体凝聚力与层次化视频索引与代理搜索,解决长视频理解中的信息碎片化和全局一致性问题,实验显示在LVBench上达到84.1%的准确率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22321 2026-03-25 cs.CV cs.AI cs.CL 62%

From Instructions to Assistance: a Dataset Aligning Instruction Manuals with Assembly Videos for Evaluating Multimodal LLMs

从指令到协助:一个对齐指令手册与装配视频的数据集用于评估多模态大语言模型

Federico Toschi, Nicolò Brunello, Andrea Sassella, Vincenzo Scotti, Mark James Carman

机构 * DEIB, Politecnico di Milano(米兰理工大学DEIB学院) KASTEL, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院KASTEL研究所)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出M2AD数据集,用于评估多模态大语言模型在技术任务中的协助能力,探讨其推理、步骤跟踪和指令引用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22279 2026-03-24 cs.CV cs.AI 62%

3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing

3D-Layout-R1: 为语言指导的空间编辑进行结构化推理

Haoyu Zhen, Xiaolong Li, Yilin Zhao, Han Zhang, Sifei Liu, Kaichun Mo, Chuang Gan, Subhashree Radhakrishnan

机构 * NVIDIA UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12781 2026-03-23 cs.AI cs.CV 62%

VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension

VIRO:用于指代表达理解的鲁棒且高效的神经符号推理与验证

Hyejin Park, Junhyuk Kwon, Suha Kwak, Jungseul Ok

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学(POSTECH))

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VIRO通过在推理步骤中嵌入轻量级操作符验证器,提升指代表达理解的鲁棒性和效率,达到61.1%的平衡准确率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18418 2026-03-20 cs.CV cs.AI 62%

Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

注意罕见病:罕见皮肤疾病能否通过诊断推理可靠诊断?

Yang Liu, Jiyao Yang, Hongjin Zhao, Xiaoyong Li, Yanzhe Ji, Xingjian Li, Runmin Jiang, Tianyang Wang, Saeed Anwar, Dongwoo Kim, Yue Yao, Zhenyue Qin, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Australian National University(澳大利亚国立大学) University of Western Australia(西澳大学) POSTECH Yale University(耶鲁大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DermCase基准,通过多模态数据评估罕见皮肤疾病诊断推理能力,揭示现有模型在诊断准确性和临床推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17024 2026-03-20 cs.CV cs.AI cs.CL 62%

HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning

HopChain: 多跳数据合成用于通用视觉语言推理

Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃迁实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HopChain框架,通过多跳视觉语言推理数据合成提升VLMs的通用推理能力,实验表明其在多个基准测试中显著提升性能。

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏