arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26289 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4507 篇

2605.20867 2026-05-21 cs.MA cs.CV 57%

ProCrit: Self-Elicited Multi-Perspective Reasoning with Critic-Guided Revision for Multimodal Sarcasm Detection

ProCrit: 通过批评引导的修订实现自激发多视角推理用于多模态讽刺检测

Yingjia Xu, Jiulong Wu, Bowen Zhang, Baokui Guo, Siyuan Chai, Min Cao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Baidu Inc.(百度公司) Zhipu AI(智谱AI)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ProCrit,一种通过批评引导的修订实现自激发多视角推理的框架,用于多模态讽刺检测,解决了现有方法依赖固定视角的问题,通过动态生成多视角分析并进行协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20743 2026-05-21 cs.CV cs.CL 57%

Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction

Draw2Think: 通过约束引擎交互增强几何推理

Juncheng Hu, Jiawei Du, Xin Zhang, Joey Tianyi Zhou

机构 * National University of Singapore(新加坡国立大学) Centre for Frontier AI Research, Agency for Science, Technology and Research(科技研究局前沿人工智能研究中心) Institute of High Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 Draw2Think通过与GeoGebra约束引擎交互,将几何推理从潜在空间推断转换为与约束引擎的代理交互,从而提高几何推理的准确性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20033 2026-05-20 cs.CV cs.GT 57%

A Nash Equilibrium Framework For Training-Free Multimodal Step Verification

为无训练多模态步骤验证构建纳什均衡框架

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软印度研究院) Indian Institute of Technology Hyderabad(印度海得拉巴理工学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种无训练的多模态步骤验证方法,将步骤验证视为专门法官之间的协调问题,并通过纳什均衡游戏形式化法官之间的交互,通过闭式解计算均衡分数,实现对分歧的敏感过滤和稳定性意识的排名,实验表明跨模态一致性(而非平均置信度)提供了鲁棒的验证信号。

Comments ICLR 2026 Workshop VerifAI-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19950 2026-05-20 cs.CV 57%

AffectVerse: Emotional World Models for Multimodal Affective Computing

AffectVerse: 多模态情感计算中的情感世界模型

Bo Zhao, Fanghua Ye, Yixin Ji, Sicheng Zhao, Xiaojiang Peng, Zitong YU

机构 * Great Bay University(大湾大学) Tencent(腾讯) Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本研究提出AffectVerse,一种基于Qwen2.5-Omni的多模态情感计算模型,通过引入情感世界模块实现短期潜在情感预测,利用未来预测作为自监督信号,提高了情感计算的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18464 2026-05-20 cs.CV 57%

PERL: Parameter Efficient Reasoning in CLIP Latent Space

PERL:在CLIP潜在空间中实现参数高效的推理

Simone Carnemolla, Salvatore Calcagno, Daniela Giordano, Concetto Spampinato, Matteo Pennisi

机构 * University of Catania(卡塔尼亚大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出PERL,一种在CLIP潜在空间中通过迭代潜在推理实现参数高效适应的框架,该方法在多个基准测试中表现出最佳的参数-性能权衡,仅需约6K可训练参数即可实现强的新型类别准确率和竞争性的迁移性能。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18570 2026-05-19 cs.AI 57%

Query-Conditioned Knowledge Alignment for Reliable Cross-System Medical Reasoning

基于查询的知识对齐用于可靠的跨系统医学推理

Yan Jiao, Jingran Xu, Pin-Han Ho, Limei Peng

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳先进研究院,电子科技大学) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系) School of Computer Science and Engineering, Kyungpook National University(庆北国立大学计算机科学与工程学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于查询的知识对齐方法QCEA,通过将实体对齐问题转化为查询条件下的对应关系问题,以提升跨系统医学推理的可靠性,主要贡献是引入了方向感知变换模块以捕捉异构知识系统中的非对称和多对多对应关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12413 2026-05-19 cs.CV 57%

Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images

超越定位:从全景图像中对MLLMs的视角条件空间推理进行综合诊断

Yuangong Chen, Wai Keung Wong, Jiaxing Li, Ioannis Patras, Xu Zheng

机构 * The Hong Kong Polytechnic University(香港理工大学) Guangzhou University(广州大学) Queen Mary University of London(伦敦玛丽女王大学) HKUST(Guangzhou)(香港科技大学(广州))

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文研究了多模态大语言模型(MLLMs)在视角变化下的空间推理能力,提出了PCSR-Bench基准测试,评估了14种代表性MLLMs在不同任务上的表现,揭示了空间推理能力的显著差距,并探讨了通过强化学习进行优化的可能性。

Comments 10pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06316 2026-05-19 cs.AI 57%

ALIGN: A Vision-Language Framework for High-Accuracy Accident Location Inference through Geo-Spatial Neural Reasoning

ALIGN:一种通过地理空间神经推理进行高精度事故位置推断的视觉-语言框架

MD Thamed Bin Zaman Chowdhury, Moazzem Hossain

机构 * Department of Civil Engineering, Bangladesh University of Engineering and Technology(孟加拉工程与技术大学土木工程系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出ALIGN框架,通过视觉-语言模型整合文本和图像数据,以高精度推断事故位置,显著优于传统文本解析方法,实现了亚公里级的定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18158 2026-05-19 cs.CV eess.IV 57%

Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion

语义解耦与组合用于具有高效LLM推理和生成扩散的通用图像编码

Jinming Liu, Yuntao Wei, Junyan Lin, Shengyang Zhao, Heming Sun, Zhibo Chen, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Ningbo Institute of Digital Twin(宁波数字孪生研究院) Eastern Institute of Technology(东部技术研究院) University of Science and Technology of China(中国科学技术大学) Yokohama National University(Yokohama国立大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 本文提出UniCodec,一种基于语义解耦和组合生成的通用图像编码框架,通过高效LLM推理和生成扩散模型实现人类和机器需求的统一压缩,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17329 2026-05-19 cs.CR cs.AI 57%

LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails

LPG: 在潜在策略护栏中平衡效率与政策推理

Nanxi Li, Zhengyue Zhao, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出LPG框架,通过学习动态政策的语义潜在推理,在保持高安全准确率的同时实现低延迟的政策执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17262 2026-05-19 cs.CV 57%

EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning

EgoIntrospect: 一个用于用户中心内部状态推理的注视数据集和基准

Zeyu Wang, Chang Liu, Eduardus Tjitrahardja, Yuntao Wang, Borislav Pavlov, Fangfei Gou, Jose Manuel Davila, Dai Shi, Ran Xu, Yue Pan, Jiayi Tan, Shuting Chang, Qi Wang, Jinzhao Li, Jiacheng Hua, Yifei Huang, Jingwei Sun, Yu Zhang, Liuxin Zhang, Guocai Yao, Jia Jia, Yin Li, Qianying Wang, Yuanchun Shi, Miao Liu

机构 * Tsinghua University(清华大学) Tongji University(同济大学) Renmin University of China(中国人民大学) The University of Tokyo(东京大学) Lenovo Group(联想集团) Peking University(北京大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出EgoIntrospect数据集,用于研究用户中心内部状态推理,通过自注释揭示用户与AI助手的交互意图,评估多模态大语言模型在从注视观察中推理用户内部状态的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17187 2026-05-19 cs.CL cs.AI cs.CY 57%

PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media

PluRule:一种用于社交媒体上多元社区调节的基准测试

Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer

机构 * Observatory on Social Media, Indiana University, USA(社交媒体观察站,印第安纳大学,美国) Center Synergy of Systems, TUD Dresden University of Technology, Germany(系统协同中心,德累斯顿技术大学,德国)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 研究探讨了AI模型在调节社交媒体上多元社区中的挑战,提出PluRule基准测试以检测13371条规则违规情况,发现即使使用最先进的视觉语言模型,也难以有效识别违规行为。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17077 2026-05-19 cs.RO cs.AI 57%

How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning

如何指导你的机器人:密集语言标注助力机器人策略学习

Bosung Kim, Ruiyi Wang, David Acuna, Jaehun Jung, Alexander Trevithick, Brandon Cui, Yejin Choi, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

AI总结 本研究通过密集语言标注提升机器人策略学习效率,提出DeMiAn方法,利用视觉语言模型生成多方面标注,提升策略和世界模型性能,无需新增演示数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14504 2026-05-19 cs.AI 57%

When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution

当机器人做家务:一个基准和代理用于长期家庭任务执行

Zilin Zhu, Longteng Guo, Yanghong Mei, Bowen Pang, Zongxun Zhang, Xingjian He, Ruyi Ji, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

AI总结 本文提出LongAct基准和HoloMind代理,用于评估长期家庭任务执行中的高层自主能力,实验显示HoloMind在减少模型规模依赖的同时提升了长期性能,但目标完成率仍较低,凸显了长期规划的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07245 2026-05-19 cs.CV 57%

Zero-Shot Textual Explanations via Translating Decision-Critical Features

通过翻译决策关键特征实现零样本文本解释

Toshinori Yamauchi, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(国家信息研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出TEXTER方法,通过隔离决策关键特征生成更准确的文本解释,提升模型可解释性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08501 2026-05-19 cs.AI 57%

GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games

GVGAI-LLM:通过无限游戏评估大语言模型代理

Yuchen Li, Cong Lin, Muhammad Umair Nasir, Philip Bontrager, Jialin Liu, Julian Togelius

机构 * New York University(纽约大学) University of the Witwatersrand(沃尔特·斯通大学) Meta Lingnan University(岭南大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 GVGAI-LLM通过 arcade 式游戏测试大语言模型的推理与问题解决能力,定义了可解释的评估指标,揭示了模型在空间推理和基本规划中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01608 2026-05-19 cs.CV 57%

From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models

从像素到地点:一个系统性基准,用于评估大语言模型中的图像地理定位能力

Lingyao Li, Runlong Yu, Qikai Hu, Bowei Li, Min Deng, Yang Zhou, Xiaowei Jia

机构 * University of South Florida Tampa USA University of Alabama Tuscaloosa USA University of Michigan Ann Arbor USA Texas Tech University Lubbock USA Texas A \& M University College Station USA University of Pittsburgh Pittsburgh USA University of South Florida University of Alabama University of Michigan Texas Tech University Texas A \& M University University of Pittsburgh

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出IMAGEO-Bench基准,系统评估大语言模型在图像地理定位中的准确性、距离误差、地理偏见和推理过程,揭示闭源模型在高资源区域表现优于欠代表区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14692 2026-05-18 cs.CV 57%

Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding

链式窥视:面向视频理解的搜索引导渐进性对象基础推理

Zhixuan Wu, Quanxing Zha, Teng Wang, Genbao Xu, Wenyuan Gu, Wei Rao, Nan Ma, Bo Cheng, Soujanya Poria

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China.(网络与交换技术国家重点实验室,北京邮电大学,北京,中国) Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University, China.(大数据研究院,复旦大学计算机科学与人工智能学院,中国) ARC Lab, Tencent PCG, Shenzhen, China.(腾讯PCG深圳实验室,深圳,中国) School of Artificial Intelligence, Beijing University of Technology, Beijing, China.(北京理工大学人工智能学院,北京,中国)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 本文提出Chain-of-Glimpse框架,通过搜索引导的渐进推理解决视频中对象变化问题,提升多步骤决策的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16129 2026-05-18 cs.CV 57%

Neurosymbolic Object-Centric Learning with Distant Supervision

基于远监督的神经符号对象中心学习

Stefano Colamonaco, David Debot, Giuseppe Marra

机构 * Department of Computer Science, KU Leuven(计算机科学系,鲁汶大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出DeepObjectLog模型,通过概率神经符号方法实现对象中心学习,无需逐对象标签或掩码,提升对组合、对象计数和规则转移的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15458 2026-05-18 cs.CV 57%

Video Models Can Reason with Verifiable Rewards

视频模型可以借助可验证的奖励进行推理

Tinghui Zhu, Sheng Zhang, James Y. Huang, Selena Song, Xiaofei Wen, Yuankai Li, Hoifung Poon, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) Microsoft Research(微软研究院) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出VideoRLVR方法,通过规则反馈优化视频扩散模型,提升可验证推理能力,在Maze、FlowFree和Sokoban任务中优于监督微调基线,证明可验证RL能推动视频模型超越感知模仿。

Comments Website: https://darthzhu.github.io/VideoRLVR-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14665 2026-05-18 cs.AI cs.CL cs.IR 57%

Falkor-IRAC: Graph-Constrained Generation for Verified Legal Reasoning in Indian Judicial AI

Falkor-IRAC:用于印度司法AI的图约束生成:在验证法律推理中的应用

Joy Bose

机构 * Independent Researcher(独立研究者)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出Falkor-IRAC框架,通过图约束生成解决印度法律AI中的验证法律推理问题,利用IRAC知识图谱进行结构化推理,并通过验证代理检查生成路径的正确性。

Comments 20 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14495 2026-05-15 cs.MM cs.AI 57%

Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification

可争议的多智能体辩论与基于竞技场的论证计算用于多媒体验证

Truong Thanh Hung Nguyen, Vo Thanh Khang Nguyen, Hoang-Loc Cao, Phuc Ho, Van Pham, Hung Cao

机构 * University of New Brunswick(新 Brunswick大学) University of Science, VNU-HCM(越南国家大学科学学院(VNU-HCM))

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出一种可争议的多智能体框架,结合多模态大语言模型、外部验证工具和基于竞技场的定量双极论证,以解决多媒体验证的透明性和可争议性问题。

Comments ACM ICMR 2026 Grand Challenge on Multimedia Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14465 2026-05-15 cs.AI 57%

From Table to Cell: Attention for Better Reasoning with TABALIGN

从表格到单元格:用于基于TABALIGN的更好推理的注意力

Tung Sum Thomas Kwok, Zeyong Zhang, Xinyu Wang, Chunhe Wang, Xiaofeng Lin, Hanwei Wu, Lei Ding, Guang Cheng, Zhijiang Guo

机构 * University of California, Los Angeles(加州大学洛杉矶分校) New Jersey Institute of Technology(新泽西理工学院) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) University of Manitoba(曼尼托巴大学) SimpleWay The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出TABALIGN框架,通过引入DLM Planner和TABATTN验证器,提升表格推理的准确性和效率,实验显示在多个基准测试中准确率提升15.76个百分点,推理速度加快44.64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14448 2026-05-15 cs.CV cs.CL cs.IR 57%

Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture

需要时思考:基于双LoRA架构的自适应推理驱动多模态嵌入

Longxiang Zhang, Weilong Dai, Guanghao Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TWN框架,通过双LoRA架构和自适应推理机制,提升多模态嵌入效率与质量,在78个任务中达到SOTA水平,参数更少,推理成本更低。

Comments 30 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14393 2026-05-15 cs.CV 57%

Analogical Trajectory Transfer

类比轨迹迁移

Junho Kim, Eun Sun Lee, Gwangtak Bae, Seunggu Kang, Young Min Kim

机构 * Dept. of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Interdisciplinary Program in Artificial Intelligence and INMC, Seoul National University(人工智能交叉计划和INMC,首尔国立大学)

专题命中 视觉推理 :VLM(abstract_cn);分类 cs.CV

AI总结 本文提出通过分解空间子问题实现类比轨迹迁移,利用3D基础模型特征进行跨场景映射,快速生成空间一致的轨迹迁移方案,适用于AR/VR和机器人领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06226 2026-05-15 cs.AI 57%

GeoLaux: A Benchmark for Evaluating MLLMs' Geometry Performance on Long-Step Problems Requiring Auxiliary Lines

GeoLaux:一个评估多模态大语言模型在需要辅助线的长步骤问题上几何性能的基准

Yumeng Fu, Jiayin Zhu, Lingling Zhang, Wenjun Wu, Bo Zhao, Shaoxuan Ma, Yushun Zhang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 GeoLaux通过2186道计算与证明题,评估23个领先MLLMs在长步骤推理和辅助线构造上的表现,揭示模型在长步骤问题上性能显著下降,强调提升辅助线理解的重要性,并发现有限答案提示能提高过程正确性。

Comments 26 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15616 2026-05-14 cs.CV 57%

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

LENS:基于大语言模型的多级多模态推理评估

Ruilin Yao, Bo Zhang, Jirui Huang, Xinwei Long, Yifang Zhang, Tianyu Zou, Yufei Wu, Shichao Su, Yifan Xu, Wenxi Zeng, Zhaoyu Yang, Guoyou Li, Shilan Zhang, Zichan Li, Yaxiong Chen, Shengwu Xiong, Peng Xu, Jiajun Zhang, Bowen Zhou, David Clifton, Luc Van Gool

机构 * Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室) University of Oxford(牛津大学) INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 LENS提出一个包含3.4K图像和60K+问题的多级评估基准,涵盖8个任务和12种日常场景,用于评估大语言模型在多模态推理中的表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13062 2026-05-14 cs.CV 57%

Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling

Edit-Compass 与 EditReward-Compass:图像编辑与奖励建模的统一基准

Xuehai Bai, Yang Shi, Yi-Fan Zhang, Xuanyu Zhu, Yuran Wang, Yifan Dai, Xinyu Liu, Yiyan Ji, Xiaoling Gu, Yuanxing Zhang

机构 * HDU(杭州大学) PKU(北京大学) Kling Team(Kling团队) CASIA(中国科学院自动化研究所)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出Edit-Compass和EditReward-Compass,通过精细多维评估框架和真实奖励建模场景,解决现有图像编辑和奖励模型评估中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11931 2026-05-13 cs.CV 57%

Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training

学会思考:通过视觉感知的自我改进训练提升多模态推理

Qihuang Zhong, Liang Ding, Wenjie Xuan, Juhua Liu, Bo Du, Dacheng Tao

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence(计算机学院、多媒体软件国家工程研究中心、人工智能研究院) Hubei Key Laboratory of Multimedia(湖北多媒体重点实验室) Network Communication Engineering, Wuhan University, China(网络通信工程、武汉大学,中国) The University of Sydney, Australia(悉尼大学,澳大利亚) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出VISTA框架,通过视觉感知的自我改进训练提升多模态推理能力,解决数据不平衡和语言先验偏差问题,实验显示在多种训练场景下提升性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09266 2026-05-13 cs.AI 57%

SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

SeePhys Pro:多模态RLVR中模态迁移和盲训练效应的诊断

Kun Xiang, Terry Jingchen Zhang, Zirong Liu, Bokai Zhou, Yueling Tang, Junjie Yu, Jiacong Lu, Shangrui Huang, Heng Li, Likui Zhang, Kunkun Liu, Changzheng Zhang, Yangle Fang, Boqiang Guo, Hui-Ling Zhen, Dandan Tu, Yinya Huang, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世人工智能中心) Huawei Technologies Ltd(华为技术有限公司)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 SeePhys Pro研究多模态RLVR中模态迁移对物理推理的影响,发现当前模型在信息从语言迁移到图像时表现下降,盲训练可提升性能,但依赖残余文本和分布特征而非有效视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏