arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2607.25151 2026-07-29 cs.IR 新提交 50%

HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research

HiEviDR-Bench:深度研究中分层证据聚合的基准测试

Yubo Sun, Chunyi Peng, Yukun Yan, Zhenghao Liu, Sen Mei, Bangrui Xu, Xuanhe Zhou, Chi Chen, Maosong Sun

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 针对深度研究中证据聚合评估不足问题,HiEviDR-Bench构建基准测试,涵盖多领域多模态设置,用证据图表示实例,开发评估框架及机制。含2000个问题,实验显示多模型虽报告质量好,但在引用准确性等方面欠佳,瓶颈在证据识别和中间主张构建。

Comments Code and data are available at https://ai9stars.github.io/HiEviDR-Bench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15050 2026-07-29 cs.CL 版本更新 50%

Beyond Factual Accuracy: Evaluating Global Reasoning Integrity in RAG Systems with LogicScore

超越事实准确性:使用逻辑得分评估RAG系统中的全球推理完整性

Zhichao Yan, Yunxiao Zhao, Jiapu Wang, Jiaoyan Chen, Xiaoli Li, Ru Li, Jeff Z. Pan

机构 * Shanxi University(山西大学) Nanjing University of Science and Technology(南京理工大学) University of Manchester(曼彻斯特大学) Singapore University of Technology and Design(新加坡科技设计大学) University of Edinburgh(爱丁堡大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出LogicScore,通过全局推理审查弥补RAG系统在长文本生成中逻辑完整性不足的问题,揭示模型在事实准确性高但全局推理质量差的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19568 2026-07-23 eess.SY cs.SY 新提交 50%

From P&ID Drawings to Process Graphs: A Multimodal Language Model Approach

从管道和仪表图到过程图:一种多模态语言模型方法

Baikai Zhu, Samuel Duong, Javal Vyas, Mehmet Mercangöz

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 研究针对P&IDs数字化难题,提出基于多模态大语言模型的两阶段工作流程,将其数字化重定义为设备标签提取与拓扑推理,经案例研究评估,该方法比端到端数字化更优,凸显知识引导工作流程在P&ID数字化中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17828 2026-07-21 cs.CL 新提交 50%

When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs

当一个名字并非名字时:低资源语言模型中文化纠缠的孟加拉语同形异义词的基准数据集和提炼推理

Md. Asaduzzaman Shuvo

机构 * United International University(联合国际大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 研究针对低资源语言模型中孟加拉语同形异义词文化纠缠问题,构建基准数据集。发现模型有主导意义偏差,特定模型失败。提出对比性思维链提示及提炼文化解释,能减少偏差,让小模型正确推理,提升系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16896 2026-07-21 cs.NI 新提交 50%

PERA: A Perceive-Reason-Act Interface Bridging Sensing, Cognitive Reasoning, and Trustworthy Agentic Response for 6G

PERA:一种感知-推理-行动接口,用于6G的传感、认知推理和可信智能体响应

Mohammad Farzanullah, Melike Erol-Kantarci, Lajos Hanzo

专题命中 视觉推理 :grounding(abstract)

AI总结 研究针对下一代网络实现中传统机器学习和大语言模型的局限,提出基于感知-推理-行动(PERA)范式的生成网络智能,用多任务架构取代边缘模型,降低复杂性与能耗,通过案例研究验证其在链路状态分类和波束预测上的有效性。

Comments 9 pages, 5 figures, 1 table, magazine paper, submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29007 2026-07-21 cs.CL 版本更新 50%

Taxonomy-Targeted Error Generation for Quantitative Reasoning

错误作为透镜:通过合成误解生成探究LLM推理

Xinming Yang, Jun Li

机构 * CUNY Graduate Center(纽约大学研究生中心) CUNY Queens College(纽约市立大学皇后学院)

专题命中 视觉推理 :grounding(abstract)

AI总结 提出一个框架,通过生成针对Bloom分类学五类错误的合成误解,以诊断LLM推理能力,并发现目标错误生成比自由形式错误生成更难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08448 2026-07-16 cs.RO 版本更新 50%

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

利用VLA:通过记忆引导智能体将冻结的视觉语言动作模型转化为可靠的操作原语

Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

机构 * Tsinghua University(清华大学) Striding AI(驰行人工智能公司) Purdue University(普渡大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Infinigence AI(英飞智研人工智能公司) Zhongguancun Academy(中关村学院) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 研究语言条件下操作问题,提出Harness VLA框架,将冻结VLA与分析原语库结合,通过学习操作范围扩展预训练VLA,在多种扰动操作任务中相比基线有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11736 2026-07-14 cs.CL 新提交 50%

MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning

MET:基于理论和文化感知的多语言道德推理

Ayoung Lee, Ryan Kwon, Yunxiang Zhang, Yuxuan Liu, Peter Railton, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 研究针对语言模型用于跨语言文化道德决策时存在的多语言性忽视问题,提出MET两步提示法及MET-D自我蒸馏训练,引入MCLASH基准,实验表明MET-D提升模型性能,揭示不同文化有益依据差异,为多语言道德推理开辟道路。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11044 2026-07-14 cs.MM 新提交 50%

RetroHolmes: When Semantic Plausibility Fails Retrospective Physical Process Reasoning

RetroHolmes:当语义合理性失效时的回顾性物理过程推理

Ruoxuan Zhang, Qiyun Zheng, Siyu Wu, Ling Zou, Hongxia Xie, Zhiyu Zhou, Jian-Yu Jiang-Lin, Zihan Li, Zhengguang Wang, Bin Wen, Ling Lo, Jianlong Fu, Meibao Yao, Juncheng Hu, Wen-Huang Cheng

专题命中 视觉推理 :vision language model(abstract)

AI总结 研究针对视觉语言模型物理推理评估不足问题,引入回顾性物理过程推理范式,提出RetroHolmes基准,通过它分析模型,发现失败模式,还展示综合分析实例,验证其诊断价值,凸显物理基础中间表示对物理推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09179 2026-07-13 cs.CR cs.SE 新提交 50%

Malaika: Understanding Malware through Tri-Grounded Agentic Reasoning

Malaika:通过三重基础的智能推理理解恶意软件

Xingzhi Qian, Xinran Zheng, Yiling He, Lorenzo Cavallaro

专题命中 视觉推理 :grounding(abstract)

AI总结 研究针对恶意软件理解挑战,将其视为基础推理问题,提出需三种基础形式。介绍多智能体框架Malaika,通过受分析师启发的推理等实现三种基础机制,用于安卓恶意软件分析,实验表明该框架提高分析质量,为可靠恶意软件理解及软件分析提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08768 2026-07-10 cs.CL 新提交 50%

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

UniClawBench:面向实际任务中主动智能体的通用基准测试

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。

Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05440 2026-07-08 econ.EM cs.SY eess.SY 新提交 50%

Retrieval over Reasoning: A Cost-Controlled Benchmark of Language Models for Energy-Retrofit Recommendation

基于推理的检索:用于能源改造推荐的语言模型成本控制基准

Eliseo Curcio

专题命中 视觉推理 :grounding(abstract)

AI总结 研究为建筑推荐节能措施问题,通过树集成解决EUI预测,发现推荐任务框架影响模型选择,对八个大语言模型基准测试,表明其过度推荐,检索可缩小差距,还给出成本控制下模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06165 2026-07-08 cs.RO 新提交 50%

EAGOR: Embodied Reasoning in Omni-direction

EAGOR:全方位的具身推理

Shriram Damodaran, Soumyaratna Debnath, Yan Wu, Wei-Yun Yau, Addison Lin Wang

机构 * EmPACT Lab, NTU Singapore Institute for Infocomm Research, A*STAR Singapore(EmPACT实验室,南洋理工大学信息与通信研究所,A*STAR新加坡)

专题命中 视觉推理 :vision language model(abstract)

AI总结 研究针对现有视觉语言模型在处理360°观测时方向估计不一致的问题,提出无需训练的几何感知框架EAGOR,将方向推理表述为球面上的递归贝叶斯估计,引入球谐信念场,实验证明其性能优于现有方法。

Comments 12 Pages, 7 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06018 2026-07-08 cs.RO 新提交 50%

RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures

RoboTALES:通过任务对齐的模拟未来学习推理引导的机器人策略

Hanan Gani, Tejal Kulkarni, Madhoolika Chodavarapu, Nicklas Hansen, Manmohan Chandraker

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 视觉推理 :VLM(abstract)

AI总结 针对预训练视频生成模型用于机器人策略规划的局限,提出RoboTALES框架,通过基于分层语言模型的规划器和基于视觉语言模型的评论家两大创新,学习任务对齐的模拟未来以训练机器人策略,在多样操纵任务中表现优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00846 2026-07-08 cs.CL 版本更新 50%

Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

Omni-RRM:通过基于自动评分标准的偏好合成推进全模态奖励建模

Zicheng Kong, Dehua Ma, Zhenbo Xu, Alven Yang, Yiwei Ru, Haoran Wang, Zixuan Zhou, Fuqing Bie, Liuyu Xiang, Huijia Wu, Jian Zhao, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) ShiFang Technology Inc.(ShiFang科技公司)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 研究针对多模态大语言模型对齐难题,提出全模态基于评分标准的奖励模型Omni-RRM。通过自动评分标准偏好合成构建数据集,用特定训练方案提升奖励辨别力,在多模态基准测试中达最优精度,还能指导选择与迁移,提升模型对齐能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01929 2026-07-03 cs.SE 新提交 50%

Beyond Textual Repository Exploration: Dual-Modal Structural Reasoning for Agentic Issue Resolution

超越文本仓库探索:面向智能体问题解决的双模态结构推理

Jiayi Zhang, Kai Huang, Yang Liu, Chunyang Chen

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 提出DUALVIEW框架,通过模块耦合图、函数调用图、类层次图和程序依赖图四种图视图,结合视觉与文本响应,使智能体在仓库探索中直接推理代码依赖结构,提升长时域问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01692 2026-07-03 cs.HC 新提交 50%

From Answer Generators to Reasoning Facilitators: Designing AI Tutors for Mathematical Reasoning in High-Stakes Environments

从答案生成器到推理促进者:为高风险环境中的数学推理设计AI导师

Yuming Feng, Yuan Tian, Erica Zhao

专题命中 视觉推理 :grounding(abstract)

AI总结 本研究设计并部署了AITutor系统,通过分层工作示例、步骤链接视觉基础和元认知支架等功能,帮助初中生在高压考试中从被动获取答案转向主动修复推理过程,提出了以推理为中心的产品循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01518 2026-07-03 cs.CR cs.RO 新提交 50%

Overthink-Triggered Slowdown Attacks on LVLM-Based Robotic Systems

基于LVLM的机器人系统中的过度思考触发慢速攻击

Qiang Han, Jie Wu, Bo Chen

专题命中 视觉推理 :vision-language model(abstract)

AI总结 研究利用LVLM的过度思考行为,通过嵌入场景文本触发推理延迟,提出三阶段框架发现可迁移触发词,实验显示最高6.96倍延迟放大。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29672 2026-07-01 cs.CL 版本更新 50%

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分

William Orwig, Roger E. Beaty

机构 * Harvard University(哈佛大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28338 2026-06-30 cs.IR 50%

Memory Shot for Long-Term Dialogue

长期对话的记忆快照

Chunyi Peng, Haidong Xin, Xuanshuo Sheng, Xin Dai, Zhenghao Liu, Shuo Wang, Yukun Yan, Zulong Chen, Yu Gu, Ge Yu

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 提出MemShot方法,通过将对话片段渲染为结构化视觉记忆单元,利用模型内部视觉推理能力关联关键情节,实现高效长期对话建模,在LoCoMo和LongMemEval上取得稳定性能并实现70倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03180 2026-06-29 cs.CL 50%

BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Bengali Language and Culture

BengaliMoralBench:一种用于审计大型语言模型道德推理的基准,针对孟加拉语和文化

Shahriyar Zaman Ridoy, Azmine Toushik Wasi, Koushik Ahamed Tonmoy, Taki Hasan Rafi, Dong-Kyu Chae

机构 * North South University(北南大学) Computational Intelligence and Operations Laboratory(计算智能与运营实验室) Hanyang University(翰林大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出BengaliMoralBench,一个针对孟加拉语和文化背景的道德推理评估基准,涵盖五个道德领域,通过三种伦理框架进行标注,评估不同模型的性能差异及文化适应性问题。

Comments Accepted at ACM FAccT 2026

Journal ref ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27306 2026-06-26 cs.CL 新提交 50%

Multilingual Reasoning Cascades Need More Context

多语言推理级联需要更多上下文

Arnav Mazumder, Dengjia Zhang, Shuyue Stella Li, Yulia Tsvetkov, Niyati Bafna

专题命中 视觉推理 :grounding(abstract)

AI总结 提出上下文感知翻译级联方法,在最终翻译模块的上下文中保留原始问题、英文翻译问题和推理链,以改善多语言推理中的信息丢失,实验表明该方法在多种语言和模型上显著提升开放生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26800 2026-06-26 cs.RO 新提交 50%

SSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic Manipulation

SSI-Policy: 学习用于视觉语言机器人操作的结构化场景接口

Kaijun Wang, Zikai Ouyang, Xuping Wu, Jinyi Hong, Wei Pan, Haibo Lu, Jia Pan, Wei Zhang, Linfang Zheng

机构 * Southern University of Science and Technology(南方科技大学) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学) LimX Dynamics

专题命中 视觉推理 :grounding(abstract)

AI总结 提出SSI-Policy框架,通过统一的结构化场景接口(SSI)联合编码单目深度、语言锚定的物体布局和指令条件化的2D运动轨迹,实现从少量演示中学习机器人操作,在LIBERO基准上仅用10个演示即提升15%性能。

Comments Accepted by 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22836 2026-06-23 cs.RO 新提交 50%

Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA

Cloak: 通过遮蔽末端执行器实现零样本跨本体操作

Michael Piseno, Guy Tevet, C. Karen Liu

机构 * Stanford University(斯坦福大学)

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 提出Cloak训练方法,通过遮蔽腕部相机中的末端执行器,使VLA模型实现零样本跨本体迁移,无需新本体数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21618 2026-06-23 cs.CL 新提交 50%

CulMind: Benchmarking Multimodal Understanding and Reasoning in Chinese Cultural Heritage

CulMind:中国文化遗产中的多模态理解与推理基准

Zhangwei Cao, Shuhan Fan, Yuting Wei, Jiajun Zhang, Yihang Peng, Qi Meng, Yangfu Zhu, Liangbin Yang

机构 * University of International Relations(国际关系学院) Kedge Business School(凯致商学院) Peking University(北京大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Capital Normal University(首都师范大学)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 针对现有基准忽视推理过程的问题,提出CulMind和CulMind-R基准,涵盖50个任务和24个推理子任务,并设计ReaScore指标评估推理质量,揭示答案与推理之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19552 2026-06-19 cs.CL 新提交 50%

LaViSA: A Language and Vision Structural Ambiguity Benchmark

LaViSA:语言与视觉结构歧义基准

Lee Sangmyeong, Shun Inadumi, Koichiro Yoshino

机构 * Nara Institute of Science and Technology(奈良先端科学技术大学院大学) Guardian Robot Project RIKEN(RIKEN守护机器人项目) The University of Osaka(大阪大学)

专题命中 视觉推理 :VLM(abstract_cn)

AI总结 提出LaViSA基准,通过七类歧义句及对应图像评估视觉语言模型利用视觉场景解决结构歧义的能力,实验显示现有模型虽能部分利用视觉信息,但在特定歧义类型和细微语义区分上仍有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16849 2026-06-18 cs.NE cs.GR cs.HC 新提交 50%

Evolution & Foundation: AI Shares Creative Control

进化与基础模型:AI共享创意控制

Dylan Banarse, Stephen Todd, William Latham, Frederic Fol Leymarie

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 提出一种结合遗传算法与多模态AI基础模型的框架,实现自动化设计3D有机形态,将艺术家角色从直接选择转变为系统设计,加速创意探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07036 2026-06-18 physics.ed-ph 版本更新 50%

Using Large Language Models to Analyze Engagement in Computational Thinking via Computational Physics Essays

使用大型语言模型通过计算物理论文分析计算思维中的参与度

Sean Savage, Amir Bralin, Paul Hur, N. Sanjay Rebello

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本研究利用多模态大型语言模型自动评估100篇学生计算物理论文中的计算思维参与度,在明确子任务上达到84%的准确率,但主观整体质量评估准确率仅71%。

Comments 13 pages, 3 figures, 3 tables. Submitted to Physical Review Physics Education Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14961 2026-06-16 cs.CL 新提交 50%

CoRA: Confidence-Rationale Alignment for Reliable Chain-of-Thought Reasoning

CoRA: 面向可靠思维链推理的置信度-理由对齐

Juming Xiong, Weixin Liu, Kevin Guo, Congning Ni, Junchao Zhu, Chongyu Qu, Chao Yan, Katherine Brown, Avinash Baidya, Xiang Gao, Bradley Malin, Zhijun Yin

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) Intuit AI Research(Intuit AI研究)

专题命中 视觉推理 :grounding(abstract)

AI总结 提出GRPO强化学习框架,联合奖励答案正确性、置信度与理由支持度,减少置信度与理由对齐误差,提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03727 2026-06-16 cs.IR 版本更新 50%

When Does Latent Reasoning Help? MeRa: Metric-Space Bias for Spatial Prediction

潜在推理何时有帮助?MeRa:空间预测的度量空间偏差

Zhenyu Yu, Shuigeng Zhou

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出MeRa模块,通过在序列编码器和预测头之间引入度量空间偏差,证明潜在推理在空间预测中有效,否则会降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏