arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2511.20272 2026-07-07 cs.CV 版本更新 50%

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

VKnowU:评估多模态语言模型中的视觉知识理解

Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。

Comments Accepted by ECCV 2026. https://github.com/OpenGVLab/VKnowU

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01707 2026-07-03 cs.CV 新提交 50%

LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression

LASER: 通过视觉注意力保持与沉没抑制为LVLMs提供矫正透镜

Bowen Yuan, Zijian Wang, Yadan Luo, Shijie Wang, Zi Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对大型视觉语言模型在长序列解码中视觉遗忘的问题,提出LASER后训练框架,通过视觉接地奖励和沉没抑制奖励调节注意力轨迹与分布,在8个基准上超越强基线。

Comments The 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01243 2026-07-03 cs.IR 新提交 50%

STRUCTSURVEY: Structured Agentic Retrieval for Automated Survey Paper Generation

STRUCTSURVEY: 结构化智能检索用于自动生成综述论文

Paolo Pedinotti, Enrico Santus

专题命中 推理评测 :reasoning(abstract)

AI总结 提出STRUCTSURVEY分层多智能体框架,通过动态构建实体、关系和主题分类的图表示,将结构推理从生成阶段转移到检索阶段,在ACL综述基准上相比嵌入检索基线平均提升ROUGE-1召回率2.9、ROUGE-2召回率1.0,且不降低精确度。

Comments 8 pages, 1 figure, appendices, SurgeLLM, RAG4Reports, ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22645 2026-07-03 cs.IR cs.CY 新提交 50%

All Relations Lead to Rome: Automated Knowledge Graph Creation and Question Generation

所有关系通向罗马:自动化知识图谱构建与问题生成

Matthijs Jansen op de Haar, Tobias Stähle, Lorenzo Gatti

专题命中 推理评测 :reasoning(abstract)

AI总结 提出ARLtR框架,联合构建知识图谱、嵌入和基于事实的问答对,实现符号图与稠密检索的统一表示,并以罗马帝国历史数据集验证。

Comments 10 pages, 5 figures, version one

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17360 2026-07-03 cs.CV 版本更新 50%

Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

Omni-DuplexEval: 评估实时双工全模交互

Chaoqun He, Mingyang Xiang, Yingjing Xu, Bokai Xu, Junbo Cui, Jie Zhou, Yuan Yao, Lijie Wen

机构 * Tsinghua University(清华大学) Tongji University(同济大学) ModelBest Inc.(ModelBest公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12144 2026-07-03 cs.MA 版本更新 50%

VERITAS: A Multi-Agent Co-Scientist for Verifiable Image-Derived Hypothesis Testing

VERITAS:通过智能系统进行图像派生假设检验的可验证认知推理

Lucas Stoffl, Benedikt Wiestler, Johannes C. Paetzold

专题命中 推理评测 :reasoning(abstract)

AI总结 VERITAS通过多智能体系统自主测试自然语言假设,生成可审计的证据链,通过四阶段工作流和认知证据标签框架提升医学影像研究的可验证性,达到81.4%的准确率。

Comments 43 pages, 5 figures. Code available at https://github.com/LucZot/veritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29616 2026-07-03 cs.CV 版本更新 50%

Video-Oasis: Rethinking Evaluation of Video Understanding

Video-Oasis:重新审视视频理解的评估

Geuntaek Lim, Sungjune Park, Jaeyun Lee, Inwoong Lee, Taeoh Kim, Dongyoon Wee, Minho Shim, Yukyung Choi

机构 * Sejong University(世宗大学) NAVER Cloud

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Video-Oasis,通过系统评估现有评估方法,揭示视频理解中的时空挑战,发现54%的基准样本无需视觉输入即可解决,先进模型表现仅略超随机猜测。

Comments Accepted at ECCV2026; Project page: https://limgeuntaekk.github.io/Video-Oasis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16662 2026-07-03 cs.MA 版本更新 50%

Evaluating Collective Behaviour of Hundreds of LLM Agents

评估数百个LLM代理的集体行为

Richard Willis, Jianing Zhao, Yali Du, Joel Z. Leibo

专题命中 推理评测 :reasoning(abstract)

AI总结 提出框架评估LLM代理在社会困境中的涌现行为,通过自然语言策略生成与代码翻译,分析行为指纹、自博弈福利及文化演化,发现大群体中文化演化收敛至低福利自私均衡。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05952 2026-07-03 cs.CY 版本更新 50%

Dean of LLM Tutors: A Framework for Automated Quality Review of AI-generated Feedback

LLM导师院长:AI生成反馈的自动质量审查框架

Keyang Qian, Yixin Cheng, Rui Guan, Wei Dai, Flora Jin, Kaixun Yang, Sadia Nawaz, Zachari Swiecki, Guanliang Chen, Lixiang Yan, Dragan Gašević

专题命中 推理评测 :reasoning(abstract)

AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01040 2026-07-02 cs.IR 新提交 50%

As It Was: Aligning LLM Search Evaluation with Historical User Preferences

如其所是:将LLM搜索评估与历史用户偏好对齐

Ali Vardasbi, Gustavo Penha, Enrico Palumbo, Claudia Hauff, Hugues Bouchard, Mounia Lalmas

专题命中 推理评测 :reasoning(abstract)

AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00711 2026-07-02 cs.SE 新提交 50%

ClarifyCodeBench: Evaluating LLMs on Clarifying Ambiguous Requirements for Code Generation

ClarifyCodeBench: 评估大语言模型在代码生成中澄清模糊需求的能力

Zheng Fang, Dongming Jin, Yihong dong, Yongmin Li, Kechi Zhang, Zhi Jin, Ge Li

专题命中 推理评测 :reasoning(abstract)

AI总结 提出ClarifyCodeBench基准,通过人工标注的模糊需求、澄清问题和指标,评估LLMs主动澄清需求的能力,发现代码生成能力与需求澄清能力脱钩,且多模糊场景下性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00696 2026-07-02 cs.CV 新提交 50%

Imprint: Online Memory Compression for Long-Horizon Egocentric QA

Imprint: 面向长程自我中心问答的在线记忆压缩

Kousik Das, Debaditya Roy

机构 * IIT, Kharagpur(印度理工学院卡哈拉格普尔分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出交互中心记忆框架Imprint,将长程自我中心记忆建模为在线压缩问题,利用人类记忆巩固信号选择性保留和压缩交互,在7天基准上提升QA准确率并大幅降低存储和检索开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00606 2026-07-02 cs.CV 新提交 50%

Retrieved Images as Visual Thought: Training-Free Multimodal In-Context Learning for the Open-vs-Closed Gap

检索图像作为视觉思维:面向开放与封闭差距的无训练多模态上下文学习

Bingchen Huang, Zhiling Wang, Yifu Chen, Yuanchao Du

专题命中 推理评测 :reasoning(abstract)

AI总结 提出无训练框架ReVisIT,通过检索图像-标签对作为视觉思维单元,结合结构化类定义、多模态检索和交替注入示例,在多个基准上显著提升性能,弥合开放与封闭任务差距。

Comments 12 pages, 6 figures. Includes appendix. Introduces the MAAC-Bench benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31037 2026-07-02 cs.RO 新提交 50%

Labimus: A Simulation and Benchmark for Humanoid Dexterous Manipulation in Chemical Laboratory

Labimus: 化学实验室中类人灵巧操作的仿真与基准

Yuhan Wu, Zhao Jin, Tao Li, Yuheng Zhang, Zhichao Wang, Shuo Wang, Jun Jiang, Xiaobo Li, Yanyong Zhang, Jian Tang, Zhengping Che, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出Labimus,首个针对有机化学实验室中类人灵巧操作的基准,通过真实到仿真建模重建30多个功能资产,定义原子操作和称重流程,揭示任务完成与实验精度之间的差距。

Comments Project page: https://labimus.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31689 2026-07-01 cs.SE 新提交 50%

ScratchWorld: Evaluating If World Models Compute Executable Consequences

ScratchWorld: 评估世界模型是否计算可执行后果

Yufeng Lin, Jialu Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 提出ScratchWorld基准,通过Scratch项目验证世界模型在稀疏变化环境中的状态预测、因果归因等能力,发现模型常忽略可执行规则,最高仅达13.8%的F1值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31219 2026-07-01 cs.CV 新提交 50%

CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization

CooperScene: 具有C-V2X通信特性的多模态协作自主基准

Bo Wu, Ruoshen Mo, Justin Yue, Yanyu Zhang, Janice Nguyen, Guoyuan Wu, Amit Roy-Chowdhury, Matthew J. Barth, Hang Qiu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 推理评测 :planning(abstract)

AI总结 提出CooperScene数据集,通过真实C-V2X通信特性、多模态传感器和3GPP标准,建立多车协作感知基准,包含59K帧、344K标注对象。

Comments Accepted to ECCV 2026. 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31187 2026-07-01 cs.CV 新提交 50%

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31169 2026-07-01 cs.CV 新提交 50%

Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

超越单字符:评估多模态大语言模型在句子级甲骨文理解中的表现

Ziqi Li, Zijian Chen, Tingzhu Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出S-OBI基准,通过字形替换与组合合成清晰标准的句子级甲骨文实例,设计语义匹配、语义槽提取和上下文推理任务,评估多模态大语言模型在句子级甲骨文理解中的表现,发现当前模型仍依赖字符级识别。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31100 2026-07-01 cs.CV 新提交 50%

TaxoMIL: Taxonomy-Constrained Learning for Hierarchical Whole Slide Image Analysis

TaxoMIL:用于层次化全切片图像分析的分层约束学习

Chaeyeon Lee, Khang Nguyen Quoc, Jinsol Song, Yosep Chong, Kwangil Yim, Jin Tae Kwak

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Hospital Pathology, The Catholic University of Korea College of Medicine(韩国天主教大学医学院医院病理学系)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出TaxoMIL框架,将WSI诊断重构为多粒度文本生成任务,通过双头Transformer解码器和分类学引导目标,实现层次感知的准确预测。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21173 2026-07-01 cs.RO cs.CV 版本更新 50%

Multimodal Benchmark for Safety Assessment in Industrial Inspection Scenarios

工业检测场景安全评估的多模态基准

Zeyi Liu, Shuang Liu, Jihai Min, Zhaoheng Zhang, Jun Cen, Pengyu Han, Songqiao Hu, Zihan Meng, Xiao He, Donghua Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) DAMO Academy, Alibaba Group(阿里巴巴达摩院) School of Automation, Southeast University(东南大学自动化学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。

Comments 14 pages, 6 figures, Accepted by Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30393 2026-06-30 cs.CV 50%

SADL: What to Ignore? A Benchmark for Subject-Aware Distractor Localization

SADL:该忽略什么?面向主体感知的干扰物定位基准

Cao-Tri Nguyen, Nguyen-Khoa Luong, Vinh-Tiep Nguyen, Minh-Triet Tran

机构 * University of Science(科学大学) Vietnam National University Ho Chi Minh City(越南胡志明市国家大学) University of Information Technology(信息技术大学) John Von Neumann Institute(约翰·冯·诺依曼研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出SADL基准,包含1,800个主体感知案例,用于评估视觉语言模型在干扰物定位中的排除校准能力,揭示模型过度排除的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29850 2026-06-30 cs.CV 50%

Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction

面向具身AI的高效视觉指代:智能体驱动数据合成、跨块注意力与迭代校正

Zijian Hong, Qi Lv, Yuxiang Xie, Jianming Xing, Xiang Deng, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 推理评测 :reasoning(abstract)

AI总结 提出PointArena 2026解决方案,通过智能体驱动数据合成、确定性可操控数据流水线、跨块注意力与迭代校正模块,实现77.2%总体准确率,排名第二。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29301 2026-06-30 cs.CV 50%

Pointer-CAD v2: Plan-Then-Construct CAD Generation with Dimension-Aware Parametric Precision

Pointer-CAD v2: 先规划后构建的尺寸感知参数化CAD生成

Dacheng Qi, Chenyu Wang, Jingwei Xu, Yi Ma, Shenghua Gao

机构 * The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) TranscEngram Monash University(墨尔本大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出Pointer-CAD v2,采用先规划后构建范式,通过指针机制直接预测连续参数值,消除量化误差,并在顶点、边和面层级引入层次化几何精度指标,显著提升CAD生成的几何精度。

Comments Accepted to ECCV 2026. Code is available at https://github.com/Snitro/Pointer-CAD-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28673 2026-06-30 cs.CV 50%

BackTranslation2.0 -- A Linguistically Motivated Metric to Assess Sign Language Production

BackTranslation2.0——一种基于语言学的评估手语生成质量的指标

Oliver Cory, Maksym Ivashechkin, Karahan Sahin, Oline Ranum, Jianhe Low, Edward Fish, Anton Pelykh, Ozge Mercanoglu Sincan, Richard Bowden

机构 * Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出BackTranslation2.0,一种基于语言学的文本到手语翻译评估指标,通过代理框架整合多个工具评估语法、音韵、流畅性和保真度,与人类判断高度相关。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28364 2026-06-30 cs.IR 50%

LLM based Knowledge Graph Approach to Automating Medical Device Regulatory Compliance

基于LLM的知识图谱方法实现医疗器械监管合规自动化

Subhankar Chattoraj, Karuna Pande Joshi

专题命中 推理评测 :reasoning(abstract)

AI总结 提出结合知识图谱与大语言模型的方法,从FDA文档提取监管知识并自动分类医疗器械,实现合规评估自动化,减少人工审查并加速上市。

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025, pp. 321-328

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02742 2026-06-30 cs.CV 50%

Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models

一致但错误:空间视觉-语言模型中的证据不敏感性

S Divakar Bhat, Toshihiko Yamasaki

机构 * The University of Tokyo, Japan(东京大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 通过引入ViewDiag多视图评估协议,发现现代视觉-语言模型在空间推理中表现出跨视角一致但错误的现象,表明其预测主要源于先验驱动而非证据敏感推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02482 2026-06-30 cs.CV 50%

X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding

X-Stream: 探索多模态大语言模型作为多流理解的多路复用器

Peiwen Sun, Xudong Lu, Huadai Liu, Yang Bo, Dongming Wu, Huankang Guan, Minghong Cai, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Rui Liu, Xiangyu Yue

机构 * MMLab, Chinese University of Hong Kong(中大香港人工智能实验室) Huawei Inc.(华为公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 为解决多流视频理解评估缺失的问题,提出首个基准X-Stream,包含4220个QA对和932个视频,覆盖多窗口、多视角和多设备场景,并基于信号多路复用理论评估MLLM作为多路复用器的性能,发现现有模型在并发流上仅达约50%分数。

Comments Project Page: https://peiwensun2000.github.io/xstream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23660 2026-06-30 physics.ed-ph 50%

Using Large Language Models in Physics Education

在物理教育中使用大型语言模型

Jonah L. Donaldson, Aliya Nawaz, Konstantinos Doran, Alysta Lim, Mario Campanelli

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究评估了2024年中至2025年底发布的前沿大型语言模型在解决大学物理问题(经典力学、电磁学、量子力学)和自动评分方面的能力,发现文本推理接近饱和,多模态集成解决了空间几何限制,但部分评分仍存在挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12175 2026-06-30 cs.CV 50%

Redefining Quality Criteria and Distance-Aware Score Modeling for Image Editing Assessment

重新定义质量标准与距离感知评分建模用于图像编辑评估

Xinjie Zhang, Qiang Li, Xiaowen Ma, Axi Niu, Li Yan, Qingsen Yan

机构 * Northwestern Polytechnical University(西北工业大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出DS-IEQA框架,通过反馈驱动指标优化和令牌解耦距离回归损失,改进图像编辑质量评估的指标定义与评分连续性建模。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 2812-2820

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21545 2026-06-30 cs.CV 50%

EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal

EraseLoRA: 基于多模态大语言模型的前景排除与背景子类型聚合用于无数据集对象去除

Sanghyun Jo, Donghwan Lee, Eunji Jung, Seong Je Oh, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 EraseLoRA通过多模态大语言模型实现前景排除与背景子类型聚合,提升无数据集对象去除的背景重建与前景抑制效果,显著提高重建真实性并减少冗余生成。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏