arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 595 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 595 篇

2601.14348 2026-08-11 cs.IR 版本更新 50%

Legal Retrieval for Public Defenders

为公共辩护人设计的法律检索

Dominik Stammbach, Kylie Zhang, Patty Liu, Nimra Nadeem, Inyoung Cheong, Lucia Zheng, Peter Henderson

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种针对公共辩护人工作的法律检索工具,通过引入领域知识提升检索效果,并发布了一个真实辩护人检索查询的分类学和手动标注的数据集,以改进现实中的法律检索基准。

Comments Forthcoming TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16854 2026-08-11 cs.CV 版本更新 50%

Certainty Is Redundant: Token Sparsification for Efficient Camouflaged Object Detection with Vision Foundation Models

CATP:基于置信度的令牌修剪用于伪装目标检测

Yuhan Gao, Shuhao Kang, Xin He, Bing Li, Ming-Ming Cheng, Yun Liu

机构 * VCIP, College of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Academy for Advanced Interdisciplinary Studies, Nankai University(先进交叉学科研究院,南开大学) School of Computer Science and Engineering, Tianjin University of Technology(计算机科学与工程学院,天津工业大学) School of Information and Communication Engineering, UESTC(信息与通信工程学院,电子科技大学) Nankai International Advanced Research Institute, Shenzhen Futian(南开国际先进研究院,深圳福田)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出CATP框架,通过分层修剪和双路径补偿机制提升伪装目标检测效率,减少计算量并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17504 2026-08-11 cs.CV q-bio.QM 版本更新 50%

BMDS-Net:Deployment-aware multi-modal brain tumor segmentation with adaptive fusion,decoder regularization,and Bayesian calibration

BMDS-Net:一种用于鲁棒脑肿瘤分割的贝叶斯多模态深度监督网络

Yan Zhou, Suncheng Xiang, Zhen Huang, Yue Ouyang, Yingqiu Li, Zehua Wang

机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(数学与统计学学院,长沙理工大学) School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) Shanghai Chest Hospital, Shanghai Jiao Tong University School of Medicine(上海胸科医院,上海交通大学医学院)

专题命中 推理评测 :planning(abstract)

AI总结 BMDS-Net通过贝叶斯方法提升多模态脑肿瘤分割的鲁棒性和可信度,实现更稳定的临床应用。

Comments 21 pages, 6 figures. Manuscript prepared for submission to ACM HEALTH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09772 2026-08-07 cs.CV 版本更新 50%

SemDINO: Foundation Prior-Guided Cross-Temporal Semantic Alignment Network for Remote Sensing Change Detection

SemDINO: 一种基于DINOv3的跨时间语义对齐变化检测网络

Xinyu Tong, Meihua Zhou, Jinxiao Sun, Zaiyan Zhang, Hongruixuan Chen, Lei Wang

机构 * Xinjiang Institute of Ecology and Geography, Chinese Academy of Sciences(中国科学院新疆生态与地理研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) College of Information and Communication Engineering, Harbin Engineering University(哈尔滨工程大学信息与通信工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出SemDINO网络,通过双分支编码器、多尺度时序交互、语义净化与变化增强模块,解决语义变化检测中跨时间对齐不足、多尺度表示弱及伪变化鲁棒性差的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13621 2026-08-07 cs.CV 版本更新 50%

Visual Intention Grounding for Egocentric Assistants

面向第一人称视角助手的视觉意图定位

Pengzhan Sun, Junbin Xiao, Tze Ho Elden Tse, Yicong Li, Arjun Akula, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出首个第一人称视觉意图定位数据集EgoIntention,及推理至定位(RoG)指令微调方法,解决多模态模型在第一人称视角下的意图定位问题,实现了统一的视觉定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14006 2026-08-06 cs.CV cs.RO 版本更新 50%

ResPlan: A Large-Scale Vector-Graph Dataset of 17,000 Residential Floor Plans

ResPlan:包含17000张住宅平面图的大规模矢量图数据集

Mohamed Abouagour, Eleftherios Garyfallidis

机构 * Department of Intelligent Systems Engineering, Indiana University(智能系统工程系,印第安纳大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 ResPlan是含17000张住宅平面图的矢量图数据集,具备功能空间标注与四类图边,相比RPLAN、MSD有更高质量单元布局,含相关代码与三个基准任务基线,可公开获取。

Comments 11 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02039 2026-08-05 cs.CV 版本更新 50%

RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?

RSVideo:你的视觉-语言模型准备好应对遥感视频了吗?

Hongjie Zhou, Shiqin Wang, Haoyang Chen, Haonan Guo, Di Wang, Juhua Liu, Fu Lin, Yong Luo

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究构建了遥感视频数据集RSVideo-10K与评估基准RSVideo-Bench,发现现有视觉-语言模型在遥感视频理解上存在不足,提出强化学习框架RSVideo提升小目标时空聚焦能力,取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18673 2026-08-05 cs.CV 版本更新 50%

MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts

MissingBench-Verified:探究视觉语言模型检测缺失物体部分的无能

Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou, Guoping Luo, Shan Du

机构 * University of British Columbia(英属哥伦比亚大学) Weathon Software(威盛软件)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究视觉语言模型检测缺失物体部分的能力,提出MissingBench-Verified基准,发现十个领先模型在此场景存在高失败率,现有缓解策略效果不佳,揭示当前VLM在检查监测任务中的根本局限,强调架构或训练干预的必要。

Comments Submitted to the ECCV 2026 Workshop on Explainable Computer Vision (eXCV). 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13040 2026-08-05 cs.RO 版本更新 50%

RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation

RoboProcessBench:视觉语言机器人操作中的过程感知理解基准测试

Dayu Xia, Yue Shi, Yao Mu, Huiting Ji, Chaofan Ma, Yingjie Zhou, Hua Chen, Yang Liu, Jiezhang Cao, Guangtao Zhai

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) China University of Mining Technology(中国矿业大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出RoboProcessBench基准,通过静态监控和动态推理两个维度、12个诊断问题家族,评估视觉语言模型在机器人操作中的过程感知理解能力,并基于58k问答对数据集验证了当前模型的局限性及后训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07916 2026-08-05 cs.CV 版本更新 50%

Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation

Tarot-SAM3: 无需训练的SAM3用于任意指称表达分割

Weiming Zhang, Dingwen Xiao, Songyue Guo, Guangyu Xiang, Shiqi Wen, Minwei Zhao, Lei Chen, Lin Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 Tarot-SAM3通过引入推理辅助提示和自修复机制,实现对任意指称表达的高效分割,有效解决传统方法对长或隐含表达的处理难题。

Comments We need to make a huge revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08592 2026-08-05 cs.MM 版本更新 50%

Fact-Checking at Scale: Multimodal AI for Authenticity and Context Verification in Online Media

大规模事实核查:用于在线媒体真实性与上下文验证的多模态AI

Van-Hoang Phan, Tung-Duong Le-Duc, Long-Khanh Pham, Anh-Thu Le, Quynh-Huong Dinh-Nguyen, Dang-Quan Vo, Hoang-Quoc Nguyen-Son, Anh-Duy Tran, Dang Vu, Minh-Son Dao

专题命中 推理评测 :reasoning(abstract)

AI总结 本文为2025年ACM多媒体大会多媒体验证挑战赛开发了多模态验证系统,整合视觉取证等技术,可检测脱离上下文的媒体,提升了多媒体验证水平,为相关从业者提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27637 2026-08-04 cs.CV 版本更新 50%

MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models

MMOOC:多模态大语言模型的上下文外评估综合基准

Wenjie Zhu, Yabin Zhang, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东方理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MMOOC基准,评估多模态大语言模型在上下文偏移场景下的拒绝与作答能力,实验发现当前模型难以平衡可答性与拒绝性,后训练可提升稳健性,该基准将公开。

Comments project page:https://zhuwenjie98.github.io/MMOOC-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27278 2026-08-04 cs.CV 版本更新 50%

OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation

OVEarth-Bench:面向开放词汇地球观测的类别广度与查询多样性评估

Kaiyu Li, Zepeng Xin, Zixuan Jiang, Jing Fu, Lanxuan Xue, Lingyu Zhang, Xiangyong Cao

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出OVEarth-Bench基准,从类别广度与查询多样性两方面扩展开放词汇地球观测评估,经实验发现MLLM类方法性能最优,为该领域未来研究提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00107 2026-08-04 cs.SE 版本更新 50%

The Illusion of Safety: Multi-Tier Verification of AI vs. Human C++ Code

安全的假象:AI与人类C++代码的多层验证

Saif Mahmud, Fadul Sikder, Yuede Ji, Haotian Zhang, Yu Lei

专题命中 推理评测 :reasoning(abstract)

AI总结 提出VULBENCH-CPP基准,通过四层验证发现AI生成C++代码的运行时违规率约为人类代码的两倍,静态分析会因代码长度产生安全假象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15230 2026-08-04 econ.EM 版本更新 50%

EnergyAgentBench: Benchmarking LLM Agents on Live Energy Infrastructure Data

EnergyAgentBench: 在实时能源基础设施数据上评估LLM代理的基准测试

Eliseo Curcio

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出EnergyAgentBench,首个基于实时电力市场数据的LLM代理基准测试,评估数据中心选址、长期投资组合优化等任务,九种模型在1414次运行中表现各异,Claude Sonnet 4.6在整体得分上领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22868 2026-08-04 cs.CV 版本更新 50%

Seeing the Unseen: Towards Training-Free Inspection for Wind Turbine Blades Using Knowledge-Augmented Vision Language Models

看见不可见:基于知识增强视觉语言模型的无训练风机叶片检测方法

Yang Zhang, Qianyu Zhou, Farhad Imani, Jiong Tang

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究提出结合RAG与VLM的零样本风机叶片检测框架,构建多模态知识库,在小样本测试中表现优于基线,为工业检测提供数据高效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23424 2026-08-03 econ.GN q-fin.EC 版本更新 50%

Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam

错误且更自信:语言模型参加研究生经济学考试的实地实验

Piyush Akimitsu

专题命中 推理评测 :reasoning(abstract)

AI总结 研究语言模型在研究生经济学考试中面对误导性信息的表现,通过GERB实验发现误导性信息降低正确答案概率,不同类型模型受影响无显著差异,错误答案有完整解释且模型自信,不对照答案难以发现错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26518 2026-07-31 cs.CV 版本更新 50%

EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding

EgoSafe:用于视觉安全理解的第一人称移动采集基准

Yuyun Chen, Tianao Li, TianQuan Feng, Cen Chen, Huiping Zhuang, Hao Peng, Ziqian Zeng

机构 * South China University of Technology(华南理工大学) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11518 2026-07-31 cs.IR 版本更新 50%

KuaiSearch: An E-Commerce Search Dataset with Authentic Queries and Product Texts for Recall, Ranking, and Relevance

KuaiSearch: 一个大规模电商平台搜索数据集用于召回、排序和相关性

Yupeng Li, Ben Chen, Mingyue Cheng, Zhiding Liu, Xuxin Zhang, Chenyi Lei

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出KuaiSearch,首个涵盖召回、排序和相关性评估的大型电商平台搜索数据集,通过真实用户交互数据提升电商搜索研究的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00215 2026-07-31 cs.SE 版本更新 50%

DocPrism: Multi-lingual Detection of Incorrectness Inconsistencies between Code and Documentation

DocPrism:代码与文档间错误不一致性的多语言检测

Xiaomeng Xu, Zahin Wahab, Reid Holmes, Caroline Lemieux

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出轻量级多语言代码-文档不一致性检测工具DocPrism,通过LCEF方法降低标记率、提升F1分数,在多语言真实场景中表现优于现有技术。

Comments 22 pages. To appear in Proceedings of the ACM on Software Engineering, Volume 3, ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13431 2026-07-30 cs.SD 版本更新 50%

Text2Score: Generating Sheet Music From Textual Prompts

Text2Score:从文本提示生成乐谱

Keshav Bhandari, Sungkyun Chang, Abhinaba Roy, Francesca Ronchini, Emmanouil Benetos, Dorien Herremans, Simon Colton

机构 * Queen Mary University of London(伦敦女王学院) Singapore University of Technology and Design(新加坡科技设计大学) Politecnico di Milano(米兰理工大学) EmotionWave(情绪波)

专题命中 推理评测 :planning(abstract)

AI总结 本文提出Text2Score框架,通过规划和执行阶段生成乐谱,利用符号XML数据直接生成监督信号,优于其他方法。

Comments 9 pages including references, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05485 2026-07-30 cs.SE 版本更新 50%

Readability-Robust Code Summarization via Meta Curriculum Learning

通过元课程学习实现抗可读性代码摘要

Wenhao Zeng, Yitian Chai, Hao Zhou, Fandong Meng, Jie Zhou, Xiaodong Gu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出RoFTCodeSum方法,通过结合课程学习和元学习提升代码摘要对低可读性代码的鲁棒性。

Comments Code available at https://github.com/Zengwh02/RoFTCodeSum

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04569 2026-07-29 eess.SY cs.SY 版本更新 50%

LLMs for Agentic Home Energy Management

用于智能家庭能源管理的大语言模型

Sokipriala Jonah, Queen Moses, Abiola Babatunde, Michael Ajao-Olarinoye, Daniel Bammeke

专题命中 推理评测 :reasoning(abstract)

AI总结 研究家庭能源管理系统中,大语言模型智能体能否为多设备家庭能源调度提供自然语言接口。通过工具调用ReAct智能体及相关数据,对三个商业模型进行基准测试,结果显示模型表现各异,能实现高调度成功率和接近最优性。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16302 2026-07-29 cs.CV 版本更新 50%

Explainable Flood Segmentation on Sentinel-1 SAR1 Imagery Using CNN and Transformer Architectures

可解释的Sentinel-1 SAR影像洪水分割:CNN与Transformer架构的比较研究

Arundhuti Banerjee, David Daou

机构 * United Nations University's Institute for Environment and Human Security (UNU-EHS)(联合国大学环境与人类安全研究所(UNU-EHS))

专题命中 推理评测 :planning(abstract)

AI总结 比较CNN和视觉Transformer在Sentinel-1 SAR影像多类洪水分割中的性能,SegFormer-b2在ETCI数据集上显著优于U-Net,但在Sen1Floods11上优势缩小,并利用可解释性技术分析模型决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26563 2026-07-29 cs.SE 版本更新 50%

TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems

TrajAudit:智能体编码系统的自动化故障诊断

Minxing Wang, Xiaofei Xie, Yintong Huo

专题命中 推理评测 :reasoning(abstract)

AI总结 针对仓库级编码轨迹中噪声多、上下文长的问题,提出TrajAudit框架,通过模式匹配过滤和测试报告先验知识辅助,实现高效故障诊断,在RootSE基准上定位准确率提升24.4个百分点,令牌消耗降低18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13653 2026-07-28 cs.CV cs.RO 版本更新 50%

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation

探索性、交流性和可部署性:用于开放世界移动操作的视觉驱动具身智能体

Boyu Mi, Mengchen Ma, Yifei Yao, Xing Gao, Junting Chen, Yangzi Li, Zihou Zhu, Guohao Li, Zhenfei Yin, Tai Wang, Yao Mu, Jiangmiao Pang, Hanqing Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对具身智能体现实部署难题,提出REAL框架,通过建立一致环境API、设计任务组合优化性能,引入REAL - Bench评估。实验显示其智能体在交互式任务中表现出色,在物理机器人上也实现高成功率,弥合现实差距。

Comments Accepted to ECCV 2026. 57 pages. Code available at https://github.com/InternRobotics/REAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14382 2026-07-28 cs.CV 版本更新 50%

StAR: Segment Anything Reasoner

StAR:分段任何推理器

Seokju Yun, Dongheon Lee, Noori Bae, Jaesung Jun, Chanseul Cho, Youngmin Ro

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出StAR框架,通过多角度优化提升分割性能,并首次引入并行测试时间扩展,构建ReasonSeg-X数据集以评估高级方法。

Comments ECCV 2026 / Code: https://github.com/ysj9909/StAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19372 2026-07-24 eess.IV q-bio.QM 版本更新 50%

endoExplain: A reproducible protocol for auditing score-localisation discordance in colonoscopy image classifiers

超越人工智能辅助结肠镜检查中的置信度:一种用于内镜人工智能审查的空间、时间和质量感知审计框架

Roberto Alcaraz Machado, Ana Lucía Rodríguez Blanco

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对AI辅助结肠镜检查中仅置信度不能全面评估预测的问题,提出EndoExplain审计框架,整合多种要素。通过实验展示了分类器和分割器的性能,还验证了归因方法等,该框架能分离多种信号,为临床审查提供支持,是回顾性研究原型。

Comments 18 pages, 5 figures, 5 tables. Substantially revised version with a new title and scope; added calibration analysis, paired multi-CAM evaluation, random-deletion controls, architecture and seed robustness analyses, and frozen external spatial transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02006 2026-07-24 cs.SE 版本更新 50%

An Agentic Approach Towards Replication Package Quality Evaluation

面向复制包质量评估的智能体方法

Maximilian Alexander Amougou Mbida, Florian Angermeir

专题命中 推理评测 :planning(abstract)

AI总结 提出一种多智能体方法,将开放科学指南转化为机器可验证标准,自动检查复制包质量并生成改进报告,初步评估显示高一致性和正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22952 2026-07-24 cs.SE 版本更新 50%

Sifting the Noise: A Comparative Study of LLM Agents in Vulnerability False Positive Filtering

筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究

Yunpeng Xiong, Ting Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。

Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏