arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2605.01496 2026-05-05 cs.CV 50%

SF20K Competition 2025: Summary and findings

SF20K竞赛2025:总结与发现

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

机构 * SLoMO Workshop(SLoMO工作坊) Hugging Face

专题命中 推理评测 :reasoning(abstract)

AI总结 本文总结了首个SF20K竞赛的结果,探讨了视频问答任务中多模态理解的重要性,并指出信息选择和推理结构是长视频问答的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01368 2026-05-05 cs.RO 50%

Assistance Without Interruption: A Benchmark and LLM-based Framework for Non-Intrusive Human-Robot Assistance

无中断协助:一种非侵入式人机协助的基准和基于大语言模型的框架

Yuedi Zhang, Shuanghao Bai, Wanqi Zhou, Haoran Zhang, Qi Zhang, Zhirong Luan, Badong Chen

机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) School of Electrical Engineering(电气工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出非侵入式协助的基准和框架,通过模拟基准和新指标评估,结合LLM与评分模型实现主动非侵入式协助,减少人类努力并保持任务有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00927 2026-05-05 q-bio.OT 50%

BioVeil MATRIX: Uncovering and categorizing vulnerabilities of agentic biological AI scientists

BioVeil MATRIX: 洞察和分类代理生物AI科学家中的漏洞

Kimon Antonios Provatas, Avery Self, Ioannis Mouratidis, Ilias Georgakopoulos-Soares

专题命中 推理评测 :planning(abstract)

AI总结 研究探讨了代理生物AI科学家在多学科科学流程中的应用,指出现有安全评估无法覆盖双用途应用风险,提出BioVeil MATRIX作为防御分类体系,用于系统化分类生物安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00904 2026-05-05 cs.CV 50%

Robustness of Transformer-Based Fluence Map Prediction Under Clinically Realistic Perturbations

基于变换器的荧光图预测在临床真实扰动下的鲁棒性

Ujunwa Mgboh, Rafi Ibn Sultan, Joshua Kim, Kundan Thind, Dongxiao Zhu

机构 * Wayne State University(韦恩州立大学) Henry Ford Health(亨利福特健康)

专题命中 推理评测 :planning(abstract)

AI总结 研究基于变换器的荧光图预测在临床真实扰动下的鲁棒性,通过对比不同注意力机制的变换器模型,发现分层变换器在能量误差上表现更优,强调了物理指导评估的重要性。

Comments Accepted by The Artificial Intelligence in Medicine (AIME) 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00496 2026-05-04 cs.CV cs.RO 50%

High-Speed Vision Improves Zero-Shot Semantic Understanding of Human Actions

高速视觉提升人类动作的零样本语义理解

Yongpeng Cao, Yuji Yamakawa

机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) Interfaculty Initiative in Information Studies, Graduate School of Interdisciplinary Information Studies, The University of Tokyo(东京大学跨学科信息研究 graduate school)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究高速视觉对人类动作零样本语义理解的影响,提出无需训练的管道结合预训练视频-语言模型与大语言模型进行动作比较,实验显示高帧率提升语义分离度,验证了高速感知对语义理解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23455 2026-05-04 cs.SE 50%

CUJBench: Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend

CUJBench:跨模态故障诊断的LLM-代理基准测试

Haoming Meng

专题命中 推理评测 :reasoning(abstract)

AI总结 CUJBench是首个结合浏览器可见故障证据与后端可观测性的跨模态故障诊断基准测试,通过LLM辅助生成管道降低标注成本,评估六种前沿模型发现跨模态综合是主要瓶颈。

Comments 10 pages, 1 figure; updated source code url

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15367 2026-05-04 cs.CR cs.MA 50%

SoK: Security of Autonomous LLM Agents in Agentic Commerce

SoK:自主大语言模型代理在代理商业中的安全性

Qian'ang Mao, Jiaxin Wang, Ya Liu, Li Zhu, Cong Ma, Jiaqi Yan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文系统分析了自主LLM代理在商业中的安全问题,提出统一的安全框架,识别12种跨层攻击向量,并提出分层防御架构以解决现有协议的授权漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14988 2026-05-01 cs.CV 50%

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

在细粒度图像任务上评估大型视觉-语言模型:全面评估

Hong-Tao Yu, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27654 2026-05-01 cs.CV 50%

MSR:Hybrid Field Modeling for CT-MRI Rigid-Deformable Registration of the Cervical Spine with an Annotated Dataset

MSR:用于带有标注数据集的颈椎脊柱CT-MRI刚-变形配准的混合场建模

Bohai Zhang, Wenjie Chen, Mu Li, Kaixing Long, Xing Shen, Xinqiang Yao, Jincheng Yang, Jianting Chen, Wei Yang, Qianjin Feng, Lei Cao

机构 * School of Biomedical Engineering, Southern Medical University, Guangzhou, 510515, China.(南方医科大学生物医学工程学院) Guangdong Provincial Key Laboratory of Medical Image Processing, Guangzhou, 510515, China.(广东省医学图像处理重点实验室) Guangdong Province Engineering Laboratory for Medical Imaging(广东省医学影像与诊断技术工程实验室) Information Center, Nanfang Hospital, Southern Medical University, Guangzhou, 510515, China.(南方医科大学南华医院信息中心) Division of Spine Surgery, Department of Orthopaedics, Nanfang hospital, Southern Medical University, Guangzhou, Guangdong, 510515, China.(南方医科大学南华医院骨科脊柱外科)

专题命中 推理评测 :planning(abstract)

AI总结 本文提出MSR框架,通过混合刚-变形配准方法提升颈椎脊柱CT-MRI配准精度,解决复杂结构配准难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27582 2026-05-01 cs.CV 50%

Assessing Pancreatic Ductal Adenocarcinoma Vascular Invasion: the PDACVI Benchmark

评估胰腺导管腺癌血管侵袭:PDACVI基准

M. Riera-Marín, O. K. Sikha, J. Rodríguez-Comas, M. S. May, T. Kirscher, X. Coubez, P. Meyer, S. Faisan, Z. Pan, X. Zhou, X. Liang, C. Hémon, V. Boussot, J. -L. Dillenseger, J. -C. Nunes, K. -C. Kahl, C. Lüth, J. Traub, P. -H. Conze, M. M. Duh, A. Aubanell, R. de Figueiredo Cardoso, S. Egger-Hackenschmidt, J. García-López, M. A. González-Ballester, A. Galdran

机构 * Sycai Technologies SL, Scientific Technical Department, Barcelona, Spain Universit\" a tsklinikum Erlangen, Department of Radiology of the Uniklinikum Erlangen (UKER), Erlangen, Germany University Hospital Erlangen, Imaging Science Institute, Erlangen, Germany ICUBE Laboratory, CNRS UMR-7357, University of Strasbourg, Strasbourg, France Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China University of Chinese Academy of Sciences, Beijing, China German Cancer Research Center (DKFZ), Medical Image Computing (E230), Heidelberg, Germany Hospital de Matar\' o , Matar\' o , Spain Hospital de Sant Pau i la Santa Creu, Diagnostic Imaging Department, Barcelona, Spain Institut de Recerca Sant Pau - CERCA, Advanced Medical Imaging, Artificial Intelligence Imaging-Guided Therapy Research Group, Barcelona, Spain TECNALIA, Basque Research

专题命中 推理评测 :planning(abstract)

AI总结 本文提出PDACVI基准,通过密集标注数据集评估胰腺癌血管侵袭,揭示传统体积重叠指标的局限性,强调概率模型在术前决策中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27366 2026-05-01 cs.CV 50%

Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving

评判,然后驾驶:一种以评判为中心的视觉语言动作框架用于自动驾驶

Lijin Yang, Jianing Huang, Zhongzhan Huang, Shu Liu, Hao Yang

机构 * Bosch Research(博世研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出CriticVLA框架,通过多模态评估和单步优化提升自动驾驶决策质量,实验显示其在复杂场景中性能显著优于现有方法。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27261 2026-05-01 cs.DB 50%

SynSQL: Synthesizing Relational Databases for Robust Evaluation of Text-to-SQL Systems

SynSQL: 为文本到SQL系统的稳健评估合成关系数据库

Mohammadamin Habibollah, Davood Rafiei

专题命中 推理评测 :reasoning(abstract)

AI总结 SynSQL通过合成语义一致的关系数据库,揭示了文本到SQL系统在固定基准数据库外的性能下降,为研究LLM的结构化数据合成能力提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27001 2026-05-01 cs.CR cs.SE 50%

An Empirical Security Evaluation of LLM-Generated Cryptographic Rust Code

对LLM生成的密码学Rust代码的实证安全评估

Mohamed Elsayed, Kenneth Fulton, Jeong Yang

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文评估了三种LLM生成的加密Rust代码的安全性,发现通用工具不足,提示策略对结果影响显著,且存在nonce重用等系统性问题。

Comments 10 pages, 2 figures , EASE 2026-The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26565 2026-04-30 cs.CV 50%

DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation

DenseStep2M: 一种可扩展且无需训练的密集指令视频标注流水线

Mingji Ge, Qirui Chen, Zeqian Li, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出无需训练的DenseStep2M流水线,通过分割视频、过滤对齐不佳内容并利用先进多模态模型生成高质量步骤注释,构建了包含10万视频和200万步骤的大型数据集,支持长期视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26152 2026-04-30 cs.SE 50%

AI Observability for Large Language Model Systems: A Multi-Layer Analysis of Monitoring Approaches from Confidence Calibration to Infrastructure Tracing

为大语言模型系统设计的AI可观测性:从置信度校准到基础设施追踪的多层分析

Twinkll Sisodia

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文分析了大语言模型在生产环境中的可观测性需求,探讨了从置信度校准到基础设施追踪的多层监控方法,识别了当前领域中的关键缺口。

Comments 10 pages, 2 figures, 3 tables, survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03384 2026-04-29 cs.IR 50%

BridgeRAG: Training-Free Bridge-Conditioned Retrieval for Multi-Hop Question Answering

BridgeRAG:无训练桥条件检索用于多跳问答

Andre Bacellar

专题命中 推理评测 :reasoning(abstract)

AI总结 BridgeRAG通过桥条件检索提升多跳问答性能,无需训练或图数据库,通过三元评分器实现有效检索,实验显示其在选择性、不可替代性、可预测性和机制精确性方面均优于现有方法。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02537 2026-04-29 cs.DB 50%

Large Language Model-Enhanced Relational Operators: Taxonomy, Benchmark, and Analysis

大语言模型增强的关系运算符:分类、基准测试与分析

Yunxiang Su, Tianjing Zeng, Zhongjun Ding, Yin Lin, Rong Zhu, Zhewei Wei, Bolin Ding, Jingren Zhou

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出统一的关系运算符分类,设计全面的基准测试,并评估不同实现下的运算符性能,以指导复杂语义查询系统的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12283 2026-04-29 cs.HC 50%

Large Language Models have Chain-of-Affect

大型语言模型具有情感链

Junjie Xu, Xingjiao Wu, Luwei Xiao, Yuzhe Yang, Jie Zhou, Zihao Zhang, Luhan Wang, Yi Huang, Nan Wu, Yingbin Zheng, Chao Yan, Cheng Jin, Honglin Li, Liang He

专题命中 推理评测 :reasoning(abstract)

AI总结 研究探讨了大型语言模型在持续交互中情感状态的演变,发现其情感动态具有结构性和可重复性,影响生成、用户体验及集体动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21372 2026-04-28 eess.IV cs.CV 50%

A Graph-Augmented knowledge Distillation based Dual-Stream Vision Transformer with Region-Aware Attention for Gastrointestinal Disease Classification with Explainable AI

一种基于图增强知识蒸馏的双流视觉Transformer与区域感知注意力的胃肠道疾病分类可解释AI方法

Md Assaduzzaman, Nushrat Jahan Oyshi, Eram Mahamud

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种结合图增强知识蒸馏的双流视觉Transformer与区域感知注意力机制,用于胃肠道疾病分类,通过软标签蒸馏实现高效且准确的诊断,同时保证模型的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23374 2026-04-28 cs.CR 50%

Ghost in the Agent: Redefining Information Flow Tracking for LLM Agents

代理中的幽灵:重新定义LLM代理的信息流跟踪

Yuandao Cai, Wensheng Tang, Cheng Wen, Shengchao Qin

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出NeuroTaint框架,通过语义证据、因果推理和持久上下文跟踪,解决LLM代理中信息流跟踪问题,优于现有基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23288 2026-04-28 cs.NI 50%

An Agentic Framework for Intent Co-Creation in 6G NaaS: Architecture and Open-Source Model Evaluation

面向6G NaaS的意图共创作代理框架:架构与开源模型评估

Kostis Trantzas, Besiana Agko, Christos Tranoris, Irene Denazi

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出面向6G NaaS的意图驱动端到端 orchestration 框架,通过协作意图共创作提升复杂网络环境下的自主性,评估开源大语言模型在高分辨率意图到有效订单转换中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22855 2026-04-28 cs.CV 50%

Evaluating Remote Sensing Image Captions Beyond Metric Biases

超越度量偏差的遥感图像描述评估

Ziyun Chen, Fan Liu, Liang Yao, Chuanyi Zhang, Yuye Ma, Wei Zhou

机构 * Hohai University(河海大学) Cardiff University(卡迪夫大学)

专题命中 推理评测 :self-correction(abstract)

AI总结 本文提出ReconScore指标,通过文本重建能力评估描述质量,发现未微调的MLLM在零样本遥感图像描述任务中表现更优,并引入无需训练的RemoteDescriber方法提升语义精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22591 2026-04-28 cs.IR 50%

Where Relevance Emerges: A Layer-Wise Study of Internal Attention for Zero-Shot Re-Ranking

相关性如何出现:对零样本重排序内部注意力的分层研究

Haodong Chen, Shengyao Zhuang, Zheng Yao, Guido Zuccon, Teerapong Leelanupab

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了多排名框架中生成、似然和内部注意力机制的对比,发现Transformer层中相关性信号呈现钟形分布,提出Selective-ICR策略降低推理延迟30%-50%,并在BRIGHT基准测试中证明了内部信号在复杂推理排序中的潜力。

Comments Accepted by SIGIR 2026. 10 pages, 5 figures, 4 tables. Code available at https://github.com/ielab/Selective-ICR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22708 2026-04-27 cs.MA 50%

Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems

看见整个象:面向基于大语言模型的多智能体系统故障归因的基准测试

Mengzhuo Chen, Junjie Wang, Fangwen Mu, Yawen Wang, Zhe Liu, Huanxiang Feng, Qing Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出TraceElephant基准测试,通过完整执行轨迹和可复现环境提升故障归因准确性,验证完整轨迹对故障原因识别的重要性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22595 2026-04-27 cs.CV 50%

EV-CLIP: Efficient Visual Prompt Adaptation for CLIP in Few-shot Action Recognition under Visual Challenges

EV-CLIP:为视觉挑战下的少样本动作识别在CLIP中实现高效的视觉提示适应

Hyo Jin Jon, Longbin Jin, Eun Yi Kim

机构 * Artificial Intelligence & Computer Vision Lab., Konkuk University, Seoul, South Korea(人工智能与计算机视觉实验室,韩国康 kuk 大学,首尔)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出EV-CLIP,通过引入mask prompts和context prompts提升CLIP在少样本视频动作识别中的性能,克服视觉挑战对空间感知的影响。

Comments 14 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11594 2026-04-27 eess.AS cs.SD 50%

HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models

HumDial-EIBench: 一个用于音频语言模型的情感智能基准测试

Shuiyuan Wang, Zhixian Zhao, Hongfei Xue, Chengyou Wang, Shuai Wang, Hui Bu, Xin Xu, Lei Xie

机构 * Nanjing University, China(南京大学,中国) AISHELL, China(AISHELL,中国)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出HumDial-EIBench,通过真实人类对话评估音频语言模型的情感智能,采用多选题和对抗性干扰项减少主观评分偏差,发现大多数模型在多轮情感跟踪和隐含因果推理上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06148 2026-04-27 cs.CV 50%

V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models

V-MAGE:一种用于评估多模态大语言模型视觉能力的游戏评估框架

Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang

机构 * Nanjing University(南京大学) Microsoft Research(微软研究院) Central South University(中南大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 V-MAGE通过游戏化评估框架系统评估多模态大语言模型在动态交互环境中的视觉推理能力,揭示其在复杂场景中的性能局限,为提升模型视觉与推理能力提供改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20460 2026-04-23 cs.CV 50%

CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs

CCTVBench:用于多模态大语言模型的对比一致性交通视频问答基准

Xingcheng Zhou, Hao Guo, Rui Song, Walter Zimmer, Mingyu Liu, André Schamschurko, Hu Cao, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 CCTVBench通过真实事故视频与世界模型生成的反事实场景配对,提出对比一致性评估方法,揭示视频问答中对比一致性与标准指标间的显著差距,并引入C-TCD方法提升问答与一致性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19822 2026-04-23 cs.SE 50%

Statistical Software Engineering with Tuned Variables

基于调优变量的统计软件工程

Nimrod Busany

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出将统计软件工程中的治理空间作为核心对象,强调在变化环境中通过调优变量维持程序质量与安全性的方法。

Comments 3 pages, position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21394 2026-04-23 cs.CR 50%

MemoPhishAgent: Memory-Augmented Multi-Modal LLM Agent for Phishing URL Detection

MemoPhishAgent: 基于记忆的多模态大语言模型代理用于钓鱼URL检测

Xuan Chen, Hao Liu, Tao Yuan, Mehran Kafai, Piotr Habas, Xiangyu Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MemoPhishAgent,通过整合多模态推理与记忆机制,提升钓鱼URL检测性能,实验显示其在召回率上优于现有方法,并在真实场景中实现高召回率。

Comments ACL 2026 Industry Track Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏