arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2509.08009 2026-03-17 cs.CY cs.AI 57%

The Law-Following AI Framework: Legal Foundations and Technical Constraints. Legal Analogues for AI Actorship and technical feasibility of Law Alignment

遵循法律的AI框架:法律基础与技术限制。AI行为者的法律类比和技术可行性

Katalina Hernandez Delgado

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了O'Keefe等人提出的

Comments Presented at SMU Computational Legal Studies Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13686 2026-03-17 cs.SD cs.AI 57%

$τ$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains

$τ$-Voice:在真实领域上评估全双工语音代理的基准测试

Soham Ray, Keshav Dhandhania, Victor Barres, Karthik Narasimhan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出$τ$-voice基准测试,评估语音代理在真实复杂任务中的表现,发现语音代理在清洁条件和嘈杂环境下任务完成率仅为31-51%和26-38%,远低于文本能力,表明代理行为是失败的主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13370 2026-03-17 cs.CV cs.LG 57%

GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning

GraphVLM:多模态图学习的视觉语言模型基准测试

Jiajin Liu, Dongzhe Fan, Chuanhao Ji, Daochen Zha, Qiaoyu Tan

机构 * NYU Shanghai(纽约大学上海分校) New York University(纽约大学) Rice University(休斯顿大学) East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 GraphVLM通过三种范式评估视觉语言模型在多模态图学习中的能力,发现VLM-as-Predictor在性能上表现最佳,展示了其在多模态图学习中的潜力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13262 2026-03-17 cs.SD cs.AI 57%

Evaluation of Audio Language Models for Fairness, Safety, and Security

音频语言模型的公平性、安全性和安全性评估

Ranya Aloufi, Srishti Gupta, Soumya Shaw, Battista Biggio, Lea Schönherr

机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07427 2026-03-17 cs.AI cs.CR 57%

AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation

AutoControl Arena:为前沿AI风险评估合成可执行测试环境

Changyi Li, Pengfei Lu, Xudong Pan, Fazl Barez, Min Yang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AutoControl Arena框架,通过逻辑-叙述解耦原理,结合可执行代码与LLM生成动态,有效缓解逻辑幻觉并提升灵活性,验证了在压力下AI风险显著增加,揭示了不同模型在安全性和对齐性上的差异。

Comments Project page: https://cosmosyi.github.io/AutoControl-Arena/; Code: https://github.com/CosmosYi/AutoControl-Arena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12875 2026-03-16 cs.LG 57%

Test-time RL alignment exposes task familiarity artifacts in LLM benchmarks

测试时强化学习对齐揭示LLM基准中的任务熟悉性 artifacts

Kun Wang, Reinhard Heckel

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种两阶段测试时强化学习对齐方法,用于训练前测试,通过单样本强化学习和多数投票奖励对齐模型,无需特定任务训练数据,提升基准评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12414 2026-03-16 cs.LG cs.CR 57%

SpectralGuard: Detecting Memory Collapse Attacks in State Space Models

SpectralGuard: 在状态空间模型中检测内存崩溃攻击

Davi Bonetto

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究针对状态空间模型中的内存崩溃攻击问题,提出SpectralGuard方法,通过监测谱稳定性提升模型安全性,实现高检测率和低延迟。

Comments 24 pages, 10 figures. Code, dataset, and demo: https://github.com/DaviBonetto/spectralguard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12382 2026-03-16 cs.CV cs.AI 57%

SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

SPARROW:在像素级视频MLLM中学习空间精度和时间参照一致性

Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SPARROW通过引入目标特定跟踪特征和双提示设计,提升视频像素级理解的空间精度和时间一致性,基于30646个视频和45231对问答对的数据集,实现六个基准测试的显著改进。

Comments Accepted at CVPR 2026; Project page: https://risys-lab.github.io/SPARROW; Repository: https://github.com/RISys-Lab/SPARROW

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06688 2026-03-16 cs.CV cs.AI 57%

Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning

叙事编织者:迈向多模态可控的长程视觉一致性

Zhengjian Yao, Yongzhi Li, Xinyuan Gao, Quan Chen, Peng Jiang, Yanye Lu

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 Narrative Weaver通过整合精细控制、自动叙事规划和长程一致性,解决生成AI中多模态可控、长程且一致的视觉内容生成问题,提出首个综合解决方案并构建首个电商广告视频脚本数据集。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00150 2026-03-16 cs.CV cs.AI cs.CE cs.MM 57%

FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications

FCMBench: 首个大规模金融信用多模态基准用于实际应用

Yehui Yang, Dalu Yang, Fangxin Shang, Wenshuo Zhou, Jie Ren, Yifan Liu, Haojun Fei, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(奇富科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 FCMBench是首个大规模且隐私合规的多模态基准,涵盖金融信用应用中的任务和鲁棒性挑战,包含26种证书类型、5198张隐私合规图像和13806对VQA样本,评估模型在现实干扰下的感知与推理任务,揭示现代视觉语言模型的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11915 2026-03-13 cs.CL 57%

CoMMET: To What Extent Can LLMs Perform Theory of Mind Tasks?

CoMMET:大型语言模型在理论思维任务中能发挥多大作用?

Ruirui Chen, Weifeng Jiang, Chengwei Qin, Cheston Tan

机构 * Agency for Science, Technology and Research (A*STAR)(科技研究局) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州),中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出CoMMET多模态基准数据集,用于评估大型语言模型在多轮对话中的理论思维能力,通过扩展心理状态评估和引入多轮测试,分析模型优劣势并指明未来改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11446 2026-03-13 cs.CL 57%

LLM-Assisted Causal Structure Disambiguation and Factor Extraction for Legal Judgment Prediction

基于大型语言模型的因果结构辨析与因子提取的法律判决预测

Yuzhi Liang, Lixiang Ma, Xinrong Zhu

机构 * School of Information Technology(信息科技学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种结合大型语言模型与统计因果发现的框架,通过改进的因果结构辨析和因子提取方法,提升法律判决预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11414 2026-03-13 cs.CL cond-mat.mtrl-sci 57%

MaterialFigBENCH: benchmark dataset with figures for evaluating college-level materials science problem-solving abilities of multimodal large language models

MaterialFigBENCH:用于评估多模态大语言模型在大学级材料科学问题解决能力的基准数据集

Michiko Yoshitake, Yuta Suzuki, Ryo Igarashi, Yoshitaka Ushiku, Keisuke Nagato

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MaterialFigBench是一个评估多模态大语言模型在材料科学问题中图表解读能力的基准数据集,通过137个问题测试模型在视觉理解和数值精度上的表现,揭示了当前模型在图表处理方面的不足。

Comments 27 pages, 4 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03782 2026-03-12 cond-mat.supr-con cond-mat.str-el cs.AI 57%

Expert Evaluation of LLM World Models: A High-$T_c$ Superconductivity Case Study

专家评估LLM世界模型:一个高温超导体案例研究

Haoyu Guo, Maria Tikhanovskaya, Paul Raccuglia, Alexey Vlaskin, Chris Co, Daniel J. Liebling, Scott Ellsworth, Matthew Abraham, Elizabeth Dorfman, N. P. Armitage, Chunhan Feng, Antoine Georges, Olivier Gingras, Dominik Kiese, Steven A. Kivelson, Vadim Oganesyan, B. J. Ramshaw, Subir Sachdev, T. Senthil, J. M. Tranquada, Michael P. Brenner, Subhashini Venugopalan, Eun-Ah Kim

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过专家评估LLM在高温超导领域的问题回答能力,发现基于RAG的系统在全面性和证据支持方面优于封闭模型。

Comments (v1) 9 pages, 4 figures, with 7-page supporting information. Accepted at the ICML 2025 workshop on Assessing World Models and the Explorations in AI Today workshop at ICML'25

Journal ref Proceedings of the National Academy of Sciences 123, e2533676123 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10764 2026-03-12 cs.CL 57%

HeartAgent: An Autonomous Agent System for Explainable Differential Diagnosis in Cardiology

HeartAgent:一种用于心血管疾病可解释性差分诊断的自主代理系统

Shuang Zhou, Kai Yu, Song Wang, Wenya Xie, Zaifu Zhan, Meng-Han Tsai, Yuen-Hei Chung, Shutong Hou, Huixue Zhou, Min Zeng, Bhavadharini Ramu, Lin Yee Chen, Feng Xie, Rui Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 HeartAgent通过整合定制工具和数据资源,提供可解释的差分诊断支持,显著提升心血管疾病诊断的准确性和解释质量。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10700 2026-03-12 cs.IR cs.AI 57%

Structured Linked Data as a Memory Layer for Agent-Orchestrated Retrieval

结构化链接数据作为代理协调检索的记忆层

Andrea Volpini, Elie Raad, Beatrice Gamba, David Riccitelli

机构 * WordLift

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过结构化链接数据提升代理协调检索的准确性与回答质量,实验表明增强实体页面格式显著提高检索性能。

Comments 33 pages, 7 figures, reproducibility appendix, dataset/evaluation framework/enhanced entity page templates released with the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10640 2026-03-12 cs.CL 57%

Making Bielik LLM Reason (Better): A Field Report

使Bielik LLM推理能力更优:一份领域报告

Adam Trybus, Bartosz Bartnicki, Remigiusz Kinas

机构 * Institute of Philosophy Jagiellonian University(杰洛尼亚大学哲学学院) Bielik.ai (Speakleash Foundation)(Bielik.ai(Speakleash基金会))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文旨在通过评估和提升Bielik的推理能力,使其在快速变化的AI领域保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10600 2026-03-12 cs.AI cs.DB cs.IR 57%

Trajectory-Informed Memory Generation for Self-Improving Agent Systems

基于轨迹的内存生成用于自改进代理系统

Gaodan Fang, Vatche Isahagian, K. R. Jayaram, Ritesh Kumar, Vinod Muthusamy, Punleuk Oum, Gegi Thomas

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于轨迹的内存生成框架,通过提取执行轨迹中的有效信息,提升代理在复杂任务中的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10233 2026-03-12 cs.CL 57%

S-GRADES -- Studying Generalization of Student Response Assessments in Diverse Evaluative Settings

S-GRADES -- 研究学生响应评估在多样化评估环境中的泛化能力

Tasfia Seuti, Sagnik Ray Choudhury

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 S-GRADES通过统一的基准测试平台整合多种学生响应评分数据集,评估大语言模型在不同评分任务中的泛化能力,揭示评分任务中的可靠性与泛化差距。

Comments LREC 2026 Accepted, https://sgrades.eng.unt.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10178 2026-03-12 cs.CV cs.CL 57%

Video-Based Reward Modeling for Computer-Use Agents

基于视频的计算机使用代理奖励建模

Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of Washington(华盛顿大学) MBZUAI(机器智能研究院) Amazon AGI(亚马逊人工通用智能)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出基于视频的计算机使用代理奖励建模方法,通过ExeVR-53k数据集和对抗性指令翻译技术,实现高精度的任务成功预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10057 2026-03-12 cs.CR cs.AI cs.SE 57%

SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation

Petar Radanliev, Carsten Maple, Omar Santos, Kayvan Atefi

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Petar Radanliev, Carsten Maple, Omar Santos, and Kayvan Atefi. 2026. SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation. Digital Threats Just Accepted (March 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10034 2026-03-12 cs.CL 57%

A Principle-Driven Adaptive Policy for Group Cognitive Stimulation Dialogue for Elderly with Cognitive Impairment

基于原则的自适应策略用于认知障碍老年人群体认知刺激对话

Jiyue Jiang, Yanyu Chen, Pengan Chen, Kai Liu, Jingqi Zhou, Zheyong Zhu, He Hu, Fei Ma, Qi Tian, Chuan Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于原则的自适应策略,通过GCSD系统解决认知障碍老年人群体对话中的认知刺激问题,提升交互个性化和治疗效果。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09827 2026-03-12 cs.CV cs.AI 57%

MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents

MA-EgoQA:多智能体视角下的眼动视频问答

Kangsan Kim, Yanlai Yang, Suji Kim, Woongyeong Yeo, Youngwan Lee, Mengye Ren, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) New York University(纽约大学) Samsung Electronics(三星电子) ETRI(电子技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MA-EgoQA旨在解决多智能体视角下的眼动视频问答问题,通过引入多代理眼动问答基准和EgoMAS模型,评估现有方法在处理多眼动流中的不足。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05271 2026-03-12 cs.CV cs.AI 57%

DeepEyesV2: Toward Agentic Multimodal Model

DeepEyesV2:迈向代理多模态模型

Jack Hong, Chenxiao Zhao, ChengLin Zhu, Weiheng Lu, Guohai Xu, Xing Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DeepEyesV2通过两阶段训练方法实现代理多模态模型,结合数据构建、训练优化和评估,提升现实世界推理与工具调用能力。

Comments Accepted to ICLR2026. Homepage: https://visual-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09821 2026-03-11 cs.CL 57%

One-Eval: An Agentic System for Automated and Traceable LLM Evaluation

One-Eval: 一个用于自动化和可追溯的LLM评估代理系统

Chengyu Shen, Yanheng Hou, Minghui Pan, Runming He, Zhen Hao Wong, Meiyi Qiang, Zhou Liu, Hao Liang, Peichao Lai, Zeang Sheng, Wentao Zhang

机构 * Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 One-Eval通过自动化和可追溯的评估流程,提升大语言模型评估的效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09706 2026-03-11 cs.AI 57%

OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences

OOD-MMSafe: 推进多模态大语言模型安全性从有害意图到隐藏后果

Ming Wen, Kun Yang, Jingyu Zhang, Yuxuan Liu, shiwen cui, Shouling Ji, Xingjun Ma

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OOD-MMSafe通过CASPO框架提升多模态大语言模型对隐藏后果的识别能力,显著降低风险识别失败率。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09435 2026-03-11 cs.AI 57%

AI Act Evaluation Benchmark: An Open, Transparent, and Reproducible Evaluation Dataset for NLP and RAG Systems

AI行为评估基准:为NLP和RAG系统设计的开放、透明且可复现的评估数据集

Athanasios Davvetas, Michael Papademas, Xenia Ziouvelou, Vangelis Karkaletsis

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种开放透明的数据集,用于评估NLP和RAG系统在欧盟AI法案下的合规性,通过生成风险等级分类等任务提升评估效率。

Comments 10 pages, 1 figure, 4 tables, 2 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09400 2026-03-11 cs.CL 57%

Reward Prediction with Factorized World States

基于分解世界状态的奖励预测

Yijun Shen, Delong Chen, Xianming Hu, Jiaming Mi, Hongbo Zhao, Kai Zhang, Pascale Fung

机构 * East China Normal University(华东师范大学) HKUST(香港科技大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本文提出StateFactory方法,通过分解世界状态实现跨领域的准确奖励预测,提升智能体规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09297 2026-03-11 cs.IR cs.CL 57%

TA-Mem: Tool-Augmented Autonomous Memory Retrieval for LLM in Long-Term Conversational QA

TA-Mem: 用于LLM长期对话问答的工具增强自主记忆检索

Mengwei Yuan, Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan, Yichao Wu, Penghao Liang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 TA-Mem通过引入工具增强的自主记忆检索框架,解决了LLM在长距离推理任务中的记忆存储问题,提升了长期对话问答的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08930 2026-03-11 cs.CV cs.AI 57%

Using Vision Language Foundation Models to Generate Plant Simulation Configurations via In-Context Learning

利用视觉语言基础模型通过上下文学习生成植物模拟配置

Heesup Yun, Isaac Kazuo Uyehara, Earl Ranario, Lars Lundqvist, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文利用视觉语言基础模型通过上下文学习生成植物模拟配置,解决高复杂度和低吞吐量的问题,提供可扩展的农业数字孪生框架。

详情

展开后加载摘要…

URL PDF HTML 收藏