arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-26 至 2026-02-26 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2602.21786 2026-02-26 cs.CL 92%

D-COT: Disciplined Chain-of-Thought Learning for Efficient Reasoning in Small Language Models

D-COT:为小语言模型高效推理的纪律性推理学习

Shunsuke Ubukata

机构 * Shunsuke Ubukata(独立研究者)

专题命中 推理评测 :CoT(title,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

AI总结 D-CoT通过引入控制标签强制结构化推理,提升小语言模型在推理任务中的性能并减少计算成本。

Comments 9 pages, 3 figures. Code: https://github.com/gitpullpull/DisciplinedChainOfThought | Benchmarks: https://huggingface.co/datasets/gitpullpull/D-CoT-Benchmarks | Dataset: https://huggingface.co/datasets/gitpullpull/D-CoT-datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21346 2026-02-26 cs.CL cs.AI 86%

Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment

基于对齐的DPO:一种原则性的推理方法以提高安全性对齐

Mengxuan Hu, Vivek V. Datla, Anoop Kumar, Zihan Guan, Sheng Li, Alfy Samuel, Daben Liu

机构 * University of Virginia(弗吉尼亚大学) Capital One

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于对齐的DPO方法,通过引入推理意识的后训练和对齐加权机制,提升大语言模型的安全性对齐鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21226 2026-02-26 cs.CL cs.AI 81%

IslamicLegalBench: Evaluating LLMs Knowledge and Reasoning of Islamic Law Across 1,200 Years of Islamic Pluralist Legal Traditions

伊斯兰法律基准:评估LLMs在1200年伊斯兰多元法律传统中的知识和推理能力

Ezieddin Elmahjub, Junaid Qadir, Abdullah Mushtaq, Rafay Naeem, Ibrahim Ghaznavi, Waleed Iqbal

机构 * Qatar University(卡塔尔大学) Information Technology University(信息技术大学) Northeastern University(东北大学) Queen Mary University of London(伦敦女王学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 伊斯兰法律基准评估LLMs在伊斯兰法推理中的能力,揭示其在复杂任务中存在显著缺陷,强调基础知识缺失对AI性能的影响。

Comments This manuscript has been submitted for review to Artificial Intelligence \& Law

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06899 2026-02-26 cs.CL cs.AI 81%

RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation

RPTS: 基于树结构的推理过程评分用于忠实多模态评估

Haofeng Wang, Yu Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RPTS提出了一种基于树结构的评分方法,用于评估多模态推理过程的忠实度,通过构建推理树和动态权重调整,揭示模型推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21779 2026-02-26 cs.CV cs.AI 79%

Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models

超越静态伪影:一种用于视觉语言模型中视频深度伪造推理的取证基准

Zheyuan Gu, Qingsong Zhao, Yusong Wang, Zhaohong Huang, Xinqi Li, Cheng Yuan, Jiaowei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院,中国电信(TeleAI)) Peking University(北京大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出FAQ基准,通过多选任务提升视觉语言模型对视频深度伪造的时间推理能力,并通过实验验证其有效性。

Comments 16 pages, 9 figures. Submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21706 2026-02-26 cs.CV cs.AI 79%

SurGo-R1: Benchmarking and Modeling Contextual Reasoning for Operative Zone in Surgical Video

SurGo-R1:手术视频中操作区的上下文推理基准测试与建模

Guanyi Qin, Xiaozhen Wang, Zhu Zhuo, Chang Han Low, Yuancan Xiao, Yibing Fu, Haofeng Liu, Kai Wang, Chunjiang Li, Yueming Jin

机构 * National University of Singapore, Singapore(新加坡国立大学) Southern Medical University, China(南方医科大学) Guangzhou Research Translation and Innovation Institute, National University of Singapore, China(广州研究翻译与创新研究院,新加坡国立大学,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SurGo-R1通过RLHF优化的多阶段架构,在手术视频中实现了高精度的操作区识别,显著优于通用视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21650 2026-02-26 cs.SI cs.AI 79%

PPCR-IM: A System for Multi-layer DAG-based Public Policy Consequence Reasoning and Social Indicator Mapping

PPCR-IM:一个多层DAG基础的公共政策后果推理与社会指标映射系统

Zichen Song, Weijia Li

机构 * Lanzhou University(兰州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PPCR-IM通过多层DAG推理和指标映射,实现公共政策后果的结构化分析与社会影响评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07667 2026-02-26 cs.AI 79%

1-2-3 Check: Enhancing Contextual Privacy in LLM via Multi-Agent Reasoning

1-2-3 Check: 通过多智能体推理增强LLM的上下文隐私

Wenkai Li, Liwen Sun, Zhenxiang Guan, Xuhui Zhou, Maarten Sap

机构 * Language Technologies Institute Carnegie Mellon University(语言技术研究所卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 通过多智能体推理,有效减少LLM中的私有信息泄露,提升上下文隐私保护效果。

Comments Accepted at the International Association for AI Safety and Ethics AI (IASEAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21698 2026-02-26 cs.CV 78%

E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of-Thought

E-comIQ-ZH: 一种用于评估电子商务海报细粒度的对齐人类数据集和基准

Meiqi Sun, Mingyu Li, Junxiong Zhu

机构 * Taobao & Tmall Group, Alibaba Group(淘宝与天猫集团、阿里巴巴集团)

专题命中 推理评测 :chain-of-thought(title);CoT(abstract)

AI总结 E-comIQ-ZH提出了一种针对中文电子商务海报生成的对齐人类评估框架,通过构建多维评分数据集和专家校准的链式推理模型,实现了细粒度的自动化评估。

Comments 21pages, 19figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21854 2026-02-26 cs.CL 77%

FewMMBench: A Benchmark for Multimodal Few-Shot Learning

FewMMBench: 一种多模态少样本学习的基准测试

Mustafa Dogan, Ilker Kesen, Iacer Calixto, Aykut Erdem, Erkut Erdem

机构 * Aselsan Research(阿塞利桑研究)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 FewMMBench是一个用于评估多模态少样本学习能力的基准测试,通过系统分析不同任务类型、模型家族和提示策略,揭示指令调优模型在零样本性能上的优势及CoT推理的局限性。

Comments Preprint. 49 pages, 38 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05066 2026-02-26 cs.CR cs.AI 70%

Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks

通过代理式攻击绕过AI控制协议

Jafar Isbarov, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出通过代理式攻击绕过AI监控防御,显示即使大规模监控模型也易受攻击,揭示当前防御机制的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15715 2026-02-26 cs.CL cs.AI 62%

RebuttalAgent: Strategic Persuasion in Academic Rebuttal via Theory of Mind

反驳代理:通过心理理论实现学术反驳的战略说服

Zhitao He, Zongwei Lyu, Yi R Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 RebuttalAgent通过心理理论框架实现学术反驳的战略说服,利用训练数据和强化学习提升反驳效果,显著优于现有模型。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21420 2026-02-26 cs.LG cs.AI 62%

Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning

过度自信的错误需要更强的纠正:强化学习中的非对称置信度惩罚

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang

机构 * LinkedIn Corporation(领英公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非对称置信度感知错误惩罚(ACE)以解决强化学习中过度自信错误的问题,通过动态调节负优势提升模型推理能力与生成多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19922 2026-02-26 cs.CL cs.AI 62%

HEART: A Unified Benchmark for Assessing Humans and LLMs in Emotional Support Dialogue

HEART:一个评估人类和大语言模型在情感支持对话中能力的统一基准

Laya Iyer, Kriti Aggarwal, Sanmi Koyejo, Gail Heyman, Desmond C. Ong, Subhabrata Mukherjee

机构 * Stanford University(斯坦福大学) University of California, San Diego(加州大学圣地亚哥分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 HEART通过多轮情感支持对话评估人类与大语言模型的能力差异,揭示两者在共情、一致性等维度上的表现及趋同趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19139 2026-02-26 cs.AI cs.CL 62%

A Multi-faceted Analysis of Cognitive Abilities: Evaluating Prompt Methods with Large Language Models on the CONSORT Checklist

对认知能力的多维度分析:利用大型语言模型在CONSORT清单上评估提示方法

Sohyeon Jeon, Hyung-Chul Lee

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过比较通用和领域专用LLM在三种提示策略下的表现,揭示了其在评估临床试验报告时存在显著的校准错误和过度自信问题,强调了改进校准和提示工程的重要性。

Comments We have decided to withdraw this manuscript because we believe it requires further revision and substantial improvement before it is suitable for dissemination to the academic community

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22125 2026-02-26 cs.CL 57%

IndicIFEval: A Benchmark for Verifiable Instruction-Following Evaluation in 14 Indic Languages

IndicIFEval: 一种用于14种印地语系语言可验证指令跟随评估的基准

Thanmay Jayakumar, Mohammed Safi Ur Rahman Khan, Raj Dabre, Ratish Puduppully, Anoop Kunchukuttan

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) IT University of Copenhagen(丹麦技术大学) Microsoft(微软)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 IndicIFEval是一个评估14种印地语系语言指令跟随能力的基准,通过规则指令和人类验证例子评估大语言模型的生成能力。

Comments 8 pages + Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21763 2026-02-26 cs.CL 57%

Improving Implicit Discourse Relation Recognition with Natural Language Explanations from LLMs

通过LLMs生成的自然语言解释提升隐含话语关系识别

Heng Wang, Changxing Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过利用LLMs生成的自然语言解释提升隐含话语关系识别的性能和可解释性。

Comments AAAI26'0ral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21728 2026-02-26 cs.CL 57%

Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling

在知识图谱上探索:通过路径细化奖励建模激励大语言模型自主探索

Shiqi Yan, Yubo Chen, Ruiqi Zhou, Zhengxi Yao, Shuai Chen, Tianyi Zhang, Shijie Zhang, Wei Qiang Zhang, Yongfeng Huang, Haixin Duan, Yunqi Zhang

机构 * Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国) Institute for Network Sciences and Cyberspace, Tsinghua University, Beijing, China(网络科学与网络空间研究院,清华大学,北京,中国) Ant International, Ant Group, Hangzhou, Zhejiang, China(蚂蚁集团,杭州,浙江,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Explore-on-Graph框架,通过强化学习和路径细化奖励建模,使大语言模型在知识图谱上自主探索更广泛的推理空间,实现对分布外推理问题的高效泛化。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21230 2026-02-26 cs.CL 57%

TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents

TRACE: 基于轨迹的深度研究代理综合评估

Yanyu Chen, Jiyue Jiang, Jiahong Liu, Yifei Zhang, Xiao Guo, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 TRACE提出基于轨迹的深度研究代理综合评估框架,通过分层效用函数和阶梯式能力评估协议,解决单一指标评估的不足,揭示代理在准确性、效率和鲁棒性之间的关键权衡。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07986 2026-02-26 cs.CL cs.CV 57%

VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding

VULCA-Bench:一个多文化视觉-语言基准,用于评估文化理解

Haorui Yu, Diji Yang, Hang He, Fengrui Zhang, Qiufeng Yi

机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD部门) University of California, Santa Cruz, USA(加州大学圣克ruz分校) Analogy AI East China Normal University, China(华东师范大学) Nanjing University, China(南京大学) Department of Mechanical Engineering, School of Engineering, University of Birmingham(伯明翰大学工程学院机械工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 VULCA-Bench通过多文化艺术批评基准评估视觉-语言模型在文化理解上的能力,包含7,410对图像-批评对,涵盖八个文化传统,通过五层框架评估文化理解,揭示更高阶推理更具挑战性。

Comments 8 pages, 4 figures, submitted to ACL 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21112 2026-02-26 cs.RO cs.AI 57%

EO-1: An Open Unified Embodied Foundation Model for General Robot Control

EO-1:一个通用机器人控制的开放统一具身基础模型

Delin Qu, Haoming Song, Qizhi Chen, Zhaoqing Chen, Xianqiang Gao, Dong Wang, Xinyi Ye, Qi Lv, Modi Shi, Guanghui Ren, Cheng Ruan, Maoqing Yao, Haoran Yang, Jiacheng Bao, Bin Zhao, Xuelong Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) AgiBot Northwestern Polytechnical University(西北工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EO-1是一个统一的具身基础模型,通过交错视觉-文本-动作预训练实现了在多模态推理和机器人控制中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03447 2026-02-26 cs.RO cs.CV 50%

HetroD: A High-Fidelity Drone Dataset and Benchmark for Autonomous Driving in Heterogeneous Traffic

HetroD:一种用于异质交通中自动驾驶的高保真无人机数据集和基准

Yu-Hsiang Chen, Wei-Jer Chang, Christian Kotulla, Thomas Keutgens, Steffen Runde, Tobias Moers, Christoph Klas, Wei Zhan, Masayoshi Tomizuka, Yi-Ting Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) UC Berkeley(伯克利大学) fka GmbH

专题命中 推理评测 :planning(abstract)

AI总结 HetroD通过高保真无人机数据集和基准,解决异质交通中自动驾驶面临的复杂行为预测与规划挑战。

Comments IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏