arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-29 至 2026-01-29 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 21 篇

2510.01146 2026-01-29 cs.CL cs.AI cs.LG 82%

mR3: Multilingual Rubric-Agnostic Reward Reasoning Models

mR3:多语言无评分标准奖励推理模型

David Anugraha, Shou-Yi Hung, Zilu Tang, Annie En-Shiun Lee, Derry Tanti Wijaya, Genta Indra Winata

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学) Boston University(波士顿大学) Ontario Tech University(安大略技术大学) Monash University Indonesia(墨尔本大学印尼分校) Capital One(Capital One公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 mR3是一种多语言无评分标准奖励推理模型,通过72种语言训练实现广泛语言覆盖,超越更大模型并验证其在多语言奖励模型基准上的最佳性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20221 2026-01-29 cs.AI cs.CL 81%

Scaling Medical Reasoning Verification via Tool-Integrated Reinforcement Learning

通过工具集成强化学习扩展医学推理验证

Hang Zhang, Ruheng Wang, Yuelyu Ji, Mingu Kwak, Xizhi Wu, Chenyu Li, Li Zhang, Wenqi Shi, Yifan Peng, Yanshan Wang

机构 * University of Pittsburgh(匹兹堡大学) UT Southwestern Medical Center(西南医学中心) Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出$\method$,通过工具集成强化学习实现医学推理验证的扩展,显著提升验证效果并降低采样预算需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16656 2026-01-29 cs.AI 79%

NUMINA: A Natural Understanding Benchmark for Multi-dimensional Intelligence and Numerical Reasoning Abilities

NUMINA:多维智能与数值推理能力的自然理解基准

Changyu Zeng, Yifan Wang, Zimu Wang, Wei Wang, Zhengni Yang, Muyi Bao, Jiming Xiao, Anh Nguyen, Yutao Yue

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进技术学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Deep Perception Technology, JITRI(深度感知技术研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 NUMINA是一个用于多维智能和数值推理能力的自然理解基准,通过多尺度注释和自动化注释流程提升多模态室内感知理解,揭示当前LLM在三维空间计算中的不足。

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22575--22590

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07972 2026-01-29 cs.LG cs.AI cs.CL 75%

HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization

HeuriGym: 一个用于评估LLM生成启发式算法的代理基准

Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong, Haoxing Ren, Samitha Samaranayake, Carla P. Gomes, Zhiru Zhang

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HeuriGym是一个用于评估LLM生成启发式算法的代理基准,通过代码执行反馈和迭代改进,揭示了LLM在组合优化中的局限性。

Comments Accepted to ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17641 2026-01-29 cs.CL cs.AI cs.LG cs.SD 75%

AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?

AuditoryBench++: 语言模型能否在不听觉的情况下理解听觉知识?

Hyunjong Ok, Suho Yoo, Hyeonjun Kim, Jaeho Lee

机构 * Pohang University of Science and Technology(坡山科学技术大学) HJ AILAB Korea Advanced Institute of Science and Technology(韩国高级科学技术研究院)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AuditoryBench++通过AIR-CoT方法提升语言模型在听觉知识推理中的表现。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20757 2026-01-29 cs.CL 74%

Persona Prompting as a Lens on LLM Social Reasoning

作为LLM社会推理的镜像:人格提示

Jing Yang, Moritz Hechtbauer, Elisabeth Khalilov, Evelyn Luise Brinkmann, Vera Schmitt, Nils Feldhus

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本研究探讨了人格提示对LLM社会推理的影响,发现其虽能提升分类效果,但会降低推理质量并加剧偏见。

Comments 9 Pages, EACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20253 2026-01-29 cs.CL cs.AI 62%

Automated Benchmark Generation from Domain Guidelines Informed by Bloom's Taxonomy

基于布卢姆分类法的领域指南驱动的自动基准生成

Si Chen, Le Huy Khiem, Annalisa Szymanski, Ronald Metoyer, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame, USA(诺丁汉大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 基于布卢姆分类法的自动基准生成框架,通过专家指南生成多选题和对话,评估模型在实践领域中的上下文推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20103 2026-01-29 cs.SE cs.AI cs.LG 62%

Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis

通过对比分析在代码环境中基准测试奖励黑客检测

Darshan Deshpande, Anand Kannappan, Rebecca Qian

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过对比分析提出了一种涵盖54类的奖励利用分类法,并引入TRACE基准测试,展示模型在对比设置中对奖励黑客的检测效果优于孤立分类设置。

Comments Dataset: https://huggingface.co/datasets/PatronusAI/trace-dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16669 2026-01-29 cs.CL cs.AI cs.CY 62%

PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice

PLawBench: 一个基于规则的法律实践评估基准

Yuzhen Shi, Huanghai Liu, Yiran Hu, Gaojie Song, Xinran Xu, Yubo Ma, Tianyi Tang, Li Zhang, Qingjing Chen, Di Feng, Wenbo Lv, Weiheng Wu, Kexin Yang, Sen Yang, Wei Wang, Rongyao Shi, Yuanyang Qiu, Yuemeng Qi, Jingwen Zhang, Xiaoyu Sui, Yifan Chen, Yi Zhang, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Weixing Shen, Bing Zhao, Charles L. A. Clarke, Hu Wei

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PLawBench通过现实法律任务评估LLM的法律推理能力,揭示其在细节处理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14616 2026-01-29 cs.CL cs.AI 62%

Beyond Correctness: Evaluating Subjective Writing Preferences Across Cultures

超越正确性:跨文化的主观写作偏好评估

Shuangshuang Ying, Yunwen Li, Xingwei Qu, Xin Li, Sheng Jin, Minghao Liu, Zhoufutu Wen, Xeron Du, Tianyu Zheng, Yichi Zhang, Letian Ni, Yuyang Cheng, Zhenzhu Yang, Qiguang Chen, Jingzhe Ding, Shengda Long, Wangchunshu Zhou, Jiazhan Feng, Wanjun Zhong, Libo Qin, Ge Zhang, Wenhao Huang, Wanxiang Che, Chenghua Lin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WritingPreferenceBench数据集,发现基于序列的奖励模型在评估主观写作偏好时表现不佳,而生成奖励模型通过推理链达到更高准确率,揭示了当前RLHF方法在捕捉主观偏好方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20705 2026-01-29 cs.CV cs.AI 57%

LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?

LEMON:大型语言模型在教学视频中的时间多模态理解表现如何?

Zhuang Yu, Lei Shen, Jing Zhao, Shiliang Sun

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LEMON是一个针对教学视频的多模态理解评估基准,旨在评估大型语言模型在时间推理和跨模态整合方面的表现,揭示其在复杂教育内容中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20465 2026-01-29 cs.CL 57%

BMAM: Brain-inspired Multi-Agent Memory Framework

基于大脑的多智能体记忆框架 BMAM

Yang Li, Jiaxiang Liu, Yusong Wang, Yujie Wu, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Institute of Science Tokyo(东京科学研究所) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 BMAM 提出了一种基于大脑认知机制的多智能体记忆框架,通过分解记忆为事件型、语义型等子系统,提升长时间交互中的信息保持和行为一致性,实验显示其在 LoCoMo 基准上达到 78.45% 的准确率。

Comments Submitted to ACL (ARR 2026 January submission); non-anonymous preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20311 2026-01-29 cs.HC cs.AI 57%

DiagLink: A Dual-User Diagnostic Assistance System by Synergizing Experts with LLMs and Knowledge Graphs

DiagLink:通过融合专家与LLM和知识图谱的双用户诊断辅助系统

Zihan Zhou, Yinan Liu, Yuyang Xie, Bin Wang, Xiaochun Yang, Zezheng Feng

机构 * Northeastern University(东北大学) Northeastern University School of Computer Science(东北大学计算机科学学院) Northeastern University Software College(东北大学软件学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DiagLink通过融合LLM、知识图谱和专家,构建双用户诊断辅助系统,提升诊断效率和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20141 2026-01-29 cs.CY cs.AI 57%

Large language models accurately predict public perceptions of support for climate action worldwide

大型语言模型能准确预测全球对气候行动的支持感知

Nattavudh Powdthavee, Sandra J. Geiger

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 大型语言模型能准确预测全球对气候行动的支持感知,为评估气候行动中的感知差距提供快速工具,尤其在资源丰富的国家可作为替代调查手段。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20102 2026-01-29 cs.CL 57%

Counterfactual Cultural Cues Reduce Medical QA Accuracy in LLMs: Identifier vs Context Effects

反事实文化线索降低大语言模型医学问答准确性:标识符效应与情境效应

Amirhossein Haji Mohammad Rezaei, Zahra Shakeri

机构 * Institute of Health Policy, Management, and Evaluation (IHPME)(健康政策、管理与评估研究所) Dalla Lana School of Public Health(达拉兰公共卫生学院) University of Toronto(多伦多大学) Faculty of Information(信息学院) Schwartz Reisman Institute(施瓦茨-雷曼研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过反事实文化线索测试,发现文化相关信息显著降低大语言模型医学问答准确性,尤其在标识符与情境共同存在时影响最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19916 2026-01-29 cs.CL 57%

PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review

PaperAudit-Bench: 用于关键自动化同行评审中研究论文错误检测的基准测试

Songjun Tu, Yiwen Ma, Jiahao Lin, Qichao Zhang, Xiangyuan Lan, Junfeng. Li, Nan Xu, Linjing Li, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Wenge Technology(文英科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PaperAudit-Bench通过整合结构化错误检测与证据意识的评审生成,提升自动化同行评审的批判性评估能力,并支持轻量级模型训练以实现高效错误检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08430 2026-01-29 cs.AI 57%

RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation

RubricHub: 通过自动化粗到细生成构建一个全面且高度判别性的评分标准数据集

Sunzhu Li, Jiale Zhao, Miteto Wei, Huimin Ren, Yang Zhou, Jingwen Yang, Shunyu Liu, Kaike Zhang, Wei Chen

机构 * Li Auto Inc. Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RubricHub通过自动化粗到细生成方法构建了一个大规模多领域评分标准数据集,通过后训练流程显著提升了模型在HealthBench上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23565 2026-01-29 cs.CV cs.AI 57%

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07286 2026-01-29 cs.CL cs.IR 57%

Arce: Augmented Roberta with Contextualized Elucidations for Ner in Automated Rule Checking

Arce:增强的RoBERTa与上下文澄清用于自动规则检查中的命名实体识别

Jian Chen, Jiabao Dou

机构 * Ningxia Research Institute of Transport Science(宁夏交通运输科学研究院) Department of Computer Science(计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ARCE通过增强RoBERTa并结合上下文澄清,有效解决了AEC领域自动规则检查中的命名实体识别问题,实现了77.20%的Macro-F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20623 2026-01-29 cs.IR 50%

When Vision Meets Texts in Listwise Reranking

当视觉与文本在列表级重排序中相遇

Hongyi Cai

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Rank-Nexus,一种轻量级多模态图像-文本文档重排序器,通过渐进跨模态训练策略提升重排序性能,适用于文本和图像重排序基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20196 2026-01-29 cs.CV 50%

Automated Marine Biofouling Assessment: Benchmarking Computer Vision and Multimodal LLMs on the Level of Fouling Scale

自动化海洋生物污损评估:基于生物污损等级的计算机视觉与多模态LLM对比分析

Brayden Hamilton, Tim Cashmore, Peter Driscoll, Trevor Gee, Henry Williams

机构 * Centre for Automation and Robotic Engineering Science(自动化与机器人工程科学中心) The University of Auckland(奥克兰大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过对比计算机视觉与多模态LLM在生物污损等级评估中的表现,提出混合方法以实现可扩展且可解释的自动化评估。

Comments Australasian Conference on Robotics and Automation, ACRA2025 13 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏