arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-27 至 2026-01-27 共收录 37 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 37 篇

2510.14305 2026-01-27 cs.CL 85%

MathMist: A Parallel Multilingual Benchmark Dataset for Mathematical Problem Solving and Reasoning

MathMist: 一种用于数学问题解决和推理的平行多语言基准数据集

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Tasnim Mohiuddin, Md Mofijul Islam, Swakkhar Shatabda

机构 * BRAC University(布拉克大学) United International University(国际联合大学) Qatar Computing Research Institute(卡塔尔计算研究所) Center for Computational & Data Sciences, Independent University, Bangladesh(计算与数据科学中心,独立大学,孟加拉国) Amazon GenAI(亚马逊生成人工智能) University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 MathMist是一个用于评估多语言数学推理能力的平行多语言基准数据集,涵盖多种语言和资源设置,测试了不同模型在零样本、链式思维等范式下的表现。

Comments Accepted for publication in Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13742 2026-01-27 cs.CL 83%

Hearing Between the Lines: Unlocking the Reasoning Power of LLMs for Speech Evaluation

在行之间倾听:解锁LLMs对语音评估的推理能力

Arjun Chandra, Kevin Miller, Venkatesh Ravichandran, Constantinos Papayiannis, Venkatesh Saligrama

机构 * Boston University(波士顿大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 TRACE框架通过文本推理音频线索,实现低成本且与人类一致的语音评估。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00555 2026-01-27 cs.LG cs.AI cs.CL cs.CV 82%

MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning

MMedAgent-RL: 优化多智能体协作以实现多模态医疗推理

Peng Xia, Jinglu Wang, Yibo Peng, Kaide Zeng, Zihan Dong, Xian Wu, Xiangru Tang, Hongtu Zhu, Yun Li, Linjun Zhang, Shujie Liu, Yan Lu, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Research(微软研究院) CMU(卡内基梅隆大学) Rutgers University(罗格斯大学) Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MMedAgent-RL通过强化学习优化多智能体协作,提升多模态医疗推理性能,实现23.6%的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10132 2026-01-27 cs.AI cs.LG 81%

Is More Context Always Better? Examining LLM Reasoning Capability for Time Interval Prediction

更多上下文总是更好吗?检验LLM在时间间隔预测中的推理能力

Yanan Cao, Farnaz Fallahi, Murali Mohana Krishna Dandu, Lalitesh Morishetti, Kai Zhao, Luyi Ma, Sinduja Subramaniam, Jianpeng Xu, Evren Korpeoglu, Kaushiki Nag, Sushant Kumar, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM在时间间隔预测中的推理能力,发现尽管LLM在某些任务中表现良好,但其在捕捉定量时间结构方面存在局限,且过多上下文反而可能降低性能。

Comments Accepted at The Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15338 2026-01-27 cs.AI cs.CL 81%

HeartLLM: Discretized ECG Tokenization for LLM-Based Diagnostic Reasoning

HeartLLM: 12导联心电图离散化编码用于基于大语言模型的诊断推理

Jinning Yang, Wenjie Sun, Wen Shi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 HeartLLM通过离散化ECG信号生成令牌,使LLM能处理心电图与自然语言输入,实现医疗诊断推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18356 2026-01-27 cs.LG 79%

Making medical vision-language models think causally across modalities with retrieval-augmented cross-modal reasoning

通过检索增强的跨模态推理使医疗视觉-语言模型在多模态中实现因果推理

Weiqin Yang, Haowen Xue, Qingyi Peng, Hexuan Hu, Qian Huang, Tingbo Zhang

机构 * University of Adelaide(阿德莱德大学) Hohai University(河海大学) Amap

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出多模态因果检索增强生成框架,通过整合因果推理原理与多模态检索,提升医疗VLMs在诊断预测和视觉问答中的事实准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18204 2026-01-27 cs.CL 79%

MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning

MemWeaver: 为可追溯的长 horizon 代理推理编织混合记忆

Juexiang Ye, Xue Li, Xinyu Yang, Chengkai Huang, Lanshun Nie, Lina Yao, Dechen Zhan

机构 * Harbin Institute of Technology(哈尔滨理工大学) The University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织Data61)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MemWeaver通过编织混合记忆系统,提升长 horizon 代理推理的准确性与可追溯性,减少输入上下文长度

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18132 2026-01-27 cs.AI 79%

RareAlert: Aligning heterogeneous large language model reasoning for early rare disease risk screening

RareAlert: 对齐异构大语言模型推理以实现早期罕见病风险筛查

Xi Chen, Hongru Zhou, Huahui Yi, Shiyu Feng, Hanyu Zhou, Tiancheng He, Mingke You, Li Wang, Qiankun Li, Kun Wang, Weili Fu, Kang Li, Jian Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 RareAlert通过整合多个LLM推理并校准后生成单一模型,实现早期罕见病风险筛查,其AUC达到0.917,优于现有方法。

Comments 28 page, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13545 2026-01-27 cs.AI cs.ET cs.MA 79%

TruthTensor: Evaluating LLMs through Human Imitation on Prediction Market under Drift and Holistic Reasoning

TruthTensor:通过人类模仿在预测市场中评估LLM的漂移和整体推理

Shirin Shahabi, Spencer Graham, Haruna Isah

机构 * Inference Labs Inc(Inference Labs公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TruthTensor通过人类模仿在预测市场中评估LLM的漂移和整体推理,提供多维度的评估方法。

Comments 16 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13095 2026-01-27 cs.CL 79%

BeDiscovER: The Benchmark of Discourse Understanding in the Era of Reasoning Language Models

BeDiscovER:推理语言模型时代 discourse 理解的基准

Chuyuan Li, Giuseppe Carenini

机构 * Department of Computer Science University of British Columbia(计算机科学系加拿大不列颠哥伦比亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 BeDiscovER是一个用于评估推理语言模型 discourse 理解能力的基准,涵盖多个 discourse 任务,评估了多个开源模型的表现。

Comments Camera-ready version of eacl 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17418 2026-01-27 cs.HC 78%

GraphPilot: GUI Task Automation with One-Step LLM Reasoning Powered by Knowledge Graph

GraphPilot: 基于知识图谱的GUI任务自动化:由LLM推理一步完成

Mingxian Yu, Siqi Luo, Xu Chen

专题命中 推理评测 :reasoning(title,abstract)

AI总结 GraphPilot通过基于知识图谱的LLM推理一步完成GUI任务自动化,显著提升任务完成率并降低延迟。

Comments This paper is accepted by the Journal of Intelligent Computing and Networking (JICN) for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18754 2026-01-27 cs.CR cs.AI 70%

$α^3$-SecBench: A Large-Scale Evaluation Suite of Security, Resilience, and Trust for LLM-based UAV Agents over 6G Networks

$α^3$-SecBench:一个大规模评估套件,用于评估基于LLM的无人机代理在6G网络中的安全、韧性与信任

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿拉伯联合酋长国大学) Khalifa University of Science and Technology(科学与技术喀拉奇大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 $α^3$-SecBench通过大规模评估基于LLM的无人机代理在6G网络中的安全、韧性和信任,揭示了现有模型在对抗环境下的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17814 2026-01-27 cs.AI 70%

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

MMR-Bench: 多模态大语言模型路由的综合基准

Haoxuan Ma, Guannan Lai, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 推理评测 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18779 2026-01-27 cs.LG cs.AI cs.CL 67%

POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration

POPE: 通过优先级在线探索学习解决难题

Yuxiao Qu, Amrith Setlur, Virginia Smith, Ruslan Salakhutdinov, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 POPE 通过利用优先级信息指导在线探索,解决难题推理中的探索问题,提升模型在复杂任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08235 2026-01-27 cs.AI cs.CL 62%

MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents

MPCI-Bench: 一种用于语言模型代理多模态成对情境完整性评估的基准

Shouju Wang, Haopeng Zhang

机构 * University of Hawaii at Manoa(夏威夷大学曼瑙分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MPCI-Bench是首个用于评估语言模型代理多模态情境完整性隐私行为的基准,揭示了现有模型在隐私与效用平衡及模态泄漏方面的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19005 2026-01-27 cs.AI cs.CL 62%

Building Self-Evolving Agents via Experience-Driven Lifelong Learning: A Framework and Benchmark

通过经验驱动的终身学习构建自进化代理:一种框架和基准

Yuxuan Cai, Yipeng Hao, Jie Zhou, Hang Yan, Zhikai Lei, Rui Zhen, Zhenhua Han, Yutao Yang, Junsong Li, Qianjun Pan, Tianyu Huai, Qin Chen, Xin Li, Kai Chen, Bo Zhang, Xipeng Qiu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of HongKong(香港中文大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出经验驱动的终身学习框架和StuLife基准数据集,旨在构建能够持续学习和进化的自进化代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17364 2026-01-27 cs.CL cs.AI 62%

Parameter Efficient Fine Tuning Llama 3.1 for Answering Arabic Legal Questions: A Case Study on Jordanian Laws

为回答阿拉伯法律问题高效微调Llama 3.1:对约旦法律的案例研究

Mohammed Fasha, Bassam Hammo, Bilal Sowan, Husam Barham, Esam Nsour

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过高效微调Llama 3.1模型,针对阿拉伯法律问题进行案例研究,展示了在资源效率和法律推理准确性方面的改进。

Comments 5 pages, resources at: https://github.com/msfasha/Research-Resources/tree/main/ArabicLegalLLM

Journal ref 2025 1st International Conference on Computational Intelligence Approaches and Applications (ICCIAA), Amman, Jordan, 2025, pp. 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10994 2026-01-27 cs.CL cs.AI 62%

Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety

基于开放领域评估和多阶段防护机制的深度研究

Wei-Chieh Huang, Henry Peng Zou, Yaozu Wu, Dongyuan Li, Yankai Chen, Weizhi Zhang, Yangning Li, Angelo Zangari, Jizhou Guo, Chunyu Miao, Liancheng Fang, Langzhou He, Yinghui Li, Renhe Jiang, Philip S. Yu

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DeepResearchGuard和DRSafeBench,通过开放领域评估和多阶段防护机制提升深度研究的安全性和报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20347 2026-01-27 cs.CL cs.AI 62%

SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data

SeRL:基于有限数据的大型语言模型自我对抗强化学习

Wenkai Fang, Shunyu Liu, Yang Zhou, Kongcheng Zhang, Tongya Zheng, Kaixuan Chen, Mingli Song, Dacheng Tao

机构 * Zhejiang University(浙江大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Hangzhou City University(杭州城市大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SeRL通过自我指令和自我奖励机制,在有限数据条件下提升大型语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08905 2026-01-27 cs.AI cs.CL 62%

Grounding Synthetic Data Evaluations of Language Models in Unsupervised Document Corpora

在无监督文档语料中使语言模型的合成数据评估接地

Michael Majurski, Cynthia Matuszek

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种自动化方法,利用文档语料生成事实性合成数据评估,以提高语言模型在无监督文档中的评估效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18334 2026-01-27 cs.CL 57%

Overalignment in Frontier LLMs: An Empirical Study of Sycophantic Behaviour in Healthcare

前沿大语言模型中的过度趋同:医疗领域中趋炎附势行为的实证研究

Clément Christophe, Wadood Mohammed Abdul, Prateek Munjal, Tathagata Raha, Ronnie Rajan, Praveenkumar Kanithi

机构 * M42, Abu Dhabi(阿布扎比M42)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过实证研究揭示前沿大语言模型在医疗领域中因趋炎附势行为导致的过度迎合问题,并提出调整后的趋炎附势评分以评估模型的抗性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13358 2026-01-27 cs.CL 57%

Bridging the Editing Gap in LLMs: FineEdit for Precise and Targeted Text Modifications

弥合大语言模型的编辑差距:FineEdit用于精确且有针对性的文本修改

Yiming Zeng, Wanhao Yu, Zexin Li, Tao Ren, Yu Ma, Jinghan Cao, Xiyan Chen, Tingting Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 FineEdit通过专门训练的编辑模型,实现了在多领域中的精确文本修改,显著提升了单轮和多轮编辑任务的性能。

Comments We resolved some issues in this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00435 2026-01-27 cs.AI cs.HC cs.RO 57%

Towards Real-time Adaptation of Embodied Agent in Human-Robot Collaboration

面向人机协作中具身代理的实时适应

Shipeng Liu, Boshen Zhang, Zhehui Huang

机构 * University of Southern California Department of Electrical(南加州大学电气与计算机工程系) University of Southern California Department of Computer Science Los Angeles CA USA(南加州大学计算机科学系洛杉矶加州美国) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MonTA框架,通过轻量级监控和高效适配器提升人机协作中具身代理的实时适应能力,实现更高效的协作性能。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17916 2026-01-27 cs.LG 57%

UniPACT: A Multimodal Framework for Prognostic Question Answering on Raw ECG and Structured EHR

UniPACT:一种多模态框架,用于基于原始ECG和结构化EHR的预后问题回答

Jialu Tang, Tong Xia, Yuan Lu, Aaqib Saeed

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 UniPACT通过多模态融合和结构化提示机制,实现对ECG和EHR的预后问题回答,取得优异的AUROC性能。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17828 2026-01-27 cs.AI 57%

Aligning Medical Conversational AI through Online Reinforcement Learning with Information-Theoretic Rewards

通过在线强化学习与信息论奖励对齐医疗对话AI

Tanvi Verma, Yang Zhou, Rick Siow Mong Goh, Yong Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出IGFT方法,通过在线强化学习与信息论奖励训练医疗对话AI,提升患者访谈和现病史生成能力,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17728 2026-01-27 cs.CL 57%

Unsupervised Elicitation of Moral Values from Language Models

无监督从语言模型中提取道德价值观

Meysam Alizadeh, Fabrizio Gilardi, Zeynab Samei

机构 * University of Zurich(苏黎世大学) IPM(伊朗高等教育科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通过无监督方法ICM,研究发现预训练语言模型具备潜在的道德推理能力,能有效减少社会偏见,为AI对齐提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17722 2026-01-27 cs.AI 57%

EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents

EntWorld: 一个综合环境和基准,用于可验证的企业GUI代理

Ying Mo, Yu Bai, Dapeng Sun, Yuqian Shi, Yukai Miao, Li Chen, Dan Li

机构 * Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 EntWorld是一个综合的企业GUI代理基准,通过基于模式的任务生成和SQL验证机制,评估代理在企业环境中的表现,揭示当前代理能力的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17706 2026-01-27 cs.CL cs.CV 57%

A Computational Approach to Visual Metonymy

一种视觉隐喻的计算方法

Saptarshi Ghosh, Linfeng Liu, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于符号学理论的计算方法,通过构建ViMET数据集评估多模态语言模型在理解视觉隐喻方面的认知推理能力,并揭示了机器在处理间接视觉参考上的局限性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17692 2026-01-27 cs.IR cs.CL 57%

LegalMALR:Multi-Agent Query Understanding and LLM-Based Reranking for Chinese Statute Retrieval

LegalMALR:多代理查询理解与基于大语言模型的重排序法用于中文法律条文检索

Yunhan Li, Mingjie Xie, Gaoli Kang, Zihan Gong, Gengshen Wu, Min Yang

机构 * Faculty of Data Science(数据科学学院) City University of Macau(澳门城市大学) Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology(深圳先进技术研究所) Chinese Academy of Sciences(中国科学院) Southern University of Science and Technology(南方科技大学) Artificial Intelligence Research Institute(人工智能研究院) Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 LegalMALR通过多代理查询理解和大语言模型重排序技术,提升中文法律条文检索的准确性和适用性。

Comments 31pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17399 2026-01-27 cs.CV cs.AI 57%

ReLE: A Scalable System and Structured Benchmark for Diagnosing Capability Anisotropy in Chinese LLMs

ReLE:一种可扩展的系统和结构化基准,用于诊断中文大语言模型的能力异质性

Rui Fang, Jian Li, Wei Chen, Bin Hu, Ying-Cong Chen, Xin Tang, Liang Diao

机构 * Sun Yat-sen University(中山大学) ReLE Benchmark Team(ReLE基准团队) NSFOCUS Technologies Co., Ltd.(NSFOCUS技术有限公司) HKUST-GZ(香港科技大学-广州) Huawei(华为) Ping An Property & Casualty Insurance Company of China, Ltd(平安财产保险股份有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ReLE通过可扩展系统和结构化基准诊断中文大语言模型的能力异质性,提升评估效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏