arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-27 至 2026-01-27 共收录 162 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 21 篇

2601.17971 2026-01-27 cs.CL 57%

LLMs as Cultural Archives: Cultural Commonsense Knowledge Graph Extraction

LLMs作为文化档案:文化常识知识图谱提取

Junior Cedric Tonga, Chen Cecilia Liu, Iryna Gurevych, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Ubiquitous Knowledge Processing Lab (UKP Lab)(无处不在知识处理实验室) Department of Computer Science(计算机科学系) Hessian Center for AI (hessian.AI)(黑森人工智能中心) Technische Universität Darmstadt(德累斯顿技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种基于提示的框架,用于构建文化常识知识图谱,通过LLMs作为文化档案提取文化特定知识,提升文化推理和故事生成性能。

Comments EACL 2026 MAIN

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17735 2026-01-27 cs.AI 57%

ReFuGe: Feature Generation for Prediction Tasks on Relational Databases with LLM Agents

ReFuGe:基于LLM代理的关联数据库预测任务特征生成

Kyungho Kim, Geon Lee, Juyeon Kim, Dongwon Choi, Shinhwan Kang, Kijung Shin

机构 * KAIST(韩国科学技术院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 ReFuGe通过LLM代理生成关联数据库预测任务的特征,提升预测性能。

Comments Accepted in ACM WWW 2026 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14047 2026-01-27 cs.GT cs.AI cs.MA cs.SI econ.TH 57%

Collective intelligence in science: direct elicitation of diverse information from experts with unknown information structure

科学中的集体智慧:通过未知信息结构直接获取专家多样化信息

Alexey V. Osipov, Nikolay N. Osipov

机构 * Swiss Re Institute(瑞士再保险学院) St. Petersburg State University(圣彼得堡国立大学) St. Petersburg Department of V. A. Steklov Institute of Mathematics of the Russian Academy of Sciences(俄罗斯科学院圣彼得堡维克托·阿列克谢耶维奇·斯捷克洛夫数学研究所圣彼得堡分所) HSE University(俄罗斯高等经济大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 通过结合预测市场和聊天机制,实现专家在未知信息结构下高效共享信息,从而提升科学问题的集体分析效率。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04861 2026-01-27 cs.AI 57%

Orchestrating Intelligence: Confidence-Aware Routing for Efficient Multi-Agent Collaboration across Multi-Scale Models

协调智能:基于置信度的路由机制用于高效多智能体协作跨多尺度模型

Jingbo Wang, Sendong Zhao, Jiatong Liu, Haochun Wang, Wanting Li, Bing Qin, Ting Liu

机构 * Research Center for Social Computing and Information Retrieval, Harbin Institute of Technology, China(社会科学与信息检索研究中心,哈尔滨工业大学,中国) the Institute of Automation of the Chinese Academy of Sciences, China(中国科学院自动化研究所,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 OI-MAS通过基于置信度的路由机制,实现高效多智能体协作,提升准确率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11266 2026-01-27 cs.SE cs.AI 57%

Live API-Bench: 2500+ Live APIs for Testing Multi-Step Tool Calling

Benjamin Elder, Anupama Murthi, Jungkoo Kang, Ankita Rajaram Naik, Kiran Kate, Kinjal Basu, Danish Contractor

机构 * IBM Research AI(IBM人工智能研究实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

Comments 11+32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04058 2026-01-27 cs.GR cs.CV 50%

SMooGPT: Stylized Motion Generation using Large Language Models

SMooGPT:利用大语言模型进行风格化动作生成

Lei Zhong, Yi Yang, Changjian Li

机构 * University of Edinburgh(爱丁堡大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 SMooGPT通过利用大语言模型的推理、组合和生成能力,实现风格化动作生成,提升动作控制和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17997 2026-01-27 physics.app-ph 50%

Generative metamaterials based on large language models

基于大语言模型的生成超材料

Zhenyang Gao, Gengchen Zheng, Pengyuan Ren, Hongsong Wang, Kun Zhou, Minh-Son Pham, Yi Wu, Yu Zou, Chu Lun Alex Leung, Yuanyuan Tian, Yang Lu, Haowei Wang, Hongze Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 基于大语言模型开发生成超材料设计工具,实现快速高效的设计生成与诊断进化,推动高通量超材料发现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 37 篇

2510.14305 2026-01-27 cs.CL 85%

MathMist: A Parallel Multilingual Benchmark Dataset for Mathematical Problem Solving and Reasoning

MathMist: 一种用于数学问题解决和推理的平行多语言基准数据集

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Tasnim Mohiuddin, Md Mofijul Islam, Swakkhar Shatabda

机构 * BRAC University(布拉克大学) United International University(国际联合大学) Qatar Computing Research Institute(卡塔尔计算研究所) Center for Computational & Data Sciences, Independent University, Bangladesh(计算与数据科学中心,独立大学,孟加拉国) Amazon GenAI(亚马逊生成人工智能) University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 MathMist是一个用于评估多语言数学推理能力的平行多语言基准数据集,涵盖多种语言和资源设置,测试了不同模型在零样本、链式思维等范式下的表现。

Comments Accepted for publication in Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13742 2026-01-27 cs.CL 83%

Hearing Between the Lines: Unlocking the Reasoning Power of LLMs for Speech Evaluation

在行之间倾听:解锁LLMs对语音评估的推理能力

Arjun Chandra, Kevin Miller, Venkatesh Ravichandran, Constantinos Papayiannis, Venkatesh Saligrama

机构 * Boston University(波士顿大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 TRACE框架通过文本推理音频线索,实现低成本且与人类一致的语音评估。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00555 2026-01-27 cs.LG cs.AI cs.CL cs.CV 82%

MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning

MMedAgent-RL: 优化多智能体协作以实现多模态医疗推理

Peng Xia, Jinglu Wang, Yibo Peng, Kaide Zeng, Zihan Dong, Xian Wu, Xiangru Tang, Hongtu Zhu, Yun Li, Linjun Zhang, Shujie Liu, Yan Lu, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Research(微软研究院) CMU(卡内基梅隆大学) Rutgers University(罗格斯大学) Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MMedAgent-RL通过强化学习优化多智能体协作,提升多模态医疗推理性能,实现23.6%的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10132 2026-01-27 cs.AI cs.LG 81%

Is More Context Always Better? Examining LLM Reasoning Capability for Time Interval Prediction

更多上下文总是更好吗?检验LLM在时间间隔预测中的推理能力

Yanan Cao, Farnaz Fallahi, Murali Mohana Krishna Dandu, Lalitesh Morishetti, Kai Zhao, Luyi Ma, Sinduja Subramaniam, Jianpeng Xu, Evren Korpeoglu, Kaushiki Nag, Sushant Kumar, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM在时间间隔预测中的推理能力,发现尽管LLM在某些任务中表现良好,但其在捕捉定量时间结构方面存在局限,且过多上下文反而可能降低性能。

Comments Accepted at The Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15338 2026-01-27 cs.AI cs.CL 81%

HeartLLM: Discretized ECG Tokenization for LLM-Based Diagnostic Reasoning

HeartLLM: 12导联心电图离散化编码用于基于大语言模型的诊断推理

Jinning Yang, Wenjie Sun, Wen Shi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 HeartLLM通过离散化ECG信号生成令牌,使LLM能处理心电图与自然语言输入,实现医疗诊断推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18356 2026-01-27 cs.LG 79%

Making medical vision-language models think causally across modalities with retrieval-augmented cross-modal reasoning

通过检索增强的跨模态推理使医疗视觉-语言模型在多模态中实现因果推理

Weiqin Yang, Haowen Xue, Qingyi Peng, Hexuan Hu, Qian Huang, Tingbo Zhang

机构 * University of Adelaide(阿德莱德大学) Hohai University(河海大学) Amap

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出多模态因果检索增强生成框架,通过整合因果推理原理与多模态检索,提升医疗VLMs在诊断预测和视觉问答中的事实准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18204 2026-01-27 cs.CL 79%

MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning

MemWeaver: 为可追溯的长 horizon 代理推理编织混合记忆

Juexiang Ye, Xue Li, Xinyu Yang, Chengkai Huang, Lanshun Nie, Lina Yao, Dechen Zhan

机构 * Harbin Institute of Technology(哈尔滨理工大学) The University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织Data61)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MemWeaver通过编织混合记忆系统,提升长 horizon 代理推理的准确性与可追溯性,减少输入上下文长度

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18132 2026-01-27 cs.AI 79%

RareAlert: Aligning heterogeneous large language model reasoning for early rare disease risk screening

RareAlert: 对齐异构大语言模型推理以实现早期罕见病风险筛查

Xi Chen, Hongru Zhou, Huahui Yi, Shiyu Feng, Hanyu Zhou, Tiancheng He, Mingke You, Li Wang, Qiankun Li, Kun Wang, Weili Fu, Kang Li, Jian Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 RareAlert通过整合多个LLM推理并校准后生成单一模型,实现早期罕见病风险筛查,其AUC达到0.917,优于现有方法。

Comments 28 page, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13545 2026-01-27 cs.AI cs.ET cs.MA 79%

TruthTensor: Evaluating LLMs through Human Imitation on Prediction Market under Drift and Holistic Reasoning

TruthTensor:通过人类模仿在预测市场中评估LLM的漂移和整体推理

Shirin Shahabi, Spencer Graham, Haruna Isah

机构 * Inference Labs Inc(Inference Labs公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TruthTensor通过人类模仿在预测市场中评估LLM的漂移和整体推理,提供多维度的评估方法。

Comments 16 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13095 2026-01-27 cs.CL 79%

BeDiscovER: The Benchmark of Discourse Understanding in the Era of Reasoning Language Models

BeDiscovER:推理语言模型时代 discourse 理解的基准

Chuyuan Li, Giuseppe Carenini

机构 * Department of Computer Science University of British Columbia(计算机科学系加拿大不列颠哥伦比亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 BeDiscovER是一个用于评估推理语言模型 discourse 理解能力的基准,涵盖多个 discourse 任务,评估了多个开源模型的表现。

Comments Camera-ready version of eacl 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17418 2026-01-27 cs.HC 78%

GraphPilot: GUI Task Automation with One-Step LLM Reasoning Powered by Knowledge Graph

GraphPilot: 基于知识图谱的GUI任务自动化:由LLM推理一步完成

Mingxian Yu, Siqi Luo, Xu Chen

专题命中 推理评测 :reasoning(title,abstract)

AI总结 GraphPilot通过基于知识图谱的LLM推理一步完成GUI任务自动化,显著提升任务完成率并降低延迟。

Comments This paper is accepted by the Journal of Intelligent Computing and Networking (JICN) for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18754 2026-01-27 cs.CR cs.AI 70%

$α^3$-SecBench: A Large-Scale Evaluation Suite of Security, Resilience, and Trust for LLM-based UAV Agents over 6G Networks

$α^3$-SecBench:一个大规模评估套件,用于评估基于LLM的无人机代理在6G网络中的安全、韧性与信任

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿拉伯联合酋长国大学) Khalifa University of Science and Technology(科学与技术喀拉奇大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 $α^3$-SecBench通过大规模评估基于LLM的无人机代理在6G网络中的安全、韧性和信任,揭示了现有模型在对抗环境下的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17814 2026-01-27 cs.AI 70%

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

MMR-Bench: 多模态大语言模型路由的综合基准

Haoxuan Ma, Guannan Lai, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 推理评测 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18779 2026-01-27 cs.LG cs.AI cs.CL 67%

POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration

POPE: 通过优先级在线探索学习解决难题

Yuxiao Qu, Amrith Setlur, Virginia Smith, Ruslan Salakhutdinov, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 POPE 通过利用优先级信息指导在线探索,解决难题推理中的探索问题,提升模型在复杂任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08235 2026-01-27 cs.AI cs.CL 62%

MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents

MPCI-Bench: 一种用于语言模型代理多模态成对情境完整性评估的基准

Shouju Wang, Haopeng Zhang

机构 * University of Hawaii at Manoa(夏威夷大学曼瑙分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MPCI-Bench是首个用于评估语言模型代理多模态情境完整性隐私行为的基准,揭示了现有模型在隐私与效用平衡及模态泄漏方面的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19005 2026-01-27 cs.AI cs.CL 62%

Building Self-Evolving Agents via Experience-Driven Lifelong Learning: A Framework and Benchmark

通过经验驱动的终身学习构建自进化代理:一种框架和基准

Yuxuan Cai, Yipeng Hao, Jie Zhou, Hang Yan, Zhikai Lei, Rui Zhen, Zhenhua Han, Yutao Yang, Junsong Li, Qianjun Pan, Tianyu Huai, Qin Chen, Xin Li, Kai Chen, Bo Zhang, Xipeng Qiu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of HongKong(香港中文大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出经验驱动的终身学习框架和StuLife基准数据集,旨在构建能够持续学习和进化的自进化代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17364 2026-01-27 cs.CL cs.AI 62%

Parameter Efficient Fine Tuning Llama 3.1 for Answering Arabic Legal Questions: A Case Study on Jordanian Laws

为回答阿拉伯法律问题高效微调Llama 3.1:对约旦法律的案例研究

Mohammed Fasha, Bassam Hammo, Bilal Sowan, Husam Barham, Esam Nsour

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过高效微调Llama 3.1模型,针对阿拉伯法律问题进行案例研究,展示了在资源效率和法律推理准确性方面的改进。

Comments 5 pages, resources at: https://github.com/msfasha/Research-Resources/tree/main/ArabicLegalLLM

Journal ref 2025 1st International Conference on Computational Intelligence Approaches and Applications (ICCIAA), Amman, Jordan, 2025, pp. 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10994 2026-01-27 cs.CL cs.AI 62%

Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety

基于开放领域评估和多阶段防护机制的深度研究

Wei-Chieh Huang, Henry Peng Zou, Yaozu Wu, Dongyuan Li, Yankai Chen, Weizhi Zhang, Yangning Li, Angelo Zangari, Jizhou Guo, Chunyu Miao, Liancheng Fang, Langzhou He, Yinghui Li, Renhe Jiang, Philip S. Yu

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DeepResearchGuard和DRSafeBench,通过开放领域评估和多阶段防护机制提升深度研究的安全性和报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20347 2026-01-27 cs.CL cs.AI 62%

SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data

SeRL:基于有限数据的大型语言模型自我对抗强化学习

Wenkai Fang, Shunyu Liu, Yang Zhou, Kongcheng Zhang, Tongya Zheng, Kaixuan Chen, Mingli Song, Dacheng Tao

机构 * Zhejiang University(浙江大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Hangzhou City University(杭州城市大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SeRL通过自我指令和自我奖励机制,在有限数据条件下提升大型语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08905 2026-01-27 cs.AI cs.CL 62%

Grounding Synthetic Data Evaluations of Language Models in Unsupervised Document Corpora

在无监督文档语料中使语言模型的合成数据评估接地

Michael Majurski, Cynthia Matuszek

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种自动化方法,利用文档语料生成事实性合成数据评估,以提高语言模型在无监督文档中的评估效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18334 2026-01-27 cs.CL 57%

Overalignment in Frontier LLMs: An Empirical Study of Sycophantic Behaviour in Healthcare

前沿大语言模型中的过度趋同:医疗领域中趋炎附势行为的实证研究

Clément Christophe, Wadood Mohammed Abdul, Prateek Munjal, Tathagata Raha, Ronnie Rajan, Praveenkumar Kanithi

机构 * M42, Abu Dhabi(阿布扎比M42)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过实证研究揭示前沿大语言模型在医疗领域中因趋炎附势行为导致的过度迎合问题,并提出调整后的趋炎附势评分以评估模型的抗性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13358 2026-01-27 cs.CL 57%

Bridging the Editing Gap in LLMs: FineEdit for Precise and Targeted Text Modifications

弥合大语言模型的编辑差距:FineEdit用于精确且有针对性的文本修改

Yiming Zeng, Wanhao Yu, Zexin Li, Tao Ren, Yu Ma, Jinghan Cao, Xiyan Chen, Tingting Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 FineEdit通过专门训练的编辑模型,实现了在多领域中的精确文本修改,显著提升了单轮和多轮编辑任务的性能。

Comments We resolved some issues in this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00435 2026-01-27 cs.AI cs.HC cs.RO 57%

Towards Real-time Adaptation of Embodied Agent in Human-Robot Collaboration

面向人机协作中具身代理的实时适应

Shipeng Liu, Boshen Zhang, Zhehui Huang

机构 * University of Southern California Department of Electrical(南加州大学电气与计算机工程系) University of Southern California Department of Computer Science Los Angeles CA USA(南加州大学计算机科学系洛杉矶加州美国) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MonTA框架,通过轻量级监控和高效适配器提升人机协作中具身代理的实时适应能力,实现更高效的协作性能。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏