arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-27 至 2026-01-27 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 28 篇

2511.15169 2026-01-27 cs.AI 85%

SafeRBench: Dissecting the Reasoning Safety of Large Language Models

SafeRBench: 解析大语言模型推理安全性的本质

Xin Gao, Shaohan Yu, Zerui Chen, Yueming Lyu, Weichen Yu, Guanghao Li, Jiyao Liu, Jianxiong Gao, Jian Liang, Ziwei Liu, Chenyang Si

机构 * Nanjing University(南京大学) Fudan University(复旦大学) Carnegie Mellon University(卡内基梅隆大学) Chinese Academy of Sciences(中国科学院) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 SafeRBench通过端到端评估方法解析大语言模型推理过程中的安全性问题,提出风险分层探测、微思维分析和10项细粒度指标,揭示大模型在增强安全性的同时可能增加可操作风险的悖论。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17564 2026-01-27 cs.AI cs.LG 81%

JaxARC: A High-Performance JAX-based Environment for Abstraction and Reasoning Research

JaxARC: 一种基于JAX的高性能环境,用于抽象和推理研究

Aadam, Monu Verma, Mohamed Abdel-Mottaleb

机构 * Luddy School of Informatics, Computing, and Engineering(信息学、计算与工程学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 JaxARC是一种基于JAX的高性能强化学习环境,用于支持大规模抽象与推理研究,通过大规模并行和高吞吐量提升实验效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17197 2026-01-27 cs.CL cs.LG 81%

Reasoning Beyond Literal: Cross-style Multimodal Reasoning for Figurative Language Understanding

超越字面:跨风格多模态推理用于隐喻语言理解

Seyyed Saeid Cheshmi, Hahnemann Ortiz, James Mooney, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种三步框架,通过跨风格多模态推理提升隐喻语言理解能力,实验显示推理轨迹和跨风格训练能显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18091 2026-01-27 cs.LG 79%

From LLMs to LRMs: Rethinking Pruning for Reasoning-Centric Models

从大语言模型到大推理模型:重新思考面向推理中心模型的剪枝

Longwei Ding, Anhao Zhao, Fanghua Ye, Ziyang Chen, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学) Tencent Hunyuan / AI Lab(腾讯文英/人工智能实验室) Université Paris Dauphine - PSL(巴黎-萨克勒大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文研究了推理增强模型的剪枝策略,发现深度剪枝在分类任务中表现更优,而宽度剪枝在生成和推理中更稳健,静态剪枝更利于保持推理性能。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17467 2026-01-27 cs.LG 79%

Harnessing Reasoning Trajectories for Hallucination Detection via Answer-agreement Representation Shaping

通过答案一致性表示塑造进行推理轨迹的幻觉检测

Jianxiong Zhang, Bing Guo, Yuming Jiang, Haobo Wang, Bo An, Xuefeng Du

机构 * College of Computer Science, Sichuan University, China(四川大学计算机学院) School of Software Technology, Zhejiang University, China(浙江大学软件学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学 computing and Data Science学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出ARS方法,通过塑造答案一致性表示来提高推理轨迹中幻觉检测的准确性,无需人工标注即可提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22860 2026-01-27 cs.CL q-bio.NC 79%

Far from the Shallow: Brain-Predictive Reasoning Embedding through Residual Disentanglement

远离浅层:通过残差解耦实现脑预测推理嵌入

Linyang He, Tianjun Zhong, Richard Antonello, Gavin Mischler, Micah Goldblum, Nima Mesgarani

机构 * Zuckerman Mind Brain Behavior Institute, Columbia University(扎克曼脑行为研究所,哥伦比亚大学) Department of Electrical Engineering, Columbia University(电气工程系,哥伦比亚大学) Department of Computer Science, Columbia University(计算机科学系,哥伦比亚大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过残差解耦方法,研究实现了对语言推理过程的神经嵌入解耦,揭示了推理在大脑中的独特预测能力及时间特征。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10769 2026-01-27 cs.CL 79%

Mind the Gap: Benchmarking LLM Uncertainty and Calibration with Specialty-Aware Clinical QA and Reasoning-Based Behavioural Features

注意差距:基于专业意识的临床QA和推理行为特征的LLM不确定性与校准基准测试

Alberto Testoni, Iacer Calixto

机构 * Department of Medical Informatics, Amsterdam University Medical Center, University of Amsterdam, Amsterdam, The Netherlands(医学信息学系,阿姆斯特丹大学医学中心,阿姆斯特丹大学,阿姆斯特丹,荷兰) Amsterdam Public Health, Methodology, Amsterdam, The Netherlands(阿姆斯特丹公共健康,方法学,阿姆斯特丹,荷兰)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过评估不同临床专科和问题类型的LLM不确定性校准,提出基于行为特征的新型轻量方法,强调选择互补模型的重要性。

Comments Accepted at EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18386 2026-01-27 cs.CV 78%

ARMOR: Agentic Reasoning for Methods Orchestration and Reparameterization for Robust Adversarial Attacks

ARMOR: 为对抗攻击的鲁棒性进行方法编排与重参数化中的代理推理

Gabriel Lee Jun Rong, Christos Korgialas, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

专题命中 其他推理 :reasoning(title,abstract)

AI总结 ARMOR通过视觉语言模型引导的代理协作,提升对抗攻击的鲁棒性和跨架构迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18044 2026-01-27 cs.SE 78%

RGFL: Reasoning Guided Fault Localization for Automated Program Repair Using Large Language Models

RGFL:基于大语言模型的自动化程序修复中的推理引导故障定位

Melika Sepidband, Hamed Taherkhani, Hung Viet Pham, Hadi Hemmati

专题命中 其他推理 :reasoning(title,abstract)

AI总结 RGFL通过引入分层推理模块和反事实分析,提升自动化程序修复中的文件和元素级故障定位精度,显著提高修复成功率。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15331 2026-01-27 cs.HC 78%

DesignerlyLoop: Forming Design Intent through Curated Reasoning for Human-LLM Alignment

DesignerlyLoop: 通过精选推理形成设计意图以实现人-大语言模型对齐

Anqi Wang, Zhengyi Li, Xin Tong, Pan Hui

专题命中 其他推理 :reasoning(title,abstract)

AI总结 DesignerlyLoop通过精选推理提升人-大语言模型在设计任务中的对齐,改进设计质量和创造力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15304 2026-01-27 cs.IR 78%

MLLMRec: A Preference Reasoning Paradigm with Graph Refinement for Multimodal Recommendation

MLLMRec: 基于图细化的多模态推荐偏好推理范式

Yuzhuo Dang, Xin Zhang, Zhiqiang Pan, Yuxiao Duan, Wanyu Chen, Fei Cai, Honghui Chen

专题命中 其他推理 :reasoning(title,abstract)

AI总结 MLLMRec通过图细化和多模态大语言模型提升多模态推荐的用户偏好推理与物品表示学习准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18582 2026-01-27 cs.CL 74%

From Classification to Ranking: Enhancing LLM Reasoning Capabilities for MBTI Personality Detection

从分类到排序:提升LLM推理能力以进行MBTI性格检测

Yuan Cao, Feixiang Liu, Xinyue Wang, Yihan Zhu, Hui Xu, Zheng Wang, Qiang Qiu

专题命中 其他推理 :reasoning(title);分类 cs.CL

AI总结 本文提出将性格检测视为排序任务,通过改进的强化学习方法提升LLM在MBTI性格检测中的推理能力。

Comments 9 pages, 4 figures, AAAI 2026 Bridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16815 2026-01-27 cs.CL cs.AI 73%

Knowing the Facts but Choosing the Shortcut: Understanding How Large Language Models Compare Entities

知晓事实却选择捷径:理解大型语言模型如何比较实体

Hans Hergen Lehmann, Jae Hee Lee, Steven Schockaert, Stefan Wermter

机构 * University of Hamburg(汉堡大学) Cardiff University(卡迪夫大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大型语言模型在比较实体时更依赖数值知识,而小型模型则受启发式偏差影响,通过链式思考提示可引导模型更依赖数值特征。

Comments 34 pages, 20 figures. Accepted for EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11031 2026-01-27 cs.LG cs.AI cs.CL 67%

Prefill-Guided Thinking for zero-shot detection of AI-generated images

预填充引导的思考用于AI生成图像的零样本检测

Zoher Kachwala, Danishjeet Singh, Danielle Yang, Filippo Menczer

机构 * Observatory on Social Media(社会媒体观察所) Indiana University(印第安纳大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出预填充引导思考方法,通过引导视觉-语言模型推理提升AI生成图像的零样本检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17699 2026-01-27 cs.AI cs.CL 62%

SQL-Trail: Multi-Turn Reinforcement Learning with Interleaved Feedback for Text-to-SQL

SQL-Trail: 多轮强化学习与交错反馈用于文本到SQL

Harper Hua, Zhen Han, Zhengyuan Shen, Jeremy Lee, Patrick Guan, Qi Zhu, Sullam Jeoung, Yueyan Chen, Yunfei Bai, Shuai Wang, Vassilis Ioannidis, Huzefa Rangwala

机构 * Stanford University(斯坦福大学) Amazon Web Services(亚马逊网络服务)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SQL-Trail通过多轮强化学习与交错反馈提升文本到SQL的生成能力,实现更高效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18102 2026-01-27 cs.CL 57%

CHiRPE: A Step Towards Real-World Clinical NLP with Clinician-Oriented Model Explanations

CHiRPE:迈向真实世界临床NLP的一步:面向临床医生的模型解释

Stephanie Fong, Zimu Wang, Guilherme C. Oliveira, Xiangyu Zhao, Yiwen Jiang, Jiahe Liu, Beau-Luke Colton, Scott Woods, Martha E. Shenton, Barnaby Nelson, Zongyuan Ge, Dominic Dwyer

机构 * Orygen and The University of Melbourne(Orygen和墨尔本大学) AIM for Health Lab, Monash University(AIM for Health实验室,墨尔本大学) University of Liverpool(利物浦大学) Yale School of Medicine, Yale University(耶鲁医学院,耶鲁大学) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里奇沃特医院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 CHiRPE通过临床医生共同开发的新型SHAP解释格式,实现了高准确率的临床风险预测,并展示了临床指导的模型开发在真实世界中的应用潜力。

Comments This paper is accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17897 2026-01-27 cs.AI 57%

UniCog: Uncovering Cognitive Abilities of LLMs through Latent Mind Space Analysis

UniCog: 通过潜在思维空间分析揭示大语言模型的认知能力

Jiayu Liu, Yinhe Long, Zhenya Huang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 UniCog通过潜在思维空间分析揭示大语言模型的认知能力,提出统一框架并提升推理性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17542 2026-01-27 cs.AI cs.SE 57%

Cognitive Platform Engineering for Autonomous Cloud Operations

认知平台工程用于自主云操作

Vinoth Punniyamoorthy, Nitin Saksena, Srivenkateswara Reddy Sankiti, Nachiappan Chockalingam, Aswathnarayan Muthukrishnan Kirubakaran, Shiva Kumar Reddy Carimireddy, Durgaraman Maruthavanan

机构 * IEEE Senior Texas USA(IEEE高级工程师,得克萨斯州,美国) Albertsons Companies California USA(Albertsons公司,加利福尼亚州,美国) Cleveland State University Ohio USA(克利夫兰州立大学,俄亥俄州,美国) IEEE Senior Massachusetts USA(IEEE高级工程师,马萨诸塞州,美国) IEEE Senior California USA(IEEE高级工程师,加利福尼亚州,美国)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出认知平台工程,通过整合感知、推理和自主行动,提升云操作的自动化与智能化水平,实现更高效的云环境管理。

Journal ref International Journal of Computer Applications. 187, 72 ( Jan 2026), 17-23

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17530 2026-01-27 cs.CL 57%

Revealing the Truth with ConLLM for Detecting Multi-Modal Deepfakes

用ConLLM揭示真相以检测多模态深度伪造

Gautam Siddharth Kashyap, Harsh Joshi, Niharika Jain, Ebad Shabbir, Jiechao Gao, Nipun Joshi, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Bharati Vidyapeeth’s College Of Engineering(巴里蒂大学工程学院) Vivekananda Institute of Professional Studies (VIPS)(维维kananda专业研究学院) DSEU-Okhla Center for SDGC(SDGC研究中心) Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 ConLLM通过对比学习和大语言模型推理,有效提升多模态深度伪造检测的准确率和泛化能力。

Comments Accepted at EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17008 2026-01-27 cs.LG 57%

Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs

Turn-PPO:基于PPO的回合级优势估计以提升代理语言模型中的多回合强化学习

Junbo Li, Peng Zhou, Rui Meng, Meet P. Vadera, Lihong Li, Yang Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Amazon(亚马逊)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出turn-PPO,通过回合级MDP公式化提升多回合强化学习在代理语言模型中的表现,验证其在WebShop和Sokoban数据集上的有效性。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19113 2026-01-27 cs.CL 57%

Argument-Based Consistency in Toxicity Explanations of LLMs

基于论证的一致性:大语言模型毒性解释的评估

Ramaravind Kommiya Mothilal, Joanna Roy, Syed Ishtiaque Ahmed, Shion Guha

机构 * University of Toronto(多伦多大学) trail-ml

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出基于论证的一致性标准,评估大语言模型对毒性的推理能力,发现其在复杂关系下的解释不一致。

Comments 29 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11740 2026-01-27 cs.LG cs.CV 57%

Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent

通过模态解耦梯度下降缓解MLLM指令微调中的视觉知识遗忘

Junda Wu, Yuxin Xiong, Xintong Li, Yu Xia, Ruoyu Wang, Yu Wang, Tong Yu, Sungchul Kim, Ryan A. Rossi, Lina Yao, Jingbo Shang, Julian McAuley

机构 * UC San Diego(加州大学圣迭戈分校) University of New South Wales(新南威尔士大学) Adobe Research(Adobe研究)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出模态解耦梯度下降方法,通过有效秩量化视觉退化并缓解过度压缩,保留预训练视觉知识并提升任务适应能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17084 2026-01-27 physics.chem-ph cs.AI physics.comp-ph 57%

ChemNavigator: Agentic AI Discovery of Design Rules for Organic Photocatalysts

ChemNavigator: 基于代理AI的有机光催化剂设计规则发现

Iman Peivaste, Ahmed Makradi, Salim Belouettar

机构 * Luxembourg Institute of Science and Technology (LIST)(卢森堡科学技术研究所) University of Luxembourg(卢森堡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 ChemNavigator通过代理AI自主发现有机光催化剂设计规则,推导出六个化学基础设计原则,为AI辅助材料发现提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18240 2026-01-27 cs.CV 50%

V-Loop: Visual Logical Loop Verification for Hallucination Detection in Medical Visual Question Answering

V-Loop:用于医学视觉问答中幻觉检测的视觉逻辑循环验证

Mengyuan Jin, Zehui Liao, Yong Xia

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 V-Loop通过双向推理和视觉逻辑循环验证,提升医学视觉问答中幻觉检测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18239 2026-01-27 cs.HC 50%

Probing the Future of Meta-Analysis: Eliciting Design Principles via an Agentic Research IDE

探索元分析的未来:通过代理研究IDE eliciting设计原则

Sizhe Cheng, Feng Liang, Yuhan Wen, Xipei Yu, Yong Wang

专题命中 其他推理 :reasoning(abstract)

AI总结 Research IDE通过'研究作为代码'隐喻,提供一种多代理后端支持的写作环境,通过'假设断点'实现现场验证,提升研究人员的自主权和智力所有权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17627 2026-01-27 cs.SE 50%

Code Change Characteristics and Description Alignment: A Comparative Study of Agentic versus Human Pull Requests

代码变更特征与描述对齐:代理与人类拉取请求的比较研究

Dung Pham, Taher A. Ghaleb

专题命中 其他推理 :reasoning(abstract)

AI总结 研究比较了代理与人类生成的拉取请求在代码变更特征和描述质量上的差异,发现代理在提交级消息质量上表现更好,但在PR级总结上不如人类,揭示了代理在微观精确性与宏观沟通之间的差距。

Comments Accepted at the 23rd International Conference on Mining Software Repositories (MSR '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20844 2026-01-27 cs.MA 50%

TrustResearcher: Automating Knowledge-Grounded and Transparent Research Ideation with Multi-Agent Collaboration

TrustResearcher: 通过多智能体协作实现知识导向且透明的研究构想自动化

Jiawei Zhou, Ruicheng Zhu, Mengshi Chen, Jianwei Wang, Kai Wang

专题命中 其他推理 :reasoning(abstract)

AI总结 TrustResearcher通过多智能体协作实现知识导向且透明的研究构想自动化,提供可配置的智能体和证据一致的构想生成。

Comments Accepted to The Web Conference (WWW) 2026 as a demo paper. 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10978 2026-01-27 cs.IR 50%

Does LLM Focus on the Right Words? Mitigating Context Bias in LLM-based Recommenders

LLM是否聚焦在正确的词语?基于组分布鲁棒优化的推荐系统去偏方法

Bohao Wang, Jiawei Chen, Feng Liu, Changwang Zhang, Jun Wang, Canghong Jin, Chun Chen, Can Wang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出GDRT方法,通过组分布鲁棒优化减轻LLM推荐系统中的上下文偏见,提升推荐准确性和公平性。

Comments Accepted by WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏