arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5817 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5817 篇

2601.16853 2026-01-26 cs.AI cs.CL 81%

Reasoning Promotes Robustness in Theory of Mind Tasks

推理促进理论思维任务的鲁棒性

Ian B. de Haan, Peter van der Putten, Max van Duijn

机构 * LIACS, Leiden University(莱顿大学人工智能与计算科学研究所)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理导向的LLMs在理论思维任务中的鲁棒性,发现其在提示变化和任务扰动中表现更稳定,认为鲁棒性提升源于解决正确问题的能力增强而非新的推理形式。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14658 2026-01-22 cs.CL cs.AI 81%

Say Anything but This: When Tokenizer Betrays Reasoning in LLMs

说任何事但并非如此:当分词器背叛大语言模型的推理

Navid Ayoobi, Marcus I Armstrong, Arjun Mukherjee

机构 * University of Houston(休斯顿大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现分词器的不一致导致LLM推理错误,通过一致性探针揭示了分词引起的表征缺陷,并提出分词层面的修复方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17523 2026-01-16 cs.CL cs.AI 81%

Bayesian Teaching Enables Probabilistic Reasoning in Large Language Models

贝叶斯教学使大语言模型具备概率推理能力

Linlu Qiu, Fei Sha, Kelsey Allen, Yoon Kim, Tal Linzen, Sjoerd van Steenkiste

机构 * MIT(麻省理工学院) Meta Google(谷歌公司) DeepMind University of British Columbia(不列颠哥伦比亚大学深度思维学院) Vector Institute(向量研究所) New York University(纽约大学) Google Research(谷歌研究)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过教学使大语言模型模仿贝叶斯模型预测,提升其概率推理能力并推广至新任务。

Comments Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09855 2026-01-16 cs.AI cs.CL 81%

Thinking Long, but Short: Stable Sequential Test-Time Scaling for Large Reasoning Models

深入思考,但简短:大型推理模型的稳定序列测试时间扩展

Michael R. Metel, Yufei Cui, Boxing Chen, Prasanna Parthasarathi

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Min-Seek方法,通过高效管理KV缓存实现大型推理模型在扩展推理长度时的稳定性与准确性提升。

Comments Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03697 2026-01-15 cs.LG cs.AI cs.AR 81%

AnaFlow: Agentic LLM-based Workflow for Reasoning-Driven Explainable and Sample-Efficient Analog Circuit Sizing

AnaFlow: 基于代理的LLM工作流:以推理驱动的可解释且样本高效的模拟电路尺寸设计

Mohsen Ahmadzadeh, Kaichang Chen, Georges Gielen

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 AnaFlow通过基于代理的LLM工作流实现高效、可解释的模拟电路尺寸设计,利用人类可理解的推理和自适应仿真策略,提升设计效率和透明度。

Comments This article was accepted by 2025 International Conference on Computer-Aided Design (ICCAD 2025) and was presented in Munich, October 2025

Journal ref Proc. 2025 IEEE/ACM International Conference on Computer-Aided Design (ICCAD) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09280 2026-01-15 cs.CL cs.AI 81%

ReGraM: Region-First Knowledge Graph Reasoning for Medical Question Answering

ReGraM:面向医疗问答的区域优先知识图谱推理

Chaerin Lee, Sohee Park, Hyunsik Na, Daseon Choi

机构 * Department of Software, Soongsil University(软件系,顺斯大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ReGraM通过区域优先的知识图谱推理框架,提升医疗问答的准确性和一致性。

Comments 18 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08873 2026-01-15 cs.CV cs.AI cs.LG cs.MM 81%

ForensicFormer: Hierarchical Multi-Scale Reasoning for Cross-Domain Image Forgery Detection

ForensicFormer: 基于层次多尺度推理的跨领域图像伪造检测

Hema Hariharan Samson

机构 * Independent Researcher(独立研究者)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 ForensicFormer通过层次多尺度推理框架,实现跨领域图像伪造检测的高准确率与鲁棒性,显著提升对AI生成图像的检测能力。

Comments 9 pages, 4 figures, 5 tables. Technical report on hierarchical multi-scale image forgery detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02163 2026-01-12 cs.AI cs.CL 81%

EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning

EverMemOS:一种用于结构化长时程推理的自组织记忆操作系统

Chuanrui Hu, Xingze Gao, Zuyi Zhou, Dannong Xu, Yi Bai, Xintong Li, Hui Zhang, Tong Li, Chong Zhang, Lidong Bing, Yafeng Deng

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 EverMemOS通过自组织记忆系统提升长时程推理能力,实现事件轨迹捕捉、语义整合与重构性回忆,有效增强记忆增强推理任务的性能。

Comments 16 pages, 7 figures, 12 tables. Code available at https://github.com/EverMind-AI/EverMemOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05019 2026-01-09 cs.CL cs.AI q-bio.NC 81%

Hán Dān Xué Bù (Mimicry) or Qīng Chū Yú Lán (Mastery)? A Cognitive Perspective on Reasoning Distillation in Large Language Models

模仿(Mimicry)还是精通(Mastery)?从认知视角看大语言模型中的推理蒸馏

Yueqing Hu, Xinyang Peng, Shuting Peng, Hanqi Wang, Tianhong Wang

机构 * School of Philosophy, Anhui University(安徽大学哲学学院) Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) Faculty of Education, University of Cambridge(剑桥大学教育学院) School of Foreign Studies, South China Normal University(华南师范大学外语学院) Division of Psychology and Language Sciences, University College London(伦敦大学学院心理学与语言科学系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 从认知视角研究大语言模型推理蒸馏,发现其导致功能对齐崩溃,揭示人类样样的认知是主动强化的涌现属性而非被动模仿。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24617 2026-01-06 cs.LG cs.AI 81%

Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space

动态大概念模型:在适应性语义空间中的潜在推理

Xingwei Qu, Shaowen Wang, Zihao Huang, Kai Hua, Fan Yin, Rui-Jie Zhu, Jundong Zhou, Qiyang Min, Zihao Wang, Yizhi Li, Tianyu Zhang, He Xing, Zheng Zhang, Yuxuan Song, Tianyu Zheng, Zhiyuan Zeng, Chenghua Lin, Ge Zhang, Wenhao Huang

机构 * University of Manchester(曼彻斯特大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 动态大概念模型通过层次压缩和压缩感知扩展定律,在适应性语义空间中提升推理效率,实现零样本基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11407 2026-01-05 cs.CL cs.AI 81%

EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes

EXAONE 4.0:整合非推理与推理模式的统一大语言模型

Kyunghoon Bae, Eunbi Choi, Kibong Choi, Stanley Jungkyu Choi, Yemuk Choi, Kyubeen Han, Seokhee Hong, Junwon Hwang, Taewan Hwang, Joonwon Jang, Hyojin Jeon, Kijeong Jeon, Gerrard Jeongwon Jo, Hyunjik Jo, Jiyeon Jung, Euisoon Kim, Hyosang Kim, Jihoon Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Youchul Kim, Edward Hwayoung Lee, Gwangho Lee, Haeju Lee, Honglak Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Young Min Paik, Yongmin Park, Youngyong Park, Sanghyun Seo, Sihoon Yang, Heuiyeen Yeen, Sihyuk Yi, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 EXAONE 4.0通过整合非推理与推理模式,实现了高性能与先进推理能力的统一,支持多语言并提供两种不同规模的模型版本。

Comments Technical Report, 30 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21706 2025-12-29 cs.CL cs.AI 81%

Enabling Conversational Behavior Reasoning Capabilities in Full-Duplex Speech

实现全双工语音中对话行为推理能力

Shuchang Pan, Siddharth Banerjee, Dhruv Hebbar, Siddhant Patel, Akshaj Gupta, Kan Jen Cheng, Hanjo Kim, Zeyi Austin Li, Martin Q. Ma, Tingle Li, Gopala Anumanchipalli, Jiachen Lian

机构 * Zhejiang University(浙江大学) University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于图的思维框架,通过建模对话行为的因果推断,实现全双工语音交互中的行为推理与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21280 2025-12-25 cs.CL cs.AI 81%

SMART SLM: Structured Memory and Reasoning Transformer, A Small Language Model for Accurate Document Assistance

SMART SLM:结构记忆与推理变换器,一种用于准确文档辅助的小语言模型

Divij Dudeja, Mayukha Pal

机构 * ABB Ability Innovation Center(ABB能力创新中心) Indian Institute of Information Technology(印度信息科技学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 SMART SLM通过结构化记忆与推理变换器,提升工程文档处理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19240 2025-12-23 cs.CL cs.AI 81%

ChemATP: A Training-Free Chemical Reasoning Framework for Large Language Models

ChemATP: 一种无需训练的化学推理框架用于大语言模型

Mingxu Zhang, Dazhong Shen, Qi Zhang, Ying Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ChemATP通过构建原子级文本知识库,使冻结的大语言模型能够动态检索和推理化学知识,从而在无需训练的情况下实现高效的化学推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18822 2025-12-23 cs.AI cs.CL 81%

AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting

AdaCtrl: 通过难度感知预算分配实现适应性与可控性推理

Shijue Huang, Hongru Wang, Wanjun Zhong, Zhaochen Su, Jiazhan Feng, Bowen Cao, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 AdaCtrl通过难度感知预算分配实现自适应推理控制,提升模型在不同任务中的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12690 2025-12-16 cs.LG cs.CL cs.CV 81%

Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning

重新评估监督微调的作用:VLM推理中的实证研究

Yongcan Yu, Lingxiao He, Shuo Lu, Lijun Sheng, Yinuo Xu, Yanbo Wang, Kuangpu Guo, Jianjie Cheng, Meng Wang, Qianlong Xie, Xingxing Wang, Dapeng Hu, Jian Liang

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(人工智能研究院 & 模式识别与人工智能研究所,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Meituan(美团)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过实证分析发现,监督微调在VLM推理中具有重要作用,挑战了强化学习优于监督微调的主流观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11277 2025-12-15 cs.CL cs.LG 81%

When Actions Teach You to Think: Reasoning-Action Synergy via Reinforcement Learning in Conversational Agents

当行动教你思考:通过强化学习在对话代理中实现推理-行动协同

Mrinal Rawat, Arkajyoti Chakraborty, Neha Gupta, Roberto Pieraccini

机构 * Uniphore

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 通过强化学习实现对话代理中推理与行动的协同,提升模型推理质量和工具调用精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10561 2025-12-12 cs.CL cs.LG 81%

Causal Reasoning Favors Encoders: On The Limits of Decoder-Only Models

因果推理更青睐编码器:关于解码器-only模型极限的探讨

Amartya Roy, Elamparithy M, Kripabandhu Ghosh, Ponnurangam Kumaraguru, Adrian de Wynter

机构 * SIRE, IIT Delhi(IIT德里SIRE) Robert Bosch GmbH, India(印度罗伯特博世集团) IIIT Hyderabad(海得拉巴IIIT) IISER Kolkata(科钦IISER) Microsoft and the University of York(微软和约克大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了因果推理中编码器和编码器-解码器架构相较于仅解码器模型的优势,发现前者在多跳联合推理和分布偏移鲁棒性方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08270 2025-12-10 cs.AI cs.CL q-fin.GN 81%

Reasoning Models Ace the CFA Exams

推理模型在CFA考试中表现优异

Jaisal Patel, Yunzhe Chen, Kaiwen He, Keyi Wang, David Li, Kairong Xiao, Xiao-Yang Liu

机构 * Rensselaer Polytechnic Institute(罗格斯理工学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) SecureFinAI Lab(安全金融人工智能实验室) Columbia University(哥伦比亚大学) Business School(商学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估了先进推理模型在模拟CFA考试中的表现,发现Gemini 3.0 Pro在多个考试级别均取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20549 2025-12-09 cs.LG cs.AI 81%

MedGR$^2$: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning

MedGR$^2$: 通过生成奖励学习突破医学推理的数据壁垒

Weihai Zhi, Jiayan Guo, Shangyang Li

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MedGR$^2$通过生成奖励学习解决医学推理中的数据稀缺问题,实现高效训练和泛化,优于现有方法。

Comments 8 pages, 5 figures

Journal ref AAAI'2026 Main Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02246 2025-12-03 cs.CL cs.AI 81%

DETAIL Matters: Measuring the Impact of Prompt Specificity on Reasoning in Large Language Models

DETAIL 重要性:测量提示特定性对大语言模型推理的影响

Olivia Kim

机构 * Emory University(埃默里大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过DETAIL框架研究提示特定性对大语言模型推理性能的影响,发现特定性提升准确性,尤其对小型模型和程序性任务效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20669 2025-11-27 cs.CL cs.AI 81%

Structured Definitions and Segmentations for Legal Reasoning in LLMs: A Study on Indian Legal Data

结构化定义与分割在大语言模型法律推理中的应用:对印度法律数据的研究

Mann Khatri, Mirza Yusuf, Rajiv Ratn Shah, Ponnurangam Kumaraguru

机构 * Indraprastha Institute of Information Technology(印度普拉斯塔学院信息科技研究所) International Institute of Information Technology Hyderabad(国际信息科技研究所(海得拉巴))

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过结构化定义与分割方法提升大语言模型在法律推理中的性能,实验显示在印度法律数据集上模型性能提升达1.5%-4.36%。

Comments Accepted at BDA 2025 as short paper; This paper is long version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14299 2025-11-25 cs.AI cs.CL cs.MA 81%

DataSage: Multi-agent Collaboration for Insight Discovery with External Knowledge Retrieval, Multi-role Debating, and Multi-path Reasoning

DataSage: 基于外部知识检索、多角色辩论和多路径推理的多智能体协作以实现洞察发现

Xiaochuan Liu, Yuanfeng Song, Xiaoming Yin, Xing Chen

机构 * ByteDance, China(字节跳动)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DataSage通过多智能体协作、外部知识检索和多路径推理,提升数据洞察发现的准确性和深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16016 2025-11-21 cs.LG cs.AI 81%

CARE: Turning LLMs Into Causal Reasoning Expert

CARE: 将大语言模型转化为因果推理专家

Juncheng Dong, Yiling Liu, Ahmed Aloui, Vahid Tarokh, David Carlson

机构 * Duke University(杜克大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CARE通过监督微调提升LLMs的因果推理能力,使其在因果发现任务中超越传统算法和大参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20098 2025-11-20 cs.CL cs.AI 81%

Leveraging the Power of Large Language Models in Entity Linking via Adaptive Routing and Targeted Reasoning

Yajie Li, Albert Galimov, Mitra Datta Ganapaneni, Pujitha Thejaswi, De Meng, Priyanshu Kumar, Saloni Potdar

机构 * College of Information and Computer Sciences, University of Massachusetts Amherst(信息与计算机科学学院,马萨诸塞大学阿默斯特分校) Apple(苹果公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15137 2025-11-20 cs.LG cs.AI 81%

From Solving to Verifying: A Unified Objective for Robust Reasoning in LLMs

Xiaoxuan Wang, Bo Liu, Song Jiang, Jingzhou Liu, Jingyuan Qi, Xia Chen, Baosheng He

机构 * Meta

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02492 2025-11-18 cs.CL cs.LG 81%

GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning

Chenglong Wang, Yongyu Mu, Hang Zhou, Yifu Huo, Ziming Zhu, Jiali Zeng, Murun Yang, Bei Li, Xiaoyang Hao, Chunliang Zhang, Fandong Meng, Jingbo Zhu, Tong Xiao

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04381 2025-11-13 cs.CL cs.AI 81%

Limitations of Large Language Models in Clinical Problem-Solving Arising from Inflexible Reasoning

Jonathan Kim, Anna Podlasek, Kie Shidara, Feng Liu, Ahmed Alaa, Danilo Bernardo

机构 * Department of Neurology and Neurologic Sciences(神经病学与神经科学系) Stanford University(斯坦福大学) Image Guided Therapy and Research Facility(影像引导治疗与研究设施) University of Dundee(邓迪大学) Weill Institute of Neurology and Neurosciences(韦尔神经病学与神经科学研究所) University of California, San Francisco(加州大学旧金山分校) Department of Systems and Enterprises(系统与企业系) Stevens Institute of Technology(史蒂文斯理工学院) Department of EECS(电子工程与计算机科学系) University of California Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 14 pages, 6 figures

Journal ref Sci Rep 15, 39426 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08052 2025-11-12 cs.AI cs.CL cs.SE 81%

Dual-Process Scaffold Reasoning for Enhancing LLM Code Debugging

Po-Chung Hsieh, Chin-Po Chen, Jeng-Lin Li, Ming-Ching Chang

机构 * National Taiwan University(国立台湾大学) AI Research Center, Inventec Corporation(Inventec公司人工智能研究中心) University at Albany, SUNY(纽约州立大学阿尔巴尼分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07166 2025-11-11 cs.CL cs.AI cs.CE 81%

AdaRec: Adaptive Recommendation with LLMs via Narrative Profiling and Dual-Channel Reasoning

Meiyun Wang, Charin Polpanumas

机构 * The University of Tokyo(东京大学) Amazon.com, Inc.(亚马逊公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏