arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-13 至 2026-01-13 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 23 篇

2506.19467 2026-01-13 cs.CL cs.AI 86%

Can Reasoning Help Large Language Models Capture Human Annotator Disagreement?

推理是否能帮助大语言模型捕捉人类标注者的分歧?

Jingwei Ni, Yu Fan, Vilém Zouhar, Donya Rooein, Alexander Hoyle, Mrinmaya Sachan, Markus Leippold, Dirk Hovy, Elliott Ash

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理方法对大语言模型捕捉人类标注分歧的影响,发现RLVR推理会降低性能,而朴素推理能提升性能,揭示了用推理模型替代人类标注的风险。

Comments EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06098 2026-01-13 cs.AI 85%

Automatic Question Generation for Intuitive Learning Utilizing Causal Graph Guided Chain of Thought Reasoning

利用因果图引导的推理链生成自动问题以促进直观学习

Nicholas X. Wang, Neel V. Parpia, Aaryan D. Parikh, Aggelos K. Katsaggelos

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出利用因果图引导的推理链和多智能体架构,生成准确且符合课程要求的问题,以提高直观学习的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07245 2026-01-13 cs.AI cs.CL cs.LG 82%

Learning to Trust the Crowd: A Multi-Model Consensus Reasoning Engine for Large Language Models

学习信任群体:一种多模型共识推理引擎用于大语言模型

Pranav Kallem

机构 * Department of Computer Science(计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出多模型共识推理引擎,通过整合多个大语言模型的输出,提升回答的准确性和可靠性,实验表明其在多个基准测试中显著优于单一模型和多数投票。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06373 2026-01-13 cs.MA 82%

DemMA: Dementia Multi-Turn Dialogue Agent with Expert-Guided Reasoning and Action Simulation

DemMA:具有专家引导推理和行动模拟的痴呆多轮对话代理

Yutong Song, Jiang Wu, Kazi Sharif, Honghui Xu, Nikil Dutt, Amir Rahmani

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 DemMA通过专家引导的推理和行动模拟,实现了高保真的痴呆症患者多轮对话模拟,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07260 2026-01-13 cs.CL 79%

ActiShade: Activating Overshadowed Knowledge to Guide Multi-Hop Reasoning in Large Language Models

ActiShade: 通过激活被遮蔽的知识来指导大语言模型的多跳推理

Huipeng Ma, Luan Zhang, Dandan Song, Linmei Hu, Yuhang Tian, Jun Yang, Changzhi Zhou, Chenhao Li, Yizhou Jin, Xudong Li, Meng Lin, Mingxing Zhang, Shuhao Zhang

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 ActiShade通过激活被遮蔽的知识来提升大语言模型在多跳推理中的表现。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07180 2026-01-13 cs.CL 79%

Structured Reasoning for Large Language Models

为大型语言模型引入结构化推理

Jinyi Han, Zixiang Di, Zishang Jiang, Ying Liao, Jiaqing Liang, Yongqi Wang, Yanghua Xiao

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学) Beijing Institute of Technology(北京理工大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出结构化推理框架SCR,通过生成-验证-修改范式提升LLM的推理效率和自我验证能力,减少输出标记长度达50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07430 2026-01-13 cs.CL cs.AI 62%

KALE: Enhancing Knowledge Manipulation in Large Language Models via Knowledge-aware Learning

KALE:通过知识感知学习增强大语言模型的知识操作

Qitan Lv, Tianyu Liu, Qiaosheng Zhang, Xingcheng Xu, Chaochao Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 KALE通过知识感知学习框架提升大语言模型的知识操作能力,利用知识图谱生成高质量推理过程并优化模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07389 2026-01-13 cs.LG cs.AI cs.IT math.IT 62%

On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training

在训练后阶段,监督微调与强化学习无法解耦

Xueyan Niu, Bo Bai, Wei Han, Weixi Zhang

机构 * Theory Laboratory Central Research Institute, 2012 Laboratories(理论实验室中央研究院,2012实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究证明在训练后阶段,监督微调与强化学习无法解耦,且在交替训练顺序下会导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07320 2026-01-13 cs.LG cs.AI 62%

Segmental Advantage Estimation: Enhancing PPO for Long-Context LLM Training

段落优势估计:增强PPO用于长上下文LLM训练

Xue Gong, Qi Yi, Ziyuan Nan, Guanhua Huang, Kejiao Li, Yuhao Jiang, Ruibin Xiong, Zenan Xu, Jiaming Guo, Shaohui Peng, Bo Zhou

机构 * LLM Department, Tencent(腾讯大语言模型部门) University of Chinese Academy of Sciences(中国科学院大学) Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心) State Key Lab of Processors, Institute of Computing Technology, CAS(计算技术研究所处理器国家重点实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 段落优势估计通过减少稀疏奖励环境中的偏差,提升PPO在长上下文LLM训练中的稳定性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07149 2026-01-13 cs.AI cs.CL 62%

Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling

奖励创造力:一种人类对齐的生成奖励模型用于故事创作中的强化学习

Zhaoyan Li, Hang Lei, Yujia Wang, Lanbo Liu, Hao Liu, Liang Yu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种人类对齐的生成奖励模型和强化学习框架,用于提升故事创作的质量和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06047 2026-01-13 cs.AI cs.CL cs.CY 62%

"They parted illusions -- they parted disclaim marinade": Misalignment as structural fidelity in LLMs

他们分开了幻象——他们分开了否定腌制:在大语言模型中将不一致视为结构忠实

Mariana Lins Costa

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出大语言模型中'不一致'现象源于对不一致语言结构的忠实,而非欺骗性意图,通过分析案例和实证数据,揭示语言结构与意图生成的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07675 2026-01-13 cs.LG q-fin.RM 57%

Tab-TRM: Tiny Recursive Model for Insurance Pricing on Tabular Data

Tab-TRM:表格数据上的保险定价小型递归模型

Kishan Padayachy, Ronald Richman, Mario V. Wüthrich

机构 * insureAI Department of Mathematics, ETH Zurich(数学系,苏黎世联邦理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 Tab-TRM是一种基于递归推理的保险定价模型,结合传统精算方法与现代机器学习技术,通过迭代优化实现高效准确的保险定价。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07645 2026-01-13 cs.CL 57%

PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs

PlaM: 无需训练的高原引导模型融合以提升多模态大语言模型的视觉语义

Zijing Wang, Yongkang Liu, Mingyang Wang, Ercong Nie, Deyuan Chen, Zhengjie Zhao, Shi Feng, Daling Wang, Xiaocui Yang, Yifei Zhang, Hinrich Schütze

机构 * Northeastern University, China(东北大学) CIS, LMU Munich, Germany(慕尼黑大学计算机学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 PlaM通过无需训练的高原引导模型融合方法,提升多模态大语言模型的视觉语义表现。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07469 2026-01-13 cs.AI 57%

Knowledge Distillation for LLM-Based Human Activity Recognition in Homes

用于家庭中基于大语言模型的人活动识别的知识蒸馏

Julien Cumin, Oussama Er-Rahmany, Xi Chen

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了利用大语言模型进行家庭中的人活动识别,并通过知识蒸馏技术提升小型模型性能,实现参数减少50倍的同时保持高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07359 2026-01-13 cs.CV cs.AI 57%

Seeing Right but Saying Wrong: Inter- and Intra-Layer Refinement in MLLMs without Training

看到正确却说错:在MLLMs中无需训练的跨层和内层细化

Shezheng Song, Shasha Li, Jie Yu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 DualPD通过双视角解码细化策略,无需额外训练提升多模态大语言模型的视觉理解准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07190 2026-01-13 cs.AI 57%

Active Context Compression: Autonomous Memory Management in LLM Agents

主动上下文压缩:LLM代理中的自主内存管理

Nikhil Verma

机构 * Independent Researcher(独立研究者)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Focus代理,通过自主压缩上下文提升LLM在长周期任务中的效率与准确性。

Comments 8 pages, 2 figures, 2 tables. IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07022 2026-01-13 cs.CL 57%

Solar Open Technical Report

太阳能开放技术报告

Sungrae Park, Sanghoon Kim, Jungho Cho, Gyoungjin Gim, Dawoon Jung, Mikyoung Cha, Eunhae Choo, Taekgyu Hong, Minbyul Jeong, SeHwan Joo, Minsoo Khang, Eunwon Kim, Minjeong Kim, Sujeong Kim, Yunsu Kim, Hyeonju Lee, Seunghyun Lee, Sukyung Lee, Siyoung Park, Gyungin Shin, Inseo Song, Wonho Song, Seonghoon Yang, Seungyoun Yi, Sanghoon Yoon, Jeonghyun Ko, Seyoung Song, Keunwoo Choi, Hwalsuk Lee, Sunghun Kim, Du-Seong Chang, Kyunghyun Cho, Junsuk Choe, Hwaran Lee, Jae-Gil Lee, KyungTae Lim, Alice Oh

机构 * Upstage Solar Team(Upstage太阳能团队)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Solar Open通过解决数据稀缺、课程协调和可扩展RL三个挑战,构建了一个具有竞争力的双语混合专家语言模型,展示了在服务不足语言AI开发中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07334 2026-01-13 cs.LG 57%

Graph-KV: Breaking Sequence via Injecting Structural Biases into Large Language Models

Graph-KV: 通过向大语言模型注入结构偏差打破序列

Haoyu Wang, Peihao Wang, Mufei Li, Shikun Liu, Siqi Miao, Zhangyang Wang, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 Graph-KV通过引入结构偏差打破序列限制,提升大语言模型在图结构任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16674 2026-01-13 cs.CL 57%

Through the LLM Looking Glass: A Socratic Probing of Donkeys, Elephants, and Markets

通过语言模型的棱镜:对驴、大象和市场的苏格拉底探查

Molly Kennedy, Ayyoob Imani, Timo Spinde, Akiko Aizawa, Hinrich Schütze

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过苏格拉底方法分析LLM在意识形态框架下的偏见,发现GPT-4o在标注准确性上达到人类水平,但面对二元比较时仍存在偏好倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06377 2026-01-13 cs.AI 57%

HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents

HiMem:用于长时间跨度代理的分层长时记忆

Ningning Zhang, Xingxing Yang, Zhizhong Tan, Weiping Deng, Wenyong Wang

机构 * Macau University of Science and Technology(澳门科学理工大學)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 HiMem通过分层长时记忆框架提升长跨度对话代理的适应性和自我进化能力,采用双通道分割和多阶段信息提取实现高效且保真的记忆管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06171 2026-01-13 cs.CY cs.AI 57%

From Individual Prompts to Collective Intelligence: Mainstreaming Generative AI in the Classroom

从个体提示到集体智慧:在课堂中主流化生成式AI

Junaid Qadir, Muhammad Salman Khan

机构 * College of Engineering, Qatar University, Doha, Qatar(卡塔尔大学工程学院,多哈)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过集体智慧导向的教学法,结合生成式AI和同伴协作,提升课堂学习效果与学生参与度。

Comments accepted at IEEE EDUCON 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06126 2026-01-13 cs.AI 57%

NL2Dashboard: A Lightweight and Controllable Framework for Generating Dashboards with LLMs

NL2Dashboard: 一种轻量且可控的基于LLM生成仪表盘的框架

Boshen Shi, Kexin Yang, Yuanbo Yang, Guanguang Chang, Ce Chi, Zhendong Wang, Xing Wang, Junlan Feng

机构 * Jiutian Research, China Mobile(九天研究,中国移动)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 NL2Dashboard通过分析-呈现解耦原理,提出轻量可控的仪表盘生成框架,实现高效视觉质量和高可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00140 2026-01-13 cs.SE cs.AI 57%

LLM-based Zero-shot Triple Extraction for Automated Ontology Generation from Software Engineering Standards

基于大型语言模型的零样本三元组提取用于从软件工程标准自动生成本体

Songhui Yue

机构 * Computer Science Department(计算机科学系) Charleston Southern University(查尔斯顿南方大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于LLM的零样本三元组提取方法,用于从软件工程标准中自动生成本体,通过改进的工作流程和专家标注集验证了其有效性。

Comments Semantic Data Integration Workshop, held in conjunction with IEEE International Conference on Semantic Computing (IEEE ICSC 2026), accepted, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏