arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-13 至 2026-01-13 共收录 149 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 48 篇

2601.07812 2026-01-13 cs.CV 50%

More Images, More Problems? A Controlled Analysis of VLM Failure Modes

更多图像,更多问题?对VLV失败模式的受控分析

Anurag Das, Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas, Bernt Schiele, Georgios Tzimiropoulos, Brais Martinez

机构 * MPI for Informatics Saarland Informatics Campus(马克斯·普朗克研究所(信息学)萨尔兰信息学校区) Samsung AI Cambridge(三星人工智能(剑桥)) Technical University of Iași Romania(罗文扎大学(罗马尼亚)) Queen Mary University of London UK(伦敦女王大学(英国))

专题命中 推理评测 :reasoning(abstract)

AI总结 MIMIC基准通过诊断实验揭示LVLM在多图像任务中的失败模式,并提出数据生成和注意力遮罩方案以提升跨图像信息聚合能力。

Comments 19 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07484 2026-01-13 cs.GR 50%

R3-RECON: Radiance-Field-Free Active Reconstruction via Renderability

R3-RECON:通过可渲染性进行无辐射场主动重建

Xiaofeng Jin, Matteo Frosi, Yiran Guo, Matteo Matteucci

专题命中 推理评测 :planning(abstract)

AI总结 R3-RECON通过无辐射场的可渲染性场实现高效主动重建,提升新视角质量和3DGS重建精度。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25263 2026-01-13 cs.CV 50%

LangHOPS: Language Grounded Hierarchical Open-Vocabulary Part Segmentation

LangHOPS: 语言引导的层次开放词汇部件分割

Yang Miao, Jan-Nico Zaech, Xi Wang, Fabien Despinoy, Danda Pani Paudel, Luc Van Gool

机构 * INSAIT Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·欧里迪斯基") ETH Zurich(苏黎世联邦理工学院) TU Munich(慕尼黑技术大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 LangHOPS通过多模态大语言模型实现开放词汇物体-部件实例分割,取得领域内和跨数据集的优异性能。

Comments 10 pages, 5 figures, 14 tables, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06419 2026-01-13 cs.CR cs.PL 50%

Lightweight Yet Secure: Secure Scripting Language Generation via Lightweight LLMs

轻量却安全:通过轻量LLM实现安全脚本语言生成

Keyang Zhang, Zeyu Chen, Xuan Feng, Dongliang Fang, Yaowen Zheng, Zhi Li, Limin Sun

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出PSSec框架,通过数据合成与微调提升轻量LLM在生成安全PowerShell脚本方面的能力,显著降低推理成本。

Comments 19 pages,8 figures,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06198 2026-01-13 cs.CV 50%

How Does India Cook Biryani?

印度是如何烹饪饭团的?

Shubham Goel, Farzana S, C V Rishi, Aditya Arun, C V Jawahar

机构 * IIIT Hyderabad

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06177 2026-01-13 cs.CR cs.SE 50%

AutoVulnPHP: LLM-Powered Two-Stage PHP Vulnerability Detection and Automated Localization

AutoVulnPHP: 基于LLM的两阶段PHP漏洞检测与自动定位

Zhiqiang Wang, Yizhong Ding, Zilong Xiao, Jinyu Lu, Yan Jia, Yanjun Li

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 AutoVulnPHP通过结合两阶段漏洞检测与细粒度自动定位,利用LLM提升PHP漏洞检测的准确性和定位精度,首次构建大规模PHP漏洞数据集并验证其实际应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 23 篇

2506.19467 2026-01-13 cs.CL cs.AI 86%

Can Reasoning Help Large Language Models Capture Human Annotator Disagreement?

推理是否能帮助大语言模型捕捉人类标注者的分歧?

Jingwei Ni, Yu Fan, Vilém Zouhar, Donya Rooein, Alexander Hoyle, Mrinmaya Sachan, Markus Leippold, Dirk Hovy, Elliott Ash

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理方法对大语言模型捕捉人类标注分歧的影响,发现RLVR推理会降低性能,而朴素推理能提升性能,揭示了用推理模型替代人类标注的风险。

Comments EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06098 2026-01-13 cs.AI 85%

Automatic Question Generation for Intuitive Learning Utilizing Causal Graph Guided Chain of Thought Reasoning

利用因果图引导的推理链生成自动问题以促进直观学习

Nicholas X. Wang, Neel V. Parpia, Aaryan D. Parikh, Aggelos K. Katsaggelos

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出利用因果图引导的推理链和多智能体架构,生成准确且符合课程要求的问题,以提高直观学习的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07245 2026-01-13 cs.AI cs.CL cs.LG 82%

Learning to Trust the Crowd: A Multi-Model Consensus Reasoning Engine for Large Language Models

学习信任群体:一种多模型共识推理引擎用于大语言模型

Pranav Kallem

机构 * Department of Computer Science(计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出多模型共识推理引擎,通过整合多个大语言模型的输出,提升回答的准确性和可靠性,实验表明其在多个基准测试中显著优于单一模型和多数投票。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06373 2026-01-13 cs.MA 82%

DemMA: Dementia Multi-Turn Dialogue Agent with Expert-Guided Reasoning and Action Simulation

DemMA:具有专家引导推理和行动模拟的痴呆多轮对话代理

Yutong Song, Jiang Wu, Kazi Sharif, Honghui Xu, Nikil Dutt, Amir Rahmani

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 DemMA通过专家引导的推理和行动模拟,实现了高保真的痴呆症患者多轮对话模拟,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07260 2026-01-13 cs.CL 79%

ActiShade: Activating Overshadowed Knowledge to Guide Multi-Hop Reasoning in Large Language Models

ActiShade: 通过激活被遮蔽的知识来指导大语言模型的多跳推理

Huipeng Ma, Luan Zhang, Dandan Song, Linmei Hu, Yuhang Tian, Jun Yang, Changzhi Zhou, Chenhao Li, Yizhou Jin, Xudong Li, Meng Lin, Mingxing Zhang, Shuhao Zhang

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 ActiShade通过激活被遮蔽的知识来提升大语言模型在多跳推理中的表现。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07180 2026-01-13 cs.CL 79%

Structured Reasoning for Large Language Models

为大型语言模型引入结构化推理

Jinyi Han, Zixiang Di, Zishang Jiang, Ying Liao, Jiaqing Liang, Yongqi Wang, Yanghua Xiao

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学) Beijing Institute of Technology(北京理工大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出结构化推理框架SCR,通过生成-验证-修改范式提升LLM的推理效率和自我验证能力,减少输出标记长度达50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07430 2026-01-13 cs.CL cs.AI 62%

KALE: Enhancing Knowledge Manipulation in Large Language Models via Knowledge-aware Learning

KALE:通过知识感知学习增强大语言模型的知识操作

Qitan Lv, Tianyu Liu, Qiaosheng Zhang, Xingcheng Xu, Chaochao Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 KALE通过知识感知学习框架提升大语言模型的知识操作能力,利用知识图谱生成高质量推理过程并优化模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07389 2026-01-13 cs.LG cs.AI cs.IT math.IT 62%

On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training

在训练后阶段,监督微调与强化学习无法解耦

Xueyan Niu, Bo Bai, Wei Han, Weixi Zhang

机构 * Theory Laboratory Central Research Institute, 2012 Laboratories(理论实验室中央研究院,2012实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究证明在训练后阶段,监督微调与强化学习无法解耦,且在交替训练顺序下会导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07320 2026-01-13 cs.LG cs.AI 62%

Segmental Advantage Estimation: Enhancing PPO for Long-Context LLM Training

段落优势估计:增强PPO用于长上下文LLM训练

Xue Gong, Qi Yi, Ziyuan Nan, Guanhua Huang, Kejiao Li, Yuhao Jiang, Ruibin Xiong, Zenan Xu, Jiaming Guo, Shaohui Peng, Bo Zhou

机构 * LLM Department, Tencent(腾讯大语言模型部门) University of Chinese Academy of Sciences(中国科学院大学) Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心) State Key Lab of Processors, Institute of Computing Technology, CAS(计算技术研究所处理器国家重点实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 段落优势估计通过减少稀疏奖励环境中的偏差,提升PPO在长上下文LLM训练中的稳定性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07149 2026-01-13 cs.AI cs.CL 62%

Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling

奖励创造力:一种人类对齐的生成奖励模型用于故事创作中的强化学习

Zhaoyan Li, Hang Lei, Yujia Wang, Lanbo Liu, Hao Liu, Liang Yu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种人类对齐的生成奖励模型和强化学习框架,用于提升故事创作的质量和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06047 2026-01-13 cs.AI cs.CL cs.CY 62%

"They parted illusions -- they parted disclaim marinade": Misalignment as structural fidelity in LLMs

他们分开了幻象——他们分开了否定腌制:在大语言模型中将不一致视为结构忠实

Mariana Lins Costa

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出大语言模型中'不一致'现象源于对不一致语言结构的忠实,而非欺骗性意图,通过分析案例和实证数据,揭示语言结构与意图生成的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07675 2026-01-13 cs.LG q-fin.RM 57%

Tab-TRM: Tiny Recursive Model for Insurance Pricing on Tabular Data

Tab-TRM:表格数据上的保险定价小型递归模型

Kishan Padayachy, Ronald Richman, Mario V. Wüthrich

机构 * insureAI Department of Mathematics, ETH Zurich(数学系,苏黎世联邦理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 Tab-TRM是一种基于递归推理的保险定价模型,结合传统精算方法与现代机器学习技术,通过迭代优化实现高效准确的保险定价。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07645 2026-01-13 cs.CL 57%

PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs

PlaM: 无需训练的高原引导模型融合以提升多模态大语言模型的视觉语义

Zijing Wang, Yongkang Liu, Mingyang Wang, Ercong Nie, Deyuan Chen, Zhengjie Zhao, Shi Feng, Daling Wang, Xiaocui Yang, Yifei Zhang, Hinrich Schütze

机构 * Northeastern University, China(东北大学) CIS, LMU Munich, Germany(慕尼黑大学计算机学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 PlaM通过无需训练的高原引导模型融合方法,提升多模态大语言模型的视觉语义表现。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07469 2026-01-13 cs.AI 57%

Knowledge Distillation for LLM-Based Human Activity Recognition in Homes

用于家庭中基于大语言模型的人活动识别的知识蒸馏

Julien Cumin, Oussama Er-Rahmany, Xi Chen

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了利用大语言模型进行家庭中的人活动识别,并通过知识蒸馏技术提升小型模型性能,实现参数减少50倍的同时保持高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07359 2026-01-13 cs.CV cs.AI 57%

Seeing Right but Saying Wrong: Inter- and Intra-Layer Refinement in MLLMs without Training

看到正确却说错:在MLLMs中无需训练的跨层和内层细化

Shezheng Song, Shasha Li, Jie Yu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 DualPD通过双视角解码细化策略,无需额外训练提升多模态大语言模型的视觉理解准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07190 2026-01-13 cs.AI 57%

Active Context Compression: Autonomous Memory Management in LLM Agents

主动上下文压缩:LLM代理中的自主内存管理

Nikhil Verma

机构 * Independent Researcher(独立研究者)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Focus代理,通过自主压缩上下文提升LLM在长周期任务中的效率与准确性。

Comments 8 pages, 2 figures, 2 tables. IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07022 2026-01-13 cs.CL 57%

Solar Open Technical Report

太阳能开放技术报告

Sungrae Park, Sanghoon Kim, Jungho Cho, Gyoungjin Gim, Dawoon Jung, Mikyoung Cha, Eunhae Choo, Taekgyu Hong, Minbyul Jeong, SeHwan Joo, Minsoo Khang, Eunwon Kim, Minjeong Kim, Sujeong Kim, Yunsu Kim, Hyeonju Lee, Seunghyun Lee, Sukyung Lee, Siyoung Park, Gyungin Shin, Inseo Song, Wonho Song, Seonghoon Yang, Seungyoun Yi, Sanghoon Yoon, Jeonghyun Ko, Seyoung Song, Keunwoo Choi, Hwalsuk Lee, Sunghun Kim, Du-Seong Chang, Kyunghyun Cho, Junsuk Choe, Hwaran Lee, Jae-Gil Lee, KyungTae Lim, Alice Oh

机构 * Upstage Solar Team(Upstage太阳能团队)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Solar Open通过解决数据稀缺、课程协调和可扩展RL三个挑战,构建了一个具有竞争力的双语混合专家语言模型,展示了在服务不足语言AI开发中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07334 2026-01-13 cs.LG 57%

Graph-KV: Breaking Sequence via Injecting Structural Biases into Large Language Models

Graph-KV: 通过向大语言模型注入结构偏差打破序列

Haoyu Wang, Peihao Wang, Mufei Li, Shikun Liu, Siqi Miao, Zhangyang Wang, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 Graph-KV通过引入结构偏差打破序列限制,提升大语言模型在图结构任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16674 2026-01-13 cs.CL 57%

Through the LLM Looking Glass: A Socratic Probing of Donkeys, Elephants, and Markets

通过语言模型的棱镜:对驴、大象和市场的苏格拉底探查

Molly Kennedy, Ayyoob Imani, Timo Spinde, Akiko Aizawa, Hinrich Schütze

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过苏格拉底方法分析LLM在意识形态框架下的偏见,发现GPT-4o在标注准确性上达到人类水平,但面对二元比较时仍存在偏好倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06377 2026-01-13 cs.AI 57%

HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents

HiMem:用于长时间跨度代理的分层长时记忆

Ningning Zhang, Xingxing Yang, Zhizhong Tan, Weiping Deng, Wenyong Wang

机构 * Macau University of Science and Technology(澳门科学理工大學)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 HiMem通过分层长时记忆框架提升长跨度对话代理的适应性和自我进化能力,采用双通道分割和多阶段信息提取实现高效且保真的记忆管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06171 2026-01-13 cs.CY cs.AI 57%

From Individual Prompts to Collective Intelligence: Mainstreaming Generative AI in the Classroom

从个体提示到集体智慧:在课堂中主流化生成式AI

Junaid Qadir, Muhammad Salman Khan

机构 * College of Engineering, Qatar University, Doha, Qatar(卡塔尔大学工程学院,多哈)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过集体智慧导向的教学法,结合生成式AI和同伴协作,提升课堂学习效果与学生参与度。

Comments accepted at IEEE EDUCON 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06126 2026-01-13 cs.AI 57%

NL2Dashboard: A Lightweight and Controllable Framework for Generating Dashboards with LLMs

NL2Dashboard: 一种轻量且可控的基于LLM生成仪表盘的框架

Boshen Shi, Kexin Yang, Yuanbo Yang, Guanguang Chang, Ce Chi, Zhendong Wang, Xing Wang, Junlan Feng

机构 * Jiutian Research, China Mobile(九天研究,中国移动)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 NL2Dashboard通过分析-呈现解耦原理,提出轻量可控的仪表盘生成框架,实现高效视觉质量和高可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00140 2026-01-13 cs.SE cs.AI 57%

LLM-based Zero-shot Triple Extraction for Automated Ontology Generation from Software Engineering Standards

基于大型语言模型的零样本三元组提取用于从软件工程标准自动生成本体

Songhui Yue

机构 * Computer Science Department(计算机科学系) Charleston Southern University(查尔斯顿南方大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于LLM的零样本三元组提取方法,用于从软件工程标准中自动生成本体,通过改进的工作流程和专家标注集验证了其有效性。

Comments Semantic Data Integration Workshop, held in conjunction with IEEE International Conference on Semantic Computing (IEEE ICSC 2026), accepted, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏