arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-19 至 2026-01-19 共收录 60 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2512.11485 2026-01-19 cs.CL 57%

Mistake Notebook Learning: Batch-Clustered Failures for Training-Free Agent Adaptation

错误笔记本学习:用于无训练代理适应的批量聚类失败

Xuanbo Su, Yingfang Zhang, Hao Luo, Xiaoteng Liu, Leo Huang

机构 * Bairong Inc.(柏龙公司) School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) School of Software, Jilin University(吉林大学软件学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MNL通过批量聚类失败提炼结构化错误笔记,提升代理适应性和鲁棒性,无需参数更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15437 2026-01-19 cs.AI cs.HC math.HO 57%

Apriori Knowledge in an Era of Computational Opacity: The Role of AI in Mathematical Discovery

在计算不透明时代中的先验知识:人工智能在数学发现中的作用

Eamon Duede, Kevin Davey

机构 * Purdue University(普渡大学) Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了在计算不透明时代,通过AI获取数学先验知识的挑战与可能方法,强调证明检查器在其中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2502.13137 2026-01-19 cs.AI 57%

Theorem Prover as a Judge for Synthetic Data Generation

定理推理解释器作为合成数据生成的裁判

Joshua Ong Jun Leang, Giwon Hong, Wenda Li, Shay B. Cohen

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出TP-as-a-Judge和RLTPF方法,通过定理推理解释器提升LLM的合成数据生成与推理准确性。

Journal ref Proc. ACL 2025, pp. 29941-29977

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01298 2026-01-19 cs.IR 50%

Augmented Knowledge Graph Querying leveraging LLMs

增强知识图谱查询利用大语言模型

Marco Arazzi, Davide Ligari, Serena Nicolazzo, Antonino Nocera

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 SparqLLM通过结合RAG和LLM技术,实现高效的知识图谱查询与可视化,提升非专家用户的数据交互能力。

Journal ref 2025 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 7 篇

2601.10810 2026-01-19 cs.LG cs.AI 79%

Digital Metabolism: Decoupling Logic from Facts via Regenerative Unlearning -- Towards a Pure Neural Logic Core

数字代谢:通过再生反学习解耦逻辑与事实 -- 向纯神经逻辑核心迈进

Mengmeng Peng, Zhenyu Fang, He Sun

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出'数字代谢'假说,通过再生反学习解耦逻辑与事实,实现纯神经逻辑核心,提升模型推理能力并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11322 2026-01-19 cs.CV cs.LO 78%

Enhancing Vision Language Models with Logic Reasoning for Situational Awareness

通过逻辑推理增强视觉语言模型以提升情境感知能力

Pavana Pradeep, Krishna Kant, Suya Yu

机构 * CIS Department, Temple University(Temple大学计算机与信息科学系) ARL(美国陆军研究实验室)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文通过整合逻辑推理与传统计算机视觉方法,提升视觉语言模型在情境感知中的准确性与细粒度事件识别能力。

Comments Accepted for publication in IEEE Transactions on AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01439 2026-01-19 cs.AI cs.RO 70%

Probabilistic Mission Design for Neuro-Symbolic Unmanned Aircraft Systems

基于概率的方法用于神经符号无人机系统任务设计

Simon Kohaut, Benedict Flade, Daniel Ochs, Devendra Singh Dhami, Julian Eggert, Kristian Kersting

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出概率任务设计(ProMis)方法,结合神经符号技术,用于在法律框架内导航无人驾驶航空器,通过混合概率逻辑程序和机器学习模型提升任务规划的可靠性和适应性。

Comments arXiv admin note: text overlap with arXiv:2406.03454

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11379 2026-01-19 cs.CL cs.AI cs.CY cs.SI 62%

Evaluating LLM Behavior in Hiring: Implicit Weights, Fairness Across Groups, and Alignment with Human Preferences

评估LLM在招聘中的行为:隐含权重、群体公平性及与人类偏好的一致性

Morgane Hoffmann, Emma Jouffroy, Warren Jouanneau, Marc Palyart, Charles Pebereau

机构 * Malt

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出评估LLM招聘决策的框架,发现模型重视核心生产力信号,但对某些特征的解释超出显性匹配价值,且不同群体间权重存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09122 2026-01-19 cs.SE cs.AI 57%

Vendor-Aware Industrial Agents: RAG-Enhanced LLMs for Secure On-Premise PLC Code Generation

面向供应商的工业代理:增强型LLM用于安全本地PLC代码生成

Joschka Kersting, Michael Rummel, Gesa Benndorf

机构 * Centre for Machine Learning(机器学习中心) Fraunhofer IOSB-INA(弗劳恩霍夫IOSB-INA研究所) FA-EDC Mitsubishi Electric Europe(三菱电机欧洲)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于RAG增强的LLM方法,用于在低数据域中安全生成本地PLC代码,通过提示工程和定向检索提升代码生成质量。

Comments ICIT2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10931 2026-01-19 cs.CV cs.AI 57%

Sparse Data Tree Canopy Segmentation: Fine-Tuning Leading Pretrained Models on Only 150 Images

稀疏数据树冠分割:仅在150张图像上微调预训练模型

David Szczecina, Hudson Sun, Anthony Bertnyk, Niloofar Azad, Kyle Gao, Lincoln Linlin Xu

机构 * University of Waterloo(滑铁卢大学) University of Calgary(卡尔加里大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文评估了五种模型在低数据下的树冠分割表现,发现卷积模型在小数据情况下表现更优,而Transformer模型因数据需求高和任务差异表现欠佳。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10865 2026-01-19 cs.CR cs.SE 50%

Multi-Agent Taint Specification Extraction for Vulnerability Detection

多代理污点规范提取用于漏洞检测

Jonah Ghebremichael, Saastha Vasan, Saad Ullah, Greg Tystahl, David Adei, Christopher Kruegel, Giovanni Vigna, William Enck, Alexandros Kapravelos

专题命中 逻辑推理 :reasoning(abstract)

AI总结 SemTaint通过结合LLM语义理解和传统静态分析,提取定制化的污点规范以提升漏洞检测效果

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 11 篇

2601.11354 2026-01-19 cs.AI cs.CL 84%

AstroReason-Bench: Evaluating Unified Agentic Planning across Heterogeneous Space Planning Problems

AstroReason-Bench: 评估跨异构空间规划问题的统一代理规划

Weiyi Wang, Xinchi Chen, Jingjing Gong, Xuanjing Huang, Xipeng Qiu

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AstroReason-Bench通过评估代理在复杂空间规划问题中的表现,揭示了通用规划在现实约束下的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06534 2026-01-19 cs.AI cs.LG 81%

Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them

代理搜索中的有益推理行为及有效训练以获得这些行为

Jiahe Jin, Abhijay Paladugu, Chenyan Xiong

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出行为引导方法,通过预训练使代理搜索模型具备信息验证、权威评估等有益推理行为,从而在强化学习前提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10820 2026-01-19 cs.LG cs.AI cs.CL cs.MA 78%

Towards Reliable ML Feature Engineering via Planning in Constrained-Topology of LLM Agents

通过LLM代理的受限拓扑规划实现可靠的机器学习特征工程

Himanshu Thakur, Anusha Kamath, Anurag Muthyala, Dhwani Sanmukhani, Smruthi Mukund, Jay Katukuri

机构 * Meta Menlo Park, CA(Meta 洛杉矶公园分校) JPMorgan Chase & Co.(摩根大通公司)

专题命中 规划推理 :planning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于LLM代理的受限拓扑规划框架,通过多步骤生成代码提升特征工程的可靠性与效率,实验显示在数据集和实际应用中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11475 2026-01-19 cs.CV 67%

Generative Scenario Rollouts for End-to-End Autonomous Driving

生成场景回放用于端到端自动驾驶

Rajeev Yasarla, Deepti Hegde, Shizhong Han, Hsin-Pai Cheng, Yunxiao Shi, Meysam Sadeghigooghari, Shweta Mahajan, Apratim Bhattacharyya, Litian Liu, Risheek Garrepalli, Thomas Svantesson, Fatih Porikli, Hong Cai

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 GeRo通过自回归回放策略,结合规划与生成,提升自动驾驶系统的长期推理和多代理规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09105 2026-01-19 cs.AI cs.CL cs.CV 62%

AviationLMM: A Large Multimodal Foundation Model for Civil Aviation

AviationLMM:民用航空的大规模多模态基础模型

Wenbin Li, Jingling Wu, Xiaoyong Lin. Jing Chen, Cong Chen

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AviationLMM旨在通过统一民用航空的异构数据流,提升航空安全与效率,推动可信且隐私保护的航空人工智能生态系统发展。

Comments Accepted by 2025 7th International Conference on Interdisciplinary Computer Science and Engineering (ICICSE 2025), Chongqing, China; 9 pages,1 figure,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03687 2026-01-19 cs.CL cs.AI 62%

MedReflect: Teaching Medical LLMs to Self-Improve via Reflective Correction

MedReflect: 通过反思修正教学医疗LLM自我改进

Yue Huang, Yanyuan Chen, Dexuan Xu, Chenzhuo Zhao, Weihua Yue, Yu Huang

机构 * Peking University(北京大学) University of Virginia(弗吉尼亚大学) Peking University Sixth Hospital(北京大学第六医院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MedReflect通过自我反思机制提升医疗LLM的自主学习能力,减少外部数据依赖,实现高效医疗问题解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11311 2026-01-19 cs.LG 57%

FORESTLLM: Large Language Models Make Random Forest Great on Few-shot Tabular Learning

FORESTLLM:大型语言模型使随机森林在少样本表格学习中表现卓越

Zhihan Yang, Jiaqi Wei, Xiang Zhang, Haoyu Dong, Yiwen Wang, Xiaoke Guo, Pengkun Zhang, Yiwei Xu, Chenyu You

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 FORESTLLM结合决策森林的结构归纳偏见和LLM的语义推理能力,通过语义分割和上下文推理机制,在少样本表格学习中实现高性能。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16995 2026-01-19 cs.CL 57%

DecoupledESC: Enhancing Emotional Support Generation via Strategy-Response Decoupled Preference Optimization

解耦ESC:通过策略-回应解耦的偏好优化增强情感支持生成

Chao Zhang, Xin Shi, Xueqiao Zhang, Yifan Zhu, Yi Yang, Yawei Luo

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出了解耦ESC框架,通过策略-回应解耦的偏好优化方法,提升情感支持生成的质量与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22608 2026-01-19 cs.AI cs.CE 57%

Beyond Isolated Investor: Predicting Startup Success via Roleplay-Based Collective Agents

超越孤立投资者:通过角色扮演基于的集体代理预测初创企业成功

Zhongyang Liu, Haoyu Pei, Xiangyi Xiao, Xiaocong Du, Yihui Li, Suting Hong, Kunpeng Zhang, Haipeng Zhang

机构 * ShanghaiTech University(上海科技大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Maryland(马里兰大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SimVC-CAS,通过角色扮演基于的集体代理系统,预测初创企业成功并提高预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11284 2026-01-19 cs.HC cs.IR 50%

"Can You Tell Me?": Designing Copilots to Support Human Judgement in Online Information Seeking

你能告诉我吗?:设计支持在线信息寻求中人类判断的Copilot

Markus Bink, Marten Risius, Udo Kruschwitz, David Elsweiler

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一种基于LLM的Copilot,旨在支持用户在在线信息寻求中的判断,通过促进数字素养技能提升,但实验显示其在提升回答准确性和搜索参与度方面效果有限。

Comments Pre-Print accepted at CHIIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10849 2026-01-19 cs.MA 50%

Cooperative UAVs for Remote Data Collection under Limited Communications: An Asynchronous Multiagent Learning Framework

协同无人机在有限通信下的远程数据采集:一种异步多智能体学习框架

Cuong Le, Symeon Chatzinotas, Thang X. Vu

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种异步多智能体学习框架,用于解决有限通信下无人机协同数据采集的轨迹和带宽分配优化问题,提升能效和任务完成效率。

Comments Accepted to IEEE Transactions on Wireless Communications

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 3 篇

2506.00070 2026-01-19 cs.RO cs.AI 79%

Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics

Robot-R1: 通过强化学习提升机器人中的具身推理

Dongyoung Kim, Sumin Park, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学) UC Berkeley(加州大学伯克利分校) RLWRLD

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Robot-R1通过强化学习提升机器人中的具身推理,优于SFT方法并超越GPT-4o在低级动作控制推理任务中

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10725 2026-01-19 cs.RO math.OC 50%

Multi-Agent Formation Navigation Using Diffusion-Based Trajectory Generation

基于扩散的多智能体编队导航

Hieu Do Quang, Chien Truong-Quoc, Quoc Van Tran

机构 * Department of Mechatronics, School of Mechanical Engineering, Hanoi University of Science and Technology(机械工程系,河内科学与技术大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出基于扩散模型的多智能体编队导航方法,通过生成领头者中点轨迹实现平滑运动,有效应对复杂环境中的编队控制问题。

Comments 8 pages, 3 figures, full version of a paper submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11574 2026-01-19 cs.CV 50%

Evaluating Foundation Models' 3D Understanding Through Multi-View Correspondence Analysis

通过多视角对应分析评估基础模型的3D理解

Valentina Lilova, Toyesh Chakravorty, Julian I. Bibo, Emma Boccaletti, Brandon Li, Lívia Baxová, Cees G. M. Snoek, Mohammadreza Salehi

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种无需微调的3D场景理解基准,评估基础模型在多视角下的3D推理能力,展示DINO编码器在大视角变化下的竞争力。

Comments NeurIPS 2025 UniReps workshop, to be published in PMLR

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 3 篇

2601.11000 2026-01-19 cs.CL cs.AI 62%

When Personalization Misleads: Understanding and Mitigating Hallucinations in Personalized LLMs

当个性化误导:理解并缓解个性化大语言模型中的幻觉现象

Zhongxiang Sun, Yi Zhan, Chenglei Shen, Weijie Yu, Xiao Zhang, Ming He, Jun Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) AI Lab at Lenovo Research(联想研究院人工智能实验室) School of Artificial Intelligence and Data Science, University of International Business and Economics(国际商务与经济大学人工智能与数据科学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FPPS方法,通过轻量级推理时间策略缓解个性化大语言模型中的事实性幻觉问题,并引入PFQABench基准评估事实性和个性化问答性能。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25063 2026-01-19 cs.LG cs.CL 62%

Many Minds from One Model: Bayesian-Inspired Transformers for Population Diversity

一模多样:基于贝叶斯思想的变压器用于群体多样性

Diji Yang, Yi Zhang

机构 * University of California Santa Cruz(加州大学圣克ruz分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 B-Trans通过在归一化层中引入随机性,实现从单一预训练模型中采样出多样且连贯的变压器实例,提升响应多样性与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11359 2026-01-19 cs.CV cs.AI 57%

Think-Clip-Sample: Slow-Fast Frame Selection for Video Understanding

Think-Clip-Sample: 慢-快帧选择用于视频理解

Wenhui Tan, Ruihua Song, Jiaze Li, Jianzhong Ju, Zhenbo Luo

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 Think-Clip-Sample通过多查询推理和慢-快采样提升长视频理解的效率和效果

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 7 篇

2601.11255 2026-01-19 cs.CL cs.LG 81%

Reasoning in Trees: Improving Retrieval-Augmented Generation for Multi-Hop Question Answering

树状推理:改进多跳问题回答的检索增强生成

Yuling Shi, Maolin Sun, Zijun Liu, Mo Yang, Yixiong Fang, Tianran Sun, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 RT-RAG通过构建推理树来提升多跳问题回答的准确性和一致性,实验结果显示其在F1和EM指标上均优于现有方法。

Comments Accepted to GLOW@WWW2026. Code available at https://github.com/sakura20221/RT-RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10825 2026-01-19 cs.CL cs.CY cs.LG 81%

Reasoning Models Generate Societies of Thought

推理模型生成思想社会

Junsol Kim, Shiyang Lai, Nino Scherrer, Blaise Agüera y Arcas, James Evans

机构 * Google, Paradigms of Intelligence Team(谷歌,智能范式团队) University of Chicago(芝加哥大学) Santa Fe Institute(圣达菲研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 推理模型通过模拟多代理互动生成思想社会,提升推理准确性与多样性,揭示了社会结构对问题解决的促进作用。

详情

展开后加载摘要…

URL PDF HTML 收藏