arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-25 至 2025-11-25 共收录 126 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2511.19131 2025-11-25 cs.CL 87%

Eliciting Chain-of-Thought in Base LLMs via Gradient-Based Representation Optimization

通过基于梯度的表示优化在基础LLM中引导链式思维

Zijian Wang, Yanxiang Ma, Chang Xu

机构 * Zijian Wang, Yanxiang Ma, Chang Xu(作者)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 本文提出了一种基于概率条件生成的隐藏状态优化方法,通过梯度优化提升基础LLM的链式思维推理能力,有效解决隐藏状态操纵中的分布偏移问题。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14258 2025-11-25 cs.CL 83%

Entropy-Guided Reasoning Compression

熵引导的推理压缩

Hourun Zhu, Yang Gao, Wenlong Fei, Jiawei Li, Huashan Sun

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出熵引导的推理压缩框架,通过平衡熵变化引导模型在高效推理与探索之间取得平衡,实验表明在保持准确性的同时将推理长度压缩至原始的20%。

Comments 10pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18617 2025-11-25 cs.CR cs.LG 83%

DarkMind: Latent Chain-of-Thought Backdoor in Customized LLMs

DarkMind: 自定义大语言模型中的潜在推理链后门

Zhen Guo, Shanghao Shi, Shamim Yazdani, Ning Zhang, Reza Tourani

专题命中 数学推理 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.LG

AI总结 DarkMind是一种针对定制化大语言模型的潜在推理链后门攻击,通过操纵内部推理步骤实现隐蔽攻击,展示了高攻击成功率并揭示了推理层面安全威胁的紧迫性。

Comments 19 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17577 2025-11-25 cs.LG cs.AI cs.CL 82%

Efficient Mathematical Reasoning Models via Dynamic Pruning and Knowledge Distillation

通过动态剪枝和知识蒸馏实现高效的数学推理模型

Fengming Yu, Qingyu Meng, Haiwei Pan, Kejia Zhang

机构 * Harbin Engineering University(哈尔滨工程大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过动态剪枝和知识蒸馏优化方法,提升大型语言模型在数学推理任务中的效率与性能。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19333 2025-11-25 cs.CL 79%

Learning to Reason: Training LLMs with GPT-OSS or DeepSeek R1 Reasoning Traces

学习推理:通过GPT-OSS或DeepSeek R1推理轨迹训练LLMs

Shaltiel Shmidman, Asher Fredman, Oleg Sudakov, Meriem Bendris

机构 * DICTA NVIDIA

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究通过比较DeepSeek-R1和gpt-oss生成的推理轨迹对中型LLMs在数学问题上的微调效果,评估了推理轨迹在提升模型推理能力中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 5 篇

2505.20613 2025-11-25 cs.CL cs.AI cs.LG cs.LO 78%

REAL-Prover: Retrieval Augmented Lean Prover for Mathematical Reasoning

REAL-Prover:基于检索的Lean证明器用于数学推理

Ziju Shen, Naohao Huang, Fanyi Yang, Yutong Wang, Guoxiong Gao, Tianyi Xu, Jiedong Jiang, Wanyi He, Pu Yang, Mengzhou Sun, Haocheng Ju, Peihao Wu, Bryan Dai, Bin Dong

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) Ubiquant(Ubiquant公司) Beijing International Center for Mathematical Research(北京国际数学研究中心)

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 REAL-Prover基于检索增强的Lean证明器,通过微调大型语言模型和检索系统,在数学推理任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03469 2025-11-25 cs.AI cs.LO 74%

Bridging LLM Planning Agents and Formal Methods: A Case Study in Plan Verification

连接大语言模型规划代理与形式方法:计划验证的案例研究

Keshav Ramani, Vali Tawosi, Salwa Alamir, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 代码与定理证明 :planning(title);分类 cs.AI

AI总结 本文提出一种利用大语言模型将自然语言计划转换为形式化逻辑并进行验证的框架,展示了GPT-5在计划验证中的高准确率及形式化表示的生成能力。

Comments Accepted to AgenticSE Workshop at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19423 2025-11-25 q-bio.QM cs.AI 57%

Beyond Protein Language Models: An Agentic LLM Framework for Mechanistic Enzyme Design

超越蛋白质语言模型:一种用于机制酶设计的代理LLM框架

Bruno Jacob, Khushbu Agarwal, Marcel Baer, Peter Rice, Simone Raugei

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Genie-CAT通过整合文献推理、结构解析、静电势计算和机器学习预测,实现蛋白质设计中可解释的科学假设生成,提升计算发现效率。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18438 2025-11-25 cs.CR cs.SE 50%

LLMs as Firmware Experts: A Runtime-Grown Tree-of-Agents Framework

LLMs作为固件专家:一种运行时增长的代理树框架

Xiangrui Zhang, Zeyu Chen, Haining Wang, Qiang Li

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出FIRMHIVE框架,利用LLMs作为固件安全分析师,通过递归代理蜂群实现更深入的固件漏洞检测,提升漏洞识别率和精度。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22085 2025-11-25 cs.SE 50%

BOOP: Write Right Code

BOOP:写出正确的代码

Vaani Goenka, Aalok Thakkar

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 BOOP通过结构化框架提升编程教育中的计算思维能力,强调正确性优先的开发方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 9 篇

2511.17947 2025-11-25 cs.AI cs.IR 81%

Leveraging Evidence-Guided LLMs to Enhance Trustworthy Depression Diagnosis

利用证据引导的LLM提升可信的抑郁症诊断

Yining Yuan, J. Ben Tamo, Micky C. Nnamdi, Yifei Wang, May D. Wang

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 本文提出EGDR框架,通过证据引导推理和置信度评分提升抑郁症诊断的准确性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17909 2025-11-25 cs.AI 79%

ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models in Chemistry

ChemVTS-Bench: 评估多模态大语言模型在化学中的视觉-文本-符号推理能力

Zhiyuan Huang, Baichuan Yang, Zikun He, Yanhong Wu, Fang Hongyu, Zhenhe Liu, Lin Dongsheng, Bing Su

机构 * Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学) South China University of Technology(华南理工大学) Gaotu Techedu Inc(高图科技公司)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ChemVTS-Bench通过多模态输入评估大语言模型在化学中的视觉-文本-符号推理能力,揭示了结构化学的挑战及多模态融合的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17728 2025-11-25 math.RA cs.AI 79%

Ternary Gamma Semirings as a Novel Algebraic Framework for Learnable Symbolic Reasoning

三元Gamma半环作为可学习符号推理的新代数框架

Chandrasekhar Gokavarapu, D. Madhusudhana Rao

机构 * Government College (A), Rajahmundry, A.P., India(印度安得拉邦拉贾姆ун迪政府学院) Department of Mathematics, Acharya Nagarjuna University, Guntur, A.P., India(安得拉邦古尔塔阿查里亚纳加普大学数学系) Government College For Women(A), Guntur, Andhra Pradesh, India(印度安得拉邦古尔塔政府女子学院) Dept. of Mathematics,Acharya Nagarjuna University, Guntur, A.P., India(安得拉邦古尔塔阿查里亚纳加普大学数学系)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出神经三元半环,通过三元运算符替代传统二元乘法,为可学习符号推理提供数学严谨且有效的代数框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17672 2025-11-25 cs.AI 79%

Cognitive Inception: Agentic Reasoning against Visual Deceptions by Injecting Skepticism

认知 inception:通过注入怀疑进行视觉欺骗的代理推理

Yinjie Zhao, Heng Zhao, Bihan Wen, Joey Tianyi Zhou

机构 * CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)认知智能研究所,新加坡) IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)信息处理中心,新加坡) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院ROSE实验室)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Inception框架,通过注入怀疑提升LLM对视觉欺骗的抵御能力,实现可推广的真伪验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18964 2025-11-25 cs.AI 70%

Synthesizing Visual Concepts as Vision-Language Programs

合成视觉概念作为视觉-语言程序

Antonia Wüst, Wolfgang Stammer, Hikaru Shindo, Lukas Helff, Devendra Singh Dhami, Kristian Kersting

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本研究提出视觉-语言程序(VLP),结合视觉模型的感知灵活性与程序合成的系统推理能力,通过生成结构化视觉描述并编译成神经符号程序,提升复杂逻辑推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17638 2025-11-25 cs.LG cs.AI 62%

Model-to-Model Knowledge Transmission (M2KT): A Data-Free Framework for Cross-Model Understanding Transfer

模型到模型知识传输(M2KT):一种无数据的跨模型理解迁移框架

Pratham Sorte

机构 * Department of Computer Science(计算机科学系) Engineering MIT-World Peace University, Pune, India(工程学院 MIT-世界和平大学 印度邦普尼)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 M2KT提出了一种无数据的跨模型知识传输方法,通过概念空间交换知识包,实现高效的知识迁移和模型自我改进。

Comments 8 pages including figures, prepared in IEEE conference style. Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18718 2025-11-25 cs.RO cs.AI 57%

AIRHILT: A Human-in-the-Loop Testbed for Multimodal Conflict Detection in Aviation

AIRHILT:航空多模态冲突检测的人机交互测试平台

Omar Garib, Jayaprakash D. Kambhampaty, Olivia J. Pinon Fischer, Dimitri N. Mavris

机构 * Daniel Guggenheim School of Aerospace Engineering, Georgia Institute of Technology(丹尼尔·古根海姆航空航天工程学院,佐治亚理工学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 AIRHILT是一款用于航空多模态冲突检测的人机交互测试平台,通过集成ASR、视觉检测和决策模型,实现冲突检测的高效评估与研究。

Comments 9 pages, 4 figures, 1 table, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18604 2025-11-25 cs.RO cs.AI cs.MA 57%

An Analysis of Constraint-Based Multi-Agent Pathfinding Algorithms

基于约束的多智能体路径寻找算法分析

Hannah Lee, James D. Motes, Marco Morales, Nancy M. Amato

机构 * Parasol Lab, School of Computer Science, University of Illinois at Urbana Champaign(帕索尔实验室,计算机科学学院,伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science at Instituto Tecnológico Autónomo de México (ITAM)(墨西哥自治理工学院(ITAM)计算机科学系)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文分析了基于约束的多智能体路径寻找算法,探讨了保守型与激进型约束在不同场景下的性能差异,并提供了决策流程图以指导约束选择,同时强调了拓扑特征在多机器人运动规划中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17644 2025-11-25 cs.AI 57%

Hybrid Neuro-Symbolic Models for Ethical AI in Risk-Sensitive Domains

混合神经符号模型用于风险敏感领域的伦理AI

Chaitanya Kumar Kolli

机构 * Independent Researcher USA Email(独立研究者)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出混合神经符号模型,用于在风险敏感领域实现伦理AI,通过结合神经网络与符号推理,提升AI的可解释性和合规性。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 29 篇

2511.19155 2025-11-25 cs.AI 85%

EEG-VLM: A Hierarchical Vision-Language Model with Multi-Level Feature Alignment and Visually Enhanced Language-Guided Reasoning for EEG Image-Based Sleep Stage Prediction

EEG-VLM:一种具有多级特征对齐和视觉增强语言引导推理的分层视觉-语言模型,用于基于EEG图像的睡眠阶段预测

Xihe Qiu, Gengchen Ma, Haoyu Wang, Chen Zhan, Xiaoyu Tan, Shuo Li

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Department of Control Science and Engineering, College of Electronics and Information Engineering, Tongji University(同济大学电子信息工程学院控制科学与工程系) Tencent Youtu Lab(腾讯云视觉实验室) Case Western Reserve University(凯斯西储大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 EEG-VLM通过多级特征对齐和视觉增强语言引导推理,提升基于EEG图像的睡眠阶段分类的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08068 2025-11-25 cs.AI 84%

A Roadmap to Guide the Integration of LLMs in Hierarchical Planning

引导大型语言模型在分层规划中整合的路线图

Israel Puerta-Merino, Carlos Núñez-Molina, Pablo Mesejo, Juan Fernández-Olivares

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出了一条引导大型语言模型在分层规划中整合的路线图,通过分类整合方法和建立基准测试,探索LLMs在分层规划中的应用潜力。

Comments 5 pages, 0 figures, to be published in the AAAI Workshop on Planning in the Era of LLMs ( https://llmforplanning.github.io )

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18171 2025-11-25 cs.AI 83%

BPMN to PDDL: Translating Business Workflows for AI Planning

BPMN到PDDL:为AI规划翻译业务流程

Jasper Nie, Christian Muise, Victoria Armstrong

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本研究提出将BPMN 2.0转换为PDDL的框架,支持核心业务流程构造,并通过非确定性规划器生成和评估执行轨迹,为AI规划提供基础。

Comments 8 pages, 3 figures. Code and generated PDDL outputs available at https://github.com/QuMuLab/bpmn-to-pddl-translation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17986 2025-11-25 cs.CV cs.AI 83%

Plan-X: Instruct Video Generation via Semantic Planning

Plan-X: 通过语义规划指导视频生成

Lun Huang, You Xie, Hongyi Xu, Tianpei Gu, Chenxu Zhang, Guoxian Song, Zenan Li, Xiaochen Zhao, Linjie Luo, Guillermo Sapiro

机构 * Duke University(杜克大学) Princeton University(普林斯顿大学) ByteDance Intelligent Creation(字节跳动智能创作) Apple(苹果公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 Plan-X通过语义规划框架减少视频生成中的视觉幻觉,实现与多模态上下文一致的精细指令对齐生成。

Comments The project page is at https://byteaigc.github.io/Plan-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17506 2025-11-25 cs.NI cs.AI 83%

AURA: Adaptive Unified Reasoning and Automation with LLM-Guided MARL for NextG Cellular Networks

AURA: 一种基于LLM引导的多智能体强化学习的自适应统一推理与自动化方法用于NextG蜂窝网络

Narjes Nourzad, Mingyu Zong, Bhaskar Krishnamachari

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 AURA结合LLM推理与MARL适应性,通过信任机制平衡局部学习与外部输入,提升NextG网络的实时管理和动态流量处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18230 2025-11-25 cs.CR 82%

Think Fast: Real-Time IoT Intrusion Reasoning Using IDS and LLMs at the Edge Gateway

Think Fast: 在边缘网关使用IDS和LLMs实现实时物联网入侵推理

Saeid Jamshidi, Amin Nikanjam, Negar Shahabi, Kawser Wazed Nafi, Foutse Khomh, Samira Keivanpour, Rolando Herrero

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出一种在边缘网关使用IDS和LLMs实现实时物联网入侵检测的框架,通过整合轻量级ML模型和预训练大语言模型,提升检测准确性、语义可解释性和操作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18313 2025-11-25 cs.CL cs.DB cs.IR cs.LG 81%

Path-Constrained Retrieval: A Structural Approach to Reliable LLM Agent Reasoning Through Graph-Scoped Semantic Search

路径约束检索:一种通过图域语义搜索实现可靠LLM代理推理的结构方法

Joseph Oladokun

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 路径约束检索通过结合结构图约束与语义搜索,提升LLM代理推理的可靠性和一致性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19055 2025-11-25 eess.SY cs.AI cs.SY math.OC 79%

Large Language Model-Assisted Planning of Electric Vehicle Charging Infrastructure with Real-World Case Study

基于大语言模型的电动汽车充电基础设施规划与现实案例研究

Xinda Zheng, Canchen Jiang, Hao Wang

机构 * Department of Data Science and AI, Faculty of Information Technology, Monash University(数据科学与人工智能系,信息科技学院,莫纳什大学) Monash Energy Institute, Monash University(莫纳什能源研究所,莫纳什大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型优化电动汽车充电基础设施规划,通过空间-时间需求动态建模和分布式优化算法,实现实用案例中总成本降低30%。

Journal ref Sustainable Energy Technologies and Assessments, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18749 2025-11-25 cs.CL cs.CY cs.IR 79%

Large Language Models Require Curated Context for Reliable Political Fact-Checking -- Even with Reasoning and Web Search

大语言模型需要经过筛选的上下文才能可靠地进行政治事实核查——即使有推理和网络搜索

Matthew R. DeVerna, Kai-Cheng Yang, Harry Yaojun Yan, Filippo Menczer

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 大语言模型需通过筛选的上下文提升政治事实核查的可靠性,定制RAG系统显著提升宏F1指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11043 2025-11-25 cs.AI cs.RO 79%

Autonomous Vehicle Path Planning by Searching With Differentiable Simulation

通过可微模拟进行自动驾驶路径规划

Asen Nachkov, Jan-Nico Zaech, Danda Pani Paudel, Xi Wang, Luc Van Gool

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出DSS框架,利用可微模拟器Waymax进行路径规划,通过梯度下降优化动作序列,提升自动驾驶的跟踪和路径规划精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15668 2025-11-25 cs.AI cs.FL 79%

Preprint: Exploring Inevitable Waypoints for Unsolvability Explanation in Hybrid Planning Problems

预印本:探索不可回避的路径点以解释混合规划问题中的不可解性

Mir Md Sajid Sarwar, Rajarshi Ray

机构 * School of Mathematical and Computational Sciences, Indian Association for the Cultivation of Science, Kolkata(数学与计算科学学院,印度科学培养协会,科希马)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于最长公共子序列问题的新型方法,用于识别混合规划问题中的不可回避路径点,从而解释其不可解性。

Journal ref ACM Transactions on Embedded Computing Systems, Volume 24, Issue 6, Article No.: 163, Year: 09 Oct0ber 2025, Pages 1 - 20

详情

展开后加载摘要…

URL PDF HTML 收藏