arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-25 至 2025-11-25 共收录 375 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 50 篇

2511.19333 2025-11-25 cs.CL 77%

Learning to Reason: Training LLMs with GPT-OSS or DeepSeek R1 Reasoning Traces

学习推理:通过GPT-OSS或DeepSeek R1推理轨迹训练LLMs

Shaltiel Shmidman, Asher Fredman, Oleg Sudakov, Meriem Bendris

机构 * DICTA NVIDIA

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本研究通过比较DeepSeek-R1和gpt-oss生成的推理轨迹对中型LLMs在数学问题上的微调效果,评估了推理轨迹在提升模型推理能力中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16660 2025-11-25 cs.AI 77%

Cognitive Foundations for Reasoning and Their Manifestation in LLMs

认知基础与推理及其在大语言模型中的体现

Priyanka Kargupta, Shuyue Stella Li, Haocheng Wang, Jinu Lee, Shan Chen, Orevaoghene Ahia, Dean Light, Thomas L. Griffiths, Max Kleiman-Weiner, Jiawei Han, Asli Celikyilmaz, Yulia Tsvetkov

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析LLMs推理机制,揭示其在复杂问题上的表现优于简单变体,提出基于认知科学的28项元素分类,并开发测试时推理指导方法,提升复杂问题性能达66.7%。

Comments 40 pages, 4 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09755 2025-11-25 cs.CE cs.AI 77%

Intelligent Design 4.0: Paradigm Evolution Toward the Agentic AI Era

智能设计4.0:迈向代理AI时代的范式演变

Shuo Jiang, Min Xie, Frank Youhua Chen, Jian Ma, Jianxi Luo

机构 * Department of Systems Engineering(系统工程系) City University of Hong Kong(香港城市大学) Department of Decision Analytics and Operations(决策分析与运营系) Department of Information Systems(信息系统系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出智能设计4.0范式,基于基础模型的代理AI系统,推动工程设计的自动化与智能化发展。

Comments 17 pages, 7 figures

Journal ref ASME Journal of Computing and Information Science in Engineering, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18165 2025-11-25 cs.SE cs.AI 77%

Towards a General Framework for HTN Modeling with LLMs

迈向基于LLM的HTN建模通用框架

Israel Puerta-Merino, Carlos Núñez-Molina, Pablo Mesejo, Juan Fernández-Olivares

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出L2HP框架,用于改进LLM在分层规划建模中的能力,通过实验发现分层规划的建模难度显著高于自动规划。

Comments 10 pages, 5 figures, to be published in the Workshop on Planning in the Era of LLMs ( LM4Plan - https://llmforplanning.github.io ) and the Workshop on Hierarchical Planning ( HPlan - https://icaps25.icaps-conference.org/program/workshops/hplan/ ), both in the International Conference on Automated Planning and Scheduling (ICAPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17947 2025-11-25 cs.AI cs.IR 77%

Leveraging Evidence-Guided LLMs to Enhance Trustworthy Depression Diagnosis

利用证据引导的LLM提升可信的抑郁症诊断

Yining Yuan, J. Ben Tamo, Micky C. Nnamdi, Yifei Wang, May D. Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出EGDR框架,通过证据引导推理和置信度评分提升抑郁症诊断的准确性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17672 2025-11-25 cs.AI 77%

Cognitive Inception: Agentic Reasoning against Visual Deceptions by Injecting Skepticism

认知 inception:通过注入怀疑进行视觉欺骗的代理推理

Yinjie Zhao, Heng Zhao, Bihan Wen, Joey Tianyi Zhou

机构 * CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)认知智能研究所,新加坡) IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)信息处理中心,新加坡) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院ROSE实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Inception框架,通过注入怀疑提升LLM对视觉欺骗的抵御能力,实现可推广的真伪验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08068 2025-11-25 cs.AI 77%

A Roadmap to Guide the Integration of LLMs in Hierarchical Planning

引导大型语言模型在分层规划中整合的路线图

Israel Puerta-Merino, Carlos Núñez-Molina, Pablo Mesejo, Juan Fernández-Olivares

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一条引导大型语言模型在分层规划中整合的路线图,通过分类整合方法和建立基准测试,探索LLMs在分层规划中的应用潜力。

Comments 5 pages, 0 figures, to be published in the AAAI Workshop on Planning in the Era of LLMs ( https://llmforplanning.github.io )

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22888 2025-11-25 cs.IR 75%

MGFRec: Towards Reinforced Reasoning Recommendation with Multiple Groundings and Feedback

MGFRec: 向多接地与反馈的强化推理推荐迈进

Shihao Cai, Chongming Gao, Haoyan Liu, Wentao Shi, Jianshan Sun, Ruiming Tang, Fuli Feng

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MGFRec通过多轮接地和反馈机制提升推荐系统中推理与实际物品空间的一致性,改进推荐效果。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20613 2025-11-25 cs.CL cs.AI cs.LG cs.LO 75%

REAL-Prover: Retrieval Augmented Lean Prover for Mathematical Reasoning

REAL-Prover:基于检索的Lean证明器用于数学推理

Ziju Shen, Naohao Huang, Fanyi Yang, Yutong Wang, Guoxiong Gao, Tianyi Xu, Jiedong Jiang, Wanyi He, Pu Yang, Mengzhou Sun, Haocheng Ju, Peihao Wu, Bryan Dai, Bin Dong

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) Ubiquant(Ubiquant公司) Beijing International Center for Mathematical Research(北京国际数学研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 REAL-Prover基于检索增强的Lean证明器,通过微调大型语言模型和检索系统,在数学推理任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18438 2025-11-25 cs.CR cs.SE 75%

LLMs as Firmware Experts: A Runtime-Grown Tree-of-Agents Framework

LLMs作为固件专家:一种运行时增长的代理树框架

Xiangrui Zhang, Zeyu Chen, Haining Wang, Qiang Li

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出FIRMHIVE框架,利用LLMs作为固件安全分析师,通过递归代理蜂群实现更深入的固件漏洞检测,提升漏洞识别率和精度。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18001 2025-11-25 cs.SE 75%

Enhancing Automated Program Repair via Faulty Token Localization and Quality-Aware Patch Refinement

通过故障性令牌定位和质量感知补丁细化增强自动程序修复

Jiaolong Kong, Xiaofei Xie, Yiheng Xiong, Yuekun Wang, Jian Wang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 TokenRepair通过内部反思定位潜在故障令牌并结合质量感知的外部反馈,提升自动程序修复的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22633 2025-11-25 cs.CL cs.AI cs.CV cs.LG cs.MM 75%

Spatial Knowledge Graph-Guided Multimodal Synthesis

基于空间知识图的多模态合成

Yida Xue, Zhen Bi, Jinnan Yang, Jungang Lou, Kehai Chen, Min Zhang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Nanjing University of Science and Technology(南京理工大学) Huzhou University(湖州大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SKG2DATA通过空间知识图引导多模态合成,提升多模态大语言模型的空间感知与推理能力。

Comments IEEE/ACM Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19097 2025-11-25 cs.CL 74%

DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF

DeCoRL:通过并行子步骤生成和级联强化学习解耦推理链

Ziyuan Gao, Di Liang, Xianjie Wu, Philippe Morel, Minlong Peng

机构 * Ziyuan Gao 1(某大学) Di Liang 2(某大学) Xianjie Wu 3(某大学) Philippe Morel 1(某大学) Minlong Peng 2(某大学)

专题命中 推理与问题求解 :RLHF(title);分类 cs.CL

AI总结 DeCoRL通过并行子步骤生成和级联强化学习,实现了推理链的解耦,提升了推理效率、可解释性和系统性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13837 2025-11-25 cs.AI cs.CL cs.CV 73%

Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

强化学习真的能激励大语言模型在基础模型之外提升推理能力吗?

Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Yang Yue, Shiji Song, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学 LeapLab) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现RLVR方法未有效激发LLMs的新型推理能力,而蒸馏方法能更有效地扩展模型推理能力。

Comments 31 pages, 27 figures

Journal ref NeurIPS 2025 Oral; ICML 2025 AI4MATH workshop best paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06567 2025-11-25 cs.LG cs.AI 73%

Human Cognition Inspired RAG with Knowledge Graph for Complex Problem Solving

受人类认知启发的基于知识图谱的RAG用于复杂问题解决

Yao Cheng, Yibo Zhao, Jiapeng Zhu, Yao Liu, Xing Sun, Xiang Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CogGRAG是一种受人类认知启发的基于图的RAG框架,通过树状思维图结构实现复杂问题分解、知识检索与推理,提升知识图谱问答的准确性和可靠性。

Comments The paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19131 2025-11-25 cs.CL 70%

Eliciting Chain-of-Thought in Base LLMs via Gradient-Based Representation Optimization

通过基于梯度的表示优化在基础LLM中引导链式思维

Zijian Wang, Yanxiang Ma, Chang Xu

机构 * Zijian Wang, Yanxiang Ma, Chang Xu(作者)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于概率条件生成的隐藏状态优化方法,通过梯度优化提升基础LLM的链式思维推理能力,有效解决隐藏状态操纵中的分布偏移问题。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18964 2025-11-25 cs.AI 70%

Synthesizing Visual Concepts as Vision-Language Programs

合成视觉概念作为视觉-语言程序

Antonia Wüst, Wolfgang Stammer, Hikaru Shindo, Lukas Helff, Devendra Singh Dhami, Kristian Kersting

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本研究提出视觉-语言程序(VLP),结合视觉模型的感知灵活性与程序合成的系统推理能力,通过生成结构化视觉描述并编译成神经符号程序,提升复杂逻辑推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18864 2025-11-25 cs.CL 70%

Think Before You Prune: Selective Self-Generated Calibration for Pruning Large Reasoning Models

在剪枝前思考:为剪枝大型推理模型的自生成校准

Yang Xiang, Yixin Ji, Juntao Li, Min Zhang

机构 * Soochow University(苏州大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种选择性自生成推理数据策略,通过自生成的校准数据提升大型推理模型剪枝后的推理能力,实验结果显示性能提升10%-13%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18714 2025-11-25 cs.AI cs.CY 70%

MAGMA-Edu: Multi-Agent Generative Multimodal Framework for Text-Diagram Educational Question Generation

MAGMA-Edu:多智能体生成多模态框架用于文本-图表教育问题生成

Zhenyu Wu, Jian Li, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MAGMA-Edu通过多智能体框架实现教育问题生成,提升文本与图像的一致性,达到多模态教育内容生成的新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15065 2025-11-25 cs.CV cs.AI 70%

Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks

通过视频推理:首次评估视频模型在迷宫解决任务中的推理能力

Cheng Yang, Haiyuan Wan, Yiran Peng, Xin Cheng, Zhaoyang Yu, Jiayi Zhang, Junchi Yu, Xinlei Yu, Xiawu Zheng, Dongzhan Zhou, Chenglin Wu

机构 * DeepWisdom Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学) Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本文首次评估视频模型在迷宫解决任务中的推理能力,提出VR-Bench基准,展示视频生成在空间推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06345 2025-11-25 cs.DC cs.AI 70%

PRAGMA: A Profiling-Reasoned Multi-Agent Framework for Automatic Kernel Optimization

PRAGMA:一种基于剖析的多智能体框架用于自动内核优化

Kelun Lei, Hailong Yang, Huaitao Zhang, Xin You, Kaige Zhang, Zhongzhi Luan, Yi Liu, Depei Qian

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PRAGMA通过整合执行反馈和硬件剖析,利用AI生成高性能内核,实现比现有方法更优的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18617 2025-11-25 cs.CR cs.LG 70%

DarkMind: Latent Chain-of-Thought Backdoor in Customized LLMs

DarkMind: 自定义大语言模型中的潜在推理链后门

Zhen Guo, Shanghao Shi, Shamim Yazdani, Ning Zhang, Reza Tourani

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 DarkMind是一种针对定制化大语言模型的潜在推理链后门攻击,通过操纵内部推理步骤实现隐蔽攻击,展示了高攻击成功率并揭示了推理层面安全威胁的紧迫性。

Comments 19 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18436 2025-11-25 cs.CL 70%

Can Code-Switched Texts Activate a Knowledge Switch in LLMs? A Case Study on English-Korean Code-Switching

代码切换文本能否在LLMs中激活知识切换?一种英语-韩语代码切换案例研究

Seoyeon Kim, Huiseo Kim, Chanjun Park, Jinyoung Yeo, Dongha Lee

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过EnKoQA数据集探讨代码切换是否能激活LLMs中的知识,发现其在低资源语言任务中具有潜力。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18450 2025-11-25 cs.AI 70%

ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints

ORIGAMISPACE:基于数学约束的多模态大语言模型多步空间推理基准测试

Rui Xu, Dakuan Lu, Zicheng Zhao, Xiaoyu Tan, Xintao Wang, Siyu Yuan, Jiangjie Chen, Yinghui Xu

机构 * Fudan University(复旦大学) SII INF Technology(INF技术)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ORIGAMISPACE通过折纸任务评估多模态大语言模型在多步空间推理和数学约束处理中的能力,提出四个评估任务并探索强化学习训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10353 2025-11-25 cs.CV 67%

Motion-R1: Enhancing Motion Generation with Decomposed Chain-of-Thought and RL Binding

Motion-R1: 通过分解的链式推理与RL绑定增强运动生成

Runqi Ouyang, Haoyun Li, Zhenyuan Zhang, Xiaofeng Wang, Zeyu Zhang, Zheng Zhu, Guan Huang, Sirui Han, Xingang Wang

机构 * GigaAI CASIA HKUST(香港科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 Motion-R1通过结合分解的链式推理与强化学习,提升运动生成的质量和可解释性,实现多项指标的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18437 2025-11-25 cs.CV 67%

Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning

基于感知证据的强化学习用于多模态推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Zhixiong Zeng, Siqi Yang, Peng Shi, Lin Ma, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Meituan Inc(美团公司) The University of Sydney(悉尼大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 PEARL通过将推理锚定在验证的视觉证据上,提升多模态推理能力,有效解决视觉幻觉和奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17952 2025-11-25 cs.CV 67%

Multi-speaker Attention Alignment for Multimodal Social Interaction

多说话者注意力对齐用于多模态社交互动

Liangyang Ouyang, Yifei Huang, Mingfang Zhang, Caixin Kang, Ryosuke Furuta, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种多模态多说话者注意力对齐方法,通过动态头选择和自适应注意力偏差提升多模态社交互动理解能力,实现SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17755 2025-11-25 cs.CV 67%

CORA: Consistency-Guided Semi-Supervised Framework for Reasoning Segmentation

CORA: 一致性引导的半监督框架用于推理分割

Prantik Howlader, Hoang Nguyen-Canh, Srijan Das, Jingyi Xu, Hieu Le, Dimitris Samaras

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract)

AI总结 CORA通过一致性引导的半监督方法实现高效推理分割,在Cityscapes和PanNuke数据集上分别提升2.3%和2.4%

Comments WACV 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23229 2025-11-25 cs.CR 67%

Fine-Grained Privacy Extraction from Retrieval-Augmented Generation Systems via Knowledge Asymmetry Exploitation

通过知识不对称利用从检索增强生成系统中进行细粒度隐私提取

Yufei Chen, Yao Wang, Haibin Zhang, Tao Gu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出一种利用知识不对称性从RAG系统中细粒度提取隐私信息的攻击框架,通过自适应提示和神经网络训练实现高隐私提取率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04763 2025-11-25 cs.LO cs.CL cs.LG cs.PL 62%

MiniF2F in Rocq: Automatic Translation Between Proof Assistants -- A Case Study

MiniF2F在Rocq中的应用:证明助手间的自动翻译——一个案例研究

Jules Viennot, Guillaume Baudart, Emilio Jesùs Gallego Arias, Marc Lelarge

机构 * IRIF, Université Paris Cité, Inria, CNRS(IRIF、巴黎城市大学、Inria、CNRS) IRIF, Université Paris Cité, CNRS(IRIF、巴黎城市大学、CNRS) DI ENS, PSL University, Inria(ENS巴黎研究院、巴黎综合理工大学、Inria)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.LG

AI总结 本研究利用先进LLM将MiniF2F翻译成Rocq,通过多阶段实验实现高精度翻译,成功翻译478个定理,数据集开源。

详情

展开后加载摘要…

URL PDF HTML 收藏