arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-25 至 2025-11-25 共收录 50 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 50 篇

2511.19055 2025-11-25 eess.SY cs.AI cs.SY math.OC 89%

Large Language Model-Assisted Planning of Electric Vehicle Charging Infrastructure with Real-World Case Study

基于大语言模型的电动汽车充电基础设施规划与现实案例研究

Xinda Zheng, Canchen Jiang, Hao Wang

机构 * Department of Data Science and AI, Faculty of Information Technology, Monash University(数据科学与人工智能系,信息科技学院,莫纳什大学) Monash Energy Institute, Monash University(莫纳什能源研究所,莫纳什大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型优化电动汽车充电基础设施规划,通过空间-时间需求动态建模和分布式优化算法,实现实用案例中总成本降低30%。

Journal ref Sustainable Energy Technologies and Assessments, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18749 2025-11-25 cs.CL cs.CY cs.IR 88%

Large Language Models Require Curated Context for Reliable Political Fact-Checking -- Even with Reasoning and Web Search

大语言模型需要经过筛选的上下文才能可靠地进行政治事实核查——即使有推理和网络搜索

Matthew R. DeVerna, Kai-Cheng Yang, Harry Yaojun Yan, Filippo Menczer

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 大语言模型需通过筛选的上下文提升政治事实核查的可靠性,定制RAG系统显著提升宏F1指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23715 2025-11-25 cs.CL 88%

Don't Take the Premise for Granted: Evaluating the Premise Critique Ability of Large Language Models

不要轻信前提:评估大语言模型的前提批判能力

Jinzhe Li, Gengxu Li, Yi Chang, Yuan Wu

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出前提批判基准,评估大语言模型在面对错误前提时的批判能力,揭示其在推理与前提批判上的差异及改进需求。

Comments EMNLP 2025 Findings camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17909 2025-11-25 cs.AI 88%

ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models in Chemistry

ChemVTS-Bench: 评估多模态大语言模型在化学中的视觉-文本-符号推理能力

Zhiyuan Huang, Baichuan Yang, Zikun He, Yanhong Wu, Fang Hongyu, Zhenhe Liu, Lin Dongsheng, Bing Su

机构 * Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学) South China University of Technology(华南理工大学) Gaotu Techedu Inc(高图科技公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 ChemVTS-Bench通过多模态输入评估大语言模型在化学中的视觉-文本-符号推理能力,揭示了结构化学的挑战及多模态融合的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17584 2025-11-25 cs.LG cs.AI 88%

LLM-Powered Text-Attributed Graph Anomaly Detection via Retrieval-Augmented Reasoning

通过检索增强推理的大型语言模型驱动的文本属性图异常检测

Haoyan Xu, Ruizhi Qian, Zhengtao Yao, Ziyi Liu, Li Li, Yuqi Li, Yanshu Li, Wenqing Zheng, Daniele Rosa, Daniel Barcklow, Senthil Kumar, Jieyu Zhao, Yue Zhao

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于检索增强推理的LLM驱动文本属性图异常检测框架,通过生成语义连贯但上下文不一致的异常节点,提升异常检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18313 2025-11-25 cs.CL cs.DB cs.IR cs.LG 86%

Path-Constrained Retrieval: A Structural Approach to Reliable LLM Agent Reasoning Through Graph-Scoped Semantic Search

路径约束检索:一种通过图域语义搜索实现可靠LLM代理推理的结构方法

Joseph Oladokun

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 路径约束检索通过结合结构图约束与语义搜索,提升LLM代理推理的可靠性和一致性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17506 2025-11-25 cs.NI cs.AI 85%

AURA: Adaptive Unified Reasoning and Automation with LLM-Guided MARL for NextG Cellular Networks

AURA: 一种基于LLM引导的多智能体强化学习的自适应统一推理与自动化方法用于NextG蜂窝网络

Narjes Nourzad, Mingyu Zong, Bhaskar Krishnamachari

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AURA结合LLM推理与MARL适应性,通过信任机制平衡局部学习与外部输入,提升NextG网络的实时管理和动态流量处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03469 2025-11-25 cs.AI cs.LO 83%

Bridging LLM Planning Agents and Formal Methods: A Case Study in Plan Verification

连接大语言模型规划代理与形式方法:计划验证的案例研究

Keshav Ramani, Vali Tawosi, Salwa Alamir, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种利用大语言模型将自然语言计划转换为形式化逻辑并进行验证的框架,展示了GPT-5在计划验证中的高准确率及形式化表示的生成能力。

Comments Accepted to AgenticSE Workshop at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12509 2025-11-25 cs.AI 83%

Graph of Verification: Structured Verification of LLM Reasoning with Directed Acyclic Graphs

验证图:基于有向无环图的结构化LLM推理验证

Jiwei Fang, Bin Zhang, Changwei Wang, Jin Wan, Zhiwei Xu

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出验证图(GoV),通过灵活的节点块架构实现适应性多粒度验证,有效解决LLM推理验证中的精度与鲁棒性平衡问题。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17630 2025-11-25 cs.LG cs.AI cs.HC 82%

Can we use LLMs to bootstrap reinforcement learning? -- A case study in digital health behavior change

能否利用大语言模型(LLM)来引导强化学习?——数字健康行为改变的案例研究

Nele Albers, Esra Cemre Su de Groot, Loes Keijsers, Manon H. Hillegers, Emiel Krahmer

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文探讨了利用大语言模型生成用户交互样本以提升数字健康行为改变的强化学习效果,并通过实验验证了LLM生成样本的实用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19155 2025-11-25 cs.AI 79%

EEG-VLM: A Hierarchical Vision-Language Model with Multi-Level Feature Alignment and Visually Enhanced Language-Guided Reasoning for EEG Image-Based Sleep Stage Prediction

EEG-VLM:一种具有多级特征对齐和视觉增强语言引导推理的分层视觉-语言模型,用于基于EEG图像的睡眠阶段预测

Xihe Qiu, Gengchen Ma, Haoyu Wang, Chen Zhan, Xiaoyu Tan, Shuo Li

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Department of Control Science and Engineering, College of Electronics and Information Engineering, Tongji University(同济大学电子信息工程学院控制科学与工程系) Tencent Youtu Lab(腾讯云视觉实验室) Case Western Reserve University(凯斯西储大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 EEG-VLM通过多级特征对齐和视觉增强语言引导推理,提升基于EEG图像的睡眠阶段分类的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02162 2025-11-25 cs.RO cs.AI cs.HC 79%

Text to Robotic Assembly of Multi Component Objects using 3D Generative AI and Vision Language Models

通过3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装

Alexander Htet Kyaw, Richa Gupta, Dhruv Shah, Anoop Sinha, Kory Mathewson, Stefanie Pender, Sachin Chitta, Yotto Koga, Faez Ahmed, Lawrence Sass, Randall Davis

机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院) MIT(麻省理工学院) Google DeepMind(谷歌DeepMind) Google, Paradigms of Intelligence(谷歌、范式智能) Autodesk Research(Autodesk研究) MIT Mechanical Engineering(麻省理工学院机械工程系) MIT Architecture(麻省理工学院建筑系) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出利用3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装,通过多模态推理分解生成网格并优化组件分配。

Comments Accepted to NeurIPS 2025, Conference on Neural Information Processing Systems, Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18572 2025-11-25 cs.CV cs.LG 79%

GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model

GeoReasoner: 基于大规模视觉-语言模型的街景地理定位

Ling Li, Yu Ye, Yao Zhou, Bingchuan Jiang, Wei Zeng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tongji University(同济大学) Independent Researcher(独立研究者) Information Engineering University(信息工程大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 GeoReasoner通过整合外部知识和改进的微调方法,提升了街景地理定位的性能,优于现有模型并节省训练资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18743 2025-11-25 cs.CL cs.AI 79%

RhinoInsight: Improving Deep Research through Control Mechanisms for Model Behavior and Context

RhinoInsight: 通过模型行为和上下文的控制机制提升深度研究

Yu Lei, Shuzheng Si, Wei Wang, Yifei Wu, Gang Chen, Fanchao Qi, Maosong Sun

机构 * DeepLang AI Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Jiaotong University(北京交通大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RhinoInsight通过引入可验证检查表和证据审计两种控制机制,提升深度研究任务的鲁棒性和可追溯性,同时保持在深度搜索任务中的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14299 2025-11-25 cs.AI cs.CL cs.MA 79%

DataSage: Multi-agent Collaboration for Insight Discovery with External Knowledge Retrieval, Multi-role Debating, and Multi-path Reasoning

DataSage: 基于外部知识检索、多角色辩论和多路径推理的多智能体协作以实现洞察发现

Xiaochuan Liu, Yuanfeng Song, Xiaoming Yin, Xing Chen

机构 * ByteDance, China(字节跳动)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DataSage通过多智能体协作、外部知识检索和多路径推理,提升数据洞察发现的准确性和深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16353 2025-11-25 cs.CL cs.AI 79%

Lessons from Studying Two-Hop Latent Reasoning

从双跳潜在推理研究中获得的启示

Mikita Balesni, Tomek Korbak, Owain Evans

机构 * Apollo Research(Apollo研究机构) UK AI Security Institute(英国人工智能安全研究所) UC Berkeley(加州大学伯克利分校) TruthfulAI

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过双跳问答任务揭示LLM潜在推理能力,发现模型在合成事实组合上表现不足,但能处理混合事实场景,强调避免误判推理能力的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19333 2025-11-25 cs.CL 77%

Learning to Reason: Training LLMs with GPT-OSS or DeepSeek R1 Reasoning Traces

学习推理:通过GPT-OSS或DeepSeek R1推理轨迹训练LLMs

Shaltiel Shmidman, Asher Fredman, Oleg Sudakov, Meriem Bendris

机构 * DICTA NVIDIA

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本研究通过比较DeepSeek-R1和gpt-oss生成的推理轨迹对中型LLMs在数学问题上的微调效果,评估了推理轨迹在提升模型推理能力中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16660 2025-11-25 cs.AI 77%

Cognitive Foundations for Reasoning and Their Manifestation in LLMs

认知基础与推理及其在大语言模型中的体现

Priyanka Kargupta, Shuyue Stella Li, Haocheng Wang, Jinu Lee, Shan Chen, Orevaoghene Ahia, Dean Light, Thomas L. Griffiths, Max Kleiman-Weiner, Jiawei Han, Asli Celikyilmaz, Yulia Tsvetkov

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析LLMs推理机制,揭示其在复杂问题上的表现优于简单变体,提出基于认知科学的28项元素分类,并开发测试时推理指导方法,提升复杂问题性能达66.7%。

Comments 40 pages, 4 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09755 2025-11-25 cs.CE cs.AI 77%

Intelligent Design 4.0: Paradigm Evolution Toward the Agentic AI Era

智能设计4.0:迈向代理AI时代的范式演变

Shuo Jiang, Min Xie, Frank Youhua Chen, Jian Ma, Jianxi Luo

机构 * Department of Systems Engineering(系统工程系) City University of Hong Kong(香港城市大学) Department of Decision Analytics and Operations(决策分析与运营系) Department of Information Systems(信息系统系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出智能设计4.0范式,基于基础模型的代理AI系统,推动工程设计的自动化与智能化发展。

Comments 17 pages, 7 figures

Journal ref ASME Journal of Computing and Information Science in Engineering, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18165 2025-11-25 cs.SE cs.AI 77%

Towards a General Framework for HTN Modeling with LLMs

迈向基于LLM的HTN建模通用框架

Israel Puerta-Merino, Carlos Núñez-Molina, Pablo Mesejo, Juan Fernández-Olivares

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出L2HP框架,用于改进LLM在分层规划建模中的能力,通过实验发现分层规划的建模难度显著高于自动规划。

Comments 10 pages, 5 figures, to be published in the Workshop on Planning in the Era of LLMs ( LM4Plan - https://llmforplanning.github.io ) and the Workshop on Hierarchical Planning ( HPlan - https://icaps25.icaps-conference.org/program/workshops/hplan/ ), both in the International Conference on Automated Planning and Scheduling (ICAPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17947 2025-11-25 cs.AI cs.IR 77%

Leveraging Evidence-Guided LLMs to Enhance Trustworthy Depression Diagnosis

利用证据引导的LLM提升可信的抑郁症诊断

Yining Yuan, J. Ben Tamo, Micky C. Nnamdi, Yifei Wang, May D. Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出EGDR框架,通过证据引导推理和置信度评分提升抑郁症诊断的准确性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17672 2025-11-25 cs.AI 77%

Cognitive Inception: Agentic Reasoning against Visual Deceptions by Injecting Skepticism

认知 inception:通过注入怀疑进行视觉欺骗的代理推理

Yinjie Zhao, Heng Zhao, Bihan Wen, Joey Tianyi Zhou

机构 * CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)认知智能研究所,新加坡) IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)信息处理中心,新加坡) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院ROSE实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Inception框架,通过注入怀疑提升LLM对视觉欺骗的抵御能力,实现可推广的真伪验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08068 2025-11-25 cs.AI 77%

A Roadmap to Guide the Integration of LLMs in Hierarchical Planning

引导大型语言模型在分层规划中整合的路线图

Israel Puerta-Merino, Carlos Núñez-Molina, Pablo Mesejo, Juan Fernández-Olivares

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一条引导大型语言模型在分层规划中整合的路线图,通过分类整合方法和建立基准测试,探索LLMs在分层规划中的应用潜力。

Comments 5 pages, 0 figures, to be published in the AAAI Workshop on Planning in the Era of LLMs ( https://llmforplanning.github.io )

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22888 2025-11-25 cs.IR 75%

MGFRec: Towards Reinforced Reasoning Recommendation with Multiple Groundings and Feedback

MGFRec: 向多接地与反馈的强化推理推荐迈进

Shihao Cai, Chongming Gao, Haoyan Liu, Wentao Shi, Jianshan Sun, Ruiming Tang, Fuli Feng

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MGFRec通过多轮接地和反馈机制提升推荐系统中推理与实际物品空间的一致性,改进推荐效果。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20613 2025-11-25 cs.CL cs.AI cs.LG cs.LO 75%

REAL-Prover: Retrieval Augmented Lean Prover for Mathematical Reasoning

REAL-Prover:基于检索的Lean证明器用于数学推理

Ziju Shen, Naohao Huang, Fanyi Yang, Yutong Wang, Guoxiong Gao, Tianyi Xu, Jiedong Jiang, Wanyi He, Pu Yang, Mengzhou Sun, Haocheng Ju, Peihao Wu, Bryan Dai, Bin Dong

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) Ubiquant(Ubiquant公司) Beijing International Center for Mathematical Research(北京国际数学研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 REAL-Prover基于检索增强的Lean证明器,通过微调大型语言模型和检索系统,在数学推理任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18438 2025-11-25 cs.CR cs.SE 75%

LLMs as Firmware Experts: A Runtime-Grown Tree-of-Agents Framework

LLMs作为固件专家:一种运行时增长的代理树框架

Xiangrui Zhang, Zeyu Chen, Haining Wang, Qiang Li

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出FIRMHIVE框架,利用LLMs作为固件安全分析师,通过递归代理蜂群实现更深入的固件漏洞检测,提升漏洞识别率和精度。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18001 2025-11-25 cs.SE 75%

Enhancing Automated Program Repair via Faulty Token Localization and Quality-Aware Patch Refinement

通过故障性令牌定位和质量感知补丁细化增强自动程序修复

Jiaolong Kong, Xiaofei Xie, Yiheng Xiong, Yuekun Wang, Jian Wang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 TokenRepair通过内部反思定位潜在故障令牌并结合质量感知的外部反馈,提升自动程序修复的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22633 2025-11-25 cs.CL cs.AI cs.CV cs.LG cs.MM 75%

Spatial Knowledge Graph-Guided Multimodal Synthesis

基于空间知识图的多模态合成

Yida Xue, Zhen Bi, Jinnan Yang, Jungang Lou, Kehai Chen, Min Zhang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Nanjing University of Science and Technology(南京理工大学) Huzhou University(湖州大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SKG2DATA通过空间知识图引导多模态合成,提升多模态大语言模型的空间感知与推理能力。

Comments IEEE/ACM Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19097 2025-11-25 cs.CL 74%

DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF

DeCoRL:通过并行子步骤生成和级联强化学习解耦推理链

Ziyuan Gao, Di Liang, Xianjie Wu, Philippe Morel, Minlong Peng

机构 * Ziyuan Gao 1(某大学) Di Liang 2(某大学) Xianjie Wu 3(某大学) Philippe Morel 1(某大学) Minlong Peng 2(某大学)

专题命中 推理与问题求解 :RLHF(title);分类 cs.CL

AI总结 DeCoRL通过并行子步骤生成和级联强化学习,实现了推理链的解耦,提升了推理效率、可解释性和系统性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13837 2025-11-25 cs.AI cs.CL cs.CV 73%

Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

强化学习真的能激励大语言模型在基础模型之外提升推理能力吗?

Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Yang Yue, Shiji Song, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学 LeapLab) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现RLVR方法未有效激发LLMs的新型推理能力,而蒸馏方法能更有效地扩展模型推理能力。

Comments 31 pages, 27 figures

Journal ref NeurIPS 2025 Oral; ICML 2025 AI4MATH workshop best paper

详情

展开后加载摘要…

URL PDF HTML 收藏