arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-30 至 2026-01-30 共收录 36 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 36 篇

2601.21212 2026-01-30 cs.AI cs.CY 89%

Intelli-Planner: Towards Customized Urban Planning via Large Language Model Empowered Reinforcement Learning

Intelli-Planner: 通过大型语言模型赋能的强化学习实现定制化城市规划

Xixian Yong, Peilin Sun, Zihe Wang, Xiao Zhou

机构 * Gaoling School of Artificial Intelligence\ University of China Beijing China Gaoling School of Artificial Intelligence\ University of China

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Intelli-Planner通过结合深度强化学习与大型语言模型,实现定制化城市规划,提升规划方案的参与度和满意度。

Comments The Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21181 2026-01-30 cs.AI 88%

MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models

MAD:用于减轻多模态大语言模型中跨模态幻觉的模态自适应解码

Sangyun Chung, Se Yeon Kim, Youngchae Chee, Yong Man Ro

机构 * Integrated Vision Language Lab, KAIST, South Korea(韩国科学技术院集成视觉语言实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 MAD通过自适应加权对比解码分支,有效减少多模态大语言模型中的跨模态幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21210 2026-01-30 cs.AI 85%

Uncovering Hidden Correctness in LLM Causal Reasoning via Symbolic Verification

通过符号验证揭示LLM因果推理中的隐藏正确性

Paul He, Yinya Huang, Mrinmaya Sachan, Zhijing Jin

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) ETH Zürich(苏黎世联邦理工学院) MPI for Intelligent Systems(智能系统研究所) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DoVerifier,通过符号验证揭示LLM因果推理中的隐藏正确性,提升因果推理评估的严谨性与信息量。

Comments EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21113 2026-01-30 cs.AI cs.MA 85%

Planner-Auditor Twin: Agentic Discharge Planning with FHIR-Based LLM Planning, Guideline Recall, Optional Caching and Self-Improvement

计划-审核双胞胎:基于FHIR的LLM计划、指南回忆、可选缓存和自我改进的代理出院计划

Kaiyuan Wu, Aditya Nagori, Rishikesan Kamaleswaran

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 基于FHIR的LLM计划与审核框架,通过自我改进和缓存优化,提升临床出院计划的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20090 2026-01-30 cs.AI 85%

Should I Have Expressed a Different Intent? Counterfactual Generation for LLM-Based Autonomous Control

我本应表达不同的意图?基于LLM的自主控制的反事实生成

Amirmohammad Farzaneh, Salvatore D'Oro, Osvaldo Simeone

机构 * Department of Engineering, King's College London, London, UK(伦敦大学金史密斯学院工程系) Intelligent Networked Systems Institute (INSI), Northeastern University, Boston, MA, USA(东北大学智能网络系统研究所) Intelligent Networked Systems Institute (INSI), Northeastern University, London, UK(伦敦大学东北大学智能网络系统研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于结构因果模型的反事实生成方法,通过概率性反事实生成和离线校准,为LLM驱动的自主控制提供可靠反事实推理,展示了在无线网络控制中的显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19510 2026-01-30 cs.RO cs.CL 85%

ALRM: Agentic LLM for Robotic Manipulation

ALRM:用于机器人操作的代理LLM

Vitor Gaboardi dos Santos, Ibrahim Khadraoui, Ibrahim Farhat, Hamza Yous, Samy Teffahi, Hakim Hacid

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ALRM提出了一种基于LLM的代理框架,通过ReAct推理循环实现机器人操作的模块化执行,支持代码生成和工具规划模式,实验表明其在多步骤推理和语言多样性任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21876 2026-01-30 cs.RO 85%

LLM-Driven Scenario-Aware Planning for Autonomous Driving

基于大语言模型的场景感知规划用于自动驾驶

He Li, Zhaowei Chen, Rui Gao, Guoliang Li, Qi Hao, Shuai Wang, Chengzhong Xu

机构 * University of Macau(澳门大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Southern University of Science and Technology(南方科技大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出LAP,一种基于大语言模型的自适应规划方法,通过场景理解与联合优化实现自动驾驶中的高速与精确驾驶平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09101 2026-01-30 cs.HC 85%

A Survey of LLM Alignment: Instruction Understanding, Intention Reasoning, and Reliable Generation

大型语言模型对齐综述:指令理解、意图推理和可靠生成

Zongyu Chang, Feihong Lu, Ziqin Zhu, Qian Li, Cheng Ji, Tao Yang, Zhuo Chen, Hao Peng, Yang Liu, Ruifeng Xu, Yangqiu Song, Jianxin Li, Shangguang Wang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了大型语言模型在指令理解、意图推理和可靠生成方面的挑战与解决方案,旨在提升模型在现实应用中的可靠性与适应性。

Comments 37 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01203 2026-01-30 cs.SI 85%

HetGCoT: Heterogeneous Graph-Enhanced Chain-of-Thought LLM Reasoning for Academic Question Answering

HetGCoT:异构图增强的链式思考LLM推理用于学术问答

Runsong Jia, Mengjia Wu, Ying Ding, Jie Lu, Yi Zhang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 HetGCoT通过异构图增强链式思考LLM推理,提升学术问答的可解释性和准确性。

Comments Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21894 2026-01-30 cs.LG 83%

Not All Code Is Equal: A Data-Centric Study of Code Complexity and LLM Reasoning

并非所有代码都同等重要:一项以数据为中心的代码复杂度与大语言模型推理研究

Lukas Twist, Shu Yang, Hanqi Yan, Jingzhi Gong, Di Wang, Helen Yannakoudakis, Jie M. Zhang

机构 * King's College London, United Kingdom(伦敦国王学院) King Abdullah University of Science(阿卜杜勒阿齐兹国王科学大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过研究代码结构复杂性对大语言模型推理能力的影响,发现结构特性在提升推理性能中起关键作用,优于单纯扩大训练数据规模。

Comments 16 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21199 2026-01-30 cs.CV cs.AI 83%

Thinker: A vision-language foundation model for embodied intelligence

Thinker:一个用于具身智能的视觉-语言基础模型

Baiyu Pan, Daqin Luo, Junpeng Yang, Jiyuan Wang, Yixuan Zhang, Hailin Shi, Jichao Jiao

专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 Thinker通过构建大规模数据集和改进输入方式,在机器人感知与推理任务中实现了最先进的性能。

Comments IROS 2025, 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10996 2026-01-30 cs.CL 83%

RAS: Retrieval-And-Structuring for Knowledge-Intensive LLM Generation

RAS:基于检索与构建的知识密集型大语言模型生成

Pengcheng Jiang, Lang Cao, Ruike Zhu, Minhao Jiang, Yunyi Zhang, Jiaming Shen, Jimeng Sun, Jiawei Han

机构 * Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RAS通过动态构建问题特定知识图谱,提升大语言模型在知识密集型任务中的推理准确性和鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21192 2026-01-30 cs.AI cs.CL 82%

Do Reasoning Models Enhance Embedding Models?

推理模型能增强嵌入模型吗?

Wun Yu Chan, Shaojin Chen, Huihao Jing, Kwun Hang Lau, Elton Chun-Chai Li, Zihao Wang, Haoran Li, Yangqiu Song

机构 * CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文研究了推理模型是否能提升嵌入模型的性能,发现其初始化对对比学习效果无显著影响,并提出HRSA框架揭示流形重新对齐现象。

Comments 10 main pages, 18 appendix pages, 13 figures, 11 tables, 4 prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22035 2026-01-30 cs.CL cs.AI 81%

Thinking Out of Order: When Output Order Stops Reflecting Reasoning Order in Diffusion Language Models

脱离顺序思考:当输出顺序不再反映推理顺序时扩散语言模型的表现

Longxuan Yu, Yu Fu, Shaorong Zhang, Hui Liu, Mukund Varma T, Greg Ver Steeg, Yue Dong

机构 * University of California, Riverside, CA, USA(加州大学河滨分校) Independent Researcher(独立研究者) University of California, San Diego, CA, USA(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出屏蔽扩散语言模型(MDLMs)在处理输出顺序与推理顺序不一致时展现出的顺序鲁棒性,通过实验验证其在不同基准上的稳定性能。

Comments 18 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17915 2026-01-30 cs.AI cs.LG cs.LO 81%

Think Locally, Explain Globally: Graph-Guided LLM Investigations via Local Reasoning and Belief Propagation

局部思考,全球解释:通过局部推理和信念传播的图引导LLM研究

Saurabh Jha, Rohan Arora, Bhavya, Noah Zheutlin, Paulina Toro Isaza, Laura Shwartz, Yu Deng, Daby Sow, Ruchi Mahindru, Ruchir Puri

机构 * IBM Research(IBM研究院)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 EoG通过图引导的局部推理和信念传播提升LLM在开放性研究中的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21634 2026-01-30 cs.CV 80%

RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning

RSGround-R1: 重新思考通过空间推理的遥感视觉定位

Shiqi Huang, Shuting He, Bihan Wen

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(电气电子工程学院,南洋理工大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(教育部计算与经济交叉学科重点实验室,上海财经大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 RSGround-R1通过引入空间推理引导的后训练框架,提升遥感图像中目标物体的定位精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21533 2026-01-30 cs.AI 79%

ARGORA: Orchestrated Argumentation for Causally Grounded LLM Reasoning and Decision Making

ARGORA:用于因果基础的大语言模型推理和决策的协同论证

Youngjin Jin, Hanna Kim, Kwanwoo Kim, Chanhee Lee, Seungwon Shin

机构 * School of EE, KAIST, Daejeon, South Korea(韩国科学技术院电子工程学院) S2W Inc., Pangyo, South Korea(S2W公司)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 ARGORA通过构建因果论证图,提升大语言模型在因果推理和决策中的准确性与修正能力。

Comments 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18196 2026-01-30 cs.CL 79%

LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision

LogicReward: 通过逐步逻辑监督激励大语言模型推理

Jundong Xu, Hao Fei, Huichi Zhou, Xin Quan, Qijun Huang, Shengqiong Wu, William Yang Wang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University College London(伦敦大学学院) University of Manchester(曼彻斯特大学) University of Melbourne(墨尔本大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL

AI总结 LogicReward通过逐步逻辑监督提升大语言模型的推理能力,有效增强推理可信度和泛化能力,实验显示其在自然语言推理和逻辑推理任务中优于GPT-4o和o4-mini。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21590 2026-01-30 cs.LG cs.AI 79%

Scalable Power Sampling: Unlocking Efficient, Training-Free Reasoning for LLMs via Distribution Sharpening

可扩展的功率采样:通过分布锐化实现LLM的高效无训练推理

Xiaotong Ji, Rasul Tutunov, Matthieu Zimmer, Haitham Bou Ammar

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无训练、无验证器的算法,通过分布锐化提升LLM的推理效率,减少计算成本,实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21000 2026-01-30 cs.CL cs.AI 79%

UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop

UrduBench: 一种基于上下文融合翻译的人工参与推理基准测试

Muhammad Ali Shafique, Areej Mehboob, Layba Fiaz, Muhammad Usman Qadeer, Hamza Farooq

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出UrduBench,通过上下文融合翻译和人工参与验证,构建乌尔都语推理基准测试,评估不同模型在多种提示策略下的表现,揭示多步骤推理在乌尔都语中的挑战及语言对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00190 2026-01-30 cs.CL cs.AI 79%

Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics

可解释的链式思维推理:对状态感知推理动态的实证分析

Sheldon Yu, Yuxin Xiong, Junda Wu, Xintong Li, Tong Yu, Xiang Chen, Ritwik Sinha, Jingbo Shang, Julian McAuley

机构 * University of California San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种状态感知的转换框架,通过结构化潜在动态分析链式思维推理的语义演变和转换,提升推理过程的可解释性。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21617 2026-01-30 cs.CV 78%

PathReasoner-R1: Instilling Structured Reasoning into Pathology Vision-Language Model via Knowledge-Guided Policy Optimization

PathReasoner-R1: 通过知识引导的策略优化在病理视觉-语言模型中引入结构化推理

Songhan Jiang, Fengchun Liu, Ziyue Wang, Linghan Cai, Yongbing Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) Technical University of Dresden(德累斯顿技术大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 PathReasoner-R1通过知识引导的策略优化,在病理视觉-语言模型中引入结构化推理,提升模型的临床推理能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11479 2026-01-30 cs.AI 77%

Health Facility Location in Ethiopia: Leveraging LLMs to Integrate Expert Knowledge into Algorithmic Planning

埃塞俄比亚卫生设施选址:利用大语言模型整合专家知识到算法规划中

Yohai Trabelsi, Guojun Xiong, Fentabil Getnet, Stéphane Verguet, Milind Tambe

机构 * John A. Paulson School of Engineering and Applied Sciences, Harvard University(工程与应用科学学院,哈佛大学) National Data Management and Analytics Center for Health, Ethiopian Public Health Institute(健康数据管理与分析中心,埃塞俄比亚公共卫生研究所) Department of Global Health and Population, Harvard T.H. Chan School of Public Health(全球卫生与人口学院,哈佛T.H. Chan公共卫生学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种结合大语言模型和优化技术的混合框架,用于埃塞俄比亚卫生设施选址,以整合专家知识并提升规划的公平性和数据驱动性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08182 2026-01-30 cs.LG 77%

CTRLS: Chain-of-Thought Reasoning via Latent State-Transition

CTRLS: 通过潜在状态转移进行链式推理

Junda Wu, Yuxin Xiong, Xintong Li, Sheldon Yu, Zhengmian Hu, Tong Yu, Rui Wang, Xiang Chen, Jingbo Shang, Julian McAuley

机构 * University of California, San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CTRLS通过建模潜在状态转移的马尔可夫决策过程,利用分布式强化学习提升大语言模型的推理能力与探索效率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21742 2026-01-30 cs.AI cs.CL cs.MA 76%

Epistemic Context Learning: Building Trust the Right Way in LLM-Based Multi-Agent Systems

知识上下文学习:在基于大语言模型的多智能体系统中以正确方式建立信任

Ruiwen Zhou, Maojia Song, Xiaobao Wu, Sitao Cheng, Xunjian Yin, Yuxi Xie, Zhuoqun Hao, Wenyue Hua, Liangming Pan, Soujanya Poria, Min-Yen Kan

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology(新加坡科技学院) Nanyang Technological University(南洋理工大学) Duke University(杜克大学) University of Waterloo(滑铁卢大学) Microsoft(微软公司) Peking University(北京大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI

AI总结 本文提出Epistemic Context Learning(ECL),通过历史交互构建同伴资料以提升多智能体系统中信任建模的准确性,使小型模型在性能上超越大模型,并在多种配置中表现出良好的泛化能力。

Comments Codes and data are available at https://github.com/skyriver-2000/epistemic-context-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01559 2026-01-30 cs.SD 75%

LLM2Fx-Tools: Tool Calling For Music Post-Production

LLM2Fx-Tools: 音乐后期制作中的工具调用

Seungheon Doh, Junghyun Koo, Marco A. Martínez-Ramírez, Woosung Choi, Wei-Hsiang Liao, Qiyu Wu, Juhan Nam, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 LLM2Fx-Tools通过LLM实现音频效果模块的工具调用,生成可执行的音频效果序列,提升音乐后期制作的可解释性和可控性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21711 2026-01-30 cs.CL cs.AI 73%

TACLer: Tailored Curriculum Reinforcement Learning for Efficient Reasoning

TACLer: 针对高效推理的定制课程强化学习

Huiyuan Lai, Malvina Nissim

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Center for Language and Cognition (CLCG), University of Groningen, The Netherlands(语言与认知中心(CLCG),格罗宁根大学,荷兰)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TACLer通过定制课程强化学习提升推理效率,减少计算成本并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21936 2026-01-30 cs.AI 70%

AgenticSimLaw: A Juvenile Courtroom Multi-Agent Debate Simulation for Explainable High-Stakes Tabular Decision Making

AgenticSimLaw: 一个面向可解释高风险表格决策的青少年法庭多智能体辩论模拟

Jon Chun, Kathrine Elkins, Yong Suk Lee

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 AgenticSimLaw通过结构化多智能体辩论框架提升高风险表格决策的可解释性和稳定性,适用于需要透明和人类监督的决策任务。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21804 2026-01-30 cs.CL 70%

Distribution-Aware Reward Estimation for Test-Time Reinforcement Learning

面向分布的奖励估计用于测试时强化学习

Bodong Du, Xuanqi Huang, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(电子与计算机工程系,香港科学与技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DARE通过利用回放分布而非单一多数结果来改进测试时强化学习的奖励估计,提高了优化稳定性和最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21598 2026-01-30 cs.AI 70%

Beyond Imitation: Reinforcement Learning for Active Latent Planning

超越模仿:用于主动潜在规划的强化学习

Zhi Zheng, Wee Sun Lee

机构 * School of Computing, National University of Singapore, Singapore(计算学院,新加坡国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ATP-Latent方法,通过主动规划和强化学习优化潜在空间,提升链式推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏