arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11088 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11088 篇

2604.21354 2026-04-24 cs.LG 83%

Decoupled Travel Planning with Behavior Forest

解耦行为森林中的旅行计划

Duanyang Yuan, Sihang Zhou, Yanning Hou, Xiaoshu Chen, Haoyuan Chen, Ke Liang, Jiyuan Liu, Chuan Ma, Xinwang Liu, Jian Huang

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) College of Computer Science, Chongqing University(计算机科学学院,重庆大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文提出行为森林方法,通过解耦复杂任务和约束到可管理的子空间,提升大语言模型在多约束旅行计划中的性能,实验表明在TravelPlanner和ChinaTravel基准上分别优于现有方法6.67%和11.82%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19937 2026-04-23 cs.CV cs.AI 83%

Infection-Reasoner: A Compact Vision-Language Model for Wound Infection Classification with Evidence-Grounded Clinical Reasoning

Infection-Reasoner: 一种用于伤口感染分类的紧凑视觉-语言模型,结合证据支撑的临床推理

Palawat Busaranuvong, Reza Saadati Fard, Emmanuel Agu, Deepak Kumar, Shefalika Gautam, Bengisu Tulu, Diane Strong

机构 * Worcester Polytechnic Institute(沃斯特理工学院) UMass Chan Medical School(UMass Chan医学院)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Infection-Reasoner,一种紧凑的视觉-语言模型,通过两阶段训练提升伤口感染分类和推理生成的准确性与解释性,实验结果显示其在分类和推理质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11038 2026-04-21 cs.CL 83%

Budget-Aware Anytime Reasoning with LLM-Synthesized Preference Data

具有预算意识的任意时间推理与LLM合成的偏好数据

Xuanming Zhang, Shwan Ashrafi, Aziza Mirsaidova, Amir H. Rezaeian, Miguel Ballesteros, Lydia B. Chilton, Zhou Yu, Dan Roth

机构 * Columbia University(哥伦比亚大学) Oracle AI

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 研究在有限计算预算下LLM的推理行为,提出任意时间推理框架和Anytime Index指标,通过LLM合成的偏好数据提升推理效率与质量。

Comments ACL 2026 Findings, 13 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12390 2026-04-20 cs.AI 83%

Heuristic Classification of Thoughts Prompting (HCoT): Integrating Expert System Heuristics for Structured Reasoning into Large Language Models

思维提示的启发式分类(HCoT):将专家系统启发式方法整合到大型语言模型中的结构化推理

Lei Lin, Jizhao Zhu, Yong Liu, Donghong Sun, Hongbo He, Yihua Du

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Shenyang Aerospace University(沈阳航空航天大学) ZGC LAB, Beijing,China(北京ZGC实验室) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出HCoT方法,通过启发式分类模型整合专家系统启发式方法,提升大型语言模型在复杂问题中的推理能力,实现更高效的决策和更稳定的推理链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14712 2026-04-17 cs.AI 83%

SGA-MCTS: Decoupling Planning from Execution via Training-Free Atomic Experience Retrieval

SGA-MCTS:通过无训练原子经验检索解耦规划与执行

Xin Xie, Dongyun Xue, Wuguannan Yao, Mingxiao Feng, Wengang Zhou, Xiang Qi, Houqiang Li, Peng Zhang

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Hefei Comprehensive National Science Center(合肥国家科学中心)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 SGA-MCTS通过无训练原子经验检索解耦规划与执行,利用MCTS探索解空间并生成SGA原子,结合检索增强机制实现高效推理,使冻结模型在无需微调的情况下达到SOTA系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04442 2026-04-16 cs.CV cs.CL 83%

Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization

通过门控感知-推理优化解决大视觉-语言模型中的过度思考

Xingjian Diao, Zheyuan Liu, Chunhui Zhang, Weiyi Wu, Keyi Kong, Lin Shi, Kaize Ding, Soroush Vosoughi, Jiang Gui

机构 * Dartmouth College(达特茅斯学院) University of Notre Dame(诺丁汉大学) Cornell University(康奈尔大学) Northwestern University(西北大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出GPRO方法,通过动态路由计算路径提升大视觉-语言模型的推理效率与准确性,减少过度思考带来的冗余响应。

Comments Accepted to Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19917 2026-04-15 cs.CL 83%

PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models

PILOT:通过内部化潜在优化轨迹进行大语言模型的规划

Haoyu Zheng, Yun Zhu, Yuqian Yuan, Bo Yuan, Wenqiao Zhang, Siliang Tang, Jun Xiao

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 PILOT通过内部化潜在优化轨迹,帮助大语言模型克服长周期任务中的推理不稳定问题,实验显示其在数学和编码基准测试中性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17209 2026-04-10 cs.RO cs.AI 83%

LiloDriver: A Lifelong Learning Framework for Closed-loop Motion Planning in Long-tail Autonomous Driving Scenarios

LiloDriver:一种面向长尾自动驾驶场景闭环运动规划的终身学习框架

Huaiyuan Yao, Pengfei Li, Bu Jin, Yupeng Zheng, An Liu, Lisen Mu, Qing Su, Qian Zhang, Yilun Chen, Peng Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Horizon Robotics(地平线机器人)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 LiloDriver通过结合大语言模型与记忆增强的规划生成系统,实现了在长尾自动驾驶场景中闭环运动规划的持续适应,优于传统规则和学习方法。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29908 2026-04-09 cs.AI 83%

C-TRAIL: A Commonsense World Framework for Trajectory Planning in Autonomous Driving

C-TRAIL:用于自动驾驶轨迹规划的常识世界框架

Zhihong Cui, Haoran Tang, Tianyi Li, Yushuai Li, Peiyuan Guan, Amir Taherkordi, Tor Skeie

机构 * University of Oslo(奥斯陆大学) Hong Kong Polytechnic University(香港理工大学) Aalborg University(奥尔堡大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出C-TRAIL框架,结合常识世界与信任机制,通过Recall-Plan-Update循环提升自动驾驶轨迹规划的可靠性,实验表明其在ADE、FDE和SR指标上均优于现有方法。

Journal ref IEEE Transactions on Vehicular Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04190 2026-04-07 cs.AI 83%

Schema-Aware Planning and Hybrid Knowledge Toolset for Reliable Knowledge Graph Triple Verification

基于模式的规划和混合知识工具集的可靠知识图谱三元组验证

Xinyan Ma, Xianhao Ou, Weihao Zhang, Shixin Jiang, Runxuan Liu, Dandan Tu, Lei Chen, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Bay Area International Business School, Beijing Normal University(北京师范大学湾区国际商学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出SHARP,一种无需训练的自主代理,通过动态策略规划、主动调查和证据推理改进知识图谱三元组验证的稳定性与解释性,实验证明其在FB15K-237和Wikidata5M-Ind上准确率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03393 2026-04-07 cs.AI 83%

TABQAWORLD: Optimizing Multimodal Reasoning for Multi-Turn Table Question Answering

TABQAWORLD: 优化多模态推理以实现多轮表格问答

Tung Sum Thomas Kwok, Xinyu Wang, Xiaofeng Lin, Peng Lu, Chunhe Wang, Changlun Li, Hanwei Wu, Nan Tang, Elisa Kreiss, Guang Cheng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) SimpleWay

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 TABQAWORLD通过联合优化表格表示与估计,提升多轮表格问答的可靠性与效率,实现4.87%的准确率提升和33.35%的推理延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15925 2026-04-07 cs.RO cs.AI cs.CV 83%

VERDI: VLM-Embedded Reasoning for Autonomous Driving

VERDI:嵌入视觉语言模型的自动驾驶推理

Bowen Feng, Zhiting Mei, Julian Ost, Filippo Ghilotti, Baiang Li, Roger Girgis, Anirudha Majumdar, Felix Heide

机构 * Princeton University(普林斯顿大学) Torc Robotics

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 VERDI通过在训练时整合视觉语言模型的推理过程和常识知识,提升自动驾驶系统的决策能力,实现更高效的模块化架构,同时保持快速推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02965 2026-04-06 cs.RO cs.CL 83%

Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA

开环规划,闭环验证:VLA的推测验证

Zihua Wang, Zhitao Lin, Ruibo Li, Yu Zhang, Xu Yang, Siya Mi, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Purple Mountain Laboratories(紫金山实验室)

专题命中 规划推理 :planning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出SV-VLA框架,结合高效开环长周期规划与轻量闭环在线验证,提升VLA在动态环境中的效率与可靠性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29585 2026-04-06 cs.GR cs.AI 83%

Learn2Fold: Structured Origami Generation with World Model Planning

Learn2Fold: 基于世界模型规划的结构化折纸生成

Yanjia Huang, Yunuo Chen, Ying Jiang, Jinru Han, Zhengzhong Tu, Yin Yang, Chenfanfu Jiang

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出Learn2Fold框架,通过结合符号推理与物理模拟,解决从文本生成物理有效的折纸折叠序列问题。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01765 2026-04-03 cs.CV cs.AI cs.RO 83%

DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning

DriveDreamer-Policy: 一种基于几何的世界-动作模型用于统一生成与规划

Yang Zhou, Xiaofeng Wang, Hao Shao, Letian Wang, Guosheng Zhao, Jiangnan Shao, Jiagang Zhu, Tingdong Yu, Zheng Zhu, Guan Huang, Steven L. Waslander

机构 * GigaAI University of Toronto(多伦多大学) CUHK MMLab(香港中文大学多媒体实验室)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出DriveDreamer-Policy,结合深度生成、未来视频生成与运动规划,通过几何感知的世界表示提升生成与规划的连贯性与准确性。

Comments 11 pages, 4 figures; Project Website: https://drivedreamer-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00510 2026-04-02 cs.AI 83%

Adaptive Parallel Monte Carlo Tree Search for Efficient Test-time Compute Scaling

自适应并行蒙特卡洛树搜索用于高效测试时间计算扩展

Hongbeen Kim, Juhyun Lee, Sanghyeon Lee, Kwanghoon Choi, Jaehyuk Huh

机构 * School of Computing, Korea Advanced Institute of Science and Technology(韩国科学技术院计算学院)

专题命中 规划推理 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出负早退和自适应提升机制,通过优化MCTS执行效率,降低端到端延迟并提升吞吐量,同时保持推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29085 2026-04-01 cs.AI 83%

PAR$^2$-RAG: Planned Active Retrieval and Reasoning for Multi-Hop Question Answering

PAR$^2$-RAG:计划主动检索与推理用于多跳问答

Xingyu Li, Rongguang Wang, Yuying Wang, Mengqing Guo, Chenyang Li, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI(甲骨文人工智能)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 PAR$^2$-RAG通过分阶段的覆盖与承诺分离,结合广度优先锚定和深度优先细化,提升多跳问答的准确率和检索效果。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03707 2026-03-31 cs.CL 83%

OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering

OmniRAG-Agent:面向低资源长音频视频的代理多模态推理

Yifan Zhu, Xinyu Mu, Tao Feng, Zhonghong Ou, Yuning Gong, Haoran Luo

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 本文提出OmniRAG-Agent,通过构建图像音频检索增强生成模块和代理循环,解决低资源长音频视频问答中的高成本编码、弱细粒度检索等问题,实验表明其在低资源环境下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15259 2026-03-26 cs.AI 83%

SAG-Agent: Enabling Long-Horizon Reasoning in Strategy Games via Dynamic Knowledge Graphs

SAG-Agent:通过动态知识图谱实现策略游戏中长周期推理

Chenwei Tang, Lin Long, Xinyu Liu, Jingyu Xing, Zizhou Wang, Joey Tianyi Zhou, Jiawei Du, Liangli Zhen, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education(教育部机器学习与工业智能工程研究中心) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR)高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR)前沿人工智能研究中心)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 SAG-Agent通过构建持久化的状态-动作图,解决无API环境下自主代理的效率瓶颈,提升探索效率和战略深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21376 2026-03-25 cs.AI 83%

A transformer architecture alteration to incentivise externalised reasoning

一种变换器架构的修改以激励外部化推理

Elizabeth Pavlova, Mariia Koroliuk, Karthik Viswanathan, Cameron Tice, Edward James Young, Puria Radmard

机构 * MARS University of Amsterdam(阿姆斯特丹大学) Geodesic Research

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种变换器架构修改和训练流程,使大语言模型更倾向于产生详细推理。通过在中间层加入早退机制,训练模型在预测下一个token时提前退出计算,从而减少冗余计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20198 2026-03-24 cs.CR cs.CV cs.LG 83%

Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning

视觉排斥攻击:通过代理规划实现自动多模态红队行动

Yunbei Zhang, Yingqiang Ge, Weijie Xu, Yuhui Xu, Jihun Hamm, Chandan K. Reddy

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文提出视觉排斥攻击,通过多模态多轮代理规划框架MM-Plan,实现基于视觉内容的攻击,展示了对前沿模型的高攻击成功率,揭示了当前安全对齐的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19515 2026-03-23 cs.AI 83%

ItinBench: Benchmarking Planning Across Multiple Cognitive Dimensions with Large Language Models

ItinBench:利用大语言模型在多个认知维度上进行规划的基准测试

Tianlong Wang, Pinqiao Wang, Weili Shi, Sheng li

机构 * University of Virginia(弗吉尼亚大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出ItinBench,通过整合空间推理和传统语言推理任务,评估大语言模型在多认知维度上的规划能力,发现模型在同时处理多个维度时性能不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19257 2026-03-23 cs.CL 83%

Constraint-aware Path Planning from Natural Language Instructions Using Large Language Models

基于自然语言指令的约束感知路径规划:利用大语言模型

Dylan Shim, Minghan Wei

专题命中 规划推理 :planning(title,abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出利用大语言模型解决带约束的路径规划问题,通过自然语言输入进行问题匹配和自推断,实现灵活且可扩展的解决方案。

Comments Accepted by 2026 SPIE Security + Defense Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15888 2026-03-20 cs.AI cs.CV cs.RO 83%

AsgardBench -- Evaluating Visually Grounded Interactive Planning Under Minimal Feedback

AsgardBench -- 评估基于视觉的交互式规划在最小反馈下的表现

Andrea Tupini, Lars Liden, Reuben Tan, Yu Wang, Jianfeng Gao

机构 * Microsoft(微软)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 AsgardBench旨在评估基于视觉的高阶动作序列生成和交互式规划,重点在于执行过程中基于视觉观察而非导航或低级操作的计划适应。通过限制代理输入为图像、动作历史和轻量级成功/失败信号,该基准测试强调条件分支和计划修复。

Comments 19 figures, 6 tables, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16777 2026-03-18 cs.AI 83%

Anticipatory Planning for Multimodal AI Agents

多模态AI代理的前瞻性规划

Yongyuan Liang, Shijie Zhou, Yu Gu, Hao Tan, Gang Wu, Franck Dernoncourt, Jihyung Kil, Ryan A. Rossi, Ruiyi Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究) State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出TraceR1框架,通过前瞻性轨迹推理提升多模态代理的规划能力,实现更稳定的执行和泛化性能。

Comments Published at CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15255 2026-03-18 cs.AI cs.MA 83%

SAGE: Multi-Agent Self-Evolution for LLM Reasoning

SAGE:多智能体自进化用于大语言模型推理

Yulin Peng, Xinxin Zhu, Chenxing Wei, Nianbo Zeng, Leilei Wang, Ying Tiffany He, F. Richard Yu

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), China(广东省人工智能与数字经济实验室(深圳)) School of Information Technology, Carleton University, Canada(卡尔顿大学信息科技学院,加拿大)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 SAGE通过四智能体协同进化提升LLM推理能力,利用小种子集实现稳定自训练,在数学和代码生成基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20722 2026-03-17 cs.AI 83%

Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning

缓冲区很重要:在大语言模型推理中释放离策略强化学习的潜力

Xu Wan, Yansheng Wang, Wenqi Huang, Mingyang Sun

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出BAPO框架,通过动态选择训练批次和保证策略改进下限,提升大语言模型训练效率,实验显示在数学、规划和视觉推理任务中平均提升12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13230 2026-03-17 cs.CL 83%

Slang Context-based Inference Enhancement via Greedy Search-Guided Chain-of-Thought Prompting

基于贪心搜索的链式推理提示的俚语推理增强

Jinghan Cao, Qingyang Ren, Xiangyun Chen, Xinjin Li, Haoxiang Gao, Yu Zhao

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 本文提出一种基于贪心搜索的链式推理框架,通过改进小语言模型的推理能力,提升俚语解释的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11351 2026-03-13 cs.RO cs.AI 83%

Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning

通过混合大语言模型(LLM)符号规划和LLM引导的强化学习实现新颖性适应

Hong Lu, Pierrick Lorang, Timothy R. Duggan, Jivko Sinapov, Matthias Scheutz

机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) Austrian Institute of Technology GmbH(奥地利技术研究所)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出一种融合大语言模型、符号规划和强化学习的神经符号架构,用于在动态开放环境中处理新颖物体,通过LLM识别缺失操作符并生成计划,提升机器人在连续领域中的操作符学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09337 2026-03-11 cs.CV cs.AI 83%

Beyond Scaling: Assessing Strategic Reasoning and Rapid Decision-Making Capability of LLMs in Zero-sum Environments

超越规模:在零和环境中评估大语言模型的战略推理和快速决策能力

Yang Li, Xing Chen, Yutao Liu, Gege Qi, Yanxian BI, Zizhe Wang, Yunjian Zhang, Yao Zhu

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出STAR基准,评估大语言模型在零和环境中的战略推理和快速决策能力,揭示推理深度与及时行动能力的权衡。

Comments Code available

详情

展开后加载摘要…

URL PDF HTML 收藏