arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11047 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11047 篇

2605.18421 2026-06-16 cs.CL cs.AI cs.LG 版本更新 75%

EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

EvoMemBench: 从自演化视角评估智能体记忆

Yuyao Wang, Zhongjian Zhang, Mo Chi, Kaichi Yu, Yuhan Li, Miao Peng, Bing Tong, Chen Zhang, Yan Zhou, Jia Li

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Createlink Technology(创-link科技) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Institute of Technology(北京理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EvoMemBench,从自演化视角评估智能体记忆,通过内存范围和内容两个维度构建统一基准,比较15种内存方法并发现当前内存系统尚未达到通用解决方案,长上下文基线仍具竞争力,内存在上下文不足或任务困难时效果显著,检索方法在知识密集型任务中表现优异,而程序和长期记忆方法在任务结构匹配时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06002 2026-06-08 cs.CV 版本更新 75%

Global-Local Monte Carlo Tree Search in Vision-Language Models for Text-to-3D Indoor Scene Generation

面向文本到3D室内场景生成的视觉-语言模型中的全局-局部蒙特卡洛树搜索

Mengshi Qi, Wei Deng, Xianlin Zhang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 提出一种全局-局部蒙特卡洛树搜索方法,通过分层场景表示和PRM引导的MCTS解决文本到3D室内场景生成中的错误传播问题,并构建新基准数据集3DTindo-bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01838 2026-06-02 cs.CL cs.AI cs.LG 75%

LayerRoute: Input-Conditioned Adaptive Layer Skipping via LoRA Fine-Tuning for Agentic Language Models

LayerRoute: 基于LoRA微调的输入条件自适应层跳过方法用于智能语言模型

Prateek Kumar Sikdar

机构 * Accenture(埃森哲)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LayerRoute,通过为每个Transformer块添加轻量级路由器和LoRA适配器,根据输入类型(工具调用或规划推理)自适应跳过层,在仅增加0.22%可训练参数下实现12.91%的跳过差异并提升质量。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25393 2026-05-26 cs.RO 75%

Decision-Making with Lightweight Confidence-Aware Language Model for Autonomous Driving

基于轻量级置信感知语言模型的自动驾驶决策

Ruoyu Yao, Ruiguo Zhong, Pei Liu, Mingxing Peng, Rui Yang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 提出一种利用轻量级置信感知语言模型的决策框架,通过多智能体协作生成置信注释的决策演示并蒸馏到双头轻量模型,在nuPlan上实现SOTA成功率和低延迟。

Comments 8 Pages, 3 figures, ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11811 2026-05-26 cs.PL cs.AI cs.CL cs.LG 75%

M$^\star$: Every Task Deserves Its Own Memory Harness

M$^\star$:每个任务都应有专属的记忆框架

Wenbo Pan, Shujie Liu, Xiangyang Zhou, Shiwei Zhang, Wanlu Shi, Mirror Xu, Xiaohua Jia

机构 * City University of Hong Kong(香港城市大学) Microsoft(微软)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出M$^\star$方法,通过可执行程序进化自动发现任务优化的记忆系统,在对话、具身规划和专家推理等任务上优于固定记忆基线。

Comments Preprint. Code: https://github.com/wbopan/mstar ; Live demo: https://mstar.wenbo.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05513 2026-05-13 cs.IR 75%

LEAPS: An LLM-Empowered Adaptive Plugin in Taobao AI Search

LEAPS: 阿里巴巴淘宝AI搜索中的大语言模型赋能自适应插件

Lei Wang, Jinhang Wu, Zhibin Wang, Biye Li

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 LEAPS通过'拓宽与精炼'范式优化搜索流程,提升购物对话体验,同时保持传统检索性能并支持低成本集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11349 2026-05-04 cs.CV 75%

Image Score: Learning and Evaluating Human Preferences for Mercari Search

图像评分:学习和评估Mercari搜索中的人类偏好

Chingis Oinar, Miao Cao, Shanshan Fu

机构 * Mercari

专题命中 规划推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出一种高效利用大型语言模型进行图像质量评估的方法,通过链式推理生成与人类行为一致的标签,提升电商场景下的图像评估可解释性并提高销售转化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27351 2026-05-01 cs.AI cs.CL cs.LG 75%

Heterogeneous Scientific Foundation Model Collaboration

异质科学基础模型协作

Zihao Li, Jiaru Zou, Feihao Fang, Xuying Ning, Mengting Ai, Tianxin Wei, Sirui Chen, Xiyuan Yang, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Eywa框架,通过将语言模型与领域特定基础模型结合,提升科学领域多模态任务的推理能力,实验显示其在结构化数据任务中表现更优。

Comments Preprint. 57 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20868 2026-04-14 cs.LG cs.AI cs.CL 75%

StyleBench: Evaluating thinking styles in Large Language Models

StyleBench: 评估大型语言模型中的思维风格

Junyu Guo, Shangding Gu, Ming Jin, Costas Spanos, Javad Lavaei

机构 * University of California, Berkeley(加州大学伯克利分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过StyleBench评估不同推理风格在大型语言模型中的表现,发现结构复杂度在特定任务和模型容量下提升准确性,同时探讨了推理策略选择的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01804 2026-04-10 cs.CL cs.AI cs.LG 75%

$\texttt{SEM-CTRL}$: Semantically Controlled Decoding

SEM-CTRL:语义控制解码

Mohammad Albinhassan, Pranava Madhyastha, Alessandra Russo

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SEM-CTRL,通过集成基于答案集语法的约束,使LLM在不微调的情况下保证输出的语法和语义正确性,实验显示其在多种任务中优于现有模型。

Comments Published in Transactions on Machine Learning Research (TMLR), 03/2026

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18841 2026-04-09 cs.CL cs.AI cs.LG 75%

LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning

LongWriter-Zero: 通过强化学习掌握超长文本生成

Yuhao Wu, Yushi Bai, Zhiqiang Hu, Roy Ka-Wei Lee, Juanzi Li

机构 * Singapore University of Technology and Design, Singapore(新加坡科技设计大学) Tsinghua University, Beijing, China(清华大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于激励的方法,无需标注或合成数据,通过强化学习使LLM生成超长高质量文本,实验表明其在长文本任务中优于传统SFT方法,达到WritingBench和Arena-Write的最优效果。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05681 2026-04-08 cs.AI cs.CL cs.GT cs.LG cs.MA 75%

LUDOBENCH: Evaluating LLM Behavioural Decision-Making Through Spot-Based Board Game Scenarios in Ludo

LUDOBENCH:通过基于点的棋盘游戏场景评估LLM的行为决策

Ojas Jain, Dhruv Kumar

机构 * Department of Computer Science and Information Systems, BITS Pilani(比拉理工学院皮拉尼校区计算机科学与信息系统系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LudoBench通过12种不同决策类别中的480个手工设计点场景,评估LLM在Ludo棋盘游戏中的战略推理能力,发现模型在行为上呈现不同特征,揭示了提示敏感性作为关键漏洞。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08955 2026-03-17 cs.CL cs.AI cs.LG 75%

Imagine-then-Plan: Agent Learning from Adaptive Lookahead with World Models

想象后再计划:基于世界模型的自适应前瞻学习 agent 学习框架

Youwei Liu, Jian Wang, Hanlin Wang, Beichen Guo, Wenjie Li

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Imagine-then-Plan框架,通过自适应前瞻机制提升agent在复杂任务中的推理能力,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12559 2026-03-16 physics.soc-ph 75%

Large Language Models as Delivery Rider: Generating Instant Food Delivery Riders' Routing Decision with LLM Agent Framework

大语言模型作为配送骑手:利用LLM代理框架生成即时食品配送骑手的路线决策

Chengbo Zhang, Zuopeng Xiao

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出LLM-DR框架,通过基于经验的骑手人设和基于推理的路线过程,模拟配送骑手的异质决策,以研究骑手劳动力战略对系统出行模式的影响。

Comments Proceedings of the 3rd International Conference on Urban Science and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03290 2026-03-05 cs.CL cs.AI cs.IR cs.LG 75%

AriadneMem: Threading the Maze of Lifelong Memory for LLM Agents

AriadneMem: 为LLM代理梳理终身记忆的迷宫

Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Jingjing Wang, Xuanzhao Dong, Minzhou Huang, Rui Cai, Hejian Sang, Hao Wang, Peijie Qiu, Yueyue Deng, Prayag Tiwari, Brendan Hogan Rappazzo, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Morgan Stanley(摩根大通) Rice University(里奇大学) Clemson University(克莱姆森大学) Northwestern University(西北大学) UC Davis(加州大学戴维斯分校) Iowa State University(爱荷华州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) Columbia University(哥伦比亚大学) Halmstad University(哈马格大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AriadneMem通过解耦的两阶段流程提升LLM代理在长期对话中的多跳和平均F1表现,同时减少运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01414 2026-03-03 cs.RO 75%

Jailbreaking Embodied LLMs via Action-level Manipulation

通过动作层面操控实现体感大语言模型的突破

Xinyu Huang, Qiang Yang, Leming Shen, Zijing Ma, Yuanqing Zheng

机构 * The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) University of Cambridge, Cambridge, United Kingdom(剑桥大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);verifier(abstract)

AI总结 Blindfold通过动作层面操控实现对体感大语言模型的突破,其攻击成功率显著高于现有基线,凸显了对后果感知防御机制的迫切需求。

Comments This paper has been officially accepted for ACM SenSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21447 2026-02-26 cs.CR cs.AI cs.CL cs.LG 75%

Adversarial Intent is a Latent Variable: Stateful Trust Inference for Securing Multimodal Agentic RAG

对抗意图是潜在变量:用于安全多模态代理RAG的状态信任推断

Inderjeet Singh, Vikas Pahuja, Aishvariya Priya Rathina Sabapathy, Chiara Picardi, Amit Giloni, Roman Vainshtein, Andrés Murillo, Hisashi Kojima, Motoyoshi Sekiya, Yuki Unno, Junichi Suga

机构 * Fujitsu Research of Europe, UK(富士通欧洲研究机构,英国) Fujitsu Limited, Japan(富士通株式会社,日本)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MMA-RAG^T框架,通过状态化信任推断提升多模态代理RAG的安全性,实验显示攻击成功率显著降低。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15733 2026-02-20 cs.AI cs.CL cs.LG 75%

$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts

SPECS:通过推测草案实现更快的测试时间扩展

Mert Cemri, Nived Rajaraman, Rishabh Tiwari, Xiaoxuan Liu, Kurt Keutzer, Ion Stoica, Kannan Ramchandran, Ahmad Beirami, Ziteng Sun

专题命中 规划推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPECS通过推测草案方法在提升测试时间扩展效率的同时减少延迟,实现更优的推理性能与用户体验。

Comments 28 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14852 2026-01-28 cs.DC cs.AI cs.CL cs.LG cs.PF 75%

Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents

代理计划缓存:用于快速且低成本LLM代理的测试时间内存

Qizheng Zhang, Michael Wornow, Gerry Wan, Kunle Olukotun

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Agentic Plan Caching通过测试时间内存提取并重用结构化计划模板,降低LLM代理服务成本和延迟,提升效率。

Comments NeurIPS 2025. 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18207 2026-01-27 cs.LG cs.AI cs.CL cs.IR 75%

PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR

PaperSearchQA: 基于强化学习与验证奖励的学习科学论文搜索与推理

James Burgess, Jan N. Hansen, Duo Peng, Yuhui Zhang, Alejandro Lozano, Min Woo Sun, Emma Lundberg, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Chan Zuckerberg Biohub Network(查纳·泽克拜尔生物枢纽网络) KTH Royal Institute of Technology(皇家理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PaperSearchQA通过训练搜索代理在科学论文中进行搜索与推理,提升技术问答能力,为未来的人工智能科学家系统奠定基础。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16984 2026-01-27 cs.LG cs.AI cs.CL cs.CV cs.IR cs.MM 75%

TelcoAI: Advancing 3GPP Technical Specification Search through Agentic Multi-Modal Retrieval-Augmented Generation

TelcoAI: 通过代理多模态检索增强生成技术推进3GPP技术规范搜索

Rahul Ghosh, Chun-Hao Liu, Gaurav Rele, Vidya Sagar Ravipati, Hazar Aouad

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(生成式AI创新中心,亚马逊网络服务)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TelcoAI通过代理多模态检索增强生成技术,提升3GPP技术规范搜索的准确性和效率,实现87%的召回率和16%的性能提升。

Comments Accepted to IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04748 2026-01-21 cs.LG cs.AI cs.CL 75%

AttriLens-Mol: Attribute Guided Reinforcement Learning for Molecular Property Prediction with Large Language Models

AttriLens-Mol:基于属性引导的强化学习用于利用大语言模型进行分子属性预测

Xuan Lin, Long Chen, Yile Wang

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AttriLens-Mol通过属性引导的强化学习框架提升大语言模型在分子属性预测中的性能,有效激发相关属性,提高可解释性和预测效果。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20458 2025-12-29 cs.IR 75%

Laser: Governing Long-Horizon Agentic Search via Structured Protocol and Context Register

激光:通过结构化协议和上下文寄存器治理长 horizon 的代理搜索

Shuting Wang, Qiaolin Xia, Vich Wang, Herberttli, Bobsimons, Zhicheng Dou

专题命中 规划推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract)

AI总结 Laser通过结构化协议和上下文寄存器稳定并扩展代理搜索,提升多跳问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19360 2025-12-23 cs.IR 75%

Generative vector search to improve pathology foundation models across multimodal vision-language tasks

生成向量搜索以提升多模态视觉-语言任务中的病理基础模型

Markus Ekvall, Ludvig Bergenstråhle, Patrick Truong, Ben Murrell, Joakim Lundeberg

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);test-time compute(abstract)

AI总结 STHLM通过生成向量搜索方法提升多模态视觉-语言任务中病理基础模型的检索性能,实现10-30%的性能提升和10倍的维度压缩

Comments 13 pages main (54 total), 2 main figures (9 total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09864 2025-12-11 cs.CV 75%

UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving

UniUGP:统一理解、生成与规划以实现端到端自动驾驶

Hao Lu, Ziyang Liu, Guangfeng Jiang, Yuanfei Luo, Sheng Chen, Yangang Zhang, Ying-Cong Chen

机构 * ByteDance Seed(字节跳动种子)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 UniUGP通过整合预训练视觉模型和视频生成模型,实现端到端自动驾驶中的场景推理、视频生成和轨迹规划,提升复杂场景下的性能和泛化能力。

Comments Project Page: https://seed-uniugp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22891 2025-12-01 cs.AI cs.CL cs.LG 75%

ORION: Teaching Language Models to Reason Efficiently in the Language of Thought

ORION:教语言模型以高效的方式在思维语言中推理

Kumar Tanmay, Kriti Aggarwal, Paul Pu Liang, Subhabrata Mukherjee

机构 * Harvard University(哈佛大学) Hippocratic AI(希波克拉底AI) Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ORION通过SLPO优化实现高效压缩推理,提升推理效率和准确性,同时保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16927 2025-11-17 cs.CL cs.AI cs.LG 75%

Latent Principle Discovery for Language Model Self-Improvement

Keshav Ramji, Tahira Naseem, Ramón Fernandez Astudillo

机构 * IBM Research AI(IBM人工智能研究)

专题命中 规划推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19794 2025-11-14 cs.CL cs.AI cs.IR cs.LG cs.MA 75%

Why Do Open-Source LLMs Struggle with Data Analysis? A Systematic Empirical Study

Yuqi Zhu, Yi Zhong, Jintian Zhang, Ziheng Zhang, Shuofei Qiao, Yujie Luo, Lun Du, Da Zheng, Ningyu Zhang, Huajun Chen

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments AAAI 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20749 2025-11-14 cs.LG cs.AI cs.CL 75%

Matryoshka Pilot: Learning to Drive Black-Box LLMs with LLMs

Changhao Li, Yuchen Zhuang, Rushi Qiang, Haotian Sun, Hanjun Dai, Chao Zhang, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院) Precur AI Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02878 2025-10-31 cs.LG cs.AI cs.CL 75%

Language Models can Self-Improve at State-Value Estimation for Better Search

Ethan Mendes, Alan Ritter

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏