arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-24 至 2026-02-24 共收录 143 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 10 篇

2506.05850 2026-02-24 cs.CL cs.AI 84%

Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models

跨语言崩溃:语言中心化基础模型如何塑造大语言模型的推理

Cheonbok Park, Jeonghoon Kim, Joosung Lee, Sanghwan Bae, Jaegul Choo, Kang Min Yoo

机构 * NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 该研究探讨了多语言模型在长链思考中因语言中心化先验导致的推理能力下降问题,并提出通过语言一致性奖励等方法缓解这一现象。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07751 2026-02-24 cs.CL cs.AI cs.SC 81%

AbstRaL: Augmenting LLMs' Reasoning by Reinforcing Abstract Thinking

AbstRaL: 通过强化抽象思维增强大语言模型的推理能力

Silin Gao, Antoine Bosselut, Samy Bengio, Emmanuel Abbe

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 AbstRaL通过强化学习提升LLM的抽象推理能力,有效缓解GSM扰动基准测试中的性能下降,并提升模型在OD数学和一般推理任务上的泛化能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20132 2026-02-24 cs.LG 79%

LAD: Learning Advantage Distribution for Reasoning

LAD: 为推理学习优势分布

Wendi Li, Sharon Li

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 LAD通过学习优势分布提升大型模型推理的多样性和准确性,无需额外训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24183 2026-02-24 cs.LG cs.AR cs.PL 79%

QiMeng-CodeV-R1: Reasoning-Enhanced Verilog Generation

QiMeng-CodeV-R1: 基于推理增强的Verilog生成

Yaoyu Zhu, Di Huang, Hanqi Lyu, Xiaoyun Zhang, Chongxiao Li, Wenxuan Shi, Yutong Wu, Jianan Mu, Jinghua Wang, Yang Zhao, Pengwei Jin, Shuyao Cheng, Shengwen Liang, Xishan Zhang, Rui Zhang, Zidong Du, Qi Guo, Xing Hu, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 QiMeng-CodeV-R1通过改进的RLVR框架,实现了基于推理增强的Verilog生成,提升了硬件描述语言生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10604 2026-02-24 cs.CL cs.AI 62%

Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters

步骤3.5 Flash:通过11B活跃参数实现前沿级智能

Ailin Huang, Ang Li, Aobo Kong, Bin Wang, Binxing Jiao, Bo Dong, Bojun Wang, Boyu Chen, Brian Li, Buyun Ma, Chang Su, Changxin Miao, Changyi Wan, Chao Lou, Chen Hu, Chen Xu, Chenfeng Yu, Chengting Feng, Chengyuan Yao, Chunrui Han, Dan Ma, Dapeng Shi, Daxin Jiang, Dehua Ma, Deshan Sun, Di Qi, Enle Liu, Fajie Zhang, Fanqi Wan, Guanzhe Huang, Gulin Yan, Guoliang Cao, Guopeng Li, Han Cheng, Hangyu Guo, Hanshan Zhang, Hao Nie, Haonan Jia, Haoran Lv, Hebin Zhou, Hekun Lv, Heng Wang, Heung-Yeung Shum, Hongbo Huang, Hongbo Peng, Hongyu Zhou, Hongyuan Wang, Houyong Chen, Huangxi Zhu, Huimin Wu, Huiyong Guo, Jia Wang, Jian Zhou, Jianjian Sun, Jiaoren Wu, Jiaran Zhang, Jiashu Lv, Jiashuo Liu, Jiayi Fu, Jiayu Liu, Jie Cheng, Jie Luo, Jie Yang, Jie Zhou, Jieyi Hou, Jing Bai, Jingcheng Hu, Jingjing Xie, Jingwei Wu, Jingyang Zhang, Jishi Zhou, Junfeng Liu, Junzhe Lin, Ka Man Lo, Kai Liang, Kaibo Liu, Kaijun Tan, Kaiwen Yan, Kaixiang Li, Kang An, Kangheng Lin, Lei Yang, Liang Lv, Liang Zhao, Liangyu Chen, Lieyu Shi, Liguo Tan, Lin Lin, Lina Chen, Luck Ma, Mengqiang Ren, Michael Li, Ming Li, Mingliang Li, Mingming Zhang, Mingrui Chen, Mitt Huang, Na Wang, Peng Liu, Qi Han, Qian Zhao, Qinglin He, Qinxin Du, Qiuping Wu, Quan Sun, Rongqiu Yang, Ruihang Miao, Ruixin Han, Ruosi Wan, Ruyan Guo, Shan Wang, Shaoliang Pang, Shaowen Yang, Shengjie Fan, Shijie Shang, Shiliang Yang, Shiwei Li, Shuangshuang Tian, Siqi Liu, Siye Wu, Siyu Chen, Song Yuan, Tiancheng Cao, Tianchi Yue, Tianhao Cheng, Tianning Li, Tingdan Luo, Wang You, Wei Ji, Wei Yuan, Wei Zhang, Weibo Wu, Weihao Xie, Wen Sun, Wenjin Deng, Wenzhen Zheng, Wuxun Xie, Xiangfeng Wang, Xiangwen Kong, Xiangyu Liu, Xiangyu Zhang, Xiaobo Yang, Xiaojia Liu, Xiaolan Yuan, Xiaoran Jiao, Xiaoxiao Ren, Xiaoyun Zhang, Xin Li, Xin Liu, Xin Wu, Xing Chen, Xingping Yang, Xinran Wang, Xu Zhao, Xuan He, Xuanti Feng, Xuedan Cai, Xuqiang Zhou, Yanbo Yu, Yang Li, Yang Xu, Yanlin Lai, Yanming Xu, Yaoyu Wang, Yeqing Shen, Yibo Zhu, Yichen Lv, Yicheng Cao, Yifeng Gong, Yijing Yang, Yikun Yang, Yin Zhao, Yingxiu Zhao, Yinmin Zhang, Yitong Zhang, Yixuan Zhang, Yiyang Chen, Yongchi Zhao, Yongshen Long, Yongyao Wang, Yousong Guan, Yu Zhou, Yuang Peng, Yuanhao Ding, Yuantao Fan, Yuanwei Lu, Yuanzhen Yang, Yuchu Luo, Yudi Zhao, Yue Peng, Yueqiang Lin, Yufan Lu, Yuling Zhao, Yunzhou Ju, Yurong Zhang, Yusheng Li, Yuxiang Yang, Yuyang Chen, Yuzhu Cai, Zejia Weng, Zetao Hong, Zexi Li, Zhe Xie, Zheng Ge, Zheng Gong, Zheng Zeng, Zhenyi Lu, Zhewei Huang, Zhichao Chang, Zhiguo Huang, Zhiheng Hu, Zidong Yang, Zili Wang, Ziqi Ren, Zixin Zhang, Zixuan Wang

机构 * StepFun Team(StepFun团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Step 3.5 Flash通过11B活跃参数实现前沿级智能,结合高效推理与多任务表现,提升代理在数学、代码等领域的性能。

Comments Technical report for Step 3.5 Flash

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19208 2026-02-24 cs.LG cs.AI 62%

How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization

如何分配,如何学习?动态回放分配与优势调节用于策略优化

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chaowen Hu, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DynaMO通过动态回放分配和梯度感知优势调节,优化策略学习中的资源分配与梯度更新稳定性,提升数学推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03817 2026-02-24 cs.LG stat.ML 57%

TROLL: Trust Regions improve Reinforcement Learning for Large Language Models

TROLL:通过信任区域改进大型语言模型的强化学习

Philipp Becker, Niklas Freymuth, Serge Thilges, Fabian Otto, Gerhard Neumann

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 TROLL通过引入基于信任区域的离散可微投影,改进了大型语言模型的强化学习训练,提升了训练速度、稳定性和最终成功率。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07543 2026-02-24 cs.CV cs.CL 57%

MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts

MathScape:在现实数学情境中评估多模态大语言模型

Hao Liang, Linzhuang Sun, Minxuan Zhou, Zirong Chen, Meiyi Qiang, Mingan Lin, Tianpeng Li, Fan Yang, Zenan Zhou, Wentao Zhang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Baichuan Inc.(百度文心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MathScape是一个评估多模态大语言模型在现实数学情境中推理能力的新基准,揭示了现有模型在现实任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19357 2026-02-24 cs.CV cs.LG 57%

MentalBlackboard: Evaluating Spatial Visualization via Mathematical Transformations

MentalBlackboard: 通过数学变换评估空间可视化能力

Nilay Yilmaz, Maitreya Patel, Naga Sai Abhiram Kusumba, Yixuan He, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学)

专题命中 数学推理 :planning(abstract);分类 cs.LG

AI总结 MentalBlackboard通过数学变换评估模型的空间可视化能力,揭示其在预测和规划任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18700 2026-02-24 cs.CR cs.CL 57%

Watermarking LLM Agent Trajectories

对LLM代理轨迹进行水印标记

Wenlong Meng, Chen Gong, Terry Yue Zhuo, Fan Zhang, Kecen Li, Zheng Liu, Zhou Yang, Chengkun Wei, Wenzhi Chen

机构 * Zhejiang University, China(浙江大学) University of Virginia, USA(弗吉尼亚大学) Alibaba Qwen, China(阿里巴巴通义实验室) University of Alberta, Canada(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ActHook,一种针对LLM代理轨迹数据集的水印方法,通过在决策点插入钩子动作实现可靠的黑盒检测,实验显示其在数学推理等任务中具有高检测精度且性能影响小。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 4 篇

2602.18916 2026-02-24 cs.MA cs.AI cs.SC 85%

Adaptive Collaboration of Arena-Based Argumentative LLMs for Explainable and Contestable Legal Reasoning

面向可解释和可争议法律推理的 Arena 基础论证 LLM 自适应协作

Hoang-Loc Cao, Phuc Ho, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Dinh Thien Loc Nguyen, Hung Cao

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 ACAL通过自适应多智能体协作和 Arena 基础论证框架,提升法律推理的可解释性和可争议性,实验证明其在效率和透明度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19160 2026-02-24 cs.AI cs.CL cs.LO 81%

Reasoning Capabilities of Large Language Models. Lessons Learned from General Game Playing

大语言模型的推理能力。从通用游戏玩法中获得的教训

Maciej Świechowski, Adam Żychowski, Jacek Mańdziuk

机构 * Grail Team(Grail团队) Warsaw University of Technology(华沙技术大学) AGH University of Krakow(克拉科夫AGH大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过通用游戏玩法任务评估大语言模型的推理能力,发现部分模型在多步骤任务中表现稳定,但随着任务复杂度增加性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15940 2026-02-24 cs.LG cs.AI 62%

Lean Finder: Semantic Search for Mathlib That Understands User Intents

Lean Finder: 用于Mathlib的语义搜索,能理解用户意图

Jialin Lu, Kye Emond, Kaiyu Yang, Swarat Chaudhuri, Weiran Sun, Wuyang Chen

机构 * Simon Fraser University(西蒙·弗雷泽大学) University of Waterloo(滑铁卢大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Lean Finder通过语义搜索和用户意图理解,提升了数学家在Lean和mathlib中的搜索效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19065 2026-02-24 cs.AI 57%

Agentic Problem Frames: A Systematic Approach to Engineering Reliable Domain Agents

代理问题框架:一种系统化的方法用于工程可靠领域代理

Chanjin Park

机构 * Institute of Engineering Research(工程研究所) Seoul National University(首尔国立大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出代理问题框架(APF),通过系统化工程方法提升领域代理的可靠性,结合AJD规范工具和AVR循环实现任务要求的渐近收敛。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 9 篇

2305.11098 2026-02-24 cs.AI 88%

A Simple Generative Model of Logical Reasoning and Statistical Learning

逻辑推理与统计学习的简单生成模型

Hiroyuki Kido

机构 * School of Computer Science(计算机科学系) Informatics, Cardiff University(信息学,卡迪夫大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一个基于贝叶斯方法的简单模型,统一逻辑推理与统计学习,通过形式逻辑的可满足性建模数据生成符号知识,实现精确推断和理论正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18514 2026-02-24 cs.CR cs.AI 83%

Trojan Horses in Recruiting: A Red-Teaming Case Study on Indirect Prompt Injection in Standard vs. Reasoning Models

招聘中的木马:针对标准与推理模型间接提示注入的红队案例研究

Manuel Wirth

机构 * University of Mannheim(曼海姆大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究通过红队测试揭示了标准与推理模型在间接提示注入中的安全差异,发现推理模型在复杂指令下易出现元认知泄漏,而标准模型在简单攻击中表现较弱。

Comments 43 pages, 3 synthetic CV PDF's, 6 chat history PDF's and system prompts. This work was developed as part of the Responsible AI course within the Mannheim Master in Data Science (MMDS) program at the University of Mannheim

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19569 2026-02-24 cs.CL cs.AI 81%

Temporal-Aware Heterogeneous Graph Reasoning with Multi-View Fusion for Temporal Question Answering

具有多视角融合的时序感知异构图推理用于时序问答

Wuzhenghong Wen, Bowen Zhou, Jinwen Huang, Xianjie Wu, Yuwei Sun, Su Pan, Liang Li, Jianting Liu

机构 * 1 School of Internet of Things, Nanjing University of Posts Telecommunications 2 Faculty of Medicine \& Health, University of New South Wales, Sydney, Australia 3 Dept. of Biomedical Engineering \& Biotechnology, Khalifa University, Abu Dhabi 4 Beijing Information Science Technology University 5 Shortest Path Technology Co., Ltd.

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种时序感知异构图推理框架,通过多视角融合提升时序问答的准确性和效率。

Comments 6pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18650 2026-02-24 cs.MA cs.AI cs.IR 70%

NutriOrion: A Hierarchical Multi-Agent Framework for Personalized Nutrition Intervention Grounded in Clinical Guidelines

NutriOrion:一种基于临床指南的个性化营养干预分层多智能体框架

Junwei Wu, Runze Yan, Hanqi Luo, Darren Liu, Minxiao Wang, Kimberly L. Townsend, Lydia S. Hartwig, Derek Milketinas, Xiao Hu, Carl Yang

机构 * Emory University(埃默里大学) Texas Woman's University(德克萨斯女子大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 NutriOrion通过分层多智能体框架实现个性化营养干预,结合多目标优先级算法和安全约束机制,有效解决多病共存患者的饮食需求冲突与临床有效性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04568 2026-02-24 cs.AI cs.CL cs.IR cs.LG 67%

Neurosymbolic Retrievers for Retrieval-augmented Generation

用于检索增强生成的神经符号检索器

Yash Saxena, Manas Gaur

机构 * Dept. of CSEE University of Maryland Baltimore County, Maryland, USA(电子工程系大学马里兰大学巴尔的摩县) Dept. of CSEE University of Maryland Baltimore County, MD, USA(电子工程系大学马里兰大学巴尔的摩县)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出神经符号 RAG 框架,通过结合知识图谱与神经检索技术,提升检索过程的透明性和生成性能。

Comments 8 pages, 2 Figures, Published in IEEE Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17621 2026-02-24 cs.MA cs.AI cs.CL 62%

From Competition to Coordination: Market Making as a Scalable Framework for Safe and Aligned Multi-Agent LLM Systems

从竞争到协调:市场制作作为安全且对齐的多智能体大语言模型系统的可扩展框架

Brendan Gho, Suman Muppavarapu, Afnan Shaik, Tyson Tsay, Atharva Mohan, James Begin, Kevin Zhu, Archana Vaidheeswaran, Vasu Sharma

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于市场机制的多智能体大语言模型协调框架,通过结构化经济交换提升推理准确性和透明度,实现自我组织和可验证推理,为安全、对齐的AI系统提供可扩展解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19187 2026-02-24 cs.LG 57%

Adaptive Problem Generation via Symbolic Representations

通过符号表示实现自适应问题生成

Teresa Yeo, Myeongho Jeon, Dulaj Weerakoon, Rui Qiao, Alok Prakash, Armando Solar-Lezama, Archan Misra

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联盟研究技术) Massachusetts Institute of Technology(麻省理工学院) Singapore Management University(新加坡管理大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出通过符号表示生成自适应问题,以提升小型语言模型在数学任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21896 2026-02-24 cs.AI 57%

GenesisGeo: Technical Report

GenesisGeo:技术报告

Minfeng Zhu, Zi Wang, Sizhe Ji, Zhengtong Du, Shengqiang Tai, Junming Ke, Xiao Deng, Zanlang Yin, Xiuqi Huang, Heyu Wang, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Polytechnic Institute, Zhejiang University(浙江大学多科大学院) Hangzhou Research Institute of AI and Holographic Technology(杭州人工智能与全息技术研究 institutes) Volkswagen Group Innovation(大众集团创新) School of Mathematical Science, Zhejiang University(浙江大学数学科学学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GenesisGeo-1M数据集及基于多任务学习的几何学习框架,通过大规模合成数据提升模型在几何推理任务中的性能,实现金牌级表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16949 2026-02-24 cs.CY 50%

How should AI knowledge be governed? Epistemic authority, structural transparency, and the case for open cognitive graphs

AI知识应该如何被治理?知识权威、结构透明性与开放认知图的案例

Chao Li, Chunyi Zhao, Yuru Wang, Yi Hu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出开放认知图作为教育AI治理框架,通过结构透明和知识权威管理,实现教育AI与民主问责的对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 29 篇

2602.20119 2026-02-24 cs.RO cs.AI cs.CV 83%

NovaPlan: Zero-Shot Long-Horizon Manipulation via Closed-Loop Video Language Planning

NovaPlan: 通过闭环视频语言规划实现零样本长周期操控

Jiahui Fu, Junyu Nan, Lingfeng Sun, Hongyu Li, Jianing Qian, Jennifer L. Barry, Kris Kitani, George Konidaris

机构 * Robotics and AI Institute(机器人与人工智能研究所) Carnegie Mellon University(卡内基梅隆大学) Brown University(布朗大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 NovaPlan通过闭环视频语言规划实现零样本长周期操控,结合高层任务分解与底层物理执行,无需先验演示即可完成复杂装配任务。

Comments 25 pages, 15 figures. Project webpage: https://nova-plan.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13444 2026-02-24 cs.CV cs.AI 83%

VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning

VideoMind: 一种用于时序 grounded 视频推理的链式 LoRA 代理

Ye Liu, Kevin Qinghong Lin, Chang Wen Chen, Mike Zheng Shou

机构 * The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 VideoMind 提出了一种基于角色的链式 LoRA 机制,用于提升视频时序 grounded 推理的效率与灵活性。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18694 2026-02-24 cs.LG cs.AI 81%

In-Context Planning with Latent Temporal Abstractions

基于潜在时间抽象的上下文规划

Baiting Luo, Yunuo Zhang, Nathaniel S. Keplinger, Samir Gupta, Abhishek Dubey, Ayan Mukhopadhyay

机构 * Vanderbilt University(范德比大学) William & Mary(威廉与玛丽学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 I-TAP通过学习离散时间抽象空间,实现高效且鲁棒的上下文规划,在部分可观测和随机动态环境中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00672 2026-02-24 cs.LG cs.AI 81%

ML-Tool-Bench: Tool-Augmented Planning for ML Tasks

ML-Tool-Bench: 为机器学习任务增强的工具辅助规划

Yaswanth Chittepu, Raghavendra Addanki, Tung Mai, Anup Rao, Branislav Kveton

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ML-Tool-Bench,通过引入内存中的命名对象管理,评估工具增强的ML代理,改进了ReAct方法,提升了16.52个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19980 2026-02-24 cs.LG 79%

Discrete Diffusion Models Exploit Asymmetry to Solve Lookahead Planning Tasks

离散扩散模型利用不对称性解决前瞻规划任务

Itamar Trainin, Shauli Ravfogel, Omri Abend, Amir Feder

机构 * Hebrew University of Jerusalem(耶路撒冷希伯来大学) New York University(纽约大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 离散扩散模型通过反向生成机制在无需复杂遍历机制的情况下解决前瞻规划任务,相比自回归模型更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19633 2026-02-24 cs.AI 79%

TAPE: Tool-Guided Adaptive Planning and Constrained Execution in Language Model Agents

TAPE: 语言模型代理中的工具引导自适应规划与约束执行

Jongwon Jeong, Jungtaek Kim, Kangwook Lee

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 TAPE通过工具引导的自适应规划与约束执行方法,提升语言模型代理在复杂任务中的成功率,特别是在困难设置中表现显著优于现有框架。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19304 2026-02-24 cs.RO cs.AI cs.HC cs.MA 79%

Safe and Interpretable Multimodal Path Planning for Multi-Agent Cooperation

安全且可解释的多模态路径规划用于多智能体协作

Haojun Shi, Suyu Ye, Katherine M. Guerrerio, Jianzhi Shen, Yifan Yin, Daniel Khashabi, Chien-Ming Huang, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 CaPE通过多模态路径规划实现安全且可解释的多智能体协作,利用视觉-语言模型和模型基于规划器确保路径调整的安全性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏