arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-06 至 2026-02-06 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 20 篇

2601.21826 2026-02-06 cs.CL 88%

Mil-SCORE: Benchmarking Long-Context Geospatial Reasoning and Planning in Large Language Models

Mil-SCORE:大型语言模型中长上下文地理空间推理与规划的基准测试

Aadi Palnitkar, Mingyang Mao, Nicholas Waytowich, Vinicius G. Goecks, Xiaomin Lin

机构 * University of Maryland, College Park MD, USA(马里兰大学) ERA Lab, University of South Florida, Tampa FL, USA(佛罗里达大学埃拉实验室) DEVCOM Army Research Laboratory, Aberdeen Proving Ground MD, USA(国防部陆军研究实验室) EEHPC Lab, Johns Hopkins University, Baltimore MD, USA(约翰霍普金斯大学EEHPC实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

AI总结 Mil-SCORE是首个针对复杂军事规划情景的多跳问题数据集,旨在评估大型语言模型在长上下文地理空间推理与规划中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05075 2026-02-06 cs.AI cs.LG cs.RO physics.space-ph 81%

Optimizing Mission Planning for Multi-Debris Rendezvous Using Reinforcement Learning with Refueling and Adaptive Collision Avoidance

利用强化学习优化多碎片对接任务的使命规划

Agni Bandyopadhyay, Gunther Waxenegger-Wilfing

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于强化学习的框架,用于优化多碎片清除任务的使命规划,通过自适应碰撞避让和高效任务规划提高任务效率和安全性。

Comments Accpeted at Conference: 15th IAA Symposium on Small Satellites for Earth System Observation At: Berlin

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05385 2026-02-06 cs.CL 79%

IESR:Efficient MCTS-Based Modular Reasoning for Text-to-SQL with Large Language Models

IESR:基于MCTS的高效模块化推理用于文本到SQL with大型语言模型

Tao Liu, Jiafan Lu, Bohan Yu, Pengcheng Wu, Liu Haixin, Guoyu Xu, Li Xiangheng, Lixiao Li, Jiaming Hou, Zhao Shijun, Xinglin Lyu, Kunli Zhang, Yuxiang Jia, Hongyin Zan

机构 * Zhengzhou University(郑州大学) Tianjin University(天津大学) Zhongshan University(中山大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 IESR提出一种基于MCTS的高效模块化推理框架,用于文本到SQL任务,通过信息增强和结构化推理提升复杂查询处理能力。

Comments 25 pages, 16 figures, 8 tables. Hongyin Zan is corresponding author, Jiafan Lu is first co-author

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05279 2026-02-06 cs.AI cs.CR 79%

Hallucination-Resistant Security Planning with a Large Language Model

具备抗幻觉能力的安全规划与大语言模型

Kim Hammar, Tansu Alpcan, Emil Lupu

机构 * The University of Melbourne(墨尔本大学) Imperial College London(伦敦帝国理工学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种抗幻觉的安全规划框架,通过迭代循环和上下文学习优化LLM决策,减少恢复时间30%。

Comments Accepted to IEEE/IFIP Network Operations and Management Symposium 2026. To appear in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16928 2026-02-06 cs.CR 78%

From Sands to Mansions: Towards Automated Cyberattack Emulation with Classical Planning and Large Language Models

从沙子到豪宅:迈向自动化网络攻击仿真的方法:经典规划与大语言模型

Lingzhi Wang, Zhenyuan Li, Yi Jiang, Zhengkai Wang, Xiangmin Shen, Wei Ruan, Yan Chen

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出Aurora系统,结合经典规划与大语言模型,实现自动化网络攻击仿真,生成大规模数据集并验证其在入侵检测系统中的有效性。

Comments This is the author-accepted version of a paper accepted at the Applied Cryptography and Network Security (ACNS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24073 2026-02-06 cs.HC 78%

"Having Lunch Now": Understanding How Users Engage with a Proactive Agent for Daily Planning and Self-Reflection

现在午餐时间

Adnan Abbas, Caleb Wohn, Arnav Jagtap, Eugenia H Rho, Young-Ho Kim, Sang Won Lee

专题命中 规划推理 :planning(title,abstract)

AI总结 本文研究用户与主动代理的互动,探讨其在日常规划和自我反思中的作用,发现用户有不同反应模式并提出设计改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10962 2026-02-06 cs.LG cs.AI 73%

WebSTAR: Scalable Data Synthesis for Computer Use Agents with Step-Level Filtering

WebSTAR: 可扩展的数据合成用于计算机使用代理的步级过滤

Yifei He, Pranit Chawla, Yaser Souri, Subhojit Som, Xia Song

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 WebSTAR通过步级过滤技术合成高质量数据,构建了WebSTAR和WebSCORE数据集,并训练了高效的过程奖励模型StepRM,提升计算机使用代理的训练效果和部署效率。

Comments Project website: https://yifei-he.github.io/webstar-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05327 2026-02-06 cs.AI 70%

ProAct: Agentic Lookahead in Interactive Environments

ProAct:交互环境中的代理前瞻性

Yangbin Yu, Mingyu Yang, Junyou Li, Yiming Gao, Feiyu Liu, Yijun Yang, Zichuan Lin, Jiafei Lyu, Yicheng Liu, Zhicong Lu, Deheng Ye, Jie Jiang

机构 * Tencent Hunyuan(腾讯文言)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 ProAct通过双阶段训练范式提升交互环境中的前瞻性推理能力,结合GLAD和MC-Critic实现更稳定的策略优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17767 2026-02-06 cs.CL 70%

Position: The Real Barrier to LLM Agent Usability is Agentic ROI

位置:LLM代理可用性的真正障碍是代理的ROI

Weiwen Liu, Jiarui Qin, Xu Huang, Xingshan Zeng, Yunjia Xi, Jianghao Lin, Chuhan Wu, Yasheng Wang, Lifeng Shang, Ruiming Tang, Defu Lian, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本文提出LLM代理可用性的核心问题在于其投资回报率,主张通过Z字型发展路径提升其在日常应用中的可用性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05552 2026-02-06 cs.RO cs.CV 67%

VLN-Pilot: Large Vision-Language Model as an Autonomous Indoor Drone Operator

VLN-Pilot: 大型视觉-语言模型作为自主室内无人机操作员

Bessie Dominguez-Dager, Sergio Suescun-Ferrandiz, Felix Escalona, Francisco Gomez-Donoso, Miguel Cazorla

机构 * University Institute for Compute Research(计算研究大学研究所) University of Alicante(阿利坎特大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 VLN-Pilot利用大型视觉-语言模型实现自主室内无人机导航,通过自然语言指令和视觉感知结合,提高飞行任务的自主性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23646 2026-02-06 cs.CV 67%

Active Perception Agent for Omnimodal Audio-Video Understanding

多模态音频视频理解的主动感知代理

Keda Tao, Wenjie Du, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 OmniAgent通过动态规划和音频引导感知范式,实现多模态细粒度推理,无需训练即超越现有模型性能。

Comments Website:https://kd-tao.github.io/OmniAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05273 2026-02-06 cs.RO 67%

Affordance-Aware Interactive Decision-Making and Execution for Ambiguous Instructions

具有包容性的交互决策与执行以应对模糊指令

Hengxuan Xu, Fengbo Lan, Zhixin Zhao, Shengjie Wang, Mengqiao Liu, Jieqian Sun, Yu Cheng, Tao Zhang

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息学院) Computer Science and Engineering Department, Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 AIDE通过双流框架整合交互式探索与视觉-语言推理,实现对模糊指令的高效决策与执行,提升机器人在陌生环境中的任务规划能力。

Comments 14 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20339 2026-02-06 cs.CL cs.LG 62%

Improving Diffusion Language Model Decoding through Joint Search in Generation Order and Token Space

通过生成顺序和令牌空间的联合搜索改进扩散语言模型解码

Yangyi Shen, Tianjian Feng, Jiaqi Han, Wen Wang, Tianlang Chen, Chunhua Shen, Jure Leskovec, Stefano Ermon

机构 * stanford(斯坦福大学) zju(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过联合搜索生成顺序和令牌空间,改进扩散语言模型的解码性能,在多个基准测试中取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25634 2026-02-06 cs.RO cs.AI 57%

Learning to Plan & Schedule with Reinforcement-Learned Bimanual Robot Skills

学习计划与调度的强化学习双臂机器人技能

Weikang Wan, Fabio Ramos, Xuning Yang, Caelan Garrett

机构 * NVIDIA University of California San Diego(加州大学圣地亚哥分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于强化学习的双臂机器人技能计划与调度框架,通过分层结构提升复杂任务的执行效率与协调性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05240 2026-02-06 cs.AI 57%

Explainable AI: A Combined XAI Framework for Explaining Brain Tumour Detection Models

可解释AI:一种结合XAI框架用于解释脑肿瘤检测模型

Patrick McGonagle, William Farrelly, Kevin Curran

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种结合GRAD-CAM、LRP和SHAP的XAI框架,用于提升脑肿瘤检测模型的可解释性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05105 2026-02-06 cs.AI cs.RO cs.SE 57%

GAMMS: Graph based Adversarial Multiagent Modeling Simulator

基于图的对抗多智能体建模模拟器

Rohan Patil, Jai Malegaonkar, Xiao Jiang, Andre Dion, Gaurav S. Sukhatme, Henrik I. Christensen

机构 * University of Southern California(美国南加州大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 GAMMS是一款轻量级多智能体仿真框架,支持图结构环境下的快速开发与评估,提供可视化反馈和现实基础,适用于复杂领域如交通和通信系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05446 2026-02-06 cs.HC 50%

DiLLS: Interactive Diagnosis of LLM-based Multi-agent Systems via Layered Summary of Agent Behaviors

通过代理行为分层总结实现基于大语言模型的多代理系统交互诊断:DiLLS

Rui Sheng, Yukun Yang, Chuhan Shi, Yanna Lin, Zixin Chen, Huamin Qu, Furui Cheng

专题命中 规划推理 :planning(abstract)

AI总结 DiLLS通过多层行为总结,帮助开发者更高效地诊断和理解基于LLM的多代理系统故障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04992 2026-02-06 cs.HC cs.RO 50%

Applying Ground Robot Fleets in Urban Search: Understanding Professionals' Operational Challenges and Design Opportunities

在城市搜索中应用地面机器人队伍:理解专业人员的操作挑战与设计机会

Puqi Zhou, Charles R. Twardy, Cynthia Lum, Myeong Lee, David J. Porfirio, Michael R. Hieb, Chris Thomas, Xuesu Xiao, Sungsoo Ray Hong

机构 * George Mason University(乔治·马歇尔大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 规划推理 :planning(abstract)

AI总结 本文探讨了在城市搜索中应用地面机器人队伍对公共安全专业人员操作挑战的影响,提出了减轻认知和体力负担的设计机会。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04972 2026-02-06 cs.CY 50%

Learning Context Matters: Measuring and Diagnosing Personalization Gaps in LLM-Based Instructional Design

学习上下文很重要:在基于LLM的教学设计中测量和诊断个性化差距

Johaun Hatchett, Debshila Basu Mallick, Brittany C. Bradford, Richard G. Baraniuk

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种框架,用于测量和诊断学习上下文对基于LLM教学系统的影响,发现提供学习上下文能改善LLM的教学策略,但尚未实现可靠的个性化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02648 2026-02-06 eess.SY cs.CY cs.GT cs.MA cs.SI cs.SY 50%

Steering the Herd: A Framework for LLM-based Control of Social Learning

引导 herd:一种基于 LLM 的社会学习控制框架

Raghu Arghal, Kevin He, Shirin Saeedi Bidokhti, Saswati Sarkar

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出了一种基于 LLM 的社会学习控制框架,研究信息中介如何通过动态规划和贝叶斯更新影响社会福利和群体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏