arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-13 至 2026-01-13 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 27 篇

2601.06176 2026-01-13 cs.CV 87%

TIR-Flow: Active Video Search and Reasoning with Frozen VLMs

TIR-Flow:基于冻结视频语言模型的主动视频搜索与推理

Hongbo Jin, Siyi Xie, Jiayu Ding, Kuanwei Lin, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 TIR-Flow通过三个协同模块实现冻结视频语言模型的主动视频搜索与推理,显著提升性能并拓展长视界视频推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04632 2026-01-13 cs.AI cs.LG 84%

Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models?

能否在线预测提示难度以加速推理模型的强化学习微调?

Yun Qu, Qi Wang, Yixiu Mao, Vincent Tao Hu, Björn Ommer, Xiangyang Ji

机构 * Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出MoPPS框架,通过贝叶斯方法在线预测提示难度,从而加速推理模型的强化学习微调过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07577 2026-01-13 cs.AI 83%

Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon Agents

超越纠缠规划:面向长时间 horizon 的任务解耦规划

Yunfan Li, Bingbing Xu, Xueyun Tian, Xiucheng Xu, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室、计算技术研究所、中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出任务解耦规划(TDP)方法,通过将任务分解为子目标图,减少长horizon智能体的规划误差传播,提升鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14656 2026-01-13 cs.AI 83%

Cost-Awareness in Tree-Search LLM Planning: A Systematic Study

树搜索LLM规划中的成本意识:系统研究

Zihao Zhang, Hui Wei, Kenan Jiang, Shijia Pan, Shu Kai, Fei Liu

机构 * Emory University(埃默里大学) University of California, Merced(加州大学默塞德分校)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文研究了树搜索LLM规划器在资源受限下的成本意识问题,发现现有方法难以找到最优计划,双向搜索表现最佳,MCTS在短时间任务中最优,表明需新算法而非单纯增加计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11890 2026-01-13 cs.RO cs.AI 83%

Integrating Symbolic RL Planning into a BDI-based Autonomous UAV Framework: System Integration and SIL Validation

将符号RL规划整合到基于BDI的自主无人机框架中:系统集成与SIL验证

Sangwoo Jeon, Juchul Shin, YeonJe Cho, Gyeong-Tae Kim, Seongwoo Kim

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本研究提出AMAD-SRL框架,整合符号RL与BDI方法,通过SIL验证提升无人机任务效率75%。

Comments This submission has been withdrawn by the authors due to institutional and contractual requirements related to security and export-control review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06102 2026-01-13 cs.AI cs.LG 82%

Dynamic Intelligence Ceilings: Measuring Long-Horizon Limits of Planning and Creativity in Artificial Systems

动态智能上限:测量人工智能系统长期规划和创造力的长期限制

Truong Xuan Khanh, Truong Quynh Hoa

机构 * H&K Research Studio, Clevix LLC(Clevix LLC 研究室)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态智能上限概念,通过轨迹导向评估框架量化人工智能系统长期规划与创造力的限制,揭示智能上限的动态性与轨迹依赖性。

Comments This paper introduces a trajectory-centric evaluation framework for analyzing long-horizon intelligence limits in artificial systems, focusing on developmental behavior, planning, and structural creativity rather than proposing new learning algorithms. 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07782 2026-01-13 cs.CL cs.AI cs.IR 81%

Beyond Single-Shot: Multi-step Tool Retrieval via Query Planning

超越单次检索:通过查询规划实现多步工具检索

Wei Fang, James Glass

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出TOOLQP框架,通过迭代查询规划解决多步工具检索问题,实现更高效的检索和执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07296 2026-01-13 cs.AI cs.CL 81%

LRAS: Advanced Legal Reasoning with Agentic Search

LRAS: 基于代理搜索的先进法律推理

Yujin Zhou, Chuxue Cao, Jinluan Yang, Lijun Wu, Conghui He, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LRAS通过整合反思模仿学习和难度感知强化学习,使大推理模型能够识别知识边界并处理法律推理的复杂性,从而在法律领域取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12626 2026-01-13 cs.AI cs.DC 80%

Automated Planning for Optimal Data Pipeline Instantiation

最优数据管道实例化的自动化规划

Leonardo Rosa Amado, Adriano Vogel, Dalvan Griebler, Gabriel Paludo Licks, Eric Simon, Felipe Meneguzzi

机构 * Pontifical Catholic University of Rio Grande do Sul, Brazil(里约格朗德杜斯鲁斯天主教大学) Johannes Kepler University Linz, Austria(林茨约翰·凯撒大学) Sapienza University of Rome, Italy(罗马萨皮恩扎大学) SAP Labs, France(SAP实验室) University of Aberdeen, Scotland(阿伯丁大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于动作成本的规划方法,用于优化数据管道实例化,通过启发式算法减少总执行时间,并在实验中验证了其有效性。

Journal ref Proceedings of the ECAI Workshop on AI-based Planning for Complex Real-World Applications (CAIPI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06562 2026-01-13 cs.LG 79%

Mosaic: Unlocking Long-Context Inference for Diffusion LLMs via Global Memory Planning and Dynamic Peak Taming

Mosaic: 通过全局内存规划和动态峰值镇压解锁扩散语言模型的长上下文推理

Liang Zheng, Bowen Shi, Yitao Hu, Jiawei Zhang, Ruofan Li, Sheng Chen, Wenxin Li, Keqiu Li

机构 * Tianjin University, China(天津大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 Mosaic通过全局内存规划和动态峰值镇压,提升扩散语言模型的长上下文推理能力,实现内存效率和推理长度的显著提升。

Comments 11 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06164 2026-01-13 cs.SE cs.AI 79%

Contract2Plan: Verified Contract-Grounded Retrieval-Augmented Optimization for BOM-Aware Procurement and Multi-Echelon Inventory Planning

Contract2Plan: 一种基于合同的验证性检索增强优化方法用于BOM感知采购和多层级库存规划

Sahil Agarwal

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 Contract2Plan通过验证性检索增强优化方法,解决合同条款与BOM耦合导致的采购和库存规划问题,确保计划的可行性与合规性。

Comments 22 pages, 5 figures, 4 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06062 2026-01-13 cs.CY cs.AI cs.HC 79%

From Values to Frameworks: A Qualitative Study of Ethical Reasoning in Agentic AI Practitioners

从价值到框架:关于代理AI从业者伦理推理的定性研究

Theodore Roberts, Bahram Zarrin

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过定性研究揭示代理AI从业者在伦理推理中的三种框架:用户、设计和伦理,强调需管理这些框架以确保伦理结果。

Comments 10 pages, 2 charts, 1 heatmap

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07186 2026-01-13 cs.RO 78%

PROTEA: Securing Robot Task Planning and Execution

PROTEA:保障机器人任务规划与执行的安全性

Zainab Altaweel, Mohaiminul Al Nahian, Jake Juettner, Adnan Siraj Rakin, Shiqi Zhang

专题命中 规划推理 :planning(title,abstract)

AI总结 PROTEA通过LLM-as-a-Judge机制评估机器人任务计划的安全性,解决维度和历史挑战,提升任务规划系统的鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06818 2026-01-13 cs.CL 70%

AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents

AgentHallu: 评估基于大语言模型的代理的自动幻觉归因

Xuannan Liu, Xiao Yang, Zekun Li, Peipei Li, Ran He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Department of Computer Science & Technology, Tsinghua University(清华大学计算机科学与技术系) University of California, Santa Barbara(加州大学圣芭芭拉分校) Center for Research on Intelligent Perception and Computing, NLPR, CASIA(智能感知与计算研究中心,国家工程实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 AgentHallu提出一个评估基于大语言模型的代理自动识别幻觉来源的任务,通过高质量轨迹和多级注释评估13个模型,发现顶级模型在定位幻觉步骤上表现有限,工具使用幻觉最难识别。

Comments Project page: https://liuxuannan.github.io/AgentHallu.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06064 2026-01-13 cs.CY cs.AI cs.MA 70%

Socio-technical aspects of Agentic AI

群体技术视角下的代理AI

Praveen Kumar Donta, Alaa Saleh, Ying Li, Shubham Vaishnav, Kai Fang, Hailin Feng, Yuchao Xia, Thippa Reddy Gadekallu, Qiyang Zhang, Xiaodan Shi, Ali Beikmohammadi, Sindri Magnússon, Ilir Murturi, Chinmaya Kumar Dehury, Marcin Paprzycki, Lauri Loven, Sasu Tarkoma, Schahram Dustdar

机构 * Department of Computer and Systems Sciences, Stockholm University(斯德哥尔摩大学计算机与系统科学系) Center for Ubiquitous Computing, University of Oulu(奥卢大学无处不在计算中心) College of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Zhejiang A\&F University, Hangzhou(浙江工业大学之江学院) School of Computer Science, Peking University(北京大学计算机科学学院) Department of Mechatronics, University of Prishtina(普里什蒂纳大学机电系) Department of Computer Science, IISER Berhampur(伯尔哈普尔IISER计算机科学系) Systems Research Institute Polish Academy of Sciences(波兰科学院系统研究所) Department of Computer Science, University of Helsinki(赫尔辛基大学计算机科学系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文从社会技术视角探讨代理AI,分析其技术组件与社会背景的关联,揭示伦理挑战及未来研究方向。

Comments Dear Reviewer, please note that this is not survey/review or position paper. This paper introduced new framework (MAD-BAD-SAD Framework) for Socio-technical aspects of Agentic AI, Ethical considerations, which is very important to consider beside technical development

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07767 2026-01-13 cs.LG cs.CL 62%

Are LLM Decisions Faithful to Verbal Confidence?

大型语言模型的决策是否忠实于其语言自信度?

Jiawei Wang, Yanfei Zhou, Siddartha Devic, Deqing Fu

机构 * University of Southern California(南加州大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究发现大型语言模型在高惩罚条件下缺乏战略决策能力,其语言自信度与实际决策不一致,影响AI系统的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06505 2026-01-13 cs.LG cs.AI 62%

Neural Nonmyopic Bayesian Optimization in Dynamic Cost Settings

动态成本环境下的神经非短视贝叶斯优化

Sang T. Truong, Duc Q. Nguyen, Willie Neiswanger, Ryan-Rhys Griffiths, Stefano Ermon, Nick Haber, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) University of Southern California(南加州大学) FutureHouse, Inc.(FutureHouse公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 LookaHES通过整合神经策略,实现动态成本环境下的非短视贝叶斯优化,提升复杂决策空间中的长视图优化能力。

Comments 32 pages, 20 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04566 2026-01-13 cs.AI cs.CL 62%

BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents

BackdoorAgent: 一个统一框架用于针对基于LLM的代理的后门攻击

Yunhao Feng, Yige Li, Yutao Wu, Yingshui Tan, Yanming Guo, Yifan Ding, Kun Zhai, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Singapore Management University(新加坡管理大学) Alibaba Group(阿里巴巴集团) Deakin University(德肯大学) Hunan Institute of Advanced Technology(湖南高级技术研究所)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 BackdoorAgent提出一个统一框架,分析LLM代理中后门攻击的跨阶段传播和触发器持续性,揭示代理工作流的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07364 2026-01-13 cs.AI 57%

On the universal definition of intelligence

关于智能的普遍定义

Joseph Chen

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出扩展预测假说(EPH)作为人类和人工智能智能的普遍定义,通过区分预测能力并引入可获性概念,统一解释智能的多个方面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07041 2026-01-13 cs.CL 57%

When Abundance Conceals Weakness: Knowledge Conflict in Multilingual Models

当丰裕掩盖弱点:多语言模型中的知识冲突

Jiaqi Zhao, Qiang Huang, Haodong Chen, Xiaoxing You, Jun Yu

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究提出CLEAR框架,分析多语言模型在跨语言知识冲突中的解决机制,揭示任务类型对冲突解决的影响,显示语言资源丰富度与语言亲和力在不同任务中的决定性作用。

Comments 14 pages, 7 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03544 2026-01-13 math.OC cs.AI cs.RO 57%

Agile Tradespace Exploration for Space Rendezvous Mission Design via Transformers

通过变换器实现空间交汇任务设计的敏捷贸易空间探索

Yuji Takubo, Daniele Gammelli, Marco Pavone, Simone D'Amico

机构 * Dept. of Aeronautics & Astronautics Stanford University(航空与航天系 斯坦福大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于变换器的框架,实现快速生成多目标交汇任务的帕累托最优轨迹,提升任务设计效率与灵活性。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06216 2026-01-13 cs.CY cs.AI 57%

LLM Agents in Law: Taxonomy, Applications, and Challenges

法律中的LLM代理:分类、应用与挑战

Shuang Liu, Ruijia Zhang, Ruoyun Ma, Yujia Deng, Lanyi Zhu, Jiayu Li, Zelong Li, Zhibin Shen, Mengnan Du

机构 * Carnegie Mellon University(卡内基梅隆大学) National University of Singapore(国立新加坡大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) The University of Chicago(芝加哥大学) Rutgers University(罗格斯大学) Columbia University(哥伦比亚大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文探讨了法律领域中LLM代理的分类、应用及挑战,分析了技术转变、应用分类、评估方法及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06029 2026-01-13 cs.HC cs.AI 57%

A Recommendation System-Based Framework for Enhancing Human-Machine Collaboration in Industrial Timetabling Rescheduling: Application in Preventive Maintenance

基于推荐系统的工业时间表重排增强人机协作框架:预防性维护的应用

Kévin Ducharlet, Liwen Zhang, Sara Maqrot, Houssem Saidi

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于推荐系统的框架,用于提升工业时间表重排中的人机协作效率,通过九个实际案例验证启发式方法在平衡解决方案质量和计算时间方面的效果。

Journal ref 26th IFIP WG 5.5 SOCOLNET Working Conference on Virtual Enterprises, PRO-VE 2025, Oct 2025, Porto, Portugal. pp.363-381

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04791 2026-01-13 cs.AI 57%

What-If Analysis of Large Language Models: Explore the Game World Using Proactive Thinking

大型语言模型的What-If分析:通过前瞻性思维探索游戏世界

Yuan Sui, Yanming Zhang, Yi Liao, Yu Gu, Guohua Tang, Zhongqian Sun, Wei Yang, Bryan Hooi

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 WiA-LLM通过前瞻性思维提升大型语言模型在复杂游戏环境中的决策能力,实现74.2%的预测准确率和更接近专家玩家的策略行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07181 2026-01-13 cs.CV 50%

ShowUI-Aloha: Human-Taught GUI Agent

ShowUI-Aloha: 由人类指导的GUI代理

Yichun Zhang, Xiangwu Guo, Yauhong Goh, Jessica Hu, Zhiheng Chen, Xin Wang, Difei Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 规划推理 :reasoning(abstract)

AI总结 ShowUI-Aloha通过将无结构的人类屏幕记录转化为结构化任务,提供了一种可扩展的解决方案,用于构建能够从观察人类中有效学习的通用GUI代理。

Comments 13 Pages, 16 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21199 2026-01-13 cs.CV eess.SP 50%

MedPrompt: LLM-CNN Fusion with Weight Routing for Medical Image Segmentation and Classification

MedPrompt: 基于权重路由的LLM-CNN融合用于医学图像分割与分类

Shadman Sobhan, Kazi Abrar Mahmud, Abduz Zami

机构 * 1 ,2 Department of Electrical Electronic Engineering,\ University of Engineering 3Department of Computer Science \& Engineering,\ University of Engineering \& Technology, Rajshahi-6204, Bangladesh

专题命中 规划推理 :planning(abstract)

AI总结 MedPrompt结合LLM和CNN实现医学图像分割与分类,通过权重路由提高可扩展性,实现高准确率和低延迟的实时应用。

Comments 40 pages, 8 Tables, 9 Figures

Journal ref Published at Biomedical Signal Processing and Control Volume 113, Part D, March 2026, 109251

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25602 2026-01-13 cs.IR 50%

TRUE: A Reproducible Framework for LLM-Driven Relevance Judgment in Information Retrieval

TRUE: 一种用于信息检索中基于大语言模型的相关性判断的可重复框架

Mouly Dewan, Jiqun Liu, Chirag Shah

专题命中 规划推理 :reasoning(abstract)

AI总结 TRUE是一种用于信息检索中基于大语言模型的相关性判断的可重复框架,通过迭代数据采样和推理评估多个相关性因素,提升相关性判断的可靠性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏