arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-07 至 2025-10-07 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 25 篇

2510.04532 2025-10-07 cs.AI cs.CL cs.RO 91%

More Than Meets the Eye? Uncovering the Reasoning-Planning Disconnect in Training Vision-Language Driving Models

Xurui Song, Shuo Huai, JingJing Jiang, Jiayi Kong, Jun Luo

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract);CoT(abstract)

Comments The dataset will be released publicly once the paper is accepted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04568 2025-10-07 cs.AI cs.LG 81%

COSMIR: Chain Orchestrated Structured Memory for Iterative Reasoning over Long Context

Naman Gupta, Shreeyash Gowaikar, Arun Iyer, Kirankumar Shiragur, Ramakrishna B Bairi, Rishikesh Maurya, Ritabrata Maiti, Sankarshan Damle, Shachee Mishra Gupta

机构 * Microsoft(微软)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09614 2025-10-07 cs.AI cs.CL 81%

Language Agents Mirror Human Causal Reasoning Biases. How Can We Help Them Think Like Scientists?

Anthony GX-Chen, Dongyan Lin, Mandana Samiei, Doina Precup, Blake A. Richards, Rob Fergus, Kenneth Marino

机构 * New York University(纽约大学) McGill University(麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) CIFAR Learning in Machines and Brains Program(CIFAR 机器与大脑学习计划) The University of Utah(犹他大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Conference on Language Modelling (COLM) 2025, Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05048 2025-10-07 cs.AI cs.GT 79%

Look-ahead Reasoning with a Learned Model in Imperfect Information Games

Ondřej Kubíček, Viliam Lisý

机构 * Artificial Intelligence Center, FEE Czech Technical University in Prague(人工智能中心,布拉格捷克技术大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03847 2025-10-07 cs.AI cs.LG 79%

Small Language Models for Agentic Systems: A Survey of Architectures, Capabilities, and Deployment Trade offs

Raghav Sharma, Manan Mehta

专题命中 规划推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.AI、cs.LG

Comments 9 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00413 2025-10-07 cs.CV 78%

PAL-UI: Planning with Active Look-back for Vision-Based GUI Agents

Zikang Liu, Junyi Li, Wayne Xin Zhao, Dawei Gao, Yaliang Li, Ji-rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学全球化人工智能学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :planning(title,abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04023 2025-10-07 cs.AI cs.CL 73%

LLM-Based Data Science Agents: A Survey of Capabilities, Challenges, and Future Directions

Mizanur Rahman, Amran Bhuiyan, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Ridwan Mahbub, Ahmed Masry, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Vector Institute for AI(人工智能矢量研究所) Dialpad Inc.(Dialpad公司) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments Survey paper; 45 data science agents; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04678 2025-10-07 cs.CL 70%

Multi-Agent Tool-Integrated Policy Optimization

Zhanfeng Mo, Xingxuan Li, Yuntao Chen, Lidong Bing

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04542 2025-10-07 cs.AI 70%

Code World Models for General Game Playing

Wolfgang Lehrach, Daniel Hennes, Miguel Lazaro-Gredilla, Xinghua Lou, Carter Wendelken, Zun Li, Antoine Dedieu, Jordi Grau-Moya, Marc Lanctot, Atil Iscen, John Schultz, Marcus Chiam, Ian Gemp, Piotr Zielinski, Satinder Singh, Kevin P. Murphy

机构 * Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01932 2025-10-07 cs.CL 70%

Veri-R1: Toward Precise and Faithful Claim Verification via Online Reinforcement Learning

Qi He, Cheng Qian, Xiusi Chen, Bingxiang He, Yi R. Fung, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Fudan University(复旦大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04851 2025-10-07 cs.AI cs.LG cs.MA 62%

LEGOMem: Modular Procedural Memory for Multi-agent LLM Systems for Workflow Automation

Dongge Han, Camille Couturier, Daniel Madrigal Diaz, Xuchao Zhang, Victor Rühle, Saravan Rajmohan

机构 * Microsoft(微软)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04031 2025-10-07 cs.CL cs.AI 62%

Does Using Counterfactual Help LLMs Explain Textual Importance in Classification?

Nelvin Tan, James Asikin Cheung, Yu-Ching Shih, Dong Yang, Amol Salunkhe

机构 * American Express(美国运通)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03971 2025-10-07 cs.LG cs.AI 62%

What Can You Do When You Have Zero Rewards During RL?

Jatin Prakash, Anirudh Buvanesh

机构 * New York University(纽约大学) Mila, Université de Montréal(蒙特利尔大学米拉实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03514 2025-10-07 cs.CY cs.AI cs.CL 62%

Red Lines and Grey Zones in the Fog of War: Benchmarking Legal Risk, Moral Harm, and Regional Bias in Large Language Model Military Decision-Making

Toby Drinkall

机构 * Oxford Internet Institute, University of Oxford(牛津互联网研究所、牛津大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

Comments 54 pages; 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04695 2025-10-07 cs.AI 57%

Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents

Yiding Wang, Zhepei Wei, Xinyu Zhu, Yu Meng

机构 * Department of Computer Science, University of Virginia(计算机科学系,弗吉尼亚大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16965 2025-10-07 cs.CL cs.CV 57%

Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning

Zhe Hu, Jing Li, Zhongzhu Pu, Hou Pong Chan, Yu Yin

机构 * The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) InspireOmni AI Alibaba Group(阿里巴巴集团) Case Western Reserve University(凯斯西储大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04560 2025-10-07 cs.AI 57%

ContextNav: Towards Agentic Multimodal In-Context Learning

Honghao Fu, Yuan Ouyang, Kai-Wei Chang, Yiwei Wang, Zi Huang, Yujun Cai

机构 * The University of Queensland(昆士兰大学) Nanjing University(南京大学) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Merced(加州大学默塞德分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03829 2025-10-07 cs.NI cs.AI 57%

A4FN: an Agentic AI Architecture for Autonomous Flying Networks

André Coelho, Pedro Ribeiro, Helder Fontes, Rui Campos

机构 * FCT – Fundação para a Ciência e a Tecnologia, I.P.(葡萄牙科学与技术基金会)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

Comments This paper has been accepted for presentation in the Auto ML for Zero-Touch Network Management Workshop (WS04-01) at the IEEE International Symposium on Personal, Indoor and Mobile Radio Communications (PIMRC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13118 2025-10-07 cs.CL cs.CR 57%

AutoBnB-RAG: Enhancing Multi-Agent Incident Response with Retrieval-Augmented Generation

Zefang Liu, Arman Anwar

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05791 2025-10-07 cs.AI 57%

GTA1: GUI Test-time Scaling Agent

Yan Yang, Dongxu Li, Yutong Dai, Yuhao Yang, Ziyang Luo, Zirui Zhao, Zhiyuan Hu, Junzhe Huang, Amrita Saha, Zeyuan Chen, Ran Xu, Liyuan Pan, Silvio Savarese, Caiming Xiong, Junnan Li

专题命中 规划推理 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20924 2025-10-07 cs.AI 57%

Domain-Agnostic Scalable AI Safety Ensuring Framework

Beomjun Kim, Kangyeon Kim, Sunwoo Kim, Yeonsang Shin, Heejin Ahn

机构 * Massachusetts Institute of Technology(麻省理工学院) Korea Advanced Institute of Science and Technology(韩国科学技术院) Seoul National University(首尔国立大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25361 2025-10-07 cs.AI 57%

Structural Reward Model: Enhancing Interpretability, Efficiency, and Scalability in Reward Modeling

Xiaoyu Liu, Di Liang, Chang Dai, Hongyu Shan, Peiyang Liu, Yonghao Liu, Muling Wu, Yuntao Li, Xianjie Wu, LI Miao, Jiangrong Shen, Minlong Peng

机构 * Northeastern University, Boston(东北大学,波士顿) Independent Developer(独立开发者) Peiking University(北京大学) Jilin University(吉林大学) Beihang University(北航) Xi’an Jiaotong University(西安交通大学) Baidu Inc(百度公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04364 2025-10-07 cs.HC 50%

Reflection Before Action: Designing a Framework for Quantifying Thought Patterns for Increased Self-awareness in Personal Decision Making

Morita Tarvirdians, Senthil Chandrasegaran, Hayley Hung, Catholijn M. Jonker, Catharine Oertel

专题命中 规划推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20117 2025-10-07 cs.CV 50%

RESCUE: Crowd Evacuation Simulation via Controlling SDM-United Characters

Xiaolin Liu, Tianyi Zhou, Hongbo Kang, Jian Ma, Ziwen Wang, Jing Huang, Wenguo Weng, Yu-Kun Lai, Kun Li

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Cardiff University(卡迪夫大学)

专题命中 规划推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05135 2025-10-07 cs.RO 50%

LERa: Replanning with Visual Feedback in Instruction Following

Svyatoslav Pchelintsev, Maxim Patratskiy, Anatoly Onishchenko, Alexandr Korchemnyi, Aleksandr Medvedev, Uliana Vinogradova, Ilya Galuzinsky, Aleksey Postnikov, Alexey K. Kovalev, Aleksandr I. Panov

机构 * MIPT(莫斯科国立交通大学) Sberbank of Russia, Robotics Center(俄罗斯储蓄银行机器人中心) AIRI

专题命中 规划推理 :planning(abstract)

Comments Accepted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏