arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11088 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11088 篇

1402.2196 2014-10-15 q-bio.NC 67%

Affective and cognitive prefrontal cortex projections to the lateral habenula in humans

Karin Vadovičová

专题命中 规划推理 :reasoning(abstract);planning(abstract)

Comments I renamed the medioventral part of the anterior thalamus via which the PFC to LHb fibre tracts from ventral anterior (AV) to medial anterior thalamic region. Apologies for that. My co-author decided to remove his name

详情

展开后加载摘要…

URL PDF HTML 收藏
1310.2431 2013-10-10 cs.LO cs.MA 67%

Practical Verification of Decision-Making in Agent-Based Autonomous Systems

Louise A. Dennis, Michael Fisher, Nicholas K. Lincoln, Alexei Lisitsa, Sandor M. Veres

专题命中 规划推理 :reasoning(abstract);logical reasoning(abstract)

Comments Submitted to Journal of Automated Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03426 2026-07-07 cs.LG cs.AI 新提交 66%

Amortising Bayesian Experimental Design for Sequential Information Gathering in LLMs

用于大语言模型中顺序信息收集的摊销贝叶斯实验设计

Jakob Hartmann, James Harvey, Jhonathan Navott, Erik Y. Wang, Luckeciano C. Melo, Flaviu Cipcigan, Cheng Zhang, Alessandro Abate

机构 * University of Oxford(牛津大学) Ellison Institute of Technology(埃里森理工学院)

专题命中 规划推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

AI总结 研究大语言模型在顺序决策中信息收集问题,提出摊销顺序信息收集方法,将贝叶斯实验设计融入模型策略,经实验验证该方法能有效提升成功率并降低推理成本。

Comments 20 pages, 7 figures. Accepted to FoGen 2026: Foundations of Deep Generative Models: Understanding Memorization, Generalization, and Reasoning, an ICML 2026 workshop (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02629 2025-08-07 cs.RO cs.AI cs.CL 66%

HyCodePolicy: Hybrid Language Controllers for Multimodal Monitoring and Decision in Embodied Agents

Yibin Liu, Zhixuan Liang, Zanxin Chen, Tianxing Chen, Mengkang Hu, Wanxi Dong, Congsheng Xu, Zhaoming Han, Yusen Qin, Yao Mu

专题命中 规划推理 :reasoning(abstract,comments);分类 cs.CL、cs.AI

Comments Accepted to ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03904 2025-01-08 cs.LG cs.AI cs.IR 66%

Exploring the Potential of Large Language Models in Public Transportation: San Antonio Case Study

Ramya Jonnala, Gongbo Liang, Jeong Yang, Izzat Alsmadi

专题命中 规划推理 :planning(abstract,comments);分类 cs.AI、cs.LG

Comments This work is accepted to AAAI 2025 Workshop on AI for Urban Planning. arXiv admin note: substantial text overlap with arXiv:2407.11003

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08534 2024-01-29 cs.LG cs.AI cs.HC 66%

DiConStruct: Causal Concept-based Explanations through Black-Box Distillation

Ricardo Moreira, Jacopo Bono, Mário Cardoso, Pedro Saleiro, Mário A. T. Figueiredo, Pedro Bizarro

专题命中 规划推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

Comments Accepted at Conference on Causal Learning and Reasoning (CLeaR 2024, https://www.cclear.cc/2024). To be published at Proceedings of Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.13911 2021-06-29 cs.LG cs.AI 66%

Predictive Control Using Learned State Space Models via Rolling Horizon Evolution

Alvaro Ovalle, Simon M. Lucas

专题命中 规划推理 :planning(abstract,comments);分类 cs.AI、cs.LG

Comments Accepted at the Bridging the Gap Between AI Planning and Reinforcement Learning (PRL) Workshop at ICAPS 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.09930 2023-03-15 cs.AI cs.MA 65%

Conflict-Based Search for Explainable Multi-Agent Path Finding

Justin Kottinger, Shaull Almagor, Morteza Lahijanian

专题命中 规划推理 :planning(abstract,comments);分类 cs.AI

Comments To appear in International Conference on Automated Planning and Scheduling (ICAPS 2022), June 2022

Journal ref 2022 Proceedings of the International Conference on Automated Planning and Scheduling (ICAPS))

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.01774 2020-11-04 cs.AI cs.HC 65%

Provenance-Based Assessment of Plans in Context

Scott E. Friedman, Robert P. Goldman, Richard G. Freedman, Ugur Kuter, Christopher Geib, Jeffrey Rye

专题命中 规划推理 :planning(abstract,comments);分类 cs.AI

Comments 9 pages, 7 figures, including in Proceedings of the 2020 ICAPS Workshop on Explainable AI Planning (XAIP)

Journal ref Proceedings of the 2020 ICAPS Workshop on Explainable AI Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24255 2026-08-25 cs.CL cs.AI cs.HC 版本更新 62%

Effects of Theory of Mind and Prosocial Beliefs on Steering Human-Aligned Behaviors of LLMs in Ultimatum Games

心理理论与亲社会信念对最后通牒博弈中大型语言模型的人类对齐行为的影响

Neemesh Yadav, Yihuai Lan, Shan Dong, Mai Hieu Hien, Palakorn Achananuparp, Jing Jiang, Ee-Peng Lim

机构 * Singapore Management University(新加坡管理大学) Australian National University(澳大利亚国立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究以最后通牒博弈为任务,赋予LLM不同亲社会信念与推理方法,开展2700次模拟,发现ToM推理可增强LLM行为对齐度等,且不同游戏角色适配不同ToM顺序,Llama 3.3 70B的推理与行动信念最一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13200 2026-08-25 cs.LG cs.AI cs.MA 版本更新 62%

SRMT: Shared Memory for Multi-agent Lifelong Pathfinding

SRMT:面向多智能体终身路径规划的共享内存

Alsu Sagirova, Yuri Kuratov, Mikhail Burtsev

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出共享循环记忆Transformer(SRMT),通过全局共享内存工作区实现去中心化多智能体的无约束协调,在PO-MAPF等任务上表现优于基线,可扩展且无需领域特定启发式。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20661 2026-08-24 cs.AI cs.CE cs.CL cs.IR 新提交 62%

Auditable by Construction: An Ontology-Driven Framework for Trustworthy LLM Analytics in Enterprise Finance

可审计性原生:面向企业金融领域可信大语言模型分析的本体驱动框架

Sergiy Lunyakin

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对企业金融大语言模型应用的信任问题,提出知识驱动分析框架KDAF,结合本体与CARP技术,在FinanceBench评估中,其可审计性优于基线方法,表明可审计性是该框架的核心优势。

Comments 20 pages, 1 figure, 4 tables, 1 algorithm. Artifact deposit with configurations, ontology schema, prompts, audit reports and reconstruction scripts: https://doi.org/10.5281/zenodo.22022068

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20392 2026-08-24 cs.CL cs.AI 新提交 62%

Evaluation-as-Search: Adaptive Discovery of Grounding Failures in Meeting Assistants

评估即搜索:会议助手接地故障的自适应发现

Sami Khairy, Yasaman Hosseinkashi, Vishak Gopal, Ross Cutler

机构 * Microsoft(微软公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EaS方法构建MeetingProbe基准,发现会议助手故障多源于话语语用挑战,其自适应搜索比随机探测的故障发现率高2.5倍,且公开了该基准以支持可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16794 2026-08-20 cs.RO cs.AI cs.CL 版本更新 62%

Neurosymbolic Embodied Agents

神经符号具身智能体

Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha

机构 * Imperial College London(帝国理工学院) Johns Hopkins University(约翰斯·霍普金斯大学) City, University of London(伦敦城市大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25459 2026-08-19 cs.CL cs.LG 版本更新 62%

SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA

SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中

Haozhou Xu, Dongxia Wu, Matteo Chinazzi, Ruijia Niu, Rose Yu, Yi-An Ma

机构 * University of California San Diego(加州大学圣迭戈分校) Stanford University(斯坦福大学) Northeastern University(东北大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%

Comments Haozhou Xu and Dongxia Wu are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13428 2026-08-19 cs.CL cs.AI 版本更新 62%

MCTS-KBQA: Monte Carlo Tree Search with Information Gain Rewards for Knowledge Base Question Answering

MCTS-KBQA:基于信息增益奖励的知识库问答蒙特卡洛树搜索

Guanming Xiong, Haochen Li, Zonghong Dai, Liqiang Wen, Wen Zhao

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对基于LLM的KBQA中MCTS应用的奖励设计与计算成本问题,提出Fast MCTS方法,以信息增益奖励替代中间状态终端展开,在四个KBQA基准上提升了准确率-成本权衡。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15459 2026-08-18 cs.LG cs.AI 新提交 62%

Not All Attention Is Equal: A Quantitative Survey of the EEI Trade-off

并非所有注意力都平等:EEI权衡的定量综述

Aditya Singh

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本综述围绕注意力机制的效率-表达性-可解释性权衡,定量对比21种方法,梳理其多领域发展脉络,分析研究缺口并指明未来方向,支持粗粒度层级对比。

Comments 53 pages, 8 figures, 16 tables. Code and analysis artifacts: https://github.com/Nixon-H/not-all-attention-is-equal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15424 2026-08-18 cs.MA cs.AI cs.LG 新提交 62%

ETHOS: Towards a Modular Ethics Framework for Clinical Multi-Agent Systems

ETHOS:面向临床多智能体系统的模块化伦理框架

Rakesh Sharma, Sydney Pugh, Cameron Beeche, Pankhuri Singhal, Rachel Wu, Margaret Eby, Jeffrey Duda, James Gee, Kyra O'Brien, Hersh Sagreiya, Marina Serper, Victoria Gershuni, Angela Bradbury, Anurag Verma, Eric Eaton, Kevin B. Johnson, Walter Witschey

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ETHOS是可与现有临床多智能体系统集成的模块化伦理框架,通过分层治理提升决策可靠性,将AI伦理原则转化为可部署的安全保障。

Comments Preprint of an article submitted for consideration in Pacific Symposium on Biocomputing \textcopyright\ 2027 World Scientific Publishing Company. \url{https://psb.stanford.edu/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14660 2026-08-18 cs.LG cs.AI cs.CY 新提交 62%

Ring-based Spatial Transformer: Learning Non-linear Spatial Interactions between Building Distribution and Pedestrian Flow

基于环的空间Transformer:学习建筑分布与行人流量之间的非线性空间相互作用

Shun Nakayama, Takahiro Kanamori, Wanglin Yan

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出基于环的SpatialTransformer模型,利用东京100个火车站的环缓冲区数据学习建筑分布与行人流量的非线性空间相互作用,其预测准确率优于GWR,挑战了紧凑城市假设,为城市规划提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06008 2026-08-18 cs.AI cs.CL 版本更新 62%

PolyWorkBench: Benchmarking LLM Agents for Cross-Lingual Long-Horizon Workflows

PolyWorkBench:多语言长视野语言模型智能体基准测试

Hongliang Li, Yijin Liu, Zhiwei Zhang, Zihe Liu, Xinyue Lou, Jinan Xu, Fandong Meng, Kaiyu Huang

机构 * Beijing Jiaotong University(北京交通大学) Weixin AI, Tencent Inc(腾讯微云人工智能实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 研究多语言长视野工作流程中LLM智能体的表现,提出PolyWorkBench基准测试及结合多种评估方式的混合框架,发现最先进LLM智能体在多语言设置中性能降,强调联合建模语言变化和程序决策对智能体评估的重要性。

Comments 17 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12336 2026-08-14 cs.CL cs.AI 新提交 62%

StorySpark: Module-wise Evolutionary Search for Story Premise Generation

StorySpark:面向故事前提生成的模块级进化搜索

Yang Yang, Zining Zhong, Qian Cao, Jindong Li, Boyun Xu, Kaishen Yuan, Menglin Yang, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) Shandong University(山东大学) Institute of Deep Perception Technology, JITRI(JITRI深度感知技术研究院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM故事生成中前提构思不足的问题,提出StorySpark模块级进化搜索框架,通过优化叙事模块生成更优质的故事前提,提升下游故事质量与创意性。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12062 2026-08-13 cs.CL cs.AI 新提交 62%

Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations

偏好树优化:通过前瞻模拟增强面向目标的对话

Lior Baruch, Moshe Butman, Kfir Bar, Doron Friedman

机构 * Reichman University(赖希曼大学) School of Computer Science(计算机科学学院) School of Communications(传播学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。

Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11361 2026-08-13 cs.LG cs.CL cs.PF 新提交 62%

Lifecycle-Optimal Tokenization: Vocabulary Size as a Deployment-Regime-Dependent Infrastructure Parameter

生命周期最优分词:词汇表大小作为与部署 regime 相关的基础设施参数

Rima Mittal, Ankit Gubrani, Satyanarayana Kakollu

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现 LLM 分词器的最优词汇表大小随部署 regime 变化,提出生命周期部署成本模型,经实验证实其与训练最优值差异最高达 16 倍,且最优范围内质量损失极小,为 LLM 部署提供词汇表容量规划指导。

Comments 6 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17244 2026-08-13 cs.CL cs.AI 版本更新 62%

DORA Explorer: Improving the Exploration Ability of LLMs Without Training

DORA Explorer: 无需训练提升大语言模型的探索能力

Priya Gurjar, Md Farhan Ishmam, Kenneth Marino

机构 * Kahlert School of Computing, University of Utah(犹他大学计算学院Kahlert学院)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DORA Explorer框架,通过生成多样化动作候选并利用token log-probabilities评分,提升LLM在序列决策任务中的探索能力,实验显示在MAB和TALES环境中性能显著提升。

Comments 17 pages, 6 Figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17468 2026-08-13 cs.LG cs.AI 版本更新 62%

Deep Activity Model: A Generative Approach for Human Mobility Pattern Synthesis

深度活动模型:一种用于人类移动模式合成的生成式方法

Xishun Liao, Qinhua Jiang, Brian Yueshuai He, Yifan Liu, Chenchen Kuai, Jiaqi Ma

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有人类移动模型的局限,提出生成式Transformer模型,结合社会人口统计与家庭属性合成活动链,经数据训练微调后,在多区域模拟中表现良好,为城市规划提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10692 2026-08-12 cs.CL cs.AI 新提交 62%

SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information

SPIEval:评估大型语言模型作为处理分散个人信息的移动助手的能力

Junjie Ye, Zhuohui Sheng, Shaofan Liu, Yulun Zhu, Wenjie Fu, Dingwei Zhu, Ming Zhang, Yujiong Shen, Weichao Wang, Xin Zhao, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang, Pluto Zhou

机构 * Fudan University(复旦大学) Tencent Hunyuan Team(腾讯混元团队)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出基于五种认知能力的人工策划基准SPIEval,评估9种LLMs作为移动助手处理分散个人信息的能力,发现其准确率最高仅57.3%,存在信息定位等显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10337 2026-08-12 cs.HC cs.AI cs.CL 新提交 62%

Narrative Keyframing for Generative Creative Writing

用于生成式创意写作的叙事关键帧技术

Chao Zhang, Abe Davis

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出叙事关键帧技术,作为AI辅助创意写作的交互方法,通过三种关键帧类型实现对生成文本的精细控制,经用户研究验证其可控性、透明性与趣味性更优。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24188 2026-08-12 cs.CL cs.LG 版本更新 62%

MT-PingEval: Evaluating Multi-Turn Collaboration with Private Information Games

MT-PingEval:通过私人信息游戏评估多轮协作

Jacob Eisenstein, Fantine Huot, Adam Fisch, Jonathan Berant, Mirella Lapata

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 MT-PingEval通过私人信息游戏评估语言模型在多轮协作中的表现,发现其在规划和执行多轮对话方面存在显著缺陷,并强调了提高对话连贯性和信息管理的重要性。

Comments CoLM camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09019 2026-08-11 cs.HC cs.AI cs.CL cs.CY cs.SI 新提交 62%

How People Evaluate AI-, Expert-, and Peer-Style Financial Advice

人们如何评估AI风格、专家风格和同行风格的金融建议

Aryan Ramchandra Kapadia, Eshwar Chandrasekharan, Koustuv Saha

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过实验对比AI、专家、同行风格金融建议的评估差异,发现归属标注与沟通线索共同影响评估,错误标注会提升AI建议评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08878 2026-08-11 cs.LG cs.AI cs.PF 新提交 62%

DistillCache: KL-Guided Adaptive KV-Cache Eviction for Memory-Efficient LLM Inference

DistillCache:基于KL引导的自适应KV缓存驱逐的内存高效大语言模型推理

Asaad Althoubi

机构 * Oklahoma State University(俄克拉荷马州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DistillCache是一种强化学习框架,将KV缓存驱逐建模为序列决策问题,在25%缓存预算下,在LongBench上保留全缓存94.2%的准确率,优于多种基线方法,可提升推理吞吐量。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏