arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-24 至 2026-08-24 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 26 篇

2608.20359 2026-08-24 cs.CL 新提交 92%

Self-Speculation for Faster Reasoning Models

用于更快推理模型的自推测技术

Ravisri Valluri, Tung Nguyen, Aditya Grover

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);planning(abstract)

AI总结 该研究针对LLM推理延迟问题,提出无需训练的SSR自推测解码方法,结合思维链与后缀解码,在Qwen3.5、Gemma-4等模型上实现总生成延迟最高24.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20670 2026-08-24 cs.AI cs.CL 新提交 84%

Why2Speak: Faithful Reasoning for Abstaining Action Policies

Why2Speak:弃权(不执行)策略的忠实推理

Shreya Mendi, Brinnae Bent

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对智能体需在行动与弃权间选择的问题,以多方对话干预为场景,对比多种策略,发现能力与可审计性的权衡,分析现有方法缺陷并提供监督评估的控制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21180 2026-08-24 eess.IV cs.CV 新提交 82%

Toward Vision Language Model-based Assessment of Clinical Quality and Usability of LGE-MR Images for Cardiac Ablation Planning

面向基于视觉语言模型的LGE-MR图像临床质量与可用性评估以用于心脏消融规划

Bipasha Kundu, Abhishek Chaturvedi, Axel W. E. Wismueller, Richard Simon, Cristian A. Linte

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本研究提出两阶段VLM框架用于左心房LGE-MRI的临床导向图像质量评估,在60个图像切片-文本对数据集上,InternVL2的标准级准确率最高,DeepSeek实现完美临床可用性一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21186 2026-08-24 cs.LG 新提交 79%

A Neurosymbolic Approach for Constructing Planning Domain Models from Clinical Narratives

一种从临床叙事构建规划领域模型的神经符号方法

Ranveer Singh, Saurabh Mathur, Michael Skinner, Prasad Tadepalli, Kristian Kersting, Sriraam Natarajan

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 针对临床叙事难以构建外科手术概率规划模型的问题,提出神经符号框架NSPIN,结合预训练LLM从2660份阑尾切除术记录生成的模型可泛化且符合临床实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21157 2026-08-24 cs.DC cs.AI 新提交 79%

HIERA: Workload-Aware Planning Across Implementation Spaces for GPU Kernel Optimization

HIERA:面向GPU内核优化的跨实现空间工作负载感知规划

Jinghao Wang, Qiqi Gu, Chenpeng Wu, Jianguo Yao, Haibing Guan, Xijun Li

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 HIERA是一种跨实现空间的GPU内核优化分层规划框架,在KernelBench实验中优于无训练方法,还在科学计算模板算子上实现1.53倍加速,无需额外训练即可接近CUDA-L1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20564 2026-08-24 cs.AI 新提交 79%

Consilience: Conformally Calibrated Communication Control for Hidden-Profile Multi-Agent Reasoning

Consilience:用于隐式多智能体推理的保形校准通信控制

Abhijith Babu, Ramneet Kaur, Vishal Pramanik, Olivera Kotevska, Nathaniel D. Bastian, Susmit Jha, Sunny Raj, Yanzhao Wu, Sumit Kumar Jha, Anirban Roy

机构 * Knight Foundation School of Computing and Information Sciences, Florida International University(佛罗里达国际大学奈特基金会计算与信息科学学院) SRI International(SRI国际公司) University of Florida(佛罗里达大学) Oak Ridge National Laboratory(橡树岭国家实验室) Army Cyber Institute, United States Military Academy(美国军事学院陆军网络研究所) Oakland University(奥克兰大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Consilience框架,通过轮次保形校准程序保证多智能体通信控制的可靠性,在HiddenBench任务上提升了决策准确性与通信效率,优于现有协议甚至全信息基线。

Comments 39 pages, 2 figures, 9 tables. Includes appendix with full proof of Proposition 1, expanded results, ablations, and complete prompt templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20405 2026-08-24 cs.CL 新提交 79%

ARGUS: Theory-of-Mind Guided Argument Generation with Strategy-Aware Planning and Knowledge Grounding

ARGUS:基于心理理论(Theory-of-Mind)的论证生成,结合策略感知规划与知识接地

Zhe Hu

机构 * InspireOmni AI The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL

AI总结 该研究提出基于智能体的Argus框架,结合心理理论推理、策略感知规划等,在三个基准上优于基线,可有效改变抗拒受众立场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11821 2026-08-24 cs.LG 版本更新 79%

Reinforcing Multi-Turn Reasoning in LLM Agents via Fine-Grained Reward Structure and Credit Assignment

通过细粒度奖励结构与信用分配增强大语言模型智能体的多轮推理能力

Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Texas A&M University(德克萨斯A&M大学) Prime Intellect Morgan Stanley(摩根大通)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文针对LLM智能体多轮推理的信用分配问题,提出适配三类奖励结构的GRPO与PPO算法,实验证实密集每轮奖励结构优于稀疏奖励,PPO在搜索任务上表现最优。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14313 2026-08-24 cs.LG cs.AI 版本更新 73%

AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning

你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成

Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

机构 * Rutgers University(新泽西州立大学) Nanyang Technological University(南洋理工大学) University of Connecticut(康涅狄格大学) Fudan University(复旦大学) NVIDIA Research(NVIDIA研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20631 2026-08-24 cs.AI 新提交 70%

Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents

加权记忆树:为长视野大语言模型智能体记住重要信息

Quang Dao, Purvi Kathalkar, Kenneth Eaton

机构 * Rose-Hulman Institute of Technology(罗斯-霍曼理工学院) Georgia Institute of Technology(佐治亚理工学院) Georgia Tech Research Institute(佐治亚理工学院研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出加权记忆树(WMT)分层记忆系统,在GAIA-Text数据集上使LLM智能体准确率平均提升9.97个百分点、令牌用量减32.8%,可抑制低效用内容与不可靠信息传播。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20379 2026-08-24 cs.AI 新提交 70%

A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications

多模态智能体框架的基础与前沿:技术及应用综述

Neel Mokaria, Rishie Raj, Dheeraj Baiju, Xiaoqian Shen, Shraman Pramanick, Kevin Qinghong Lin, Arda Senocak, Mike Zheng Shou, Philip Torr, Mohamed Elhoseiny, Yapeng Tian, Ruohan Gao, Salman Khan, Sayan Nag, Sanjoy Chowdhury, Dinesh Manocha

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本综述针对多模态在智能体框架核心模块的作用展开系统分析,梳理了其架构整合方式、应用领域及效率权衡,为通用智能系统研究指明方向。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13988 2026-08-24 cs.AI 版本更新 70%

Recognizing Artificial Minds: A Philosophical Defense of AI Cognition

识别人工心智:对AI认知的哲学辩护

Herman Cappelen, Josh Dever

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究为“全猪论题”辩护,主张LLMs是具备认知状态的成熟智能体,反驳相关质疑并推测其可能拥有人类概念体系外的内容。

Comments Pre-publication draft. Forthcoming as Open Access from Oxford University Press. Please cite the OUP version when available. Note title change: previously, "Going Whole Hog: A Philosophical Defence of AI Cognition"

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20953 2026-08-24 cs.CL cs.AI cs.LG cs.PF 新提交 67%

Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs

量化感知修复:恢复压缩4位大语言模型的实用方案

Bakbergen Ryskulov, Iker García-Ferrero, David Montero, David Jansen, Ali Hashemi, Jezabel R. Garcia, Antonio Tiene, Román Orús

机构 * Multiverse Computing(多元宇宙计算公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对压缩4位大模型部署时性能下降问题,提出量化感知修复方案,直接从原始未压缩模型蒸馏4位学生模型,在多基准测试中表现优于量化感知训练,且部署便捷。

Comments Patent Application Number: 26382838.6 / P202602102EP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20661 2026-08-24 cs.AI cs.CE cs.CL cs.IR 新提交 62%

Auditable by Construction: An Ontology-Driven Framework for Trustworthy LLM Analytics in Enterprise Finance

可审计性原生:面向企业金融领域可信大语言模型分析的本体驱动框架

Sergiy Lunyakin

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对企业金融大语言模型应用的信任问题,提出知识驱动分析框架KDAF,结合本体与CARP技术,在FinanceBench评估中,其可审计性优于基线方法,表明可审计性是该框架的核心优势。

Comments 20 pages, 1 figure, 4 tables, 1 algorithm. Artifact deposit with configurations, ontology schema, prompts, audit reports and reconstruction scripts: this https URL (https://doi.org/10.5281/zenodo.22022068)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20392 2026-08-24 cs.CL cs.AI 新提交 62%

Evaluation-as-Search: Adaptive Discovery of Grounding Failures in Meeting Assistants

评估即搜索:会议助手接地故障的自适应发现

Sami Khairy, Yasaman Hosseinkashi, Vishak Gopal, Ross Cutler

机构 * Microsoft(微软公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EaS方法构建MeetingProbe基准,发现会议助手故障多源于话语语用挑战,其自适应搜索比随机探测的故障发现率高2.5倍,且公开了该基准以支持可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20830 2026-08-24 cs.CY cs.LG 新提交 61%

Fine-tuning LLMs for Tourist Trajectory Prediction using Field Experiment Data

利用实地实验数据微调大型语言模型(LLMs)进行游客轨迹预测

Tatsuya Amano, Hirozumi Yamaguchi

专题命中 规划推理 :reasoning(abstract);分类 cs.LG;planning(comments)

AI总结 该研究利用日本和歌山城公园的566条轨迹微调Llama-3.1-8B,实现49.1%的下一个兴趣点准确率,在样本不足场景泛化性强,为旅游轨迹预测提供了高保真行为模型及反事实分析基础。

Comments 5 pages, 4 figures. Accepted at the 2nd Workshop on AI for Urban Planning (AI4UP) at AAAI-26, Singapore, January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21027 2026-08-24 cs.AI 新提交 57%

Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents

无需解决,仅需比较:用于LLM智能体运行时干预的微型顾问

Yanze Jiang, Mingxuan Li, Yuhao Wang, Shengfang Zhai, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体运行时干预需求,提出仅比较框架COTA,经多任务多执行器评估,其性能优于基线,可在辅助模型能力弱于执行器时实现有效干预。

Comments 21 pages, 1 figure, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20966 2026-08-24 cs.CR cs.AI 新提交 57%

Structured but Fragile: On the Limits of LLMs in Cybersecurity Decision-Making

结构化但脆弱:大型语言模型(LLMs)在网络安全决策中的局限性

Pasquale Malacaria, Yunxiao Zhang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究探讨LLMs在网络安全决策中的表现,发现其在明确攻击图结构时能产生接近优化基线的策略,但随复杂度增加而脆弱,对提示敏感,且无法稳健应用结构化推理,为AI辅助安全决策系统设计评估提供参考。

Comments 31 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20845 2026-08-24 cs.AI cs.DB cs.IR 新提交 57%

RAG Deserves an Index: Why Ingest-Time Compilation Beats Query-Time Interpretation

检索增强生成(RAG)值得一个索引:为什么摄入时编译优于查询时解释

Kyle Wild, Yusuke Takahashi, Asako Uraki

机构 * Endgame Labs, Inc.(终局实验室公司) Asia AI Institute(亚洲人工智能研究院) Musashino University(武藏野大学) Faculty of Data Science, Musashino University(武藏野大学数据科学学院) AIx, Inc.(AIx公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出摄入时语义编译(ISC)范式,将语料编译为可查询数据库对象,实验显示其检索效果优于传统RAG方法,增量更新成本更低,为RAG提供了索引化解决方案。

Comments Position paper. 6 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20771 2026-08-24 cs.AI 新提交 57%

CAS: Conformalized Agentic Search via Adaptive Retrieval and Policy Weighting

CAS:通过自适应检索与策略加权实现的保形智能体搜索

Zixi Zhu, Jiayuan Su, Jian Zhang, Yu Lin, Hongwei Wang

机构 * Zhejiang University(浙江大学) ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC学院) Tencent Inc.(腾讯公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对搜索智能体RL微调的可靠性问题,提出CAS框架,通过自适应检索与策略加权结合CP技术,提升推理准确率并减少冗余搜索,构建高可靠高效智能体范式。

Comments 21 pages, including figures, tables, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20481 2026-08-24 cs.CR cs.AI 新提交 57%

AEGIS: Preventing Cross-Domain Resource Abuse in MCP

AEGIS:防止MCP中的跨域资源滥用

Shriti Priya, Teryl Taylor, Frederico Araujo

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AEGIS,该组件借助LLM将MCP工具调用归一化为统一表示,结合Open Policy Agent与ContextForge AI Gateway,可防止跨异构MCP工具和模态的资源滥用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11354 2026-08-24 cs.AI 版本更新 57%

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面

Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

机构 * JPMorganChase(摩根大通)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。

Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07107 2026-08-24 cs.AI 版本更新 57%

MemWM: Memory-Augmented Text-Based World Model

MemWM:记忆增强的基于文本的世界模型

Yujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye, Boliang Liu, Sikuan Yan, Shuning Wang, Xuebing Zhou, Sören Pirk, Hinrich Schütze, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Huawei Heisenberg Research Center(华为海森堡研究中心) Zhejiang University(浙江大学) Technical University of Munich (TUM)(慕尼黑工业大学) TU Berlin(柏林工业大学) Kiel University(基尔大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出记忆增强的基于文本的世界模型MemWM,通过引入世界记忆解决世界模型的系统性预测错误,在ALFWorld等基准上提升智能体规划成功率与效率。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20541 2026-08-24 stat.OT 新提交 50%

Statistics in the Age of AI

AI时代的统计学

Juan Sosa, Brenda Betancourt

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究探讨AI时代统计学的核心逻辑,提出需通过统计依据关联数据与主张,明确统计学家的核心角色是构建、评判及维护统计依据,为AI与统计结合提供理论框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20709 2026-08-24 math.OC 新提交 50%

ResiliFlow: An Open Transport World Model for Infrastructure Perception and Disaster Resilience

ResiliFlow:面向基础设施感知与灾害韧性的开放交通世界模型

Junxiang Xu, Vinayak Dixit, S. Travis Waller, Divya Jayakumar Nair, Qianwen (Vivian)Guo, Sisi Jian, Xiao Wen, Ashutosh Ashutosh, Sunhyung Yoo, Julius Secadiningrat, Jingni Guo

专题命中 规划推理 :planning(abstract)

AI总结 ResiliFlow是面向基础设施感知与灾害韧性的开放交通世界模型平台,整合两类工作空间功能,实现交通模型的可检查复用,支撑研究协作与公众监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12536 2026-08-24 cs.DB cs.DS cs.IR 版本更新 50%

jXBW: A Compressed Index Enabling Structure-Aware JSONL Retrieval for Structured RAG

jXBW: 面向结构化RAG中结构感知JSONL检索的压缩索引

Yasuo Tabei

专题命中 规划推理 :reasoning(abstract)

AI总结 提出jXBW压缩索引,通过合并树表示、基于扩展Burrows-Wheeler变换的简洁树索引和三阶段子结构搜索算法,实现查询依赖的复杂度,在百万级JSONL数据集上比最强基线快16倍至2800倍。

详情

展开后加载摘要…

URL PDF HTML 收藏