arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11120 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11120 篇

2608.07107 2026-08-24 cs.AI 版本更新 57%

MemWM: Memory-Augmented Text-Based World Model

MemWM:记忆增强的基于文本的世界模型

Yujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye, Boliang Liu, Sikuan Yan, Shuning Wang, Xuebing Zhou, Sören Pirk, Hinrich Schütze, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Huawei Heisenberg Research Center(华为海森堡研究中心) Zhejiang University(浙江大学) Technical University of Munich (TUM)(慕尼黑工业大学) TU Berlin(柏林工业大学) Kiel University(基尔大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出记忆增强的基于文本的世界模型MemWM,通过引入世界记忆解决世界模型的系统性预测错误,在ALFWorld等基准上提升智能体规划成功率与效率。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17276 2026-08-24 cs.RO cs.AI cs.CV 57%

Leveraging CVAE for Joint Configuration Estimation of Multifingered Grippers from Point Cloud Data

利用CVAE从点云数据联合估计多指抓取器的关节配置

Julien Merand, Boris Meden, Mathieu Grossard

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,法国国家科学研究中心,List)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出利用CVAE从点云数据联合估计多指抓取器关节配置,通过机器学习提高效率和准确性。

Journal ref 2025 IEEE 21st International Conference on Automation Science and Engineering (CASE), Los Angeles, CA, USA, 2025, pp. 895-900

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20026 2026-08-21 cs.CV cs.LG 新提交 57%

From Street View Imagery to Street Quality Indicators: Vision Language Inference for the Suburban 15-minute City

从街景图像到街道质量指标:面向郊区15分钟城市的视觉语言推理

Joan Perez, Giovanni Fusco

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文以法国尼斯东北部郊区为研究对象,采用开源的SAGAI工作流,利用视觉语言模型从街景图像评估街景质量,发现理想街景仅存在于部分郊区区域,证明了VLM可支持郊区城市诊断,助力循证规划。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19854 2026-08-21 cs.SE cs.AI 新提交 57%

Repo0: Design-Driven Zero-to-All Code Generation

Repo0:面向从零到全代码生成的设计驱动框架

Silin Chen, Haoyi Teng, Xiaodong Gu, Yuling Shi, Jiale Huang, Yongpan Wang, Hongyu Zhang, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Chongqing University(重庆大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 Repo0是面向从零到全代码生成的连续结构演化框架,通过Dual-DAG架构等技术,在RepoCraft数据集上相较RPG大幅提升了代码生成的功能覆盖率与通过率。

Comments Our code and data are available at https://github.com/cslsolow/Repo0

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14398 2026-08-21 cs.AI 版本更新 57%

ChronoAgentic: A Code-based Multi-Agent World Simulator for Physically Grounded Simulation Construction

编码智能体作为世界模拟器

Hongyu Wang, Jingquan Wang, Ashvin Anilkumar, Bocheng Zou, Radu Serban, Dan Negrut

机构 * Department of Mechanical & Aerospace Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校机械与航空航天工程系) School of Computer, Data, and Information Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机、数据与信息科学学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出一个通过可执行模拟代码构建基于物理的世界模型的智能体框架,协调规划、代码生成、视觉审查和物理分析智能体,迭代修正代码以满足物理约束,在物理准确性、指令忠实度和视觉质量上超越视频模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18731 2026-08-20 cs.CV cs.AI 新提交 57%

A Few Cases Are All You Need: An Empirical Study of Annotation-Efficient LoRA Fine-Tuning of MedSAM3

少数案例足矣:对MedSAM3的标注高效LoRA微调的实证研究

Sachin Dudda Nagaraju, Bendik Skarre Abrahamsen, Ashkan Moradi, Mattijs Elschot

机构 * Norwegian University of Science and Technology(挪威科技大学) St. Olavs Hospital, Trondheim University Hospital(圣奥拉夫斯医院(特隆赫姆大学医院))

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对MedSAM3,用LoRA微调实现仅10个标注案例即可让医学图像分割达到临床可用性能,在腹部器官和心脏分割任务上优于部分专业工具,且训练速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18682 2026-08-20 cs.AI 新提交 57%

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

RTPO:用于稳定智能体强化学习训练的反向回合策略优化

Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

机构 * Adelaide University(阿德莱德大学) The University of Sydney(悉尼大学) Curtin University(科廷大学) School of CSIT(计算机科学与信息技术学院) ACFR(澳大利亚空间研究中心) School of EECMS(电子工程、计算机与数学科学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18613 2026-08-20 cs.AI cs.CR 新提交 57%

CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence

CTIFoundry:用于网络威胁情报的智能体原生语料库支架

Yutong Cheng, Changze Li, Qian Cui, Wei Ding, Lingzhi Wang, Yan Chen, Peng Gao

机构 * Virginia Tech(弗吉尼亚理工大学) Amazon(亚马逊公司) Northwestern University(西北大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 CTIFoundry是用于网络威胁情报的智能体原生语料库支架,在CTIConnect基准测试中可使智能体F1提升0.19至0.28,小型模型在其上表现优于旗舰模型,且无需增加搜索工作量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18282 2026-08-20 math.OC cs.LG cs.SY eess.SY 新提交 57%

Self-supervised In-context Operator Learning for Stochastic Mean-Field Control

面向随机平均场控制的自监督上下文算子学习

Suyi Gao, Mo Zhou, Rongjie Lai

机构 * Purdue University(普渡大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本研究提出首个无网格自监督神经算子NFIST,通过结合概率流ODE与可逆归一化流Transformer解决随机平均场控制问题,可实现未见任务的一次前向求解,在多任务上展现零样本泛化并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17574 2026-08-20 cs.AI cs.SY eess.SY 交叉投稿 57%

Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making

演化不确定性下的风险量化:面向安全序贯决策的信念依赖鲁棒性

Deep Kumar Ganguly, Jan Kretinsky

机构 * Technical University of Munich(慕尼黑工业大学) Masaryk University(马萨里克大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出RATTL算法,将智能体谨慎程度与认知不确定性绑定,证明其规划问题适定且满足安全三明治性质,可保障LLM等智能体在不确定性下的运行时安全。

Comments Accepted for presentation at the IJCAI-ECAI 2026 RobustifAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16806 2026-08-20 cs.RO cs.AI 版本更新 57%

Breaking Planner Integrity Boundary: Enviroment State-Text Injection Attack on LLM-Driven Embodied Agents

当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

机构 * Wuhan University(武汉大学) University at Buffalo(布法罗大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。

Comments submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01324 2026-08-20 cs.AI 版本更新 57%

G-ReAct: Graph-Guided Deep Search via Structure-State Co-Evolution

G-ReAct:基于结构-状态协同演化的图引导深度搜索

Shaoxiong Yang, Mengyuan Zhang, Shaojun Lin, Chao Li, Wei Liu, Kun Shao, Jian Luan

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出图引导深度搜索框架G-ReAct,通过结构-状态协同演化解决现有LLM深度搜索的上下文遗忘等问题,仅用少量轨迹微调即提升模型在BrowseComp-ZH、XBench上的准确率,且推理时可增强现有LLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17834 2026-08-19 cs.HC cs.AI 新提交 57%

AdaLens: Interactive Storyline for Monitoring and Steering Long-Running Agentic Data Analysis

AdaLens:用于监控和引导长时间运行的智能体数据分析的交互式故事情节

Yangtian Liu, Yan Miao, Shuhan Liu, Yunfan Zhou, Dae Hyun Kim, Di Weng, Yingcai Wu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Yonsei University(延世大学) School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对长时间智能体数据分析的传统界面无法满足可观测性与可引导性需求,本文提出交互式系统AdaLens,结合故事情节表示与引导交互,经案例及用户研究验证其能有效支持分析师监控与引导此类分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17184 2026-08-19 cs.CL 新提交 57%

AISA: AI Safety Assistant Framework for Continuous Improvement of Highway Construction

AISA:用于公路施工持续改进的AI安全助手框架

Mason Smetana, Trevor Neece, Lev Khazanovich

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本研究提出AISA框架,基于LLM和文本嵌入模型实现公路施工事故分类、质量评分及相关数据检索,为未来智能体应用提供基础,在OIICS分类和事故检索等任务上取得优于随机水平的效果。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21802 2026-08-19 cs.CL 版本更新 57%

When to Plan, When to Polish: Noise Level as a Granularity Axis for Diffusion Language Models

何时规划,何时精炼:噪声水平作为扩散语言模型的粒度轴

Peihong Li, Yuanjie Shi, Yan Yan

机构 * Washington State University(华盛顿州立大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 提出噪声依赖粒度控制(NDGC)方法,通过噪声水平调节训练和推理的粒度,实现从粗到细的去噪,无需显式规划器或层次结构,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00417 2026-08-19 cs.NI cs.AI 57%

AgentxGCore: Agentic AI for Next-Generation Mobile Core Network

AgentxGCore:面向下一代移动核心网络的智能体AI

Maria Katarine Santana Barbosa, Kelvin L. Dias

机构 * Centro de Informática - Universidade Federal de Pernambuco(计算机中心 - 佩鲁巴科联邦大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AgentxGCore,通过智能体AI原生层扩展3GPP架构,利用多智能体系统实现基于实时信息的闭环优化,支持自组织和自适应。

Comments This paper has been accepted for publication in IEEE Network

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31156 2026-08-19 cs.LG 版本更新 57%

TabCausal: Pretraining Across Causal Environments for Tabular Causal Discovery

TabCausal: 跨因果环境的表格因果发现预训练

Zi-Rong Li, Si-Yang Liu, Tian-Zuo Wang, Han-Jia Ye

机构 * Nanjing University(南京大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出TabCausal,一种通过动态任务构建策略在多样化因果环境中进行大规模预训练的因果发现基础模型,在合成和语义基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01839 2026-08-19 cs.SE cs.AI 57%

The Machine Learning Canvas: Empirical Findings on Why Strategy Matters More Than AI Code Generation

机器学习画布:关于为何策略比AI代码生成更重要的实证发现

Martin Prause

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究通过实证分析揭示了机器学习项目成功的关键因素,强调策略比AI代码生成更重要,提出了机器学习画布框架,指出组织支持、策略规划、流程管理和生态系统是决定项目成败的核心要素。

Comments Dataset available: https://ieee-dataport.org/documents/machine-learning-canvas-success-determinants

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08748 2026-08-19 cs.RO cs.AI 版本更新 57%

Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT

面向机器人操作的视觉提示:采用带标注引导的拾取与放置方法,基于ACT算法

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

机构 * Embodied AI Research Team(具身人工智能研究团队) National Institute of AIST(国家信息与系统技术研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 针对便利店机器人拾取放置任务的挑战,提出带标注引导视觉提示的感知-行动流水线,采用ACT算法实现自适应操作,提升了零售环境下的抓取精度与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15455 2026-08-19 math.NA cs.AI cs.NA math.AP 版本更新 57%

Solving nonconvex Hamilton--Jacobi--Isaacs equations with PINN-based policy iteration

用基于PINN的策略迭代求解非凸哈密顿-雅可比-艾萨克斯方程

Hee Jun Yang, Minjung Gim, Yeoneung Kim

机构 * National Institute for Mathematical Sciences(数学科学研究院) Department of Applied Artificial Intelligence(应用人工智能系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出结合PINN与策略迭代的无网格框架,可求解高维非凸HJI方程,在两类数值实验中表现优于直接PINN求解器,具理论依据与应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16710 2026-08-18 cs.LG 新提交 57%

The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback

伦理决策头:基于人类反馈的强化学习在自动驾驶中实现规范伦理

Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi

机构 * Stony Brook University(石溪大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出伦理决策头(EDH)框架,结合PPO与人类偏好奖励模型,在CARLA仿真中训练自动驾驶智能体,发现人类对自动驾驶伦理的理论规定与实践奖励存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16370 2026-08-18 cs.AI 新提交 57%

What Does Context Compression Cost an Agent? Interaction Costs Unrevealed by Task-Completion Metrics

上下文压缩会给智能体带来什么代价?任务完成指标未揭示的交互代价

Shuyu Liu

机构 * Chongqing University of Science and Technology(重庆科技学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对使用工具的智能体,发现上下文压缩会带来任务完成指标未揭示的隐藏交互成本,检索调用增加是其主要来源,且该特征具有环境依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15909 2026-08-18 cs.IR cs.CL 新提交 57%

Large language model-assisted discovery of cohorts from scientific literature

大语言模型辅助的科学文献队列发现

Moritz Sturm, Lisa M. Berg, Inken Berg, Harishny Sarma, Jasmin Hartmann, Denissa Girschik, Gemma Roig, Christine M. Freitag, Andreas G. Chiocchetti

机构 * University Hospital Frankfurt, Goethe University Frankfurt(法兰克福大学医院,法兰克福大学) Goethe University Frankfurt(法兰克福大学) The Hessian Center for Artificial Intelligence (hessian.AI)(黑森人工智能中心)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 该研究开发了问题驱动框架,通过PubMed API检索文献,用大语言模型提取队列名称,在青少年攻击行为遗传学用例中,补充了队列目录未覆盖的17个合格队列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15687 2026-08-18 cs.AI 新提交 57%

THESIS-MoE: Trainable Hierarchical Extraction and SteerIng of Sycophancy in Mixture-of-Experts

THESIS-MoE:可训练的分层提取与混合专家模型中谄媚行为的引导

Kareem Hassani, Chaymaa Abbas, Lama Mawlawi, Mariette Awad

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出THESIS-MoE,通过共享对比信号定位MoE模型中谄媚行为的计算子电路,采用有条件干预方法,在保留知识的同时消除了高达90%的信念诱导谄媚行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15082 2026-08-18 cs.AI 新提交 57%

Beyond Thresholds: A Quality-Aware Decision Intelligence Framework for Cold Chain IoT Systems

Aashna Sofat, Balwinder Sodhi

机构 * IIT Ropar(印度理工学院罗帕尔分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15016 2026-08-18 cs.CR cs.AI 新提交 57%

Hierarchical Agentic Incident Response with Digital-Twin-Validated Attack Inference

结合数字孪生验证攻击推理的分层智能体事件响应

Yiran Gao, Juntao Chen, Tao Li

机构 * City University of Hong Kong(香港城市大学) Fordham University(福特汉姆大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对网络事件响应效率低的问题,提出整合LLM攻击推理、滚动规划与数字孪生验证的分层智能体响应框架,在33组件企业网络测试台的多阶段攻击场景中,其恢复成功率较前沿LLM基线提升18%-31%。

Comments 2026 IEEE Conference on Communications and Network Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14950 2026-08-18 cs.CL 新提交 57%

DA-RAC: Distance-Aware Calibration of LLM Judges for Trustworthy AI Auditing

DA-RAC:面向可信AI审计的大语言模型评判器的距离感知校准

Cheng Wu, Vishal Anand, Jaya Krishna Mandivarapu, Xiya Liu, Rui Zhuang

机构 * Microsoft(微软公司)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 针对LLM评判器因无关参考示例导致的校准偏差问题,提出DA-RAC距离感知参考锚定校准方法,在多轮评估基准上提升了校准效果并降低了误通过风险,为可信AI审计提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14765 2026-08-18 cs.AI cs.DB 新提交 57%

Agentic Data Cleaning Without a Clean Reference: An Experimental Study of Capabilities and Trade-offs

无干净参考的智能体数据清洗:能力与权衡的实验研究

Hadi Fadlallah

机构 * Faculty of Arts and Sciences(文理学院) University of Sciences and Arts in Lebanon(黎巴嫩科学与艺术大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出整合多组件的基于证据的无参考智能体数据清洗框架,经多数据集实验发现,额外能力会在多指标间引入权衡,无配置在所有标准上最优。

Comments 21 pages, 3 figures, Submitted to New Generation Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14655 2026-08-18 cs.LG cs.CV 新提交 57%

Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation

通过模态子空间激活诊断并缓解全模态大语言模型(Omni-LLMs)中的感知-决策失配问题

Hongbo Jiang, Jie Li, Yunhang Shen, Tianyu Xie, Pingyang Dai

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 针对Omni-LLMs存在的感知-决策失配问题,本文提出因果模态敏感性及对应诊断方法,构建CausalMSBench数据集,提出无需训练的MSA框架以恢复模型的因果模态敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14631 2026-08-18 cs.AI 新提交 57%

Accuracy and Reliability of Large Language Models in Cosmetic Chemistry and Skin Health: A Benchmarking Study

大型语言模型在化妆品化学与皮肤健康领域的准确性与可靠性:一项基准测试研究

Amelia Liu

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究测试14个LLMs在化妆品化学与皮肤健康领域的表现,发现其总体准确性差、技术深度不足,无法可靠提供相关信息,需微调验证数据集并改进算法推理。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏