arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-25 至 2026-08-25 共收录 243 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 52 篇

2608.23035 2026-08-25 cs.AI 新提交 57%

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试

Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi

机构 * Alibaba(阿里巴巴)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出 MobilePA-Bench 基准,针对现有移动智能体评估基准的盲区,从多维度测试移动规划智能体,发现前沿 LLM 在移动场景中存在可靠性问题,该基准可用于诊断与加速可靠移动智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23029 2026-08-25 cs.CL 新提交 57%

Meta-Moderator: Empowering Multi-Agent Debate with Meta-Cognition

元审核员:用元认知赋能多智能体辩论

Wentao Hu, Zhuoyue Wan, Jinhao Shen, Chen Jason Zhang, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出Meta-Moderator可学习框架,将多智能体辩论的审核视为元认知过程,经结果驱动策略优化训练,在五个基准测试中性能优于现有决策层,能动态调控辩论并减少错误聚合。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22974 2026-08-25 cs.AI 新提交 57%

Toward Effective and Reliable LLM Agents via Dynamic Ontology

基于动态本体的有效可靠大语言模型智能体研究

Xiaohui Zhang, Zequn Sun, Chengyuan Yang, Yuanning Cui, Lingbing Guo, Wei Hu

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OaK框架,通过动态构建优化面向任务的本体论,在TravelPlanner等数据集上验证其可提升LLM智能体的证据基础与多步推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22899 2026-08-25 cs.AI 新提交 57%

CDEG: Learning Decision-Critical Evidence for Long-Horizon Diagnostic Agents

CDEG:为长程诊断智能体学习决策关键证据

Xiwei Dai, Zijie Meng, Zhiting Fan, Yixuan Tang, Ziru Niu, Zuozhu Liu

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于图的框架CDEG,通过对比同一病例的成功与失败轨迹、受控反事实干预等学习决策关键证据,在多基准测试中使长程诊断智能体准确率最高提升11.5%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22657 2026-08-25 cs.RO cs.AI cs.MA 新提交 57%

Physical Agentic AI: An Architecture for Orchestrating a Robot Crew with LLMs

物理智能体AI:一种用于协调机器人团队与大语言模型的架构

Xinyuan Liu, Eren Sadikoglu, Riana Chatterjee, Ransalu Senanayake

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出Physical Agentic AI框架,通过语义规划与执行间的显式架构接口协调机器人团队,在两类任务中验证其可提升技能落地率、减少故障动作,为物理机器人团队提供可靠协调方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22631 2026-08-25 cs.LG 新提交 57%

Learning Generalizable Behaviors for Terminal Agents

学习终端智能体的可泛化行为

Yihang Yao, Bo Pang, Xuan Phi Nguyen, Ding Zhao, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :verifier(abstract);分类 cs.LG

AI总结 本研究针对终端智能体泛化问题,提出智能体组合泛化假设,开发训练方案River,其用不足30%的TMax环境使多规模模型在两个基准上RL增益平均提升超100%,且性能优于开源8B模型、可跨多维度泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22444 2026-08-25 cs.CL 新提交 57%

Aligned Alone, Misaligned Together: Forecasting Adversarial Capture in LLM Agent Populations

单独对齐,共同错位:预测大语言模型智能体群体中的对抗捕获

Isotta Magistrali, Chen Shani

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对LLM智能体群体,提出从群体无攻击时的良性运行状态校准响应函数,可提前预测坚定少数群体引发的对抗捕获,且捕获为临时状态,孤立对齐不等同于群体对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22421 2026-08-25 cs.AI 新提交 57%

Where World Models Break: Natural-Input Failure Discovery

世界模型何时失效:自然输入的故障发现

Zhanpeng Shi, Zi Liang, Rong Feng, Shiqin Tang, Xuyang Chen, Hongzong Li

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) Generative AI Research and Development Center, The Hong Kong University of Science and Technology(香港科技大学生成式人工智能研发中心)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文针对现有世界模型评估忽略灾难性故障风险的问题,提出 BasinLens 方法,可在有限查询预算下发现自然输入引发的可复现、局部持续的世界模型故障,暴露常规基准未覆盖的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22230 2026-08-25 cs.CL 新提交 57%

Whitewashing Hate, Smearing Harmless Content: Annotator-Style Rebuttal Attacks on LLM-Based Moderation

洗白仇恨内容、抹黑无害内容:针对基于大语言模型的内容审核的标注者式反驳攻击

Junyu Lu, Kaiyuan Liu, Jingyi Kang, Deyi Ji, Hailong Zhang, Lanyun Zhu, Qi Zhu, Bo Xu, Liang Yang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Tongji University(同济大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对LLMs内容审核提出标注者式反驳攻击,发现洗白仇恨内容与抹黑无害内容的攻击效果存在模型特异性不对称性,防御措施无法完全消除攻击影响,凸显需定向防御与反馈鲁棒性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22191 2026-08-25 cs.AI cs.SE 新提交 57%

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents

探索时持异议,提交时持共识:面向软件智能体的路由引导测试时缩放

Kang Chen, Junjie Nian, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对软件智能体测试时缩放难题,提出Risa方法,利用MoE路由轨迹引导探索与仲裁,在SWE-bench等基准上提升了仓库级软件工程任务的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21808 2026-08-25 cs.CL 新提交 57%

MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning

MCite-RL:基于引用增强型智能体强化学习的可靠多模态检索增强生成

Suifeng Zhao, Zida Liu, Xinyu Lei, Lei Sun, Jun Gao, Sujian Li

机构 * Peking University(北京大学) Panasonic Connect Co., Ltd.(松下连接株式会社)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 针对现有多模态RAG存在的视觉引用不准或与答案脱节问题,本文提出MCite-RL框架,通过智能体优化模块和引用增强型奖励机制实现引用精度与答案质量的联合优化,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21555 2026-08-25 cs.PL cs.DS cs.LG 新提交 57%

Tensor Seeks Layout: Formalizing Layout Selection for ML Compilers

张量寻求布局:为机器学习编译器形式化布局选择

Clemens Eisenhofer, Yuwen Jia, Daniel Kroening, Sergey Pupyrev

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文首次形式化机器学习编译器的布局选择问题,提出组合优化模型与算法,实现多种现有策略的统一,在AI加速器编译器上的实验验证了其效果,可分离成本模型误差与搜索质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21543 2026-08-25 cs.CV cs.AI 新提交 57%

presto: Efficient, Training-free, and Open-world Object Placement via Imaginary Search

presto:基于想象搜索的高效无训练开放世界物体放置方法

Weixuan Ding, Shang Liu, Hanyu Pei, Zeyan Liu

机构 * Wuhan University(武汉大学) University of Louisville(路易斯维尔大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出零样本无训练框架presto,将开放世界物体放置转化为MLLM引导的启发式搜索任务,经多基准实验及人类研究验证,其在开放世界场景中性能最优,且MLLM作为评判者的变体更具感知一致性。

Comments Accepted to ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20316 2026-08-25 cs.AI 版本更新 57%

Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation

潘多拉的AI模型路由盒:带代价价值估计的高效分配

Adam Fisch, Shubhendu Trivedi, Fantine Huot, William W. Cohen, Michael Kaisers, Mirella Lapata, Kate Larson, Jacob Eisenstein

机构 * Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对异构AI系统的查询路由问题,提出带代价价值估计的Pandora's Router集中式策略及Pandora's Bidder去中心化策略,可在保证路由质量的同时减少高成本估计器的使用,还能在不同场景优化分配效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16447 2026-08-25 cs.AI cs.RO 版本更新 57%

HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents

HaReCAP:面向递归大语言模型智能体的习惯性动作 grounding 方法

Shen Liu, Zhenguo Xu, Shaopu Wang, Yike Gao, Chunlei Wang

机构 * North China Institute of Computer System Engineering(华北计算机系统工程研究所) University of Science and Technology of China(中国科学技术大学) China Information Security Research Institute Co., Ltd.(中国信息安全研究院有限公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 HaReCAP 是针对 ReCAP 的低侵入性扩展,通过编译叶子反射规则减少长视距具身任务中 LLM 的重复调用,在 Robotouille 和 ALFWorld 上显著降低了 token 消耗。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04384 2026-08-25 cs.AI 版本更新 57%

Improving Auto-Design of Neural PDE Solvers with a Domain-Specific Language

用领域特定语言改进神经偏微分方程求解器的自动设计

Shengxin Kong, Liwen Xu, Jingwen Fu

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出ADSL-PDE领域特定语言,通过结构化搜索空间提升神经PDE求解器自动设计的搜索效率与优化稳定性,前十次迭代性能提升超52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20274 2026-08-25 cs.AI 版本更新 57%

Lagrange: An Open-Vocabulary, Energy-Based Sparse Framework for Generalized End-to-End Driving

Lagrange: 一种面向通用端到端驾驶的开放词汇、基于能量的稀疏框架

Shihao Ji, HongXi Li, Zihui Song, Mingyu Li

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Lagrange框架,利用掩码潜在场和视觉语言模型实现开放词汇、稀疏计算,通过拉格朗日动作最小化确保运动学约束,在nuScenes和CODA基准上验证了鲁棒性和可解释性。

Comments Withdrawn due to serious concerns regarding the authenticity and accuracy of the listed authorship. The identity of one or more listed authors cannot presently be verified, and the author list may not represent distinct contributors. The manuscript is withdrawn pending institutional review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00297 2026-08-25 cs.CR cs.LG 版本更新 57%

Trident: Improving Malware Detection with LLMs and Behavioral Features

Trident:利用LLMs和行为特征提升恶意软件检测

Rebecca Saul, Jingzhi Jiang, Elliott Chia, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Trident系统,结合静态特征、行为规则和LLM分析,提升恶意软件检测性能,优于传统方法并具备更强的抗概念漂移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03795 2026-08-25 cs.RO cs.AI 版本更新 57%

MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving

MPCFormer: 一种融合物理信息的数据驱动方法用于可解释的社交感知自主驾驶

Jia Hu, Zhexi Lian, Xuerun Yan, Ruiang Bi, Dou Shen, Yu Ruan, Chunlong Xia, Haoran Wang

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 MPCFormer通过融合物理信息和数据驱动的方法,提升自主驾驶在复杂交通场景中的社交交互能力,实现更安全的人类行为模拟,实验显示其在轨迹预测和碰撞率控制方面表现优异。

Comments 17 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08793 2026-08-25 cs.CL cs.DB 版本更新 57%

LakeHopper: Knowledge-Aware Adaptation of Column Type Annotators across Data Lakes

LakeHopper: 通过模型适应实现跨数据湖列类型注释

Yushi Sun, Xujia Li, Nan Tang, Quanqing Xu, Chuanhui Yang, Lei Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Ant Group(蚂蚁集团) HKUST(GZ)/HKUST(香港科技大学(广州)/香港科技大学)

专题命中 规划推理 :verifier(abstract);分类 cs.CL

AI总结 LakeHopper通过模型适应技术,有效解决跨数据湖列类型注释问题,减少注释需求并提升适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12811 2026-08-25 cs.CL 版本更新 57%

ConvergeWriter: Data-Driven Bottom-Up Article Construction

ConvergeWriter:数据驱动的自下而上文章构建

Binquan Ji, Jiaqi Wang, Ruiting Li, Xingchen Han, Yiyang Qi, Shichao Wang, Yifei Lu, Yuantao Han, Feiliang Ren

机构 * Binquan Ji, Jiaqi Wang, Ruiting Li, Xingchen Han, Yiyang Qi, Shichao Wang, Yifei Lu, Yuantao Han, Feiliang Ren(作者)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 针对现有LLM生成长篇文档的问题,提出自下而上的ConvergeWriter框架,通过检索聚类构建知识基础,减少幻觉,在14B、32B模型上性能优于或比肩基准,适用于高保真知识场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23336 2026-08-25 cs.CV 新提交 50%

Can Coding Agents Build Robust Baselines? A Skill-Based Approach for Automating the Medical Imaging Model-Development Pipeline

编码智能体能构建鲁棒基线吗?一种基于技能的医学影像模型开发流水线自动化方法

Eugenia Moris, José Ignacio Orlando

机构 * Arionkoder LLC(阿里昂科德有限责任公司) Yatiris(亚蒂里斯) UNICEN-CONICET(国立中央大学-阿根廷国家科学技术研究委员会)

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究提出一种结合文献引导推理等的智能体式AI科学家工作流,可自动化医学影像模型开发流水线,在四个公开基准上取得竞争力结果,大幅降低相关工程工作量。

Comments MICCAI 2026 Workshop AgenticMed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22938 2026-08-25 cs.SE cs.AR 新提交 50%

Execution-Anchored Hallucination Calibration Reranking for Verilog Code Generation

面向Verilog代码生成的执行锚定幻觉校准重排序

Guang Yang, Xing Hu, Xiang Chen, Terry Yue Zhuo, Xin Xia

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究针对LLM生成Verilog代码时的性能问题,提出EAHC重排序框架,通过双通道架构融合执行与推理信号,解决现有方法的域迁移差和推理幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22724 2026-08-25 cs.CE 新提交 50%

Frontiers in FinTech: Multimodal Foundation Models for Financial Reporting and Decision Science

金融科技前沿:面向财务报告与决策科学的多模态基础模型

Yulu Huang, Niannian Yu, Yaxin Yang, Yong Huang

专题命中 规划推理 :reasoning(abstract)

AI总结 针对异构财务数据对会计信息系统的挑战,本研究提出多模态大语言模型FinVision,经200家上市公司验证可降低19%估值误差,48名专业用户测试缩短51%任务时间,助力审计自动化与财务分析民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22278 2026-08-25 cs.RO 新提交 50%

DreamMimic: Learning Visuomotor Whole-Body Loco-Manipulation via World Model

DreamMimic:通过世界模型学习视觉运动全身移动操作

Jie Yin, Xingyu Lai

机构 * Tsinghua University(清华大学)

专题命中 规划推理 :planning(abstract)

AI总结 DreamMimic 框架通过世界模型辅助蒸馏,将特权教师策略提炼为基于视觉的人形机器人控制器,引入 PCG 平衡引导与探索,在 OMOMO 和 BEHAVE 上提升了视觉移动操作性能。

Comments accepted to IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22242 2026-08-25 cs.CY 新提交 50%

Unfolding the Interdisciplinary Complexities of Climate Science: Fuxi-Climate Foundational Model

解析气候科学的跨学科复杂性:伏羲气候基础模型

Zhengyu Shi, Shaojie Shi, Rui Xu, Bohao Lv, Zhichao Chen, Jiaran Hao, Zijian Chen, Weiqi Tang, Yuan Qi, Yinghui Xu, Libo Wu

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究提出气候专用大型语言模型Fuxi-Climate基础模型,其在跨学科气候推理中性能更稳定,能实现高权衡覆盖度与不确定性感知推理,可为气候风险分析及智能体决策系统提供支撑。

Comments 28 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21602 2026-08-25 cs.HC 新提交 50%

Exploring Agentic Approaches for Data Issue Detection and Repair in AI-Assisted Visualization

探索用于AI辅助可视化中数据问题检测与修复的智能体方法

Parimal Kashireddy, Anna Fariha, Mahmood Jasim

专题命中 规划推理 :planning(abstract)

AI总结 本研究通过评估GPT-5等LLMs在单/多智能体模式下的表现,探究其在AI辅助可视化中检测修复数据问题的能力,发现其在单字段问题上表现良好但在时间等问题上存在不足,并提出智能体可视化系统的设计启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21439 2026-08-25 cs.CV 新提交 50%

WorldMind: Decoupled Game World Model for State-Aware NPC Behavior

WorldMind:用于状态感知NPC行为的解耦游戏世界模型

Zhiyang Deng, Boran Zhang, Danze Chen, Yeying Jin

机构 * Tencent(腾讯)

专题命中 规划推理 :planning(abstract)

AI总结 本研究针对现有游戏世界模型中NPC行为与视频生成绑定的问题,提出首个解耦框架WorldMind,构建BOSS-140K数据集,实验显示其NPC行为更优。

Comments Project page: this https URL (https://teawhite.cn/worldmind_projectpage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13791 2026-08-25 eess.IV cs.CV 版本更新 50%

VLM- and LLM-Driven Multi-Agent System for PET Image Denoising

基于视觉语言模型(VLM)与大语言模型(LLM)驱动的多智能体正电子发射断层扫描(PET)图像去噪系统

Boxiao Yu, Savas Ozdemir, Yang Xing, Fumio Hashimoto, Jiong Wu, Yizhou Chen, Axel Rominger, Ruogu Fang, Kuangyu Shi, Tinsu Pan, Kuang Gong

专题命中 规划推理 :reasoning(abstract)

AI总结 针对PET图像分辨率低、信噪比差及深度学习去噪部署需多模型与专家干预的问题,本文提出VLM与LLM驱动的多智能体闭环PET去噪框架,自主选最优模型参数,在低剂量数据上优于UNet等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09616 2026-08-25 cs.DC 版本更新 50%

DCGen 1.1 Technical Report: Generating Datacenter Configurations (including IT, Power, Cooling)

DCGen 1.1 技术报告:生成数据中心配置(包括IT、电力、冷却)

Wedan Emmanuel Gnibga, Andrew A. Chien

专题命中 规划推理 :planning(abstract)

AI总结 为研究数据中心硬件设计、运营动态、冷却机制及与电网的交互,DCGen工具能生成多种数据中心配置,涵盖IT硬件、冷却和电力分配基础设施,并支持不同电力、计算能力和面积目标的场景探索。

详情

展开后加载摘要…

URL PDF HTML 收藏