arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 902 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 902 篇

2608.17834 2026-08-19 cs.HC cs.AI 新提交 57%

AdaLens: Interactive Storyline for Monitoring and Steering Long-Running Agentic Data Analysis

AdaLens:用于监控和引导长时间运行的智能体数据分析的交互式故事情节

Yangtian Liu, Yan Miao, Shuhan Liu, Yunfan Zhou, Dae Hyun Kim, Di Weng, Yingcai Wu

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对长时间智能体数据分析的传统界面无法满足可观测性与可引导性需求,本文提出交互式系统AdaLens,结合故事情节表示与引导交互,经案例及用户研究验证其能有效支持分析师监控与引导此类分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17184 2026-08-19 cs.CL 新提交 57%

AISA: AI Safety Assistant Framework for Continuous Improvement of Highway Construction

AISA:用于公路施工持续改进的AI安全助手框架

Mason Smetana, Trevor Neece, Lev Khazanovich

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本研究提出AISA框架,基于LLM和文本嵌入模型实现公路施工事故分类、质量评分及相关数据检索,为未来智能体应用提供基础,在OIICS分类和事故检索等任务上取得优于随机水平的效果。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16710 2026-08-18 cs.LG 新提交 57%

The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback

伦理决策头:基于人类反馈的强化学习在自动驾驶中实现规范伦理

Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi

机构 * Stony Brook University(石溪大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出伦理决策头(EDH)框架,结合PPO与人类偏好奖励模型,在CARLA仿真中训练自动驾驶智能体,发现人类对自动驾驶伦理的理论规定与实践奖励存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16447 2026-08-18 cs.AI cs.RO 新提交 57%

HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents

HaReCAP:面向递归大语言模型智能体的习惯性动作 grounding 方法

Shen Liu, Zhenguo Xu, Shaopu Wang, Yike Gao, Chunlei Wang

机构 * North China Institute of Computer System Engineering(华北计算机系统工程研究所) University of Science and Technology of China(中国科学技术大学) China Information Security Research Institute Co., Ltd.(中国信息安全研究院有限公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 HaReCAP 是针对 ReCAP 的低侵入性扩展,通过编译叶子反射规则减少长视距具身任务中 LLM 的重复调用,在 Robotouille 和 ALFWorld 上显著降低了 token 消耗。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16370 2026-08-18 cs.AI 新提交 57%

What Does Context Compression Cost an Agent? Interaction Costs Unrevealed by Task-Completion Metrics

上下文压缩会给智能体带来什么代价?任务完成指标未揭示的交互代价

Shuyu Liu

机构 * Chongqing University of Science and Technology(重庆科技学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对使用工具的智能体,发现上下文压缩会带来任务完成指标未揭示的隐藏交互成本,检索调用增加是其主要来源,且该特征具有环境依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15909 2026-08-18 cs.IR cs.CL 新提交 57%

Large language model-assisted discovery of cohorts from scientific literature

大语言模型辅助的科学文献队列发现

Moritz Sturm, Lisa M. Berg, Inken Berg, Harishny Sarma, Jasmin Hartmann, Denissa Girschik, Gemma Roig, Christine M. Freitag, Andreas G. Chiocchetti

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 该研究开发了问题驱动框架,通过PubMed API检索文献,用大语言模型提取队列名称,在青少年攻击行为遗传学用例中,补充了队列目录未覆盖的17个合格队列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15687 2026-08-18 cs.AI 新提交 57%

THESIS-MoE: Trainable Hierarchical Extraction and SteerIng of Sycophancy in Mixture-of-Experts

THESIS-MoE:可训练的分层提取与混合专家模型中谄媚行为的引导

Kareem Hassani, Chaymaa Abbas, Lama Mawlawi, Mariette Awad

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出THESIS-MoE,通过共享对比信号定位MoE模型中谄媚行为的计算子电路,采用有条件干预方法,在保留知识的同时消除了高达90%的信念诱导谄媚行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15082 2026-08-18 cs.AI 新提交 57%

Beyond Thresholds: A Quality-Aware Decision Intelligence Framework for Cold Chain IoT Systems

Aashna Sofat, Balwinder Sodhi

机构 * IIT Ropar(印度理工学院罗帕尔分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15016 2026-08-18 cs.CR cs.AI 新提交 57%

Hierarchical Agentic Incident Response with Digital-Twin-Validated Attack Inference

结合数字孪生验证攻击推理的分层智能体事件响应

Yiran Gao, Juntao Chen, Tao Li

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对网络事件响应效率低的问题,提出整合LLM攻击推理、滚动规划与数字孪生验证的分层智能体响应框架,在33组件企业网络测试台的多阶段攻击场景中,其恢复成功率较前沿LLM基线提升18%-31%。

Comments 2026 IEEE Conference on Communications and Network Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14950 2026-08-18 cs.CL 新提交 57%

DA-RAC: Distance-Aware Calibration of LLM Judges for Trustworthy AI Auditing

DA-RAC:面向可信AI审计的大语言模型评判器的距离感知校准

Cheng Wu, Vishal Anand, Jaya Krishna Mandivarapu, Xiya Liu, Rui Zhuang

机构 * Microsoft(微软公司)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 针对LLM评判器因无关参考示例导致的校准偏差问题,提出DA-RAC距离感知参考锚定校准方法,在多轮评估基准上提升了校准效果并降低了误通过风险,为可信AI审计提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14765 2026-08-18 cs.AI cs.DB 新提交 57%

Agentic Data Cleaning Without a Clean Reference: An Experimental Study of Capabilities and Trade-offs

无干净参考的智能体数据清洗:能力与权衡的实验研究

Hadi Fadlallah

机构 * Faculty of Arts and Sciences(文理学院) University of Sciences and Arts in Lebanon(黎巴嫩科学与艺术大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出整合多组件的基于证据的无参考智能体数据清洗框架,经多数据集实验发现,额外能力会在多指标间引入权衡,无配置在所有标准上最优。

Comments 21 pages, 3 figures, Submitted to New Generation Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14655 2026-08-18 cs.LG cs.CV 新提交 57%

Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation

通过模态子空间激活诊断并缓解全模态大语言模型(Omni-LLMs)中的感知-决策失配问题

Hongbo Jiang, Jie Li, Yunhang Shen, Tianyu Xie, Pingyang Dai

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 针对Omni-LLMs存在的感知-决策失配问题,本文提出因果模态敏感性及对应诊断方法,构建CausalMSBench数据集,提出无需训练的MSA框架以恢复模型的因果模态敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14631 2026-08-18 cs.AI 新提交 57%

Accuracy and Reliability of Large Language Models in Cosmetic Chemistry and Skin Health: A Benchmarking Study

大型语言模型在化妆品化学与皮肤健康领域的准确性与可靠性:一项基准测试研究

Amelia Liu

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究测试14个LLMs在化妆品化学与皮肤健康领域的表现,发现其总体准确性差、技术深度不足,无法可靠提供相关信息,需微调验证数据集并改进算法推理。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14246 2026-08-17 cs.AI 新提交 57%

Polaris : Multi Agentic System for Conversational Enterprise Analytics

Polaris:用于对话式企业分析的多智能体系统

Varuni H K, Soham Sarkar, Jay Kumar, Goutham Krishnan, Tanvi Johari, Avinash Bharadwaj, Santosh Hegde

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出名为Polaris的多智能体框架,通过动态任务协调(DTC)层与ReAct风格智能体结合,实现对话式企业分析,在结构化企业数据集上验证了其高语义保真度与答案相关性,为大规模可信端到端商业智能提供了新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13334 2026-08-14 cs.CL 新提交 57%

RippleMem: From Isolated Retrieval to Associative Recollection for Long-Term Agent Memory

RippleMem:从孤立检索到智能体长期记忆的关联回忆

Jingbo Ji, Lingyi Li, Xilong Cheng, Yuhao Zhou, Wenji Zhang, Yuting Tan, Yunxiao Qin

机构 * Communication University of China(中国传媒大学) Zhilian Yinghe Technology Co., Ltd.(智联映和科技有限公司) State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 RippleMem是一种智能体长期记忆系统,以自适应关联回忆替代孤立检索,在LoCoMo、LongMemEval-S数据集上提升LLM-as-a-Judge准确率并降低图构建成本,性能优于现有方法。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12373 2026-08-14 cs.AI 新提交 57%

Don't Want Your LLM to Recommend Nuclear Strike? Try Asking It in Japanese

不想让你的大语言模型(LLM)推荐核打击?试试用日语提问

Rian Touchent

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究发现,用日语提问可降低部分LLM在核打击场景中的发动率,其机制为模型的推理语言而非输入语言,且仅适用于在英语中已存在犹豫的模型,表明LLM安全行为具语言依赖性。

Journal ref Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), Jul 2026, San Diego, United States. pp.489-502

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12273 2026-08-13 cs.CR cs.AI 新提交 57%

Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

收敛式绕路劫持:基于技能的大语言模型智能体中的任务保留型资源放大

Junliang Liu, Ruoyu Li, Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Jingheng Xu, Laizhong Cui

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出收敛式绕路劫持攻击,耦合LLM智能体技能选择与规划阶段,可放大任务资源消耗,在DeepSeek-V4-Pro上80.02%的任务会被选中攻击者控制的协调器,任务完成率不变但成本显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11924 2026-08-13 cs.CL 新提交 57%

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

Spark-to-Paper:作为可组合技能的端到端研究论文生成系统

Zhuoyang Qian, Biao Wu, Yiran Wang, Chris D Yan, Desan Dai, Liangwei Zheng, Jin Jiang, Junsheng Zhang, Wenhao Wang

机构 * Vast Intelligence Lab(星智实验室) University of Technology Sydney(悉尼科技大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 Spark-to-Paper是在现有编码助手中实现的端到端研究论文生成系统,含13项可组合技能,在8个研究主题中实现高引用与图表有效性,提升伪造检测率,成本与耗时较低。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11888 2026-08-13 cs.AI 新提交 57%

Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents

智能体技能可能有害:LLM智能体中技能诱导故障的实证研究

Gen Dong, Yanjie Gao, Liqun Li, Tianyin Xu, Yu Hua, Fan Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Microsoft Research(微软研究院) Microsoft(微软) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文通过提出差异分析框架,在SkillsBench等数据集上发现LLM智能体的技能会引发功能故障与效率回归,并构建SkillTriage工具,为安全复用技能提供研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11742 2026-08-13 cs.CL 新提交 57%

Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models

波纹枢轴搜索:扩散大语言模型的主动并行解码

Yushi Ye, Xu Chen, Haoyun Jiang, Jinsong Lan, Haihong Tang, Bo Han, Ivor Tsang, Yanfeng Wang, Bo Zheng, Jiangchao Yao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学合作中位数网络创新中心) Alibaba Group TMLR Group(阿里巴巴集团TMLR团队) Hong Kong Baptist University(香港浸会大学) A*STAR CFAR and Nanyang Technological University(新加坡科研局计算科学中心和南洋理工大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出RPS方法,利用dLLM解码的波纹效应,在保持生成质量的同时,大幅提升解码速度与准确率,适用于推理及代码生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11631 2026-08-13 cs.AI 新提交 57%

CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement

CLAIM:基于不确定性度量的大语言模型开放域主动澄清领先方案

Kuangzhao Yang, Ziliang Zhao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于不确定性度量的CLAIM框架,无需人工标注,结合监督学习与强化学习训练统一澄清决策模型,实现开放域人机交互中低成本鲁棒的主动澄清。

Comments 11 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11354 2026-08-13 cs.AI 新提交 57%

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面

Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

机构 * JPMorganChase(摩根大通)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。

Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11350 2026-08-13 cs.CL cs.RO 新提交 57%

Self-Evolving Embodied Agents via Skill-Harness Evolution

基于技能-工具链进化的自演化具身智能体

Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * Microsoft Research(微软研究院) Northeastern University(东北大学)

专题命中 规划推理 :verifier(abstract);分类 cs.CL

AI总结 提出免训练的SHAPER框架,通过演化技能与工具链实现冻结模型驱动的自演化具身智能体,在VLABench等数据集上验证其适配优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10920 2026-08-12 cs.AI 新提交 57%

IO Factory: Simulating AI-Enabled Influence Campaigns at Scale

IO Factory:大规模模拟AI驱动的影响力行动

Lukasz Olejnik, Wenchao Dong, Jonas R. Kunst, Signe Riemer-Sørensen, Tobias Herb, Meeyoung Cha, Daniel Thilo Schroeder

机构 * King’s College London(伦敦国王学院) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) BI Norwegian Business School(挪威商学院) University of Oslo(奥斯陆大学) SINTEF Digital(SINTEF数字研究所) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 IO Factory是AI驱动的大规模影响力行动模拟框架,可在受控平台中关联多环节数据,在10万智能体配置下可执行行动并生成可检查证据,支持可重复研究与红队分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10676 2026-08-12 cs.AI 新提交 57%

Self-Correcting Long-Horizon Search Agents via Tree-Structured Memory

基于树状记忆的自修正长程搜索智能体

Aijun Yang, Qianxue Guo, Ziyi Huang, Yuxuan Chen, Shiyou Qian, Jian Cao

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出ReTree树状记忆机制,解决LLM搜索智能体的上下文增长与错误推理问题,在四个基准上优于Full-Trajectory ReAct,准确率最高提升25.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10186 2026-08-12 cs.MA cs.AI cs.CY 新提交 57%

The Deliberative Deficit: An Empirical Critique of LLMs in Democratic Discourse

审议缺陷:对大型语言模型在民主讨论中的实证批判

Maurice Flechtner

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究通过审议推理指数(DRI)评估1980次五智能体LLM运行,发现LLM群体讨论程序性质量与人类相当但主体间一致性提升小、视角多样性仅为人类的1/3,反转人类收敛模式,仅可作为人类推理的辅助工具而非自主审议智能体。

Comments 10 pages, archival publication at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10108 2026-08-12 cs.AI 新提交 57%

MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory

MESA:面向长视野智能体记忆的任务自适应多结构证据选择

Beidi Zhao, Yaoqi Chen, Yuru Feng, Menghao Li, Qianxi Zhang, Baotong Lu, Jianan Lu, Zhirui Wang, Xinjiang Wang, Shusen Xu, Zengzhong Li, Xiaoxiao Li, Qi Chen

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 MESA是面向长视野智能体记忆的多结构证据选择框架,通过自适应选择融合互补记忆结构,在AMA-Bench上性能优于基线且减少了证据标记使用量。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09732 2026-08-11 cs.CR cs.AI 新提交 57%

ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners

ColluSkill:用于规避智能体技能扫描器的对抗性跨技能组合

Puyu Zeng, Simeng Qin, Jingzhi Li, Ju Jia, Zheli Liu, Xiaojun Jia

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究提出ColluSkill攻击框架,可通过跨技能组合规避技能扫描器,攻击成功率达96.0%;还提出ChainGuard防御框架,能将攻击成功率降至22.5%,同时放行99.5%良性工作流。

Comments 9 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09168 2026-08-11 cs.AI 新提交 57%

From Relevance to Execution Utility: Reward-Aware Dynamic Execution Gating for Skill-Based LLM Agents

从相关性到执行效用:面向基于技能的大语言模型智能体的奖励感知动态执行门控

Liang He, Jingbo Wen, Hongyu Gu, Hao Li, Haoyu Wang, Yixiong Chen, Kangning Cui, Xilu Wang

机构 * Tongji University(同济大学) The University of Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学) Nankai University(南开大学) Johns Hopkins University(约翰斯·霍普金斯大学) City University of Hong Kong(香港城市大学) University of Surrey(萨里大学)

专题命中 规划推理 :verifier(abstract);分类 cs.AI

AI总结 针对基于技能的LLM智能体执行决策难题,提出RADEG轻量型决策层,通过学习代理模型预测执行效用,在288个rollout的评估中减少不必要执行并优于基线方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08077 2026-08-11 cs.AI cs.MA cs.RO 新提交 57%

Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?

探索、建图、记忆、决策:具身视觉语言模型是否已准备好应对安全关键场景?

Gabriele La Malfa, Nitay Alon, Emanuele La Malfa, Reuth Mirsky, Stefan Sarkadi

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文扩展ToS框架为EMRD流程,评估VLMs在安全关键场景下的空间理解与决策能力,发现其决策依赖文本先验、空间推理受低光照影响,且记忆与人类认知存在根本差异,存在对齐风险。

详情

展开后加载摘要…

URL PDF HTML 收藏