arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-31 至 2026-08-31 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 9 篇

2608.28128 2026-08-31 cs.LG cs.AI 新提交 84%

VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning

VICT:用于长 horizon LLM 智能体强化学习的验证器插装式信用追踪

Pengcheng Li, Zhengyang Zhang, Dongxu Zhang, Sui Huang, Shaohua Ma

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Jiaxing Nanhu University(嘉兴南湖学院)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 针对长 horizon LLM 智能体强化学习的细粒度信用分配挑战,提出 VICT 方法,通过验证器侧的证明边追踪分配信用,在 ALFWorld 和 WebShop 上性能显著优于仅结果训练。

Comments accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27351 2026-08-31 cs.LG 版本更新 83%

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

理解用于大语言模型推理的进化策略:比GRPO更广泛的推理覆盖范围

Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 本文研究用于LLM推理的进化策略(ES),发现ES比GRPO有更广泛的推理覆盖范围,开发了结合两者优势的GRPO-ES策略,还揭示了ES的功能稀疏性等特性,确立其为独特的推理后训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17070 2026-08-31 cs.CL cs.AI 版本更新 81%

Large Reasoning Models Struggle to Transfer Parametric Knowledge Across Scripts

大推理模型在不同脚本间转移参数知识时面临困难

Lucas Bandarkar, Alan Ansell, Trevor Cohn

机构 * Google Research(谷歌研究) University of California, Los Angeles(加州大学洛杉矶分校) University of Melbourne(墨尔本大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现,大模型在跨语言知识转移中主要受脚本差异影响,通过分析数据和实验表明,提升模型对转写歧义的推理能力可改善跨脚本知识转移。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17981 2026-08-31 cs.LG 版本更新 70%

Recirculation

再循环

Michael C. Mozer, Shoaib Ahmed Siddiqui, Danny Sawyer, Sunny Sanyal, Rosanne Liu

机构 * Google DeepMind(谷歌DeepMind) University of Texas, Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 该研究提出推理时架构增强技术“再循环”及其自适应变体,无需额外训练,可显著降低Gemma3系列模型的困惑度、提升推理任务准确率,为架构演进提供新方向。

Comments v2: added citations to related work, included more methodological details concerning perplexity evaluation which help explain the large reductions in perplexity observed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12015 2026-08-31 cs.CR cs.AI cs.CL cs.LG cs.MA 版本更新 67%

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28478 2026-08-31 cs.CL 新提交 57%

Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge

盲人摸象:探究长尾分歧知识下大语言模型(LLM)的认知近视问题

Zhuoshi Pan, Junru Lu, Yan Qian, H. Vicky Zhao, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Tencent(腾讯) University of Warwick(华威大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本研究推出ElephantBench探针,发现LLM在长尾分歧知识问答中仅52.4%的问题能同时回忆两种解释,模型规模扩大等方法无法消除认知不完整性,为评估LLM认知严谨性提供了工具。

Comments 10 pages, 10 figurs, 1 table, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27141 2026-08-31 cs.CR cs.AI 版本更新 57%

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

安全性无法组合:自主大型语言模型智能体的非衰减循环状态

Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Supply Chain Tech Team Y, JD.com(京东Y供应链技术团队) Peking University(北京大学) Fudan University(复旦大学) Fullive-AI(Fullive人工智能)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28542 2026-08-31 cs.CR cs.MA 新提交 50%

Offline-Verifiable Accountability for Cross-Organization Agent Messaging: A Preserved Evidence-Bundle Approach

跨组织智能体消息传递的离线可验证问责性:一种保留证据束的方法

Adil Alshammari, Hayretdin Bahsi

专题命中 测试时计算 :verifier(abstract)

AI总结 针对跨组织智能体消息传递的离线可验证问责需求,提出保留证据束模型及策略控制的离线验证器,原型测试显示其可有效拒绝证据不足的束,无需依赖实时服务。

Comments 17 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27487 2026-08-31 cs.SE 新提交 50%

Grounded Checklist Partial Credit for Agent Skill Trajectories

智能体技能轨迹的基于接地检查表的部分 credit 评估

Suliu Qin, Lu Yin, Xilu Wang

专题命中 测试时计算 :verifier(abstract)

AI总结 针对智能体轨迹评估的二元评分缺陷,提出 GCPC 方法,结合人工规则与 LLM 生成检查表,在 SkillsBench 等数据集上验证其评估区分度、与人类评估一致性及跨数据集迁移性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏