arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-17 至 2026-08-17 共收录 47 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2608.14277 2026-08-17 cs.CL cs.AI 新提交 81%

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning

SimpleOPD:适用于长上下文推理的、简单的与分词器无关的在线策略蒸馏

Haonan He, Haodi Lei, Yun Luo, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Shengji Tang, Zhilin Wang, Runzhe Zhan, Lei Bai, Ganqu Cui, Fangchen Yu, Yafu Li, Peng Ye, Ning Ding, Yu Cheng

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出SimpleOPD方法,通过共享文本空间对齐令牌、引入学生参考KL损失并屏蔽特殊终止令牌优势,将长上下文模型SU-01的推理能力迁移至多类学生模型,在数学及科学基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13607 2026-08-17 cs.AI cs.CL cs.LG 新提交 75%

No Universal Signal Predicts Sample-Level LLM Regression under Version Updates

没有通用信号可预测版本更新下的样本级大语言模型退化

Jia Sheng, Yiwei Lu

机构 * University of Ottawa(渥太华大学) Vector Institute(向量研究所)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究如何用推理时信号预测LLM版本更新导致的样本级退化,对比单模型与跨版本信号,发现信号有效性具任务依赖性且无通用最优信号,部分跨版本信号可支持选择性回退,从业者可据此选择信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14407 2026-08-17 cs.AI 新提交 57%

The Past and Future of AI Scientists

AI科学家的过去与未来

Ross D. King

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述AI科学家的过去与未来,指出其核心挑战是多技术集成,现有技术已支持构建更通用系统,其有望变革科学,诺贝尔图灵挑战目标进展超前。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14212 2026-08-17 cs.AI 新提交 57%

APTER: Adaptive Post-Training with Expert-Grounded Rubrics

APTER:基于专家准则的自适应后训练

Xukai Wang, Liangqi Li, Zhiyue Xu, Jingang Zhou, Xiaoyu Shi, Jiansheng Cai, Bo Zhang, Zhe Li, Xu-Yao Zhang

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字科技)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 APTER是将结构化领域知识融入专业复杂推理评估、优化与诊断的框架,通过专家准则生成查询级准则并用于自适应后训练,在数学、医学领域三代模型上均实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2608.13567 2026-08-17 cs.AI cs.CL cs.LG 新提交 67%

Modular Cognitive Architecture Emerges in Large Language Models

大型语言模型中出现的模块化认知架构

Pengrui Han, Jacob Andreas, Evelina Fedorenko, Andrea Gregor de Varda

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究探究大型语言模型是否会出现类似人类大脑的模块化认知架构,经对4个认知领域46项任务的回路分析,发现其会形成相似模块化架构,表明模块化可能是智能系统的基本属性。

Comments https://pengrui-han.github.io/LLM_Modularity_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 2 篇

2608.14375 2026-08-17 cs.AI cs.CL cs.LG 新提交 67%

Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages

错误但有用:多智能体消息中超越答案正确性的轨迹价值

Chih-Hsuan Yang, Anjir Ahmed Chowdhury, Cheng-Hau Yang, Weijian Zheng, Fernando Llorente, Xiaolong Ma, Xinyang Li, Eliu A. Huerta, Ian T. Foster, Rajeev Thakur

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出DHD协议,发现多智能体错误消息含有用信息,错误但有帮助的消息普遍存在,其轨迹价值可辅助决策,答案正确性不决定轨迹价值。

Comments 24 pages, 9 figures. Includes an appendix and an ancillary reproducibility artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13958 2026-08-17 cs.AI cs.CY cs.LO 新提交 57%

Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence

用Wolfram语言实现计算法以用于人工智能治理

James K. Wiles

机构 * Wolfram Institute for Computational Foundations of Science(沃尔夫勒姆计算基础科学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文在Wolfram语言中实现Reified Input/Output Logic,测试GPT-4转换英文法律陈述的情况,通过AI看门狗案例展示计算法可作为AI治理工具,理想目标是形式化可编程执行的法律。

Comments 25 pages, 1 figure, 2 tables, 12 code listings. Wolfram Language implementation and verification script (31 assertions) available at https://github.com/Zaffer/research-computational-law

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 6 篇

2608.13612 2026-08-17 cs.AI cs.SE 新提交 79%

SemPlan: Benchmarking Structured Semantic Planning for LLM-Based Queries over Enterprise Data

SemPlan:面向企业数据的基于大语言模型(LLM)查询的结构化语义规划基准测试

Bruno Santos Teixeira

机构 * Universidade Federal de Ouro Preto (UFOP)(欧鲁普雷图联邦大学(UFOP))

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究构建了SemPlan基准测试,对比四种架构在企业数据LLM查询语义规划中的表现,发现结构化语义规划架构(A3)正确率最高,不同架构在正确率、策略合规性、成本等方面存在权衡。

Comments 11 pages, 3 figures, 9 tables. Submitted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14466 2026-08-17 cs.RO cs.IT cs.LG math.IT 新提交 79%

Expected Free Energy-based Informative Path Planning for Robotic Mars Exploration

基于期望自由能的火星探测机器人信息路径规划

Ajith Anil Meera, Pablo Lanillos, Wouter Kouw

机构 * TU Eindhoven(埃因霍温理工大学) Cajal Centre for Neuroscience, Spanish National Research Council(西班牙国家研究委员会卡哈尔神经科学中心)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 该研究提出将主动推理的期望自由能作为统一准则,用于预算约束下的机器人信息路径规划,其规划方法在火星探测场景中可同时实现精准地图构建与高价值区域定位,性能优于信息论基准方法。

Comments accepted for IWAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14312 2026-08-17 cs.CL 新提交 70%

Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL

Envs-FORGE:面向智能体强化学习的前沿优化、奖励驱动的环境合成方法

Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Zhichao Shi, Hao Zhou, Xuhui Jiang, Chengjin Xu, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DataArcTech Ltd.(DataArcTech有限公司)

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.CL

AI总结 Envs-FORGE是面向智能体RL的奖励驱动环境合成方法,通过MILP选动作生成训练环境,在多模型及数据集上显著提升Pass@1等指标。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14246 2026-08-17 cs.AI 新提交 57%

Polaris : Multi Agentic System for Conversational Enterprise Analytics

Polaris:用于对话式企业分析的多智能体系统

Varuni H K, Soham Sarkar, Jay Kumar, Goutham Krishnan, Tanvi Johari, Avinash Bharadwaj, Santosh Hegde

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出名为Polaris的多智能体框架,通过动态任务协调(DTC)层与ReAct风格智能体结合,实现对话式企业分析,在结构化企业数据集上验证了其高语义保真度与答案相关性,为大规模可信端到端商业智能提供了新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13791 2026-08-17 eess.IV cs.CV 新提交 50%

VLM- and LLM-Driven Multi-Agent System for PET Image Denoising

基于视觉语言模型(VLM)与大语言模型(LLM)驱动的多智能体正电子发射断层扫描(PET)图像去噪系统

Boxiao Yu, Savas Ozdemir, Yang Xing, Fumio Hashimoto, Jiong Wu, Yizhou Chen, Axel Rominger, Ruogu Fang, Kuangyu Shi, Tinsu Pan, Kuang Gong

专题命中 规划推理 :reasoning(abstract)

AI总结 针对PET图像分辨率低、信噪比差及深度学习去噪部署需多模型与专家干预的问题,本文提出VLM与LLM驱动的多智能体闭环PET去噪框架,自主选最优模型参数,在低剂量数据上优于UNet等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14309 2026-08-17 cs.CV q-bio.TO 新提交 50%

Spatial Message Passing in Language Space for Pathology Image Interpretation

面向病理图像解读的语言空间空间消息传递

Jing-Cheng Yang, Hao-Jung Wang, Jinhao Du, Yang Hu, Ming-shan Tsai, Jens Rittscher, Bin Li

机构 * National Taiwan University(台湾大学) University of Oxford(牛津大学) ZYTCA Limited(ZYTCA有限公司)

专题命中 规划推理 :reasoning(abstract)

AI总结 提出SLMP框架,在语言空间对病理图像执行空间推理,无需微调MLLM,提升肿瘤描述准确率,缩小通用与病理专用MLLM的性能差距。

Comments Accepted at MICCAI 2026 Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 3 篇

2608.14160 2026-08-17 cs.RO 新提交 67%

OccPlanner: Goal-Aware Occupancy-Conditioned Diffusion Planner for Pixel-Goal Navigation

OccPlanner:面向像素目标导航的目标感知占用条件扩散规划器

Binling Huang, Nianjin Ye, Xi Yang, Liang Hu, Zhou Huang, Shuang Wei, Longrui Yang, Yanchi Chen, Lanpeng Jia

机构 * Changhong Intelligent Robot(长虹智能机器人) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 该研究针对像素目标导航的3D目标定位与无碰撞规划难题,提出OccPlanner模型,引入L3ROcc生成监督,在仿真中大幅提升导航成功率,还验证了其仿真到真实的迁移适配性。

Comments Technical report. 11 pages, 6 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13921 2026-08-17 cs.AI 新提交 57%

When Personal Memory Has No Single Answer: Evaluating LLM Agents under Irreducible Conflict

当个人记忆没有唯一答案时:评估大语言模型智能体在不可约冲突下的表现

Lu Yang, Shusheng Xu, Zhuoran Li, Tongkai Yang, Longbo Huang

机构 * Ant Group(蚂蚁集团)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对大语言模型智能体的记忆冲突问题,提出了基准TANGLE并评估其表现,发现现有方法存在缺陷,进而提出冲突感知行动策略CAAP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13723 2026-08-17 cs.RO 新提交 50%

Graph-MambaNav: Spatial-Temporal Graph Mamba Leveraging Object-Relation Knowledge for Object-Goal Navigation

Graph-MambaNav:利用对象关系知识的时空图Mamba用于目标对象导航

Leyuan Sun, Genxin Chen, Linwei Ye, Yan Zhang, Xi Kan, Yanfei Sun

机构 * School of Internet of Things Engineering, Wuxi University(无锡大学物联网工程学院) School of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出Graph-MambaNav,一种结合LLM常识对象关系的目标感知时空图编码框架,通过节点排序与Mamba建模实现高效导航,在仿真环境表现优异且泛化性好,经真实机器人部署验证有效。

Comments Accepted by IEEE Robotics and Automation Letters (IEEE RA-L), will transfer to 2027 IEEE International Conference on Robotics & Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 2 篇

2608.14161 2026-08-17 cs.AI 新提交 79%

BiasTrace: Linking Reasoning Behaviours to Biased Outputs in LLMs

BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来

Varsha Ramineni, Hossein A. Rahmani, Jerome Ramos, Karin Sevegnani, Emine Yilmaz

机构 * University College London(伦敦大学学院) NVIDIA(英伟达)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14420 2026-08-17 cs.LG 新提交 70%

More Correct Mass, Worse Answers: Why Power Sampling Can Fail and How to Fix It

更多正确质量,更差答案:幂采样为何会失效及如何修复

Haohui Yang, Jiaxing Sun, Xiujun Ma

机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能 State Key Laboratory)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 研究发现幂采样存在悖论,即提升正确轨迹概率却降低下游推理性能,归因于剂量与覆盖不匹配,提出修复后的支持保留幂采样器可逆转损失并优于标准多采样推理。

Comments 16 pages, 8 figures, 1 table. Haohui Yang and Jiaxing Sun contributed equally. Xiujun Ma is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 6 篇

2608.14003 2026-08-17 cs.CL 新提交 85%

Batch-wise Adaptive Pruning: Periodic Neuron Activation-Aware Weight Pruning for Language Reasoning Model

批量自适应剪枝:面向语言推理模型的周期性神经元激活感知权重剪枝

Yongmin Kim, Shota Takashiro, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究针对语言推理模型批量推理下自适应剪枝性能下降的问题,提出带周期性top-k选择和激活记忆的无训练剪枝方法,在DeepSeek-R1-Distill-Qwen-7B上实现39.7个百分点准确率提升与1.40倍推理加速。

Comments Accepted at COLM 2026. 28 pages, 12 figures, 18 tables. Code: https://github.com/matsuolab/batch-wise-prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13760 2026-08-17 cs.CL cs.AI cs.CV cs.LG 新提交 85%

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

放大并不意味着具有预测性:思考模型中的推理行为

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。

Comments Published in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14452 2026-08-17 cs.AI 新提交 79%

SheetCompass: Hierarchical Relation Graphs for Agentic Spreadsheet Reasoning

SheetCompass:面向智能体电子表格推理的分层关系图

Panjing He, Mingyue Cheng, Yucong Luo, Li Li, Xiaohan Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对LLM处理电子表格时丢失多维结构语义的问题,提出SheetCompass框架,通过显式建模表内外结构关系并结合内存机制,提升智能体对复杂工作簿的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14290 2026-08-17 cs.AI 新提交 79%

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

Intern-S2-Mobius:知识与推理解耦的基础模型

Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu, Yicheng Gu, Qipeng Guo, Ermo Hua, Haian Huang, Haozheng Hou, Jie Hou, Xiangyu Hong, Che Jiang, Minxi Jin, Cheng Liang, Dahua Lin, Dawei Liu, Kuikun Liu, Chengqi Lv, Haijun Lv, Han Lv, Ningsheng Ma, Biqing Qi, Jianmin Qian, Shiya Su, Youbang Sun, Huanze Tang, Zhongbo Tian, Hanjing Wang, Rui Wang, Ting Wang, Yi Wang, Baiting Wu, Jun Xu, Bowen Yang, Hui Wang, Weida Wang, Haochen Ye, Jiashuo Yu, Shan Yu, Xiaoyi Yu, Qirui Zeng, Qi Zhang, Ming Zhang, Wenwei Zhang, Bowen Zhou, Xinyu Zhou

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出知识与推理解耦的Mobius-v0架构,基于此构建的7B模型和Intern-S2-Mobius模型,分别在减少训练数据和提升推理速度的同时保持了相近的下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13900 2026-08-17 cs.DB cs.AI cs.CL cs.LG 新提交 67%

Agentic Transaction: Towards ACID-Compliant Agent Systems

智能体事务:面向ACID兼容的智能体系统

Zhaoyan Sun, Xiaoxiao Wang, Guoliang Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14047 2026-08-17 cs.RO cs.AI cs.CV 新提交 57%

Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

将视觉-语言-动作模型进化为具备即时工具使用能力的智能体

Yi Ding, Yanzhao Yu, Xili Dai, Xianbiao Qi, Peiwen Sun, Xueqian Wang, Xiangyu Yue, Jianan Wang

机构 * Astribot(星舟机器人) Tsinghua University(清华大学) Juxi Tech(矩芯科技) IntelliFusion Inc.(智融公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出带工具使用的智能体机器人(ART)框架,调优VLA模型以利用工具模块,在模拟及真实任务中成功率较基线高20%,为VLA系统实际部署奠定基础。

Comments 12 pages, 4 figures, Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings, 2026, pp. 1346-1357

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 推理评测 13 篇

2608.14015 2026-08-17 cs.CV cs.AI 新提交 79%

MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

MedClaw:用于长程手术视频推理的启发式智能体框架

Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang

机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) University of Maryland(马里兰大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) University of British Columbia(不列颠哥伦比亚大学) Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出MedClaw智能体框架,通过分离推理与感知、启发式技能蒸馏循环,在仅需约100个标注示例的情况下,于自建及公开手术视频基准MedClawBench上,显著优于现有一次性VLM和通用视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13667 2026-08-17 cs.AI cs.SE 新提交 79%

Second Thought: Reasoning in Parallel as LLM Agents Act and Observe

Second Thought:LLM智能体行动与观察时的并行推理

Zhensu Sun, Chengran Yang, Yunbo Lyu, Jieke Shi, David Lo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出无需训练的推理框架Second Thought,利用LLM智能体行动与观察的空闲窗口并行推理,在多基准测试中降低轮次、减少主线程解码量,且Pass@1表现优于计算匹配对照组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13766 2026-08-17 cs.CV 新提交 78%

ChartProbe: A Diagnostic Study on Visual Reasoning through Perception, Grounding, and Simple Reasoning

ChartProbe:通过感知、定位与简单推理开展视觉推理的诊断研究

Mahsa Khoshnoodi, Sarah Adel Bargal

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出诊断框架ChartProbe,发现视觉-语言模型可通过单独监督感知、定位等简单技能,在无需复杂推理数据的情况下提升复杂图表推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14465 2026-08-17 cs.CL cs.LG 新提交 62%

You Only Pass Once: Answering and Abstaining Together in a Single Forward Pass of a Frozen Language Model

仅前向传播一次:在冻结语言模型的单次前向传播中同时完成回答与弃权(不执行)

Ziyang Luo, Zhongyao Chu, Xinjie He, Youting Wang, Xukui Qin, Runxiong Wu, Yan-Syuan Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出YOPO系统,通过训练小型网络重构残差流,在冻结Qwen2.5模型单次前向传播中同时实现回答、引导与弃权,性能优于两次前向传播基准,且在跨域等场景表现出色。

Comments 24 pages. Ziyang Luo and Zhongyao Chu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14109 2026-08-17 cs.AI cs.LG cs.MA 新提交 62%

A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents

面向自主大语言模型智能体中结构化漂移诊断与恢复的基于图的强化学习框架

Ismail El Hamraoui, Sagar Jose, Nicolas Bureau, Robert Plana

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对自主LLM智能体的运行时行为漂移问题,提出基于图的强化学习即插即用恢复框架,经AppWorld基准验证,该框架可利用漂移信息做出正确恢复决策且输出符合要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13712 2026-08-17 cs.CY cs.AI cs.CL 新提交 62%

Reading Between The Lines: Modeling and Evaluating Behavioral Realism in Legal Simulation

字里行间:法律模拟中行为真实性的建模与评估

Divya Vetticaden, Arya Gupta, Julian Nyarko, Megan Ma

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出可控法律角色驱动的证词采集模拟器WitnessSim,采用分离行为真实性与教学实用性的评估框架,证实其行为保真度,为法律模拟性能评估提供框架。

Comments Accepted at ICML 2026 AI4Law. 47 pages, 26 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏