arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-31 至 2026-08-31 共收录 51 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 51 篇

2604.12379 2026-08-31 cs.SE cs.AI cs.LG 版本更新 92%

Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks

超越输出正确性:评估大型语言模型在编码任务中的推理能力

Yuangang Li, Justin Tian Jin Chen, Ethan Yu, David Hong, Iftekhar Ahmed

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CodeRQ-Bench,首个评估LLM在生成、摘要和分类等编码任务中推理质量的基准,通过分析现有评估器的1069个不匹配案例,提出VERA评估器,实验表明其在四个数据集上均优于基线,提升AUCROC和AUPRC最高达0.26和0.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27932 2026-08-31 cs.HC 新提交 91%

Graphionale: How Graph Visualizations of LLM Rationales Affect Human Decision Making

Graphionale:LLM推理依据的图形可视化如何影响人类决策

Xinru Wang, Zhexuan Ma, Ming Yin, Shuai Ma, Thomas W Malone

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究开发了Graphionale作为测试平台,通过204人在线用户研究发现,图形化LLM推理依据对不同任务模态的决策影响不同,匹配推理格式与任务模态是AI解释设计的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19212 2026-08-31 cs.CL cs.AI 版本更新 91%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

面向上下文感知安全的多模态大语言模型解码引导

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型安全对齐的平衡难题,提出SafeCoDe解码框架,通过两阶段机制优化上下文敏感的弃权行为,在多基准实验中有效提升安全性能且保留模型有用性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24418 2026-08-31 cs.CR 版本更新 90%

GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners

GSPR:将大语言模型(LLM)安全防护措施对齐为可泛化的安全策略推理器

Haoran Li, Jingru Zeng, Yulin Chen, Huihao Jing, Wenbin Hu, Hao Peng, Haochen Shi, Xi Yang, Ziqian Zeng, Sirui Han, Yangqiu Song

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对现有LLM安全防护措施泛化性不足的问题,提出可泛化安全策略推理器GSPR,通过强化学习在多安全基准训练后提升安全与类别预测能力,且推理token成本更低。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28270 2026-08-31 cs.RO cs.AI 新提交 90%

Spatial-Semantic Reasoning using Large Language Models for Efficient UAV Search Operations

基于大语言模型的空间语义推理用于高效无人机搜索任务

Marin Maletic, Marijana Peti, Tamara Petrovic, Stjepan Bogdan

机构 * University of Zagreb(萨格勒布大学) Faculty of Electrical Engineering and Computing(电气工程与计算机学院) LARICS (Laboratory for Robotics and Intelligent Control Systems)(拉里克机器人与智能控制系统实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出基于大语言模型的无人机实时语义导航框架,结合多技术实现高效目标导航,经仿真与真实实验验证可缩短任务时长且保持高搜索准确率。

Comments 8 pages, preprint, Published in: 2025 European Conference on Mobile Robots (ECMR), DOI: https://doi.org/10.1109/ECMR65884.2025.11163229

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28128 2026-08-31 cs.LG cs.AI 新提交 90%

VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning

VICT:用于长 horizon LLM 智能体强化学习的验证器插装式信用追踪

Pengcheng Li, Zhengyang Zhang, Dongxu Zhang, Sui Huang, Shaohua Ma

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Jiaxing Nanhu University(嘉兴南湖学院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对长 horizon LLM 智能体强化学习的细粒度信用分配挑战,提出 VICT 方法,通过验证器侧的证明边追踪分配信用,在 ALFWorld 和 WebShop 上性能显著优于仅结果训练。

Comments accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28182 2026-08-31 physics.soc-ph cs.CL 新提交 88%

Benchmarking large language model agent societies against human behavioural distributions

针对人类行为分布的大语言模型智能体群体基准测试

Raad Bin Tareaf

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究开发了开源工具SILICA,测试12个大语言模型智能体群体与人类行为的契合度,发现多数模型仅起始行为与人类相近,最终行为、合作模式等均存在显著差距,仅推理训练模型表现接近人类,当前硅基智能体群体仅支持探索性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14684 2026-08-31 cs.CL 版本更新 88%

SMRC: Aligning Large Language Models with Student Reasoning for Mathematical Error Correction

SMRC:使大语言模型与学生数学推理对齐以进行数学错误修正

Biaojie Zeng, Min Zhang, Juan Zhou, Fengrui Liu, Ruiyang Huang, Yu Song, Xin Lin

机构 * East China Normal University(华东师范大学) East Chine Normal University(华东师范大学) Southeast University(东南大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究针对大语言模型数学推理错误的教育场景修正需求,提出SMRC方法,结合MCTS等技术构建高中数学基准MSEB,实验显示其在多数据集上性能优于现有方法。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27141 2026-08-31 cs.CR cs.AI 版本更新 87%

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

安全性无法组合:自主大型语言模型智能体的非衰减循环状态

Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Supply Chain Tech Team Y, JD.com(京东Y供应链技术团队) Peking University(北京大学) Fudan University(复旦大学) Fullive-AI(Fullive人工智能)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14240 2026-08-31 cs.AI 版本更新 84%

AFFORDANCE20Q: Evaluating Affordance Reasoning from Physical Properties

AFFORDANCE20Q:从物理属性评估可承担性推理

Yifan Jiang, Meige Yang, Zitong Li, Jay Pujara

机构 * Information Sciences Institute, University of Southern California(南加州大学信息科学研究所) University of Southern California(南加州大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Affordance20Q基准,通过20个问题游戏评估模型从物理属性推理物体可承担性的能力,发现LLM与人类差距约20分,并开发KARI方法提升开源模型达15.2分。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07261 2026-08-31 cs.CL 版本更新 83%

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments EMNLP 2026, findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17070 2026-08-31 cs.CL cs.AI 版本更新 82%

Large Reasoning Models Struggle to Transfer Parametric Knowledge Across Scripts

大推理模型在不同脚本间转移参数知识时面临困难

Lucas Bandarkar, Alan Ansell, Trevor Cohn

机构 * Google Research(谷歌研究) University of California, Los Angeles(加州大学洛杉矶分校) University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);LLM(abstract_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,大模型在跨语言知识转移中主要受脚本差异影响,通过分析数据和实验表明,提升模型对转写歧义的推理能力可改善跨脚本知识转移。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28407 2026-08-31 cs.CL 新提交 81%

A Unified Framework to Elicit Structured Feedback for Interpretable Multi-Trait Essay Scoring

用于可解释多特质作文评分的结构化反馈提取统一框架

Shihang Yang, Sanwoo Lee, Ningning Zhao, Yunfang Wu

机构 * Peking University(北京大学) Beijing Normal University(北京师范大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究针对多特质自动作文评分中反馈与评分分离的问题,提出统一框架HiFTS,结合教师LLM提炼反馈并训练学生模型,在新数据集CFMS-34及ASAP++上取得优异评分与反馈效果。

Comments 14 pages, accepted to EMNLP 2026 Findings. Code: this https URL (https://github.com/Atiyahsama/HiFTS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27974 2026-08-31 cs.CL 新提交 81%

QUORUM: QUality-Optimized Routing Using Multiple annotators

QUORUM:基于多个标注者的质量优化路由

Antonio Purificato, Maria Sofia Bucarelli, Andrea Bacciu, Amin Mantrach, Fabrizio Silvestri

机构 * Amazon(亚马逊) Sapienza University of Rome(罗马萨皮恩扎大学) Université Côte d’Azur(蔚蓝海岸大学) CNRS(法国国家科学研究中心) Inria(法国国家信息与自动化研究所) I3S(信息、信号与智能系统实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出预算感知路由框架QUORUM,通过特征信号估计实例难度、结合多标注者结果,在固定预算下动态分配任务,提升标注质量并降低成本。

Comments 4 figures, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27818 2026-08-31 cs.AI 新提交 81%

AcCoRD: Evaluating User-Agent Collaboration Under Realistic User Preference Dynamics

AcCoRD:评估现实用户偏好动态下的用户-智能体协作

Tejas Srinivasan, Shikib Mehri, Nandita Shankar Naik, Anirban Das, William M. Campbell, Jesse Thomason

机构 * University of Southern California(南加州大学) Contextual AI(Contextual AI公司) Capital One(第一资本金融公司) Georgia Tech University(佐治亚理工大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 研究针对现有用户-智能体协作基准无法捕捉偏好动态的问题,推出AcCoRD基准,评估前沿LLM处理偏好动态的能力,发现模型难应对交互中出现/演变的偏好,仅提示无法实现所需不确定性识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24024 2026-08-31 cs.AI 版本更新 81%

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28403 2026-08-31 cs.SE 新提交 80%

Recovering Software Architecture Intent from Historical Work Items using Generative AI: A Mixed-Methods Industry Case Study

使用生成AI从历史工作项中恢复软件架构意图:一项混合方法行业案例研究

Dominik Storck, Tobias Eisenreich, Stefan Wagner

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本研究以两个行业项目为对象,提出基于LLM的五步半自动工作流,结合混合方法验证,可从历史敏捷工作项中恢复C4架构图,生成的架构基线准确有用,能揭示架构差异与漂移,且具备实际可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27506 2026-08-31 cs.AI 新提交 77%

Thinking Costs Tokens: When More Structure is Worth the Price

思考成本即 token:更多结构何时值得付出代价

Thomas Nolasque, John Grey, Calista Pham, Ankit Vani

机构 * Royal Bank of Canada(加拿大皇家银行)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文研究语言模型推理结构的 token 预算阈值,在 FinQA、TAT-QA 任务上用 GPT-5.4 mini 验证,1500 token 后验证搜索架构性能优于单体模型,交叉点在 1000-1500 token 间。

Comments 8 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27501 2026-08-31 cs.CL 新提交 77%

INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning

INSPIRE:一种用于示例驱动数学推理的“先内化再改进”方法

Shuai Wang, Jiayi Kuang, Yinghui Li, Haojing Huang, Xinnian Liang, Ying Shen, Liang Lin

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) ByteDance Inc.(字节跳动公司) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 该研究针对LLMs数学推理中内化不足的问题,提出INSPIRE方法,结合RGSI与分阶段规则偏好训练,提升了示例驱动数学推理能力且未降低通用推理水平。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00938 2026-08-31 cs.LG 版本更新 77%

Large Reasoning Models Learn Better Alignment from Flawed Thinking

大规模推理模型通过 flawed thinking 学习更好的对齐

ShengYun Peng, Pin-Yu Chen, Eric Smith, Song Jiang, Hongyuan Zhan, Haozhu Wang, Mahesh Pasupuleti, Duen Horng Chau, Jianfeng Chi

机构 * Meta Superintelligence Labs(Meta超级智能实验室) IBM Research(IBM研究院)

专题命中 推理与问题求解 :RLHF(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 RECAP通过强化学习提升模型安全对齐能力,减少偏见并增强鲁棒性,同时保持推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19151 2026-08-31 cs.AI cs.MA 版本更新 77%

Multimodal Collaborative Debate for Zero-Shot Time Series Reasoning

TS-Debate:多模态协作辩论用于零样本时间序列推理

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST Seoul(韩国科学技术院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。

Comments EMNLP 2026 (Main), Project Page: this https URL (https://deepauto-ai.github.io/ts-debate/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18603 2026-08-31 cs.AI cs.CV 版本更新 77%

Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning

Doc-CoB:通过视觉链式框推理增强文档理解

Ye Mo, Kai Ye, Xianwei Mao, Zirui Shao, Gang Huang, Bo Zhang, Hangdi Xing, Kehan Chen, Huan Zhou, Zixu Yan, Jiajun Bu, Sheng Zhou

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可感知与智能系统重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出Doc-CoB框架,通过粗到细的布局感知视觉推理,结合多模态大语言模型,逐步聚焦查询相关布局区域,提升文档理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28437 2026-08-31 eess.SY cs.RO 新提交 75%

LUCID: An Agentic AI Framework on Digital-Twin in the Loop for QoS-Guaranteeing Robotic Control

LUCID:一种用于QoS保障机器人控制的闭环数字孪生智能体AI框架

Hyeonsu Lyu, Minwoo Kim, Sehyun Ryu, Hyun Jong Yang

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 LUCID是一种LLM智能体编排的云机器人框架,将TP-RRM动态编排于DITL环境,结合路径规划与RRM验证器,可适应动态条件并降低规划延迟,保障机器人控制的QoS。

Comments 10 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28018 2026-08-31 cs.CL cs.AI cs.LG 新提交 75%

Twin Worlds: Equivariance-Based Abstention for Evidence-Grounded Reasoning

双世界:基于等变性的证据型推理弃权(不执行)方法

Vy Nguyen, Ziqi Xu, Jeffrey Chan, Estrid He, Feng Xia, Renqiang Luo, Erik Cambria, Xiuzhen Zhang

机构 * RMIT University(皇家墨尔本理工大学) Jilin University(吉林大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出双世界框架,通过等变性弃权提升大语言模型知识密集型推理的可靠性,在四个基准和三个模型主干上优于基线方法,可识别答案未可靠基于证据的情况。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08577 2026-08-31 cs.CL cs.AI cs.LG cs.PF 版本更新 75%

Think-at-Hard: Dynamic Looped Transformers for Improved Reasoning

Think-at-Hard: 选择性潜在迭代以改进推理语言模型

Tianyu Fu, Yichen You, Zekai Chen, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对循环变压器中潜在过思考问题,提出Think-at-Hard方法,通过轻量级决策器选择性地在困难令牌上触发潜在迭代,并采用深度感知LoRA和双因果注意力机制,在数学、问答和编码任务上一致提升性能。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01113 2026-08-31 cs.RO 版本更新 75%

From Dialogue to Execution: Mixture-of-Agents Assisted Interactive Planning for Behavior Tree-Based Long-Horizon Robot Execution

从对话到执行:基于混合代理的交互式规划用于基于行为树的长时域机器人执行

Kanata Suzuki, Kazuki Hori, Haruka Miyoshi, Shuhei Kurita, Tetsuya Ogata

机构 * Waseda University(早稻田大学) National Institute of Informatics(国家信息研究所) NII Research and Development Center for Large Language Models(国家信息研究所大型语言模型研究开发中心) The Graduate University for Advanced Studies (SOKENDAI)(高级研究大学研究生院(SOKENDAI))

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出基于混合代理的交互式规划框架,通过生成行为树实现长时域机器人任务的高效执行,减少人类干预并提升执行质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28300 2026-08-31 cs.RO cs.AI 新提交 74%

MaCoPlanner: LLM-Assisted Manual-Compiled Task Planning with Proactive Safety Verification for Robotic Industrial Panel Operation

MaCoPlanner:面向机器人工业面板操作的、结合主动安全验证的大语言模型辅助人工编译任务规划

Guipeng Xin, Jiahe Xua, Mohammad Deghat, Chenhui Wan, Jie Liu, Youmin Hu, Zhongxu Hu

机构 * Huazhong University of Science and Technology(华中科技大学) University of New South Wales(新南威尔士大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.AI

AI总结 MaCoPlanner是面向机器人工业面板操作的规划框架,通过编译设备手册知识生成规划,经主动安全验证后执行,大幅提升了任务成功率,在Level-2、Level-3任务上分别提升了21.6、17.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27963 2026-08-31 cs.AI 新提交 74%

SABER: Stability-Aware Early Exit for LLM Reasoning via Adversarial Branch Probing

SABER:基于对抗分支探测的大语言模型推理稳定性感知早停方法

Wanli Cheng, Haiya Xiang, Juntao Li, Hongling Wang, Wenliang Chen

机构 * Soochow University(苏州大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.AI

AI总结 SABER是一种无需训练的大语言模型推理早停框架,通过对抗分支探测平衡推理效率与可靠性,可平均减少30.2%-39.8%的推理token消耗且保持相当准确率。

Comments 20 pages,10 figures,EMNLP 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27462 2026-08-31 cs.CL cs.AI 新提交 73%

Sledgehammer or Scalpel? A Fine-grained Adaptive Framework for Implicit Hate Speech

大锤还是手术刀?用于隐性仇恨言论检测的细粒度自适应框架

Han Wang, Yuhu Cheng, Xuesong Wang, Yi Zhu

机构 * School of Information and Control Engineering, China University of Mining and Technology(中国矿业大学信息与控制工程学院) Yangzhou University(扬州大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对隐性仇恨言论检测中现有方法推理流程单一、计算冗余的问题,提出FAID框架,先细粒度分类再自适应处理不同类型样本,在四个基准数据集上显著优于SOTA基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26086 2026-08-31 cs.LG cs.AI 版本更新 73%

TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development

TraceML:机器学习开发中人类-智能体规划的实证分析

Jiarui Yan, Weiwei Sun, Sijie Li, Wenhan Li, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 TraceML通过构建人类与智能体在Kaggle竞赛中的配对轨迹数据集,实证分析了人类与智能体在机器学习开发规划上的差异,发现智能体存在行为循环问题,提炼的人类规划提示可缩小部分差距。

详情

展开后加载摘要…

URL PDF HTML 收藏