arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-26 至 2026-08-26 共收录 133 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 36 篇

2608.24439 2026-08-26 cs.CV 新提交 78%

DoublesEval: Diagnosing Multi-Agent Tactical Reasoning in Vision-Language Models via Professional Doubles Badminton

DoublesEval:通过专业双打羽毛球诊断视觉语言模型的多智能体战术推理能力

Jintao Cheng, Weibin Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of Macau(澳门大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本研究提出DoublesEval框架,以专业双打羽毛球为测试平台评估VLMs的多智能体战术推理能力,发现现有模型存在明显瓶颈,所提TacticCheck可提升模型表现但仍有差距,强调需改进VLMs的评估范式。

Comments Accepted by BMVC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13394 2026-08-26 cs.CV 版本更新 78%

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

空间-DisE:评估视觉语言模型空间推理能力的统一基准

Xinmiao Huang, Qisong He, Zhenglin Huang, Boxuan Wang, Zhuoyun Li, Guangliang Cheng, Yi Dong, Xiaowei Huang

机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。

Comments ICLR 2026 Accepted Project Page: this https URL (https://shinmohuang.github.io/spatialdise_page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24534 2026-08-26 cs.AI 新提交 70%

Neurosymbolic Alignment for Physiologically-Safe Clinical Language Models

面向生理安全临床语言模型的神经符号对齐

Abdulhady Abas Abdullah, Erik Cambria, Milena Zivkovic

机构 * University of Kurdistan Hewlêr(库尔德斯坦大学) Nanyang Technological University(南洋理工大学) Massachusetts Institute of Technology(麻省理工学院) University of Kragujevac(克拉古耶瓦茨大学)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 提出神经符号对齐框架,耦合临床LLM与HGNN生理世界模型,在CSB基准上显著提升临床LLM的生理安全性能,优于ORPO、GPT-4等方法,为临床LLM安全对齐提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07737 2026-08-26 cs.CV cs.AI 版本更新 70%

Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes

看见 vs. 相信:评估开源多模态大模型在反直觉场景中的语言偏见

Chen Ling, Tongwei Zhang, Hanqian Li, Nai Ding

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 为评估多模态大模型处理反直觉动作场景的能力,提出CAIT基准(400个高保真合成场景),发现开源模型因语言先验而忽视视觉证据,性能接近随机水平,而链式思维推理虽提升准确率但导致过度思考拒绝视觉内容,通过微调和结构化提示可缓解此偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24696 2026-08-26 cs.LG cs.AI 新提交 62%

On-policy Distillation with Verifiable Reward

结合可验证奖励的在线蒸馏

Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang, Bingxiang He, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学LeapLab) Beihang University(北京航空航天大学) SMS, Peking University(北京大学SMS) NLPLab, Tsinghua University(清华大学NLPLab)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出OPDVR方法,无缝结合OPD与RLVR且不增加超参数,经六个推理基准实验验证其性能优于标准OPD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24350 2026-08-26 cs.CL cs.AI 新提交 62%

FARCA: Fact-Aligned Reliability-Aware Credit Assignment for Reinforcement Learning with Factual Supervision

FARCA:面向具备事实监督的强化学习的事实对齐可靠性感知信用分配

Qiming Xie, Wenjie Zheng, Xiangqing Shen, Rui Xia

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 FARCA是一种面向具备事实监督的强化学习的策略优化框架,通过对齐事实验证与策略更新的粒度、引入反事实证据归因计算可靠性权重,提升模型事实性并保留通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02041 2026-08-26 cs.CL cs.AI 版本更新 62%

EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training

EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力

Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts

机构 * Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院) Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系) Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院) School of Humanities, Tallinn University(塔林大学人文学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EstLLM通过持续预训练和后训练提升多语言大语言模型中爱沙尼亚的能力,增强语言和推理表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24615 2026-08-26 cs.CL 新提交 57%

Quantization Effects on Bangla Language Understanding in Large Language Models: A Systematic Evaluation

量化对大型语言模型孟加拉语理解能力的影响:一项系统评估

Ismail Hossain, Nafi Ullah Shafin, Mohammad Abdullah Al Mumin

机构 * Institute of Information and Communication Technology (IICT)(信息与通信技术研究所) Shahjalal University of Science and Technology (SUST)(沙赫贾拉勒科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究首次系统评估了三种量化格式对Qwen-2.5-7B等三个模型家族在五个孟加拉语NLU基准上的影响,发现架构和量化方法比位宽更关键,量化可用于孟加拉语部署。

Comments 8 pages, 1 table, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24570 2026-08-26 cs.AI 新提交 57%

EviDx: Evidence-Aware Active Diagnosis with Scaffolded LLM Agents

Lihang Zeng, Shaoting Zhang, Xiaofan Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24509 2026-08-26 cs.AI cs.SE 新提交 57%

PeakBench: Benchmarking Resource-Aware Tool Invocation in LLM Agents

PeakBench:面向大语言模型智能体的资源感知工具调用基准测试

Zhi-Kai Chen, Xu-Xiang Zhong, Song-Yan Li, De-Chuan Zhan, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Nanjing University(南京大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 PeakBench是面向LLM智能体的资源感知工具调用基准,通过两部分评估框架解耦逻辑规划与物理调度,实验表明资源信息可减少溢出、提升利用率,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24314 2026-08-26 cs.AI cs.ET 新提交 57%

Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

用于语音智能体评估的LLM评判基准:可靠性、校准与人工监督

Anupam Purwar, Shashank Singh, Kritika Srivastava

机构 * Sprinklr AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究对比人工与GPT-4.1、GPT-5对电信和零售语音智能体对话的评估,发现LLM评估可靠性依赖指标与配置,可作为规模化评估组成部分,支持混合评估 pipeline。

Comments Extends LLM-as-a-Judge to voice agents across telecom and retail, testing GPT-4.1 and GPT-5 against human raters across 10 safety and efficiency metrics. A correlation-based calibration analysis reveals domain-dependent reliability and identifies Recovery Turn Count and safety-recall metrics as unreliable for fully automated judging

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24231 2026-08-26 cs.CL 新提交 57%

RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges

RecurSE:面向LLM规则评判器的有界递归自评估

Kaiyuan Liu, Ziyuan Zhuang, Rongxiang Weng, Jieping Ye

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Meituan LongCat Team(美团龙猫团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出RecurSE,一种无需外部监督的LLM规则评判器优化方法,通过同步评判器与检查器的协同演化、接口解耦及PAV监控,在多基准上实现泛化提升,可增强下游策略对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24145 2026-08-26 cs.CL cs.SE 新提交 57%

TrustDABench: Benchmarking Reliability and Robustness of LLMs for Structured Data Analysis

TrustDABench:面向结构化数据分析的大语言模型可靠性与鲁棒性基准

Boshen Shi, Yize Liu, Chen Zhao, Ce Chi, Zhendong Wang, Xing Wang, Junlan Feng

机构 * Jiutian(九天)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出TrustDABench基准,评估8种LLM在结构化数据分析中的可靠性与鲁棒性,发现现有模型在检测冲突证据、应对扰动等方面存在不足,需提升证据边界识别与不变性推理能力。

Comments Code&Data: this https URL (https://github.com/Skyorca/TrustDABench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24099 2026-08-26 cs.AI 新提交 57%

Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments

Android GUI智能体对运行时异常是否具备鲁棒性?AnTrap:在动态对抗环境中评估智能体

Guo Gan, Yilun Zhao, Cong Chen, Jinbiao Wei, Tingyu Song, Zheyuan Yang, Lin Fu, Hong Zhou

机构 * Zhejiang University(浙江大学) Yale University(耶鲁大学) University of Chinese Academy of Sciences(中国科学院大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对Android GUI智能体抗运行时异常鲁棒性不足的问题,提出AnTrap基准评估框架,发现16款领先GUI模型普遍受动态异常影响,且深度上下文陷阱暴露模型内在局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23978 2026-08-26 cs.AI cs.CV 新提交 57%

When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

当视觉不再足够:评估大视觉语言模型(LVLMs)中的交互式视觉定位

Zhengxiang Wang, Owen Rambow

机构 * Stony Brook University(石溪大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文针对大视觉语言模型(LVLMs)提出交互式视觉定位的受控评估框架,发现当前LVLMs表现低于人类基线,主动提问式定位困难且校准不佳,该任务仍具挑战性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23783 2026-08-26 cs.CL 新提交 57%

Inter-dimension Dependence for Multi-Dimensional Evaluation of Open-Ended Text

面向开放文本多维度评估的维度间依赖关系

Haoyuan Li, Snigdha Chaturvedi

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理评测 :CoT(abstract_cn);分类 cs.CL

AI总结 本文针对开放文本多维度评估中LLM评判者的维度间依赖问题,提出CorrGap度量该依赖关系,进而提出DimCheck方法缓解该问题,在多任务多模型上优于基线且推理成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23758 2026-08-26 cs.SD cs.AI 新提交 57%

EXAM$^2$: $\underline{Ex}tending$ $\underline{A}udio$ $Understanding$ $in$ $\underline{M}ultilingual$ $and$ $\underline{M}ultimodal$ $Analysis$

EXAM²:扩展多语言与多模态分析中的音频理解能力

Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多语言多模态音频理解基准EXAM²,评估现有模型发现其存在多语言跨模态理解差距,微调的Gemma3n-EXAM²性能显著提升,推动相关研究发展。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23986 2026-08-26 math.OC cs.AI cs.PF 新提交 57%

The Shadow Price of Intelligence: Quality Degradation in LLM Inference as a Supply Chain Problem

智能的影子价格:作为供应链问题的大语言模型推理质量退化

Elioth Sanabria

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文将LLM推理质量退化视为供应链问题,建模拥塞下的服务分配,揭示节流的反直觉影响,提出影子价格可毫秒级计算最优策略,证明拥塞时节流是需求杠杆而非成本杠杆。

Comments 40 pages, 12 figures. Numerical instances calibrated to public benchmark data for five LLM providers

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11239 2026-08-26 cs.LG 版本更新 57%

Massive-STEPS: Massive Semantic Trajectories for Understanding POI Check-ins -- Dataset and Benchmarks

Massive-STEPS: 用于理解POI签到的大量语义轨迹 -- 数据集和基准测试

Wilson Wongso, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 Massive-STEPS通过提供大规模、公开的POI签到数据集和基准测试,推动人类移动性和POI轨迹建模的可重复研究。

Comments Accepted to SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08626 2026-08-26 cs.CL 版本更新 57%

How Order-Sensitive Are LLMs? OrderProbe for Deterministic Structural Reconstruction

大语言模型对顺序敏感性如何?OrderProbe用于确定性结构重建

Zhaolu Kang, Yingjie He, Kehan Jiang, Leqi Zheng, Jiachen Qian, Qianyuan Zhang, Chunlei Meng, Yujie Feng, Yuan Wang, Stephen Dou, Aming Wu, Pengxiang Zhao, Jiaxin Liu, Guansu Wang, Zeyu Zhang, Lei Wang, Qishi Zhan, Xiaomin He, Meisheng Zhang, Jianyuan Ni, Richeng Xuan

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong(香港城市大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Marquette University(马凯特大学) Juniata College(朱尼阿特学院)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 研究通过OrderProbe基准评估大语言模型对输入顺序的敏感性,发现即使在前沿模型上,结构重建仍面临挑战,且语义能力与结构鲁棒性存在脱节。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24269 2026-08-26 cs.SE cs.CR 新提交 50%

Towards LLM-Enhanced Android Taint Analysis

面向大语言模型增强的Android污点分析

Nicholas Miazzo, Marco Alecci, Jordan Samhi, Jacques Klein, Eleonora Losiouk

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探究商用LLM能否有效推理Android应用的污点流,提出智能体交互策略,在DroidBench基准上Gemini-3 Flash的F1分数达0.96(优于FlowDroid的0.55),还能识别真实应用中FlowDroid未发现的潜在数据泄露,可补充传统静态污点分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23974 2026-08-26 cs.CV cs.MM 新提交 50%

Boot-and-Feedback Framework for Generalist-Expert Model Collaboration in Breast Ultrasound Diagnosis

用于乳腺超声诊断的通才-专家模型协作的引导与反馈框架

Ming Cheng, Hongyu Sun, Zhaolin Chen, Jun Liu, Hossein Rahmani, Qiuhong Ke

机构 * Monash University(莫纳什大学) Renmin University of China(中国人民大学) Lancaster University(兰卡斯特大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对乳腺超声诊断中深度学习的可靠性与可解释性难题,提出BooF框架实现MLLM与专家模型协作,经多数据集验证其性能优于现有最优方法。

Comments 5 pages, 2 figures. Published in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23785 2026-08-26 cs.CR 新提交 50%

A Scenario-Based Evaluation of CRQC+AI Vulnerability Spectrum for TLS 1.3 Cryptographic Dependencies

针对TLS 1.3密码依赖项的CRQC+AI漏洞谱的基于场景的评估

Noel Grover, Mussie Haile, Brad Pedersen, Eric Uner, Bradley J Erickson

专题命中 推理评测 :reasoning(abstract)

AI总结 本文基于四场景能力模型评估TLS 1.3密码依赖项的CRQC+AI漏洞谱,明确NIST算法未被破解,提出PQC迁移强制要求及相关补充措施。

Comments 23 figures, 68 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00468 2026-08-26 cs.SE 版本更新 50%

Cloud-OpsBench: A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems

Cloud-OpsBench: 一种可重现的云系统代理根本原因分析基准

Yilun Wang, Guangba Yu, Haiyu Huang, Yujie Huang, Zirui Wang, Pengfei Chen, Michael R. Lyu

专题命中 推理评测 :reasoning(abstract)

AI总结 Cloud-OpsBench 是一个用于云系统代理根本原因分析的可重现基准,通过构建确定性数字孪生,提供数据引擎、强化学习环境和诊断标准,支持下一代SRE研究。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19001 2026-08-26 cs.CV 版本更新 50%

Life-Bench: A Benchmark and Knowledge Graph Framework for Multimodal Personalization Beyond Concept Recognition

一个用于高级多模态个性化研究的基准和知识引导框架

Xia Hu, Honglei Zhuang, Brian Potetz, Alireza Fathi, Bo Hu, Babak Samari, Howard Zhou

机构 * Google(谷歌) DeepMind(深Mind)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 18 篇

2608.24790 2026-08-26 cs.AI 新提交 92%

Right Diagnoses, Decorative Reasoning:A Perturbation Audit of Medical Chain-of-Thought

正确诊断,装饰性推理:医学思维链的扰动审计

Mengzhu Xu, Jifan Gao, Xia Jiang, Yaoxin Wu, Xi Long

机构 * Eindhoven University of Technology(埃因霍温理工大学) Dana-Farber Cancer Institute(达纳-法伯癌症研究所)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

AI总结 本研究通过医学扰动审计方法,对14个大语言模型在四个医学问答基准上进行测试,发现医学思维链多为装饰性内容,为医学CoT的忠实性审计提供了可复用标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24574 2026-08-26 cs.AI 新提交 79%

PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos

PhysMLLMs:用于图像与视频的统一指称分割及接地推理的空间先验

Siyao Yan, Bo Han, Jisheng Dang, Bimei Wang, Shude Wang, Hong Peng, Yulan Guo, Jianhuang Lai, Bin Hu, Tat-SengChua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) School of Electronics and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 PhysMLLMs是注入物理启发空间先验的训练架构,通过REPA-Global机制提升视频分割的时空一致性,且不损害图像级接地与通用多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24001 2026-08-26 cs.AI 新提交 79%

Diverse by Reasoning: Harnessing the Wisdom of LLM Crowds for Future Prediction

通过推理实现多样性:利用大语言模型群体的智慧进行未来预测

Nirupam Chetlapalli, Yiming Liao, Min-Chun Chen, Keke Chen

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出感知行为框架构建多样化LLM群体,用K-means++聚类选代表,三模型群体预测性能优于全部25模型的投票,降本提效,凸显群体构成与代表性多样性的重要性。

Comments 13 pages, 4 figures, 5 tables. Submitted to IEEE BigData 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12895 2026-08-26 cs.LG 版本更新 79%

Wait, Wait, Wait... Why Do Reasoning Models Loop?

等等,等等,等等……为什么推理模型会循环?

Charilaos Pipis, Shivam Garg, Vasilis Kontonis, Vaishnavi Shrivastava, Akshay Krishnamurthy, Dimitris Papailiopoulos

机构 * MIT(麻省理工学院) Microsoft Research(微软研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 研究揭示了推理模型循环的原因,指出学习中的错误是关键因素,并提出温度调节和训练干预可减少循环现象。

Comments Published as Spotlight at ICML 2026. Code: this https URL (https://github.com/microsoft/llm-looping)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01597 2026-08-26 cs.LG 版本更新 77%

Learning from the Right Rollouts: Data Attribution for PPO-based LLM Post-Training

从正确的回放中学习:基于PPO的LLM后训练的数据归因

Dong Shu, Denghui Zhang, Jessica Hullman

机构 * Northwestern University(西北大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.LG

AI总结 本文提出Influence-Guided PPO框架,通过计算影响分数筛选反向齐梯度的回放片段,提升PPO后训练效率并减少不忠实的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏