arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-02 至 2026-02-02 共收录 121 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2505.08140 2026-02-02 cs.AI cs.FL cs.LG 73%

Lost in Transmission: When and Why LLMs Fail to Reason Globally

在传输中迷失:当且为什么大语言模型无法全球推理

Tobias Schnabel, Kiran Tomlinson, Adith Swaminathan, Jennifer Neville

专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究指出大语言模型在处理需要高带宽通信的任务时存在能力限制,并通过BAPO模型证明了链式思维能将复杂问题简化为易处理形式。

Comments 39 pages; NeurIPS 2025, spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10543 2026-02-02 cs.AI cs.CL 62%

Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing

通过解码过程中的安全意识探测防御大型语言模型的劫持攻击

Yinzhi Zhao, Ming Wang, Shi Feng, Xiaocui Yang, Daling Wang, Yifei Zhang

机构 * Northeastern University, China(东北大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 通过在解码过程中激活内在安全意识,提升大型语言模型对劫持攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22885 2026-02-02 cs.CL 57%

Leveraging LLMs For Turkish Skill Extraction

利用LLMs进行土耳其语技能提取

Ezgi Arslan İltüzer, Özgür Anıl Özlü, Vahid Farajijobehdar, Gülşen Eryiğit

机构 * Kariyer.net, R&D Center(Kariyer.net 研发中心) Istanbul Technical University(伊斯坦布尔技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文利用LLMs提升土耳其语技能提取性能,提出首个土耳其语技能提取数据集,并通过端到端流程实现0.56的性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21558 2026-02-02 cs.CL 57%

ASTRA: Automated Synthesis of agentic Trajectories and Reinforcement Arenas

ASTRA: 自动化合成代理轨迹与强化环境

Xiaoyu Tian, Haotian Wang, Shuaiting Chen, Hao Zhou, Kaichi Yu, Yudian Zhang, Jade Ouyang, Junxi Yin, Jiong Chen, Baoyan Guo, Lei Zhang, Junjie Tao, Yuansheng Song, Ming Cui, Chengwei Liu

机构 * Beike Language and Intelligence(北溪语言与智能)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 ASTRA通过可扩展数据合成和可验证强化学习,自动化训练工具增强语言模型代理,实现多轮稳定学习和高性能工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13926 2026-02-02 cs.CL 57%

BioMedSearch: A Multi-Source Biomedical Retrieval Framework Based on LLMs

BioMedSearch: 基于LLMs的多源生物医学检索框架

Congying Liu, Xingyuan Wei, Peipei Liu, Yiqing Shen, Yanxu Mao, Tiehan Cui

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Johns Hopkins University(约翰霍普金斯大学) Henan University(河南大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 BioMedSearch基于LLMs构建多源生物医学检索框架,通过整合文献、蛋白质数据库和网络搜索,提升复杂生物医学问题的准确回答能力。

Journal ref Proceedings of the IEEE International Conference on Bioinformatics and Biomedicine (BIBM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08613 2026-02-02 cs.CL 57%

GraphGhost: Tracing Structures Behind Large Language Models

GraphGhost: 探索大型语言模型背后的结构

Xinnan Dai, Xianxuan Long, Chung-Hsiang Lo, Kai Guo, Shenglai Zeng, Dongsheng Luo, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Northeastern University(东北大学) Florida International University(佛罗里达国际大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 GraphGhost通过图分析揭示大型语言模型内部结构,捕捉推理过程中的关键节点与信息流,为理解模型决策提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 34 篇

2601.22790 2026-02-02 cs.AI math.ST stat.TH 83%

Conditional Performance Guarantee for Large Reasoning Models

基于条件的大型推理模型性能保证

Jianguo Huang, Hao Zeng, Bingyi Jing, Hongxin Wei, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学) Southern University of Science(南方科技大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出G-PAC和C-PAC推理框架,通过分组策略实现组条件风险控制,提升异质环境下推理效率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15612 2026-02-02 cs.SD eess.AS 82%

Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition

在鸡尾酒派对中思考:用于目标说话人自动语音识别的链式思维和强化学习

Yiru Zhang, Hang Su, Lichun Fan, Zhenbo Luo, Jian Luan

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) MiLM Plus, Xiaomi Inc., China(MiLM Plus,小米公司,中国)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract)

AI总结 本文提出结合链式思维和强化学习的新型框架,提升目标说话人自动语音识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06822 2026-02-02 cs.AI cs.CL 81%

RAFFLES: Reasoning-based Attribution of Faults for LLM Systems

基于推理的LLM系统故障归因

Chenyang Zhu, Spencer Hong, Jingyu Wu, Kushal Chawla, Charlotte Tang, Youbing Yin, Nathan Wolfe, Erin Babinsky, Daben Liu

机构 * Capital One

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RAFFLES通过整合迭代推理的离线评估架构,实现了对LLM系统中步骤级故障的自动化检测,显著提高了故障识别的准确率。

Comments Accepted at EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22742 2026-02-02 cs.CL 79%

AR-BENCH: Benchmarking Legal Reasoning with Judgment Error Detection, Classification and Correction

AR-BENCH:通过判决错误检测、分类和纠正进行法律推理基准测试

Yifei Li, Richong Zhang, Wanyu Tu, Zhijie Nie, Haokun Luo, Chuantao Yin, Pengchong Li

机构 * SKLCCSE Beihang University(北京航空航天大学软件学院) SCCE University of Science and Technology Beijing(北京科技大学计算机学院) Sino-French Engineer School Beihang University(北京航空航天大学中法工程师学院) People’s Procuratorate of Beijing Municipality(北京市人民检察院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 AR-BENCH通过构建基准数据集和评估14个大语言模型,揭示现有模型在法律判决错误识别上的局限性,旨在提升法律推理的诊断能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22735 2026-02-02 cs.CL 79%

MM-THEBench: Do Reasoning MLLMs Think Reasonably?

MM-THEBench: 多模态大语言模型是否能合理推理?

Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

机构 * KIRC, Institute for Artificial Intelligence, Tsinghua University, China(KIRC人工智能研究院,清华大学,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MM-THEBench旨在评估推理MLLMs在中间推理过程中的幻觉问题,通过细粒度分类和多层次评估框架,揭示思考对多模态任务中幻觉和推理能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21937 2026-02-02 cs.AI 79%

Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities

检索增强推理沙盒:一种解耦检索与推理能力的基准

Shuangshuang Ying, Zheyu Wang, Yunjian Peng, Jin Chen, Yuhao Wu, Hongbin Lin, Dingyu He, Siyi Liu, Gengchen Yu, YinZhu Piao, Yuchen Wu, Xin Gui, Zhongyuan Peng, Xin Li, Xeron Du, Libo Qin, YiXin Cao, Ge Zhang, Stephen Huang

机构 * Full author list in Contributions(完整作者列表)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DeR2通过解耦检索与推理能力,提供了一种评估大语言模型处理新颖科学信息能力的基准测试方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10909 2026-02-02 cs.AI 79%

PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature

PaperArena: 一个用于科学文献上工具增强代理推理的评估基准

Daoyu Wang, Mingyue Cheng, Shuo Yu, Zirui Liu, Ze Guo, Xin Li, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PaperArena提出一个评估基准,用于评估基于LLM的代理在跨多篇论文整合信息并使用外部工具进行推理的能力,实验显示现有代理在复杂任务上的表现有限。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22959 2026-02-02 cs.CV 78%

Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models

Triage: 分层视觉预算机制用于视觉语言模型中的高效视频推理

Anmin Wang, Nan Zhang, Wei Tao, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 Triage通过分层视觉预算机制优化视频推理,提升效率并保持性能。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22269 2026-02-02 cs.AI cs.CL cs.LG 75%

JAF: Judge Agent Forest

JAF:裁判代理森林

Sahil Garg, Brad Cheezum, Sridhar Dutta, Vishal Agarwal

机构 * Averlon

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 JAF通过裁判代理森林框架,利用联合推理和集合学习原理,提升主代理的自我改进能力,通过高效的哈希算法优化多样示例选择,改进推理路径探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19299 2026-02-02 cs.AI 74%

Helios: A Foundational Language Model for Smart Energy Knowledge Reasoning and Application

Helios:一种面向智能能源知识推理与应用的基础语言模型

Haoyu Jiang, Fanjie Zeng, Boan Qu, Xiaojie Lin, Wei Zhong

机构 * College of Energy Engineering, Zhejiang University(浙江大学能源工程学院) Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海研究院)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 Helios是一种专为智能能源领域设计的基础语言模型,通过构建多智能体协作框架和相关数据集,提升领域知识、任务执行准确性和与人类偏好的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21422 2026-02-02 cs.CL 74%

Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework

自动评审员无法检测研究论文中的错误推理:一种新的反事实评估框架

Nils Dycke, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and National Research Center for Applied Cybersecurity(UKP实验室、计算机科学系和应用网络安全国家研究中心)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文提出一种反事实评估框架,揭示自动评审系统在检测研究论文中逻辑错误方面的不足,并提出未来研究建议。

Comments accepted to TACL 2026 (presented at EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22930 2026-02-02 cs.RO cs.AI cs.LG 73%

MTDrive: Multi-turn Interactive Reinforcement Learning for Autonomous Driving

MTDrive: 多轮交互式强化学习用于自动驾驶

Xidong Li, Mingyu Guo, Chenchao Xu, Bailin Li, Wenjing Zhu, Yangang Zou, Rui Chen, Zehuan Wang

机构 * Li Auto Inc.(利汽车公司) NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 MTDrive通过多轮交互式强化学习框架,结合多模态大语言模型与强化学习,提升自动驾驶轨迹规划的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22162 2026-02-02 q-fin.GN cs.AI cs.CL 73%

UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos

UniFinEval: 向跨文本、图像和视频的金融多模态模型统一评估迈进

Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin Guo, Rongjunchen Zhang, Liwen Zhang

机构 * SUFE(上海财经大学) Tencent(腾讯) Gatech(佐治亚理工学院) HiThink Research(慧图研究)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 UniFinEval提出首个统一多模态基准,用于评估金融领域高信息密度下的多模态模型能力,通过五个真实金融场景和大规模数据集验证模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13524 2026-02-02 cs.CL 70%

OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models

OMGEval: 一种开放的多语言生成评估基准用于大型语言模型

Yang Liu, Meng Xu, Shuo Wang, Liner Yang, Haoyu Wang, Zhenghao Liu, Cunliang Kong, Yun Chen, Yang Liu, Maosong Sun, Erhong Yang

机构 * Beijing Language and Culture University(北京语言大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Northeastern University(东北大学) Shanghai University of Finance and Economics(上海金融学院)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 OMGEval是一个开放的多语言生成评估基准,通过提供多种语言的开放性问题,评估大型语言模型在不同文化背景下的能力,旨在提升多语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22889 2026-02-02 cs.CL cs.AI cs.LG cs.SD 67%

DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion

DiffuSpeech: 通过统一的语音-文本扩散实现无声思考, spoken 答案

Yuxuan Lou, Ziming Wu, Yaochen Wang, Yong Liu, Yingxuan Ren, Fuming Lai, Shaobing Lian, Jie Tang, Yang You

机构 * National University of Singapore(新加坡国立大学) Tencent(腾讯)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DiffuSpeech通过统一的语音-文本扩散模型,实现语音生成的同时生成内部推理,提升语音问答的准确性和语音质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17687 2026-02-02 cs.LG cs.AI 62%

Agentic reinforcement learning empowers next-generation chemical language models for molecular design and synthesis

代理强化学习赋能下一代化学语言模型用于分子设计与合成

Hao Li, He Cao, Shenyao Peng, Zijing Liu, Bin Feng, Yu Wang, Zhiyuan Yan, Yonghong Tian, Yu Li, Li Yuan

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Shenzhen Graduate School, Shenzhen, 518055, China(深圳研究生院,深圳,518055,中国) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) Peng Cheng Laboratory, Shenzhen, 518000, China(鹏城实验室,深圳,518000,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ChemCRAFT通过代理强化学习实现化学语言模型的高效分子设计与合成,突破传统模型在成本与隐私间的限制。

Comments Working in Progress, 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11854 2026-02-02 cs.CL cs.AI cs.MA 62%

ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems

ATOD: 一种用于代理任务导向对话系统的评估框架和基准

Yifei Zhang, Hooshang Nayyeri, Rinat Khaziev, Emine Yilmaz, Gokhan Tur, Dilek Hakkani-Tür, Hari Thadakamalla

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ATOD提出了一种评估框架和基准,用于评估代理任务导向对话系统的多目标协调、依赖管理、记忆、适应性和主动性等能力,并通过ATOD-Eval实现了细粒度指标评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22714 2026-02-02 cs.LG cs.AI cs.CV 62%

Vision-Language Models Unlock Task-Centric Latent Actions

视觉-语言模型解锁任务导向的潜在动作

Alexander Nikulin, Ilya Zisman, Albina Klepach, Denis Tarasov, Alexander Derevyagin, Andrei Polubarov, Lyubaykin Nikita, Vladislav Kurenkov

机构 * Innopolis University(因诺波利斯大学) Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究所以及ISP俄罗斯科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用视觉-语言模型的常识推理能力,通过可提示的表示分离可控变化与噪声,提升潜在动作质量,从而提高下游任务性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22690 2026-02-02 cs.LG cs.AI 62%

Do Transformers Have the Ability for Periodicity Generalization?

Transformer 是否具备周期性泛化能力?

Huanyu Liu, Ge Li, Yihong Dong, Sihan Wu, Peixu Wang, Sihao Cheng, Taozhi Chen, Kechi Zhang, Hao Zhu, Tongxuan Liu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了 Transformer 在周期性泛化方面的局限性,通过引入抽象代数和推理视角,揭示了模型在处理复合周期性任务时的不足,并提出了可控生成基准 Coper。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02295 2026-02-02 cs.CV cs.AI cs.LG 62%

VideoNSA: Native Sparse Attention Scales Video Understanding

VideoNSA:原生稀疏注意力扩展视频理解

Enxin Song, Wenhao Chai, Shusheng Yang, Ethan Armand, Xiaojun Shan, Haiyang Xu, Jianwen Xie, Zhuowen Tu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 VideoNSA通过端到端训练提升视频理解,结合原生稀疏注意力实现长视频和时间推理的性能优化

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22911 2026-02-02 cs.CL cs.AI 62%

ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Marketing

ElectriQ:一个评估大型语言模型在电力营销中响应能力的基准

Jinzhi Wang, Qingke Peng, Haozhou Li, Zeyuan Zeng, Jiangbo Zhang, Kaixuan Yang, Ningyong Wu, Qinfeng Song, Ruimeng Li, Biyi Zhou

机构 * Systems Engineering Institute, Xi’an Jiaotong University(系统工程研究所,西安交通大学) State Key Laboratory of Multiphase Flow in Power Engineering, School of Energy and Power Engineering, Xi’an Jiaotong University(电力工程多相流国家重点实验室,能源与动力工程学院,西安交通大学) School of Electronic Science and Engineering, Xi'an Jiaotong University(电子科学与工程学院,西安交通大学) Organizational Management Department, School of Management, Xi’an Jiaotong University(组织管理部,管理学院,西安交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ElectriQ是一个用于评估大型语言模型在电力营销中响应能力的基准,通过结合人类评分、自动指标和合规测试,提出SEEK-RAG方法提升领域知识注入,实现高效且合规的电力营销助手部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23183 2026-02-02 cs.CL 57%

JobResQA: A Benchmark for LLM Machine Reading Comprehension on Multilingual Résumés and JDs

JobResQA:一个用于多语言简历和职位描述的LLM机器阅读理解基准

Casimiro Pio Carrino, Paula Estrella, Rabih Zbib, Carlos Escolano, José A. R. Fonollosa

机构 * Avature Machine Learning(Avature 机器学习) Universitat Politècnica de Catalunya(巴塞罗那理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 JobResQA是一个用于评估LLM在多语言简历和职位描述上的机器阅读理解能力的基准,揭示了多语言MRC在人力资源应用中的关键差距。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23058 2026-02-02 cs.LG 57%

From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning

从绝对到相对:重新思考基于群体的强化学习中的奖励塑造

Wenzhe Niu, Wei He, Zongxia Xie, Jinpeng Ou, Huichuan Fan, Yuchen Ge, Yanru Sun, Ziyin Wang, Yizhao Sun, Chengshun Shi, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Tianjin University(天津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出RLRR框架,通过将奖励塑造从绝对评分转为相对排名,解决群体强化学习中奖励稳定性与监督稀疏性问题,并在推理和生成任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20730 2026-02-02 cs.CL 57%

AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts

AgentLongBench: 通过环境回放构建可控的长上下文代理基准

Shicheng Fang, Yuxin Wang, Xiaoran Liu, Jiahao Lu, Chuanyuan Tan, Xinchi Chen, Yining Zheng, Xuanjing Huang, Xipeng Qiu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 AgentLongBench通过模拟环境回放评估代理在长上下文任务中的表现,揭示代理在动态信息综合方面的不足。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏