arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-03 至 2026-03-03 共收录 259 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 61 篇

2602.16110 2026-03-03 cs.CV cs.AI 57%

OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis

OmniCT:迈向统一的切片-体积LVLM以实现全面的CT分析

Tianwei Lin, Zhongwei Qiu, Wenqiao Zhang, Jiang Liu, Yihan Xie, Mingjian Gao, Zhenxuan Fan, Zhaocheng Li, Sijing Li, Zhongle Xie, Peng LU, Yueting Zhuang, Ling Zhang, Beng Chin Ooi, Yingda Xia

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云学术院) Hupan Lab(虎派实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OmniCT提出了一种统一的切片-体积LVLM,通过空间一致性增强、器官级语义增强和MedEval-CT数据集,实现了全面的CT分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04388 2026-03-03 cs.LG 57%

Learning to Orchestrate Agents in Natural Language with the Conductor

通过指挥模型学习自然语言中的代理协调

Stefan Nielsen, Edoardo Cetin, Peter Schwendeman, Qi Sun, Jinglue Xu, Yujin Tang

机构 * Sakana AI, Japan(日本Sakana AI公司) University of Michigan, USA(美国密歇根大学) Institute of Science Tokyo, Japan(日本东京科学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出通过强化学习训练指挥模型,实现自然语言中代理的协调,展示其在推理基准测试中的卓越性能。

Comments To appear at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06218 2026-03-03 cs.CV cs.AI 57%

EgoNight: Towards Egocentric Vision Understanding at Night with a Challenging Benchmark

EgoNight: 向夜间视角理解迈进的挑战性基准

Deheng Zhang, Yuqian Fu, Runyi Yang, Yang Miao, Tianwen Qian, Xu Zheng, Guolei Sun, Ajad Chhatkuli, Xuanjing Huang, Yu-Gang Jiang, Luc Van Gool, Danda Pani Paudel

机构 * East China Normal University(东华大学) HKUST(GZ)(香港科技大学(广州)) Nankai University(南开大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EgoNight提出首个夜间视角视觉基准,通过日夜间对齐视频和人工验证构建VQA任务,揭示低光照条件下模型性能下降问题,并引入辅助任务推动模型泛化能力提升。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16395 2026-03-03 cs.CL 57%

OJBench: A Competition Level Code Benchmark For Large Language Models

OJBench: 一个面向大语言模型的竞赛级代码基准

Zhexu Wang, Yiping Liu, Yejie Wang, Wenyang He, Bofei Gao, Muxi Diao, Yanxu Chen, Kelin Fu, Flood Sung, Zhilin Yang, Tianyu Liu, Weiran Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Moonshot AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 OJBench是一个用于评估大语言模型竞赛级代码推理能力的基准,通过232个编程竞赛问题揭示了现有模型在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00960 2026-03-03 cs.CR cs.AI 57%

AWE: Adaptive Agents for Dynamic Web Penetration Testing

AWE:动态网络渗透测试的自适应代理

Akshat Singh Jaswal, Ashish Baghel

机构 * Stux Labs(Stux实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AWE通过内存增强的多代理框架,在动态网络渗透测试中实现高准确性和效率,针对注入类漏洞取得显著成果。

Journal ref Workshop on LLM Assisted Security and Trust Exploration (LAST-X), co-located with NDSS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00938 2026-03-03 cs.CV cs.AI 57%

Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos

超越8位:HDR-UGC视频的主观和客观质量评估

Shreshth Saini, Bowen Chen, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * Laboratory for Image and Video Engineering (LIVE), UT Austin(图像与视频工程实验室(LIVE),得克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HDR-Q,首个针对HDR-UGC视频的多模态大语言模型,通过HDR感知编码器和HAPO框架实现超越8位的高质量视频评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00895 2026-03-03 cs.LG 57%

Evaluating AI Grading on Real-World Handwritten College Mathematics: A Large-Scale Study Toward a Benchmark

评估AI在真实世界中的大学数学手写作业评分:迈向基准的大型研究

Zhiqi Yu, Xingping Liu, Haobin Mao, Mingshuo Liu, Long Chen, Jack Xin, Yifeng Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种基于OCR条件的大语言模型,用于评估真实手写数学作业的AI评分,并建立了一个标准化的基准以支持未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00285 2026-03-03 cs.AI 57%

TraderBench: How Robust Are AI Agents in Adversarial Capital Markets?

TraderBench: AI代理在对抗性资本市场中的鲁棒性如何?

Xiaochuang Yuan, Hui Xu, Silvia Xu, Cui Zou, Jing Xiong

机构 * Amazon.com Inc.(亚马逊公司) Stony Brook University(石溪大学) Stanford University(斯坦福大学) University of Oklahoma(俄克拉荷马大学) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TraderBench通过结合静态任务与对抗性交易模拟,评估AI代理在动态市场中的鲁棒性,发现现有模型在加密交易中表现稳定但缺乏真实适应性。

Comments Equal Contribution: Xiaochuang Yuan and Hui Xu contributed equally to this work. All correspondence should be directed to yxc20098@gmail.com. Submitted to Agents in the Wild Workshop, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12462 2026-03-03 cs.AI cs.CR 57%

Evaluating and Mitigating LLM-as-a-judge Bias in Communication Systems

评估和减轻通信系统中LLM-as-a-judge的偏见

Jiaxin Gao, Chen Chen, Yanwen Jia, Xueluan Gong, Kwok-Yan Lam, Qian Wang

机构 * School of Computer Science and Engineering at Nanyang Technological University(南洋理工大学计算机科学与工程学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络科学与工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了LLM-as-a-judge在通信系统中的偏见问题,分析了不同模型对偏见输入的鲁棒性,并提出四种缓解策略以提高判断的公平性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04080 2026-03-03 cs.CL 57%

PoLi-RL: A Point-to-List Reinforcement Learning Framework for Conditional Semantic Textual Similarity

PoLi-RL: 一种用于条件语义文本相似度的点到列表强化学习框架

Zixin Song, Bowen Zhang, Qian-Wen Zhang, Di Yin, Xing Sun, Chunping Li

机构 * Tsinghua University(清华大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PoLi-RL通过点到列表强化学习框架,解决条件语义文本相似度中的优化难题,实现Spearman相关系数达48.18,为复杂条件判断任务提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18487 2026-03-03 cs.CL 57%

Actions Speak Louder than Prompts: A Large-Scale Study of LLMs for Graph Inference

行动胜于提示:大型语言模型在图推断中的大规模研究

Ben Finkelshtein, Silviu Cucerzan, Sujay Kumar Jauhar, Ryen White

机构 * University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究通过大规模评估揭示LLM在图推断中的表现,发现代码生成在长文本图中表现最佳,异质图上交互策略仍有效,且方法能灵活适应不同输入类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00115 2026-03-03 physics.soc-ph cs.AI cs.CV 57%

Multimodal Modular Chain of Thoughts in Energy Performance Certificate Assessment

多模态模块化思维链在能源性能证书评估中的应用

Zhen Peng, Peter J. Bentley

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于多模态模块化思维链的低成本EPC预评估方法,通过结构化提示实现对EPC评分的序数结构捕捉,实验表明其在数据稀缺环境下具有显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00028 2026-03-03 cs.CL 57%

EPPCMinerBen: A Novel Benchmark for Evaluating Large Language Models on Electronic Patient-Provider Communication via the Patient Portal

EPPCMinerBen:一种用于通过患者门户评估大语言模型在电子患者-提供者沟通中的新基准

Samah Fodeh, Yan Wang, Linhai Ma, Srivani Talakokkul, Jordan M. Alpert, Sarah Schellhorn

机构 * Department of Emergency Medicine, Yale School of Medicine(耶鲁医学院急诊医学部) Cleveland Clinic Lerner College of Medicine of Case Western Reserve University, Cleveland Clinic(克利夫兰医学中心Lerner学院(凯斯西储大学)) Medical Oncology, Yale School of Medicine(耶鲁医学院肿瘤学部)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EPPCMinerBen是一个用于评估大语言模型在电子患者-提供者沟通中表现的新基准,通过患者门户数据验证了大型模型在证据提取和分类任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14176 2026-03-03 cs.DB cs.IR 50%

ReSearch: A Multi-Stage Machine Learning Framework for Earth Science Data Discovery

ReSearch:一种用于地球科学数据发现的多阶段机器学习框架

Youran Sun, Yixin Wen, Haizhao Yang

专题命中 推理评测 :reasoning(abstract)

AI总结 ReSearch通过多阶段推理增强搜索框架,提升地球科学数据检索的召回率和排序性能,支持科学发现的可重复性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01547 2026-03-03 cs.CV 50%

PathMoE: Interpretable Multimodal Interaction Experts for Pediatric Brain Tumor Classification

PathMoE:用于儿童脑肿瘤分类的可解释多模态交互专家

Jian Yu, Joakim Nguyen, Jinrui Fang, Awais Naeem, Zeyuan Cao, Sanjay Krishnan, Nicholas Konz, Tianlong Chen, Chandra Krishnan, Hairong Wang, Edward Castillo, Ying Ding, Ankita Shukla

机构 * University of Texas(德克萨斯大学) Dell Children’s Medical Center(德尔儿童医学中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Nevada, Reno(内华达大学里诺分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 PathMoE通过整合多模态信息提升儿童脑肿瘤分类性能,揭示了不同模态间的交互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01417 2026-03-03 cs.IR 50%

ReFeed: Retrieval Feedback-Guided Dataset Construction for Style-Aware Query Rewriting

ReFeed: 基于检索反馈的领域感知查询重写数据集构建

Jiyoon Myung, Jungki Son, Kyungro Lee, Jihyeon Park, Joohyung Han

专题命中 推理评测 :reasoning(abstract)

AI总结 ReFeed通过检索反馈驱动数据集构建,提升查询重写模型对文档风格的感知能力,改进领域特定场景下的检索效果。

Comments Accepted at the Workshop on New Frontiers in Information Retrieval (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01257 2026-03-03 cs.CR cs.SE 50%

A Systematic Study of LLM-Based Architectures for Automated Patching

对基于大语言模型的自动补丁架构的系统研究

Qingxiao Xu, Ze Sheng, Zhicheng Chen, Jeff Huang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文系统研究了基于LLM的自动补丁架构,通过统一基准评估四种范式,揭示了不同架构在效率、灵活性和泛化能力上的权衡,发现通用代码代理在性能上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01108 2026-03-03 cs.CV 50%

GroundedSurg: A Multi-Procedure Benchmark for Language-Conditioned Surgical Tool Segmentation

GroundedSurg: 一种多手术流程的语言条件手术工具分割基准

Tajamul Ashraf, Abrar Ul Riyaz, Wasif Tak, Tavaheed Tariq, Sonia Yadav, Moloud Abdar, Janibul Bashir

机构 * King Abdullah University of Science and Technology (KAUST)(卡奥尔大学科学与技术学院) Thapar Institute of Engineering and Technology(塔帕尔工程与技术学院) The University of Queensland(昆士兰大学) Gaash Research Lab, National Institute of Technology Srinagar(加什研究实验室,锡纳加尔国家理工学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 GroundedSurg提出了一种多手术流程的语言条件手术工具分割基准,通过实例级接地和空间注释评估视觉-语言模型在临床真实场景中的性能。

Comments https://github.com/gaash-lab/GroundedSurg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01083 2026-03-03 cs.CV 50%

Can Vision Language Models Assess Graphic Design Aesthetics? A Benchmark, Evaluation, and Dataset Perspective

视觉语言模型能否评估图形设计的审美?一个基准、评估和数据集的视角

Arctanx An, Shizhao Sun, Danqing Huang, Mingxi Cheng, Yan Gao, Ji Li, Yu Qiao, Jiang Bian

机构 * Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院) Microsoft(微软) Central South University(中南大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出AesEval-Bench基准,系统评估视觉语言模型在图形设计审美评估中的性能,并构建训练数据集以提升模型在该领域的表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01082 2026-03-03 cs.CV cs.IR 50%

Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval

超越全局相似性:面向细粒度、多条件多模态检索

Xuan Lu, Kangle Li, Haohang Huang, Rui Meng, Wenjun Zeng, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 MCMR提出一个多条件多模态检索基准,通过细粒度多模态检索评估模型在复杂查询中的条件感知推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07367 2026-03-03 cs.SD 50%

FOCAL: A Novel Benchmarking Technique for Multi-modal Agents

FOCAL:多模态代理的新型基准测试技术

Anupam Purwar, Aditya Choudhary

专题命中 推理评测 :reasoning(abstract)

AI总结 FOCAL提出了一种新型基准测试技术,用于评估多模态代理的端到端推理能力、误差传播及对话效果。

Comments We present a framework for evaluation of Multi-modal Agents consisting of Voice-to-voice model components viz. Text to Speech (TTS), Retrieval Augmented Generation (RAG) and Speech-to-text (STT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00994 2026-03-03 cs.HC 50%

VizQStudio: Iterative Visualization Literacy MCQs Design with Simulated Students

VizQStudio: 基于模拟学生的迭代可视化素养多选题设计

Zixin Chen, Yuhang Zeng, Sicheng Song, Yanna Lin, Xian Xu, Huamin Qu, Meng Xia

专题命中 推理评测 :reasoning(abstract)

AI总结 VizQStudio通过模拟学生帮助教师迭代设计高质量可视化素养多选题,提升评估设计的灵活性和适应性。

Comments TVCG fast track (PVIS 2026 TVCG Track) under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00595 2026-03-03 cs.CV 50%

UNICBench: UNIfied Counting Benchmark for MLLM

UNICBench: 多模态多层级计数基准与评估工具包

Chenggang Rong, Tao Han, Zhiyuan Zhao, Yaowu Fan, Jia Wan, Song Guo, Yuan Yuan, Junyu Gao

机构 * Northwestern Polytechnical University(北华大学) Hong Kong University of Science and Technology(香港科技大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Sun Yat-sen University(中山大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 推理评测 :reasoning(abstract)

AI总结 UNICBench是一个统一的多模态计数基准,通过准确的地面真实值和分层报告,评估45种最先进的MLLMs在图像、文本和音频计数任务上的性能,揭示了模型在推理和难分支上的不足。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00468 2026-03-03 cs.SE 50%

Cloud-OpsBench: A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems

Cloud-OpsBench: 一种可重现的云系统代理根本原因分析基准

Yilun Wang, Guangba Yu, Haiyu Huang, Zirui Wang, Yujie Huang, Pengfei Chen, Michael R. Lyu

专题命中 推理评测 :reasoning(abstract)

AI总结 Cloud-OpsBench 是一个用于云系统代理根本原因分析的可重现基准,通过构建确定性数字孪生,提供数据引擎、强化学习环境和诊断标准,支持下一代SRE研究。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 25 篇

2603.00578 2026-03-03 cs.AI cs.CL 90%

Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs

草稿式推理:在长链式推理LLM中学习高效推理

Jie Cao, Tianwei Lin, Zhenxuan Fan, Bo Yuan, Ziyuan Zhao, Rolan Yan, Wenqiao Zhang, Siliang Tang

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 Draft-Thinking通过草稿式推理结构和渐进式课程学习,在长链式推理LLM中实现高效推理,显著降低推理预算并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18453 2026-03-03 cs.AI cs.CL 84%

Reason Like a Radiologist: Chain-of-Thought and Reinforcement Learning for Verifiable Report Generation

像放射科医生一样推理:用于可验证报告生成的推理链和强化学习

Peiyuan Jing, Kinhei Lee, Zhenxuan Zhang, Huichi Zhou, Zhengqing Yuan, Zhifan Gao, Lei Zhu, Giorgos Papanastasiou, Yingying Fang, Guang Yang

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BoxMed-RL通过推理链和强化学习生成可验证的放射科报告,提升报告的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02025 2026-03-03 cs.LG cs.AI 81%

Revealing Combinatorial Reasoning of GNNs via Graph Concept Bottleneck Layer

通过图概念瓶颈层揭示图神经网络的组合推理

Yue Niu, Zhaokai Sun, Jiayi Yang, Xiaofeng Cao, Rui Fan, Xin Sun, Hanli Wang, Wei Ye

机构 * Tongji University, Shanghai, China(同济大学) City University of Macau, Macau, China(澳门城市大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出图概念瓶颈层,通过将概念视为图词并利用语言模型学习嵌入,提升GNNs的组合推理可解释性与性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01326 2026-03-03 cs.CL cs.LG 81%

Truth as a Trajectory: What Internal Representations Reveal About Large Language Model Reasoning

真相作为轨迹:内部表示揭示大语言模型推理的本质

Hamed Damirchi, Ignacio Meza De la Jara, Ehsan Abbasnejad, Afshar Shamsi, Zhen Zhang, Javen Shi

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Monash University(莫纳什大学) Concordia University(康科迪亚大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 TaT通过分析大语言模型推理过程中的层间几何位移,揭示有效推理与虚假行为的区别,提升模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19473 2026-03-03 cs.LG cs.AI 81%

WavefrontDiffusion: Dynamic Decoding Schedule for Improved Reasoning

WavefrontDiffusion: 动态解码调度以提升推理性能

Haojin Yang, Rui Hu, Zequn Sun, Rui Zhou, Yujun Cai, Yiwei Wang

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) The University of Queensland(昆士兰大学) University of California, Merced(加州大学梅尔德分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 WavefrontDiffusion通过动态解码调度提升推理和代码生成的性能与语义连贯性。

Comments 19 pages. 3 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22611 2026-03-03 cs.LG cs.AI 81%

Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning

分位数优势估计:稳定LLM推理的RLVR

Junkang Wu, Kexin Huang, Jiancan Wu, An Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过分位数优势估计方法,稳定RLVR训练过程,提升LLM推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏