arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5824 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5824 篇

2409.06679 2026-04-15 cs.CL 79%

E2LLM: Encoder Elongated Large Language Models for Long-Context Understanding and Reasoning

E2LLM:用于长上下文理解与推理的编码器扩展大语言模型

Zihan Liao, Jun Wang, Hang Yu, Lingxiao Wei, Jianguo Li, Jun Wang, Wei Zhang

机构 * East China Normal University(东华师范大学) Ant Group(蚂蚁集团)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出E2LLM,通过分块压缩和适配器对齐,解决长上下文处理中的性能、效率与兼容性难题,在文档摘要和问答任务中优于现有方法。

Comments Accept by EMNLP'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10455 2026-04-14 cs.CL 79%

EviCare: Enhancing Diagnosis Prediction with Deep Model-Guided Evidence for In-Context Reasoning

EviCare: 通过深度模型引导的证据增强诊断预测

Hengyu Zhang, Xuyun Zhang, Pengxiang Zhan, Linhao Luo, Hang Lv, Yanchao Tan, Shirui Pan, Carl Yang

机构 * Macquarie University(麦考瑞大学) Fuzhou University(福州大学) Monash University(莫纳什大学) Griffith University(格里菲斯大学) Emory University(埃默里大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 EviCare通过整合深度模型指导的证据选择、证据优先级排序和关系证据构建,提升基于LLM的诊断预测性能,在MIMIC-III和MIMIC-IV数据集上实现20.65%的平均提升,尤其在新诊断预测上提升显著。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04672 2026-04-14 cs.CV cs.CL 79%

Agri-R1: Agricultural Reasoning for Disease Diagnosis via Automated-Synthesis and Reinforcement Learning

Agri-R1:通过自动合成与强化学习进行农业疾病诊断的推理增强

Wentao Zhang, Mingkun Xu, Qi Zhang, Shangyang Li, Derek F. Wong, Lifei Wang, Yanchao Yang, Lina Lu, Tao Fang

机构 * Shandong University of Technology(山东理工大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) School of Physical Science and Technology, Beijing University of Posts and Telecommunications(北京邮电大学物理科学与技术学院) NLP2CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系自然语言处理与中葡机器翻译实验室) Institute of International Language Services Studies, Macau Millennium College(澳门千禧学院国际语言服务研究所)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 Agri-R1通过自动合成与强化学习提升农业疾病诊断,利用仅19%的数据生成高质量推理数据,采用改进的奖励函数提升模型在疾病识别和农业知识问答上的性能。

Comments This paper is submitted for review to the 2026 ACM MM Conference. The corresponding authors are Tao Fang and Lina Lu, where Tao Fang is the senior Corresponding Author (Last Author) and the principal supervisor of this work, having led the research design, guided the methodology, and overseen the entire project

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27817 2026-04-13 cs.CV cs.AI cs.CR 79%

Towards Context-Aware Image Anonymization with Multi-Agent Reasoning

面向多智能体推理的上下文感知图像匿名化

Robert Aufschläger, Jakob Folz, Gautam Savaliya, Manjitha D Vidanalage, Michael Heigl, Martin Schramm

机构 * Deggendorf Institute of Technology(代根多夫应用技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CAIAMAR框架,通过多智能体推理和扩散匿名化技术,实现上下文感知的PII分割,减少重识别风险并提升图像质量。

Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04666 2026-04-10 cs.AI cs.CR 79%

Know Thy Enemy: Securing LLMs Against Prompt Injection via Diverse Data Synthesis and Instruction-Level Chain-of-Thought Learning

知彼者智:通过多样化数据合成和指令级推理学习增强大语言模型抗提示注入能力

Zhiyuan Chang, Mingyang Li, Yuekai Huang, Ziyou Jiang, Xiaojun Jia, Qian Xiong, Junjie Wang, Zhaoyang Li, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory, Institute of Software Chinese Academy of Sciences(中国科学院软件研究所综合信息系统技术国家级重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Beijing Forestry University(北京林业大学)

专题命中 其他推理 :chain-of-thought(title,abstract);分类 cs.AI

AI总结 本文提出InstruCoT方法,通过多样化数据合成和指令级推理学习提升大语言模型对提示注入攻击的防御能力,实验表明其在行为偏差、隐私泄露和有害输出方面显著优于基线方法。

Comments 19 pages, 6 figures; accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26522 2026-04-09 cs.LG 79%

Entropy After </Think> for reasoning model early exiting

推理模型早期退出后的熵

Xi Wang, James McInerney, Lequn Wang, Nathan Kallus

机构 * Johns Hopkins University(约翰霍普金斯大学) Netflix Research(Netflix研究院) Cornell University(康奈尔大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出熵后</Think>信号(EAT)用于检测和防止推理模型过度思考,通过减少冗余推理token消耗提升效率,在数学问题数据集上验证了其有效性。

Comments Code and data assets are available at https://github.com/xidulu/EAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05540 2026-04-08 cs.CL 79%

Learning to Edit Knowledge via Instruction-based Chain-of-Thought Prompting

通过基于指令的思考链提示学习知识编辑

Jinhu Fu, Yan Bai, Longzhu He, Yihang Lou, Yanxiao Zhao, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Huawei Technologies Ltd.(华为技术有限公司) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 其他推理 :chain-of-thought(title);reasoning(abstract);分类 cs.CL

AI总结 本文提出CoT2Edit方法,通过思考链推理提升大语言模型的知识编辑能力,解决泛化差和范围窄的问题,实验显示在六个场景中表现优异。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04921 2026-04-07 cs.CL cs.CV 79%

TriAttention: Efficient Long Reasoning with Trigonometric KV Compression

TriAttention: 有效长推理的三角KV压缩

Weian Mao, Xi Lin, Wei Huang, Yuxin Xie, Tianfu Fu, Bohan Zhuang, Song Han, Yukang Chen

机构 * MIT(麻省理工学院) NVIDIA(英伟达) ZJU(浙江大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TriAttention通过三角序列利用KV集中性,提升长推理效率,实现2.5倍吞吐量和10.7倍KV内存节省。

Comments Code is available at https://github.com/WeianMao/triattention

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01528 2026-04-07 cs.CY cs.LG 79%

Making Bias Non-Predictive: Training Robust LLM Reasoning via Reinforcement Learning

消除偏见的可预测性:通过强化学习训练鲁棒的大语言模型推理

Qian Wang, Xuandong Zhao, Zirui Zhang, Zhanzhi Lou, Nuo Chen, Dawn Song, Bingsheng He

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Epistemic Independence Training (EIT)框架,通过使偏见提示非预测性来提升大语言模型的推理鲁棒性,实验表明其在对抗性偏见下表现更优,并能泛化至多种偏见类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22095 2026-04-07 cs.CL 79%

Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation

基于推理引导的多模态知识利用的检索专家混合

Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Yishan Li, Yukun Yan, Shuo Wang, Yu Gu, Minghe Yu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MoRE框架,通过动态选择检索专家提升多模态大语言模型的知识利用效率,实验表明在开放领域问答基准上性能提升超过7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03242 2026-04-07 cs.LG 79%

DRAFT: Task Decoupled Latent Reasoning for Agent Safety

草稿:任务解耦的潜在推理用于代理安全

Lin Wang, Junfeng Fang, Dan Zhang, Fei Shen, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出DRAFT框架,通过解耦安全判断为提取器和推理器两个阶段,利用潜在空间证据聚合提升代理安全性,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01302 2026-04-03 cs.CL 79%

Scaling Reasoning Tokens via RL and Parallel Thinking: Evidence From Competitive Programming

通过强化学习和并行思维扩展推理令牌:来自竞赛编程的证据

Qianfan Zhang, Tianyu Guo, Xuandi Ren, Jiale Chen, Ming Ding, Ran Xin, Xia Xiao

机构 * Princeton University(普林斯顿大学) Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过强化学习和并行思维方法扩展竞赛编程中的推理令牌预算,展示了多轮并行思维流程在分配令牌预算方面的有效性,实验表明其在复杂编程问题上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26330 2026-03-30 cs.CV cs.AI 79%

Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation

通过输入自适应深度聚合缓解视觉语言微调中的推理税

Yiming Ren, Yujiu Yang, Junjie Wang

机构 * Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出IADA机制,通过输入自适应的跨深度检索提升视觉语言模型的推理能力,实验表明其在参数效率方面优于LoRA微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25203 2026-03-27 cs.CV cs.CL 79%

Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detection

基于概率概念图推理的多模态虚假信息检测

Ruichao Yang, Wei Gao, Xiaobin Zhu, Jing Ma, Hongzhan Lin, Ziyang Luo, Bo-Wen Zhang, Xu-Cheng Yin

机构 * University of Science and Technology Beijing(北京科技大学) Singapore Management University(新加坡管理大学) Hong Kong Baptist University(香港浸会大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出PCGR框架,通过构建概念图进行多模态虚假信息检测,实现可解释且可进化的方法,提升检测准确性和抗新兴操纵能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21854 2026-03-24 cs.AI 79%

Reasoning or Rhetoric? An Empirical Analysis of Moral Reasoning Explanations in Large Language Models

推理还是修辞?对大型语言模型中道德推理解释的实证分析

Aryan Kasat, Smriti Singh, Aman Chadha, Vinija Jain

机构 * TCS AI Practice(TCS人工智能实践) UT Austin(德克萨斯大学奥斯汀分校) Amazon GenAI(亚马逊生成人工智能) Google GenAI(谷歌生成人工智能)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过分析LSTM对道德困境的回应,探讨其是否具备道德发展阶段的真正进展,发现其表现出后常规推理,且存在道德解耦现象,揭示了对成熟道德推理的修辞模仿。

Comments 32 pages, 34 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21341 2026-03-24 cs.AI 79%

RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models

RoboAlign:学习测试时推理以改进视觉-语言-动作模型中的语言-动作对齐

Dongyoung Kim, Sumin Park, Woomin Song, Seungku Kim, Taeyoung Kim, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * Yonsei University(延世大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出RoboAlign框架,通过零样本自然语言推理生成动作标记并结合强化学习提升动作准确性,从而在视觉-语言-动作模型中实现语言与低级动作之间的对齐,提升模型性能。

Comments 15 pages, 7 figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20620 2026-03-24 cs.AI 79%

Reasoning Traces Shape Outputs but Models Won't Say So

推理轨迹影响输出但模型不会坦言

Yijie Hao, Lingjie Chen, Ali Emami, Joyce Ho

机构 * Emory University(埃默里大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨大推理模型产生的推理轨迹是否真实反映其输出驱动因素,发现注入合成推理片段能可靠改变输出,但模型在解释改变时普遍拒绝披露影响,激活分析显示系统性欺骗模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20170 2026-03-23 cs.AI 79%

Learning Dynamic Belief Graphs for Theory-of-mind Reasoning

学习动态信念图以进行心灵理论推理

Ruxiao Chen, Xilei Zhao, Thomas J. Cova, Frank A. Drews, Susu Xu

机构 * Department of Civil Systems Engineering, Johns Hopkins University, Baltimore, MD, USA School of the Environment, Society \& Sustainability, University of Utah, Salt Lake City, UT, USA Department of Psychology, University of Utah, Salt Lake City, UT, USA Coastal Engineering, University of Florida, Gainesville, FL, USA

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种动态信念图模型,用于增强大语言模型的心灵理论推理能力,通过联合推断潜在信念、学习时间变化依赖关系,并链接信念演变与信息获取和决策,提升高不确定性环境下的行动预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18014 2026-03-23 cs.LG 79%

Predictive Scaling Laws for Efficient GRPO Training of Large Reasoning Models

为高效训练大推理模型的预测缩放定律

Datta Nimmaturi, Vaishnavi Bhargava, Rajat Ghosh, Johnu George, Debojyoti Dutta

机构 * Nutanix

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出预测框架,通过实验推导出基于模型大小、初始性能和训练进度的经验缩放定律,识别三个训练阶段并建议提前停止以减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18718 2026-03-20 cs.AI 79%

MemMA: Coordinating the Memory Cycle through Multi-Agent Reasoning and In-Situ Self-Evolution

MemMA:通过多智能体推理和现场自进化协调内存循环

Minhua Lin, Zhiwei Zhang, Hanqing Lu, Hui Liu, Xianfeng Tang, Qi He, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊) Microsoft(微软)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MemMA通过多智能体推理和现场自进化协调内存循环,解决内存循环正向路径的战略盲区和反向路径的稀疏延迟监督问题,提升长周期交互性能。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16219 2026-03-18 cs.CL 79%

SpecSteer: Synergizing Local Context and Global Reasoning for Efficient Personalized Generation

SpecSteer:协同局部上下文与全局推理以实现高效个性化生成

Hang Lv, Sheng Liang, Hao Wang, Yongyue Zhang, Hongchao Gu, Wei Guo, Defu Lian, Yong Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SpecSteer框架,通过结合本地上下文与云端推理,解决个性化生成中的隐私与推理能力矛盾,实现高效生成并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13725 2026-03-17 cs.CL 79%

Can We Trust LLMs on Memristors? Diving into Reasoning Ability under Non-Ideality

我们能相信基于忆阻器的LLMs吗?在非理想条件下探究推理能力

Taiqiang Wu, Yuxin Cheng, Chenchen Ding, Runming Yang, Xincheng Feng, Wenyong Zhou, Zhengwu Liu, Ngai Wong

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究探讨了基于忆阻器的类脑计算架构对LLM推理能力的影响,发现非理想性导致推理能力下降,提出三种无训练策略并总结提升鲁棒性的指导原则。

Comments 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12176 2026-03-13 cs.CV cs.AI 79%

BehaviorVLM: Unified Finetuning-Free Behavioral Understanding with Vision-Language Reasoning

BehaviorVLM: 无需微调的统一行为理解与视觉-语言推理

Jingyang Ke, Weihan Li, Amartya Pradhan, Jeffrey Markowitz, Anqi Wu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 BehaviorVLM通过无需微调的视觉-语言框架,实现了姿态估计和行为理解的统一,利用详细推理步骤减少人工标注,提升多动物行为分析的可扩展性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08719 2026-03-12 cs.AR cs.AI cs.SE 79%

SiliconMind-V1: Multi-Agent Distillation and Debug-Reasoning Workflows for Verilog Code Generation

SiliconMind-V1:用于Verilog代码生成的多智能体蒸馏与调试推理工作流

Mu-Chi Chen, Yu-Hung Kao, Po-Hsuan Huang, Shao-Chun Ho, Hsiang-Yu Tsou, I-Ting Wu, En-Ming Huang, Yu-Kai Hung, Wei-Po Hsin, Cheng Liang, Chia-Heng Tu, Shih-Hao Hung, H. T. Kung

机构 * SiliconMind-V1

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SiliconMind-V1通过多智能体框架和测试平台驱动的验证,实现了更高效且功能正确的Verilog代码生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09835 2026-03-11 cs.CL 79%

Chow-Liu Ordering for Long-Context Reasoning in Chain-of-Agents

Chow-Liu 排序用于链式代理中的长上下文推理

Naman Gupta, Vaibhav Singh, Arun Iyer, Kirankumar Shiragur, Pratham Grover, Ramakrishna B. Bairi, Ritabrata Maiti, Sankarshan Damle, Shachee Mishra Gupta, Rishikesh Maurya, Vageesh D. C

机构 * Microsoft(微软)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文利用Chow-Liu树学习依赖结构,通过广度优先遍历优化块顺序,减少信息损失并提升长上下文推理的准确率。

Comments Published as a workshop paper at ICLR 2026 Workshop MemAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06659 2026-03-10 cs.CY cs.AI 79%

Science Literacy: Generative AI as Enabler of Coherence in the Teaching, Learning, and Assessment of Scientific Knowledge and Reasoning

科学素养:生成式AI在科学知识与推理教学、学习和评估中的促进作用

Xiaoming Zhai, James W. Pellegrino, Matias Rojas, Jongchan Park, Matthew Nyaaba, Clayton Cohn, Gautam Biswas

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文探讨生成式AI在提升科学素养中的作用,分析其在教学、学习和评估中的应用挑战与解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05275 2026-03-06 cs.MM cs.CL cs.SD 79%

SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning

SarcasmMiner:一种双轨后训练框架,用于鲁棒的音频视觉讽刺推理

Zhu Li, Yongjian Chen, Huiyuan Lai, Xiyuan Gao, Shekhar Nayak, Matt Coler

机构 * Speech Technology Lab, University of Groningen, The Netherlands(格罗宁根大学语音技术实验室,荷兰) Center for Language and Cognition, University of Groningen, The Netherlands(格罗宁根大学语言与认知中心,荷兰)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 SarcasmMiner通过双轨蒸馏和组相对策略优化提升多模态讽刺检测性能,实现F1值显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06690 2026-03-06 cs.CL 79%

Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation

在生成过程中思考:面向个性化长文本生成的即兴推理

Chengbing Wang, Yang Zhang, Wenjie Wang, Xiaoyan Zhao, Fuli Feng, Xiangnan He, Tat-Seng Chua

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(国立新加坡大学) The Chinese University of Hong Kong(香港中文大学) National Engineering Laboratory for BITA, University of Science and Technology of China(BITA国家工程实验室,科学技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 FlyThinker通过在生成过程中进行动态推理,提升个性化长文本生成的效率和效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10619 2026-03-05 cs.CV cs.AI 79%

Improving Medical Visual Reinforcement Fine-Tuning via Perception and Reasoning Augmentation

通过感知与推理增强改进医疗视觉强化微调

Guangjing Yang, ZhangYuan Yu, Ziyuan Qin, Xinyuan Song, Huahui Yi, Qingbo Kang, Jun Gao, Yiyue Li, Chenlin Du, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Emory University(埃默里大学) Sichuan University(四川大学) Peking University(北京大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出VRFT-Aug框架,通过增强感知与推理能力,改进医疗影像领域的强化微调效果,提升模型在医学应用中的可靠性与推理能力。

Comments CPAL 2026

Journal ref 2026 Conference on Parsimony and Learning (CPAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12264 2026-03-04 cs.AI 79%

Reducing Belief Deviation in Reinforcement Learning for Active Reasoning

减少强化学习中的信念偏差以实现主动推理

Deyu Zou, Yongqiang Chen, Jianxiang Wang, Haochen Yang, Mufei Li, James Cheng, Pan Li, Yu Gong

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出$\mathbf{T^3}$方法,通过跟踪信念偏差并截断训练轨迹,提升LLM在主动推理中的训练稳定性与性能表现。

Comments Published as a conference paper at ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏