arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19037 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19037 篇

2603.02128 2026-03-03 cs.CL cs.AI cs.CY 79%

LLMs as Strategic Actors: Behavioral Alignment, Risk Calibration, and Argumentation Framing in Geopolitical Simulations

大语言模型作为战略行为体:地缘政治模拟中的行为对齐、风险校准与论证框架

Veronika Solopova, Viktoria Skorik, Maksym Tereshchenko, Alina Haidun, Ostap Vykhopen

机构 * Mantisanalytics

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在地缘政治模拟中的行为表现,发现其在初期能模拟人类决策,但随时间推移表现出不同的策略特征,且在论证框架上偏向规范性与合作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18753 2026-03-03 cs.LG cs.AI 79%

HalluGuard: Demystifying Data-Driven and Reasoning-Driven Hallucinations in LLMs

HalluGuard: 解密数据驱动和推理驱动的LLM幻觉

Xinyue Zeng, Junhong Lin, Yujun Yan, Feng Guo, Liang Shi, Jun Wu, Dawei Zhou

机构 * CS Department Virginia Tech(弗吉尼亚理工学院计算机科学系) EECS Department MIT(麻省理工学院电子工程与计算机科学系) CS Department Dartmouth College(达特茅斯学院计算机科学系) Statistics Department Virginia Tech(弗吉尼亚理工学院统计学系) CS Department Michigan State University(密歇根州立大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HalluGuard通过统一理论框架和NTK评分方法,系统识别LLM中的数据驱动和推理驱动幻觉,实现高精度检测。

Comments Accepted by The Fourteenth International Conference on Learning Representations (ICLR'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18453 2026-03-03 cs.AI cs.CL 79%

Reason Like a Radiologist: Chain-of-Thought and Reinforcement Learning for Verifiable Report Generation

像放射科医生一样推理:用于可验证报告生成的推理链和强化学习

Peiyuan Jing, Kinhei Lee, Zhenxuan Zhang, Huichi Zhou, Zhengqing Yuan, Zhifan Gao, Lei Zhu, Giorgos Papanastasiou, Yingying Fang, Guang Yang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 BoxMed-RL通过推理链和强化学习生成可验证的放射科报告,提升报告的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01089 2026-03-03 cs.CL cs.LG 79%

CARD: Towards Conditional Design of Multi-agent Topological Structures

CARD: 向多智能体拓扑结构的条件设计迈进

Tongtong Wu, Yanming Li, Ziye Tang, Chen Jiang, Linhao Luo, Guilin Qi, Shirui Pan, Gholamreza Haffari

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 CARD通过条件图生成框架实现多智能体通信拓扑的动态适应,提升系统在不同环境下的有效性和鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19842 2026-03-03 cs.AI cs.LG 79%

DAG-Math: Graph-of-Thought Guided Mathematical Reasoning in LLMs

DAG-Math: 图思维引导的大型语言模型数学推理

Yuanhe Zhang, Ilja Kuzborskij, Jason D. Lee, Chenlei Leng, Fanghui Liu

机构 * Department of Statistics, University of Warwick(沃里克大学统计系) Google DeepMind(谷歌DeepMind) Department of Applied Mathematics, Hong Kong Polytechnic University(香港理工大学应用数学系) School of Mathematical Sciences, Institute of Natural Sciences and MOE-LSC, Shanghai Jiao Tong University(上海交通大学数学科学学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DAG-Math通过构建图思维引导的数学推理框架,评估LLM的推理能力,揭示了推理忠实度与最终答案准确性的差异。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13888 2026-03-03 cs.CL cs.AI 79%

Reliable Fine-Grained Evaluation of Natural Language Math Proofs

自然语言数学证明的可靠细粒度评估

Wenjie Ma, Andrei Cojocaru, Neel Kolhe, Bradley Louie, Robin Said Sharif, Haihan Zhang, Vincent Zhuang, Matei Zaharia, Sewon Min

机构 * UC Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Peking University(北京大学) Allen Institute for AI(人工智能研究院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ProofGrader,通过结合强推理模型、丰富上下文和简单集成方法,实现对LLM生成数学证明的细粒度评估,有效提升证明生成任务的可靠性。

Comments 40 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05069 2026-03-03 cs.CL cs.AI 79%

SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs

SwiReasoning: 在潜在空间和显式空间中切换以实现帕累托更优推理的LLM

Dachuan Shi, Abedelkadir Asi, Keying Li, Xiangchi Yuan, Leyan Pan, Wenke Lee, Wen Xiao

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SwiReasoning通过在潜在空间和显式空间之间切换,提升推理LLMs的准确率和令牌效率。

Comments ICLR 2026. Code: https://github.com/sdc17/SwiReasoning, Website: https://swireasoning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01025 2026-03-03 cs.LG cs.AI 79%

One-Token Verification for Reasoning Correctness Estimation

单token验证用于推理正确性估计

Zhan Zhuang, Xiequn Wang, Zebin Chen, Feiyang Ye, Ying Wei, Kede Ma, Yu Zhang

机构 * Southern University of Science(南方科技大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出单token验证方法,用于高效估计推理正确性,通过低秩适应集成到LLM中,减少token使用并提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25532 2026-03-03 cs.CL cs.AI 79%

Calibrating Verbalized Confidence with Self-Generated Distractors

校准带有自生成干扰项的置信度

Victor Wang, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出DINCO方法,通过自生成干扰项和归一化置信度校准,提升大型语言模型的置信度估计准确性。

Comments ICLR 2026. Code: https://github.com/victorwang37/dinco

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18395 2026-03-02 cs.CL cs.AI 79%

Latent Self-Consistency for Reliable Majority-Set Selection in Short- and Long-Answer Reasoning

潜在自一致性用于短答和长答推理中可靠多数集选择

Jungsuk Oh, Jay-Yoon Lee

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LSC通过学习token嵌入选择语义一致的响应,有效提升短答和长答推理中的多数集选择可靠性,且计算开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14697 2026-02-26 cs.AI cs.LG 79%

Evolutionary System Prompt Learning for Reinforcement Learning in LLMs

强化学习中大语言模型的进化系统提示学习

Lunjun Zhang, Ryan Chen, Bradly C. Stadie

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Statistics(统计学系) Data Science, Northwestern University(数据科学,西北大学) Bridgewater AIA Labs(布里奇沃特AIA实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 E-SPL通过结合强化学习和系统提示进化,提升大语言模型在推理和智能任务中的性能。

Comments 39 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00043 2026-02-26 cs.CV cs.AI cs.CL 79%

VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning

VOILA:对多模态大语言模型的感知理解与类比推理能力评估

Nilay Yilmaz, Maitreya Patel, Yiran Lawrence Luo, Tejas Gokhale, Chitta Baral, Suren Jayasuriya, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 VOILA通过类比映射方法评估多模态大语言模型的感知理解和抽象推理能力,发现其在图像间关系理解上存在不足,但通过多步提示策略可提升性能。

Comments Accepted at ICLR 2025. Code and data: https://github.com/nlylmz/Voila

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20130 2026-02-24 cs.CL cs.AI 79%

To Reason or Not to: Selective Chain-of-Thought in Medical Question Answering

推理还是不推理:医学问答中的选择性推理

Zaifu Zhan, Min Zeng, Shuang Zhou, Yiran Song, Xiaoyi Chen, Yu Hou, Yifan Wu, Yang Ruan, Rui Zhang

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Minnesota(明尼苏达大学) Division of Computational Health Sciences, Department of Surgery(计算健康科学 division,外科系) Department of Computer Science and Engineering(计算机科学与工程系) Health Data Science, School of Public Health(公共卫生学院健康数据科学系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 选择性推理通过动态调整推理深度和效率,提升医学问答的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19208 2026-02-24 cs.LG cs.AI 79%

How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization

如何分配,如何学习?动态回放分配与优势调节用于策略优化

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chaowen Hu, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DynaMO通过动态回放分配和梯度感知优势调节,优化策略学习中的资源分配与梯度更新稳定性,提升数学推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18918 2026-02-24 cs.AI cs.LG 79%

Early Evidence of Vibe-Proving with Consumer LLMs: A Case Study on Spectral Region Characterization with ChatGPT-5.2 (Thinking)

早期证据表明使用消费者LLM进行Vibe-Proving:通过ChatGPT-5.2(Thinking)对频谱区域特征的案例研究

Brecht Verbeken, Brando Vagenende, Marie-Anne Guerry, Andres Algaba, Vincent Ginis

机构 * Data Analytics Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学数据分析实验室) imec-SMIT, Vrije Universiteit Brussel(布鲁塞尔自由大学imec-SMIT) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过ChatGPT-5.2研究了LLM在数学证明中的应用,展示了其在高阶证明搜索中的有效性,并提出了LLM协助的局限性及改进方向。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00672 2026-02-24 cs.LG cs.AI 79%

ML-Tool-Bench: Tool-Augmented Planning for ML Tasks

ML-Tool-Bench: 为机器学习任务增强的工具辅助规划

Yaswanth Chittepu, Raghavendra Addanki, Tung Mai, Anup Rao, Branislav Kveton

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ML-Tool-Bench,通过引入内存中的命名对象管理,评估工具增强的ML代理,改进了ReAct方法,提升了16.52个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18307 2026-02-23 cs.SE cs.CL cs.LG cs.PL 79%

VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean

VeriSoftBench: 仓库级形式验证基准测试用于Lean

Yutong Xin, Qiaochu Chen, Greg Durrett, Işil Dillig

机构 * New York University(纽约大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 VeriSoftBench通过500个Lean 4证明义务评估LLM和证明器在仓库级形式验证中的表现,揭示了依赖闭包对证明成功率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16154 2026-02-19 cs.CL cs.AI 79%

Balancing Faithfulness and Performance in Reasoning via Multi-Listener Soft Execution

通过多听众软执行平衡忠实与性能

Nithin Sivakumaran, Shoubin Yu, Hyunji Lee, Yue Zhang, Ali Payani, Mohit Bansal, Elias Stengel-Eskin

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 REMUL通过多听众强化学习方法提升推理忠实性与性能,改进多个基准的忠实性指标和准确性。

Comments Code: https://github.com/nsivaku/remul

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12522 2026-02-17 cs.SE cs.AI cs.IR cs.LG cs.MA 79%

Improved Bug Localization with AI Agents Leveraging Hypothesis and Dynamic Cognition

改进的AI代理在利用假设和动态认知进行Bug定位中的应用

Asif Mohammed Samir, Mohammad Masudur Rahman

机构 * Dalhousie University(达尔豪西大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CogniGent技术,利用AI代理进行因果推理和动态认知调试,提升bug定位的准确性和效率。

Comments 13 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12422 2026-02-16 cs.AR cs.AI cs.LG 79%

CacheMind: From Miss Rates to Why -- Natural-Language, Trace-Grounded Reasoning for Cache Replacement

CacheMind: 从缺失率到原因 -- 基于自然语言和跟踪数据的缓存替换推理

Kaushal Mhapsekar, Azam Ghanbari, Bita Aslrousta, Samira Mirbagher-Ajorpaz

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CacheMind通过自然语言和跟踪数据推理提升缓存替换性能,实现高准确率和实际应用效果。

Comments 16 pages, 13 figures, ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05014 2026-02-13 cs.AI cs.CL cs.IR 79%

DeepRead: Document Structure-Aware Reasoning to Enhance Agentic Search

DeepRead: 一种基于文档结构的推理以增强代理搜索

Zhanli Li, Huiwen Tian, Lvzhou Luo, Yixuan Cao, Ping Luo

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, CAS(中国科学院大学) Wenlan School of Business, Zhongnan University of Economics(中南财经政法大学文澜商学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeepRead通过结构感知的文档推理增强代理搜索,有效提升文档理解精度。

Comments This version has significantly enhanced the clarity of our research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10816 2026-02-12 cs.CL cs.AI 79%

Beyond Confidence: The Rhythms of Reasoning in Generative Models

超越置信度:生成模型推理的节奏

Deyuan Liu, Zecheng Wang, Zhanyue Qin, Zhiying Tu, Dianhui Chu, Dianbo Sui

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出δ_TC B度量标准,用于评估生成模型在预测稳定性方面的鲁棒性,揭示了传统度量在上下文学习中的不足,并为提升模型稳定性提供新方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09447 2026-02-12 cs.SE cs.AI cs.CL 79%

SWE-AGI: Benchmarking Specification-Driven Software Construction with MoonBit in the Era of Autonomous Agents

SWE-AGI:在自主代理时代利用MoonBit进行规范驱动软件构建的基准测试

Zhirui Zhang, Hongbo Zhang, Haoxiang Fei, Zhiyuan Bao, Yubin Chen, Zhengyu Lei, Ziyue Liu, Yixuan Sun, Mingkun Xiao, Zihang Ye, Yu Zhang, Hongcheng Zhu, Yuxiang Wen, Heung-Yeung Shum

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SWE-AGI通过MoonBit评估LLM在规范驱动下的软件构建能力,揭示了AI辅助开发中代码阅读瓶颈及模型性能随任务难度变化的特性。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09442 2026-02-11 cs.CL cs.AI 79%

Evaluating Social Bias in RAG Systems: When External Context Helps and Reasoning Hurts

评估RAG系统中的社会偏见:当外部上下文有助于而推理有害

Shweta Parihar, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估RAG系统中的社会偏见,发现外部上下文可减少偏见,但链式思维提示反而增加偏见,凸显了需要偏见意识推理框架的重要性。

Comments Accepted as a full paper with an oral presentation at the 30th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08948 2026-02-10 cs.AI cs.CL 79%

CoRefine: Confidence-Guided Self-Refinement for Adaptive Test-Time Compute

CoRefine: 基于置信度的自修正以适应测试时计算

Chen Jin, Ryutaro Tanno, Tom Diethe, Philip Teare

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CoRefine通过置信度引导的自修正方法,在减少计算开销的同时提升推理准确性,适用于需要适应性测试时计算的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06795 2026-02-09 cs.CL cs.AI 79%

Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling

生成数据驱动的推理评分标准以实现领域自适应奖励建模

Kate Sanders, Nathaniel Weir, Sapana Chaudhary, Kaj Bostrom, Huzefa Rangwala

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon Web Services(亚马逊网络服务)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出数据驱动的推理评分标准,用于提升领域自适应奖励建模的错误检测能力,实验显示其在技术领域任务准确性提升达45%

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15732 2026-02-05 cs.AI cs.LG 79%

Can LLMs Reconcile Knowledge Conflicts in Counterfactual Reasoning

大语言模型能否在反事实推理中调和知识冲突

Khurram Yamin, Gaurav Ghosal, Bryan Wilder

机构 * Department of Machine Learning(机器学习系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了大语言模型在反事实推理中整合参数知识的能力,发现其普遍挣扎并存在知识退化问题。

Comments ICML 2025 Workshop on Scaling up Intervention Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04601 2026-02-04 cs.LG cs.CL 79%

Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space

自然语言行为-批评者:在语言空间中可扩展的非策略学习

Joey Hong, Kang Liu, Zhan Ling, Jiecao Chen, Sergey Levine

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出NLAC算法,利用生成式LLM批评者生成自然语言反馈,实现更高效稳定的LLM智能体训练。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02546 2026-02-04 cs.LG cs.AI 79%

GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning

GPG:一种简单而强大的用于模型推理的强化学习基线

Xiangxiang Chu, Hailang Huang, Xiao Zhang, Fei Wei, Yong Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 GPG提出了一种简化且高效的强化学习方法,通过直接优化原始目标并消除冗余组件,实现了在多种任务中优于传统方法的性能。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15746 2026-02-03 cs.CL cs.AI cs.CV 79%

End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning

端到端代理RAG系统训练用于可追溯的诊断推理

Qiaoyu Zheng, Yuze Sun, Chaoyi Wu, Weike Zhao, Pengcheng Qiu, Yongguo Yu, Kun Sun, Jian Zhang, Yanfeng Wang, Ya Zhang, Weidi Xie

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Deep-DxSearch通过端到端强化学习训练代理RAG系统,实现可追溯的诊断推理,显著提升诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏