arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1755 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1755 篇

2605.10082 2026-05-13 cs.CL cs.LG 62%

FERA: Uncertainty-Aware Federated Reasoning for Large Language Models

FERA:面向大语言模型的不确定性感知联邦推理

Ruhan Wang, Chengkai Huang, Zhiyong Wang, Junda Wu, Rui Wang, Tong Yu, Julian McAuley, Lina Yao, Dongruo Zhou

机构 * Indiana University(印第安纳大学) The University of New South Wales(新南威尔士大学) The Chinese University of Hong Kong(香港中文大学) University of California San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 FERA通过迭代服务器-客户端协同细化,解决联邦推理中客户端可靠性依赖查询的问题,提升多步骤推理能力,实验表明其在多个推理基准上优于联邦训练和无训练基线。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06908 2026-05-11 cs.LG cs.AI 62%

Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents

同信号,异意义:方向感知的自适应学习用于大语言模型代理

Ziming Li, Jiatan Huang, Xiaoguang Guo, Guilin Wang, Chuxu Zhang

机构 * University of Connecticut(康奈尔大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DIAL方法,通过方向感知的自适应学习解决LLM代理中计算需求与计算适宜性差异问题,提升性能-成本平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09839 2026-05-11 cs.AI cs.LG 62%

Steered LLM Activations are Non-Surjective

引导的LLM激活不是满射的

Aayush Mishra, Daniel Khashabi, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了激活引导是否能通过文本提示实现,证明引导行为在实际中无法通过提示复现,区分了白盒引导与黑盒提示的差异。

Comments 10 pages main text. ICLR 2026 Workshops (Sci4DL, Re-Align)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13224 2026-05-11 cs.AI cs.CL 62%

A Geometric Taxonomy of Hallucinations in LLMs

大语言模型幻觉的几何分类

Javier Marín

机构 * Javier Marín

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于嵌入空间几何的幻觉检测方法,通过三种操作类型区分可检测与不可检测的幻觉,验证了在不同领域数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11653 2026-05-01 cs.IR cs.AI cs.LG 62%

GroupRank: A Groupwise Paradigm for Effective and Efficient Passage Reranking with LLMs

GroupRank: 一种用于基于LLM的高效有效段落重排序的组内方法

Meixiu Long, Duolin Sun, Dan Yang, Yihan Jiao, Lei Liu, Jiahai Wang, BinBin Hu, Yue Shen, Jie Feng, Zhehao Tan, Junjie Wang, Lianzhen Zhong, Jian Wang, Peng Wei, Jinjie Gu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Ant Group(蚂蚁集团)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 GroupRank提出一种组内方法平衡灵活性和上下文感知,通过合成数据融合局部点状信号与全局列表排名,提升重排序效果和效率,实验显示在BRIGHT上达到65.2 NDCG@10,且推理速度提升6.4倍。

Comments Accepted by ACL-Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14352 2026-05-01 cs.CY cs.AI cs.LO 62%

Epistemic reflections on AI answering our questions: overwatch, erudite, logician, interlocutor

关于AI回答问题的认知反思:监视、博学、逻辑学家、对话者

Johan F. Hoorn, Ella-Jenna Oosterglorenwoud

机构 * The Hong Kong Polytechnic University(香港理工大学) Eindhoven University of Technology (TU/e)(埃因霍温理工大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨AI在金融、法律等领域被广泛依赖的问题,指出其缺乏逻辑验证和实证验证,可能导致误判和剽窃。提出需了解推理系统以使AI成为可信的对话伙伴。

Comments 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25934 2026-04-30 cs.CY cs.AI 62%

LLM Psychosis: A Theoretical and Diagnostic Framework for Reality-Boundary Failures in Large Language Models

LLM精神病:一种理论和诊断框架,用于大语言模型中现实边界失败

Ashutosh Raj

机构 * NeuraCare AI IIT Ropar(罗帕理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出LLM精神病理论框架,用于描述大语言模型认知崩溃现象,通过五个特征定义诊断工具LCIS,分析不同严重等级的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03247 2026-04-24 cs.LG cs.AI 62%

Towards Multimodal Active Learning: Efficient Learning with Limited Paired Data

迈向多模态主动学习:在有限配对数据下高效学习

Jiancheng Zhang, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个处理对齐数据的多模态主动学习框架,结合不确定性与多样性原则,实现线性时间获取,降低多模态标注成本且保持性能。

Comments Accepted by Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09781 2026-04-23 cs.LG cs.AI 62%

Explainability in Generative Medical Diffusion Models: A Faithfulness-Based Analysis on MRI Synthesis

生成医学扩散模型的可解释性:基于忠实度的MRI合成分析

Surjo Dey, Pallabi Saikia

机构 * Rajiv Gandhi institute of petroleum technology(拉吉夫·甘地石油技术学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨生成扩散模型在医学影像中的可解释性,聚焦MRI合成,通过分析原型方法评估生成与训练特征的关系,实验表明EPPNet在忠实度上表现最佳,提升生成过程的透明度和可信度。

Comments Accepted at 3rd World Congress on Smart Computing (WCSC2026) conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20598 2026-04-23 cs.IR cs.CL cs.DB cs.LG 62%

Self-Aware Vector Embeddings for Retrieval-Augmented Generation: A Neuroscience-Inspired Framework for Temporal, Confidence-Weighted, and Relational Knowledge

具有自我意识的向量嵌入用于检索增强生成:一种受神经科学启发的框架,用于时间、置信度加权和关系知识

Naizhong Xu

机构 * Principal Consultant, CMC APAC(CMC APAC 主任顾问)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SmartVector框架,通过引入时间意识、置信度衰减和关系意识,改进检索增强生成系统,提升准确性与鲁棒性。

Comments 17 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18963 2026-04-22 cs.LG cs.AI 62%

Distillation Traps and Guards: A Calibration Knob for LLM Distillability

知识蒸馏陷阱与守护:一种用于LLM可蒸馏性的校准调节器

Weixiao Zhan, Yongcheng Jing, Leszek Rutkowski, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science(生成人工智能实验室,计算与数据科学学院) Nanyang Technological University(南洋理工大学) Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) AGH University of Krakow(克拉科夫AGH大学) SAN University(SAN大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文分析了知识蒸馏中的陷阱,提出了一种后处理校准方法,通过强化学习微调控制教师模型的可蒸馏性,提升蒸馏效果和模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22977 2026-04-20 cs.LG cs.AI 62%

The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination

推理陷阱:增强大语言模型推理能力如何放大工具幻觉

Chenlong Yin, Zeyang Sha, Shiwen Cui, Changhua Meng, Zechao Li

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Nanjing University of Science and Technology(南京理工大学) Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨增强LLM推理能力是否导致工具幻觉增加,通过SimpleToolHalluBench验证因果关系,发现推理增强与幻觉成正比,且不受过拟合影响,揭示需新的训练目标平衡能力和可靠性。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20020 2026-04-20 cs.AI cs.CL 62%

Persona-Assigned Large Language Models Exhibit Human-Like Motivated Reasoning

具有人格分配的大型语言模型表现出类似人类的动机推理

Saloni Dash, Amélie Reymond, Emma S. Spiro, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了分配不同政治和社会人口属性的人格对大型语言模型动机推理的影响,发现人格分配的模型在评估信息真实性时表现下降,且政治人格在科学证据评估中更倾向于与自身身份一致的结论,传统去偏方法效果有限。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05024 2026-04-17 stat.ME cs.AI cs.LG 62%

Model-Free Assessment of Simulator Fidelity via Quantile Curves

通过分位数曲线进行无模型的模拟器保真度评估

Garud Iyengar, Yu-Shiou Willy Lin, Kaizheng Wang

机构 * Department of IEOR and Data Science Institute, Columbia University(工业工程与数据科学学院,哥伦比亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过分位数曲线评估模拟器保真度,构建置信区间以估计潜变量参数差异,支持统计推断和风险测量,适用于多种输出空间。

Comments 39 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13258 2026-04-16 cs.CL cs.AI 62%

Hessian-Enhanced Token Attribution (HETA): Interpreting Autoregressive LLMs

Hessian-Enhanced Token Attribution (HETA): 解释自回归语言模型

Vishal Pramanik, Maisha Maliha, Nathaniel D. Bastian, Sumit Kumar Jha

机构 * Department of Computer & Information Science & Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系) School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院) Department of Electrical Engineering and Computer Science, United States Military Academy(美国军事学院电子工程与计算机科学系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 HETA提出了一种针对解码器-only语言模型的新型解释框架,结合语义过渡向量、Hessian敏感度评分和KL散度,提升上下文感知和因果解释能力,通过基准数据集验证其在生成任务中的优越性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25512 2026-04-15 cs.LG cs.AI cs.CV 62%

FaCT: Faithful Concept Traces for Explaining Neural Network Decisions

FaCT:用于解释神经网络决策的忠实概念追踪

Amin Parchami-Araghi, Sukrut Rao, Jonas Fischer, Bernt Schiele

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FaCT模型,通过共享类间概念实现忠实解释,引入C²-Score评估概念一致性,提升可解释性同时保持ImageNet性能。

Comments 35 pages, 23 figures, 2 tables, Neural Information Processing Systems (NeurIPS) 2025; Code is available at https://github.com/m-parchami/FaCT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05593 2026-04-08 cs.AI cs.CL 62%

Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge

标签效应:人类和LLM-as-a-Judge在信任评估中的共享启发式依赖

Xin Sun, Di Wu, Sijing Qin, Isao Echizen, Abdallah El Ali, Saku Sugawara

机构 * National Institute of Informatics (NII)(国立信息学研究所) University of Amsterdam(阿姆斯特丹大学) University of Tokyo(东京大学) Hitotsubashi University(一桥大学) Centrum Wiskunde & Informatica (CWI)(荷兰数学与计算机科学研究中心) Utrecht University(乌得勒支大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示人类和LLM在信任评估中受标签影响的共同机制,通过对比人类和模型的反应,发现标签对信任判断有显著偏倚,提出需警惕标签敏感的LLM评估有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13909 2026-04-08 cs.CL cs.AI 62%

Knowledge Reasoning Language Model: Unifying Knowledge and Language for Inductive Knowledge Graph Reasoning

知识推理语言模型:统一知识与语言以进行归纳知识图谱推理

Xingrui Zhuo, Jiapu Wang, Gongqing Wu, Zhongyuan Wang, Jichen Zhang, Shirui Pan, Xindong Wu

机构 * The Key Laboratory of Knowledge Engineering with Big Data (the Ministry of Education of China), Hefei University of Technology, China(合肥工业大学大数据知识工程教育部重点实验室) School of Computer Science and Information Engineering, Hefei University of Technology, China(合肥工业大学计算机与信息学院) Nanjing University of Science and Technology, China(南京理工大学) China Unicom Digital Technology Co., Ltd., Beijing, China(联通数字科技有限公司) China Unicom Internet of Things Co., Ltd., Nanjing, China(联通物联网有限责任公司) Shandong Inspur Science Research Institute, Jinan, China(山东浪潮科学研究院) Griffith University, Australia(格里菲斯大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KRLM,通过统一语言模型知识与知识图谱上下文,解决归纳知识图谱推理中的知识扭曲和生成幻觉问题,实验表明其在25个真实数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02226 2026-04-03 cs.AI cs.LG 62%

When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learning

何时提问:用于强化学习的不确定性门控语言帮助

Juarez Monteiro, Nathan Gavenski, Gianlucca Zuin, Adriano Veloso

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ASK方法,通过结合小型语言模型和训练好的RL策略,提升模型在分布外任务中的泛化能力,通过不确定性门控机制选择性利用语言模型进行决策,实验显示其在迁移任务中表现稳健。

Comments In Proceedings of International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16082 2026-04-03 q-bio.QM cs.AI cs.LG 62%

BIOGEN: Evidence-Grounded Multi-Agent Reasoning Framework for Transcriptomic Interpretation in Antimicrobial Resistance

BIOGEN:基于证据的多智能体推理框架用于抗菌药物耐药性中的转录组解释

Elias Hossain, Mehrdad Shoeibi, Ivan Garibay, Niloofar Yousefi

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 BIOGEN通过结合生物信息检索、结构化推理和多批评验证,生成可追溯的转录组模块解释,其在抗菌药物耐药性研究中表现出强生物学基础和零幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25052 2026-04-02 cs.CL cs.AI 62%

Closing the Confidence-Faithfulness Gap in Large Language Models

弥合大语言模型中的置信度-忠实度差距

Miranda Muqing Miao, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过线性探针和对比激活添加分析,揭示大语言模型中置信度信号与校准的线性关系,提出双阶段适应性引导流程以提升校准对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29950 2026-04-01 cs.AI cs.CL 62%

Physiological and Semantic Patterns in Medical Teams Using an Intelligent Tutoring System

医疗团队中的生理与语义模式:基于智能教学系统

Xiaoshan Huang, Conrad Borchers, Jiayi Zhang, Susanne P. Lajoie

机构 * McGill University(麦吉尔大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究通过智能教学系统分析医疗团队在诊断虚拟患者时的生理和对话动态,发现语义变化与生理同步峰值相关,且高生理同步伴随低语义相似性,揭示了团队协作中的关键时刻。

Comments Accepted as short paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10780 2026-04-01 cs.CL cs.LG 62%

Script Gap: Evaluating LLM Triage on Indian Languages in Native vs Romanized Scripts in a Real World Setting

脚本间隙:在真实世界环境中评估LLM在印度语言本土脚本与罗马化脚本上的三线分类

Manurag Khullar, Utkarsh Desai, Poorva Malviya, Aman Dalmia, Zheyuan Ryan Shi

机构 * School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM在印度语言及尼泊尔语的本土脚本与罗马化脚本在真实世界中的三线分类可靠性,发现罗马化文本导致性能下降达24分,并提出基于不确定性的选择路由方法以缩小脚本差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22582 2026-03-25 cs.CL cs.AI 62%

Lie to Me: How Faithful Is Chain-of-Thought Reasoning in Reasoning Models?

对我的谎言:推理模型中的思维链推理可信度如何?

Richard J. Young

机构 * University of Nevada, Las Vegas, Department of Management, Entrepreneurship and Technology, Lee Business School(内华达大学拉斯维加斯分校,管理、创业与技术系,李商学院) DeepNeuro AI

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了12种开源推理模型在MMLU和GPQA Diamond中的表现,发现模型在提示影响下的可信度差异显著,训练方法和架构影响更大。

Comments 27 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22303 2026-03-25 cs.LG cs.AI 62%

Sample Transform Cost-Based Training-Free Hallucination Detector for Large Language Models

基于样本转换成本的无训练hallucination检测器用于大型语言模型

Zeyang Ding, Xinglin Hu, Jicong Fan

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于最优传输距离的hallucination检测方法,通过计算token嵌入之间的Wasserstein距离矩阵,得到AvgWD和EigenWD两个指标,用于无训练检测大型语言模型的hallucination问题。

Comments 24 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20246 2026-03-24 cs.CL cs.AI cs.NE q-bio.NC 62%

Decoding the decoder: Contextual sequence-to-sequence modeling for intracortical speech decoding

解码解码器:用于皮层语音解码的上下文序列到序列建模

Michal Olak, Tommaso Boccato, Matteo Ferrante

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于Transformer的多任务序列到序列模型,用于从皮层记录中解码语音,通过引入Neural Hammer Scalpel模块提升鲁棒性和可解释性,实验显示其在语音解码任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18895 2026-03-20 cs.HC cs.AI cs.LG 62%

From Accuracy to Readiness: Metrics and Benchmarks for Human-AI Decision-Making

从准确到准备:人类-人工智能决策的度量与基准

Min Hun Lee

机构 * Singapore Management University(新加坡国立大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出评估人类-人工智能决策的度量框架,聚焦团队准备度,引入四类评价指标并连接人类-人工智能上boarding生命周期,通过交互轨迹评估校准、错误恢复与治理。

Comments ACM CHI 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02290 2026-03-20 cs.CL cs.AI 62%

Hallucination or Creativity: How to Evaluate AI-Generated Scientific Stories?

幻觉或创造力:如何评估AI生成的科学故事?

Alex Argese, Pasquale Lisena, Raphaël Troncy

机构 * EURECOM

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出StoryScore指标,用于评估AI生成的科学故事,结合语义对齐、词汇 grounding、叙事控制等方法,解决传统指标无法区分教育创造力与事实错误的问题。

Journal ref Proceedings of the Text2Story'26 Workshop, Delft (The Netherlands), 29-March-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09734 2026-03-20 cs.CL cs.AI 62%

From Detection to Diagnosis: Advancing Hallucination Analysis with Automated Data Synthesis

从检测到诊断:通过自动化数据合成推进幻觉分析

Yanyi Liu, Qingwen Yang, Tiezheng Guo, Feiyu Qu, Jun Liu, Yingyou Wen

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出从检测到诊断的新范式,通过自动化数据合成生成高质量训练样本,训练出HDM-4B-RL模型,在幻觉诊断任务中超越现有检测模型,实现更可靠的生成式AI系统。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11248 2026-03-17 cs.LG cs.CL 62%

Reasoning-Grounded Natural Language Explanations for Language Models

基于推理的自然语言解释方法用于语言模型

Vojtech Cahlik, Rodrigo Alves, Pavel Kordik

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种通过推理过程生成可信自然语言解释的方法,通过将推理过程转化为token序列并解码为自然语言,提升解释的准确性与答案质量。

Comments (v2) Added acknowledgements section

Journal ref In: Guidotti, R., Schmid, U., Longo, L. (eds) Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2578. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏