arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1755 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1755 篇

2603.13154 2026-03-16 cs.CL cs.AI 62%

ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation

ESG-Bench: 对长上下文 ESG 报告进行基准测试以缓解幻觉

Siqi Sun, Ben Peng Wu, Mali Jin, Peizhen Bai, Hanpei Zhang, Xingyi Song

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ESG-Bench 数据集,用于评估大语言模型在解析 ESG 报告和减少幻觉方面的能力,通过人工标注的 QA 对和细粒度标签,系统评估模型提取和推理 ESG 内容的能力。

Comments To be published in the AAAI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10745 2026-03-12 cs.LG cs.AI 62%

CUPID: A Plug-in Framework for Joint Aleatoric and Epistemic Uncertainty Estimation with a Single Model

CUPID:一种联合估计自然不确定性和本质不确定性的插件框架

Xinran Xu, Xiuyi Fan

机构 * Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(南洋理工大学李科钦医学院,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院,新加坡) Centre for Medical Technologies & Innovations, National Health Group, Singapore(国家健康集团医学技术与创新中心,新加坡)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 CUPID是一种无需修改基础模型即可联合估计自然和本质不确定性的插件框架,适用于多种任务,提供透明且可解释的不确定性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04028 2026-03-05 cs.LG cs.AI cs.CR 62%

A Multi-Dimensional Quality Scoring Framework for Decentralized LLM Inference with Proof of Quality

一种用于去中心化大语言模型推理的多维质量评分框架

Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

机构 * DGrid AI

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多维质量评分框架,用于去中心化LLM推理中的质量评估,通过分解输出质量为多个模块化维度,并通过实验验证其在不同任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20346 2026-03-04 cs.CR cs.AI cs.LG 62%

Multimodal Multi-Agent Ransomware Analysis Using AutoGen

基于AutoGen的多模态多智能体勒索软件分析

Asifullah Khan, Aimen Wadood, Mubashar Iqbal, Umme Zahoora

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于AutoGen的多模态多智能体框架,通过融合静态、动态和网络信息,提升勒索软件分类的准确性和稳定性。

Comments 46 pages, 11 figures and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01907 2026-03-03 cs.LG cs.CL 62%

Efficient RLVR Training via Weighted Mutual Information Data Selection

通过加权互信息数据选择实现高效的RLVR训练

Xinyu Zhou, Boyu Zhu, Haotian Zhang, Huiming Wang, Zhijiang Guo

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 InSight通过加权互信息数据选择方法提升RLVR训练效率,实现性能和加速的显著提升。

Comments 15 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20095 2026-03-03 cs.CV cs.CL cs.LG 62%

BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models

BioCAP: 利用合成描述性注释超越标签在生物基础模型中的应用

Ziheng Zhang, Xinyue Ma, Arpita Chowdhury, Elizabeth G. Campolongo, Matthew J. Thompson, Net Zhang, Samuel Stevens, Hilmar Lapp, Tanya Berger-Wolf, Yu Su, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) Duke University(杜克大学) Boston University(波士顿大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 BioCAP通过生成合成描述性注释提升生物基础模型的性能,实现物种分类和文本-图像检索的高准确率。

Comments ICLR 2026; Project page: https://imageomics.github.io/biocap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25532 2026-03-03 cs.CL cs.AI 62%

Calibrating Verbalized Confidence with Self-Generated Distractors

校准带有自生成干扰项的置信度

Victor Wang, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出DINCO方法,通过自生成干扰项和归一化置信度校准,提升大型语言模型的置信度估计准确性。

Comments ICLR 2026. Code: https://github.com/victorwang37/dinco

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15888 2026-03-03 cs.CL cs.AI 62%

Distribution-Aligned Decoding for Efficient LLM Task Adaptation

面向高效大语言模型任务适应的分布对齐解码

Senkang Hu, Xudong Han, Jinqi Jiang, Yihang Tao, Zihan Fang, Yong Dai, Sam Tak Wu Kwong, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City(香港JC智能城市STEM实验室) City University of Hong Kong(香港城市大学) University of Sussex(苏塞克斯大学) Huazhong University of Science and Technology(华中科技大学) Fudan University(复旦大学) Lingnan University(岭大大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SVDecode通过引导输出分布对齐提升大语言模型任务适应性能,理论证明其与全微调等价,实验显示在多个任务上准确率提升显著。

Comments Accepted by NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09886 2026-02-26 cs.CL cs.AI 62%

Probabilistic distances-based hallucination detection in LLMs with RAG

基于概率距离的LLM中幻觉检测方法(RAG)

Rodion Oblovatny, Alexandra Kuleshova, Konstantin Polev, Alexey Zaytsev

机构 * Markov Lab, Department of Mathematics(马尔可夫实验室,数学系) Computer Science, Saint-Petersburg University(计算机科学,圣彼得堡大学) AI Center, Skoltech(人工智能中心,斯克里普丘克技术学院) SB AI Lab(SB人工智能实验室) AI Center, Skoltech, Risk department, Sber(人工智能中心,斯克里普丘克技术学院,风险部门)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于概率距离的LLM幻觉检测方法,利用提示标记与响应标记嵌入分布的距离来检测幻觉,具有高效性和可迁移性。

Comments Updated approach to constructing a hallucination detection score. Added results from experiments with the NLI task. The approach with trainable deep kernels has been removed, with a focus on the unsupervised approach

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17053 2026-02-24 cs.AI cs.CL 62%

RFEval: Benchmarking Reasoning Faithfulness under Counterfactual Reasoning Intervention in Large Reasoning Models

RFEval: 在大推理模型中评估推理忠实性下的反事实推理干预基准测试

Yunseok Han, Yejoon Lee, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室) IPAI ECE(电子工程系) Seoul National University(首尔国立大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 RFEval通过反事实推理干预评估大推理模型的推理忠实性,发现49.7%的输出不忠实,主要源于立场不一致,强调准确性不能作为忠实性的可靠代理。

Comments Accepted in ICLR 2026 Poster: https://iclr.cc/virtual/2026/poster/10011763

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10587 2026-02-23 cs.CL cs.AI 62%

Anthropomimetic Uncertainty: What Verbalized Uncertainty in Language Models is Missing

拟人化不确定性:语言模型中言语不确定性所缺失的内容

Dennis Ulmer, Alexandra Lorson, Ivan Titov, Christian Hardmeier

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了语言模型中言语不确定性缺失的问题,提出拟人化不确定性的概念,旨在通过模仿人类语言行为提升模型的可信度和人机协作效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17633 2026-02-20 cs.LG cs.AI stat.ML 62%

When to Trust the Cheap Check: Weak and Strong Verification for Reasoning

何时相信廉价检查:弱验证与强验证用于推理

Shayan Kiyani, Sima Noorani, George Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出弱-强验证策略,通过两个阈值结构控制接受和拒绝错误,以提高LLM推理的可靠性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14581 2026-02-17 cs.LG cs.AI 62%

Model-agnostic Selective Labeling with Provable Statistical Guarantees

模型无关的可证明统计保证选择性标注

Huipeng Huang, Wenbo Liao, Huajun Xi, Hao Zeng, Mengchen Zhao, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Department of Mathematics, The Chinese University of HongKong(数学系,香港中文大学) School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出符合性标注方法,通过控制假发现率保证人工智能预测的可信度,从而提升大规模数据标注的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13087 2026-02-16 cs.LG cs.AI 62%

EXCODER: EXplainable Classification Of DiscretE time series Representations

EXCODER: 可解释的时间序列离散表示分类

Yannik Hahn, Antonin Königsfeld, Hasan Tercan, Tobias Meisen

机构 * Institute for Technologies and Management of Digital Transformation (TMDT) University of Wuppertal(数字转型技术与管理研究所(TMDT)乌珀塔尔大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 EXCODER通过将时间序列转换为离散潜在表示,提升分类的可解释性,并提出SSA度量标准验证XAI方法的有效性。

Comments Accepted at PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11388 2026-02-13 cs.LG cs.CL 62%

Sparse Semantic Dimension as a Generalization Certificate for LLMs

稀疏语义维度作为大语言模型的泛化证书

Dibyanayan Bandyopadhyay, Asif Ekbal

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

AI总结 通过稀疏语义维度理论,揭示大语言模型泛化能力源于内部表示的稀疏结构而非参数数量。

Comments Work in progress (17 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08520 2026-02-13 cs.AI cs.LG 62%

Reinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model Reasoning

强化推断:利用不确定性进行自我修正的语言模型推理

Xinhai Sun

机构 * Programme of Management Engineering, Politecnico di Milano(米兰理工学院管理工程项目)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出强化推断方法,通过利用模型不确定性进行自我修正推理,提升语言模型在零样本设置下的准确性,同时减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08272 2026-02-10 cs.LG cs.AI 62%

When Do Multi-Agent Systems Outperform? Analysing the Learning Efficiency of Agentic Systems

多智能体系统何时表现更优?分析智能体系统的学习效率

Junwei Su, Chuan Wu

机构 * Department of Computer Science, University of Hong Kong(计算机科学系,香港大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多智能体强化学习在大语言模型中的学习效率,通过理论分析揭示任务分解与对齐对样本复杂性的影响,明确MARL在特定任务下的优势条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10602 2026-02-10 cs.CV cs.AI cs.CL 62%

TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination Via Latent Truthful-Guided Pre-Intervention

TruthPrInt: 通过潜在真实引导预干预缓解大视觉-语言模型对象幻觉

Jinhao Duan, Fei Kong, Hao Cheng, James Diffenderfer, Bhavya Kailkhura, Lichao Sun, Xiaofeng Zhu, Xiaoshuang Shi, Kaidi Xu

机构 * Drexel University(德雷塞尔大学) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LLNL(劳伦斯利弗莫尔国家实验室) Lehigh University(莱斯大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 TruthPrInt通过学习真相方向并引导解码过程,有效缓解大视觉-语言模型中的对象幻觉问题。

Comments 15 pages, 9 figures, the first two authors contributed equally, Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07164 2026-02-10 cs.CL cs.AI 62%

Your Language Model Secretly Contains Personality Subnetworks

你的语言模型秘密包含个性子网络

Ruimeng Ye, Zihan Wang, Zinan Ling, Yang Xiao, Manling Li, Xiaolong Ma, Bo Hui

机构 * University of Tulsa(图兰大学) Northwestern University(西北大学) University of Arizona(亚利桑那大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大型语言模型内部已嵌入身份子网络,无需外部知识即可实现身份切换和行为调整。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06920 2026-02-09 cs.CL cs.AI 62%

Halluverse-M^3: A multitask multilingual benchmark for hallucination in LLMs

Halluverse-M^3: 一个多任务多语言的幻觉基准测试用于LLMs中的幻觉

Samir Abdaljalil, Parichit Sharma, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) University of Maryland, Baltimore(马里兰大学巴尔的摩分校) Hamad Bin Khalifa University(哈马德·本·卡尔法大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Halluverse-M^3是一个多语言多任务基准测试,用于评估大型语言模型中的幻觉检测性能,涵盖四种语言和两种生成任务,揭示了不同任务和语言下的幻觉检测挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06022 2026-02-06 cs.LG cs.AI 62%

Correctness-Optimized Residual Activation Lens (CORAL): Transferrable and Calibration-Aware Inference-Time Steering

正确性优化残差激活透镜(CORAL):可转移且校准感知的推理时间引导

Miranda Muqing Miao, Young-Min Cho, Lyle Ungar

机构 * Department of Computer and Information Science, University of Pennsylvania, Philadelphia, USA(计算机与信息科学系,宾夕法尼亚大学,费城,美国)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 CORAL通过正则化探针提取模型内部分布式信息,提升推理时多项选择问答的准确性与校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04326 2026-02-05 cs.AI cs.CL cs.MA 62%

From Assumptions to Actions: Turning LLM Reasoning into Uncertainty-Aware Planning for Embodied Agents

从假设到行动:将大语言模型推理转化为具有不确定性的代理规划

SeungWon Seo, SooBin Lim, SeongRae Noh, Haneul Kim, HyeongYeop Kang

机构 * Department of Computer Science and Engineering, Korea University(计算机科学与工程系,韩国大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 PCE框架通过结构化决策树将LLM推理中的假设转化为可靠策略,提升多智能体环境下的规划效率和任务完成率。

Comments 31 pages, 10 figures, Accepted ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03852 2026-02-05 cs.HC cs.AI cs.CY 62%

Perceptions of AI-CBT: Trust and Barriers in Chinese Postgrads

对AI-CBT的认知:中国研究生中的信任与障碍

Chan-in Sio, Alex Mann, Lingxi Fan, Andrew Cheung, Lik-hang Lee

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本研究探讨了中国研究生对AI-CBT聊天机器人在心理健康支持中的信任与障碍,揭示了感知有用性与隐私安全等因素对使用意图的影响。

Comments Accepted and presented in The 30th International Conference on Technologies and Applications of Artificial Intelligence in Taipei, Taiwan on 13-14 December 2025 (TAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02888 2026-02-04 cs.CL cs.AI 62%

HALT: Hallucination Assessment via Log-probs as Time series

HALT:通过log-prob作为时间序列进行幻觉评估

Ahmad Shapiro, Karan Taneja, Ashok Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 HALT通过log-prob时间序列检测幻觉,比Lettuce更高效且兼容专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01956 2026-02-03 cs.LG cs.AI 62%

Efficient Epistemic Uncertainty Estimation for Large Language Models via Knowledge Distillation

通过知识蒸馏实现大型语言模型的高效信念不确定性估计

Seonghyeon Park, Jewon Yeom, Jaewon Sok, Jeongjae Park, Heejun Kim, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Rural Systems Engineering, Seoul National University(首尔国立大学农村系统工程系) Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系) Department of Electrical Engineering and Computer Science, Gwangju Institute of Science and Technology(全州科学科技研究院电子工程与计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过知识蒸馏高效估计大型语言模型的信念不确定性,减少估计误差并提升幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15386 2026-02-03 cs.CL cs.AI 62%

RePPL: Recalibrating Perplexity by Uncertainty in Semantic Propagation and Language Generation for Explainable QA Hallucination Detection

RePPL:通过语义传播和语言生成中的不确定性重新校准困惑度以检测可解释问答幻觉

Yiming Huang, Junyan Zhang, Zihao Wang, Biquan Bie, Yunzhong Qiu, Xuming Hu, Yi R. Fung, Xinlei He

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 RePPL通过校准语义传播和语言生成中的不确定性,提升问答幻觉检测性能,生成token级不确定性评分作为解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00977 2026-02-03 cs.CL cs.LG 62%

Trust in One Round: Confidence Estimation for Large Language Models via Structural Signals

单轮信任:通过结构信号提升大语言模型的置信度估计

Pengyue Yang, Jiawen Wen, Haolin Jin, Linghan Huang, Huaming Chen, Ling Chen

机构 * The University of Sydney(悉尼大学) University of Technology Sydney(技术大学悉尼)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

AI总结 通过分析模型最终层隐藏状态轨迹中的多尺度结构信号,提出结构置信度方法,实现单次通过的高效、稳健置信度估计,适用于高社会影响和资源受限的LLM应用。

Comments Accepted at The ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00279 2026-02-03 cs.CL cs.LG 62%

Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering

在大型语言模型长格式问答中评估不确定性校准的基准测试

Philip Müller, Nicholas Popovič, Michael Färber, Peter Steinbach

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出首个大规模基准,评估大型语言模型在长格式问答中不确定性校准的可靠性,揭示了指令调优和推理过程对校准的影响及ECE指标的局限性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21969 2026-02-02 cs.CL cs.AI 62%

Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding

Token-Guard: 通过自检解码实现token级幻觉控制

Yifan Zhu, Huiqiang Rong, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 Token-Guard通过自检解码技术,实现对大型语言模型中token级幻觉的有效控制,提升生成准确性与输出可靠性。

Comments Accepted by ICLR 2026 main conference

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04418 2026-01-30 cs.LG cs.CL 62%

The Illusion of Certainty: Uncertainty Quantification for LLMs Fails under Ambiguity

确定性的幻觉:在歧义下LLM的不确定性量化失效

Tim Tomov, Dominik Fuchsgruber, Tom Wollschläger, Stephan Günnemann

机构 * School of Computation, Information Technology \& Munich Data Science Institute - Technical University of Munich

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究揭示了在歧义环境下LLM的不确定性量化方法存在缺陷,提出了MAQA*和AmbigQA*数据集以评估模型在歧义数据上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏