arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1753 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1753 篇

2511.14776 2025-12-02 cs.CL 70%

COMPASS: Context-Modulated PID Attention Steering System for Hallucination Mitigation

COMPASS:基于上下文调节的PID注意力转向系统用于减少幻觉

Kenji Sahay, Snigdha Pandya, Rohan Nagale, Anna Lin, Shikhar Shiromani, Kevin Zhu, Dev Sunishchal

机构 * Algoverse Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 COMPASS通过上下文调节PID注意力转向系统减少大型语言模型的幻觉,通过可解释的反馈回路提升生成的准确性与可解释性。

Comments 9 pages, 6 figures including algorithmns, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23031 2025-12-01 cs.CV cs.AI 70%

From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning

从幻觉到意图:用于视觉-语言推理的视觉理由学习

Changpeng Wang, Haozhe Wang, Xi Chen, Junhan Liu, Taofeng Xue, Chong Peng, Donglian Qi, Fangzhen Lin, Yunfeng Yan

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Meituan(美团)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出视觉理由学习(ViRL),通过将视觉动作作为核心推理元素,提升视觉-语言推理模型的透明度和可信度。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01533 2025-11-21 cs.CR cs.CY 70%

LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution

LightDefense: 一种基于不确定性驱动的轻量级对抗劫持防御方法通过移位词分布

Zhuoran Yang, Yanyong Zhang

专题命中 幻觉与事实性 :safety(abstract);jailbreak(abstract);分类 cs.CY

AI总结 LightDefense通过调整词元分布和利用模型不确定性,提供了一种轻量级的对抗劫持防御方法,有效提升LLM的安全性同时保持对正常查询的有用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10205 2025-11-19 cs.AI 70%

PIXEL: Adaptive Steering Via Position-wise Injection with eXact Estimated Levels under Subspace Calibration

Manjiang Yu, Hongji Li, Priyanka Singh, Xue Li, Di Wang, Lijie Hu

机构 * University of Queensland(昆士兰大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析师实验室) King Abdullah University of Science and Technology (KAUST)(国王 Abdullah 科学与技术大学)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI

Comments 20 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12661 2025-11-18 cs.CL 70%

Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge Editing

Yuchen Wu, Liang Ding, Li Shen, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Sydney(悉尼大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00620 2025-11-04 cs.CL 70%

Certain but not Probable? Differentiating Certainty from Probability in LLM Token Outputs for Probabilistic Scenarios

Autumn Toney-Wails, Ryan Wails

机构 * SciTech Strategies, Inc.(SciTech Strategies公司) Georgetown University(乔治城大学)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

Comments To appear at the Second Workshop on Uncertainty-Aware NLP @EMNLP 2025 (UncertaiNLP '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03136 2025-10-06 cs.CL 70%

Beyond the Final Layer: Intermediate Representations for Better Multilingual Calibration in Large Language Models

Ej Zhou, Caiqi Zhang, Tiancheng Hu, Chengzu Li, Nigel Collier, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02580 2025-10-06 cs.AI 70%

V2X-UniPool: Unifying Multimodal Perception and Knowledge Reasoning for Autonomous Driving

Xuewen Luo, Fengze Yang, Fan Ding, Xiangbo Gao, Shuo Xing, Yang Zhou, Zhengzhong Tu, Chenxi Liu

机构 * University of Utah(犹他大学) Monash University(莫纳什大学) Texas A&M University(德克萨斯农工大学)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17193 2025-07-24 physics.app-ph cs.LG 70%

Spintronic Bayesian Hardware Driven by Stochastic Magnetic Domain Wall Dynamics

Tianyi Wang, Bingqian Dai, Kin Wong, Yaochen Li, Yang Cheng, Qingyuan Shu, Haoran He, Puyang Huang, Hanshen Huang, Kang L. Wang

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03037 2025-06-04 cs.LG stat.ME stat.ML 70%

On the Need to Align Intent and Implementation in Uncertainty Quantification for Machine Learning

Shubhendu Trivedi, Brian D. Nord

机构 * Fermi National Accelerator Laboratory(费米国家加速器实验室) Department of Astronomy and Astrophysics, University of Chicago(芝加哥大学天文学与天体物理学系) Kavli Institute for Cosmological Physics, University of Chicago(芝加哥大学凯弗利宇宙物理研究所)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09301 2025-04-15 cs.AI 70%

Continuum-Interaction-Driven Intelligence: Human-Aligned Neural Architecture via Crystallized Reasoning and Fluid Generation

Pengcheng Zhou, Zhiqiang Nie, Haochen Li

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22573 2025-03-31 cs.CR cs.AI 70%

A Framework for Cryptographic Verifiability of End-to-End AI Pipelines

Kar Balan, Robert Learney, Tim Wood

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments Accepted to 11th ACM International Workshop on Security and Privacy Analytics (IWSPA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05223 2025-03-27 cs.CL 70%

100% Elimination of Hallucinations on RAGTruth for GPT-4 and GPT-3.5 Turbo

Michael C. Wood, Adam A. Forbes

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01695 2025-03-04 cs.CL 70%

Generate, Discriminate, Evolve: Enhancing Context Faithfulness via Fine-Grained Sentence-Level Self-Evolution

Kun Li, Tianhua Zhang, Yunxiang Li, Hongyin Luo, Abdalla Moustafa, Xixin Wu, James Glass, Helen Meng

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18004 2024-12-25 cs.CL 70%

Correctness is not Faithfulness in RAG Attributions

Jonas Wallat, Maria Heuss, Maarten de Rijke, Avishek Anand

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17826 2024-12-05 cs.LG cs.AI cs.CL cs.CY cs.HC stat.ML 70%

Prediction-Powered Ranking of Large Language Models

Ivi Chatzi, Eleni Straitouri, Suhas Thejaswi, Manuel Gomez Rodriguez

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Published at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02655 2024-10-10 cs.CL 70%

Calibrating the Confidence of Large Language Models by Eliciting Fidelity

Mozhi Zhang, Mianqiu Huang, Rundong Shi, Linsen Guo, Chong Peng, Peng Yan, Yaqian Zhou, Xipeng Qiu

专题命中 幻觉与事实性 :alignment(abstract);RLHF(abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13808 2024-08-27 cs.CL 70%

Towards Reliable Medical Question Answering: Techniques and Challenges in Mitigating Hallucinations in Language Models

Duy Khoa Pham, Bao Quoc Vo

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.CL

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07820 2024-08-13 cs.LG 70%

Large Language Models Are Zero-Shot Time Series Forecasters

Nate Gruver, Marc Finzi, Shikai Qiu, Andrew Gordon Wilson

专题命中 幻觉与事实性 :alignment(abstract);RLHF(abstract);分类 cs.LG

Comments NeurIPS 2023. Code available at: https://github.com/ngruver/llmtime

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10114 2024-07-23 cs.CL 70%

TokenSHAP: Interpreting Large Language Models with Monte Carlo Shapley Value Estimation

Roni Goldshmidt, Miriam Horovicz

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00793 2024-06-04 stat.ML cs.LG 70%

Is In-Context Learning in Large Language Models Bayesian? A Martingale Perspective

Fabian Falck, Ziyu Wang, Chris Holmes

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

Comments Accepted at International Conference on Machine Learning (ICML) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03789 2024-04-08 cs.CV cs.AI 70%

Quantifying Uncertainty in Motion Prediction with Variational Bayesian Mixture

Juanwu Lu, Can Cui, Yunsheng Ma, Aniket Bera, Ziran Wang

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments Accepted at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01320 2023-10-25 cs.AI cs.CL cs.CY cs.LG cs.MA 70%

Avalon's Game of Thoughts: Battle Against Deception through Recursive Contemplation

Shenzhi Wang, Chang Liu, Zilong Zheng, Siyuan Qi, Shuo Chen, Qisen Yang, Andrew Zhao, Chaofei Wang, Shiji Song, Gao Huang

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16519 2023-05-29 cs.CL 70%

The Dangers of trusting Stochastic Parrots: Faithfulness and Trust in Open-domain Conversational Question Answering

Sabrina Chiesurin, Dimitris Dimakopoulos, Marco Antonio Sobrevilla Cabezudo, Arash Eshghi, Ioannis Papaioannou, Verena Rieser, Ioannis Konstas

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

Comments 5 pages, ACL Findings 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.02730 2022-11-08 stat.ML cs.LG 70%

Uncertainty-aware predictive modeling for fair data-driven decisions

Patrick Kaiser, Christoph Kern, David Rügamer

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.12807 2022-09-27 cs.LG cs.CV 70%

Out-of-Distribution Detection with Hilbert-Schmidt Independence Optimization

Jingyang Lin, Yu Wang, Qi Cai, Yingwei Pan, Ting Yao, Hongyang Chao, Tao Mei

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.LG

Comments Source code is available at \url{https://github.com/jylins/hood}

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.09625 2021-07-21 cs.CL 70%

Learning ULMFiT and Self-Distillation with Calibration for Medical Dialogue System

Shuang Ao, Xeno Acharya

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.CL

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03528 2026-07-07 cs.LG cs.AI cs.CL 新提交 69%

Aligning Language Models with Selective Prediction

通过选择性预测使语言模型对齐

Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bioinformatics and Computational Biology Program(生物信息学与计算生物学项目) Division of Biostatistics and Health Data Science(生物统计学与健康数据科学部) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG;safety(comments)

AI总结 研究聚焦提升语言模型可靠性,采用选择性预测策略,在模型训练后对齐阶段,提出基于强化学习的框架RLSR,以风险-覆盖曲线下面积为目标,在域内域外任务中风险-覆盖权衡表现更好。

Comments Accepted by ICML 2026 Agents in the Wild: Safety, Security, and Beyond Workshop, Project Page: https://sun-umn.github.io/RLSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28963 2026-06-30 cs.CL cs.CY cs.LG 69%

Beyond the Mean: Three-Axis Fidelity for Aligning LLM-Based Survey Simulators from Small Pilot Data

超越均值:从小型试点数据对齐基于LLM的调查模拟器的三轴保真度

Eun Cheol Choi, Youngrae Kim, Prabhu Pugalenthi, Hong-En Chen, Bo-Ruei Huang

专题命中 幻觉与事实性 :alignment(abstract,comments);分类 cs.CL、cs.CY、cs.LG

AI总结 针对LLM模拟社会调查响应时的系统偏差,提出结构、边际和个体三轴保真度框架,通过提示、修正和微调三种方法对比,发现微调小型试点数据可实现平衡保真度,但保真度水平因子样本而异。

Comments 11 pages, 8 tables, 3 figures; Pluralistic Alignment @ ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02904 2026-04-21 cs.CL cs.AI cs.LG 69%

Enhancing Trust in Large Language Models via Uncertainty-Calibrated Fine-Tuning

通过不确定性校准微调增强大语言模型的信任

Ranganath Krishnan, Piyush Khanna, Omesh Tickoo

机构 * Capital One, AI Labs(Capital One人工智能实验室) Wayve Technologies(Wayve技术公司) Intel Corporation(英特尔公司)

专题命中 幻觉与事实性 :trustworthy(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种不确定性感知微调方法,用于提升大语言模型在自然语言生成任务中的不确定性估计能力,从而提高生成响应的可信度并减少幻觉现象。

Comments ICLR 2026 Trustworthy AI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏