arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1755 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1755 篇

2411.03387 2026-03-13 cs.LG stat.ML 57%

Quantifying Aleatoric Uncertainty of the Treatment Effect: A Novel Orthogonal Learner

量化治疗效应的偶然不确定性:一种新的正交学习者

Valentyn Melnychuk, Stefan Feuerriegel, Mihaela van der Schaar

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种新的正交学习者(AU-learner),用于量化治疗效应的偶然不确定性,通过部分可识别性方法获得CDTE的精确界限,并展示了其在Neyman正交性和准Oracle效率方面的优势。

Journal ref Proceedings of the 38th Conference on Neural Information Processing Systems (NeurIPS 2024), Vancouver, Canada, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11093 2026-03-13 cs.AI cs.RO 57%

A Survey of Reasoning in Autonomous Driving Systems: Open Challenges and Emerging Paradigms

自动驾驶系统推理的综述:开放挑战与新兴范式

Kejin Yu, Yuhan Sun, Taiqiang Wu, Ruixu Zhang, Zhiqiang Lin, Yuxin Meng, Junjie Wang, Yujiu Yang

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文综述了自动驾驶系统推理的挑战与新兴范式,提出认知层次分解驾驶任务,并系统化七个核心推理挑战,强调发展可验证的神经符号架构以解决高延迟推理与安全需求的矛盾。

Comments Published in TMLR (March 2026) | OpenReview: https://openreview.net/forum?id=XwQ7dc4bqn

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08495 2026-03-10 cs.LG stat.ML 57%

Efficient Credal Prediction through Decalibration

通过去校准实现高效的可信预测

Paul Hofman, Timo Löhr, Maximilian Muschalik, Yusuf Sale, Eyke Hüllermeier

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) DFKI (DSA)(德意志联邦防务研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于相对似然的高效可信预测方法,通过去校准技术实现对复杂模型的高效可信集生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11892 2026-03-10 cs.CL 57%

R-WoM: Retrieval-augmented World Model For Computer-use Agents

R-WoM:基于检索的世界模型用于计算机使用代理

Kai Mei, Jiang Guo, Shuaichen Chang, Mingwen Dong, Dongkyu Lee, Xing Niu, Jiarong Jiang

机构 * Rutgers University(罗杰斯大学) AWS Agentic AI(亚马逊敏捷人工智能)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 R-WoM通过整合外部检索知识提升世界模型能力,有效改善长周期模拟中的决策表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07755 2026-03-10 cs.CL 57%

Whitening Reveals Cluster Commitment as the Geometric Separator of Hallucination Types

去噪揭示集群承诺作为幻觉类型的几何分隔器

Matic Korun

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 通过去噪揭示集群承诺作为幻觉类型分离的几何分隔器,证明类型1/2边界是容量限制而非测量伪影。

Comments 9 pages, 2 figures, appendices (reproducibility, sample generation, additional figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07048 2026-03-10 cs.CV cs.AI 57%

Looking Back and Forth: Cross-Image Attention Calibration and Attentive Preference Learning for Multi-Image Hallucination Mitigation

回望与前行:用于多图像幻觉缓解的跨图像注意力校准与关注偏好学习

Xiaochen Yang, Hao Fang, Jiawei Kong, Yaoxin Mao, Bin Chen, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出CAPL框架,通过跨图像注意力校准和偏好学习缓解多图像幻觉问题,提升模型对跨图像关联的建模能力,并在多个任务中取得稳定性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05909 2026-03-09 cs.CL 57%

InfoGatherer: Principled Information Seeking via Evidence Retrieval and Strategic Questioning

InfoGatherer: 通过证据检索和策略性提问进行原理化的信息获取

Maksym Taranukhin, Shuyue Stella Li, Evangelos Milios, Geoff Pleiss, Yulia Tsvetkov, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) CIFAR AI Chair(CIFAR人工智能主席) University of Washington(华盛顿大学) Dalhousie University(达尔豪斯大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 InfoGatherer通过证据检索和策略性提问,结合结构化证据网络和Dempster-Shafer理论,实现原理化的信息获取,提升医疗和法律任务中的可靠性与可解释性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05828 2026-03-09 cs.CL 57%

HART: Data-Driven Hallucination Attribution and Evidence-Based Tracing for Large Language Models

HART: 基于数据的幻觉归因与证据导向追踪用于大语言模型

Shize Liang, Hongzhi Wang

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 HART通过结构化建模方法提升大语言模型幻觉归因与证据追踪的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08445 2026-03-09 cs.CV cs.LG 57%

Uncertainty-Aware Subset Selection for Robust Visual Explainability under Distribution Shifts

考虑不确定性的子集选择以在分布偏移下实现稳健的视觉可解释性

Madhav Gupta, Vishak Prasad C, Ganesh Ramakrishnan

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出一种结合子模子集选择与层间梯度不确定性估计的方法,以提高在分布偏移下的视觉可解释性鲁棒性和保真度。

Comments Accepted to the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04746 2026-03-06 cs.AI cs.HC econ.GN q-fin.EC 57%

Visioning Human-Agentic AI Teaming: Continuity, Tension, and Future Research

展望人机协同AI:连续性、张力与未来研究

Bowen Lou, Tian Lu, T. S. Raghu, Yingjie Zhang

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学) Peking University(北京大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出Team SA理论作为人机协同AI转型的整合锚点,探讨在适应性自主下持续对齐的挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21039 2026-03-06 cs.IR cs.LG 57%

Agentic Multi-Persona Framework for Evidence-Aware Fake News Detection

代理多角色框架用于证据感知的虚假新闻检测

Roopa Bukke, Soumya Pandey, Suraj Kumar, Soumi Chattopadhyay, Chandranath Adak

机构 * Dept. of CSE, Indian Institute of Technology Indore(计算机科学与工程系,印度理工学院印度奥尔德分校) Dept. of CSE, Indian Institute of Technology Patna(计算机科学与工程系,印度理工学院帕纳分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出AMPEND-LS框架,通过LLM与SLM协同作用,实现多模态虚假新闻检测,提升准确率和鲁棒性,增强信息安全性。

Comments 10 pages, 3 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09669 2026-03-05 cs.CL 57%

Query-Level Uncertainty in Large Language Models

查询级不确定性在大语言模型中

Lihu Chen, Gerard de Melo, Fabian M. Suchanek, Gaël Varoquaux

机构 * Imperial College London(伦敦帝国学院) Hasso Plattner Institute / University of Potsdam(霍普夫纳研究所/波茨坦大学) Telecom Paris, Institut Polytechnique de Paris(电信巴黎学院,巴黎理工学院) Soda, Inria Saclay(Soda,法国国家信息与自动化技术研究院萨克利实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 本研究提出了一种无需训练的内部置信度方法,用于检测大语言模型的知识边界,通过查询级不确定性提高回答质量并降低计算成本。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22165 2026-03-04 cs.LG 57%

Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models

思想图景:可视化大语言模型的推理过程

Zhanke Zhou, Zhaocheng Zhu, Xuan Li, Mikhail Galkin, Xiao Feng, Sanmi Koyejo, Jian Tang, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) Stanford University(斯坦福大学) Mila - Québec AI Institute(魁北克 AI 院) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔 HEC 学院) Intel AI Lab(英特尔 AI 实验室)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 提出思想图景(LoT)可视化工具,用于分析大语言模型的推理轨迹,揭示推理模式并提升推理准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01502 2026-03-03 cs.CL eess.AS 57%

Anatomy of the Modality Gap: Dissecting the Internal States of End-to-End Speech LLMs

模态差距的解剖:剖析端到端语音大语言模型的内部状态

Ming-Hao Hsu, Xueyao Zhang, Xiaohai Tian, Jun Zhang, Zhizheng Wu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文研究了端到端语音大语言模型中语音与文本表示的跨层对齐特性,揭示了语音冗余性导致的模态差距问题,并提出未来需在标记或时间粒度上进行优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01426 2026-03-03 cs.CL 57%

Understanding the Physics of Key-Value Cache Compression for LLMs through Attention Dynamics

通过注意力动态理解LLMs中键值缓存压缩的物理原理

Samhruth Ananthanarayanan, Ayan Sengupta, Tanmoy Chakraborty

机构 * IIT Delhi, India(德里印度理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 通过分析LLMs中键值缓存压缩的物理机制,揭示了压缩对内部表示和语义可达性的影响,以及不同架构在路由动态上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24191 2026-03-02 cs.GT cs.AI cs.LO 57%

Resilient Strategies for Stochastic Systems: How Much Does It Take to Break a Winning Strategy?

随机系统中的稳健策略:打破获胜策略需要多大的代价?

Kush Grover, Markel Zubia, Debraj Chakraborty, Muqsit Azeem, Nils Jansen, Jan Kretinsky

机构 * Ruhr University Bochum Germany Nanyang Technological University, Singapore Technical University of Munich \& University of Konstanz Germany Ruhr University Bochum \& Radboud University Nijmegen Germany Masaryk University Czech Republic Ruhr University Bochum Technical University of Munich \& University of Konstanz Ruhr University Bochum \& Radboud University Nijmegen Masaryk University

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文研究了随机系统中稳健策略的定义与问题,探讨了马尔可夫决策过程和随机游戏中的可达性和安全目标,提出了一种基于干扰频率的稳健性度量方法。

Comments To appear in Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08448 2026-03-02 cs.LG 57%

Exploring Cross-model Neuronal Correlations in the Context of Predicting Model Performance and Generalizability

探索预测模型性能和泛化能力的跨模型神经元相关性

Haniyeh Ehsani Oskouie, Sajjad Ghiasvand, Lionel Levine, Majid Sarrafzadeh

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过跨模型神经元相关性评估模型性能和泛化能力,验证了表示对齐作为轻量级兼容性检查的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22814 2026-02-27 cs.AI cs.HC 57%

When Should an AI Act? A Human-Centered Model of Scene, Context, and Behavior for Agentic AI Design

AI何时行动?面向智能体AI设计的场景、情境与行为的人本模型

Soyoung Jung, Daehoo Yoon, Sung Gyu Koh, Young Hwan Kim, Yehan Ahn, Sung Park

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种人本模型,用于设计具有情境敏感性和判断力的智能体AI系统,通过整合场景、情境和人类行为因素,指导智能体的干预行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21701 2026-02-26 cs.LG physics.data-an stat.ML 57%

Learning Complex Physical Regimes via Coverage-oriented Uncertainty Quantification: An application to the Critical Heat Flux

通过覆盖导向的不确定性量化学习复杂物理区域:应用于临界热流的应用

Michele Cazzola, Alberto Ghione, Lucia Sargentini, Julien Nespoulous, Riccardo Finotello

机构 * Université Paris Saclay, Cea(巴黎萨克雷大学,CEA)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 通过覆盖导向的不确定性量化方法,提升对复杂物理区域(如临界热流)的建模能力,实现高预测精度和动态适应的不确定性估计。

Comments 34 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21588 2026-02-26 cs.LG cs.CE 57%

ABM-UDE: Developing Surrogates for Epidemic Agent-Based Models via Scientific Machine Learning

ABM-UDE:通过科学机器学习开发用于流行病代理模型的替代方案

Sharv Murgai, Utkarsh Utkarsh, Kyle C. Nguyen, Alan Edelman, Erin C. S. Acquesta, Christopher Vincent Rackauckas

机构 * Monta Vista High School(蒙塔维斯塔高中) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Sandia National Laboratories(桑塔纳国家实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 ABM-UDE通过科学机器学习开发流行病代理模型的替代方案,利用UDEs学习接触率参数化,提升预测精度与可靠性,实现快速、可解释的流行病模拟。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05598 2026-02-25 cs.IR cs.AI 57%

AgentDR: Dynamic Recommendation with Implicit Item-Item Relations via LLM-based Agents

AgentDR: 通过基于LLM的代理进行动态推荐:利用隐式物品-物品关系

Mingdai Yang, Nurendra Choudhary, Jiangshu Du, Edward W. Huang, Philip S. Yu, Karthik Subbian, Danai Koutra

机构 * Amazon(亚马逊) University of Michigan(密歇根大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 AgentDR通过基于LLM的代理利用隐式物品-物品关系,结合记忆机制和提示策略,提升动态推荐的全排名性能和相关性。

Comments 12 pages, accepted by WWW'26 as long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18763 2026-02-24 cs.CV cs.AI 57%

TAG: Thinking with Action Unit Grounding for Facial Expression Recognition

TAG:基于动作单元的面部表情识别中的思维

Haobo Lin, Tianyi Bai, Jiajun Zhang, Xuanhao Chang, Sheng Lu, Fangming Gu, Zengjie Hu, Wentao Zhang

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 TAG通过基于动作单元的视觉-语言框架,提升面部表情识别的推理可信度和视觉一致性。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16019 2026-02-19 cs.CV cs.AI 57%

MedProbCLIP: Probabilistic Adaptation of Vision-Language Foundation Model for Reliable Radiograph-Report Retrieval

MedProbCLIP: 基于概率适应的视觉-语言基础模型用于可靠放射影像-报告检索

Ahmad Elallaf, Yu Zhang, Yuktha Priya Masupalli, Jeong Yang, Young Lee, Zechun Cao, Gongbo Liang

机构 * Texas A&M University-San Antonio(德克萨斯A&M大学-圣安东尼奥分校) Boise State University(博伊州立大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 MedProbCLIP 通过概率适应提升放射影像与报告检索的可靠性,优于现有基线方法。

Comments Accepted to the 2026 Winter Conference on Applications of Computer Vision (WACV) Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14853 2026-02-17 cs.AI 57%

Uncertainty-Aware Measurement of Scenario Suite Representativeness for Autonomous Systems

面向自主系统的场景套件代表性不确定性测量

Robab Aghazadeh Chakherlou, Siddartha Khastgir, Xingyu Zhao, Jerein Jeyachandran, Shufeng Chen

机构 * WMG, University of Warwick, Coventry, UK(沃森学院,沃里克大学,科文特里,英国)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种概率方法,通过比较场景套件与预期运营领域特征分布,量化自主系统训练数据的代表性,并利用不精确贝叶斯方法处理有限数据和不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13567 2026-02-17 cs.CL 57%

DistillLens: Symmetric Knowledge Distillation Through Logit Lens

DistillLens: 通过Logit Lens实现对称的知识蒸馏

Manish Dhakal, Uthman Jinadu, Anjila Budathoki, Rajshekhar Sunderraman, Yi Ding

机构 * Georgia State University(佐治亚州立大学) Auburn University(阿肯色大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 DistillLens通过Logit Lens对称对齐学生和教师模型的思维过程,提升知识蒸馏性能。

Comments Knowledge Distillation in LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06014 2026-02-16 cs.CV cs.LG 57%

Post-hoc Probabilistic Vision-Language Models

事后概率视觉-语言模型

Anton Baumann, Rui Li, Marcus Klasson, Santeri Mentu, Shyamgopal Karthik, Zeynep Akata, Arno Solin, Martin Trapp

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出一种无需额外训练的VLMs事后不确定性估计方法,通过贝叶斯后验近似和余弦相似度不确定性量化,提升主动学习效率和预测可靠性。

Comments Published at ICLR 2026. Project page: https://aaltoml.github.io/BayesVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11217 2026-02-13 cs.LG 57%

The Magic Correlations: Understanding Knowledge Transfer from Pretraining to Supervised Fine-Tuning

魔法相关性:从预训练到监督微调的知识转移理解

Simin Fan, Dimitris Paparas, Natasha Noy, Binbin Xiong, Noveen Sachdeva, Berivan Isik

机构 * Google Research(谷歌研究) EPFL(瑞士联邦理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究通过分析预训练到监督微调的知识转移,揭示了不同能力类别、基准测试和模型规模间转移可靠性的差异,为模型开发和数据整理提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06025 2026-02-12 cs.LG stat.ML 57%

Out-of-Distribution Detection from Small Training Sets using Bayesian Neural Network Classifiers

从少量训练集出发利用贝叶斯神经网络分类器进行分布外检测

Kevin Raina, Tanya Schmah

机构 * Department of Mathematics and Statistics University of Ottawa(数学与统计学系 马尼托瓦大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于贝叶斯神经网络的分布外检测方法,通过预期logit向量生成得分,并在MNIST和CIFAR-10数据集上验证了其在小训练集下的优越性能。

Comments British Machine Vision Conference (BMVC) 2025; 18 pages, 6 figures, 3 tables

Journal ref https://bmvc2025.bmva.org/proceedings/1187/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12814 2026-02-11 cs.SI cs.CY 57%

Tiered Anonymity on Social-Media Platforms as a Countermeasure against Deepfakes and LLM-Driven Mass Misinformation

社交媒体平台的分层匿名性:作为对抗深度伪造和大语言模型驱动的虚假信息的对策

David Khachaturov, Roxanne Schnyder, Robert Mullins

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CY

AI总结 本文提出通过三级匿名框架应对深度伪造和大语言模型驱动的虚假信息,通过影响力评分区分用户层级并实施差异化隐私保护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08693 2026-02-10 cs.LG 57%

Reasoning aligns language models to human cognition

推理使语言模型对齐人类认知

Gonçalo Guiomar, Elia Torre, Pehuen Moure, Victoria Shavina, Mario Giulianelli, Shih-Chii Liu, Valerio Mante

机构 * ETH AI Center, Zürich, Switzerland ETH Zürich, Switzerland Institute for Neuroinformatics, University of Zürich \& ETH Zürich, Switzerland University College London, London, United Kingdom

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究通过主动概率推理任务揭示语言模型与人类在不确定性决策中的差异,发现延长推理能显著提升推理性能,但对信息获取影响有限。

Comments 38 pages, 4 main figures, multiple appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏