arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1755 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1755 篇

2601.04742 2026-01-09 cs.CL 57%

Tool-MAD: A Multi-Agent Debate Framework for Fact Verification with Diverse Tool Augmentation and Adaptive Retrieval

Tool-MAD: 一种用于事实验证的多智能体辩论框架,具有多样化工具增强和自适应检索

Seyeon Jeong, Yeonjun Choi, JongWook Kim, Beakcheol Jang

机构 * Graduate School of Information, Yonsei University(Yonsei大学信息研究生院) Department of Computer Science, Sangmyung University(Sangmyung大学计算机科学系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 Tool-MAD通过多智能体辩论框架结合多样化工具增强和自适应检索,提升事实验证的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11529 2026-01-09 cs.CL 57%

Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models

通过内部状态和结构化推理一致性检测大语言模型中的幻觉

Yusheng Song, Lirong Qiu, Xi Zhang, Zhihao Tang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 通过内部状态和结构化推理一致性检测大语言模型中的幻觉,提出统一框架解决检测困境,提升事实和逻辑任务的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03860 2026-01-08 cs.CL 57%

PartisanLens: A Multilingual Dataset of Hyperpartisan and Conspiratorial Immigration Narratives in European Media

PartisanLens: 一种多语言的欧洲媒体中极偏见和阴谋论移民叙述数据集

Michele Joshua Maggini, Paloma Piot, Anxo Pérez, Erik Bran Marino, Lúa Santamaría Montesinos, Ana Lisboa, Marta Vázquez Abuín, Javier Parapar, Pablo Gamallo

机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes da USC(乌拉特大学智能技术研究中心) IRLab, CITIC Research Centre, Universidade da Coruña(IR实验室,CITIC研究中心,科鲁纳大学) Universidade de Évora(埃夫拉大学) Universidad de La Rioja(里瓦达维亚大学) GESIS Leibniz Institute for the Social Sciences(莱比锡社会科学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 PartisanLens 是首个多语言数据集,用于研究欧洲媒体中的极偏见和阴谋论移民叙述,评估LLMs在分类和标注中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02562 2026-01-07 cs.LG eess.IV 57%

CutisAI: Deep Learning Framework for Automated Dermatology and Cancer Screening

CutisAI: 用于自动化皮肤科和癌症筛查的深度学习框架

Rohit Kaushik, Eva Kaushik

机构 * Hanson Professional Services USA(Hanson专业服务公司) University of Tennessee Knoxville(田纳西大学肯纳邦克分校) Oak Ridge National Laboratory USA(橡树岭国家实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 CBDC框架结合统计学习理论、拓扑数据分析和贝叶斯符合推断,实现了皮肤病和癌症筛查的高准确率和可信不确定性量化。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02314 2026-01-06 cs.AI 57%

Project Ariadne: A Structural Causal Framework for Auditing Faithfulness in LLM Agents

Project Ariadne: 一种用于审计大语言模型代理忠实性的结构因果框架

Sourena Khanzadeh

机构 * Sourena Khanzadeh(独立研究者)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 Project Ariadne提出一种结构因果框架,通过因果干预评估大语言模型代理推理的忠实性,揭示代理推理与决策之间的因果脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01378 2026-01-06 cs.AI 57%

Empowering Small Language Models with Factual Hallucination-Aware Reasoning for Financial Classification

赋能小型语言模型以实现金融分类的事实幻觉感知推理

Han Yuan, Yilin Wu, Li Zhang, Zheng Ma

机构 * Decision Science Center of Excellence(决策科学中心卓越机构) American Express(美国运通)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出AAAI流程,通过缓解事实幻觉提升小型语言模型在金融分类中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20034 2026-01-05 cs.CV cs.CL 57%

Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore

视觉编码器真的能解释物体幻觉吗?:通过简单细粒度CLIPScore缓解物体幻觉

Hongseok Oh, Wonseok Hwang

机构 * Department of Artificial intelligence University of Seoul(人工智能系首尔大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出F-CLIPScore,通过细粒度文本嵌入缓解LVLM中的物体幻觉问题,显著提升评估准确性。

Comments Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22189 2025-12-30 cs.LG 57%

Physics-Informed Machine Learning for Transformer Condition Monitoring -- Part II: Physics-Informed Neural Networks and Uncertainty Quantification

基于物理的机器学习用于变压器状态监测 -- 第二部分:基于物理的神经网络和不确定性量化

Jose I. Aizpurua

机构 * University of the Basque Country (UPV/EHU)(巴斯克大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出基于物理的神经网络和贝叶斯框架,用于变压器状态监测中的不确定性量化与预测。

Comments 7 pages, 8 figures, published as conference paper in IEEE Advanced Research Workshop on Transformers 2025 as part of the Tutorial delivered with the title "Physics-informed Machine Learning for Transformer Condition Monitoring"

Journal ref 8th International Advanced Research Workshop on Transformers (ARWtr), Baiona, Spain, 2025, pp. 95-101

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01564 2025-12-24 cs.CL 57%

Enhancing Uncertainty Estimation in LLMs with Expectation of Aggregated Internal Belief

通过聚合内部信念期望增强大语言模型的不确定性估计

Zeguan Xiao, Diyang Dou, Boya Xiong, Yun Chen, Guanhua Chen

专题命中 幻觉与事实性 :RLHF(abstract);分类 cs.CL

AI总结 本文提出EAGLE方法,通过聚合内部信念期望提升大语言模型的不确定性估计,改进校准性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19424 2025-12-23 cs.CL 57%

CodeSimpleQA: Scaling Factuality in Code Large Language Models

CodeSimpleQA: 在代码大语言模型中提升事实性

Jian Yang, Wei Zhang, Yizhi Li, Shawn Guo, Haowen Wang, Aishan Liu, Ge Zhang, Zili Wang, Zhoujun Li, Xianglong Liu, Weifeng Lv

机构 * Beihang University(北航大学) Manchester(曼彻斯特) M-A-P StepFun

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 CodeSimpleQA通过构建双语基准测试和后训练框架,提升代码大语言模型在编程知识事实准确性上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15584 2025-12-23 cs.AI cs.GT 57%

A Decision-Theoretic Approach for Managing Misalignment

一种用于管理偏差的决策理论方法

Daniel A. Herrmann, Abinav Chari, Isabelle Qian, Sree Sharvesh, B. A. Levinstein

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Amrita Vishwa Vidyapeetham(阿米特拉维瓦大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种决策理论框架,用于在不确定情况下评估人工智能代理的偏差是否足够,以决定是否委托决策。

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17383 2025-12-23 cs.RO cs.LG 57%

Confidence Calibration in Vision-Language-Action Models

视觉-语言-动作模型中的置信度校准

Thomas P Zollo, Richard Zemel

机构 * Columbia University(哥伦比亚大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出通过提示集合和动作-wise Platt缩放技术,改进视觉-语言-动作模型的置信度校准,以提升机器人行为的可靠性和性能。

Comments 38 pages, 19 figures; additional experiments with VLA variants

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08971 2025-12-23 cs.CL 57%

Structured Language Generation Model: Loss Calibration and Formatted Decoding for Robust Structure Prediction and Knowledge Retrieval

结构语言生成模型:损失校准与格式解码以实现稳健的结构预测与知识检索

Minho Lee, Junghyun Min, Yerang Kim, Woochul Lee, Yeonsoo Lee

机构 * KT Gen AI Lab(KT生成人工智能实验室) Georgetown University(乔治城大学) Korea University(韩国大学) NC AI(NC人工智能)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 SLGM通过损失校准和格式解码提升结构预测和知识检索性能,无需额外参数或数据集特定工程。

Comments 20 pages, 4 figures. FrontierIR at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14851 2025-12-18 cs.LG 57%

Unreliable Uncertainty Estimates with Monte Carlo Dropout

基于蒙特卡洛滴落的不可靠不确定性估计

Aslak Djupskås, Alexander Johannes Stasik, Signe Riemer-Sørensen

机构 * Department of Data Science, Norwegian University of Life Sciences(数据科学系,挪威生命科学大学) SINTEF AS, Department of Mathematics and Cybernetics(SINTEF公司,数学与自动化系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文指出蒙特卡洛滴落在估计不确定性时不可靠,尤其在插值和外推区域表现不佳,不如传统贝叶斯方法可靠。

Comments Accepted for the Northern Lights Deep Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04566 2025-12-17 cs.LG physics.data-an stat.ML 57%

Reliable Statistical Guarantees for Conformal Predictors with Small Datasets

在小数据集上为符合预测器提供可靠的统计保证

Miguel Sánchez-Domínguez, Lucas Lacasa, Javier de Vicente, Gonzalo Rubio, Eusebio Valero

机构 * ETSIAE-UPM - School of Aeronautics, Universidad Politécnica de Madrid(西班牙马德里理工大学航空航天学院) Institute for Cross-Disciplinary Physics and Complex Systems (IFISC), CSIC-UIB(交叉学科物理与复杂系统研究所(IFISC),CSIC-UIB) Center for Computational Simulation, Universidad Politécnica de Madrid, Campus de Montegancedo, Boadilla del Monte(计算模拟中心,马德里理工大学蒙特加森多校区,博阿迪利亚德尔蒙特)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种新的统计保证方法,用于在小数据集上提高符合预测器的可靠性,通过提供覆盖概率信息并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12341 2025-12-16 cs.LG stat.ML 57%

Uncertainty Quantification for Machine Learning: One Size Does Not Fit All

机器学习中的不确定性量化:一大小并不适合所有

Paul Hofman, Yusuf Sale, Eyke Hüllermeier

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种灵活的不确定性度量方法,适用于不同任务和场景,强调根据具体应用定制不确定性量化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11750 2025-12-15 eess.SY cs.LG cs.SY 57%

LUCID: Learning-Enabled Uncertainty-Aware Certification of Stochastic Dynamical Systems

LUCID:基于学习的不确定性感知随机动力系统认证

Ernesto Casablanca, Oliver Schön, Paolo Zuliani, Sadegh Soudjani

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 LUCID通过学习控制障碍证书和傅里叶核展开,为随机动态系统提供鲁棒且高效的认证框架,实现形式安全保证。

Comments The manuscript has been accepted for publication in the main track of AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08938 2025-12-11 cs.HC cs.CY 57%

The Impact of Artificial Intelligence on Strategic Technology Management: A Mixed-Methods Analysis of Resources, Capabilities, and Human-AI Collaboration

人工智能对战略技术管理的影响:资源、能力和人机协作的混合方法分析

Massimo Fascinari, Vincent English

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 本文通过混合方法分析,探讨AI如何提升战略技术管理的有效性,提出AIbSTM框架,强调人机协作而非自主AI领导。

Comments 32 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07334 2025-12-09 cs.AI 57%

Hallucination as a Computational Boundary: A Hierarchy of Inevitability and the Oracle Escape

幻觉作为计算边界:不可避免性层级与 oracle 逃逸

Wang Xi, Quan Shi, Zenghui Ding, Jianqing Gao, Xianjun Yang

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出计算类对齐原则,通过构建计算必要性层级和逃逸路线,为大型语言模型的幻觉问题提供理论框架和解决方案。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12868 2025-12-08 cs.HC cs.AI 57%

As Confidence Aligns: Exploring the Effect of AI Confidence on Human Self-confidence in Human-AI Decision Making

信心相辅:探索AI信心对人类自信心在人类-AI决策中的影响

Jingshu Li, Yitian Yang, Q. Vera Liao, Junti Zhang, Yi-Chieh Lee

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究发现人类自信心与AI置信度相辅相成,且这种一致性在AI退出后仍持续,同时实时反馈会降低一致性,表明两者并非独立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00882 2025-12-04 cs.CV cs.AI 57%

Look, Recite, Then Answer: Enhancing VLM Performance via Self-Generated Knowledge Hints

看、复述、然后回答:通过自动生成的知识提示提升VLM性能

Xisheng Feng

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 通过自动生成的知识提示提升VLM性能,采用模块化设计减少幻觉,实现精准农业中杂草识别准确率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02340 2025-12-03 cs.AI cs.CV 57%

Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective

多视角视觉空间推理的推理路径与潜在状态分析:从认知科学视角

Qiyao Xue, Weichen Liu, Shiqi Wang, Haoming Wang, Yuyang Wu, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 ReMindView-Bench从认知科学视角评估VLMs在多视角空间推理中的表现,揭示其在跨视角对齐和视角取向方面的不足。

Comments 23 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25686 2025-12-02 cs.LG 57%

EXP-CAM: Explanation Generation and Circuit Discovery Using Classifier Activation Matching

EXP-CAM:基于分类器激活匹配的解释生成与电路发现

Pirzada Suhail, Aditya Anand, Amit Sethi

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 EXP-CAM通过分类器激活匹配生成最小且忠实的图像解释,揭示模型内部计算机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23440 2025-12-01 cs.LG cs.AR cs.DC stat.ML 57%

Accelerated Execution of Bayesian Neural Networks using a Single Probabilistic Forward Pass and Code Generation

利用单次概率前向传递和代码生成加速贝叶斯神经网络

Bernhard Klein, Falk Selker, Hendrik Borras, Sophie Steger, Franz Pernkopf, Holger Fröning

机构 * Heidelberg University(海德堡大学) Graz University of Technology(格拉茨技术大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于概率前向传递和代码生成的方法,显著提升贝叶斯神经网络在嵌入式系统中的计算效率和部署性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22004 2025-12-01 stat.ML cs.LG 57%

On the Effect of Regularization on Nonparametric Mean-Variance Regression

关于正则化对非参数均方回归的影响

Eliot Wong-Toi, Alex Boyd, Vincent Fortuin, Stephan Mandt

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文研究了正则化对非参数均方回归模型的影响,通过统计场理论框架揭示了正则化驱动的相变现象,并展示了在UCI和ClimSim数据集上的鲁棒校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21705 2025-12-01 cs.CL cs.CV 57%

Insight-A: Attribution-aware for Multimodal Misinformation Detection

Insight-A: 多模态虚假信息检测中的归因意识

Junjie Wu, Yumeng Fu, Chen Gong, Guohong Fu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 Insight-A通过归因意识和分层推理提升多模态虚假信息检测效果,有效识别伪造来源并增强跨模态一致性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00259 2025-12-01 cs.CL 57%

AutoHall: Automated Factuality Hallucination Dataset Generation for Large Language Models

AutoHall: 自动化生成大语言模型的事实性幻觉数据集

Zouying Cao, Yifei Yang, XiaoJing Li, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(上海可信数据流通与治理Web3重点实验室) School of Media & Communication, Shanghai Jiao Tong University(媒体与传播学院,上海交通大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 AutoHall通过自动化生成模型特定的幻觉数据集,提升大语言模型的事实性内容检测能力。

Comments Accepted by IEEE Transactions on Audio, Speech, and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21401 2025-11-27 cs.CL 57%

Can LLMs extract human-like fine-grained evidence for evidence-based fact-checking?

大语言模型能否提取出具有人类细粒度证据的证据以用于基于证据的事实核查?

Antonín Jarolím, Martin Fajčík, Lucia Makaiová

机构 * Brno University of Technology, Czech Republic(布拉格技术大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文研究了大语言模型在细粒度证据提取任务中的表现,通过新数据集评估发现,模型大小与对齐程度之间存在有效平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20704 2025-11-27 cs.LG stat.ML 57%

Pretraining Transformer-Based Models on Diffusion-Generated Synthetic Graphs for Alzheimer's Disease Prediction

基于扩散生成合成图的Transformer模型预训练用于阿尔茨海默病预测

Abolfazl Moslemi, Hossein Peyvandi

机构 * Sharif University of Technology(谢里夫理工学院) Pasargad Institute for Advanced Innovative Solutions(帕萨尔加德先进创新解决方案研究所)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究提出基于扩散生成合成图的Transformer模型,通过预训练提升阿尔茨海默病预测的准确性和泛化能力。

Comments 14 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17572 2025-11-25 cs.CL cs.SI 57%

Community-Aligned Behavior Under Uncertainty: Evidence of Epistemic Stance Transfer in LLMs

在不确定性下对齐的行为:LLMs中认知立场转移的证据

Patrick Gerard, Aiden Chang, Svitlana Volkova

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本研究通过删除事件知识验证LLMs在无知情况下仍能保持社区特定的行为模式,证明对齐编码了结构化且可推广的行为,推动更安全的LLM部署。

Comments 37 pages, EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏