arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1755 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1755 篇

2503.12972 2025-11-24 cs.CV cs.AI 57%

Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning

对齐视觉与语言:无需注释的多模态知识图谱构建以增强大语言模型推理

Junming Liu, Siyuan Meng, Yanting Gao, Song Mao, Pinlong Cai, Guohang Yan, Yirong Chen, Zilin Bian, Ding Wang, Botian Shi

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出 VaLiK 方法,通过跨模态信息补充构建无需注释的多模态知识图谱,提升大语言模型推理能力。

Comments 14 pages, 7 figures, 6 tables; Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16333 2025-11-21 cs.LG 57%

Beyond Generative AI: World Models for Clinical Prediction, Counterfactuals, and Planning

超越生成式AI:用于临床预测、反事实和规划的世界模型

Mohammad Areeb Qazi, Maryam Nadeem, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫莫德·本·扎伊德人工智能大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文探讨了世界模型在医疗领域中的应用,旨在通过预测动态、反事实评估和规划提升临床决策的可靠性。

Comments 2 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15921 2025-11-21 cs.AI 57%

Thinking, Faithful and Stable: Mitigating Hallucinations in LLMs

思考、忠实与稳定:减轻大语言模型幻觉的方法

Chelsea Zou, Yiheng Yao, Basant Khalil

机构 * Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究提出一种通过强化学习策略减少大语言模型幻觉的方法,通过置信度对齐和熵激增信号提升推理的连贯性和准确性。

Comments Originally released June 5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01840 2025-11-20 cs.LG 57%

Optimizing In-Context Learning for Efficient Full Conformal Prediction

Weicao Deng, Sangwoo Park, Min Li, Osvaldo Simeone

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12579 2025-11-18 cs.AI 57%

Enhancing Conversational Recommender Systems with Tree-Structured Knowledge and Pretrained Language Models

Yongwen Ren, Chao Wang, Peng Du, Chuan Qin, Dazhong Shen, Hui Xiong

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04832 2025-11-18 cs.CL 57%

Joint Evaluation of Answer and Reasoning Consistency for Hallucination Detection in Large Reasoning Models

Changyue Wang, Weihang Su, Qingyao Ai, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Quan Cheng Laboratory(泉城实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10227 2025-11-13 cs.LG physics.app-ph 57%

A Certifiable Machine Learning-Based Pipeline to Predict Fatigue Life of Aircraft Structures

Ángel Ladrón, Miguel Sánchez-Domínguez, Javier Rozalén, Fernando R. Sánchez, Javier de Vicente, Lucas Lacasa, Eusebio Valero, Gonzalo Rubio

机构 * ETSIAE-UPM - School of Aeronautics, Universidad Politécnica de Madrid(西班牙马德里理工大学航空学院) Institute for Cross-Disciplinary Physics and Complex Systems (IFISC), CSIC-UIB(跨学科物理与复杂系统研究所(IFISC)) Center for Computational Simulation, Universidad Politécnica de Madrid, Campus de Montegancedo, Boadilla del Monte(马德里理工大学计算模拟中心)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments 34 pages, 17 figures

Journal ref Engineering Failure Analysis, Volume 184, 2026, 110334

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07700 2025-11-12 cs.LG cs.CV eess.IV 57%

On the Role of Calibration in Benchmarking Algorithmic Fairness for Skin Cancer Detection

Brandon Dominique, Prudence Lam, Nicholas Kurtansky, Jochen Weber, Kivanc Kose, Veronica Rotemberg, Jennifer Dy

机构 * Northeastern University(东北大学) Memorial Sloan Kettering Cancer Center(纪念斯隆凯特琳癌症中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

Comments 19 pages, 4 figures. Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:027

Journal ref Machine.Learning.for.Biomedical.Imaging. 3 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07295 2025-11-12 cs.IR cs.AI 57%

Hard vs. Noise: Resolving Hard-Noisy Sample Confusion in Recommender Systems via Large Language Models

Tianrui Song, Wen-Shuo Chao, Hao Liu

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06607 2025-11-11 cs.LG 57%

Explainable Probabilistic Machine Learning for Predicting Drilling Fluid Loss of Circulation in Marun Oil Field

Seshu Kumar Damarla, Xiuli Zhu

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments 5 pages, 3 tables, 4 figrues

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07863 2025-11-11 cs.LG 57%

Robust Hallucination Detection in LLMs via Adaptive Token Selection

Mengjia Niu, Hamed Haddadi, Guansong Pang

机构 * Imperial College London, UK(伦敦帝国学院) Singapore Management University(新加坡管理大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05804 2025-11-11 cs.LG cs.SY eess.SP eess.SY stat.ML 57%

Catching Contamination Before Generation: Spectral Kill Switches for Agents

Valentin Noël

机构 * Devoteam

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments Preprint under review (2025). 9 pages, 2 figures. Code and scripts: to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11196 2025-11-11 cs.CL cs.CV 57%

Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations

Johannes Moll, Markus Graf, Tristan Lemke, Nicolas Lenhart, Daniel Truhn, Jean-Benoit Delbrouck, Jiazhen Pan, Daniel Rueckert, Lisa C. Adams, Keno K. Bressem

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) TUM University Hospital(慕尼黑技术大学医院) German Heart Center TUM University Hospital(慕尼黑技术大学医院德国心脏中心) Department of Radiology(放射科) Klinikum rechts der Isar TUM University Hospital(慕尼黑技术大学医院右岸诊所) Uniklinik RWTH Aachen(亚琛工业大学医院) HOPPR IL USA(HOPPR美国) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted to ML4H 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21257 2025-11-11 cs.CV cs.CL 57%

Hallucination as an Upper Bound: A New Perspective on Text-to-Image Evaluation

Seyed Amir Kasaei, Mohammad Hossein Rohban

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted at GenProCC NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09360 2025-11-10 cs.CL 57%

MetaRAG: Metamorphic Testing for Hallucination Detection in RAG Systems

Channdeth Sok, David Luz, Yacine Haddam

机构 * Forvia Paris Tech Center, GIT, Immeuble Lumière, 40 avenue des Terroirs de France, 75012 Paris, France(巴黎Forvia技术中心,GIT,Lumière大厦,法国巴黎75012)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

Comments Identity-Aware AI workshop at 28th European Conference on Artificial Intelligence, October 25, 2025, Bologna, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23845 2025-11-06 cs.CL 57%

Read Your Own Mind: Reasoning Helps Surface Self-Confidence Signals in LLMs

Jakub Podolak, Rajeev Verma

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

Comments Presented at UncertaiNLP Workshop at EMNLP 2025 https://aclanthology.org/2025.uncertainlp-main.21.pdf

Journal ref UncertaiNLP Workshop at Empirical Methods in Natural Language Processing 2025 (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03166 2025-11-06 cs.CL 57%

Measuring Aleatoric and Epistemic Uncertainty in LLMs: Empirical Evaluation on ID and OOD QA Tasks

Kevin Wang, Subre Abdoul Moktar, Jia Li, Kangshuo Li, Feng Chen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted by UDM-KDD'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01458 2025-11-04 cs.CV cs.AI 57%

When to Trust the Answer: Question-Aligned Semantic Nearest Neighbor Entropy for Safer Surgical VQA

Dennis Pierantozzi, Luca Carlini, Mauro Orazio Drago, Chiara Lena, Cesare Hassan, Elena De Momi, Danail Stoyanov, Sophia Bano, Mobarak I. Hoque

机构 * IRCCS Humanitas Research Hospital(Humanitas研究医院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00419 2025-11-04 cs.CV cs.AI 57%

LGCA: Enhancing Semantic Representation via Progressive Expansion

Thanh Hieu Cao, Trung Khang Tran, Gia Thinh Pham, Tuong Nghiem Diep, Thanh Binh Nguyen

机构 * University of Science, Vietnam National University Ho Chi Minh City, Vietnam(越南胡志明市国家大学科学大学) National University of Singapore, Singapore(新加坡国立大学) AISIA Lab, Ho Chi Minh City, Vietnam(越南胡志明市AISIA实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments 15 pages, 5 figures, to appear in SoICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08809 2025-11-04 cs.LG 57%

Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models

Wei Chen, Xin Yan, Bin Wen, Fan Yang, Tingting Gao, Di Zhang, Long Chen

机构 * HKUST(香港科技大学) University of Waterloo(滑铁卢大学) Kuaishou Technology(快手科技)

专题命中 幻觉与事实性 :DPO(abstract);分类 cs.LG

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12149 2025-11-04 cs.CL cs.MM cs.SI 57%

Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models

Junjie Chen, Xuyang Liu, Subin Huang, Linfeng Zhang, Hang Yu

机构 * Anhui Polytechnic University (AHPU)(安徽工程大学) Shanghai University (SHU)(上海大学) Shanghai Jiao Tong University (SJTU)(上海交通大学) Sichuan University (SCU)(四川大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26769 2025-10-31 cs.CV cs.LG 57%

SteerVLM: Robust Model Control through Lightweight Activation Steering for Vision Language Models

Anushka Sivakumar, Andrew Zhang, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science(计算机科学系) Virginia Tech(弗吉尼亚理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24368 2025-10-29 cs.LG 57%

Filtering instances and rejecting predictions to obtain reliable models in healthcare

Maria Gabriela Valeriano, David Kohan Marzagão, Alfredo Montelongo, Carlos Roberto Veiga Kiffer, Natan Katz, Ana Carolina Lorena

机构 * Instituto de Computação(计算研究所) Universidade Estadual de Campinas(Campinas州立大学) Department of Informatics(信息学院) King’s College London(伦敦国王学院) Núcleo de Telessaúde(远程医疗中心) Universidade Federal do Rio Grande do Sul(鲁汶联邦大学) Escola Paulista de Medicina(巴西圣保罗医学学院) Universidade Federal de São Paulo(圣保罗联邦大学) Divisão de Ciência da Computação(计算机科学部) Instituto Tecnológico de Aeronáutica(航空技术研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments This paper is under review at Machine Learning (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23464 2025-10-29 cs.AI 57%

The Confidence Paradox: Can LLM Know When It's Wrong

Sahil Tripathi, Md Tabrez Nafis, Imran Hussain, Jiechao Gao

机构 * Jamia Hamdard(贾迈亚哈姆达德大学) Center for SDGC, Stanford University(SDGC中心,斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Accepted at the 14th IJCNLP & 4th AACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22614 2025-10-28 cs.SE cs.AI 57%

Does In-IDE Calibration of Large Language Models work at Scale?

Roham Koohestani, Agnia Sergeyuk, David Gros, Claudio Spiess, Sergey Titov, Prem Devanbu, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学) JetBrains Research(JetBrains研究) University of California, Davis(加州大学戴维斯分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20011 2025-10-24 cs.CV cs.LG 57%

Improving Predictive Confidence in Medical Imaging via Online Label Smoothing

Kushan Choudhury, Shubhrodeep Roy, Ankur Chanda, Shubhajit Biswas, Somenath Kuiry

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

Comments Accepted and presented in International Conference on Advancing Science and Technologies in Health Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19997 2025-10-24 cs.SE cs.AI 57%

A Framework for the Adoption and Integration of Generative AI in Midsize Organizations and Enterprises (FAIGMOE)

Abraham Itzhak Weinberg

机构 * AI-WEINBERG, AI Experts(AI-WEINBERG人工智能专家)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19310 2025-10-23 cs.CL 57%

JointCQ: Improving Factual Hallucination Detection with Joint Claim and Query Generation

Fan Xu, Huixuan Zhang, Zhenliang Zhang, Jiahao Wang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) Trustworthy Technology and Engineering Laboratory, Huawei(可信技术与工程实验室,华为)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14345 2025-10-21 q-fin.PM cs.AI 57%

LLM-Enhanced Black-Litterman Portfolio Optimization

Youngbin Lee, Yejin Kim, Juhyeong Kim, Suin Kim, Yongjae Lee

机构 * Elice AI Quant Lab, MODULABS Seoul Republic of Korea Meritz Fire \& Marine Insurance AI Quant Lab, MODULABS Seoul Republic of Korea Mirae Asset Global Investments AI Quant Lab, MODULABS Seoul Republic of Korea Ulsan National Institute of Science Elice AI Quant Lab, MODULABS Meritz Fire \& Marine Insurance AI Quant Lab, MODULABS Mirae Asset Global Investments AI Quant Lab, MODULABS

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Presented at the CIKM 2025 Workshop on Financial AI (https://advancesinfinancialai.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16376 2025-10-21 math.OC cs.AI cs.RO cs.SY eess.SY math.ST stat.TH 57%

Conformal Prediction in The Loop: A Feedback-Based Uncertainty Model for Trajectory Optimization

Han Wang, Chao Ning

机构 * School of Automation and Intelligent Sensing(自动化与智能感知学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏