arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-04 至 2025-11-04 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 7 篇

2511.00126 2025-11-04 cs.LG cs.AI 73%

Dynamic Model Selection for Trajectory Prediction via Pairwise Ranking and Meta-Features

Lu Bowen

机构 * Lu Bowen(路 Bowen)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00620 2025-11-04 cs.CL 70%

Certain but not Probable? Differentiating Certainty from Probability in LLM Token Outputs for Probabilistic Scenarios

Autumn Toney-Wails, Ryan Wails

机构 * SciTech Strategies, Inc.(SciTech Strategies公司) Georgetown University(乔治城大学)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

Comments To appear at the Second Workshop on Uncertainty-Aware NLP @EMNLP 2025 (UncertaiNLP '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05777 2025-11-04 cs.CL cs.AI cs.CY 67%

Medical Hallucinations in Foundation Models and Their Impact on Healthcare

Yubin Kim, Hyewon Jeong, Shan Chen, Shuyue Stella Li, Chanwoo Park, Mingyu Lu, Kumail Alhamoud, Jimin Mun, Cristina Grau, Minseok Jung, Rodrigo Gameiro, Lizhou Fan, Eugene Park, Tristan Lin, Joonsik Yoon, Wonjin Yoon, Maarten Sap, Yulia Tsvetkov, Paul Liang, Xuhai Xu, Xin Liu, Chunjong Park, Hyeonhoon Lee, Hae Won Park, Daniel McDuff, Samir Tulebaev, Cynthia Breazeal

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Seoul National University Hospital(首尔国立大学医院) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01458 2025-11-04 cs.CV cs.AI 57%

When to Trust the Answer: Question-Aligned Semantic Nearest Neighbor Entropy for Safer Surgical VQA

Dennis Pierantozzi, Luca Carlini, Mauro Orazio Drago, Chiara Lena, Cesare Hassan, Elena De Momi, Danail Stoyanov, Sophia Bano, Mobarak I. Hoque

机构 * IRCCS Humanitas Research Hospital(Humanitas研究医院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00419 2025-11-04 cs.CV cs.AI 57%

LGCA: Enhancing Semantic Representation via Progressive Expansion

Thanh Hieu Cao, Trung Khang Tran, Gia Thinh Pham, Tuong Nghiem Diep, Thanh Binh Nguyen

机构 * University of Science, Vietnam National University Ho Chi Minh City, Vietnam(越南胡志明市国家大学科学大学) National University of Singapore, Singapore(新加坡国立大学) AISIA Lab, Ho Chi Minh City, Vietnam(越南胡志明市AISIA实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments 15 pages, 5 figures, to appear in SoICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08809 2025-11-04 cs.LG 57%

Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models

Wei Chen, Xin Yan, Bin Wen, Fan Yang, Tingting Gao, Di Zhang, Long Chen

机构 * HKUST(香港科技大学) University of Waterloo(滑铁卢大学) Kuaishou Technology(快手科技)

专题命中 幻觉与事实性 :DPO(abstract);分类 cs.LG

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12149 2025-11-04 cs.CL cs.MM cs.SI 57%

Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models

Junjie Chen, Xuyang Liu, Subin Huang, Linfeng Zhang, Hang Yu

机构 * Anhui Polytechnic University (AHPU)(安徽工程大学) Shanghai University (SHU)(上海大学) Shanghai Jiao Tong University (SJTU)(上海交通大学) Sichuan University (SCU)(四川大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏