arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-18 至 2025-11-18 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 8 篇

2511.13290 2025-11-18 cs.AI cs.CL cs.CY 82%

Dropouts in Confidence: Moral Uncertainty in Human-LLM Alignment

Jea Kwon, Luiz Felipe Vecchietti, Sungwon Park, Meeyoung Cha

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00091 2025-11-18 cs.AI cs.CL 81%

Ensemble Debates with Local Large Language Models for AI Alignment

Ephraiem Sarabamoun

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments The manuscript is being withdrawn to incorporate additional revisions and improvements

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12661 2025-11-18 cs.CL 70%

Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge Editing

Yuchen Wu, Liang Ding, Li Shen, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Sydney(悉尼大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05810 2025-11-18 cs.AI cs.CL cs.LG 67%

DiagnoLLM: A Hybrid Bayesian Neural Language Framework for Interpretable Disease Diagnosis

Bowen Xu, Xinyue Zeng, Jiazhen Hu, Tuo Wang, Adithya Kulkarni

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01956 2025-11-18 cs.LG cs.CY stat.ML 62%

EXAGREE: Mitigating Explanation Disagreement with Stakeholder-Aligned Models

Sichao Li, Tommy Liu, Quanling Deng, Amanda S. Barnard

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12579 2025-11-18 cs.AI 57%

Enhancing Conversational Recommender Systems with Tree-Structured Knowledge and Pretrained Language Models

Yongwen Ren, Chao Wang, Peng Du, Chuan Qin, Dazhong Shen, Hui Xiong

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04832 2025-11-18 cs.CL 57%

Joint Evaluation of Answer and Reasoning Consistency for Hallucination Detection in Large Reasoning Models

Changyue Wang, Weihang Su, Qingyao Ai, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Quan Cheng Laboratory(泉城实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11984 2025-11-18 cs.CV 50%

From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology

Zhenhao Guo, Rachit Saluja, Tianyuan Yao, Quan Liu, Junchao Zhu, Haibo Wang, Daniel Reisenbüchler, Yuankai Huo, Benjamin Liechty, David J. Pisapia, Kenji Ikemura, Steven Salvatoree, Surya Seshane, Mert R. Sabuncu, Yihe Yang, Ruining Deng

机构 * New York University(纽约大学) Cornell Tech(康奈尔科技) Vanderbilt University(范德比大学) Carnegie Mellon University(卡内基梅隆大学) University of Regensburg(莱茵河畔大学) Weill Cornell Medicine(韦尔·科恩医学中心) Northwell Health(北well健康)

专题命中 幻觉与事实性 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏