arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-21 至 2025-10-21 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 6 篇

2510.16257 2025-10-21 cs.CL 79%

Towards Low-Resource Alignment to Diverse Perspectives with Sparse Feedback

Chu Fei Luo, Samuel Dahan, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering & Ingenuity Labs Research Institute(电气与计算机工程系及创新实验室研究机构) Conflict Analytics Lab, Queen’s University(冲突分析实验室,女王大学) Cornell Law School(康奈尔法学院)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

Comments Findings of EMNLP 2025, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17598 2025-10-21 cs.LG cs.AI cs.CL 67%

Hallucination Detection in LLMs Using Spectral Features of Attention Maps

Jakub Binkowski, Denis Janiak, Albert Sawczyn, Bogdan Gabrys, Tomasz Kajdanowicz

机构 * Wroclaw University of Science and Technology(沃拉日-克拉夫大学科学与技术学院) University of Technology Sydney(悉尼技术大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025. Code available at https://github.com/graphml-lab-pwr/lapeigvals

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14345 2025-10-21 q-fin.PM cs.AI 57%

LLM-Enhanced Black-Litterman Portfolio Optimization

Youngbin Lee, Yejin Kim, Juhyeong Kim, Suin Kim, Yongjae Lee

机构 * Elice AI Quant Lab, MODULABS Seoul Republic of Korea Meritz Fire \& Marine Insurance AI Quant Lab, MODULABS Seoul Republic of Korea Mirae Asset Global Investments AI Quant Lab, MODULABS Seoul Republic of Korea Ulsan National Institute of Science Elice AI Quant Lab, MODULABS Meritz Fire \& Marine Insurance AI Quant Lab, MODULABS Mirae Asset Global Investments AI Quant Lab, MODULABS

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Presented at the CIKM 2025 Workshop on Financial AI (https://advancesinfinancialai.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16376 2025-10-21 math.OC cs.AI cs.RO cs.SY eess.SY math.ST stat.TH 57%

Conformal Prediction in The Loop: A Feedback-Based Uncertainty Model for Trajectory Optimization

Han Wang, Chao Ning

机构 * School of Automation and Intelligent Sensing(自动化与智能感知学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16359 2025-10-21 cs.CL 57%

Utilising Large Language Models for Generating Effective Counter Arguments to Anti-Vaccine Tweets

Utsav Dhanuka, Soham Poddar, Saptarshi Ghosh

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments 14 pages, 1 figure, work done as a part of B.Tech project at IIT Kharagpur

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13169 2025-10-21 cs.CV 50%

Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling

Tsung-Han Wu, Heekyung Lee, Jiaxin Ge, Joseph E. Gonzalez, Trevor Darrell, David M. Chan

机构 * UC Berkeley(加州大学伯克利分校) POSTECH

专题命中 幻觉与事实性 :safety(abstract)

Comments Accepted to NeurIPS 2025; Project Page: https://reverse-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏