arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-25 至 2025-12-25 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 3 篇

2512.20950 2025-12-25 cs.CL cs.AI cs.IR cs.LG 82%

MultiMind at SemEval-2025 Task 7: Crosslingual Fact-Checked Claim Retrieval via Multi-Source Alignment

多思维在SemEval-2025任务7中的应用:通过多源对齐实现跨语言事实核查声明检索

Mohammad Mahdi Abootorabi, Alireza Ghahramani Kure, Mohammadali Mohammadkhani, Sina Elahimanesh, Mohammad Ali Ali Panah

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TriAligner通过多源对齐和对比学习,实现跨语言事实核查声明的高效检索,提升多语言环境下的信息准确性。

Comments 11 pages Published at the SemEval-2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06433 2025-12-25 cs.CV 78%

Diagnose Like A REAL Pathologist: An Uncertainty-Focused Approach for Trustworthy Multi-Resolution Multiple Instance Learning

像真正的病理科医生一样诊断:一种以不确定性为核心的多分辨率多实例学习方法

Sungrae Hong, Sol Lee, Jisu Shin, Jiwon Jeong, Mun Yong Yi

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 幻觉与事实性 :trustworthy(title,abstract)

AI总结 本文提出UFC-MIL方法,通过多分辨率图像和不确定性校准,提升多实例学习的诊断可靠性。

Comments Accepted by IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20630 2025-12-25 cs.AI 70%

MicroProbe: Efficient Reliability Assessment for Foundation Models with Minimal Data

MicroProbe: 用极少数据高效评估基础模型的可靠性

Aayam Bansal, Ishaan Gangwani

机构 * Aayam Bansal(未知) Ishaan Gangwani(未知)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 MicroProbe通过仅使用100个精心选择的示例,高效评估基础模型可靠性,比随机采样方法提升23.5%的综合分数,显著降低评估成本并保持高覆盖率。

Comments ICML NewInML

详情

展开后加载摘要…

URL PDF HTML 收藏