arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-02 至 2025-12-02 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2512.01659 2025-12-02 cs.LG cs.AI cs.CL 82%

HalluGraph: Auditable Hallucination Detection for Legal RAG Systems via Knowledge Graph Alignment

HalluGraph: 通过知识图谱对齐实现法律RAG系统的可审计性幻觉检测

Valentin Noël, Elimane Yassine Seidou, Charly Ken Capo-Chichi, Ghanem Amari

机构 * Devoteam

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HalluGraph通过知识图谱对齐技术,为法律RAG系统提供可审计的幻觉检测,实现高精度的实体定位和关系验证,提升法律应用场景的可靠性。

Comments 8 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14776 2025-12-02 cs.CL 70%

COMPASS: Context-Modulated PID Attention Steering System for Hallucination Mitigation

COMPASS:基于上下文调节的PID注意力转向系统用于减少幻觉

Kenji Sahay, Snigdha Pandya, Rohan Nagale, Anna Lin, Shikhar Shiromani, Kevin Zhu, Dev Sunishchal

机构 * Algoverse Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 COMPASS通过上下文调节PID注意力转向系统减少大型语言模型的幻觉,通过可解释的反馈回路提升生成的准确性与可解释性。

Comments 9 pages, 6 figures including algorithmns, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01420 2025-12-02 cs.CL cs.AI 62%

PromptBridge: Cross-Model Prompt Transfer for Large Language Models

PromptBridge: 跨模型提示迁移用于大型语言模型

Yaxuan Wang, Quan Liu, Zhenting Wang, Zichao Li, Wei Wei, Yang Liu, Yujia Bao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 PromptBridge通过跨模型提示迁移技术,解决模型切换时提示效果下降的问题,提升下游任务准确性并减少迁移成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25686 2025-12-02 cs.LG 57%

EXP-CAM: Explanation Generation and Circuit Discovery Using Classifier Activation Matching

EXP-CAM:基于分类器激活匹配的解释生成与电路发现

Pirzada Suhail, Aditya Anand, Amit Sethi

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 EXP-CAM通过分类器激活匹配生成最小且忠实的图像解释,揭示模型内部计算机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22171 2025-12-02 cs.CV 50%

HARMONY: Hidden Activation Representations and Model Output-Aware Uncertainty Estimation for Vision-Language Models

HARMONY:隐藏的激活表示和模型输出感知的不确定性估计用于视觉-语言模型

Erum Mushtaq, Zalan Fabian, Yavuz Faruk Bakman, Anil Ramakrishna, Mahdi Soltanolkotabi, Salman Avestimehr

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 HARMONY通过整合生成token、模型输出不确定性分数和隐藏表示,提升视觉-语言模型的不确定性估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏