arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-11 至 2026-02-11 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 3 篇

2602.09541 2026-02-11 cs.CV 71%

Scalpel: Fine-Grained Alignment of Attention Activation Manifolds via Mixture Gaussian Bridges to Mitigate Multimodal Hallucination

Scalpel: 通过混合高斯桥梁实现细粒度注意力激活流形对齐以缓解多模态幻觉

Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata

机构 * Fujitsu Research & Development Center Co.,LTD.(Fujitsu 研究与开发中心有限公司) Fujitsu Limited(Fujitsu 有限公司)

专题命中 幻觉与事实性 :alignment(title)

AI总结 Scalpel通过高斯混合模型和熵最优传输减少多模态幻觉,实现注意力激活流形的细粒度对齐,提升视觉-语言模型的输出一致性。

Comments WACV 2026 (It was accepted in the first round, with an acceptance rate of 6%.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22399 2026-02-11 astro-ph.IM cs.AI physics.space-ph 70%

Space AI: Leveraging Artificial Intelligence for Space to Improve Life on Earth

空间AI:利用人工智能推动空间探索,改善地球生活

Ziyang Wang

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出空间AI作为跨学科领域,旨在通过人工智能技术提升太空探索能力,同时为地球带来广泛的社会效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12814 2026-02-11 cs.SI cs.CY 57%

Tiered Anonymity on Social-Media Platforms as a Countermeasure against Deepfakes and LLM-Driven Mass Misinformation

社交媒体平台的分层匿名性:作为对抗深度伪造和大语言模型驱动的虚假信息的对策

David Khachaturov, Roxanne Schnyder, Robert Mullins

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CY

AI总结 本文提出通过三级匿名框架应对深度伪造和大语言模型驱动的虚假信息,通过影响力评分区分用户层级并实施差异化隐私保护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏