arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-26 至 2025-11-26 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2511.19749 2025-11-26 cs.AI 79%

Scaling Item-to-Standard Alignment with Large Language Models: Accuracy, Limits, and Solutions

基于大语言模型的项目-标准对齐扩展:准确性、限制与解决方案

Farzan Karimi-Malekabadi, Pooya Razavi, Sonya Powers

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型在提升项目-标准对齐效率方面的应用,通过实验发现LLMs在识别不一致项目和筛选候选技能方面表现优异,结合过滤策略可显著减少人工工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08087 2025-11-26 cs.CR 75%

Securing Large Language Models: Addressing Bias, Misinformation, and Prompt Attacks

保障大语言模型:应对偏见、虚假信息和提示攻击

Benji Peng, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Junyu Liu, Xinyuan Song, Qian Niu

专题命中 AI治理与伦理 :jailbreak(abstract);red teaming(abstract);prompt injection(abstract)

AI总结 本文探讨了大语言模型在偏见、虚假信息和提示攻击方面的安全问题,分析了偏见缓解策略、内容检测机制及防御措施,强调了对LLM安全领域进一步研究的重要性。

Comments 17 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19979 2025-11-26 cs.IR 67%

The 2nd Workshop on Human-Centered Recommender Systems

人类中心推荐系统研讨会第二届

Kaike Zhang, Jiakai Tang, Du Su, Shuchang Liu, Julian McAuley, Lina Yao, Qi Cao, Yue Feng, Fei Sun

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract)

AI总结 该研讨会旨在推动推荐系统从优化参与度向设计真正理解、参与和惠及人类的系统转变,探讨如何整合人类价值观以提升推荐系统的社会责任感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19886 2025-11-26 cs.CR cs.CV 50%

Frequency Bias Matters: Diving into Robust and Generalized Deep Image Forgery Detection

频率偏差至关重要:深入探讨鲁棒且通用的深度图像伪造检测

Chi Liu, Tianqing Zhu, Wanlei Zhou, Wei Zhao

机构 * Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文从频率视角分析深度图像伪造检测器的通用性和鲁棒性问题,提出两步频率对齐方法以提升检测可靠性并增强反伪造能力。

Comments Accepted for publication in IEEE Transactions on Dependable and Secure Computing

详情

展开后加载摘要…

URL PDF HTML 收藏