arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-12 至 2025-09-12 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2509.09303 2025-09-12 cs.CL 79%

From scratch to silver: Creating trustworthy training data for patent-SDG classification using Large Language Models

Grazia Sveva Ascione, Nicolò Tamagnone

机构 * Department of Industrial Engineering, Polytechnic University of Turin(工业工程系,都灵理工学院) Venice School of Management, Ca Foscari University of Venice(威尼斯管理学院,威尼斯福斯卡里大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08839 2025-09-12 cs.CY 79%

Evaluating the Clinical Safety of LLMs in Response to High-Risk Mental Health Disclosures

Siddharth Shah, Amit Gupta, Aarav Mann, Alexandre Vaz, Benjamin E. Caldwell, Robert Scholz, Peter Awad, Rocky Allemandi, Doug Faust, Harshita Banka, Tony Rousmaniere

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

Comments Previously posted as a preprint on Research Square (DOI: 10.21203/rs.3.rs-7364128/v1), under a CC BY 4.0 License

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08997 2025-09-12 cs.HC 78%

YouthSafe: A Youth-Centric Safety Benchmark and Safeguard Model for Large Language Models

Yaman Yu, Yiren Liu, Jacky Zhang, Yun Huang, Yang Wang

专题命中 安全评测 :safety(title,abstract)

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08852 2025-09-12 cs.CY cs.AI cs.LG 75%

Safe and Certifiable AI Systems: Concepts, Challenges, and Lessons Learned

Kajetan Schweighofer, Barbara Brune, Lukas Gruber, Simon Schmid, Alexander Aufreiter, Andreas Gruber, Thomas Doms, Sebastian Eder, Florian Mayer, Xaver-Paul Stadlbauer, Christoph Schwald, Werner Zellinger, Bernhard Nessler, Sepp Hochreiter

机构 * TRUSTIFAI GMBH(TRUSTIFAI公司) TÜV AUSTRIA HOLDING AG(TÜV奥地利控股公司) Software Competence Center Hagenberg(哈根贝格软件竞争力中心) Johannes Kepler University Linz - Institute for Machine Learning(林茨约瑟夫·约瑟夫斯大学-机器学习研究所)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 63 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08912 2025-09-12 cs.CY cs.HC 74%

Towards Trustworthy AI: Characterizing User-Reported Risks across LLMs "In the Wild"

Lingyao Li, Renkai Ma, Zhaoqian Xue, Junjie Xiong

专题命中 安全评测 :trustworthy(title);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09397 2025-09-12 cs.CV 67%

Decoupling Clinical and Class-Agnostic Features for Reliable Few-Shot Adaptation under Shift

Umaima Rahman, Raza Imam, Mohammad Yaqub, Dwarikanath Mahapatra

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) Khalifa University(卡利法大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09593 2025-09-12 cs.CL cs.AI 62%

Fluent but Unfeeling: The Emotional Blind Spots of Language Models

Bangzhao Shu, Isha Joshi, Melissa Karnaze, Anh C. Pham, Ishita Kakkar, Sindhu Kothe, Arpine Hovasapian, Mai ElSherief

机构 * Northeastern University(东北大学) UC San Diego(加州大学圣地亚哥分校) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Camera-ready version for ICWSM 2026. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09680 2025-09-12 cs.CV cs.CL 57%

FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark

Rongyao Fang, Aldrich Yu, Chengqi Duan, Linjiang Huang, Shuai Bai, Yuxuan Cai, Kun Wang, Si Liu, Xihui Liu, Hongsheng Li

机构 * CUHK(香港中文大学) HKU(香港大学) BUAA(北京航空航天大学) Alibaba(阿里巴巴)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Project page: https://flux-reason-6m.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03700 2025-09-12 cs.HC cs.AI 57%

MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning

Liujian Tang, Shaokang Dong, Yijia Huang, Minqi Xiang, Hongtao Ruan, Bin Wang, Shuo Li, Zhiheng Xi, Zhihui Cao, Hailiang Pang, Heng Kong, He Yang, Mingxu Chai, Zhilin Gao, Xingyu Liu, Yingnan Fu, Jiaming Liu, Xuanjing Huang, Yu-Gang Jiang, Tao Gui, Qi Zhang, Kang Wang, Yunke Zhang, Yuran Wang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01523 2025-09-12 cs.CL 57%

CondAmbigQA: A Benchmark and Dataset for Conditional Ambiguous Question Answering

Zongxi Li, Yang Li, Haoran Xie, S. Joe Qin

机构 * School of Data Science, Lingnan University(数据科学学院) School of Science and Technology, Hong Kong Metropolitan University(科技学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09311 2025-09-12 cs.CV 50%

Image Recognition with Vision and Language Embeddings of VLMs

Illia Volkov, Nikita Kisel, Klara Janouskova, Jiri Matas

机构 * Visual Recognition Group, Faculty of Electrical Engineering, Czech Technical University in Prague(视觉识别组,电气工程学院,布拉格捷克技术大学)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏