arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-25 至 2025-12-25 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 2 篇

2512.21107 2025-12-25 cs.CL cs.AI cs.LG 82%

Semi-Supervised Learning for Large Language Models Safety and Content Moderation

大型语言模型安全性和内容审核的半监督学习

Eduard Stefan Dinuta, Iustin Sirbu, Traian Rebedea

机构 * National University of Science and Technology Politehnica Bucharest(波兰技术大学科学与技术国家大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用半监督学习提升大型语言模型的安全性,通过结合标记和未标记数据以及任务特定增强技术,提高安全分类器的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20082 2025-12-25 cs.AI 57%

Adaptive Financial Sentiment Analysis for NIFTY 50 via Instruction-Tuned LLMs , RAG and Reinforcement Learning Approaches

通过指令调优LLMs、RAG和强化学习方法实现NIFTY 50的自适应金融情绪分析

Chaithra, Kamesh Kadimisetty, Biju R Mohan

机构 * National Institute of Technology Karnataka(印度卡纳塔克国家理工学院) Gayatri Vidya Parishad College of Engineering(迦雅利维达帕希拉工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出结合指令调优LLMs、RAG和强化学习的方法,提升NIFTY 50金融情绪分析的准确性和市场适应性。

Comments Accepted in CODS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏