arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-23 至 2026-02-23 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 10 篇

2602.17696 2026-02-23 cs.LG cs.AI 81%

Can LLM Safety Be Ensured by Constraining Parameter Regions?

通过约束参数区域能否确保大语言模型的安全性?

Zongmin Li, Jian Su, Farah Benamara, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Institute for Infocomm Research (I 2 R)(信息通信研究所) IRIT, Université de Toulouse, CNRS, Toulouse INP(图卢兹大学IRIT研究所、法国国家科学研究中心) IPAL, CNRS-NUS-A*STAR(IPAL、法国国家科学研究中心-南洋理工大学-A*STAR)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了四种安全区域识别方法,发现其在不同粒度和数据集下重叠程度低,表明现有方法难以可靠地识别稳定的安全区域。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17910 2026-02-23 cs.AI 79%

Alignment in Time: Peak-Aware Orchestration for Long-Horizon Agentic Systems

时间对齐:面向长时间 horizon 代理系统的峰值感知 orchestration

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱维大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 APEMO通过时间-情感信号优化计算分配,提升长horizon代理系统轨迹质量和重用概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17687 2026-02-23 cs.IR cs.AI cs.CL cs.LG 67%

IRPAPERS: A Visual Document Benchmark for Scientific Retrieval and Question Answering

IRPAPERS: 一个用于科学检索和问答的视觉文档基准

Connor Shorten, Augustas Skaburskas, Daniel M. Jones, Charles Pierse, Roberto Esposito, John Trengrove, Etienne Dilocker, Bob van Luijt

机构 * Weaviate

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IRPAPERS基准通过比较图像和文本检索系统,揭示了多模态混合搜索在科学文档检索和问答中的优势。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17672 2026-02-23 cs.HC cs.AI cs.CL cs.CR cs.CY 67%

Assessing LLM Response Quality in the Context of Technology-Facilitated Abuse

评估在技术辅助虐待情境下的LLM响应质量

Vijay Prakash, Majed Almansoori, Donghan Hu, Rahul Chatterjee, Danny Yuxing Huang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文评估了四种LLM在技术辅助虐待情境下的响应质量,揭示其在支持幸存者方面的有效性和局限性,并提出改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18351 2026-02-23 cs.CL cs.AI 62%

Validating Political Position Predictions of Arguments

验证论证中政治立场预测的准确性

Jordan Robinson, Angus R. Williams, Katie Atkinson, Anthony G. Cohn

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出双尺度验证框架,通过点评和成对验证方法验证论证中政治立场预测的准确性,构建了大规模政治立场知识库,提升了政治领域知识表示能力。

Comments 13 pages, 6 figures, 6 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01865 2026-02-23 cs.CL cs.AI 62%

Cross-Lingual Interleaving for Speech Language Models

跨语言交织用于语音语言模型

Adel Moumen, Guangzhi Sun, Philip C. Woodland

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出跨语言交织方法,通过混合多语言语音标记提升SLMs的跨语言理解和生成能力,并发布相关数据集和基准以促进多语言语音模型的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 62%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17999 2026-02-23 cs.HC cs.AI 57%

Aurora: Neuro-Symbolic AI Driven Advising Agent

Aurora:神经符号AI驱动的建议代理

Lorena Amanda Quincoso Lugones, Christopher Kverne, Nityam Sharadkumar Bhimani, Ana Carolina Oliveira, Agoritsa Polyzou, Christine Lisetti, Janki Bhimani

机构 * Florida International University(佛罗里达国际大学) Northeastern University(东北大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Aurora通过神经符号AI结合检索增强生成、符号推理和课程数据库,实现大规模、可验证的学术建议,提升推荐准确性和效率。

Comments Accepted to 41st ACM/SIGAPP Symposium On Applied Computing. 8 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17770 2026-02-23 cs.CV cs.LG 57%

CLUTCH: Contextualized Language model for Unlocking Text-Conditioned Hand motion modelling in the wild

CLUTCH:解锁野外文本条件手部运动建模的上下文化语言模型

Balamurugan Thambiraja, Omid Taheri, Radek Danecek, Giorgio Becherini, Gerard Pons-Moll, Justus Thies

机构 * Technical University of Darmstadt(德累斯顿技术大学) Max-Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tuebingen(图宾根大学) Tubingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 CLUTCH通过引入3D-HIW数据集和SHIFT架构,提出基于LLM的手部动画系统,提升野外手部运动建模的保真度与泛化能力。

Comments ICLR2026; Project page: https://balamuruganthambiraja.github.io/CLUTCH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15605 2026-02-23 cs.CV 50%

GIFT: A Framework Towards Global Interpretable Faithful Textual Explanations of Vision Classifiers

GIFT: 一种面向视觉分类器全局可解释忠实文本解释的框架

Éloi Zablocki, Valentin Gerard, Amaia Cardiel, Eric Gaussier, Matthieu Cord, Eduardo Valle

机构 * Université Grenoble Alpes(法国格勒诺布尔大学) Sorbonne Université(巴黎索邦大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 GIFT提出一种框架,通过生成局部反事实并转化为文本解释,实现视觉分类器的全局可解释和忠实性。

Comments TMLR 2026 (featured certification)

详情

展开后加载摘要…

URL PDF HTML 收藏