arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-20 至 2026-02-20 共收录 19 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 19 篇

2602.17357 2026-02-20 cs.CY 88%

Astra: AI Safety, Trust, & Risk Assessment

Astra:人工智能安全、信任与风险评估

Pranav Aggarwal, Ananya Basotia, Debayan Gupta, Rahul Kulkarni, Shalini Kapoor, Kashyap J., A. Mukundan, Aishwarya Pokhriyal, Anirban Sen, Aryan Shah, Aalok Thakkar

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 Astra提出一个基于实证的人工智能安全风险数据库,通过三元因果分类法评估风险,聚焦印度社会技术景观中的特定挑战,为动态监管框架提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16832 2026-02-20 cs.AI cs.CL 86%

IndicJR: A Judge-Free Benchmark of Jailbreak Robustness in South Asian Languages

IndicJR:一种无裁判的南亚语言对抗鲁棒性基准

Priyaranjan Pattnayak, Sanchari Chowdhuri

机构 * Oracle America Inc.(Oracle美国公司)

专题命中 安全评测 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 IndicJR是一种无裁判的南亚语言对抗鲁棒性基准,揭示了多语言对抗攻击的模式和风险,尤其关注南亚用户的语言转换和罗马化问题。

Comments Accepted in EACL Industry Track Oral, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16943 2026-02-20 cs.AI cs.SE 85%

Mind the GAP: Text Safety Does Not Transfer to Tool-Call Safety in LLM Agents

注意GAP:在LLM代理中,文本安全不转移到工具调用安全

Arnold Cartagena, Ariane Teixeira

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 该研究发现LLM代理中文本安全不等同于工具调用安全,引入GAP基准测试揭示两者差异,强调需专门评估工具调用安全。

Comments 23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17364 2026-02-20 cs.LG cs.AI 81%

A feature-stable and explainable machine learning framework for trustworthy decision-making under incomplete clinical data

一种具有特征稳定性和可解释性的机器学习框架,用于在不完整临床数据下实现可信的决策

Justyna Andrys-Olek, Paulina Tworek, Luca Gherardini, Mark W. Ruddock, Mary Jo Kurt, Peter Fitzgerald, Jose Sousa

机构 * Computational Intelligence, Sano Centre for Computational Personalised Medicine(计算智能,Sano计算个性化医学中心) Clinical Studies Group, Randox Laboratories Ltd., Co.(临床研究组,Randox实验室有限公司)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 CACTUS是一种针对不完整临床数据设计的可解释机器学习框架,通过提升特征稳定性与可解释性,增强模型在缺失数据下的可信决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17106 2026-02-20 cs.AI 79%

Toward Trustworthy Evaluation of Sustainability Rating Methodologies: A Human-AI Collaborative Framework for Benchmark Dataset Construction

迈向可信的可持续性评级方法论评估:一种人机协作框架用于基准数据集构建

Xiaoran Cai, Wang Yang, Xiyu Ren, Chekun Law, Rohit Sharma, Peng Qi

机构 * Columbia University, USA(哥伦比亚大学) Case Western Reserve University, USA(凯斯西储大学) Hong Kong University of Science(香港科学大学) NVIDIA, USA(NVIDIA公司) Informatica Inc., USA(Informatica公司)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出一种人机协作框架,用于构建可信的可持续性评级方法论基准数据集,以提高评分的可比性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16984 2026-02-20 cs.AI 79%

Fundamental Limits of Black-Box Safety Evaluation: Information-Theoretic and Computational Barriers from Latent Context Conditioning

黑盒安全评估的根本限制:从潜在上下文条件化的信息论和计算障碍

Vishal Srivastava

机构 * Whiting School of Engineering(韦斯利工程学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了黑盒安全评估的根本限制,揭示了潜在上下文条件化策略在部署风险估计中的信息论和计算障碍,提出了被动和自适应评估的下界以及计算分离的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17259 2026-02-20 cs.RO 78%

FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment

FRAPPE:通过多未来表示对齐将世界建模注入通用策略

Han Zhao, Jingbo Wang, Wenxuan Song, Shuai Chen, Yang Liu, Yan Wang, Haoang Li, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) South China University of Technology(华南理工大学) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 FRAPPE通过多未来表示对齐提升通用机器人策略的世界建模能力,提高微调效率并减少数据依赖,实验证明其在长时序和未见场景中的泛化性能优于现有方法。

Comments Project Website: https://h-zhao1997.github.io/frappe

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16756 2026-02-20 cs.CR cs.SE 78%

NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist

NESSiE: 必要安全基准 -- 识别不应存在的错误

Johannes Bertram, Jonas Geiping

专题命中 安全评测 :safety(title,abstract)

AI总结 NESSiE提出了一种轻量级安全基准,用于检测大型语言模型中不应存在的安全故障,揭示模型在帮助与安全之间的偏差。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08646 2026-02-20 cs.CL cs.CY 62%

QSTN: A Modular Framework for Robust Questionnaire Inference with Large Language Models

QSTN: 一种用于大型语言模型鲁棒问卷推断的模块化框架

Maximilian Kreutner, Jens Rupprecht, Georg Ahnert, Ahmed Salem, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱比锡社会科学研究所) CSH Vienna(维也纳CSH)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 QSTN是一种模块化框架,通过无需编码的界面实现大型语言模型在问卷推断中的稳健评估与高效响应生成。

Comments Accepted at 2026 EACL System Demonstrations The Python package is available at https://github.com/dess-mannheim/QSTN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04220 2026-02-20 cs.CL cs.AI 62%

BEADs: Bias Evaluation Across Domains

BEADs: 跨领域偏差评估

Shaina Raza, Mizanur Rahman, Michael R. Zhang

机构 * Vector Institute(向量研究所) Royal Bank of Canada(皇家银行) University of Toronto(多伦多大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 BEADs数据集通过跨领域偏差评估,提供广泛NLP任务的偏差检测与模型评估方案,揭示现有模型在人口群体上的系统性偏差问题。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16740 2026-02-20 cs.LG cs.AI 62%

Quantifying LLM Attention-Head Stability: Implications for Circuit Universality

量化大语言模型注意力头的稳定性:对电路通用性的启示

Karan Bali, Jack Stanley, Praneet Suresh, Danilo Bzdok

机构 * Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究量化了大语言模型注意力头的稳定性,发现中层头最不稳定但表示最独特,深层模型中层分歧更明显,权重衰减优化提升稳定性,残差流较稳定,为AI系统白盒监控提供新视角。

Comments Main Body: 8 pages, Total length: 33 pages, Code repo: https://github.com/karanbali/attention_head_seed_stability , Weights repo: https://huggingface.co/karanbali/attention_head_seed_stability

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23339 2026-02-20 cs.AI cs.CL cs.HC 62%

A Scalable Framework for Evaluating Health Language Models

可扩展的健康语言模型评估框架

Neil Mallinar, A. Ali Heydari, Xin Liu, Anthony Z. Faranesh, Brent Winslow, Nova Hammerquist, Benjamin Graef, Cathy Speed, Mark Malhotra, Shwetak Patel, Javier L. Prieto, Daniel McDuff, Ahmed A. Metwally

机构 * Google Research(谷歌研究)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出自适应精确布尔评估框架,用于高效评估健康领域语言模型,提升评估效率和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13469 2026-02-20 cs.HC cs.AI 57%

How Multimodal Large Language Models Support Access to Visual Information: A Diary Study With Blind and Low Vision People

多模态大语言模型如何支持视障人士获取视觉信息:一项与盲人和低视力人士的日记研究

Ricardo E. Gonzalez Penuela, Crescentia Jung, Sharon Y Lin, Ruiying Hu, Shiri Azenkot

机构 * Cornell University(康奈尔大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本研究探讨了多模态大语言模型如何通过视觉助手技能支持视障人士获取视觉信息,并发现其在实际应用中的表现及改进方向。

Comments 24 pages, 17 figures, 7 tables, appendix section, to appear main track CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17185 2026-02-20 cs.HC cs.AI 57%

The Bots of Persuasion: Examining How Conversational Agents' Linguistic Expressions of Personality Affect User Perceptions and Decisions

说服的机器人:探讨对话代理的语言性人格表达如何影响用户感知和决策

Uğur Genç, Heng Gu, Chadha Degachi, Evangelos Niforatos, Senthil Chandrasegaran, Himanshu Verma

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究探讨了对话代理通过语言表达的人格如何影响用户在慈善捐赠中的感知和决策,发现人格特征显著影响用户信任和捐赠行为。

Comments Accepted to be presented at CHI'26 in Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16938 2026-02-20 cs.CL 57%

ConvApparel: A Benchmark Dataset and Validation Framework for User Simulators in Conversational Recommenders

ConvApparel:一种用于对话推荐系统中用户模拟器的基准数据集和验证框架

Ofer Meshi, Krisztian Balog, Sally Goldman, Avi Caciularu, Guy Tennenholtz, Jihwan Jeong, Amir Globerson, Craig Boutilier

机构 * Google(谷歌)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 ConvApparel通过双代理数据收集和反事实验证框架,评估对话推荐系统中用户模拟器的现实差距和泛化能力。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21193 2026-02-20 cs.CL 57%

Estonian Native Large Language Model Benchmark

爱沙尼亚原生大语言模型基准

Helena Grete Lillepalu, Tanel Alumäe

机构 * Department of Software Science, Tallinn University of Technology, Estonia(软件科学系,塔林技术大学,爱沙尼亚)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出爱沙尼亚语言的大语言模型基准,通过七个多样化的数据集评估不同模型的性能,结合人类和LLM评判方法,验证了高性能模型在爱沙尼亚语言评估中的有效性。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17340 2026-02-20 cs.HC 50%

PersonaMail: Learning and Adapting Personal Communication Preferences for Context-Aware Email Writing

PersonaMail: 通过结构化沟通因素探索、细粒度编辑控制和适应性重用策略学习和适应个人通信偏好以实现情境感知的电子邮件写作

Rui Yao, Qiuyuan Ren, Felicia Fang-Yi Tan, Chen Yang, Xiaoyu Zhang, Shengdong Zhao

专题命中 安全评测 :alignment(abstract)

AI总结 PersonaMail通过结构化探索、细粒度编辑和适应性重用策略,提升电子邮件写作中对个人通信偏好的学习与适应能力,提高效率和用户满意度。

Comments 21 pages, 5 figures. Accepted to the 31st International Conference on Intelligent User Interfaces (IUI 26), March 23-26, 2026, Paphos, Cyprus

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14969 2026-02-20 q-bio.GN stat.ML 50%

Robust Machine Learning for Regulatory Sequence Modeling under Biological and Technical Distribution Shifts

在生物和技术分布偏移下鲁棒的机器学习用于调控序列建模

Yiyao Yang

专题命中 安全评测 :safety(abstract)

AI总结 本研究提出了一种鲁棒性框架,通过结合模拟和真实数据分析,评估机器学习模型在生物和技术分布偏移下的性能,发现传统i.i.d.评估无法察觉的鲁棒性缺口,并通过引入生物先验特征和不确定性感知预测提升模型的鲁棒性。

Comments 20 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16926 2026-02-20 cs.CE 50%

BEMEval-Doc2Schema: Benchmarking Large Language Models for Structured Data Extraction in Building Energy Modeling

BEMEval-Doc2Schema:用于建筑能耗建模的结构化数据提取的大型语言模型基准测试

Yiyuan Jia, Xiaoqin Fu, Liang Zhang

专题命中 安全评测 :alignment(abstract)

AI总结 BEMEval-Doc2Schema提出了一种用于评估大型语言模型在建筑能耗建模中结构化数据提取性能的基准测试框架,通过引入KVOR指标和跨模型比较,为未来研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏