arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-16 至 2026-01-16 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 12 篇

2601.02737 2026-01-16 cs.CV 82%

Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench

揭示和弥合MLLMs中的功能感知差距:通过PET-Bench实现原子视觉对齐和分层评估

Zanting Ye, Xiaolong Niu, Xuanbin Wu, Xu Han, Shengyuan Liu, Jing Hao, Zhihao Peng, Hao Sun, Jieqin Lv, Fanghu Wang, Yanchao Huang, Hubing Wu, Yixuan Yuan, Habib Zaidi, Arman Rahmim, Yefeng Zheng, Lijun Lu

机构 * School of Biomedical Engineering, Southern Medical University(生物医学工程学院,南方医科大学) School of Biomedical Engineering, Shanghai Jiaotong University(生物医学工程学院,上海交通大学) Department of Electronic Engineering, Chinese University of Hong Kong(电子工程系,中国香港大学) Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) Department of Nuclear Medicine, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(核医学科,广州中医药大学第二附属医院) PET Center, Department of Nuclear Medicine, Guangdong Provincial People’s Hospital, Southern Medical University(PET中心,核医学科,广东省人民医院,南方医科大学) Department of Nuclear Medicine, Nanfang Hospital, Southern Medical University(核医学科,南芳医院,南方医科大学) Division of Nuclear Medicine and Molecular Imaging, Geneva University Hospitals(核医学与分子影像学部,日内瓦大学医院) Departments of Radiology, Physics, and Biomedical Engineering, The University of British Columbia(放射学、物理和生物医学工程系,不列颠哥伦比亚大学) Medical Artificial Intelligence Laboratory, Westlake University(医学人工智能实验室,西湖大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract)

AI总结 本文提出AVA方法,通过原子视觉对齐解决MLLMs在功能成像中的感知差距,提升诊断准确性14.83%。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09756 2026-01-16 cs.CR cs.AI cs.CL 81%

Synthetic Data for Veterinary EHR De-identification: Benefits, Limits, and Safety Trade-offs Under Fixed Compute

兽医电子健康记录的合成数据:在固定计算下的好处、限制和安全权衡

David Brundage

机构 * University of Wisconsin-Madison, School of Veterinary Medicine(威斯康星大学麦迪逊分校兽医学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了合成数据在兽医电子健康记录去标识化中的应用,发现合成数据在固定预算下无法替代真实数据,但适度混合可提升性能,但需注意训练暴露增加而非数据质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05465 2026-01-16 cs.AI cs.CL 81%

VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models

VAL-Bench:信念一致性作为语言模型价值观对齐的度量标准

Aman Gupta, Denny O'Shea, Fazl Barez

机构 * MasterClass University of Oxford(牛津大学) WhiteBox Martian

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 VAL-Bench通过评估语言模型在现实价值相关提示中的信念一致性,提出了一种衡量价值观对齐的新基准,揭示了不同模型在一致性上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10460 2026-01-16 cs.CL cs.AI cs.CY cs.LG 79%

Contextual StereoSet: Stress-Testing Bias Alignment Robustness in Large Language Models

上下文立体集:在大型语言模型中压力测试偏见对齐的鲁棒性

Abhinaba Basu, Pavan Chakraborty

机构 * Indian Institute of Information Technology, Allahabad (IIITA)(印度信息与技术研究所(Allahabad)) National Institute of Electronics and Information Technology (NIELIT)(国家电子与信息技术研究所)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI、cs.CY

AI总结 上下文立体集通过压力测试大型语言模型在不同上下文中的偏见对齐鲁棒性,揭示固定条件测试的偏见分数可能无法推广。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20323 2026-01-16 cs.CL cs.AI cs.LG 67%

PMOA-TTS: Introducing the PubMed Open Access Textual Times Series Corpus

PMOA-TTS:引入PubMed开放获取文本时间序列语料库

Shahriar Noroozizadeh, Sayantan Kumar, George H. Chen, Jeremy C. Weiss

机构 * Machine Learning Department, School of Computer Science(计算机科学系机器学习部门) Heinz College of Information Systems and Public Policy(信息系统与公共政策学院) National Library of Medicine(国家医学图书馆)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PMOA-TTS通过大规模语言模型管道构建,为时间序列分析提供结构化文本时间线,支持时间推理、生存建模和事件预测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10562 2026-01-16 cs.LG cs.AI cs.CV 62%

Process-Guided Concept Bottleneck Model

过程引导的概念瓶颈模型

Reza M. Asiyabi, SEOSAW Partnership, Steven Hancock, Casey Ryan

机构 * SEOSAW Partnership(SEOSAW合作机构)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 过程引导的概念瓶颈模型通过引入生物物理意义的中间概念,提升科学领域中深度学习模型的可解释性和透明性,减少误差和偏见,同时利用多源数据产生可解释的中间输出。

Comments 13 pages with 7 figures and 1 table, Supplementary Materials 10 pages with 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10122 2026-01-16 cs.CL cs.AI cs.HC 62%

Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends

由大型语言模型驱动的角色扮演代理:现状、挑战与未来趋势

Ye Wang, Jiaxing Chen, Hongjiang Xiao

机构 * Communication University of China(中国传媒大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文系统回顾了由大型语言模型驱动的角色扮演代理的现状、挑战及未来趋势,探讨了关键技术路径与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10455 2026-01-16 cs.CL cs.RO 57%

SurgGoal: Rethinking Surgical Planning Evaluation via Goal-Satisfiability

SurgGoal: 重新思考手术计划评估 via 目标满足性

Ruochen Li, Kun Yuan, Yufei Xia, Yue Zhou, Qingyu Lu, Weihang Li, Youxiang Zhu, Nassir Navab

机构 * Technical University of Munich, Germany(慕尼黑技术大学) University of Strasbourg, France(斯特拉斯堡大学) University of Glasgow, United Kingdom(格拉斯哥大学) Nanyang Technological University, Singapore(南洋理工大学) University of Massachusetts Boston, USA(马萨诸塞大学波士顿分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 SurgGoal通过目标满足性度量重新评估手术计划,揭示视频大语言模型在安全关键环境中的性能问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10406 2026-01-16 cs.AI 57%

ErrEval: Error-Aware Evaluation for Question Generation through Explicit Diagnostics

ErrEval: 通过显式诊断实现的问题生成的误差感知评估

Weiping Fu, Bifan Wei, Jingyi Hao, Yushun Zhang, Jian Zhang, Jiaxin Wang, Bo Li, Yu He, Lingling Zhang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) School of Continuing Education, Xi’an Jiaotong University(继续教育学院,西安交通大学) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, Xi’an(陕西省大数据知识工程重点实验室,西安) Test center, National University of Defense Technology(测试中心,国防科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 ErrEval通过显式诊断机制改进问题生成评估,有效识别并纠正事实性幻觉和答案不匹配等缺陷,提升评估与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07863 2026-01-16 cs.CL 57%

QoSBERT: An Uncertainty-Aware Approach based on Pre-trained Language Models for Service Quality Prediction

QoSBERT:基于预训练语言模型的不确定性感知方法用于服务质量预测

Ziliang Wang, Xiaohong Zhang, Ze Shi Li, Meng Yan

机构 * Key Laboratory of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术重点实验室(北京大学)) School of Computer Science, Peking University(北京大学计算机科学学院) Key Laboratory of Dependable Service Computing in Cyber Physical Society (Chongqing University), Ministry of Education, China(网络物理社会可信服务计算重点实验室(重庆大学)) School of Big Data and Software Engineering, Chongqing University(重庆大学大数据与软件工程学院) Department of Computer Science at the University of Victoria(维多利亚大学计算机科学系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 QoSBERT基于预训练语言模型,通过不确定性估计提升服务质量预测的准确性和可靠性。

Journal ref IEEE Transactions on Services Computing ( Volume: 18, Issue: 6, Nov.-Dec. 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10033 2026-01-16 cs.CL 57%

EmplifAI: a Fine-grained Dataset for Japanese Empathetic Medical Dialogues in 28 Emotion Labels

EmplifAI:一个用于日语共情医疗对话的细粒度数据集,包含28种情绪标签

Wan Jou She, Lis Kanashiro Pereira, Fei Cheng, Sakiko Yahata, Panote Siriaraya, Eiji Aramaki

机构 * Kyoto Institute of Technology, Japan(京都技术大学) National Institute of Information and Communications Technology (NICT), Japan(信息通信技术国家研究所) Kyoto University, Japan(京都大学) Nara Institute of Science and Technology, Japan(奈良科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 EmplifAI是一个用于日语共情医疗对话的细粒度数据集,包含28种情绪标签,通过微调提升了日本LLM的流畅性和共情能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05066 2026-01-16 cs.CV 56%

Beautiful Images, Toxic Words: Understanding and Addressing Offensive Text in Generated Images

美丽的图像,有毒的词语:理解并解决生成图像中的冒犯性文本

Aditya Kumar, Tom Blanchard, Adam Dziedzic, Franziska Boenisch

专题命中 安全评测 :safety(abstract);alignment(comments)

AI总结 本文提出了一种针对生成图像中冒犯性文本的微调策略,并发布了ToxicBench基准,用于评估和改进文本到图像模型的安全性。

Comments Accepted at AAAI 2026 (AI Alignment Track)

详情

展开后加载摘要…

URL PDF HTML 收藏