arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-29 至 2026-01-29 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 13 篇

2601.20419 2026-01-29 cs.CV cs.AI 79%

Let's Roll a BiFTA: Bi-refinement for Fine-grained Text-visual Alignment in Vision-Language Models

让我们进行BiFTA:用于视觉语言模型中细粒度文本-视觉对齐的双 refinement

Yuhao Sun, Chengyi Cai, Jiacheng Zhang, Zesheng Ye, Xingliang Yuan, Feng Liu

机构 * School of Computing and Information Systems(计算机与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 BiFTA通过视图和描述细化方法提升视觉语言模型中细粒度文本-视觉对齐的零样本性能。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17100 2026-01-29 cs.CV 78%

The SAGES Critical View of Safety Challenge: A Global Benchmark for AI-Assisted Surgical Quality Assessment

SAGES关键安全视角挑战:人工智能辅助手术质量评估的全球基准

Deepak Alapatt, Jennifer Eckhoff, Zhiliang Lyu, Yutong Ban, Jean-Paul Mazellier, Sarah Choksi, Kunyi Yang, Po-Hsing Chiang, Noemi Zorzetti, Samuele Cannas, Daniel Neimark, Omri Bar, Amine Yamlahi, Jakob Hennighausen, Xiaohan Wang, Rui Li, Long Liang, Yuxian Wang, Saurabh Koju, Binod Bhattarai, Tim Jaspers, Zhehua Mao, Anjana Wijekoon, Jun Ma, Yinan Xu, Zhilong Weng, Ammar M. Okran, Hatem A. Rashwan, Boyang Shen, Kaixiang Yang, Yutao Zhang, Hao Wang, 2024 CVS Challenge Consortium, Quanzheng Li, Filippo Filicori, Xiang Li, Pietro Mascagni, Daniel A. Hashimoto, Guy Rosman, Ozanan Meireles, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家医学研究院) ICube(ICube研究中心) UMR7357(法国国家科研机构(UMR7357)) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院) University Hospital Cologne(科隆大学医院) Global College(全球学院) Shanghai Jiao Tong University(上海交通大学) Chang Gung Memorial Hospital(长庚纪念医院) A. Costa Hospital(A. Costa医院) Maggiore Hospital - AUSL Bologna(马吉奥医院 - 玛格丽特医院) Institute for Research against Digestive Cancer (IRCAD)(消化道癌症研究机构(IRCAD)) Lenox Hill Hospital(Lenox Hill医院) Northwell Health(Northwell健康系统) Albany Medical Center(阿尔巴尼医疗中心) German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) Stanford University(斯坦福大学) MultiModal Learning Lab(多模态学习实验室) NAAMII University of Aberdeen(阿伯丁大学) Eindhoven University of Technology(埃因霍温理工大学) UCL Hawkes Institute(UCL Hawkes研究所) Dept of Computer Science, University College London(计算机科学系,伦敦大学学院) University Health Network(大学健康网络) Institute for Biomedical Informatics(生物医学信息研究所) Rovira i Virgili University(罗维拉-维吉里大学) Huazhong University of Science(华中科技大学) Hefei University of Technology(合肥工业大学) University of Pennsylvania(宾夕法尼亚大学) Duke University(杜克大学)

专题命中 安全评测 :safety(title,abstract)

AI总结 SAGES关键安全视角挑战通过全球协作和AI技术,提升手术质量评估的性能和鲁棒性,推动临床应用。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20367 2026-01-29 cs.LG cs.SY eess.SY 70%

Unsupervised Anomaly Detection in Multi-Agent Trajectory Prediction via Transformer-Based Models

基于Transformer模型的多智能体轨迹预测中的无监督异常检测

Qing Lyu, Zhe Fu, Alexandre Bayen

机构 * Electrical Engineering and Computer Sciences(电气工程与计算机科学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出基于Transformer的多智能体轨迹预测无监督异常检测框架,通过预测残差和双评估方案识别安全关键场景,有效捕捉多智能体风险并提供可解释的风险类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20852 2026-01-29 cs.LG cs.CV 57%

C3Box: A CLIP-based Class-Incremental Learning Toolbox

C3Box: 基于CLIP的类增量学习工具箱

Hao Sun, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 C3Box是一个基于CLIP的类增量学习工具箱,整合了多种CIL方法,提供统一框架和标准化流程,提升持续学习研究的可重复性和实用性。

Comments The code is available at https://github.com/LAMDA-CL/C3Box

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09785 2026-01-29 cs.AI 57%

AI Annotation Orchestration: Evaluating LLM verifiers to Improve the Quality of LLM Annotations in Learning Analytics

AI标注协调:评估LLM验证器以提高学习分析中LLM标注的质量

Bakhtawar Ahtisham, Kirk Vanacore, Jinsook Lee, Zhuqian Zhou, Doug Pietrzak, Rene F. Kizilcec

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文通过评估LLM验证器提升学习分析中标注质量,提出灵活的协调框架和实证比较方法,展示验证在提高标注可靠性中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20757 2026-01-29 cs.CL 57%

Persona Prompting as a Lens on LLM Social Reasoning

作为LLM社会推理的镜像:人格提示

Jing Yang, Moritz Hechtbauer, Elisabeth Khalilov, Evelyn Luise Brinkmann, Vera Schmitt, Nils Feldhus

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究探讨了人格提示对LLM社会推理的影响,发现其虽能提升分类效果,但会降低推理质量并加剧偏见。

Comments 9 Pages, EACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20546 2026-01-29 cs.CL 57%

Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models

超越发散性创造:基于人类的大型语言模型创造力评估

Kumiko Nakajima, Jan Zuiderveld, Sandro Pezzelle

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出CDAT任务,基于人类创造力理论,评估LLMs在新颖性与适当性之间的平衡,发现较小模型更具创造力,而高级模型更注重适当性。

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16778 2026-01-29 cs.LG 57%

GCL-OT: Graph Contrastive Learning with Optimal Transport for Heterophilic Text-Attributed Graphs

GCL-OT:基于最优传输的图对比学习用于异质文本属性图

Yating Ren, Yikun Ban, Huobin Tan

机构 * Yating Ren, Yikun Ban, Huobin Tan

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 GCL-OT通过最优传输和定制机制解决文本属性图中的异质性问题,提升结构-文本对齐效果。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03001 2026-01-29 cs.CL 57%

LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation

LEGO-Eval: 向通过工具增强合成3D具身环境的细粒度评估迈进

Gyeom Hwangbo, Hyungjoo Chae, Minseok Kang, Hyeonjong Ju, Soohyun Oh, Jinyoung Yeo

机构 * Yonsei University(延世大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 LEGO-Eval通过工具增强合成3D具身环境,提供细粒度评估框架和基准测试集,提升场景与指令对齐的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14398 2026-01-29 cs.CL 57%

YNTP-100: A Benchmark for Your Next Token Prediction with 100 People

YNTP-100: 一个用于下一步令牌预测的基准,包含100人

Shiyao Ding, Takayuki Ito

机构 * Kyoto University(京都大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 YNTP-100是一个包含100人的多语言对话基准,用于评估个性化响应生成的对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08734 2026-01-29 cs.CL 57%

NurValues: Real-World Nursing Values Evaluation for Large Language Models in Clinical Context

NurValues: 临床情境下大型语言模型护理价值观的现实评估

Ben Yao, Qiuchi Li, Yazhou Zhang, Siyu Yang, Bohan Zhang, Prayag Tiwari, Jing Qin

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Copenhagen(哥本哈根大学) Tianjin University(天津大学) Tongji Hospital of Tongji Medical College of Huazhong University of Science and Technology(华中科技大学同济医学院同济医院) Beijing University of Chinese Medicine(北京中医药大学) Halmstad University(哈马尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 NurValues通过首个护理价值对齐基准,评估LLMs在临床情境中是否符合护理核心价值观,发现通用LLMs在公正维度表现最差。

Comments 39 pages, 9 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13369 2026-01-29 cs.CL 57%

Reducing Hallucinations in Language Model-based SPARQL Query Generation Using Post-Generation Memory Retrieval

通过生成后记忆检索减少基于语言模型的SPARQL查询生成中的幻觉

Aditya Sharma, Christopher J. Pal, Amal Zouaq

机构 * Polytechnique Montréal(蒙特利尔理工学院) Mila - Quebec AI Institute(魁北克人工智能研究院) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出PGMR框架,通过生成后记忆检索减少语言模型生成SPARQL查询时的URI幻觉,提升查询准确性和系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01256 2026-01-29 cs.CV cs.LG 57%

NLPrompt: Noise-Label Prompt Learning for Vision-Language Models

NLPrompt: 噪声标签提示学习用于视觉-语言模型

Bikang Pan, Qun Li, Xiaoying Tang, Wei Huang, Zhen Fang, Feng Liu, Jingya Wang, Jingyi Yu, Ye Shi

机构 * ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心) University of Technology Sydney(悉尼科技大学) University of Melbourne(墨尔本大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 NLPrompt通过结合PromptMAE和PromptOT,提升视觉-语言模型在噪声标签下的提示学习鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏