arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-07 至 2026-01-07 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2601.02364 2026-01-07 cs.IR cs.AI 74%

Towards Trustworthy LLM-Based Recommendation via Rationale Integration

通过推理整合实现可信的基于大语言模型的推荐

Chung Park, Taesan Kim, Hyeongjun Yun, Dongjoon Hong, Junui Hong, Kijung Park, MinCheol Cho, Mira Myong, Jihoon Oh, Min sung Choi

机构 * SK Telecom(SK电信)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文提出基于大语言模型的推荐系统,通过生成逻辑严谨的理由提升推荐的可解释性和性能。

Comments Accepted at RS4SD'25 (CIKM'25 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02669 2026-01-07 cs.CL 70%

Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking

面向大规模语言模型事实核查的全面阶段性基准评估

Hongzhan Lin, Zixin Chen, Zhiqi Shen, Ziyang Luo, Zhen Ye, Jing Ma, Tat-Seng Chua, Guandong Xu

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Salesforce AI Research(Salesforce AI 研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) The Education University of Hong Kong(香港教育大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 FactArena提出一个全面的LLM事实核查阶段基准评估框架,通过标准化流程和动态生成挑战性声明,揭示LLM在事实推理中的鲁棒性与准确性差异。

Comments 17 pages, 21 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03750 2026-01-07 cs.LG cs.AI cs.CL cs.CY 70%

The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems

MASK基准:在人工智能系统中区分诚实与准确性

Richard Ren, Arunim Agarwal, Mantas Mazeika, Cristina Menghini, Robert Vacareanu, Brad Kenstler, Mick Yang, Isabelle Barrass, Alice Gatti, Xuwang Yin, Eduardo Trevino, Matias Geralnik, Adam Khoja, Dean Lee, Summer Yue, Dan Hendrycks

机构 * Center for AI Safety(人工智能安全中心) Scale AI

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出MASK基准,通过大规模人工数据集区分LLM的准确性和诚实性,发现大模型虽更准确但不更诚实,简单干预可提升诚实度,强调需加强评估与干预以确保模型可信。

Comments Website: https://www.mask-benchmark.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03025 2026-01-07 cs.IR cs.AI cs.CL cs.LG 67%

LORE: A Large Generative Model for Search Relevance

LORE:一种大规模生成模型用于搜索相关性

Chenji Lu, Zhuo Chen, Hui Zhao, Zhiyuan Zeng, Gang Zhao, Junjie Ren, Ruicong Xu, Haoran Li, Songyan Liu, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LORE提出了一种基于大规模生成模型的搜索相关性框架,通过两阶段训练和分层部署策略提升搜索效果,为垂直领域提供方法参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21813 2026-01-07 cs.AI cs.CL cs.IR cs.LG 67%

OAEI-LLM-T: A TBox Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching

OAEI-LLM-T:用于理解大规模语言模型幻觉的本体匹配TBox基准数据集

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang, Jing Jiang

机构 * Australian National University(澳大利亚国立大学) Monash University(墨尔本大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OAEI-LLM-T是一个用于研究大规模语言模型在本体匹配中幻觉问题的TBox基准数据集,通过分类幻觉类型并提供评估工具,促进对LLM在OM任务中表现的深入理解。

Comments 14 pages, 4 figures, 4 tables, 2 prompt templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03227 2026-01-07 cs.SD cs.AI 57%

The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization

声纳时刻:在音频地理定位中基准测试音频语言模型

Ruixing Zhang, Zihan Liu, Leilei Sun, Tongyu Zhu, Weifeng Lv

机构 * The State Key Laboratory of Complex and Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北航) Shanghai AI Laboratory(上海人工智能实验室) The Key Laboratory of Data Science and Intelligent Computing, International Innovation Institute, Beihang University(数据科学与智能计算重点实验室,国际创新研究院,北航)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出AGL1K基准,用于评估音频语言模型在音频地理定位中的能力,发现封闭源模型表现更优,语言线索在预测中起主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03120 2026-01-07 cs.AI 57%

A framework for assuring the accuracy and fidelity of an AI-enabled Digital Twin of en route UK airspace

一种确保基于AI的英国空域数字孪生准确性和保真的框架

Adam Keane, Nick Pepper, Chris Burr, Amy Hodgkin, Dewi Gould, John Korna, Marc Thomas

机构 * The Alan Turing Institute(阿尔法·图灵研究院) NATS(国家空中交通服务) Queen Mary University London(伦敦女王学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的数字孪生准确性和保真度保证框架,结合可信和伦理保证方法,为研究人员和监管机构提供评估和讨论数字孪生的结构化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09146 2026-01-07 cs.CL 57%

DoPE: Denoising Rotary Position Embedding

DoPE: 去噪旋转位置嵌入

Jing Xiong, Liyang Fan, Hui Shen, Zunhai Su, Min Yang, Lingpeng Kong, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安阿伯分校) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 DoPE通过去噪旋转位置嵌入提升大型语言模型在长上下文外推和鲁棒性方面的性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02814 2026-01-07 cs.AI 57%

Causal-Enhanced AI Agents for Medical Research Screening

因果增强的医疗研究筛查AI代理

Duc Ngo, Arya Rahgoza

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种因果图增强的AI代理,用于医疗研究筛选,通过显式因果推理和双层知识图谱提升系统综述的准确性和可解释性。

Comments for submission to The 39th Canadian Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02398 2026-01-07 cs.NI cs.AI 57%

AI-Native Integrated Sensing and Communications for Self-Organizing Wireless Networks: Architectures, Learning Paradigms, and System-Level Design

面向自组织无线网络的AI原生集成感知与通信:架构、学习范式与系统级设计

S. Zhang, M. Feizarefi, A. F. Mirzaei

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文综述了AI原生集成感知与通信在自组织无线网络中的架构、学习范式及系统设计,探讨了深度强化学习等方法在动态环境中的应用及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01116 2026-01-07 stat.ME q-bio.QM 50%

Beyond P-Values: Importing Quantitative Finance's Risk and Regret Metrics for AI in Learning Health Systems

超越P值:将定量金融的风险和遗憾度量引入AI在学习健康系统中的应用

Richik Chakraborty

专题命中 安全评测 :safety(abstract)

AI总结 本文提出将定量金融的风险和遗憾度量引入AI在学习健康系统中的应用,以改进对持续学习系统中证据和安全性的评估。

Comments Manuscript: 12 pages, 3 mathematical boxes, 1 figure, 1 table, 26 references

详情

展开后加载摘要…

URL PDF HTML 收藏