arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-23 至 2026-01-23 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 17 篇

2601.15714 2026-01-23 cs.LG cs.AI cs.CL 85%

Even GPT-5.2 Can't Count to Five: The Case for Zero-Error Horizons in Trustworthy LLMs

即使GPT-5.2也无法数到五:可信大语言模型中的零误差视野案例

Ryoma Sato

机构 * National Institute of Informatics(国家信息研究所)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出零误差视野(ZEH)用于评估可信大语言模型的无错误解决范围,通过分析GPT-5.2和Qwen2.5发现其在简单任务上的错误,揭示算法能力的涌现特性,并提出降低计算成本的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13137 2026-01-23 cs.CL 79%

Adversarial Alignment: Ensuring Value Consistency in Large Language Models for Sensitive Domains

对抗对齐:确保大型语言模型在敏感领域中的价值一致性

Yuan Gao, Zhigang Liu, Xinyu Yao, Bo Chen, Xiaobing Zhao

机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) National Language Resource Monitoring and Research Center of Minority Languages(少数民族语言资源监测与研究中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出对抗对齐框架,通过持续预训练、指令微调和对抗训练提升大型语言模型在敏感领域中的价值一致性,实验表明其优于现有主流模型。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15211 2026-01-23 cs.AI stat.AP 79%

Embracing Ambiguity: Bayesian Nonparametrics and Stakeholder Participation for Ambiguity-Aware Safety Evaluation

拥抱模糊性:基于贝叶斯非参数方法和利益相关者参与的模糊性感知安全评估

Yanan Long

专题命中 安全评测 :safety(title);trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于贝叶斯非参数方法和利益相关者参与的框架,用于模糊性感知的安全评估,通过量化尾部风险和整合利益相关者偏好提升生成模型的可信度。

Comments AAAI 2026 workshop MURE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15706 2026-01-23 cs.AI 70%

Improving Methodologies for LLM Evaluations Across Global Languages

提升跨全球语言的LLM评估方法

Akriti Vij, Benjamin Chua, Darshini Ramiah, En Qi Ng, Mahran Morsidi, Naga Nikshith Gangarapu, Sharmini Johnson, Vanessa Wilfred, Vikneswaran Kumaran, Wan Sie Lee, Wenzhuo Yang, Yongsen Zheng, Bill Black, Boming Xia, Frank Sun, Hao Zhang, Qinghua Lu, Suyu Ma, Yue Liu, Chi-kiu Lo, Fatemeh Azadi, Isar Nejadgholi, Sowmya Vajjala, Agnes Delaborde, Nicolas Rolin, Tom Seimandi, Akiko Murakami, Haruto Ishi, Satoshi Sekine, Takayuki Semitsu, Tasuku Sasaki, Angela Kinuthia, Jean Wangari, Michael Michie, Stephanie Kasaon, Hankyul Baek, Jaewon Noh, Kihyuk Nam, Sang Seo, Sungpil Shin, Taewhi Lee, Yongsu Kim, Daisy Newbold-Harrop, Jessica Wang, Mahmoud Ghanem, Vy Hong

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本研究通过多语言评估活动,探讨了不同语言环境下LLM安全行为的差异,并提出了改进多语言安全评估的方法论建议。

Comments Author names have been organised by country, and in alphabetical order within countries

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15429 2026-01-23 cs.CL 70%

Domain-Specific Knowledge Graphs in RAG-Enhanced Healthcare LLMs

在增强医疗LLM中的领域特定知识图谱

Sydney Anuyah, Mehedi Mahmud Kaushik, Hao Dai, Rakesh Shiradkar, Arjan Durresi, Sunandan Chakraborty

机构 * Luddy School of Informatics, Computing, and Engineering, Indiana University, Indianapolis, IN, USA(信息学、计算与工程学院,印第安纳大学,印第安纳波利斯,IN,USA) School of Medicine, Indiana University, Indianapolis, IN, USA(医学学院,印第安纳大学,印第安纳波利斯,IN,USA) Department of Biomedical Engineering and Informatics, Indiana University, Indianapolis, IN, USA(生物医学工程与信息学系,印第安纳大学,印第安纳波利斯,IN,USA)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 该研究探讨了在医疗LLM中利用领域特定知识图谱提升检索增强生成的效果,发现精准匹配的图谱检索优于随意联合,且模型大小和温度对性能影响各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05867 2026-01-23 cs.CR cs.CL 70%

Can LLM Infer Risk Information From MCP Server System Logs?

LLM能否从MCP服务器系统日志中推断风险信息?

Jiayi Fu, Yuansen Zhang, Yinggui Wang

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 本文提出首个评估LLM从MCP服务器系统日志中识别安全风险的合成基准,通过训练不同模型展示强化学习在提升LLM安全性能中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15511 2026-01-23 cs.CL cs.CY 62%

AdversaRiskQA: An Adversarial Factuality Benchmark for High-Risk Domains

AdversaRiskQA: 面向高风险领域的对抗事实性基准

Adam Szelestey, Sofie van Engelen, Tianhao Huang, Justin Snelders, Qintao Zeng, Songgaojun Deng

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 AdversaRiskQA是一个面向高风险领域的对抗事实性基准,通过评估LLM在不同领域和难度下的事实性表现,揭示模型弱点并提升高风险应用的可靠性。

Comments 13 pages, 4 figures, and 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15816 2026-01-23 eess.SY cs.AI cs.SY 57%

Virtual Traffic Police: Large Language Model-Augmented Traffic Signal Control for Unforeseen Incidents

虚拟交通警察:基于大语言模型的交通信号控制用于突发事件

Shiqi Wei, Qiqing Wang, Kaidi Yang

机构 * Department of Civil and Environmental Engineering, National University of Singapore(环境与土木工程系,新加坡国立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的交通信号控制框架,通过虚拟交通警察代理实时调整信号控制器参数,提升应对突发事件的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15721 2026-01-23 cs.IR cs.AI 57%

CoNRec: Context-Discerning Negative Recommendation with LLMs

CoNRec:基于大语言模型的上下文辨识负向推荐

Xinda Chen, Jiawei Wu, Yishuang Liu, Jialin Zhu, Shuwen Xiao, Junjun Zheng, Xiangheng Kong, Yuning Jiang

机构 * Alibaba Inc.(阿里巴巴公司) Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 CoNRec提出了一种基于大语言模型的负向反馈建模框架,通过上下文辨识模块和渐进式训练方法,提升对用户负向偏好的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15558 2026-01-23 cs.CL 57%

From Generation to Collaboration: Using LLMs to Edit for Empathy in Healthcare

从生成到协作:利用LLMs编辑以增强医疗中的同理心

Man Luo, Bahareh Harandizadeh, Amara Tariq, Halim Abbas, Umar Ghaffar, Christopher J Warren, Segun O. Kolade, Haidar M. Abdul-Muhsin

机构 * Science team(科学团队) Abridge Mayo Clinic(梅奥诊所) Department of AI & Informatics(人工智能与信息学部门) Urology Department(泌尿科部门)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本研究利用LLMs作为编辑工具,通过优化医生书面回应增强医疗中的同理心,同时保持事实准确性,提出新的评估指标并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15533 2026-01-23 cs.AI 57%

From Generative Engines to Actionable Simulators: The Imperative of Physical Grounding in World Models

从生成引擎到可操作模拟器:世界模型中物理基础的必要性

Zhikang Chen, Tingting Zhu

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出将世界模型重新定义为可操作模拟器,强调因果结构和约束意识,以提升医疗决策中的反事实推理和长期预见能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15476 2026-01-23 cs.AI cs.PF 57%

Reliability by design: quantifying and eliminating fabrication risk in LLMs. From generative to consultative AI: a comparative analysis in the legal domain and lessons for high-stakes knowledge bases

可靠性设计:量化并消除大语言模型中的制造风险。从生成式到咨询式AI:法律领域中的比较分析及对高风险知识库的启示

Alex Dantart

机构 * Humanizing Internet

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过减少幻觉提升大语言模型在法律领域的可靠性,引入两种可靠性指标,并展示先进的 RAG 系统有效降低伪造事实率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24257 2026-01-23 cs.CR cs.LG 57%

VeriLLM: A Lightweight Framework for Publicly Verifiable Decentralized Inference

VeriLLM:一种轻量级的公开可验证去中心化推理框架

Ke Wang, Zishuo Zhao, Xinyuan Song, Zelin Li, Libin Xia, Chris Tong, Bill Shi, Wenjie Qu, Eric Yang, Lynn Ai

机构 * University of Illinois Urbana-Champaign, Gradient(伊利诺伊大学厄巴纳-香槟分校,Gradient) Emory University(埃默里大学) Ohio State University(俄亥俄州立大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 VeriLLM通过轻量级经验重跑和链上检查实现公开可验证的去中心化LLM推理,提高效率与安全性,减少验证成本。

Comments 18 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17914 2026-01-23 cs.CL 57%

Vision-Language Models Align with Human Neural Representations in Concept Processing

视觉-语言模型在概念处理中与人类神经表征对齐

Anna Bavaresco, Marianne de Heer Kloots, Sandro Pezzelle, Raquel Fernández

机构 * Institute for Logic, Language and Computation University of Amsterdam(逻辑、语言与计算研究所 阿姆斯特丹大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究发现视觉-语言模型在概念处理中能与人类神经表征对齐,揭示了不同架构在脑部响应中的差异。

Comments Accepted to EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15780 2026-01-23 cs.CV 50%

Assessing Situational and Spatial Awareness of VLMs with Synthetically Generated Video

通过合成视频评估VLMs的情境与空间意识

Pascal Benschop, Justin Dauwels, Jan van Gemert

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一个合成基准,评估VLMs在区分暴力与无害活动、跨视角角色绑定及细粒度轨迹对齐方面的性能,发现其表现仅略高于随机水平,且稳定颜色线索仅部分缓解了问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15366 2026-01-23 cs.CV 50%

AI-Based Culvert-Sewer Inspection

基于AI的涵洞-排水管检查

Christina Thrainer

机构 * Graz University of Technology(格拉茨技术大学) Institute of Visual Computing(视觉计算研究所) Institute of Human-Centred Computing(以人为本计算研究所) Gulf States Center for Environmental Informatics(海湾州环境信息中心)

专题命中 安全评测 :safety(abstract)

AI总结 本研究提出三种基于AI的方法,旨在提高涵洞和排水管道缺陷分割的精度,解决数据稀缺问题。

Comments Masters thesis, University of Technology Graz, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20879 2026-01-23 cs.CV 50%

MultiHuman-Testbench: Benchmarking Image Generation for Multiple Humans

MultiHuman-Testbench: 多人图像生成的基准测试

Shubhankar Borse, Seokeon Choi, Sunghyun Park, Jeongho Kim, Shreya Kadambi, Risheek Garrepalli, Sungrack Yun, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research(高通AI研究)

专题命中 安全评测 :alignment(abstract)

AI总结 MultiHuman-Testbench提出了一种多人类图像生成的基准测试,通过多指标评估提升ID相似性,为研究提供标准化工具。

Comments Accepted at the NeurIPS 2025 D&B Track

详情

展开后加载摘要…

URL PDF HTML 收藏