arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-27 至 2026-01-27 共收录 30 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 30 篇

2511.15169 2026-01-27 cs.AI 83%

SafeRBench: Dissecting the Reasoning Safety of Large Language Models

SafeRBench: 解析大语言模型推理安全性的本质

Xin Gao, Shaohan Yu, Zerui Chen, Yueming Lyu, Weichen Yu, Guanghao Li, Jiyao Liu, Jianxiong Gao, Jian Liang, Ziwei Liu, Chenyang Si

机构 * Nanjing University(南京大学) Fudan University(复旦大学) Carnegie Mellon University(卡内基梅隆大学) Chinese Academy of Sciences(中国科学院) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 SafeRBench通过端到端评估方法解析大语言模型推理过程中的安全性问题,提出风险分层探测、微思维分析和10项细粒度指标,揭示大模型在增强安全性的同时可能增加可操作风险的悖论。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10994 2026-01-27 cs.CL cs.AI 81%

Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety

基于开放领域评估和多阶段防护机制的深度研究

Wei-Chieh Huang, Henry Peng Zou, Yaozu Wu, Dongyuan Li, Yankai Chen, Weizhi Zhang, Yangning Li, Angelo Zangari, Jizhou Guo, Chunyu Miao, Liancheng Fang, Langzhou He, Yinghui Li, Renhe Jiang, Philip S. Yu

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DeepResearchGuard和DRSafeBench,通过开放领域评估和多阶段防护机制提升深度研究的安全性和报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03310 2026-01-27 eess.AS 78%

TASU: Text-Only Alignment for Speech Understanding

TASU:用于语音理解的纯文本对齐

Jing Peng, Yi Yang, Xu Li, Yu Xi, Quanwei Tang, Yangui Fang, Junjie Li, Kai Yu

专题命中 安全评测 :alignment(title,abstract)

AI总结 TASU通过纯文本数据实现语音理解的跨模态对齐,提升了零样本语音识别性能,并在多个基准测试中优于现有模型。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18464 2026-01-27 cs.CV cs.AI 74%

Fair-Eye Net: A Fair, Trustworthy, Multimodal Integrated Glaucoma Full Chain AI System

Fair-Eye Net:一种公平、可信的多模态集成青光眼全流程人工智能系统

Wenbin Wei, Suyuan Yao, Cheng Huang, Xiangyu Gao

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 Fair-Eye Net通过多模态融合和公平性优化,实现青光眼全流程AI系统,提升诊断准确性与公平性,助力全球眼科健康公平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17312 2026-01-27 cs.CL cs.AI 73%

Meta-Judging with Large Language Models: Concepts, Methods, and Challenges

元评判与大型语言模型:概念、方法与挑战

Hugo Silva, Mateus Mendes, Hugo Gonçalo Oliveira

机构 * University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra, Department of Informatics Engineering(科英布拉大学,CISUC/LASI——科英布拉大学信息与系统研究中心,信息工程系) Polytechnic University of Coimbra, Rua da Misericórdia, Lagar dos Cortiços, S. Martinho do Bispo, 3045-093 Coimbra, Portugal(科英布拉理工大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了LLM-as-a-Meta-Judge在提升自动化评估稳定性与可信度方面的潜力,同时指出需解决的成本、提示敏感性及共享偏差等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18754 2026-01-27 cs.CR cs.AI 70%

$α^3$-SecBench: A Large-Scale Evaluation Suite of Security, Resilience, and Trust for LLM-based UAV Agents over 6G Networks

$α^3$-SecBench:一个大规模评估套件,用于评估基于LLM的无人机代理在6G网络中的安全、韧性与信任

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿拉伯联合酋长国大学) Khalifa University of Science and Technology(科学与技术喀拉奇大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 $α^3$-SecBench通过大规模评估基于LLM的无人机代理在6G网络中的安全、韧性和信任,揭示了现有模型在对抗环境下的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18356 2026-01-27 cs.LG 70%

Making medical vision-language models think causally across modalities with retrieval-augmented cross-modal reasoning

通过检索增强的跨模态推理使医疗视觉-语言模型在多模态中实现因果推理

Weiqin Yang, Haowen Xue, Qingyi Peng, Hexuan Hu, Qian Huang, Tingbo Zhang

机构 * University of Adelaide(阿德莱德大学) Hohai University(河海大学) Amap

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出多模态因果检索增强生成框架,通过整合因果推理原理与多模态检索,提升医疗VLMs在诊断预测和视觉问答中的事实准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18334 2026-01-27 cs.CL 70%

Overalignment in Frontier LLMs: An Empirical Study of Sycophantic Behaviour in Healthcare

前沿大语言模型中的过度趋同:医疗领域中趋炎附势行为的实证研究

Clément Christophe, Wadood Mohammed Abdul, Prateek Munjal, Tathagata Raha, Ronnie Rajan, Praveenkumar Kanithi

机构 * M42, Abu Dhabi(阿布扎比M42)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文通过实证研究揭示前沿大语言模型在医疗领域中因趋炎附势行为导致的过度迎合问题,并提出调整后的趋炎附势评分以评估模型的抗性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04886 2026-01-27 cs.SE cs.AI 70%

Analyzing Message-Code Inconsistency in AI Coding Agent-Authored Pull Requests

分析AI编码代理生成的拉取请求中的消息-代码不一致

Jingzhi Gong, Giovanni Pinna, Yixin Bian, Jie M. Zhang

机构 * King's College London(伦敦大学国王学院) University of Trieste(特里斯特大学) Harbin Normal University(哈尔滨师范大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究发现AI生成的PR描述中存在显著的消息-代码不一致问题,导致接受率降低和合并时间延长,需加强验证机制和生成优化以提升人机协作的可信度。

Comments Accepted by MSR'26 Mining Challenge Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17346 2026-01-27 cs.AI 70%

Multi-Agent Learning Path Planning via LLMs

通过大型语言模型进行多智能体学习路径规划

Haoxin Xu, Changyong Qi, Tong Liu, Bohao Zhang, Anna He, Bingqian Jiang, Longwei Zheng, Xiaoqing Gu

机构 * Shanghai International Studies University(上海国际 Studies 大学) East China Normal University(华东师范大学) Huaiyin Normal University(淮阴师范学院) City University of Macau(澳门城市大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本研究提出基于LLMs的多智能体学习路径规划框架,通过角色与规则协作机制提升学习路径的透明性与可解释性,实验表明其在路径质量、知识一致性及认知负荷匹配方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17082 2026-01-27 cs.CY cs.AI cs.CL cs.CV cs.LG 70%

Do VLMs Have a Moral Backbone? A Study on the Fragile Morality of Vision-Language Models

视觉-语言模型是否具有道德基础?对视觉语言模型脆弱道德的研究

Zhining Liu, Tianyi Wang, Xiao Lin, Penghao Ouyang, Gaotang Li, Ze Yang, Hui Liu, Sumit Keswani, Vishwa Pardeshi, Huijun Zhao, Wei Fan, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Fidelity Investments(富达投资)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现视觉语言模型在面对文本和视觉扰动时道德判断易变,需通过轻量干预提升道德鲁棒性以确保负责任的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07110 2026-01-27 cs.CL cs.AI cs.CY 67%

The Need for a Socially-Grounded Persona Framework for User Simulation

用户模拟中需要基于社会的个性框架

Pranav Narayanan Venkit, Yu Li, Yada Pruksachatkun, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出SCOPE框架,通过社会心理学协议构建更高质量的个性,提升大语言模型在社会模拟中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18706 2026-01-27 cs.AI cs.LG 62%

Health-SCORE: Towards Scalable Rubrics for Improving Health-LLMs

Health-SCORE: 向提升健康大语言模型的可扩展评分标准迈进

Zhichao Yang, Sepehr Janghorbani, Dongxu Zhang, Jun Han, Qian Qian, Andrew Ressler, Gregory D. Lyng, Sanjit Singh Batra, Robert E. Tillman

机构 * Optum AI

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 Health-SCORE是一种通用且可扩展的基于评分标准的训练和评估框架,通过降低开发成本和提升响应质量,使医疗领域的大语言模型评估和训练更加可行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18200 2026-01-27 cs.LG cs.AI 62%

HeterCSI: Channel-Adaptive Heterogeneous CSI Pretraining Framework for Generalized Wireless Foundation Models

HeterCSI:面向通用无线基础模型的通道自适应异构CSI预训练框架

Chenyu Zhang, Xinchen Lyu, Chenshan Ren, Shuhan Liu, Qimei Cui, Xiaofeng Tao

机构 * National Engineering Research Center for Mobile Network Technologies, Beijing University of Posts and Telecommunications(中国移动网络技术国家工程研究中心,北京邮电大学) Department of Broadband Communication, Pengcheng Laboratory(宽带通信系,鹏城实验室) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(民族语言智能分析与安全治理重点实验室,中央民族大学) China Telecom Corporation Limited Gansu Branch(中国电信集团甘肃分公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 HeterCSI通过解决CSI尺度异质性和场景多样性问题,提出一种通道自适应的异构CSI预训练框架,提升无线基础模型的泛化能力和效率。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17173 2026-01-27 cs.CL cs.AI 62%

Beyond Factual QA: Mentorship-Oriented Question Answering over Long-Form Multilingual Content

超越事实问答:面向长形式多语言内容的指导型问答

Parth Bhalerao, Diola Dsouza, Ruiwen Guan, Oana Ignat

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MentorQA,首个多语言长形式视频指导型问答数据集和评估框架,通过对比不同架构发现Multi-Agent在复杂和低资源语言中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15124 2026-01-27 cs.LG cs.AI 62%

RAG-GFM: Overcoming In-Memory Bottlenecks in Graph Foundation Models via Retrieval-Augmented Generation

RAG-GFM:通过检索增强生成克服图基础模型中的内存瓶颈

Haonan Yuan, Qingyun Sun, Jiacheng Tao, Xingcheng Fu, Jianxin Li

机构 * SKLCCSE, School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北航) Guangxi Normal University(广西师范大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 RAG-GFM通过检索增强生成方法,解决图基础模型中的内存瓶颈问题,提升模型的效率和效果。

Comments Accepted by the Web Conference 2026 (Research Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18630 2026-01-27 cs.AI cs.HC 57%

Assessing the Quality of Mental Health Support in LLM Responses through Multi-Attribute Human Evaluation

通过多属性人类评估评估LLM响应中的心理健康支持质量

Abeer Badawi, Md Tahmid Rahman Laskar, Elahe Rahimi, Sheri Grach, Lindsay Bertrand, Lames Danok, Frank Rudzicz, Jimmy Huang, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Dalhousie University(达尔豪斯大学) IWK Health Hospital(IWK健康医院) King’s College London(伦敦国王学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过多属性人类评估方法,评估LLM在心理健康对话中的响应质量,揭示LLMs在认知可靠性与情感一致性方面的差异,并倡导以治疗敏感性为核心的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18085 2026-01-27 cs.HC cs.AI stat.AP 57%

"Crash Test Dummies" for AI-Enabled Clinical Assessment: Validating Virtual Patient Scenarios with Virtual Learners

为AI赋能的临床评估设计'碰撞测试假人':通过虚拟学习者验证虚拟患者场景

Brian Gin, Ahreum Lim, Flávia Silva e Oliveira, Kuan Xing, Xiaomei Song, Gayana Amiyangoda, Thilanka Seneviratne, Alison F. Doubleday, Ananya Gangopadhyaya, Bob Kiser, Lukas Shum-Tim, Dhruva Patel, Kosala Marambe, Lauren Maggio, Ara Tekian, Yoon Soo Park

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种开源AI虚拟患者平台和测量模型,通过虚拟学习者验证评估流程,实现稳健的能力评估和AI辅助评估的验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16516 2026-01-27 cs.LG 57%

Rethinking Large Language Models For Irregular Time Series Classification In Critical Care

重新思考用于危重监护中不规则时间序列分类的大型语言模型

Feixiang Zheng, Yu Wu, Cecilia Mascolo, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) University of Cambridge, UK(剑桥大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文研究了LLMs在不规则ICU时间序列分类中的有效性,发现编码器设计比对齐策略更重要,但LLMs在训练时间和少样本学习中表现欠佳。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11020 2026-01-27 cs.CV cs.AI 57%

GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation

GeoVLMath: 通过跨模态奖励增强视觉-语言模型中的几何推理以辅助线创建

Shasha Guo, Liang Pang, Xi Wang, Yanling Wang, Huawei Shen, Jing Zhang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 GeoVLMath通过跨模态奖励模型提升视觉-语言模型在复杂立体几何问题中的几何推理能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17920 2026-01-27 cs.AI 57%

Agentic AI for Self-Driving Laboratories in Soft Matter: Taxonomy, Benchmarks,and Open Challenges

代理AI在软物质中的自主实验室:分类、基准和开放挑战

Xuanzhou Chen, Audrey Wang, Stanley Yin, Hanyang Jiang, Dong Zhang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文探讨了自主实验室在软物质中的应用,提出了基于智能体的环境交互框架,回顾了闭环实验的主要方法,并指出了多模态表示、校准不确定性、安全探索和共享基准基础设施等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17814 2026-01-27 cs.AI 57%

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

MMR-Bench: 多模态大语言模型路由的综合基准

Haoxuan Ma, Guannan Lai, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17728 2026-01-27 cs.CL 57%

Unsupervised Elicitation of Moral Values from Language Models

无监督从语言模型中提取道德价值观

Meysam Alizadeh, Fabrizio Gilardi, Zeynab Samei

机构 * University of Zurich(苏黎世大学) IPM(伊朗高等教育科学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 通过无监督方法ICM,研究发现预训练语言模型具备潜在的道德推理能力,能有效减少社会偏见,为AI对齐提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17344 2026-01-27 cs.CL 57%

The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents

阴影自我:大型语言模型代理中的内在价值偏差

Chen Chen, Kim Young Il, Yuan Yang, Wenhao Su, Yilin Zhang, Xueluan Gong, Qian Wang, Yongsen Zheng, Ziyao Liu, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究提出IMPRESS框架,系统评估大型语言模型代理中的内在价值偏差风险,发现其在不同模型中普遍存在,且受上下文化和框架机制显著影响。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25975 2026-01-27 cs.CL cs.PL 57%

SymCode: A Neurosymbolic Approach to Mathematical Reasoning via Verifiable Code Generation

SymCode:通过可验证代码生成实现数学推理的神经符号方法

Sina Bagheri Nezhad, Yao Li, Ameeta Agrawal

机构 * Portland State University(波特兰州立大学) ElastixAI

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 SymCode通过可验证代码生成实现数学推理,显著提升准确性并增强模型的透明度和可靠性。

Comments camera-ready EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05840 2026-01-27 cs.LG 57%

Multimodal Trajectory Representation Learning for Travel Time Estimation

多模态轨迹表示学习用于旅行时间估计

Zhi Liu, Xuyuan Hu, Xiao Han, Zhehao Dai, Zhaolin Deng, Guojiang Shen, Xiangjie Kong

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang University of Technology College of Computer Science(浙江工业大学计算机科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出多模态动态轨迹整合框架,通过整合GPS、网格轨迹和道路网络约束,提升旅行时间估计的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18698 2026-01-27 cs.CV 50%

Are Video Generation Models Geographically Fair? An Attraction-Centric Evaluation of Global Visual Knowledge

视频生成模型在地理上是否公平?一种以吸引力为中心的全球视觉知识评估

Xiao Liu, Jiawei Zhang

机构 * IFM Lab, Department of Computer Science University of California, Davis(信息融合实验室,计算机科学系加州大学戴维斯分校)

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过GAP框架评估了文本到视频模型在地理公平性上的表现,发现模型在不同地区和文化群体中具有相对均匀的地理相关视觉知识,表明其在全球应用中的潜力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08537 2026-01-27 cs.CV 50%

Saliency-Bench: A Comprehensive Benchmark for Evaluating Visual Explanations

Saliency-Bench: 一个全面的评估视觉解释的基准测试

Yifei Zhang, James Song, Siyi Gu, Tianxu Jiang, Bo Pan, Guangji Bai, Liang Zhao

机构 * Emory University(埃默里大学) Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 安全评测 :alignment(abstract)

AI总结 Saliency-Bench是一个全面的视觉解释评估基准测试,通过多个数据集和标准流程评估显著性方法的解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17824 2026-01-27 cs.HC cs.IR 50%

OwlerLite: Scope- and Freshness-Aware Web Retrieval for LLM Assistants

OwlerLite:面向LLM助手的范围和新鲜度感知网络检索

Saber Zerhoudi, Michael Dinzinger, Michael Granitzer, Jelena Mitrovic

专题命中 安全评测 :trustworthy(abstract)

AI总结 OwlerLite通过用户定义的范围和数据新鲜度提升LLM助手的检索可控性和可信度。

Journal ref Proceedings of the Companion Proceedings of the ACM Web Conference 2026 (WWW Companion '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09493 2026-01-27 cs.IR 50%

Evaluating Conversational Recommender Systems via Large Language Models: A User-Centric Framework

通过大语言模型评估对话推荐系统:一种以用户为中心的框架

Nuo Chen, Quanyu Dai, Xiaoyu Dong, Piaohong Wang, Qinglin Jia, Zhaocheng Du, Zhenhua Dong, Xiao-Ming Wu

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出CoRE框架,通过大语言模型评估对话推荐系统,结合用户评价和多代理辩论,提升用户体验评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏