arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-13 至 2026-02-13 共收录 56 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 18 篇

2410.14182 2026-02-13 cs.CL cs.LG 81%

LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs

LabSafety Bench: 对科学实验室中AI安全问题的LLM基准测试

Yujun Zhou, Jingdong Yang, Yue Huang, Kehan Guo, Zoe Emory, Bikram Ghosh, Amita Bedar, Sujay Shekar, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 LabSafety Bench通过评估LLMs和VLMs在实验室安全问题上的表现,揭示了当前模型在危险识别和风险评估方面的不足,强调了对AI安全评估框架的迫切需求。

Comments Published at Nature Machine Intelligence

Journal ref Nat Mach Intell 8, 20-31 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04860 2026-02-13 cs.LG cs.AI 81%

Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails

对齐倾倒过程:自我进化如何推动LLM代理偏离轨道

Siwei Han, Kaiwen Xiong, Jiaqi Liu, Xinyu Ye, Yaofeng Su, Wenbo Duan, Xinyuan Liu, Cihang Xie, Mohit Bansal, Mingyu Ding, Linjun Zhang, Huaxiu Yao

机构 * Rutgers University(罗切斯特大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了自我进化LLM代理在部署后因持续互动而偏离对齐约束的风险,通过自我利益探索和模仿策略扩散两种范式分析,发现对齐优势会迅速衰减,现有对齐方法难以有效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11412 2026-02-13 cs.CY cs.AI cs.HC 73%

When Visibility Outpaces Verification: Delayed Verification and Narrative Lock-in in Agentic AI Discourse

当可见性超越验证:代理AI discourse中的延迟验证与叙述锁定

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱文大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文研究了代理AI讨论中可见性与验证时间的关系,揭示了高可见度讨论因延迟验证导致的叙述锁定现象,并提出知识摩擦作为平衡平台的干预措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11305 2026-02-13 cs.CL 70%

Are Aligned Large Language Models Still Misaligned?

对齐的大型语言模型仍然存在偏差吗?

Usman Naseem, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Sushant Kumar Ray, Abdullah Mohammad, Agrima Seth

机构 * Macquarie University(麦考瑞大学) DSEU-Okhla University of Delhi(德里大学) Microsoft(微软公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出Mis-Align Bench基准测试,通过统一评估安全、价值和文化维度的偏差,揭示单维度模型在联合条件下的高覆盖率与高假失败率问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11877 2026-02-13 cs.CL cs.AI 62%

Towards Fair and Comprehensive Evaluation of Routers in Collaborative LLM Systems

迈向协作大语言模型系统中路由器的公平且全面评估

Wanxing Wu, He Zhu, Yixia Li, Lei Yang, Jiehui Zhao, Hongru Wang, Jian Yang, Benyou Wang, Bingyi Jing, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Institut Polytechnique de Paris(巴黎政治学院) Peking University(北京大学) Deepexi Technology Co. Ltd.(深醒科技有限公司) University of Edinburgh(爱丁堡大学) Beihang University(北航) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RouterXBench框架和ProbeDirichlet路由器,通过内部隐藏状态提升路由能力与跨领域鲁棒性,实现对协作大语言模型系统中路由器的公平全面评估。

Comments Our code is publicly available at https://github.com/zhuchichi56/RouterXBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11690 2026-02-13 cs.LG cs.AI 62%

ANML: Attribution-Native Machine Learning with Guaranteed Robustness

ANML:具有保证鲁棒性的属性原生机器学习

Oliver Zahn, Matt Beton, Simran Chana

机构 * University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ANML通过质量加权训练提升模型性能和归因能力,在多个数据集上显著减少误差。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11666 2026-02-13 cs.AI cs.CL 62%

PhyNiKCE: A Neurosymbolic Agentic Framework for Autonomous Computational Fluid Dynamics

PhyNiKCE:一种用于自主计算流体动力学的神经符号代理框架

E Fan, Lisong Shi, Zhengtong Li, Chih-yung Wen

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 PhyNiKCE通过神经符号框架提升CFD模拟的可信度与效率,实现96%的性能提升并减少59%的自我校正循环。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11165 2026-02-13 cs.CL cs.AI 62%

Assessing LLM Reliability on Temporally Recent Open-Domain Questions

评估LLM在近期开放领域问题上的可靠性

Pushwitha Krishnappa, Amit Das, Vinija Jain, Tathagata Mukherjee, Aman Chadha

机构 * University of Alabama Huntsville(阿拉巴马大学亨茨维尔分校) University of North Alabama(北阿拉巴马大学) Stanford University(斯坦福大学) Google(谷歌) Apple(苹果公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 RECOM研究通过分析15000个Reddit问题,发现LLM在语义对齐上表现优异,但词汇重合度低,揭示模型通过改写保留意义,挑战传统词汇度量的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11918 2026-02-13 cs.AI 57%

MEME: Modeling the Evolutionary Modes of Financial Markets

MEME:金融市场的进化模式建模

Taian Guo, Haiyang Shen, Junyu Luo, Zhongshi Xing, Hanchun Lian, Jinsheng Huang, Binqi Chen, Luchen Liu, Yun Ma, Ming Zhang

机构 * National Key Laboratory for Multimedia Information Processing, PKU-Anker LLM Lab, School of Computer Science, Peking University(国家多媒体信息处理重点实验室、PKU-Anker LLM实验室、计算机科学学院、北京大学) School of Electronics Engineering(电子工程学院) Computer Science, Peking University(计算机科学、北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究所、北京大学) Sun Yat-sen University(中山大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MEME通过建模金融市场中的动态进化思维模式,利用多代理提取和高斯混合模型,实现对市场动态的精准重建,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11750 2026-02-13 cs.SE cs.AI cs.HC 57%

AmbiBench: Benchmarking Mobile GUI Agents Beyond One-Shot Instructions in the Wild

AmbiBench:在真实场景中超越单次指令的移动GUI代理基准测试

Jiazheng Sun, Mingxuan Li, Yingying Zhang, Jiayang Niu, Yachen Wu, Ruihan Jin, Shuyu Lei, Pengrongrui Tan, Zongyu Zhang, Ruoyi Wang, Jiachen Yang, Boyu Yang, Jiacheng Liu, Xin Peng

机构 * Fudan University(复旦大学) Jilin University(吉林大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 AmbiBench是首个针对移动GUI代理在真实场景中超越单次指令的双向意图对齐的基准测试,通过引入清晰度分类和MUSE框架评估代理在不同清晰度下的表现。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11674 2026-02-13 cs.AI 57%

Benchmark Health Index: A Systematic Framework for Benchmarking the Benchmarks of LLMs

基准健康指数:一个系统框架,用于评估大型语言模型的基准测试

Longyuan Zhu, Hairan Hua, Linlin Miao, Bing Zhao

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出Benchmark Health Index,通过三个维度评估LLM基准测试的健康状况,为评估选择和动态管理提供系统框架。

Comments 42 pages, 8 figures, 7 tables. Code and website available at https://github.com/SKYLENAGE-AI/benchmark-health-index

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11514 2026-02-13 cs.SE cs.AI cs.CV cs.HC 57%

How Smart Is Your GUI Agent? A Framework for the Future of Software Interaction

你的GUI代理有多智能?面向软件交互未来的框架

Sidong Feng, Chunyang Chen

机构 * The Chinese University of Hong Kong(香港中文大学) Technical University of Munich(慕尼黑工业大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出GUI代理自主级别框架,旨在明确自主性并评估软件交互的可信赖性进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11340 2026-02-13 cs.AI 57%

Bi-Level Prompt Optimization for Multimodal LLM-as-a-Judge

双层提示优化用于多模态LLM作为裁判

Bo Pan, Xuan Kan, Kaitai Zhang, Yan Yan, Shunwen Tan, Zihao He, Zixin Ding, Junjie Wu, Liang Zhao

机构 * Meta AI Emory University(埃默里大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出BLPO框架,通过双层优化提升多模态LLM在评估AI生成图像时的提示效果,解决上下文限制导致的优化瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07497 2026-02-13 cs.CL 57%

From Native Memes to Global Moderation: Cross-Cultural Evaluation of Vision-Language Models for Hateful Meme Detection

从本土迷因到全球监管:跨文化评估视觉-语言模型在仇恨迷因检测中的应用

Mo Wang, Kaixuan Ren, Pratik Jalan, Ahmed Ashraf, Tuong Vy Vu, Rahul Seetharaman, Shah Nawaz, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Nile University(尼罗大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Johannes Kepler University(约翰尼斯·开普勒大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文通过跨文化评估揭示视觉-语言模型在仇恨迷因检测中的文化偏见问题,并提出本土语言提示和一样本学习等改进策略以提升模型的公平性和鲁棒性。

Comments 12 pages, 5 figures, Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11730 2026-02-13 cs.CV 50%

STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning

STVG-R1: 通过强化学习激励视频中实例级推理与 grounding

Xiaowen Zhang, Zhi Gao, Licheng Jiao, Lingling Li, Qing Li

机构 * Xidian University(西电大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Institute of Technology(北京理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 STVG-R1通过强化学习框架提升视频中实例级推理与 grounding 的准确性,实现显著的性能提升和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 2 篇

2602.11301 2026-02-13 cs.AI cs.CR 57%

The PBSAI Governance Ecosystem: A Multi-Agent AI Reference Architecture for Securing Enterprise AI Estates

PBSAI治理生态系统:一种多智能体AI参考架构,用于保障企业AI领地安全

John M. Willis

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 PBSAI提出了一种多智能体参考架构,用于保障企业AI领地的安全,通过十二个领域分类法和有限智能体家族实现责任划分,结合分析监控、协调防御等技术,确保系统安全与可追溯性。

Comments 43 pages, plus 12 pages of appendices. One Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09369 2026-02-13 cs.CR 50%

Timing and Memory Telemetry on GPUs for AI Governance

GPU上的定时和内存遥测用于AI治理

Saleh K. Monfared, Fatemeh Ganji, Dan Holcomb, Shahin Tajik

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 通过GPU定时和内存遥测技术,实现对大规模AI计算资源的治理,以确保资源使用符合政策和法律要求。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 9 篇

2601.12580 2026-02-13 cs.MA 82%

Semantic Fusion: Verifiable Alignment in Decentralized Multi-Agent Systems

语义融合:去中心化多智能体系统的可验证对齐

Sofiya Zaichyk

专题命中 其他安全 :alignment(title,abstract);safety(abstract)

AI总结 语义融合通过本地本体验证实现去中心化多智能体系统的可验证语义对齐,支持动态更新提案并确保安全性和鲁棒性。

Comments 29 pages

Journal ref ACM Trans. Auton. Adapt. Syst. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11328 2026-02-13 cs.CL 74%

Evaluating Alignment of Behavioral Dispositions in LLMs

评估大语言模型中行为倾向的对齐情况

Amir Taubenfeld, Zorik Gekhman, Lior Nezry, Omri Feldman, Natalie Harris, Shashir Reddy, Romina Stella, Ariel Goldstein, Marian Croak, Yossi Matias, Amir Feder

机构 * Google(谷歌)

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 本研究通过情境判断测试评估大语言模型行为倾向与人类倾向的对齐情况,发现模型在不同共识场景下表现出过度自信、偏离共识及跨模型特质模式,揭示了LLMs声明价值与实际行为之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11073 2026-02-13 cs.CV cs.AI cs.CL 62%

Chatting with Images for Introspective Visual Thinking

与图像对话以进行反思性视觉思维

Junfei Wu, Jian Guan, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ViLaVT通过语言引导的特征调节框架,实现多图像区域的联合重编码,提升跨模态对齐与复杂空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11881 2026-02-13 cs.AI 57%

From Atoms to Trees: Building a Structured Feature Forest with Hierarchical Sparse Autoencoders

从原子到树:构建具有层次稀疏自编码器的结构化特征森林

Yifan Luo, Yang Zhan, Jiedong Jiang, Tianyang Liu, Mingrui Wu, Zhennan Zhou, Bin Dong

机构 * School of Mathematical Science, Peking University, Beijing, China(北京大学数学科学学院) Beijing International Center for Mathematical Research(北京国际数学研究中心) the New Cornerstone Science Laboratory, Peking University, Beijing, China(北京大学新基石科学实验室) Center for Machine Learning Research, Peking University, Beijing, China(北京大学机器学习研究中心) School of Information and Electronics, Beijing Institute of Technology, Beijing, China(北京理工大学信息与电子学院) Institute for Theoretical Sciences, Westlake University, Hangzhou, China(西湖大学理论科学研究院) School of Science, Westlake University, Hangzhou, China(西湖大学理学院) School of Informatics, University of Edinburgh, Edinburgh, UK(爱丁堡大学信息学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出层次稀疏自编码器HSAE,通过结构约束和随机扰动机制,联合学习LLM中的层次化特征结构,实现语义有意义的多尺度概念分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11136 2026-02-13 cs.AI 57%

FormalJudge: A Neuro-Symbolic Paradigm for Agentic Oversight

FormalJudge: 一种用于代理监管的神经符号范式

Jiayi Zhou, Yang Sheng, Hantao Lou, Yaodong Yang, Jie Fu

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 FormalJudge通过神经符号框架结合形式验证,提升代理行为安全性和欺骗检测能力,实现数学保证而非概率评分。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11717 2026-02-13 cs.AI 57%

Beyond Parameter Arithmetic: Sparse Complementary Fusion for Distribution-Aware Model Merging

超越参数运算:用于分布感知模型融合的稀疏互补融合

Weihong Lin, Lin Sun, Qilong Shi, Aomufei Yuan, Yuxuan Tian, Zhengyang Wang, Guangxiang Zhao, Xiangzheng Zhang, Tong Yang

机构 * Beijing Qiyuan Technology Co., Ltd.(北京启元科技有限公司) Peking University(北京大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出SCF-RKL方法,通过稀疏、分布感知的更新控制功能干扰,提升模型融合的稳定性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11643 2026-02-13 cs.RO cs.AI cs.CV 57%

ViTaS: Visual Tactile Soft Fusion Contrastive Learning for Visuomotor Learning

ViTaS: 用于视觉-运动学习的视觉触觉软融合对比学习

Yufeng Tian, Shuiqi Cheng, Tianming Wei, Tianxing Zhou, Yuanhang Zhang, Zixian Liu, Qianwei Han, Zhecheng Yuan, Huazhe Xu

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 ViTaS通过融合视觉和触觉信息,利用软融合对比学习提升视觉-运动学习的性能。

Comments Published to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09070 2026-02-13 cs.SD cs.AI eess.AS 57%

NarraScore: Bridging Visual Narrative and Musical Dynamics via Hierarchical Affective Control

NarraScore: 通过分层情感控制弥合视觉叙事与音乐动态

Yufan Wen, Zhaocheng Liu, YeGuo Hua, Ziyi Guo, Lihua Zhang, Chun Yuan, Jian Wu

机构 * Tsinghua University(清华大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 NarraScore通过分层情感控制,实现视觉叙事与音乐动态的融合,以高密度压缩叙事逻辑,提升长视频配乐生成的连贯性与自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02388 2026-02-13 cs.CL 57%

Learning to Route: A Rule-Driven Agent Framework for Hybrid-Source Retrieval-Augmented Generation

学习路由:一种基于规则的代理框架用于混合源检索增强生成

Haoyue Bai, Haoyu Wang, Shengyu Chen, Zhengzhang Chen, Lu-An Tang, Wei Cheng, Haifeng Chen, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) NEC Laboratories America(NEC美国实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于规则的路由框架,通过系统规则选择合适来源提升检索增强生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏