arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-25 至 2026-02-25 共收录 45 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 18 篇

2602.20873 2026-02-25 cs.CV 50%

MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classification

MUSE: 通过精确和多样的语义提升少样本全滑片图像分类

Jiahao Xu, Sheng Huang, Xin Zhang, Zhixiong Nan, Jiajun Dong, Nankun Mu

机构 * School of Big Data & Software Engineering, Chongqing University(大数据与软件工程学院,重庆大学) School of Computer Science & Technology, Chongqing University(计算机科学与技术学院,重庆大学)

专题命中 安全评测 :alignment(abstract)

AI总结 MUSE通过样本层面的细粒度语义增强和随机多视图生成,提升少样本全滑片图像分类的性能和鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10720 2026-02-25 cs.CV 50%

Ecological mapping with geospatial foundation models

基于地理空间基础模型的生态制图

Craig Mahlasi, Gciniwe S. Baloyi, Zaheed Gaffoor, Levente Klein, Anne Jones, Etienne Vos, Michal Muszynski, Geoffrey Dawson, Campbell Watson

机构 * IBM Research(IBM研究) IBM Sustainability Software(IBM可持续性软件)

专题命中 安全评测 :alignment(abstract)

AI总结 本研究通过微调Prithvi-EO-2.0和TerraMind模型,在生态制图任务中展示了优于ResNet基线的性能,强调了数据对齐和高分辨率输入的重要性。

Comments Revised abstract

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他安全 13 篇

2602.21012 2026-02-25 cs.CY 88%

International AI Safety Report 2026

2026国际人工智能安全报告

Yoshua Bengio, Stephen Clare, Carina Prunkl, Maksym Andriushchenko, Ben Bucknall, Malcolm Murray, Rishi Bommasani, Stephen Casper, Tom Davidson, Raymond Douglas, David Duvenaud, Philip Fox, Usman Gohar, Rose Hadshar, Anson Ho, Tiancheng Hu, Cameron Jones, Sayash Kapoor, Atoosa Kasirzadeh, Sam Manning, Nestor Maslej, Vasilios Mavroudis, Conor McGlynn, Richard Moulange, Jessica Newman, Kwan Yee Ng, Patricia Paskov, Shalaleh Rismani, Girish Sastry, Elizabeth Seger, Scott Singer, Charlotte Stix, Lucia Velasco, Nicole Wheeler, Daron Acemoglu, Vincent Conitzer, Thomas G. Dietterich, Fredrik Heintz, Geoffrey Hinton, Nick Jennings, Susan Leavy, Teresa Ludermir, Vidushi Marda, Helen Margetts, John McDermid, Jane Munga, Arvind Narayanan, Alondra Nelson, Clara Neppel, Sarvapali D. Ramchurn, Stuart Russell, Marietje Schaake, Bernhard Schölkopf, Alvaro Soto, Lee Tiedrich, Gaël Varoquaux, Andrew Yao, Ya-Qin Zhang, Leandro Angelo Aguirre, Olubunmi Ajala, Fahad Albalawi, Noora AlMalek, Christian Busch, Jonathan Collas, André Carlos Ponce de Leon Ferreira de Carvalho, Amandeep Gill, Ahmet Halit Hatip, Juha Heikkilä, Chris Johnson, Gill Jolly, Ziv Katzir, Mary N. Kerema, Hiroaki Kitano, Antonio Krüger, Kyoung Mu Lee, José Ramón López Portillo, Aoife McLysaght, Oleksii Molchanovskyi, Andrea Monti, Mona Nemer, Nuria Oliver, Raquel Pezoa, Audrey Plonk, Balaraman Ravindran, Hammam Riza, Crystal Rugege, Haroon Sheikh, Denise Wong, Yi Zeng, Liming Zhu, Daniel Privitera, Sören Mindermann

专题命中 其他安全 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 2026国际人工智能安全报告由全球29国及国际组织共同参与,汇集超过100位专家意见,全面评估通用人工智能系统的安全性和潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20644 2026-02-25 cs.SE 78%

An LLM-driven Scenario Generation Pipeline Using an Extended Scenic DSL for Autonomous Driving Safety Validation

基于扩展Scenic DSL的LLM驱动场景生成流水线用于自动驾驶安全验证

Fida Khandaker Safa, Yupeng Jiang, Xi Zheng

专题命中 其他安全 :safety(title,abstract)

AI总结 本文提出基于扩展Scenic DSL和LLM的场景生成流水线,实现高精度自动驾驶安全验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20727 2026-02-25 cs.CL 70%

ID-LoRA: Efficient Low-Rank Adaptation Inspired by Matrix Interpolative Decomposition

ID-LoRA: 基于矩阵插值分解的高效低秩适应

Xindian Ma, Rundong Kong, Peng Zhang, Ruoxiang Huang, Yongyu Jiang

机构 * Tianjin University(天津大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 ID-LoRA通过基于矩阵插值分解的低秩适应方法,在减少可训练参数的同时保持模型容量,优于现有PEFT技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20696 2026-02-25 cs.AI 70%

PromptCD: Test-Time Behavior Enhancement via Polarity-Prompt Contrastive Decoding

PromptCD:通过极性提示对比解码提升测试时行为

Baolong Bi, Yuyao Ge, Shenghua Liu, Yuchen He, Siqian Tong, Lizhe Chen, Lingrui Mei, Zehao Li, Yiwei Wang, Yujun Cai, Ming-Hsuan Yang, Xueqi Cheng

专题命中 其他安全 :alignment(abstract);harmlessness(abstract);分类 cs.AI

AI总结 PromptCD通过极性提示对比解码在测试时提升LLM和VLM的行为一致性,实现无需额外训练的广泛增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18777 2026-02-25 cs.AI cs.CL cs.LG 67%

Programming by Backprop: An Instruction is Worth 100 Examples When Finetuning LLMs

通过反向传播编程:在微调LLMs时,一条指令的价值相当于100个示例

Jonathan Cook, Silvia Sapora, Arash Ahmadian, Akbir Khan, Tim Rocktaschel, Jakob Foerster, Laura Ruis

机构 * FLAIR, University of Oxford(FLAIR,牛津大学) Cohere & Cohere Labs(Cohere及Cohere实验室) Anthropic UCL AI Centre(UCL人工智能中心) MIT(麻省理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过反向传播编程(PBB)使LLMs能从声明性指令中学习程序性知识,提升训练效率并减少对大量示例的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15763 2026-02-25 cs.LG cs.CL 62%

GLM-5: from Vibe Coding to Agentic Engineering

GLM-5:从振动编码到代理工程

GLM-5-Team, :, Aohan Zeng, Xin Lv, Zhenyu Hou, Zhengxiao Du, Qinkai Zheng, Bin Chen, Da Yin, Chendi Ge, Chenghua Huang, Chengxing Xie, Chenzheng Zhu, Congfeng Yin, Cunxiang Wang, Gengzheng Pan, Hao Zeng, Haoke Zhang, Haoran Wang, Huilong Chen, Jiajie Zhang, Jian Jiao, Jiaqi Guo, Jingsen Wang, Jingzhao Du, Jinzhu Wu, Kedong Wang, Lei Li, Lin Fan, Lucen Zhong, Mingdao Liu, Mingming Zhao, Pengfan Du, Qian Dong, Rui Lu, Shuang-Li, Shulin Cao, Song Liu, Ting Jiang, Xiaodong Chen, Xiaohan Zhang, Xuancheng Huang, Xuezhen Dong, Yabo Xu, Yao Wei, Yifan An, Yilin Niu, Yitong Zhu, Yuanhao Wen, Yukuo Cen, Yushi Bai, Zhongpei Qiao, Zihan Wang, Zikang Wang, Zilin Zhu, Ziqiang Liu, Zixuan Li, Bojie Wang, Bosi Wen, Can Huang, Changpeng Cai, Chao Yu, Chen Li, Chengwei Hu, Chenhui Zhang, Dan Zhang, Daoyan Lin, Dayong Yang, Di Wang, Ding Ai, Erle Zhu, Fangzhou Yi, Feiyu Chen, Guohong Wen, Hailong Sun, Haisha Zhao, Haiyi Hu, Hanchen Zhang, Hanrui Liu, Hanyu Zhang, Hao Peng, Hao Tai, Haobo Zhang, He Liu, Hongwei Wang, Hongxi Yan, Hongyu Ge, Huan Liu, Huanpeng Chu, Jia'ni Zhao, Jiachen Wang, Jiajing Zhao, Jiamin Ren, Jiapeng Wang, Jiaxin Zhang, Jiayi Gui, Jiayue Zhao, Jijie Li, Jing An, Jing Li, Jingwei Yuan, Jinhua Du, Jinxin Liu, Junkai Zhi, Junwen Duan, Kaiyue Zhou, Kangjian Wei, Ke Wang, Keyun Luo, Laiqiang Zhang, Leigang Sha, Liang Xu, Lindong Wu, Lintao Ding, Lu Chen, Minghao Li, Nianyi Lin, Pan Ta, Qiang Zou, Rongjun Song, Ruiqi Yang, Shangqing Tu, Shangtong Yang, Shaoxiang Wu, Shengyan Zhang, Shijie Li, Shuang Li, Shuyi Fan, Wei Qin, Wei Tian, Weining Zhang, Wenbo Yu, Wenjie Liang, Xiang Kuang, Xiangmeng Cheng, Xiangyang Li, Xiaoquan Yan, Xiaowei Hu, Xiaoying Ling, Xing Fan, Xingye Xia, Xinyuan Zhang, Xinze Zhang, Xirui Pan, Xu Zou, Xunkai Zhang, Yadi Liu, Yandong Wu, Yanfu Li, Yidong Wang, Yifan Zhu, Yijun Tan, Yilin Zhou, Yiming Pan, Ying Zhang, Yinpei Su, Yipeng Geng, Yong Yan, Yonglin Tan, Yuean Bi, Yuhan Shen, Yuhao Yang, Yujiang Li, Yunan Liu, Yunqing Wang, Yuntao Li, Yurong Wu, Yutao Zhang, Yuxi Duan, Yuxuan Zhang, Zezhen Liu, Zhengtao Jiang, Zhenhe Yan, Zheyu Zhang, Zhixiang Wei, Zhuo Chen, Zhuoer Feng, Zijun Yao, Ziwei Chai, Ziyuan Wang, Zuzhou Zhang, Bin Xu, Minlie Huang, Hongning Wang, Juanzi Li, Yuxiao Dong, Jie Tang

机构 * GLM-5 Team(GLM-5团队) Zhipu AI(智谱AI) Tsinghua University(清华大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 GLM-5通过异步强化学习和DSA技术实现高效训练与推理,展现卓越的软件工程能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14462 2026-02-25 cs.LG cs.AI 62%

Silent Inconsistency in Data-Parallel Full Fine-Tuning: Diagnosing Worker-Level Optimization Misalignment

数据并行全微调中的沉默不一致:诊断工作级别优化不一致

Hong Li, Zhen Zhou, Honggang Zhang, Yuping Luo, Xinyue Wang, Han Gong, Zhiyuan Liu

机构 * School of Transportation Southeast University(交通学院东南大学) Department of Logistics and Maritime Studies The Hong Kong Polytechnic University(物流与海运研究部香港理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种轻量诊断框架,用于检测数据并行微调中工作级别优化的不一致问题,通过损失分散度、梯度范数分散度和方向一致性指标,揭示隐藏的不稳定性模式。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02620 2026-02-25 q-bio.QM cs.AI cs.LG 62%

CryoLVM: Self-supervised Learning from Cryo-EM Density Maps with Large Vision Models

CryoLVM: 从冷冻电镜密度图中利用大视觉模型进行自监督学习

Weining Fu, Kai Shu, Kui Xu, Qiangfeng Cliff Zhang

机构 * State Key Laboratory of Membrane Biology, Beijing Frontier Research Center of Biological Structures, Tsinghua-Peking Joint Center for Life Sciences, School of Life Sciences, Tsinghua University, Beijing, China(膜生物学国家重点实验室,北京生物结构前沿研究中心,清华-北大联合生命科学中心,生命科学学院,清华大学,北京,中国) State Key Laboratory of Membrane Biology-Membrane Structure and Artificial Intelligence Biology Branch,Hangzhou, China(膜生物学国家重点实验室-膜结构与人工智能生物学分支,杭州,中国) State Key Laboratory of Membrane Biology, Beijing Tsinghua Institute for Frontier Interdisciplinary Innovation, Beijing, China(膜生物学国家重点实验室,北京清华大学前沿交叉创新研究院,北京,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 CryoLVM通过自监督学习从冷冻电镜密度图中提取结构信息,结合JEPA与SCUNet实现高效适应多种下游任务,提升密度图处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20934 2026-02-25 cs.AI 57%

Architecting AgentOS: From Token-Level Context to Emergent System-Level Intelligence

构建AgentOS:从令牌级上下文到涌现的系统级智能

ChengYou Li, XiaoDong Liu, XiangBao Meng, XinYu Zhao

机构 * Yishu Research(亿舒研究) Fukuoka Institute of Technology(福冈技术学院) National University of Singapore(新加坡国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出AgentOS框架,通过重构LLM为推理内核,引入深度上下文管理和语义切片机制,旨在构建具备系统级智能的自主认知环境。

Comments 16 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02276 2026-02-25 cs.AI 57%

BioX-Bridge: Model Bridging for Unsupervised Cross-Modal Knowledge Transfer across Biosignals

BioX-Bridge:生物信号跨模态知识迁移的模型桥接

Chenqi Li, Yu Liu, Timothy Denison, Tingting Zhu

机构 * Department of Engineering Science University of Oxford(工程科学系 奥克大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 BioX-Bridge通过轻量级桥接网络实现生物信号跨模态无监督知识迁移,显著减少可训练参数并提升迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20486 2026-02-25 cs.HC cs.AI 57%

Hybrid LLM-Embedded Dialogue Agents for Learner Reflection: Designing Responsive and Theory-Driven Interactions

混合LLM嵌入对话代理用于学习者反思:设计响应性且理论驱动的互动

Paras Sharma, YuePing Sha, Janet Shufor Bih Epse Fofang, Brayden Yan, Jess A. Turner, Nicole Balay, Hubert O. Asare, Angela E. B. Stewart, Erin Walker

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学) Bowie State University(鲍威州立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种混合对话系统,结合LLM的响应能力与理论驱动的规则框架,以支持学习者反思,但发现其在提高反思深度的同时也带来了一些挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20923 2026-02-25 cs.RO 50%

ParkDiffusion++: Ego Intention Conditioned Joint Multi-Agent Trajectory Prediction for Automated Parking using Diffusion Models

ParkDiffusion++: 基于扩散模型的多智能体轨迹预测用于自动化停车的自我意图条件联合预测

Jiarong Wei, Anna Rehr, Christian Feist, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) CARIAD SE

专题命中 其他安全 :safety(abstract)

AI总结 ParkDiffusion++通过联合学习多智能体轨迹预测与自我意图预测,实现自动化停车中的高效假设决策与安全预测。

Comments ICRA 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20818 2026-02-25 cs.CV 50%

GatedCLIP: Gated Multimodal Fusion for Hateful Memes Detection

GatedCLIP:用于仇恨表情包检测的门控多模态融合

Yingying Guo, Ke Zhang, Zirong Zeng

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 其他安全 :alignment(abstract)

AI总结 GatedCLIP通过门控融合和对比学习提升多模态仇恨表情包检测性能,实现0.66 AUROC优于CLIP基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏