arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-19 至 2026-02-19 共收录 27 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 1 篇

2510.12121 2026-02-19 cs.AI cs.CL cs.LG 67%

Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing

通过针对性表征编辑实现大语言模型中的精确属性强度控制

Rongzhi Zhang, Liqin Ye, Yuzhao Heng, Xiang Chen, Tong Yu, Lingkai Kong, Sudheer Chava, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) Adobe Research(Adobe研究) Harvard University(哈佛大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过针对性表征编辑方法,实现大语言模型中精确属性强度控制,提升模型对用户需求的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 1 篇

2602.12281 2026-02-19 cs.RO cs.AI cs.SY eess.SY 79%

Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

在视觉-语言-动作对齐中,验证比策略学习更具效率

Jacky Kwok, Xilun Zhang, Mengdi Xu, Yuejiang Liu, Azalia Mirhoseini, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) NVIDIA Research(NVIDIA研究)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出CoVer-VLA验证方法,通过测试时验证在视觉-语言-动作对齐中实现22%的在分布和13%的分布外收益,同时在现实世界实验中进一步提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2501.16534 2026-02-19 cs.CR cs.AI 90%

Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs

针对对齐:提取对齐LLM的安全分类器

Jean-Charles Noirot Ferrand, Yohan Beugin, Eric Pauley, Ryan Sheatsley, Patrick McDaniel

机构 * 2 Department of Computer Science Virginia Tech Blacksburg, VA, USA

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出了一种提取对齐LLM安全分类器的方法,通过构建候选分类器并评估其在对抗性攻击中的有效性,展示了替代分类器在提高攻击成功率方面的优势。

Comments This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16520 2026-02-19 cs.CR cs.AI 79%

Recursive language models for jailbreak detection: a procedural defense for tool-augmented agents

递归语言模型用于对抗检测:一种针对工具增强代理的程序性防御

Doron Shavit

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出基于递归语言模型的RLM-JB框架,通过程序化方法检测对抗性输入,实现高检测效果与高精度的平衡。

Comments 5 pages and 1 figure. Appendix: an additional 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21190 2026-02-19 cs.CR 75%

The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning

恶意示例:通过模板填充和不安全推理实现大语言模型的劫持

Mingrui Liu, Sixiao Zhang, Cheng Long, Kwok Yan Lam

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 TrojFill通过模板填充和不安全推理漏洞,实现对大语言模型的安全过滤绕过,展示了对齐LLM的系统性弱点。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15001 2026-02-19 cs.LG 70%

Boundary Point Jailbreaking of Black-Box LLMs

黑盒大语言模型的边界点劫持

Xander Davies, Giorgi Giglemiani, Edmund Lau, Eric Winsor, Geoffrey Irving, Yarin Gal

机构 * UK AI Security Institute(英国人工智能安全研究所) OATML, University of Oxford(OATML、牛津大学)

专题命中 越狱攻击 :jailbreak(abstract);red teaming(abstract);分类 cs.LG

AI总结 BPJ是一种全新的黑盒自动化劫持攻击方法,通过边界点选择策略有效突破宪法分类器和GPT-5输入分类器的防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15897 2026-02-19 cs.CL 57%

Mitigating Gradient Inversion Risks in Language Models via Token Obfuscation

通过令牌混淆缓解语言模型中的梯度倒置风险

Xinguo Feng, Zhongkui Ma, Zihan Wang, Alsharif Abuadbba, Guangdong Bai

机构 * The University of Queensland(昆士兰大学) CSIRO's Data61(CSIRO的数据61部门) City University of Hong Kong(香港城市大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出GHOST机制,通过令牌混淆解耦梯度、嵌入和令牌空间的联系,有效缓解语言模型的梯度倒置风险,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2602.16019 2026-02-19 cs.CV cs.AI 57%

MedProbCLIP: Probabilistic Adaptation of Vision-Language Foundation Model for Reliable Radiograph-Report Retrieval

MedProbCLIP: 基于概率适应的视觉-语言基础模型用于可靠放射影像-报告检索

Ahmad Elallaf, Yu Zhang, Yuktha Priya Masupalli, Jeong Yang, Young Lee, Zechun Cao, Gongbo Liang

机构 * Texas A&M University-San Antonio(德克萨斯A&M大学-圣安东尼奥分校) Boise State University(博伊州立大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 MedProbCLIP 通过概率适应提升放射影像与报告检索的可靠性,优于现有基线方法。

Comments Accepted to the 2026 Winter Conference on Applications of Computer Vision (WACV) Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 1 篇

2401.04536 2026-02-19 cs.CL cs.AI cs.LG 67%

Evaluating Language Model Agency through Negotiations

通过谈判评估语言模型的代理能力

Tim R. Davidson, Veniamin Veselovsky, Martin Josifoski, Maxime Peyrard, Antoine Bosselut, Michal Kosinski, Robert West

机构 * EPFL(瑞士联邦理工学院) UGA(普罗万大学) CNRS(法国国家科学研究中心) LIG(里莫恩-盖朗实验室) Stanford University(斯坦福大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过谈判游戏评估语言模型的代理能力,发现封闭源模型更擅长完成任务,合作谈判游戏最具挑战性,且强模型可能输给弱对手。

Comments Accepted to ICLR 2024, code and link to project data are made available at https://github.com/epfl-dlab/LAMEN

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 8 篇

2602.16660 2026-02-19 cs.CL cs.AI cs.LG 89%

Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment

一次对齐,多语言受益:为LLM安全对齐强制多语言一致性

Yuyan Bu, Xiaohao Liu, ZhaoXing Ren, Yaodong Yang, Juntao Dai

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) National University of Singapore(新加坡国立大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种资源高效的多语言一致性对齐方法,通过多语言一致性损失实现多语言同时对齐,提升跨语言安全性和泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07680 2026-02-19 cs.CV cs.AI cs.LG cs.RO 84%

Vision and Language: Novel Representations and Artificial intelligence for Driving Scene Safety Assessment and Autonomous Vehicle Planning

视觉与语言:新颖的表示方法和人工智能用于驾驶场景安全评估与自动驾驶规划

Ross Greer, Maitrayee Keskar, Angel Martinez-Sanchez, Parthib Roy, Shashank Shriram, Mohan Trivedi

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉-语言表示在自动驾驶安全评估和规划中的应用,提出轻量级危险检测、轨迹规划框架整合及自然语言约束方法,强调表示-任务对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15242 2026-02-19 cs.CV 82%

Trustworthy and Fair SkinGPT-R1 for Democratizing Dermatological Reasoning across Diverse Ethnicities

可信且公平的SkinGPT-R1:用于在不同种族中普及皮肤病推理

Yuhao Shen, Zhangtianyi Chen, Yuanhao He, Yan Xu, Shuping Zhang, Liyuan Sun, Zijian Wang, Yinghao Zhu, Yuyuan Yang, Jiahe Qian, Ziwen Wang, Xinyuan Zhang, Wenbin Liu, Zongyuan Ge, Tao Lu, Siyuan Yan, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院,香港中文大学(深圳)) Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学) Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(皮肤科,天津整合皮肤科研究所,天津中医研究院附属医院) Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院) Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(皮肤科,北京安贞医院,首都医科大学) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Department of Dermatology, Beijing Aerospace General Hospital(皮肤科,北京航天总医院)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract)

AI总结 SkinGPT-R1通过公平性意识的专家混合架构实现可解释且公平的皮肤病诊断,提升不同种族间的诊断准确性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15859 2026-02-19 cs.CL 81%

From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants

从语音记录到AI代理:知识提取、RAG整合及对话式AI助手的鲁棒评估

Krittin Pachtrachai, Petmongkon Pornpichitsuwan, Wachiravit Modecrua, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC)(阿米蒂研究与应用中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);red teaming(abstract);prompt injection(abstract)

AI总结 本文提出了一种端到端框架,通过历史通话记录构建和评估对话式AI助手,利用知识提取和RAG整合提升事实准确性和鲁棒性。

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10515 2026-02-19 cs.CL cs.AI physics.ed-ph 62%

Mastering Olympiad-Level Physics with Artificial Intelligence

用人工智能掌握竞赛级物理

Dong-Shan Jian, Xiang Li, Chen-Xu Yan, Hui-Wen Zheng, Zhi-Zhang Bian, You-Le Fang, Ren-Xi He, Jing-Tian Zhang, Ce Meng, Ling-Shi Meng, Bing-Rui Gong, Sheng-Qi Zhang, Yan-Qing Ma

机构 * School of Physics, Peking University(物理系,北京大学) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学系,北京大学) Center for High Energy Physics, Peking University(高能物理中心,北京大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LOCA框架,通过逻辑链增强方法在物理竞赛中实现接近完美的成绩,展示了AI在复杂物理推理中的强大能力。

Comments 8 pages, 3 figures, Content from the previous article 2510.01249 is included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16650 2026-02-19 cs.CE cs.AI 57%

Retrieval Augmented Generation of Literature-derived Polymer Knowledge: The Example of a Biodegradable Polymer Expert System

文献衍生聚合物知识的检索增强生成:生物降解聚合物专家系统的例子

Sonakshi Gupta, Akhlak Mahmood, Wei Xiong, Rampi Ramprasad

机构 * School of Computational Science and Engineering(计算科学与工程学院) Georgia Institute of Technology(佐治亚理工学院) Matmerize, Inc.(Matmerize公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出基于检索增强生成的聚合物知识系统,通过构建结构化知识图谱和语义向量方法,提升生物降解聚合物领域的文献检索与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15913 2026-02-19 eess.IV cs.AI cs.CV 57%

Foundation Models for Medical Imaging: Status, Challenges, and Directions

医学影像中的基础模型:现状、挑战与方向

Chuang Niu, Pengwei Wu, Bruno De Man, Ge Wang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文综述了医学影像中基础模型的现状、挑战与未来方向,强调了通用型模型在跨模态和临床任务中的适应能力及临床应用的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16493 2026-02-19 cs.CV 50%

MMA: Multimodal Memory Agent

MMA:多模态记忆代理

Yihao Lu, Wanru Cheng, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 安全评测 :safety(abstract)

AI总结 MMA通过动态可靠性评分和冲突感知网络共识,提升多模态代理在长horizon任务中的记忆检索与决策能力,同时在多个基准测试中展现优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. AI治理与伦理 3 篇

2602.15881 2026-02-19 cs.CY 83%

Pluralism in AI Governance: Toward Sociotechnical Alignment and Normative Coherence

AI治理中的多元主义:迈向社会技术对齐与规范一致性

Mike Wa Nkongolo

专题命中 AI治理与伦理 :alignment(title,abstract);safety(abstract);分类 cs.CY

AI总结 本文提出了一种全面的价值敏感AI治理模型,通过整合多种框架和比较分析,探讨如何将公共价值观嵌入社会技术系统,强调监管作为主动机制的重要性。

Comments 18 pages, 6 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16438 2026-02-19 cs.LG cs.AI 81%

Intra-Fairness Dynamics: The Bias Spillover Effect in Targeted LLM Alignment

内在公平动态:定向大语言模型对齐中的偏见溢出效应

Eva Paraschou, Line Harder Clemmensen, Sneha Das

机构 * Department of Applied Mathematics and Computer Science, Technical University of Denmark(应用数学与计算机科学系,丹麦技术大学) Department of Mathematical Sciences, University of Copenhagen(数学科学系,哥本哈根大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了定向性别对齐对多敏感属性公平性的影响,发现改善某一属性公平性可能加剧其他属性的不平等,强调了多属性、情境感知公平性评估的重要性。

Comments Submitted to the BiAlign CHI Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16553 2026-02-19 cs.CY 57%

Agentic AI, Medical Morality, and the Transformation of the Patient-Physician Relationship

代理AI、医疗道德与患者-医生关系的变革

Robert Ranisch, Sabine Salloch

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨代理AI如何通过重塑患者-医生关系改变医疗道德,呼吁在广泛应用前融入伦理考量。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他安全 7 篇

2602.16584 2026-02-19 q-bio.NC 78%

The Representational Alignment Hypothesis: Evidence for and Consequences of Invariant Semantic Structure Across Embedding Modalities

表征对齐假说:跨嵌入模态的不变语义结构的证据及其后果

Akhil Ramidi, Kevin Scharp

专题命中 其他安全 :alignment(title,abstract)

AI总结 该研究提出表征对齐假说,探讨跨模态嵌入的不变语义结构,质疑其根本性,并提出新的哲学视角和区分方法。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15903 2026-02-19 cs.CV 78%

Detecting Deepfakes with Multivariate Soft Blending and CLIP-based Image-Text Alignment

利用多变量软融合和基于CLIP的图像-文本对齐检测深度伪造

Jingwei Li, Jiaxin Tong, Pengfei Wu

机构 * Zhejiang Gongshang University(浙江工商大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出MSBA-CLIP框架,通过多变量软融合和CLIP引导的伪造强度估计,提升深度伪造检测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11047 2026-02-19 cs.CL 57%

Embedding Inversion via Conditional Masked Diffusion Language Models

通过条件掩码扩散语言模型实现嵌入反向

Han Xiao

机构 * Jina AI by Elastic(Jina AI)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过条件掩码扩散语言模型实现嵌入反向,无需访问目标编码器,通过并行去噪技术高效恢复标记。

Comments 8 pages, 3 figures, 4 tables. Code and demo: https://github.com/jina-ai/embedding-inversion-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16101 2026-02-19 cs.LG 57%

Axle Sensor Fusion for Online Continual Wheel Fault Detection in Wayside Railway Monitoring

轴传感器融合用于在线持续轮故障检测在铁路旁侧监控

Afonso Lourenço, Francisca Osório, Diogo Risca, Goreti Marreiros

机构 * GECAD, ISEP, Polytechnic of Porto(GECAD、ISEP、波尔图理工大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于轴传感器融合和持续学习的铁路轮故障检测方法,通过变分自编码器和梯度提升分类器实现在线持续检测,适应动态操作条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00364 2026-02-19 cs.CV cs.LG 57%

LMSeg: Unleashing the Power of Large-Scale Models for Open-Vocabulary Semantic Segmentation

LMSeg:释放大规模模型在开放词汇语义分割中的潜力

Huadong Tang, Youpeng Zhao, Yan Huang, Min Xu, Jun Wang, Qiang Wu

机构 * Huadong Tang(华东唐) Youpeng Zhao(赵有鹏) Yan Huang(黄艳) Min Xu(徐敏) Jun Wang(王俊) Qiang Wu(吴强)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 LMSeg通过结合多个大规模模型提升开放词汇语义分割的性能,利用LLMs生成多样化视觉属性的提示并改进视觉特征提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16681 2026-02-19 cs.CV 50%

VETime: Vision Enhanced Zero-Shot Time Series Anomaly Detection

VETime: 基于视觉增强的零样本时间序列异常检测

Yingyuan Yang, Tian Lan, Yifei Gao, Yimeng Lu, Wenjun He, Meng Wang, Chenghao Liu, Chen Zhang

机构 * Department of Industrial Engineering, Tsinghua University, Beijing, China(清华大学工业工程系) Lab, Huawei Technologies Ltd, Beijing, China(华为技术有限公司2012实验室) Datadog AI Research(Datadog人工智能研究)

专题命中 其他安全 :alignment(abstract)

AI总结 VETime通过融合视觉与时间模态,提出零样本时间序列异常检测框架,实现高精度定位与低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10577 2026-02-19 cs.IR 50%

Campaign-2-PT-RAG: LLM-Guided Semantic Product Type Attribution for Scalable Campaign Ranking

Campaign-2-PT-RAG: LLM引导的语义产品类型归因用于可扩展的活动排名

Yiming Che, Mansi Ranjit Mane, Keerthi Gopalakrishnan, Parisa Kaghazgaran, Murali Mohana Krishna Dandu, Archana Venkatachalapathy, Sinduja Subramaniam, Yokila Arora, Evren Korpeoglu, Sushant Kumar, Kannan Achan

专题命中 其他安全 :alignment(abstract)

AI总结 Campaign-2-PT-RAG通过LLM解析活动内容并推断产品类型,生成高质量标签以提升电子商务活动排名优化

Comments fix typo and author names

详情

展开后加载摘要…

URL PDF HTML 收藏