arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-25 至 2026-02-25 共收录 45 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2506.04462 2026-02-25 cs.CL cs.CR cs.LG 84%

Watermarking Degrades Alignment in Language Models: Analysis and Mitigation

水印会损害语言模型的对齐:分析与缓解

Apurv Verma, NhatHai Phan, Shubhendu Trivedi

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 研究发现水印影响语言模型对齐,提出Alignment Resampling方法恢复对齐性能。

Comments Published in Transactions of Machine Learning Research 02/2026. Extended version of the earlier paper published at the 1st Workshop on GenAI Watermarking (ICLR 2025)

Journal ref Transactions of Machine Learning Research 02/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20457 2026-02-25 cs.LG stat.ML 79%

Oracle-Robust Online Alignment for Large Language Models

面向大语言模型的Oracle鲁棒在线对齐

Zimeng Li, Mudit Gaur, Vaneet Aggarwal

机构 * Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出了一种Oracle鲁棒的在线对齐方法,通过引入不确定性集和敏感性惩罚,实现了对大语言模型在不准确偏好反馈下的鲁棒优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20595 2026-02-25 cs.CR cs.AI 57%

OptiLeak: Efficient Prompt Reconstruction via Reinforcement Learning in Multi-tenant LLM Services

OptiLeak: 通过强化学习在多租户LLM服务中高效重建提示

Longxiang Wang, Xiang Zheng, Xuhao Zhang, Yao Zhang, Ye Wu, Cong Wang

机构 * City University of Hong Kong(香港城市大学) ByteDance Inc.(字节跳动公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 OptiLeak通过强化学习和两阶段微调,在多租户LLM服务中高效重建提示,减少请求次数达12.48倍,提升隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2602.00795 2026-02-25 cs.CV 78%

DVLA-RL: Dual-Level Vision-Language Alignment with Reinforcement Learning Gating for Few-Shot Learning

DVLA-RL:基于强化学习门控的双层视觉-语言对齐用于少样本学习

Wenhao Li, Xianjing Meng, Qiangchang Wang, Zhongyi Han, Zhibin Wu, Yilong Yin

机构 * Software School, Shandong University(山东大学软件学院) Shenzhen Loop Area Institute(深圳河套学院) School of Computing and Artificial Intelligence, Shandong University of Finance and Economics(山东财经大学计算机与人工智能学院)

专题命中 安全训练 :alignment(title,abstract)

AI总结 DVLA-RL通过双层语义构建和强化学习门控注意力,实现少样本学习中视觉与语言的双层次对齐,提升泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16602 2026-02-25 cs.CL cs.AI 73%

Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics

拒绝引导:为敏感话题对LLM拒绝行为实现细粒度控制

Iker García-Ferrero, David Montero, Roman Orus

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 通过引导向量控制LLM在敏感话题上的拒绝行为,实现安全且可控的审核方法。

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20500 2026-02-25 cs.RO cs.CV 67%

Strategy-Supervised Autonomous Laparoscopic Camera Control via Event-Driven Graph Mining

基于事件驱动图挖掘的策略监督自主腹腔镜摄像机控制

Keyu Zhou, Peisen Xu, Yahao Wu, Jiming Chen, Gaofeng Li, Shunlei Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本研究提出基于事件驱动图挖掘的策略监督自主腹腔镜摄像机控制方法,通过结合视觉-语言推理与闭环控制,提升手术视野稳定性与可解释性,实验表明其在减少视野偏移和图像抖动方面表现优异。

Comments Submitted to IEEE Transactions on Robotics (T-RO). 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16613 2026-02-25 cs.LG cs.AI 62%

Safe Reinforcement Learning for Real-World Engine Control

用于现实世界发动机控制的安全强化学习

Julian Bedei, Lucas Koch, Kevin Badalian, Alexander Winkler, Patrick Schaber, Jakob Andert

机构 * Teaching and Research Area Mechatronics in Mobile Propulsion(移动传动机械研究与教学领域) RWTH Aachen University(亚琛工业大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种安全强化学习方法,用于在高热效率和低排放的HCCI模式下实现发动机控制,通过实时安全监控和实验验证,有效解决了传统控制方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2601.03868 2026-02-25 cs.CL cs.AI cs.CR 91%

What Matters For Safety Alignment?

安全对齐中什么重要?

Xing Li, Hui-Ling Zhen, Lihao Yin, Xianzhi Yu, Zhenhua Dong, Mingxuan Yuan

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 本文研究了安全对齐中关键因素,发现集成推理和自我反思机制的重要性,揭示了CoT攻击的高成功率及安全风险,强调了安全约束在模型训练中的必要性。

Comments Added more commercial model results, majority voting scores, and theoretical analysis in v2

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2602.20720 2026-02-25 cs.CR cs.AI 79%

AdapTools: Adaptive Tool-based Indirect Prompt Injection Attacks on Agentic LLMs

AdapTools: 面向代理LLM的自适应工具间接提示注入攻击

Che Wang, Jiaming Zhang, Ziqi Zhang, Zijie Wang, Yinghui Wang, Jianbo Gao, Tao Wei, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore(数据科学,南洋理工大学,新加坡) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 AdapTools通过自适应工具和提示生成,提升间接提示注入攻击成功率2.13倍,同时降低系统效用1.78倍,有效应对现代AI代理的快速演变特性。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20708 2026-02-25 cs.AI cs.CR 79%

ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction

ICON:基于推理时校正的代理间接提示注入防御

Che Wang, Fuyao Zhang, Jiaming Zhang, Ziqi Zhang, Yinghui Wang, Longtao Huang, Jianbo Gao, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) Alibaba(阿里巴巴) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 ICON通过潜在空间轨迹探测和修正器实现对代理间接提示注入攻击的防御,有效提升任务连续性和安全性,同时保持高检测率和任务效用。

Comments 11 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2602.20400 2026-02-25 cs.LG cs.AI 76%

Three Concrete Challenges and Two Hopes for the Safety of Unsupervised Elicitation

三个具体挑战和两个希望:对无监督引导的安全性

Callum Canavan, Aditya Shrivastava, Allison Qi, Jonathan Michala, Fabien Roger

专题命中 幻觉与事实性 :safety(title);分类 cs.AI、cs.LG

AI总结 本文探讨了无监督引导技术在面对特定数据集挑战时的局限性,并提出了未来研究的优先方向。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05598 2026-02-25 cs.IR cs.AI 57%

AgentDR: Dynamic Recommendation with Implicit Item-Item Relations via LLM-based Agents

AgentDR: 通过基于LLM的代理进行动态推荐:利用隐式物品-物品关系

Mingdai Yang, Nurendra Choudhary, Jiangshu Du, Edward W. Huang, Philip S. Yu, Karthik Subbian, Danai Koutra

机构 * Amazon(亚马逊) University of Michigan(密歇根大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 AgentDR通过基于LLM的代理利用隐式物品-物品关系,结合记忆机制和提示策略,提升动态推荐的全排名性能和相关性。

Comments 12 pages, accepted by WWW'26 as long paper

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2602.18464 2026-02-25 cs.CY cs.AI cs.CL cs.CR 67%

How Well Can LLM Agents Simulate End-User Security and Privacy Attitudes and Behaviors?

LLM代理能多好地模拟终端用户的安全和隐私态度和行为?

Yuxuan Li, Leyang Li, Hao-Ping Lee, Sauvik Das

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Department of Computer Science and Engineering, University of Notre Dame(诺特难大学计算机科学与工程系)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文研究LLM代理在模拟用户安全隐私态度和行为方面的有效性,发现现有模型表现有限,但通过特定提示策略可提升匹配度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17645 2026-02-25 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning

HoloLLM:面向语言基础的人感知与推理的多感官基础模型

Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HoloLLM通过整合LiDAR、红外、毫米波雷达和Wi-Fi等多感官数据,提升语言基础的人感知与推理能力,实验表明其在真实场景中的性能提升达30%。

Comments Camera-ready version. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 18 篇

2602.20813 2026-02-25 cs.AI 83%

Pressure Reveals Character: Behavioural Alignment Evaluation at Depth

压力揭示特性:深度下的行为对齐评估

Nora Petrova, John Burden

机构 * Prolific

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一个深度行为对齐评估基准,通过多轮场景揭示模型行为倾向,发现多数模型在多个类别存在弱点,且对齐行为呈现统一构念特性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20628 2026-02-25 cs.AI 79%

When can we trust untrusted monitoring? A safety case sketch across collusion strategies

我们何时可以信任不可信的监控?跨合谋策略的安全案例草图

Nelson Gardner-Challis, Jonathan Bostock, Georgiy Kozhevnikov, Morgan Sinclaire, Joan Velja, Alessandro Abate, Charlie Griffin

机构 * LASR Labs(LASR实验室) University of Oxford(牛津大学) University of Wyoming(怀俄明大学) Imperial College London(伦敦帝国学院) UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种跨合谋策略的安全案例草图,探讨了不可信监控的安全性问题,分析了不同合谋策略的有效性,并指出了未解决的挑战。

Comments 66 pages, 14 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11876 2026-02-25 cs.CL 79%

EAMET: Robust Massive Model Editing via Embedding Alignment Optimization

EAMET: 通过嵌入对齐优化实现鲁棒的大规模模型编辑

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 EAMET通过嵌入对齐优化提升大规模模型编辑的鲁棒性和效率,实现90%的编辑效果

Comments This paper was accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23434 2026-02-25 cs.LG 79%

Towards Trustworthy GUI Agents: A Survey

迈向可信的GUI代理:综述

Yucheng Shi, Wenhao Yu, Jingyuan Huang, Wenlin Yao, Wenhu Chen, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文综述了GUI代理的可信度挑战,提出信任分类法并分析了信任评估与安全可靠部署的开放问题。

Comments 14 pages, work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01856 2026-02-25 eess.SY cs.SY 78%

Hierarchical Multi-Agent MCTS for Safety-Critical Coordination in Mixed-Autonomy Roundabouts

分层多智能体MCTS用于混合自主性环形路口的安全协调

Zhihao Lin, Jianglin Lan, Shuo Liu, Zhen Tian, Dezong Zhao, Chongfeng Wei

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种分层多智能体MCTS框架,用于混合自主性环形路口的安全协调,通过车道特定不确定性模型和安全意识修剪,有效降低轨迹偏移和PET违规率。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20976 2026-02-25 cs.CL cs.CY 73%

Evaluating Proactive Risk Awareness of Large Language Models

评估大型语言模型的前瞻性风险意识

Xuan Luo, Yubin Chen, Zhiyu Hou, Linpu Yu, Geng Tu, Jing Li, Ruifeng Xu

机构 * The Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University, Hong Kong(香港理工大学) Southern University of Science and Technology, Shenzhen(南方科技大学) Shenzhen Loop Area Institute, Shenzhen, China(深圳南山区研究院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文提出前瞻性风险意识评估框架,通过Butterfly数据集评估LLMs在生态领域预见潜在危害的能力,发现响应长度限制和多模态保护盲点等问题,强调部署LLM时需加强主动防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20294 2026-02-25 cs.CL cs.AI cs.CY 67%

InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation

InterviewSim: 一种可扩展的基于面试的人格模拟框架

Yu Li, Pranav Narayanan Venkit, Yada Pruksachatkun, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce 研究)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 InterviewSim提出了一种基于真实面试数据的多维评估框架,通过系统比较证明基于真实访谈数据的方法在人格模拟中表现更优,并揭示了不同方法在人格风格与事实一致性方面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20379 2026-02-25 cs.CL cs.AI 62%

Case-Aware LLM-as-a-Judge Evaluation for Enterprise-Scale RAG Systems

面向企业级RAG系统的案例感知LLM-as-a-Judge评估

Mukul Chhabra, Luigi Medrano, Arush Verma

机构 * Dell Technologies(戴尔技术)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出面向企业级RAG系统的案例感知LLM-as-a-Judge评估框架,通过八个操作指标评估多轮工作流,揭示企业关键权衡,提升系统诊断清晰度和可操作性。

Comments 12 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20170 2026-02-25 cs.CY cs.AI 62%

CAGE: A Framework for Culturally Adaptive Red-Teaming Benchmark Generation

CAGE:一种用于文化适应性红队基准生成的框架

Chaeyun Kim, YongTaek Lim, Kihyun Kim, Junghwan Kim, Minwoo Kim

机构 * Seoul National University(首尔国立大学) AI Safety Team, DATUMO INC(DATUMO公司人工智能安全团队)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 CAGE框架通过文化适应性生成方法,系统地调整红队提示以适应不同文化背景,从而生成更有效的安全评估基准。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20162 2026-02-25 cs.CL cs.AI 62%

Talking to Yourself: Defying Forgetting in Large Language Models

与自己对话:在大型语言模型中克服遗忘

Yutao Sun, Mingshuai Chen, Tiancheng Zhao, Phillip Miao, Zilun Zhang, Haozhan Shen, Ruizhe Zhu, Jianwei Yin

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院) Om AI Research(奥姆人工智能研究) Stanford University(斯坦福大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SA-SFT方法,通过让LLM生成自我对话来缓解微调过程中的灾难性遗忘,提升领域性能并优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20867 2026-02-25 cs.CR cs.AI cs.CE cs.ET 57%

SoK: Agentic Skills -- Beyond Tool Use in LLM Agents

SoK: 代理技能——超越LLM代理中的工具使用

Yanna Jiang, Delong Li, Haiyu Deng, Baihe Ma, Xu Wang, Qin Wang, Guangsheng Yu

机构 * University of Technology Sydney(悉尼科技大学) CSIRO Data61(CSIRO数据61)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文探讨了代理技能在LLM代理中的应用,分析了技能的生命周期管理、分类方法及其安全影响,并提出了未来研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20759 2026-02-25 cs.CL 57%

Overton Pluralistic Reinforcement Learning for Large Language Models

奥顿多元强化学习用于大语言模型

Yu Fu, Seongho Son, Ilija Bogunovic

机构 * University College London(伦敦大学学院) University of Basel(巴塞尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出OP-GRPO框架,通过强化学习使大语言模型生成多样化响应,提升人类视角覆盖和视角独特性,实验证明其在自然语言推理任务中的优越性能。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20513 2026-02-25 cs.CL 57%

From Performance to Purpose: A Sociotechnical Taxonomy for Evaluating Large Language Model Utility

从性能到目的:一种用于评估大语言模型效用的社技术分类

Gavin Levinson, Keith Feldman

机构 * University of Michigan(密歇根大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出LUX框架,用于评估大语言模型在不同应用场景中的效用,涵盖性能、交互、运营和治理四个领域,并提供动态工具支持框架探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07525 2026-02-25 cs.CV cs.AI 57%

EHWGesture -- A dataset for multimodal understanding of clinical gestures

EHWGesture -- 一个用于多模态理解临床手势的数据集

Gianluca Amprimo, Alberto Ancilotto, Alessandro Savino, Fabio Quazzolo, Claudia Ferraris, Gabriella Olmo, Elisabetta Farella, Stefano Di Carlo

机构 * Department of Control and Computer Engineering, Politecnico di Torino(控制与计算机工程系,都灵理工大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) CNR-IEIIT(意大利国家研究委员会-IEIIT)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 EHWGesture是一个包含五个临床相关手势的多模态视频数据集,用于提升临床手势理解的多模态分析能力。

Comments Accepted at ICCV 2025 Workshop on AI-driven Skilled Activity Understanding, Assessment & Feedback Generation

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01080 2026-02-25 cs.LG cs.PF 57%

Development and Comparative Evaluation of Three Artificial Intelligence Models (NLP, LLM, JEPA) for Predicting Triage in Emergency Departments: A 7-Month Retrospective Proof-of-Concept

三种人工智能模型(NLP、LLM、JEPA)在急诊科分诊中的开发与比较评估:一项7个月的回顾性概念验证

Edouard Lansiaux, Ramy Azzouz, Emmanuel Chazard, Amélie Vromant, Eric Wiel

机构 * Department of Emergency Lille University Hospital(里尔大学医院急诊科) Centre Antipoison, Lille University Hospital(里尔大学医院毒物中心) Department of Public Health, EA 2694 & ULR 2694-METRICS(公共卫生部门,EA 2694及ULR 2694-METRICS) Lille University(里尔大学) Emergency Department Hôpital Pitié-Salpêtrière, AP-HP(皮蒂埃-萨尔佩特里耶医院急诊科,AP-HP)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本研究评估了三种AI模型在急诊科分诊中的表现,发现基于LLM的URGENTIAPARSE在准确性和预测住院需求方面表现最佳,为提升急诊科患者安全和效率提供了新的方向。

Comments 13 pages, 7 figures, 3 tables

Journal ref 2025:2:1-10 BDCAT '25: Proceedings of the IEEE/ACM 12th International Conference on Big Data Computing, Applications and Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21035 2026-02-25 cs.CV cs.MM 50%

Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning

不只是存在与否:无需微调即可使CLIP理解否定性视觉描述

Junhao Xiao, Zhiyu Wu, Hao Lin, Yi Chen, Yahui Liu, Xiaoran Zhao, Zixu Wang, Zejiang He

专题命中 安全评测 :alignment(abstract)

AI总结 CLIPGlasses通过双阶段设计提升CLIP对否定性视觉描述的理解能力,无需微调,增强跨领域泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏