arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-08 至 2026-01-08 共收录 47 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 14 篇

2509.01217 2026-01-08 eess.IV cs.CV 50%

Learn2Reg 2024: New Benchmark Datasets Driving Progress on New Challenges

Learn2Reg 2024:新基准数据集推动新挑战的进步

Lasse Hansen, Wiebke Heyer, Christoph Großbröhmer, Frederic Madesta, Thilo Sentker, Wang Jiazheng, Yuxi Zhang, Hang Zhang, Min Liu, Junyi Wang, Xi Zhu, Yuhua Li, Liwen Wang, Daniil Morozov, Nazim Haouchine, Joel Honkamaa, Pekka Marttinen, Yichao Zhou, Zuopeng Tan, Zhuoyuan Wang, Yi Wang, Hongchao Zhou, Shunbo Hu, Yi Zhang, Qian Tao, Lukas Förner, Thomas Wendler, Bailiang Jian, Christian Wachinger, Jin Kim, Dan Ruan, Marek Wodzinski, Henning Müller, Tony C. W. Mok, Xi Jia, Jinming Duan, Mikael Brudfors, Seyed-Ahmad Ahmadi, Yunzheng Zhu, William Hsu, Tina Kapur, William M. Wells, Alexandra Golby, Aaron Carass, Harrison Bai, Yihao Liu, Perrine Paul-Gilloteaux, Joakim Lindblad, Nataša Sladoje, Andreas Walter, Junyu Chen, Reuben Dorent, Alessa Hering, Mattias P. Heinrich

机构 * EchoScout GmbH Institute of Medical Informatics(医学信息学研究所) Institute of Applied Medical Informatics(应用医学信息学研究所) Institute of Computational Neuroscience(计算神经科学研究所) School of Artificial Intelligence and Robotics(人工智能与机器人学院) Cornell University(康奈尔大学) University of Electronic Science and Technology of China(电子科技大学) Mechanical Engineering Department(机械工程系) Harvard Medical School(哈佛医学院) Technical University of Munich(慕尼黑技术大学) Aalto University(阿德莱德大学) Canon Medical Systems (China) Co., Ltd.(佳能医疗系统(中国)有限公司) Smart Medical Imaging, Learning and Engineering (SMLE) Lab(智能医学影像、学习和工程实验室) School of Information Science and Engineering(信息科学与工程学院) Department of Imaging Physics(影像物理系) Clinical Computational Medical Imaging Research(临床计算医学成像研究) TUM Klinikum Rechts der Isar(慕尼黑工业大学医院) University of California(加州大学) AGH University of Krakow(克拉科夫应用科学大学)

专题命中 安全评测 :alignment(abstract)

AI总结 Learn2Reg 2024通过引入新任务和数据集,推动医学图像配准领域在模态多样性和任务复杂性方面的进展。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:034

Journal ref Machine.Learning.for.Biomedical.Imaging. 3 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09818 2026-01-08 cs.CV 50%

ViMoNet: A Multimodal Vision-Language Framework for Human Behavior Understanding from Motion and Video

ViMoNet: 一种多模态视觉-语言框架,用于从运动和视频中理解人类行为

Rajan Das Gupta, Lei Wei, Md Yeasin Rahat, Nafiz Fahad, Abir Ahmed, Liew Tze Hui

机构 * Department of Computer Science, American International University–Bangladesh (AIUB)(美国国际大学-孟加拉国计算机科学系) Faculty of Psychology, Shinawatra University(信武大学心理学系) Faculty of Information Science and Technology, Multimedia University(多媒体大学信息科学与技术系) Department of Information Technology, Washington University of Science & Technology(华盛顿科学与技术大学信息科技系)

专题命中 安全评测 :alignment(abstract)

AI总结 ViMoNet通过整合运动和视频数据,提出多模态视觉-语言框架,有效提升人类行为理解与医疗保健应用潜力。

Comments This is the preprint version of the manuscript. It is currently being prepared for submission to an academic conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 3 篇

2601.03578 2026-01-08 cs.CL 70%

PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health Ethics

PsychEthicsBench: 评估大型语言模型在澳大利亚心理健康伦理中的表现

Yaling Shen, Stephanie Fong, Yiwen Jiang, Zimu Wang, Feilong Tang, Qingyang Xu, Xiangyu Zhao, Zhongxing Xu, Jiahe Liu, Jinpeng Hu, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) University of Liverpool(利物浦大学) Hefei University of Technology(合肥工业大学)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 PsychEthicsBench通过多选和开放式任务评估LLMs在心理健康伦理方面的表现,揭示拒绝率作为伦理指标的不足,并指出领域微调可能损害伦理鲁棒性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04747 2026-01-08 cs.CY cs.AI 62%

E-LENS: User Requirements-Oriented AI Ethics Assurance

E-LENS:以用户需求为导向的AI伦理保证

Jianlong Zhou, Fang Chen

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出以用户需求为导向的AI伦理保证方法,通过E-LENS平台验证AI伦理,以航空安全方法为借鉴,结合危险分析构建AI伦理保证案例。

Comments 29 pages

Journal ref Human-Intelligent Systems Integration, August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04107 2026-01-08 cs.CY 57%

From Abstract Threats to Institutional Realities: A Comparative Semantic Network Analysis of AI Securitisation in the US, EU, and China

从抽象威胁到制度现实:对美、欧、中三国人工智能安全化的比较语义网络分析

Ruiyi Guo, Bodong Zhang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文通过比较语义网络分析,揭示美欧中三国在人工智能治理上的制度逻辑差异,指出结构性不可通约性导致治理协调困难。

Comments Submitted to the 2026 ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 12 篇

2501.03747 2026-01-08 cs.LG cs.CL stat.AP 81%

Context-Alignment: Activating and Enhancing LLM Capabilities in Time Series

上下文对齐:在时间序列中激活和增强大语言模型的能力

Yuxiao Hu, Qian Li, Dongxiao Zhang, Jinyue Yan, Yuntian Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出上下文对齐方法,通过多模态输入和图神经网络增强LLMs在时间序列任务中的能力,提升逻辑和结构理解,提高预测性能。

Comments This paper has been accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03401 2026-01-08 cs.CL 79%

Rendering Data Unlearnable by Exploiting LLM Alignment Mechanisms

通过利用大语言模型对齐机制使数据不可学习

Ruihan Zhang, Jun Sun

机构 * Singapore Management University(新加坡国立管理大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 通过利用LLM对齐机制,提出免责声明注入方法,使数据对模型不可学习,实现数据保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18795 2026-01-08 cs.CV 78%

ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder

通过基于大语言模型的嵌入器实现渐进式视觉-语言对齐的ProCLIP

Xiaoxing Hu, Kaicheng Yang, Ziyang Gong, Qi Ming, Zonghao Guo, Yu Tian, Xiang An, Ziyong Feng, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学) DeepGlint(深图科技) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 ProCLIP通过课程学习逐步对齐CLIP图像编码器与基于大语言模型的嵌入器,提升长文本处理和多语言理解能力。

Comments 17 pages, 5 fiugres

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20396 2026-01-08 cs.LG 74%

BiListing: Modality Alignment for Listings

BiListing: 列表模态对齐

Guillaume Guy, Mihajlo Grbovic, Chun How Tan, Han Zhao

机构 * Airbnb

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 BiListing通过结合大型语言模型和预训练语言-图像模型,实现列表文本与照片的模态对齐,提升搜索效率并解决冷启动问题。

Journal ref Proceedings of the 34th ACM International Conference on Information and Knowledge Management, CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04170 2026-01-08 cs.AI 70%

Agent Drift: Quantifying Behavioral Degradation in Multi-Agent LLM Systems Over Extended Interactions

智能体漂移:多智能体大语言模型系统在长时间交互中的行为退化量化

Abhishek Rath

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本研究提出智能体漂移概念,通过理论框架和量化指标,探讨多智能体系统在长时间交互中的行为退化问题,并提出缓解策略以提升系统稳定性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03534 2026-01-08 cs.CL cs.CV cs.HC cs.LG 62%

Persona-aware and Explainable Bikeability Assessment: A Vision-Language Model Approach

具有人格意识和可解释性的自行车适应性评估:一种视觉-语言模型方法

Yilong Dai, Ziyi Wang, Chenguang Wang, Kexin Zhou, Yiheng Qian, Susu Xu, Xiang Yan

机构 * University of Alabama(阿拉巴马大学) University of Maryland, College Park(马里兰大学学院公园分校) Stony Brook University(石溪大学) University of Florida(佛罗里达大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种视觉-语言模型框架,通过人格意识和可解释性方法评估自行车适应性,解决道路环境复杂性和用户感知异质性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03845 2026-01-08 cs.AI cs.LO 57%

Formally Explaining Decision Tree Models with Answer Set Programming

用答案集编程形式解释决策树模型

Akihiro Takemura, Masayuki Otani, Katsumi Inoue

机构 * National Institute of Informatics, Tokyo, Japan(日本信息处理研究院) Tokyo Institute of Technology, Tokyo, Japan(东京技术大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出利用答案集编程生成决策树模型多种解释的方法,以提升模型的可解释性与形式化验证能力。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 420-437

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03477 2026-01-08 cs.LG 57%

Hybrid Approach for Driver Behavior Analysis with Machine Learning, Feature Optimization, and Explainable AI

融合机器学习、特征优化与可解释AI的驾驶员行为分析方法

Mehedi Hasan Shuvo, Md. Raihan Tapader, Nur Mohammad Tamjid, Sajjadul Islam, Ahnaf Atef Choudhury, Jia Uddin

机构 * Department of CSE, DUET Gazipur, Bangladesh Department of IST, George Mason University Fairfax, USA AI \& Big Data Department, Woosong University Daejeon, South Korea

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出融合机器学习、特征优化和可解释AI的方法,通过特征分析和模型优化提升驾驶员行为预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03376 2026-01-08 cs.LG 57%

Weather-Aware Transformer for Real-Time Route Optimization in Drone-as-a-Service Operations

考虑天气的变换器用于无人机即服务操作中的实时路线优化

Kamal Mohamed, Lillian Wassim, Ali Hamdi, Khaled Shaban

机构 * Dept. of Computer Science, Qatar University, Doha, Qatar(计算机科学系,卡塔尔大学,多哈)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出一种天气感知的变换器框架,用于实时优化无人机即服务操作的路线,通过天气启发式方法提升动态环境下的路由决策效率与安全性。

Comments 2025 IEEE/ACS 22nd International Conference on Computer Systems and Applications (AICCSA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03993 2026-01-08 cs.CV 50%

PosterVerse: A Full-Workflow Framework for Commercial-Grade Poster Generation with HTML-Based Scalable Typography

PosterVerse: 一个用于商业级海报生成的全流程框架,基于HTML的可扩展字体

Junle Liu, Peirong Zhang, Yuyi Zhang, Pengyu Yan, Hui Zhou, Xinyue Zhou, Fengjun Guo, Lianwen Jin

专题命中 其他安全 :alignment(abstract)

AI总结 PosterVerse通过全流程框架和HTML驱动技术,实现商业级海报的高密度文本渲染与灵活设计。

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03713 2026-01-08 cs.CV 50%

BREATH-VL: Vision-Language-Guided 6-DoF Bronchoscopy Localization via Semantic-Geometric Fusion

BREATH-VL:基于视觉-语言引导的6自由度支气管镜定位:通过语义-几何融合

Qingyao Tian, Bingyu Yang, Huai Liao, Xinyan Huang, Junyong Li, Dong Yi, Hongbin Liu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Pulmonary and Critical Care Medicine, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院呼吸与危重症医学科) Centre of AI and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(香港科学院人工智能与机器人中心) School of Biomedical Engineering and Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院)

专题命中 其他安全 :alignment(abstract)

AI总结 BREATH-VL通过融合语义和几何信息,实现高精度的6自由度支气管镜定位,减少定位误差并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08930 2026-01-08 cs.GR 50%

How Does a Virtual Agent Decide Where to Look? Symbolic Cognitive Reasoning for Embodied Head Rotation

虚拟代理如何决定看向何处?基于具身头部旋转的符号认知推理

Juyeong Hwang, Seong-Eun Hong, JaeYoung Seon, Hyeongyeop Kang

专题命中 其他安全 :safety(abstract)

AI总结 本文提出SCORE框架,通过符号认知推理实现具身头部旋转,结合视觉-语言模型和大语言模型,使虚拟代理能合理预测头部运动及背后动机。

Comments 13 pages, 8 figures. Accepted to SIGGRAPH Asia Conference Papers '25

Journal ref SIGGRAPH Asia Conference Papers '25, December 15-18, 2025, Hongkong

详情

展开后加载摘要…

URL PDF HTML 收藏