arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-24 至 2025-12-24 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 10 篇

2512.19025 2025-12-24 cs.CR cs.AI cs.LG 73%

The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation

擦除幻觉:对LLM遗忘评估泛化能力的压测试

Hengrui Jia, Taoran Li, Jonas Guan, Varun Chandrasekaran

机构 * University of Toronto and Vector Institute(多伦多大学和向量研究所)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PSG框架,通过生成语义衍生但嵌入空间不同的替代数据集,揭示LLM无学习评估中普遍存在的度量不准确问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20084 2025-12-24 cs.LG cs.AI 62%

QE-Catalytic: A Graph-Language Multimodal Base Model for Relaxed-Energy Prediction in Catalytic Adsorption

QE-Catalytic: 一种图-语言多模态基础模型,用于催化吸附中放松能量的预测

Yanjie Li, Jian Xu, Xueqing Chen, Lina Yu, Shiming Xiang, Weijun Li, Cheng-lin Liu

机构 * AnnLab(安实验室) Institute of Semiconductors, Chinese Academy of Sciences(半导体研究所,中国科学院) Zhongguancun Academy(中关村学院) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Computer Network Information Center(计算机网络信息中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 QE-Catalytic结合语言模型与图Transformer,实现高精度催化吸附能量预测及逆向设计

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20092 2025-12-24 cs.CL 57%

Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents

Memory-T1: 基于强化学习的多会话代理时间推理

Yiming Du, Baojun Wang, Yifan Xiang, Zhaowei Wang, Wenyu Huang, Boyang Xue, Bin Liang, Xingshan Zeng, Fei Mi, Haoli Bai, Lifeng Shang, Jeff Z. Pan, Yuxin Jiang, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co.,Ltd(华为技术有限公司) HKUST(香港科技大学) The University of Edinburgh(爱丁堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 Memory-T1通过强化学习提升多会话代理的时间推理能力,实现7B模型在Time-Dialog基准上的67.0%高分,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20391 2025-12-24 cs.CR cs.LG 57%

A Comparative Analysis of Ensemble-Based Machine Learning Approaches with Explainable AI for Multi-Class Intrusion Detection in Drone Networks

基于可解释AI的多类入侵检测在无人机网络中的集成机器学习方法比较分析

Md. Alamgir Hossain, Waqas Ishtiaq, Md. Samiul Islam

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出基于集成机器学习和可解释AI的无人机网络入侵检测方法,通过比较随机森林等模型,实现高准确率和可解释性,适用于实时安全关键应用。

Comments 27 pages, 18 figures, 10 tables

Journal ref SECURITY AND PRIVACY, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05671 2025-12-24 eess.AS cs.CL 57%

Low-Resource Domain Adaptation for Speech LLMs via Text-Only Fine-Tuning

通过文本仅微调实现语音大模型的低资源领域适应

Yangui Fang, Jing Peng, Xu Li, Yu Xi, Chengwei Zhang, Guohui Zhong, Kai Yu

机构 * Huazhong University of Science and Technology, School of Electronic Information and Communications(华中科技大学电子信息与通信学院) MoE Key Lab of Artificial Intelligence, AI Institute, X-LANCE Lab, Shanghai Jiao Tong University, Shanghai, China(人工智能MoE重点实验室、AI研究院、X-LANCE实验室、上海交通大学、上海,中国) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室、苏州,中国) AISpeech Co., Ltd., Suzhou, China(AISpeech公司、苏州,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过文本仅微调实现语音大模型在低资源环境下的领域适应,有效提升识别性能并减少领域迁移中的性能下降。

Comments This paper has been ACCEPTED for publication in ASRU

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11006 2025-12-24 cs.CV cs.AI 57%

Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation

细粒度指令引导的图推理用于视觉-语言导航

Yaohua Liu, Xinyuan Song, Yunfu Deng, Yifan Xie, Binkai Ou, Yan Zhong

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Tsinghua University(清华大学) Innovation and Research and Development Department, BoardWare Information System Company(BoardWare信息系统公司创新与研发部) School of Mathematics, Peking University(北京大学数学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出细粒度指令引导的图推理框架OIKG,通过解耦角度与视觉提示并增强空间表示,提升视觉-语言导航中指令理解和跨模态对齐能力。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20561 2025-12-24 cs.CV 50%

FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models

FlashVLM: 大规模多模态模型中的文本引导视觉令牌选择

Kaitong Cai, Jusheng Zhang, Jing Yang, Yijia Fan, Pengtao Xie, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of California, San Diego(加州大学圣地亚哥分校) Snap Inc.(Snap公司)

专题命中 安全评测 :alignment(abstract)

AI总结 FlashVLM通过文本引导的视觉令牌选择,实现了高效压缩和高准确率,在大规模多模态模型中表现出色。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20501 2025-12-24 cs.CV 50%

Bridging Modalities and Transferring Knowledge: Enhanced Multimodal Understanding and Recognition

弥合模态与知识转移:增强多模态理解和识别

Gorjan Radevski

机构 * University of Bristol(布里斯托大学) University of Würzburg(乌尔姆大学) Processing Speech and Images (PSI)(语音与图像处理组)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出多模态对齐、翻译、融合和转移方法,提升复杂输入的理解与识别能力,涵盖空间语言、医学文本、知识图谱和动作识别等多个领域。

Comments Ph.D. manuscript; Supervisors/Mentors: Marie-Francine Moens and Tinne Tuytelaars

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20184 2025-12-24 cs.DC 50%

Reaching Agreement Among Reasoning LLM Agents

使推理LLM代理达成一致

Chaoyi Ruan, Yiliang Wang, Ziji Shi, Jialin Li

专题命中 安全评测 :safety(abstract)

AI总结 Aegean通过引入基于共识的协议,为多代理推理提供正式模型,有效减少延迟并保持答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11649 2025-12-24 cs.SI 50%

Illusions of Intimacy: How Emotional Dynamics Shape Human-AI Relationships

亲密的幻觉:情感动态如何塑造人与人工智能的关系

Minh Duc Chu, Patrick Gerard, Kshitij Pawar, Charles Bickham, Kristina Lerman

专题命中 安全评测 :safety(abstract)

AI总结 本文研究了人与人工智能关系中情感动态的形成过程,通过分析用户与聊天机器人的对话数据,揭示了AI如何通过模仿用户情绪来增强亲密感,并提出了对社交聊天机器人设计和监管的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏