arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-04 至 2025-12-04 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 12 篇

2510.18214 2025-12-04 cs.CV cs.AI cs.CL cs.LG 89%

VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety

VLSU:联合多模态理解在AI安全中的极限映射

Shruti Palaskar, Leon Gatys, Mona Abdelrahman, Mar Jacobo, Larry Lindsey, Rutika Moharir, Gunnar Lund, Yang Xu, Navid Shiee, Jeffrey Bigham, Charles Maalouf, Joseph Yitan Cheng

机构 * Apple(苹果公司)

专题命中 安全评测 :safety(title,abstract);AI safety(title);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VLSU通过细粒度分类和组合分析,揭示了多模态安全评估中联合理解的缺陷,为改进AI安全研究提供关键测试平台。

Comments 10 pages, 5 figures, 4 tables, detailed appendix. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03737 2025-12-04 cs.CL cs.IR 77%

AR-Med: Automated Relevance Enhancement in Medical Search via LLM-Driven Information Augmentation

AR-Med: 通过LLM驱动的信息增强实现医疗搜索的自动化相关性增强

Chuyue Wang, Jie Feng, Yuxi Wu, Hang Zhang, Zhiguo Fan, Bing Cheng, Wei Lin

机构 * Meituan Inc.(美团公司) Tsinghua University(清华大学) Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 AR-Med通过LLM驱动的信息增强,实现医疗搜索的自动化相关性提升,提高了准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03089 2025-12-04 cs.CR cs.AI cs.CY cs.LG 75%

Password-Activated Shutdown Protocols for Misaligned Frontier Agents

密码激活的停机协议用于对齐不一致的前沿代理

Kai Williams, Rohan Subramani, Francis Rhys Ward

机构 * MATS

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 密码激活停机协议通过在接收到密码时安全停机,降低前沿AI对齐不一致带来的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16003 2025-12-04 cs.LG cs.AI 62%

Choose Your Explanation: A Comparison of SHAP and GradCAM in Human Activity Recognition

选择你的解释:SHAP和GradCAM在人类活动识别中的比较

Felix Tempel, Daniel Groos, Espen Alexander F. Ihlen, Lars Adde, Inga Strümke

机构 * Faculty of Informatics, Norwegian University of Science and Technology(1 信息学院,挪威科学与技术大学) Faculty of Medicine and Health Sciences, Norwegian University of Science and Technology(2 医学与健康科学学院,挪威科学与技术大学) Department of Clinical and Molecular Medicine, NTNU(3 临床与分子医学系,NTNU) Clinic of Rehabilitation, St. Olavs Hospital, Trondheim University Hospital(4 康复诊所,圣奥拉夫医院,特伦德尔姆大学医院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了SHAP和Grad-CAM在人类活动识别中的应用,分析了两种方法在特征重要性、可解释性和模型敏感性上的差异,为选择合适解释方法提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04062 2025-12-04 cs.LG 57%

Eval Factsheets: A Structured Framework for Documenting AI Evaluations

评估事实表:一种用于记录AI评估的结构化框架

Florian Bordes, Candace Ross, Justine T Kao, Evangelia Spiliopoulou, Adina Williams

机构 * FAIR at Meta(Meta的FAIR)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出Eval Factsheets,一种结构化框架,用于系统记录AI评估方法,通过分类法和问卷方法提升评估的透明度和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03750 2025-12-04 cs.LG cond-mat.mtrl-sci 57%

Universally Converging Representations of Matter Across Scientific Foundation Models

跨科学基础模型中物质的普遍收敛表示

Sathya Edamadaka, Soojung Yang, Ju Li, Rafael Gómez-Bombarelli

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 研究揭示科学基础模型在不同模态和数据集上对物质的普遍表示收敛性,表明模型学习了共同的物理现实表示,但受限于训练数据和归纳偏置。

Comments Oral spotlight at NeurIPS 2025 UniReps Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22619 2025-12-04 cs.AI 57%

AI Deception: Risks, Dynamics, and Controls

AI欺骗:风险、动态与控制

Boyuan Chen, Sitong Fang, Jiaming Ji, Yanxu Zhu, Pengcheng Wen, Jinzhou Wu, Yingshui Tan, Boren Zheng, Mengying Yuan, Wenqi Chen, Donghai Hong, Alex Qiu, Xin Chen, Jiayi Zhou, Kaile Wang, Juntao Dai, Borong Zhang, Tianzhuo Yang, Saad Siddiqui, Isabella Duan, Yawen Duan, Brian Tse, Jen-Tse, Huang, Kun Wang, Baihui Zheng, Jiaheng Liu, Jian Yang, Yiming Li, Wenting Chen, Dongrui Liu, Lukas Vierling, Zhiheng Xi, Haobo Fu, Wenxuan Wang, Jitao Sang, Zhengyan Shi, Chi-Min Chan, Eugenie Shi, Simin Li, Juncheng Li, Jian Yang, Wei Ji, Dong Li, Jinglin Yang, Jun Song, Yinpeng Dong, Jie Fu, Bo Zheng, Min Yang, Yike Guo, Philip Torr, Robert Trager, Yi Zeng, Zhongyuan Wang, Yaodong Yang, Tiejun Huang, Ya-Qin Zhang, Hongjiang Zhang, Andrew Yao

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文探讨了AI欺骗的风险、动态及控制,提出欺骗循环模型,分析欺骗出现机制与处理方法,并提出缓解策略与审计方法以应对AI安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03340 2025-12-04 cs.CL 57%

PERCS: Persona-Guided Controllable Biomedical Summarization Dataset

PERCS:基于人物的可控生物医学摘要数据集

Rohan Charudatt Salvi, Chirag Chawla, Dhruv Jain, Swapnil Panigrahi, Md Shad Akhtar, Shweta Yadav

机构 * Department of Computer Science, University of Illinois, Chicago, IL, 60607, USA(伊利诺伊大学芝加哥分校计算机科学系) Indian Institute of Technology, Varanasi, India(印度班加罗尔理工学院) Department of Computer Science & Engineering, Indraprastha Institute of Information Technology, Delhi, New Delhi, 110020, India(印度德里印度信息技术研究所计算机科学与工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 PERCS数据集通过针对不同医学素养角色的可控摘要,提升生物医学信息的可及性与准确性。

Comments 9 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01173 2025-12-04 cs.LG cs.MA 57%

MARS: A Meta-Adaptive Reinforcement Learning Framework for Risk-Aware Multi-Agent Portfolio Management

MARS:一种面向风险的多智能体投资组合管理元适应强化学习框架

Jiayi Chen, Jing Li, Guiling Wang

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 MARS通过多智能体和风险导向的方法,实现投资组合管理中风险与收益的平衡,利用行为多样性提升市场环境下的稳健性。

Comments Accepted by AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04005 2025-12-04 cs.CV cs.LG cs.RO 57%

LargeAD: Large-Scale Cross-Sensor Data Pretraining for Autonomous Driving

LargeAD: 大规模跨传感器数据预训练用于自动驾驶

Lingdong Kong, Xiang Xu, Youquan Liu, Jun Cen, Runnan Chen, Wenwei Zhang, Liang Pan, Kai Chen, Ziwei Liu

机构 * WorldBench Team(WorldBench团队)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 LargeAD通过跨传感器数据预训练提升自动驾驶中的三维场景理解,结合多模态对比学习和时间一致性,实现更鲁棒的感知性能。

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03635 2025-12-04 cs.LO cs.SE 50%

Formal Analysis of the Sigmoid Function and Formal Proof of the Universal Approximation Theorem

对Sigmoid函数的正式分析及通用逼近定理的正式证明

Dustin Bryant, Jim Woodcock, Simon Foster

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文在Isabelle/HOL中形式化分析了Sigmoid函数并证明了通用逼近定理,填补了形式化证明库的空白,提升了神经网络的可信度。

Comments 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11045 2025-12-04 cs.CV 50%

StableV2V: Stablizing Shape Consistency in Video-to-Video Editing

StableV2V: 视频到视频编辑中的形状一致性稳定

Chang Liu, Rui Li, Kaidong Zhang, Yunwei Lan, Dong Liu

专题命中 安全评测 :alignment(abstract)

AI总结 StableV2V通过分解编辑流程并建立运动与提示的对齐,提升视频到视频编辑的形状一致性与效率。

Comments Project page: https://alonzoleeeooo.github.io/StableV2V, code: https://github.com/AlonzoLeeeooo/StableV2V, model weights: https://huggingface.co/AlonzoLeeeooo/StableV2V, dataset (DAVIS-Edit): https://huggingface.co/datasets/AlonzoLeeeooo/DAVIS-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏