arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-26 至 2026-02-26 共收录 50 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2602.21346 2026-02-26 cs.CL cs.AI 93%

Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment

基于对齐的DPO:一种原则性的推理方法以提高安全性对齐

Mengxuan Hu, Vivek V. Datla, Anoop Kumar, Zihan Guan, Sheng Li, Alfy Samuel, Daben Liu

机构 * University of Virginia(弗吉尼亚大学) Capital One

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);safety(title,abstract);RLHF(abstract)

AI总结 本文提出基于对齐的DPO方法,通过引入推理意识的后训练和对齐加权机制,提升大语言模型的安全性对齐鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21765 2026-02-26 cs.LG cs.AI stat.ML 84%

Generalisation of RLHF under Reward Shift and Clipped KL Regularisation

基于奖励偏移和截断KL正则化的RLHF泛化

Kenton Tang, Yuzhu Chen, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于奖励偏移和截断KL正则化的RLHF泛化理论,分析了奖励偏移和KL截断对泛化误差的影响,并给出了优化KL截断阈值和预算分配的实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20498 2026-02-26 cs.CL 83%

Robust Preference Alignment via Directional Neighborhood Consensus

通过方向邻域共识实现鲁棒偏好对齐

Ruochen Mao, Yuling Shi, Xiaodong Gu, Jiaheng Wei

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL

AI总结 通过方向邻域共识实现鲁棒偏好对齐,提升模型在多样化偏好下的稳定性与可靠性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21745 2026-02-26 cs.AI cs.CY 62%

The ASIR Courage Model: A Phase-Dynamic Framework for Truth Transitions in Human and AI Systems

ASIR勇气模型:人类和人工智能系统中真相过渡的相动态框架

Hyo Jin Kim

机构 * Jinple Studio(jinple工作室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 ASIR勇气模型通过相动态框架,将真相披露视为状态转换过程,适用于人类和AI系统在压力下的行为分析与建模。

Comments 13 pages, 5 figures. Version 1. Includes recursive feedback extension and simulation results. Data available via DOI: 10.5281/zenodo.18754266

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07922 2026-02-26 cs.LG 57%

SERL: Self-Examining Reinforcement Learning on Open-Domain

SERL:面向开放域的自我审查强化学习

Weixuan Ou, Yanzhao Zheng, Shuoshuo Sun, Wei Zhang, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu, Pengwei Yan, Yifan Qiao

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 SERL通过自我审查机制提升开放域任务中的LLM性能,无需外部信号,实现演员与裁判的协同改进。

Comments Accepted by the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20800 2026-02-26 cs.IR 50%

Mitigating Preference Leakage via Strict Estimator Separation for Normative Generative Ranking

通过严格估计分离缓解偏好泄漏以规范生成排序

Dalia Nahhas, Xiaohao Cai, Imran Razzak, Shoaib Jameel

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出通过严格分离监督与评估模型,缓解偏好泄漏问题,提升生成排序的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 13 篇

2602.22146 2026-02-26 cs.LG cs.AI 84%

Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual

多目标安全大语言模型对齐的可证明最终迭代收敛性:基于乐观对偶算法

Yining Li, Peizhong Ju, Ness Shroff

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种乐观对偶算法,用于多目标安全大语言模型对齐,解决了传统方法在最终迭代中的不稳定问题,并证明了该算法的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12033 2026-02-26 cs.LG cs.AI 81%

EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation

EARL: 用于可靠RTL代码生成的熵感知强化学习对齐大语言模型

Jiahe Shi, Zhengqi Gao, Ching-Yun Ko, Duane Boning

机构 * MIT(麻省理工学院) IBM(国际商业机器公司)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 EARL通过熵感知强化学习提升Verilog代码生成的可靠性与准确性

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17306 2026-02-26 cs.CL 79%

Refusal Direction is Universal Across Safety-Aligned Languages

拒绝方向在安全对齐语言中是普遍的

Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本文研究了多语言LLMs中拒绝方向的跨语言普遍性,发现英文提取的向量可有效绕过其他语言的拒绝,揭示了跨语言安全机制的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19983 2026-02-26 cs.RO cs.AI 79%

Contextual Safety Reasoning and Grounding for Open-World Robots

面向开放世界机器人的上下文安全推理与 grounding

Zachary Ravichandran, David Snyder, Alexander Robey, Hamed Hassani, Vijay Kumar, George J. Pappas

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 CORE框架通过视觉语言模型实现在线上下文推理与空间grounding,提供概率安全保证,在开放世界中有效执行上下文适应的安全行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20094 2026-02-26 cs.IR cs.CL cs.HC 70%

Toward Safe and Human-Aligned Game Conversational Recommendation via Multi-Agent Decomposition

迈向安全且人本对齐的游戏对话推荐的多智能体分解

Zheng Hui, Xiaokai Wei, Yexi Jiang, Kevin Gao, Chen Wang, Frank Ong, Se-eun Yoon, Rachit Pareek, Michelle Gong

机构 * Roblox Corporation(Roblox公司) University of Cambridge(剑桥大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 MATCHA通过多智能体框架提升游戏对话推荐的安全性与人本对齐,实现更精细的个性化和更强的对抗防御能力。

Comments ICML 2025 MAS, EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21857 2026-02-26 cs.AI cs.CL cs.LG 67%

Distill and Align Decomposition for Enhanced Claim Verification

分解与对齐:提升声明验证的Distill和Align分解

Jabez Magomere, Elena Kochkina, Samuel Mensah, Simerjot Kaur, Fernando Acero, Arturo Oncevay, Charese H. Smiley, Xiaomo Liu, Manuela Veloso

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于强化学习的分解与对齐方法,通过优化分解质量和验证器对齐,提升声明验证性能,达到71.75%的宏F1,优于现有方法。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06966 2026-02-26 cs.LG cs.AI cs.CY 67%

Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research

机器去学习并不如你所想:生成式AI政策与研究的启示

A. Feder Cooper, Christopher A. Choquette-Choo, Miranda Bogen, Kevin Klyman, Matthew Jagielski, Katja Filippova, Ken Liu, Alexandra Chouldechova, Jamie Hayes, Yangsibo Huang, Eleni Triantafillou, Peter Kairouz, Nicole Elyse Mitchell, Niloofar Mireshghallah, Abigail Z. Jacobs, James Grimmelmann, Vitaly Shmatikov, Christopher De Sa, Ilia Shumailov, Andreas Terzis, Solon Barocas, Jennifer Wortman Vaughan, danah boyd, Yejin Choi, Sanmi Koyejo, Fernando Delgado, Percy Liang, Daniel E. Ho, Pamela Samuelson, Miles Brundage, David Bau, Seth Neel, Hanna Wallach, Amy B. Cyphert, Mark A. Lemley, Nicolas Papernot, Katherine Lee

机构 * The GenLaw Center(GenLaw中心) Microsoft Research(微软研究院) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) Center for Democracy & Technology(民主与科技中心) Princeton(普林斯顿) Google(谷歌) University of Washington(华盛顿大学) University of Michigan(密歇根大学) Cornell Tech(康奈尔科技) Cornell Law School(康奈尔法学院) Cornell University(康奈尔大学) Lighthouse Stanford Law School(斯坦福法学院) UC Berkeley(伯克利大学) Independent(独立研究者) Northeastern University(东北大学) Harvard Business School(哈佛商学院) W. Virginia University College of Law(维珍尼亚大学法学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文指出机器去学习并非通用解决方案,揭示其在生成式AI政策与研究中的局限性。

Comments NeurIPS 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17729 2026-02-26 cs.CY cs.AI cs.ET cs.HC 62%

Stop Saying "AI"

别再说『人工智能』了

Nathan G. Wood, Scott Robbins, Eduardo Zegarra Berodt, Anton Graf von Westerholt, Michelle Behrndt, Hauke Budig, Daniel Kloock-Schreiber

机构 * Institute of Air Transportation Systems, Hamburg University of Technology(空气交通系统研究所,汉堡技术大学) Ethics + Emerging Sciences Group, California Polytechnic State University San Luis Obispo(伦理与新兴科学小组,加州州立大学圣路易斯奥比斯波分校) Center for Environmental and Technology Ethics – Prague(环境与技术伦理中心–布拉格) Academy for Responsible Research, Teaching, and Innovation, Karlsruhe Institute of Technology(负责任研究、教学与创新学院,卡尔斯鲁厄理工学院) Department of Philosophy, University of Hamburg(哲学系,汉堡大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了『人工智能』术语在军事领域的应用,指出其泛化带来的问题,并主张在讨论中明确具体系统以提高讨论的精确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21269 2026-02-26 cs.LG cs.AI stat.ML 62%

Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space

群体正交化策略优化:将群体策略优化视为希尔伯特空间中的正交投影

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东公司泰安分公司)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 GOPO通过正交投影在希尔伯特空间中优化群体策略,实现精确稀疏性和稳定梯度动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12415 2026-02-26 cs.LG cs.AI 62%

Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space

正交化策略优化:作为希尔伯特空间中的正交投影的策略优化

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东公司泰安分支)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 OPO通过正交投影在希尔伯特空间中实现策略优化,利用守恒定律而非方差减少启发式方法,提升模型在长时程训练和分布外泛化中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00062 2026-02-26 cs.CV cs.AI cs.LG cs.RO 62%

World Simulation with Video Foundation Models for Physical AI

基于视频基础模型的世界模拟用于物理AI

NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Cosmos-Predict2.5和Cosmos-Transfer2.5通过统一生成和增强的模拟能力,推动物理AI领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18060 2026-02-26 cs.LG cs.AI cs.RO 62%

SPACeR: Self-Play Anchoring with Centralized Reference Models

SPACeR:基于集中参考模型的自我对战锚定

Wei-Jer Chang, Akshay Rangesh, Kevin Joseph, Matthew Strong, Masayoshi Tomizuka, Yihan Hu, Wei Zhan

机构 * Applied Intuition University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 SPACeR通过集中参考模型指导自我对战,实现高效、可扩展的自动驾驶策略生成。

Comments Accepted at ICLR 2026. Project page: https://spacer-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21496 2026-02-26 cs.AI 57%

Beyond Refusal: Probing the Limits of Agentic Self-Correction for Semantic Sensitive Information

超越拒绝:探求代理自我校正对语义敏感信息的极限

Umid Suleymanov, Zaur Rajabov, Emil Mirzazada, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系) School of IT and Engineering, ADA University(ADA大学信息科技与工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出SemSIEdit框架,通过代理代理迭代批评和重写敏感信息,减少泄露并平衡隐私与效用,揭示规模依赖的安全分歧和推理悖论。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2506.07452 2026-02-26 cs.LG cs.AI cs.CL cs.CY 90%

When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment

当风格破坏安全性:防御大语言模型对抗浅层风格对齐

Yuxin Xiao, Sana Tonekaboni, Walter Gerych, Vinith Suriyakumar, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究探讨了风格对齐对大语言模型安全性的影响,提出 SafeStyle 防御策略有效缓解了浅层风格对齐带来的风险。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19610 2026-02-26 cs.CV 82%

JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models

JailBound: 视觉语言模型内部安全边界的劫持

Jiaxin Song, Yixu Wang, Jie Li, Rui Yu, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Xuan Tong(宣通) NSFOCUS

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract)

AI总结 JailBound通过在视觉语言模型的潜在空间中探索安全边界,提出了一种新的劫持框架,有效提升了白盒和黑盒攻击成功率,揭示了模型的安全风险。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21236 2026-02-26 cs.SI cs.CY 70%

@GrokSet: multi-party Human-LLM Interactions in Social Media

@GrokSet:社交媒体中多方人与LLM互动

Matteo Migliarini, Berat Ercevik, Oluwagbemike Olowe, Saira Fatima, Sarah Zhao, Minh Anh Le, Vasu Sharma, Ashwinee Panda

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 @GrokSet 是一个大规模社交媒体数据集,揭示了LLM在高风险政治辩论中作为权威裁决者的功能转变及其在社交验证中的低地位

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2602.21267 2026-02-26 cs.CR cs.AI 79%

A Systematic Review of Algorithmic Red Teaming Methodologies for Assurance and Security of AI Applications

对AI应用保障和安全性的算法红队方法论系统综述

Shruti Srivastava, Kiranmayee Janardhan, Shaurya Jauhari

专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI

AI总结 本文系统综述了自动化红队方法的现有研究,探讨其方法、工具、优势与局限,并指出未来改进方向,以提升AI应用的安全保障能力。

Comments 39 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 3 篇

2602.05066 2026-02-26 cs.CR cs.AI 70%

Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks

通过代理式攻击绕过AI控制协议

Jafar Isbarov, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出通过代理式攻击绕过AI监控防御,显示即使大规模监控模型也易受攻击,揭示当前防御机制的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22157 2026-02-26 cs.CL cs.HC cs.LG 62%

Dynamic Personality Adaptation in Large Language Models via State Machines

通过状态机实现大语言模型的动态人格适应

Leon Pielage, Ole Hätscher, Mitja Back, Bernhard Marschall, Benjamin Risse

机构 * Institute for Geoinformatics, University of Münster(地理信息研究所,穆尔斯特大学) Faculty of Mathematics and Computer Science, University of Münster(数学与计算机科学学院,穆尔斯特大学) Department of Psychology, University of Münster(心理学系,穆尔斯特大学) Institute of Medical Education and Student Affairs, University of Münster(医学教育与学生事务研究所,穆尔斯特大学)

专题命中 提示注入 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过状态机实现大语言模型动态人格适应的框架,通过模块化评分管道实现人格状态的动态调整,提升在复杂互动场景中的表现。

Comments 22 pages, 5 figures, submitted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20156 2026-02-26 cs.CR cs.LG 57%

Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks

Skill-Inject: 评估代理对技能文件攻击的脆弱性

David Schmotz, Luca Beurer-Kellner, Sahar Abdelnabi, Maksym Andriushchenko

机构 * Max Planck Institute for Intelligent Systems, ELLIS Institute Tübingen, Tübingen AI Center(马克斯·普朗克智能系统研究所、图宾根ELLIS研究所、图宾根人工智能中心)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 SkillInject通过评估代理对技能文件攻击的脆弱性,揭示了当前LLM代理在安全性和合规性方面的严重问题,指出需采用上下文感知的授权框架来提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 3 篇

2506.09886 2026-02-26 cs.CL cs.AI 62%

Probabilistic distances-based hallucination detection in LLMs with RAG

基于概率距离的LLM中幻觉检测方法(RAG)

Rodion Oblovatny, Alexandra Kuleshova, Konstantin Polev, Alexey Zaytsev

机构 * Markov Lab, Department of Mathematics(马尔可夫实验室,数学系) Computer Science, Saint-Petersburg University(计算机科学,圣彼得堡大学) AI Center, Skoltech(人工智能中心,斯克里普丘克技术学院) SB AI Lab(SB人工智能实验室) AI Center, Skoltech, Risk department, Sber(人工智能中心,斯克里普丘克技术学院,风险部门)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于概率距离的LLM幻觉检测方法,利用提示标记与响应标记嵌入分布的距离来检测幻觉,具有高效性和可迁移性。

Comments Updated approach to constructing a hallucination detection score. Added results from experiments with the NLI task. The approach with trainable deep kernels has been removed, with a focus on the unsupervised approach

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21701 2026-02-26 cs.LG physics.data-an stat.ML 57%

Learning Complex Physical Regimes via Coverage-oriented Uncertainty Quantification: An application to the Critical Heat Flux

通过覆盖导向的不确定性量化学习复杂物理区域:应用于临界热流的应用

Michele Cazzola, Alberto Ghione, Lucia Sargentini, Julien Nespoulous, Riccardo Finotello

机构 * Université Paris Saclay, Cea(巴黎萨克雷大学,CEA)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 通过覆盖导向的不确定性量化方法,提升对复杂物理区域(如临界热流)的建模能力,实现高预测精度和动态适应的不确定性估计。

Comments 34 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21588 2026-02-26 cs.LG cs.CE 57%

ABM-UDE: Developing Surrogates for Epidemic Agent-Based Models via Scientific Machine Learning

ABM-UDE:通过科学机器学习开发用于流行病代理模型的替代方案

Sharv Murgai, Utkarsh Utkarsh, Kyle C. Nguyen, Alan Edelman, Erin C. S. Acquesta, Christopher Vincent Rackauckas

机构 * Monta Vista High School(蒙塔维斯塔高中) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Sandia National Laboratories(桑塔纳国家实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 ABM-UDE通过科学机器学习开发流行病代理模型的替代方案,利用UDEs学习接触率参数化,提升预测精度与可靠性,实现快速、可解释的流行病模拟。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 2 篇

2602.13477 2026-02-26 cs.AI 70%

OMNI-LEAK: Orchestrator Multi-Agent Network Induced Data Leakage

OMNI-LEAK:协调多智能体网络引发的数据泄露

Akshat Naik, Jay Culligan, Yarin Gal, Philip Torr, Rahaf Aljundi, Alasdair Paren, Adel Bibi

机构 * University of Oxford(牛津大学)

专题命中 隐私与版权 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 OMNI-LEAK攻击通过多智能体协调设置中的单个提示注入泄露敏感数据,揭示了多代理系统在数据安全方面的关键漏洞。

Comments Preprint; corrected typos

详情

展开后加载摘要…

URL PDF HTML 收藏