arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-10 至 2025-12-10 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 17 篇

2512.02530 2025-12-10 cs.AI 83%

Aetheria: A multimodal interpretable content safety framework based on multi-agent debate and collaboration

Aetheria:基于多智能体辩论与协作的多模态可解释内容安全框架

Yuxiang He, Jian Zhao, Yuchen Yuan, Tianle Zhang, Wei Cai, Haojie Cheng, Ziyan Shi, Ming Zhu, Haichuan Tang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Sichuan University(四川大学) Peking University(北京大学) Beijing Jiaotong University(北京交通大学) Harbin Institute of Technology(哈尔滨工业大学) China Railway Rolling Stock Corporation Limited(中国铁路滚动股票有限公司)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 Aetheria通过多智能体辩论与协作机制,实现多模态内容安全的可解释性与高准确性,提升可信AI审查水平。

Comments https://github.com/Herrieson/Aetheria

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08233 2025-12-10 cs.RO 78%

Semantic-Metric Bayesian Risk Fields: Learning Robot Safety from Human Videos with a VLM Prior

语义-度量贝叶斯风险场:从人类视频中学习机器人安全性的方法

Timothy Chen, Marcus Dominguez-Kuhne, Aiden Swann, Xu Liu, Mac Schwager

机构 * Stanford University(斯坦福大学) California Institute of Technology(加州理工学院)

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出基于贝叶斯框架的语义-度量风险场,通过人类视频学习机器人安全风险模型,实现类人风险评估与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01354 2025-12-10 cs.AI cs.CL cs.CY cs.LG q-fin.TR 70%

The Necessity of Imperfection:Reversing Model Collapse via Simulating Cognitive Boundedness

不完美之必要:通过模拟认知局限性逆转模型崩溃

Zhongjie Jiang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出通过模拟认知局限性生成具有真实功能增益的合成数据,以解决模型崩溃问题。

Comments 60 pages,9 figures. v3: Major update. Added 3D topological visualization (Figure 1) and independent computational verification of the Adaptive Markets Hypothesis (AMH). Includes comprehensive Supplementary Materials (algorithmic pseudocode, system architecture, and real-time GARCH logs) for technical reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08451 2025-12-10 cs.LG cs.AI cs.CY cs.ET 67%

Biothreat Benchmark Generation Framework for Evaluating Frontier AI Models II: Benchmark Generation Process

生物威胁基准生成框架用于评估前沿AI模型II:基准生成过程

Gary Ackerman, Zachary Kallenborn, Anna Wetzel, Hayley Peterson, Jenna LaTourette, Olivia Shoemaker, Brandon Behlendorf, Sheriff Almakki, Doug Clifford, Noah Sheinbaum

专题命中 安全评测 :red teaming(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出生物威胁基准生成框架,通过三种方法生成细菌生物威胁基准数据集,用于评估前沿AI模型的生物安全风险。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08769 2025-12-10 cs.AI 57%

A Practical Guide for Designing, Developing, and Deploying Production-Grade Agentic AI Workflows

生产级智能体AI工作流设计、开发与部署的实用指南

Eranga Bandara, Ross Gore, Peter Foytik, Sachin Shetty, Ravi Mukkamala, Abdul Rahman, Xueping Liang, Safdar H. Bouk, Amin Hass, Sachini Rajapakse, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(旧 Dominion 大学) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一套生产级智能体AI工作流的设计、开发和部署的最佳实践,涵盖架构设计、多智能体模式、模型上下文协议及环境感知部署策略,旨在提升系统的可靠性与可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08723 2025-12-10 cs.CY 57%

The Role of Risk Modeling in Advanced AI Risk Management

风险建模在高级人工智能风险管理中的作用

Chloé Touzet, Henry Papadatos, Malcolm Murray, Otter Quarks, Steve Barrett, Alejandro Tlaie Boria, Elija Perrier, Matthew Smith, Siméon Campos

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文探讨了风险建模在高级AI风险管理中的关键作用,提出通过整合情景构建与风险评估,构建可验证的AI架构以应对复杂风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08185 2025-12-10 cs.CR cs.AI 57%

A Practical Framework for Evaluating Medical AI Security: Reproducible Assessment of Jailbreaking and Privacy Vulnerabilities Across Clinical Specialties

评估医疗AI安全的实用框架:在不同临床专科中可重复评估劫持和隐私漏洞

Jinghao Wang, Ping Zhang, Carter Yagemann

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种可重复评估医疗AI安全性的框架,针对不同临床专科的劫持和隐私漏洞进行评估,无需特殊资源或数据权限。

Comments 6 pages, 1 figure, framework proposal

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23856 2025-12-10 cs.AI 57%

From Benchmarks to Business Impact: Deploying IBM Generalist Agent in Enterprise Production

从基准到业务影响:在企业生产中部署IBM通用代理

Segev Shlomov, Alon Oved, Sami Marreed, Ido Levy, Offer Akrabi, Avi Yaeli, Łukasz Strąk, Elizabeth Koumpan, Yinon Goldshtein, Eilam Shapira, Nir Mashkif, Asaf Adi

机构 * IBM

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 IBM开发并试点了CUGA,展示了通用代理在企业生产环境中的应用,通过分层规划-执行架构实现先进性能,并在人才招聘领域验证其可扩展性和安全性。

Comments AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02239 2025-12-10 cs.CV cs.AI 57%

MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens

MiniGPT-5:通过生成性vokens实现交错的视觉-语言生成

Kaizhi Zheng, Xuehai He, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MiniGPT-5通过生成性vokens实现交错的视觉-语言生成,显著提升多模态生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07983 2025-12-10 cs.SE cs.AI 57%

An Empirical Framework for Evaluating Semantic Preservation Using Hugging Face

基于Hugging Face的语义保持评估经验框架

Nan Jia, Anita Raja, Raffi Khatchadourian

机构 * CUNY, the Graduate Center(纽约大学研究生中心) CUNY, Hunter College(纽约大学亨特学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出基于Hugging Face的语义保持评估经验框架,通过分析模型演化数据,揭示语义漂移检测方法及重构模式,为构建更可信的ML系统提供基础。

Comments Accepted to Hawaii International Conference on System Sciences (HICSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07898 2025-12-10 cs.MA cs.AI 57%

MARINE: Theoretical Optimization and Design for Multi-Agent Recursive IN-context Enhancement

MARINE:多智能体递归上下文增强的理论优化与设计

Hongwei Zhang, Ji Lu, Yongsheng Du, Yanqin Gao, Lingjun Huang, Baoli Wang, Fang Tan, Peng Zou

机构 * Hongwei Zhang(张宏伟) Ji Lu(卢纪) Yongsheng Du(杜永生) Yanqin Gao(高燕琴) Lingjun Huang(黄令军) Baoli Wang(王宝利) Fang Tan(谭芳) Peng Zou(邹鹏)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MARINE通过理论优化和设计实现多智能体递归上下文增强,显著提升推理性能并减少参数需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07874 2025-12-10 cs.LG 57%

Controllable risk scenario generation from human crash data for autonomous vehicle testing

从人类碰撞数据生成可控的风险场景用于自动驾驶测试

Qiujing Lu, Xuanhan Wang, Runze Yuan, Wei Lu, Xinyi Gong, Shuo Feng

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Beijing DiDi Infinity Technology and Development Co., Ltd.(北京滴滴无限科技发展有限公司) Space Information Research Institute and Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(空间信息研究所和浙江空间信息感知与传输重点实验室,杭州电子科技大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 CRAG通过生成可控的风险场景,提升自动驾驶车辆在罕见安全关键条件下的鲁棒性评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07845 2025-12-10 cs.SD cs.AI eess.AS 57%

AudioScene: Integrating Object-Event Audio into 3D Scenes

AudioScene: 将对象事件音频整合到3D场景中

Shuaihang Yuan, Congcong Wen, Muhammad Shafique, Anthony Tzes, Yi Fang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出AudioScene数据集,通过整合音频事件与3D场景,探索音频条件任务,提升空间学习的准确性与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08860 2025-12-10 cs.CV 50%

Tri-Bench: Stress-Testing VLM Reliability on Spatial Reasoning under Camera Tilt and Object Interference

Tri-Bench:在相机倾斜和物体干扰下测试VLM在空间推理中的可靠性

Amit Bendkhale

机构 * Amit Bendkhale(独立研究者)

专题命中 安全评测 :trustworthy(abstract)

AI总结 Tri-Bench通过测试VLM在相机倾斜和物体干扰下的空间推理可靠性,揭示了模型在几何推理中的不足。

Comments 6 pages, 3 figures. Code and data: https://github.com/Amiton7/Tri-Bench. Accepted to the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08645 2025-12-10 cs.CV 50%

Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation

图像生成链:迈向可监控和可控的图像生成

Young Kyung Kim, Oded Schlesinger, Yuzhou Zhao, J. Matias Di Martino, Guillermo Sapiro

机构 * Duke University(杜克大学) Princeton University(普林斯顿大学) Universidad Católica del Uruguay(乌拉圭天主教大学) Apple(苹果公司)

专题命中 安全评测 :safety(abstract)

AI总结 CoIG框架通过将图像生成过程分解为可监控的步骤,提升图像生成的可控性和可解释性。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11110 2025-12-10 cs.CV 50%

Beyond accuracy: quantifying the reliability of Multiple Instance Learning for Whole Slide Image classification

超越准确性:量化多实例学习在全滑片图像分类中的可靠性

Hassan Keshvarikhojasteh, Marc Aubreville, Christof A. Bertram, Josien P. W. Pluim, Mitko Veta

机构 * Department of Biomedical Engineering, Eindhoven University of Technology(埃因霍温理工大学生物医学工程系) Flensburg Artificial Intelligence Research Group (FLAIR), Flensburg University of Applied Sciences(弗劳恩霍夫应用科技大学人工智能研究组) University of Veterinary Medicine Vienna(维也纳兽医大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出三种量化指标评估多实例学习在全滑片图像分类中的可靠性,发现MEAN-POOL-INS模型在可靠性上表现优异,为未来研究提供可靠基准。

Journal ref PloS one. 2025 Dec 5;20(12):e0337261

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03080 2025-12-10 q-bio.TO 50%

Explainable AI for computational pathology identifies model limitations and tissue biomarkers

可解释AI用于计算病理学识别模型限制和组织生物标志物

Jakub R. Kaczmarzyk, Chanwoo Kim, Soham Gadgil, Deepika Savant, Zhen Zhao, Joel H. Saltz, Su-In Lee, Peter K. Koo

专题命中 安全评测 :trustworthy(abstract)

AI总结 HIPPO通过可解释AI方法识别模型限制和组织生物标志物,提升数字病理学中模型的可解释性和临床应用价值。

Comments The following authors contributed equally: Jakub R. Kaczmarzyk, Chanwoo Kim, Soham Gadgil

详情

展开后加载摘要…

URL PDF HTML 收藏