arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-25 至 2025-12-25 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 10 篇

2512.20755 2025-12-25 cs.LG cs.AI 81%

Bridging Efficiency and Safety: Formal Verification of Neural Networks with Early Exits

弥合效率与安全:具有早期退出的神经网络形式验证

Yizhak Yisrael Elboher, Avraham Raviv, Amihay Elboher, Zhouxing Shi, Omri Azencot, Hillel Kugler, Guy Katz

机构 * The Hebrew University of Jerusalem, Israel(特拉维夫大学) Bar Ilan University, Israel(巴伊兰大学) Ben-Gurion University of the Negev, Israel(贝纳亚克大学) University of California, Riverside, USA(加州大学河滨分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种针对具有早期退出机制的神经网络进行形式验证的方法,通过定制鲁棒性属性和优化策略,在保证正确性的同时提升验证效率和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20688 2025-12-25 cs.GT cs.AI cs.LG cs.MA 81%

Mechanism-Based Intelligence (MBI): Differentiable Incentives for Rational Coordination and Guaranteed Alignment in Multi-Agent Systems

基于机制的智能(MBI):用于多智能体系统中理性协调和保证对齐的可微激励

Stefano Grassi

专题命中 安全评测 :alignment(title);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 基于机制的智能(MBI)通过可微价格机制实现多智能体系统的理性协调和保证对齐,提供高效、可审计且可扩展的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21127 2025-12-25 cs.AI 79%

A Real-World Evaluation of LLM Medication Safety Reviews in NHS Primary Care

对NHS初级医疗中基于LLM的药物安全审查系统的真实世界评估

Oliver Normand, Esther Borsi, Mitch Fruin, Lauren E Walker, Jamie Heagerty, Chris C. Holmes, Anthony J Avery, Iain E Buchan, Harry Coppock

机构 * i.AI, Department for Science, Innovation, and Technology(i.AI,科学、创新与技术部门) Centre for Experimental Therapeutics, University of Liverpool(实验治疗中心,利物浦大学) Civic Health Innovation Labs, University of Liverpool(公民健康创新实验室,利物浦大学) Downing Street(唐宁街10号) Department of Statistics, University of Oxford(统计系,牛津大学) Ellison Institute of Technology(埃利森技术研究所) Centre for Academic Primary Care, University of Nottingham(学术初级护理中心,诺丁汉大学) The UK AI Security Institute(英国人工智能安全研究所) Department of Computing, Imperial College London(计算系,伦敦帝国学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文评估了基于LLM的药物安全审查系统在真实临床数据中的表现,揭示了其在不同复杂性下的失败模式,强调了上下文推理的重要性及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09016 2025-12-25 cs.SD cs.AI eess.AS 79%

DiTSinger: Scaling Singing Voice Synthesis with Diffusion Transformer and Implicit Alignment

DiTSinger: 通过扩散变换器和隐式对齐扩展歌唱语音合成

Zongcai Du, Guilin Deng, Xiaofeng Guo, Xin Gao, Linke Li, Kaichang Cheng, Fubo Han, Siyu Yang, Peng Liu, Pan Zhong, Qiang Fu

机构 * Migu Music, China Mobile Communications Corporation, China(咪咕音乐,中国移动通信集团,中国)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 DiTSinger通过扩散变换器和隐式对齐机制实现高效且高保真的歌唱语音合成,解决了数据稀缺和模型扩展性问题。

Comments ICASSP26 under review. Demo page: https://nju-jet.github.io/DiTSinger

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20634 2025-12-25 cs.LG cs.AI cs.CL 67%

Real Time Detection and Quantitative Analysis of Spurious Forgetting in Continual Learning

持续学习中虚假遗忘的实时检测与定量分析

Weiwei Wang

机构 * Shenzhen Sunline Tech Co., Ltd.(深圳Sunline科技有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出浅层与深层对齐框架,通过定量指标和实时检测方法解决持续学习中的虚假遗忘问题,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11783 2025-12-25 eess.SP cs.AI cs.LG q-bio.NC 62%

EEG Foundation Models: A Critical Review of Current Progress and Future Directions

EEG基础模型:对当前进展和未来方向的批判性回顾

Gayal Kuruppu, Neeraj Wagh, Vaclav Kremen, Sandipan Pati, Gregory Worrell, Yogatheesan Varatharajah

机构 * Department of Computer Science & Engineering, University of Minnesota Twin Cities(计算机科学与工程系,明尼苏达大学双城分校) Department of Bioengineering, University of Illinois at Urbana-Champaign(生物工程系,伊利诺伊大学厄巴纳-香槟分校) Department of Neurology, Mayo Clinic(神经病学系,梅奥诊所) Department of Neurology, University of Minnesota Twin Cities(神经病学系,明尼苏达大学双城分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文回顾了EEG基础模型的当前进展,分析了其在自监督建模中的方法和评估策略,指出未来需加强可扩展性和可信度以提升实际应用价值。

Comments 22 pages (main), 5 figures (main), 4 tables (main + supplement)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17019 2025-12-25 cs.CV cs.AI cs.CY 62%

Let Androids Dream of Electric Sheep: A Human-Inspired Image Implication Understanding and Reasoning Framework

让安卓梦见电羊:一种受人类启发的图像隐喻理解和推理框架

Chenhao Zhang, Yazhe Niu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究提出LAD框架,通过三阶段方法解决图像隐喻理解问题,在多个基准测试中取得优异成绩,推动视觉语言推理和人机交互发展。

Comments 19 pages, 9 figures, 7 tables. Code & Dataset: https://github.com/MING-ZCH/Let-Androids-Dream-of-Electric-Sheep

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21021 2025-12-25 cs.IR cs.LG 57%

Towards Better Search with Domain-Aware Text Embeddings for C2C Marketplaces

面向C2C市场向更好搜索的领域感知文本嵌入

Andre Rusli, Miao Cao, Shoma Ishimoto, Sho Akiyama, Max Frenzel

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出领域感知的文本嵌入方法,通过优化C2C市场places的搜索质量,提升相关性和效率,为更丰富的LLM时代搜索体验奠定基础。

Comments 5 pages, AAAI 2026 Workshop on New Frontiers in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20671 2025-12-25 cs.AI 57%

Bridging the AI Trustworthiness Gap between Functions and Norms

弥合功能与规范之间的人工智能可信度差距

Daan Di Scala, Sophie Lathouwers, Michael van Bekkum

机构 * TNO Netherlands Organisation for Applied Scientific Research, Data Science Department(荷兰应用科学研究院数据科学部门) Utrecht University, Department of Information(乌得勒支大学信息与计算科学系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过引入语义语言弥合功能可信人工智能与规范可信人工智能之间的差距,以提升人工智能系统的可信度评估。

Comments Published as Position Paper during the TRUST-AI workshop at the ECAI2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02622 2025-12-25 cs.CV 50%

RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence

RULER-Bench: 探索下一代视频生成模型的基于规则的推理能力以实现视觉基础智能

Xuming He, Zehao Fan, Hengjia Li, Fan Zhuo, Hankun Xu, Senlin Cheng, Di Weng, Haifeng Liu, Can Ye, Boxi Wu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 安全评测 :alignment(abstract)

AI总结 RULER-Bench通过评估视频生成模型的基于规则的推理能力,揭示了其在时间一致性等指标上的不足,为提升视频生成模型的推理能力提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏