arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-10 至 2025-12-10 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 6 篇

2506.06301 2025-12-10 cs.AI 79%

Large Language Models and Their Applications in Roadway Safety and Mobility Enhancement: A Comprehensive Review

大语言模型及其在道路安全与出行提升中的应用:全面综述

Muhammad Monjurul Karim, Yan Shi, Shucheng Zhang, Bingzhang Wang, Mehrdad Nasri, Yinhai Wang

机构 * Department of Civil and Environmental Engineering, University of Washington(土木与环境工程系,华盛顿大学)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 本文综述了大语言模型在道路安全与出行提升中的应用,探讨其在交通领域的适应策略及面临的挑战。

Journal ref Artificial Intelligence for Transportation, 1, 100004, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08449 2025-12-10 cs.AI 77%

From Accuracy to Impact: The Impact-Driven AI Framework (IDAIF) for Aligning Engineering Architecture with Theory of Change

从准确度到影响:用于对齐工程架构与影响理论的影响力驱动AI框架(IDAIF)

Yong-Woon Kim

专题命中 AI治理与伦理 :alignment(abstract);RLHF(abstract);trustworthy(abstract);分类 cs.AI

AI总结 IDAIF通过整合影响理论与AI架构,提供了一种以影响为中心的AI开发框架,旨在提升AI系统的伦理性和社会价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08592 2025-12-10 cs.AI cs.CY cs.HC cs.SY eess.SY 62%

The SMART+ Framework for AI Systems

为AI系统设计的SMART+框架

Laxmiraju Kandikatla, Branislav Radeljic

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 SMART+框架为AI系统提供了一种结构化模型,涵盖安全、监控、责任、可靠性和透明性,并增强隐私与安全、数据治理和公平性,以提升AI系统的治理和合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06616 2025-12-10 cs.HC cs.AI 57%

Memory Power Asymmetry in Human-AI Relationships: Preserving Mutual Forgetting in the Digital Age

人机关系中的记忆权力不对称:在数字时代保持相互遗忘

Rasam Dorri, Rami Zwick

机构 * School of Business, University of California, Riverside(加州大学河滨分校商学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出记忆权力不对称概念,探讨人机关系中因记忆能力差异导致的权力失衡,并提出六个恢复健康记忆平衡的设计原则。

Comments 31 pages, 2 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07909 2025-12-10 cs.CR cs.CY 57%

Agentic Artificial Intelligence for Ethical Cybersecurity in Uganda: A Reinforcement Learning Framework for Threat Detection in Resource-Constrained Environments

代理人工智能用于乌干达的伦理网络安全:一种强化学习框架用于资源受限环境中的威胁检测

Ibrahim Adabara, Bashir Olaniyi Sadiq, Aliyu Nuhu Shuaibu, Yale Ibrahim Danjuma, Venkateswarlu Maninti, Mutebi Joe

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

AI总结 本研究提出一种结合强化学习和伦理治理的代理人工智能框架,用于资源受限环境中的网络安全威胁检测,实现了100%的检测率和零假阳性,提升网络安全效果和公平性。

Comments 29 pages, 7 figures, 2 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08374 2025-12-10 cs.CV 50%

The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss

看不见的偏见:预规范MLLM中规范差异如何导致视觉信息丢失

Bozhou Li, Xinda Xue, Sihan Yang, Yang Shi, Xinlong Chen, Yushuo Guan, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xi’an Jiaotong University(西安交通大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文揭示了预规范MLLM中规范差异导致的视觉信息丢失问题,并提出通过插入层规范层来解决这一问题,提升模型整体能力。

详情

展开后加载摘要…

URL PDF HTML 收藏