arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-25 至 2026-08-25 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 8 篇

2608.02660 2026-08-25 cs.CY cs.AI cs.HC 版本更新 81%

AI Alignment and Fiduciary Obligation

AI对齐与受托义务

Benjamin Lange

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本文提出将受托理论应用于长期AI助手部署,以开发者对用户负有的忠诚、注意、善意和坦诚四项受托义务为基础构建AI对齐标准,为AI对齐研究提供新视角。

Comments 10 pages, 1 table. Accepted at the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17681 2026-08-25 cs.CV 版本更新 78%

Motion-Aware Vision-Reference Alignment for Referring Multi-Object Tracking

基于多模态大语言模型的视觉-运动-参考对齐的指称多目标跟踪

Weiyi Lv, Ning Zhang, Hanyang Sun, Haoran Jiang, Kai Zhao, Yixiao Gu, Jing Xiao, Dan Zeng

机构 * Shanghai University(上海大学) PAII Inc.(PAII公司)

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 VMRMOT通过多模态大语言模型实现视觉-运动-参考对齐,提升指称多目标跟踪的性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23264 2026-08-25 cs.AI cs.CL 新提交 73%

Hidden in the Request: Explaining Unethical LLM Compliance through Token Relevance

隐藏在请求中:通过词元相关性解释不道德的大语言模型合规性

Or Biton, Tomer Krichli, Itai Allouche, Joseph Keshet

机构 * Faculty of Electrical and Computer Engineering, Technion(以色列理工学院电气与计算机工程学院)

专题命中 AI治理与伦理 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLMs在不道德场景下的合规性失败问题,提出LRP引导的解码方法,发现模型对提示词元的归因不足是关键原因,干预后可提升响应安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04931 2026-08-25 cs.AI cs.CL cs.HC 版本更新 73%

A Survey on Human-AI Collaboration with Large Foundation Models

大型基础模型下的人机协作研究综述

Vanshika Vats, Marzia Binta Nizam, Minghao Liu, Ziyuan Wang, Richard Ho, Mohnish Sai Prasad, Vincent Titterton, Sai Venkat Malreddy, Riya Aggarwal, Yanwen Xu, Lei Ding, Jay Mehta, Nathan Grinnell, Li Liu, Sijia Zhong, Devanathan Nallur Gandamani, Xinyi Tang, Rohan Ghosalkar, Celeste Shen, Rachel Shen, Nafisa Hussain, Kesav Ravichandran, James Davis

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 该综述围绕人类引导模型开发等四方面,分析大型基础模型(LFMs)与人机协作(HAI)的机遇、风险与挑战,指出成功的HAI系统需以人为本设计,助力将LFMs力量转化为可靠的人机伙伴关系。

Comments Accepted in ACM Transactions on Intelligent Systems and Technology (ACM-TIST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21577 2026-08-25 cs.LG cs.AI 新提交 62%

Anchoring Bias: A Persistent Fairness Backdoor Attack against MLLMs under Continual Learning

锚定偏差:一种针对持续学习下多模态大语言模型(MLLMs)的持久公平性后门攻击

Yuyang Luo, Kai Shu

机构 * Emory University(埃默里大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对持续学习下的多模态大语言模型,研究人员提出持久公平性后门攻击,通过两种机制注入持久群体歧视,该攻击能规避标准防御且在多轮持续学习中留存。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10169 2026-08-25 cs.AI cs.LG 版本更新 62%

MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction

MAVEN-T:用于实时多智能体轨迹预测的强化异构蒸馏

Wenchang Duan, Zhenguo Gao, Jinguo Xian, Yi Shi

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Bio-X Institutes, Key Laboratory for the Genetics of Developmental and Neuropsychiatric Disorders, Shanghai Jiao Tong University(上海交通大学Bio-X研究院、发育与神经精神疾病遗传学重点实验室) Shanghai Key Laboratory of Psychotic Disorders, Brain Science and Technology Research Center, Shanghai Jiao Tong University(上海精神疾病重点实验室、脑科学与技术研究中心,上海交通大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出MAVEN-T框架,通过高容量教师模型和紧凑学生模型的异构蒸馏,结合强化学习优化,实现实时多智能体轨迹预测,在多个数据集上达到高精度与低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21363 2026-08-25 cs.AI cs.CR 新提交 57%

AIREP: A Protocol for Per-Decision Evidence in AI Runtime Governance

AIREP:AI运行时治理中逐决策证据的协议

Ali Toygar Abak

机构 * Phionyx Research(菲奥尼克斯研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 AIREP是一种用于记录自动化AI运行时治理决策的协议,以签名对象形式存储决策,通过SHA-256哈希链防篡改,可供相关AI运行时采用。

Comments 8 pages. Reference implementation and two-verifier conformance kit: this https URL (https://github.com/halvrenofviryel/ai-runtime-evidence-protocol)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14486 2026-08-25 cs.CV 版本更新 50%

Reduce the Artifacts Bias for More Generalizable AI-Generated Image Detection

降低艺术偏差以提高通用性的人工智能生成图像检测

Yiheng Li, Yang Yang, Wenhao Wang, Zichang Tan, Zecheng Lin, Li Gao, Zhen Lei

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) Sangfor Technologies Inc.(Sangfor技术公司) China Mobile Financial Technology Co., Ltd.(中国移动金融科技有限公司) CAIR, HKSIS, Chinese Academy of Sciences(中国科学院CAIR、HKSIS部门) SCSE, FIE, M.U.S.T, Macau, China(澳门SCSE、FIE、M.U.S.T部门) Vast Intelligence Lab, Sydney, Australia(悉尼澳大利亚Vast Intelligence Lab)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出SEF框架,通过分离专家融合减少领域干扰,提升AI生成图像检测的通用性与鲁棒性,实验表明在13个基准上表现优异。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏