arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-28 至 2026-08-28 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2608.26696 2026-08-28 cs.AI cs.CR cs.SE 新提交 57%

Five Primitives for Governing Autonomous AI Agents at Runtime

运行时管控自主AI智能体的五大原语

Jiten Oswal, John Cadeddu

机构 * Aurite AI(奥莱特人工智能公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 针对企业自主AI智能体管控的适配问题,提出发现、身份等五大运行时管控原语,描述其实现方案、成本及部分原语的开发状态。

Comments 14 pages, 2 figures, 1 table. Describes an implemented system in private pilot deployment; four of five primitives implemented

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26182 2026-08-28 cs.AI cs.HC cs.RO 新提交 57%

Why did My Robot Just Change Personality? Prompting Guidelines for a Grounded Robot Persona in LLM-Based HRI

我的机器人为什么刚改变了人格?面向基于大语言模型(LLM)的人机交互(HRI)的具身机器人人格提示设计指南

Ashita Ashok, Franziska Babel, Patrick Holthaus, Rucha Khot, Karla Bransky, Fethiye Irmak Dogan, Karsten Berns, Silvia Rossi, Minha Lee, Guy Laban

机构 * RPTU Kaiserslautern(凯泽斯劳滕工业大学) Linköping University(林雪平大学) University of Hertfordshire(赫特福德大学) Eindhoven University of Technology(埃因霍温理工大学) Australian National University(澳大利亚国立大学) University of Cambridge(剑桥大学) University of Naples Federico II(那不勒斯费德里科二世大学) Ben-Gurion University of the Negev(本-古里安大学内盖夫分校) The Azrieli National Center for Autism and Neurodevelopment Research(阿兹列利国家自闭症与神经发育研究中心)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文针对基于LLM的HRI中机器人人格模糊等问题,提出含八个组件的提示设计框架及指南,为HRI研究提供结构化设计与报告辅助,强调提示设计需作为社会技术问题处理。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26157 2026-08-28 cs.AI 新提交 57%

GROUND: Reducing Hallucinations in LLM-Based Enterprise Analytics Through Governed Semantic Definitions

GROUND:通过受监管的语义定义减少基于大语言模型的企业分析中的幻觉现象

Aravind Sasidharan Pillai

机构 * Cox Automotive Inc(考克斯汽车公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 该研究提出GROUND框架,通过受监管语义层约束大语言模型生成的企业分析内容,在多模型多数据集测试中消除了所有评估类别的幻觉,保障了数据安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05281 2026-08-28 cs.HC 版本更新 50%

Algorithmic Fairness Perceptions in the Global South: Evidence from Bangladesh on Ride-Sharing, Beauty Filters, and Large

全球南方的算法公平感知:来自孟加拉国关于网约车、美颜滤镜和大型语言模型的证据

Ahmed Abdal Shafi Rasel, Ahmed Mustafa Amlan, Tasmim Shajahan Mim

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 该研究通过对孟加拉国199名民众的双语调查,揭示了情境影响算法公平感知、对算法保护需求普遍、美颜滤镜损害自我形象、识别与阐明LLM文化偏见存在差异等四个关键模式,指出仅结果导向的公平指标存在局限。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏