Trustworthy Machine Learning under Distribution Shifts
在分布偏移下可信的机器学习
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG
AI总结 研究旨在通过提升鲁棒性、可解释性和适应性,在分布偏移下增强机器学习系统的可靠性与责任性。
Comments PhD Thesis
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
在分布偏移下可信的机器学习
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG
AI总结 研究旨在通过提升鲁棒性、可解释性和适应性,在分布偏移下增强机器学习系统的可靠性与责任性。
Comments PhD Thesis
一种整合安全检查的新型机器学习框架用于职业事故预测
机构 * Laboratoire de Mathématique Blaise Pascal UMR 6620 CNRS, Université Clermont Auvergne(布列塔尼数学实验室(皮萨实验室))
专题命中 安全评测 :safety(title,abstract);分类 cs.LG
AI总结 本文提出一种整合安全检查的新型机器学习框架,用于预测职业事故,通过将安全检查数据转化为二元时间序列,实现短期风险信号的生成与评估。
量化真实鲁棒性:基于同义词加权的相似性用于可信XAI评估
机构 * The University of Mississippi(密苏里大学)
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于同义词加权的相似性方法,用于更准确评估XAI系统的鲁棒性,防止攻击成功率的高估。
Comments 10 pages, 2 figures, 6 tables. Changes to title, abstract and minor edits to the content as a result of acceptance to the 59th Hawaii International Conference on System Sciences
DarkPatterns-LLM: 一种多层基准用于检测操纵性和有害的AI行为
机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) ; National University of Sciences and Technology(国立科学与技术大学) ; School of Electrical Engineering & Computer Science(电子与计算机科学学院)
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 DarkPatterns-LLM提出了一种多层基准用于检测LLM中的操纵性行为,通过细粒度分析和专家标注,评估七个危害类别下的内容,揭示模型在自主性检测方面的不足。
预审至同行评审:使用大型语言模型自动化评审的陷阱
机构 * AllSci Corp(AllSci公司) ; Sunwater Capital(Sunwater资本) ; Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) ; Dept. of Computer Science, Northern Illinois University(北伊利诺伊大学计算机科学系) ; Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
AI总结 本文研究了使用大型语言模型进行学术评审的潜力与风险,发现其作为预审筛选工具具有一定效用,但存在与人类评审不一致的风险及系统性高估偏差。
可解释的神经逆向运动学用于障碍物感知的机器人操作:对IKNet变体的比较分析
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 本研究提出了一种可解释性工作流程,通过Shapley值归因和物理障碍规避评估,改进IKNet变体以提升机器人操作的透明性和安全性。
Comments 27 pages, 16 figures
基于样本加权的公平类增量学习
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于样本加权的公平类增量学习框架,通过调整训练权重减少敏感群体的遗忘,提升模型公平性。
Comments 30 pages, 30 figures
Valori:一种用于人工智能系统的确定性内存基质
机构 * Valori Kernel Project(Valori内核项目)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 Valori通过使用固定点算术和可重放状态机,为人工智能系统提供确定性内存解决方案,解决浮点运算导致的非确定性问题。
Comments 7 pages, 1 figure. systems paper with empirical evaluation and determinism validation experiments. Code available at https://github.com/varshith-Git/Valori-Kernel
逻辑草图提示(LSP):一种确定性和可解释的提示方法
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 逻辑草图提示(LSP)通过引入类型变量、确定性条件评估器和规则验证器,提升了大语言模型在需要严格规则遵守、确定性和可审计性任务中的性能和可解释性。
基于大语言模型的无线交通预测
机构 * Shandong Key Laboratory of Intelligent Communication and Sensing-Computing Integration, Shandong University(山东大学智能通信与感知-计算整合重点实验室) ; School of Information Science and Engineering, Shandong Normal University(山东师范大学信息科学与工程学院) ; China Mobile Communications Group Shandong Co., Ltd(中国移动通信集团山东有限公司) ; Computer, Electrical and Mathematical Science and Engineering Division, King Abdullah University of Science and Technology (KAUST)(卡布斯大学科学与工程学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出TIDES框架,利用大语言模型和DeepSeek模块,通过空间对齐和个性化模型提升无线交通预测的精度和鲁棒性。
评估多智能体系统模拟在自动驾驶测试中的行为覆盖率
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 本研究提出了一种基于模型预测控制的行人智能体,用于评估多智能体系统模拟在自动驾驶测试中的行为覆盖率,以提升系统安全性和可靠性。
TCEval:利用热舒适性评估人工智能的认知与感知能力
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 TCEval通过热舒适性场景评估AI的跨模态推理、因果关联和适应性决策能力,揭示当前LLM在热舒适性领域存在基础推理能力但缺乏精确因果理解。
Gamayun的多语言 mastery 之路:一种 1.5B 参数 LLM 的高效训练
机构 * Gamayun Team(Gamayun团队)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 Gamayun 通过两阶段预训练策略,在资源受限环境下高效训练出 1.5B 参数多语言模型,支持 12 种语言,尤其在俄语上取得先进成果。
大语言模型的文化基因:跨语料库训练对模型价值观与偏见的影响研究
机构 * Department of Communications(通讯系) ; University of Malta(马耳他大学) ; Faculty of Mathematics(数学系) ; University of Primorska(普里摩尔卡大学) ; Faculty of Electrical Engineering(电气工程系) ; University of Montenegro(黑山大学) ; Faculty of Science & Technology(科学与技术系) ; University of the Faroe Islands(法罗群岛大学) ; Department of Computer Science(计算机科学系) ; San Francisco State University(旧金山州立大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本研究通过跨文化探针数据集分析大语言模型在个人主义-集体主义和权力距离维度上的文化偏见,揭示模型价值观与训练语料文化背景的关联。
Comments 10 pages, 5 figures, IEEE conference format, submitted to [Conference Name]
基于提示引导的潜在扩散模型的图像和视频质量评估用于跨数据集泛化
机构 * Samsung Research Institute(三星研究机构) ; Qualcomm(高通) ; New York University(纽约大学) ; Indian Institute of Science(印度科学研究院)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出基于提示引导的潜在扩散模型,通过学习跨注意力图和时间质量调节器,实现图像和视频质量评估的跨数据集泛化。
Comments Accepted to Transactions on Machine Learning Research
DICE:基于概率评分的离散可解释比较评估用于检索增强生成
机构 * School of Computer Science and Technology(计算机科学与技术学院) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 DICE提出一种基于概率评分的两阶段框架,提升RAG评估的可解释性和稳健性,通过透明判断和系统性错误诊断,实现高效且可信的评估。
Comments Accepted at ResponsibleFM @ NeurIPS 2025
LLM-as-a-Judge: 快速评估法律文档推荐用于检索增强生成
机构 * Bloomberg(彭博)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出LLM-as-a-Judge方法,通过改进评估指标和统计检验,实现法律文档推荐系统的自动化评估,提高评估效率和准确性。
Comments Accepted in EARL 25: The 2nd Workshop on Evaluating and Applying Recommender Systems with Large Language Models at RecSys 2025
Journal ref Proceedings of the 2nd Workshop on Evaluating and Applying Recommender Systems with Large Language Models (EARL), RecSys 2025
可解释的胆囊超声诊断:一种轻量级的网页-移动软件平台与实时XAI
机构 * University of Liberal Arts Bangladesh(乌拉尔大学 Bangladesh) ; BRAC University(BRAC大学)
专题命中 安全评测 :trustworthy(abstract)
AI总结 本研究提出了一种轻量级网页-移动软件平台,利用混合深度学习模型MobResTaNet实现胆囊疾病的实时可解释诊断,准确率达99.85%。