Astra: AI Safety, Trust, & Risk Assessment
Astra:人工智能安全、信任与风险评估
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 Astra提出一个基于实证的人工智能安全风险数据库,通过三元因果分类法评估风险,聚焦印度社会技术景观中的特定挑战,为动态监管框架提供基础。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
Astra:人工智能安全、信任与风险评估
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 Astra提出一个基于实证的人工智能安全风险数据库,通过三元因果分类法评估风险,聚焦印度社会技术景观中的特定挑战,为动态监管框架提供基础。
IndicJR:一种无裁判的南亚语言对抗鲁棒性基准
机构 * Oracle America Inc.(Oracle美国公司)
专题命中 安全评测 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 IndicJR是一种无裁判的南亚语言对抗鲁棒性基准,揭示了多语言对抗攻击的模式和风险,尤其关注南亚用户的语言转换和罗马化问题。
Comments Accepted in EACL Industry Track Oral, 2026
注意GAP:在LLM代理中,文本安全不转移到工具调用安全
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI
AI总结 该研究发现LLM代理中文本安全不等同于工具调用安全,引入GAP基准测试揭示两者差异,强调需专门评估工具调用安全。
Comments 23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark
一种具有特征稳定性和可解释性的机器学习框架,用于在不完整临床数据下实现可信的决策
机构 * Computational Intelligence, Sano Centre for Computational Personalised Medicine(计算智能,Sano计算个性化医学中心) ; Clinical Studies Group, Randox Laboratories Ltd., Co.(临床研究组,Randox实验室有限公司)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG
AI总结 CACTUS是一种针对不完整临床数据设计的可解释机器学习框架,通过提升特征稳定性与可解释性,增强模型在缺失数据下的可信决策能力。
迈向可信的可持续性评级方法论评估:一种人机协作框架用于基准数据集构建
机构 * Columbia University, USA(哥伦比亚大学) ; Case Western Reserve University, USA(凯斯西储大学) ; Hong Kong University of Science(香港科学大学) ; NVIDIA, USA(NVIDIA公司) ; Informatica Inc., USA(Informatica公司)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
AI总结 本文提出一种人机协作框架,用于构建可信的可持续性评级方法论基准数据集,以提高评分的可比性和可信度。
黑盒安全评估的根本限制:从潜在上下文条件化的信息论和计算障碍
机构 * Whiting School of Engineering(韦斯利工程学院) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本文研究了黑盒安全评估的根本限制,揭示了潜在上下文条件化策略在部署风险估计中的信息论和计算障碍,提出了被动和自适应评估的下界以及计算分离的结论。
FRAPPE:通过多未来表示对齐将世界建模注入通用策略
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; South China University of Technology(华南理工大学) ; ShanghaiTech University(上海科技大学) ; Tsinghua University(清华大学)
专题命中 安全评测 :alignment(title,abstract)
AI总结 FRAPPE通过多未来表示对齐提升通用机器人策略的世界建模能力,提高微调效率并减少数据依赖,实验证明其在长时序和未见场景中的泛化性能优于现有方法。
Comments Project Website: https://h-zhao1997.github.io/frappe
NESSiE: 必要安全基准 -- 识别不应存在的错误
专题命中 安全评测 :safety(title,abstract)
AI总结 NESSiE提出了一种轻量级安全基准,用于检测大型语言模型中不应存在的安全故障,揭示模型在帮助与安全之间的偏差。
Comments 13 pages, 6 figures
QSTN: 一种用于大型语言模型鲁棒问卷推断的模块化框架
机构 * University of Mannheim(曼海姆大学) ; GESIS - Leibniz Institute for the Social Sciences(莱比锡社会科学研究所) ; CSH Vienna(维也纳CSH)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 QSTN是一种模块化框架,通过无需编码的界面实现大型语言模型在问卷推断中的稳健评估与高效响应生成。
Comments Accepted at 2026 EACL System Demonstrations The Python package is available at https://github.com/dess-mannheim/QSTN/
BEADs: 跨领域偏差评估
机构 * Vector Institute(向量研究所) ; Royal Bank of Canada(皇家银行) ; University of Toronto(多伦多大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 BEADs数据集通过跨领域偏差评估,提供广泛NLP任务的偏差检测与模型评估方案,揭示现有模型在人口群体上的系统性偏差问题。
Comments under review
量化大语言模型注意力头的稳定性:对电路通用性的启示
机构 * Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) ; McGill University(麦吉尔大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本研究量化了大语言模型注意力头的稳定性,发现中层头最不稳定但表示最独特,深层模型中层分歧更明显,权重衰减优化提升稳定性,残差流较稳定,为AI系统白盒监控提供新视角。
Comments Main Body: 8 pages, Total length: 33 pages, Code repo: https://github.com/karanbali/attention_head_seed_stability , Weights repo: https://huggingface.co/karanbali/attention_head_seed_stability
可扩展的健康语言模型评估框架
机构 * Google Research(谷歌研究)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出自适应精确布尔评估框架,用于高效评估健康领域语言模型,提升评估效率和一致性。
多模态大语言模型如何支持视障人士获取视觉信息:一项与盲人和低视力人士的日记研究
机构 * Cornell University(康奈尔大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本研究探讨了多模态大语言模型如何通过视觉助手技能支持视障人士获取视觉信息,并发现其在实际应用中的表现及改进方向。
Comments 24 pages, 17 figures, 7 tables, appendix section, to appear main track CHI 2026
说服的机器人:探讨对话代理的语言性人格表达如何影响用户感知和决策
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 研究探讨了对话代理通过语言表达的人格如何影响用户在慈善捐赠中的感知和决策,发现人格特征显著影响用户信任和捐赠行为。
Comments Accepted to be presented at CHI'26 in Barcelona
ConvApparel:一种用于对话推荐系统中用户模拟器的基准数据集和验证框架
机构 * Google(谷歌)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 ConvApparel通过双代理数据收集和反事实验证框架,评估对话推荐系统中用户模拟器的现实差距和泛化能力。
Comments EACL 2026
爱沙尼亚原生大语言模型基准
机构 * Department of Software Science, Tallinn University of Technology, Estonia(软件科学系,塔林技术大学,爱沙尼亚)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出爱沙尼亚语言的大语言模型基准,通过七个多样化的数据集评估不同模型的性能,结合人类和LLM评判方法,验证了高性能模型在爱沙尼亚语言评估中的有效性。
Comments Accepted to LREC 2026
PersonaMail: 通过结构化沟通因素探索、细粒度编辑控制和适应性重用策略学习和适应个人通信偏好以实现情境感知的电子邮件写作
专题命中 安全评测 :alignment(abstract)
AI总结 PersonaMail通过结构化探索、细粒度编辑和适应性重用策略,提升电子邮件写作中对个人通信偏好的学习与适应能力,提高效率和用户满意度。
Comments 21 pages, 5 figures. Accepted to the 31st International Conference on Intelligent User Interfaces (IUI 26), March 23-26, 2026, Paphos, Cyprus
在生物和技术分布偏移下鲁棒的机器学习用于调控序列建模
专题命中 安全评测 :safety(abstract)
AI总结 本研究提出了一种鲁棒性框架,通过结合模拟和真实数据分析,评估机器学习模型在生物和技术分布偏移下的性能,发现传统i.i.d.评估无法察觉的鲁棒性缺口,并通过引入生物先验特征和不确定性感知预测提升模型的鲁棒性。
Comments 20 pages, 16 figures
BEMEval-Doc2Schema:用于建筑能耗建模的结构化数据提取的大型语言模型基准测试
专题命中 安全评测 :alignment(abstract)
AI总结 BEMEval-Doc2Schema提出了一种用于评估大型语言模型在建筑能耗建模中结构化数据提取性能的基准测试框架,通过引入KVOR指标和跨模型比较,为未来研究提供了基础。