Logical Consistency Between Disagreeing Experts and Its Role in AI Safety
机构 * Andrés Corrada-Emmanuel(独立研究者)
专题命中 安全评测 :safety(title);AI safety(title);分类 cs.AI
Comments 10 pages, 7 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Andrés Corrada-Emmanuel(独立研究者)
专题命中 安全评测 :safety(title);AI safety(title);分类 cs.AI
Comments 10 pages, 7 figures
机构 * National University of Singapore(新加坡国立大学) ; Huazhong University of Science and Technology(华中科技大学) ; Central China Normal University(中国地质大学) ; iWudao Tech(iWudao科技) ; Oxford(牛津大学) ; Google Deepmind(谷歌DeepMind)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
Comments This is a work in progress. Comments and suggestions are welcome
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Department of Computer Science, University of York(约克大学计算机科学系) ; French-Azerbaijani University under Azerbaijan State Oil and Industry University(阿塞拜疆国家石油和工业大学下的法阿大学) ; School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院) ; Department of Engineering, University of Aberdeen(阿伯丁大学工程系) ; École Polytechnique, Institut Polytechnique de Paris(巴黎理工学院)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
机构 * Kempelen Institute of Intelligent Technologies(基姆佩尔智能技术研究所) ; University of Copenhagen(哥本哈根大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
Comments Project Page: https://deeptracereward.github.io/
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Stanford University(斯坦福大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments 9 pages
机构 * IRISA, Univ. Rennes, CNRS(IRISA、里昂大学、CNRS) ; Imatag ; LABEL4.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
Comments Preprint
机构 * Department of Civil and Environmental Engineering, University of Washington(华盛顿大学土木与环境工程系)
专题命中 安全评测 :safety(abstract);分类 cs.AI
机构 * Netherlands Organisation for Applied Scientific Research(荷兰应用科学研究院) ; Integrated Vehicle Safety Group(集成车辆安全组) ; Radboud University(拉德堡德大学) ; Donders Institute for Brain, Cognition and Behaviour(多纳尔斯脑、认知与行为研究所)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
Comments Accepted for publication in proceedings of the 2025 IEEE International Automated Vehicle Validation Conference
机构 * Independent Researcher(独立研究者) ; New York University(纽约大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
Comments Accepted as a full paper at SIGIR-AP 2025
机构 * Institute of Science and Technology(科学与技术研究所) ; Federal University of São Paulo(圣保罗联邦大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments 8 pages, 5 figures, 5 tables
专题命中 安全评测 :safety(abstract);分类 cs.AI
Comments 11 pages, 5 figures, MSc dissertation submission draft, prepared for conference/journal consideration
机构 * University of Amsterdam(阿姆斯特丹大学) ; ETH Zürich(苏黎世联邦理工学院) ; University of Copenhagen(哥本哈根大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments ICML 2025 Assessing World Models Workshop; EMNLP 2025 Findings
专题命中 安全评测 :trustworthy(abstract)
Comments 12 pages and 6 figures
专题命中 安全评测 :alignment(abstract)
专题命中 安全评测 :alignment(abstract)
Comments The 6th ACM International Conference on Al in Finance
机构 * Nanyang Technological University(南洋理工大学) ; Nanjing University of Information Science and Technology(南京信息工程大学) ; Zhejiang University(浙江大学) ; South China Normal University(华南师范大学) ; Alibaba DAMO Academy(阿里巴巴达摩院) ; City University of Hong Kong(香港城市大学)
专题命中 安全评测 :alignment(abstract)
机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)
专题命中 安全评测 :safety(abstract)