Entailment as Robust Self-Learner
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
Comments Accepted by ACL 2023 main conference
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
Comments Accepted by ACL 2023 main conference
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments 18 pages, 6 tables, 11 figures, NeurIPS 2023 submission
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments Extended NeurIPS submission
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments 9 pages, 6 figures
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.CL
Comments Accepted by ACL 2023
专题命中 安全评测 :alignment(abstract);分类 cs.CL
专题命中 安全评测 :safety(abstract);分类 cs.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
Comments FAccT 2023
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
Comments 14 pages
专题命中 安全评测 :safety(abstract);分类 cs.LG
Comments 10 pages, 6 figures; updated citation, clarified language
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments Project page: https://github.com/chenzcv7/MOTOR
专题命中 安全评测 :safety(abstract);分类 cs.AI
Comments This paper has been accepted by ACM Transactions on Software Engineering and Methodology (TOSEM'23) in "Continuous Special Section: AI and SE." Please include TOSEM for any citations
Journal ref ACM Trans. Softw. Eng. Methodol. (2023)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
Comments Accepted to NoDaLiDa 2023
专题命中 安全评测 :alignment(abstract);分类 cs.CL
Comments Technical Report for AliceMind's VECO 2.0 (ranked 1st on the XTREME leaderboard on March 17, 2023)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
Comments Accepted by COLING 2022
Journal ref https://aclanthology.org/2022.coling-1.141/
专题命中 安全评测 :safety(abstract);分类 cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
Comments Accepted to 2023 Conference on Computer-Human Interaction (CHI) Human-Centered Explainable AI Workshop, 8 pages
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments CVPR 2023 Highlight
专题命中 安全评测 :safety(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.LG
Comments 8 pages, under review
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.LG
Comments accepted by TPAMI2023
专题命中 安全评测 :safety(abstract);分类 cs.LG
Comments Accepted by the Special Issue on Human-Centered Explainable AI, ACM Transactions on Interactive Intelligent Systems
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments 11 pages, 8 figures
专题命中 安全评测 :trustworthy(abstract);分类 cs.CY
Comments 3rd International Workshop on Scientific Knowledge: Representation, Discovery, and Assessment co-located with The Web Conference 2023
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments Accepted at ECML PKDD 2022
Journal ref Machine Learning and Knowledge Discovery in Databases, vol. 3, pp. 121-136, 2022
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments 10 pages concept paper