arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2311.13978 2023-11-27 cs.LG eess.IV 57%

MedISure: Towards Assuring Machine Learning-based Medical Image Classifiers using Mixup Boundary Analysis

Adam Byfield, William Poulett, Ben Wallace, Anusha Jose, Shatakshi Tyagi, Smita Shembekar, Adnan Qayyum, Junaid Qadir, Muhammad Bilal

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11045 2023-11-23 cs.AI 57%

Orca 2: Teaching Small Language Models How to Reason

Arindam Mitra, Luciano Del Corro, Shweti Mahajan, Andres Codas, Clarisse Simoes, Sahaj Agarwal, Xuxi Chen, Anastasia Razdaibiedina, Erik Jones, Kriti Aggarwal, Hamid Palangi, Guoqing Zheng, Corby Rosset, Hamed Khanpour, Ahmed Awadallah

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Added url to model weights fixed typo in Author name

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13390 2023-11-23 cs.LG 57%

Counterfactual Explanation via Search in Gaussian Mixture Distributed Latent Space

Xuan Zhao, Klaus Broelemann, Gjergji Kasneci

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments XAI workshop of IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12755 2023-11-22 cs.AI 57%

Digital Twin Framework for Optimal and Autonomous Decision-Making in Cyber-Physical Systems: Enhancing Reliability and Adaptability in the Oil and Gas Industry

Carine Menezes Rebello, Johannes Jäschkea, Idelfonso B. R. Nogueira

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.12855 2023-11-21 cs.AI cs.SE 57%

AI-Augmented Business Process Management Systems: A Research Manifesto

Marlon Dumas, Fabiana Fournier, Lior Limonad, Andrea Marrella, Marco Montali, Jana-Rebecca Rehse, Rafael Accorsi, Diego Calvanese, Giuseppe De Giacomo, Dirk Fahland, Avigdor Gal, Marcello La Rosa, Hagen Völzer, Ingo Weber

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 19 pages, 1 figure

Journal ref ACM Transactions on Management Information Systems, 31 January 2023 Volume 14, Issue 1, Article No.: 11, pp 1-19

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07792 2023-11-15 cs.CY 57%

Western, Religious or Spiritual: An Evaluation of Moral Justification in Large Language Models

Eyup Engin Kucuk, Muhammed Yusuf Kocyigit

专题命中 安全评测 :alignment(abstract);分类 cs.CY

Comments 16 pages total, 8 pages main paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06454 2023-11-14 cs.LG 57%

A Saliency-based Clustering Framework for Identifying Aberrant Predictions

Aina Tersol Montserrat, Alexander R. Loftus, Yael Daihes

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09736 2023-11-10 cs.CV cs.CL 57%

STOA-VLP: Spatial-Temporal Modeling of Object and Action for Video-Language Pre-training

Weihong Zhong, Mao Zheng, Duyu Tang, Xuan Luo, Heng Gong, Xiaocheng Feng, Bing Qin

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments AAAI 2023, 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03837 2023-11-08 cs.IR cs.CL 57%

OLaLa: Ontology Matching with Large Language Models

Sven Hertling, Heiko Paulheim

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted at K-CAP 2023 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01361 2023-11-03 cs.CV cs.CL 57%

GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks

Xinlu Zhang, Yujie Lu, Weizhi Wang, An Yan, Jun Yan, Lianke Qin, Heng Wang, Xifeng Yan, William Yang Wang, Linda Ruth Petzold

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08166 2023-11-01 cs.CL 57%

Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning

Junyu Lu, Dixiang Zhang, Xiaojun Wu, Xinyu Gao, Ruyi Gan, Jiaxing Zhang, Yan Song, Pingjian Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19211 2023-10-31 cs.SI cs.LG 57%

Investigative Pattern Detection Framework for Counterterrorism

Shashika R. Muramudalige, Benjamin W. K. Hung, Rosanne Libretti, Jytte Klausen, Anura P. Jayasumana

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17903 2023-10-30 cs.SE cs.AI 57%

Pitfalls in Language Models for Code Intelligence: A Taxonomy and Survey

Xinyu She, Yue Liu, Yanjie Zhao, Yiling He, Li Li, Chakkrit Tantithamthavorn, Zhan Qin, Haoyu Wang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11888 2023-10-27 cs.RO cs.AI 57%

Penalty-Based Imitation Learning With Cross Semantics Generation Sensor Fusion for Autonomous Driving

Hongkuan Zhou, Aifen Sui, Letian Shi, Yinxian Li

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09848 2023-10-25 cs.CL cs.IR 57%

Evaluating Verifiability in Generative Search Engines

Nelson F. Liu, Tianyi Zhang, Percy Liang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments 25 pages, 12 figures; to appear in Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05442 2023-10-24 cs.CL 57%

Establishing Trustworthiness: Rethinking Tasks and Model Evaluation

Robert Litschko, Max Müller-Eberstein, Rob van der Goot, Leon Weber, Barbara Plank

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Accepted at EMNLP 2023 (Main Conference), camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13800 2023-10-24 cs.CL 57%

Evaluation Metrics in the Era of GPT-4: Reliably Evaluating Large Language Models on Sequence to Sequence Tasks

Andrea Sottana, Bin Liang, Kai Zou, Zheng Yuan

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted at EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06808 2023-10-24 cs.AI 57%

Multi-Agent Reinforcement Learning Guided by Signal Temporal Logic Specifications

Jiangwei Wang, Shuo Yang, Ziyan An, Songyang Han, Zhili Zhang, Rahul Mangharam, Meiyi Ma, Fei Miao

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13085 2023-10-24 cs.CL 57%

Decomposed Prompting for Machine Translation Between Related Languages using Large Language Models

Ratish Puduppully, Anoop Kunchukuttan, Raj Dabre, Ai Ti Aw, Nancy F. Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments EMNLP 2023 (Main, Long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10683 2023-10-24 cs.CV cs.CL 57%

Paxion: Patching Action Knowledge in Video-Language Foundation Models

Zhenhailong Wang, Ansel Blume, Sha Li, Genglin Liu, Jaemin Cho, Zineng Tang, Mohit Bansal, Heng Ji

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments NeurIPS 2023 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11716 2023-10-19 cs.CL 57%

Reflection-Tuning: Data Recycling Improves LLM Instruction-Tuning

Ming Li, Lichang Chen, Jiuhai Chen, Shwai He, Heng Huang, Jiuxiang Gu, Tianyi Zhou

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03666 2023-10-19 stat.ML cs.LG 57%

Bridging Trustworthiness and Open-World Learning: An Exploratory Neural Approach for Enhancing Interpretability, Generalization, and Robustness

Shide Du, Zihan Fang, Shiyang Lan, Yanchao Tan, Manuel Günther, Shiping Wang, Wenzhong Guo

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10841 2023-10-18 cs.LG math.ST stat.TH 57%

A Machine Learning-based Algorithm for Automated Detection of Frequency-based Events in Recorded Time Series of Sensor Data

Bahareh Medghalchi, Andreas Vogel

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09767 2023-10-18 cs.LG cs.CR 57%

It Is All About Data: A Survey on the Effects of Data on Adversarial Robustness

Peiyu Xiong, Michael Tegegn, Jaskeerat Singh Sarin, Shubhraneel Pal, Julia Rubin

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Accepted to ACM Computing Surveys, 40 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06762 2023-10-11 cs.CL 57%

TRACE: A Comprehensive Benchmark for Continual Learning in Large Language Models

Xiao Wang, Yuansen Zhang, Tianze Chen, Songyang Gao, Senjie Jin, Xianjun Yang, Zhiheng Xi, Rui Zheng, Yicheng Zou, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04948 2023-10-10 cs.CL 57%

Extrapolating Large Language Models to Non-English by Aligning Languages

Wenhao Zhu, Yunzhe Lv, Qingxiu Dong, Fei Yuan, Jingjing Xu, Shujian Huang, Lingpeng Kong, Jiajun Chen, Lei Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05177 2023-10-10 cs.CL 57%

Do Large Language Models Know about Facts?

Xuming Hu, Junzhe Chen, Xiaochuan Li, Yufei Guo, Lijie Wen, Philip S. Yu, Zhijiang Guo

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03652 2023-10-06 cs.CE cs.LG 57%

Extreme sparsification of physics-augmented neural networks for interpretable model discovery in mechanics

Jan N. Fuhg, Reese E. Jones, Nikolaos Bouklas

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 34 pages, 19 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03324 2023-10-06 cs.CV cs.LG 57%

Investigating the Limitation of CLIP Models: The Worst-Performing Categories

Jie-Jing Shao, Jiang-Xin Shi, Xiao-Wen Yang, Lan-Zhe Guo, Yu-Feng Li

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04018 2023-10-06 cs.AI q-bio.QM 57%

PyTrial: Machine Learning Software and Benchmark for Clinical Trial Applications

Zifeng Wang, Brandon Theodorou, Tianfan Fu, Cao Xiao, Jimeng Sun

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏