arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2410.14911 2024-10-22 cs.CV cs.AI cs.CL 62%

A Hybrid Defense Strategy for Boosting Adversarial Robustness in Vision-Language Models

Yuhan Liang, Yijun Li, Yumeng Niu, Qianhe Shen, Hangyu Liu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13901 2024-10-21 cs.CR cs.AI cs.CL cs.ET 62%

SoK: Prompt Hacking of Large Language Models

Baha Rababah, Shang, Wu, Matthew Kwiatkowski, Carson Leung, Cuneyt Gurcan Akcora

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07811 2024-10-18 cs.NE cs.AI cs.LG 62%

Evolutionary Computation and Explainable AI: A Roadmap to Understandable Intelligent Systems

Ryan Zhou, Jaume Bacardit, Alexander Brownlee, Stefano Cagnoni, Martin Fyvie, Giovanni Iacca, John McCall, Niki van Stein, David Walker, Ting Hu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 24 pages, 4 figures. arXiv admin note: substantial text overlap with arXiv:2306.14786

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12959 2024-10-18 cs.AI cs.CL 62%

Large Language Models as a Tool for Mining Object Knowledge

Hannah YoungEun An, Lenhart K. Schubert

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12219 2024-10-17 cs.AI cs.CL cs.MM 62%

OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities

Lichang Chen, Hexiang Hu, Mingda Zhang, Yiwen Chen, Zifeng Wang, Yandong Li, Pranav Shyam, Tianyi Zhou, Heng Huang, Ming-Hsuan Yang, Boqing Gong

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 6 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09858 2024-10-17 cs.LG cs.AI 62%

A Survey of Out-of-distribution Generalization for Graph Machine Learning from a Causal View

Jing Ma

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08442 2024-10-15 cs.LG cs.AI 62%

JurEE not Judges: safeguarding llm interactions with small, specialised Encoder Ensembles

Dom Nasrabadi

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05176 2024-10-15 cs.CL cs.AI 62%

Convergences and Divergences between Automatic Assessment and Human Evaluation: Insights from Comparing ChatGPT-Generated Translation and Neural Machine Translation

Zhaokun Jiang, Qianxi Lv, Ziyin Zhang, Lei Lei

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07966 2024-10-11 cs.LG cs.AI 62%

Neural Reasoning Networks: Efficient Interpretable Neural Networks With Automatic Textual Explanations

Stephen Carrow, Kyle Harper Erwin, Olga Vilenskaia, Parikshit Ram, Tim Klinger, Naweed Aghmad Khan, Ndivhuwo Makondo, Alexander Gray

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13890 2024-10-11 cs.CL cs.AI 62%

ClinicalLab: Aligning Agents for Multi-Departmental Clinical Diagnostics in the Real World

Weixiang Yan, Haitian Liu, Tengxiao Wu, Qian Chen, Wen Wang, Haoyuan Chai, Jiayi Wang, Weishan Zhao, Yixin Zhang, Renjun Zhang, Li Zhu, Xuandong Zhao

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05044 2024-10-08 cs.RO cs.AI cs.CV cs.LG 62%

PhotoReg: Photometrically Registering 3D Gaussian Splatting Models

Ziwen Yuan, Tianyi Zhang, Matthew Johnson-Roberson, Weiming Zhi

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04555 2024-10-08 cs.LG cs.CY 62%

$\texttt{dattri}$: A Library for Efficient Data Attribution

Junwei Deng, Ting-Wei Li, Shiyuan Zhang, Shixuan Liu, Yijun Pan, Hao Huang, Xinhe Wang, Pingbang Hu, Xingjian Zhang, Jiaqi W. Ma

专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03342 2024-10-08 cs.LG cs.AI 62%

Domain Adaptation for Time-Series Classification to Mitigate Covariate Shift

Felix Ott, David Rügamer, Lucas Heublein, Bernd Bischl, Christopher Mutschler

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Journal ref 2022 Proceedings of the 30th ACM International Conference on Multimedia (ACMMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17125 2024-10-07 cs.CL cs.LG 62%

To Know or Not To Know? Analyzing Self-Consistency of Large Language Models under Ambiguity

Anastasiia Sedova, Robert Litschko, Diego Frassinelli, Benjamin Roth, Barbara Plank

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19680 2024-10-01 cs.CL cs.AI 62%

Instruction Embedding: Latent Representations of Instructions Towards Task Identification

Yiwei Li, Jiayi Shi, Shaoxiong Feng, Peiwen Yuan, Xinglin Wang, Boyuan Pan, Heda Wang, Yao Hu, Kan Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18982 2024-10-01 cs.RO cs.AI cs.LG 62%

Aligning Robot Navigation Behaviors with Human Intentions and Preferences

Haresh Karnan

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Haresh Karnan's PhD Dissertation A recording of the defense talk can be accessed here: https://youtu.be/MssiO6g0Gb8

Journal ref The University of Texas at Austin, May 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18962 2024-09-30 cs.CV cs.AI cs.LG 62%

Exploring Token Pruning in Vision State Space Models

Zheng Zhan, Zhenglun Kong, Yifan Gong, Yushu Wu, Zichong Meng, Hangyu Zheng, Xuan Shen, Stratis Ioannidis, Wei Niu, Pu Zhao, Yanzhi Wang

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments NeurIPS'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18812 2024-09-30 cs.CL cs.AI cs.DL 62%

LLMs4Synthesis: Leveraging Large Language Models for Scientific Synthesis

Hamed Babaei Giglou, Jennifer D'Souza, Sören Auer

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 3 figures, Accepted to JCDL 2024 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16849 2024-09-26 cs.AI cs.CL 62%

Exposing Assumptions in AI Benchmarks through Cognitive Modelling

Jonathan H. Rystrøm, Kenneth C. Enevoldsen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02559 2024-09-25 cs.CL cs.AI 62%

A Framework for Human Evaluation of Large Language Models in Healthcare Derived from Literature Review

Thomas Yu Chow Tam, Sonish Sivarajkumar, Sumit Kapoor, Alisa V Stolyar, Katelyn Polanska, Karleigh R McCarthy, Hunter Osterhoudt, Xizhi Wu, Shyam Visweswaran, Sunyang Fu, Piyush Mathur, Giovanni E. Cacciamani, Cong Sun, Yifan Peng, Yanshan Wang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14277 2024-09-24 cs.AI cs.CL cs.CV cs.RO 62%

Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models

Yew Ken Chia, Qi Sun, Lidong Bing, Soujanya Poria

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13897 2024-09-24 cs.CL cs.AI 62%

LLM for Everyone: Representing the Underrepresented in Large Language Models

Samuel Cahyawijaya

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12785 2024-09-23 cs.CE cs.AI cs.LG 62%

Investigation on domain adaptation of additive manufacturing monitoring systems to enhance digital twin reusability

Jiarui Xie, Zhuo Yang, Chun-Chun Hu, Haw-Ching Yang, Yan Lu, Yaoyao Fiona Zhao

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 7 figures, 3 tables. IEEE CASE 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12479 2024-09-20 cs.LG cs.AI cs.CV 62%

Learning Multi-Manifold Embedding for Out-Of-Distribution Detection

Jeng-Lin Li, Ming-Ching Chang, Wei-Chao Chen

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments European Conference on Computer Vision ECCV 2024 BEW Workshop Best Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13785 2024-09-20 cs.LG cs.AI math.PR stat.ML 62%

Efficient Two-Stage Gaussian Process Regression Via Automatic Kernel Search and Subsampling

Shifan Zhao, Jiaying Lu, Ji Yang, Edmond Chow, Yuanzhe Xi

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12708 2024-09-19 cs.LG cs.AI stat.ML 62%

Deep Neural Network Benchmarks for Selective Classification

Andrea Pugnana, Lorenzo Perini, Jesse Davis, Salvatore Ruggieri

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Published in The Journal of Data centric Machine Learning Research (DMLR), Vol 1, (17):1-58 (2024)

Journal ref Journal of Data-centric Machine Learning Research (DMLR), Vol 1, (17):1-58, (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10547 2024-09-18 cs.CR cs.AI cs.LG 62%

NoPhish: Efficient Chrome Extension for Phishing Detection Using Machine Learning Techniques

Leand Thaqi, Arbnor Halili, Kamer Vishi, Blerim Rexha

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 21 pages, 13 figures, 5 listings, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11139 2024-09-18 cs.RO cs.AI cs.LG 62%

RuleFuser: An Evidential Bayes Approach for Rule Injection in Imitation Learned Planners and Predictors for Robustness under Distribution Shifts

Jay Patrikar, Sushant Veer, Apoorva Sharma, Marco Pavone, Sebastian Scherer

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17326 2024-09-17 cs.LG cs.AI cs.CV 62%

Matrix Information Theory for Self-Supervised Learning

Yifan Zhang, Zhiquan Tan, Jingqin Yang, Weiran Huang, Yang Yuan

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02764 2024-09-16 cs.CL cs.LG 62%

Assessing Adversarial Robustness of Large Language Models: An Empirical Study

Zeyu Yang, Zhao Meng, Xiaochen Zheng, Roger Wattenhofer

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

Comments Oral presentation at KDD 2024 GenAI Evaluation workshop

详情

展开后加载摘要…

URL PDF HTML 收藏