arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2410.16166 2024-10-22 cs.CV cs.CL 57%

Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining

Han Huang, Yuqi Huo, Zijia Zhao, Haoyu Lu, Shu Wu, Bingning Wang, Qiang Liu, Weipeng Chen, Liang Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05072 2024-10-22 cs.CL 57%

Aligning Translation-Specific Understanding to General Understanding in Large Language Models

Yichong Huang, Baohang Li, Xiaocheng Feng, Chengpeng Fu, Wenshuai Huo, Ting Liu, Bing Qin

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments EMNLP2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15648 2024-10-22 cs.LG stat.ME 57%

Linking Model Intervention to Causal Interpretation in Model Explanation

Debo Cheng, Ziqi Xu, Jiuyong Li, Lin Liu, Kui Yu, Thuc Duy Le, Jixue Liu

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15623 2024-10-22 cs.CL 57%

Guardians of Discourse: Evaluating LLMs on Multilingual Offensive Language Detection

Jianfei He, Lilin Wang, Jiaying Wang, Zhenyu Liu, Hongbin Na, Zimu Wang, Wei Wang, Qi Chen

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments Accepted at UIC 2024 proceedings. Accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15405 2024-10-22 cs.AI 57%

XAI-based Feature Ensemble for Enhanced Anomaly Detection in Autonomous Driving Systems

Sazid Nazat, Mustafa Abdallah

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 31 pages, 4 figures (including the subfigures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16477 2024-10-22 cs.CV cs.CL 57%

DaLPSR: Leverage Degradation-Aligned Language Prompt for Real-World Image Super-Resolution

Aiwen Jiang, Zhi Wei, Long Peng, Feiqiang Liu, Wenbo Li, Mingwen Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11863 2024-10-21 cs.CL 57%

How Interpretable are Reasoning Explanations from Prompting Large Language Models?

Wei Jie Yeo, Ranjan Satapathy, Rick Siow Mong Goh, Erik Cambria

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments NAACL Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12722 2024-10-17 cs.CL 57%

WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation

João Matos, Shan Chen, Siena Placino, Yingya Li, Juan Carlos Climent Pardo, Daphna Idan, Takeshi Tohyama, David Restrepo, Luis F. Nakayama, Jose M. M. Pascual-Leone, Guergana Savova, Hugo Aerts, Leo A. Celi, A. Ian Wong, Danielle S. Bitterman, Jack Gallifant

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments submitted for review, total of 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12109 2024-10-17 cs.CL cs.CV 57%

OMCAT: Omni Context Aware Transformer

Arushi Goel, Karan Sapra, Matthieu Le, Rafael Valle, Andrew Tao, Bryan Catanzaro

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Demo page: https://om-cat.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11904 2024-10-16 cs.CV cs.AI 57%

Finding the Subjective Truth: Collecting 2 Million Votes for Comprehensive Gen-AI Model Evaluation

Dimitrios Christodoulou, Mads Kuhlmann-Jørgensen

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10210 2024-10-16 cs.CL 57%

Minimum Tuning to Unlock Long Output from LLMs with High Quality Data as the Key

Yingda Chen, Xingjun Wang, Jintao Huang, Yunlin Mao, Daoze Zhang, Yuze Zhao

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11924 2024-10-16 cs.CL 57%

Cofca: A Step-Wise Counterfactual Multi-hop QA benchmark

Jian Wu, Linyi Yang, Zhen Wang, Manabu Okumura, Yue Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08764 2024-10-14 cs.CL 57%

Measuring the Groundedness of Legal Question-Answering Systems

Dietrich Trautmann, Natalia Ostapuk, Quentin Grail, Adrian Alan Pol, Guglielmo Bonifazi, Shang Gao, Martin Gajek

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments to appear NLLP @ EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08315 2024-10-14 stat.ML cs.LG 57%

Avoiding mode collapse in diffusion models fine-tuned with reinforcement learning

Roberto Barceló, Cristóbal Alcázar, Felipe Tobar

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07830 2024-10-11 cs.CL 57%

NusaMT-7B: Machine Translation for Low-Resource Indonesian Languages with Large Language Models

William Tan, Kevin Zhu

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted to SoLaR @ NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07405 2024-10-11 cs.CV cs.AI 57%

Exploring Efficient Foundational Multi-modal Models for Video Summarization

Karan Samel, Apoorva Beedu, Nitish Sontakke, Irfan Essa

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13703 2024-10-11 cs.CL 57%

Investigating Multilingual Instruction-Tuning: Do Polyglot Models Demand for Multilingual Instructions?

Alexander Arno Weber, Klaudia Thellmann, Jan Ebert, Nicolas Flores-Herr, Jens Lehmann, Michael Fromm, Mehdi Ali

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted for EMNLP 2024 (Main), 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18365 2024-10-10 cs.CL 57%

Themis: A Reference-free NLG Evaluation Language Model with Flexibility and Interpretability

Xinyu Hu, Li Lin, Mingqi Gao, Xunjian Yin, Xiaojun Wan

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted by EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06925 2024-10-10 cs.CL 57%

A Thorough Examination of Decoding Methods in the Era of LLMs

Chufan Shi, Haoran Yang, Deng Cai, Zhisong Zhang, Yifan Wang, Yujiu Yang, Wai Lam

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05306 2024-10-10 cs.CR cs.AI 57%

Towards Assuring EU AI Act Compliance and Adversarial Robustness of LLMs

Tomas Bueno Momcilovic, Beat Buesser, Giulio Zizzo, Mark Purcell, Dian Balta

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Accepted in the AI Act Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12021 2024-10-10 cs.CL 57%

Can AI Relate: Testing Large Language Model Response for Mental Health Support

Saadia Gabriel, Isha Puri, Xuhai Xu, Matteo Malgaroli, Marzyeh Ghassemi

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04751 2024-10-08 cs.CV cs.CL 57%

Intriguing Properties of Large Language and Vision Models

Young-Jun Lee, Byungsoo Ko, Han-Gyu Kim, Yechan Hwang, Ho-Jin Choi

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Code is available in https://github.com/passing2961/IP-LLVM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20267 2024-10-08 cs.CL 57%

Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions

Ruochen Zhao, Wenxuan Zhang, Yew Ken Chia, Weiwen Xu, Deli Zhao, Lidong Bing

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03656 2024-10-08 cs.CL 57%

Emotionally Numb or Empathetic? Evaluating How LLMs Feel Using EmotionBench

Jen-tse Huang, Man Ho Lam, Eric John Li, Shujie Ren, Wenxuan Wang, Wenxiang Jiao, Zhaopeng Tu, Michael R. Lyu

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments NeurIPS 2024; 10 pages of main text; 14 pages of appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11979 2024-10-07 cs.SE cs.CL 57%

On the Potential and Limitations of Few-Shot In-Context Learning to Generate Metamorphic Specifications for Tax Preparation Software

Dananjay Srinivas, Rohan Das, Saeid Tizpaz-Niari, Ashutosh Trivedi, Maria Leonor Pacheco

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Accepted to the Proceedings of the Natural Legal Language Processing Workshop, EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02049 2024-10-04 cs.CV cs.CL cs.GR 57%

Emo3D: Metric and Benchmarking Dataset for 3D Facial Expression Generation from Emotion Description

Mahshid Dehghani, Amirahmad Shafiee, Ali Shafiei, Neda Fallah, Farahmand Alizadeh, Mohammad Mehdi Gholinejad, Hamid Behroozi, Jafar Habibi, Ehsaneddin Asgari

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02043 2024-10-04 cs.CR cs.LG cs.NE 57%

Impact of White-Box Adversarial Attacks on Convolutional Neural Networks

Rakesh Podder, Sudipto Ghosh

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02005 2024-10-04 cs.LG stat.ML 57%

FairlyUncertain: A Comprehensive Benchmark of Uncertainty in Algorithmic Fairness

Lucas Rosenblatt, R. Teal Witter

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11096 2024-10-04 cs.CL 57%

The Potential and Challenges of Evaluating Attitudes, Opinions, and Values in Large Language Models

Bolei Ma, Xinpeng Wang, Tiancheng Hu, Anna-Carolina Haensch, Michael A. Hedderich, Barbara Plank, Frauke Kreuter

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01039 2024-10-03 cs.CL 57%

From Facts to Insights: A Study on the Generation and Evaluation of Analytical Reports for Deciphering Earnings Calls

Tomas Goldsack, Yang Wang, Chenghua Lin, Chung-Chi Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏