arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2407.13692 2024-08-02 cs.CL 57%

Prover-Verifier Games improve legibility of LLM outputs

Jan Hendrik Kirchner, Yining Chen, Harri Edwards, Jan Leike, Nat McAleese, Yuri Burda

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20743 2024-07-31 cs.CL 57%

Meltemi: The first open Large Language Model for Greek

Leon Voukoutis, Dimitris Roussis, Georgios Paraskevopoulos, Sokratis Sofianopoulos, Prokopis Prokopidis, Vassilis Papavasileiou, Athanasios Katsamanis, Stelios Piperidis, Vassilis Katsouros

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11276 2024-07-31 cs.AI q-fin.GN 57%

Towards Data-Centric Automatic R&D

Haotian Chen, Xinjie Shen, Zeqi Ye, Wenjun Feng, Haoxue Wang, Xiao Yang, Xu Yang, Weiqing Liu, Jiang Bian

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13700 2024-07-30 cs.LG cs.CR 57%

On the Conflict of Robustness and Learning in Collaborative Machine Learning

Mathilde Raynal, Carmela Troncoso

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15736 2024-07-23 cs.CL 57%

OMoS-QA: A Dataset for Cross-Lingual Extractive Question Answering in a German Migration Context

Steffen Kleinle, Jakob Prange, Annemarie Friedrich

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Accepted to KONVENS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14875 2024-07-23 cs.CL 57%

Seal: Advancing Speech Language Models to be Few-Shot Learners

Shuyu Lei, Lingen Liu, Jiaolong Yang, Yasen Jiao, Yuxiang Yang, Yushu Yang, Xiang Guo

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14239 2024-07-22 cs.AI 57%

KoMA: Knowledge-driven Multi-agent Framework for Autonomous Driving with Large Language Models

Kemou Jiang, Xuan Cai, Zhiyong Cui, Aoyong Li, Yilong Ren, Haiyang Yu, Hao Yang, Daocheng Fu, Licheng Wen, Pinlong Cai

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 13 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12024 2024-07-18 cs.HC cs.AI 57%

Leveraging Large Language Models for enhanced personalised user experience in Smart Homes

Jordan Rey-Jouanchicot, André Bottaro, Eric Campo, Jean-Léon Bouraoui, Nadine Vigouroux, Frédéric Vella

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07243 2024-07-18 cs.CL 57%

MBBQ: A Dataset for Cross-Lingual Comparison of Stereotypes in Generative LLMs

Vera Neplenbroek, Arianna Bisazza, Raquel Fernández

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments Accepted to COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11612 2024-07-17 cs.IR cs.AI 57%

Sociotechnical Implications of Generative Artificial Intelligence for Information Access

Bhaskar Mitra, Henriette Cramer, Olya Gurevich

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16537 2024-07-17 cs.CL 57%

LMExplainer: Grounding Knowledge and Explaining Language Models

Zichen Chen, Jianda Chen, Yuanyuan Chen, Han Yu, Ambuj K Singh, Misha Sra

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 25 pages, 10 figures, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13930 2024-07-16 cs.LG cs.SY eess.SY 57%

Enhancing Reinforcement Learning Agents with Local Guides

Paul Daoudi, Bogdan Robu, Christophe Prieur, Ludovic Dos Santos, Merwan Barlier

专题命中 安全评测 :safety(abstract);分类 cs.LG

Journal ref AAMAS '23: Proceedings of the 2023 International Conference on Autonomous Agents and Multiagent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09512 2024-07-16 cs.HC cs.AI 57%

Design and evaluation of AI copilots -- case studies of retail copilot templates

Michal Furmakiewicz, Chang Liu, Angus Taylor, Ilya Venger

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09424 2024-07-15 eess.SP cs.AI 57%

TelecomGPT: A Framework to Build Telecom-Specfic Large Language Models

Hang Zou, Qiyang Zhao, Yu Tian, Lina Bariah, Faouzi Bader, Thierry Lestable, Merouane Debbah

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments arXiv admin note: text overlap with arXiv:1303.2654 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13556 2024-07-15 cs.CV cs.AI 57%

Find n' Propagate: Open-Vocabulary 3D Object Detection in Urban Environments

Djamahl Etchegaray, Zi Huang, Tatsuya Harada, Yadan Luo

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments To appear in ECCV 2024. Source code: https://github.com/djamahl99/findnpropagate

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02558 2024-07-15 cs.CL cs.CV 57%

The Minimum Information about CLinical Artificial Intelligence Checklist for Generative Modeling Research (MI-CLAIM-GEN)

Brenda Y. Miao, Irene Y. Chen, Christopher YK Williams, Jaysón Davidson, Augusto Garcia-Agundez, Shenghuan Sun, Travis Zack, Suchi Saria, Rima Arnaout, Giorgio Quer, Hossein J. Sadaei, Ali Torkamani, Brett Beaulieu-Jones, Bin Yu, Milena Gianfrancesco, Atul J. Butte, Beau Norgeot, Madhumita Sushil

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05798 2024-07-09 cs.LG 57%

$\textbf{S}^2$IP-LLM: Semantic Space Informed Prompt Learning with LLM for Time Series Forecasting

Zijie Pan, Yushan Jiang, Sahil Garg, Anderson Schneider, Yuriy Nevmyvaka, Dongjin Song

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03913 2024-07-08 cs.AI cs.HC 57%

MobileExperts: A Dynamic Tool-Enabled Agent Team in Mobile Devices

Jiayi Zhang, Chuang Zhao, Yihan Zhao, Zhaoyang Yu, Ming He, Jianping Fan

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14499 2024-07-08 cs.CL 57%

"My Answer is C": First-Token Probabilities Do Not Match Text Answers in Instruction-Tuned Language Models

Xinpeng Wang, Bolei Ma, Chengzhi Hu, Leon Weber-Genzel, Paul Röttger, Frauke Kreuter, Dirk Hovy, Barbara Plank

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00995 2024-07-02 cs.CY cs.SY eess.SY physics.app-ph 57%

Data on the Move: Traffic-Oriented Data Trading Platform Powered by AI Agent with Common Sense

Yi Yu, Shengyue Yao, Tianchen Zhou, Yexuan Fu, Jingru Yu, Ding Wang, Xuhong Wang, Cen Chen, Yilun Lin

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00738 2024-07-02 cs.CL 57%

SeaLLMs -- Large Language Models for Southeast Asia

Xuan-Phi Nguyen, Wenxuan Zhang, Xin Li, Mahani Aljunied, Zhiqiang Hu, Chenhui Shen, Yew Ken Chia, Xingxuan Li, Jianyu Wang, Qingyu Tan, Liying Cheng, Guanzheng Chen, Yue Deng, Sen Yang, Chaoqun Liu, Hang Zhang, Lidong Bing

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Technical report, ACL 2024 DEMO TRACK

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20080 2024-07-01 cs.AI physics.ao-ph physics.geo-ph 57%

AI for Extreme Event Modeling and Understanding: Methodologies and Challenges

Gustau Camps-Valls, Miguel-Ángel Fernández-Torres, Kai-Hendrik Cohrs, Adrian Höhl, Andrea Castelletti, Aytac Pacal, Claire Robin, Francesco Martinuzzi, Ioannis Papoutsis, Ioannis Prapas, Jorge Pérez-Aracil, Katja Weigel, Maria Gonzalez-Calabuig, Markus Reichstein, Martin Rabel, Matteo Giuliani, Miguel Mahecha, Oana-Iuliana Popescu, Oscar J. Pellicer-Valero, Said Ouala, Sancho Salcedo-Sanz, Sebastian Sippel, Spyros Kondylatos, Tamara Happé, Tristan Williams

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19504 2024-07-01 cs.CL 57%

Are Generative Language Models Multicultural? A Study on Hausa Culture and Emotions using ChatGPT

Ibrahim Said Ahmad, Shiran Dudy, Resmi Ramachandranpillai, Kenneth Church

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09972 2024-06-28 cs.CL 57%

A Better LLM Evaluator for Text Generation: The Impact of Prompt Output Sequencing and Optimization

KuanChao Chu, Yi-Pei Chen, Hideki Nakayama

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Presented in JSAI 2024. The first two authors contributed equally. arXiv admin note: substantial text overlap with arXiv:2406.02863

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17518 2024-06-27 cs.AI cs.SI 57%

Enhancing Explainability of Knowledge Learning Paths: Causal Knowledge Networks

Yuang Wei, Yizhou Zhou, Yuan-Hao Jiang, Bo Jiang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 8 pages, 3 figures, Educational Data Mining 2024, Human-Centric eXplainable AI in Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16455 2024-06-25 cs.AI 57%

Guardrails for avoiding harmful medical product recommendations and off-label promotion in generative AI models

Daniel Lopez-Martinez

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments CVPR 2024 Responsible Generative AI (ReGenAI) workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14903 2024-06-25 cs.AI 57%

GIEBench: Towards Holistic Evaluation of Group Identity-based Empathy for Large Language Models

Leyan Wang, Yonggang Jin, Tianhao Shen, Tianyu Zheng, Xinrun Du, Chenchen Zhang, Wenhao Huang, Jiaheng Liu, Shi Wang, Ge Zhang, Liuyu Xiang, Zhaofeng He

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15268 2024-06-24 cs.AI 57%

Towards Robust Training Datasets for Machine Learning with Ontologies: A Case Study for Emergency Road Vehicle Detection

Lynn Vonderhaar, Timothy Elvira, Tyler Procko, Omar Ochoa

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14866 2024-06-24 cs.AI eess.IV 57%

AI-based Anomaly Detection for Clinical-Grade Histopathological Diagnostics

Jonas Dippel, Niklas Prenißl, Julius Hense, Philipp Liznerski, Tobias Winterhoff, Simon Schallenberg, Marius Kloft, Oliver Buchstab, David Horst, Maximilian Alber, Lukas Ruff, Klaus-Robert Müller, Frederick Klauschen

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14713 2024-06-24 cs.CY 57%

Risk thresholds for frontier AI

Leonie Koessler, Jonas Schuett, Markus Anderljung

专题命中 安全评测 :safety(abstract);分类 cs.CY

Comments 24 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏