arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2412.15254 2024-12-23 cs.CL 57%

RIRO: Reshaping Inputs, Refining Outputs Unlocking the Potential of Large Language Models in Data-Scarce Contexts

Ali Hamdi, Hozaifa Kassab, Mohamed Bahaa, Marwa Mohamed

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00146 2024-12-23 cs.AI 57%

Responsibility-aware Strategic Reasoning in Probabilistic Multi-Agent Systems

Chunyan Mu, Muhammad Najib, Nir Oren

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19547 2024-12-23 cs.LG cs.CV 57%

CLIPLoss and Norm-Based Data Selection Methods for Multimodal Contrastive Learning

Yiping Wang, Yifang Chen, Wendan Yan, Alex Fang, Wenjing Zhou, Kevin Jamieson, Simon Shaolei Du

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments This paper supercedes our previous VAS paper (arXiv:2402.02055). It's accepted by NeurIPS2024 as spotlight paper. DataComp benchmark: https://www.datacomp.ai/dcclip/leaderboard.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14179 2024-12-20 cs.SE cs.AI 57%

Benchmarking Harmonized Tariff Schedule Classification Models

Bryce Judy

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05130 2024-12-17 cs.CL 57%

Fast-DetectGPT: Efficient Zero-Shot Detection of Machine-Generated Text via Conditional Probability Curvature

Guangsheng Bao, Yanbin Zhao, Zhiyang Teng, Linyi Yang, Yue Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments ICLR 2024 camera version (9 pages, 5 figures, 11 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10429 2024-12-17 cs.CV cs.AI 57%

GPTDrawer: Enhancing Visual Synthesis through ChatGPT

Kun Li, Xinwei Chen, Tianyou Song, Hansong Zhang, Wenzhe Zhang, Qing Shan

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10008 2024-12-16 cs.CL 57%

Automated Collection of Evaluation Dataset for Semantic Search in Low-Resource Domain Language

Anastasia Zhukova, Christian E. Matt, Bela Gipp

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments accepted in the First Workshop on Language Models for Low-Resource Languages (LoResLM) co-located with the 31st International Conference on Computational Linguistics (COLING 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08350 2024-12-16 cs.CL 57%

Salute the Classic: Revisiting Challenges of Machine Translation in the Age of Large Language Models

Jianhui Pang, Fanghua Ye, Longyue Wang, Dian Yu, Derek F. Wong, Shuming Shi, Zhaopeng Tu

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments This paper has been accepted by TACL; A pre-MIT Press publication version; Longyue Wang is the Corresponding Author

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01314 2024-12-13 cs.CV cs.LG 57%

Disentangling Mean Embeddings for Better Diagnostics of Image Generators

Sebastian G. Gruber, Pascal Tobias Ziegler, Florian Buettner

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments Published at Interpretable AI: Past, Present and Future Workshop at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.16223 2024-12-13 cs.LG cs.SY eess.SY 57%

Towards Real-World Deployment of Reinforcement Learning for Traffic Signal Control

Arthur Müller, Vishal Rangras, Georg Schnittker, Michael Waldmann, Maxim Friesen, Tobias Ferfers, Lukas Schreckenberg, Florian Hufen, Jürgen Jasperneite, Marco Wiering

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Paper was accepted by ICMLA 2021 (20th IEEE International Conference on Machine Learning and Applications). Code available under https://github.com/RL-INA/LemgoRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09000 2024-12-13 cs.HC cs.AI 57%

The AI Interface: Designing for the Ideal Machine-Human Experience (Editorial)

Aparna Sundar, Tony Russell-Rose, Udo Kruschwitz, Karen Machleit

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08955 2024-12-13 cs.CL 57%

Align, Generate, Learn: A Novel Closed-Loop Framework for Cross-Lingual In-Context Learning

Mateo Alejandro Rojas, Rafael Carranza

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05185 2024-12-12 cs.CV cs.LG cs.MM 57%

LinVT: Empower Your Image-level Large Language Model to Understand Videos

Lishuai Gao, Yujie Zhong, Yingsen Zeng, Haoxian Tan, Dengjie Li, Zheng Zhao

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01987 2024-12-12 cs.LG 57%

Representation Learning of Multivariate Time Series using Attention and Adversarial Training

Leon Scharwächter, Sebastian Otte

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15950 2024-12-12 cs.IR cs.AI 57%

Representation Learning with Large Language Models for Recommendation

Xubin Ren, Wei Wei, Lianghao Xia, Lixin Su, Suqi Cheng, Junfeng Wang, Dawei Yin, Chao Huang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Published as a WWW'24 full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.01517 2024-12-12 cs.LG 57%

Correct-N-Contrast: A Contrastive Approach for Improving Robustness to Spurious Correlations

Michael Zhang, Nimit S. Sohoni, Hongyang R. Zhang, Chelsea Finn, Christopher Ré

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 38 pages, 14 figures. ICML 2022 Long Talk

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10053 2024-12-10 cs.CL 57%

Householder Pseudo-Rotation: A Novel Approach to Activation Editing in LLMs with Direction-Magnitude Perspective

Van-Cuong Pham, Thien Huu Nguyen

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05851 2024-12-09 cs.AI 57%

Cognitive Architecture Toward Common Ground Sharing Among Humans and Generative AIs: Trial on Model-Model Interactions in Tangram Naming Task

Junya Morita, Tatsuya Yui, Takeru Amaya, Ryuichiro Higashinaka, Yugo Takeuchi

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Proceedings of the 2023 AAAI Fall Symposium on Integrating Cognitive Architectures and Generative Models

Journal ref Proceedings of the 2023 AAAI Fall Symposia, vol.2, no. 1, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04029 2024-12-06 cs.AI 57%

Considerations Influencing Offense-Defense Dynamics From Artificial Intelligence

Giulio Corsi, Kyle Kilian, Richard Mallah

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01535 2024-12-06 cs.CL 57%

Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models

Seungone Kim, Juyoung Suk, Shayne Longpre, Bill Yuchen Lin, Jamin Shin, Sean Welleck, Graham Neubig, Moontae Lee, Kyungjae Lee, Minjoon Seo

专题命中 安全评测 :harmlessness(abstract);分类 cs.CL

Comments EMNLP 2024 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03497 2024-12-05 cs.LG physics.atom-ph 57%

Soft Checksums to Flag Untrustworthy Machine Learning Surrogate Predictions and Application to Atomic Physics Simulations

Casey Lauer, Robert C. Blake, Jonathan B. Freund

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03267 2024-12-05 cs.SD cs.AI eess.AS 57%

Detecting abnormal heart sound using mobile phones and on-device IConNet

Linh Vu, Thu Tran

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments N2Women'24 Workshop, MobiSys 2024, Tokyo, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01778 2024-12-03 cs.CR cs.AI 57%

HackSynth: LLM Agent and Evaluation Framework for Autonomous Penetration Testing

Lajos Muzsai, David Imolai, András Lukács

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00948 2024-12-03 cs.CL 57%

Uhura: A Benchmark for Evaluating Scientific Question Answering and Truthfulness in Low-Resource African Languages

Edward Bayes, Israel Abebe Azime, Jesujoba O. Alabi, Jonas Kgomo, Tyna Eloundou, Elizabeth Proehl, Kai Chen, Imaan Khadir, Naome A. Etori, Shamsuddeen Hassan Muhammad, Choice Mpanza, Igneciah Pocia Thete, Dietrich Klakow, David Ifeoluwa Adelani

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00243 2024-12-03 cs.RO cs.AI 57%

Realistic Corner Case Generation for Autonomous Vehicles with Multimodal Large Language Model

Qiujing Lu, Meng Ma, Ximiao Dai, Xuanhan Wang, Shuo Feng

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00239 2024-12-03 cs.SE cs.AI 57%

Generating a Low-code Complete Workflow via Task Decomposition and RAG

Orlando Marquez Ayala, Patrice Béchard

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Under review; 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04449 2024-12-02 cs.AI 57%

EARBench: Towards Evaluating Physical Risk Awareness for Task Planning of Foundation Model-based Embodied AI Agents

Zihao Zhu, Bingzhe Wu, Zhengyou Zhang, Lei Han, Qingshan Liu, Baoyuan Wu

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18169 2024-11-28 cs.CV cs.AI 57%

PDZSeg: Adapting the Foundation Model for Dissection Zone Segmentation with Visual Prompts in Robot-assisted Endoscopic Submucosal Dissection

Mengya Xu, Wenjin Mo, Guankun Wang, Huxin Gao, An Wang, Zhen Li, Xiaoxiao Yang, Hongliang Ren

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17502 2024-11-27 cs.LG 57%

Confidence-Aware Deep Learning for Load Plan Adjustments in the Parcel Service Industry

Thomas Bruys, Reza Zandehshahvar, Amira Hijazi, Pascal Van Hentenryck

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01241 2024-11-27 cs.CR cs.AI 57%

Just-in-Time Detection of Silent Security Patches

Xunzhu Tang, Zhenghan Chen, Kisub Kim, Haoye Tian, Saad Ezzini, Jacques Klein

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏