arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2406.11288 2025-02-18 cs.CL cs.CV 57%

MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models

Shengkang Wang, Hongzhan Lin, Ziyang Luo, Zhen Ye, Guang Chen, Jing Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong Baptist University(香港浸会大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09940 2025-02-17 cs.CL cs.SD eess.AS 57%

A Preliminary Exploration with GPT-4o Voice Mode

Yu-Xiang Lin, Chih-Kai Yang, Wei-Chih Chen, Chen-An Li, Chien-yu Huang, Xuanjun Chen, Hung-yi Lee

机构 * National Taiwan University(台湾大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17016 2025-02-17 cs.LG stat.AP stat.ML 57%

Error-controlled non-additive interaction discovery in machine learning models

Winston Chen, Yifan Jiang, William Stafford Noble, Yang Young Lu

机构 * University of Michigan(密歇根大学) University of Waterloo(滑铁卢大学) University of Washington(华盛顿大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments Accepted by Natural Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08489 2025-02-14 cs.CL 57%

Salamandra Technical Report

Aitor Gonzalez-Agirre, Marc Pàmies, Joan Llop, Irene Baucells, Severino Da Dalt, Daniel Tamayo, José Javier Saiz, Ferran Espuña, Jaume Prats, Javier Aula-Blasco, Mario Mina, Iñigo Pikabea, Adrián Rubio, Alexander Shvets, Anna Sallés, Iñaki Lacunza, Jorge Palomar, Júlia Falcão, Lucía Tormo, Luis Vasquez-Reina, Montserrat Marimon, Oriol Pareras, Valle Ruiz-Fernández, Marta Villegas

机构 * Language Technologies Unit Barcelona Supercomputing Center(巴塞罗那超级计算中心语言技术单元)

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09156 2025-02-14 cs.CL 57%

Improving TCM Question Answering through Tree-Organized Self-Reflective Retrieval with LLMs

Chang Liu, Ying Chang, Jianmin Li, Yiqian Qu, Yu Li, Lingyong Cao, Shuyuan Lin

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09763 2025-02-13 cs.CL 57%

Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations

Wenjie Mo, Jiashu Xu, Qin Liu, Jiongxiao Wang, Jun Yan, Hadi Askari, Chaowei Xiao, Muhao Chen

机构 * University of Southern California(南加州大学) Harvard University(哈佛大学) University of California, Davis(加州大学戴维斯分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Findings of NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19018 2025-02-12 cs.CL 57%

Let the Fuzzy Rule Speak: Enhancing In-context Learning Debiasing with Interpretability

Ruixi Lin, Yang You

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20163 2025-02-12 cs.IR cs.CL 57%

UniHGKR: Unified Instruction-aware Heterogeneous Knowledge Retrievers

Dehai Min, Zhiyang Xu, Guilin Qi, Lifu Huang, Chenyu You

机构 * Southeast University(东南大学) Stony Brook University(石溪大学) Virginia Tech(弗吉尼亚理工大学) UC Davis(加州大学戴维斯分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments NAACL 2025, Main, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19214 2025-02-12 stat.ML cs.LG 57%

Group & Reweight: A Novel Cost-Sensitive Approach to Mitigating Class Imbalance in Network Traffic Classification

Wumei Du, Dong Liang, Yiqin Lv, Xingxing Liang, Guanlin Wu, Qi Wang, Zheng Xie

机构 * National University of Defense Technology(国防科技大学) Academy of Military Science(军事科学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 21 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05926 2025-02-11 eess.IV cs.CL cs.CV 57%

A Generative Framework for Bidirectional Image-Report Understanding in Chest Radiography

Nicholas Evans, Stephen Baker, Miles Reed

机构 * Bandırma Onyedi Eylül University(班迪尔马奥涅迪埃伊吕勒大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06243 2025-02-11 cs.CV cs.LG 57%

Multi-Scale Transformer Architecture for Accurate Medical Image Classification

Jiacheng Hu, Yanlin Xiang, Yang Lin, Junliang Du, Hanchao Zhang, Houze Liu

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05506 2025-02-11 stat.ML cs.LG stat.ME 57%

Confidence Diagram of Nonparametric Ranking for Uncertainty Assessment in Large Language Models Evaluation

Zebin Wang, Yi Han, Ethan X. Fang, Lan Wang, Junwei Lu

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17040 2025-02-11 cs.CL 57%

Arabic Dataset for LLM Safeguard Evaluation

Yasser Ashraf, Yuxia Wang, Bin Gu, Preslav Nakov, Timothy Baldwin

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) LibrAI The University of Melbourne(墨尔本大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments Accepted at NAACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.11570 2025-02-11 cs.SD cs.LG eess.AS 57%

Conditional Generative Data Augmentation for Clinical Audio Datasets

Matthias Seibold, Armando Hoch, Mazda Farshad, Nassir Navab, Philipp Fürnstahl

机构 * Technical University of Munich(慕尼黑工业大学) University of Zurich(苏黎世大学) University Hospital Balgrist(巴尔格里斯特大学医院) Balgrist University Hospital(巴尔格里斯特大学医院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14059 2025-02-10 q-fin.CP cs.CE cs.CL 57%

UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models

Yuzhe Yang, Yifei Zhang, Yan Hu, Yilin Guo, Ruoli Gan, Yueru He, Mingcong Lei, Xiao Zhang, Haining Wang, Qianqian Xie, Jimin Huang, Honghai Yu, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) The Fin AI(Fin AI公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03579 2025-02-07 cs.CY cs.HC 57%

A Mixed-Methods Evaluation of LLM-Based Chatbots for Menopause

Roshini Deva, Manvi S, Jasmine Zhou, Elizabeth Britton Chahine, Agena Davenport-Nicholson, Nadi Nina Kaonga, Selen Bozkurt, Azra Ismail

专题命中 安全评测 :safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03407 2025-02-06 cs.LG 57%

Detecting Strategic Deception Using Linear Probes

Nicholas Goldowsky-Dill, Bilal Chughtai, Stefan Heimersheim, Marius Hobbhahn

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Website: http://data.apolloresearch.ai/dd/ Code: http://www.github.com/ApolloResearch/deception-detection/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02710 2025-02-06 stat.ML cs.LG 57%

Achievable distributional robustness when the robust risk is only partially identified

Julia Kostin, Nicola Gnecco, Fanny Yang

机构 * ETH Zurich(苏黎世联邦理工学院) Gatsby Computational Neuroscience Unit, University College London(伦敦大学学院盖茨比计算神经科学单元) Imperial College London(帝国理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16718 2025-02-06 cs.LG 57%

Outlier Synthesis via Hamiltonian Monte Carlo for Out-of-Distribution Detection

Hengzhuang Li, Teng Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) School of Computer Science and Technology(计算机科学与技术学院) National Engineering Research Center for Big Data Technology and System(国家大数据技术与系统工程研究中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01992 2025-02-05 q-fin.TR cs.LG 57%

FinRLlama: A Solution to LLM-Engineered Signals Challenge at FinRL Contest 2024

Arnav Grover

机构 * Purdue University(普渡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments Competition Track FinRL, ICAIF 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01635 2025-02-04 cs.SE cs.AI 57%

The AI Agent Index

Stephen Casper, Luke Bailey, Rosco Hunter, Carson Ezell, Emma Cabalé, Michael Gerovitch, Stewart Slocum, Kevin Wei, Nikola Jurkovic, Ariba Khan, Phillip J. K. Christoffersen, A. Pinar Ozisik, Rakshit Trivedi, Dylan Hadfield-Menell, Noam Kolt

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) University of Warwick(华威大学) Harvard University(哈佛大学) Hebrew University(希伯来大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Accompanying website: https://aiagentindex.mit.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00826 2025-02-04 cs.CL 57%

Weak Supervision Dynamic KL-Weighted Diffusion Models Guided by Large Language Models

Julian Perry, Frank Sanders, Carter Scott

机构 * Delta University for Science and Technology(德尔塔科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13964 2025-02-04 cs.CV cs.AI cs.HC 57%

Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble

Lin Duan, Yanming Xiu, Maria Gorlatova

机构 * Duke University(杜克大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16484 2025-02-04 cs.LG 57%

Identifying Sub-networks in Neural Networks via Functionally Similar Representations

Tian Gao, Amit Dhurandhar, Karthikeyan Natesan Ramamurthy, Dennis Wei

机构 * IBM Research(IBM研究院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17942 2025-01-31 cs.CY cs.HC 57%

"I Would Never Trust Anything Western": Kumu (Educator) Perspectives on Use of LLMs for Culturally Revitalizing CS Education in Hawaiian Schools

Manas Mhasakar, Rachel Baker-Ramos, Ben Carter, Evyn-Bree Helekahi-Kaiwi, Josiah Hester

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16303 2025-01-29 cs.CL cs.IR 57%

RAPID: Retrieval-Augmented Parallel Inference Drafting for Text-Based Video Event Retrieval

Long Nguyen, Huy Nguyen, Bao Khuu, Huy Luu, Huy Le, Tuan Nguyen, Tho Quan

机构 * Ho Chi Minh City University of Technology (HCMUT)(胡志明市理工大学) Vietnam National University Ho Chi Minh City(胡志明市越南国家大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Under review at SoICT'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14144 2025-01-27 cs.CL 57%

Test-Time Code-Switching for Cross-lingual Aspect Sentiment Triplet Extraction

Dongming Sheng, Kexin Han, Hao Li, Yan Zhang, Yucheng Huang, Jun Lang, Wenqiang Liu

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13912 2025-01-24 cs.CL 57%

Analysis of Indic Language Capabilities in LLMs

Aatman Vaidya, Tarunima Prabhakar, Denny George, Swair Shah

机构 * Tattle Civic Tech India(塔特尔公民科技印度公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 17 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14876 2025-01-24 cs.CV cs.AI 57%

Precise and Robust Sidewalk Detection: Leveraging Ensemble Learning to Surpass LLM Limitations in Urban Environments

Ibne Farabi Shihab, Sudesh Ramesh Bhagat, Anuj Sharma

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12061 2025-01-22 cs.LG cs.MA 57%

Tackling Uncertainties in Multi-Agent Reinforcement Learning through Integration of Agent Termination Dynamics

Somnath Hazra, Pallab Dasgupta, Soumyajit Dey

机构 * IIT Kharagpur(印度理工学院卡哈拉格普尔分校) Synopsys(新思科技)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏