arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8034 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8034 篇

2502.08482 2025-02-13 cs.CL cs.AI cs.LG 67%

Enhancing Auto-regressive Chain-of-Thought through Loop-Aligned Reasoning

Qifan Yu, Zhenyu He, Sijie Li, Xun Zhou, Jun Zhang, Jingjing Xu, Di He

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02040 2025-02-05 cs.CL cs.AI cs.LG 67%

M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference

Nikhil Bhendawade, Mahyar Najibi, Devang Naik, Irina Belousova

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08019 2025-01-15 cs.LG cs.AI cs.CY 67%

An AI-driven framework for rapid and localized optimizations of urban open spaces

Pegah Eshraghi, Arman Nikkhah Dehnavi, Maedeh Mirdamadi, Riccardo Talami, Zahra-Sadat Zomorodian

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09308 2025-01-15 cs.CL cs.AI cs.LG q-bio.NC 67%

Divergences between Language Models and Human Brains

Yuchen Zhou, Emmy Liu, Graham Neubig, Michael J. Tarr, Leila Wehbe

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03700 2025-01-10 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

OneLLM: One Framework to Align All Modalities with Language

Jiaming Han, Kaixiong Gong, Yiyuan Zhang, Jiaqi Wang, Kaipeng Zhang, Dahua Lin, Yu Qiao, Peng Gao, Xiangyu Yue

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by CVPR 2024. Code: https://github.com/csuhan/OneLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02739 2025-01-07 cs.CL cs.AI cs.LG 67%

TARDiS : Text Augmentation for Refining Diversity and Separability

Kyungmin Kim, SangHun Im, GiBaeg Kim, Heung-Seon Oh

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11303 2024-12-30 cs.LG cs.AI cs.CL 67%

TSDS: Data Selection for Task-Specific Model Finetuning

Zifan Liu, Amin Karbasi, Theodoros Rekatsinas

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 31 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14546 2024-12-24 cs.CL cs.AI cs.LG 67%

Connecting the Dots: LLMs can Infer and Verbalize Latent Structure from Disparate Training Data

Johannes Treutlein, Dami Choi, Jan Betley, Samuel Marks, Cem Anil, Roger Grosse, Owain Evans

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2024. 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10893 2024-12-17 cs.CL cs.AI cs.LG 67%

BgGPT 1.0: Extending English-centric LLMs to other languages

Anton Alexandrov, Veselin Raychev, Dimitar I. Dimitrov, Ce Zhang, Martin Vechev, Kristina Toutanova

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05231 2024-12-13 cs.CY cs.CL cs.LG 67%

Evaluating GPT-4 at Grading Handwritten Solutions in Math Exams

Adriana Caraeni, Alexander Scarlatos, Andrew Lan

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG

Comments Published in LAK 2025: The 15th International Learning Analytics and Knowledge Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01708 2024-12-03 cs.CL cs.AI cs.HC cs.LG 67%

Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review

Rui Ye, Xianghe Pang, Jingyi Chai, Jiaao Chen, Zhenfei Yin, Zhen Xiang, Xiaowen Dong, Jing Shao, Siheng Chen

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 27 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17593 2024-12-03 cs.CL cs.AI cs.LG 67%

What Differentiates Educational Literature? A Multimodal Fusion Approach of Transformers and Computational Linguistics

Jordan J. Bird

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10153 2024-11-27 cs.CL cs.CY cs.LG 67%

Diagnosing Hate Speech Classification: Where Do Humans and Machines Disagree, and Why?

Xilin Yang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14254 2024-11-22 cs.LG cs.AI cs.CY 67%

BERT-Based Approach for Automating Course Articulation Matrix Construction with Explainable AI

Natenaile Asmamaw Shiferaw, Simpenzwe Honore Leandre, Aman Sinha, Dillip Rout

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05200 2024-11-11 cs.CY cs.CL cs.HC cs.LG 67%

Toward Cultural Interpretability: A Linguistic Anthropological Framework for Describing and Evaluating Large Language Models (LLMs)

Graham M. Jones, Shai Satran, Arvind Satyanarayan

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG

Comments Accepted for publication in Big Data & Society, November 2, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00593 2024-11-07 cs.CL cs.AI cs.LG 67%

Adapting Language Models via Token Translation

Zhili Feng, Tanya Marwah, Nicolo Fusi, David Alvarez-Melis, Lester Mackey

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05241 2024-11-01 cs.CL cs.AI cs.CY cs.ET cs.GT 67%

Large Model Strategic Thinking, Small Model Efficiency: Transferring Theory of Mind in Large Language Models

Nunzio Lore, Sepehr Ilami, Babak Heydari

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20036 2024-10-29 cs.CL cs.AI cs.LG 67%

Architectural Flaw Detection in Civil Engineering Using GPT-4

Saket Kumar, Abul Ehtesham, Aditi Singh, Tala Talaei Khoei

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12841 2024-10-21 cs.CL cs.AI cs.HC cs.LG 67%

UniAutoML: A Human-Centered Framework for Unified Discriminative and Generative AutoML with Large Language Models

Jiayi Guo, Zan Chen, Yingrui Ji, Liyun Zhang, Daqin Luo, Zhigang Li, Yiqin Shen

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13086 2024-10-18 cs.CL cs.AI cs.LG 67%

Reverse-Engineering the Reader

Samuel Kiegeland, Ethan Gotlieb Wilcox, Afra Amini, David Robert Reich, Ryan Cotterell

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12242 2024-10-11 cs.CL cs.AI cs.LG 67%

Reference-based Metrics Disprove Themselves in Question Generation

Bang Nguyen, Mengxia Yu, Yun Huang, Meng Jiang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024 Findings - Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04074 2024-10-08 cs.CL cs.AI cs.LG 67%

On Eliciting Syntax from Language Models via Hashing

Yiran Wang, Masao Utiyama

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03884 2024-10-08 cs.CL cs.AI cs.CY cs.HC 67%

KidLM: Advancing Language Models for Children -- Early Insights and Future Directions

Mir Tafseer Nayeem, Davood Rafiei

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted to EMNLP 2024 (long, main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02795 2024-10-07 cs.CY cs.AI cs.CL 67%

TaCIE: Enhancing Instruction Comprehension in Large Language Models through Task-Centred Instruction Evolution

Jiuding Yang, Shengyao Lu, Weidong Guo, Xiangyang Li, Kaitong Yang, Yu Xu, Di Niu

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09253 2024-09-17 cs.IR cs.AI cs.CL cs.LG 67%

Unleash LLMs Potential for Recommendation by Coordinating Twin-Tower Dynamic Semantic Token Generator

Jun Yin, Zhengxin Zeng, Mingzheng Li, Hao Yan, Chaozhuo Li, Weihao Han, Jianjin Zhang, Ruochen Liu, Allen Sun, Denvy Deng, Feng Sun, Qi Zhang, Shirui Pan, Senzhang Wang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20578 2024-09-17 cs.CL cs.AI cs.CY 67%

Comparison of Large Language Models for Generating Contextually Relevant Questions

Ivo Lodovico Molina, Valdemar Švábenský, Tsubasa Minematsu, Li Chen, Fumiya Okubo, Atsushi Shimada

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Published in Springer ECTEL 2024 conference proceedings, see https://doi.org/10.1007/978-3-031-72312-4_18

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05783 2024-09-04 cs.CY cs.AI cs.CL cs.CV 67%

A Survey on Responsible Generative AI: What to Generate and What Not

Jindong Gu

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 77 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07377 2024-08-16 cs.CL cs.AI cs.CY 67%

Do GPT Language Models Suffer From Split Personality Disorder? The Advent Of Substrate-Free Psychometrics

Peter Romero, Stephen Fitz, Teruo Nakatsuma

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 37 pages, 7 figures, 3 tables, date v1: Mar 26 2023; replaced with new version; reason: removed journal logo from older version of article that is no longer valid

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04652 2024-08-12 cs.CL cs.AI cs.LG 67%

Leveraging Large Language Models with Chain-of-Thought and Prompt Engineering for Traffic Crash Severity Analysis and Inference

Hao Zhen, Yucheng Shi, Yongcan Huang, Jidong J. Yang, Ninghao Liu

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 20 pages, 12 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01249 2024-08-06 cs.AI cs.CL cs.LG 67%

Large AI Model Empowered Multimodal Semantic Communications

Feibo Jiang, Li Dong, Yubo Peng, Kezhi Wang, Kun Yang, Cunhua Pan, Xiaohu You

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by IEEE CM

详情

展开后加载摘要…

URL PDF HTML 收藏