arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2503.05856 2025-03-11 cs.CL cs.AI 62%

This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs

Lorenz Wolf, Sangwoong Yoon, Ilija Bogunovic

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 35 pages, 9 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04283 2025-03-07 cs.LG cs.AI 62%

Explainable AI in Time-Sensitive Scenarios: Prefetched Offline Explanation Model

Fabio Michele Russo, Carlo Metta, Anna Monreale, Salvatore Rinzivillo, Fabio Pinelli

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Journal ref Discovery Science 2024, Springer Nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23825 2025-03-05 cs.CL cs.AI 62%

GlotCC: An Open Broad-Coverage CommonCrawl Corpus and Pipeline for Minority Languages

Amir Hossein Kargaran, François Yvon, Hinrich Schütze

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20657 2025-03-03 cs.AI cs.CL cs.DB 62%

Automatic database description generation for Text-to-SQL

Yingqi Gao, Zhiling Luo

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13211 2025-03-03 cs.RO cs.AI cs.CV cs.LG 62%

ManiSkill-HAB: A Benchmark for Low-Level Manipulation in Home Rearrangement Tasks

Arth Shukla, Stone Tao, Hao Su

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08351 2025-03-03 cs.CL cs.LG 62%

AutoBencher: Towards Declarative Benchmark Construction

Xiang Lisa Li, Farzaan Kaiyom, Evan Zheran Liu, Yifan Mai, Percy Liang, Tatsunori Hashimoto

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

Comments Accepted for publication at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22446 2025-02-28 cs.CL cs.AI 62%

Do Large Language Models Align with Core Mental Health Counseling Competencies?

Viet Cuong Nguyen, Mohammad Taher, Dongwan Hong, Vinicius Konkolics Possobom, Vibha Thirunellayi Gopalakrishnan, Ekta Raj, Zihang Li, Heather J. Soled, Michael L. Birnbaum, Srijan Kumar, Munmun De Choudhury

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 10 Pages, Accepted to Findings of NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15832 2025-02-27 cs.AR cs.CL cs.LG 62%

DeepRTL: Bridging Verilog Understanding and Generation with a Unified Representation Model

Yi Liu, Changran Xu, Yunhao Zhou, Zeju Li, Qiang Xu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments ICLR 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.01241 2025-02-27 cs.AI cs.HC cs.LG 62%

Diagrammatization and Abduction to Improve AI Interpretability With Domain-Aligned Explanations for Medical Diagnosis

Brian Y. Lim, Joseph P. Cahaly, Chester Y. F. Sng, Adam Chew

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments CHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18339 2025-02-26 cs.CL cs.LG 62%

Correlating and Predicting Human Evaluations of Language Models from Natural Language Processing Benchmarks

Rylan Schaeffer, Punit Singh Koura, Binh Tang, Ranjan Subramanian, Aaditya K Singh, Todor Mihaylov, Prajjwal Bhargava, Lovish Madaan, Niladri S. Chatterji, Vedanuj Goswami, Sergey Edunov, Dieuwke Hupkes, Sanmi Koyejo, Sharan Narang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17955 2025-02-26 cs.CL cs.AI 62%

Language Models' Factuality Depends on the Language of Inquiry

Tushar Aggarwal, Kumar Tanmay, Ayush Agrawal, Kumar Ayush, Hamid Palangi, Paul Pu Liang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10563 2025-02-26 cs.LG cs.CL 62%

Accelerating Unbiased LLM Evaluation via Synthetic Feedback

Zhaoyi Zhou, Yuda Song, Andrea Zanette

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20533 2025-02-26 cs.LG cs.CL 62%

Guiding Through Complexity: What Makes Good Supervision for Hard Math Reasoning Tasks?

Xuan He, Da Yin, Nanyun Peng

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments NAACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17643 2025-02-26 cs.AI cs.HC cs.LG cs.MA 62%

Socratic: Enhancing Human Teamwork via AI-enabled Coaching

Sangwon Seo, Bing Han, Rayan E. Harari, Roger D. Dias, Marco A. Zenati, Eduardo Salas, Vaibhav Unhelkar

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Extended version of an identically-titled paper accepted at AAMAS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14906 2025-02-24 cs.CL cs.AI 62%

Beyond Words: Exploring Cultural Value Sensitivity in Multimodal Models

Srishti Yadav, Zhi Zhang, Daniel Hershcovich, Ekaterina Shutova

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18444 2025-02-19 cs.CL cs.AI 62%

Is my Meeting Summary Good? Estimating Quality with a Multi-LLM Evaluator

Frederic Kirstein, Terry Ruas, Bela Gipp

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Journal ref COLING 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12197 2025-02-19 cs.CL cs.AI 62%

A Closer Look at System Prompt Robustness

Norman Mu, Jonathan Lu, Michael Lavery, David Wagner

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments Artifacts: https://github.com/normster/RealGuardrails

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11429 2025-02-18 cs.LG cs.CY 62%

What's in a Query: Polarity-Aware Distribution-Based Fair Ranking

Aparna Balagopalan, Kai Wang, Olawale Salaudeen, Asia Biega, Marzyeh Ghassemi

专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG

Comments Published in WWW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11269 2025-02-18 cs.AI cs.LG cs.SC 62%

Unlocking the Potential of Generative AI through Neuro-Symbolic Architectures: Benefits and Limitations

Oualid Bougzime, Samir Jabbar, Christophe Cruz, Frédéric Demoly

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments 54 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02028 2025-02-18 cs.CL cs.AI 62%

Fine-tuning Language Models for Recipe Generation: A Comparative Analysis and Benchmark Study

Anneketh Vij, Changhao Liu, Rahul Anil Nair, Theodore Eugene Ho, Edward Shi, Ayan Bhowmick

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 10 figures,14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12499 2025-02-18 cs.CL cs.AI 62%

LinguaLIFT: An Effective Two-stage Instruction Tuning Framework for Low-Resource Language Reasoning

Hongbin Zhang, Kehai Chen, Xuefeng Bai, Yang Xiang, Min Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10768 2025-02-18 cs.IR cs.AI cs.CL 62%

Evaluating improvements on using Large Language Models (LLMs) for property extraction in the Open Research Knowledge Graph (ORKG)

Sandra Schaftner

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10412 2025-02-18 cs.CY cs.AI 62%

Identifying relevant indicators for monitoring a National Artificial Intelligence Strategy

Renata Pelissari, Ricardo Suyama, Leonardo Tomazeli Duarte, Henrique Sá Earp

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08652 2025-02-14 cs.CY cs.AI 62%

LegalScore: Development of a Benchmark for Evaluating AI Models in Legal Career Exams in Brazil

Roberto Caparroz, Marcelo Roitman, Beatriz G. Chow, Caroline Giusti, Larissa Torhacs, Pedro A. Sola, João H. M. Diogo, Luiza Balby, Carolina D. L. Vasconcelos, Leonardo R. Caparroz, Albano P. Franco

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

Comments Main article 25 pages, Appendices from page 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07352 2025-02-14 cs.CL cs.AI cs.DL 62%

Bridging the Evaluation Gap: Leveraging Large Language Models for Topic Model Evaluation

Zhiyin Tan, Jennifer D'Souza

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments accepted by IRCDL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08468 2025-02-13 cs.CV cs.AI cs.CL 62%

mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data

Haonan Chen, Liang Wang, Nan Yang, Yutao Zhu, Ziliang Zhao, Furu Wei, Zhicheng Dou

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06884 2025-02-12 cs.LG cs.AI 62%

Learning Conformal Abstention Policies for Adaptive Risk Management in Large Language and Vision-Language Models

Sina Tayebati, Divake Kumar, Nastaran Darabi, Dinithi Jayasuriya, Ranganath Krishnan, Amit Ranjan Trivedi

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06279 2025-02-11 cs.CL cs.LG 62%

DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models

Utkarsh Tiwari, Aryan Seth, Adi Mukherjee, Kaavya Mer, Kavish, Dhruv Kumar

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07430 2025-02-11 cs.CL cs.AI 62%

Knowledge Graph Guided Evaluation of Abstention Techniques

Kinshuk Vasisht, Navreet Kaur, Danish Pruthi

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13237 2025-02-11 cs.CL cs.AI cs.CR 62%

Large Language Models are Easily Confused: A Quantitative Metric, Security Implications and Typological Analysis

Yiyi Chen, Qiongxiu Li, Russa Biswas, Johannes Bjerva

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 15 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏