arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-19 至 2025-09-19 共收录 31 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2507.05129 2025-09-19 cs.CL cs.CY cs.LG 75%

SMART: Simulated Students Aligned with Item Response Theory for Question Difficulty Prediction

Alexander Scarlatos, Nigel Fernandez, Christopher Ormerod, Susan Lottridge, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Cambium Assessment(Cambium评估)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.CY、cs.LG

Comments Published in EMNLP 2025: The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20415 2025-09-19 cs.CL 57%

Enhancing Logical Reasoning in Language Models via Symbolically-Guided Monte Carlo Process Supervision

Xingwei Tan, Marco Valentino, Mahmud Akhter, Maria Liakata, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦大学玛丽女王学院电子工程与计算机科学学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments EMNLP 2025 (Main), 9+6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19176 2025-09-19 cs.CL 57%

Assistant-Guided Mitigation of Teacher Preference Bias in LLM-as-a-Judge

Zhuo Liu, Moxin Li, Xun Deng, Qifan Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meta AI

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05154 2025-09-19 cs.CL 57%

CARE: Multilingual Human Preference Learning for Cultural Awareness

Geyang Guo, Tarek Naous, Hiromi Wakaki, Yukiko Nishimura, Yuki Mitsufuji, Alan Ritter, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Sony Group Corporation(索尼集团) Sony AI(索尼人工智能)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2509.15202 2025-09-19 cs.CR 89%

Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction

Yuanbo Xie, Yingjie Zhang, Tianyun Liu, Duohe Ma, Tingwen Liu

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract)

Comments Accepted by EMNLP2025 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15154 2025-09-19 cs.CV 50%

MedFact-R1: Towards Factual Medical Reasoning via Pseudo-Label Augmentation

Gengliang Li, Rongyu Chen, Bin Li, Linlin Yang, Guodong Ding

机构 * Baosight(博思特) NUS(新加坡国立大学) SIAT(深圳先进技术研究院) CUC(中国科学技术大学) Microsoft(微软) ANU(澳大利亚国立大学)

专题命中 安全训练 :trustworthy(abstract)

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15099 2025-09-19 eess.SY cs.SY 50%

Digital Twin-based Cooperative Autonomous Driving in Smart Intersections: A Multi-Agent Reinforcement Learning Approach

Taoyuan Yu, Kui Wang, Zongdian Li, Tao Yu, Kei Sakaguchi, Walid Saad

专题命中 安全训练 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 红队测试 1 篇

2509.14651 2025-09-19 cs.CL cs.AI 88%

MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models

Siyu Yan, Long Zeng, Xuecheng Wu, Chengcheng Han, Kongcheng Zhang, Chong Peng, Xuezhi Cao, Xunliang Cai, Chenjuan Guo

机构 * East China Normal University(东华大学) Xi’an Jiaotong University(西安交通大学) Meituan(美团) Zhejiang University(浙江大学)

专题命中 红队测试 :safety(title,abstract);red teaming(title);alignment(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2509.14271 2025-09-19 cs.CR cs.LG 79%

Early Approaches to Adversarial Fine-Tuning for Prompt Injection Defense: A 2022 Study of GPT-3 and Contemporary Models

Gustavo Sandoval, Denys Fenchenko, Junyao Chen

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2410.10901 2025-09-19 cs.LG cs.AI cs.CL 67%

3DS: Medical Domain Adaptation of LLMs via Decomposed Difficulty-based Data Selection

Hongxin Ding, Yue Fang, Runchuan Zhu, Xinke Jiang, Jinyang Zhang, Yongxin Xu, Xu Chu, Junfeng Zhao, Yasha Wang

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) National Engineering Research Center for Software Engineering, Peking University, China(软件工程国家级工程研究中心) Big Data Technology Research Center, Nanhu Laboratory, Jiaxing, China(南湖实验室大数据技术研究中心) Peking University Information Technology Institute, Tianjin Binhai, China(北京大学信息科学技术研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14084 2025-09-19 cs.CV 50%

AD-DINOv3: Enhancing DINOv3 for Zero-Shot Anomaly Detection with Anomaly-Aware Calibration

Jingyi Yuan, Jianxiong Ye, Wenkang Chen, Chenqiang Gao

机构 * School of Intelligent Systems Engineering, Sun Yat-Sen University(智能系统工程学院,中山大学)

专题命中 幻觉与事实性 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 13 篇

2509.14956 2025-09-19 cs.AI cs.MA 79%

Sentinel Agents for Secure and Trustworthy Agentic AI in Multi-Agent Systems

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI Tesisquare(Tesisquare人工智能负责人) Voiceinteroperability.ai Initiative Member(Voiceinteroperability.ai 创始成员) Linux Foundation AI & Data(Linux基金会人工智能与数据) AI & Data Torino, TO 10100, Italy(人工智能与数据Torino, TO 10100, Italy) Principal Conversational Technologies(对话技术首席专家) Plymouth Meeting, Pennsylvania, USA(美国宾夕法尼亚州Plymouth Meeting)

专题命中 安全评测 :trustworthy(title);prompt injection(abstract);分类 cs.AI

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14446 2025-09-19 q-bio.NC 78%

Mouse vs. AI: A Neuroethological Benchmark for Visual Robustness and Neural Alignment

Marius Schneider, Joe Canzano, Jing Peng, Yuchen Hou, Spencer LaVere Smith, Michael Beyeler

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14396 2025-09-19 econ.TH cs.GT 71%

Friend or Foe: Delegating to an AI Whose Alignment is Unknown

Drew Fudenberg, Annie Liang

专题命中 安全评测 :alignment(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12476 2025-09-19 cs.CL 70%

Audited Reasoning Refinement: Fine-Tuning Language Models via LLM-Guided Step-Wise Evaluation and Correction

Sumanta Bhattacharyya, Sara Riazi, Pedram Rooshenas

专题命中 安全评测 :alignment(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14199 2025-09-19 cs.CV cs.AI cs.CL cs.LG 67%

Dense Video Understanding with Gated Residual Tokenization

Haichao Zhang, Wenhao Chai, Shwai He, Ang Li, Yun Fu

机构 * Northeastern University(东北大学) Princeton University(普林斯顿大学) University of Maryland(马里兰大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14930 2025-09-19 cs.CL cs.AI 62%

Cross-Modal Knowledge Distillation for Speech Large Language Models

Enzhi Wang, Qicheng Li, Zhiyuan Tang, Yuhang Jia

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国) Tencent Ethereal Audio Lab, Tencent Corporation, Shenzhen, China(腾讯虚实音频实验室,腾讯公司,深圳,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07054 2025-09-19 cs.AI cs.LG stat.ME 62%

Statistical Methods in Generative AI

Edgar Dobriban

机构 * Edgar Dobriban 1(Edgar Dobriban)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments Invited review paper for Annual Review of Statistics and Its Application. Feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20020 2025-09-19 cs.LG cs.AI 62%

Modular Machine Learning: An Indispensable Path towards New-Generation Large Language Models

Xin Wang, Haoyang Li, Haibo Chen, Zeyang Zhang, Wenwu Zhu

机构 * Department of Computer Science and Technology, BNRist, Tsinghua University(计算机科学与技术系,BNRist,清华大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14936 2025-09-19 cs.LG 57%

A Comparative Analysis of Transformer Models in Social Bot Detection

Rohan Veit, Michael Lones

机构 * Department of Computer Science, Heriot-Watt University(计算机科学系,赫瑞斯学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments To appear in proceedings of UKCI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14304 2025-09-19 cs.SD cs.AI eess.AS 57%

Deploying UDM Series in Real-Life Stuttered Speech Applications: A Clinical Evaluation Framework

Eric Zhang, Li Wei, Sarah Chen, Michael Wang

机构 * SSHealth Team(SSHealth团队) AI for Healthcare Laboratory(人工智能医疗实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16538 2025-09-19 cs.CL 57%

Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models

Ercong Nie, Helmut Schmid, Hinrich Schütze

机构 * Center for Information and Language Processing (CIS)(信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15068 2025-09-19 cs.HC 50%

Learning in Context: Personalizing Educational Content with Large Language Models to Enhance Student Learning

Joy Jia Yin Lim, Daniel Zhang-Li, Jifan Yu, Xin Cong, Ye He, Zhiyuan Liu, Huiqin Liu, Lei Hou, Juanzi Li, Bin Xu

专题命中 安全评测 :trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14739 2025-09-19 cs.CV 50%

FMGS-Avatar: Mesh-Guided 2D Gaussian Splatting with Foundation Model Priors for 3D Monocular Avatar Reconstruction

Jinlong Fan, Bingyu Hu, Xingguang Li, Yuxiang Yang, Jing Zhang

机构 * HangZhou Dianzi University(杭州电子大学) Shenzhen Polytechnic University(深圳职业技术大学) WuHan University(武汉大学)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 7 篇

2509.10685 2025-09-19 cs.CL cs.AI cs.LG 82%

Pluralistic Alignment for Healthcare: A Role-Driven Framework

Jiayou Zhong, Anudeex Shetty, Chao Jia, Xuanrui Lin, Usman Naseem

机构 * Cheriton School of Computer Science, University of Waterloo(滑铁卢大学计算机科学学院) School of Computing, FSE, Macquarie University(麦觉大学计算机学院) School of Computing and Information System, the University of Melbourne(墨尔本大学计算机与信息系统学院) Rajax Network Technology (ele.me), China(中国Rajax网络技术(饿了么)) Alibaba Cloud Computing, Alibaba Group, China(中国阿里云 computing,阿里集团)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 (Main Proceedings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14735 2025-09-19 cs.CL 79%

Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM

Chenkun Tan, Pengyu Wang, Shaojun Zhou, Botian Jiang, Zhaowei Li, Dong Zhang, Xinghao Wang, Yaqian Zhou, Xipeng Qiu

机构 * Fudan University(复旦大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

Comments Accepted by Findings of EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14738 2025-09-19 cs.CL 57%

UnifiedVisual: A Framework for Constructing Unified Vision-Language Datasets

Pengyu Wang, Shaojun Zhou, Chenkun Tan, Xinghao Wang, Wei Huang, Zhen Ye, Zhaowei Li, Botian Jiang, Dong Zhang, Xipeng Qiu

机构 * Fudan University(复旦大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

Comments Accepted by Findings of EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14554 2025-09-19 cs.CY 57%

Generative Large Language Models for Knowledge Representation: A Systematic Review of Concept Map Generation

Xiaoming Zhai

专题命中 其他安全 :alignment(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21830 2025-09-19 cs.AI 57%

DualSG: A Dual-Stream Explicit Semantic-Guided Multivariate Time Series Forecasting Framework

Kuiye Ding, Fanda Fan, Yao Wang, Ruijie jian, Xiaorui Wang, Luqi Gong, Yishan Jiang, Chunjie Luo, Jianfeng Zhan

机构 * SKL of Processors, Institute of Computing Technology, Chinese Academy of Sciences(处理器国家重点实验室,计算技术研究所,中国科学院) Fu Foundation School of Engineering and Applied Science, Columbia University(工程与应用科学学院,哥伦比亚大学) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang Lab(浙江实验室) Beijing University of Technology(北京理工大学) Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments This paper has been accepted by ACM Multimedia 2025 (ACM MM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15703 2025-09-19 cs.MA cs.AI 57%

Predicting Multi-Agent Specialization via Task Parallelizability

Elizabeth Mieczkowski, Ruaridh Mon-Williams, Neil Bramley, Christopher G. Lucas, Natalia Velez, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) University of Edinburgh(爱丁堡大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏