arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-01 至 2025-12-01 共收录 72 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2510.13022 2025-12-01 cs.CL cs.AI cs.LG 75%

On the Role of Preference Variance in Preference Optimization

关于偏好方差在偏好优化中的作用

Jiacheng Guo, Zihao Li, Jiahao Qiu, Yue Wu, Mengdi Wang

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Princeton University(普林斯顿大学) AI Lab(人工智能实验室)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了偏好方差在偏好优化中的作用,发现高方差提示在训练大型语言模型时表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23436 2025-12-01 cs.AI 70%

Towards Continuous Intelligence Growth: Self-Training, Continual Learning, and Dual-Scale Memory in SuperIntelliAgent

迈向持续智能增长:在SuperIntelliAgent中实现自我训练、持续学习和双尺度记忆

Jianzhe Lin, Zeyu Pan, Yun Zhu, Ruiqi Song, Jining Yang

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 SuperIntelliAgent通过自我训练和双尺度记忆实现持续智能增长,利用可训练学习者与推理验证者配对,提升偏好对齐和学习效果。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22138 2025-12-01 cs.LG 70%

TinyLLM: Evaluation and Optimization of Small Language Models for Agentic Tasks on Edge Devices

TinyLLM: 小型语言模型在边缘设备上用于代理任务的评估与优化

Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta, Khalil Shujaee, Roy George

机构 * Department of Cyber-Physical Systems, Clark Atlanta University, USA(计算机物理系统系,Clark Atlanta大学,美国) Department of Computer Science and Engineering, United International University, Bangladesh(计算机科学与工程系,联合国际大学,孟加拉国)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 TinyLLM研究小型语言模型在边缘设备上执行代理任务的优化方法,通过混合策略提升准确性与效率,验证了中等规模模型在多轮任务中的优势。

Comments 8 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04340 2025-12-01 cs.LG cs.HC 70%

Interactive Groupwise Comparison for Reinforcement Learning from Human Feedback

基于交互式组间比较的强化学习从人类反馈中学习

Jan Kompatscher, Danqing Shi, Giovanna Varni, Tino Weinkauf, Antti Oulasvirta

机构 * Aalto University(阿尔托大学) University of Cambridge(剑桥大学) University of Trento(特伦特大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出交互式组间比较方法,通过可视化和主动学习提升强化学习从人类反馈中学习的奖励和策略效果。

Comments 10 pages, 8 figures in proceedings of Computer Graphics Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21748 2025-12-01 cs.CL cs.AI 62%

Building Domain-Specific Small Language Models via Guided Data Generation

通过引导数据生成构建领域专用小型语言模型

Aman Kumar, Ekant Muljibhai Amin, Xian Yeow Lee, Lasitha Vidyaratne, Ahmed K. Farahat, Dipanjan D. Ghosh, Yuta Koreeda, Chetan Gupta

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种通过引导数据生成构建领域专用小型语言模型的方法,结合领域适应预训练、监督微调和偏好优化,展示了在工业诊断任务中优于开源模型的性能。

Comments Accepted at Thirty-Eighth Annual Conference on Innovative Applications of Artificial Intelligence (IAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21725 2025-12-01 cs.CL cs.AI 62%

PromptTailor: Multi-turn Intent-Aligned Prompt Synthesis for Lightweight LLMs

PromptTailor: 为轻量级大语言模型进行多轮意图对齐的提示合成

Yizhou Xu, Janet Davis

机构 * Whitman College(惠特曼学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 PromptTailor通过意图对齐的提示合成提升轻量级大语言模型的输出质量,以更少的模型调用次数实现更高的用户偏好率。

Comments EMNLP 2025 Workshop PALS. Additional note: There is a citation error on Evoke. The paper we are referring to is "Evoking critical thinking abilities in LLMs via reviewer-author prompt editing."

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 12 篇

2511.21718 2025-12-01 cs.CL 85%

When Harmless Words Harm: A New Threat to LLM Safety via Conceptual Triggers

有害词语的危害:通过概念触发器对LLM安全性的新威胁

Zhaoxin Zhang, Borui Chen, Yiming Hu, Youyang Qu, Tianqing Zhu, Longxiang Gao

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出MICM方法,通过概念触发器针对LLM的价值结构进行劫持,揭示了现有安全机制对隐含价值观操控的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23174 2025-12-01 cs.CL 83%

Are LLMs Good Safety Agents or a Propaganda Engine?

LLMs是安全代理还是宣传引擎?

Neemesh Yadav, Francesco Ortu, Jiarui Liu, Joeun Yook, Bernhard Schölkopf, Rada Mihalcea, Alberto Cazzaniga, Zhijing Jin

机构 * SMU University of Trieste(特里este大学) AREA Science Park(AREA科学园) CMU(卡内基梅隆大学) University of Toronto(多伦多大学) Vector Institute(向量研究所) MPI for Intelligent Systems(智能系统研究所) University of Michigan(密歇根大学)

专题命中 安全训练 :safety(title,abstract);prompt injection(abstract);分类 cs.CL

AI总结 本文通过PSP数据集研究LLMs在政治敏感内容上的拒绝行为,发现大多数模型存在审查倾向,并分析了影响拒绝分布的关键因素。

Comments 15 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22738 2025-12-01 cs.LG cs.CR 79%

ShieldAgent: Shielding Agents via Verifiable Safety Policy Reasoning

ShieldAgent: 通过可验证的安全策略推理实现安全代理

Zhaorun Chen, Mintong Kang, Bo Li

机构 * University of Chicago, Chicago IL, USA(芝加哥大学) University of Illinois at Urbana-Champaign, Champaign IL, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 ShieldAgent通过逻辑推理实现对代理动作轨迹的安全策略合规性,有效提升代理防护性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23300 2025-12-01 cs.RO 67%

SafeHumanoid: VLM-RAG-driven Control of Upper Body Impedance for Humanoid Robot

SafeHumanoid: 通过VLM-RAG驱动的人形机器人上半身阻抗控制

Yara Mahmoud, Jeffrin Sam, Nguyen Khang, Marcelino Fernando, Issatay Tokmurziyev, Miguel Altamirano Cabrera, Muhammad Haris Khan, Artem Lykov, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯克洛尔沃科学与技术研究所)

专题命中 安全训练 :safety(abstract);trustworthy(abstract)

AI总结 SafeHumanoid通过VLM-RAG结合自身视觉,实现人形机器人上半身阻抗控制,提升人机交互的安全性与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23311 2025-12-01 cs.CV cs.AI cs.CL 62%

Toward Automatic Safe Driving Instruction: A Large-Scale Vision Language Model Approach

迈向自动安全驾驶指令:一种大规模视觉语言模型方法

Haruki Sakajo, Hiroshi Takato, Hiroshi Tsutsui, Komei Soda, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) Teatis inc.(Teatis公司) Queensland university of technology(昆士兰理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种大规模视觉语言模型方法,用于生成安全驾驶指令,通过构建数据集并评估模型性能,展示了微调模型在自动驾驶安全中的应用与挑战。

Comments Accepted to MMLoSo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23315 2025-12-01 cs.LG 57%

Emergent Coordination and Phase Structure in Independent Multi-Agent Reinforcement Learning

独立多智能体强化学习中的涌现协调与相结构

Azusa Yamaguchi

机构 * School of Physics and Astronomy University of Edinburgh(物理与天文学学院 英格兰爱丁堡大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究通过分析独立多智能体强化学习中的协调与相结构,揭示了规模、密度和内核漂移之间的相互作用对多智能体学习系统动态的影响。

Comments 22 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23193 2025-12-01 cs.RO cs.LG cs.SY eess.SY 57%

Fault-Tolerant MARL for CAVs under Observation Perturbations for Highway On-Ramp Merging

面向高速公路汇入车道的抗观测扰动多智能体强化学习故障容错方法

Yuchen Shi, Huaxin Pei, Yi Zhang, Danya Yao

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(北京信息科学与技术国家研究中心(BNRist),清华大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种面向高速公路汇入车道的抗观测扰动多智能体强化学习故障容错方法,通过对抗性扰动生成和故障容忍智能体设计,提升协同驾驶系统的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22737 2025-12-01 cs.AI cs.HC 57%

Agentic AI Framework for Individuals with Disabilities and Neurodivergence: A Multi-Agent System for Healthy Eating, Daily Routines, and Inclusive Well-Being

具有残疾和神经多样性个体的代理AI框架:一个用于健康饮食、日常习惯和包容性福祉的多代理系统

Salman Jan, Toqeer Ali Syed, Gohar Ali, Ali Akarma, Mohammad Riyaz Belgaum, Ahmad Ali

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种多代理系统,通过个性化营养、适应性调度、食品指导和生理监测等代理,为残疾和神经多样性个体提供健康饮食、日常习惯和包容性福祉的AI框架。

Comments Presented at International Conference on Business and Digital Technology, Bahrain, Springer Nature, 27 November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22312 2025-12-01 cs.CL 57%

Token-Level Marginalization for Multi-Label LLM Classifiers

标记级边际化用于多标签LLM分类器

Anjaneya Praharaj, Jaykumar Kasundra

机构 * ServiceNow

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出三种标记级概率估计方法,提升生成模型在多标签内容安全分类中的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21395 2025-12-01 cs.CV cs.AI 57%

Monet: Reasoning in Latent Visual Space Beyond Images and Language

Monet: 在图像和语言之外的潜在视觉空间推理

Qixun Wang, Yang Shi, Yifei Wang, Yuanxing Zhang, Pengfei Wan, Kun Gai, Xianghua Ying, Yisen Wang

机构 * Peking University(北京大学) Kling Team(Kling团队) Amazon AGI SF Lab(Amazon AGI SF实验室) MIT(麻省理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 Monet通过在潜在视觉空间中直接推理,提升多模态大语言模型的视觉推理能力,解决了潜在-视觉对齐和嵌入监督不足的问题,展示了在现实世界和抽象视觉任务中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22609 2025-12-01 cs.CV cs.RO 50%

MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory

MG-Nav:基于稀疏空间记忆的双尺度视觉导航

Bo Wang, Jiehong Lin, Chenzhi Liu, Xinting Hu, Yifei Yu, Tianjia Liu, Zhongrui Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 安全训练 :alignment(abstract)

AI总结 MG-Nav通过稀疏空间记忆图和VGGT-adapter模块实现双尺度视觉导航,结合全局规划与局部控制,实现零样本导航的高鲁棒性与高性能。

Comments 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12099 2025-12-01 cs.CV 50%

TinyRS-R1: Compact Multimodal Language Model for Remote Sensing

TinyRS-R1:用于遥感的紧凑多模态语言模型

Aybora Koksal, A. Aydin Alatan

机构 * Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中欧技术大学(METU)电子与电气工程系)

专题命中 安全训练 :alignment(abstract)

AI总结 TinyRS-R1是一种专为遥感设计的紧凑多模态语言模型,通过四阶段训练实现高效性能,兼具推理增强与低资源消耗。

Comments Accepted to IEEE Geoscience and Remote Sensing Letters (GRSL). Code, models, and the captions for datasets are available at https://github.com/aybora/TinyRS

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2511.21757 2025-12-01 cs.CY cs.AI cs.CL cs.CR 85%

Medical Malice: A Dataset for Context-Aware Safety in Healthcare LLMs

医疗恶意:用于医疗LLM中情境感知安全的数据库

Andrew Maranhão Ventura D'addario

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 Medical Malice提出一个情境感知安全的医疗数据库,通过对抗性提示和伦理推理提升医疗LLM的安全性,以应对医疗领域复杂且系统性的威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21749 2025-12-01 cs.CL cs.AI 73%

Proactive Defense: Compound AI for Detecting Persuasion Attacks and Measuring Inoculation Effectiveness

主动防御:用于检测说服攻击并衡量免疫效果的复合AI

Svitlana Volkova, Will Dupree, Hsien-Te Kao, Peter Bautista, Gabe Ganberg, Jeff Beaubien, Laura Cassani

机构 * Aptima, Inc.(Aptima公司)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BRIES复合AI架构,通过专门代理检测说服攻击并评估免疫效果,揭示不同模型在处理说服语言上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22044 2025-12-01 cs.CR cs.AI 70%

Distillability of LLM Security Logic: Predicting Attack Success Rate of Outline Filling Attack via Ranking Regression

LLM安全逻辑的可蒸馏性:通过排序回归预测轮廓填充攻击的成功率

Tianyu Zhang, Zihang Xi, Jingyu Hua, Sheng Zhong

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文通过排序回归方法,研究LLM安全逻辑的可蒸馏性,提出改进的轮廓填充攻击以预测攻击成功率,实验表明代理模型在预测安全边界方面具有较高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2511.21990 2025-12-01 cs.LG cs.AI cs.CR 84%

A Safety and Security Framework for Real-World Agentic Systems

面向现实世界代理系统的安全与安全框架

Shaona Ghosh, Barnaby Simkin, Kyriacos Shiarlis, Soumili Nandi, Dan Zhao, Matthew Fiedler, Julia Bazinska, Nikki Pope, Roopa Prabhu, Daniel Rohrer, Michael Demoret, Bartley Richardson

机构 * NVIDIA Lakera AI

专题命中 红队测试 :safety(title,abstract);red teaming(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种动态框架,通过用户安全视角识别新型代理风险,并通过红队行动和案例研究验证其在企业级代理系统中的安全性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 8 篇

2511.23031 2025-12-01 cs.CV cs.AI 70%

From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning

从幻觉到意图:用于视觉-语言推理的视觉理由学习

Changpeng Wang, Haozhe Wang, Xi Chen, Junhan Liu, Taofeng Xue, Chong Peng, Donglian Qi, Fangzhen Lin, Yunfeng Yan

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Meituan(美团)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出视觉理由学习(ViRL),通过将视觉动作作为核心推理元素,提升视觉-语言推理模型的透明度和可信度。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22351 2025-12-01 cs.CV 67%

INSIGHT: An Interpretable Neural Vision-Language Framework for Reasoning of Generative Artifacts

INSIGHT: 一种可解释的神经视觉-语言框架,用于生成性艺术作品的推理

Anshul Bagaria

机构 * Indian Institute of Technology, Madras, Tamil Nadu, India(印度理工学院Madras分校,泰米尔纳德州,印度)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract)

AI总结 INSIGHT提出了一种可解释的神经视觉-语言框架,通过多尺度定位、语义对齐和结构化提示协议,实现对生成性艺术作品的鲁棒检测与透明解释。

Comments 36 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21762 2025-12-01 cs.CL cs.AI 62%

Factors That Support Grounded Responses in LLM Conversations: A Rapid Review

支持LLM对话中基础响应的因素:一项快速回顾

Gabriele Cesar Iwashima, Claudia Susie Rodrigues, Claudio Dipolitto, Geraldo Xexéo

机构 * (June 2025)((2025年6月))

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过快速回顾识别了支持LLM对话中基础响应的因素,重点分析了推理时间、训练后及强化学习方法,旨在提升LLM响应的准确性和可靠性。

Comments 28 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23440 2025-12-01 cs.LG cs.AR cs.DC stat.ML 57%

Accelerated Execution of Bayesian Neural Networks using a Single Probabilistic Forward Pass and Code Generation

利用单次概率前向传递和代码生成加速贝叶斯神经网络

Bernhard Klein, Falk Selker, Hendrik Borras, Sophie Steger, Franz Pernkopf, Holger Fröning

机构 * Heidelberg University(海德堡大学) Graz University of Technology(格拉茨技术大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于概率前向传递和代码生成的方法,显著提升贝叶斯神经网络在嵌入式系统中的计算效率和部署性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22004 2025-12-01 stat.ML cs.LG 57%

On the Effect of Regularization on Nonparametric Mean-Variance Regression

关于正则化对非参数均方回归的影响

Eliot Wong-Toi, Alex Boyd, Vincent Fortuin, Stephan Mandt

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文研究了正则化对非参数均方回归模型的影响,通过统计场理论框架揭示了正则化驱动的相变现象,并展示了在UCI和ClimSim数据集上的鲁棒校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21705 2025-12-01 cs.CL cs.CV 57%

Insight-A: Attribution-aware for Multimodal Misinformation Detection

Insight-A: 多模态虚假信息检测中的归因意识

Junjie Wu, Yumeng Fu, Chen Gong, Guohong Fu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 Insight-A通过归因意识和分层推理提升多模态虚假信息检测效果,有效识别伪造来源并增强跨模态一致性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00259 2025-12-01 cs.CL 57%

AutoHall: Automated Factuality Hallucination Dataset Generation for Large Language Models

AutoHall: 自动化生成大语言模型的事实性幻觉数据集

Zouying Cao, Yifei Yang, XiaoJing Li, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(上海可信数据流通与治理Web3重点实验室) School of Media & Communication, Shanghai Jiao Tong University(媒体与传播学院,上海交通大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 AutoHall通过自动化生成模型特定的幻觉数据集,提升大语言模型的事实性内容检测能力。

Comments Accepted by IEEE Transactions on Audio, Speech, and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22746 2025-12-01 cs.HC 50%

Epistemic Fragility in Large Language Models: Prompt Framing Systematically Modulates Misinformation Correction

大型语言模型中的知识脆弱性:提示框架系统性地调节 misinformation 的纠正

Sekoul Krastev, Hilary Sweatman, Anni Sternisko, Steve Rathje

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 研究发现提示框架对大型语言模型纠正虚假信息的能力有显著影响,揭示了模型在知识准确性上的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏