arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2510.05748 2026-03-12 cs.LG 57%

Communication Enables Cooperation in LLM Agents: A Comparison with Curriculum-Based Approaches

通信使LLM代理协作:与基于课程的方法的比较

Hachem Madmoun, Salem Lahlou

机构 * MBZUAI(穆扎布伊人工智能研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文通过比较直接通信与课程学习方法,发现通信在促进LLM代理合作中更有效,而课程学习可能因设计选择影响对齐目标。

Comments Published in EACL 2026 - Corrected cooperation rates for two-stage communication conditions (96.7% and 100.0%, previously reported as 48.3% and 50.0% due to a denominator bug in the evaluation code). All other results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09249 2026-03-11 cs.AI 57%

Social-R1: Towards Human-like Social Reasoning in LLMs

Social-R1: 向大语言模型中引入人类般的社交推理

Jincenzi Wu, Yuxuan Lei, Jianxun Lian, Yitian Huang, Lexin Zhou, Haotian Li, Xing Xie, Helen Meng

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Social-R1通过多维奖励对齐模型推理与人类认知,利用ToMBench-Hard提供困难训练案例,使大模型在社交推理任务中实现超越和稳健泛化。

Comments 27 pages. Code and dataset will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09231 2026-03-11 cs.AI 57%

Cognitively Layered Data Synthesis for Domain Adaptation of LLMs to Space Situational Awareness

认知分层数据合成用于LLM在空间态势感知领域的领域适应

Ding Linghu, Cheng Wang, Da Fan, Wei Shi, Kaifeng Yin, Xiaoliang Xue, Fan Yang, Haiyi Ren, Cong Zhang

机构 * Qian Xuesen Laboratory of Space Technology(钱学森空间技术实验室) China Academy of Space Technology(中国航天科技研究院) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出BD-FDG框架,通过认知分层问题建模和结构化知识组织,构建高质量SFT数据集,提升LLM在空间态势感知领域的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07191 2026-03-11 cs.CR cs.AI 57%

Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice

自主代理系统治理架构:威胁、框架与工程实践

Yuxu Ge

机构 * University of York(约克大学) Department of Computer Science(计算机科学系) York United Kingdom(约克英国)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出分层治理架构LGA,通过四层框架有效拦截恶意工具调用,实验表明其在不同部署场景下均表现出高拦截率和低虚警率。

Comments 22 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03538 2026-03-11 cs.CV cs.AI 57%

SDR-GAIN: A High Real-Time Occluded Pedestrian Pose Completion Method for Autonomous Driving

SDR-GAIN: 一种用于自动驾驶的高实时遮挡行人姿态补全方法

Honghao Fu, Yongli Gu, Yidong Yan, Yilang Shen, Yiwen Wu, Libo Sun

机构 * School of Instrument Science and Engineering, Southeast University(仪器科学与工程学院,东南大学) School of Geospatial Engineering and Science, Sun Yat-sen University(地理信息工程与科学学院,中山大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 SDR-GAIN通过自监督对抗学习实现高实时遮挡行人姿态补全,提升自动驾驶系统鲁棒性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08814 2026-03-11 cs.RO cs.AI cs.ET cs.MA 57%

Scale-Plan: Scalable Language-Enabled Task Planning for Heterogeneous Multi-Robot Teams

Scale-Plan: 为异构多机器人团队实现可扩展的语言赋能任务规划

Piyush Gupta, Sangjae Bae, Jiachen Li, David Isele

机构 * Honda Research Institute(本田研究院) University of California(加州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Scale-Plan通过生成紧凑的任务相关问题表示,提升异构多机器人团队的可扩展性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08806 2026-03-11 cs.SE cs.AI 57%

Test-Driven AI Agent Definition (TDAD): Compiling Tool-Using Agents from Behavioral Specifications

基于行为规范的AI代理定义(TDAD):从行为规范编译工具使用代理

Tzafrir Rehan

机构 * Fiverr Labs(Fiverr 实验室)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 TDAD通过编译行为规范生成可执行测试,确保工具使用代理在生产环境中的行为合规性,提升测试质量和回归安全性。

Comments 9 pages, 2 figures, open benchmark at https://github.com/f-labs-io/tdad-paper-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08392 2026-03-10 cs.CL 57%

COACH meets QUORUM: A Framework and Pipeline for Aligning User, Expert and Developer Perspectives in LLM-generated Health Counselling

COACH meets QUORUM: 一个框架和流程用于对齐用户、专家和开发者在LLM生成健康咨询中的视角

Yee Man Ng, Bram van Dijk, Pieter Beynen, Otto Boekesteijn, Joris Jansen, Gerard van Oortmerssen, Max van Duijn, Marco Spruit

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 COACH与QUORUM框架通过多利益相关者评估,提升LLM生成健康建议的可信度和实用性。

Comments Under review for the CL4Health workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08062 2026-03-10 cs.LG q-bio.GN 57%

Adversarial Domain Adaptation Enables Knowledge Transfer Across Heterogeneous RNA-Seq Datasets

对抗域适应促进跨异构RNA-seq数据集的知识转移

Kevin Dradjat, Massinissa Hamidi, Blaise Hanczar

机构 * IBISC Laboratory(IBISC实验室) University Paris-Saclay (Univ. Evry)(巴黎萨克雷大学(欧韦尔大学)) France(法国)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本研究提出基于深度学习的域适应框架,通过跨异构RNA-seq数据集实现有效知识转移,提升癌症类型分类的准确性,尤其在低数据场景下表现更优。

Comments 7 pages, 5 figures. Submitted to ECCB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07897 2026-03-10 cs.LG 57%

LeJOT-AutoML: LLM-Driven Feature Engineering for Job Execution Time Prediction in Databricks Cost Optimization

LeJOT-AutoML:基于LLM的特征工程用于Databricks成本优化中的作业执行时间预测

Lizhi Ma, Yi-Xiang Hu, Yihui Ren, Feng Wu, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学) Lenovo(联想)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 LeJOT-AutoML利用LLM驱动的AutoML框架,通过动态生成特征提升Databricks作业执行时间预测的准确性,从而实现成本优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07709 2026-03-10 cs.HC cs.AI 57%

YAQIN: Culturally Sensitive, Agentic AI for Mental Healthcare Support Among Muslim Women in the UK

YAQIN:面向英国穆斯林女性的文化敏感、代理型AI心理健康支持系统

Yasmin Zaraket, Céline Mougenot

机构 * Dyson School of Design Engineering, Imperial College London(帝京理工学院伦敦校区设计工程学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 YAQIN通过整合伊斯兰心理学和用户中心设计,为英国穆斯林女性提供文化敏感的AI心理健康支持,提升信任与治疗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07670 2026-03-10 cs.AI 57%

Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers

自主LLM代理的记忆:机制、评估与新兴前沿

Pengfei Du

机构 * Hong Kong Research Institute of Technology(香港理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文探讨了自主LLM代理中记忆的机制、评估及未来发展方向,分析了五种核心机制及评估挑战,强调记忆对代理适应性和应用的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07572 2026-03-10 cs.LG 57%

TS-MLLM: A Multi-Modal Large Language Model-based Framework for Industrial Time-Series Big Data Analysis

TS-MLLM:一种基于多模态大语言模型的工业时间序列大数据分析框架

Haiteng Wang, Yikang Li, Yunfei Zhu, Jingheng Yan, Lei Ren, Laurence T. Yang

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Department of Computer Science, St. Francis Xavier University(圣弗朗西斯科大学计算机科学系)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 TS-MLLM通过多模态大语言模型联合建模时序信号、频域图像和文本知识,提升工业时间序列预测的鲁棒性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07460 2026-03-10 cs.CR cs.AI 57%

Where Do LLM-based Systems Break? A System-Level Security Framework for Risk Assessment and Treatment

LLM-based系统在哪里失效?一个系统级安全框架用于风险评估与处理

Neha Nagaraja, Hayretdin Bahsi

机构 * Northern Arizona University(北亚利桑那大学) Department of Software Science(软件科学系) Tallinn University of Technology(塔林技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种系统级安全框架,用于评估和处理LLM系统中的风险,通过结合系统建模与攻击-防御树,分析医疗场景中的多步骤攻击路径,并提供可比较的防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07019 2026-03-10 cs.CL 57%

AutoChecklist: Composable Pipelines for Checklist Generation and Scoring with LLM-as-a-Judge

AutoChecklist: 用于检查表生成和评分的可组合流水线

Karen Zhou, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 AutoChecklist通过可组合的流水线实现检查表生成与评分,支持多种LLM提供者,并展示了在领域适应中的灵活性。

Comments Website: https://autochecklist.github.io/, Code: https://github.com/ChicagoHAI/AutoChecklist

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06749 2026-03-10 cs.RO cs.AI 57%

Robotic Foundation Models for Industrial Control: A Comprehensive Survey and Readiness Assessment Framework

工业控制中的机器人基础模型:全面调研与可行性评估框架

David Kube, Simon Hadwiger, Tobias Meisen

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文调研了工业控制中机器人基础模型的应用现状,通过系统评估框架分析了其工业适用性,指出工业成熟度有限,需加强安全、实时性、感知与集成等关键因素的系统性考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06584 2026-03-10 cs.HC cs.CY cs.SE 57%

AI-Powered Multi-Stakeholder Ecosystems for Global Development: A Design Research Study on the GSI D-Hub Proof-of-Concept Platform

人工智能赋能的多方利益相关者生态系统用于全球发展:对GSI D-Hub概念验证平台的设计研究

Muzakkiruddin Ahmed Mohammed, Adeeba Tarannum, Eileen Devereux Dailey, Marla Johnson, Mert Can Cakmak, John Talburt

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 本文提出GSI D-Hub平台,利用可解释AI促进多方协作,通过设计科学方法验证其在提升透明度和决策信心方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06570 2026-03-09 cs.CV cs.AI 57%

SUREON: A Benchmark and Vision-Language-Model for Surgical Reasoning

SUREON:一个手术推理的基准和视觉-语言模型

Alejandra Perez, Anita Rau, Lee White, Busisiwe Mlambo, Chinedu Nwoye, Muhammad Abdullah Jamal, Omid Mohareri

机构 * Intuitive Surgical Inc.

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 SUREON通过大规模视频问答数据集和两种模型提升手术推理能力,准确率超过84%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01203 2026-03-09 cs.AI 57%

How Well Does Agent Development Reflect Real-World Work?

代理开发是否能反映现实世界的工作?

Zora Zhiruo Wang, Sanidhya Vijayvargiya, Aspen Chen, Hanmo Zhang, Venu Arvind Arangarajan, Jett Chen, Valerie Chen, Diyi Yang, Daniel Fried, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06222 2026-03-09 cs.CL 57%

SPOT: Span-level Pause-of-Thought for Efficient and Interpretable Latent Reasoning in Large Language Models

SPOT:基于跨度的思考暂停,用于大语言模型中高效且可解释的潜在推理

Yunlong Chu, Minglai Shao, Yuhang Liu, Bing Hao, Yumeng Lin, Jialu Wang, Ruijie Wang

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 SPOT通过压缩显式推理步骤为紧凑的潜在暂停token,提升大语言模型的推理效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05832 2026-03-09 cs.HC cs.AI 57%

Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics

Lexara: 一种以用户为中心的评估工具包,用于评估用于对话式可视化分析的大型语言模型

Srishti Palani, Vidya Setlur

机构 * Tableau Research, Salesforce(Tableau研究机构,Salesforce)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Lexara是一种以用户为中心的评估工具包,用于评估对话式可视化分析中的大型语言模型,通过多格式输出的可解释指标和交互式工具帮助用户进行模型和提示选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05423 2026-03-06 cs.LG 57%

An interpretable prototype parts-based neural network for medical tabular data

可解释的原型部件基于神经网络用于医疗表格数据

Jacek Karolczak, Jerzy Stefanowski

机构 * Poznan University of Technology, Institute of Computing Science(波兹南技术大学计算科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种可解释的原型部件基于神经网络,用于医疗表格数据,通过可训练的特征片段学习有意义的原型部件,实现可解释的预测和临床决策支持。

Comments Proc. of EXPLIMED at ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05184 2026-03-06 cs.CV cs.AI 57%

Logi-PAR: Logic-Infused Patient Activity Recognition via Differentiable Rule

Logi-PAR: 通过可微规则融合的逻辑患者活动识别

Muhammad Zarar, MingZheng Zhang, Xiaowang Zhang, Zhiyong Feng, Sofonias Yitagesu, Kawsar Farooq

机构 * School of Computer Software, Tianjin University, China(天津大学软件学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Logi-PAR通过可微规则融合实现患者活动识别,首次将逻辑推理融入模型以生成可解释的活动分析和反事实干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04815 2026-03-06 cs.AI 57%

EchoGuard: An Agentic Framework with Knowledge-Graph Memory for Detecting Manipulative Communication in Longitudinal Dialogue

EchoGuard: 一种基于知识图谱记忆的代理框架,用于检测纵向对话中的操纵性沟通

Ratna Kandala, Niva Manchanda, Akshata Kishore Moharir, Ananth Kandala

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 EchoGuard通过知识图谱记忆和结构化循环检测纵向对话中的操纵性沟通,提升个体识别能力与自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01919 2026-03-06 cs.CR cs.AI cs.SE 57%

Real Money, Fake Models: Deceptive Model Claims in Shadow APIs

真实的钱,假的模型:影子API中的欺骗性模型声明

Yage Zhang, Yukun Jiang, Zeyuan Chen, Michael Backes, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文首次系统审计官方LLM API与影子API,揭示了影子API在性能、安全性和身份验证方面的欺骗行为,影响科研可重复性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04325 2026-03-05 cs.CV cs.LG 57%

Scalable Evaluation of the Realism of Synthetic Environmental Augmentations in Images

可扩展性评估合成环境增强图像的真实性

Damian J. Ruck, Paul Vautravers, Oliver Chalkley, Jake Thomas

机构 * Advai Ltd(Advai有限公司)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种可扩展框架,用于评估合成环境增强图像的真实性,发现生成式AI在大多数条件下优于基于规则的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04212 2026-03-05 cs.SE cs.CL 57%

Code Fingerprints: Disentangled Attribution of LLM-Generated Code

代码指纹:解耦的LLM生成代码归因

Jiaxun Guo, Ziyuan Yang, Mengyu Sun, Hui Wang, Jingfeng Lu, Yi Zhang

机构 * School of Cyber Science and Engineering, Sichuan University, Chengdu, China(四川大学计算机科学与工程学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出DCAN网络,通过解耦语义与风格信息,实现对LLM生成代码的多模型归因。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03903 2026-03-05 cs.CV cs.LG 57%

From Misclassifications to Outliers: Joint Reliability Assessment in Classification

从误分类到异常值:分类中的联合可靠性评估

Yang Li, Youyang Sha, Yinzhi Wang, Timothy Hospedales, Xi Shen, Shell Xu Hu, Xuanlong Yu

机构 * Intellindust AI Lab(智联工业人工智能实验室) Samsung AI Center(三星人工智能中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出联合评估框架和双评分函数,提升分类器可靠性,适用于不同场景的稳健模型部署。

Comments 15 pages, 3 figures. The source code is publicly available at https://github.com/Intellindust-AI-Lab/SUREPlus

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03633 2026-03-05 cs.CR cs.AI 57%

Goal-Driven Risk Assessment for LLM-Powered Systems: A Healthcare Case Study

面向目标的风险评估用于LLM驱动系统:一个医疗案例研究

Neha Nagaraja, Hayretdin Bahsi

机构 * School of Informatics, Computing, and Cyber Systems(信息学、计算与网络系统学院) Northern Arizona University(北亚利桑那大学) Department of Software Science(软件科学系) Tallinn University of Technology(塔林技术大学)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种面向目标的风险评估方法,用于评估LLM驱动系统的安全风险,通过攻击树详细分析威胁向量和攻击路径,以提升医疗系统等复杂系统的安全性。

Comments To appear in the HealthSec Workshop at the 2025 IEEE Annual Computer Security Applications Conference (ACSAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22730 2026-03-05 cs.CL 57%

Extending Czech Aspect-Based Sentiment Analysis with Opinion Terms: Dataset and LLM Benchmarks

扩展捷克基于方面的情感分析:数据集和大语言模型基准

Jakub Šmíd, Pavel Přibáň, Pavel Král

机构 * Department of Computer Science and Engineering(计算机科学与工程系) NTIS -- New Technologies for the Information Society(信息社会新技术)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种针对捷克语的ABSA数据集和翻译对齐方法,通过实验展示了其在低资源语言中的应用效果和改进。

Comments Accepted for the 15th edition of the Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏