arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-09 至 2025-12-09 共收录 28 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 28 篇

2512.05485 2025-12-09 cs.CR 82%

TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations

TeleAI-Safety: 一种全面的LLM jailbreaking基准测试,面向攻击、防御和评估

Xiuyuan Chen, Jian Zhao, Yuxiang He, Yuan Xun, Xinwei Liu, Yanshu Li, Huilin Zhou, Wei Cai, Ziyan Shi, Yuchen Yuan, Tianle Zhang, Chi Zhang, Xuelong Li

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract)

AI总结 TeleAI-Safety提出了一种全面的LLM安全评估基准,整合多种攻击、防御和评估方法,用于系统性评估LLM的安全性及优化防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06917 2025-12-09 cs.LG 79%

Know your Trajectory -- Trustworthy Reinforcement Learning deployment through Importance-Based Trajectory Analysis

了解你的轨迹 -- 通过基于重要性的轨迹分析实现可信的强化学习部署

Clifford F, Devika Jay, Abhishek Sarkar, Satheesh K Perepu, Santhosh G S, Kaushik Dey, Balaraman Ravindran

机构 * Clifford F(未知) Devika Jay(未知) Abhishek Sarkar(未知) Satheesh K Perepu(未知) Santhosh G S(未知) Kaushik Dey(未知) Balaraman Ravindran(未知)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文提出基于重要性的轨迹分析框架,通过评估轨迹级状态重要性,提升强化学习部署的可信度和可解释性。

Comments Accepted at 4th Deployable AI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10645 2025-12-09 cs.LG cs.AI 76%

Trustworthy Retrosynthesis: Eliminating Hallucinations with a Diverse Ensemble of Reaction Scorers

可信的逆合成:通过多样化的反应评分器消除幻觉

Michal Sadowski, Tadija Radusinović, Maria Wyrzykowska, Lukasz Sztukiewicz, Jan Rzymkowski, Paweł Włodarczyk-Pruszyński, Mikołaj Sacha, Piotr Kozakowski, Ruard van Workum, Stanislaw Kamil Jastrzebski

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

AI总结 RetroTrim通过多样化反应评分策略有效消除逆合成中的幻觉,实现高质量路径生成,解决药物类似物领域中的合成计划可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06902 2025-12-09 cs.SE cs.AI 74%

BabelCoder: Agentic Code Translation with Specification Alignment

BabelCoder: 基于规范对齐的代理代码翻译

Fazle Rabbi, Soumit Kanti Saha, Tri Minh Triet Pham, Song Wang, Jinqiu Yang

机构 * Concordia University(康科迪亚大学) York University(约克大学)

专题命中 安全评测 :alignment(title);分类 cs.AI

AI总结 BabelCoder通过代理协作框架提升代码翻译准确性,实现94.16%的平均准确率。

Comments 21 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21933 2025-12-09 cs.CL cs.AI 73%

Why Chain of Thought Fails in Clinical Text Understanding

为什么链式思维在临床文本理解中失效

Jiageng Wu, Kevin Xie, Bowen Gu, Nils Krüger, Kueiyu Joshua Lin, Jie Yang

机构 * Harvard Medical School(哈佛医学院) MIT(麻省理工学院) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现链式思维在临床文本理解中导致性能下降,揭示了其在临床任务中可靠性与可解释性的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07059 2025-12-09 cs.CL 70%

Replicating TEMPEST at Scale: Multi-Turn Adversarial Attacks Against Trillion-Parameter Frontier Models

在大规模上复制TEMPEST:针对万亿参数前沿模型的多轮对抗攻击

Richard Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究通过TEMPEST框架评估了十种前沿模型对多轮对抗攻击的鲁棒性,发现模型规模不影响鲁棒性,而思考模式能提升安全性。

Comments 30 pages, 11 figures, 5 tables. Code and data: https://github.com/ricyoung/tempest-replication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03072 2025-12-09 cs.AI cs.LO 70%

Beyond the Black Box: A Cognitive Architecture for Explainable and Aligned AI

超越黑箱:可解释和对齐的AI认知架构

Hu Keyi

机构 * Tongji University(同济大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出'权重计算主义'认知架构,通过分解认知为逻辑原子和基本操作,实现可解释、普遍和可追溯的价值对齐,为通用人工智能的发展提供理论和实践基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19397 2025-12-09 cs.LG 70%

Are Time-Series Foundation Models Deployment-Ready? A Systematic Study of Adversarial Robustness Across Domains

时间序列基础模型是否已准备好部署?跨领域的对抗鲁棒性系统研究

Jiawen Zhang, Zhenwei Zhang, Shun Zheng, Xumeng Wen, Jia Li, Jiang Bian

机构 * HKUST (GZ)(香港科技大学) Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本研究系统分析了时间序列基础模型在跨领域对抗攻击下的鲁棒性,揭示了模型脆弱性及改进方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06751 2025-12-09 cs.CL cs.AI cs.LG 67%

Becoming Experienced Judges: Selective Test-Time Learning for Evaluators

成为经验丰富的法官:用于评估者的选择性测试时间学习

Seungyeon Jwa, Daechul Ahn, Reokyoung Kim, Dongyeop Kang, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) University of Minnesota(明尼苏达大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出选择性测试时间学习框架,使评估者在推理过程中逐步改进,通过自适应元提示提升评估效果,实验证明其在多个基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16543 2025-12-09 cs.IR cs.AI cs.CL cs.LG 67%

The Oracle and The Prism: A Decoupled and Efficient Framework for Generative Recommendation Explanation

oracle 与 prism:一种解耦且高效的生成推荐解释框架

Jiaheng Zhang, Daqiang Zhang

机构 * Sun Yat-sen University(中山大学) School of Software Engineer Tong ji University(同济大学软件工程学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 prism 通过解耦推荐过程和蒸馏技术,提升可解释推荐系统的效率与可信度。

Comments 12pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07021 2025-12-09 cs.LG cs.AI 62%

Transferring Clinical Knowledge into ECGs Representation

将临床知识转移到ECG表示中

Jose Geraldo Fernandes, Luiz Facury de Souza, Pedro Robles Dutenhefner, Gisele L. Pappa, Wagner Meira

机构 * Department of Computer Science(计算机科学系) Universidade Federal de Minas Gerais(巴西矿务联邦大学) Depart. of Math. and Comp. Sc.(数学与计算机科学系) Albion College(阿尔比恩学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种三阶段训练方法,将多模态临床数据转化为ECG表示,提升分类模型的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06161 2025-12-09 cs.AI cs.LG 62%

Deep learning for autism detection using clinical notes: A comparison of transfer learning for a transparent and black-box approach

利用临床笔记进行自闭症检测的深度学习:透明与黑箱方法的迁移学习比较

Gondy Leroy, Prakash Bisht, Sai Madhuri Kandula, Nell Maltman, Sydney Rice

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种基于BioBERT的透明机器学习方法,通过混合数据集训练提升了自闭症检测的准确率,优于黑箱方法。

Comments 9 pages

Journal ref Artificial Intelligence in Medicine, February, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05994 2025-12-09 eess.AS cs.AI cs.CL cs.SD 62%

KidSpeak: A General Multi-purpose LLM for Kids' Speech Recognition and Screening

KidSpeak: 一个通用的多用途大语言模型用于儿童语音识别与筛查

Rohan Sharma, Dancheng Liu, Jingchen Sun, Shijie Zhou, Jiayu Qin, Jinjun Xiong, Changyou Chen

机构 * Department of Computer Science and Engineering, State University of New York at Buffalo(计算机科学与工程系,纽约州立大学布法罗分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 KidSpeak是首个为儿童语音识别与筛查设计的多用途大语言模型,结合语音增强技术与FASA对齐工具,实现87%的准确率,提升儿童语音数据质量13.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07724 2025-12-09 cs.ET cs.AI 57%

The Native Spiking Microarchitecture: From Iontronic Primitives to Bit-Exact FP8 Arithmetic

本征脉冲微架构:从离子电子原语到精确的FP8算术

Zhengzheng Tang

机构 * Boston University(波士顿大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出本征脉冲微架构,通过空间组合流水线和粘性-额外修正机制,实现从随机离子到确定性浮点的转换,达到FP8精确计算并提升线性层效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07667 2025-12-09 cs.LG 57%

Depth-Wise Activation Steering for Honest Language Models

深度方向激活引导用于诚实语言模型

Gracjan Góral, Marysia Winkels, Steven Basart

机构 * University of Warsaw(华沙大学) MARS(对齐研究学生导师计划) Center for AI Safety(人工智能安全中心)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 深度方向激活引导方法通过高斯调度提升语言模型的诚实性,无需训练或微调,有效增强模型真实报告能力。

Comments See \url{https://github.com/marysia/gaussian-activation-steering}. for code and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07474 2025-12-09 cs.HC cs.CL 57%

Living the Novel: A System for Generating Self-Training Timeline-Aware Conversational Agents from Novels

活出小说:一种从小说生成自训练时间感知对话代理的系统

Yifei Huang, Tianyu Yan, Sitong Gong, Xiwei Gao, Caixin Kang, Ruicong Liu, Huchuan Lu, Bo Zheng

机构 * Shanda AI Research, Tokyo(上海沙达人工智能研究有限公司,东京) The University of Tokyo(东京大学) Dalian University of Technology(大连理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出Living Novel系统,通过两阶段训练流程解决LLM驱动角色的人设漂移和鲁棒性问题,实现连贯且抗中断的对话体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07302 2025-12-09 cs.CV cs.AI 57%

Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts

迈向准确的无人机图像感知:通过更强的任务提示引导视觉-语言模型

Mingning Guo, Mengwei Wu, Shaoxian Li, Haifeng Li, Chao Tao

机构 * School of Geosciences and InfoPhysics, Central South University(地质科学与信息物理学院,中南大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 AerialVP通过增强任务提示提升无人机图像感知性能,引入AerialSense基准评估模型在复杂场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07234 2025-12-09 cs.CV cs.AI 57%

Dropout Prompt Learning: Towards Robust and Adaptive Vision-Language Models

Dropout Prompt Learning: 向稳健和适应性强的视觉-语言模型迈进

Biao Chen, Lin Zuo, Mengmeng Jing, Kunbin He, Yuchen Wang

机构 * Biao Chen, Lin Zuo, Mengmeng Jing, Kunbin He, Yuchen Wang(作者)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Dropout Prompt Learning通过在视觉-语言模型中应用Dropout技术,提升模型的鲁棒性和适应性,实验表明其在低样本学习、长尾分类和分布外泛化等任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06390 2025-12-09 cs.CR cs.AI 57%

Ghost in the Transformer: Detecting Model Reuse with Invariant Spectral Signatures

Transformer中的幽灵:通过不变频谱特征检测模型重用

Suqing Wang, Ziyang Ma, Li Xinyi, Zuchao Li

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出GhostSpec,一种通过不变频谱特征验证LLM血统的方法,无需训练数据或行为修改,具有鲁棒性和高效性。

Comments Accepted at AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13515 2025-12-09 cs.CV cs.AI 57%

UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning

UniME-V2:基于大规模语言模型的通用多模态嵌入学习判别器

Tiancheng Gu, Kaicheng Yang, Kaichen Zhang, Xiang An, Ziyong Feng, Yueyi Zhang, Weidong Cai, Jiankang Deng, Lidong Bing

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 UniME-V2利用大规模语言模型提升通用多模态嵌入学习的判别能力,通过引入MLLM-as-a-Judge机制和重排序模型实现更高效的负样本挖掘和语义匹配。

Comments AAAI2026 Oral, Webpage:https://garygutc.github.io/UniME-v2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19912 2025-12-09 cs.CV cs.LG cs.RO 57%

Enhanced Spatiotemporal Consistency for Image-to-LiDAR Data Pretraining

增强的时空一致性用于图像到LiDAR数据预训练

Xiang Xu, Lingdong Kong, Hui Shuai, Wenwei Zhang, Liang Pan, Kai Chen, Ziwei Liu, Qingshan Liu

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) School of Computing, Department of Computer Science, National University of Singapore(新加坡国立大学计算机学院) School of Computer Science, Nanjing University of Posts and Telecommunications(南京邮电大学计算机学院) Shanghai AI Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 SuperFlow++通过整合时空线索提升图像到LiDAR数据预训练效果,实现更鲁棒的特征表示和更高效的自动驾驶感知。

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06710 2025-12-09 cs.AI 57%

Stochasticity in Agentic Evaluations: Quantifying Inconsistency with Intraclass Correlation

代理评估中的随机性:通过组内相关系数量化不一致性

Zairah Mustahsan, Abel Lim, Megna Anand, Saahil Jain, Bryan McCann

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过组内相关系数量化代理评估中的不一致性,以提高评估可靠性,建议在基准测试中报告ICC和查询内方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06341 2025-12-09 cs.LG cs.IR cs.IT math.IT 57%

Interpretive Efficiency: Information-Geometric Foundations of Data Usefulness

可解释效率:数据有用性的信息几何基础

Ronald Katende

机构 * Department of Mathematics(数学系) Kabale University(卡巴勒大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出可解释效率,一种基于信息几何的度量,用于评估数据支持可解释性表示的有效性,并通过实验验证其在表示设计中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06032 2025-12-09 cs.CV cs.AI 57%

The SAM2-to-SAM3 Gap in the Segment Anything Model Family: Why Prompt-Based Expertise Fails in Concept-Driven Image Segmentation

在Segment Anything模型家族中SAM2到SAM3之间的鸿沟:基于提示的专家知识为何在概念驱动的图像分割中失效

Ranjan Sapkota, Konstantinos I. Roumeliotis, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(希腊皮洛斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文分析了SAM2到SAM3在分割模型中的断层,指出基于提示的分割方法在概念驱动分割中失效的原因,并探讨了SAM3的多模态架构与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07449 2025-12-09 cs.PF 50%

AFarePart: Accuracy-aware Fault-resilient Partitioner for DNN Edge Accelerators

AFarePart: 用于DNN边缘加速器的精度感知故障容错分区器

Mukta Debnath, Krishnendu Guha, Debasri Saha, Amlan Chakrabarti, Susmita Sur-Kolay

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种精度感知的DNN分区框架,通过NSGA-II多目标优化提升故障容错性,实验显示在性能开销小的情况下,故障容忍度提升达27.7%。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13036 2025-12-09 cs.CV 50%

uCLIP: Parameter-Efficient Multilingual Extension of Vision-Language Models with Unpaired Data

uCLIP: 无配对数据下多语言视觉语言模型的参数高效扩展

Dahyun Chung, Donghyun Shin, Yujin Sung, Seunggi Moon, Jinwoo Jeon, Byung-Jun Lee

专题命中 安全评测 :alignment(abstract)

AI总结 uCLIP通过无需配对数据的轻量级框架,在低资源语言中实现高效多语言视觉语言对齐。

Comments Our project page can be found at https://dinyudin203.github.io/uCLIP-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06645 2025-12-09 cs.MA 50%

Analyzing Collision Rates in Large-Scale Mixed Traffic Control via Multi-Agent Reinforcement Learning

通过多智能体强化学习分析大规模混合交通控制中的碰撞率

Muyang Fan

专题命中 安全评测 :safety(abstract)

AI总结 本研究通过多智能体强化学习分析大规模混合交通控制中的碰撞率影响因素,探讨交通密度、信号协调和转向策略对碰撞风险的作用,为提升交通系统安全性和效率提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06583 2025-12-09 econ.GN q-fin.EC 50%

Tournament-Based Performance Evaluation and Systematic Misallocation: Why Forced Ranking Systems Produce Random Outcomes

基于竞赛的绩效评估与系统性误分配:为什么强制排名系统产生随机结果

Jeremy McEntire

专题命中 安全评测 :alignment(abstract)

AI总结 本文揭示强制排名系统因系统性误分配导致随机结果,指出其无法有效解决委托-代理问题,反而加剧了分配误差。

Comments 31 pages, 6 tables. Agent-based simulation demonstrating structural allocation failures in tournament-based forced distribution evaluation mechanisms. Includes sensitivity analyses across team bias levels, alternative distributions, and cutoff percentages

详情

展开后加载摘要…

URL PDF HTML 收藏