arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-25 至 2026-08-25 共收录 162 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 31 篇

2602.07008 2026-08-25 cs.CV cs.LG 版本更新 57%

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints

不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Kangwei Liu, Sanyi Zhang, Zhangcheng Wang, Shiming Liu, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Communication University of China(中国传媒大学) Imperial College London(伦敦帝国学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01028 2026-08-25 cs.CL stat.ME 版本更新 57%

Syntax-Guided Diffusion Language Models with User-Integrated Personalization

带有用户集成个性化的语法引导扩散语言模型

Ruqian Zhang, Yijiao Zhang, Juan Shen, Zhongyi Zhu, Annie Qu

机构 * Department of Statistics and Data Science, Fudan University(复旦大学统计与数据科学系) Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣巴巴拉分校统计与应用概率系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究提出语法引导扩散语言模型,结合结构监督与个性化条件,通过级联及非级联架构、共享表示机制,在多任务实验中展现出文本生成的流畅度、多样性与风格保真度优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11827 2026-08-25 cs.CL 版本更新 57%

Bridging Linguistic Structure and Mechanistic Interpretability for Conceptual Interpretation in Language Models

弥合语言结构与机械可解释性以实现语言模型中的概念解释

Nura Aljaafari, Danilo S. Carvalho, André Freitas

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究提出DSRA方法,结合因果追踪与定义性语义角色,在GPT-J-6B和BERTIN GPT-J-6B中揭示语言模型内部激活与定义结构的系统对应,为概念解释研究提供新路径。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18494 2026-08-25 cs.LG 版本更新 57%

Learning in PINNs: Phase transition, diffusion equilibrium, and generalization

物理信息神经网络(PINNs)中的学习:相变、扩散平衡与泛化

Sokratis J. Anagnostopoulos, Juan Diego Toscano, Nikolaos Stergiopulos, George Em Karniadakis

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 该研究通过神经梯度信噪比识别出全连接神经网络的扩散平衡阶段,提出逐样本重加权方案提升残差同质性与泛化,基于PINNs实验表明梯度与残差有序可加快收敛、改善泛化。

Journal ref Anagnostopoulos, S.J., Toscano, J.D., Stergiopulos, N. and Karniadakis, G.E., 2025. Learning in pinns: Phase transition, diffusion equilibrium, and generalization. Neural Networks, p.107983

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22702 2026-08-25 cs.HC 新提交 50%

AffAdapt: AFFect-driven ADAPTive AI Personas for Seamless Conversations

AffAdapt:面向流畅对话的情感驱动型自适应AI角色

Nishanth Chidambaram, Kaustubh Paliwal, Kayla Hom, Shaoze Zhou, Chen Chen, Manas Satish Bedmutha, Nadir Weibel

专题命中 其他安全 :alignment(abstract)

AI总结 研究提出AffAdapt框架,整合多模块构建AI角色交互循环,实现流畅人机对话,在高风险对话场景验证其有效性,指出相关挑战并说明其应用场景。

Comments 3 pages, 2 figures, Adjunct Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26 Adjunct), Detroit, MI, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21450 2026-08-25 cs.CV 新提交 50%

Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering

超越视觉相似度:面向基于知识的视觉问答的实体对齐检索

Hangrui Xu, Zhengxian Wu, Yunyao Yu, Zhuohong Chen, Rui Cong, Xiangwen Deng, Zhifang Liu, Peng Jiao, Haoqian Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Arizona(亚利桑那大学)

专题命中 其他安全 :alignment(abstract)

AI总结 针对KB-VQA现有检索范式忽略实体语义对齐的缺陷,提出首个MLLM嵌入检索器KBMR,结合语义判别器与连续语义蒸馏目标,在Recall@1和VQA准确率上较CLIP基线实现显著提升。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21445 2026-08-25 cs.CV 新提交 50%

ViTexSZ: Heterogeneous Vision-Text Knowledge Distillation for EEG Seizure Detection

ViTexSZ:用于脑电图癫痫发作检测的异构视觉-文本知识蒸馏框架

Chenxi Liu, Mingzhao Li, Yicong Liu, Hao Miao, Hongyuan Zhang, Ziyi Chen, Gaofeng Meng

专题命中 其他安全 :alignment(abstract)

AI总结 ViTexSZ是用于EEG癫痫发作检测的异构视觉-文本知识蒸馏框架,通过多模态大语言模型对齐异构EEG与临床语义,在四个数据集上实现最高准确率,相对第二优基线提升达12.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-08-25 cs.CV 版本更新 50%

Specialist-Generalist Fusion with Outcome-Supervised Rationales for Deepfake Detection

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16537 2026-08-25 cs.RO 版本更新 50%

Nori A3: A Bimanual Mobile Manipulator at the Appliance Price Point

Nori Bot:一款不到1000美元的 floor-to-counter 移动机械臂

Antonio Li

机构 * LeRobot

专题命中 其他安全 :safety(abstract)

AI总结 Nori Bot 通过600mm Z轴提升、Raspberry Pi 4与OpenClaw协同控制以及软件安全栈解决移动机械臂的三大限制,成本仅为同类商业平台的3%。

Comments 5 pages, 4 figures, 2 tables. Supersedes arXiv:2605.16537, which described an earlier prototype on a different mechanical base

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09754 2026-08-25 stat.AP 版本更新 50%

Surface temperature extremes produced by huge machine learning hindcasts of summer 2023

由2023年夏季巨大机器学习预测产生的表面温度极值

Mark Risser, Ankur Mahesh, William D. Collins, Joshua North, Boris Bonev, Karthik Kashinath, Thorsten Kurth, Michael S. Pritchard, Shashank Subramanian

专题命中 其他安全 :safety(abstract)

AI总结 本文利用球面傅里叶神经算子机器学习模型生成7424个天气情景,研究2023年夏季极端高温事件,发现其极值温度在大部分地区不寻常,但在部分区域超出传统预测范围,凸显大规模模拟在预测湿热和干旱温度极值中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-08-25 cs.CV 版本更新 50%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 其他安全 :safety(abstract)

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16899 2026-08-25 cs.CR 50%

Security Vulnerabilities in Software Supply Chain for Autonomous Vehicles

Md Wasiul Haque, Md Erfan, Sagar Dasgupta, Md Rayhanur Rahman, Mizanur Rahman

专题命中 其他安全 :safety(abstract)

Comments 16 pages, 9 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏