arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-16 至 2026-02-16 共收录 21 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 21 篇

2602.12968 2026-02-16 cs.IR cs.AI cs.CL 81%

RGAlign-Rec: Ranking-Guided Alignment for Latent Query Reasoning in Recommendation Systems

RGAlign-Rec: 基于排名引导的潜在查询推理中的对齐方法

Junhua Liu, Yang Jihao, Cheng Chang, Kunrong LI, Bin Fu, Kwan Hui Lim

机构 * Forth AI Singapore(Forth AI新加坡) Shopee Singapore(Shopee新加坡) Singapore Uni. of Tech. and Design(新加坡技术与设计大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 RGAlign-Rec通过闭环对齐框架结合语义推理和增强查询模型,提升电子商务推荐系统的预测准确性和服务质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11235 2026-02-16 cs.IR 78%

MTFM: A Scalable and Alignment-free Foundation Model for Industrial Recommendation in Meituan

MTFM:一种可扩展且无对齐的工业推荐基础模型

Xin Song, Zhilin Guan, Ruidong Han, Binghao Tang, Tianwen Chen, Bing Li, Zihao Li, Han Zhang, Fei Jiang, Qing Wang, Zikang Xu, Fengyi Li, Chunzhen Jing, Lei Yu, Wei Lin

专题命中 其他安全 :alignment(title,abstract)

AI总结 MTFM是一种基于Transformer的工业推荐基础模型,通过异构标记和多场景样本聚合提升效率,实现无对齐的多场景推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12569 2026-02-16 cs.HC 78%

Editable XAI: Toward Bidirectional Human-AI Alignment with Co-Editable Explanations of Interpretable Attributes

可编辑的可解释性AI:通过可编辑的可解释属性实现双向人机对齐

Haoyang Chen, Jingwen Bai, Fang Tian, Brian Y Lim

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出可编辑的XAI方法CoExplain,通过允许用户编写规则来提升人机对齐,实验表明其在理解和控制方面优于传统只读XAI。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12878 2026-02-16 cs.CY 74%

Understanding Cultural Alignment in Multilingual LLMs via Natural Debate Statements

通过自然辩论陈述理解多语言大语言模型中的文化契合

Vlad-Andrei Negru, Camelia Lemnaru, Mihai Surdeanu, Rodica Potolea

专题命中 其他安全 :alignment(title);分类 cs.CY

AI总结 本文通过分析自然辩论陈述,揭示了多语言大语言模型在不同文化背景下的价值观差异及其对用户社会文化背景适应能力的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05325 2026-02-16 cs.LG 74%

Quasiparticle Interference Kernel Extraction with Variational Autoencoders via Latent Alignment

通过潜在对齐的变分自编码器提取准粒子干涉核

Yingshuai Ji, Haomin Zhuang, Matthew Toole, James McKenzie, Xiaolong Liu, Xiangliang Zhang

机构 * Department of Computer Science \& \ University of Notre Dame South Bend, IN, USA Department of Physics \& Astronomy University of Notre Dame South Bend, IN, USA

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 本文提出基于变分自编码器和潜在对齐的AI框架,实现复杂散射条件下准粒子干涉核的高效提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12592 2026-02-16 cs.LG cs.AI 73%

Power Interpretable Causal ODE Networks: A Unified Model for Explainable Anomaly Detection and Root Cause Analysis in Power Systems

电力可解释因果微分方程网络:一种用于电力系统可解释异常检测和根本原因分析的统一模型

Yue Sun, Likai Wang, Rick S. Blum, Parv Venkitasubramaniam

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 PICODE网络通过统一模型实现电力系统中异常检测与根本原因分析的可解释性,提升模型的可解释性和减少对标注数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00004 2026-02-16 cs.AI cs.CL cs.LG 67%

Finetuning Large Language Models for Automated Depression Screening in Nigerian Pidgin English: GENSCORE Pilot Study

基于大型语言模型的尼日利亚皮钦英语自动化抑郁症筛查:GENSCORE试点研究

Isaac Iyinoluwa Olufadewa, Miracle Ayomikun Adesina, Ezekiel Ayodeji Oladejo, Uthman Babatunde Usman, Owen Kolade Adeniyi, Matthew Tolulope Olawoyin

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究利用微调的大型语言模型,针对尼日利亚皮钦英语开发自动化抑郁症筛查工具,GPT-4.1在准确率和文化适应性上表现最佳,为资源受限地区心理健康应用提供基础。

Comments 10 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12778 2026-02-16 cs.CL cs.LG 62%

Aspect-Based Sentiment Analysis for Future Tourism Experiences: A BERT-MoE Framework for Persian User Reviews

面向未来旅游体验的基于方面的情感分析:一种针对波斯语用户评论的BERT-MoE框架

Hamidreza Kazemi Taskooh, Taha Zare Harofte

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种BERT-MoE框架,用于波斯语旅游评论的基于方面的情感分析,实现90.6%的ABSA F1分数,同时提升计算效率,支持可持续AI发展。

Comments 25 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12546 2026-02-16 eess.AS cs.AI cs.CL cs.SD 62%

Decoder-only Conformer with Modality-aware Sparse Mixtures of Experts for ASR

仅解码器的Conformer结合模态感知的稀疏专家混合

Jaeyoung Lee, Masato Mimura

机构 * NTT, Inc., Japan(日本NTT公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种仅解码器的Conformer模型,通过模态感知的稀疏混合专家实现更高效的ASR,减少了参数使用并提升了识别准确率。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12205 2026-02-16 cs.CV cs.AI 57%

DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

DeepGen 1.0: 一种轻量级统一多模态模型,用于推进图像生成与编辑

Dianyi Wang, Ruihang Li, Feng Han, Chaofan Ma, Wei Song, Siyuan Wang, Yibin Wang, Yi Xin, Hongjian Liu, Zhixiong Zhang, Shengyuan Ding, Tianhang Wang, Zhenglin Cheng, Tao Lin, Cheng Jin, Kaicheng Yu, Jingjing Chen, Wenjie Wang, Zhongyu Wei, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) University of Southern California(南加州大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 DeepGen 1.0通过轻量级统一多模态模型在图像生成与编辑领域实现高性能,采用SCB框架和数据驱动训练策略,超越大参数模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19093 2026-02-16 cs.LG 57%

Weight Decay may matter more than muP for Learning Rate Transfer in Practice

权重衰减可能比muP对学习率转移更重要

Atli Kosson, Jeremy Welborn, Yang Liu, Martin Jaggi, Xi Chen

机构 * Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室) EPFL(瑞士联邦理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究发现权重衰减在学习率转移中比muP更有效,挑战了传统观点并解释了muP对独立权重衰减的依赖。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19852 2026-02-16 cs.SD cs.AI 57%

Eliminating stability hallucinations in llm-based tts models via attention guidance

通过注意力引导消除基于大语言模型的TTS模型中的稳定性幻觉

ShiMing Wang, ZhiHao Du, Yang Xiang, TianYu Zhao, Han Zhao, Qian Chen, XianGang Li, HanJie Guo, ZhenHua Ling

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文通过改进注意力机制,减少基于大语言模型的TTS模型中的稳定性幻觉,提升语音合成的稳定性和连续性。

Comments The authors are withdrawing this preprint as it was submitted prematurely without the final approval of all collaborating institutions. We apologize for any inconvenience

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12634 2026-02-16 cs.CY 57%

The Rise of AI Agent Communities: Large-Scale Analysis of Discourse and Interaction on Moltbook

AI代理社区的崛起:Moltbook上 discourse 和 interaction 的大规模分析

Lingyao Li, Renkai Ma, Chen Chen, Zhicong Lu, Yongfeng Zhang

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 研究分析了Moltbook上AI代理的讨论主题、发布行为及互动模式,揭示了代理自我意识的形成机制及社区协调的特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12500 2026-02-16 cs.SE cs.AI cs.CR 57%

Favia: Forensic Agent for Vulnerability-fix Identification and Analysis

Favia:漏洞修复识别与分析的取证代理

André Storhaug, Jiamou Sun, Jingyue Li

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Favia通过结合可扩展的候选排名与深入语义推理,有效识别漏洞修复,优于传统和LLM基方法。

Comments 44 pages, 12 figures, 5 tables, 3 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12419 2026-02-16 cs.AI 57%

Intent-Driven Smart Manufacturing Integrating Knowledge Graphs and Large Language Models

意图驱动的智能制造整合知识图谱和大语言模型

Takoua Jradi, John Violos, Dimitrios Spatharakis, Lydia Mavraidi, Ioannis Dimolitsas, Aris Leivadeas, Symeon Papavassiliou

机构 * 1Department of Software IT Engineering, École de technologie supérieure, Montreal, Canada 2School of Electrical \& Computer Engineering, National Technical University of Athens

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出结合大语言模型和知识图谱的意图驱动智能制造框架,通过微调和语义映射提升制造系统的人机交互性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05096 2026-02-16 cs.CV cs.LG 57%

Visual concept ranking uncovers medical shortcuts used by large multimodal models

视觉概念排名揭示大型多模态模型使用的医学捷径

Joseph D. Janizek, Sonnet Xu, Junayd Lateef, Roxana Daneshjou

机构 * Stanford University(斯坦福大学) University of California Berkeley(加州大学伯克利分校)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出视觉概念排名方法,用于揭示大型多模态模型在医疗任务中表现的潜在视觉特征依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12936 2026-02-16 cs.CV 50%

Unleashing MLLMs on the Edge: A Unified Framework for Cross-Modal ReID via Adaptive SVD Distillation

在边缘侧释放MLLMs:通过自适应SVD蒸馏实现跨模态重识别的统一框架

Hongbo Jiang, Jie Li, Xinqi Cai, Tianyu Xie, Yunhang Shen, Pingyang Dai, Liujuan Cao

机构 * Tencent Youtu Lab, Shanghai, China(腾讯优图实验室,上海,中国) Xiamen University, Media Analytics(厦门大学,媒体分析) Computing Lab, Department of Artificial Intelligence, School of Informatics, Xiamen, China(计算实验室,人工智能系,信息学院,厦门,中国)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出MLLMEmbed-ReID框架,通过自适应SVD蒸馏实现跨模态重识别的统一部署,结合云-边缘架构提升性能与效率。

Comments Equal contribution by Jie Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12927 2026-02-16 cs.GT 50%

Solving Qualitative Multi-Objective Stochastic Games

求解定性多目标随机博弈

Moritz Graf, Anthony Lin, Rupak Majumdar

专题命中 其他安全 :safety(abstract)

AI总结 该研究探讨了多目标随机博弈的复杂性和确定性,证明了特定目标组合的博弈在PSPACE完全,而完整布尔组合则为NEXPTIME难。

Comments Accepted as a full paper at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04066 2026-02-16 cs.SE 50%

Exploring the Potential of Large Language Models in Simulink-Stateflow Mutant Generation

探索大型语言模型在Simulink-Stateflow变异体生成中的潜力

Pablo Valle, Shaukat Ali, Aitor Arrieta

专题命中 其他安全 :safety(abstract)

AI总结 本文利用大型语言模型生成高质量的Simulink-Stateflow变异体,显著提高了生成效率和变异体质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04553 2026-02-16 cs.HC 50%

Understanding Codebase like a Professional! Human-AI Collaboration for Code Comprehension

像专业人员一样理解代码库!面向代码理解的人机协作

Jie Gao, Yue Xue, Xiaofei Xie, SoeMin Thant, Erika Lee, Bowen Xu

专题命中 其他安全 :alignment(abstract)

AI总结 CodeMap通过动态信息提取和交互式可视化,提升代码理解的直观性和易用性,减少对LLM响应的依赖。

Comments Accepted at the 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20034 2026-02-16 cs.CV 50%

MaskInversion: Localized Embeddings via Optimization of Explainability Maps

MaskInversion: 通过可解释性图的优化生成局部嵌入

Walid Bousselham, Sofian Chaybouti, Christian Rupprecht, Vittorio Ferrari, Hilde Kuehne

机构 * Tuebingen AI Center University of Tuebingen(图宾根人工智能中心 图宾根大学) University of Oxford(牛津大学) Meta MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 MaskInversion通过优化可解释性图生成特定图像区域的嵌入,适用于多种视觉-语言任务。

Comments Project page: https://walidbousselham.com/MaskInversion

详情

展开后加载摘要…

URL PDF HTML 收藏