arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-11 至 2026-02-11 共收录 48 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 20 篇

2602.09483 2026-02-11 cs.CV 78%

Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions

超越单个词对齐:通过令牌交互蒸馏多模态大语言模型

Lin Chen, Xiaoke Zhao, Kun Ding, Weiwei Feng, Changtao Miao, Zili Wang, Wenxuan Guo, Ying Wang, Kaiyuan Zheng, Bo Zhang, Zhe Li, Shiming Xiang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所信息与智能系统研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhejiang University(浙江大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 Align-TI通过令牌交互改进知识蒸馏,实现多模态大语言模型的高效压缩与性能提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15831 2026-02-11 cs.CV 78%

UniFit: Towards Universal Virtual Try-on with MLLM-Guided Semantic Alignment

UniFit: 向基于多模态大语言模型引导的语义对齐的通用虚拟试衣迈进

Wei Zhang, Yeying Jin, Xin Li, Yan Zhang, Xiaofeng Cong, Cong Wang, Fengcai Qiao, zhichao Lian

专题命中 其他安全 :alignment(title,abstract)

AI总结 UniFit通过多模态大语言模型引导的语义对齐模块,解决虚拟试衣中语义差距和数据稀缺问题,实现通用且高性能的试衣框架。

Comments accepted to AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14410 2026-02-11 eess.AS 78%

TTA: Transcribe, Translate and Alignment for Cross-lingual Speech Representation

TTA:跨语言语音表示的转录、翻译与对齐

Wei Liu, Jiahong Li, Yiwen Shao, Dong Yu

专题命中 其他安全 :alignment(title,abstract)

AI总结 TTA通过大规模训练生成跨语言语音表示,提升语音识别与翻译任务的性能,优于Whisper模型。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00185 2026-02-11 cs.AI cs.LG 62%

Chunking Strategies for Multimodal AI Systems

多模态AI系统中的分块策略

Shashanka B R, Mohith Charan R, Seema Banu F

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了多模态系统中分块策略的分类和技术分析,探讨了不同模态的数据处理方法及挑战。

Comments 50 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10030 2026-02-11 cs.CL cs.AI 62%

Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models

面向推理的提示优化以对齐黑盒大语言模型

Saaduddin Mahmud, Mason Nakamura, Kyle Hollins Wray, Shlomo Zilberstein

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IAPO框架,通过联合优化提示和推理规模,提升黑盒大语言模型对齐效果。

Comments Accepted to AAAI 2026. Extended 17-page version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09552 2026-02-11 cs.CL cs.AI cs.IR 62%

Comprehensive Comparison of RAG Methods Across Multi-Domain Conversational QA

跨多领域对话问答中RAG方法的全面比较

Klejda Alushi, Jan Strich, Chris Biemann, Martin Semmann

机构 * Hub of Computing and Data Science (HCDS) University of Hamburg(计算与数据科学中心(HCDS)乌姆斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过跨多领域对话问答数据集的全面比较,发现简单策略在多轮对话中表现更优,而复杂方法未必有效,强调检索策略与数据集结构的匹配至关重要。

Comments Accepted to EACL SRW 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16054 2026-02-11 cs.CL cs.AI 62%

Learning Tractable Distributions Of Language Model Continuations

学习可 tractable 的语言模型延续分布

Gwen Yidou-Weng, Ian Li, Anji Liu, Oliver Broadrick, Yuchen Cui, Guy Van den Broeck, Benjie Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校) National University of Singapore(新加坡国立大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 LTLA通过结合神经网络和隐马尔可夫模型,提高语言模型延续的可 tractable 性,实现更高效的解码和更强的约束控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09901 2026-02-11 cs.IR cs.CL 57%

QP-OneModel: A Unified Generative LLM for Multi-Task Query Understanding in Xiaohongshu Search

QP-OneModel: 一个用于小红书搜索多任务查询理解的统一生成式大语言模型

Jianzhao Huang, Xiaorui Huang, Fei Zhao, Yunpeng Liu, Hui Zhang, Fangcheng Shi, Congfeng Li, Zechen Sun, Yi Wu, Yao Hu, Yunhan Bai, Shaosheng Cao

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 QP-OneModel通过统一生成式大语言模型提升小红书搜索多任务查询理解的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08060 2026-02-11 cs.LG 57%

Compiler-Assisted Speculative Sampling for Accelerated LLM Inference on Heterogeneous Edge Devices

编译器辅助的推测采样用于加速异构边缘设备上的大语言模型推理

Alejandro Ruiz y Mesa, Guilherme Korol, Moritz Riesterer, João Paulo Cardoso de Lima, Jeronimo Castrillon

机构 * NXP Semiconductors(恩智浦半导体)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出编译器辅助的推测采样方法,通过分析成本模型优化异构边缘设备上的LLM推理性能,实现翻译任务加速1.68倍。

Comments Accepted to AccML@HiPEAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10192 2026-02-11 cs.CL cs.DB 57%

Text2SQL-Flow: A Robust SQL-Aware Data Augmentation Framework for Text-to-SQL

Text2SQL-Flow:一种鲁棒的SQL感知数据增强框架用于文本到SQL

Qifeng Cai, Hao Liang, Chang Xu, Tao Xie, Wentao Zhang, Bin Cui

机构 * Peking University, Beijing, China(北京大学,北京,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 Text2SQL-Flow提出了一种SQL感知的数据增强框架,通过生成高质量的文本到SQL数据集,提升大型语言模型在问题解决和检索任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06440 2026-02-11 cs.CV cs.LG 57%

Machine Learning Detection of Road Surface Conditions: A Generalizable Model using Traffic Cameras and Weather Data

基于交通摄像头和天气数据的机器学习道路表面状况检测:一种通用模型

Carly Sutter, Kara J. Sulia, Nick P. Bassill, Christopher D. Wirz, Christopher D. Thorncroft, Jay C. Rothenberger, Vanessa Przybylo, Mariana G. Cains, Jacob Radford, David Aaron Evans

机构 * Atmospheric Sciences Research Center, University at Albany(大气科学研究中心,阿尔巴尼大学) Department of Atmospheric and Environmental Sciences, University at Albany(大气与环境科学系,阿尔巴尼大学) State Weather Risk Communication Center(州天气风险沟通中心) National Science Foundation National Center for Atmospheric Research(国家科学基金会大气研究中心) School of Computer Science, The University of Oklahoma(计算机科学学院,俄克拉荷马大学) Cooperative Institute for Research in the Atmosphere(大气研究合作研究所)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本研究提出一种基于交通摄像头和天气数据的机器学习模型,用于预测道路表面状况,实现了81.5%的准确率,提升道路管理决策和冬季天气应对能力。

Comments Accepted for publication in the International Journal of Transportation Science and Technology (IJTST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02840 2026-02-11 cs.AI 57%

Take Goodhart Seriously: Principled Limit on General-Purpose AI Optimization

认真对待Goodhart定律:通用人工智能优化的原理性限制

Antoine Maier, Aude Maier, Tom David

机构 * General-Purpose AI Policy Lab (GPAI Policy Lab)(通用人工智能政策实验室) École polytechnique fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出通用人工智能优化存在原理性限制,因目标规范偏差和优化压力导致系统失控风险。

Comments 9 pages, 1 figure. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08422 2026-02-11 cs.CV cs.LG 57%

LD-ViCE: Latent Diffusion Model for Video Counterfactual Explanations

LD-ViCE:基于视频的反事实解释的潜在扩散模型

Payal Varshney, Adriano Lucieri, Christoph Balada, Sheraz Ahmed, Andreas Dengel

机构 * Rheinland-Pfälzische Technische Universität Kaiserslautern-Landau(莱茵-瓦尔德大学凯泽斯劳滕-兰道分校) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 LD-ViCE通过潜在扩散模型生成高质量的视频反事实解释,提升模型可解释性和可信度。

Comments 44 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10155 2026-02-11 cs.CL 57%

What Should Feature Distillation Transfer in LLMs? A Task-Tangent Geometry View

LLM中特征蒸馏应转移什么?基于任务切线几何的观点

Khouloud Saadi, Di Wang

机构 * Department of Computer Science, King Abdullah University of Science and Technology(卡布斯大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出Flex-KD方法,通过任务切线几何视角实现有效的特征蒸馏,提升模型在语言理解和生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09934 2026-02-11 cs.CV 50%

VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization

VersaViT: 通过任务引导优化增强MLLM视觉骨干

Yikun Liu, Yuan Liu, Shangzhe Di, Haicheng Wang, Zhongyin Zhao, Le Tian, Xiao Zhou, Jie Zhou, Jiangchao Yao, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院) CMIC, Shanghai Jiao Tong University, China(上海交通大学计算机学院) WeChat AI, Tencent Inc., China(腾讯公司)

专题命中 其他安全 :alignment(abstract)

AI总结 VersaViT通过任务引导优化增强MLLM视觉骨干,解决其在密集预测任务中的性能问题,提升视觉任务的适应性与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09165 2026-02-11 cs.CV 50%

All-in-One Conditioning for Text-to-Image Synthesis

文本到图像合成的综合条件化

Hirunima Jayasekara, Chuong Huynh, Yixuan Ren, Christabel Acquaye, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出基于场景图的零样本条件化机制,通过轻量级语言模型生成视觉条件,提升文本到图像合成的语义一致性和生成多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09132 2026-02-11 cs.DB cs.ET cs.MA 50%

SciDataCopilot: An Agentic Data Preparation Framework for AGI-driven Scientific Discovery

SciDataCopilot: 一种面向AGI驱动科学发现的代理数据准备框架

Jiyong Rao, Yicheng Qiu, Jiahui Zhang, Juntao Deng, Shangquan Sun, Fenghua Ling, Hao Chen, Nanqing Dong, Zhangyang Gao, Siqi Sun, Yuqiang Li, Dongzhan Zhou, Guangyu Wang, Lijun Wu, Conghui He, Xuhong Wang, Jing Shao, Xiang Liu, Yu Zhu, Mianxin Liu, Qihao Zheng, Yinghui Zhang, Jiamin Wu, Xiaosong Wang, Shixiang Tang, Wenlong Zhang, Bo Zhang, Wanli Ouyang, Runkai Zhao, Chunfeng Song, Lei Bai, Chi Zhang

专题命中 其他安全 :alignment(abstract)

AI总结 SciDataCopilot通过自主代理框架实现端到端的数据准备,提升科学发现效率与一致性,推动实验驱动的科学通用智能发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20127 2026-02-11 cs.RO cs.NI 50%

TURBO: Utility-Aware Bandwidth Allocation for Cloud-Augmented Autonomous Control

TURBO:面向云增强自主控制的效用感知带宽分配

Peter Schafhalter, Alexander Krentsel, Hongbo Wei, Joseph E. Gonzalez, Sylvia Ratnasamy, Scott Shenker, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他安全 :safety(abstract)

AI总结 TURBO通过联合优化汽车和云的带宽分配与控制管道配置,提升自动驾驶系统的精度和安全性。

Comments 34 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏