arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8057 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8057 篇

2602.10153 2026-02-12 cs.CR cs.LG cs.SE 57%

Basic Legibility Protocols Improve Trusted Monitoring

基础可读性协议提升可信监控

Ashwin Sreevatsa, Sebastian Prasanna, Cody Rushing

机构 * Cambridge Boston Alignment Initiative (CBAI) Summer Research Fellowship(剑桥波士顿对齐计划暑期研究奖学金) Redwood Research(红木研究)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本研究提出可读性协议,通过鼓励不受信任模型产生易于监控评估的行为,提升可信监控的安全性,同时增强监控者对诚实代码的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03737 2026-02-12 cs.LG 57%

Soft Sensor for Bottom-Hole Pressure Estimation in Petroleum Wells Using Long Short-Term Memory and Transfer Learning

基于长短期记忆与迁移学习的石油井底压力估计软传感器

M. A. Fernandes, E. Gildin, M. A. Sampaio

机构 * University of São Paulo(圣保罗大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出基于LSTM和迁移学习的石油井底压力估计软传感器,通过实测数据验证其在成本和精度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04518 2026-02-12 eess.AS cs.CL 57%

Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model

迈向单个语音语言模型中的高效语音-文本联合解码

Haibin Wu, Yuxuan Hu, Ruchao Fan, Xiaofei Wang, Kenichi Kumatani, Bo Ren, Jianwei Yu, Heng Lu, Lijuan Wang, Yao Qian, Jinyu Li

机构 * Microsoft(微软公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种早停交错解码方法,以提升语音-文本联合解码的效率和性能,并通过高质量QA数据集进一步优化语音问答性能。

Comments Accepted by ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09901 2026-02-11 cs.IR cs.CL 57%

QP-OneModel: A Unified Generative LLM for Multi-Task Query Understanding in Xiaohongshu Search

QP-OneModel: 一个用于小红书搜索多任务查询理解的统一生成式大语言模型

Jianzhao Huang, Xiaorui Huang, Fei Zhao, Yunpeng Liu, Hui Zhang, Fangcheng Shi, Congfeng Li, Zechen Sun, Yi Wu, Yao Hu, Yunhan Bai, Shaosheng Cao

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 QP-OneModel通过统一生成式大语言模型提升小红书搜索多任务查询理解的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08060 2026-02-11 cs.LG 57%

Compiler-Assisted Speculative Sampling for Accelerated LLM Inference on Heterogeneous Edge Devices

编译器辅助的推测采样用于加速异构边缘设备上的大语言模型推理

Alejandro Ruiz y Mesa, Guilherme Korol, Moritz Riesterer, João Paulo Cardoso de Lima, Jeronimo Castrillon

机构 * NXP Semiconductors(恩智浦半导体)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出编译器辅助的推测采样方法,通过分析成本模型优化异构边缘设备上的LLM推理性能,实现翻译任务加速1.68倍。

Comments Accepted to AccML@HiPEAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10192 2026-02-11 cs.CL cs.DB 57%

Text2SQL-Flow: A Robust SQL-Aware Data Augmentation Framework for Text-to-SQL

Text2SQL-Flow:一种鲁棒的SQL感知数据增强框架用于文本到SQL

Qifeng Cai, Hao Liang, Chang Xu, Tao Xie, Wentao Zhang, Bin Cui

机构 * Peking University, Beijing, China(北京大学,北京,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 Text2SQL-Flow提出了一种SQL感知的数据增强框架,通过生成高质量的文本到SQL数据集,提升大型语言模型在问题解决和检索任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06440 2026-02-11 cs.CV cs.LG 57%

Machine Learning Detection of Road Surface Conditions: A Generalizable Model using Traffic Cameras and Weather Data

基于交通摄像头和天气数据的机器学习道路表面状况检测:一种通用模型

Carly Sutter, Kara J. Sulia, Nick P. Bassill, Christopher D. Wirz, Christopher D. Thorncroft, Jay C. Rothenberger, Vanessa Przybylo, Mariana G. Cains, Jacob Radford, David Aaron Evans

机构 * Atmospheric Sciences Research Center, University at Albany(大气科学研究中心,阿尔巴尼大学) Department of Atmospheric and Environmental Sciences, University at Albany(大气与环境科学系,阿尔巴尼大学) State Weather Risk Communication Center(州天气风险沟通中心) National Science Foundation National Center for Atmospheric Research(国家科学基金会大气研究中心) School of Computer Science, The University of Oklahoma(计算机科学学院,俄克拉荷马大学) Cooperative Institute for Research in the Atmosphere(大气研究合作研究所)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本研究提出一种基于交通摄像头和天气数据的机器学习模型,用于预测道路表面状况,实现了81.5%的准确率,提升道路管理决策和冬季天气应对能力。

Comments Accepted for publication in the International Journal of Transportation Science and Technology (IJTST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02840 2026-02-11 cs.AI 57%

Take Goodhart Seriously: Principled Limit on General-Purpose AI Optimization

认真对待Goodhart定律:通用人工智能优化的原理性限制

Antoine Maier, Aude Maier, Tom David

机构 * General-Purpose AI Policy Lab (GPAI Policy Lab)(通用人工智能政策实验室) École polytechnique fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出通用人工智能优化存在原理性限制,因目标规范偏差和优化压力导致系统失控风险。

Comments 9 pages, 1 figure. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08422 2026-02-11 cs.CV cs.LG 57%

LD-ViCE: Latent Diffusion Model for Video Counterfactual Explanations

LD-ViCE:基于视频的反事实解释的潜在扩散模型

Payal Varshney, Adriano Lucieri, Christoph Balada, Sheraz Ahmed, Andreas Dengel

机构 * Rheinland-Pfälzische Technische Universität Kaiserslautern-Landau(莱茵-瓦尔德大学凯泽斯劳滕-兰道分校) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 LD-ViCE通过潜在扩散模型生成高质量的视频反事实解释,提升模型可解释性和可信度。

Comments 44 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10155 2026-02-11 cs.CL 57%

What Should Feature Distillation Transfer in LLMs? A Task-Tangent Geometry View

LLM中特征蒸馏应转移什么?基于任务切线几何的观点

Khouloud Saadi, Di Wang

机构 * Department of Computer Science, King Abdullah University of Science and Technology(卡布斯大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出Flex-KD方法,通过任务切线几何视角实现有效的特征蒸馏,提升模型在语言理解和生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08295 2026-02-10 cs.AI 57%

The Vibe-Automation of Automation: A Proactive Education Framework for Computer Science in the Age of Generative AI

自动化之自动化:生成式人工智能时代计算机科学的前瞻性教育框架

Ilya Levin

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出Vibe-Automation概念,探讨生成式AI时代计算机科学教育的前瞻性框架,强调隐性规律的操作化与教育体系的变革。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08208 2026-02-10 cs.CL cs.HC 57%

LLMs and people both learn to form conventions -- just not with each other

大语言模型和人类都学会形成惯例——但并不是彼此之间

Cameron R. Jones, Agnese Lombardi, Kyle Mahowald, Benjamin K. Bergen

机构 * Department of Psychology, Stony Brook University(心理学系,石溪大学) Department of Cognitive Science, University of California San Diego(认知科学系,加州圣地亚哥大学) Department of Philology, Literature, and Linguistics, University of Pisa(philology、文学与语言学系,比萨大学) Department of Linguistics, University of Texas at Austin(语言学系,德克萨斯大学奥斯汀分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究发现人类和AI在同类型对话中能形成惯例,但人机对话效果较差,表明对话协调需要共同的解释偏见。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04413 2026-02-10 cs.LG quant-ph 57%

Distribution-Guided and Constrained Quantum Machine Unlearning

基于分布和约束的量子机器学习去学习

Nausherwan Malik, Zubair Khalid, Muhammad Faryad

机构 * Department of Electrical Engineering, Lahore University of Management Sciences, Lahore 54792, Pakistan.(电气工程系,拉合尔管理科学大学,巴基斯坦拉合尔) Department of Physics, Lahore University of Management Sciences, Lahore 54792, Pakistan.(物理系,拉合尔管理科学大学,巴基斯坦拉合尔)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种基于分布和约束的量子机器学习去学习框架,通过可调节的目标分布和保留约束,有效控制遗忘与保留行为之间的权衡,提升去学习的可靠性与可解释性。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08099 2026-02-10 cs.CV cs.AI 57%

VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval

VidVec:解锁视频MLLM嵌入用于视频-文本检索

Issar Tzachor, Dvir Samuel, Rami Ben-Ari

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 VidVec通过利用预训练MLLM的中间层嵌入和校准头部,实现无需训练的视频-文本检索,超越现有方法,达到最佳性能。

Comments Project page: https://iyttor.github.io/VidVec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07790 2026-02-10 cs.LG 57%

MaD-Mix: Multi-Modal Data Mixtures via Latent Space Coupling for Vision-Language Model Training

MaD-Mix: 通过潜在空间耦合实现多模态数据混合用于视觉-语言模型训练

Wanyun Xie, Francesco Tonin, Volkan Cevher

机构 * LIONS, EPFL(EPFL 雷奥尼实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 MaD-Mix通过潜在空间耦合实现多模态数据混合,提升视觉-语言模型训练效率,减少训练步骤并增强复杂场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07378 2026-02-10 cs.LG physics.data-an stat.ML 57%

Dichotomy of Feature Learning and Unlearning: Fast-Slow Analysis on Neural Networks with Stochastic Gradient Descent

特征学习与遗忘的二元性:基于随机梯度下降的神经网络快慢分析

Shota Imai, Sota Nishiyama, Masaaki Imaizumi

机构 * The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(RIKEN先进人工智能项目中心)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文研究了神经网络中特征学习与遗忘的二元性,通过快慢动态分析揭示特征遗忘的机制与条件,提出特征遗忘由数据主非线性项强度和第二层权重初始尺度决定。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18727 2026-02-10 cs.LG 57%

LogSyn: A Few-Shot LLM Framework for Structured Insight Extraction from Unstructured General Aviation Maintenance Logs

LogSyn: 一种基于少样本学习的LLM框架,用于从非结构化通用航空维护日志中提取结构化洞察

Devansh Agarwal, Maitreyi Chatterjee, Biplab Chatterjee

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 LogSyn通过少样本学习利用LLM将非结构化航空维护日志转化为结构化数据,实现故障模式识别与事件分类,提升航空维护流程和预测分析能力。

Comments Accepted in Proceedings of the 3rd INCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05176 2026-02-06 cs.CL 57%

Among Us: Measuring and Mitigating Malicious Contributions in Model Collaboration Systems

Among Us: 在模型协作系统中衡量并减轻恶意贡献

Ziyuan Yang, Wenxuan Ding, Shangbin Feng, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) New York University(纽约大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 研究针对模型协作系统中的恶意贡献问题,通过实验评估恶意模型的影响,并提出外部监督策略以缓解其影响。

Comments 19 pages, 15 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04929 2026-02-06 cs.LG 57%

TurboBoA: Faster and Exact Attention-aware Quantization without Backpropagation

TurboBoA: 更快且精确的注意力感知量化无需反向传播

Junhan Kim, Yeo Jeong Park, Seungwoo Son, Chungman Lee, Ho-young Kim, Joonyoung Kim, Yongkweon Jeon

机构 * Samsung Research(三星研究院) SNU.ac.kr(首尔国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 TurboBoA是一种无需反向传播的高效PTQ算法,通过联合量化和误差补偿提升精度与速度,实现比BoA更快的量化过程。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04903 2026-02-06 cs.LG 57%

Mind the Performance Gap: Capability-Behavior Trade-offs in Feature Steering

注意性能差距:特征引导中的能力-行为权衡

Eitan Sprejer, Oscar Agustín Stanchi, María Victoria Carro, Denise Alejandra Mester, Iván Arcuschin

机构 * BAISH, Universidad de Buenos Aires, Argentina(BAISH,布宜诺斯艾利斯大学,阿根廷) AISAR, AI Safety Argentina(AISAR,人工智能安全阿根廷) Instituto de Investigación en Informática LIDI, Universidad Nacional de La Plata, Argentina(信息研究所LIDI,拉普拉塔国立大学,阿根廷) FAIR, IALAB UBA, Universidad de Buenos Aires, Argentina(FAIR,IALAB UBA,布宜诺斯艾利斯大学,阿根廷) Università degli Studi di Genova, Italy(热那亚大学,意大利)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 研究发现特征引导方法在控制行为时显著降低模型性能,揭示了能力与行为之间的权衡问题。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05701 2026-02-06 cs.LG 57%

Statistically Valid Post-Deployment Monitoring Should Be Standard for AI-Based Digital Health

基于AI的数字健康应将统计上有效的部署后监控作为标准

Pavel Dolin, Weizhi Li, Gautam Dasarathy, Visar Berisha

机构 * Arizona State University(亚利桑那州立大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文主张基于AI的数字健康应采用统计上有效的部署后监控作为标准,提出统计有效且标签效率高的测试框架以确保现实部署的可靠性和安全性。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04570 2026-02-05 cs.CL 57%

Can LLMs capture stable human-generated sentence entropy measures?

大语言模型能否捕捉到稳定的人生成句子熵度量?

Estrella Pivel-Villanueva, Elisabeth Frederike Sterner, Franziska Knolle

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过实验证明大语言模型在捕捉人类生成句子熵方面的能力,发现GPT-4o与人类数据最一致,但LLMs无法完全替代稳定的人类分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13580 2026-02-05 cs.CL 57%

Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language Models

稀疏子网络增强用于大型语言模型中资源匮乏语言

Daniil Gurgurov, Tanja Baeumel, Josef van Genabith, Simon Ostermann

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Centre for European Research in Trusted AI (CERTAIN)(欧洲可信人工智能研究中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过稀疏子网络增强方法,提升大型语言模型在资源匮乏语言上的性能,同时保持通用能力,并展示了其在多个语言模型上的有效性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12387 2026-02-04 cs.LG cond-mat.dis-nn cond-mat.stat-mech math-ph math.MP q-bio.NC stat.ML 57%

Neural Thermodynamics: Entropic Forces in Deep and Universal Representation Learning

神经热力学:深度和通用表征学习中的熵力

Liu Ziyin, Yizhou Xu, Isaac Chuang

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出神经热力学理论,揭示深度学习中熵力与对称性打破对表征学习和优化行为的调控作用。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01734 2026-02-03 cs.LG 57%

MSign: An Optimizer Preventing Training Instability in Large Language Models via Stable Rank Restoration

MSign: 通过稳定秩恢复防止大语言模型训练不稳定

Lianhai Ren, Yucheng Ding, Xiao Liu, Qianxiao Li, Peng Cheng, Yeyun Gong

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 MSign通过稳定秩恢复机制防止大语言模型训练不稳定,有效减少训练失败并降低计算开销

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01598 2026-02-03 cs.CL 57%

The Art of Socratic Inquiry: A Framework for Proactive Template-Guided Therapeutic Conversation Generation

苏格拉底式探究的艺术:一种主动模板引导治疗对话生成的框架

Mingwen Zhang, Minqiang Yang, Changsheng Ma, Yang Yu, Hui Bai, Chen Xu, Xiangzhen Kong, Bin Hu

机构 * School of Information Science and Engineering, Lanzhou University(信息科学与工程学院,兰州大学) School of Medical Technology, Beijing Institute of Technology(医学技术学院,北京理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出Socratic Inquiry Framework,通过策略锚定和模板检索分离提问时机与内容,提升LLMs的主动提问能力,推动心理引导型大语言模型的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01525 2026-02-03 cs.HC cs.CY 57%

How Notations Evolve: A Historical Analysis with Implications for Supporting User-Defined Abstractions

符号如何演变:一种历史分析及其对支持用户定义抽象的启示

Jingyue Zhang, J. D. Zamfirescu-Pereira, Elena L. Glassman, Damien Masson, Ian Arawjo

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 本文通过历史分析探讨符号演变的三个社会阶段和三个功能阶段,提出如何设计支持用户定义抽象的新系统。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05825 2026-02-03 cs.HC cs.AI 57%

Decoding Workload and Agreement From EEG During Spoken Dialogue With Conversational AI

从语音对话中解码工作负荷与共识的EEG信号

Lucija Mihić Zidar, Philipp Wicke, Praneel Bhatia, Rosa Lutz, Marius Klug, Thorsten O. Zander

机构 * Chair of Neuroadaptive Human--Computer Interaction(神经适应性人机交互教授席位) Brandenburg Technical University Cottbus--Senftenberg(勃兰登堡技术大学库滕堡-森芬根堡分校) Auryal GmbH(Auryal公司) Cottbus, Germany(库滕堡,德国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过EEG解码语音对话中的工作负荷与共识,验证了现有分类器在对话场景中的迁移能力,并探讨了其应用限制。

Comments Accepted at the 14th International Winter Conference on Brain-Computer Interface

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01443 2026-02-03 cs.AI 57%

SimGym: Traffic-Grounded Browser Agents for Offline A/B Testing in E-Commerce

SimGym:基于流量的浏览器代理用于电子商务中的离线A/B测试

Alberto Castelo, Zahra Zanjani Foumani, Ailin Fan, Keat Yang Koay, Vibhor Malik, Yuanzheng Zhu, Han Li, Meysam Feghhi, Ronie Uliana, Shuang Xie, Zhaoyu Zhang, Angelo Ocana Martins, Mingyu Zhao, Francis Pelland, Jonathan Faerman, Nikolas LeBlanc, Aaron Glazer, Andrew McNamara, Lingyun Wang, Zhong Wu

机构 * Shopify

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SimGym通过基于流量的合成买家和大型语言模型代理,实现快速离线A/B测试,提升电子商务实验效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01382 2026-02-03 cs.CV cs.LG 57%

PromptRL: Prompt Matters in RL for Flow-Based Image Generation

PromptRL: 流基于图像生成中强化学习中提示的重要性

Fu-Yun Wang, Han Zhang, Michael Gharbi, Hongsheng Li, Taesung Park

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) Meta Superintelligence Labs, USA(Meta超智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 PromptRL通过整合语言模型作为可训练的提示精修代理,提升流基于图像生成中强化学习的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏