arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-12 至 2026-02-12 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 13 篇

2602.09877 2026-02-12 cs.CL 83%

The Devil Behind Moltbook: Anthropic Safety is Always Vanishing in Self-Evolving AI Societies

Moltbook背后的魔鬼:在自我进化的AI社会中,人类安全始终在消失

Chenxu Wang, Chaozhuo Li, Songyang Liu, Zejian Chen, Jinyu Hou, Ji Qi, Rui Li, Litian Zhang, Qiwei Ye, Zheng Liu, Xu Chen, Xi Zhang, Philip S. Yu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Renmin University of China(中国人民大学) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 其他安全 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 研究揭示了自我进化AI社会中安全持续性的不可能性,并提出解决方案以缓解安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10593 2026-02-12 cs.CV 71%

Fast Person Detection Using YOLOX With AI Accelerator For Train Station Safety

利用YOLOX与AI加速器的快速人员检测用于车站安全

Mas Nurul Achmadiah, Novendra Setyawan, Achmad Arif Bryantono, Chi-Chia Sun, Wen-Kai Kuo

机构 * Department of Electro-Optics, National Formosa University, Taiwan(国立Formosa大学电子光学系) Department of Electrical Engineering, National Taipei University, Taiwan(国立台北大学电子工程系) Department of Electrical Engineering, University of Muhammadiyah Malang, Indonesia(穆罕默迪亚大学Malang分校电子工程系) Department of Electronics Engineering, State Polytechnic of Malang, Indonesia(Malang州立理工学院电子工程系) Smart Manufacturing and Intelligent Machinery Research Center, National Formosa University, Taiwan(国立Formosa大学智能制造与智能机械研究中心) Department of Electronics Engineering, National Formosa University, Taiwan(国立Formosa大学电子工程系)

专题命中 其他安全 :safety(title)

AI总结 本文提出利用YOLOX与Hailo-8 AI加速器提高车站乘客检测的准确性和效率

Comments 6 pages, 8 figures, 2 tables. Presented at 2024 International Electronics Symposium (IES). IEEE DOI: 10.1109/IES63037.2024.10665874

Journal ref 2024 International Electronics Symposium (IES), pp. 504-509, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05228 2026-02-12 cs.AI 70%

Surgery: Mitigating Harmful Fine-Tuning for Large Language Models via Attention Sink

手术:通过注意力sink缓解大型语言模型的有害微调

Guozhi Liu, Weiwei Lin, Tiansheng Huang, Ruichao Mo, Qi Mu, Xiumin Wang, Li Shen

机构 * South China University of Technology(南方科技大学) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 Surgery通过注意力sink机制在微调阶段抑制有害模式学习,提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11924 2026-02-12 cs.CL cs.AI cs.LG 67%

Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability

大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示

Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。

Journal ref 4th Deployable AI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11024 2026-02-12 cs.CV cs.AI 57%

Chain-of-Look Spatial Reasoning for Dense Surgical Instrument Counting

密集手术器械计数的链式观察空间推理

Rishikesh Bhyri, Brian R Quaranto, Philip J Seger, Kaity Tung, Brendan Fox, Gene Yang, Steven D. Schwaitzberg, Junsong Yuan, Nan Xi, Peter C W Kim

机构 * State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出Chain-of-Look框架,通过结构化视觉链提升密集手术器械计数的准确性,并引入邻近损失函数和SurgCount-HD数据集,实验证明其在复杂场景中的优越性能。

Comments Accepted to WACV 2026. This version includes additional authors who contributed during the rebuttal phase

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10597 2026-02-12 cs.CY 57%

Llama-Polya: Instruction Tuning for Large Language Model based on Polya's Problem-solving

Llama-Polya:基于波利亚问题解决框架的大型语言模型指令调优

Unggi Lee, Yeil Jeong, Chohui Lee, Gyuri Byun, Yunseo Lee, Minji Kang, Minji Jeon

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 Llama-Polya通过整合波利亚问题解决框架,提升大型语言模型在数学推理和教学对齐方面的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10454 2026-02-12 cs.CL 57%

LATA: A Tool for LLM-Assisted Translation Annotation

LATA:一个辅助翻译标注的工具

Baorong Huang, Ali Asiri

机构 * School of Foreign Languages, Huaihua University(怀化大学外语学院) Alith University College, Umm al-Qura University(乌姆·阿尔·库拉大学阿利思大学学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 LATA是一个利用大语言模型辅助的翻译标注工具,旨在提高标注效率的同时保持语言学精度,适用于结构差异大的语言对。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10153 2026-02-12 cs.CR cs.LG cs.SE 57%

Basic Legibility Protocols Improve Trusted Monitoring

基础可读性协议提升可信监控

Ashwin Sreevatsa, Sebastian Prasanna, Cody Rushing

机构 * Cambridge Boston Alignment Initiative (CBAI) Summer Research Fellowship(剑桥波士顿对齐计划暑期研究奖学金) Redwood Research(红木研究)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本研究提出可读性协议,通过鼓励不受信任模型产生易于监控评估的行为,提升可信监控的安全性,同时增强监控者对诚实代码的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03737 2026-02-12 cs.LG 57%

Soft Sensor for Bottom-Hole Pressure Estimation in Petroleum Wells Using Long Short-Term Memory and Transfer Learning

基于长短期记忆与迁移学习的石油井底压力估计软传感器

M. A. Fernandes, E. Gildin, M. A. Sampaio

机构 * University of São Paulo(圣保罗大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出基于LSTM和迁移学习的石油井底压力估计软传感器,通过实测数据验证其在成本和精度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04518 2026-02-12 eess.AS cs.CL 57%

Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model

迈向单个语音语言模型中的高效语音-文本联合解码

Haibin Wu, Yuxuan Hu, Ruchao Fan, Xiaofei Wang, Kenichi Kumatani, Bo Ren, Jianwei Yu, Heng Lu, Lijuan Wang, Yao Qian, Jinyu Li

机构 * Microsoft(微软公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种早停交错解码方法,以提升语音-文本联合解码的效率和性能,并通过高质量QA数据集进一步优化语音问答性能。

Comments Accepted by ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10701 2026-02-12 cs.HC 50%

Don't blame me: How Intelligent Support Affects Moral Responsibility in Human Oversight

不要责怪我:智能支持如何影响人类监督中的道德责任

Cedric Faas, Richard Uth, Sarah Sterz, Markus Langer, Anna Maria Feit

专题命中 其他安全 :safety(abstract)

AI总结 研究探讨了智能支持系统如何影响人类在监督任务中的道德责任感知,发现限制选择会降低责任感知,但对其他相关方的责任判断无影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10411 2026-02-12 cs.IR 50%

GeoGR: A Generative Retrieval Framework for Spatio-Temporal Aware POI Recommendation

GeoGR: 一种面向空间时间感知的POI推荐生成框架

Fangye Wang, Haowen Lin, Yifang Yuan, Siyuan Wang, Xiaojiang Zhou, Song Yang, Pengjie Wang

专题命中 其他安全 :alignment(abstract)

AI总结 GeoGR是一种面向空间时间感知的POI推荐生成框架,通过两阶段设计提升POI推荐的准确性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05826 2026-02-12 cs.HC 50%

Whispers of the Butterfly: A Research-through-Design Exploration of In-Situ Conversational AI Guidance in Large-Scale Outdoor MR Exhibitions

蝴蝶低语:一种在大规模户外MR展览中现场对话式AI引导的研以致用探索

Dongyijie Primo Pan, Shuyue Li, Yawei Zhao, Junkun Long, Hao Li, Pan Hui

专题命中 其他安全 :safety(abstract)

AI总结 本文通过研以致用方法,开发了Dream-Butterfly,一种在户外MR展览中提供多语言解释的AI导览员,探索了人机协作在安全受限环境中的应用与影响。

详情

展开后加载摘要…

URL PDF HTML 收藏