arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-25 至 2025-11-25 共收录 23 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 23 篇

2511.18039 2025-11-25 cs.LG 83%

Curvature-Aware Safety Restoration In LLMs Fine-Tuning

曲率感知的LLM微调安全恢复

Thong Bach, Thanh Nguyen-Tang, Dung Nguyen, Thao Minh Le, Truyen Tran

专题命中 其他安全 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 本研究提出曲率感知对齐恢复方法,通过影响函数和二阶优化,在保持任务性能的同时减少有害输出,提升LLM的安全性和实用性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19155 2025-11-25 cs.AI 79%

EEG-VLM: A Hierarchical Vision-Language Model with Multi-Level Feature Alignment and Visually Enhanced Language-Guided Reasoning for EEG Image-Based Sleep Stage Prediction

EEG-VLM:一种具有多级特征对齐和视觉增强语言引导推理的分层视觉-语言模型,用于基于EEG图像的睡眠阶段预测

Xihe Qiu, Gengchen Ma, Haoyu Wang, Chen Zhan, Xiaoyu Tan, Shuo Li

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Department of Control Science and Engineering, College of Electronics and Information Engineering, Tongji University(同济大学电子信息工程学院控制科学与工程系) Tencent Youtu Lab(腾讯云视觉实验室) Case Western Reserve University(凯斯西储大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 EEG-VLM通过多级特征对齐和视觉增强语言引导推理,提升基于EEG图像的睡眠阶段分类的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18824 2025-11-25 cs.CV cs.CL 79%

Assessing the alignment between infants' visual and linguistic experience using multimodal language models

利用多模态语言模型评估婴儿的视觉和语言经验一致性

Alvin Wei Ming Tan, Jane Yang, Tarun Sepuri, Khai Loong Aw, Robert Z. Sparks, Zi Yin, Virginia A. Marchman, Michael C. Frank, Bria Long

机构 * Department of Psychology, Stanford University(心理学系,斯坦福大学) Department of Psychology, University of California, San Diego(心理学系,加州大学圣地亚哥分校) Department of Psychology, Tsinghua University(心理学系,清华大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 基于多模态语言模型评估婴儿视觉与语言经验一致性,揭示日常学习中视觉与语言对齐的稀有性及跨儿童差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01558 2025-11-25 cs.CV cs.AI 79%

VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval

VideoLights: 用于联合视频亮点检测和时刻检索的特征细化与跨任务对齐变换器

Dhiman Paul, Md Rizwan Parvez, Nabeel Mohammed, Shafin Rahman

机构 * North South University(北南大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 VideoLights通过引入特征细化、跨模态融合和联合任务反馈机制,提升视频亮点检测与时刻检索的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17638 2025-11-25 cs.LG cs.AI 73%

Model-to-Model Knowledge Transmission (M2KT): A Data-Free Framework for Cross-Model Understanding Transfer

模型到模型知识传输(M2KT):一种无数据的跨模型理解迁移框架

Pratham Sorte

机构 * Department of Computer Science(计算机科学系) Engineering MIT-World Peace University, Pune, India(工程学院 MIT-世界和平大学 印度邦普尼)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 M2KT提出了一种无数据的跨模型知识传输方法,通过概念空间交换知识包,实现高效的知识迁移和模型自我改进。

Comments 8 pages including figures, prepared in IEEE conference style. Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19232 2025-11-25 cs.CL cs.AI 62%

In Machina N400: Pinpointing Where a Causal Language Model Detects Semantic Violations

在机器中N400:定位因果语言模型检测语义违规的位置

Christos-Nikolaos Zacharopoulos, Revekka Kyriakoglou

机构 * Independent Researcher(独立研究者) Université Paris 8 Vincennes - Saint-Denis, Paris, France(巴黎第八大学凡尔赛-圣但尼分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨因果语言模型如何检测语义违规,发现模型在中间层能有效区分合理与不合理句子,且违规信息在中间瓶颈后坍塌,与人类阅读中语义异常检测的理论相呼应。

Comments Accepted at AICS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18714 2025-11-25 cs.AI cs.CY 62%

MAGMA-Edu: Multi-Agent Generative Multimodal Framework for Text-Diagram Educational Question Generation

MAGMA-Edu:多智能体生成多模态框架用于文本-图表教育问题生成

Zhenyu Wu, Jian Li, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 MAGMA-Edu通过多智能体框架实现教育问题生成,提升文本与图像的一致性,达到多模态教育内容生成的新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08255 2025-11-25 cs.LG cs.AI 62%

Investigating Representation Universality: Case Study on Genealogical Representations

探讨表示通用性:谱系表示的案例研究

David D. Baek, Yuxiao Li, Max Tegmark

机构 * MIT(麻省理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了大型语言模型在表示谱系信息时的通用性,通过两种实验证据验证图结构表示的通用性,并指出缺乏地面真实表示的挑战。

Comments 14 pages, 7 figures

Journal ref NeurIPS 2025 Workshop on Responsible Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18319 2025-11-25 cs.AI cs.LG cs.SY eess.SY 62%

Weakly-supervised Latent Models for Task-specific Visual-Language Control

弱监督潜在模型用于任务特定的视觉语言控制

Xian Yeow Lee, Lasitha Vidyaratne, Gregory Sin, Ahmed Farahat, Chetan Gupta

机构 * Industrial AI Lab, Hitachi America, Ltd.(日立美国有限公司工业人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种任务特定的潜在动态模型,利用目标状态监督学习动作诱导位移,以提高空间定位任务中的视觉语言控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13814 2025-11-25 cs.HC cs.AI cs.LG 62%

Reversing the Lens: Using Explainable AI to Understand Human Expertise

反转镜头:利用可解释人工智能理解人类专家能力

Roussel Rahman, Aashwin Ananda Mishra, Wan-Lin Hu

机构 * Department of Photon Science(光子科学系) SLAC National Accelerator Laboratory(SLAC国家加速器实验室) Department of Machine Learning(机器学习系)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用可解释人工智能方法分析人类在调节粒子加速器任务中的学习过程,揭示专家能力发展中的问题分解与策略演变机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06843 2025-11-25 cs.CL cs.AI 62%

Integrating Cognitive Processing Signals into Language Models: A Review of Advances, Applications and Future Directions

将认知处理信号整合进语言模型:关于进展、应用与未来方向的综述

Angela Lopez-Cardona, Sebastian Idesis, Ioannis Arapakis

机构 * Telefónica Scientific Research(Telefónica科学研究院) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了将认知信号,特别是眼动数据整合到语言模型中的最新进展、应用及未来方向,探讨了其在提升模型性能和解决环境成本方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03469 2025-11-25 cs.AI cs.LO 57%

Bridging LLM Planning Agents and Formal Methods: A Case Study in Plan Verification

连接大语言模型规划代理与形式方法:计划验证的案例研究

Keshav Ramani, Vali Tawosi, Salwa Alamir, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种利用大语言模型将自然语言计划转换为形式化逻辑并进行验证的框架,展示了GPT-5在计划验证中的高准确率及形式化表示的生成能力。

Comments Accepted to AgenticSE Workshop at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04645 2025-11-25 cs.IR cs.AI 57%

Pathway to Relevance: How Cross-Encoders Implement a Semantic Variant of BM25

相关性路径:交叉编码器如何实现语义变体的BM25

Meng Lu, Catherine Chen, Carsten Eickhoff

机构 * Brown University(布朗大学) University of Tübingen(图宾根大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文通过分析交叉编码器的机制,揭示其如何通过结合传统相关性信号实现语义变体的BM25排序功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18403 2025-11-25 cs.CY 57%

UnWEIRDing LLM Entity Recommendations

去WEIRD化LLM实体推荐

Aayush Kumar, Sanket Mhatre

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 本文研究了LLM在现实世界实体推荐中的文化偏见,通过WEIRD框架评估并应用多元提示策略以减轻偏见,发现不同模型的偏见减轻效果不一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18306 2025-11-25 cs.CL 57%

Table Comprehension in Building Codes using Vision Language Models and Domain-Specific Fine-Tuning

利用视觉语言模型和领域特定微调进行建筑规范中的表格理解

Mohammad Aqib, Mohd Hamza, Ying Hei Chui, Qipei Mei

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 本文研究了利用视觉语言模型和领域特定微调提取建筑规范中表格信息的方法,发现直接输入方法在准确性上优于间接输入方法,且微调后模型性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06859 2025-11-25 cs.AI cs.CV 57%

MeteorPred: A Meteorological Multimodal Large Model and Dataset for Severe Weather Event Prediction

MeteorPred:一种用于恶劣天气事件预测的气象多模态大模型和数据集

Shuo Tang, Jian Xu, Jiadong Zhang, Yi Chen, Qizhao Jin, Lingdong Shen, Chenglin Liu, Shiming Xiang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy, Beijing(中关村学院) China Meteorological Administration(中国气象局)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 MeteorPred提出一种多模态大模型和数据集,用于提升恶劣天气事件预测的准确性和自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17413 2025-11-25 cs.CL 57%

Conversations: Love Them, Hate Them, Steer Them

对话:喜欢它们,讨厌它们,引导它们

Niranjan Chebrolu, Gerard Christopher Yeo, Kokil Jaidka

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文通过激活工程引导LLaMA 3.1-8B增强情感表达,提升对话AI的共情能力。

Comments We have created a new arXiv submission with a more up to date version of this paper at arXiv:2511.12832

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13093 2025-11-25 cs.CV cs.AI 57%

Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension

Video-RAG: 基于视觉对齐的检索增强长视频理解

Yongdong Luo, Xiawu Zheng, Guilin Li, Shukang Yin, Haojia Lin, Chaoyou Fu, Jinfa Huang, Jiayi Ji, Fei Chao, Jiebo Luo, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Nanjing University(南京大学) University of Rochester(罗切斯特大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Video-RAG通过视觉对齐的辅助文本提升长视频理解性能,无需训练且兼容性强,显著优于专有模型。

Comments Accepted at NeurIPS 2025. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10584 2025-11-25 cs.IR 50%

DAS: Dual-Aligned Semantic IDs Empowered Industrial Recommender System

DAS: 基于双对齐语义ID的工业推荐系统

Wencai Ye, Mingjie Sun, Shaoyun Shi, Peng Wang, Wenjin Wu, Peng Jiang

专题命中 其他安全 :alignment(abstract)

AI总结 DAS通过双对齐语义ID方法,提升推荐系统中多模态内容整合与协同信号对齐效率,有效解决信息损失与灵活性问题。

Comments Accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17888 2025-11-25 cs.CV 50%

MINDiff: Mask-Integrated Negative Attention for Controlling Overfitting in Text-to-Image Personalization

MINDiff: 集成掩码的负关注用于控制文本到图像个性化中的过拟合

Seulgi Jeong, Jaeil Kim

机构 * Kyungpook National University(庆尚国立大学)

专题命中 其他安全 :alignment(abstract)

AI总结 MINDiff通过在推理过程中引入负关注机制,有效控制文本到图像个性化中的过拟合问题,无需修改模型架构即可提升文本对齐度和主题保真度。

Comments Accepted at ICCV 2025 Personalization in Generative AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10936 2025-11-25 cs.CV cs.RO 50%

Vision-Only Gaussian Splatting for Collaborative Semantic Occupancy Prediction

仅视觉的高斯散射用于协作语义占用预测

Cheng Chen, Hao Huang, Saurabh Bagchi

专题命中 其他安全 :alignment(abstract)

AI总结 本研究提出基于稀疏3D语义高斯散射的协作语义占用预测方法,通过高效融合和减少通信开销,提升了协作感知的性能和鲁棒性。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23535 2025-11-25 cs.SE 50%

Comparative Analysis of the Code Generated by Popular Large Language Models (LLMs) for MISRA C++ Compliance

对流行大语言模型生成的代码在MISRA C++合规性方面的比较分析

Malik Muhammad Umer

专题命中 其他安全 :safety(abstract)

AI总结 本文比较了多种大语言模型生成的C++代码在MISRA C++合规性上的表现,发现ChatGPT在合规性上表现最佳,而其他模型存在不同程度的违规问题。

Journal ref in IEEE Access, vol. 13, pp. 194815-194831, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22390 2025-11-25 cs.SE 50%

What Characteristics Make ChatGPT Effective for Software Issue Resolution? An Empirical Study of Task, Project, and Conversational Signals in GitHub Issues

哪些特征使ChatGPT在软件问题解决中有效?对GitHub问题中任务、项目和对话信号的实证研究

Ramtin Ehsani, Sakshi Pathak, Esteban Parra, Sonia Haiduc, Preetha Chatterjee

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究了ChatGPT在软件问题解决中的有效性特征,发现其在代码生成和工具推荐方面表现较好,但代码解释能力较弱,且更受欢迎的项目和经验丰富的开发者从中受益更多。

Comments Accepted for publication in Empirical Software Engineering (EMSE), 2025

Journal ref Empirical Software Engineering, 31, 22 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏