Curvature-Aware Safety Restoration In LLMs Fine-Tuning
曲率感知的LLM微调安全恢复
专题命中 其他安全 :safety(title,abstract);alignment(abstract);分类 cs.LG
AI总结 本研究提出曲率感知对齐恢复方法,通过影响函数和二阶优化,在保持任务性能的同时减少有害输出,提升LLM的安全性和实用性。
Comments 19 pages, 10 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
曲率感知的LLM微调安全恢复
专题命中 其他安全 :safety(title,abstract);alignment(abstract);分类 cs.LG
AI总结 本研究提出曲率感知对齐恢复方法,通过影响函数和二阶优化,在保持任务性能的同时减少有害输出,提升LLM的安全性和实用性。
Comments 19 pages, 10 figures
EEG-VLM:一种具有多级特征对齐和视觉增强语言引导推理的分层视觉-语言模型,用于基于EEG图像的睡眠阶段预测
机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) ; Department of Control Science and Engineering, College of Electronics and Information Engineering, Tongji University(同济大学电子信息工程学院控制科学与工程系) ; Tencent Youtu Lab(腾讯云视觉实验室) ; Case Western Reserve University(凯斯西储大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 EEG-VLM通过多级特征对齐和视觉增强语言引导推理,提升基于EEG图像的睡眠阶段分类的准确性和可解释性。
利用多模态语言模型评估婴儿的视觉和语言经验一致性
机构 * Department of Psychology, Stanford University(心理学系,斯坦福大学) ; Department of Psychology, University of California, San Diego(心理学系,加州大学圣地亚哥分校) ; Department of Psychology, Tsinghua University(心理学系,清华大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 基于多模态语言模型评估婴儿视觉与语言经验一致性,揭示日常学习中视觉与语言对齐的稀有性及跨儿童差异。
VideoLights: 用于联合视频亮点检测和时刻检索的特征细化与跨任务对齐变换器
机构 * North South University(北南大学) ; Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 VideoLights通过引入特征细化、跨模态融合和联合任务反馈机制,提升视频亮点检测与时刻检索的性能。
模型到模型知识传输(M2KT):一种无数据的跨模型理解迁移框架
机构 * Department of Computer Science(计算机科学系) ; Engineering MIT-World Peace University, Pune, India(工程学院 MIT-世界和平大学 印度邦普尼)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 M2KT提出了一种无数据的跨模型知识传输方法,通过概念空间交换知识包,实现高效的知识迁移和模型自我改进。
Comments 8 pages including figures, prepared in IEEE conference style. Preprint. Work in progress
在机器中N400:定位因果语言模型检测语义违规的位置
机构 * Independent Researcher(独立研究者) ; Université Paris 8 Vincennes - Saint-Denis, Paris, France(巴黎第八大学凡尔赛-圣但尼分校)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨因果语言模型如何检测语义违规,发现模型在中间层能有效区分合理与不合理句子,且违规信息在中间瓶颈后坍塌,与人类阅读中语义异常检测的理论相呼应。
Comments Accepted at AICS2025
MAGMA-Edu:多智能体生成多模态框架用于文本-图表教育问题生成
机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 MAGMA-Edu通过多智能体框架实现教育问题生成,提升文本与图像的一致性,达到多模态教育内容生成的新水平。
探讨表示通用性:谱系表示的案例研究
机构 * MIT(麻省理工学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本研究探讨了大型语言模型在表示谱系信息时的通用性,通过两种实验证据验证图结构表示的通用性,并指出缺乏地面真实表示的挑战。
Comments 14 pages, 7 figures
Journal ref NeurIPS 2025 Workshop on Responsible Foundation Models
弱监督潜在模型用于任务特定的视觉语言控制
机构 * Industrial AI Lab, Hitachi America, Ltd.(日立美国有限公司工业人工智能实验室)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种任务特定的潜在动态模型,利用目标状态监督学习动作诱导位移,以提高空间定位任务中的视觉语言控制性能。
反转镜头:利用可解释人工智能理解人类专家能力
机构 * Department of Photon Science(光子科学系) ; SLAC National Accelerator Laboratory(SLAC国家加速器实验室) ; Department of Machine Learning(机器学习系)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本研究利用可解释人工智能方法分析人类在调节粒子加速器任务中的学习过程,揭示专家能力发展中的问题分解与策略演变机制。
将认知处理信号整合进语言模型:关于进展、应用与未来方向的综述
机构 * Telefónica Scientific Research(Telefónica科学研究院) ; Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文综述了将认知信号,特别是眼动数据整合到语言模型中的最新进展、应用及未来方向,探讨了其在提升模型性能和解决环境成本方面的潜力。
连接大语言模型规划代理与形式方法:计划验证的案例研究
机构 * J.P. Morgan AI Research(摩根大通人工智能研究)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出一种利用大语言模型将自然语言计划转换为形式化逻辑并进行验证的框架,展示了GPT-5在计划验证中的高准确率及形式化表示的生成能力。
Comments Accepted to AgenticSE Workshop at ASE 2025
相关性路径:交叉编码器如何实现语义变体的BM25
机构 * Brown University(布朗大学) ; University of Tübingen(图宾根大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本文通过分析交叉编码器的机制,揭示其如何通过结合传统相关性信号实现语义变体的BM25排序功能。
去WEIRD化LLM实体推荐
专题命中 其他安全 :alignment(abstract);分类 cs.CY
AI总结 本文研究了LLM在现实世界实体推荐中的文化偏见,通过WEIRD框架评估并应用多元提示策略以减轻偏见,发现不同模型的偏见减轻效果不一致。
利用视觉语言模型和领域特定微调进行建筑规范中的表格理解
专题命中 其他安全 :safety(abstract);分类 cs.CL
AI总结 本文研究了利用视觉语言模型和领域特定微调提取建筑规范中表格信息的方法,发现直接输入方法在准确性上优于间接输入方法,且微调后模型性能显著提升。
MeteorPred:一种用于恶劣天气事件预测的气象多模态大模型和数据集
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Zhongguancun Academy, Beijing(中关村学院) ; China Meteorological Administration(中国气象局)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 MeteorPred提出一种多模态大模型和数据集,用于提升恶劣天气事件预测的准确性和自动化水平。
对话:喜欢它们,讨厌它们,引导它们
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本文通过激活工程引导LLaMA 3.1-8B增强情感表达,提升对话AI的共情能力。
Comments We have created a new arXiv submission with a more up to date version of this paper at arXiv:2511.12832
Video-RAG: 基于视觉对齐的检索增强长视频理解
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) ; Nanjing University(南京大学) ; University of Rochester(罗切斯特大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 Video-RAG通过视觉对齐的辅助文本提升长视频理解性能,无需训练且兼容性强,显著优于专有模型。
Comments Accepted at NeurIPS 2025. Camera-ready version
DAS: 基于双对齐语义ID的工业推荐系统
专题命中 其他安全 :alignment(abstract)
AI总结 DAS通过双对齐语义ID方法,提升推荐系统中多模态内容整合与协同信号对齐效率,有效解决信息损失与灵活性问题。
Comments Accepted by CIKM 2025
MINDiff: 集成掩码的负关注用于控制文本到图像个性化中的过拟合
机构 * Kyungpook National University(庆尚国立大学)
专题命中 其他安全 :alignment(abstract)
AI总结 MINDiff通过在推理过程中引入负关注机制,有效控制文本到图像个性化中的过拟合问题,无需修改模型架构即可提升文本对齐度和主题保真度。
Comments Accepted at ICCV 2025 Personalization in Generative AI Workshop
仅视觉的高斯散射用于协作语义占用预测
专题命中 其他安全 :alignment(abstract)
AI总结 本研究提出基于稀疏3D语义高斯散射的协作语义占用预测方法,通过高效融合和减少通信开销,提升了协作感知的性能和鲁棒性。
Comments Accepted by AAAI 2026 (Oral)
对流行大语言模型生成的代码在MISRA C++合规性方面的比较分析
专题命中 其他安全 :safety(abstract)
AI总结 本文比较了多种大语言模型生成的C++代码在MISRA C++合规性上的表现,发现ChatGPT在合规性上表现最佳,而其他模型存在不同程度的违规问题。
Journal ref in IEEE Access, vol. 13, pp. 194815-194831, 2025
哪些特征使ChatGPT在软件问题解决中有效?对GitHub问题中任务、项目和对话信号的实证研究
专题命中 其他安全 :alignment(abstract)
AI总结 本文研究了ChatGPT在软件问题解决中的有效性特征,发现其在代码生成和工具推荐方面表现较好,但代码解释能力较弱,且更受欢迎的项目和经验丰富的开发者从中受益更多。
Comments Accepted for publication in Empirical Software Engineering (EMSE), 2025
Journal ref Empirical Software Engineering, 31, 22 (2026)