arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-17 至 2025-12-17 共收录 41 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2512.13699 2025-12-17 cs.CY 57%

Us-vs-Them bias in Large Language Models

大语言模型中的‘我们 vs 他们’偏见

Tabia Tanzin Prama, Julia Witte Zimmerman, Christopher M. Danforth, Peter Sheridan Dodds

专题命中 AI治理与伦理 :DPO(abstract);分类 cs.CY

AI总结 本研究发现大语言模型在不同人设下表现出‘我们 vs 他们’偏见,通过微调和DPO方法可有效缓解这种偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他安全 10 篇

2511.15464 2025-12-17 cs.CV cs.LG 79%

SIGMMA: Hierarchical Graph-Based Multi-Scale Multi-modal Contrastive Alignment of Histopathology Image and Spatial Transcriptome

SIGMMA:基于层次图的多尺度多模态对比对齐:组织病理图像与空间转录组

Dabin Jeong, Amirhossein Vahidi, Ciro Ramírez-Suástegui, Marie Moullet, Kevin Ly, Mohammad Vali Sanian, Sebastian Birk, Yinshui Chang, Adam Boxall, Daniyal Jafree, Lloyd Steele, Vijaya Baskar MS, Muzlifah Haniffa, Mohammad Lotfollahi

机构 * Wellcome Sanger Institute(沃森桑格研究所) Cambridge Centre for AI in Medicine(剑桥人工智能医学中心) Institute of AI for Health(人工智能与健康研究所) Cambridge Stem Cell Institute(剑桥干细胞研究所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 SIGMMA通过多尺度多模态对比对齐,提升组织病理图像与空间转录组的跨模态对应表示,提高基因表达预测和跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13974 2025-12-17 cs.RO 78%

Autonomous Construction-Site Safety Inspection Using Mobile Robots: A Multilayer VLM-LLM Pipeline

基于移动机器人的自主施工工地安全检查:一种多层VLM-LLM流水线

Hossein Naderi, Alireza Shojaei, Philip Agee, Kereshmeh Afsari, Abiola Akanmu

专题命中 其他安全 :safety(title,abstract)

AI总结 本文提出一种多层VLM-LLM流水线,通过机器人自主导航与人工智能结合,实现施工工地安全检查的自动化报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13201 2025-12-17 cs.IR 78%

Cog-RAG: Cognitive-Inspired Dual-Hypergraph with Theme Alignment Retrieval-Augmented Generation

Cog-RAG: 基于认知的双超图主题对齐检索增强生成

Hao Hu, Yifan Feng, Ruoxue Li, Rundong Xue, Xingliang Hou, Zhiqiang Tian, Yue Gao, Shaoyi Du

专题命中 其他安全 :alignment(title,abstract)

AI总结 Cog-RAG通过双超图结构和主题对齐策略,提升检索增强生成的语义对齐与生成一致性。

Comments Accepted by AAAI 2026 main conference

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14320 2025-12-17 cs.CV cs.AI cs.CY cs.LG 67%

Semantic Mismatch and Perceptual Degradation: A New Perspective on Image Editing Immunity

语义不匹配与感知退化:图像编辑免疫的新视角

Shuai Dong, Jie Zhang, Guoying Zhao, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of China Academy of Sciences(中国科学院大学) Center for Machine Vision and Signal Analysis, University of Oulu(信号分析中心,奥卢大学) School of Computer Science, China University of Geosciences(计算机科学学院,中国地质大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出SIFM方法和ISR度量标准,通过语义不匹配和感知退化来评估图像编辑免疫效果,提升对抗恶意扩散式操纵的能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10400 2025-12-17 cs.MA cs.AI cs.CL 62%

Rethinking the Reliability of Multi-agent System: A Perspective from Byzantine Fault Tolerance

重新思考多智能体系统可靠性:从拜占庭容错的角度出发

Lifan Zheng, Jiawei Chen, Qinghong Yin, Jingyuan Zhang, Xinyi Zeng, Yu Tian

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12875 2025-12-17 cs.AI 57%

LTA-thinker: Latent Thought-Augmented Training Framework for Large Language Models on Complex Reasoning

LTA-thinker: 用于复杂推理的大语言模型的潜在思维增强训练框架

Jiaqi Wang, Binquan Ji, Haibo Luo, Yiyang Qi, Ruiting Li, Huiyan Wang, Yuantao Han, Cangyi Yang, jiaxu Zhang, Feiliang Ren

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 LTA-Thinker通过提升潜在思维分布方差和信息效率,优化大语言模型的复杂推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14130 2025-12-17 cs.CR cs.AI 57%

UIXPOSE: Mobile Malware Detection via Intention-Behaviour Discrepancy Analysis

基于意图-行为不一致分析的移动恶意软件检测:UIXPOSE

Amirmohammad Pasdar, Toby Murray, Van-Thuan Pham

机构 * School of Computing and Information Systems(计算与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 UIXPOSE通过意图-行为不一致分析提升移动恶意软件的动态检测能力

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13716 2025-12-17 cs.AI 57%

ValuePilot: A Two-Phase Framework for Value-Driven Decision-Making

ValuePilot:一种面向价值驱动决策的双阶段框架

Yitong Luo, Ziang Chen, Hou Hei Lam, Jiayu zhan, Junqi Wang, Zhenliang Zhang, Xue Feng

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(1 通用人工智能国家重点实验室,BIGAI) Tsinghua University(2 清华大学) Peking University(3 北京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 ValuePilot通过双阶段框架实现价值驱动的个性化决策,提升AI在复杂场景中的可解释性和适应性。

Comments Accepted at LAW Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01149 2025-12-17 cs.IR 50%

ModernVBERT: Towards Smaller Visual Document Retrievers

ModernVBERT: 向更小的视觉文档检索器迈进

Paul Teiletche, Quentin Macé, Max Conti, Antonio Loison, Gautier Viaud, Pierre Colombo, Manuel Faysse

专题命中 其他安全 :alignment(abstract)

AI总结 ModernVBERT通过优化视觉文档检索模型,实现了在文档检索任务中性能优于更大模型的高效轻量级模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09554 2025-12-17 cs.IR 50%

Mixture-of-RAG: Integrating Text and Tables with Large Language Models

混合RAG:利用大语言模型整合文本和表格

Chi Zhang, Qiyang Chen, Mengqi Zhang

专题命中 其他安全 :alignment(abstract)

AI总结 MixRAG通过三阶段框架整合文本和表格,提升异构文档检索性能,实现混合模态文档接地的最新成果。

Comments Accepted to SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏