Us-vs-Them bias in Large Language Models
大语言模型中的‘我们 vs 他们’偏见
专题命中 AI治理与伦理 :DPO(abstract);分类 cs.CY
AI总结 本研究发现大语言模型在不同人设下表现出‘我们 vs 他们’偏见,通过微调和DPO方法可有效缓解这种偏见。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
大语言模型中的‘我们 vs 他们’偏见
专题命中 AI治理与伦理 :DPO(abstract);分类 cs.CY
AI总结 本研究发现大语言模型在不同人设下表现出‘我们 vs 他们’偏见,通过微调和DPO方法可有效缓解这种偏见。
SIGMMA:基于层次图的多尺度多模态对比对齐:组织病理图像与空间转录组
机构 * Wellcome Sanger Institute(沃森桑格研究所) ; Cambridge Centre for AI in Medicine(剑桥人工智能医学中心) ; Institute of AI for Health(人工智能与健康研究所) ; Cambridge Stem Cell Institute(剑桥干细胞研究所)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 SIGMMA通过多尺度多模态对比对齐,提升组织病理图像与空间转录组的跨模态对应表示,提高基因表达预测和跨模态检索性能。
基于移动机器人的自主施工工地安全检查:一种多层VLM-LLM流水线
专题命中 其他安全 :safety(title,abstract)
AI总结 本文提出一种多层VLM-LLM流水线,通过机器人自主导航与人工智能结合,实现施工工地安全检查的自动化报告生成。
Cog-RAG: 基于认知的双超图主题对齐检索增强生成
专题命中 其他安全 :alignment(title,abstract)
AI总结 Cog-RAG通过双超图结构和主题对齐策略,提升检索增强生成的语义对齐与生成一致性。
Comments Accepted by AAAI 2026 main conference
Journal ref AAAI 2026
语义不匹配与感知退化:图像编辑免疫的新视角
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of China Academy of Sciences(中国科学院大学) ; Center for Machine Vision and Signal Analysis, University of Oulu(信号分析中心,奥卢大学) ; School of Computer Science, China University of Geosciences(计算机科学学院,中国地质大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文提出SIFM方法和ISR度量标准,通过语义不匹配和感知退化来评估图像编辑免疫效果,提升对抗恶意扩散式操纵的能力。
Comments 11 pages, 4 figures
重新思考多智能体系统可靠性:从拜占庭容错的角度出发
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。
LTA-thinker: 用于复杂推理的大语言模型的潜在思维增强训练框架
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 LTA-Thinker通过提升潜在思维分布方差和信息效率,优化大语言模型的复杂推理性能。
基于意图-行为不一致分析的移动恶意软件检测:UIXPOSE
机构 * School of Computing and Information Systems(计算与信息系统学院) ; The University of Melbourne(墨尔本大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 UIXPOSE通过意图-行为不一致分析提升移动恶意软件的动态检测能力
Comments 15 pages
ValuePilot:一种面向价值驱动决策的双阶段框架
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(1 通用人工智能国家重点实验室,BIGAI) ; Tsinghua University(2 清华大学) ; Peking University(3 北京大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 ValuePilot通过双阶段框架实现价值驱动的个性化决策,提升AI在复杂场景中的可解释性和适应性。
Comments Accepted at LAW Workshop, NeurIPS 2025
ModernVBERT: 向更小的视觉文档检索器迈进
专题命中 其他安全 :alignment(abstract)
AI总结 ModernVBERT通过优化视觉文档检索模型,实现了在文档检索任务中性能优于更大模型的高效轻量级模型。
混合RAG:利用大语言模型整合文本和表格
专题命中 其他安全 :alignment(abstract)
AI总结 MixRAG通过三阶段框架整合文本和表格,提升异构文档检索性能,实现混合模态文档接地的最新成果。
Comments Accepted to SIGKDD 2026