arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-29 至 2025-12-29 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2512.21552 2025-12-29 cs.CY cs.AI cs.HC 88%

Bidirectional Human-AI Alignment in Education for Trustworthy Learning Environments

教育中的人机双向对齐以实现可信学习环境

Hua Shen

专题命中 安全评测 :alignment(title,abstract);trustworthy(title,abstract);分类 cs.AI、cs.CY

AI总结 本文探讨教育中人机双向对齐,旨在通过培养教师、学生和机构的技术素养,实现可信学习环境,促进公平性、透明度和人类发展。

Comments Book Chapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21354 2025-12-29 cs.CR cs.AI cs.SE 83%

Reflection-Driven Control for Trustworthy Code Agents

基于反射的可信代码代理控制

Bin Wang, Jiazheng Quan, Xingrui Yu, Hansen Hu, Yuhao, Ivor Tsang

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出反射驱动控制方法,通过内部反思循环提升代码生成的安全性和合规性,实现自主、安全且可审计的AI代码代理。

Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07015 2025-12-29 cs.CL cs.AI cs.IR 81%

FVA-RAG: Falsification-Verification Alignment for Mitigating Sycophantic Hallucinations

FVA-RAG:通过对抗性上下文对齐缓解趋炎附势幻觉

Mayank Ravishankara

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 FVA-RAG通过引入对抗性上下文检索,有效缓解了因前提错误导致的幻觉问题,其在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21551 2025-12-29 cs.HC cs.AI cs.CL 81%

Human-AI Interaction Alignment: Designing, Evaluating, and Evolving Value-Centered AI For Reciprocal Human-AI Futures

人机交互对齐:为互惠人机未来设计、评估和演化以价值为中心的AI

Hua Shen, Tiffany Knearem, Divy Thakkar, Pat Pataranutaporn, Anoop Sinha, Yike, Shi, Jenny T. Liang, Lama Ahmad, Tanu Mitra, Brad A. Myers, Yang Li

机构 * NYU Shanghai, New York University(纽约大学上海校区) Google(谷歌) Massachusetts Institute of Technologyy(麻省理工学院) Google, Paradigms of Intelligence(谷歌、智能范式) Carnegie Mellon University, New York University(卡内基梅隆大学、纽约大学) Carnegie Mellon University(卡内基梅隆大学) OpenAI University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研讨会探讨如何通过设计、评估和演化以价值为中心的AI,实现人机之间的互惠协作与动态对齐。

Comments CHI 2026 BiAlign Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21220 2025-12-29 cs.AI cs.CV cs.RO 79%

RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic

RoboSafe: 通过可执行的安全逻辑保障具身智能体

Le Wang, Zonghao Ying, Xiao Yang, Quanchen Zou, Zhenfei Yin, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) AI Security Lab(360AI安全实验室) The University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 RoboSafe通过可执行的安全逻辑保障具身智能体,减少危险行为并保持任务性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21583 2025-12-29 cs.AI 70%

A Medical Multimodal Diagnostic Framework Integrating Vision-Language Models and Logic Tree Reasoning

一种整合视觉-语言模型和逻辑树推理的医学多模态诊断框架

Zelin Zang, Wenyi Gu, Siqi Ma, Dan Yang, Yue Shen, Zhu Zhang, Guohui Fan, Wing-Kuen Ling, Fuji Yang

机构 * Tsientang Institute of Advanced Study (TIAS)(钱塘先进研究所) Westlake University(西湖大学) Ant Group(蚂蚁集团) China-Japan Friendship Hospital(中日友好医院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种整合视觉-语言模型与逻辑树推理的医学诊断框架,旨在提升多模态医学AI的可信度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21439 2025-12-29 cs.CL cs.AI cs.LG 67%

Morality is Contextual: Learning Interpretable Moral Contexts from Human Data with Probabilistic Clustering and Large Language Models

道德是情境性的:从人类数据中学习可解释的道德情境,结合概率聚类和大语言模型

Geoffroy Morlat, Marceau Nahon, Augustin Chartouny, Raja Chatila, Ismael T. Freire, Mehdi Khamassi

机构 * Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne University(索邦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 COMETH通过结合概率聚类和大语言模型,从人类数据中学习可解释的道德情境,提升道德判断的准确性与可解释性。

Comments 11 pages, 5 figures, +24 pages of Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21866 2025-12-29 cs.LG cs.AI 62%

Secure and Explainable Fraud Detection in Finance via Hierarchical Multi-source Dataset Distillation

通过分层多源数据集蒸馏实现金融领域的安全可解释欺诈检测

Yiming Qian, Thorsten Neumann, Xueyining Huang, David Hardoon, Fei Gao, Yong Liu, Siow Mong Rick Goh

机构 * Institute of High Performance Computing, A*STAR(高性能计算研究所) Xi'an Jiaotong--Liverpool University(西安交通大学利物浦大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 通过分层多源数据集蒸馏实现金融欺诈检测的可解释性和隐私保护,提升跨机构的欺诈检测性能与隐私安全性。

Journal ref The ACM International Conference on AI in Finance (ICAIF) Workshop, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21482 2025-12-29 cs.AI 57%

LogicLens: Visual-Logical Co-Reasoning for Text-Centric Forgery Analysis

LogicLens:面向文本导向伪造分析的视觉-逻辑协同推理

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 LogicLens通过视觉-逻辑协同推理框架,提升文本导向伪造分析的准确性和鲁棒性,其在多个基准测试中表现优异。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21964 2025-12-29 cs.CV 50%

Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models

感知与校准:分析和增强医疗多模态大语言模型的鲁棒性

Dunyuan XU, Xikai Yang, Yaoqian Li, Juzheng Miao, Jinpeng Li, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, CUHK, Hong Kong, China(计算机科学与工程系,CUHK,香港,中国) Institute of Medical Intelligence and XR, CUHK, Hong Kong, China(医学智能与XR研究所,CUHK,香港,中国)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出IMC框架,通过感知和校准原则提升医疗多模态大语言模型的鲁棒性,针对视觉和文本模态分别设计PDC和SMS进行噪声校正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21616 2025-12-29 cs.CV 50%

TAMEing Long Contexts in Personalization: Towards Training-Free and State-Aware MLLM Personalized Assistant

在个性化中延长上下文:迈向无训练和状态感知的MLLM个性化助手

Rongpei Hong, Jian Lang, Ting Zhong, Yong Wang, Fan Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) Aiwen Technology Co., Ltd.(Aiwen科技有限公司) Intelligent Digital Media Technology Key Laboratory of Sichuan Province(四川省智能数字媒体技术重点实验室)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出TAME框架,通过双记忆和RA2G范式实现无训练、状态感知的MLLM个性化,提升长上下文对话能力。

Comments Accepted by KDD 2026 research track. Code and data are available at https://github.com/ronpay/TAME

详情

展开后加载摘要…

URL PDF HTML 收藏