arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-29 至 2025-12-29 共收录 28 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2512.21715 2025-12-29 cs.CL cs.AI 62%

CATCH: A Controllable Theme Detection Framework with Contextualized Clustering and Hierarchical Generation

CATCH:一个具有上下文聚类和层次生成的可控主题检测框架

Rui Ke, Jiahui Xu, Shenghao Yang, Kuang Wang, Feng Jiang, Haizhou Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 CATCH提出了一种可控主题检测框架,通过上下文聚类和层次生成机制,解决稀疏语句和用户偏好识别的问题,提升对话系统中主题检测的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20312 2025-12-29 cs.LG cs.AI 62%

TableGPT-R1: Advancing Tabular Reasoning Through Reinforcement Learning

TableGPT-R1: 通过强化学习推进表格推理

Saisai Yang, Qingyi Huang, Jing Yuan, Liangyu Zha, Kai Tang, Yuhang Yang, Ning Wang, Yucheng Wei, Liyao Li, Wentao Ye, Hao Chen, Tao Zhang, Junlin Zhou, Haobo Wang, Gang Chen, Junbo Zhao

机构 * Zhejiang University Institute of Computing Innovation(浙江大学计算创新研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 TableGPT-R1通过强化学习框架提升表格推理能力,整合数据工程、奖励系统和多阶段训练框架,实现复杂表格任务的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21915 2025-12-29 cs.LG cs.DB 57%

Exploring the Heterogeneity of Tabular Data: A Diversity-aware Data Generator via LLMs

探索表格数据的异质性:通过LLMs的多样性感知数据生成器

Yafeng Tang, Xiaoou Ding, Jianzhuo Du, Zishuo Yan, Zhuang Ma, Zheng Liang, Zekai Qian, Hongzhi Wang

机构 * Hongzhi Wang(王 Hongzhi)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 DATE通过LLMs生成多样化且高质量的表格数据,有效提升机器学习模型的性能与推理能力。

Comments This manuscript has been submitted to IEEE Transactions on Knowledge and Data Engineering (TKDE) for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2512.21673 2025-12-29 cs.CV cs.AI cs.LG 62%

Comparative Analysis of Deep Learning Models for Perception in Autonomous Vehicles

自动驾驶车辆感知中深度学习模型的比较分析

Jalal Khan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了YOLO-NAS和YOLOv8在自动驾驶车辆感知任务中的性能,发现YOLOv8在训练时间和检测精度上均优于YOLO-NAS。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12712 2025-12-29 cs.CL cs.AI 62%

Adaptive Focus Memory for Language Models

自适应聚焦记忆用于语言模型

Christopher Cruz

机构 * Purdue University(普渡大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 自适应聚焦记忆通过动态分配保真度级别,实现多轮对话中有效约束保持,无需修改模型权重或外部检索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13021 2025-12-29 eess.SY cs.SY 50%

Safe Control of Multi-Agent Systems with Minimal Communication

多智能体系统安全控制的最小通信

Mo Yang, Jing Yu, Necmiye Ozay

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种多智能体系统中最小化通信的控制器设计方法,通过秩最小化问题和系统级合成实现安全性和协调性的保障。

Comments to appear at 2025 IEEE Conference on Decision and Control (CDC)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2512.21008 2025-12-29 cs.CR 67%

GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs

GateBreaker: 对混合专家LLM的门控引导攻击

Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Stjepan Picek, Ahmad-Reza Sadeghi

专题命中 越狱攻击 :alignment(abstract);safety(abstract)

AI总结 GateBreaker通过门控引导攻击破坏MoE LLM的安全对齐,发现安全机制集中在少量神经元上,禁用这些神经元显著提高攻击成功率。

Comments Accepted by USENIX Security'26

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2512.21722 2025-12-29 cs.RO 67%

MAction-SocialNav: Multi-Action Socially Compliant Navigation via Reasoning-enhanced Prompt Tuning

MAction-SocialNav: 通过推理增强的提示调优实现多动作社交合规导航

Zishuo Wang, Xinyu Zhang, Zhuonan Liu, Tomohito Kawabata, Daeun Song, Xuesu Xiao, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学) Graduate School of Computer Science, George Mason University(计算机科学研究生院,乔治·梅森大学)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)

AI总结 MAction-SocialNav通过推理增强的提示调优实现多动作社交合规导航,提升决策质量与安全性,效率高于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 11 篇

2512.21552 2025-12-29 cs.CY cs.AI cs.HC 88%

Bidirectional Human-AI Alignment in Education for Trustworthy Learning Environments

教育中的人机双向对齐以实现可信学习环境

Hua Shen

专题命中 安全评测 :alignment(title,abstract);trustworthy(title,abstract);分类 cs.AI、cs.CY

AI总结 本文探讨教育中人机双向对齐,旨在通过培养教师、学生和机构的技术素养,实现可信学习环境,促进公平性、透明度和人类发展。

Comments Book Chapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21354 2025-12-29 cs.CR cs.AI cs.SE 83%

Reflection-Driven Control for Trustworthy Code Agents

基于反射的可信代码代理控制

Bin Wang, Jiazheng Quan, Xingrui Yu, Hansen Hu, Yuhao, Ivor Tsang

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出反射驱动控制方法,通过内部反思循环提升代码生成的安全性和合规性,实现自主、安全且可审计的AI代码代理。

Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07015 2025-12-29 cs.CL cs.AI cs.IR 81%

FVA-RAG: Falsification-Verification Alignment for Mitigating Sycophantic Hallucinations

FVA-RAG:通过对抗性上下文对齐缓解趋炎附势幻觉

Mayank Ravishankara

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 FVA-RAG通过引入对抗性上下文检索,有效缓解了因前提错误导致的幻觉问题,其在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21551 2025-12-29 cs.HC cs.AI cs.CL 81%

Human-AI Interaction Alignment: Designing, Evaluating, and Evolving Value-Centered AI For Reciprocal Human-AI Futures

人机交互对齐:为互惠人机未来设计、评估和演化以价值为中心的AI

Hua Shen, Tiffany Knearem, Divy Thakkar, Pat Pataranutaporn, Anoop Sinha, Yike, Shi, Jenny T. Liang, Lama Ahmad, Tanu Mitra, Brad A. Myers, Yang Li

机构 * NYU Shanghai, New York University(纽约大学上海校区) Google(谷歌) Massachusetts Institute of Technologyy(麻省理工学院) Google, Paradigms of Intelligence(谷歌、智能范式) Carnegie Mellon University, New York University(卡内基梅隆大学、纽约大学) Carnegie Mellon University(卡内基梅隆大学) OpenAI University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研讨会探讨如何通过设计、评估和演化以价值为中心的AI,实现人机之间的互惠协作与动态对齐。

Comments CHI 2026 BiAlign Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21220 2025-12-29 cs.AI cs.CV cs.RO 79%

RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic

RoboSafe: 通过可执行的安全逻辑保障具身智能体

Le Wang, Zonghao Ying, Xiao Yang, Quanchen Zou, Zhenfei Yin, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) AI Security Lab(360AI安全实验室) The University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 RoboSafe通过可执行的安全逻辑保障具身智能体,减少危险行为并保持任务性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21583 2025-12-29 cs.AI 70%

A Medical Multimodal Diagnostic Framework Integrating Vision-Language Models and Logic Tree Reasoning

一种整合视觉-语言模型和逻辑树推理的医学多模态诊断框架

Zelin Zang, Wenyi Gu, Siqi Ma, Dan Yang, Yue Shen, Zhu Zhang, Guohui Fan, Wing-Kuen Ling, Fuji Yang

机构 * Tsientang Institute of Advanced Study (TIAS)(钱塘先进研究所) Westlake University(西湖大学) Ant Group(蚂蚁集团) China-Japan Friendship Hospital(中日友好医院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种整合视觉-语言模型与逻辑树推理的医学诊断框架,旨在提升多模态医学AI的可信度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21439 2025-12-29 cs.CL cs.AI cs.LG 67%

Morality is Contextual: Learning Interpretable Moral Contexts from Human Data with Probabilistic Clustering and Large Language Models

道德是情境性的:从人类数据中学习可解释的道德情境,结合概率聚类和大语言模型

Geoffroy Morlat, Marceau Nahon, Augustin Chartouny, Raja Chatila, Ismael T. Freire, Mehdi Khamassi

机构 * Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne University(索邦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 COMETH通过结合概率聚类和大语言模型,从人类数据中学习可解释的道德情境,提升道德判断的准确性与可解释性。

Comments 11 pages, 5 figures, +24 pages of Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21866 2025-12-29 cs.LG cs.AI 62%

Secure and Explainable Fraud Detection in Finance via Hierarchical Multi-source Dataset Distillation

通过分层多源数据集蒸馏实现金融领域的安全可解释欺诈检测

Yiming Qian, Thorsten Neumann, Xueyining Huang, David Hardoon, Fei Gao, Yong Liu, Siow Mong Rick Goh

机构 * Institute of High Performance Computing, A*STAR(高性能计算研究所) Xi'an Jiaotong--Liverpool University(西安交通大学利物浦大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 通过分层多源数据集蒸馏实现金融欺诈检测的可解释性和隐私保护,提升跨机构的欺诈检测性能与隐私安全性。

Journal ref The ACM International Conference on AI in Finance (ICAIF) Workshop, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21482 2025-12-29 cs.AI 57%

LogicLens: Visual-Logical Co-Reasoning for Text-Centric Forgery Analysis

LogicLens:面向文本导向伪造分析的视觉-逻辑协同推理

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 LogicLens通过视觉-逻辑协同推理框架,提升文本导向伪造分析的准确性和鲁棒性,其在多个基准测试中表现优异。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21964 2025-12-29 cs.CV 50%

Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models

感知与校准:分析和增强医疗多模态大语言模型的鲁棒性

Dunyuan XU, Xikai Yang, Yaoqian Li, Juzheng Miao, Jinpeng Li, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, CUHK, Hong Kong, China(计算机科学与工程系,CUHK,香港,中国) Institute of Medical Intelligence and XR, CUHK, Hong Kong, China(医学智能与XR研究所,CUHK,香港,中国)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出IMC框架,通过感知和校准原则提升医疗多模态大语言模型的鲁棒性,针对视觉和文本模态分别设计PDC和SMS进行噪声校正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21616 2025-12-29 cs.CV 50%

TAMEing Long Contexts in Personalization: Towards Training-Free and State-Aware MLLM Personalized Assistant

在个性化中延长上下文:迈向无训练和状态感知的MLLM个性化助手

Rongpei Hong, Jian Lang, Ting Zhong, Yong Wang, Fan Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) Aiwen Technology Co., Ltd.(Aiwen科技有限公司) Intelligent Digital Media Technology Key Laboratory of Sichuan Province(四川省智能数字媒体技术重点实验室)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出TAME框架,通过双记忆和RA2G范式实现无训练、状态感知的MLLM个性化,提升长上下文对话能力。

Comments Accepted by KDD 2026 research track. Code and data are available at https://github.com/ronpay/TAME

详情

展开后加载摘要…

URL PDF HTML 收藏

6. AI治理与伦理 4 篇

2512.21775 2025-12-29 cs.AI cs.CY cs.DB 62%

Compliance Rating Scheme: A Data Provenance Framework for Generative AI Datasets

合规评分方案:一种面向生成式人工智能数据集的数据溯源框架

Matyas Bohacek, Ignacio Vilanova Echavarri

机构 * Stanford University(斯坦福大学) Imperial College London(帝国理工学院伦敦分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出合规评分方案,用于评估生成式人工智能数据集的透明度、问责制和安全性,同时提供开源库以实现数据溯源,促进负责任的数据集构建与管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13540 2025-12-29 cs.LG cs.CY 62%

Fairness-Aware Graph Representation Learning with Limited Demographic Information

带有有限人口信息的公平图表示学习

Zichong Wang, Zhipeng Yin, Liping Yang, Jun Zhuang, Rui Yu, Qingzhao Kong, Wenbin Zhang

机构 * Florida International University(佛罗里达国际大学) University of New Mexico(新墨西哥大学) Boise State University(博伊西州立大学) University of Louisville(路易斯维尔大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY、cs.LG

AI总结 本文提出FairGLite框架,在有限人口信息下减轻图学习中的偏见,通过生成人口信息代理和自适应置信度策略,实现公平性和效用的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21699 2025-12-29 cs.AI 57%

Towards Responsible and Explainable AI Agents with Consensus-Driven Reasoning

迈向负责任和可解释的AI代理:基于共识驱动的推理

Eranga Bandara, Tharaka Hewa, Ross Gore, Sachin Shetty, Ravi Mukkamala, Peter Foytik, Abdul Rahman, Safdar H. Bouk, Xueping Liang, Amin Hass, Sachini Rajapakse, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University, Norfolk, VA, USA(老奥本大学) Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) Florida International University, USA(佛罗里达国际大学) Nanyang Technological University, Singapore(南洋理工大学) University of Colombo, Sri Lanka(科伦坡大学) Accenture Technology Labs, Arlington, VA, USA(Accenture技术实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于多模型共识和推理层治理的负责任和可解释的AI代理架构,通过结构化整合不同模型的输出以提升系统鲁棒性、透明度和责任性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04489 2025-12-29 cs.CY 57%

The Decision Path to Control AI Risks Completely: Fundamental Control Mechanisms for AI Governance

完全控制AI风险的决策路径:AI治理的基本控制机制

Yong Tao

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文提出通过五支柱和六种控制机制,构建AI治理架构,以全面控制AI风险并减少潜在威胁。

Comments Added 1 paragraph to Ackowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 5 篇

2512.21985 2025-12-29 cs.CV cs.AI 79%

LVLM-Aided Alignment of Task-Specific Vision Models

通过大视觉语言模型辅助对齐任务特定视觉模型

Alexander Koebler, Lukas Kuhn, Ingo Thon, Florian Buettner

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 通过大视觉语言模型辅助对齐任务特定视觉模型,提升模型与人类规范的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21506 2025-12-29 cs.LG cs.AI cs.CL cs.HC 67%

MotionTeller: Multi-modal Integration of Wearable Time-Series with LLMs for Health and Behavioral Understanding

MotionTeller: 多模态整合可穿戴时间序列与大语言模型用于健康和行为理解

Aiwei Zhang, Arvind Pillai, Andrew Campbell, Nicholas C. Jacobson

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MotionTeller通过整合可穿戴时间序列与大语言模型,实现高精度的自然语言行为摘要生成,提升健康和行为理解的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09109 2025-12-29 cs.CL cs.AI cs.IR 62%

Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning

正向与反向思考:用于检索增强推理的多目标强化学习

Wenda Wei, Yu-An Liu, Ruqing Zhang, Jiafeng Guo, Lixin Su, Shuaiqiang Wang, Dawei Yin, Maarten de Rijke, Xueqi Cheng

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Bi-RAR通过双向信息距离和多目标强化学习框架,提升检索增强推理在复杂多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21859 2025-12-29 cs.CL 57%

TimeBill: Time-Budgeted Inference for Large Language Models

TimeBill: 为大语言模型设计的时间预算推理方法

Qi Fan, An Zou, Yehan Ma

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 TimeBill提出了一种时间预算推理框架,通过细粒度响应长度预测和执行时间估计,提升大语言模型在时间敏感任务中的效率和响应性能。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21817 2025-12-29 cs.CL 57%

Method Decoration (DeMe): A Framework for LLM-Driven Adaptive Method Generation in Dynamic IoT Environments

方法装饰(DeMe):一种用于动态物联网环境中的LLM驱动自适应方法生成的框架

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(计算机科学学院,成都信息科技大學)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 DeMe框架通过动态装饰机制使LLM在动态物联网环境中自适应生成安全且环境适应的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏