arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-09 至 2025-12-09 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 10 篇

2512.07141 2025-12-09 cs.CV cs.CL 89%

Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models

思考-反思-修订:一种基于策略的反思框架,用于大型视觉语言模型的安全对齐

Fenghua Weng, Chaochao Lu, Xia Hu, Wenqi Shao, Wenjie Wang

机构 * Shanghaitech University(上海科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 TRR通过策略引导的反思框架提升大型视觉语言模型的安全对齐,显著提高安全响应率至87.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23478 2025-12-09 cs.CV 67%

Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models

Video-R2: 通过强化一致性和基于现实的推理提升多模态语言模型

Muhammad Maaz, Hanoona Rasheed, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Linköping University(林肯皮大学) Australian National University(澳大利亚国立大学)

专题命中 安全训练 :alignment(abstract);trustworthy(abstract)

AI总结 Video-R2通过强化学习提升多模态模型在视频推理中的时间对齐和逻辑一致性,提高准确性和可信度。

Comments Video-R2 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07092 2025-12-09 cs.LG cs.AI 62%

The Geometry of Persona: Disentangling Personality from Reasoning in Large Language Models

人格的几何学:从推理中分离人格特征于大型语言模型

Zhixiang Wang

机构 * Precision and Intelligence Medical Imaging Lab, Beijing Friendship Hospital, Capital Medical University(首都医科大学北京友谊医院精准与智能医学影像实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Soul Engine框架,通过解耦人格特质于LLM推理,实现安全可控的人格个性化。

Comments 10 pages, 3 figures, 1 table. Code and dataset available at https://huggingface.co/Zx93/Soul-Engine-Qwen2.5-0.5B

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05731 2025-12-09 cs.AI cs.CL 62%

InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization

InfiGUI-G1: 通过自适应探索策略优化推进GUI接地

Yuhang Liu, Zeyu Liu, Shuanghe Zhu, Pengxiang Li, Congkai Xie, Jiasheng Wang, Xavier Hu, Xiaotian Han, Jianbo Yuan, Xinyao Wang, Shengyu Zhang, Hongxia Yang, Fei Wu

机构 * Amazon(亚马逊)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 InfiGUI-G1通过自适应探索策略优化改进GUI接地,实现显著的语义对齐和性能提升。

Comments Accepted to AAAI 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07075 2025-12-09 cs.CL 57%

Do Large Language Models Truly Understand Cross-cultural Differences?

大型语言模型真的能理解跨文化差异吗?

Shiwei Guo, Sihang Jiang, Qianxi He, Yanghua Xiao, Jiaqing Liang, Bi Yude, Minggui He, Shimin Tao, Li Zhang

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出SAGE基准,通过跨文化核心概念对齐和生成任务设计,评估LLMs的跨文化理解和推理能力,揭示其在跨文化推理中的系统性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01888 2025-12-09 cs.LG cs.CR cs.MA 57%

Optimizing Day-Ahead Energy Trading with Proximal Policy Optimization and Blockchain

通过近端策略优化与区块链优化日前能源交易

Navneet Verma, Ying Xie

机构 * Kennesaw State University(肯纳邦大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出结合PPO与区块链的框架,用于优化日前能源市场中prosumers的自动化交易策略,实现供需平衡与电网韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17705 2025-12-09 cs.RO cs.AI 57%

Towards Autonomous and Safe Last-mile Deliveries with AI-augmented Self-driving Delivery Robots

迈向自主安全的最后-mile配送:基于AI增强的自动驾驶配送机器人

Eyad Shaklab, Areg Karapetyan, Arjun Sharma, Murad Mebrahtu, Mustofa Basri, Mohamed Nagy, Majid Khonji, Jorge Dias

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI增强的自动驾驶配送机器人系统,用于实现小型城市社区的自主安全最后-mile配送,通过整合优化和现实约束,提升配送效率与客户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06835 2025-12-09 cs.AI 57%

Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning

解耦以泛化:面向数据稀缺的视觉语言推理的上下文优先自进化学习

Tingyu Li, Zheng Sun, Jingxuan Wei, Siyuan Li, Conghui He, Lijun Wu, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai JiaoTong University(上海交通大学) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 DoGe通过双解耦框架,引导模型优先从上下文学习以提升数据稀缺下的视觉语言推理能力,提出两阶段RL方法和演进课程学习流水线,有效解决传统方法的奖励黑客问题。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06659 2025-12-09 cs.CR 50%

The Evolution of Agentic AI in Cybersecurity: From Single LLM Reasoners to Multi-Agent Systems and Autonomous Pipelines

代理AI在网络安全中的演变:从单一LLM推理者到多代理系统和自主流水线

Vaishali Vinay

专题命中 安全训练 :safety(abstract)

AI总结 本文探讨了网络安全中代理AI从单一LLM到多代理系统的发展,分析了五代分类法及各代在推理深度、工具使用等维度的差异,并总结了当前面临的挑战。

Comments Accepted at ICAIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06268 2025-12-09 eess.SY cs.MA cs.SY 50%

A Physics-Informed Fixed Skyroad Model for Continuous UAS Traffic Management (C-UTM)

一种融合物理信息的固定天空路模型用于连续无人机交通管理(C-UTM)

Muhammad Junayed Hasan Zahed, Hossein Rastgoftar

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种融合物理信息的固定天空路模型,用于解决低空无人机交通管理中的动态空域分配问题,通过构建多层天空路结构和连续UTM框架,提高空域利用率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏