arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-02 至 2026-06-02 共收录 185 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 39 篇

2602.01728 2026-06-02 cs.CE 50%

Aligning Shared and Routed Experts for Cross-Subject EEG Generalization

对齐共享专家和路由专家以实现跨被试脑电图泛化

Zhi Zhang, Yan Liu, Zhejing Hu, Gong Chen, Sheng-hua Zhong, Changhong Jing, Shuqiang Wang, Jibin Wu, KC Tan, Jiannong Cao

专题命中 其他安全 :alignment(abstract)

AI总结 提出共享-路由专家对齐(SREA)框架,通过联合嵌入、原型稀疏路由和互导重加权,协同共享专家与路由专家,解决跨被试EEG泛化中个体差异与可迁移结构的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07152 2026-06-02 cs.MA 50%

Agents of Diffusion: Enhancing Diffusion Language Models with Multi-Agent Reinforcement Learning for Structured Data Generation (Extended Version)

扩散代理:利用多智能体强化学习增强扩散语言模型以生成结构化数据(扩展版)

Aja Khanal, Kaushik T. Ranade, Rishabh Agrawal, Kalyan S. Basu, Apurva Narayan

专题命中 其他安全 :alignment(abstract)

AI总结 提出Agents of Diffusion (AoD)框架,通过多智能体强化学习结合扩散语言模型与自回归模型的推理能力,实现高语义新颖性和结构保真度的结构化数据生成。

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12795 2026-06-02 cs.SE 50%

When Large Language Models Meet UAV Projects: An Empirical Study from Developers' Perspective

当大型语言模型遇到无人机项目:来自开发者视角的实证研究

Yihua Chen, Xingle Que, Jiashuo Zhang, Jiachi Chen, Ting Cui, Guangshun Li, Ting Chen

专题命中 其他安全 :safety(abstract)

AI总结 通过分析997篇论文和1509个GitHub项目,并调查52位从业者,本研究分类了无人机项目中大型语言模型(LLM)的九种常见任务和四种工作流,揭示了研究与工业实践之间的差异,并指出了整合LLM的五大挑战因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15234 2026-06-02 cs.CV 50%

Exploring the Capabilities of Large Language Model Encoders for Image-Text Retrieval in Chest X-rays

探索大语言模型编码器在胸部X光片图像-文本检索中的能力

Hanbin Ko, Gihun Cho, Inhyeok Baek, Donguk Kim, Joonbeom Koo, Changi Kim, Dongheon Lee, Chang Min Park

机构 * Interdisciplinary Program in Bioengineering, Seoul National University Graduate School(生物工程跨学科项目,首尔国立大学研究生院) Integrated Major in Innovative Medical Science, Seoul National University Graduate School(创新医学科学整合专业,首尔国立大学研究生院) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第一附属医院放射科) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院放射科,首尔国立大学医院) Institute of Medical and Biological Engineering, Seoul National University Medical Research Center(医学与生物工程研究所,首尔国立大学医学研究所以及) Institute of Radiation Medicine, Seoul National University Medical Research Center(放射医学研究所,首尔国立大学医学研究所以及)

专题命中 其他安全 :alignment(abstract)

AI总结 提出一种领域自适应的双向大语言模型文本编码器,通过掩码标记预测和监督对比学习训练,结合参数高效的双塔对比视觉语言框架,提升胸部X光片图像与文本的对齐和检索性能。

Comments 12 pages, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13833 2026-06-02 cs.DC 50%

DistFlow: A Fully Distributed RL Framework for Scalable and Efficient LLM Post-Training

DistFlow: 一种用于可扩展高效LLM后训练的全分布式强化学习框架

Zhixin Wang, Jiaming Xu, Tianyi Zhou, Mingjun Zhang, Liming Liu, Jiarui Hu, Dian Yang, Tongyu Wang, Ping Zhang, Jinlong Hou, Siyuan Feng, Yuan Qi, Yuan Cheng

专题命中 其他安全 :alignment(abstract)

AI总结 提出DistFlow框架,通过解耦数据传输与控制调度、采用多控制器范式和基于DAG的任务调度器,实现近线性可扩展性并提升吞吐量达2.63倍。

详情

展开后加载摘要…

URL PDF HTML 收藏