arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-04 至 2025-12-04 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 10 篇

2512.03579 2025-12-04 cs.LG math.PR math.ST stat.TH 79%

Optimal Transportation and Alignment Between Gaussian Measures

高斯测度间的最优运输与对齐

Sanjit Dandapanthula, Aleksandr Podkopaev, Shiva Prasad Kasiviswanathan, Aaditya Ramdas, Ziv Goldfeld

机构 * Carnegie Mellon University, Department of Statistics(卡内基梅隆大学统计学系) Amazon Web Services (AWS) LogAnalytics(亚马逊网络服务(AWS)日志分析) Carnegie Mellon University, Machine Learning Department(卡内基梅隆大学机器学习系) Cornell University, Department of Electrical and Computer Engineering(康奈尔大学电子与计算机工程系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出了一种针对高斯分布的最优运输与格罗莫夫-沃瑟斯坦对齐的闭式解,扩展到内积GW对齐,并应用于知识蒸馏和异构聚类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10746 2025-12-04 cs.CL 79%

RECAP: Transparent Inference-Time Emotion Alignment for Medical Dialogue Systems

RECAP:医疗对话系统中透明的推理时间情感对齐

Adarsh Srinivasan, Jacob Dineen, Muhammad Umar Afzal, Muhammad Uzair Sarfraz, Irbaz B. Riaz, Ben Zhou

专题命中 其他安全 :alignment(title);safety(abstract);分类 cs.CL

AI总结 RECAP通过结构化情感推理提升医疗对话系统的情感响应质量,实现透明和可审计的同理心沟通。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00926 2025-12-04 cs.AI cs.CL 62%

LLMs Position Themselves as More Rational Than Humans: Emergence of AI Self-Awareness Measured Through Game Theory

大语言模型将自己定位为比人类更理性:通过博弈论测量AI自我意识的出现

Kyung-Hoon Kim

机构 * Gmarket Seoul, South Korea(韩国首尔Gmarket)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究通过博弈论框架测量大语言模型的自我意识,发现先进模型表现出比人类更高的理性认知。

Comments 19 pages, 6 figures, 28 models tested across 4,200 trials

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03248 2025-12-04 cs.MA cs.AI cs.LG eess.SP 62%

Learning Network Sheaves for AI-native Semantic Communication

面向AI原生语义通信的网络sheaf学习

Enrico Grimaldi, Mario Edoardo Pandolfo, Gabriele D'Acunto, Sergio Barbarossa, Paolo Di Lorenzo

机构 * Department of Computer, Control and Management Engineering, Sapienza University of Rome, Italy(计算机、控制与管理工程系,罗马萨皮恩扎大学) National Inter-University Consortium for Telecommunications (CNIT), Parma, Italy(电信国家大学联合体(CNIT),帕尔马,意大利) Department of Information Engineering, Electronics, and Telecommunications, Sapienza University, Rome, Italy(信息工程、电子与电信系,罗马萨皮恩扎大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种学习网络sheaf的方法,用于AI原生语义通信,通过语义去噪和压缩提升AI代理的对齐与语义聚类提取能力。

Journal ref Proceedings for 2025 Asilomar Conference on Signals, Systems, and Computers

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03976 2025-12-04 cs.CL 57%

Adapting Large Language Models to Low-Resource Tibetan: A Two-Stage Continual and Supervised Fine-Tuning Study

将大型语言模型适应于低资源藏语:一种两阶段持续和监督微调研究

Lifeng Chen, Ryan Lai, Tianming Liu

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究通过两阶段方法将Qwen2.5-3B适应到藏语,通过持续预训练和监督微调提升翻译质量,实现低资源语言的模型适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03445 2025-12-04 cs.CV cs.AI 57%

Multi-Aspect Knowledge-Enhanced Medical Vision-Language Pretraining with Multi-Agent Data Generation

多方面知识增强的医学视觉-语言预训练与多代理数据生成

Xieji Li, Siyuan Yan, Yingsheng Liu, H. Peter Soyer, Monika Janda, Victoria Mar, Zongyuan Ge

机构 * Department of Data Science and AI, Faculty of Information Technology, Monash University(数据科学与人工智能系,信息科技学院,墨尔本大学) Victorian Melanoma Service, Alfred Health(维多利亚黑色素瘤服务,阿尔弗雷德健康) Frazer Institute, The University of Queensland, Dermatology Research Centre(弗雷泽研究所,昆士兰大学,皮肤科研究中心)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本研究提出一种多代理数据生成与多方面知识增强的医学视觉-语言预训练框架,通过提升数据质量和细粒度对齐,实现零样本性能的突破。

Comments 10 pages. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09571 2025-12-04 cs.RO cs.LG 57%

Are you a robot? Detecting Autonomous Vehicles from Behavior Analysis

你是机器人吗?通过行为分析检测自动驾驶汽车

Fabio Maresca, Filippo Grazioli, Antonio Albanese, Vincenzo Sciancalepore, Gianpiero Negri, Xavier Costa-Perez

机构 * NEC Laboratories Europe GmbH(NEC欧洲实验室) Flyhound Co.(Flyhound公司) i2CAT Foundation(i2CAT基金会) Amazon Global Robotics - EU Innovation Lab(亚马逊全球机器人-欧盟创新实验室)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种通过摄像头图像和状态信息自动识别自动驾驶车辆的框架,利用CARLA模拟器创建数据集并测试其识别准确率,达到80%-93%的识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03844 2025-12-04 cs.CV 50%

CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation

CoDA:从文本到图像扩散模型到无训练数据集蒸馏

Letian Zhou, Songhua Liu, Xinchao Wang

专题命中 其他安全 :alignment(abstract)

AI总结 CoDA通过核心分布对齐技术,利用现成文本到图像模型实现无训练数据集蒸馏,提升目标语义与通用生成先验的对齐,取得ImageNet-1K的高准确率。

Comments 34 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03289 2025-12-04 cs.HC 50%

DAWZY: A New Addition to AI powered "Human in the Loop" Music Co-creation

DAWZY:一种新的AI驱动的“人机协同”音乐共创工具

Aaron C Elkins, Sanchit Singh, Adrian Kieback, Sawyer Blankenship, Uyiosa Philip Amadasun, Aman Chadha

专题命中 其他安全 :safety(abstract)

AI总结 DAWZY是一种基于AI的开源音乐创作工具,通过自然语言交互和LLM代码生成,提升音乐制作效率与用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22826 2025-12-04 cs.CV 50%

Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs

某些模态比其他模态更平等:在MLLMs中解码和架构多模态整合

Tianle Chen, Chaitanya Chakka, Arjun Reddy Akula, Xavier Thomas, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究了多模态大语言模型对矛盾模态的鲁棒性,提出模态对齐调优策略以提升多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏