arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-08 至 2025-12-08 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 10 篇

2510.18526 2025-12-08 cs.AI cs.LG 81%

Counterfactual Reasoning for Steerable Pluralistic Value Alignment of Large Language Models

反事实推理用于可操控的多元价值观对齐大语言模型

Hanze Guo, Jing Yao, Xiao Zhou, Xiaoyuan Yi, Xing Xie

机构 * Renmin University of China(中国人民大学) Microsoft Research Asia(微软亚洲研究院) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 COUPLE通过反事实推理框架实现多元价值观对齐,解决现有方法在处理细粒度价值目标时的依赖性和优先级控制问题。

Comments NeurIPS 2025. 41 pages, 7 figures

Journal ref The Thirty-Ninth Annual Conference on Neural Information Processing Systems. (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05815 2025-12-08 cs.RO 78%

Optimal Safety-Aware Scheduling for Multi-Agent Aerial 3D Printing with Utility Maximization under Dependency Constraints

多智能体空中3D打印的最优安全意识调度与效用最大化在依赖约束下

Marios-Nektarios Stamatopoulos, Shridhar Velhal, Avijit Banerjee, George Nikolakopoulos

机构 * Robotics and AI Group, Luleå University of Technology(机器人与人工智能组,卢勒奥技术大学)

专题命中 其他安全 :safety(title,abstract)

AI总结 本文提出了一种基于效用最大化的优化框架,用于在依赖约束下实现多智能体空中3D打印的最优安全调度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16832 2025-12-08 cs.CV 78%

Joint Self-Supervised Video Alignment and Action Segmentation

联合自监督视频对齐与动作分割

Ali Shah Ali, Syed Ahmed Mahmood, Mubin Saeed, Andrey Konin, M. Zeeshan Zia, Quoc-Huy Tran

机构 * Retrocausal, Inc.(Retrocausal公司)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出了一种统一最优传输框架,用于联合自监督视频对齐与动作分割,实现了高效训练和更优的分割性能。

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04555 2025-12-08 cs.RO cs.CV 71%

Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment

Evo-1:轻量级视觉-语言-动作模型,保持语义对齐

Tao Lin, Yilei Zhong, Yuxin Du, Jingjing Zhang, Jiting Liu, Yinxinyu Chen, Encheng Gu, Ziyan Liu, Hongyi Cai, Yanwen Zou, Lixing Zou, Zhaoye Zhou, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) SII Carnegie Mellon University(卡内基梅隆大学) University of Cambridge(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 其他安全 :alignment(title)

AI总结 Evo-1是一种轻量级的视觉-语言-动作模型,通过减少计算并保持语义对齐,实现了高效的部署和强大的性能。

Comments Github: https://github.com/MINT-SJTU/Evo-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05502 2025-12-08 cs.LG 57%

GRASP: Graph Reasoning Agents for Systems Pharmacology with Human-in-the-Loop

GRASP:具有人机交互循环的图推理代理用于系统药理学

Omid Bazgir, Vineeth Manthapuri, Ilia Rattsev, Mohammad Jafarnejad

机构 * Clinical Pharmacology, Genentech(基因泰克临床药理部) Preclinical & Translational PKPD, Genentech Inc.(基因泰克预临床与转化药代动力学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 GRASP通过图推理代理实现系统药理学模型开发的自动化与严谨性,提升生物医学建模的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05365 2025-12-08 cs.AI q-bio.QM 57%

MCP-AI: Protocol-Driven Intelligence Framework for Autonomous Reasoning in Healthcare

MCP-AI:面向医疗领域自主推理的协议驱动智能框架

Zag ElSayed, Craig Erickson, Ernest Pedapati

机构 * School of Information Technology University of Cincinnati Ohio, USA(信息科技学院 俄亥俄州立大学 奥哈伊俄州) Adolescent Psychiatry Cincinnati Children’s Hospital Medical Center Ohio, USA(青少年精神病学 奥克兰儿童医院医疗中心 奥哈伊俄州)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 MCP-AI是一种基于模型上下文协议的医疗自主推理框架,通过整合临床逻辑和安全协作,提升医疗决策的可解释性和适应性。

Comments 6 pages, 4 figures

Journal ref IEEE ICMLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05226 2025-12-08 cs.LG 57%

Variance Matters: Improving Domain Adaptation via Stratified Sampling

方差至关重要:通过分层抽样改进领域适应

Andrea Napoli, Paul White

机构 * Institute of Sound and Vibration Research(声学与振动研究所) University of Southampton(南安普顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出VaRDASS方法,通过分层抽样减少领域适应中的方差,提升领域差异估计精度和目标领域性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05599 2025-12-08 cs.RO 50%

An Integrated System for WEEE Sorting Employing X-ray Imaging, AI-based Object Detection and Segmentation, and Delta Robot Manipulation

一种集成系统用于WEEE分类,采用X射线成像、基于AI的对象检测和分割以及Delta机器人操作

Panagiotis Giannikos, Lampis Papakostas, Evangelos Katralis, Panagiotis Mavridis, George Chryssinas, Myrto Inglezou, Nikolaos Panagopoulos, Antonis Porichis, Athanasios Mastrogeorgiou, Panagiotis Chatzakos

机构 * THL (Tech Hive Labs)(Tech Hive Labs) AI Innovation Centre, University of Essex(艾创新中心,埃塞克斯大学) Control Systems Lab, School of Mechanical Engineering, NTUA(控制系统实验室,机械工程学院,NTUA)

专题命中 其他安全 :safety(abstract)

AI总结 本研究提出一种集成系统,结合X射线成像、AI检测和Delta机器人,实现WEEE中电池的自动分类与回收。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16054 2025-12-08 cs.CV 50%

Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model

基于多模态大语言模型的语言引导推理用于群体活动检测

Jihua Peng, Qianxiong Xu, Yichen Liu, Chenxi Liu, Cheng Long, Rui Zhao, Ziyue Li

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出LIR-GAD框架,通过多模态大语言模型实现群体活动检测,引入活动标记和群体标记以提升语义理解和分类性能。

Comments This work is being incorporated into a larger study

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13010 2025-12-08 eess.IV cs.CV 50%

Learning accurate rigid registration for longitudinal brain MRI from synthetic data

从合成数据中学习准确的纵向脑部MRI刚体配准

Jingru Fu, Adrian V. Dalca, Bruce Fischl, Rodrigo Moreno, Malte Hoffmann

机构 * 1 Division of Biomedical Imaging, KTH Royal Institute of Technology, Huddinge, Sweden 2 Athinoula A.\ Martinos Center for Biomedical Imaging, Charlestown, USA 3 Department of Radiology, Massachusetts General Hospital, Boston, USA 4 Department of Radiology, Harvard Medical School, Boston, USA 5 Computer Science \& Artificial Intelligence Laboratory, MIT, Cambridge, USA

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出了一种基于合成数据训练的模型,用于提高纵向脑部MRI刚体配准的准确性。

Comments 5 pages, 4 figures, 1 table, rigid image registration, deep learning, longitudinal analysis, neuroimaging, accepted by the IEEE International Symposium on Biomedical Imaging

Journal ref IEEE Int Symp Biomed Imaging, 2025, 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏