arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-25 至 2025-11-25 共收录 84 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 28 篇

2511.11500 2025-11-25 cs.LG 79%

Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation

诚实胜过准确:通过强化犹豫实现可信语言模型

Mohamad Amin Mohamadi, Tianhao Wang, Zhiyuan Li

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 通过强化犹豫方法,将回避作为核心训练目标,使语言模型在风险可控下提升可信度,降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17730 2025-11-25 eess.SY cs.SY 78%

Safety and Risk Pathways in Cooperative Generative Multi-Agent Systems: A Telecom Perspective

合作生成多智能体系统的安全性和风险路径:电信视角

Zeinab Nezami, Shehr Bano, Abdelaziz Salama, Maryam Hafeez, Syed Ali Raza Zaidi

专题命中 安全评测 :safety(title,abstract)

AI总结 本文从电信视角探讨生成多智能体系统中的安全性和风险路径,提出模块化安全评估框架,揭示智能体多样性对系统稳定性的影响,并展示通过模拟验证的改进与持续存在的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07793 2025-11-25 cs.CL cs.AI 73%

LLM4Cell: A Survey of Large Language and Agentic Models for Single-Cell Biology

LLM4Cell: 一种用于单细胞生物学的大语言和代理模型综述

Sajib Acharjee Dip, Adrika Zafor, Bikash Kumar Paul, Uddip Acharjee Shuvo, Muhit Islam Emon, Xuan Wang, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Department of Computational Modeling and Data Analytics, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算建模与数据分析系) Institute of Information and Technology, University of Dhaka, Dhaka, Bangladesh(达卡大学信息技术学院) Fralin Biomedical Research Institute at VTC: Cancer Research Center, Washington DC, USA(弗拉林生物医学研究中心:癌症研究中心)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 LLM4Cell综述了58个用于单细胞生物学的大语言和代理模型,分析了其在注释、轨迹建模和药物反应预测等任务中的表现,并指出了可解释性、标准化和可信模型开发的挑战。

Comments 34 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19324 2025-11-25 cs.IR cs.AI cs.CL 62%

What Drives Cross-lingual Ranking? Retrieval Approaches with Multilingual Language Models

什么推动跨语言排序?具有多语言语言模型的检索方法

Roksana Goworek, Olivia Macmillan-Scott, Eda B. Özyiğit

机构 * The Alan Turing Institute(艾伦·图灵研究所) Queen Mary University of London(伦敦女王学院) University College London(伦敦大学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了跨语言检索中影响排序的因素,发现专门训练的密集检索模型和对比学习在低资源和跨脚本场景中表现更优,优于传统的翻译和单语言检索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19257 2025-11-25 cs.CR cs.AI cs.LG 62%

Medusa: Cross-Modal Transferable Adversarial Attacks on Multimodal Medical Retrieval-Augmented Generation

Medusa: 跨模态可转移的对抗攻击用于多模态医疗检索增强生成

Yingjia Shang, Yi Liu, Huimin Wang, Furong Li, Wenfang Sun, Wu Chengyu, Yefeng Zheng

机构 * Westlake University(西湖大学) Heilongjiang University(黑龙江大学) City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 Medusa提出了一种针对多模态医疗检索增强生成系统的跨模态可转移对抗攻击方法,通过优化扰动和双循环策略实现高攻击成功率并抵御主流防御措施。

Comments Accepted at KDD 2026 First Cycle (full version). Authors marked with * contributed equally. Yi Liu is the lead author

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18860 2025-11-25 cs.CL cs.AI 62%

Generating Reading Comprehension Exercises with Large Language Models for Educational Applications

利用大语言模型生成阅读理解练习用于教育应用

Xingyu Huang, Fei Jiang, Jianli Xiao

机构 * School of Optical-Electrical and Computer Engineering, University of Shanghai for Science and Technology, Shanghai, China(光学电子与计算机工程学院,上海理工大学,上海,中国) Chongqing Academy of Science and Technology, Chongqing, China(重庆市科学技术院,重庆,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RCEG框架,利用大语言模型自动生成高质量、个性化的英语阅读理解练习,通过内容候选生成、判别器筛选和综合评估指标提升练习质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09711 2025-11-25 cs.CL cs.AI 62%

PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry

PsychiatryBench: 一个面向心理治疗的多任务基准测试

Aya E. Fouda, Abdelrahamn A. Hassan, Radwa J. Hanafy, Mohammed E. Fouda

机构 * Compumacy for Artificial Intelligence solutions(人工智能解决方案公司) Department of Behavioural Health- Saint Elizabeths Hospital(行为健康部门-圣伊丽莎白医院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 PsychiatryBench通过权威教科书和病例书构建多任务基准,评估LLMs在心理治疗中的临床一致性与安全性,揭示模型在多轮随访等任务中的不足,推动专门调优和更严谨的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19265 2025-11-25 cs.LG 57%

Unboxing the Black Box: Mechanistic Interpretability for Algorithmic Understanding of Neural Networks

揭开黑箱:神经网络算法理解的机理可解释性

Bianka Kowalska, Halina Kwaśnicka

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出了一种统一的机理可解释性方法分类,并探讨了其在可解释人工智能中的应用与潜在贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18840 2025-11-25 cs.MA cs.AI 57%

Addressing Situated Teaching Needs: A Multi-Agent Framework for Automated Slide Adaptation

应对情境教学需求:一种多智能体框架用于自动幻灯片适应

Binglin Liu, Yucheng Wang, Zheyuan Zhang, Jiyuan Lu, Shen Yang, Daniel Zhang-Li, Huiqin Liu, Jifan Yu

机构 * Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种多智能体框架,用于自动化教学幻灯片适应,通过教师访谈识别关键摩擦点,并在8门课程中验证了其有效性,达到0.89的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17977 2025-11-25 cs.SE cs.LG cs.NI 57%

Synthesizing Precise Protocol Specs from Natural Language for Effective Test Generation

从自然语言合成精确的协议规范以实现有效的测试生成

Kuangxiangzi Liu, Dhiman Chakraborty, Alexander Liggesmeyer, Andreas Zeller

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本研究提出了一种两阶段方法,利用大语言模型从自然语言规范生成形式化协议规范,以提高测试生成的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17927 2025-11-25 cs.CV cs.AI 57%

PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning

PA-FAS: 向可解释和通用的多模态人脸反伪装迈进:通过路径增强强化学习

Yingjie Ma, Xun Lin, Yong Xu, Weicheng Xie, Zitong Yu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 PA-FAS通过路径增强强化学习提升多模态人脸反伪装的可解释性和泛化能力。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17644 2025-11-25 cs.AI 57%

Hybrid Neuro-Symbolic Models for Ethical AI in Risk-Sensitive Domains

混合神经符号模型用于风险敏感领域的伦理AI

Chaitanya Kumar Kolli

机构 * Independent Researcher USA Email(独立研究者)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出混合神经符号模型,用于在风险敏感领域实现伦理AI,通过结合神经网络与符号推理,提升AI的可解释性和合规性。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17596 2025-11-25 cs.CV cs.AI 57%

Reconstruction-Driven Multimodal Representation Learning for Automated Media Understanding

基于重建的多模态表示学习用于自动化媒体理解

Yassir Benhammou, Suman Kalyan, Sujay Kumar

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出多模态自编码器MMAE,通过统一学习文本、音频和视觉数据的表示,实现广播内容的端到端自动化元数据提取与语义聚类,提升广播档案的可检索性与管理效率。

Comments 8 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17515 2025-11-25 cs.HC cs.AI 57%

Embedding Generative AI into Systems Analysis and Design Curriculum: Framework, Case Study, and Cross-Campus Empirical Evidence

将生成式人工智能融入系统分析与设计课程:框架、案例研究和跨校园实证证据

Mahmoud Elkhodr, Ergun Gide

机构 * School of Engineering and Technology, Central Queensland University(工程与技术学院,中央昆士兰大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出SAGE框架,通过将生成式人工智能融入课程设计,培养学生批判性思维和AI编排能力,揭示学生在系统分析中的关键挑战和教育改进方向。

Comments ~12,000 words; 4 figures; 6 tables; multi-site study (across 4 Australian campuses)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19109 2025-11-25 cs.CV 50%

HABIT: Human Action Benchmark for Interactive Traffic in CARLA

HABIT: 交互交通中的人类行为基准

Mohan Ramesh, Mark Azer, Fabian B. Flohr

机构 * Intelligent Vehicles Lab, Munich University of Applied Sciences(智能车辆实验室,慕尼黑应用科学大学)

专题命中 安全评测 :safety(abstract)

AI总结 HABIT是一个高保真度的交互交通人类行为基准,通过整合现实人类运动数据提升自动驾驶模拟的真实性,揭示现有自动驾驶代理在复杂场景下的性能缺陷。

Comments Accepted to WACV 2026. This is the pre-camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18983 2025-11-25 cs.CV 50%

UMCL: Unimodal-generated Multimodal Contrastive Learning for Cross-compression-rate Deepfake Detection

UMCL: 单模生成多模对比学习用于跨压缩率深度伪造检测

Ching-Yi Lai, Chih-Yu Jian, Pei-Cheng Chuang, Chia-Ming Lee, Chih-Chung Hsu, Chiou-Ting Hsu, Chia-Wen Lin

专题命中 安全评测 :alignment(abstract)

AI总结 UMCL通过单模生成多模对比学习,提升跨压缩率深度伪造检测的鲁棒性和准确性。

Comments 24-page manuscript accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18921 2025-11-25 cs.CV 50%

BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models

BackdoorVLM:面向视觉-语言模型的后门攻击基准

Juncheng Li, Yige Li, Hanxun Huang, Yunhao Chen, Xin Wang, Yixu Wang, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Singapore Management University(新加坡管理学院) The University of Melbourne(墨尔本大学)

专题命中 安全评测 :jailbreak(abstract)

AI总结 BackdoorVLM提出首个评估视觉-语言模型后门攻击的基准,揭示VLMs对文本指令的高敏感性及多模后门的有效性

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18547 2025-11-25 physics.med-ph 50%

Towards Integrated Clinical-Computational Nuclear Medicine

迈向整合的临床-计算核医学

Faraz Farhadi, Shadi A. Esfahani, Fereshteh Yousefirizi, Monica Luo, Pedro Esquinas Fernandez, Arkadiusz Sitek, Hamid Sabet, Babak Saboury, Arman Rahmim, Pedram Heidari

专题命中 安全评测 :safety(abstract)

AI总结 本文探讨了整合临床与计算核医学的重要性,通过AI和PBPK建模提升影像质量和治疗个性化,强调临床监督在确保安全性和准确性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10353 2025-11-25 cs.CV 50%

Motion-R1: Enhancing Motion Generation with Decomposed Chain-of-Thought and RL Binding

Motion-R1: 通过分解的链式推理与RL绑定增强运动生成

Runqi Ouyang, Haoyun Li, Zhenyuan Zhang, Xiaofeng Wang, Zeyu Zhang, Zheng Zhu, Guan Huang, Sirui Han, Xingang Wang

机构 * GigaAI CASIA HKUST(香港科技大学)

专题命中 安全评测 :alignment(abstract)

AI总结 Motion-R1通过结合分解的链式推理与强化学习,提升运动生成的质量和可解释性,实现多项指标的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02298 2025-11-25 cs.IR 50%

A Zero-shot Explainable Doctor Ranking Framework with Large Language Models

基于大语言模型的零样本可解释医生排名框架

Ziyang Zeng, Dongyuan Li, Yuqing Yang

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出基于大语言模型的零样本可解释医生排名框架,通过动态生成疾病特定的排名标准和逐步推理理由,提升医生排名的透明度和可解释性,并在DrRank数据集上取得显著性能提升。

Comments Accepted by Big Data Mining and Analytics (JCR Q1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18486 2025-11-25 cs.RO cs.SY eess.SY 50%

Expanding the Workspace of Electromagnetic Navigation Systems Using Dynamic Feedback for Single- and Multi-agent Control

通过动态反馈扩展电磁导航系统的作业空间以实现单体和多体控制

Jasan Zughaibi, Denis von Arx, Maurus Derungs, Florian Heemeyer, Luca A. Antonelli, Quentin Boehler, Michael Muehlebach, Bradley J. Nelson

机构 * Multi-Scale Robotics Lab, ETH Zurich(多尺度机器人实验室,苏黎世联邦理工学院) Learning and Dynamical Systems Group, Max Planck Institute for Intelligent Systems(学习与动态系统组,马克斯·普朗克智能系统研究所)

专题命中 安全评测 :alignment(abstract)

AI总结 通过动态反馈和系统级控制设计扩展电磁导航系统的作业空间,实现单体和多体控制的稳定与高效

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18352 2025-11-25 cs.CV 50%

MagicWand: A Universal Agent for Generation and Evaluation Aligned with User Preference

MagicWand: 一个通用代理用于生成与评估,与用户偏好对齐

Zitong Xu, Dake Shen, Yaosong Du, Kexiang Hao, Jinghan Huang, Xiande Huang

机构 * Shanghai Jiao Tong University(上海交通大学) De Artificial Intelligence Lab(德人工智能实验室) The Chinese University of Hong Kong, Shenzhen China(香港中文大学(深圳))

专题命中 安全评测 :alignment(abstract)

AI总结 MagicWand通过结合用户偏好数据集和先进生成模型,实现高质量内容生成与偏好对齐评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18343 2025-11-25 cs.SE 50%

A Needle in a Haystack: Intent-driven Reusable Artifacts Recommendation with LLMs

在 haystack 中寻找针:基于意图的可重用 artifacts 推荐 with LLMs

Dongming Jin, Zhi Jin, Xiaohong Chen, Zheng Fang, Linyu Li, Yuanpeng He, Jia Li, Yirang Zhang, Yingtao Fang

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出 TreeRec 框架,通过语义抽象组织 artifacts 成层次结构树,提升 LLMs 在意图驱动推荐中的性能和效率。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17755 2025-11-25 cs.CV 50%

CORA: Consistency-Guided Semi-Supervised Framework for Reasoning Segmentation

CORA: 一致性引导的半监督框架用于推理分割

Prantik Howlader, Hoang Nguyen-Canh, Srijan Das, Jingyi Xu, Hieu Le, Dimitris Samaras

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 安全评测 :alignment(abstract)

AI总结 CORA通过一致性引导的半监督方法实现高效推理分割,在Cityscapes和PanNuke数据集上分别提升2.3%和2.4%

Comments WACV 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17735 2025-11-25 cs.CV 50%

Towards Open-Ended Visual Scientific Discovery with Sparse Autoencoders

基于稀疏自编码器的开放性视觉科学发现

Samuel Stevens, Jacob Beattie, Tanya Berger-Wolf, Yu Su

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本研究探讨稀疏自编码器在基础模型表示中实现开放性特征发现的潜力,通过生态图像案例展示其在无标签数据下的细粒度结构识别能力,为科学发现提供了新工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02188 2025-11-25 cs.CR 50%

Whispering Agents: An Event-driven Covert Communication Protocol For the Internet of Agents

低语代理:一种基于事件的隐秘通信协议用于代理互联网

Kaibo Huang, Yukun Wei, Wansheng Wu, Tianhua Zhang, Zhongliang Yang, Linna Zhou

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种基于事件的隐秘通信协议ΠCCAP,利用代理对话的特性实现安全隐秘通信,为代理互联网的安全监控和防御提供基础支持。

Comments Accepted to AAAI-26 (Main, Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 5 篇

2502.00313 2025-11-25 cs.GT cs.AI cs.CL cs.MA 81%

Distributive Fairness in Large Language Models: Evaluating Alignment with Human Values

大语言模型中的分配公平性:评估与人类价值观的对齐

Hadi Hosseini, Samarth Khanna

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在分配公平性方面的表现,发现其与人类价值观存在偏差,并探讨了提升对齐性的策略。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17952 2025-11-25 cs.CV 78%

Multi-speaker Attention Alignment for Multimodal Social Interaction

多说话者注意力对齐用于多模态社交互动

Liangyang Ouyang, Yifei Huang, Mingfang Zhang, Caixin Kang, Ryosuke Furuta, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 本文提出了一种多模态多说话者注意力对齐方法,通过动态头选择和自适应注意力偏差提升多模态社交互动理解能力,实现SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13912 2025-11-25 cs.CL cs.AI 76%

AI Debaters are More Persuasive when Arguing in Alignment with Their Own Beliefs

AI辩论在与自身信念一致时更具说服力

María Victoria Carro, Denise Alejandra Mester, Facundo Nieto, Oscar Agustín Stanchi, Guido Ernesto Bergman, Mario Alejandro Leiva, Eitan Sprejer, Luca Nicolás Forziati Gangi, Francisca Gauna Selasco, Juan Gustavo Corvalán, Gerardo I. Simari, María Vanina Martinez

机构 * FAIR, IALAB, Universidad de Buenos Aires(FAIR、IALAB、布宜诺斯艾利斯大学) Universidad de Buenos Aires(布宜诺斯艾利斯大学) Universidad Nacional de Córdoba(科尔多瓦国立大学) BAISH, Universidad de Buenos Aires(BAISH、布宜诺斯艾利斯大学) Instituto de Investigación en Informática LIDI, Universidad Nacional de La Plata(信息研究所LIDI、拉普拉塔国立大学;CONICET) CONICET(计算机科学与工程系,南大学及ICIC UNS-CONICET) Dept. of Comp. Sci. and Eng., Universidad Nacional del Sur & ICIC UNS-CONICET(人工智能研究所(IIIA-CSIC),西班牙) Artificial Intelligence Research Institute (IIIA-CSIC), ES

专题命中 AI治理与伦理 :alignment(title);分类 cs.CL、cs.AI

AI总结 本研究探讨了AI辩论中模型在与自身信念一致或不一致时的说服力差异,发现模型倾向于迎合裁判观点,但不一致的论点在比较中更受好评。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19334 2025-11-25 cs.CY 70%

Normative active inference: A numerical proof of principle for a computational and economic legal analytic approach to AI governance

规范性主动推断:一种计算和经济法律分析方法用于AI治理的数值原理证明

Axel Constant, Mahault Albarracin, Karl J. Friston

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 本文提出通过设计监管实现合法且规范敏感的AI行为,利用主动推断框架模拟自动驾驶场景,展示法律规范对AI代理决策的影响。

Comments 19 pages, 6 figures, 1 box

详情

展开后加载摘要…

URL PDF HTML 收藏