arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2511.19877 2025-12-12 cs.MM cs.CV cs.LG eess.AS 57%

It Hears, It Sees too: Multi-Modal LLM for Depression Detection By Integrating Visual Understanding into Audio Language Models

它能听,也能看 too:通过将视觉理解整合到音频语言模型中构建多模态大语言模型以检测抑郁症

Xiangyu Zhao, Yaling Shen, Yiwen Jiang, Zimu Wang, Jiahe Liu, Maxmartwell H Cheng, Guilherme C Oliveira, Robert Desimone, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) Massachusetts Institute of Technology(麻省理工学院) The University of Melbourne(墨尔本大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种多模态大语言模型框架,通过整合视觉理解到音频语言模型中,提升抑郁症检测的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18271 2025-12-12 cs.CV cs.AI 57%

Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models

超越文字和像素:生成模型中隐式世界知识推理的基准测试

Tianyang Han, Junhao Su, Junjie Hu, Peizhen Yang, Hengyu Shi, Junfeng Luo, Jialin Gao

机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) Fudan University(复旦大学) D^{4} Lab(D⁴实验室) HHMI Janelia Research Campus(HHMI贾能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16528 2025-12-12 cs.LG 57%

Aligning ASR Evaluation with Human and LLM Judgments: Intelligibility Metrics Using Phonetic, Semantic, and NLI Approaches

对齐语音识别评估与人类和LLM判断:利用音系、语义和NLI方法的可理解性度量

Bornali Phukon, Xiuwen Zheng, Mark Hasegawa-Johnson

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出结合NLI、语义和音系相似性的新型语音识别评估度量,以提高对口吃和发音障碍语音的可理解性评估精度。

Comments 5 pages, 2 figures, Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10066 2025-12-12 stat.AP cs.AI 57%

Classifying Metamorphic versus Single-Fold Proteins with Statistical Learning and AlphaFold2

利用统计学习和AlphaFold2对变构蛋白与单构蛋白进行分类

Yongkai Chen, Samuel WK Wong, SC Kou

机构 * Harvard University(哈佛大学) University of Waterloo(滑铁卢大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用AlphaFold2生成构象集合并结合统计学习,对变构与单构蛋白进行分类,提高了对变构蛋白识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09552 2025-12-11 cs.CL 57%

Systematic Framework of Application Methods for Large Language Models in Language Sciences

大型语言模型在语言科学中应用方法的系统框架

Kun Sun, Rong Wang

机构 * Tongji University, China(同济大学) University of Tübingen, Germany(图宾根大学) Institute of Natural Language Processing, University of Stuttgart, Germany(斯图加特大学自然语言处理研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出两个系统框架,指导LLMs在语言科学中的战略应用,通过方法选择和多阶段研究流程提升研究的可重复性和科学性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08352 2025-12-11 cs.CV cs.AI 57%

Evaluating Small Vision-Language Models on Distance-Dependent Traffic Perception

评估小型视觉-语言模型在距离依赖性交通感知中的表现

Nikos Theodoridis, Tim Brophy, Reenu Mohandas, Ganesh Sistu, Fiachra Collins, Anthony Scanlan, Ciaran Eising

机构 * University of Limerick(利默里克大学) Data Driven Computer Engineering Research Centre(数据驱动计算机工程研究中心) Lero, The Irish Software Research Centre(Lero爱尔兰软件研究中心) Valeo Vision Systems(瓦莱欧视觉系统)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文评估了小型视觉-语言模型在距离依赖性交通感知任务中的表现,发现其在感知能力上显著弱于人类。

Comments Published in IEEE Open Journal of Vehicular Technology. Final version available at: https://ieeexplore.ieee.org/document/11230063

Journal ref IEEE Open Journal of Vehicular Technology, vol. 7, pp. 54-72, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.00881 2025-12-11 cs.RO cs.LG 57%

Robustness and Adaptability of Reinforcement Learning based Cooperative Autonomous Driving in Mixed-autonomy Traffic

基于混合自主交通的强化学习协同自动驾驶的鲁棒性与适应性

Rodolfo Valiente, Behrad Toghi, Ramtin Pedarsani, Yaser P. Fallah

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于多智能体强化学习的方法,用于提高自动驾驶车辆在混合自主交通环境中的鲁棒性和适应性,通过隐式学习人类驾驶行为以优化社会效用和安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08769 2025-12-10 cs.AI 57%

A Practical Guide for Designing, Developing, and Deploying Production-Grade Agentic AI Workflows

生产级智能体AI工作流设计、开发与部署的实用指南

Eranga Bandara, Ross Gore, Peter Foytik, Sachin Shetty, Ravi Mukkamala, Abdul Rahman, Xueping Liang, Safdar H. Bouk, Amin Hass, Sachini Rajapakse, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(旧 Dominion 大学) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一套生产级智能体AI工作流的设计、开发和部署的最佳实践,涵盖架构设计、多智能体模式、模型上下文协议及环境感知部署策略,旨在提升系统的可靠性与可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08723 2025-12-10 cs.CY 57%

The Role of Risk Modeling in Advanced AI Risk Management

风险建模在高级人工智能风险管理中的作用

Chloé Touzet, Henry Papadatos, Malcolm Murray, Otter Quarks, Steve Barrett, Alejandro Tlaie Boria, Elija Perrier, Matthew Smith, Siméon Campos

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文探讨了风险建模在高级AI风险管理中的关键作用,提出通过整合情景构建与风险评估,构建可验证的AI架构以应对复杂风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08185 2025-12-10 cs.CR cs.AI 57%

A Practical Framework for Evaluating Medical AI Security: Reproducible Assessment of Jailbreaking and Privacy Vulnerabilities Across Clinical Specialties

评估医疗AI安全的实用框架:在不同临床专科中可重复评估劫持和隐私漏洞

Jinghao Wang, Ping Zhang, Carter Yagemann

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种可重复评估医疗AI安全性的框架,针对不同临床专科的劫持和隐私漏洞进行评估,无需特殊资源或数据权限。

Comments 6 pages, 1 figure, framework proposal

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23856 2025-12-10 cs.AI 57%

From Benchmarks to Business Impact: Deploying IBM Generalist Agent in Enterprise Production

从基准到业务影响:在企业生产中部署IBM通用代理

Segev Shlomov, Alon Oved, Sami Marreed, Ido Levy, Offer Akrabi, Avi Yaeli, Łukasz Strąk, Elizabeth Koumpan, Yinon Goldshtein, Eilam Shapira, Nir Mashkif, Asaf Adi

机构 * IBM

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 IBM开发并试点了CUGA,展示了通用代理在企业生产环境中的应用,通过分层规划-执行架构实现先进性能,并在人才招聘领域验证其可扩展性和安全性。

Comments AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02239 2025-12-10 cs.CV cs.AI 57%

MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens

MiniGPT-5:通过生成性vokens实现交错的视觉-语言生成

Kaizhi Zheng, Xuehai He, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MiniGPT-5通过生成性vokens实现交错的视觉-语言生成,显著提升多模态生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07983 2025-12-10 cs.SE cs.AI 57%

An Empirical Framework for Evaluating Semantic Preservation Using Hugging Face

基于Hugging Face的语义保持评估经验框架

Nan Jia, Anita Raja, Raffi Khatchadourian

机构 * CUNY, the Graduate Center(纽约大学研究生中心) CUNY, Hunter College(纽约大学亨特学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出基于Hugging Face的语义保持评估经验框架,通过分析模型演化数据,揭示语义漂移检测方法及重构模式,为构建更可信的ML系统提供基础。

Comments Accepted to Hawaii International Conference on System Sciences (HICSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07898 2025-12-10 cs.MA cs.AI 57%

MARINE: Theoretical Optimization and Design for Multi-Agent Recursive IN-context Enhancement

MARINE:多智能体递归上下文增强的理论优化与设计

Hongwei Zhang, Ji Lu, Yongsheng Du, Yanqin Gao, Lingjun Huang, Baoli Wang, Fang Tan, Peng Zou

机构 * Hongwei Zhang(张宏伟) Ji Lu(卢纪) Yongsheng Du(杜永生) Yanqin Gao(高燕琴) Lingjun Huang(黄令军) Baoli Wang(王宝利) Fang Tan(谭芳) Peng Zou(邹鹏)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MARINE通过理论优化和设计实现多智能体递归上下文增强,显著提升推理性能并减少参数需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07874 2025-12-10 cs.LG 57%

Controllable risk scenario generation from human crash data for autonomous vehicle testing

从人类碰撞数据生成可控的风险场景用于自动驾驶测试

Qiujing Lu, Xuanhan Wang, Runze Yuan, Wei Lu, Xinyi Gong, Shuo Feng

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Beijing DiDi Infinity Technology and Development Co., Ltd.(北京滴滴无限科技发展有限公司) Space Information Research Institute and Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(空间信息研究所和浙江空间信息感知与传输重点实验室,杭州电子科技大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 CRAG通过生成可控的风险场景,提升自动驾驶车辆在罕见安全关键条件下的鲁棒性评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07845 2025-12-10 cs.SD cs.AI eess.AS 57%

AudioScene: Integrating Object-Event Audio into 3D Scenes

AudioScene: 将对象事件音频整合到3D场景中

Shuaihang Yuan, Congcong Wen, Muhammad Shafique, Anthony Tzes, Yi Fang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出AudioScene数据集,通过整合音频事件与3D场景,探索音频条件任务,提升空间学习的准确性与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07724 2025-12-09 cs.ET cs.AI 57%

The Native Spiking Microarchitecture: From Iontronic Primitives to Bit-Exact FP8 Arithmetic

本征脉冲微架构:从离子电子原语到精确的FP8算术

Zhengzheng Tang

机构 * Boston University(波士顿大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出本征脉冲微架构,通过空间组合流水线和粘性-额外修正机制,实现从随机离子到确定性浮点的转换,达到FP8精确计算并提升线性层效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07667 2025-12-09 cs.LG 57%

Depth-Wise Activation Steering for Honest Language Models

深度方向激活引导用于诚实语言模型

Gracjan Góral, Marysia Winkels, Steven Basart

机构 * University of Warsaw(华沙大学) MARS(对齐研究学生导师计划) Center for AI Safety(人工智能安全中心)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 深度方向激活引导方法通过高斯调度提升语言模型的诚实性,无需训练或微调,有效增强模型真实报告能力。

Comments See \url{https://github.com/marysia/gaussian-activation-steering}. for code and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07474 2025-12-09 cs.HC cs.CL 57%

Living the Novel: A System for Generating Self-Training Timeline-Aware Conversational Agents from Novels

活出小说:一种从小说生成自训练时间感知对话代理的系统

Yifei Huang, Tianyu Yan, Sitong Gong, Xiwei Gao, Caixin Kang, Ruicong Liu, Huchuan Lu, Bo Zheng

机构 * Shanda AI Research, Tokyo(上海沙达人工智能研究有限公司,东京) The University of Tokyo(东京大学) Dalian University of Technology(大连理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出Living Novel系统,通过两阶段训练流程解决LLM驱动角色的人设漂移和鲁棒性问题,实现连贯且抗中断的对话体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07302 2025-12-09 cs.CV cs.AI 57%

Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts

迈向准确的无人机图像感知:通过更强的任务提示引导视觉-语言模型

Mingning Guo, Mengwei Wu, Shaoxian Li, Haifeng Li, Chao Tao

机构 * School of Geosciences and InfoPhysics, Central South University(地质科学与信息物理学院,中南大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 AerialVP通过增强任务提示提升无人机图像感知性能,引入AerialSense基准评估模型在复杂场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07234 2025-12-09 cs.CV cs.AI 57%

Dropout Prompt Learning: Towards Robust and Adaptive Vision-Language Models

Dropout Prompt Learning: 向稳健和适应性强的视觉-语言模型迈进

Biao Chen, Lin Zuo, Mengmeng Jing, Kunbin He, Yuchen Wang

机构 * Biao Chen, Lin Zuo, Mengmeng Jing, Kunbin He, Yuchen Wang(作者)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Dropout Prompt Learning通过在视觉-语言模型中应用Dropout技术,提升模型的鲁棒性和适应性,实验表明其在低样本学习、长尾分类和分布外泛化等任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06390 2025-12-09 cs.CR cs.AI 57%

Ghost in the Transformer: Detecting Model Reuse with Invariant Spectral Signatures

Transformer中的幽灵:通过不变频谱特征检测模型重用

Suqing Wang, Ziyang Ma, Li Xinyi, Zuchao Li

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出GhostSpec,一种通过不变频谱特征验证LLM血统的方法,无需训练数据或行为修改,具有鲁棒性和高效性。

Comments Accepted at AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13515 2025-12-09 cs.CV cs.AI 57%

UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning

UniME-V2:基于大规模语言模型的通用多模态嵌入学习判别器

Tiancheng Gu, Kaicheng Yang, Kaichen Zhang, Xiang An, Ziyong Feng, Yueyi Zhang, Weidong Cai, Jiankang Deng, Lidong Bing

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 UniME-V2利用大规模语言模型提升通用多模态嵌入学习的判别能力,通过引入MLLM-as-a-Judge机制和重排序模型实现更高效的负样本挖掘和语义匹配。

Comments AAAI2026 Oral, Webpage:https://garygutc.github.io/UniME-v2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19912 2025-12-09 cs.CV cs.LG cs.RO 57%

Enhanced Spatiotemporal Consistency for Image-to-LiDAR Data Pretraining

增强的时空一致性用于图像到LiDAR数据预训练

Xiang Xu, Lingdong Kong, Hui Shuai, Wenwei Zhang, Liang Pan, Kai Chen, Ziwei Liu, Qingshan Liu

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) School of Computing, Department of Computer Science, National University of Singapore(新加坡国立大学计算机学院) School of Computer Science, Nanjing University of Posts and Telecommunications(南京邮电大学计算机学院) Shanghai AI Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 SuperFlow++通过整合时空线索提升图像到LiDAR数据预训练效果,实现更鲁棒的特征表示和更高效的自动驾驶感知。

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06710 2025-12-09 cs.AI 57%

Stochasticity in Agentic Evaluations: Quantifying Inconsistency with Intraclass Correlation

代理评估中的随机性:通过组内相关系数量化不一致性

Zairah Mustahsan, Abel Lim, Megna Anand, Saahil Jain, Bryan McCann

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过组内相关系数量化代理评估中的不一致性,以提高评估可靠性,建议在基准测试中报告ICC和查询内方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06341 2025-12-09 cs.LG cs.IR cs.IT math.IT 57%

Interpretive Efficiency: Information-Geometric Foundations of Data Usefulness

可解释效率:数据有用性的信息几何基础

Ronald Katende

机构 * Department of Mathematics(数学系) Kabale University(卡巴勒大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出可解释效率,一种基于信息几何的度量,用于评估数据支持可解释性表示的有效性,并通过实验验证其在表示设计中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06032 2025-12-09 cs.CV cs.AI 57%

The SAM2-to-SAM3 Gap in the Segment Anything Model Family: Why Prompt-Based Expertise Fails in Concept-Driven Image Segmentation

在Segment Anything模型家族中SAM2到SAM3之间的鸿沟:基于提示的专家知识为何在概念驱动的图像分割中失效

Ranjan Sapkota, Konstantinos I. Roumeliotis, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(希腊皮洛斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文分析了SAM2到SAM3在分割模型中的断层,指出基于提示的分割方法在概念驱动分割中失效的原因,并探讨了SAM3的多模态架构与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05648 2025-12-08 cs.LG 57%

Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs

超越数据过滤:LLMs中能力移除的知识定位

Igor Shilov, Alex Cloud, Aryo Pradipta Gema, Jacob Goldman-Wetzler, Nina Panickssery, Henry Sleight, Erik Jones, Cem Anil

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出SGTM方法,通过局部化知识并屏蔽梯度来移除LLM中的危险能力,相比数据过滤和梯度路由,在标签噪声下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05576 2025-12-08 cs.AI 57%

CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning

CureAgent:一种无需训练的执行-分析框架用于临床推理

Ting-Ting Xie, Yixin Zhang

机构 * Cambridge(剑桥)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 CureAgent提出无需训练的执行-分析框架,通过模块化架构和分层集合策略提升临床推理性能,实现CURE-Bench上的最佳表现。

Comments 2nd Place Solution to the CURE-Bench Competition @ NeurIPS 2025. Code available at https://github.com/June01/CureAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05176 2025-12-08 cs.SE cs.AI cs.HC 57%

Towards A Cultural Intelligence and Values Inferences Quality Benchmark for Community Values and Common Knowledge

迈向社区价值观和常识的文化智能与价值观推理质量基准

Brittany Johnson, Erin Reddick, Angela D. R. Smith

机构 * George Mason University(乔治·马歇尔大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出CIVIQ基准,旨在通过社区价值观和常识对齐提升文化智能,填补美国文化多样性下的评估空白。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏