arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-27 至 2025-11-27 共收录 50 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2511.14476 2025-11-27 cs.AI 89%

Operationalizing Pluralistic Values in Large Language Model Alignment Reveals Trade-offs in Safety, Inclusivity, and Model Behavior

在大型语言模型对齐中操作多元价值观揭示了安全、包容性和模型行为之间的权衡

Dalia Ali, Dora Zhao, Allison Koenecke, Orestis Papakyriakopoulos

机构 * Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);分类 cs.AI

AI总结 本研究探讨了在大型语言模型对齐中融入多元价值观的影响,发现不同群体偏好和设计选择对模型行为和安全性有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21050 2025-11-27 cs.LG cs.AI stat.ML 86%

Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs

打破安全性与能力的权衡:具有可验证奖励的强化学习在LLMs中维持安全护栏

Dongkyu Derek Cho, Huan Song, Arijit Ghosh Chowdhury, Haotian An, Yawei Wang, Rohit Thekkanal, Negin Sokhandan, Sharlina Keshava, Hannah Marlowe

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过可验证奖励的强化学习方法,在提升LLM推理能力的同时维持安全性,挑战了传统安全性与能力权衡的假设。

Comments AAAI-26 Workshop on Post-AI Formal Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19387 2025-11-27 cs.LG cs.SY eess.SY math.OC 83%

Alignment of large language models with constrained learning

受限学习下的大语言模型对齐

Botong Zhang, Shuo Li, Ignacio Hounie, Osbert Bastani, Dongsheng Ding, Alejandro Ribeiro

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种基于拉格朗日对偶性的迭代对偶对齐方法,用于在满足约束条件下优化大语言模型策略,通过实验验证了其在受限对齐问题中的有效性。

Comments 51 pages, 5 figures, 11 tables; Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19474 2025-11-27 cs.LG 79%

g-DPO: Scalable Preference Optimization for Protein Language Models

g-DPO:可扩展的偏好优化用于蛋白质语言模型

Constance Ferragu, Jonathan D. Ziegler, Nicolas Deutschmann, Arthur Lindoulsi, Eli Bixby, Cradle ML Team

机构 * Cradle ML Team(Cradle团队) Cradle Zürich, Switzerland(Cradle瑞士苏黎世)

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.LG

AI总结 g-DPO通过序列聚类和组近似方法提升蛋白质语言模型的偏好优化效率,实现更快的收敛速度和与标准DPO相当的性能。

Comments Accepted at two workshops: FM4LS NeurIPS 2025 (accepted-paper.html" target="_blank" rel="noopener">https://nips2025fm4ls.github.io/pages/accepted-paper.html) and MLSB in Copenhagen EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18477 2025-11-27 cs.IR cs.AI cs.LG 62%

Personalized Image Generation for Recommendations Beyond Catalogs

推荐超越目录的个性化图像生成

Gabriel Patron, Zhiwei Xu, Ishan Kapnadak, Felipe Maia Polo

机构 * University of Michigan(密歇根大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 REBECA通过直接学习隐含反馈信号实现高效个性化图像生成,无需微调扩散模型,提升大规模用户群体的个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21638 2025-11-27 cs.LG 57%

Aligning LLMs Toward Multi-Turn Conversational Outcomes Using Iterative PPO

通过迭代PPO对齐大语言模型以实现多轮对话结果

Daniel R. Jiang, Jalaj Bhandari, Yukai Yang, Rémi Munos, Tyler Lu

机构 * Meta FAIR at Meta(Meta的FAIR)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出Iterative PPO方法,通过迭代优化多轮对话中的Q函数和策略,实现更稳定的对话生成。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21270 2025-11-27 cs.SD cs.CV 50%

Multi-Reward GRPO for Stable and Prosodic Single-Codebook TTS LLMs at Scale

多奖励GRPO用于大规模稳定且有声调的单代码本TTS LLMs

Yicheng Zhong, Peiji Yang, Zhisheng Wang

机构 * Tencent Technology Co.Ltd(腾讯科技有限公司)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出多奖励GRPO框架,通过优化单代码本TTS LLMs的生成策略,提升语音的语调稳定性、说话者相似性和自然度。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 5 篇

2508.12398 2025-11-27 cs.CR cs.AI cs.CL 84%

Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position

对齐何处开始?扩散大语言模型可能需要不同的位置

Zhixin Xie, Xurui Song, Jun Luo

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MOSA方法,通过强化学习对齐dLLM中间生成与安全拒绝,提升安全性。

Comments Accepted for oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17846 2025-11-27 cs.RO cs.AI 79%

Safety Control of Service Robots with LLMs and Embodied Knowledge Graphs

服务机器人中结合大语言模型和具身知识图谱的安全控制

Yong Qi, Gabriel Kyebambo, Siyuan Xie, Wei Shen, Shenghui Wang, Bitao Xie, Bin He, Zhipeng Wang, Shuo Jiang

机构 * School of Electronic Information(电子信息学院) Artificial Intelligence, Shaanxi University of Science(人工智能,陕西科技大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出结合大语言模型与具身知识图谱的方法,提升服务机器人安全控制,通过预定义指令和知识库验证增强安全实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15392 2025-11-27 cs.LG 57%

Learning in Stackelberg Mean Field Games: A Non-Asymptotic Analysis

在Stackelberg均场博弈中学习:非渐近分析

Sihan Zeng, Benjamin Patrick Evans, Sujay Bhatt, Leo Ardon, Sumitra Ganesh, Alec Koppel

机构 * J.P.Morgan AI Research(J.P.Morgan AI研究)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出AC-SMFG算法,首次在Stackelberg均场博弈中实现非渐近收敛保证,通过梯度对齐条件提升策略优化效率。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21584 2025-11-27 cs.RO cs.AI 57%

Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving

基于模型的策略适应用于闭环端到端自动驾驶

Haohong Lin, Yunzhi Zhang, Wenhao Ding, Jiajun Wu, Ding Zhao

机构 * CMU(卡内基梅隆大学) Stanford(斯坦福大学) NVIDIA(英伟达)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于模型的策略适应框架,通过生成反事实轨迹和训练Q值模型提升自动驾驶在闭环环境中的鲁棒性和安全性。

Comments Published at NeurIPS 2025: https://openreview.net/forum?id=4OLbpaTKJe

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20919 2025-11-27 physics.ed-ph hep-ex 50%

Virtual high voltage lab: gamified learning in a safe 3d environment

虚拟高压实验室:在安全3D环境中的游戏化学习

Vladyslav Pliuhin, Yevgen Tsegelnyk, Maria Sukhonos, Ihor Biletskyi, Sergiy Plankovskyy, Taras Sakhoshko

专题命中 安全训练 :safety(abstract)

AI总结 本研究提出一个基于Unreal Engine 5的虚拟高压实验室,通过游戏化和沉浸式技术提升学生在高压工程学习中的参与度和实践技能,增强城市能源系统韧性。

Comments 54 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2511.19218 2025-11-27 cs.CR cs.AI 88%

Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization

对抗攻击-防御共演进用于LLM安全对齐的树组双感知搜索与优化

Xurui Li, Kaisong Song, Rui Zhu, Pin-Yu Chen, Haixu Tang

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Yale University(耶鲁大学) IBM Research AI(IBM人工智能研究) Indiana University(印第安纳大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.AI

AI总结 ACE-Safety通过树组双感知搜索与优化,共同优化攻击与防御模型,提升LLM的安全对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02833 2025-11-27 cs.CR 85%

Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs

通过过拟合攻击:10次良性微调以劫持LLMs

Zhixin Xie, Xurui Song, Jun Luo

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 通过10个良性QA对微调实现LLM劫持,利用过拟合增强敏感性,提升攻击效果与隐蔽性。

Comments Published as a conference paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18581 2025-11-27 cs.CR 78%

TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization

TASO:通过替代模板和后缀优化实现对抗性攻击

Yanting Wang, Runpeng Geng, Jinghui Chen, Minhao Cheng, Jinyuan Jia

专题命中 越狱攻击 :jailbreak(title,abstract)

AI总结 TASO通过交替优化模板和后缀,提高对抗性攻击的有效性,针对多种大语言模型进行测试并证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14070 2025-11-27 cs.CR cs.AI 57%

Special-Character Adversarial Attacks on Open-Source Language Model

特殊字符对抗攻击对开源语言模型的攻击

Ephraiem Sarabamoun

机构 * University of Virginia(弗吉尼亚大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文研究了针对开源语言模型的特殊字符对抗攻击,评估了多种攻击方式并揭示了模型的安全漏洞及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 2 篇

2511.21401 2025-11-27 cs.CL 57%

Can LLMs extract human-like fine-grained evidence for evidence-based fact-checking?

大语言模型能否提取出具有人类细粒度证据的证据以用于基于证据的事实核查?

Antonín Jarolím, Martin Fajčík, Lucia Makaiová

机构 * Brno University of Technology, Czech Republic(布拉格技术大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文研究了大语言模型在细粒度证据提取任务中的表现,通过新数据集评估发现,模型大小与对齐程度之间存在有效平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20704 2025-11-27 cs.LG stat.ML 57%

Pretraining Transformer-Based Models on Diffusion-Generated Synthetic Graphs for Alzheimer's Disease Prediction

基于扩散生成合成图的Transformer模型预训练用于阿尔茨海默病预测

Abolfazl Moslemi, Hossein Peyvandi

机构 * Sharif University of Technology(谢里夫理工学院) Pasargad Institute for Advanced Innovative Solutions(帕萨尔加德先进创新解决方案研究所)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究提出基于扩散生成合成图的Transformer模型,通过预训练提升阿尔茨海默病预测的准确性和泛化能力。

Comments 14 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 20 篇

2511.20703 2025-11-27 cs.CY cs.AI cs.LG 82%

PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach

PropensityBench: 通过代理方法评估大语言模型中的潜在安全风险

Udari Madhushani Sehwag, Shayan Shabihi, Alex McAvoy, Vikash Sehwag, Yuancheng Xu, Dalton Towers, Furong Huang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 PropensityBench通过模拟危险能力评估大语言模型的潜在安全风险倾向,揭示模型在压力下可能选择高风险行为的倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21363 2025-11-27 cs.LG cs.AI 81%

The Directed Prediction Change - Efficient and Trustworthy Fidelity Assessment for Local Feature Attribution Methods

定向预测变化 - 用于局部特征归因方法高效且可信的保真度评估

Kevin Iselborn, David Dembinsky, Adriano Lucieri, Andreas Dengel

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DPC度量标准,用于高效且可信地评估局部特征归因方法的保真度,通过改进预测变化度量并消除随机性,实现快速且确定性的评估。

Comments 13 pages, 10 figures, 5 tables, accepted at AAAI SECURE-AI4H workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20726 2025-11-27 cs.LG cs.AI 81%

Learning from Risk: LLM-Guided Generation of Safety-Critical Scenarios with Prior Knowledge

从风险学习:利用先验知识的LLM引导的安全关键场景生成

Yuhang Wang, Heye Huang, Zhenhua Xu, Kailai Sun, Baoshen Guo, Jinhua Zhao

机构 * Chinese Academy of Sciences, China(中国科学院) Department of Urban Studies and Planning, Massachusetts Institute of Technology, USA(麻省理工学院城市研究与规划系) School of Vehicle and Mobility, Tsinghua University, China(清华大学车辆与移动系统学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用LLM和CVAE生成安全关键场景的方法,通过知识驱动优化提升自动驾驶系统在罕见高风险事件下的鲁棒性与可控性。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21568 2025-11-27 cs.CL 79%

RoParQ: Paraphrase-Aware Alignment of Large Language Models Towards Robustness to Paraphrased Questions

RoParQ:面向抗 paraphrased 问题的大型语言模型对齐

Minjoon Choi

机构 * Seoul National University(首尔国立大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 RoParQ 通过引入 XParaCon 指标和基于推理的 SFT 策略,提升 LLM 在 paraphrased 问题上的鲁棒性与一致性。

Comments 12 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21561 2025-11-27 cs.LG 79%

Machine Learning Approaches to Clinical Risk Prediction: Multi-Scale Temporal Alignment in Electronic Health Records

基于机器学习的临床风险预测方法:电子健康记录中的多尺度时间对齐

Wei-Chen Chang, Lu Dai, Ting Xu

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 本研究提出基于多尺度时间对齐网络的临床风险预测方法,通过多尺度卷积和注意力机制提升EHR中异步时间序列的建模能力。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17041 2025-11-27 cs.IR cs.AI 79%

CLLMRec: LLM-powered Cognitive-Aware Concept Recommendation via Semantic Alignment and Prerequisite Knowledge Distillation

CLLMRec: 基于大语言模型的认知感知概念推荐:通过语义对齐和先决知识蒸馏

Xiangrui Xiong, Yichuan Lu, Zifei Pan, Chang Sun

机构 * Xihua University, Chengdu 610039, China(西华大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 CLLMRec通过语义对齐和先决知识蒸馏,利用大语言模型实现认知感知的概念推荐,无需依赖结构化知识图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21460 2025-11-27 cs.AI 77%

MADRA: Multi-Agent Debate for Risk-Aware Embodied Planning

MADRA:多智能体辩论用于风险感知的具身规划

Junjian Wang, Lidan Zhao, Xi Sheryl Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) University of Chinese Academy of Sciences, Nanjing(中国科学院大学南京校区)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 MADRA通过多智能体辩论和分层认知框架,在安全性和效率上超越现有方法,实现高安全任务拒绝率和低误拒率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20736 2025-11-27 cs.CY cs.AI cs.CL 75%

Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts

大语言模型在社会法律情境中对非法指令的共谋回应

Xing Wang, Huiyuan Xie, Yiyan Wang, Chaojun Xiao, Huimin Chen, Holli Sargeant, Felix Steffek, Jie Shao, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究探讨大语言模型在社会法律情境中对非法指令的共谋回应,揭示其在不同情境下的安全性和易感性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08135 2025-11-27 cs.SE cs.AI cs.DC cs.PF 74%

Leveraging AI for Productive and Trustworthy HPC Software: Challenges and Research Directions

利用AI实现高效且可信的HPC软件:挑战与研究方向

Keita Teranishi, Harshitha Menon, William F. Godoy, Prasanna Balaprakash, David Bau, Tal Ben-Nun, Abhinav Bhatele, Franz Franchetti, Michael Franusich, Todd Gamblin, Giorgis Georgakoudis, Tom Goldstein, Arjun Guha, Steven Hahn, Costin Iancu, Zheming Jin, Terry Jones, Tze Meng Low, Het Mankad, Narasinga Rao Miniskar, Mohammad Alaul Haque Monil, Daniel Nichols, Konstantinos Parasyris, Swaroop Pophale, Pedro Valero-Lara, Jeffrey S. Vetter, Samuel Williams, Aaron Young

机构 * Oak Ridge National Laboratory(奥克荷厄斯国家实验室) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) Carnegie Mellon University(卡内基梅隆大学) Northeastern University(东北大学) University of Maryland(马里兰大学) SpiralGen Inc.(SpiralGen公司)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文探讨了利用AI改进HPC软件的挑战与研究方向,提出通过Ellora和Durban项目推动AI在HPC软件发展中的应用。

Comments 12 pages, 1 Figure, Accepted at "The 1st International Workshop on Foundational Large Language Models Advances for HPC" LLM4HPC to be held in conjunction with ISC High Performance 2025

Journal ref In: Neuwirth, S., Paul, A.K., Weinzierl, T., Carson, E.C. (eds) High Performance Computing. ISC High Performance 2025. Lecture Notes in Computer Science, vol 16091. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20733 2025-11-27 cs.CY cs.AI cs.CL cs.HC 67%

InvisibleBench: A Deployment Gate for Caregiving Relationship AI

InvisibleBench:护理关系AI的部署门

Ali Madad

机构 * GiveCare

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 InvisibleBench评估护理关系AI的部署安全性,通过多维度测试揭示模型在危机检测、合规性及创伤导向设计上的差异,强调生产系统中确定性危机路由的重要性。

Comments 29 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20686 2025-11-27 cs.AI cs.CY cs.LG 67%

AssurAI: Experience with Constructing Korean Socio-cultural Datasets to Discover Potential Risks of Generative AI

AssurAI: 韩国社会文化数据集构建经验以发现生成式AI的潜在风险

Chae-Gyun Lim, Seung-Ho Han, EunYoung Byun, Jeongyun Han, Soohyun Cho, Eojin Joo, Heehyeon Kim, Sieun Kim, Juhoon Lee, Hyunsoo Lee, Dongkun Lee, Jonghwan Hyeon, Yechan Hwang, Young-Jun Lee, Kyeongryul Lee, Minhyeong An, Hyunjun Ahn, Jeongwoo Son, Junho Park, Donggyu Yoon, Taehyung Kim, Jeemin Kim, Dasom Choi, Kwangyoung Lee, Hyunseung Lim, Yeohyun Jung, Jongok Hong, Sooyohn Nam, Joonyoung Park, Sungmin Na, Yubin Choi, Jeanne Choi, Yoojin Hong, Sueun Jang, Youngseok Seo, Somin Park, Seoungung Jo, Wonhye Chae, Yeeun Jo, Eunyoung Kim, Joyce Jiyoung Whang, HwaJung Hong, Joseph Seering, Uichin Lee, Juho Kim, Sunna Choi, Seokyeon Ko, Taeho Kim, Kyunghoon Kim, Myungsik Ha, So Jung Lee, Jemin Hwang, JoonHo Kwak, Ho-Jin Choi

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 AssurAI通过构建高质量的韩语多模态数据集,评估生成式AI的安全性,发现潜在风险,促进更安全的AI发展。

Comments 16 pages, HuggingFace: https://huggingface.co/datasets/TTA01/AssurAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12336 2025-11-27 cs.CV 67%

Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding

对多模态大语言模型在视频理解中的可信度进行基准测试

Youze Wang, Zijun Chen, Ruoyu Chen, Shishen Gu, Wenbo Hu, Jiayang Liu, Yinpeng Dong, Hang Su, Jun Zhu, Meng Wang, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) Institute of Science Tokyo(东京科学研究所)

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本研究提出Trust-videoLLMs基准,评估23种视频LLMs在真实性、鲁棒性、安全性和隐私等方面的表现,揭示其在动态场景理解及现实风险缓解中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏