arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2604.23775 2026-04-28 cs.RO 82%

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22737 2026-04-22 cs.CV 82%

Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models

Lingua-SafetyBench: 一个多语言视觉-语言模型安全评估基准

Enyi Shi, Pengyang Shao, Yanxin Zhang, Chenhang Cui, Jiayi Lyu, Xiaobo Xia, Fei Shen, Tat-Seng Chua

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) School of Engineering Science, University of the Chinese Academy of Sciences(中国科学院工程科学学院) NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心)

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

AI总结 本文提出Lingua-SafetyBench,通过10万多个多语言图像-文本对评估多模态模型的安全性,发现非高资源语言和非拉丁文在文本主导风险下安全性更差,强调需要专门的语言和模态对齐策略以提升安全性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16424 2026-04-21 cs.CR cs.AI cs.CL cs.LG math.OC 82%

Safety, Security, and Cognitive Risks in State-Space Models: A Systematic Threat Analysis with Spectral, Stateful, and Capacity Attacks

状态空间模型中的安全性、安全性和认知风险:基于谱、状态ful和容量攻击的系统性威胁分析

Manoj Parmar

机构 * SovereignAI Security Labs(SovereignAI安全实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统分析了状态空间模型的安全性、安全性和认知风险,提出了七项贡献,包括威胁框架、三种新型攻击类别、14项MITRE ATLAS技术扩展以及针对不同领域的攻击者分类。

Comments 32 pages, 22 tables, NeurIPS 2026 submission format. Appendix contains theoretical analysis and future experimentation plans

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05157 2026-04-01 cs.SE cs.SY eess.SY 82%

The Necessity of a Holistic Safety Evaluation Framework for AI-Based Automation Features

人工智能驱动自动化功能的综合安全评估框架的必要性

Alireza Abbaspour, Shabin Mahadevan, Kilian Zwirglmaier, Jeff Stafford

专题命中 安全评测 :safety(title,abstract);AI safety(abstract)

AI总结 本文探讨了在人工智能整合下,需对AI组件进行综合安全分析和风险评估,以识别和缓解潜在风险,特别是在安全关键驾驶系统中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23376 2026-03-30 cs.CV cs.RO 82%

ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment

ABot-PhysWorld:用于机器人操作的交互世界基础模型,具有物理对齐

Yuzhi Chen, Ronghan Chen, Dongjie Huo, Yandan Yang, Dekang Qi, Haoyun Liu, Tong Lin, Shuang Zeng, Junjin Xiao, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

专题命中 安全评测 :alignment(title,abstract);DPO(abstract)

AI总结 ABot-PhysWorld通过物理对齐的交互世界模型,生成物理合理且可控的视频,解决了传统方法在物理仿真中的不足,通过新框架和基准测试提升了性能。

Comments Code: https://github.com/amap-cvlab/ABot-PhysWorld.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23037 2026-03-25 cs.CV cs.AI cs.CL cs.LG cs.RO 82%

YOLOv10 with Kolmogorov-Arnold networks and vision-language foundation models for interpretable object detection and trustworthy multimodal AI in computer vision perception

YOLOv10结合Kolmogorov-Arnold网络和视觉-语言基础模型用于可解释的目标检测和可信的多模态AI在计算机视觉感知

Marios Impraimakis, Daniel Vazquez, Feiyu Zhou

机构 * University of Bath(巴斯大学) Zhejiang University(浙江大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于Kolmogorov-Arnold网络和视觉-语言基础模型的YOLOv10框架,通过七种几何和语义特征提升目标检测的可解释性,并在模糊、遮挡或低纹理场景中实现可信的置信度估计。

Comments 14 pages, 23 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19092 2026-03-20 cs.CV cs.AI cs.CL cs.LG 82%

SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues

SAVeS: 通过语义线索引导视觉-语言模型中的安全判断

Carlos Hinojosa, Clemens Grange, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过语义线索引导视觉-语言模型的安全判断,提出SAVeS基准和评估协议,验证安全决策对语义线索的敏感性,揭示模型对视觉-语言关联的依赖及潜在安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06194 2026-03-18 cs.CY cs.AI cs.CL 82%

Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias

大语言模型中的政治倾向:心理测量身份与行为偏见的多维审计

Adib Sakhawat, Tahsin Islam, Takia Farhin, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

机构 * Systems and Software Lab (SSL) Department of Computer Science and Engineering(系统与软件实验室(SSL)计算机科学与工程系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究通过多维心理测量工具审计26个大语言模型,发现模型在政治倾向上聚类于自由主义左 quadrant,且模型身份解释了大部分变异性,但心理测量意识形态未显著预测分类误差。

Comments Under review, 25 pages, 6 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15242 2026-02-19 cs.CV 82%

Trustworthy and Fair SkinGPT-R1 for Democratizing Dermatological Reasoning across Diverse Ethnicities

可信且公平的SkinGPT-R1:用于在不同种族中普及皮肤病推理

Yuhao Shen, Zhangtianyi Chen, Yuanhao He, Yan Xu, Shuping Zhang, Liyuan Sun, Zijian Wang, Yinghao Zhu, Yuyuan Yang, Jiahe Qian, Ziwen Wang, Xinyuan Zhang, Wenbin Liu, Zongyuan Ge, Tao Lu, Siyuan Yan, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院,香港中文大学(深圳)) Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学) Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(皮肤科,天津整合皮肤科研究所,天津中医研究院附属医院) Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院) Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(皮肤科,北京安贞医院,首都医科大学) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Department of Dermatology, Beijing Aerospace General Hospital(皮肤科,北京航天总医院)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract)

AI总结 SkinGPT-R1通过公平性意识的专家混合架构实现可解释且公平的皮肤病诊断,提升不同种族间的诊断准确性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11472 2026-02-13 cs.CR cs.DC 82%

Future Mining: Learning for Safety and Security

未来采矿:安全与安全的学习

Md Sazedur Rahman, Mizanur Rahman Jewel, Sanjay Madria

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract)

AI总结 本文提出了一种统一的智能安全和安全架构,整合多模态感知、安全联邦学习、强化学习、DTN通信和能量感知传感,以提升采矿环境中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09947 2026-02-11 cs.CR 82%

Trustworthy Agentic AI Requires Deterministic Architectural Boundaries

可信的代理AI需要确定性的架构边界

Manish Bhattarai, Minh Vu

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract)

AI总结 本文提出三位一体防御架构,通过确定性的架构执行解决代理AI的安全问题,强调架构调解对可信AI应用的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08369 2026-02-10 cs.AI cs.CL cs.LG 82%

MemAdapter: Fast Alignment across Agent Memory Paradigms via Generative Subgraph Retrieval

MemAdapter:通过生成子图检索实现跨代理记忆范式的快速对齐

Xin Zhang, Kailai Yang, Chenyue Li, Hao Li, Qiyu Wei, Jun'ichi Tsujii, Sophia Ananiadou

机构 * The University of Manchester(曼彻斯特大学) Stanford University(斯坦福大学) Imperial College London(伦敦帝国理工学院) National Institute of Advanced Industrial Science(国家先进工业科学与技术研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MemAdapter通过生成子图检索实现跨代理记忆范式的快速对齐,提升记忆检索灵活性并降低对齐成本,实验显示其性能优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21548 2026-01-26 cs.CL cs.AI cs.CY physics.soc-ph 82%

Fluent but Foreign: Even Regional LLMs Lack Cultural Alignment

流畅但异域:即使区域LLM也缺乏文化契合

Dhruv Agarwal, Anya Shukla, Sunayana Sitaram, Aditya Vashistha

机构 * Cornell University(康奈尔大学) Microsoft Research(微软研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现,即使区域LLM也缺乏文化契合,需通过社区基础的数据和厚宽评估来构建真正主权的LLM。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14728 2026-01-22 eess.AS cs.AI cs.CL cs.LG cs.SD 82%

AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering

AQAScore: 通过音频问答评估文本到音频生成中的语义对齐

Chun-Yi Kuan, Kai-Wei Chang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AQAScore通过音频问答评估文本到音频生成的语义对齐,利用大型语言模型的推理能力,有效捕捉语义不一致性。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02737 2026-01-16 cs.CV 82%

Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench

揭示和弥合MLLMs中的功能感知差距:通过PET-Bench实现原子视觉对齐和分层评估

Zanting Ye, Xiaolong Niu, Xuanbin Wu, Xu Han, Shengyuan Liu, Jing Hao, Zhihao Peng, Hao Sun, Jieqin Lv, Fanghu Wang, Yanchao Huang, Hubing Wu, Yixuan Yuan, Habib Zaidi, Arman Rahmim, Yefeng Zheng, Lijun Lu

机构 * School of Biomedical Engineering, Southern Medical University(生物医学工程学院,南方医科大学) School of Biomedical Engineering, Shanghai Jiaotong University(生物医学工程学院,上海交通大学) Department of Electronic Engineering, Chinese University of Hong Kong(电子工程系,中国香港大学) Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) Department of Nuclear Medicine, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(核医学科,广州中医药大学第二附属医院) PET Center, Department of Nuclear Medicine, Guangdong Provincial People’s Hospital, Southern Medical University(PET中心,核医学科,广东省人民医院,南方医科大学) Department of Nuclear Medicine, Nanfang Hospital, Southern Medical University(核医学科,南芳医院,南方医科大学) Division of Nuclear Medicine and Molecular Imaging, Geneva University Hospitals(核医学与分子影像学部,日内瓦大学医院) Departments of Radiology, Physics, and Biomedical Engineering, The University of British Columbia(放射学、物理和生物医学工程系,不列颠哥伦比亚大学) Medical Artificial Intelligence Laboratory, Westlake University(医学人工智能实验室,西湖大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract)

AI总结 本文提出AVA方法,通过原子视觉对齐解决MLLMs在功能成像中的感知差距,提升诊断准确性14.83%。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05485 2025-12-09 cs.CR 82%

TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations

TeleAI-Safety: 一种全面的LLM jailbreaking基准测试,面向攻击、防御和评估

Xiuyuan Chen, Jian Zhao, Yuxiang He, Yuan Xun, Xinwei Liu, Yanshu Li, Huilin Zhou, Wei Cai, Ziyan Shi, Yuchen Yuan, Tianle Zhang, Chi Zhang, Xuelong Li

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract)

AI总结 TeleAI-Safety提出了一种全面的LLM安全评估基准,整合多种攻击、防御和评估方法,用于系统性评估LLM的安全性及优化防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16402 2025-12-08 cs.AI cs.CL cs.CV cs.LG cs.RO 82%

IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks

IS-Bench:评估由视觉语言模型驱动的具身智能体在日常家务任务中的交互安全性

Xiaoya Lu, Zeren Chen, Xuhao Hu, Yijin Zhou, Weichen Zhang, Dongrui Liu, Lu Sheng, Jing Shao

机构 * Xiaoya Lu 1, 2(某大学) Zeren Chen 2, 3(某大学) Xuhao Hu 2, 4(某大学) Yijin Zhou 2(某大学) Weichen Zhang 2(某大学) Dongrui Liu 2(某大学) Lu Sheng 3(某研究所) Jing Shao 2(某研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IS-Bench通过多模态基准评估视觉语言模型驱动的具身智能体在日常家务任务中的交互安全性,揭示现有智能体缺乏安全意识的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22047 2025-12-01 cs.CR 82%

Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks

评估大型语言模型安全防护措施对对抗攻击的鲁棒性

Richard J. Young

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract)

AI总结 本研究评估了大型语言模型安全防护措施对对抗攻击的鲁棒性,发现模型在未见过的提示上表现显著下降,且存在新的失败模式,强调泛化能力的重要性。

Comments 21 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20703 2025-11-27 cs.CY cs.AI cs.LG 82%

PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach

PropensityBench: 通过代理方法评估大语言模型中的潜在安全风险

Udari Madhushani Sehwag, Shayan Shabihi, Alex McAvoy, Vikash Sehwag, Yuancheng Xu, Dalton Towers, Furong Huang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 PropensityBench通过模拟危险能力评估大语言模型的潜在安全风险倾向,揭示模型在压力下可能选择高风险行为的倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20604 2025-11-26 cs.CL cs.AI cs.LG 82%

On Evaluating LLM Alignment by Evaluating LLMs as Judges

通过评估LLM作为裁判来评估LLM对齐

Yixin Liu, Pengfei Liu, Arman Cohan

机构 * Yale University(耶鲁大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AlignEval基准,通过评估LLM作为裁判的能力来衡量其对齐人类偏好的效果,结果优于现有自动评估基准。

Comments NeurIPS 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08045 2025-11-14 cs.CL cs.AI cs.CY 82%

Break the Checkbox: Challenging Closed-Style Evaluations of Cultural Alignment in LLMs

Mohsinul Kabir, Ajwad Abrar, Sophia Ananiadou

机构 * Department of Computer Science, National Center for Text Mining, The University of Manchester(计算机科学系,文本挖掘国家中心,曼彻斯特大学) Department of Computer Science and Engineering, Islamic University of Technology(计算机科学与工程系,伊斯兰技术大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted at EMNLP 2025 (Main)

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05889 2025-11-11 cs.RO 82%

From Words to Safety: Language-Conditioned Safety Filtering for Robot Navigation

Zeyuan Feng, Haimingyue Zhang, Somil Bansal

机构 * department of Aeronautics and Astronautics, Stanford University(航空与宇航系,斯坦福大学) School of Vehicle and Mobility at Tsinghua University(清华大学车辆与移动系统学院)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17408 2025-10-21 cs.RO cs.SY eess.SY 82%

Integrating Trustworthy Artificial Intelligence with Energy-Efficient Robotic Arms for Waste Sorting

Halima I. Kure, Jishna Retnakumari, Augustine O. Nwajana, Umar M. Ismail, Bilyaminu A. Romo, Ehigiator Egho-Promise

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract)

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14697 2025-10-21 cs.CR cs.RO 82%

AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions

Zonghao Ying, Le Wang, Yisong Xiao, Jiakai Wang, Yuqing Ma, Jinyang Guo, Zhenfei Yin, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * SKLCCSE, Beihang University(北京航空航天大学智能科学与技术研究中心) Zhongguancun Laboratory(中关村实验室) The University of Sydney(悉尼大学) Henan University of Science(河南科技大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11278 2025-10-17 cs.LG cs.AI cs.CL 82%

ENIGMA: The Geometry of Reasoning and Alignment in Large-Language Models

Gareth Seneque, Lap-Hang Ho, Nafise Erfanian Saeedi, Jeffrey Molendijk, Ariel Kuperman, Tim Elson

机构 * Australian Broadcasting Corporation(澳大利亚广播公司)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 52 pages, 10 figures, author typo corrected, abstract typo corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07709 2025-10-10 cs.AI cs.CL cs.CY cs.MA 82%

Multimodal Safety Evaluation in Generative Agent Social Simulations

Alhim Vera, Karen Sanchez, Carlos Hinojosa, Haidar Bin Hamid, Donghoon Kim, Bernard Ghanem

机构 * University of Cincinnati(辛辛那提大学) King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17276 2025-09-23 cs.CL cs.AI cs.LG 82%

Probabilistic Token Alignment for Large Language Model Fusion

Runjia Zeng, James Chenhao Liang, Cheng Han, Zhiwen Cao, Jiahao Liu, Xiaojun Quan, Yingjie Victor Chen, Lifu Huang, Tong Geng, Qifan Wang, Dongfang Liu

机构 * Rochester Institute of Technology(罗切斯特理工学院) U.S. Naval Research Laboratory(美国海军研究实验室) University of Missouri-Kansas City(密苏里大学-Kansas城分校) Adobe(Adobe公司) Meituan(美团) Sun Yat-sen University(孙中山大学) Purdue University(普渡大学) UC Davis(加州大学戴维斯分校) University of Rochester(罗切斯特大学) Rice University(莱斯大学) Meta AI

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07315 2025-09-10 cs.CR cs.SE 82%

SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs

Hongfei Xia, Hongru Wang, Zeming Liu, Qian Yu, Yuhang Guo, Haifeng Wang

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract)

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02357 2025-07-11 cs.LG cs.AI cs.CY 82%

Evaluating LLM Agent Adherence to Hierarchical Safety Principles: A Lightweight Benchmark for Probing Foundational Controllability Components

Ram Potham

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY、cs.LG

Comments Preprint. This work has been submitted to the Technical AI Governance Workshop at ICML 2025 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00854 2025-07-09 cs.CL cs.AI cs.LG cs.MM q-bio.NC 82%

EEG2TEXT-CN: An Exploratory Study of Open-Vocabulary Chinese Text-EEG Alignment via Large Language Model and Contrastive Learning on ChineseEEG

Jacky Tai-Yu Lu, Jung Chiang, Chi-Sheng Chen, Anna Nai-Yun Tung, Hsiang Wei Hu, Yuan Chiao Cheng

机构 * Department of Artificial Intelligence in Healthcare, International Academia of Biomedical Innovation Technology(人工智能医疗系,国际生物医学创新技术学院) National Taiwan University(台湾大学) Neuro Industry Research, Neuro Industry, Inc.(神经产业研究,神经产业公司) Department of Biomedical Engineering, University of Southern California(生物医学工程系,南加州大学) Taiwan Artificial Intelligence Association(台湾人工智能协会)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏