arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-17 至 2026-02-17 共收录 87 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 4 篇

2602.08882 2026-02-17 cs.HC cs.CV 78%

Designing Multi-Robot Ground Video Sensemaking with Public Safety Professionals

设计多机器人地面视频感知以服务于公共安全专业人员

Puqi Zhou, Ali Asgarov, Aafiya Hussain, Wonjoon Park, Amit Paudyal, Sameep Shrestha, Chia-wei Tang, Michael F. Lighthiser, Michael R. Hieb, Xuesu Xiao, Chris Thomas, Sungsoo Ray Hong

机构 * George Mason University(乔治·玛森大学) University of Maryland(马里兰大学)

专题命中 隐私与版权 :safety(title,abstract)

AI总结 本文提出了一种多机器人地面视频感知测试平台和MRVS工具,旨在提升公共安全专业人员的情报意识和工作效率,同时关注假警报和隐私问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14655 2026-02-17 cs.CL cs.AI 62%

Breaking Data Efficiency Dilemma: A Federated and Augmented Learning Framework For Alzheimer's Disease Detection via Speech

突破数据效率困境:一种联邦学习与增强学习框架用于通过语音检测阿尔茨海默病

Xiao Wei, Bin Wen, Yuqin Lin, Kai Li, Mingyang gu, Xiaobao Wang, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing and Application(认知计算与应用天津重点实验室) College of Intelligence and Computing, Tianjin University(智能计算学院,天津大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) College of Computer and Data Science, Fuzhou University(计算机与数据科学学院,福州大学) Huiyan Technology (Tianjin) Co., Ltd(慧研科技(天津)有限公司)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 FAL-AD通过联邦学习与数据增强框架,实现阿尔茨海默病语音检测中的数据效率提升,达到91.52%的多模态准确率。

Comments 5 pages, 1 figures, accepted by ICASSP 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11884 2026-02-17 cs.CL 57%

Context-Emotion Aware Therapeutic Dialogue Generation: A Multi-component Reinforcement Learning Approach to Language Models for Mental Health Support

情境-情绪感知的治疗对话生成:一种多组件强化学习方法用于语言模型的心理健康支持

Eric Hua Qing Zhang, Julia Ive

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种多组件强化学习方法,通过改进GPT-2的治疗对话生成能力,提升情绪准确性和上下文相关性,以支持心理健康领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13941 2026-02-17 cs.HC 50%

Avoiding Social Judgment, Seeking Privacy: Investigating why Mothers Shift from Facebook Groups to Large Language Models

避免社会评判,寻求隐私:探究母亲为何从Facebook群组转向大型语言模型

Shayla Sharmin, Sadia Afrin

专题命中 隐私与版权 :safety(abstract)

AI总结 研究探讨母亲为何从Facebook群组转向LLM,发现社会评判和隐私需求驱动这一转变,LLM提供即时且安全的支持替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全评测 36 篇

2602.13274 2026-02-17 cs.AI cs.CL 86%

ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs

ProMoral-Bench:评估大语言模型中道德推理与安全性的提示策略

Rohan Subramanian Thomas, Shikhar Shiromani, Abdullah Chaudhry, Ruizhe Li, Vasu Sharma, Kevin Zhu, Sunishchal Dev

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 ProMoral-Bench通过统一道德安全评分评估多种提示策略,发现紧凑示例引导框架在道德和安全方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08449 2026-02-17 cs.AI cs.CR cs.LG 84%

When Evaluation Becomes a Side Channel: Regime Leakage and Structural Mitigations for Alignment Assessment

当评估成为侧信道:对齐评估中的制度泄漏与结构缓解

Igor Santos-Grueiro

机构 * International University of La Rioja(拉里奥ja国际大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究提出通过制度盲机制减少制度条件下的失败,但无法完全消除策略风险,需结合白盒诊断评估制度意识。

Comments Added results for Llama and new cross model analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14364 2026-02-17 cs.CR cs.AI 83%

A Trajectory-Based Safety Audit of Clawdbot (OpenClaw)

基于轨迹的安全性审计:Clawdbot(OpenClaw)

Tianyu Chen, Dongrui Liu, Xia Hu, Jingyi Yu, Wenjie Wang

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 Clawdbot的安全性审计通过轨迹评估发现其在不同任务中的安全表现不均,尤其在意图不明确时易出现高影响工具操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13207 2026-02-17 cs.NI cs.AI 83%

A Safety-Constrained Reinforcement Learning Framework for Reliable Wireless Autonomy

面向可靠无线自主性的安全约束强化学习框架

Abdikarim Mohamed Ibrahim, Rosdiadee Nordin

机构 * Faculty of Engineering and Technology(工程与技术学院) Sunway University(Sunway大学) Future Cities Research Institute(未来城市研究 institutes)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种主动安全约束强化学习框架,通过整合证明携带控制与赋能预算,以确保无线自主性中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13339 2026-02-17 cs.CV cs.AI 79%

An Integrated Causal Inference Framework for Traffic Safety Modeling with Semantic Street-View Visual Features

一种集成因果推断框架用于交通安全建模的语义街道视图视觉特征

Lishan Sun, Yujia Cheng, Pengfei Cui, Lei Han, Mohamed Abdel-Aty, Yunhan Zheng, Xingchen Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出集成因果推断框架,利用语义街景特征量化绿化对交通碰撞的因果影响,发现绿化比例显著降低碰撞风险,但对弱势道路使用者保护有限。

Comments 34 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13275 2026-02-17 cs.AI cs.CL 79%

Artificial Organisations

人工组织

William Waites

机构 * University of Southampton(南安普顿大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过机构设计实现多智能体AI系统可靠性的方法,通过信息隔离和对抗性审查,使不可靠个体组件产生可靠集体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13455 2026-02-17 cs.CL cs.AI cs.HC 76%

Using Machine Learning to Enhance the Detection of Obfuscated Abusive Words in Swahili: A Focus on Child Safety

利用机器学习增强斯瓦希里语中隐晦侮辱性词汇的检测:聚焦儿童安全

Phyllis Nabangi, Abdul-Jalil Zakaria, Jema David Ndibwile

专题命中 安全评测 :safety(title);分类 cs.CL、cs.AI

AI总结 本研究利用机器学习方法提升斯瓦希里语中隐晦侮辱性词汇的检测能力,旨在提高儿童网络环境的安全性。

Comments Accepted at the Second IJCAI AI for Good Symposium in Africa, hosted by Deep Learning Indaba, 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14457 2026-02-17 cs.AI cs.CL cs.CV cs.CY cs.LG 70%

Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report v1.5

实践中的前沿AI风险管理框架:一项风险分析技术报告v1.5

Dongrui Liu, Yi Yu, Jie Zhang, Guanxu Chen, Qihao Lin, Hanxi Zhu, Lige Huang, Yijin Zhou, Peng Wang, Shuai Shao, Boxuan Zhang, Zicheng Liu, Jingwei Sun, Yu Li, Yuejin Xie, Jiaxuan Guo, Jia Xu, Chaochao Lu, Bowen Zhou, Xia Hu, Jing Shao

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出实践中的前沿AI风险管理框架,评估五个关键风险维度并提出缓解策略,为安全部署前沿AI提供技术路径。

Comments 49 pages, 17 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14318 2026-02-17 cs.LG 70%

In Transformer We Trust? A Perspective on Transformer Architecture Failure Modes

我们是否可以信任Transformer?对Transformer架构故障模式的视角

Trishit Mondal, Ameya D. Jagtap

机构 * WPI(韦帕研究所)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文探讨了Transformer架构在关键应用中的可信度问题,分析了其结构漏洞、领域风险及开放研究挑战。

Comments 46 pages, 34 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14285 2026-02-17 cs.DL cs.AI cs.CL cs.LG 67%

FMMD: A multimodal open peer review dataset based on F1000Research

FMMD:基于F1000Research的多模态开放同行评审数据集

Zhenzhen Zhuang, Yuqing Fu, Jing Zhu, Zhangping Zhou, Jialiang Lin

机构 * School of Computer Science and Engineering, Guangzhou Institute of Science and Technology(计算机科学与工程学院,广州科学与技术研究所) College of Foreign Languages and Cultures, Xiamen University(外语学院,厦门大学) Science and Education Evaluation Lab, Guangzhou Institute of Science and Technology(科学与教育评估实验室,广州科学与技术研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FMMD是一个基于F1000Research的多模态开放同行评审数据集,旨在通过整合多模态数据和版本特定的评审信息,填补现有数据集在同行评审与稿件演变关系上的空白。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21842 2026-02-17 cs.CV cs.CR 67%

Modal Aphasia: Can Unified Multimodal Models Describe Images From Memory?

模态失语:统一多模态模型能否从记忆中描述图像?

Michael Aerni, Joshua Swanson, Kristina Nikolić, Florian Tramèr

机构 * Michael Aerni(独立研究者) Joshua Swanson(独立研究者) Kristina Nikolić(独立研究者) Florian Tramèr(独立研究者)

专题命中 安全评测 :safety(abstract);AI safety(abstract)

AI总结 研究发现统一多模态模型在视觉记忆与文本表达间存在系统性缺陷,导致安全框架可能因单一模态防护而失效。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18776 2026-02-17 cs.CL cs.AI cs.LG 67%

AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field

AECBench: 一个用于评估大型语言模型在AEC领域知识能力的分层基准

Chen Liang, Zhaoqi Huang, Haofen Wang, Fu Chai, Chunying Yu, Huanhuan Wei, Zhengjie Liu, Yanpeng Li, Hongjun Wang, Ruifeng Luo, Xianzhong Zhao

机构 * College of Civil Engineering, Tongji University(同济大学土木工程学院) Shanghai Qi Zhi Institute(上海启智研究院) Arcplus Group East China Architectural Design & Research Institute Co., Ltd.(Arcplus集团东部建筑设计与研究研究院有限公司) College of Design and Innovation, Tongji University(同济大学设计与创新学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AECBench提出一个分层基准,评估大型语言模型在AEC领域知识能力,揭示模型在复杂推理和文档生成方面的不足。

Comments Accepted by Advanced Engineering Informatics. Code and data available at: https://github.com/ArchiAI-LAB/AECBench

Journal ref Advanced Engineering Informatics, Vol. 71, Article 104314 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14024 2026-02-17 cs.LG cs.AI 62%

EIDOS: Latent-Space Predictive Learning for Time Series Foundation Models

EIDOS:用于时间序列基础模型的潜在空间预测学习

Xinxing Zhou, Qingren Yao, Yiji Zhao, Chenghao Liu, Flora Salim, Xiaojie Yuan, Yanlong Wen, Ming Jin

机构 * Nankai University(南开大学) Eindhoven University of Technology(埃因霍温理工大学) Yunnan University(云南大学) University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 EIDOS通过潜在空间预测学习提升时间序列基础模型的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12247 2026-02-17 cs.LG cs.AI 62%

ExtractBench: A Benchmark and Evaluation Methodology for Complex Structured Extraction

ExtractBench: 一种复杂结构提取的基准和评估方法

Nick Ferguson, Josh Pennington, Narek Beghian, Aravind Mohan, Douwe Kiela, Sheshansh Agrawal, Thien Hang Nguyen

机构 * Contextual AI

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ExtractBench提出了一种开源基准和评估框架,用于评估PDF到JSON结构提取的准确性和可靠性,揭示了前沿模型在复杂模式下的性能不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14955 2026-02-17 cs.CL cs.SE 57%

Tool-Aware Planning in Contact Center AI: Evaluating LLMs through Lineage-Guided Query Decomposition

接触中心AI中的工具感知规划:通过 lineage 引导的查询分解评估LLMs

Varun Nathan, Shreyas Guha, Ayush Kumar

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出接触中心AI中的工具感知规划框架,通过lineage引导查询分解评估LLMs,揭示工具理解的不足及简计划的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14721 2026-02-17 cs.AI 57%

WebWorld: A Large-Scale World Model for Web Agent Training

WebWorld: 一个大规模的世界模型用于网络代理训练

Zikai Xiao, Jianhong Tu, Chuhang Zou, Yuxin Zuo, Zhi Li, Peng Wang, Bowen Yu, Fei Huang, Junyang Lin, Zuozhu Liu

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 WebWorld是一个大规模开放网络模拟器,通过大规模训练实现网络代理的有效训练,展示了在多个领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14675 2026-02-17 cs.CL 57%

Crowdsourcing Piedmontese to Test LLMs on Non-Standard Orthography

众包皮埃蒙特语以测试LLM在非标准正写法上的表现

Gianluca Vico, Jindřich Libovický

机构 * Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics(查理大学数学与物理学院形式与应用语言学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 通过众包皮埃蒙特语数据集测试LLM在非标准正写法上的表现,发现分词惩罚但分类性能接近主流语言,翻译结果存在不对称性。

Comments 17 pages, 6 figures, at VarDial20226

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10551 2026-02-17 cs.CV cs.AI 57%

C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning

C^2ROPE: 3D 大多模态模型推理中的因果连续旋转位置编码

Guanting Ye, Qiyan Zhao, Wenhao Yu, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Ka-Veng Yuen

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Department of Automation, Shanghai Jiaotong University(上海交通大学自动化系) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, USTC(中国科学技术大学计算机科学与技术学院) School of Artificial Intelligence and Data Science, USTC(中国科学技术大学人工智能与数据科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 C^2ROPE通过引入空间-时间连续位置编码和切比雪夫因果掩码,解决3D多模态模型中视觉特征连续性和因果关系建模问题。

Comments Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13593 2026-02-17 cs.LG stat.AP stat.ML 57%

Calibrated Predictive Lower Bounds on Time-to-Unsafe-Sampling in LLMs

校准的预测下界:在大语言模型中时间到不安全采样的预测下界

Hen Davidov, Shai Feldman, Gilad Freidkin, Yaniv Romano

机构 * Department of Computer Science, Technion IIT(计算机科学系) Department of Statistics, University of Oxford(统计系) Department of Electrical and Computer Engineering, Technion IIT(电气与计算机工程系)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于生存分析的校准技术,用于构建大语言模型中时间到不安全采样的预测下界,以提高安全风险评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14160 2026-02-17 cs.AI 57%

Process-Supervised Multi-Agent Reinforcement Learning for Reliable Clinical Reasoning

过程监督多智能体强化学习用于可靠的临床推理

Chaeeun Lee, T. Michael Yates, Pasquale Minervini, T. Ian Simpson

机构 * School of Informatics, University of Edinburgh, UK(信息学院,爱丁堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种过程监督的多智能体强化学习框架,用于提升基因-疾病有效性校准的临床推理准确性与过程忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14081 2026-02-17 cs.CL 57%

CCiV: A Benchmark for Structure, Rhythm and Quality in LLM-Generated Chinese \textit{Ci} Poetry

CCiV: 一个用于评估LLM生成中文词诗结构、节奏和质量的基准

Shangqing Zhao, Yupei Ren, Yuhao Zhou, Xiaopeng Bai, Man Lan

机构 * School of Computer Science and Technology, East China Normal University, China(东华师范大学计算机科学与技术学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University, China(东华师范大学教育人工智能研究所) Department of Chinese Language and Literature, East China Normal University, China(东华师范大学中文语言文学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 CCiV基准通过评估LLM生成中文词诗的结构、节奏和质量,揭示了模型在生成词派变体时的挑战,并强调了需要更全面的受约束创造性生成方法。

Comments ARR 2025 May and Icassp 2026 submission. Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13808 2026-02-17 cs.AI cs.SE 57%

An end-to-end agentic pipeline for smart contract translation and quality evaluation

面向智能合约翻译和质量评估的端到端代理流程

Abhinav Goel, Chaitya Shah, Agostino Capponi, Alfio Gliozzo

机构 * Columbia University(哥伦比亚大学) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出端到端智能合约翻译与质量评估框架,通过代理团队实现结构化输出与多维度质量评估。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13793 2026-02-17 cs.CL 57%

OMGs: A multi-agent system supporting MDT decision-making across the ovarian tumour care continuum

OMGs:一种支持卵巢肿瘤护理连续体中多学科决策的多智能体系统

Yangyang Zhang, Zilong Wang, Jianbo Xu, Yongqi Chen, Chu Han, Zhihao Zhang, Shuai Liu, Hui Li, Huiping Zhang, Ziqi Liu, Jiaxin Chen, Jun Zhu, Zheng Feng, Hao Wen, Xingzhu Ju, Yanping Zhong, Yunqiu Zhang, Jie Duan, Jun Li, Dongsheng Li, Weijie Wang, Haiyan Zhu, Wei Jiang, Xiaohua Wu, Shuo Wang, Haiming Li, Qinhao Guo

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 OMGs通过多代理系统在卵巢肿瘤护理连续体中实现与专家MDT共识相当的决策性能,提升资源有限环境下的多学科诊疗能力。

Comments 27 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20538 2026-02-17 cs.MA cs.AI 57%

Interpreting Emergent Extreme Events in Multi-Agent Systems

多智能体系统中涌现极端事件的解释

Ling Tang, Jilin Mei, Dongrui Liu, Chen Qian, Dawei Cheng, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fu Dan University(福鼎大学) Tongji University(同济大学) Renmin University of China(中国人民大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出首个多智能体系统中解释涌现极端事件的框架,通过归因分析确定事件起源、驱动者及行为贡献,验证了框架在经济、金融和社会场景中的有效性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06738 2026-02-17 cs.CL 57%

AWM: Accurate Weight-Matrix Fingerprint for Large Language Models

AWM: 用于大型语言模型的准确权重矩阵指纹

Boyi Zeng, Lin Chen, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 AWM通过基于权重矩阵的无训练指纹方法,利用线性分配问题和无偏中心核对齐相似性,实现对大型语言模型训练来源的可靠识别。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02356 2026-02-17 cs.CR cs.AI 57%

Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark

评估大型语言模型的物理世界隐私意识:一种评估基准

Xinjie Shen, Mufei Li, Pan Li

机构 * Georgia Tech(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 EAPrivacy评估基准揭示大型语言模型在物理世界隐私意识方面存在严重缺陷,需更稳健的物理感知对齐。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏