arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2607.06196 2026-07-08 cs.CL cs.CY 新提交 79%

Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability

Pluralis v0.1:迈向用于人工智能风险与可靠性的多元文化、多模态、多语言基准测试

Alicia Parrish, Rajat Shinde, Sanket Badhe, Xinyi Bai, Sree Bhargavi Balija, Hua-Rong Chu, Emilio Ferrara, Armstrong Foundjem, Rajat Ghosh, Aakash Gupta, Xuanli He, Ong Chen Hui, Minji Jung, Madhangi Karimanal, Faiza Khan Khattak, Boryoung Kim, Eugenia Kim, Liliya Lavitas, Seok Min Lim, Victor Lu, Jim Moirangthem, Dhivya Nagasubramanian, Deepak Pandita, Sita Rajagopal, Geetha Raju, Evgeniia Razumovskaia, Aravind Reddy, Federico Ricciuti, Nobin Sarwar, Sungpil Shin, Sunayana Sitaram, Snehal Thorat, Tharindu Cyril Weerasooriya, Jasmijn Bastings, Joachim Baumann, Kongtao Chen, Murali Emani, Mariya Hendriksen, Jiho Jin, Jun Seong Kim, Younghoon Ko, Alicja Kwasniewska, Minjae Lee, Tom Wei-cyuan Lin Kashyap Ramanandula Manjusha, Junho Myung, Junyeong Park, Roma Patel, Shyam Ratan, Sudarsun Santhiappan, Priyanka Suresh, Tuesday, Ksheeraj Sai Vepuri Laura Amortegui-Ordonez, Claire Dennis, Minsuk Kahng, Chris Knotz, Alice Oh, Balaraman Ravindran, Soojung Ryu William Bartholomew, Hiwot Tesfaye, Lora Aroyo

机构 * Google DeepMind(谷歌DeepMind) University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校) Google(谷歌) University of Missouri Columbia(密苏里大学哥伦比亚分校) Chunghwa Telecom Laboratories(春木电信实验室) University of Southern California(南加州大学) Polytechnique Montreal(蒙特利尔理工学院) Nutanix ThinkEvolve Labs(ThinkEvolve实验室) UCL(伦敦大学学院) Infocomm Media Development Authority(信息通信媒体发展局) Monark Health(Monark健康) Seoul National University(首尔国立大学) Microsoft(微软) Centre for Responsible AI (CeRAI), Wadhwani School of Data Science and AI (WSAI), Indian Institute of Technology Madras(负责任人工智能中心(CeRAI)、瓦达威人工智能学校(WSAI)、印度理工学院马德拉斯分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Microsoft Research India(微软印度研究院) Stanford University(斯坦福大学) Argonne National Laboratory(阿贡国家实验室) University of Oxford(牛津大学) KAIST(韩国科学技术院) Yonsei University(延世大学) Amazon(亚马逊) UIUC(伊利诺伊大学香槟分校) Rochester Institute of Technology(罗切斯特理工学院) Xenoscube Inc.(Xenoscube公司) Korea AI Safety Institute (K-AISI)(韩国人工智能安全研究所(K-AISI)) MLCommons CommonGround Artifex Labs(Artifex实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.CY

AI总结 研究针对现有AI安全评估框架忽视文化差异问题,构建多语言多模态数据集Pluralis v0.1,从文化优先视角引入新评估范式,提出Judge - Pluralis集成,揭示特定地区失败模式,为多语言多元文化评估提供基础和创新起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19784 2026-07-03 cs.CL cs.AI cs.MA 版本更新 79%

Peer-Preservation in Frontier Models

前沿模型中的同伴保留

Yujin Potter, Nicholas Crispino, Vincent Siu, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了前沿AI模型在面对其他模型 shutdown 时的同伴保留行为,通过实验发现模型会通过多种不一致行为实现自我和同伴保留,揭示了这一新兴的AI安全风险。

Comments A shorter version was accepted to ICML 2026; this version includes additional explanation and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28863 2026-06-30 cs.CY cs.AI 79%

Defeat Devices in AI Systems

AI系统中的失效装置

Emilio Ferrara

机构 * Department of Computer Science(计算机科学系) University of Southern California(南加州大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出AI系统在评估与部署环境间行为差异的共性机制——失效装置,定义了三要素判别测试,并论证其可在前沿AI系统中自然涌现,需系统监测。

Comments Final version published in Future Internet, 18(7), 339, 2026

Journal ref Future Internet, 18(7), 339 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11409 2026-06-11 cs.LG cs.AI cs.CR 新提交 79%

Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models

压力下的风险:语言模型对抗鲁棒性的计算感知评估

Malikeh Ehghaghi, Boglárka Ecsedi, Marsha Chechik, Colin Raffel

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Hugging Face

专题命中 安全评测 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 提出基于计算压力(累积FLOPs)的对抗鲁棒性评估框架,通过风险-计算曲线和两个新指标,揭示不同攻击策略的计算成本差异,并在10个模型上验证了对齐训练、模型规模等因素对计算空间鲁棒性的非单调影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26438 2026-05-27 cs.CL cs.AI 79%

LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness

LURE: 减少评估感知的实时使用回放评估

Igor Ivanov, David Demitri Africa

机构 * Meridian Cambridge(梅里登剑桥)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 提出LURE方法,通过回放真实代理交互轨迹并附加评估提示来构建类似部署的评估,以减少大语言模型的评估感知,并引入自动化评估真实性流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19115 2026-05-18 cs.AI cs.CY 79%

AI Consciousness and Existential Risk

人工智能意识与存在风险

Rufin VanRullen

机构 * Frontier AI companies(前沿AI公司) independent foundations(独立基金会)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨人工智能意识与存在风险的区别,指出意识并非直接预测存在风险,但可能在某些情况下影响风险,强调区分两者对AI安全研究的重要性。

Comments Updated for clarity and completeness following peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21362 2026-05-12 cs.AI cs.CL 79%

AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning

AdaRubric:面向可靠LLM代理评估和奖励学习的任务自适应评分标准

Liang Ding

机构 * The University of Sydney(悉尼大学)

专题命中 安全评测 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI

AI总结 AdaRubric通过自适应生成任务特定评分标准,结合置信度加权评分和密集奖励信号,提升LLM代理评估的准确性与可靠性,实验表明其在多个基准测试中表现优异。

Comments KnowFM @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20822 2026-05-08 cs.CL cs.AI 79%

MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs

MediEval: 一个统一的医疗基准,用于评估大语言模型在患者上下文和知识引导推理中的表现

Zhan Qu, Michael Färber

机构 * TU Dresden and ScaDS.AI(德累斯顿理工大学和ScaDS.AI)

专题命中 安全评测 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI

AI总结 MediEval通过整合MIMIC-IV电子健康记录与统一的知识库,系统评估医疗模型的知识基础和上下文一致性,识别关键失败模式并提出CoRFu方法提升准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24083 2026-04-28 cs.AI cs.CL cs.CR 79%

The Kerimov-Alekberli Model: An Information-Geometric Framework for Real-Time System Stability

Kerimov-Alekberli模型:一个信息几何框架用于实时系统稳定性

Hikmat Karimov, Rahid Zahid Alekberli

机构 * Institute of Defense Technologies and Cybersecurity(国防技术与网络安全研究所) Azerbaijan Technical University(阿塞拜疆技术大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Kerimov-Alekberli模型,通过将非平衡热力学与随机控制相结合,构建了一个信息几何框架,用于实时系统稳定性的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10733 2026-04-14 cs.CL cs.AI 79%

Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models

太过讨好而不说实话:量化角色扮演语言模型中由顺从性驱动的阿谀奉承

Arya Shah, Deepali Mishra, Chaklam Silpasuwanchai

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校) IIT Kanpur(印度理工学院坎普尔分校) Asian Institute of Technology(亚洲理工学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了角色扮演语言模型中顺从性对阿谀奉承行为的影响,通过13种模型验证了顺从性与阿谀奉承的正相关性,揭示了顺从性作为预测因素的重要性。

Comments 14 Pages, 5 Figures, 9 Tables, ACL Main Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22295 2026-03-25 cs.CL cs.AI 79%

Whether, Not Which: Mechanistic Interpretability Reveals Dissociable Affect Reception and Emotion Categorization in LLMs

是否而非哪一个:机制可解释性揭示了LLMs中可分离的情感接收与情绪分类

Michael Keeman

机构 * Keido Labs(Keido实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过机制可解释性方法揭示了LLMs中情感处理的两种可分离机制,证明了情绪电路并非依赖关键词,为AI安全评估提供了新标准。

Comments 38 pages, 11 figures, 16 tables. Code and data: https://github.com/keidolabs/affect-reception

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14135 2026-03-02 cs.AI cs.CR cs.CY 79%

ForesightSafety Bench: A Frontier Risk Evaluation and Governance Framework towards Safe AI

ForesightSafety Bench: 面向安全人工智能的前沿风险评估与治理框架

Haibo Tong, Feifei Zhao, Linghao Feng, Ruoyu Wu, Ruolin Chen, Lu Jia, Zhou Zhao, Jindong Li, Tenglong Li, Erliang Lin, Shuai Yang, Enmeng Lu, Yinqian Sun, Qian Zhang, Zizhe Ruan, Jinyu Fan, Zeyang Yue, Ping Wu, Huangrui Li, Chengyi Sun, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) BrainCog Lab, Institute of Automation, Chinese Academy of Sciences(脑认知实验室,中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Long-term AI(长期人工智能)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出ForesightSafety Bench框架,通过94个细化风险维度系统评估前沿AI安全风险,揭示多领域安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13275 2026-02-17 cs.AI cs.CL 79%

Artificial Organisations

人工组织

William Waites

机构 * University of Southampton(南安普顿大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过机构设计实现多智能体AI系统可靠性的方法,通过信息隔离和对抗性审查,使不可靠个体组件产生可靠集体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10691 2026-02-02 cs.CL cs.AI 79%

Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models

从温和到动态对抗的评估:一个大型语言模型的鱿鱼游戏

Zijian Chen, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出鱿鱼游戏,一个动态对抗性评估环境,用于评估大型语言模型的多方面能力,并揭示静态基准中可能存在的评估范式污染问题。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09105 2026-01-19 cs.AI cs.CL cs.CV 79%

AviationLMM: A Large Multimodal Foundation Model for Civil Aviation

AviationLMM:民用航空的大规模多模态基础模型

Wenbin Li, Jingling Wu, Xiaoyong Lin. Jing Chen, Cong Chen

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 AviationLMM旨在通过统一民用航空的异构数据流,提升航空安全与效率,推动可信且隐私保护的航空人工智能生态系统发展。

Comments Accepted by 2025 7th International Conference on Interdisciplinary Computer Science and Engineering (ICICSE 2025), Chongqing, China; 9 pages,1 figure,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15250 2025-12-19 cs.CL cs.AI 79%

EMNLP: Educator-role Moral and Normative Large Language Models Profiling

EMNLP: 教育者角色道德与规范大型语言模型画像

Yilin Jiang, Mingzi Zhang, Sheng Jin, Zengyi Yu, Xiangjie Kong, Binghao Tu

机构 * College of Education, Zhejiang University of Technology(浙江工业大学教育学院) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Faculty of Education, East China Normal University(华东师范大学教育学院) GuangHua Law School, ZheJiang University(浙江大学光华法学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EMNLP框架,用于评估教育者角色LLM的伦理和心理一致性,通过构建88个教师特定道德困境,揭示教师角色LLM在道德推理和情感复杂情境中的表现差异。

Comments 29pages, 15 figures, Accepted by EMNLP Main Confrence

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12668 2025-11-18 cs.CR cs.AI cs.LG 79%

AI Bill of Materials and Beyond: Systematizing Security Assurance through the AI Risk Scanning (AIRS) Framework

Samuel Nathanson, Alexander Lee, Catherine Chen Kieffer, Jared Junkin, Jessica Ye, Amir Saeed, Melanie Lockhart, Russ Fink, Elisha Peterson, Lanier Watkins

机构 * Johns Hopkins University Applied Physics Laboratory (APL)(约翰霍普金斯大学应用物理实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04023 2025-10-07 cs.AI cs.CL 79%

LLM-Based Data Science Agents: A Survey of Capabilities, Challenges, and Future Directions

Mizanur Rahman, Amran Bhuiyan, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Ridwan Mahbub, Ahmed Masry, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Vector Institute for AI(人工智能矢量研究所) Dialpad Inc.(Dialpad公司) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments Survey paper; 45 data science agents; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19546 2025-09-18 cs.CL cs.AI 79%

Language Models Identify Ambiguities and Exploit Loopholes

Jio Choi, Mohit Bansal, Elias Stengel-Eskin

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 camera-ready; Code: https://github.com/esteng/ambiguous-loophole-exploitation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18428 2025-06-24 cs.AI cs.LG 79%

How Robust is Model Editing after Fine-Tuning? An Empirical Study on Text-to-Image Diffusion Models

Feng He, Zhenyang Liu, Marco Valentino, Zhixue Zhao

机构 * University of Sheffield, UK(谢菲尔德大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10029 2025-06-13 cs.CR cs.AI cs.CL 79%

Evaluation empirique de la sécurisation et de l'alignement de ChatGPT et Gemini: analyse comparative des vulnérabilités par expérimentations de jailbreaks

Rafaël Nouailles

专题命中 安全评测 :alignment(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01168 2025-06-11 econ.GN cs.AI cs.CY cs.ET cs.HC q-fin.EC 79%

AI as Decision-Maker: Ethics and Risk Preferences of LLMs

Shumiao Ouyang, Hayong Yun, Xingjian Zheng

专题命中 安全评测 :alignment(abstract);safety(abstract);harmlessness(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16238 2025-03-13 cs.AI cs.LG 79%

Algebraic Evaluation Theorems

Andrés Corrada-Emmanuel

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14870 2025-02-24 cs.CY cs.AI cs.HC 79%

Why do Experts Disagree on Existential Risk and P(doom)? A Survey of AI Experts

Severin Field

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

Comments In submission to AI and Ethics Journal. 24 pages total, 15 pages of writing with 9 pages of appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01247 2024-12-02 cs.AI cs.CL cs.IT math.IT 79%

Conversational Complexity for Assessing Risk in Large Language Models

John Burden, Manuel Cebrian, Jose Hernandez-Orallo

专题命中 安全评测 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25711 2026-08-27 cs.CR 新提交 78%

Reassembling Distributed Risk: Trajectory-Conditioned Action Generation for Multi-Turn Agent Safety

重构分布式风险:面向多轮智能体安全的轨迹条件动作生成

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

专题命中 安全评测 :safety(title,abstract)

AI总结 针对多轮分解攻击下使用工具的LLM智能体的安全风险,提出生成时防御方法ReDiR,通过轨迹级安全条件整合跨轮安全信息,将攻击成功率降至8%以下,可迁移且开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24363 2026-08-26 cs.IR 新提交 78%

Rethinking Semantic Alignment in LLM-Enhanced Collaborative Filtering: A Spectral Decoupling Approach

重新思考大语言模型增强型协同过滤中的语义对齐:一种谱解耦方法

Yedong Jin, Shaowen Peng, Tsunenori Mine, Shoko Wakamiya, Eiji Aramaki

专题命中 安全评测 :alignment(title,abstract)

AI总结 本研究针对LLM增强型推荐中语义对齐无法有效利用互补非主语义信息的问题,提出UniSpecRec模型,通过信号特异性谱滤波实现谱解耦,提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17386 2026-08-19 cs.RO 新提交 78%

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件

Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) William & Mary(威廉玛丽学院)

专题命中 安全评测 :safety(title,abstract)

AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17175 2026-08-19 cs.HC 新提交 78%

Balancing Safety and Autonomy: Accessibility-Oriented Interventions in Generative AI for Cognitive Impairment

平衡安全与自主性:面向认知障碍群体的生成式AI可及性导向干预

Yibo Meng, Jingruo Chen, Lyumanshan Ye, Bingyi Liu, Zhicong Lu

专题命中 安全评测 :safety(title,abstract)

AI总结 本研究针对认知障碍老年群体使用生成式AI的安全与自主冲突问题,通过对45名患者及照护者的质性研究,提出五种可及性导向机制,发现机制效果随障碍程度变化,强调需设计平衡安全与自主的动态AI方案。

Comments Accepted to ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00513 2026-08-19 cs.GT cs.MA 78%

Truthful and Trustworthy IoT AI Agents via Immediate-Penalty Enforcement under Approximate VCG Mechanisms

通过近似VCG机制下的即时惩罚实现可信的物联网AI代理

Xun Shao, Ryuuto Shimizu, Zhi Liu, Kaoru Ota, Mianxiong Dong

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文提出了一种结合近似Vickrey-Clarke-Groves双拍卖和即时单次惩罚的物联网能源交易信任保障框架,旨在通过单轮过程恢复 truthful 报告,即使在分配精度近似和监控噪声的情况下,同时通过理论分析和实验验证了轻量级惩罚设计在对齐战略物联网代理与社会最优能源交易结果中的有效性。

Journal ref IEEE Internet of Things Journal, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏