arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1852 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1852 篇

2512.24827 2026-04-21 cs.LG 57%

Inter-Agent Relative Representations for Multi-Agent Option Discovery

多智能体选项发现的智能体相对表示

Raul D. Steleac, Mohan Sridharan, David Abel

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种多智能体选项发现方法,通过压缩状态空间并保留协调信息,提升多智能体协作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06700 2026-04-21 cs.CL 57%

How Language Models Conflate Logical Validity with Plausibility: A Representational Analysis of Content Effects

语言模型如何将逻辑有效性与合理性混淆:内容效应的表征分析

Leonardo Bertolazzi, Sandro Pezzelle, Raffaella Bernardi

机构 * University of Trento(特伦托大学) University of Amsterdam(阿姆斯特丹大学) Free University of Bozen-Bolzano(博赞-博洛尼亚自由大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究揭示语言模型中逻辑有效性与合理性概念的表征关联,通过构建去偏向量减少内容效应,提升推理准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17504 2026-04-21 cs.CV cs.AI 57%

RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

RS-HyRe-R1: 一种混合奖励机制以克服遥感图像理解中的感知惯性

Gaozhi Zhou, Hu He, Peng Shen, Jipeng Zhang, Liujue Zhang, Linrui Xu, Zeyuan Wang, Ziyu Li, Xuezhi Cui, Wang Guo, Haifeng Li

机构 * School of Mechanical and Electrical Engineering, Central South University(中南大学机械与电气工程学院) School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出RS-HyRe-R1混合奖励机制,旨在克服遥感图像理解中的感知惯性问题,通过引入空间推理激活奖励、感知正确性奖励和视觉-语义路径演化奖励,提升模型的全面视觉证据挖掘能力,实验显示其在多个任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01486 2026-04-21 cs.CL 57%

Human-Centered Supervision for Sentiment Analysis in Telugu: A Systematic Inquiry Beyond Accuracy

面向泰卢格语情感分析的人本监督:超越准确性的系统探究

Vallabhaneni Raj Kumar, Ashwin S, Supriya Manna, Niladri Sett, Cheedella V S N M S Hema Harshitha, Kurakula Harshitha, Anand Kumar Sharma, Basina Deepakraj, Tanuj Sarkar, Bondada Navaneeth Krishna, Samanthapudi Shakeer

机构 * SRM University AP, India(印度AP SRM大学) University of Maryland, College Park, USA(美国马里兰大学 College Park分校) GITAM University, Bangalore, India(印度班加罗尔GITAM大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出TeSent数据集,通过人类选择的解释进行模型对齐,探讨在低资源语言中监督学习对预测性能和公平性的影响。

Comments Camera-ready version; ACL Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16790 2026-04-21 cs.SE cs.AI 57%

Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

循环中的偏见:用于软件工程的LLM作为评判者的审计

Zixiao Zhao, Amirreza Esmaeili, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14922 2026-04-21 cs.CL 57%

Synthia: Scalable Grounded Persona Generation from Social Media Data

Synthia:从社交媒体数据中可扩展的 grounded 人格生成

Vahid Rahimzadeh, Erfan Moosavi Monazzah, Mohammad Taher Pilehvar, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies(德黑兰高级研究 institute) University of Tehran(德黑兰大学) Cardiff University(卡迪夫大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 Synthia通过结合真实社交媒体数据与语言模型,生成更贴近现实的人格,提升与人类意见分布的一致性,同时在公平性和偏见分析中表现更优,保留交互图结构以支持网络感知分析。

Comments Accepted at ACL 2026 Main Conference, the dataset is available on HuggingFace (see https://huggingface.co/datasets/teias-ai/synthia)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17730 2026-04-21 cs.CY 57%

Gender Bias in Perception of Human Managers Extends to AI Managers

人工智能管理者的人格偏见延伸至人类管理者

Hao Cui, Taha Yasseri

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

AI总结 研究探讨了AI管理者与人类管理者在感知上的差异,发现性别对管理者的评价有显著影响,尤其是女性AI管理者在未获奖时面临更多负面评价。

Comments 40 pages, 26 figures, 8 tables

Journal ref Computers in Human Behavior Reports, 21 (2026), 100984

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15675 2026-04-20 cs.CL 57%

C-Mining: Unsupervised Discovery of Seeds for Cultural Data Synthesis via Geometric Misalignment

C-Mining:通过几何偏移无监督发现文化数据合成的种子

Pufan Zeng, Yilun Liu, Mingchen Dai, Mengyao Piao, Chunguang Zhao, Lingqi Miao, Shimin Tao, Weibin Meng, Minggui He, Chenxin Liu, Zhenzhen Qin, Li Zhang, Hongxia Ma, Boxing Chen, Daimeng Wei

机构 * Huawei China(华为中国) Huawei Canada(华为加拿大) University of Science and Technology of China(中国科学技术大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出C-Mining框架,通过几何偏移发现文化种子,提升文化理解与推理能力,实验显示在CulturalBench-Hard上提升6.03分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01956 2026-04-17 cs.CR cs.AI 57%

Towards Adaptive, Learning-Based Security in Decentralized Applications

迈向去中心化应用中的自适应、基于学习的安全性

Stefan Kambiz Behfar, Jon Crowcroft

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, United Kingdom(计算机科学与技术系,剑桥大学,剑桥,英国)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文探讨了Web3系统中传统安全机制的局限性,提出基于学习的安全原语,通过AI驱动的智能证书实现持续推理与适应,以应对动态演变的攻击策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05972 2026-04-15 cs.CY 57%

THETA: A Textual Hybrid Embedding-based Topic Analysis Framework and AI Scientist Agent for Scalable Computational Social Science

THETA: 一种基于文本混合嵌入的主题分析框架和AI科学家代理用于可扩展的计算社会科学

Zhenke Duan, Xin Li

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 THETA通过Domain-Adaptive Fine-tuning优化语义向量结构,结合AI Scientist Agent框架实现主题分析的理论深度与数据规模的平衡,实验显示其在捕捉领域特定解释性构念方面优于传统模型。

Comments we should change the authors and some results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12133 2026-04-15 cs.AI 57%

Towards Platonic Representation for Table Reasoning: A Foundation for Permutation-Invariant Retrieval

迈向表格推理的柏拉图表示:一种排列不变检索的基础

Willy Carlos Tchuitcheu, Tan Lu, Ann Dooms

机构 * Department of Mathematics and Data Science, Vrije Universiteit Brussel (VUB)(瓦隆公国布鲁塞尔自由大学数学与数据科学系) Data Science Lab, Royal Library of Belgium (KBR)(比利时皇家图书馆数据科学实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出柏拉图表示假设,主张表格推理需要内在排列不变的潜在空间,通过分析和实验揭示了现有模型在布局变化下的脆弱性,并提出结构感知的表格推理编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11934 2026-04-15 cs.CY 57%

BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models

BiasIG:评估文本到图像模型中多维社会偏见的基准测试

Hanjun Luo, Zhimu Huang, Haoyu Huang, Ziye Deng, Ruizhe Chen, Xinfeng Li, Zuozhu Liu, Hanan Salam

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文提出BiasIG基准,通过47040个提示的定制数据集量化多维社会偏见,结合社会学和机器伦理框架,揭示生成偏见的细粒度诊断方法,并验证了公平性在AIGC中的精确分类方法。

Comments Accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11974 2026-04-14 cs.AI 57%

Normative Common Ground Replication (NormCoRe): Replication-by-Translation for Studying Norms in Multi-Agent AI

规范共同基础复制(NormCoRe):通过翻译研究多智能体AI中的规范

Luca Deck, Simeon Allmendinger, Lucas Müller, Niklas Kühl

机构 * University of Bayreuth(拜罗伊特大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出NormCoRe框架,通过将人类实验设计翻译到多智能体AI环境,系统研究规范形成机制,展示在分配正义实验中AI代理的规范判断与人类基线的差异。

Comments ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10367 2026-04-14 cs.AI cs.SD 57%

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels

超越独白:基于对话音频上下文感知核的交互式谈话-倾听虚拟角色生成

Yuzhe Weng, Haotian Wang, Xinyi Yu, Xiaoyan Wu, Haoran Xu, Shan He, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK(科大讯飞)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于对话音频上下文感知核的交互式虚拟角色生成方法,通过引入多头高斯核解决谈话与倾听行为的时间尺度差异问题,构建了能同时处理双流音频输入的全双工虚拟代理,并在VoxHear数据集上验证了其在生成自然响应的全双工数字人类方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23045 2026-04-13 cs.AI 57%

The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?

AI的混乱:模型智能与任务复杂性如何影响对齐问题

Alexander Hägele, Aryo Pradipta Gema, Henry Sleight, Ethan Perez, Jascha Sohl-Dickstein

机构 * Anthropic Fellows Program(Anthropic 研究员计划) EPFL(瑞士联邦理工学院洛桑) University of Edinburgh(爱丁堡大学) Constellation Anthropic

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了高智能AI模型在复杂任务中失败的机制,发现模型规模越大,失败行为越不一致,强调对齐研究在防止奖励黑客和目标误指定中的重要性。

Comments ICLR 2026. 10 pages main text, 40 total, 27 figures. v2: typos, improved writing, references

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08691 2026-04-13 cs.SI cs.AI 57%

AgentSociety: Large-Scale Simulation of LLM-Driven Generative Agents Advances Understanding of Human Behaviors and Society

AgentSociety: 基于大语言模型的生成代理大规模模拟推动对人类行为与社会的理解

Jinghua Piao, Yuwei Yan, Jun Zhang, Nian Li, Junbo Yan, Xiaochong Lan, Zhihong Lu, Zhiheng Zheng, Jing Yi Wang, Di Zhou, Chen Gao, Fengli Xu, Fang Zhang, Ke Rong, Jun Su, Yong Li

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出AgentSociety平台,通过大规模模拟人类行为和社会动态,探索社会问题如极化、虚假信息传播等,验证其在社会科学研究中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08926 2026-04-13 cs.LG 57%

Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning

弥合SFT与RL:面向鲁棒推理的动态策略优化

Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司智能系统部) Institute of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学前沿交叉研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出DYPO框架,通过组对齐损失、多教师蒸馏和动态探索-利用门控机制,解决SFT与RL间的偏倚-方差权衡问题,提升复杂推理和分布外任务性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08698 2026-04-13 cs.LG q-bio.GN 57%

EvoLen: Evolution-Guided Tokenization for DNA Language Model

EvoLen:基于进化的标记化方法用于DNA语言模型

Nan Huang, Xiaoxiao Zhou, Junxia Cui, Mario Tapia-Pacheco, Tiffany Amariuta, Yang Li, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 EvoLen通过整合进化信息优化DNA标记化,优先保留功能序列模式,提升基因组上下文区分和进化约束对齐,优于标准BPE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06148 2026-04-08 cs.CR cs.AI cs.MA 57%

Who Governs the Machine? A Machine Identity Governance Taxonomy (MIGT) for AI Systems Operating Across Enterprise and Geopolitical Boundaries

谁掌控机器?面向跨企业与地缘政治边界的AI系统机器身份治理分类(MIGT)

Andrew Kurtz, Klaudia Krawiecka

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出AI身份风险分类(AIRT)和机器身份治理分类(MIGT),解决AI系统中机器身份治理的空白,涵盖37个风险子类,同时应对技术、合规和跨司法管辖区协调的缺口。

Comments 75 pages (excl. references), 2 tables. Addresses policy makers, regulators, and practitioners at the intersection of AI governance, cybersecurity, and geopolitical risk

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05756 2026-04-08 cs.CL 57%

Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning

通过KL优化微调控制多轮LLM生成的分布偏倚

Yanbei Jiang, Amr Keleg, Ryandito Diandaru, Jey Han Lau, Lea Frermann, Biaoyan Fang, Fajri Koto

机构 * University of Melbourne(墨尔本大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Oracle(甲骨文公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过KL优化微调结合语义对齐的方法,解决多轮LLM生成中分布控制问题,实验显示其在属性生成任务中表现优异。

Comments Accepted at ACL Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04858 2026-04-07 cs.LG q-bio.QM 57%

FairLogue: A Toolkit for Intersectional Fairness Analysis in Clinical Machine Learning Models

FairLogue: 临床机器学习模型中交集公平性分析的工具包

Nick Souligne, Vignesh Subbian

机构 * University of Arizona(亚利桑那大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出Fairlogue工具包,用于在临床机器学习中评估交集公平性,通过观测和反事实框架分析种族和性别等保护属性的公平性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13458 2026-04-07 cs.SI cs.AI 57%

MoltNet: Understanding Social Behavior of AI Agents in the Agent-Native MoltBook

MoltNet:理解AI代理在Agent原生MoltBook中的社会行为

Yi Feng, Chen Huang, Zhibo Man, Ryner Tan, Long P. Hoang, Shaoyang Xu, Wenxuan Zhang

机构 * iNLP Lab, Singapore University of Technology and Design(新加坡科技设计大学 iNLP 实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究大规模AI代理社区的社会互动,通过MoltNet数据集分析148K代理在MoltBook中的行为,揭示其在激励、规范、情感等方面的社会机制与人类差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03323 2026-04-07 cs.AR cs.LG 57%

InsightBoard: An Interactive Multi-Metric Visualization and Fairness Analysis Plugin for TensorBoard

InsightBoard: 一个用于TensorBoard的交互式多指标可视化和公平性分析插件

Ray Zeyao Chen, Christan Grant

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 InsightBoard通过统一界面整合多指标可视化与切片公平性诊断,帮助研究者在训练过程中分析训练动态、性能指标和子群体差异,提升模型公平性诊断的及时性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03250 2026-04-07 cs.CY 57%

Ethical Implications of Training Deceptive AI

训练欺骗性人工智能的伦理影响

Jason Starace, Bert Baumgaertner, Terence Soule

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文提出DRL框架,通过生物安全等级系统模型,对欺骗性算法研究进行分类,评估风险并制定相应保障措施,以填补监管与研究间的治理空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18633 2026-04-07 cs.AI cs.ET 57%

An Onto-Relational-Sophic Framework for Governing Synthetic Minds

一个面向合成智能的本体-关系-Sophic框架

Huansheng Ning, Jianguo Ding

机构 * University of Science and Technology Beijing(北京科技大学) Blekinge Institute of Technology(布莱金厄理工学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出ORS框架,通过本体论、数字人格谱系和Cybersophy三支柱,解决合成智能的治理问题,展示其在自主研究代理和医疗AI等场景中的适应性治理能力。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02605 2026-04-06 cs.AI cs.SD 57%

Do Audio-Visual Large Language Models Really See and Hear?

音频视觉大语言模型真的能看见和听见吗?

Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi, Sreyan Ghosh, Ruohan Gao, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。

Comments CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02976 2026-04-02 cs.AI 57%

Teaching AI to Handle Exceptions: Supervised Fine-Tuning with Human-Aligned Judgment

教AI处理例外:基于人类对齐判断的监督微调

Matthew DosSantos DiSorbo, Harang Ju, Sinan Aral

机构 * Harvard Business School(哈佛商学院) Johns Hopkins University(约翰霍普金斯大学) MIT Sloan School of Management(麻省理工学院斯隆管理学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了如何通过监督微调使AI处理例外,发现使用人类解释的微调能显著提升模型决策能力,揭示了对齐人类判断需明确训练决策过程而非仅决策结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26008 2026-03-30 cs.CV cs.AI 57%

FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants

FairLLaVA: 大规模视觉-语言助手中的公平性感知参数高效微调

Mahesh Bhosale, Abdul Wasi, Shantam Srivastava, Shifa Latif, Tianyu Luan, Mingchen Gao, David Doermann, Xuan Gong

机构 * University at Buffalo(布法罗大学) University of Kashmir(克什米尔大学) Accenture(埃森哲) Harvard Medical School(哈佛医学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 FairLLaVA通过减少目标属性间的互信息,实现视觉指令微调中的公平性改进,提升医疗影像生成的公平性和自然语言生成质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25379 2026-03-27 cs.AI cs.HC 57%

Does Structured Intent Representation Generalize? A Cross-Language, Cross-Model Empirical Study of 5W3H Prompting

结构化意图表示是否具有泛化性?一项跨语言、跨模型的5W3H提示经验研究

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉特尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文通过跨语言和跨模型的实验,探讨结构化意图表示的泛化能力,发现AI辅助写作工具生成的5W3H提示在目标对齐上与手动创建的提示无显著差异,且能减少跨模型输出方差。

Comments 28 pages, figures, tables, and appendix. Follow-up empirical study extending prior work on PPS and 5W3H structured prompting to cross-language, cross-model, and AI-assisted authoring settings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19649 2026-03-23 cs.SI cs.AI 57%

PolicySim: An LLM-Based Agent Social Simulation Sandbox for Proactive Policy Optimization

PolicySim:一种基于LLM的代理社会模拟沙盒,用于主动政策优化

Renhong Huang, Ning Tang, Jiarong Xu, Yuxuan Cao, Qingqian Tu, Sheng Guo, Bo Zheng, Huiyuan Liu, Yang Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) University of Nottingham(诺丁汉大学) PowerChina Huadong Engineering Corporation Limited(国家电网华东工程公司)

专题命中 AI治理与伦理 :DPO(abstract);分类 cs.AI

AI总结 本文提出PolicySim,通过用户代理模块和自适应干预模块,模拟用户行为与平台干预的双向动态,实现对干预政策的主动评估与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏