arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1847 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1847 篇

2509.20057 2026-03-23 cs.CL cs.AI 62%

Responsible AI Technical Report

负责任的人工智能技术报告

KT, :, Yunjin Park, Jungwon Yoon, Junhyung Moon, Myunggyo Oh, Wonhyuk Lee, Sujin Kim, Youngchol Kim, Eunmi Kim, Hyoungjun Park, Eunyoung Shin, Wonyoung Lee, Somin Lee, Minwook Ju, Minsung Noh, Dongyoung Jeong, Jeongyeop Kim, Wanjin Park, Soonmin Bae

机构 * Responsible AI Center(负责任AI中心) Tech. Innovation Group(技术创新组)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种负责任的人工智能评估方法和风险缓解技术,用于确保AI服务的安全性和可靠性,并提供实用工具来管理和缓解AI风险。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16749 2026-03-20 cs.CL cs.LG 62%

Probing Cultural Signals in Large Language Models through Author Profiling

通过作者画像探测大语言模型中的文化信号

Valentin Lafargue, Ariel Guerra-Adames, Emmanuelle Claeys, Elouan Vuichard, Jean-Michel Loubes

机构 * IMT, Toulouse, France(法国图卢兹IMT学院) INRIA Bordeaux, France(法国波尔多INRIA) ANITI 2, Toulouse, France(法国图卢兹ANITI) IRIT, Toulouse, France(法国图卢兹IRIT) Université de Bordeaux, Bordeaux, France(法国波尔多大学) BPH, Inserm, France(法国Inserm BPH) CNRS IRL CROSSING, Adelaide, Australia(澳大利亚阿德莱德CNRS IRL CROSSING)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究通过零样本设置评估大语言模型能否从歌曲歌词中推断歌手性别和种族,发现模型存在系统性文化偏见,提出两种公平性指标量化差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16746 2026-03-20 cs.CY cs.AI 62%

Beyond Partisan Leaning: A Comparative Analysis of Political Bias in Large Language Models

超越党派倾向:对大型语言模型中政治偏见的比较分析

Tai-Quan Peng, Kaiqi Yang, Sanguk Lee, Hang Li, Yucheng Chu, Yuping Lin, Hui Liu

机构 * Michigan State University(密歇根州立大学) Texas Christian University(德克萨斯基督教大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过无角色扮演的专题特定方法评估LLM的政治行为,发现大多数模型倾向左翼,且模型规模和开放性不是主要预测因素。

Journal ref Journal of Information Technology & Politics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16938 2026-03-19 cs.CR cs.AI cs.CY 62%

Cryptographic Runtime Governance for Autonomous AI Systems: The Aegis Architecture for Verifiable Policy Enforcement

面向自主AI系统的加密运行时治理:Aegis架构用于可验证的政策执行

Adam Massimo Mazzocchetti

机构 * SPQR Technologies Inc.(SPQR技术公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出Aegis架构,通过加密技术将政策约束作为执行条件,实现自主AI系统的可验证政策执行,通过实验验证其在运行时治理中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16926 2026-03-18 cs.CY cs.AI cs.HC 62%

Nishpaksh: TEC Standard-Compliant Framework for Fairness Auditing and Certification of AI Models

Nishpaksh:符合TEC标准的AI模型公平性审计与认证框架

Shashank Prakash, Ranjitha Prasad, Avinash Agarwal

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出Nishpaksh,一个符合TEC标准的AI模型公平性审计与认证工具,通过整合风险量化、上下文阈值确定和定量公平性评估,提供可复现的审计级评估,验证了其在COMPAS数据集上识别属性偏见和生成标准化公平评分的能力。

Comments Accepted and presented at 2026 18th International Conference on COMmunication Systems and NETworks (COMSNETS)

Journal ref 2026 18th International Conference on COMmunication Systems and NETworks (COMSNETS), Bengaluru, India, 2026, pp. 877-882

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14625 2026-03-17 cs.MA cs.AI cs.LG cs.SY eess.SY 62%

EcoFair-CH-MARL: Scalable Constrained Hierarchical Multi-Agent RL with Real-Time Emission Budgets and Fairness Guarantees

EcoFair-CH-MARL:具有实时排放预算和公平性保证的可扩展约束层次多智能体强化学习

Saad Alqithami

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EcoFair-CH-MARL框架,通过引入双重预算层、公平性奖励转换器和两级策略架构,实现高效、可持续且公平的海运物流解决方案,实验显示其在排放、吞吐量和公平性方面优于现有方法。

Comments Conference: The 28th European Conference on Artificial Intelligence (ECAI)

Journal ref Frontiers in Artificial Intelligence and Applications, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16624 2026-03-16 cs.CY cs.AI 62%

The GPT-4o Shock Emotional Attachment to AI Models and Its Impact on Regulatory Acceptance: A Cross-Cultural Analysis of the Immediate Transition from GPT-4o to GPT-5

GPT-4o震惊的对AI模型的情感依附及其对监管接受度的影响:对从GPT-4o到GPT-5即时过渡的跨文化分析

Hiroki Naito

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了GPT-4o到GPT-5的即时过渡引发的情感依附与监管接受度的跨文化影响,发现日文内容更侧重于损失叙事,英文内容包含更多愤怒与批判,且日文内容的情感依附显著更高。

Comments 9 pages ,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03998 2026-03-13 cs.HC cs.AI cs.CY 62%

TRACE: AI-Assisted Assessment of Collaborative Projects in Computer Science Education

TRACE:计算机科学教育中协作项目的AI辅助评估

Songmei Yu, Andrew Zagula

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 TRACE通过AI辅助分析提升计算机科学教育中协作项目评估的透明度和可扩展性。

Comments 7 pages, 3 figures. Accepted at EISTA 2025; published in the Journal of Systemics, Cybernetics and Informatics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10351 2026-03-12 cs.CL cs.AI 62%

Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneck

通过解耦信息瓶颈缓解多语言大语言模型作为评判者的翻译偏差

Hongbin Zhang, Kehai Chen, Xuefen Bai, Youcheng Pan, Yang Xiang, Jinpeng Wang, Min Zhang

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DIBJudge框架,通过解耦信息瓶颈缓解多语言LLM的翻译偏差问题,有效提升多语言评估的公平性和准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07546 2026-03-10 cs.AI cs.LG 62%

COOL-MC: Verifying and Explaining RL Policies for Multi-bridge Network Maintenance

COOL-MC:多桥网络维护的强化学习策略验证与解释

Dennis Gross

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 COOL-MC通过概率模型检查和可解释性方法,验证并解释多桥网络维护的强化学习策略,揭示策略的安全性和偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15904 2026-03-10 cs.CL cs.AI 62%

More Women, Same Stereotypes: Unpacking the Gender Bias Paradox in Large Language Models

更多女性,相同刻板印象:解构大型语言模型中的性别偏见悖论

Evan Chen, Run-Jun Zhan, Yan-Bai Lin, Hung-Hsuan Chen

机构 * Computer Science and Information Engineering(计算机科学与信息工程系)

专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过自由叙事揭示大型语言模型中的性别偏见,发现其在职业性别分布上更接近人类刻板印象,而非现实数据,强调了平衡缓解措施的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06599 2026-03-10 cs.CY cs.AI 62%

Building the ethical AI framework of the future: from philosophy to practice

构建未来的伦理AI框架:从哲学到实践

Jasper Kyle Catapang

机构 * Graduate School of Global Studies(全球研究研究生院) Tokyo University of Foreign Studies(东京外国语大学) AI Product Development Division(人工智能产品开发部门) Money Forward, Inc.(Money Forward公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种伦理设计控制架构,通过三重闸门机制整合后果论、义务论和美德伦理,为AI生命周期提供可执行的治理方案。

Journal ref AI Ethics 6, 150 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04582 2026-03-06 cs.AI cs.LG 62%

Self-Attribution Bias: When AI Monitors Go Easy on Themselves

自我归因偏差:当AI监控对自己宽容时

Dipika Khullar, Jack Hopkins, Rowan Wang, Fabien Roger

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究发现AI监控在自我归因偏差下可能低估风险,导致部署不充分的监控系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03515 2026-03-05 cs.CY cs.AI 62%

The Controllability Trap: A Governance Framework for Military AI Agents

可控性陷阱:军事AI代理的治理框架

Subramanyam Sahoo

机构 * MARS (Mentorship for Alignment Researchers) 4.0 Fellow(MARS(对齐研究导师计划)4.0 Fellow) Cambridge AI Safety Hub (CAISH) University of Cambridge(剑桥AI安全中心(CAISH)剑桥大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出AMAGF框架,通过预防、检测和纠正三个支柱,解决军事AI代理中的控制失效问题,通过控制质量评分实现持续控制管理。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild. 20 Pages and 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03341 2026-03-05 cs.CY cs.AI 62%

Ethical and Explainable AI in Reusable MLOps Pipelines

可重用MLOps流水线中的伦理与可解释性AI

Rakib Hossain, Mahmood Menon Khan, Lisan Al Amin, Dhruv Parikh, Farhana Afroz, Bestoun S. Ahmed

机构 * Washington University of Science and Technology(科学与技术华盛顿大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Karlstad University(卡尔斯塔德大学) American University of Bahrain(巴林美国大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种整合伦理和可解释性AI的MLOps框架,通过自动化公平性控制和可解释性特征,在生产环境中实现公平性与预测效用的平衡。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01385 2026-03-03 cs.CL cs.AI 62%

Toward Graph-Tokenizing Large Language Models with Reconstructive Graph Instruction Tuning

迈向通过重构图指令微调的大型语言模型的图-词化

Zhongjian Zhang, Xiao Wang, Mengmei Zhang, Jiarui Tan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RGLM方法,通过重构图信息和显式图监督改进图-词化LLMs的对齐效果,提升对图结构的理解与利用。

Comments accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00428 2026-03-03 cs.CL cs.AI cs.CR 62%

When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems

当智能体“误忆”时:探索基于大语言模型的多智能体系统中的曼德拉效应

Naen Xu, Hengyu An, Shuo Shi, Jinghuai Zhang, Chunyi Zhou, Changjiang Li, Tianyu Du, Zhihui Fu, Jun Wang, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks(帕洛阿尔托网络公司) OPPO Research Institute(OPPO研究院) Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于大语言模型的多智能体系统中的曼德拉效应,提出MANBENCH基准并提出缓解策略,实现74.40%的效应减少。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10619 2026-03-02 cs.LG cs.AI cs.NI 62%

Meta-Reinforcement Learning for Fast and Data-Efficient Spectrum Allocation in Dynamic Wireless Networks

元强化学习用于动态无线网络中快速且数据高效的频谱分配

Oluwaseyi Giwa, Tobi Awodunmila, Muhammad Ahmed Mohsin, Ahsan Bilal, Muhammad Ali Jamshed

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出元学习框架用于动态无线网络中快速且数据高效的频谱分配,通过对比实验展示其在性能和适应性上的优势。

Comments 5 pages, 6 figures, under review at IEEE Wireless Communications Letters

Journal ref IEEE Wireless Communications Letters 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23378 2026-03-02 cs.HC cs.AI cs.CY 62%

Now You See Me: Designing Responsible AI Dashboards for Early-Stage Health Innovation

现在你看到了:为早期健康创新设计负责任的AI仪表盘

Svitlana Surodina, Sinem Görücü, Lili Golmohammadi, Emelia Delaney, Rita Borgo

机构 * OPORA Health Technologies LTD(OPORA健康科技有限公司) King's College London(国王学院伦敦)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种面向早期健康创新的负责任AI治理仪表板设计方法,通过协作设计和治理机制支持决策和问责。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22790 2026-02-27 cs.CL cs.AI 62%

Natural Language Declarative Prompting (NLD-P): A Modular Governance Method for Prompt Design Under Model Drift

自然语言声明式提示(NLD-P):一种模块化治理方法,用于在模型漂移下的提示设计

Hyunwoo Kim, Hanau Yi, Jaehee Bae, Yumin Kim

机构 * ddai Inc.(ddai公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NLD-P作为模块化治理方法,通过自然语言声明式提示解决模型漂移下的提示设计问题,提供可解释的控制框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05435 2026-02-27 eess.AS cs.AI cs.LG 62%

Unbiased Sliced Wasserstein Kernels for High-Quality Audio Captioning

无偏切片Wasserstein核用于高质量音频描述生成

Manh Luong, Khai Nguyen, Dinh Phung, Gholamreza Haffari, Lizhen Qu

机构 * Monash University(墨尔本大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出无偏切片Wasserstein核,通过保留模态间时间信息,提升音频描述质量及推理能力。

Journal ref Manh Luong. (2025). Unbiased Sliced Wasserstein Kernels for High-Quality Audio Captioning. In Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21939 2026-02-26 cs.CY cs.AI 62%

Hidden Topics: Measuring Sensitive AI Beliefs with List Experiments

隐藏主题:通过列表实验测量敏感的AI信念

Maxim Chupilkin

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过列表实验揭示大型语言模型对监控、酷刑和核打击等敏感问题的潜在态度,验证了该方法在检测AI隐藏信念的有效性。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09905 2026-02-24 cs.LG cs.AI cs.CV 62%

PRISM: Diversifying Dataset Distillation by Decoupling Architectural Priors

PRISM: 通过解耦架构先验来多样化数据集蒸馏

Brian B. Moser, Shalini Sarode, Federico Raue, Stanislav Frolov, Krzysztof Adamkiewicz, Arundhati Shanbhag, Joachim Folz, Tobias C. Nauen, Andreas Dengel

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) RPTU Kaiserslautern-Landau(科隆大学(RPTU))

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 PRISM通过解耦架构先验提升数据集蒸馏的多样性与性能

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18459 2026-02-24 cs.CY cs.AI 62%

From Bias Mitigation to Bias Negotiation: Governing Identity and Sociocultural Reasoning in Generative AI

从偏见缓解到偏见协商:在生成式AI中治理身份与社会文化推理

Zackary Okun Dunivin, Bingyi Han, John Bollenbocher

机构 * Institute for Social Science, University of Stuttgart(斯图加特大学社会科学研究所) Department of Computer Science, Saarland University(萨尔兰大学计算机科学系) Department of Linguistics, University of Texas Austin TX USA(德克萨斯大学语言学系) Department of Linguistics, University of Texas(德克萨斯大学语言学系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出偏见协商作为生成式AI治理身份与社会文化推理的新框架,通过实证研究探讨其在缓解偏见和提升社会公正中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22211 2026-02-18 cs.CL cs.AI 62%

LogiPart: Local Large Language Models for Data Exploration at Scale with Logical Partitioning

LogiPart: 用于大规模数据探索的本地大语言模型与逻辑分区

Tiago Fernandes Tavares

机构 * Tiago Fernandes Tavares(独立研究者)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 LogiPart通过本地大语言模型与逻辑分区技术,在大规模数据探索中实现高效、可解释的税目发现,克服传统方法的效率与成本限制。

Comments This version introduces a major architectural shift to Local LLMs and NLI-based assignment, scaling the framework to O(1) generative complexity. Formerly titled 'Question-Driven Analysis and Synthesis'

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14158 2026-02-17 cs.CL cs.AI cs.MA 62%

A Multi-Agent Framework for Medical AI: Leveraging Fine-Tuned GPT, LLaMA, and DeepSeek R1 for Evidence-Based and Bias-Aware Clinical Query Processing

面向医疗AI的多智能体框架:利用微调的GPT、LLaMA和DeepSeek R1进行基于证据和偏见意识的临床查询处理

Naeimeh Nourmohammadi, Md Meem Hossain, The Anh Han, Safina Showkat Ara, Zia Ush Shamszaman

机构 * Department of Computing Games, Teesside University, Middlesbrough, United Kingdom Centre for Digital Innovation, Teesside University, Middlesbrough, United Kingdom Faculty of Business \& Technology, University of Sunderland, Sunderland, United Kingdom

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多智能体框架,利用微调的GPT、LLaMA和DeepSeek R1,结合证据检索和偏见检查,提升医疗问答的可靠性与准确性。

Comments 27 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13253 2026-02-17 cs.CY cs.AI 62%

Implicit Bias in LLMs for Transgender Populations

LLMs对跨性别人群的隐性偏见

Micaela Hirsch, Marina Elichiry, Blas Radi, Tamara Quiroga, David Restrepo, Luciana Benotti, Veronica Xhardez, Jocelyn Dunstan, Enzo Ferrante

机构 * Instituto de Ciencias de la Computación (UBA-CONICET)(计算机科学研究所(UBA-CONICET)) Hospital Dr. Lucio Melendez(Lucio Melendez医院) Universidad de Buenos Aires(布宜诺斯艾利斯大学) Universidad Católica de Chile(智利天主大学) MICS, CentraleSupélec - Université Paris-Saclay(MICS,CentraleSupélec-巴黎萨克雷大学) Universidad Nacional de Córdoba(科迪利亚国家大学) Fundación Vía Libre(自由之路基金会) CIECTI

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本研究揭示了LLMs对跨性别人群的隐性偏见,通过词语关联测试和医疗预约分配任务发现LLMs在多个类别中存在负面关联,并指出需研究以减少LLMs中的刻板印象偏见,确保医疗应用中的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23001 2026-02-12 cs.CL cs.AI 62%

Bias Beyond Borders: Political Ideology Evaluation and Steering in Multilingual LLMs

偏见超越国界:多语言大语言模型中的政治意识形态评估与引导

Afrozah Nadeem, Agrima Seth, Mehwish Nasim, Usman Naseem

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院) Microsoft, USA(微软公司) University of Western Australia, Australia(西澳大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出跨语言对齐引导框架,用于评估和减轻多语言LLM中的政治偏见,通过跨语言对齐意识形态表示以实现公平性与多样性的平衡。

Comments PrePrint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09590 2026-02-11 cs.CL cs.AI 62%

Context-Aware Counterfactual Data Augmentation for Gender Bias Mitigation in Language Models

面向上下文的反事实数据增强用于语言模型中的性别偏见缓解

Shweta Parihar, Liu Guangliang, Natalie Parde, Lu Cheng

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Context-CDA方法,通过增强上下文和过滤低质量反事实,有效缓解语言模型中的性别偏见,同时保持语言建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07799 2026-02-10 cs.LG cs.AI 62%

Fairness Aware Reward Optimization

公平感知的奖励优化

Ching Lam Choi, Vighnesh Subramaniam, Phillip Isola, Antonio Torralba, Stefanie Jegelka

机构 * CSAIL, Department of EECS, Massachusetts Institute of Technology(计算机科学与人工智能实验室,电气工程与计算机科学系,麻省理工学院) School of CIT, MCML, MDSI, Technical University of Munich(信息科技学院,MCML,MDSI,慕尼黑技术大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Faro通过在处理过程中训练奖励模型,实现公平性、准确性与校准性的平衡,减少偏见并提升模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏