arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-04 至 2025-12-04 共收录 38 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2505.23316 2025-12-04 cs.CL 83%

Proximalized Preference Optimization for Diverse Feedback Types: A Decomposed Perspective on DPO

近端化偏好优化用于多样化反馈类型:对DPO的分解视角

Kaiyang Guo, Yinchuan Li, Zhitang Chen

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出PRO方法,通过分解DPO损失并恢复完整正则化项,解决似然不足确定性问题,提升对多样化反馈类型的适应能力。

Comments NeurIPS'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03399 2025-12-04 cs.LG 79%

Full-Stack Alignment: Co-Aligning AI and Institutions with Thick Models of Value

全栈对齐:通过厚价值模型对齐人工智能与机构

Joe Edelman, Tan Zhi-Xuan, Ryan Lowe, Oliver Klingefjord, Vincent Wang-Mascianica, Matija Franklin, Ryan Othniel Kearns, Ellie Hain, Atrisha Sarkar, Michiel Bakker, Fazl Barez, David Duvenaud, Jakob Foerster, Iason Gabriel, Joseph Gubbels, Bryce Goodman, Andreas Haupt, Jobst Heitzig, Julian Jara-Ettinger, Atoosa Kasirzadeh, James Ravi Kirkpatrick, Andrew Koh, W. Bradley Knox, Philipp Koralus, Joel Lehman, Sydney Levine, Samuele Marro, Manon Revel, Toby Shorin, Morgan Sutherland, Michael Henry Tessler, Ivan Vendrov, James Wilken-Smith

机构 * Meaning Alignment Institute(意义对齐研究所) Massachusetts Institute of Technology(麻省理工学院) University College London(伦敦大学学院) University of Oxford(牛津大学) Western University(西方大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学) Stanford University(斯坦福大学) Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所) Yale University(耶鲁大学) Carnegie Mellon University(卡内基梅隆大学) UT Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学) Harvard University(哈佛大学) Midjourney Core contributor(Midjourney核心贡献者)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出通过厚价值模型实现全栈对齐,以解决AI与机构目标不一致导致的不良后果,涵盖价值表示、规范推理和集体利益建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00195 2025-12-04 cs.CL cs.AI cs.HC 73%

Let Them Down Easy! Contextual Effects of LLM Guardrails on User Perceptions and Preferences

让它们轻松一些!LLM护栏对用户感知和偏好的情境影响

Mingqian Zheng, Wenjia Hu, Patrick Zhao, Motahhare Eslami, Jena D. Hwang, Faeze Brahman, Carolyn Rose, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Simon Fraser University(西蒙弗雷泽大学) Allen Institute for AI(人工智能研究所)

专题命中 偏好对齐 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了LLM护栏对用户感知和偏好的影响,发现部分合规策略能显著降低负面感知,强调应通过创造性的拒绝策略而非意图检测来提升安全性和用户体验。

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03208 2025-12-04 stat.ML cs.LG 70%

Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback

大语言模型奖励学习中异质人类反馈的不确定性量化

Pangpang Liu, Junwei Lu, Will Wei Sun

机构 * Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Department of Biostatistics, Harvard University(哈佛大学生物统计学系) Department of Quantitative Methods, Purdue University(普渡大学定量方法系)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种异质偏好框架,通过双凸优化解决大语言模型奖励学习中的不确定性量化问题,并通过理论保证和实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18929 2025-12-04 cs.LG 57%

Trajectory Balance with Asynchrony: Decoupling Exploration and Learning for Fast, Scalable LLM Post-Training

轨迹平衡与异步性:解耦探索与学习以实现快速、可扩展的LLM后训练

Brian Bartoldson, Siddarth Venkatraman, James Diffenderfer, Moksh Jain, Tal Ben-Nun, Seanie Lee, Minsu Kim, Johan Obando-Ceron, Yoshua Bengio, Bhavya Kailkhura

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) KAIST(韩国科学技术院) CIFAR Fellow

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 TBA通过解耦探索与学习,提升LLM后训练的速度和性能,适用于多种任务并支持大规模数据生成。

Comments NeurIPS 2025; 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 2 篇

2512.03059 2025-12-04 cs.LG 57%

Safe and Sustainable Electric Bus Charging Scheduling with Constrained Hierarchical DRL

安全且可持续的电动巴士充电调度与受约束的分层深度强化学习

Jiaju Qi, Lei Lei, Thorsteinn Jonsson, Dusit Niyato

机构 * College of Engineering, University of Guelph(圭尔夫大学工程学院) EthicalAI College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种安全且可持续的电动巴士充电调度方法,采用受约束的分层深度强化学习框架,通过整合拉格朗日松弛实现安全与成本的优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20412 2025-12-04 cs.MA cs.LG 57%

Structuring Collective Action with LLM-Guided Evolution: From Ill-Structured Problems to Executable Heuristics

利用LLM引导的进化结构化集体行动:从无序问题到可执行启发式方法

Kevin Bradley Dsouza, Graham Alexander Watt, Yuri Leonenko, Juan Moreno-Cruz

机构 * University of Waterloo(滑铁卢大学) Royal Bank of Canada(加拿大皇家银行)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 ECHO-MIMIC通过LLM引导的进化搜索,将无序问题转化为可执行的启发式方法,实现集体行动的结构化解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2505.14607 2025-12-04 cs.CL cs.CR 85%

sudoLLM: On Multi-role Alignment of Language Models

sudoLLM: 关于语言模型的多角色对齐

Soumadeep Saha, Akshay Chaturvedi, Joy Mahapatra, Utpal Garain

机构 * ISI Kolkata(印度Kolkata ISI研究所) IRIT Toulouse(法国图卢兹 IRIT 研究所)

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 sudoLLM通过注入用户偏见信号,实现多角色对齐的LLM,提升安全性和抗攻击能力。

Comments Accepted to EMNLP 2025 (findings)

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 366-384, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01513 2025-12-04 cs.CR cs.CV 82%

SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism

SafePTR: 通过剪枝-恢复机制实现多模态大语言模型的令牌级 Jailbreak 防御

Beitao Chen, Xinyu Lyu, Lianli Gao, Jingkuan Song, Heng Tao Shen

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳研究院) Southwestern University of Finance and Economics(西南财经大学) Engineering Research Center of Intelligent Finance, Ministry of Education(教育部智能金融工程研究中心) Tongji University(同济大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

AI总结 SafePTR 提出一种无需训练的多模态大语言模型防御机制,通过剪枝有害令牌并恢复良性特征,有效提升安全性并保持效率。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2512.00882 2025-12-04 cs.CV cs.AI 57%

Look, Recite, Then Answer: Enhancing VLM Performance via Self-Generated Knowledge Hints

看、复述、然后回答:通过自动生成的知识提示提升VLM性能

Xisheng Feng

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 通过自动生成的知识提示提升VLM性能,采用模块化设计减少幻觉,实现精准农业中杂草识别准确率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 1 篇

2505.02828 2025-12-04 cs.AI cs.CR 57%

Privacy Risks and Preservation Methods in Explainable Artificial Intelligence: A Scoping Review

可解释人工智能中的隐私风险与保护方法:一项综述

Sonal Allana, Mohan Kankanhalli, Rozita Dara

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI

AI总结 本文通过综述现有文献,探讨了可解释人工智能中隐私风险与保护方法,分析了隐私与可解释性之间的冲突及平衡策略。

Comments Published in Transactions on Machine Learning Research: https://openreview.net/forum?id=q9nykJfzku

Journal ref Transactions on Machine Learning Research, 10/2025, ISSN=2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 12 篇

2510.18214 2025-12-04 cs.CV cs.AI cs.CL cs.LG 89%

VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety

VLSU:联合多模态理解在AI安全中的极限映射

Shruti Palaskar, Leon Gatys, Mona Abdelrahman, Mar Jacobo, Larry Lindsey, Rutika Moharir, Gunnar Lund, Yang Xu, Navid Shiee, Jeffrey Bigham, Charles Maalouf, Joseph Yitan Cheng

机构 * Apple(苹果公司)

专题命中 安全评测 :safety(title,abstract);AI safety(title);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VLSU通过细粒度分类和组合分析,揭示了多模态安全评估中联合理解的缺陷,为改进AI安全研究提供关键测试平台。

Comments 10 pages, 5 figures, 4 tables, detailed appendix. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03737 2025-12-04 cs.CL cs.IR 77%

AR-Med: Automated Relevance Enhancement in Medical Search via LLM-Driven Information Augmentation

AR-Med: 通过LLM驱动的信息增强实现医疗搜索的自动化相关性增强

Chuyue Wang, Jie Feng, Yuxi Wu, Hang Zhang, Zhiguo Fan, Bing Cheng, Wei Lin

机构 * Meituan Inc.(美团公司) Tsinghua University(清华大学) Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 AR-Med通过LLM驱动的信息增强,实现医疗搜索的自动化相关性提升,提高了准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03089 2025-12-04 cs.CR cs.AI cs.CY cs.LG 75%

Password-Activated Shutdown Protocols for Misaligned Frontier Agents

密码激活的停机协议用于对齐不一致的前沿代理

Kai Williams, Rohan Subramani, Francis Rhys Ward

机构 * MATS

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 密码激活停机协议通过在接收到密码时安全停机,降低前沿AI对齐不一致带来的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16003 2025-12-04 cs.LG cs.AI 62%

Choose Your Explanation: A Comparison of SHAP and GradCAM in Human Activity Recognition

选择你的解释:SHAP和GradCAM在人类活动识别中的比较

Felix Tempel, Daniel Groos, Espen Alexander F. Ihlen, Lars Adde, Inga Strümke

机构 * Faculty of Informatics, Norwegian University of Science and Technology(1 信息学院,挪威科学与技术大学) Faculty of Medicine and Health Sciences, Norwegian University of Science and Technology(2 医学与健康科学学院,挪威科学与技术大学) Department of Clinical and Molecular Medicine, NTNU(3 临床与分子医学系,NTNU) Clinic of Rehabilitation, St. Olavs Hospital, Trondheim University Hospital(4 康复诊所,圣奥拉夫医院,特伦德尔姆大学医院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了SHAP和Grad-CAM在人类活动识别中的应用,分析了两种方法在特征重要性、可解释性和模型敏感性上的差异,为选择合适解释方法提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04062 2025-12-04 cs.LG 57%

Eval Factsheets: A Structured Framework for Documenting AI Evaluations

评估事实表:一种用于记录AI评估的结构化框架

Florian Bordes, Candace Ross, Justine T Kao, Evangelia Spiliopoulou, Adina Williams

机构 * FAIR at Meta(Meta的FAIR)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出Eval Factsheets,一种结构化框架,用于系统记录AI评估方法,通过分类法和问卷方法提升评估的透明度和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03750 2025-12-04 cs.LG cond-mat.mtrl-sci 57%

Universally Converging Representations of Matter Across Scientific Foundation Models

跨科学基础模型中物质的普遍收敛表示

Sathya Edamadaka, Soojung Yang, Ju Li, Rafael Gómez-Bombarelli

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 研究揭示科学基础模型在不同模态和数据集上对物质的普遍表示收敛性,表明模型学习了共同的物理现实表示,但受限于训练数据和归纳偏置。

Comments Oral spotlight at NeurIPS 2025 UniReps Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22619 2025-12-04 cs.AI 57%

AI Deception: Risks, Dynamics, and Controls

AI欺骗:风险、动态与控制

Boyuan Chen, Sitong Fang, Jiaming Ji, Yanxu Zhu, Pengcheng Wen, Jinzhou Wu, Yingshui Tan, Boren Zheng, Mengying Yuan, Wenqi Chen, Donghai Hong, Alex Qiu, Xin Chen, Jiayi Zhou, Kaile Wang, Juntao Dai, Borong Zhang, Tianzhuo Yang, Saad Siddiqui, Isabella Duan, Yawen Duan, Brian Tse, Jen-Tse, Huang, Kun Wang, Baihui Zheng, Jiaheng Liu, Jian Yang, Yiming Li, Wenting Chen, Dongrui Liu, Lukas Vierling, Zhiheng Xi, Haobo Fu, Wenxuan Wang, Jitao Sang, Zhengyan Shi, Chi-Min Chan, Eugenie Shi, Simin Li, Juncheng Li, Jian Yang, Wei Ji, Dong Li, Jinglin Yang, Jun Song, Yinpeng Dong, Jie Fu, Bo Zheng, Min Yang, Yike Guo, Philip Torr, Robert Trager, Yi Zeng, Zhongyuan Wang, Yaodong Yang, Tiejun Huang, Ya-Qin Zhang, Hongjiang Zhang, Andrew Yao

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文探讨了AI欺骗的风险、动态及控制,提出欺骗循环模型,分析欺骗出现机制与处理方法,并提出缓解策略与审计方法以应对AI安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03340 2025-12-04 cs.CL 57%

PERCS: Persona-Guided Controllable Biomedical Summarization Dataset

PERCS:基于人物的可控生物医学摘要数据集

Rohan Charudatt Salvi, Chirag Chawla, Dhruv Jain, Swapnil Panigrahi, Md Shad Akhtar, Shweta Yadav

机构 * Department of Computer Science, University of Illinois, Chicago, IL, 60607, USA(伊利诺伊大学芝加哥分校计算机科学系) Indian Institute of Technology, Varanasi, India(印度班加罗尔理工学院) Department of Computer Science & Engineering, Indraprastha Institute of Information Technology, Delhi, New Delhi, 110020, India(印度德里印度信息技术研究所计算机科学与工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 PERCS数据集通过针对不同医学素养角色的可控摘要,提升生物医学信息的可及性与准确性。

Comments 9 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01173 2025-12-04 cs.LG cs.MA 57%

MARS: A Meta-Adaptive Reinforcement Learning Framework for Risk-Aware Multi-Agent Portfolio Management

MARS:一种面向风险的多智能体投资组合管理元适应强化学习框架

Jiayi Chen, Jing Li, Guiling Wang

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 MARS通过多智能体和风险导向的方法,实现投资组合管理中风险与收益的平衡,利用行为多样性提升市场环境下的稳健性。

Comments Accepted by AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04005 2025-12-04 cs.CV cs.LG cs.RO 57%

LargeAD: Large-Scale Cross-Sensor Data Pretraining for Autonomous Driving

LargeAD: 大规模跨传感器数据预训练用于自动驾驶

Lingdong Kong, Xiang Xu, Youquan Liu, Jun Cen, Runnan Chen, Wenwei Zhang, Liang Pan, Kai Chen, Ziwei Liu

机构 * WorldBench Team(WorldBench团队)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 LargeAD通过跨传感器数据预训练提升自动驾驶中的三维场景理解,结合多模态对比学习和时间一致性,实现更鲁棒的感知性能。

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03635 2025-12-04 cs.LO cs.SE 50%

Formal Analysis of the Sigmoid Function and Formal Proof of the Universal Approximation Theorem

对Sigmoid函数的正式分析及通用逼近定理的正式证明

Dustin Bryant, Jim Woodcock, Simon Foster

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文在Isabelle/HOL中形式化分析了Sigmoid函数并证明了通用逼近定理,填补了形式化证明库的空白,提升了神经网络的可信度。

Comments 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11045 2025-12-04 cs.CV 50%

StableV2V: Stablizing Shape Consistency in Video-to-Video Editing

StableV2V: 视频到视频编辑中的形状一致性稳定

Chang Liu, Rui Li, Kaidong Zhang, Yunwei Lan, Dong Liu

专题命中 安全评测 :alignment(abstract)

AI总结 StableV2V通过分解编辑流程并建立运动与提示的对齐,提升视频到视频编辑的形状一致性与效率。

Comments Project page: https://alonzoleeeooo.github.io/StableV2V, code: https://github.com/AlonzoLeeeooo/StableV2V, model weights: https://huggingface.co/AlonzoLeeeooo/StableV2V, dataset (DAVIS-Edit): https://huggingface.co/datasets/AlonzoLeeeooo/DAVIS-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏

7. AI治理与伦理 5 篇

2512.03047 2025-12-04 cs.CL cs.AI cs.LG 87%

Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models

基于熵的大型语言模型价值漂移与对齐工作的测量

Samih Fadli

专题命中 AI治理与伦理 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于熵的框架,用于测量大型语言模型中的价值漂移和对齐工作,通过五种行为分类法和熵动态分析,实现对模型伦理熵的实时监控与警报。

Comments 6 pages. Companion paper to "The Second Law of Intelligence: Controlling Ethical Entropy in Autonomous Systems". Code and tools: https://github.com/AerisSpace/EthicalEntropyKit

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23733 2025-12-04 cs.CY cs.AI cs.HC 62%

Unintentional Consequences: Generative AI Use for Cybercrime

无意后果:生成式AI用于网络犯罪

Truong Jack Luu, Binny M. Samuel

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 生成式AI的普及导致网络犯罪激增,研究通过分析数据揭示AI技术放大恶意行为的机制,并提出多层策略以应对风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15478 2025-12-04 cs.CL 57%

A Group Fairness Lens for Large Language Models

为大语言模型引入群体公平性视角

Guanqun Bi, Yuqiang Xie, Lei Shen, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本文提出从群体公平性角度评估大语言模型的偏见,引入 GFAIR 数据集和 GF-THINK 方法,以缓解模型中的偏见问题。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03439 2025-12-04 cs.IR 50%

LLM as Explainable Re-Ranker for Recommendation System

大语言模型作为可解释的重排序器用于推荐系统

Yaqi Wang, Haojia Sun, Shuting Zhang

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出利用大语言模型作为可解释的重排序器,结合传统推荐模型提升推荐系统的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03180 2025-12-04 cs.MA cs.ET 50%

AGENTSAFE: A Unified Framework for Ethical Assurance and Governance in Agentic AI

AGENTSAFE:面向代理AI的统一伦理保障与治理框架

Rafflesia Khan, Declan Joyce, Mansura Habiba

专题命中 AI治理与伦理 :safety(abstract)

AI总结 AGENTSAFE提出一个统一的治理框架,通过风险分类转化为可操作的设计、运行时和审计控制,提供可衡量的预部署保障,并通过运行时治理和问责机制建立代理AI生态系统的信任。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他安全 10 篇

2512.03579 2025-12-04 cs.LG math.PR math.ST stat.TH 79%

Optimal Transportation and Alignment Between Gaussian Measures

高斯测度间的最优运输与对齐

Sanjit Dandapanthula, Aleksandr Podkopaev, Shiva Prasad Kasiviswanathan, Aaditya Ramdas, Ziv Goldfeld

机构 * Carnegie Mellon University, Department of Statistics(卡内基梅隆大学统计学系) Amazon Web Services (AWS) LogAnalytics(亚马逊网络服务(AWS)日志分析) Carnegie Mellon University, Machine Learning Department(卡内基梅隆大学机器学习系) Cornell University, Department of Electrical and Computer Engineering(康奈尔大学电子与计算机工程系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出了一种针对高斯分布的最优运输与格罗莫夫-沃瑟斯坦对齐的闭式解,扩展到内积GW对齐,并应用于知识蒸馏和异构聚类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10746 2025-12-04 cs.CL 79%

RECAP: Transparent Inference-Time Emotion Alignment for Medical Dialogue Systems

RECAP:医疗对话系统中透明的推理时间情感对齐

Adarsh Srinivasan, Jacob Dineen, Muhammad Umar Afzal, Muhammad Uzair Sarfraz, Irbaz B. Riaz, Ben Zhou

专题命中 其他安全 :alignment(title);safety(abstract);分类 cs.CL

AI总结 RECAP通过结构化情感推理提升医疗对话系统的情感响应质量,实现透明和可审计的同理心沟通。

详情

展开后加载摘要…

URL PDF HTML 收藏